{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 7.46909161641704, "eval_steps": 3000, "global_step": 96000, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 10.691896057128906, "epoch": 0.00038902937171756465, "grad_norm": 13.375, "learning_rate": 2e-06, "loss": 10.7682, "mean_token_accuracy": 0.0, "num_tokens": 8095.0, "step": 5 }, { "entropy": 10.691933250427246, "epoch": 0.0007780587434351293, "grad_norm": 12.6875, "learning_rate": 4.5e-06, "loss": 10.7403, "mean_token_accuracy": 0.0006377055658958852, "num_tokens": 17329.0, "step": 10 }, { "entropy": 10.69080991744995, "epoch": 0.001167088115152694, "grad_norm": 10.125, "learning_rate": 7e-06, "loss": 10.4717, "mean_token_accuracy": 0.03278036494739354, "num_tokens": 25729.0, "step": 15 }, { "entropy": 10.676905536651612, "epoch": 0.0015561174868702586, "grad_norm": 6.5625, "learning_rate": 9.5e-06, "loss": 10.1506, "mean_token_accuracy": 0.04596309997141361, "num_tokens": 33980.0, "step": 20 }, { "entropy": 10.59173231124878, "epoch": 0.0019451468585878235, "grad_norm": 4.28125, "learning_rate": 1.2e-05, "loss": 9.8699, "mean_token_accuracy": 0.04366149380803108, "num_tokens": 41675.0, "step": 25 }, { "entropy": 10.51305980682373, "epoch": 0.002334176230305388, "grad_norm": 3.34375, "learning_rate": 1.4500000000000002e-05, "loss": 9.7305, "mean_token_accuracy": 0.046745364740490916, "num_tokens": 50277.0, "step": 30 }, { "entropy": 10.490173530578613, "epoch": 0.0027232056020229526, "grad_norm": 3.046875, "learning_rate": 1.7000000000000003e-05, "loss": 9.6493, "mean_token_accuracy": 0.0512831661850214, "num_tokens": 58790.0, "step": 35 }, { "entropy": 10.494702529907226, "epoch": 0.0031122349737405172, "grad_norm": 2.96875, "learning_rate": 1.95e-05, "loss": 9.6088, "mean_token_accuracy": 0.05120518207550049, "num_tokens": 67247.0, "step": 40 }, { "entropy": 10.47821397781372, "epoch": 0.003501264345458082, "grad_norm": 2.828125, "learning_rate": 2.2e-05, "loss": 9.5376, "mean_token_accuracy": 0.054223894327878955, "num_tokens": 75174.0, "step": 45 }, { "entropy": 10.43958568572998, "epoch": 0.003890293717175647, "grad_norm": 2.46875, "learning_rate": 2.4500000000000003e-05, "loss": 9.4437, "mean_token_accuracy": 0.06763513237237931, "num_tokens": 83203.0, "step": 50 }, { "entropy": 10.308233833312988, "epoch": 0.004279323088893211, "grad_norm": 2.3125, "learning_rate": 2.7e-05, "loss": 9.4079, "mean_token_accuracy": 0.06488834656774997, "num_tokens": 91798.0, "step": 55 }, { "entropy": 10.269000720977782, "epoch": 0.004668352460610776, "grad_norm": 2.09375, "learning_rate": 2.95e-05, "loss": 9.4289, "mean_token_accuracy": 0.06329003609716892, "num_tokens": 100869.0, "step": 60 }, { "entropy": 10.361470031738282, "epoch": 0.0050573818323283405, "grad_norm": 2.296875, "learning_rate": 3.2e-05, "loss": 9.3296, "mean_token_accuracy": 0.061626766622066495, "num_tokens": 109697.0, "step": 65 }, { "entropy": 10.3142409324646, "epoch": 0.005446411204045905, "grad_norm": 2.0625, "learning_rate": 3.4500000000000005e-05, "loss": 9.2921, "mean_token_accuracy": 0.06110430583357811, "num_tokens": 118656.0, "step": 70 }, { "entropy": 10.19054298400879, "epoch": 0.00583544057576347, "grad_norm": 1.859375, "learning_rate": 3.7e-05, "loss": 9.2586, "mean_token_accuracy": 0.060313938185572624, "num_tokens": 127748.0, "step": 75 }, { "entropy": 10.34864444732666, "epoch": 0.0062244699474810344, "grad_norm": 1.984375, "learning_rate": 3.95e-05, "loss": 9.1176, "mean_token_accuracy": 0.0627338420599699, "num_tokens": 136621.0, "step": 80 }, { "entropy": 10.175674057006836, "epoch": 0.006613499319198599, "grad_norm": 2.015625, "learning_rate": 4.2000000000000004e-05, "loss": 8.9517, "mean_token_accuracy": 0.06631159856915474, "num_tokens": 145793.0, "step": 85 }, { "entropy": 10.162372493743897, "epoch": 0.007002528690916164, "grad_norm": 1.796875, "learning_rate": 4.45e-05, "loss": 8.8629, "mean_token_accuracy": 0.06395913921296596, "num_tokens": 154466.0, "step": 90 }, { "entropy": 10.15381736755371, "epoch": 0.007391558062633729, "grad_norm": 2.09375, "learning_rate": 4.7000000000000004e-05, "loss": 8.8443, "mean_token_accuracy": 0.06343522258102893, "num_tokens": 163297.0, "step": 95 }, { "entropy": 10.048249244689941, "epoch": 0.007780587434351294, "grad_norm": 1.84375, "learning_rate": 4.9500000000000004e-05, "loss": 8.696, "mean_token_accuracy": 0.06365865133702756, "num_tokens": 171747.0, "step": 100 }, { "entropy": 10.09149627685547, "epoch": 0.008169616806068859, "grad_norm": 1.6953125, "learning_rate": 5.2e-05, "loss": 8.6166, "mean_token_accuracy": 0.06534692756831646, "num_tokens": 180499.0, "step": 105 }, { "entropy": 9.920382881164551, "epoch": 0.008558646177786422, "grad_norm": 1.71875, "learning_rate": 5.45e-05, "loss": 8.4788, "mean_token_accuracy": 0.06633736491203308, "num_tokens": 189227.0, "step": 110 }, { "entropy": 9.86361379623413, "epoch": 0.008947675549503988, "grad_norm": 1.609375, "learning_rate": 5.7e-05, "loss": 8.3439, "mean_token_accuracy": 0.07009124867618084, "num_tokens": 198388.0, "step": 115 }, { "entropy": 9.680712413787841, "epoch": 0.009336704921221552, "grad_norm": 1.421875, "learning_rate": 5.9499999999999996e-05, "loss": 8.2396, "mean_token_accuracy": 0.06940936222672463, "num_tokens": 206854.0, "step": 120 }, { "entropy": 9.601908302307129, "epoch": 0.009725734292939117, "grad_norm": 1.6015625, "learning_rate": 6.2e-05, "loss": 8.119, "mean_token_accuracy": 0.0706846684217453, "num_tokens": 215506.0, "step": 125 }, { "entropy": 9.40778636932373, "epoch": 0.010114763664656681, "grad_norm": 1.40625, "learning_rate": 6.450000000000001e-05, "loss": 8.027, "mean_token_accuracy": 0.07141325175762177, "num_tokens": 223717.0, "step": 130 }, { "entropy": 9.245368766784669, "epoch": 0.010503793036374246, "grad_norm": 1.25, "learning_rate": 6.7e-05, "loss": 7.9189, "mean_token_accuracy": 0.07270697467029094, "num_tokens": 232480.0, "step": 135 }, { "entropy": 9.090145778656005, "epoch": 0.01089282240809181, "grad_norm": 1.390625, "learning_rate": 6.950000000000001e-05, "loss": 7.8471, "mean_token_accuracy": 0.07338932827115059, "num_tokens": 241350.0, "step": 140 }, { "entropy": 8.89556589126587, "epoch": 0.011281851779809376, "grad_norm": 1.234375, "learning_rate": 7.2e-05, "loss": 7.7957, "mean_token_accuracy": 0.07191371396183968, "num_tokens": 250610.0, "step": 145 }, { "entropy": 8.702104473114014, "epoch": 0.01167088115152694, "grad_norm": 1.2109375, "learning_rate": 7.45e-05, "loss": 7.7138, "mean_token_accuracy": 0.06948468647897243, "num_tokens": 259672.0, "step": 150 }, { "entropy": 8.603777408599854, "epoch": 0.012059910523244505, "grad_norm": 1.3046875, "learning_rate": 7.7e-05, "loss": 7.6923, "mean_token_accuracy": 0.0712867472320795, "num_tokens": 267826.0, "step": 155 }, { "entropy": 8.510001087188721, "epoch": 0.012448939894962069, "grad_norm": 1.2890625, "learning_rate": 7.950000000000001e-05, "loss": 7.6847, "mean_token_accuracy": 0.06826631203293801, "num_tokens": 277324.0, "step": 160 }, { "entropy": 8.372300243377685, "epoch": 0.012837969266679634, "grad_norm": 1.28125, "learning_rate": 8.2e-05, "loss": 7.5139, "mean_token_accuracy": 0.07538944780826569, "num_tokens": 285482.0, "step": 165 }, { "entropy": 8.333262157440185, "epoch": 0.013226998638397198, "grad_norm": 1.3671875, "learning_rate": 8.450000000000001e-05, "loss": 7.5443, "mean_token_accuracy": 0.07613336965441704, "num_tokens": 293684.0, "step": 170 }, { "entropy": 8.189146041870117, "epoch": 0.013616028010114764, "grad_norm": 1.359375, "learning_rate": 8.7e-05, "loss": 7.4992, "mean_token_accuracy": 0.0754831738770008, "num_tokens": 302605.0, "step": 175 }, { "entropy": 8.120375633239746, "epoch": 0.014005057381832327, "grad_norm": 1.4453125, "learning_rate": 8.95e-05, "loss": 7.5501, "mean_token_accuracy": 0.07501808553934097, "num_tokens": 310849.0, "step": 180 }, { "entropy": 8.180096626281738, "epoch": 0.014394086753549893, "grad_norm": 1.3984375, "learning_rate": 9.2e-05, "loss": 7.5376, "mean_token_accuracy": 0.07213864214718342, "num_tokens": 319752.0, "step": 185 }, { "entropy": 8.150297737121582, "epoch": 0.014783116125267459, "grad_norm": 1.609375, "learning_rate": 9.45e-05, "loss": 7.5715, "mean_token_accuracy": 0.07293041869997978, "num_tokens": 328009.0, "step": 190 }, { "entropy": 8.01708698272705, "epoch": 0.015172145496985022, "grad_norm": 1.1953125, "learning_rate": 9.7e-05, "loss": 7.4454, "mean_token_accuracy": 0.07922360971570015, "num_tokens": 337414.0, "step": 195 }, { "entropy": 8.00553069114685, "epoch": 0.015561174868702588, "grad_norm": 1.234375, "learning_rate": 9.95e-05, "loss": 7.4438, "mean_token_accuracy": 0.08163341209292412, "num_tokens": 345419.0, "step": 200 }, { "entropy": 8.010188388824464, "epoch": 0.01595020424042015, "grad_norm": 1.28125, "learning_rate": 0.000102, "loss": 7.4176, "mean_token_accuracy": 0.08399317860603332, "num_tokens": 353435.0, "step": 205 }, { "entropy": 7.945941305160522, "epoch": 0.016339233612137717, "grad_norm": 1.34375, "learning_rate": 0.00010449999999999999, "loss": 7.4398, "mean_token_accuracy": 0.07745959497988224, "num_tokens": 361840.0, "step": 210 }, { "entropy": 8.018308210372926, "epoch": 0.016728262983855283, "grad_norm": 1.1875, "learning_rate": 0.000107, "loss": 7.5097, "mean_token_accuracy": 0.07523712664842605, "num_tokens": 370873.0, "step": 215 }, { "entropy": 7.983619546890258, "epoch": 0.017117292355572845, "grad_norm": 1.7421875, "learning_rate": 0.0001095, "loss": 7.4308, "mean_token_accuracy": 0.07907425090670586, "num_tokens": 379558.0, "step": 220 }, { "entropy": 7.867334222793579, "epoch": 0.01750632172729041, "grad_norm": 1.3828125, "learning_rate": 0.000112, "loss": 7.4184, "mean_token_accuracy": 0.08053626418113709, "num_tokens": 387870.0, "step": 225 }, { "entropy": 7.964390230178833, "epoch": 0.017895351099007976, "grad_norm": 1.421875, "learning_rate": 0.0001145, "loss": 7.4773, "mean_token_accuracy": 0.08220710828900338, "num_tokens": 396442.0, "step": 230 }, { "entropy": 7.887078332901001, "epoch": 0.01828438047072554, "grad_norm": 1.5546875, "learning_rate": 0.00011700000000000001, "loss": 7.4199, "mean_token_accuracy": 0.07810803577303886, "num_tokens": 404764.0, "step": 235 }, { "entropy": 7.896487426757813, "epoch": 0.018673409842443103, "grad_norm": 1.1953125, "learning_rate": 0.00011949999999999999, "loss": 7.3561, "mean_token_accuracy": 0.08208074867725372, "num_tokens": 413355.0, "step": 240 }, { "entropy": 7.845146036148071, "epoch": 0.01906243921416067, "grad_norm": 1.203125, "learning_rate": 0.000122, "loss": 7.25, "mean_token_accuracy": 0.08628582656383514, "num_tokens": 421868.0, "step": 245 }, { "entropy": 7.847237968444825, "epoch": 0.019451468585878234, "grad_norm": 1.171875, "learning_rate": 0.0001245, "loss": 7.2885, "mean_token_accuracy": 0.08563556969165802, "num_tokens": 431106.0, "step": 250 }, { "entropy": 7.879620504379273, "epoch": 0.0198404979575958, "grad_norm": 1.5078125, "learning_rate": 0.000127, "loss": 7.4271, "mean_token_accuracy": 0.0771660901606083, "num_tokens": 439459.0, "step": 255 }, { "entropy": 7.715308475494385, "epoch": 0.020229527329313362, "grad_norm": 1.40625, "learning_rate": 0.0001295, "loss": 7.2523, "mean_token_accuracy": 0.08652433380484581, "num_tokens": 447943.0, "step": 260 }, { "entropy": 7.791458606719971, "epoch": 0.020618556701030927, "grad_norm": 1.3515625, "learning_rate": 0.000132, "loss": 7.3749, "mean_token_accuracy": 0.08243331611156464, "num_tokens": 456691.0, "step": 265 }, { "entropy": 7.827027750015259, "epoch": 0.021007586072748493, "grad_norm": 1.1953125, "learning_rate": 0.00013450000000000002, "loss": 7.2679, "mean_token_accuracy": 0.08309322819113732, "num_tokens": 466388.0, "step": 270 }, { "entropy": 7.677990436553955, "epoch": 0.02139661544446606, "grad_norm": 1.265625, "learning_rate": 0.00013700000000000002, "loss": 7.3463, "mean_token_accuracy": 0.084238101541996, "num_tokens": 474544.0, "step": 275 }, { "entropy": 7.855551147460938, "epoch": 0.02178564481618362, "grad_norm": 1.3203125, "learning_rate": 0.0001395, "loss": 7.3638, "mean_token_accuracy": 0.08487658277153969, "num_tokens": 483561.0, "step": 280 }, { "entropy": 7.682491683959961, "epoch": 0.022174674187901186, "grad_norm": 1.3046875, "learning_rate": 0.00014199999999999998, "loss": 7.1825, "mean_token_accuracy": 0.08649473935365677, "num_tokens": 492036.0, "step": 285 }, { "entropy": 7.736964845657349, "epoch": 0.02256370355961875, "grad_norm": 1.2890625, "learning_rate": 0.0001445, "loss": 7.3058, "mean_token_accuracy": 0.08307258263230324, "num_tokens": 500978.0, "step": 290 }, { "entropy": 7.750108766555786, "epoch": 0.022952732931336317, "grad_norm": 1.1484375, "learning_rate": 0.000147, "loss": 7.331, "mean_token_accuracy": 0.08541621565818787, "num_tokens": 509719.0, "step": 295 }, { "entropy": 7.716811800003052, "epoch": 0.02334176230305388, "grad_norm": 1.2890625, "learning_rate": 0.0001495, "loss": 7.2418, "mean_token_accuracy": 0.0862745113670826, "num_tokens": 518422.0, "step": 300 }, { "entropy": 7.7041215896606445, "epoch": 0.023730791674771445, "grad_norm": 1.375, "learning_rate": 0.000152, "loss": 7.2726, "mean_token_accuracy": 0.08733444213867188, "num_tokens": 527172.0, "step": 305 }, { "entropy": 7.661469459533691, "epoch": 0.02411982104648901, "grad_norm": 1.2265625, "learning_rate": 0.00015450000000000001, "loss": 7.1871, "mean_token_accuracy": 0.08940150961279869, "num_tokens": 536070.0, "step": 310 }, { "entropy": 7.650560522079468, "epoch": 0.024508850418206576, "grad_norm": 1.3359375, "learning_rate": 0.000157, "loss": 7.1815, "mean_token_accuracy": 0.08751222342252732, "num_tokens": 544556.0, "step": 315 }, { "entropy": 7.71123743057251, "epoch": 0.024897879789924138, "grad_norm": 1.4765625, "learning_rate": 0.0001595, "loss": 7.1717, "mean_token_accuracy": 0.08722432479262351, "num_tokens": 553122.0, "step": 320 }, { "entropy": 7.609269285202027, "epoch": 0.025286909161641703, "grad_norm": 1.3671875, "learning_rate": 0.000162, "loss": 7.235, "mean_token_accuracy": 0.07931372076272965, "num_tokens": 562265.0, "step": 325 }, { "entropy": 7.594164276123047, "epoch": 0.02567593853335927, "grad_norm": 1.1875, "learning_rate": 0.00016450000000000001, "loss": 7.1853, "mean_token_accuracy": 0.09104064255952835, "num_tokens": 570938.0, "step": 330 }, { "entropy": 7.591356801986694, "epoch": 0.026064967905076834, "grad_norm": 1.3125, "learning_rate": 0.00016700000000000002, "loss": 7.1202, "mean_token_accuracy": 0.0924045629799366, "num_tokens": 578568.0, "step": 335 }, { "entropy": 7.654570388793945, "epoch": 0.026453997276794396, "grad_norm": 1.3515625, "learning_rate": 0.00016950000000000003, "loss": 7.192, "mean_token_accuracy": 0.09244821965694427, "num_tokens": 587013.0, "step": 340 }, { "entropy": 7.647093391418457, "epoch": 0.026843026648511962, "grad_norm": 1.21875, "learning_rate": 0.00017199999999999998, "loss": 7.2278, "mean_token_accuracy": 0.08628092929720879, "num_tokens": 595354.0, "step": 345 }, { "entropy": 7.5597922801971436, "epoch": 0.027232056020229527, "grad_norm": 1.328125, "learning_rate": 0.00017449999999999999, "loss": 7.1994, "mean_token_accuracy": 0.086347945779562, "num_tokens": 603971.0, "step": 350 }, { "entropy": 7.513363790512085, "epoch": 0.027621085391947093, "grad_norm": 1.25, "learning_rate": 0.000177, "loss": 7.1077, "mean_token_accuracy": 0.0958691768348217, "num_tokens": 612097.0, "step": 355 }, { "entropy": 7.607126188278198, "epoch": 0.028010114763664655, "grad_norm": 1.234375, "learning_rate": 0.0001795, "loss": 7.1708, "mean_token_accuracy": 0.09145483076572418, "num_tokens": 621445.0, "step": 360 }, { "entropy": 7.514036798477173, "epoch": 0.02839914413538222, "grad_norm": 1.1953125, "learning_rate": 0.000182, "loss": 7.2337, "mean_token_accuracy": 0.08651573956012726, "num_tokens": 630041.0, "step": 365 }, { "entropy": 7.50714807510376, "epoch": 0.028788173507099786, "grad_norm": 1.40625, "learning_rate": 0.0001845, "loss": 7.0418, "mean_token_accuracy": 0.09683061838150024, "num_tokens": 638317.0, "step": 370 }, { "entropy": 7.585668706893921, "epoch": 0.02917720287881735, "grad_norm": 1.3359375, "learning_rate": 0.000187, "loss": 7.1733, "mean_token_accuracy": 0.09136604964733124, "num_tokens": 647297.0, "step": 375 }, { "entropy": 7.613582992553711, "epoch": 0.029566232250534917, "grad_norm": 1.6640625, "learning_rate": 0.0001895, "loss": 7.2214, "mean_token_accuracy": 0.09044467359781265, "num_tokens": 655309.0, "step": 380 }, { "entropy": 7.432076501846313, "epoch": 0.02995526162225248, "grad_norm": 1.265625, "learning_rate": 0.000192, "loss": 7.08, "mean_token_accuracy": 0.0861615188419819, "num_tokens": 663879.0, "step": 385 }, { "entropy": 7.516607666015625, "epoch": 0.030344290993970045, "grad_norm": 1.5078125, "learning_rate": 0.0001945, "loss": 6.9856, "mean_token_accuracy": 0.09427314698696136, "num_tokens": 672913.0, "step": 390 }, { "entropy": 7.394821453094482, "epoch": 0.03073332036568761, "grad_norm": 1.2109375, "learning_rate": 0.00019700000000000002, "loss": 7.0979, "mean_token_accuracy": 0.09137862846255303, "num_tokens": 682282.0, "step": 395 }, { "entropy": 7.4547014236450195, "epoch": 0.031122349737405176, "grad_norm": 1.2890625, "learning_rate": 0.00019950000000000002, "loss": 7.1059, "mean_token_accuracy": 0.08515429720282555, "num_tokens": 691432.0, "step": 400 }, { "entropy": 7.444170570373535, "epoch": 0.03151137910912274, "grad_norm": 1.3203125, "learning_rate": 0.000202, "loss": 7.102, "mean_token_accuracy": 0.08980939239263534, "num_tokens": 700639.0, "step": 405 }, { "entropy": 7.551699113845825, "epoch": 0.0319004084808403, "grad_norm": 1.5, "learning_rate": 0.00020449999999999998, "loss": 7.184, "mean_token_accuracy": 0.0844474621117115, "num_tokens": 709200.0, "step": 410 }, { "entropy": 7.30176272392273, "epoch": 0.03228943785255787, "grad_norm": 1.3515625, "learning_rate": 0.000207, "loss": 7.0024, "mean_token_accuracy": 0.09402795061469078, "num_tokens": 717266.0, "step": 415 }, { "entropy": 7.484861898422241, "epoch": 0.032678467224275434, "grad_norm": 1.2265625, "learning_rate": 0.0002095, "loss": 6.9873, "mean_token_accuracy": 0.09403469264507294, "num_tokens": 725799.0, "step": 420 }, { "entropy": 7.3827354431152346, "epoch": 0.033067496595993, "grad_norm": 1.46875, "learning_rate": 0.000212, "loss": 7.1101, "mean_token_accuracy": 0.09061254039406777, "num_tokens": 734375.0, "step": 425 }, { "entropy": 7.475268840789795, "epoch": 0.033456525967710565, "grad_norm": 1.359375, "learning_rate": 0.0002145, "loss": 7.1403, "mean_token_accuracy": 0.090643859654665, "num_tokens": 743453.0, "step": 430 }, { "entropy": 7.326716709136963, "epoch": 0.033845555339428124, "grad_norm": 1.1171875, "learning_rate": 0.00021700000000000002, "loss": 7.0003, "mean_token_accuracy": 0.09671235233545303, "num_tokens": 752443.0, "step": 435 }, { "entropy": 7.399496269226074, "epoch": 0.03423458471114569, "grad_norm": 1.2734375, "learning_rate": 0.0002195, "loss": 6.9699, "mean_token_accuracy": 0.09153517037630081, "num_tokens": 761294.0, "step": 440 }, { "entropy": 7.355255746841431, "epoch": 0.034623614082863255, "grad_norm": 1.3359375, "learning_rate": 0.000222, "loss": 6.9395, "mean_token_accuracy": 0.0974013090133667, "num_tokens": 769489.0, "step": 445 }, { "entropy": 7.445426177978516, "epoch": 0.03501264345458082, "grad_norm": 1.3046875, "learning_rate": 0.0002245, "loss": 7.0191, "mean_token_accuracy": 0.09303558543324471, "num_tokens": 777836.0, "step": 450 }, { "entropy": 7.343358373641967, "epoch": 0.035401672826298386, "grad_norm": 1.2890625, "learning_rate": 0.00022700000000000002, "loss": 7.0442, "mean_token_accuracy": 0.08798035010695457, "num_tokens": 786543.0, "step": 455 }, { "entropy": 7.382262325286865, "epoch": 0.03579070219801595, "grad_norm": 1.359375, "learning_rate": 0.00022950000000000002, "loss": 7.1011, "mean_token_accuracy": 0.09493663161993027, "num_tokens": 794525.0, "step": 460 }, { "entropy": 7.329567766189575, "epoch": 0.03617973156973352, "grad_norm": 1.3984375, "learning_rate": 0.00023200000000000003, "loss": 7.0001, "mean_token_accuracy": 0.09533165432512761, "num_tokens": 803537.0, "step": 465 }, { "entropy": 7.326742553710938, "epoch": 0.03656876094145108, "grad_norm": 1.234375, "learning_rate": 0.00023449999999999998, "loss": 6.9507, "mean_token_accuracy": 0.09251324906945228, "num_tokens": 811706.0, "step": 470 }, { "entropy": 7.262205600738525, "epoch": 0.03695779031316864, "grad_norm": 1.171875, "learning_rate": 0.000237, "loss": 7.0091, "mean_token_accuracy": 0.09699861034750938, "num_tokens": 820182.0, "step": 475 }, { "entropy": 7.3125176429748535, "epoch": 0.03734681968488621, "grad_norm": 1.3046875, "learning_rate": 0.0002395, "loss": 6.9423, "mean_token_accuracy": 0.09304441586136818, "num_tokens": 829808.0, "step": 480 }, { "entropy": 7.292161369323731, "epoch": 0.03773584905660377, "grad_norm": 1.359375, "learning_rate": 0.000242, "loss": 6.8887, "mean_token_accuracy": 0.09506509900093078, "num_tokens": 838838.0, "step": 485 }, { "entropy": 7.33060131072998, "epoch": 0.03812487842832134, "grad_norm": 1.40625, "learning_rate": 0.0002445, "loss": 6.9833, "mean_token_accuracy": 0.09907156899571419, "num_tokens": 847800.0, "step": 490 }, { "entropy": 7.394680452346802, "epoch": 0.0385139078000389, "grad_norm": 1.484375, "learning_rate": 0.000247, "loss": 7.08, "mean_token_accuracy": 0.09246540367603302, "num_tokens": 856503.0, "step": 495 }, { "entropy": 7.226006984710693, "epoch": 0.03890293717175647, "grad_norm": 1.453125, "learning_rate": 0.0002495, "loss": 6.9683, "mean_token_accuracy": 0.09611012637615204, "num_tokens": 865245.0, "step": 500 }, { "entropy": 7.303643465042114, "epoch": 0.039291966543474034, "grad_norm": 1.3984375, "learning_rate": 0.000252, "loss": 6.9749, "mean_token_accuracy": 0.0949372723698616, "num_tokens": 874485.0, "step": 505 }, { "entropy": 7.133185148239136, "epoch": 0.0396809959151916, "grad_norm": 1.34375, "learning_rate": 0.0002545, "loss": 6.8372, "mean_token_accuracy": 0.10009809583425522, "num_tokens": 883301.0, "step": 510 }, { "entropy": 7.179492998123169, "epoch": 0.04007002528690916, "grad_norm": 1.296875, "learning_rate": 0.000257, "loss": 6.8987, "mean_token_accuracy": 0.09437932819128036, "num_tokens": 892387.0, "step": 515 }, { "entropy": 7.161367273330688, "epoch": 0.040459054658626724, "grad_norm": 1.078125, "learning_rate": 0.0002595, "loss": 6.8902, "mean_token_accuracy": 0.101420196890831, "num_tokens": 901522.0, "step": 520 }, { "entropy": 7.167306137084961, "epoch": 0.04084808403034429, "grad_norm": 1.2578125, "learning_rate": 0.000262, "loss": 6.8411, "mean_token_accuracy": 0.09641877040266991, "num_tokens": 909848.0, "step": 525 }, { "entropy": 7.3447840213775635, "epoch": 0.041237113402061855, "grad_norm": 1.265625, "learning_rate": 0.00026450000000000003, "loss": 7.0797, "mean_token_accuracy": 0.09041683003306389, "num_tokens": 919079.0, "step": 530 }, { "entropy": 7.150223207473755, "epoch": 0.04162614277377942, "grad_norm": 1.390625, "learning_rate": 0.00026700000000000004, "loss": 6.8357, "mean_token_accuracy": 0.10363327041268348, "num_tokens": 927807.0, "step": 535 }, { "entropy": 7.154421615600586, "epoch": 0.042015172145496986, "grad_norm": 1.3046875, "learning_rate": 0.00026950000000000005, "loss": 6.9331, "mean_token_accuracy": 0.10026705339550972, "num_tokens": 936498.0, "step": 540 }, { "entropy": 7.247080707550049, "epoch": 0.04240420151721455, "grad_norm": 1.1171875, "learning_rate": 0.00027200000000000005, "loss": 7.0055, "mean_token_accuracy": 0.10041748508810996, "num_tokens": 945436.0, "step": 545 }, { "entropy": 7.224219846725464, "epoch": 0.04279323088893212, "grad_norm": 1.2109375, "learning_rate": 0.0002745, "loss": 6.9165, "mean_token_accuracy": 0.09951690733432769, "num_tokens": 953990.0, "step": 550 }, { "entropy": 7.183721542358398, "epoch": 0.04318226026064968, "grad_norm": 1.328125, "learning_rate": 0.000277, "loss": 6.8412, "mean_token_accuracy": 0.0982144832611084, "num_tokens": 962008.0, "step": 555 }, { "entropy": 7.243313407897949, "epoch": 0.04357128963236724, "grad_norm": 1.125, "learning_rate": 0.0002795, "loss": 7.004, "mean_token_accuracy": 0.097385935485363, "num_tokens": 970935.0, "step": 560 }, { "entropy": 7.262167167663574, "epoch": 0.04396031900408481, "grad_norm": 1.171875, "learning_rate": 0.00028199999999999997, "loss": 6.9564, "mean_token_accuracy": 0.09126960262656211, "num_tokens": 979492.0, "step": 565 }, { "entropy": 7.1115397930145265, "epoch": 0.04434934837580237, "grad_norm": 1.2578125, "learning_rate": 0.0002845, "loss": 6.8659, "mean_token_accuracy": 0.09609195366501808, "num_tokens": 987866.0, "step": 570 }, { "entropy": 7.152759647369384, "epoch": 0.04473837774751994, "grad_norm": 1.140625, "learning_rate": 0.000287, "loss": 6.9064, "mean_token_accuracy": 0.09902488738298416, "num_tokens": 996760.0, "step": 575 }, { "entropy": 7.205654001235962, "epoch": 0.0451274071192375, "grad_norm": 1.3828125, "learning_rate": 0.0002895, "loss": 6.8252, "mean_token_accuracy": 0.10003674700856209, "num_tokens": 1005432.0, "step": 580 }, { "entropy": 7.1957074165344235, "epoch": 0.04551643649095507, "grad_norm": 1.3046875, "learning_rate": 0.000292, "loss": 6.9228, "mean_token_accuracy": 0.10067613199353218, "num_tokens": 1013729.0, "step": 585 }, { "entropy": 6.997878503799439, "epoch": 0.045905465862672634, "grad_norm": 1.2734375, "learning_rate": 0.0002945, "loss": 6.7348, "mean_token_accuracy": 0.1082767240703106, "num_tokens": 1022485.0, "step": 590 }, { "entropy": 7.08715558052063, "epoch": 0.0462944952343902, "grad_norm": 1.3515625, "learning_rate": 0.000297, "loss": 6.8166, "mean_token_accuracy": 0.10034638941287995, "num_tokens": 1030523.0, "step": 595 }, { "entropy": 7.2036830425262455, "epoch": 0.04668352460610776, "grad_norm": 1.1953125, "learning_rate": 0.0002995, "loss": 6.9339, "mean_token_accuracy": 0.09973467364907265, "num_tokens": 1039268.0, "step": 600 }, { "entropy": 7.0301995277404785, "epoch": 0.047072553977825324, "grad_norm": 1.25, "learning_rate": 0.000302, "loss": 6.8202, "mean_token_accuracy": 0.10042936652898789, "num_tokens": 1048590.0, "step": 605 }, { "entropy": 7.0609663963317875, "epoch": 0.04746158334954289, "grad_norm": 1.15625, "learning_rate": 0.0003045, "loss": 6.7556, "mean_token_accuracy": 0.10278418138623238, "num_tokens": 1057232.0, "step": 610 }, { "entropy": 7.049582195281983, "epoch": 0.047850612721260455, "grad_norm": 1.1640625, "learning_rate": 0.000307, "loss": 6.8216, "mean_token_accuracy": 0.09878815785050392, "num_tokens": 1066404.0, "step": 615 }, { "entropy": 7.038175964355469, "epoch": 0.04823964209297802, "grad_norm": 1.1953125, "learning_rate": 0.0003095, "loss": 6.8842, "mean_token_accuracy": 0.0939465455710888, "num_tokens": 1075093.0, "step": 620 }, { "entropy": 7.106451797485351, "epoch": 0.048628671464695586, "grad_norm": 1.2421875, "learning_rate": 0.000312, "loss": 6.7875, "mean_token_accuracy": 0.09886922240257263, "num_tokens": 1084454.0, "step": 625 }, { "entropy": 6.990231323242187, "epoch": 0.04901770083641315, "grad_norm": 1.203125, "learning_rate": 0.0003145, "loss": 6.7069, "mean_token_accuracy": 0.10300704166293144, "num_tokens": 1093452.0, "step": 630 }, { "entropy": 7.079220771789551, "epoch": 0.04940673020813072, "grad_norm": 1.2890625, "learning_rate": 0.000317, "loss": 6.7417, "mean_token_accuracy": 0.10723969489336013, "num_tokens": 1101814.0, "step": 635 }, { "entropy": 6.995628929138183, "epoch": 0.049795759579848276, "grad_norm": 1.34375, "learning_rate": 0.0003195, "loss": 6.8303, "mean_token_accuracy": 0.10031761527061463, "num_tokens": 1110386.0, "step": 640 }, { "entropy": 7.119993448257446, "epoch": 0.05018478895156584, "grad_norm": 1.2109375, "learning_rate": 0.000322, "loss": 6.9206, "mean_token_accuracy": 0.09205639511346816, "num_tokens": 1120141.0, "step": 645 }, { "entropy": 7.026125097274781, "epoch": 0.05057381832328341, "grad_norm": 1.203125, "learning_rate": 0.00032450000000000003, "loss": 6.8553, "mean_token_accuracy": 0.09914684519171715, "num_tokens": 1129920.0, "step": 650 }, { "entropy": 6.9065900325775145, "epoch": 0.05096284769500097, "grad_norm": 1.296875, "learning_rate": 0.00032700000000000003, "loss": 6.7387, "mean_token_accuracy": 0.10237120762467385, "num_tokens": 1138518.0, "step": 655 }, { "entropy": 7.056087446212769, "epoch": 0.05135187706671854, "grad_norm": 1.3984375, "learning_rate": 0.00032950000000000004, "loss": 6.8477, "mean_token_accuracy": 0.09784239828586579, "num_tokens": 1147113.0, "step": 660 }, { "entropy": 6.963723516464233, "epoch": 0.0517409064384361, "grad_norm": 1.359375, "learning_rate": 0.00033200000000000005, "loss": 6.6747, "mean_token_accuracy": 0.10692296847701073, "num_tokens": 1155886.0, "step": 665 }, { "entropy": 6.999239587783814, "epoch": 0.05212993581015367, "grad_norm": 1.359375, "learning_rate": 0.00033450000000000005, "loss": 6.8402, "mean_token_accuracy": 0.10142037197947502, "num_tokens": 1164200.0, "step": 670 }, { "entropy": 6.969135522842407, "epoch": 0.052518965181871234, "grad_norm": 1.2578125, "learning_rate": 0.000337, "loss": 6.7113, "mean_token_accuracy": 0.10580320581793785, "num_tokens": 1172720.0, "step": 675 }, { "entropy": 6.8918328285217285, "epoch": 0.05290799455358879, "grad_norm": 1.1953125, "learning_rate": 0.0003395, "loss": 6.6591, "mean_token_accuracy": 0.09922505840659142, "num_tokens": 1181225.0, "step": 680 }, { "entropy": 7.110291481018066, "epoch": 0.05329702392530636, "grad_norm": 1.1953125, "learning_rate": 0.000342, "loss": 6.8661, "mean_token_accuracy": 0.1002252757549286, "num_tokens": 1190070.0, "step": 685 }, { "entropy": 6.889911794662476, "epoch": 0.053686053297023924, "grad_norm": 1.171875, "learning_rate": 0.00034449999999999997, "loss": 6.745, "mean_token_accuracy": 0.09947578459978104, "num_tokens": 1198995.0, "step": 690 }, { "entropy": 7.012227392196655, "epoch": 0.05407508266874149, "grad_norm": 1.1328125, "learning_rate": 0.000347, "loss": 6.7964, "mean_token_accuracy": 0.10564659833908081, "num_tokens": 1207664.0, "step": 695 }, { "entropy": 7.011436891555786, "epoch": 0.054464112040459055, "grad_norm": 1.2109375, "learning_rate": 0.0003495, "loss": 6.6877, "mean_token_accuracy": 0.11616539508104325, "num_tokens": 1216232.0, "step": 700 }, { "entropy": 6.915061187744141, "epoch": 0.05485314141217662, "grad_norm": 1.3046875, "learning_rate": 0.000352, "loss": 6.7785, "mean_token_accuracy": 0.10488367006182671, "num_tokens": 1224106.0, "step": 705 }, { "entropy": 6.85550856590271, "epoch": 0.055242170783894186, "grad_norm": 1.2734375, "learning_rate": 0.0003545, "loss": 6.6638, "mean_token_accuracy": 0.1070045679807663, "num_tokens": 1232514.0, "step": 710 }, { "entropy": 7.0201925277709964, "epoch": 0.05563120015561175, "grad_norm": 1.3515625, "learning_rate": 0.000357, "loss": 6.7192, "mean_token_accuracy": 0.1072799600660801, "num_tokens": 1240178.0, "step": 715 }, { "entropy": 6.829072189331055, "epoch": 0.05602022952732931, "grad_norm": 1.2890625, "learning_rate": 0.0003595, "loss": 6.6433, "mean_token_accuracy": 0.10768454670906066, "num_tokens": 1248635.0, "step": 720 }, { "entropy": 6.899731540679932, "epoch": 0.056409258899046875, "grad_norm": 1.3515625, "learning_rate": 0.000362, "loss": 6.7462, "mean_token_accuracy": 0.10741591677069665, "num_tokens": 1256389.0, "step": 725 }, { "entropy": 6.866089391708374, "epoch": 0.05679828827076444, "grad_norm": 1.328125, "learning_rate": 0.0003645, "loss": 6.6941, "mean_token_accuracy": 0.1057390108704567, "num_tokens": 1264035.0, "step": 730 }, { "entropy": 6.956638479232788, "epoch": 0.057187317642482006, "grad_norm": 1.2421875, "learning_rate": 0.000367, "loss": 6.6953, "mean_token_accuracy": 0.10426240265369416, "num_tokens": 1272941.0, "step": 735 }, { "entropy": 6.688238668441772, "epoch": 0.05757634701419957, "grad_norm": 1.234375, "learning_rate": 0.0003695, "loss": 6.676, "mean_token_accuracy": 0.106101393699646, "num_tokens": 1281767.0, "step": 740 }, { "entropy": 7.095763778686523, "epoch": 0.05796537638591714, "grad_norm": 1.1875, "learning_rate": 0.000372, "loss": 6.7623, "mean_token_accuracy": 0.10797640457749366, "num_tokens": 1290049.0, "step": 745 }, { "entropy": 6.762351226806641, "epoch": 0.0583544057576347, "grad_norm": 1.1484375, "learning_rate": 0.0003745, "loss": 6.5951, "mean_token_accuracy": 0.11266529634594917, "num_tokens": 1299032.0, "step": 750 }, { "entropy": 6.872419738769532, "epoch": 0.05874343512935227, "grad_norm": 1.234375, "learning_rate": 0.000377, "loss": 6.851, "mean_token_accuracy": 0.10019904971122742, "num_tokens": 1308508.0, "step": 755 }, { "entropy": 6.993260669708252, "epoch": 0.059132464501069834, "grad_norm": 1.109375, "learning_rate": 0.0003795, "loss": 6.6769, "mean_token_accuracy": 0.10615287944674492, "num_tokens": 1317044.0, "step": 760 }, { "entropy": 6.876901865005493, "epoch": 0.05952149387278739, "grad_norm": 1.1796875, "learning_rate": 0.000382, "loss": 6.7072, "mean_token_accuracy": 0.10667419582605361, "num_tokens": 1325554.0, "step": 765 }, { "entropy": 6.8257323741912845, "epoch": 0.05991052324450496, "grad_norm": 1.1484375, "learning_rate": 0.0003845, "loss": 6.5916, "mean_token_accuracy": 0.10517750829458236, "num_tokens": 1334201.0, "step": 770 }, { "entropy": 6.738331365585327, "epoch": 0.060299552616222524, "grad_norm": 1.2265625, "learning_rate": 0.00038700000000000003, "loss": 6.6132, "mean_token_accuracy": 0.11592961698770524, "num_tokens": 1343061.0, "step": 775 }, { "entropy": 6.788525867462158, "epoch": 0.06068858198794009, "grad_norm": 1.25, "learning_rate": 0.00038950000000000003, "loss": 6.5887, "mean_token_accuracy": 0.11328529119491577, "num_tokens": 1352262.0, "step": 780 }, { "entropy": 6.766341304779052, "epoch": 0.061077611359657655, "grad_norm": 1.1796875, "learning_rate": 0.00039200000000000004, "loss": 6.6355, "mean_token_accuracy": 0.10724243074655533, "num_tokens": 1361400.0, "step": 785 }, { "entropy": 6.8809511184692385, "epoch": 0.06146664073137522, "grad_norm": 1.2109375, "learning_rate": 0.00039450000000000005, "loss": 6.7431, "mean_token_accuracy": 0.10390153974294662, "num_tokens": 1369850.0, "step": 790 }, { "entropy": 6.770475769042969, "epoch": 0.061855670103092786, "grad_norm": 1.15625, "learning_rate": 0.00039700000000000005, "loss": 6.5993, "mean_token_accuracy": 0.11133262068033219, "num_tokens": 1378342.0, "step": 795 }, { "entropy": 6.833333206176758, "epoch": 0.06224469947481035, "grad_norm": 1.2734375, "learning_rate": 0.0003995, "loss": 6.7006, "mean_token_accuracy": 0.10400806367397308, "num_tokens": 1386981.0, "step": 800 }, { "entropy": 6.896929168701172, "epoch": 0.06263372884652792, "grad_norm": 1.1796875, "learning_rate": 0.000402, "loss": 6.7767, "mean_token_accuracy": 0.10226056203246117, "num_tokens": 1395801.0, "step": 805 }, { "entropy": 6.881122875213623, "epoch": 0.06302275821824548, "grad_norm": 1.234375, "learning_rate": 0.0004045, "loss": 6.6733, "mean_token_accuracy": 0.11250713765621186, "num_tokens": 1403715.0, "step": 810 }, { "entropy": 6.890682744979858, "epoch": 0.06341178758996305, "grad_norm": 1.0859375, "learning_rate": 0.00040699999999999997, "loss": 6.766, "mean_token_accuracy": 0.10130376219749451, "num_tokens": 1413199.0, "step": 815 }, { "entropy": 6.845803165435791, "epoch": 0.0638008169616806, "grad_norm": 1.203125, "learning_rate": 0.0004095, "loss": 6.7297, "mean_token_accuracy": 0.10811256021261215, "num_tokens": 1421918.0, "step": 820 }, { "entropy": 6.727932119369507, "epoch": 0.06418984633339817, "grad_norm": 1.1640625, "learning_rate": 0.000412, "loss": 6.6275, "mean_token_accuracy": 0.10078049674630166, "num_tokens": 1430625.0, "step": 825 }, { "entropy": 6.839619207382202, "epoch": 0.06457887570511574, "grad_norm": 1.265625, "learning_rate": 0.0004145, "loss": 6.6537, "mean_token_accuracy": 0.10472832173109055, "num_tokens": 1439158.0, "step": 830 }, { "entropy": 6.7103558540344235, "epoch": 0.0649679050768333, "grad_norm": 1.15625, "learning_rate": 0.000417, "loss": 6.6218, "mean_token_accuracy": 0.11031484305858612, "num_tokens": 1448266.0, "step": 835 }, { "entropy": 6.824801921844482, "epoch": 0.06535693444855087, "grad_norm": 1.234375, "learning_rate": 0.0004195, "loss": 6.7042, "mean_token_accuracy": 0.10656223520636558, "num_tokens": 1457322.0, "step": 840 }, { "entropy": 6.962126445770264, "epoch": 0.06574596382026843, "grad_norm": 1.1171875, "learning_rate": 0.000422, "loss": 6.8104, "mean_token_accuracy": 0.10119246616959572, "num_tokens": 1466120.0, "step": 845 }, { "entropy": 6.734336900711059, "epoch": 0.066134993191986, "grad_norm": 1.2109375, "learning_rate": 0.0004245, "loss": 6.5668, "mean_token_accuracy": 0.10800775364041329, "num_tokens": 1474965.0, "step": 850 }, { "entropy": 6.679752445220947, "epoch": 0.06652402256370356, "grad_norm": 1.2734375, "learning_rate": 0.000427, "loss": 6.6775, "mean_token_accuracy": 0.10365973934531211, "num_tokens": 1483483.0, "step": 855 }, { "entropy": 6.906285905838013, "epoch": 0.06691305193542113, "grad_norm": 1.234375, "learning_rate": 0.0004295, "loss": 6.6044, "mean_token_accuracy": 0.10145875811576843, "num_tokens": 1492313.0, "step": 860 }, { "entropy": 6.7070897102355955, "epoch": 0.06730208130713869, "grad_norm": 1.203125, "learning_rate": 0.000432, "loss": 6.533, "mean_token_accuracy": 0.10664732605218888, "num_tokens": 1501081.0, "step": 865 }, { "entropy": 6.653385829925537, "epoch": 0.06769111067885625, "grad_norm": 1.140625, "learning_rate": 0.0004345, "loss": 6.5538, "mean_token_accuracy": 0.10266396701335907, "num_tokens": 1510169.0, "step": 870 }, { "entropy": 6.73896050453186, "epoch": 0.06808014005057382, "grad_norm": 1.1484375, "learning_rate": 0.000437, "loss": 6.5099, "mean_token_accuracy": 0.10998809859156608, "num_tokens": 1519546.0, "step": 875 }, { "entropy": 6.610293054580689, "epoch": 0.06846916942229138, "grad_norm": 1.171875, "learning_rate": 0.0004395, "loss": 6.6221, "mean_token_accuracy": 0.10572586581110954, "num_tokens": 1529104.0, "step": 880 }, { "entropy": 6.671034288406372, "epoch": 0.06885819879400895, "grad_norm": 1.1640625, "learning_rate": 0.000442, "loss": 6.5747, "mean_token_accuracy": 0.11553266048431396, "num_tokens": 1537033.0, "step": 885 }, { "entropy": 6.745483112335205, "epoch": 0.06924722816572651, "grad_norm": 1.3046875, "learning_rate": 0.0004445, "loss": 6.5984, "mean_token_accuracy": 0.10939133316278457, "num_tokens": 1545059.0, "step": 890 }, { "entropy": 6.75796480178833, "epoch": 0.06963625753744408, "grad_norm": 1.1328125, "learning_rate": 0.000447, "loss": 6.5969, "mean_token_accuracy": 0.10726859346032143, "num_tokens": 1553784.0, "step": 895 }, { "entropy": 6.6265500545501705, "epoch": 0.07002528690916164, "grad_norm": 1.140625, "learning_rate": 0.00044950000000000003, "loss": 6.5325, "mean_token_accuracy": 0.1090914063155651, "num_tokens": 1562059.0, "step": 900 }, { "entropy": 6.712047672271728, "epoch": 0.0704143162808792, "grad_norm": 1.1640625, "learning_rate": 0.00045200000000000004, "loss": 6.591, "mean_token_accuracy": 0.10841032788157463, "num_tokens": 1570061.0, "step": 905 }, { "entropy": 6.632591104507446, "epoch": 0.07080334565259677, "grad_norm": 1.1015625, "learning_rate": 0.00045450000000000004, "loss": 6.5654, "mean_token_accuracy": 0.11026803255081177, "num_tokens": 1578261.0, "step": 910 }, { "entropy": 6.621666669845581, "epoch": 0.07119237502431433, "grad_norm": 1.296875, "learning_rate": 0.00045700000000000005, "loss": 6.4859, "mean_token_accuracy": 0.11358301490545272, "num_tokens": 1586260.0, "step": 915 }, { "entropy": 6.711280393600464, "epoch": 0.0715814043960319, "grad_norm": 1.3359375, "learning_rate": 0.00045950000000000006, "loss": 6.6821, "mean_token_accuracy": 0.10423496067523956, "num_tokens": 1595234.0, "step": 920 }, { "entropy": 6.685232305526734, "epoch": 0.07197043376774946, "grad_norm": 1.2578125, "learning_rate": 0.000462, "loss": 6.5795, "mean_token_accuracy": 0.10836847126483917, "num_tokens": 1604212.0, "step": 925 }, { "entropy": 6.730190992355347, "epoch": 0.07235946313946703, "grad_norm": 1.078125, "learning_rate": 0.0004645, "loss": 6.6145, "mean_token_accuracy": 0.11065342202782631, "num_tokens": 1612925.0, "step": 930 }, { "entropy": 6.590854501724243, "epoch": 0.07274849251118459, "grad_norm": 1.21875, "learning_rate": 0.000467, "loss": 6.5066, "mean_token_accuracy": 0.10939636155962944, "num_tokens": 1621804.0, "step": 935 }, { "entropy": 6.572239732742309, "epoch": 0.07313752188290217, "grad_norm": 1.0703125, "learning_rate": 0.0004695, "loss": 6.4856, "mean_token_accuracy": 0.11304571852087975, "num_tokens": 1630943.0, "step": 940 }, { "entropy": 6.617482995986938, "epoch": 0.07352655125461972, "grad_norm": 1.1796875, "learning_rate": 0.000472, "loss": 6.3922, "mean_token_accuracy": 0.11573764458298683, "num_tokens": 1638899.0, "step": 945 }, { "entropy": 6.57882833480835, "epoch": 0.07391558062633728, "grad_norm": 1.25, "learning_rate": 0.0004745, "loss": 6.6125, "mean_token_accuracy": 0.11446217894554138, "num_tokens": 1647485.0, "step": 950 }, { "entropy": 6.657685661315918, "epoch": 0.07430460999805485, "grad_norm": 1.171875, "learning_rate": 0.000477, "loss": 6.5656, "mean_token_accuracy": 0.11251236274838447, "num_tokens": 1656290.0, "step": 955 }, { "entropy": 6.712019300460815, "epoch": 0.07469363936977241, "grad_norm": 1.1015625, "learning_rate": 0.0004795, "loss": 6.5924, "mean_token_accuracy": 0.11167355254292488, "num_tokens": 1665474.0, "step": 960 }, { "entropy": 6.533619403839111, "epoch": 0.07508266874148999, "grad_norm": 1.3125, "learning_rate": 0.000482, "loss": 6.464, "mean_token_accuracy": 0.1160540908575058, "num_tokens": 1673599.0, "step": 965 }, { "entropy": 6.607017183303833, "epoch": 0.07547169811320754, "grad_norm": 1.1171875, "learning_rate": 0.0004845, "loss": 6.4586, "mean_token_accuracy": 0.11052219942212105, "num_tokens": 1683282.0, "step": 970 }, { "entropy": 6.630674982070923, "epoch": 0.07586072748492512, "grad_norm": 1.15625, "learning_rate": 0.000487, "loss": 6.5825, "mean_token_accuracy": 0.1119205579161644, "num_tokens": 1691094.0, "step": 975 }, { "entropy": 6.443245840072632, "epoch": 0.07624975685664268, "grad_norm": 1.28125, "learning_rate": 0.0004895, "loss": 6.444, "mean_token_accuracy": 0.11762246191501617, "num_tokens": 1700053.0, "step": 980 }, { "entropy": 6.574719095230103, "epoch": 0.07663878622836025, "grad_norm": 1.265625, "learning_rate": 0.000492, "loss": 6.3455, "mean_token_accuracy": 0.1151976853609085, "num_tokens": 1707732.0, "step": 985 }, { "entropy": 6.575902795791626, "epoch": 0.0770278156000778, "grad_norm": 1.265625, "learning_rate": 0.0004945, "loss": 6.6179, "mean_token_accuracy": 0.10963503271341324, "num_tokens": 1716406.0, "step": 990 }, { "entropy": 6.661358880996704, "epoch": 0.07741684497179536, "grad_norm": 1.0546875, "learning_rate": 0.000497, "loss": 6.6325, "mean_token_accuracy": 0.10895756259560585, "num_tokens": 1725832.0, "step": 995 }, { "entropy": 6.733318710327149, "epoch": 0.07780587434351294, "grad_norm": 1.125, "learning_rate": 0.0004995, "loss": 6.5474, "mean_token_accuracy": 0.10725341215729714, "num_tokens": 1734853.0, "step": 1000 }, { "entropy": 6.559145545959472, "epoch": 0.0781949037152305, "grad_norm": 1.234375, "learning_rate": 0.0004999999989075146, "loss": 6.5731, "mean_token_accuracy": 0.11213273108005524, "num_tokens": 1744240.0, "step": 1005 }, { "entropy": 6.637544441223144, "epoch": 0.07858393308694807, "grad_norm": 1.1484375, "learning_rate": 0.0004999999944692927, "loss": 6.566, "mean_token_accuracy": 0.10990296676754951, "num_tokens": 1753334.0, "step": 1010 }, { "entropy": 6.47784652709961, "epoch": 0.07897296245866563, "grad_norm": 1.171875, "learning_rate": 0.000499999986617054, "loss": 6.4764, "mean_token_accuracy": 0.11047938987612724, "num_tokens": 1762032.0, "step": 1015 }, { "entropy": 6.572625017166137, "epoch": 0.0793619918303832, "grad_norm": 1.1015625, "learning_rate": 0.0004999999753507986, "loss": 6.4775, "mean_token_accuracy": 0.11230112910270691, "num_tokens": 1770508.0, "step": 1020 }, { "entropy": 6.491672945022583, "epoch": 0.07975102120210076, "grad_norm": 1.078125, "learning_rate": 0.0004999999606705267, "loss": 6.3729, "mean_token_accuracy": 0.11614649370312691, "num_tokens": 1780167.0, "step": 1025 }, { "entropy": 6.619625043869019, "epoch": 0.08014005057381832, "grad_norm": 1.078125, "learning_rate": 0.0004999999425762385, "loss": 6.5776, "mean_token_accuracy": 0.10773374065756798, "num_tokens": 1788809.0, "step": 1030 }, { "entropy": 6.548305225372315, "epoch": 0.08052907994553589, "grad_norm": 1.234375, "learning_rate": 0.0004999999210679344, "loss": 6.4943, "mean_token_accuracy": 0.11628751307725907, "num_tokens": 1797445.0, "step": 1035 }, { "entropy": 6.631950330734253, "epoch": 0.08091810931725345, "grad_norm": 1.2265625, "learning_rate": 0.0004999998961456145, "loss": 6.5027, "mean_token_accuracy": 0.11015650182962418, "num_tokens": 1806488.0, "step": 1040 }, { "entropy": 6.501224613189697, "epoch": 0.08130713868897102, "grad_norm": 1.15625, "learning_rate": 0.0004999998678092794, "loss": 6.5833, "mean_token_accuracy": 0.11565212160348892, "num_tokens": 1815692.0, "step": 1045 }, { "entropy": 6.625118780136108, "epoch": 0.08169616806068858, "grad_norm": 1.203125, "learning_rate": 0.0004999998360589293, "loss": 6.4938, "mean_token_accuracy": 0.11357240229845048, "num_tokens": 1824599.0, "step": 1050 }, { "entropy": 6.689116191864014, "epoch": 0.08208519743240615, "grad_norm": 1.1484375, "learning_rate": 0.000499999800894565, "loss": 6.6448, "mean_token_accuracy": 0.11452656835317612, "num_tokens": 1833411.0, "step": 1055 }, { "entropy": 6.518345499038697, "epoch": 0.08247422680412371, "grad_norm": 1.2578125, "learning_rate": 0.0004999997623161866, "loss": 6.4549, "mean_token_accuracy": 0.10907695516943931, "num_tokens": 1842177.0, "step": 1060 }, { "entropy": 6.470740461349488, "epoch": 0.08286325617584128, "grad_norm": 1.1484375, "learning_rate": 0.0004999997203237951, "loss": 6.4244, "mean_token_accuracy": 0.116130381077528, "num_tokens": 1850176.0, "step": 1065 }, { "entropy": 6.579597043991089, "epoch": 0.08325228554755884, "grad_norm": 1.0625, "learning_rate": 0.000499999674917391, "loss": 6.4737, "mean_token_accuracy": 0.10759498700499534, "num_tokens": 1859464.0, "step": 1070 }, { "entropy": 6.453550958633423, "epoch": 0.0836413149192764, "grad_norm": 1.1328125, "learning_rate": 0.0004999996260969748, "loss": 6.3705, "mean_token_accuracy": 0.11378242447972298, "num_tokens": 1867733.0, "step": 1075 }, { "entropy": 6.466144609451294, "epoch": 0.08403034429099397, "grad_norm": 1.1328125, "learning_rate": 0.0004999995738625475, "loss": 6.3725, "mean_token_accuracy": 0.11944899260997772, "num_tokens": 1876010.0, "step": 1080 }, { "entropy": 6.499561977386475, "epoch": 0.08441937366271153, "grad_norm": 1.1171875, "learning_rate": 0.0004999995182141099, "loss": 6.5391, "mean_token_accuracy": 0.1163535013794899, "num_tokens": 1884906.0, "step": 1085 }, { "entropy": 6.527617025375366, "epoch": 0.0848084030344291, "grad_norm": 1.15625, "learning_rate": 0.0004999994591516626, "loss": 6.4293, "mean_token_accuracy": 0.11143236458301545, "num_tokens": 1893464.0, "step": 1090 }, { "entropy": 6.541065073013305, "epoch": 0.08519743240614666, "grad_norm": 1.09375, "learning_rate": 0.0004999993966752066, "loss": 6.4873, "mean_token_accuracy": 0.11323103830218315, "num_tokens": 1902769.0, "step": 1095 }, { "entropy": 6.517040348052978, "epoch": 0.08558646177786423, "grad_norm": 1.1171875, "learning_rate": 0.000499999330784743, "loss": 6.4036, "mean_token_accuracy": 0.11408817544579505, "num_tokens": 1911968.0, "step": 1100 }, { "entropy": 6.483025693893433, "epoch": 0.08597549114958179, "grad_norm": 1.265625, "learning_rate": 0.0004999992614802725, "loss": 6.3911, "mean_token_accuracy": 0.11573496237397193, "num_tokens": 1920063.0, "step": 1105 }, { "entropy": 6.351643323898315, "epoch": 0.08636452052129936, "grad_norm": 1.2109375, "learning_rate": 0.0004999991887617966, "loss": 6.3803, "mean_token_accuracy": 0.11390967592597008, "num_tokens": 1929192.0, "step": 1110 }, { "entropy": 6.570942449569702, "epoch": 0.08675354989301692, "grad_norm": 0.95703125, "learning_rate": 0.0004999991126293158, "loss": 6.5798, "mean_token_accuracy": 0.10959510430693627, "num_tokens": 1939082.0, "step": 1115 }, { "entropy": 6.373979282379151, "epoch": 0.08714257926473448, "grad_norm": 1.0625, "learning_rate": 0.0004999990330828318, "loss": 6.43, "mean_token_accuracy": 0.1143827423453331, "num_tokens": 1948313.0, "step": 1120 }, { "entropy": 6.586628484725952, "epoch": 0.08753160863645205, "grad_norm": 1.3203125, "learning_rate": 0.0004999989501223456, "loss": 6.4296, "mean_token_accuracy": 0.11529109328985214, "num_tokens": 1957035.0, "step": 1125 }, { "entropy": 6.405944681167602, "epoch": 0.08792063800816961, "grad_norm": 1.1171875, "learning_rate": 0.0004999988637478584, "loss": 6.4257, "mean_token_accuracy": 0.11158483400940895, "num_tokens": 1966041.0, "step": 1130 }, { "entropy": 6.511107158660889, "epoch": 0.08830966737988719, "grad_norm": 1.2109375, "learning_rate": 0.0004999987739593716, "loss": 6.4577, "mean_token_accuracy": 0.10981602147221566, "num_tokens": 1975019.0, "step": 1135 }, { "entropy": 6.464044380187988, "epoch": 0.08869869675160474, "grad_norm": 1.1875, "learning_rate": 0.0004999986807568865, "loss": 6.3725, "mean_token_accuracy": 0.12287635952234269, "num_tokens": 1982930.0, "step": 1140 }, { "entropy": 6.514709520339966, "epoch": 0.08908772612332232, "grad_norm": 1.21875, "learning_rate": 0.0004999985841404045, "loss": 6.4993, "mean_token_accuracy": 0.1092392586171627, "num_tokens": 1991888.0, "step": 1145 }, { "entropy": 6.3899940013885494, "epoch": 0.08947675549503988, "grad_norm": 1.1796875, "learning_rate": 0.0004999984841099271, "loss": 6.3541, "mean_token_accuracy": 0.11540794596076012, "num_tokens": 2000202.0, "step": 1150 }, { "entropy": 6.460285663604736, "epoch": 0.08986578486675743, "grad_norm": 1.078125, "learning_rate": 0.000499998380665456, "loss": 6.3698, "mean_token_accuracy": 0.11728540211915969, "num_tokens": 2009281.0, "step": 1155 }, { "entropy": 6.4477497100830075, "epoch": 0.090254814238475, "grad_norm": 1.0859375, "learning_rate": 0.0004999982738069924, "loss": 6.3702, "mean_token_accuracy": 0.11771893873810768, "num_tokens": 2017806.0, "step": 1160 }, { "entropy": 6.440757131576538, "epoch": 0.09064384361019256, "grad_norm": 1.046875, "learning_rate": 0.0004999981635345382, "loss": 6.4672, "mean_token_accuracy": 0.1128288336098194, "num_tokens": 2027582.0, "step": 1165 }, { "entropy": 6.436817359924317, "epoch": 0.09103287298191014, "grad_norm": 1.1328125, "learning_rate": 0.0004999980498480949, "loss": 6.3218, "mean_token_accuracy": 0.12205893769860268, "num_tokens": 2035427.0, "step": 1170 }, { "entropy": 6.547386360168457, "epoch": 0.0914219023536277, "grad_norm": 1.0390625, "learning_rate": 0.0004999979327476644, "loss": 6.5285, "mean_token_accuracy": 0.11442452073097228, "num_tokens": 2044603.0, "step": 1175 }, { "entropy": 6.3849019527435305, "epoch": 0.09181093172534527, "grad_norm": 1.1171875, "learning_rate": 0.0004999978122332485, "loss": 6.3552, "mean_token_accuracy": 0.12413827255368233, "num_tokens": 2053272.0, "step": 1180 }, { "entropy": 6.4762718200683596, "epoch": 0.09219996109706283, "grad_norm": 1.1015625, "learning_rate": 0.0004999976883048487, "loss": 6.3797, "mean_token_accuracy": 0.11840806007385254, "num_tokens": 2061677.0, "step": 1185 }, { "entropy": 6.43572359085083, "epoch": 0.0925889904687804, "grad_norm": 1.0234375, "learning_rate": 0.0004999975609624673, "loss": 6.397, "mean_token_accuracy": 0.11727287769317626, "num_tokens": 2070282.0, "step": 1190 }, { "entropy": 6.5320531845092775, "epoch": 0.09297801984049796, "grad_norm": 1.21875, "learning_rate": 0.0004999974302061059, "loss": 6.5035, "mean_token_accuracy": 0.111043381690979, "num_tokens": 2078812.0, "step": 1195 }, { "entropy": 6.397515392303466, "epoch": 0.09336704921221552, "grad_norm": 1.1015625, "learning_rate": 0.0004999972960357666, "loss": 6.3813, "mean_token_accuracy": 0.11424519494175911, "num_tokens": 2087020.0, "step": 1200 }, { "entropy": 6.413018131256104, "epoch": 0.09375607858393309, "grad_norm": 1.2109375, "learning_rate": 0.0004999971584514516, "loss": 6.3238, "mean_token_accuracy": 0.11890219822525978, "num_tokens": 2095933.0, "step": 1205 }, { "entropy": 6.320618343353272, "epoch": 0.09414510795565065, "grad_norm": 1.140625, "learning_rate": 0.0004999970174531627, "loss": 6.3436, "mean_token_accuracy": 0.12122933119535446, "num_tokens": 2105218.0, "step": 1210 }, { "entropy": 6.293485689163208, "epoch": 0.09453413732736822, "grad_norm": 1.1875, "learning_rate": 0.0004999968730409022, "loss": 6.2566, "mean_token_accuracy": 0.11917761564254761, "num_tokens": 2113808.0, "step": 1215 }, { "entropy": 6.390006256103516, "epoch": 0.09492316669908578, "grad_norm": 1.09375, "learning_rate": 0.0004999967252146723, "loss": 6.4251, "mean_token_accuracy": 0.1174811840057373, "num_tokens": 2123014.0, "step": 1220 }, { "entropy": 6.498880815505982, "epoch": 0.09531219607080335, "grad_norm": 1.1484375, "learning_rate": 0.0004999965739744752, "loss": 6.346, "mean_token_accuracy": 0.12444588094949723, "num_tokens": 2131840.0, "step": 1225 }, { "entropy": 6.458331155776977, "epoch": 0.09570122544252091, "grad_norm": 1.1796875, "learning_rate": 0.0004999964193203132, "loss": 6.4309, "mean_token_accuracy": 0.11823861449956893, "num_tokens": 2140467.0, "step": 1230 }, { "entropy": 6.428109121322632, "epoch": 0.09609025481423847, "grad_norm": 1.1484375, "learning_rate": 0.0004999962612521888, "loss": 6.3798, "mean_token_accuracy": 0.12282692417502403, "num_tokens": 2149282.0, "step": 1235 }, { "entropy": 6.429515647888183, "epoch": 0.09647928418595604, "grad_norm": 1.0859375, "learning_rate": 0.0004999960997701041, "loss": 6.3801, "mean_token_accuracy": 0.11871640384197235, "num_tokens": 2157781.0, "step": 1240 }, { "entropy": 6.419339513778686, "epoch": 0.0968683135576736, "grad_norm": 1.1171875, "learning_rate": 0.0004999959348740618, "loss": 6.3565, "mean_token_accuracy": 0.11975458636879921, "num_tokens": 2166482.0, "step": 1245 }, { "entropy": 6.3982480525970455, "epoch": 0.09725734292939117, "grad_norm": 1.0859375, "learning_rate": 0.0004999957665640641, "loss": 6.3726, "mean_token_accuracy": 0.11583413928747177, "num_tokens": 2174559.0, "step": 1250 }, { "entropy": 6.392813014984131, "epoch": 0.09764637230110873, "grad_norm": 1.1171875, "learning_rate": 0.000499995594840114, "loss": 6.2627, "mean_token_accuracy": 0.12039380520582199, "num_tokens": 2182374.0, "step": 1255 }, { "entropy": 6.315843868255615, "epoch": 0.0980354016728263, "grad_norm": 1.015625, "learning_rate": 0.0004999954197022138, "loss": 6.3739, "mean_token_accuracy": 0.12241144180297851, "num_tokens": 2191427.0, "step": 1260 }, { "entropy": 6.491170120239258, "epoch": 0.09842443104454386, "grad_norm": 1.109375, "learning_rate": 0.0004999952411503661, "loss": 6.4657, "mean_token_accuracy": 0.11634750217199326, "num_tokens": 2199698.0, "step": 1265 }, { "entropy": 6.412351083755493, "epoch": 0.09881346041626143, "grad_norm": 1.0546875, "learning_rate": 0.0004999950591845738, "loss": 6.2891, "mean_token_accuracy": 0.12139204517006874, "num_tokens": 2208519.0, "step": 1270 }, { "entropy": 6.28710150718689, "epoch": 0.09920248978797899, "grad_norm": 1.0625, "learning_rate": 0.0004999948738048397, "loss": 6.3098, "mean_token_accuracy": 0.12150795012712479, "num_tokens": 2217453.0, "step": 1275 }, { "entropy": 6.34256329536438, "epoch": 0.09959151915969655, "grad_norm": 1.1328125, "learning_rate": 0.0004999946850111663, "loss": 6.4153, "mean_token_accuracy": 0.1209065318107605, "num_tokens": 2225623.0, "step": 1280 }, { "entropy": 6.43469386100769, "epoch": 0.09998054853141412, "grad_norm": 1.109375, "learning_rate": 0.0004999944928035569, "loss": 6.3593, "mean_token_accuracy": 0.121299659460783, "num_tokens": 2234519.0, "step": 1285 }, { "entropy": 6.3267598152160645, "epoch": 0.10036957790313168, "grad_norm": 1.296875, "learning_rate": 0.000499994297182014, "loss": 6.3602, "mean_token_accuracy": 0.11970539391040802, "num_tokens": 2242994.0, "step": 1290 }, { "entropy": 6.463318681716919, "epoch": 0.10075860727484925, "grad_norm": 1.0859375, "learning_rate": 0.0004999940981465408, "loss": 6.3755, "mean_token_accuracy": 0.11988109499216079, "num_tokens": 2251687.0, "step": 1295 }, { "entropy": 6.263813257217407, "epoch": 0.10114763664656681, "grad_norm": 1.09375, "learning_rate": 0.0004999938956971404, "loss": 6.2951, "mean_token_accuracy": 0.12231847047805786, "num_tokens": 2260751.0, "step": 1300 }, { "entropy": 6.42852816581726, "epoch": 0.10153666601828439, "grad_norm": 1.109375, "learning_rate": 0.0004999936898338156, "loss": 6.2395, "mean_token_accuracy": 0.1288893111050129, "num_tokens": 2269125.0, "step": 1305 }, { "entropy": 6.226840353012085, "epoch": 0.10192569539000194, "grad_norm": 1.09375, "learning_rate": 0.0004999934805565698, "loss": 6.1775, "mean_token_accuracy": 0.12845248058438302, "num_tokens": 2277098.0, "step": 1310 }, { "entropy": 6.373805332183838, "epoch": 0.10231472476171952, "grad_norm": 1.0859375, "learning_rate": 0.000499993267865406, "loss": 6.455, "mean_token_accuracy": 0.11760153844952584, "num_tokens": 2285953.0, "step": 1315 }, { "entropy": 6.406149291992188, "epoch": 0.10270375413343708, "grad_norm": 1.09375, "learning_rate": 0.0004999930517603275, "loss": 6.3714, "mean_token_accuracy": 0.12183143571019173, "num_tokens": 2294487.0, "step": 1320 }, { "entropy": 6.39051923751831, "epoch": 0.10309278350515463, "grad_norm": 1.0625, "learning_rate": 0.0004999928322413374, "loss": 6.3909, "mean_token_accuracy": 0.11598639711737632, "num_tokens": 2302915.0, "step": 1325 }, { "entropy": 6.3545863151550295, "epoch": 0.1034818128768722, "grad_norm": 1.140625, "learning_rate": 0.0004999926093084394, "loss": 6.3443, "mean_token_accuracy": 0.11570636853575707, "num_tokens": 2310769.0, "step": 1330 }, { "entropy": 6.3191876888275145, "epoch": 0.10387084224858976, "grad_norm": 1.1640625, "learning_rate": 0.0004999923829616365, "loss": 6.2362, "mean_token_accuracy": 0.11870313882827759, "num_tokens": 2319987.0, "step": 1335 }, { "entropy": 6.339432001113892, "epoch": 0.10425987162030734, "grad_norm": 1.1875, "learning_rate": 0.0004999921532009323, "loss": 6.3474, "mean_token_accuracy": 0.11524386182427407, "num_tokens": 2328964.0, "step": 1340 }, { "entropy": 6.397040700912475, "epoch": 0.1046489009920249, "grad_norm": 1.15625, "learning_rate": 0.0004999919200263304, "loss": 6.3133, "mean_token_accuracy": 0.11604936346411705, "num_tokens": 2337945.0, "step": 1345 }, { "entropy": 6.3518479347229, "epoch": 0.10503793036374247, "grad_norm": 1.15625, "learning_rate": 0.0004999916834378342, "loss": 6.2137, "mean_token_accuracy": 0.1228095144033432, "num_tokens": 2345989.0, "step": 1350 }, { "entropy": 6.209484100341797, "epoch": 0.10542695973546003, "grad_norm": 1.1328125, "learning_rate": 0.0004999914434354472, "loss": 6.3234, "mean_token_accuracy": 0.12122376561164856, "num_tokens": 2353752.0, "step": 1355 }, { "entropy": 6.382920408248902, "epoch": 0.10581598910717759, "grad_norm": 1.0859375, "learning_rate": 0.0004999912000191733, "loss": 6.2872, "mean_token_accuracy": 0.11960536614060402, "num_tokens": 2361961.0, "step": 1360 }, { "entropy": 6.2765013694763185, "epoch": 0.10620501847889516, "grad_norm": 1.1171875, "learning_rate": 0.000499990953189016, "loss": 6.2129, "mean_token_accuracy": 0.12653318867087365, "num_tokens": 2370148.0, "step": 1365 }, { "entropy": 6.378698635101318, "epoch": 0.10659404785061272, "grad_norm": 1.0625, "learning_rate": 0.0004999907029449791, "loss": 6.2592, "mean_token_accuracy": 0.12621283754706383, "num_tokens": 2379105.0, "step": 1370 }, { "entropy": 6.351945304870606, "epoch": 0.10698307722233029, "grad_norm": 1.03125, "learning_rate": 0.0004999904492870663, "loss": 6.3305, "mean_token_accuracy": 0.12122908383607864, "num_tokens": 2387417.0, "step": 1375 }, { "entropy": 6.3498913764953615, "epoch": 0.10737210659404785, "grad_norm": 1.109375, "learning_rate": 0.0004999901922152816, "loss": 6.3536, "mean_token_accuracy": 0.12595803663134575, "num_tokens": 2396163.0, "step": 1380 }, { "entropy": 6.179137945175171, "epoch": 0.10776113596576542, "grad_norm": 1.1015625, "learning_rate": 0.0004999899317296288, "loss": 6.2105, "mean_token_accuracy": 0.12522833421826363, "num_tokens": 2404661.0, "step": 1385 }, { "entropy": 6.334095621109009, "epoch": 0.10815016533748298, "grad_norm": 1.28125, "learning_rate": 0.0004999896678301121, "loss": 6.302, "mean_token_accuracy": 0.11695858612656593, "num_tokens": 2413459.0, "step": 1390 }, { "entropy": 6.355089330673218, "epoch": 0.10853919470920055, "grad_norm": 1.15625, "learning_rate": 0.0004999894005167352, "loss": 6.2443, "mean_token_accuracy": 0.12691024467349052, "num_tokens": 2421401.0, "step": 1395 }, { "entropy": 6.320974922180175, "epoch": 0.10892822408091811, "grad_norm": 1.1015625, "learning_rate": 0.000499989129789502, "loss": 6.252, "mean_token_accuracy": 0.1299786426126957, "num_tokens": 2429983.0, "step": 1400 }, { "entropy": 6.366431760787964, "epoch": 0.10931725345263567, "grad_norm": 1.078125, "learning_rate": 0.0004999888556484172, "loss": 6.3893, "mean_token_accuracy": 0.11359420493245125, "num_tokens": 2439206.0, "step": 1405 }, { "entropy": 6.271417093276978, "epoch": 0.10970628282435324, "grad_norm": 1.0625, "learning_rate": 0.0004999885780934845, "loss": 6.3147, "mean_token_accuracy": 0.13233309537172316, "num_tokens": 2448801.0, "step": 1410 }, { "entropy": 6.330869722366333, "epoch": 0.1100953121960708, "grad_norm": 1.1796875, "learning_rate": 0.0004999882971247081, "loss": 6.3539, "mean_token_accuracy": 0.12248845249414445, "num_tokens": 2458007.0, "step": 1415 }, { "entropy": 6.32300910949707, "epoch": 0.11048434156778837, "grad_norm": 1.1796875, "learning_rate": 0.0004999880127420926, "loss": 6.2393, "mean_token_accuracy": 0.13286312147974969, "num_tokens": 2466574.0, "step": 1420 }, { "entropy": 6.4055665016174315, "epoch": 0.11087337093950593, "grad_norm": 1.046875, "learning_rate": 0.0004999877249456421, "loss": 6.3219, "mean_token_accuracy": 0.12253004312515259, "num_tokens": 2475263.0, "step": 1425 }, { "entropy": 6.054247617721558, "epoch": 0.1112624003112235, "grad_norm": 1.1328125, "learning_rate": 0.0004999874337353609, "loss": 6.0664, "mean_token_accuracy": 0.12846405506134034, "num_tokens": 2483738.0, "step": 1430 }, { "entropy": 6.2588417530059814, "epoch": 0.11165142968294106, "grad_norm": 1.109375, "learning_rate": 0.0004999871391112535, "loss": 6.187, "mean_token_accuracy": 0.1216193564236164, "num_tokens": 2492937.0, "step": 1435 }, { "entropy": 6.194214534759522, "epoch": 0.11204045905465862, "grad_norm": 1.171875, "learning_rate": 0.0004999868410733244, "loss": 6.2503, "mean_token_accuracy": 0.12336413487792015, "num_tokens": 2500716.0, "step": 1440 }, { "entropy": 6.254022169113159, "epoch": 0.11242948842637619, "grad_norm": 1.15625, "learning_rate": 0.000499986539621578, "loss": 6.2575, "mean_token_accuracy": 0.12012252137064934, "num_tokens": 2509385.0, "step": 1445 }, { "entropy": 6.420900154113769, "epoch": 0.11281851779809375, "grad_norm": 1.09375, "learning_rate": 0.0004999862347560191, "loss": 6.3259, "mean_token_accuracy": 0.11690858453512191, "num_tokens": 2518179.0, "step": 1450 }, { "entropy": 6.249479198455811, "epoch": 0.11320754716981132, "grad_norm": 1.1015625, "learning_rate": 0.0004999859264766521, "loss": 6.2585, "mean_token_accuracy": 0.12355490997433663, "num_tokens": 2526644.0, "step": 1455 }, { "entropy": 6.265651607513428, "epoch": 0.11359657654152888, "grad_norm": 1.1015625, "learning_rate": 0.0004999856147834817, "loss": 6.1782, "mean_token_accuracy": 0.12229724824428559, "num_tokens": 2534998.0, "step": 1460 }, { "entropy": 6.28430061340332, "epoch": 0.11398560591324645, "grad_norm": 1.0859375, "learning_rate": 0.0004999852996765129, "loss": 6.253, "mean_token_accuracy": 0.125435870885849, "num_tokens": 2543562.0, "step": 1465 }, { "entropy": 6.282908535003662, "epoch": 0.11437463528496401, "grad_norm": 1.09375, "learning_rate": 0.0004999849811557502, "loss": 6.2506, "mean_token_accuracy": 0.1216797761619091, "num_tokens": 2551688.0, "step": 1470 }, { "entropy": 6.275887537002563, "epoch": 0.11476366465668159, "grad_norm": 1.0390625, "learning_rate": 0.0004999846592211984, "loss": 6.3275, "mean_token_accuracy": 0.12465370073914528, "num_tokens": 2560227.0, "step": 1475 }, { "entropy": 6.321870994567871, "epoch": 0.11515269402839914, "grad_norm": 1.046875, "learning_rate": 0.0004999843338728626, "loss": 6.2034, "mean_token_accuracy": 0.12613042816519737, "num_tokens": 2569245.0, "step": 1480 }, { "entropy": 6.224797201156616, "epoch": 0.1155417234001167, "grad_norm": 1.15625, "learning_rate": 0.0004999840051107476, "loss": 6.223, "mean_token_accuracy": 0.1265519917011261, "num_tokens": 2577706.0, "step": 1485 }, { "entropy": 6.319393301010132, "epoch": 0.11593075277183428, "grad_norm": 1.1796875, "learning_rate": 0.0004999836729348584, "loss": 6.2579, "mean_token_accuracy": 0.12350616082549096, "num_tokens": 2586075.0, "step": 1490 }, { "entropy": 6.252358913421631, "epoch": 0.11631978214355183, "grad_norm": 1.0625, "learning_rate": 0.0004999833373452, "loss": 6.2734, "mean_token_accuracy": 0.12134807705879211, "num_tokens": 2594965.0, "step": 1495 }, { "entropy": 6.257946348190307, "epoch": 0.1167088115152694, "grad_norm": 1.15625, "learning_rate": 0.0004999829983417778, "loss": 6.1954, "mean_token_accuracy": 0.12667486742138861, "num_tokens": 2603355.0, "step": 1500 }, { "entropy": 6.317920351028443, "epoch": 0.11709784088698696, "grad_norm": 1.1015625, "learning_rate": 0.0004999826559245965, "loss": 6.3263, "mean_token_accuracy": 0.12176407799124718, "num_tokens": 2611697.0, "step": 1505 }, { "entropy": 6.24525089263916, "epoch": 0.11748687025870454, "grad_norm": 1.1015625, "learning_rate": 0.0004999823100936615, "loss": 6.1881, "mean_token_accuracy": 0.12955067977309226, "num_tokens": 2620821.0, "step": 1510 }, { "entropy": 6.2969574451446535, "epoch": 0.1178758996304221, "grad_norm": 1.1328125, "learning_rate": 0.0004999819608489781, "loss": 6.1926, "mean_token_accuracy": 0.1269972711801529, "num_tokens": 2628891.0, "step": 1515 }, { "entropy": 6.232346153259277, "epoch": 0.11826492900213967, "grad_norm": 1.0390625, "learning_rate": 0.0004999816081905515, "loss": 6.3299, "mean_token_accuracy": 0.12064500376582146, "num_tokens": 2638641.0, "step": 1520 }, { "entropy": 6.277464914321899, "epoch": 0.11865395837385723, "grad_norm": 1.1953125, "learning_rate": 0.0004999812521183872, "loss": 6.2218, "mean_token_accuracy": 0.12372512891888618, "num_tokens": 2646898.0, "step": 1525 }, { "entropy": 6.343517303466797, "epoch": 0.11904298774557479, "grad_norm": 1.15625, "learning_rate": 0.0004999808926324903, "loss": 6.2575, "mean_token_accuracy": 0.12216506227850914, "num_tokens": 2655404.0, "step": 1530 }, { "entropy": 6.174682712554931, "epoch": 0.11943201711729236, "grad_norm": 1.09375, "learning_rate": 0.0004999805297328665, "loss": 6.1524, "mean_token_accuracy": 0.1293441690504551, "num_tokens": 2663851.0, "step": 1535 }, { "entropy": 6.2491882801055905, "epoch": 0.11982104648900992, "grad_norm": 1.203125, "learning_rate": 0.0004999801634195214, "loss": 6.1957, "mean_token_accuracy": 0.12269230708479881, "num_tokens": 2672231.0, "step": 1540 }, { "entropy": 6.198257303237915, "epoch": 0.12021007586072749, "grad_norm": 1.1328125, "learning_rate": 0.0004999797936924603, "loss": 6.209, "mean_token_accuracy": 0.12302690893411636, "num_tokens": 2680198.0, "step": 1545 }, { "entropy": 6.30586805343628, "epoch": 0.12059910523244505, "grad_norm": 1.0234375, "learning_rate": 0.000499979420551689, "loss": 6.2377, "mean_token_accuracy": 0.12162458598613739, "num_tokens": 2689208.0, "step": 1550 }, { "entropy": 6.306586265563965, "epoch": 0.12098813460416262, "grad_norm": 1.0859375, "learning_rate": 0.000499979043997213, "loss": 6.2899, "mean_token_accuracy": 0.11871301680803299, "num_tokens": 2698116.0, "step": 1555 }, { "entropy": 6.267044591903686, "epoch": 0.12137716397588018, "grad_norm": 1.109375, "learning_rate": 0.0004999786640290381, "loss": 6.1975, "mean_token_accuracy": 0.11922681853175163, "num_tokens": 2707046.0, "step": 1560 }, { "entropy": 6.23398265838623, "epoch": 0.12176619334759774, "grad_norm": 1.0625, "learning_rate": 0.0004999782806471701, "loss": 6.192, "mean_token_accuracy": 0.1261439874768257, "num_tokens": 2714929.0, "step": 1565 }, { "entropy": 6.2020190238952635, "epoch": 0.12215522271931531, "grad_norm": 1.1484375, "learning_rate": 0.0004999778938516147, "loss": 6.2158, "mean_token_accuracy": 0.1232543520629406, "num_tokens": 2723436.0, "step": 1570 }, { "entropy": 6.223355484008789, "epoch": 0.12254425209103287, "grad_norm": 1.1484375, "learning_rate": 0.000499977503642378, "loss": 6.266, "mean_token_accuracy": 0.12410560548305512, "num_tokens": 2731935.0, "step": 1575 }, { "entropy": 6.175629901885986, "epoch": 0.12293328146275044, "grad_norm": 1.0859375, "learning_rate": 0.0004999771100194656, "loss": 6.0801, "mean_token_accuracy": 0.13136413991451262, "num_tokens": 2740307.0, "step": 1580 }, { "entropy": 6.136730718612671, "epoch": 0.123322310834468, "grad_norm": 1.140625, "learning_rate": 0.0004999767129828837, "loss": 6.0848, "mean_token_accuracy": 0.13186190873384476, "num_tokens": 2749077.0, "step": 1585 }, { "entropy": 6.22774748802185, "epoch": 0.12371134020618557, "grad_norm": 1.140625, "learning_rate": 0.0004999763125326383, "loss": 6.2122, "mean_token_accuracy": 0.1224086344242096, "num_tokens": 2758133.0, "step": 1590 }, { "entropy": 6.179558944702149, "epoch": 0.12410036957790313, "grad_norm": 1.1484375, "learning_rate": 0.0004999759086687355, "loss": 6.1341, "mean_token_accuracy": 0.1290878973901272, "num_tokens": 2766509.0, "step": 1595 }, { "entropy": 6.1690037727355955, "epoch": 0.1244893989496207, "grad_norm": 1.0859375, "learning_rate": 0.0004999755013911813, "loss": 6.308, "mean_token_accuracy": 0.12781446427106857, "num_tokens": 2775908.0, "step": 1600 }, { "entropy": 6.2387913227081295, "epoch": 0.12487842832133826, "grad_norm": 1.125, "learning_rate": 0.000499975090699982, "loss": 6.0694, "mean_token_accuracy": 0.13497328236699105, "num_tokens": 2784803.0, "step": 1605 }, { "entropy": 6.248407363891602, "epoch": 0.12526745769305583, "grad_norm": 1.09375, "learning_rate": 0.0004999746765951438, "loss": 6.2272, "mean_token_accuracy": 0.12323559522628784, "num_tokens": 2793897.0, "step": 1610 }, { "entropy": 6.144442796707153, "epoch": 0.1256564870647734, "grad_norm": 1.2109375, "learning_rate": 0.0004999742590766729, "loss": 6.0709, "mean_token_accuracy": 0.12970903664827346, "num_tokens": 2802652.0, "step": 1615 }, { "entropy": 6.195466232299805, "epoch": 0.12604551643649095, "grad_norm": 1.1328125, "learning_rate": 0.0004999738381445757, "loss": 6.2156, "mean_token_accuracy": 0.12098970115184784, "num_tokens": 2811527.0, "step": 1620 }, { "entropy": 6.168512582778931, "epoch": 0.1264345458082085, "grad_norm": 1.1796875, "learning_rate": 0.0004999734137988586, "loss": 6.0632, "mean_token_accuracy": 0.13398998901247977, "num_tokens": 2819410.0, "step": 1625 }, { "entropy": 6.040783309936524, "epoch": 0.1268235751799261, "grad_norm": 1.0625, "learning_rate": 0.000499972986039528, "loss": 6.0735, "mean_token_accuracy": 0.1366802491247654, "num_tokens": 2828079.0, "step": 1630 }, { "entropy": 6.200006103515625, "epoch": 0.12721260455164365, "grad_norm": 1.1171875, "learning_rate": 0.0004999725548665904, "loss": 6.1926, "mean_token_accuracy": 0.13287901505827904, "num_tokens": 2836326.0, "step": 1635 }, { "entropy": 6.217862844467163, "epoch": 0.1276016339233612, "grad_norm": 1.1875, "learning_rate": 0.0004999721202800524, "loss": 6.2434, "mean_token_accuracy": 0.12198355495929718, "num_tokens": 2845271.0, "step": 1640 }, { "entropy": 6.14015941619873, "epoch": 0.12799066329507877, "grad_norm": 1.0546875, "learning_rate": 0.0004999716822799206, "loss": 6.1008, "mean_token_accuracy": 0.13585591837763786, "num_tokens": 2853688.0, "step": 1645 }, { "entropy": 6.2203113555908205, "epoch": 0.12837969266679633, "grad_norm": 1.1015625, "learning_rate": 0.0004999712408662016, "loss": 6.1861, "mean_token_accuracy": 0.13381585478782654, "num_tokens": 2862261.0, "step": 1650 }, { "entropy": 6.182382297515869, "epoch": 0.12876872203851392, "grad_norm": 1.0546875, "learning_rate": 0.0004999707960389021, "loss": 6.1977, "mean_token_accuracy": 0.12676158770918847, "num_tokens": 2871324.0, "step": 1655 }, { "entropy": 6.26635627746582, "epoch": 0.12915775141023147, "grad_norm": 1.171875, "learning_rate": 0.0004999703477980288, "loss": 6.2583, "mean_token_accuracy": 0.11872835904359817, "num_tokens": 2880268.0, "step": 1660 }, { "entropy": 6.208874273300171, "epoch": 0.12954678078194903, "grad_norm": 1.171875, "learning_rate": 0.0004999698961435885, "loss": 6.1612, "mean_token_accuracy": 0.12779268771409988, "num_tokens": 2888510.0, "step": 1665 }, { "entropy": 6.200055122375488, "epoch": 0.1299358101536666, "grad_norm": 1.09375, "learning_rate": 0.0004999694410755882, "loss": 6.07, "mean_token_accuracy": 0.13593013808131219, "num_tokens": 2897616.0, "step": 1670 }, { "entropy": 6.106130218505859, "epoch": 0.13032483952538418, "grad_norm": 1.09375, "learning_rate": 0.0004999689825940347, "loss": 6.166, "mean_token_accuracy": 0.13071656748652458, "num_tokens": 2905703.0, "step": 1675 }, { "entropy": 6.1497344970703125, "epoch": 0.13071386889710174, "grad_norm": 1.109375, "learning_rate": 0.0004999685206989349, "loss": 6.0503, "mean_token_accuracy": 0.13300523832440375, "num_tokens": 2914881.0, "step": 1680 }, { "entropy": 6.064972543716431, "epoch": 0.1311028982688193, "grad_norm": 1.078125, "learning_rate": 0.0004999680553902959, "loss": 6.111, "mean_token_accuracy": 0.13151929527521133, "num_tokens": 2923563.0, "step": 1685 }, { "entropy": 6.2831262111663815, "epoch": 0.13149192764053685, "grad_norm": 1.015625, "learning_rate": 0.0004999675866681247, "loss": 6.3242, "mean_token_accuracy": 0.12403198331594467, "num_tokens": 2932821.0, "step": 1690 }, { "entropy": 6.244329929351807, "epoch": 0.1318809570122544, "grad_norm": 1.109375, "learning_rate": 0.0004999671145324286, "loss": 6.2049, "mean_token_accuracy": 0.12842011004686354, "num_tokens": 2940926.0, "step": 1695 }, { "entropy": 6.194862365722656, "epoch": 0.132269986383972, "grad_norm": 1.0390625, "learning_rate": 0.0004999666389832144, "loss": 6.1331, "mean_token_accuracy": 0.13136012181639672, "num_tokens": 2950028.0, "step": 1700 }, { "entropy": 6.151176118850708, "epoch": 0.13265901575568956, "grad_norm": 1.1328125, "learning_rate": 0.0004999661600204897, "loss": 6.1368, "mean_token_accuracy": 0.13054827898740767, "num_tokens": 2957636.0, "step": 1705 }, { "entropy": 6.0364806175231935, "epoch": 0.13304804512740712, "grad_norm": 1.0859375, "learning_rate": 0.0004999656776442615, "loss": 5.9255, "mean_token_accuracy": 0.1334216207265854, "num_tokens": 2966544.0, "step": 1710 }, { "entropy": 6.1242743015289305, "epoch": 0.13343707449912467, "grad_norm": 1.03125, "learning_rate": 0.0004999651918545372, "loss": 6.1605, "mean_token_accuracy": 0.12257000207901, "num_tokens": 2976236.0, "step": 1715 }, { "entropy": 6.152473640441895, "epoch": 0.13382610387084226, "grad_norm": 1.171875, "learning_rate": 0.0004999647026513243, "loss": 6.1172, "mean_token_accuracy": 0.13368836417794228, "num_tokens": 2984261.0, "step": 1720 }, { "entropy": 6.08830189704895, "epoch": 0.13421513324255982, "grad_norm": 1.078125, "learning_rate": 0.00049996421003463, "loss": 6.0843, "mean_token_accuracy": 0.12732574567198754, "num_tokens": 2992970.0, "step": 1725 }, { "entropy": 6.202375268936157, "epoch": 0.13460416261427738, "grad_norm": 1.171875, "learning_rate": 0.0004999637140044619, "loss": 6.1223, "mean_token_accuracy": 0.13581531047821044, "num_tokens": 3001356.0, "step": 1730 }, { "entropy": 6.075127840042114, "epoch": 0.13499319198599494, "grad_norm": 1.078125, "learning_rate": 0.0004999632145608275, "loss": 6.1247, "mean_token_accuracy": 0.13326116278767586, "num_tokens": 3009509.0, "step": 1735 }, { "entropy": 6.151353645324707, "epoch": 0.1353822213577125, "grad_norm": 1.0625, "learning_rate": 0.0004999627117037343, "loss": 6.1486, "mean_token_accuracy": 0.1305352844297886, "num_tokens": 3017675.0, "step": 1740 }, { "entropy": 6.159458446502685, "epoch": 0.13577125072943008, "grad_norm": 1.1953125, "learning_rate": 0.00049996220543319, "loss": 6.1111, "mean_token_accuracy": 0.13545044139027596, "num_tokens": 3025527.0, "step": 1745 }, { "entropy": 6.122771835327148, "epoch": 0.13616028010114764, "grad_norm": 1.2265625, "learning_rate": 0.0004999616957492025, "loss": 6.0723, "mean_token_accuracy": 0.13396283537149428, "num_tokens": 3034251.0, "step": 1750 }, { "entropy": 6.054795837402343, "epoch": 0.1365493094728652, "grad_norm": 1.109375, "learning_rate": 0.0004999611826517793, "loss": 6.3029, "mean_token_accuracy": 0.12316446378827095, "num_tokens": 3043272.0, "step": 1755 }, { "entropy": 6.303162145614624, "epoch": 0.13693833884458276, "grad_norm": 1.1015625, "learning_rate": 0.0004999606661409281, "loss": 6.1523, "mean_token_accuracy": 0.1299624763429165, "num_tokens": 3051092.0, "step": 1760 }, { "entropy": 6.103368616104126, "epoch": 0.13732736821630034, "grad_norm": 1.1328125, "learning_rate": 0.0004999601462166569, "loss": 6.1178, "mean_token_accuracy": 0.12677409127354622, "num_tokens": 3060584.0, "step": 1765 }, { "entropy": 6.161142778396607, "epoch": 0.1377163975880179, "grad_norm": 1.125, "learning_rate": 0.0004999596228789736, "loss": 6.1185, "mean_token_accuracy": 0.13394217044115067, "num_tokens": 3069990.0, "step": 1770 }, { "entropy": 6.1580225944519045, "epoch": 0.13810542695973546, "grad_norm": 1.0390625, "learning_rate": 0.0004999590961278859, "loss": 6.0852, "mean_token_accuracy": 0.12508078217506408, "num_tokens": 3078837.0, "step": 1775 }, { "entropy": 6.0550312995910645, "epoch": 0.13849445633145302, "grad_norm": 1.125, "learning_rate": 0.0004999585659634021, "loss": 6.0777, "mean_token_accuracy": 0.1352244459092617, "num_tokens": 3087557.0, "step": 1780 }, { "entropy": 6.0994940280914305, "epoch": 0.13888348570317058, "grad_norm": 1.125, "learning_rate": 0.0004999580323855301, "loss": 6.1028, "mean_token_accuracy": 0.12971555292606354, "num_tokens": 3096524.0, "step": 1785 }, { "entropy": 6.242001056671143, "epoch": 0.13927251507488816, "grad_norm": 1.109375, "learning_rate": 0.0004999574953942781, "loss": 6.164, "mean_token_accuracy": 0.12785928025841714, "num_tokens": 3105271.0, "step": 1790 }, { "entropy": 6.110553503036499, "epoch": 0.13966154444660572, "grad_norm": 1.1015625, "learning_rate": 0.0004999569549896541, "loss": 6.071, "mean_token_accuracy": 0.12340522482991219, "num_tokens": 3114479.0, "step": 1795 }, { "entropy": 6.123258876800537, "epoch": 0.14005057381832328, "grad_norm": 1.09375, "learning_rate": 0.0004999564111716665, "loss": 6.0558, "mean_token_accuracy": 0.14115509390830994, "num_tokens": 3123319.0, "step": 1800 }, { "entropy": 6.0733929634094235, "epoch": 0.14043960319004084, "grad_norm": 1.015625, "learning_rate": 0.0004999558639403232, "loss": 6.0825, "mean_token_accuracy": 0.13198988437652587, "num_tokens": 3132532.0, "step": 1805 }, { "entropy": 6.229814195632935, "epoch": 0.1408286325617584, "grad_norm": 1.1328125, "learning_rate": 0.0004999553132956328, "loss": 6.1592, "mean_token_accuracy": 0.12872777804732322, "num_tokens": 3140798.0, "step": 1810 }, { "entropy": 6.103444957733155, "epoch": 0.14121766193347599, "grad_norm": 1.140625, "learning_rate": 0.0004999547592376035, "loss": 6.1475, "mean_token_accuracy": 0.13363951444625854, "num_tokens": 3149607.0, "step": 1815 }, { "entropy": 6.03386869430542, "epoch": 0.14160669130519354, "grad_norm": 1.15625, "learning_rate": 0.0004999542017662438, "loss": 5.9717, "mean_token_accuracy": 0.13687212467193605, "num_tokens": 3157537.0, "step": 1820 }, { "entropy": 6.089433431625366, "epoch": 0.1419957206769111, "grad_norm": 1.2109375, "learning_rate": 0.0004999536408815623, "loss": 6.1376, "mean_token_accuracy": 0.12610816434025765, "num_tokens": 3166351.0, "step": 1825 }, { "entropy": 6.060422134399414, "epoch": 0.14238475004862866, "grad_norm": 1.1484375, "learning_rate": 0.0004999530765835672, "loss": 5.9849, "mean_token_accuracy": 0.13618941605091095, "num_tokens": 3174690.0, "step": 1830 }, { "entropy": 6.075569534301758, "epoch": 0.14277377942034625, "grad_norm": 1.1171875, "learning_rate": 0.0004999525088722673, "loss": 6.1061, "mean_token_accuracy": 0.1265280582010746, "num_tokens": 3183460.0, "step": 1835 }, { "entropy": 6.1444073677062985, "epoch": 0.1431628087920638, "grad_norm": 1.0546875, "learning_rate": 0.0004999519377476711, "loss": 6.0722, "mean_token_accuracy": 0.1317371055483818, "num_tokens": 3192183.0, "step": 1840 }, { "entropy": 6.090657949447632, "epoch": 0.14355183816378136, "grad_norm": 1.109375, "learning_rate": 0.0004999513632097872, "loss": 6.1671, "mean_token_accuracy": 0.13313975185155869, "num_tokens": 3200875.0, "step": 1845 }, { "entropy": 6.174860572814941, "epoch": 0.14394086753549892, "grad_norm": 1.1015625, "learning_rate": 0.0004999507852586245, "loss": 6.0212, "mean_token_accuracy": 0.13179150596261024, "num_tokens": 3209797.0, "step": 1850 }, { "entropy": 6.107384920120239, "epoch": 0.14432989690721648, "grad_norm": 1.1484375, "learning_rate": 0.0004999502038941917, "loss": 6.1357, "mean_token_accuracy": 0.126478423923254, "num_tokens": 3218612.0, "step": 1855 }, { "entropy": 6.0968400001525875, "epoch": 0.14471892627893407, "grad_norm": 1.15625, "learning_rate": 0.0004999496191164975, "loss": 6.0554, "mean_token_accuracy": 0.1293291188776493, "num_tokens": 3227364.0, "step": 1860 }, { "entropy": 6.112162446975708, "epoch": 0.14510795565065163, "grad_norm": 1.1015625, "learning_rate": 0.000499949030925551, "loss": 6.0761, "mean_token_accuracy": 0.12927125319838523, "num_tokens": 3236448.0, "step": 1865 }, { "entropy": 6.098051738739014, "epoch": 0.14549698502236919, "grad_norm": 1.1640625, "learning_rate": 0.0004999484393213609, "loss": 6.012, "mean_token_accuracy": 0.13607736453413963, "num_tokens": 3244957.0, "step": 1870 }, { "entropy": 6.022885847091675, "epoch": 0.14588601439408674, "grad_norm": 1.1484375, "learning_rate": 0.0004999478443039363, "loss": 6.1038, "mean_token_accuracy": 0.12877627462148666, "num_tokens": 3253250.0, "step": 1875 }, { "entropy": 6.15300350189209, "epoch": 0.14627504376580433, "grad_norm": 1.1640625, "learning_rate": 0.0004999472458732862, "loss": 5.9976, "mean_token_accuracy": 0.14316268488764763, "num_tokens": 3261455.0, "step": 1880 }, { "entropy": 6.0133215427398685, "epoch": 0.1466640731375219, "grad_norm": 1.1484375, "learning_rate": 0.0004999466440294198, "loss": 6.0574, "mean_token_accuracy": 0.13383367732167245, "num_tokens": 3270108.0, "step": 1885 }, { "entropy": 6.168636178970337, "epoch": 0.14705310250923945, "grad_norm": 1.1328125, "learning_rate": 0.000499946038772346, "loss": 6.1715, "mean_token_accuracy": 0.12984701097011567, "num_tokens": 3278425.0, "step": 1890 }, { "entropy": 6.1114959716796875, "epoch": 0.147442131880957, "grad_norm": 1.046875, "learning_rate": 0.0004999454301020741, "loss": 6.1128, "mean_token_accuracy": 0.12607192546129226, "num_tokens": 3288358.0, "step": 1895 }, { "entropy": 6.106830310821533, "epoch": 0.14783116125267456, "grad_norm": 1.2109375, "learning_rate": 0.0004999448180186133, "loss": 6.1045, "mean_token_accuracy": 0.12614032998681068, "num_tokens": 3297199.0, "step": 1900 }, { "entropy": 6.098498821258545, "epoch": 0.14822019062439215, "grad_norm": 1.09375, "learning_rate": 0.000499944202521973, "loss": 6.1129, "mean_token_accuracy": 0.12640552148222922, "num_tokens": 3306350.0, "step": 1905 }, { "entropy": 6.05791392326355, "epoch": 0.1486092199961097, "grad_norm": 1.09375, "learning_rate": 0.0004999435836121624, "loss": 5.9412, "mean_token_accuracy": 0.13614155799150468, "num_tokens": 3314921.0, "step": 1910 }, { "entropy": 5.942939949035645, "epoch": 0.14899824936782727, "grad_norm": 1.1875, "learning_rate": 0.000499942961289191, "loss": 6.0897, "mean_token_accuracy": 0.13519461452960968, "num_tokens": 3323324.0, "step": 1915 }, { "entropy": 6.268859624862671, "epoch": 0.14938727873954483, "grad_norm": 1.203125, "learning_rate": 0.0004999423355530683, "loss": 6.2168, "mean_token_accuracy": 0.12899630516767502, "num_tokens": 3331614.0, "step": 1920 }, { "entropy": 6.068661069869995, "epoch": 0.1497763081112624, "grad_norm": 1.21875, "learning_rate": 0.0004999417064038035, "loss": 6.048, "mean_token_accuracy": 0.13625814467668534, "num_tokens": 3339573.0, "step": 1925 }, { "entropy": 6.113537693023682, "epoch": 0.15016533748297997, "grad_norm": 1.15625, "learning_rate": 0.0004999410738414065, "loss": 6.019, "mean_token_accuracy": 0.13822999522089957, "num_tokens": 3347775.0, "step": 1930 }, { "entropy": 6.026789045333862, "epoch": 0.15055436685469753, "grad_norm": 1.140625, "learning_rate": 0.0004999404378658866, "loss": 5.9738, "mean_token_accuracy": 0.13702433034777642, "num_tokens": 3356947.0, "step": 1935 }, { "entropy": 6.101319646835327, "epoch": 0.1509433962264151, "grad_norm": 1.1328125, "learning_rate": 0.0004999397984772536, "loss": 6.067, "mean_token_accuracy": 0.1303373880684376, "num_tokens": 3365420.0, "step": 1940 }, { "entropy": 6.0900736331939695, "epoch": 0.15133242559813265, "grad_norm": 1.15625, "learning_rate": 0.0004999391556755172, "loss": 6.1591, "mean_token_accuracy": 0.12977703511714936, "num_tokens": 3373483.0, "step": 1945 }, { "entropy": 6.1492267608642575, "epoch": 0.15172145496985023, "grad_norm": 0.9921875, "learning_rate": 0.0004999385094606872, "loss": 6.1473, "mean_token_accuracy": 0.12746963351964952, "num_tokens": 3382557.0, "step": 1950 }, { "entropy": 6.168496370315552, "epoch": 0.1521104843415678, "grad_norm": 1.1015625, "learning_rate": 0.0004999378598327733, "loss": 6.0838, "mean_token_accuracy": 0.12692655250430107, "num_tokens": 3392079.0, "step": 1955 }, { "entropy": 6.093343210220337, "epoch": 0.15249951371328535, "grad_norm": 1.078125, "learning_rate": 0.0004999372067917854, "loss": 6.1531, "mean_token_accuracy": 0.13067096173763276, "num_tokens": 3401070.0, "step": 1960 }, { "entropy": 6.078389596939087, "epoch": 0.1528885430850029, "grad_norm": 1.046875, "learning_rate": 0.0004999365503377335, "loss": 6.0271, "mean_token_accuracy": 0.1348519966006279, "num_tokens": 3409921.0, "step": 1965 }, { "entropy": 6.104602289199829, "epoch": 0.1532775724567205, "grad_norm": 1.1484375, "learning_rate": 0.0004999358904706273, "loss": 6.0616, "mean_token_accuracy": 0.1285829097032547, "num_tokens": 3419149.0, "step": 1970 }, { "entropy": 6.030079126358032, "epoch": 0.15366660182843805, "grad_norm": 1.2109375, "learning_rate": 0.0004999352271904771, "loss": 5.9462, "mean_token_accuracy": 0.13964028134942055, "num_tokens": 3427435.0, "step": 1975 }, { "entropy": 6.123502540588379, "epoch": 0.1540556312001556, "grad_norm": 1.1796875, "learning_rate": 0.0004999345604972928, "loss": 6.1541, "mean_token_accuracy": 0.12671427205204963, "num_tokens": 3436377.0, "step": 1980 }, { "entropy": 6.069276142120361, "epoch": 0.15444466057187317, "grad_norm": 1.1015625, "learning_rate": 0.0004999338903910846, "loss": 6.0279, "mean_token_accuracy": 0.13194865062832833, "num_tokens": 3444997.0, "step": 1985 }, { "entropy": 6.103115558624268, "epoch": 0.15483368994359073, "grad_norm": 1.1640625, "learning_rate": 0.0004999332168718626, "loss": 6.104, "mean_token_accuracy": 0.1315036803483963, "num_tokens": 3454254.0, "step": 1990 }, { "entropy": 6.131479167938233, "epoch": 0.15522271931530832, "grad_norm": 1.2265625, "learning_rate": 0.0004999325399396371, "loss": 6.0603, "mean_token_accuracy": 0.1318090170621872, "num_tokens": 3462853.0, "step": 1995 }, { "entropy": 5.984948539733887, "epoch": 0.15561174868702587, "grad_norm": 1.125, "learning_rate": 0.0004999318595944183, "loss": 6.0059, "mean_token_accuracy": 0.13085325956344604, "num_tokens": 3471288.0, "step": 2000 }, { "entropy": 5.977605199813842, "epoch": 0.15600077805874343, "grad_norm": 1.203125, "learning_rate": 0.0004999311758362166, "loss": 5.9, "mean_token_accuracy": 0.1340898171067238, "num_tokens": 3479479.0, "step": 2005 }, { "entropy": 6.000810623168945, "epoch": 0.156389807430461, "grad_norm": 1.1171875, "learning_rate": 0.0004999304886650422, "loss": 5.9227, "mean_token_accuracy": 0.13736169710755347, "num_tokens": 3488621.0, "step": 2010 }, { "entropy": 6.011513090133667, "epoch": 0.15677883680217858, "grad_norm": 1.140625, "learning_rate": 0.0004999297980809058, "loss": 5.9912, "mean_token_accuracy": 0.1385435238480568, "num_tokens": 3497792.0, "step": 2015 }, { "entropy": 5.96446213722229, "epoch": 0.15716786617389614, "grad_norm": 1.2109375, "learning_rate": 0.0004999291040838176, "loss": 5.9932, "mean_token_accuracy": 0.13427436128258705, "num_tokens": 3506548.0, "step": 2020 }, { "entropy": 6.073589420318603, "epoch": 0.1575568955456137, "grad_norm": 1.109375, "learning_rate": 0.0004999284066737884, "loss": 5.9874, "mean_token_accuracy": 0.14162887558341025, "num_tokens": 3515086.0, "step": 2025 }, { "entropy": 6.079417896270752, "epoch": 0.15794592491733125, "grad_norm": 1.1484375, "learning_rate": 0.0004999277058508285, "loss": 6.025, "mean_token_accuracy": 0.13054124414920806, "num_tokens": 3523985.0, "step": 2030 }, { "entropy": 6.108053159713745, "epoch": 0.1583349542890488, "grad_norm": 1.140625, "learning_rate": 0.0004999270016149486, "loss": 6.1046, "mean_token_accuracy": 0.1336774356663227, "num_tokens": 3532575.0, "step": 2035 }, { "entropy": 6.097129058837891, "epoch": 0.1587239836607664, "grad_norm": 1.125, "learning_rate": 0.0004999262939661596, "loss": 6.0793, "mean_token_accuracy": 0.13377865329384803, "num_tokens": 3541558.0, "step": 2040 }, { "entropy": 6.012680435180664, "epoch": 0.15911301303248396, "grad_norm": 1.1171875, "learning_rate": 0.0004999255829044721, "loss": 5.9951, "mean_token_accuracy": 0.1400863155722618, "num_tokens": 3549697.0, "step": 2045 }, { "entropy": 6.0912693500518795, "epoch": 0.15950204240420152, "grad_norm": 1.0703125, "learning_rate": 0.0004999248684298968, "loss": 6.1595, "mean_token_accuracy": 0.12602965235710145, "num_tokens": 3558673.0, "step": 2050 }, { "entropy": 6.175625467300415, "epoch": 0.15989107177591907, "grad_norm": 1.1640625, "learning_rate": 0.0004999241505424447, "loss": 6.022, "mean_token_accuracy": 0.13359369337558746, "num_tokens": 3567176.0, "step": 2055 }, { "entropy": 6.115584897994995, "epoch": 0.16028010114763663, "grad_norm": 1.15625, "learning_rate": 0.0004999234292421265, "loss": 6.1588, "mean_token_accuracy": 0.12792168632149697, "num_tokens": 3576020.0, "step": 2060 }, { "entropy": 6.0277955532073975, "epoch": 0.16066913051935422, "grad_norm": 1.203125, "learning_rate": 0.0004999227045289535, "loss": 5.983, "mean_token_accuracy": 0.13384223580360413, "num_tokens": 3584705.0, "step": 2065 }, { "entropy": 6.09326057434082, "epoch": 0.16105815989107178, "grad_norm": 1.15625, "learning_rate": 0.0004999219764029363, "loss": 6.1786, "mean_token_accuracy": 0.12971396073698999, "num_tokens": 3593339.0, "step": 2070 }, { "entropy": 6.074710321426392, "epoch": 0.16144718926278934, "grad_norm": 1.09375, "learning_rate": 0.0004999212448640861, "loss": 5.9169, "mean_token_accuracy": 0.14326073378324508, "num_tokens": 3601206.0, "step": 2075 }, { "entropy": 5.917049407958984, "epoch": 0.1618362186345069, "grad_norm": 1.0703125, "learning_rate": 0.0004999205099124141, "loss": 6.0137, "mean_token_accuracy": 0.1296630918979645, "num_tokens": 3610371.0, "step": 2080 }, { "entropy": 6.166858434677124, "epoch": 0.16222524800622448, "grad_norm": 1.1640625, "learning_rate": 0.0004999197715479313, "loss": 6.0274, "mean_token_accuracy": 0.13334443271160126, "num_tokens": 3618834.0, "step": 2085 }, { "entropy": 5.907374048233033, "epoch": 0.16261427737794204, "grad_norm": 1.140625, "learning_rate": 0.0004999190297706489, "loss": 6.0599, "mean_token_accuracy": 0.1330284595489502, "num_tokens": 3627426.0, "step": 2090 }, { "entropy": 6.1726648807525635, "epoch": 0.1630033067496596, "grad_norm": 1.234375, "learning_rate": 0.0004999182845805783, "loss": 6.0783, "mean_token_accuracy": 0.1352132059633732, "num_tokens": 3636020.0, "step": 2095 }, { "entropy": 6.094464588165283, "epoch": 0.16339233612137716, "grad_norm": 1.140625, "learning_rate": 0.0004999175359777306, "loss": 6.0024, "mean_token_accuracy": 0.13878497257828712, "num_tokens": 3644419.0, "step": 2100 }, { "entropy": 5.983648729324341, "epoch": 0.16378136549309472, "grad_norm": 1.15625, "learning_rate": 0.0004999167839621174, "loss": 6.1132, "mean_token_accuracy": 0.12433986812829971, "num_tokens": 3653223.0, "step": 2105 }, { "entropy": 6.119035482406616, "epoch": 0.1641703948648123, "grad_norm": 1.0625, "learning_rate": 0.0004999160285337501, "loss": 6.1165, "mean_token_accuracy": 0.12628517150878907, "num_tokens": 3662409.0, "step": 2110 }, { "entropy": 6.122584199905395, "epoch": 0.16455942423652986, "grad_norm": 1.265625, "learning_rate": 0.0004999152696926399, "loss": 6.0838, "mean_token_accuracy": 0.12654283344745637, "num_tokens": 3670635.0, "step": 2115 }, { "entropy": 5.966174030303955, "epoch": 0.16494845360824742, "grad_norm": 1.0390625, "learning_rate": 0.0004999145074387985, "loss": 6.0089, "mean_token_accuracy": 0.14118071272969246, "num_tokens": 3679303.0, "step": 2120 }, { "entropy": 6.192105531692505, "epoch": 0.16533748297996498, "grad_norm": 1.0859375, "learning_rate": 0.0004999137417722374, "loss": 6.1857, "mean_token_accuracy": 0.1251898981630802, "num_tokens": 3689299.0, "step": 2125 }, { "entropy": 6.109566402435303, "epoch": 0.16572651235168256, "grad_norm": 1.0703125, "learning_rate": 0.0004999129726929684, "loss": 6.088, "mean_token_accuracy": 0.13834489807486533, "num_tokens": 3697843.0, "step": 2130 }, { "entropy": 6.1182887077331545, "epoch": 0.16611554172340012, "grad_norm": 1.1484375, "learning_rate": 0.0004999122002010029, "loss": 6.0233, "mean_token_accuracy": 0.1364858292043209, "num_tokens": 3705876.0, "step": 2135 }, { "entropy": 6.109085321426392, "epoch": 0.16650457109511768, "grad_norm": 1.1875, "learning_rate": 0.0004999114242963527, "loss": 6.1332, "mean_token_accuracy": 0.12421078756451606, "num_tokens": 3714835.0, "step": 2140 }, { "entropy": 6.028184270858764, "epoch": 0.16689360046683524, "grad_norm": 1.125, "learning_rate": 0.0004999106449790298, "loss": 5.9968, "mean_token_accuracy": 0.13307098522782326, "num_tokens": 3723421.0, "step": 2145 }, { "entropy": 6.027436256408691, "epoch": 0.1672826298385528, "grad_norm": 1.078125, "learning_rate": 0.0004999098622490458, "loss": 6.0106, "mean_token_accuracy": 0.13246056139469148, "num_tokens": 3731590.0, "step": 2150 }, { "entropy": 6.005514812469483, "epoch": 0.16767165921027039, "grad_norm": 1.1875, "learning_rate": 0.0004999090761064125, "loss": 5.9387, "mean_token_accuracy": 0.13851954340934752, "num_tokens": 3740700.0, "step": 2155 }, { "entropy": 6.0273407936096195, "epoch": 0.16806068858198794, "grad_norm": 1.0625, "learning_rate": 0.000499908286551142, "loss": 6.0128, "mean_token_accuracy": 0.1371268466114998, "num_tokens": 3749516.0, "step": 2160 }, { "entropy": 6.007265949249268, "epoch": 0.1684497179537055, "grad_norm": 1.1953125, "learning_rate": 0.0004999074935832463, "loss": 5.9506, "mean_token_accuracy": 0.14042013585567475, "num_tokens": 3757696.0, "step": 2165 }, { "entropy": 6.036279582977295, "epoch": 0.16883874732542306, "grad_norm": 1.109375, "learning_rate": 0.0004999066972027373, "loss": 6.0279, "mean_token_accuracy": 0.13567456975579262, "num_tokens": 3765786.0, "step": 2170 }, { "entropy": 5.970781230926514, "epoch": 0.16922777669714065, "grad_norm": 1.203125, "learning_rate": 0.0004999058974096271, "loss": 5.9077, "mean_token_accuracy": 0.1398158609867096, "num_tokens": 3773265.0, "step": 2175 }, { "entropy": 6.03927173614502, "epoch": 0.1696168060688582, "grad_norm": 1.140625, "learning_rate": 0.000499905094203928, "loss": 6.0607, "mean_token_accuracy": 0.13150161504745483, "num_tokens": 3782402.0, "step": 2180 }, { "entropy": 6.0491118907928465, "epoch": 0.17000583544057576, "grad_norm": 1.171875, "learning_rate": 0.000499904287585652, "loss": 6.1228, "mean_token_accuracy": 0.1305118791759014, "num_tokens": 3791901.0, "step": 2185 }, { "entropy": 6.073975229263306, "epoch": 0.17039486481229332, "grad_norm": 1.0546875, "learning_rate": 0.0004999034775548113, "loss": 5.9415, "mean_token_accuracy": 0.14102055951952935, "num_tokens": 3799872.0, "step": 2190 }, { "entropy": 5.967797756195068, "epoch": 0.17078389418401088, "grad_norm": 1.1484375, "learning_rate": 0.0004999026641114185, "loss": 5.8987, "mean_token_accuracy": 0.13859765678644181, "num_tokens": 3808949.0, "step": 2195 }, { "entropy": 6.072041463851929, "epoch": 0.17117292355572847, "grad_norm": 1.1953125, "learning_rate": 0.0004999018472554857, "loss": 6.0097, "mean_token_accuracy": 0.13413021862506866, "num_tokens": 3817429.0, "step": 2200 }, { "entropy": 6.208354568481445, "epoch": 0.17156195292744603, "grad_norm": 1.09375, "learning_rate": 0.0004999010269870253, "loss": 6.2949, "mean_token_accuracy": 0.12197455763816833, "num_tokens": 3827101.0, "step": 2205 }, { "entropy": 6.107734298706054, "epoch": 0.17195098229916359, "grad_norm": 1.0546875, "learning_rate": 0.0004999002033060498, "loss": 6.0075, "mean_token_accuracy": 0.1353926807641983, "num_tokens": 3836147.0, "step": 2210 }, { "entropy": 5.9734382152557375, "epoch": 0.17234001167088114, "grad_norm": 1.1796875, "learning_rate": 0.0004998993762125716, "loss": 6.0336, "mean_token_accuracy": 0.13586182668805122, "num_tokens": 3845300.0, "step": 2215 }, { "entropy": 6.102244281768799, "epoch": 0.17272904104259873, "grad_norm": 1.234375, "learning_rate": 0.0004998985457066034, "loss": 6.0182, "mean_token_accuracy": 0.1369253620505333, "num_tokens": 3853620.0, "step": 2220 }, { "entropy": 6.035351324081421, "epoch": 0.1731180704143163, "grad_norm": 1.1953125, "learning_rate": 0.0004998977117881576, "loss": 6.0209, "mean_token_accuracy": 0.13868235647678376, "num_tokens": 3861734.0, "step": 2225 }, { "entropy": 6.056541538238525, "epoch": 0.17350709978603385, "grad_norm": 1.140625, "learning_rate": 0.0004998968744572472, "loss": 6.0255, "mean_token_accuracy": 0.13340835496783257, "num_tokens": 3870753.0, "step": 2230 }, { "entropy": 6.01226224899292, "epoch": 0.1738961291577514, "grad_norm": 1.09375, "learning_rate": 0.0004998960337138845, "loss": 5.901, "mean_token_accuracy": 0.1386076405644417, "num_tokens": 3879382.0, "step": 2235 }, { "entropy": 6.042281532287598, "epoch": 0.17428515852946896, "grad_norm": 1.1328125, "learning_rate": 0.0004998951895580826, "loss": 6.0833, "mean_token_accuracy": 0.12960439622402192, "num_tokens": 3888417.0, "step": 2240 }, { "entropy": 6.019704818725586, "epoch": 0.17467418790118655, "grad_norm": 1.171875, "learning_rate": 0.0004998943419898542, "loss": 5.9544, "mean_token_accuracy": 0.13442030027508736, "num_tokens": 3897083.0, "step": 2245 }, { "entropy": 5.953819322586059, "epoch": 0.1750632172729041, "grad_norm": 1.1328125, "learning_rate": 0.0004998934910092119, "loss": 5.9233, "mean_token_accuracy": 0.13848119750618934, "num_tokens": 3905564.0, "step": 2250 }, { "entropy": 6.029740190505981, "epoch": 0.17545224664462167, "grad_norm": 1.140625, "learning_rate": 0.0004998926366161689, "loss": 6.0581, "mean_token_accuracy": 0.1252748928964138, "num_tokens": 3914896.0, "step": 2255 }, { "entropy": 6.078394889831543, "epoch": 0.17584127601633923, "grad_norm": 1.1796875, "learning_rate": 0.0004998917788107383, "loss": 6.0724, "mean_token_accuracy": 0.13376214429736139, "num_tokens": 3924151.0, "step": 2260 }, { "entropy": 6.082054328918457, "epoch": 0.17623030538805678, "grad_norm": 1.0859375, "learning_rate": 0.0004998909175929326, "loss": 6.0164, "mean_token_accuracy": 0.13435427844524384, "num_tokens": 3933163.0, "step": 2265 }, { "entropy": 6.003792142868042, "epoch": 0.17661933475977437, "grad_norm": 1.1875, "learning_rate": 0.0004998900529627653, "loss": 5.9297, "mean_token_accuracy": 0.13886286765336991, "num_tokens": 3941120.0, "step": 2270 }, { "entropy": 5.892064476013184, "epoch": 0.17700836413149193, "grad_norm": 1.1328125, "learning_rate": 0.0004998891849202495, "loss": 5.8359, "mean_token_accuracy": 0.1366935320198536, "num_tokens": 3949896.0, "step": 2275 }, { "entropy": 6.072416210174561, "epoch": 0.1773973935032095, "grad_norm": 1.171875, "learning_rate": 0.000499888313465398, "loss": 5.974, "mean_token_accuracy": 0.14090991467237474, "num_tokens": 3958794.0, "step": 2280 }, { "entropy": 5.998848390579224, "epoch": 0.17778642287492705, "grad_norm": 1.1484375, "learning_rate": 0.0004998874385982247, "loss": 6.0345, "mean_token_accuracy": 0.1342969536781311, "num_tokens": 3967267.0, "step": 2285 }, { "entropy": 5.955915451049805, "epoch": 0.17817545224664463, "grad_norm": 1.1953125, "learning_rate": 0.0004998865603187421, "loss": 5.9559, "mean_token_accuracy": 0.1364803656935692, "num_tokens": 3976536.0, "step": 2290 }, { "entropy": 6.106266164779663, "epoch": 0.1785644816183622, "grad_norm": 1.0703125, "learning_rate": 0.000499885678626964, "loss": 6.022, "mean_token_accuracy": 0.1321044869720936, "num_tokens": 3986006.0, "step": 2295 }, { "entropy": 5.940597105026245, "epoch": 0.17895351099007975, "grad_norm": 1.1875, "learning_rate": 0.0004998847935229038, "loss": 5.9638, "mean_token_accuracy": 0.13107028752565383, "num_tokens": 3994478.0, "step": 2300 }, { "entropy": 6.0922130107879635, "epoch": 0.1793425403617973, "grad_norm": 1.0703125, "learning_rate": 0.0004998839050065746, "loss": 5.9898, "mean_token_accuracy": 0.13526349514722824, "num_tokens": 4003190.0, "step": 2305 }, { "entropy": 6.025421810150147, "epoch": 0.17973156973351487, "grad_norm": 1.0546875, "learning_rate": 0.0004998830130779902, "loss": 5.9347, "mean_token_accuracy": 0.13667116016149522, "num_tokens": 4011886.0, "step": 2310 }, { "entropy": 5.891482496261597, "epoch": 0.18012059910523245, "grad_norm": 1.109375, "learning_rate": 0.000499882117737164, "loss": 5.8326, "mean_token_accuracy": 0.13485828712582587, "num_tokens": 4020792.0, "step": 2315 }, { "entropy": 5.931954765319825, "epoch": 0.18050962847695, "grad_norm": 1.1484375, "learning_rate": 0.0004998812189841096, "loss": 5.8219, "mean_token_accuracy": 0.14047594219446183, "num_tokens": 4029235.0, "step": 2320 }, { "entropy": 5.931398057937622, "epoch": 0.18089865784866757, "grad_norm": 1.1875, "learning_rate": 0.0004998803168188407, "loss": 6.0385, "mean_token_accuracy": 0.13752583786845207, "num_tokens": 4037341.0, "step": 2325 }, { "entropy": 5.9774956703186035, "epoch": 0.18128768722038513, "grad_norm": 1.2265625, "learning_rate": 0.0004998794112413708, "loss": 5.9435, "mean_token_accuracy": 0.13515810221433638, "num_tokens": 4046324.0, "step": 2330 }, { "entropy": 5.988140821456909, "epoch": 0.18167671659210272, "grad_norm": 1.09375, "learning_rate": 0.0004998785022517137, "loss": 5.9935, "mean_token_accuracy": 0.13900482952594756, "num_tokens": 4054579.0, "step": 2335 }, { "entropy": 6.065921449661255, "epoch": 0.18206574596382027, "grad_norm": 1.234375, "learning_rate": 0.0004998775898498835, "loss": 5.9492, "mean_token_accuracy": 0.14194765612483023, "num_tokens": 4063087.0, "step": 2340 }, { "entropy": 6.072832870483398, "epoch": 0.18245477533553783, "grad_norm": 1.15625, "learning_rate": 0.0004998766740358936, "loss": 6.0289, "mean_token_accuracy": 0.13890346884727478, "num_tokens": 4072309.0, "step": 2345 }, { "entropy": 6.000887250900268, "epoch": 0.1828438047072554, "grad_norm": 1.0625, "learning_rate": 0.0004998757548097582, "loss": 6.0795, "mean_token_accuracy": 0.13404593393206596, "num_tokens": 4081017.0, "step": 2350 }, { "entropy": 6.056308937072754, "epoch": 0.18323283407897295, "grad_norm": 1.1796875, "learning_rate": 0.0004998748321714911, "loss": 6.083, "mean_token_accuracy": 0.13330470472574235, "num_tokens": 4089799.0, "step": 2355 }, { "entropy": 6.006195831298828, "epoch": 0.18362186345069054, "grad_norm": 1.234375, "learning_rate": 0.0004998739061211065, "loss": 6.0072, "mean_token_accuracy": 0.1390180394053459, "num_tokens": 4097948.0, "step": 2360 }, { "entropy": 6.019151639938355, "epoch": 0.1840108928224081, "grad_norm": 1.140625, "learning_rate": 0.0004998729766586181, "loss": 5.8641, "mean_token_accuracy": 0.13988614454865456, "num_tokens": 4107050.0, "step": 2365 }, { "entropy": 5.934751653671265, "epoch": 0.18439992219412565, "grad_norm": 1.1015625, "learning_rate": 0.0004998720437840403, "loss": 5.904, "mean_token_accuracy": 0.13505125269293786, "num_tokens": 4115547.0, "step": 2370 }, { "entropy": 5.9610343933105465, "epoch": 0.1847889515658432, "grad_norm": 1.140625, "learning_rate": 0.0004998711074973871, "loss": 5.9015, "mean_token_accuracy": 0.13932024538517, "num_tokens": 4124047.0, "step": 2375 }, { "entropy": 5.893201923370361, "epoch": 0.1851779809375608, "grad_norm": 1.125, "learning_rate": 0.0004998701677986728, "loss": 5.8559, "mean_token_accuracy": 0.1403021939098835, "num_tokens": 4132005.0, "step": 2380 }, { "entropy": 6.073483228683472, "epoch": 0.18556701030927836, "grad_norm": 1.171875, "learning_rate": 0.0004998692246879116, "loss": 6.0277, "mean_token_accuracy": 0.1299221158027649, "num_tokens": 4140199.0, "step": 2385 }, { "entropy": 5.97588005065918, "epoch": 0.18595603968099592, "grad_norm": 1.171875, "learning_rate": 0.0004998682781651178, "loss": 5.9748, "mean_token_accuracy": 0.1365482524037361, "num_tokens": 4149353.0, "step": 2390 }, { "entropy": 5.944373273849488, "epoch": 0.18634506905271347, "grad_norm": 1.125, "learning_rate": 0.0004998673282303059, "loss": 5.9579, "mean_token_accuracy": 0.13471838161349298, "num_tokens": 4158531.0, "step": 2395 }, { "entropy": 5.880623435974121, "epoch": 0.18673409842443103, "grad_norm": 1.109375, "learning_rate": 0.0004998663748834901, "loss": 5.7368, "mean_token_accuracy": 0.14892419204115867, "num_tokens": 4166743.0, "step": 2400 }, { "entropy": 6.018037462234497, "epoch": 0.18712312779614862, "grad_norm": 1.1640625, "learning_rate": 0.0004998654181246851, "loss": 6.1001, "mean_token_accuracy": 0.1294975347816944, "num_tokens": 4175416.0, "step": 2405 }, { "entropy": 6.046519470214844, "epoch": 0.18751215716786618, "grad_norm": 1.125, "learning_rate": 0.0004998644579539052, "loss": 6.0364, "mean_token_accuracy": 0.1348044417798519, "num_tokens": 4185324.0, "step": 2410 }, { "entropy": 5.996607494354248, "epoch": 0.18790118653958374, "grad_norm": 1.09375, "learning_rate": 0.000499863494371165, "loss": 5.9524, "mean_token_accuracy": 0.13784608691930772, "num_tokens": 4193361.0, "step": 2415 }, { "entropy": 6.035355854034424, "epoch": 0.1882902159113013, "grad_norm": 1.1171875, "learning_rate": 0.0004998625273764793, "loss": 6.0001, "mean_token_accuracy": 0.1302669644355774, "num_tokens": 4202553.0, "step": 2420 }, { "entropy": 5.929054594039917, "epoch": 0.18867924528301888, "grad_norm": 1.2109375, "learning_rate": 0.0004998615569698626, "loss": 5.9479, "mean_token_accuracy": 0.1433779552578926, "num_tokens": 4211585.0, "step": 2425 }, { "entropy": 6.020910692214966, "epoch": 0.18906827465473644, "grad_norm": 1.15625, "learning_rate": 0.0004998605831513296, "loss": 5.98, "mean_token_accuracy": 0.13211928457021713, "num_tokens": 4220829.0, "step": 2430 }, { "entropy": 5.951228189468384, "epoch": 0.189457304026454, "grad_norm": 1.1875, "learning_rate": 0.0004998596059208953, "loss": 5.8953, "mean_token_accuracy": 0.13831101283431052, "num_tokens": 4228658.0, "step": 2435 }, { "entropy": 5.926197052001953, "epoch": 0.18984633339817156, "grad_norm": 1.125, "learning_rate": 0.0004998586252785743, "loss": 5.9772, "mean_token_accuracy": 0.14194808825850486, "num_tokens": 4237650.0, "step": 2440 }, { "entropy": 6.0081957340240475, "epoch": 0.19023536276988912, "grad_norm": 1.140625, "learning_rate": 0.0004998576412243816, "loss": 5.9425, "mean_token_accuracy": 0.13898246958851815, "num_tokens": 4246701.0, "step": 2445 }, { "entropy": 5.968480920791626, "epoch": 0.1906243921416067, "grad_norm": 1.2265625, "learning_rate": 0.0004998566537583321, "loss": 5.9247, "mean_token_accuracy": 0.13750442117452621, "num_tokens": 4254541.0, "step": 2450 }, { "entropy": 5.9757208824157715, "epoch": 0.19101342151332426, "grad_norm": 1.125, "learning_rate": 0.0004998556628804408, "loss": 5.9488, "mean_token_accuracy": 0.13661977127194405, "num_tokens": 4263111.0, "step": 2455 }, { "entropy": 5.903095483779907, "epoch": 0.19140245088504182, "grad_norm": 1.1875, "learning_rate": 0.0004998546685907225, "loss": 5.98, "mean_token_accuracy": 0.13575077131390573, "num_tokens": 4272796.0, "step": 2460 }, { "entropy": 5.948573637008667, "epoch": 0.19179148025675938, "grad_norm": 1.109375, "learning_rate": 0.0004998536708891927, "loss": 5.8919, "mean_token_accuracy": 0.1417429715394974, "num_tokens": 4281361.0, "step": 2465 }, { "entropy": 6.026061391830444, "epoch": 0.19218050962847694, "grad_norm": 1.1796875, "learning_rate": 0.0004998526697758663, "loss": 5.9372, "mean_token_accuracy": 0.13869260102510453, "num_tokens": 4290470.0, "step": 2470 }, { "entropy": 5.973368835449219, "epoch": 0.19256953900019452, "grad_norm": 1.171875, "learning_rate": 0.0004998516652507585, "loss": 5.9896, "mean_token_accuracy": 0.1328210227191448, "num_tokens": 4299087.0, "step": 2475 }, { "entropy": 5.942784452438355, "epoch": 0.19295856837191208, "grad_norm": 1.1875, "learning_rate": 0.0004998506573138846, "loss": 5.8646, "mean_token_accuracy": 0.1429189197719097, "num_tokens": 4307572.0, "step": 2480 }, { "entropy": 5.963555192947387, "epoch": 0.19334759774362964, "grad_norm": 1.09375, "learning_rate": 0.0004998496459652598, "loss": 5.9277, "mean_token_accuracy": 0.14059290289878845, "num_tokens": 4316337.0, "step": 2485 }, { "entropy": 6.075507640838623, "epoch": 0.1937366271153472, "grad_norm": 1.078125, "learning_rate": 0.0004998486312048995, "loss": 6.0435, "mean_token_accuracy": 0.13950250148773194, "num_tokens": 4326258.0, "step": 2490 }, { "entropy": 5.918562126159668, "epoch": 0.19412565648706478, "grad_norm": 1.1484375, "learning_rate": 0.0004998476130328193, "loss": 5.8813, "mean_token_accuracy": 0.14137958139181137, "num_tokens": 4334711.0, "step": 2495 }, { "entropy": 5.970353269577027, "epoch": 0.19451468585878234, "grad_norm": 1.0625, "learning_rate": 0.0004998465914490343, "loss": 5.9743, "mean_token_accuracy": 0.13537674471735955, "num_tokens": 4343739.0, "step": 2500 }, { "entropy": 5.954079532623291, "epoch": 0.1949037152304999, "grad_norm": 1.046875, "learning_rate": 0.00049984556645356, "loss": 5.9093, "mean_token_accuracy": 0.1404120497405529, "num_tokens": 4352905.0, "step": 2505 }, { "entropy": 6.014039754867554, "epoch": 0.19529274460221746, "grad_norm": 1.1171875, "learning_rate": 0.0004998445380464124, "loss": 5.9394, "mean_token_accuracy": 0.14536958336830139, "num_tokens": 4361333.0, "step": 2510 }, { "entropy": 5.888523912429809, "epoch": 0.19568177397393502, "grad_norm": 1.1171875, "learning_rate": 0.0004998435062276066, "loss": 5.8983, "mean_token_accuracy": 0.13909753113985063, "num_tokens": 4369872.0, "step": 2515 }, { "entropy": 5.987714862823486, "epoch": 0.1960708033456526, "grad_norm": 1.171875, "learning_rate": 0.0004998424709971586, "loss": 5.965, "mean_token_accuracy": 0.1441866084933281, "num_tokens": 4378097.0, "step": 2520 }, { "entropy": 5.949221229553222, "epoch": 0.19645983271737016, "grad_norm": 1.1484375, "learning_rate": 0.0004998414323550839, "loss": 5.8936, "mean_token_accuracy": 0.13887374848127365, "num_tokens": 4387414.0, "step": 2525 }, { "entropy": 6.000862646102905, "epoch": 0.19684886208908772, "grad_norm": 1.3125, "learning_rate": 0.0004998403903013984, "loss": 5.9835, "mean_token_accuracy": 0.14411986842751504, "num_tokens": 4395922.0, "step": 2530 }, { "entropy": 5.882594108581543, "epoch": 0.19723789146080528, "grad_norm": 1.1328125, "learning_rate": 0.0004998393448361179, "loss": 5.9476, "mean_token_accuracy": 0.13559090122580528, "num_tokens": 4404500.0, "step": 2535 }, { "entropy": 5.838614749908447, "epoch": 0.19762692083252287, "grad_norm": 1.1875, "learning_rate": 0.000499838295959258, "loss": 5.9285, "mean_token_accuracy": 0.1404655933380127, "num_tokens": 4413433.0, "step": 2540 }, { "entropy": 5.985950040817261, "epoch": 0.19801595020424043, "grad_norm": 1.1171875, "learning_rate": 0.000499837243670835, "loss": 5.9686, "mean_token_accuracy": 0.14125767052173616, "num_tokens": 4421789.0, "step": 2545 }, { "entropy": 5.908414649963379, "epoch": 0.19840497957595798, "grad_norm": 1.1484375, "learning_rate": 0.0004998361879708646, "loss": 5.842, "mean_token_accuracy": 0.14500181004405022, "num_tokens": 4430256.0, "step": 2550 }, { "entropy": 5.934167671203613, "epoch": 0.19879400894767554, "grad_norm": 1.09375, "learning_rate": 0.000499835128859363, "loss": 5.8883, "mean_token_accuracy": 0.13772125393152237, "num_tokens": 4438431.0, "step": 2555 }, { "entropy": 5.989070034027099, "epoch": 0.1991830383193931, "grad_norm": 1.140625, "learning_rate": 0.0004998340663363461, "loss": 5.9525, "mean_token_accuracy": 0.13467848151922227, "num_tokens": 4447150.0, "step": 2560 }, { "entropy": 5.908329772949219, "epoch": 0.1995720676911107, "grad_norm": 1.2890625, "learning_rate": 0.0004998330004018301, "loss": 5.8286, "mean_token_accuracy": 0.1427350550889969, "num_tokens": 4455181.0, "step": 2565 }, { "entropy": 5.937408065795898, "epoch": 0.19996109706282825, "grad_norm": 1.1484375, "learning_rate": 0.0004998319310558312, "loss": 5.8475, "mean_token_accuracy": 0.14098502844572067, "num_tokens": 4463361.0, "step": 2570 }, { "entropy": 5.972924375534058, "epoch": 0.2003501264345458, "grad_norm": 1.234375, "learning_rate": 0.0004998308582983657, "loss": 5.9067, "mean_token_accuracy": 0.14643627852201463, "num_tokens": 4471853.0, "step": 2575 }, { "entropy": 5.81297550201416, "epoch": 0.20073915580626336, "grad_norm": 1.1875, "learning_rate": 0.0004998297821294497, "loss": 5.8622, "mean_token_accuracy": 0.14285662174224853, "num_tokens": 4480812.0, "step": 2580 }, { "entropy": 6.017388820648193, "epoch": 0.20112818517798095, "grad_norm": 1.078125, "learning_rate": 0.0004998287025490995, "loss": 5.8837, "mean_token_accuracy": 0.1472306877374649, "num_tokens": 4489180.0, "step": 2585 }, { "entropy": 5.9446248531341555, "epoch": 0.2015172145496985, "grad_norm": 1.203125, "learning_rate": 0.0004998276195573317, "loss": 5.9769, "mean_token_accuracy": 0.13497108072042466, "num_tokens": 4498013.0, "step": 2590 }, { "entropy": 6.0001615524292, "epoch": 0.20190624392141607, "grad_norm": 1.15625, "learning_rate": 0.0004998265331541627, "loss": 6.0107, "mean_token_accuracy": 0.12803680896759034, "num_tokens": 4506767.0, "step": 2595 }, { "entropy": 6.023769521713257, "epoch": 0.20229527329313363, "grad_norm": 1.0859375, "learning_rate": 0.0004998254433396088, "loss": 6.0163, "mean_token_accuracy": 0.13594405427575112, "num_tokens": 4516657.0, "step": 2600 }, { "entropy": 5.886989116668701, "epoch": 0.20268430266485118, "grad_norm": 1.2265625, "learning_rate": 0.0004998243501136867, "loss": 5.8502, "mean_token_accuracy": 0.14113568887114525, "num_tokens": 4524980.0, "step": 2605 }, { "entropy": 5.9184175491333, "epoch": 0.20307333203656877, "grad_norm": 1.171875, "learning_rate": 0.0004998232534764129, "loss": 5.9077, "mean_token_accuracy": 0.14252403378486633, "num_tokens": 4533236.0, "step": 2610 }, { "entropy": 5.863450002670288, "epoch": 0.20346236140828633, "grad_norm": 1.234375, "learning_rate": 0.0004998221534278041, "loss": 5.8162, "mean_token_accuracy": 0.14335810765624046, "num_tokens": 4541778.0, "step": 2615 }, { "entropy": 5.959815788269043, "epoch": 0.2038513907800039, "grad_norm": 1.171875, "learning_rate": 0.0004998210499678769, "loss": 5.923, "mean_token_accuracy": 0.13540767207741738, "num_tokens": 4551131.0, "step": 2620 }, { "entropy": 5.985937166213989, "epoch": 0.20424042015172145, "grad_norm": 1.125, "learning_rate": 0.0004998199430966481, "loss": 5.9087, "mean_token_accuracy": 0.13660723865032195, "num_tokens": 4559530.0, "step": 2625 }, { "entropy": 5.76199860572815, "epoch": 0.20462944952343903, "grad_norm": 1.1875, "learning_rate": 0.0004998188328141346, "loss": 5.7991, "mean_token_accuracy": 0.14168990179896354, "num_tokens": 4567533.0, "step": 2630 }, { "entropy": 6.024087429046631, "epoch": 0.2050184788951566, "grad_norm": 1.125, "learning_rate": 0.0004998177191203531, "loss": 5.9456, "mean_token_accuracy": 0.13533081263303756, "num_tokens": 4576414.0, "step": 2635 }, { "entropy": 5.922002506256104, "epoch": 0.20540750826687415, "grad_norm": 1.1484375, "learning_rate": 0.0004998166020153204, "loss": 5.8799, "mean_token_accuracy": 0.1403877317905426, "num_tokens": 4585331.0, "step": 2640 }, { "entropy": 5.909115886688232, "epoch": 0.2057965376385917, "grad_norm": 1.1796875, "learning_rate": 0.0004998154814990538, "loss": 5.9162, "mean_token_accuracy": 0.14347948133945465, "num_tokens": 4593526.0, "step": 2645 }, { "entropy": 5.876611804962158, "epoch": 0.20618556701030927, "grad_norm": 1.21875, "learning_rate": 0.00049981435757157, "loss": 5.9093, "mean_token_accuracy": 0.1371060587465763, "num_tokens": 4602400.0, "step": 2650 }, { "entropy": 5.864795446395874, "epoch": 0.20657459638202685, "grad_norm": 1.234375, "learning_rate": 0.0004998132302328862, "loss": 5.8555, "mean_token_accuracy": 0.14304873943328858, "num_tokens": 4611037.0, "step": 2655 }, { "entropy": 5.906079483032227, "epoch": 0.2069636257537444, "grad_norm": 1.1953125, "learning_rate": 0.0004998120994830195, "loss": 5.8705, "mean_token_accuracy": 0.1427972808480263, "num_tokens": 4619030.0, "step": 2660 }, { "entropy": 5.921322631835937, "epoch": 0.20735265512546197, "grad_norm": 1.125, "learning_rate": 0.000499810965321987, "loss": 5.864, "mean_token_accuracy": 0.1356546849012375, "num_tokens": 4628649.0, "step": 2665 }, { "entropy": 5.863415861129761, "epoch": 0.20774168449717953, "grad_norm": 1.1796875, "learning_rate": 0.0004998098277498059, "loss": 5.7696, "mean_token_accuracy": 0.14580075666308404, "num_tokens": 4636935.0, "step": 2670 }, { "entropy": 5.887133026123047, "epoch": 0.2081307138688971, "grad_norm": 1.234375, "learning_rate": 0.0004998086867664934, "loss": 5.9707, "mean_token_accuracy": 0.13916994631290436, "num_tokens": 4645532.0, "step": 2675 }, { "entropy": 6.022394037246704, "epoch": 0.20851974324061467, "grad_norm": 1.09375, "learning_rate": 0.000499807542372067, "loss": 6.0362, "mean_token_accuracy": 0.13294412568211555, "num_tokens": 4654433.0, "step": 2680 }, { "entropy": 6.088439798355102, "epoch": 0.20890877261233223, "grad_norm": 1.25, "learning_rate": 0.0004998063945665439, "loss": 6.0405, "mean_token_accuracy": 0.1323567308485508, "num_tokens": 4662913.0, "step": 2685 }, { "entropy": 5.968340587615967, "epoch": 0.2092978019840498, "grad_norm": 1.078125, "learning_rate": 0.0004998052433499416, "loss": 6.0029, "mean_token_accuracy": 0.13033748045563698, "num_tokens": 4672270.0, "step": 2690 }, { "entropy": 6.009377145767212, "epoch": 0.20968683135576735, "grad_norm": 1.1875, "learning_rate": 0.0004998040887222776, "loss": 6.045, "mean_token_accuracy": 0.1328607678413391, "num_tokens": 4681428.0, "step": 2695 }, { "entropy": 5.998253345489502, "epoch": 0.21007586072748494, "grad_norm": 1.1875, "learning_rate": 0.0004998029306835693, "loss": 5.8696, "mean_token_accuracy": 0.14181804582476615, "num_tokens": 4690492.0, "step": 2700 }, { "entropy": 5.976545810699463, "epoch": 0.2104648900992025, "grad_norm": 1.1015625, "learning_rate": 0.0004998017692338344, "loss": 5.9857, "mean_token_accuracy": 0.13384222462773324, "num_tokens": 4699667.0, "step": 2705 }, { "entropy": 5.75888295173645, "epoch": 0.21085391947092005, "grad_norm": 1.2109375, "learning_rate": 0.0004998006043730905, "loss": 5.6552, "mean_token_accuracy": 0.1563888520002365, "num_tokens": 4708529.0, "step": 2710 }, { "entropy": 5.798262882232666, "epoch": 0.2112429488426376, "grad_norm": 1.171875, "learning_rate": 0.0004997994361013551, "loss": 5.9154, "mean_token_accuracy": 0.13552722483873367, "num_tokens": 4717684.0, "step": 2715 }, { "entropy": 5.907504463195801, "epoch": 0.21163197821435517, "grad_norm": 1.0859375, "learning_rate": 0.0004997982644186461, "loss": 5.8459, "mean_token_accuracy": 0.14533798694610595, "num_tokens": 4727067.0, "step": 2720 }, { "entropy": 5.893569469451904, "epoch": 0.21202100758607276, "grad_norm": 1.1953125, "learning_rate": 0.0004997970893249813, "loss": 5.8291, "mean_token_accuracy": 0.14064672365784645, "num_tokens": 4735434.0, "step": 2725 }, { "entropy": 5.894484281539917, "epoch": 0.21241003695779032, "grad_norm": 1.1640625, "learning_rate": 0.0004997959108203785, "loss": 5.8669, "mean_token_accuracy": 0.14163699969649315, "num_tokens": 4743843.0, "step": 2730 }, { "entropy": 6.0105119228363035, "epoch": 0.21279906632950787, "grad_norm": 1.0546875, "learning_rate": 0.0004997947289048554, "loss": 5.9142, "mean_token_accuracy": 0.1434435725212097, "num_tokens": 4753228.0, "step": 2735 }, { "entropy": 5.9337730884552, "epoch": 0.21318809570122543, "grad_norm": 1.1640625, "learning_rate": 0.0004997935435784302, "loss": 5.9959, "mean_token_accuracy": 0.13996100500226022, "num_tokens": 4763401.0, "step": 2740 }, { "entropy": 5.934045076370239, "epoch": 0.21357712507294302, "grad_norm": 1.140625, "learning_rate": 0.0004997923548411208, "loss": 5.8468, "mean_token_accuracy": 0.14104977995157242, "num_tokens": 4771812.0, "step": 2745 }, { "entropy": 5.906756114959717, "epoch": 0.21396615444466058, "grad_norm": 1.15625, "learning_rate": 0.000499791162692945, "loss": 5.8769, "mean_token_accuracy": 0.14148839563131332, "num_tokens": 4780616.0, "step": 2750 }, { "entropy": 5.880796670913696, "epoch": 0.21435518381637814, "grad_norm": 1.1328125, "learning_rate": 0.0004997899671339214, "loss": 5.8714, "mean_token_accuracy": 0.1407567411661148, "num_tokens": 4789886.0, "step": 2755 }, { "entropy": 5.902111768722534, "epoch": 0.2147442131880957, "grad_norm": 1.125, "learning_rate": 0.0004997887681640675, "loss": 5.8659, "mean_token_accuracy": 0.1388687163591385, "num_tokens": 4799189.0, "step": 2760 }, { "entropy": 5.9799223899841305, "epoch": 0.21513324255981325, "grad_norm": 1.1875, "learning_rate": 0.0004997875657834021, "loss": 5.9074, "mean_token_accuracy": 0.14284486845135688, "num_tokens": 4807850.0, "step": 2765 }, { "entropy": 5.920933198928833, "epoch": 0.21552227193153084, "grad_norm": 1.140625, "learning_rate": 0.0004997863599919432, "loss": 5.8206, "mean_token_accuracy": 0.14280714765191077, "num_tokens": 4815742.0, "step": 2770 }, { "entropy": 5.91602783203125, "epoch": 0.2159113013032484, "grad_norm": 1.1328125, "learning_rate": 0.0004997851507897089, "loss": 5.9167, "mean_token_accuracy": 0.14030473083257675, "num_tokens": 4824761.0, "step": 2775 }, { "entropy": 6.005980825424194, "epoch": 0.21630033067496596, "grad_norm": 1.25, "learning_rate": 0.0004997839381767178, "loss": 6.023, "mean_token_accuracy": 0.13371331468224526, "num_tokens": 4832805.0, "step": 2780 }, { "entropy": 5.939170408248901, "epoch": 0.21668936004668352, "grad_norm": 1.109375, "learning_rate": 0.0004997827221529882, "loss": 5.8843, "mean_token_accuracy": 0.14137587547302247, "num_tokens": 4841938.0, "step": 2785 }, { "entropy": 5.92487063407898, "epoch": 0.2170783894184011, "grad_norm": 1.109375, "learning_rate": 0.0004997815027185386, "loss": 5.9011, "mean_token_accuracy": 0.13681731075048448, "num_tokens": 4849932.0, "step": 2790 }, { "entropy": 5.821724700927734, "epoch": 0.21746741879011866, "grad_norm": 1.1796875, "learning_rate": 0.0004997802798733874, "loss": 5.779, "mean_token_accuracy": 0.14767844080924988, "num_tokens": 4859054.0, "step": 2795 }, { "entropy": 6.00215711593628, "epoch": 0.21785644816183622, "grad_norm": 1.1640625, "learning_rate": 0.0004997790536175534, "loss": 5.9348, "mean_token_accuracy": 0.14400338754057884, "num_tokens": 4867415.0, "step": 2800 }, { "entropy": 5.9811138153076175, "epoch": 0.21824547753355378, "grad_norm": 1.15625, "learning_rate": 0.0004997778239510548, "loss": 5.9799, "mean_token_accuracy": 0.1346263289451599, "num_tokens": 4875965.0, "step": 2805 }, { "entropy": 5.946578025817871, "epoch": 0.21863450690527134, "grad_norm": 1.09375, "learning_rate": 0.0004997765908739106, "loss": 5.868, "mean_token_accuracy": 0.1421209491789341, "num_tokens": 4884629.0, "step": 2810 }, { "entropy": 5.920269346237182, "epoch": 0.21902353627698892, "grad_norm": 1.1796875, "learning_rate": 0.0004997753543861395, "loss": 5.9236, "mean_token_accuracy": 0.14194096624851227, "num_tokens": 4893573.0, "step": 2815 }, { "entropy": 5.871851634979248, "epoch": 0.21941256564870648, "grad_norm": 1.1015625, "learning_rate": 0.00049977411448776, "loss": 5.8508, "mean_token_accuracy": 0.14088700339198112, "num_tokens": 4902831.0, "step": 2820 }, { "entropy": 6.002893781661987, "epoch": 0.21980159502042404, "grad_norm": 1.1171875, "learning_rate": 0.0004997728711787912, "loss": 5.9012, "mean_token_accuracy": 0.13369439616799356, "num_tokens": 4911360.0, "step": 2825 }, { "entropy": 5.933447265625, "epoch": 0.2201906243921416, "grad_norm": 1.2109375, "learning_rate": 0.0004997716244592518, "loss": 5.856, "mean_token_accuracy": 0.1380616083741188, "num_tokens": 4919758.0, "step": 2830 }, { "entropy": 5.814820194244385, "epoch": 0.22057965376385918, "grad_norm": 1.15625, "learning_rate": 0.0004997703743291607, "loss": 5.7524, "mean_token_accuracy": 0.15023381486535073, "num_tokens": 4928934.0, "step": 2835 }, { "entropy": 5.785764932632446, "epoch": 0.22096868313557674, "grad_norm": 1.109375, "learning_rate": 0.000499769120788537, "loss": 5.8125, "mean_token_accuracy": 0.1431200847029686, "num_tokens": 4937780.0, "step": 2840 }, { "entropy": 6.037427234649658, "epoch": 0.2213577125072943, "grad_norm": 1.203125, "learning_rate": 0.0004997678638373995, "loss": 5.9051, "mean_token_accuracy": 0.1383948467671871, "num_tokens": 4946862.0, "step": 2845 }, { "entropy": 5.868165636062622, "epoch": 0.22174674187901186, "grad_norm": 1.1171875, "learning_rate": 0.0004997666034757676, "loss": 5.887, "mean_token_accuracy": 0.14369800984859465, "num_tokens": 4954883.0, "step": 2850 }, { "entropy": 5.797883749008179, "epoch": 0.22213577125072942, "grad_norm": 1.1953125, "learning_rate": 0.0004997653397036603, "loss": 5.6813, "mean_token_accuracy": 0.15522562339901924, "num_tokens": 4962840.0, "step": 2855 }, { "entropy": 5.835611629486084, "epoch": 0.222524800622447, "grad_norm": 1.1640625, "learning_rate": 0.0004997640725210965, "loss": 5.9223, "mean_token_accuracy": 0.14193681627511978, "num_tokens": 4972334.0, "step": 2860 }, { "entropy": 5.9330864429473875, "epoch": 0.22291382999416456, "grad_norm": 1.1640625, "learning_rate": 0.0004997628019280958, "loss": 5.8871, "mean_token_accuracy": 0.14560381472110748, "num_tokens": 4981032.0, "step": 2865 }, { "entropy": 5.886129903793335, "epoch": 0.22330285936588212, "grad_norm": 1.171875, "learning_rate": 0.0004997615279246773, "loss": 5.914, "mean_token_accuracy": 0.14388557896018028, "num_tokens": 4990502.0, "step": 2870 }, { "entropy": 6.024803590774536, "epoch": 0.22369188873759968, "grad_norm": 1.171875, "learning_rate": 0.0004997602505108603, "loss": 6.0752, "mean_token_accuracy": 0.13173774257302284, "num_tokens": 4999121.0, "step": 2875 }, { "entropy": 5.972172689437866, "epoch": 0.22408091810931724, "grad_norm": 1.125, "learning_rate": 0.0004997589696866644, "loss": 5.8406, "mean_token_accuracy": 0.14171420633792878, "num_tokens": 5007271.0, "step": 2880 }, { "entropy": 5.839230108261108, "epoch": 0.22446994748103483, "grad_norm": 1.2421875, "learning_rate": 0.0004997576854521088, "loss": 5.8827, "mean_token_accuracy": 0.13617974072694777, "num_tokens": 5015940.0, "step": 2885 }, { "entropy": 5.812696170806885, "epoch": 0.22485897685275238, "grad_norm": 1.0859375, "learning_rate": 0.000499756397807213, "loss": 5.781, "mean_token_accuracy": 0.14219485297799112, "num_tokens": 5024294.0, "step": 2890 }, { "entropy": 5.876422786712647, "epoch": 0.22524800622446994, "grad_norm": 1.1796875, "learning_rate": 0.0004997551067519966, "loss": 5.7615, "mean_token_accuracy": 0.15088033750653268, "num_tokens": 5033401.0, "step": 2895 }, { "entropy": 5.839484453201294, "epoch": 0.2256370355961875, "grad_norm": 1.1796875, "learning_rate": 0.0004997538122864792, "loss": 5.8552, "mean_token_accuracy": 0.1417061373591423, "num_tokens": 5041955.0, "step": 2900 }, { "entropy": 5.92848014831543, "epoch": 0.2260260649679051, "grad_norm": 1.1328125, "learning_rate": 0.0004997525144106804, "loss": 5.898, "mean_token_accuracy": 0.13416951149702072, "num_tokens": 5051132.0, "step": 2905 }, { "entropy": 5.7870166301727295, "epoch": 0.22641509433962265, "grad_norm": 1.09375, "learning_rate": 0.00049975121312462, "loss": 5.8046, "mean_token_accuracy": 0.14889086335897445, "num_tokens": 5059492.0, "step": 2910 }, { "entropy": 5.853955602645874, "epoch": 0.2268041237113402, "grad_norm": 1.1953125, "learning_rate": 0.0004997499084283177, "loss": 5.8692, "mean_token_accuracy": 0.143447807431221, "num_tokens": 5069015.0, "step": 2915 }, { "entropy": 5.916986465454102, "epoch": 0.22719315308305776, "grad_norm": 1.1875, "learning_rate": 0.0004997486003217932, "loss": 5.8649, "mean_token_accuracy": 0.14138873815536498, "num_tokens": 5077614.0, "step": 2920 }, { "entropy": 5.828479671478272, "epoch": 0.22758218245477532, "grad_norm": 1.1484375, "learning_rate": 0.0004997472888050664, "loss": 5.8007, "mean_token_accuracy": 0.1477051630616188, "num_tokens": 5086300.0, "step": 2925 }, { "entropy": 5.84206714630127, "epoch": 0.2279712118264929, "grad_norm": 1.1796875, "learning_rate": 0.0004997459738781573, "loss": 5.8453, "mean_token_accuracy": 0.1453349806368351, "num_tokens": 5095967.0, "step": 2930 }, { "entropy": 5.8847919464111325, "epoch": 0.22836024119821047, "grad_norm": 1.1796875, "learning_rate": 0.0004997446555410857, "loss": 5.8065, "mean_token_accuracy": 0.14551942944526672, "num_tokens": 5104611.0, "step": 2935 }, { "entropy": 5.818680095672607, "epoch": 0.22874927056992803, "grad_norm": 1.0859375, "learning_rate": 0.0004997433337938716, "loss": 5.7603, "mean_token_accuracy": 0.14727237671613694, "num_tokens": 5113452.0, "step": 2940 }, { "entropy": 5.7687592029571535, "epoch": 0.22913829994164558, "grad_norm": 1.1328125, "learning_rate": 0.0004997420086365351, "loss": 5.7552, "mean_token_accuracy": 0.1463024787604809, "num_tokens": 5121558.0, "step": 2945 }, { "entropy": 5.800099563598633, "epoch": 0.22952732931336317, "grad_norm": 1.28125, "learning_rate": 0.0004997406800690966, "loss": 5.7291, "mean_token_accuracy": 0.158209228515625, "num_tokens": 5129942.0, "step": 2950 }, { "entropy": 5.918742609024048, "epoch": 0.22991635868508073, "grad_norm": 1.1484375, "learning_rate": 0.0004997393480915758, "loss": 5.8627, "mean_token_accuracy": 0.13658782318234444, "num_tokens": 5139012.0, "step": 2955 }, { "entropy": 5.898570966720581, "epoch": 0.2303053880567983, "grad_norm": 1.1875, "learning_rate": 0.0004997380127039931, "loss": 5.8623, "mean_token_accuracy": 0.1460738256573677, "num_tokens": 5148185.0, "step": 2960 }, { "entropy": 5.961733865737915, "epoch": 0.23069441742851585, "grad_norm": 1.1171875, "learning_rate": 0.0004997366739063688, "loss": 5.8949, "mean_token_accuracy": 0.1355762153863907, "num_tokens": 5157086.0, "step": 2965 }, { "entropy": 5.97607455253601, "epoch": 0.2310834468002334, "grad_norm": 1.203125, "learning_rate": 0.0004997353316987231, "loss": 5.9666, "mean_token_accuracy": 0.13954457640647888, "num_tokens": 5165842.0, "step": 2970 }, { "entropy": 5.937599039077758, "epoch": 0.231472476171951, "grad_norm": 1.1171875, "learning_rate": 0.0004997339860810765, "loss": 5.9787, "mean_token_accuracy": 0.1414493590593338, "num_tokens": 5174161.0, "step": 2975 }, { "entropy": 5.968914127349853, "epoch": 0.23186150554366855, "grad_norm": 1.1484375, "learning_rate": 0.0004997326370534495, "loss": 5.8987, "mean_token_accuracy": 0.1409076064825058, "num_tokens": 5183830.0, "step": 2980 }, { "entropy": 5.895692634582519, "epoch": 0.2322505349153861, "grad_norm": 1.21875, "learning_rate": 0.0004997312846158622, "loss": 5.8161, "mean_token_accuracy": 0.14208230078220369, "num_tokens": 5192248.0, "step": 2985 }, { "entropy": 5.817179870605469, "epoch": 0.23263956428710367, "grad_norm": 1.0859375, "learning_rate": 0.0004997299287683355, "loss": 5.7776, "mean_token_accuracy": 0.1490553967654705, "num_tokens": 5201212.0, "step": 2990 }, { "entropy": 5.853628253936767, "epoch": 0.23302859365882125, "grad_norm": 1.15625, "learning_rate": 0.0004997285695108898, "loss": 5.8421, "mean_token_accuracy": 0.14157011210918427, "num_tokens": 5209338.0, "step": 2995 }, { "entropy": 5.974374198913575, "epoch": 0.2334176230305388, "grad_norm": 1.109375, "learning_rate": 0.0004997272068435458, "loss": 5.8576, "mean_token_accuracy": 0.14298054277896882, "num_tokens": 5217590.0, "step": 3000 }, { "epoch": 0.2334176230305388, "eval_entropy": 5.72153007830417, "eval_loss": 5.904752254486084, "eval_mean_token_accuracy": 0.14778396588919596, "eval_num_tokens": 5217590.0, "eval_runtime": 28.7542, "eval_samples_per_second": 1445.286, "eval_steps_per_second": 180.669, "step": 3000 }, { "entropy": 5.8005329132080075, "epoch": 0.23380665240225637, "grad_norm": 1.109375, "learning_rate": 0.000499725840766324, "loss": 5.7915, "mean_token_accuracy": 0.14410673528909684, "num_tokens": 5226383.0, "step": 3005 }, { "entropy": 5.920779180526734, "epoch": 0.23419568177397393, "grad_norm": 1.09375, "learning_rate": 0.0004997244712792453, "loss": 5.8243, "mean_token_accuracy": 0.1450793609023094, "num_tokens": 5235517.0, "step": 3010 }, { "entropy": 5.9037463665008545, "epoch": 0.2345847111456915, "grad_norm": 1.15625, "learning_rate": 0.0004997230983823305, "loss": 5.799, "mean_token_accuracy": 0.15086298882961274, "num_tokens": 5243812.0, "step": 3015 }, { "entropy": 5.84418740272522, "epoch": 0.23497374051740907, "grad_norm": 1.1484375, "learning_rate": 0.0004997217220756003, "loss": 5.817, "mean_token_accuracy": 0.14579055458307266, "num_tokens": 5252399.0, "step": 3020 }, { "entropy": 5.86341438293457, "epoch": 0.23536276988912663, "grad_norm": 1.140625, "learning_rate": 0.0004997203423590757, "loss": 5.8496, "mean_token_accuracy": 0.14410731792449952, "num_tokens": 5260847.0, "step": 3025 }, { "entropy": 5.9321190357208256, "epoch": 0.2357517992608442, "grad_norm": 1.1953125, "learning_rate": 0.0004997189592327775, "loss": 5.8993, "mean_token_accuracy": 0.13984145000576972, "num_tokens": 5268847.0, "step": 3030 }, { "entropy": 5.912533950805664, "epoch": 0.23614082863256175, "grad_norm": 1.15625, "learning_rate": 0.0004997175726967268, "loss": 5.8449, "mean_token_accuracy": 0.1432294562458992, "num_tokens": 5277989.0, "step": 3035 }, { "entropy": 5.807249355316162, "epoch": 0.23652985800427934, "grad_norm": 1.1875, "learning_rate": 0.0004997161827509447, "loss": 5.8298, "mean_token_accuracy": 0.14517134800553322, "num_tokens": 5286272.0, "step": 3040 }, { "entropy": 5.843175888061523, "epoch": 0.2369188873759969, "grad_norm": 1.140625, "learning_rate": 0.0004997147893954521, "loss": 5.8561, "mean_token_accuracy": 0.14687449485063553, "num_tokens": 5295281.0, "step": 3045 }, { "entropy": 5.927417421340943, "epoch": 0.23730791674771445, "grad_norm": 1.2109375, "learning_rate": 0.0004997133926302702, "loss": 5.7811, "mean_token_accuracy": 0.147725660353899, "num_tokens": 5303905.0, "step": 3050 }, { "entropy": 5.8274088382720945, "epoch": 0.237696946119432, "grad_norm": 1.171875, "learning_rate": 0.0004997119924554204, "loss": 5.7698, "mean_token_accuracy": 0.14279649034142494, "num_tokens": 5313146.0, "step": 3055 }, { "entropy": 5.812492322921753, "epoch": 0.23808597549114957, "grad_norm": 1.125, "learning_rate": 0.0004997105888709236, "loss": 5.8213, "mean_token_accuracy": 0.1478417322039604, "num_tokens": 5320838.0, "step": 3060 }, { "entropy": 5.884876251220703, "epoch": 0.23847500486286716, "grad_norm": 1.2109375, "learning_rate": 0.0004997091818768015, "loss": 5.8272, "mean_token_accuracy": 0.14175651222467422, "num_tokens": 5329312.0, "step": 3065 }, { "entropy": 5.842220640182495, "epoch": 0.23886403423458472, "grad_norm": 1.1953125, "learning_rate": 0.000499707771473075, "loss": 5.8239, "mean_token_accuracy": 0.14224815219640732, "num_tokens": 5337747.0, "step": 3070 }, { "entropy": 5.890048694610596, "epoch": 0.23925306360630227, "grad_norm": 1.1171875, "learning_rate": 0.0004997063576597659, "loss": 5.82, "mean_token_accuracy": 0.13902755007147788, "num_tokens": 5346928.0, "step": 3075 }, { "entropy": 5.860515022277832, "epoch": 0.23964209297801983, "grad_norm": 1.1953125, "learning_rate": 0.0004997049404368954, "loss": 5.8373, "mean_token_accuracy": 0.13793924003839492, "num_tokens": 5355827.0, "step": 3080 }, { "entropy": 5.991226482391357, "epoch": 0.2400311223497374, "grad_norm": 1.171875, "learning_rate": 0.000499703519804485, "loss": 5.9741, "mean_token_accuracy": 0.13731370642781257, "num_tokens": 5364309.0, "step": 3085 }, { "entropy": 5.884651184082031, "epoch": 0.24042015172145498, "grad_norm": 1.2109375, "learning_rate": 0.0004997020957625564, "loss": 5.868, "mean_token_accuracy": 0.1458408921957016, "num_tokens": 5372979.0, "step": 3090 }, { "entropy": 5.857665157318115, "epoch": 0.24080918109317254, "grad_norm": 1.0625, "learning_rate": 0.0004997006683111312, "loss": 5.8287, "mean_token_accuracy": 0.14318791329860686, "num_tokens": 5381809.0, "step": 3095 }, { "entropy": 5.925519943237305, "epoch": 0.2411982104648901, "grad_norm": 1.1953125, "learning_rate": 0.000499699237450231, "loss": 5.8886, "mean_token_accuracy": 0.14159021526575089, "num_tokens": 5390036.0, "step": 3100 }, { "entropy": 5.988127946853638, "epoch": 0.24158723983660765, "grad_norm": 1.109375, "learning_rate": 0.0004996978031798774, "loss": 5.9362, "mean_token_accuracy": 0.13715847954154015, "num_tokens": 5398739.0, "step": 3105 }, { "entropy": 5.866925144195557, "epoch": 0.24197626920832524, "grad_norm": 1.1171875, "learning_rate": 0.0004996963655000924, "loss": 5.8508, "mean_token_accuracy": 0.13922770768404008, "num_tokens": 5407441.0, "step": 3110 }, { "entropy": 5.887317657470703, "epoch": 0.2423652985800428, "grad_norm": 1.1796875, "learning_rate": 0.0004996949244108977, "loss": 5.8102, "mean_token_accuracy": 0.14160098806023597, "num_tokens": 5416534.0, "step": 3115 }, { "entropy": 5.842632818222046, "epoch": 0.24275432795176036, "grad_norm": 1.0703125, "learning_rate": 0.000499693479912315, "loss": 5.8628, "mean_token_accuracy": 0.14435580223798752, "num_tokens": 5425170.0, "step": 3120 }, { "entropy": 5.8731931209564205, "epoch": 0.24314335732347792, "grad_norm": 1.15625, "learning_rate": 0.0004996920320043666, "loss": 5.826, "mean_token_accuracy": 0.13852888271212577, "num_tokens": 5433721.0, "step": 3125 }, { "entropy": 5.938917779922486, "epoch": 0.24353238669519547, "grad_norm": 1.1796875, "learning_rate": 0.0004996905806870742, "loss": 5.8817, "mean_token_accuracy": 0.1431050829589367, "num_tokens": 5441708.0, "step": 3130 }, { "entropy": 5.844237279891968, "epoch": 0.24392141606691306, "grad_norm": 1.21875, "learning_rate": 0.0004996891259604598, "loss": 5.7866, "mean_token_accuracy": 0.14370601251721382, "num_tokens": 5449942.0, "step": 3135 }, { "entropy": 5.880588436126709, "epoch": 0.24431044543863062, "grad_norm": 1.1875, "learning_rate": 0.0004996876678245455, "loss": 5.7923, "mean_token_accuracy": 0.1475344941020012, "num_tokens": 5458004.0, "step": 3140 }, { "entropy": 5.9699300765991214, "epoch": 0.24469947481034818, "grad_norm": 1.125, "learning_rate": 0.0004996862062793536, "loss": 5.8779, "mean_token_accuracy": 0.1441954031586647, "num_tokens": 5467071.0, "step": 3145 }, { "entropy": 5.882994031906128, "epoch": 0.24508850418206574, "grad_norm": 1.1015625, "learning_rate": 0.0004996847413249061, "loss": 5.8592, "mean_token_accuracy": 0.14534298777580262, "num_tokens": 5476221.0, "step": 3150 }, { "entropy": 5.889163970947266, "epoch": 0.24547753355378332, "grad_norm": 1.359375, "learning_rate": 0.0004996832729612252, "loss": 5.7781, "mean_token_accuracy": 0.1421756461262703, "num_tokens": 5484549.0, "step": 3155 }, { "entropy": 5.770286703109742, "epoch": 0.24586656292550088, "grad_norm": 1.2265625, "learning_rate": 0.0004996818011883333, "loss": 5.7796, "mean_token_accuracy": 0.1462826058268547, "num_tokens": 5492909.0, "step": 3160 }, { "entropy": 5.878460454940796, "epoch": 0.24625559229721844, "grad_norm": 1.203125, "learning_rate": 0.0004996803260062527, "loss": 5.8447, "mean_token_accuracy": 0.1453042894601822, "num_tokens": 5501418.0, "step": 3165 }, { "entropy": 5.947468614578247, "epoch": 0.246644621668936, "grad_norm": 1.1640625, "learning_rate": 0.0004996788474150057, "loss": 5.8269, "mean_token_accuracy": 0.14394153654575348, "num_tokens": 5510609.0, "step": 3170 }, { "entropy": 5.731346225738525, "epoch": 0.24703365104065356, "grad_norm": 1.2890625, "learning_rate": 0.0004996773654146149, "loss": 5.6813, "mean_token_accuracy": 0.1574917584657669, "num_tokens": 5518349.0, "step": 3175 }, { "entropy": 5.728027200698852, "epoch": 0.24742268041237114, "grad_norm": 1.140625, "learning_rate": 0.0004996758800051026, "loss": 5.625, "mean_token_accuracy": 0.15064212381839753, "num_tokens": 5526972.0, "step": 3180 }, { "entropy": 5.777186107635498, "epoch": 0.2478117097840887, "grad_norm": 1.1640625, "learning_rate": 0.0004996743911864916, "loss": 5.8014, "mean_token_accuracy": 0.14768730401992797, "num_tokens": 5535683.0, "step": 3185 }, { "entropy": 5.830631589889526, "epoch": 0.24820073915580626, "grad_norm": 1.1953125, "learning_rate": 0.0004996728989588041, "loss": 5.7698, "mean_token_accuracy": 0.15127997547388078, "num_tokens": 5544258.0, "step": 3190 }, { "entropy": 5.7605572700500485, "epoch": 0.24858976852752382, "grad_norm": 1.171875, "learning_rate": 0.0004996714033220632, "loss": 5.7839, "mean_token_accuracy": 0.14324464723467828, "num_tokens": 5552608.0, "step": 3195 }, { "entropy": 5.882555913925171, "epoch": 0.2489787978992414, "grad_norm": 1.09375, "learning_rate": 0.0004996699042762911, "loss": 5.911, "mean_token_accuracy": 0.13898452371358871, "num_tokens": 5561357.0, "step": 3200 }, { "entropy": 5.895790910720825, "epoch": 0.24936782727095896, "grad_norm": 1.140625, "learning_rate": 0.0004996684018215111, "loss": 5.7385, "mean_token_accuracy": 0.15563871711492538, "num_tokens": 5569862.0, "step": 3205 }, { "entropy": 5.797485113143921, "epoch": 0.24975685664267652, "grad_norm": 1.1953125, "learning_rate": 0.0004996668959577453, "loss": 5.803, "mean_token_accuracy": 0.148903951048851, "num_tokens": 5578485.0, "step": 3210 }, { "entropy": 5.792536973953247, "epoch": 0.2501458860143941, "grad_norm": 1.0703125, "learning_rate": 0.0004996653866850173, "loss": 5.7815, "mean_token_accuracy": 0.13914278522133827, "num_tokens": 5587713.0, "step": 3215 }, { "entropy": 5.876435041427612, "epoch": 0.25053491538611167, "grad_norm": 1.1484375, "learning_rate": 0.0004996638740033495, "loss": 5.8683, "mean_token_accuracy": 0.14536678940057754, "num_tokens": 5596541.0, "step": 3220 }, { "entropy": 5.836820125579834, "epoch": 0.2509239447578292, "grad_norm": 1.109375, "learning_rate": 0.0004996623579127651, "loss": 5.7374, "mean_token_accuracy": 0.1486624523997307, "num_tokens": 5605573.0, "step": 3225 }, { "entropy": 5.815556573867798, "epoch": 0.2513129741295468, "grad_norm": 1.171875, "learning_rate": 0.0004996608384132868, "loss": 5.7302, "mean_token_accuracy": 0.15229415744543076, "num_tokens": 5614016.0, "step": 3230 }, { "entropy": 5.929158639907837, "epoch": 0.25170200350126437, "grad_norm": 1.1171875, "learning_rate": 0.000499659315504938, "loss": 5.9714, "mean_token_accuracy": 0.1410625085234642, "num_tokens": 5622451.0, "step": 3235 }, { "entropy": 5.871538591384888, "epoch": 0.2520910328729819, "grad_norm": 1.484375, "learning_rate": 0.0004996577891877417, "loss": 5.8263, "mean_token_accuracy": 0.1432577043771744, "num_tokens": 5631384.0, "step": 3240 }, { "entropy": 5.845392656326294, "epoch": 0.2524800622446995, "grad_norm": 1.125, "learning_rate": 0.0004996562594617209, "loss": 5.787, "mean_token_accuracy": 0.14552973359823226, "num_tokens": 5640726.0, "step": 3245 }, { "entropy": 5.880887746810913, "epoch": 0.252869091616417, "grad_norm": 1.2578125, "learning_rate": 0.0004996547263268991, "loss": 5.7875, "mean_token_accuracy": 0.14155513122677804, "num_tokens": 5648948.0, "step": 3250 }, { "entropy": 5.727876091003418, "epoch": 0.2532581209881346, "grad_norm": 1.1953125, "learning_rate": 0.0004996531897832993, "loss": 5.7484, "mean_token_accuracy": 0.14809300750494003, "num_tokens": 5657951.0, "step": 3255 }, { "entropy": 5.896551561355591, "epoch": 0.2536471503598522, "grad_norm": 1.140625, "learning_rate": 0.000499651649830945, "loss": 5.8633, "mean_token_accuracy": 0.14910533055663108, "num_tokens": 5667476.0, "step": 3260 }, { "entropy": 5.904336595535279, "epoch": 0.2540361797315697, "grad_norm": 1.09375, "learning_rate": 0.0004996501064698593, "loss": 5.8708, "mean_token_accuracy": 0.14054447636008263, "num_tokens": 5676627.0, "step": 3265 }, { "entropy": 5.7955468654632565, "epoch": 0.2544252091032873, "grad_norm": 1.2109375, "learning_rate": 0.000499648559700066, "loss": 5.7879, "mean_token_accuracy": 0.15155547559261323, "num_tokens": 5684376.0, "step": 3270 }, { "entropy": 5.905218029022217, "epoch": 0.25481423847500484, "grad_norm": 1.1484375, "learning_rate": 0.0004996470095215884, "loss": 5.9569, "mean_token_accuracy": 0.133226178586483, "num_tokens": 5693629.0, "step": 3275 }, { "entropy": 5.966583728790283, "epoch": 0.2552032678467224, "grad_norm": 1.1953125, "learning_rate": 0.0004996454559344498, "loss": 5.8397, "mean_token_accuracy": 0.14316044747829437, "num_tokens": 5702010.0, "step": 3280 }, { "entropy": 5.7592079639434814, "epoch": 0.25559229721844, "grad_norm": 1.25, "learning_rate": 0.0004996438989386741, "loss": 5.7497, "mean_token_accuracy": 0.14288737773895263, "num_tokens": 5710823.0, "step": 3285 }, { "entropy": 5.851301670074463, "epoch": 0.25598132659015754, "grad_norm": 1.171875, "learning_rate": 0.0004996423385342847, "loss": 5.7971, "mean_token_accuracy": 0.15071944296360015, "num_tokens": 5719389.0, "step": 3290 }, { "entropy": 5.921173000335694, "epoch": 0.25637035596187513, "grad_norm": 1.2109375, "learning_rate": 0.0004996407747213055, "loss": 5.7838, "mean_token_accuracy": 0.14567249342799188, "num_tokens": 5727327.0, "step": 3295 }, { "entropy": 5.809784698486328, "epoch": 0.25675938533359266, "grad_norm": 1.0859375, "learning_rate": 0.00049963920749976, "loss": 5.6969, "mean_token_accuracy": 0.15062555074691772, "num_tokens": 5735886.0, "step": 3300 }, { "entropy": 5.797888612747192, "epoch": 0.25714841470531025, "grad_norm": 1.15625, "learning_rate": 0.0004996376368696721, "loss": 5.7431, "mean_token_accuracy": 0.1468089461326599, "num_tokens": 5744656.0, "step": 3305 }, { "entropy": 5.88851490020752, "epoch": 0.25753744407702783, "grad_norm": 1.15625, "learning_rate": 0.0004996360628310656, "loss": 5.9045, "mean_token_accuracy": 0.13661069944500923, "num_tokens": 5753026.0, "step": 3310 }, { "entropy": 5.876181364059448, "epoch": 0.25792647344874536, "grad_norm": 1.2578125, "learning_rate": 0.0004996344853839644, "loss": 5.8452, "mean_token_accuracy": 0.14359349012374878, "num_tokens": 5762771.0, "step": 3315 }, { "entropy": 5.826467847824096, "epoch": 0.25831550282046295, "grad_norm": 1.1328125, "learning_rate": 0.0004996329045283924, "loss": 5.8225, "mean_token_accuracy": 0.15036021620035173, "num_tokens": 5771151.0, "step": 3320 }, { "entropy": 5.829469013214111, "epoch": 0.25870453219218054, "grad_norm": 1.2578125, "learning_rate": 0.0004996313202643737, "loss": 5.7301, "mean_token_accuracy": 0.14670131206512452, "num_tokens": 5780648.0, "step": 3325 }, { "entropy": 5.801216411590576, "epoch": 0.25909356156389807, "grad_norm": 1.1328125, "learning_rate": 0.0004996297325919321, "loss": 5.7089, "mean_token_accuracy": 0.14597562104463577, "num_tokens": 5789698.0, "step": 3330 }, { "entropy": 5.902236461639404, "epoch": 0.25948259093561565, "grad_norm": 1.1796875, "learning_rate": 0.0004996281415110919, "loss": 5.9083, "mean_token_accuracy": 0.13697285056114197, "num_tokens": 5799218.0, "step": 3335 }, { "entropy": 5.800975608825683, "epoch": 0.2598716203073332, "grad_norm": 1.109375, "learning_rate": 0.0004996265470218773, "loss": 5.7761, "mean_token_accuracy": 0.14101554378867148, "num_tokens": 5808455.0, "step": 3340 }, { "entropy": 5.86399564743042, "epoch": 0.26026064967905077, "grad_norm": 1.1953125, "learning_rate": 0.0004996249491243122, "loss": 5.8026, "mean_token_accuracy": 0.14507102519273757, "num_tokens": 5816464.0, "step": 3345 }, { "entropy": 5.831243515014648, "epoch": 0.26064967905076836, "grad_norm": 1.21875, "learning_rate": 0.0004996233478184211, "loss": 5.7665, "mean_token_accuracy": 0.1419643133878708, "num_tokens": 5825188.0, "step": 3350 }, { "entropy": 5.816180896759033, "epoch": 0.2610387084224859, "grad_norm": 1.2578125, "learning_rate": 0.0004996217431042282, "loss": 5.8148, "mean_token_accuracy": 0.14716667979955672, "num_tokens": 5834150.0, "step": 3355 }, { "entropy": 5.8475151538848875, "epoch": 0.2614277377942035, "grad_norm": 1.1796875, "learning_rate": 0.000499620134981758, "loss": 5.6758, "mean_token_accuracy": 0.15172670781612396, "num_tokens": 5842801.0, "step": 3360 }, { "entropy": 5.8005210876464846, "epoch": 0.261816767165921, "grad_norm": 1.2265625, "learning_rate": 0.0004996185234510346, "loss": 5.7071, "mean_token_accuracy": 0.15291839390993117, "num_tokens": 5851547.0, "step": 3365 }, { "entropy": 5.862095355987549, "epoch": 0.2622057965376386, "grad_norm": 1.1796875, "learning_rate": 0.0004996169085120828, "loss": 5.8569, "mean_token_accuracy": 0.1441195249557495, "num_tokens": 5860430.0, "step": 3370 }, { "entropy": 5.778133964538574, "epoch": 0.2625948259093562, "grad_norm": 1.1796875, "learning_rate": 0.0004996152901649268, "loss": 5.7645, "mean_token_accuracy": 0.1446751818060875, "num_tokens": 5869648.0, "step": 3375 }, { "entropy": 5.897901725769043, "epoch": 0.2629838552810737, "grad_norm": 1.1875, "learning_rate": 0.0004996136684095913, "loss": 5.7754, "mean_token_accuracy": 0.14787262827157974, "num_tokens": 5878606.0, "step": 3380 }, { "entropy": 5.817872047424316, "epoch": 0.2633728846527913, "grad_norm": 1.1796875, "learning_rate": 0.0004996120432461009, "loss": 5.8403, "mean_token_accuracy": 0.1442799985408783, "num_tokens": 5886772.0, "step": 3385 }, { "entropy": 5.80500373840332, "epoch": 0.2637619140245088, "grad_norm": 1.2265625, "learning_rate": 0.0004996104146744804, "loss": 5.7437, "mean_token_accuracy": 0.1436271235346794, "num_tokens": 5895007.0, "step": 3390 }, { "entropy": 5.937970876693726, "epoch": 0.2641509433962264, "grad_norm": 1.34375, "learning_rate": 0.0004996087826947541, "loss": 5.8675, "mean_token_accuracy": 0.13643872514367103, "num_tokens": 5904249.0, "step": 3395 }, { "entropy": 5.748004293441772, "epoch": 0.264539972767944, "grad_norm": 1.359375, "learning_rate": 0.0004996071473069471, "loss": 5.8357, "mean_token_accuracy": 0.1466163992881775, "num_tokens": 5911416.0, "step": 3400 }, { "entropy": 5.873762226104736, "epoch": 0.26492900213966153, "grad_norm": 1.1953125, "learning_rate": 0.0004996055085110842, "loss": 5.875, "mean_token_accuracy": 0.14148805439472198, "num_tokens": 5920370.0, "step": 3405 }, { "entropy": 5.922806882858277, "epoch": 0.2653180315113791, "grad_norm": 1.25, "learning_rate": 0.0004996038663071902, "loss": 5.8398, "mean_token_accuracy": 0.14385833963751793, "num_tokens": 5928884.0, "step": 3410 }, { "entropy": 5.857811307907104, "epoch": 0.26570706088309665, "grad_norm": 1.203125, "learning_rate": 0.0004996022206952901, "loss": 5.857, "mean_token_accuracy": 0.13694723397493364, "num_tokens": 5938456.0, "step": 3415 }, { "entropy": 5.915801191329956, "epoch": 0.26609609025481423, "grad_norm": 1.1796875, "learning_rate": 0.0004996005716754086, "loss": 5.8785, "mean_token_accuracy": 0.14502357617020606, "num_tokens": 5947157.0, "step": 3420 }, { "entropy": 5.856646108627319, "epoch": 0.2664851196265318, "grad_norm": 1.2109375, "learning_rate": 0.000499598919247571, "loss": 5.7374, "mean_token_accuracy": 0.15310335159301758, "num_tokens": 5956084.0, "step": 3425 }, { "entropy": 5.784454250335694, "epoch": 0.26687414899824935, "grad_norm": 1.1875, "learning_rate": 0.0004995972634118023, "loss": 5.7743, "mean_token_accuracy": 0.14791329205036163, "num_tokens": 5964782.0, "step": 3430 }, { "entropy": 5.885459470748901, "epoch": 0.26726317836996694, "grad_norm": 1.15625, "learning_rate": 0.0004995956041681277, "loss": 5.9786, "mean_token_accuracy": 0.13400535508990288, "num_tokens": 5974013.0, "step": 3435 }, { "entropy": 5.869965076446533, "epoch": 0.2676522077416845, "grad_norm": 1.203125, "learning_rate": 0.0004995939415165722, "loss": 5.85, "mean_token_accuracy": 0.14296992719173432, "num_tokens": 5983351.0, "step": 3440 }, { "entropy": 5.8040210723876955, "epoch": 0.26804123711340205, "grad_norm": 1.1484375, "learning_rate": 0.0004995922754571611, "loss": 5.6754, "mean_token_accuracy": 0.15375011265277863, "num_tokens": 5992084.0, "step": 3445 }, { "entropy": 5.711496829986572, "epoch": 0.26843026648511964, "grad_norm": 1.1171875, "learning_rate": 0.0004995906059899197, "loss": 5.7014, "mean_token_accuracy": 0.1504288472235203, "num_tokens": 6001043.0, "step": 3450 }, { "entropy": 5.7762144088745115, "epoch": 0.26881929585683717, "grad_norm": 1.2578125, "learning_rate": 0.0004995889331148733, "loss": 5.7247, "mean_token_accuracy": 0.14711771607398988, "num_tokens": 6009620.0, "step": 3455 }, { "entropy": 5.789427089691162, "epoch": 0.26920832522855476, "grad_norm": 1.3046875, "learning_rate": 0.0004995872568320474, "loss": 5.7209, "mean_token_accuracy": 0.1434781163930893, "num_tokens": 6018278.0, "step": 3460 }, { "entropy": 5.775634527206421, "epoch": 0.26959735460027234, "grad_norm": 1.203125, "learning_rate": 0.0004995855771414673, "loss": 5.7694, "mean_token_accuracy": 0.14877430200576783, "num_tokens": 6026741.0, "step": 3465 }, { "entropy": 5.8912004947662355, "epoch": 0.2699863839719899, "grad_norm": 1.2109375, "learning_rate": 0.0004995838940431585, "loss": 5.7922, "mean_token_accuracy": 0.14324328750371934, "num_tokens": 6035370.0, "step": 3470 }, { "entropy": 5.831309652328491, "epoch": 0.27037541334370746, "grad_norm": 1.3046875, "learning_rate": 0.0004995822075371466, "loss": 5.7808, "mean_token_accuracy": 0.1441688671708107, "num_tokens": 6044372.0, "step": 3475 }, { "entropy": 5.8337959289550785, "epoch": 0.270764442715425, "grad_norm": 1.2109375, "learning_rate": 0.0004995805176234571, "loss": 5.7907, "mean_token_accuracy": 0.1507210314273834, "num_tokens": 6052940.0, "step": 3480 }, { "entropy": 5.863040447235107, "epoch": 0.2711534720871426, "grad_norm": 1.25, "learning_rate": 0.0004995788243021158, "loss": 5.7137, "mean_token_accuracy": 0.1456463798880577, "num_tokens": 6062048.0, "step": 3485 }, { "entropy": 5.742090702056885, "epoch": 0.27154250145886016, "grad_norm": 1.3515625, "learning_rate": 0.0004995771275731483, "loss": 5.7422, "mean_token_accuracy": 0.14996225386857986, "num_tokens": 6071478.0, "step": 3490 }, { "entropy": 5.718463277816772, "epoch": 0.2719315308305777, "grad_norm": 1.203125, "learning_rate": 0.0004995754274365802, "loss": 5.6752, "mean_token_accuracy": 0.15684566050767898, "num_tokens": 6080495.0, "step": 3495 }, { "entropy": 5.880794525146484, "epoch": 0.2723205602022953, "grad_norm": 1.2109375, "learning_rate": 0.0004995737238924376, "loss": 5.8302, "mean_token_accuracy": 0.13611356019973755, "num_tokens": 6090141.0, "step": 3500 }, { "entropy": 5.855888843536377, "epoch": 0.2727095895740128, "grad_norm": 1.203125, "learning_rate": 0.0004995720169407461, "loss": 5.7909, "mean_token_accuracy": 0.14242940098047258, "num_tokens": 6099215.0, "step": 3505 }, { "entropy": 5.864683771133423, "epoch": 0.2730986189457304, "grad_norm": 1.1328125, "learning_rate": 0.0004995703065815317, "loss": 5.8744, "mean_token_accuracy": 0.13853381276130677, "num_tokens": 6108802.0, "step": 3510 }, { "entropy": 5.982160949707032, "epoch": 0.273487648317448, "grad_norm": 1.1640625, "learning_rate": 0.0004995685928148203, "loss": 5.8708, "mean_token_accuracy": 0.14367551431059838, "num_tokens": 6117486.0, "step": 3515 }, { "entropy": 5.751517820358276, "epoch": 0.2738766776891655, "grad_norm": 1.2890625, "learning_rate": 0.000499566875640638, "loss": 5.691, "mean_token_accuracy": 0.15760284960269927, "num_tokens": 6125248.0, "step": 3520 }, { "entropy": 5.816810512542725, "epoch": 0.2742657070608831, "grad_norm": 1.1640625, "learning_rate": 0.0004995651550590108, "loss": 5.7458, "mean_token_accuracy": 0.14610794484615325, "num_tokens": 6134831.0, "step": 3525 }, { "entropy": 5.793434810638428, "epoch": 0.2746547364326007, "grad_norm": 1.1953125, "learning_rate": 0.0004995634310699647, "loss": 5.8221, "mean_token_accuracy": 0.1443501353263855, "num_tokens": 6143248.0, "step": 3530 }, { "entropy": 5.8795264720916744, "epoch": 0.2750437658043182, "grad_norm": 1.3046875, "learning_rate": 0.0004995617036735261, "loss": 5.829, "mean_token_accuracy": 0.14278091713786126, "num_tokens": 6151768.0, "step": 3535 }, { "entropy": 5.806972646713257, "epoch": 0.2754327951760358, "grad_norm": 1.2109375, "learning_rate": 0.0004995599728697211, "loss": 5.716, "mean_token_accuracy": 0.15529972016811372, "num_tokens": 6160091.0, "step": 3540 }, { "entropy": 5.80297966003418, "epoch": 0.27582182454775334, "grad_norm": 1.2109375, "learning_rate": 0.0004995582386585759, "loss": 5.8261, "mean_token_accuracy": 0.1379936493933201, "num_tokens": 6169440.0, "step": 3545 }, { "entropy": 5.845169639587402, "epoch": 0.2762108539194709, "grad_norm": 1.234375, "learning_rate": 0.0004995565010401167, "loss": 5.7921, "mean_token_accuracy": 0.14506490528583527, "num_tokens": 6177604.0, "step": 3550 }, { "entropy": 5.884006500244141, "epoch": 0.2765998832911885, "grad_norm": 1.2265625, "learning_rate": 0.0004995547600143702, "loss": 5.8005, "mean_token_accuracy": 0.13861700221896173, "num_tokens": 6186252.0, "step": 3555 }, { "entropy": 5.80251636505127, "epoch": 0.27698891266290604, "grad_norm": 1.171875, "learning_rate": 0.0004995530155813625, "loss": 5.7424, "mean_token_accuracy": 0.1510542720556259, "num_tokens": 6194641.0, "step": 3560 }, { "entropy": 5.8658629894256595, "epoch": 0.2773779420346236, "grad_norm": 1.140625, "learning_rate": 0.0004995512677411203, "loss": 5.8756, "mean_token_accuracy": 0.14317311719059944, "num_tokens": 6203925.0, "step": 3565 }, { "entropy": 5.895973205566406, "epoch": 0.27776697140634116, "grad_norm": 1.2109375, "learning_rate": 0.0004995495164936698, "loss": 5.7566, "mean_token_accuracy": 0.14684337750077248, "num_tokens": 6213001.0, "step": 3570 }, { "entropy": 5.795819807052612, "epoch": 0.27815600077805874, "grad_norm": 1.078125, "learning_rate": 0.0004995477618390381, "loss": 5.7686, "mean_token_accuracy": 0.1391209714114666, "num_tokens": 6221754.0, "step": 3575 }, { "entropy": 5.763400554656982, "epoch": 0.27854503014977633, "grad_norm": 1.1328125, "learning_rate": 0.0004995460037772513, "loss": 5.6719, "mean_token_accuracy": 0.14914391040802003, "num_tokens": 6229792.0, "step": 3580 }, { "entropy": 5.773159742355347, "epoch": 0.27893405952149386, "grad_norm": 1.109375, "learning_rate": 0.0004995442423083365, "loss": 5.7772, "mean_token_accuracy": 0.14420934915542602, "num_tokens": 6238839.0, "step": 3585 }, { "entropy": 5.84812970161438, "epoch": 0.27932308889321145, "grad_norm": 1.203125, "learning_rate": 0.0004995424774323201, "loss": 5.6807, "mean_token_accuracy": 0.14983972907066345, "num_tokens": 6246939.0, "step": 3590 }, { "entropy": 5.830242109298706, "epoch": 0.279712118264929, "grad_norm": 1.171875, "learning_rate": 0.000499540709149229, "loss": 5.8123, "mean_token_accuracy": 0.1413383439183235, "num_tokens": 6255858.0, "step": 3595 }, { "entropy": 5.772054052352905, "epoch": 0.28010114763664656, "grad_norm": 1.28125, "learning_rate": 0.0004995389374590901, "loss": 5.7289, "mean_token_accuracy": 0.14664228558540343, "num_tokens": 6265137.0, "step": 3600 }, { "entropy": 5.795121526718139, "epoch": 0.28049017700836415, "grad_norm": 1.1640625, "learning_rate": 0.0004995371623619301, "loss": 5.727, "mean_token_accuracy": 0.14856354743242264, "num_tokens": 6273286.0, "step": 3605 }, { "entropy": 5.699319839477539, "epoch": 0.2808792063800817, "grad_norm": 1.2578125, "learning_rate": 0.000499535383857776, "loss": 5.7434, "mean_token_accuracy": 0.1431848406791687, "num_tokens": 6282477.0, "step": 3610 }, { "entropy": 5.889150619506836, "epoch": 0.28126823575179927, "grad_norm": 1.1875, "learning_rate": 0.000499533601946655, "loss": 5.7949, "mean_token_accuracy": 0.14193343818187715, "num_tokens": 6291756.0, "step": 3615 }, { "entropy": 5.8616869926452635, "epoch": 0.2816572651235168, "grad_norm": 1.234375, "learning_rate": 0.0004995318166285938, "loss": 5.8663, "mean_token_accuracy": 0.13642492145299911, "num_tokens": 6301093.0, "step": 3620 }, { "entropy": 5.8186732769012455, "epoch": 0.2820462944952344, "grad_norm": 1.28125, "learning_rate": 0.0004995300279036199, "loss": 5.6829, "mean_token_accuracy": 0.15127351135015488, "num_tokens": 6310379.0, "step": 3625 }, { "entropy": 5.775457906723022, "epoch": 0.28243532386695197, "grad_norm": 1.2265625, "learning_rate": 0.00049952823577176, "loss": 5.7066, "mean_token_accuracy": 0.1457876168191433, "num_tokens": 6318983.0, "step": 3630 }, { "entropy": 5.753813028335571, "epoch": 0.2828243532386695, "grad_norm": 1.1640625, "learning_rate": 0.0004995264402330416, "loss": 5.7176, "mean_token_accuracy": 0.15276553630828857, "num_tokens": 6327816.0, "step": 3635 }, { "entropy": 5.794705772399903, "epoch": 0.2832133826103871, "grad_norm": 1.1953125, "learning_rate": 0.0004995246412874919, "loss": 5.8038, "mean_token_accuracy": 0.14400455206632615, "num_tokens": 6336693.0, "step": 3640 }, { "entropy": 5.853319835662842, "epoch": 0.2836024119821047, "grad_norm": 1.203125, "learning_rate": 0.000499522838935138, "loss": 5.7451, "mean_token_accuracy": 0.14893249571323394, "num_tokens": 6345456.0, "step": 3645 }, { "entropy": 5.794118928909302, "epoch": 0.2839914413538222, "grad_norm": 1.328125, "learning_rate": 0.0004995210331760074, "loss": 5.7217, "mean_token_accuracy": 0.15264002978801727, "num_tokens": 6353584.0, "step": 3650 }, { "entropy": 5.727006578445435, "epoch": 0.2843804707255398, "grad_norm": 1.140625, "learning_rate": 0.0004995192240101275, "loss": 5.7469, "mean_token_accuracy": 0.15091292411088944, "num_tokens": 6362258.0, "step": 3655 }, { "entropy": 5.738786602020264, "epoch": 0.2847695000972573, "grad_norm": 1.2890625, "learning_rate": 0.0004995174114375258, "loss": 5.6761, "mean_token_accuracy": 0.15246595144271852, "num_tokens": 6371373.0, "step": 3660 }, { "entropy": 5.864908266067505, "epoch": 0.2851585294689749, "grad_norm": 1.2890625, "learning_rate": 0.0004995155954582297, "loss": 5.7375, "mean_token_accuracy": 0.15102535858750343, "num_tokens": 6380431.0, "step": 3665 }, { "entropy": 5.861855220794678, "epoch": 0.2855475588406925, "grad_norm": 1.2734375, "learning_rate": 0.0004995137760722668, "loss": 5.9038, "mean_token_accuracy": 0.1457961119711399, "num_tokens": 6389305.0, "step": 3670 }, { "entropy": 5.851635265350342, "epoch": 0.28593658821241, "grad_norm": 1.171875, "learning_rate": 0.0004995119532796646, "loss": 5.7213, "mean_token_accuracy": 0.15150809288024902, "num_tokens": 6397065.0, "step": 3675 }, { "entropy": 5.806237506866455, "epoch": 0.2863256175841276, "grad_norm": 1.1640625, "learning_rate": 0.000499510127080451, "loss": 5.8472, "mean_token_accuracy": 0.13979469537734984, "num_tokens": 6407053.0, "step": 3680 }, { "entropy": 5.867288637161255, "epoch": 0.28671464695584514, "grad_norm": 1.234375, "learning_rate": 0.0004995082974746535, "loss": 5.8145, "mean_token_accuracy": 0.1415085345506668, "num_tokens": 6415165.0, "step": 3685 }, { "entropy": 5.869475412368774, "epoch": 0.28710367632756273, "grad_norm": 1.1875, "learning_rate": 0.0004995064644622999, "loss": 5.795, "mean_token_accuracy": 0.1459844619035721, "num_tokens": 6423646.0, "step": 3690 }, { "entropy": 5.868303823471069, "epoch": 0.2874927056992803, "grad_norm": 1.34375, "learning_rate": 0.0004995046280434181, "loss": 5.8131, "mean_token_accuracy": 0.1465369090437889, "num_tokens": 6432134.0, "step": 3695 }, { "entropy": 5.818410873413086, "epoch": 0.28788173507099785, "grad_norm": 1.1484375, "learning_rate": 0.0004995027882180358, "loss": 5.7027, "mean_token_accuracy": 0.1474486768245697, "num_tokens": 6440456.0, "step": 3700 }, { "entropy": 5.809641408920288, "epoch": 0.28827076444271543, "grad_norm": 1.15625, "learning_rate": 0.0004995009449861812, "loss": 5.7866, "mean_token_accuracy": 0.13990482091903686, "num_tokens": 6448952.0, "step": 3705 }, { "entropy": 5.804608154296875, "epoch": 0.28865979381443296, "grad_norm": 1.1796875, "learning_rate": 0.000499499098347882, "loss": 5.6512, "mean_token_accuracy": 0.16037264764308928, "num_tokens": 6457225.0, "step": 3710 }, { "entropy": 5.810186100006104, "epoch": 0.28904882318615055, "grad_norm": 1.1875, "learning_rate": 0.0004994972483031662, "loss": 5.7833, "mean_token_accuracy": 0.1467502385377884, "num_tokens": 6465450.0, "step": 3715 }, { "entropy": 5.810656881332397, "epoch": 0.28943785255786814, "grad_norm": 1.21875, "learning_rate": 0.000499495394852062, "loss": 5.8163, "mean_token_accuracy": 0.1399491086602211, "num_tokens": 6473736.0, "step": 3720 }, { "entropy": 5.83799033164978, "epoch": 0.28982688192958567, "grad_norm": 1.1953125, "learning_rate": 0.0004994935379945977, "loss": 5.7577, "mean_token_accuracy": 0.1468055784702301, "num_tokens": 6482092.0, "step": 3725 }, { "entropy": 5.8806088924407955, "epoch": 0.29021591130130325, "grad_norm": 1.234375, "learning_rate": 0.0004994916777308012, "loss": 5.7831, "mean_token_accuracy": 0.14831546545028687, "num_tokens": 6490704.0, "step": 3730 }, { "entropy": 5.850636386871338, "epoch": 0.29060494067302084, "grad_norm": 1.2734375, "learning_rate": 0.0004994898140607007, "loss": 5.7201, "mean_token_accuracy": 0.15038958936929703, "num_tokens": 6499634.0, "step": 3735 }, { "entropy": 5.743886566162109, "epoch": 0.29099397004473837, "grad_norm": 1.1953125, "learning_rate": 0.0004994879469843247, "loss": 5.8767, "mean_token_accuracy": 0.13921897560358049, "num_tokens": 6509261.0, "step": 3740 }, { "entropy": 5.8543627738952635, "epoch": 0.29138299941645596, "grad_norm": 1.1171875, "learning_rate": 0.0004994860765017013, "loss": 5.7098, "mean_token_accuracy": 0.14895353764295577, "num_tokens": 6517542.0, "step": 3745 }, { "entropy": 5.767716026306152, "epoch": 0.2917720287881735, "grad_norm": 1.171875, "learning_rate": 0.000499484202612859, "loss": 5.7096, "mean_token_accuracy": 0.14601053446531295, "num_tokens": 6525945.0, "step": 3750 }, { "entropy": 5.740671157836914, "epoch": 0.2921610581598911, "grad_norm": 1.2109375, "learning_rate": 0.0004994823253178264, "loss": 5.7276, "mean_token_accuracy": 0.1483728989958763, "num_tokens": 6534744.0, "step": 3755 }, { "entropy": 5.7915150165557865, "epoch": 0.29255008753160866, "grad_norm": 1.2578125, "learning_rate": 0.0004994804446166317, "loss": 5.6894, "mean_token_accuracy": 0.15682424753904342, "num_tokens": 6542640.0, "step": 3760 }, { "entropy": 5.801311922073364, "epoch": 0.2929391169033262, "grad_norm": 1.296875, "learning_rate": 0.0004994785605093035, "loss": 5.747, "mean_token_accuracy": 0.15235013365745545, "num_tokens": 6551292.0, "step": 3765 }, { "entropy": 5.7961516857147215, "epoch": 0.2933281462750438, "grad_norm": 1.1640625, "learning_rate": 0.0004994766729958705, "loss": 5.8392, "mean_token_accuracy": 0.1455648086965084, "num_tokens": 6560760.0, "step": 3770 }, { "entropy": 5.925059127807617, "epoch": 0.2937171756467613, "grad_norm": 1.21875, "learning_rate": 0.0004994747820763612, "loss": 5.8572, "mean_token_accuracy": 0.13900205940008165, "num_tokens": 6570618.0, "step": 3775 }, { "entropy": 5.86215295791626, "epoch": 0.2941062050184789, "grad_norm": 1.2265625, "learning_rate": 0.0004994728877508046, "loss": 5.7023, "mean_token_accuracy": 0.14909525960683823, "num_tokens": 6579484.0, "step": 3780 }, { "entropy": 5.818112993240357, "epoch": 0.2944952343901965, "grad_norm": 1.171875, "learning_rate": 0.0004994709900192289, "loss": 5.7803, "mean_token_accuracy": 0.1460746668279171, "num_tokens": 6588531.0, "step": 3785 }, { "entropy": 5.769961595535278, "epoch": 0.294884263761914, "grad_norm": 1.2265625, "learning_rate": 0.0004994690888816635, "loss": 5.8196, "mean_token_accuracy": 0.14704116955399513, "num_tokens": 6596862.0, "step": 3790 }, { "entropy": 5.825479936599732, "epoch": 0.2952732931336316, "grad_norm": 1.1328125, "learning_rate": 0.0004994671843381367, "loss": 5.723, "mean_token_accuracy": 0.14900503158569336, "num_tokens": 6605594.0, "step": 3795 }, { "entropy": 5.8890174388885494, "epoch": 0.29566232250534913, "grad_norm": 1.3046875, "learning_rate": 0.0004994652763886778, "loss": 5.7712, "mean_token_accuracy": 0.14753982722759246, "num_tokens": 6613971.0, "step": 3800 }, { "entropy": 5.812981510162354, "epoch": 0.2960513518770667, "grad_norm": 1.234375, "learning_rate": 0.0004994633650333155, "loss": 5.8431, "mean_token_accuracy": 0.1393670342862606, "num_tokens": 6623116.0, "step": 3805 }, { "entropy": 5.812322998046875, "epoch": 0.2964403812487843, "grad_norm": 1.1875, "learning_rate": 0.0004994614502720792, "loss": 5.7277, "mean_token_accuracy": 0.1557611882686615, "num_tokens": 6631910.0, "step": 3810 }, { "entropy": 5.8097423076629635, "epoch": 0.29682941062050183, "grad_norm": 1.15625, "learning_rate": 0.0004994595321049974, "loss": 5.7528, "mean_token_accuracy": 0.15263307020068168, "num_tokens": 6640882.0, "step": 3815 }, { "entropy": 5.902229881286621, "epoch": 0.2972184399922194, "grad_norm": 1.140625, "learning_rate": 0.0004994576105320994, "loss": 5.8396, "mean_token_accuracy": 0.1413460522890091, "num_tokens": 6649665.0, "step": 3820 }, { "entropy": 5.703270339965821, "epoch": 0.29760746936393695, "grad_norm": 1.1875, "learning_rate": 0.0004994556855534146, "loss": 5.6241, "mean_token_accuracy": 0.154371440410614, "num_tokens": 6658725.0, "step": 3825 }, { "entropy": 5.67880334854126, "epoch": 0.29799649873565454, "grad_norm": 1.1796875, "learning_rate": 0.0004994537571689719, "loss": 5.6708, "mean_token_accuracy": 0.1537424236536026, "num_tokens": 6667403.0, "step": 3830 }, { "entropy": 5.888912105560303, "epoch": 0.2983855281073721, "grad_norm": 1.1328125, "learning_rate": 0.0004994518253788007, "loss": 5.756, "mean_token_accuracy": 0.14269450083374977, "num_tokens": 6676673.0, "step": 3835 }, { "entropy": 5.810962390899658, "epoch": 0.29877455747908965, "grad_norm": 1.1953125, "learning_rate": 0.0004994498901829304, "loss": 5.7563, "mean_token_accuracy": 0.14370476379990577, "num_tokens": 6686212.0, "step": 3840 }, { "entropy": 5.744761562347412, "epoch": 0.29916358685080724, "grad_norm": 1.2265625, "learning_rate": 0.0004994479515813903, "loss": 5.7617, "mean_token_accuracy": 0.14795507341623307, "num_tokens": 6694812.0, "step": 3845 }, { "entropy": 5.79722900390625, "epoch": 0.2995526162225248, "grad_norm": 1.1484375, "learning_rate": 0.0004994460095742096, "loss": 5.7061, "mean_token_accuracy": 0.14745592027902604, "num_tokens": 6703439.0, "step": 3850 }, { "entropy": 5.837129878997803, "epoch": 0.29994164559424236, "grad_norm": 1.265625, "learning_rate": 0.000499444064161418, "loss": 5.7082, "mean_token_accuracy": 0.14777314588427543, "num_tokens": 6711465.0, "step": 3855 }, { "entropy": 5.729570055007935, "epoch": 0.30033067496595994, "grad_norm": 1.171875, "learning_rate": 0.000499442115343045, "loss": 5.7249, "mean_token_accuracy": 0.14670694693922998, "num_tokens": 6720526.0, "step": 3860 }, { "entropy": 5.893850612640381, "epoch": 0.3007197043376775, "grad_norm": 1.265625, "learning_rate": 0.0004994401631191202, "loss": 5.9148, "mean_token_accuracy": 0.1395176962018013, "num_tokens": 6728696.0, "step": 3865 }, { "entropy": 5.797284650802612, "epoch": 0.30110873370939506, "grad_norm": 1.3828125, "learning_rate": 0.0004994382074896731, "loss": 5.7731, "mean_token_accuracy": 0.14963408410549164, "num_tokens": 6737955.0, "step": 3870 }, { "entropy": 5.84608416557312, "epoch": 0.30149776308111265, "grad_norm": 1.234375, "learning_rate": 0.0004994362484547335, "loss": 5.8347, "mean_token_accuracy": 0.14240911602973938, "num_tokens": 6746413.0, "step": 3875 }, { "entropy": 5.765618562698364, "epoch": 0.3018867924528302, "grad_norm": 1.2109375, "learning_rate": 0.0004994342860143309, "loss": 5.6949, "mean_token_accuracy": 0.14801103472709656, "num_tokens": 6754341.0, "step": 3880 }, { "entropy": 5.667687511444091, "epoch": 0.30227582182454776, "grad_norm": 1.2265625, "learning_rate": 0.0004994323201684953, "loss": 5.5675, "mean_token_accuracy": 0.15506181120872498, "num_tokens": 6762623.0, "step": 3885 }, { "entropy": 5.747409772872925, "epoch": 0.3026648511962653, "grad_norm": 1.125, "learning_rate": 0.0004994303509172566, "loss": 5.7186, "mean_token_accuracy": 0.14648325890302658, "num_tokens": 6771270.0, "step": 3890 }, { "entropy": 5.833155012130737, "epoch": 0.3030538805679829, "grad_norm": 1.0625, "learning_rate": 0.0004994283782606444, "loss": 5.7834, "mean_token_accuracy": 0.14363724514842033, "num_tokens": 6780292.0, "step": 3895 }, { "entropy": 5.880225801467896, "epoch": 0.30344290993970047, "grad_norm": 1.3046875, "learning_rate": 0.0004994264021986888, "loss": 5.6681, "mean_token_accuracy": 0.15166061818599702, "num_tokens": 6788580.0, "step": 3900 }, { "entropy": 5.639140987396241, "epoch": 0.303831939311418, "grad_norm": 1.328125, "learning_rate": 0.0004994244227314197, "loss": 5.6524, "mean_token_accuracy": 0.14872112795710563, "num_tokens": 6796801.0, "step": 3905 }, { "entropy": 5.7354284763336185, "epoch": 0.3042209686831356, "grad_norm": 1.109375, "learning_rate": 0.0004994224398588672, "loss": 5.6678, "mean_token_accuracy": 0.14618211537599562, "num_tokens": 6805630.0, "step": 3910 }, { "entropy": 5.683595514297485, "epoch": 0.3046099980548531, "grad_norm": 1.21875, "learning_rate": 0.0004994204535810615, "loss": 5.6425, "mean_token_accuracy": 0.15028658956289292, "num_tokens": 6814316.0, "step": 3915 }, { "entropy": 5.896274042129517, "epoch": 0.3049990274265707, "grad_norm": 1.296875, "learning_rate": 0.0004994184638980326, "loss": 5.8131, "mean_token_accuracy": 0.14128096029162407, "num_tokens": 6823224.0, "step": 3920 }, { "entropy": 5.82032413482666, "epoch": 0.3053880567982883, "grad_norm": 1.1796875, "learning_rate": 0.0004994164708098107, "loss": 5.8399, "mean_token_accuracy": 0.1436244174838066, "num_tokens": 6832104.0, "step": 3925 }, { "entropy": 5.832739591598511, "epoch": 0.3057770861700058, "grad_norm": 1.15625, "learning_rate": 0.000499414474316426, "loss": 5.7432, "mean_token_accuracy": 0.1472333326935768, "num_tokens": 6841208.0, "step": 3930 }, { "entropy": 5.652276039123535, "epoch": 0.3061661155417234, "grad_norm": 1.2890625, "learning_rate": 0.0004994124744179088, "loss": 5.546, "mean_token_accuracy": 0.15998484641313554, "num_tokens": 6849622.0, "step": 3935 }, { "entropy": 5.7208733558654785, "epoch": 0.306555144913441, "grad_norm": 1.203125, "learning_rate": 0.0004994104711142896, "loss": 5.7513, "mean_token_accuracy": 0.1525330901145935, "num_tokens": 6857355.0, "step": 3940 }, { "entropy": 5.833088970184326, "epoch": 0.3069441742851585, "grad_norm": 1.234375, "learning_rate": 0.0004994084644055986, "loss": 5.764, "mean_token_accuracy": 0.15032006576657295, "num_tokens": 6866173.0, "step": 3945 }, { "entropy": 5.745790719985962, "epoch": 0.3073332036568761, "grad_norm": 1.25, "learning_rate": 0.0004994064542918664, "loss": 5.7618, "mean_token_accuracy": 0.14327194094657897, "num_tokens": 6874438.0, "step": 3950 }, { "entropy": 5.838888788223267, "epoch": 0.30772223302859364, "grad_norm": 1.15625, "learning_rate": 0.0004994044407731235, "loss": 5.7559, "mean_token_accuracy": 0.14924216270446777, "num_tokens": 6882790.0, "step": 3955 }, { "entropy": 5.77858567237854, "epoch": 0.3081112624003112, "grad_norm": 1.1640625, "learning_rate": 0.0004994024238494002, "loss": 5.8004, "mean_token_accuracy": 0.13810172826051711, "num_tokens": 6891375.0, "step": 3960 }, { "entropy": 5.672658538818359, "epoch": 0.3085002917720288, "grad_norm": 1.203125, "learning_rate": 0.0004994004035207274, "loss": 5.7009, "mean_token_accuracy": 0.15040683150291442, "num_tokens": 6899510.0, "step": 3965 }, { "entropy": 5.849552297592163, "epoch": 0.30888932114374634, "grad_norm": 1.296875, "learning_rate": 0.0004993983797871356, "loss": 5.7546, "mean_token_accuracy": 0.15272879973053932, "num_tokens": 6908311.0, "step": 3970 }, { "entropy": 5.77811074256897, "epoch": 0.30927835051546393, "grad_norm": 1.265625, "learning_rate": 0.0004993963526486555, "loss": 5.7107, "mean_token_accuracy": 0.14666830450296403, "num_tokens": 6917064.0, "step": 3975 }, { "entropy": 5.765193367004395, "epoch": 0.30966737988718146, "grad_norm": 1.3203125, "learning_rate": 0.000499394322105318, "loss": 5.7055, "mean_token_accuracy": 0.14877342879772187, "num_tokens": 6925705.0, "step": 3980 }, { "entropy": 5.929165410995483, "epoch": 0.31005640925889905, "grad_norm": 1.1875, "learning_rate": 0.0004993922881571538, "loss": 5.8505, "mean_token_accuracy": 0.14009160473942756, "num_tokens": 6934232.0, "step": 3985 }, { "entropy": 5.842931127548217, "epoch": 0.31044543863061663, "grad_norm": 1.2734375, "learning_rate": 0.0004993902508041939, "loss": 5.7825, "mean_token_accuracy": 0.1494826927781105, "num_tokens": 6943143.0, "step": 3990 }, { "entropy": 5.784590435028076, "epoch": 0.31083446800233416, "grad_norm": 1.1796875, "learning_rate": 0.000499388210046469, "loss": 5.6572, "mean_token_accuracy": 0.15119214802980424, "num_tokens": 6951613.0, "step": 3995 }, { "entropy": 5.781867980957031, "epoch": 0.31122349737405175, "grad_norm": 1.3515625, "learning_rate": 0.0004993861658840102, "loss": 5.8635, "mean_token_accuracy": 0.144657726585865, "num_tokens": 6960531.0, "step": 4000 }, { "entropy": 5.813362073898316, "epoch": 0.3116125267457693, "grad_norm": 1.2734375, "learning_rate": 0.0004993841183168484, "loss": 5.7836, "mean_token_accuracy": 0.14522304087877275, "num_tokens": 6969211.0, "step": 4005 }, { "entropy": 5.923810148239136, "epoch": 0.31200155611748687, "grad_norm": 1.1953125, "learning_rate": 0.0004993820673450148, "loss": 5.8097, "mean_token_accuracy": 0.14293079674243928, "num_tokens": 6978414.0, "step": 4010 }, { "entropy": 5.676694631576538, "epoch": 0.31239058548920445, "grad_norm": 1.203125, "learning_rate": 0.0004993800129685404, "loss": 5.5568, "mean_token_accuracy": 0.15368023365736008, "num_tokens": 6987350.0, "step": 4015 }, { "entropy": 5.725512933731079, "epoch": 0.312779614860922, "grad_norm": 1.2265625, "learning_rate": 0.0004993779551874565, "loss": 5.7006, "mean_token_accuracy": 0.15659889280796052, "num_tokens": 6995817.0, "step": 4020 }, { "entropy": 5.77770471572876, "epoch": 0.31316864423263957, "grad_norm": 1.390625, "learning_rate": 0.0004993758940017943, "loss": 5.7712, "mean_token_accuracy": 0.14786949157714843, "num_tokens": 7004454.0, "step": 4025 }, { "entropy": 5.818613433837891, "epoch": 0.31355767360435716, "grad_norm": 1.296875, "learning_rate": 0.000499373829411585, "loss": 5.712, "mean_token_accuracy": 0.1497095689177513, "num_tokens": 7012126.0, "step": 4030 }, { "entropy": 5.80422043800354, "epoch": 0.3139467029760747, "grad_norm": 1.15625, "learning_rate": 0.00049937176141686, "loss": 5.7819, "mean_token_accuracy": 0.15036623552441597, "num_tokens": 7021232.0, "step": 4035 }, { "entropy": 5.852689599990844, "epoch": 0.3143357323477923, "grad_norm": 1.2734375, "learning_rate": 0.0004993696900176506, "loss": 5.7645, "mean_token_accuracy": 0.14852062985301018, "num_tokens": 7029488.0, "step": 4040 }, { "entropy": 5.820941209793091, "epoch": 0.3147247617195098, "grad_norm": 1.2578125, "learning_rate": 0.0004993676152139883, "loss": 5.7985, "mean_token_accuracy": 0.1442652441561222, "num_tokens": 7037323.0, "step": 4045 }, { "entropy": 5.7845946788787845, "epoch": 0.3151137910912274, "grad_norm": 1.328125, "learning_rate": 0.0004993655370059046, "loss": 5.7531, "mean_token_accuracy": 0.14139595925807952, "num_tokens": 7045754.0, "step": 4050 }, { "entropy": 5.7826457023620605, "epoch": 0.315502820462945, "grad_norm": 1.3046875, "learning_rate": 0.0004993634553934309, "loss": 5.6884, "mean_token_accuracy": 0.14923796579241752, "num_tokens": 7054026.0, "step": 4055 }, { "entropy": 5.715740585327149, "epoch": 0.3158918498346625, "grad_norm": 1.2109375, "learning_rate": 0.0004993613703765989, "loss": 5.7329, "mean_token_accuracy": 0.1490222007036209, "num_tokens": 7063383.0, "step": 4060 }, { "entropy": 5.74744987487793, "epoch": 0.3162808792063801, "grad_norm": 1.265625, "learning_rate": 0.0004993592819554402, "loss": 5.7028, "mean_token_accuracy": 0.15151856541633607, "num_tokens": 7071952.0, "step": 4065 }, { "entropy": 5.862038898468017, "epoch": 0.3166699085780976, "grad_norm": 1.375, "learning_rate": 0.0004993571901299866, "loss": 5.7424, "mean_token_accuracy": 0.1466784045100212, "num_tokens": 7080283.0, "step": 4070 }, { "entropy": 5.658473825454712, "epoch": 0.3170589379498152, "grad_norm": 1.2578125, "learning_rate": 0.0004993550949002697, "loss": 5.6853, "mean_token_accuracy": 0.14666975438594818, "num_tokens": 7088669.0, "step": 4075 }, { "entropy": 5.697621583938599, "epoch": 0.3174479673215328, "grad_norm": 1.2734375, "learning_rate": 0.0004993529962663213, "loss": 5.5697, "mean_token_accuracy": 0.16409860402345658, "num_tokens": 7097201.0, "step": 4080 }, { "entropy": 5.748375940322876, "epoch": 0.31783699669325033, "grad_norm": 1.2578125, "learning_rate": 0.0004993508942281732, "loss": 5.7527, "mean_token_accuracy": 0.14704224616289138, "num_tokens": 7106509.0, "step": 4085 }, { "entropy": 5.772694444656372, "epoch": 0.3182260260649679, "grad_norm": 1.3203125, "learning_rate": 0.0004993487887858575, "loss": 5.662, "mean_token_accuracy": 0.15324160903692247, "num_tokens": 7114550.0, "step": 4090 }, { "entropy": 5.823660564422608, "epoch": 0.31861505543668545, "grad_norm": 1.125, "learning_rate": 0.000499346679939406, "loss": 5.7734, "mean_token_accuracy": 0.15043377876281738, "num_tokens": 7122875.0, "step": 4095 }, { "entropy": 5.785100364685059, "epoch": 0.31900408480840303, "grad_norm": 1.203125, "learning_rate": 0.0004993445676888507, "loss": 5.5858, "mean_token_accuracy": 0.14903404712677001, "num_tokens": 7132263.0, "step": 4100 }, { "entropy": 5.708623313903809, "epoch": 0.3193931141801206, "grad_norm": 1.1484375, "learning_rate": 0.0004993424520342236, "loss": 5.8122, "mean_token_accuracy": 0.14726694226264953, "num_tokens": 7141448.0, "step": 4105 }, { "entropy": 5.757666683197021, "epoch": 0.31978214355183815, "grad_norm": 1.1953125, "learning_rate": 0.0004993403329755569, "loss": 5.8158, "mean_token_accuracy": 0.14173928201198577, "num_tokens": 7151021.0, "step": 4110 }, { "entropy": 5.908272171020508, "epoch": 0.32017117292355574, "grad_norm": 1.2734375, "learning_rate": 0.0004993382105128828, "loss": 5.7724, "mean_token_accuracy": 0.14403056129813194, "num_tokens": 7160103.0, "step": 4115 }, { "entropy": 5.794647169113159, "epoch": 0.32056020229527327, "grad_norm": 1.25, "learning_rate": 0.0004993360846462333, "loss": 5.7575, "mean_token_accuracy": 0.14108945354819297, "num_tokens": 7169003.0, "step": 4120 }, { "entropy": 5.856556415557861, "epoch": 0.32094923166699085, "grad_norm": 1.234375, "learning_rate": 0.0004993339553756408, "loss": 5.8024, "mean_token_accuracy": 0.15243273302912713, "num_tokens": 7177086.0, "step": 4125 }, { "entropy": 5.769464302062988, "epoch": 0.32133826103870844, "grad_norm": 1.15625, "learning_rate": 0.0004993318227011378, "loss": 5.674, "mean_token_accuracy": 0.15314000099897385, "num_tokens": 7185772.0, "step": 4130 }, { "entropy": 5.854861259460449, "epoch": 0.32172729041042597, "grad_norm": 1.25, "learning_rate": 0.0004993296866227562, "loss": 5.8114, "mean_token_accuracy": 0.14875666797161102, "num_tokens": 7194394.0, "step": 4135 }, { "entropy": 5.803802633285523, "epoch": 0.32211631978214356, "grad_norm": 1.25, "learning_rate": 0.0004993275471405288, "loss": 5.6327, "mean_token_accuracy": 0.15715198665857316, "num_tokens": 7202143.0, "step": 4140 }, { "entropy": 5.6745908737182615, "epoch": 0.32250534915386114, "grad_norm": 1.2421875, "learning_rate": 0.0004993254042544879, "loss": 5.737, "mean_token_accuracy": 0.14759556651115419, "num_tokens": 7210645.0, "step": 4145 }, { "entropy": 5.773699808120727, "epoch": 0.3228943785255787, "grad_norm": 1.1640625, "learning_rate": 0.000499323257964666, "loss": 5.6711, "mean_token_accuracy": 0.15104791671037673, "num_tokens": 7218872.0, "step": 4150 }, { "entropy": 5.864423131942749, "epoch": 0.32328340789729626, "grad_norm": 1.1484375, "learning_rate": 0.0004993211082710957, "loss": 5.8581, "mean_token_accuracy": 0.14464571326971054, "num_tokens": 7226977.0, "step": 4155 }, { "entropy": 5.803394317626953, "epoch": 0.3236724372690138, "grad_norm": 1.25, "learning_rate": 0.0004993189551738097, "loss": 5.6977, "mean_token_accuracy": 0.14795618653297424, "num_tokens": 7235635.0, "step": 4160 }, { "entropy": 5.760642957687378, "epoch": 0.3240614666407314, "grad_norm": 1.234375, "learning_rate": 0.0004993167986728405, "loss": 5.6863, "mean_token_accuracy": 0.15549185127019882, "num_tokens": 7244506.0, "step": 4165 }, { "entropy": 5.751373052597046, "epoch": 0.32445049601244896, "grad_norm": 1.2734375, "learning_rate": 0.000499314638768221, "loss": 5.7222, "mean_token_accuracy": 0.149913389980793, "num_tokens": 7252883.0, "step": 4170 }, { "entropy": 5.821081495285034, "epoch": 0.3248395253841665, "grad_norm": 1.3203125, "learning_rate": 0.0004993124754599839, "loss": 5.6798, "mean_token_accuracy": 0.14590843692421912, "num_tokens": 7261580.0, "step": 4175 }, { "entropy": 5.793644857406616, "epoch": 0.3252285547558841, "grad_norm": 1.1875, "learning_rate": 0.0004993103087481619, "loss": 5.7723, "mean_token_accuracy": 0.1446990892291069, "num_tokens": 7270346.0, "step": 4180 }, { "entropy": 5.804017353057861, "epoch": 0.3256175841276016, "grad_norm": 1.21875, "learning_rate": 0.0004993081386327881, "loss": 5.8424, "mean_token_accuracy": 0.14238107204437256, "num_tokens": 7279393.0, "step": 4185 }, { "entropy": 5.733974027633667, "epoch": 0.3260066134993192, "grad_norm": 1.296875, "learning_rate": 0.0004993059651138953, "loss": 5.6846, "mean_token_accuracy": 0.14898681640625, "num_tokens": 7287929.0, "step": 4190 }, { "entropy": 5.858212947845459, "epoch": 0.3263956428710368, "grad_norm": 1.203125, "learning_rate": 0.0004993037881915165, "loss": 5.7203, "mean_token_accuracy": 0.14945944994688035, "num_tokens": 7296336.0, "step": 4195 }, { "entropy": 5.687768888473511, "epoch": 0.3267846722427543, "grad_norm": 1.2109375, "learning_rate": 0.0004993016078656847, "loss": 5.6126, "mean_token_accuracy": 0.15262411832809447, "num_tokens": 7304624.0, "step": 4200 }, { "entropy": 5.690052080154419, "epoch": 0.3271737016144719, "grad_norm": 1.171875, "learning_rate": 0.000499299424136433, "loss": 5.7504, "mean_token_accuracy": 0.14595601409673692, "num_tokens": 7312945.0, "step": 4205 }, { "entropy": 5.824770212173462, "epoch": 0.32756273098618943, "grad_norm": 1.25, "learning_rate": 0.0004992972370037946, "loss": 5.669, "mean_token_accuracy": 0.15038443952798844, "num_tokens": 7321273.0, "step": 4210 }, { "entropy": 5.8330482006072994, "epoch": 0.327951760357907, "grad_norm": 1.2109375, "learning_rate": 0.0004992950464678026, "loss": 5.7675, "mean_token_accuracy": 0.15167799592018127, "num_tokens": 7330446.0, "step": 4215 }, { "entropy": 5.669593095779419, "epoch": 0.3283407897296246, "grad_norm": 1.390625, "learning_rate": 0.0004992928525284903, "loss": 5.704, "mean_token_accuracy": 0.1521438404917717, "num_tokens": 7339282.0, "step": 4220 }, { "entropy": 5.752499961853028, "epoch": 0.32872981910134214, "grad_norm": 1.2578125, "learning_rate": 0.000499290655185891, "loss": 5.6707, "mean_token_accuracy": 0.14109978452324867, "num_tokens": 7347848.0, "step": 4225 }, { "entropy": 5.679991912841797, "epoch": 0.3291188484730597, "grad_norm": 1.1796875, "learning_rate": 0.000499288454440038, "loss": 5.6748, "mean_token_accuracy": 0.15071465373039244, "num_tokens": 7356678.0, "step": 4230 }, { "entropy": 5.791227054595947, "epoch": 0.3295078778447773, "grad_norm": 1.234375, "learning_rate": 0.0004992862502909645, "loss": 5.7363, "mean_token_accuracy": 0.15067468732595443, "num_tokens": 7365411.0, "step": 4235 }, { "entropy": 5.725597524642945, "epoch": 0.32989690721649484, "grad_norm": 1.296875, "learning_rate": 0.0004992840427387043, "loss": 5.6558, "mean_token_accuracy": 0.15863664150238038, "num_tokens": 7373635.0, "step": 4240 }, { "entropy": 5.772441816329956, "epoch": 0.3302859365882124, "grad_norm": 1.328125, "learning_rate": 0.0004992818317832908, "loss": 5.7525, "mean_token_accuracy": 0.15104876458644867, "num_tokens": 7382469.0, "step": 4245 }, { "entropy": 5.791848611831665, "epoch": 0.33067496595992996, "grad_norm": 1.3125, "learning_rate": 0.0004992796174247574, "loss": 5.7456, "mean_token_accuracy": 0.14663487672805786, "num_tokens": 7390712.0, "step": 4250 }, { "entropy": 5.83238000869751, "epoch": 0.33106399533164754, "grad_norm": 1.34375, "learning_rate": 0.0004992773996631378, "loss": 5.6763, "mean_token_accuracy": 0.14819879531860353, "num_tokens": 7398905.0, "step": 4255 }, { "entropy": 5.7469171524047855, "epoch": 0.33145302470336513, "grad_norm": 1.2734375, "learning_rate": 0.0004992751784984656, "loss": 5.7521, "mean_token_accuracy": 0.14595615193247796, "num_tokens": 7407242.0, "step": 4260 }, { "entropy": 5.742021656036377, "epoch": 0.33184205407508266, "grad_norm": 1.1953125, "learning_rate": 0.0004992729539307745, "loss": 5.7694, "mean_token_accuracy": 0.1436052680015564, "num_tokens": 7416489.0, "step": 4265 }, { "entropy": 5.906120681762696, "epoch": 0.33223108344680025, "grad_norm": 1.234375, "learning_rate": 0.0004992707259600984, "loss": 5.7559, "mean_token_accuracy": 0.1527278333902359, "num_tokens": 7424507.0, "step": 4270 }, { "entropy": 5.736468029022217, "epoch": 0.3326201128185178, "grad_norm": 1.2890625, "learning_rate": 0.0004992684945864709, "loss": 5.746, "mean_token_accuracy": 0.1425243631005287, "num_tokens": 7433343.0, "step": 4275 }, { "entropy": 5.7437169551849365, "epoch": 0.33300914219023536, "grad_norm": 1.2578125, "learning_rate": 0.0004992662598099261, "loss": 5.6856, "mean_token_accuracy": 0.15159007757902146, "num_tokens": 7441452.0, "step": 4280 }, { "entropy": 5.82387146949768, "epoch": 0.33339817156195295, "grad_norm": 1.3125, "learning_rate": 0.0004992640216304975, "loss": 5.7383, "mean_token_accuracy": 0.15166881456971168, "num_tokens": 7449541.0, "step": 4285 }, { "entropy": 5.772676610946656, "epoch": 0.3337872009336705, "grad_norm": 1.2421875, "learning_rate": 0.0004992617800482196, "loss": 5.7508, "mean_token_accuracy": 0.1446318544447422, "num_tokens": 7458812.0, "step": 4290 }, { "entropy": 5.80000319480896, "epoch": 0.33417623030538807, "grad_norm": 1.2734375, "learning_rate": 0.000499259535063126, "loss": 5.6754, "mean_token_accuracy": 0.14619821310043335, "num_tokens": 7467607.0, "step": 4295 }, { "entropy": 5.712003326416015, "epoch": 0.3345652596771056, "grad_norm": 1.34375, "learning_rate": 0.000499257286675251, "loss": 5.6227, "mean_token_accuracy": 0.1527673527598381, "num_tokens": 7476047.0, "step": 4300 }, { "entropy": 5.78293080329895, "epoch": 0.3349542890488232, "grad_norm": 1.390625, "learning_rate": 0.0004992550348846285, "loss": 5.6868, "mean_token_accuracy": 0.14961570352315903, "num_tokens": 7484496.0, "step": 4305 }, { "entropy": 5.65687518119812, "epoch": 0.33534331842054077, "grad_norm": 1.25, "learning_rate": 0.0004992527796912928, "loss": 5.612, "mean_token_accuracy": 0.15613239780068397, "num_tokens": 7493161.0, "step": 4310 }, { "entropy": 5.699185752868653, "epoch": 0.3357323477922583, "grad_norm": 1.3359375, "learning_rate": 0.0004992505210952782, "loss": 5.7685, "mean_token_accuracy": 0.14365074336528777, "num_tokens": 7502122.0, "step": 4315 }, { "entropy": 5.795812940597534, "epoch": 0.3361213771639759, "grad_norm": 1.28125, "learning_rate": 0.0004992482590966188, "loss": 5.7234, "mean_token_accuracy": 0.14752976670861245, "num_tokens": 7510369.0, "step": 4320 }, { "entropy": 5.68804521560669, "epoch": 0.3365104065356934, "grad_norm": 1.3203125, "learning_rate": 0.0004992459936953489, "loss": 5.6099, "mean_token_accuracy": 0.158554507791996, "num_tokens": 7519321.0, "step": 4325 }, { "entropy": 5.735086917877197, "epoch": 0.336899435907411, "grad_norm": 1.1796875, "learning_rate": 0.0004992437248915032, "loss": 5.655, "mean_token_accuracy": 0.1553067222237587, "num_tokens": 7528196.0, "step": 4330 }, { "entropy": 5.724933862686157, "epoch": 0.3372884652791286, "grad_norm": 1.28125, "learning_rate": 0.0004992414526851157, "loss": 5.7136, "mean_token_accuracy": 0.1463082104921341, "num_tokens": 7536124.0, "step": 4335 }, { "entropy": 5.84370985031128, "epoch": 0.3376774946508461, "grad_norm": 1.2109375, "learning_rate": 0.0004992391770762212, "loss": 5.8058, "mean_token_accuracy": 0.1447911098599434, "num_tokens": 7544409.0, "step": 4340 }, { "entropy": 5.809447193145752, "epoch": 0.3380665240225637, "grad_norm": 1.140625, "learning_rate": 0.000499236898064854, "loss": 5.7001, "mean_token_accuracy": 0.1530858114361763, "num_tokens": 7552803.0, "step": 4345 }, { "entropy": 5.6515076637268065, "epoch": 0.3384555533942813, "grad_norm": 1.2578125, "learning_rate": 0.0004992346156510488, "loss": 5.6644, "mean_token_accuracy": 0.1459401488304138, "num_tokens": 7561909.0, "step": 4350 }, { "entropy": 5.825453233718872, "epoch": 0.3388445827659988, "grad_norm": 1.203125, "learning_rate": 0.0004992323298348403, "loss": 5.7289, "mean_token_accuracy": 0.14583828970789908, "num_tokens": 7571759.0, "step": 4355 }, { "entropy": 5.8584259986877445, "epoch": 0.3392336121377164, "grad_norm": 1.1875, "learning_rate": 0.000499230040616263, "loss": 5.8566, "mean_token_accuracy": 0.15016695931553842, "num_tokens": 7580010.0, "step": 4360 }, { "entropy": 5.782916736602783, "epoch": 0.33962264150943394, "grad_norm": 1.1171875, "learning_rate": 0.0004992277479953518, "loss": 5.6514, "mean_token_accuracy": 0.14859042316675186, "num_tokens": 7587841.0, "step": 4365 }, { "entropy": 5.720286655426025, "epoch": 0.34001167088115153, "grad_norm": 1.25, "learning_rate": 0.0004992254519721414, "loss": 5.6889, "mean_token_accuracy": 0.14878612980246544, "num_tokens": 7596187.0, "step": 4370 }, { "entropy": 5.681316328048706, "epoch": 0.3404007002528691, "grad_norm": 1.25, "learning_rate": 0.0004992231525466666, "loss": 5.6074, "mean_token_accuracy": 0.15483227521181106, "num_tokens": 7604361.0, "step": 4375 }, { "entropy": 5.770654630661011, "epoch": 0.34078972962458665, "grad_norm": 1.2109375, "learning_rate": 0.0004992208497189624, "loss": 5.6927, "mean_token_accuracy": 0.1531132161617279, "num_tokens": 7613173.0, "step": 4380 }, { "entropy": 5.7282201766967775, "epoch": 0.34117875899630423, "grad_norm": 1.21875, "learning_rate": 0.0004992185434890637, "loss": 5.7741, "mean_token_accuracy": 0.14267738461494445, "num_tokens": 7621730.0, "step": 4385 }, { "entropy": 5.8589198112487795, "epoch": 0.34156778836802176, "grad_norm": 1.15625, "learning_rate": 0.0004992162338570055, "loss": 5.7414, "mean_token_accuracy": 0.15011457800865174, "num_tokens": 7630362.0, "step": 4390 }, { "entropy": 5.7542157649993895, "epoch": 0.34195681773973935, "grad_norm": 1.3828125, "learning_rate": 0.0004992139208228227, "loss": 5.7186, "mean_token_accuracy": 0.14609325155615807, "num_tokens": 7639368.0, "step": 4395 }, { "entropy": 5.7741481304168705, "epoch": 0.34234584711145694, "grad_norm": 1.2578125, "learning_rate": 0.0004992116043865506, "loss": 5.7489, "mean_token_accuracy": 0.1471161961555481, "num_tokens": 7648399.0, "step": 4400 }, { "entropy": 5.7407738208770756, "epoch": 0.34273487648317447, "grad_norm": 1.1953125, "learning_rate": 0.0004992092845482244, "loss": 5.5847, "mean_token_accuracy": 0.15751371681690216, "num_tokens": 7657298.0, "step": 4405 }, { "entropy": 5.788975954055786, "epoch": 0.34312390585489205, "grad_norm": 1.25, "learning_rate": 0.0004992069613078791, "loss": 5.7176, "mean_token_accuracy": 0.15156893134117128, "num_tokens": 7665328.0, "step": 4410 }, { "entropy": 5.724450349807739, "epoch": 0.3435129352266096, "grad_norm": 1.28125, "learning_rate": 0.0004992046346655499, "loss": 5.6566, "mean_token_accuracy": 0.1507851794362068, "num_tokens": 7674610.0, "step": 4415 }, { "entropy": 5.772369146347046, "epoch": 0.34390196459832717, "grad_norm": 1.2578125, "learning_rate": 0.0004992023046212723, "loss": 5.6962, "mean_token_accuracy": 0.15413508117198943, "num_tokens": 7682727.0, "step": 4420 }, { "entropy": 5.71473445892334, "epoch": 0.34429099397004476, "grad_norm": 1.3828125, "learning_rate": 0.0004991999711750816, "loss": 5.6621, "mean_token_accuracy": 0.15658219903707504, "num_tokens": 7691547.0, "step": 4425 }, { "entropy": 5.73526964187622, "epoch": 0.3446800233417623, "grad_norm": 1.1640625, "learning_rate": 0.0004991976343270133, "loss": 5.6102, "mean_token_accuracy": 0.15017578452825547, "num_tokens": 7699987.0, "step": 4430 }, { "entropy": 5.739548635482788, "epoch": 0.3450690527134799, "grad_norm": 1.4140625, "learning_rate": 0.0004991952940771026, "loss": 5.6789, "mean_token_accuracy": 0.15383388996124267, "num_tokens": 7708397.0, "step": 4435 }, { "entropy": 5.745605754852295, "epoch": 0.34545808208519746, "grad_norm": 1.390625, "learning_rate": 0.0004991929504253852, "loss": 5.6689, "mean_token_accuracy": 0.14823864698410033, "num_tokens": 7716795.0, "step": 4440 }, { "entropy": 5.750987958908081, "epoch": 0.345847111456915, "grad_norm": 1.25, "learning_rate": 0.0004991906033718966, "loss": 5.6828, "mean_token_accuracy": 0.14957790747284888, "num_tokens": 7725663.0, "step": 4445 }, { "entropy": 5.786761999130249, "epoch": 0.3462361408286326, "grad_norm": 1.25, "learning_rate": 0.0004991882529166724, "loss": 5.8069, "mean_token_accuracy": 0.14756733924150467, "num_tokens": 7735175.0, "step": 4450 }, { "entropy": 5.77248911857605, "epoch": 0.3466251702003501, "grad_norm": 1.1171875, "learning_rate": 0.0004991858990597483, "loss": 5.6742, "mean_token_accuracy": 0.15260669961571693, "num_tokens": 7744041.0, "step": 4455 }, { "entropy": 5.813203620910644, "epoch": 0.3470141995720677, "grad_norm": 1.2109375, "learning_rate": 0.0004991835418011601, "loss": 5.7328, "mean_token_accuracy": 0.14599995985627173, "num_tokens": 7752168.0, "step": 4460 }, { "entropy": 5.774614095687866, "epoch": 0.3474032289437853, "grad_norm": 1.2421875, "learning_rate": 0.0004991811811409434, "loss": 5.6653, "mean_token_accuracy": 0.1525656133890152, "num_tokens": 7760746.0, "step": 4465 }, { "entropy": 5.690586090087891, "epoch": 0.3477922583155028, "grad_norm": 1.203125, "learning_rate": 0.0004991788170791341, "loss": 5.6782, "mean_token_accuracy": 0.15173280835151673, "num_tokens": 7769960.0, "step": 4470 }, { "entropy": 5.805200624465942, "epoch": 0.3481812876872204, "grad_norm": 1.28125, "learning_rate": 0.0004991764496157682, "loss": 5.7113, "mean_token_accuracy": 0.14903471767902374, "num_tokens": 7778475.0, "step": 4475 }, { "entropy": 5.694829988479614, "epoch": 0.34857031705893793, "grad_norm": 1.2578125, "learning_rate": 0.0004991740787508814, "loss": 5.571, "mean_token_accuracy": 0.15922194421291352, "num_tokens": 7787590.0, "step": 4480 }, { "entropy": 5.716617298126221, "epoch": 0.3489593464306555, "grad_norm": 1.2109375, "learning_rate": 0.0004991717044845097, "loss": 5.7509, "mean_token_accuracy": 0.14409140273928642, "num_tokens": 7796841.0, "step": 4485 }, { "entropy": 5.844481468200684, "epoch": 0.3493483758023731, "grad_norm": 1.375, "learning_rate": 0.0004991693268166892, "loss": 5.752, "mean_token_accuracy": 0.1473579525947571, "num_tokens": 7804889.0, "step": 4490 }, { "entropy": 5.751714563369751, "epoch": 0.34973740517409063, "grad_norm": 1.1875, "learning_rate": 0.0004991669457474559, "loss": 5.7307, "mean_token_accuracy": 0.1499755159020424, "num_tokens": 7813185.0, "step": 4495 }, { "entropy": 5.805147790908814, "epoch": 0.3501264345458082, "grad_norm": 1.28125, "learning_rate": 0.0004991645612768461, "loss": 5.7197, "mean_token_accuracy": 0.15086604356765748, "num_tokens": 7821630.0, "step": 4500 }, { "entropy": 5.836012315750122, "epoch": 0.35051546391752575, "grad_norm": 1.3046875, "learning_rate": 0.0004991621734048958, "loss": 5.7522, "mean_token_accuracy": 0.15427149161696435, "num_tokens": 7829941.0, "step": 4505 }, { "entropy": 5.707473087310791, "epoch": 0.35090449328924334, "grad_norm": 1.2265625, "learning_rate": 0.0004991597821316415, "loss": 5.6936, "mean_token_accuracy": 0.15636295527219773, "num_tokens": 7838515.0, "step": 4510 }, { "entropy": 5.8055788516998295, "epoch": 0.3512935226609609, "grad_norm": 1.296875, "learning_rate": 0.0004991573874571192, "loss": 5.6896, "mean_token_accuracy": 0.15325772613286973, "num_tokens": 7846575.0, "step": 4515 }, { "entropy": 5.651686334609986, "epoch": 0.35168255203267845, "grad_norm": 1.2734375, "learning_rate": 0.0004991549893813653, "loss": 5.5803, "mean_token_accuracy": 0.1577739804983139, "num_tokens": 7854970.0, "step": 4520 }, { "entropy": 5.672727489471436, "epoch": 0.35207158140439604, "grad_norm": 1.3203125, "learning_rate": 0.0004991525879044162, "loss": 5.6722, "mean_token_accuracy": 0.1503447487950325, "num_tokens": 7863293.0, "step": 4525 }, { "entropy": 5.777629470825195, "epoch": 0.35246061077611357, "grad_norm": 1.296875, "learning_rate": 0.0004991501830263084, "loss": 5.6652, "mean_token_accuracy": 0.15367957353591918, "num_tokens": 7871029.0, "step": 4530 }, { "entropy": 5.671704244613648, "epoch": 0.35284964014783116, "grad_norm": 1.1640625, "learning_rate": 0.0004991477747470783, "loss": 5.5294, "mean_token_accuracy": 0.1555831491947174, "num_tokens": 7879797.0, "step": 4535 }, { "entropy": 5.820374870300293, "epoch": 0.35323866951954874, "grad_norm": 1.1875, "learning_rate": 0.0004991453630667625, "loss": 5.8385, "mean_token_accuracy": 0.14210431426763534, "num_tokens": 7888600.0, "step": 4540 }, { "entropy": 5.752278423309326, "epoch": 0.3536276988912663, "grad_norm": 1.3984375, "learning_rate": 0.0004991429479853976, "loss": 5.6771, "mean_token_accuracy": 0.15561284869909286, "num_tokens": 7897794.0, "step": 4545 }, { "entropy": 5.773390102386474, "epoch": 0.35401672826298386, "grad_norm": 1.2109375, "learning_rate": 0.0004991405295030202, "loss": 5.658, "mean_token_accuracy": 0.15940722376108168, "num_tokens": 7905822.0, "step": 4550 }, { "entropy": 5.700776815414429, "epoch": 0.35440575763470145, "grad_norm": 1.3203125, "learning_rate": 0.0004991381076196671, "loss": 5.7223, "mean_token_accuracy": 0.1521821677684784, "num_tokens": 7914560.0, "step": 4555 }, { "entropy": 5.661709499359131, "epoch": 0.354794787006419, "grad_norm": 1.265625, "learning_rate": 0.0004991356823353748, "loss": 5.577, "mean_token_accuracy": 0.15658768862485886, "num_tokens": 7924058.0, "step": 4560 }, { "entropy": 5.762267398834228, "epoch": 0.35518381637813656, "grad_norm": 1.40625, "learning_rate": 0.0004991332536501804, "loss": 5.7225, "mean_token_accuracy": 0.1503455936908722, "num_tokens": 7932979.0, "step": 4565 }, { "entropy": 5.655368661880493, "epoch": 0.3555728457498541, "grad_norm": 1.203125, "learning_rate": 0.0004991308215641205, "loss": 5.4999, "mean_token_accuracy": 0.16385250836610793, "num_tokens": 7941357.0, "step": 4570 }, { "entropy": 5.6736588954925535, "epoch": 0.3559618751215717, "grad_norm": 1.2578125, "learning_rate": 0.0004991283860772323, "loss": 5.6739, "mean_token_accuracy": 0.15402223020792008, "num_tokens": 7949997.0, "step": 4575 }, { "entropy": 5.716558218002319, "epoch": 0.35635090449328927, "grad_norm": 1.1875, "learning_rate": 0.0004991259471895525, "loss": 5.6288, "mean_token_accuracy": 0.14936613291502, "num_tokens": 7958246.0, "step": 4580 }, { "entropy": 5.683485794067383, "epoch": 0.3567399338650068, "grad_norm": 1.2109375, "learning_rate": 0.0004991235049011182, "loss": 5.7203, "mean_token_accuracy": 0.14906762838363646, "num_tokens": 7967176.0, "step": 4585 }, { "entropy": 5.747391319274902, "epoch": 0.3571289632367244, "grad_norm": 1.3125, "learning_rate": 0.0004991210592119663, "loss": 5.5664, "mean_token_accuracy": 0.16120724231004716, "num_tokens": 7974761.0, "step": 4590 }, { "entropy": 5.708501148223877, "epoch": 0.3575179926084419, "grad_norm": 1.296875, "learning_rate": 0.0004991186101221342, "loss": 5.643, "mean_token_accuracy": 0.1528185173869133, "num_tokens": 7983155.0, "step": 4595 }, { "entropy": 5.7329905986785885, "epoch": 0.3579070219801595, "grad_norm": 1.21875, "learning_rate": 0.000499116157631659, "loss": 5.6438, "mean_token_accuracy": 0.14957136809825897, "num_tokens": 7991276.0, "step": 4600 }, { "entropy": 5.790548658370971, "epoch": 0.3582960513518771, "grad_norm": 1.2578125, "learning_rate": 0.0004991137017405777, "loss": 5.7855, "mean_token_accuracy": 0.1485683262348175, "num_tokens": 7999488.0, "step": 4605 }, { "entropy": 5.799504184722901, "epoch": 0.3586850807235946, "grad_norm": 1.1328125, "learning_rate": 0.0004991112424489277, "loss": 5.6554, "mean_token_accuracy": 0.1543542042374611, "num_tokens": 8008553.0, "step": 4610 }, { "entropy": 5.698079681396484, "epoch": 0.3590741100953122, "grad_norm": 1.0546875, "learning_rate": 0.0004991087797567462, "loss": 5.6266, "mean_token_accuracy": 0.15792726278305053, "num_tokens": 8017890.0, "step": 4615 }, { "entropy": 5.748518419265747, "epoch": 0.35946313946702974, "grad_norm": 1.234375, "learning_rate": 0.0004991063136640709, "loss": 5.7805, "mean_token_accuracy": 0.14351232275366782, "num_tokens": 8025782.0, "step": 4620 }, { "entropy": 5.807697534561157, "epoch": 0.3598521688387473, "grad_norm": 1.3203125, "learning_rate": 0.0004991038441709388, "loss": 5.6364, "mean_token_accuracy": 0.15547887086868287, "num_tokens": 8034623.0, "step": 4625 }, { "entropy": 5.715529870986939, "epoch": 0.3602411982104649, "grad_norm": 1.4140625, "learning_rate": 0.0004991013712773877, "loss": 5.6676, "mean_token_accuracy": 0.148578180372715, "num_tokens": 8043789.0, "step": 4630 }, { "entropy": 5.687366724014282, "epoch": 0.36063022758218244, "grad_norm": 1.25, "learning_rate": 0.0004990988949834549, "loss": 5.6296, "mean_token_accuracy": 0.1519090548157692, "num_tokens": 8053456.0, "step": 4635 }, { "entropy": 5.633113861083984, "epoch": 0.3610192569539, "grad_norm": 1.40625, "learning_rate": 0.000499096415289178, "loss": 5.6033, "mean_token_accuracy": 0.15289738029241562, "num_tokens": 8061692.0, "step": 4640 }, { "entropy": 5.604199457168579, "epoch": 0.3614082863256176, "grad_norm": 1.2734375, "learning_rate": 0.0004990939321945948, "loss": 5.5536, "mean_token_accuracy": 0.15800046771764756, "num_tokens": 8069564.0, "step": 4645 }, { "entropy": 5.718245315551758, "epoch": 0.36179731569733514, "grad_norm": 1.234375, "learning_rate": 0.0004990914456997427, "loss": 5.6435, "mean_token_accuracy": 0.14634049832820892, "num_tokens": 8078490.0, "step": 4650 }, { "entropy": 5.722595119476319, "epoch": 0.36218634506905273, "grad_norm": 1.3125, "learning_rate": 0.0004990889558046598, "loss": 5.7247, "mean_token_accuracy": 0.14826465845108033, "num_tokens": 8086858.0, "step": 4655 }, { "entropy": 5.757637453079224, "epoch": 0.36257537444077026, "grad_norm": 1.375, "learning_rate": 0.0004990864625093836, "loss": 5.6636, "mean_token_accuracy": 0.1571757525205612, "num_tokens": 8094542.0, "step": 4660 }, { "entropy": 5.779032802581787, "epoch": 0.36296440381248785, "grad_norm": 1.3359375, "learning_rate": 0.0004990839658139519, "loss": 5.7169, "mean_token_accuracy": 0.15186462104320525, "num_tokens": 8102756.0, "step": 4665 }, { "entropy": 5.825753402709961, "epoch": 0.36335343318420543, "grad_norm": 1.296875, "learning_rate": 0.0004990814657184028, "loss": 5.7476, "mean_token_accuracy": 0.15559100806713105, "num_tokens": 8111258.0, "step": 4670 }, { "entropy": 5.857345867156982, "epoch": 0.36374246255592296, "grad_norm": 1.484375, "learning_rate": 0.0004990789622227741, "loss": 5.8447, "mean_token_accuracy": 0.144379186630249, "num_tokens": 8119624.0, "step": 4675 }, { "entropy": 5.7407505989074705, "epoch": 0.36413149192764055, "grad_norm": 1.1796875, "learning_rate": 0.0004990764553271038, "loss": 5.6134, "mean_token_accuracy": 0.15366872400045395, "num_tokens": 8128156.0, "step": 4680 }, { "entropy": 5.72602686882019, "epoch": 0.3645205212993581, "grad_norm": 1.3203125, "learning_rate": 0.0004990739450314299, "loss": 5.6786, "mean_token_accuracy": 0.14902170971035958, "num_tokens": 8136080.0, "step": 4685 }, { "entropy": 5.751847553253174, "epoch": 0.36490955067107567, "grad_norm": 1.4140625, "learning_rate": 0.0004990714313357906, "loss": 5.6585, "mean_token_accuracy": 0.15590455532073974, "num_tokens": 8144742.0, "step": 4690 }, { "entropy": 5.737034893035888, "epoch": 0.36529858004279325, "grad_norm": 1.2421875, "learning_rate": 0.000499068914240224, "loss": 5.7293, "mean_token_accuracy": 0.15128549188375473, "num_tokens": 8153377.0, "step": 4695 }, { "entropy": 5.796698474884034, "epoch": 0.3656876094145108, "grad_norm": 1.28125, "learning_rate": 0.0004990663937447682, "loss": 5.6537, "mean_token_accuracy": 0.15566126704216005, "num_tokens": 8162169.0, "step": 4700 }, { "entropy": 5.7169088363647464, "epoch": 0.36607663878622837, "grad_norm": 1.3359375, "learning_rate": 0.0004990638698494615, "loss": 5.6176, "mean_token_accuracy": 0.15707356631755828, "num_tokens": 8170727.0, "step": 4705 }, { "entropy": 5.605865859985352, "epoch": 0.3664656681579459, "grad_norm": 1.2109375, "learning_rate": 0.0004990613425543423, "loss": 5.5769, "mean_token_accuracy": 0.15790215730667115, "num_tokens": 8179013.0, "step": 4710 }, { "entropy": 5.608945417404175, "epoch": 0.3668546975296635, "grad_norm": 1.21875, "learning_rate": 0.0004990588118594487, "loss": 5.5506, "mean_token_accuracy": 0.16253751665353774, "num_tokens": 8187030.0, "step": 4715 }, { "entropy": 5.626094484329224, "epoch": 0.3672437269013811, "grad_norm": 1.3125, "learning_rate": 0.0004990562777648194, "loss": 5.5305, "mean_token_accuracy": 0.16110363602638245, "num_tokens": 8195073.0, "step": 4720 }, { "entropy": 5.708602380752564, "epoch": 0.3676327562730986, "grad_norm": 1.2734375, "learning_rate": 0.0004990537402704928, "loss": 5.6886, "mean_token_accuracy": 0.15165950506925582, "num_tokens": 8203626.0, "step": 4725 }, { "entropy": 5.740704441070557, "epoch": 0.3680217856448162, "grad_norm": 1.296875, "learning_rate": 0.0004990511993765071, "loss": 5.6818, "mean_token_accuracy": 0.15222800001502038, "num_tokens": 8212750.0, "step": 4730 }, { "entropy": 5.796080303192139, "epoch": 0.3684108150165337, "grad_norm": 1.2265625, "learning_rate": 0.0004990486550829011, "loss": 5.6619, "mean_token_accuracy": 0.14802802354097366, "num_tokens": 8221542.0, "step": 4735 }, { "entropy": 5.622773456573486, "epoch": 0.3687998443882513, "grad_norm": 1.3125, "learning_rate": 0.0004990461073897134, "loss": 5.6049, "mean_token_accuracy": 0.14905112236738205, "num_tokens": 8230574.0, "step": 4740 }, { "entropy": 5.730619859695435, "epoch": 0.3691888737599689, "grad_norm": 1.265625, "learning_rate": 0.0004990435562969827, "loss": 5.6972, "mean_token_accuracy": 0.14874366521835328, "num_tokens": 8239400.0, "step": 4745 }, { "entropy": 5.72901029586792, "epoch": 0.3695779031316864, "grad_norm": 1.3203125, "learning_rate": 0.0004990410018047475, "loss": 5.5251, "mean_token_accuracy": 0.1579698383808136, "num_tokens": 8247537.0, "step": 4750 }, { "entropy": 5.6703370094299315, "epoch": 0.369966932503404, "grad_norm": 1.328125, "learning_rate": 0.0004990384439130467, "loss": 5.6396, "mean_token_accuracy": 0.15181135013699532, "num_tokens": 8256551.0, "step": 4755 }, { "entropy": 5.7400750637054445, "epoch": 0.3703559618751216, "grad_norm": 1.2734375, "learning_rate": 0.0004990358826219192, "loss": 5.6844, "mean_token_accuracy": 0.1494295671582222, "num_tokens": 8265492.0, "step": 4760 }, { "entropy": 5.737407207489014, "epoch": 0.37074499124683913, "grad_norm": 1.3359375, "learning_rate": 0.0004990333179314038, "loss": 5.6124, "mean_token_accuracy": 0.15380854159593582, "num_tokens": 8273798.0, "step": 4765 }, { "entropy": 5.640963745117188, "epoch": 0.3711340206185567, "grad_norm": 1.234375, "learning_rate": 0.0004990307498415393, "loss": 5.5995, "mean_token_accuracy": 0.1561552718281746, "num_tokens": 8281998.0, "step": 4770 }, { "entropy": 5.725772285461426, "epoch": 0.37152304999027425, "grad_norm": 1.3203125, "learning_rate": 0.0004990281783523648, "loss": 5.7066, "mean_token_accuracy": 0.14791832715272904, "num_tokens": 8289833.0, "step": 4775 }, { "entropy": 5.670173215866089, "epoch": 0.37191207936199183, "grad_norm": 1.28125, "learning_rate": 0.0004990256034639192, "loss": 5.6611, "mean_token_accuracy": 0.1593535929918289, "num_tokens": 8297562.0, "step": 4780 }, { "entropy": 5.801353979110718, "epoch": 0.3723011087337094, "grad_norm": 1.2578125, "learning_rate": 0.0004990230251762418, "loss": 5.6676, "mean_token_accuracy": 0.15265004262328147, "num_tokens": 8305262.0, "step": 4785 }, { "entropy": 5.720134830474853, "epoch": 0.37269013810542695, "grad_norm": 1.21875, "learning_rate": 0.0004990204434893713, "loss": 5.5911, "mean_token_accuracy": 0.1556418776512146, "num_tokens": 8313949.0, "step": 4790 }, { "entropy": 5.650853681564331, "epoch": 0.37307916747714454, "grad_norm": 1.2578125, "learning_rate": 0.0004990178584033474, "loss": 5.63, "mean_token_accuracy": 0.153776678442955, "num_tokens": 8322801.0, "step": 4795 }, { "entropy": 5.779564762115479, "epoch": 0.37346819684886207, "grad_norm": 1.2421875, "learning_rate": 0.0004990152699182089, "loss": 5.62, "mean_token_accuracy": 0.1598824217915535, "num_tokens": 8331118.0, "step": 4800 }, { "entropy": 5.7409477710723875, "epoch": 0.37385722622057965, "grad_norm": 1.3828125, "learning_rate": 0.0004990126780339953, "loss": 5.6884, "mean_token_accuracy": 0.15528960078954696, "num_tokens": 8340498.0, "step": 4805 }, { "entropy": 5.785793113708496, "epoch": 0.37424625559229724, "grad_norm": 1.2890625, "learning_rate": 0.0004990100827507459, "loss": 5.8207, "mean_token_accuracy": 0.14700310155749322, "num_tokens": 8349235.0, "step": 4810 }, { "entropy": 5.755542755126953, "epoch": 0.37463528496401477, "grad_norm": 1.4609375, "learning_rate": 0.0004990074840684999, "loss": 5.6936, "mean_token_accuracy": 0.1547679141163826, "num_tokens": 8358484.0, "step": 4815 }, { "entropy": 5.776040840148926, "epoch": 0.37502431433573236, "grad_norm": 1.2265625, "learning_rate": 0.0004990048819872969, "loss": 5.6245, "mean_token_accuracy": 0.15924780070781708, "num_tokens": 8366894.0, "step": 4820 }, { "entropy": 5.662250757217407, "epoch": 0.3754133437074499, "grad_norm": 1.2578125, "learning_rate": 0.0004990022765071765, "loss": 5.631, "mean_token_accuracy": 0.1452302061021328, "num_tokens": 8375271.0, "step": 4825 }, { "entropy": 5.68854022026062, "epoch": 0.3758023730791675, "grad_norm": 1.2109375, "learning_rate": 0.000498999667628178, "loss": 5.5764, "mean_token_accuracy": 0.15381914377212524, "num_tokens": 8383714.0, "step": 4830 }, { "entropy": 5.651234245300293, "epoch": 0.37619140245088506, "grad_norm": 1.265625, "learning_rate": 0.0004989970553503411, "loss": 5.6853, "mean_token_accuracy": 0.15144770443439484, "num_tokens": 8392022.0, "step": 4835 }, { "entropy": 5.759373378753662, "epoch": 0.3765804318226026, "grad_norm": 1.640625, "learning_rate": 0.0004989944396737054, "loss": 5.65, "mean_token_accuracy": 0.14829441905021667, "num_tokens": 8401282.0, "step": 4840 }, { "entropy": 5.729718780517578, "epoch": 0.3769694611943202, "grad_norm": 1.2265625, "learning_rate": 0.0004989918205983106, "loss": 5.7199, "mean_token_accuracy": 0.14889771938323976, "num_tokens": 8411147.0, "step": 4845 }, { "entropy": 5.8805125713348385, "epoch": 0.37735849056603776, "grad_norm": 1.359375, "learning_rate": 0.0004989891981241964, "loss": 5.7159, "mean_token_accuracy": 0.1495855137705803, "num_tokens": 8420434.0, "step": 4850 }, { "entropy": 5.745460796356201, "epoch": 0.3777475199377553, "grad_norm": 1.2734375, "learning_rate": 0.0004989865722514027, "loss": 5.6811, "mean_token_accuracy": 0.1509254492819309, "num_tokens": 8430022.0, "step": 4855 }, { "entropy": 5.540482044219971, "epoch": 0.3781365493094729, "grad_norm": 1.234375, "learning_rate": 0.0004989839429799692, "loss": 5.4636, "mean_token_accuracy": 0.16462698578834534, "num_tokens": 8438898.0, "step": 4860 }, { "entropy": 5.618959999084472, "epoch": 0.3785255786811904, "grad_norm": 1.3046875, "learning_rate": 0.000498981310309936, "loss": 5.5649, "mean_token_accuracy": 0.15923128873109818, "num_tokens": 8446931.0, "step": 4865 }, { "entropy": 5.75497031211853, "epoch": 0.378914608052908, "grad_norm": 1.2890625, "learning_rate": 0.0004989786742413428, "loss": 5.638, "mean_token_accuracy": 0.15647049695253373, "num_tokens": 8455515.0, "step": 4870 }, { "entropy": 5.714741182327271, "epoch": 0.3793036374246256, "grad_norm": 1.265625, "learning_rate": 0.0004989760347742298, "loss": 5.639, "mean_token_accuracy": 0.15014245137572288, "num_tokens": 8464135.0, "step": 4875 }, { "entropy": 5.76575117111206, "epoch": 0.3796926667963431, "grad_norm": 1.3203125, "learning_rate": 0.0004989733919086369, "loss": 5.7329, "mean_token_accuracy": 0.1491445854306221, "num_tokens": 8473222.0, "step": 4880 }, { "entropy": 5.757653379440308, "epoch": 0.3800816961680607, "grad_norm": 1.3046875, "learning_rate": 0.0004989707456446043, "loss": 5.7107, "mean_token_accuracy": 0.15802261978387833, "num_tokens": 8481966.0, "step": 4885 }, { "entropy": 5.763038921356201, "epoch": 0.38047072553977823, "grad_norm": 1.40625, "learning_rate": 0.0004989680959821721, "loss": 5.7354, "mean_token_accuracy": 0.1485402375459671, "num_tokens": 8491276.0, "step": 4890 }, { "entropy": 5.71974368095398, "epoch": 0.3808597549114958, "grad_norm": 1.3359375, "learning_rate": 0.0004989654429213805, "loss": 5.6814, "mean_token_accuracy": 0.15291936323046684, "num_tokens": 8499926.0, "step": 4895 }, { "entropy": 5.741155004501342, "epoch": 0.3812487842832134, "grad_norm": 1.265625, "learning_rate": 0.0004989627864622699, "loss": 5.5594, "mean_token_accuracy": 0.15729069113731384, "num_tokens": 8508544.0, "step": 4900 }, { "entropy": 5.758600425720215, "epoch": 0.38163781365493094, "grad_norm": 1.359375, "learning_rate": 0.0004989601266048804, "loss": 5.682, "mean_token_accuracy": 0.1453734003007412, "num_tokens": 8517326.0, "step": 4905 }, { "entropy": 5.64643874168396, "epoch": 0.3820268430266485, "grad_norm": 1.328125, "learning_rate": 0.0004989574633492525, "loss": 5.6628, "mean_token_accuracy": 0.15118559151887895, "num_tokens": 8526218.0, "step": 4910 }, { "entropy": 5.787919235229492, "epoch": 0.38241587239836605, "grad_norm": 1.328125, "learning_rate": 0.0004989547966954266, "loss": 5.6956, "mean_token_accuracy": 0.1465151771903038, "num_tokens": 8534708.0, "step": 4915 }, { "entropy": 5.723714780807495, "epoch": 0.38280490177008364, "grad_norm": 1.2890625, "learning_rate": 0.000498952126643443, "loss": 5.6392, "mean_token_accuracy": 0.15696539580821992, "num_tokens": 8543302.0, "step": 4920 }, { "entropy": 5.613685512542725, "epoch": 0.3831939311418012, "grad_norm": 1.25, "learning_rate": 0.0004989494531933424, "loss": 5.5588, "mean_token_accuracy": 0.15237713605165482, "num_tokens": 8552586.0, "step": 4925 }, { "entropy": 5.64679446220398, "epoch": 0.38358296051351876, "grad_norm": 1.203125, "learning_rate": 0.0004989467763451652, "loss": 5.5374, "mean_token_accuracy": 0.15823079496622086, "num_tokens": 8561720.0, "step": 4930 }, { "entropy": 5.698852682113648, "epoch": 0.38397198988523634, "grad_norm": 1.34375, "learning_rate": 0.0004989440960989523, "loss": 5.529, "mean_token_accuracy": 0.15683713406324387, "num_tokens": 8570510.0, "step": 4935 }, { "entropy": 5.667657041549683, "epoch": 0.3843610192569539, "grad_norm": 1.2265625, "learning_rate": 0.000498941412454744, "loss": 5.6631, "mean_token_accuracy": 0.15189100801944733, "num_tokens": 8579986.0, "step": 4940 }, { "entropy": 5.660448598861694, "epoch": 0.38475004862867146, "grad_norm": 1.21875, "learning_rate": 0.0004989387254125813, "loss": 5.6278, "mean_token_accuracy": 0.14973406940698625, "num_tokens": 8588507.0, "step": 4945 }, { "entropy": 5.676297044754028, "epoch": 0.38513907800038905, "grad_norm": 1.28125, "learning_rate": 0.0004989360349725049, "loss": 5.5545, "mean_token_accuracy": 0.1551334172487259, "num_tokens": 8596651.0, "step": 4950 }, { "entropy": 5.7129144191741945, "epoch": 0.3855281073721066, "grad_norm": 1.2734375, "learning_rate": 0.0004989333411345555, "loss": 5.5836, "mean_token_accuracy": 0.15729959458112716, "num_tokens": 8605080.0, "step": 4955 }, { "entropy": 5.641625881195068, "epoch": 0.38591713674382416, "grad_norm": 1.390625, "learning_rate": 0.0004989306438987742, "loss": 5.548, "mean_token_accuracy": 0.1537535160779953, "num_tokens": 8613017.0, "step": 4960 }, { "entropy": 5.702543449401856, "epoch": 0.38630616611554175, "grad_norm": 1.3203125, "learning_rate": 0.0004989279432652018, "loss": 5.7241, "mean_token_accuracy": 0.1546338826417923, "num_tokens": 8621954.0, "step": 4965 }, { "entropy": 5.809708023071289, "epoch": 0.3866951954872593, "grad_norm": 1.2265625, "learning_rate": 0.0004989252392338791, "loss": 5.6677, "mean_token_accuracy": 0.1566025510430336, "num_tokens": 8630213.0, "step": 4970 }, { "entropy": 5.784931945800781, "epoch": 0.38708422485897687, "grad_norm": 1.4609375, "learning_rate": 0.0004989225318048475, "loss": 5.6861, "mean_token_accuracy": 0.15659048557281494, "num_tokens": 8638360.0, "step": 4975 }, { "entropy": 5.757261753082275, "epoch": 0.3874732542306944, "grad_norm": 1.3515625, "learning_rate": 0.0004989198209781478, "loss": 5.723, "mean_token_accuracy": 0.15046840906143188, "num_tokens": 8647778.0, "step": 4980 }, { "entropy": 5.73045597076416, "epoch": 0.387862283602412, "grad_norm": 1.390625, "learning_rate": 0.0004989171067538211, "loss": 5.6507, "mean_token_accuracy": 0.15228100568056108, "num_tokens": 8655584.0, "step": 4985 }, { "entropy": 5.673905515670777, "epoch": 0.38825131297412957, "grad_norm": 1.3203125, "learning_rate": 0.000498914389131909, "loss": 5.6874, "mean_token_accuracy": 0.1532427988946438, "num_tokens": 8664159.0, "step": 4990 }, { "entropy": 5.718062448501587, "epoch": 0.3886403423458471, "grad_norm": 1.2265625, "learning_rate": 0.0004989116681124523, "loss": 5.5877, "mean_token_accuracy": 0.1540216326713562, "num_tokens": 8672488.0, "step": 4995 }, { "entropy": 5.754921197891235, "epoch": 0.3890293717175647, "grad_norm": 1.328125, "learning_rate": 0.0004989089436954924, "loss": 5.7203, "mean_token_accuracy": 0.1480067603290081, "num_tokens": 8681492.0, "step": 5000 }, { "entropy": 5.677997732162476, "epoch": 0.3894184010892822, "grad_norm": 1.296875, "learning_rate": 0.0004989062158810706, "loss": 5.606, "mean_token_accuracy": 0.15589867532253265, "num_tokens": 8690453.0, "step": 5005 }, { "entropy": 5.791937589645386, "epoch": 0.3898074304609998, "grad_norm": 1.2578125, "learning_rate": 0.0004989034846692284, "loss": 5.6959, "mean_token_accuracy": 0.15180487632751466, "num_tokens": 8699349.0, "step": 5010 }, { "entropy": 5.6987401962280275, "epoch": 0.3901964598327174, "grad_norm": 1.3203125, "learning_rate": 0.0004989007500600073, "loss": 5.6942, "mean_token_accuracy": 0.1500448077917099, "num_tokens": 8707512.0, "step": 5015 }, { "entropy": 5.793087816238403, "epoch": 0.3905854892044349, "grad_norm": 1.3359375, "learning_rate": 0.0004988980120534486, "loss": 5.717, "mean_token_accuracy": 0.14697987586259842, "num_tokens": 8715847.0, "step": 5020 }, { "entropy": 5.72705192565918, "epoch": 0.3909745185761525, "grad_norm": 1.3515625, "learning_rate": 0.000498895270649594, "loss": 5.6111, "mean_token_accuracy": 0.1572824612259865, "num_tokens": 8725548.0, "step": 5025 }, { "entropy": 5.638960075378418, "epoch": 0.39136354794787004, "grad_norm": 1.9921875, "learning_rate": 0.000498892525848485, "loss": 5.564, "mean_token_accuracy": 0.16159805804491043, "num_tokens": 8733935.0, "step": 5030 }, { "entropy": 5.7204138278961185, "epoch": 0.3917525773195876, "grad_norm": 1.25, "learning_rate": 0.0004988897776501633, "loss": 5.6876, "mean_token_accuracy": 0.15322512090206147, "num_tokens": 8743110.0, "step": 5035 }, { "entropy": 5.641509246826172, "epoch": 0.3921416066913052, "grad_norm": 1.390625, "learning_rate": 0.0004988870260546705, "loss": 5.5112, "mean_token_accuracy": 0.1590324655175209, "num_tokens": 8751166.0, "step": 5040 }, { "entropy": 5.681423711776733, "epoch": 0.39253063606302274, "grad_norm": 1.25, "learning_rate": 0.0004988842710620486, "loss": 5.7162, "mean_token_accuracy": 0.15126417875289916, "num_tokens": 8759929.0, "step": 5045 }, { "entropy": 5.837319183349609, "epoch": 0.39291966543474033, "grad_norm": 2.015625, "learning_rate": 0.0004988815126723391, "loss": 5.7138, "mean_token_accuracy": 0.15048869475722312, "num_tokens": 8768541.0, "step": 5050 }, { "entropy": 5.765131187438965, "epoch": 0.3933086948064579, "grad_norm": 1.3125, "learning_rate": 0.0004988787508855841, "loss": 5.6237, "mean_token_accuracy": 0.153934982419014, "num_tokens": 8776803.0, "step": 5055 }, { "entropy": 5.62071008682251, "epoch": 0.39369772417817545, "grad_norm": 1.4140625, "learning_rate": 0.0004988759857018253, "loss": 5.5955, "mean_token_accuracy": 0.1592630684375763, "num_tokens": 8784773.0, "step": 5060 }, { "entropy": 5.751138544082641, "epoch": 0.39408675354989303, "grad_norm": 1.46875, "learning_rate": 0.0004988732171211048, "loss": 5.655, "mean_token_accuracy": 0.15452175438404084, "num_tokens": 8793797.0, "step": 5065 }, { "entropy": 5.625418424606323, "epoch": 0.39447578292161056, "grad_norm": 1.2578125, "learning_rate": 0.0004988704451434644, "loss": 5.5384, "mean_token_accuracy": 0.15230093747377396, "num_tokens": 8802366.0, "step": 5070 }, { "entropy": 5.739065170288086, "epoch": 0.39486481229332815, "grad_norm": 1.4140625, "learning_rate": 0.0004988676697689465, "loss": 5.6729, "mean_token_accuracy": 0.15218451768159866, "num_tokens": 8810975.0, "step": 5075 }, { "entropy": 5.769051790237427, "epoch": 0.39525384166504574, "grad_norm": 1.2890625, "learning_rate": 0.000498864890997593, "loss": 5.6945, "mean_token_accuracy": 0.1473867617547512, "num_tokens": 8819137.0, "step": 5080 }, { "entropy": 5.685499238967895, "epoch": 0.39564287103676327, "grad_norm": 1.3671875, "learning_rate": 0.0004988621088294461, "loss": 5.6939, "mean_token_accuracy": 0.1510564461350441, "num_tokens": 8827676.0, "step": 5085 }, { "entropy": 5.709568500518799, "epoch": 0.39603190040848085, "grad_norm": 1.4140625, "learning_rate": 0.000498859323264548, "loss": 5.6426, "mean_token_accuracy": 0.15703052133321763, "num_tokens": 8836005.0, "step": 5090 }, { "entropy": 5.636990165710449, "epoch": 0.3964209297801984, "grad_norm": 1.421875, "learning_rate": 0.000498856534302941, "loss": 5.5295, "mean_token_accuracy": 0.1587708003818989, "num_tokens": 8844153.0, "step": 5095 }, { "entropy": 5.71082124710083, "epoch": 0.39680995915191597, "grad_norm": 1.28125, "learning_rate": 0.0004988537419446673, "loss": 5.644, "mean_token_accuracy": 0.153173828125, "num_tokens": 8852520.0, "step": 5100 }, { "entropy": 5.714675331115723, "epoch": 0.39719898852363356, "grad_norm": 1.34375, "learning_rate": 0.0004988509461897694, "loss": 5.4872, "mean_token_accuracy": 0.1576193779706955, "num_tokens": 8860609.0, "step": 5105 }, { "entropy": 5.648047876358032, "epoch": 0.3975880178953511, "grad_norm": 1.375, "learning_rate": 0.0004988481470382897, "loss": 5.6664, "mean_token_accuracy": 0.1524683952331543, "num_tokens": 8869185.0, "step": 5110 }, { "entropy": 5.684601879119873, "epoch": 0.3979770472670687, "grad_norm": 1.3203125, "learning_rate": 0.0004988453444902708, "loss": 5.537, "mean_token_accuracy": 0.152810937166214, "num_tokens": 8877758.0, "step": 5115 }, { "entropy": 5.723855924606323, "epoch": 0.3983660766387862, "grad_norm": 1.328125, "learning_rate": 0.0004988425385457549, "loss": 5.7168, "mean_token_accuracy": 0.15099436789751053, "num_tokens": 8887236.0, "step": 5120 }, { "entropy": 5.716874504089356, "epoch": 0.3987551060105038, "grad_norm": 2.171875, "learning_rate": 0.0004988397292047848, "loss": 5.6896, "mean_token_accuracy": 0.15267200022935867, "num_tokens": 8895808.0, "step": 5125 }, { "entropy": 5.7161201477050785, "epoch": 0.3991441353822214, "grad_norm": 1.2421875, "learning_rate": 0.0004988369164674032, "loss": 5.6626, "mean_token_accuracy": 0.1510595954954624, "num_tokens": 8904091.0, "step": 5130 }, { "entropy": 5.5925610065460205, "epoch": 0.3995331647539389, "grad_norm": 1.28125, "learning_rate": 0.0004988341003336526, "loss": 5.4659, "mean_token_accuracy": 0.15727559775114058, "num_tokens": 8912046.0, "step": 5135 }, { "entropy": 5.770779085159302, "epoch": 0.3999221941256565, "grad_norm": 1.4609375, "learning_rate": 0.0004988312808035757, "loss": 5.681, "mean_token_accuracy": 0.14915614053606988, "num_tokens": 8921060.0, "step": 5140 }, { "entropy": 5.727402973175049, "epoch": 0.400311223497374, "grad_norm": 1.2578125, "learning_rate": 0.0004988284578772155, "loss": 5.629, "mean_token_accuracy": 0.15255586802959442, "num_tokens": 8930757.0, "step": 5145 }, { "entropy": 5.825820398330689, "epoch": 0.4007002528690916, "grad_norm": 1.296875, "learning_rate": 0.0004988256315546146, "loss": 5.7951, "mean_token_accuracy": 0.15042151659727096, "num_tokens": 8939544.0, "step": 5150 }, { "entropy": 5.696900844573975, "epoch": 0.4010892822408092, "grad_norm": 1.4375, "learning_rate": 0.0004988228018358161, "loss": 5.6018, "mean_token_accuracy": 0.15607771426439285, "num_tokens": 8949347.0, "step": 5155 }, { "entropy": 5.725059270858765, "epoch": 0.40147831161252673, "grad_norm": 1.4375, "learning_rate": 0.0004988199687208628, "loss": 5.6584, "mean_token_accuracy": 0.15238844454288483, "num_tokens": 8957697.0, "step": 5160 }, { "entropy": 5.740241527557373, "epoch": 0.4018673409842443, "grad_norm": 1.2734375, "learning_rate": 0.0004988171322097977, "loss": 5.6755, "mean_token_accuracy": 0.14611184522509574, "num_tokens": 8966107.0, "step": 5165 }, { "entropy": 5.675651693344117, "epoch": 0.4022563703559619, "grad_norm": 1.703125, "learning_rate": 0.0004988142923026638, "loss": 5.5825, "mean_token_accuracy": 0.15178962647914887, "num_tokens": 8974128.0, "step": 5170 }, { "entropy": 5.6408562660217285, "epoch": 0.40264539972767943, "grad_norm": 1.328125, "learning_rate": 0.0004988114489995044, "loss": 5.5668, "mean_token_accuracy": 0.15450093746185303, "num_tokens": 8982564.0, "step": 5175 }, { "entropy": 5.664896154403687, "epoch": 0.403034429099397, "grad_norm": 1.2578125, "learning_rate": 0.0004988086023003624, "loss": 5.6069, "mean_token_accuracy": 0.1550554156303406, "num_tokens": 8990924.0, "step": 5180 }, { "entropy": 5.820183563232422, "epoch": 0.40342345847111455, "grad_norm": 1.328125, "learning_rate": 0.0004988057522052811, "loss": 5.698, "mean_token_accuracy": 0.14887791126966476, "num_tokens": 8999827.0, "step": 5185 }, { "entropy": 5.7121435642242435, "epoch": 0.40381248784283214, "grad_norm": 1.296875, "learning_rate": 0.0004988028987143037, "loss": 5.5321, "mean_token_accuracy": 0.1553960233926773, "num_tokens": 9007885.0, "step": 5190 }, { "entropy": 5.6945513725280765, "epoch": 0.4042015172145497, "grad_norm": 1.4765625, "learning_rate": 0.0004988000418274736, "loss": 5.6351, "mean_token_accuracy": 0.15085338950157165, "num_tokens": 9016752.0, "step": 5195 }, { "entropy": 5.713669633865356, "epoch": 0.40459054658626725, "grad_norm": 1.265625, "learning_rate": 0.0004987971815448341, "loss": 5.6434, "mean_token_accuracy": 0.15495601445436477, "num_tokens": 9025547.0, "step": 5200 }, { "entropy": 5.741844606399536, "epoch": 0.40497957595798484, "grad_norm": 1.28125, "learning_rate": 0.0004987943178664285, "loss": 5.6778, "mean_token_accuracy": 0.15183082818984986, "num_tokens": 9034711.0, "step": 5205 }, { "entropy": 5.718159914016724, "epoch": 0.40536860532970237, "grad_norm": 1.3828125, "learning_rate": 0.0004987914507923004, "loss": 5.59, "mean_token_accuracy": 0.15771124362945557, "num_tokens": 9042565.0, "step": 5210 }, { "entropy": 5.592754888534546, "epoch": 0.40575763470141996, "grad_norm": 1.3203125, "learning_rate": 0.0004987885803224931, "loss": 5.6583, "mean_token_accuracy": 0.14471440464258195, "num_tokens": 9051590.0, "step": 5215 }, { "entropy": 5.819624614715576, "epoch": 0.40614666407313754, "grad_norm": 1.3671875, "learning_rate": 0.0004987857064570505, "loss": 5.7309, "mean_token_accuracy": 0.15148103088140488, "num_tokens": 9060415.0, "step": 5220 }, { "entropy": 5.640044164657593, "epoch": 0.4065356934448551, "grad_norm": 1.3359375, "learning_rate": 0.0004987828291960158, "loss": 5.516, "mean_token_accuracy": 0.15662309378385544, "num_tokens": 9069492.0, "step": 5225 }, { "entropy": 5.608748483657837, "epoch": 0.40692472281657266, "grad_norm": 1.1875, "learning_rate": 0.000498779948539433, "loss": 5.5735, "mean_token_accuracy": 0.16103582680225373, "num_tokens": 9078183.0, "step": 5230 }, { "entropy": 5.808728265762329, "epoch": 0.4073137521882902, "grad_norm": 1.3125, "learning_rate": 0.0004987770644873455, "loss": 5.7835, "mean_token_accuracy": 0.14806534647941588, "num_tokens": 9086661.0, "step": 5235 }, { "entropy": 5.690426826477051, "epoch": 0.4077027815600078, "grad_norm": 1.40625, "learning_rate": 0.0004987741770397974, "loss": 5.5175, "mean_token_accuracy": 0.1621639087796211, "num_tokens": 9095449.0, "step": 5240 }, { "entropy": 5.665590906143189, "epoch": 0.40809181093172536, "grad_norm": 1.3515625, "learning_rate": 0.0004987712861968323, "loss": 5.6577, "mean_token_accuracy": 0.15061125010252, "num_tokens": 9103347.0, "step": 5245 }, { "entropy": 5.572380304336548, "epoch": 0.4084808403034429, "grad_norm": 1.2421875, "learning_rate": 0.000498768391958494, "loss": 5.5632, "mean_token_accuracy": 0.1605206623673439, "num_tokens": 9112382.0, "step": 5250 }, { "entropy": 5.73834261894226, "epoch": 0.4088698696751605, "grad_norm": 1.234375, "learning_rate": 0.0004987654943248266, "loss": 5.5031, "mean_token_accuracy": 0.15901872366666794, "num_tokens": 9120628.0, "step": 5255 }, { "entropy": 5.75648136138916, "epoch": 0.40925889904687807, "grad_norm": 1.3515625, "learning_rate": 0.0004987625932958739, "loss": 5.6933, "mean_token_accuracy": 0.15073462724685668, "num_tokens": 9130280.0, "step": 5260 }, { "entropy": 5.856960916519165, "epoch": 0.4096479284185956, "grad_norm": 1.3203125, "learning_rate": 0.0004987596888716801, "loss": 5.7914, "mean_token_accuracy": 0.1458967387676239, "num_tokens": 9139720.0, "step": 5265 }, { "entropy": 5.688859844207764, "epoch": 0.4100369577903132, "grad_norm": 1.2109375, "learning_rate": 0.0004987567810522892, "loss": 5.7051, "mean_token_accuracy": 0.149783219397068, "num_tokens": 9148537.0, "step": 5270 }, { "entropy": 5.752209806442261, "epoch": 0.4104259871620307, "grad_norm": 1.4921875, "learning_rate": 0.0004987538698377451, "loss": 5.7694, "mean_token_accuracy": 0.15261628925800325, "num_tokens": 9156965.0, "step": 5275 }, { "entropy": 5.672241067886352, "epoch": 0.4108150165337483, "grad_norm": 1.2890625, "learning_rate": 0.0004987509552280924, "loss": 5.4953, "mean_token_accuracy": 0.1591440185904503, "num_tokens": 9164982.0, "step": 5280 }, { "entropy": 5.738524103164673, "epoch": 0.4112040459054659, "grad_norm": 1.3515625, "learning_rate": 0.000498748037223375, "loss": 5.7207, "mean_token_accuracy": 0.14531775191426277, "num_tokens": 9173383.0, "step": 5285 }, { "entropy": 5.788292264938354, "epoch": 0.4115930752771834, "grad_norm": 1.328125, "learning_rate": 0.0004987451158236372, "loss": 5.7358, "mean_token_accuracy": 0.15552923828363419, "num_tokens": 9182743.0, "step": 5290 }, { "entropy": 5.747622489929199, "epoch": 0.411982104648901, "grad_norm": 1.3359375, "learning_rate": 0.0004987421910289234, "loss": 5.6239, "mean_token_accuracy": 0.15142476558685303, "num_tokens": 9191770.0, "step": 5295 }, { "entropy": 5.5697931289672855, "epoch": 0.41237113402061853, "grad_norm": 1.25, "learning_rate": 0.0004987392628392781, "loss": 5.5785, "mean_token_accuracy": 0.15786964744329451, "num_tokens": 9200885.0, "step": 5300 }, { "entropy": 5.832540702819824, "epoch": 0.4127601633923361, "grad_norm": 1.3671875, "learning_rate": 0.0004987363312547456, "loss": 5.6686, "mean_token_accuracy": 0.1493069648742676, "num_tokens": 9210114.0, "step": 5305 }, { "entropy": 5.745130014419556, "epoch": 0.4131491927640537, "grad_norm": 1.28125, "learning_rate": 0.0004987333962753703, "loss": 5.6199, "mean_token_accuracy": 0.15895049124956132, "num_tokens": 9218608.0, "step": 5310 }, { "entropy": 5.698068571090698, "epoch": 0.41353822213577124, "grad_norm": 1.1640625, "learning_rate": 0.0004987304579011967, "loss": 5.6659, "mean_token_accuracy": 0.15064293891191483, "num_tokens": 9227737.0, "step": 5315 }, { "entropy": 5.731441307067871, "epoch": 0.4139272515074888, "grad_norm": 1.3984375, "learning_rate": 0.0004987275161322697, "loss": 5.5737, "mean_token_accuracy": 0.15715447142720224, "num_tokens": 9236589.0, "step": 5320 }, { "entropy": 5.67019567489624, "epoch": 0.41431628087920636, "grad_norm": 1.3984375, "learning_rate": 0.0004987245709686337, "loss": 5.6204, "mean_token_accuracy": 0.16002295315265655, "num_tokens": 9245313.0, "step": 5325 }, { "entropy": 5.662066316604614, "epoch": 0.41470531025092394, "grad_norm": 1.453125, "learning_rate": 0.0004987216224103334, "loss": 5.655, "mean_token_accuracy": 0.15002036690711976, "num_tokens": 9254001.0, "step": 5330 }, { "entropy": 5.80666069984436, "epoch": 0.41509433962264153, "grad_norm": 1.28125, "learning_rate": 0.0004987186704574136, "loss": 5.7102, "mean_token_accuracy": 0.14658118188381195, "num_tokens": 9262485.0, "step": 5335 }, { "entropy": 5.689135217666626, "epoch": 0.41548336899435906, "grad_norm": 1.421875, "learning_rate": 0.0004987157151099189, "loss": 5.5907, "mean_token_accuracy": 0.1536131516098976, "num_tokens": 9271490.0, "step": 5340 }, { "entropy": 5.625450229644775, "epoch": 0.41587239836607665, "grad_norm": 1.34375, "learning_rate": 0.0004987127563678945, "loss": 5.6282, "mean_token_accuracy": 0.15292252898216246, "num_tokens": 9280595.0, "step": 5345 }, { "entropy": 5.719094228744507, "epoch": 0.4162614277377942, "grad_norm": 1.3984375, "learning_rate": 0.0004987097942313852, "loss": 5.5414, "mean_token_accuracy": 0.1592733532190323, "num_tokens": 9289260.0, "step": 5350 }, { "entropy": 5.755507230758667, "epoch": 0.41665045710951176, "grad_norm": 1.3203125, "learning_rate": 0.0004987068287004355, "loss": 5.7281, "mean_token_accuracy": 0.15436695963144303, "num_tokens": 9297842.0, "step": 5355 }, { "entropy": 5.752491664886475, "epoch": 0.41703948648122935, "grad_norm": 1.3046875, "learning_rate": 0.0004987038597750909, "loss": 5.7035, "mean_token_accuracy": 0.1510893762111664, "num_tokens": 9306533.0, "step": 5360 }, { "entropy": 5.7559339046478275, "epoch": 0.4174285158529469, "grad_norm": 1.2890625, "learning_rate": 0.0004987008874553964, "loss": 5.5968, "mean_token_accuracy": 0.1522625654935837, "num_tokens": 9314534.0, "step": 5365 }, { "entropy": 5.749003839492798, "epoch": 0.41781754522466447, "grad_norm": 1.359375, "learning_rate": 0.0004986979117413969, "loss": 5.758, "mean_token_accuracy": 0.15595654249191285, "num_tokens": 9323179.0, "step": 5370 }, { "entropy": 5.687869930267334, "epoch": 0.41820657459638205, "grad_norm": 1.359375, "learning_rate": 0.0004986949326331376, "loss": 5.5471, "mean_token_accuracy": 0.16193525791168212, "num_tokens": 9331265.0, "step": 5375 }, { "entropy": 5.665004444122315, "epoch": 0.4185956039680996, "grad_norm": 1.515625, "learning_rate": 0.0004986919501306638, "loss": 5.6089, "mean_token_accuracy": 0.15000245124101638, "num_tokens": 9340856.0, "step": 5380 }, { "entropy": 5.683504724502564, "epoch": 0.41898463333981717, "grad_norm": 1.1953125, "learning_rate": 0.0004986889642340207, "loss": 5.6271, "mean_token_accuracy": 0.15085209980607034, "num_tokens": 9350728.0, "step": 5385 }, { "entropy": 5.813549613952636, "epoch": 0.4193736627115347, "grad_norm": 1.4296875, "learning_rate": 0.0004986859749432536, "loss": 5.7624, "mean_token_accuracy": 0.14495969265699388, "num_tokens": 9360109.0, "step": 5390 }, { "entropy": 5.783225584030151, "epoch": 0.4197626920832523, "grad_norm": 1.3359375, "learning_rate": 0.0004986829822584078, "loss": 5.7253, "mean_token_accuracy": 0.1517239674925804, "num_tokens": 9369101.0, "step": 5395 }, { "entropy": 5.762203168869019, "epoch": 0.4201517214549699, "grad_norm": 1.328125, "learning_rate": 0.0004986799861795289, "loss": 5.6917, "mean_token_accuracy": 0.14891715198755265, "num_tokens": 9377686.0, "step": 5400 }, { "entropy": 5.774033546447754, "epoch": 0.4205407508266874, "grad_norm": 1.5390625, "learning_rate": 0.0004986769867066622, "loss": 5.683, "mean_token_accuracy": 0.1555148705840111, "num_tokens": 9386439.0, "step": 5405 }, { "entropy": 5.68793888092041, "epoch": 0.420929780198405, "grad_norm": 1.5078125, "learning_rate": 0.0004986739838398532, "loss": 5.717, "mean_token_accuracy": 0.15431362837553025, "num_tokens": 9395086.0, "step": 5410 }, { "entropy": 5.714366340637207, "epoch": 0.4213188095701225, "grad_norm": 1.2421875, "learning_rate": 0.0004986709775791475, "loss": 5.5778, "mean_token_accuracy": 0.15415338277816773, "num_tokens": 9403762.0, "step": 5415 }, { "entropy": 5.662868070602417, "epoch": 0.4217078389418401, "grad_norm": 1.3984375, "learning_rate": 0.0004986679679245907, "loss": 5.6173, "mean_token_accuracy": 0.1550531730055809, "num_tokens": 9412386.0, "step": 5420 }, { "entropy": 5.671959304809571, "epoch": 0.4220968683135577, "grad_norm": 1.6953125, "learning_rate": 0.0004986649548762286, "loss": 5.5757, "mean_token_accuracy": 0.16350484043359756, "num_tokens": 9420538.0, "step": 5425 }, { "entropy": 5.661460494995117, "epoch": 0.4224858976852752, "grad_norm": 1.359375, "learning_rate": 0.0004986619384341066, "loss": 5.5702, "mean_token_accuracy": 0.15350655913352967, "num_tokens": 9429083.0, "step": 5430 }, { "entropy": 5.733646297454834, "epoch": 0.4228749270569928, "grad_norm": 1.328125, "learning_rate": 0.0004986589185982708, "loss": 5.6627, "mean_token_accuracy": 0.15776549130678177, "num_tokens": 9436892.0, "step": 5435 }, { "entropy": 5.726545667648315, "epoch": 0.42326395642871034, "grad_norm": 1.2890625, "learning_rate": 0.0004986558953687671, "loss": 5.6756, "mean_token_accuracy": 0.1516024351119995, "num_tokens": 9445267.0, "step": 5440 }, { "entropy": 5.721020984649658, "epoch": 0.42365298580042793, "grad_norm": 1.625, "learning_rate": 0.0004986528687456409, "loss": 5.685, "mean_token_accuracy": 0.15134571343660355, "num_tokens": 9454292.0, "step": 5445 }, { "entropy": 5.707912731170654, "epoch": 0.4240420151721455, "grad_norm": 1.3359375, "learning_rate": 0.0004986498387289384, "loss": 5.5852, "mean_token_accuracy": 0.16004859358072282, "num_tokens": 9463126.0, "step": 5450 }, { "entropy": 5.679943418502807, "epoch": 0.42443104454386305, "grad_norm": 1.4296875, "learning_rate": 0.0004986468053187058, "loss": 5.6632, "mean_token_accuracy": 0.15489592105150224, "num_tokens": 9471703.0, "step": 5455 }, { "entropy": 5.664609098434449, "epoch": 0.42482007391558063, "grad_norm": 1.5, "learning_rate": 0.0004986437685149887, "loss": 5.5365, "mean_token_accuracy": 0.1670185387134552, "num_tokens": 9480029.0, "step": 5460 }, { "entropy": 5.743315315246582, "epoch": 0.4252091032872982, "grad_norm": 1.328125, "learning_rate": 0.0004986407283178334, "loss": 5.6452, "mean_token_accuracy": 0.15648874193429946, "num_tokens": 9488277.0, "step": 5465 }, { "entropy": 5.725664234161377, "epoch": 0.42559813265901575, "grad_norm": 1.5546875, "learning_rate": 0.0004986376847272861, "loss": 5.6974, "mean_token_accuracy": 0.1544747918844223, "num_tokens": 9496096.0, "step": 5470 }, { "entropy": 5.682655239105225, "epoch": 0.42598716203073334, "grad_norm": 1.3828125, "learning_rate": 0.0004986346377433929, "loss": 5.6116, "mean_token_accuracy": 0.16111418157815932, "num_tokens": 9504653.0, "step": 5475 }, { "entropy": 5.7783355712890625, "epoch": 0.42637619140245087, "grad_norm": 1.359375, "learning_rate": 0.0004986315873661999, "loss": 5.5822, "mean_token_accuracy": 0.15282244384288787, "num_tokens": 9513088.0, "step": 5480 }, { "entropy": 5.619540166854859, "epoch": 0.42676522077416845, "grad_norm": 1.453125, "learning_rate": 0.0004986285335957536, "loss": 5.5013, "mean_token_accuracy": 0.15677933245897294, "num_tokens": 9521714.0, "step": 5485 }, { "entropy": 5.613918161392212, "epoch": 0.42715425014588604, "grad_norm": 1.296875, "learning_rate": 0.0004986254764321002, "loss": 5.6033, "mean_token_accuracy": 0.1575162246823311, "num_tokens": 9530629.0, "step": 5490 }, { "entropy": 5.701473379135132, "epoch": 0.42754327951760357, "grad_norm": 1.296875, "learning_rate": 0.0004986224158752861, "loss": 5.6084, "mean_token_accuracy": 0.162319153547287, "num_tokens": 9539293.0, "step": 5495 }, { "entropy": 5.623651647567749, "epoch": 0.42793230888932116, "grad_norm": 1.40625, "learning_rate": 0.0004986193519253578, "loss": 5.5598, "mean_token_accuracy": 0.15547969192266464, "num_tokens": 9547628.0, "step": 5500 }, { "entropy": 5.656365871429443, "epoch": 0.4283213382610387, "grad_norm": 1.390625, "learning_rate": 0.0004986162845823618, "loss": 5.5529, "mean_token_accuracy": 0.16461351811885833, "num_tokens": 9557260.0, "step": 5505 }, { "entropy": 5.761644983291626, "epoch": 0.4287103676327563, "grad_norm": 1.6796875, "learning_rate": 0.0004986132138463446, "loss": 5.5998, "mean_token_accuracy": 0.1509658232331276, "num_tokens": 9565923.0, "step": 5510 }, { "entropy": 5.653045129776001, "epoch": 0.42909939700447386, "grad_norm": 1.359375, "learning_rate": 0.0004986101397173528, "loss": 5.6036, "mean_token_accuracy": 0.15777654498815535, "num_tokens": 9574373.0, "step": 5515 }, { "entropy": 5.683512020111084, "epoch": 0.4294884263761914, "grad_norm": 1.3359375, "learning_rate": 0.000498607062195433, "loss": 5.6989, "mean_token_accuracy": 0.15172723829746246, "num_tokens": 9583652.0, "step": 5520 }, { "entropy": 5.723854303359985, "epoch": 0.429877455747909, "grad_norm": 1.4296875, "learning_rate": 0.000498603981280632, "loss": 5.6535, "mean_token_accuracy": 0.1534549355506897, "num_tokens": 9592625.0, "step": 5525 }, { "entropy": 5.6727447509765625, "epoch": 0.4302664851196265, "grad_norm": 1.3046875, "learning_rate": 0.0004986008969729964, "loss": 5.5531, "mean_token_accuracy": 0.15823169946670532, "num_tokens": 9600934.0, "step": 5530 }, { "entropy": 5.625131464004516, "epoch": 0.4306555144913441, "grad_norm": 1.5234375, "learning_rate": 0.0004985978092725731, "loss": 5.5533, "mean_token_accuracy": 0.16186170428991317, "num_tokens": 9609481.0, "step": 5535 }, { "entropy": 5.626396179199219, "epoch": 0.4310445438630617, "grad_norm": 1.3203125, "learning_rate": 0.000498594718179409, "loss": 5.525, "mean_token_accuracy": 0.16443886905908583, "num_tokens": 9618063.0, "step": 5540 }, { "entropy": 5.672539138793946, "epoch": 0.4314335732347792, "grad_norm": 1.53125, "learning_rate": 0.0004985916236935508, "loss": 5.6056, "mean_token_accuracy": 0.15570127665996553, "num_tokens": 9626144.0, "step": 5545 }, { "entropy": 5.569118499755859, "epoch": 0.4318226026064968, "grad_norm": 1.2578125, "learning_rate": 0.0004985885258150458, "loss": 5.5639, "mean_token_accuracy": 0.1569093570113182, "num_tokens": 9635328.0, "step": 5550 }, { "entropy": 5.7548158168792725, "epoch": 0.43221163197821433, "grad_norm": 1.265625, "learning_rate": 0.0004985854245439408, "loss": 5.7049, "mean_token_accuracy": 0.14901985377073287, "num_tokens": 9644529.0, "step": 5555 }, { "entropy": 5.743087673187256, "epoch": 0.4326006613499319, "grad_norm": 1.5234375, "learning_rate": 0.0004985823198802827, "loss": 5.6839, "mean_token_accuracy": 0.15375212132930755, "num_tokens": 9653763.0, "step": 5560 }, { "entropy": 5.674944353103638, "epoch": 0.4329896907216495, "grad_norm": 1.421875, "learning_rate": 0.0004985792118241188, "loss": 5.5095, "mean_token_accuracy": 0.1607091173529625, "num_tokens": 9661433.0, "step": 5565 }, { "entropy": 5.601434946060181, "epoch": 0.43337872009336703, "grad_norm": 1.3125, "learning_rate": 0.0004985761003754961, "loss": 5.5038, "mean_token_accuracy": 0.15965722799301146, "num_tokens": 9669688.0, "step": 5570 }, { "entropy": 5.7145667552948, "epoch": 0.4337677494650846, "grad_norm": 1.28125, "learning_rate": 0.0004985729855344622, "loss": 5.6217, "mean_token_accuracy": 0.155311219394207, "num_tokens": 9678403.0, "step": 5575 }, { "entropy": 5.7246904373168945, "epoch": 0.4341567788368022, "grad_norm": 1.28125, "learning_rate": 0.000498569867301064, "loss": 5.7205, "mean_token_accuracy": 0.14789665564894677, "num_tokens": 9687504.0, "step": 5580 }, { "entropy": 5.7681337833404545, "epoch": 0.43454580820851973, "grad_norm": 1.2421875, "learning_rate": 0.0004985667456753489, "loss": 5.5273, "mean_token_accuracy": 0.1617080509662628, "num_tokens": 9695772.0, "step": 5585 }, { "entropy": 5.617122650146484, "epoch": 0.4349348375802373, "grad_norm": 1.2890625, "learning_rate": 0.0004985636206573642, "loss": 5.5952, "mean_token_accuracy": 0.1571861684322357, "num_tokens": 9704150.0, "step": 5590 }, { "entropy": 5.557275772094727, "epoch": 0.43532386695195485, "grad_norm": 1.2890625, "learning_rate": 0.0004985604922471575, "loss": 5.5016, "mean_token_accuracy": 0.16332297772169113, "num_tokens": 9712245.0, "step": 5595 }, { "entropy": 5.662200260162353, "epoch": 0.43571289632367244, "grad_norm": 1.3515625, "learning_rate": 0.0004985573604447761, "loss": 5.6432, "mean_token_accuracy": 0.1524854212999344, "num_tokens": 9721027.0, "step": 5600 }, { "entropy": 5.731251001358032, "epoch": 0.43610192569539, "grad_norm": 1.4375, "learning_rate": 0.0004985542252502676, "loss": 5.5657, "mean_token_accuracy": 0.1564818188548088, "num_tokens": 9728939.0, "step": 5605 }, { "entropy": 5.763981342315674, "epoch": 0.43649095506710756, "grad_norm": 1.2578125, "learning_rate": 0.0004985510866636796, "loss": 5.7119, "mean_token_accuracy": 0.15163636654615403, "num_tokens": 9737863.0, "step": 5610 }, { "entropy": 5.688189840316772, "epoch": 0.43687998443882514, "grad_norm": 1.4609375, "learning_rate": 0.0004985479446850596, "loss": 5.7083, "mean_token_accuracy": 0.1486771047115326, "num_tokens": 9747666.0, "step": 5615 }, { "entropy": 5.658762121200562, "epoch": 0.4372690138105427, "grad_norm": 1.421875, "learning_rate": 0.0004985447993144554, "loss": 5.5646, "mean_token_accuracy": 0.1599259227514267, "num_tokens": 9756595.0, "step": 5620 }, { "entropy": 5.730542516708374, "epoch": 0.43765804318226026, "grad_norm": 1.3046875, "learning_rate": 0.0004985416505519147, "loss": 5.5981, "mean_token_accuracy": 0.15622531548142432, "num_tokens": 9764747.0, "step": 5625 }, { "entropy": 5.640635251998901, "epoch": 0.43804707255397785, "grad_norm": 1.2421875, "learning_rate": 0.0004985384983974853, "loss": 5.5542, "mean_token_accuracy": 0.15800215303897858, "num_tokens": 9772992.0, "step": 5630 }, { "entropy": 5.633075332641601, "epoch": 0.4384361019256954, "grad_norm": 1.3359375, "learning_rate": 0.0004985353428512148, "loss": 5.5335, "mean_token_accuracy": 0.1635892003774643, "num_tokens": 9781107.0, "step": 5635 }, { "entropy": 5.624766874313354, "epoch": 0.43882513129741296, "grad_norm": 1.2421875, "learning_rate": 0.0004985321839131514, "loss": 5.6325, "mean_token_accuracy": 0.15101755112409593, "num_tokens": 9790618.0, "step": 5640 }, { "entropy": 5.734963464736938, "epoch": 0.4392141606691305, "grad_norm": 1.4375, "learning_rate": 0.0004985290215833428, "loss": 5.6187, "mean_token_accuracy": 0.150974078476429, "num_tokens": 9800147.0, "step": 5645 }, { "entropy": 5.785725402832031, "epoch": 0.4396031900408481, "grad_norm": 1.25, "learning_rate": 0.0004985258558618372, "loss": 5.6791, "mean_token_accuracy": 0.15372121408581735, "num_tokens": 9809056.0, "step": 5650 }, { "entropy": 5.627626085281372, "epoch": 0.43999221941256567, "grad_norm": 1.296875, "learning_rate": 0.0004985226867486825, "loss": 5.5326, "mean_token_accuracy": 0.15544520765542985, "num_tokens": 9817188.0, "step": 5655 }, { "entropy": 5.6710656642913815, "epoch": 0.4403812487842832, "grad_norm": 1.25, "learning_rate": 0.0004985195142439267, "loss": 5.7274, "mean_token_accuracy": 0.1486324056982994, "num_tokens": 9826904.0, "step": 5660 }, { "entropy": 5.741341066360474, "epoch": 0.4407702781560008, "grad_norm": 1.3046875, "learning_rate": 0.0004985163383476181, "loss": 5.6834, "mean_token_accuracy": 0.1525462031364441, "num_tokens": 9835937.0, "step": 5665 }, { "entropy": 5.69437313079834, "epoch": 0.44115930752771837, "grad_norm": 1.2734375, "learning_rate": 0.0004985131590598048, "loss": 5.5055, "mean_token_accuracy": 0.1657673478126526, "num_tokens": 9843695.0, "step": 5670 }, { "entropy": 5.693076705932617, "epoch": 0.4415483368994359, "grad_norm": 1.2265625, "learning_rate": 0.0004985099763805352, "loss": 5.6019, "mean_token_accuracy": 0.15521264225244522, "num_tokens": 9852693.0, "step": 5675 }, { "entropy": 5.6236875534057615, "epoch": 0.4419373662711535, "grad_norm": 1.2421875, "learning_rate": 0.0004985067903098574, "loss": 5.6014, "mean_token_accuracy": 0.15343275368213655, "num_tokens": 9860251.0, "step": 5680 }, { "entropy": 5.5922425270080565, "epoch": 0.442326395642871, "grad_norm": 1.3828125, "learning_rate": 0.0004985036008478197, "loss": 5.5379, "mean_token_accuracy": 0.15147336274385453, "num_tokens": 9868319.0, "step": 5685 }, { "entropy": 5.629176235198974, "epoch": 0.4427154250145886, "grad_norm": 1.1953125, "learning_rate": 0.0004985004079944707, "loss": 5.5678, "mean_token_accuracy": 0.15566625073552132, "num_tokens": 9877119.0, "step": 5690 }, { "entropy": 5.791639518737793, "epoch": 0.4431044543863062, "grad_norm": 1.28125, "learning_rate": 0.0004984972117498587, "loss": 5.6647, "mean_token_accuracy": 0.15812490731477738, "num_tokens": 9886015.0, "step": 5695 }, { "entropy": 5.674712800979615, "epoch": 0.4434934837580237, "grad_norm": 1.28125, "learning_rate": 0.0004984940121140323, "loss": 5.602, "mean_token_accuracy": 0.1511713407933712, "num_tokens": 9894829.0, "step": 5700 }, { "entropy": 5.8527120590209964, "epoch": 0.4438825131297413, "grad_norm": 1.359375, "learning_rate": 0.00049849080908704, "loss": 5.8629, "mean_token_accuracy": 0.1408378891646862, "num_tokens": 9904840.0, "step": 5705 }, { "entropy": 5.819258117675782, "epoch": 0.44427154250145884, "grad_norm": 1.25, "learning_rate": 0.0004984876026689302, "loss": 5.6971, "mean_token_accuracy": 0.1521285057067871, "num_tokens": 9913535.0, "step": 5710 }, { "entropy": 5.7410163402557375, "epoch": 0.4446605718731764, "grad_norm": 1.265625, "learning_rate": 0.000498484392859752, "loss": 5.5853, "mean_token_accuracy": 0.1592594563961029, "num_tokens": 9921676.0, "step": 5715 }, { "entropy": 5.634752941131592, "epoch": 0.445049601244894, "grad_norm": 1.3203125, "learning_rate": 0.0004984811796595538, "loss": 5.6579, "mean_token_accuracy": 0.1542586490511894, "num_tokens": 9930321.0, "step": 5720 }, { "entropy": 5.693371438980103, "epoch": 0.44543863061661154, "grad_norm": 1.3125, "learning_rate": 0.0004984779630683843, "loss": 5.5919, "mean_token_accuracy": 0.15253776609897612, "num_tokens": 9939324.0, "step": 5725 }, { "entropy": 5.716857051849365, "epoch": 0.44582765998832913, "grad_norm": 1.2421875, "learning_rate": 0.0004984747430862924, "loss": 5.6196, "mean_token_accuracy": 0.16022590100765227, "num_tokens": 9948603.0, "step": 5730 }, { "entropy": 5.600257349014282, "epoch": 0.44621668936004666, "grad_norm": 1.2890625, "learning_rate": 0.0004984715197133271, "loss": 5.5224, "mean_token_accuracy": 0.1616570070385933, "num_tokens": 9957165.0, "step": 5735 }, { "entropy": 5.739328241348266, "epoch": 0.44660571873176425, "grad_norm": 1.328125, "learning_rate": 0.0004984682929495371, "loss": 5.6943, "mean_token_accuracy": 0.14594707265496254, "num_tokens": 9966064.0, "step": 5740 }, { "entropy": 5.640423107147217, "epoch": 0.44699474810348183, "grad_norm": 1.1953125, "learning_rate": 0.0004984650627949715, "loss": 5.5367, "mean_token_accuracy": 0.15209029316902162, "num_tokens": 9975146.0, "step": 5745 }, { "entropy": 5.680380773544312, "epoch": 0.44738377747519936, "grad_norm": 1.234375, "learning_rate": 0.0004984618292496792, "loss": 5.6202, "mean_token_accuracy": 0.15602054297924042, "num_tokens": 9983725.0, "step": 5750 }, { "entropy": 5.733370542526245, "epoch": 0.44777280684691695, "grad_norm": 1.2109375, "learning_rate": 0.0004984585923137093, "loss": 5.6747, "mean_token_accuracy": 0.15484231412410737, "num_tokens": 9992627.0, "step": 5755 }, { "entropy": 5.630478382110596, "epoch": 0.4481618362186345, "grad_norm": 1.2890625, "learning_rate": 0.000498455351987111, "loss": 5.4979, "mean_token_accuracy": 0.15697283297777176, "num_tokens": 10000801.0, "step": 5760 }, { "entropy": 5.698464012145996, "epoch": 0.44855086559035207, "grad_norm": 1.2265625, "learning_rate": 0.0004984521082699333, "loss": 5.6096, "mean_token_accuracy": 0.160343961417675, "num_tokens": 10009421.0, "step": 5765 }, { "entropy": 5.667017126083374, "epoch": 0.44893989496206965, "grad_norm": 1.296875, "learning_rate": 0.0004984488611622256, "loss": 5.6474, "mean_token_accuracy": 0.15203245729207993, "num_tokens": 10018527.0, "step": 5770 }, { "entropy": 5.714696216583252, "epoch": 0.4493289243337872, "grad_norm": 1.265625, "learning_rate": 0.000498445610664037, "loss": 5.5737, "mean_token_accuracy": 0.16014605462551118, "num_tokens": 10026906.0, "step": 5775 }, { "entropy": 5.624043941497803, "epoch": 0.44971795370550477, "grad_norm": 1.2421875, "learning_rate": 0.000498442356775417, "loss": 5.5475, "mean_token_accuracy": 0.1580877646803856, "num_tokens": 10035972.0, "step": 5780 }, { "entropy": 5.652503919601441, "epoch": 0.45010698307722236, "grad_norm": 1.359375, "learning_rate": 0.0004984390994964148, "loss": 5.6497, "mean_token_accuracy": 0.14800439924001693, "num_tokens": 10044544.0, "step": 5785 }, { "entropy": 5.768403387069702, "epoch": 0.4504960124489399, "grad_norm": 1.375, "learning_rate": 0.00049843583882708, "loss": 5.6335, "mean_token_accuracy": 0.15916564911603928, "num_tokens": 10052880.0, "step": 5790 }, { "entropy": 5.7311272621154785, "epoch": 0.4508850418206575, "grad_norm": 1.2890625, "learning_rate": 0.000498432574767462, "loss": 5.6963, "mean_token_accuracy": 0.14732673913240432, "num_tokens": 10062373.0, "step": 5795 }, { "entropy": 5.6710062503814695, "epoch": 0.451274071192375, "grad_norm": 1.2734375, "learning_rate": 0.0004984293073176103, "loss": 5.5125, "mean_token_accuracy": 0.16145335882902145, "num_tokens": 10070473.0, "step": 5800 }, { "entropy": 5.725533723831177, "epoch": 0.4516631005640926, "grad_norm": 1.2734375, "learning_rate": 0.0004984260364775744, "loss": 5.6547, "mean_token_accuracy": 0.15550251305103302, "num_tokens": 10079857.0, "step": 5805 }, { "entropy": 5.70276026725769, "epoch": 0.4520521299358102, "grad_norm": 1.4140625, "learning_rate": 0.000498422762247404, "loss": 5.6039, "mean_token_accuracy": 0.1518784373998642, "num_tokens": 10088326.0, "step": 5810 }, { "entropy": 5.675834608078003, "epoch": 0.4524411593075277, "grad_norm": 1.453125, "learning_rate": 0.0004984194846271489, "loss": 5.5466, "mean_token_accuracy": 0.15411396324634552, "num_tokens": 10097208.0, "step": 5815 }, { "entropy": 5.686789417266846, "epoch": 0.4528301886792453, "grad_norm": 1.2578125, "learning_rate": 0.0004984162036168586, "loss": 5.6393, "mean_token_accuracy": 0.14983187168836593, "num_tokens": 10106057.0, "step": 5820 }, { "entropy": 5.659746503829956, "epoch": 0.4532192180509628, "grad_norm": 1.2890625, "learning_rate": 0.0004984129192165831, "loss": 5.5515, "mean_token_accuracy": 0.1533331200480461, "num_tokens": 10115384.0, "step": 5825 }, { "entropy": 5.728514289855957, "epoch": 0.4536082474226804, "grad_norm": 1.25, "learning_rate": 0.0004984096314263722, "loss": 5.6365, "mean_token_accuracy": 0.14838182777166367, "num_tokens": 10123958.0, "step": 5830 }, { "entropy": 5.685654067993164, "epoch": 0.453997276794398, "grad_norm": 1.359375, "learning_rate": 0.0004984063402462757, "loss": 5.5811, "mean_token_accuracy": 0.16384691447019578, "num_tokens": 10133199.0, "step": 5835 }, { "entropy": 5.608744812011719, "epoch": 0.45438630616611553, "grad_norm": 1.2265625, "learning_rate": 0.0004984030456763435, "loss": 5.5209, "mean_token_accuracy": 0.16693407595157622, "num_tokens": 10141796.0, "step": 5840 }, { "entropy": 5.632417869567871, "epoch": 0.4547753355378331, "grad_norm": 1.3984375, "learning_rate": 0.0004983997477166257, "loss": 5.5498, "mean_token_accuracy": 0.16132254749536515, "num_tokens": 10149941.0, "step": 5845 }, { "entropy": 5.706463146209717, "epoch": 0.45516436490955064, "grad_norm": 1.265625, "learning_rate": 0.0004983964463671723, "loss": 5.6488, "mean_token_accuracy": 0.15120118111371994, "num_tokens": 10158796.0, "step": 5850 }, { "entropy": 5.7029928207397464, "epoch": 0.45555339428126823, "grad_norm": 1.234375, "learning_rate": 0.0004983931416280334, "loss": 5.5775, "mean_token_accuracy": 0.1588720500469208, "num_tokens": 10167328.0, "step": 5855 }, { "entropy": 5.687714672088623, "epoch": 0.4559424236529858, "grad_norm": 1.359375, "learning_rate": 0.0004983898334992591, "loss": 5.6381, "mean_token_accuracy": 0.1526034250855446, "num_tokens": 10175937.0, "step": 5860 }, { "entropy": 5.681948041915893, "epoch": 0.45633145302470335, "grad_norm": 1.390625, "learning_rate": 0.0004983865219808998, "loss": 5.5921, "mean_token_accuracy": 0.14964849948883058, "num_tokens": 10184828.0, "step": 5865 }, { "entropy": 5.637333917617798, "epoch": 0.45672048239642093, "grad_norm": 1.234375, "learning_rate": 0.0004983832070730055, "loss": 5.5963, "mean_token_accuracy": 0.1577572539448738, "num_tokens": 10193871.0, "step": 5870 }, { "entropy": 5.634118127822876, "epoch": 0.4571095117681385, "grad_norm": 1.4453125, "learning_rate": 0.0004983798887756265, "loss": 5.6008, "mean_token_accuracy": 0.15409007370471955, "num_tokens": 10202740.0, "step": 5875 }, { "entropy": 5.706058931350708, "epoch": 0.45749854113985605, "grad_norm": 1.21875, "learning_rate": 0.0004983765670888133, "loss": 5.5434, "mean_token_accuracy": 0.1615920588374138, "num_tokens": 10210903.0, "step": 5880 }, { "entropy": 5.608094549179077, "epoch": 0.45788757051157364, "grad_norm": 1.25, "learning_rate": 0.0004983732420126163, "loss": 5.4997, "mean_token_accuracy": 0.16220609247684478, "num_tokens": 10219305.0, "step": 5885 }, { "entropy": 5.657922029495239, "epoch": 0.45827659988329117, "grad_norm": 1.2421875, "learning_rate": 0.0004983699135470858, "loss": 5.6679, "mean_token_accuracy": 0.14259497374296187, "num_tokens": 10228575.0, "step": 5890 }, { "entropy": 5.6840509414672855, "epoch": 0.45866562925500876, "grad_norm": 1.3046875, "learning_rate": 0.0004983665816922723, "loss": 5.6437, "mean_token_accuracy": 0.15515442043542862, "num_tokens": 10237813.0, "step": 5895 }, { "entropy": 5.765459394454956, "epoch": 0.45905465862672634, "grad_norm": 1.265625, "learning_rate": 0.0004983632464482267, "loss": 5.639, "mean_token_accuracy": 0.151662015914917, "num_tokens": 10246606.0, "step": 5900 }, { "entropy": 5.665762281417846, "epoch": 0.4594436879984439, "grad_norm": 1.359375, "learning_rate": 0.0004983599078149991, "loss": 5.5937, "mean_token_accuracy": 0.1628975346684456, "num_tokens": 10254996.0, "step": 5905 }, { "entropy": 5.648976230621338, "epoch": 0.45983271737016146, "grad_norm": 1.453125, "learning_rate": 0.0004983565657926405, "loss": 5.6435, "mean_token_accuracy": 0.15243904292583466, "num_tokens": 10263570.0, "step": 5910 }, { "entropy": 5.629678344726562, "epoch": 0.460221746741879, "grad_norm": 1.125, "learning_rate": 0.0004983532203812017, "loss": 5.4759, "mean_token_accuracy": 0.16085339486598968, "num_tokens": 10272237.0, "step": 5915 }, { "entropy": 5.653153705596924, "epoch": 0.4606107761135966, "grad_norm": 1.5625, "learning_rate": 0.0004983498715807331, "loss": 5.6017, "mean_token_accuracy": 0.15792696475982665, "num_tokens": 10281215.0, "step": 5920 }, { "entropy": 5.727438068389892, "epoch": 0.46099980548531416, "grad_norm": 1.3515625, "learning_rate": 0.0004983465193912857, "loss": 5.6669, "mean_token_accuracy": 0.15387242883443833, "num_tokens": 10291054.0, "step": 5925 }, { "entropy": 5.810876703262329, "epoch": 0.4613888348570317, "grad_norm": 1.3359375, "learning_rate": 0.0004983431638129104, "loss": 5.6472, "mean_token_accuracy": 0.1563032776117325, "num_tokens": 10299847.0, "step": 5930 }, { "entropy": 5.660638475418091, "epoch": 0.4617778642287493, "grad_norm": 1.3984375, "learning_rate": 0.0004983398048456581, "loss": 5.5824, "mean_token_accuracy": 0.15701979771256447, "num_tokens": 10309195.0, "step": 5935 }, { "entropy": 5.640789127349853, "epoch": 0.4621668936004668, "grad_norm": 1.46875, "learning_rate": 0.0004983364424895796, "loss": 5.6019, "mean_token_accuracy": 0.15272444784641265, "num_tokens": 10318386.0, "step": 5940 }, { "entropy": 5.626794528961182, "epoch": 0.4625559229721844, "grad_norm": 1.390625, "learning_rate": 0.0004983330767447262, "loss": 5.5244, "mean_token_accuracy": 0.1628873825073242, "num_tokens": 10327230.0, "step": 5945 }, { "entropy": 5.629368782043457, "epoch": 0.462944952343902, "grad_norm": 1.5703125, "learning_rate": 0.0004983297076111489, "loss": 5.5165, "mean_token_accuracy": 0.15757380425930023, "num_tokens": 10335617.0, "step": 5950 }, { "entropy": 5.661604261398315, "epoch": 0.4633339817156195, "grad_norm": 1.21875, "learning_rate": 0.0004983263350888987, "loss": 5.5725, "mean_token_accuracy": 0.15994318276643754, "num_tokens": 10344302.0, "step": 5955 }, { "entropy": 5.681477737426758, "epoch": 0.4637230110873371, "grad_norm": 1.8125, "learning_rate": 0.0004983229591780268, "loss": 5.6433, "mean_token_accuracy": 0.1517888329923153, "num_tokens": 10352490.0, "step": 5960 }, { "entropy": 5.655088281631469, "epoch": 0.46411204045905463, "grad_norm": 1.3046875, "learning_rate": 0.0004983195798785844, "loss": 5.5766, "mean_token_accuracy": 0.16044610887765884, "num_tokens": 10361249.0, "step": 5965 }, { "entropy": 5.74783935546875, "epoch": 0.4645010698307722, "grad_norm": 1.3046875, "learning_rate": 0.0004983161971906228, "loss": 5.6829, "mean_token_accuracy": 0.14617585390806198, "num_tokens": 10370367.0, "step": 5970 }, { "entropy": 5.724832582473755, "epoch": 0.4648900992024898, "grad_norm": 2.53125, "learning_rate": 0.0004983128111141935, "loss": 5.6284, "mean_token_accuracy": 0.14997454285621642, "num_tokens": 10378429.0, "step": 5975 }, { "entropy": 5.623139333724976, "epoch": 0.46527912857420733, "grad_norm": 1.4375, "learning_rate": 0.0004983094216493475, "loss": 5.5512, "mean_token_accuracy": 0.15990946292877198, "num_tokens": 10386762.0, "step": 5980 }, { "entropy": 5.657111024856567, "epoch": 0.4656681579459249, "grad_norm": 1.5546875, "learning_rate": 0.0004983060287961367, "loss": 5.5573, "mean_token_accuracy": 0.15611529648303984, "num_tokens": 10395150.0, "step": 5985 }, { "entropy": 5.686012268066406, "epoch": 0.4660571873176425, "grad_norm": 1.453125, "learning_rate": 0.0004983026325546123, "loss": 5.6061, "mean_token_accuracy": 0.1571057692170143, "num_tokens": 10403941.0, "step": 5990 }, { "entropy": 5.790388917922973, "epoch": 0.46644621668936004, "grad_norm": 1.484375, "learning_rate": 0.0004982992329248257, "loss": 5.6699, "mean_token_accuracy": 0.14361992180347444, "num_tokens": 10413955.0, "step": 5995 }, { "entropy": 5.740258312225341, "epoch": 0.4668352460610776, "grad_norm": 1.390625, "learning_rate": 0.0004982958299068289, "loss": 5.576, "mean_token_accuracy": 0.15433995723724364, "num_tokens": 10421676.0, "step": 6000 }, { "epoch": 0.4668352460610776, "eval_entropy": 5.496154374681606, "eval_loss": 5.649525165557861, "eval_mean_token_accuracy": 0.16116220440296053, "eval_num_tokens": 10421676.0, "eval_runtime": 28.6748, "eval_samples_per_second": 1449.287, "eval_steps_per_second": 181.17, "step": 6000 }, { "entropy": 5.599911737442016, "epoch": 0.46722427543279516, "grad_norm": 1.46875, "learning_rate": 0.000498292423500673, "loss": 5.5414, "mean_token_accuracy": 0.15246708691120148, "num_tokens": 10430714.0, "step": 6005 }, { "entropy": 5.7318932056427006, "epoch": 0.46761330480451274, "grad_norm": 1.421875, "learning_rate": 0.0004982890137064102, "loss": 5.6676, "mean_token_accuracy": 0.15135798901319503, "num_tokens": 10439089.0, "step": 6010 }, { "entropy": 5.671796178817749, "epoch": 0.46800233417623033, "grad_norm": 1.328125, "learning_rate": 0.000498285600524092, "loss": 5.5886, "mean_token_accuracy": 0.1586393378674984, "num_tokens": 10447455.0, "step": 6015 }, { "entropy": 5.6312915802001955, "epoch": 0.46839136354794786, "grad_norm": 1.375, "learning_rate": 0.0004982821839537701, "loss": 5.5752, "mean_token_accuracy": 0.154066501557827, "num_tokens": 10455936.0, "step": 6020 }, { "entropy": 5.781944608688354, "epoch": 0.46878039291966545, "grad_norm": 1.2890625, "learning_rate": 0.0004982787639954966, "loss": 5.7007, "mean_token_accuracy": 0.14853788390755654, "num_tokens": 10465389.0, "step": 6025 }, { "entropy": 5.8027105808258055, "epoch": 0.469169422291383, "grad_norm": 1.390625, "learning_rate": 0.0004982753406493232, "loss": 5.5786, "mean_token_accuracy": 0.15479041785001754, "num_tokens": 10474709.0, "step": 6030 }, { "entropy": 5.6630011081695555, "epoch": 0.46955845166310056, "grad_norm": 1.5625, "learning_rate": 0.0004982719139153018, "loss": 5.5814, "mean_token_accuracy": 0.152097749710083, "num_tokens": 10482972.0, "step": 6035 }, { "entropy": 5.663127374649048, "epoch": 0.46994748103481815, "grad_norm": 1.3984375, "learning_rate": 0.0004982684837934845, "loss": 5.5797, "mean_token_accuracy": 0.15856870114803315, "num_tokens": 10490897.0, "step": 6040 }, { "entropy": 5.644709920883178, "epoch": 0.4703365104065357, "grad_norm": 1.3515625, "learning_rate": 0.0004982650502839234, "loss": 5.5886, "mean_token_accuracy": 0.15786385238170625, "num_tokens": 10499679.0, "step": 6045 }, { "entropy": 5.725128126144409, "epoch": 0.47072553977825327, "grad_norm": 1.421875, "learning_rate": 0.0004982616133866705, "loss": 5.6421, "mean_token_accuracy": 0.15326734334230424, "num_tokens": 10508775.0, "step": 6050 }, { "entropy": 5.618102359771728, "epoch": 0.4711145691499708, "grad_norm": 1.7578125, "learning_rate": 0.0004982581731017779, "loss": 5.5447, "mean_token_accuracy": 0.16346119344234467, "num_tokens": 10517600.0, "step": 6055 }, { "entropy": 5.5527385711669925, "epoch": 0.4715035985216884, "grad_norm": 1.5078125, "learning_rate": 0.0004982547294292979, "loss": 5.5035, "mean_token_accuracy": 0.16293236017227172, "num_tokens": 10525674.0, "step": 6060 }, { "entropy": 5.699562311172485, "epoch": 0.47189262789340597, "grad_norm": 1.4453125, "learning_rate": 0.0004982512823692828, "loss": 5.7015, "mean_token_accuracy": 0.14990407973527908, "num_tokens": 10533819.0, "step": 6065 }, { "entropy": 5.661665582656861, "epoch": 0.4722816572651235, "grad_norm": 1.359375, "learning_rate": 0.0004982478319217848, "loss": 5.5065, "mean_token_accuracy": 0.1595573216676712, "num_tokens": 10542901.0, "step": 6070 }, { "entropy": 5.691421365737915, "epoch": 0.4726706866368411, "grad_norm": 1.2890625, "learning_rate": 0.0004982443780868562, "loss": 5.5825, "mean_token_accuracy": 0.16080685406923295, "num_tokens": 10552388.0, "step": 6075 }, { "entropy": 5.728979778289795, "epoch": 0.4730597160085587, "grad_norm": 1.3984375, "learning_rate": 0.0004982409208645496, "loss": 5.6839, "mean_token_accuracy": 0.15371156632900237, "num_tokens": 10561676.0, "step": 6080 }, { "entropy": 5.769681835174561, "epoch": 0.4734487453802762, "grad_norm": 1.5234375, "learning_rate": 0.0004982374602549173, "loss": 5.5888, "mean_token_accuracy": 0.15942396819591523, "num_tokens": 10570037.0, "step": 6085 }, { "entropy": 5.650616025924682, "epoch": 0.4738377747519938, "grad_norm": 1.3828125, "learning_rate": 0.0004982339962580119, "loss": 5.5862, "mean_token_accuracy": 0.15037061125040055, "num_tokens": 10579140.0, "step": 6090 }, { "entropy": 5.655625486373902, "epoch": 0.4742268041237113, "grad_norm": 1.3828125, "learning_rate": 0.0004982305288738859, "loss": 5.6288, "mean_token_accuracy": 0.15578012466430663, "num_tokens": 10587689.0, "step": 6095 }, { "entropy": 5.667337083816529, "epoch": 0.4746158334954289, "grad_norm": 1.3203125, "learning_rate": 0.0004982270581025919, "loss": 5.5078, "mean_token_accuracy": 0.15836172550916672, "num_tokens": 10596002.0, "step": 6100 }, { "entropy": 5.702313661575317, "epoch": 0.4750048628671465, "grad_norm": 1.703125, "learning_rate": 0.0004982235839441826, "loss": 5.7311, "mean_token_accuracy": 0.14916150867938996, "num_tokens": 10605895.0, "step": 6105 }, { "entropy": 5.763257837295532, "epoch": 0.475393892238864, "grad_norm": 1.40625, "learning_rate": 0.0004982201063987108, "loss": 5.6638, "mean_token_accuracy": 0.14756975322961807, "num_tokens": 10614641.0, "step": 6110 }, { "entropy": 5.660020637512207, "epoch": 0.4757829216105816, "grad_norm": 1.453125, "learning_rate": 0.0004982166254662292, "loss": 5.6378, "mean_token_accuracy": 0.1533852770924568, "num_tokens": 10624381.0, "step": 6115 }, { "entropy": 5.706807374954224, "epoch": 0.47617195098229914, "grad_norm": 1.3359375, "learning_rate": 0.0004982131411467904, "loss": 5.5952, "mean_token_accuracy": 0.15574658811092376, "num_tokens": 10632493.0, "step": 6120 }, { "entropy": 5.704343557357788, "epoch": 0.4765609803540167, "grad_norm": 1.3671875, "learning_rate": 0.0004982096534404476, "loss": 5.6232, "mean_token_accuracy": 0.14914219677448273, "num_tokens": 10641556.0, "step": 6125 }, { "entropy": 5.67762017250061, "epoch": 0.4769500097257343, "grad_norm": 1.40625, "learning_rate": 0.0004982061623472535, "loss": 5.6904, "mean_token_accuracy": 0.15633485242724418, "num_tokens": 10649736.0, "step": 6130 }, { "entropy": 5.684682178497314, "epoch": 0.47733903909745184, "grad_norm": 1.5625, "learning_rate": 0.0004982026678672612, "loss": 5.5009, "mean_token_accuracy": 0.16547404527664183, "num_tokens": 10657991.0, "step": 6135 }, { "entropy": 5.596237707138061, "epoch": 0.47772806846916943, "grad_norm": 1.421875, "learning_rate": 0.0004981991700005238, "loss": 5.5706, "mean_token_accuracy": 0.15123811960220337, "num_tokens": 10667310.0, "step": 6140 }, { "entropy": 5.741936254501343, "epoch": 0.47811709784088696, "grad_norm": 1.328125, "learning_rate": 0.000498195668747094, "loss": 5.6213, "mean_token_accuracy": 0.15695492923259735, "num_tokens": 10675658.0, "step": 6145 }, { "entropy": 5.638043642044067, "epoch": 0.47850612721260455, "grad_norm": 1.5078125, "learning_rate": 0.0004981921641070254, "loss": 5.5102, "mean_token_accuracy": 0.16681503355503083, "num_tokens": 10684016.0, "step": 6150 }, { "entropy": 5.666017532348633, "epoch": 0.47889515658432213, "grad_norm": 1.453125, "learning_rate": 0.0004981886560803708, "loss": 5.6281, "mean_token_accuracy": 0.15898596942424775, "num_tokens": 10692814.0, "step": 6155 }, { "entropy": 5.71913104057312, "epoch": 0.47928418595603967, "grad_norm": 2.296875, "learning_rate": 0.0004981851446671838, "loss": 5.6469, "mean_token_accuracy": 0.15398247838020324, "num_tokens": 10701571.0, "step": 6160 }, { "entropy": 5.743273782730102, "epoch": 0.47967321532775725, "grad_norm": 1.4296875, "learning_rate": 0.0004981816298675173, "loss": 5.6321, "mean_token_accuracy": 0.15258511602878572, "num_tokens": 10710569.0, "step": 6165 }, { "entropy": 5.699658441543579, "epoch": 0.4800622446994748, "grad_norm": 1.390625, "learning_rate": 0.0004981781116814248, "loss": 5.6556, "mean_token_accuracy": 0.15451659709215165, "num_tokens": 10719277.0, "step": 6170 }, { "entropy": 5.6413978099822994, "epoch": 0.48045127407119237, "grad_norm": 1.5078125, "learning_rate": 0.0004981745901089596, "loss": 5.523, "mean_token_accuracy": 0.1553031951189041, "num_tokens": 10727174.0, "step": 6175 }, { "entropy": 5.652820158004761, "epoch": 0.48084030344290996, "grad_norm": 1.4453125, "learning_rate": 0.0004981710651501753, "loss": 5.6308, "mean_token_accuracy": 0.1499924898147583, "num_tokens": 10736072.0, "step": 6180 }, { "entropy": 5.77542290687561, "epoch": 0.4812293328146275, "grad_norm": 1.484375, "learning_rate": 0.0004981675368051254, "loss": 5.6366, "mean_token_accuracy": 0.1591070920228958, "num_tokens": 10745375.0, "step": 6185 }, { "entropy": 5.6705575466156, "epoch": 0.4816183621863451, "grad_norm": 1.34375, "learning_rate": 0.0004981640050738633, "loss": 5.6372, "mean_token_accuracy": 0.15502333045005798, "num_tokens": 10754049.0, "step": 6190 }, { "entropy": 5.6272234439849855, "epoch": 0.48200739155806266, "grad_norm": 1.2734375, "learning_rate": 0.0004981604699564426, "loss": 5.5709, "mean_token_accuracy": 0.15725173354148864, "num_tokens": 10763475.0, "step": 6195 }, { "entropy": 5.723629283905029, "epoch": 0.4823964209297802, "grad_norm": 1.4296875, "learning_rate": 0.0004981569314529169, "loss": 5.6537, "mean_token_accuracy": 0.15193783938884736, "num_tokens": 10772100.0, "step": 6200 }, { "entropy": 5.624773168563843, "epoch": 0.4827854503014978, "grad_norm": 1.421875, "learning_rate": 0.00049815338956334, "loss": 5.586, "mean_token_accuracy": 0.1571911796927452, "num_tokens": 10780605.0, "step": 6205 }, { "entropy": 5.688734722137451, "epoch": 0.4831744796732153, "grad_norm": 1.40625, "learning_rate": 0.0004981498442877656, "loss": 5.57, "mean_token_accuracy": 0.15786497220396994, "num_tokens": 10789235.0, "step": 6210 }, { "entropy": 5.692664527893067, "epoch": 0.4835635090449329, "grad_norm": 1.484375, "learning_rate": 0.0004981462956262474, "loss": 5.5806, "mean_token_accuracy": 0.15071646571159364, "num_tokens": 10798078.0, "step": 6215 }, { "entropy": 5.687393140792847, "epoch": 0.4839525384166505, "grad_norm": 1.65625, "learning_rate": 0.0004981427435788396, "loss": 5.6054, "mean_token_accuracy": 0.14804309904575347, "num_tokens": 10807667.0, "step": 6220 }, { "entropy": 5.652494049072265, "epoch": 0.484341567788368, "grad_norm": 1.609375, "learning_rate": 0.0004981391881455957, "loss": 5.5685, "mean_token_accuracy": 0.14992497563362123, "num_tokens": 10816574.0, "step": 6225 }, { "entropy": 5.658774518966675, "epoch": 0.4847305971600856, "grad_norm": 1.453125, "learning_rate": 0.0004981356293265696, "loss": 5.5465, "mean_token_accuracy": 0.15477658212184905, "num_tokens": 10824675.0, "step": 6230 }, { "entropy": 5.645687818527222, "epoch": 0.4851196265318031, "grad_norm": 1.40625, "learning_rate": 0.0004981320671218157, "loss": 5.5049, "mean_token_accuracy": 0.16456515043973924, "num_tokens": 10832855.0, "step": 6235 }, { "entropy": 5.572377777099609, "epoch": 0.4855086559035207, "grad_norm": 1.4296875, "learning_rate": 0.0004981285015313877, "loss": 5.4122, "mean_token_accuracy": 0.1659885361790657, "num_tokens": 10841603.0, "step": 6240 }, { "entropy": 5.74435248374939, "epoch": 0.4858976852752383, "grad_norm": 1.546875, "learning_rate": 0.0004981249325553399, "loss": 5.7553, "mean_token_accuracy": 0.14605401381850242, "num_tokens": 10850348.0, "step": 6245 }, { "entropy": 5.7315455913543705, "epoch": 0.48628671464695583, "grad_norm": 1.421875, "learning_rate": 0.0004981213601937264, "loss": 5.4984, "mean_token_accuracy": 0.15666187256574632, "num_tokens": 10858955.0, "step": 6250 }, { "entropy": 5.634166193008423, "epoch": 0.4866757440186734, "grad_norm": 1.3125, "learning_rate": 0.0004981177844466013, "loss": 5.5928, "mean_token_accuracy": 0.1482228606939316, "num_tokens": 10867336.0, "step": 6255 }, { "entropy": 5.68542799949646, "epoch": 0.48706477339039095, "grad_norm": 1.359375, "learning_rate": 0.0004981142053140192, "loss": 5.6738, "mean_token_accuracy": 0.15138802379369737, "num_tokens": 10877043.0, "step": 6260 }, { "entropy": 5.799023103713989, "epoch": 0.48745380276210853, "grad_norm": 1.40625, "learning_rate": 0.0004981106227960339, "loss": 5.6314, "mean_token_accuracy": 0.15212034434080124, "num_tokens": 10885580.0, "step": 6265 }, { "entropy": 5.727660846710205, "epoch": 0.4878428321338261, "grad_norm": 1.3984375, "learning_rate": 0.0004981070368927001, "loss": 5.7355, "mean_token_accuracy": 0.1497201591730118, "num_tokens": 10894289.0, "step": 6270 }, { "entropy": 5.723119068145752, "epoch": 0.48823186150554365, "grad_norm": 1.375, "learning_rate": 0.000498103447604072, "loss": 5.6595, "mean_token_accuracy": 0.14703867062926293, "num_tokens": 10902384.0, "step": 6275 }, { "entropy": 5.73089189529419, "epoch": 0.48862089087726124, "grad_norm": 1.546875, "learning_rate": 0.0004980998549302044, "loss": 5.5618, "mean_token_accuracy": 0.1498264640569687, "num_tokens": 10911160.0, "step": 6280 }, { "entropy": 5.621191596984863, "epoch": 0.4890099202489788, "grad_norm": 1.2578125, "learning_rate": 0.0004980962588711516, "loss": 5.4562, "mean_token_accuracy": 0.16945781260728837, "num_tokens": 10920066.0, "step": 6285 }, { "entropy": 5.694791412353515, "epoch": 0.48939894962069636, "grad_norm": 1.375, "learning_rate": 0.000498092659426968, "loss": 5.635, "mean_token_accuracy": 0.15655620992183686, "num_tokens": 10928969.0, "step": 6290 }, { "entropy": 5.752533292770385, "epoch": 0.48978797899241394, "grad_norm": 1.2578125, "learning_rate": 0.0004980890565977085, "loss": 5.627, "mean_token_accuracy": 0.1562311053276062, "num_tokens": 10936939.0, "step": 6295 }, { "entropy": 5.633117532730102, "epoch": 0.4901770083641315, "grad_norm": 1.4453125, "learning_rate": 0.0004980854503834276, "loss": 5.5868, "mean_token_accuracy": 0.15852609723806382, "num_tokens": 10945929.0, "step": 6300 }, { "entropy": 5.663782453536987, "epoch": 0.49056603773584906, "grad_norm": 1.2890625, "learning_rate": 0.0004980818407841802, "loss": 5.5863, "mean_token_accuracy": 0.1573207527399063, "num_tokens": 10954849.0, "step": 6305 }, { "entropy": 5.678795623779297, "epoch": 0.49095506710756665, "grad_norm": 1.328125, "learning_rate": 0.0004980782278000207, "loss": 5.6407, "mean_token_accuracy": 0.15423305928707123, "num_tokens": 10963800.0, "step": 6310 }, { "entropy": 5.839993190765381, "epoch": 0.4913440964792842, "grad_norm": 1.3671875, "learning_rate": 0.0004980746114310043, "loss": 5.6953, "mean_token_accuracy": 0.15321774333715438, "num_tokens": 10972477.0, "step": 6315 }, { "entropy": 5.829525756835937, "epoch": 0.49173312585100176, "grad_norm": 1.3515625, "learning_rate": 0.0004980709916771858, "loss": 5.6855, "mean_token_accuracy": 0.1555396370589733, "num_tokens": 10981437.0, "step": 6320 }, { "entropy": 5.64800500869751, "epoch": 0.4921221552227193, "grad_norm": 1.34375, "learning_rate": 0.0004980673685386198, "loss": 5.5357, "mean_token_accuracy": 0.15727183669805528, "num_tokens": 10989973.0, "step": 6325 }, { "entropy": 5.586803579330445, "epoch": 0.4925111845944369, "grad_norm": 1.453125, "learning_rate": 0.0004980637420153618, "loss": 5.5574, "mean_token_accuracy": 0.15266730338335038, "num_tokens": 10998160.0, "step": 6330 }, { "entropy": 5.676742506027222, "epoch": 0.49290021396615447, "grad_norm": 1.421875, "learning_rate": 0.0004980601121074664, "loss": 5.7116, "mean_token_accuracy": 0.1521316148340702, "num_tokens": 11007127.0, "step": 6335 }, { "entropy": 5.7719337940216064, "epoch": 0.493289243337872, "grad_norm": 1.421875, "learning_rate": 0.0004980564788149889, "loss": 5.5615, "mean_token_accuracy": 0.15340966284275054, "num_tokens": 11015518.0, "step": 6340 }, { "entropy": 5.611857223510742, "epoch": 0.4936782727095896, "grad_norm": 1.3828125, "learning_rate": 0.0004980528421379844, "loss": 5.4632, "mean_token_accuracy": 0.16847451776266098, "num_tokens": 11023739.0, "step": 6345 }, { "entropy": 5.586323976516724, "epoch": 0.4940673020813071, "grad_norm": 1.2890625, "learning_rate": 0.000498049202076508, "loss": 5.4961, "mean_token_accuracy": 0.16648571491241454, "num_tokens": 11032034.0, "step": 6350 }, { "entropy": 5.642065715789795, "epoch": 0.4944563314530247, "grad_norm": 1.375, "learning_rate": 0.0004980455586306149, "loss": 5.4984, "mean_token_accuracy": 0.1611510455608368, "num_tokens": 11040319.0, "step": 6355 }, { "entropy": 5.604467725753784, "epoch": 0.4948453608247423, "grad_norm": 1.6875, "learning_rate": 0.0004980419118003605, "loss": 5.5654, "mean_token_accuracy": 0.15740724951028823, "num_tokens": 11049459.0, "step": 6360 }, { "entropy": 5.663004446029663, "epoch": 0.4952343901964598, "grad_norm": 1.8046875, "learning_rate": 0.0004980382615858001, "loss": 5.5489, "mean_token_accuracy": 0.15955363661050798, "num_tokens": 11058402.0, "step": 6365 }, { "entropy": 5.593869209289551, "epoch": 0.4956234195681774, "grad_norm": 1.328125, "learning_rate": 0.0004980346079869892, "loss": 5.4955, "mean_token_accuracy": 0.1616832584142685, "num_tokens": 11067430.0, "step": 6370 }, { "entropy": 5.668562316894532, "epoch": 0.49601244893989493, "grad_norm": 1.3359375, "learning_rate": 0.000498030951003983, "loss": 5.492, "mean_token_accuracy": 0.16149785220623017, "num_tokens": 11075594.0, "step": 6375 }, { "entropy": 5.595048952102661, "epoch": 0.4964014783116125, "grad_norm": 1.421875, "learning_rate": 0.0004980272906368371, "loss": 5.4584, "mean_token_accuracy": 0.1725854143500328, "num_tokens": 11083509.0, "step": 6380 }, { "entropy": 5.637046384811401, "epoch": 0.4967905076833301, "grad_norm": 1.4296875, "learning_rate": 0.0004980236268856071, "loss": 5.6269, "mean_token_accuracy": 0.15187471285462378, "num_tokens": 11091938.0, "step": 6385 }, { "entropy": 5.681407499313354, "epoch": 0.49717953705504764, "grad_norm": 1.3671875, "learning_rate": 0.0004980199597503487, "loss": 5.6592, "mean_token_accuracy": 0.15273707509040832, "num_tokens": 11099974.0, "step": 6390 }, { "entropy": 5.583227300643921, "epoch": 0.4975685664267652, "grad_norm": 1.421875, "learning_rate": 0.0004980162892311171, "loss": 5.3097, "mean_token_accuracy": 0.1723850205540657, "num_tokens": 11107944.0, "step": 6395 }, { "entropy": 5.559449100494385, "epoch": 0.4979575957984828, "grad_norm": 1.4453125, "learning_rate": 0.0004980126153279684, "loss": 5.603, "mean_token_accuracy": 0.1561395511031151, "num_tokens": 11116401.0, "step": 6400 }, { "entropy": 5.660170412063598, "epoch": 0.49834662517020034, "grad_norm": 1.375, "learning_rate": 0.0004980089380409583, "loss": 5.5709, "mean_token_accuracy": 0.15186020135879516, "num_tokens": 11125430.0, "step": 6405 }, { "entropy": 5.715793418884277, "epoch": 0.4987356545419179, "grad_norm": 1.3984375, "learning_rate": 0.0004980052573701424, "loss": 5.6372, "mean_token_accuracy": 0.148736110329628, "num_tokens": 11133949.0, "step": 6410 }, { "entropy": 5.731146192550659, "epoch": 0.49912468391363546, "grad_norm": 1.390625, "learning_rate": 0.0004980015733155767, "loss": 5.5675, "mean_token_accuracy": 0.16028442829847336, "num_tokens": 11141749.0, "step": 6415 }, { "entropy": 5.649786901473999, "epoch": 0.49951371328535304, "grad_norm": 1.7890625, "learning_rate": 0.0004979978858773171, "loss": 5.5657, "mean_token_accuracy": 0.15979141891002654, "num_tokens": 11150618.0, "step": 6420 }, { "entropy": 5.609336900711059, "epoch": 0.49990274265707063, "grad_norm": 1.390625, "learning_rate": 0.0004979941950554195, "loss": 5.5968, "mean_token_accuracy": 0.15541461259126663, "num_tokens": 11158549.0, "step": 6425 }, { "entropy": 5.672288656234741, "epoch": 0.5002917720287882, "grad_norm": 1.65625, "learning_rate": 0.0004979905008499399, "loss": 5.5365, "mean_token_accuracy": 0.16468718647956848, "num_tokens": 11167131.0, "step": 6430 }, { "entropy": 5.669491386413574, "epoch": 0.5006808014005057, "grad_norm": 1.390625, "learning_rate": 0.0004979868032609344, "loss": 5.6143, "mean_token_accuracy": 0.15387326255440711, "num_tokens": 11175766.0, "step": 6435 }, { "entropy": 5.688392448425293, "epoch": 0.5010698307722233, "grad_norm": 1.3515625, "learning_rate": 0.0004979831022884591, "loss": 5.5899, "mean_token_accuracy": 0.15998782515525817, "num_tokens": 11184799.0, "step": 6440 }, { "entropy": 5.594391107559204, "epoch": 0.5014588601439409, "grad_norm": 1.375, "learning_rate": 0.0004979793979325701, "loss": 5.5329, "mean_token_accuracy": 0.1567195326089859, "num_tokens": 11193083.0, "step": 6445 }, { "entropy": 5.582624864578247, "epoch": 0.5018478895156584, "grad_norm": 1.6796875, "learning_rate": 0.0004979756901933236, "loss": 5.5276, "mean_token_accuracy": 0.16227489709854126, "num_tokens": 11201753.0, "step": 6450 }, { "entropy": 5.760551834106446, "epoch": 0.502236918887376, "grad_norm": 1.296875, "learning_rate": 0.000497971979070776, "loss": 5.619, "mean_token_accuracy": 0.15672486275434494, "num_tokens": 11209965.0, "step": 6455 }, { "entropy": 5.6459235668182375, "epoch": 0.5026259482590936, "grad_norm": 1.453125, "learning_rate": 0.0004979682645649834, "loss": 5.517, "mean_token_accuracy": 0.1660740926861763, "num_tokens": 11217961.0, "step": 6460 }, { "entropy": 5.661819362640381, "epoch": 0.5030149776308112, "grad_norm": 1.421875, "learning_rate": 0.0004979645466760025, "loss": 5.6222, "mean_token_accuracy": 0.15498576909303666, "num_tokens": 11225803.0, "step": 6465 }, { "entropy": 5.619951629638672, "epoch": 0.5034040070025287, "grad_norm": 1.3046875, "learning_rate": 0.0004979608254038892, "loss": 5.4606, "mean_token_accuracy": 0.16229200810194017, "num_tokens": 11234584.0, "step": 6470 }, { "entropy": 5.680429172515869, "epoch": 0.5037930363742462, "grad_norm": 1.375, "learning_rate": 0.0004979571007487003, "loss": 5.6651, "mean_token_accuracy": 0.15144428014755248, "num_tokens": 11243340.0, "step": 6475 }, { "entropy": 5.62803840637207, "epoch": 0.5041820657459638, "grad_norm": 1.390625, "learning_rate": 0.0004979533727104924, "loss": 5.531, "mean_token_accuracy": 0.1532328888773918, "num_tokens": 11252383.0, "step": 6480 }, { "entropy": 5.630037784576416, "epoch": 0.5045710951176814, "grad_norm": 1.3515625, "learning_rate": 0.000497949641289322, "loss": 5.6087, "mean_token_accuracy": 0.15235372483730317, "num_tokens": 11261419.0, "step": 6485 }, { "entropy": 5.653547477722168, "epoch": 0.504960124489399, "grad_norm": 1.34375, "learning_rate": 0.0004979459064852456, "loss": 5.574, "mean_token_accuracy": 0.15386256873607634, "num_tokens": 11270743.0, "step": 6490 }, { "entropy": 5.706313419342041, "epoch": 0.5053491538611166, "grad_norm": 1.234375, "learning_rate": 0.0004979421682983197, "loss": 5.4868, "mean_token_accuracy": 0.15976502299308776, "num_tokens": 11279666.0, "step": 6495 }, { "entropy": 5.7113391876220705, "epoch": 0.505738183232834, "grad_norm": 1.4375, "learning_rate": 0.0004979384267286015, "loss": 5.6601, "mean_token_accuracy": 0.14999309778213502, "num_tokens": 11288710.0, "step": 6500 }, { "entropy": 5.6965361595153805, "epoch": 0.5061272126045516, "grad_norm": 1.6328125, "learning_rate": 0.0004979346817761475, "loss": 5.5297, "mean_token_accuracy": 0.15320013761520385, "num_tokens": 11297665.0, "step": 6505 }, { "entropy": 5.7402442455291744, "epoch": 0.5065162419762692, "grad_norm": 1.2421875, "learning_rate": 0.0004979309334410144, "loss": 5.6928, "mean_token_accuracy": 0.15129803717136384, "num_tokens": 11306751.0, "step": 6510 }, { "entropy": 5.690135049819946, "epoch": 0.5069052713479868, "grad_norm": 1.8515625, "learning_rate": 0.0004979271817232594, "loss": 5.6844, "mean_token_accuracy": 0.15013830214738846, "num_tokens": 11315659.0, "step": 6515 }, { "entropy": 5.701597547531128, "epoch": 0.5072943007197044, "grad_norm": 1.578125, "learning_rate": 0.0004979234266229391, "loss": 5.5613, "mean_token_accuracy": 0.1573285400867462, "num_tokens": 11323362.0, "step": 6520 }, { "entropy": 5.6727128505706785, "epoch": 0.5076833300914219, "grad_norm": 1.4375, "learning_rate": 0.0004979196681401106, "loss": 5.5589, "mean_token_accuracy": 0.15374930649995805, "num_tokens": 11332343.0, "step": 6525 }, { "entropy": 5.6307044506073, "epoch": 0.5080723594631394, "grad_norm": 1.3671875, "learning_rate": 0.000497915906274831, "loss": 5.5097, "mean_token_accuracy": 0.153728187084198, "num_tokens": 11340816.0, "step": 6530 }, { "entropy": 5.596715879440308, "epoch": 0.508461388834857, "grad_norm": 1.4375, "learning_rate": 0.0004979121410271574, "loss": 5.5076, "mean_token_accuracy": 0.1596982181072235, "num_tokens": 11349728.0, "step": 6535 }, { "entropy": 5.6834207534790036, "epoch": 0.5088504182065746, "grad_norm": 1.3203125, "learning_rate": 0.0004979083723971468, "loss": 5.6381, "mean_token_accuracy": 0.1554409921169281, "num_tokens": 11358477.0, "step": 6540 }, { "entropy": 5.589273118972779, "epoch": 0.5092394475782922, "grad_norm": 1.40625, "learning_rate": 0.0004979046003848564, "loss": 5.4559, "mean_token_accuracy": 0.166815909743309, "num_tokens": 11367183.0, "step": 6545 }, { "entropy": 5.6982262134552, "epoch": 0.5096284769500097, "grad_norm": 1.5390625, "learning_rate": 0.0004979008249903435, "loss": 5.6663, "mean_token_accuracy": 0.1446331888437271, "num_tokens": 11376703.0, "step": 6550 }, { "entropy": 5.741359567642212, "epoch": 0.5100175063217273, "grad_norm": 1.359375, "learning_rate": 0.0004978970462136655, "loss": 5.6684, "mean_token_accuracy": 0.1546018734574318, "num_tokens": 11385502.0, "step": 6555 }, { "entropy": 5.686350870132446, "epoch": 0.5104065356934449, "grad_norm": 1.40625, "learning_rate": 0.0004978932640548794, "loss": 5.5298, "mean_token_accuracy": 0.1591428518295288, "num_tokens": 11393947.0, "step": 6560 }, { "entropy": 5.59600796699524, "epoch": 0.5107955650651624, "grad_norm": 1.4765625, "learning_rate": 0.0004978894785140429, "loss": 5.5188, "mean_token_accuracy": 0.164163675904274, "num_tokens": 11403077.0, "step": 6565 }, { "entropy": 5.57859468460083, "epoch": 0.51118459443688, "grad_norm": 1.375, "learning_rate": 0.0004978856895912132, "loss": 5.5, "mean_token_accuracy": 0.15813149958848954, "num_tokens": 11411863.0, "step": 6570 }, { "entropy": 5.681532716751098, "epoch": 0.5115736238085975, "grad_norm": 1.4453125, "learning_rate": 0.0004978818972864481, "loss": 5.4611, "mean_token_accuracy": 0.16052573472261428, "num_tokens": 11420030.0, "step": 6575 }, { "entropy": 5.702321243286133, "epoch": 0.5119626531803151, "grad_norm": 1.3203125, "learning_rate": 0.0004978781015998048, "loss": 5.5644, "mean_token_accuracy": 0.15766163170337677, "num_tokens": 11428534.0, "step": 6580 }, { "entropy": 5.664851665496826, "epoch": 0.5123516825520327, "grad_norm": 1.4609375, "learning_rate": 0.0004978743025313413, "loss": 5.5533, "mean_token_accuracy": 0.15721214860677718, "num_tokens": 11436641.0, "step": 6585 }, { "entropy": 5.631090784072876, "epoch": 0.5127407119237503, "grad_norm": 1.4140625, "learning_rate": 0.0004978705000811148, "loss": 5.5312, "mean_token_accuracy": 0.1598398506641388, "num_tokens": 11444595.0, "step": 6590 }, { "entropy": 5.577209997177124, "epoch": 0.5131297412954678, "grad_norm": 1.5703125, "learning_rate": 0.0004978666942491832, "loss": 5.3865, "mean_token_accuracy": 0.16264140456914902, "num_tokens": 11453257.0, "step": 6595 }, { "entropy": 5.589799070358277, "epoch": 0.5135187706671853, "grad_norm": 1.421875, "learning_rate": 0.0004978628850356043, "loss": 5.5615, "mean_token_accuracy": 0.15875291973352432, "num_tokens": 11461762.0, "step": 6600 }, { "entropy": 5.649018383026123, "epoch": 0.5139078000389029, "grad_norm": 1.34375, "learning_rate": 0.0004978590724404358, "loss": 5.4686, "mean_token_accuracy": 0.15878367722034453, "num_tokens": 11470602.0, "step": 6605 }, { "entropy": 5.635024499893189, "epoch": 0.5142968294106205, "grad_norm": 1.4140625, "learning_rate": 0.0004978552564637356, "loss": 5.5583, "mean_token_accuracy": 0.15673930644989015, "num_tokens": 11479826.0, "step": 6610 }, { "entropy": 5.680516052246094, "epoch": 0.5146858587823381, "grad_norm": 1.3984375, "learning_rate": 0.0004978514371055616, "loss": 5.6371, "mean_token_accuracy": 0.15062430500984192, "num_tokens": 11488698.0, "step": 6615 }, { "entropy": 5.728860330581665, "epoch": 0.5150748881540557, "grad_norm": 1.328125, "learning_rate": 0.0004978476143659718, "loss": 5.6055, "mean_token_accuracy": 0.15783123075962066, "num_tokens": 11497434.0, "step": 6620 }, { "entropy": 5.626099395751953, "epoch": 0.5154639175257731, "grad_norm": 1.3515625, "learning_rate": 0.0004978437882450241, "loss": 5.6226, "mean_token_accuracy": 0.15543157532811164, "num_tokens": 11506173.0, "step": 6625 }, { "entropy": 5.63395414352417, "epoch": 0.5158529468974907, "grad_norm": 1.453125, "learning_rate": 0.0004978399587427766, "loss": 5.5153, "mean_token_accuracy": 0.1609303444623947, "num_tokens": 11514824.0, "step": 6630 }, { "entropy": 5.634879398345947, "epoch": 0.5162419762692083, "grad_norm": 1.3828125, "learning_rate": 0.0004978361258592874, "loss": 5.5784, "mean_token_accuracy": 0.15130043774843216, "num_tokens": 11523634.0, "step": 6635 }, { "entropy": 5.803075313568115, "epoch": 0.5166310056409259, "grad_norm": 1.34375, "learning_rate": 0.0004978322895946147, "loss": 5.7006, "mean_token_accuracy": 0.15314190834760666, "num_tokens": 11531916.0, "step": 6640 }, { "entropy": 5.699688673019409, "epoch": 0.5170200350126435, "grad_norm": 1.6796875, "learning_rate": 0.0004978284499488167, "loss": 5.5159, "mean_token_accuracy": 0.16227565407752992, "num_tokens": 11540000.0, "step": 6645 }, { "entropy": 5.699098587036133, "epoch": 0.5174090643843611, "grad_norm": 1.671875, "learning_rate": 0.0004978246069219516, "loss": 5.6113, "mean_token_accuracy": 0.15647616535425185, "num_tokens": 11548760.0, "step": 6650 }, { "entropy": 5.587365961074829, "epoch": 0.5177980937560785, "grad_norm": 1.3984375, "learning_rate": 0.0004978207605140777, "loss": 5.4321, "mean_token_accuracy": 0.16562076658010483, "num_tokens": 11557991.0, "step": 6655 }, { "entropy": 5.608901739120483, "epoch": 0.5181871231277961, "grad_norm": 1.4921875, "learning_rate": 0.0004978169107252534, "loss": 5.4985, "mean_token_accuracy": 0.16201310306787492, "num_tokens": 11566638.0, "step": 6660 }, { "entropy": 5.53792028427124, "epoch": 0.5185761524995137, "grad_norm": 1.40625, "learning_rate": 0.0004978130575555373, "loss": 5.4198, "mean_token_accuracy": 0.16330699175596236, "num_tokens": 11575106.0, "step": 6665 }, { "entropy": 5.5862060546875, "epoch": 0.5189651818712313, "grad_norm": 1.3515625, "learning_rate": 0.0004978092010049877, "loss": 5.5869, "mean_token_accuracy": 0.1444960653781891, "num_tokens": 11583971.0, "step": 6670 }, { "entropy": 5.6814610958099365, "epoch": 0.5193542112429489, "grad_norm": 1.328125, "learning_rate": 0.000497805341073663, "loss": 5.5944, "mean_token_accuracy": 0.1549292489886284, "num_tokens": 11592936.0, "step": 6675 }, { "entropy": 5.649386644363403, "epoch": 0.5197432406146664, "grad_norm": 1.2578125, "learning_rate": 0.0004978014777616219, "loss": 5.4676, "mean_token_accuracy": 0.159424264729023, "num_tokens": 11602055.0, "step": 6680 }, { "entropy": 5.592701244354248, "epoch": 0.520132269986384, "grad_norm": 1.6640625, "learning_rate": 0.0004977976110689229, "loss": 5.4963, "mean_token_accuracy": 0.15947575122117996, "num_tokens": 11610211.0, "step": 6685 }, { "entropy": 5.6688920021057125, "epoch": 0.5205212993581015, "grad_norm": 1.515625, "learning_rate": 0.000497793740995625, "loss": 5.5579, "mean_token_accuracy": 0.15732331275939943, "num_tokens": 11619096.0, "step": 6690 }, { "entropy": 5.658513736724854, "epoch": 0.5209103287298191, "grad_norm": 1.5859375, "learning_rate": 0.0004977898675417866, "loss": 5.6363, "mean_token_accuracy": 0.15888825207948684, "num_tokens": 11628142.0, "step": 6695 }, { "entropy": 5.700950670242309, "epoch": 0.5212993581015367, "grad_norm": 1.40625, "learning_rate": 0.0004977859907074664, "loss": 5.485, "mean_token_accuracy": 0.16149185299873353, "num_tokens": 11635961.0, "step": 6700 }, { "entropy": 5.6735364437103275, "epoch": 0.5216883874732542, "grad_norm": 1.3828125, "learning_rate": 0.0004977821104927236, "loss": 5.6212, "mean_token_accuracy": 0.1562149181962013, "num_tokens": 11644778.0, "step": 6705 }, { "entropy": 5.657710838317871, "epoch": 0.5220774168449718, "grad_norm": 1.734375, "learning_rate": 0.0004977782268976167, "loss": 5.5925, "mean_token_accuracy": 0.15472943633794783, "num_tokens": 11654043.0, "step": 6710 }, { "entropy": 5.711113595962525, "epoch": 0.5224664462166894, "grad_norm": 1.4375, "learning_rate": 0.0004977743399222048, "loss": 5.5755, "mean_token_accuracy": 0.15707167237997055, "num_tokens": 11662794.0, "step": 6715 }, { "entropy": 5.631554222106933, "epoch": 0.522855475588407, "grad_norm": 1.625, "learning_rate": 0.0004977704495665471, "loss": 5.5782, "mean_token_accuracy": 0.1574481889605522, "num_tokens": 11670624.0, "step": 6720 }, { "entropy": 5.58207483291626, "epoch": 0.5232445049601245, "grad_norm": 1.46875, "learning_rate": 0.0004977665558307023, "loss": 5.482, "mean_token_accuracy": 0.15776702016592026, "num_tokens": 11679366.0, "step": 6725 }, { "entropy": 5.526380920410157, "epoch": 0.523633534331842, "grad_norm": 1.484375, "learning_rate": 0.0004977626587147295, "loss": 5.3984, "mean_token_accuracy": 0.16687122136354446, "num_tokens": 11688137.0, "step": 6730 }, { "entropy": 5.559792566299438, "epoch": 0.5240225637035596, "grad_norm": 1.609375, "learning_rate": 0.000497758758218688, "loss": 5.5255, "mean_token_accuracy": 0.16067289113998412, "num_tokens": 11697236.0, "step": 6735 }, { "entropy": 5.669983386993408, "epoch": 0.5244115930752772, "grad_norm": 1.359375, "learning_rate": 0.0004977548543426368, "loss": 5.5201, "mean_token_accuracy": 0.159443636238575, "num_tokens": 11706513.0, "step": 6740 }, { "entropy": 5.647953271865845, "epoch": 0.5248006224469948, "grad_norm": 1.3515625, "learning_rate": 0.0004977509470866353, "loss": 5.4815, "mean_token_accuracy": 0.16161043643951417, "num_tokens": 11715239.0, "step": 6745 }, { "entropy": 5.624539852142334, "epoch": 0.5251896518187124, "grad_norm": 1.421875, "learning_rate": 0.0004977470364507427, "loss": 5.5067, "mean_token_accuracy": 0.1691492259502411, "num_tokens": 11724086.0, "step": 6750 }, { "entropy": 5.574176502227783, "epoch": 0.5255786811904298, "grad_norm": 1.46875, "learning_rate": 0.0004977431224350184, "loss": 5.5399, "mean_token_accuracy": 0.16304653882980347, "num_tokens": 11731975.0, "step": 6755 }, { "entropy": 5.606770372390747, "epoch": 0.5259677105621474, "grad_norm": 1.3515625, "learning_rate": 0.0004977392050395217, "loss": 5.5292, "mean_token_accuracy": 0.15769765973091127, "num_tokens": 11741172.0, "step": 6760 }, { "entropy": 5.635431337356567, "epoch": 0.526356739933865, "grad_norm": 1.53125, "learning_rate": 0.0004977352842643121, "loss": 5.497, "mean_token_accuracy": 0.16328567042946815, "num_tokens": 11750609.0, "step": 6765 }, { "entropy": 5.648671865463257, "epoch": 0.5267457693055826, "grad_norm": 1.5546875, "learning_rate": 0.000497731360109449, "loss": 5.4808, "mean_token_accuracy": 0.164144603908062, "num_tokens": 11758901.0, "step": 6770 }, { "entropy": 5.56562385559082, "epoch": 0.5271347986773002, "grad_norm": 1.59375, "learning_rate": 0.0004977274325749922, "loss": 5.4329, "mean_token_accuracy": 0.16389899849891662, "num_tokens": 11767202.0, "step": 6775 }, { "entropy": 5.573253870010376, "epoch": 0.5275238280490177, "grad_norm": 1.46875, "learning_rate": 0.0004977235016610011, "loss": 5.5385, "mean_token_accuracy": 0.15641603320837022, "num_tokens": 11776164.0, "step": 6780 }, { "entropy": 5.63574366569519, "epoch": 0.5279128574207352, "grad_norm": 2.1875, "learning_rate": 0.0004977195673675353, "loss": 5.4803, "mean_token_accuracy": 0.16279528737068177, "num_tokens": 11784548.0, "step": 6785 }, { "entropy": 5.597996187210083, "epoch": 0.5283018867924528, "grad_norm": 1.6640625, "learning_rate": 0.0004977156296946545, "loss": 5.5534, "mean_token_accuracy": 0.15933460593223572, "num_tokens": 11793249.0, "step": 6790 }, { "entropy": 5.689667177200318, "epoch": 0.5286909161641704, "grad_norm": 1.4453125, "learning_rate": 0.0004977116886424187, "loss": 5.6144, "mean_token_accuracy": 0.14791540801525116, "num_tokens": 11801512.0, "step": 6795 }, { "entropy": 5.639977645874024, "epoch": 0.529079945535888, "grad_norm": 1.4921875, "learning_rate": 0.0004977077442108873, "loss": 5.4758, "mean_token_accuracy": 0.16063254177570344, "num_tokens": 11810248.0, "step": 6800 }, { "entropy": 5.584291219711304, "epoch": 0.5294689749076055, "grad_norm": 1.375, "learning_rate": 0.0004977037964001204, "loss": 5.4666, "mean_token_accuracy": 0.16245136857032777, "num_tokens": 11819190.0, "step": 6805 }, { "entropy": 5.538795900344849, "epoch": 0.5298580042793231, "grad_norm": 1.4609375, "learning_rate": 0.000497699845210178, "loss": 5.5398, "mean_token_accuracy": 0.15167467221617698, "num_tokens": 11827585.0, "step": 6810 }, { "entropy": 5.7072672843933105, "epoch": 0.5302470336510406, "grad_norm": 1.6015625, "learning_rate": 0.0004976958906411197, "loss": 5.5459, "mean_token_accuracy": 0.1585001215338707, "num_tokens": 11836256.0, "step": 6815 }, { "entropy": 5.716243410110474, "epoch": 0.5306360630227582, "grad_norm": 1.3203125, "learning_rate": 0.0004976919326930059, "loss": 5.6621, "mean_token_accuracy": 0.1554935097694397, "num_tokens": 11845022.0, "step": 6820 }, { "entropy": 5.5915556907653805, "epoch": 0.5310250923944758, "grad_norm": 1.8046875, "learning_rate": 0.0004976879713658964, "loss": 5.5293, "mean_token_accuracy": 0.15867503434419633, "num_tokens": 11853289.0, "step": 6825 }, { "entropy": 5.57533483505249, "epoch": 0.5314141217661933, "grad_norm": 1.5078125, "learning_rate": 0.0004976840066598514, "loss": 5.4742, "mean_token_accuracy": 0.16293567717075347, "num_tokens": 11861589.0, "step": 6830 }, { "entropy": 5.715223932266236, "epoch": 0.5318031511379109, "grad_norm": 1.421875, "learning_rate": 0.0004976800385749309, "loss": 5.5798, "mean_token_accuracy": 0.15770153254270552, "num_tokens": 11870313.0, "step": 6835 }, { "entropy": 5.734091663360596, "epoch": 0.5321921805096285, "grad_norm": 1.484375, "learning_rate": 0.0004976760671111954, "loss": 5.5738, "mean_token_accuracy": 0.15089233294129373, "num_tokens": 11879558.0, "step": 6840 }, { "entropy": 5.651639175415039, "epoch": 0.532581209881346, "grad_norm": 1.421875, "learning_rate": 0.000497672092268705, "loss": 5.5776, "mean_token_accuracy": 0.15512731820344924, "num_tokens": 11887951.0, "step": 6845 }, { "entropy": 5.729362916946411, "epoch": 0.5329702392530636, "grad_norm": 1.4765625, "learning_rate": 0.00049766811404752, "loss": 5.7686, "mean_token_accuracy": 0.15023297369480132, "num_tokens": 11896900.0, "step": 6850 }, { "entropy": 5.703069496154785, "epoch": 0.5333592686247812, "grad_norm": 1.4140625, "learning_rate": 0.0004976641324477008, "loss": 5.5873, "mean_token_accuracy": 0.1571554109454155, "num_tokens": 11905681.0, "step": 6855 }, { "entropy": 5.608556461334229, "epoch": 0.5337482979964987, "grad_norm": 1.3125, "learning_rate": 0.0004976601474693077, "loss": 5.5402, "mean_token_accuracy": 0.15932610929012297, "num_tokens": 11914662.0, "step": 6860 }, { "entropy": 5.5953371047973635, "epoch": 0.5341373273682163, "grad_norm": 1.5078125, "learning_rate": 0.0004976561591124014, "loss": 5.5401, "mean_token_accuracy": 0.16420037299394608, "num_tokens": 11923298.0, "step": 6865 }, { "entropy": 5.679533910751343, "epoch": 0.5345263567399339, "grad_norm": 1.5234375, "learning_rate": 0.0004976521673770421, "loss": 5.4428, "mean_token_accuracy": 0.16081129461526872, "num_tokens": 11932206.0, "step": 6870 }, { "entropy": 5.593166303634644, "epoch": 0.5349153861116515, "grad_norm": 1.4296875, "learning_rate": 0.0004976481722632907, "loss": 5.5182, "mean_token_accuracy": 0.16239935159683228, "num_tokens": 11940786.0, "step": 6875 }, { "entropy": 5.602063179016113, "epoch": 0.535304415483369, "grad_norm": 1.3046875, "learning_rate": 0.0004976441737712076, "loss": 5.5302, "mean_token_accuracy": 0.15598469376564025, "num_tokens": 11949619.0, "step": 6880 }, { "entropy": 5.618106126785278, "epoch": 0.5356934448550865, "grad_norm": 1.875, "learning_rate": 0.0004976401719008536, "loss": 5.4673, "mean_token_accuracy": 0.16513773053884506, "num_tokens": 11957696.0, "step": 6885 }, { "entropy": 5.6020430564880375, "epoch": 0.5360824742268041, "grad_norm": 1.546875, "learning_rate": 0.0004976361666522893, "loss": 5.4777, "mean_token_accuracy": 0.16478777974843978, "num_tokens": 11965622.0, "step": 6890 }, { "entropy": 5.564819049835205, "epoch": 0.5364715035985217, "grad_norm": 1.2734375, "learning_rate": 0.0004976321580255755, "loss": 5.5604, "mean_token_accuracy": 0.15686802566051483, "num_tokens": 11973969.0, "step": 6895 }, { "entropy": 5.735695314407349, "epoch": 0.5368605329702393, "grad_norm": 1.640625, "learning_rate": 0.0004976281460207731, "loss": 5.5424, "mean_token_accuracy": 0.1604687198996544, "num_tokens": 11982469.0, "step": 6900 }, { "entropy": 5.748460721969605, "epoch": 0.5372495623419569, "grad_norm": 1.515625, "learning_rate": 0.000497624130637943, "loss": 5.6423, "mean_token_accuracy": 0.15869580954313278, "num_tokens": 11990656.0, "step": 6905 }, { "entropy": 5.631741619110107, "epoch": 0.5376385917136743, "grad_norm": 1.6015625, "learning_rate": 0.000497620111877146, "loss": 5.6412, "mean_token_accuracy": 0.15766993165016174, "num_tokens": 11999394.0, "step": 6910 }, { "entropy": 5.693097543716431, "epoch": 0.5380276210853919, "grad_norm": 1.484375, "learning_rate": 0.0004976160897384431, "loss": 5.5945, "mean_token_accuracy": 0.1619994305074215, "num_tokens": 12007692.0, "step": 6915 }, { "entropy": 5.696098041534424, "epoch": 0.5384166504571095, "grad_norm": 1.453125, "learning_rate": 0.0004976120642218955, "loss": 5.581, "mean_token_accuracy": 0.15603196769952773, "num_tokens": 12016038.0, "step": 6920 }, { "entropy": 5.663388681411743, "epoch": 0.5388056798288271, "grad_norm": 1.2890625, "learning_rate": 0.000497608035327564, "loss": 5.6578, "mean_token_accuracy": 0.15578502416610718, "num_tokens": 12024504.0, "step": 6925 }, { "entropy": 5.620071315765381, "epoch": 0.5391947092005447, "grad_norm": 1.578125, "learning_rate": 0.00049760400305551, "loss": 5.5747, "mean_token_accuracy": 0.1651473879814148, "num_tokens": 12032935.0, "step": 6930 }, { "entropy": 5.692807579040528, "epoch": 0.5395837385722622, "grad_norm": 1.3359375, "learning_rate": 0.0004975999674057944, "loss": 5.6058, "mean_token_accuracy": 0.1548255831003189, "num_tokens": 12041907.0, "step": 6935 }, { "entropy": 5.632751417160034, "epoch": 0.5399727679439797, "grad_norm": 1.4375, "learning_rate": 0.0004975959283784787, "loss": 5.4339, "mean_token_accuracy": 0.1649518758058548, "num_tokens": 12050528.0, "step": 6940 }, { "entropy": 5.575006771087646, "epoch": 0.5403617973156973, "grad_norm": 1.3046875, "learning_rate": 0.0004975918859736241, "loss": 5.4231, "mean_token_accuracy": 0.16248443573713303, "num_tokens": 12059221.0, "step": 6945 }, { "entropy": 5.634440135955811, "epoch": 0.5407508266874149, "grad_norm": 1.3671875, "learning_rate": 0.0004975878401912919, "loss": 5.6479, "mean_token_accuracy": 0.15099793821573257, "num_tokens": 12068131.0, "step": 6950 }, { "entropy": 5.661639404296875, "epoch": 0.5411398560591325, "grad_norm": 1.421875, "learning_rate": 0.0004975837910315436, "loss": 5.5298, "mean_token_accuracy": 0.1661975249648094, "num_tokens": 12076521.0, "step": 6955 }, { "entropy": 5.66230411529541, "epoch": 0.54152888543085, "grad_norm": 1.4609375, "learning_rate": 0.0004975797384944405, "loss": 5.7098, "mean_token_accuracy": 0.15018136128783227, "num_tokens": 12085306.0, "step": 6960 }, { "entropy": 5.655632781982422, "epoch": 0.5419179148025676, "grad_norm": 1.5703125, "learning_rate": 0.000497575682580044, "loss": 5.4907, "mean_token_accuracy": 0.15574343353509904, "num_tokens": 12094409.0, "step": 6965 }, { "entropy": 5.595790147781372, "epoch": 0.5423069441742852, "grad_norm": 1.3828125, "learning_rate": 0.000497571623288416, "loss": 5.5227, "mean_token_accuracy": 0.15902038514614106, "num_tokens": 12103385.0, "step": 6970 }, { "entropy": 5.695128440856934, "epoch": 0.5426959735460027, "grad_norm": 1.390625, "learning_rate": 0.0004975675606196177, "loss": 5.6476, "mean_token_accuracy": 0.15420727133750917, "num_tokens": 12112452.0, "step": 6975 }, { "entropy": 5.769511127471924, "epoch": 0.5430850029177203, "grad_norm": 1.328125, "learning_rate": 0.000497563494573711, "loss": 5.6461, "mean_token_accuracy": 0.15349312052130698, "num_tokens": 12120918.0, "step": 6980 }, { "entropy": 5.665116882324218, "epoch": 0.5434740322894378, "grad_norm": 1.5390625, "learning_rate": 0.0004975594251507575, "loss": 5.592, "mean_token_accuracy": 0.1524340584874153, "num_tokens": 12129797.0, "step": 6985 }, { "entropy": 5.638438987731933, "epoch": 0.5438630616611554, "grad_norm": 1.4140625, "learning_rate": 0.000497555352350819, "loss": 5.5875, "mean_token_accuracy": 0.1590471237897873, "num_tokens": 12139245.0, "step": 6990 }, { "entropy": 5.724023914337158, "epoch": 0.544252091032873, "grad_norm": 1.4296875, "learning_rate": 0.0004975512761739572, "loss": 5.753, "mean_token_accuracy": 0.15055884122848512, "num_tokens": 12147409.0, "step": 6995 }, { "entropy": 5.770619010925293, "epoch": 0.5446411204045906, "grad_norm": 1.4140625, "learning_rate": 0.000497547196620234, "loss": 5.5615, "mean_token_accuracy": 0.16063691973686217, "num_tokens": 12156121.0, "step": 7000 }, { "entropy": 5.601393699645996, "epoch": 0.5450301497763081, "grad_norm": 1.3203125, "learning_rate": 0.0004975431136897114, "loss": 5.4546, "mean_token_accuracy": 0.15758006274700165, "num_tokens": 12165307.0, "step": 7005 }, { "entropy": 5.608690309524536, "epoch": 0.5454191791480256, "grad_norm": 1.3203125, "learning_rate": 0.0004975390273824512, "loss": 5.5458, "mean_token_accuracy": 0.1556534193456173, "num_tokens": 12173899.0, "step": 7010 }, { "entropy": 5.594245529174804, "epoch": 0.5458082085197432, "grad_norm": 1.3828125, "learning_rate": 0.0004975349376985155, "loss": 5.532, "mean_token_accuracy": 0.157239693403244, "num_tokens": 12182898.0, "step": 7015 }, { "entropy": 5.639141654968261, "epoch": 0.5461972378914608, "grad_norm": 1.3125, "learning_rate": 0.0004975308446379663, "loss": 5.4257, "mean_token_accuracy": 0.1626703605055809, "num_tokens": 12191500.0, "step": 7020 }, { "entropy": 5.6254807472229, "epoch": 0.5465862672631784, "grad_norm": 2.515625, "learning_rate": 0.0004975267482008657, "loss": 5.5746, "mean_token_accuracy": 0.1632894828915596, "num_tokens": 12199420.0, "step": 7025 }, { "entropy": 5.611004114151001, "epoch": 0.546975296634896, "grad_norm": 1.4375, "learning_rate": 0.000497522648387276, "loss": 5.4928, "mean_token_accuracy": 0.16589215099811555, "num_tokens": 12207676.0, "step": 7030 }, { "entropy": 5.597789764404297, "epoch": 0.5473643260066134, "grad_norm": 1.5390625, "learning_rate": 0.0004975185451972592, "loss": 5.5569, "mean_token_accuracy": 0.15775526612997054, "num_tokens": 12216248.0, "step": 7035 }, { "entropy": 5.665650224685669, "epoch": 0.547753355378331, "grad_norm": 1.375, "learning_rate": 0.0004975144386308776, "loss": 5.588, "mean_token_accuracy": 0.15302129238843917, "num_tokens": 12224588.0, "step": 7040 }, { "entropy": 5.739396286010742, "epoch": 0.5481423847500486, "grad_norm": 1.5078125, "learning_rate": 0.0004975103286881936, "loss": 5.5993, "mean_token_accuracy": 0.15411234349012376, "num_tokens": 12234093.0, "step": 7045 }, { "entropy": 5.782606601715088, "epoch": 0.5485314141217662, "grad_norm": 1.5703125, "learning_rate": 0.0004975062153692696, "loss": 5.5289, "mean_token_accuracy": 0.16654838025569915, "num_tokens": 12242164.0, "step": 7050 }, { "entropy": 5.646966361999512, "epoch": 0.5489204434934838, "grad_norm": 1.4609375, "learning_rate": 0.0004975020986741678, "loss": 5.6246, "mean_token_accuracy": 0.15668172687292098, "num_tokens": 12251204.0, "step": 7055 }, { "entropy": 5.668913650512695, "epoch": 0.5493094728652014, "grad_norm": 1.3671875, "learning_rate": 0.0004974979786029509, "loss": 5.5663, "mean_token_accuracy": 0.1603537067770958, "num_tokens": 12259809.0, "step": 7060 }, { "entropy": 5.653614330291748, "epoch": 0.5496985022369189, "grad_norm": 1.5078125, "learning_rate": 0.0004974938551556814, "loss": 5.5587, "mean_token_accuracy": 0.16657759249210358, "num_tokens": 12268668.0, "step": 7065 }, { "entropy": 5.587209415435791, "epoch": 0.5500875316086364, "grad_norm": 1.3828125, "learning_rate": 0.0004974897283324217, "loss": 5.5027, "mean_token_accuracy": 0.16190332025289536, "num_tokens": 12276823.0, "step": 7070 }, { "entropy": 5.495704174041748, "epoch": 0.550476560980354, "grad_norm": 1.390625, "learning_rate": 0.0004974855981332343, "loss": 5.4501, "mean_token_accuracy": 0.16237061023712157, "num_tokens": 12285950.0, "step": 7075 }, { "entropy": 5.627369546890259, "epoch": 0.5508655903520716, "grad_norm": 1.484375, "learning_rate": 0.0004974814645581823, "loss": 5.5635, "mean_token_accuracy": 0.15469660311937333, "num_tokens": 12295265.0, "step": 7080 }, { "entropy": 5.76141324043274, "epoch": 0.5512546197237892, "grad_norm": 1.90625, "learning_rate": 0.0004974773276073282, "loss": 5.5738, "mean_token_accuracy": 0.15849540680646895, "num_tokens": 12303649.0, "step": 7085 }, { "entropy": 5.638611364364624, "epoch": 0.5516436490955067, "grad_norm": 1.8828125, "learning_rate": 0.0004974731872807347, "loss": 5.6248, "mean_token_accuracy": 0.15033020302653313, "num_tokens": 12313303.0, "step": 7090 }, { "entropy": 5.6014965057373045, "epoch": 0.5520326784672243, "grad_norm": 1.3359375, "learning_rate": 0.0004974690435784647, "loss": 5.5833, "mean_token_accuracy": 0.16375116258859634, "num_tokens": 12321692.0, "step": 7095 }, { "entropy": 5.572794961929321, "epoch": 0.5524217078389418, "grad_norm": 1.2734375, "learning_rate": 0.0004974648965005811, "loss": 5.3883, "mean_token_accuracy": 0.1655963644385338, "num_tokens": 12329908.0, "step": 7100 }, { "entropy": 5.638770723342896, "epoch": 0.5528107372106594, "grad_norm": 1.4296875, "learning_rate": 0.0004974607460471466, "loss": 5.5623, "mean_token_accuracy": 0.15805137604475022, "num_tokens": 12339270.0, "step": 7105 }, { "entropy": 5.664997816085815, "epoch": 0.553199766582377, "grad_norm": 1.359375, "learning_rate": 0.0004974565922182246, "loss": 5.4481, "mean_token_accuracy": 0.15830651968717574, "num_tokens": 12347586.0, "step": 7110 }, { "entropy": 5.583152627944946, "epoch": 0.5535887959540945, "grad_norm": 1.5, "learning_rate": 0.0004974524350138777, "loss": 5.4329, "mean_token_accuracy": 0.15977163314819337, "num_tokens": 12356291.0, "step": 7115 }, { "entropy": 5.618222665786743, "epoch": 0.5539778253258121, "grad_norm": 1.4140625, "learning_rate": 0.0004974482744341693, "loss": 5.6092, "mean_token_accuracy": 0.1476268246769905, "num_tokens": 12364948.0, "step": 7120 }, { "entropy": 5.7117523670196535, "epoch": 0.5543668546975297, "grad_norm": 1.4921875, "learning_rate": 0.0004974441104791624, "loss": 5.5624, "mean_token_accuracy": 0.15631393045186998, "num_tokens": 12373497.0, "step": 7125 }, { "entropy": 5.684345865249634, "epoch": 0.5547558840692473, "grad_norm": 1.421875, "learning_rate": 0.0004974399431489201, "loss": 5.5101, "mean_token_accuracy": 0.15973858088254927, "num_tokens": 12382198.0, "step": 7130 }, { "entropy": 5.554830026626587, "epoch": 0.5551449134409648, "grad_norm": 1.4140625, "learning_rate": 0.0004974357724435057, "loss": 5.4866, "mean_token_accuracy": 0.1644471228122711, "num_tokens": 12391122.0, "step": 7135 }, { "entropy": 5.525238418579102, "epoch": 0.5555339428126823, "grad_norm": 1.640625, "learning_rate": 0.0004974315983629825, "loss": 5.4274, "mean_token_accuracy": 0.16473395228385926, "num_tokens": 12399338.0, "step": 7140 }, { "entropy": 5.615933656692505, "epoch": 0.5559229721843999, "grad_norm": 1.3671875, "learning_rate": 0.0004974274209074139, "loss": 5.5348, "mean_token_accuracy": 0.14955220967531205, "num_tokens": 12408561.0, "step": 7145 }, { "entropy": 5.596295118331909, "epoch": 0.5563120015561175, "grad_norm": 1.4609375, "learning_rate": 0.0004974232400768632, "loss": 5.4188, "mean_token_accuracy": 0.16242959946393967, "num_tokens": 12417727.0, "step": 7150 }, { "entropy": 5.614875650405883, "epoch": 0.5567010309278351, "grad_norm": 1.4453125, "learning_rate": 0.0004974190558713939, "loss": 5.4376, "mean_token_accuracy": 0.16201478540897368, "num_tokens": 12426446.0, "step": 7155 }, { "entropy": 5.5842243194580075, "epoch": 0.5570900602995527, "grad_norm": 1.3828125, "learning_rate": 0.0004974148682910694, "loss": 5.495, "mean_token_accuracy": 0.16075697988271714, "num_tokens": 12435124.0, "step": 7160 }, { "entropy": 5.619173288345337, "epoch": 0.5574790896712701, "grad_norm": 1.515625, "learning_rate": 0.0004974106773359533, "loss": 5.6183, "mean_token_accuracy": 0.15286070257425308, "num_tokens": 12444073.0, "step": 7165 }, { "entropy": 5.716760969161987, "epoch": 0.5578681190429877, "grad_norm": 1.640625, "learning_rate": 0.0004974064830061091, "loss": 5.5898, "mean_token_accuracy": 0.1601371094584465, "num_tokens": 12452419.0, "step": 7170 }, { "entropy": 5.706222009658814, "epoch": 0.5582571484147053, "grad_norm": 1.359375, "learning_rate": 0.0004974022853016006, "loss": 5.5499, "mean_token_accuracy": 0.15545956194400787, "num_tokens": 12461488.0, "step": 7175 }, { "entropy": 5.609360027313232, "epoch": 0.5586461777864229, "grad_norm": 1.40625, "learning_rate": 0.0004973980842224913, "loss": 5.4911, "mean_token_accuracy": 0.15602228343486785, "num_tokens": 12470344.0, "step": 7180 }, { "entropy": 5.649265336990356, "epoch": 0.5590352071581405, "grad_norm": 1.390625, "learning_rate": 0.0004973938797688452, "loss": 5.4932, "mean_token_accuracy": 0.15788175910711288, "num_tokens": 12479189.0, "step": 7185 }, { "entropy": 5.640626525878906, "epoch": 0.559424236529858, "grad_norm": 1.5703125, "learning_rate": 0.0004973896719407259, "loss": 5.5243, "mean_token_accuracy": 0.16059497147798538, "num_tokens": 12488199.0, "step": 7190 }, { "entropy": 5.557397651672363, "epoch": 0.5598132659015755, "grad_norm": 1.5078125, "learning_rate": 0.0004973854607381972, "loss": 5.4083, "mean_token_accuracy": 0.16683684289455414, "num_tokens": 12496704.0, "step": 7195 }, { "entropy": 5.537837314605713, "epoch": 0.5602022952732931, "grad_norm": 1.515625, "learning_rate": 0.0004973812461613232, "loss": 5.4111, "mean_token_accuracy": 0.16901323050260544, "num_tokens": 12504724.0, "step": 7200 }, { "entropy": 5.606007385253906, "epoch": 0.5605913246450107, "grad_norm": 1.265625, "learning_rate": 0.0004973770282101677, "loss": 5.595, "mean_token_accuracy": 0.15539490282535554, "num_tokens": 12514614.0, "step": 7205 }, { "entropy": 5.725541639328003, "epoch": 0.5609803540167283, "grad_norm": 1.4375, "learning_rate": 0.0004973728068847947, "loss": 5.6217, "mean_token_accuracy": 0.1517338916659355, "num_tokens": 12522744.0, "step": 7210 }, { "entropy": 5.629028463363648, "epoch": 0.5613693833884458, "grad_norm": 1.8046875, "learning_rate": 0.0004973685821852684, "loss": 5.5292, "mean_token_accuracy": 0.16160846799612044, "num_tokens": 12531783.0, "step": 7215 }, { "entropy": 5.619050025939941, "epoch": 0.5617584127601634, "grad_norm": 1.3046875, "learning_rate": 0.0004973643541116528, "loss": 5.5904, "mean_token_accuracy": 0.1496799409389496, "num_tokens": 12541768.0, "step": 7220 }, { "entropy": 5.7859978675842285, "epoch": 0.562147442131881, "grad_norm": 1.453125, "learning_rate": 0.000497360122664012, "loss": 5.6416, "mean_token_accuracy": 0.15416546911001205, "num_tokens": 12550684.0, "step": 7225 }, { "entropy": 5.717968082427978, "epoch": 0.5625364715035985, "grad_norm": 1.6484375, "learning_rate": 0.0004973558878424104, "loss": 5.5466, "mean_token_accuracy": 0.15934956967830657, "num_tokens": 12559948.0, "step": 7230 }, { "entropy": 5.561044692993164, "epoch": 0.5629255008753161, "grad_norm": 1.40625, "learning_rate": 0.0004973516496469119, "loss": 5.4869, "mean_token_accuracy": 0.16337195932865142, "num_tokens": 12568681.0, "step": 7235 }, { "entropy": 5.691223812103272, "epoch": 0.5633145302470336, "grad_norm": 1.6171875, "learning_rate": 0.0004973474080775811, "loss": 5.6114, "mean_token_accuracy": 0.152906334400177, "num_tokens": 12577724.0, "step": 7240 }, { "entropy": 5.76364803314209, "epoch": 0.5637035596187512, "grad_norm": 1.3515625, "learning_rate": 0.0004973431631344824, "loss": 5.5306, "mean_token_accuracy": 0.15633030086755753, "num_tokens": 12585994.0, "step": 7245 }, { "entropy": 5.6505897521972654, "epoch": 0.5640925889904688, "grad_norm": 1.234375, "learning_rate": 0.00049733891481768, "loss": 5.6015, "mean_token_accuracy": 0.15584657341241837, "num_tokens": 12595525.0, "step": 7250 }, { "entropy": 5.647922468185425, "epoch": 0.5644816183621864, "grad_norm": 1.4375, "learning_rate": 0.0004973346631272384, "loss": 5.4333, "mean_token_accuracy": 0.16841700673103333, "num_tokens": 12603645.0, "step": 7255 }, { "entropy": 5.587335395812988, "epoch": 0.5648706477339039, "grad_norm": 1.8984375, "learning_rate": 0.0004973304080632222, "loss": 5.5055, "mean_token_accuracy": 0.15742655992507934, "num_tokens": 12612165.0, "step": 7260 }, { "entropy": 5.591152763366699, "epoch": 0.5652596771056215, "grad_norm": 1.5078125, "learning_rate": 0.000497326149625696, "loss": 5.4214, "mean_token_accuracy": 0.16940227746963502, "num_tokens": 12620678.0, "step": 7265 }, { "entropy": 5.681361198425293, "epoch": 0.565648706477339, "grad_norm": 1.375, "learning_rate": 0.0004973218878147244, "loss": 5.6155, "mean_token_accuracy": 0.15588987991213799, "num_tokens": 12628745.0, "step": 7270 }, { "entropy": 5.70417628288269, "epoch": 0.5660377358490566, "grad_norm": 1.421875, "learning_rate": 0.0004973176226303719, "loss": 5.6584, "mean_token_accuracy": 0.1473071962594986, "num_tokens": 12637448.0, "step": 7275 }, { "entropy": 5.679449367523193, "epoch": 0.5664267652207742, "grad_norm": 1.546875, "learning_rate": 0.0004973133540727033, "loss": 5.5324, "mean_token_accuracy": 0.1581710919737816, "num_tokens": 12645804.0, "step": 7280 }, { "entropy": 5.655721378326416, "epoch": 0.5668157945924918, "grad_norm": 1.375, "learning_rate": 0.0004973090821417835, "loss": 5.4942, "mean_token_accuracy": 0.15874693989753724, "num_tokens": 12654156.0, "step": 7285 }, { "entropy": 5.6041888236999515, "epoch": 0.5672048239642093, "grad_norm": 1.6015625, "learning_rate": 0.0004973048068376772, "loss": 5.4653, "mean_token_accuracy": 0.16248227059841155, "num_tokens": 12662271.0, "step": 7290 }, { "entropy": 5.724769163131714, "epoch": 0.5675938533359268, "grad_norm": 1.4375, "learning_rate": 0.0004973005281604492, "loss": 5.6371, "mean_token_accuracy": 0.15151395946741103, "num_tokens": 12671016.0, "step": 7295 }, { "entropy": 5.633071088790894, "epoch": 0.5679828827076444, "grad_norm": 1.3515625, "learning_rate": 0.0004972962461101646, "loss": 5.5932, "mean_token_accuracy": 0.15309520661830903, "num_tokens": 12679593.0, "step": 7300 }, { "entropy": 5.625471401214599, "epoch": 0.568371912079362, "grad_norm": 1.421875, "learning_rate": 0.0004972919606868883, "loss": 5.5179, "mean_token_accuracy": 0.16120276600122452, "num_tokens": 12688715.0, "step": 7305 }, { "entropy": 5.643703126907349, "epoch": 0.5687609414510796, "grad_norm": 1.4140625, "learning_rate": 0.0004972876718906852, "loss": 5.5263, "mean_token_accuracy": 0.15836018621921538, "num_tokens": 12698078.0, "step": 7310 }, { "entropy": 5.5868239402771, "epoch": 0.5691499708227972, "grad_norm": 1.390625, "learning_rate": 0.0004972833797216206, "loss": 5.5126, "mean_token_accuracy": 0.16403855681419371, "num_tokens": 12706375.0, "step": 7315 }, { "entropy": 5.724744892120361, "epoch": 0.5695390001945146, "grad_norm": 1.765625, "learning_rate": 0.0004972790841797595, "loss": 5.7066, "mean_token_accuracy": 0.15244438797235488, "num_tokens": 12715727.0, "step": 7320 }, { "entropy": 5.67259030342102, "epoch": 0.5699280295662322, "grad_norm": 1.4296875, "learning_rate": 0.000497274785265167, "loss": 5.6122, "mean_token_accuracy": 0.14762853384017943, "num_tokens": 12725565.0, "step": 7325 }, { "entropy": 5.743588399887085, "epoch": 0.5703170589379498, "grad_norm": 1.46875, "learning_rate": 0.0004972704829779086, "loss": 5.631, "mean_token_accuracy": 0.15871698409318924, "num_tokens": 12733498.0, "step": 7330 }, { "entropy": 5.620137357711792, "epoch": 0.5707060883096674, "grad_norm": 1.4765625, "learning_rate": 0.0004972661773180492, "loss": 5.4476, "mean_token_accuracy": 0.1599652126431465, "num_tokens": 12741635.0, "step": 7335 }, { "entropy": 5.520822048187256, "epoch": 0.571095117681385, "grad_norm": 1.46875, "learning_rate": 0.0004972618682856545, "loss": 5.4631, "mean_token_accuracy": 0.16328149437904357, "num_tokens": 12750973.0, "step": 7340 }, { "entropy": 5.571967029571534, "epoch": 0.5714841470531025, "grad_norm": 1.6328125, "learning_rate": 0.0004972575558807896, "loss": 5.5372, "mean_token_accuracy": 0.16574114114046096, "num_tokens": 12759075.0, "step": 7345 }, { "entropy": 5.700579309463501, "epoch": 0.57187317642482, "grad_norm": 1.46875, "learning_rate": 0.0004972532401035201, "loss": 5.5225, "mean_token_accuracy": 0.15687755197286607, "num_tokens": 12767485.0, "step": 7350 }, { "entropy": 5.705129623413086, "epoch": 0.5722622057965376, "grad_norm": 1.484375, "learning_rate": 0.0004972489209539114, "loss": 5.4884, "mean_token_accuracy": 0.16281367540359498, "num_tokens": 12775128.0, "step": 7355 }, { "entropy": 5.561953735351563, "epoch": 0.5726512351682552, "grad_norm": 1.5625, "learning_rate": 0.0004972445984320292, "loss": 5.4076, "mean_token_accuracy": 0.1676819458603859, "num_tokens": 12783243.0, "step": 7360 }, { "entropy": 5.649951601028443, "epoch": 0.5730402645399728, "grad_norm": 1.3984375, "learning_rate": 0.0004972402725379388, "loss": 5.6279, "mean_token_accuracy": 0.16052431762218475, "num_tokens": 12791613.0, "step": 7365 }, { "entropy": 5.6840691566467285, "epoch": 0.5734292939116903, "grad_norm": 1.421875, "learning_rate": 0.000497235943271706, "loss": 5.559, "mean_token_accuracy": 0.15703178942203522, "num_tokens": 12799817.0, "step": 7370 }, { "entropy": 5.691116380691528, "epoch": 0.5738183232834079, "grad_norm": 1.3359375, "learning_rate": 0.0004972316106333966, "loss": 5.5644, "mean_token_accuracy": 0.15355917811393738, "num_tokens": 12808994.0, "step": 7375 }, { "entropy": 5.637736511230469, "epoch": 0.5742073526551255, "grad_norm": 1.3671875, "learning_rate": 0.0004972272746230761, "loss": 5.5256, "mean_token_accuracy": 0.1580606669187546, "num_tokens": 12817191.0, "step": 7380 }, { "entropy": 5.6404008865356445, "epoch": 0.574596382026843, "grad_norm": 1.453125, "learning_rate": 0.0004972229352408104, "loss": 5.4956, "mean_token_accuracy": 0.15748804658651352, "num_tokens": 12825773.0, "step": 7385 }, { "entropy": 5.73073410987854, "epoch": 0.5749854113985606, "grad_norm": 2.6875, "learning_rate": 0.0004972185924866655, "loss": 5.5644, "mean_token_accuracy": 0.16047893315553666, "num_tokens": 12834489.0, "step": 7390 }, { "entropy": 5.677036237716675, "epoch": 0.5753744407702781, "grad_norm": 1.71875, "learning_rate": 0.0004972142463607071, "loss": 5.5498, "mean_token_accuracy": 0.1610588014125824, "num_tokens": 12843179.0, "step": 7395 }, { "entropy": 5.7206519603729244, "epoch": 0.5757634701419957, "grad_norm": 1.34375, "learning_rate": 0.0004972098968630012, "loss": 5.5736, "mean_token_accuracy": 0.15535116493701934, "num_tokens": 12851243.0, "step": 7400 }, { "entropy": 5.598516273498535, "epoch": 0.5761524995137133, "grad_norm": 1.4453125, "learning_rate": 0.0004972055439936137, "loss": 5.6291, "mean_token_accuracy": 0.15630768090486527, "num_tokens": 12860267.0, "step": 7405 }, { "entropy": 5.757432508468628, "epoch": 0.5765415288854309, "grad_norm": 1.6171875, "learning_rate": 0.0004972011877526109, "loss": 5.6497, "mean_token_accuracy": 0.15755585208535194, "num_tokens": 12870022.0, "step": 7410 }, { "entropy": 5.694835472106933, "epoch": 0.5769305582571485, "grad_norm": 1.59375, "learning_rate": 0.0004971968281400587, "loss": 5.5952, "mean_token_accuracy": 0.1492684304714203, "num_tokens": 12879227.0, "step": 7415 }, { "entropy": 5.661354351043701, "epoch": 0.5773195876288659, "grad_norm": 1.5078125, "learning_rate": 0.0004971924651560233, "loss": 5.5483, "mean_token_accuracy": 0.15837249904870987, "num_tokens": 12888180.0, "step": 7420 }, { "entropy": 5.675881195068359, "epoch": 0.5777086170005835, "grad_norm": 1.4453125, "learning_rate": 0.0004971880988005709, "loss": 5.5394, "mean_token_accuracy": 0.16022545620799064, "num_tokens": 12896767.0, "step": 7425 }, { "entropy": 5.618383169174194, "epoch": 0.5780976463723011, "grad_norm": 1.359375, "learning_rate": 0.0004971837290737677, "loss": 5.4341, "mean_token_accuracy": 0.16697876006364823, "num_tokens": 12904766.0, "step": 7430 }, { "entropy": 5.529607534408569, "epoch": 0.5784866757440187, "grad_norm": 1.640625, "learning_rate": 0.0004971793559756801, "loss": 5.5357, "mean_token_accuracy": 0.1580686628818512, "num_tokens": 12913808.0, "step": 7435 }, { "entropy": 5.590646886825562, "epoch": 0.5788757051157363, "grad_norm": 1.71875, "learning_rate": 0.0004971749795063744, "loss": 5.5143, "mean_token_accuracy": 0.15939191728830338, "num_tokens": 12923103.0, "step": 7440 }, { "entropy": 5.6191099166870115, "epoch": 0.5792647344874537, "grad_norm": 1.546875, "learning_rate": 0.000497170599665917, "loss": 5.473, "mean_token_accuracy": 0.16246490627527238, "num_tokens": 12931168.0, "step": 7445 }, { "entropy": 5.548571968078614, "epoch": 0.5796537638591713, "grad_norm": 2.015625, "learning_rate": 0.0004971662164543743, "loss": 5.5678, "mean_token_accuracy": 0.16391166001558305, "num_tokens": 12939875.0, "step": 7450 }, { "entropy": 5.61009259223938, "epoch": 0.5800427932308889, "grad_norm": 1.359375, "learning_rate": 0.0004971618298718131, "loss": 5.4683, "mean_token_accuracy": 0.16916644275188447, "num_tokens": 12947883.0, "step": 7455 }, { "entropy": 5.789393091201783, "epoch": 0.5804318226026065, "grad_norm": 1.625, "learning_rate": 0.0004971574399182995, "loss": 5.7034, "mean_token_accuracy": 0.14763562753796577, "num_tokens": 12956940.0, "step": 7460 }, { "entropy": 5.626276636123658, "epoch": 0.5808208519743241, "grad_norm": 1.3359375, "learning_rate": 0.0004971530465939005, "loss": 5.4359, "mean_token_accuracy": 0.1634249910712242, "num_tokens": 12965003.0, "step": 7465 }, { "entropy": 5.603636360168457, "epoch": 0.5812098813460417, "grad_norm": 1.515625, "learning_rate": 0.0004971486498986825, "loss": 5.4668, "mean_token_accuracy": 0.16253004223108292, "num_tokens": 12973323.0, "step": 7470 }, { "entropy": 5.600870990753174, "epoch": 0.5815989107177592, "grad_norm": 1.4609375, "learning_rate": 0.0004971442498327124, "loss": 5.5004, "mean_token_accuracy": 0.16327155977487565, "num_tokens": 12982654.0, "step": 7475 }, { "entropy": 5.62065544128418, "epoch": 0.5819879400894767, "grad_norm": 1.5, "learning_rate": 0.0004971398463960568, "loss": 5.5431, "mean_token_accuracy": 0.16062046885490416, "num_tokens": 12991781.0, "step": 7480 }, { "entropy": 5.694522523880005, "epoch": 0.5823769694611943, "grad_norm": 1.390625, "learning_rate": 0.0004971354395887827, "loss": 5.6288, "mean_token_accuracy": 0.15725939124822616, "num_tokens": 13000539.0, "step": 7485 }, { "entropy": 5.702580308914184, "epoch": 0.5827659988329119, "grad_norm": 1.4140625, "learning_rate": 0.0004971310294109569, "loss": 5.4965, "mean_token_accuracy": 0.1644050046801567, "num_tokens": 13008638.0, "step": 7490 }, { "entropy": 5.61459527015686, "epoch": 0.5831550282046295, "grad_norm": 1.296875, "learning_rate": 0.0004971266158626461, "loss": 5.4854, "mean_token_accuracy": 0.16098864525556564, "num_tokens": 13017217.0, "step": 7495 }, { "entropy": 5.55291600227356, "epoch": 0.583544057576347, "grad_norm": 1.359375, "learning_rate": 0.0004971221989439177, "loss": 5.5311, "mean_token_accuracy": 0.15793122053146363, "num_tokens": 13025278.0, "step": 7500 }, { "entropy": 5.603717041015625, "epoch": 0.5839330869480646, "grad_norm": 1.4609375, "learning_rate": 0.0004971177786548384, "loss": 5.5575, "mean_token_accuracy": 0.15922897905111313, "num_tokens": 13034484.0, "step": 7505 }, { "entropy": 5.727790403366089, "epoch": 0.5843221163197821, "grad_norm": 1.390625, "learning_rate": 0.0004971133549954753, "loss": 5.629, "mean_token_accuracy": 0.1499597117304802, "num_tokens": 13042831.0, "step": 7510 }, { "entropy": 5.727259254455566, "epoch": 0.5847111456914997, "grad_norm": 1.40625, "learning_rate": 0.0004971089279658954, "loss": 5.5922, "mean_token_accuracy": 0.15369003713130952, "num_tokens": 13051614.0, "step": 7515 }, { "entropy": 5.634461355209351, "epoch": 0.5851001750632173, "grad_norm": 1.5078125, "learning_rate": 0.0004971044975661663, "loss": 5.5506, "mean_token_accuracy": 0.15672828108072281, "num_tokens": 13060179.0, "step": 7520 }, { "entropy": 5.575223398208618, "epoch": 0.5854892044349348, "grad_norm": 1.2890625, "learning_rate": 0.0004971000637963549, "loss": 5.4628, "mean_token_accuracy": 0.1732001096010208, "num_tokens": 13068328.0, "step": 7525 }, { "entropy": 5.537419319152832, "epoch": 0.5858782338066524, "grad_norm": 1.3203125, "learning_rate": 0.0004970956266565285, "loss": 5.5145, "mean_token_accuracy": 0.1610039070248604, "num_tokens": 13076879.0, "step": 7530 }, { "entropy": 5.68983154296875, "epoch": 0.58626726317837, "grad_norm": 1.453125, "learning_rate": 0.0004970911861467544, "loss": 5.5583, "mean_token_accuracy": 0.1535510741174221, "num_tokens": 13085123.0, "step": 7535 }, { "entropy": 5.558996152877808, "epoch": 0.5866562925500876, "grad_norm": 1.515625, "learning_rate": 0.0004970867422671002, "loss": 5.5188, "mean_token_accuracy": 0.16626303195953368, "num_tokens": 13093884.0, "step": 7540 }, { "entropy": 5.70104022026062, "epoch": 0.5870453219218051, "grad_norm": 1.359375, "learning_rate": 0.000497082295017633, "loss": 5.5751, "mean_token_accuracy": 0.16042875796556472, "num_tokens": 13102581.0, "step": 7545 }, { "entropy": 5.683917903900147, "epoch": 0.5874343512935226, "grad_norm": 1.4609375, "learning_rate": 0.0004970778443984206, "loss": 5.5609, "mean_token_accuracy": 0.15632733553647996, "num_tokens": 13111307.0, "step": 7550 }, { "entropy": 5.681131172180176, "epoch": 0.5878233806652402, "grad_norm": 1.34375, "learning_rate": 0.0004970733904095303, "loss": 5.5639, "mean_token_accuracy": 0.15917730927467347, "num_tokens": 13119279.0, "step": 7555 }, { "entropy": 5.6647991180419925, "epoch": 0.5882124100369578, "grad_norm": 1.515625, "learning_rate": 0.0004970689330510298, "loss": 5.5906, "mean_token_accuracy": 0.1582401856780052, "num_tokens": 13127753.0, "step": 7560 }, { "entropy": 5.680768918991089, "epoch": 0.5886014394086754, "grad_norm": 1.3828125, "learning_rate": 0.0004970644723229868, "loss": 5.636, "mean_token_accuracy": 0.15444589108228685, "num_tokens": 13136881.0, "step": 7565 }, { "entropy": 5.652431774139404, "epoch": 0.588990468780393, "grad_norm": 1.4140625, "learning_rate": 0.0004970600082254687, "loss": 5.4991, "mean_token_accuracy": 0.15578779727220535, "num_tokens": 13145291.0, "step": 7570 }, { "entropy": 5.579540681838989, "epoch": 0.5893794981521104, "grad_norm": 1.4609375, "learning_rate": 0.0004970555407585436, "loss": 5.4579, "mean_token_accuracy": 0.16331358551979064, "num_tokens": 13153560.0, "step": 7575 }, { "entropy": 5.626413154602051, "epoch": 0.589768527523828, "grad_norm": 1.4921875, "learning_rate": 0.000497051069922279, "loss": 5.5139, "mean_token_accuracy": 0.15920064300298692, "num_tokens": 13162304.0, "step": 7580 }, { "entropy": 5.6824174404144285, "epoch": 0.5901575568955456, "grad_norm": 1.765625, "learning_rate": 0.0004970465957167429, "loss": 5.5345, "mean_token_accuracy": 0.16362176686525345, "num_tokens": 13171404.0, "step": 7585 }, { "entropy": 5.739548587799073, "epoch": 0.5905465862672632, "grad_norm": 1.546875, "learning_rate": 0.000497042118142003, "loss": 5.6142, "mean_token_accuracy": 0.15650009736418724, "num_tokens": 13180001.0, "step": 7590 }, { "entropy": 5.686169528961182, "epoch": 0.5909356156389808, "grad_norm": 1.5234375, "learning_rate": 0.0004970376371981275, "loss": 5.552, "mean_token_accuracy": 0.15728999227285384, "num_tokens": 13189749.0, "step": 7595 }, { "entropy": 5.586195945739746, "epoch": 0.5913246450106983, "grad_norm": 1.3828125, "learning_rate": 0.0004970331528851842, "loss": 5.5261, "mean_token_accuracy": 0.16812347173690795, "num_tokens": 13199169.0, "step": 7600 }, { "entropy": 5.562873315811157, "epoch": 0.5917136743824158, "grad_norm": 1.390625, "learning_rate": 0.0004970286652032412, "loss": 5.4885, "mean_token_accuracy": 0.16665935814380645, "num_tokens": 13207014.0, "step": 7605 }, { "entropy": 5.640641927719116, "epoch": 0.5921027037541334, "grad_norm": 1.8359375, "learning_rate": 0.0004970241741523667, "loss": 5.4406, "mean_token_accuracy": 0.1629709154367447, "num_tokens": 13215333.0, "step": 7610 }, { "entropy": 5.642063808441162, "epoch": 0.592491733125851, "grad_norm": 1.4296875, "learning_rate": 0.0004970196797326286, "loss": 5.5707, "mean_token_accuracy": 0.15491992235183716, "num_tokens": 13223740.0, "step": 7615 }, { "entropy": 5.596137189865113, "epoch": 0.5928807624975686, "grad_norm": 1.5390625, "learning_rate": 0.0004970151819440955, "loss": 5.5128, "mean_token_accuracy": 0.16230032742023467, "num_tokens": 13232065.0, "step": 7620 }, { "entropy": 5.629691648483276, "epoch": 0.5932697918692861, "grad_norm": 1.7265625, "learning_rate": 0.0004970106807868351, "loss": 5.5009, "mean_token_accuracy": 0.1631051391363144, "num_tokens": 13241171.0, "step": 7625 }, { "entropy": 5.5375292778015135, "epoch": 0.5936588212410037, "grad_norm": 1.375, "learning_rate": 0.000497006176260916, "loss": 5.4181, "mean_token_accuracy": 0.16693178415298462, "num_tokens": 13249553.0, "step": 7630 }, { "entropy": 5.618206977844238, "epoch": 0.5940478506127213, "grad_norm": 1.3046875, "learning_rate": 0.0004970016683664068, "loss": 5.4889, "mean_token_accuracy": 0.1628669649362564, "num_tokens": 13258585.0, "step": 7635 }, { "entropy": 5.637617492675782, "epoch": 0.5944368799844388, "grad_norm": 1.296875, "learning_rate": 0.0004969971571033754, "loss": 5.5552, "mean_token_accuracy": 0.16011955440044404, "num_tokens": 13267317.0, "step": 7640 }, { "entropy": 5.575131750106811, "epoch": 0.5948259093561564, "grad_norm": 1.40625, "learning_rate": 0.0004969926424718906, "loss": 5.37, "mean_token_accuracy": 0.16295740604400635, "num_tokens": 13275705.0, "step": 7645 }, { "entropy": 5.6024312496185305, "epoch": 0.5952149387278739, "grad_norm": 1.4375, "learning_rate": 0.0004969881244720207, "loss": 5.5182, "mean_token_accuracy": 0.1615263268351555, "num_tokens": 13284046.0, "step": 7650 }, { "entropy": 5.58196268081665, "epoch": 0.5956039680995915, "grad_norm": 1.4921875, "learning_rate": 0.0004969836031038343, "loss": 5.5, "mean_token_accuracy": 0.16613336950540541, "num_tokens": 13292451.0, "step": 7655 }, { "entropy": 5.714156723022461, "epoch": 0.5959929974713091, "grad_norm": 1.65625, "learning_rate": 0.0004969790783674002, "loss": 5.6349, "mean_token_accuracy": 0.1574876733124256, "num_tokens": 13300788.0, "step": 7660 }, { "entropy": 5.666077136993408, "epoch": 0.5963820268430267, "grad_norm": 1.4375, "learning_rate": 0.0004969745502627868, "loss": 5.5477, "mean_token_accuracy": 0.16628242731094361, "num_tokens": 13309235.0, "step": 7665 }, { "entropy": 5.58871488571167, "epoch": 0.5967710562147442, "grad_norm": 1.4375, "learning_rate": 0.0004969700187900629, "loss": 5.4521, "mean_token_accuracy": 0.1600484788417816, "num_tokens": 13317331.0, "step": 7670 }, { "entropy": 5.575796985626221, "epoch": 0.5971600855864618, "grad_norm": 1.75, "learning_rate": 0.0004969654839492973, "loss": 5.4885, "mean_token_accuracy": 0.1504474826157093, "num_tokens": 13327296.0, "step": 7675 }, { "entropy": 5.673458480834961, "epoch": 0.5975491149581793, "grad_norm": 1.5390625, "learning_rate": 0.0004969609457405588, "loss": 5.5549, "mean_token_accuracy": 0.15951465219259262, "num_tokens": 13336650.0, "step": 7680 }, { "entropy": 5.641073751449585, "epoch": 0.5979381443298969, "grad_norm": 1.4921875, "learning_rate": 0.0004969564041639163, "loss": 5.5005, "mean_token_accuracy": 0.15823953747749328, "num_tokens": 13345353.0, "step": 7685 }, { "entropy": 5.656012964248657, "epoch": 0.5983271737016145, "grad_norm": 1.2890625, "learning_rate": 0.0004969518592194386, "loss": 5.5111, "mean_token_accuracy": 0.16030848026275635, "num_tokens": 13354302.0, "step": 7690 }, { "entropy": 5.549968671798706, "epoch": 0.5987162030733321, "grad_norm": 1.53125, "learning_rate": 0.0004969473109071946, "loss": 5.4504, "mean_token_accuracy": 0.163647423684597, "num_tokens": 13362950.0, "step": 7695 }, { "entropy": 5.585221242904663, "epoch": 0.5991052324450497, "grad_norm": 1.6484375, "learning_rate": 0.0004969427592272535, "loss": 5.5745, "mean_token_accuracy": 0.1560671731829643, "num_tokens": 13371383.0, "step": 7700 }, { "entropy": 5.669369792938232, "epoch": 0.5994942618167671, "grad_norm": 1.40625, "learning_rate": 0.0004969382041796843, "loss": 5.5383, "mean_token_accuracy": 0.1628669172525406, "num_tokens": 13379767.0, "step": 7705 }, { "entropy": 5.655380296707153, "epoch": 0.5998832911884847, "grad_norm": 1.3203125, "learning_rate": 0.000496933645764556, "loss": 5.5267, "mean_token_accuracy": 0.15433267802000045, "num_tokens": 13387970.0, "step": 7710 }, { "entropy": 5.545374393463135, "epoch": 0.6002723205602023, "grad_norm": 1.4296875, "learning_rate": 0.0004969290839819381, "loss": 5.4821, "mean_token_accuracy": 0.16639994978904724, "num_tokens": 13396605.0, "step": 7715 }, { "entropy": 5.582101249694825, "epoch": 0.6006613499319199, "grad_norm": 1.3671875, "learning_rate": 0.0004969245188318994, "loss": 5.4222, "mean_token_accuracy": 0.16884092390537261, "num_tokens": 13406028.0, "step": 7720 }, { "entropy": 5.643075370788575, "epoch": 0.6010503793036375, "grad_norm": 1.453125, "learning_rate": 0.0004969199503145093, "loss": 5.4808, "mean_token_accuracy": 0.16709552854299545, "num_tokens": 13414927.0, "step": 7725 }, { "entropy": 5.538677787780761, "epoch": 0.601439408675355, "grad_norm": 1.2890625, "learning_rate": 0.0004969153784298374, "loss": 5.4197, "mean_token_accuracy": 0.16179912090301513, "num_tokens": 13423020.0, "step": 7730 }, { "entropy": 5.501712656021118, "epoch": 0.6018284380470725, "grad_norm": 1.4609375, "learning_rate": 0.0004969108031779527, "loss": 5.4259, "mean_token_accuracy": 0.16240470558404924, "num_tokens": 13431514.0, "step": 7735 }, { "entropy": 5.627806663513184, "epoch": 0.6022174674187901, "grad_norm": 1.7890625, "learning_rate": 0.0004969062245589247, "loss": 5.6042, "mean_token_accuracy": 0.15487990602850915, "num_tokens": 13440333.0, "step": 7740 }, { "entropy": 5.58061785697937, "epoch": 0.6026064967905077, "grad_norm": 2.328125, "learning_rate": 0.0004969016425728231, "loss": 5.5314, "mean_token_accuracy": 0.1586664631962776, "num_tokens": 13448841.0, "step": 7745 }, { "entropy": 5.669718933105469, "epoch": 0.6029955261622253, "grad_norm": 1.65625, "learning_rate": 0.0004968970572197172, "loss": 5.6055, "mean_token_accuracy": 0.15758649706840516, "num_tokens": 13457846.0, "step": 7750 }, { "entropy": 5.730754661560058, "epoch": 0.6033845555339428, "grad_norm": 1.84375, "learning_rate": 0.0004968924684996765, "loss": 5.6091, "mean_token_accuracy": 0.15334318280220033, "num_tokens": 13466242.0, "step": 7755 }, { "entropy": 5.67420654296875, "epoch": 0.6037735849056604, "grad_norm": 1.46875, "learning_rate": 0.000496887876412771, "loss": 5.5405, "mean_token_accuracy": 0.15616600215435028, "num_tokens": 13474639.0, "step": 7760 }, { "entropy": 5.563692665100097, "epoch": 0.6041626142773779, "grad_norm": 1.359375, "learning_rate": 0.0004968832809590701, "loss": 5.436, "mean_token_accuracy": 0.16429483294487, "num_tokens": 13483673.0, "step": 7765 }, { "entropy": 5.667019462585449, "epoch": 0.6045516436490955, "grad_norm": 1.390625, "learning_rate": 0.0004968786821386435, "loss": 5.5529, "mean_token_accuracy": 0.15738777071237564, "num_tokens": 13493001.0, "step": 7770 }, { "entropy": 5.751283121109009, "epoch": 0.6049406730208131, "grad_norm": 1.5546875, "learning_rate": 0.0004968740799515611, "loss": 5.5688, "mean_token_accuracy": 0.15729465782642366, "num_tokens": 13500878.0, "step": 7775 }, { "entropy": 5.6461762428283695, "epoch": 0.6053297023925306, "grad_norm": 1.5390625, "learning_rate": 0.0004968694743978926, "loss": 5.6267, "mean_token_accuracy": 0.1560249738395214, "num_tokens": 13509945.0, "step": 7780 }, { "entropy": 5.580125570297241, "epoch": 0.6057187317642482, "grad_norm": 1.3984375, "learning_rate": 0.0004968648654777081, "loss": 5.5488, "mean_token_accuracy": 0.16145080476999282, "num_tokens": 13520024.0, "step": 7785 }, { "entropy": 5.669335126876831, "epoch": 0.6061077611359658, "grad_norm": 1.4609375, "learning_rate": 0.0004968602531910773, "loss": 5.644, "mean_token_accuracy": 0.15712960958480834, "num_tokens": 13529136.0, "step": 7790 }, { "entropy": 5.628845357894898, "epoch": 0.6064967905076833, "grad_norm": 1.4375, "learning_rate": 0.0004968556375380704, "loss": 5.452, "mean_token_accuracy": 0.16029975712299346, "num_tokens": 13537001.0, "step": 7795 }, { "entropy": 5.619492673873902, "epoch": 0.6068858198794009, "grad_norm": 1.578125, "learning_rate": 0.0004968510185187571, "loss": 5.4475, "mean_token_accuracy": 0.16057668179273604, "num_tokens": 13545520.0, "step": 7800 }, { "entropy": 5.581534576416016, "epoch": 0.6072748492511184, "grad_norm": 1.40625, "learning_rate": 0.000496846396133208, "loss": 5.5005, "mean_token_accuracy": 0.1582297757267952, "num_tokens": 13554770.0, "step": 7805 }, { "entropy": 5.701692295074463, "epoch": 0.607663878622836, "grad_norm": 1.4296875, "learning_rate": 0.0004968417703814928, "loss": 5.5476, "mean_token_accuracy": 0.15719548612833023, "num_tokens": 13562797.0, "step": 7810 }, { "entropy": 5.613367748260498, "epoch": 0.6080529079945536, "grad_norm": 1.5, "learning_rate": 0.0004968371412636818, "loss": 5.5004, "mean_token_accuracy": 0.16422986686229707, "num_tokens": 13572017.0, "step": 7815 }, { "entropy": 5.6862372875213625, "epoch": 0.6084419373662712, "grad_norm": 1.421875, "learning_rate": 0.0004968325087798453, "loss": 5.5231, "mean_token_accuracy": 0.1657199665904045, "num_tokens": 13580245.0, "step": 7820 }, { "entropy": 5.597463941574096, "epoch": 0.6088309667379888, "grad_norm": 1.4140625, "learning_rate": 0.0004968278729300536, "loss": 5.4988, "mean_token_accuracy": 0.15661692023277282, "num_tokens": 13588719.0, "step": 7825 }, { "entropy": 5.66688551902771, "epoch": 0.6092199961097062, "grad_norm": 1.640625, "learning_rate": 0.0004968232337143769, "loss": 5.5555, "mean_token_accuracy": 0.16355859488248825, "num_tokens": 13597345.0, "step": 7830 }, { "entropy": 5.707019233703614, "epoch": 0.6096090254814238, "grad_norm": 1.96875, "learning_rate": 0.0004968185911328858, "loss": 5.5719, "mean_token_accuracy": 0.15881615430116652, "num_tokens": 13605468.0, "step": 7835 }, { "entropy": 5.659979629516601, "epoch": 0.6099980548531414, "grad_norm": 2.734375, "learning_rate": 0.0004968139451856506, "loss": 5.5829, "mean_token_accuracy": 0.15562816858291625, "num_tokens": 13614085.0, "step": 7840 }, { "entropy": 5.596334028244018, "epoch": 0.610387084224859, "grad_norm": 1.65625, "learning_rate": 0.0004968092958727419, "loss": 5.4023, "mean_token_accuracy": 0.16623687595129014, "num_tokens": 13622370.0, "step": 7845 }, { "entropy": 5.6452563285827635, "epoch": 0.6107761135965766, "grad_norm": 1.6171875, "learning_rate": 0.00049680464319423, "loss": 5.5358, "mean_token_accuracy": 0.162747386097908, "num_tokens": 13630615.0, "step": 7850 }, { "entropy": 5.621069622039795, "epoch": 0.6111651429682942, "grad_norm": 1.4921875, "learning_rate": 0.0004967999871501858, "loss": 5.4597, "mean_token_accuracy": 0.16595776081085206, "num_tokens": 13638461.0, "step": 7855 }, { "entropy": 5.525365924835205, "epoch": 0.6115541723400116, "grad_norm": 1.546875, "learning_rate": 0.0004967953277406798, "loss": 5.5588, "mean_token_accuracy": 0.15436985194683076, "num_tokens": 13647266.0, "step": 7860 }, { "entropy": 5.577764654159546, "epoch": 0.6119432017117292, "grad_norm": 1.5234375, "learning_rate": 0.0004967906649657828, "loss": 5.5385, "mean_token_accuracy": 0.15356022566556932, "num_tokens": 13655930.0, "step": 7865 }, { "entropy": 5.682845115661621, "epoch": 0.6123322310834468, "grad_norm": 1.828125, "learning_rate": 0.0004967859988255655, "loss": 5.5266, "mean_token_accuracy": 0.1603233262896538, "num_tokens": 13664427.0, "step": 7870 }, { "entropy": 5.619559383392334, "epoch": 0.6127212604551644, "grad_norm": 1.5625, "learning_rate": 0.0004967813293200985, "loss": 5.5442, "mean_token_accuracy": 0.1572070375084877, "num_tokens": 13673120.0, "step": 7875 }, { "entropy": 5.572880744934082, "epoch": 0.613110289826882, "grad_norm": 1.3984375, "learning_rate": 0.0004967766564494529, "loss": 5.3749, "mean_token_accuracy": 0.16913995444774627, "num_tokens": 13681918.0, "step": 7880 }, { "entropy": 5.554079675674439, "epoch": 0.6134993191985995, "grad_norm": 1.515625, "learning_rate": 0.0004967719802136996, "loss": 5.4778, "mean_token_accuracy": 0.16967321187257767, "num_tokens": 13689904.0, "step": 7885 }, { "entropy": 5.60751166343689, "epoch": 0.613888348570317, "grad_norm": 2.078125, "learning_rate": 0.0004967673006129094, "loss": 5.5141, "mean_token_accuracy": 0.16323916763067245, "num_tokens": 13697861.0, "step": 7890 }, { "entropy": 5.705719375610352, "epoch": 0.6142773779420346, "grad_norm": 1.4296875, "learning_rate": 0.0004967626176471536, "loss": 5.6527, "mean_token_accuracy": 0.15828764587640762, "num_tokens": 13706058.0, "step": 7895 }, { "entropy": 5.716040849685669, "epoch": 0.6146664073137522, "grad_norm": 1.5, "learning_rate": 0.0004967579313165028, "loss": 5.5623, "mean_token_accuracy": 0.1580530047416687, "num_tokens": 13715081.0, "step": 7900 }, { "entropy": 5.621213054656982, "epoch": 0.6150554366854698, "grad_norm": 1.4921875, "learning_rate": 0.0004967532416210284, "loss": 5.4588, "mean_token_accuracy": 0.16525533944368362, "num_tokens": 13723311.0, "step": 7905 }, { "entropy": 5.625402641296387, "epoch": 0.6154444660571873, "grad_norm": 1.3203125, "learning_rate": 0.0004967485485608016, "loss": 5.4866, "mean_token_accuracy": 0.15760971158742904, "num_tokens": 13731737.0, "step": 7910 }, { "entropy": 5.621528196334839, "epoch": 0.6158334954289049, "grad_norm": 1.4765625, "learning_rate": 0.0004967438521358934, "loss": 5.5461, "mean_token_accuracy": 0.16389579325914383, "num_tokens": 13740255.0, "step": 7915 }, { "entropy": 5.610876655578613, "epoch": 0.6162225248006225, "grad_norm": 1.5859375, "learning_rate": 0.0004967391523463754, "loss": 5.489, "mean_token_accuracy": 0.16789331734180452, "num_tokens": 13748656.0, "step": 7920 }, { "entropy": 5.564035367965698, "epoch": 0.61661155417234, "grad_norm": 1.6171875, "learning_rate": 0.0004967344491923185, "loss": 5.5076, "mean_token_accuracy": 0.15980468392372132, "num_tokens": 13757539.0, "step": 7925 }, { "entropy": 5.659132051467895, "epoch": 0.6170005835440576, "grad_norm": 1.390625, "learning_rate": 0.0004967297426737943, "loss": 5.5129, "mean_token_accuracy": 0.15738938599824906, "num_tokens": 13766569.0, "step": 7930 }, { "entropy": 5.653924655914307, "epoch": 0.6173896129157751, "grad_norm": 1.5078125, "learning_rate": 0.0004967250327908742, "loss": 5.5366, "mean_token_accuracy": 0.16349831819534302, "num_tokens": 13775071.0, "step": 7935 }, { "entropy": 5.568353176116943, "epoch": 0.6177786422874927, "grad_norm": 1.609375, "learning_rate": 0.0004967203195436297, "loss": 5.5299, "mean_token_accuracy": 0.15771082788705826, "num_tokens": 13783319.0, "step": 7940 }, { "entropy": 5.554364490509033, "epoch": 0.6181676716592103, "grad_norm": 1.4375, "learning_rate": 0.0004967156029321322, "loss": 5.4737, "mean_token_accuracy": 0.1636737361550331, "num_tokens": 13792746.0, "step": 7945 }, { "entropy": 5.6123247146606445, "epoch": 0.6185567010309279, "grad_norm": 1.4296875, "learning_rate": 0.0004967108829564532, "loss": 5.4158, "mean_token_accuracy": 0.16776807606220245, "num_tokens": 13801632.0, "step": 7950 }, { "entropy": 5.608026552200317, "epoch": 0.6189457304026454, "grad_norm": 1.484375, "learning_rate": 0.0004967061596166646, "loss": 5.554, "mean_token_accuracy": 0.164193557202816, "num_tokens": 13810527.0, "step": 7955 }, { "entropy": 5.641494846343994, "epoch": 0.6193347597743629, "grad_norm": 1.6875, "learning_rate": 0.0004967014329128378, "loss": 5.4927, "mean_token_accuracy": 0.1584918275475502, "num_tokens": 13819885.0, "step": 7960 }, { "entropy": 5.602808618545533, "epoch": 0.6197237891460805, "grad_norm": 1.40625, "learning_rate": 0.0004966967028450448, "loss": 5.4986, "mean_token_accuracy": 0.1619834065437317, "num_tokens": 13828509.0, "step": 7965 }, { "entropy": 5.639061784744262, "epoch": 0.6201128185177981, "grad_norm": 1.40625, "learning_rate": 0.000496691969413357, "loss": 5.4984, "mean_token_accuracy": 0.15714405626058578, "num_tokens": 13837196.0, "step": 7970 }, { "entropy": 5.626188468933106, "epoch": 0.6205018478895157, "grad_norm": 1.6171875, "learning_rate": 0.0004966872326178466, "loss": 5.5401, "mean_token_accuracy": 0.15958023220300674, "num_tokens": 13845849.0, "step": 7975 }, { "entropy": 5.598227500915527, "epoch": 0.6208908772612333, "grad_norm": 1.421875, "learning_rate": 0.0004966824924585851, "loss": 5.4759, "mean_token_accuracy": 0.1665155291557312, "num_tokens": 13853430.0, "step": 7980 }, { "entropy": 5.629713916778565, "epoch": 0.6212799066329507, "grad_norm": 1.484375, "learning_rate": 0.0004966777489356448, "loss": 5.6462, "mean_token_accuracy": 0.14797311276197433, "num_tokens": 13862520.0, "step": 7985 }, { "entropy": 5.67573127746582, "epoch": 0.6216689360046683, "grad_norm": 1.421875, "learning_rate": 0.0004966730020490975, "loss": 5.5734, "mean_token_accuracy": 0.15468597412109375, "num_tokens": 13871064.0, "step": 7990 }, { "entropy": 5.598003816604614, "epoch": 0.6220579653763859, "grad_norm": 1.359375, "learning_rate": 0.000496668251799015, "loss": 5.4698, "mean_token_accuracy": 0.15911296308040618, "num_tokens": 13879952.0, "step": 7995 }, { "entropy": 5.624768495559692, "epoch": 0.6224469947481035, "grad_norm": 1.640625, "learning_rate": 0.0004966634981854699, "loss": 5.6215, "mean_token_accuracy": 0.15347439646720887, "num_tokens": 13888054.0, "step": 8000 }, { "entropy": 5.720452976226807, "epoch": 0.6228360241198211, "grad_norm": 1.4453125, "learning_rate": 0.0004966587412085339, "loss": 5.5917, "mean_token_accuracy": 0.15596983581781387, "num_tokens": 13897051.0, "step": 8005 }, { "entropy": 5.644585418701172, "epoch": 0.6232250534915386, "grad_norm": 1.4765625, "learning_rate": 0.0004966539808682793, "loss": 5.5541, "mean_token_accuracy": 0.15398771762847902, "num_tokens": 13906175.0, "step": 8010 }, { "entropy": 5.594349575042725, "epoch": 0.6236140828632561, "grad_norm": 1.5078125, "learning_rate": 0.0004966492171647783, "loss": 5.5113, "mean_token_accuracy": 0.16241261661052703, "num_tokens": 13915283.0, "step": 8015 }, { "entropy": 5.613103246688842, "epoch": 0.6240031122349737, "grad_norm": 1.5859375, "learning_rate": 0.0004966444500981032, "loss": 5.5599, "mean_token_accuracy": 0.15472135916352273, "num_tokens": 13924007.0, "step": 8020 }, { "entropy": 5.635571241378784, "epoch": 0.6243921416066913, "grad_norm": 1.71875, "learning_rate": 0.0004966396796683265, "loss": 5.4524, "mean_token_accuracy": 0.1615746721625328, "num_tokens": 13932694.0, "step": 8025 }, { "entropy": 5.6920552253723145, "epoch": 0.6247811709784089, "grad_norm": 1.5390625, "learning_rate": 0.0004966349058755204, "loss": 5.5668, "mean_token_accuracy": 0.1511019714176655, "num_tokens": 13941817.0, "step": 8030 }, { "entropy": 5.627501916885376, "epoch": 0.6251702003501264, "grad_norm": 1.578125, "learning_rate": 0.0004966301287197573, "loss": 5.4196, "mean_token_accuracy": 0.16701409667730333, "num_tokens": 13950413.0, "step": 8035 }, { "entropy": 5.68371171951294, "epoch": 0.625559229721844, "grad_norm": 1.5859375, "learning_rate": 0.0004966253482011098, "loss": 5.5711, "mean_token_accuracy": 0.15596165508031845, "num_tokens": 13959415.0, "step": 8040 }, { "entropy": 5.586246681213379, "epoch": 0.6259482590935616, "grad_norm": 1.515625, "learning_rate": 0.0004966205643196503, "loss": 5.4396, "mean_token_accuracy": 0.16483698040246964, "num_tokens": 13967889.0, "step": 8045 }, { "entropy": 5.451131200790405, "epoch": 0.6263372884652791, "grad_norm": 1.40625, "learning_rate": 0.0004966157770754516, "loss": 5.4298, "mean_token_accuracy": 0.16041132509708406, "num_tokens": 13976190.0, "step": 8050 }, { "entropy": 5.743996858596802, "epoch": 0.6267263178369967, "grad_norm": 1.4609375, "learning_rate": 0.000496610986468586, "loss": 5.5624, "mean_token_accuracy": 0.15470899939537047, "num_tokens": 13984940.0, "step": 8055 }, { "entropy": 5.711560821533203, "epoch": 0.6271153472087143, "grad_norm": 1.453125, "learning_rate": 0.0004966061924991267, "loss": 5.5669, "mean_token_accuracy": 0.15803698003292083, "num_tokens": 13993740.0, "step": 8060 }, { "entropy": 5.649155855178833, "epoch": 0.6275043765804318, "grad_norm": 1.9609375, "learning_rate": 0.000496601395167146, "loss": 5.6063, "mean_token_accuracy": 0.15621764957904816, "num_tokens": 14002401.0, "step": 8065 }, { "entropy": 5.6560780048370365, "epoch": 0.6278934059521494, "grad_norm": 1.4921875, "learning_rate": 0.0004965965944727168, "loss": 5.589, "mean_token_accuracy": 0.16249808073043823, "num_tokens": 14011197.0, "step": 8070 }, { "entropy": 5.668906259536743, "epoch": 0.628282435323867, "grad_norm": 1.3828125, "learning_rate": 0.0004965917904159121, "loss": 5.4433, "mean_token_accuracy": 0.16768872141838073, "num_tokens": 14020344.0, "step": 8075 }, { "entropy": 5.573599004745484, "epoch": 0.6286714646955845, "grad_norm": 1.4765625, "learning_rate": 0.0004965869829968046, "loss": 5.4688, "mean_token_accuracy": 0.1629825420677662, "num_tokens": 14029117.0, "step": 8080 }, { "entropy": 5.550131130218506, "epoch": 0.6290604940673021, "grad_norm": 1.8125, "learning_rate": 0.0004965821722154674, "loss": 5.3851, "mean_token_accuracy": 0.17250871807336807, "num_tokens": 14038395.0, "step": 8085 }, { "entropy": 5.654913759231567, "epoch": 0.6294495234390196, "grad_norm": 1.34375, "learning_rate": 0.0004965773580719734, "loss": 5.4818, "mean_token_accuracy": 0.1610204964876175, "num_tokens": 14046983.0, "step": 8090 }, { "entropy": 5.532347106933594, "epoch": 0.6298385528107372, "grad_norm": 1.5859375, "learning_rate": 0.0004965725405663957, "loss": 5.3661, "mean_token_accuracy": 0.17185525000095367, "num_tokens": 14056261.0, "step": 8095 }, { "entropy": 5.560761213302612, "epoch": 0.6302275821824548, "grad_norm": 1.34375, "learning_rate": 0.0004965677196988073, "loss": 5.5553, "mean_token_accuracy": 0.15718994289636612, "num_tokens": 14065371.0, "step": 8100 }, { "entropy": 5.667489385604858, "epoch": 0.6306166115541724, "grad_norm": 1.5078125, "learning_rate": 0.0004965628954692815, "loss": 5.6046, "mean_token_accuracy": 0.15320607796311378, "num_tokens": 14074007.0, "step": 8105 }, { "entropy": 5.6024304866790775, "epoch": 0.63100564092589, "grad_norm": 1.4296875, "learning_rate": 0.0004965580678778913, "loss": 5.4635, "mean_token_accuracy": 0.16192514896392823, "num_tokens": 14083259.0, "step": 8110 }, { "entropy": 5.5890124320983885, "epoch": 0.6313946702976074, "grad_norm": 1.3984375, "learning_rate": 0.0004965532369247102, "loss": 5.4472, "mean_token_accuracy": 0.16927091628313065, "num_tokens": 14090993.0, "step": 8115 }, { "entropy": 5.708404493331909, "epoch": 0.631783699669325, "grad_norm": 1.46875, "learning_rate": 0.0004965484026098111, "loss": 5.5798, "mean_token_accuracy": 0.16099388897418976, "num_tokens": 14099722.0, "step": 8120 }, { "entropy": 5.694318532943726, "epoch": 0.6321727290410426, "grad_norm": 1.453125, "learning_rate": 0.0004965435649332679, "loss": 5.5686, "mean_token_accuracy": 0.1553332358598709, "num_tokens": 14108483.0, "step": 8125 }, { "entropy": 5.700818920135498, "epoch": 0.6325617584127602, "grad_norm": 1.5, "learning_rate": 0.0004965387238951536, "loss": 5.5813, "mean_token_accuracy": 0.15432338714599608, "num_tokens": 14117187.0, "step": 8130 }, { "entropy": 5.629018354415893, "epoch": 0.6329507877844778, "grad_norm": 1.515625, "learning_rate": 0.0004965338794955418, "loss": 5.4165, "mean_token_accuracy": 0.16764814108610154, "num_tokens": 14125424.0, "step": 8135 }, { "entropy": 5.578190708160401, "epoch": 0.6333398171561953, "grad_norm": 2.125, "learning_rate": 0.0004965290317345061, "loss": 5.4749, "mean_token_accuracy": 0.16633348613977433, "num_tokens": 14133038.0, "step": 8140 }, { "entropy": 5.669448947906494, "epoch": 0.6337288465279128, "grad_norm": 1.5078125, "learning_rate": 0.0004965241806121198, "loss": 5.635, "mean_token_accuracy": 0.15585788935422898, "num_tokens": 14141114.0, "step": 8145 }, { "entropy": 5.701724481582642, "epoch": 0.6341178758996304, "grad_norm": 1.5390625, "learning_rate": 0.0004965193261284567, "loss": 5.4913, "mean_token_accuracy": 0.16475782543420792, "num_tokens": 14149681.0, "step": 8150 }, { "entropy": 5.664780807495117, "epoch": 0.634506905271348, "grad_norm": 1.4921875, "learning_rate": 0.0004965144682835904, "loss": 5.521, "mean_token_accuracy": 0.15518609285354615, "num_tokens": 14158510.0, "step": 8155 }, { "entropy": 5.62149748802185, "epoch": 0.6348959346430656, "grad_norm": 1.6796875, "learning_rate": 0.0004965096070775946, "loss": 5.5722, "mean_token_accuracy": 0.16341715157032013, "num_tokens": 14166897.0, "step": 8160 }, { "entropy": 5.646671915054322, "epoch": 0.6352849640147831, "grad_norm": 1.5703125, "learning_rate": 0.0004965047425105431, "loss": 5.5112, "mean_token_accuracy": 0.16355205327272415, "num_tokens": 14174692.0, "step": 8165 }, { "entropy": 5.608004140853882, "epoch": 0.6356739933865007, "grad_norm": 1.6015625, "learning_rate": 0.0004964998745825097, "loss": 5.5145, "mean_token_accuracy": 0.1610356867313385, "num_tokens": 14183779.0, "step": 8170 }, { "entropy": 5.618157815933228, "epoch": 0.6360630227582182, "grad_norm": 1.6171875, "learning_rate": 0.0004964950032935682, "loss": 5.5653, "mean_token_accuracy": 0.1621095359325409, "num_tokens": 14191809.0, "step": 8175 }, { "entropy": 5.619154691696167, "epoch": 0.6364520521299358, "grad_norm": 1.6875, "learning_rate": 0.0004964901286437927, "loss": 5.5212, "mean_token_accuracy": 0.1605943337082863, "num_tokens": 14200652.0, "step": 8180 }, { "entropy": 5.64874005317688, "epoch": 0.6368410815016534, "grad_norm": 1.4921875, "learning_rate": 0.0004964852506332568, "loss": 5.4994, "mean_token_accuracy": 0.1635741412639618, "num_tokens": 14209694.0, "step": 8185 }, { "entropy": 5.67854871749878, "epoch": 0.6372301108733709, "grad_norm": 1.71875, "learning_rate": 0.000496480369262035, "loss": 5.5653, "mean_token_accuracy": 0.15659616738557816, "num_tokens": 14218040.0, "step": 8190 }, { "entropy": 5.608455085754395, "epoch": 0.6376191402450885, "grad_norm": 1.453125, "learning_rate": 0.000496475484530201, "loss": 5.4904, "mean_token_accuracy": 0.16435641497373582, "num_tokens": 14225908.0, "step": 8195 }, { "entropy": 5.625738477706909, "epoch": 0.6380081696168061, "grad_norm": 1.3984375, "learning_rate": 0.0004964705964378292, "loss": 5.514, "mean_token_accuracy": 0.15561088025569916, "num_tokens": 14234140.0, "step": 8200 }, { "entropy": 5.676596355438233, "epoch": 0.6383971989885237, "grad_norm": 1.4296875, "learning_rate": 0.0004964657049849934, "loss": 5.5588, "mean_token_accuracy": 0.161154206097126, "num_tokens": 14243590.0, "step": 8205 }, { "entropy": 5.700593566894531, "epoch": 0.6387862283602412, "grad_norm": 1.5234375, "learning_rate": 0.0004964608101717681, "loss": 5.5236, "mean_token_accuracy": 0.1618498295545578, "num_tokens": 14252249.0, "step": 8210 }, { "entropy": 5.620331192016602, "epoch": 0.6391752577319587, "grad_norm": 1.609375, "learning_rate": 0.0004964559119982275, "loss": 5.4516, "mean_token_accuracy": 0.1617949664592743, "num_tokens": 14261147.0, "step": 8215 }, { "entropy": 5.61994776725769, "epoch": 0.6395642871036763, "grad_norm": 1.3984375, "learning_rate": 0.000496451010464446, "loss": 5.5242, "mean_token_accuracy": 0.16001735627651215, "num_tokens": 14270309.0, "step": 8220 }, { "entropy": 5.57561731338501, "epoch": 0.6399533164753939, "grad_norm": 1.515625, "learning_rate": 0.0004964461055704978, "loss": 5.511, "mean_token_accuracy": 0.15979014486074447, "num_tokens": 14279379.0, "step": 8225 }, { "entropy": 5.560876750946045, "epoch": 0.6403423458471115, "grad_norm": 1.609375, "learning_rate": 0.0004964411973164574, "loss": 5.4614, "mean_token_accuracy": 0.1537440910935402, "num_tokens": 14288136.0, "step": 8230 }, { "entropy": 5.591270303726196, "epoch": 0.6407313752188291, "grad_norm": 1.5390625, "learning_rate": 0.0004964362857023993, "loss": 5.3891, "mean_token_accuracy": 0.16101400256156922, "num_tokens": 14296437.0, "step": 8235 }, { "entropy": 5.613467645645142, "epoch": 0.6411204045905465, "grad_norm": 1.3984375, "learning_rate": 0.000496431370728398, "loss": 5.4342, "mean_token_accuracy": 0.17272723615169525, "num_tokens": 14304861.0, "step": 8240 }, { "entropy": 5.53576021194458, "epoch": 0.6415094339622641, "grad_norm": 1.3046875, "learning_rate": 0.0004964264523945281, "loss": 5.4904, "mean_token_accuracy": 0.16508440673351288, "num_tokens": 14312861.0, "step": 8245 }, { "entropy": 5.503257942199707, "epoch": 0.6418984633339817, "grad_norm": 1.4375, "learning_rate": 0.0004964215307008643, "loss": 5.3573, "mean_token_accuracy": 0.16898525953292848, "num_tokens": 14321651.0, "step": 8250 }, { "entropy": 5.606548023223877, "epoch": 0.6422874927056993, "grad_norm": 1.40625, "learning_rate": 0.0004964166056474811, "loss": 5.5186, "mean_token_accuracy": 0.16981685757637024, "num_tokens": 14329234.0, "step": 8255 }, { "entropy": 5.63331151008606, "epoch": 0.6426765220774169, "grad_norm": 1.7109375, "learning_rate": 0.0004964116772344534, "loss": 5.641, "mean_token_accuracy": 0.15602685809135436, "num_tokens": 14337603.0, "step": 8260 }, { "entropy": 5.645445251464844, "epoch": 0.6430655514491345, "grad_norm": 1.984375, "learning_rate": 0.0004964067454618559, "loss": 5.5221, "mean_token_accuracy": 0.16045982241630555, "num_tokens": 14346634.0, "step": 8265 }, { "entropy": 5.691012954711914, "epoch": 0.6434545808208519, "grad_norm": 1.6015625, "learning_rate": 0.0004964018103297634, "loss": 5.5444, "mean_token_accuracy": 0.15774981528520585, "num_tokens": 14355336.0, "step": 8270 }, { "entropy": 5.637445688247681, "epoch": 0.6438436101925695, "grad_norm": 1.6171875, "learning_rate": 0.0004963968718382509, "loss": 5.4931, "mean_token_accuracy": 0.1598949909210205, "num_tokens": 14364434.0, "step": 8275 }, { "entropy": 5.580499696731567, "epoch": 0.6442326395642871, "grad_norm": 1.4453125, "learning_rate": 0.0004963919299873931, "loss": 5.432, "mean_token_accuracy": 0.1723459243774414, "num_tokens": 14372454.0, "step": 8280 }, { "entropy": 5.626510953903198, "epoch": 0.6446216689360047, "grad_norm": 1.703125, "learning_rate": 0.0004963869847772653, "loss": 5.4967, "mean_token_accuracy": 0.1624937891960144, "num_tokens": 14381381.0, "step": 8285 }, { "entropy": 5.6586121082305905, "epoch": 0.6450106983077223, "grad_norm": 1.5390625, "learning_rate": 0.0004963820362079423, "loss": 5.5855, "mean_token_accuracy": 0.15776764452457429, "num_tokens": 14390853.0, "step": 8290 }, { "entropy": 5.5826750755310055, "epoch": 0.6453997276794398, "grad_norm": 1.5234375, "learning_rate": 0.0004963770842794994, "loss": 5.4458, "mean_token_accuracy": 0.16542210429906845, "num_tokens": 14399897.0, "step": 8295 }, { "entropy": 5.546051073074341, "epoch": 0.6457887570511573, "grad_norm": 1.4765625, "learning_rate": 0.0004963721289920115, "loss": 5.5021, "mean_token_accuracy": 0.16482663303613662, "num_tokens": 14408192.0, "step": 8300 }, { "entropy": 5.548407506942749, "epoch": 0.6461777864228749, "grad_norm": 1.4453125, "learning_rate": 0.0004963671703455538, "loss": 5.3852, "mean_token_accuracy": 0.17058072835206986, "num_tokens": 14416004.0, "step": 8305 }, { "entropy": 5.585981321334839, "epoch": 0.6465668157945925, "grad_norm": 1.3359375, "learning_rate": 0.0004963622083402018, "loss": 5.4231, "mean_token_accuracy": 0.16638686507940292, "num_tokens": 14424573.0, "step": 8310 }, { "entropy": 5.536883068084717, "epoch": 0.6469558451663101, "grad_norm": 1.53125, "learning_rate": 0.0004963572429760305, "loss": 5.4153, "mean_token_accuracy": 0.16832368671894074, "num_tokens": 14432756.0, "step": 8315 }, { "entropy": 5.62876329421997, "epoch": 0.6473448745380276, "grad_norm": 1.328125, "learning_rate": 0.0004963522742531155, "loss": 5.5143, "mean_token_accuracy": 0.15935860425233841, "num_tokens": 14441695.0, "step": 8320 }, { "entropy": 5.589247512817383, "epoch": 0.6477339039097452, "grad_norm": 1.7109375, "learning_rate": 0.000496347302171532, "loss": 5.6141, "mean_token_accuracy": 0.15695839151740074, "num_tokens": 14451233.0, "step": 8325 }, { "entropy": 5.634691572189331, "epoch": 0.6481229332814628, "grad_norm": 1.515625, "learning_rate": 0.0004963423267313554, "loss": 5.4841, "mean_token_accuracy": 0.16518651098012924, "num_tokens": 14459757.0, "step": 8330 }, { "entropy": 5.642829942703247, "epoch": 0.6485119626531803, "grad_norm": 1.7265625, "learning_rate": 0.0004963373479326614, "loss": 5.5698, "mean_token_accuracy": 0.1531238727271557, "num_tokens": 14468308.0, "step": 8335 }, { "entropy": 5.619338035583496, "epoch": 0.6489009920248979, "grad_norm": 1.3984375, "learning_rate": 0.0004963323657755255, "loss": 5.5011, "mean_token_accuracy": 0.1637391686439514, "num_tokens": 14476654.0, "step": 8340 }, { "entropy": 5.64993805885315, "epoch": 0.6492900213966154, "grad_norm": 1.4453125, "learning_rate": 0.0004963273802600231, "loss": 5.5943, "mean_token_accuracy": 0.16172325909137725, "num_tokens": 14484960.0, "step": 8345 }, { "entropy": 5.72280445098877, "epoch": 0.649679050768333, "grad_norm": 1.4453125, "learning_rate": 0.00049632239138623, "loss": 5.5754, "mean_token_accuracy": 0.1508148118853569, "num_tokens": 14493708.0, "step": 8350 }, { "entropy": 5.721679782867431, "epoch": 0.6500680801400506, "grad_norm": 1.46875, "learning_rate": 0.0004963173991542219, "loss": 5.531, "mean_token_accuracy": 0.16181753277778627, "num_tokens": 14502123.0, "step": 8355 }, { "entropy": 5.621743965148926, "epoch": 0.6504571095117682, "grad_norm": 1.6171875, "learning_rate": 0.0004963124035640746, "loss": 5.5046, "mean_token_accuracy": 0.16208697408437728, "num_tokens": 14510782.0, "step": 8360 }, { "entropy": 5.53667573928833, "epoch": 0.6508461388834857, "grad_norm": 1.5078125, "learning_rate": 0.0004963074046158637, "loss": 5.4504, "mean_token_accuracy": 0.1645912155508995, "num_tokens": 14518560.0, "step": 8365 }, { "entropy": 5.63091254234314, "epoch": 0.6512351682552032, "grad_norm": 1.453125, "learning_rate": 0.0004963024023096652, "loss": 5.4836, "mean_token_accuracy": 0.1586213417351246, "num_tokens": 14527541.0, "step": 8370 }, { "entropy": 5.679382848739624, "epoch": 0.6516241976269208, "grad_norm": 1.453125, "learning_rate": 0.0004962973966455551, "loss": 5.5212, "mean_token_accuracy": 0.16429576873779297, "num_tokens": 14535590.0, "step": 8375 }, { "entropy": 5.476749753952026, "epoch": 0.6520132269986384, "grad_norm": 1.453125, "learning_rate": 0.0004962923876236092, "loss": 5.4237, "mean_token_accuracy": 0.15991545766592025, "num_tokens": 14544929.0, "step": 8380 }, { "entropy": 5.631164979934693, "epoch": 0.652402256370356, "grad_norm": 1.34375, "learning_rate": 0.0004962873752439035, "loss": 5.5858, "mean_token_accuracy": 0.1527818873524666, "num_tokens": 14553883.0, "step": 8385 }, { "entropy": 5.696902561187744, "epoch": 0.6527912857420736, "grad_norm": 1.6640625, "learning_rate": 0.0004962823595065141, "loss": 5.6022, "mean_token_accuracy": 0.15535233467817305, "num_tokens": 14563085.0, "step": 8390 }, { "entropy": 5.681191062927246, "epoch": 0.653180315113791, "grad_norm": 1.4453125, "learning_rate": 0.0004962773404115172, "loss": 5.4552, "mean_token_accuracy": 0.16444580256938934, "num_tokens": 14571444.0, "step": 8395 }, { "entropy": 5.63764533996582, "epoch": 0.6535693444855086, "grad_norm": 1.3671875, "learning_rate": 0.0004962723179589886, "loss": 5.5539, "mean_token_accuracy": 0.16111520528793336, "num_tokens": 14580039.0, "step": 8400 }, { "entropy": 5.579935073852539, "epoch": 0.6539583738572262, "grad_norm": 1.5859375, "learning_rate": 0.000496267292149005, "loss": 5.4336, "mean_token_accuracy": 0.16800265163183212, "num_tokens": 14588322.0, "step": 8405 }, { "entropy": 5.57730073928833, "epoch": 0.6543474032289438, "grad_norm": 1.4609375, "learning_rate": 0.0004962622629816423, "loss": 5.3722, "mean_token_accuracy": 0.1650988057255745, "num_tokens": 14597503.0, "step": 8410 }, { "entropy": 5.609830713272094, "epoch": 0.6547364326006614, "grad_norm": 1.703125, "learning_rate": 0.000496257230456977, "loss": 5.5037, "mean_token_accuracy": 0.15908412784337997, "num_tokens": 14605804.0, "step": 8415 }, { "entropy": 5.462103652954101, "epoch": 0.6551254619723789, "grad_norm": 1.4375, "learning_rate": 0.0004962521945750855, "loss": 5.4273, "mean_token_accuracy": 0.17144200950860977, "num_tokens": 14614064.0, "step": 8420 }, { "entropy": 5.612936496734619, "epoch": 0.6555144913440965, "grad_norm": 1.5078125, "learning_rate": 0.000496247155336044, "loss": 5.4338, "mean_token_accuracy": 0.16576751172542573, "num_tokens": 14622231.0, "step": 8425 }, { "entropy": 5.623867321014404, "epoch": 0.655903520715814, "grad_norm": 1.5859375, "learning_rate": 0.0004962421127399291, "loss": 5.5545, "mean_token_accuracy": 0.1569196030497551, "num_tokens": 14631244.0, "step": 8430 }, { "entropy": 5.587360048294068, "epoch": 0.6562925500875316, "grad_norm": 1.6796875, "learning_rate": 0.0004962370667868172, "loss": 5.4267, "mean_token_accuracy": 0.16126427203416824, "num_tokens": 14639575.0, "step": 8435 }, { "entropy": 5.58545503616333, "epoch": 0.6566815794592492, "grad_norm": 1.3671875, "learning_rate": 0.0004962320174767851, "loss": 5.4756, "mean_token_accuracy": 0.15965766459703445, "num_tokens": 14648810.0, "step": 8440 }, { "entropy": 5.555451202392578, "epoch": 0.6570706088309667, "grad_norm": 1.4375, "learning_rate": 0.000496226964809909, "loss": 5.3258, "mean_token_accuracy": 0.17258747071027755, "num_tokens": 14657783.0, "step": 8445 }, { "entropy": 5.624908018112182, "epoch": 0.6574596382026843, "grad_norm": 1.546875, "learning_rate": 0.000496221908786266, "loss": 5.5276, "mean_token_accuracy": 0.15910668671131134, "num_tokens": 14666872.0, "step": 8450 }, { "entropy": 5.645132446289063, "epoch": 0.6578486675744019, "grad_norm": 1.71875, "learning_rate": 0.0004962168494059327, "loss": 5.6502, "mean_token_accuracy": 0.1516483262181282, "num_tokens": 14675762.0, "step": 8455 }, { "entropy": 5.561020088195801, "epoch": 0.6582376969461194, "grad_norm": 1.7734375, "learning_rate": 0.0004962117866689857, "loss": 5.3148, "mean_token_accuracy": 0.169151408970356, "num_tokens": 14683928.0, "step": 8460 }, { "entropy": 5.6118079662323, "epoch": 0.658626726317837, "grad_norm": 1.90625, "learning_rate": 0.000496206720575502, "loss": 5.5508, "mean_token_accuracy": 0.15828213691711426, "num_tokens": 14692411.0, "step": 8465 }, { "entropy": 5.686123466491699, "epoch": 0.6590157556895546, "grad_norm": 1.4375, "learning_rate": 0.0004962016511255584, "loss": 5.5501, "mean_token_accuracy": 0.15016385316848754, "num_tokens": 14701002.0, "step": 8470 }, { "entropy": 5.7460590362548825, "epoch": 0.6594047850612721, "grad_norm": 2.0625, "learning_rate": 0.0004961965783192318, "loss": 5.605, "mean_token_accuracy": 0.15275918543338776, "num_tokens": 14710172.0, "step": 8475 }, { "entropy": 5.595785903930664, "epoch": 0.6597938144329897, "grad_norm": 1.671875, "learning_rate": 0.0004961915021565992, "loss": 5.5364, "mean_token_accuracy": 0.15851985067129135, "num_tokens": 14719446.0, "step": 8480 }, { "entropy": 5.684946155548095, "epoch": 0.6601828438047073, "grad_norm": 1.453125, "learning_rate": 0.0004961864226377377, "loss": 5.5389, "mean_token_accuracy": 0.1646391198039055, "num_tokens": 14728193.0, "step": 8485 }, { "entropy": 5.620755958557129, "epoch": 0.6605718731764249, "grad_norm": 1.3515625, "learning_rate": 0.0004961813397627241, "loss": 5.434, "mean_token_accuracy": 0.15734331607818602, "num_tokens": 14736930.0, "step": 8490 }, { "entropy": 5.5294873237609865, "epoch": 0.6609609025481424, "grad_norm": 1.8046875, "learning_rate": 0.0004961762535316358, "loss": 5.4386, "mean_token_accuracy": 0.1667746901512146, "num_tokens": 14745995.0, "step": 8495 }, { "entropy": 5.519912528991699, "epoch": 0.6613499319198599, "grad_norm": 2.59375, "learning_rate": 0.0004961711639445499, "loss": 5.488, "mean_token_accuracy": 0.1612710624933243, "num_tokens": 14754827.0, "step": 8500 }, { "entropy": 5.717486047744751, "epoch": 0.6617389612915775, "grad_norm": 1.546875, "learning_rate": 0.0004961660710015435, "loss": 5.5755, "mean_token_accuracy": 0.15806931331753732, "num_tokens": 14763594.0, "step": 8505 }, { "entropy": 5.6062768459320065, "epoch": 0.6621279906632951, "grad_norm": 1.8984375, "learning_rate": 0.0004961609747026943, "loss": 5.3934, "mean_token_accuracy": 0.16947395503520965, "num_tokens": 14772366.0, "step": 8510 }, { "entropy": 5.5509490966796875, "epoch": 0.6625170200350127, "grad_norm": 1.8046875, "learning_rate": 0.0004961558750480791, "loss": 5.4908, "mean_token_accuracy": 0.1578017368912697, "num_tokens": 14780738.0, "step": 8515 }, { "entropy": 5.560414981842041, "epoch": 0.6629060494067303, "grad_norm": 1.5078125, "learning_rate": 0.0004961507720377756, "loss": 5.4666, "mean_token_accuracy": 0.15795683562755586, "num_tokens": 14788982.0, "step": 8520 }, { "entropy": 5.602201271057129, "epoch": 0.6632950787784477, "grad_norm": 1.5078125, "learning_rate": 0.0004961456656718611, "loss": 5.4556, "mean_token_accuracy": 0.1655229315161705, "num_tokens": 14797832.0, "step": 8525 }, { "entropy": 5.638581800460815, "epoch": 0.6636841081501653, "grad_norm": 1.6015625, "learning_rate": 0.000496140555950413, "loss": 5.4978, "mean_token_accuracy": 0.16762352734804153, "num_tokens": 14806391.0, "step": 8530 }, { "entropy": 5.6750490188598635, "epoch": 0.6640731375218829, "grad_norm": 1.4609375, "learning_rate": 0.0004961354428735091, "loss": 5.5066, "mean_token_accuracy": 0.1556483417749405, "num_tokens": 14814920.0, "step": 8535 }, { "entropy": 5.574772119522095, "epoch": 0.6644621668936005, "grad_norm": 1.6015625, "learning_rate": 0.0004961303264412267, "loss": 5.4551, "mean_token_accuracy": 0.16089894473552704, "num_tokens": 14823541.0, "step": 8540 }, { "entropy": 5.581590223312378, "epoch": 0.6648511962653181, "grad_norm": 1.53125, "learning_rate": 0.0004961252066536437, "loss": 5.4229, "mean_token_accuracy": 0.1616658866405487, "num_tokens": 14832128.0, "step": 8545 }, { "entropy": 5.636154460906982, "epoch": 0.6652402256370356, "grad_norm": 1.4609375, "learning_rate": 0.0004961200835108375, "loss": 5.5883, "mean_token_accuracy": 0.15480114370584488, "num_tokens": 14841434.0, "step": 8550 }, { "entropy": 5.655720949172974, "epoch": 0.6656292550087531, "grad_norm": 1.734375, "learning_rate": 0.000496114957012886, "loss": 5.4972, "mean_token_accuracy": 0.16742078512907027, "num_tokens": 14850255.0, "step": 8555 }, { "entropy": 5.625656604766846, "epoch": 0.6660182843804707, "grad_norm": 1.390625, "learning_rate": 0.0004961098271598671, "loss": 5.5812, "mean_token_accuracy": 0.1552358813583851, "num_tokens": 14858924.0, "step": 8560 }, { "entropy": 5.646219539642334, "epoch": 0.6664073137521883, "grad_norm": 1.609375, "learning_rate": 0.0004961046939518585, "loss": 5.5106, "mean_token_accuracy": 0.16416953057050704, "num_tokens": 14867426.0, "step": 8565 }, { "entropy": 5.699926424026489, "epoch": 0.6667963431239059, "grad_norm": 1.515625, "learning_rate": 0.0004960995573889379, "loss": 5.4714, "mean_token_accuracy": 0.16506651192903518, "num_tokens": 14876218.0, "step": 8570 }, { "entropy": 5.671121644973755, "epoch": 0.6671853724956234, "grad_norm": 1.359375, "learning_rate": 0.0004960944174711836, "loss": 5.5289, "mean_token_accuracy": 0.15950822383165358, "num_tokens": 14883995.0, "step": 8575 }, { "entropy": 5.540333652496338, "epoch": 0.667574401867341, "grad_norm": 1.46875, "learning_rate": 0.0004960892741986734, "loss": 5.5014, "mean_token_accuracy": 0.1624891757965088, "num_tokens": 14892659.0, "step": 8580 }, { "entropy": 5.664654541015625, "epoch": 0.6679634312390585, "grad_norm": 1.4609375, "learning_rate": 0.0004960841275714853, "loss": 5.5264, "mean_token_accuracy": 0.15727367997169495, "num_tokens": 14901518.0, "step": 8585 }, { "entropy": 5.607156229019165, "epoch": 0.6683524606107761, "grad_norm": 1.6484375, "learning_rate": 0.0004960789775896975, "loss": 5.509, "mean_token_accuracy": 0.16244361102581023, "num_tokens": 14910171.0, "step": 8590 }, { "entropy": 5.604865503311157, "epoch": 0.6687414899824937, "grad_norm": 1.4453125, "learning_rate": 0.0004960738242533881, "loss": 5.4873, "mean_token_accuracy": 0.16071989834308625, "num_tokens": 14918651.0, "step": 8595 }, { "entropy": 5.5974328994750975, "epoch": 0.6691305193542112, "grad_norm": 1.8984375, "learning_rate": 0.0004960686675626353, "loss": 5.4889, "mean_token_accuracy": 0.15908095240592957, "num_tokens": 14926951.0, "step": 8600 }, { "entropy": 5.726441287994385, "epoch": 0.6695195487259288, "grad_norm": 1.6328125, "learning_rate": 0.0004960635075175173, "loss": 5.5811, "mean_token_accuracy": 0.15933732837438583, "num_tokens": 14935528.0, "step": 8605 }, { "entropy": 5.610484170913696, "epoch": 0.6699085780976464, "grad_norm": 1.3515625, "learning_rate": 0.0004960583441181124, "loss": 5.4549, "mean_token_accuracy": 0.16408660262823105, "num_tokens": 14944117.0, "step": 8610 }, { "entropy": 5.582907962799072, "epoch": 0.670297607469364, "grad_norm": 1.546875, "learning_rate": 0.0004960531773644992, "loss": 5.4265, "mean_token_accuracy": 0.16474046409130097, "num_tokens": 14952957.0, "step": 8615 }, { "entropy": 5.647277021408081, "epoch": 0.6706866368410815, "grad_norm": 1.640625, "learning_rate": 0.0004960480072567557, "loss": 5.5077, "mean_token_accuracy": 0.15832734555006028, "num_tokens": 14960942.0, "step": 8620 }, { "entropy": 5.688439846038818, "epoch": 0.671075666212799, "grad_norm": 1.734375, "learning_rate": 0.0004960428337949604, "loss": 5.6049, "mean_token_accuracy": 0.1537842944264412, "num_tokens": 14970579.0, "step": 8625 }, { "entropy": 5.594122982025146, "epoch": 0.6714646955845166, "grad_norm": 1.8671875, "learning_rate": 0.0004960376569791921, "loss": 5.4374, "mean_token_accuracy": 0.15769007354974746, "num_tokens": 14979353.0, "step": 8630 }, { "entropy": 5.67335877418518, "epoch": 0.6718537249562342, "grad_norm": 1.953125, "learning_rate": 0.0004960324768095291, "loss": 5.6024, "mean_token_accuracy": 0.16516705453395844, "num_tokens": 14988435.0, "step": 8635 }, { "entropy": 5.647039937973022, "epoch": 0.6722427543279518, "grad_norm": 2.15625, "learning_rate": 0.0004960272932860502, "loss": 5.5194, "mean_token_accuracy": 0.15829846411943435, "num_tokens": 14996834.0, "step": 8640 }, { "entropy": 5.670257425308227, "epoch": 0.6726317836996694, "grad_norm": 1.6640625, "learning_rate": 0.0004960221064088338, "loss": 5.5703, "mean_token_accuracy": 0.15692353248596191, "num_tokens": 15004988.0, "step": 8645 }, { "entropy": 5.666182184219361, "epoch": 0.6730208130713868, "grad_norm": 1.515625, "learning_rate": 0.0004960169161779588, "loss": 5.5264, "mean_token_accuracy": 0.1628352239727974, "num_tokens": 15013482.0, "step": 8650 }, { "entropy": 5.591054677963257, "epoch": 0.6734098424431044, "grad_norm": 1.484375, "learning_rate": 0.0004960117225935038, "loss": 5.4371, "mean_token_accuracy": 0.16409590989351272, "num_tokens": 15021506.0, "step": 8655 }, { "entropy": 5.586325979232788, "epoch": 0.673798871814822, "grad_norm": 1.46875, "learning_rate": 0.0004960065256555477, "loss": 5.4772, "mean_token_accuracy": 0.16757019460201264, "num_tokens": 15029880.0, "step": 8660 }, { "entropy": 5.585851573944092, "epoch": 0.6741879011865396, "grad_norm": 1.5078125, "learning_rate": 0.0004960013253641695, "loss": 5.4672, "mean_token_accuracy": 0.16203958690166473, "num_tokens": 15038080.0, "step": 8665 }, { "entropy": 5.597144031524659, "epoch": 0.6745769305582572, "grad_norm": 1.59375, "learning_rate": 0.0004959961217194477, "loss": 5.4829, "mean_token_accuracy": 0.1624331921339035, "num_tokens": 15046779.0, "step": 8670 }, { "entropy": 5.656364631652832, "epoch": 0.6749659599299748, "grad_norm": 1.5234375, "learning_rate": 0.0004959909147214615, "loss": 5.5129, "mean_token_accuracy": 0.15865243524312972, "num_tokens": 15055557.0, "step": 8675 }, { "entropy": 5.579842853546142, "epoch": 0.6753549893016922, "grad_norm": 1.59375, "learning_rate": 0.0004959857043702902, "loss": 5.3801, "mean_token_accuracy": 0.1640066534280777, "num_tokens": 15063054.0, "step": 8680 }, { "entropy": 5.585133504867554, "epoch": 0.6757440186734098, "grad_norm": 1.40625, "learning_rate": 0.0004959804906660124, "loss": 5.4688, "mean_token_accuracy": 0.16473619192838668, "num_tokens": 15071510.0, "step": 8685 }, { "entropy": 5.563712930679321, "epoch": 0.6761330480451274, "grad_norm": 1.5546875, "learning_rate": 0.0004959752736087073, "loss": 5.4888, "mean_token_accuracy": 0.1553959906101227, "num_tokens": 15080524.0, "step": 8690 }, { "entropy": 5.669127082824707, "epoch": 0.676522077416845, "grad_norm": 1.703125, "learning_rate": 0.0004959700531984543, "loss": 5.5237, "mean_token_accuracy": 0.15884414985775946, "num_tokens": 15089689.0, "step": 8695 }, { "entropy": 5.576257514953613, "epoch": 0.6769111067885626, "grad_norm": 1.5546875, "learning_rate": 0.0004959648294353324, "loss": 5.4073, "mean_token_accuracy": 0.16998513787984848, "num_tokens": 15097970.0, "step": 8700 }, { "entropy": 5.54570426940918, "epoch": 0.6773001361602801, "grad_norm": 2.15625, "learning_rate": 0.0004959596023194208, "loss": 5.509, "mean_token_accuracy": 0.15639949291944505, "num_tokens": 15107786.0, "step": 8705 }, { "entropy": 5.655686950683593, "epoch": 0.6776891655319977, "grad_norm": 1.7265625, "learning_rate": 0.000495954371850799, "loss": 5.4862, "mean_token_accuracy": 0.16529091447591782, "num_tokens": 15116370.0, "step": 8710 }, { "entropy": 5.68412218093872, "epoch": 0.6780781949037152, "grad_norm": 1.6953125, "learning_rate": 0.0004959491380295463, "loss": 5.5175, "mean_token_accuracy": 0.15937916487455367, "num_tokens": 15124961.0, "step": 8715 }, { "entropy": 5.645760822296142, "epoch": 0.6784672242754328, "grad_norm": 2.609375, "learning_rate": 0.0004959439008557422, "loss": 5.5278, "mean_token_accuracy": 0.15579134672880174, "num_tokens": 15134230.0, "step": 8720 }, { "entropy": 5.597600364685059, "epoch": 0.6788562536471504, "grad_norm": 1.53125, "learning_rate": 0.000495938660329466, "loss": 5.4762, "mean_token_accuracy": 0.15846306532621385, "num_tokens": 15143585.0, "step": 8725 }, { "entropy": 5.5997742176055905, "epoch": 0.6792452830188679, "grad_norm": 1.984375, "learning_rate": 0.0004959334164507973, "loss": 5.3996, "mean_token_accuracy": 0.15709985047578812, "num_tokens": 15151834.0, "step": 8730 }, { "entropy": 5.526013803482056, "epoch": 0.6796343123905855, "grad_norm": 1.5390625, "learning_rate": 0.0004959281692198155, "loss": 5.459, "mean_token_accuracy": 0.15873907804489135, "num_tokens": 15160630.0, "step": 8735 }, { "entropy": 5.591261196136474, "epoch": 0.6800233417623031, "grad_norm": 1.8125, "learning_rate": 0.0004959229186366007, "loss": 5.4203, "mean_token_accuracy": 0.16888799667358398, "num_tokens": 15168999.0, "step": 8740 }, { "entropy": 5.640165138244629, "epoch": 0.6804123711340206, "grad_norm": 1.5703125, "learning_rate": 0.000495917664701232, "loss": 5.4996, "mean_token_accuracy": 0.16761998534202577, "num_tokens": 15177507.0, "step": 8745 }, { "entropy": 5.663268566131592, "epoch": 0.6808014005057382, "grad_norm": 1.4453125, "learning_rate": 0.0004959124074137894, "loss": 5.5497, "mean_token_accuracy": 0.15307750552892685, "num_tokens": 15186843.0, "step": 8750 }, { "entropy": 5.590552043914795, "epoch": 0.6811904298774557, "grad_norm": 1.640625, "learning_rate": 0.0004959071467743526, "loss": 5.4358, "mean_token_accuracy": 0.16405264288187027, "num_tokens": 15195081.0, "step": 8755 }, { "entropy": 5.632944202423095, "epoch": 0.6815794592491733, "grad_norm": 1.5390625, "learning_rate": 0.0004959018827830016, "loss": 5.5331, "mean_token_accuracy": 0.16543604135513307, "num_tokens": 15203538.0, "step": 8760 }, { "entropy": 5.714319372177124, "epoch": 0.6819684886208909, "grad_norm": 1.75, "learning_rate": 0.000495896615439816, "loss": 5.5638, "mean_token_accuracy": 0.15726466104388237, "num_tokens": 15211845.0, "step": 8765 }, { "entropy": 5.64163293838501, "epoch": 0.6823575179926085, "grad_norm": 1.53125, "learning_rate": 0.0004958913447448759, "loss": 5.5604, "mean_token_accuracy": 0.16496984660625458, "num_tokens": 15220128.0, "step": 8770 }, { "entropy": 5.609681749343872, "epoch": 0.682746547364326, "grad_norm": 1.6015625, "learning_rate": 0.0004958860706982613, "loss": 5.5371, "mean_token_accuracy": 0.1546408787369728, "num_tokens": 15228741.0, "step": 8775 }, { "entropy": 5.650665616989135, "epoch": 0.6831355767360435, "grad_norm": 1.8046875, "learning_rate": 0.000495880793300052, "loss": 5.5375, "mean_token_accuracy": 0.1545580267906189, "num_tokens": 15237674.0, "step": 8780 }, { "entropy": 5.608680534362793, "epoch": 0.6835246061077611, "grad_norm": 1.6640625, "learning_rate": 0.0004958755125503284, "loss": 5.4188, "mean_token_accuracy": 0.1603718653321266, "num_tokens": 15245727.0, "step": 8785 }, { "entropy": 5.636897563934326, "epoch": 0.6839136354794787, "grad_norm": 1.46875, "learning_rate": 0.0004958702284491703, "loss": 5.5221, "mean_token_accuracy": 0.1570213332772255, "num_tokens": 15254511.0, "step": 8790 }, { "entropy": 5.611495447158814, "epoch": 0.6843026648511963, "grad_norm": 1.390625, "learning_rate": 0.0004958649409966581, "loss": 5.4847, "mean_token_accuracy": 0.160319522023201, "num_tokens": 15263500.0, "step": 8795 }, { "entropy": 5.60971474647522, "epoch": 0.6846916942229139, "grad_norm": 1.4921875, "learning_rate": 0.000495859650192872, "loss": 5.4799, "mean_token_accuracy": 0.16392674893140793, "num_tokens": 15271960.0, "step": 8800 }, { "entropy": 5.703287553787232, "epoch": 0.6850807235946313, "grad_norm": 1.4296875, "learning_rate": 0.0004958543560378922, "loss": 5.6659, "mean_token_accuracy": 0.15225871056318283, "num_tokens": 15280576.0, "step": 8805 }, { "entropy": 5.663115358352661, "epoch": 0.6854697529663489, "grad_norm": 1.4609375, "learning_rate": 0.0004958490585317991, "loss": 5.5318, "mean_token_accuracy": 0.1648571327328682, "num_tokens": 15288674.0, "step": 8810 }, { "entropy": 5.625303268432617, "epoch": 0.6858587823380665, "grad_norm": 1.828125, "learning_rate": 0.000495843757674673, "loss": 5.4181, "mean_token_accuracy": 0.16334908306598664, "num_tokens": 15296881.0, "step": 8815 }, { "entropy": 5.608910036087036, "epoch": 0.6862478117097841, "grad_norm": 1.4765625, "learning_rate": 0.0004958384534665945, "loss": 5.4782, "mean_token_accuracy": 0.16224911957979202, "num_tokens": 15305379.0, "step": 8820 }, { "entropy": 5.6033713817596436, "epoch": 0.6866368410815017, "grad_norm": 1.4296875, "learning_rate": 0.0004958331459076438, "loss": 5.5691, "mean_token_accuracy": 0.15493535324931146, "num_tokens": 15314572.0, "step": 8825 }, { "entropy": 5.63705039024353, "epoch": 0.6870258704532192, "grad_norm": 1.359375, "learning_rate": 0.0004958278349979018, "loss": 5.5418, "mean_token_accuracy": 0.15657844468951226, "num_tokens": 15323407.0, "step": 8830 }, { "entropy": 5.627943754196167, "epoch": 0.6874148998249368, "grad_norm": 1.34375, "learning_rate": 0.0004958225207374488, "loss": 5.4151, "mean_token_accuracy": 0.15650082528591155, "num_tokens": 15332208.0, "step": 8835 }, { "entropy": 5.583755350112915, "epoch": 0.6878039291966543, "grad_norm": 1.3984375, "learning_rate": 0.0004958172031263655, "loss": 5.4595, "mean_token_accuracy": 0.1620849221944809, "num_tokens": 15340972.0, "step": 8840 }, { "entropy": 5.57933497428894, "epoch": 0.6881929585683719, "grad_norm": 1.4609375, "learning_rate": 0.0004958118821647326, "loss": 5.4426, "mean_token_accuracy": 0.1666816309094429, "num_tokens": 15349991.0, "step": 8845 }, { "entropy": 5.530833578109741, "epoch": 0.6885819879400895, "grad_norm": 1.4453125, "learning_rate": 0.0004958065578526308, "loss": 5.3791, "mean_token_accuracy": 0.17523722350597382, "num_tokens": 15358194.0, "step": 8850 }, { "entropy": 5.619156074523926, "epoch": 0.688971017311807, "grad_norm": 1.7109375, "learning_rate": 0.000495801230190141, "loss": 5.4257, "mean_token_accuracy": 0.163530196249485, "num_tokens": 15366954.0, "step": 8855 }, { "entropy": 5.704611015319824, "epoch": 0.6893600466835246, "grad_norm": 1.4296875, "learning_rate": 0.0004957958991773441, "loss": 5.6093, "mean_token_accuracy": 0.15734027922153473, "num_tokens": 15376107.0, "step": 8860 }, { "entropy": 5.599389457702637, "epoch": 0.6897490760552422, "grad_norm": 1.421875, "learning_rate": 0.0004957905648143206, "loss": 5.4884, "mean_token_accuracy": 0.16068901717662812, "num_tokens": 15384517.0, "step": 8865 }, { "entropy": 5.707489633560181, "epoch": 0.6901381054269597, "grad_norm": 1.5234375, "learning_rate": 0.0004957852271011519, "loss": 5.6396, "mean_token_accuracy": 0.15333401635289193, "num_tokens": 15393544.0, "step": 8870 }, { "entropy": 5.63929591178894, "epoch": 0.6905271347986773, "grad_norm": 1.828125, "learning_rate": 0.0004957798860379187, "loss": 5.4442, "mean_token_accuracy": 0.1683732807636261, "num_tokens": 15402165.0, "step": 8875 }, { "entropy": 5.622973155975342, "epoch": 0.6909161641703949, "grad_norm": 1.4765625, "learning_rate": 0.0004957745416247022, "loss": 5.4916, "mean_token_accuracy": 0.1617909163236618, "num_tokens": 15411430.0, "step": 8880 }, { "entropy": 5.629455804824829, "epoch": 0.6913051935421124, "grad_norm": 1.453125, "learning_rate": 0.0004957691938615833, "loss": 5.4046, "mean_token_accuracy": 0.16690257638692857, "num_tokens": 15420346.0, "step": 8885 }, { "entropy": 5.520572233200073, "epoch": 0.69169422291383, "grad_norm": 1.4765625, "learning_rate": 0.0004957638427486434, "loss": 5.3353, "mean_token_accuracy": 0.17267585545778275, "num_tokens": 15428747.0, "step": 8890 }, { "entropy": 5.414216136932373, "epoch": 0.6920832522855476, "grad_norm": 1.546875, "learning_rate": 0.0004957584882859636, "loss": 5.3316, "mean_token_accuracy": 0.16797439754009247, "num_tokens": 15437110.0, "step": 8895 }, { "entropy": 5.571062803268433, "epoch": 0.6924722816572652, "grad_norm": 1.46875, "learning_rate": 0.0004957531304736251, "loss": 5.4768, "mean_token_accuracy": 0.16320954859256745, "num_tokens": 15446524.0, "step": 8900 }, { "entropy": 5.65091347694397, "epoch": 0.6928613110289827, "grad_norm": 1.40625, "learning_rate": 0.0004957477693117091, "loss": 5.5152, "mean_token_accuracy": 0.1618165910243988, "num_tokens": 15455372.0, "step": 8905 }, { "entropy": 5.650473690032959, "epoch": 0.6932503404007002, "grad_norm": 1.5703125, "learning_rate": 0.0004957424048002971, "loss": 5.4078, "mean_token_accuracy": 0.16240484565496444, "num_tokens": 15463060.0, "step": 8910 }, { "entropy": 5.531956577301026, "epoch": 0.6936393697724178, "grad_norm": 1.40625, "learning_rate": 0.0004957370369394706, "loss": 5.5246, "mean_token_accuracy": 0.1603606067597866, "num_tokens": 15471836.0, "step": 8915 }, { "entropy": 5.662734794616699, "epoch": 0.6940283991441354, "grad_norm": 1.421875, "learning_rate": 0.0004957316657293107, "loss": 5.5207, "mean_token_accuracy": 0.16369528323411942, "num_tokens": 15479819.0, "step": 8920 }, { "entropy": 5.639108276367187, "epoch": 0.694417428515853, "grad_norm": 1.6328125, "learning_rate": 0.0004957262911698992, "loss": 5.5088, "mean_token_accuracy": 0.16640071272850038, "num_tokens": 15488562.0, "step": 8925 }, { "entropy": 5.617952966690064, "epoch": 0.6948064578875706, "grad_norm": 1.34375, "learning_rate": 0.0004957209132613175, "loss": 5.5899, "mean_token_accuracy": 0.15694498494267464, "num_tokens": 15497822.0, "step": 8930 }, { "entropy": 5.66477222442627, "epoch": 0.695195487259288, "grad_norm": 1.4765625, "learning_rate": 0.0004957155320036473, "loss": 5.5297, "mean_token_accuracy": 0.15420645251870155, "num_tokens": 15506913.0, "step": 8935 }, { "entropy": 5.650326061248779, "epoch": 0.6955845166310056, "grad_norm": 1.3125, "learning_rate": 0.0004957101473969702, "loss": 5.4725, "mean_token_accuracy": 0.1661776825785637, "num_tokens": 15516053.0, "step": 8940 }, { "entropy": 5.649831771850586, "epoch": 0.6959735460027232, "grad_norm": 1.453125, "learning_rate": 0.000495704759441368, "loss": 5.5135, "mean_token_accuracy": 0.15613418817520142, "num_tokens": 15524174.0, "step": 8945 }, { "entropy": 5.603764915466309, "epoch": 0.6963625753744408, "grad_norm": 1.5, "learning_rate": 0.0004956993681369221, "loss": 5.4317, "mean_token_accuracy": 0.16271826028823852, "num_tokens": 15533652.0, "step": 8950 }, { "entropy": 5.661756324768066, "epoch": 0.6967516047461584, "grad_norm": 1.40625, "learning_rate": 0.0004956939734837148, "loss": 5.4747, "mean_token_accuracy": 0.16325116157531738, "num_tokens": 15541644.0, "step": 8955 }, { "entropy": 5.509464406967163, "epoch": 0.6971406341178759, "grad_norm": 1.484375, "learning_rate": 0.0004956885754818277, "loss": 5.432, "mean_token_accuracy": 0.17381385564804078, "num_tokens": 15550298.0, "step": 8960 }, { "entropy": 5.629638576507569, "epoch": 0.6975296634895934, "grad_norm": 1.421875, "learning_rate": 0.0004956831741313427, "loss": 5.5018, "mean_token_accuracy": 0.1647512845695019, "num_tokens": 15559388.0, "step": 8965 }, { "entropy": 5.500730657577515, "epoch": 0.697918692861311, "grad_norm": 1.4296875, "learning_rate": 0.0004956777694323418, "loss": 5.3335, "mean_token_accuracy": 0.16650238931179046, "num_tokens": 15567543.0, "step": 8970 }, { "entropy": 5.505261754989624, "epoch": 0.6983077222330286, "grad_norm": 1.5625, "learning_rate": 0.000495672361384907, "loss": 5.4324, "mean_token_accuracy": 0.1692634642124176, "num_tokens": 15575365.0, "step": 8975 }, { "entropy": 5.681888818740845, "epoch": 0.6986967516047462, "grad_norm": 1.3125, "learning_rate": 0.0004956669499891202, "loss": 5.4978, "mean_token_accuracy": 0.16197374761104583, "num_tokens": 15584295.0, "step": 8980 }, { "entropy": 5.666158962249756, "epoch": 0.6990857809764637, "grad_norm": 1.453125, "learning_rate": 0.0004956615352450639, "loss": 5.5156, "mean_token_accuracy": 0.17047316581010818, "num_tokens": 15592906.0, "step": 8985 }, { "entropy": 5.530295705795288, "epoch": 0.6994748103481813, "grad_norm": 1.875, "learning_rate": 0.0004956561171528198, "loss": 5.4542, "mean_token_accuracy": 0.15547731518745422, "num_tokens": 15601938.0, "step": 8990 }, { "entropy": 5.546193027496338, "epoch": 0.6998638397198989, "grad_norm": 1.53125, "learning_rate": 0.0004956506957124704, "loss": 5.4481, "mean_token_accuracy": 0.16723582297563552, "num_tokens": 15610173.0, "step": 8995 }, { "entropy": 5.643675851821899, "epoch": 0.7002528690916164, "grad_norm": 1.5, "learning_rate": 0.000495645270924098, "loss": 5.5277, "mean_token_accuracy": 0.15238175243139268, "num_tokens": 15618896.0, "step": 9000 }, { "epoch": 0.7002528690916164, "eval_entropy": 5.48892997332326, "eval_loss": 5.537880897521973, "eval_mean_token_accuracy": 0.16768242414104928, "eval_num_tokens": 15618896.0, "eval_runtime": 28.6719, "eval_samples_per_second": 1449.435, "eval_steps_per_second": 181.188, "step": 9000 }, { "entropy": 5.598692321777344, "epoch": 0.700641898463334, "grad_norm": 1.34375, "learning_rate": 0.0004956398427877847, "loss": 5.446, "mean_token_accuracy": 0.16387993842363358, "num_tokens": 15627890.0, "step": 9005 }, { "entropy": 5.573201608657837, "epoch": 0.7010309278350515, "grad_norm": 1.609375, "learning_rate": 0.000495634411303613, "loss": 5.3828, "mean_token_accuracy": 0.1656647354364395, "num_tokens": 15636290.0, "step": 9010 }, { "entropy": 5.572251892089843, "epoch": 0.7014199572067691, "grad_norm": 1.515625, "learning_rate": 0.0004956289764716654, "loss": 5.4455, "mean_token_accuracy": 0.16509263068437577, "num_tokens": 15644777.0, "step": 9015 }, { "entropy": 5.600341558456421, "epoch": 0.7018089865784867, "grad_norm": 1.7109375, "learning_rate": 0.0004956235382920241, "loss": 5.4793, "mean_token_accuracy": 0.15838624760508538, "num_tokens": 15653333.0, "step": 9020 }, { "entropy": 5.6746580600738525, "epoch": 0.7021980159502043, "grad_norm": 1.359375, "learning_rate": 0.0004956180967647717, "loss": 5.4714, "mean_token_accuracy": 0.16225895434617996, "num_tokens": 15662140.0, "step": 9025 }, { "entropy": 5.617575931549072, "epoch": 0.7025870453219218, "grad_norm": 1.578125, "learning_rate": 0.0004956126518899911, "loss": 5.5609, "mean_token_accuracy": 0.1655264288187027, "num_tokens": 15671387.0, "step": 9030 }, { "entropy": 5.625704574584961, "epoch": 0.7029760746936393, "grad_norm": 1.390625, "learning_rate": 0.0004956072036677644, "loss": 5.4991, "mean_token_accuracy": 0.1554996997117996, "num_tokens": 15680884.0, "step": 9035 }, { "entropy": 5.684255933761596, "epoch": 0.7033651040653569, "grad_norm": 1.515625, "learning_rate": 0.0004956017520981746, "loss": 5.4485, "mean_token_accuracy": 0.158163383603096, "num_tokens": 15690030.0, "step": 9040 }, { "entropy": 5.610305118560791, "epoch": 0.7037541334370745, "grad_norm": 1.6015625, "learning_rate": 0.0004955962971813044, "loss": 5.467, "mean_token_accuracy": 0.1622978761792183, "num_tokens": 15698260.0, "step": 9045 }, { "entropy": 5.518650770187378, "epoch": 0.7041431628087921, "grad_norm": 1.671875, "learning_rate": 0.0004955908389172364, "loss": 5.3716, "mean_token_accuracy": 0.17074191123247145, "num_tokens": 15706275.0, "step": 9050 }, { "entropy": 5.656791067123413, "epoch": 0.7045321921805097, "grad_norm": 1.6171875, "learning_rate": 0.0004955853773060536, "loss": 5.6008, "mean_token_accuracy": 0.16207863092422486, "num_tokens": 15715086.0, "step": 9055 }, { "entropy": 5.6516862392425535, "epoch": 0.7049212215522271, "grad_norm": 1.75, "learning_rate": 0.0004955799123478388, "loss": 5.4052, "mean_token_accuracy": 0.16449855417013168, "num_tokens": 15723931.0, "step": 9060 }, { "entropy": 5.590332937240601, "epoch": 0.7053102509239447, "grad_norm": 1.515625, "learning_rate": 0.0004955744440426748, "loss": 5.5517, "mean_token_accuracy": 0.16194690018892288, "num_tokens": 15732905.0, "step": 9065 }, { "entropy": 5.602451610565185, "epoch": 0.7056992802956623, "grad_norm": 1.5703125, "learning_rate": 0.0004955689723906448, "loss": 5.4469, "mean_token_accuracy": 0.1638907566666603, "num_tokens": 15742355.0, "step": 9070 }, { "entropy": 5.709460067749023, "epoch": 0.7060883096673799, "grad_norm": 1.4921875, "learning_rate": 0.0004955634973918318, "loss": 5.521, "mean_token_accuracy": 0.16189123094081878, "num_tokens": 15750924.0, "step": 9075 }, { "entropy": 5.617863130569458, "epoch": 0.7064773390390975, "grad_norm": 1.453125, "learning_rate": 0.0004955580190463186, "loss": 5.4484, "mean_token_accuracy": 0.16356792151927949, "num_tokens": 15759677.0, "step": 9080 }, { "entropy": 5.595055437088012, "epoch": 0.7068663684108151, "grad_norm": 1.53125, "learning_rate": 0.0004955525373541886, "loss": 5.4445, "mean_token_accuracy": 0.15860881954431533, "num_tokens": 15767875.0, "step": 9085 }, { "entropy": 5.545309209823609, "epoch": 0.7072553977825325, "grad_norm": 1.59375, "learning_rate": 0.0004955470523155249, "loss": 5.4341, "mean_token_accuracy": 0.16337229758501054, "num_tokens": 15776194.0, "step": 9090 }, { "entropy": 5.632459306716919, "epoch": 0.7076444271542501, "grad_norm": 1.6484375, "learning_rate": 0.0004955415639304107, "loss": 5.5201, "mean_token_accuracy": 0.16406060010194778, "num_tokens": 15784774.0, "step": 9095 }, { "entropy": 5.611529779434204, "epoch": 0.7080334565259677, "grad_norm": 1.390625, "learning_rate": 0.0004955360721989292, "loss": 5.3971, "mean_token_accuracy": 0.170825731754303, "num_tokens": 15793121.0, "step": 9100 }, { "entropy": 5.703958511352539, "epoch": 0.7084224858976853, "grad_norm": 1.53125, "learning_rate": 0.0004955305771211641, "loss": 5.6047, "mean_token_accuracy": 0.1560478091239929, "num_tokens": 15801518.0, "step": 9105 }, { "entropy": 5.6174711227417, "epoch": 0.7088115152694029, "grad_norm": 1.8046875, "learning_rate": 0.0004955250786971982, "loss": 5.3588, "mean_token_accuracy": 0.1709561228752136, "num_tokens": 15809602.0, "step": 9110 }, { "entropy": 5.60283932685852, "epoch": 0.7092005446411204, "grad_norm": 1.5859375, "learning_rate": 0.0004955195769271154, "loss": 5.5686, "mean_token_accuracy": 0.15899789780378343, "num_tokens": 15818529.0, "step": 9115 }, { "entropy": 5.648442792892456, "epoch": 0.709589574012838, "grad_norm": 1.6015625, "learning_rate": 0.0004955140718109991, "loss": 5.4401, "mean_token_accuracy": 0.173095266520977, "num_tokens": 15827176.0, "step": 9120 }, { "entropy": 5.634540843963623, "epoch": 0.7099786033845555, "grad_norm": 1.703125, "learning_rate": 0.0004955085633489326, "loss": 5.521, "mean_token_accuracy": 0.1553187772631645, "num_tokens": 15837095.0, "step": 9125 }, { "entropy": 5.575646877288818, "epoch": 0.7103676327562731, "grad_norm": 1.4375, "learning_rate": 0.0004955030515409997, "loss": 5.4907, "mean_token_accuracy": 0.16527149379253386, "num_tokens": 15845285.0, "step": 9130 }, { "entropy": 5.5941849708557125, "epoch": 0.7107566621279907, "grad_norm": 1.7578125, "learning_rate": 0.0004954975363872838, "loss": 5.4942, "mean_token_accuracy": 0.16929271966218948, "num_tokens": 15853468.0, "step": 9135 }, { "entropy": 5.637126636505127, "epoch": 0.7111456914997082, "grad_norm": 1.3515625, "learning_rate": 0.0004954920178878689, "loss": 5.431, "mean_token_accuracy": 0.16908954679965973, "num_tokens": 15861699.0, "step": 9140 }, { "entropy": 5.6686560153961185, "epoch": 0.7115347208714258, "grad_norm": 1.6796875, "learning_rate": 0.0004954864960428385, "loss": 5.5156, "mean_token_accuracy": 0.15655331686139107, "num_tokens": 15870401.0, "step": 9145 }, { "entropy": 5.5921454429626465, "epoch": 0.7119237502431434, "grad_norm": 1.3984375, "learning_rate": 0.0004954809708522765, "loss": 5.3192, "mean_token_accuracy": 0.17602779418230058, "num_tokens": 15878214.0, "step": 9150 }, { "entropy": 5.578209257125854, "epoch": 0.712312779614861, "grad_norm": 1.5546875, "learning_rate": 0.0004954754423162667, "loss": 5.5048, "mean_token_accuracy": 0.1651099443435669, "num_tokens": 15886581.0, "step": 9155 }, { "entropy": 5.6807318210601805, "epoch": 0.7127018089865785, "grad_norm": 1.375, "learning_rate": 0.000495469910434893, "loss": 5.6188, "mean_token_accuracy": 0.15459591150283813, "num_tokens": 15895748.0, "step": 9160 }, { "entropy": 5.697744464874267, "epoch": 0.713090838358296, "grad_norm": 1.546875, "learning_rate": 0.0004954643752082392, "loss": 5.4706, "mean_token_accuracy": 0.15997869968414308, "num_tokens": 15905030.0, "step": 9165 }, { "entropy": 5.5733599185943605, "epoch": 0.7134798677300136, "grad_norm": 1.5, "learning_rate": 0.0004954588366363896, "loss": 5.453, "mean_token_accuracy": 0.15960024297237396, "num_tokens": 15913430.0, "step": 9170 }, { "entropy": 5.546750068664551, "epoch": 0.7138688971017312, "grad_norm": 1.71875, "learning_rate": 0.0004954532947194279, "loss": 5.3884, "mean_token_accuracy": 0.16921509355306624, "num_tokens": 15921432.0, "step": 9175 }, { "entropy": 5.661558675765991, "epoch": 0.7142579264734488, "grad_norm": 1.53125, "learning_rate": 0.0004954477494574384, "loss": 5.4398, "mean_token_accuracy": 0.1639270529150963, "num_tokens": 15930159.0, "step": 9180 }, { "entropy": 5.588769388198853, "epoch": 0.7146469558451664, "grad_norm": 1.6796875, "learning_rate": 0.0004954422008505052, "loss": 5.5109, "mean_token_accuracy": 0.15652605295181274, "num_tokens": 15939911.0, "step": 9185 }, { "entropy": 5.568434810638427, "epoch": 0.7150359852168838, "grad_norm": 1.578125, "learning_rate": 0.0004954366488987125, "loss": 5.4305, "mean_token_accuracy": 0.16211689561605452, "num_tokens": 15948586.0, "step": 9190 }, { "entropy": 5.506918573379517, "epoch": 0.7154250145886014, "grad_norm": 1.609375, "learning_rate": 0.0004954310936021444, "loss": 5.3097, "mean_token_accuracy": 0.1671778976917267, "num_tokens": 15956818.0, "step": 9195 }, { "entropy": 5.614367055892944, "epoch": 0.715814043960319, "grad_norm": 1.53125, "learning_rate": 0.0004954255349608853, "loss": 5.5179, "mean_token_accuracy": 0.15673997849225998, "num_tokens": 15966027.0, "step": 9200 }, { "entropy": 5.669200229644775, "epoch": 0.7162030733320366, "grad_norm": 1.421875, "learning_rate": 0.0004954199729750198, "loss": 5.5671, "mean_token_accuracy": 0.1588587701320648, "num_tokens": 15975186.0, "step": 9205 }, { "entropy": 5.546558856964111, "epoch": 0.7165921027037542, "grad_norm": 1.6796875, "learning_rate": 0.0004954144076446318, "loss": 5.4239, "mean_token_accuracy": 0.1685514986515045, "num_tokens": 15983924.0, "step": 9210 }, { "entropy": 5.585919570922852, "epoch": 0.7169811320754716, "grad_norm": 1.484375, "learning_rate": 0.0004954088389698061, "loss": 5.4512, "mean_token_accuracy": 0.17108927965164183, "num_tokens": 15992906.0, "step": 9215 }, { "entropy": 5.5795739650726315, "epoch": 0.7173701614471892, "grad_norm": 1.5625, "learning_rate": 0.000495403266950627, "loss": 5.4739, "mean_token_accuracy": 0.16261557191610337, "num_tokens": 16001378.0, "step": 9220 }, { "entropy": 5.598306322097779, "epoch": 0.7177591908189068, "grad_norm": 1.328125, "learning_rate": 0.0004953976915871792, "loss": 5.4686, "mean_token_accuracy": 0.16207181066274642, "num_tokens": 16010704.0, "step": 9225 }, { "entropy": 5.566759204864502, "epoch": 0.7181482201906244, "grad_norm": 1.4453125, "learning_rate": 0.0004953921128795472, "loss": 5.4508, "mean_token_accuracy": 0.1655542552471161, "num_tokens": 16018936.0, "step": 9230 }, { "entropy": 5.593916034698486, "epoch": 0.718537249562342, "grad_norm": 1.5078125, "learning_rate": 0.0004953865308278156, "loss": 5.3588, "mean_token_accuracy": 0.1663544625043869, "num_tokens": 16027295.0, "step": 9235 }, { "entropy": 5.501459980010987, "epoch": 0.7189262789340595, "grad_norm": 1.5625, "learning_rate": 0.0004953809454320693, "loss": 5.3808, "mean_token_accuracy": 0.16815916448831558, "num_tokens": 16036493.0, "step": 9240 }, { "entropy": 5.560643815994263, "epoch": 0.7193153083057771, "grad_norm": 1.4609375, "learning_rate": 0.0004953753566923929, "loss": 5.5038, "mean_token_accuracy": 0.1660083144903183, "num_tokens": 16045406.0, "step": 9245 }, { "entropy": 5.623446416854859, "epoch": 0.7197043376774946, "grad_norm": 1.3671875, "learning_rate": 0.0004953697646088712, "loss": 5.4826, "mean_token_accuracy": 0.16748983412981033, "num_tokens": 16054126.0, "step": 9250 }, { "entropy": 5.632719039916992, "epoch": 0.7200933670492122, "grad_norm": 1.4296875, "learning_rate": 0.0004953641691815891, "loss": 5.5064, "mean_token_accuracy": 0.15853000283241273, "num_tokens": 16063921.0, "step": 9255 }, { "entropy": 5.6339634418487545, "epoch": 0.7204823964209298, "grad_norm": 1.453125, "learning_rate": 0.0004953585704106315, "loss": 5.5061, "mean_token_accuracy": 0.16534079760313034, "num_tokens": 16072160.0, "step": 9260 }, { "entropy": 5.63057131767273, "epoch": 0.7208714257926473, "grad_norm": 1.8671875, "learning_rate": 0.0004953529682960832, "loss": 5.4452, "mean_token_accuracy": 0.1626740127801895, "num_tokens": 16080794.0, "step": 9265 }, { "entropy": 5.553777599334717, "epoch": 0.7212604551643649, "grad_norm": 1.5390625, "learning_rate": 0.0004953473628380295, "loss": 5.4747, "mean_token_accuracy": 0.1672894313931465, "num_tokens": 16089615.0, "step": 9270 }, { "entropy": 5.552600383758545, "epoch": 0.7216494845360825, "grad_norm": 1.625, "learning_rate": 0.0004953417540365553, "loss": 5.394, "mean_token_accuracy": 0.15982172787189483, "num_tokens": 16098363.0, "step": 9275 }, { "entropy": 5.596477413177491, "epoch": 0.7220385139078, "grad_norm": 1.4921875, "learning_rate": 0.0004953361418917455, "loss": 5.4838, "mean_token_accuracy": 0.15724485367536545, "num_tokens": 16106837.0, "step": 9280 }, { "entropy": 5.656517791748047, "epoch": 0.7224275432795176, "grad_norm": 1.3828125, "learning_rate": 0.0004953305264036856, "loss": 5.4247, "mean_token_accuracy": 0.1660174235701561, "num_tokens": 16114923.0, "step": 9285 }, { "entropy": 5.614937114715576, "epoch": 0.7228165726512352, "grad_norm": 1.4296875, "learning_rate": 0.0004953249075724607, "loss": 5.4609, "mean_token_accuracy": 0.15922097563743592, "num_tokens": 16123698.0, "step": 9290 }, { "entropy": 5.586376905441284, "epoch": 0.7232056020229527, "grad_norm": 1.421875, "learning_rate": 0.0004953192853981559, "loss": 5.4395, "mean_token_accuracy": 0.1639003649353981, "num_tokens": 16132361.0, "step": 9295 }, { "entropy": 5.663545083999634, "epoch": 0.7235946313946703, "grad_norm": 1.2890625, "learning_rate": 0.0004953136598808566, "loss": 5.5057, "mean_token_accuracy": 0.1602555587887764, "num_tokens": 16141554.0, "step": 9300 }, { "entropy": 5.642953014373779, "epoch": 0.7239836607663879, "grad_norm": 1.4296875, "learning_rate": 0.0004953080310206481, "loss": 5.4305, "mean_token_accuracy": 0.16263717859983445, "num_tokens": 16150206.0, "step": 9305 }, { "entropy": 5.631220960617066, "epoch": 0.7243726901381055, "grad_norm": 1.46875, "learning_rate": 0.0004953023988176162, "loss": 5.5605, "mean_token_accuracy": 0.1562460854649544, "num_tokens": 16158995.0, "step": 9310 }, { "entropy": 5.60384202003479, "epoch": 0.724761719509823, "grad_norm": 1.609375, "learning_rate": 0.0004952967632718458, "loss": 5.52, "mean_token_accuracy": 0.15501880943775176, "num_tokens": 16167809.0, "step": 9315 }, { "entropy": 5.793039560317993, "epoch": 0.7251507488815405, "grad_norm": 1.4375, "learning_rate": 0.0004952911243834227, "loss": 5.6074, "mean_token_accuracy": 0.15796300321817397, "num_tokens": 16176257.0, "step": 9320 }, { "entropy": 5.660436630249023, "epoch": 0.7255397782532581, "grad_norm": 1.6640625, "learning_rate": 0.0004952854821524324, "loss": 5.5777, "mean_token_accuracy": 0.15514086186885834, "num_tokens": 16185597.0, "step": 9325 }, { "entropy": 5.703607749938965, "epoch": 0.7259288076249757, "grad_norm": 1.578125, "learning_rate": 0.0004952798365789606, "loss": 5.5843, "mean_token_accuracy": 0.15821659713983535, "num_tokens": 16194591.0, "step": 9330 }, { "entropy": 5.749100112915039, "epoch": 0.7263178369966933, "grad_norm": 1.5078125, "learning_rate": 0.0004952741876630928, "loss": 5.5342, "mean_token_accuracy": 0.1550159201025963, "num_tokens": 16203073.0, "step": 9335 }, { "entropy": 5.5745586395263675, "epoch": 0.7267068663684109, "grad_norm": 1.5703125, "learning_rate": 0.0004952685354049148, "loss": 5.497, "mean_token_accuracy": 0.1630001738667488, "num_tokens": 16211208.0, "step": 9340 }, { "entropy": 5.6307062149047855, "epoch": 0.7270958957401283, "grad_norm": 1.4609375, "learning_rate": 0.0004952628798045124, "loss": 5.439, "mean_token_accuracy": 0.1698139950633049, "num_tokens": 16219687.0, "step": 9345 }, { "entropy": 5.658086538314819, "epoch": 0.7274849251118459, "grad_norm": 1.5703125, "learning_rate": 0.0004952572208619714, "loss": 5.539, "mean_token_accuracy": 0.1642148092389107, "num_tokens": 16228214.0, "step": 9350 }, { "entropy": 5.654706954956055, "epoch": 0.7278739544835635, "grad_norm": 1.4375, "learning_rate": 0.0004952515585773778, "loss": 5.6282, "mean_token_accuracy": 0.15758585929870605, "num_tokens": 16237765.0, "step": 9355 }, { "entropy": 5.650431346893311, "epoch": 0.7282629838552811, "grad_norm": 1.5546875, "learning_rate": 0.0004952458929508171, "loss": 5.4818, "mean_token_accuracy": 0.17496364265680314, "num_tokens": 16245339.0, "step": 9360 }, { "entropy": 5.55873589515686, "epoch": 0.7286520132269987, "grad_norm": 1.3359375, "learning_rate": 0.0004952402239823757, "loss": 5.4573, "mean_token_accuracy": 0.15955497622489928, "num_tokens": 16253966.0, "step": 9365 }, { "entropy": 5.583206415176392, "epoch": 0.7290410425987162, "grad_norm": 1.46875, "learning_rate": 0.0004952345516721393, "loss": 5.4502, "mean_token_accuracy": 0.16356470733880996, "num_tokens": 16262859.0, "step": 9370 }, { "entropy": 5.610286617279053, "epoch": 0.7294300719704337, "grad_norm": 1.6015625, "learning_rate": 0.0004952288760201942, "loss": 5.5051, "mean_token_accuracy": 0.16029743254184722, "num_tokens": 16271646.0, "step": 9375 }, { "entropy": 5.547354507446289, "epoch": 0.7298191013421513, "grad_norm": 1.3671875, "learning_rate": 0.0004952231970266265, "loss": 5.4811, "mean_token_accuracy": 0.15630216598510743, "num_tokens": 16281058.0, "step": 9380 }, { "entropy": 5.652565431594849, "epoch": 0.7302081307138689, "grad_norm": 1.4375, "learning_rate": 0.0004952175146915223, "loss": 5.4287, "mean_token_accuracy": 0.1669951409101486, "num_tokens": 16289039.0, "step": 9385 }, { "entropy": 5.510778188705444, "epoch": 0.7305971600855865, "grad_norm": 1.5859375, "learning_rate": 0.0004952118290149679, "loss": 5.3194, "mean_token_accuracy": 0.17808689475059508, "num_tokens": 16297373.0, "step": 9390 }, { "entropy": 5.546924877166748, "epoch": 0.730986189457304, "grad_norm": 1.6640625, "learning_rate": 0.0004952061399970492, "loss": 5.5022, "mean_token_accuracy": 0.15341666340827942, "num_tokens": 16306066.0, "step": 9395 }, { "entropy": 5.642647647857666, "epoch": 0.7313752188290216, "grad_norm": 1.6640625, "learning_rate": 0.000495200447637853, "loss": 5.5518, "mean_token_accuracy": 0.15412714183330536, "num_tokens": 16315282.0, "step": 9400 }, { "entropy": 5.785994386672973, "epoch": 0.7317642482007392, "grad_norm": 1.5234375, "learning_rate": 0.0004951947519374655, "loss": 5.6386, "mean_token_accuracy": 0.15836541950702668, "num_tokens": 16324830.0, "step": 9405 }, { "entropy": 5.633684873580933, "epoch": 0.7321532775724567, "grad_norm": 1.609375, "learning_rate": 0.0004951890528959731, "loss": 5.4955, "mean_token_accuracy": 0.16180311292409896, "num_tokens": 16332990.0, "step": 9410 }, { "entropy": 5.587968397140503, "epoch": 0.7325423069441743, "grad_norm": 1.796875, "learning_rate": 0.0004951833505134623, "loss": 5.4687, "mean_token_accuracy": 0.1543179526925087, "num_tokens": 16342115.0, "step": 9415 }, { "entropy": 5.665604782104492, "epoch": 0.7329313363158918, "grad_norm": 1.515625, "learning_rate": 0.0004951776447900196, "loss": 5.4552, "mean_token_accuracy": 0.16402145326137543, "num_tokens": 16350329.0, "step": 9420 }, { "entropy": 5.574960565567016, "epoch": 0.7333203656876094, "grad_norm": 1.5859375, "learning_rate": 0.0004951719357257317, "loss": 5.5541, "mean_token_accuracy": 0.16425096988677979, "num_tokens": 16358890.0, "step": 9425 }, { "entropy": 5.708090877532959, "epoch": 0.733709395059327, "grad_norm": 1.6171875, "learning_rate": 0.000495166223320685, "loss": 5.5926, "mean_token_accuracy": 0.1554354265332222, "num_tokens": 16367338.0, "step": 9430 }, { "entropy": 5.721589708328247, "epoch": 0.7340984244310446, "grad_norm": 1.40625, "learning_rate": 0.0004951605075749662, "loss": 5.5067, "mean_token_accuracy": 0.16801688820123672, "num_tokens": 16375472.0, "step": 9435 }, { "entropy": 5.642661428451538, "epoch": 0.7344874538027621, "grad_norm": 1.484375, "learning_rate": 0.0004951547884886623, "loss": 5.4899, "mean_token_accuracy": 0.1639014407992363, "num_tokens": 16384212.0, "step": 9440 }, { "entropy": 5.571622610092163, "epoch": 0.7348764831744796, "grad_norm": 1.8828125, "learning_rate": 0.0004951490660618598, "loss": 5.388, "mean_token_accuracy": 0.1667047306895256, "num_tokens": 16393447.0, "step": 9445 }, { "entropy": 5.558136415481568, "epoch": 0.7352655125461972, "grad_norm": 1.5234375, "learning_rate": 0.0004951433402946457, "loss": 5.3829, "mean_token_accuracy": 0.1678649365901947, "num_tokens": 16401876.0, "step": 9450 }, { "entropy": 5.6018385887146, "epoch": 0.7356545419179148, "grad_norm": 1.5703125, "learning_rate": 0.0004951376111871068, "loss": 5.4963, "mean_token_accuracy": 0.17034075856208802, "num_tokens": 16411020.0, "step": 9455 }, { "entropy": 5.632222080230713, "epoch": 0.7360435712896324, "grad_norm": 1.5, "learning_rate": 0.0004951318787393299, "loss": 5.5339, "mean_token_accuracy": 0.15947003960609435, "num_tokens": 16420492.0, "step": 9460 }, { "entropy": 5.598445320129395, "epoch": 0.73643260066135, "grad_norm": 1.5078125, "learning_rate": 0.0004951261429514023, "loss": 5.4316, "mean_token_accuracy": 0.16751165241003035, "num_tokens": 16429277.0, "step": 9465 }, { "entropy": 5.616234636306762, "epoch": 0.7368216300330674, "grad_norm": 1.5703125, "learning_rate": 0.0004951204038234106, "loss": 5.4709, "mean_token_accuracy": 0.16523509919643403, "num_tokens": 16438008.0, "step": 9470 }, { "entropy": 5.654847097396851, "epoch": 0.737210659404785, "grad_norm": 1.5625, "learning_rate": 0.0004951146613554424, "loss": 5.4806, "mean_token_accuracy": 0.16680918782949447, "num_tokens": 16446791.0, "step": 9475 }, { "entropy": 5.593355751037597, "epoch": 0.7375996887765026, "grad_norm": 1.4296875, "learning_rate": 0.0004951089155475843, "loss": 5.5062, "mean_token_accuracy": 0.16251966655254363, "num_tokens": 16455277.0, "step": 9480 }, { "entropy": 5.593828105926514, "epoch": 0.7379887181482202, "grad_norm": 1.765625, "learning_rate": 0.000495103166399924, "loss": 5.4303, "mean_token_accuracy": 0.16394807398319244, "num_tokens": 16463310.0, "step": 9485 }, { "entropy": 5.653588676452637, "epoch": 0.7383777475199378, "grad_norm": 1.625, "learning_rate": 0.0004950974139125484, "loss": 5.4723, "mean_token_accuracy": 0.1603311374783516, "num_tokens": 16472421.0, "step": 9490 }, { "entropy": 5.643746042251587, "epoch": 0.7387667768916554, "grad_norm": 1.5390625, "learning_rate": 0.0004950916580855448, "loss": 5.5334, "mean_token_accuracy": 0.16023790836334229, "num_tokens": 16481814.0, "step": 9495 }, { "entropy": 5.6236348152160645, "epoch": 0.7391558062633728, "grad_norm": 1.40625, "learning_rate": 0.0004950858989190007, "loss": 5.5019, "mean_token_accuracy": 0.15711402893066406, "num_tokens": 16490902.0, "step": 9500 }, { "entropy": 5.670229244232178, "epoch": 0.7395448356350904, "grad_norm": 1.6796875, "learning_rate": 0.0004950801364130032, "loss": 5.4574, "mean_token_accuracy": 0.16394625455141068, "num_tokens": 16499418.0, "step": 9505 }, { "entropy": 5.550073432922363, "epoch": 0.739933865006808, "grad_norm": 1.40625, "learning_rate": 0.0004950743705676401, "loss": 5.3998, "mean_token_accuracy": 0.16792995035648345, "num_tokens": 16508578.0, "step": 9510 }, { "entropy": 5.5597185611724855, "epoch": 0.7403228943785256, "grad_norm": 1.375, "learning_rate": 0.0004950686013829987, "loss": 5.4663, "mean_token_accuracy": 0.16282816976308823, "num_tokens": 16517356.0, "step": 9515 }, { "entropy": 5.569721984863281, "epoch": 0.7407119237502432, "grad_norm": 1.5234375, "learning_rate": 0.0004950628288591665, "loss": 5.4441, "mean_token_accuracy": 0.15830240696668624, "num_tokens": 16525834.0, "step": 9520 }, { "entropy": 5.61745057106018, "epoch": 0.7411009531219607, "grad_norm": 1.4375, "learning_rate": 0.0004950570529962311, "loss": 5.4867, "mean_token_accuracy": 0.16102957129478454, "num_tokens": 16534513.0, "step": 9525 }, { "entropy": 5.634679746627808, "epoch": 0.7414899824936783, "grad_norm": 1.4765625, "learning_rate": 0.0004950512737942803, "loss": 5.4562, "mean_token_accuracy": 0.1676692172884941, "num_tokens": 16543326.0, "step": 9530 }, { "entropy": 5.561607074737549, "epoch": 0.7418790118653958, "grad_norm": 1.5703125, "learning_rate": 0.0004950454912534015, "loss": 5.4452, "mean_token_accuracy": 0.16409103125333785, "num_tokens": 16551589.0, "step": 9535 }, { "entropy": 5.591177320480346, "epoch": 0.7422680412371134, "grad_norm": 1.4609375, "learning_rate": 0.0004950397053736827, "loss": 5.4473, "mean_token_accuracy": 0.1670309916138649, "num_tokens": 16560261.0, "step": 9540 }, { "entropy": 5.590814447402954, "epoch": 0.742657070608831, "grad_norm": 1.484375, "learning_rate": 0.0004950339161552117, "loss": 5.4316, "mean_token_accuracy": 0.16776785999536514, "num_tokens": 16568645.0, "step": 9545 }, { "entropy": 5.56022047996521, "epoch": 0.7430460999805485, "grad_norm": 1.421875, "learning_rate": 0.0004950281235980761, "loss": 5.4474, "mean_token_accuracy": 0.16762655973434448, "num_tokens": 16577206.0, "step": 9550 }, { "entropy": 5.632214689254761, "epoch": 0.7434351293522661, "grad_norm": 1.46875, "learning_rate": 0.000495022327702364, "loss": 5.4363, "mean_token_accuracy": 0.16455136835575104, "num_tokens": 16585011.0, "step": 9555 }, { "entropy": 5.6199352741241455, "epoch": 0.7438241587239837, "grad_norm": 1.9609375, "learning_rate": 0.0004950165284681631, "loss": 5.4862, "mean_token_accuracy": 0.1609924092888832, "num_tokens": 16593574.0, "step": 9560 }, { "entropy": 5.594768810272217, "epoch": 0.7442131880957013, "grad_norm": 1.390625, "learning_rate": 0.0004950107258955618, "loss": 5.4256, "mean_token_accuracy": 0.16947073340415955, "num_tokens": 16603023.0, "step": 9565 }, { "entropy": 5.702660179138183, "epoch": 0.7446022174674188, "grad_norm": 1.390625, "learning_rate": 0.0004950049199846479, "loss": 5.5135, "mean_token_accuracy": 0.16235789135098458, "num_tokens": 16611963.0, "step": 9570 }, { "entropy": 5.64899435043335, "epoch": 0.7449912468391363, "grad_norm": 1.7421875, "learning_rate": 0.0004949991107355095, "loss": 5.4564, "mean_token_accuracy": 0.16407136619091034, "num_tokens": 16619942.0, "step": 9575 }, { "entropy": 5.508935070037841, "epoch": 0.7453802762108539, "grad_norm": 1.3984375, "learning_rate": 0.0004949932981482347, "loss": 5.3456, "mean_token_accuracy": 0.16973289400339125, "num_tokens": 16628261.0, "step": 9580 }, { "entropy": 5.684511280059814, "epoch": 0.7457693055825715, "grad_norm": 1.625, "learning_rate": 0.0004949874822229118, "loss": 5.4888, "mean_token_accuracy": 0.1607719212770462, "num_tokens": 16637290.0, "step": 9585 }, { "entropy": 5.614342832565308, "epoch": 0.7461583349542891, "grad_norm": 1.5703125, "learning_rate": 0.0004949816629596288, "loss": 5.4721, "mean_token_accuracy": 0.1669323280453682, "num_tokens": 16646147.0, "step": 9590 }, { "entropy": 5.5784093856811525, "epoch": 0.7465473643260067, "grad_norm": 1.4453125, "learning_rate": 0.0004949758403584746, "loss": 5.5734, "mean_token_accuracy": 0.1605289027094841, "num_tokens": 16655299.0, "step": 9595 }, { "entropy": 5.6553062915802, "epoch": 0.7469363936977241, "grad_norm": 1.84375, "learning_rate": 0.0004949700144195368, "loss": 5.4556, "mean_token_accuracy": 0.16472315341234206, "num_tokens": 16664091.0, "step": 9600 }, { "entropy": 5.74340591430664, "epoch": 0.7473254230694417, "grad_norm": 1.7421875, "learning_rate": 0.0004949641851429043, "loss": 5.5141, "mean_token_accuracy": 0.16007463932037352, "num_tokens": 16672665.0, "step": 9605 }, { "entropy": 5.585549449920654, "epoch": 0.7477144524411593, "grad_norm": 1.5078125, "learning_rate": 0.0004949583525286654, "loss": 5.4367, "mean_token_accuracy": 0.1651037484407425, "num_tokens": 16680735.0, "step": 9610 }, { "entropy": 5.609591007232666, "epoch": 0.7481034818128769, "grad_norm": 1.5546875, "learning_rate": 0.0004949525165769085, "loss": 5.5232, "mean_token_accuracy": 0.1619318887591362, "num_tokens": 16689560.0, "step": 9615 }, { "entropy": 5.675543212890625, "epoch": 0.7484925111845945, "grad_norm": 1.6796875, "learning_rate": 0.0004949466772877224, "loss": 5.4672, "mean_token_accuracy": 0.16306936591863633, "num_tokens": 16698953.0, "step": 9620 }, { "entropy": 5.625356245040893, "epoch": 0.748881540556312, "grad_norm": 1.484375, "learning_rate": 0.0004949408346611955, "loss": 5.5121, "mean_token_accuracy": 0.16117900460958481, "num_tokens": 16707601.0, "step": 9625 }, { "entropy": 5.564679431915283, "epoch": 0.7492705699280295, "grad_norm": 1.5078125, "learning_rate": 0.0004949349886974165, "loss": 5.4926, "mean_token_accuracy": 0.1600220173597336, "num_tokens": 16716660.0, "step": 9630 }, { "entropy": 5.647576713562012, "epoch": 0.7496595992997471, "grad_norm": 1.46875, "learning_rate": 0.0004949291393964741, "loss": 5.4463, "mean_token_accuracy": 0.16327247470617295, "num_tokens": 16725274.0, "step": 9635 }, { "entropy": 5.619313144683838, "epoch": 0.7500486286714647, "grad_norm": 1.5390625, "learning_rate": 0.000494923286758457, "loss": 5.4217, "mean_token_accuracy": 0.16573825627565383, "num_tokens": 16733301.0, "step": 9640 }, { "entropy": 5.66570897102356, "epoch": 0.7504376580431823, "grad_norm": 2.359375, "learning_rate": 0.0004949174307834541, "loss": 5.4743, "mean_token_accuracy": 0.16345229148864746, "num_tokens": 16742072.0, "step": 9645 }, { "entropy": 5.661173248291016, "epoch": 0.7508266874148998, "grad_norm": 1.6640625, "learning_rate": 0.0004949115714715543, "loss": 5.48, "mean_token_accuracy": 0.16001084744930266, "num_tokens": 16751497.0, "step": 9650 }, { "entropy": 5.544694662094116, "epoch": 0.7512157167866174, "grad_norm": 1.5625, "learning_rate": 0.0004949057088228465, "loss": 5.4181, "mean_token_accuracy": 0.16923647224903107, "num_tokens": 16760518.0, "step": 9655 }, { "entropy": 5.656236028671264, "epoch": 0.751604746158335, "grad_norm": 1.328125, "learning_rate": 0.0004948998428374194, "loss": 5.54, "mean_token_accuracy": 0.15598669797182083, "num_tokens": 16768689.0, "step": 9660 }, { "entropy": 5.614003610610962, "epoch": 0.7519937755300525, "grad_norm": 1.5546875, "learning_rate": 0.0004948939735153622, "loss": 5.3853, "mean_token_accuracy": 0.17029613703489305, "num_tokens": 16777047.0, "step": 9665 }, { "entropy": 5.555197858810425, "epoch": 0.7523828049017701, "grad_norm": 1.453125, "learning_rate": 0.0004948881008567641, "loss": 5.3616, "mean_token_accuracy": 0.17010919004678726, "num_tokens": 16785402.0, "step": 9670 }, { "entropy": 5.5848133087158205, "epoch": 0.7527718342734876, "grad_norm": 1.53125, "learning_rate": 0.0004948822248617139, "loss": 5.455, "mean_token_accuracy": 0.1636451430618763, "num_tokens": 16794687.0, "step": 9675 }, { "entropy": 5.694547653198242, "epoch": 0.7531608636452052, "grad_norm": 1.640625, "learning_rate": 0.000494876345530301, "loss": 5.491, "mean_token_accuracy": 0.16249312162399293, "num_tokens": 16803762.0, "step": 9680 }, { "entropy": 5.608018636703491, "epoch": 0.7535498930169228, "grad_norm": 1.6875, "learning_rate": 0.0004948704628626145, "loss": 5.51, "mean_token_accuracy": 0.1589452415704727, "num_tokens": 16812872.0, "step": 9685 }, { "entropy": 5.654308128356933, "epoch": 0.7539389223886404, "grad_norm": 1.328125, "learning_rate": 0.0004948645768587437, "loss": 5.5666, "mean_token_accuracy": 0.15174276679754256, "num_tokens": 16821270.0, "step": 9690 }, { "entropy": 5.632787799835205, "epoch": 0.7543279517603579, "grad_norm": 1.4921875, "learning_rate": 0.0004948586875187778, "loss": 5.4284, "mean_token_accuracy": 0.16506413072347642, "num_tokens": 16829508.0, "step": 9695 }, { "entropy": 5.59177532196045, "epoch": 0.7547169811320755, "grad_norm": 1.7734375, "learning_rate": 0.0004948527948428064, "loss": 5.421, "mean_token_accuracy": 0.16233740672469138, "num_tokens": 16838327.0, "step": 9700 }, { "entropy": 5.598222398757935, "epoch": 0.755106010503793, "grad_norm": 1.3515625, "learning_rate": 0.0004948468988309187, "loss": 5.4128, "mean_token_accuracy": 0.16744261384010314, "num_tokens": 16846530.0, "step": 9705 }, { "entropy": 5.502956771850586, "epoch": 0.7554950398755106, "grad_norm": 1.421875, "learning_rate": 0.0004948409994832043, "loss": 5.3434, "mean_token_accuracy": 0.16664833426475525, "num_tokens": 16854825.0, "step": 9710 }, { "entropy": 5.598453044891357, "epoch": 0.7558840692472282, "grad_norm": 1.359375, "learning_rate": 0.0004948350967997526, "loss": 5.5003, "mean_token_accuracy": 0.1536581963300705, "num_tokens": 16864096.0, "step": 9715 }, { "entropy": 5.674967241287232, "epoch": 0.7562730986189458, "grad_norm": 1.7265625, "learning_rate": 0.0004948291907806532, "loss": 5.5619, "mean_token_accuracy": 0.15005003958940505, "num_tokens": 16873000.0, "step": 9720 }, { "entropy": 5.726628828048706, "epoch": 0.7566621279906633, "grad_norm": 1.4375, "learning_rate": 0.0004948232814259957, "loss": 5.5606, "mean_token_accuracy": 0.16236240267753602, "num_tokens": 16881374.0, "step": 9725 }, { "entropy": 5.637835550308227, "epoch": 0.7570511573623808, "grad_norm": 1.671875, "learning_rate": 0.0004948173687358699, "loss": 5.5264, "mean_token_accuracy": 0.15957718193531037, "num_tokens": 16889192.0, "step": 9730 }, { "entropy": 5.582265377044678, "epoch": 0.7574401867340984, "grad_norm": 1.5625, "learning_rate": 0.0004948114527103652, "loss": 5.5184, "mean_token_accuracy": 0.1577650398015976, "num_tokens": 16898538.0, "step": 9735 }, { "entropy": 5.630859899520874, "epoch": 0.757829216105816, "grad_norm": 1.4765625, "learning_rate": 0.0004948055333495717, "loss": 5.5183, "mean_token_accuracy": 0.15783605873584747, "num_tokens": 16907543.0, "step": 9740 }, { "entropy": 5.654094886779785, "epoch": 0.7582182454775336, "grad_norm": 1.4296875, "learning_rate": 0.0004947996106535791, "loss": 5.4257, "mean_token_accuracy": 0.17062853574752807, "num_tokens": 16916140.0, "step": 9745 }, { "entropy": 5.5783079147338865, "epoch": 0.7586072748492512, "grad_norm": 2.375, "learning_rate": 0.0004947936846224773, "loss": 5.4182, "mean_token_accuracy": 0.1665373921394348, "num_tokens": 16925433.0, "step": 9750 }, { "entropy": 5.532951974868775, "epoch": 0.7589963042209686, "grad_norm": 2.515625, "learning_rate": 0.0004947877552563562, "loss": 5.4507, "mean_token_accuracy": 0.16356708705425263, "num_tokens": 16933598.0, "step": 9755 }, { "entropy": 5.639309597015381, "epoch": 0.7593853335926862, "grad_norm": 1.609375, "learning_rate": 0.0004947818225553056, "loss": 5.5459, "mean_token_accuracy": 0.1587366744875908, "num_tokens": 16942270.0, "step": 9760 }, { "entropy": 5.602426338195801, "epoch": 0.7597743629644038, "grad_norm": 1.515625, "learning_rate": 0.0004947758865194156, "loss": 5.3833, "mean_token_accuracy": 0.16099860072135924, "num_tokens": 16951044.0, "step": 9765 }, { "entropy": 5.673260307312011, "epoch": 0.7601633923361214, "grad_norm": 2.609375, "learning_rate": 0.0004947699471487766, "loss": 5.5603, "mean_token_accuracy": 0.1531473256647587, "num_tokens": 16960215.0, "step": 9770 }, { "entropy": 5.716788911819458, "epoch": 0.760552421707839, "grad_norm": 1.7890625, "learning_rate": 0.0004947640044434782, "loss": 5.5952, "mean_token_accuracy": 0.15658744424581528, "num_tokens": 16968515.0, "step": 9775 }, { "entropy": 5.679812908172607, "epoch": 0.7609414510795565, "grad_norm": 1.484375, "learning_rate": 0.0004947580584036109, "loss": 5.5651, "mean_token_accuracy": 0.15306783169507981, "num_tokens": 16977597.0, "step": 9780 }, { "entropy": 5.585596179962158, "epoch": 0.761330480451274, "grad_norm": 1.5078125, "learning_rate": 0.0004947521090292649, "loss": 5.4231, "mean_token_accuracy": 0.1596038371324539, "num_tokens": 16987376.0, "step": 9785 }, { "entropy": 5.5853808403015135, "epoch": 0.7617195098229916, "grad_norm": 1.5078125, "learning_rate": 0.0004947461563205304, "loss": 5.4246, "mean_token_accuracy": 0.16407533586025239, "num_tokens": 16995976.0, "step": 9790 }, { "entropy": 5.5631688117980955, "epoch": 0.7621085391947092, "grad_norm": 1.546875, "learning_rate": 0.0004947402002774977, "loss": 5.4284, "mean_token_accuracy": 0.16948177963495253, "num_tokens": 17003819.0, "step": 9795 }, { "entropy": 5.549920654296875, "epoch": 0.7624975685664268, "grad_norm": 1.5546875, "learning_rate": 0.0004947342409002572, "loss": 5.4126, "mean_token_accuracy": 0.1728143498301506, "num_tokens": 17011632.0, "step": 9800 }, { "entropy": 5.55021185874939, "epoch": 0.7628865979381443, "grad_norm": 1.6015625, "learning_rate": 0.0004947282781888994, "loss": 5.3461, "mean_token_accuracy": 0.1698859602212906, "num_tokens": 17019737.0, "step": 9805 }, { "entropy": 5.623792028427124, "epoch": 0.7632756273098619, "grad_norm": 1.4609375, "learning_rate": 0.0004947223121435147, "loss": 5.5057, "mean_token_accuracy": 0.16593750119209288, "num_tokens": 17028803.0, "step": 9810 }, { "entropy": 5.5954584121704105, "epoch": 0.7636646566815795, "grad_norm": 1.5078125, "learning_rate": 0.0004947163427641936, "loss": 5.3402, "mean_token_accuracy": 0.16582608968019485, "num_tokens": 17036847.0, "step": 9815 }, { "entropy": 5.676225996017456, "epoch": 0.764053686053297, "grad_norm": 1.5546875, "learning_rate": 0.0004947103700510268, "loss": 5.4853, "mean_token_accuracy": 0.1590005040168762, "num_tokens": 17045665.0, "step": 9820 }, { "entropy": 5.690594434738159, "epoch": 0.7644427154250146, "grad_norm": 1.546875, "learning_rate": 0.0004947043940041047, "loss": 5.4871, "mean_token_accuracy": 0.16544217467308045, "num_tokens": 17053842.0, "step": 9825 }, { "entropy": 5.657180213928223, "epoch": 0.7648317447967321, "grad_norm": 1.5703125, "learning_rate": 0.0004946984146235183, "loss": 5.5492, "mean_token_accuracy": 0.15866318196058274, "num_tokens": 17062287.0, "step": 9830 }, { "entropy": 5.671737289428711, "epoch": 0.7652207741684497, "grad_norm": 1.6328125, "learning_rate": 0.0004946924319093579, "loss": 5.5675, "mean_token_accuracy": 0.16470288038253783, "num_tokens": 17071495.0, "step": 9835 }, { "entropy": 5.566572856903076, "epoch": 0.7656098035401673, "grad_norm": 1.4140625, "learning_rate": 0.0004946864458617148, "loss": 5.495, "mean_token_accuracy": 0.1597565859556198, "num_tokens": 17080734.0, "step": 9840 }, { "entropy": 5.645231056213379, "epoch": 0.7659988329118849, "grad_norm": 1.671875, "learning_rate": 0.0004946804564806793, "loss": 5.5168, "mean_token_accuracy": 0.16035535037517548, "num_tokens": 17089683.0, "step": 9845 }, { "entropy": 5.651087903976441, "epoch": 0.7663878622836025, "grad_norm": 1.4765625, "learning_rate": 0.0004946744637663427, "loss": 5.5363, "mean_token_accuracy": 0.15783768147230148, "num_tokens": 17098203.0, "step": 9850 }, { "entropy": 5.565146541595459, "epoch": 0.7667768916553199, "grad_norm": 1.6171875, "learning_rate": 0.0004946684677187956, "loss": 5.3894, "mean_token_accuracy": 0.16356709450483323, "num_tokens": 17107185.0, "step": 9855 }, { "entropy": 5.602199363708496, "epoch": 0.7671659210270375, "grad_norm": 1.65625, "learning_rate": 0.0004946624683381292, "loss": 5.4465, "mean_token_accuracy": 0.16764336079359055, "num_tokens": 17115168.0, "step": 9860 }, { "entropy": 5.595751810073852, "epoch": 0.7675549503987551, "grad_norm": 1.578125, "learning_rate": 0.0004946564656244345, "loss": 5.4376, "mean_token_accuracy": 0.16738105267286302, "num_tokens": 17124037.0, "step": 9865 }, { "entropy": 5.572898054122925, "epoch": 0.7679439797704727, "grad_norm": 1.7578125, "learning_rate": 0.0004946504595778026, "loss": 5.3668, "mean_token_accuracy": 0.16299717128276825, "num_tokens": 17132238.0, "step": 9870 }, { "entropy": 5.559570550918579, "epoch": 0.7683330091421903, "grad_norm": 1.4296875, "learning_rate": 0.0004946444501983246, "loss": 5.5043, "mean_token_accuracy": 0.15664197653532028, "num_tokens": 17140405.0, "step": 9875 }, { "entropy": 5.5682971477508545, "epoch": 0.7687220385139077, "grad_norm": 1.4921875, "learning_rate": 0.0004946384374860916, "loss": 5.42, "mean_token_accuracy": 0.1662541151046753, "num_tokens": 17149207.0, "step": 9880 }, { "entropy": 5.61993441581726, "epoch": 0.7691110678856253, "grad_norm": 2.4375, "learning_rate": 0.0004946324214411949, "loss": 5.4076, "mean_token_accuracy": 0.15628940016031265, "num_tokens": 17157680.0, "step": 9885 }, { "entropy": 5.643505573272705, "epoch": 0.7695000972573429, "grad_norm": 1.5703125, "learning_rate": 0.0004946264020637259, "loss": 5.4463, "mean_token_accuracy": 0.16137076020240784, "num_tokens": 17166907.0, "step": 9890 }, { "entropy": 5.586683464050293, "epoch": 0.7698891266290605, "grad_norm": 1.59375, "learning_rate": 0.0004946203793537757, "loss": 5.4843, "mean_token_accuracy": 0.16788864582777024, "num_tokens": 17176318.0, "step": 9895 }, { "entropy": 5.6048585891723635, "epoch": 0.7702781560007781, "grad_norm": 1.625, "learning_rate": 0.0004946143533114358, "loss": 5.5217, "mean_token_accuracy": 0.15332429856061935, "num_tokens": 17185380.0, "step": 9900 }, { "entropy": 5.660828351974487, "epoch": 0.7706671853724957, "grad_norm": 1.421875, "learning_rate": 0.0004946083239367976, "loss": 5.4994, "mean_token_accuracy": 0.1601640537381172, "num_tokens": 17193177.0, "step": 9905 }, { "entropy": 5.5617344856262205, "epoch": 0.7710562147442132, "grad_norm": 1.46875, "learning_rate": 0.0004946022912299527, "loss": 5.4757, "mean_token_accuracy": 0.15949599891901017, "num_tokens": 17201071.0, "step": 9910 }, { "entropy": 5.543600606918335, "epoch": 0.7714452441159307, "grad_norm": 1.4765625, "learning_rate": 0.0004945962551909926, "loss": 5.3834, "mean_token_accuracy": 0.16966844946146012, "num_tokens": 17209375.0, "step": 9915 }, { "entropy": 5.601286697387695, "epoch": 0.7718342734876483, "grad_norm": 1.3984375, "learning_rate": 0.0004945902158200089, "loss": 5.337, "mean_token_accuracy": 0.17217303067445755, "num_tokens": 17217453.0, "step": 9920 }, { "entropy": 5.601703071594239, "epoch": 0.7722233028593659, "grad_norm": 1.46875, "learning_rate": 0.0004945841731170931, "loss": 5.4188, "mean_token_accuracy": 0.16042266339063643, "num_tokens": 17225671.0, "step": 9925 }, { "entropy": 5.519887161254883, "epoch": 0.7726123322310835, "grad_norm": 1.2265625, "learning_rate": 0.0004945781270823369, "loss": 5.3674, "mean_token_accuracy": 0.16603152453899384, "num_tokens": 17234396.0, "step": 9930 }, { "entropy": 5.570225620269776, "epoch": 0.773001361602801, "grad_norm": 1.4375, "learning_rate": 0.0004945720777158323, "loss": 5.4813, "mean_token_accuracy": 0.1608129024505615, "num_tokens": 17243509.0, "step": 9935 }, { "entropy": 5.619941139221192, "epoch": 0.7733903909745186, "grad_norm": 1.40625, "learning_rate": 0.0004945660250176708, "loss": 5.4021, "mean_token_accuracy": 0.17428109794855118, "num_tokens": 17251447.0, "step": 9940 }, { "entropy": 5.535233879089356, "epoch": 0.7737794203462361, "grad_norm": 1.3359375, "learning_rate": 0.0004945599689879443, "loss": 5.4664, "mean_token_accuracy": 0.16355775743722917, "num_tokens": 17260240.0, "step": 9945 }, { "entropy": 5.602076053619385, "epoch": 0.7741684497179537, "grad_norm": 1.4921875, "learning_rate": 0.0004945539096267448, "loss": 5.467, "mean_token_accuracy": 0.16678984612226486, "num_tokens": 17267835.0, "step": 9950 }, { "entropy": 5.57802038192749, "epoch": 0.7745574790896713, "grad_norm": 1.359375, "learning_rate": 0.0004945478469341642, "loss": 5.4616, "mean_token_accuracy": 0.16033925563097, "num_tokens": 17277069.0, "step": 9955 }, { "entropy": 5.602939796447754, "epoch": 0.7749465084613888, "grad_norm": 1.4140625, "learning_rate": 0.0004945417809102944, "loss": 5.4513, "mean_token_accuracy": 0.16086394041776658, "num_tokens": 17285014.0, "step": 9960 }, { "entropy": 5.531858968734741, "epoch": 0.7753355378331064, "grad_norm": 1.5546875, "learning_rate": 0.0004945357115552275, "loss": 5.3995, "mean_token_accuracy": 0.16076785176992417, "num_tokens": 17292649.0, "step": 9965 }, { "entropy": 5.668289852142334, "epoch": 0.775724567204824, "grad_norm": 1.421875, "learning_rate": 0.0004945296388690557, "loss": 5.5467, "mean_token_accuracy": 0.15805940628051757, "num_tokens": 17301792.0, "step": 9970 }, { "entropy": 5.5542267799377445, "epoch": 0.7761135965765416, "grad_norm": 1.2421875, "learning_rate": 0.000494523562851871, "loss": 5.2994, "mean_token_accuracy": 0.16803679764270782, "num_tokens": 17310377.0, "step": 9975 }, { "entropy": 5.576317358016968, "epoch": 0.7765026259482591, "grad_norm": 1.796875, "learning_rate": 0.0004945174835037655, "loss": 5.5252, "mean_token_accuracy": 0.15372655987739564, "num_tokens": 17319779.0, "step": 9980 }, { "entropy": 5.755231428146362, "epoch": 0.7768916553199766, "grad_norm": 1.4296875, "learning_rate": 0.0004945114008248319, "loss": 5.6449, "mean_token_accuracy": 0.14884610027074813, "num_tokens": 17328210.0, "step": 9985 }, { "entropy": 5.584620618820191, "epoch": 0.7772806846916942, "grad_norm": 1.3359375, "learning_rate": 0.0004945053148151619, "loss": 5.3651, "mean_token_accuracy": 0.1722089931368828, "num_tokens": 17336287.0, "step": 9990 }, { "entropy": 5.564840316772461, "epoch": 0.7776697140634118, "grad_norm": 1.4375, "learning_rate": 0.0004944992254748482, "loss": 5.4267, "mean_token_accuracy": 0.16362099945545197, "num_tokens": 17344171.0, "step": 9995 }, { "entropy": 5.535340070724487, "epoch": 0.7780587434351294, "grad_norm": 1.453125, "learning_rate": 0.0004944931328039832, "loss": 5.4545, "mean_token_accuracy": 0.169051456451416, "num_tokens": 17352786.0, "step": 10000 }, { "entropy": 5.541292333602906, "epoch": 0.778447772806847, "grad_norm": 1.484375, "learning_rate": 0.0004944870368026592, "loss": 5.4307, "mean_token_accuracy": 0.16499633044004441, "num_tokens": 17361824.0, "step": 10005 }, { "entropy": 5.592077016830444, "epoch": 0.7788368021785644, "grad_norm": 1.46875, "learning_rate": 0.0004944809374709689, "loss": 5.4585, "mean_token_accuracy": 0.16586715281009673, "num_tokens": 17370249.0, "step": 10010 }, { "entropy": 5.572728633880615, "epoch": 0.779225831550282, "grad_norm": 1.421875, "learning_rate": 0.0004944748348090045, "loss": 5.4421, "mean_token_accuracy": 0.16339399069547653, "num_tokens": 17379650.0, "step": 10015 }, { "entropy": 5.5525439262390135, "epoch": 0.7796148609219996, "grad_norm": 1.453125, "learning_rate": 0.0004944687288168589, "loss": 5.4564, "mean_token_accuracy": 0.1660699188709259, "num_tokens": 17388046.0, "step": 10020 }, { "entropy": 5.638512372970581, "epoch": 0.7800038902937172, "grad_norm": 1.4921875, "learning_rate": 0.0004944626194946246, "loss": 5.4271, "mean_token_accuracy": 0.17610761970281602, "num_tokens": 17395851.0, "step": 10025 }, { "entropy": 5.612651348114014, "epoch": 0.7803929196654348, "grad_norm": 1.46875, "learning_rate": 0.0004944565068423945, "loss": 5.5025, "mean_token_accuracy": 0.1645132765173912, "num_tokens": 17404273.0, "step": 10030 }, { "entropy": 5.528199911117554, "epoch": 0.7807819490371523, "grad_norm": 1.40625, "learning_rate": 0.0004944503908602612, "loss": 5.4391, "mean_token_accuracy": 0.16655797511339188, "num_tokens": 17412884.0, "step": 10035 }, { "entropy": 5.565637111663818, "epoch": 0.7811709784088698, "grad_norm": 1.859375, "learning_rate": 0.0004944442715483174, "loss": 5.4246, "mean_token_accuracy": 0.16185757219791413, "num_tokens": 17420939.0, "step": 10040 }, { "entropy": 5.574648046493531, "epoch": 0.7815600077805874, "grad_norm": 1.546875, "learning_rate": 0.0004944381489066561, "loss": 5.4762, "mean_token_accuracy": 0.16504090428352355, "num_tokens": 17429838.0, "step": 10045 }, { "entropy": 5.630850172042846, "epoch": 0.781949037152305, "grad_norm": 1.4921875, "learning_rate": 0.0004944320229353702, "loss": 5.4576, "mean_token_accuracy": 0.16243240088224412, "num_tokens": 17439164.0, "step": 10050 }, { "entropy": 5.634826183319092, "epoch": 0.7823380665240226, "grad_norm": 1.5625, "learning_rate": 0.0004944258936345526, "loss": 5.4317, "mean_token_accuracy": 0.16340447217226028, "num_tokens": 17447544.0, "step": 10055 }, { "entropy": 5.478040027618408, "epoch": 0.7827270958957401, "grad_norm": 1.3984375, "learning_rate": 0.0004944197610042963, "loss": 5.3042, "mean_token_accuracy": 0.1662735790014267, "num_tokens": 17456270.0, "step": 10060 }, { "entropy": 5.567981147766114, "epoch": 0.7831161252674577, "grad_norm": 1.53125, "learning_rate": 0.0004944136250446944, "loss": 5.4864, "mean_token_accuracy": 0.16388331800699235, "num_tokens": 17465241.0, "step": 10065 }, { "entropy": 5.686744737625122, "epoch": 0.7835051546391752, "grad_norm": 1.6875, "learning_rate": 0.0004944074857558399, "loss": 5.4825, "mean_token_accuracy": 0.1565874397754669, "num_tokens": 17474460.0, "step": 10070 }, { "entropy": 5.599651908874511, "epoch": 0.7838941840108928, "grad_norm": 1.3671875, "learning_rate": 0.0004944013431378261, "loss": 5.4503, "mean_token_accuracy": 0.16428371965885163, "num_tokens": 17483256.0, "step": 10075 }, { "entropy": 5.623570966720581, "epoch": 0.7842832133826104, "grad_norm": 1.796875, "learning_rate": 0.0004943951971907461, "loss": 5.4704, "mean_token_accuracy": 0.16218913793563844, "num_tokens": 17491922.0, "step": 10080 }, { "entropy": 5.608122491836548, "epoch": 0.7846722427543279, "grad_norm": 1.4765625, "learning_rate": 0.0004943890479146933, "loss": 5.4693, "mean_token_accuracy": 0.16983896046876906, "num_tokens": 17499763.0, "step": 10085 }, { "entropy": 5.619894170761109, "epoch": 0.7850612721260455, "grad_norm": 1.546875, "learning_rate": 0.0004943828953097607, "loss": 5.4396, "mean_token_accuracy": 0.16675328761339187, "num_tokens": 17508682.0, "step": 10090 }, { "entropy": 5.518069171905518, "epoch": 0.7854503014977631, "grad_norm": 1.46875, "learning_rate": 0.000494376739376042, "loss": 5.3658, "mean_token_accuracy": 0.16787486970424653, "num_tokens": 17517269.0, "step": 10095 }, { "entropy": 5.444378519058228, "epoch": 0.7858393308694807, "grad_norm": 1.5703125, "learning_rate": 0.0004943705801136304, "loss": 5.3881, "mean_token_accuracy": 0.1697043627500534, "num_tokens": 17525135.0, "step": 10100 }, { "entropy": 5.537582588195801, "epoch": 0.7862283602411982, "grad_norm": 1.421875, "learning_rate": 0.0004943644175226193, "loss": 5.4714, "mean_token_accuracy": 0.1688419073820114, "num_tokens": 17534195.0, "step": 10105 }, { "entropy": 5.574254274368286, "epoch": 0.7866173896129158, "grad_norm": 1.53125, "learning_rate": 0.0004943582516031025, "loss": 5.3923, "mean_token_accuracy": 0.16879581660032272, "num_tokens": 17543016.0, "step": 10110 }, { "entropy": 5.642699337005615, "epoch": 0.7870064189846333, "grad_norm": 1.6484375, "learning_rate": 0.0004943520823551732, "loss": 5.4769, "mean_token_accuracy": 0.1671273186802864, "num_tokens": 17551854.0, "step": 10115 }, { "entropy": 5.58419017791748, "epoch": 0.7873954483563509, "grad_norm": 1.8359375, "learning_rate": 0.0004943459097789252, "loss": 5.3816, "mean_token_accuracy": 0.1663597121834755, "num_tokens": 17560739.0, "step": 10120 }, { "entropy": 5.572810363769531, "epoch": 0.7877844777280685, "grad_norm": 1.375, "learning_rate": 0.0004943397338744523, "loss": 5.4077, "mean_token_accuracy": 0.1652447521686554, "num_tokens": 17569784.0, "step": 10125 }, { "entropy": 5.651245927810669, "epoch": 0.7881735070997861, "grad_norm": 1.5625, "learning_rate": 0.000494333554641848, "loss": 5.5803, "mean_token_accuracy": 0.15896444022655487, "num_tokens": 17579262.0, "step": 10130 }, { "entropy": 5.56685996055603, "epoch": 0.7885625364715037, "grad_norm": 1.5078125, "learning_rate": 0.000494327372081206, "loss": 5.4249, "mean_token_accuracy": 0.16502940356731416, "num_tokens": 17587984.0, "step": 10135 }, { "entropy": 5.54715485572815, "epoch": 0.7889515658432211, "grad_norm": 1.6953125, "learning_rate": 0.0004943211861926204, "loss": 5.3763, "mean_token_accuracy": 0.17046990543603896, "num_tokens": 17596598.0, "step": 10140 }, { "entropy": 5.5723248481750485, "epoch": 0.7893405952149387, "grad_norm": 1.671875, "learning_rate": 0.0004943149969761848, "loss": 5.5089, "mean_token_accuracy": 0.16314789652824402, "num_tokens": 17605768.0, "step": 10145 }, { "entropy": 5.589661455154419, "epoch": 0.7897296245866563, "grad_norm": 1.453125, "learning_rate": 0.0004943088044319932, "loss": 5.4277, "mean_token_accuracy": 0.16240018904209136, "num_tokens": 17614412.0, "step": 10150 }, { "entropy": 5.651829719543457, "epoch": 0.7901186539583739, "grad_norm": 1.5234375, "learning_rate": 0.0004943026085601395, "loss": 5.4399, "mean_token_accuracy": 0.1601569950580597, "num_tokens": 17622515.0, "step": 10155 }, { "entropy": 5.587910747528076, "epoch": 0.7905076833300915, "grad_norm": 2.015625, "learning_rate": 0.0004942964093607178, "loss": 5.365, "mean_token_accuracy": 0.16747316867113113, "num_tokens": 17631256.0, "step": 10160 }, { "entropy": 5.6510865688323975, "epoch": 0.790896712701809, "grad_norm": 1.5234375, "learning_rate": 0.0004942902068338222, "loss": 5.5021, "mean_token_accuracy": 0.1550629422068596, "num_tokens": 17639648.0, "step": 10165 }, { "entropy": 5.615673446655274, "epoch": 0.7912857420735265, "grad_norm": 1.421875, "learning_rate": 0.0004942840009795466, "loss": 5.4277, "mean_token_accuracy": 0.1639723613858223, "num_tokens": 17648225.0, "step": 10170 }, { "entropy": 5.598308277130127, "epoch": 0.7916747714452441, "grad_norm": 1.5078125, "learning_rate": 0.0004942777917979855, "loss": 5.4785, "mean_token_accuracy": 0.16637687385082245, "num_tokens": 17656764.0, "step": 10175 }, { "entropy": 5.592406749725342, "epoch": 0.7920638008169617, "grad_norm": 1.84375, "learning_rate": 0.0004942715792892328, "loss": 5.4409, "mean_token_accuracy": 0.15991899520158767, "num_tokens": 17665127.0, "step": 10180 }, { "entropy": 5.562086486816407, "epoch": 0.7924528301886793, "grad_norm": 1.453125, "learning_rate": 0.000494265363453383, "loss": 5.3483, "mean_token_accuracy": 0.1689964562654495, "num_tokens": 17673297.0, "step": 10185 }, { "entropy": 5.594065761566162, "epoch": 0.7928418595603968, "grad_norm": 1.4609375, "learning_rate": 0.0004942591442905302, "loss": 5.4877, "mean_token_accuracy": 0.1662108927965164, "num_tokens": 17681816.0, "step": 10190 }, { "entropy": 5.619212293624878, "epoch": 0.7932308889321144, "grad_norm": 1.7109375, "learning_rate": 0.0004942529218007689, "loss": 5.4946, "mean_token_accuracy": 0.16034965813159943, "num_tokens": 17690588.0, "step": 10195 }, { "entropy": 5.606663799285888, "epoch": 0.7936199183038319, "grad_norm": 1.703125, "learning_rate": 0.0004942466959841936, "loss": 5.4009, "mean_token_accuracy": 0.16643059998750687, "num_tokens": 17699196.0, "step": 10200 }, { "entropy": 5.684493541717529, "epoch": 0.7940089476755495, "grad_norm": 1.9765625, "learning_rate": 0.0004942404668408985, "loss": 5.4966, "mean_token_accuracy": 0.16475944668054582, "num_tokens": 17708928.0, "step": 10205 }, { "entropy": 5.64884467124939, "epoch": 0.7943979770472671, "grad_norm": 1.4453125, "learning_rate": 0.0004942342343709783, "loss": 5.3999, "mean_token_accuracy": 0.16832922548055648, "num_tokens": 17717888.0, "step": 10210 }, { "entropy": 5.6147425174713135, "epoch": 0.7947870064189846, "grad_norm": 1.5234375, "learning_rate": 0.0004942279985745275, "loss": 5.4201, "mean_token_accuracy": 0.1606283888220787, "num_tokens": 17726022.0, "step": 10215 }, { "entropy": 5.52122130393982, "epoch": 0.7951760357907022, "grad_norm": 1.796875, "learning_rate": 0.0004942217594516409, "loss": 5.3901, "mean_token_accuracy": 0.16497442424297332, "num_tokens": 17733998.0, "step": 10220 }, { "entropy": 5.584072780609131, "epoch": 0.7955650651624198, "grad_norm": 1.4921875, "learning_rate": 0.000494215517002413, "loss": 5.4461, "mean_token_accuracy": 0.1670831933617592, "num_tokens": 17742039.0, "step": 10225 }, { "entropy": 5.565745782852173, "epoch": 0.7959540945341373, "grad_norm": 1.375, "learning_rate": 0.0004942092712269384, "loss": 5.3595, "mean_token_accuracy": 0.17128196358680725, "num_tokens": 17751474.0, "step": 10230 }, { "entropy": 5.531363391876221, "epoch": 0.7963431239058549, "grad_norm": 1.546875, "learning_rate": 0.0004942030221253122, "loss": 5.3525, "mean_token_accuracy": 0.16915419846773147, "num_tokens": 17759483.0, "step": 10235 }, { "entropy": 5.5520336627960205, "epoch": 0.7967321532775724, "grad_norm": 1.5859375, "learning_rate": 0.0004941967696976289, "loss": 5.4772, "mean_token_accuracy": 0.16447118073701858, "num_tokens": 17768025.0, "step": 10240 }, { "entropy": 5.5067604064941404, "epoch": 0.79712118264929, "grad_norm": 1.6640625, "learning_rate": 0.0004941905139439835, "loss": 5.3213, "mean_token_accuracy": 0.16718516796827315, "num_tokens": 17776861.0, "step": 10245 }, { "entropy": 5.572161340713501, "epoch": 0.7975102120210076, "grad_norm": 1.453125, "learning_rate": 0.0004941842548644712, "loss": 5.4757, "mean_token_accuracy": 0.165050645172596, "num_tokens": 17786221.0, "step": 10250 }, { "entropy": 5.631086683273315, "epoch": 0.7978992413927252, "grad_norm": 1.6953125, "learning_rate": 0.0004941779924591864, "loss": 5.4619, "mean_token_accuracy": 0.15975369215011598, "num_tokens": 17794619.0, "step": 10255 }, { "entropy": 5.614037752151489, "epoch": 0.7982882707644428, "grad_norm": 1.4140625, "learning_rate": 0.0004941717267282244, "loss": 5.4449, "mean_token_accuracy": 0.16635915637016296, "num_tokens": 17803288.0, "step": 10260 }, { "entropy": 5.569530868530274, "epoch": 0.7986773001361602, "grad_norm": 1.4921875, "learning_rate": 0.0004941654576716806, "loss": 5.513, "mean_token_accuracy": 0.1579871207475662, "num_tokens": 17812648.0, "step": 10265 }, { "entropy": 5.544220733642578, "epoch": 0.7990663295078778, "grad_norm": 1.4453125, "learning_rate": 0.0004941591852896495, "loss": 5.4183, "mean_token_accuracy": 0.168813855946064, "num_tokens": 17821955.0, "step": 10270 }, { "entropy": 5.671693468093872, "epoch": 0.7994553588795954, "grad_norm": 1.359375, "learning_rate": 0.0004941529095822268, "loss": 5.4531, "mean_token_accuracy": 0.16473222225904466, "num_tokens": 17829987.0, "step": 10275 }, { "entropy": 5.563750839233398, "epoch": 0.799844388251313, "grad_norm": 1.546875, "learning_rate": 0.0004941466305495074, "loss": 5.4015, "mean_token_accuracy": 0.17213702201843262, "num_tokens": 17839298.0, "step": 10280 }, { "entropy": 5.580596446990967, "epoch": 0.8002334176230306, "grad_norm": 1.5703125, "learning_rate": 0.0004941403481915867, "loss": 5.4335, "mean_token_accuracy": 0.16103956699371338, "num_tokens": 17847950.0, "step": 10285 }, { "entropy": 5.6678954601287845, "epoch": 0.800622446994748, "grad_norm": 1.6171875, "learning_rate": 0.0004941340625085601, "loss": 5.5517, "mean_token_accuracy": 0.15696440488100052, "num_tokens": 17857416.0, "step": 10290 }, { "entropy": 5.685216808319092, "epoch": 0.8010114763664656, "grad_norm": 1.5625, "learning_rate": 0.0004941277735005228, "loss": 5.4051, "mean_token_accuracy": 0.17213125079870223, "num_tokens": 17866516.0, "step": 10295 }, { "entropy": 5.651232957839966, "epoch": 0.8014005057381832, "grad_norm": 1.4375, "learning_rate": 0.0004941214811675702, "loss": 5.5713, "mean_token_accuracy": 0.1570074513554573, "num_tokens": 17875823.0, "step": 10300 }, { "entropy": 5.529204177856445, "epoch": 0.8017895351099008, "grad_norm": 1.4609375, "learning_rate": 0.0004941151855097982, "loss": 5.4453, "mean_token_accuracy": 0.16270828992128372, "num_tokens": 17883597.0, "step": 10305 }, { "entropy": 5.655588626861572, "epoch": 0.8021785644816184, "grad_norm": 1.5, "learning_rate": 0.0004941088865273018, "loss": 5.4267, "mean_token_accuracy": 0.15925383567810059, "num_tokens": 17892053.0, "step": 10310 }, { "entropy": 5.571537494659424, "epoch": 0.802567593853336, "grad_norm": 1.6171875, "learning_rate": 0.0004941025842201769, "loss": 5.34, "mean_token_accuracy": 0.1758824184536934, "num_tokens": 17900187.0, "step": 10315 }, { "entropy": 5.566791629791259, "epoch": 0.8029566232250535, "grad_norm": 1.484375, "learning_rate": 0.0004940962785885189, "loss": 5.5103, "mean_token_accuracy": 0.16310321539640427, "num_tokens": 17908608.0, "step": 10320 }, { "entropy": 5.621613883972168, "epoch": 0.803345652596771, "grad_norm": 1.4140625, "learning_rate": 0.0004940899696324237, "loss": 5.3931, "mean_token_accuracy": 0.16399924606084823, "num_tokens": 17917331.0, "step": 10325 }, { "entropy": 5.639385461807251, "epoch": 0.8037346819684886, "grad_norm": 1.5078125, "learning_rate": 0.0004940836573519868, "loss": 5.5026, "mean_token_accuracy": 0.16221323907375335, "num_tokens": 17925228.0, "step": 10330 }, { "entropy": 5.588077640533447, "epoch": 0.8041237113402062, "grad_norm": 1.53125, "learning_rate": 0.0004940773417473043, "loss": 5.386, "mean_token_accuracy": 0.16964919567108155, "num_tokens": 17934110.0, "step": 10335 }, { "entropy": 5.571057844161987, "epoch": 0.8045127407119238, "grad_norm": 1.515625, "learning_rate": 0.0004940710228184717, "loss": 5.4002, "mean_token_accuracy": 0.16821952313184738, "num_tokens": 17942237.0, "step": 10340 }, { "entropy": 5.536181497573852, "epoch": 0.8049017700836413, "grad_norm": 1.296875, "learning_rate": 0.000494064700565585, "loss": 5.2754, "mean_token_accuracy": 0.17488184869289397, "num_tokens": 17951288.0, "step": 10345 }, { "entropy": 5.613046884536743, "epoch": 0.8052907994553589, "grad_norm": 1.3125, "learning_rate": 0.0004940583749887403, "loss": 5.5177, "mean_token_accuracy": 0.1582699842751026, "num_tokens": 17960300.0, "step": 10350 }, { "entropy": 5.569222831726075, "epoch": 0.8056798288270764, "grad_norm": 1.9140625, "learning_rate": 0.0004940520460880333, "loss": 5.388, "mean_token_accuracy": 0.16975254267454148, "num_tokens": 17968745.0, "step": 10355 }, { "entropy": 5.536905717849732, "epoch": 0.806068858198794, "grad_norm": 1.5703125, "learning_rate": 0.0004940457138635601, "loss": 5.3868, "mean_token_accuracy": 0.17145797312259675, "num_tokens": 17976614.0, "step": 10360 }, { "entropy": 5.601132726669311, "epoch": 0.8064578875705116, "grad_norm": 1.484375, "learning_rate": 0.0004940393783154169, "loss": 5.5609, "mean_token_accuracy": 0.15555154234170915, "num_tokens": 17984769.0, "step": 10365 }, { "entropy": 5.637803840637207, "epoch": 0.8068469169422291, "grad_norm": 1.53125, "learning_rate": 0.0004940330394436999, "loss": 5.4096, "mean_token_accuracy": 0.16131651550531387, "num_tokens": 17992885.0, "step": 10370 }, { "entropy": 5.6023236274719235, "epoch": 0.8072359463139467, "grad_norm": 1.5625, "learning_rate": 0.000494026697248505, "loss": 5.4427, "mean_token_accuracy": 0.16060977727174758, "num_tokens": 18001752.0, "step": 10375 }, { "entropy": 5.539025354385376, "epoch": 0.8076249756856643, "grad_norm": 1.671875, "learning_rate": 0.0004940203517299287, "loss": 5.4514, "mean_token_accuracy": 0.16818694472312928, "num_tokens": 18009939.0, "step": 10380 }, { "entropy": 5.642893218994141, "epoch": 0.8080140050573819, "grad_norm": 1.5859375, "learning_rate": 0.000494014002888067, "loss": 5.4256, "mean_token_accuracy": 0.17641784995794296, "num_tokens": 18017993.0, "step": 10385 }, { "entropy": 5.685582017898559, "epoch": 0.8084030344290994, "grad_norm": 1.2734375, "learning_rate": 0.0004940076507230166, "loss": 5.5275, "mean_token_accuracy": 0.1595136985182762, "num_tokens": 18027564.0, "step": 10390 }, { "entropy": 5.601905393600464, "epoch": 0.8087920638008169, "grad_norm": 1.5, "learning_rate": 0.0004940012952348735, "loss": 5.4925, "mean_token_accuracy": 0.1663194105029106, "num_tokens": 18036174.0, "step": 10395 }, { "entropy": 5.584610557556152, "epoch": 0.8091810931725345, "grad_norm": 2.578125, "learning_rate": 0.0004939949364237345, "loss": 5.4184, "mean_token_accuracy": 0.16337654888629913, "num_tokens": 18044994.0, "step": 10400 }, { "entropy": 5.556111240386963, "epoch": 0.8095701225442521, "grad_norm": 1.3515625, "learning_rate": 0.0004939885742896958, "loss": 5.414, "mean_token_accuracy": 0.17001941949129104, "num_tokens": 18053789.0, "step": 10405 }, { "entropy": 5.656559991836548, "epoch": 0.8099591519159697, "grad_norm": 1.4921875, "learning_rate": 0.000493982208832854, "loss": 5.5409, "mean_token_accuracy": 0.15735476613044738, "num_tokens": 18063483.0, "step": 10410 }, { "entropy": 5.597215843200684, "epoch": 0.8103481812876873, "grad_norm": 1.5234375, "learning_rate": 0.0004939758400533058, "loss": 5.3369, "mean_token_accuracy": 0.16720130443572997, "num_tokens": 18071952.0, "step": 10415 }, { "entropy": 5.521363878250122, "epoch": 0.8107372106594047, "grad_norm": 1.3828125, "learning_rate": 0.0004939694679511478, "loss": 5.3825, "mean_token_accuracy": 0.16801090091466903, "num_tokens": 18080323.0, "step": 10420 }, { "entropy": 5.6019659519195555, "epoch": 0.8111262400311223, "grad_norm": 1.53125, "learning_rate": 0.0004939630925264765, "loss": 5.4981, "mean_token_accuracy": 0.16568824797868728, "num_tokens": 18089458.0, "step": 10425 }, { "entropy": 5.640874862670898, "epoch": 0.8115152694028399, "grad_norm": 1.953125, "learning_rate": 0.000493956713779389, "loss": 5.4191, "mean_token_accuracy": 0.16081434786319732, "num_tokens": 18098553.0, "step": 10430 }, { "entropy": 5.577661180496216, "epoch": 0.8119042987745575, "grad_norm": 1.5546875, "learning_rate": 0.0004939503317099817, "loss": 5.5074, "mean_token_accuracy": 0.16271842867136002, "num_tokens": 18106794.0, "step": 10435 }, { "entropy": 5.592539739608765, "epoch": 0.8122933281462751, "grad_norm": 1.609375, "learning_rate": 0.0004939439463183517, "loss": 5.3803, "mean_token_accuracy": 0.1721673861145973, "num_tokens": 18115509.0, "step": 10440 }, { "entropy": 5.6062883853912355, "epoch": 0.8126823575179926, "grad_norm": 1.4375, "learning_rate": 0.0004939375576045958, "loss": 5.5061, "mean_token_accuracy": 0.16080288887023925, "num_tokens": 18124548.0, "step": 10445 }, { "entropy": 5.59943413734436, "epoch": 0.8130713868897101, "grad_norm": 1.640625, "learning_rate": 0.0004939311655688109, "loss": 5.4267, "mean_token_accuracy": 0.16586086750030518, "num_tokens": 18132295.0, "step": 10450 }, { "entropy": 5.616068983078003, "epoch": 0.8134604162614277, "grad_norm": 1.8359375, "learning_rate": 0.0004939247702110941, "loss": 5.5311, "mean_token_accuracy": 0.16209654808044432, "num_tokens": 18140731.0, "step": 10455 }, { "entropy": 5.633013343811035, "epoch": 0.8138494456331453, "grad_norm": 1.2734375, "learning_rate": 0.0004939183715315423, "loss": 5.4039, "mean_token_accuracy": 0.16486435532569885, "num_tokens": 18149834.0, "step": 10460 }, { "entropy": 5.60955114364624, "epoch": 0.8142384750048629, "grad_norm": 2.734375, "learning_rate": 0.0004939119695302526, "loss": 5.3614, "mean_token_accuracy": 0.17106925398111344, "num_tokens": 18158745.0, "step": 10465 }, { "entropy": 5.645635509490967, "epoch": 0.8146275043765804, "grad_norm": 1.9296875, "learning_rate": 0.0004939055642073224, "loss": 5.5618, "mean_token_accuracy": 0.15414967238903046, "num_tokens": 18168292.0, "step": 10470 }, { "entropy": 5.646367979049683, "epoch": 0.815016533748298, "grad_norm": 1.484375, "learning_rate": 0.0004938991555628484, "loss": 5.4561, "mean_token_accuracy": 0.15823084786534308, "num_tokens": 18177592.0, "step": 10475 }, { "entropy": 5.6279990673065186, "epoch": 0.8154055631200156, "grad_norm": 1.421875, "learning_rate": 0.0004938927435969283, "loss": 5.4272, "mean_token_accuracy": 0.16151497662067413, "num_tokens": 18186845.0, "step": 10480 }, { "entropy": 5.614060544967652, "epoch": 0.8157945924917331, "grad_norm": 1.375, "learning_rate": 0.0004938863283096592, "loss": 5.5079, "mean_token_accuracy": 0.15635852068662642, "num_tokens": 18195417.0, "step": 10485 }, { "entropy": 5.601277017593384, "epoch": 0.8161836218634507, "grad_norm": 1.546875, "learning_rate": 0.0004938799097011384, "loss": 5.4367, "mean_token_accuracy": 0.16019178926944733, "num_tokens": 18204009.0, "step": 10490 }, { "entropy": 5.568668603897095, "epoch": 0.8165726512351682, "grad_norm": 1.578125, "learning_rate": 0.0004938734877714634, "loss": 5.4354, "mean_token_accuracy": 0.1707957848906517, "num_tokens": 18211927.0, "step": 10495 }, { "entropy": 5.516373252868652, "epoch": 0.8169616806068858, "grad_norm": 1.484375, "learning_rate": 0.0004938670625207317, "loss": 5.3591, "mean_token_accuracy": 0.17173811048269272, "num_tokens": 18220394.0, "step": 10500 }, { "entropy": 5.631072282791138, "epoch": 0.8173507099786034, "grad_norm": 1.53125, "learning_rate": 0.0004938606339490406, "loss": 5.4695, "mean_token_accuracy": 0.16214495599269868, "num_tokens": 18229803.0, "step": 10505 }, { "entropy": 5.617847442626953, "epoch": 0.817739739350321, "grad_norm": 1.8046875, "learning_rate": 0.0004938542020564877, "loss": 5.4333, "mean_token_accuracy": 0.16107070446014404, "num_tokens": 18238431.0, "step": 10510 }, { "entropy": 5.549394273757935, "epoch": 0.8181287687220385, "grad_norm": 1.546875, "learning_rate": 0.0004938477668431706, "loss": 5.4465, "mean_token_accuracy": 0.16725078821182252, "num_tokens": 18246745.0, "step": 10515 }, { "entropy": 5.530304431915283, "epoch": 0.8185177980937561, "grad_norm": 1.6484375, "learning_rate": 0.0004938413283091871, "loss": 5.4062, "mean_token_accuracy": 0.1659283459186554, "num_tokens": 18255569.0, "step": 10520 }, { "entropy": 5.569682216644287, "epoch": 0.8189068274654736, "grad_norm": 1.625, "learning_rate": 0.0004938348864546347, "loss": 5.3463, "mean_token_accuracy": 0.16907418817281722, "num_tokens": 18263711.0, "step": 10525 }, { "entropy": 5.705848264694214, "epoch": 0.8192958568371912, "grad_norm": 1.484375, "learning_rate": 0.0004938284412796111, "loss": 5.5241, "mean_token_accuracy": 0.16439357846975328, "num_tokens": 18272220.0, "step": 10530 }, { "entropy": 5.573349475860596, "epoch": 0.8196848862089088, "grad_norm": 1.640625, "learning_rate": 0.0004938219927842144, "loss": 5.4329, "mean_token_accuracy": 0.163949453830719, "num_tokens": 18281107.0, "step": 10535 }, { "entropy": 5.4945001125335695, "epoch": 0.8200739155806264, "grad_norm": 1.4375, "learning_rate": 0.0004938155409685422, "loss": 5.3947, "mean_token_accuracy": 0.16415611356496812, "num_tokens": 18290196.0, "step": 10540 }, { "entropy": 5.641933822631836, "epoch": 0.820462944952344, "grad_norm": 1.9609375, "learning_rate": 0.0004938090858326923, "loss": 5.5487, "mean_token_accuracy": 0.16089368164539336, "num_tokens": 18299418.0, "step": 10545 }, { "entropy": 5.534397268295288, "epoch": 0.8208519743240614, "grad_norm": 1.5078125, "learning_rate": 0.000493802627376763, "loss": 5.2681, "mean_token_accuracy": 0.17511842250823975, "num_tokens": 18308171.0, "step": 10550 }, { "entropy": 5.6119359016418455, "epoch": 0.821241003695779, "grad_norm": 2.5, "learning_rate": 0.0004937961656008518, "loss": 5.469, "mean_token_accuracy": 0.16383302211761475, "num_tokens": 18317144.0, "step": 10555 }, { "entropy": 5.598818588256836, "epoch": 0.8216300330674966, "grad_norm": 1.5078125, "learning_rate": 0.0004937897005050573, "loss": 5.5389, "mean_token_accuracy": 0.16111208945512773, "num_tokens": 18326648.0, "step": 10560 }, { "entropy": 5.663065338134766, "epoch": 0.8220190624392142, "grad_norm": 1.625, "learning_rate": 0.0004937832320894772, "loss": 5.4837, "mean_token_accuracy": 0.16640617996454238, "num_tokens": 18335901.0, "step": 10565 }, { "entropy": 5.592900085449219, "epoch": 0.8224080918109318, "grad_norm": 1.6875, "learning_rate": 0.0004937767603542098, "loss": 5.4167, "mean_token_accuracy": 0.16778741925954818, "num_tokens": 18344905.0, "step": 10570 }, { "entropy": 5.480745840072632, "epoch": 0.8227971211826492, "grad_norm": 1.4453125, "learning_rate": 0.0004937702852993534, "loss": 5.3637, "mean_token_accuracy": 0.17065452486276628, "num_tokens": 18353422.0, "step": 10575 }, { "entropy": 5.719949340820312, "epoch": 0.8231861505543668, "grad_norm": 1.484375, "learning_rate": 0.000493763806925006, "loss": 5.5222, "mean_token_accuracy": 0.1527490124106407, "num_tokens": 18361632.0, "step": 10580 }, { "entropy": 5.584030675888061, "epoch": 0.8235751799260844, "grad_norm": 1.90625, "learning_rate": 0.0004937573252312661, "loss": 5.3702, "mean_token_accuracy": 0.17391784489154816, "num_tokens": 18370142.0, "step": 10585 }, { "entropy": 5.516370964050293, "epoch": 0.823964209297802, "grad_norm": 1.8125, "learning_rate": 0.000493750840218232, "loss": 5.3987, "mean_token_accuracy": 0.16997681856155394, "num_tokens": 18378245.0, "step": 10590 }, { "entropy": 5.530230712890625, "epoch": 0.8243532386695196, "grad_norm": 1.5625, "learning_rate": 0.0004937443518860021, "loss": 5.371, "mean_token_accuracy": 0.16971075683832168, "num_tokens": 18386814.0, "step": 10595 }, { "entropy": 5.557858180999756, "epoch": 0.8247422680412371, "grad_norm": 1.65625, "learning_rate": 0.0004937378602346747, "loss": 5.3934, "mean_token_accuracy": 0.16131658852100372, "num_tokens": 18396276.0, "step": 10600 }, { "entropy": 5.602482557296753, "epoch": 0.8251312974129547, "grad_norm": 2.578125, "learning_rate": 0.0004937313652643485, "loss": 5.4063, "mean_token_accuracy": 0.16615637689828872, "num_tokens": 18404445.0, "step": 10605 }, { "entropy": 5.520392036437988, "epoch": 0.8255203267846722, "grad_norm": 2.296875, "learning_rate": 0.000493724866975122, "loss": 5.3031, "mean_token_accuracy": 0.1748577743768692, "num_tokens": 18412870.0, "step": 10610 }, { "entropy": 5.508503103256226, "epoch": 0.8259093561563898, "grad_norm": 1.796875, "learning_rate": 0.0004937183653670937, "loss": 5.4393, "mean_token_accuracy": 0.16420634537935258, "num_tokens": 18421084.0, "step": 10615 }, { "entropy": 5.564705753326416, "epoch": 0.8262983855281074, "grad_norm": 1.609375, "learning_rate": 0.0004937118604403623, "loss": 5.4678, "mean_token_accuracy": 0.16587617248296738, "num_tokens": 18429869.0, "step": 10620 }, { "entropy": 5.573436832427978, "epoch": 0.8266874148998249, "grad_norm": 1.78125, "learning_rate": 0.0004937053521950266, "loss": 5.3284, "mean_token_accuracy": 0.16766274869441986, "num_tokens": 18438747.0, "step": 10625 }, { "entropy": 5.665083026885986, "epoch": 0.8270764442715425, "grad_norm": 1.5546875, "learning_rate": 0.0004936988406311854, "loss": 5.5365, "mean_token_accuracy": 0.15890450030565262, "num_tokens": 18447241.0, "step": 10630 }, { "entropy": 5.7015656471252445, "epoch": 0.8274654736432601, "grad_norm": 1.7890625, "learning_rate": 0.0004936923257489373, "loss": 5.5596, "mean_token_accuracy": 0.15821138247847558, "num_tokens": 18455757.0, "step": 10635 }, { "entropy": 5.544709491729736, "epoch": 0.8278545030149776, "grad_norm": 1.71875, "learning_rate": 0.0004936858075483811, "loss": 5.3769, "mean_token_accuracy": 0.17397935390472413, "num_tokens": 18463863.0, "step": 10640 }, { "entropy": 5.556622886657715, "epoch": 0.8282435323866952, "grad_norm": 3.0625, "learning_rate": 0.000493679286029616, "loss": 5.557, "mean_token_accuracy": 0.1569342777132988, "num_tokens": 18472396.0, "step": 10645 }, { "entropy": 5.580170726776123, "epoch": 0.8286325617584127, "grad_norm": 1.4921875, "learning_rate": 0.0004936727611927407, "loss": 5.4125, "mean_token_accuracy": 0.1605270177125931, "num_tokens": 18480625.0, "step": 10650 }, { "entropy": 5.61102328300476, "epoch": 0.8290215911301303, "grad_norm": 1.421875, "learning_rate": 0.0004936662330378546, "loss": 5.4834, "mean_token_accuracy": 0.1617751434445381, "num_tokens": 18489878.0, "step": 10655 }, { "entropy": 5.580025768280029, "epoch": 0.8294106205018479, "grad_norm": 1.4453125, "learning_rate": 0.0004936597015650561, "loss": 5.3825, "mean_token_accuracy": 0.16149143129587173, "num_tokens": 18498873.0, "step": 10660 }, { "entropy": 5.667516469955444, "epoch": 0.8297996498735655, "grad_norm": 2.046875, "learning_rate": 0.0004936531667744448, "loss": 5.514, "mean_token_accuracy": 0.15458784252405167, "num_tokens": 18507716.0, "step": 10665 }, { "entropy": 5.58152208328247, "epoch": 0.8301886792452831, "grad_norm": 1.4921875, "learning_rate": 0.0004936466286661197, "loss": 5.3541, "mean_token_accuracy": 0.1737774208188057, "num_tokens": 18516547.0, "step": 10670 }, { "entropy": 5.597664213180542, "epoch": 0.8305777086170005, "grad_norm": 1.4140625, "learning_rate": 0.00049364008724018, "loss": 5.4877, "mean_token_accuracy": 0.16016840189695358, "num_tokens": 18525714.0, "step": 10675 }, { "entropy": 5.611033296585083, "epoch": 0.8309667379887181, "grad_norm": 1.4296875, "learning_rate": 0.000493633542496725, "loss": 5.5175, "mean_token_accuracy": 0.16490766108036042, "num_tokens": 18534981.0, "step": 10680 }, { "entropy": 5.605623769760132, "epoch": 0.8313557673604357, "grad_norm": 1.6015625, "learning_rate": 0.0004936269944358539, "loss": 5.4396, "mean_token_accuracy": 0.16582519561052322, "num_tokens": 18543599.0, "step": 10685 }, { "entropy": 5.6430579662323, "epoch": 0.8317447967321533, "grad_norm": 1.453125, "learning_rate": 0.0004936204430576664, "loss": 5.4097, "mean_token_accuracy": 0.17386528998613357, "num_tokens": 18552207.0, "step": 10690 }, { "entropy": 5.586783695220947, "epoch": 0.8321338261038709, "grad_norm": 1.375, "learning_rate": 0.0004936138883622614, "loss": 5.4901, "mean_token_accuracy": 0.16271726936101913, "num_tokens": 18560421.0, "step": 10695 }, { "entropy": 5.592414093017578, "epoch": 0.8325228554755884, "grad_norm": 1.6796875, "learning_rate": 0.0004936073303497387, "loss": 5.3776, "mean_token_accuracy": 0.17105771005153655, "num_tokens": 18568812.0, "step": 10700 }, { "entropy": 5.595654630661011, "epoch": 0.8329118848473059, "grad_norm": 1.65625, "learning_rate": 0.0004936007690201976, "loss": 5.3693, "mean_token_accuracy": 0.16839257776737213, "num_tokens": 18577077.0, "step": 10705 }, { "entropy": 5.580293750762939, "epoch": 0.8333009142190235, "grad_norm": 1.4140625, "learning_rate": 0.000493594204373738, "loss": 5.4792, "mean_token_accuracy": 0.16489122807979584, "num_tokens": 18585754.0, "step": 10710 }, { "entropy": 5.522100019454956, "epoch": 0.8336899435907411, "grad_norm": 1.546875, "learning_rate": 0.0004935876364104591, "loss": 5.3631, "mean_token_accuracy": 0.16696490049362184, "num_tokens": 18594578.0, "step": 10715 }, { "entropy": 5.617912912368775, "epoch": 0.8340789729624587, "grad_norm": 1.390625, "learning_rate": 0.0004935810651304608, "loss": 5.4762, "mean_token_accuracy": 0.1588385820388794, "num_tokens": 18603810.0, "step": 10720 }, { "entropy": 5.6939843654632565, "epoch": 0.8344680023341763, "grad_norm": 1.5546875, "learning_rate": 0.0004935744905338427, "loss": 5.4456, "mean_token_accuracy": 0.161747607588768, "num_tokens": 18612870.0, "step": 10725 }, { "entropy": 5.620265007019043, "epoch": 0.8348570317058938, "grad_norm": 1.609375, "learning_rate": 0.0004935679126207046, "loss": 5.5157, "mean_token_accuracy": 0.1638943523168564, "num_tokens": 18621353.0, "step": 10730 }, { "entropy": 5.502186822891235, "epoch": 0.8352460610776113, "grad_norm": 1.5859375, "learning_rate": 0.0004935613313911463, "loss": 5.3857, "mean_token_accuracy": 0.1673603981733322, "num_tokens": 18630152.0, "step": 10735 }, { "entropy": 5.562418603897095, "epoch": 0.8356350904493289, "grad_norm": 1.703125, "learning_rate": 0.0004935547468452678, "loss": 5.4313, "mean_token_accuracy": 0.16592019349336623, "num_tokens": 18639278.0, "step": 10740 }, { "entropy": 5.610720300674439, "epoch": 0.8360241198210465, "grad_norm": 1.9375, "learning_rate": 0.0004935481589831688, "loss": 5.4182, "mean_token_accuracy": 0.1697460889816284, "num_tokens": 18647436.0, "step": 10745 }, { "entropy": 5.701122903823853, "epoch": 0.8364131491927641, "grad_norm": 1.7421875, "learning_rate": 0.0004935415678049492, "loss": 5.442, "mean_token_accuracy": 0.15971136838197708, "num_tokens": 18655532.0, "step": 10750 }, { "entropy": 5.636491298675537, "epoch": 0.8368021785644816, "grad_norm": 1.4609375, "learning_rate": 0.0004935349733107094, "loss": 5.4711, "mean_token_accuracy": 0.16443484872579575, "num_tokens": 18664827.0, "step": 10755 }, { "entropy": 5.548076486587524, "epoch": 0.8371912079361992, "grad_norm": 1.5, "learning_rate": 0.000493528375500549, "loss": 5.3793, "mean_token_accuracy": 0.1734402894973755, "num_tokens": 18673535.0, "step": 10760 }, { "entropy": 5.615402460098267, "epoch": 0.8375802373079168, "grad_norm": 1.609375, "learning_rate": 0.0004935217743745685, "loss": 5.5589, "mean_token_accuracy": 0.15757714211940765, "num_tokens": 18682223.0, "step": 10765 }, { "entropy": 5.717745971679688, "epoch": 0.8379692666796343, "grad_norm": 1.5703125, "learning_rate": 0.0004935151699328677, "loss": 5.4631, "mean_token_accuracy": 0.16686998009681703, "num_tokens": 18690847.0, "step": 10770 }, { "entropy": 5.659970808029175, "epoch": 0.8383582960513519, "grad_norm": 1.578125, "learning_rate": 0.0004935085621755471, "loss": 5.4589, "mean_token_accuracy": 0.1638115555047989, "num_tokens": 18699658.0, "step": 10775 }, { "entropy": 5.596157026290894, "epoch": 0.8387473254230694, "grad_norm": 1.3671875, "learning_rate": 0.000493501951102707, "loss": 5.4399, "mean_token_accuracy": 0.1618892252445221, "num_tokens": 18708396.0, "step": 10780 }, { "entropy": 5.562104082107544, "epoch": 0.839136354794787, "grad_norm": 1.8125, "learning_rate": 0.0004934953367144474, "loss": 5.4614, "mean_token_accuracy": 0.16248811781406403, "num_tokens": 18717185.0, "step": 10785 }, { "entropy": 5.659436798095703, "epoch": 0.8395253841665046, "grad_norm": 1.3984375, "learning_rate": 0.0004934887190108688, "loss": 5.3989, "mean_token_accuracy": 0.16952570229768754, "num_tokens": 18725493.0, "step": 10790 }, { "entropy": 5.608885335922241, "epoch": 0.8399144135382222, "grad_norm": 1.6171875, "learning_rate": 0.0004934820979920719, "loss": 5.3988, "mean_token_accuracy": 0.16731245517730714, "num_tokens": 18733843.0, "step": 10795 }, { "entropy": 5.575446748733521, "epoch": 0.8403034429099397, "grad_norm": 1.4921875, "learning_rate": 0.0004934754736581567, "loss": 5.4595, "mean_token_accuracy": 0.16522205770015716, "num_tokens": 18742226.0, "step": 10800 }, { "entropy": 5.669210577011109, "epoch": 0.8406924722816572, "grad_norm": 1.4453125, "learning_rate": 0.000493468846009224, "loss": 5.5991, "mean_token_accuracy": 0.15872693657875062, "num_tokens": 18751117.0, "step": 10805 }, { "entropy": 5.614519691467285, "epoch": 0.8410815016533748, "grad_norm": 1.3671875, "learning_rate": 0.0004934622150453742, "loss": 5.4192, "mean_token_accuracy": 0.16686538308858873, "num_tokens": 18759244.0, "step": 10810 }, { "entropy": 5.567561769485474, "epoch": 0.8414705310250924, "grad_norm": 1.5859375, "learning_rate": 0.000493455580766708, "loss": 5.4834, "mean_token_accuracy": 0.16303838342428206, "num_tokens": 18768107.0, "step": 10815 }, { "entropy": 5.531203556060791, "epoch": 0.84185956039681, "grad_norm": 1.5390625, "learning_rate": 0.0004934489431733262, "loss": 5.323, "mean_token_accuracy": 0.16933274567127227, "num_tokens": 18777419.0, "step": 10820 }, { "entropy": 5.629980516433716, "epoch": 0.8422485897685276, "grad_norm": 1.765625, "learning_rate": 0.0004934423022653293, "loss": 5.4494, "mean_token_accuracy": 0.16474525183439254, "num_tokens": 18786410.0, "step": 10825 }, { "entropy": 5.597207403182983, "epoch": 0.842637619140245, "grad_norm": 1.5, "learning_rate": 0.0004934356580428182, "loss": 5.4088, "mean_token_accuracy": 0.1639324113726616, "num_tokens": 18794409.0, "step": 10830 }, { "entropy": 5.546269083023072, "epoch": 0.8430266485119626, "grad_norm": 1.5546875, "learning_rate": 0.0004934290105058937, "loss": 5.4686, "mean_token_accuracy": 0.16208438575267792, "num_tokens": 18803561.0, "step": 10835 }, { "entropy": 5.5684432029724125, "epoch": 0.8434156778836802, "grad_norm": 1.6015625, "learning_rate": 0.0004934223596546565, "loss": 5.4267, "mean_token_accuracy": 0.16030320823192595, "num_tokens": 18812096.0, "step": 10840 }, { "entropy": 5.600976467132568, "epoch": 0.8438047072553978, "grad_norm": 1.5234375, "learning_rate": 0.0004934157054892077, "loss": 5.4528, "mean_token_accuracy": 0.1602882444858551, "num_tokens": 18820506.0, "step": 10845 }, { "entropy": 5.616394281387329, "epoch": 0.8441937366271154, "grad_norm": 2.09375, "learning_rate": 0.0004934090480096482, "loss": 5.4516, "mean_token_accuracy": 0.16456348299980164, "num_tokens": 18829437.0, "step": 10850 }, { "entropy": 5.699944686889649, "epoch": 0.8445827659988329, "grad_norm": 1.453125, "learning_rate": 0.0004934023872160791, "loss": 5.5665, "mean_token_accuracy": 0.16061313152313234, "num_tokens": 18838759.0, "step": 10855 }, { "entropy": 5.597001600265503, "epoch": 0.8449717953705504, "grad_norm": 1.4921875, "learning_rate": 0.0004933957231086014, "loss": 5.4612, "mean_token_accuracy": 0.16601901054382323, "num_tokens": 18847000.0, "step": 10860 }, { "entropy": 5.601649618148803, "epoch": 0.845360824742268, "grad_norm": 1.3828125, "learning_rate": 0.0004933890556873161, "loss": 5.5343, "mean_token_accuracy": 0.1564929887652397, "num_tokens": 18855370.0, "step": 10865 }, { "entropy": 5.698432302474975, "epoch": 0.8457498541139856, "grad_norm": 1.7265625, "learning_rate": 0.0004933823849523246, "loss": 5.5949, "mean_token_accuracy": 0.15831229239702224, "num_tokens": 18863825.0, "step": 10870 }, { "entropy": 5.620156240463257, "epoch": 0.8461388834857032, "grad_norm": 1.5546875, "learning_rate": 0.0004933757109037279, "loss": 5.3282, "mean_token_accuracy": 0.1642865091562271, "num_tokens": 18872088.0, "step": 10875 }, { "entropy": 5.5633057117462155, "epoch": 0.8465279128574207, "grad_norm": 1.4921875, "learning_rate": 0.0004933690335416274, "loss": 5.3486, "mean_token_accuracy": 0.1773277997970581, "num_tokens": 18880472.0, "step": 10880 }, { "entropy": 5.661197471618652, "epoch": 0.8469169422291383, "grad_norm": 1.5703125, "learning_rate": 0.0004933623528661245, "loss": 5.5364, "mean_token_accuracy": 0.16062142550945283, "num_tokens": 18889822.0, "step": 10885 }, { "entropy": 5.6680803298950195, "epoch": 0.8473059716008559, "grad_norm": 1.4140625, "learning_rate": 0.0004933556688773203, "loss": 5.461, "mean_token_accuracy": 0.1654386967420578, "num_tokens": 18897542.0, "step": 10890 }, { "entropy": 5.52772364616394, "epoch": 0.8476950009725734, "grad_norm": 1.7265625, "learning_rate": 0.0004933489815753165, "loss": 5.5129, "mean_token_accuracy": 0.1636799842119217, "num_tokens": 18906330.0, "step": 10895 }, { "entropy": 5.554571342468262, "epoch": 0.848084030344291, "grad_norm": 1.484375, "learning_rate": 0.0004933422909602143, "loss": 5.3405, "mean_token_accuracy": 0.17273216545581818, "num_tokens": 18914176.0, "step": 10900 }, { "entropy": 5.5777268409729, "epoch": 0.8484730597160085, "grad_norm": 1.4921875, "learning_rate": 0.0004933355970321155, "loss": 5.3792, "mean_token_accuracy": 0.17397787570953369, "num_tokens": 18922233.0, "step": 10905 }, { "entropy": 5.512351560592651, "epoch": 0.8488620890877261, "grad_norm": 1.4609375, "learning_rate": 0.0004933288997911215, "loss": 5.4074, "mean_token_accuracy": 0.17171715646982194, "num_tokens": 18930742.0, "step": 10910 }, { "entropy": 5.58294711112976, "epoch": 0.8492511184594437, "grad_norm": 1.640625, "learning_rate": 0.0004933221992373338, "loss": 5.3429, "mean_token_accuracy": 0.1723746880888939, "num_tokens": 18938879.0, "step": 10915 }, { "entropy": 5.702480030059815, "epoch": 0.8496401478311613, "grad_norm": 1.34375, "learning_rate": 0.0004933154953708544, "loss": 5.5466, "mean_token_accuracy": 0.1529100403189659, "num_tokens": 18947753.0, "step": 10920 }, { "entropy": 5.628855419158936, "epoch": 0.8500291772028788, "grad_norm": 1.453125, "learning_rate": 0.0004933087881917848, "loss": 5.4423, "mean_token_accuracy": 0.16019981801509858, "num_tokens": 18956805.0, "step": 10925 }, { "entropy": 5.513213014602661, "epoch": 0.8504182065745964, "grad_norm": 1.484375, "learning_rate": 0.0004933020777002268, "loss": 5.3946, "mean_token_accuracy": 0.1699616253376007, "num_tokens": 18965683.0, "step": 10930 }, { "entropy": 5.545962190628051, "epoch": 0.8508072359463139, "grad_norm": 1.3671875, "learning_rate": 0.0004932953638962823, "loss": 5.3836, "mean_token_accuracy": 0.1677742287516594, "num_tokens": 18973873.0, "step": 10935 }, { "entropy": 5.533621215820313, "epoch": 0.8511962653180315, "grad_norm": 1.46875, "learning_rate": 0.000493288646780053, "loss": 5.3252, "mean_token_accuracy": 0.1759396269917488, "num_tokens": 18982097.0, "step": 10940 }, { "entropy": 5.569990348815918, "epoch": 0.8515852946897491, "grad_norm": 1.5234375, "learning_rate": 0.0004932819263516409, "loss": 5.3822, "mean_token_accuracy": 0.16632181257009507, "num_tokens": 18991019.0, "step": 10945 }, { "entropy": 5.584324312210083, "epoch": 0.8519743240614667, "grad_norm": 1.375, "learning_rate": 0.0004932752026111481, "loss": 5.3909, "mean_token_accuracy": 0.16592037975788115, "num_tokens": 18999231.0, "step": 10950 }, { "entropy": 5.627434206008911, "epoch": 0.8523633534331843, "grad_norm": 1.703125, "learning_rate": 0.0004932684755586765, "loss": 5.4736, "mean_token_accuracy": 0.16317906975746155, "num_tokens": 19007807.0, "step": 10955 }, { "entropy": 5.536687231063842, "epoch": 0.8527523828049017, "grad_norm": 1.609375, "learning_rate": 0.0004932617451943282, "loss": 5.4578, "mean_token_accuracy": 0.16746993213891984, "num_tokens": 19017908.0, "step": 10960 }, { "entropy": 5.55510458946228, "epoch": 0.8531414121766193, "grad_norm": 1.65625, "learning_rate": 0.0004932550115182053, "loss": 5.4541, "mean_token_accuracy": 0.16267437040805816, "num_tokens": 19026999.0, "step": 10965 }, { "entropy": 5.516574144363403, "epoch": 0.8535304415483369, "grad_norm": 1.515625, "learning_rate": 0.00049324827453041, "loss": 5.3652, "mean_token_accuracy": 0.17764215916395187, "num_tokens": 19035738.0, "step": 10970 }, { "entropy": 5.5748766422271725, "epoch": 0.8539194709200545, "grad_norm": 1.515625, "learning_rate": 0.0004932415342310446, "loss": 5.4544, "mean_token_accuracy": 0.16744358092546463, "num_tokens": 19044530.0, "step": 10975 }, { "entropy": 5.563995313644409, "epoch": 0.8543085002917721, "grad_norm": 1.640625, "learning_rate": 0.0004932347906202111, "loss": 5.4462, "mean_token_accuracy": 0.16135307550430297, "num_tokens": 19053306.0, "step": 10980 }, { "entropy": 5.668405628204345, "epoch": 0.8546975296634896, "grad_norm": 1.46875, "learning_rate": 0.000493228043698012, "loss": 5.444, "mean_token_accuracy": 0.1676616132259369, "num_tokens": 19062172.0, "step": 10985 }, { "entropy": 5.448013257980347, "epoch": 0.8550865590352071, "grad_norm": 1.5546875, "learning_rate": 0.0004932212934645498, "loss": 5.2317, "mean_token_accuracy": 0.17657214850187303, "num_tokens": 19070804.0, "step": 10990 }, { "entropy": 5.558322095870972, "epoch": 0.8554755884069247, "grad_norm": 1.90625, "learning_rate": 0.0004932145399199268, "loss": 5.3942, "mean_token_accuracy": 0.17129886597394944, "num_tokens": 19079055.0, "step": 10995 }, { "entropy": 5.553512859344482, "epoch": 0.8558646177786423, "grad_norm": 1.5625, "learning_rate": 0.0004932077830642455, "loss": 5.3717, "mean_token_accuracy": 0.16821828484535217, "num_tokens": 19087459.0, "step": 11000 }, { "entropy": 5.458574676513672, "epoch": 0.8562536471503599, "grad_norm": 1.5546875, "learning_rate": 0.0004932010228976084, "loss": 5.2555, "mean_token_accuracy": 0.1769370749592781, "num_tokens": 19096271.0, "step": 11005 }, { "entropy": 5.552489280700684, "epoch": 0.8566426765220774, "grad_norm": 1.59375, "learning_rate": 0.000493194259420118, "loss": 5.4576, "mean_token_accuracy": 0.1654369756579399, "num_tokens": 19105257.0, "step": 11010 }, { "entropy": 5.599417304992675, "epoch": 0.857031705893795, "grad_norm": 1.6015625, "learning_rate": 0.000493187492631877, "loss": 5.4055, "mean_token_accuracy": 0.17078562825918198, "num_tokens": 19113673.0, "step": 11015 }, { "entropy": 5.586803674697876, "epoch": 0.8574207352655125, "grad_norm": 2.3125, "learning_rate": 0.0004931807225329882, "loss": 5.3628, "mean_token_accuracy": 0.17019713819026946, "num_tokens": 19121635.0, "step": 11020 }, { "entropy": 5.576512002944947, "epoch": 0.8578097646372301, "grad_norm": 1.6328125, "learning_rate": 0.0004931739491235541, "loss": 5.4334, "mean_token_accuracy": 0.16907898634672164, "num_tokens": 19130097.0, "step": 11025 }, { "entropy": 5.505575513839721, "epoch": 0.8581987940089477, "grad_norm": 1.5234375, "learning_rate": 0.0004931671724036777, "loss": 5.3411, "mean_token_accuracy": 0.17085011452436447, "num_tokens": 19138349.0, "step": 11030 }, { "entropy": 5.521160554885864, "epoch": 0.8585878233806652, "grad_norm": 1.671875, "learning_rate": 0.0004931603923734616, "loss": 5.431, "mean_token_accuracy": 0.16136478036642074, "num_tokens": 19146948.0, "step": 11035 }, { "entropy": 5.5303449630737305, "epoch": 0.8589768527523828, "grad_norm": 1.65625, "learning_rate": 0.0004931536090330088, "loss": 5.3903, "mean_token_accuracy": 0.16915357261896133, "num_tokens": 19155372.0, "step": 11040 }, { "entropy": 5.659363651275635, "epoch": 0.8593658821241004, "grad_norm": 1.7578125, "learning_rate": 0.0004931468223824222, "loss": 5.4744, "mean_token_accuracy": 0.16891405135393142, "num_tokens": 19163634.0, "step": 11045 }, { "entropy": 5.687005615234375, "epoch": 0.859754911495818, "grad_norm": 1.546875, "learning_rate": 0.0004931400324218048, "loss": 5.4874, "mean_token_accuracy": 0.16447663456201553, "num_tokens": 19171582.0, "step": 11050 }, { "entropy": 5.593333196640015, "epoch": 0.8601439408675355, "grad_norm": 1.59375, "learning_rate": 0.0004931332391512597, "loss": 5.4967, "mean_token_accuracy": 0.16020538061857223, "num_tokens": 19181136.0, "step": 11055 }, { "entropy": 5.567076349258423, "epoch": 0.860532970239253, "grad_norm": 1.6015625, "learning_rate": 0.0004931264425708897, "loss": 5.4898, "mean_token_accuracy": 0.15613535791635513, "num_tokens": 19189389.0, "step": 11060 }, { "entropy": 5.629894351959228, "epoch": 0.8609219996109706, "grad_norm": 1.6171875, "learning_rate": 0.0004931196426807983, "loss": 5.462, "mean_token_accuracy": 0.171858774125576, "num_tokens": 19198315.0, "step": 11065 }, { "entropy": 5.690217018127441, "epoch": 0.8613110289826882, "grad_norm": 1.4765625, "learning_rate": 0.0004931128394810884, "loss": 5.4957, "mean_token_accuracy": 0.1585194043815136, "num_tokens": 19207234.0, "step": 11070 }, { "entropy": 5.594514226913452, "epoch": 0.8617000583544058, "grad_norm": 1.4375, "learning_rate": 0.0004931060329718634, "loss": 5.4816, "mean_token_accuracy": 0.15357260406017303, "num_tokens": 19216552.0, "step": 11075 }, { "entropy": 5.605134344100952, "epoch": 0.8620890877261234, "grad_norm": 1.6484375, "learning_rate": 0.0004930992231532265, "loss": 5.4304, "mean_token_accuracy": 0.15944818556308746, "num_tokens": 19225237.0, "step": 11080 }, { "entropy": 5.532908391952515, "epoch": 0.8624781170978408, "grad_norm": 1.9609375, "learning_rate": 0.000493092410025281, "loss": 5.3591, "mean_token_accuracy": 0.17342484295368193, "num_tokens": 19233246.0, "step": 11085 }, { "entropy": 5.534931993484497, "epoch": 0.8628671464695584, "grad_norm": 1.6640625, "learning_rate": 0.0004930855935881302, "loss": 5.374, "mean_token_accuracy": 0.16980006992816926, "num_tokens": 19241748.0, "step": 11090 }, { "entropy": 5.624445199966431, "epoch": 0.863256175841276, "grad_norm": 1.4375, "learning_rate": 0.0004930787738418777, "loss": 5.5339, "mean_token_accuracy": 0.16268638968467714, "num_tokens": 19250259.0, "step": 11095 }, { "entropy": 5.631997871398926, "epoch": 0.8636452052129936, "grad_norm": 1.890625, "learning_rate": 0.0004930719507866269, "loss": 5.607, "mean_token_accuracy": 0.16095600426197051, "num_tokens": 19259266.0, "step": 11100 }, { "entropy": 5.629003381729126, "epoch": 0.8640342345847112, "grad_norm": 1.46875, "learning_rate": 0.0004930651244224814, "loss": 5.4365, "mean_token_accuracy": 0.16444171816110612, "num_tokens": 19268099.0, "step": 11105 }, { "entropy": 5.575818014144898, "epoch": 0.8644232639564287, "grad_norm": 1.4296875, "learning_rate": 0.0004930582947495448, "loss": 5.3094, "mean_token_accuracy": 0.17518702149391174, "num_tokens": 19276894.0, "step": 11110 }, { "entropy": 5.506184387207031, "epoch": 0.8648122933281462, "grad_norm": 1.5078125, "learning_rate": 0.0004930514617679206, "loss": 5.4067, "mean_token_accuracy": 0.16996466964483262, "num_tokens": 19285724.0, "step": 11115 }, { "entropy": 5.595422697067261, "epoch": 0.8652013226998638, "grad_norm": 2.53125, "learning_rate": 0.0004930446254777125, "loss": 5.3213, "mean_token_accuracy": 0.17358873635530472, "num_tokens": 19294468.0, "step": 11120 }, { "entropy": 5.595965957641601, "epoch": 0.8655903520715814, "grad_norm": 1.390625, "learning_rate": 0.0004930377858790242, "loss": 5.3934, "mean_token_accuracy": 0.16887759119272233, "num_tokens": 19303575.0, "step": 11125 }, { "entropy": 5.632161092758179, "epoch": 0.865979381443299, "grad_norm": 1.7109375, "learning_rate": 0.0004930309429719595, "loss": 5.5483, "mean_token_accuracy": 0.1665432259440422, "num_tokens": 19312778.0, "step": 11130 }, { "entropy": 5.628087949752808, "epoch": 0.8663684108150166, "grad_norm": 1.4765625, "learning_rate": 0.0004930240967566224, "loss": 5.4051, "mean_token_accuracy": 0.16356466412544252, "num_tokens": 19320725.0, "step": 11135 }, { "entropy": 5.617732286453247, "epoch": 0.8667574401867341, "grad_norm": 1.546875, "learning_rate": 0.0004930172472331167, "loss": 5.4315, "mean_token_accuracy": 0.17228960543870925, "num_tokens": 19329842.0, "step": 11140 }, { "entropy": 5.508480453491211, "epoch": 0.8671464695584516, "grad_norm": 1.7109375, "learning_rate": 0.0004930103944015463, "loss": 5.4311, "mean_token_accuracy": 0.1688416540622711, "num_tokens": 19338136.0, "step": 11145 }, { "entropy": 5.53710036277771, "epoch": 0.8675354989301692, "grad_norm": 1.4296875, "learning_rate": 0.0004930035382620149, "loss": 5.3925, "mean_token_accuracy": 0.1666646420955658, "num_tokens": 19346597.0, "step": 11150 }, { "entropy": 5.604273986816406, "epoch": 0.8679245283018868, "grad_norm": 1.4765625, "learning_rate": 0.000492996678814627, "loss": 5.3847, "mean_token_accuracy": 0.16759981960058212, "num_tokens": 19355595.0, "step": 11155 }, { "entropy": 5.591334676742553, "epoch": 0.8683135576736044, "grad_norm": 1.59375, "learning_rate": 0.0004929898160594865, "loss": 5.4532, "mean_token_accuracy": 0.17089799791574478, "num_tokens": 19364133.0, "step": 11160 }, { "entropy": 5.59797625541687, "epoch": 0.8687025870453219, "grad_norm": 1.40625, "learning_rate": 0.0004929829499966974, "loss": 5.5101, "mean_token_accuracy": 0.15949829816818237, "num_tokens": 19373628.0, "step": 11165 }, { "entropy": 5.588370513916016, "epoch": 0.8690916164170395, "grad_norm": 1.4609375, "learning_rate": 0.0004929760806263641, "loss": 5.4369, "mean_token_accuracy": 0.16313839703798294, "num_tokens": 19381901.0, "step": 11170 }, { "entropy": 5.536091613769531, "epoch": 0.8694806457887571, "grad_norm": 1.546875, "learning_rate": 0.0004929692079485906, "loss": 5.527, "mean_token_accuracy": 0.1661791443824768, "num_tokens": 19390390.0, "step": 11175 }, { "entropy": 5.6095479965209964, "epoch": 0.8698696751604746, "grad_norm": 1.4296875, "learning_rate": 0.0004929623319634814, "loss": 5.4858, "mean_token_accuracy": 0.1574648216366768, "num_tokens": 19399858.0, "step": 11180 }, { "entropy": 5.576297378540039, "epoch": 0.8702587045321922, "grad_norm": 1.734375, "learning_rate": 0.0004929554526711407, "loss": 5.4277, "mean_token_accuracy": 0.16378122717142105, "num_tokens": 19409062.0, "step": 11185 }, { "entropy": 5.563224458694458, "epoch": 0.8706477339039097, "grad_norm": 1.609375, "learning_rate": 0.0004929485700716729, "loss": 5.4028, "mean_token_accuracy": 0.1680426374077797, "num_tokens": 19417228.0, "step": 11190 }, { "entropy": 5.610040950775146, "epoch": 0.8710367632756273, "grad_norm": 1.4921875, "learning_rate": 0.0004929416841651824, "loss": 5.509, "mean_token_accuracy": 0.1611345425248146, "num_tokens": 19426086.0, "step": 11195 }, { "entropy": 5.659562110900879, "epoch": 0.8714257926473449, "grad_norm": 1.8359375, "learning_rate": 0.0004929347949517739, "loss": 5.5053, "mean_token_accuracy": 0.1610720545053482, "num_tokens": 19435363.0, "step": 11200 }, { "entropy": 5.569135046005249, "epoch": 0.8718148220190625, "grad_norm": 1.6953125, "learning_rate": 0.0004929279024315516, "loss": 5.305, "mean_token_accuracy": 0.17181036323308946, "num_tokens": 19443355.0, "step": 11205 }, { "entropy": 5.524402189254761, "epoch": 0.87220385139078, "grad_norm": 1.53125, "learning_rate": 0.0004929210066046204, "loss": 5.3494, "mean_token_accuracy": 0.16735538244247436, "num_tokens": 19452217.0, "step": 11210 }, { "entropy": 5.613103628158569, "epoch": 0.8725928807624975, "grad_norm": 1.5390625, "learning_rate": 0.0004929141074710847, "loss": 5.5384, "mean_token_accuracy": 0.156987027823925, "num_tokens": 19460034.0, "step": 11215 }, { "entropy": 5.593009805679321, "epoch": 0.8729819101342151, "grad_norm": 1.5625, "learning_rate": 0.0004929072050310491, "loss": 5.4874, "mean_token_accuracy": 0.1655286356806755, "num_tokens": 19468403.0, "step": 11220 }, { "entropy": 5.5963386535644535, "epoch": 0.8733709395059327, "grad_norm": 1.4921875, "learning_rate": 0.0004929002992846188, "loss": 5.5069, "mean_token_accuracy": 0.16459607928991318, "num_tokens": 19477551.0, "step": 11225 }, { "entropy": 5.642898416519165, "epoch": 0.8737599688776503, "grad_norm": 1.5078125, "learning_rate": 0.0004928933902318981, "loss": 5.4011, "mean_token_accuracy": 0.16497209072113037, "num_tokens": 19486131.0, "step": 11230 }, { "entropy": 5.639529895782471, "epoch": 0.8741489982493679, "grad_norm": 1.546875, "learning_rate": 0.000492886477872992, "loss": 5.5351, "mean_token_accuracy": 0.15575776249170303, "num_tokens": 19496212.0, "step": 11235 }, { "entropy": 5.561580181121826, "epoch": 0.8745380276210853, "grad_norm": 1.5859375, "learning_rate": 0.0004928795622080054, "loss": 5.372, "mean_token_accuracy": 0.1667099341750145, "num_tokens": 19504556.0, "step": 11240 }, { "entropy": 5.589718866348266, "epoch": 0.8749270569928029, "grad_norm": 1.46875, "learning_rate": 0.0004928726432370434, "loss": 5.4418, "mean_token_accuracy": 0.1647622615098953, "num_tokens": 19512832.0, "step": 11245 }, { "entropy": 5.621614551544189, "epoch": 0.8753160863645205, "grad_norm": 1.3203125, "learning_rate": 0.0004928657209602107, "loss": 5.4634, "mean_token_accuracy": 0.16495981961488723, "num_tokens": 19521410.0, "step": 11250 }, { "entropy": 5.576944732666016, "epoch": 0.8757051157362381, "grad_norm": 1.375, "learning_rate": 0.0004928587953776125, "loss": 5.4316, "mean_token_accuracy": 0.16559310704469682, "num_tokens": 19529935.0, "step": 11255 }, { "entropy": 5.463144540786743, "epoch": 0.8760941451079557, "grad_norm": 1.484375, "learning_rate": 0.0004928518664893538, "loss": 5.3266, "mean_token_accuracy": 0.17452301383018493, "num_tokens": 19538330.0, "step": 11260 }, { "entropy": 5.523600101470947, "epoch": 0.8764831744796732, "grad_norm": 1.6015625, "learning_rate": 0.0004928449342955397, "loss": 5.3399, "mean_token_accuracy": 0.16870104670524597, "num_tokens": 19546860.0, "step": 11265 }, { "entropy": 5.629951238632202, "epoch": 0.8768722038513908, "grad_norm": 1.765625, "learning_rate": 0.0004928379987962756, "loss": 5.4226, "mean_token_accuracy": 0.16777731627225875, "num_tokens": 19554945.0, "step": 11270 }, { "entropy": 5.602519750595093, "epoch": 0.8772612332231083, "grad_norm": 1.671875, "learning_rate": 0.0004928310599916666, "loss": 5.4509, "mean_token_accuracy": 0.16262111216783523, "num_tokens": 19563182.0, "step": 11275 }, { "entropy": 5.526263952255249, "epoch": 0.8776502625948259, "grad_norm": 1.46875, "learning_rate": 0.0004928241178818178, "loss": 5.4305, "mean_token_accuracy": 0.16654721945524215, "num_tokens": 19571405.0, "step": 11280 }, { "entropy": 5.725631141662598, "epoch": 0.8780392919665435, "grad_norm": 1.484375, "learning_rate": 0.0004928171724668349, "loss": 5.5185, "mean_token_accuracy": 0.16668618023395537, "num_tokens": 19580053.0, "step": 11285 }, { "entropy": 5.691386985778808, "epoch": 0.878428321338261, "grad_norm": 1.390625, "learning_rate": 0.0004928102237468229, "loss": 5.5353, "mean_token_accuracy": 0.16114630401134492, "num_tokens": 19588457.0, "step": 11290 }, { "entropy": 5.520010614395142, "epoch": 0.8788173507099786, "grad_norm": 1.484375, "learning_rate": 0.0004928032717218876, "loss": 5.3756, "mean_token_accuracy": 0.16722139418125154, "num_tokens": 19597608.0, "step": 11295 }, { "entropy": 5.5498902797698975, "epoch": 0.8792063800816962, "grad_norm": 1.4453125, "learning_rate": 0.0004927963163921343, "loss": 5.3957, "mean_token_accuracy": 0.17279530167579651, "num_tokens": 19605904.0, "step": 11300 }, { "entropy": 5.604985475540161, "epoch": 0.8795954094534137, "grad_norm": 1.5546875, "learning_rate": 0.0004927893577576685, "loss": 5.3813, "mean_token_accuracy": 0.16346621215343476, "num_tokens": 19614660.0, "step": 11305 }, { "entropy": 5.506232166290284, "epoch": 0.8799844388251313, "grad_norm": 1.7734375, "learning_rate": 0.0004927823958185959, "loss": 5.3655, "mean_token_accuracy": 0.17348123341798782, "num_tokens": 19623210.0, "step": 11310 }, { "entropy": 5.561007976531982, "epoch": 0.8803734681968488, "grad_norm": 1.5703125, "learning_rate": 0.000492775430575022, "loss": 5.4444, "mean_token_accuracy": 0.16233074367046357, "num_tokens": 19631747.0, "step": 11315 }, { "entropy": 5.64417781829834, "epoch": 0.8807624975685664, "grad_norm": 2.03125, "learning_rate": 0.0004927684620270527, "loss": 5.5251, "mean_token_accuracy": 0.15691719055175782, "num_tokens": 19639902.0, "step": 11320 }, { "entropy": 5.673055934906006, "epoch": 0.881151526940284, "grad_norm": 1.625, "learning_rate": 0.0004927614901747935, "loss": 5.5495, "mean_token_accuracy": 0.15953097343444825, "num_tokens": 19648478.0, "step": 11325 }, { "entropy": 5.701460456848144, "epoch": 0.8815405563120016, "grad_norm": 1.5703125, "learning_rate": 0.0004927545150183503, "loss": 5.5502, "mean_token_accuracy": 0.16400340497493743, "num_tokens": 19657467.0, "step": 11330 }, { "entropy": 5.691887903213501, "epoch": 0.8819295856837192, "grad_norm": 1.6640625, "learning_rate": 0.000492747536557829, "loss": 5.5182, "mean_token_accuracy": 0.1579813688993454, "num_tokens": 19665382.0, "step": 11335 }, { "entropy": 5.561461162567139, "epoch": 0.8823186150554367, "grad_norm": 1.453125, "learning_rate": 0.0004927405547933353, "loss": 5.3391, "mean_token_accuracy": 0.16862319111824037, "num_tokens": 19674486.0, "step": 11340 }, { "entropy": 5.607643938064575, "epoch": 0.8827076444271542, "grad_norm": 1.359375, "learning_rate": 0.0004927335697249753, "loss": 5.3618, "mean_token_accuracy": 0.16630233973264694, "num_tokens": 19683060.0, "step": 11345 }, { "entropy": 5.49778938293457, "epoch": 0.8830966737988718, "grad_norm": 1.390625, "learning_rate": 0.0004927265813528549, "loss": 5.3447, "mean_token_accuracy": 0.1723550483584404, "num_tokens": 19691634.0, "step": 11350 }, { "entropy": 5.5745201587677, "epoch": 0.8834857031705894, "grad_norm": 1.3515625, "learning_rate": 0.0004927195896770804, "loss": 5.43, "mean_token_accuracy": 0.1592835769057274, "num_tokens": 19699975.0, "step": 11355 }, { "entropy": 5.609763813018799, "epoch": 0.883874732542307, "grad_norm": 1.625, "learning_rate": 0.0004927125946977574, "loss": 5.3904, "mean_token_accuracy": 0.16351550817489624, "num_tokens": 19708431.0, "step": 11360 }, { "entropy": 5.54373517036438, "epoch": 0.8842637619140246, "grad_norm": 1.671875, "learning_rate": 0.0004927055964149923, "loss": 5.4088, "mean_token_accuracy": 0.16205148696899413, "num_tokens": 19717189.0, "step": 11365 }, { "entropy": 5.623295307159424, "epoch": 0.884652791285742, "grad_norm": 1.609375, "learning_rate": 0.0004926985948288914, "loss": 5.4746, "mean_token_accuracy": 0.1615665078163147, "num_tokens": 19725855.0, "step": 11370 }, { "entropy": 5.572314357757568, "epoch": 0.8850418206574596, "grad_norm": 1.6328125, "learning_rate": 0.0004926915899395608, "loss": 5.373, "mean_token_accuracy": 0.1688873991370201, "num_tokens": 19734617.0, "step": 11375 }, { "entropy": 5.653919458389282, "epoch": 0.8854308500291772, "grad_norm": 1.5546875, "learning_rate": 0.0004926845817471068, "loss": 5.5065, "mean_token_accuracy": 0.16308294236660004, "num_tokens": 19743731.0, "step": 11380 }, { "entropy": 5.674256706237793, "epoch": 0.8858198794008948, "grad_norm": 1.46875, "learning_rate": 0.0004926775702516358, "loss": 5.4546, "mean_token_accuracy": 0.16395652443170547, "num_tokens": 19752336.0, "step": 11385 }, { "entropy": 5.597683382034302, "epoch": 0.8862089087726124, "grad_norm": 1.5078125, "learning_rate": 0.0004926705554532541, "loss": 5.4435, "mean_token_accuracy": 0.16464806348085403, "num_tokens": 19761488.0, "step": 11390 }, { "entropy": 5.5336109638214115, "epoch": 0.8865979381443299, "grad_norm": 1.4375, "learning_rate": 0.0004926635373520682, "loss": 5.3615, "mean_token_accuracy": 0.16801237165927888, "num_tokens": 19770330.0, "step": 11395 }, { "entropy": 5.606996393203735, "epoch": 0.8869869675160474, "grad_norm": 1.5859375, "learning_rate": 0.0004926565159481845, "loss": 5.4215, "mean_token_accuracy": 0.1609994277358055, "num_tokens": 19779037.0, "step": 11400 }, { "entropy": 5.6447957992553714, "epoch": 0.887375996887765, "grad_norm": 1.5, "learning_rate": 0.0004926494912417097, "loss": 5.4884, "mean_token_accuracy": 0.16048842221498488, "num_tokens": 19787661.0, "step": 11405 }, { "entropy": 5.582346391677857, "epoch": 0.8877650262594826, "grad_norm": 1.5859375, "learning_rate": 0.0004926424632327503, "loss": 5.3951, "mean_token_accuracy": 0.16768926084041597, "num_tokens": 19796421.0, "step": 11410 }, { "entropy": 5.584974193572998, "epoch": 0.8881540556312002, "grad_norm": 1.6796875, "learning_rate": 0.0004926354319214129, "loss": 5.3981, "mean_token_accuracy": 0.16604495644569398, "num_tokens": 19805842.0, "step": 11415 }, { "entropy": 5.655823516845703, "epoch": 0.8885430850029177, "grad_norm": 1.515625, "learning_rate": 0.0004926283973078041, "loss": 5.4218, "mean_token_accuracy": 0.16787973940372466, "num_tokens": 19814179.0, "step": 11420 }, { "entropy": 5.613330984115601, "epoch": 0.8889321143746353, "grad_norm": 1.5625, "learning_rate": 0.0004926213593920309, "loss": 5.4923, "mean_token_accuracy": 0.16426144540309906, "num_tokens": 19822435.0, "step": 11425 }, { "entropy": 5.588300609588623, "epoch": 0.8893211437463528, "grad_norm": 1.546875, "learning_rate": 0.0004926143181742, "loss": 5.4055, "mean_token_accuracy": 0.1616242453455925, "num_tokens": 19830300.0, "step": 11430 }, { "entropy": 5.58564510345459, "epoch": 0.8897101731180704, "grad_norm": 1.609375, "learning_rate": 0.0004926072736544181, "loss": 5.5159, "mean_token_accuracy": 0.16276822090148926, "num_tokens": 19839264.0, "step": 11435 }, { "entropy": 5.621684646606445, "epoch": 0.890099202489788, "grad_norm": 1.6171875, "learning_rate": 0.0004926002258327922, "loss": 5.4597, "mean_token_accuracy": 0.16228195577859877, "num_tokens": 19848086.0, "step": 11440 }, { "entropy": 5.6392816543579105, "epoch": 0.8904882318615055, "grad_norm": 1.8359375, "learning_rate": 0.0004925931747094292, "loss": 5.4315, "mean_token_accuracy": 0.15673258900642395, "num_tokens": 19856571.0, "step": 11445 }, { "entropy": 5.5869261741638185, "epoch": 0.8908772612332231, "grad_norm": 1.8671875, "learning_rate": 0.0004925861202844361, "loss": 5.4554, "mean_token_accuracy": 0.16131344437599182, "num_tokens": 19865272.0, "step": 11450 }, { "entropy": 5.5566261291503904, "epoch": 0.8912662906049407, "grad_norm": 1.609375, "learning_rate": 0.00049257906255792, "loss": 5.4055, "mean_token_accuracy": 0.1614033855497837, "num_tokens": 19874307.0, "step": 11455 }, { "entropy": 5.58982629776001, "epoch": 0.8916553199766583, "grad_norm": 1.6015625, "learning_rate": 0.000492572001529988, "loss": 5.4526, "mean_token_accuracy": 0.16618746519088745, "num_tokens": 19882851.0, "step": 11460 }, { "entropy": 5.654384803771973, "epoch": 0.8920443493483758, "grad_norm": 1.5546875, "learning_rate": 0.0004925649372007469, "loss": 5.3495, "mean_token_accuracy": 0.1758921191096306, "num_tokens": 19891276.0, "step": 11465 }, { "entropy": 5.620083808898926, "epoch": 0.8924333787200933, "grad_norm": 1.515625, "learning_rate": 0.0004925578695703045, "loss": 5.4917, "mean_token_accuracy": 0.15829311907291413, "num_tokens": 19900551.0, "step": 11470 }, { "entropy": 5.639655208587646, "epoch": 0.8928224080918109, "grad_norm": 1.703125, "learning_rate": 0.0004925507986387676, "loss": 5.5149, "mean_token_accuracy": 0.16138267070055007, "num_tokens": 19909412.0, "step": 11475 }, { "entropy": 5.615196323394775, "epoch": 0.8932114374635285, "grad_norm": 2.203125, "learning_rate": 0.0004925437244062436, "loss": 5.3594, "mean_token_accuracy": 0.16976200491189958, "num_tokens": 19918073.0, "step": 11480 }, { "entropy": 5.482284116744995, "epoch": 0.8936004668352461, "grad_norm": 1.484375, "learning_rate": 0.0004925366468728397, "loss": 5.3073, "mean_token_accuracy": 0.1825845032930374, "num_tokens": 19926040.0, "step": 11485 }, { "entropy": 5.53025107383728, "epoch": 0.8939894962069637, "grad_norm": 1.5625, "learning_rate": 0.0004925295660386635, "loss": 5.4712, "mean_token_accuracy": 0.16550873219966888, "num_tokens": 19934543.0, "step": 11490 }, { "entropy": 5.575025939941407, "epoch": 0.8943785255786811, "grad_norm": 1.4921875, "learning_rate": 0.0004925224819038224, "loss": 5.4113, "mean_token_accuracy": 0.1682252526283264, "num_tokens": 19943198.0, "step": 11495 }, { "entropy": 5.554923725128174, "epoch": 0.8947675549503987, "grad_norm": 1.5703125, "learning_rate": 0.0004925153944684239, "loss": 5.3523, "mean_token_accuracy": 0.17520031929016114, "num_tokens": 19952319.0, "step": 11500 }, { "entropy": 5.547123098373413, "epoch": 0.8951565843221163, "grad_norm": 1.703125, "learning_rate": 0.0004925083037325754, "loss": 5.3438, "mean_token_accuracy": 0.16900049149990082, "num_tokens": 19961982.0, "step": 11505 }, { "entropy": 5.5912707328796385, "epoch": 0.8955456136938339, "grad_norm": 1.7578125, "learning_rate": 0.0004925012096963847, "loss": 5.3775, "mean_token_accuracy": 0.16102658361196517, "num_tokens": 19971055.0, "step": 11510 }, { "entropy": 5.426222467422486, "epoch": 0.8959346430655515, "grad_norm": 1.5234375, "learning_rate": 0.0004924941123599593, "loss": 5.2642, "mean_token_accuracy": 0.1792299598455429, "num_tokens": 19979850.0, "step": 11515 }, { "entropy": 5.569857549667359, "epoch": 0.896323672437269, "grad_norm": 1.5234375, "learning_rate": 0.0004924870117234069, "loss": 5.4525, "mean_token_accuracy": 0.16205697506666183, "num_tokens": 19989261.0, "step": 11520 }, { "entropy": 5.60758605003357, "epoch": 0.8967127018089865, "grad_norm": 1.65625, "learning_rate": 0.0004924799077868353, "loss": 5.3745, "mean_token_accuracy": 0.16446672976017, "num_tokens": 19998321.0, "step": 11525 }, { "entropy": 5.539510774612427, "epoch": 0.8971017311807041, "grad_norm": 1.6328125, "learning_rate": 0.0004924728005503522, "loss": 5.4442, "mean_token_accuracy": 0.16351263523101806, "num_tokens": 20007191.0, "step": 11530 }, { "entropy": 5.566989707946777, "epoch": 0.8974907605524217, "grad_norm": 1.640625, "learning_rate": 0.0004924656900140655, "loss": 5.4821, "mean_token_accuracy": 0.16563700139522552, "num_tokens": 20015805.0, "step": 11535 }, { "entropy": 5.563309526443481, "epoch": 0.8978797899241393, "grad_norm": 1.609375, "learning_rate": 0.0004924585761780831, "loss": 5.4314, "mean_token_accuracy": 0.1693728670477867, "num_tokens": 20024861.0, "step": 11540 }, { "entropy": 5.718994665145874, "epoch": 0.8982688192958569, "grad_norm": 1.40625, "learning_rate": 0.000492451459042513, "loss": 5.5048, "mean_token_accuracy": 0.16540486142039298, "num_tokens": 20034208.0, "step": 11545 }, { "entropy": 5.63351469039917, "epoch": 0.8986578486675744, "grad_norm": 1.6953125, "learning_rate": 0.000492444338607463, "loss": 5.4469, "mean_token_accuracy": 0.16422081738710403, "num_tokens": 20042786.0, "step": 11550 }, { "entropy": 5.641626787185669, "epoch": 0.899046878039292, "grad_norm": 1.7890625, "learning_rate": 0.0004924372148730413, "loss": 5.5006, "mean_token_accuracy": 0.1618044413626194, "num_tokens": 20051697.0, "step": 11555 }, { "entropy": 5.640315103530884, "epoch": 0.8994359074110095, "grad_norm": 1.671875, "learning_rate": 0.000492430087839356, "loss": 5.4725, "mean_token_accuracy": 0.1687396615743637, "num_tokens": 20059814.0, "step": 11560 }, { "entropy": 5.575307369232178, "epoch": 0.8998249367827271, "grad_norm": 1.4921875, "learning_rate": 0.0004924229575065152, "loss": 5.4575, "mean_token_accuracy": 0.16698689609766007, "num_tokens": 20068329.0, "step": 11565 }, { "entropy": 5.614092016220093, "epoch": 0.9002139661544447, "grad_norm": 1.75, "learning_rate": 0.000492415823874627, "loss": 5.4582, "mean_token_accuracy": 0.1686816081404686, "num_tokens": 20076925.0, "step": 11570 }, { "entropy": 5.618636560440064, "epoch": 0.9006029955261622, "grad_norm": 1.4921875, "learning_rate": 0.0004924086869437998, "loss": 5.477, "mean_token_accuracy": 0.15615838915109634, "num_tokens": 20085248.0, "step": 11575 }, { "entropy": 5.653695392608642, "epoch": 0.9009920248978798, "grad_norm": 1.5859375, "learning_rate": 0.0004924015467141417, "loss": 5.4472, "mean_token_accuracy": 0.16372430920600892, "num_tokens": 20093929.0, "step": 11580 }, { "entropy": 5.575537443161011, "epoch": 0.9013810542695974, "grad_norm": 1.4609375, "learning_rate": 0.0004923944031857613, "loss": 5.5273, "mean_token_accuracy": 0.1625973328948021, "num_tokens": 20103141.0, "step": 11585 }, { "entropy": 5.583071327209472, "epoch": 0.901770083641315, "grad_norm": 1.578125, "learning_rate": 0.0004923872563587668, "loss": 5.3516, "mean_token_accuracy": 0.17516722828149794, "num_tokens": 20111938.0, "step": 11590 }, { "entropy": 5.563779306411743, "epoch": 0.9021591130130325, "grad_norm": 1.625, "learning_rate": 0.0004923801062332666, "loss": 5.3575, "mean_token_accuracy": 0.17270515710115433, "num_tokens": 20120795.0, "step": 11595 }, { "entropy": 5.5637914657592775, "epoch": 0.90254814238475, "grad_norm": 1.421875, "learning_rate": 0.0004923729528093694, "loss": 5.4399, "mean_token_accuracy": 0.1667784184217453, "num_tokens": 20129816.0, "step": 11600 }, { "entropy": 5.681299018859863, "epoch": 0.9029371717564676, "grad_norm": 1.5390625, "learning_rate": 0.0004923657960871836, "loss": 5.5512, "mean_token_accuracy": 0.15675133019685744, "num_tokens": 20138380.0, "step": 11605 }, { "entropy": 5.657552194595337, "epoch": 0.9033262011281852, "grad_norm": 1.8828125, "learning_rate": 0.0004923586360668178, "loss": 5.5556, "mean_token_accuracy": 0.16022806912660598, "num_tokens": 20147201.0, "step": 11610 }, { "entropy": 5.5744353294372555, "epoch": 0.9037152304999028, "grad_norm": 1.453125, "learning_rate": 0.0004923514727483807, "loss": 5.3958, "mean_token_accuracy": 0.16239219754934311, "num_tokens": 20156744.0, "step": 11615 }, { "entropy": 5.643081378936768, "epoch": 0.9041042598716204, "grad_norm": 1.5, "learning_rate": 0.000492344306131981, "loss": 5.4098, "mean_token_accuracy": 0.168283312022686, "num_tokens": 20165081.0, "step": 11620 }, { "entropy": 5.673436975479126, "epoch": 0.9044932892433378, "grad_norm": 1.6875, "learning_rate": 0.0004923371362177272, "loss": 5.4099, "mean_token_accuracy": 0.16650529354810714, "num_tokens": 20172893.0, "step": 11625 }, { "entropy": 5.595490980148315, "epoch": 0.9048823186150554, "grad_norm": 1.7734375, "learning_rate": 0.0004923299630057284, "loss": 5.4815, "mean_token_accuracy": 0.16391136050224303, "num_tokens": 20181351.0, "step": 11630 }, { "entropy": 5.583002185821533, "epoch": 0.905271347986773, "grad_norm": 1.5859375, "learning_rate": 0.0004923227864960934, "loss": 5.4898, "mean_token_accuracy": 0.15725645869970323, "num_tokens": 20189650.0, "step": 11635 }, { "entropy": 5.686719799041748, "epoch": 0.9056603773584906, "grad_norm": 1.796875, "learning_rate": 0.000492315606688931, "loss": 5.4394, "mean_token_accuracy": 0.15606636852025985, "num_tokens": 20198184.0, "step": 11640 }, { "entropy": 5.691554021835327, "epoch": 0.9060494067302082, "grad_norm": 2.40625, "learning_rate": 0.0004923084235843501, "loss": 5.3587, "mean_token_accuracy": 0.172410349547863, "num_tokens": 20206357.0, "step": 11645 }, { "entropy": 5.539533615112305, "epoch": 0.9064384361019256, "grad_norm": 1.59375, "learning_rate": 0.0004923012371824598, "loss": 5.4629, "mean_token_accuracy": 0.17097723335027695, "num_tokens": 20214384.0, "step": 11650 }, { "entropy": 5.616372919082641, "epoch": 0.9068274654736432, "grad_norm": 1.5546875, "learning_rate": 0.000492294047483369, "loss": 5.4746, "mean_token_accuracy": 0.16025118231773378, "num_tokens": 20224103.0, "step": 11655 }, { "entropy": 5.634894609451294, "epoch": 0.9072164948453608, "grad_norm": 1.9921875, "learning_rate": 0.0004922868544871869, "loss": 5.4794, "mean_token_accuracy": 0.165157687664032, "num_tokens": 20233414.0, "step": 11660 }, { "entropy": 5.620892858505249, "epoch": 0.9076055242170784, "grad_norm": 1.40625, "learning_rate": 0.0004922796581940227, "loss": 5.3324, "mean_token_accuracy": 0.17546915560960769, "num_tokens": 20240988.0, "step": 11665 }, { "entropy": 5.528362703323364, "epoch": 0.907994553588796, "grad_norm": 1.65625, "learning_rate": 0.0004922724586039855, "loss": 5.3643, "mean_token_accuracy": 0.1678197294473648, "num_tokens": 20250066.0, "step": 11670 }, { "entropy": 5.513184261322022, "epoch": 0.9083835829605135, "grad_norm": 1.828125, "learning_rate": 0.0004922652557171846, "loss": 5.3023, "mean_token_accuracy": 0.17026133388280867, "num_tokens": 20258435.0, "step": 11675 }, { "entropy": 5.593416833877564, "epoch": 0.9087726123322311, "grad_norm": 1.5234375, "learning_rate": 0.0004922580495337292, "loss": 5.4836, "mean_token_accuracy": 0.1679489091038704, "num_tokens": 20267345.0, "step": 11680 }, { "entropy": 5.65469651222229, "epoch": 0.9091616417039486, "grad_norm": 2.0625, "learning_rate": 0.0004922508400537288, "loss": 5.5081, "mean_token_accuracy": 0.16376658529043198, "num_tokens": 20275644.0, "step": 11685 }, { "entropy": 5.640007209777832, "epoch": 0.9095506710756662, "grad_norm": 1.4921875, "learning_rate": 0.0004922436272772926, "loss": 5.476, "mean_token_accuracy": 0.16782302558422088, "num_tokens": 20284459.0, "step": 11690 }, { "entropy": 5.6208737850189205, "epoch": 0.9099397004473838, "grad_norm": 1.4296875, "learning_rate": 0.0004922364112045301, "loss": 5.3894, "mean_token_accuracy": 0.1607832819223404, "num_tokens": 20293088.0, "step": 11695 }, { "entropy": 5.504998254776001, "epoch": 0.9103287298191013, "grad_norm": 2.484375, "learning_rate": 0.000492229191835551, "loss": 5.4, "mean_token_accuracy": 0.16904088854789734, "num_tokens": 20301811.0, "step": 11700 }, { "entropy": 5.640305519104004, "epoch": 0.9107177591908189, "grad_norm": 2.171875, "learning_rate": 0.0004922219691704645, "loss": 5.5325, "mean_token_accuracy": 0.15783090144395828, "num_tokens": 20310365.0, "step": 11705 }, { "entropy": 5.680600500106811, "epoch": 0.9111067885625365, "grad_norm": 1.5859375, "learning_rate": 0.0004922147432093805, "loss": 5.4597, "mean_token_accuracy": 0.1692796379327774, "num_tokens": 20318891.0, "step": 11710 }, { "entropy": 5.569218397140503, "epoch": 0.911495817934254, "grad_norm": 1.5546875, "learning_rate": 0.0004922075139524083, "loss": 5.3474, "mean_token_accuracy": 0.17611400932073593, "num_tokens": 20327313.0, "step": 11715 }, { "entropy": 5.541305351257324, "epoch": 0.9118848473059716, "grad_norm": 1.984375, "learning_rate": 0.000492200281399658, "loss": 5.3301, "mean_token_accuracy": 0.17205900996923446, "num_tokens": 20335511.0, "step": 11720 }, { "entropy": 5.546508932113648, "epoch": 0.9122738766776891, "grad_norm": 1.75, "learning_rate": 0.000492193045551239, "loss": 5.3346, "mean_token_accuracy": 0.17597660124301912, "num_tokens": 20343588.0, "step": 11725 }, { "entropy": 5.595340919494629, "epoch": 0.9126629060494067, "grad_norm": 1.546875, "learning_rate": 0.0004921858064072612, "loss": 5.4424, "mean_token_accuracy": 0.16616809666156768, "num_tokens": 20352793.0, "step": 11730 }, { "entropy": 5.558742332458496, "epoch": 0.9130519354211243, "grad_norm": 1.578125, "learning_rate": 0.0004921785639678347, "loss": 5.4892, "mean_token_accuracy": 0.16771798133850097, "num_tokens": 20362480.0, "step": 11735 }, { "entropy": 5.562952852249145, "epoch": 0.9134409647928419, "grad_norm": 2.03125, "learning_rate": 0.000492171318233069, "loss": 5.363, "mean_token_accuracy": 0.17176808118820192, "num_tokens": 20371192.0, "step": 11740 }, { "entropy": 5.651773405075073, "epoch": 0.9138299941645595, "grad_norm": 2.09375, "learning_rate": 0.0004921640692030742, "loss": 5.4804, "mean_token_accuracy": 0.16320589035749436, "num_tokens": 20379322.0, "step": 11745 }, { "entropy": 5.657601451873779, "epoch": 0.914219023536277, "grad_norm": 1.4921875, "learning_rate": 0.0004921568168779603, "loss": 5.4271, "mean_token_accuracy": 0.1589912310242653, "num_tokens": 20387976.0, "step": 11750 }, { "entropy": 5.621883726119995, "epoch": 0.9146080529079945, "grad_norm": 1.6328125, "learning_rate": 0.0004921495612578374, "loss": 5.5132, "mean_token_accuracy": 0.1600305199623108, "num_tokens": 20397398.0, "step": 11755 }, { "entropy": 5.622820043563843, "epoch": 0.9149970822797121, "grad_norm": 1.4921875, "learning_rate": 0.0004921423023428156, "loss": 5.424, "mean_token_accuracy": 0.16491100639104844, "num_tokens": 20406503.0, "step": 11760 }, { "entropy": 5.540057563781739, "epoch": 0.9153861116514297, "grad_norm": 1.515625, "learning_rate": 0.0004921350401330049, "loss": 5.3406, "mean_token_accuracy": 0.17000339776277543, "num_tokens": 20415117.0, "step": 11765 }, { "entropy": 5.543955755233765, "epoch": 0.9157751410231473, "grad_norm": 1.7578125, "learning_rate": 0.0004921277746285155, "loss": 5.4153, "mean_token_accuracy": 0.16678078174591066, "num_tokens": 20423519.0, "step": 11770 }, { "entropy": 5.573290872573852, "epoch": 0.9161641703948649, "grad_norm": 1.5, "learning_rate": 0.0004921205058294579, "loss": 5.3659, "mean_token_accuracy": 0.16791573017835618, "num_tokens": 20431831.0, "step": 11775 }, { "entropy": 5.66247525215149, "epoch": 0.9165531997665823, "grad_norm": 1.609375, "learning_rate": 0.000492113233735942, "loss": 5.5059, "mean_token_accuracy": 0.15884622186422348, "num_tokens": 20440927.0, "step": 11780 }, { "entropy": 5.5654441833496096, "epoch": 0.9169422291382999, "grad_norm": 1.484375, "learning_rate": 0.0004921059583480785, "loss": 5.3926, "mean_token_accuracy": 0.16572857946157454, "num_tokens": 20448974.0, "step": 11785 }, { "entropy": 5.515251779556275, "epoch": 0.9173312585100175, "grad_norm": 1.609375, "learning_rate": 0.0004920986796659775, "loss": 5.3082, "mean_token_accuracy": 0.17805312275886537, "num_tokens": 20457955.0, "step": 11790 }, { "entropy": 5.5523580551147464, "epoch": 0.9177202878817351, "grad_norm": 1.4453125, "learning_rate": 0.0004920913976897498, "loss": 5.3972, "mean_token_accuracy": 0.16891333162784578, "num_tokens": 20465942.0, "step": 11795 }, { "entropy": 5.5653056621551515, "epoch": 0.9181093172534527, "grad_norm": 1.7734375, "learning_rate": 0.0004920841124195055, "loss": 5.4712, "mean_token_accuracy": 0.1669631913304329, "num_tokens": 20474726.0, "step": 11800 }, { "entropy": 5.561779737472534, "epoch": 0.9184983466251702, "grad_norm": 1.5625, "learning_rate": 0.0004920768238553554, "loss": 5.416, "mean_token_accuracy": 0.16652749478816986, "num_tokens": 20483442.0, "step": 11805 }, { "entropy": 5.547149133682251, "epoch": 0.9188873759968877, "grad_norm": 1.4765625, "learning_rate": 0.0004920695319974099, "loss": 5.3741, "mean_token_accuracy": 0.17090764045715331, "num_tokens": 20492950.0, "step": 11810 }, { "entropy": 5.61188268661499, "epoch": 0.9192764053686053, "grad_norm": 1.3671875, "learning_rate": 0.0004920622368457798, "loss": 5.4666, "mean_token_accuracy": 0.1626928448677063, "num_tokens": 20502035.0, "step": 11815 }, { "entropy": 5.617907381057739, "epoch": 0.9196654347403229, "grad_norm": 1.5546875, "learning_rate": 0.0004920549384005759, "loss": 5.3446, "mean_token_accuracy": 0.17139900624752044, "num_tokens": 20510140.0, "step": 11820 }, { "entropy": 5.583600568771362, "epoch": 0.9200544641120405, "grad_norm": 1.578125, "learning_rate": 0.0004920476366619086, "loss": 5.4569, "mean_token_accuracy": 0.1582721382379532, "num_tokens": 20519391.0, "step": 11825 }, { "entropy": 5.664299488067627, "epoch": 0.920443493483758, "grad_norm": 1.9453125, "learning_rate": 0.000492040331629889, "loss": 5.4511, "mean_token_accuracy": 0.16522680073976517, "num_tokens": 20527635.0, "step": 11830 }, { "entropy": 5.6060832977294925, "epoch": 0.9208325228554756, "grad_norm": 1.3203125, "learning_rate": 0.0004920330233046277, "loss": 5.4075, "mean_token_accuracy": 0.16618909686803818, "num_tokens": 20536455.0, "step": 11835 }, { "entropy": 5.636282634735108, "epoch": 0.9212215522271932, "grad_norm": 1.6640625, "learning_rate": 0.0004920257116862359, "loss": 5.546, "mean_token_accuracy": 0.1542813390493393, "num_tokens": 20545887.0, "step": 11840 }, { "entropy": 5.57595739364624, "epoch": 0.9216105815989107, "grad_norm": 1.4296875, "learning_rate": 0.0004920183967748241, "loss": 5.381, "mean_token_accuracy": 0.16687051951885223, "num_tokens": 20554415.0, "step": 11845 }, { "entropy": 5.616524982452392, "epoch": 0.9219996109706283, "grad_norm": 1.6484375, "learning_rate": 0.0004920110785705037, "loss": 5.4938, "mean_token_accuracy": 0.16545359045267105, "num_tokens": 20563081.0, "step": 11850 }, { "entropy": 5.513118267059326, "epoch": 0.9223886403423458, "grad_norm": 1.390625, "learning_rate": 0.0004920037570733857, "loss": 5.3445, "mean_token_accuracy": 0.17197140008211137, "num_tokens": 20571800.0, "step": 11855 }, { "entropy": 5.633137226104736, "epoch": 0.9227776697140634, "grad_norm": 1.4921875, "learning_rate": 0.0004919964322835809, "loss": 5.4673, "mean_token_accuracy": 0.1649052232503891, "num_tokens": 20580481.0, "step": 11860 }, { "entropy": 5.6207211971282955, "epoch": 0.923166699085781, "grad_norm": 1.46875, "learning_rate": 0.0004919891042012006, "loss": 5.3584, "mean_token_accuracy": 0.1680561199784279, "num_tokens": 20589575.0, "step": 11865 }, { "entropy": 5.512158679962158, "epoch": 0.9235557284574986, "grad_norm": 1.5, "learning_rate": 0.0004919817728263562, "loss": 5.4403, "mean_token_accuracy": 0.1664802387356758, "num_tokens": 20598277.0, "step": 11870 }, { "entropy": 5.693507719039917, "epoch": 0.9239447578292161, "grad_norm": 1.4375, "learning_rate": 0.0004919744381591586, "loss": 5.5295, "mean_token_accuracy": 0.16748165041208268, "num_tokens": 20607013.0, "step": 11875 }, { "entropy": 5.640137624740601, "epoch": 0.9243337872009336, "grad_norm": 1.4296875, "learning_rate": 0.0004919671001997193, "loss": 5.4994, "mean_token_accuracy": 0.16177828460931779, "num_tokens": 20615605.0, "step": 11880 }, { "entropy": 5.675401878356934, "epoch": 0.9247228165726512, "grad_norm": 1.4296875, "learning_rate": 0.0004919597589481497, "loss": 5.4499, "mean_token_accuracy": 0.15949563086032867, "num_tokens": 20624275.0, "step": 11885 }, { "entropy": 5.6085638999938965, "epoch": 0.9251118459443688, "grad_norm": 1.4921875, "learning_rate": 0.000491952414404561, "loss": 5.3888, "mean_token_accuracy": 0.1679642006754875, "num_tokens": 20632681.0, "step": 11890 }, { "entropy": 5.659155607223511, "epoch": 0.9255008753160864, "grad_norm": 1.4921875, "learning_rate": 0.0004919450665690646, "loss": 5.4556, "mean_token_accuracy": 0.16983082741498948, "num_tokens": 20641432.0, "step": 11895 }, { "entropy": 5.585770940780639, "epoch": 0.925889904687804, "grad_norm": 1.734375, "learning_rate": 0.0004919377154417724, "loss": 5.4649, "mean_token_accuracy": 0.16276452094316482, "num_tokens": 20650120.0, "step": 11900 }, { "entropy": 5.545875215530396, "epoch": 0.9262789340595214, "grad_norm": 1.4609375, "learning_rate": 0.0004919303610227954, "loss": 5.359, "mean_token_accuracy": 0.16669993549585344, "num_tokens": 20658188.0, "step": 11905 }, { "entropy": 5.514937448501587, "epoch": 0.926667963431239, "grad_norm": 1.53125, "learning_rate": 0.0004919230033122457, "loss": 5.2875, "mean_token_accuracy": 0.1804579585790634, "num_tokens": 20666157.0, "step": 11910 }, { "entropy": 5.547408819198608, "epoch": 0.9270569928029566, "grad_norm": 2.34375, "learning_rate": 0.0004919156423102345, "loss": 5.4928, "mean_token_accuracy": 0.16427554711699485, "num_tokens": 20674995.0, "step": 11915 }, { "entropy": 5.641458177566529, "epoch": 0.9274460221746742, "grad_norm": 1.3671875, "learning_rate": 0.0004919082780168736, "loss": 5.4405, "mean_token_accuracy": 0.16236664950847626, "num_tokens": 20683786.0, "step": 11920 }, { "entropy": 5.585165119171142, "epoch": 0.9278350515463918, "grad_norm": 1.421875, "learning_rate": 0.0004919009104322751, "loss": 5.4596, "mean_token_accuracy": 0.16301724314689636, "num_tokens": 20692582.0, "step": 11925 }, { "entropy": 5.576903438568115, "epoch": 0.9282240809181093, "grad_norm": 1.40625, "learning_rate": 0.0004918935395565503, "loss": 5.4632, "mean_token_accuracy": 0.16221937090158461, "num_tokens": 20700892.0, "step": 11930 }, { "entropy": 5.551387596130371, "epoch": 0.9286131102898268, "grad_norm": 1.5078125, "learning_rate": 0.0004918861653898113, "loss": 5.3381, "mean_token_accuracy": 0.17207940220832824, "num_tokens": 20709521.0, "step": 11935 }, { "entropy": 5.562303304672241, "epoch": 0.9290021396615444, "grad_norm": 1.9765625, "learning_rate": 0.0004918787879321701, "loss": 5.4336, "mean_token_accuracy": 0.16194119304418564, "num_tokens": 20717614.0, "step": 11940 }, { "entropy": 5.563432693481445, "epoch": 0.929391169033262, "grad_norm": 1.4921875, "learning_rate": 0.0004918714071837384, "loss": 5.3715, "mean_token_accuracy": 0.1687655344605446, "num_tokens": 20726624.0, "step": 11945 }, { "entropy": 5.61021842956543, "epoch": 0.9297801984049796, "grad_norm": 1.4921875, "learning_rate": 0.0004918640231446282, "loss": 5.4828, "mean_token_accuracy": 0.16277274787425994, "num_tokens": 20734738.0, "step": 11950 }, { "entropy": 5.605218696594238, "epoch": 0.9301692277766972, "grad_norm": 1.5, "learning_rate": 0.0004918566358149517, "loss": 5.3988, "mean_token_accuracy": 0.16683424711227418, "num_tokens": 20742825.0, "step": 11955 }, { "entropy": 5.578117942810058, "epoch": 0.9305582571484147, "grad_norm": 1.6015625, "learning_rate": 0.000491849245194821, "loss": 5.3779, "mean_token_accuracy": 0.1739774078130722, "num_tokens": 20752132.0, "step": 11960 }, { "entropy": 5.637444067001343, "epoch": 0.9309472865201323, "grad_norm": 1.5546875, "learning_rate": 0.0004918418512843479, "loss": 5.5075, "mean_token_accuracy": 0.1613238826394081, "num_tokens": 20761838.0, "step": 11965 }, { "entropy": 5.56450719833374, "epoch": 0.9313363158918498, "grad_norm": 1.6015625, "learning_rate": 0.0004918344540836451, "loss": 5.3957, "mean_token_accuracy": 0.16996693909168242, "num_tokens": 20770405.0, "step": 11970 }, { "entropy": 5.715441370010376, "epoch": 0.9317253452635674, "grad_norm": 1.515625, "learning_rate": 0.0004918270535928244, "loss": 5.5864, "mean_token_accuracy": 0.15619297772645951, "num_tokens": 20780130.0, "step": 11975 }, { "entropy": 5.594107055664063, "epoch": 0.932114374635285, "grad_norm": 1.7109375, "learning_rate": 0.0004918196498119984, "loss": 5.4561, "mean_token_accuracy": 0.17283804416656495, "num_tokens": 20788852.0, "step": 11980 }, { "entropy": 5.553250312805176, "epoch": 0.9325034040070025, "grad_norm": 1.4453125, "learning_rate": 0.0004918122427412793, "loss": 5.3715, "mean_token_accuracy": 0.1689470276236534, "num_tokens": 20796944.0, "step": 11985 }, { "entropy": 5.54477891921997, "epoch": 0.9328924333787201, "grad_norm": 1.390625, "learning_rate": 0.0004918048323807795, "loss": 5.5106, "mean_token_accuracy": 0.1635565549135208, "num_tokens": 20806118.0, "step": 11990 }, { "entropy": 5.649374771118164, "epoch": 0.9332814627504377, "grad_norm": 1.4609375, "learning_rate": 0.0004917974187306114, "loss": 5.3038, "mean_token_accuracy": 0.17418421804904938, "num_tokens": 20814643.0, "step": 11995 }, { "entropy": 5.6086163997650145, "epoch": 0.9336704921221552, "grad_norm": 2.328125, "learning_rate": 0.0004917900017908875, "loss": 5.3672, "mean_token_accuracy": 0.1686716139316559, "num_tokens": 20823315.0, "step": 12000 }, { "epoch": 0.9336704921221552, "eval_entropy": 5.371572630719799, "eval_loss": 5.466134548187256, "eval_mean_token_accuracy": 0.1723012616067293, "eval_num_tokens": 20823315.0, "eval_runtime": 28.5605, "eval_samples_per_second": 1455.088, "eval_steps_per_second": 181.895, "step": 12000 }, { "entropy": 5.507457256317139, "epoch": 0.9340595214938728, "grad_norm": 1.6484375, "learning_rate": 0.0004917825815617205, "loss": 5.3884, "mean_token_accuracy": 0.17000421285629272, "num_tokens": 20832811.0, "step": 12005 }, { "entropy": 5.613448762893677, "epoch": 0.9344485508655903, "grad_norm": 1.515625, "learning_rate": 0.0004917751580432229, "loss": 5.4398, "mean_token_accuracy": 0.16664963215589523, "num_tokens": 20841824.0, "step": 12010 }, { "entropy": 5.599476003646851, "epoch": 0.9348375802373079, "grad_norm": 1.71875, "learning_rate": 0.0004917677312355072, "loss": 5.3926, "mean_token_accuracy": 0.17509149014949799, "num_tokens": 20850220.0, "step": 12015 }, { "entropy": 5.488557815551758, "epoch": 0.9352266096090255, "grad_norm": 1.4609375, "learning_rate": 0.0004917603011386863, "loss": 5.3347, "mean_token_accuracy": 0.17387936115264893, "num_tokens": 20859193.0, "step": 12020 }, { "entropy": 5.54458532333374, "epoch": 0.9356156389807431, "grad_norm": 1.34375, "learning_rate": 0.0004917528677528727, "loss": 5.3549, "mean_token_accuracy": 0.16718203574419022, "num_tokens": 20867610.0, "step": 12025 }, { "entropy": 5.615087413787842, "epoch": 0.9360046683524607, "grad_norm": 1.515625, "learning_rate": 0.0004917454310781795, "loss": 5.454, "mean_token_accuracy": 0.16309396028518677, "num_tokens": 20876991.0, "step": 12030 }, { "entropy": 5.541305351257324, "epoch": 0.9363936977241781, "grad_norm": 1.59375, "learning_rate": 0.0004917379911147193, "loss": 5.3173, "mean_token_accuracy": 0.16801157742738723, "num_tokens": 20885794.0, "step": 12035 }, { "entropy": 5.619901990890503, "epoch": 0.9367827270958957, "grad_norm": 1.4140625, "learning_rate": 0.0004917305478626049, "loss": 5.5104, "mean_token_accuracy": 0.16595079600811005, "num_tokens": 20893487.0, "step": 12040 }, { "entropy": 5.6008594036102295, "epoch": 0.9371717564676133, "grad_norm": 1.625, "learning_rate": 0.0004917231013219495, "loss": 5.4598, "mean_token_accuracy": 0.1607996016740799, "num_tokens": 20902587.0, "step": 12045 }, { "entropy": 5.596264743804932, "epoch": 0.9375607858393309, "grad_norm": 1.3984375, "learning_rate": 0.000491715651492866, "loss": 5.3903, "mean_token_accuracy": 0.17339229583740234, "num_tokens": 20911062.0, "step": 12050 }, { "entropy": 5.620618295669556, "epoch": 0.9379498152110485, "grad_norm": 1.5078125, "learning_rate": 0.0004917081983754675, "loss": 5.4123, "mean_token_accuracy": 0.16720927357673646, "num_tokens": 20919369.0, "step": 12055 }, { "entropy": 5.613325119018555, "epoch": 0.938338844582766, "grad_norm": 1.71875, "learning_rate": 0.0004917007419698669, "loss": 5.4666, "mean_token_accuracy": 0.1663628563284874, "num_tokens": 20927514.0, "step": 12060 }, { "entropy": 5.677690505981445, "epoch": 0.9387278739544835, "grad_norm": 5.875, "learning_rate": 0.0004916932822761776, "loss": 5.5023, "mean_token_accuracy": 0.16759129613637924, "num_tokens": 20935750.0, "step": 12065 }, { "entropy": 5.5808741569519045, "epoch": 0.9391169033262011, "grad_norm": 1.46875, "learning_rate": 0.0004916858192945126, "loss": 5.3986, "mean_token_accuracy": 0.16836540699005126, "num_tokens": 20944089.0, "step": 12070 }, { "entropy": 5.581806325912476, "epoch": 0.9395059326979187, "grad_norm": 1.515625, "learning_rate": 0.0004916783530249852, "loss": 5.5052, "mean_token_accuracy": 0.1604120537638664, "num_tokens": 20952704.0, "step": 12075 }, { "entropy": 5.61510329246521, "epoch": 0.9398949620696363, "grad_norm": 1.4375, "learning_rate": 0.0004916708834677086, "loss": 5.3592, "mean_token_accuracy": 0.16789056211709977, "num_tokens": 20960741.0, "step": 12080 }, { "entropy": 5.604568719863892, "epoch": 0.9402839914413538, "grad_norm": 1.390625, "learning_rate": 0.0004916634106227962, "loss": 5.3752, "mean_token_accuracy": 0.17388292998075486, "num_tokens": 20968778.0, "step": 12085 }, { "entropy": 5.603709936141968, "epoch": 0.9406730208130714, "grad_norm": 1.3984375, "learning_rate": 0.0004916559344903614, "loss": 5.5405, "mean_token_accuracy": 0.1607699140906334, "num_tokens": 20977993.0, "step": 12090 }, { "entropy": 5.612804269790649, "epoch": 0.941062050184789, "grad_norm": 1.5703125, "learning_rate": 0.0004916484550705176, "loss": 5.3795, "mean_token_accuracy": 0.17117612361907958, "num_tokens": 20986974.0, "step": 12095 }, { "entropy": 5.604335594177246, "epoch": 0.9414510795565065, "grad_norm": 1.4140625, "learning_rate": 0.0004916409723633785, "loss": 5.4724, "mean_token_accuracy": 0.16735209971666337, "num_tokens": 20995224.0, "step": 12100 }, { "entropy": 5.6226420402526855, "epoch": 0.9418401089282241, "grad_norm": 1.4296875, "learning_rate": 0.0004916334863690573, "loss": 5.4697, "mean_token_accuracy": 0.16305154114961623, "num_tokens": 21003270.0, "step": 12105 }, { "entropy": 5.595528697967529, "epoch": 0.9422291382999416, "grad_norm": 1.5234375, "learning_rate": 0.0004916259970876678, "loss": 5.4472, "mean_token_accuracy": 0.16190327256917952, "num_tokens": 21012665.0, "step": 12110 }, { "entropy": 5.630600214004517, "epoch": 0.9426181676716592, "grad_norm": 1.875, "learning_rate": 0.0004916185045193237, "loss": 5.4708, "mean_token_accuracy": 0.1663910672068596, "num_tokens": 21021043.0, "step": 12115 }, { "entropy": 5.621525621414184, "epoch": 0.9430071970433768, "grad_norm": 1.4453125, "learning_rate": 0.0004916110086641384, "loss": 5.3871, "mean_token_accuracy": 0.16917871534824372, "num_tokens": 21029525.0, "step": 12120 }, { "entropy": 5.529054307937622, "epoch": 0.9433962264150944, "grad_norm": 1.4921875, "learning_rate": 0.0004916035095222259, "loss": 5.3924, "mean_token_accuracy": 0.16976384520530702, "num_tokens": 21037687.0, "step": 12125 }, { "entropy": 5.611918115615845, "epoch": 0.9437852557868119, "grad_norm": 1.4140625, "learning_rate": 0.0004915960070936999, "loss": 5.4768, "mean_token_accuracy": 0.16243709176778792, "num_tokens": 21046095.0, "step": 12130 }, { "entropy": 5.659605216979981, "epoch": 0.9441742851585294, "grad_norm": 1.4375, "learning_rate": 0.0004915885013786742, "loss": 5.433, "mean_token_accuracy": 0.16504660099744797, "num_tokens": 21054565.0, "step": 12135 }, { "entropy": 5.49802794456482, "epoch": 0.944563314530247, "grad_norm": 1.5546875, "learning_rate": 0.0004915809923772628, "loss": 5.3443, "mean_token_accuracy": 0.17390815615653993, "num_tokens": 21062942.0, "step": 12140 }, { "entropy": 5.5965657234191895, "epoch": 0.9449523439019646, "grad_norm": 1.5078125, "learning_rate": 0.0004915734800895796, "loss": 5.396, "mean_token_accuracy": 0.1641937553882599, "num_tokens": 21070642.0, "step": 12145 }, { "entropy": 5.623910331726075, "epoch": 0.9453413732736822, "grad_norm": 1.4140625, "learning_rate": 0.0004915659645157383, "loss": 5.3635, "mean_token_accuracy": 0.16894838064908982, "num_tokens": 21079007.0, "step": 12150 }, { "entropy": 5.605703544616699, "epoch": 0.9457304026453998, "grad_norm": 1.4296875, "learning_rate": 0.0004915584456558535, "loss": 5.4377, "mean_token_accuracy": 0.16110673993825914, "num_tokens": 21087672.0, "step": 12155 }, { "entropy": 5.686621379852295, "epoch": 0.9461194320171173, "grad_norm": 1.6484375, "learning_rate": 0.0004915509235100388, "loss": 5.376, "mean_token_accuracy": 0.16856016516685485, "num_tokens": 21095954.0, "step": 12160 }, { "entropy": 5.604067611694336, "epoch": 0.9465084613888348, "grad_norm": 1.375, "learning_rate": 0.0004915433980784086, "loss": 5.3702, "mean_token_accuracy": 0.16448871940374374, "num_tokens": 21104439.0, "step": 12165 }, { "entropy": 5.524645709991455, "epoch": 0.9468974907605524, "grad_norm": 1.6640625, "learning_rate": 0.0004915358693610769, "loss": 5.4059, "mean_token_accuracy": 0.15946614742279053, "num_tokens": 21112933.0, "step": 12170 }, { "entropy": 5.538733863830567, "epoch": 0.94728652013227, "grad_norm": 1.40625, "learning_rate": 0.0004915283373581581, "loss": 5.402, "mean_token_accuracy": 0.1738529697060585, "num_tokens": 21122085.0, "step": 12175 }, { "entropy": 5.634131717681885, "epoch": 0.9476755495039876, "grad_norm": 1.4140625, "learning_rate": 0.0004915208020697664, "loss": 5.4597, "mean_token_accuracy": 0.16466081142425537, "num_tokens": 21130994.0, "step": 12180 }, { "entropy": 5.645436811447143, "epoch": 0.9480645788757052, "grad_norm": 1.3515625, "learning_rate": 0.0004915132634960162, "loss": 5.3834, "mean_token_accuracy": 0.17394153475761415, "num_tokens": 21139744.0, "step": 12185 }, { "entropy": 5.595538473129272, "epoch": 0.9484536082474226, "grad_norm": 1.4453125, "learning_rate": 0.0004915057216370218, "loss": 5.3965, "mean_token_accuracy": 0.1731519356369972, "num_tokens": 21148333.0, "step": 12190 }, { "entropy": 5.519620656967163, "epoch": 0.9488426376191402, "grad_norm": 1.5078125, "learning_rate": 0.0004914981764928977, "loss": 5.326, "mean_token_accuracy": 0.17691762298345565, "num_tokens": 21157450.0, "step": 12195 }, { "entropy": 5.648521041870117, "epoch": 0.9492316669908578, "grad_norm": 1.65625, "learning_rate": 0.0004914906280637584, "loss": 5.5001, "mean_token_accuracy": 0.16335393339395524, "num_tokens": 21166410.0, "step": 12200 }, { "entropy": 5.604200220108032, "epoch": 0.9496206963625754, "grad_norm": 1.3671875, "learning_rate": 0.0004914830763497183, "loss": 5.435, "mean_token_accuracy": 0.16810693889856337, "num_tokens": 21175104.0, "step": 12205 }, { "entropy": 5.597310638427734, "epoch": 0.950009725734293, "grad_norm": 1.7890625, "learning_rate": 0.0004914755213508922, "loss": 5.3788, "mean_token_accuracy": 0.16749434620141984, "num_tokens": 21182597.0, "step": 12210 }, { "entropy": 5.5915443897247314, "epoch": 0.9503987551060105, "grad_norm": 1.453125, "learning_rate": 0.0004914679630673945, "loss": 5.4896, "mean_token_accuracy": 0.16872426271438598, "num_tokens": 21192399.0, "step": 12215 }, { "entropy": 5.56868987083435, "epoch": 0.950787784477728, "grad_norm": 1.6796875, "learning_rate": 0.0004914604014993401, "loss": 5.3472, "mean_token_accuracy": 0.17401702851057052, "num_tokens": 21201275.0, "step": 12220 }, { "entropy": 5.5518927574157715, "epoch": 0.9511768138494456, "grad_norm": 1.5390625, "learning_rate": 0.0004914528366468436, "loss": 5.4565, "mean_token_accuracy": 0.16536201536655426, "num_tokens": 21210491.0, "step": 12225 }, { "entropy": 5.564200925827026, "epoch": 0.9515658432211632, "grad_norm": 1.5234375, "learning_rate": 0.0004914452685100199, "loss": 5.4495, "mean_token_accuracy": 0.1683812901377678, "num_tokens": 21218899.0, "step": 12230 }, { "entropy": 5.501306676864624, "epoch": 0.9519548725928808, "grad_norm": 1.5234375, "learning_rate": 0.0004914376970889836, "loss": 5.3524, "mean_token_accuracy": 0.16297265887260437, "num_tokens": 21227640.0, "step": 12235 }, { "entropy": 5.575056791305542, "epoch": 0.9523439019645983, "grad_norm": 1.5546875, "learning_rate": 0.0004914301223838497, "loss": 5.3197, "mean_token_accuracy": 0.16264411211013793, "num_tokens": 21236422.0, "step": 12240 }, { "entropy": 5.630202198028565, "epoch": 0.9527329313363159, "grad_norm": 1.6015625, "learning_rate": 0.0004914225443947334, "loss": 5.4947, "mean_token_accuracy": 0.16732407957315446, "num_tokens": 21245820.0, "step": 12245 }, { "entropy": 5.647228384017945, "epoch": 0.9531219607080335, "grad_norm": 3.90625, "learning_rate": 0.0004914149631217494, "loss": 5.4399, "mean_token_accuracy": 0.16611770391464234, "num_tokens": 21255570.0, "step": 12250 }, { "entropy": 5.662381029129028, "epoch": 0.953510990079751, "grad_norm": 1.484375, "learning_rate": 0.0004914073785650127, "loss": 5.5614, "mean_token_accuracy": 0.16004973351955415, "num_tokens": 21263712.0, "step": 12255 }, { "entropy": 5.6631018161773685, "epoch": 0.9539000194514686, "grad_norm": 1.6484375, "learning_rate": 0.0004913997907246385, "loss": 5.436, "mean_token_accuracy": 0.17167474776506425, "num_tokens": 21272309.0, "step": 12260 }, { "entropy": 5.506390190124511, "epoch": 0.9542890488231861, "grad_norm": 1.453125, "learning_rate": 0.000491392199600742, "loss": 5.359, "mean_token_accuracy": 0.1665118530392647, "num_tokens": 21281711.0, "step": 12265 }, { "entropy": 5.51539626121521, "epoch": 0.9546780781949037, "grad_norm": 3.734375, "learning_rate": 0.0004913846051934382, "loss": 5.3196, "mean_token_accuracy": 0.17208221256732942, "num_tokens": 21289524.0, "step": 12270 }, { "entropy": 5.513137531280518, "epoch": 0.9550671075666213, "grad_norm": 1.5078125, "learning_rate": 0.0004913770075028425, "loss": 5.2626, "mean_token_accuracy": 0.17546534538269043, "num_tokens": 21298225.0, "step": 12275 }, { "entropy": 5.542500305175781, "epoch": 0.9554561369383389, "grad_norm": 1.453125, "learning_rate": 0.0004913694065290701, "loss": 5.2958, "mean_token_accuracy": 0.178589104115963, "num_tokens": 21306819.0, "step": 12280 }, { "entropy": 5.576265525817871, "epoch": 0.9558451663100564, "grad_norm": 1.65625, "learning_rate": 0.0004913618022722363, "loss": 5.4454, "mean_token_accuracy": 0.16563066840171814, "num_tokens": 21315517.0, "step": 12285 }, { "entropy": 5.614781618118286, "epoch": 0.9562341956817739, "grad_norm": 1.5, "learning_rate": 0.0004913541947324566, "loss": 5.3488, "mean_token_accuracy": 0.16864724308252335, "num_tokens": 21324144.0, "step": 12290 }, { "entropy": 5.605503416061401, "epoch": 0.9566232250534915, "grad_norm": 1.7109375, "learning_rate": 0.0004913465839098463, "loss": 5.4197, "mean_token_accuracy": 0.17107993364334106, "num_tokens": 21333329.0, "step": 12295 }, { "entropy": 5.522213315963745, "epoch": 0.9570122544252091, "grad_norm": 1.3984375, "learning_rate": 0.0004913389698045209, "loss": 5.3781, "mean_token_accuracy": 0.1652178406715393, "num_tokens": 21341955.0, "step": 12300 }, { "entropy": 5.586077404022217, "epoch": 0.9574012837969267, "grad_norm": 1.5390625, "learning_rate": 0.000491331352416596, "loss": 5.3473, "mean_token_accuracy": 0.16738866716623307, "num_tokens": 21350593.0, "step": 12305 }, { "entropy": 5.535979175567627, "epoch": 0.9577903131686443, "grad_norm": 2.15625, "learning_rate": 0.0004913237317461872, "loss": 5.4292, "mean_token_accuracy": 0.16674810349941255, "num_tokens": 21359007.0, "step": 12310 }, { "entropy": 5.549071025848389, "epoch": 0.9581793425403617, "grad_norm": 1.359375, "learning_rate": 0.00049131610779341, "loss": 5.4487, "mean_token_accuracy": 0.16577992141246795, "num_tokens": 21367645.0, "step": 12315 }, { "entropy": 5.510221481323242, "epoch": 0.9585683719120793, "grad_norm": 1.375, "learning_rate": 0.0004913084805583803, "loss": 5.263, "mean_token_accuracy": 0.17191761881113052, "num_tokens": 21376040.0, "step": 12320 }, { "entropy": 5.58285551071167, "epoch": 0.9589574012837969, "grad_norm": 1.4765625, "learning_rate": 0.0004913008500412136, "loss": 5.4068, "mean_token_accuracy": 0.17451067715883256, "num_tokens": 21385305.0, "step": 12325 }, { "entropy": 5.545878791809082, "epoch": 0.9593464306555145, "grad_norm": 1.3515625, "learning_rate": 0.0004912932162420259, "loss": 5.3043, "mean_token_accuracy": 0.18116566985845567, "num_tokens": 21393705.0, "step": 12330 }, { "entropy": 5.582909774780274, "epoch": 0.9597354600272321, "grad_norm": 1.53125, "learning_rate": 0.0004912855791609327, "loss": 5.428, "mean_token_accuracy": 0.16888475716114043, "num_tokens": 21401830.0, "step": 12335 }, { "entropy": 5.569549655914306, "epoch": 0.9601244893989496, "grad_norm": 1.546875, "learning_rate": 0.0004912779387980502, "loss": 5.4796, "mean_token_accuracy": 0.16422994881868364, "num_tokens": 21410398.0, "step": 12340 }, { "entropy": 5.64050612449646, "epoch": 0.9605135187706672, "grad_norm": 1.8203125, "learning_rate": 0.0004912702951534942, "loss": 5.4314, "mean_token_accuracy": 0.16885158866643907, "num_tokens": 21419082.0, "step": 12345 }, { "entropy": 5.648242807388305, "epoch": 0.9609025481423847, "grad_norm": 1.4453125, "learning_rate": 0.0004912626482273809, "loss": 5.427, "mean_token_accuracy": 0.1632491961121559, "num_tokens": 21427992.0, "step": 12350 }, { "entropy": 5.555550384521484, "epoch": 0.9612915775141023, "grad_norm": 1.390625, "learning_rate": 0.0004912549980198258, "loss": 5.3935, "mean_token_accuracy": 0.16734340637922288, "num_tokens": 21436933.0, "step": 12355 }, { "entropy": 5.5616072654724125, "epoch": 0.9616806068858199, "grad_norm": 1.453125, "learning_rate": 0.0004912473445309455, "loss": 5.3882, "mean_token_accuracy": 0.16933085173368453, "num_tokens": 21445640.0, "step": 12360 }, { "entropy": 5.698657846450805, "epoch": 0.9620696362575375, "grad_norm": 1.4375, "learning_rate": 0.000491239687760856, "loss": 5.5502, "mean_token_accuracy": 0.15852493792772293, "num_tokens": 21454511.0, "step": 12365 }, { "entropy": 5.60389199256897, "epoch": 0.962458665629255, "grad_norm": 1.4453125, "learning_rate": 0.0004912320277096732, "loss": 5.5412, "mean_token_accuracy": 0.1576765350997448, "num_tokens": 21463851.0, "step": 12370 }, { "entropy": 5.536577939987183, "epoch": 0.9628476950009726, "grad_norm": 2.484375, "learning_rate": 0.0004912243643775137, "loss": 5.3283, "mean_token_accuracy": 0.17465019077062607, "num_tokens": 21471620.0, "step": 12375 }, { "entropy": 5.570523643493653, "epoch": 0.9632367243726901, "grad_norm": 1.421875, "learning_rate": 0.0004912166977644936, "loss": 5.3446, "mean_token_accuracy": 0.1683275133371353, "num_tokens": 21479944.0, "step": 12380 }, { "entropy": 5.631869506835938, "epoch": 0.9636257537444077, "grad_norm": 1.9140625, "learning_rate": 0.0004912090278707293, "loss": 5.5166, "mean_token_accuracy": 0.15817615985870362, "num_tokens": 21489175.0, "step": 12385 }, { "entropy": 5.595966625213623, "epoch": 0.9640147831161253, "grad_norm": 1.65625, "learning_rate": 0.000491201354696337, "loss": 5.4373, "mean_token_accuracy": 0.17099682986736298, "num_tokens": 21498533.0, "step": 12390 }, { "entropy": 5.68024845123291, "epoch": 0.9644038124878428, "grad_norm": 1.5078125, "learning_rate": 0.0004911936782414334, "loss": 5.5038, "mean_token_accuracy": 0.15963890701532363, "num_tokens": 21506771.0, "step": 12395 }, { "entropy": 5.534885454177856, "epoch": 0.9647928418595604, "grad_norm": 1.515625, "learning_rate": 0.0004911859985061348, "loss": 5.3038, "mean_token_accuracy": 0.1820862114429474, "num_tokens": 21515359.0, "step": 12400 }, { "entropy": 5.566308212280274, "epoch": 0.965181871231278, "grad_norm": 1.4765625, "learning_rate": 0.0004911783154905577, "loss": 5.3759, "mean_token_accuracy": 0.16567621976137162, "num_tokens": 21524313.0, "step": 12405 }, { "entropy": 5.529404783248902, "epoch": 0.9655709006029956, "grad_norm": 1.8046875, "learning_rate": 0.0004911706291948188, "loss": 5.3766, "mean_token_accuracy": 0.1746726393699646, "num_tokens": 21533211.0, "step": 12410 }, { "entropy": 5.5782609462738035, "epoch": 0.9659599299747131, "grad_norm": 1.5234375, "learning_rate": 0.0004911629396190348, "loss": 5.3304, "mean_token_accuracy": 0.17233569473028182, "num_tokens": 21541575.0, "step": 12415 }, { "entropy": 5.597880029678345, "epoch": 0.9663489593464306, "grad_norm": 1.546875, "learning_rate": 0.0004911552467633221, "loss": 5.4257, "mean_token_accuracy": 0.1635533392429352, "num_tokens": 21549569.0, "step": 12420 }, { "entropy": 5.5263899803161625, "epoch": 0.9667379887181482, "grad_norm": 1.609375, "learning_rate": 0.0004911475506277976, "loss": 5.3771, "mean_token_accuracy": 0.16541996747255325, "num_tokens": 21557277.0, "step": 12425 }, { "entropy": 5.5775562763214115, "epoch": 0.9671270180898658, "grad_norm": 1.6015625, "learning_rate": 0.000491139851212578, "loss": 5.4123, "mean_token_accuracy": 0.16224730163812637, "num_tokens": 21566590.0, "step": 12430 }, { "entropy": 5.653618907928466, "epoch": 0.9675160474615834, "grad_norm": 1.5546875, "learning_rate": 0.0004911321485177802, "loss": 5.479, "mean_token_accuracy": 0.15981924384832383, "num_tokens": 21575140.0, "step": 12435 }, { "entropy": 5.5106744289398195, "epoch": 0.967905076833301, "grad_norm": 1.5390625, "learning_rate": 0.0004911244425435212, "loss": 5.4187, "mean_token_accuracy": 0.16120911836624147, "num_tokens": 21584647.0, "step": 12440 }, { "entropy": 5.612622928619385, "epoch": 0.9682941062050184, "grad_norm": 1.421875, "learning_rate": 0.0004911167332899176, "loss": 5.3749, "mean_token_accuracy": 0.16861445009708403, "num_tokens": 21593609.0, "step": 12445 }, { "entropy": 5.710604286193847, "epoch": 0.968683135576736, "grad_norm": 1.859375, "learning_rate": 0.0004911090207570867, "loss": 5.4977, "mean_token_accuracy": 0.16604768186807634, "num_tokens": 21602584.0, "step": 12450 }, { "entropy": 5.497505331039429, "epoch": 0.9690721649484536, "grad_norm": 1.59375, "learning_rate": 0.0004911013049451453, "loss": 5.4567, "mean_token_accuracy": 0.1718402773141861, "num_tokens": 21611109.0, "step": 12455 }, { "entropy": 5.647250127792359, "epoch": 0.9694611943201712, "grad_norm": 1.5703125, "learning_rate": 0.0004910935858542106, "loss": 5.4644, "mean_token_accuracy": 0.1647668480873108, "num_tokens": 21620173.0, "step": 12460 }, { "entropy": 5.57645320892334, "epoch": 0.9698502236918888, "grad_norm": 1.328125, "learning_rate": 0.0004910858634843997, "loss": 5.2968, "mean_token_accuracy": 0.17491580843925475, "num_tokens": 21628318.0, "step": 12465 }, { "entropy": 5.589544105529785, "epoch": 0.9702392530636063, "grad_norm": 1.5234375, "learning_rate": 0.0004910781378358297, "loss": 5.5078, "mean_token_accuracy": 0.164412023127079, "num_tokens": 21637102.0, "step": 12470 }, { "entropy": 5.590525102615357, "epoch": 0.9706282824353238, "grad_norm": 1.46875, "learning_rate": 0.0004910704089086178, "loss": 5.3554, "mean_token_accuracy": 0.17072507441043855, "num_tokens": 21645055.0, "step": 12475 }, { "entropy": 5.6012671947479244, "epoch": 0.9710173118070414, "grad_norm": 1.3984375, "learning_rate": 0.0004910626767028815, "loss": 5.4189, "mean_token_accuracy": 0.16050756871700286, "num_tokens": 21654106.0, "step": 12480 }, { "entropy": 5.5423140048980715, "epoch": 0.971406341178759, "grad_norm": 1.5625, "learning_rate": 0.0004910549412187379, "loss": 5.4081, "mean_token_accuracy": 0.17627297341823578, "num_tokens": 21663081.0, "step": 12485 }, { "entropy": 5.586370897293091, "epoch": 0.9717953705504766, "grad_norm": 1.609375, "learning_rate": 0.0004910472024563045, "loss": 5.3733, "mean_token_accuracy": 0.1717690572142601, "num_tokens": 21671033.0, "step": 12490 }, { "entropy": 5.61957197189331, "epoch": 0.9721843999221941, "grad_norm": 1.640625, "learning_rate": 0.0004910394604156987, "loss": 5.3861, "mean_token_accuracy": 0.17137907147407533, "num_tokens": 21679167.0, "step": 12495 }, { "entropy": 5.644653844833374, "epoch": 0.9725734292939117, "grad_norm": 1.7265625, "learning_rate": 0.0004910317150970379, "loss": 5.5172, "mean_token_accuracy": 0.16495581418275834, "num_tokens": 21688365.0, "step": 12500 }, { "entropy": 5.595451211929321, "epoch": 0.9729624586656292, "grad_norm": 1.5390625, "learning_rate": 0.0004910239665004397, "loss": 5.3996, "mean_token_accuracy": 0.16991671025753022, "num_tokens": 21697003.0, "step": 12505 }, { "entropy": 5.587980651855469, "epoch": 0.9733514880373468, "grad_norm": 1.4375, "learning_rate": 0.0004910162146260216, "loss": 5.408, "mean_token_accuracy": 0.16433726847171784, "num_tokens": 21705947.0, "step": 12510 }, { "entropy": 5.568564796447754, "epoch": 0.9737405174090644, "grad_norm": 1.5390625, "learning_rate": 0.0004910084594739013, "loss": 5.4325, "mean_token_accuracy": 0.16390192359685898, "num_tokens": 21714153.0, "step": 12515 }, { "entropy": 5.630647468566894, "epoch": 0.9741295467807819, "grad_norm": 1.578125, "learning_rate": 0.0004910007010441964, "loss": 5.5104, "mean_token_accuracy": 0.16128549575805665, "num_tokens": 21723480.0, "step": 12520 }, { "entropy": 5.6597191333770756, "epoch": 0.9745185761524995, "grad_norm": 1.578125, "learning_rate": 0.0004909929393370248, "loss": 5.3811, "mean_token_accuracy": 0.1717036947607994, "num_tokens": 21731297.0, "step": 12525 }, { "entropy": 5.553610706329346, "epoch": 0.9749076055242171, "grad_norm": 1.515625, "learning_rate": 0.0004909851743525041, "loss": 5.3617, "mean_token_accuracy": 0.16348666846752166, "num_tokens": 21740975.0, "step": 12530 }, { "entropy": 5.5200341701507565, "epoch": 0.9752966348959347, "grad_norm": 1.59375, "learning_rate": 0.000490977406090752, "loss": 5.3565, "mean_token_accuracy": 0.16492999494075775, "num_tokens": 21749642.0, "step": 12535 }, { "entropy": 5.591656494140625, "epoch": 0.9756856642676522, "grad_norm": 1.625, "learning_rate": 0.0004909696345518867, "loss": 5.3955, "mean_token_accuracy": 0.16482315063476563, "num_tokens": 21757962.0, "step": 12540 }, { "entropy": 5.629759502410889, "epoch": 0.9760746936393697, "grad_norm": 1.5390625, "learning_rate": 0.0004909618597360258, "loss": 5.3771, "mean_token_accuracy": 0.17003940045833588, "num_tokens": 21766053.0, "step": 12545 }, { "entropy": 5.507699871063233, "epoch": 0.9764637230110873, "grad_norm": 1.3515625, "learning_rate": 0.0004909540816432876, "loss": 5.3511, "mean_token_accuracy": 0.16111702620983123, "num_tokens": 21774280.0, "step": 12550 }, { "entropy": 5.573996067047119, "epoch": 0.9768527523828049, "grad_norm": 1.4765625, "learning_rate": 0.0004909463002737897, "loss": 5.3712, "mean_token_accuracy": 0.1694996878504753, "num_tokens": 21782879.0, "step": 12555 }, { "entropy": 5.654839944839478, "epoch": 0.9772417817545225, "grad_norm": 1.3671875, "learning_rate": 0.0004909385156276506, "loss": 5.4579, "mean_token_accuracy": 0.16924386769533156, "num_tokens": 21791294.0, "step": 12560 }, { "entropy": 5.591029214859009, "epoch": 0.9776308111262401, "grad_norm": 1.6484375, "learning_rate": 0.0004909307277049881, "loss": 5.2873, "mean_token_accuracy": 0.17874531745910643, "num_tokens": 21799304.0, "step": 12565 }, { "entropy": 5.599150848388672, "epoch": 0.9780198404979576, "grad_norm": 1.4140625, "learning_rate": 0.0004909229365059205, "loss": 5.5029, "mean_token_accuracy": 0.15985802412033082, "num_tokens": 21809024.0, "step": 12570 }, { "entropy": 5.582186079025268, "epoch": 0.9784088698696751, "grad_norm": 1.640625, "learning_rate": 0.0004909151420305661, "loss": 5.2952, "mean_token_accuracy": 0.17661263346672057, "num_tokens": 21817412.0, "step": 12575 }, { "entropy": 5.504785776138306, "epoch": 0.9787978992413927, "grad_norm": 1.578125, "learning_rate": 0.000490907344279043, "loss": 5.3278, "mean_token_accuracy": 0.17064658403396607, "num_tokens": 21825261.0, "step": 12580 }, { "entropy": 5.61702446937561, "epoch": 0.9791869286131103, "grad_norm": 1.5234375, "learning_rate": 0.0004908995432514698, "loss": 5.4527, "mean_token_accuracy": 0.17164114564657212, "num_tokens": 21833318.0, "step": 12585 }, { "entropy": 5.565180969238281, "epoch": 0.9795759579848279, "grad_norm": 1.8828125, "learning_rate": 0.0004908917389479645, "loss": 5.4065, "mean_token_accuracy": 0.17269199788570405, "num_tokens": 21841377.0, "step": 12590 }, { "entropy": 5.559814596176148, "epoch": 0.9799649873565455, "grad_norm": 1.4453125, "learning_rate": 0.0004908839313686456, "loss": 5.3641, "mean_token_accuracy": 0.16850048750638963, "num_tokens": 21850183.0, "step": 12595 }, { "entropy": 5.67911696434021, "epoch": 0.980354016728263, "grad_norm": 1.8828125, "learning_rate": 0.0004908761205136319, "loss": 5.4554, "mean_token_accuracy": 0.17185364663600922, "num_tokens": 21858108.0, "step": 12600 }, { "entropy": 5.575015640258789, "epoch": 0.9807430460999805, "grad_norm": 1.4296875, "learning_rate": 0.0004908683063830414, "loss": 5.3452, "mean_token_accuracy": 0.16938232034444808, "num_tokens": 21866330.0, "step": 12605 }, { "entropy": 5.568648910522461, "epoch": 0.9811320754716981, "grad_norm": 1.703125, "learning_rate": 0.0004908604889769932, "loss": 5.4134, "mean_token_accuracy": 0.16798173189163207, "num_tokens": 21875254.0, "step": 12610 }, { "entropy": 5.618528223037719, "epoch": 0.9815211048434157, "grad_norm": 1.3828125, "learning_rate": 0.0004908526682956054, "loss": 5.4826, "mean_token_accuracy": 0.16005044877529145, "num_tokens": 21884009.0, "step": 12615 }, { "entropy": 5.646177816390991, "epoch": 0.9819101342151333, "grad_norm": 1.4296875, "learning_rate": 0.0004908448443389972, "loss": 5.4054, "mean_token_accuracy": 0.16468650102615356, "num_tokens": 21892428.0, "step": 12620 }, { "entropy": 5.6400901794433596, "epoch": 0.9822991635868508, "grad_norm": 1.609375, "learning_rate": 0.0004908370171072869, "loss": 5.4489, "mean_token_accuracy": 0.1713656887412071, "num_tokens": 21901140.0, "step": 12625 }, { "entropy": 5.524168920516968, "epoch": 0.9826881929585684, "grad_norm": 1.4765625, "learning_rate": 0.0004908291866005933, "loss": 5.3428, "mean_token_accuracy": 0.1827618509531021, "num_tokens": 21909072.0, "step": 12630 }, { "entropy": 5.499984264373779, "epoch": 0.9830772223302859, "grad_norm": 1.46875, "learning_rate": 0.0004908213528190355, "loss": 5.3942, "mean_token_accuracy": 0.16729398667812348, "num_tokens": 21917873.0, "step": 12635 }, { "entropy": 5.642496728897095, "epoch": 0.9834662517020035, "grad_norm": 1.53125, "learning_rate": 0.0004908135157627321, "loss": 5.5039, "mean_token_accuracy": 0.16090389639139174, "num_tokens": 21927302.0, "step": 12640 }, { "entropy": 5.616642904281616, "epoch": 0.9838552810737211, "grad_norm": 1.3828125, "learning_rate": 0.0004908056754318022, "loss": 5.4414, "mean_token_accuracy": 0.1711207300424576, "num_tokens": 21936440.0, "step": 12645 }, { "entropy": 5.565749645233154, "epoch": 0.9842443104454386, "grad_norm": 1.5234375, "learning_rate": 0.0004907978318263646, "loss": 5.3079, "mean_token_accuracy": 0.16842927783727646, "num_tokens": 21944655.0, "step": 12650 }, { "entropy": 5.664102029800415, "epoch": 0.9846333398171562, "grad_norm": 1.625, "learning_rate": 0.0004907899849465383, "loss": 5.5415, "mean_token_accuracy": 0.16499512493610383, "num_tokens": 21953202.0, "step": 12655 }, { "entropy": 5.607707691192627, "epoch": 0.9850223691888738, "grad_norm": 1.4296875, "learning_rate": 0.0004907821347924424, "loss": 5.4077, "mean_token_accuracy": 0.16860270798206328, "num_tokens": 21961889.0, "step": 12660 }, { "entropy": 5.5387133121490475, "epoch": 0.9854113985605913, "grad_norm": 1.4296875, "learning_rate": 0.0004907742813641963, "loss": 5.2683, "mean_token_accuracy": 0.17518474757671357, "num_tokens": 21970864.0, "step": 12665 }, { "entropy": 5.5290234088897705, "epoch": 0.9858004279323089, "grad_norm": 1.5703125, "learning_rate": 0.0004907664246619187, "loss": 5.3742, "mean_token_accuracy": 0.16862202137708665, "num_tokens": 21979271.0, "step": 12670 }, { "entropy": 5.556199789047241, "epoch": 0.9861894573040264, "grad_norm": 1.5, "learning_rate": 0.0004907585646857293, "loss": 5.2483, "mean_token_accuracy": 0.17392691522836684, "num_tokens": 21987321.0, "step": 12675 }, { "entropy": 5.612700462341309, "epoch": 0.986578486675744, "grad_norm": 1.5703125, "learning_rate": 0.0004907507014357467, "loss": 5.5053, "mean_token_accuracy": 0.16294969171285628, "num_tokens": 21996094.0, "step": 12680 }, { "entropy": 5.541552543640137, "epoch": 0.9869675160474616, "grad_norm": 1.703125, "learning_rate": 0.0004907428349120909, "loss": 5.3535, "mean_token_accuracy": 0.16713285595178604, "num_tokens": 22004095.0, "step": 12685 }, { "entropy": 5.634124612808227, "epoch": 0.9873565454191792, "grad_norm": 1.4765625, "learning_rate": 0.0004907349651148809, "loss": 5.4669, "mean_token_accuracy": 0.1649239957332611, "num_tokens": 22013371.0, "step": 12690 }, { "entropy": 5.548127555847168, "epoch": 0.9877455747908968, "grad_norm": 1.4765625, "learning_rate": 0.0004907270920442361, "loss": 5.3348, "mean_token_accuracy": 0.16820223927497863, "num_tokens": 22022313.0, "step": 12695 }, { "entropy": 5.640724039077758, "epoch": 0.9881346041626142, "grad_norm": 1.3125, "learning_rate": 0.0004907192157002762, "loss": 5.5035, "mean_token_accuracy": 0.16597417145967483, "num_tokens": 22031690.0, "step": 12700 }, { "entropy": 5.720732975006103, "epoch": 0.9885236335343318, "grad_norm": 1.5390625, "learning_rate": 0.0004907113360831204, "loss": 5.5498, "mean_token_accuracy": 0.15509618520736695, "num_tokens": 22040957.0, "step": 12705 }, { "entropy": 5.640105438232422, "epoch": 0.9889126629060494, "grad_norm": 1.5390625, "learning_rate": 0.0004907034531928886, "loss": 5.384, "mean_token_accuracy": 0.16889772564172745, "num_tokens": 22049623.0, "step": 12710 }, { "entropy": 5.541781282424926, "epoch": 0.989301692277767, "grad_norm": 1.5390625, "learning_rate": 0.0004906955670297001, "loss": 5.3755, "mean_token_accuracy": 0.16839928478002547, "num_tokens": 22058205.0, "step": 12715 }, { "entropy": 5.555943965911865, "epoch": 0.9896907216494846, "grad_norm": 1.8046875, "learning_rate": 0.0004906876775936746, "loss": 5.2751, "mean_token_accuracy": 0.17056004852056503, "num_tokens": 22067375.0, "step": 12720 }, { "entropy": 5.523751258850098, "epoch": 0.990079751021202, "grad_norm": 2.0625, "learning_rate": 0.0004906797848849321, "loss": 5.3152, "mean_token_accuracy": 0.1756708651781082, "num_tokens": 22075670.0, "step": 12725 }, { "entropy": 5.517127323150635, "epoch": 0.9904687803929196, "grad_norm": 1.7265625, "learning_rate": 0.000490671888903592, "loss": 5.3986, "mean_token_accuracy": 0.16902980208396912, "num_tokens": 22084360.0, "step": 12730 }, { "entropy": 5.547106170654297, "epoch": 0.9908578097646372, "grad_norm": 1.578125, "learning_rate": 0.0004906639896497744, "loss": 5.4079, "mean_token_accuracy": 0.1749236837029457, "num_tokens": 22092666.0, "step": 12735 }, { "entropy": 5.639094638824463, "epoch": 0.9912468391363548, "grad_norm": 3.21875, "learning_rate": 0.0004906560871235988, "loss": 5.5243, "mean_token_accuracy": 0.16201450526714326, "num_tokens": 22101311.0, "step": 12740 }, { "entropy": 5.6404026508331295, "epoch": 0.9916358685080724, "grad_norm": 1.515625, "learning_rate": 0.0004906481813251854, "loss": 5.3512, "mean_token_accuracy": 0.17302687615156173, "num_tokens": 22109640.0, "step": 12745 }, { "entropy": 5.558566522598267, "epoch": 0.9920248978797899, "grad_norm": 2.109375, "learning_rate": 0.0004906402722546542, "loss": 5.3578, "mean_token_accuracy": 0.16336167603731155, "num_tokens": 22118721.0, "step": 12750 }, { "entropy": 5.5309693813323975, "epoch": 0.9924139272515075, "grad_norm": 1.5234375, "learning_rate": 0.000490632359912125, "loss": 5.3549, "mean_token_accuracy": 0.16795935928821565, "num_tokens": 22126745.0, "step": 12755 }, { "entropy": 5.620975685119629, "epoch": 0.992802956623225, "grad_norm": 1.625, "learning_rate": 0.000490624444297718, "loss": 5.4324, "mean_token_accuracy": 0.16674798727035522, "num_tokens": 22135010.0, "step": 12760 }, { "entropy": 5.562928485870361, "epoch": 0.9931919859949426, "grad_norm": 1.3828125, "learning_rate": 0.0004906165254115533, "loss": 5.3876, "mean_token_accuracy": 0.1693186119198799, "num_tokens": 22144339.0, "step": 12765 }, { "entropy": 5.504650115966797, "epoch": 0.9935810153666602, "grad_norm": 1.5625, "learning_rate": 0.000490608603253751, "loss": 5.3311, "mean_token_accuracy": 0.17818619459867477, "num_tokens": 22153405.0, "step": 12770 }, { "entropy": 5.613975858688354, "epoch": 0.9939700447383778, "grad_norm": 1.59375, "learning_rate": 0.0004906006778244312, "loss": 5.3972, "mean_token_accuracy": 0.16567289531230928, "num_tokens": 22161392.0, "step": 12775 }, { "entropy": 5.626464748382569, "epoch": 0.9943590741100953, "grad_norm": 1.5625, "learning_rate": 0.0004905927491237145, "loss": 5.3751, "mean_token_accuracy": 0.16952494531869888, "num_tokens": 22170635.0, "step": 12780 }, { "entropy": 5.496331119537354, "epoch": 0.9947481034818129, "grad_norm": 1.6171875, "learning_rate": 0.0004905848171517208, "loss": 5.2583, "mean_token_accuracy": 0.17667841017246247, "num_tokens": 22178629.0, "step": 12785 }, { "entropy": 5.4876610279083256, "epoch": 0.9951371328535304, "grad_norm": 1.5703125, "learning_rate": 0.0004905768819085706, "loss": 5.3403, "mean_token_accuracy": 0.16736946552991866, "num_tokens": 22187142.0, "step": 12790 }, { "entropy": 5.61784143447876, "epoch": 0.995526162225248, "grad_norm": 1.375, "learning_rate": 0.0004905689433943846, "loss": 5.4147, "mean_token_accuracy": 0.16835962533950805, "num_tokens": 22195249.0, "step": 12795 }, { "entropy": 5.604678726196289, "epoch": 0.9959151915969656, "grad_norm": 1.4609375, "learning_rate": 0.0004905610016092828, "loss": 5.4356, "mean_token_accuracy": 0.17299420088529588, "num_tokens": 22203621.0, "step": 12800 }, { "entropy": 5.513427066802978, "epoch": 0.9963042209686831, "grad_norm": 1.3125, "learning_rate": 0.0004905530565533859, "loss": 5.3902, "mean_token_accuracy": 0.17429412454366683, "num_tokens": 22212547.0, "step": 12805 }, { "entropy": 5.576586627960205, "epoch": 0.9966932503404007, "grad_norm": 1.53125, "learning_rate": 0.0004905451082268146, "loss": 5.3753, "mean_token_accuracy": 0.16535618603229524, "num_tokens": 22221642.0, "step": 12810 }, { "entropy": 5.57655897140503, "epoch": 0.9970822797121183, "grad_norm": 1.4765625, "learning_rate": 0.0004905371566296891, "loss": 5.4221, "mean_token_accuracy": 0.16553240567445754, "num_tokens": 22230227.0, "step": 12815 }, { "entropy": 5.546317768096924, "epoch": 0.9974713090838359, "grad_norm": 1.375, "learning_rate": 0.0004905292017621305, "loss": 5.379, "mean_token_accuracy": 0.17151281237602234, "num_tokens": 22238973.0, "step": 12820 }, { "entropy": 5.574538230895996, "epoch": 0.9978603384555534, "grad_norm": 1.3046875, "learning_rate": 0.0004905212436242593, "loss": 5.3664, "mean_token_accuracy": 0.17034893482923508, "num_tokens": 22247613.0, "step": 12825 }, { "entropy": 5.531944751739502, "epoch": 0.9982493678272709, "grad_norm": 1.3359375, "learning_rate": 0.0004905132822161962, "loss": 5.4013, "mean_token_accuracy": 0.1644030660390854, "num_tokens": 22255707.0, "step": 12830 }, { "entropy": 5.529854869842529, "epoch": 0.9986383971989885, "grad_norm": 1.3515625, "learning_rate": 0.0004905053175380621, "loss": 5.2829, "mean_token_accuracy": 0.17318745702505112, "num_tokens": 22264524.0, "step": 12835 }, { "entropy": 5.589191246032715, "epoch": 0.9990274265707061, "grad_norm": 1.640625, "learning_rate": 0.0004904973495899778, "loss": 5.4015, "mean_token_accuracy": 0.1655420944094658, "num_tokens": 22272973.0, "step": 12840 }, { "entropy": 5.55372052192688, "epoch": 0.9994164559424237, "grad_norm": 1.5546875, "learning_rate": 0.0004904893783720642, "loss": 5.4276, "mean_token_accuracy": 0.16893602758646012, "num_tokens": 22281545.0, "step": 12845 }, { "entropy": 5.563304615020752, "epoch": 0.9998054853141413, "grad_norm": 1.5078125, "learning_rate": 0.0004904814038844424, "loss": 5.4281, "mean_token_accuracy": 0.17418748140335083, "num_tokens": 22289835.0, "step": 12850 }, { "entropy": 5.521205902099609, "epoch": 1.000155611748687, "grad_norm": 1.4609375, "learning_rate": 0.0004904734261272332, "loss": 5.3891, "mean_token_accuracy": 0.16933360861407387, "num_tokens": 22297794.0, "step": 12855 }, { "entropy": 5.524118947982788, "epoch": 1.0005446411204046, "grad_norm": 1.71875, "learning_rate": 0.0004904654451005576, "loss": 5.3053, "mean_token_accuracy": 0.1667938694357872, "num_tokens": 22305637.0, "step": 12860 }, { "entropy": 5.5762371063232425, "epoch": 1.0009336704921221, "grad_norm": 1.7890625, "learning_rate": 0.0004904574608045369, "loss": 5.3809, "mean_token_accuracy": 0.16399641185998917, "num_tokens": 22314796.0, "step": 12865 }, { "entropy": 5.551935291290283, "epoch": 1.0013226998638398, "grad_norm": 1.8125, "learning_rate": 0.0004904494732392923, "loss": 5.3254, "mean_token_accuracy": 0.16489121317863464, "num_tokens": 22324522.0, "step": 12870 }, { "entropy": 5.583127498626709, "epoch": 1.0017117292355573, "grad_norm": 1.6015625, "learning_rate": 0.0004904414824049448, "loss": 5.3107, "mean_token_accuracy": 0.17289249002933502, "num_tokens": 22333404.0, "step": 12875 }, { "entropy": 5.531590461730957, "epoch": 1.0021007586072748, "grad_norm": 1.6640625, "learning_rate": 0.0004904334883016156, "loss": 5.4215, "mean_token_accuracy": 0.16096602827310563, "num_tokens": 22343364.0, "step": 12880 }, { "entropy": 5.633839654922485, "epoch": 1.0024897879789925, "grad_norm": 1.4921875, "learning_rate": 0.0004904254909294261, "loss": 5.3302, "mean_token_accuracy": 0.1673327311873436, "num_tokens": 22352854.0, "step": 12885 }, { "entropy": 5.585352230072021, "epoch": 1.00287881735071, "grad_norm": 1.578125, "learning_rate": 0.0004904174902884978, "loss": 5.2469, "mean_token_accuracy": 0.17581924498081208, "num_tokens": 22361916.0, "step": 12890 }, { "entropy": 5.492735099792481, "epoch": 1.0032678467224276, "grad_norm": 1.7265625, "learning_rate": 0.0004904094863789519, "loss": 5.3255, "mean_token_accuracy": 0.167428807169199, "num_tokens": 22370848.0, "step": 12895 }, { "entropy": 5.497122097015381, "epoch": 1.0036568760941451, "grad_norm": 1.8671875, "learning_rate": 0.00049040147920091, "loss": 5.2529, "mean_token_accuracy": 0.1785206213593483, "num_tokens": 22379945.0, "step": 12900 }, { "entropy": 5.555041217803955, "epoch": 1.0040459054658626, "grad_norm": 1.4375, "learning_rate": 0.0004903934687544933, "loss": 5.2859, "mean_token_accuracy": 0.1729058489203453, "num_tokens": 22388795.0, "step": 12905 }, { "entropy": 5.58409013748169, "epoch": 1.0044349348375803, "grad_norm": 1.578125, "learning_rate": 0.0004903854550398237, "loss": 5.3286, "mean_token_accuracy": 0.17441962510347367, "num_tokens": 22396960.0, "step": 12910 }, { "entropy": 5.5396336078643795, "epoch": 1.0048239642092978, "grad_norm": 1.5546875, "learning_rate": 0.0004903774380570226, "loss": 5.2166, "mean_token_accuracy": 0.17924095094203948, "num_tokens": 22404698.0, "step": 12915 }, { "entropy": 5.519770288467408, "epoch": 1.0052129935810155, "grad_norm": 1.53125, "learning_rate": 0.0004903694178062117, "loss": 5.2649, "mean_token_accuracy": 0.16885225474834442, "num_tokens": 22413391.0, "step": 12920 }, { "entropy": 5.59088659286499, "epoch": 1.005602022952733, "grad_norm": 1.5, "learning_rate": 0.0004903613942875126, "loss": 5.3689, "mean_token_accuracy": 0.16756330281496049, "num_tokens": 22421357.0, "step": 12925 }, { "entropy": 5.522199535369873, "epoch": 1.0059910523244504, "grad_norm": 1.6328125, "learning_rate": 0.0004903533675010472, "loss": 5.2402, "mean_token_accuracy": 0.17148982286453246, "num_tokens": 22430286.0, "step": 12930 }, { "entropy": 5.498510885238647, "epoch": 1.006380081696168, "grad_norm": 1.3984375, "learning_rate": 0.0004903453374469373, "loss": 5.3072, "mean_token_accuracy": 0.17554282248020173, "num_tokens": 22439128.0, "step": 12935 }, { "entropy": 5.548002052307129, "epoch": 1.0067691110678856, "grad_norm": 1.7890625, "learning_rate": 0.0004903373041253045, "loss": 5.2589, "mean_token_accuracy": 0.1688343971967697, "num_tokens": 22447724.0, "step": 12940 }, { "entropy": 5.5518271923065186, "epoch": 1.0071581404396033, "grad_norm": 1.578125, "learning_rate": 0.0004903292675362709, "loss": 5.3047, "mean_token_accuracy": 0.17320431768894196, "num_tokens": 22456792.0, "step": 12945 }, { "entropy": 5.446905088424683, "epoch": 1.0075471698113208, "grad_norm": 1.40625, "learning_rate": 0.0004903212276799584, "loss": 5.2342, "mean_token_accuracy": 0.17724946439266204, "num_tokens": 22465465.0, "step": 12950 }, { "entropy": 5.501704168319702, "epoch": 1.0079361991830382, "grad_norm": 1.7421875, "learning_rate": 0.0004903131845564889, "loss": 5.2831, "mean_token_accuracy": 0.1737855315208435, "num_tokens": 22474498.0, "step": 12955 }, { "entropy": 5.480178499221802, "epoch": 1.008325228554756, "grad_norm": 1.6171875, "learning_rate": 0.0004903051381659847, "loss": 5.2168, "mean_token_accuracy": 0.17675953656435012, "num_tokens": 22482926.0, "step": 12960 }, { "entropy": 5.51214280128479, "epoch": 1.0087142579264734, "grad_norm": 1.875, "learning_rate": 0.0004902970885085677, "loss": 5.2527, "mean_token_accuracy": 0.17354887425899507, "num_tokens": 22491984.0, "step": 12965 }, { "entropy": 5.5587738990783695, "epoch": 1.009103287298191, "grad_norm": 1.46875, "learning_rate": 0.00049028903558436, "loss": 5.2774, "mean_token_accuracy": 0.1709383174777031, "num_tokens": 22501411.0, "step": 12970 }, { "entropy": 5.599527645111084, "epoch": 1.0094923166699086, "grad_norm": 1.734375, "learning_rate": 0.0004902809793934838, "loss": 5.3921, "mean_token_accuracy": 0.17097476199269296, "num_tokens": 22510289.0, "step": 12975 }, { "entropy": 5.573763227462768, "epoch": 1.009881346041626, "grad_norm": 1.5703125, "learning_rate": 0.0004902729199360615, "loss": 5.4092, "mean_token_accuracy": 0.16954686790704726, "num_tokens": 22519061.0, "step": 12980 }, { "entropy": 5.623443698883056, "epoch": 1.0102703754133437, "grad_norm": 1.625, "learning_rate": 0.0004902648572122153, "loss": 5.4159, "mean_token_accuracy": 0.16341166198253632, "num_tokens": 22528207.0, "step": 12985 }, { "entropy": 5.678278112411499, "epoch": 1.0106594047850612, "grad_norm": 1.6640625, "learning_rate": 0.0004902567912220674, "loss": 5.3627, "mean_token_accuracy": 0.17135710418224334, "num_tokens": 22537055.0, "step": 12990 }, { "entropy": 5.484136247634888, "epoch": 1.011048434156779, "grad_norm": 1.4921875, "learning_rate": 0.0004902487219657404, "loss": 5.3185, "mean_token_accuracy": 0.16931733042001723, "num_tokens": 22545239.0, "step": 12995 }, { "entropy": 5.575659942626953, "epoch": 1.0114374635284964, "grad_norm": 1.53125, "learning_rate": 0.0004902406494433566, "loss": 5.4656, "mean_token_accuracy": 0.15858107060194016, "num_tokens": 22554850.0, "step": 13000 }, { "entropy": 5.607913684844971, "epoch": 1.0118264929002139, "grad_norm": 1.5625, "learning_rate": 0.0004902325736550386, "loss": 5.3069, "mean_token_accuracy": 0.168249773979187, "num_tokens": 22563799.0, "step": 13005 }, { "entropy": 5.5935163497924805, "epoch": 1.0122155222719316, "grad_norm": 1.5390625, "learning_rate": 0.0004902244946009088, "loss": 5.4982, "mean_token_accuracy": 0.16486130356788636, "num_tokens": 22572699.0, "step": 13010 }, { "entropy": 5.699872589111328, "epoch": 1.012604551643649, "grad_norm": 1.625, "learning_rate": 0.0004902164122810899, "loss": 5.4254, "mean_token_accuracy": 0.16156801134347915, "num_tokens": 22580916.0, "step": 13015 }, { "entropy": 5.599102592468261, "epoch": 1.0129935810153667, "grad_norm": 1.640625, "learning_rate": 0.0004902083266957045, "loss": 5.3041, "mean_token_accuracy": 0.17652194797992707, "num_tokens": 22589525.0, "step": 13020 }, { "entropy": 5.562756013870239, "epoch": 1.0133826103870842, "grad_norm": 1.3984375, "learning_rate": 0.0004902002378448753, "loss": 5.3147, "mean_token_accuracy": 0.1701074570417404, "num_tokens": 22597929.0, "step": 13025 }, { "entropy": 5.572381925582886, "epoch": 1.0137716397588017, "grad_norm": 1.546875, "learning_rate": 0.000490192145728725, "loss": 5.3423, "mean_token_accuracy": 0.16986422687768937, "num_tokens": 22606500.0, "step": 13030 }, { "entropy": 5.5856163024902346, "epoch": 1.0141606691305194, "grad_norm": 1.5078125, "learning_rate": 0.0004901840503473764, "loss": 5.3023, "mean_token_accuracy": 0.1720694214105606, "num_tokens": 22614626.0, "step": 13035 }, { "entropy": 5.555132865905762, "epoch": 1.0145496985022369, "grad_norm": 1.5, "learning_rate": 0.0004901759517009522, "loss": 5.3449, "mean_token_accuracy": 0.16404235512018203, "num_tokens": 22623488.0, "step": 13040 }, { "entropy": 5.514724254608154, "epoch": 1.0149387278739546, "grad_norm": 1.421875, "learning_rate": 0.0004901678497895755, "loss": 5.2677, "mean_token_accuracy": 0.17093850672245026, "num_tokens": 22632413.0, "step": 13045 }, { "entropy": 5.612932395935059, "epoch": 1.015327757245672, "grad_norm": 1.59375, "learning_rate": 0.0004901597446133692, "loss": 5.4009, "mean_token_accuracy": 0.16236702352762222, "num_tokens": 22640982.0, "step": 13050 }, { "entropy": 5.627354383468628, "epoch": 1.0157167866173895, "grad_norm": 1.546875, "learning_rate": 0.0004901516361724564, "loss": 5.3796, "mean_token_accuracy": 0.16859890520572662, "num_tokens": 22649809.0, "step": 13055 }, { "entropy": 5.535728788375854, "epoch": 1.0161058159891072, "grad_norm": 1.625, "learning_rate": 0.0004901435244669597, "loss": 5.2795, "mean_token_accuracy": 0.16824382692575454, "num_tokens": 22658292.0, "step": 13060 }, { "entropy": 5.60081639289856, "epoch": 1.0164948453608247, "grad_norm": 1.703125, "learning_rate": 0.0004901354094970025, "loss": 5.3647, "mean_token_accuracy": 0.17014574706554414, "num_tokens": 22667063.0, "step": 13065 }, { "entropy": 5.50766077041626, "epoch": 1.0168838747325424, "grad_norm": 1.640625, "learning_rate": 0.0004901272912627081, "loss": 5.2963, "mean_token_accuracy": 0.1683926209807396, "num_tokens": 22676213.0, "step": 13070 }, { "entropy": 5.399009561538696, "epoch": 1.0172729041042599, "grad_norm": 1.515625, "learning_rate": 0.0004901191697641992, "loss": 5.2223, "mean_token_accuracy": 0.17431732416152954, "num_tokens": 22684948.0, "step": 13075 }, { "entropy": 5.559270000457763, "epoch": 1.0176619334759773, "grad_norm": 1.7265625, "learning_rate": 0.0004901110450015994, "loss": 5.3226, "mean_token_accuracy": 0.16503900289535522, "num_tokens": 22693218.0, "step": 13080 }, { "entropy": 5.565805530548095, "epoch": 1.018050962847695, "grad_norm": 1.5078125, "learning_rate": 0.0004901029169750319, "loss": 5.1915, "mean_token_accuracy": 0.17868994325399398, "num_tokens": 22701572.0, "step": 13085 }, { "entropy": 5.513815641403198, "epoch": 1.0184399922194125, "grad_norm": 1.640625, "learning_rate": 0.0004900947856846201, "loss": 5.2641, "mean_token_accuracy": 0.17290471345186234, "num_tokens": 22709498.0, "step": 13090 }, { "entropy": 5.539499950408936, "epoch": 1.0188290215911302, "grad_norm": 1.78125, "learning_rate": 0.000490086651130487, "loss": 5.2725, "mean_token_accuracy": 0.17217059284448624, "num_tokens": 22717922.0, "step": 13095 }, { "entropy": 5.584228277206421, "epoch": 1.0192180509628477, "grad_norm": 1.5546875, "learning_rate": 0.0004900785133127566, "loss": 5.298, "mean_token_accuracy": 0.174782095849514, "num_tokens": 22725933.0, "step": 13100 }, { "entropy": 5.56052885055542, "epoch": 1.0196070803345652, "grad_norm": 1.6171875, "learning_rate": 0.000490070372231552, "loss": 5.2871, "mean_token_accuracy": 0.17098522782325745, "num_tokens": 22734198.0, "step": 13105 }, { "entropy": 5.549863290786743, "epoch": 1.0199961097062828, "grad_norm": 1.5, "learning_rate": 0.0004900622278869968, "loss": 5.3158, "mean_token_accuracy": 0.17081442326307297, "num_tokens": 22742419.0, "step": 13110 }, { "entropy": 5.590565347671509, "epoch": 1.0203851390780003, "grad_norm": 1.3828125, "learning_rate": 0.0004900540802792146, "loss": 5.2721, "mean_token_accuracy": 0.17368832975625992, "num_tokens": 22750576.0, "step": 13115 }, { "entropy": 5.571694278717041, "epoch": 1.020774168449718, "grad_norm": 1.6640625, "learning_rate": 0.000490045929408329, "loss": 5.443, "mean_token_accuracy": 0.17148976922035217, "num_tokens": 22759604.0, "step": 13120 }, { "entropy": 5.519921159744262, "epoch": 1.0211631978214355, "grad_norm": 1.703125, "learning_rate": 0.0004900377752744637, "loss": 5.2, "mean_token_accuracy": 0.1760471448302269, "num_tokens": 22768305.0, "step": 13125 }, { "entropy": 5.598498058319092, "epoch": 1.021552227193153, "grad_norm": 1.6484375, "learning_rate": 0.0004900296178777426, "loss": 5.3585, "mean_token_accuracy": 0.16258263885974883, "num_tokens": 22777364.0, "step": 13130 }, { "entropy": 5.523081064224243, "epoch": 1.0219412565648707, "grad_norm": 1.53125, "learning_rate": 0.000490021457218289, "loss": 5.2833, "mean_token_accuracy": 0.17148469686508178, "num_tokens": 22786192.0, "step": 13135 }, { "entropy": 5.619490909576416, "epoch": 1.0223302859365881, "grad_norm": 1.7265625, "learning_rate": 0.0004900132932962272, "loss": 5.3412, "mean_token_accuracy": 0.17192437499761581, "num_tokens": 22794244.0, "step": 13140 }, { "entropy": 5.561174011230468, "epoch": 1.0227193153083058, "grad_norm": 1.59375, "learning_rate": 0.000490005126111681, "loss": 5.3224, "mean_token_accuracy": 0.17580875903367996, "num_tokens": 22802543.0, "step": 13145 }, { "entropy": 5.4827522277832035, "epoch": 1.0231083446800233, "grad_norm": 1.4609375, "learning_rate": 0.000489996955664774, "loss": 5.3307, "mean_token_accuracy": 0.1704048439860344, "num_tokens": 22811267.0, "step": 13150 }, { "entropy": 5.540749597549438, "epoch": 1.023497374051741, "grad_norm": 1.59375, "learning_rate": 0.0004899887819556306, "loss": 5.2402, "mean_token_accuracy": 0.17342166900634765, "num_tokens": 22820196.0, "step": 13155 }, { "entropy": 5.611469745635986, "epoch": 1.0238864034234585, "grad_norm": 1.6953125, "learning_rate": 0.0004899806049843745, "loss": 5.4058, "mean_token_accuracy": 0.16959395557641982, "num_tokens": 22828498.0, "step": 13160 }, { "entropy": 5.590411138534546, "epoch": 1.024275432795176, "grad_norm": 1.4453125, "learning_rate": 0.0004899724247511299, "loss": 5.3153, "mean_token_accuracy": 0.17874199599027635, "num_tokens": 22837411.0, "step": 13165 }, { "entropy": 5.43924765586853, "epoch": 1.0246644621668937, "grad_norm": 1.640625, "learning_rate": 0.000489964241256021, "loss": 5.2425, "mean_token_accuracy": 0.174375019967556, "num_tokens": 22846265.0, "step": 13170 }, { "entropy": 5.445515918731689, "epoch": 1.0250534915386111, "grad_norm": 1.75, "learning_rate": 0.0004899560544991718, "loss": 5.2115, "mean_token_accuracy": 0.17506559789180756, "num_tokens": 22854489.0, "step": 13175 }, { "entropy": 5.581643438339233, "epoch": 1.0254425209103288, "grad_norm": 1.4765625, "learning_rate": 0.0004899478644807068, "loss": 5.4031, "mean_token_accuracy": 0.1649957537651062, "num_tokens": 22863269.0, "step": 13180 }, { "entropy": 5.599470853805542, "epoch": 1.0258315502820463, "grad_norm": 1.4453125, "learning_rate": 0.0004899396712007498, "loss": 5.3845, "mean_token_accuracy": 0.1650130942463875, "num_tokens": 22872304.0, "step": 13185 }, { "entropy": 5.527854061126709, "epoch": 1.0262205796537638, "grad_norm": 1.640625, "learning_rate": 0.0004899314746594256, "loss": 5.1749, "mean_token_accuracy": 0.17417426705360411, "num_tokens": 22881409.0, "step": 13190 }, { "entropy": 5.547877550125122, "epoch": 1.0266096090254815, "grad_norm": 1.4453125, "learning_rate": 0.0004899232748568584, "loss": 5.2728, "mean_token_accuracy": 0.17250572741031647, "num_tokens": 22889560.0, "step": 13195 }, { "entropy": 5.515940761566162, "epoch": 1.026998638397199, "grad_norm": 1.4609375, "learning_rate": 0.0004899150717931724, "loss": 5.3383, "mean_token_accuracy": 0.16536664813756943, "num_tokens": 22897434.0, "step": 13200 }, { "entropy": 5.558090734481811, "epoch": 1.0273876677689167, "grad_norm": 1.6796875, "learning_rate": 0.0004899068654684924, "loss": 5.3265, "mean_token_accuracy": 0.17122836261987687, "num_tokens": 22906050.0, "step": 13205 }, { "entropy": 5.543594074249268, "epoch": 1.0277766971406341, "grad_norm": 1.8984375, "learning_rate": 0.0004898986558829428, "loss": 5.2867, "mean_token_accuracy": 0.17371345311403275, "num_tokens": 22914118.0, "step": 13210 }, { "entropy": 5.535507440567017, "epoch": 1.0281657265123516, "grad_norm": 1.6953125, "learning_rate": 0.0004898904430366479, "loss": 5.3026, "mean_token_accuracy": 0.17229761481285094, "num_tokens": 22922539.0, "step": 13215 }, { "entropy": 5.513501453399658, "epoch": 1.0285547558840693, "grad_norm": 1.7421875, "learning_rate": 0.0004898822269297328, "loss": 5.3049, "mean_token_accuracy": 0.16814896166324617, "num_tokens": 22932371.0, "step": 13220 }, { "entropy": 5.560471725463867, "epoch": 1.0289437852557868, "grad_norm": 1.4296875, "learning_rate": 0.0004898740075623218, "loss": 5.3368, "mean_token_accuracy": 0.17443976998329164, "num_tokens": 22940608.0, "step": 13225 }, { "entropy": 5.570888376235962, "epoch": 1.0293328146275045, "grad_norm": 1.5546875, "learning_rate": 0.0004898657849345399, "loss": 5.3154, "mean_token_accuracy": 0.16587201207876207, "num_tokens": 22948905.0, "step": 13230 }, { "entropy": 5.490921688079834, "epoch": 1.029721843999222, "grad_norm": 1.71875, "learning_rate": 0.0004898575590465116, "loss": 5.2805, "mean_token_accuracy": 0.17339199185371398, "num_tokens": 22957218.0, "step": 13235 }, { "entropy": 5.541296672821045, "epoch": 1.0301108733709394, "grad_norm": 1.53125, "learning_rate": 0.0004898493298983619, "loss": 5.4322, "mean_token_accuracy": 0.17029115557670593, "num_tokens": 22965700.0, "step": 13240 }, { "entropy": 5.665392017364502, "epoch": 1.0304999027426571, "grad_norm": 1.625, "learning_rate": 0.0004898410974902155, "loss": 5.3734, "mean_token_accuracy": 0.1702515408396721, "num_tokens": 22973996.0, "step": 13245 }, { "entropy": 5.611515378952026, "epoch": 1.0308889321143746, "grad_norm": 2.21875, "learning_rate": 0.0004898328618221974, "loss": 5.3472, "mean_token_accuracy": 0.16921236664056777, "num_tokens": 22983142.0, "step": 13250 }, { "entropy": 5.511696481704712, "epoch": 1.0312779614860923, "grad_norm": 1.9140625, "learning_rate": 0.0004898246228944327, "loss": 5.3042, "mean_token_accuracy": 0.17110096514225007, "num_tokens": 22991263.0, "step": 13255 }, { "entropy": 5.589747524261474, "epoch": 1.0316669908578098, "grad_norm": 1.921875, "learning_rate": 0.0004898163807070461, "loss": 5.3915, "mean_token_accuracy": 0.16521840393543244, "num_tokens": 23000068.0, "step": 13260 }, { "entropy": 5.590217065811157, "epoch": 1.0320560202295272, "grad_norm": 1.53125, "learning_rate": 0.0004898081352601629, "loss": 5.2952, "mean_token_accuracy": 0.1719805970788002, "num_tokens": 23007935.0, "step": 13265 }, { "entropy": 5.508534669876099, "epoch": 1.032445049601245, "grad_norm": 1.453125, "learning_rate": 0.0004897998865539082, "loss": 5.3762, "mean_token_accuracy": 0.1628126934170723, "num_tokens": 23017462.0, "step": 13270 }, { "entropy": 5.587372779846191, "epoch": 1.0328340789729624, "grad_norm": 1.65625, "learning_rate": 0.0004897916345884069, "loss": 5.3703, "mean_token_accuracy": 0.1638731062412262, "num_tokens": 23026681.0, "step": 13275 }, { "entropy": 5.562488794326782, "epoch": 1.0332231083446801, "grad_norm": 1.6171875, "learning_rate": 0.0004897833793637847, "loss": 5.333, "mean_token_accuracy": 0.16925524473190307, "num_tokens": 23035720.0, "step": 13280 }, { "entropy": 5.599439382553101, "epoch": 1.0336121377163976, "grad_norm": 1.515625, "learning_rate": 0.0004897751208801665, "loss": 5.3498, "mean_token_accuracy": 0.16761697828769684, "num_tokens": 23044491.0, "step": 13285 }, { "entropy": 5.585770988464356, "epoch": 1.034001167088115, "grad_norm": 1.7734375, "learning_rate": 0.0004897668591376777, "loss": 5.3603, "mean_token_accuracy": 0.1694803535938263, "num_tokens": 23054034.0, "step": 13290 }, { "entropy": 5.564758253097534, "epoch": 1.0343901964598328, "grad_norm": 1.53125, "learning_rate": 0.0004897585941364436, "loss": 5.2971, "mean_token_accuracy": 0.1661220148205757, "num_tokens": 23062478.0, "step": 13295 }, { "entropy": 5.516941356658935, "epoch": 1.0347792258315502, "grad_norm": 1.609375, "learning_rate": 0.0004897503258765896, "loss": 5.3332, "mean_token_accuracy": 0.16616709232330323, "num_tokens": 23070776.0, "step": 13300 }, { "entropy": 5.580062818527222, "epoch": 1.035168255203268, "grad_norm": 1.4765625, "learning_rate": 0.0004897420543582413, "loss": 5.3791, "mean_token_accuracy": 0.17137093096971512, "num_tokens": 23078459.0, "step": 13305 }, { "entropy": 5.574888563156128, "epoch": 1.0355572845749854, "grad_norm": 1.8046875, "learning_rate": 0.000489733779581524, "loss": 5.3411, "mean_token_accuracy": 0.17564865797758103, "num_tokens": 23087113.0, "step": 13310 }, { "entropy": 5.4958878517150875, "epoch": 1.035946313946703, "grad_norm": 1.921875, "learning_rate": 0.0004897255015465635, "loss": 5.2687, "mean_token_accuracy": 0.17245230823755264, "num_tokens": 23095989.0, "step": 13315 }, { "entropy": 5.522052526473999, "epoch": 1.0363353433184206, "grad_norm": 1.46875, "learning_rate": 0.0004897172202534853, "loss": 5.2964, "mean_token_accuracy": 0.17018729597330093, "num_tokens": 23104578.0, "step": 13320 }, { "entropy": 5.564993953704834, "epoch": 1.036724372690138, "grad_norm": 1.6015625, "learning_rate": 0.000489708935702415, "loss": 5.3517, "mean_token_accuracy": 0.16749211847782136, "num_tokens": 23114390.0, "step": 13325 }, { "entropy": 5.672108793258667, "epoch": 1.0371134020618558, "grad_norm": 1.4296875, "learning_rate": 0.0004897006478934784, "loss": 5.2382, "mean_token_accuracy": 0.1764823541045189, "num_tokens": 23122411.0, "step": 13330 }, { "entropy": 5.504877090454102, "epoch": 1.0375024314335732, "grad_norm": 1.359375, "learning_rate": 0.0004896923568268011, "loss": 5.2102, "mean_token_accuracy": 0.17106251716613768, "num_tokens": 23130801.0, "step": 13335 }, { "entropy": 5.494357776641846, "epoch": 1.0378914608052907, "grad_norm": 1.4765625, "learning_rate": 0.000489684062502509, "loss": 5.2545, "mean_token_accuracy": 0.17517763674259185, "num_tokens": 23138578.0, "step": 13340 }, { "entropy": 5.535081005096435, "epoch": 1.0382804901770084, "grad_norm": 1.390625, "learning_rate": 0.0004896757649207281, "loss": 5.3263, "mean_token_accuracy": 0.1695863649249077, "num_tokens": 23147135.0, "step": 13345 }, { "entropy": 5.62409987449646, "epoch": 1.0386695195487259, "grad_norm": 1.53125, "learning_rate": 0.000489667464081584, "loss": 5.3969, "mean_token_accuracy": 0.16792264580726624, "num_tokens": 23155791.0, "step": 13350 }, { "entropy": 5.559703826904297, "epoch": 1.0390585489204436, "grad_norm": 1.40625, "learning_rate": 0.0004896591599852029, "loss": 5.2531, "mean_token_accuracy": 0.17504205256700517, "num_tokens": 23163674.0, "step": 13355 }, { "entropy": 5.526022291183471, "epoch": 1.039447578292161, "grad_norm": 1.5078125, "learning_rate": 0.0004896508526317107, "loss": 5.3217, "mean_token_accuracy": 0.16219640225172044, "num_tokens": 23171931.0, "step": 13360 }, { "entropy": 5.580244541168213, "epoch": 1.0398366076638785, "grad_norm": 1.703125, "learning_rate": 0.0004896425420212334, "loss": 5.333, "mean_token_accuracy": 0.1642221838235855, "num_tokens": 23180195.0, "step": 13365 }, { "entropy": 5.52488956451416, "epoch": 1.0402256370355962, "grad_norm": 1.4296875, "learning_rate": 0.0004896342281538973, "loss": 5.2704, "mean_token_accuracy": 0.1739368423819542, "num_tokens": 23189486.0, "step": 13370 }, { "entropy": 5.542613410949707, "epoch": 1.0406146664073137, "grad_norm": 1.515625, "learning_rate": 0.0004896259110298283, "loss": 5.3894, "mean_token_accuracy": 0.16582002192735673, "num_tokens": 23198055.0, "step": 13375 }, { "entropy": 5.539638423919678, "epoch": 1.0410036957790314, "grad_norm": 1.609375, "learning_rate": 0.0004896175906491528, "loss": 5.2664, "mean_token_accuracy": 0.17826088666915893, "num_tokens": 23206092.0, "step": 13380 }, { "entropy": 5.595705842971801, "epoch": 1.0413927251507489, "grad_norm": 1.625, "learning_rate": 0.0004896092670119968, "loss": 5.3396, "mean_token_accuracy": 0.17463093847036362, "num_tokens": 23214820.0, "step": 13385 }, { "entropy": 5.502323818206787, "epoch": 1.0417817545224664, "grad_norm": 1.578125, "learning_rate": 0.0004896009401184869, "loss": 5.3084, "mean_token_accuracy": 0.17374697476625442, "num_tokens": 23224033.0, "step": 13390 }, { "entropy": 5.497268962860107, "epoch": 1.042170783894184, "grad_norm": 1.671875, "learning_rate": 0.0004895926099687493, "loss": 5.2872, "mean_token_accuracy": 0.1754576474428177, "num_tokens": 23233074.0, "step": 13395 }, { "entropy": 5.507416200637818, "epoch": 1.0425598132659015, "grad_norm": 1.3671875, "learning_rate": 0.0004895842765629104, "loss": 5.2462, "mean_token_accuracy": 0.17499990612268448, "num_tokens": 23241167.0, "step": 13400 }, { "entropy": 5.596942138671875, "epoch": 1.0429488426376192, "grad_norm": 1.4453125, "learning_rate": 0.0004895759399010966, "loss": 5.2753, "mean_token_accuracy": 0.16960269212722778, "num_tokens": 23249601.0, "step": 13405 }, { "entropy": 5.550609159469604, "epoch": 1.0433378720093367, "grad_norm": 1.8359375, "learning_rate": 0.0004895675999834345, "loss": 5.368, "mean_token_accuracy": 0.1588814824819565, "num_tokens": 23257868.0, "step": 13410 }, { "entropy": 5.58900089263916, "epoch": 1.0437269013810542, "grad_norm": 1.5078125, "learning_rate": 0.0004895592568100505, "loss": 5.3533, "mean_token_accuracy": 0.16595737785100936, "num_tokens": 23266586.0, "step": 13415 }, { "entropy": 5.614063453674317, "epoch": 1.0441159307527719, "grad_norm": 1.7578125, "learning_rate": 0.0004895509103810714, "loss": 5.3321, "mean_token_accuracy": 0.1688019946217537, "num_tokens": 23275114.0, "step": 13420 }, { "entropy": 5.413854789733887, "epoch": 1.0445049601244893, "grad_norm": 1.375, "learning_rate": 0.0004895425606966237, "loss": 5.2248, "mean_token_accuracy": 0.17890949547290802, "num_tokens": 23283200.0, "step": 13425 }, { "entropy": 5.542884397506714, "epoch": 1.044893989496207, "grad_norm": 1.5, "learning_rate": 0.000489534207756834, "loss": 5.4307, "mean_token_accuracy": 0.16368771940469742, "num_tokens": 23291999.0, "step": 13430 }, { "entropy": 5.607825660705567, "epoch": 1.0452830188679245, "grad_norm": 1.5546875, "learning_rate": 0.0004895258515618293, "loss": 5.3143, "mean_token_accuracy": 0.16850415319204332, "num_tokens": 23300514.0, "step": 13435 }, { "entropy": 5.53573431968689, "epoch": 1.045672048239642, "grad_norm": 1.625, "learning_rate": 0.0004895174921117362, "loss": 5.2721, "mean_token_accuracy": 0.17205916494131088, "num_tokens": 23309543.0, "step": 13440 }, { "entropy": 5.466213941574097, "epoch": 1.0460610776113597, "grad_norm": 1.3203125, "learning_rate": 0.0004895091294066816, "loss": 5.2948, "mean_token_accuracy": 0.1734081506729126, "num_tokens": 23319002.0, "step": 13445 }, { "entropy": 5.568212270736694, "epoch": 1.0464501069830772, "grad_norm": 1.6640625, "learning_rate": 0.0004895007634467924, "loss": 5.346, "mean_token_accuracy": 0.1708262339234352, "num_tokens": 23326604.0, "step": 13450 }, { "entropy": 5.503519582748413, "epoch": 1.0468391363547949, "grad_norm": 1.34375, "learning_rate": 0.0004894923942321955, "loss": 5.2818, "mean_token_accuracy": 0.17666701823472977, "num_tokens": 23335492.0, "step": 13455 }, { "entropy": 5.5053855895996096, "epoch": 1.0472281657265123, "grad_norm": 1.4765625, "learning_rate": 0.0004894840217630179, "loss": 5.3065, "mean_token_accuracy": 0.17429608553647996, "num_tokens": 23343693.0, "step": 13460 }, { "entropy": 5.522336721420288, "epoch": 1.0476171950982298, "grad_norm": 1.828125, "learning_rate": 0.0004894756460393868, "loss": 5.2667, "mean_token_accuracy": 0.17938611954450606, "num_tokens": 23352587.0, "step": 13465 }, { "entropy": 5.547571134567261, "epoch": 1.0480062244699475, "grad_norm": 1.3671875, "learning_rate": 0.000489467267061429, "loss": 5.3455, "mean_token_accuracy": 0.1718888908624649, "num_tokens": 23361293.0, "step": 13470 }, { "entropy": 5.5730455875396725, "epoch": 1.048395253841665, "grad_norm": 1.4921875, "learning_rate": 0.0004894588848292718, "loss": 5.3243, "mean_token_accuracy": 0.17050171196460723, "num_tokens": 23369663.0, "step": 13475 }, { "entropy": 5.535304594039917, "epoch": 1.0487842832133827, "grad_norm": 1.7109375, "learning_rate": 0.0004894504993430425, "loss": 5.2367, "mean_token_accuracy": 0.17066449224948882, "num_tokens": 23378224.0, "step": 13480 }, { "entropy": 5.581699514389038, "epoch": 1.0491733125851002, "grad_norm": 1.4375, "learning_rate": 0.000489442110602868, "loss": 5.4122, "mean_token_accuracy": 0.16622019559144974, "num_tokens": 23386693.0, "step": 13485 }, { "entropy": 5.533706712722778, "epoch": 1.0495623419568176, "grad_norm": 1.4921875, "learning_rate": 0.0004894337186088759, "loss": 5.2712, "mean_token_accuracy": 0.1727204993367195, "num_tokens": 23395226.0, "step": 13490 }, { "entropy": 5.527824020385742, "epoch": 1.0499513713285353, "grad_norm": 1.46875, "learning_rate": 0.0004894253233611934, "loss": 5.2939, "mean_token_accuracy": 0.16925432831048964, "num_tokens": 23403779.0, "step": 13495 }, { "entropy": 5.560998725891113, "epoch": 1.0503404007002528, "grad_norm": 1.6015625, "learning_rate": 0.000489416924859948, "loss": 5.3993, "mean_token_accuracy": 0.17176871448755265, "num_tokens": 23411807.0, "step": 13500 }, { "entropy": 5.492605113983155, "epoch": 1.0507294300719705, "grad_norm": 1.484375, "learning_rate": 0.000489408523105267, "loss": 5.2718, "mean_token_accuracy": 0.16818220168352127, "num_tokens": 23420323.0, "step": 13505 }, { "entropy": 5.528667259216308, "epoch": 1.051118459443688, "grad_norm": 1.71875, "learning_rate": 0.0004894001180972779, "loss": 5.2788, "mean_token_accuracy": 0.1729546681046486, "num_tokens": 23429220.0, "step": 13510 }, { "entropy": 5.546587419509888, "epoch": 1.0515074888154055, "grad_norm": 1.578125, "learning_rate": 0.0004893917098361082, "loss": 5.3048, "mean_token_accuracy": 0.17642121762037277, "num_tokens": 23438471.0, "step": 13515 }, { "entropy": 5.576458263397217, "epoch": 1.0518965181871232, "grad_norm": 1.578125, "learning_rate": 0.0004893832983218856, "loss": 5.3738, "mean_token_accuracy": 0.17581699937582015, "num_tokens": 23447504.0, "step": 13520 }, { "entropy": 5.450729417800903, "epoch": 1.0522855475588406, "grad_norm": 1.578125, "learning_rate": 0.0004893748835547377, "loss": 5.113, "mean_token_accuracy": 0.185771644115448, "num_tokens": 23456065.0, "step": 13525 }, { "entropy": 5.535451936721802, "epoch": 1.0526745769305583, "grad_norm": 1.78125, "learning_rate": 0.0004893664655347921, "loss": 5.2961, "mean_token_accuracy": 0.17600812017917633, "num_tokens": 23463826.0, "step": 13530 }, { "entropy": 5.418683910369873, "epoch": 1.0530636063022758, "grad_norm": 1.765625, "learning_rate": 0.0004893580442621767, "loss": 5.2655, "mean_token_accuracy": 0.1793366938829422, "num_tokens": 23472092.0, "step": 13535 }, { "entropy": 5.565783071517944, "epoch": 1.0534526356739935, "grad_norm": 1.4765625, "learning_rate": 0.000489349619737019, "loss": 5.3779, "mean_token_accuracy": 0.16387729495763778, "num_tokens": 23480934.0, "step": 13540 }, { "entropy": 5.618014240264893, "epoch": 1.053841665045711, "grad_norm": 1.5390625, "learning_rate": 0.000489341191959447, "loss": 5.325, "mean_token_accuracy": 0.1696184165775776, "num_tokens": 23490187.0, "step": 13545 }, { "entropy": 5.5481956005096436, "epoch": 1.0542306944174284, "grad_norm": 1.484375, "learning_rate": 0.0004893327609295887, "loss": 5.2614, "mean_token_accuracy": 0.17242091447114943, "num_tokens": 23498330.0, "step": 13550 }, { "entropy": 5.435535097122193, "epoch": 1.0546197237891461, "grad_norm": 1.4140625, "learning_rate": 0.0004893243266475719, "loss": 5.188, "mean_token_accuracy": 0.17514382153749466, "num_tokens": 23506219.0, "step": 13555 }, { "entropy": 5.4826188564300535, "epoch": 1.0550087531608636, "grad_norm": 1.546875, "learning_rate": 0.0004893158891135245, "loss": 5.2779, "mean_token_accuracy": 0.173899045586586, "num_tokens": 23514585.0, "step": 13560 }, { "entropy": 5.568767881393432, "epoch": 1.055397782532581, "grad_norm": 1.4140625, "learning_rate": 0.0004893074483275746, "loss": 5.2323, "mean_token_accuracy": 0.1731153279542923, "num_tokens": 23522919.0, "step": 13565 }, { "entropy": 5.561643838882446, "epoch": 1.0557868119042988, "grad_norm": 1.4609375, "learning_rate": 0.0004892990042898503, "loss": 5.4482, "mean_token_accuracy": 0.1605902597308159, "num_tokens": 23531613.0, "step": 13570 }, { "entropy": 5.564041614532471, "epoch": 1.0561758412760163, "grad_norm": 1.453125, "learning_rate": 0.0004892905570004798, "loss": 5.3891, "mean_token_accuracy": 0.16505015641450882, "num_tokens": 23539865.0, "step": 13575 }, { "entropy": 5.478564691543579, "epoch": 1.056564870647734, "grad_norm": 1.6484375, "learning_rate": 0.000489282106459591, "loss": 5.2238, "mean_token_accuracy": 0.18216872662305833, "num_tokens": 23548424.0, "step": 13580 }, { "entropy": 5.562547302246093, "epoch": 1.0569539000194514, "grad_norm": 1.4921875, "learning_rate": 0.0004892736526673124, "loss": 5.3177, "mean_token_accuracy": 0.17252922505140306, "num_tokens": 23557199.0, "step": 13585 }, { "entropy": 5.565737009048462, "epoch": 1.0573429293911691, "grad_norm": 1.4609375, "learning_rate": 0.0004892651956237721, "loss": 5.4448, "mean_token_accuracy": 0.15989054441452027, "num_tokens": 23565979.0, "step": 13590 }, { "entropy": 5.564665126800537, "epoch": 1.0577319587628866, "grad_norm": 1.4453125, "learning_rate": 0.0004892567353290986, "loss": 5.3022, "mean_token_accuracy": 0.16925350278615953, "num_tokens": 23575405.0, "step": 13595 }, { "entropy": 5.64054651260376, "epoch": 1.058120988134604, "grad_norm": 1.4765625, "learning_rate": 0.0004892482717834201, "loss": 5.4364, "mean_token_accuracy": 0.15500097647309302, "num_tokens": 23584589.0, "step": 13600 }, { "entropy": 5.524608135223389, "epoch": 1.0585100175063218, "grad_norm": 1.65625, "learning_rate": 0.0004892398049868651, "loss": 5.2872, "mean_token_accuracy": 0.1721488878130913, "num_tokens": 23593079.0, "step": 13605 }, { "entropy": 5.564929008483887, "epoch": 1.0588990468780393, "grad_norm": 1.5, "learning_rate": 0.000489231334939562, "loss": 5.357, "mean_token_accuracy": 0.1696854367852211, "num_tokens": 23602010.0, "step": 13610 }, { "entropy": 5.610072231292724, "epoch": 1.059288076249757, "grad_norm": 1.578125, "learning_rate": 0.0004892228616416395, "loss": 5.3134, "mean_token_accuracy": 0.17270972430706025, "num_tokens": 23610707.0, "step": 13615 }, { "entropy": 5.460940933227539, "epoch": 1.0596771056214744, "grad_norm": 1.578125, "learning_rate": 0.0004892143850932259, "loss": 5.2961, "mean_token_accuracy": 0.16677080243825912, "num_tokens": 23619579.0, "step": 13620 }, { "entropy": 5.498000049591065, "epoch": 1.060066134993192, "grad_norm": 1.7734375, "learning_rate": 0.00048920590529445, "loss": 5.2719, "mean_token_accuracy": 0.18019049018621444, "num_tokens": 23628407.0, "step": 13625 }, { "entropy": 5.489911699295044, "epoch": 1.0604551643649096, "grad_norm": 1.671875, "learning_rate": 0.0004891974222454406, "loss": 5.1994, "mean_token_accuracy": 0.17532860189676286, "num_tokens": 23637094.0, "step": 13630 }, { "entropy": 5.492452001571655, "epoch": 1.060844193736627, "grad_norm": 1.6015625, "learning_rate": 0.0004891889359463261, "loss": 5.2958, "mean_token_accuracy": 0.17481526583433152, "num_tokens": 23645823.0, "step": 13635 }, { "entropy": 5.570481586456299, "epoch": 1.0612332231083448, "grad_norm": 1.671875, "learning_rate": 0.0004891804463972354, "loss": 5.4054, "mean_token_accuracy": 0.16421720683574675, "num_tokens": 23655027.0, "step": 13640 }, { "entropy": 5.657866048812866, "epoch": 1.0616222524800623, "grad_norm": 1.4140625, "learning_rate": 0.0004891719535982974, "loss": 5.4441, "mean_token_accuracy": 0.16156262755393982, "num_tokens": 23663840.0, "step": 13645 }, { "entropy": 5.62884030342102, "epoch": 1.0620112818517797, "grad_norm": 1.3515625, "learning_rate": 0.0004891634575496408, "loss": 5.3922, "mean_token_accuracy": 0.16663903295993804, "num_tokens": 23672795.0, "step": 13650 }, { "entropy": 5.578080129623413, "epoch": 1.0624003112234974, "grad_norm": 1.5, "learning_rate": 0.0004891549582513946, "loss": 5.3172, "mean_token_accuracy": 0.16714794635772706, "num_tokens": 23681833.0, "step": 13655 }, { "entropy": 5.574814081192017, "epoch": 1.062789340595215, "grad_norm": 1.6484375, "learning_rate": 0.000489146455703688, "loss": 5.2916, "mean_token_accuracy": 0.17374734282493592, "num_tokens": 23689939.0, "step": 13660 }, { "entropy": 5.514884662628174, "epoch": 1.0631783699669326, "grad_norm": 1.796875, "learning_rate": 0.0004891379499066495, "loss": 5.3363, "mean_token_accuracy": 0.17417766749858857, "num_tokens": 23698535.0, "step": 13665 }, { "entropy": 5.5378015518188475, "epoch": 1.06356739933865, "grad_norm": 1.6484375, "learning_rate": 0.0004891294408604087, "loss": 5.2683, "mean_token_accuracy": 0.17150928527116777, "num_tokens": 23707749.0, "step": 13670 }, { "entropy": 5.612474966049194, "epoch": 1.0639564287103676, "grad_norm": 1.421875, "learning_rate": 0.0004891209285650942, "loss": 5.414, "mean_token_accuracy": 0.1681921124458313, "num_tokens": 23716503.0, "step": 13675 }, { "entropy": 5.620874881744385, "epoch": 1.0643454580820852, "grad_norm": 1.421875, "learning_rate": 0.0004891124130208355, "loss": 5.353, "mean_token_accuracy": 0.17228189632296562, "num_tokens": 23724882.0, "step": 13680 }, { "entropy": 5.450166463851929, "epoch": 1.0647344874538027, "grad_norm": 1.453125, "learning_rate": 0.0004891038942277618, "loss": 5.3544, "mean_token_accuracy": 0.17434402406215668, "num_tokens": 23733680.0, "step": 13685 }, { "entropy": 5.5328607082366945, "epoch": 1.0651235168255204, "grad_norm": 1.484375, "learning_rate": 0.0004890953721860022, "loss": 5.2802, "mean_token_accuracy": 0.1807577818632126, "num_tokens": 23742066.0, "step": 13690 }, { "entropy": 5.522846984863281, "epoch": 1.065512546197238, "grad_norm": 1.34375, "learning_rate": 0.0004890868468956862, "loss": 5.2014, "mean_token_accuracy": 0.1826232448220253, "num_tokens": 23750558.0, "step": 13695 }, { "entropy": 5.465801191329956, "epoch": 1.0659015755689554, "grad_norm": 1.640625, "learning_rate": 0.000489078318356943, "loss": 5.2722, "mean_token_accuracy": 0.1692625030875206, "num_tokens": 23759120.0, "step": 13700 }, { "entropy": 5.448861455917358, "epoch": 1.066290604940673, "grad_norm": 5.0, "learning_rate": 0.0004890697865699021, "loss": 5.3096, "mean_token_accuracy": 0.17092404961586, "num_tokens": 23768301.0, "step": 13705 }, { "entropy": 5.515306758880615, "epoch": 1.0666796343123905, "grad_norm": 1.390625, "learning_rate": 0.0004890612515346929, "loss": 5.2569, "mean_token_accuracy": 0.17921047955751418, "num_tokens": 23776155.0, "step": 13710 }, { "entropy": 5.566693305969238, "epoch": 1.0670686636841082, "grad_norm": 1.46875, "learning_rate": 0.0004890527132514448, "loss": 5.3532, "mean_token_accuracy": 0.16514315009117125, "num_tokens": 23785363.0, "step": 13715 }, { "entropy": 5.595513248443604, "epoch": 1.0674576930558257, "grad_norm": 1.546875, "learning_rate": 0.0004890441717202876, "loss": 5.2999, "mean_token_accuracy": 0.17422668337821962, "num_tokens": 23793817.0, "step": 13720 }, { "entropy": 5.550647640228272, "epoch": 1.0678467224275432, "grad_norm": 1.453125, "learning_rate": 0.0004890356269413507, "loss": 5.356, "mean_token_accuracy": 0.16996671706438066, "num_tokens": 23802629.0, "step": 13725 }, { "entropy": 5.465928840637207, "epoch": 1.068235751799261, "grad_norm": 1.4375, "learning_rate": 0.000489027078914764, "loss": 5.1411, "mean_token_accuracy": 0.1822621151804924, "num_tokens": 23811178.0, "step": 13730 }, { "entropy": 5.53959698677063, "epoch": 1.0686247811709784, "grad_norm": 1.828125, "learning_rate": 0.0004890185276406569, "loss": 5.3693, "mean_token_accuracy": 0.167016638815403, "num_tokens": 23819685.0, "step": 13735 }, { "entropy": 5.419653844833374, "epoch": 1.069013810542696, "grad_norm": 1.5, "learning_rate": 0.0004890099731191592, "loss": 5.239, "mean_token_accuracy": 0.17011093348264694, "num_tokens": 23828733.0, "step": 13740 }, { "entropy": 5.601557350158691, "epoch": 1.0694028399144135, "grad_norm": 1.921875, "learning_rate": 0.000489001415350401, "loss": 5.4134, "mean_token_accuracy": 0.16911170482635499, "num_tokens": 23837095.0, "step": 13745 }, { "entropy": 5.624904584884644, "epoch": 1.069791869286131, "grad_norm": 1.4609375, "learning_rate": 0.0004889928543345118, "loss": 5.3659, "mean_token_accuracy": 0.16807382553815842, "num_tokens": 23846637.0, "step": 13750 }, { "entropy": 5.593227338790894, "epoch": 1.0701808986578487, "grad_norm": 1.9453125, "learning_rate": 0.0004889842900716217, "loss": 5.4405, "mean_token_accuracy": 0.16046826392412186, "num_tokens": 23856042.0, "step": 13755 }, { "entropy": 5.581457424163818, "epoch": 1.0705699280295662, "grad_norm": 1.7265625, "learning_rate": 0.0004889757225618606, "loss": 5.398, "mean_token_accuracy": 0.161847585439682, "num_tokens": 23865367.0, "step": 13760 }, { "entropy": 5.560931396484375, "epoch": 1.0709589574012839, "grad_norm": 1.4765625, "learning_rate": 0.0004889671518053584, "loss": 5.3748, "mean_token_accuracy": 0.16762278825044633, "num_tokens": 23874740.0, "step": 13765 }, { "entropy": 5.559179353713989, "epoch": 1.0713479867730014, "grad_norm": 1.8046875, "learning_rate": 0.0004889585778022453, "loss": 5.3194, "mean_token_accuracy": 0.17093719094991683, "num_tokens": 23884229.0, "step": 13770 }, { "entropy": 5.510400342941284, "epoch": 1.0717370161447188, "grad_norm": 1.4453125, "learning_rate": 0.0004889500005526514, "loss": 5.23, "mean_token_accuracy": 0.17975565642118455, "num_tokens": 23892149.0, "step": 13775 }, { "entropy": 5.644508028030396, "epoch": 1.0721260455164365, "grad_norm": 1.4453125, "learning_rate": 0.0004889414200567067, "loss": 5.4889, "mean_token_accuracy": 0.15467537343502044, "num_tokens": 23901802.0, "step": 13780 }, { "entropy": 5.592928695678711, "epoch": 1.072515074888154, "grad_norm": 1.3515625, "learning_rate": 0.0004889328363145415, "loss": 5.3306, "mean_token_accuracy": 0.17018810361623765, "num_tokens": 23910268.0, "step": 13785 }, { "entropy": 5.456088638305664, "epoch": 1.0729041042598717, "grad_norm": 3.296875, "learning_rate": 0.0004889242493262859, "loss": 5.1646, "mean_token_accuracy": 0.17440763264894485, "num_tokens": 23918351.0, "step": 13790 }, { "entropy": 5.511342859268188, "epoch": 1.0732931336315892, "grad_norm": 1.3828125, "learning_rate": 0.0004889156590920704, "loss": 5.2312, "mean_token_accuracy": 0.17307026088237762, "num_tokens": 23927367.0, "step": 13795 }, { "entropy": 5.500313711166382, "epoch": 1.0736821630033067, "grad_norm": 1.40625, "learning_rate": 0.0004889070656120253, "loss": 5.3071, "mean_token_accuracy": 0.17446416169404982, "num_tokens": 23936216.0, "step": 13800 }, { "entropy": 5.636788845062256, "epoch": 1.0740711923750244, "grad_norm": 1.6015625, "learning_rate": 0.0004888984688862809, "loss": 5.3835, "mean_token_accuracy": 0.16611143052577973, "num_tokens": 23944344.0, "step": 13805 }, { "entropy": 5.575056076049805, "epoch": 1.0744602217467418, "grad_norm": 1.46875, "learning_rate": 0.0004888898689149677, "loss": 5.4094, "mean_token_accuracy": 0.15442738458514213, "num_tokens": 23953390.0, "step": 13810 }, { "entropy": 5.635413694381714, "epoch": 1.0748492511184595, "grad_norm": 1.40625, "learning_rate": 0.0004888812656982162, "loss": 5.3982, "mean_token_accuracy": 0.1702481508255005, "num_tokens": 23962230.0, "step": 13815 }, { "entropy": 5.562955141067505, "epoch": 1.075238280490177, "grad_norm": 1.6328125, "learning_rate": 0.0004888726592361569, "loss": 5.2811, "mean_token_accuracy": 0.1708732083439827, "num_tokens": 23971627.0, "step": 13820 }, { "entropy": 5.496527624130249, "epoch": 1.0756273098618945, "grad_norm": 1.625, "learning_rate": 0.0004888640495289204, "loss": 5.282, "mean_token_accuracy": 0.17555358856916428, "num_tokens": 23980222.0, "step": 13825 }, { "entropy": 5.5275712490081785, "epoch": 1.0760163392336122, "grad_norm": 1.671875, "learning_rate": 0.0004888554365766374, "loss": 5.3474, "mean_token_accuracy": 0.1654688909649849, "num_tokens": 23988803.0, "step": 13830 }, { "entropy": 5.544680786132813, "epoch": 1.0764053686053296, "grad_norm": 1.5234375, "learning_rate": 0.0004888468203794385, "loss": 5.3409, "mean_token_accuracy": 0.16459826976060868, "num_tokens": 23997664.0, "step": 13835 }, { "entropy": 5.532573986053467, "epoch": 1.0767943979770473, "grad_norm": 1.7265625, "learning_rate": 0.0004888382009374545, "loss": 5.3239, "mean_token_accuracy": 0.17208846807479858, "num_tokens": 24006641.0, "step": 13840 }, { "entropy": 5.502842378616333, "epoch": 1.0771834273487648, "grad_norm": 1.6328125, "learning_rate": 0.0004888295782508161, "loss": 5.2714, "mean_token_accuracy": 0.16638420522212982, "num_tokens": 24014852.0, "step": 13845 }, { "entropy": 5.573114013671875, "epoch": 1.0775724567204823, "grad_norm": 1.7109375, "learning_rate": 0.0004888209523196542, "loss": 5.2946, "mean_token_accuracy": 0.1803032010793686, "num_tokens": 24023441.0, "step": 13850 }, { "entropy": 5.620143985748291, "epoch": 1.0779614860922, "grad_norm": 1.703125, "learning_rate": 0.0004888123231440997, "loss": 5.3048, "mean_token_accuracy": 0.17385974228382112, "num_tokens": 24032120.0, "step": 13855 }, { "entropy": 5.561611080169678, "epoch": 1.0783505154639175, "grad_norm": 1.6953125, "learning_rate": 0.0004888036907242834, "loss": 5.3607, "mean_token_accuracy": 0.16757990270853043, "num_tokens": 24040264.0, "step": 13860 }, { "entropy": 5.642135095596314, "epoch": 1.0787395448356352, "grad_norm": 1.921875, "learning_rate": 0.0004887950550603366, "loss": 5.4115, "mean_token_accuracy": 0.16733597069978715, "num_tokens": 24049194.0, "step": 13865 }, { "entropy": 5.55846471786499, "epoch": 1.0791285742073526, "grad_norm": 1.9375, "learning_rate": 0.0004887864161523901, "loss": 5.2732, "mean_token_accuracy": 0.17170953005552292, "num_tokens": 24058004.0, "step": 13870 }, { "entropy": 5.4610028743743895, "epoch": 1.0795176035790701, "grad_norm": 1.5546875, "learning_rate": 0.0004887777740005749, "loss": 5.2269, "mean_token_accuracy": 0.17321476042270662, "num_tokens": 24066871.0, "step": 13875 }, { "entropy": 5.558225488662719, "epoch": 1.0799066329507878, "grad_norm": 1.5703125, "learning_rate": 0.0004887691286050224, "loss": 5.3347, "mean_token_accuracy": 0.16767856925725938, "num_tokens": 24075409.0, "step": 13880 }, { "entropy": 5.588159608840942, "epoch": 1.0802956623225053, "grad_norm": 2.109375, "learning_rate": 0.0004887604799658635, "loss": 5.2789, "mean_token_accuracy": 0.16992218941450118, "num_tokens": 24083983.0, "step": 13885 }, { "entropy": 5.536437511444092, "epoch": 1.080684691694223, "grad_norm": 2.515625, "learning_rate": 0.0004887518280832295, "loss": 5.2984, "mean_token_accuracy": 0.17002954483032226, "num_tokens": 24092225.0, "step": 13890 }, { "entropy": 5.474335479736328, "epoch": 1.0810737210659405, "grad_norm": 1.6796875, "learning_rate": 0.0004887431729572519, "loss": 5.2265, "mean_token_accuracy": 0.18012141734361647, "num_tokens": 24100045.0, "step": 13895 }, { "entropy": 5.488373041152954, "epoch": 1.081462750437658, "grad_norm": 1.5546875, "learning_rate": 0.0004887345145880617, "loss": 5.2988, "mean_token_accuracy": 0.1758161962032318, "num_tokens": 24108540.0, "step": 13900 }, { "entropy": 5.590416717529297, "epoch": 1.0818517798093756, "grad_norm": 1.5, "learning_rate": 0.0004887258529757904, "loss": 5.3874, "mean_token_accuracy": 0.16554994285106658, "num_tokens": 24117819.0, "step": 13905 }, { "entropy": 5.5390746116638185, "epoch": 1.082240809181093, "grad_norm": 1.75, "learning_rate": 0.0004887171881205696, "loss": 5.1909, "mean_token_accuracy": 0.17586574107408523, "num_tokens": 24127000.0, "step": 13910 }, { "entropy": 5.528246259689331, "epoch": 1.0826298385528108, "grad_norm": 1.7109375, "learning_rate": 0.0004887085200225306, "loss": 5.3117, "mean_token_accuracy": 0.16844677478075026, "num_tokens": 24135404.0, "step": 13915 }, { "entropy": 5.449680376052856, "epoch": 1.0830188679245283, "grad_norm": 1.921875, "learning_rate": 0.0004886998486818049, "loss": 5.1416, "mean_token_accuracy": 0.1834289848804474, "num_tokens": 24143944.0, "step": 13920 }, { "entropy": 5.510674047470093, "epoch": 1.083407897296246, "grad_norm": 1.3828125, "learning_rate": 0.0004886911740985242, "loss": 5.2696, "mean_token_accuracy": 0.17339787483215333, "num_tokens": 24153097.0, "step": 13925 }, { "entropy": 5.570836067199707, "epoch": 1.0837969266679635, "grad_norm": 1.46875, "learning_rate": 0.00048868249627282, "loss": 5.4283, "mean_token_accuracy": 0.16437558084726334, "num_tokens": 24162499.0, "step": 13930 }, { "entropy": 5.550439834594727, "epoch": 1.084185956039681, "grad_norm": 2.109375, "learning_rate": 0.000488673815204824, "loss": 5.2494, "mean_token_accuracy": 0.1778493732213974, "num_tokens": 24170543.0, "step": 13935 }, { "entropy": 5.554481840133667, "epoch": 1.0845749854113986, "grad_norm": 1.5546875, "learning_rate": 0.0004886651308946681, "loss": 5.3223, "mean_token_accuracy": 0.16854367554187774, "num_tokens": 24180871.0, "step": 13940 }, { "entropy": 5.505338907241821, "epoch": 1.084964014783116, "grad_norm": 1.5703125, "learning_rate": 0.0004886564433424839, "loss": 5.2427, "mean_token_accuracy": 0.17851458340883256, "num_tokens": 24189075.0, "step": 13945 }, { "entropy": 5.594527339935302, "epoch": 1.0853530441548336, "grad_norm": 1.5625, "learning_rate": 0.0004886477525484032, "loss": 5.3365, "mean_token_accuracy": 0.1770291283726692, "num_tokens": 24197686.0, "step": 13950 }, { "entropy": 5.437126588821411, "epoch": 1.0857420735265513, "grad_norm": 1.6796875, "learning_rate": 0.0004886390585125579, "loss": 5.2393, "mean_token_accuracy": 0.16652272939682006, "num_tokens": 24207093.0, "step": 13955 }, { "entropy": 5.627029943466186, "epoch": 1.0861311028982688, "grad_norm": 1.546875, "learning_rate": 0.0004886303612350799, "loss": 5.3385, "mean_token_accuracy": 0.16592801958322526, "num_tokens": 24216447.0, "step": 13960 }, { "entropy": 5.685516357421875, "epoch": 1.0865201322699864, "grad_norm": 1.5546875, "learning_rate": 0.0004886216607161013, "loss": 5.3846, "mean_token_accuracy": 0.16547441035509108, "num_tokens": 24225041.0, "step": 13965 }, { "entropy": 5.608265018463134, "epoch": 1.086909161641704, "grad_norm": 1.3828125, "learning_rate": 0.0004886129569557538, "loss": 5.323, "mean_token_accuracy": 0.1650741770863533, "num_tokens": 24233686.0, "step": 13970 }, { "entropy": 5.504385042190552, "epoch": 1.0872981910134216, "grad_norm": 1.578125, "learning_rate": 0.0004886042499541699, "loss": 5.3341, "mean_token_accuracy": 0.17844736874103545, "num_tokens": 24242553.0, "step": 13975 }, { "entropy": 5.5233869552612305, "epoch": 1.087687220385139, "grad_norm": 3.453125, "learning_rate": 0.0004885955397114813, "loss": 5.2467, "mean_token_accuracy": 0.17321914732456206, "num_tokens": 24251658.0, "step": 13980 }, { "entropy": 5.637213277816772, "epoch": 1.0880762497568566, "grad_norm": 1.8671875, "learning_rate": 0.0004885868262278205, "loss": 5.3671, "mean_token_accuracy": 0.16639908850193025, "num_tokens": 24260397.0, "step": 13985 }, { "entropy": 5.4556975841522215, "epoch": 1.0884652791285743, "grad_norm": 1.328125, "learning_rate": 0.0004885781095033195, "loss": 5.2728, "mean_token_accuracy": 0.17130138874053955, "num_tokens": 24268789.0, "step": 13990 }, { "entropy": 5.530916452407837, "epoch": 1.0888543085002917, "grad_norm": 1.625, "learning_rate": 0.0004885693895381108, "loss": 5.3914, "mean_token_accuracy": 0.16509933024644852, "num_tokens": 24278050.0, "step": 13995 }, { "entropy": 5.6599335193634035, "epoch": 1.0892433378720092, "grad_norm": 1.5390625, "learning_rate": 0.0004885606663323263, "loss": 5.3238, "mean_token_accuracy": 0.17296088933944703, "num_tokens": 24286477.0, "step": 14000 }, { "entropy": 5.442564010620117, "epoch": 1.089632367243727, "grad_norm": 1.7109375, "learning_rate": 0.0004885519398860987, "loss": 5.195, "mean_token_accuracy": 0.17921269088983535, "num_tokens": 24295704.0, "step": 14005 }, { "entropy": 5.424733352661133, "epoch": 1.0900213966154444, "grad_norm": 1.390625, "learning_rate": 0.0004885432101995604, "loss": 5.2377, "mean_token_accuracy": 0.17668494284152986, "num_tokens": 24304132.0, "step": 14010 }, { "entropy": 5.582837057113648, "epoch": 1.090410425987162, "grad_norm": 1.546875, "learning_rate": 0.0004885344772728436, "loss": 5.3355, "mean_token_accuracy": 0.16859273314476014, "num_tokens": 24312864.0, "step": 14015 }, { "entropy": 5.586115026473999, "epoch": 1.0907994553588796, "grad_norm": 1.546875, "learning_rate": 0.0004885257411060812, "loss": 5.2558, "mean_token_accuracy": 0.17344018965959548, "num_tokens": 24321745.0, "step": 14020 }, { "entropy": 5.488592529296875, "epoch": 1.0911884847305973, "grad_norm": 1.6875, "learning_rate": 0.0004885170016994053, "loss": 5.2762, "mean_token_accuracy": 0.16774366945028304, "num_tokens": 24331061.0, "step": 14025 }, { "entropy": 5.45854082107544, "epoch": 1.0915775141023147, "grad_norm": 2.359375, "learning_rate": 0.0004885082590529489, "loss": 5.2893, "mean_token_accuracy": 0.17020780444145203, "num_tokens": 24339935.0, "step": 14030 }, { "entropy": 5.5863566398620605, "epoch": 1.0919665434740322, "grad_norm": 2.140625, "learning_rate": 0.0004884995131668445, "loss": 5.3168, "mean_token_accuracy": 0.17068814039230346, "num_tokens": 24348876.0, "step": 14035 }, { "entropy": 5.534871435165405, "epoch": 1.09235557284575, "grad_norm": 1.3828125, "learning_rate": 0.0004884907640412248, "loss": 5.3285, "mean_token_accuracy": 0.1675461784005165, "num_tokens": 24357094.0, "step": 14040 }, { "entropy": 5.484497451782227, "epoch": 1.0927446022174674, "grad_norm": 1.4296875, "learning_rate": 0.0004884820116762225, "loss": 5.2759, "mean_token_accuracy": 0.1699037507176399, "num_tokens": 24366320.0, "step": 14045 }, { "entropy": 5.483876132965088, "epoch": 1.093133631589185, "grad_norm": 1.4296875, "learning_rate": 0.0004884732560719706, "loss": 5.1662, "mean_token_accuracy": 0.17697618752717972, "num_tokens": 24374390.0, "step": 14050 }, { "entropy": 5.5002411842346195, "epoch": 1.0935226609609026, "grad_norm": 1.359375, "learning_rate": 0.0004884644972286017, "loss": 5.2996, "mean_token_accuracy": 0.17514243274927138, "num_tokens": 24382804.0, "step": 14055 }, { "entropy": 5.550761318206787, "epoch": 1.09391169033262, "grad_norm": 1.453125, "learning_rate": 0.0004884557351462488, "loss": 5.2963, "mean_token_accuracy": 0.17130143493413924, "num_tokens": 24391352.0, "step": 14060 }, { "entropy": 5.5826669216156, "epoch": 1.0943007197043377, "grad_norm": 1.4609375, "learning_rate": 0.0004884469698250449, "loss": 5.3724, "mean_token_accuracy": 0.16699749678373338, "num_tokens": 24400348.0, "step": 14065 }, { "entropy": 5.508634042739868, "epoch": 1.0946897490760552, "grad_norm": 1.6640625, "learning_rate": 0.000488438201265123, "loss": 5.2093, "mean_token_accuracy": 0.1748551085591316, "num_tokens": 24409628.0, "step": 14070 }, { "entropy": 5.560254621505737, "epoch": 1.095078778447773, "grad_norm": 1.4609375, "learning_rate": 0.0004884294294666161, "loss": 5.3047, "mean_token_accuracy": 0.16498639136552812, "num_tokens": 24418379.0, "step": 14075 }, { "entropy": 5.5908811569213865, "epoch": 1.0954678078194904, "grad_norm": 1.4921875, "learning_rate": 0.0004884206544296573, "loss": 5.4404, "mean_token_accuracy": 0.16364881992340088, "num_tokens": 24427719.0, "step": 14080 }, { "entropy": 5.611962556838989, "epoch": 1.0958568371912079, "grad_norm": 1.609375, "learning_rate": 0.0004884118761543797, "loss": 5.3801, "mean_token_accuracy": 0.16736531555652617, "num_tokens": 24435938.0, "step": 14085 }, { "entropy": 5.541747426986694, "epoch": 1.0962458665629256, "grad_norm": 1.765625, "learning_rate": 0.0004884030946409167, "loss": 5.2742, "mean_token_accuracy": 0.17245944291353227, "num_tokens": 24444286.0, "step": 14090 }, { "entropy": 5.480231475830078, "epoch": 1.096634895934643, "grad_norm": 1.4140625, "learning_rate": 0.0004883943098894013, "loss": 5.2212, "mean_token_accuracy": 0.1797743782401085, "num_tokens": 24452546.0, "step": 14095 }, { "entropy": 5.530523443222046, "epoch": 1.0970239253063607, "grad_norm": 1.203125, "learning_rate": 0.000488385521899967, "loss": 5.3538, "mean_token_accuracy": 0.16807045191526412, "num_tokens": 24460765.0, "step": 14100 }, { "entropy": 5.508094596862793, "epoch": 1.0974129546780782, "grad_norm": 1.34375, "learning_rate": 0.000488376730672747, "loss": 5.2161, "mean_token_accuracy": 0.1738041266798973, "num_tokens": 24470018.0, "step": 14105 }, { "entropy": 5.511989879608154, "epoch": 1.0978019840497957, "grad_norm": 1.4921875, "learning_rate": 0.0004883679362078746, "loss": 5.1706, "mean_token_accuracy": 0.17320188879966736, "num_tokens": 24478882.0, "step": 14110 }, { "entropy": 5.533711957931518, "epoch": 1.0981910134215134, "grad_norm": 1.7109375, "learning_rate": 0.0004883591385054836, "loss": 5.3484, "mean_token_accuracy": 0.1637899562716484, "num_tokens": 24487801.0, "step": 14115 }, { "entropy": 5.5117205619812015, "epoch": 1.0985800427932308, "grad_norm": 1.5625, "learning_rate": 0.0004883503375657072, "loss": 5.3151, "mean_token_accuracy": 0.16933534294366837, "num_tokens": 24496082.0, "step": 14120 }, { "entropy": 5.497330617904663, "epoch": 1.0989690721649485, "grad_norm": 1.59375, "learning_rate": 0.0004883415333886789, "loss": 5.2197, "mean_token_accuracy": 0.18041443526744844, "num_tokens": 24504664.0, "step": 14125 }, { "entropy": 5.512371015548706, "epoch": 1.099358101536666, "grad_norm": 1.46875, "learning_rate": 0.0004883327259745325, "loss": 5.2592, "mean_token_accuracy": 0.17645634114742278, "num_tokens": 24512797.0, "step": 14130 }, { "entropy": 5.48935284614563, "epoch": 1.0997471309083835, "grad_norm": 1.578125, "learning_rate": 0.0004883239153234015, "loss": 5.2479, "mean_token_accuracy": 0.1720615178346634, "num_tokens": 24520941.0, "step": 14135 }, { "entropy": 5.573987817764282, "epoch": 1.1001361602801012, "grad_norm": 2.734375, "learning_rate": 0.0004883151014354197, "loss": 5.3462, "mean_token_accuracy": 0.17067505270242692, "num_tokens": 24530087.0, "step": 14140 }, { "entropy": 5.512291717529297, "epoch": 1.1005251896518187, "grad_norm": 1.7890625, "learning_rate": 0.0004883062843107207, "loss": 5.2979, "mean_token_accuracy": 0.16665249168872834, "num_tokens": 24538593.0, "step": 14145 }, { "entropy": 5.629961347579956, "epoch": 1.1009142190235364, "grad_norm": 1.6484375, "learning_rate": 0.0004882974639494383, "loss": 5.3658, "mean_token_accuracy": 0.1617593139410019, "num_tokens": 24547158.0, "step": 14150 }, { "entropy": 5.558168029785156, "epoch": 1.1013032483952538, "grad_norm": 1.9765625, "learning_rate": 0.0004882886403517065, "loss": 5.3639, "mean_token_accuracy": 0.1636526554822922, "num_tokens": 24556266.0, "step": 14155 }, { "entropy": 5.560190868377686, "epoch": 1.1016922777669713, "grad_norm": 1.59375, "learning_rate": 0.0004882798135176589, "loss": 5.4088, "mean_token_accuracy": 0.16728487610816956, "num_tokens": 24565122.0, "step": 14160 }, { "entropy": 5.498580121994019, "epoch": 1.102081307138689, "grad_norm": 1.609375, "learning_rate": 0.00048827098344742973, "loss": 5.2514, "mean_token_accuracy": 0.1830837294459343, "num_tokens": 24573944.0, "step": 14165 }, { "entropy": 5.534769296646118, "epoch": 1.1024703365104065, "grad_norm": 1.9375, "learning_rate": 0.0004882621501411528, "loss": 5.4202, "mean_token_accuracy": 0.16984884440898895, "num_tokens": 24582233.0, "step": 14170 }, { "entropy": 5.539715147018432, "epoch": 1.1028593658821242, "grad_norm": 1.7734375, "learning_rate": 0.0004882533135989622, "loss": 5.2744, "mean_token_accuracy": 0.17063359171152115, "num_tokens": 24590855.0, "step": 14175 }, { "entropy": 5.675771284103393, "epoch": 1.1032483952538417, "grad_norm": 2.171875, "learning_rate": 0.000488244473820992, "loss": 5.3394, "mean_token_accuracy": 0.15959832072257996, "num_tokens": 24599877.0, "step": 14180 }, { "entropy": 5.5097575187683105, "epoch": 1.1036374246255591, "grad_norm": 2.09375, "learning_rate": 0.00048823563080737634, "loss": 5.2142, "mean_token_accuracy": 0.18019939064979554, "num_tokens": 24608450.0, "step": 14185 }, { "entropy": 5.470316219329834, "epoch": 1.1040264539972768, "grad_norm": 1.59375, "learning_rate": 0.0004882267845582493, "loss": 5.3138, "mean_token_accuracy": 0.1766979455947876, "num_tokens": 24618018.0, "step": 14190 }, { "entropy": 5.555082178115844, "epoch": 1.1044154833689943, "grad_norm": 1.6484375, "learning_rate": 0.00048821793507374526, "loss": 5.2955, "mean_token_accuracy": 0.16985682994127274, "num_tokens": 24626388.0, "step": 14195 }, { "entropy": 5.606828451156616, "epoch": 1.104804512740712, "grad_norm": 1.390625, "learning_rate": 0.0004882090823539984, "loss": 5.3944, "mean_token_accuracy": 0.16266640722751619, "num_tokens": 24635284.0, "step": 14200 }, { "entropy": 5.566130876541138, "epoch": 1.1051935421124295, "grad_norm": 1.484375, "learning_rate": 0.0004882002263991431, "loss": 5.2479, "mean_token_accuracy": 0.17859185934066774, "num_tokens": 24644297.0, "step": 14205 }, { "entropy": 5.407494163513183, "epoch": 1.105582571484147, "grad_norm": 1.5234375, "learning_rate": 0.00048819136720931364, "loss": 5.1151, "mean_token_accuracy": 0.17962373048067093, "num_tokens": 24652965.0, "step": 14210 }, { "entropy": 5.3790207862854, "epoch": 1.1059716008558647, "grad_norm": 1.59375, "learning_rate": 0.00048818250478464457, "loss": 5.2001, "mean_token_accuracy": 0.17739752382040025, "num_tokens": 24661034.0, "step": 14215 }, { "entropy": 5.523409461975097, "epoch": 1.1063606302275821, "grad_norm": 1.6875, "learning_rate": 0.0004881736391252703, "loss": 5.2802, "mean_token_accuracy": 0.17606231421232224, "num_tokens": 24669831.0, "step": 14220 }, { "entropy": 5.578432893753051, "epoch": 1.1067496595992998, "grad_norm": 1.5859375, "learning_rate": 0.0004881647702313253, "loss": 5.3555, "mean_token_accuracy": 0.16432537734508515, "num_tokens": 24678491.0, "step": 14225 }, { "entropy": 5.539248991012573, "epoch": 1.1071386889710173, "grad_norm": 1.859375, "learning_rate": 0.00048815589810294427, "loss": 5.293, "mean_token_accuracy": 0.173760125041008, "num_tokens": 24687308.0, "step": 14230 }, { "entropy": 5.497361469268799, "epoch": 1.1075277183427348, "grad_norm": 1.8046875, "learning_rate": 0.00048814702274026174, "loss": 5.2635, "mean_token_accuracy": 0.17785624116659166, "num_tokens": 24696080.0, "step": 14235 }, { "entropy": 5.502005767822266, "epoch": 1.1079167477144525, "grad_norm": 1.46875, "learning_rate": 0.0004881381441434124, "loss": 5.3353, "mean_token_accuracy": 0.1668131798505783, "num_tokens": 24704561.0, "step": 14240 }, { "entropy": 5.609838771820068, "epoch": 1.10830577708617, "grad_norm": 1.5390625, "learning_rate": 0.000488129262312531, "loss": 5.3316, "mean_token_accuracy": 0.16675823777914048, "num_tokens": 24713403.0, "step": 14245 }, { "entropy": 5.606697750091553, "epoch": 1.1086948064578876, "grad_norm": 1.59375, "learning_rate": 0.00048812037724775217, "loss": 5.3491, "mean_token_accuracy": 0.1648279294371605, "num_tokens": 24722031.0, "step": 14250 }, { "entropy": 5.531491279602051, "epoch": 1.1090838358296051, "grad_norm": 1.6875, "learning_rate": 0.0004881114889492109, "loss": 5.2941, "mean_token_accuracy": 0.17142567038536072, "num_tokens": 24731176.0, "step": 14255 }, { "entropy": 5.54642653465271, "epoch": 1.1094728652013226, "grad_norm": 2.03125, "learning_rate": 0.00048810259741704197, "loss": 5.344, "mean_token_accuracy": 0.16734461337327958, "num_tokens": 24740037.0, "step": 14260 }, { "entropy": 5.627961587905884, "epoch": 1.1098618945730403, "grad_norm": 1.5546875, "learning_rate": 0.0004880937026513803, "loss": 5.3994, "mean_token_accuracy": 0.16683503091335297, "num_tokens": 24748778.0, "step": 14265 }, { "entropy": 5.589363050460816, "epoch": 1.1102509239447578, "grad_norm": 1.484375, "learning_rate": 0.0004880848046523609, "loss": 5.2414, "mean_token_accuracy": 0.17778424322605133, "num_tokens": 24757226.0, "step": 14270 }, { "entropy": 5.475401449203491, "epoch": 1.1106399533164755, "grad_norm": 1.8515625, "learning_rate": 0.00048807590342011875, "loss": 5.2835, "mean_token_accuracy": 0.17758438140153884, "num_tokens": 24765734.0, "step": 14275 }, { "entropy": 5.456071424484253, "epoch": 1.111028982688193, "grad_norm": 1.75, "learning_rate": 0.00048806699895478895, "loss": 5.2599, "mean_token_accuracy": 0.1693689614534378, "num_tokens": 24773773.0, "step": 14280 }, { "entropy": 5.522355270385742, "epoch": 1.1114180120599104, "grad_norm": 1.5078125, "learning_rate": 0.0004880580912565065, "loss": 5.29, "mean_token_accuracy": 0.17302699387073517, "num_tokens": 24782563.0, "step": 14285 }, { "entropy": 5.5858558177947994, "epoch": 1.1118070414316281, "grad_norm": 1.671875, "learning_rate": 0.0004880491803254067, "loss": 5.3871, "mean_token_accuracy": 0.16795666962862016, "num_tokens": 24791492.0, "step": 14290 }, { "entropy": 5.493483591079712, "epoch": 1.1121960708033456, "grad_norm": 1.390625, "learning_rate": 0.0004880402661616246, "loss": 5.1918, "mean_token_accuracy": 0.17944994568824768, "num_tokens": 24800229.0, "step": 14295 }, { "entropy": 5.486127138137817, "epoch": 1.1125851001750633, "grad_norm": 1.59375, "learning_rate": 0.0004880313487652956, "loss": 5.2656, "mean_token_accuracy": 0.17114198803901673, "num_tokens": 24809454.0, "step": 14300 }, { "entropy": 5.483691024780273, "epoch": 1.1129741295467808, "grad_norm": 1.6015625, "learning_rate": 0.00048802242813655503, "loss": 5.2698, "mean_token_accuracy": 0.17059182226657868, "num_tokens": 24817956.0, "step": 14305 }, { "entropy": 5.473423290252685, "epoch": 1.1133631589184985, "grad_norm": 1.5546875, "learning_rate": 0.000488013504275538, "loss": 5.1898, "mean_token_accuracy": 0.17933583855628968, "num_tokens": 24826288.0, "step": 14310 }, { "entropy": 5.65793080329895, "epoch": 1.113752188290216, "grad_norm": 1.5859375, "learning_rate": 0.0004880045771823802, "loss": 5.3618, "mean_token_accuracy": 0.16813699007034302, "num_tokens": 24834720.0, "step": 14315 }, { "entropy": 5.522952938079834, "epoch": 1.1141412176619334, "grad_norm": 1.5, "learning_rate": 0.00048799564685721695, "loss": 5.3064, "mean_token_accuracy": 0.17395334541797638, "num_tokens": 24843000.0, "step": 14320 }, { "entropy": 5.525973606109619, "epoch": 1.1145302470336511, "grad_norm": 1.7421875, "learning_rate": 0.0004879867133001837, "loss": 5.3015, "mean_token_accuracy": 0.16755297631025315, "num_tokens": 24851060.0, "step": 14325 }, { "entropy": 5.454747104644776, "epoch": 1.1149192764053686, "grad_norm": 1.75, "learning_rate": 0.0004879777765114162, "loss": 5.2085, "mean_token_accuracy": 0.1771145850419998, "num_tokens": 24859913.0, "step": 14330 }, { "entropy": 5.609213256835938, "epoch": 1.115308305777086, "grad_norm": 1.6171875, "learning_rate": 0.00048796883649104996, "loss": 5.4089, "mean_token_accuracy": 0.16464822739362717, "num_tokens": 24869648.0, "step": 14335 }, { "entropy": 5.571947288513184, "epoch": 1.1156973351488038, "grad_norm": 1.6796875, "learning_rate": 0.0004879598932392206, "loss": 5.3292, "mean_token_accuracy": 0.17350474745035172, "num_tokens": 24878813.0, "step": 14340 }, { "entropy": 5.5525922775268555, "epoch": 1.1160863645205212, "grad_norm": 1.5078125, "learning_rate": 0.00048795094675606364, "loss": 5.3082, "mean_token_accuracy": 0.16897975355386735, "num_tokens": 24887714.0, "step": 14345 }, { "entropy": 5.571045875549316, "epoch": 1.116475393892239, "grad_norm": 1.3984375, "learning_rate": 0.0004879419970417152, "loss": 5.2703, "mean_token_accuracy": 0.172675059735775, "num_tokens": 24895961.0, "step": 14350 }, { "entropy": 5.55090298652649, "epoch": 1.1168644232639564, "grad_norm": 1.375, "learning_rate": 0.00048793304409631077, "loss": 5.301, "mean_token_accuracy": 0.1732762098312378, "num_tokens": 24904873.0, "step": 14355 }, { "entropy": 5.455278730392456, "epoch": 1.117253452635674, "grad_norm": 2.03125, "learning_rate": 0.0004879240879199863, "loss": 5.1985, "mean_token_accuracy": 0.1836355596780777, "num_tokens": 24913486.0, "step": 14360 }, { "entropy": 5.500343942642212, "epoch": 1.1176424820073916, "grad_norm": 1.53125, "learning_rate": 0.00048791512851287786, "loss": 5.2854, "mean_token_accuracy": 0.1700807571411133, "num_tokens": 24921943.0, "step": 14365 }, { "entropy": 5.606582069396973, "epoch": 1.118031511379109, "grad_norm": 1.5625, "learning_rate": 0.00048790616587512107, "loss": 5.3794, "mean_token_accuracy": 0.16794403791427612, "num_tokens": 24930081.0, "step": 14370 }, { "entropy": 5.658608436584473, "epoch": 1.1184205407508268, "grad_norm": 2.0, "learning_rate": 0.0004878972000068521, "loss": 5.3183, "mean_token_accuracy": 0.1709811270236969, "num_tokens": 24938985.0, "step": 14375 }, { "entropy": 5.435786533355713, "epoch": 1.1188095701225442, "grad_norm": 1.4375, "learning_rate": 0.00048788823090820707, "loss": 5.1481, "mean_token_accuracy": 0.18129525780677797, "num_tokens": 24947497.0, "step": 14380 }, { "entropy": 5.550786018371582, "epoch": 1.1191985994942617, "grad_norm": 1.6875, "learning_rate": 0.00048787925857932194, "loss": 5.3791, "mean_token_accuracy": 0.1630413845181465, "num_tokens": 24956263.0, "step": 14385 }, { "entropy": 5.653364372253418, "epoch": 1.1195876288659794, "grad_norm": 1.625, "learning_rate": 0.00048787028302033287, "loss": 5.4578, "mean_token_accuracy": 0.16429930925369263, "num_tokens": 24965646.0, "step": 14390 }, { "entropy": 5.579395961761475, "epoch": 1.1199766582376969, "grad_norm": 1.578125, "learning_rate": 0.00048786130423137606, "loss": 5.3332, "mean_token_accuracy": 0.17410521060228348, "num_tokens": 24973318.0, "step": 14395 }, { "entropy": 5.562328958511353, "epoch": 1.1203656876094146, "grad_norm": 1.46875, "learning_rate": 0.0004878523222125879, "loss": 5.414, "mean_token_accuracy": 0.17157252877950668, "num_tokens": 24982600.0, "step": 14400 }, { "entropy": 5.674773550033569, "epoch": 1.120754716981132, "grad_norm": 1.6015625, "learning_rate": 0.0004878433369641044, "loss": 5.3954, "mean_token_accuracy": 0.16661668866872786, "num_tokens": 24990386.0, "step": 14405 }, { "entropy": 5.459098386764526, "epoch": 1.1211437463528497, "grad_norm": 1.5, "learning_rate": 0.0004878343484860621, "loss": 5.1695, "mean_token_accuracy": 0.17870809882879257, "num_tokens": 24999064.0, "step": 14410 }, { "entropy": 5.5220627784729, "epoch": 1.1215327757245672, "grad_norm": 1.75, "learning_rate": 0.0004878253567785972, "loss": 5.34, "mean_token_accuracy": 0.17166408747434617, "num_tokens": 25008448.0, "step": 14415 }, { "entropy": 5.417818355560303, "epoch": 1.1219218050962847, "grad_norm": 1.5625, "learning_rate": 0.00048781636184184644, "loss": 5.1728, "mean_token_accuracy": 0.18554657995700835, "num_tokens": 25016722.0, "step": 14420 }, { "entropy": 5.433246850967407, "epoch": 1.1223108344680024, "grad_norm": 1.53125, "learning_rate": 0.000487807363675946, "loss": 5.2511, "mean_token_accuracy": 0.17665931433439255, "num_tokens": 25026263.0, "step": 14425 }, { "entropy": 5.568420124053955, "epoch": 1.1226998638397199, "grad_norm": 1.578125, "learning_rate": 0.0004877983622810326, "loss": 5.2876, "mean_token_accuracy": 0.17753019481897353, "num_tokens": 25035202.0, "step": 14430 }, { "entropy": 5.610867261886597, "epoch": 1.1230888932114376, "grad_norm": 1.484375, "learning_rate": 0.0004877893576572427, "loss": 5.3618, "mean_token_accuracy": 0.17109027057886123, "num_tokens": 25044309.0, "step": 14435 }, { "entropy": 5.577419710159302, "epoch": 1.123477922583155, "grad_norm": 1.421875, "learning_rate": 0.000487780349804713, "loss": 5.3391, "mean_token_accuracy": 0.17795383781194687, "num_tokens": 25053044.0, "step": 14440 }, { "entropy": 5.42353835105896, "epoch": 1.1238669519548725, "grad_norm": 1.4609375, "learning_rate": 0.0004877713387235802, "loss": 5.2455, "mean_token_accuracy": 0.17633127123117448, "num_tokens": 25061869.0, "step": 14445 }, { "entropy": 5.548495864868164, "epoch": 1.1242559813265902, "grad_norm": 1.5625, "learning_rate": 0.000487762324413981, "loss": 5.4236, "mean_token_accuracy": 0.1668712839484215, "num_tokens": 25070022.0, "step": 14450 }, { "entropy": 5.605709362030029, "epoch": 1.1246450106983077, "grad_norm": 1.578125, "learning_rate": 0.00048775330687605213, "loss": 5.3215, "mean_token_accuracy": 0.16896626800298692, "num_tokens": 25078604.0, "step": 14455 }, { "entropy": 5.547206926345825, "epoch": 1.1250340400700254, "grad_norm": 1.75, "learning_rate": 0.0004877442861099305, "loss": 5.1993, "mean_token_accuracy": 0.1766393095254898, "num_tokens": 25087256.0, "step": 14460 }, { "entropy": 5.542341804504394, "epoch": 1.1254230694417429, "grad_norm": 1.9140625, "learning_rate": 0.0004877352621157529, "loss": 5.2768, "mean_token_accuracy": 0.17198699563741685, "num_tokens": 25095593.0, "step": 14465 }, { "entropy": 5.560934972763062, "epoch": 1.1258120988134603, "grad_norm": 1.6484375, "learning_rate": 0.00048772623489365635, "loss": 5.3341, "mean_token_accuracy": 0.17415791749954224, "num_tokens": 25104852.0, "step": 14470 }, { "entropy": 5.539960718154907, "epoch": 1.126201128185178, "grad_norm": 1.5859375, "learning_rate": 0.0004877172044437777, "loss": 5.3123, "mean_token_accuracy": 0.17148227542638778, "num_tokens": 25114453.0, "step": 14475 }, { "entropy": 5.502276039123535, "epoch": 1.1265901575568955, "grad_norm": 1.5234375, "learning_rate": 0.00048770817076625416, "loss": 5.3048, "mean_token_accuracy": 0.17388371527194976, "num_tokens": 25123733.0, "step": 14480 }, { "entropy": 5.490148496627808, "epoch": 1.126979186928613, "grad_norm": 1.875, "learning_rate": 0.00048769913386122253, "loss": 5.2261, "mean_token_accuracy": 0.17898911088705063, "num_tokens": 25132572.0, "step": 14485 }, { "entropy": 5.45403938293457, "epoch": 1.1273682163003307, "grad_norm": 1.5546875, "learning_rate": 0.0004876900937288202, "loss": 5.2571, "mean_token_accuracy": 0.17854359596967698, "num_tokens": 25141494.0, "step": 14490 }, { "entropy": 5.433139324188232, "epoch": 1.1277572456720482, "grad_norm": 1.7109375, "learning_rate": 0.00048768105036918426, "loss": 5.2129, "mean_token_accuracy": 0.1757223427295685, "num_tokens": 25150186.0, "step": 14495 }, { "entropy": 5.563412809371949, "epoch": 1.1281462750437659, "grad_norm": 1.6484375, "learning_rate": 0.00048767200378245187, "loss": 5.3077, "mean_token_accuracy": 0.16997037082910538, "num_tokens": 25159251.0, "step": 14500 }, { "entropy": 5.578856515884399, "epoch": 1.1285353044154833, "grad_norm": 1.7109375, "learning_rate": 0.00048766295396876025, "loss": 5.3103, "mean_token_accuracy": 0.17455729991197586, "num_tokens": 25167780.0, "step": 14505 }, { "entropy": 5.528367328643799, "epoch": 1.128924333787201, "grad_norm": 1.71875, "learning_rate": 0.00048765390092824683, "loss": 5.2092, "mean_token_accuracy": 0.18061490654945372, "num_tokens": 25175358.0, "step": 14510 }, { "entropy": 5.4804182052612305, "epoch": 1.1293133631589185, "grad_norm": 1.65625, "learning_rate": 0.000487644844661049, "loss": 5.2571, "mean_token_accuracy": 0.16878363937139512, "num_tokens": 25184247.0, "step": 14515 }, { "entropy": 5.45369668006897, "epoch": 1.129702392530636, "grad_norm": 1.53125, "learning_rate": 0.000487635785167304, "loss": 5.1891, "mean_token_accuracy": 0.1781545549631119, "num_tokens": 25192311.0, "step": 14520 }, { "entropy": 5.438900709152222, "epoch": 1.1300914219023537, "grad_norm": 2.0, "learning_rate": 0.00048762672244714953, "loss": 5.2317, "mean_token_accuracy": 0.1773073673248291, "num_tokens": 25200861.0, "step": 14525 }, { "entropy": 5.553978395462036, "epoch": 1.1304804512740712, "grad_norm": 1.6640625, "learning_rate": 0.0004876176565007229, "loss": 5.3739, "mean_token_accuracy": 0.17362226843833922, "num_tokens": 25208938.0, "step": 14530 }, { "entropy": 5.598419666290283, "epoch": 1.1308694806457888, "grad_norm": 1.5546875, "learning_rate": 0.00048760858732816174, "loss": 5.2705, "mean_token_accuracy": 0.1793088510632515, "num_tokens": 25216997.0, "step": 14535 }, { "entropy": 5.50171012878418, "epoch": 1.1312585100175063, "grad_norm": 1.734375, "learning_rate": 0.0004875995149296037, "loss": 5.1898, "mean_token_accuracy": 0.1773835837841034, "num_tokens": 25225205.0, "step": 14540 }, { "entropy": 5.476949024200439, "epoch": 1.1316475393892238, "grad_norm": 1.4453125, "learning_rate": 0.0004875904393051864, "loss": 5.2522, "mean_token_accuracy": 0.1770787462592125, "num_tokens": 25233807.0, "step": 14545 }, { "entropy": 5.501559400558472, "epoch": 1.1320365687609415, "grad_norm": 1.828125, "learning_rate": 0.0004875813604550476, "loss": 5.2673, "mean_token_accuracy": 0.169118233025074, "num_tokens": 25241715.0, "step": 14550 }, { "entropy": 5.589974689483642, "epoch": 1.132425598132659, "grad_norm": 1.515625, "learning_rate": 0.00048757227837932494, "loss": 5.3951, "mean_token_accuracy": 0.1651352420449257, "num_tokens": 25250418.0, "step": 14555 }, { "entropy": 5.5561353206634525, "epoch": 1.1328146275043767, "grad_norm": 1.578125, "learning_rate": 0.0004875631930781563, "loss": 5.2879, "mean_token_accuracy": 0.1675178065896034, "num_tokens": 25259164.0, "step": 14560 }, { "entropy": 5.5276085376739506, "epoch": 1.1332036568760941, "grad_norm": 1.515625, "learning_rate": 0.00048755410455167967, "loss": 5.3302, "mean_token_accuracy": 0.17142942398786545, "num_tokens": 25267902.0, "step": 14565 }, { "entropy": 5.522876644134522, "epoch": 1.1335926862478116, "grad_norm": 1.6328125, "learning_rate": 0.0004875450128000326, "loss": 5.2757, "mean_token_accuracy": 0.16805899292230606, "num_tokens": 25275991.0, "step": 14570 }, { "entropy": 5.52580041885376, "epoch": 1.1339817156195293, "grad_norm": 2.046875, "learning_rate": 0.0004875359178233534, "loss": 5.2765, "mean_token_accuracy": 0.17196872234344482, "num_tokens": 25284454.0, "step": 14575 }, { "entropy": 5.604035186767578, "epoch": 1.1343707449912468, "grad_norm": 1.4765625, "learning_rate": 0.00048752681962177985, "loss": 5.3838, "mean_token_accuracy": 0.16469692885875703, "num_tokens": 25292867.0, "step": 14580 }, { "entropy": 5.543754291534424, "epoch": 1.1347597743629645, "grad_norm": 1.4140625, "learning_rate": 0.00048751771819545013, "loss": 5.2724, "mean_token_accuracy": 0.1736215054988861, "num_tokens": 25301486.0, "step": 14585 }, { "entropy": 5.497570991516113, "epoch": 1.135148803734682, "grad_norm": 1.5234375, "learning_rate": 0.00048750861354450236, "loss": 5.2591, "mean_token_accuracy": 0.17186922580003738, "num_tokens": 25310800.0, "step": 14590 }, { "entropy": 5.563240098953247, "epoch": 1.1355378331063994, "grad_norm": 1.453125, "learning_rate": 0.0004874995056690746, "loss": 5.3134, "mean_token_accuracy": 0.17563033998012542, "num_tokens": 25319063.0, "step": 14595 }, { "entropy": 5.639831590652466, "epoch": 1.1359268624781171, "grad_norm": 1.5234375, "learning_rate": 0.000487490394569305, "loss": 5.364, "mean_token_accuracy": 0.16975239664316177, "num_tokens": 25327817.0, "step": 14600 }, { "entropy": 5.545086622238159, "epoch": 1.1363158918498346, "grad_norm": 1.6015625, "learning_rate": 0.0004874812802453319, "loss": 5.1958, "mean_token_accuracy": 0.1755492463707924, "num_tokens": 25335753.0, "step": 14605 }, { "entropy": 5.520526933670044, "epoch": 1.1367049212215523, "grad_norm": 1.7421875, "learning_rate": 0.0004874721626972936, "loss": 5.3828, "mean_token_accuracy": 0.1666047140955925, "num_tokens": 25344514.0, "step": 14610 }, { "entropy": 5.554873514175415, "epoch": 1.1370939505932698, "grad_norm": 1.640625, "learning_rate": 0.0004874630419253284, "loss": 5.3061, "mean_token_accuracy": 0.17575568705797195, "num_tokens": 25353003.0, "step": 14615 }, { "entropy": 5.550239753723145, "epoch": 1.1374829799649873, "grad_norm": 1.6015625, "learning_rate": 0.00048745391792957474, "loss": 5.2843, "mean_token_accuracy": 0.1726512610912323, "num_tokens": 25361599.0, "step": 14620 }, { "entropy": 5.561546659469604, "epoch": 1.137872009336705, "grad_norm": 1.53125, "learning_rate": 0.00048744479071017097, "loss": 5.3446, "mean_token_accuracy": 0.1625458464026451, "num_tokens": 25370566.0, "step": 14625 }, { "entropy": 5.575703144073486, "epoch": 1.1382610387084224, "grad_norm": 1.7109375, "learning_rate": 0.0004874356602672556, "loss": 5.3284, "mean_token_accuracy": 0.17115466445684432, "num_tokens": 25379589.0, "step": 14630 }, { "entropy": 5.550799322128296, "epoch": 1.1386500680801401, "grad_norm": 2.265625, "learning_rate": 0.0004874265266009673, "loss": 5.2631, "mean_token_accuracy": 0.17970920950174332, "num_tokens": 25387481.0, "step": 14635 }, { "entropy": 5.496348476409912, "epoch": 1.1390390974518576, "grad_norm": 1.5, "learning_rate": 0.0004874173897114445, "loss": 5.2754, "mean_token_accuracy": 0.1765144497156143, "num_tokens": 25395551.0, "step": 14640 }, { "entropy": 5.548038721084595, "epoch": 1.1394281268235753, "grad_norm": 1.4609375, "learning_rate": 0.00048740824959882603, "loss": 5.3307, "mean_token_accuracy": 0.1669141337275505, "num_tokens": 25404303.0, "step": 14645 }, { "entropy": 5.560009288787842, "epoch": 1.1398171561952928, "grad_norm": 1.9765625, "learning_rate": 0.0004873991062632504, "loss": 5.3259, "mean_token_accuracy": 0.16363555788993836, "num_tokens": 25412749.0, "step": 14650 }, { "entropy": 5.536481618881226, "epoch": 1.1402061855670103, "grad_norm": 1.3984375, "learning_rate": 0.00048738995970485635, "loss": 5.2707, "mean_token_accuracy": 0.17230881601572037, "num_tokens": 25421075.0, "step": 14655 }, { "entropy": 5.568193054199218, "epoch": 1.140595214938728, "grad_norm": 1.671875, "learning_rate": 0.0004873808099237827, "loss": 5.3903, "mean_token_accuracy": 0.16511864215135574, "num_tokens": 25429750.0, "step": 14660 }, { "entropy": 5.561778736114502, "epoch": 1.1409842443104454, "grad_norm": 1.6171875, "learning_rate": 0.0004873716569201684, "loss": 5.2846, "mean_token_accuracy": 0.17441572099924088, "num_tokens": 25437686.0, "step": 14665 }, { "entropy": 5.516694164276123, "epoch": 1.141373273682163, "grad_norm": 1.625, "learning_rate": 0.00048736250069415213, "loss": 5.2944, "mean_token_accuracy": 0.17406139373779297, "num_tokens": 25446050.0, "step": 14670 }, { "entropy": 5.4934525966644285, "epoch": 1.1417623030538806, "grad_norm": 1.65625, "learning_rate": 0.0004873533412458729, "loss": 5.3043, "mean_token_accuracy": 0.1747289478778839, "num_tokens": 25455134.0, "step": 14675 }, { "entropy": 5.469335746765137, "epoch": 1.142151332425598, "grad_norm": 1.875, "learning_rate": 0.00048734417857546986, "loss": 5.1802, "mean_token_accuracy": 0.17695782482624053, "num_tokens": 25463258.0, "step": 14680 }, { "entropy": 5.520489025115967, "epoch": 1.1425403617973158, "grad_norm": 1.65625, "learning_rate": 0.0004873350126830818, "loss": 5.2667, "mean_token_accuracy": 0.1761361226439476, "num_tokens": 25472085.0, "step": 14685 }, { "entropy": 5.560411596298218, "epoch": 1.1429293911690332, "grad_norm": 1.484375, "learning_rate": 0.0004873258435688479, "loss": 5.278, "mean_token_accuracy": 0.17668423801660538, "num_tokens": 25481233.0, "step": 14690 }, { "entropy": 5.53919677734375, "epoch": 1.143318420540751, "grad_norm": 1.453125, "learning_rate": 0.0004873166712329073, "loss": 5.2557, "mean_token_accuracy": 0.18044089078903197, "num_tokens": 25490354.0, "step": 14695 }, { "entropy": 5.53734655380249, "epoch": 1.1437074499124684, "grad_norm": 1.4921875, "learning_rate": 0.00048730749567539914, "loss": 5.3147, "mean_token_accuracy": 0.17236823439598084, "num_tokens": 25498467.0, "step": 14700 }, { "entropy": 5.552510499954224, "epoch": 1.144096479284186, "grad_norm": 1.40625, "learning_rate": 0.00048729831689646257, "loss": 5.3095, "mean_token_accuracy": 0.17018110156059266, "num_tokens": 25507543.0, "step": 14705 }, { "entropy": 5.487798404693604, "epoch": 1.1444855086559036, "grad_norm": 1.5546875, "learning_rate": 0.00048728913489623705, "loss": 5.1964, "mean_token_accuracy": 0.17983233481645583, "num_tokens": 25516070.0, "step": 14710 }, { "entropy": 5.534903049468994, "epoch": 1.144874538027621, "grad_norm": 1.5, "learning_rate": 0.0004872799496748618, "loss": 5.3293, "mean_token_accuracy": 0.17175545543432236, "num_tokens": 25525216.0, "step": 14715 }, { "entropy": 5.579160737991333, "epoch": 1.1452635673993385, "grad_norm": 1.5546875, "learning_rate": 0.0004872707612324761, "loss": 5.3436, "mean_token_accuracy": 0.1700536385178566, "num_tokens": 25533822.0, "step": 14720 }, { "entropy": 5.660882616043091, "epoch": 1.1456525967710562, "grad_norm": 1.5625, "learning_rate": 0.0004872615695692196, "loss": 5.3753, "mean_token_accuracy": 0.16802987456321716, "num_tokens": 25541580.0, "step": 14725 }, { "entropy": 5.484453248977661, "epoch": 1.1460416261427737, "grad_norm": 1.4609375, "learning_rate": 0.0004872523746852315, "loss": 5.1773, "mean_token_accuracy": 0.18269246816635132, "num_tokens": 25549860.0, "step": 14730 }, { "entropy": 5.52522029876709, "epoch": 1.1464306555144914, "grad_norm": 1.4609375, "learning_rate": 0.00048724317658065146, "loss": 5.3442, "mean_token_accuracy": 0.16894873529672622, "num_tokens": 25559060.0, "step": 14735 }, { "entropy": 5.63541898727417, "epoch": 1.146819684886209, "grad_norm": 1.4765625, "learning_rate": 0.00048723397525561916, "loss": 5.3874, "mean_token_accuracy": 0.16443771123886108, "num_tokens": 25567769.0, "step": 14740 }, { "entropy": 5.571277809143067, "epoch": 1.1472087142579266, "grad_norm": 1.8515625, "learning_rate": 0.00048722477071027394, "loss": 5.3654, "mean_token_accuracy": 0.1711871936917305, "num_tokens": 25577443.0, "step": 14745 }, { "entropy": 5.569605827331543, "epoch": 1.147597743629644, "grad_norm": 1.4609375, "learning_rate": 0.00048721556294475574, "loss": 5.2731, "mean_token_accuracy": 0.18160714358091354, "num_tokens": 25586283.0, "step": 14750 }, { "entropy": 5.551212406158447, "epoch": 1.1479867730013615, "grad_norm": 1.5390625, "learning_rate": 0.00048720635195920403, "loss": 5.3753, "mean_token_accuracy": 0.17017149925231934, "num_tokens": 25594881.0, "step": 14755 }, { "entropy": 5.50782527923584, "epoch": 1.1483758023730792, "grad_norm": 1.8984375, "learning_rate": 0.0004871971377537588, "loss": 5.2436, "mean_token_accuracy": 0.1762669488787651, "num_tokens": 25603738.0, "step": 14760 }, { "entropy": 5.583714962005615, "epoch": 1.1487648317447967, "grad_norm": 2.15625, "learning_rate": 0.0004871879203285597, "loss": 5.298, "mean_token_accuracy": 0.17087433785200118, "num_tokens": 25611780.0, "step": 14765 }, { "entropy": 5.606764793395996, "epoch": 1.1491538611165142, "grad_norm": 1.7421875, "learning_rate": 0.00048717869968374655, "loss": 5.3617, "mean_token_accuracy": 0.17412520051002503, "num_tokens": 25620489.0, "step": 14770 }, { "entropy": 5.522389936447143, "epoch": 1.1495428904882319, "grad_norm": 1.65625, "learning_rate": 0.00048716947581945954, "loss": 5.3226, "mean_token_accuracy": 0.1770711585879326, "num_tokens": 25629113.0, "step": 14775 }, { "entropy": 5.464048576354981, "epoch": 1.1499319198599494, "grad_norm": 1.7265625, "learning_rate": 0.0004871602487358383, "loss": 5.2657, "mean_token_accuracy": 0.1724536433815956, "num_tokens": 25637313.0, "step": 14780 }, { "entropy": 5.5214461326599125, "epoch": 1.150320949231667, "grad_norm": 1.5859375, "learning_rate": 0.000487151018433023, "loss": 5.3576, "mean_token_accuracy": 0.16645698100328446, "num_tokens": 25646522.0, "step": 14785 }, { "entropy": 5.5282148838043215, "epoch": 1.1507099786033845, "grad_norm": 1.515625, "learning_rate": 0.00048714178491115367, "loss": 5.2638, "mean_token_accuracy": 0.17899245619773865, "num_tokens": 25656058.0, "step": 14790 }, { "entropy": 5.586183786392212, "epoch": 1.1510990079751022, "grad_norm": 1.640625, "learning_rate": 0.00048713254817037046, "loss": 5.3711, "mean_token_accuracy": 0.17049205154180527, "num_tokens": 25665072.0, "step": 14795 }, { "entropy": 5.607844257354737, "epoch": 1.1514880373468197, "grad_norm": 1.546875, "learning_rate": 0.0004871233082108135, "loss": 5.4, "mean_token_accuracy": 0.1711244061589241, "num_tokens": 25673877.0, "step": 14800 }, { "entropy": 5.582855701446533, "epoch": 1.1518770667185372, "grad_norm": 1.5, "learning_rate": 0.0004871140650326228, "loss": 5.2596, "mean_token_accuracy": 0.16818197667598725, "num_tokens": 25683238.0, "step": 14805 }, { "entropy": 5.579865217208862, "epoch": 1.1522660960902549, "grad_norm": 1.5234375, "learning_rate": 0.0004871048186359389, "loss": 5.3595, "mean_token_accuracy": 0.16232425570487977, "num_tokens": 25692654.0, "step": 14810 }, { "entropy": 5.650218391418457, "epoch": 1.1526551254619724, "grad_norm": 1.890625, "learning_rate": 0.000487095569020902, "loss": 5.3455, "mean_token_accuracy": 0.16748398393392563, "num_tokens": 25701681.0, "step": 14815 }, { "entropy": 5.566237306594848, "epoch": 1.1530441548336898, "grad_norm": 1.6015625, "learning_rate": 0.0004870863161876524, "loss": 5.26, "mean_token_accuracy": 0.17767535746097565, "num_tokens": 25709848.0, "step": 14820 }, { "entropy": 5.603987169265747, "epoch": 1.1534331842054075, "grad_norm": 1.59375, "learning_rate": 0.0004870770601363305, "loss": 5.4981, "mean_token_accuracy": 0.16868632584810256, "num_tokens": 25717993.0, "step": 14825 }, { "entropy": 5.587001705169678, "epoch": 1.153822213577125, "grad_norm": 1.578125, "learning_rate": 0.00048706780086707675, "loss": 5.3808, "mean_token_accuracy": 0.16602419465780258, "num_tokens": 25726379.0, "step": 14830 }, { "entropy": 5.568260240554809, "epoch": 1.1542112429488427, "grad_norm": 1.5390625, "learning_rate": 0.0004870585383800317, "loss": 5.2919, "mean_token_accuracy": 0.1783009275794029, "num_tokens": 25734968.0, "step": 14835 }, { "entropy": 5.586294174194336, "epoch": 1.1546002723205602, "grad_norm": 1.6953125, "learning_rate": 0.00048704927267533585, "loss": 5.3333, "mean_token_accuracy": 0.1721921294927597, "num_tokens": 25743315.0, "step": 14840 }, { "entropy": 5.529369783401489, "epoch": 1.1549893016922779, "grad_norm": 1.7421875, "learning_rate": 0.00048704000375312975, "loss": 5.2378, "mean_token_accuracy": 0.17137032002210617, "num_tokens": 25752396.0, "step": 14845 }, { "entropy": 5.614004516601563, "epoch": 1.1553783310639953, "grad_norm": 1.65625, "learning_rate": 0.00048703073161355414, "loss": 5.3635, "mean_token_accuracy": 0.1709185004234314, "num_tokens": 25761142.0, "step": 14850 }, { "entropy": 5.493571329116821, "epoch": 1.1557673604357128, "grad_norm": 1.4921875, "learning_rate": 0.0004870214562567497, "loss": 5.24, "mean_token_accuracy": 0.17272724956274033, "num_tokens": 25769514.0, "step": 14855 }, { "entropy": 5.521751976013183, "epoch": 1.1561563898074305, "grad_norm": 1.5, "learning_rate": 0.000487012177682857, "loss": 5.2379, "mean_token_accuracy": 0.17054518312215805, "num_tokens": 25777408.0, "step": 14860 }, { "entropy": 5.4967021465301515, "epoch": 1.156545419179148, "grad_norm": 1.46875, "learning_rate": 0.0004870028958920171, "loss": 5.259, "mean_token_accuracy": 0.1768237456679344, "num_tokens": 25785646.0, "step": 14865 }, { "entropy": 5.544138431549072, "epoch": 1.1569344485508655, "grad_norm": 1.6875, "learning_rate": 0.0004869936108843706, "loss": 5.3095, "mean_token_accuracy": 0.17224012017250062, "num_tokens": 25794007.0, "step": 14870 }, { "entropy": 5.52902307510376, "epoch": 1.1573234779225832, "grad_norm": 1.6015625, "learning_rate": 0.00048698432266005854, "loss": 5.2489, "mean_token_accuracy": 0.17344386130571365, "num_tokens": 25802765.0, "step": 14875 }, { "entropy": 5.590705871582031, "epoch": 1.1577125072943006, "grad_norm": 1.53125, "learning_rate": 0.0004869750312192217, "loss": 5.3886, "mean_token_accuracy": 0.16790701746940612, "num_tokens": 25811214.0, "step": 14880 }, { "entropy": 5.591983604431152, "epoch": 1.1581015366660183, "grad_norm": 1.671875, "learning_rate": 0.00048696573656200123, "loss": 5.3748, "mean_token_accuracy": 0.16566506028175354, "num_tokens": 25820350.0, "step": 14885 }, { "entropy": 5.553336143493652, "epoch": 1.1584905660377358, "grad_norm": 1.8671875, "learning_rate": 0.00048695643868853806, "loss": 5.2935, "mean_token_accuracy": 0.18036726415157317, "num_tokens": 25828088.0, "step": 14890 }, { "entropy": 5.5192883014678955, "epoch": 1.1588795954094535, "grad_norm": 1.984375, "learning_rate": 0.0004869471375989733, "loss": 5.1599, "mean_token_accuracy": 0.181265027821064, "num_tokens": 25835909.0, "step": 14895 }, { "entropy": 5.452424430847168, "epoch": 1.159268624781171, "grad_norm": 1.8828125, "learning_rate": 0.0004869378332934481, "loss": 5.2502, "mean_token_accuracy": 0.17498199492692948, "num_tokens": 25844360.0, "step": 14900 }, { "entropy": 5.651251745223999, "epoch": 1.1596576541528885, "grad_norm": 1.4140625, "learning_rate": 0.00048692852577210356, "loss": 5.3665, "mean_token_accuracy": 0.16494977325201035, "num_tokens": 25853877.0, "step": 14905 }, { "entropy": 5.559357833862305, "epoch": 1.1600466835246062, "grad_norm": 1.484375, "learning_rate": 0.000486919215035081, "loss": 5.2664, "mean_token_accuracy": 0.175713013112545, "num_tokens": 25862200.0, "step": 14910 }, { "entropy": 5.501112365722657, "epoch": 1.1604357128963236, "grad_norm": 1.890625, "learning_rate": 0.0004869099010825217, "loss": 5.2218, "mean_token_accuracy": 0.17241571992635726, "num_tokens": 25871112.0, "step": 14915 }, { "entropy": 5.54647421836853, "epoch": 1.1608247422680413, "grad_norm": 2.09375, "learning_rate": 0.00048690058391456684, "loss": 5.3928, "mean_token_accuracy": 0.1711567685008049, "num_tokens": 25880135.0, "step": 14920 }, { "entropy": 5.55512957572937, "epoch": 1.1612137716397588, "grad_norm": 1.90625, "learning_rate": 0.0004868912635313579, "loss": 5.2908, "mean_token_accuracy": 0.17410618662834168, "num_tokens": 25888609.0, "step": 14925 }, { "entropy": 5.525064182281494, "epoch": 1.1616028010114763, "grad_norm": 1.7578125, "learning_rate": 0.0004868819399330364, "loss": 5.3393, "mean_token_accuracy": 0.16897253096103668, "num_tokens": 25897254.0, "step": 14930 }, { "entropy": 5.549260139465332, "epoch": 1.161991830383194, "grad_norm": 1.5, "learning_rate": 0.0004868726131197436, "loss": 5.2525, "mean_token_accuracy": 0.18024791330099105, "num_tokens": 25905705.0, "step": 14935 }, { "entropy": 5.559958553314209, "epoch": 1.1623808597549115, "grad_norm": 1.59375, "learning_rate": 0.0004868632830916212, "loss": 5.3027, "mean_token_accuracy": 0.17200768291950225, "num_tokens": 25914066.0, "step": 14940 }, { "entropy": 5.540140581130982, "epoch": 1.1627698891266292, "grad_norm": 1.5234375, "learning_rate": 0.0004868539498488106, "loss": 5.3123, "mean_token_accuracy": 0.17349241077899932, "num_tokens": 25922949.0, "step": 14945 }, { "entropy": 5.418867826461792, "epoch": 1.1631589184983466, "grad_norm": 1.5, "learning_rate": 0.0004868446133914536, "loss": 5.1618, "mean_token_accuracy": 0.1807738795876503, "num_tokens": 25931465.0, "step": 14950 }, { "entropy": 5.532193613052368, "epoch": 1.163547947870064, "grad_norm": 2.59375, "learning_rate": 0.00048683527371969185, "loss": 5.3353, "mean_token_accuracy": 0.16627979129552842, "num_tokens": 25941014.0, "step": 14955 }, { "entropy": 5.4955915927886965, "epoch": 1.1639369772417818, "grad_norm": 1.65625, "learning_rate": 0.00048682593083366685, "loss": 5.1995, "mean_token_accuracy": 0.17250516265630722, "num_tokens": 25950275.0, "step": 14960 }, { "entropy": 5.443646240234375, "epoch": 1.1643260066134993, "grad_norm": 1.7890625, "learning_rate": 0.00048681658473352055, "loss": 5.3219, "mean_token_accuracy": 0.16984528303146362, "num_tokens": 25959138.0, "step": 14965 }, { "entropy": 5.578936243057251, "epoch": 1.164715035985217, "grad_norm": 1.7578125, "learning_rate": 0.0004868072354193947, "loss": 5.2048, "mean_token_accuracy": 0.17416904121637344, "num_tokens": 25967221.0, "step": 14970 }, { "entropy": 5.571450471878052, "epoch": 1.1651040653569344, "grad_norm": 1.703125, "learning_rate": 0.0004867978828914312, "loss": 5.3198, "mean_token_accuracy": 0.1704607143998146, "num_tokens": 25976194.0, "step": 14975 }, { "entropy": 5.500711488723755, "epoch": 1.165493094728652, "grad_norm": 1.6171875, "learning_rate": 0.0004867885271497719, "loss": 5.286, "mean_token_accuracy": 0.17450777888298036, "num_tokens": 25985493.0, "step": 14980 }, { "entropy": 5.583955335617065, "epoch": 1.1658821241003696, "grad_norm": 1.6328125, "learning_rate": 0.0004867791681945588, "loss": 5.2399, "mean_token_accuracy": 0.17097237408161164, "num_tokens": 25994213.0, "step": 14985 }, { "entropy": 5.493848705291748, "epoch": 1.166271153472087, "grad_norm": 1.546875, "learning_rate": 0.00048676980602593395, "loss": 5.2218, "mean_token_accuracy": 0.1793581262230873, "num_tokens": 26003164.0, "step": 14990 }, { "entropy": 5.572969436645508, "epoch": 1.1666601828438048, "grad_norm": 1.6015625, "learning_rate": 0.00048676044064403936, "loss": 5.3306, "mean_token_accuracy": 0.17016486078500748, "num_tokens": 26012049.0, "step": 14995 }, { "entropy": 5.645019149780273, "epoch": 1.1670492122155223, "grad_norm": 2.390625, "learning_rate": 0.0004867510720490171, "loss": 5.4245, "mean_token_accuracy": 0.16362651586532592, "num_tokens": 26020466.0, "step": 15000 }, { "epoch": 1.1670492122155223, "eval_entropy": 5.440363345178305, "eval_loss": 5.406432151794434, "eval_mean_token_accuracy": 0.17719353199062493, "eval_num_tokens": 26020466.0, "eval_runtime": 28.5321, "eval_samples_per_second": 1456.537, "eval_steps_per_second": 182.076, "step": 15000 }, { "entropy": 5.528584003448486, "epoch": 1.1674382415872397, "grad_norm": 1.7578125, "learning_rate": 0.0004867417002410094, "loss": 5.2198, "mean_token_accuracy": 0.17334816604852676, "num_tokens": 26028815.0, "step": 15005 }, { "entropy": 5.58254861831665, "epoch": 1.1678272709589574, "grad_norm": 1.59375, "learning_rate": 0.00048673232522015845, "loss": 5.4157, "mean_token_accuracy": 0.16548077017068863, "num_tokens": 26037759.0, "step": 15010 }, { "entropy": 5.569189119338989, "epoch": 1.168216300330675, "grad_norm": 1.390625, "learning_rate": 0.0004867229469866064, "loss": 5.3363, "mean_token_accuracy": 0.16419618874788283, "num_tokens": 26046349.0, "step": 15015 }, { "entropy": 5.553538084030151, "epoch": 1.1686053297023926, "grad_norm": 2.953125, "learning_rate": 0.0004867135655404956, "loss": 5.3218, "mean_token_accuracy": 0.17581884264945985, "num_tokens": 26055265.0, "step": 15020 }, { "entropy": 5.570549488067627, "epoch": 1.16899435907411, "grad_norm": 1.8671875, "learning_rate": 0.00048670418088196844, "loss": 5.3144, "mean_token_accuracy": 0.17261690348386766, "num_tokens": 26064335.0, "step": 15025 }, { "entropy": 5.560314559936524, "epoch": 1.1693833884458276, "grad_norm": 1.6484375, "learning_rate": 0.0004866947930111674, "loss": 5.2445, "mean_token_accuracy": 0.1767016112804413, "num_tokens": 26073044.0, "step": 15030 }, { "entropy": 5.531310939788819, "epoch": 1.1697724178175453, "grad_norm": 1.6640625, "learning_rate": 0.00048668540192823467, "loss": 5.2614, "mean_token_accuracy": 0.17961026281118392, "num_tokens": 26081361.0, "step": 15035 }, { "entropy": 5.520599699020385, "epoch": 1.1701614471892627, "grad_norm": 1.7578125, "learning_rate": 0.000486676007633313, "loss": 5.2636, "mean_token_accuracy": 0.17193735688924788, "num_tokens": 26089740.0, "step": 15040 }, { "entropy": 5.579999923706055, "epoch": 1.1705504765609804, "grad_norm": 2.046875, "learning_rate": 0.0004866666101265448, "loss": 5.3566, "mean_token_accuracy": 0.17004507035017014, "num_tokens": 26098906.0, "step": 15045 }, { "entropy": 5.565162658691406, "epoch": 1.170939505932698, "grad_norm": 1.3046875, "learning_rate": 0.00048665720940807274, "loss": 5.3229, "mean_token_accuracy": 0.16735642552375793, "num_tokens": 26107978.0, "step": 15050 }, { "entropy": 5.539587879180909, "epoch": 1.1713285353044154, "grad_norm": 1.46875, "learning_rate": 0.00048664780547803935, "loss": 5.2691, "mean_token_accuracy": 0.16775070279836654, "num_tokens": 26116756.0, "step": 15055 }, { "entropy": 5.625945043563843, "epoch": 1.171717564676133, "grad_norm": 1.609375, "learning_rate": 0.0004866383983365873, "loss": 5.3314, "mean_token_accuracy": 0.16616996079683305, "num_tokens": 26125078.0, "step": 15060 }, { "entropy": 5.590082883834839, "epoch": 1.1721065940478506, "grad_norm": 1.6796875, "learning_rate": 0.00048662898798385956, "loss": 5.3755, "mean_token_accuracy": 0.16891691833734512, "num_tokens": 26134149.0, "step": 15065 }, { "entropy": 5.55862078666687, "epoch": 1.1724956234195683, "grad_norm": 1.734375, "learning_rate": 0.00048661957441999875, "loss": 5.2231, "mean_token_accuracy": 0.17921175807714462, "num_tokens": 26142789.0, "step": 15070 }, { "entropy": 5.540366888046265, "epoch": 1.1728846527912857, "grad_norm": 2.34375, "learning_rate": 0.00048661015764514765, "loss": 5.3997, "mean_token_accuracy": 0.16913245618343353, "num_tokens": 26151189.0, "step": 15075 }, { "entropy": 5.532864904403686, "epoch": 1.1732736821630034, "grad_norm": 1.5546875, "learning_rate": 0.00048660073765944927, "loss": 5.2869, "mean_token_accuracy": 0.1758386954665184, "num_tokens": 26159495.0, "step": 15080 }, { "entropy": 5.489394569396973, "epoch": 1.173662711534721, "grad_norm": 1.7109375, "learning_rate": 0.0004865913144630465, "loss": 5.2141, "mean_token_accuracy": 0.17278929948806762, "num_tokens": 26167804.0, "step": 15085 }, { "entropy": 5.528975915908814, "epoch": 1.1740517409064384, "grad_norm": 1.515625, "learning_rate": 0.00048658188805608227, "loss": 5.2723, "mean_token_accuracy": 0.17362222373485564, "num_tokens": 26176240.0, "step": 15090 }, { "entropy": 5.5410560131072994, "epoch": 1.174440770278156, "grad_norm": 1.5859375, "learning_rate": 0.0004865724584386998, "loss": 5.2688, "mean_token_accuracy": 0.1735546037554741, "num_tokens": 26184580.0, "step": 15095 }, { "entropy": 5.5709363460540775, "epoch": 1.1748297996498736, "grad_norm": 2.03125, "learning_rate": 0.0004865630256110418, "loss": 5.3421, "mean_token_accuracy": 0.17168836742639543, "num_tokens": 26193756.0, "step": 15100 }, { "entropy": 5.613444709777832, "epoch": 1.175218829021591, "grad_norm": 1.6171875, "learning_rate": 0.00048655358957325174, "loss": 5.3278, "mean_token_accuracy": 0.17838720381259918, "num_tokens": 26201818.0, "step": 15105 }, { "entropy": 5.6102183818817135, "epoch": 1.1756078583933087, "grad_norm": 1.703125, "learning_rate": 0.00048654415032547277, "loss": 5.3963, "mean_token_accuracy": 0.15847362875938414, "num_tokens": 26211817.0, "step": 15110 }, { "entropy": 5.541627645492554, "epoch": 1.1759968877650262, "grad_norm": 1.4140625, "learning_rate": 0.00048653470786784794, "loss": 5.2459, "mean_token_accuracy": 0.1706738367676735, "num_tokens": 26220280.0, "step": 15115 }, { "entropy": 5.454172658920288, "epoch": 1.176385917136744, "grad_norm": 1.6171875, "learning_rate": 0.0004865252622005206, "loss": 5.2304, "mean_token_accuracy": 0.18413861244916915, "num_tokens": 26228719.0, "step": 15120 }, { "entropy": 5.595516157150269, "epoch": 1.1767749465084614, "grad_norm": 1.734375, "learning_rate": 0.00048651581332363405, "loss": 5.307, "mean_token_accuracy": 0.1710882231593132, "num_tokens": 26237462.0, "step": 15125 }, { "entropy": 5.616157579421997, "epoch": 1.177163975880179, "grad_norm": 1.546875, "learning_rate": 0.00048650636123733176, "loss": 5.4087, "mean_token_accuracy": 0.17296858727931977, "num_tokens": 26245747.0, "step": 15130 }, { "entropy": 5.611859369277954, "epoch": 1.1775530052518965, "grad_norm": 1.5546875, "learning_rate": 0.0004864969059417571, "loss": 5.2976, "mean_token_accuracy": 0.1728380501270294, "num_tokens": 26254977.0, "step": 15135 }, { "entropy": 5.596359348297119, "epoch": 1.177942034623614, "grad_norm": 1.7578125, "learning_rate": 0.0004864874474370534, "loss": 5.4187, "mean_token_accuracy": 0.1656192198395729, "num_tokens": 26264298.0, "step": 15140 }, { "entropy": 5.561619901657105, "epoch": 1.1783310639953317, "grad_norm": 1.8203125, "learning_rate": 0.00048647798572336445, "loss": 5.2331, "mean_token_accuracy": 0.17204071581363678, "num_tokens": 26273454.0, "step": 15145 }, { "entropy": 5.590262460708618, "epoch": 1.1787200933670492, "grad_norm": 1.609375, "learning_rate": 0.00048646852080083355, "loss": 5.3009, "mean_token_accuracy": 0.17017791122198106, "num_tokens": 26282584.0, "step": 15150 }, { "entropy": 5.549900007247925, "epoch": 1.1791091227387667, "grad_norm": 1.4609375, "learning_rate": 0.0004864590526696045, "loss": 5.3298, "mean_token_accuracy": 0.17289702147245406, "num_tokens": 26291633.0, "step": 15155 }, { "entropy": 5.594415664672852, "epoch": 1.1794981521104844, "grad_norm": 1.421875, "learning_rate": 0.00048644958132982094, "loss": 5.3577, "mean_token_accuracy": 0.1653517961502075, "num_tokens": 26300808.0, "step": 15160 }, { "entropy": 5.53204312324524, "epoch": 1.1798871814822018, "grad_norm": 1.5078125, "learning_rate": 0.00048644010678162644, "loss": 5.2577, "mean_token_accuracy": 0.18163457065820693, "num_tokens": 26308976.0, "step": 15165 }, { "entropy": 5.523904848098755, "epoch": 1.1802762108539195, "grad_norm": 1.6640625, "learning_rate": 0.0004864306290251649, "loss": 5.3142, "mean_token_accuracy": 0.16775508150458335, "num_tokens": 26316980.0, "step": 15170 }, { "entropy": 5.5156854629516605, "epoch": 1.180665240225637, "grad_norm": 1.6796875, "learning_rate": 0.00048642114806058014, "loss": 5.2201, "mean_token_accuracy": 0.17746393233537675, "num_tokens": 26325723.0, "step": 15175 }, { "entropy": 5.567081308364868, "epoch": 1.1810542695973547, "grad_norm": 1.6796875, "learning_rate": 0.0004864116638880159, "loss": 5.3091, "mean_token_accuracy": 0.17228560298681259, "num_tokens": 26334851.0, "step": 15180 }, { "entropy": 5.567082262039184, "epoch": 1.1814432989690722, "grad_norm": 1.984375, "learning_rate": 0.0004864021765076162, "loss": 5.3196, "mean_token_accuracy": 0.16638908982276918, "num_tokens": 26343696.0, "step": 15185 }, { "entropy": 5.6168395519256595, "epoch": 1.1818323283407897, "grad_norm": 1.6328125, "learning_rate": 0.00048639268591952494, "loss": 5.4422, "mean_token_accuracy": 0.1645281657576561, "num_tokens": 26353054.0, "step": 15190 }, { "entropy": 5.564056015014648, "epoch": 1.1822213577125074, "grad_norm": 1.828125, "learning_rate": 0.00048638319212388614, "loss": 5.2647, "mean_token_accuracy": 0.1795717552304268, "num_tokens": 26361484.0, "step": 15195 }, { "entropy": 5.545347452163696, "epoch": 1.1826103870842248, "grad_norm": 1.7734375, "learning_rate": 0.0004863736951208438, "loss": 5.3686, "mean_token_accuracy": 0.16862039715051652, "num_tokens": 26370402.0, "step": 15200 }, { "entropy": 5.559129047393799, "epoch": 1.1829994164559423, "grad_norm": 1.5703125, "learning_rate": 0.00048636419491054217, "loss": 5.3974, "mean_token_accuracy": 0.16546053439378738, "num_tokens": 26378746.0, "step": 15205 }, { "entropy": 5.515748929977417, "epoch": 1.18338844582766, "grad_norm": 1.421875, "learning_rate": 0.0004863546914931252, "loss": 5.2852, "mean_token_accuracy": 0.1783539429306984, "num_tokens": 26386984.0, "step": 15210 }, { "entropy": 5.635797166824341, "epoch": 1.1837774751993775, "grad_norm": 1.6875, "learning_rate": 0.0004863451848687373, "loss": 5.4063, "mean_token_accuracy": 0.1640034019947052, "num_tokens": 26395712.0, "step": 15215 }, { "entropy": 5.6407819271087645, "epoch": 1.1841665045710952, "grad_norm": 4.65625, "learning_rate": 0.00048633567503752253, "loss": 5.337, "mean_token_accuracy": 0.169952854514122, "num_tokens": 26406421.0, "step": 15220 }, { "entropy": 5.655284357070923, "epoch": 1.1845555339428127, "grad_norm": 1.7578125, "learning_rate": 0.0004863261619996253, "loss": 5.2957, "mean_token_accuracy": 0.1705295443534851, "num_tokens": 26416032.0, "step": 15225 }, { "entropy": 5.508386564254761, "epoch": 1.1849445633145304, "grad_norm": 1.5390625, "learning_rate": 0.0004863166457551899, "loss": 5.2573, "mean_token_accuracy": 0.17223215699195862, "num_tokens": 26423903.0, "step": 15230 }, { "entropy": 5.558989000320435, "epoch": 1.1853335926862478, "grad_norm": 1.46875, "learning_rate": 0.0004863071263043608, "loss": 5.3597, "mean_token_accuracy": 0.16596672236919402, "num_tokens": 26432631.0, "step": 15235 }, { "entropy": 5.5874451160430905, "epoch": 1.1857226220579653, "grad_norm": 1.4921875, "learning_rate": 0.0004862976036472823, "loss": 5.3508, "mean_token_accuracy": 0.167239710688591, "num_tokens": 26441529.0, "step": 15240 }, { "entropy": 5.567822599411011, "epoch": 1.186111651429683, "grad_norm": 1.4921875, "learning_rate": 0.00048628807778409907, "loss": 5.2432, "mean_token_accuracy": 0.17956746220588685, "num_tokens": 26449928.0, "step": 15245 }, { "entropy": 5.555808877944946, "epoch": 1.1865006808014005, "grad_norm": 1.484375, "learning_rate": 0.0004862785487149555, "loss": 5.2176, "mean_token_accuracy": 0.18223925828933715, "num_tokens": 26458065.0, "step": 15250 }, { "entropy": 5.48214635848999, "epoch": 1.186889710173118, "grad_norm": 1.4140625, "learning_rate": 0.0004862690164399963, "loss": 5.2736, "mean_token_accuracy": 0.1731280580163002, "num_tokens": 26466690.0, "step": 15255 }, { "entropy": 5.499134683609009, "epoch": 1.1872787395448356, "grad_norm": 1.65625, "learning_rate": 0.00048625948095936593, "loss": 5.3272, "mean_token_accuracy": 0.168271504342556, "num_tokens": 26476133.0, "step": 15260 }, { "entropy": 5.602310085296631, "epoch": 1.1876677689165531, "grad_norm": 1.453125, "learning_rate": 0.00048624994227320923, "loss": 5.2873, "mean_token_accuracy": 0.170215705037117, "num_tokens": 26485151.0, "step": 15265 }, { "entropy": 5.532072067260742, "epoch": 1.1880567982882708, "grad_norm": 1.9296875, "learning_rate": 0.00048624040038167094, "loss": 5.3355, "mean_token_accuracy": 0.16652823984622955, "num_tokens": 26494178.0, "step": 15270 }, { "entropy": 5.596423387527466, "epoch": 1.1884458276599883, "grad_norm": 1.6015625, "learning_rate": 0.00048623085528489584, "loss": 5.3324, "mean_token_accuracy": 0.1781013563275337, "num_tokens": 26503233.0, "step": 15275 }, { "entropy": 5.4985284328460695, "epoch": 1.188834857031706, "grad_norm": 1.6171875, "learning_rate": 0.00048622130698302863, "loss": 5.1961, "mean_token_accuracy": 0.17551186680793762, "num_tokens": 26512127.0, "step": 15280 }, { "entropy": 5.467780923843383, "epoch": 1.1892238864034235, "grad_norm": 1.59375, "learning_rate": 0.00048621175547621426, "loss": 5.1811, "mean_token_accuracy": 0.18775192201137542, "num_tokens": 26520239.0, "step": 15285 }, { "entropy": 5.492806911468506, "epoch": 1.189612915775141, "grad_norm": 1.5, "learning_rate": 0.0004862022007645978, "loss": 5.316, "mean_token_accuracy": 0.17370967119932174, "num_tokens": 26528946.0, "step": 15290 }, { "entropy": 5.596633815765381, "epoch": 1.1900019451468586, "grad_norm": 1.5625, "learning_rate": 0.00048619264284832403, "loss": 5.3054, "mean_token_accuracy": 0.17137685269117356, "num_tokens": 26536825.0, "step": 15295 }, { "entropy": 5.495219326019287, "epoch": 1.1903909745185761, "grad_norm": 1.5546875, "learning_rate": 0.00048618308172753804, "loss": 5.2638, "mean_token_accuracy": 0.1775554046034813, "num_tokens": 26545208.0, "step": 15300 }, { "entropy": 5.516074848175049, "epoch": 1.1907800038902936, "grad_norm": 1.5546875, "learning_rate": 0.0004861735174023849, "loss": 5.2621, "mean_token_accuracy": 0.1717539519071579, "num_tokens": 26553768.0, "step": 15305 }, { "entropy": 5.538155031204224, "epoch": 1.1911690332620113, "grad_norm": 1.578125, "learning_rate": 0.00048616394987300985, "loss": 5.3589, "mean_token_accuracy": 0.1700994923710823, "num_tokens": 26561582.0, "step": 15310 }, { "entropy": 5.477288293838501, "epoch": 1.1915580626337288, "grad_norm": 1.671875, "learning_rate": 0.0004861543791395579, "loss": 5.268, "mean_token_accuracy": 0.17064569890499115, "num_tokens": 26570632.0, "step": 15315 }, { "entropy": 5.496282768249512, "epoch": 1.1919470920054465, "grad_norm": 1.3125, "learning_rate": 0.0004861448052021743, "loss": 5.2385, "mean_token_accuracy": 0.17956620305776597, "num_tokens": 26579507.0, "step": 15320 }, { "entropy": 5.519331216812134, "epoch": 1.192336121377164, "grad_norm": 1.7421875, "learning_rate": 0.0004861352280610044, "loss": 5.2708, "mean_token_accuracy": 0.17697979509830475, "num_tokens": 26588765.0, "step": 15325 }, { "entropy": 5.5780798435211185, "epoch": 1.1927251507488816, "grad_norm": 1.3984375, "learning_rate": 0.00048612564771619346, "loss": 5.3091, "mean_token_accuracy": 0.1718684285879135, "num_tokens": 26597529.0, "step": 15330 }, { "entropy": 5.517671203613281, "epoch": 1.193114180120599, "grad_norm": 1.5, "learning_rate": 0.00048611606416788686, "loss": 5.273, "mean_token_accuracy": 0.17543119788169861, "num_tokens": 26605960.0, "step": 15335 }, { "entropy": 5.480123376846313, "epoch": 1.1935032094923166, "grad_norm": 1.6328125, "learning_rate": 0.00048610647741622996, "loss": 5.2105, "mean_token_accuracy": 0.17834984064102172, "num_tokens": 26614435.0, "step": 15340 }, { "entropy": 5.498327350616455, "epoch": 1.1938922388640343, "grad_norm": 1.7890625, "learning_rate": 0.0004860968874613683, "loss": 5.3028, "mean_token_accuracy": 0.17556809335947038, "num_tokens": 26622873.0, "step": 15345 }, { "entropy": 5.516958522796631, "epoch": 1.1942812682357518, "grad_norm": 1.703125, "learning_rate": 0.0004860872943034474, "loss": 5.2521, "mean_token_accuracy": 0.18184894621372222, "num_tokens": 26631529.0, "step": 15350 }, { "entropy": 5.616390800476074, "epoch": 1.1946702976074695, "grad_norm": 2.0, "learning_rate": 0.0004860776979426128, "loss": 5.3387, "mean_token_accuracy": 0.1649305284023285, "num_tokens": 26639466.0, "step": 15355 }, { "entropy": 5.475955963134766, "epoch": 1.195059326979187, "grad_norm": 1.734375, "learning_rate": 0.0004860680983790101, "loss": 5.2721, "mean_token_accuracy": 0.17273431569337844, "num_tokens": 26648329.0, "step": 15360 }, { "entropy": 5.521997594833374, "epoch": 1.1954483563509044, "grad_norm": 1.7109375, "learning_rate": 0.0004860584956127849, "loss": 5.2099, "mean_token_accuracy": 0.17746111750602722, "num_tokens": 26656899.0, "step": 15365 }, { "entropy": 5.599232149124146, "epoch": 1.195837385722622, "grad_norm": 1.6796875, "learning_rate": 0.00048604888964408306, "loss": 5.4497, "mean_token_accuracy": 0.16418037116527556, "num_tokens": 26666155.0, "step": 15370 }, { "entropy": 5.505629587173462, "epoch": 1.1962264150943396, "grad_norm": 3.34375, "learning_rate": 0.0004860392804730502, "loss": 5.2305, "mean_token_accuracy": 0.17840504944324492, "num_tokens": 26675567.0, "step": 15375 }, { "entropy": 5.551540231704712, "epoch": 1.1966154444660573, "grad_norm": 1.484375, "learning_rate": 0.00048602966809983204, "loss": 5.2835, "mean_token_accuracy": 0.1745466023683548, "num_tokens": 26684133.0, "step": 15380 }, { "entropy": 5.596503400802613, "epoch": 1.1970044738377748, "grad_norm": 1.7421875, "learning_rate": 0.0004860200525245746, "loss": 5.4122, "mean_token_accuracy": 0.1621151477098465, "num_tokens": 26692746.0, "step": 15385 }, { "entropy": 5.599116277694702, "epoch": 1.1973935032094922, "grad_norm": 1.53125, "learning_rate": 0.0004860104337474239, "loss": 5.2925, "mean_token_accuracy": 0.17825113534927367, "num_tokens": 26701887.0, "step": 15390 }, { "entropy": 5.544364500045776, "epoch": 1.19778253258121, "grad_norm": 1.4296875, "learning_rate": 0.00048600081176852555, "loss": 5.2699, "mean_token_accuracy": 0.173001329600811, "num_tokens": 26710346.0, "step": 15395 }, { "entropy": 5.45468282699585, "epoch": 1.1981715619529274, "grad_norm": 1.40625, "learning_rate": 0.00048599118658802575, "loss": 5.1874, "mean_token_accuracy": 0.18110829144716262, "num_tokens": 26718775.0, "step": 15400 }, { "entropy": 5.4572399139404295, "epoch": 1.198560591324645, "grad_norm": 1.7265625, "learning_rate": 0.0004859815582060706, "loss": 5.2515, "mean_token_accuracy": 0.17368060499429702, "num_tokens": 26726683.0, "step": 15405 }, { "entropy": 5.513894176483154, "epoch": 1.1989496206963626, "grad_norm": 1.5703125, "learning_rate": 0.0004859719266228061, "loss": 5.2757, "mean_token_accuracy": 0.18025728464126586, "num_tokens": 26735450.0, "step": 15410 }, { "entropy": 5.513188743591309, "epoch": 1.19933865006808, "grad_norm": 1.5546875, "learning_rate": 0.0004859622918383784, "loss": 5.239, "mean_token_accuracy": 0.17627025693655013, "num_tokens": 26744006.0, "step": 15415 }, { "entropy": 5.434592628479004, "epoch": 1.1997276794397977, "grad_norm": 1.6484375, "learning_rate": 0.0004859526538529337, "loss": 5.1489, "mean_token_accuracy": 0.18480762392282485, "num_tokens": 26751964.0, "step": 15420 }, { "entropy": 5.440835046768188, "epoch": 1.2001167088115152, "grad_norm": 1.59375, "learning_rate": 0.0004859430126666182, "loss": 5.2328, "mean_token_accuracy": 0.17953760772943497, "num_tokens": 26760766.0, "step": 15425 }, { "entropy": 5.451300573348999, "epoch": 1.200505738183233, "grad_norm": 1.734375, "learning_rate": 0.00048593336827957824, "loss": 5.2157, "mean_token_accuracy": 0.17408957779407502, "num_tokens": 26769663.0, "step": 15430 }, { "entropy": 5.608166265487671, "epoch": 1.2008947675549504, "grad_norm": 1.7890625, "learning_rate": 0.00048592372069196024, "loss": 5.4536, "mean_token_accuracy": 0.15993206351995468, "num_tokens": 26778693.0, "step": 15435 }, { "entropy": 5.555925989151001, "epoch": 1.2012837969266679, "grad_norm": 1.7734375, "learning_rate": 0.0004859140699039104, "loss": 5.2388, "mean_token_accuracy": 0.1839575320482254, "num_tokens": 26787368.0, "step": 15440 }, { "entropy": 5.482231330871582, "epoch": 1.2016728262983856, "grad_norm": 1.7421875, "learning_rate": 0.00048590441591557526, "loss": 5.1728, "mean_token_accuracy": 0.1869637429714203, "num_tokens": 26795559.0, "step": 15445 }, { "entropy": 5.41761155128479, "epoch": 1.202061855670103, "grad_norm": 1.8203125, "learning_rate": 0.00048589475872710134, "loss": 5.1875, "mean_token_accuracy": 0.18019474893808365, "num_tokens": 26803657.0, "step": 15450 }, { "entropy": 5.580560779571533, "epoch": 1.2024508850418207, "grad_norm": 1.5859375, "learning_rate": 0.0004858850983386351, "loss": 5.3663, "mean_token_accuracy": 0.16929758042097093, "num_tokens": 26812214.0, "step": 15455 }, { "entropy": 5.5866086959838865, "epoch": 1.2028399144135382, "grad_norm": 1.40625, "learning_rate": 0.0004858754347503231, "loss": 5.2159, "mean_token_accuracy": 0.18279595375061036, "num_tokens": 26820591.0, "step": 15460 }, { "entropy": 5.506124639511109, "epoch": 1.203228943785256, "grad_norm": 1.546875, "learning_rate": 0.00048586576796231216, "loss": 5.3095, "mean_token_accuracy": 0.17119992822408675, "num_tokens": 26829228.0, "step": 15465 }, { "entropy": 5.560684728622436, "epoch": 1.2036179731569734, "grad_norm": 1.421875, "learning_rate": 0.0004858560979747487, "loss": 5.444, "mean_token_accuracy": 0.16026985198259353, "num_tokens": 26838083.0, "step": 15470 }, { "entropy": 5.506431961059571, "epoch": 1.2040070025286909, "grad_norm": 1.84375, "learning_rate": 0.00048584642478777967, "loss": 5.145, "mean_token_accuracy": 0.17816006392240524, "num_tokens": 26846796.0, "step": 15475 }, { "entropy": 5.506115818023682, "epoch": 1.2043960319004086, "grad_norm": 1.5703125, "learning_rate": 0.0004858367484015517, "loss": 5.2605, "mean_token_accuracy": 0.17919433265924453, "num_tokens": 26854874.0, "step": 15480 }, { "entropy": 5.477559232711792, "epoch": 1.204785061272126, "grad_norm": 1.640625, "learning_rate": 0.00048582706881621166, "loss": 5.2763, "mean_token_accuracy": 0.17676855772733688, "num_tokens": 26863040.0, "step": 15485 }, { "entropy": 5.5456871509552, "epoch": 1.2051740906438435, "grad_norm": 1.5, "learning_rate": 0.0004858173860319063, "loss": 5.2844, "mean_token_accuracy": 0.16790855824947357, "num_tokens": 26872183.0, "step": 15490 }, { "entropy": 5.567169094085694, "epoch": 1.2055631200155612, "grad_norm": 1.8046875, "learning_rate": 0.00048580770004878277, "loss": 5.2502, "mean_token_accuracy": 0.17474120408296584, "num_tokens": 26880480.0, "step": 15495 }, { "entropy": 5.510172176361084, "epoch": 1.2059521493872787, "grad_norm": 1.984375, "learning_rate": 0.0004857980108669879, "loss": 5.2865, "mean_token_accuracy": 0.17212100327014923, "num_tokens": 26888855.0, "step": 15500 }, { "entropy": 5.485987567901612, "epoch": 1.2063411787589964, "grad_norm": 2.15625, "learning_rate": 0.00048578831848666875, "loss": 5.2852, "mean_token_accuracy": 0.17178125828504562, "num_tokens": 26897692.0, "step": 15505 }, { "entropy": 5.5099524974823, "epoch": 1.2067302081307139, "grad_norm": 2.09375, "learning_rate": 0.00048577862290797235, "loss": 5.2627, "mean_token_accuracy": 0.17293234765529633, "num_tokens": 26906502.0, "step": 15510 }, { "entropy": 5.56928186416626, "epoch": 1.2071192375024316, "grad_norm": 1.640625, "learning_rate": 0.00048576892413104586, "loss": 5.2824, "mean_token_accuracy": 0.17150285094976425, "num_tokens": 26915246.0, "step": 15515 }, { "entropy": 5.599849605560303, "epoch": 1.207508266874149, "grad_norm": 2.171875, "learning_rate": 0.0004857592221560364, "loss": 5.394, "mean_token_accuracy": 0.17263538390398026, "num_tokens": 26923901.0, "step": 15520 }, { "entropy": 5.566528367996216, "epoch": 1.2078972962458665, "grad_norm": 1.5703125, "learning_rate": 0.0004857495169830912, "loss": 5.4748, "mean_token_accuracy": 0.1707826942205429, "num_tokens": 26933246.0, "step": 15525 }, { "entropy": 5.5978960514068605, "epoch": 1.2082863256175842, "grad_norm": 1.84375, "learning_rate": 0.0004857398086123575, "loss": 5.3148, "mean_token_accuracy": 0.17998244166374205, "num_tokens": 26941938.0, "step": 15530 }, { "entropy": 5.548754453659058, "epoch": 1.2086753549893017, "grad_norm": 1.484375, "learning_rate": 0.0004857300970439827, "loss": 5.2626, "mean_token_accuracy": 0.17742191553115844, "num_tokens": 26949967.0, "step": 15535 }, { "entropy": 5.47895245552063, "epoch": 1.2090643843610192, "grad_norm": 1.65625, "learning_rate": 0.00048572038227811404, "loss": 5.3449, "mean_token_accuracy": 0.17146805673837662, "num_tokens": 26958743.0, "step": 15540 }, { "entropy": 5.595466423034668, "epoch": 1.2094534137327368, "grad_norm": 1.78125, "learning_rate": 0.000485710664314899, "loss": 5.3434, "mean_token_accuracy": 0.1736383780837059, "num_tokens": 26967338.0, "step": 15545 }, { "entropy": 5.539255046844483, "epoch": 1.2098424431044543, "grad_norm": 1.7890625, "learning_rate": 0.000485700943154485, "loss": 5.2201, "mean_token_accuracy": 0.17763067781925201, "num_tokens": 26976182.0, "step": 15550 }, { "entropy": 5.5409869194030765, "epoch": 1.210231472476172, "grad_norm": 1.9296875, "learning_rate": 0.0004856912187970195, "loss": 5.3651, "mean_token_accuracy": 0.17120445817708968, "num_tokens": 26984275.0, "step": 15555 }, { "entropy": 5.618622589111328, "epoch": 1.2106205018478895, "grad_norm": 1.46875, "learning_rate": 0.0004856814912426502, "loss": 5.315, "mean_token_accuracy": 0.17017755210399627, "num_tokens": 26991891.0, "step": 15560 }, { "entropy": 5.5119915962219235, "epoch": 1.2110095312196072, "grad_norm": 1.6640625, "learning_rate": 0.0004856717604915245, "loss": 5.2254, "mean_token_accuracy": 0.1756272718310356, "num_tokens": 27000390.0, "step": 15565 }, { "entropy": 5.371413326263427, "epoch": 1.2113985605913247, "grad_norm": 1.640625, "learning_rate": 0.0004856620265437902, "loss": 5.2167, "mean_token_accuracy": 0.18659651130437852, "num_tokens": 27009348.0, "step": 15570 }, { "entropy": 5.507945013046265, "epoch": 1.2117875899630421, "grad_norm": 1.3671875, "learning_rate": 0.000485652289399595, "loss": 5.2994, "mean_token_accuracy": 0.17704981416463852, "num_tokens": 27017529.0, "step": 15575 }, { "entropy": 5.590599632263183, "epoch": 1.2121766193347598, "grad_norm": 1.390625, "learning_rate": 0.00048564254905908655, "loss": 5.2962, "mean_token_accuracy": 0.1775521606206894, "num_tokens": 27026238.0, "step": 15580 }, { "entropy": 5.452028274536133, "epoch": 1.2125656487064773, "grad_norm": 1.4921875, "learning_rate": 0.00048563280552241266, "loss": 5.2311, "mean_token_accuracy": 0.178492571413517, "num_tokens": 27034995.0, "step": 15585 }, { "entropy": 5.636938190460205, "epoch": 1.2129546780781948, "grad_norm": 1.6640625, "learning_rate": 0.0004856230587897212, "loss": 5.4297, "mean_token_accuracy": 0.16370497345924379, "num_tokens": 27043631.0, "step": 15590 }, { "entropy": 5.586244440078735, "epoch": 1.2133437074499125, "grad_norm": 1.7109375, "learning_rate": 0.0004856133088611602, "loss": 5.2814, "mean_token_accuracy": 0.1802394911646843, "num_tokens": 27052491.0, "step": 15595 }, { "entropy": 5.512923288345337, "epoch": 1.21373273682163, "grad_norm": 1.859375, "learning_rate": 0.0004856035557368773, "loss": 5.2502, "mean_token_accuracy": 0.17505358457565307, "num_tokens": 27061056.0, "step": 15600 }, { "entropy": 5.450316095352173, "epoch": 1.2141217661933477, "grad_norm": 1.7421875, "learning_rate": 0.00048559379941702074, "loss": 5.2445, "mean_token_accuracy": 0.18168267458677292, "num_tokens": 27069562.0, "step": 15605 }, { "entropy": 5.533176374435425, "epoch": 1.2145107955650651, "grad_norm": 1.4765625, "learning_rate": 0.00048558403990173844, "loss": 5.2575, "mean_token_accuracy": 0.1756133958697319, "num_tokens": 27077814.0, "step": 15610 }, { "entropy": 5.523116588592529, "epoch": 1.2148998249367828, "grad_norm": 2.09375, "learning_rate": 0.00048557427719117855, "loss": 5.1765, "mean_token_accuracy": 0.18126779943704605, "num_tokens": 27086515.0, "step": 15615 }, { "entropy": 5.55156512260437, "epoch": 1.2152888543085003, "grad_norm": 1.4765625, "learning_rate": 0.0004855645112854891, "loss": 5.3001, "mean_token_accuracy": 0.17764369249343873, "num_tokens": 27095759.0, "step": 15620 }, { "entropy": 5.525755834579468, "epoch": 1.2156778836802178, "grad_norm": 1.7109375, "learning_rate": 0.0004855547421848184, "loss": 5.3189, "mean_token_accuracy": 0.1713688164949417, "num_tokens": 27104921.0, "step": 15625 }, { "entropy": 5.56371488571167, "epoch": 1.2160669130519355, "grad_norm": 2.078125, "learning_rate": 0.00048554496988931456, "loss": 5.3058, "mean_token_accuracy": 0.17698432356119156, "num_tokens": 27113876.0, "step": 15630 }, { "entropy": 5.55414400100708, "epoch": 1.216455942423653, "grad_norm": 1.4765625, "learning_rate": 0.00048553519439912597, "loss": 5.1844, "mean_token_accuracy": 0.17874561995267868, "num_tokens": 27121654.0, "step": 15635 }, { "entropy": 5.435419797897339, "epoch": 1.2168449717953704, "grad_norm": 1.53125, "learning_rate": 0.0004855254157144009, "loss": 5.2201, "mean_token_accuracy": 0.1826067790389061, "num_tokens": 27130156.0, "step": 15640 }, { "entropy": 5.513195753097534, "epoch": 1.2172340011670881, "grad_norm": 1.5625, "learning_rate": 0.0004855156338352877, "loss": 5.3133, "mean_token_accuracy": 0.16902976036071776, "num_tokens": 27138646.0, "step": 15645 }, { "entropy": 5.532236242294312, "epoch": 1.2176230305388056, "grad_norm": 1.53125, "learning_rate": 0.00048550584876193493, "loss": 5.3127, "mean_token_accuracy": 0.17692103683948518, "num_tokens": 27147282.0, "step": 15650 }, { "entropy": 5.48130054473877, "epoch": 1.2180120599105233, "grad_norm": 1.59375, "learning_rate": 0.00048549606049449085, "loss": 5.2068, "mean_token_accuracy": 0.1692296326160431, "num_tokens": 27156238.0, "step": 15655 }, { "entropy": 5.534921932220459, "epoch": 1.2184010892822408, "grad_norm": 1.59375, "learning_rate": 0.0004854862690331041, "loss": 5.3177, "mean_token_accuracy": 0.17091383785009384, "num_tokens": 27164936.0, "step": 15660 }, { "entropy": 5.543131589889526, "epoch": 1.2187901186539585, "grad_norm": 1.6484375, "learning_rate": 0.00048547647437792327, "loss": 5.2783, "mean_token_accuracy": 0.1732231631875038, "num_tokens": 27173362.0, "step": 15665 }, { "entropy": 5.475022649765014, "epoch": 1.219179148025676, "grad_norm": 1.71875, "learning_rate": 0.000485466676529097, "loss": 5.2085, "mean_token_accuracy": 0.18326039016246795, "num_tokens": 27181611.0, "step": 15670 }, { "entropy": 5.536137342453003, "epoch": 1.2195681773973934, "grad_norm": 2.21875, "learning_rate": 0.00048545687548677373, "loss": 5.2751, "mean_token_accuracy": 0.17755033373832702, "num_tokens": 27189593.0, "step": 15675 }, { "entropy": 5.541131639480591, "epoch": 1.2199572067691111, "grad_norm": 1.578125, "learning_rate": 0.0004854470712511025, "loss": 5.1921, "mean_token_accuracy": 0.17833051532506944, "num_tokens": 27198006.0, "step": 15680 }, { "entropy": 5.571993207931518, "epoch": 1.2203462361408286, "grad_norm": 1.6796875, "learning_rate": 0.00048543726382223193, "loss": 5.3165, "mean_token_accuracy": 0.17003822028636933, "num_tokens": 27206846.0, "step": 15685 }, { "entropy": 5.518065547943115, "epoch": 1.220735265512546, "grad_norm": 1.46875, "learning_rate": 0.00048542745320031075, "loss": 5.2586, "mean_token_accuracy": 0.17630101144313812, "num_tokens": 27214838.0, "step": 15690 }, { "entropy": 5.508387708663941, "epoch": 1.2211242948842638, "grad_norm": 1.5234375, "learning_rate": 0.00048541763938548795, "loss": 5.3418, "mean_token_accuracy": 0.16945082545280457, "num_tokens": 27224161.0, "step": 15695 }, { "entropy": 5.465720891952515, "epoch": 1.2215133242559812, "grad_norm": 1.6640625, "learning_rate": 0.00048540782237791244, "loss": 5.2027, "mean_token_accuracy": 0.17481983155012132, "num_tokens": 27233084.0, "step": 15700 }, { "entropy": 5.675802373886109, "epoch": 1.221902353627699, "grad_norm": 1.7109375, "learning_rate": 0.00048539800217773293, "loss": 5.4057, "mean_token_accuracy": 0.16449622958898544, "num_tokens": 27242219.0, "step": 15705 }, { "entropy": 5.573157024383545, "epoch": 1.2222913829994164, "grad_norm": 1.6875, "learning_rate": 0.0004853881787850988, "loss": 5.3388, "mean_token_accuracy": 0.1737979307770729, "num_tokens": 27250411.0, "step": 15710 }, { "entropy": 5.55861644744873, "epoch": 1.2226804123711341, "grad_norm": 1.7421875, "learning_rate": 0.00048537835220015886, "loss": 5.343, "mean_token_accuracy": 0.17057652920484542, "num_tokens": 27259472.0, "step": 15715 }, { "entropy": 5.558578681945801, "epoch": 1.2230694417428516, "grad_norm": 1.7109375, "learning_rate": 0.0004853685224230623, "loss": 5.2428, "mean_token_accuracy": 0.17715482264757157, "num_tokens": 27267922.0, "step": 15720 }, { "entropy": 5.531707859039306, "epoch": 1.223458471114569, "grad_norm": 1.84375, "learning_rate": 0.00048535868945395825, "loss": 5.375, "mean_token_accuracy": 0.17383092045783996, "num_tokens": 27277129.0, "step": 15725 }, { "entropy": 5.5771197319030765, "epoch": 1.2238475004862868, "grad_norm": 1.5078125, "learning_rate": 0.00048534885329299586, "loss": 5.3225, "mean_token_accuracy": 0.17048002630472184, "num_tokens": 27285583.0, "step": 15730 }, { "entropy": 5.515822172164917, "epoch": 1.2242365298580042, "grad_norm": 1.6484375, "learning_rate": 0.0004853390139403245, "loss": 5.2067, "mean_token_accuracy": 0.1759398177266121, "num_tokens": 27294292.0, "step": 15735 }, { "entropy": 5.59844741821289, "epoch": 1.224625559229722, "grad_norm": 1.5078125, "learning_rate": 0.00048532917139609334, "loss": 5.4076, "mean_token_accuracy": 0.16913793981075287, "num_tokens": 27302606.0, "step": 15740 }, { "entropy": 5.627884387969971, "epoch": 1.2250145886014394, "grad_norm": 1.5234375, "learning_rate": 0.0004853193256604518, "loss": 5.2607, "mean_token_accuracy": 0.18148200511932372, "num_tokens": 27311103.0, "step": 15745 }, { "entropy": 5.637231254577637, "epoch": 1.2254036179731569, "grad_norm": 1.671875, "learning_rate": 0.00048530947673354924, "loss": 5.2834, "mean_token_accuracy": 0.17769556790590285, "num_tokens": 27319497.0, "step": 15750 }, { "entropy": 5.523335409164429, "epoch": 1.2257926473448746, "grad_norm": 1.5, "learning_rate": 0.0004852996246155351, "loss": 5.3158, "mean_token_accuracy": 0.1735464498400688, "num_tokens": 27328367.0, "step": 15755 }, { "entropy": 5.507326602935791, "epoch": 1.226181676716592, "grad_norm": 1.6015625, "learning_rate": 0.00048528976930655896, "loss": 5.213, "mean_token_accuracy": 0.1748963087797165, "num_tokens": 27336797.0, "step": 15760 }, { "entropy": 5.462827920913696, "epoch": 1.2265707060883098, "grad_norm": 1.484375, "learning_rate": 0.00048527991080677015, "loss": 5.1833, "mean_token_accuracy": 0.1751452013850212, "num_tokens": 27345052.0, "step": 15765 }, { "entropy": 5.520791006088257, "epoch": 1.2269597354600272, "grad_norm": 1.625, "learning_rate": 0.00048527004911631843, "loss": 5.2214, "mean_token_accuracy": 0.18662792593240737, "num_tokens": 27353062.0, "step": 15770 }, { "entropy": 5.494668340682983, "epoch": 1.2273487648317447, "grad_norm": 1.9140625, "learning_rate": 0.0004852601842353534, "loss": 5.2634, "mean_token_accuracy": 0.17666485607624055, "num_tokens": 27361471.0, "step": 15775 }, { "entropy": 5.546452474594116, "epoch": 1.2277377942034624, "grad_norm": 1.6953125, "learning_rate": 0.00048525031616402476, "loss": 5.34, "mean_token_accuracy": 0.1727466270327568, "num_tokens": 27370655.0, "step": 15780 }, { "entropy": 5.552441549301148, "epoch": 1.2281268235751799, "grad_norm": 1.6015625, "learning_rate": 0.00048524044490248227, "loss": 5.1714, "mean_token_accuracy": 0.1819349005818367, "num_tokens": 27379329.0, "step": 15785 }, { "entropy": 5.554012870788574, "epoch": 1.2285158529468976, "grad_norm": 1.421875, "learning_rate": 0.00048523057045087557, "loss": 5.3233, "mean_token_accuracy": 0.1722200632095337, "num_tokens": 27388864.0, "step": 15790 }, { "entropy": 5.5810950756072994, "epoch": 1.228904882318615, "grad_norm": 1.4921875, "learning_rate": 0.00048522069280935466, "loss": 5.411, "mean_token_accuracy": 0.16008602529764177, "num_tokens": 27397804.0, "step": 15795 }, { "entropy": 5.50671911239624, "epoch": 1.2292939116903325, "grad_norm": 1.3984375, "learning_rate": 0.0004852108119780693, "loss": 5.2768, "mean_token_accuracy": 0.17277107387781143, "num_tokens": 27406578.0, "step": 15800 }, { "entropy": 5.53170256614685, "epoch": 1.2296829410620502, "grad_norm": 1.390625, "learning_rate": 0.0004852009279571694, "loss": 5.3446, "mean_token_accuracy": 0.16500737518072128, "num_tokens": 27415207.0, "step": 15805 }, { "entropy": 5.552730846405029, "epoch": 1.2300719704337677, "grad_norm": 1.8203125, "learning_rate": 0.000485191040746805, "loss": 5.2996, "mean_token_accuracy": 0.16809863299131395, "num_tokens": 27424201.0, "step": 15810 }, { "entropy": 5.513219118118286, "epoch": 1.2304609998054854, "grad_norm": 1.53125, "learning_rate": 0.0004851811503471262, "loss": 5.2975, "mean_token_accuracy": 0.17288100570440293, "num_tokens": 27433187.0, "step": 15815 }, { "entropy": 5.48877534866333, "epoch": 1.2308500291772029, "grad_norm": 1.7109375, "learning_rate": 0.00048517125675828294, "loss": 5.2801, "mean_token_accuracy": 0.17049404084682465, "num_tokens": 27441976.0, "step": 15820 }, { "entropy": 5.528487777709961, "epoch": 1.2312390585489204, "grad_norm": 1.59375, "learning_rate": 0.00048516135998042536, "loss": 5.2056, "mean_token_accuracy": 0.1832287698984146, "num_tokens": 27450235.0, "step": 15825 }, { "entropy": 5.5694622039794925, "epoch": 1.231628087920638, "grad_norm": 1.671875, "learning_rate": 0.0004851514600137037, "loss": 5.4018, "mean_token_accuracy": 0.1667611390352249, "num_tokens": 27458842.0, "step": 15830 }, { "entropy": 5.632485342025757, "epoch": 1.2320171172923555, "grad_norm": 1.5546875, "learning_rate": 0.00048514155685826807, "loss": 5.3476, "mean_token_accuracy": 0.1709143579006195, "num_tokens": 27467383.0, "step": 15835 }, { "entropy": 5.532180643081665, "epoch": 1.2324061466640732, "grad_norm": 1.5390625, "learning_rate": 0.0004851316505142688, "loss": 5.3166, "mean_token_accuracy": 0.17439887374639512, "num_tokens": 27475811.0, "step": 15840 }, { "entropy": 5.632568120956421, "epoch": 1.2327951760357907, "grad_norm": 1.4296875, "learning_rate": 0.00048512174098185615, "loss": 5.4272, "mean_token_accuracy": 0.16330601274967194, "num_tokens": 27484032.0, "step": 15845 }, { "entropy": 5.55184383392334, "epoch": 1.2331842054075082, "grad_norm": 1.4609375, "learning_rate": 0.00048511182826118055, "loss": 5.1548, "mean_token_accuracy": 0.17924610823392867, "num_tokens": 27492330.0, "step": 15850 }, { "entropy": 5.467745923995972, "epoch": 1.2335732347792259, "grad_norm": 1.734375, "learning_rate": 0.00048510191235239246, "loss": 5.2543, "mean_token_accuracy": 0.17472672760486602, "num_tokens": 27501042.0, "step": 15855 }, { "entropy": 5.507084846496582, "epoch": 1.2339622641509433, "grad_norm": 1.515625, "learning_rate": 0.00048509199325564217, "loss": 5.2061, "mean_token_accuracy": 0.17931463569402695, "num_tokens": 27509939.0, "step": 15860 }, { "entropy": 5.60815691947937, "epoch": 1.234351293522661, "grad_norm": 1.5078125, "learning_rate": 0.0004850820709710803, "loss": 5.4009, "mean_token_accuracy": 0.16378685384988784, "num_tokens": 27518653.0, "step": 15865 }, { "entropy": 5.622842645645141, "epoch": 1.2347403228943785, "grad_norm": 1.8203125, "learning_rate": 0.0004850721454988574, "loss": 5.2647, "mean_token_accuracy": 0.18122659176588057, "num_tokens": 27526856.0, "step": 15870 }, { "entropy": 5.4506090641021725, "epoch": 1.235129352266096, "grad_norm": 1.4921875, "learning_rate": 0.00048506221683912405, "loss": 5.1987, "mean_token_accuracy": 0.18405112624168396, "num_tokens": 27535205.0, "step": 15875 }, { "entropy": 5.5352109432220455, "epoch": 1.2355183816378137, "grad_norm": 1.4140625, "learning_rate": 0.0004850522849920309, "loss": 5.2926, "mean_token_accuracy": 0.17213273793458939, "num_tokens": 27543516.0, "step": 15880 }, { "entropy": 5.614929294586181, "epoch": 1.2359074110095312, "grad_norm": 1.4609375, "learning_rate": 0.00048504234995772863, "loss": 5.351, "mean_token_accuracy": 0.17170230001211167, "num_tokens": 27552136.0, "step": 15885 }, { "entropy": 5.534029865264893, "epoch": 1.2362964403812489, "grad_norm": 1.5546875, "learning_rate": 0.0004850324117363681, "loss": 5.3267, "mean_token_accuracy": 0.18268054872751235, "num_tokens": 27560805.0, "step": 15890 }, { "entropy": 5.523261976242066, "epoch": 1.2366854697529663, "grad_norm": 3.40625, "learning_rate": 0.00048502247032809997, "loss": 5.248, "mean_token_accuracy": 0.17248456925153732, "num_tokens": 27569643.0, "step": 15895 }, { "entropy": 5.5592669486999515, "epoch": 1.237074499124684, "grad_norm": 1.5, "learning_rate": 0.0004850125257330751, "loss": 5.2029, "mean_token_accuracy": 0.17631499767303466, "num_tokens": 27578506.0, "step": 15900 }, { "entropy": 5.4709169387817385, "epoch": 1.2374635284964015, "grad_norm": 1.40625, "learning_rate": 0.00048500257795144446, "loss": 5.2974, "mean_token_accuracy": 0.17011501491069794, "num_tokens": 27586911.0, "step": 15905 }, { "entropy": 5.515015459060669, "epoch": 1.237852557868119, "grad_norm": 1.5078125, "learning_rate": 0.000484992626983359, "loss": 5.3283, "mean_token_accuracy": 0.17393341809511184, "num_tokens": 27595112.0, "step": 15910 }, { "entropy": 5.593227338790894, "epoch": 1.2382415872398367, "grad_norm": 1.7421875, "learning_rate": 0.0004849826728289696, "loss": 5.3333, "mean_token_accuracy": 0.1646855928003788, "num_tokens": 27603923.0, "step": 15915 }, { "entropy": 5.441413116455078, "epoch": 1.2386306166115542, "grad_norm": 1.6640625, "learning_rate": 0.00048497271548842737, "loss": 5.1339, "mean_token_accuracy": 0.18607923090457917, "num_tokens": 27612705.0, "step": 15920 }, { "entropy": 5.51904296875, "epoch": 1.2390196459832716, "grad_norm": 1.5703125, "learning_rate": 0.0004849627549618834, "loss": 5.2743, "mean_token_accuracy": 0.1758978247642517, "num_tokens": 27621858.0, "step": 15925 }, { "entropy": 5.597062587738037, "epoch": 1.2394086753549893, "grad_norm": 1.453125, "learning_rate": 0.00048495279124948886, "loss": 5.3578, "mean_token_accuracy": 0.1709895223379135, "num_tokens": 27629977.0, "step": 15930 }, { "entropy": 5.603897666931152, "epoch": 1.2397977047267068, "grad_norm": 1.421875, "learning_rate": 0.0004849428243513948, "loss": 5.3037, "mean_token_accuracy": 0.1735332727432251, "num_tokens": 27638433.0, "step": 15935 }, { "entropy": 5.461909389495849, "epoch": 1.2401867340984245, "grad_norm": 1.53125, "learning_rate": 0.00048493285426775255, "loss": 5.2284, "mean_token_accuracy": 0.17621096074581147, "num_tokens": 27647116.0, "step": 15940 }, { "entropy": 5.4775975227355955, "epoch": 1.240575763470142, "grad_norm": 1.8046875, "learning_rate": 0.0004849228809987135, "loss": 5.3019, "mean_token_accuracy": 0.16883142665028572, "num_tokens": 27655598.0, "step": 15945 }, { "entropy": 5.652406930923462, "epoch": 1.2409647928418597, "grad_norm": 2.40625, "learning_rate": 0.0004849129045444288, "loss": 5.3986, "mean_token_accuracy": 0.16651797145605088, "num_tokens": 27664308.0, "step": 15950 }, { "entropy": 5.523653602600097, "epoch": 1.2413538222135772, "grad_norm": 1.84375, "learning_rate": 0.0004849029249050498, "loss": 5.1381, "mean_token_accuracy": 0.18590807169675827, "num_tokens": 27672808.0, "step": 15955 }, { "entropy": 5.586093521118164, "epoch": 1.2417428515852946, "grad_norm": 1.765625, "learning_rate": 0.00048489294208072805, "loss": 5.3471, "mean_token_accuracy": 0.16780729293823243, "num_tokens": 27681091.0, "step": 15960 }, { "entropy": 5.5585376739501955, "epoch": 1.2421318809570123, "grad_norm": 1.7421875, "learning_rate": 0.00048488295607161495, "loss": 5.2922, "mean_token_accuracy": 0.17706929743289948, "num_tokens": 27689582.0, "step": 15965 }, { "entropy": 5.5264345645904545, "epoch": 1.2425209103287298, "grad_norm": 1.75, "learning_rate": 0.0004848729668778621, "loss": 5.2268, "mean_token_accuracy": 0.17582499235868454, "num_tokens": 27698509.0, "step": 15970 }, { "entropy": 5.552094411849976, "epoch": 1.2429099397004473, "grad_norm": 1.59375, "learning_rate": 0.0004848629744996211, "loss": 5.3387, "mean_token_accuracy": 0.16460926830768585, "num_tokens": 27708216.0, "step": 15975 }, { "entropy": 5.616294527053833, "epoch": 1.243298969072165, "grad_norm": 1.6328125, "learning_rate": 0.0004848529789370434, "loss": 5.3306, "mean_token_accuracy": 0.1712876006960869, "num_tokens": 27716801.0, "step": 15980 }, { "entropy": 5.538486289978027, "epoch": 1.2436879984438824, "grad_norm": 1.6328125, "learning_rate": 0.0004848429801902808, "loss": 5.2974, "mean_token_accuracy": 0.17481158822774887, "num_tokens": 27725186.0, "step": 15985 }, { "entropy": 5.6251349449157715, "epoch": 1.2440770278156001, "grad_norm": 1.5, "learning_rate": 0.00048483297825948485, "loss": 5.2537, "mean_token_accuracy": 0.171275532245636, "num_tokens": 27733386.0, "step": 15990 }, { "entropy": 5.57133412361145, "epoch": 1.2444660571873176, "grad_norm": 1.53125, "learning_rate": 0.00048482297314480756, "loss": 5.3205, "mean_token_accuracy": 0.17034234553575517, "num_tokens": 27742253.0, "step": 15995 }, { "entropy": 5.528388786315918, "epoch": 1.2448550865590353, "grad_norm": 1.859375, "learning_rate": 0.0004848129648464006, "loss": 5.2425, "mean_token_accuracy": 0.1777079001069069, "num_tokens": 27751555.0, "step": 16000 }, { "entropy": 5.566807222366333, "epoch": 1.2452441159307528, "grad_norm": 2.203125, "learning_rate": 0.0004848029533644159, "loss": 5.3841, "mean_token_accuracy": 0.16856226176023484, "num_tokens": 27760151.0, "step": 16005 }, { "entropy": 5.586111927032471, "epoch": 1.2456331453024703, "grad_norm": 1.5546875, "learning_rate": 0.0004847929386990052, "loss": 5.3005, "mean_token_accuracy": 0.17904738783836366, "num_tokens": 27770017.0, "step": 16010 }, { "entropy": 5.518650197982788, "epoch": 1.246022174674188, "grad_norm": 1.4140625, "learning_rate": 0.00048478292085032065, "loss": 5.163, "mean_token_accuracy": 0.17997154146432875, "num_tokens": 27777796.0, "step": 16015 }, { "entropy": 5.4770392894744875, "epoch": 1.2464112040459054, "grad_norm": 1.515625, "learning_rate": 0.0004847728998185142, "loss": 5.2616, "mean_token_accuracy": 0.17714573293924332, "num_tokens": 27785784.0, "step": 16020 }, { "entropy": 5.546535491943359, "epoch": 1.246800233417623, "grad_norm": 1.5546875, "learning_rate": 0.00048476287560373786, "loss": 5.2723, "mean_token_accuracy": 0.17140836715698243, "num_tokens": 27793911.0, "step": 16025 }, { "entropy": 5.446552419662476, "epoch": 1.2471892627893406, "grad_norm": 2.28125, "learning_rate": 0.00048475284820614375, "loss": 5.2726, "mean_token_accuracy": 0.18089391440153121, "num_tokens": 27803125.0, "step": 16030 }, { "entropy": 5.430708980560302, "epoch": 1.247578292161058, "grad_norm": 1.4296875, "learning_rate": 0.00048474281762588407, "loss": 5.2319, "mean_token_accuracy": 0.17744951993227004, "num_tokens": 27812008.0, "step": 16035 }, { "entropy": 5.5487429141998295, "epoch": 1.2479673215327758, "grad_norm": 1.515625, "learning_rate": 0.0004847327838631109, "loss": 5.3557, "mean_token_accuracy": 0.16771409809589385, "num_tokens": 27820490.0, "step": 16040 }, { "entropy": 5.603517723083496, "epoch": 1.2483563509044933, "grad_norm": 1.4921875, "learning_rate": 0.0004847227469179766, "loss": 5.301, "mean_token_accuracy": 0.1743951141834259, "num_tokens": 27829513.0, "step": 16045 }, { "entropy": 5.511103773117066, "epoch": 1.248745380276211, "grad_norm": 1.9140625, "learning_rate": 0.0004847127067906334, "loss": 5.2549, "mean_token_accuracy": 0.17470561116933822, "num_tokens": 27837811.0, "step": 16050 }, { "entropy": 5.579536199569702, "epoch": 1.2491344096479284, "grad_norm": 1.703125, "learning_rate": 0.00048470266348123365, "loss": 5.3891, "mean_token_accuracy": 0.1684957981109619, "num_tokens": 27846449.0, "step": 16055 }, { "entropy": 5.447787570953369, "epoch": 1.249523439019646, "grad_norm": 1.4375, "learning_rate": 0.0004846926169899298, "loss": 5.18, "mean_token_accuracy": 0.18282399475574493, "num_tokens": 27854834.0, "step": 16060 }, { "entropy": 5.5481071949005125, "epoch": 1.2499124683913636, "grad_norm": 1.515625, "learning_rate": 0.00048468256731687426, "loss": 5.3233, "mean_token_accuracy": 0.17269108444452286, "num_tokens": 27862984.0, "step": 16065 }, { "entropy": 5.581409549713134, "epoch": 1.250301497763081, "grad_norm": 1.6328125, "learning_rate": 0.0004846725144622194, "loss": 5.3548, "mean_token_accuracy": 0.16472773104906083, "num_tokens": 27872198.0, "step": 16070 }, { "entropy": 5.586838436126709, "epoch": 1.2506905271347986, "grad_norm": 1.640625, "learning_rate": 0.000484662458426118, "loss": 5.2592, "mean_token_accuracy": 0.17459298968315123, "num_tokens": 27880856.0, "step": 16075 }, { "entropy": 5.495987892150879, "epoch": 1.2510795565065163, "grad_norm": 1.4765625, "learning_rate": 0.00048465239920872247, "loss": 5.1995, "mean_token_accuracy": 0.1802007809281349, "num_tokens": 27888677.0, "step": 16080 }, { "entropy": 5.46326208114624, "epoch": 1.2514685858782337, "grad_norm": 1.484375, "learning_rate": 0.00048464233681018545, "loss": 5.2571, "mean_token_accuracy": 0.17940560579299927, "num_tokens": 27896940.0, "step": 16085 }, { "entropy": 5.534651088714599, "epoch": 1.2518576152499514, "grad_norm": 1.4453125, "learning_rate": 0.0004846322712306596, "loss": 5.3629, "mean_token_accuracy": 0.16747429370880126, "num_tokens": 27905739.0, "step": 16090 }, { "entropy": 5.588169384002685, "epoch": 1.252246644621669, "grad_norm": 2.125, "learning_rate": 0.00048462220247029783, "loss": 5.308, "mean_token_accuracy": 0.1772422343492508, "num_tokens": 27914029.0, "step": 16095 }, { "entropy": 5.621267461776734, "epoch": 1.2526356739933866, "grad_norm": 1.546875, "learning_rate": 0.00048461213052925265, "loss": 5.4159, "mean_token_accuracy": 0.16701759546995162, "num_tokens": 27923287.0, "step": 16100 }, { "entropy": 5.502909421920776, "epoch": 1.253024703365104, "grad_norm": 1.625, "learning_rate": 0.0004846020554076771, "loss": 5.2592, "mean_token_accuracy": 0.17615789026021958, "num_tokens": 27931727.0, "step": 16105 }, { "entropy": 5.534601783752441, "epoch": 1.2534137327368216, "grad_norm": 1.5390625, "learning_rate": 0.0004845919771057239, "loss": 5.1926, "mean_token_accuracy": 0.1769889771938324, "num_tokens": 27939524.0, "step": 16110 }, { "entropy": 5.574967527389527, "epoch": 1.2538027621085392, "grad_norm": 1.4375, "learning_rate": 0.0004845818956235462, "loss": 5.2762, "mean_token_accuracy": 0.16775871813297272, "num_tokens": 27947827.0, "step": 16115 }, { "entropy": 5.494071769714355, "epoch": 1.2541917914802567, "grad_norm": 1.7578125, "learning_rate": 0.00048457181096129664, "loss": 5.283, "mean_token_accuracy": 0.17416021078824998, "num_tokens": 27956447.0, "step": 16120 }, { "entropy": 5.556335926055908, "epoch": 1.2545808208519742, "grad_norm": 1.6875, "learning_rate": 0.0004845617231191285, "loss": 5.3239, "mean_token_accuracy": 0.16798613965511322, "num_tokens": 27965570.0, "step": 16125 }, { "entropy": 5.534073543548584, "epoch": 1.254969850223692, "grad_norm": 1.6171875, "learning_rate": 0.0004845516320971948, "loss": 5.2915, "mean_token_accuracy": 0.1722590446472168, "num_tokens": 27974527.0, "step": 16130 }, { "entropy": 5.5188836574554445, "epoch": 1.2553588795954094, "grad_norm": 1.2734375, "learning_rate": 0.0004845415378956486, "loss": 5.2166, "mean_token_accuracy": 0.17618252336978912, "num_tokens": 27983190.0, "step": 16135 }, { "entropy": 5.528718614578247, "epoch": 1.255747908967127, "grad_norm": 1.4296875, "learning_rate": 0.000484531440514643, "loss": 5.3408, "mean_token_accuracy": 0.17083994448184966, "num_tokens": 27992203.0, "step": 16140 }, { "entropy": 5.534156799316406, "epoch": 1.2561369383388445, "grad_norm": 1.40625, "learning_rate": 0.00048452133995433136, "loss": 5.2954, "mean_token_accuracy": 0.17254400253295898, "num_tokens": 28001154.0, "step": 16145 }, { "entropy": 5.495703649520874, "epoch": 1.2565259677105622, "grad_norm": 1.421875, "learning_rate": 0.0004845112362148668, "loss": 5.2, "mean_token_accuracy": 0.17672016322612763, "num_tokens": 28009841.0, "step": 16150 }, { "entropy": 5.512458992004395, "epoch": 1.2569149970822797, "grad_norm": 1.46875, "learning_rate": 0.0004845011292964028, "loss": 5.2923, "mean_token_accuracy": 0.17635370939970016, "num_tokens": 28019245.0, "step": 16155 }, { "entropy": 5.579947233200073, "epoch": 1.2573040264539972, "grad_norm": 2.046875, "learning_rate": 0.00048449101919909265, "loss": 5.4261, "mean_token_accuracy": 0.16537006199359894, "num_tokens": 28028342.0, "step": 16160 }, { "entropy": 5.572152137756348, "epoch": 1.257693055825715, "grad_norm": 1.5859375, "learning_rate": 0.00048448090592308955, "loss": 5.3589, "mean_token_accuracy": 0.171546870470047, "num_tokens": 28037308.0, "step": 16165 }, { "entropy": 5.564729070663452, "epoch": 1.2580820851974324, "grad_norm": 1.6875, "learning_rate": 0.0004844707894685473, "loss": 5.3209, "mean_token_accuracy": 0.17351430505514145, "num_tokens": 28046214.0, "step": 16170 }, { "entropy": 5.48063554763794, "epoch": 1.2584711145691498, "grad_norm": 1.3984375, "learning_rate": 0.0004844606698356192, "loss": 5.159, "mean_token_accuracy": 0.17853713184595107, "num_tokens": 28054722.0, "step": 16175 }, { "entropy": 5.456463575363159, "epoch": 1.2588601439408675, "grad_norm": 1.4375, "learning_rate": 0.0004844505470244588, "loss": 5.1627, "mean_token_accuracy": 0.17707505226135253, "num_tokens": 28062596.0, "step": 16180 }, { "entropy": 5.396499967575073, "epoch": 1.2592491733125852, "grad_norm": 1.4453125, "learning_rate": 0.0004844404210352197, "loss": 5.2069, "mean_token_accuracy": 0.17821115702390672, "num_tokens": 28071183.0, "step": 16185 }, { "entropy": 5.431892681121826, "epoch": 1.2596382026843027, "grad_norm": 1.875, "learning_rate": 0.00048443029186805554, "loss": 5.2099, "mean_token_accuracy": 0.1791281968355179, "num_tokens": 28079194.0, "step": 16190 }, { "entropy": 5.52010555267334, "epoch": 1.2600272320560202, "grad_norm": 1.4765625, "learning_rate": 0.0004844201595231201, "loss": 5.2124, "mean_token_accuracy": 0.1752294510602951, "num_tokens": 28087874.0, "step": 16195 }, { "entropy": 5.606992435455322, "epoch": 1.2604162614277379, "grad_norm": 4.09375, "learning_rate": 0.00048441002400056706, "loss": 5.3018, "mean_token_accuracy": 0.17383768111467363, "num_tokens": 28097390.0, "step": 16200 }, { "entropy": 5.4187366485595705, "epoch": 1.2608052907994554, "grad_norm": 1.484375, "learning_rate": 0.0004843998853005502, "loss": 5.2, "mean_token_accuracy": 0.17888538539409637, "num_tokens": 28105445.0, "step": 16205 }, { "entropy": 5.543935775756836, "epoch": 1.2611943201711728, "grad_norm": 1.640625, "learning_rate": 0.0004843897434232233, "loss": 5.2495, "mean_token_accuracy": 0.1747748598456383, "num_tokens": 28113855.0, "step": 16210 }, { "entropy": 5.548325538635254, "epoch": 1.2615833495428905, "grad_norm": 1.4375, "learning_rate": 0.00048437959836874047, "loss": 5.2141, "mean_token_accuracy": 0.1837356135249138, "num_tokens": 28123300.0, "step": 16215 }, { "entropy": 5.47448878288269, "epoch": 1.261972378914608, "grad_norm": 1.84375, "learning_rate": 0.00048436945013725544, "loss": 5.1998, "mean_token_accuracy": 0.1759326219558716, "num_tokens": 28131829.0, "step": 16220 }, { "entropy": 5.526947689056397, "epoch": 1.2623614082863255, "grad_norm": 2.078125, "learning_rate": 0.00048435929872892226, "loss": 5.3663, "mean_token_accuracy": 0.1652940958738327, "num_tokens": 28141060.0, "step": 16225 }, { "entropy": 5.589622354507446, "epoch": 1.2627504376580432, "grad_norm": 1.921875, "learning_rate": 0.0004843491441438949, "loss": 5.3689, "mean_token_accuracy": 0.16020533740520476, "num_tokens": 28149866.0, "step": 16230 }, { "entropy": 5.5559464454650875, "epoch": 1.2631394670297609, "grad_norm": 1.6328125, "learning_rate": 0.00048433898638232755, "loss": 5.2884, "mean_token_accuracy": 0.1736864283680916, "num_tokens": 28158593.0, "step": 16235 }, { "entropy": 5.503639888763428, "epoch": 1.2635284964014784, "grad_norm": 1.5625, "learning_rate": 0.0004843288254443742, "loss": 5.2248, "mean_token_accuracy": 0.17802777588367463, "num_tokens": 28167301.0, "step": 16240 }, { "entropy": 5.524279689788818, "epoch": 1.2639175257731958, "grad_norm": 1.40625, "learning_rate": 0.0004843186613301892, "loss": 5.2754, "mean_token_accuracy": 0.17966293692588806, "num_tokens": 28176092.0, "step": 16245 }, { "entropy": 5.599130153656006, "epoch": 1.2643065551449135, "grad_norm": 1.6171875, "learning_rate": 0.0004843084940399266, "loss": 5.3472, "mean_token_accuracy": 0.17642695009708403, "num_tokens": 28184570.0, "step": 16250 }, { "entropy": 5.530882930755615, "epoch": 1.264695584516631, "grad_norm": 1.5859375, "learning_rate": 0.0004842983235737408, "loss": 5.2617, "mean_token_accuracy": 0.1801413506269455, "num_tokens": 28192874.0, "step": 16255 }, { "entropy": 5.5411170482635494, "epoch": 1.2650846138883485, "grad_norm": 1.515625, "learning_rate": 0.0004842881499317861, "loss": 5.2667, "mean_token_accuracy": 0.18436603993177414, "num_tokens": 28201546.0, "step": 16260 }, { "entropy": 5.49763593673706, "epoch": 1.2654736432600662, "grad_norm": 1.4609375, "learning_rate": 0.0004842779731142168, "loss": 5.2584, "mean_token_accuracy": 0.17174842804670334, "num_tokens": 28210061.0, "step": 16265 }, { "entropy": 5.432314538955689, "epoch": 1.2658626726317836, "grad_norm": 1.5546875, "learning_rate": 0.00048426779312118735, "loss": 5.1915, "mean_token_accuracy": 0.17794633507728577, "num_tokens": 28219334.0, "step": 16270 }, { "entropy": 5.59707465171814, "epoch": 1.2662517020035013, "grad_norm": 1.6171875, "learning_rate": 0.0004842576099528522, "loss": 5.3288, "mean_token_accuracy": 0.16946832239627838, "num_tokens": 28227963.0, "step": 16275 }, { "entropy": 5.523435163497925, "epoch": 1.2666407313752188, "grad_norm": 1.7265625, "learning_rate": 0.0004842474236093659, "loss": 5.2924, "mean_token_accuracy": 0.17364021241664887, "num_tokens": 28236648.0, "step": 16280 }, { "entropy": 5.512435960769653, "epoch": 1.2670297607469365, "grad_norm": 1.7890625, "learning_rate": 0.00048423723409088306, "loss": 5.2871, "mean_token_accuracy": 0.169327412545681, "num_tokens": 28245221.0, "step": 16285 }, { "entropy": 5.537802076339721, "epoch": 1.267418790118654, "grad_norm": 1.5078125, "learning_rate": 0.0004842270413975582, "loss": 5.2682, "mean_token_accuracy": 0.1720076471567154, "num_tokens": 28254481.0, "step": 16290 }, { "entropy": 5.513460254669189, "epoch": 1.2678078194903715, "grad_norm": 1.6640625, "learning_rate": 0.000484216845529546, "loss": 5.2509, "mean_token_accuracy": 0.17465183585882188, "num_tokens": 28263844.0, "step": 16295 }, { "entropy": 5.467709922790528, "epoch": 1.2681968488620892, "grad_norm": 1.34375, "learning_rate": 0.00048420664648700113, "loss": 5.2071, "mean_token_accuracy": 0.17747659385204315, "num_tokens": 28272500.0, "step": 16300 }, { "entropy": 5.558680582046509, "epoch": 1.2685858782338066, "grad_norm": 1.546875, "learning_rate": 0.0004841964442700784, "loss": 5.3074, "mean_token_accuracy": 0.16695282310247422, "num_tokens": 28281553.0, "step": 16305 }, { "entropy": 5.540439224243164, "epoch": 1.2689749076055241, "grad_norm": 1.515625, "learning_rate": 0.00048418623887893264, "loss": 5.2741, "mean_token_accuracy": 0.1742094039916992, "num_tokens": 28290078.0, "step": 16310 }, { "entropy": 5.483782529830933, "epoch": 1.2693639369772418, "grad_norm": 1.3828125, "learning_rate": 0.00048417603031371867, "loss": 5.1407, "mean_token_accuracy": 0.17784553468227388, "num_tokens": 28298879.0, "step": 16315 }, { "entropy": 5.457211303710937, "epoch": 1.2697529663489593, "grad_norm": 1.5078125, "learning_rate": 0.0004841658185745913, "loss": 5.2597, "mean_token_accuracy": 0.18327910006046294, "num_tokens": 28307188.0, "step": 16320 }, { "entropy": 5.445938491821289, "epoch": 1.270141995720677, "grad_norm": 1.3203125, "learning_rate": 0.00048415560366170564, "loss": 5.1752, "mean_token_accuracy": 0.18031149506568908, "num_tokens": 28316012.0, "step": 16325 }, { "entropy": 5.530198621749878, "epoch": 1.2705310250923945, "grad_norm": 1.359375, "learning_rate": 0.0004841453855752165, "loss": 5.3491, "mean_token_accuracy": 0.1687226489186287, "num_tokens": 28325750.0, "step": 16330 }, { "entropy": 5.523533058166504, "epoch": 1.2709200544641122, "grad_norm": 1.9765625, "learning_rate": 0.0004841351643152791, "loss": 5.2985, "mean_token_accuracy": 0.17067915201187134, "num_tokens": 28335217.0, "step": 16335 }, { "entropy": 5.577079916000367, "epoch": 1.2713090838358296, "grad_norm": 1.4921875, "learning_rate": 0.0004841249398820485, "loss": 5.2589, "mean_token_accuracy": 0.17277070879936218, "num_tokens": 28344123.0, "step": 16340 }, { "entropy": 5.56252384185791, "epoch": 1.271698113207547, "grad_norm": 1.7265625, "learning_rate": 0.0004841147122756797, "loss": 5.2708, "mean_token_accuracy": 0.17112697809934616, "num_tokens": 28353230.0, "step": 16345 }, { "entropy": 5.526676177978516, "epoch": 1.2720871425792648, "grad_norm": 1.5703125, "learning_rate": 0.000484104481496328, "loss": 5.2831, "mean_token_accuracy": 0.17249808758497237, "num_tokens": 28361636.0, "step": 16350 }, { "entropy": 5.504556894302368, "epoch": 1.2724761719509823, "grad_norm": 1.484375, "learning_rate": 0.0004840942475441486, "loss": 5.2533, "mean_token_accuracy": 0.170597605407238, "num_tokens": 28370066.0, "step": 16355 }, { "entropy": 5.527553272247315, "epoch": 1.2728652013226998, "grad_norm": 2.546875, "learning_rate": 0.0004840840104192969, "loss": 5.3288, "mean_token_accuracy": 0.16599608063697815, "num_tokens": 28379017.0, "step": 16360 }, { "entropy": 5.591423749923706, "epoch": 1.2732542306944175, "grad_norm": 2.03125, "learning_rate": 0.000484073770121928, "loss": 5.2832, "mean_token_accuracy": 0.17235138714313508, "num_tokens": 28387939.0, "step": 16365 }, { "entropy": 5.5084977626800535, "epoch": 1.273643260066135, "grad_norm": 2.328125, "learning_rate": 0.0004840635266521975, "loss": 5.1952, "mean_token_accuracy": 0.1758476436138153, "num_tokens": 28396341.0, "step": 16370 }, { "entropy": 5.467773008346557, "epoch": 1.2740322894378526, "grad_norm": 5.78125, "learning_rate": 0.0004840532800102607, "loss": 5.2073, "mean_token_accuracy": 0.17458854019641876, "num_tokens": 28405128.0, "step": 16375 }, { "entropy": 5.497469186782837, "epoch": 1.27442131880957, "grad_norm": 1.796875, "learning_rate": 0.00048404303019627314, "loss": 5.1921, "mean_token_accuracy": 0.17867213785648345, "num_tokens": 28412841.0, "step": 16380 }, { "entropy": 5.430998992919922, "epoch": 1.2748103481812878, "grad_norm": 1.7734375, "learning_rate": 0.00048403277721039036, "loss": 5.1505, "mean_token_accuracy": 0.18427162021398544, "num_tokens": 28421526.0, "step": 16385 }, { "entropy": 5.4770458221435545, "epoch": 1.2751993775530053, "grad_norm": 1.3671875, "learning_rate": 0.0004840225210527679, "loss": 5.3253, "mean_token_accuracy": 0.17072549164295198, "num_tokens": 28430070.0, "step": 16390 }, { "entropy": 5.460269260406494, "epoch": 1.2755884069247228, "grad_norm": 1.421875, "learning_rate": 0.0004840122617235613, "loss": 5.2053, "mean_token_accuracy": 0.17117018401622772, "num_tokens": 28438920.0, "step": 16395 }, { "entropy": 5.587383127212524, "epoch": 1.2759774362964404, "grad_norm": 1.546875, "learning_rate": 0.0004840019992229263, "loss": 5.232, "mean_token_accuracy": 0.17959167063236237, "num_tokens": 28447666.0, "step": 16400 }, { "entropy": 5.534450912475586, "epoch": 1.276366465668158, "grad_norm": 1.40625, "learning_rate": 0.00048399173355101867, "loss": 5.3605, "mean_token_accuracy": 0.16608233749866486, "num_tokens": 28457341.0, "step": 16405 }, { "entropy": 5.470757341384887, "epoch": 1.2767554950398754, "grad_norm": 1.578125, "learning_rate": 0.00048398146470799417, "loss": 5.2504, "mean_token_accuracy": 0.18641512244939804, "num_tokens": 28466202.0, "step": 16410 }, { "entropy": 5.602308511734009, "epoch": 1.277144524411593, "grad_norm": 1.4453125, "learning_rate": 0.00048397119269400846, "loss": 5.3356, "mean_token_accuracy": 0.17155100107192994, "num_tokens": 28474494.0, "step": 16415 }, { "entropy": 5.576149225234985, "epoch": 1.2775335537833106, "grad_norm": 1.53125, "learning_rate": 0.00048396091750921766, "loss": 5.2951, "mean_token_accuracy": 0.1768299549818039, "num_tokens": 28482931.0, "step": 16420 }, { "entropy": 5.48293981552124, "epoch": 1.2779225831550283, "grad_norm": 1.4609375, "learning_rate": 0.0004839506391537774, "loss": 5.2548, "mean_token_accuracy": 0.17274906784296035, "num_tokens": 28491372.0, "step": 16425 }, { "entropy": 5.447651052474976, "epoch": 1.2783116125267457, "grad_norm": 1.5078125, "learning_rate": 0.0004839403576278438, "loss": 5.1784, "mean_token_accuracy": 0.18031758815050125, "num_tokens": 28500201.0, "step": 16430 }, { "entropy": 5.464600706100464, "epoch": 1.2787006418984634, "grad_norm": 1.453125, "learning_rate": 0.0004839300729315729, "loss": 5.2059, "mean_token_accuracy": 0.17613438218832017, "num_tokens": 28508899.0, "step": 16435 }, { "entropy": 5.5099687576293945, "epoch": 1.279089671270181, "grad_norm": 1.546875, "learning_rate": 0.0004839197850651206, "loss": 5.2897, "mean_token_accuracy": 0.17009116113185882, "num_tokens": 28518280.0, "step": 16440 }, { "entropy": 5.590722703933716, "epoch": 1.2794787006418984, "grad_norm": 1.59375, "learning_rate": 0.00048390949402864317, "loss": 5.3411, "mean_token_accuracy": 0.17054921835660936, "num_tokens": 28527113.0, "step": 16445 }, { "entropy": 5.445984888076782, "epoch": 1.279867730013616, "grad_norm": 1.4609375, "learning_rate": 0.00048389919982229666, "loss": 5.2428, "mean_token_accuracy": 0.1773141548037529, "num_tokens": 28535253.0, "step": 16450 }, { "entropy": 5.414700889587403, "epoch": 1.2802567593853336, "grad_norm": 1.3515625, "learning_rate": 0.00048388890244623723, "loss": 5.2753, "mean_token_accuracy": 0.17602664083242417, "num_tokens": 28543475.0, "step": 16455 }, { "entropy": 5.58476300239563, "epoch": 1.280645788757051, "grad_norm": 1.7578125, "learning_rate": 0.0004838786019006213, "loss": 5.3341, "mean_token_accuracy": 0.17287300676107406, "num_tokens": 28551921.0, "step": 16460 }, { "entropy": 5.530067205429077, "epoch": 1.2810348181287687, "grad_norm": 1.6953125, "learning_rate": 0.00048386829818560493, "loss": 5.2924, "mean_token_accuracy": 0.17198163717985154, "num_tokens": 28560413.0, "step": 16465 }, { "entropy": 5.57966251373291, "epoch": 1.2814238475004862, "grad_norm": 1.40625, "learning_rate": 0.00048385799130134464, "loss": 5.3328, "mean_token_accuracy": 0.17408890128135682, "num_tokens": 28568802.0, "step": 16470 }, { "entropy": 5.520438098907471, "epoch": 1.281812876872204, "grad_norm": 1.5, "learning_rate": 0.0004838476812479968, "loss": 5.4196, "mean_token_accuracy": 0.1665988437831402, "num_tokens": 28578164.0, "step": 16475 }, { "entropy": 5.5440600395202635, "epoch": 1.2822019062439214, "grad_norm": 1.5078125, "learning_rate": 0.00048383736802571774, "loss": 5.1965, "mean_token_accuracy": 0.18536286652088166, "num_tokens": 28586061.0, "step": 16480 }, { "entropy": 5.493400049209595, "epoch": 1.282590935615639, "grad_norm": 1.4375, "learning_rate": 0.000483827051634664, "loss": 5.1938, "mean_token_accuracy": 0.17700058668851854, "num_tokens": 28594185.0, "step": 16485 }, { "entropy": 5.458246231079102, "epoch": 1.2829799649873566, "grad_norm": 1.6640625, "learning_rate": 0.00048381673207499224, "loss": 5.2435, "mean_token_accuracy": 0.1800957813858986, "num_tokens": 28602427.0, "step": 16490 }, { "entropy": 5.46396837234497, "epoch": 1.283368994359074, "grad_norm": 1.5078125, "learning_rate": 0.0004838064093468588, "loss": 5.2042, "mean_token_accuracy": 0.17680867612361909, "num_tokens": 28611608.0, "step": 16495 }, { "entropy": 5.487648820877075, "epoch": 1.2837580237307917, "grad_norm": 1.390625, "learning_rate": 0.0004837960834504206, "loss": 5.204, "mean_token_accuracy": 0.18109429329633714, "num_tokens": 28620142.0, "step": 16500 }, { "entropy": 5.512625360488892, "epoch": 1.2841470531025092, "grad_norm": 1.671875, "learning_rate": 0.0004837857543858341, "loss": 5.3326, "mean_token_accuracy": 0.17388014048337935, "num_tokens": 28629401.0, "step": 16505 }, { "entropy": 5.537943506240845, "epoch": 1.2845360824742267, "grad_norm": 1.5078125, "learning_rate": 0.0004837754221532561, "loss": 5.2438, "mean_token_accuracy": 0.17308045625686647, "num_tokens": 28637934.0, "step": 16510 }, { "entropy": 5.494345378875733, "epoch": 1.2849251118459444, "grad_norm": 1.6484375, "learning_rate": 0.00048376508675284334, "loss": 5.2738, "mean_token_accuracy": 0.17197916358709336, "num_tokens": 28647145.0, "step": 16515 }, { "entropy": 5.511820554733276, "epoch": 1.2853141412176619, "grad_norm": 1.4609375, "learning_rate": 0.00048375474818475274, "loss": 5.348, "mean_token_accuracy": 0.16744939982891083, "num_tokens": 28656146.0, "step": 16520 }, { "entropy": 5.521165418624878, "epoch": 1.2857031705893796, "grad_norm": 1.4609375, "learning_rate": 0.00048374440644914104, "loss": 5.1696, "mean_token_accuracy": 0.17831232994794846, "num_tokens": 28664476.0, "step": 16525 }, { "entropy": 5.506192064285278, "epoch": 1.286092199961097, "grad_norm": 1.5078125, "learning_rate": 0.00048373406154616523, "loss": 5.1949, "mean_token_accuracy": 0.1829805016517639, "num_tokens": 28672188.0, "step": 16530 }, { "entropy": 5.4434877872467045, "epoch": 1.2864812293328147, "grad_norm": 1.390625, "learning_rate": 0.00048372371347598226, "loss": 5.2932, "mean_token_accuracy": 0.17740696519613267, "num_tokens": 28680758.0, "step": 16535 }, { "entropy": 5.660080194473267, "epoch": 1.2868702587045322, "grad_norm": 2.515625, "learning_rate": 0.00048371336223874923, "loss": 5.4143, "mean_token_accuracy": 0.16645713970065118, "num_tokens": 28690392.0, "step": 16540 }, { "entropy": 5.547315073013306, "epoch": 1.2872592880762497, "grad_norm": 1.359375, "learning_rate": 0.000483703007834623, "loss": 5.2844, "mean_token_accuracy": 0.16991337090730668, "num_tokens": 28699121.0, "step": 16545 }, { "entropy": 5.575688982009888, "epoch": 1.2876483174479674, "grad_norm": 1.8046875, "learning_rate": 0.0004836926502637609, "loss": 5.3706, "mean_token_accuracy": 0.1695497527718544, "num_tokens": 28707692.0, "step": 16550 }, { "entropy": 5.533820629119873, "epoch": 1.2880373468196848, "grad_norm": 1.46875, "learning_rate": 0.00048368228952632005, "loss": 5.3026, "mean_token_accuracy": 0.17484888136386872, "num_tokens": 28716630.0, "step": 16555 }, { "entropy": 5.501118946075439, "epoch": 1.2884263761914023, "grad_norm": 1.5, "learning_rate": 0.00048367192562245756, "loss": 5.1848, "mean_token_accuracy": 0.18588481545448304, "num_tokens": 28725503.0, "step": 16560 }, { "entropy": 5.552927112579345, "epoch": 1.28881540556312, "grad_norm": 1.5625, "learning_rate": 0.00048366155855233067, "loss": 5.3029, "mean_token_accuracy": 0.17311994433403016, "num_tokens": 28734578.0, "step": 16565 }, { "entropy": 5.5685888767242435, "epoch": 1.2892044349348377, "grad_norm": 1.5703125, "learning_rate": 0.0004836511883160968, "loss": 5.3426, "mean_token_accuracy": 0.1714356303215027, "num_tokens": 28743380.0, "step": 16570 }, { "entropy": 5.557417201995849, "epoch": 1.2895934643065552, "grad_norm": 1.5, "learning_rate": 0.0004836408149139133, "loss": 5.3036, "mean_token_accuracy": 0.1725929245352745, "num_tokens": 28752968.0, "step": 16575 }, { "entropy": 5.508104467391968, "epoch": 1.2899824936782727, "grad_norm": 1.625, "learning_rate": 0.00048363043834593743, "loss": 5.3067, "mean_token_accuracy": 0.16962089091539384, "num_tokens": 28761756.0, "step": 16580 }, { "entropy": 5.504446744918823, "epoch": 1.2903715230499904, "grad_norm": 1.3828125, "learning_rate": 0.0004836200586123268, "loss": 5.2552, "mean_token_accuracy": 0.17421442717313768, "num_tokens": 28771110.0, "step": 16585 }, { "entropy": 5.55663275718689, "epoch": 1.2907605524217078, "grad_norm": 1.5703125, "learning_rate": 0.00048360967571323875, "loss": 5.3467, "mean_token_accuracy": 0.16930615156888962, "num_tokens": 28780016.0, "step": 16590 }, { "entropy": 5.547071695327759, "epoch": 1.2911495817934253, "grad_norm": 1.28125, "learning_rate": 0.00048359928964883094, "loss": 5.2443, "mean_token_accuracy": 0.1836158812046051, "num_tokens": 28788150.0, "step": 16595 }, { "entropy": 5.515267848968506, "epoch": 1.291538611165143, "grad_norm": 1.375, "learning_rate": 0.000483588900419261, "loss": 5.2265, "mean_token_accuracy": 0.17374784201383592, "num_tokens": 28796564.0, "step": 16600 }, { "entropy": 5.6450110912323, "epoch": 1.2919276405368605, "grad_norm": 1.484375, "learning_rate": 0.0004835785080246864, "loss": 5.471, "mean_token_accuracy": 0.16478035002946853, "num_tokens": 28804987.0, "step": 16605 }, { "entropy": 5.577270603179931, "epoch": 1.292316669908578, "grad_norm": 1.34375, "learning_rate": 0.000483568112465265, "loss": 5.2501, "mean_token_accuracy": 0.17944055646657944, "num_tokens": 28813752.0, "step": 16610 }, { "entropy": 5.407899522781372, "epoch": 1.2927056992802957, "grad_norm": 1.5, "learning_rate": 0.00048355771374115436, "loss": 5.1681, "mean_token_accuracy": 0.18100990802049638, "num_tokens": 28822464.0, "step": 16615 }, { "entropy": 5.464084005355835, "epoch": 1.2930947286520134, "grad_norm": 1.359375, "learning_rate": 0.0004835473118525125, "loss": 5.2223, "mean_token_accuracy": 0.1792286142706871, "num_tokens": 28830997.0, "step": 16620 }, { "entropy": 5.505066299438477, "epoch": 1.2934837580237308, "grad_norm": 1.4140625, "learning_rate": 0.0004835369067994971, "loss": 5.1946, "mean_token_accuracy": 0.1861805021762848, "num_tokens": 28839979.0, "step": 16625 }, { "entropy": 5.517421722412109, "epoch": 1.2938727873954483, "grad_norm": 1.375, "learning_rate": 0.000483526498582266, "loss": 5.2183, "mean_token_accuracy": 0.1755661517381668, "num_tokens": 28848394.0, "step": 16630 }, { "entropy": 5.651650047302246, "epoch": 1.294261816767166, "grad_norm": 2.0625, "learning_rate": 0.00048351608720097715, "loss": 5.5204, "mean_token_accuracy": 0.16302997022867202, "num_tokens": 28857804.0, "step": 16635 }, { "entropy": 5.5143248558044435, "epoch": 1.2946508461388835, "grad_norm": 1.3125, "learning_rate": 0.00048350567265578867, "loss": 5.1797, "mean_token_accuracy": 0.17618067264556886, "num_tokens": 28866405.0, "step": 16640 }, { "entropy": 5.540298795700073, "epoch": 1.295039875510601, "grad_norm": 1.5234375, "learning_rate": 0.0004834952549468584, "loss": 5.2881, "mean_token_accuracy": 0.1797433838248253, "num_tokens": 28874751.0, "step": 16645 }, { "entropy": 5.561378765106201, "epoch": 1.2954289048823187, "grad_norm": 1.7421875, "learning_rate": 0.0004834848340743446, "loss": 5.3932, "mean_token_accuracy": 0.16223286539316178, "num_tokens": 28884013.0, "step": 16650 }, { "entropy": 5.54998459815979, "epoch": 1.2958179342540361, "grad_norm": 1.515625, "learning_rate": 0.0004834744100384052, "loss": 5.1959, "mean_token_accuracy": 0.17620742470026016, "num_tokens": 28892175.0, "step": 16655 }, { "entropy": 5.581575584411621, "epoch": 1.2962069636257538, "grad_norm": 1.6875, "learning_rate": 0.0004834639828391984, "loss": 5.2577, "mean_token_accuracy": 0.1740424305200577, "num_tokens": 28901238.0, "step": 16660 }, { "entropy": 5.525385522842408, "epoch": 1.2965959929974713, "grad_norm": 1.4296875, "learning_rate": 0.00048345355247688256, "loss": 5.2794, "mean_token_accuracy": 0.17541230767965316, "num_tokens": 28910368.0, "step": 16665 }, { "entropy": 5.548087453842163, "epoch": 1.296985022369189, "grad_norm": 1.59375, "learning_rate": 0.0004834431189516158, "loss": 5.3785, "mean_token_accuracy": 0.16417302042245865, "num_tokens": 28918854.0, "step": 16670 }, { "entropy": 5.560145330429077, "epoch": 1.2973740517409065, "grad_norm": 1.6953125, "learning_rate": 0.0004834326822635565, "loss": 5.2917, "mean_token_accuracy": 0.17520996034145356, "num_tokens": 28927103.0, "step": 16675 }, { "entropy": 5.516687202453613, "epoch": 1.297763081112624, "grad_norm": 1.4921875, "learning_rate": 0.00048342224241286296, "loss": 5.2083, "mean_token_accuracy": 0.1745814263820648, "num_tokens": 28936257.0, "step": 16680 }, { "entropy": 5.634287881851196, "epoch": 1.2981521104843416, "grad_norm": 1.46875, "learning_rate": 0.0004834117993996937, "loss": 5.3561, "mean_token_accuracy": 0.1687796711921692, "num_tokens": 28944991.0, "step": 16685 }, { "entropy": 5.563974905014038, "epoch": 1.2985411398560591, "grad_norm": 1.7734375, "learning_rate": 0.0004834013532242071, "loss": 5.3248, "mean_token_accuracy": 0.17341580390930175, "num_tokens": 28953781.0, "step": 16690 }, { "entropy": 5.552775430679321, "epoch": 1.2989301692277766, "grad_norm": 1.4453125, "learning_rate": 0.0004833909038865616, "loss": 5.2094, "mean_token_accuracy": 0.1797615483403206, "num_tokens": 28961916.0, "step": 16695 }, { "entropy": 5.501725149154663, "epoch": 1.2993191985994943, "grad_norm": 1.46875, "learning_rate": 0.0004833804513869159, "loss": 5.2453, "mean_token_accuracy": 0.17446848303079604, "num_tokens": 28970223.0, "step": 16700 }, { "entropy": 5.497382974624633, "epoch": 1.2997082279712118, "grad_norm": 1.4296875, "learning_rate": 0.0004833699957254284, "loss": 5.2919, "mean_token_accuracy": 0.17867342829704286, "num_tokens": 28979063.0, "step": 16705 }, { "entropy": 5.640632677078247, "epoch": 1.3000972573429295, "grad_norm": 1.796875, "learning_rate": 0.000483359536902258, "loss": 5.3819, "mean_token_accuracy": 0.1725120261311531, "num_tokens": 28987229.0, "step": 16710 }, { "entropy": 5.578525114059448, "epoch": 1.300486286714647, "grad_norm": 1.71875, "learning_rate": 0.0004833490749175632, "loss": 5.3407, "mean_token_accuracy": 0.1683332324028015, "num_tokens": 28995889.0, "step": 16715 }, { "entropy": 5.548509788513184, "epoch": 1.3008753160863646, "grad_norm": 1.421875, "learning_rate": 0.00048333860977150286, "loss": 5.3387, "mean_token_accuracy": 0.16908127963542938, "num_tokens": 29003962.0, "step": 16720 }, { "entropy": 5.508148670196533, "epoch": 1.3012643454580821, "grad_norm": 1.4140625, "learning_rate": 0.00048332814146423566, "loss": 5.2254, "mean_token_accuracy": 0.17627947479486467, "num_tokens": 29012652.0, "step": 16725 }, { "entropy": 5.631994438171387, "epoch": 1.3016533748297996, "grad_norm": 1.6328125, "learning_rate": 0.0004833176699959206, "loss": 5.3728, "mean_token_accuracy": 0.16163735389709472, "num_tokens": 29022445.0, "step": 16730 }, { "entropy": 5.546034574508667, "epoch": 1.3020424042015173, "grad_norm": 1.359375, "learning_rate": 0.00048330719536671633, "loss": 5.2529, "mean_token_accuracy": 0.16912207007408142, "num_tokens": 29030840.0, "step": 16735 }, { "entropy": 5.568957138061523, "epoch": 1.3024314335732348, "grad_norm": 1.421875, "learning_rate": 0.000483296717576782, "loss": 5.3078, "mean_token_accuracy": 0.1755591794848442, "num_tokens": 29039640.0, "step": 16740 }, { "entropy": 5.448435497283936, "epoch": 1.3028204629449522, "grad_norm": 1.8203125, "learning_rate": 0.0004832862366262765, "loss": 5.2497, "mean_token_accuracy": 0.17302780151367186, "num_tokens": 29047793.0, "step": 16745 }, { "entropy": 5.486004590988159, "epoch": 1.30320949231667, "grad_norm": 1.453125, "learning_rate": 0.00048327575251535886, "loss": 5.2357, "mean_token_accuracy": 0.17673268914222717, "num_tokens": 29056880.0, "step": 16750 }, { "entropy": 5.54179105758667, "epoch": 1.3035985216883874, "grad_norm": 1.578125, "learning_rate": 0.0004832652652441883, "loss": 5.2527, "mean_token_accuracy": 0.17667125761508942, "num_tokens": 29065093.0, "step": 16755 }, { "entropy": 5.474070596694946, "epoch": 1.303987551060105, "grad_norm": 1.4296875, "learning_rate": 0.00048325477481292375, "loss": 5.3188, "mean_token_accuracy": 0.17161299139261246, "num_tokens": 29074389.0, "step": 16760 }, { "entropy": 5.413042831420898, "epoch": 1.3043765804318226, "grad_norm": 1.703125, "learning_rate": 0.0004832442812217244, "loss": 5.1535, "mean_token_accuracy": 0.17977993041276932, "num_tokens": 29082789.0, "step": 16765 }, { "entropy": 5.587252378463745, "epoch": 1.3047656098035403, "grad_norm": 1.421875, "learning_rate": 0.0004832337844707496, "loss": 5.4247, "mean_token_accuracy": 0.16643834859132767, "num_tokens": 29092831.0, "step": 16770 }, { "entropy": 5.458986759185791, "epoch": 1.3051546391752578, "grad_norm": 1.4765625, "learning_rate": 0.00048322328456015855, "loss": 5.1172, "mean_token_accuracy": 0.1841055527329445, "num_tokens": 29101067.0, "step": 16775 }, { "entropy": 5.520122098922729, "epoch": 1.3055436685469752, "grad_norm": 1.59375, "learning_rate": 0.00048321278149011053, "loss": 5.2925, "mean_token_accuracy": 0.1647133469581604, "num_tokens": 29110423.0, "step": 16780 }, { "entropy": 5.515471601486206, "epoch": 1.305932697918693, "grad_norm": 1.3203125, "learning_rate": 0.00048320227526076504, "loss": 5.2013, "mean_token_accuracy": 0.17780290842056273, "num_tokens": 29119508.0, "step": 16785 }, { "entropy": 5.467047166824341, "epoch": 1.3063217272904104, "grad_norm": 1.546875, "learning_rate": 0.0004831917658722814, "loss": 5.2822, "mean_token_accuracy": 0.1781074270606041, "num_tokens": 29127899.0, "step": 16790 }, { "entropy": 5.554867172241211, "epoch": 1.3067107566621279, "grad_norm": 1.53125, "learning_rate": 0.00048318125332481903, "loss": 5.3227, "mean_token_accuracy": 0.17663970291614534, "num_tokens": 29137261.0, "step": 16795 }, { "entropy": 5.5556189060211185, "epoch": 1.3070997860338456, "grad_norm": 1.4296875, "learning_rate": 0.00048317073761853764, "loss": 5.3536, "mean_token_accuracy": 0.17130178213119507, "num_tokens": 29145439.0, "step": 16800 }, { "entropy": 5.542152452468872, "epoch": 1.307488815405563, "grad_norm": 1.4453125, "learning_rate": 0.0004831602187535965, "loss": 5.3811, "mean_token_accuracy": 0.16846368610858917, "num_tokens": 29153871.0, "step": 16805 }, { "entropy": 5.494944667816162, "epoch": 1.3078778447772808, "grad_norm": 1.5390625, "learning_rate": 0.0004831496967301554, "loss": 5.219, "mean_token_accuracy": 0.17613357603549956, "num_tokens": 29162343.0, "step": 16810 }, { "entropy": 5.4702600002288815, "epoch": 1.3082668741489982, "grad_norm": 1.4375, "learning_rate": 0.00048313917154837386, "loss": 5.2666, "mean_token_accuracy": 0.1772501453757286, "num_tokens": 29170533.0, "step": 16815 }, { "entropy": 5.483978128433227, "epoch": 1.308655903520716, "grad_norm": 1.390625, "learning_rate": 0.0004831286432084118, "loss": 5.3002, "mean_token_accuracy": 0.17461176365613937, "num_tokens": 29179353.0, "step": 16820 }, { "entropy": 5.505611944198608, "epoch": 1.3090449328924334, "grad_norm": 1.3984375, "learning_rate": 0.0004831181117104289, "loss": 5.2637, "mean_token_accuracy": 0.16662295609712602, "num_tokens": 29188747.0, "step": 16825 }, { "entropy": 5.509248971939087, "epoch": 1.3094339622641509, "grad_norm": 1.546875, "learning_rate": 0.00048310757705458476, "loss": 5.2485, "mean_token_accuracy": 0.17222723960876465, "num_tokens": 29197302.0, "step": 16830 }, { "entropy": 5.496852779388428, "epoch": 1.3098229916358686, "grad_norm": 1.46875, "learning_rate": 0.00048309703924103944, "loss": 5.2638, "mean_token_accuracy": 0.17514885365962982, "num_tokens": 29205667.0, "step": 16835 }, { "entropy": 5.606069326400757, "epoch": 1.310212021007586, "grad_norm": 1.3828125, "learning_rate": 0.00048308649826995283, "loss": 5.331, "mean_token_accuracy": 0.1714055135846138, "num_tokens": 29214475.0, "step": 16840 }, { "entropy": 5.485038614273071, "epoch": 1.3106010503793035, "grad_norm": 1.4296875, "learning_rate": 0.00048307595414148475, "loss": 5.2256, "mean_token_accuracy": 0.1753092348575592, "num_tokens": 29222990.0, "step": 16845 }, { "entropy": 5.500304174423218, "epoch": 1.3109900797510212, "grad_norm": 1.4140625, "learning_rate": 0.0004830654068557952, "loss": 5.351, "mean_token_accuracy": 0.17122073471546173, "num_tokens": 29232351.0, "step": 16850 }, { "entropy": 5.591643857955932, "epoch": 1.3113791091227387, "grad_norm": 1.4609375, "learning_rate": 0.0004830548564130444, "loss": 5.2175, "mean_token_accuracy": 0.17079212963581086, "num_tokens": 29240418.0, "step": 16855 }, { "entropy": 5.58412914276123, "epoch": 1.3117681384944564, "grad_norm": 1.453125, "learning_rate": 0.00048304430281339216, "loss": 5.3266, "mean_token_accuracy": 0.17036605775356292, "num_tokens": 29248975.0, "step": 16860 }, { "entropy": 5.466780281066894, "epoch": 1.3121571678661739, "grad_norm": 1.4609375, "learning_rate": 0.0004830337460569989, "loss": 5.299, "mean_token_accuracy": 0.16868091225624085, "num_tokens": 29257866.0, "step": 16865 }, { "entropy": 5.447692203521728, "epoch": 1.3125461972378916, "grad_norm": 1.7421875, "learning_rate": 0.0004830231861440246, "loss": 5.0762, "mean_token_accuracy": 0.19014528691768645, "num_tokens": 29266057.0, "step": 16870 }, { "entropy": 5.472238826751709, "epoch": 1.312935226609609, "grad_norm": 1.4609375, "learning_rate": 0.0004830126230746295, "loss": 5.2396, "mean_token_accuracy": 0.17188325077295302, "num_tokens": 29274752.0, "step": 16875 }, { "entropy": 5.591193723678589, "epoch": 1.3133242559813265, "grad_norm": 1.3984375, "learning_rate": 0.00048300205684897405, "loss": 5.2972, "mean_token_accuracy": 0.17175144106149673, "num_tokens": 29282781.0, "step": 16880 }, { "entropy": 5.4347821235656735, "epoch": 1.3137132853530442, "grad_norm": 1.6171875, "learning_rate": 0.0004829914874672184, "loss": 5.2579, "mean_token_accuracy": 0.1727503716945648, "num_tokens": 29291196.0, "step": 16885 }, { "entropy": 5.507078647613525, "epoch": 1.3141023147247617, "grad_norm": 1.3671875, "learning_rate": 0.00048298091492952297, "loss": 5.3608, "mean_token_accuracy": 0.17136398255825042, "num_tokens": 29300168.0, "step": 16890 }, { "entropy": 5.51510066986084, "epoch": 1.3144913440964792, "grad_norm": 1.546875, "learning_rate": 0.0004829703392360482, "loss": 5.1742, "mean_token_accuracy": 0.17384043484926223, "num_tokens": 29308468.0, "step": 16895 }, { "entropy": 5.42665958404541, "epoch": 1.3148803734681969, "grad_norm": 1.625, "learning_rate": 0.00048295976038695455, "loss": 5.1956, "mean_token_accuracy": 0.1762784630060196, "num_tokens": 29317096.0, "step": 16900 }, { "entropy": 5.507435703277588, "epoch": 1.3152694028399143, "grad_norm": 1.5703125, "learning_rate": 0.0004829491783824025, "loss": 5.3237, "mean_token_accuracy": 0.16330843567848205, "num_tokens": 29325840.0, "step": 16905 }, { "entropy": 5.528168678283691, "epoch": 1.315658432211632, "grad_norm": 1.7265625, "learning_rate": 0.00048293859322255276, "loss": 5.2574, "mean_token_accuracy": 0.17604086101055144, "num_tokens": 29333874.0, "step": 16910 }, { "entropy": 5.513610696792602, "epoch": 1.3160474615833495, "grad_norm": 1.8359375, "learning_rate": 0.0004829280049075657, "loss": 5.1969, "mean_token_accuracy": 0.17857919931411742, "num_tokens": 29341937.0, "step": 16915 }, { "entropy": 5.604503917694092, "epoch": 1.3164364909550672, "grad_norm": 1.5, "learning_rate": 0.00048291741343760216, "loss": 5.4431, "mean_token_accuracy": 0.16034996807575225, "num_tokens": 29350231.0, "step": 16920 }, { "entropy": 5.566038799285889, "epoch": 1.3168255203267847, "grad_norm": 1.5625, "learning_rate": 0.0004829068188128229, "loss": 5.291, "mean_token_accuracy": 0.17317449748516084, "num_tokens": 29359036.0, "step": 16925 }, { "entropy": 5.547137355804443, "epoch": 1.3172145496985022, "grad_norm": 1.5234375, "learning_rate": 0.0004828962210333885, "loss": 5.2173, "mean_token_accuracy": 0.17305073589086534, "num_tokens": 29368063.0, "step": 16930 }, { "entropy": 5.5168146133422855, "epoch": 1.3176035790702199, "grad_norm": 1.7734375, "learning_rate": 0.0004828856200994598, "loss": 5.1926, "mean_token_accuracy": 0.1722488895058632, "num_tokens": 29376653.0, "step": 16935 }, { "entropy": 5.454179811477661, "epoch": 1.3179926084419373, "grad_norm": 1.4921875, "learning_rate": 0.0004828750160111978, "loss": 5.1639, "mean_token_accuracy": 0.1818734660744667, "num_tokens": 29384978.0, "step": 16940 }, { "entropy": 5.557752084732056, "epoch": 1.3183816378136548, "grad_norm": 1.359375, "learning_rate": 0.00048286440876876325, "loss": 5.3509, "mean_token_accuracy": 0.16898144632577897, "num_tokens": 29393927.0, "step": 16945 }, { "entropy": 5.617773962020874, "epoch": 1.3187706671853725, "grad_norm": 1.46875, "learning_rate": 0.00048285379837231714, "loss": 5.3688, "mean_token_accuracy": 0.17309068590402604, "num_tokens": 29402393.0, "step": 16950 }, { "entropy": 5.540349960327148, "epoch": 1.31915969655709, "grad_norm": 1.4921875, "learning_rate": 0.0004828431848220205, "loss": 5.2691, "mean_token_accuracy": 0.17470085322856904, "num_tokens": 29411011.0, "step": 16955 }, { "entropy": 5.511628770828247, "epoch": 1.3195487259288077, "grad_norm": 1.53125, "learning_rate": 0.0004828325681180343, "loss": 5.3238, "mean_token_accuracy": 0.17451790273189544, "num_tokens": 29420095.0, "step": 16960 }, { "entropy": 5.499999713897705, "epoch": 1.3199377553005252, "grad_norm": 1.5859375, "learning_rate": 0.0004828219482605197, "loss": 5.2824, "mean_token_accuracy": 0.1737119346857071, "num_tokens": 29429274.0, "step": 16965 }, { "entropy": 5.573909902572632, "epoch": 1.3203267846722428, "grad_norm": 1.7578125, "learning_rate": 0.00048281132524963786, "loss": 5.2599, "mean_token_accuracy": 0.1712793916463852, "num_tokens": 29437572.0, "step": 16970 }, { "entropy": 5.572024631500244, "epoch": 1.3207158140439603, "grad_norm": 1.8828125, "learning_rate": 0.0004828006990855499, "loss": 5.3103, "mean_token_accuracy": 0.1769681081175804, "num_tokens": 29446294.0, "step": 16975 }, { "entropy": 5.498513841629029, "epoch": 1.3211048434156778, "grad_norm": 1.3984375, "learning_rate": 0.00048279006976841704, "loss": 5.2685, "mean_token_accuracy": 0.17740708738565444, "num_tokens": 29454710.0, "step": 16980 }, { "entropy": 5.525652360916138, "epoch": 1.3214938727873955, "grad_norm": 1.453125, "learning_rate": 0.0004827794372984007, "loss": 5.2778, "mean_token_accuracy": 0.1790226951241493, "num_tokens": 29463067.0, "step": 16985 }, { "entropy": 5.546511125564575, "epoch": 1.321882902159113, "grad_norm": 1.5234375, "learning_rate": 0.000482768801675662, "loss": 5.2809, "mean_token_accuracy": 0.16328697949647902, "num_tokens": 29471636.0, "step": 16990 }, { "entropy": 5.566883897781372, "epoch": 1.3222719315308304, "grad_norm": 1.5859375, "learning_rate": 0.0004827581629003625, "loss": 5.2979, "mean_token_accuracy": 0.17054706811904907, "num_tokens": 29480772.0, "step": 16995 }, { "entropy": 5.467402076721191, "epoch": 1.3226609609025481, "grad_norm": 1.34375, "learning_rate": 0.00048274752097266356, "loss": 5.2057, "mean_token_accuracy": 0.17657761573791503, "num_tokens": 29489113.0, "step": 17000 }, { "entropy": 5.5701793193817135, "epoch": 1.3230499902742658, "grad_norm": 1.4453125, "learning_rate": 0.0004827368758927266, "loss": 5.2834, "mean_token_accuracy": 0.16945007741451262, "num_tokens": 29497721.0, "step": 17005 }, { "entropy": 5.523563241958618, "epoch": 1.3234390196459833, "grad_norm": 1.7109375, "learning_rate": 0.0004827262276607132, "loss": 5.2763, "mean_token_accuracy": 0.17571234554052353, "num_tokens": 29506452.0, "step": 17010 }, { "entropy": 5.52751932144165, "epoch": 1.3238280490177008, "grad_norm": 1.40625, "learning_rate": 0.000482715576276785, "loss": 5.2437, "mean_token_accuracy": 0.17883221805095673, "num_tokens": 29514635.0, "step": 17015 }, { "entropy": 5.543888664245605, "epoch": 1.3242170783894185, "grad_norm": 1.625, "learning_rate": 0.0004827049217411035, "loss": 5.3094, "mean_token_accuracy": 0.17182139605283736, "num_tokens": 29523929.0, "step": 17020 }, { "entropy": 5.5267242908477785, "epoch": 1.324606107761136, "grad_norm": 1.4921875, "learning_rate": 0.00048269426405383043, "loss": 5.2353, "mean_token_accuracy": 0.17125312238931656, "num_tokens": 29533125.0, "step": 17025 }, { "entropy": 5.51857590675354, "epoch": 1.3249951371328534, "grad_norm": 1.6171875, "learning_rate": 0.00048268360321512745, "loss": 5.241, "mean_token_accuracy": 0.1842625692486763, "num_tokens": 29541604.0, "step": 17030 }, { "entropy": 5.5429747104644775, "epoch": 1.3253841665045711, "grad_norm": 1.3984375, "learning_rate": 0.0004826729392251564, "loss": 5.2495, "mean_token_accuracy": 0.17560553252696992, "num_tokens": 29550100.0, "step": 17035 }, { "entropy": 5.497852230072022, "epoch": 1.3257731958762886, "grad_norm": 1.515625, "learning_rate": 0.000482662272084079, "loss": 5.3096, "mean_token_accuracy": 0.17464201301336288, "num_tokens": 29559490.0, "step": 17040 }, { "entropy": 5.578866386413575, "epoch": 1.326162225248006, "grad_norm": 1.546875, "learning_rate": 0.0004826516017920571, "loss": 5.3156, "mean_token_accuracy": 0.1663801148533821, "num_tokens": 29568734.0, "step": 17045 }, { "entropy": 5.558235454559326, "epoch": 1.3265512546197238, "grad_norm": 1.4921875, "learning_rate": 0.0004826409283492528, "loss": 5.3005, "mean_token_accuracy": 0.16661880016326905, "num_tokens": 29577339.0, "step": 17050 }, { "entropy": 5.594893550872802, "epoch": 1.3269402839914415, "grad_norm": 1.5546875, "learning_rate": 0.00048263025175582783, "loss": 5.4069, "mean_token_accuracy": 0.17300795316696166, "num_tokens": 29585561.0, "step": 17055 }, { "entropy": 5.532519292831421, "epoch": 1.327329313363159, "grad_norm": 1.3671875, "learning_rate": 0.0004826195720119442, "loss": 5.3405, "mean_token_accuracy": 0.1671331435441971, "num_tokens": 29594663.0, "step": 17060 }, { "entropy": 5.562968492507935, "epoch": 1.3277183427348764, "grad_norm": 1.546875, "learning_rate": 0.0004826088891177641, "loss": 5.2927, "mean_token_accuracy": 0.17947182208299636, "num_tokens": 29603537.0, "step": 17065 }, { "entropy": 5.561071825027466, "epoch": 1.3281073721065941, "grad_norm": 1.3984375, "learning_rate": 0.00048259820307344954, "loss": 5.3108, "mean_token_accuracy": 0.1721128538250923, "num_tokens": 29612234.0, "step": 17070 }, { "entropy": 5.477893447875976, "epoch": 1.3284964014783116, "grad_norm": 1.3984375, "learning_rate": 0.00048258751387916267, "loss": 5.1261, "mean_token_accuracy": 0.17609235048294067, "num_tokens": 29621435.0, "step": 17075 }, { "entropy": 5.65094404220581, "epoch": 1.328885430850029, "grad_norm": 1.46875, "learning_rate": 0.00048257682153506564, "loss": 5.4109, "mean_token_accuracy": 0.16384723782539368, "num_tokens": 29630266.0, "step": 17080 }, { "entropy": 5.425221300125122, "epoch": 1.3292744602217468, "grad_norm": 1.8671875, "learning_rate": 0.0004825661260413208, "loss": 5.2022, "mean_token_accuracy": 0.17390880286693572, "num_tokens": 29639118.0, "step": 17085 }, { "entropy": 5.5009173393249515, "epoch": 1.3296634895934643, "grad_norm": 1.5859375, "learning_rate": 0.00048255542739809035, "loss": 5.2909, "mean_token_accuracy": 0.1802072197198868, "num_tokens": 29647616.0, "step": 17090 }, { "entropy": 5.591170930862427, "epoch": 1.330052518965182, "grad_norm": 1.34375, "learning_rate": 0.00048254472560553665, "loss": 5.2439, "mean_token_accuracy": 0.175567227602005, "num_tokens": 29656264.0, "step": 17095 }, { "entropy": 5.540565347671508, "epoch": 1.3304415483368994, "grad_norm": 1.4140625, "learning_rate": 0.00048253402066382207, "loss": 5.2545, "mean_token_accuracy": 0.17449957877397537, "num_tokens": 29664452.0, "step": 17100 }, { "entropy": 5.520974826812744, "epoch": 1.3308305777086171, "grad_norm": 1.65625, "learning_rate": 0.0004825233125731091, "loss": 5.203, "mean_token_accuracy": 0.18167235553264618, "num_tokens": 29673456.0, "step": 17105 }, { "entropy": 5.562027359008789, "epoch": 1.3312196070803346, "grad_norm": 1.4375, "learning_rate": 0.00048251260133356014, "loss": 5.322, "mean_token_accuracy": 0.17192415595054628, "num_tokens": 29682232.0, "step": 17110 }, { "entropy": 5.454007339477539, "epoch": 1.331608636452052, "grad_norm": 1.5078125, "learning_rate": 0.00048250188694533774, "loss": 5.2339, "mean_token_accuracy": 0.17304678857326508, "num_tokens": 29690421.0, "step": 17115 }, { "entropy": 5.4780511379241945, "epoch": 1.3319976658237698, "grad_norm": 1.3984375, "learning_rate": 0.0004824911694086044, "loss": 5.2317, "mean_token_accuracy": 0.17659468501806258, "num_tokens": 29698844.0, "step": 17120 }, { "entropy": 5.552738618850708, "epoch": 1.3323866951954872, "grad_norm": 1.640625, "learning_rate": 0.000482480448723523, "loss": 5.2453, "mean_token_accuracy": 0.17272809147834778, "num_tokens": 29706738.0, "step": 17125 }, { "entropy": 5.552623605728149, "epoch": 1.3327757245672047, "grad_norm": 1.4765625, "learning_rate": 0.00048246972489025586, "loss": 5.3074, "mean_token_accuracy": 0.17191975116729735, "num_tokens": 29715812.0, "step": 17130 }, { "entropy": 5.46045331954956, "epoch": 1.3331647539389224, "grad_norm": 1.3984375, "learning_rate": 0.00048245899790896597, "loss": 5.2165, "mean_token_accuracy": 0.17677971422672273, "num_tokens": 29724488.0, "step": 17135 }, { "entropy": 5.487279272079467, "epoch": 1.33355378331064, "grad_norm": 1.578125, "learning_rate": 0.0004824482677798159, "loss": 5.1985, "mean_token_accuracy": 0.1763208717107773, "num_tokens": 29733565.0, "step": 17140 }, { "entropy": 5.503689336776733, "epoch": 1.3339428126823576, "grad_norm": 2.046875, "learning_rate": 0.00048243753450296863, "loss": 5.2947, "mean_token_accuracy": 0.17290622144937515, "num_tokens": 29742437.0, "step": 17145 }, { "entropy": 5.536953592300415, "epoch": 1.334331842054075, "grad_norm": 1.453125, "learning_rate": 0.00048242679807858693, "loss": 5.3139, "mean_token_accuracy": 0.1747690573334694, "num_tokens": 29751636.0, "step": 17150 }, { "entropy": 5.537477731704712, "epoch": 1.3347208714257928, "grad_norm": 1.5703125, "learning_rate": 0.00048241605850683365, "loss": 5.2542, "mean_token_accuracy": 0.17375836819410323, "num_tokens": 29760199.0, "step": 17155 }, { "entropy": 5.515740203857422, "epoch": 1.3351099007975102, "grad_norm": 1.484375, "learning_rate": 0.00048240531578787197, "loss": 5.2316, "mean_token_accuracy": 0.17604660391807556, "num_tokens": 29769169.0, "step": 17160 }, { "entropy": 5.492473697662353, "epoch": 1.3354989301692277, "grad_norm": 1.5390625, "learning_rate": 0.0004823945699218647, "loss": 5.2275, "mean_token_accuracy": 0.18034135401248932, "num_tokens": 29777218.0, "step": 17165 }, { "entropy": 5.518818998336792, "epoch": 1.3358879595409454, "grad_norm": 1.5625, "learning_rate": 0.0004823838209089749, "loss": 5.2612, "mean_token_accuracy": 0.17358344197273254, "num_tokens": 29786221.0, "step": 17170 }, { "entropy": 5.551379585266114, "epoch": 1.3362769889126629, "grad_norm": 1.40625, "learning_rate": 0.00048237306874936565, "loss": 5.287, "mean_token_accuracy": 0.1712179586291313, "num_tokens": 29794659.0, "step": 17175 }, { "entropy": 5.61849308013916, "epoch": 1.3366660182843804, "grad_norm": 5.21875, "learning_rate": 0.0004823623134432001, "loss": 5.2747, "mean_token_accuracy": 0.17288178503513335, "num_tokens": 29804237.0, "step": 17180 }, { "entropy": 5.625817441940308, "epoch": 1.337055047656098, "grad_norm": 1.390625, "learning_rate": 0.00048235155499064166, "loss": 5.3764, "mean_token_accuracy": 0.17292446345090867, "num_tokens": 29813521.0, "step": 17185 }, { "entropy": 5.567737722396851, "epoch": 1.3374440770278155, "grad_norm": 1.4765625, "learning_rate": 0.00048234079339185335, "loss": 5.4118, "mean_token_accuracy": 0.16924850791692733, "num_tokens": 29822123.0, "step": 17190 }, { "entropy": 5.562762832641601, "epoch": 1.3378331063995332, "grad_norm": 1.4296875, "learning_rate": 0.00048233002864699856, "loss": 5.3288, "mean_token_accuracy": 0.17189282029867173, "num_tokens": 29830557.0, "step": 17195 }, { "entropy": 5.525648307800293, "epoch": 1.3382221357712507, "grad_norm": 1.5078125, "learning_rate": 0.0004823192607562405, "loss": 5.2644, "mean_token_accuracy": 0.1800930082798004, "num_tokens": 29839566.0, "step": 17200 }, { "entropy": 5.547825002670288, "epoch": 1.3386111651429684, "grad_norm": 1.328125, "learning_rate": 0.00048230848971974265, "loss": 5.2257, "mean_token_accuracy": 0.18331782519817352, "num_tokens": 29847808.0, "step": 17205 }, { "entropy": 5.5210363388061525, "epoch": 1.3390001945146859, "grad_norm": 1.5, "learning_rate": 0.0004822977155376684, "loss": 5.1894, "mean_token_accuracy": 0.1824951261281967, "num_tokens": 29855974.0, "step": 17210 }, { "entropy": 5.562961387634277, "epoch": 1.3393892238864034, "grad_norm": 1.6796875, "learning_rate": 0.0004822869382101814, "loss": 5.3489, "mean_token_accuracy": 0.1708719938993454, "num_tokens": 29864910.0, "step": 17215 }, { "entropy": 5.619733810424805, "epoch": 1.339778253258121, "grad_norm": 1.53125, "learning_rate": 0.0004822761577374449, "loss": 5.4062, "mean_token_accuracy": 0.17142790108919143, "num_tokens": 29873668.0, "step": 17220 }, { "entropy": 5.568241596221924, "epoch": 1.3401672826298385, "grad_norm": 1.453125, "learning_rate": 0.0004822653741196227, "loss": 5.3239, "mean_token_accuracy": 0.17096898704767227, "num_tokens": 29882099.0, "step": 17225 }, { "entropy": 5.517499160766602, "epoch": 1.340556312001556, "grad_norm": 1.6171875, "learning_rate": 0.0004822545873568783, "loss": 5.2333, "mean_token_accuracy": 0.1769474998116493, "num_tokens": 29891022.0, "step": 17230 }, { "entropy": 5.522295522689819, "epoch": 1.3409453413732737, "grad_norm": 1.40625, "learning_rate": 0.00048224379744937545, "loss": 5.2463, "mean_token_accuracy": 0.17085277736186982, "num_tokens": 29899270.0, "step": 17235 }, { "entropy": 5.584539270401001, "epoch": 1.3413343707449912, "grad_norm": 1.390625, "learning_rate": 0.00048223300439727783, "loss": 5.3713, "mean_token_accuracy": 0.170196969807148, "num_tokens": 29908183.0, "step": 17240 }, { "entropy": 5.534591436386108, "epoch": 1.3417234001167089, "grad_norm": 1.4375, "learning_rate": 0.00048222220820074926, "loss": 5.2891, "mean_token_accuracy": 0.1724605530500412, "num_tokens": 29917148.0, "step": 17245 }, { "entropy": 5.544017791748047, "epoch": 1.3421124294884264, "grad_norm": 1.46875, "learning_rate": 0.00048221140885995346, "loss": 5.2134, "mean_token_accuracy": 0.17335040271282195, "num_tokens": 29926251.0, "step": 17250 }, { "entropy": 5.555476951599121, "epoch": 1.342501458860144, "grad_norm": 1.40625, "learning_rate": 0.0004822006063750543, "loss": 5.3232, "mean_token_accuracy": 0.17271163016557695, "num_tokens": 29935000.0, "step": 17255 }, { "entropy": 5.517015266418457, "epoch": 1.3428904882318615, "grad_norm": 1.3984375, "learning_rate": 0.00048218980074621575, "loss": 5.1795, "mean_token_accuracy": 0.1885431557893753, "num_tokens": 29943046.0, "step": 17260 }, { "entropy": 5.550515747070312, "epoch": 1.343279517603579, "grad_norm": 1.5, "learning_rate": 0.00048217899197360183, "loss": 5.2784, "mean_token_accuracy": 0.17839820235967635, "num_tokens": 29952254.0, "step": 17265 }, { "entropy": 5.511128282546997, "epoch": 1.3436685469752967, "grad_norm": 1.4375, "learning_rate": 0.0004821681800573764, "loss": 5.2408, "mean_token_accuracy": 0.1727580949664116, "num_tokens": 29961458.0, "step": 17270 }, { "entropy": 5.537738084793091, "epoch": 1.3440575763470142, "grad_norm": 1.46875, "learning_rate": 0.0004821573649977036, "loss": 5.2193, "mean_token_accuracy": 0.17950380891561507, "num_tokens": 29969865.0, "step": 17275 }, { "entropy": 5.530964469909668, "epoch": 1.3444466057187316, "grad_norm": 1.3828125, "learning_rate": 0.00048214654679474753, "loss": 5.2639, "mean_token_accuracy": 0.17164423316717148, "num_tokens": 29978260.0, "step": 17280 }, { "entropy": 5.583264255523682, "epoch": 1.3448356350904493, "grad_norm": 1.4375, "learning_rate": 0.00048213572544867224, "loss": 5.4019, "mean_token_accuracy": 0.1712228015065193, "num_tokens": 29987528.0, "step": 17285 }, { "entropy": 5.540467214584351, "epoch": 1.3452246644621668, "grad_norm": 1.375, "learning_rate": 0.00048212490095964213, "loss": 5.2426, "mean_token_accuracy": 0.17255399823188783, "num_tokens": 29995991.0, "step": 17290 }, { "entropy": 5.555293083190918, "epoch": 1.3456136938338845, "grad_norm": 1.671875, "learning_rate": 0.0004821140733278212, "loss": 5.2137, "mean_token_accuracy": 0.17633496820926667, "num_tokens": 30004569.0, "step": 17295 }, { "entropy": 5.5175879955291744, "epoch": 1.346002723205602, "grad_norm": 1.4921875, "learning_rate": 0.0004821032425533739, "loss": 5.3079, "mean_token_accuracy": 0.17088200896978378, "num_tokens": 30014021.0, "step": 17300 }, { "entropy": 5.484115791320801, "epoch": 1.3463917525773197, "grad_norm": 1.546875, "learning_rate": 0.0004820924086364646, "loss": 5.1275, "mean_token_accuracy": 0.1816444516181946, "num_tokens": 30021803.0, "step": 17305 }, { "entropy": 5.4960136890411375, "epoch": 1.3467807819490372, "grad_norm": 1.390625, "learning_rate": 0.00048208157157725756, "loss": 5.275, "mean_token_accuracy": 0.17458716332912444, "num_tokens": 30030707.0, "step": 17310 }, { "entropy": 5.528691339492798, "epoch": 1.3471698113207546, "grad_norm": 1.671875, "learning_rate": 0.00048207073137591726, "loss": 5.3056, "mean_token_accuracy": 0.1705812394618988, "num_tokens": 30040235.0, "step": 17315 }, { "entropy": 5.610648584365845, "epoch": 1.3475588406924723, "grad_norm": 1.3828125, "learning_rate": 0.00048205988803260824, "loss": 5.3262, "mean_token_accuracy": 0.17061686962842942, "num_tokens": 30049361.0, "step": 17320 }, { "entropy": 5.517641830444336, "epoch": 1.3479478700641898, "grad_norm": 1.4453125, "learning_rate": 0.00048204904154749496, "loss": 5.3024, "mean_token_accuracy": 0.17135556042194366, "num_tokens": 30058896.0, "step": 17325 }, { "entropy": 5.591673088073731, "epoch": 1.3483368994359073, "grad_norm": 1.5078125, "learning_rate": 0.00048203819192074206, "loss": 5.3229, "mean_token_accuracy": 0.16766200214624405, "num_tokens": 30067206.0, "step": 17330 }, { "entropy": 5.469931268692017, "epoch": 1.348725928807625, "grad_norm": 1.46875, "learning_rate": 0.00048202733915251407, "loss": 5.2238, "mean_token_accuracy": 0.1793886184692383, "num_tokens": 30076286.0, "step": 17335 }, { "entropy": 5.378542470932007, "epoch": 1.3491149581793425, "grad_norm": 1.4921875, "learning_rate": 0.00048201648324297573, "loss": 5.1316, "mean_token_accuracy": 0.17962127476930617, "num_tokens": 30084681.0, "step": 17340 }, { "entropy": 5.540548324584961, "epoch": 1.3495039875510602, "grad_norm": 1.9609375, "learning_rate": 0.00048200562419229185, "loss": 5.2415, "mean_token_accuracy": 0.17583508491516114, "num_tokens": 30093293.0, "step": 17345 }, { "entropy": 5.448749971389771, "epoch": 1.3498930169227776, "grad_norm": 1.6484375, "learning_rate": 0.000481994762000627, "loss": 5.0993, "mean_token_accuracy": 0.18627091199159623, "num_tokens": 30101593.0, "step": 17350 }, { "entropy": 5.483889818191528, "epoch": 1.3502820462944953, "grad_norm": 1.3359375, "learning_rate": 0.00048198389666814616, "loss": 5.298, "mean_token_accuracy": 0.17381460219621658, "num_tokens": 30110328.0, "step": 17355 }, { "entropy": 5.494292449951172, "epoch": 1.3506710756662128, "grad_norm": 1.46875, "learning_rate": 0.00048197302819501416, "loss": 5.2518, "mean_token_accuracy": 0.17856424003839494, "num_tokens": 30118721.0, "step": 17360 }, { "entropy": 5.444191646575928, "epoch": 1.3510601050379303, "grad_norm": 1.4765625, "learning_rate": 0.00048196215658139586, "loss": 5.2113, "mean_token_accuracy": 0.17079658806324005, "num_tokens": 30127238.0, "step": 17365 }, { "entropy": 5.516708326339722, "epoch": 1.351449134409648, "grad_norm": 1.5, "learning_rate": 0.0004819512818274562, "loss": 5.2062, "mean_token_accuracy": 0.18769046068191528, "num_tokens": 30135049.0, "step": 17370 }, { "entropy": 5.38051176071167, "epoch": 1.3518381637813655, "grad_norm": 1.3984375, "learning_rate": 0.0004819404039333603, "loss": 5.2224, "mean_token_accuracy": 0.17592968046665192, "num_tokens": 30143991.0, "step": 17375 }, { "entropy": 5.516547632217407, "epoch": 1.352227193153083, "grad_norm": 1.4765625, "learning_rate": 0.0004819295228992731, "loss": 5.4044, "mean_token_accuracy": 0.16552523225545884, "num_tokens": 30153968.0, "step": 17380 }, { "entropy": 5.670028638839722, "epoch": 1.3526162225248006, "grad_norm": 1.390625, "learning_rate": 0.00048191863872535984, "loss": 5.2668, "mean_token_accuracy": 0.17516425102949143, "num_tokens": 30162927.0, "step": 17385 }, { "entropy": 5.464689826965332, "epoch": 1.3530052518965183, "grad_norm": 1.2734375, "learning_rate": 0.0004819077514117855, "loss": 5.2105, "mean_token_accuracy": 0.18032141625881196, "num_tokens": 30170986.0, "step": 17390 }, { "entropy": 5.438656425476074, "epoch": 1.3533942812682358, "grad_norm": 1.5859375, "learning_rate": 0.00048189686095871545, "loss": 5.2, "mean_token_accuracy": 0.1782979339361191, "num_tokens": 30179167.0, "step": 17395 }, { "entropy": 5.446647310256958, "epoch": 1.3537833106399533, "grad_norm": 1.5, "learning_rate": 0.00048188596736631475, "loss": 5.2096, "mean_token_accuracy": 0.17918047457933425, "num_tokens": 30187710.0, "step": 17400 }, { "entropy": 5.591613721847534, "epoch": 1.354172340011671, "grad_norm": 1.40625, "learning_rate": 0.00048187507063474885, "loss": 5.3135, "mean_token_accuracy": 0.1697572022676468, "num_tokens": 30196502.0, "step": 17405 }, { "entropy": 5.4313451766967775, "epoch": 1.3545613693833884, "grad_norm": 1.484375, "learning_rate": 0.00048186417076418294, "loss": 5.1582, "mean_token_accuracy": 0.17617504000663758, "num_tokens": 30205070.0, "step": 17410 }, { "entropy": 5.485702085494995, "epoch": 1.354950398755106, "grad_norm": 1.40625, "learning_rate": 0.00048185326775478256, "loss": 5.2269, "mean_token_accuracy": 0.17253556847572327, "num_tokens": 30213554.0, "step": 17415 }, { "entropy": 5.437127780914307, "epoch": 1.3553394281268236, "grad_norm": 1.484375, "learning_rate": 0.00048184236160671306, "loss": 5.1717, "mean_token_accuracy": 0.17828486114740372, "num_tokens": 30222687.0, "step": 17420 }, { "entropy": 5.481479597091675, "epoch": 1.355728457498541, "grad_norm": 1.625, "learning_rate": 0.00048183145232013995, "loss": 5.2522, "mean_token_accuracy": 0.1716803342103958, "num_tokens": 30231086.0, "step": 17425 }, { "entropy": 5.463227939605713, "epoch": 1.3561174868702586, "grad_norm": 1.4453125, "learning_rate": 0.00048182053989522883, "loss": 5.1462, "mean_token_accuracy": 0.17938144952058793, "num_tokens": 30240355.0, "step": 17430 }, { "entropy": 5.56818642616272, "epoch": 1.3565065162419763, "grad_norm": 1.453125, "learning_rate": 0.00048180962433214515, "loss": 5.3472, "mean_token_accuracy": 0.1726804181933403, "num_tokens": 30249586.0, "step": 17435 }, { "entropy": 5.54279408454895, "epoch": 1.356895545613694, "grad_norm": 1.4140625, "learning_rate": 0.00048179870563105453, "loss": 5.289, "mean_token_accuracy": 0.17133213579654694, "num_tokens": 30257666.0, "step": 17440 }, { "entropy": 5.5305335521698, "epoch": 1.3572845749854114, "grad_norm": 1.375, "learning_rate": 0.0004817877837921228, "loss": 5.4184, "mean_token_accuracy": 0.17413941472768785, "num_tokens": 30266846.0, "step": 17445 }, { "entropy": 5.429582405090332, "epoch": 1.357673604357129, "grad_norm": 1.4140625, "learning_rate": 0.0004817768588155155, "loss": 5.1556, "mean_token_accuracy": 0.18280264288187026, "num_tokens": 30275587.0, "step": 17450 }, { "entropy": 5.517132043838501, "epoch": 1.3580626337288466, "grad_norm": 1.5390625, "learning_rate": 0.00048176593070139865, "loss": 5.251, "mean_token_accuracy": 0.1791014090180397, "num_tokens": 30283948.0, "step": 17455 }, { "entropy": 5.617012786865234, "epoch": 1.358451663100564, "grad_norm": 1.4765625, "learning_rate": 0.00048175499944993767, "loss": 5.3841, "mean_token_accuracy": 0.17775468528270721, "num_tokens": 30292302.0, "step": 17460 }, { "entropy": 5.618616962432862, "epoch": 1.3588406924722816, "grad_norm": 1.6484375, "learning_rate": 0.00048174406506129884, "loss": 5.3812, "mean_token_accuracy": 0.17075441926717758, "num_tokens": 30301414.0, "step": 17465 }, { "entropy": 5.551756906509399, "epoch": 1.3592297218439993, "grad_norm": 1.53125, "learning_rate": 0.00048173312753564787, "loss": 5.2781, "mean_token_accuracy": 0.18222108483314514, "num_tokens": 30311045.0, "step": 17470 }, { "entropy": 5.482461023330688, "epoch": 1.3596187512157167, "grad_norm": 1.6015625, "learning_rate": 0.0004817221868731506, "loss": 5.1715, "mean_token_accuracy": 0.1783289611339569, "num_tokens": 30318552.0, "step": 17475 }, { "entropy": 5.4592358589172365, "epoch": 1.3600077805874344, "grad_norm": 1.375, "learning_rate": 0.00048171124307397334, "loss": 5.2939, "mean_token_accuracy": 0.17215437889099122, "num_tokens": 30327583.0, "step": 17480 }, { "entropy": 5.529998731613159, "epoch": 1.360396809959152, "grad_norm": 1.453125, "learning_rate": 0.0004817002961382819, "loss": 5.2334, "mean_token_accuracy": 0.17080385535955428, "num_tokens": 30336339.0, "step": 17485 }, { "entropy": 5.575060033798218, "epoch": 1.3607858393308696, "grad_norm": 1.40625, "learning_rate": 0.00048168934606624255, "loss": 5.3262, "mean_token_accuracy": 0.1722218230366707, "num_tokens": 30344878.0, "step": 17490 }, { "entropy": 5.529403781890869, "epoch": 1.361174868702587, "grad_norm": 1.484375, "learning_rate": 0.00048167839285802116, "loss": 5.2777, "mean_token_accuracy": 0.17036345303058625, "num_tokens": 30353071.0, "step": 17495 }, { "entropy": 5.503236627578735, "epoch": 1.3615638980743046, "grad_norm": 1.46875, "learning_rate": 0.0004816674365137843, "loss": 5.236, "mean_token_accuracy": 0.18010642230510712, "num_tokens": 30361356.0, "step": 17500 }, { "entropy": 5.594958639144897, "epoch": 1.3619529274460223, "grad_norm": 1.65625, "learning_rate": 0.000481656477033698, "loss": 5.2848, "mean_token_accuracy": 0.16840853095054625, "num_tokens": 30370917.0, "step": 17505 }, { "entropy": 5.516336965560913, "epoch": 1.3623419568177397, "grad_norm": 1.3125, "learning_rate": 0.0004816455144179286, "loss": 5.3034, "mean_token_accuracy": 0.17195237725973128, "num_tokens": 30380304.0, "step": 17510 }, { "entropy": 5.569565868377685, "epoch": 1.3627309861894572, "grad_norm": 1.3828125, "learning_rate": 0.0004816345486666424, "loss": 5.2476, "mean_token_accuracy": 0.17904252409934998, "num_tokens": 30388565.0, "step": 17515 }, { "entropy": 5.56043963432312, "epoch": 1.363120015561175, "grad_norm": 1.375, "learning_rate": 0.0004816235797800058, "loss": 5.3612, "mean_token_accuracy": 0.17108625322580337, "num_tokens": 30397220.0, "step": 17520 }, { "entropy": 5.5058962345123295, "epoch": 1.3635090449328924, "grad_norm": 1.453125, "learning_rate": 0.0004816126077581852, "loss": 5.2294, "mean_token_accuracy": 0.17219217568635942, "num_tokens": 30405235.0, "step": 17525 }, { "entropy": 5.501880311965943, "epoch": 1.36389807430461, "grad_norm": 1.3359375, "learning_rate": 0.00048160163260134724, "loss": 5.2692, "mean_token_accuracy": 0.17481008023023606, "num_tokens": 30414218.0, "step": 17530 }, { "entropy": 5.5271735191345215, "epoch": 1.3642871036763276, "grad_norm": 1.328125, "learning_rate": 0.0004815906543096583, "loss": 5.246, "mean_token_accuracy": 0.1751176968216896, "num_tokens": 30422665.0, "step": 17535 }, { "entropy": 5.566660642623901, "epoch": 1.3646761330480452, "grad_norm": 1.4453125, "learning_rate": 0.000481579672883285, "loss": 5.2742, "mean_token_accuracy": 0.17250326573848723, "num_tokens": 30431868.0, "step": 17540 }, { "entropy": 5.5575110912323, "epoch": 1.3650651624197627, "grad_norm": 1.375, "learning_rate": 0.00048156868832239396, "loss": 5.2896, "mean_token_accuracy": 0.17769983112812043, "num_tokens": 30440548.0, "step": 17545 }, { "entropy": 5.569244337081909, "epoch": 1.3654541917914802, "grad_norm": 1.609375, "learning_rate": 0.0004815577006271519, "loss": 5.2951, "mean_token_accuracy": 0.16673124134540557, "num_tokens": 30448959.0, "step": 17550 }, { "entropy": 5.527101755142212, "epoch": 1.365843221163198, "grad_norm": 1.40625, "learning_rate": 0.00048154670979772555, "loss": 5.2031, "mean_token_accuracy": 0.17675437778234482, "num_tokens": 30457193.0, "step": 17555 }, { "entropy": 5.593591117858887, "epoch": 1.3662322505349154, "grad_norm": 1.875, "learning_rate": 0.0004815357158342815, "loss": 5.2809, "mean_token_accuracy": 0.16696500182151794, "num_tokens": 30466253.0, "step": 17560 }, { "entropy": 5.470001888275147, "epoch": 1.3666212799066328, "grad_norm": 1.5078125, "learning_rate": 0.0004815247187369868, "loss": 5.1927, "mean_token_accuracy": 0.1841494306921959, "num_tokens": 30474675.0, "step": 17565 }, { "entropy": 5.512925243377685, "epoch": 1.3670103092783505, "grad_norm": 1.5, "learning_rate": 0.00048151371850600814, "loss": 5.2487, "mean_token_accuracy": 0.179536671936512, "num_tokens": 30483031.0, "step": 17570 }, { "entropy": 5.445442771911621, "epoch": 1.367399338650068, "grad_norm": 1.4921875, "learning_rate": 0.00048150271514151255, "loss": 5.2388, "mean_token_accuracy": 0.17908791452646255, "num_tokens": 30491331.0, "step": 17575 }, { "entropy": 5.499799489974976, "epoch": 1.3677883680217857, "grad_norm": 1.4375, "learning_rate": 0.00048149170864366693, "loss": 5.2732, "mean_token_accuracy": 0.17207299023866654, "num_tokens": 30499649.0, "step": 17580 }, { "entropy": 5.547387552261353, "epoch": 1.3681773973935032, "grad_norm": 1.453125, "learning_rate": 0.00048148069901263836, "loss": 5.1323, "mean_token_accuracy": 0.18310274183750153, "num_tokens": 30508922.0, "step": 17585 }, { "entropy": 5.525827264785766, "epoch": 1.368566426765221, "grad_norm": 1.375, "learning_rate": 0.00048146968624859375, "loss": 5.2161, "mean_token_accuracy": 0.17420928031206132, "num_tokens": 30517745.0, "step": 17590 }, { "entropy": 5.471214771270752, "epoch": 1.3689554561369384, "grad_norm": 1.578125, "learning_rate": 0.0004814586703517003, "loss": 5.3641, "mean_token_accuracy": 0.16873226016759874, "num_tokens": 30526597.0, "step": 17595 }, { "entropy": 5.624855613708496, "epoch": 1.3693444855086558, "grad_norm": 1.609375, "learning_rate": 0.0004814476513221251, "loss": 5.2381, "mean_token_accuracy": 0.17717682123184203, "num_tokens": 30533969.0, "step": 17600 }, { "entropy": 5.553325605392456, "epoch": 1.3697335148803735, "grad_norm": 1.4140625, "learning_rate": 0.00048143662916003545, "loss": 5.3244, "mean_token_accuracy": 0.16900917142629623, "num_tokens": 30543277.0, "step": 17605 }, { "entropy": 5.552525186538697, "epoch": 1.370122544252091, "grad_norm": 1.5390625, "learning_rate": 0.0004814256038655985, "loss": 5.3019, "mean_token_accuracy": 0.16587134897708894, "num_tokens": 30551889.0, "step": 17610 }, { "entropy": 5.529733419418335, "epoch": 1.3705115736238085, "grad_norm": 1.671875, "learning_rate": 0.0004814145754389816, "loss": 5.2625, "mean_token_accuracy": 0.17882727086544037, "num_tokens": 30560926.0, "step": 17615 }, { "entropy": 5.63389835357666, "epoch": 1.3709006029955262, "grad_norm": 1.421875, "learning_rate": 0.00048140354388035204, "loss": 5.3334, "mean_token_accuracy": 0.1755084991455078, "num_tokens": 30570102.0, "step": 17620 }, { "entropy": 5.516022348403931, "epoch": 1.3712896323672437, "grad_norm": 1.3515625, "learning_rate": 0.0004813925091898772, "loss": 5.289, "mean_token_accuracy": 0.1758200615644455, "num_tokens": 30578585.0, "step": 17625 }, { "entropy": 5.572675895690918, "epoch": 1.3716786617389614, "grad_norm": 1.359375, "learning_rate": 0.0004813814713677246, "loss": 5.2751, "mean_token_accuracy": 0.1793521448969841, "num_tokens": 30587594.0, "step": 17630 }, { "entropy": 5.639176321029663, "epoch": 1.3720676911106788, "grad_norm": 1.46875, "learning_rate": 0.0004813704304140616, "loss": 5.2865, "mean_token_accuracy": 0.17619706988334655, "num_tokens": 30596234.0, "step": 17635 }, { "entropy": 5.56216402053833, "epoch": 1.3724567204823965, "grad_norm": 1.3671875, "learning_rate": 0.0004813593863290559, "loss": 5.3491, "mean_token_accuracy": 0.17236778140068054, "num_tokens": 30605822.0, "step": 17640 }, { "entropy": 5.5389673709869385, "epoch": 1.372845749854114, "grad_norm": 1.4609375, "learning_rate": 0.0004813483391128748, "loss": 5.2277, "mean_token_accuracy": 0.17901082187891007, "num_tokens": 30614154.0, "step": 17645 }, { "entropy": 5.545075607299805, "epoch": 1.3732347792258315, "grad_norm": 1.3671875, "learning_rate": 0.0004813372887656862, "loss": 5.2727, "mean_token_accuracy": 0.17536881566047668, "num_tokens": 30622393.0, "step": 17650 }, { "entropy": 5.468309164047241, "epoch": 1.3736238085975492, "grad_norm": 1.4609375, "learning_rate": 0.0004813262352876576, "loss": 5.314, "mean_token_accuracy": 0.17265358418226243, "num_tokens": 30632173.0, "step": 17655 }, { "entropy": 5.644980812072754, "epoch": 1.3740128379692667, "grad_norm": 1.390625, "learning_rate": 0.00048131517867895684, "loss": 5.3839, "mean_token_accuracy": 0.16801826059818267, "num_tokens": 30640313.0, "step": 17660 }, { "entropy": 5.561770582199097, "epoch": 1.3744018673409841, "grad_norm": 1.484375, "learning_rate": 0.00048130411893975155, "loss": 5.179, "mean_token_accuracy": 0.17904140502214433, "num_tokens": 30648651.0, "step": 17665 }, { "entropy": 5.460551834106445, "epoch": 1.3747908967127018, "grad_norm": 1.484375, "learning_rate": 0.0004812930560702097, "loss": 5.2722, "mean_token_accuracy": 0.1761232152581215, "num_tokens": 30657782.0, "step": 17670 }, { "entropy": 5.453908967971802, "epoch": 1.3751799260844193, "grad_norm": 1.375, "learning_rate": 0.00048128199007049907, "loss": 5.2695, "mean_token_accuracy": 0.1734609380364418, "num_tokens": 30666493.0, "step": 17675 }, { "entropy": 5.482020711898803, "epoch": 1.375568955456137, "grad_norm": 1.359375, "learning_rate": 0.00048127092094078756, "loss": 5.1579, "mean_token_accuracy": 0.18722697496414184, "num_tokens": 30675054.0, "step": 17680 }, { "entropy": 5.586921834945679, "epoch": 1.3759579848278545, "grad_norm": 1.390625, "learning_rate": 0.00048125984868124317, "loss": 5.1986, "mean_token_accuracy": 0.18506894409656524, "num_tokens": 30683927.0, "step": 17685 }, { "entropy": 5.448682975769043, "epoch": 1.3763470141995722, "grad_norm": 1.3125, "learning_rate": 0.0004812487732920338, "loss": 5.1044, "mean_token_accuracy": 0.1847105324268341, "num_tokens": 30691670.0, "step": 17690 }, { "entropy": 5.368113422393799, "epoch": 1.3767360435712896, "grad_norm": 1.7109375, "learning_rate": 0.0004812376947733277, "loss": 5.1374, "mean_token_accuracy": 0.1819167971611023, "num_tokens": 30700312.0, "step": 17695 }, { "entropy": 5.484257364273072, "epoch": 1.3771250729430071, "grad_norm": 1.5859375, "learning_rate": 0.00048122661312529263, "loss": 5.207, "mean_token_accuracy": 0.18260670304298401, "num_tokens": 30708975.0, "step": 17700 }, { "entropy": 5.4597815990448, "epoch": 1.3775141023147248, "grad_norm": 1.578125, "learning_rate": 0.0004812155283480971, "loss": 5.2139, "mean_token_accuracy": 0.17757836878299713, "num_tokens": 30718314.0, "step": 17705 }, { "entropy": 5.502430629730225, "epoch": 1.3779031316864423, "grad_norm": 1.515625, "learning_rate": 0.0004812044404419091, "loss": 5.2598, "mean_token_accuracy": 0.17979368269443513, "num_tokens": 30726801.0, "step": 17710 }, { "entropy": 5.48796010017395, "epoch": 1.3782921610581598, "grad_norm": 1.484375, "learning_rate": 0.000481193349406897, "loss": 5.1199, "mean_token_accuracy": 0.17985542863607407, "num_tokens": 30734884.0, "step": 17715 }, { "entropy": 5.5230245113372805, "epoch": 1.3786811904298775, "grad_norm": 1.4765625, "learning_rate": 0.000481182255243229, "loss": 5.2694, "mean_token_accuracy": 0.174702250957489, "num_tokens": 30744986.0, "step": 17720 }, { "entropy": 5.448199367523193, "epoch": 1.379070219801595, "grad_norm": 1.34375, "learning_rate": 0.00048117115795107335, "loss": 5.2396, "mean_token_accuracy": 0.17263717502355574, "num_tokens": 30753476.0, "step": 17725 }, { "entropy": 5.575817537307739, "epoch": 1.3794592491733126, "grad_norm": 1.3984375, "learning_rate": 0.0004811600575305987, "loss": 5.3525, "mean_token_accuracy": 0.16767941564321517, "num_tokens": 30762642.0, "step": 17730 }, { "entropy": 5.573722314834595, "epoch": 1.3798482785450301, "grad_norm": 1.375, "learning_rate": 0.0004811489539819731, "loss": 5.3178, "mean_token_accuracy": 0.17155630737543107, "num_tokens": 30771530.0, "step": 17735 }, { "entropy": 5.524826765060425, "epoch": 1.3802373079167478, "grad_norm": 1.3671875, "learning_rate": 0.00048113784730536544, "loss": 5.3021, "mean_token_accuracy": 0.1755194529891014, "num_tokens": 30780001.0, "step": 17740 }, { "entropy": 5.5157185077667235, "epoch": 1.3806263372884653, "grad_norm": 1.5546875, "learning_rate": 0.00048112673750094396, "loss": 5.2185, "mean_token_accuracy": 0.17801757007837296, "num_tokens": 30788696.0, "step": 17745 }, { "entropy": 5.544213199615479, "epoch": 1.3810153666601828, "grad_norm": 1.34375, "learning_rate": 0.0004811156245688773, "loss": 5.2894, "mean_token_accuracy": 0.17802254110574722, "num_tokens": 30797457.0, "step": 17750 }, { "entropy": 5.540354633331299, "epoch": 1.3814043960319005, "grad_norm": 1.4140625, "learning_rate": 0.0004811045085093342, "loss": 5.2623, "mean_token_accuracy": 0.17355971038341522, "num_tokens": 30807048.0, "step": 17755 }, { "entropy": 5.522058057785034, "epoch": 1.381793425403618, "grad_norm": 1.4296875, "learning_rate": 0.0004810933893224831, "loss": 5.2795, "mean_token_accuracy": 0.17771067470312119, "num_tokens": 30815315.0, "step": 17760 }, { "entropy": 5.493741416931153, "epoch": 1.3821824547753354, "grad_norm": 1.3671875, "learning_rate": 0.00048108226700849287, "loss": 5.2059, "mean_token_accuracy": 0.17556727230548858, "num_tokens": 30823221.0, "step": 17765 }, { "entropy": 5.653856945037842, "epoch": 1.382571484147053, "grad_norm": 1.8828125, "learning_rate": 0.0004810711415675323, "loss": 5.3886, "mean_token_accuracy": 0.1708286300301552, "num_tokens": 30832112.0, "step": 17770 }, { "entropy": 5.552512311935425, "epoch": 1.3829605135187706, "grad_norm": 1.390625, "learning_rate": 0.0004810600129997702, "loss": 5.2602, "mean_token_accuracy": 0.18118225783109665, "num_tokens": 30840597.0, "step": 17775 }, { "entropy": 5.439036703109741, "epoch": 1.3833495428904883, "grad_norm": 1.484375, "learning_rate": 0.00048104888130537534, "loss": 5.079, "mean_token_accuracy": 0.18668164014816285, "num_tokens": 30848947.0, "step": 17780 }, { "entropy": 5.470128679275513, "epoch": 1.3837385722622058, "grad_norm": 1.5703125, "learning_rate": 0.00048103774648451664, "loss": 5.2908, "mean_token_accuracy": 0.16934383660554886, "num_tokens": 30856630.0, "step": 17785 }, { "entropy": 5.517313623428345, "epoch": 1.3841276016339235, "grad_norm": 1.3828125, "learning_rate": 0.00048102660853736314, "loss": 5.3591, "mean_token_accuracy": 0.17357830703258514, "num_tokens": 30866032.0, "step": 17790 }, { "entropy": 5.559560108184814, "epoch": 1.384516631005641, "grad_norm": 1.4921875, "learning_rate": 0.0004810154674640837, "loss": 5.2005, "mean_token_accuracy": 0.18244669437408448, "num_tokens": 30874104.0, "step": 17795 }, { "entropy": 5.456486225128174, "epoch": 1.3849056603773584, "grad_norm": 2.265625, "learning_rate": 0.00048100432326484744, "loss": 5.1932, "mean_token_accuracy": 0.18531633168458939, "num_tokens": 30882792.0, "step": 17800 }, { "entropy": 5.4607233047485355, "epoch": 1.385294689749076, "grad_norm": 1.375, "learning_rate": 0.0004809931759398235, "loss": 5.1905, "mean_token_accuracy": 0.17663442194461823, "num_tokens": 30891337.0, "step": 17805 }, { "entropy": 5.490444087982178, "epoch": 1.3856837191207936, "grad_norm": 1.3046875, "learning_rate": 0.00048098202548918094, "loss": 5.2462, "mean_token_accuracy": 0.17789483666419983, "num_tokens": 30899589.0, "step": 17810 }, { "entropy": 5.548178815841675, "epoch": 1.386072748492511, "grad_norm": 1.4921875, "learning_rate": 0.00048097087191308914, "loss": 5.248, "mean_token_accuracy": 0.17168817669153214, "num_tokens": 30907893.0, "step": 17815 }, { "entropy": 5.590281629562378, "epoch": 1.3864617778642288, "grad_norm": 1.3515625, "learning_rate": 0.0004809597152117171, "loss": 5.3521, "mean_token_accuracy": 0.17575883418321608, "num_tokens": 30916797.0, "step": 17820 }, { "entropy": 5.536968803405761, "epoch": 1.3868508072359464, "grad_norm": 1.5703125, "learning_rate": 0.0004809485553852342, "loss": 5.2271, "mean_token_accuracy": 0.1801610469818115, "num_tokens": 30925451.0, "step": 17825 }, { "entropy": 5.4286932945251465, "epoch": 1.387239836607664, "grad_norm": 1.3671875, "learning_rate": 0.0004809373924338098, "loss": 5.2114, "mean_token_accuracy": 0.1740361452102661, "num_tokens": 30934595.0, "step": 17830 }, { "entropy": 5.514843463897705, "epoch": 1.3876288659793814, "grad_norm": 1.4296875, "learning_rate": 0.00048092622635761316, "loss": 5.3527, "mean_token_accuracy": 0.17542300522327423, "num_tokens": 30943896.0, "step": 17835 }, { "entropy": 5.617434692382813, "epoch": 1.388017895351099, "grad_norm": 1.375, "learning_rate": 0.00048091505715681395, "loss": 5.2009, "mean_token_accuracy": 0.17829690277576446, "num_tokens": 30952255.0, "step": 17840 }, { "entropy": 5.536069869995117, "epoch": 1.3884069247228166, "grad_norm": 1.578125, "learning_rate": 0.0004809038848315814, "loss": 5.2979, "mean_token_accuracy": 0.17594264894723893, "num_tokens": 30960972.0, "step": 17845 }, { "entropy": 5.5068258285522464, "epoch": 1.388795954094534, "grad_norm": 1.515625, "learning_rate": 0.0004808927093820851, "loss": 5.317, "mean_token_accuracy": 0.1752900078892708, "num_tokens": 30970298.0, "step": 17850 }, { "entropy": 5.5917236328125, "epoch": 1.3891849834662517, "grad_norm": 1.3828125, "learning_rate": 0.0004808815308084947, "loss": 5.249, "mean_token_accuracy": 0.17603506594896318, "num_tokens": 30979355.0, "step": 17855 }, { "entropy": 5.469105577468872, "epoch": 1.3895740128379692, "grad_norm": 1.421875, "learning_rate": 0.0004808703491109798, "loss": 5.2058, "mean_token_accuracy": 0.1828099876642227, "num_tokens": 30988085.0, "step": 17860 }, { "entropy": 5.485192489624024, "epoch": 1.3899630422096867, "grad_norm": 1.546875, "learning_rate": 0.0004808591642897099, "loss": 5.2318, "mean_token_accuracy": 0.1788646697998047, "num_tokens": 30996039.0, "step": 17865 }, { "entropy": 5.622358179092407, "epoch": 1.3903520715814044, "grad_norm": 1.8125, "learning_rate": 0.000480847976344855, "loss": 5.3905, "mean_token_accuracy": 0.1623087152838707, "num_tokens": 31004664.0, "step": 17870 }, { "entropy": 5.525275182723999, "epoch": 1.390741100953122, "grad_norm": 1.46875, "learning_rate": 0.00048083678527658465, "loss": 5.2237, "mean_token_accuracy": 0.17863224893808366, "num_tokens": 31012571.0, "step": 17875 }, { "entropy": 5.497212934494018, "epoch": 1.3911301303248396, "grad_norm": 1.5078125, "learning_rate": 0.0004808255910850687, "loss": 5.2657, "mean_token_accuracy": 0.17490193396806716, "num_tokens": 31020901.0, "step": 17880 }, { "entropy": 5.590429353713989, "epoch": 1.391519159696557, "grad_norm": 1.5, "learning_rate": 0.0004808143937704769, "loss": 5.2698, "mean_token_accuracy": 0.17845822721719742, "num_tokens": 31029707.0, "step": 17885 }, { "entropy": 5.518889379501343, "epoch": 1.3919081890682747, "grad_norm": 1.5390625, "learning_rate": 0.00048080319333297937, "loss": 5.2573, "mean_token_accuracy": 0.17721348106861115, "num_tokens": 31037833.0, "step": 17890 }, { "entropy": 5.46894268989563, "epoch": 1.3922972184399922, "grad_norm": 1.609375, "learning_rate": 0.00048079198977274597, "loss": 5.2177, "mean_token_accuracy": 0.18497949540615083, "num_tokens": 31046494.0, "step": 17895 }, { "entropy": 5.64621934890747, "epoch": 1.3926862478117097, "grad_norm": 1.59375, "learning_rate": 0.00048078078308994666, "loss": 5.3797, "mean_token_accuracy": 0.16880697757005692, "num_tokens": 31054957.0, "step": 17900 }, { "entropy": 5.589640092849732, "epoch": 1.3930752771834274, "grad_norm": 1.4765625, "learning_rate": 0.0004807695732847515, "loss": 5.2143, "mean_token_accuracy": 0.17668064683675766, "num_tokens": 31063068.0, "step": 17905 }, { "entropy": 5.469656896591187, "epoch": 1.3934643065551449, "grad_norm": 1.4140625, "learning_rate": 0.00048075836035733053, "loss": 5.232, "mean_token_accuracy": 0.17443308532238005, "num_tokens": 31072081.0, "step": 17910 }, { "entropy": 5.459174633026123, "epoch": 1.3938533359268626, "grad_norm": 1.8125, "learning_rate": 0.000480747144307854, "loss": 5.1413, "mean_token_accuracy": 0.1869641736149788, "num_tokens": 31080541.0, "step": 17915 }, { "entropy": 5.554146337509155, "epoch": 1.39424236529858, "grad_norm": 1.4921875, "learning_rate": 0.00048073592513649203, "loss": 5.3186, "mean_token_accuracy": 0.17137922942638398, "num_tokens": 31089035.0, "step": 17920 }, { "entropy": 5.503985023498535, "epoch": 1.3946313946702977, "grad_norm": 1.421875, "learning_rate": 0.0004807247028434148, "loss": 5.3555, "mean_token_accuracy": 0.1599217176437378, "num_tokens": 31096973.0, "step": 17925 }, { "entropy": 5.51119384765625, "epoch": 1.3950204240420152, "grad_norm": 1.4765625, "learning_rate": 0.0004807134774287927, "loss": 5.2605, "mean_token_accuracy": 0.16861334443092346, "num_tokens": 31104526.0, "step": 17930 }, { "entropy": 5.5450520515441895, "epoch": 1.3954094534137327, "grad_norm": 2.953125, "learning_rate": 0.00048070224889279603, "loss": 5.1132, "mean_token_accuracy": 0.1863141119480133, "num_tokens": 31112350.0, "step": 17935 }, { "entropy": 5.5180140972137455, "epoch": 1.3957984827854504, "grad_norm": 1.765625, "learning_rate": 0.00048069101723559505, "loss": 5.3033, "mean_token_accuracy": 0.17458772361278535, "num_tokens": 31120333.0, "step": 17940 }, { "entropy": 5.510772228240967, "epoch": 1.3961875121571679, "grad_norm": 1.375, "learning_rate": 0.0004806797824573603, "loss": 5.2895, "mean_token_accuracy": 0.1694720506668091, "num_tokens": 31129652.0, "step": 17945 }, { "entropy": 5.636420392990113, "epoch": 1.3965765415288853, "grad_norm": 1.4765625, "learning_rate": 0.0004806685445582624, "loss": 5.2777, "mean_token_accuracy": 0.17210106551647186, "num_tokens": 31137542.0, "step": 17950 }, { "entropy": 5.505106592178345, "epoch": 1.396965570900603, "grad_norm": 1.5, "learning_rate": 0.00048065730353847143, "loss": 5.2651, "mean_token_accuracy": 0.17383188009262085, "num_tokens": 31145958.0, "step": 17955 }, { "entropy": 5.497444200515747, "epoch": 1.3973546002723205, "grad_norm": 1.5859375, "learning_rate": 0.00048064605939815837, "loss": 5.2125, "mean_token_accuracy": 0.17757827937602996, "num_tokens": 31154267.0, "step": 17960 }, { "entropy": 5.5881565570831295, "epoch": 1.3977436296440382, "grad_norm": 1.5703125, "learning_rate": 0.0004806348121374936, "loss": 5.2922, "mean_token_accuracy": 0.1808555990457535, "num_tokens": 31162742.0, "step": 17965 }, { "entropy": 5.587315273284912, "epoch": 1.3981326590157557, "grad_norm": 1.484375, "learning_rate": 0.0004806235617566479, "loss": 5.2793, "mean_token_accuracy": 0.1769614890217781, "num_tokens": 31171275.0, "step": 17970 }, { "entropy": 5.427456521987915, "epoch": 1.3985216883874734, "grad_norm": 1.46875, "learning_rate": 0.000480612308255792, "loss": 5.0029, "mean_token_accuracy": 0.18687910586595535, "num_tokens": 31179318.0, "step": 17975 }, { "entropy": 5.489149904251098, "epoch": 1.3989107177591908, "grad_norm": 1.5234375, "learning_rate": 0.00048060105163509647, "loss": 5.2028, "mean_token_accuracy": 0.17561819553375244, "num_tokens": 31187129.0, "step": 17980 }, { "entropy": 5.546788454055786, "epoch": 1.3992997471309083, "grad_norm": 1.484375, "learning_rate": 0.0004805897918947323, "loss": 5.3998, "mean_token_accuracy": 0.17156168669462205, "num_tokens": 31196381.0, "step": 17985 }, { "entropy": 5.542816305160523, "epoch": 1.399688776502626, "grad_norm": 1.59375, "learning_rate": 0.0004805785290348702, "loss": 5.3178, "mean_token_accuracy": 0.17258928567171097, "num_tokens": 31205659.0, "step": 17990 }, { "entropy": 5.574976825714112, "epoch": 1.4000778058743435, "grad_norm": 1.4375, "learning_rate": 0.00048056726305568124, "loss": 5.2832, "mean_token_accuracy": 0.17487747222185135, "num_tokens": 31214996.0, "step": 17995 }, { "entropy": 5.582656621932983, "epoch": 1.400466835246061, "grad_norm": 1.453125, "learning_rate": 0.00048055599395733617, "loss": 5.2491, "mean_token_accuracy": 0.17277689576148986, "num_tokens": 31222964.0, "step": 18000 }, { "epoch": 1.400466835246061, "eval_entropy": 5.321191076364967, "eval_loss": 5.354572772979736, "eval_mean_token_accuracy": 0.1805547287212586, "eval_num_tokens": 31222964.0, "eval_runtime": 28.5359, "eval_samples_per_second": 1456.34, "eval_steps_per_second": 182.051, "step": 18000 }, { "entropy": 5.532103061676025, "epoch": 1.4008558646177787, "grad_norm": 1.328125, "learning_rate": 0.00048054472174000615, "loss": 5.3504, "mean_token_accuracy": 0.16962839514017106, "num_tokens": 31231653.0, "step": 18005 }, { "entropy": 5.49730920791626, "epoch": 1.4012448939894961, "grad_norm": 1.4375, "learning_rate": 0.00048053344640386207, "loss": 5.2086, "mean_token_accuracy": 0.1795650452375412, "num_tokens": 31240613.0, "step": 18010 }, { "entropy": 5.457658433914185, "epoch": 1.4016339233612138, "grad_norm": 1.4296875, "learning_rate": 0.00048052216794907505, "loss": 5.1542, "mean_token_accuracy": 0.18604094088077544, "num_tokens": 31249724.0, "step": 18015 }, { "entropy": 5.515489721298218, "epoch": 1.4020229527329313, "grad_norm": 1.3828125, "learning_rate": 0.00048051088637581624, "loss": 5.3758, "mean_token_accuracy": 0.17347239702939987, "num_tokens": 31258717.0, "step": 18020 }, { "entropy": 5.536655426025391, "epoch": 1.402411982104649, "grad_norm": 1.4921875, "learning_rate": 0.000480499601684257, "loss": 5.2282, "mean_token_accuracy": 0.180781552195549, "num_tokens": 31267170.0, "step": 18025 }, { "entropy": 5.52217664718628, "epoch": 1.4028010114763665, "grad_norm": 1.5703125, "learning_rate": 0.0004804883138745682, "loss": 5.2772, "mean_token_accuracy": 0.17391119599342347, "num_tokens": 31277787.0, "step": 18030 }, { "entropy": 5.5132862567901615, "epoch": 1.403190040848084, "grad_norm": 1.3984375, "learning_rate": 0.0004804770229469214, "loss": 5.2609, "mean_token_accuracy": 0.17398350983858107, "num_tokens": 31286185.0, "step": 18035 }, { "entropy": 5.576523208618164, "epoch": 1.4035790702198017, "grad_norm": 1.8515625, "learning_rate": 0.0004804657289014878, "loss": 5.1974, "mean_token_accuracy": 0.17363112568855285, "num_tokens": 31295361.0, "step": 18040 }, { "entropy": 5.540326261520386, "epoch": 1.4039680995915191, "grad_norm": 1.484375, "learning_rate": 0.00048045443173843884, "loss": 5.3228, "mean_token_accuracy": 0.18048126101493836, "num_tokens": 31304036.0, "step": 18045 }, { "entropy": 5.472900772094727, "epoch": 1.4043571289632366, "grad_norm": 1.3203125, "learning_rate": 0.00048044313145794587, "loss": 5.1759, "mean_token_accuracy": 0.18150803595781326, "num_tokens": 31311919.0, "step": 18050 }, { "entropy": 5.553953027725219, "epoch": 1.4047461583349543, "grad_norm": 1.4296875, "learning_rate": 0.00048043182806018034, "loss": 5.2994, "mean_token_accuracy": 0.17473077028989792, "num_tokens": 31320805.0, "step": 18055 }, { "entropy": 5.525098085403442, "epoch": 1.4051351877066718, "grad_norm": 1.578125, "learning_rate": 0.00048042052154531384, "loss": 5.3042, "mean_token_accuracy": 0.17650000452995301, "num_tokens": 31329688.0, "step": 18060 }, { "entropy": 5.460553407669067, "epoch": 1.4055242170783895, "grad_norm": 1.40625, "learning_rate": 0.0004804092119135179, "loss": 5.1551, "mean_token_accuracy": 0.18024409264326097, "num_tokens": 31338301.0, "step": 18065 }, { "entropy": 5.604771852493286, "epoch": 1.405913246450107, "grad_norm": 1.609375, "learning_rate": 0.0004803978991649641, "loss": 5.3656, "mean_token_accuracy": 0.16851025819778442, "num_tokens": 31347371.0, "step": 18070 }, { "entropy": 5.569414234161377, "epoch": 1.4063022758218247, "grad_norm": 1.5546875, "learning_rate": 0.00048038658329982404, "loss": 5.3098, "mean_token_accuracy": 0.1763094872236252, "num_tokens": 31355740.0, "step": 18075 }, { "entropy": 5.471652555465698, "epoch": 1.4066913051935421, "grad_norm": 1.4921875, "learning_rate": 0.0004803752643182695, "loss": 5.1401, "mean_token_accuracy": 0.18562333285808563, "num_tokens": 31364718.0, "step": 18080 }, { "entropy": 5.5960338592529295, "epoch": 1.4070803345652596, "grad_norm": 1.5859375, "learning_rate": 0.0004803639422204723, "loss": 5.2786, "mean_token_accuracy": 0.17359669208526612, "num_tokens": 31372845.0, "step": 18085 }, { "entropy": 5.549406337738037, "epoch": 1.4074693639369773, "grad_norm": 1.3046875, "learning_rate": 0.0004803526170066041, "loss": 5.259, "mean_token_accuracy": 0.18189283311367035, "num_tokens": 31380614.0, "step": 18090 }, { "entropy": 5.559660720825195, "epoch": 1.4078583933086948, "grad_norm": 1.46875, "learning_rate": 0.00048034128867683674, "loss": 5.3279, "mean_token_accuracy": 0.1742562472820282, "num_tokens": 31389609.0, "step": 18095 }, { "entropy": 5.594971990585327, "epoch": 1.4082474226804123, "grad_norm": 1.59375, "learning_rate": 0.0004803299572313422, "loss": 5.3051, "mean_token_accuracy": 0.17143698334693908, "num_tokens": 31399046.0, "step": 18100 }, { "entropy": 5.480393886566162, "epoch": 1.40863645205213, "grad_norm": 1.515625, "learning_rate": 0.0004803186226702924, "loss": 5.204, "mean_token_accuracy": 0.18068505376577376, "num_tokens": 31407832.0, "step": 18105 }, { "entropy": 5.554833316802979, "epoch": 1.4090254814238474, "grad_norm": 1.421875, "learning_rate": 0.0004803072849938592, "loss": 5.2712, "mean_token_accuracy": 0.17457137554883956, "num_tokens": 31417097.0, "step": 18110 }, { "entropy": 5.597403430938721, "epoch": 1.4094145107955651, "grad_norm": 1.34375, "learning_rate": 0.0004802959442022149, "loss": 5.318, "mean_token_accuracy": 0.17648953348398208, "num_tokens": 31425448.0, "step": 18115 }, { "entropy": 5.476740503311158, "epoch": 1.4098035401672826, "grad_norm": 1.5, "learning_rate": 0.00048028460029553126, "loss": 5.1477, "mean_token_accuracy": 0.1920905292034149, "num_tokens": 31434116.0, "step": 18120 }, { "entropy": 5.429643869400024, "epoch": 1.4101925695390003, "grad_norm": 1.3984375, "learning_rate": 0.00048027325327398065, "loss": 5.2222, "mean_token_accuracy": 0.17521251887083053, "num_tokens": 31443456.0, "step": 18125 }, { "entropy": 5.503236627578735, "epoch": 1.4105815989107178, "grad_norm": 1.4375, "learning_rate": 0.0004802619031377351, "loss": 5.2302, "mean_token_accuracy": 0.17537346631288528, "num_tokens": 31452372.0, "step": 18130 }, { "entropy": 5.595557832717896, "epoch": 1.4109706282824352, "grad_norm": 1.796875, "learning_rate": 0.00048025054988696684, "loss": 5.2647, "mean_token_accuracy": 0.1775445282459259, "num_tokens": 31460446.0, "step": 18135 }, { "entropy": 5.460465764999389, "epoch": 1.411359657654153, "grad_norm": 1.46875, "learning_rate": 0.00048023919352184827, "loss": 5.1913, "mean_token_accuracy": 0.17444835752248763, "num_tokens": 31468814.0, "step": 18140 }, { "entropy": 5.440851068496704, "epoch": 1.4117486870258704, "grad_norm": 1.3359375, "learning_rate": 0.00048022783404255156, "loss": 5.1888, "mean_token_accuracy": 0.18189519196748732, "num_tokens": 31477617.0, "step": 18145 }, { "entropy": 5.555392789840698, "epoch": 1.412137716397588, "grad_norm": 1.3359375, "learning_rate": 0.0004802164714492491, "loss": 5.1721, "mean_token_accuracy": 0.18350616842508316, "num_tokens": 31485226.0, "step": 18150 }, { "entropy": 5.4960307598114015, "epoch": 1.4125267457693056, "grad_norm": 1.3203125, "learning_rate": 0.00048020510574211335, "loss": 5.213, "mean_token_accuracy": 0.18131631910800933, "num_tokens": 31493425.0, "step": 18155 }, { "entropy": 5.446992015838623, "epoch": 1.412915775141023, "grad_norm": 1.515625, "learning_rate": 0.00048019373692131674, "loss": 5.1858, "mean_token_accuracy": 0.17397785931825638, "num_tokens": 31502499.0, "step": 18160 }, { "entropy": 5.492952823638916, "epoch": 1.4133048045127408, "grad_norm": 1.6875, "learning_rate": 0.00048018236498703176, "loss": 5.2219, "mean_token_accuracy": 0.18217087388038636, "num_tokens": 31510376.0, "step": 18165 }, { "entropy": 5.534497308731079, "epoch": 1.4136938338844582, "grad_norm": 1.4765625, "learning_rate": 0.00048017098993943097, "loss": 5.3843, "mean_token_accuracy": 0.1694500580430031, "num_tokens": 31519101.0, "step": 18170 }, { "entropy": 5.494120121002197, "epoch": 1.414082863256176, "grad_norm": 1.4140625, "learning_rate": 0.000480159611778687, "loss": 5.2142, "mean_token_accuracy": 0.1815626800060272, "num_tokens": 31527221.0, "step": 18175 }, { "entropy": 5.454511451721191, "epoch": 1.4144718926278934, "grad_norm": 1.40625, "learning_rate": 0.00048014823050497243, "loss": 5.2224, "mean_token_accuracy": 0.17851397693157195, "num_tokens": 31535711.0, "step": 18180 }, { "entropy": 5.554487419128418, "epoch": 1.4148609219996109, "grad_norm": 1.421875, "learning_rate": 0.00048013684611846, "loss": 5.3671, "mean_token_accuracy": 0.16796732544898987, "num_tokens": 31545363.0, "step": 18185 }, { "entropy": 5.629341316223145, "epoch": 1.4152499513713286, "grad_norm": 1.453125, "learning_rate": 0.00048012545861932245, "loss": 5.2305, "mean_token_accuracy": 0.1848675489425659, "num_tokens": 31553760.0, "step": 18190 }, { "entropy": 5.520274877548218, "epoch": 1.415638980743046, "grad_norm": 1.4921875, "learning_rate": 0.0004801140680077325, "loss": 5.1672, "mean_token_accuracy": 0.18191928416490555, "num_tokens": 31561625.0, "step": 18195 }, { "entropy": 5.431030988693237, "epoch": 1.4160280101147635, "grad_norm": 1.484375, "learning_rate": 0.0004801026742838631, "loss": 5.2559, "mean_token_accuracy": 0.18150032609701156, "num_tokens": 31569345.0, "step": 18200 }, { "entropy": 5.564674043655396, "epoch": 1.4164170394864812, "grad_norm": 1.34375, "learning_rate": 0.0004800912774478871, "loss": 5.2141, "mean_token_accuracy": 0.17311955988407135, "num_tokens": 31577990.0, "step": 18205 }, { "entropy": 5.449020624160767, "epoch": 1.416806068858199, "grad_norm": 1.34375, "learning_rate": 0.0004800798774999773, "loss": 5.1736, "mean_token_accuracy": 0.18605172783136367, "num_tokens": 31586556.0, "step": 18210 }, { "entropy": 5.5212301254272464, "epoch": 1.4171950982299164, "grad_norm": 1.46875, "learning_rate": 0.00048006847444030686, "loss": 5.2983, "mean_token_accuracy": 0.1785432368516922, "num_tokens": 31595697.0, "step": 18215 }, { "entropy": 5.457568502426147, "epoch": 1.4175841276016339, "grad_norm": 1.40625, "learning_rate": 0.0004800570682690487, "loss": 5.1979, "mean_token_accuracy": 0.18486751317977906, "num_tokens": 31604760.0, "step": 18220 }, { "entropy": 5.530587768554687, "epoch": 1.4179731569733516, "grad_norm": 1.6015625, "learning_rate": 0.0004800456589863759, "loss": 5.319, "mean_token_accuracy": 0.1679696723818779, "num_tokens": 31614115.0, "step": 18225 }, { "entropy": 5.476338243484497, "epoch": 1.418362186345069, "grad_norm": 1.4140625, "learning_rate": 0.0004800342465924616, "loss": 5.3082, "mean_token_accuracy": 0.17588279098272325, "num_tokens": 31622492.0, "step": 18230 }, { "entropy": 5.564793109893799, "epoch": 1.4187512157167865, "grad_norm": 1.453125, "learning_rate": 0.000480022831087479, "loss": 5.3314, "mean_token_accuracy": 0.1728792354464531, "num_tokens": 31632269.0, "step": 18235 }, { "entropy": 5.582900667190552, "epoch": 1.4191402450885042, "grad_norm": 1.4609375, "learning_rate": 0.0004800114124716012, "loss": 5.3121, "mean_token_accuracy": 0.17432929426431656, "num_tokens": 31640374.0, "step": 18240 }, { "entropy": 5.48635573387146, "epoch": 1.4195292744602217, "grad_norm": 1.9609375, "learning_rate": 0.0004799999907450015, "loss": 5.2139, "mean_token_accuracy": 0.18473908305168152, "num_tokens": 31648406.0, "step": 18245 }, { "entropy": 5.486824989318848, "epoch": 1.4199183038319392, "grad_norm": 1.46875, "learning_rate": 0.0004799885659078533, "loss": 5.1621, "mean_token_accuracy": 0.1814996376633644, "num_tokens": 31656478.0, "step": 18250 }, { "entropy": 5.467016363143921, "epoch": 1.4203073332036569, "grad_norm": 1.78125, "learning_rate": 0.0004799771379603299, "loss": 5.1801, "mean_token_accuracy": 0.1797877460718155, "num_tokens": 31665106.0, "step": 18255 }, { "entropy": 5.577709484100342, "epoch": 1.4206963625753746, "grad_norm": 1.5, "learning_rate": 0.0004799657069026046, "loss": 5.3065, "mean_token_accuracy": 0.17493281960487367, "num_tokens": 31673557.0, "step": 18260 }, { "entropy": 5.481100130081177, "epoch": 1.421085391947092, "grad_norm": 1.484375, "learning_rate": 0.00047995427273485097, "loss": 5.1117, "mean_token_accuracy": 0.18842861652374268, "num_tokens": 31682123.0, "step": 18265 }, { "entropy": 5.520610094070435, "epoch": 1.4214744213188095, "grad_norm": 1.5390625, "learning_rate": 0.00047994283545724247, "loss": 5.3765, "mean_token_accuracy": 0.16894069612026213, "num_tokens": 31690387.0, "step": 18270 }, { "entropy": 5.48298192024231, "epoch": 1.4218634506905272, "grad_norm": 1.4296875, "learning_rate": 0.00047993139506995273, "loss": 5.2109, "mean_token_accuracy": 0.18396772742271422, "num_tokens": 31699814.0, "step": 18275 }, { "entropy": 5.482313394546509, "epoch": 1.4222524800622447, "grad_norm": 1.4296875, "learning_rate": 0.0004799199515731551, "loss": 5.1837, "mean_token_accuracy": 0.18609511256217956, "num_tokens": 31708437.0, "step": 18280 }, { "entropy": 5.479394817352295, "epoch": 1.4226415094339622, "grad_norm": 1.453125, "learning_rate": 0.00047990850496702346, "loss": 5.1567, "mean_token_accuracy": 0.18924205899238586, "num_tokens": 31716935.0, "step": 18285 }, { "entropy": 5.5642204761505125, "epoch": 1.4230305388056799, "grad_norm": 2.109375, "learning_rate": 0.0004798970552517314, "loss": 5.3884, "mean_token_accuracy": 0.17014314979314804, "num_tokens": 31725997.0, "step": 18290 }, { "entropy": 5.4827601432800295, "epoch": 1.4234195681773973, "grad_norm": 1.4140625, "learning_rate": 0.00047988560242745264, "loss": 5.1946, "mean_token_accuracy": 0.17987073063850403, "num_tokens": 31733651.0, "step": 18295 }, { "entropy": 5.480494117736816, "epoch": 1.423808597549115, "grad_norm": 1.359375, "learning_rate": 0.000479874146494361, "loss": 5.195, "mean_token_accuracy": 0.17923596650362014, "num_tokens": 31742465.0, "step": 18300 }, { "entropy": 5.5356810092926025, "epoch": 1.4241976269208325, "grad_norm": 1.421875, "learning_rate": 0.0004798626874526302, "loss": 5.2542, "mean_token_accuracy": 0.17424688786268233, "num_tokens": 31751547.0, "step": 18305 }, { "entropy": 5.50795693397522, "epoch": 1.4245866562925502, "grad_norm": 1.4296875, "learning_rate": 0.00047985122530243426, "loss": 5.3916, "mean_token_accuracy": 0.16523353084921838, "num_tokens": 31761027.0, "step": 18310 }, { "entropy": 5.530346012115478, "epoch": 1.4249756856642677, "grad_norm": 1.359375, "learning_rate": 0.000479839760043947, "loss": 5.2853, "mean_token_accuracy": 0.17017893940210344, "num_tokens": 31770166.0, "step": 18315 }, { "entropy": 5.5170868873596195, "epoch": 1.4253647150359852, "grad_norm": 1.546875, "learning_rate": 0.00047982829167734245, "loss": 5.1459, "mean_token_accuracy": 0.18376674950122834, "num_tokens": 31778606.0, "step": 18320 }, { "entropy": 5.536589097976685, "epoch": 1.4257537444077029, "grad_norm": 1.4765625, "learning_rate": 0.00047981682020279456, "loss": 5.3647, "mean_token_accuracy": 0.17093889117240907, "num_tokens": 31787637.0, "step": 18325 }, { "entropy": 5.438645362854004, "epoch": 1.4261427737794203, "grad_norm": 1.4375, "learning_rate": 0.0004798053456204775, "loss": 5.1905, "mean_token_accuracy": 0.17995227128267288, "num_tokens": 31796401.0, "step": 18330 }, { "entropy": 5.547728776931763, "epoch": 1.4265318031511378, "grad_norm": 1.453125, "learning_rate": 0.0004797938679305651, "loss": 5.318, "mean_token_accuracy": 0.17136707454919814, "num_tokens": 31805917.0, "step": 18335 }, { "entropy": 5.613900470733642, "epoch": 1.4269208325228555, "grad_norm": 1.71875, "learning_rate": 0.00047978238713323193, "loss": 5.3311, "mean_token_accuracy": 0.17354520857334138, "num_tokens": 31814890.0, "step": 18340 }, { "entropy": 5.4882893562316895, "epoch": 1.427309861894573, "grad_norm": 1.390625, "learning_rate": 0.00047977090322865183, "loss": 5.186, "mean_token_accuracy": 0.18392392843961716, "num_tokens": 31822469.0, "step": 18345 }, { "entropy": 5.521025514602661, "epoch": 1.4276988912662907, "grad_norm": 1.671875, "learning_rate": 0.0004797594162169993, "loss": 5.3106, "mean_token_accuracy": 0.1728377729654312, "num_tokens": 31831030.0, "step": 18350 }, { "entropy": 5.506049394607544, "epoch": 1.4280879206380082, "grad_norm": 1.40625, "learning_rate": 0.0004797479260984485, "loss": 5.2157, "mean_token_accuracy": 0.1733946830034256, "num_tokens": 31840137.0, "step": 18355 }, { "entropy": 5.41376838684082, "epoch": 1.4284769500097259, "grad_norm": 1.4375, "learning_rate": 0.00047973643287317386, "loss": 5.1016, "mean_token_accuracy": 0.18575553596019745, "num_tokens": 31849258.0, "step": 18360 }, { "entropy": 5.432569313049316, "epoch": 1.4288659793814433, "grad_norm": 1.3828125, "learning_rate": 0.00047972493654134963, "loss": 5.1303, "mean_token_accuracy": 0.17914825528860093, "num_tokens": 31857506.0, "step": 18365 }, { "entropy": 5.534861421585083, "epoch": 1.4292550087531608, "grad_norm": 1.5, "learning_rate": 0.00047971343710315043, "loss": 5.2572, "mean_token_accuracy": 0.17397128641605378, "num_tokens": 31866685.0, "step": 18370 }, { "entropy": 5.589266014099121, "epoch": 1.4296440381248785, "grad_norm": 1.53125, "learning_rate": 0.0004797019345587506, "loss": 5.3317, "mean_token_accuracy": 0.168351948261261, "num_tokens": 31874404.0, "step": 18375 }, { "entropy": 5.602615880966186, "epoch": 1.430033067496596, "grad_norm": 1.5, "learning_rate": 0.0004796904289083248, "loss": 5.3191, "mean_token_accuracy": 0.17482101172208786, "num_tokens": 31883075.0, "step": 18380 }, { "entropy": 5.518873023986816, "epoch": 1.4304220968683135, "grad_norm": 1.546875, "learning_rate": 0.0004796789201520474, "loss": 5.2386, "mean_token_accuracy": 0.17895665019750595, "num_tokens": 31891539.0, "step": 18385 }, { "entropy": 5.585813522338867, "epoch": 1.4308111262400312, "grad_norm": 1.4765625, "learning_rate": 0.00047966740829009333, "loss": 5.2729, "mean_token_accuracy": 0.1783260703086853, "num_tokens": 31900575.0, "step": 18390 }, { "entropy": 5.558542680740357, "epoch": 1.4312001556117486, "grad_norm": 1.5625, "learning_rate": 0.000479655893322637, "loss": 5.2645, "mean_token_accuracy": 0.1751030206680298, "num_tokens": 31909256.0, "step": 18395 }, { "entropy": 5.476305246353149, "epoch": 1.4315891849834663, "grad_norm": 1.578125, "learning_rate": 0.0004796443752498532, "loss": 5.2069, "mean_token_accuracy": 0.17858581990003586, "num_tokens": 31917098.0, "step": 18400 }, { "entropy": 5.606909608840942, "epoch": 1.4319782143551838, "grad_norm": 1.5546875, "learning_rate": 0.0004796328540719169, "loss": 5.3353, "mean_token_accuracy": 0.17273962944746019, "num_tokens": 31925331.0, "step": 18405 }, { "entropy": 5.516603279113769, "epoch": 1.4323672437269015, "grad_norm": 1.484375, "learning_rate": 0.0004796213297890026, "loss": 5.1932, "mean_token_accuracy": 0.17810521125793458, "num_tokens": 31933769.0, "step": 18410 }, { "entropy": 5.516629600524903, "epoch": 1.432756273098619, "grad_norm": 1.3828125, "learning_rate": 0.0004796098024012853, "loss": 5.2931, "mean_token_accuracy": 0.17049989551305772, "num_tokens": 31943089.0, "step": 18415 }, { "entropy": 5.542341470718384, "epoch": 1.4331453024703364, "grad_norm": 1.5390625, "learning_rate": 0.00047959827190894, "loss": 5.2623, "mean_token_accuracy": 0.17716800421476364, "num_tokens": 31951452.0, "step": 18420 }, { "entropy": 5.5623345375061035, "epoch": 1.4335343318420541, "grad_norm": 1.484375, "learning_rate": 0.00047958673831214157, "loss": 5.2645, "mean_token_accuracy": 0.17607493400573732, "num_tokens": 31959625.0, "step": 18425 }, { "entropy": 5.45009069442749, "epoch": 1.4339233612137716, "grad_norm": 1.4921875, "learning_rate": 0.00047957520161106496, "loss": 5.2398, "mean_token_accuracy": 0.17711673229932784, "num_tokens": 31967906.0, "step": 18430 }, { "entropy": 5.425977516174316, "epoch": 1.434312390585489, "grad_norm": 1.5859375, "learning_rate": 0.0004795636618058853, "loss": 5.1912, "mean_token_accuracy": 0.18084208518266678, "num_tokens": 31976183.0, "step": 18435 }, { "entropy": 5.4853521347045895, "epoch": 1.4347014199572068, "grad_norm": 1.921875, "learning_rate": 0.0004795521188967777, "loss": 5.2147, "mean_token_accuracy": 0.1803765967488289, "num_tokens": 31984513.0, "step": 18440 }, { "entropy": 5.603140640258789, "epoch": 1.4350904493289243, "grad_norm": 1.4765625, "learning_rate": 0.0004795405728839172, "loss": 5.3823, "mean_token_accuracy": 0.16767289340496064, "num_tokens": 31992994.0, "step": 18445 }, { "entropy": 5.60715274810791, "epoch": 1.435479478700642, "grad_norm": 1.4765625, "learning_rate": 0.0004795290237674792, "loss": 5.2702, "mean_token_accuracy": 0.17277760207653045, "num_tokens": 32002043.0, "step": 18450 }, { "entropy": 5.495297861099243, "epoch": 1.4358685080723594, "grad_norm": 1.4609375, "learning_rate": 0.00047951747154763866, "loss": 5.1444, "mean_token_accuracy": 0.18213044106960297, "num_tokens": 32009901.0, "step": 18455 }, { "entropy": 5.429672050476074, "epoch": 1.4362575374440771, "grad_norm": 1.4296875, "learning_rate": 0.00047950591622457106, "loss": 5.2092, "mean_token_accuracy": 0.1747964233160019, "num_tokens": 32017947.0, "step": 18460 }, { "entropy": 5.491956377029419, "epoch": 1.4366465668157946, "grad_norm": 1.28125, "learning_rate": 0.00047949435779845174, "loss": 5.2351, "mean_token_accuracy": 0.17535976469516754, "num_tokens": 32026537.0, "step": 18465 }, { "entropy": 5.490673208236695, "epoch": 1.437035596187512, "grad_norm": 1.3828125, "learning_rate": 0.00047948279626945596, "loss": 5.2, "mean_token_accuracy": 0.17987239509820938, "num_tokens": 32034874.0, "step": 18470 }, { "entropy": 5.503887081146241, "epoch": 1.4374246255592298, "grad_norm": 1.34375, "learning_rate": 0.00047947123163775924, "loss": 5.2933, "mean_token_accuracy": 0.17334435433149337, "num_tokens": 32043829.0, "step": 18475 }, { "entropy": 5.574766540527344, "epoch": 1.4378136549309473, "grad_norm": 1.34375, "learning_rate": 0.000479459663903537, "loss": 5.319, "mean_token_accuracy": 0.17150646299123765, "num_tokens": 32052883.0, "step": 18480 }, { "entropy": 5.565496826171875, "epoch": 1.4382026843026647, "grad_norm": 1.3828125, "learning_rate": 0.0004794480930669649, "loss": 5.3384, "mean_token_accuracy": 0.17598079591989518, "num_tokens": 32061421.0, "step": 18485 }, { "entropy": 5.524099397659302, "epoch": 1.4385917136743824, "grad_norm": 1.546875, "learning_rate": 0.0004794365191282183, "loss": 5.2517, "mean_token_accuracy": 0.1852465033531189, "num_tokens": 32069957.0, "step": 18490 }, { "entropy": 5.453353834152222, "epoch": 1.4389807430461, "grad_norm": 1.4453125, "learning_rate": 0.00047942494208747297, "loss": 5.1448, "mean_token_accuracy": 0.17750681787729264, "num_tokens": 32079375.0, "step": 18495 }, { "entropy": 5.513231897354126, "epoch": 1.4393697724178176, "grad_norm": 1.4609375, "learning_rate": 0.0004794133619449045, "loss": 5.1945, "mean_token_accuracy": 0.17859329283237457, "num_tokens": 32088331.0, "step": 18500 }, { "entropy": 5.5179328441619875, "epoch": 1.439758801789535, "grad_norm": 1.6640625, "learning_rate": 0.0004794017787006886, "loss": 5.1606, "mean_token_accuracy": 0.17839935719966887, "num_tokens": 32096897.0, "step": 18505 }, { "entropy": 5.462598133087158, "epoch": 1.4401478311612528, "grad_norm": 1.640625, "learning_rate": 0.000479390192355001, "loss": 5.1812, "mean_token_accuracy": 0.18658424019813538, "num_tokens": 32105942.0, "step": 18510 }, { "entropy": 5.582726955413818, "epoch": 1.4405368605329703, "grad_norm": 1.4296875, "learning_rate": 0.0004793786029080176, "loss": 5.3821, "mean_token_accuracy": 0.1678169012069702, "num_tokens": 32114540.0, "step": 18515 }, { "entropy": 5.470570611953735, "epoch": 1.4409258899046877, "grad_norm": 1.34375, "learning_rate": 0.0004793670103599143, "loss": 5.1975, "mean_token_accuracy": 0.17213313430547714, "num_tokens": 32123214.0, "step": 18520 }, { "entropy": 5.520587396621704, "epoch": 1.4413149192764054, "grad_norm": 1.359375, "learning_rate": 0.00047935541471086677, "loss": 5.2468, "mean_token_accuracy": 0.17993490248918534, "num_tokens": 32132369.0, "step": 18525 }, { "entropy": 5.493685579299926, "epoch": 1.441703948648123, "grad_norm": 1.5390625, "learning_rate": 0.0004793438159610511, "loss": 5.1832, "mean_token_accuracy": 0.17664045840501785, "num_tokens": 32141037.0, "step": 18530 }, { "entropy": 5.47927041053772, "epoch": 1.4420929780198404, "grad_norm": 1.2421875, "learning_rate": 0.00047933221411064334, "loss": 5.1904, "mean_token_accuracy": 0.1803370237350464, "num_tokens": 32149515.0, "step": 18535 }, { "entropy": 5.483889818191528, "epoch": 1.442482007391558, "grad_norm": 1.3515625, "learning_rate": 0.0004793206091598194, "loss": 5.2819, "mean_token_accuracy": 0.18418145328760147, "num_tokens": 32158099.0, "step": 18540 }, { "entropy": 5.545689821243286, "epoch": 1.4428710367632755, "grad_norm": 1.5546875, "learning_rate": 0.0004793090011087554, "loss": 5.2474, "mean_token_accuracy": 0.17718044966459273, "num_tokens": 32167059.0, "step": 18545 }, { "entropy": 5.628464984893799, "epoch": 1.4432600661349932, "grad_norm": 1.4453125, "learning_rate": 0.00047929738995762755, "loss": 5.4081, "mean_token_accuracy": 0.1738082140684128, "num_tokens": 32175988.0, "step": 18550 }, { "entropy": 5.431274652481079, "epoch": 1.4436490955067107, "grad_norm": 1.375, "learning_rate": 0.000479285775706612, "loss": 5.1472, "mean_token_accuracy": 0.1820313513278961, "num_tokens": 32185362.0, "step": 18555 }, { "entropy": 5.488016414642334, "epoch": 1.4440381248784284, "grad_norm": 1.4453125, "learning_rate": 0.00047927415835588496, "loss": 5.2293, "mean_token_accuracy": 0.1793539971113205, "num_tokens": 32194599.0, "step": 18560 }, { "entropy": 5.502857065200805, "epoch": 1.444427154250146, "grad_norm": 1.421875, "learning_rate": 0.00047926253790562265, "loss": 5.2221, "mean_token_accuracy": 0.18292603492736817, "num_tokens": 32203106.0, "step": 18565 }, { "entropy": 5.462140607833862, "epoch": 1.4448161836218634, "grad_norm": 1.453125, "learning_rate": 0.00047925091435600147, "loss": 5.2762, "mean_token_accuracy": 0.1786574736237526, "num_tokens": 32211652.0, "step": 18570 }, { "entropy": 5.606622123718262, "epoch": 1.445205212993581, "grad_norm": 1.4375, "learning_rate": 0.00047923928770719776, "loss": 5.2767, "mean_token_accuracy": 0.1761241987347603, "num_tokens": 32220435.0, "step": 18575 }, { "entropy": 5.580476903915406, "epoch": 1.4455942423652985, "grad_norm": 1.5390625, "learning_rate": 0.00047922765795938797, "loss": 5.2255, "mean_token_accuracy": 0.1731432482600212, "num_tokens": 32228368.0, "step": 18580 }, { "entropy": 5.499847888946533, "epoch": 1.445983271737016, "grad_norm": 1.4140625, "learning_rate": 0.0004792160251127485, "loss": 5.2905, "mean_token_accuracy": 0.17172825038433076, "num_tokens": 32237367.0, "step": 18585 }, { "entropy": 5.552915382385254, "epoch": 1.4463723011087337, "grad_norm": 1.796875, "learning_rate": 0.00047920438916745586, "loss": 5.281, "mean_token_accuracy": 0.17678776234388352, "num_tokens": 32245503.0, "step": 18590 }, { "entropy": 5.579898357391357, "epoch": 1.4467613304804512, "grad_norm": 1.8046875, "learning_rate": 0.0004791927501236866, "loss": 5.2794, "mean_token_accuracy": 0.17110560238361358, "num_tokens": 32254565.0, "step": 18595 }, { "entropy": 5.566863775253296, "epoch": 1.4471503598521689, "grad_norm": 1.9609375, "learning_rate": 0.00047918110798161754, "loss": 5.3109, "mean_token_accuracy": 0.1716754898428917, "num_tokens": 32263701.0, "step": 18600 }, { "entropy": 5.509312582015991, "epoch": 1.4475393892238864, "grad_norm": 1.5390625, "learning_rate": 0.00047916946274142503, "loss": 5.2271, "mean_token_accuracy": 0.17801002115011216, "num_tokens": 32272205.0, "step": 18605 }, { "entropy": 5.532806253433227, "epoch": 1.447928418595604, "grad_norm": 1.4921875, "learning_rate": 0.00047915781440328593, "loss": 5.2796, "mean_token_accuracy": 0.1783734977245331, "num_tokens": 32279918.0, "step": 18610 }, { "entropy": 5.569362354278565, "epoch": 1.4483174479673215, "grad_norm": 1.4453125, "learning_rate": 0.0004791461629673769, "loss": 5.2782, "mean_token_accuracy": 0.18548174798488617, "num_tokens": 32288600.0, "step": 18615 }, { "entropy": 5.6158974170684814, "epoch": 1.448706477339039, "grad_norm": 1.328125, "learning_rate": 0.0004791345084338748, "loss": 5.3884, "mean_token_accuracy": 0.1736078068614006, "num_tokens": 32298334.0, "step": 18620 }, { "entropy": 5.522739839553833, "epoch": 1.4490955067107567, "grad_norm": 1.6015625, "learning_rate": 0.0004791228508029565, "loss": 5.173, "mean_token_accuracy": 0.18253856599330903, "num_tokens": 32306785.0, "step": 18625 }, { "entropy": 5.447295713424682, "epoch": 1.4494845360824742, "grad_norm": 1.875, "learning_rate": 0.00047911119007479873, "loss": 5.2974, "mean_token_accuracy": 0.17676982432603836, "num_tokens": 32315419.0, "step": 18630 }, { "entropy": 5.498271560668945, "epoch": 1.4498735654541917, "grad_norm": 1.3984375, "learning_rate": 0.00047909952624957866, "loss": 5.1661, "mean_token_accuracy": 0.18285317867994308, "num_tokens": 32323655.0, "step": 18635 }, { "entropy": 5.494969701766967, "epoch": 1.4502625948259094, "grad_norm": 1.484375, "learning_rate": 0.000479087859327473, "loss": 5.1564, "mean_token_accuracy": 0.17849189192056655, "num_tokens": 32331465.0, "step": 18640 }, { "entropy": 5.518987464904785, "epoch": 1.450651624197627, "grad_norm": 1.4140625, "learning_rate": 0.000479076189308659, "loss": 5.3647, "mean_token_accuracy": 0.16813654005527495, "num_tokens": 32341211.0, "step": 18645 }, { "entropy": 5.599263381958008, "epoch": 1.4510406535693445, "grad_norm": 1.453125, "learning_rate": 0.00047906451619331364, "loss": 5.3881, "mean_token_accuracy": 0.16863451153039932, "num_tokens": 32349344.0, "step": 18650 }, { "entropy": 5.597398948669434, "epoch": 1.451429682941062, "grad_norm": 1.4765625, "learning_rate": 0.00047905283998161404, "loss": 5.2459, "mean_token_accuracy": 0.18101862221956252, "num_tokens": 32357797.0, "step": 18655 }, { "entropy": 5.418971300125122, "epoch": 1.4518187123127797, "grad_norm": 1.4296875, "learning_rate": 0.00047904116067373743, "loss": 5.1741, "mean_token_accuracy": 0.1775391846895218, "num_tokens": 32366131.0, "step": 18660 }, { "entropy": 5.500018072128296, "epoch": 1.4522077416844972, "grad_norm": 1.65625, "learning_rate": 0.0004790294782698609, "loss": 5.3244, "mean_token_accuracy": 0.17078361809253692, "num_tokens": 32374738.0, "step": 18665 }, { "entropy": 5.5818921566009525, "epoch": 1.4525967710562147, "grad_norm": 1.5390625, "learning_rate": 0.0004790177927701618, "loss": 5.2686, "mean_token_accuracy": 0.17400980293750762, "num_tokens": 32383638.0, "step": 18670 }, { "entropy": 5.589617919921875, "epoch": 1.4529858004279324, "grad_norm": 1.3984375, "learning_rate": 0.0004790061041748174, "loss": 5.3198, "mean_token_accuracy": 0.17448485642671585, "num_tokens": 32393269.0, "step": 18675 }, { "entropy": 5.578018474578857, "epoch": 1.4533748297996498, "grad_norm": 1.65625, "learning_rate": 0.0004789944124840051, "loss": 5.2831, "mean_token_accuracy": 0.17404098212718963, "num_tokens": 32401568.0, "step": 18680 }, { "entropy": 5.484119415283203, "epoch": 1.4537638591713673, "grad_norm": 1.890625, "learning_rate": 0.0004789827176979022, "loss": 5.177, "mean_token_accuracy": 0.18192571997642518, "num_tokens": 32409996.0, "step": 18685 }, { "entropy": 5.498085594177246, "epoch": 1.454152888543085, "grad_norm": 1.453125, "learning_rate": 0.0004789710198166864, "loss": 5.2546, "mean_token_accuracy": 0.17036639899015427, "num_tokens": 32418886.0, "step": 18690 }, { "entropy": 5.4717014789581295, "epoch": 1.4545419179148027, "grad_norm": 1.4375, "learning_rate": 0.00047895931884053497, "loss": 5.088, "mean_token_accuracy": 0.1844627693295479, "num_tokens": 32427999.0, "step": 18695 }, { "entropy": 5.574623680114746, "epoch": 1.4549309472865202, "grad_norm": 1.4140625, "learning_rate": 0.00047894761476962547, "loss": 5.3855, "mean_token_accuracy": 0.1670853778719902, "num_tokens": 32437115.0, "step": 18700 }, { "entropy": 5.509613370895385, "epoch": 1.4553199766582376, "grad_norm": 1.375, "learning_rate": 0.00047893590760413545, "loss": 5.182, "mean_token_accuracy": 0.18272268921136856, "num_tokens": 32445668.0, "step": 18705 }, { "entropy": 5.419609689712525, "epoch": 1.4557090060299553, "grad_norm": 1.4296875, "learning_rate": 0.00047892419734424276, "loss": 5.2173, "mean_token_accuracy": 0.18120238333940505, "num_tokens": 32454022.0, "step": 18710 }, { "entropy": 5.6126405715942385, "epoch": 1.4560980354016728, "grad_norm": 1.703125, "learning_rate": 0.00047891248399012495, "loss": 5.3578, "mean_token_accuracy": 0.16935040354728698, "num_tokens": 32462997.0, "step": 18715 }, { "entropy": 5.639453792572022, "epoch": 1.4564870647733903, "grad_norm": 1.3984375, "learning_rate": 0.0004789007675419597, "loss": 5.2013, "mean_token_accuracy": 0.1808380052447319, "num_tokens": 32471184.0, "step": 18720 }, { "entropy": 5.457993841171264, "epoch": 1.456876094145108, "grad_norm": 1.3984375, "learning_rate": 0.00047888904799992486, "loss": 5.2321, "mean_token_accuracy": 0.17736491411924363, "num_tokens": 32480051.0, "step": 18725 }, { "entropy": 5.471709728240967, "epoch": 1.4572651235168255, "grad_norm": 1.71875, "learning_rate": 0.00047887732536419826, "loss": 5.2668, "mean_token_accuracy": 0.17767847031354905, "num_tokens": 32489269.0, "step": 18730 }, { "entropy": 5.533928155899048, "epoch": 1.4576541528885432, "grad_norm": 1.515625, "learning_rate": 0.0004788655996349577, "loss": 5.2032, "mean_token_accuracy": 0.17996295690536498, "num_tokens": 32497941.0, "step": 18735 }, { "entropy": 5.577839612960815, "epoch": 1.4580431822602606, "grad_norm": 1.3984375, "learning_rate": 0.00047885387081238125, "loss": 5.2556, "mean_token_accuracy": 0.17264704704284667, "num_tokens": 32507679.0, "step": 18740 }, { "entropy": 5.513876342773438, "epoch": 1.4584322116319783, "grad_norm": 1.4609375, "learning_rate": 0.0004788421388966467, "loss": 5.2543, "mean_token_accuracy": 0.177100370824337, "num_tokens": 32516964.0, "step": 18745 }, { "entropy": 5.489507007598877, "epoch": 1.4588212410036958, "grad_norm": 1.421875, "learning_rate": 0.00047883040388793207, "loss": 5.0977, "mean_token_accuracy": 0.18875344842672348, "num_tokens": 32525178.0, "step": 18750 }, { "entropy": 5.5613339900970455, "epoch": 1.4592102703754133, "grad_norm": 1.4609375, "learning_rate": 0.00047881866578641563, "loss": 5.2873, "mean_token_accuracy": 0.17423087656497954, "num_tokens": 32533694.0, "step": 18755 }, { "entropy": 5.481985378265381, "epoch": 1.459599299747131, "grad_norm": 1.5234375, "learning_rate": 0.0004788069245922753, "loss": 5.263, "mean_token_accuracy": 0.17914574444293976, "num_tokens": 32542529.0, "step": 18760 }, { "entropy": 5.539718818664551, "epoch": 1.4599883291188485, "grad_norm": 1.53125, "learning_rate": 0.0004787951803056893, "loss": 5.2557, "mean_token_accuracy": 0.17087531983852386, "num_tokens": 32550987.0, "step": 18765 }, { "entropy": 5.461848402023316, "epoch": 1.460377358490566, "grad_norm": 1.3671875, "learning_rate": 0.0004787834329268358, "loss": 5.2196, "mean_token_accuracy": 0.18231728672981262, "num_tokens": 32559812.0, "step": 18770 }, { "entropy": 5.483540821075439, "epoch": 1.4607663878622836, "grad_norm": 1.546875, "learning_rate": 0.000478771682455893, "loss": 5.2575, "mean_token_accuracy": 0.17913838326931, "num_tokens": 32568477.0, "step": 18775 }, { "entropy": 5.595295095443726, "epoch": 1.461155417234001, "grad_norm": 1.5234375, "learning_rate": 0.0004787599288930393, "loss": 5.3042, "mean_token_accuracy": 0.17240114361047745, "num_tokens": 32577921.0, "step": 18780 }, { "entropy": 5.53241081237793, "epoch": 1.4615444466057188, "grad_norm": 1.546875, "learning_rate": 0.000478748172238453, "loss": 5.1865, "mean_token_accuracy": 0.17665198296308518, "num_tokens": 32587028.0, "step": 18785 }, { "entropy": 5.468697023391724, "epoch": 1.4619334759774363, "grad_norm": 1.296875, "learning_rate": 0.0004787364124923125, "loss": 5.2113, "mean_token_accuracy": 0.17969428598880768, "num_tokens": 32596092.0, "step": 18790 }, { "entropy": 5.493045425415039, "epoch": 1.462322505349154, "grad_norm": 1.9375, "learning_rate": 0.00047872464965479625, "loss": 5.1867, "mean_token_accuracy": 0.17488005757331848, "num_tokens": 32605271.0, "step": 18795 }, { "entropy": 5.5779859066009525, "epoch": 1.4627115347208715, "grad_norm": 1.421875, "learning_rate": 0.0004787128837260826, "loss": 5.3576, "mean_token_accuracy": 0.17157439291477203, "num_tokens": 32614240.0, "step": 18800 }, { "entropy": 5.565021753311157, "epoch": 1.463100564092589, "grad_norm": 1.3515625, "learning_rate": 0.0004787011147063503, "loss": 5.2703, "mean_token_accuracy": 0.1783323273062706, "num_tokens": 32623390.0, "step": 18805 }, { "entropy": 5.527627229690552, "epoch": 1.4634895934643066, "grad_norm": 1.5625, "learning_rate": 0.0004786893425957777, "loss": 5.2488, "mean_token_accuracy": 0.17946368008852004, "num_tokens": 32631649.0, "step": 18810 }, { "entropy": 5.468304920196533, "epoch": 1.463878622836024, "grad_norm": 1.9140625, "learning_rate": 0.0004786775673945436, "loss": 5.1639, "mean_token_accuracy": 0.18047667890787125, "num_tokens": 32640844.0, "step": 18815 }, { "entropy": 5.552310752868652, "epoch": 1.4642676522077416, "grad_norm": 1.390625, "learning_rate": 0.00047866578910282656, "loss": 5.2358, "mean_token_accuracy": 0.18207817822694777, "num_tokens": 32649458.0, "step": 18820 }, { "entropy": 5.4970098495483395, "epoch": 1.4646566815794593, "grad_norm": 1.421875, "learning_rate": 0.00047865400772080535, "loss": 5.2361, "mean_token_accuracy": 0.18117030262947081, "num_tokens": 32657649.0, "step": 18825 }, { "entropy": 5.6064270496368405, "epoch": 1.4650457109511767, "grad_norm": 1.8203125, "learning_rate": 0.00047864222324865875, "loss": 5.3613, "mean_token_accuracy": 0.17145565152168274, "num_tokens": 32665407.0, "step": 18830 }, { "entropy": 5.538425588607788, "epoch": 1.4654347403228944, "grad_norm": 1.390625, "learning_rate": 0.0004786304356865655, "loss": 5.18, "mean_token_accuracy": 0.17483089864253998, "num_tokens": 32673760.0, "step": 18835 }, { "entropy": 5.4918532371521, "epoch": 1.465823769694612, "grad_norm": 2.0625, "learning_rate": 0.00047861864503470457, "loss": 5.2163, "mean_token_accuracy": 0.17299856692552568, "num_tokens": 32682118.0, "step": 18840 }, { "entropy": 5.533446168899536, "epoch": 1.4662127990663296, "grad_norm": 1.546875, "learning_rate": 0.0004786068512932547, "loss": 5.2338, "mean_token_accuracy": 0.1782324194908142, "num_tokens": 32690430.0, "step": 18845 }, { "entropy": 5.509104585647583, "epoch": 1.466601828438047, "grad_norm": 1.578125, "learning_rate": 0.000478595054462395, "loss": 5.1005, "mean_token_accuracy": 0.18468573540449143, "num_tokens": 32698776.0, "step": 18850 }, { "entropy": 5.578722095489502, "epoch": 1.4669908578097646, "grad_norm": 1.5703125, "learning_rate": 0.00047858325454230437, "loss": 5.3369, "mean_token_accuracy": 0.16908054798841476, "num_tokens": 32707299.0, "step": 18855 }, { "entropy": 5.461874628067017, "epoch": 1.4673798871814823, "grad_norm": 2.5, "learning_rate": 0.0004785714515331619, "loss": 5.1691, "mean_token_accuracy": 0.18886398226022721, "num_tokens": 32716041.0, "step": 18860 }, { "entropy": 5.558421325683594, "epoch": 1.4677689165531997, "grad_norm": 1.5390625, "learning_rate": 0.00047855964543514666, "loss": 5.2067, "mean_token_accuracy": 0.18090793937444688, "num_tokens": 32724182.0, "step": 18865 }, { "entropy": 5.4812487125396725, "epoch": 1.4681579459249172, "grad_norm": 1.3828125, "learning_rate": 0.00047854783624843786, "loss": 5.1533, "mean_token_accuracy": 0.1838173657655716, "num_tokens": 32732858.0, "step": 18870 }, { "entropy": 5.556770753860474, "epoch": 1.468546975296635, "grad_norm": 1.4921875, "learning_rate": 0.00047853602397321453, "loss": 5.2887, "mean_token_accuracy": 0.17406779378652573, "num_tokens": 32741422.0, "step": 18875 }, { "entropy": 5.587092685699463, "epoch": 1.4689360046683524, "grad_norm": 1.8828125, "learning_rate": 0.00047852420860965605, "loss": 5.3569, "mean_token_accuracy": 0.17178572565317154, "num_tokens": 32750720.0, "step": 18880 }, { "entropy": 5.46769118309021, "epoch": 1.46932503404007, "grad_norm": 1.390625, "learning_rate": 0.00047851239015794166, "loss": 5.1763, "mean_token_accuracy": 0.18463176041841506, "num_tokens": 32759418.0, "step": 18885 }, { "entropy": 5.475292634963989, "epoch": 1.4697140634117876, "grad_norm": 1.6015625, "learning_rate": 0.00047850056861825066, "loss": 5.2437, "mean_token_accuracy": 0.17988823354244232, "num_tokens": 32767604.0, "step": 18890 }, { "entropy": 5.505810976028442, "epoch": 1.4701030927835053, "grad_norm": 1.7421875, "learning_rate": 0.00047848874399076245, "loss": 5.3327, "mean_token_accuracy": 0.1643638089299202, "num_tokens": 32776535.0, "step": 18895 }, { "entropy": 5.60525918006897, "epoch": 1.4704921221552227, "grad_norm": 1.453125, "learning_rate": 0.0004784769162756563, "loss": 5.2437, "mean_token_accuracy": 0.17636585980653763, "num_tokens": 32785633.0, "step": 18900 }, { "entropy": 5.555313396453857, "epoch": 1.4708811515269402, "grad_norm": 1.4296875, "learning_rate": 0.000478465085473112, "loss": 5.1965, "mean_token_accuracy": 0.17897548973560334, "num_tokens": 32794281.0, "step": 18905 }, { "entropy": 5.557896709442138, "epoch": 1.471270180898658, "grad_norm": 1.3984375, "learning_rate": 0.0004784532515833088, "loss": 5.3886, "mean_token_accuracy": 0.17159285098314286, "num_tokens": 32802312.0, "step": 18910 }, { "entropy": 5.4439699172973635, "epoch": 1.4716592102703754, "grad_norm": 1.5625, "learning_rate": 0.00047844141460642636, "loss": 5.1483, "mean_token_accuracy": 0.18073673993349076, "num_tokens": 32810983.0, "step": 18915 }, { "entropy": 5.51186203956604, "epoch": 1.4720482396420929, "grad_norm": 1.5, "learning_rate": 0.00047842957454264425, "loss": 5.2088, "mean_token_accuracy": 0.17734425514936447, "num_tokens": 32820695.0, "step": 18920 }, { "entropy": 5.555723428726196, "epoch": 1.4724372690138106, "grad_norm": 1.40625, "learning_rate": 0.00047841773139214213, "loss": 5.2394, "mean_token_accuracy": 0.17897880971431732, "num_tokens": 32828483.0, "step": 18925 }, { "entropy": 5.470044183731079, "epoch": 1.472826298385528, "grad_norm": 1.6328125, "learning_rate": 0.0004784058851550997, "loss": 5.2496, "mean_token_accuracy": 0.17767204642295836, "num_tokens": 32837827.0, "step": 18930 }, { "entropy": 5.560628175735474, "epoch": 1.4732153277572457, "grad_norm": 1.3671875, "learning_rate": 0.0004783940358316967, "loss": 5.338, "mean_token_accuracy": 0.1716095820069313, "num_tokens": 32846872.0, "step": 18935 }, { "entropy": 5.5058746337890625, "epoch": 1.4736043571289632, "grad_norm": 1.4765625, "learning_rate": 0.00047838218342211296, "loss": 5.1407, "mean_token_accuracy": 0.18916736990213395, "num_tokens": 32855418.0, "step": 18940 }, { "entropy": 5.474823427200318, "epoch": 1.473993386500681, "grad_norm": 1.3671875, "learning_rate": 0.00047837032792652837, "loss": 5.2385, "mean_token_accuracy": 0.17264438569545745, "num_tokens": 32864075.0, "step": 18945 }, { "entropy": 5.550068044662476, "epoch": 1.4743824158723984, "grad_norm": 1.625, "learning_rate": 0.0004783584693451226, "loss": 5.3247, "mean_token_accuracy": 0.17061852365732194, "num_tokens": 32872615.0, "step": 18950 }, { "entropy": 5.596851968765259, "epoch": 1.4747714452441159, "grad_norm": 1.3203125, "learning_rate": 0.0004783466076780759, "loss": 5.1821, "mean_token_accuracy": 0.18105166256427765, "num_tokens": 32881313.0, "step": 18955 }, { "entropy": 5.535932636260986, "epoch": 1.4751604746158336, "grad_norm": 1.5234375, "learning_rate": 0.0004783347429255679, "loss": 5.2618, "mean_token_accuracy": 0.17378393709659576, "num_tokens": 32889323.0, "step": 18960 }, { "entropy": 5.382056617736817, "epoch": 1.475549503987551, "grad_norm": 2.5625, "learning_rate": 0.000478322875087779, "loss": 5.2122, "mean_token_accuracy": 0.17133685797452927, "num_tokens": 32898045.0, "step": 18965 }, { "entropy": 5.606275320053101, "epoch": 1.4759385333592685, "grad_norm": 1.3984375, "learning_rate": 0.00047831100416488906, "loss": 5.2937, "mean_token_accuracy": 0.16449671983718872, "num_tokens": 32906646.0, "step": 18970 }, { "entropy": 5.586366462707519, "epoch": 1.4763275627309862, "grad_norm": 1.328125, "learning_rate": 0.00047829913015707816, "loss": 5.276, "mean_token_accuracy": 0.18009517788887025, "num_tokens": 32915714.0, "step": 18975 }, { "entropy": 5.513172626495361, "epoch": 1.4767165921027037, "grad_norm": 1.390625, "learning_rate": 0.00047828725306452657, "loss": 5.3706, "mean_token_accuracy": 0.1678380027413368, "num_tokens": 32924996.0, "step": 18980 }, { "entropy": 5.512981271743774, "epoch": 1.4771056214744214, "grad_norm": 1.5078125, "learning_rate": 0.00047827537288741453, "loss": 5.1739, "mean_token_accuracy": 0.17783922106027603, "num_tokens": 32933550.0, "step": 18985 }, { "entropy": 5.588498878479004, "epoch": 1.4774946508461388, "grad_norm": 1.4921875, "learning_rate": 0.0004782634896259222, "loss": 5.2963, "mean_token_accuracy": 0.17333537638187407, "num_tokens": 32941800.0, "step": 18990 }, { "entropy": 5.510610628128052, "epoch": 1.4778836802178565, "grad_norm": 1.3203125, "learning_rate": 0.00047825160328023, "loss": 5.2754, "mean_token_accuracy": 0.17806044071912766, "num_tokens": 32951674.0, "step": 18995 }, { "entropy": 5.515177917480469, "epoch": 1.478272709589574, "grad_norm": 1.34375, "learning_rate": 0.0004782397138505181, "loss": 5.2085, "mean_token_accuracy": 0.1780326247215271, "num_tokens": 32959880.0, "step": 19000 }, { "entropy": 5.46801233291626, "epoch": 1.4786617389612915, "grad_norm": 1.53125, "learning_rate": 0.00047822782133696715, "loss": 5.2089, "mean_token_accuracy": 0.1779392957687378, "num_tokens": 32968557.0, "step": 19005 }, { "entropy": 5.643283653259277, "epoch": 1.4790507683330092, "grad_norm": 1.2890625, "learning_rate": 0.0004782159257397574, "loss": 5.3013, "mean_token_accuracy": 0.1736760750412941, "num_tokens": 32977519.0, "step": 19010 }, { "entropy": 5.605164241790772, "epoch": 1.4794397977047267, "grad_norm": 1.4921875, "learning_rate": 0.00047820402705906953, "loss": 5.2983, "mean_token_accuracy": 0.1751009404659271, "num_tokens": 32985917.0, "step": 19015 }, { "entropy": 5.442546033859253, "epoch": 1.4798288270764441, "grad_norm": 1.375, "learning_rate": 0.00047819212529508394, "loss": 5.2219, "mean_token_accuracy": 0.17615674436092377, "num_tokens": 32994612.0, "step": 19020 }, { "entropy": 5.510252857208252, "epoch": 1.4802178564481618, "grad_norm": 1.7890625, "learning_rate": 0.0004781802204479812, "loss": 5.3181, "mean_token_accuracy": 0.17805822640657426, "num_tokens": 33003528.0, "step": 19025 }, { "entropy": 5.508291482925415, "epoch": 1.4806068858198795, "grad_norm": 1.4765625, "learning_rate": 0.0004781683125179421, "loss": 5.1985, "mean_token_accuracy": 0.18396976590156555, "num_tokens": 33011685.0, "step": 19030 }, { "entropy": 5.5322174549102785, "epoch": 1.480995915191597, "grad_norm": 1.4296875, "learning_rate": 0.0004781564015051472, "loss": 5.241, "mean_token_accuracy": 0.18288617730140685, "num_tokens": 33020313.0, "step": 19035 }, { "entropy": 5.47178168296814, "epoch": 1.4813849445633145, "grad_norm": 1.703125, "learning_rate": 0.0004781444874097772, "loss": 5.2781, "mean_token_accuracy": 0.17470365464687349, "num_tokens": 33029143.0, "step": 19040 }, { "entropy": 5.494315099716187, "epoch": 1.4817739739350322, "grad_norm": 2.09375, "learning_rate": 0.00047813257023201307, "loss": 5.1964, "mean_token_accuracy": 0.1762500986456871, "num_tokens": 33038359.0, "step": 19045 }, { "entropy": 5.467061376571655, "epoch": 1.4821630033067497, "grad_norm": 1.3828125, "learning_rate": 0.0004781206499720354, "loss": 5.2529, "mean_token_accuracy": 0.17411217987537383, "num_tokens": 33046914.0, "step": 19050 }, { "entropy": 5.591938924789429, "epoch": 1.4825520326784671, "grad_norm": 1.5, "learning_rate": 0.00047810872663002523, "loss": 5.3421, "mean_token_accuracy": 0.17366454303264617, "num_tokens": 33054490.0, "step": 19055 }, { "entropy": 5.562242221832276, "epoch": 1.4829410620501848, "grad_norm": 1.734375, "learning_rate": 0.00047809680020616333, "loss": 5.391, "mean_token_accuracy": 0.17157071232795715, "num_tokens": 33064624.0, "step": 19060 }, { "entropy": 5.484333562850952, "epoch": 1.4833300914219023, "grad_norm": 1.40625, "learning_rate": 0.00047808487070063083, "loss": 5.1165, "mean_token_accuracy": 0.17980176955461502, "num_tokens": 33072581.0, "step": 19065 }, { "entropy": 5.520661783218384, "epoch": 1.4837191207936198, "grad_norm": 1.46875, "learning_rate": 0.0004780729381136086, "loss": 5.2819, "mean_token_accuracy": 0.178500497341156, "num_tokens": 33081696.0, "step": 19070 }, { "entropy": 5.533953046798706, "epoch": 1.4841081501653375, "grad_norm": 1.859375, "learning_rate": 0.0004780610024452778, "loss": 5.2499, "mean_token_accuracy": 0.17403241097927094, "num_tokens": 33090470.0, "step": 19075 }, { "entropy": 5.5420433521270756, "epoch": 1.4844971795370552, "grad_norm": 1.7578125, "learning_rate": 0.00047804906369581954, "loss": 5.3068, "mean_token_accuracy": 0.1782301813364029, "num_tokens": 33099006.0, "step": 19080 }, { "entropy": 5.4641313552856445, "epoch": 1.4848862089087727, "grad_norm": 1.53125, "learning_rate": 0.0004780371218654148, "loss": 5.1575, "mean_token_accuracy": 0.18589748591184616, "num_tokens": 33107715.0, "step": 19085 }, { "entropy": 5.525591039657593, "epoch": 1.4852752382804901, "grad_norm": 1.625, "learning_rate": 0.00047802517695424496, "loss": 5.1965, "mean_token_accuracy": 0.18338321894407272, "num_tokens": 33116895.0, "step": 19090 }, { "entropy": 5.5436680793762205, "epoch": 1.4856642676522078, "grad_norm": 1.3046875, "learning_rate": 0.0004780132289624913, "loss": 5.2482, "mean_token_accuracy": 0.17710049748420714, "num_tokens": 33125676.0, "step": 19095 }, { "entropy": 5.504342174530029, "epoch": 1.4860532970239253, "grad_norm": 1.875, "learning_rate": 0.0004780012778903349, "loss": 5.2414, "mean_token_accuracy": 0.1806422621011734, "num_tokens": 33134870.0, "step": 19100 }, { "entropy": 5.506136846542359, "epoch": 1.4864423263956428, "grad_norm": 1.546875, "learning_rate": 0.00047798932373795724, "loss": 5.3259, "mean_token_accuracy": 0.17531076222658157, "num_tokens": 33144258.0, "step": 19105 }, { "entropy": 5.574120378494262, "epoch": 1.4868313557673605, "grad_norm": 1.6015625, "learning_rate": 0.00047797736650553977, "loss": 5.2662, "mean_token_accuracy": 0.17567249685525893, "num_tokens": 33153703.0, "step": 19110 }, { "entropy": 5.570472526550293, "epoch": 1.487220385139078, "grad_norm": 1.6015625, "learning_rate": 0.00047796540619326366, "loss": 5.247, "mean_token_accuracy": 0.1701607197523117, "num_tokens": 33163092.0, "step": 19115 }, { "entropy": 5.511020660400391, "epoch": 1.4876094145107956, "grad_norm": 1.4375, "learning_rate": 0.0004779534428013107, "loss": 5.2518, "mean_token_accuracy": 0.17861293256282806, "num_tokens": 33172133.0, "step": 19120 }, { "entropy": 5.5301741600036625, "epoch": 1.4879984438825131, "grad_norm": 1.296875, "learning_rate": 0.00047794147632986223, "loss": 5.2577, "mean_token_accuracy": 0.17505211383104324, "num_tokens": 33180629.0, "step": 19125 }, { "entropy": 5.515226984024048, "epoch": 1.4883874732542308, "grad_norm": 1.546875, "learning_rate": 0.0004779295067790999, "loss": 5.209, "mean_token_accuracy": 0.17765021622180938, "num_tokens": 33189602.0, "step": 19130 }, { "entropy": 5.523668098449707, "epoch": 1.4887765026259483, "grad_norm": 1.515625, "learning_rate": 0.0004779175341492053, "loss": 5.2393, "mean_token_accuracy": 0.17363129705190658, "num_tokens": 33198403.0, "step": 19135 }, { "entropy": 5.474996280670166, "epoch": 1.4891655319976658, "grad_norm": 1.40625, "learning_rate": 0.0004779055584403601, "loss": 5.1822, "mean_token_accuracy": 0.17516040056943893, "num_tokens": 33207131.0, "step": 19140 }, { "entropy": 5.5032196044921875, "epoch": 1.4895545613693835, "grad_norm": 1.40625, "learning_rate": 0.000477893579652746, "loss": 5.2319, "mean_token_accuracy": 0.1749684691429138, "num_tokens": 33216143.0, "step": 19145 }, { "entropy": 5.491715717315674, "epoch": 1.489943590741101, "grad_norm": 1.3125, "learning_rate": 0.00047788159778654475, "loss": 5.227, "mean_token_accuracy": 0.18794695436954498, "num_tokens": 33224558.0, "step": 19150 }, { "entropy": 5.418473196029663, "epoch": 1.4903326201128184, "grad_norm": 1.2734375, "learning_rate": 0.00047786961284193813, "loss": 5.2249, "mean_token_accuracy": 0.1761377602815628, "num_tokens": 33232737.0, "step": 19155 }, { "entropy": 5.546581697463989, "epoch": 1.4907216494845361, "grad_norm": 1.6484375, "learning_rate": 0.0004778576248191081, "loss": 5.2419, "mean_token_accuracy": 0.17629723995923996, "num_tokens": 33240845.0, "step": 19160 }, { "entropy": 5.50310640335083, "epoch": 1.4911106788562536, "grad_norm": 1.3984375, "learning_rate": 0.0004778456337182365, "loss": 5.1486, "mean_token_accuracy": 0.18558304905891418, "num_tokens": 33249101.0, "step": 19165 }, { "entropy": 5.570547819137573, "epoch": 1.4914997082279713, "grad_norm": 1.625, "learning_rate": 0.0004778336395395052, "loss": 5.2546, "mean_token_accuracy": 0.17909433245658873, "num_tokens": 33258403.0, "step": 19170 }, { "entropy": 5.3771405696868895, "epoch": 1.4918887375996888, "grad_norm": 1.4453125, "learning_rate": 0.00047782164228309636, "loss": 5.1617, "mean_token_accuracy": 0.18375119864940642, "num_tokens": 33266679.0, "step": 19175 }, { "entropy": 5.477028846740723, "epoch": 1.4922777669714065, "grad_norm": 1.59375, "learning_rate": 0.00047780964194919193, "loss": 5.1756, "mean_token_accuracy": 0.1825355038046837, "num_tokens": 33274996.0, "step": 19180 }, { "entropy": 5.6039050102233885, "epoch": 1.492666796343124, "grad_norm": 1.578125, "learning_rate": 0.00047779763853797387, "loss": 5.297, "mean_token_accuracy": 0.17526201605796815, "num_tokens": 33282558.0, "step": 19185 }, { "entropy": 5.521491050720215, "epoch": 1.4930558257148414, "grad_norm": 1.59375, "learning_rate": 0.0004777856320496245, "loss": 5.2857, "mean_token_accuracy": 0.17085435837507248, "num_tokens": 33291233.0, "step": 19190 }, { "entropy": 5.516939544677735, "epoch": 1.493444855086559, "grad_norm": 1.4609375, "learning_rate": 0.000477773622484326, "loss": 5.1519, "mean_token_accuracy": 0.18402533680200578, "num_tokens": 33299821.0, "step": 19195 }, { "entropy": 5.497485160827637, "epoch": 1.4938338844582766, "grad_norm": 1.3203125, "learning_rate": 0.0004777616098422604, "loss": 5.243, "mean_token_accuracy": 0.1784694239497185, "num_tokens": 33309624.0, "step": 19200 }, { "entropy": 5.548103713989258, "epoch": 1.494222913829994, "grad_norm": 1.671875, "learning_rate": 0.00047774959412361014, "loss": 5.2534, "mean_token_accuracy": 0.17316729128360747, "num_tokens": 33318727.0, "step": 19205 }, { "entropy": 5.556207752227783, "epoch": 1.4946119432017118, "grad_norm": 1.5390625, "learning_rate": 0.0004777375753285575, "loss": 5.2643, "mean_token_accuracy": 0.17649584859609604, "num_tokens": 33327219.0, "step": 19210 }, { "entropy": 5.49752836227417, "epoch": 1.4950009725734292, "grad_norm": 1.4296875, "learning_rate": 0.00047772555345728486, "loss": 5.2436, "mean_token_accuracy": 0.17766701579093933, "num_tokens": 33336466.0, "step": 19215 }, { "entropy": 5.639565515518188, "epoch": 1.495390001945147, "grad_norm": 1.4453125, "learning_rate": 0.0004777135285099746, "loss": 5.3138, "mean_token_accuracy": 0.1677102193236351, "num_tokens": 33346040.0, "step": 19220 }, { "entropy": 5.583371782302857, "epoch": 1.4957790313168644, "grad_norm": 1.3203125, "learning_rate": 0.0004777015004868092, "loss": 5.2554, "mean_token_accuracy": 0.17835576236248016, "num_tokens": 33355476.0, "step": 19225 }, { "entropy": 5.427486371994019, "epoch": 1.496168060688582, "grad_norm": 1.5, "learning_rate": 0.0004776894693879712, "loss": 5.2101, "mean_token_accuracy": 0.1823199763894081, "num_tokens": 33364455.0, "step": 19230 }, { "entropy": 5.449832153320313, "epoch": 1.4965570900602996, "grad_norm": 1.265625, "learning_rate": 0.0004776774352136431, "loss": 5.1963, "mean_token_accuracy": 0.17985452711582184, "num_tokens": 33373129.0, "step": 19235 }, { "entropy": 5.468187570571899, "epoch": 1.496946119432017, "grad_norm": 1.7734375, "learning_rate": 0.00047766539796400756, "loss": 5.2227, "mean_token_accuracy": 0.17842733412981032, "num_tokens": 33382775.0, "step": 19240 }, { "entropy": 5.522367668151856, "epoch": 1.4973351488037348, "grad_norm": 1.3828125, "learning_rate": 0.0004776533576392471, "loss": 5.2179, "mean_token_accuracy": 0.17783847004175185, "num_tokens": 33391370.0, "step": 19245 }, { "entropy": 5.577925491333008, "epoch": 1.4977241781754522, "grad_norm": 1.25, "learning_rate": 0.0004776413142395445, "loss": 5.2231, "mean_token_accuracy": 0.18265827596187592, "num_tokens": 33399832.0, "step": 19250 }, { "entropy": 5.447705411911011, "epoch": 1.4981132075471697, "grad_norm": 1.2890625, "learning_rate": 0.00047762926776508244, "loss": 5.2702, "mean_token_accuracy": 0.17773692309856415, "num_tokens": 33408709.0, "step": 19255 }, { "entropy": 5.469012689590454, "epoch": 1.4985022369188874, "grad_norm": 1.9921875, "learning_rate": 0.00047761721821604387, "loss": 5.2526, "mean_token_accuracy": 0.17171256840229035, "num_tokens": 33416983.0, "step": 19260 }, { "entropy": 5.547253656387329, "epoch": 1.4988912662906049, "grad_norm": 1.6640625, "learning_rate": 0.0004776051655926115, "loss": 5.2792, "mean_token_accuracy": 0.17764000296592714, "num_tokens": 33426692.0, "step": 19265 }, { "entropy": 5.525631237030029, "epoch": 1.4992802956623226, "grad_norm": 1.75, "learning_rate": 0.00047759310989496813, "loss": 5.2771, "mean_token_accuracy": 0.1786951094865799, "num_tokens": 33434895.0, "step": 19270 }, { "entropy": 5.48480863571167, "epoch": 1.49966932503404, "grad_norm": 1.296875, "learning_rate": 0.0004775810511232969, "loss": 5.1799, "mean_token_accuracy": 0.17740183025598527, "num_tokens": 33443378.0, "step": 19275 }, { "entropy": 5.6220931053161625, "epoch": 1.5000583544057577, "grad_norm": 1.3984375, "learning_rate": 0.00047756898927778056, "loss": 5.3216, "mean_token_accuracy": 0.17830412834882736, "num_tokens": 33452753.0, "step": 19280 }, { "entropy": 5.612939500808716, "epoch": 1.5004473837774752, "grad_norm": 1.46875, "learning_rate": 0.00047755692435860227, "loss": 5.2736, "mean_token_accuracy": 0.17088256925344467, "num_tokens": 33461625.0, "step": 19285 }, { "entropy": 5.475265979766846, "epoch": 1.5008364131491927, "grad_norm": 1.3984375, "learning_rate": 0.000477544856365945, "loss": 5.2059, "mean_token_accuracy": 0.179485522210598, "num_tokens": 33471228.0, "step": 19290 }, { "entropy": 5.471999597549439, "epoch": 1.5012254425209104, "grad_norm": 1.421875, "learning_rate": 0.00047753278529999205, "loss": 5.2291, "mean_token_accuracy": 0.17918296307325363, "num_tokens": 33480137.0, "step": 19295 }, { "entropy": 5.535181331634521, "epoch": 1.5016144718926279, "grad_norm": 1.4453125, "learning_rate": 0.00047752071116092637, "loss": 5.2295, "mean_token_accuracy": 0.18213903903961182, "num_tokens": 33488860.0, "step": 19300 }, { "entropy": 5.5006327629089355, "epoch": 1.5020035012643453, "grad_norm": 1.6171875, "learning_rate": 0.0004775086339489312, "loss": 5.1929, "mean_token_accuracy": 0.17780565321445466, "num_tokens": 33497625.0, "step": 19305 }, { "entropy": 5.493137454986572, "epoch": 1.502392530636063, "grad_norm": 1.578125, "learning_rate": 0.0004774965536641899, "loss": 5.3801, "mean_token_accuracy": 0.16805230230093002, "num_tokens": 33506422.0, "step": 19310 }, { "entropy": 5.495547437667847, "epoch": 1.5027815600077807, "grad_norm": 1.421875, "learning_rate": 0.00047748447030688575, "loss": 5.1149, "mean_token_accuracy": 0.18306494504213333, "num_tokens": 33515638.0, "step": 19315 }, { "entropy": 5.507063627243042, "epoch": 1.503170589379498, "grad_norm": 1.296875, "learning_rate": 0.00047747238387720194, "loss": 5.1579, "mean_token_accuracy": 0.17949606329202653, "num_tokens": 33524287.0, "step": 19320 }, { "entropy": 5.469194650650024, "epoch": 1.5035596187512157, "grad_norm": 1.328125, "learning_rate": 0.000477460294375322, "loss": 5.169, "mean_token_accuracy": 0.17187461405992507, "num_tokens": 33532579.0, "step": 19325 }, { "entropy": 5.462903022766113, "epoch": 1.5039486481229334, "grad_norm": 1.65625, "learning_rate": 0.00047744820180142935, "loss": 5.2507, "mean_token_accuracy": 0.17614063024520873, "num_tokens": 33540816.0, "step": 19330 }, { "entropy": 5.43666410446167, "epoch": 1.5043376774946509, "grad_norm": 1.5078125, "learning_rate": 0.00047743610615570746, "loss": 5.1207, "mean_token_accuracy": 0.18905248045921325, "num_tokens": 33549383.0, "step": 19335 }, { "entropy": 5.44313154220581, "epoch": 1.5047267068663683, "grad_norm": 1.4453125, "learning_rate": 0.00047742400743833993, "loss": 5.1711, "mean_token_accuracy": 0.1888299450278282, "num_tokens": 33557457.0, "step": 19340 }, { "entropy": 5.536280107498169, "epoch": 1.505115736238086, "grad_norm": 1.5234375, "learning_rate": 0.0004774119056495102, "loss": 5.2773, "mean_token_accuracy": 0.1775692045688629, "num_tokens": 33565479.0, "step": 19345 }, { "entropy": 5.490532875061035, "epoch": 1.5055047656098035, "grad_norm": 1.375, "learning_rate": 0.00047739980078940206, "loss": 5.2402, "mean_token_accuracy": 0.1738107830286026, "num_tokens": 33574691.0, "step": 19350 }, { "entropy": 5.49760069847107, "epoch": 1.505893794981521, "grad_norm": 1.4140625, "learning_rate": 0.00047738769285819894, "loss": 5.0974, "mean_token_accuracy": 0.19047680944204332, "num_tokens": 33582360.0, "step": 19355 }, { "entropy": 5.417484474182129, "epoch": 1.5062828243532387, "grad_norm": 1.6484375, "learning_rate": 0.0004773755818560849, "loss": 5.2145, "mean_token_accuracy": 0.18156716525554656, "num_tokens": 33590977.0, "step": 19360 }, { "entropy": 5.421353960037232, "epoch": 1.5066718537249564, "grad_norm": 1.3515625, "learning_rate": 0.0004773634677832434, "loss": 5.1858, "mean_token_accuracy": 0.17915512025356292, "num_tokens": 33600227.0, "step": 19365 }, { "entropy": 5.555703830718994, "epoch": 1.5070608830966739, "grad_norm": 1.4375, "learning_rate": 0.0004773513506398584, "loss": 5.2418, "mean_token_accuracy": 0.1850794032216072, "num_tokens": 33608408.0, "step": 19370 }, { "entropy": 5.5497194766998295, "epoch": 1.5074499124683913, "grad_norm": 1.3671875, "learning_rate": 0.0004773392304261137, "loss": 5.163, "mean_token_accuracy": 0.17952251434326172, "num_tokens": 33616892.0, "step": 19375 }, { "entropy": 5.471491575241089, "epoch": 1.507838941840109, "grad_norm": 1.4375, "learning_rate": 0.0004773271071421933, "loss": 5.2719, "mean_token_accuracy": 0.17584420144557952, "num_tokens": 33626090.0, "step": 19380 }, { "entropy": 5.371228408813477, "epoch": 1.5082279712118265, "grad_norm": 1.4296875, "learning_rate": 0.00047731498078828105, "loss": 5.113, "mean_token_accuracy": 0.18904853612184525, "num_tokens": 33634855.0, "step": 19385 }, { "entropy": 5.534246635437012, "epoch": 1.508617000583544, "grad_norm": 1.4765625, "learning_rate": 0.000477302851364561, "loss": 5.2704, "mean_token_accuracy": 0.17462550103664398, "num_tokens": 33643425.0, "step": 19390 }, { "entropy": 5.6518120765686035, "epoch": 1.5090060299552617, "grad_norm": 1.34375, "learning_rate": 0.00047729071887121717, "loss": 5.3694, "mean_token_accuracy": 0.16821225732564926, "num_tokens": 33652926.0, "step": 19395 }, { "entropy": 5.577523469924927, "epoch": 1.5093950593269791, "grad_norm": 1.625, "learning_rate": 0.0004772785833084337, "loss": 5.2849, "mean_token_accuracy": 0.16904430240392684, "num_tokens": 33661279.0, "step": 19400 }, { "entropy": 5.459644746780396, "epoch": 1.5097840886986966, "grad_norm": 1.3515625, "learning_rate": 0.0004772664446763946, "loss": 5.1542, "mean_token_accuracy": 0.17910317182540894, "num_tokens": 33669717.0, "step": 19405 }, { "entropy": 5.519716501235962, "epoch": 1.5101731180704143, "grad_norm": 1.328125, "learning_rate": 0.0004772543029752842, "loss": 5.2944, "mean_token_accuracy": 0.17271620333194732, "num_tokens": 33679141.0, "step": 19410 }, { "entropy": 5.503009366989136, "epoch": 1.510562147442132, "grad_norm": 1.3515625, "learning_rate": 0.00047724215820528666, "loss": 5.1043, "mean_token_accuracy": 0.1840835064649582, "num_tokens": 33686867.0, "step": 19415 }, { "entropy": 5.514965438842774, "epoch": 1.5109511768138495, "grad_norm": 1.515625, "learning_rate": 0.0004772300103665863, "loss": 5.2052, "mean_token_accuracy": 0.18849213123321534, "num_tokens": 33695073.0, "step": 19420 }, { "entropy": 5.492791175842285, "epoch": 1.511340206185567, "grad_norm": 1.421875, "learning_rate": 0.00047721785945936733, "loss": 5.2865, "mean_token_accuracy": 0.17294924110174179, "num_tokens": 33703212.0, "step": 19425 }, { "entropy": 5.543099737167358, "epoch": 1.5117292355572847, "grad_norm": 1.265625, "learning_rate": 0.0004772057054838143, "loss": 5.2325, "mean_token_accuracy": 0.178933984041214, "num_tokens": 33711487.0, "step": 19430 }, { "entropy": 5.539937543869018, "epoch": 1.5121182649290021, "grad_norm": 1.640625, "learning_rate": 0.00047719354844011146, "loss": 5.3027, "mean_token_accuracy": 0.17686383575201034, "num_tokens": 33719642.0, "step": 19435 }, { "entropy": 5.452017545700073, "epoch": 1.5125072943007196, "grad_norm": 1.5078125, "learning_rate": 0.0004771813883284434, "loss": 5.2132, "mean_token_accuracy": 0.1760488346219063, "num_tokens": 33728167.0, "step": 19440 }, { "entropy": 5.487132215499878, "epoch": 1.5128963236724373, "grad_norm": 1.546875, "learning_rate": 0.00047716922514899455, "loss": 5.2183, "mean_token_accuracy": 0.18252888768911363, "num_tokens": 33736094.0, "step": 19445 }, { "entropy": 5.490319633483887, "epoch": 1.5132853530441548, "grad_norm": 1.6875, "learning_rate": 0.00047715705890194953, "loss": 5.1025, "mean_token_accuracy": 0.18678970783948898, "num_tokens": 33744416.0, "step": 19450 }, { "entropy": 5.535049533843994, "epoch": 1.5136743824158723, "grad_norm": 2.140625, "learning_rate": 0.00047714488958749285, "loss": 5.2294, "mean_token_accuracy": 0.18198212683200837, "num_tokens": 33752873.0, "step": 19455 }, { "entropy": 5.4473429203033445, "epoch": 1.51406341178759, "grad_norm": 1.6953125, "learning_rate": 0.00047713271720580924, "loss": 5.2055, "mean_token_accuracy": 0.17665968537330629, "num_tokens": 33761604.0, "step": 19460 }, { "entropy": 5.523878526687622, "epoch": 1.5144524411593077, "grad_norm": 1.46875, "learning_rate": 0.0004771205417570834, "loss": 5.2378, "mean_token_accuracy": 0.18237500339746476, "num_tokens": 33770562.0, "step": 19465 }, { "entropy": 5.526638126373291, "epoch": 1.5148414705310251, "grad_norm": 1.3515625, "learning_rate": 0.00047710836324150004, "loss": 5.1784, "mean_token_accuracy": 0.18329360336065292, "num_tokens": 33779037.0, "step": 19470 }, { "entropy": 5.4901021957397464, "epoch": 1.5152304999027426, "grad_norm": 1.546875, "learning_rate": 0.000477096181659244, "loss": 5.2452, "mean_token_accuracy": 0.18164824694395065, "num_tokens": 33787949.0, "step": 19475 }, { "entropy": 5.500197124481201, "epoch": 1.5156195292744603, "grad_norm": 1.34375, "learning_rate": 0.0004770839970105, "loss": 5.161, "mean_token_accuracy": 0.18387614339590072, "num_tokens": 33796783.0, "step": 19480 }, { "entropy": 5.528604984283447, "epoch": 1.5160085586461778, "grad_norm": 1.359375, "learning_rate": 0.00047707180929545295, "loss": 5.2021, "mean_token_accuracy": 0.17828374952077866, "num_tokens": 33804975.0, "step": 19485 }, { "entropy": 5.4207807064056395, "epoch": 1.5163975880178953, "grad_norm": 1.421875, "learning_rate": 0.00047705961851428786, "loss": 5.217, "mean_token_accuracy": 0.17787167727947234, "num_tokens": 33813355.0, "step": 19490 }, { "entropy": 5.450259447097778, "epoch": 1.516786617389613, "grad_norm": 1.3671875, "learning_rate": 0.00047704742466718973, "loss": 5.1799, "mean_token_accuracy": 0.18868510276079178, "num_tokens": 33821710.0, "step": 19495 }, { "entropy": 5.585661935806274, "epoch": 1.5171756467613304, "grad_norm": 1.3359375, "learning_rate": 0.00047703522775434354, "loss": 5.3466, "mean_token_accuracy": 0.17114655673503876, "num_tokens": 33830674.0, "step": 19500 }, { "entropy": 5.433118104934692, "epoch": 1.517564676133048, "grad_norm": 1.3984375, "learning_rate": 0.00047702302777593425, "loss": 5.1585, "mean_token_accuracy": 0.1804536372423172, "num_tokens": 33838963.0, "step": 19505 }, { "entropy": 5.537739515304565, "epoch": 1.5179537055047656, "grad_norm": 1.3125, "learning_rate": 0.00047701082473214715, "loss": 5.2981, "mean_token_accuracy": 0.17711785733699797, "num_tokens": 33847728.0, "step": 19510 }, { "entropy": 5.5240199089050295, "epoch": 1.5183427348764833, "grad_norm": 1.46875, "learning_rate": 0.00047699861862316725, "loss": 5.2805, "mean_token_accuracy": 0.18331485688686372, "num_tokens": 33856170.0, "step": 19515 }, { "entropy": 5.534817743301391, "epoch": 1.5187317642482008, "grad_norm": 1.46875, "learning_rate": 0.0004769864094491798, "loss": 5.2693, "mean_token_accuracy": 0.17890494912862778, "num_tokens": 33865531.0, "step": 19520 }, { "entropy": 5.564637756347656, "epoch": 1.5191207936199183, "grad_norm": 1.4140625, "learning_rate": 0.0004769741972103702, "loss": 5.1741, "mean_token_accuracy": 0.1755641967058182, "num_tokens": 33873976.0, "step": 19525 }, { "entropy": 5.477769804000855, "epoch": 1.519509822991636, "grad_norm": 1.4140625, "learning_rate": 0.00047696198190692353, "loss": 5.0558, "mean_token_accuracy": 0.19165010005235672, "num_tokens": 33881884.0, "step": 19530 }, { "entropy": 5.481703615188598, "epoch": 1.5198988523633534, "grad_norm": 1.5390625, "learning_rate": 0.0004769497635390253, "loss": 5.2998, "mean_token_accuracy": 0.17802365124225616, "num_tokens": 33890932.0, "step": 19535 }, { "entropy": 5.5093635559082035, "epoch": 1.520287881735071, "grad_norm": 1.3203125, "learning_rate": 0.0004769375421068608, "loss": 5.2395, "mean_token_accuracy": 0.17986425906419753, "num_tokens": 33899271.0, "step": 19540 }, { "entropy": 5.48005690574646, "epoch": 1.5206769111067886, "grad_norm": 1.5859375, "learning_rate": 0.00047692531761061555, "loss": 5.2722, "mean_token_accuracy": 0.1734055608510971, "num_tokens": 33908776.0, "step": 19545 }, { "entropy": 5.477955961227417, "epoch": 1.521065940478506, "grad_norm": 1.4140625, "learning_rate": 0.000476913090050475, "loss": 5.1584, "mean_token_accuracy": 0.18549179583787917, "num_tokens": 33917424.0, "step": 19550 }, { "entropy": 5.561444520950317, "epoch": 1.5214549698502235, "grad_norm": 1.34375, "learning_rate": 0.00047690085942662464, "loss": 5.2409, "mean_token_accuracy": 0.1757921427488327, "num_tokens": 33925948.0, "step": 19555 }, { "entropy": 5.540966939926148, "epoch": 1.5218439992219412, "grad_norm": 1.296875, "learning_rate": 0.00047688862573925015, "loss": 5.2657, "mean_token_accuracy": 0.1819721519947052, "num_tokens": 33934623.0, "step": 19560 }, { "entropy": 5.499468040466309, "epoch": 1.522233028593659, "grad_norm": 1.40625, "learning_rate": 0.00047687638898853707, "loss": 5.2651, "mean_token_accuracy": 0.17442897260189055, "num_tokens": 33943871.0, "step": 19565 }, { "entropy": 5.559149694442749, "epoch": 1.5226220579653764, "grad_norm": 1.3984375, "learning_rate": 0.0004768641491746711, "loss": 5.2328, "mean_token_accuracy": 0.17475976943969726, "num_tokens": 33953032.0, "step": 19570 }, { "entropy": 5.515017557144165, "epoch": 1.523011087337094, "grad_norm": 1.4375, "learning_rate": 0.000476851906297838, "loss": 5.2703, "mean_token_accuracy": 0.17934996038675308, "num_tokens": 33961702.0, "step": 19575 }, { "entropy": 5.515548610687256, "epoch": 1.5234001167088116, "grad_norm": 1.296875, "learning_rate": 0.00047683966035822346, "loss": 5.2907, "mean_token_accuracy": 0.17442075312137603, "num_tokens": 33970996.0, "step": 19580 }, { "entropy": 5.560163354873657, "epoch": 1.523789146080529, "grad_norm": 1.328125, "learning_rate": 0.00047682741135601336, "loss": 5.2671, "mean_token_accuracy": 0.17682661414146422, "num_tokens": 33980445.0, "step": 19585 }, { "entropy": 5.546480560302735, "epoch": 1.5241781754522465, "grad_norm": 1.6796875, "learning_rate": 0.00047681515929139356, "loss": 5.1924, "mean_token_accuracy": 0.17978233397006987, "num_tokens": 33989042.0, "step": 19590 }, { "entropy": 5.400068187713623, "epoch": 1.5245672048239642, "grad_norm": 1.53125, "learning_rate": 0.00047680290416454995, "loss": 5.087, "mean_token_accuracy": 0.1935490220785141, "num_tokens": 33998162.0, "step": 19595 }, { "entropy": 5.455098581314087, "epoch": 1.524956234195682, "grad_norm": 1.5703125, "learning_rate": 0.0004767906459756684, "loss": 5.2001, "mean_token_accuracy": 0.18574739545583724, "num_tokens": 34007480.0, "step": 19600 }, { "entropy": 5.476698589324951, "epoch": 1.5253452635673992, "grad_norm": 1.5859375, "learning_rate": 0.00047677838472493504, "loss": 5.2068, "mean_token_accuracy": 0.17758456617593765, "num_tokens": 34015605.0, "step": 19605 }, { "entropy": 5.539534568786621, "epoch": 1.5257342929391169, "grad_norm": 1.453125, "learning_rate": 0.0004767661204125358, "loss": 5.3378, "mean_token_accuracy": 0.172260582447052, "num_tokens": 34024847.0, "step": 19610 }, { "entropy": 5.507574892044067, "epoch": 1.5261233223108346, "grad_norm": 1.4140625, "learning_rate": 0.0004767538530386569, "loss": 5.2114, "mean_token_accuracy": 0.17498655766248702, "num_tokens": 34034205.0, "step": 19615 }, { "entropy": 5.542208528518676, "epoch": 1.526512351682552, "grad_norm": 1.4921875, "learning_rate": 0.00047674158260348437, "loss": 5.1349, "mean_token_accuracy": 0.18341722786426545, "num_tokens": 34042578.0, "step": 19620 }, { "entropy": 5.490110778808594, "epoch": 1.5269013810542695, "grad_norm": 1.3671875, "learning_rate": 0.00047672930910720436, "loss": 5.2068, "mean_token_accuracy": 0.18112893104553224, "num_tokens": 34051699.0, "step": 19625 }, { "entropy": 5.412960624694824, "epoch": 1.5272904104259872, "grad_norm": 1.3125, "learning_rate": 0.00047671703255000326, "loss": 5.2156, "mean_token_accuracy": 0.17743537127971648, "num_tokens": 34060872.0, "step": 19630 }, { "entropy": 5.495071268081665, "epoch": 1.5276794397977047, "grad_norm": 1.4296875, "learning_rate": 0.0004767047529320673, "loss": 5.2585, "mean_token_accuracy": 0.17518007159233093, "num_tokens": 34069501.0, "step": 19635 }, { "entropy": 5.5749565124511715, "epoch": 1.5280684691694222, "grad_norm": 1.25, "learning_rate": 0.00047669247025358257, "loss": 5.3057, "mean_token_accuracy": 0.1733539342880249, "num_tokens": 34078573.0, "step": 19640 }, { "entropy": 5.506174993515015, "epoch": 1.5284574985411399, "grad_norm": 1.328125, "learning_rate": 0.00047668018451473584, "loss": 5.2502, "mean_token_accuracy": 0.17640733271837233, "num_tokens": 34087270.0, "step": 19645 }, { "entropy": 5.487158155441284, "epoch": 1.5288465279128576, "grad_norm": 1.4453125, "learning_rate": 0.0004766678957157132, "loss": 5.279, "mean_token_accuracy": 0.17368052005767823, "num_tokens": 34096205.0, "step": 19650 }, { "entropy": 5.477304410934448, "epoch": 1.5292355572845748, "grad_norm": 1.3125, "learning_rate": 0.0004766556038567013, "loss": 5.1091, "mean_token_accuracy": 0.1881142407655716, "num_tokens": 34104736.0, "step": 19655 }, { "entropy": 5.521236848831177, "epoch": 1.5296245866562925, "grad_norm": 1.296875, "learning_rate": 0.0004766433089378865, "loss": 5.2285, "mean_token_accuracy": 0.18070223331451415, "num_tokens": 34113420.0, "step": 19660 }, { "entropy": 5.556590986251831, "epoch": 1.5300136160280102, "grad_norm": 1.40625, "learning_rate": 0.00047663101095945544, "loss": 5.3078, "mean_token_accuracy": 0.16629046946763992, "num_tokens": 34121702.0, "step": 19665 }, { "entropy": 5.5381275653839115, "epoch": 1.5304026453997277, "grad_norm": 1.40625, "learning_rate": 0.00047661870992159476, "loss": 5.1991, "mean_token_accuracy": 0.17533429712057114, "num_tokens": 34129657.0, "step": 19670 }, { "entropy": 5.510898780822754, "epoch": 1.5307916747714452, "grad_norm": 1.75, "learning_rate": 0.00047660640582449106, "loss": 5.3392, "mean_token_accuracy": 0.1726617157459259, "num_tokens": 34138078.0, "step": 19675 }, { "entropy": 5.532526254653931, "epoch": 1.5311807041431629, "grad_norm": 1.421875, "learning_rate": 0.00047659409866833104, "loss": 5.208, "mean_token_accuracy": 0.17718277871608734, "num_tokens": 34146402.0, "step": 19680 }, { "entropy": 5.593402957916259, "epoch": 1.5315697335148803, "grad_norm": 1.4453125, "learning_rate": 0.0004765817884533014, "loss": 5.3406, "mean_token_accuracy": 0.17491628229618073, "num_tokens": 34155909.0, "step": 19685 }, { "entropy": 5.443002796173095, "epoch": 1.5319587628865978, "grad_norm": 2.859375, "learning_rate": 0.000476569475179589, "loss": 5.1955, "mean_token_accuracy": 0.17626997977495193, "num_tokens": 34164598.0, "step": 19690 }, { "entropy": 5.490495204925537, "epoch": 1.5323477922583155, "grad_norm": 1.578125, "learning_rate": 0.00047655715884738074, "loss": 5.2364, "mean_token_accuracy": 0.17988378256559373, "num_tokens": 34173476.0, "step": 19695 }, { "entropy": 5.51881685256958, "epoch": 1.5327368216300332, "grad_norm": 1.3671875, "learning_rate": 0.0004765448394568632, "loss": 5.2607, "mean_token_accuracy": 0.17252431511878968, "num_tokens": 34181986.0, "step": 19700 }, { "entropy": 5.490952825546264, "epoch": 1.5331258510017505, "grad_norm": 1.390625, "learning_rate": 0.0004765325170082237, "loss": 5.2343, "mean_token_accuracy": 0.17885182052850723, "num_tokens": 34190477.0, "step": 19705 }, { "entropy": 5.420037317276001, "epoch": 1.5335148803734682, "grad_norm": 1.484375, "learning_rate": 0.000476520191501649, "loss": 5.1337, "mean_token_accuracy": 0.18653440922498704, "num_tokens": 34198955.0, "step": 19710 }, { "entropy": 5.56107873916626, "epoch": 1.5339039097451859, "grad_norm": 1.296875, "learning_rate": 0.00047650786293732607, "loss": 5.3278, "mean_token_accuracy": 0.1705892026424408, "num_tokens": 34207744.0, "step": 19715 }, { "entropy": 5.500405502319336, "epoch": 1.5342929391169033, "grad_norm": 1.34375, "learning_rate": 0.0004764955313154421, "loss": 5.2267, "mean_token_accuracy": 0.1827854871749878, "num_tokens": 34215935.0, "step": 19720 }, { "entropy": 5.500259351730347, "epoch": 1.5346819684886208, "grad_norm": 1.28125, "learning_rate": 0.00047648319663618415, "loss": 5.2572, "mean_token_accuracy": 0.17511722147464753, "num_tokens": 34224990.0, "step": 19725 }, { "entropy": 5.490764236450195, "epoch": 1.5350709978603385, "grad_norm": 1.359375, "learning_rate": 0.00047647085889973936, "loss": 5.1639, "mean_token_accuracy": 0.17535528540611267, "num_tokens": 34232928.0, "step": 19730 }, { "entropy": 5.4304577827453615, "epoch": 1.535460027232056, "grad_norm": 1.2734375, "learning_rate": 0.00047645851810629503, "loss": 5.1248, "mean_token_accuracy": 0.18983405232429504, "num_tokens": 34241434.0, "step": 19735 }, { "entropy": 5.448640394210815, "epoch": 1.5358490566037735, "grad_norm": 1.296875, "learning_rate": 0.00047644617425603825, "loss": 5.1878, "mean_token_accuracy": 0.18371172100305558, "num_tokens": 34250067.0, "step": 19740 }, { "entropy": 5.5160462856292725, "epoch": 1.5362380859754912, "grad_norm": 1.6171875, "learning_rate": 0.0004764338273491565, "loss": 5.2585, "mean_token_accuracy": 0.17849910706281663, "num_tokens": 34258656.0, "step": 19745 }, { "entropy": 5.497633218765259, "epoch": 1.5366271153472089, "grad_norm": 1.375, "learning_rate": 0.00047642147738583695, "loss": 5.3363, "mean_token_accuracy": 0.1677684485912323, "num_tokens": 34267417.0, "step": 19750 }, { "entropy": 5.501345634460449, "epoch": 1.5370161447189261, "grad_norm": 1.3828125, "learning_rate": 0.0004764091243662671, "loss": 5.1136, "mean_token_accuracy": 0.18635567128658295, "num_tokens": 34275334.0, "step": 19755 }, { "entropy": 5.474584245681763, "epoch": 1.5374051740906438, "grad_norm": 1.4453125, "learning_rate": 0.00047639676829063437, "loss": 5.267, "mean_token_accuracy": 0.17711216062307358, "num_tokens": 34284016.0, "step": 19760 }, { "entropy": 5.422528028488159, "epoch": 1.5377942034623615, "grad_norm": 1.640625, "learning_rate": 0.00047638440915912623, "loss": 5.1803, "mean_token_accuracy": 0.18633621633052827, "num_tokens": 34292747.0, "step": 19765 }, { "entropy": 5.4854660987854, "epoch": 1.538183232834079, "grad_norm": 1.6484375, "learning_rate": 0.0004763720469719303, "loss": 5.1284, "mean_token_accuracy": 0.18211973756551741, "num_tokens": 34301764.0, "step": 19770 }, { "entropy": 5.45488920211792, "epoch": 1.5385722622057965, "grad_norm": 1.5703125, "learning_rate": 0.000476359681729234, "loss": 5.2554, "mean_token_accuracy": 0.180397367477417, "num_tokens": 34310522.0, "step": 19775 }, { "entropy": 5.5550501346588135, "epoch": 1.5389612915775142, "grad_norm": 1.4765625, "learning_rate": 0.000476347313431225, "loss": 5.2454, "mean_token_accuracy": 0.1829739987850189, "num_tokens": 34319342.0, "step": 19780 }, { "entropy": 5.654476547241211, "epoch": 1.5393503209492316, "grad_norm": 1.4296875, "learning_rate": 0.00047633494207809096, "loss": 5.349, "mean_token_accuracy": 0.17210122644901277, "num_tokens": 34327468.0, "step": 19785 }, { "entropy": 5.552998638153076, "epoch": 1.539739350320949, "grad_norm": 1.40625, "learning_rate": 0.00047632256767001977, "loss": 5.3085, "mean_token_accuracy": 0.17831750959157944, "num_tokens": 34336484.0, "step": 19790 }, { "entropy": 5.433817720413208, "epoch": 1.5401283796926668, "grad_norm": 1.390625, "learning_rate": 0.000476310190207199, "loss": 5.121, "mean_token_accuracy": 0.18866233229637147, "num_tokens": 34344708.0, "step": 19795 }, { "entropy": 5.497208499908448, "epoch": 1.5405174090643845, "grad_norm": 1.5390625, "learning_rate": 0.00047629780968981653, "loss": 5.1789, "mean_token_accuracy": 0.17989312559366227, "num_tokens": 34352757.0, "step": 19800 }, { "entropy": 5.498340320587158, "epoch": 1.540906438436102, "grad_norm": 1.5234375, "learning_rate": 0.00047628542611806007, "loss": 5.1837, "mean_token_accuracy": 0.18371548503637314, "num_tokens": 34362070.0, "step": 19805 }, { "entropy": 5.472554445266724, "epoch": 1.5412954678078195, "grad_norm": 1.84375, "learning_rate": 0.00047627303949211773, "loss": 5.2068, "mean_token_accuracy": 0.17690205425024033, "num_tokens": 34370136.0, "step": 19810 }, { "entropy": 5.441941928863526, "epoch": 1.5416844971795371, "grad_norm": 1.359375, "learning_rate": 0.0004762606498121774, "loss": 5.1586, "mean_token_accuracy": 0.18312578350305558, "num_tokens": 34378534.0, "step": 19815 }, { "entropy": 5.4551536560058596, "epoch": 1.5420735265512546, "grad_norm": 1.390625, "learning_rate": 0.000476248257078427, "loss": 5.155, "mean_token_accuracy": 0.18011748045682907, "num_tokens": 34386313.0, "step": 19820 }, { "entropy": 5.466526460647583, "epoch": 1.542462555922972, "grad_norm": 1.3359375, "learning_rate": 0.0004762358612910547, "loss": 5.2162, "mean_token_accuracy": 0.18401468992233277, "num_tokens": 34394566.0, "step": 19825 }, { "entropy": 5.451198577880859, "epoch": 1.5428515852946898, "grad_norm": 1.3984375, "learning_rate": 0.0004762234624502484, "loss": 5.1038, "mean_token_accuracy": 0.18378186076879502, "num_tokens": 34403177.0, "step": 19830 }, { "entropy": 5.5477441310882565, "epoch": 1.5432406146664073, "grad_norm": 1.75, "learning_rate": 0.00047621106055619644, "loss": 5.2504, "mean_token_accuracy": 0.18197994977235793, "num_tokens": 34411577.0, "step": 19835 }, { "entropy": 5.44796199798584, "epoch": 1.5436296440381247, "grad_norm": 1.2578125, "learning_rate": 0.00047619865560908687, "loss": 5.2403, "mean_token_accuracy": 0.17166987657546998, "num_tokens": 34420649.0, "step": 19840 }, { "entropy": 5.490853643417358, "epoch": 1.5440186734098424, "grad_norm": 1.3359375, "learning_rate": 0.0004761862476091079, "loss": 5.1491, "mean_token_accuracy": 0.1853147879242897, "num_tokens": 34429778.0, "step": 19845 }, { "entropy": 5.536733770370484, "epoch": 1.5444077027815601, "grad_norm": 2.0, "learning_rate": 0.00047617383655644785, "loss": 5.2474, "mean_token_accuracy": 0.17991104274988173, "num_tokens": 34438412.0, "step": 19850 }, { "entropy": 5.500594711303711, "epoch": 1.5447967321532776, "grad_norm": 1.53125, "learning_rate": 0.0004761614224512951, "loss": 5.2341, "mean_token_accuracy": 0.17307254076004028, "num_tokens": 34447022.0, "step": 19855 }, { "entropy": 5.505466651916504, "epoch": 1.545185761524995, "grad_norm": 1.3671875, "learning_rate": 0.0004761490052938379, "loss": 5.2752, "mean_token_accuracy": 0.17882970869541168, "num_tokens": 34455502.0, "step": 19860 }, { "entropy": 5.46995792388916, "epoch": 1.5455747908967128, "grad_norm": 1.53125, "learning_rate": 0.0004761365850842646, "loss": 5.2091, "mean_token_accuracy": 0.17881093323230743, "num_tokens": 34463682.0, "step": 19865 }, { "entropy": 5.4828651428222654, "epoch": 1.5459638202684303, "grad_norm": 1.5703125, "learning_rate": 0.0004761241618227639, "loss": 5.1368, "mean_token_accuracy": 0.18842589110136032, "num_tokens": 34471678.0, "step": 19870 }, { "entropy": 5.447758388519287, "epoch": 1.5463528496401477, "grad_norm": 1.5078125, "learning_rate": 0.00047611173550952414, "loss": 5.1516, "mean_token_accuracy": 0.18642189353704453, "num_tokens": 34479830.0, "step": 19875 }, { "entropy": 5.490526628494263, "epoch": 1.5467418790118654, "grad_norm": 1.4140625, "learning_rate": 0.00047609930614473387, "loss": 5.2329, "mean_token_accuracy": 0.1749920517206192, "num_tokens": 34487445.0, "step": 19880 }, { "entropy": 5.439973926544189, "epoch": 1.547130908383583, "grad_norm": 1.3203125, "learning_rate": 0.00047608687372858175, "loss": 5.1097, "mean_token_accuracy": 0.18481873273849486, "num_tokens": 34496306.0, "step": 19885 }, { "entropy": 5.4423408031463625, "epoch": 1.5475199377553004, "grad_norm": 1.40625, "learning_rate": 0.00047607443826125633, "loss": 5.223, "mean_token_accuracy": 0.18217843919992446, "num_tokens": 34505067.0, "step": 19890 }, { "entropy": 5.577670431137085, "epoch": 1.547908967127018, "grad_norm": 1.4765625, "learning_rate": 0.00047606199974294637, "loss": 5.3308, "mean_token_accuracy": 0.17201985120773317, "num_tokens": 34513947.0, "step": 19895 }, { "entropy": 5.595619869232178, "epoch": 1.5482979964987358, "grad_norm": 1.75, "learning_rate": 0.0004760495581738406, "loss": 5.3579, "mean_token_accuracy": 0.1698410466313362, "num_tokens": 34523383.0, "step": 19900 }, { "entropy": 5.517604017257691, "epoch": 1.5486870258704533, "grad_norm": 1.3984375, "learning_rate": 0.0004760371135541278, "loss": 5.1609, "mean_token_accuracy": 0.1815445527434349, "num_tokens": 34532376.0, "step": 19905 }, { "entropy": 5.633794975280762, "epoch": 1.5490760552421707, "grad_norm": 1.3828125, "learning_rate": 0.0004760246658839967, "loss": 5.3244, "mean_token_accuracy": 0.1725177586078644, "num_tokens": 34541075.0, "step": 19910 }, { "entropy": 5.488174247741699, "epoch": 1.5494650846138884, "grad_norm": 1.2890625, "learning_rate": 0.0004760122151636364, "loss": 5.1303, "mean_token_accuracy": 0.18467805832624434, "num_tokens": 34550296.0, "step": 19915 }, { "entropy": 5.496546077728271, "epoch": 1.549854113985606, "grad_norm": 1.3671875, "learning_rate": 0.0004759997613932356, "loss": 5.2673, "mean_token_accuracy": 0.17745690494775773, "num_tokens": 34559185.0, "step": 19920 }, { "entropy": 5.591800928115845, "epoch": 1.5502431433573234, "grad_norm": 1.3984375, "learning_rate": 0.00047598730457298335, "loss": 5.2671, "mean_token_accuracy": 0.17782671451568605, "num_tokens": 34568018.0, "step": 19925 }, { "entropy": 5.539928197860718, "epoch": 1.550632172729041, "grad_norm": 1.4140625, "learning_rate": 0.00047597484470306866, "loss": 5.2757, "mean_token_accuracy": 0.18031223565340043, "num_tokens": 34576835.0, "step": 19930 }, { "entropy": 5.514178514480591, "epoch": 1.5510212021007586, "grad_norm": 1.4140625, "learning_rate": 0.0004759623817836806, "loss": 5.2019, "mean_token_accuracy": 0.18242556899785994, "num_tokens": 34585426.0, "step": 19935 }, { "entropy": 5.47841248512268, "epoch": 1.551410231472476, "grad_norm": 1.3984375, "learning_rate": 0.0004759499158150082, "loss": 5.2561, "mean_token_accuracy": 0.17484237104654313, "num_tokens": 34594428.0, "step": 19940 }, { "entropy": 5.550037002563476, "epoch": 1.5517992608441937, "grad_norm": 1.5078125, "learning_rate": 0.00047593744679724076, "loss": 5.2841, "mean_token_accuracy": 0.1782570242881775, "num_tokens": 34603736.0, "step": 19945 }, { "entropy": 5.572537994384765, "epoch": 1.5521882902159114, "grad_norm": 1.484375, "learning_rate": 0.00047592497473056733, "loss": 5.2563, "mean_token_accuracy": 0.17629345506429672, "num_tokens": 34613295.0, "step": 19950 }, { "entropy": 5.442608213424682, "epoch": 1.552577319587629, "grad_norm": 1.4140625, "learning_rate": 0.00047591249961517724, "loss": 5.2058, "mean_token_accuracy": 0.1787840574979782, "num_tokens": 34622955.0, "step": 19955 }, { "entropy": 5.43725905418396, "epoch": 1.5529663489593464, "grad_norm": 1.5078125, "learning_rate": 0.0004759000214512598, "loss": 5.209, "mean_token_accuracy": 0.1802055209875107, "num_tokens": 34631866.0, "step": 19960 }, { "entropy": 5.546178340911865, "epoch": 1.553355378331064, "grad_norm": 1.546875, "learning_rate": 0.0004758875402390042, "loss": 5.2882, "mean_token_accuracy": 0.17883485406637192, "num_tokens": 34640281.0, "step": 19965 }, { "entropy": 5.563056135177613, "epoch": 1.5537444077027815, "grad_norm": 1.6328125, "learning_rate": 0.00047587505597859996, "loss": 5.2577, "mean_token_accuracy": 0.1743539720773697, "num_tokens": 34649080.0, "step": 19970 }, { "entropy": 5.471347713470459, "epoch": 1.554133437074499, "grad_norm": 1.4296875, "learning_rate": 0.00047586256867023646, "loss": 5.2033, "mean_token_accuracy": 0.182217738032341, "num_tokens": 34657969.0, "step": 19975 }, { "entropy": 5.536583137512207, "epoch": 1.5545224664462167, "grad_norm": 1.3515625, "learning_rate": 0.0004758500783141032, "loss": 5.3468, "mean_token_accuracy": 0.17523048669099808, "num_tokens": 34667187.0, "step": 19980 }, { "entropy": 5.51764669418335, "epoch": 1.5549114958179344, "grad_norm": 1.296875, "learning_rate": 0.0004758375849103897, "loss": 5.1836, "mean_token_accuracy": 0.17960923463106154, "num_tokens": 34676292.0, "step": 19985 }, { "entropy": 5.548939990997314, "epoch": 1.5553005251896517, "grad_norm": 1.6796875, "learning_rate": 0.0004758250884592855, "loss": 5.2907, "mean_token_accuracy": 0.17781132757663726, "num_tokens": 34685198.0, "step": 19990 }, { "entropy": 5.479723691940308, "epoch": 1.5556895545613694, "grad_norm": 1.4453125, "learning_rate": 0.00047581258896098024, "loss": 5.109, "mean_token_accuracy": 0.19083650261163712, "num_tokens": 34694019.0, "step": 19995 }, { "entropy": 5.526100778579712, "epoch": 1.556078583933087, "grad_norm": 1.453125, "learning_rate": 0.0004758000864156636, "loss": 5.2558, "mean_token_accuracy": 0.17508168518543243, "num_tokens": 34703183.0, "step": 20000 }, { "entropy": 5.500713443756103, "epoch": 1.5564676133048045, "grad_norm": 1.28125, "learning_rate": 0.00047578758082352527, "loss": 5.2231, "mean_token_accuracy": 0.175339911878109, "num_tokens": 34711049.0, "step": 20005 }, { "entropy": 5.505970239639282, "epoch": 1.556856642676522, "grad_norm": 1.265625, "learning_rate": 0.00047577507218475487, "loss": 5.3026, "mean_token_accuracy": 0.1678979679942131, "num_tokens": 34720130.0, "step": 20010 }, { "entropy": 5.581413412094117, "epoch": 1.5572456720482397, "grad_norm": 1.375, "learning_rate": 0.00047576256049954236, "loss": 5.2633, "mean_token_accuracy": 0.18482479006052016, "num_tokens": 34728791.0, "step": 20015 }, { "entropy": 5.416379833221436, "epoch": 1.5576347014199572, "grad_norm": 1.515625, "learning_rate": 0.0004757500457680776, "loss": 5.047, "mean_token_accuracy": 0.18813843578100203, "num_tokens": 34737470.0, "step": 20020 }, { "entropy": 5.446556568145752, "epoch": 1.5580237307916747, "grad_norm": 1.3671875, "learning_rate": 0.0004757375279905504, "loss": 5.2406, "mean_token_accuracy": 0.17581817060708999, "num_tokens": 34745774.0, "step": 20025 }, { "entropy": 5.398502254486084, "epoch": 1.5584127601633924, "grad_norm": 1.328125, "learning_rate": 0.00047572500716715075, "loss": 5.1243, "mean_token_accuracy": 0.1879748821258545, "num_tokens": 34753649.0, "step": 20030 }, { "entropy": 5.539699745178223, "epoch": 1.55880178953511, "grad_norm": 1.4140625, "learning_rate": 0.00047571248329806855, "loss": 5.2084, "mean_token_accuracy": 0.18214959949254989, "num_tokens": 34761833.0, "step": 20035 }, { "entropy": 5.467098426818848, "epoch": 1.5591908189068273, "grad_norm": 1.34375, "learning_rate": 0.00047569995638349383, "loss": 5.1837, "mean_token_accuracy": 0.17986234724521638, "num_tokens": 34770969.0, "step": 20040 }, { "entropy": 5.504928064346314, "epoch": 1.559579848278545, "grad_norm": 1.3984375, "learning_rate": 0.0004756874264236168, "loss": 5.2555, "mean_token_accuracy": 0.1732724726200104, "num_tokens": 34779860.0, "step": 20045 }, { "entropy": 5.512750959396362, "epoch": 1.5599688776502627, "grad_norm": 1.53125, "learning_rate": 0.00047567489341862753, "loss": 5.1722, "mean_token_accuracy": 0.18275004476308823, "num_tokens": 34788816.0, "step": 20050 }, { "entropy": 5.417970657348633, "epoch": 1.5603579070219802, "grad_norm": 1.3984375, "learning_rate": 0.00047566235736871607, "loss": 5.2677, "mean_token_accuracy": 0.17720874398946762, "num_tokens": 34797784.0, "step": 20055 }, { "entropy": 5.46078052520752, "epoch": 1.5607469363936977, "grad_norm": 1.6171875, "learning_rate": 0.00047564981827407277, "loss": 5.1076, "mean_token_accuracy": 0.19123952388763427, "num_tokens": 34806553.0, "step": 20060 }, { "entropy": 5.473185634613037, "epoch": 1.5611359657654154, "grad_norm": 1.3828125, "learning_rate": 0.00047563727613488785, "loss": 5.1359, "mean_token_accuracy": 0.1809887170791626, "num_tokens": 34814854.0, "step": 20065 }, { "entropy": 5.4507176876068115, "epoch": 1.5615249951371328, "grad_norm": 1.390625, "learning_rate": 0.00047562473095135154, "loss": 5.317, "mean_token_accuracy": 0.1838538318872452, "num_tokens": 34823147.0, "step": 20070 }, { "entropy": 5.517060995101929, "epoch": 1.5619140245088503, "grad_norm": 1.3671875, "learning_rate": 0.0004756121827236544, "loss": 5.1878, "mean_token_accuracy": 0.188933427631855, "num_tokens": 34831335.0, "step": 20075 }, { "entropy": 5.562550687789917, "epoch": 1.562303053880568, "grad_norm": 1.4296875, "learning_rate": 0.0004755996314519866, "loss": 5.2583, "mean_token_accuracy": 0.17847694605588912, "num_tokens": 34840118.0, "step": 20080 }, { "entropy": 5.479040861129761, "epoch": 1.5626920832522857, "grad_norm": 1.671875, "learning_rate": 0.0004755870771365387, "loss": 5.2501, "mean_token_accuracy": 0.17598040252923966, "num_tokens": 34848851.0, "step": 20085 }, { "entropy": 5.474196910858154, "epoch": 1.563081112624003, "grad_norm": 1.3515625, "learning_rate": 0.00047557451977750113, "loss": 5.1292, "mean_token_accuracy": 0.18570237308740617, "num_tokens": 34857660.0, "step": 20090 }, { "entropy": 5.477176094055176, "epoch": 1.5634701419957207, "grad_norm": 1.3515625, "learning_rate": 0.0004755619593750645, "loss": 5.1808, "mean_token_accuracy": 0.18108201622962952, "num_tokens": 34866828.0, "step": 20095 }, { "entropy": 5.542474794387817, "epoch": 1.5638591713674383, "grad_norm": 1.34375, "learning_rate": 0.0004755493959294194, "loss": 5.3232, "mean_token_accuracy": 0.1698934778571129, "num_tokens": 34875461.0, "step": 20100 }, { "entropy": 5.429262256622314, "epoch": 1.5642482007391558, "grad_norm": 1.3828125, "learning_rate": 0.0004755368294407564, "loss": 5.1674, "mean_token_accuracy": 0.17874481230974198, "num_tokens": 34883914.0, "step": 20105 }, { "entropy": 5.504143095016479, "epoch": 1.5646372301108733, "grad_norm": 1.40625, "learning_rate": 0.0004755242599092662, "loss": 5.3103, "mean_token_accuracy": 0.1787399411201477, "num_tokens": 34892191.0, "step": 20110 }, { "entropy": 5.572123861312866, "epoch": 1.565026259482591, "grad_norm": 1.3359375, "learning_rate": 0.00047551168733513956, "loss": 5.2645, "mean_token_accuracy": 0.17563781291246414, "num_tokens": 34900450.0, "step": 20115 }, { "entropy": 5.533158302307129, "epoch": 1.5654152888543085, "grad_norm": 1.21875, "learning_rate": 0.00047549911171856717, "loss": 5.1451, "mean_token_accuracy": 0.18031956851482392, "num_tokens": 34908706.0, "step": 20120 }, { "entropy": 5.489985609054566, "epoch": 1.565804318226026, "grad_norm": 1.3203125, "learning_rate": 0.0004754865330597398, "loss": 5.1831, "mean_token_accuracy": 0.18891116380691528, "num_tokens": 34916598.0, "step": 20125 }, { "entropy": 5.485782814025879, "epoch": 1.5661933475977436, "grad_norm": 1.4609375, "learning_rate": 0.00047547395135884854, "loss": 5.2131, "mean_token_accuracy": 0.18263823240995408, "num_tokens": 34925850.0, "step": 20130 }, { "entropy": 5.5575401306152346, "epoch": 1.5665823769694613, "grad_norm": 1.328125, "learning_rate": 0.0004754613666160841, "loss": 5.2962, "mean_token_accuracy": 0.17317381054162978, "num_tokens": 34934919.0, "step": 20135 }, { "entropy": 5.6056372165679935, "epoch": 1.5669714063411786, "grad_norm": 1.328125, "learning_rate": 0.00047544877883163753, "loss": 5.3957, "mean_token_accuracy": 0.16409746706485748, "num_tokens": 34943875.0, "step": 20140 }, { "entropy": 5.497797155380249, "epoch": 1.5673604357128963, "grad_norm": 1.3828125, "learning_rate": 0.00047543618800569975, "loss": 5.1688, "mean_token_accuracy": 0.18242404907941817, "num_tokens": 34952458.0, "step": 20145 }, { "entropy": 5.5054436206817625, "epoch": 1.567749465084614, "grad_norm": 1.3203125, "learning_rate": 0.00047542359413846184, "loss": 5.2815, "mean_token_accuracy": 0.17552659511566163, "num_tokens": 34961550.0, "step": 20150 }, { "entropy": 5.490035438537598, "epoch": 1.5681384944563315, "grad_norm": 1.3984375, "learning_rate": 0.0004754109972301149, "loss": 5.1875, "mean_token_accuracy": 0.17088261991739273, "num_tokens": 34969561.0, "step": 20155 }, { "entropy": 5.533228731155395, "epoch": 1.568527523828049, "grad_norm": 1.2734375, "learning_rate": 0.00047539839728085007, "loss": 5.2692, "mean_token_accuracy": 0.1801791563630104, "num_tokens": 34977904.0, "step": 20160 }, { "entropy": 5.47243299484253, "epoch": 1.5689165531997666, "grad_norm": 1.1953125, "learning_rate": 0.0004753857942908585, "loss": 5.2963, "mean_token_accuracy": 0.17523210495710373, "num_tokens": 34986646.0, "step": 20165 }, { "entropy": 5.574240875244141, "epoch": 1.5693055825714841, "grad_norm": 1.2578125, "learning_rate": 0.0004753731882603315, "loss": 5.3001, "mean_token_accuracy": 0.17411949932575227, "num_tokens": 34995387.0, "step": 20170 }, { "entropy": 5.571469640731811, "epoch": 1.5696946119432016, "grad_norm": 1.265625, "learning_rate": 0.00047536057918946026, "loss": 5.2341, "mean_token_accuracy": 0.18052912801504134, "num_tokens": 35004668.0, "step": 20175 }, { "entropy": 5.4023552417755125, "epoch": 1.5700836413149193, "grad_norm": 1.4140625, "learning_rate": 0.0004753479670784361, "loss": 5.1006, "mean_token_accuracy": 0.19072446525096892, "num_tokens": 35012881.0, "step": 20180 }, { "entropy": 5.545693445205688, "epoch": 1.570472670686637, "grad_norm": 1.3203125, "learning_rate": 0.0004753353519274505, "loss": 5.2295, "mean_token_accuracy": 0.17299910485744477, "num_tokens": 35022127.0, "step": 20185 }, { "entropy": 5.501242589950562, "epoch": 1.5708617000583545, "grad_norm": 1.7265625, "learning_rate": 0.0004753227337366948, "loss": 5.1233, "mean_token_accuracy": 0.18250587880611419, "num_tokens": 35030066.0, "step": 20190 }, { "entropy": 5.393864011764526, "epoch": 1.571250729430072, "grad_norm": 1.2734375, "learning_rate": 0.00047531011250636046, "loss": 5.1584, "mean_token_accuracy": 0.18586154878139496, "num_tokens": 35038560.0, "step": 20195 }, { "entropy": 5.496399593353272, "epoch": 1.5716397588017896, "grad_norm": 1.515625, "learning_rate": 0.00047529748823663896, "loss": 5.3378, "mean_token_accuracy": 0.1725176230072975, "num_tokens": 35048011.0, "step": 20200 }, { "entropy": 5.610437440872192, "epoch": 1.572028788173507, "grad_norm": 1.3125, "learning_rate": 0.0004752848609277219, "loss": 5.2989, "mean_token_accuracy": 0.17597989439964296, "num_tokens": 35056247.0, "step": 20205 }, { "entropy": 5.532671070098877, "epoch": 1.5724178175452246, "grad_norm": 1.453125, "learning_rate": 0.00047527223057980086, "loss": 5.2149, "mean_token_accuracy": 0.17512428164482116, "num_tokens": 35064885.0, "step": 20210 }, { "entropy": 5.4634042263031, "epoch": 1.5728068469169423, "grad_norm": 1.3671875, "learning_rate": 0.00047525959719306736, "loss": 5.1533, "mean_token_accuracy": 0.1735348418354988, "num_tokens": 35073452.0, "step": 20215 }, { "entropy": 5.50248498916626, "epoch": 1.5731958762886598, "grad_norm": 1.4609375, "learning_rate": 0.0004752469607677134, "loss": 5.3041, "mean_token_accuracy": 0.16941092163324356, "num_tokens": 35082459.0, "step": 20220 }, { "entropy": 5.544084072113037, "epoch": 1.5735849056603772, "grad_norm": 1.484375, "learning_rate": 0.0004752343213039305, "loss": 5.256, "mean_token_accuracy": 0.17132338881492615, "num_tokens": 35091336.0, "step": 20225 }, { "entropy": 5.502958154678344, "epoch": 1.573973935032095, "grad_norm": 1.3125, "learning_rate": 0.0004752216788019104, "loss": 5.2031, "mean_token_accuracy": 0.1825808823108673, "num_tokens": 35099802.0, "step": 20230 }, { "entropy": 5.484231853485108, "epoch": 1.5743629644038126, "grad_norm": 1.2578125, "learning_rate": 0.0004752090332618451, "loss": 5.2221, "mean_token_accuracy": 0.17584270983934402, "num_tokens": 35108520.0, "step": 20235 }, { "entropy": 5.576858997344971, "epoch": 1.57475199377553, "grad_norm": 1.375, "learning_rate": 0.0004751963846839263, "loss": 5.2748, "mean_token_accuracy": 0.1817975491285324, "num_tokens": 35117481.0, "step": 20240 }, { "entropy": 5.492777347564697, "epoch": 1.5751410231472476, "grad_norm": 1.375, "learning_rate": 0.00047518373306834605, "loss": 5.2381, "mean_token_accuracy": 0.17642291337251664, "num_tokens": 35126605.0, "step": 20245 }, { "entropy": 5.503046464920044, "epoch": 1.5755300525189653, "grad_norm": 1.3515625, "learning_rate": 0.00047517107841529626, "loss": 5.1378, "mean_token_accuracy": 0.189200721681118, "num_tokens": 35135312.0, "step": 20250 }, { "entropy": 5.534327745437622, "epoch": 1.5759190818906827, "grad_norm": 1.640625, "learning_rate": 0.000475158420724969, "loss": 5.2003, "mean_token_accuracy": 0.17962053567171096, "num_tokens": 35144759.0, "step": 20255 }, { "entropy": 5.524717998504639, "epoch": 1.5763081112624002, "grad_norm": 1.3125, "learning_rate": 0.00047514575999755627, "loss": 5.2953, "mean_token_accuracy": 0.17909365892410278, "num_tokens": 35153701.0, "step": 20260 }, { "entropy": 5.538240051269531, "epoch": 1.576697140634118, "grad_norm": 1.2734375, "learning_rate": 0.00047513309623325024, "loss": 5.3798, "mean_token_accuracy": 0.1722281128168106, "num_tokens": 35162503.0, "step": 20265 }, { "entropy": 5.459548711776733, "epoch": 1.5770861700058354, "grad_norm": 1.328125, "learning_rate": 0.0004751204294322429, "loss": 5.2024, "mean_token_accuracy": 0.18295868188142778, "num_tokens": 35171209.0, "step": 20270 }, { "entropy": 5.464225101470947, "epoch": 1.5774751993775529, "grad_norm": 1.3125, "learning_rate": 0.00047510775959472675, "loss": 5.203, "mean_token_accuracy": 0.17535534501075745, "num_tokens": 35179623.0, "step": 20275 }, { "entropy": 5.508400106430054, "epoch": 1.5778642287492706, "grad_norm": 1.2734375, "learning_rate": 0.0004750950867208937, "loss": 5.189, "mean_token_accuracy": 0.18121856600046157, "num_tokens": 35188679.0, "step": 20280 }, { "entropy": 5.464699602127075, "epoch": 1.5782532581209883, "grad_norm": 1.265625, "learning_rate": 0.0004750824108109362, "loss": 5.1719, "mean_token_accuracy": 0.18520854711532592, "num_tokens": 35197325.0, "step": 20285 }, { "entropy": 5.620121860504151, "epoch": 1.5786422874927057, "grad_norm": 1.2734375, "learning_rate": 0.0004750697318650466, "loss": 5.3222, "mean_token_accuracy": 0.17438203543424607, "num_tokens": 35206741.0, "step": 20290 }, { "entropy": 5.571952676773071, "epoch": 1.5790313168644232, "grad_norm": 1.4140625, "learning_rate": 0.0004750570498834173, "loss": 5.2589, "mean_token_accuracy": 0.1712891712784767, "num_tokens": 35215346.0, "step": 20295 }, { "entropy": 5.484773921966553, "epoch": 1.579420346236141, "grad_norm": 1.375, "learning_rate": 0.0004750443648662407, "loss": 5.1765, "mean_token_accuracy": 0.1844707801938057, "num_tokens": 35223811.0, "step": 20300 }, { "entropy": 5.521778964996338, "epoch": 1.5798093756078584, "grad_norm": 1.4140625, "learning_rate": 0.00047503167681370924, "loss": 5.2587, "mean_token_accuracy": 0.17331053912639618, "num_tokens": 35232438.0, "step": 20305 }, { "entropy": 5.507816410064697, "epoch": 1.5801984049795759, "grad_norm": 1.3515625, "learning_rate": 0.0004750189857260154, "loss": 5.2342, "mean_token_accuracy": 0.16795391738414764, "num_tokens": 35242529.0, "step": 20310 }, { "entropy": 5.394672775268555, "epoch": 1.5805874343512936, "grad_norm": 1.3125, "learning_rate": 0.0004750062916033519, "loss": 5.0468, "mean_token_accuracy": 0.18975515067577362, "num_tokens": 35250695.0, "step": 20315 }, { "entropy": 5.486641788482666, "epoch": 1.580976463723011, "grad_norm": 1.4453125, "learning_rate": 0.0004749935944459113, "loss": 5.1744, "mean_token_accuracy": 0.18354397267103195, "num_tokens": 35259212.0, "step": 20320 }, { "entropy": 5.459771680831909, "epoch": 1.5813654930947285, "grad_norm": 1.5078125, "learning_rate": 0.0004749808942538862, "loss": 5.1817, "mean_token_accuracy": 0.1863773837685585, "num_tokens": 35267667.0, "step": 20325 }, { "entropy": 5.490675592422486, "epoch": 1.5817545224664462, "grad_norm": 1.71875, "learning_rate": 0.0004749681910274693, "loss": 5.2145, "mean_token_accuracy": 0.18251511007547377, "num_tokens": 35275850.0, "step": 20330 }, { "entropy": 5.604182004928589, "epoch": 1.582143551838164, "grad_norm": 1.6640625, "learning_rate": 0.00047495548476685334, "loss": 5.2147, "mean_token_accuracy": 0.17405499815940856, "num_tokens": 35284635.0, "step": 20335 }, { "entropy": 5.5078987121582035, "epoch": 1.5825325812098814, "grad_norm": 1.421875, "learning_rate": 0.00047494277547223125, "loss": 5.2323, "mean_token_accuracy": 0.18257189840078353, "num_tokens": 35292335.0, "step": 20340 }, { "entropy": 5.429032039642334, "epoch": 1.5829216105815989, "grad_norm": 1.3359375, "learning_rate": 0.00047493006314379573, "loss": 5.2113, "mean_token_accuracy": 0.18066998422145844, "num_tokens": 35300709.0, "step": 20345 }, { "entropy": 5.4936658382415775, "epoch": 1.5833106399533166, "grad_norm": 1.359375, "learning_rate": 0.00047491734778173976, "loss": 5.1801, "mean_token_accuracy": 0.18381191343069075, "num_tokens": 35308956.0, "step": 20350 }, { "entropy": 5.424949693679809, "epoch": 1.583699669325034, "grad_norm": 1.3984375, "learning_rate": 0.00047490462938625617, "loss": 5.198, "mean_token_accuracy": 0.17705115526914597, "num_tokens": 35317663.0, "step": 20355 }, { "entropy": 5.470248889923096, "epoch": 1.5840886986967515, "grad_norm": 1.34375, "learning_rate": 0.00047489190795753806, "loss": 5.2847, "mean_token_accuracy": 0.17230038046836854, "num_tokens": 35327412.0, "step": 20360 }, { "entropy": 5.6052069664001465, "epoch": 1.5844777280684692, "grad_norm": 1.3671875, "learning_rate": 0.0004748791834957784, "loss": 5.2948, "mean_token_accuracy": 0.17563155442476272, "num_tokens": 35335888.0, "step": 20365 }, { "entropy": 5.557424688339234, "epoch": 1.5848667574401867, "grad_norm": 2.515625, "learning_rate": 0.00047486645600117037, "loss": 5.2407, "mean_token_accuracy": 0.1836341843008995, "num_tokens": 35345122.0, "step": 20370 }, { "entropy": 5.537162637710571, "epoch": 1.5852557868119042, "grad_norm": 1.3515625, "learning_rate": 0.0004748537254739068, "loss": 5.3098, "mean_token_accuracy": 0.18009259998798371, "num_tokens": 35353751.0, "step": 20375 }, { "entropy": 5.5538407325744625, "epoch": 1.5856448161836219, "grad_norm": 1.4375, "learning_rate": 0.0004748409919141812, "loss": 5.246, "mean_token_accuracy": 0.1785751089453697, "num_tokens": 35363083.0, "step": 20380 }, { "entropy": 5.448006725311279, "epoch": 1.5860338455553395, "grad_norm": 1.390625, "learning_rate": 0.0004748282553221865, "loss": 5.1688, "mean_token_accuracy": 0.187142077088356, "num_tokens": 35371198.0, "step": 20385 }, { "entropy": 5.47127137184143, "epoch": 1.586422874927057, "grad_norm": 1.296875, "learning_rate": 0.0004748155156981162, "loss": 5.2586, "mean_token_accuracy": 0.18322091847658156, "num_tokens": 35379633.0, "step": 20390 }, { "entropy": 5.5214379787445065, "epoch": 1.5868119042987745, "grad_norm": 1.3359375, "learning_rate": 0.00047480277304216346, "loss": 5.2137, "mean_token_accuracy": 0.1787571743130684, "num_tokens": 35388172.0, "step": 20395 }, { "entropy": 5.466855525970459, "epoch": 1.5872009336704922, "grad_norm": 1.3984375, "learning_rate": 0.00047479002735452164, "loss": 5.1879, "mean_token_accuracy": 0.17919579297304153, "num_tokens": 35397126.0, "step": 20400 }, { "entropy": 5.496103429794312, "epoch": 1.5875899630422097, "grad_norm": 1.3984375, "learning_rate": 0.00047477727863538415, "loss": 5.1711, "mean_token_accuracy": 0.18472271859645845, "num_tokens": 35405364.0, "step": 20405 }, { "entropy": 5.476044321060181, "epoch": 1.5879789924139271, "grad_norm": 1.390625, "learning_rate": 0.00047476452688494444, "loss": 5.1923, "mean_token_accuracy": 0.18309639245271683, "num_tokens": 35414187.0, "step": 20410 }, { "entropy": 5.501715040206909, "epoch": 1.5883680217856448, "grad_norm": 1.5078125, "learning_rate": 0.000474751772103396, "loss": 5.1853, "mean_token_accuracy": 0.18391240686178206, "num_tokens": 35422694.0, "step": 20415 }, { "entropy": 5.502434825897216, "epoch": 1.5887570511573625, "grad_norm": 1.3515625, "learning_rate": 0.0004747390142909323, "loss": 5.3234, "mean_token_accuracy": 0.1774757221341133, "num_tokens": 35431176.0, "step": 20420 }, { "entropy": 5.539558696746826, "epoch": 1.5891460805290798, "grad_norm": 1.359375, "learning_rate": 0.00047472625344774713, "loss": 5.2502, "mean_token_accuracy": 0.17063300162553788, "num_tokens": 35439938.0, "step": 20425 }, { "entropy": 5.549200963973999, "epoch": 1.5895351099007975, "grad_norm": 1.4140625, "learning_rate": 0.00047471348957403374, "loss": 5.1734, "mean_token_accuracy": 0.1832476183772087, "num_tokens": 35447864.0, "step": 20430 }, { "entropy": 5.535675382614135, "epoch": 1.5899241392725152, "grad_norm": 1.421875, "learning_rate": 0.0004747007226699862, "loss": 5.2277, "mean_token_accuracy": 0.18092171102762222, "num_tokens": 35456047.0, "step": 20435 }, { "entropy": 5.414860343933105, "epoch": 1.5903131686442327, "grad_norm": 1.3046875, "learning_rate": 0.00047468795273579803, "loss": 5.1655, "mean_token_accuracy": 0.185432069003582, "num_tokens": 35464510.0, "step": 20440 }, { "entropy": 5.539222860336304, "epoch": 1.5907021980159501, "grad_norm": 1.328125, "learning_rate": 0.0004746751797716629, "loss": 5.287, "mean_token_accuracy": 0.1778273656964302, "num_tokens": 35472715.0, "step": 20445 }, { "entropy": 5.464086818695068, "epoch": 1.5910912273876678, "grad_norm": 1.5234375, "learning_rate": 0.0004746624037777748, "loss": 5.1588, "mean_token_accuracy": 0.1783091187477112, "num_tokens": 35482094.0, "step": 20450 }, { "entropy": 5.495008754730224, "epoch": 1.5914802567593853, "grad_norm": 1.6875, "learning_rate": 0.00047464962475432754, "loss": 5.2007, "mean_token_accuracy": 0.17638317197561265, "num_tokens": 35489864.0, "step": 20455 }, { "entropy": 5.524823331832886, "epoch": 1.5918692861311028, "grad_norm": 1.515625, "learning_rate": 0.000474636842701515, "loss": 5.2853, "mean_token_accuracy": 0.17576328068971633, "num_tokens": 35498840.0, "step": 20460 }, { "entropy": 5.476958084106445, "epoch": 1.5922583155028205, "grad_norm": 1.2890625, "learning_rate": 0.0004746240576195311, "loss": 5.1186, "mean_token_accuracy": 0.17764958292245864, "num_tokens": 35506954.0, "step": 20465 }, { "entropy": 5.490156459808349, "epoch": 1.5926473448745382, "grad_norm": 1.3203125, "learning_rate": 0.00047461126950856987, "loss": 5.2748, "mean_token_accuracy": 0.17365874946117402, "num_tokens": 35515796.0, "step": 20470 }, { "entropy": 5.501256084442138, "epoch": 1.5930363742462554, "grad_norm": 1.296875, "learning_rate": 0.0004745984783688253, "loss": 5.1867, "mean_token_accuracy": 0.18192726820707322, "num_tokens": 35523713.0, "step": 20475 }, { "entropy": 5.509800577163697, "epoch": 1.5934254036179731, "grad_norm": 1.328125, "learning_rate": 0.00047458568420049153, "loss": 5.3246, "mean_token_accuracy": 0.1736530378460884, "num_tokens": 35532800.0, "step": 20480 }, { "entropy": 5.5810600280761715, "epoch": 1.5938144329896908, "grad_norm": 1.3671875, "learning_rate": 0.00047457288700376274, "loss": 5.2308, "mean_token_accuracy": 0.18621969372034072, "num_tokens": 35540865.0, "step": 20485 }, { "entropy": 5.528258323669434, "epoch": 1.5942034623614083, "grad_norm": 1.4140625, "learning_rate": 0.00047456008677883304, "loss": 5.3214, "mean_token_accuracy": 0.17472659200429916, "num_tokens": 35549498.0, "step": 20490 }, { "entropy": 5.52451343536377, "epoch": 1.5945924917331258, "grad_norm": 1.421875, "learning_rate": 0.0004745472835258966, "loss": 5.2187, "mean_token_accuracy": 0.18188000321388245, "num_tokens": 35557756.0, "step": 20495 }, { "entropy": 5.586997318267822, "epoch": 1.5949815211048435, "grad_norm": 1.34375, "learning_rate": 0.00047453447724514773, "loss": 5.3117, "mean_token_accuracy": 0.17629093527793885, "num_tokens": 35566062.0, "step": 20500 }, { "entropy": 5.530290269851685, "epoch": 1.595370550476561, "grad_norm": 1.5390625, "learning_rate": 0.0004745216679367808, "loss": 5.1428, "mean_token_accuracy": 0.18013672083616256, "num_tokens": 35574377.0, "step": 20505 }, { "entropy": 5.52440710067749, "epoch": 1.5957595798482784, "grad_norm": 1.546875, "learning_rate": 0.0004745088556009901, "loss": 5.2307, "mean_token_accuracy": 0.1787106916308403, "num_tokens": 35582254.0, "step": 20510 }, { "entropy": 5.534545516967773, "epoch": 1.5961486092199961, "grad_norm": 1.484375, "learning_rate": 0.0004744960402379701, "loss": 5.2749, "mean_token_accuracy": 0.17506421804428102, "num_tokens": 35590804.0, "step": 20515 }, { "entropy": 5.520808601379395, "epoch": 1.5965376385917138, "grad_norm": 1.4296875, "learning_rate": 0.00047448322184791525, "loss": 5.2238, "mean_token_accuracy": 0.1801039084792137, "num_tokens": 35599547.0, "step": 20520 }, { "entropy": 5.598384952545166, "epoch": 1.596926667963431, "grad_norm": 1.5234375, "learning_rate": 0.00047447040043101994, "loss": 5.3329, "mean_token_accuracy": 0.17442476749420166, "num_tokens": 35608948.0, "step": 20525 }, { "entropy": 5.602685832977295, "epoch": 1.5973156973351488, "grad_norm": 1.7578125, "learning_rate": 0.00047445757598747886, "loss": 5.4273, "mean_token_accuracy": 0.16351246759295462, "num_tokens": 35618243.0, "step": 20530 }, { "entropy": 5.503303718566895, "epoch": 1.5977047267068665, "grad_norm": 1.40625, "learning_rate": 0.0004744447485174864, "loss": 5.2108, "mean_token_accuracy": 0.1850836083292961, "num_tokens": 35626938.0, "step": 20535 }, { "entropy": 5.566260528564453, "epoch": 1.598093756078584, "grad_norm": 1.4765625, "learning_rate": 0.00047443191802123746, "loss": 5.2608, "mean_token_accuracy": 0.18745750486850737, "num_tokens": 35635612.0, "step": 20540 }, { "entropy": 5.497407865524292, "epoch": 1.5984827854503014, "grad_norm": 1.359375, "learning_rate": 0.00047441908449892664, "loss": 5.2542, "mean_token_accuracy": 0.1845002830028534, "num_tokens": 35644320.0, "step": 20545 }, { "entropy": 5.451295042037964, "epoch": 1.5988718148220191, "grad_norm": 1.390625, "learning_rate": 0.00047440624795074855, "loss": 5.1568, "mean_token_accuracy": 0.18606287091970444, "num_tokens": 35652606.0, "step": 20550 }, { "entropy": 5.475770568847656, "epoch": 1.5992608441937366, "grad_norm": 1.2421875, "learning_rate": 0.00047439340837689804, "loss": 5.1453, "mean_token_accuracy": 0.18382026851177216, "num_tokens": 35661082.0, "step": 20555 }, { "entropy": 5.48795371055603, "epoch": 1.599649873565454, "grad_norm": 1.328125, "learning_rate": 0.00047438056577756986, "loss": 5.2585, "mean_token_accuracy": 0.17349821031093599, "num_tokens": 35669926.0, "step": 20560 }, { "entropy": 5.532926225662232, "epoch": 1.6000389029371718, "grad_norm": 1.2421875, "learning_rate": 0.00047436772015295903, "loss": 5.2502, "mean_token_accuracy": 0.17873613089323043, "num_tokens": 35678964.0, "step": 20565 }, { "entropy": 5.524367427825927, "epoch": 1.6004279323088895, "grad_norm": 1.3359375, "learning_rate": 0.00047435487150326036, "loss": 5.1992, "mean_token_accuracy": 0.1857219621539116, "num_tokens": 35687943.0, "step": 20570 }, { "entropy": 5.4822197437286375, "epoch": 1.6008169616806067, "grad_norm": 1.4921875, "learning_rate": 0.0004743420198286688, "loss": 5.2474, "mean_token_accuracy": 0.17616415917873382, "num_tokens": 35696684.0, "step": 20575 }, { "entropy": 5.466225242614746, "epoch": 1.6012059910523244, "grad_norm": 1.3984375, "learning_rate": 0.00047432916512937936, "loss": 5.2522, "mean_token_accuracy": 0.17492427974939345, "num_tokens": 35705038.0, "step": 20580 }, { "entropy": 5.586339712142944, "epoch": 1.6015950204240421, "grad_norm": 1.515625, "learning_rate": 0.0004743163074055871, "loss": 5.2317, "mean_token_accuracy": 0.1801270604133606, "num_tokens": 35713638.0, "step": 20585 }, { "entropy": 5.591613149642944, "epoch": 1.6019840497957596, "grad_norm": 1.3359375, "learning_rate": 0.0004743034466574871, "loss": 5.2268, "mean_token_accuracy": 0.17935534566640854, "num_tokens": 35721935.0, "step": 20590 }, { "entropy": 5.51762900352478, "epoch": 1.602373079167477, "grad_norm": 1.3125, "learning_rate": 0.0004742905828852746, "loss": 5.2819, "mean_token_accuracy": 0.17517272382974625, "num_tokens": 35731610.0, "step": 20595 }, { "entropy": 5.554374933242798, "epoch": 1.6027621085391948, "grad_norm": 1.375, "learning_rate": 0.0004742777160891447, "loss": 5.2825, "mean_token_accuracy": 0.17923903167247773, "num_tokens": 35740956.0, "step": 20600 }, { "entropy": 5.472058820724487, "epoch": 1.6031511379109122, "grad_norm": 1.2421875, "learning_rate": 0.0004742648462692926, "loss": 5.1309, "mean_token_accuracy": 0.18912305533885956, "num_tokens": 35749316.0, "step": 20605 }, { "entropy": 5.5658728122711185, "epoch": 1.6035401672826297, "grad_norm": 1.59375, "learning_rate": 0.00047425197342591363, "loss": 5.3211, "mean_token_accuracy": 0.18015774935483933, "num_tokens": 35758875.0, "step": 20610 }, { "entropy": 5.455133056640625, "epoch": 1.6039291966543474, "grad_norm": 1.3515625, "learning_rate": 0.0004742390975592031, "loss": 5.2631, "mean_token_accuracy": 0.1832687199115753, "num_tokens": 35767851.0, "step": 20615 }, { "entropy": 5.5684990882873535, "epoch": 1.604318226026065, "grad_norm": 1.5, "learning_rate": 0.00047422621866935645, "loss": 5.1664, "mean_token_accuracy": 0.18225348889827728, "num_tokens": 35776393.0, "step": 20620 }, { "entropy": 5.482385444641113, "epoch": 1.6047072553977826, "grad_norm": 1.3359375, "learning_rate": 0.000474213336756569, "loss": 5.139, "mean_token_accuracy": 0.18780395090579988, "num_tokens": 35784868.0, "step": 20625 }, { "entropy": 5.474336242675781, "epoch": 1.6050962847695, "grad_norm": 1.4140625, "learning_rate": 0.0004742004518210362, "loss": 5.2337, "mean_token_accuracy": 0.1708284929394722, "num_tokens": 35793812.0, "step": 20630 }, { "entropy": 5.509834098815918, "epoch": 1.6054853141412178, "grad_norm": 1.9765625, "learning_rate": 0.0004741875638629536, "loss": 5.2303, "mean_token_accuracy": 0.17225415557622908, "num_tokens": 35802206.0, "step": 20635 }, { "entropy": 5.551030969619751, "epoch": 1.6058743435129352, "grad_norm": 1.296875, "learning_rate": 0.0004741746728825168, "loss": 5.2035, "mean_token_accuracy": 0.17514467090368271, "num_tokens": 35811095.0, "step": 20640 }, { "entropy": 5.6419744968414305, "epoch": 1.6062633728846527, "grad_norm": 1.359375, "learning_rate": 0.0004741617788799213, "loss": 5.3242, "mean_token_accuracy": 0.1752131998538971, "num_tokens": 35819799.0, "step": 20645 }, { "entropy": 5.452331590652466, "epoch": 1.6066524022563704, "grad_norm": 1.4296875, "learning_rate": 0.00047414888185536285, "loss": 5.2251, "mean_token_accuracy": 0.17969018518924712, "num_tokens": 35829130.0, "step": 20650 }, { "entropy": 5.4639064311981205, "epoch": 1.6070414316280879, "grad_norm": 1.3515625, "learning_rate": 0.0004741359818090371, "loss": 5.1843, "mean_token_accuracy": 0.18253854364156724, "num_tokens": 35838020.0, "step": 20655 }, { "entropy": 5.4403825283050535, "epoch": 1.6074304609998054, "grad_norm": 2.34375, "learning_rate": 0.00047412307874113976, "loss": 5.1156, "mean_token_accuracy": 0.18635677099227904, "num_tokens": 35845843.0, "step": 20660 }, { "entropy": 5.446789121627807, "epoch": 1.607819490371523, "grad_norm": 1.2734375, "learning_rate": 0.0004741101726518667, "loss": 5.1243, "mean_token_accuracy": 0.18147239238023757, "num_tokens": 35854505.0, "step": 20665 }, { "entropy": 5.465287542343139, "epoch": 1.6082085197432407, "grad_norm": 1.375, "learning_rate": 0.0004740972635414136, "loss": 5.2151, "mean_token_accuracy": 0.18238385915756225, "num_tokens": 35862847.0, "step": 20670 }, { "entropy": 5.450656318664551, "epoch": 1.6085975491149582, "grad_norm": 1.359375, "learning_rate": 0.0004740843514099765, "loss": 5.183, "mean_token_accuracy": 0.18003190457820892, "num_tokens": 35871471.0, "step": 20675 }, { "entropy": 5.546759843826294, "epoch": 1.6089865784866757, "grad_norm": 1.4609375, "learning_rate": 0.0004740714362577512, "loss": 5.2022, "mean_token_accuracy": 0.17458469718694686, "num_tokens": 35880266.0, "step": 20680 }, { "entropy": 5.507287645339966, "epoch": 1.6093756078583934, "grad_norm": 1.3125, "learning_rate": 0.00047405851808493364, "loss": 5.1285, "mean_token_accuracy": 0.1825320303440094, "num_tokens": 35888727.0, "step": 20685 }, { "entropy": 5.449972677230835, "epoch": 1.6097646372301109, "grad_norm": 1.40625, "learning_rate": 0.00047404559689172006, "loss": 5.215, "mean_token_accuracy": 0.18035564869642257, "num_tokens": 35897750.0, "step": 20690 }, { "entropy": 5.462679386138916, "epoch": 1.6101536666018283, "grad_norm": 1.3828125, "learning_rate": 0.00047403267267830617, "loss": 5.1597, "mean_token_accuracy": 0.18867727369070053, "num_tokens": 35906254.0, "step": 20695 }, { "entropy": 5.484301376342773, "epoch": 1.610542695973546, "grad_norm": 1.296875, "learning_rate": 0.00047401974544488844, "loss": 5.2796, "mean_token_accuracy": 0.16822059601545333, "num_tokens": 35915180.0, "step": 20700 }, { "entropy": 5.592352342605591, "epoch": 1.6109317253452635, "grad_norm": 1.3125, "learning_rate": 0.0004740068151916628, "loss": 5.2399, "mean_token_accuracy": 0.1708812490105629, "num_tokens": 35924336.0, "step": 20705 }, { "entropy": 5.547119665145874, "epoch": 1.611320754716981, "grad_norm": 1.2890625, "learning_rate": 0.0004739938819188255, "loss": 5.2514, "mean_token_accuracy": 0.17776671648025513, "num_tokens": 35933031.0, "step": 20710 }, { "entropy": 5.507070016860962, "epoch": 1.6117097840886987, "grad_norm": 1.515625, "learning_rate": 0.0004739809456265727, "loss": 5.0965, "mean_token_accuracy": 0.19073860198259354, "num_tokens": 35941794.0, "step": 20715 }, { "entropy": 5.5489341735839846, "epoch": 1.6120988134604164, "grad_norm": 1.3515625, "learning_rate": 0.0004739680063151008, "loss": 5.3039, "mean_token_accuracy": 0.1768066868185997, "num_tokens": 35949636.0, "step": 20720 }, { "entropy": 5.509795761108398, "epoch": 1.6124878428321339, "grad_norm": 1.3203125, "learning_rate": 0.0004739550639846061, "loss": 5.3201, "mean_token_accuracy": 0.17850505858659743, "num_tokens": 35958842.0, "step": 20725 }, { "entropy": 5.488194561004638, "epoch": 1.6128768722038513, "grad_norm": 1.4609375, "learning_rate": 0.00047394211863528496, "loss": 5.1651, "mean_token_accuracy": 0.17458401918411254, "num_tokens": 35967897.0, "step": 20730 }, { "entropy": 5.435737419128418, "epoch": 1.613265901575569, "grad_norm": 1.328125, "learning_rate": 0.0004739291702673338, "loss": 5.0806, "mean_token_accuracy": 0.18676541596651078, "num_tokens": 35976309.0, "step": 20735 }, { "entropy": 5.58004412651062, "epoch": 1.6136549309472865, "grad_norm": 1.3203125, "learning_rate": 0.0004739162188809492, "loss": 5.3278, "mean_token_accuracy": 0.17659748047590257, "num_tokens": 35984401.0, "step": 20740 }, { "entropy": 5.485971975326538, "epoch": 1.614043960319004, "grad_norm": 1.3984375, "learning_rate": 0.00047390326447632747, "loss": 5.2191, "mean_token_accuracy": 0.1749339923262596, "num_tokens": 35993068.0, "step": 20745 }, { "entropy": 5.597433567047119, "epoch": 1.6144329896907217, "grad_norm": 1.4140625, "learning_rate": 0.0004738903070536654, "loss": 5.3715, "mean_token_accuracy": 0.17616495341062546, "num_tokens": 36001559.0, "step": 20750 }, { "entropy": 5.546025609970092, "epoch": 1.6148220190624392, "grad_norm": 1.4921875, "learning_rate": 0.0004738773466131594, "loss": 5.2857, "mean_token_accuracy": 0.1728214368224144, "num_tokens": 36010675.0, "step": 20755 }, { "entropy": 5.4294198513031, "epoch": 1.6152110484341566, "grad_norm": 1.515625, "learning_rate": 0.0004738643831550063, "loss": 5.0305, "mean_token_accuracy": 0.19377739876508712, "num_tokens": 36019498.0, "step": 20760 }, { "entropy": 5.397676038742065, "epoch": 1.6156000778058743, "grad_norm": 1.796875, "learning_rate": 0.0004738514166794026, "loss": 5.1076, "mean_token_accuracy": 0.19262148737907409, "num_tokens": 36028206.0, "step": 20765 }, { "entropy": 5.544890689849853, "epoch": 1.615989107177592, "grad_norm": 1.3828125, "learning_rate": 0.00047383844718654525, "loss": 5.3169, "mean_token_accuracy": 0.1798240751028061, "num_tokens": 36037341.0, "step": 20770 }, { "entropy": 5.5295360565185545, "epoch": 1.6163781365493095, "grad_norm": 1.5390625, "learning_rate": 0.0004738254746766309, "loss": 5.193, "mean_token_accuracy": 0.1816869631409645, "num_tokens": 36046596.0, "step": 20775 }, { "entropy": 5.507260847091675, "epoch": 1.616767165921027, "grad_norm": 1.375, "learning_rate": 0.0004738124991498565, "loss": 5.1667, "mean_token_accuracy": 0.18574288934469224, "num_tokens": 36055031.0, "step": 20780 }, { "entropy": 5.561546039581299, "epoch": 1.6171561952927447, "grad_norm": 1.5546875, "learning_rate": 0.00047379952060641866, "loss": 5.3078, "mean_token_accuracy": 0.18006632775068282, "num_tokens": 36064049.0, "step": 20785 }, { "entropy": 5.5834431648254395, "epoch": 1.6175452246644622, "grad_norm": 1.28125, "learning_rate": 0.00047378653904651475, "loss": 5.2795, "mean_token_accuracy": 0.17170560359954834, "num_tokens": 36072886.0, "step": 20790 }, { "entropy": 5.545154571533203, "epoch": 1.6179342540361796, "grad_norm": 1.4609375, "learning_rate": 0.00047377355447034136, "loss": 5.28, "mean_token_accuracy": 0.18235398083925247, "num_tokens": 36082133.0, "step": 20795 }, { "entropy": 5.5143474578857425, "epoch": 1.6183232834078973, "grad_norm": 1.3203125, "learning_rate": 0.0004737605668780958, "loss": 5.1922, "mean_token_accuracy": 0.182487191259861, "num_tokens": 36090980.0, "step": 20800 }, { "entropy": 5.5199206352233885, "epoch": 1.618712312779615, "grad_norm": 1.296875, "learning_rate": 0.00047374757626997494, "loss": 5.2586, "mean_token_accuracy": 0.17965995520353317, "num_tokens": 36099584.0, "step": 20805 }, { "entropy": 5.484288454055786, "epoch": 1.6191013421513323, "grad_norm": 1.421875, "learning_rate": 0.0004737345826461759, "loss": 5.2013, "mean_token_accuracy": 0.17327310889959335, "num_tokens": 36108052.0, "step": 20810 }, { "entropy": 5.492011308670044, "epoch": 1.61949037152305, "grad_norm": 1.3359375, "learning_rate": 0.0004737215860068959, "loss": 5.0859, "mean_token_accuracy": 0.1897791400551796, "num_tokens": 36116623.0, "step": 20815 }, { "entropy": 5.523939800262451, "epoch": 1.6198794008947677, "grad_norm": 1.359375, "learning_rate": 0.00047370858635233223, "loss": 5.2208, "mean_token_accuracy": 0.1824929416179657, "num_tokens": 36124953.0, "step": 20820 }, { "entropy": 5.4983409404754635, "epoch": 1.6202684302664851, "grad_norm": 1.234375, "learning_rate": 0.00047369558368268194, "loss": 5.2047, "mean_token_accuracy": 0.17592939585447312, "num_tokens": 36133500.0, "step": 20825 }, { "entropy": 5.473618841171264, "epoch": 1.6206574596382026, "grad_norm": 1.3984375, "learning_rate": 0.0004736825779981424, "loss": 5.175, "mean_token_accuracy": 0.18104309290647508, "num_tokens": 36141934.0, "step": 20830 }, { "entropy": 5.456574249267578, "epoch": 1.6210464890099203, "grad_norm": 1.5625, "learning_rate": 0.0004736695692989111, "loss": 5.1853, "mean_token_accuracy": 0.1817682757973671, "num_tokens": 36150592.0, "step": 20835 }, { "entropy": 5.473036098480224, "epoch": 1.6214355183816378, "grad_norm": 1.5078125, "learning_rate": 0.0004736565575851852, "loss": 5.0635, "mean_token_accuracy": 0.1875779777765274, "num_tokens": 36159377.0, "step": 20840 }, { "entropy": 5.500918817520142, "epoch": 1.6218245477533553, "grad_norm": 1.3203125, "learning_rate": 0.0004736435428571622, "loss": 5.1734, "mean_token_accuracy": 0.1775798186659813, "num_tokens": 36168159.0, "step": 20845 }, { "entropy": 5.38011531829834, "epoch": 1.622213577125073, "grad_norm": 1.3125, "learning_rate": 0.0004736305251150397, "loss": 5.1387, "mean_token_accuracy": 0.1821829557418823, "num_tokens": 36176108.0, "step": 20850 }, { "entropy": 5.485075855255127, "epoch": 1.6226026064967907, "grad_norm": 1.921875, "learning_rate": 0.0004736175043590151, "loss": 5.3189, "mean_token_accuracy": 0.17256989181041718, "num_tokens": 36184930.0, "step": 20855 }, { "entropy": 5.582487964630127, "epoch": 1.622991635868508, "grad_norm": 1.46875, "learning_rate": 0.000473604480589286, "loss": 5.241, "mean_token_accuracy": 0.1799950748682022, "num_tokens": 36193308.0, "step": 20860 }, { "entropy": 5.502960252761841, "epoch": 1.6233806652402256, "grad_norm": 1.3046875, "learning_rate": 0.00047359145380605007, "loss": 5.1849, "mean_token_accuracy": 0.18289902210235595, "num_tokens": 36202016.0, "step": 20865 }, { "entropy": 5.553669023513794, "epoch": 1.6237696946119433, "grad_norm": 1.3203125, "learning_rate": 0.0004735784240095049, "loss": 5.1828, "mean_token_accuracy": 0.1815961256623268, "num_tokens": 36210757.0, "step": 20870 }, { "entropy": 5.4530699253082275, "epoch": 1.6241587239836608, "grad_norm": 1.2734375, "learning_rate": 0.00047356539119984813, "loss": 5.1234, "mean_token_accuracy": 0.18398251086473466, "num_tokens": 36219052.0, "step": 20875 }, { "entropy": 5.406506204605103, "epoch": 1.6245477533553783, "grad_norm": 1.3984375, "learning_rate": 0.0004735523553772777, "loss": 5.1114, "mean_token_accuracy": 0.18620857000350952, "num_tokens": 36227890.0, "step": 20880 }, { "entropy": 5.4753025531768795, "epoch": 1.624936782727096, "grad_norm": 1.4140625, "learning_rate": 0.0004735393165419912, "loss": 5.2433, "mean_token_accuracy": 0.17671396881341933, "num_tokens": 36236725.0, "step": 20885 }, { "entropy": 5.585158157348633, "epoch": 1.6253258120988134, "grad_norm": 1.296875, "learning_rate": 0.00047352627469418666, "loss": 5.2346, "mean_token_accuracy": 0.17834849357604982, "num_tokens": 36246220.0, "step": 20890 }, { "entropy": 5.558758211135864, "epoch": 1.625714841470531, "grad_norm": 1.921875, "learning_rate": 0.0004735132298340619, "loss": 5.2747, "mean_token_accuracy": 0.17417685985565184, "num_tokens": 36254662.0, "step": 20895 }, { "entropy": 5.476184272766114, "epoch": 1.6261038708422486, "grad_norm": 1.4453125, "learning_rate": 0.0004735001819618148, "loss": 5.2274, "mean_token_accuracy": 0.1811300739645958, "num_tokens": 36262446.0, "step": 20900 }, { "entropy": 5.5535718441009525, "epoch": 1.6264929002139663, "grad_norm": 1.3359375, "learning_rate": 0.0004734871310776434, "loss": 5.222, "mean_token_accuracy": 0.1802380919456482, "num_tokens": 36271284.0, "step": 20905 }, { "entropy": 5.469676160812378, "epoch": 1.6268819295856836, "grad_norm": 1.46875, "learning_rate": 0.0004734740771817457, "loss": 5.0896, "mean_token_accuracy": 0.19211526364088058, "num_tokens": 36279180.0, "step": 20910 }, { "entropy": 5.489728689193726, "epoch": 1.6272709589574013, "grad_norm": 1.6953125, "learning_rate": 0.0004734610202743198, "loss": 5.2406, "mean_token_accuracy": 0.1792478233575821, "num_tokens": 36287714.0, "step": 20915 }, { "entropy": 5.504299211502075, "epoch": 1.627659988329119, "grad_norm": 1.5390625, "learning_rate": 0.0004734479603555638, "loss": 5.2513, "mean_token_accuracy": 0.17651249468326569, "num_tokens": 36297120.0, "step": 20920 }, { "entropy": 5.534188652038575, "epoch": 1.6280490177008364, "grad_norm": 1.3828125, "learning_rate": 0.00047343489742567593, "loss": 5.2398, "mean_token_accuracy": 0.17953075468540192, "num_tokens": 36305232.0, "step": 20925 }, { "entropy": 5.5675560474395756, "epoch": 1.628438047072554, "grad_norm": 1.375, "learning_rate": 0.00047342183148485424, "loss": 5.273, "mean_token_accuracy": 0.18312925547361375, "num_tokens": 36313587.0, "step": 20930 }, { "entropy": 5.484789562225342, "epoch": 1.6288270764442716, "grad_norm": 1.234375, "learning_rate": 0.00047340876253329706, "loss": 5.2047, "mean_token_accuracy": 0.18920795172452926, "num_tokens": 36322054.0, "step": 20935 }, { "entropy": 5.509126329421997, "epoch": 1.629216105815989, "grad_norm": 1.4453125, "learning_rate": 0.00047339569057120275, "loss": 5.127, "mean_token_accuracy": 0.18547769635915756, "num_tokens": 36330226.0, "step": 20940 }, { "entropy": 5.44800295829773, "epoch": 1.6296051351877066, "grad_norm": 1.5546875, "learning_rate": 0.00047338261559876966, "loss": 5.1991, "mean_token_accuracy": 0.173978354036808, "num_tokens": 36338436.0, "step": 20945 }, { "entropy": 5.402836322784424, "epoch": 1.6299941645594243, "grad_norm": 1.3203125, "learning_rate": 0.00047336953761619604, "loss": 5.169, "mean_token_accuracy": 0.17679326236248016, "num_tokens": 36347204.0, "step": 20950 }, { "entropy": 5.414460039138794, "epoch": 1.630383193931142, "grad_norm": 1.4140625, "learning_rate": 0.00047335645662368046, "loss": 5.1761, "mean_token_accuracy": 0.1849618673324585, "num_tokens": 36356225.0, "step": 20955 }, { "entropy": 5.484632778167724, "epoch": 1.6307722233028592, "grad_norm": 1.421875, "learning_rate": 0.0004733433726214214, "loss": 5.2419, "mean_token_accuracy": 0.17961994856595992, "num_tokens": 36364526.0, "step": 20960 }, { "entropy": 5.586671209335327, "epoch": 1.631161252674577, "grad_norm": 1.3359375, "learning_rate": 0.00047333028560961733, "loss": 5.3042, "mean_token_accuracy": 0.17767173647880555, "num_tokens": 36373162.0, "step": 20965 }, { "entropy": 5.55222373008728, "epoch": 1.6315502820462946, "grad_norm": 1.2890625, "learning_rate": 0.00047331719558846687, "loss": 5.2133, "mean_token_accuracy": 0.17999052703380586, "num_tokens": 36381545.0, "step": 20970 }, { "entropy": 5.478394937515259, "epoch": 1.631939311418012, "grad_norm": 1.3515625, "learning_rate": 0.00047330410255816863, "loss": 5.179, "mean_token_accuracy": 0.18163208067417144, "num_tokens": 36390267.0, "step": 20975 }, { "entropy": 5.512081956863403, "epoch": 1.6323283407897295, "grad_norm": 1.3203125, "learning_rate": 0.00047329100651892123, "loss": 5.2118, "mean_token_accuracy": 0.18402910530567168, "num_tokens": 36398910.0, "step": 20980 }, { "entropy": 5.502491140365601, "epoch": 1.6327173701614472, "grad_norm": 1.6328125, "learning_rate": 0.0004732779074709234, "loss": 5.1919, "mean_token_accuracy": 0.18053594082593918, "num_tokens": 36407382.0, "step": 20985 }, { "entropy": 5.452455234527588, "epoch": 1.6331063995331647, "grad_norm": 1.34375, "learning_rate": 0.000473264805414374, "loss": 5.1769, "mean_token_accuracy": 0.18799318224191666, "num_tokens": 36415734.0, "step": 20990 }, { "entropy": 5.504100704193116, "epoch": 1.6334954289048822, "grad_norm": 1.4296875, "learning_rate": 0.00047325170034947167, "loss": 5.2637, "mean_token_accuracy": 0.17064776122570038, "num_tokens": 36424537.0, "step": 20995 }, { "entropy": 5.513808393478394, "epoch": 1.6338844582766, "grad_norm": 1.2890625, "learning_rate": 0.00047323859227641537, "loss": 5.1551, "mean_token_accuracy": 0.18044808208942414, "num_tokens": 36433276.0, "step": 21000 }, { "epoch": 1.6338844582766, "eval_entropy": 5.372300026299749, "eval_loss": 5.31075382232666, "eval_mean_token_accuracy": 0.1839048819603888, "eval_num_tokens": 36433276.0, "eval_runtime": 28.7266, "eval_samples_per_second": 1446.672, "eval_steps_per_second": 180.843, "step": 21000 }, { "entropy": 5.501618051528931, "epoch": 1.6342734876483176, "grad_norm": 1.4765625, "learning_rate": 0.00047322548119540397, "loss": 5.2173, "mean_token_accuracy": 0.17700836956501007, "num_tokens": 36442154.0, "step": 21005 }, { "entropy": 5.398017358779907, "epoch": 1.634662517020035, "grad_norm": 1.328125, "learning_rate": 0.00047321236710663636, "loss": 5.064, "mean_token_accuracy": 0.18820375800132752, "num_tokens": 36450625.0, "step": 21010 }, { "entropy": 5.560705900192261, "epoch": 1.6350515463917525, "grad_norm": 1.265625, "learning_rate": 0.00047319925001031165, "loss": 5.2152, "mean_token_accuracy": 0.17989173531532288, "num_tokens": 36460082.0, "step": 21015 }, { "entropy": 5.546498870849609, "epoch": 1.6354405757634702, "grad_norm": 1.5390625, "learning_rate": 0.0004731861299066287, "loss": 5.2649, "mean_token_accuracy": 0.17282200008630752, "num_tokens": 36469372.0, "step": 21020 }, { "entropy": 5.420505666732788, "epoch": 1.6358296051351877, "grad_norm": 1.546875, "learning_rate": 0.0004731730067957867, "loss": 5.0368, "mean_token_accuracy": 0.1866752788424492, "num_tokens": 36478190.0, "step": 21025 }, { "entropy": 5.387681293487549, "epoch": 1.6362186345069052, "grad_norm": 1.4140625, "learning_rate": 0.00047315988067798476, "loss": 5.1613, "mean_token_accuracy": 0.18450152724981309, "num_tokens": 36486245.0, "step": 21030 }, { "entropy": 5.4909279346466064, "epoch": 1.6366076638786229, "grad_norm": 1.4765625, "learning_rate": 0.000473146751553422, "loss": 5.2498, "mean_token_accuracy": 0.17672774493694304, "num_tokens": 36495858.0, "step": 21035 }, { "entropy": 5.599689865112305, "epoch": 1.6369966932503404, "grad_norm": 1.546875, "learning_rate": 0.0004731336194222978, "loss": 5.2539, "mean_token_accuracy": 0.17409946024417877, "num_tokens": 36504564.0, "step": 21040 }, { "entropy": 5.353814888000488, "epoch": 1.6373857226220578, "grad_norm": 1.53125, "learning_rate": 0.00047312048428481114, "loss": 5.1251, "mean_token_accuracy": 0.1855647921562195, "num_tokens": 36512758.0, "step": 21045 }, { "entropy": 5.3884512424469, "epoch": 1.6377747519937755, "grad_norm": 1.546875, "learning_rate": 0.00047310734614116153, "loss": 5.1124, "mean_token_accuracy": 0.18222106844186783, "num_tokens": 36521429.0, "step": 21050 }, { "entropy": 5.514833450317383, "epoch": 1.6381637813654932, "grad_norm": 1.3359375, "learning_rate": 0.0004730942049915483, "loss": 5.2004, "mean_token_accuracy": 0.18652649223804474, "num_tokens": 36530161.0, "step": 21055 }, { "entropy": 5.496166181564331, "epoch": 1.6385528107372107, "grad_norm": 1.3203125, "learning_rate": 0.0004730810608361707, "loss": 5.1813, "mean_token_accuracy": 0.18224625438451766, "num_tokens": 36538184.0, "step": 21060 }, { "entropy": 5.4722819328308105, "epoch": 1.6389418401089282, "grad_norm": 1.34375, "learning_rate": 0.00047306791367522833, "loss": 5.1678, "mean_token_accuracy": 0.1848045125603676, "num_tokens": 36547418.0, "step": 21065 }, { "entropy": 5.614156723022461, "epoch": 1.6393308694806459, "grad_norm": 1.390625, "learning_rate": 0.0004730547635089206, "loss": 5.3604, "mean_token_accuracy": 0.1707831457257271, "num_tokens": 36556542.0, "step": 21070 }, { "entropy": 5.5106339931488035, "epoch": 1.6397198988523634, "grad_norm": 1.2578125, "learning_rate": 0.00047304161033744714, "loss": 5.1586, "mean_token_accuracy": 0.17730581611394883, "num_tokens": 36565903.0, "step": 21075 }, { "entropy": 5.429777765274048, "epoch": 1.6401089282240808, "grad_norm": 1.40625, "learning_rate": 0.0004730284541610075, "loss": 5.1755, "mean_token_accuracy": 0.17911712378263472, "num_tokens": 36574010.0, "step": 21080 }, { "entropy": 5.45843014717102, "epoch": 1.6404979575957985, "grad_norm": 1.4765625, "learning_rate": 0.0004730152949798012, "loss": 5.1999, "mean_token_accuracy": 0.1825070008635521, "num_tokens": 36582142.0, "step": 21085 }, { "entropy": 5.455931711196899, "epoch": 1.640886986967516, "grad_norm": 1.6171875, "learning_rate": 0.00047300213279402787, "loss": 5.1971, "mean_token_accuracy": 0.18478820770978927, "num_tokens": 36590676.0, "step": 21090 }, { "entropy": 5.477128267288208, "epoch": 1.6412760163392335, "grad_norm": 1.359375, "learning_rate": 0.00047298896760388745, "loss": 5.0925, "mean_token_accuracy": 0.19207348823547363, "num_tokens": 36599489.0, "step": 21095 }, { "entropy": 5.491489315032959, "epoch": 1.6416650457109512, "grad_norm": 1.3828125, "learning_rate": 0.0004729757994095796, "loss": 5.1659, "mean_token_accuracy": 0.17730745822191238, "num_tokens": 36608231.0, "step": 21100 }, { "entropy": 5.419163703918457, "epoch": 1.6420540750826689, "grad_norm": 1.3203125, "learning_rate": 0.00047296262821130405, "loss": 5.2344, "mean_token_accuracy": 0.17491605430841445, "num_tokens": 36617335.0, "step": 21105 }, { "entropy": 5.54743390083313, "epoch": 1.6424431044543863, "grad_norm": 1.296875, "learning_rate": 0.00047294945400926065, "loss": 5.2425, "mean_token_accuracy": 0.17947182357311248, "num_tokens": 36626249.0, "step": 21110 }, { "entropy": 5.563682126998901, "epoch": 1.6428321338261038, "grad_norm": 1.578125, "learning_rate": 0.0004729362768036494, "loss": 5.3014, "mean_token_accuracy": 0.1732996955513954, "num_tokens": 36634602.0, "step": 21115 }, { "entropy": 5.485794401168823, "epoch": 1.6432211631978215, "grad_norm": 1.53125, "learning_rate": 0.00047292309659467024, "loss": 5.2352, "mean_token_accuracy": 0.1770779922604561, "num_tokens": 36643091.0, "step": 21120 }, { "entropy": 5.541834020614624, "epoch": 1.643610192569539, "grad_norm": 1.5390625, "learning_rate": 0.0004729099133825231, "loss": 5.2513, "mean_token_accuracy": 0.18132439106702805, "num_tokens": 36652530.0, "step": 21125 }, { "entropy": 5.5994336128234865, "epoch": 1.6439992219412565, "grad_norm": 1.546875, "learning_rate": 0.000472896727167408, "loss": 5.2581, "mean_token_accuracy": 0.17381585389375687, "num_tokens": 36660858.0, "step": 21130 }, { "entropy": 5.61146092414856, "epoch": 1.6443882513129742, "grad_norm": 1.6015625, "learning_rate": 0.00047288353794952505, "loss": 5.3237, "mean_token_accuracy": 0.16663160622119905, "num_tokens": 36670211.0, "step": 21135 }, { "entropy": 5.502262973785401, "epoch": 1.6447772806846916, "grad_norm": 1.28125, "learning_rate": 0.0004728703457290744, "loss": 5.2337, "mean_token_accuracy": 0.1756765738129616, "num_tokens": 36679604.0, "step": 21140 }, { "entropy": 5.548543882369995, "epoch": 1.6451663100564091, "grad_norm": 1.3828125, "learning_rate": 0.0004728571505062562, "loss": 5.2994, "mean_token_accuracy": 0.17042364180088043, "num_tokens": 36687908.0, "step": 21145 }, { "entropy": 5.509022760391235, "epoch": 1.6455553394281268, "grad_norm": 1.4375, "learning_rate": 0.0004728439522812707, "loss": 5.1156, "mean_token_accuracy": 0.1840012028813362, "num_tokens": 36696675.0, "step": 21150 }, { "entropy": 5.464862585067749, "epoch": 1.6459443687998445, "grad_norm": 1.4375, "learning_rate": 0.00047283075105431806, "loss": 5.2001, "mean_token_accuracy": 0.17636069655418396, "num_tokens": 36705594.0, "step": 21155 }, { "entropy": 5.543157863616943, "epoch": 1.646333398171562, "grad_norm": 1.40625, "learning_rate": 0.0004728175468255987, "loss": 5.2583, "mean_token_accuracy": 0.17793198972940444, "num_tokens": 36714008.0, "step": 21160 }, { "entropy": 5.492327642440796, "epoch": 1.6467224275432795, "grad_norm": 1.9453125, "learning_rate": 0.00047280433959531287, "loss": 5.1043, "mean_token_accuracy": 0.19281417727470399, "num_tokens": 36723093.0, "step": 21165 }, { "entropy": 5.449915790557862, "epoch": 1.6471114569149972, "grad_norm": 1.328125, "learning_rate": 0.000472791129363661, "loss": 5.1076, "mean_token_accuracy": 0.18590016067028045, "num_tokens": 36732119.0, "step": 21170 }, { "entropy": 5.393493413925171, "epoch": 1.6475004862867146, "grad_norm": 1.546875, "learning_rate": 0.0004727779161308436, "loss": 5.1792, "mean_token_accuracy": 0.17904208302497865, "num_tokens": 36740593.0, "step": 21175 }, { "entropy": 5.561703491210937, "epoch": 1.6478895156584321, "grad_norm": 1.484375, "learning_rate": 0.0004727646998970612, "loss": 5.3688, "mean_token_accuracy": 0.17116793543100356, "num_tokens": 36749083.0, "step": 21180 }, { "entropy": 5.580496835708618, "epoch": 1.6482785450301498, "grad_norm": 1.40625, "learning_rate": 0.00047275148066251417, "loss": 5.1801, "mean_token_accuracy": 0.1789710432291031, "num_tokens": 36757469.0, "step": 21185 }, { "entropy": 5.593105030059815, "epoch": 1.6486675744018673, "grad_norm": 1.3046875, "learning_rate": 0.0004727382584274032, "loss": 5.3309, "mean_token_accuracy": 0.16570038050413133, "num_tokens": 36766197.0, "step": 21190 }, { "entropy": 5.44945387840271, "epoch": 1.6490566037735848, "grad_norm": 1.2890625, "learning_rate": 0.00047272503319192887, "loss": 5.1772, "mean_token_accuracy": 0.18537746071815492, "num_tokens": 36774172.0, "step": 21195 }, { "entropy": 5.498950624465943, "epoch": 1.6494456331453025, "grad_norm": 1.2421875, "learning_rate": 0.0004727118049562919, "loss": 5.2195, "mean_token_accuracy": 0.17729924619197845, "num_tokens": 36783549.0, "step": 21200 }, { "entropy": 5.603929471969605, "epoch": 1.6498346625170202, "grad_norm": 1.6171875, "learning_rate": 0.000472698573720693, "loss": 5.2722, "mean_token_accuracy": 0.17381686121225357, "num_tokens": 36791755.0, "step": 21205 }, { "entropy": 5.5498090267181395, "epoch": 1.6502236918887376, "grad_norm": 3.03125, "learning_rate": 0.0004726853394853329, "loss": 5.3341, "mean_token_accuracy": 0.17136198431253433, "num_tokens": 36801253.0, "step": 21210 }, { "entropy": 5.473941421508789, "epoch": 1.650612721260455, "grad_norm": 1.28125, "learning_rate": 0.00047267210225041234, "loss": 5.1686, "mean_token_accuracy": 0.1872959852218628, "num_tokens": 36810497.0, "step": 21215 }, { "entropy": 5.479462480545044, "epoch": 1.6510017506321728, "grad_norm": 1.4921875, "learning_rate": 0.00047265886201613234, "loss": 5.1576, "mean_token_accuracy": 0.18567696511745452, "num_tokens": 36819823.0, "step": 21220 }, { "entropy": 5.476222896575928, "epoch": 1.6513907800038903, "grad_norm": 1.5625, "learning_rate": 0.00047264561878269365, "loss": 5.1423, "mean_token_accuracy": 0.18462543934583664, "num_tokens": 36828935.0, "step": 21225 }, { "entropy": 5.468758678436279, "epoch": 1.6517798093756078, "grad_norm": 1.5546875, "learning_rate": 0.0004726323725502973, "loss": 5.0973, "mean_token_accuracy": 0.18429700881242753, "num_tokens": 36837906.0, "step": 21230 }, { "entropy": 5.498550271987915, "epoch": 1.6521688387473255, "grad_norm": 1.4140625, "learning_rate": 0.0004726191233191443, "loss": 5.1622, "mean_token_accuracy": 0.1857444688677788, "num_tokens": 36846041.0, "step": 21235 }, { "entropy": 5.542250347137451, "epoch": 1.6525578681190431, "grad_norm": 1.3359375, "learning_rate": 0.0004726058710894357, "loss": 5.2919, "mean_token_accuracy": 0.1728598564863205, "num_tokens": 36854493.0, "step": 21240 }, { "entropy": 5.445422792434693, "epoch": 1.6529468974907604, "grad_norm": 1.3359375, "learning_rate": 0.0004725926158613724, "loss": 5.0903, "mean_token_accuracy": 0.1866839811205864, "num_tokens": 36863042.0, "step": 21245 }, { "entropy": 5.528048992156982, "epoch": 1.653335926862478, "grad_norm": 1.34375, "learning_rate": 0.0004725793576351557, "loss": 5.2602, "mean_token_accuracy": 0.17213737666606904, "num_tokens": 36872513.0, "step": 21250 }, { "entropy": 5.522940444946289, "epoch": 1.6537249562341958, "grad_norm": 1.4296875, "learning_rate": 0.0004725660964109867, "loss": 5.2161, "mean_token_accuracy": 0.1788783550262451, "num_tokens": 36881149.0, "step": 21255 }, { "entropy": 5.488233470916748, "epoch": 1.6541139856059133, "grad_norm": 1.421875, "learning_rate": 0.00047255283218906673, "loss": 5.2395, "mean_token_accuracy": 0.18180759847164155, "num_tokens": 36889372.0, "step": 21260 }, { "entropy": 5.48690447807312, "epoch": 1.6545030149776307, "grad_norm": 1.5234375, "learning_rate": 0.000472539564969597, "loss": 5.1756, "mean_token_accuracy": 0.18047224432229997, "num_tokens": 36897727.0, "step": 21265 }, { "entropy": 5.498178625106812, "epoch": 1.6548920443493484, "grad_norm": 1.421875, "learning_rate": 0.00047252629475277863, "loss": 5.188, "mean_token_accuracy": 0.18057161420583726, "num_tokens": 36906288.0, "step": 21270 }, { "entropy": 5.528655481338501, "epoch": 1.655281073721066, "grad_norm": 1.515625, "learning_rate": 0.0004725130215388132, "loss": 5.248, "mean_token_accuracy": 0.1735369861125946, "num_tokens": 36915614.0, "step": 21275 }, { "entropy": 5.472884035110473, "epoch": 1.6556701030927834, "grad_norm": 1.5078125, "learning_rate": 0.0004724997453279021, "loss": 5.1117, "mean_token_accuracy": 0.18641575276851655, "num_tokens": 36923631.0, "step": 21280 }, { "entropy": 5.512561893463134, "epoch": 1.656059132464501, "grad_norm": 1.578125, "learning_rate": 0.0004724864661202467, "loss": 5.2837, "mean_token_accuracy": 0.1790953740477562, "num_tokens": 36932296.0, "step": 21285 }, { "entropy": 5.4006248950958256, "epoch": 1.6564481618362188, "grad_norm": 1.671875, "learning_rate": 0.00047247318391604846, "loss": 5.0735, "mean_token_accuracy": 0.19231092929840088, "num_tokens": 36940785.0, "step": 21290 }, { "entropy": 5.509478616714477, "epoch": 1.656837191207936, "grad_norm": 1.4375, "learning_rate": 0.00047245989871550897, "loss": 5.2028, "mean_token_accuracy": 0.1878322422504425, "num_tokens": 36948797.0, "step": 21295 }, { "entropy": 5.554609918594361, "epoch": 1.6572262205796537, "grad_norm": 1.4921875, "learning_rate": 0.0004724466105188299, "loss": 5.3133, "mean_token_accuracy": 0.175143563747406, "num_tokens": 36957808.0, "step": 21300 }, { "entropy": 5.529737281799316, "epoch": 1.6576152499513714, "grad_norm": 1.453125, "learning_rate": 0.00047243331932621263, "loss": 5.1916, "mean_token_accuracy": 0.18748618215322493, "num_tokens": 36966260.0, "step": 21305 }, { "entropy": 5.544512367248535, "epoch": 1.658004279323089, "grad_norm": 1.4296875, "learning_rate": 0.0004724200251378591, "loss": 5.2393, "mean_token_accuracy": 0.1755203902721405, "num_tokens": 36975436.0, "step": 21310 }, { "entropy": 5.607953500747681, "epoch": 1.6583933086948064, "grad_norm": 1.390625, "learning_rate": 0.0004724067279539709, "loss": 5.3472, "mean_token_accuracy": 0.17324303537607194, "num_tokens": 36983485.0, "step": 21315 }, { "entropy": 5.649571800231934, "epoch": 1.658782338066524, "grad_norm": 1.359375, "learning_rate": 0.00047239342777474975, "loss": 5.3442, "mean_token_accuracy": 0.17102190107107162, "num_tokens": 36992632.0, "step": 21320 }, { "entropy": 5.498779916763306, "epoch": 1.6591713674382416, "grad_norm": 1.359375, "learning_rate": 0.00047238012460039765, "loss": 5.1282, "mean_token_accuracy": 0.184706611931324, "num_tokens": 37000694.0, "step": 21325 }, { "entropy": 5.43941969871521, "epoch": 1.659560396809959, "grad_norm": 1.3359375, "learning_rate": 0.0004723668184311162, "loss": 5.195, "mean_token_accuracy": 0.18460538238286972, "num_tokens": 37009514.0, "step": 21330 }, { "entropy": 5.535276889801025, "epoch": 1.6599494261816767, "grad_norm": 1.4453125, "learning_rate": 0.0004723535092671074, "loss": 5.3332, "mean_token_accuracy": 0.1774955838918686, "num_tokens": 37019434.0, "step": 21335 }, { "entropy": 5.482357740402222, "epoch": 1.6603384555533944, "grad_norm": 1.453125, "learning_rate": 0.00047234019710857335, "loss": 5.1406, "mean_token_accuracy": 0.17885607331991196, "num_tokens": 37028673.0, "step": 21340 }, { "entropy": 5.458214187622071, "epoch": 1.6607274849251117, "grad_norm": 1.390625, "learning_rate": 0.0004723268819557158, "loss": 5.1822, "mean_token_accuracy": 0.18142179548740386, "num_tokens": 37038204.0, "step": 21345 }, { "entropy": 5.411493015289307, "epoch": 1.6611165142968294, "grad_norm": 1.4296875, "learning_rate": 0.00047231356380873687, "loss": 5.1029, "mean_token_accuracy": 0.18283302634954451, "num_tokens": 37047301.0, "step": 21350 }, { "entropy": 5.473569631576538, "epoch": 1.661505543668547, "grad_norm": 1.3515625, "learning_rate": 0.0004723002426678388, "loss": 5.2148, "mean_token_accuracy": 0.1792337715625763, "num_tokens": 37054892.0, "step": 21355 }, { "entropy": 5.460709905624389, "epoch": 1.6618945730402646, "grad_norm": 1.3046875, "learning_rate": 0.0004722869185332235, "loss": 5.1015, "mean_token_accuracy": 0.18274426758289336, "num_tokens": 37063139.0, "step": 21360 }, { "entropy": 5.507890367507935, "epoch": 1.662283602411982, "grad_norm": 1.328125, "learning_rate": 0.00047227359140509324, "loss": 5.2773, "mean_token_accuracy": 0.17320998758077621, "num_tokens": 37072019.0, "step": 21365 }, { "entropy": 5.508670902252197, "epoch": 1.6626726317836997, "grad_norm": 1.5, "learning_rate": 0.0004722602612836501, "loss": 5.3563, "mean_token_accuracy": 0.17287321388721466, "num_tokens": 37081209.0, "step": 21370 }, { "entropy": 5.416639614105224, "epoch": 1.6630616611554172, "grad_norm": 1.3515625, "learning_rate": 0.00047224692816909665, "loss": 5.0897, "mean_token_accuracy": 0.18702242225408555, "num_tokens": 37089464.0, "step": 21375 }, { "entropy": 5.436346960067749, "epoch": 1.6634506905271347, "grad_norm": 1.5390625, "learning_rate": 0.0004722335920616349, "loss": 5.0992, "mean_token_accuracy": 0.18826077431440352, "num_tokens": 37098224.0, "step": 21380 }, { "entropy": 5.464160394668579, "epoch": 1.6638397198988524, "grad_norm": 1.4375, "learning_rate": 0.00047222025296146745, "loss": 5.2496, "mean_token_accuracy": 0.18096317499876022, "num_tokens": 37107039.0, "step": 21385 }, { "entropy": 5.578289270401001, "epoch": 1.66422874927057, "grad_norm": 1.3125, "learning_rate": 0.00047220691086879643, "loss": 5.264, "mean_token_accuracy": 0.17396355122327806, "num_tokens": 37116029.0, "step": 21390 }, { "entropy": 5.490733337402344, "epoch": 1.6646177786422873, "grad_norm": 1.375, "learning_rate": 0.0004721935657838245, "loss": 5.0709, "mean_token_accuracy": 0.19254263937473298, "num_tokens": 37124553.0, "step": 21395 }, { "entropy": 5.4725157737731935, "epoch": 1.665006808014005, "grad_norm": 1.4140625, "learning_rate": 0.000472180217706754, "loss": 5.2293, "mean_token_accuracy": 0.18405308574438095, "num_tokens": 37132670.0, "step": 21400 }, { "entropy": 5.497640800476074, "epoch": 1.6653958373857227, "grad_norm": 1.953125, "learning_rate": 0.0004721668666377876, "loss": 5.3252, "mean_token_accuracy": 0.17594234198331832, "num_tokens": 37141534.0, "step": 21405 }, { "entropy": 5.513368940353393, "epoch": 1.6657848667574402, "grad_norm": 1.265625, "learning_rate": 0.00047215351257712783, "loss": 5.2368, "mean_token_accuracy": 0.17468259036540984, "num_tokens": 37150895.0, "step": 21410 }, { "entropy": 5.502500820159912, "epoch": 1.6661738961291577, "grad_norm": 1.296875, "learning_rate": 0.00047214015552497735, "loss": 5.1871, "mean_token_accuracy": 0.18133655339479446, "num_tokens": 37159244.0, "step": 21415 }, { "entropy": 5.4912059783935545, "epoch": 1.6665629255008754, "grad_norm": 1.3671875, "learning_rate": 0.00047212679548153867, "loss": 5.2469, "mean_token_accuracy": 0.18683581799268723, "num_tokens": 37167762.0, "step": 21420 }, { "entropy": 5.4224341869354244, "epoch": 1.6669519548725928, "grad_norm": 1.4453125, "learning_rate": 0.00047211343244701475, "loss": 5.1685, "mean_token_accuracy": 0.18159301280975343, "num_tokens": 37176470.0, "step": 21425 }, { "entropy": 5.531132411956787, "epoch": 1.6673409842443103, "grad_norm": 1.5, "learning_rate": 0.0004721000664216081, "loss": 5.2758, "mean_token_accuracy": 0.17480931729078292, "num_tokens": 37185923.0, "step": 21430 }, { "entropy": 5.496185970306397, "epoch": 1.667730013616028, "grad_norm": 1.3515625, "learning_rate": 0.0004720866974055219, "loss": 5.2788, "mean_token_accuracy": 0.17899755835533143, "num_tokens": 37195400.0, "step": 21435 }, { "entropy": 5.557925462722778, "epoch": 1.6681190429877457, "grad_norm": 1.40625, "learning_rate": 0.0004720733253989585, "loss": 5.3076, "mean_token_accuracy": 0.17580303698778152, "num_tokens": 37203862.0, "step": 21440 }, { "entropy": 5.477754020690918, "epoch": 1.6685080723594632, "grad_norm": 1.3984375, "learning_rate": 0.00047205995040212114, "loss": 5.0736, "mean_token_accuracy": 0.18728139102458954, "num_tokens": 37212518.0, "step": 21445 }, { "entropy": 5.564401006698608, "epoch": 1.6688971017311807, "grad_norm": 1.7109375, "learning_rate": 0.0004720465724152127, "loss": 5.3096, "mean_token_accuracy": 0.17177732437849044, "num_tokens": 37221342.0, "step": 21450 }, { "entropy": 5.5528092861175535, "epoch": 1.6692861311028984, "grad_norm": 1.7890625, "learning_rate": 0.00047203319143843613, "loss": 5.2324, "mean_token_accuracy": 0.1832715541124344, "num_tokens": 37230477.0, "step": 21455 }, { "entropy": 5.557088422775268, "epoch": 1.6696751604746158, "grad_norm": 1.4609375, "learning_rate": 0.0004720198074719946, "loss": 5.1887, "mean_token_accuracy": 0.1888517916202545, "num_tokens": 37238590.0, "step": 21460 }, { "entropy": 5.467580127716064, "epoch": 1.6700641898463333, "grad_norm": 1.3984375, "learning_rate": 0.00047200642051609094, "loss": 5.2181, "mean_token_accuracy": 0.18081460446119307, "num_tokens": 37248065.0, "step": 21465 }, { "entropy": 5.492550086975098, "epoch": 1.670453219218051, "grad_norm": 1.359375, "learning_rate": 0.0004719930305709285, "loss": 5.2125, "mean_token_accuracy": 0.18174617886543273, "num_tokens": 37256467.0, "step": 21470 }, { "entropy": 5.553583717346191, "epoch": 1.6708422485897685, "grad_norm": 1.65625, "learning_rate": 0.00047197963763671033, "loss": 5.1984, "mean_token_accuracy": 0.1813953474164009, "num_tokens": 37264255.0, "step": 21475 }, { "entropy": 5.460461521148682, "epoch": 1.671231277961486, "grad_norm": 1.34375, "learning_rate": 0.0004719662417136397, "loss": 5.1129, "mean_token_accuracy": 0.18463306725025178, "num_tokens": 37272671.0, "step": 21480 }, { "entropy": 5.456419610977173, "epoch": 1.6716203073332037, "grad_norm": 1.4921875, "learning_rate": 0.00047195284280191987, "loss": 5.2427, "mean_token_accuracy": 0.18076366037130356, "num_tokens": 37281895.0, "step": 21485 }, { "entropy": 5.401412487030029, "epoch": 1.6720093367049214, "grad_norm": 1.3125, "learning_rate": 0.0004719394409017541, "loss": 5.125, "mean_token_accuracy": 0.18857089728116988, "num_tokens": 37290098.0, "step": 21490 }, { "entropy": 5.506783533096313, "epoch": 1.6723983660766388, "grad_norm": 1.6640625, "learning_rate": 0.00047192603601334585, "loss": 5.1737, "mean_token_accuracy": 0.18363878577947618, "num_tokens": 37299494.0, "step": 21495 }, { "entropy": 5.502944612503052, "epoch": 1.6727873954483563, "grad_norm": 1.6953125, "learning_rate": 0.00047191262813689835, "loss": 5.2464, "mean_token_accuracy": 0.17842065989971162, "num_tokens": 37308366.0, "step": 21500 }, { "entropy": 5.476567268371582, "epoch": 1.673176424820074, "grad_norm": 1.46875, "learning_rate": 0.0004718992172726152, "loss": 5.219, "mean_token_accuracy": 0.17957063466310502, "num_tokens": 37316774.0, "step": 21505 }, { "entropy": 5.520447397232056, "epoch": 1.6735654541917915, "grad_norm": 1.6171875, "learning_rate": 0.00047188580342069983, "loss": 5.2503, "mean_token_accuracy": 0.17251145243644714, "num_tokens": 37325388.0, "step": 21510 }, { "entropy": 5.562305021286011, "epoch": 1.673954483563509, "grad_norm": 1.3359375, "learning_rate": 0.0004718723865813557, "loss": 5.2768, "mean_token_accuracy": 0.17611507922410966, "num_tokens": 37333476.0, "step": 21515 }, { "entropy": 5.5756597995758055, "epoch": 1.6743435129352267, "grad_norm": 1.4765625, "learning_rate": 0.0004718589667547865, "loss": 5.3421, "mean_token_accuracy": 0.17612942755222322, "num_tokens": 37342556.0, "step": 21520 }, { "entropy": 5.53990421295166, "epoch": 1.6747325423069441, "grad_norm": 1.40625, "learning_rate": 0.0004718455439411958, "loss": 5.2205, "mean_token_accuracy": 0.18342919945716857, "num_tokens": 37351082.0, "step": 21525 }, { "entropy": 5.537401437759399, "epoch": 1.6751215716786616, "grad_norm": 1.4453125, "learning_rate": 0.0004718321181407873, "loss": 5.1775, "mean_token_accuracy": 0.1762392118573189, "num_tokens": 37359083.0, "step": 21530 }, { "entropy": 5.466626596450806, "epoch": 1.6755106010503793, "grad_norm": 1.3671875, "learning_rate": 0.0004718186893537647, "loss": 5.1831, "mean_token_accuracy": 0.18693919479846954, "num_tokens": 37367982.0, "step": 21535 }, { "entropy": 5.570475101470947, "epoch": 1.675899630422097, "grad_norm": 1.421875, "learning_rate": 0.0004718052575803318, "loss": 5.2665, "mean_token_accuracy": 0.17587852030992507, "num_tokens": 37376932.0, "step": 21540 }, { "entropy": 5.53325834274292, "epoch": 1.6762886597938145, "grad_norm": 1.765625, "learning_rate": 0.0004717918228206923, "loss": 5.2771, "mean_token_accuracy": 0.1744777664542198, "num_tokens": 37386248.0, "step": 21545 }, { "entropy": 5.5484436511993405, "epoch": 1.676677689165532, "grad_norm": 1.578125, "learning_rate": 0.0004717783850750501, "loss": 5.1991, "mean_token_accuracy": 0.1772058054804802, "num_tokens": 37395412.0, "step": 21550 }, { "entropy": 5.542940521240235, "epoch": 1.6770667185372496, "grad_norm": 1.8359375, "learning_rate": 0.0004717649443436091, "loss": 5.161, "mean_token_accuracy": 0.18279172480106354, "num_tokens": 37404332.0, "step": 21555 }, { "entropy": 5.538176393508911, "epoch": 1.6774557479089671, "grad_norm": 1.3984375, "learning_rate": 0.00047175150062657336, "loss": 5.2719, "mean_token_accuracy": 0.1777028486132622, "num_tokens": 37413365.0, "step": 21560 }, { "entropy": 5.5362122535705565, "epoch": 1.6778447772806846, "grad_norm": 1.484375, "learning_rate": 0.00047173805392414664, "loss": 5.1549, "mean_token_accuracy": 0.1803798645734787, "num_tokens": 37422164.0, "step": 21565 }, { "entropy": 5.529918813705445, "epoch": 1.6782338066524023, "grad_norm": 1.4765625, "learning_rate": 0.0004717246042365332, "loss": 5.2371, "mean_token_accuracy": 0.18031506687402726, "num_tokens": 37431092.0, "step": 21570 }, { "entropy": 5.522467136383057, "epoch": 1.6786228360241198, "grad_norm": 1.265625, "learning_rate": 0.00047171115156393695, "loss": 5.3072, "mean_token_accuracy": 0.1718997463583946, "num_tokens": 37440832.0, "step": 21575 }, { "entropy": 5.519169569015503, "epoch": 1.6790118653958372, "grad_norm": 1.4140625, "learning_rate": 0.00047169769590656207, "loss": 5.2358, "mean_token_accuracy": 0.1741737648844719, "num_tokens": 37449317.0, "step": 21580 }, { "entropy": 5.547975540161133, "epoch": 1.679400894767555, "grad_norm": 1.640625, "learning_rate": 0.00047168423726461273, "loss": 5.2718, "mean_token_accuracy": 0.17741824686527252, "num_tokens": 37457820.0, "step": 21585 }, { "entropy": 5.516720199584961, "epoch": 1.6797899241392726, "grad_norm": 1.4453125, "learning_rate": 0.0004716707756382931, "loss": 5.1137, "mean_token_accuracy": 0.19077614545822144, "num_tokens": 37466378.0, "step": 21590 }, { "entropy": 5.543765926361084, "epoch": 1.6801789535109901, "grad_norm": 1.4375, "learning_rate": 0.00047165731102780757, "loss": 5.2484, "mean_token_accuracy": 0.17531055808067322, "num_tokens": 37475114.0, "step": 21595 }, { "entropy": 5.5077352046966555, "epoch": 1.6805679828827076, "grad_norm": 1.3984375, "learning_rate": 0.00047164384343336037, "loss": 5.2652, "mean_token_accuracy": 0.168734173476696, "num_tokens": 37483898.0, "step": 21600 }, { "entropy": 5.498862171173096, "epoch": 1.6809570122544253, "grad_norm": 1.421875, "learning_rate": 0.00047163037285515583, "loss": 5.2499, "mean_token_accuracy": 0.18168826997280121, "num_tokens": 37492420.0, "step": 21605 }, { "entropy": 5.501647472381592, "epoch": 1.6813460416261428, "grad_norm": 1.4765625, "learning_rate": 0.0004716168992933982, "loss": 5.1504, "mean_token_accuracy": 0.18668870478868485, "num_tokens": 37501090.0, "step": 21610 }, { "entropy": 5.513693380355835, "epoch": 1.6817350709978602, "grad_norm": 1.3203125, "learning_rate": 0.00047160342274829234, "loss": 5.3013, "mean_token_accuracy": 0.1726093515753746, "num_tokens": 37510465.0, "step": 21615 }, { "entropy": 5.48835506439209, "epoch": 1.682124100369578, "grad_norm": 1.453125, "learning_rate": 0.00047158994322004223, "loss": 5.2147, "mean_token_accuracy": 0.18208342641592026, "num_tokens": 37519155.0, "step": 21620 }, { "entropy": 5.484408950805664, "epoch": 1.6825131297412956, "grad_norm": 1.3359375, "learning_rate": 0.0004715764607088527, "loss": 5.1904, "mean_token_accuracy": 0.18758898377418518, "num_tokens": 37527134.0, "step": 21625 }, { "entropy": 5.511429738998413, "epoch": 1.6829021591130129, "grad_norm": 1.5234375, "learning_rate": 0.0004715629752149283, "loss": 5.2217, "mean_token_accuracy": 0.18314019441604615, "num_tokens": 37536087.0, "step": 21630 }, { "entropy": 5.458495378494263, "epoch": 1.6832911884847306, "grad_norm": 1.390625, "learning_rate": 0.00047154948673847356, "loss": 5.1611, "mean_token_accuracy": 0.1872522711753845, "num_tokens": 37543896.0, "step": 21635 }, { "entropy": 5.465446090698242, "epoch": 1.6836802178564483, "grad_norm": 1.453125, "learning_rate": 0.0004715359952796933, "loss": 5.2192, "mean_token_accuracy": 0.18115221709012985, "num_tokens": 37552571.0, "step": 21640 }, { "entropy": 5.5718724727630615, "epoch": 1.6840692472281658, "grad_norm": 1.359375, "learning_rate": 0.00047152250083879203, "loss": 5.2636, "mean_token_accuracy": 0.17640819847583772, "num_tokens": 37560823.0, "step": 21645 }, { "entropy": 5.463348865509033, "epoch": 1.6844582765998832, "grad_norm": 1.515625, "learning_rate": 0.00047150900341597464, "loss": 5.1546, "mean_token_accuracy": 0.1767340987920761, "num_tokens": 37568312.0, "step": 21650 }, { "entropy": 5.449061489105224, "epoch": 1.684847305971601, "grad_norm": 1.484375, "learning_rate": 0.0004714955030114459, "loss": 5.2171, "mean_token_accuracy": 0.18659872114658355, "num_tokens": 37577008.0, "step": 21655 }, { "entropy": 5.521494674682617, "epoch": 1.6852363353433184, "grad_norm": 1.3125, "learning_rate": 0.00047148199962541065, "loss": 5.2181, "mean_token_accuracy": 0.17695734649896622, "num_tokens": 37586252.0, "step": 21660 }, { "entropy": 5.523296928405761, "epoch": 1.6856253647150359, "grad_norm": 1.34375, "learning_rate": 0.0004714684932580738, "loss": 5.2095, "mean_token_accuracy": 0.18079616725444794, "num_tokens": 37594699.0, "step": 21665 }, { "entropy": 5.479553937911987, "epoch": 1.6860143940867536, "grad_norm": 1.453125, "learning_rate": 0.0004714549839096403, "loss": 5.1891, "mean_token_accuracy": 0.17756162583827972, "num_tokens": 37603891.0, "step": 21670 }, { "entropy": 5.500479507446289, "epoch": 1.6864034234584713, "grad_norm": 1.2734375, "learning_rate": 0.00047144147158031507, "loss": 5.2086, "mean_token_accuracy": 0.17659277319908143, "num_tokens": 37612809.0, "step": 21675 }, { "entropy": 5.52520112991333, "epoch": 1.6867924528301885, "grad_norm": 1.296875, "learning_rate": 0.0004714279562703032, "loss": 5.1665, "mean_token_accuracy": 0.17749557346105577, "num_tokens": 37621787.0, "step": 21680 }, { "entropy": 5.433181810379028, "epoch": 1.6871814822019062, "grad_norm": 1.3125, "learning_rate": 0.0004714144379798098, "loss": 5.1155, "mean_token_accuracy": 0.19358740895986556, "num_tokens": 37629796.0, "step": 21685 }, { "entropy": 5.502446794509888, "epoch": 1.687570511573624, "grad_norm": 1.5078125, "learning_rate": 0.00047140091670903986, "loss": 5.1658, "mean_token_accuracy": 0.18205602169036866, "num_tokens": 37638467.0, "step": 21690 }, { "entropy": 5.47499532699585, "epoch": 1.6879595409453414, "grad_norm": 1.546875, "learning_rate": 0.00047138739245819857, "loss": 5.2202, "mean_token_accuracy": 0.1819450080394745, "num_tokens": 37647159.0, "step": 21695 }, { "entropy": 5.50620813369751, "epoch": 1.6883485703170589, "grad_norm": 1.6796875, "learning_rate": 0.00047137386522749124, "loss": 5.2061, "mean_token_accuracy": 0.17646756619215012, "num_tokens": 37655986.0, "step": 21700 }, { "entropy": 5.458985996246338, "epoch": 1.6887375996887766, "grad_norm": 1.3671875, "learning_rate": 0.0004713603350171231, "loss": 5.101, "mean_token_accuracy": 0.19006167352199554, "num_tokens": 37663932.0, "step": 21705 }, { "entropy": 5.545205211639404, "epoch": 1.689126629060494, "grad_norm": 1.3671875, "learning_rate": 0.00047134680182729926, "loss": 5.2627, "mean_token_accuracy": 0.171118625998497, "num_tokens": 37672142.0, "step": 21710 }, { "entropy": 5.491796255111694, "epoch": 1.6895156584322115, "grad_norm": 1.2890625, "learning_rate": 0.0004713332656582254, "loss": 5.1516, "mean_token_accuracy": 0.1812073454260826, "num_tokens": 37680569.0, "step": 21715 }, { "entropy": 5.4419197082519535, "epoch": 1.6899046878039292, "grad_norm": 1.3046875, "learning_rate": 0.0004713197265101066, "loss": 5.2284, "mean_token_accuracy": 0.1740078255534172, "num_tokens": 37688852.0, "step": 21720 }, { "entropy": 5.538496255874634, "epoch": 1.690293717175647, "grad_norm": 1.5234375, "learning_rate": 0.00047130618438314856, "loss": 5.2009, "mean_token_accuracy": 0.18574654161930085, "num_tokens": 37696900.0, "step": 21725 }, { "entropy": 5.569355010986328, "epoch": 1.6906827465473642, "grad_norm": 1.40625, "learning_rate": 0.0004712926392775565, "loss": 5.3547, "mean_token_accuracy": 0.17537433207035064, "num_tokens": 37706292.0, "step": 21730 }, { "entropy": 5.422090911865235, "epoch": 1.6910717759190819, "grad_norm": 1.2890625, "learning_rate": 0.0004712790911935362, "loss": 5.1559, "mean_token_accuracy": 0.18529009073972702, "num_tokens": 37715025.0, "step": 21735 }, { "entropy": 5.5033763408660885, "epoch": 1.6914608052907996, "grad_norm": 1.453125, "learning_rate": 0.000471265540131293, "loss": 5.2751, "mean_token_accuracy": 0.17744905650615692, "num_tokens": 37724124.0, "step": 21740 }, { "entropy": 5.535478305816651, "epoch": 1.691849834662517, "grad_norm": 1.3671875, "learning_rate": 0.00047125198609103267, "loss": 5.2153, "mean_token_accuracy": 0.1779232829809189, "num_tokens": 37732689.0, "step": 21745 }, { "entropy": 5.5286273002624515, "epoch": 1.6922388640342345, "grad_norm": 1.3515625, "learning_rate": 0.0004712384290729607, "loss": 5.179, "mean_token_accuracy": 0.1785541445016861, "num_tokens": 37741206.0, "step": 21750 }, { "entropy": 5.514972352981568, "epoch": 1.6926278934059522, "grad_norm": 1.5078125, "learning_rate": 0.000471224869077283, "loss": 5.1799, "mean_token_accuracy": 0.1855989173054695, "num_tokens": 37749549.0, "step": 21755 }, { "entropy": 5.397480154037476, "epoch": 1.6930169227776697, "grad_norm": 1.578125, "learning_rate": 0.00047121130610420527, "loss": 4.9959, "mean_token_accuracy": 0.19770121127367019, "num_tokens": 37758332.0, "step": 21760 }, { "entropy": 5.4677262783050535, "epoch": 1.6934059521493872, "grad_norm": 1.34375, "learning_rate": 0.00047119774015393323, "loss": 5.1968, "mean_token_accuracy": 0.17989788800477982, "num_tokens": 37767368.0, "step": 21765 }, { "entropy": 5.492316675186157, "epoch": 1.6937949815211049, "grad_norm": 1.46875, "learning_rate": 0.00047118417122667285, "loss": 5.1695, "mean_token_accuracy": 0.18027150332927705, "num_tokens": 37776426.0, "step": 21770 }, { "entropy": 5.59453330039978, "epoch": 1.6941840108928226, "grad_norm": 1.421875, "learning_rate": 0.0004711705993226298, "loss": 5.3459, "mean_token_accuracy": 0.17371474504470824, "num_tokens": 37784464.0, "step": 21775 }, { "entropy": 5.468116283416748, "epoch": 1.6945730402645398, "grad_norm": 1.40625, "learning_rate": 0.0004711570244420102, "loss": 5.1767, "mean_token_accuracy": 0.17527460753917695, "num_tokens": 37794307.0, "step": 21780 }, { "entropy": 5.538769292831421, "epoch": 1.6949620696362575, "grad_norm": 1.296875, "learning_rate": 0.0004711434465850199, "loss": 5.251, "mean_token_accuracy": 0.1727452203631401, "num_tokens": 37803151.0, "step": 21785 }, { "entropy": 5.4954376220703125, "epoch": 1.6953510990079752, "grad_norm": 1.4765625, "learning_rate": 0.0004711298657518651, "loss": 5.2201, "mean_token_accuracy": 0.18278917968273162, "num_tokens": 37812433.0, "step": 21790 }, { "entropy": 5.4799943447113035, "epoch": 1.6957401283796927, "grad_norm": 1.65625, "learning_rate": 0.0004711162819427518, "loss": 5.1538, "mean_token_accuracy": 0.17833563685417175, "num_tokens": 37820627.0, "step": 21795 }, { "entropy": 5.515842437744141, "epoch": 1.6961291577514102, "grad_norm": 1.5390625, "learning_rate": 0.000471102695157886, "loss": 5.209, "mean_token_accuracy": 0.179173843562603, "num_tokens": 37829015.0, "step": 21800 }, { "entropy": 5.544214344024658, "epoch": 1.6965181871231279, "grad_norm": 1.3359375, "learning_rate": 0.0004710891053974739, "loss": 5.2767, "mean_token_accuracy": 0.18105421662330629, "num_tokens": 37837097.0, "step": 21805 }, { "entropy": 5.483367586135865, "epoch": 1.6969072164948453, "grad_norm": 1.796875, "learning_rate": 0.0004710755126617217, "loss": 5.2337, "mean_token_accuracy": 0.1754517912864685, "num_tokens": 37845414.0, "step": 21810 }, { "entropy": 5.5808460235595705, "epoch": 1.6972962458665628, "grad_norm": 1.296875, "learning_rate": 0.0004710619169508358, "loss": 5.2418, "mean_token_accuracy": 0.17700733840465546, "num_tokens": 37855006.0, "step": 21815 }, { "entropy": 5.608074283599853, "epoch": 1.6976852752382805, "grad_norm": 1.3984375, "learning_rate": 0.0004710483182650223, "loss": 5.3714, "mean_token_accuracy": 0.17176454812288283, "num_tokens": 37863611.0, "step": 21820 }, { "entropy": 5.488765859603882, "epoch": 1.6980743046099982, "grad_norm": 1.4765625, "learning_rate": 0.00047103471660448767, "loss": 5.2412, "mean_token_accuracy": 0.1852096512913704, "num_tokens": 37871935.0, "step": 21825 }, { "entropy": 5.453651762008667, "epoch": 1.6984633339817157, "grad_norm": 1.296875, "learning_rate": 0.00047102111196943813, "loss": 5.194, "mean_token_accuracy": 0.17935559153556824, "num_tokens": 37880760.0, "step": 21830 }, { "entropy": 5.534674739837646, "epoch": 1.6988523633534331, "grad_norm": 1.390625, "learning_rate": 0.00047100750436008035, "loss": 5.1333, "mean_token_accuracy": 0.18111956119537354, "num_tokens": 37889457.0, "step": 21835 }, { "entropy": 5.509087371826172, "epoch": 1.6992413927251508, "grad_norm": 1.390625, "learning_rate": 0.00047099389377662054, "loss": 5.2159, "mean_token_accuracy": 0.17657059729099273, "num_tokens": 37897805.0, "step": 21840 }, { "entropy": 5.471603918075561, "epoch": 1.6996304220968683, "grad_norm": 1.3203125, "learning_rate": 0.0004709802802192654, "loss": 5.2611, "mean_token_accuracy": 0.17692361027002335, "num_tokens": 37906292.0, "step": 21845 }, { "entropy": 5.475686740875244, "epoch": 1.7000194514685858, "grad_norm": 1.4140625, "learning_rate": 0.00047096666368822153, "loss": 5.1862, "mean_token_accuracy": 0.17862415462732315, "num_tokens": 37914513.0, "step": 21850 }, { "entropy": 5.549863481521607, "epoch": 1.7004084808403035, "grad_norm": 1.390625, "learning_rate": 0.00047095304418369536, "loss": 5.1783, "mean_token_accuracy": 0.18084910213947297, "num_tokens": 37923097.0, "step": 21855 }, { "entropy": 5.511747026443482, "epoch": 1.700797510212021, "grad_norm": 1.3828125, "learning_rate": 0.0004709394217058936, "loss": 5.2284, "mean_token_accuracy": 0.18504218459129335, "num_tokens": 37931617.0, "step": 21860 }, { "entropy": 5.544911241531372, "epoch": 1.7011865395837384, "grad_norm": 1.515625, "learning_rate": 0.0004709257962550231, "loss": 5.1756, "mean_token_accuracy": 0.1816698357462883, "num_tokens": 37939777.0, "step": 21865 }, { "entropy": 5.488839864730835, "epoch": 1.7015755689554561, "grad_norm": 1.4765625, "learning_rate": 0.00047091216783129035, "loss": 5.2202, "mean_token_accuracy": 0.17924584299325944, "num_tokens": 37949375.0, "step": 21870 }, { "entropy": 5.465655088424683, "epoch": 1.7019645983271738, "grad_norm": 1.28125, "learning_rate": 0.0004708985364349024, "loss": 5.1785, "mean_token_accuracy": 0.18088839203119278, "num_tokens": 37958724.0, "step": 21875 }, { "entropy": 5.5307880401611325, "epoch": 1.7023536276988913, "grad_norm": 1.46875, "learning_rate": 0.00047088490206606586, "loss": 5.159, "mean_token_accuracy": 0.18678024411201477, "num_tokens": 37967646.0, "step": 21880 }, { "entropy": 5.494955682754517, "epoch": 1.7027426570706088, "grad_norm": 1.6015625, "learning_rate": 0.00047087126472498785, "loss": 5.2442, "mean_token_accuracy": 0.17920563966035843, "num_tokens": 37976058.0, "step": 21885 }, { "entropy": 5.3977477073669435, "epoch": 1.7031316864423265, "grad_norm": 1.4375, "learning_rate": 0.000470857624411875, "loss": 5.1493, "mean_token_accuracy": 0.18142630904912949, "num_tokens": 37984895.0, "step": 21890 }, { "entropy": 5.495544576644898, "epoch": 1.703520715814044, "grad_norm": 1.40625, "learning_rate": 0.00047084398112693456, "loss": 5.1429, "mean_token_accuracy": 0.18670977503061295, "num_tokens": 37993514.0, "step": 21895 }, { "entropy": 5.509128093719482, "epoch": 1.7039097451857614, "grad_norm": 1.3125, "learning_rate": 0.0004708303348703734, "loss": 5.1887, "mean_token_accuracy": 0.17902112603187562, "num_tokens": 38002274.0, "step": 21900 }, { "entropy": 5.456932926177979, "epoch": 1.7042987745574791, "grad_norm": 1.3359375, "learning_rate": 0.0004708166856423986, "loss": 5.0952, "mean_token_accuracy": 0.18529791682958602, "num_tokens": 38010336.0, "step": 21905 }, { "entropy": 5.461038494110108, "epoch": 1.7046878039291966, "grad_norm": 1.3515625, "learning_rate": 0.00047080303344321727, "loss": 5.1723, "mean_token_accuracy": 0.18365278393030166, "num_tokens": 38019166.0, "step": 21910 }, { "entropy": 5.4248772144317625, "epoch": 1.705076833300914, "grad_norm": 1.3984375, "learning_rate": 0.00047078937827303653, "loss": 5.2018, "mean_token_accuracy": 0.18425847440958024, "num_tokens": 38027634.0, "step": 21915 }, { "entropy": 5.502353763580322, "epoch": 1.7054658626726318, "grad_norm": 1.3671875, "learning_rate": 0.0004707757201320636, "loss": 5.197, "mean_token_accuracy": 0.17829769402742385, "num_tokens": 38036611.0, "step": 21920 }, { "entropy": 5.413452196121216, "epoch": 1.7058548920443495, "grad_norm": 1.4453125, "learning_rate": 0.00047076205902050577, "loss": 5.1171, "mean_token_accuracy": 0.18649646937847136, "num_tokens": 38045815.0, "step": 21925 }, { "entropy": 5.568564081192017, "epoch": 1.706243921416067, "grad_norm": 1.25, "learning_rate": 0.00047074839493857024, "loss": 5.2784, "mean_token_accuracy": 0.17126722782850265, "num_tokens": 38054973.0, "step": 21930 }, { "entropy": 5.538995170593262, "epoch": 1.7066329507877844, "grad_norm": 1.3125, "learning_rate": 0.0004707347278864644, "loss": 5.1426, "mean_token_accuracy": 0.18554636240005493, "num_tokens": 38064084.0, "step": 21935 }, { "entropy": 5.42212495803833, "epoch": 1.7070219801595021, "grad_norm": 1.5078125, "learning_rate": 0.00047072105786439563, "loss": 5.1768, "mean_token_accuracy": 0.18434233367443084, "num_tokens": 38073838.0, "step": 21940 }, { "entropy": 5.566514158248902, "epoch": 1.7074110095312196, "grad_norm": 1.5234375, "learning_rate": 0.00047070738487257137, "loss": 5.283, "mean_token_accuracy": 0.17126548290252686, "num_tokens": 38082531.0, "step": 21945 }, { "entropy": 5.5509467124938965, "epoch": 1.707800038902937, "grad_norm": 1.3671875, "learning_rate": 0.00047069370891119895, "loss": 5.276, "mean_token_accuracy": 0.1744527518749237, "num_tokens": 38091499.0, "step": 21950 }, { "entropy": 5.473871040344238, "epoch": 1.7081890682746548, "grad_norm": 1.2890625, "learning_rate": 0.000470680029980486, "loss": 5.1044, "mean_token_accuracy": 0.1944224163889885, "num_tokens": 38099488.0, "step": 21955 }, { "entropy": 5.53945574760437, "epoch": 1.7085780976463723, "grad_norm": 1.2890625, "learning_rate": 0.00047066634808064006, "loss": 5.2293, "mean_token_accuracy": 0.18228229135274887, "num_tokens": 38107535.0, "step": 21960 }, { "entropy": 5.525403070449829, "epoch": 1.7089671270180897, "grad_norm": 1.6875, "learning_rate": 0.00047065266321186873, "loss": 5.1981, "mean_token_accuracy": 0.17936547249555587, "num_tokens": 38116457.0, "step": 21965 }, { "entropy": 5.5263231754302975, "epoch": 1.7093561563898074, "grad_norm": 1.2578125, "learning_rate": 0.0004706389753743797, "loss": 5.1201, "mean_token_accuracy": 0.18372064232826232, "num_tokens": 38124571.0, "step": 21970 }, { "entropy": 5.4254436016082765, "epoch": 1.7097451857615251, "grad_norm": 1.2734375, "learning_rate": 0.0004706252845683805, "loss": 5.1668, "mean_token_accuracy": 0.17873062938451767, "num_tokens": 38132789.0, "step": 21975 }, { "entropy": 5.346435642242431, "epoch": 1.7101342151332426, "grad_norm": 1.2578125, "learning_rate": 0.00047061159079407903, "loss": 5.0742, "mean_token_accuracy": 0.18696712106466293, "num_tokens": 38141413.0, "step": 21980 }, { "entropy": 5.444990396499634, "epoch": 1.71052324450496, "grad_norm": 1.3046875, "learning_rate": 0.000470597894051683, "loss": 5.0933, "mean_token_accuracy": 0.18352185934782028, "num_tokens": 38149869.0, "step": 21985 }, { "entropy": 5.424140930175781, "epoch": 1.7109122738766778, "grad_norm": 1.4375, "learning_rate": 0.0004705841943414003, "loss": 5.0313, "mean_token_accuracy": 0.19739166647195816, "num_tokens": 38157356.0, "step": 21990 }, { "entropy": 5.463647413253784, "epoch": 1.7113013032483952, "grad_norm": 1.4296875, "learning_rate": 0.00047057049166343876, "loss": 5.2161, "mean_token_accuracy": 0.1833688959479332, "num_tokens": 38166125.0, "step": 21995 }, { "entropy": 5.442975950241089, "epoch": 1.7116903326201127, "grad_norm": 1.3515625, "learning_rate": 0.00047055678601800623, "loss": 5.1479, "mean_token_accuracy": 0.1867290273308754, "num_tokens": 38174171.0, "step": 22000 }, { "entropy": 5.558338594436646, "epoch": 1.7120793619918304, "grad_norm": 1.375, "learning_rate": 0.00047054307740531076, "loss": 5.2564, "mean_token_accuracy": 0.1801733061671257, "num_tokens": 38182755.0, "step": 22005 }, { "entropy": 5.509387636184693, "epoch": 1.712468391363548, "grad_norm": 1.3359375, "learning_rate": 0.00047052936582556035, "loss": 5.191, "mean_token_accuracy": 0.18543592542409898, "num_tokens": 38191289.0, "step": 22010 }, { "entropy": 5.545600175857544, "epoch": 1.7128574207352654, "grad_norm": 1.625, "learning_rate": 0.00047051565127896307, "loss": 5.3311, "mean_token_accuracy": 0.17620862424373626, "num_tokens": 38200624.0, "step": 22015 }, { "entropy": 5.543854522705078, "epoch": 1.713246450106983, "grad_norm": 1.3671875, "learning_rate": 0.00047050193376572686, "loss": 5.1212, "mean_token_accuracy": 0.1847473829984665, "num_tokens": 38209272.0, "step": 22020 }, { "entropy": 5.560673522949219, "epoch": 1.7136354794787008, "grad_norm": 1.5, "learning_rate": 0.00047048821328606, "loss": 5.3079, "mean_token_accuracy": 0.17380361557006835, "num_tokens": 38218851.0, "step": 22025 }, { "entropy": 5.499703502655029, "epoch": 1.7140245088504182, "grad_norm": 1.3359375, "learning_rate": 0.0004704744898401708, "loss": 5.1976, "mean_token_accuracy": 0.18027321845293046, "num_tokens": 38227367.0, "step": 22030 }, { "entropy": 5.4966553211212155, "epoch": 1.7144135382221357, "grad_norm": 1.5546875, "learning_rate": 0.0004704607634282672, "loss": 5.1966, "mean_token_accuracy": 0.18162908107042314, "num_tokens": 38235721.0, "step": 22035 }, { "entropy": 5.536008262634278, "epoch": 1.7148025675938534, "grad_norm": 1.28125, "learning_rate": 0.00047044703405055765, "loss": 5.2701, "mean_token_accuracy": 0.17266861498355865, "num_tokens": 38244686.0, "step": 22040 }, { "entropy": 5.525236415863037, "epoch": 1.7151915969655709, "grad_norm": 1.7578125, "learning_rate": 0.00047043330170725046, "loss": 5.2671, "mean_token_accuracy": 0.17743858098983764, "num_tokens": 38253609.0, "step": 22045 }, { "entropy": 5.480854845046997, "epoch": 1.7155806263372884, "grad_norm": 1.2734375, "learning_rate": 0.00047041956639855406, "loss": 5.1883, "mean_token_accuracy": 0.17956473380327226, "num_tokens": 38261746.0, "step": 22050 }, { "entropy": 5.504291582107544, "epoch": 1.715969655709006, "grad_norm": 1.609375, "learning_rate": 0.0004704058281246766, "loss": 5.1998, "mean_token_accuracy": 0.18395068347454072, "num_tokens": 38270573.0, "step": 22055 }, { "entropy": 5.509825658798218, "epoch": 1.7163586850807238, "grad_norm": 1.3828125, "learning_rate": 0.0004703920868858268, "loss": 5.209, "mean_token_accuracy": 0.18277066498994826, "num_tokens": 38279031.0, "step": 22060 }, { "entropy": 5.498215675354004, "epoch": 1.716747714452441, "grad_norm": 1.328125, "learning_rate": 0.00047037834268221315, "loss": 5.2314, "mean_token_accuracy": 0.17874146848917008, "num_tokens": 38287060.0, "step": 22065 }, { "entropy": 5.5415667533874515, "epoch": 1.7171367438241587, "grad_norm": 1.3828125, "learning_rate": 0.0004703645955140441, "loss": 5.2182, "mean_token_accuracy": 0.1846153825521469, "num_tokens": 38295192.0, "step": 22070 }, { "entropy": 5.474501466751098, "epoch": 1.7175257731958764, "grad_norm": 1.4765625, "learning_rate": 0.00047035084538152815, "loss": 5.1256, "mean_token_accuracy": 0.18454911559820175, "num_tokens": 38303932.0, "step": 22075 }, { "entropy": 5.502408647537232, "epoch": 1.7179148025675939, "grad_norm": 1.3046875, "learning_rate": 0.0004703370922848742, "loss": 5.2879, "mean_token_accuracy": 0.17059511840343475, "num_tokens": 38312906.0, "step": 22080 }, { "entropy": 5.51400785446167, "epoch": 1.7183038319393114, "grad_norm": 1.484375, "learning_rate": 0.00047032333622429074, "loss": 5.2646, "mean_token_accuracy": 0.17891405075788497, "num_tokens": 38322359.0, "step": 22085 }, { "entropy": 5.609464263916015, "epoch": 1.718692861311029, "grad_norm": 1.3984375, "learning_rate": 0.00047030957719998656, "loss": 5.2912, "mean_token_accuracy": 0.17101875692605972, "num_tokens": 38331880.0, "step": 22090 }, { "entropy": 5.5549389839172365, "epoch": 1.7190818906827465, "grad_norm": 1.4375, "learning_rate": 0.0004702958152121704, "loss": 5.3634, "mean_token_accuracy": 0.1668516829609871, "num_tokens": 38340763.0, "step": 22095 }, { "entropy": 5.556585216522217, "epoch": 1.719470920054464, "grad_norm": 1.34375, "learning_rate": 0.0004702820502610511, "loss": 5.1855, "mean_token_accuracy": 0.17876700460910797, "num_tokens": 38349427.0, "step": 22100 }, { "entropy": 5.499334669113159, "epoch": 1.7198599494261817, "grad_norm": 1.5390625, "learning_rate": 0.0004702682823468375, "loss": 5.1542, "mean_token_accuracy": 0.18651724606752396, "num_tokens": 38358025.0, "step": 22105 }, { "entropy": 5.530140399932861, "epoch": 1.7202489787978994, "grad_norm": 1.375, "learning_rate": 0.00047025451146973844, "loss": 5.1656, "mean_token_accuracy": 0.17682957351207734, "num_tokens": 38366923.0, "step": 22110 }, { "entropy": 5.516496276855468, "epoch": 1.7206380081696167, "grad_norm": 1.328125, "learning_rate": 0.00047024073762996305, "loss": 5.2308, "mean_token_accuracy": 0.18244261890649796, "num_tokens": 38375397.0, "step": 22115 }, { "entropy": 5.4580292224884035, "epoch": 1.7210270375413343, "grad_norm": 1.3515625, "learning_rate": 0.0004702269608277202, "loss": 5.1358, "mean_token_accuracy": 0.18412314355373383, "num_tokens": 38384279.0, "step": 22120 }, { "entropy": 5.5016316890716555, "epoch": 1.721416066913052, "grad_norm": 1.2890625, "learning_rate": 0.0004702131810632189, "loss": 5.1912, "mean_token_accuracy": 0.18388418555259706, "num_tokens": 38392087.0, "step": 22125 }, { "entropy": 5.500098419189453, "epoch": 1.7218050962847695, "grad_norm": 1.3046875, "learning_rate": 0.00047019939833666837, "loss": 5.2948, "mean_token_accuracy": 0.17404642701148987, "num_tokens": 38400616.0, "step": 22130 }, { "entropy": 5.513371467590332, "epoch": 1.722194125656487, "grad_norm": 1.375, "learning_rate": 0.0004701856126482776, "loss": 5.184, "mean_token_accuracy": 0.1760253816843033, "num_tokens": 38408975.0, "step": 22135 }, { "entropy": 5.535154390335083, "epoch": 1.7225831550282047, "grad_norm": 1.3828125, "learning_rate": 0.0004701718239982559, "loss": 5.304, "mean_token_accuracy": 0.1801455423235893, "num_tokens": 38417161.0, "step": 22140 }, { "entropy": 5.525936412811279, "epoch": 1.7229721843999222, "grad_norm": 1.5625, "learning_rate": 0.00047015803238681234, "loss": 5.2696, "mean_token_accuracy": 0.179266294836998, "num_tokens": 38425078.0, "step": 22145 }, { "entropy": 5.494637393951416, "epoch": 1.7233612137716396, "grad_norm": 1.3046875, "learning_rate": 0.0004701442378141563, "loss": 5.1512, "mean_token_accuracy": 0.1798102930188179, "num_tokens": 38433347.0, "step": 22150 }, { "entropy": 5.558014678955078, "epoch": 1.7237502431433573, "grad_norm": 1.234375, "learning_rate": 0.000470130440280497, "loss": 5.2635, "mean_token_accuracy": 0.17664334326982498, "num_tokens": 38442373.0, "step": 22155 }, { "entropy": 5.548906898498535, "epoch": 1.724139272515075, "grad_norm": 1.234375, "learning_rate": 0.0004701166397860439, "loss": 5.3186, "mean_token_accuracy": 0.16979156732559203, "num_tokens": 38452325.0, "step": 22160 }, { "entropy": 5.578975248336792, "epoch": 1.7245283018867923, "grad_norm": 1.4765625, "learning_rate": 0.0004701028363310064, "loss": 5.3118, "mean_token_accuracy": 0.17591005116701125, "num_tokens": 38462317.0, "step": 22165 }, { "entropy": 5.5366353511810305, "epoch": 1.72491733125851, "grad_norm": 1.34375, "learning_rate": 0.00047008902991559385, "loss": 5.1478, "mean_token_accuracy": 0.18252284079790115, "num_tokens": 38471149.0, "step": 22170 }, { "entropy": 5.564240980148315, "epoch": 1.7253063606302277, "grad_norm": 1.5546875, "learning_rate": 0.0004700752205400158, "loss": 5.2652, "mean_token_accuracy": 0.17625696063041688, "num_tokens": 38480427.0, "step": 22175 }, { "entropy": 5.452456521987915, "epoch": 1.7256953900019452, "grad_norm": 1.3203125, "learning_rate": 0.00047006140820448174, "loss": 5.1653, "mean_token_accuracy": 0.18430205136537553, "num_tokens": 38489283.0, "step": 22180 }, { "entropy": 5.53076663017273, "epoch": 1.7260844193736626, "grad_norm": 1.421875, "learning_rate": 0.00047004759290920136, "loss": 5.2096, "mean_token_accuracy": 0.1815559223294258, "num_tokens": 38497557.0, "step": 22185 }, { "entropy": 5.482972574234009, "epoch": 1.7264734487453803, "grad_norm": 2.15625, "learning_rate": 0.0004700337746543841, "loss": 5.2468, "mean_token_accuracy": 0.18089222013950348, "num_tokens": 38506589.0, "step": 22190 }, { "entropy": 5.491979026794434, "epoch": 1.7268624781170978, "grad_norm": 1.4921875, "learning_rate": 0.0004700199534402398, "loss": 5.2318, "mean_token_accuracy": 0.18370293825864792, "num_tokens": 38515016.0, "step": 22195 }, { "entropy": 5.597206020355225, "epoch": 1.7272515074888153, "grad_norm": 1.390625, "learning_rate": 0.0004700061292669781, "loss": 5.2663, "mean_token_accuracy": 0.1809206947684288, "num_tokens": 38523792.0, "step": 22200 }, { "entropy": 5.434280061721802, "epoch": 1.727640536860533, "grad_norm": 1.4375, "learning_rate": 0.0004699923021348088, "loss": 5.0711, "mean_token_accuracy": 0.18863318711519242, "num_tokens": 38532007.0, "step": 22205 }, { "entropy": 5.447651624679565, "epoch": 1.7280295662322507, "grad_norm": 1.3515625, "learning_rate": 0.00046997847204394166, "loss": 5.2029, "mean_token_accuracy": 0.17935859113931657, "num_tokens": 38541044.0, "step": 22210 }, { "entropy": 5.547362852096557, "epoch": 1.728418595603968, "grad_norm": 1.46875, "learning_rate": 0.00046996463899458653, "loss": 5.137, "mean_token_accuracy": 0.19051269590854644, "num_tokens": 38549365.0, "step": 22215 }, { "entropy": 5.478987360000611, "epoch": 1.7288076249756856, "grad_norm": 1.2421875, "learning_rate": 0.0004699508029869533, "loss": 5.1462, "mean_token_accuracy": 0.19089205861091613, "num_tokens": 38558289.0, "step": 22220 }, { "entropy": 5.458957481384277, "epoch": 1.7291966543474033, "grad_norm": 1.5234375, "learning_rate": 0.00046993696402125205, "loss": 5.2771, "mean_token_accuracy": 0.17165924608707428, "num_tokens": 38568422.0, "step": 22225 }, { "entropy": 5.53229169845581, "epoch": 1.7295856837191208, "grad_norm": 1.484375, "learning_rate": 0.0004699231220976925, "loss": 5.2043, "mean_token_accuracy": 0.18020358085632324, "num_tokens": 38577009.0, "step": 22230 }, { "entropy": 5.477518129348755, "epoch": 1.7299747130908383, "grad_norm": 1.34375, "learning_rate": 0.0004699092772164849, "loss": 5.0347, "mean_token_accuracy": 0.19384513199329376, "num_tokens": 38584920.0, "step": 22235 }, { "entropy": 5.3449609756469725, "epoch": 1.730363742462556, "grad_norm": 1.6015625, "learning_rate": 0.0004698954293778392, "loss": 5.1218, "mean_token_accuracy": 0.19012910425662993, "num_tokens": 38593533.0, "step": 22240 }, { "entropy": 5.405400085449219, "epoch": 1.7307527718342735, "grad_norm": 1.4296875, "learning_rate": 0.00046988157858196555, "loss": 5.1222, "mean_token_accuracy": 0.18851638436317444, "num_tokens": 38602300.0, "step": 22245 }, { "entropy": 5.507129287719726, "epoch": 1.731141801205991, "grad_norm": 1.2578125, "learning_rate": 0.00046986772482907426, "loss": 5.2196, "mean_token_accuracy": 0.18343135416507722, "num_tokens": 38610729.0, "step": 22250 }, { "entropy": 5.5146712303161625, "epoch": 1.7315308305777086, "grad_norm": 3.84375, "learning_rate": 0.0004698538681193754, "loss": 5.0851, "mean_token_accuracy": 0.18869762420654296, "num_tokens": 38618192.0, "step": 22255 }, { "entropy": 5.419455528259277, "epoch": 1.7319198599494263, "grad_norm": 1.2578125, "learning_rate": 0.00046984000845307907, "loss": 5.1844, "mean_token_accuracy": 0.18631936907768248, "num_tokens": 38627030.0, "step": 22260 }, { "entropy": 5.482566833496094, "epoch": 1.7323088893211438, "grad_norm": 1.40625, "learning_rate": 0.00046982614583039584, "loss": 5.2838, "mean_token_accuracy": 0.17830957919359208, "num_tokens": 38635761.0, "step": 22265 }, { "entropy": 5.4713677883148195, "epoch": 1.7326979186928613, "grad_norm": 1.484375, "learning_rate": 0.0004698122802515359, "loss": 5.1944, "mean_token_accuracy": 0.1820732206106186, "num_tokens": 38643952.0, "step": 22270 }, { "entropy": 5.499280500411987, "epoch": 1.733086948064579, "grad_norm": 3.671875, "learning_rate": 0.0004697984117167097, "loss": 5.1417, "mean_token_accuracy": 0.1906971201300621, "num_tokens": 38651888.0, "step": 22275 }, { "entropy": 5.505435848236084, "epoch": 1.7334759774362964, "grad_norm": 1.3046875, "learning_rate": 0.00046978454022612767, "loss": 5.2712, "mean_token_accuracy": 0.1786338835954666, "num_tokens": 38660466.0, "step": 22280 }, { "entropy": 5.571185445785522, "epoch": 1.733865006808014, "grad_norm": 1.4296875, "learning_rate": 0.00046977066578000025, "loss": 5.2213, "mean_token_accuracy": 0.18112041056156158, "num_tokens": 38668429.0, "step": 22285 }, { "entropy": 5.504121255874634, "epoch": 1.7342540361797316, "grad_norm": 2.578125, "learning_rate": 0.00046975678837853806, "loss": 5.2393, "mean_token_accuracy": 0.18523801118135452, "num_tokens": 38676391.0, "step": 22290 }, { "entropy": 5.515945100784302, "epoch": 1.734643065551449, "grad_norm": 1.3125, "learning_rate": 0.00046974290802195156, "loss": 5.2463, "mean_token_accuracy": 0.184119313955307, "num_tokens": 38684662.0, "step": 22295 }, { "entropy": 5.484704446792603, "epoch": 1.7350320949231666, "grad_norm": 1.4140625, "learning_rate": 0.0004697290247104513, "loss": 5.1657, "mean_token_accuracy": 0.18281205892562866, "num_tokens": 38693497.0, "step": 22300 }, { "entropy": 5.408651876449585, "epoch": 1.7354211242948843, "grad_norm": 1.984375, "learning_rate": 0.00046971513844424814, "loss": 5.0972, "mean_token_accuracy": 0.18519675880670547, "num_tokens": 38701898.0, "step": 22305 }, { "entropy": 5.551790380477906, "epoch": 1.735810153666602, "grad_norm": 1.40625, "learning_rate": 0.00046970124922355265, "loss": 5.2179, "mean_token_accuracy": 0.17562125772237777, "num_tokens": 38710910.0, "step": 22310 }, { "entropy": 5.5886858940124515, "epoch": 1.7361991830383194, "grad_norm": 1.5625, "learning_rate": 0.0004696873570485756, "loss": 5.2399, "mean_token_accuracy": 0.1784719482064247, "num_tokens": 38719612.0, "step": 22315 }, { "entropy": 5.356118202209473, "epoch": 1.736588212410037, "grad_norm": 1.765625, "learning_rate": 0.0004696734619195278, "loss": 5.2285, "mean_token_accuracy": 0.17571593225002288, "num_tokens": 38728332.0, "step": 22320 }, { "entropy": 5.470266437530517, "epoch": 1.7369772417817546, "grad_norm": 1.25, "learning_rate": 0.00046965956383662, "loss": 5.229, "mean_token_accuracy": 0.17644769251346587, "num_tokens": 38736830.0, "step": 22325 }, { "entropy": 5.559103775024414, "epoch": 1.737366271153472, "grad_norm": 1.40625, "learning_rate": 0.0004696456628000632, "loss": 5.1997, "mean_token_accuracy": 0.18392471969127655, "num_tokens": 38745972.0, "step": 22330 }, { "entropy": 5.447118139266967, "epoch": 1.7377553005251896, "grad_norm": 1.3046875, "learning_rate": 0.00046963175881006825, "loss": 5.0933, "mean_token_accuracy": 0.1814733162522316, "num_tokens": 38754287.0, "step": 22335 }, { "entropy": 5.391161632537842, "epoch": 1.7381443298969073, "grad_norm": 1.3984375, "learning_rate": 0.0004696178518668462, "loss": 5.1891, "mean_token_accuracy": 0.18238743394613266, "num_tokens": 38763212.0, "step": 22340 }, { "entropy": 5.408348035812378, "epoch": 1.7385333592686247, "grad_norm": 1.3046875, "learning_rate": 0.00046960394197060804, "loss": 5.0209, "mean_token_accuracy": 0.1893278107047081, "num_tokens": 38771668.0, "step": 22345 }, { "entropy": 5.5382458686828615, "epoch": 1.7389223886403422, "grad_norm": 1.328125, "learning_rate": 0.00046959002912156473, "loss": 5.2641, "mean_token_accuracy": 0.1779286101460457, "num_tokens": 38781184.0, "step": 22350 }, { "entropy": 5.463222551345825, "epoch": 1.73931141801206, "grad_norm": 1.4765625, "learning_rate": 0.0004695761133199275, "loss": 5.0973, "mean_token_accuracy": 0.19137011766433715, "num_tokens": 38789622.0, "step": 22355 }, { "entropy": 5.506410932540893, "epoch": 1.7397004473837776, "grad_norm": 1.2890625, "learning_rate": 0.0004695621945659074, "loss": 5.1774, "mean_token_accuracy": 0.18483394682407378, "num_tokens": 38798250.0, "step": 22360 }, { "entropy": 5.504396533966064, "epoch": 1.740089476755495, "grad_norm": 1.3515625, "learning_rate": 0.0004695482728597157, "loss": 5.199, "mean_token_accuracy": 0.18315800428390502, "num_tokens": 38807724.0, "step": 22365 }, { "entropy": 5.503889656066894, "epoch": 1.7404785061272126, "grad_norm": 1.328125, "learning_rate": 0.00046953434820156363, "loss": 5.237, "mean_token_accuracy": 0.18558563888072968, "num_tokens": 38816017.0, "step": 22370 }, { "entropy": 5.538943910598755, "epoch": 1.7408675354989303, "grad_norm": 1.3359375, "learning_rate": 0.0004695204205916624, "loss": 5.1541, "mean_token_accuracy": 0.19018099904060365, "num_tokens": 38824976.0, "step": 22375 }, { "entropy": 5.439003801345825, "epoch": 1.7412565648706477, "grad_norm": 1.8046875, "learning_rate": 0.0004695064900302235, "loss": 5.1473, "mean_token_accuracy": 0.18844833970069885, "num_tokens": 38834358.0, "step": 22380 }, { "entropy": 5.478014039993286, "epoch": 1.7416455942423652, "grad_norm": 1.375, "learning_rate": 0.0004694925565174581, "loss": 5.2348, "mean_token_accuracy": 0.1731978103518486, "num_tokens": 38842801.0, "step": 22385 }, { "entropy": 5.52531156539917, "epoch": 1.742034623614083, "grad_norm": 1.25, "learning_rate": 0.00046947862005357777, "loss": 5.2576, "mean_token_accuracy": 0.17530435025691987, "num_tokens": 38851335.0, "step": 22390 }, { "entropy": 5.575278425216675, "epoch": 1.7424236529858004, "grad_norm": 1.3046875, "learning_rate": 0.0004694646806387939, "loss": 5.2511, "mean_token_accuracy": 0.17375997006893157, "num_tokens": 38860074.0, "step": 22395 }, { "entropy": 5.494519662857056, "epoch": 1.7428126823575179, "grad_norm": 1.609375, "learning_rate": 0.0004694507382733181, "loss": 5.1679, "mean_token_accuracy": 0.18731395602226258, "num_tokens": 38868319.0, "step": 22400 }, { "entropy": 5.441346216201782, "epoch": 1.7432017117292355, "grad_norm": 1.4375, "learning_rate": 0.0004694367929573618, "loss": 5.2222, "mean_token_accuracy": 0.18582238852977753, "num_tokens": 38876971.0, "step": 22405 }, { "entropy": 5.547492027282715, "epoch": 1.7435907411009532, "grad_norm": 1.3984375, "learning_rate": 0.0004694228446911367, "loss": 5.3315, "mean_token_accuracy": 0.16878755688667296, "num_tokens": 38886032.0, "step": 22410 }, { "entropy": 5.583523797988891, "epoch": 1.7439797704726707, "grad_norm": 1.4609375, "learning_rate": 0.0004694088934748542, "loss": 5.197, "mean_token_accuracy": 0.18434173315763475, "num_tokens": 38894505.0, "step": 22415 }, { "entropy": 5.393583488464356, "epoch": 1.7443687998443882, "grad_norm": 1.3515625, "learning_rate": 0.0004693949393087263, "loss": 5.0982, "mean_token_accuracy": 0.18977867513895036, "num_tokens": 38903450.0, "step": 22420 }, { "entropy": 5.474939775466919, "epoch": 1.744757829216106, "grad_norm": 1.5, "learning_rate": 0.0004693809821929647, "loss": 5.1824, "mean_token_accuracy": 0.18529875129461287, "num_tokens": 38911326.0, "step": 22425 }, { "entropy": 5.499625587463379, "epoch": 1.7451468585878234, "grad_norm": 1.484375, "learning_rate": 0.000469367022127781, "loss": 5.1559, "mean_token_accuracy": 0.18469337821006776, "num_tokens": 38920035.0, "step": 22430 }, { "entropy": 5.5433837890625, "epoch": 1.7455358879595408, "grad_norm": 1.40625, "learning_rate": 0.00046935305911338703, "loss": 5.2099, "mean_token_accuracy": 0.1855094775557518, "num_tokens": 38928542.0, "step": 22435 }, { "entropy": 5.521333980560303, "epoch": 1.7459249173312585, "grad_norm": 1.375, "learning_rate": 0.0004693390931499948, "loss": 5.1954, "mean_token_accuracy": 0.18716973960399627, "num_tokens": 38937486.0, "step": 22440 }, { "entropy": 5.436490297317505, "epoch": 1.7463139467029762, "grad_norm": 1.6953125, "learning_rate": 0.0004693251242378162, "loss": 5.1272, "mean_token_accuracy": 0.1873105689883232, "num_tokens": 38946171.0, "step": 22445 }, { "entropy": 5.436745452880859, "epoch": 1.7467029760746935, "grad_norm": 1.453125, "learning_rate": 0.00046931115237706304, "loss": 5.1178, "mean_token_accuracy": 0.18590092658996582, "num_tokens": 38954214.0, "step": 22450 }, { "entropy": 5.598425674438476, "epoch": 1.7470920054464112, "grad_norm": 1.359375, "learning_rate": 0.0004692971775679475, "loss": 5.2671, "mean_token_accuracy": 0.1758560135960579, "num_tokens": 38962102.0, "step": 22455 }, { "entropy": 5.5146181106567385, "epoch": 1.7474810348181289, "grad_norm": 1.8828125, "learning_rate": 0.00046928319981068154, "loss": 5.1608, "mean_token_accuracy": 0.18913196325302123, "num_tokens": 38970472.0, "step": 22460 }, { "entropy": 5.461085557937622, "epoch": 1.7478700641898464, "grad_norm": 1.3359375, "learning_rate": 0.0004692692191054773, "loss": 5.1618, "mean_token_accuracy": 0.18234552890062333, "num_tokens": 38979151.0, "step": 22465 }, { "entropy": 5.5228314876556395, "epoch": 1.7482590935615638, "grad_norm": 1.359375, "learning_rate": 0.0004692552354525468, "loss": 5.1692, "mean_token_accuracy": 0.1873565971851349, "num_tokens": 38987044.0, "step": 22470 }, { "entropy": 5.495915079116822, "epoch": 1.7486481229332815, "grad_norm": 1.2734375, "learning_rate": 0.0004692412488521023, "loss": 5.2679, "mean_token_accuracy": 0.1838843435049057, "num_tokens": 38995882.0, "step": 22475 }, { "entropy": 5.477252435684204, "epoch": 1.749037152304999, "grad_norm": 1.796875, "learning_rate": 0.000469227259304356, "loss": 5.2418, "mean_token_accuracy": 0.17672751396894454, "num_tokens": 39004456.0, "step": 22480 }, { "entropy": 5.532679891586303, "epoch": 1.7494261816767165, "grad_norm": 1.53125, "learning_rate": 0.00046921326680952023, "loss": 5.2262, "mean_token_accuracy": 0.18299031853675843, "num_tokens": 39013363.0, "step": 22485 }, { "entropy": 5.520345544815063, "epoch": 1.7498152110484342, "grad_norm": 1.4375, "learning_rate": 0.0004691992713678072, "loss": 5.1744, "mean_token_accuracy": 0.18481789976358415, "num_tokens": 39022116.0, "step": 22490 }, { "entropy": 5.517253398895264, "epoch": 1.7502042404201519, "grad_norm": 1.375, "learning_rate": 0.0004691852729794293, "loss": 5.2093, "mean_token_accuracy": 0.18476366698741914, "num_tokens": 39030737.0, "step": 22495 }, { "entropy": 5.454028797149658, "epoch": 1.7505932697918691, "grad_norm": 1.390625, "learning_rate": 0.0004691712716445991, "loss": 5.1222, "mean_token_accuracy": 0.18870659172534943, "num_tokens": 39039511.0, "step": 22500 }, { "entropy": 5.481350231170654, "epoch": 1.7509822991635868, "grad_norm": 1.546875, "learning_rate": 0.0004691572673635288, "loss": 5.1309, "mean_token_accuracy": 0.18534973114728928, "num_tokens": 39048745.0, "step": 22505 }, { "entropy": 5.49375638961792, "epoch": 1.7513713285353045, "grad_norm": 1.484375, "learning_rate": 0.000469143260136431, "loss": 5.2153, "mean_token_accuracy": 0.1792880430817604, "num_tokens": 39057311.0, "step": 22510 }, { "entropy": 5.527177715301514, "epoch": 1.751760357907022, "grad_norm": 1.5625, "learning_rate": 0.0004691292499635183, "loss": 5.2139, "mean_token_accuracy": 0.18225941956043243, "num_tokens": 39065630.0, "step": 22515 }, { "entropy": 5.495059776306152, "epoch": 1.7521493872787395, "grad_norm": 1.4296875, "learning_rate": 0.0004691152368450032, "loss": 5.177, "mean_token_accuracy": 0.1807619497179985, "num_tokens": 39074284.0, "step": 22520 }, { "entropy": 5.492371320724487, "epoch": 1.7525384166504572, "grad_norm": 1.3359375, "learning_rate": 0.00046910122078109835, "loss": 5.2081, "mean_token_accuracy": 0.18475724905729293, "num_tokens": 39083284.0, "step": 22525 }, { "entropy": 5.487291622161865, "epoch": 1.7529274460221747, "grad_norm": 1.3828125, "learning_rate": 0.0004690872017720163, "loss": 5.1628, "mean_token_accuracy": 0.18781275004148484, "num_tokens": 39091106.0, "step": 22530 }, { "entropy": 5.407898187637329, "epoch": 1.7533164753938921, "grad_norm": 1.3046875, "learning_rate": 0.00046907317981797006, "loss": 5.1078, "mean_token_accuracy": 0.19382071644067764, "num_tokens": 39100499.0, "step": 22535 }, { "entropy": 5.4645740509033205, "epoch": 1.7537055047656098, "grad_norm": 1.5859375, "learning_rate": 0.00046905915491917213, "loss": 5.2208, "mean_token_accuracy": 0.190023709833622, "num_tokens": 39108895.0, "step": 22540 }, { "entropy": 5.429339456558227, "epoch": 1.7540945341373275, "grad_norm": 1.390625, "learning_rate": 0.0004690451270758354, "loss": 5.0473, "mean_token_accuracy": 0.19826958626508712, "num_tokens": 39117053.0, "step": 22545 }, { "entropy": 5.490063762664795, "epoch": 1.7544835635090448, "grad_norm": 1.3828125, "learning_rate": 0.00046903109628817276, "loss": 5.1995, "mean_token_accuracy": 0.18657177239656447, "num_tokens": 39125750.0, "step": 22550 }, { "entropy": 5.435941076278686, "epoch": 1.7548725928807625, "grad_norm": 1.28125, "learning_rate": 0.00046901706255639703, "loss": 5.0856, "mean_token_accuracy": 0.18898576200008393, "num_tokens": 39134105.0, "step": 22555 }, { "entropy": 5.6019457340240475, "epoch": 1.7552616222524802, "grad_norm": 1.4765625, "learning_rate": 0.0004690030258807212, "loss": 5.3492, "mean_token_accuracy": 0.17937949150800706, "num_tokens": 39143543.0, "step": 22560 }, { "entropy": 5.595874404907226, "epoch": 1.7556506516241976, "grad_norm": 3.203125, "learning_rate": 0.00046898898626135827, "loss": 5.2413, "mean_token_accuracy": 0.18138222843408586, "num_tokens": 39152826.0, "step": 22565 }, { "entropy": 5.5266258239746096, "epoch": 1.7560396809959151, "grad_norm": 1.390625, "learning_rate": 0.0004689749436985211, "loss": 5.1481, "mean_token_accuracy": 0.18144762068986892, "num_tokens": 39160999.0, "step": 22570 }, { "entropy": 5.496015787124634, "epoch": 1.7564287103676328, "grad_norm": 1.453125, "learning_rate": 0.00046896089819242304, "loss": 5.1942, "mean_token_accuracy": 0.18176806569099427, "num_tokens": 39169134.0, "step": 22575 }, { "entropy": 5.460223579406739, "epoch": 1.7568177397393503, "grad_norm": 1.390625, "learning_rate": 0.0004689468497432771, "loss": 5.1316, "mean_token_accuracy": 0.18542095720767976, "num_tokens": 39177545.0, "step": 22580 }, { "entropy": 5.441378879547119, "epoch": 1.7572067691110678, "grad_norm": 1.3984375, "learning_rate": 0.0004689327983512963, "loss": 5.0744, "mean_token_accuracy": 0.18980902731418609, "num_tokens": 39185671.0, "step": 22585 }, { "entropy": 5.54808406829834, "epoch": 1.7575957984827855, "grad_norm": 1.59375, "learning_rate": 0.00046891874401669404, "loss": 5.2269, "mean_token_accuracy": 0.17572949230670928, "num_tokens": 39194420.0, "step": 22590 }, { "entropy": 5.470951938629151, "epoch": 1.7579848278545032, "grad_norm": 1.375, "learning_rate": 0.0004689046867396834, "loss": 5.1883, "mean_token_accuracy": 0.1830612137913704, "num_tokens": 39203295.0, "step": 22595 }, { "entropy": 5.464349031448364, "epoch": 1.7583738572262204, "grad_norm": 1.3125, "learning_rate": 0.0004688906265204779, "loss": 5.1586, "mean_token_accuracy": 0.18421381413936616, "num_tokens": 39211838.0, "step": 22600 }, { "entropy": 5.514088821411133, "epoch": 1.7587628865979381, "grad_norm": 1.5625, "learning_rate": 0.0004688765633592907, "loss": 5.1161, "mean_token_accuracy": 0.1813815116882324, "num_tokens": 39219842.0, "step": 22605 }, { "entropy": 5.412389659881592, "epoch": 1.7591519159696558, "grad_norm": 1.3984375, "learning_rate": 0.0004688624972563352, "loss": 5.1958, "mean_token_accuracy": 0.18454648107290267, "num_tokens": 39228167.0, "step": 22610 }, { "entropy": 5.497512006759644, "epoch": 1.7595409453413733, "grad_norm": 1.328125, "learning_rate": 0.0004688484282118249, "loss": 5.2265, "mean_token_accuracy": 0.1761507660150528, "num_tokens": 39236546.0, "step": 22615 }, { "entropy": 5.5328000545501705, "epoch": 1.7599299747130908, "grad_norm": 1.328125, "learning_rate": 0.0004688343562259732, "loss": 5.1581, "mean_token_accuracy": 0.18949703574180604, "num_tokens": 39244212.0, "step": 22620 }, { "entropy": 5.424105262756347, "epoch": 1.7603190040848085, "grad_norm": 1.328125, "learning_rate": 0.0004688202812989937, "loss": 5.1137, "mean_token_accuracy": 0.18745281398296357, "num_tokens": 39252892.0, "step": 22625 }, { "entropy": 5.412605905532837, "epoch": 1.760708033456526, "grad_norm": 1.3203125, "learning_rate": 0.0004688062034311, "loss": 5.1206, "mean_token_accuracy": 0.18772437125444413, "num_tokens": 39262261.0, "step": 22630 }, { "entropy": 5.517810869216919, "epoch": 1.7610970628282434, "grad_norm": 1.5546875, "learning_rate": 0.00046879212262250546, "loss": 5.1548, "mean_token_accuracy": 0.18764956146478654, "num_tokens": 39270790.0, "step": 22635 }, { "entropy": 5.462061357498169, "epoch": 1.761486092199961, "grad_norm": 1.4453125, "learning_rate": 0.00046877803887342406, "loss": 5.1739, "mean_token_accuracy": 0.1800505116581917, "num_tokens": 39278825.0, "step": 22640 }, { "entropy": 5.526913261413574, "epoch": 1.7618751215716788, "grad_norm": 1.3828125, "learning_rate": 0.0004687639521840693, "loss": 5.1968, "mean_token_accuracy": 0.18272940814495087, "num_tokens": 39288343.0, "step": 22645 }, { "entropy": 5.580000877380371, "epoch": 1.7622641509433963, "grad_norm": 1.2421875, "learning_rate": 0.00046874986255465495, "loss": 5.2227, "mean_token_accuracy": 0.17613643109798433, "num_tokens": 39296562.0, "step": 22650 }, { "entropy": 5.541043996810913, "epoch": 1.7626531803151138, "grad_norm": 1.390625, "learning_rate": 0.00046873576998539485, "loss": 5.1769, "mean_token_accuracy": 0.1873554453253746, "num_tokens": 39305433.0, "step": 22655 }, { "entropy": 5.422834300994873, "epoch": 1.7630422096868315, "grad_norm": 1.578125, "learning_rate": 0.0004687216744765028, "loss": 5.2317, "mean_token_accuracy": 0.1813822418451309, "num_tokens": 39313244.0, "step": 22660 }, { "entropy": 5.529487085342407, "epoch": 1.763431239058549, "grad_norm": 1.3125, "learning_rate": 0.0004687075760281927, "loss": 5.269, "mean_token_accuracy": 0.1812152922153473, "num_tokens": 39321933.0, "step": 22665 }, { "entropy": 5.576750469207764, "epoch": 1.7638202684302664, "grad_norm": 1.7578125, "learning_rate": 0.0004686934746406784, "loss": 5.2517, "mean_token_accuracy": 0.18140339553356172, "num_tokens": 39331194.0, "step": 22670 }, { "entropy": 5.5439536571502686, "epoch": 1.764209297801984, "grad_norm": 1.421875, "learning_rate": 0.00046867937031417397, "loss": 5.1582, "mean_token_accuracy": 0.1755712017416954, "num_tokens": 39339762.0, "step": 22675 }, { "entropy": 5.508156824111938, "epoch": 1.7645983271737016, "grad_norm": 1.296875, "learning_rate": 0.0004686652630488933, "loss": 5.2376, "mean_token_accuracy": 0.1777756154537201, "num_tokens": 39349020.0, "step": 22680 }, { "entropy": 5.558917760848999, "epoch": 1.764987356545419, "grad_norm": 1.2421875, "learning_rate": 0.00046865115284505063, "loss": 5.3292, "mean_token_accuracy": 0.1744164377450943, "num_tokens": 39357889.0, "step": 22685 }, { "entropy": 5.5419670104980465, "epoch": 1.7653763859171367, "grad_norm": 1.4140625, "learning_rate": 0.00046863703970285986, "loss": 5.1779, "mean_token_accuracy": 0.18267302364110946, "num_tokens": 39366120.0, "step": 22690 }, { "entropy": 5.510168504714966, "epoch": 1.7657654152888544, "grad_norm": 1.3671875, "learning_rate": 0.0004686229236225352, "loss": 5.0463, "mean_token_accuracy": 0.1917452484369278, "num_tokens": 39374056.0, "step": 22695 }, { "entropy": 5.514323616027832, "epoch": 1.766154444660572, "grad_norm": 1.28125, "learning_rate": 0.0004686088046042909, "loss": 5.243, "mean_token_accuracy": 0.18376550674438477, "num_tokens": 39383170.0, "step": 22700 }, { "entropy": 5.514267206192017, "epoch": 1.7665434740322894, "grad_norm": 1.328125, "learning_rate": 0.00046859468264834114, "loss": 5.2028, "mean_token_accuracy": 0.17862859666347503, "num_tokens": 39391599.0, "step": 22705 }, { "entropy": 5.510101461410523, "epoch": 1.766932503404007, "grad_norm": 1.359375, "learning_rate": 0.00046858055775490017, "loss": 5.2653, "mean_token_accuracy": 0.17287039011716843, "num_tokens": 39400217.0, "step": 22710 }, { "entropy": 5.522445344924927, "epoch": 1.7673215327757246, "grad_norm": 1.328125, "learning_rate": 0.0004685664299241825, "loss": 5.2213, "mean_token_accuracy": 0.1826951175928116, "num_tokens": 39408943.0, "step": 22715 }, { "entropy": 5.5075657844543455, "epoch": 1.767710562147442, "grad_norm": 1.3515625, "learning_rate": 0.0004685522991564022, "loss": 5.1799, "mean_token_accuracy": 0.17735762000083924, "num_tokens": 39417361.0, "step": 22720 }, { "entropy": 5.349432849884034, "epoch": 1.7680995915191597, "grad_norm": 1.234375, "learning_rate": 0.0004685381654517738, "loss": 4.9576, "mean_token_accuracy": 0.19321755021810533, "num_tokens": 39425896.0, "step": 22725 }, { "entropy": 5.423156452178955, "epoch": 1.7684886208908772, "grad_norm": 1.40625, "learning_rate": 0.0004685240288105119, "loss": 5.1905, "mean_token_accuracy": 0.18617706149816513, "num_tokens": 39434719.0, "step": 22730 }, { "entropy": 5.592346811294556, "epoch": 1.7688776502625947, "grad_norm": 2.046875, "learning_rate": 0.00046850988923283085, "loss": 5.1784, "mean_token_accuracy": 0.1781913235783577, "num_tokens": 39443731.0, "step": 22735 }, { "entropy": 5.548964405059815, "epoch": 1.7692666796343124, "grad_norm": 1.46875, "learning_rate": 0.00046849574671894523, "loss": 5.2615, "mean_token_accuracy": 0.1811185136437416, "num_tokens": 39452430.0, "step": 22740 }, { "entropy": 5.468866395950317, "epoch": 1.76965570900603, "grad_norm": 1.3984375, "learning_rate": 0.00046848160126906956, "loss": 5.0788, "mean_token_accuracy": 0.191403166949749, "num_tokens": 39460560.0, "step": 22745 }, { "entropy": 5.48011884689331, "epoch": 1.7700447383777476, "grad_norm": 1.53125, "learning_rate": 0.0004684674528834186, "loss": 5.2173, "mean_token_accuracy": 0.17509957253932953, "num_tokens": 39469575.0, "step": 22750 }, { "entropy": 5.486629152297974, "epoch": 1.770433767749465, "grad_norm": 1.4140625, "learning_rate": 0.00046845330156220703, "loss": 5.1754, "mean_token_accuracy": 0.18481565713882447, "num_tokens": 39478297.0, "step": 22755 }, { "entropy": 5.554228639602661, "epoch": 1.7708227971211827, "grad_norm": 1.609375, "learning_rate": 0.0004684391473056495, "loss": 5.1999, "mean_token_accuracy": 0.17505336850881575, "num_tokens": 39486947.0, "step": 22760 }, { "entropy": 5.554534959793091, "epoch": 1.7712118264929002, "grad_norm": 1.4609375, "learning_rate": 0.00046842499011396076, "loss": 5.193, "mean_token_accuracy": 0.18447613716125488, "num_tokens": 39495649.0, "step": 22765 }, { "entropy": 5.419743442535401, "epoch": 1.7716008558646177, "grad_norm": 1.3984375, "learning_rate": 0.00046841082998735575, "loss": 5.1744, "mean_token_accuracy": 0.18257228285074234, "num_tokens": 39504733.0, "step": 22770 }, { "entropy": 5.422462463378906, "epoch": 1.7719898852363354, "grad_norm": 1.6640625, "learning_rate": 0.00046839666692604916, "loss": 5.1816, "mean_token_accuracy": 0.1864844396710396, "num_tokens": 39513007.0, "step": 22775 }, { "entropy": 5.541841173171997, "epoch": 1.7723789146080529, "grad_norm": 1.359375, "learning_rate": 0.000468382500930256, "loss": 5.2592, "mean_token_accuracy": 0.18428375869989394, "num_tokens": 39521734.0, "step": 22780 }, { "entropy": 5.574861764907837, "epoch": 1.7727679439797703, "grad_norm": 1.328125, "learning_rate": 0.00046836833200019116, "loss": 5.2422, "mean_token_accuracy": 0.17813752144575118, "num_tokens": 39530525.0, "step": 22785 }, { "entropy": 5.566452264785767, "epoch": 1.773156973351488, "grad_norm": 1.25, "learning_rate": 0.0004683541601360697, "loss": 5.1746, "mean_token_accuracy": 0.19332297891378403, "num_tokens": 39538938.0, "step": 22790 }, { "entropy": 5.428329515457153, "epoch": 1.7735460027232057, "grad_norm": 1.328125, "learning_rate": 0.00046833998533810653, "loss": 5.0483, "mean_token_accuracy": 0.19870121479034425, "num_tokens": 39547342.0, "step": 22795 }, { "entropy": 5.4057197093963625, "epoch": 1.7739350320949232, "grad_norm": 1.4140625, "learning_rate": 0.0004683258076065169, "loss": 5.1484, "mean_token_accuracy": 0.17728945463895798, "num_tokens": 39555107.0, "step": 22800 }, { "entropy": 5.552070045471192, "epoch": 1.7743240614666407, "grad_norm": 1.359375, "learning_rate": 0.00046831162694151586, "loss": 5.1907, "mean_token_accuracy": 0.17948800474405288, "num_tokens": 39563226.0, "step": 22805 }, { "entropy": 5.5458996295928955, "epoch": 1.7747130908383584, "grad_norm": 1.5703125, "learning_rate": 0.00046829744334331855, "loss": 5.2526, "mean_token_accuracy": 0.17849595546722413, "num_tokens": 39571689.0, "step": 22810 }, { "entropy": 5.43891487121582, "epoch": 1.7751021202100759, "grad_norm": 1.40625, "learning_rate": 0.00046828325681214013, "loss": 5.1281, "mean_token_accuracy": 0.1900151178240776, "num_tokens": 39579985.0, "step": 22815 }, { "entropy": 5.496083498001099, "epoch": 1.7754911495817933, "grad_norm": 1.4375, "learning_rate": 0.000468269067348196, "loss": 5.214, "mean_token_accuracy": 0.1786200374364853, "num_tokens": 39587892.0, "step": 22820 }, { "entropy": 5.525401544570923, "epoch": 1.775880178953511, "grad_norm": 1.5390625, "learning_rate": 0.0004682548749517014, "loss": 5.2747, "mean_token_accuracy": 0.17936124205589293, "num_tokens": 39597516.0, "step": 22825 }, { "entropy": 5.560754442214966, "epoch": 1.7762692083252287, "grad_norm": 1.3359375, "learning_rate": 0.00046824067962287163, "loss": 5.1933, "mean_token_accuracy": 0.18506172597408294, "num_tokens": 39605860.0, "step": 22830 }, { "entropy": 5.515400123596192, "epoch": 1.776658237696946, "grad_norm": 1.2890625, "learning_rate": 0.0004682264813619221, "loss": 5.2599, "mean_token_accuracy": 0.1773095592856407, "num_tokens": 39614915.0, "step": 22835 }, { "entropy": 5.579865598678589, "epoch": 1.7770472670686637, "grad_norm": 1.4140625, "learning_rate": 0.00046821228016906836, "loss": 5.2239, "mean_token_accuracy": 0.17707508504390718, "num_tokens": 39623588.0, "step": 22840 }, { "entropy": 5.543531656265259, "epoch": 1.7774362964403814, "grad_norm": 1.4921875, "learning_rate": 0.0004681980760445257, "loss": 5.2679, "mean_token_accuracy": 0.17618009597063064, "num_tokens": 39632351.0, "step": 22845 }, { "entropy": 5.481593418121338, "epoch": 1.7778253258120988, "grad_norm": 1.328125, "learning_rate": 0.0004681838689885098, "loss": 5.2033, "mean_token_accuracy": 0.1831686705350876, "num_tokens": 39641053.0, "step": 22850 }, { "entropy": 5.413815546035766, "epoch": 1.7782143551838163, "grad_norm": 1.3125, "learning_rate": 0.0004681696590012362, "loss": 5.0452, "mean_token_accuracy": 0.18759573251008987, "num_tokens": 39649838.0, "step": 22855 }, { "entropy": 5.44483118057251, "epoch": 1.778603384555534, "grad_norm": 1.25, "learning_rate": 0.00046815544608292043, "loss": 5.1042, "mean_token_accuracy": 0.18544670045375825, "num_tokens": 39658886.0, "step": 22860 }, { "entropy": 5.5596668243408205, "epoch": 1.7789924139272515, "grad_norm": 1.2421875, "learning_rate": 0.0004681412302337782, "loss": 5.251, "mean_token_accuracy": 0.1861257806420326, "num_tokens": 39667279.0, "step": 22865 }, { "entropy": 5.47145447731018, "epoch": 1.779381443298969, "grad_norm": 1.515625, "learning_rate": 0.0004681270114540252, "loss": 5.1637, "mean_token_accuracy": 0.17995944023132324, "num_tokens": 39676213.0, "step": 22870 }, { "entropy": 5.480303144454956, "epoch": 1.7797704726706867, "grad_norm": 1.3515625, "learning_rate": 0.0004681127897438772, "loss": 5.1823, "mean_token_accuracy": 0.18513032644987107, "num_tokens": 39685859.0, "step": 22875 }, { "entropy": 5.470049285888672, "epoch": 1.7801595020424044, "grad_norm": 1.515625, "learning_rate": 0.00046809856510355007, "loss": 5.1297, "mean_token_accuracy": 0.1814592659473419, "num_tokens": 39695240.0, "step": 22880 }, { "entropy": 5.456104183197022, "epoch": 1.7805485314141216, "grad_norm": 1.6171875, "learning_rate": 0.0004680843375332595, "loss": 5.1702, "mean_token_accuracy": 0.18085871934890746, "num_tokens": 39704441.0, "step": 22885 }, { "entropy": 5.558865356445312, "epoch": 1.7809375607858393, "grad_norm": 1.25, "learning_rate": 0.00046807010703322143, "loss": 5.2474, "mean_token_accuracy": 0.1789546474814415, "num_tokens": 39714074.0, "step": 22890 }, { "entropy": 5.577106094360351, "epoch": 1.781326590157557, "grad_norm": 1.4140625, "learning_rate": 0.0004680558736036518, "loss": 5.2467, "mean_token_accuracy": 0.1729050636291504, "num_tokens": 39722527.0, "step": 22895 }, { "entropy": 5.4906635761260985, "epoch": 1.7817156195292745, "grad_norm": 1.296875, "learning_rate": 0.0004680416372447666, "loss": 5.2061, "mean_token_accuracy": 0.18229880183935165, "num_tokens": 39730983.0, "step": 22900 }, { "entropy": 5.54629373550415, "epoch": 1.782104648900992, "grad_norm": 1.28125, "learning_rate": 0.00046802739795678177, "loss": 5.268, "mean_token_accuracy": 0.17313648909330367, "num_tokens": 39741114.0, "step": 22905 }, { "entropy": 5.573707532882691, "epoch": 1.7824936782727097, "grad_norm": 1.2890625, "learning_rate": 0.00046801315573991346, "loss": 5.1811, "mean_token_accuracy": 0.17849989533424376, "num_tokens": 39749281.0, "step": 22910 }, { "entropy": 5.503108787536621, "epoch": 1.7828827076444271, "grad_norm": 1.359375, "learning_rate": 0.00046799891059437764, "loss": 5.0259, "mean_token_accuracy": 0.1950564280152321, "num_tokens": 39758136.0, "step": 22915 }, { "entropy": 5.43076810836792, "epoch": 1.7832717370161446, "grad_norm": 4.0, "learning_rate": 0.00046798466252039056, "loss": 5.2394, "mean_token_accuracy": 0.18145583122968673, "num_tokens": 39767104.0, "step": 22920 }, { "entropy": 5.493445348739624, "epoch": 1.7836607663878623, "grad_norm": 1.2578125, "learning_rate": 0.00046797041151816845, "loss": 5.1866, "mean_token_accuracy": 0.1837488204240799, "num_tokens": 39775979.0, "step": 22925 }, { "entropy": 5.4416172981262205, "epoch": 1.78404979575958, "grad_norm": 1.3671875, "learning_rate": 0.00046795615758792747, "loss": 5.0824, "mean_token_accuracy": 0.18693752437829972, "num_tokens": 39783740.0, "step": 22930 }, { "entropy": 5.483373308181763, "epoch": 1.7844388251312973, "grad_norm": 1.28125, "learning_rate": 0.0004679419007298839, "loss": 5.2096, "mean_token_accuracy": 0.18720052540302276, "num_tokens": 39791836.0, "step": 22935 }, { "entropy": 5.499473667144775, "epoch": 1.784827854503015, "grad_norm": 1.484375, "learning_rate": 0.0004679276409442541, "loss": 5.1021, "mean_token_accuracy": 0.18431679755449296, "num_tokens": 39800694.0, "step": 22940 }, { "entropy": 5.445596694946289, "epoch": 1.7852168838747327, "grad_norm": 1.4609375, "learning_rate": 0.0004679133782312544, "loss": 5.2307, "mean_token_accuracy": 0.18080616295337676, "num_tokens": 39809108.0, "step": 22945 }, { "entropy": 5.505818843841553, "epoch": 1.7856059132464501, "grad_norm": 1.375, "learning_rate": 0.0004678991125911013, "loss": 5.1656, "mean_token_accuracy": 0.18493040949106215, "num_tokens": 39817608.0, "step": 22950 }, { "entropy": 5.4679711818695065, "epoch": 1.7859949426181676, "grad_norm": 1.203125, "learning_rate": 0.0004678848440240111, "loss": 5.1446, "mean_token_accuracy": 0.18441020399332048, "num_tokens": 39826596.0, "step": 22955 }, { "entropy": 5.478511381149292, "epoch": 1.7863839719898853, "grad_norm": 1.3359375, "learning_rate": 0.0004678705725302005, "loss": 5.1663, "mean_token_accuracy": 0.18216990828514099, "num_tokens": 39834440.0, "step": 22960 }, { "entropy": 5.480071926116944, "epoch": 1.7867730013616028, "grad_norm": 1.3671875, "learning_rate": 0.0004678562981098859, "loss": 5.1997, "mean_token_accuracy": 0.17654727697372435, "num_tokens": 39842617.0, "step": 22965 }, { "entropy": 5.419719266891479, "epoch": 1.7871620307333203, "grad_norm": 1.25, "learning_rate": 0.00046784202076328394, "loss": 5.0483, "mean_token_accuracy": 0.1962967559695244, "num_tokens": 39850688.0, "step": 22970 }, { "entropy": 5.475227403640747, "epoch": 1.787551060105038, "grad_norm": 1.3828125, "learning_rate": 0.00046782774049061124, "loss": 5.1795, "mean_token_accuracy": 0.18305582106113433, "num_tokens": 39859347.0, "step": 22975 }, { "entropy": 5.495944023132324, "epoch": 1.7879400894767556, "grad_norm": 1.296875, "learning_rate": 0.0004678134572920845, "loss": 5.1794, "mean_token_accuracy": 0.1887215331196785, "num_tokens": 39867090.0, "step": 22980 }, { "entropy": 5.474986362457275, "epoch": 1.788329118848473, "grad_norm": 1.28125, "learning_rate": 0.0004677991711679204, "loss": 5.1155, "mean_token_accuracy": 0.18230823427438736, "num_tokens": 39875653.0, "step": 22985 }, { "entropy": 5.487527179718017, "epoch": 1.7887181482201906, "grad_norm": 1.2109375, "learning_rate": 0.00046778488211833585, "loss": 5.2208, "mean_token_accuracy": 0.17306694239377976, "num_tokens": 39884781.0, "step": 22990 }, { "entropy": 5.518486738204956, "epoch": 1.7891071775919083, "grad_norm": 1.3828125, "learning_rate": 0.0004677705901435475, "loss": 5.1292, "mean_token_accuracy": 0.1844154417514801, "num_tokens": 39892619.0, "step": 22995 }, { "entropy": 5.510538101196289, "epoch": 1.7894962069636258, "grad_norm": 1.375, "learning_rate": 0.0004677562952437723, "loss": 5.183, "mean_token_accuracy": 0.1811816766858101, "num_tokens": 39901518.0, "step": 23000 }, { "entropy": 5.439651870727539, "epoch": 1.7898852363353432, "grad_norm": 1.2890625, "learning_rate": 0.00046774199741922705, "loss": 5.1437, "mean_token_accuracy": 0.1903405472636223, "num_tokens": 39909550.0, "step": 23005 }, { "entropy": 5.521391296386719, "epoch": 1.790274265707061, "grad_norm": 1.234375, "learning_rate": 0.00046772769667012884, "loss": 5.2126, "mean_token_accuracy": 0.1858076810836792, "num_tokens": 39918177.0, "step": 23010 }, { "entropy": 5.446392250061035, "epoch": 1.7906632950787784, "grad_norm": 1.2265625, "learning_rate": 0.0004677133929966946, "loss": 5.179, "mean_token_accuracy": 0.1791824772953987, "num_tokens": 39926812.0, "step": 23015 }, { "entropy": 5.492099046707153, "epoch": 1.791052324450496, "grad_norm": 1.2265625, "learning_rate": 0.00046769908639914134, "loss": 5.1825, "mean_token_accuracy": 0.18112296760082244, "num_tokens": 39934506.0, "step": 23020 }, { "entropy": 5.450998115539551, "epoch": 1.7914413538222136, "grad_norm": 1.28125, "learning_rate": 0.0004676847768776861, "loss": 5.1649, "mean_token_accuracy": 0.18170108199119567, "num_tokens": 39943252.0, "step": 23025 }, { "entropy": 5.458129501342773, "epoch": 1.7918303831939313, "grad_norm": 1.34375, "learning_rate": 0.0004676704644325462, "loss": 5.2178, "mean_token_accuracy": 0.17964989691972733, "num_tokens": 39952585.0, "step": 23030 }, { "entropy": 5.532080841064453, "epoch": 1.7922194125656488, "grad_norm": 1.203125, "learning_rate": 0.0004676561490639385, "loss": 5.1815, "mean_token_accuracy": 0.18414133191108703, "num_tokens": 39961805.0, "step": 23035 }, { "entropy": 5.525699806213379, "epoch": 1.7926084419373662, "grad_norm": 1.28125, "learning_rate": 0.0004676418307720805, "loss": 5.1918, "mean_token_accuracy": 0.18118867725133897, "num_tokens": 39970045.0, "step": 23040 }, { "entropy": 5.492172050476074, "epoch": 1.792997471309084, "grad_norm": 1.2578125, "learning_rate": 0.0004676275095571892, "loss": 5.1346, "mean_token_accuracy": 0.17861605882644654, "num_tokens": 39979073.0, "step": 23045 }, { "entropy": 5.449691534042358, "epoch": 1.7933865006808014, "grad_norm": 1.234375, "learning_rate": 0.00046761318541948215, "loss": 5.1832, "mean_token_accuracy": 0.18431015759706498, "num_tokens": 39987936.0, "step": 23050 }, { "entropy": 5.4313208103179935, "epoch": 1.7937755300525189, "grad_norm": 1.1796875, "learning_rate": 0.0004675988583591766, "loss": 5.2141, "mean_token_accuracy": 0.1806098312139511, "num_tokens": 39996547.0, "step": 23055 }, { "entropy": 5.563972997665405, "epoch": 1.7941645594242366, "grad_norm": 1.2109375, "learning_rate": 0.00046758452837648997, "loss": 5.2608, "mean_token_accuracy": 0.17358036935329438, "num_tokens": 40005717.0, "step": 23060 }, { "entropy": 5.447782325744629, "epoch": 1.794553588795954, "grad_norm": 1.3125, "learning_rate": 0.0004675701954716395, "loss": 5.0644, "mean_token_accuracy": 0.18892951160669327, "num_tokens": 40014799.0, "step": 23065 }, { "entropy": 5.446631574630738, "epoch": 1.7949426181676715, "grad_norm": 1.4375, "learning_rate": 0.00046755585964484286, "loss": 5.1922, "mean_token_accuracy": 0.18078854829072952, "num_tokens": 40023899.0, "step": 23070 }, { "entropy": 5.485397863388061, "epoch": 1.7953316475393892, "grad_norm": 1.328125, "learning_rate": 0.0004675415208963177, "loss": 5.1668, "mean_token_accuracy": 0.183061483502388, "num_tokens": 40032629.0, "step": 23075 }, { "entropy": 5.493171834945679, "epoch": 1.795720676911107, "grad_norm": 1.25, "learning_rate": 0.00046752717922628125, "loss": 5.217, "mean_token_accuracy": 0.18633842021226882, "num_tokens": 40040575.0, "step": 23080 }, { "entropy": 5.468233203887939, "epoch": 1.7961097062828244, "grad_norm": 1.390625, "learning_rate": 0.0004675128346349514, "loss": 5.2118, "mean_token_accuracy": 0.17855575531721116, "num_tokens": 40049221.0, "step": 23085 }, { "entropy": 5.594485759735107, "epoch": 1.7964987356545419, "grad_norm": 1.1796875, "learning_rate": 0.00046749848712254554, "loss": 5.2256, "mean_token_accuracy": 0.17665435820817948, "num_tokens": 40057737.0, "step": 23090 }, { "entropy": 5.4544459819793705, "epoch": 1.7968877650262596, "grad_norm": 1.359375, "learning_rate": 0.00046748413668928164, "loss": 5.1747, "mean_token_accuracy": 0.19249273985624313, "num_tokens": 40066447.0, "step": 23095 }, { "entropy": 5.480179500579834, "epoch": 1.797276794397977, "grad_norm": 1.1796875, "learning_rate": 0.0004674697833353774, "loss": 5.2121, "mean_token_accuracy": 0.18554846495389937, "num_tokens": 40075825.0, "step": 23100 }, { "entropy": 5.538825845718383, "epoch": 1.7976658237696945, "grad_norm": 1.25, "learning_rate": 0.00046745542706105045, "loss": 5.2243, "mean_token_accuracy": 0.1842022031545639, "num_tokens": 40084342.0, "step": 23105 }, { "entropy": 5.613399791717529, "epoch": 1.7980548531414122, "grad_norm": 1.25, "learning_rate": 0.00046744106786651875, "loss": 5.2522, "mean_token_accuracy": 0.17147384732961654, "num_tokens": 40092650.0, "step": 23110 }, { "entropy": 5.4534307479858395, "epoch": 1.7984438825131297, "grad_norm": 1.296875, "learning_rate": 0.0004674267057520001, "loss": 5.1474, "mean_token_accuracy": 0.17812027782201767, "num_tokens": 40100738.0, "step": 23115 }, { "entropy": 5.401161527633667, "epoch": 1.7988329118848472, "grad_norm": 1.25, "learning_rate": 0.0004674123407177125, "loss": 5.0574, "mean_token_accuracy": 0.1911110833287239, "num_tokens": 40109213.0, "step": 23120 }, { "entropy": 5.427142906188965, "epoch": 1.7992219412565649, "grad_norm": 1.21875, "learning_rate": 0.00046739797276387394, "loss": 5.0204, "mean_token_accuracy": 0.19041806310415268, "num_tokens": 40117622.0, "step": 23125 }, { "entropy": 5.468235206604004, "epoch": 1.7996109706282826, "grad_norm": 1.1640625, "learning_rate": 0.00046738360189070235, "loss": 5.1772, "mean_token_accuracy": 0.18247490525245666, "num_tokens": 40126347.0, "step": 23130 }, { "entropy": 5.604040431976318, "epoch": 1.8, "grad_norm": 1.1796875, "learning_rate": 0.0004673692280984157, "loss": 5.2536, "mean_token_accuracy": 0.17334724515676497, "num_tokens": 40134245.0, "step": 23135 }, { "entropy": 5.507966136932373, "epoch": 1.8003890293717175, "grad_norm": 1.25, "learning_rate": 0.0004673548513872324, "loss": 5.1277, "mean_token_accuracy": 0.17861067950725557, "num_tokens": 40142304.0, "step": 23140 }, { "entropy": 5.4621185779571535, "epoch": 1.8007780587434352, "grad_norm": 1.328125, "learning_rate": 0.00046734047175737026, "loss": 5.1258, "mean_token_accuracy": 0.1822003170847893, "num_tokens": 40150999.0, "step": 23145 }, { "entropy": 5.515125894546509, "epoch": 1.8011670881151527, "grad_norm": 1.2734375, "learning_rate": 0.00046732608920904754, "loss": 5.159, "mean_token_accuracy": 0.1836692363023758, "num_tokens": 40158659.0, "step": 23150 }, { "entropy": 5.425184202194214, "epoch": 1.8015561174868702, "grad_norm": 1.34375, "learning_rate": 0.0004673117037424827, "loss": 5.0997, "mean_token_accuracy": 0.1865812435746193, "num_tokens": 40167343.0, "step": 23155 }, { "entropy": 5.451471042633057, "epoch": 1.8019451468585879, "grad_norm": 1.1796875, "learning_rate": 0.00046729731535789375, "loss": 5.1448, "mean_token_accuracy": 0.18296872079372406, "num_tokens": 40176433.0, "step": 23160 }, { "entropy": 5.554238319396973, "epoch": 1.8023341762303053, "grad_norm": 1.578125, "learning_rate": 0.00046728292405549913, "loss": 5.2296, "mean_token_accuracy": 0.17968525886535644, "num_tokens": 40185826.0, "step": 23165 }, { "entropy": 5.465466070175171, "epoch": 1.8027232056020228, "grad_norm": 1.5234375, "learning_rate": 0.0004672685298355172, "loss": 5.23, "mean_token_accuracy": 0.18256641030311585, "num_tokens": 40194359.0, "step": 23170 }, { "entropy": 5.422066640853882, "epoch": 1.8031122349737405, "grad_norm": 1.203125, "learning_rate": 0.0004672541326981664, "loss": 5.0435, "mean_token_accuracy": 0.18694728761911392, "num_tokens": 40202812.0, "step": 23175 }, { "entropy": 5.45535945892334, "epoch": 1.8035012643454582, "grad_norm": 1.234375, "learning_rate": 0.000467239732643665, "loss": 5.2081, "mean_token_accuracy": 0.17527190446853638, "num_tokens": 40212344.0, "step": 23180 }, { "entropy": 5.534019470214844, "epoch": 1.8038902937171757, "grad_norm": 1.421875, "learning_rate": 0.00046722532967223183, "loss": 5.2556, "mean_token_accuracy": 0.18014490604400635, "num_tokens": 40220974.0, "step": 23185 }, { "entropy": 5.518744993209839, "epoch": 1.8042793230888932, "grad_norm": 1.265625, "learning_rate": 0.0004672109237840851, "loss": 5.2045, "mean_token_accuracy": 0.17542807757854462, "num_tokens": 40229616.0, "step": 23190 }, { "entropy": 5.488847780227661, "epoch": 1.8046683524606109, "grad_norm": 1.21875, "learning_rate": 0.00046719651497944355, "loss": 5.1973, "mean_token_accuracy": 0.1816132053732872, "num_tokens": 40238505.0, "step": 23195 }, { "entropy": 5.612068223953247, "epoch": 1.8050573818323283, "grad_norm": 1.359375, "learning_rate": 0.0004671821032585259, "loss": 5.3215, "mean_token_accuracy": 0.17440221458673477, "num_tokens": 40246716.0, "step": 23200 }, { "entropy": 5.584719133377075, "epoch": 1.8054464112040458, "grad_norm": 1.2734375, "learning_rate": 0.0004671676886215506, "loss": 5.2903, "mean_token_accuracy": 0.16984851956367492, "num_tokens": 40256146.0, "step": 23205 }, { "entropy": 5.568271446228027, "epoch": 1.8058354405757635, "grad_norm": 1.515625, "learning_rate": 0.0004671532710687365, "loss": 5.26, "mean_token_accuracy": 0.18023647218942643, "num_tokens": 40265304.0, "step": 23210 }, { "entropy": 5.412523889541626, "epoch": 1.806224469947481, "grad_norm": 1.2421875, "learning_rate": 0.0004671388506003024, "loss": 5.039, "mean_token_accuracy": 0.188178214430809, "num_tokens": 40274055.0, "step": 23215 }, { "entropy": 5.4580771923065186, "epoch": 1.8066134993191985, "grad_norm": 1.3046875, "learning_rate": 0.0004671244272164671, "loss": 5.1532, "mean_token_accuracy": 0.18401886969804765, "num_tokens": 40283184.0, "step": 23220 }, { "entropy": 5.604478549957276, "epoch": 1.8070025286909162, "grad_norm": 1.4296875, "learning_rate": 0.00046711000091744935, "loss": 5.235, "mean_token_accuracy": 0.18231750279664993, "num_tokens": 40292604.0, "step": 23225 }, { "entropy": 5.415930461883545, "epoch": 1.8073915580626339, "grad_norm": 1.2734375, "learning_rate": 0.0004670955717034681, "loss": 4.9732, "mean_token_accuracy": 0.19660312831401824, "num_tokens": 40301096.0, "step": 23230 }, { "entropy": 5.508109188079834, "epoch": 1.8077805874343513, "grad_norm": 1.3671875, "learning_rate": 0.00046708113957474233, "loss": 5.3716, "mean_token_accuracy": 0.17006833404302596, "num_tokens": 40309976.0, "step": 23235 }, { "entropy": 5.606958389282227, "epoch": 1.8081696168060688, "grad_norm": 1.3671875, "learning_rate": 0.000467066704531491, "loss": 5.3082, "mean_token_accuracy": 0.18004206269979478, "num_tokens": 40318594.0, "step": 23240 }, { "entropy": 5.504400062561035, "epoch": 1.8085586461777865, "grad_norm": 1.3046875, "learning_rate": 0.0004670522665739332, "loss": 5.1413, "mean_token_accuracy": 0.1838740348815918, "num_tokens": 40326480.0, "step": 23245 }, { "entropy": 5.428885221481323, "epoch": 1.808947675549504, "grad_norm": 1.2265625, "learning_rate": 0.0004670378257022878, "loss": 5.2448, "mean_token_accuracy": 0.18750713765621185, "num_tokens": 40334646.0, "step": 23250 }, { "entropy": 5.518796825408936, "epoch": 1.8093367049212215, "grad_norm": 1.2734375, "learning_rate": 0.00046702338191677414, "loss": 5.1961, "mean_token_accuracy": 0.1821474015712738, "num_tokens": 40344007.0, "step": 23255 }, { "entropy": 5.577638959884643, "epoch": 1.8097257342929391, "grad_norm": 1.3125, "learning_rate": 0.0004670089352176113, "loss": 5.2341, "mean_token_accuracy": 0.1759342595934868, "num_tokens": 40352075.0, "step": 23260 }, { "entropy": 5.442049741744995, "epoch": 1.8101147636646568, "grad_norm": 1.1875, "learning_rate": 0.00046699448560501847, "loss": 5.1686, "mean_token_accuracy": 0.1791912466287613, "num_tokens": 40360725.0, "step": 23265 }, { "entropy": 5.484342193603515, "epoch": 1.810503793036374, "grad_norm": 1.296875, "learning_rate": 0.0004669800330792149, "loss": 5.1646, "mean_token_accuracy": 0.18470221310853957, "num_tokens": 40369022.0, "step": 23270 }, { "entropy": 5.494751214981079, "epoch": 1.8108928224080918, "grad_norm": 1.2734375, "learning_rate": 0.00046696557764041994, "loss": 5.1522, "mean_token_accuracy": 0.18368327766656875, "num_tokens": 40377624.0, "step": 23275 }, { "entropy": 5.4696708679199215, "epoch": 1.8112818517798095, "grad_norm": 1.328125, "learning_rate": 0.0004669511192888528, "loss": 5.1885, "mean_token_accuracy": 0.18576640635728836, "num_tokens": 40385678.0, "step": 23280 }, { "entropy": 5.480497980117798, "epoch": 1.811670881151527, "grad_norm": 1.2578125, "learning_rate": 0.00046693665802473294, "loss": 5.2107, "mean_token_accuracy": 0.1820526510477066, "num_tokens": 40394565.0, "step": 23285 }, { "entropy": 5.542156457901001, "epoch": 1.8120599105232444, "grad_norm": 1.375, "learning_rate": 0.00046692219384827986, "loss": 5.2067, "mean_token_accuracy": 0.18153039067983628, "num_tokens": 40402910.0, "step": 23290 }, { "entropy": 5.460059452056885, "epoch": 1.8124489398949621, "grad_norm": 1.3125, "learning_rate": 0.0004669077267597129, "loss": 5.0896, "mean_token_accuracy": 0.18731612861156463, "num_tokens": 40411352.0, "step": 23295 }, { "entropy": 5.453590774536133, "epoch": 1.8128379692666796, "grad_norm": 1.3203125, "learning_rate": 0.00046689325675925174, "loss": 5.2308, "mean_token_accuracy": 0.18438348025083542, "num_tokens": 40419925.0, "step": 23300 }, { "entropy": 5.50316424369812, "epoch": 1.813226998638397, "grad_norm": 1.3125, "learning_rate": 0.00046687878384711574, "loss": 5.1742, "mean_token_accuracy": 0.17969903200864792, "num_tokens": 40428948.0, "step": 23305 }, { "entropy": 5.5396623611450195, "epoch": 1.8136160280101148, "grad_norm": 1.3046875, "learning_rate": 0.00046686430802352476, "loss": 5.2201, "mean_token_accuracy": 0.17791296541690826, "num_tokens": 40437625.0, "step": 23310 }, { "entropy": 5.446634721755982, "epoch": 1.8140050573818325, "grad_norm": 1.3984375, "learning_rate": 0.0004668498292886982, "loss": 5.1431, "mean_token_accuracy": 0.18832213878631593, "num_tokens": 40446435.0, "step": 23315 }, { "entropy": 5.554263544082642, "epoch": 1.8143940867535497, "grad_norm": 1.265625, "learning_rate": 0.00046683534764285577, "loss": 5.1869, "mean_token_accuracy": 0.1816474676132202, "num_tokens": 40455368.0, "step": 23320 }, { "entropy": 5.484384536743164, "epoch": 1.8147831161252674, "grad_norm": 1.2578125, "learning_rate": 0.00046682086308621725, "loss": 5.1837, "mean_token_accuracy": 0.1831982284784317, "num_tokens": 40464461.0, "step": 23325 }, { "entropy": 5.529201889038086, "epoch": 1.8151721454969851, "grad_norm": 1.375, "learning_rate": 0.0004668063756190026, "loss": 5.2968, "mean_token_accuracy": 0.17010256499052048, "num_tokens": 40473143.0, "step": 23330 }, { "entropy": 5.487561178207398, "epoch": 1.8155611748687026, "grad_norm": 1.1875, "learning_rate": 0.00046679188524143136, "loss": 5.1471, "mean_token_accuracy": 0.1879039317369461, "num_tokens": 40481592.0, "step": 23335 }, { "entropy": 5.383489322662354, "epoch": 1.81595020424042, "grad_norm": 1.234375, "learning_rate": 0.0004667773919537235, "loss": 5.0204, "mean_token_accuracy": 0.1969506859779358, "num_tokens": 40489445.0, "step": 23340 }, { "entropy": 5.417173719406128, "epoch": 1.8163392336121378, "grad_norm": 1.2421875, "learning_rate": 0.00046676289575609914, "loss": 5.1207, "mean_token_accuracy": 0.18748218864202498, "num_tokens": 40498279.0, "step": 23345 }, { "entropy": 5.534570360183716, "epoch": 1.8167282629838553, "grad_norm": 1.28125, "learning_rate": 0.00046674839664877796, "loss": 5.1053, "mean_token_accuracy": 0.18652520179748536, "num_tokens": 40507051.0, "step": 23350 }, { "entropy": 5.456001138687133, "epoch": 1.8171172923555727, "grad_norm": 1.28125, "learning_rate": 0.0004667338946319801, "loss": 5.0735, "mean_token_accuracy": 0.18819492310285568, "num_tokens": 40515213.0, "step": 23355 }, { "entropy": 5.46458888053894, "epoch": 1.8175063217272904, "grad_norm": 1.28125, "learning_rate": 0.0004667193897059255, "loss": 5.2267, "mean_token_accuracy": 0.17738055437803268, "num_tokens": 40523859.0, "step": 23360 }, { "entropy": 5.568717908859253, "epoch": 1.8178953510990081, "grad_norm": 1.3671875, "learning_rate": 0.00046670488187083436, "loss": 5.2959, "mean_token_accuracy": 0.17637215554714203, "num_tokens": 40533236.0, "step": 23365 }, { "entropy": 5.513077259063721, "epoch": 1.8182843804707254, "grad_norm": 1.21875, "learning_rate": 0.0004666903711269267, "loss": 5.1055, "mean_token_accuracy": 0.1881256178021431, "num_tokens": 40541670.0, "step": 23370 }, { "entropy": 5.4451593399047855, "epoch": 1.818673409842443, "grad_norm": 1.3125, "learning_rate": 0.0004666758574744228, "loss": 5.2193, "mean_token_accuracy": 0.18748000264167786, "num_tokens": 40551411.0, "step": 23375 }, { "entropy": 5.531672859191895, "epoch": 1.8190624392141608, "grad_norm": 1.2734375, "learning_rate": 0.0004666613409135429, "loss": 5.1716, "mean_token_accuracy": 0.18129484057426454, "num_tokens": 40560351.0, "step": 23380 }, { "entropy": 5.447461080551148, "epoch": 1.8194514685858783, "grad_norm": 1.5546875, "learning_rate": 0.0004666468214445072, "loss": 5.1098, "mean_token_accuracy": 0.18999021053314208, "num_tokens": 40569363.0, "step": 23385 }, { "entropy": 5.505829620361328, "epoch": 1.8198404979575957, "grad_norm": 1.328125, "learning_rate": 0.00046663229906753595, "loss": 5.1667, "mean_token_accuracy": 0.1801112785935402, "num_tokens": 40577425.0, "step": 23390 }, { "entropy": 5.499072456359864, "epoch": 1.8202295273293134, "grad_norm": 1.765625, "learning_rate": 0.00046661777378284965, "loss": 5.1896, "mean_token_accuracy": 0.179530830681324, "num_tokens": 40585718.0, "step": 23395 }, { "entropy": 5.581491231918335, "epoch": 1.820618556701031, "grad_norm": 1.3671875, "learning_rate": 0.0004666032455906685, "loss": 5.2666, "mean_token_accuracy": 0.17839665561914445, "num_tokens": 40594886.0, "step": 23400 }, { "entropy": 5.5808652400970455, "epoch": 1.8210075860727484, "grad_norm": 1.1796875, "learning_rate": 0.00046658871449121325, "loss": 5.2988, "mean_token_accuracy": 0.17446724623441695, "num_tokens": 40603737.0, "step": 23405 }, { "entropy": 5.467912340164185, "epoch": 1.821396615444466, "grad_norm": 1.3359375, "learning_rate": 0.0004665741804847041, "loss": 5.1805, "mean_token_accuracy": 0.1730229914188385, "num_tokens": 40612473.0, "step": 23410 }, { "entropy": 5.496291303634644, "epoch": 1.8217856448161838, "grad_norm": 1.2734375, "learning_rate": 0.00046655964357136164, "loss": 5.1235, "mean_token_accuracy": 0.18517027497291566, "num_tokens": 40620517.0, "step": 23415 }, { "entropy": 5.549793004989624, "epoch": 1.822174674187901, "grad_norm": 1.2421875, "learning_rate": 0.00046654510375140657, "loss": 5.2365, "mean_token_accuracy": 0.17439647316932677, "num_tokens": 40629530.0, "step": 23420 }, { "entropy": 5.491628360748291, "epoch": 1.8225637035596187, "grad_norm": 1.2265625, "learning_rate": 0.0004665305610250594, "loss": 5.1486, "mean_token_accuracy": 0.18616321086883544, "num_tokens": 40638616.0, "step": 23425 }, { "entropy": 5.578245544433594, "epoch": 1.8229527329313364, "grad_norm": 1.3828125, "learning_rate": 0.0004665160153925408, "loss": 5.1989, "mean_token_accuracy": 0.17650567293167113, "num_tokens": 40646945.0, "step": 23430 }, { "entropy": 5.467570972442627, "epoch": 1.823341762303054, "grad_norm": 1.3046875, "learning_rate": 0.00046650146685407154, "loss": 5.1703, "mean_token_accuracy": 0.18351942002773286, "num_tokens": 40654845.0, "step": 23435 }, { "entropy": 5.3574388980865475, "epoch": 1.8237307916747714, "grad_norm": 1.2578125, "learning_rate": 0.00046648691540987226, "loss": 5.0334, "mean_token_accuracy": 0.19450154155492783, "num_tokens": 40663776.0, "step": 23440 }, { "entropy": 5.47280969619751, "epoch": 1.824119821046489, "grad_norm": 1.28125, "learning_rate": 0.00046647236106016387, "loss": 5.0844, "mean_token_accuracy": 0.19155684858560562, "num_tokens": 40672071.0, "step": 23445 }, { "entropy": 5.498898601531982, "epoch": 1.8245088504182065, "grad_norm": 1.203125, "learning_rate": 0.0004664578038051672, "loss": 5.2523, "mean_token_accuracy": 0.1806219130754471, "num_tokens": 40681264.0, "step": 23450 }, { "entropy": 5.429758167266845, "epoch": 1.824897879789924, "grad_norm": 1.4375, "learning_rate": 0.000466443243645103, "loss": 5.1497, "mean_token_accuracy": 0.18900523632764815, "num_tokens": 40690091.0, "step": 23455 }, { "entropy": 5.576818513870239, "epoch": 1.8252869091616417, "grad_norm": 1.265625, "learning_rate": 0.0004664286805801923, "loss": 5.2983, "mean_token_accuracy": 0.17648597657680512, "num_tokens": 40699623.0, "step": 23460 }, { "entropy": 5.499347591400147, "epoch": 1.8256759385333594, "grad_norm": 1.2890625, "learning_rate": 0.0004664141146106562, "loss": 5.1282, "mean_token_accuracy": 0.1847424954175949, "num_tokens": 40708288.0, "step": 23465 }, { "entropy": 5.556072473526001, "epoch": 1.8260649679050769, "grad_norm": 1.4375, "learning_rate": 0.00046639954573671547, "loss": 5.2437, "mean_token_accuracy": 0.18135821372270583, "num_tokens": 40716357.0, "step": 23470 }, { "entropy": 5.553737926483154, "epoch": 1.8264539972767944, "grad_norm": 1.21875, "learning_rate": 0.00046638497395859127, "loss": 5.2386, "mean_token_accuracy": 0.18301109224557877, "num_tokens": 40724775.0, "step": 23475 }, { "entropy": 5.457752656936646, "epoch": 1.826843026648512, "grad_norm": 1.328125, "learning_rate": 0.0004663703992765047, "loss": 5.1913, "mean_token_accuracy": 0.18251526802778245, "num_tokens": 40733642.0, "step": 23480 }, { "entropy": 5.4011266231536865, "epoch": 1.8272320560202295, "grad_norm": 1.3984375, "learning_rate": 0.00046635582169067693, "loss": 5.122, "mean_token_accuracy": 0.18980038911104202, "num_tokens": 40742201.0, "step": 23485 }, { "entropy": 5.438978242874145, "epoch": 1.827621085391947, "grad_norm": 1.3125, "learning_rate": 0.00046634124120132915, "loss": 5.0967, "mean_token_accuracy": 0.1914320170879364, "num_tokens": 40750379.0, "step": 23490 }, { "entropy": 5.480813598632812, "epoch": 1.8280101147636647, "grad_norm": 1.21875, "learning_rate": 0.0004663266578086826, "loss": 5.2383, "mean_token_accuracy": 0.17355093359947205, "num_tokens": 40759232.0, "step": 23495 }, { "entropy": 5.474311828613281, "epoch": 1.8283991441353822, "grad_norm": 1.3359375, "learning_rate": 0.0004663120715129585, "loss": 5.1978, "mean_token_accuracy": 0.18082138895988464, "num_tokens": 40768247.0, "step": 23500 }, { "entropy": 5.5469437599182125, "epoch": 1.8287881735070997, "grad_norm": 1.3203125, "learning_rate": 0.0004662974823143783, "loss": 5.2511, "mean_token_accuracy": 0.1832208201289177, "num_tokens": 40777085.0, "step": 23505 }, { "entropy": 5.502522993087768, "epoch": 1.8291772028788174, "grad_norm": 1.3125, "learning_rate": 0.0004662828902131632, "loss": 5.258, "mean_token_accuracy": 0.1753576397895813, "num_tokens": 40785466.0, "step": 23510 }, { "entropy": 5.51013560295105, "epoch": 1.829566232250535, "grad_norm": 1.3671875, "learning_rate": 0.0004662682952095348, "loss": 5.1652, "mean_token_accuracy": 0.18816448152065277, "num_tokens": 40794165.0, "step": 23515 }, { "entropy": 5.461502552032471, "epoch": 1.8299552616222525, "grad_norm": 1.265625, "learning_rate": 0.00046625369730371436, "loss": 5.1328, "mean_token_accuracy": 0.18191335797309877, "num_tokens": 40802497.0, "step": 23520 }, { "entropy": 5.473326206207275, "epoch": 1.83034429099397, "grad_norm": 1.3125, "learning_rate": 0.0004662390964959235, "loss": 5.1166, "mean_token_accuracy": 0.19084784835577012, "num_tokens": 40811022.0, "step": 23525 }, { "entropy": 5.530590963363648, "epoch": 1.8307333203656877, "grad_norm": 1.21875, "learning_rate": 0.00046622449278638375, "loss": 5.2097, "mean_token_accuracy": 0.1784398466348648, "num_tokens": 40820430.0, "step": 23530 }, { "entropy": 5.477851629257202, "epoch": 1.8311223497374052, "grad_norm": 1.4453125, "learning_rate": 0.0004662098861753167, "loss": 5.2232, "mean_token_accuracy": 0.18283409476280213, "num_tokens": 40829245.0, "step": 23535 }, { "entropy": 5.439356994628906, "epoch": 1.8315113791091227, "grad_norm": 1.2734375, "learning_rate": 0.00046619527666294394, "loss": 5.1304, "mean_token_accuracy": 0.1887688234448433, "num_tokens": 40838576.0, "step": 23540 }, { "entropy": 5.550945854187011, "epoch": 1.8319004084808403, "grad_norm": 1.3046875, "learning_rate": 0.0004661806642494872, "loss": 5.2592, "mean_token_accuracy": 0.1754223644733429, "num_tokens": 40847097.0, "step": 23545 }, { "entropy": 5.542883348464966, "epoch": 1.8322894378525578, "grad_norm": 1.265625, "learning_rate": 0.0004661660489351681, "loss": 5.1328, "mean_token_accuracy": 0.1895716205239296, "num_tokens": 40855135.0, "step": 23550 }, { "entropy": 5.482326221466065, "epoch": 1.8326784672242753, "grad_norm": 1.2578125, "learning_rate": 0.0004661514307202086, "loss": 5.2422, "mean_token_accuracy": 0.1790841907262802, "num_tokens": 40864218.0, "step": 23555 }, { "entropy": 5.475128602981568, "epoch": 1.833067496595993, "grad_norm": 1.390625, "learning_rate": 0.00046613680960483036, "loss": 5.1861, "mean_token_accuracy": 0.18098906576633453, "num_tokens": 40873147.0, "step": 23560 }, { "entropy": 5.533008718490601, "epoch": 1.8334565259677107, "grad_norm": 1.1875, "learning_rate": 0.0004661221855892552, "loss": 5.2578, "mean_token_accuracy": 0.18332785964012147, "num_tokens": 40881340.0, "step": 23565 }, { "entropy": 5.475386428833008, "epoch": 1.8338455553394282, "grad_norm": 1.2578125, "learning_rate": 0.00046610755867370506, "loss": 5.1069, "mean_token_accuracy": 0.18876246809959413, "num_tokens": 40889246.0, "step": 23570 }, { "entropy": 5.476675271987915, "epoch": 1.8342345847111456, "grad_norm": 1.2421875, "learning_rate": 0.000466092928858402, "loss": 5.1995, "mean_token_accuracy": 0.18428771644830705, "num_tokens": 40898285.0, "step": 23575 }, { "entropy": 5.466903162002564, "epoch": 1.8346236140828633, "grad_norm": 1.375, "learning_rate": 0.00046607829614356787, "loss": 5.2434, "mean_token_accuracy": 0.17963754683732985, "num_tokens": 40907012.0, "step": 23580 }, { "entropy": 5.555818128585815, "epoch": 1.8350126434545808, "grad_norm": 1.25, "learning_rate": 0.0004660636605294247, "loss": 5.1084, "mean_token_accuracy": 0.18875508159399032, "num_tokens": 40915857.0, "step": 23585 }, { "entropy": 5.551228189468384, "epoch": 1.8354016728262983, "grad_norm": 1.25, "learning_rate": 0.0004660490220161946, "loss": 5.1505, "mean_token_accuracy": 0.18369343429803847, "num_tokens": 40924364.0, "step": 23590 }, { "entropy": 5.403105735778809, "epoch": 1.835790702198016, "grad_norm": 1.34375, "learning_rate": 0.00046603438060409966, "loss": 5.1389, "mean_token_accuracy": 0.18578112721443177, "num_tokens": 40934092.0, "step": 23595 }, { "entropy": 5.441193532943726, "epoch": 1.8361797315697335, "grad_norm": 1.3125, "learning_rate": 0.000466019736293362, "loss": 5.0242, "mean_token_accuracy": 0.19129632115364076, "num_tokens": 40942066.0, "step": 23600 }, { "entropy": 5.503836393356323, "epoch": 1.836568760941451, "grad_norm": 1.34375, "learning_rate": 0.00046600508908420396, "loss": 5.1888, "mean_token_accuracy": 0.18000709414482116, "num_tokens": 40951445.0, "step": 23605 }, { "entropy": 5.47071852684021, "epoch": 1.8369577903131686, "grad_norm": 1.15625, "learning_rate": 0.00046599043897684766, "loss": 5.1631, "mean_token_accuracy": 0.19170099049806594, "num_tokens": 40960111.0, "step": 23610 }, { "entropy": 5.474275779724121, "epoch": 1.8373468196848863, "grad_norm": 1.3125, "learning_rate": 0.0004659757859715155, "loss": 5.12, "mean_token_accuracy": 0.19222436398267745, "num_tokens": 40968036.0, "step": 23615 }, { "entropy": 5.421841764450074, "epoch": 1.8377358490566038, "grad_norm": 1.3671875, "learning_rate": 0.00046596113006842975, "loss": 5.1786, "mean_token_accuracy": 0.18294933438301086, "num_tokens": 40977032.0, "step": 23620 }, { "entropy": 5.470087480545044, "epoch": 1.8381248784283213, "grad_norm": 1.453125, "learning_rate": 0.0004659464712678128, "loss": 5.1641, "mean_token_accuracy": 0.18142516314983367, "num_tokens": 40985523.0, "step": 23625 }, { "entropy": 5.432314777374268, "epoch": 1.838513907800039, "grad_norm": 1.3125, "learning_rate": 0.0004659318095698871, "loss": 5.0356, "mean_token_accuracy": 0.19299081712961197, "num_tokens": 40993617.0, "step": 23630 }, { "entropy": 5.368931865692138, "epoch": 1.8389029371717565, "grad_norm": 1.2421875, "learning_rate": 0.000465917144974875, "loss": 5.1335, "mean_token_accuracy": 0.18121035397052765, "num_tokens": 41002424.0, "step": 23635 }, { "entropy": 5.491849613189697, "epoch": 1.839291966543474, "grad_norm": 1.6796875, "learning_rate": 0.0004659024774829992, "loss": 5.2486, "mean_token_accuracy": 0.17130196839571, "num_tokens": 41011150.0, "step": 23640 }, { "entropy": 5.552239274978637, "epoch": 1.8396809959151916, "grad_norm": 2.25, "learning_rate": 0.000465887807094482, "loss": 5.1302, "mean_token_accuracy": 0.1828191176056862, "num_tokens": 41020112.0, "step": 23645 }, { "entropy": 5.504865074157715, "epoch": 1.8400700252869093, "grad_norm": 1.296875, "learning_rate": 0.00046587313380954635, "loss": 5.189, "mean_token_accuracy": 0.17841228544712068, "num_tokens": 41029470.0, "step": 23650 }, { "entropy": 5.476781511306763, "epoch": 1.8404590546586266, "grad_norm": 1.2265625, "learning_rate": 0.00046585845762841453, "loss": 5.1989, "mean_token_accuracy": 0.1734434798359871, "num_tokens": 41038622.0, "step": 23655 }, { "entropy": 5.577941226959228, "epoch": 1.8408480840303443, "grad_norm": 1.421875, "learning_rate": 0.0004658437785513095, "loss": 5.3194, "mean_token_accuracy": 0.17199227809906006, "num_tokens": 41047573.0, "step": 23660 }, { "entropy": 5.522489166259765, "epoch": 1.841237113402062, "grad_norm": 1.4765625, "learning_rate": 0.0004658290965784539, "loss": 5.1362, "mean_token_accuracy": 0.18965699076652526, "num_tokens": 41057084.0, "step": 23665 }, { "entropy": 5.4084742069244385, "epoch": 1.8416261427737795, "grad_norm": 1.1484375, "learning_rate": 0.0004658144117100704, "loss": 5.0528, "mean_token_accuracy": 0.1881210520863533, "num_tokens": 41065297.0, "step": 23670 }, { "entropy": 5.42309536933899, "epoch": 1.842015172145497, "grad_norm": 1.3203125, "learning_rate": 0.00046579972394638204, "loss": 5.1551, "mean_token_accuracy": 0.18398280888795854, "num_tokens": 41073748.0, "step": 23675 }, { "entropy": 5.509632349014282, "epoch": 1.8424042015172146, "grad_norm": 1.1953125, "learning_rate": 0.00046578503328761146, "loss": 5.1021, "mean_token_accuracy": 0.18898945152759553, "num_tokens": 41082304.0, "step": 23680 }, { "entropy": 5.518460369110107, "epoch": 1.842793230888932, "grad_norm": 1.203125, "learning_rate": 0.00046577033973398173, "loss": 5.2645, "mean_token_accuracy": 0.17780764997005463, "num_tokens": 41091130.0, "step": 23685 }, { "entropy": 5.4526628971099855, "epoch": 1.8431822602606496, "grad_norm": 1.3515625, "learning_rate": 0.0004657556432857157, "loss": 5.1702, "mean_token_accuracy": 0.18572618812322617, "num_tokens": 41100413.0, "step": 23690 }, { "entropy": 5.356188869476318, "epoch": 1.8435712896323673, "grad_norm": 1.265625, "learning_rate": 0.0004657409439430364, "loss": 5.0225, "mean_token_accuracy": 0.19837235361337663, "num_tokens": 41108582.0, "step": 23695 }, { "entropy": 5.4476786136627195, "epoch": 1.843960319004085, "grad_norm": 1.2890625, "learning_rate": 0.0004657262417061669, "loss": 5.1055, "mean_token_accuracy": 0.18668131977319719, "num_tokens": 41117067.0, "step": 23700 }, { "entropy": 5.4262354373931885, "epoch": 1.8443493483758022, "grad_norm": 1.296875, "learning_rate": 0.0004657115365753302, "loss": 5.1173, "mean_token_accuracy": 0.18363260775804519, "num_tokens": 41125559.0, "step": 23705 }, { "entropy": 5.448144626617432, "epoch": 1.84473837774752, "grad_norm": 1.2265625, "learning_rate": 0.00046569682855074953, "loss": 5.1526, "mean_token_accuracy": 0.18344168215990067, "num_tokens": 41134503.0, "step": 23710 }, { "entropy": 5.575972414016723, "epoch": 1.8451274071192376, "grad_norm": 1.671875, "learning_rate": 0.00046568211763264796, "loss": 5.2782, "mean_token_accuracy": 0.17267971634864807, "num_tokens": 41143903.0, "step": 23715 }, { "entropy": 5.487414407730102, "epoch": 1.845516436490955, "grad_norm": 1.3984375, "learning_rate": 0.0004656674038212488, "loss": 5.1694, "mean_token_accuracy": 0.17904836535453797, "num_tokens": 41153082.0, "step": 23720 }, { "entropy": 5.542892169952393, "epoch": 1.8459054658626726, "grad_norm": 1.234375, "learning_rate": 0.00046565268711677525, "loss": 5.1426, "mean_token_accuracy": 0.1869928389787674, "num_tokens": 41161749.0, "step": 23725 }, { "entropy": 5.43172550201416, "epoch": 1.8462944952343903, "grad_norm": 1.296875, "learning_rate": 0.00046563796751945065, "loss": 5.1835, "mean_token_accuracy": 0.1804962933063507, "num_tokens": 41170969.0, "step": 23730 }, { "entropy": 5.377286386489868, "epoch": 1.8466835246061077, "grad_norm": 1.3984375, "learning_rate": 0.00046562324502949834, "loss": 5.0312, "mean_token_accuracy": 0.19420293420553209, "num_tokens": 41179512.0, "step": 23735 }, { "entropy": 5.438078737258911, "epoch": 1.8470725539778252, "grad_norm": 1.25, "learning_rate": 0.0004656085196471416, "loss": 5.0873, "mean_token_accuracy": 0.18688165992498398, "num_tokens": 41188109.0, "step": 23740 }, { "entropy": 5.480934524536133, "epoch": 1.847461583349543, "grad_norm": 1.3359375, "learning_rate": 0.00046559379137260404, "loss": 5.2016, "mean_token_accuracy": 0.1750790774822235, "num_tokens": 41196708.0, "step": 23745 }, { "entropy": 5.556172180175781, "epoch": 1.8478506127212606, "grad_norm": 1.359375, "learning_rate": 0.000465579060206109, "loss": 5.3081, "mean_token_accuracy": 0.1780659958720207, "num_tokens": 41205013.0, "step": 23750 }, { "entropy": 5.448770952224732, "epoch": 1.8482396420929779, "grad_norm": 1.3515625, "learning_rate": 0.00046556432614788015, "loss": 5.027, "mean_token_accuracy": 0.19285576045513153, "num_tokens": 41213701.0, "step": 23755 }, { "entropy": 5.386996078491211, "epoch": 1.8486286714646956, "grad_norm": 1.2578125, "learning_rate": 0.0004655495891981409, "loss": 5.0756, "mean_token_accuracy": 0.18846024125814437, "num_tokens": 41222450.0, "step": 23760 }, { "entropy": 5.467958879470825, "epoch": 1.8490177008364133, "grad_norm": 1.2578125, "learning_rate": 0.000465534849357115, "loss": 5.1881, "mean_token_accuracy": 0.17802358865737916, "num_tokens": 41230259.0, "step": 23765 }, { "entropy": 5.458728790283203, "epoch": 1.8494067302081307, "grad_norm": 1.15625, "learning_rate": 0.00046552010662502595, "loss": 5.1285, "mean_token_accuracy": 0.1926506504416466, "num_tokens": 41238863.0, "step": 23770 }, { "entropy": 5.428018379211426, "epoch": 1.8497957595798482, "grad_norm": 1.578125, "learning_rate": 0.0004655053610020976, "loss": 5.1631, "mean_token_accuracy": 0.18430890291929244, "num_tokens": 41247260.0, "step": 23775 }, { "entropy": 5.4210710525512695, "epoch": 1.850184788951566, "grad_norm": 1.3515625, "learning_rate": 0.0004654906124885535, "loss": 5.0658, "mean_token_accuracy": 0.19114517271518708, "num_tokens": 41255475.0, "step": 23780 }, { "entropy": 5.3939659118652346, "epoch": 1.8505738183232834, "grad_norm": 1.265625, "learning_rate": 0.0004654758610846176, "loss": 4.9588, "mean_token_accuracy": 0.20290385335683822, "num_tokens": 41263858.0, "step": 23785 }, { "entropy": 5.421311855316162, "epoch": 1.8509628476950009, "grad_norm": 1.3828125, "learning_rate": 0.0004654611067905137, "loss": 5.2203, "mean_token_accuracy": 0.18146197348833085, "num_tokens": 41272527.0, "step": 23790 }, { "entropy": 5.504159450531006, "epoch": 1.8513518770667186, "grad_norm": 1.171875, "learning_rate": 0.00046544634960646563, "loss": 5.1659, "mean_token_accuracy": 0.1872281089425087, "num_tokens": 41280647.0, "step": 23795 }, { "entropy": 5.54730076789856, "epoch": 1.8517409064384363, "grad_norm": 1.3359375, "learning_rate": 0.0004654315895326974, "loss": 5.1859, "mean_token_accuracy": 0.18824778646230697, "num_tokens": 41289462.0, "step": 23800 }, { "entropy": 5.539541530609131, "epoch": 1.8521299358101535, "grad_norm": 1.34375, "learning_rate": 0.0004654168265694328, "loss": 5.1159, "mean_token_accuracy": 0.18879576474428178, "num_tokens": 41297178.0, "step": 23805 }, { "entropy": 5.448823928833008, "epoch": 1.8525189651818712, "grad_norm": 1.2265625, "learning_rate": 0.000465402060716896, "loss": 5.0943, "mean_token_accuracy": 0.18625584095716477, "num_tokens": 41305405.0, "step": 23810 }, { "entropy": 5.440502166748047, "epoch": 1.852907994553589, "grad_norm": 1.2109375, "learning_rate": 0.000465387291975311, "loss": 5.106, "mean_token_accuracy": 0.18837257474660873, "num_tokens": 41313330.0, "step": 23815 }, { "entropy": 5.4377179622650145, "epoch": 1.8532970239253064, "grad_norm": 1.2421875, "learning_rate": 0.00046537252034490185, "loss": 5.1436, "mean_token_accuracy": 0.19087498188018798, "num_tokens": 41321245.0, "step": 23820 }, { "entropy": 5.548234605789185, "epoch": 1.8536860532970239, "grad_norm": 1.3359375, "learning_rate": 0.00046535774582589275, "loss": 5.2058, "mean_token_accuracy": 0.17530859708786012, "num_tokens": 41330013.0, "step": 23825 }, { "entropy": 5.541493844985962, "epoch": 1.8540750826687415, "grad_norm": 1.203125, "learning_rate": 0.00046534296841850776, "loss": 5.1687, "mean_token_accuracy": 0.1860146403312683, "num_tokens": 41338134.0, "step": 23830 }, { "entropy": 5.41396951675415, "epoch": 1.854464112040459, "grad_norm": 1.2265625, "learning_rate": 0.00046532818812297124, "loss": 5.0782, "mean_token_accuracy": 0.18359216600656508, "num_tokens": 41346693.0, "step": 23835 }, { "entropy": 5.4653685092926025, "epoch": 1.8548531414121765, "grad_norm": 1.2734375, "learning_rate": 0.0004653134049395074, "loss": 5.2347, "mean_token_accuracy": 0.17438702881336213, "num_tokens": 41354987.0, "step": 23840 }, { "entropy": 5.508549308776855, "epoch": 1.8552421707838942, "grad_norm": 1.21875, "learning_rate": 0.0004652986188683406, "loss": 5.2194, "mean_token_accuracy": 0.17582044005393982, "num_tokens": 41363703.0, "step": 23845 }, { "entropy": 5.500749349594116, "epoch": 1.855631200155612, "grad_norm": 1.34375, "learning_rate": 0.00046528382990969504, "loss": 5.165, "mean_token_accuracy": 0.1863449066877365, "num_tokens": 41371983.0, "step": 23850 }, { "entropy": 5.507573080062866, "epoch": 1.8560202295273294, "grad_norm": 1.359375, "learning_rate": 0.0004652690380637953, "loss": 5.1995, "mean_token_accuracy": 0.18139823228120805, "num_tokens": 41380215.0, "step": 23855 }, { "entropy": 5.484664440155029, "epoch": 1.8564092588990468, "grad_norm": 1.2578125, "learning_rate": 0.0004652542433308657, "loss": 5.128, "mean_token_accuracy": 0.1867167368531227, "num_tokens": 41388927.0, "step": 23860 }, { "entropy": 5.5138843059539795, "epoch": 1.8567982882707645, "grad_norm": 1.203125, "learning_rate": 0.0004652394457111309, "loss": 5.2225, "mean_token_accuracy": 0.17612198293209075, "num_tokens": 41397823.0, "step": 23865 }, { "entropy": 5.510759353637695, "epoch": 1.857187317642482, "grad_norm": 1.2578125, "learning_rate": 0.00046522464520481517, "loss": 5.1895, "mean_token_accuracy": 0.1852448746562004, "num_tokens": 41406322.0, "step": 23870 }, { "entropy": 5.4510509967803955, "epoch": 1.8575763470141995, "grad_norm": 1.359375, "learning_rate": 0.00046520984181214333, "loss": 5.1502, "mean_token_accuracy": 0.18764548748731613, "num_tokens": 41415118.0, "step": 23875 }, { "entropy": 5.473931169509887, "epoch": 1.8579653763859172, "grad_norm": 1.2890625, "learning_rate": 0.0004651950355333398, "loss": 5.2019, "mean_token_accuracy": 0.1841976210474968, "num_tokens": 41424139.0, "step": 23880 }, { "entropy": 5.504588270187378, "epoch": 1.8583544057576347, "grad_norm": 1.3125, "learning_rate": 0.0004651802263686294, "loss": 5.2343, "mean_token_accuracy": 0.17744267880916595, "num_tokens": 41432017.0, "step": 23885 }, { "entropy": 5.512833881378174, "epoch": 1.8587434351293521, "grad_norm": 1.3125, "learning_rate": 0.0004651654143182367, "loss": 5.1336, "mean_token_accuracy": 0.18234180510044098, "num_tokens": 41440279.0, "step": 23890 }, { "entropy": 5.433212518692017, "epoch": 1.8591324645010698, "grad_norm": 1.2578125, "learning_rate": 0.0004651505993823866, "loss": 5.0622, "mean_token_accuracy": 0.186395999789238, "num_tokens": 41449325.0, "step": 23895 }, { "entropy": 5.4236030101776125, "epoch": 1.8595214938727875, "grad_norm": 1.3125, "learning_rate": 0.00046513578156130383, "loss": 5.0586, "mean_token_accuracy": 0.1806375950574875, "num_tokens": 41457898.0, "step": 23900 }, { "entropy": 5.427620458602905, "epoch": 1.859910523244505, "grad_norm": 1.28125, "learning_rate": 0.0004651209608552131, "loss": 5.0865, "mean_token_accuracy": 0.19528905749320985, "num_tokens": 41466410.0, "step": 23905 }, { "entropy": 5.555057525634766, "epoch": 1.8602995526162225, "grad_norm": 1.21875, "learning_rate": 0.00046510613726433945, "loss": 5.208, "mean_token_accuracy": 0.18541549742221833, "num_tokens": 41475061.0, "step": 23910 }, { "entropy": 5.376064300537109, "epoch": 1.8606885819879402, "grad_norm": 1.328125, "learning_rate": 0.0004650913107889078, "loss": 5.1645, "mean_token_accuracy": 0.18871715813875198, "num_tokens": 41483569.0, "step": 23915 }, { "entropy": 5.420612573623657, "epoch": 1.8610776113596577, "grad_norm": 1.40625, "learning_rate": 0.000465076481429143, "loss": 5.188, "mean_token_accuracy": 0.18206114321947098, "num_tokens": 41492113.0, "step": 23920 }, { "entropy": 5.473980522155761, "epoch": 1.8614666407313751, "grad_norm": 1.3828125, "learning_rate": 0.0004650616491852701, "loss": 5.2377, "mean_token_accuracy": 0.17541804611682893, "num_tokens": 41500722.0, "step": 23925 }, { "entropy": 5.442581462860107, "epoch": 1.8618556701030928, "grad_norm": 1.3046875, "learning_rate": 0.00046504681405751426, "loss": 5.0891, "mean_token_accuracy": 0.18984262645244598, "num_tokens": 41509272.0, "step": 23930 }, { "entropy": 5.497873210906983, "epoch": 1.8622446994748103, "grad_norm": 1.390625, "learning_rate": 0.00046503197604610047, "loss": 5.2517, "mean_token_accuracy": 0.18093563467264176, "num_tokens": 41517379.0, "step": 23935 }, { "entropy": 5.4139515399932865, "epoch": 1.8626337288465278, "grad_norm": 1.3828125, "learning_rate": 0.00046501713515125393, "loss": 5.1129, "mean_token_accuracy": 0.18834685683250427, "num_tokens": 41525737.0, "step": 23940 }, { "entropy": 5.4388192653656, "epoch": 1.8630227582182455, "grad_norm": 1.2734375, "learning_rate": 0.0004650022913731998, "loss": 5.1585, "mean_token_accuracy": 0.18253383487462999, "num_tokens": 41535016.0, "step": 23945 }, { "entropy": 5.518453454971313, "epoch": 1.8634117875899632, "grad_norm": 1.296875, "learning_rate": 0.00046498744471216335, "loss": 5.2418, "mean_token_accuracy": 0.18166171461343766, "num_tokens": 41544253.0, "step": 23950 }, { "entropy": 5.529545450210572, "epoch": 1.8638008169616807, "grad_norm": 1.3359375, "learning_rate": 0.00046497259516836974, "loss": 5.2009, "mean_token_accuracy": 0.17735646516084672, "num_tokens": 41551907.0, "step": 23955 }, { "entropy": 5.558815240859985, "epoch": 1.8641898463333981, "grad_norm": 1.2421875, "learning_rate": 0.00046495774274204446, "loss": 5.2102, "mean_token_accuracy": 0.18527324199676515, "num_tokens": 41560675.0, "step": 23960 }, { "entropy": 5.519184160232544, "epoch": 1.8645788757051158, "grad_norm": 1.40625, "learning_rate": 0.0004649428874334127, "loss": 5.2233, "mean_token_accuracy": 0.177040958404541, "num_tokens": 41570256.0, "step": 23965 }, { "entropy": 5.51069393157959, "epoch": 1.8649679050768333, "grad_norm": 1.390625, "learning_rate": 0.0004649280292427, "loss": 5.1806, "mean_token_accuracy": 0.18845358341932297, "num_tokens": 41578990.0, "step": 23970 }, { "entropy": 5.440972852706909, "epoch": 1.8653569344485508, "grad_norm": 1.40625, "learning_rate": 0.0004649131681701318, "loss": 5.1814, "mean_token_accuracy": 0.18484075665473937, "num_tokens": 41587896.0, "step": 23975 }, { "entropy": 5.451095104217529, "epoch": 1.8657459638202685, "grad_norm": 1.25, "learning_rate": 0.00046489830421593347, "loss": 5.1587, "mean_token_accuracy": 0.18506552428007125, "num_tokens": 41596160.0, "step": 23980 }, { "entropy": 5.490046596527099, "epoch": 1.866134993191986, "grad_norm": 1.2578125, "learning_rate": 0.0004648834373803307, "loss": 5.1716, "mean_token_accuracy": 0.17922349125146866, "num_tokens": 41605025.0, "step": 23985 }, { "entropy": 5.488406658172607, "epoch": 1.8665240225637034, "grad_norm": 1.3125, "learning_rate": 0.00046486856766354893, "loss": 5.1424, "mean_token_accuracy": 0.18891462832689285, "num_tokens": 41612768.0, "step": 23990 }, { "entropy": 5.4166882038116455, "epoch": 1.8669130519354211, "grad_norm": 1.234375, "learning_rate": 0.00046485369506581387, "loss": 5.1814, "mean_token_accuracy": 0.182580429315567, "num_tokens": 41620892.0, "step": 23995 }, { "entropy": 5.530186462402344, "epoch": 1.8673020813071388, "grad_norm": 1.3046875, "learning_rate": 0.00046483881958735124, "loss": 5.2636, "mean_token_accuracy": 0.18245457261800765, "num_tokens": 41629708.0, "step": 24000 }, { "epoch": 1.8673020813071388, "eval_entropy": 5.377515880962882, "eval_loss": 5.254362106323242, "eval_mean_token_accuracy": 0.1882645305780348, "eval_num_tokens": 41629708.0, "eval_runtime": 28.6314, "eval_samples_per_second": 1451.483, "eval_steps_per_second": 181.444, "step": 24000 }, { "entropy": 5.564175701141357, "epoch": 1.8676911106788563, "grad_norm": 1.25, "learning_rate": 0.00046482394122838663, "loss": 5.0646, "mean_token_accuracy": 0.19183979481458663, "num_tokens": 41637966.0, "step": 24005 }, { "entropy": 5.396935224533081, "epoch": 1.8680801400505738, "grad_norm": 1.3359375, "learning_rate": 0.00046480905998914587, "loss": 5.1292, "mean_token_accuracy": 0.18848343342542648, "num_tokens": 41646726.0, "step": 24010 }, { "entropy": 5.402428436279297, "epoch": 1.8684691694222915, "grad_norm": 1.3125, "learning_rate": 0.0004647941758698547, "loss": 5.1355, "mean_token_accuracy": 0.1816083699464798, "num_tokens": 41655450.0, "step": 24015 }, { "entropy": 5.58498477935791, "epoch": 1.868858198794009, "grad_norm": 1.2265625, "learning_rate": 0.000464779288870739, "loss": 5.2626, "mean_token_accuracy": 0.18196014761924745, "num_tokens": 41664295.0, "step": 24020 }, { "entropy": 5.379287385940552, "epoch": 1.8692472281657264, "grad_norm": 1.3046875, "learning_rate": 0.00046476439899202464, "loss": 4.9557, "mean_token_accuracy": 0.1983610764145851, "num_tokens": 41672025.0, "step": 24025 }, { "entropy": 5.375784301757813, "epoch": 1.8696362575374441, "grad_norm": 1.3515625, "learning_rate": 0.00046474950623393756, "loss": 5.1824, "mean_token_accuracy": 0.1824754446744919, "num_tokens": 41680360.0, "step": 24030 }, { "entropy": 5.512145566940307, "epoch": 1.8700252869091616, "grad_norm": 1.1796875, "learning_rate": 0.0004647346105967038, "loss": 5.1572, "mean_token_accuracy": 0.18014441430568695, "num_tokens": 41689865.0, "step": 24035 }, { "entropy": 5.519852638244629, "epoch": 1.870414316280879, "grad_norm": 1.1796875, "learning_rate": 0.0004647197120805493, "loss": 5.3154, "mean_token_accuracy": 0.17120766043663024, "num_tokens": 41698583.0, "step": 24040 }, { "entropy": 5.48077802658081, "epoch": 1.8708033456525968, "grad_norm": 1.203125, "learning_rate": 0.00046470481068570013, "loss": 5.3424, "mean_token_accuracy": 0.17267362624406815, "num_tokens": 41708107.0, "step": 24045 }, { "entropy": 5.5476541996002195, "epoch": 1.8711923750243145, "grad_norm": 1.2265625, "learning_rate": 0.0004646899064123824, "loss": 5.2229, "mean_token_accuracy": 0.17752458453178405, "num_tokens": 41716446.0, "step": 24050 }, { "entropy": 5.483295059204101, "epoch": 1.871581404396032, "grad_norm": 1.1796875, "learning_rate": 0.0004646749992608223, "loss": 5.1782, "mean_token_accuracy": 0.18513074070215224, "num_tokens": 41726142.0, "step": 24055 }, { "entropy": 5.475309705734253, "epoch": 1.8719704337677494, "grad_norm": 1.171875, "learning_rate": 0.0004646600892312459, "loss": 5.1525, "mean_token_accuracy": 0.18742657452821732, "num_tokens": 41734488.0, "step": 24060 }, { "entropy": 5.4400660514831545, "epoch": 1.872359463139467, "grad_norm": 1.3203125, "learning_rate": 0.0004646451763238796, "loss": 5.1278, "mean_token_accuracy": 0.18037073761224748, "num_tokens": 41743164.0, "step": 24065 }, { "entropy": 5.506045007705689, "epoch": 1.8727484925111846, "grad_norm": 1.21875, "learning_rate": 0.0004646302605389496, "loss": 5.2149, "mean_token_accuracy": 0.1824511393904686, "num_tokens": 41751994.0, "step": 24070 }, { "entropy": 5.550379228591919, "epoch": 1.873137521882902, "grad_norm": 1.1640625, "learning_rate": 0.0004646153418766822, "loss": 5.266, "mean_token_accuracy": 0.18220161646604538, "num_tokens": 41761801.0, "step": 24075 }, { "entropy": 5.586080265045166, "epoch": 1.8735265512546198, "grad_norm": 1.25, "learning_rate": 0.00046460042033730377, "loss": 5.2756, "mean_token_accuracy": 0.182007272541523, "num_tokens": 41770771.0, "step": 24080 }, { "entropy": 5.506754589080811, "epoch": 1.8739155806263375, "grad_norm": 1.2265625, "learning_rate": 0.0004645854959210408, "loss": 5.2068, "mean_token_accuracy": 0.18073942214250566, "num_tokens": 41779813.0, "step": 24085 }, { "entropy": 5.52459306716919, "epoch": 1.8743046099980547, "grad_norm": 1.296875, "learning_rate": 0.00046457056862811956, "loss": 5.2526, "mean_token_accuracy": 0.18616203218698502, "num_tokens": 41790076.0, "step": 24090 }, { "entropy": 5.523430728912354, "epoch": 1.8746936393697724, "grad_norm": 1.25, "learning_rate": 0.0004645556384587668, "loss": 5.1363, "mean_token_accuracy": 0.18820858895778655, "num_tokens": 41799448.0, "step": 24095 }, { "entropy": 5.537123966217041, "epoch": 1.87508266874149, "grad_norm": 1.234375, "learning_rate": 0.0004645407054132089, "loss": 5.2244, "mean_token_accuracy": 0.17518313080072404, "num_tokens": 41808117.0, "step": 24100 }, { "entropy": 5.434284687042236, "epoch": 1.8754716981132076, "grad_norm": 1.2265625, "learning_rate": 0.0004645257694916725, "loss": 5.0941, "mean_token_accuracy": 0.19359175860881805, "num_tokens": 41816176.0, "step": 24105 }, { "entropy": 5.4685076713562015, "epoch": 1.875860727484925, "grad_norm": 1.21875, "learning_rate": 0.0004645108306943842, "loss": 5.1868, "mean_token_accuracy": 0.18438277244567872, "num_tokens": 41825093.0, "step": 24110 }, { "entropy": 5.467846632003784, "epoch": 1.8762497568566427, "grad_norm": 1.21875, "learning_rate": 0.0004644958890215707, "loss": 5.2758, "mean_token_accuracy": 0.17675289511680603, "num_tokens": 41834524.0, "step": 24115 }, { "entropy": 5.4337804317474365, "epoch": 1.8766387862283602, "grad_norm": 1.3203125, "learning_rate": 0.0004644809444734586, "loss": 5.0686, "mean_token_accuracy": 0.18909573405981064, "num_tokens": 41843188.0, "step": 24120 }, { "entropy": 5.484651756286621, "epoch": 1.8770278156000777, "grad_norm": 1.2421875, "learning_rate": 0.00046446599705027487, "loss": 5.1909, "mean_token_accuracy": 0.18062212616205214, "num_tokens": 41852296.0, "step": 24125 }, { "entropy": 5.566081094741821, "epoch": 1.8774168449717954, "grad_norm": 1.1328125, "learning_rate": 0.00046445104675224607, "loss": 5.2102, "mean_token_accuracy": 0.1837824121117592, "num_tokens": 41861641.0, "step": 24130 }, { "entropy": 5.422137689590454, "epoch": 1.877805874343513, "grad_norm": 1.3671875, "learning_rate": 0.0004644360935795993, "loss": 5.1286, "mean_token_accuracy": 0.17997875958681106, "num_tokens": 41870463.0, "step": 24135 }, { "entropy": 5.457820034027099, "epoch": 1.8781949037152303, "grad_norm": 1.2890625, "learning_rate": 0.00046442113753256126, "loss": 5.2089, "mean_token_accuracy": 0.1828642323613167, "num_tokens": 41878739.0, "step": 24140 }, { "entropy": 5.518969440460205, "epoch": 1.878583933086948, "grad_norm": 1.203125, "learning_rate": 0.00046440617861135905, "loss": 5.1974, "mean_token_accuracy": 0.18267695009708404, "num_tokens": 41887211.0, "step": 24145 }, { "entropy": 5.512998580932617, "epoch": 1.8789729624586657, "grad_norm": 1.265625, "learning_rate": 0.0004643912168162194, "loss": 5.1056, "mean_token_accuracy": 0.18735189139842987, "num_tokens": 41895742.0, "step": 24150 }, { "entropy": 5.4816575050354, "epoch": 1.8793619918303832, "grad_norm": 1.203125, "learning_rate": 0.0004643762521473696, "loss": 5.165, "mean_token_accuracy": 0.18422200977802278, "num_tokens": 41904866.0, "step": 24155 }, { "entropy": 5.523362159729004, "epoch": 1.8797510212021007, "grad_norm": 1.21875, "learning_rate": 0.0004643612846050366, "loss": 5.2842, "mean_token_accuracy": 0.17461914867162703, "num_tokens": 41914237.0, "step": 24160 }, { "entropy": 5.398854398727417, "epoch": 1.8801400505738184, "grad_norm": 1.1640625, "learning_rate": 0.00046434631418944744, "loss": 5.1434, "mean_token_accuracy": 0.18566177040338516, "num_tokens": 41923070.0, "step": 24165 }, { "entropy": 5.49472861289978, "epoch": 1.8805290799455359, "grad_norm": 1.2890625, "learning_rate": 0.0004643313409008294, "loss": 5.1399, "mean_token_accuracy": 0.18025409281253815, "num_tokens": 41932076.0, "step": 24170 }, { "entropy": 5.472627592086792, "epoch": 1.8809181093172533, "grad_norm": 1.3125, "learning_rate": 0.00046431636473940956, "loss": 5.1894, "mean_token_accuracy": 0.1793360412120819, "num_tokens": 41941169.0, "step": 24175 }, { "entropy": 5.41436357498169, "epoch": 1.881307138688971, "grad_norm": 1.25, "learning_rate": 0.0004643013857054152, "loss": 5.0684, "mean_token_accuracy": 0.18709639757871627, "num_tokens": 41949499.0, "step": 24180 }, { "entropy": 5.552463579177856, "epoch": 1.8816961680606887, "grad_norm": 1.765625, "learning_rate": 0.00046428640379907367, "loss": 5.2551, "mean_token_accuracy": 0.1800643637776375, "num_tokens": 41957274.0, "step": 24185 }, { "entropy": 5.42193717956543, "epoch": 1.882085197432406, "grad_norm": 1.53125, "learning_rate": 0.00046427141902061225, "loss": 5.089, "mean_token_accuracy": 0.1853225514292717, "num_tokens": 41965996.0, "step": 24190 }, { "entropy": 5.471542453765869, "epoch": 1.8824742268041237, "grad_norm": 1.171875, "learning_rate": 0.0004642564313702582, "loss": 5.1442, "mean_token_accuracy": 0.18504322618246077, "num_tokens": 41974652.0, "step": 24195 }, { "entropy": 5.5182465553283695, "epoch": 1.8828632561758414, "grad_norm": 1.3203125, "learning_rate": 0.00046424144084823916, "loss": 5.165, "mean_token_accuracy": 0.17763276398181915, "num_tokens": 41982699.0, "step": 24200 }, { "entropy": 5.501750469207764, "epoch": 1.8832522855475589, "grad_norm": 1.2109375, "learning_rate": 0.0004642264474547824, "loss": 5.1158, "mean_token_accuracy": 0.18840053528547288, "num_tokens": 41991441.0, "step": 24205 }, { "entropy": 5.409266805648803, "epoch": 1.8836413149192763, "grad_norm": 1.5, "learning_rate": 0.00046421145119011556, "loss": 5.1069, "mean_token_accuracy": 0.1937762826681137, "num_tokens": 42000683.0, "step": 24210 }, { "entropy": 5.4898370742797855, "epoch": 1.884030344290994, "grad_norm": 1.3125, "learning_rate": 0.000464196452054466, "loss": 5.2135, "mean_token_accuracy": 0.18022435009479523, "num_tokens": 42009895.0, "step": 24215 }, { "entropy": 5.475457000732422, "epoch": 1.8844193736627115, "grad_norm": 1.2578125, "learning_rate": 0.0004641814500480615, "loss": 5.0522, "mean_token_accuracy": 0.18679832071065902, "num_tokens": 42018086.0, "step": 24220 }, { "entropy": 5.497677850723266, "epoch": 1.884808403034429, "grad_norm": 1.390625, "learning_rate": 0.0004641664451711296, "loss": 5.2198, "mean_token_accuracy": 0.1766365259885788, "num_tokens": 42026959.0, "step": 24225 }, { "entropy": 5.376885557174683, "epoch": 1.8851974324061467, "grad_norm": 1.2109375, "learning_rate": 0.00046415143742389793, "loss": 5.1518, "mean_token_accuracy": 0.18459801077842714, "num_tokens": 42035641.0, "step": 24230 }, { "entropy": 5.471140909194946, "epoch": 1.8855864617778644, "grad_norm": 1.25, "learning_rate": 0.0004641364268065943, "loss": 5.1209, "mean_token_accuracy": 0.1894539326429367, "num_tokens": 42044565.0, "step": 24235 }, { "entropy": 5.564204502105713, "epoch": 1.8859754911495816, "grad_norm": 1.4453125, "learning_rate": 0.00046412141331944644, "loss": 5.1985, "mean_token_accuracy": 0.18171575367450715, "num_tokens": 42053088.0, "step": 24240 }, { "entropy": 5.476246404647827, "epoch": 1.8863645205212993, "grad_norm": 1.2421875, "learning_rate": 0.00046410639696268206, "loss": 5.179, "mean_token_accuracy": 0.1850145012140274, "num_tokens": 42061880.0, "step": 24245 }, { "entropy": 5.396104431152343, "epoch": 1.886753549893017, "grad_norm": 1.25, "learning_rate": 0.0004640913777365292, "loss": 5.1479, "mean_token_accuracy": 0.1812047079205513, "num_tokens": 42070767.0, "step": 24250 }, { "entropy": 5.460137462615966, "epoch": 1.8871425792647345, "grad_norm": 1.3984375, "learning_rate": 0.00046407635564121565, "loss": 5.1456, "mean_token_accuracy": 0.18472465127706528, "num_tokens": 42080037.0, "step": 24255 }, { "entropy": 5.489675855636596, "epoch": 1.887531608636452, "grad_norm": 1.4921875, "learning_rate": 0.00046406133067696936, "loss": 5.119, "mean_token_accuracy": 0.18877738565206528, "num_tokens": 42088372.0, "step": 24260 }, { "entropy": 5.418736791610717, "epoch": 1.8879206380081697, "grad_norm": 1.453125, "learning_rate": 0.0004640463028440182, "loss": 5.1241, "mean_token_accuracy": 0.1886160746216774, "num_tokens": 42096550.0, "step": 24265 }, { "entropy": 5.472839593887329, "epoch": 1.8883096673798871, "grad_norm": 1.6328125, "learning_rate": 0.0004640312721425904, "loss": 5.1559, "mean_token_accuracy": 0.19066636264324188, "num_tokens": 42105660.0, "step": 24270 }, { "entropy": 5.49428915977478, "epoch": 1.8886986967516046, "grad_norm": 1.359375, "learning_rate": 0.0004640162385729139, "loss": 5.1125, "mean_token_accuracy": 0.19055162221193314, "num_tokens": 42114586.0, "step": 24275 }, { "entropy": 5.450196552276611, "epoch": 1.8890877261233223, "grad_norm": 1.2734375, "learning_rate": 0.0004640012021352168, "loss": 5.1452, "mean_token_accuracy": 0.19101667255163193, "num_tokens": 42123104.0, "step": 24280 }, { "entropy": 5.55902247428894, "epoch": 1.88947675549504, "grad_norm": 1.1875, "learning_rate": 0.0004639861628297273, "loss": 5.2758, "mean_token_accuracy": 0.17615424245595931, "num_tokens": 42132127.0, "step": 24285 }, { "entropy": 5.5298919677734375, "epoch": 1.8898657848667575, "grad_norm": 1.2734375, "learning_rate": 0.00046397112065667354, "loss": 5.2409, "mean_token_accuracy": 0.17821563631296158, "num_tokens": 42141586.0, "step": 24290 }, { "entropy": 5.467160224914551, "epoch": 1.890254814238475, "grad_norm": 1.328125, "learning_rate": 0.00046395607561628387, "loss": 5.1787, "mean_token_accuracy": 0.18007429987192153, "num_tokens": 42151003.0, "step": 24295 }, { "entropy": 5.493098258972168, "epoch": 1.8906438436101927, "grad_norm": 1.3515625, "learning_rate": 0.00046394102770878643, "loss": 5.1853, "mean_token_accuracy": 0.18469370603561402, "num_tokens": 42159291.0, "step": 24300 }, { "entropy": 5.5369429111480715, "epoch": 1.8910328729819101, "grad_norm": 1.2734375, "learning_rate": 0.00046392597693440974, "loss": 5.2629, "mean_token_accuracy": 0.17496658116579056, "num_tokens": 42167925.0, "step": 24305 }, { "entropy": 5.500406694412232, "epoch": 1.8914219023536276, "grad_norm": 1.265625, "learning_rate": 0.0004639109232933819, "loss": 5.1572, "mean_token_accuracy": 0.18934030085802078, "num_tokens": 42175866.0, "step": 24310 }, { "entropy": 5.455942058563233, "epoch": 1.8918109317253453, "grad_norm": 1.234375, "learning_rate": 0.0004638958667859316, "loss": 5.1324, "mean_token_accuracy": 0.200722573697567, "num_tokens": 42184233.0, "step": 24315 }, { "entropy": 5.477989721298218, "epoch": 1.8921999610970628, "grad_norm": 1.2578125, "learning_rate": 0.0004638808074122872, "loss": 5.209, "mean_token_accuracy": 0.18311432600021363, "num_tokens": 42192972.0, "step": 24320 }, { "entropy": 5.436160755157471, "epoch": 1.8925889904687803, "grad_norm": 1.2734375, "learning_rate": 0.0004638657451726771, "loss": 5.0976, "mean_token_accuracy": 0.18958324790000916, "num_tokens": 42201380.0, "step": 24325 }, { "entropy": 5.444985818862915, "epoch": 1.892978019840498, "grad_norm": 1.2265625, "learning_rate": 0.00046385068006732995, "loss": 5.1742, "mean_token_accuracy": 0.19034308940172195, "num_tokens": 42209276.0, "step": 24330 }, { "entropy": 5.585738563537598, "epoch": 1.8933670492122157, "grad_norm": 1.4453125, "learning_rate": 0.00046383561209647437, "loss": 5.3202, "mean_token_accuracy": 0.1718480780720711, "num_tokens": 42218682.0, "step": 24335 }, { "entropy": 5.660860776901245, "epoch": 1.8937560785839331, "grad_norm": 1.3203125, "learning_rate": 0.00046382054126033884, "loss": 5.3636, "mean_token_accuracy": 0.1705701857805252, "num_tokens": 42226692.0, "step": 24340 }, { "entropy": 5.539766120910644, "epoch": 1.8941451079556506, "grad_norm": 1.4296875, "learning_rate": 0.0004638054675591523, "loss": 5.2864, "mean_token_accuracy": 0.16784291565418244, "num_tokens": 42235582.0, "step": 24345 }, { "entropy": 5.549159574508667, "epoch": 1.8945341373273683, "grad_norm": 1.2578125, "learning_rate": 0.0004637903909931432, "loss": 5.1455, "mean_token_accuracy": 0.18435688316822052, "num_tokens": 42244354.0, "step": 24350 }, { "entropy": 5.465712451934815, "epoch": 1.8949231666990858, "grad_norm": 1.7265625, "learning_rate": 0.0004637753115625404, "loss": 5.0755, "mean_token_accuracy": 0.19005461782217026, "num_tokens": 42253062.0, "step": 24355 }, { "entropy": 5.432435417175293, "epoch": 1.8953121960708033, "grad_norm": 1.28125, "learning_rate": 0.0004637602292675726, "loss": 5.2125, "mean_token_accuracy": 0.17695188224315644, "num_tokens": 42262380.0, "step": 24360 }, { "entropy": 5.502747201919556, "epoch": 1.895701225442521, "grad_norm": 1.28125, "learning_rate": 0.0004637451441084689, "loss": 5.0929, "mean_token_accuracy": 0.19193921536207198, "num_tokens": 42270262.0, "step": 24365 }, { "entropy": 5.4889427661895756, "epoch": 1.8960902548142384, "grad_norm": 1.2734375, "learning_rate": 0.0004637300560854581, "loss": 5.2289, "mean_token_accuracy": 0.18317514657974243, "num_tokens": 42278935.0, "step": 24370 }, { "entropy": 5.4823219776153564, "epoch": 1.896479284185956, "grad_norm": 1.265625, "learning_rate": 0.000463714965198769, "loss": 5.1278, "mean_token_accuracy": 0.18473281264305114, "num_tokens": 42287354.0, "step": 24375 }, { "entropy": 5.51255464553833, "epoch": 1.8968683135576736, "grad_norm": 1.265625, "learning_rate": 0.0004636998714486307, "loss": 5.1323, "mean_token_accuracy": 0.1845674231648445, "num_tokens": 42296475.0, "step": 24380 }, { "entropy": 5.545323514938355, "epoch": 1.8972573429293913, "grad_norm": 1.328125, "learning_rate": 0.00046368477483527224, "loss": 5.2555, "mean_token_accuracy": 0.17985828667879106, "num_tokens": 42305306.0, "step": 24385 }, { "entropy": 5.4085352420806885, "epoch": 1.8976463723011088, "grad_norm": 1.2578125, "learning_rate": 0.0004636696753589226, "loss": 5.1971, "mean_token_accuracy": 0.17815522998571395, "num_tokens": 42314827.0, "step": 24390 }, { "entropy": 5.374692773818969, "epoch": 1.8980354016728263, "grad_norm": 1.296875, "learning_rate": 0.0004636545730198109, "loss": 5.0799, "mean_token_accuracy": 0.19325724989175797, "num_tokens": 42323396.0, "step": 24395 }, { "entropy": 5.514501571655273, "epoch": 1.898424431044544, "grad_norm": 1.421875, "learning_rate": 0.00046363946781816643, "loss": 5.1626, "mean_token_accuracy": 0.18632536083459855, "num_tokens": 42331402.0, "step": 24400 }, { "entropy": 5.396797752380371, "epoch": 1.8988134604162614, "grad_norm": 1.3125, "learning_rate": 0.00046362435975421816, "loss": 5.1078, "mean_token_accuracy": 0.19595541805028915, "num_tokens": 42339458.0, "step": 24405 }, { "entropy": 5.496005010604859, "epoch": 1.899202489787979, "grad_norm": 1.265625, "learning_rate": 0.00046360924882819554, "loss": 5.2025, "mean_token_accuracy": 0.18168049454689025, "num_tokens": 42346713.0, "step": 24410 }, { "entropy": 5.41813178062439, "epoch": 1.8995915191596966, "grad_norm": 1.2265625, "learning_rate": 0.0004635941350403277, "loss": 5.0804, "mean_token_accuracy": 0.18585621565580368, "num_tokens": 42355429.0, "step": 24415 }, { "entropy": 5.395499038696289, "epoch": 1.899980548531414, "grad_norm": 1.453125, "learning_rate": 0.0004635790183908442, "loss": 5.1331, "mean_token_accuracy": 0.18568074107170104, "num_tokens": 42364228.0, "step": 24420 }, { "entropy": 5.420674848556518, "epoch": 1.9003695779031315, "grad_norm": 1.2734375, "learning_rate": 0.00046356389887997415, "loss": 5.0443, "mean_token_accuracy": 0.18802448660135268, "num_tokens": 42372837.0, "step": 24425 }, { "entropy": 5.434771776199341, "epoch": 1.9007586072748492, "grad_norm": 1.25, "learning_rate": 0.00046354877650794707, "loss": 5.0797, "mean_token_accuracy": 0.19657609462738038, "num_tokens": 42381792.0, "step": 24430 }, { "entropy": 5.478389501571655, "epoch": 1.901147636646567, "grad_norm": 1.3125, "learning_rate": 0.00046353365127499235, "loss": 5.211, "mean_token_accuracy": 0.17944760024547576, "num_tokens": 42390650.0, "step": 24435 }, { "entropy": 5.468466567993164, "epoch": 1.9015366660182844, "grad_norm": 1.3125, "learning_rate": 0.0004635185231813396, "loss": 5.1482, "mean_token_accuracy": 0.19282734990119935, "num_tokens": 42399253.0, "step": 24440 }, { "entropy": 5.567887878417968, "epoch": 1.901925695390002, "grad_norm": 1.375, "learning_rate": 0.0004635033922272183, "loss": 5.365, "mean_token_accuracy": 0.1687123730778694, "num_tokens": 42407916.0, "step": 24445 }, { "entropy": 5.407737588882446, "epoch": 1.9023147247617196, "grad_norm": 1.2890625, "learning_rate": 0.00046348825841285813, "loss": 5.0707, "mean_token_accuracy": 0.19327960461378096, "num_tokens": 42416151.0, "step": 24450 }, { "entropy": 5.5105267524719235, "epoch": 1.902703754133437, "grad_norm": 1.1640625, "learning_rate": 0.0004634731217384886, "loss": 5.2865, "mean_token_accuracy": 0.17415828704833985, "num_tokens": 42424845.0, "step": 24455 }, { "entropy": 5.612914991378784, "epoch": 1.9030927835051545, "grad_norm": 1.3359375, "learning_rate": 0.0004634579822043394, "loss": 5.1847, "mean_token_accuracy": 0.17936229556798935, "num_tokens": 42434022.0, "step": 24460 }, { "entropy": 5.56455512046814, "epoch": 1.9034818128768722, "grad_norm": 1.2578125, "learning_rate": 0.00046344283981064035, "loss": 5.2286, "mean_token_accuracy": 0.18321893662214278, "num_tokens": 42443614.0, "step": 24465 }, { "entropy": 5.386825656890869, "epoch": 1.90387084224859, "grad_norm": 1.296875, "learning_rate": 0.00046342769455762114, "loss": 5.0531, "mean_token_accuracy": 0.18732108920812607, "num_tokens": 42452389.0, "step": 24470 }, { "entropy": 5.42635440826416, "epoch": 1.9042598716203072, "grad_norm": 1.265625, "learning_rate": 0.0004634125464455116, "loss": 5.1537, "mean_token_accuracy": 0.1788182109594345, "num_tokens": 42460796.0, "step": 24475 }, { "entropy": 5.5532256126403805, "epoch": 1.9046489009920249, "grad_norm": 1.265625, "learning_rate": 0.00046339739547454146, "loss": 5.2471, "mean_token_accuracy": 0.18061573207378387, "num_tokens": 42470108.0, "step": 24480 }, { "entropy": 5.478749227523804, "epoch": 1.9050379303637426, "grad_norm": 1.2421875, "learning_rate": 0.00046338224164494074, "loss": 5.1837, "mean_token_accuracy": 0.1765371322631836, "num_tokens": 42478361.0, "step": 24485 }, { "entropy": 5.52775468826294, "epoch": 1.90542695973546, "grad_norm": 1.2265625, "learning_rate": 0.00046336708495693933, "loss": 5.2449, "mean_token_accuracy": 0.1775071680545807, "num_tokens": 42486254.0, "step": 24490 }, { "entropy": 5.452859020233154, "epoch": 1.9058159891071775, "grad_norm": 1.390625, "learning_rate": 0.00046335192541076725, "loss": 5.0929, "mean_token_accuracy": 0.19359275698661804, "num_tokens": 42495379.0, "step": 24495 }, { "entropy": 5.4394957542419435, "epoch": 1.9062050184788952, "grad_norm": 1.265625, "learning_rate": 0.0004633367630066545, "loss": 5.1654, "mean_token_accuracy": 0.18104279637336732, "num_tokens": 42503777.0, "step": 24500 }, { "entropy": 5.51709017753601, "epoch": 1.9065940478506127, "grad_norm": 1.3046875, "learning_rate": 0.00046332159774483116, "loss": 5.242, "mean_token_accuracy": 0.17623042762279512, "num_tokens": 42512557.0, "step": 24505 }, { "entropy": 5.469807434082031, "epoch": 1.9069830772223302, "grad_norm": 1.34375, "learning_rate": 0.0004633064296255273, "loss": 5.1528, "mean_token_accuracy": 0.18538284301757812, "num_tokens": 42521245.0, "step": 24510 }, { "entropy": 5.49872670173645, "epoch": 1.9073721065940479, "grad_norm": 1.3125, "learning_rate": 0.00046329125864897307, "loss": 5.1296, "mean_token_accuracy": 0.1875286504626274, "num_tokens": 42529726.0, "step": 24515 }, { "entropy": 5.46023588180542, "epoch": 1.9077611359657656, "grad_norm": 1.265625, "learning_rate": 0.0004632760848153987, "loss": 5.1425, "mean_token_accuracy": 0.18572385460138321, "num_tokens": 42538376.0, "step": 24520 }, { "entropy": 5.471598863601685, "epoch": 1.9081501653374828, "grad_norm": 1.3359375, "learning_rate": 0.0004632609081250345, "loss": 5.1805, "mean_token_accuracy": 0.1787942185997963, "num_tokens": 42546977.0, "step": 24525 }, { "entropy": 5.5511139869689945, "epoch": 1.9085391947092005, "grad_norm": 1.3046875, "learning_rate": 0.00046324572857811054, "loss": 5.1785, "mean_token_accuracy": 0.17790181338787078, "num_tokens": 42555531.0, "step": 24530 }, { "entropy": 5.515816307067871, "epoch": 1.9089282240809182, "grad_norm": 1.234375, "learning_rate": 0.0004632305461748573, "loss": 5.2135, "mean_token_accuracy": 0.18481094837188722, "num_tokens": 42564803.0, "step": 24535 }, { "entropy": 5.518814992904663, "epoch": 1.9093172534526357, "grad_norm": 1.2578125, "learning_rate": 0.00046321536091550517, "loss": 5.2119, "mean_token_accuracy": 0.1798251450061798, "num_tokens": 42573560.0, "step": 24540 }, { "entropy": 5.49469313621521, "epoch": 1.9097062828243532, "grad_norm": 1.203125, "learning_rate": 0.0004632001728002845, "loss": 5.2082, "mean_token_accuracy": 0.18028008043766022, "num_tokens": 42582177.0, "step": 24545 }, { "entropy": 5.475135850906372, "epoch": 1.9100953121960709, "grad_norm": 1.21875, "learning_rate": 0.0004631849818294257, "loss": 5.1803, "mean_token_accuracy": 0.1802906021475792, "num_tokens": 42590874.0, "step": 24550 }, { "entropy": 5.43516354560852, "epoch": 1.9104843415677883, "grad_norm": 1.2890625, "learning_rate": 0.00046316978800315934, "loss": 5.0961, "mean_token_accuracy": 0.19092043191194535, "num_tokens": 42599644.0, "step": 24555 }, { "entropy": 5.4462066173553465, "epoch": 1.9108733709395058, "grad_norm": 1.265625, "learning_rate": 0.000463154591321716, "loss": 5.1619, "mean_token_accuracy": 0.1807519018650055, "num_tokens": 42609207.0, "step": 24560 }, { "entropy": 5.527137613296508, "epoch": 1.9112624003112235, "grad_norm": 1.2265625, "learning_rate": 0.00046313939178532624, "loss": 5.2717, "mean_token_accuracy": 0.17353625148534774, "num_tokens": 42618669.0, "step": 24565 }, { "entropy": 5.584531259536743, "epoch": 1.9116514296829412, "grad_norm": 1.2421875, "learning_rate": 0.0004631241893942206, "loss": 5.1929, "mean_token_accuracy": 0.17800243347883224, "num_tokens": 42628433.0, "step": 24570 }, { "entropy": 5.516142463684082, "epoch": 1.9120404590546585, "grad_norm": 1.2578125, "learning_rate": 0.00046310898414862983, "loss": 5.1395, "mean_token_accuracy": 0.1809336870908737, "num_tokens": 42636839.0, "step": 24575 }, { "entropy": 5.437991666793823, "epoch": 1.9124294884263762, "grad_norm": 1.2265625, "learning_rate": 0.0004630937760487847, "loss": 5.129, "mean_token_accuracy": 0.187970107793808, "num_tokens": 42645328.0, "step": 24580 }, { "entropy": 5.49188461303711, "epoch": 1.9128185177980939, "grad_norm": 1.3515625, "learning_rate": 0.0004630785650949158, "loss": 5.2445, "mean_token_accuracy": 0.17445521652698517, "num_tokens": 42653883.0, "step": 24585 }, { "entropy": 5.4548211097717285, "epoch": 1.9132075471698113, "grad_norm": 1.265625, "learning_rate": 0.0004630633512872541, "loss": 5.1874, "mean_token_accuracy": 0.18122837394475938, "num_tokens": 42662364.0, "step": 24590 }, { "entropy": 5.453305912017822, "epoch": 1.9135965765415288, "grad_norm": 1.1875, "learning_rate": 0.00046304813462603035, "loss": 5.051, "mean_token_accuracy": 0.19155173301696776, "num_tokens": 42670424.0, "step": 24595 }, { "entropy": 5.4290824890136715, "epoch": 1.9139856059132465, "grad_norm": 1.34375, "learning_rate": 0.0004630329151114754, "loss": 5.1229, "mean_token_accuracy": 0.18964357376098634, "num_tokens": 42679494.0, "step": 24600 }, { "entropy": 5.596363544464111, "epoch": 1.914374635284964, "grad_norm": 1.6875, "learning_rate": 0.00046301769274382034, "loss": 5.3167, "mean_token_accuracy": 0.17971367239952088, "num_tokens": 42688042.0, "step": 24605 }, { "entropy": 5.603968667984009, "epoch": 1.9147636646566815, "grad_norm": 1.7109375, "learning_rate": 0.0004630024675232961, "loss": 5.2719, "mean_token_accuracy": 0.18046784549951553, "num_tokens": 42696859.0, "step": 24610 }, { "entropy": 5.53309440612793, "epoch": 1.9151526940283992, "grad_norm": 1.1875, "learning_rate": 0.00046298723945013354, "loss": 5.1868, "mean_token_accuracy": 0.17964863777160645, "num_tokens": 42705291.0, "step": 24615 }, { "entropy": 5.423347854614258, "epoch": 1.9155417234001169, "grad_norm": 1.25, "learning_rate": 0.0004629720085245639, "loss": 5.2011, "mean_token_accuracy": 0.18143181949853898, "num_tokens": 42713777.0, "step": 24620 }, { "entropy": 5.494828701019287, "epoch": 1.9159307527718341, "grad_norm": 1.25, "learning_rate": 0.0004629567747468182, "loss": 5.2383, "mean_token_accuracy": 0.18515785932540893, "num_tokens": 42722373.0, "step": 24625 }, { "entropy": 5.534469270706177, "epoch": 1.9163197821435518, "grad_norm": 1.1953125, "learning_rate": 0.0004629415381171276, "loss": 5.1088, "mean_token_accuracy": 0.1884836584329605, "num_tokens": 42730791.0, "step": 24630 }, { "entropy": 5.438490390777588, "epoch": 1.9167088115152695, "grad_norm": 1.390625, "learning_rate": 0.00046292629863572325, "loss": 5.2066, "mean_token_accuracy": 0.18314601927995683, "num_tokens": 42739448.0, "step": 24635 }, { "entropy": 5.501352977752686, "epoch": 1.917097840886987, "grad_norm": 1.390625, "learning_rate": 0.0004629110563028365, "loss": 5.2018, "mean_token_accuracy": 0.17880702912807464, "num_tokens": 42748757.0, "step": 24640 }, { "entropy": 5.512107419967651, "epoch": 1.9174868702587045, "grad_norm": 1.234375, "learning_rate": 0.0004628958111186985, "loss": 5.1, "mean_token_accuracy": 0.18767209500074386, "num_tokens": 42757166.0, "step": 24645 }, { "entropy": 5.474408054351807, "epoch": 1.9178758996304222, "grad_norm": 1.28125, "learning_rate": 0.0004628805630835407, "loss": 5.1389, "mean_token_accuracy": 0.18309541642665864, "num_tokens": 42765671.0, "step": 24650 }, { "entropy": 5.4812366485595705, "epoch": 1.9182649290021396, "grad_norm": 1.2734375, "learning_rate": 0.0004628653121975944, "loss": 5.1758, "mean_token_accuracy": 0.18782023191452027, "num_tokens": 42774499.0, "step": 24655 }, { "entropy": 5.484792852401734, "epoch": 1.918653958373857, "grad_norm": 1.2578125, "learning_rate": 0.000462850058461091, "loss": 5.1525, "mean_token_accuracy": 0.18305207490921022, "num_tokens": 42783237.0, "step": 24660 }, { "entropy": 5.488727712631226, "epoch": 1.9190429877455748, "grad_norm": 1.3125, "learning_rate": 0.0004628348018742619, "loss": 5.1134, "mean_token_accuracy": 0.18319776505231858, "num_tokens": 42791217.0, "step": 24665 }, { "entropy": 5.384256601333618, "epoch": 1.9194320171172925, "grad_norm": 1.5, "learning_rate": 0.0004628195424373387, "loss": 5.119, "mean_token_accuracy": 0.18912703692913055, "num_tokens": 42799885.0, "step": 24670 }, { "entropy": 5.423672819137574, "epoch": 1.91982104648901, "grad_norm": 1.296875, "learning_rate": 0.00046280428015055286, "loss": 5.1474, "mean_token_accuracy": 0.18288756757974625, "num_tokens": 42809141.0, "step": 24675 }, { "entropy": 5.556517219543457, "epoch": 1.9202100758607274, "grad_norm": 1.234375, "learning_rate": 0.00046278901501413606, "loss": 5.2235, "mean_token_accuracy": 0.18359093219041825, "num_tokens": 42817809.0, "step": 24680 }, { "entropy": 5.436758327484131, "epoch": 1.9205991052324451, "grad_norm": 1.4453125, "learning_rate": 0.00046277374702831983, "loss": 5.1055, "mean_token_accuracy": 0.18228615075349808, "num_tokens": 42826813.0, "step": 24685 }, { "entropy": 5.4531676292419435, "epoch": 1.9209881346041626, "grad_norm": 1.3359375, "learning_rate": 0.00046275847619333576, "loss": 5.1598, "mean_token_accuracy": 0.1791495278477669, "num_tokens": 42835325.0, "step": 24690 }, { "entropy": 5.530086278915405, "epoch": 1.92137716397588, "grad_norm": 1.375, "learning_rate": 0.00046274320250941576, "loss": 5.238, "mean_token_accuracy": 0.18319268226623536, "num_tokens": 42843975.0, "step": 24695 }, { "entropy": 5.424391269683838, "epoch": 1.9217661933475978, "grad_norm": 1.234375, "learning_rate": 0.00046272792597679146, "loss": 5.0294, "mean_token_accuracy": 0.1888217270374298, "num_tokens": 42852146.0, "step": 24700 }, { "entropy": 5.459353923797607, "epoch": 1.9221552227193153, "grad_norm": 1.328125, "learning_rate": 0.00046271264659569474, "loss": 5.1883, "mean_token_accuracy": 0.18058166205883025, "num_tokens": 42860958.0, "step": 24705 }, { "entropy": 5.512636327743531, "epoch": 1.9225442520910327, "grad_norm": 1.2109375, "learning_rate": 0.0004626973643663573, "loss": 5.0598, "mean_token_accuracy": 0.19570437222719192, "num_tokens": 42869281.0, "step": 24710 }, { "entropy": 5.451256513595581, "epoch": 1.9229332814627504, "grad_norm": 1.1875, "learning_rate": 0.0004626820792890112, "loss": 5.2038, "mean_token_accuracy": 0.1903185099363327, "num_tokens": 42878359.0, "step": 24715 }, { "entropy": 5.418535757064819, "epoch": 1.9233223108344681, "grad_norm": 1.2109375, "learning_rate": 0.0004626667913638882, "loss": 5.0038, "mean_token_accuracy": 0.19892269521951675, "num_tokens": 42886156.0, "step": 24720 }, { "entropy": 5.358740997314453, "epoch": 1.9237113402061856, "grad_norm": 1.3203125, "learning_rate": 0.0004626515005912203, "loss": 5.0377, "mean_token_accuracy": 0.19124755412340164, "num_tokens": 42894970.0, "step": 24725 }, { "entropy": 5.435474300384522, "epoch": 1.924100369577903, "grad_norm": 1.4921875, "learning_rate": 0.0004626362069712397, "loss": 5.1916, "mean_token_accuracy": 0.18195788711309432, "num_tokens": 42903319.0, "step": 24730 }, { "entropy": 5.408607864379883, "epoch": 1.9244893989496208, "grad_norm": 1.3671875, "learning_rate": 0.0004626209105041782, "loss": 5.1895, "mean_token_accuracy": 0.18333597332239152, "num_tokens": 42911912.0, "step": 24735 }, { "entropy": 5.517161178588867, "epoch": 1.9248784283213383, "grad_norm": 1.3125, "learning_rate": 0.000462605611190268, "loss": 5.1225, "mean_token_accuracy": 0.19310240298509598, "num_tokens": 42920329.0, "step": 24740 }, { "entropy": 5.461654901504517, "epoch": 1.9252674576930557, "grad_norm": 1.3046875, "learning_rate": 0.00046259030902974133, "loss": 5.1434, "mean_token_accuracy": 0.18402402400970458, "num_tokens": 42928422.0, "step": 24745 }, { "entropy": 5.490858936309815, "epoch": 1.9256564870647734, "grad_norm": 1.21875, "learning_rate": 0.0004625750040228302, "loss": 5.1313, "mean_token_accuracy": 0.18420308083295822, "num_tokens": 42937016.0, "step": 24750 }, { "entropy": 5.432418537139893, "epoch": 1.926045516436491, "grad_norm": 1.234375, "learning_rate": 0.00046255969616976704, "loss": 5.1098, "mean_token_accuracy": 0.18644391596317292, "num_tokens": 42945209.0, "step": 24755 }, { "entropy": 5.484076738357544, "epoch": 1.9264345458082084, "grad_norm": 1.2265625, "learning_rate": 0.000462544385470784, "loss": 5.1579, "mean_token_accuracy": 0.17972705364227295, "num_tokens": 42953798.0, "step": 24760 }, { "entropy": 5.473036479949951, "epoch": 1.926823575179926, "grad_norm": 1.2421875, "learning_rate": 0.0004625290719261134, "loss": 5.1362, "mean_token_accuracy": 0.18376094251871108, "num_tokens": 42961780.0, "step": 24765 }, { "entropy": 5.464092159271241, "epoch": 1.9272126045516438, "grad_norm": 1.28125, "learning_rate": 0.0004625137555359876, "loss": 5.212, "mean_token_accuracy": 0.1846457153558731, "num_tokens": 42970087.0, "step": 24770 }, { "entropy": 5.4487128257751465, "epoch": 1.9276016339233613, "grad_norm": 1.2734375, "learning_rate": 0.00046249843630063905, "loss": 5.2009, "mean_token_accuracy": 0.1820971041917801, "num_tokens": 42978732.0, "step": 24775 }, { "entropy": 5.505410099029541, "epoch": 1.9279906632950787, "grad_norm": 1.3359375, "learning_rate": 0.0004624831142203001, "loss": 5.2219, "mean_token_accuracy": 0.18028130978345872, "num_tokens": 42986899.0, "step": 24780 }, { "entropy": 5.5234497547149655, "epoch": 1.9283796926667964, "grad_norm": 1.1953125, "learning_rate": 0.00046246778929520346, "loss": 5.1298, "mean_token_accuracy": 0.18116574585437775, "num_tokens": 42995047.0, "step": 24785 }, { "entropy": 5.463469409942627, "epoch": 1.928768722038514, "grad_norm": 1.265625, "learning_rate": 0.0004624524615255814, "loss": 5.2048, "mean_token_accuracy": 0.18570882827043533, "num_tokens": 43004377.0, "step": 24790 }, { "entropy": 5.495899438858032, "epoch": 1.9291577514102314, "grad_norm": 1.1640625, "learning_rate": 0.00046243713091166655, "loss": 5.2328, "mean_token_accuracy": 0.1802689641714096, "num_tokens": 43013610.0, "step": 24795 }, { "entropy": 5.47877869606018, "epoch": 1.929546780781949, "grad_norm": 1.2734375, "learning_rate": 0.0004624217974536916, "loss": 5.1571, "mean_token_accuracy": 0.18857490122318268, "num_tokens": 43022512.0, "step": 24800 }, { "entropy": 5.400929546356201, "epoch": 1.9299358101536666, "grad_norm": 1.25, "learning_rate": 0.00046240646115188925, "loss": 5.0671, "mean_token_accuracy": 0.18943429738283157, "num_tokens": 43030588.0, "step": 24805 }, { "entropy": 5.542538022994995, "epoch": 1.930324839525384, "grad_norm": 1.359375, "learning_rate": 0.0004623911220064921, "loss": 5.1958, "mean_token_accuracy": 0.1839794099330902, "num_tokens": 43038717.0, "step": 24810 }, { "entropy": 5.479157590866089, "epoch": 1.9307138688971017, "grad_norm": 1.3359375, "learning_rate": 0.00046237578001773297, "loss": 5.042, "mean_token_accuracy": 0.19117599427700044, "num_tokens": 43046736.0, "step": 24815 }, { "entropy": 5.363182115554809, "epoch": 1.9311028982688194, "grad_norm": 1.1953125, "learning_rate": 0.00046236043518584454, "loss": 4.9983, "mean_token_accuracy": 0.1980949565768242, "num_tokens": 43054773.0, "step": 24820 }, { "entropy": 5.445832061767578, "epoch": 1.931491927640537, "grad_norm": 1.25, "learning_rate": 0.0004623450875110597, "loss": 5.1518, "mean_token_accuracy": 0.18135943859815598, "num_tokens": 43062983.0, "step": 24825 }, { "entropy": 5.472748517990112, "epoch": 1.9318809570122544, "grad_norm": 1.34375, "learning_rate": 0.00046232973699361147, "loss": 5.093, "mean_token_accuracy": 0.1839778333902359, "num_tokens": 43071161.0, "step": 24830 }, { "entropy": 5.550309514999389, "epoch": 1.932269986383972, "grad_norm": 1.28125, "learning_rate": 0.0004623143836337326, "loss": 5.3224, "mean_token_accuracy": 0.1758324071764946, "num_tokens": 43080514.0, "step": 24835 }, { "entropy": 5.471392488479614, "epoch": 1.9326590157556895, "grad_norm": 1.28125, "learning_rate": 0.00046229902743165607, "loss": 5.0756, "mean_token_accuracy": 0.1939949944615364, "num_tokens": 43089177.0, "step": 24840 }, { "entropy": 5.497359657287598, "epoch": 1.933048045127407, "grad_norm": 1.375, "learning_rate": 0.0004622836683876149, "loss": 5.2299, "mean_token_accuracy": 0.1805806577205658, "num_tokens": 43097722.0, "step": 24845 }, { "entropy": 5.474992847442627, "epoch": 1.9334370744991247, "grad_norm": 1.4296875, "learning_rate": 0.0004622683065018422, "loss": 5.1161, "mean_token_accuracy": 0.1871684804558754, "num_tokens": 43106203.0, "step": 24850 }, { "entropy": 5.415040302276611, "epoch": 1.9338261038708422, "grad_norm": 1.28125, "learning_rate": 0.00046225294177457105, "loss": 5.1944, "mean_token_accuracy": 0.18180101811885835, "num_tokens": 43114607.0, "step": 24855 }, { "entropy": 5.596254777908325, "epoch": 1.9342151332425597, "grad_norm": 1.1640625, "learning_rate": 0.00046223757420603445, "loss": 5.2964, "mean_token_accuracy": 0.17320114225149155, "num_tokens": 43123179.0, "step": 24860 }, { "entropy": 5.5797360897064205, "epoch": 1.9346041626142774, "grad_norm": 1.1953125, "learning_rate": 0.0004622222037964658, "loss": 5.1363, "mean_token_accuracy": 0.18786537647247314, "num_tokens": 43130883.0, "step": 24865 }, { "entropy": 5.347901010513306, "epoch": 1.934993191985995, "grad_norm": 1.1875, "learning_rate": 0.00046220683054609815, "loss": 4.898, "mean_token_accuracy": 0.20393352657556535, "num_tokens": 43139812.0, "step": 24870 }, { "entropy": 5.465852975845337, "epoch": 1.9353822213577125, "grad_norm": 1.3671875, "learning_rate": 0.00046219145445516483, "loss": 5.2255, "mean_token_accuracy": 0.17730635553598403, "num_tokens": 43148756.0, "step": 24875 }, { "entropy": 5.497779655456543, "epoch": 1.93577125072943, "grad_norm": 1.2421875, "learning_rate": 0.00046217607552389905, "loss": 5.2146, "mean_token_accuracy": 0.17359041273593903, "num_tokens": 43158131.0, "step": 24880 }, { "entropy": 5.455423974990845, "epoch": 1.9361602801011477, "grad_norm": 1.265625, "learning_rate": 0.00046216069375253435, "loss": 4.9887, "mean_token_accuracy": 0.1951142132282257, "num_tokens": 43166400.0, "step": 24885 }, { "entropy": 5.480981111526489, "epoch": 1.9365493094728652, "grad_norm": 1.25, "learning_rate": 0.000462145309141304, "loss": 5.1182, "mean_token_accuracy": 0.18427708446979524, "num_tokens": 43175265.0, "step": 24890 }, { "entropy": 5.396628522872925, "epoch": 1.9369383388445827, "grad_norm": 1.21875, "learning_rate": 0.0004621299216904414, "loss": 5.1811, "mean_token_accuracy": 0.17596068531274794, "num_tokens": 43183735.0, "step": 24895 }, { "entropy": 5.5798238754272464, "epoch": 1.9373273682163004, "grad_norm": 1.2265625, "learning_rate": 0.00046211453140018006, "loss": 5.2497, "mean_token_accuracy": 0.1837347626686096, "num_tokens": 43192217.0, "step": 24900 }, { "entropy": 5.515407609939575, "epoch": 1.937716397588018, "grad_norm": 1.2421875, "learning_rate": 0.0004620991382707537, "loss": 5.1815, "mean_token_accuracy": 0.1841086506843567, "num_tokens": 43200241.0, "step": 24905 }, { "entropy": 5.478782749176025, "epoch": 1.9381054269597353, "grad_norm": 1.296875, "learning_rate": 0.00046208374230239556, "loss": 5.1517, "mean_token_accuracy": 0.18634021729230882, "num_tokens": 43209111.0, "step": 24910 }, { "entropy": 5.494665193557739, "epoch": 1.938494456331453, "grad_norm": 1.1796875, "learning_rate": 0.0004620683434953394, "loss": 5.2349, "mean_token_accuracy": 0.17851362377405167, "num_tokens": 43219091.0, "step": 24915 }, { "entropy": 5.464920425415039, "epoch": 1.9388834857031707, "grad_norm": 1.25, "learning_rate": 0.00046205294184981896, "loss": 5.0911, "mean_token_accuracy": 0.19249077141284943, "num_tokens": 43227140.0, "step": 24920 }, { "entropy": 5.468114042282105, "epoch": 1.9392725150748882, "grad_norm": 1.2890625, "learning_rate": 0.00046203753736606787, "loss": 5.2459, "mean_token_accuracy": 0.17988266795873642, "num_tokens": 43236356.0, "step": 24925 }, { "entropy": 5.424195194244385, "epoch": 1.9396615444466057, "grad_norm": 1.2109375, "learning_rate": 0.0004620221300443197, "loss": 5.0968, "mean_token_accuracy": 0.19473231136798858, "num_tokens": 43245083.0, "step": 24930 }, { "entropy": 5.49233341217041, "epoch": 1.9400505738183234, "grad_norm": 1.3046875, "learning_rate": 0.0004620067198848086, "loss": 5.1954, "mean_token_accuracy": 0.18348480612039567, "num_tokens": 43253042.0, "step": 24935 }, { "entropy": 5.408527851104736, "epoch": 1.9404396031900408, "grad_norm": 1.3203125, "learning_rate": 0.00046199130688776805, "loss": 5.1683, "mean_token_accuracy": 0.18580490946769715, "num_tokens": 43261783.0, "step": 24940 }, { "entropy": 5.529404163360596, "epoch": 1.9408286325617583, "grad_norm": 1.1796875, "learning_rate": 0.00046197589105343204, "loss": 5.1488, "mean_token_accuracy": 0.18931350409984588, "num_tokens": 43270286.0, "step": 24945 }, { "entropy": 5.41760516166687, "epoch": 1.941217661933476, "grad_norm": 1.296875, "learning_rate": 0.0004619604723820345, "loss": 5.1864, "mean_token_accuracy": 0.18728157877922058, "num_tokens": 43278402.0, "step": 24950 }, { "entropy": 5.435387325286865, "epoch": 1.9416066913051937, "grad_norm": 1.2578125, "learning_rate": 0.0004619450508738094, "loss": 5.1687, "mean_token_accuracy": 0.1881063312292099, "num_tokens": 43286791.0, "step": 24955 }, { "entropy": 5.484977197647095, "epoch": 1.941995720676911, "grad_norm": 1.2734375, "learning_rate": 0.00046192962652899056, "loss": 5.1544, "mean_token_accuracy": 0.18187614977359773, "num_tokens": 43295317.0, "step": 24960 }, { "entropy": 5.526894474029541, "epoch": 1.9423847500486286, "grad_norm": 1.3984375, "learning_rate": 0.00046191419934781236, "loss": 5.2108, "mean_token_accuracy": 0.18590932637453078, "num_tokens": 43303545.0, "step": 24965 }, { "entropy": 5.493436574935913, "epoch": 1.9427737794203463, "grad_norm": 1.3515625, "learning_rate": 0.0004618987693305086, "loss": 5.2122, "mean_token_accuracy": 0.18237805664539336, "num_tokens": 43311964.0, "step": 24970 }, { "entropy": 5.498593425750732, "epoch": 1.9431628087920638, "grad_norm": 1.375, "learning_rate": 0.0004618833364773135, "loss": 5.176, "mean_token_accuracy": 0.18283374160528182, "num_tokens": 43320137.0, "step": 24975 }, { "entropy": 5.5316297054290775, "epoch": 1.9435518381637813, "grad_norm": 1.484375, "learning_rate": 0.00046186790078846127, "loss": 5.2257, "mean_token_accuracy": 0.18245524019002915, "num_tokens": 43328894.0, "step": 24980 }, { "entropy": 5.4991593837738035, "epoch": 1.943940867535499, "grad_norm": 1.265625, "learning_rate": 0.00046185246226418603, "loss": 5.1266, "mean_token_accuracy": 0.18938162177801132, "num_tokens": 43337269.0, "step": 24985 }, { "entropy": 5.513243675231934, "epoch": 1.9443298969072165, "grad_norm": 1.234375, "learning_rate": 0.00046183702090472206, "loss": 5.1854, "mean_token_accuracy": 0.18574079871177673, "num_tokens": 43345838.0, "step": 24990 }, { "entropy": 5.468989610671997, "epoch": 1.944718926278934, "grad_norm": 1.203125, "learning_rate": 0.0004618215767103037, "loss": 5.2347, "mean_token_accuracy": 0.18680340349674224, "num_tokens": 43354395.0, "step": 24995 }, { "entropy": 5.480809116363526, "epoch": 1.9451079556506516, "grad_norm": 1.1796875, "learning_rate": 0.0004618061296811653, "loss": 5.1397, "mean_token_accuracy": 0.18767135888338088, "num_tokens": 43363320.0, "step": 25000 }, { "entropy": 5.514970827102661, "epoch": 1.9454969850223693, "grad_norm": 1.25, "learning_rate": 0.00046179067981754124, "loss": 5.1652, "mean_token_accuracy": 0.187693490087986, "num_tokens": 43371528.0, "step": 25005 }, { "entropy": 5.496232414245606, "epoch": 1.9458860143940866, "grad_norm": 1.3203125, "learning_rate": 0.00046177522711966584, "loss": 5.1473, "mean_token_accuracy": 0.1826369732618332, "num_tokens": 43380177.0, "step": 25010 }, { "entropy": 5.328496837615967, "epoch": 1.9462750437658043, "grad_norm": 1.25, "learning_rate": 0.00046175977158777377, "loss": 5.0053, "mean_token_accuracy": 0.19852996468544007, "num_tokens": 43387992.0, "step": 25015 }, { "entropy": 5.466800355911255, "epoch": 1.946664073137522, "grad_norm": 1.2890625, "learning_rate": 0.0004617443132220993, "loss": 5.2669, "mean_token_accuracy": 0.17822102457284927, "num_tokens": 43397620.0, "step": 25020 }, { "entropy": 5.478514671325684, "epoch": 1.9470531025092395, "grad_norm": 1.2265625, "learning_rate": 0.00046172885202287717, "loss": 5.0533, "mean_token_accuracy": 0.18851378411054612, "num_tokens": 43407023.0, "step": 25025 }, { "entropy": 5.498660039901734, "epoch": 1.947442131880957, "grad_norm": 1.34375, "learning_rate": 0.00046171338799034194, "loss": 5.1313, "mean_token_accuracy": 0.18287546187639236, "num_tokens": 43415713.0, "step": 25030 }, { "entropy": 5.367970085144043, "epoch": 1.9478311612526746, "grad_norm": 1.203125, "learning_rate": 0.0004616979211247282, "loss": 5.1163, "mean_token_accuracy": 0.1881483241915703, "num_tokens": 43424383.0, "step": 25035 }, { "entropy": 5.423070287704467, "epoch": 1.9482201906243921, "grad_norm": 1.25, "learning_rate": 0.00046168245142627065, "loss": 5.1347, "mean_token_accuracy": 0.19027692824602127, "num_tokens": 43433090.0, "step": 25040 }, { "entropy": 5.482160902023315, "epoch": 1.9486092199961096, "grad_norm": 1.3515625, "learning_rate": 0.0004616669788952041, "loss": 5.1284, "mean_token_accuracy": 0.18089062571525574, "num_tokens": 43442091.0, "step": 25045 }, { "entropy": 5.512087774276734, "epoch": 1.9489982493678273, "grad_norm": 1.28125, "learning_rate": 0.00046165150353176315, "loss": 5.1387, "mean_token_accuracy": 0.19666801244020463, "num_tokens": 43450392.0, "step": 25050 }, { "entropy": 5.405067873001099, "epoch": 1.949387278739545, "grad_norm": 1.1953125, "learning_rate": 0.0004616360253361828, "loss": 5.08, "mean_token_accuracy": 0.18863831907510759, "num_tokens": 43459252.0, "step": 25055 }, { "entropy": 5.472977972030639, "epoch": 1.9497763081112622, "grad_norm": 1.2109375, "learning_rate": 0.00046162054430869777, "loss": 5.2537, "mean_token_accuracy": 0.17645413130521775, "num_tokens": 43467580.0, "step": 25060 }, { "entropy": 5.643496417999268, "epoch": 1.95016533748298, "grad_norm": 1.203125, "learning_rate": 0.000461605060449543, "loss": 5.2674, "mean_token_accuracy": 0.18107384145259858, "num_tokens": 43476879.0, "step": 25065 }, { "entropy": 5.526113700866699, "epoch": 1.9505543668546976, "grad_norm": 1.1953125, "learning_rate": 0.00046158957375895353, "loss": 5.16, "mean_token_accuracy": 0.17806796729564667, "num_tokens": 43485881.0, "step": 25070 }, { "entropy": 5.392427444458008, "epoch": 1.950943396226415, "grad_norm": 1.3046875, "learning_rate": 0.0004615740842371643, "loss": 5.1071, "mean_token_accuracy": 0.1893598437309265, "num_tokens": 43494598.0, "step": 25075 }, { "entropy": 5.509137916564941, "epoch": 1.9513324255981326, "grad_norm": 1.21875, "learning_rate": 0.00046155859188441023, "loss": 5.1881, "mean_token_accuracy": 0.17653862982988358, "num_tokens": 43504638.0, "step": 25080 }, { "entropy": 5.546071195602417, "epoch": 1.9517214549698503, "grad_norm": 1.328125, "learning_rate": 0.0004615430967009265, "loss": 5.2117, "mean_token_accuracy": 0.18373489379882812, "num_tokens": 43512950.0, "step": 25085 }, { "entropy": 5.418782806396484, "epoch": 1.9521104843415678, "grad_norm": 1.1796875, "learning_rate": 0.00046152759868694815, "loss": 5.2165, "mean_token_accuracy": 0.18723226934671403, "num_tokens": 43521383.0, "step": 25090 }, { "entropy": 5.36074743270874, "epoch": 1.9524995137132852, "grad_norm": 1.1796875, "learning_rate": 0.0004615120978427104, "loss": 5.0095, "mean_token_accuracy": 0.19643847793340682, "num_tokens": 43529442.0, "step": 25095 }, { "entropy": 5.478216218948364, "epoch": 1.952888543085003, "grad_norm": 1.296875, "learning_rate": 0.0004614965941684485, "loss": 5.1795, "mean_token_accuracy": 0.19091429561376572, "num_tokens": 43536938.0, "step": 25100 }, { "entropy": 5.39796552658081, "epoch": 1.9532775724567206, "grad_norm": 1.296875, "learning_rate": 0.0004614810876643975, "loss": 5.1791, "mean_token_accuracy": 0.18348912000656128, "num_tokens": 43545337.0, "step": 25105 }, { "entropy": 5.378086519241333, "epoch": 1.953666601828438, "grad_norm": 1.21875, "learning_rate": 0.00046146557833079286, "loss": 5.038, "mean_token_accuracy": 0.1872916415333748, "num_tokens": 43553699.0, "step": 25110 }, { "entropy": 5.501021814346314, "epoch": 1.9540556312001556, "grad_norm": 1.234375, "learning_rate": 0.0004614500661678698, "loss": 5.2748, "mean_token_accuracy": 0.17575658112764359, "num_tokens": 43562545.0, "step": 25115 }, { "entropy": 5.53188796043396, "epoch": 1.9544446605718733, "grad_norm": 1.3203125, "learning_rate": 0.0004614345511758639, "loss": 5.2346, "mean_token_accuracy": 0.18346190303564072, "num_tokens": 43571392.0, "step": 25120 }, { "entropy": 5.431199789047241, "epoch": 1.9548336899435907, "grad_norm": 1.515625, "learning_rate": 0.00046141903335501034, "loss": 5.1522, "mean_token_accuracy": 0.18521708697080613, "num_tokens": 43579864.0, "step": 25125 }, { "entropy": 5.527487087249756, "epoch": 1.9552227193153082, "grad_norm": 1.4921875, "learning_rate": 0.0004614035127055447, "loss": 5.2984, "mean_token_accuracy": 0.17568491399288177, "num_tokens": 43588546.0, "step": 25130 }, { "entropy": 5.474833822250366, "epoch": 1.955611748687026, "grad_norm": 1.2578125, "learning_rate": 0.0004613879892277024, "loss": 5.0982, "mean_token_accuracy": 0.18994525521993638, "num_tokens": 43596582.0, "step": 25135 }, { "entropy": 5.387027025222778, "epoch": 1.9560007780587434, "grad_norm": 1.3359375, "learning_rate": 0.000461372462921719, "loss": 5.2151, "mean_token_accuracy": 0.18022741228342057, "num_tokens": 43605727.0, "step": 25140 }, { "entropy": 5.453405570983887, "epoch": 1.9563898074304609, "grad_norm": 1.203125, "learning_rate": 0.0004613569337878302, "loss": 5.1868, "mean_token_accuracy": 0.17774559408426285, "num_tokens": 43614889.0, "step": 25145 }, { "entropy": 5.449581241607666, "epoch": 1.9567788368021786, "grad_norm": 1.3515625, "learning_rate": 0.0004613414018262715, "loss": 5.1228, "mean_token_accuracy": 0.18792954385280608, "num_tokens": 43624059.0, "step": 25150 }, { "entropy": 5.579153728485108, "epoch": 1.9571678661738963, "grad_norm": 1.2890625, "learning_rate": 0.0004613258670372786, "loss": 5.297, "mean_token_accuracy": 0.18181269913911818, "num_tokens": 43633824.0, "step": 25155 }, { "entropy": 5.387596845626831, "epoch": 1.9575568955456137, "grad_norm": 1.390625, "learning_rate": 0.0004613103294210873, "loss": 5.0741, "mean_token_accuracy": 0.19260424971580506, "num_tokens": 43642010.0, "step": 25160 }, { "entropy": 5.559239864349365, "epoch": 1.9579459249173312, "grad_norm": 1.421875, "learning_rate": 0.00046129478897793323, "loss": 5.306, "mean_token_accuracy": 0.1761642038822174, "num_tokens": 43650828.0, "step": 25165 }, { "entropy": 5.634287643432617, "epoch": 1.958334954289049, "grad_norm": 1.2265625, "learning_rate": 0.00046127924570805236, "loss": 5.1833, "mean_token_accuracy": 0.1872473731637001, "num_tokens": 43659310.0, "step": 25170 }, { "entropy": 5.4130027294158936, "epoch": 1.9587239836607664, "grad_norm": 1.3359375, "learning_rate": 0.0004612636996116803, "loss": 5.0938, "mean_token_accuracy": 0.18490393906831742, "num_tokens": 43668238.0, "step": 25175 }, { "entropy": 5.370238208770752, "epoch": 1.9591130130324839, "grad_norm": 1.1796875, "learning_rate": 0.0004612481506890532, "loss": 5.0466, "mean_token_accuracy": 0.20276857614517213, "num_tokens": 43675748.0, "step": 25180 }, { "entropy": 5.440761518478394, "epoch": 1.9595020424042016, "grad_norm": 1.25, "learning_rate": 0.00046123259894040677, "loss": 5.2315, "mean_token_accuracy": 0.17397599667310715, "num_tokens": 43685750.0, "step": 25185 }, { "entropy": 5.477128410339356, "epoch": 1.959891071775919, "grad_norm": 1.21875, "learning_rate": 0.000461217044365977, "loss": 5.1477, "mean_token_accuracy": 0.18405405133962632, "num_tokens": 43694941.0, "step": 25190 }, { "entropy": 5.537965488433838, "epoch": 1.9602801011476365, "grad_norm": 1.2734375, "learning_rate": 0.0004612014869660002, "loss": 5.2287, "mean_token_accuracy": 0.17738770246505736, "num_tokens": 43703500.0, "step": 25195 }, { "entropy": 5.528535270690918, "epoch": 1.9606691305193542, "grad_norm": 1.2109375, "learning_rate": 0.00046118592674071197, "loss": 5.3071, "mean_token_accuracy": 0.18057193160057067, "num_tokens": 43712235.0, "step": 25200 }, { "entropy": 5.5984885692596436, "epoch": 1.961058159891072, "grad_norm": 1.25, "learning_rate": 0.0004611703636903488, "loss": 5.2721, "mean_token_accuracy": 0.1782281592488289, "num_tokens": 43721047.0, "step": 25205 }, { "entropy": 5.546380043029785, "epoch": 1.9614471892627894, "grad_norm": 1.2890625, "learning_rate": 0.0004611547978151466, "loss": 5.2382, "mean_token_accuracy": 0.18203096091747284, "num_tokens": 43729635.0, "step": 25210 }, { "entropy": 5.488947486877441, "epoch": 1.9618362186345069, "grad_norm": 1.28125, "learning_rate": 0.00046113922911534167, "loss": 5.1541, "mean_token_accuracy": 0.18466203659772873, "num_tokens": 43737748.0, "step": 25215 }, { "entropy": 5.48777437210083, "epoch": 1.9622252480062246, "grad_norm": 1.359375, "learning_rate": 0.0004611236575911702, "loss": 5.1269, "mean_token_accuracy": 0.18876243382692337, "num_tokens": 43745999.0, "step": 25220 }, { "entropy": 5.393968677520752, "epoch": 1.962614277377942, "grad_norm": 1.1953125, "learning_rate": 0.00046110808324286844, "loss": 4.9745, "mean_token_accuracy": 0.19572101384401322, "num_tokens": 43754029.0, "step": 25225 }, { "entropy": 5.441364336013794, "epoch": 1.9630033067496595, "grad_norm": 1.1953125, "learning_rate": 0.00046109250607067275, "loss": 5.1244, "mean_token_accuracy": 0.1899360716342926, "num_tokens": 43762289.0, "step": 25230 }, { "entropy": 5.442074108123779, "epoch": 1.9633923361213772, "grad_norm": 1.2421875, "learning_rate": 0.0004610769260748196, "loss": 5.2412, "mean_token_accuracy": 0.18013914078474044, "num_tokens": 43771479.0, "step": 25235 }, { "entropy": 5.401347732543945, "epoch": 1.9637813654930947, "grad_norm": 1.3203125, "learning_rate": 0.0004610613432555451, "loss": 5.0586, "mean_token_accuracy": 0.19501953721046447, "num_tokens": 43779889.0, "step": 25240 }, { "entropy": 5.503679800033569, "epoch": 1.9641703948648122, "grad_norm": 1.2265625, "learning_rate": 0.00046104575761308597, "loss": 5.1271, "mean_token_accuracy": 0.1913775995373726, "num_tokens": 43788394.0, "step": 25245 }, { "entropy": 5.465291118621826, "epoch": 1.9645594242365298, "grad_norm": 1.3046875, "learning_rate": 0.0004610301691476786, "loss": 5.1863, "mean_token_accuracy": 0.17730966806411744, "num_tokens": 43797188.0, "step": 25250 }, { "entropy": 5.5290687561035154, "epoch": 1.9649484536082475, "grad_norm": 1.2734375, "learning_rate": 0.0004610145778595594, "loss": 5.2678, "mean_token_accuracy": 0.17698303759098052, "num_tokens": 43806174.0, "step": 25255 }, { "entropy": 5.424228000640869, "epoch": 1.965337482979965, "grad_norm": 1.28125, "learning_rate": 0.0004609989837489651, "loss": 5.0863, "mean_token_accuracy": 0.19475599229335785, "num_tokens": 43814704.0, "step": 25260 }, { "entropy": 5.3893218517303465, "epoch": 1.9657265123516825, "grad_norm": 1.4375, "learning_rate": 0.00046098338681613234, "loss": 5.0495, "mean_token_accuracy": 0.18727365136146545, "num_tokens": 43823122.0, "step": 25265 }, { "entropy": 5.472195863723755, "epoch": 1.9661155417234002, "grad_norm": 1.3203125, "learning_rate": 0.0004609677870612976, "loss": 5.1251, "mean_token_accuracy": 0.192566579580307, "num_tokens": 43832281.0, "step": 25270 }, { "entropy": 5.432113838195801, "epoch": 1.9665045710951177, "grad_norm": 1.2578125, "learning_rate": 0.0004609521844846978, "loss": 5.0906, "mean_token_accuracy": 0.18610522150993347, "num_tokens": 43840351.0, "step": 25275 }, { "entropy": 5.512760353088379, "epoch": 1.9668936004668351, "grad_norm": 1.2890625, "learning_rate": 0.0004609365790865695, "loss": 5.2177, "mean_token_accuracy": 0.1776440218091011, "num_tokens": 43849469.0, "step": 25280 }, { "entropy": 5.499239826202393, "epoch": 1.9672826298385528, "grad_norm": 1.2265625, "learning_rate": 0.00046092097086714956, "loss": 5.1288, "mean_token_accuracy": 0.18410846441984177, "num_tokens": 43858013.0, "step": 25285 }, { "entropy": 5.482743549346924, "epoch": 1.9676716592102705, "grad_norm": 1.2421875, "learning_rate": 0.00046090535982667486, "loss": 5.1301, "mean_token_accuracy": 0.1877378985285759, "num_tokens": 43867056.0, "step": 25290 }, { "entropy": 5.429666042327881, "epoch": 1.9680606885819878, "grad_norm": 1.2734375, "learning_rate": 0.00046088974596538216, "loss": 5.0926, "mean_token_accuracy": 0.19599473029375075, "num_tokens": 43875160.0, "step": 25295 }, { "entropy": 5.384914541244507, "epoch": 1.9684497179537055, "grad_norm": 1.34375, "learning_rate": 0.0004608741292835085, "loss": 5.1068, "mean_token_accuracy": 0.1888219952583313, "num_tokens": 43884243.0, "step": 25300 }, { "entropy": 5.446265316009521, "epoch": 1.9688387473254232, "grad_norm": 1.25, "learning_rate": 0.0004608585097812907, "loss": 5.1339, "mean_token_accuracy": 0.18835226595401763, "num_tokens": 43893378.0, "step": 25305 }, { "entropy": 5.409064245223999, "epoch": 1.9692277766971407, "grad_norm": 1.109375, "learning_rate": 0.0004608428874589659, "loss": 5.06, "mean_token_accuracy": 0.19077397435903548, "num_tokens": 43902095.0, "step": 25310 }, { "entropy": 5.461485576629639, "epoch": 1.9696168060688581, "grad_norm": 1.515625, "learning_rate": 0.0004608272623167711, "loss": 5.1727, "mean_token_accuracy": 0.18362220525741577, "num_tokens": 43911452.0, "step": 25315 }, { "entropy": 5.416750860214234, "epoch": 1.9700058354405758, "grad_norm": 1.390625, "learning_rate": 0.00046081163435494335, "loss": 5.0649, "mean_token_accuracy": 0.18266730159521102, "num_tokens": 43920208.0, "step": 25320 }, { "entropy": 5.50468111038208, "epoch": 1.9703948648122933, "grad_norm": 1.25, "learning_rate": 0.0004607960035737198, "loss": 5.2038, "mean_token_accuracy": 0.1859483003616333, "num_tokens": 43929069.0, "step": 25325 }, { "entropy": 5.546693277359009, "epoch": 1.9707838941840108, "grad_norm": 1.6171875, "learning_rate": 0.0004607803699733376, "loss": 5.1999, "mean_token_accuracy": 0.18293482661247254, "num_tokens": 43937444.0, "step": 25330 }, { "entropy": 5.556116390228271, "epoch": 1.9711729235557285, "grad_norm": 1.2578125, "learning_rate": 0.000460764733554034, "loss": 5.2387, "mean_token_accuracy": 0.1804982379078865, "num_tokens": 43946744.0, "step": 25335 }, { "entropy": 5.505416297912598, "epoch": 1.9715619529274462, "grad_norm": 1.3125, "learning_rate": 0.00046074909431604623, "loss": 5.193, "mean_token_accuracy": 0.1787700042128563, "num_tokens": 43954810.0, "step": 25340 }, { "entropy": 5.481557846069336, "epoch": 1.9719509822991634, "grad_norm": 1.3046875, "learning_rate": 0.0004607334522596116, "loss": 5.167, "mean_token_accuracy": 0.18779837787151338, "num_tokens": 43963366.0, "step": 25345 }, { "entropy": 5.472129201889038, "epoch": 1.9723400116708811, "grad_norm": 1.328125, "learning_rate": 0.0004607178073849675, "loss": 5.1213, "mean_token_accuracy": 0.18650121986865997, "num_tokens": 43972170.0, "step": 25350 }, { "entropy": 5.48205795288086, "epoch": 1.9727290410425988, "grad_norm": 1.1640625, "learning_rate": 0.0004607021596923512, "loss": 5.1964, "mean_token_accuracy": 0.18093065768480301, "num_tokens": 43980743.0, "step": 25355 }, { "entropy": 5.47332911491394, "epoch": 1.9731180704143163, "grad_norm": 1.1875, "learning_rate": 0.0004606865091820003, "loss": 5.1125, "mean_token_accuracy": 0.1856198564171791, "num_tokens": 43990332.0, "step": 25360 }, { "entropy": 5.484947776794433, "epoch": 1.9735070997860338, "grad_norm": 1.15625, "learning_rate": 0.0004606708558541521, "loss": 5.1527, "mean_token_accuracy": 0.1871538445353508, "num_tokens": 43999058.0, "step": 25365 }, { "entropy": 5.505348777770996, "epoch": 1.9738961291577515, "grad_norm": 1.203125, "learning_rate": 0.0004606551997090442, "loss": 5.1674, "mean_token_accuracy": 0.19216561913490296, "num_tokens": 44008310.0, "step": 25370 }, { "entropy": 5.442971229553223, "epoch": 1.974285158529469, "grad_norm": 1.2578125, "learning_rate": 0.0004606395407469141, "loss": 5.1393, "mean_token_accuracy": 0.1868462786078453, "num_tokens": 44016818.0, "step": 25375 }, { "entropy": 5.473188304901123, "epoch": 1.9746741879011864, "grad_norm": 1.21875, "learning_rate": 0.0004606238789679995, "loss": 5.2363, "mean_token_accuracy": 0.1797398880124092, "num_tokens": 44024755.0, "step": 25380 }, { "entropy": 5.526695680618286, "epoch": 1.9750632172729041, "grad_norm": 1.203125, "learning_rate": 0.0004606082143725381, "loss": 5.201, "mean_token_accuracy": 0.18505900949239731, "num_tokens": 44033416.0, "step": 25385 }, { "entropy": 5.463621377944946, "epoch": 1.9754522466446218, "grad_norm": 1.25, "learning_rate": 0.0004605925469607673, "loss": 5.1404, "mean_token_accuracy": 0.1915491119027138, "num_tokens": 44041487.0, "step": 25390 }, { "entropy": 5.450394153594971, "epoch": 1.975841276016339, "grad_norm": 1.2109375, "learning_rate": 0.00046057687673292506, "loss": 5.2043, "mean_token_accuracy": 0.1864388704299927, "num_tokens": 44050766.0, "step": 25395 }, { "entropy": 5.52214879989624, "epoch": 1.9762303053880568, "grad_norm": 1.1875, "learning_rate": 0.00046056120368924907, "loss": 5.2703, "mean_token_accuracy": 0.1834894075989723, "num_tokens": 44060173.0, "step": 25400 }, { "entropy": 5.442066860198975, "epoch": 1.9766193347597745, "grad_norm": 1.171875, "learning_rate": 0.0004605455278299772, "loss": 5.0504, "mean_token_accuracy": 0.19249071925878525, "num_tokens": 44068472.0, "step": 25405 }, { "entropy": 5.411147212982177, "epoch": 1.977008364131492, "grad_norm": 1.34375, "learning_rate": 0.0004605298491553472, "loss": 5.1764, "mean_token_accuracy": 0.18433773666620254, "num_tokens": 44077209.0, "step": 25410 }, { "entropy": 5.538371324539185, "epoch": 1.9773973935032094, "grad_norm": 1.15625, "learning_rate": 0.0004605141676655971, "loss": 5.295, "mean_token_accuracy": 0.17790180295705796, "num_tokens": 44086525.0, "step": 25415 }, { "entropy": 5.532166814804077, "epoch": 1.9777864228749271, "grad_norm": 1.34375, "learning_rate": 0.00046049848336096485, "loss": 5.174, "mean_token_accuracy": 0.18911987990140916, "num_tokens": 44095101.0, "step": 25420 }, { "entropy": 5.457807826995849, "epoch": 1.9781754522466446, "grad_norm": 1.2421875, "learning_rate": 0.0004604827962416883, "loss": 5.0736, "mean_token_accuracy": 0.19483690112829208, "num_tokens": 44103469.0, "step": 25425 }, { "entropy": 5.395337963104248, "epoch": 1.978564481618362, "grad_norm": 1.21875, "learning_rate": 0.0004604671063080055, "loss": 5.0696, "mean_token_accuracy": 0.18762816190719606, "num_tokens": 44112161.0, "step": 25430 }, { "entropy": 5.524976539611816, "epoch": 1.9789535109900798, "grad_norm": 1.28125, "learning_rate": 0.0004604514135601546, "loss": 5.1604, "mean_token_accuracy": 0.18970298618078232, "num_tokens": 44120452.0, "step": 25435 }, { "entropy": 5.527880907058716, "epoch": 1.9793425403617975, "grad_norm": 1.3125, "learning_rate": 0.0004604357179983736, "loss": 5.2369, "mean_token_accuracy": 0.17993032336235046, "num_tokens": 44129581.0, "step": 25440 }, { "entropy": 5.544310235977173, "epoch": 1.9797315697335147, "grad_norm": 1.2578125, "learning_rate": 0.0004604200196229009, "loss": 5.1671, "mean_token_accuracy": 0.18491467237472534, "num_tokens": 44138086.0, "step": 25445 }, { "entropy": 5.494865465164184, "epoch": 1.9801205991052324, "grad_norm": 1.2109375, "learning_rate": 0.0004604043184339744, "loss": 5.1221, "mean_token_accuracy": 0.19335436522960664, "num_tokens": 44146549.0, "step": 25450 }, { "entropy": 5.508090686798096, "epoch": 1.9805096284769501, "grad_norm": 1.203125, "learning_rate": 0.0004603886144318325, "loss": 5.2236, "mean_token_accuracy": 0.17968143075704573, "num_tokens": 44156142.0, "step": 25455 }, { "entropy": 5.465776681900024, "epoch": 1.9808986578486676, "grad_norm": 1.25, "learning_rate": 0.00046037290761671346, "loss": 5.1653, "mean_token_accuracy": 0.18690854609012603, "num_tokens": 44165023.0, "step": 25460 }, { "entropy": 5.501298236846924, "epoch": 1.981287687220385, "grad_norm": 1.21875, "learning_rate": 0.0004603571979888556, "loss": 5.1738, "mean_token_accuracy": 0.18056414127349854, "num_tokens": 44174034.0, "step": 25465 }, { "entropy": 5.497203826904297, "epoch": 1.9816767165921028, "grad_norm": 1.34375, "learning_rate": 0.0004603414855484973, "loss": 5.2376, "mean_token_accuracy": 0.17781688272953033, "num_tokens": 44183072.0, "step": 25470 }, { "entropy": 5.491177701950074, "epoch": 1.9820657459638202, "grad_norm": 1.1796875, "learning_rate": 0.000460325770295877, "loss": 5.1591, "mean_token_accuracy": 0.18131774067878723, "num_tokens": 44192181.0, "step": 25475 }, { "entropy": 5.4706768035888675, "epoch": 1.9824547753355377, "grad_norm": 1.1875, "learning_rate": 0.00046031005223123297, "loss": 5.1025, "mean_token_accuracy": 0.1920669823884964, "num_tokens": 44200967.0, "step": 25480 }, { "entropy": 5.4509875774383545, "epoch": 1.9828438047072554, "grad_norm": 1.28125, "learning_rate": 0.000460294331354804, "loss": 5.1519, "mean_token_accuracy": 0.18777865469455718, "num_tokens": 44209432.0, "step": 25485 }, { "entropy": 5.388992166519165, "epoch": 1.983232834078973, "grad_norm": 1.2421875, "learning_rate": 0.0004602786076668283, "loss": 5.1342, "mean_token_accuracy": 0.18712625950574874, "num_tokens": 44218503.0, "step": 25490 }, { "entropy": 5.436001253128052, "epoch": 1.9836218634506906, "grad_norm": 1.265625, "learning_rate": 0.00046026288116754477, "loss": 5.0745, "mean_token_accuracy": 0.1878805637359619, "num_tokens": 44227164.0, "step": 25495 }, { "entropy": 5.512021541595459, "epoch": 1.984010892822408, "grad_norm": 1.3203125, "learning_rate": 0.0004602471518571919, "loss": 5.1626, "mean_token_accuracy": 0.18564372658729553, "num_tokens": 44235950.0, "step": 25500 }, { "entropy": 5.421997356414795, "epoch": 1.9843999221941258, "grad_norm": 1.28125, "learning_rate": 0.0004602314197360083, "loss": 5.088, "mean_token_accuracy": 0.19366597831249238, "num_tokens": 44244098.0, "step": 25505 }, { "entropy": 5.443205404281616, "epoch": 1.9847889515658432, "grad_norm": 1.2734375, "learning_rate": 0.0004602156848042328, "loss": 5.2004, "mean_token_accuracy": 0.17902885526418685, "num_tokens": 44252798.0, "step": 25510 }, { "entropy": 5.518117427825928, "epoch": 1.9851779809375607, "grad_norm": 1.1875, "learning_rate": 0.000460199947062104, "loss": 5.2325, "mean_token_accuracy": 0.18336304128170014, "num_tokens": 44261662.0, "step": 25515 }, { "entropy": 5.589923477172851, "epoch": 1.9855670103092784, "grad_norm": 1.1953125, "learning_rate": 0.00046018420650986074, "loss": 5.2423, "mean_token_accuracy": 0.18122700452804566, "num_tokens": 44270480.0, "step": 25520 }, { "entropy": 5.497834825515747, "epoch": 1.9859560396809959, "grad_norm": 1.21875, "learning_rate": 0.000460168463147742, "loss": 5.1554, "mean_token_accuracy": 0.1871015712618828, "num_tokens": 44278673.0, "step": 25525 }, { "entropy": 5.359372520446778, "epoch": 1.9863450690527134, "grad_norm": 1.4140625, "learning_rate": 0.0004601527169759865, "loss": 5.0349, "mean_token_accuracy": 0.19219622761011124, "num_tokens": 44287465.0, "step": 25530 }, { "entropy": 5.460550975799561, "epoch": 1.986734098424431, "grad_norm": 1.28125, "learning_rate": 0.0004601369679948333, "loss": 5.2416, "mean_token_accuracy": 0.17935955077409743, "num_tokens": 44296204.0, "step": 25535 }, { "entropy": 5.5692850112915036, "epoch": 1.9871231277961487, "grad_norm": 2.15625, "learning_rate": 0.00046012121620452127, "loss": 5.2181, "mean_token_accuracy": 0.18243835121393204, "num_tokens": 44305338.0, "step": 25540 }, { "entropy": 5.4553173065185545, "epoch": 1.9875121571678662, "grad_norm": 1.4296875, "learning_rate": 0.0004601054616052893, "loss": 5.044, "mean_token_accuracy": 0.19335984587669372, "num_tokens": 44312960.0, "step": 25545 }, { "entropy": 5.40078387260437, "epoch": 1.9879011865395837, "grad_norm": 1.1640625, "learning_rate": 0.00046008970419737674, "loss": 5.1064, "mean_token_accuracy": 0.18838817179203032, "num_tokens": 44321367.0, "step": 25550 }, { "entropy": 5.449056243896484, "epoch": 1.9882902159113014, "grad_norm": 1.171875, "learning_rate": 0.0004600739439810225, "loss": 5.1867, "mean_token_accuracy": 0.18482354283332825, "num_tokens": 44330294.0, "step": 25555 }, { "entropy": 5.571813154220581, "epoch": 1.9886792452830189, "grad_norm": 1.4140625, "learning_rate": 0.00046005818095646564, "loss": 5.1885, "mean_token_accuracy": 0.180316698551178, "num_tokens": 44338639.0, "step": 25560 }, { "entropy": 5.399201679229736, "epoch": 1.9890682746547363, "grad_norm": 1.1875, "learning_rate": 0.00046004241512394544, "loss": 5.0717, "mean_token_accuracy": 0.1873680755496025, "num_tokens": 44346911.0, "step": 25565 }, { "entropy": 5.446534538269043, "epoch": 1.989457304026454, "grad_norm": 1.46875, "learning_rate": 0.0004600266464837012, "loss": 5.169, "mean_token_accuracy": 0.18562185317277907, "num_tokens": 44355580.0, "step": 25570 }, { "entropy": 5.505319404602051, "epoch": 1.9898463333981715, "grad_norm": 1.2578125, "learning_rate": 0.0004600108750359721, "loss": 5.1648, "mean_token_accuracy": 0.1830005392432213, "num_tokens": 44363465.0, "step": 25575 }, { "entropy": 5.481562757492066, "epoch": 1.990235362769889, "grad_norm": 1.2421875, "learning_rate": 0.00045999510078099736, "loss": 5.1514, "mean_token_accuracy": 0.19406624138355255, "num_tokens": 44372797.0, "step": 25580 }, { "entropy": 5.454525423049927, "epoch": 1.9906243921416067, "grad_norm": 1.171875, "learning_rate": 0.00045997932371901645, "loss": 5.1261, "mean_token_accuracy": 0.18497560322284698, "num_tokens": 44381537.0, "step": 25585 }, { "entropy": 5.468609571456909, "epoch": 1.9910134215133244, "grad_norm": 1.296875, "learning_rate": 0.0004599635438502687, "loss": 5.1471, "mean_token_accuracy": 0.19010152518749238, "num_tokens": 44390170.0, "step": 25590 }, { "entropy": 5.460803842544555, "epoch": 1.9914024508850419, "grad_norm": 1.171875, "learning_rate": 0.00045994776117499363, "loss": 5.2141, "mean_token_accuracy": 0.1841409534215927, "num_tokens": 44398545.0, "step": 25595 }, { "entropy": 5.460994720458984, "epoch": 1.9917914802567593, "grad_norm": 1.1015625, "learning_rate": 0.00045993197569343063, "loss": 5.1644, "mean_token_accuracy": 0.18038479536771773, "num_tokens": 44407587.0, "step": 25600 }, { "entropy": 5.449535799026489, "epoch": 1.992180509628477, "grad_norm": 1.21875, "learning_rate": 0.00045991618740581926, "loss": 5.0513, "mean_token_accuracy": 0.18754464387893677, "num_tokens": 44416005.0, "step": 25605 }, { "entropy": 5.426014137268067, "epoch": 1.9925695390001945, "grad_norm": 1.171875, "learning_rate": 0.0004599003963123991, "loss": 5.0699, "mean_token_accuracy": 0.19097606092691422, "num_tokens": 44425450.0, "step": 25610 }, { "entropy": 5.42979621887207, "epoch": 1.992958568371912, "grad_norm": 1.21875, "learning_rate": 0.00045988460241340966, "loss": 5.1467, "mean_token_accuracy": 0.18691133856773376, "num_tokens": 44434657.0, "step": 25615 }, { "entropy": 5.518140554428101, "epoch": 1.9933475977436297, "grad_norm": 1.2265625, "learning_rate": 0.00045986880570909075, "loss": 5.1693, "mean_token_accuracy": 0.17848251312971114, "num_tokens": 44443160.0, "step": 25620 }, { "entropy": 5.446799325942993, "epoch": 1.9937366271153472, "grad_norm": 1.1953125, "learning_rate": 0.00045985300619968186, "loss": 5.1221, "mean_token_accuracy": 0.18127365857362748, "num_tokens": 44452097.0, "step": 25625 }, { "entropy": 5.40854320526123, "epoch": 1.9941256564870646, "grad_norm": 1.265625, "learning_rate": 0.00045983720388542286, "loss": 5.0774, "mean_token_accuracy": 0.18011631965637206, "num_tokens": 44459674.0, "step": 25630 }, { "entropy": 5.391352796554566, "epoch": 1.9945146858587823, "grad_norm": 1.28125, "learning_rate": 0.0004598213987665535, "loss": 5.1638, "mean_token_accuracy": 0.18987185060977935, "num_tokens": 44468315.0, "step": 25635 }, { "entropy": 5.543141937255859, "epoch": 1.9949037152305, "grad_norm": 1.25, "learning_rate": 0.00045980559084331354, "loss": 5.1987, "mean_token_accuracy": 0.18342542946338652, "num_tokens": 44477436.0, "step": 25640 }, { "entropy": 5.551082754135132, "epoch": 1.9952927446022175, "grad_norm": 1.375, "learning_rate": 0.000459789780115943, "loss": 5.187, "mean_token_accuracy": 0.1835482209920883, "num_tokens": 44485518.0, "step": 25645 }, { "entropy": 5.385361051559448, "epoch": 1.995681773973935, "grad_norm": 1.2421875, "learning_rate": 0.00045977396658468156, "loss": 5.0896, "mean_token_accuracy": 0.18648289144039154, "num_tokens": 44493734.0, "step": 25650 }, { "entropy": 5.418517112731934, "epoch": 1.9960708033456527, "grad_norm": 1.2109375, "learning_rate": 0.0004597581502497693, "loss": 5.1352, "mean_token_accuracy": 0.18446629047393798, "num_tokens": 44502615.0, "step": 25655 }, { "entropy": 5.523607635498047, "epoch": 1.9964598327173702, "grad_norm": 1.28125, "learning_rate": 0.0004597423311114462, "loss": 5.2338, "mean_token_accuracy": 0.18076692819595336, "num_tokens": 44511792.0, "step": 25660 }, { "entropy": 5.500126695632934, "epoch": 1.9968488620890876, "grad_norm": 1.140625, "learning_rate": 0.0004597265091699522, "loss": 5.1795, "mean_token_accuracy": 0.1797320932149887, "num_tokens": 44520627.0, "step": 25665 }, { "entropy": 5.452884006500244, "epoch": 1.9972378914608053, "grad_norm": 1.2421875, "learning_rate": 0.0004597106844255276, "loss": 5.1147, "mean_token_accuracy": 0.18461923450231552, "num_tokens": 44528844.0, "step": 25670 }, { "entropy": 5.514548444747925, "epoch": 1.9976269208325228, "grad_norm": 1.21875, "learning_rate": 0.00045969485687841227, "loss": 5.2346, "mean_token_accuracy": 0.18351624757051468, "num_tokens": 44537602.0, "step": 25675 }, { "entropy": 5.5059802532196045, "epoch": 1.9980159502042403, "grad_norm": 1.296875, "learning_rate": 0.00045967902652884645, "loss": 5.1869, "mean_token_accuracy": 0.1845601737499237, "num_tokens": 44546261.0, "step": 25680 }, { "entropy": 5.405078601837158, "epoch": 1.998404979575958, "grad_norm": 1.3203125, "learning_rate": 0.0004596631933770704, "loss": 5.092, "mean_token_accuracy": 0.18809015601873397, "num_tokens": 44554291.0, "step": 25685 }, { "entropy": 5.4805034637451175, "epoch": 1.9987940089476757, "grad_norm": 1.1875, "learning_rate": 0.00045964735742332427, "loss": 5.1248, "mean_token_accuracy": 0.190411713719368, "num_tokens": 44562355.0, "step": 25690 }, { "entropy": 5.483749437332153, "epoch": 1.9991830383193931, "grad_norm": 1.2890625, "learning_rate": 0.0004596315186678484, "loss": 5.0853, "mean_token_accuracy": 0.19052745401859283, "num_tokens": 44570517.0, "step": 25695 }, { "entropy": 5.39281153678894, "epoch": 1.9995720676911106, "grad_norm": 1.21875, "learning_rate": 0.00045961567711088307, "loss": 5.0488, "mean_token_accuracy": 0.18237481713294984, "num_tokens": 44578871.0, "step": 25700 }, { "entropy": 5.497526407241821, "epoch": 1.9999610970628283, "grad_norm": 1.2421875, "learning_rate": 0.00045959983275266873, "loss": 5.1604, "mean_token_accuracy": 0.18408870995044707, "num_tokens": 44588081.0, "step": 25705 }, { "entropy": 5.581485642327203, "epoch": 2.000311223497374, "grad_norm": 1.3203125, "learning_rate": 0.00045958398559344573, "loss": 5.2352, "mean_token_accuracy": 0.18249769177701738, "num_tokens": 44596153.0, "step": 25710 }, { "entropy": 5.444728708267212, "epoch": 2.0007002528690916, "grad_norm": 1.234375, "learning_rate": 0.00045956813563345454, "loss": 5.0338, "mean_token_accuracy": 0.18786338567733765, "num_tokens": 44604760.0, "step": 25715 }, { "entropy": 5.376680564880371, "epoch": 2.0010892822408093, "grad_norm": 1.171875, "learning_rate": 0.0004595522828729357, "loss": 4.9761, "mean_token_accuracy": 0.19338334798812867, "num_tokens": 44613251.0, "step": 25720 }, { "entropy": 5.388321208953857, "epoch": 2.0014783116125265, "grad_norm": 1.3359375, "learning_rate": 0.0004595364273121296, "loss": 5.0736, "mean_token_accuracy": 0.19962829798460008, "num_tokens": 44621914.0, "step": 25725 }, { "entropy": 5.308832311630249, "epoch": 2.0018673409842442, "grad_norm": 1.3203125, "learning_rate": 0.0004595205689512771, "loss": 4.9465, "mean_token_accuracy": 0.20085244476795197, "num_tokens": 44630096.0, "step": 25730 }, { "entropy": 5.416966962814331, "epoch": 2.002256370355962, "grad_norm": 1.25, "learning_rate": 0.00045950470779061855, "loss": 5.062, "mean_token_accuracy": 0.1934100419282913, "num_tokens": 44638175.0, "step": 25735 }, { "entropy": 5.542482137680054, "epoch": 2.0026453997276796, "grad_norm": 1.2890625, "learning_rate": 0.00045948884383039475, "loss": 5.0923, "mean_token_accuracy": 0.18295737504959106, "num_tokens": 44646970.0, "step": 25740 }, { "entropy": 5.510114479064941, "epoch": 2.003034429099397, "grad_norm": 1.28125, "learning_rate": 0.00045947297707084637, "loss": 5.1766, "mean_token_accuracy": 0.18045057803392411, "num_tokens": 44655789.0, "step": 25745 }, { "entropy": 5.395209074020386, "epoch": 2.0034234584711146, "grad_norm": 1.2890625, "learning_rate": 0.0004594571075122142, "loss": 4.9918, "mean_token_accuracy": 0.20173296928405762, "num_tokens": 44664190.0, "step": 25750 }, { "entropy": 5.419756984710693, "epoch": 2.0038124878428323, "grad_norm": 1.3125, "learning_rate": 0.00045944123515473905, "loss": 5.0446, "mean_token_accuracy": 0.1888587787747383, "num_tokens": 44673295.0, "step": 25755 }, { "entropy": 5.519266653060913, "epoch": 2.0042015172145495, "grad_norm": 1.3046875, "learning_rate": 0.00045942535999866175, "loss": 5.1451, "mean_token_accuracy": 0.18339453041553497, "num_tokens": 44681890.0, "step": 25760 }, { "entropy": 5.5163695335388185, "epoch": 2.0045905465862672, "grad_norm": 1.359375, "learning_rate": 0.0004594094820442231, "loss": 5.1522, "mean_token_accuracy": 0.1822892665863037, "num_tokens": 44690915.0, "step": 25765 }, { "entropy": 5.489056491851807, "epoch": 2.004979575957985, "grad_norm": 1.3125, "learning_rate": 0.000459393601291664, "loss": 5.1054, "mean_token_accuracy": 0.18322639763355256, "num_tokens": 44700075.0, "step": 25770 }, { "entropy": 5.364870166778564, "epoch": 2.005368605329702, "grad_norm": 1.3828125, "learning_rate": 0.00045937771774122563, "loss": 4.8824, "mean_token_accuracy": 0.20090241730213165, "num_tokens": 44708732.0, "step": 25775 }, { "entropy": 5.462747383117676, "epoch": 2.00575763470142, "grad_norm": 1.3046875, "learning_rate": 0.0004593618313931488, "loss": 5.0249, "mean_token_accuracy": 0.19056898653507232, "num_tokens": 44717019.0, "step": 25780 }, { "entropy": 5.473164653778076, "epoch": 2.0061466640731376, "grad_norm": 1.2890625, "learning_rate": 0.00045934594224767463, "loss": 5.0781, "mean_token_accuracy": 0.19051527827978135, "num_tokens": 44725359.0, "step": 25785 }, { "entropy": 5.472438335418701, "epoch": 2.0065356934448553, "grad_norm": 1.265625, "learning_rate": 0.00045933005030504424, "loss": 5.0448, "mean_token_accuracy": 0.1917184591293335, "num_tokens": 44733913.0, "step": 25790 }, { "entropy": 5.5343818187713625, "epoch": 2.0069247228165725, "grad_norm": 1.375, "learning_rate": 0.00045931415556549863, "loss": 5.22, "mean_token_accuracy": 0.1775995224714279, "num_tokens": 44743019.0, "step": 25795 }, { "entropy": 5.485415983200073, "epoch": 2.0073137521882902, "grad_norm": 1.2734375, "learning_rate": 0.0004592982580292792, "loss": 5.1332, "mean_token_accuracy": 0.1870163843035698, "num_tokens": 44753140.0, "step": 25800 }, { "entropy": 5.4236150741577145, "epoch": 2.007702781560008, "grad_norm": 1.3125, "learning_rate": 0.00045928235769662697, "loss": 5.0646, "mean_token_accuracy": 0.1901487648487091, "num_tokens": 44761470.0, "step": 25805 }, { "entropy": 5.338818120956421, "epoch": 2.008091810931725, "grad_norm": 1.2734375, "learning_rate": 0.00045926645456778327, "loss": 4.9969, "mean_token_accuracy": 0.19235067665576935, "num_tokens": 44770570.0, "step": 25810 }, { "entropy": 5.486411762237549, "epoch": 2.008480840303443, "grad_norm": 1.6640625, "learning_rate": 0.00045925054864298946, "loss": 5.0966, "mean_token_accuracy": 0.18307472616434098, "num_tokens": 44779551.0, "step": 25815 }, { "entropy": 5.464999485015869, "epoch": 2.0088698696751606, "grad_norm": 1.3359375, "learning_rate": 0.00045923463992248684, "loss": 5.0734, "mean_token_accuracy": 0.1903066396713257, "num_tokens": 44787633.0, "step": 25820 }, { "entropy": 5.431466054916382, "epoch": 2.009258899046878, "grad_norm": 1.25, "learning_rate": 0.00045921872840651675, "loss": 5.0716, "mean_token_accuracy": 0.18642838895320893, "num_tokens": 44796030.0, "step": 25825 }, { "entropy": 5.508851051330566, "epoch": 2.0096479284185955, "grad_norm": 1.3125, "learning_rate": 0.00045920281409532064, "loss": 5.1566, "mean_token_accuracy": 0.19014932066202164, "num_tokens": 44805055.0, "step": 25830 }, { "entropy": 5.404452848434448, "epoch": 2.010036957790313, "grad_norm": 1.53125, "learning_rate": 0.0004591868969891401, "loss": 5.0101, "mean_token_accuracy": 0.1900265708565712, "num_tokens": 44813767.0, "step": 25835 }, { "entropy": 5.495506429672242, "epoch": 2.010425987162031, "grad_norm": 1.265625, "learning_rate": 0.0004591709770882165, "loss": 5.137, "mean_token_accuracy": 0.18695679903030396, "num_tokens": 44821955.0, "step": 25840 }, { "entropy": 5.47645001411438, "epoch": 2.010815016533748, "grad_norm": 1.3359375, "learning_rate": 0.0004591550543927915, "loss": 5.1209, "mean_token_accuracy": 0.18559882491827012, "num_tokens": 44830565.0, "step": 25845 }, { "entropy": 5.422461366653442, "epoch": 2.011204045905466, "grad_norm": 1.296875, "learning_rate": 0.0004591391289031067, "loss": 5.0134, "mean_token_accuracy": 0.19362840056419373, "num_tokens": 44839224.0, "step": 25850 }, { "entropy": 5.344720411300659, "epoch": 2.0115930752771836, "grad_norm": 1.296875, "learning_rate": 0.0004591232006194036, "loss": 4.9259, "mean_token_accuracy": 0.1979294165968895, "num_tokens": 44847756.0, "step": 25855 }, { "entropy": 5.520812129974365, "epoch": 2.011982104648901, "grad_norm": 1.2578125, "learning_rate": 0.00045910726954192404, "loss": 5.1609, "mean_token_accuracy": 0.19344780445098878, "num_tokens": 44855739.0, "step": 25860 }, { "entropy": 5.470018815994263, "epoch": 2.0123711340206185, "grad_norm": 1.2109375, "learning_rate": 0.0004590913356709097, "loss": 5.1066, "mean_token_accuracy": 0.1839215040206909, "num_tokens": 44864402.0, "step": 25865 }, { "entropy": 5.43224458694458, "epoch": 2.012760163392336, "grad_norm": 1.2109375, "learning_rate": 0.00045907539900660237, "loss": 5.1302, "mean_token_accuracy": 0.18525513410568237, "num_tokens": 44873369.0, "step": 25870 }, { "entropy": 5.454889726638794, "epoch": 2.013149192764054, "grad_norm": 1.1796875, "learning_rate": 0.0004590594595492438, "loss": 5.1507, "mean_token_accuracy": 0.18207110166549684, "num_tokens": 44882464.0, "step": 25875 }, { "entropy": 5.466670274734497, "epoch": 2.013538222135771, "grad_norm": 1.21875, "learning_rate": 0.00045904351729907593, "loss": 5.1088, "mean_token_accuracy": 0.1833759665489197, "num_tokens": 44891729.0, "step": 25880 }, { "entropy": 5.48141040802002, "epoch": 2.013927251507489, "grad_norm": 1.5859375, "learning_rate": 0.00045902757225634066, "loss": 5.1041, "mean_token_accuracy": 0.18325370252132417, "num_tokens": 44901752.0, "step": 25885 }, { "entropy": 5.483792734146118, "epoch": 2.0143162808792066, "grad_norm": 1.1953125, "learning_rate": 0.0004590116244212799, "loss": 5.1015, "mean_token_accuracy": 0.19141349494457244, "num_tokens": 44909899.0, "step": 25890 }, { "entropy": 5.488071727752685, "epoch": 2.014705310250924, "grad_norm": 1.546875, "learning_rate": 0.0004589956737941355, "loss": 5.0922, "mean_token_accuracy": 0.18420880883932114, "num_tokens": 44918472.0, "step": 25895 }, { "entropy": 5.412648487091064, "epoch": 2.0150943396226415, "grad_norm": 1.34375, "learning_rate": 0.0004589797203751497, "loss": 4.9924, "mean_token_accuracy": 0.19799681454896928, "num_tokens": 44926799.0, "step": 25900 }, { "entropy": 5.35377459526062, "epoch": 2.015483368994359, "grad_norm": 1.2734375, "learning_rate": 0.0004589637641645645, "loss": 5.0084, "mean_token_accuracy": 0.1928921714425087, "num_tokens": 44935867.0, "step": 25905 }, { "entropy": 5.4387894630432125, "epoch": 2.0158723983660765, "grad_norm": 1.3203125, "learning_rate": 0.00045894780516262193, "loss": 5.0925, "mean_token_accuracy": 0.18745613247156143, "num_tokens": 44944705.0, "step": 25910 }, { "entropy": 5.370718479156494, "epoch": 2.016261427737794, "grad_norm": 1.203125, "learning_rate": 0.0004589318433695642, "loss": 4.9483, "mean_token_accuracy": 0.19626040905714034, "num_tokens": 44954301.0, "step": 25915 }, { "entropy": 5.406123352050781, "epoch": 2.016650457109512, "grad_norm": 1.171875, "learning_rate": 0.0004589158787856336, "loss": 5.0294, "mean_token_accuracy": 0.18952097594738007, "num_tokens": 44963005.0, "step": 25920 }, { "entropy": 5.422341775894165, "epoch": 2.0170394864812295, "grad_norm": 1.3203125, "learning_rate": 0.0004588999114110721, "loss": 5.0268, "mean_token_accuracy": 0.19401021152734757, "num_tokens": 44970935.0, "step": 25925 }, { "entropy": 5.447469234466553, "epoch": 2.017428515852947, "grad_norm": 1.3359375, "learning_rate": 0.0004588839412461223, "loss": 5.0758, "mean_token_accuracy": 0.18731636852025985, "num_tokens": 44979915.0, "step": 25930 }, { "entropy": 5.466852521896362, "epoch": 2.0178175452246645, "grad_norm": 1.359375, "learning_rate": 0.0004588679682910264, "loss": 5.1262, "mean_token_accuracy": 0.187038554251194, "num_tokens": 44988934.0, "step": 25935 }, { "entropy": 5.5741759777069095, "epoch": 2.018206574596382, "grad_norm": 1.34375, "learning_rate": 0.0004588519925460266, "loss": 5.1703, "mean_token_accuracy": 0.18277468979358674, "num_tokens": 44997578.0, "step": 25940 }, { "entropy": 5.4935530662536625, "epoch": 2.0185956039680995, "grad_norm": 1.21875, "learning_rate": 0.0004588360140113655, "loss": 5.1047, "mean_token_accuracy": 0.18689310550689697, "num_tokens": 45005806.0, "step": 25945 }, { "entropy": 5.4236218452453615, "epoch": 2.018984633339817, "grad_norm": 1.203125, "learning_rate": 0.0004588200326872855, "loss": 5.0751, "mean_token_accuracy": 0.18582610040903091, "num_tokens": 45013948.0, "step": 25950 }, { "entropy": 5.458466720581055, "epoch": 2.019373662711535, "grad_norm": 1.3046875, "learning_rate": 0.0004588040485740291, "loss": 5.0598, "mean_token_accuracy": 0.19267645478248596, "num_tokens": 45022636.0, "step": 25955 }, { "entropy": 5.571482706069946, "epoch": 2.019762692083252, "grad_norm": 1.2109375, "learning_rate": 0.0004587880616718387, "loss": 5.1493, "mean_token_accuracy": 0.18160705119371415, "num_tokens": 45031194.0, "step": 25960 }, { "entropy": 5.517333269119263, "epoch": 2.02015172145497, "grad_norm": 1.28125, "learning_rate": 0.0004587720719809572, "loss": 5.1446, "mean_token_accuracy": 0.18359096050262452, "num_tokens": 45039436.0, "step": 25965 }, { "entropy": 5.435524034500122, "epoch": 2.0205407508266875, "grad_norm": 1.2578125, "learning_rate": 0.0004587560795016269, "loss": 5.058, "mean_token_accuracy": 0.1918371707201004, "num_tokens": 45048173.0, "step": 25970 }, { "entropy": 5.444525098800659, "epoch": 2.020929780198405, "grad_norm": 1.1796875, "learning_rate": 0.0004587400842340905, "loss": 5.1909, "mean_token_accuracy": 0.18015470802783967, "num_tokens": 45057896.0, "step": 25975 }, { "entropy": 5.509703636169434, "epoch": 2.0213188095701224, "grad_norm": 1.265625, "learning_rate": 0.00045872408617859083, "loss": 5.1107, "mean_token_accuracy": 0.18852764070034028, "num_tokens": 45066451.0, "step": 25980 }, { "entropy": 5.429889440536499, "epoch": 2.02170783894184, "grad_norm": 1.3125, "learning_rate": 0.00045870808533537066, "loss": 4.961, "mean_token_accuracy": 0.19611795097589493, "num_tokens": 45075143.0, "step": 25985 }, { "entropy": 5.477476787567139, "epoch": 2.022096868313558, "grad_norm": 1.2109375, "learning_rate": 0.00045869208170467256, "loss": 5.0906, "mean_token_accuracy": 0.1898880898952484, "num_tokens": 45083370.0, "step": 25990 }, { "entropy": 5.395438241958618, "epoch": 2.022485897685275, "grad_norm": 1.28125, "learning_rate": 0.0004586760752867396, "loss": 5.0369, "mean_token_accuracy": 0.1846868947148323, "num_tokens": 45091765.0, "step": 25995 }, { "entropy": 5.474615669250488, "epoch": 2.022874927056993, "grad_norm": 1.234375, "learning_rate": 0.00045866006608181456, "loss": 5.0316, "mean_token_accuracy": 0.187349633872509, "num_tokens": 45100206.0, "step": 26000 }, { "entropy": 5.415533256530762, "epoch": 2.0232639564287105, "grad_norm": 1.265625, "learning_rate": 0.0004586440540901403, "loss": 5.0245, "mean_token_accuracy": 0.18898305147886277, "num_tokens": 45108308.0, "step": 26005 }, { "entropy": 5.485188388824463, "epoch": 2.0236529858004277, "grad_norm": 1.34375, "learning_rate": 0.00045862803931195976, "loss": 5.122, "mean_token_accuracy": 0.18841476291418074, "num_tokens": 45116473.0, "step": 26010 }, { "entropy": 5.400331974029541, "epoch": 2.0240420151721454, "grad_norm": 1.21875, "learning_rate": 0.0004586120217475161, "loss": 5.1042, "mean_token_accuracy": 0.18988458812236786, "num_tokens": 45125913.0, "step": 26015 }, { "entropy": 5.414013957977295, "epoch": 2.024431044543863, "grad_norm": 1.3203125, "learning_rate": 0.0004585960013970522, "loss": 5.0189, "mean_token_accuracy": 0.18993803411722182, "num_tokens": 45134406.0, "step": 26020 }, { "entropy": 5.417628955841065, "epoch": 2.024820073915581, "grad_norm": 1.265625, "learning_rate": 0.0004585799782608112, "loss": 5.0484, "mean_token_accuracy": 0.18064669519662857, "num_tokens": 45142736.0, "step": 26025 }, { "entropy": 5.485821533203125, "epoch": 2.025209103287298, "grad_norm": 1.3203125, "learning_rate": 0.00045856395233903624, "loss": 5.0938, "mean_token_accuracy": 0.1913389578461647, "num_tokens": 45151148.0, "step": 26030 }, { "entropy": 5.439710187911987, "epoch": 2.025598132659016, "grad_norm": 1.2578125, "learning_rate": 0.0004585479236319705, "loss": 4.9809, "mean_token_accuracy": 0.19658254384994506, "num_tokens": 45160091.0, "step": 26035 }, { "entropy": 5.43528733253479, "epoch": 2.0259871620307335, "grad_norm": 1.25, "learning_rate": 0.00045853189213985714, "loss": 5.0918, "mean_token_accuracy": 0.18603586107492448, "num_tokens": 45168796.0, "step": 26040 }, { "entropy": 5.409790897369385, "epoch": 2.0263761914024507, "grad_norm": 1.2734375, "learning_rate": 0.00045851585786293943, "loss": 5.0175, "mean_token_accuracy": 0.1993498235940933, "num_tokens": 45176891.0, "step": 26045 }, { "entropy": 5.472186803817749, "epoch": 2.0267652207741684, "grad_norm": 1.265625, "learning_rate": 0.00045849982080146067, "loss": 5.0964, "mean_token_accuracy": 0.1854078933596611, "num_tokens": 45184768.0, "step": 26050 }, { "entropy": 5.481969261169434, "epoch": 2.027154250145886, "grad_norm": 1.2890625, "learning_rate": 0.0004584837809556642, "loss": 5.1394, "mean_token_accuracy": 0.18682254999876022, "num_tokens": 45193554.0, "step": 26055 }, { "entropy": 5.410466575622559, "epoch": 2.0275432795176034, "grad_norm": 1.1328125, "learning_rate": 0.00045846773832579346, "loss": 5.112, "mean_token_accuracy": 0.1870773747563362, "num_tokens": 45202517.0, "step": 26060 }, { "entropy": 5.4473748207092285, "epoch": 2.027932308889321, "grad_norm": 1.1796875, "learning_rate": 0.00045845169291209176, "loss": 5.0427, "mean_token_accuracy": 0.18514372706413268, "num_tokens": 45211260.0, "step": 26065 }, { "entropy": 5.451929950714112, "epoch": 2.0283213382610388, "grad_norm": 1.2265625, "learning_rate": 0.00045843564471480263, "loss": 5.1107, "mean_token_accuracy": 0.18812189996242523, "num_tokens": 45219828.0, "step": 26070 }, { "entropy": 5.535624027252197, "epoch": 2.0287103676327565, "grad_norm": 1.5, "learning_rate": 0.0004584195937341695, "loss": 5.1505, "mean_token_accuracy": 0.18370659202337264, "num_tokens": 45228977.0, "step": 26075 }, { "entropy": 5.465624761581421, "epoch": 2.0290993970044737, "grad_norm": 1.2421875, "learning_rate": 0.00045840353997043606, "loss": 5.0588, "mean_token_accuracy": 0.19447536021471024, "num_tokens": 45237191.0, "step": 26080 }, { "entropy": 5.400886201858521, "epoch": 2.0294884263761914, "grad_norm": 1.28125, "learning_rate": 0.0004583874834238458, "loss": 4.9899, "mean_token_accuracy": 0.2003542050719261, "num_tokens": 45245201.0, "step": 26085 }, { "entropy": 5.4844322681427, "epoch": 2.029877455747909, "grad_norm": 1.3359375, "learning_rate": 0.0004583714240946423, "loss": 5.1693, "mean_token_accuracy": 0.18563995659351348, "num_tokens": 45253795.0, "step": 26090 }, { "entropy": 5.569413709640503, "epoch": 2.0302664851196264, "grad_norm": 1.2890625, "learning_rate": 0.00045835536198306936, "loss": 5.2393, "mean_token_accuracy": 0.17743299901485443, "num_tokens": 45263403.0, "step": 26095 }, { "entropy": 5.48958911895752, "epoch": 2.030655514491344, "grad_norm": 1.2421875, "learning_rate": 0.00045833929708937067, "loss": 5.0255, "mean_token_accuracy": 0.1974035069346428, "num_tokens": 45272085.0, "step": 26100 }, { "entropy": 5.4285706043243405, "epoch": 2.0310445438630618, "grad_norm": 1.2890625, "learning_rate": 0.0004583232294137899, "loss": 5.0595, "mean_token_accuracy": 0.1926318734884262, "num_tokens": 45281004.0, "step": 26105 }, { "entropy": 5.430748224258423, "epoch": 2.031433573234779, "grad_norm": 1.265625, "learning_rate": 0.0004583071589565709, "loss": 4.9935, "mean_token_accuracy": 0.1875285968184471, "num_tokens": 45289950.0, "step": 26110 }, { "entropy": 5.476962327957153, "epoch": 2.0318226026064967, "grad_norm": 1.2890625, "learning_rate": 0.0004582910857179576, "loss": 5.1284, "mean_token_accuracy": 0.1811276063323021, "num_tokens": 45298155.0, "step": 26115 }, { "entropy": 5.479234266281128, "epoch": 2.0322116319782144, "grad_norm": 1.203125, "learning_rate": 0.0004582750096981938, "loss": 5.1491, "mean_token_accuracy": 0.18668553978204727, "num_tokens": 45306879.0, "step": 26120 }, { "entropy": 5.4478682518005375, "epoch": 2.032600661349932, "grad_norm": 1.2890625, "learning_rate": 0.0004582589308975234, "loss": 5.1534, "mean_token_accuracy": 0.1817260429263115, "num_tokens": 45315403.0, "step": 26125 }, { "entropy": 5.447778654098511, "epoch": 2.0329896907216494, "grad_norm": 1.234375, "learning_rate": 0.00045824284931619044, "loss": 5.0138, "mean_token_accuracy": 0.19322607070207595, "num_tokens": 45324351.0, "step": 26130 }, { "entropy": 5.46865553855896, "epoch": 2.033378720093367, "grad_norm": 1.296875, "learning_rate": 0.00045822676495443893, "loss": 5.1107, "mean_token_accuracy": 0.1877137914299965, "num_tokens": 45332513.0, "step": 26135 }, { "entropy": 5.493714332580566, "epoch": 2.0337677494650848, "grad_norm": 1.2109375, "learning_rate": 0.00045821067781251284, "loss": 5.134, "mean_token_accuracy": 0.18351096510887147, "num_tokens": 45341002.0, "step": 26140 }, { "entropy": 5.552550315856934, "epoch": 2.034156778836802, "grad_norm": 1.2890625, "learning_rate": 0.00045819458789065633, "loss": 5.1533, "mean_token_accuracy": 0.18525945395231247, "num_tokens": 45349650.0, "step": 26145 }, { "entropy": 5.484904813766479, "epoch": 2.0345458082085197, "grad_norm": 1.2890625, "learning_rate": 0.0004581784951891135, "loss": 5.2299, "mean_token_accuracy": 0.17485384047031402, "num_tokens": 45359189.0, "step": 26150 }, { "entropy": 5.418768787384034, "epoch": 2.0349348375802374, "grad_norm": 1.2890625, "learning_rate": 0.0004581623997081286, "loss": 4.9962, "mean_token_accuracy": 0.1977767750620842, "num_tokens": 45367274.0, "step": 26155 }, { "entropy": 5.442041730880737, "epoch": 2.0353238669519547, "grad_norm": 1.2890625, "learning_rate": 0.0004581463014479459, "loss": 5.06, "mean_token_accuracy": 0.19644575119018554, "num_tokens": 45375424.0, "step": 26160 }, { "entropy": 5.488533067703247, "epoch": 2.0357128963236724, "grad_norm": 1.2890625, "learning_rate": 0.0004581302004088095, "loss": 5.1059, "mean_token_accuracy": 0.18596280217170716, "num_tokens": 45384333.0, "step": 26165 }, { "entropy": 5.509543514251709, "epoch": 2.03610192569539, "grad_norm": 1.4140625, "learning_rate": 0.0004581140965909638, "loss": 5.2042, "mean_token_accuracy": 0.18016870319843292, "num_tokens": 45393309.0, "step": 26170 }, { "entropy": 5.501273250579834, "epoch": 2.0364909550671078, "grad_norm": 1.2578125, "learning_rate": 0.0004580979899946531, "loss": 5.1504, "mean_token_accuracy": 0.18365611284971237, "num_tokens": 45401590.0, "step": 26175 }, { "entropy": 5.457723617553711, "epoch": 2.036879984438825, "grad_norm": 1.359375, "learning_rate": 0.0004580818806201219, "loss": 5.0504, "mean_token_accuracy": 0.1897273913025856, "num_tokens": 45409458.0, "step": 26180 }, { "entropy": 5.41987419128418, "epoch": 2.0372690138105427, "grad_norm": 1.3125, "learning_rate": 0.00045806576846761453, "loss": 5.0283, "mean_token_accuracy": 0.1898242086172104, "num_tokens": 45417777.0, "step": 26185 }, { "entropy": 5.450578069686889, "epoch": 2.0376580431822604, "grad_norm": 1.1953125, "learning_rate": 0.00045804965353737556, "loss": 5.1302, "mean_token_accuracy": 0.18693762123584748, "num_tokens": 45425489.0, "step": 26190 }, { "entropy": 5.416676998138428, "epoch": 2.0380470725539777, "grad_norm": 1.171875, "learning_rate": 0.0004580335358296494, "loss": 5.0398, "mean_token_accuracy": 0.19506158530712128, "num_tokens": 45433770.0, "step": 26195 }, { "entropy": 5.452640628814697, "epoch": 2.0384361019256954, "grad_norm": 1.296875, "learning_rate": 0.00045801741534468065, "loss": 5.1445, "mean_token_accuracy": 0.1862376183271408, "num_tokens": 45442607.0, "step": 26200 }, { "entropy": 5.423161029815674, "epoch": 2.038825131297413, "grad_norm": 1.265625, "learning_rate": 0.0004580012920827139, "loss": 5.0732, "mean_token_accuracy": 0.18894716948270798, "num_tokens": 45451671.0, "step": 26205 }, { "entropy": 5.503476619720459, "epoch": 2.0392141606691303, "grad_norm": 1.671875, "learning_rate": 0.0004579851660439939, "loss": 5.1051, "mean_token_accuracy": 0.18642035722732545, "num_tokens": 45459861.0, "step": 26210 }, { "entropy": 5.404365110397339, "epoch": 2.039603190040848, "grad_norm": 1.265625, "learning_rate": 0.00045796903722876523, "loss": 4.9803, "mean_token_accuracy": 0.19433657228946685, "num_tokens": 45468623.0, "step": 26215 }, { "entropy": 5.381502723693847, "epoch": 2.0399922194125657, "grad_norm": 1.2421875, "learning_rate": 0.0004579529056372726, "loss": 4.9651, "mean_token_accuracy": 0.19460041224956512, "num_tokens": 45476763.0, "step": 26220 }, { "entropy": 5.368109512329101, "epoch": 2.0403812487842834, "grad_norm": 1.28125, "learning_rate": 0.0004579367712697609, "loss": 5.0203, "mean_token_accuracy": 0.19235813915729522, "num_tokens": 45485069.0, "step": 26225 }, { "entropy": 5.4267431735992435, "epoch": 2.0407702781560006, "grad_norm": 1.390625, "learning_rate": 0.00045792063412647475, "loss": 5.1842, "mean_token_accuracy": 0.1847541570663452, "num_tokens": 45494236.0, "step": 26230 }, { "entropy": 5.436605930328369, "epoch": 2.0411593075277183, "grad_norm": 1.171875, "learning_rate": 0.00045790449420765925, "loss": 5.0143, "mean_token_accuracy": 0.18702832609415054, "num_tokens": 45503257.0, "step": 26235 }, { "entropy": 5.509296178817749, "epoch": 2.041548336899436, "grad_norm": 1.203125, "learning_rate": 0.00045788835151355914, "loss": 5.0965, "mean_token_accuracy": 0.18745123893022536, "num_tokens": 45511544.0, "step": 26240 }, { "entropy": 5.418730354309082, "epoch": 2.0419373662711533, "grad_norm": 1.203125, "learning_rate": 0.00045787220604441933, "loss": 5.0611, "mean_token_accuracy": 0.1919870436191559, "num_tokens": 45519951.0, "step": 26245 }, { "entropy": 5.496915102005005, "epoch": 2.042326395642871, "grad_norm": 1.1953125, "learning_rate": 0.00045785605780048497, "loss": 5.1016, "mean_token_accuracy": 0.19065672904253006, "num_tokens": 45527978.0, "step": 26250 }, { "entropy": 5.53138689994812, "epoch": 2.0427154250145887, "grad_norm": 1.1953125, "learning_rate": 0.00045783990678200086, "loss": 5.1572, "mean_token_accuracy": 0.1834472596645355, "num_tokens": 45537103.0, "step": 26255 }, { "entropy": 5.434952020645142, "epoch": 2.043104454386306, "grad_norm": 1.265625, "learning_rate": 0.00045782375298921227, "loss": 5.0444, "mean_token_accuracy": 0.1881848692893982, "num_tokens": 45545136.0, "step": 26260 }, { "entropy": 5.5000511646270756, "epoch": 2.0434934837580236, "grad_norm": 1.28125, "learning_rate": 0.0004578075964223642, "loss": 5.1969, "mean_token_accuracy": 0.17813641875982283, "num_tokens": 45553709.0, "step": 26265 }, { "entropy": 5.3977649211883545, "epoch": 2.0438825131297413, "grad_norm": 1.2265625, "learning_rate": 0.0004577914370817018, "loss": 5.0871, "mean_token_accuracy": 0.1889914482831955, "num_tokens": 45562947.0, "step": 26270 }, { "entropy": 5.4389242172241214, "epoch": 2.044271542501459, "grad_norm": 1.21875, "learning_rate": 0.00045777527496747034, "loss": 5.0646, "mean_token_accuracy": 0.1866018906235695, "num_tokens": 45571319.0, "step": 26275 }, { "entropy": 5.477866172790527, "epoch": 2.0446605718731763, "grad_norm": 1.34375, "learning_rate": 0.00045775911007991493, "loss": 5.1864, "mean_token_accuracy": 0.18381573110818863, "num_tokens": 45580071.0, "step": 26280 }, { "entropy": 5.408913040161133, "epoch": 2.045049601244894, "grad_norm": 1.1953125, "learning_rate": 0.00045774294241928093, "loss": 4.9924, "mean_token_accuracy": 0.19837945997714995, "num_tokens": 45587998.0, "step": 26285 }, { "entropy": 5.411702585220337, "epoch": 2.0454386306166117, "grad_norm": 1.21875, "learning_rate": 0.0004577267719858137, "loss": 5.1164, "mean_token_accuracy": 0.19005484580993653, "num_tokens": 45597109.0, "step": 26290 }, { "entropy": 5.507308483123779, "epoch": 2.045827659988329, "grad_norm": 1.171875, "learning_rate": 0.00045771059877975853, "loss": 5.0761, "mean_token_accuracy": 0.19275854676961898, "num_tokens": 45605699.0, "step": 26295 }, { "entropy": 5.581901597976684, "epoch": 2.0462166893600466, "grad_norm": 1.2578125, "learning_rate": 0.0004576944228013608, "loss": 5.2023, "mean_token_accuracy": 0.18384405821561814, "num_tokens": 45613634.0, "step": 26300 }, { "entropy": 5.455799531936646, "epoch": 2.0466057187317643, "grad_norm": 1.203125, "learning_rate": 0.000457678244050866, "loss": 4.9829, "mean_token_accuracy": 0.19694255739450456, "num_tokens": 45621814.0, "step": 26305 }, { "entropy": 5.457636404037475, "epoch": 2.046994748103482, "grad_norm": 1.265625, "learning_rate": 0.0004576620625285196, "loss": 5.1607, "mean_token_accuracy": 0.18184020817279817, "num_tokens": 45629386.0, "step": 26310 }, { "entropy": 5.373083591461182, "epoch": 2.0473837774751993, "grad_norm": 1.390625, "learning_rate": 0.00045764587823456717, "loss": 4.973, "mean_token_accuracy": 0.19928345829248428, "num_tokens": 45637565.0, "step": 26315 }, { "entropy": 5.432145118713379, "epoch": 2.047772806846917, "grad_norm": 1.1484375, "learning_rate": 0.00045762969116925424, "loss": 5.0847, "mean_token_accuracy": 0.18930524885654448, "num_tokens": 45646876.0, "step": 26320 }, { "entropy": 5.399530553817749, "epoch": 2.0481618362186347, "grad_norm": 1.21875, "learning_rate": 0.00045761350133282643, "loss": 4.9632, "mean_token_accuracy": 0.1875717118382454, "num_tokens": 45655445.0, "step": 26325 }, { "entropy": 5.4098467350006105, "epoch": 2.048550865590352, "grad_norm": 1.1875, "learning_rate": 0.00045759730872552937, "loss": 5.0816, "mean_token_accuracy": 0.18415096700191497, "num_tokens": 45663908.0, "step": 26330 }, { "entropy": 5.505611610412598, "epoch": 2.0489398949620696, "grad_norm": 1.84375, "learning_rate": 0.0004575811133476088, "loss": 5.1333, "mean_token_accuracy": 0.1881997600197792, "num_tokens": 45672842.0, "step": 26335 }, { "entropy": 5.475399303436279, "epoch": 2.0493289243337873, "grad_norm": 1.15625, "learning_rate": 0.00045756491519931047, "loss": 5.0688, "mean_token_accuracy": 0.18538758009672165, "num_tokens": 45680988.0, "step": 26340 }, { "entropy": 5.4382446765899655, "epoch": 2.0497179537055046, "grad_norm": 1.1328125, "learning_rate": 0.0004575487142808801, "loss": 5.0648, "mean_token_accuracy": 0.18918948918581008, "num_tokens": 45690165.0, "step": 26345 }, { "entropy": 5.487147951126099, "epoch": 2.0501069830772223, "grad_norm": 1.234375, "learning_rate": 0.0004575325105925636, "loss": 5.1278, "mean_token_accuracy": 0.1850400447845459, "num_tokens": 45698721.0, "step": 26350 }, { "entropy": 5.489384365081787, "epoch": 2.05049601244894, "grad_norm": 1.34375, "learning_rate": 0.00045751630413460665, "loss": 5.0933, "mean_token_accuracy": 0.18805812895298005, "num_tokens": 45707374.0, "step": 26355 }, { "entropy": 5.424233770370483, "epoch": 2.0508850418206577, "grad_norm": 1.2578125, "learning_rate": 0.0004575000949072554, "loss": 4.969, "mean_token_accuracy": 0.19701954424381257, "num_tokens": 45715756.0, "step": 26360 }, { "entropy": 5.360181283950806, "epoch": 2.051274071192375, "grad_norm": 1.3125, "learning_rate": 0.0004574838829107557, "loss": 5.0651, "mean_token_accuracy": 0.19640946239233018, "num_tokens": 45724173.0, "step": 26365 }, { "entropy": 5.450315952301025, "epoch": 2.0516631005640926, "grad_norm": 1.203125, "learning_rate": 0.0004574676681453535, "loss": 5.0814, "mean_token_accuracy": 0.1922634795308113, "num_tokens": 45732330.0, "step": 26370 }, { "entropy": 5.481554746627808, "epoch": 2.0520521299358103, "grad_norm": 1.25, "learning_rate": 0.00045745145061129485, "loss": 5.1041, "mean_token_accuracy": 0.18633596003055572, "num_tokens": 45741489.0, "step": 26375 }, { "entropy": 5.381827068328858, "epoch": 2.0524411593075276, "grad_norm": 1.2578125, "learning_rate": 0.00045743523030882584, "loss": 4.9855, "mean_token_accuracy": 0.19808474630117417, "num_tokens": 45750816.0, "step": 26380 }, { "entropy": 5.5357691764831545, "epoch": 2.0528301886792453, "grad_norm": 1.1640625, "learning_rate": 0.0004574190072381926, "loss": 5.1708, "mean_token_accuracy": 0.18435940593481065, "num_tokens": 45759393.0, "step": 26385 }, { "entropy": 5.523303127288818, "epoch": 2.053219218050963, "grad_norm": 1.25, "learning_rate": 0.0004574027813996413, "loss": 5.0721, "mean_token_accuracy": 0.18744754791259766, "num_tokens": 45767749.0, "step": 26390 }, { "entropy": 5.400083065032959, "epoch": 2.05360824742268, "grad_norm": 1.1953125, "learning_rate": 0.0004573865527934181, "loss": 5.1404, "mean_token_accuracy": 0.18763604164123535, "num_tokens": 45776455.0, "step": 26395 }, { "entropy": 5.4435841083526615, "epoch": 2.053997276794398, "grad_norm": 1.171875, "learning_rate": 0.0004573703214197692, "loss": 5.0468, "mean_token_accuracy": 0.1912248447537422, "num_tokens": 45784869.0, "step": 26400 }, { "entropy": 5.431168842315674, "epoch": 2.0543863061661156, "grad_norm": 1.2578125, "learning_rate": 0.00045735408727894095, "loss": 5.0834, "mean_token_accuracy": 0.19728166610002518, "num_tokens": 45793956.0, "step": 26405 }, { "entropy": 5.4899486064910885, "epoch": 2.0547753355378333, "grad_norm": 1.21875, "learning_rate": 0.00045733785037117977, "loss": 5.0555, "mean_token_accuracy": 0.18795484751462938, "num_tokens": 45801918.0, "step": 26410 }, { "entropy": 5.443356323242187, "epoch": 2.0551643649095506, "grad_norm": 1.21875, "learning_rate": 0.0004573216106967319, "loss": 5.0576, "mean_token_accuracy": 0.18777785897254945, "num_tokens": 45810026.0, "step": 26415 }, { "entropy": 5.351675224304199, "epoch": 2.0555533942812683, "grad_norm": 1.1953125, "learning_rate": 0.00045730536825584365, "loss": 5.0211, "mean_token_accuracy": 0.18824243396520615, "num_tokens": 45818101.0, "step": 26420 }, { "entropy": 5.462250757217407, "epoch": 2.055942423652986, "grad_norm": 1.3359375, "learning_rate": 0.00045728912304876176, "loss": 5.1066, "mean_token_accuracy": 0.19235883206129073, "num_tokens": 45826467.0, "step": 26425 }, { "entropy": 5.461958646774292, "epoch": 2.056331453024703, "grad_norm": 1.2421875, "learning_rate": 0.0004572728750757326, "loss": 5.0408, "mean_token_accuracy": 0.19003259390592575, "num_tokens": 45835329.0, "step": 26430 }, { "entropy": 5.413185358047485, "epoch": 2.056720482396421, "grad_norm": 1.3046875, "learning_rate": 0.0004572566243370025, "loss": 5.1016, "mean_token_accuracy": 0.19288131296634675, "num_tokens": 45844449.0, "step": 26435 }, { "entropy": 5.4415202140808105, "epoch": 2.0571095117681386, "grad_norm": 1.3671875, "learning_rate": 0.0004572403708328183, "loss": 5.0519, "mean_token_accuracy": 0.18573687523603438, "num_tokens": 45854042.0, "step": 26440 }, { "entropy": 5.433035564422608, "epoch": 2.057498541139856, "grad_norm": 1.2109375, "learning_rate": 0.0004572241145634266, "loss": 5.0416, "mean_token_accuracy": 0.19421865195035934, "num_tokens": 45863164.0, "step": 26445 }, { "entropy": 5.497725915908814, "epoch": 2.0578875705115736, "grad_norm": 1.3359375, "learning_rate": 0.000457207855529074, "loss": 5.1331, "mean_token_accuracy": 0.19196872264146805, "num_tokens": 45872054.0, "step": 26450 }, { "entropy": 5.443451309204102, "epoch": 2.0582765998832913, "grad_norm": 1.234375, "learning_rate": 0.00045719159373000713, "loss": 5.0514, "mean_token_accuracy": 0.19789825826883317, "num_tokens": 45880887.0, "step": 26455 }, { "entropy": 5.501171827316284, "epoch": 2.058665629255009, "grad_norm": 1.203125, "learning_rate": 0.0004571753291664729, "loss": 5.2103, "mean_token_accuracy": 0.17678143531084062, "num_tokens": 45890078.0, "step": 26460 }, { "entropy": 5.47356276512146, "epoch": 2.059054658626726, "grad_norm": 1.09375, "learning_rate": 0.0004571590618387179, "loss": 5.1348, "mean_token_accuracy": 0.1892164722084999, "num_tokens": 45899803.0, "step": 26465 }, { "entropy": 5.531498432159424, "epoch": 2.059443687998444, "grad_norm": 1.2421875, "learning_rate": 0.0004571427917469892, "loss": 5.0921, "mean_token_accuracy": 0.1861984297633171, "num_tokens": 45908851.0, "step": 26470 }, { "entropy": 5.407815551757812, "epoch": 2.0598327173701616, "grad_norm": 1.1953125, "learning_rate": 0.00045712651889153345, "loss": 5.0732, "mean_token_accuracy": 0.19155399799346923, "num_tokens": 45917891.0, "step": 26475 }, { "entropy": 5.467431974411011, "epoch": 2.060221746741879, "grad_norm": 1.2109375, "learning_rate": 0.00045711024327259764, "loss": 5.0599, "mean_token_accuracy": 0.18578184992074967, "num_tokens": 45926185.0, "step": 26480 }, { "entropy": 5.473532247543335, "epoch": 2.0606107761135966, "grad_norm": 1.640625, "learning_rate": 0.00045709396489042884, "loss": 5.1841, "mean_token_accuracy": 0.18667600452899932, "num_tokens": 45935064.0, "step": 26485 }, { "entropy": 5.4500171661376955, "epoch": 2.0609998054853143, "grad_norm": 1.234375, "learning_rate": 0.00045707768374527385, "loss": 5.0569, "mean_token_accuracy": 0.18398671746253967, "num_tokens": 45943216.0, "step": 26490 }, { "entropy": 5.529759693145752, "epoch": 2.0613888348570315, "grad_norm": 1.25, "learning_rate": 0.0004570613998373799, "loss": 5.175, "mean_token_accuracy": 0.18865414410829545, "num_tokens": 45952178.0, "step": 26495 }, { "entropy": 5.564587593078613, "epoch": 2.061777864228749, "grad_norm": 1.2890625, "learning_rate": 0.00045704511316699395, "loss": 5.1737, "mean_token_accuracy": 0.17856037020683288, "num_tokens": 45960962.0, "step": 26500 }, { "entropy": 5.36931529045105, "epoch": 2.062166893600467, "grad_norm": 1.2578125, "learning_rate": 0.00045702882373436317, "loss": 4.898, "mean_token_accuracy": 0.19553142488002778, "num_tokens": 45969527.0, "step": 26505 }, { "entropy": 5.43325023651123, "epoch": 2.0625559229721846, "grad_norm": 1.3046875, "learning_rate": 0.0004570125315397347, "loss": 5.0719, "mean_token_accuracy": 0.1851261094212532, "num_tokens": 45978258.0, "step": 26510 }, { "entropy": 5.3452150344848635, "epoch": 2.062944952343902, "grad_norm": 1.1640625, "learning_rate": 0.0004569962365833558, "loss": 5.0274, "mean_token_accuracy": 0.19989991188049316, "num_tokens": 45986647.0, "step": 26515 }, { "entropy": 5.443856430053711, "epoch": 2.0633339817156195, "grad_norm": 1.171875, "learning_rate": 0.00045697993886547374, "loss": 5.0437, "mean_token_accuracy": 0.19464795887470246, "num_tokens": 45995458.0, "step": 26520 }, { "entropy": 5.523579454421997, "epoch": 2.0637230110873372, "grad_norm": 1.2421875, "learning_rate": 0.00045696363838633566, "loss": 5.1614, "mean_token_accuracy": 0.18642623573541642, "num_tokens": 46004293.0, "step": 26525 }, { "entropy": 5.474764680862426, "epoch": 2.0641120404590545, "grad_norm": 1.3828125, "learning_rate": 0.00045694733514618904, "loss": 5.0873, "mean_token_accuracy": 0.1744238555431366, "num_tokens": 46013752.0, "step": 26530 }, { "entropy": 5.4697774887084964, "epoch": 2.064501069830772, "grad_norm": 1.2265625, "learning_rate": 0.0004569310291452812, "loss": 5.1361, "mean_token_accuracy": 0.18623490184545516, "num_tokens": 46021935.0, "step": 26535 }, { "entropy": 5.37326717376709, "epoch": 2.06489009920249, "grad_norm": 1.1640625, "learning_rate": 0.0004569147203838595, "loss": 5.0118, "mean_token_accuracy": 0.19864792227745057, "num_tokens": 46030567.0, "step": 26540 }, { "entropy": 5.471074819564819, "epoch": 2.065279128574207, "grad_norm": 1.21875, "learning_rate": 0.00045689840886217157, "loss": 5.1515, "mean_token_accuracy": 0.17549849897623063, "num_tokens": 46038764.0, "step": 26545 }, { "entropy": 5.347313499450683, "epoch": 2.065668157945925, "grad_norm": 1.0859375, "learning_rate": 0.00045688209458046475, "loss": 4.9205, "mean_token_accuracy": 0.19911065995693206, "num_tokens": 46047393.0, "step": 26550 }, { "entropy": 5.405013465881348, "epoch": 2.0660571873176425, "grad_norm": 1.265625, "learning_rate": 0.00045686577753898663, "loss": 5.048, "mean_token_accuracy": 0.1798100233078003, "num_tokens": 46055748.0, "step": 26555 }, { "entropy": 5.460014057159424, "epoch": 2.0664462166893602, "grad_norm": 1.2890625, "learning_rate": 0.00045684945773798483, "loss": 5.0269, "mean_token_accuracy": 0.1878630682826042, "num_tokens": 46063888.0, "step": 26560 }, { "entropy": 5.405939340591431, "epoch": 2.0668352460610775, "grad_norm": 1.1875, "learning_rate": 0.000456833135177707, "loss": 5.0308, "mean_token_accuracy": 0.19919078499078752, "num_tokens": 46073031.0, "step": 26565 }, { "entropy": 5.4378499507904055, "epoch": 2.067224275432795, "grad_norm": 1.296875, "learning_rate": 0.0004568168098584007, "loss": 5.1053, "mean_token_accuracy": 0.1878155365586281, "num_tokens": 46081204.0, "step": 26570 }, { "entropy": 5.48003740310669, "epoch": 2.067613304804513, "grad_norm": 1.375, "learning_rate": 0.0004568004817803137, "loss": 5.0864, "mean_token_accuracy": 0.19692007452249527, "num_tokens": 46089842.0, "step": 26575 }, { "entropy": 5.430802488327027, "epoch": 2.06800233417623, "grad_norm": 1.2265625, "learning_rate": 0.0004567841509436937, "loss": 5.0851, "mean_token_accuracy": 0.1911781370639801, "num_tokens": 46098400.0, "step": 26580 }, { "entropy": 5.4463705062866214, "epoch": 2.068391363547948, "grad_norm": 1.2421875, "learning_rate": 0.0004567678173487887, "loss": 5.1226, "mean_token_accuracy": 0.1812913402915001, "num_tokens": 46106948.0, "step": 26585 }, { "entropy": 5.417099380493164, "epoch": 2.0687803929196655, "grad_norm": 1.1953125, "learning_rate": 0.0004567514809958462, "loss": 5.0407, "mean_token_accuracy": 0.1880608394742012, "num_tokens": 46115361.0, "step": 26590 }, { "entropy": 5.442030429840088, "epoch": 2.069169422291383, "grad_norm": 1.171875, "learning_rate": 0.0004567351418851144, "loss": 5.0635, "mean_token_accuracy": 0.19073839038610457, "num_tokens": 46123658.0, "step": 26595 }, { "entropy": 5.529055643081665, "epoch": 2.0695584516631005, "grad_norm": 1.1875, "learning_rate": 0.00045671880001684113, "loss": 5.1086, "mean_token_accuracy": 0.1870644211769104, "num_tokens": 46132511.0, "step": 26600 }, { "entropy": 5.442026615142822, "epoch": 2.069947481034818, "grad_norm": 1.3203125, "learning_rate": 0.00045670245539127413, "loss": 5.1247, "mean_token_accuracy": 0.18608764111995696, "num_tokens": 46141337.0, "step": 26605 }, { "entropy": 5.437988996505737, "epoch": 2.070336510406536, "grad_norm": 1.265625, "learning_rate": 0.00045668610800866173, "loss": 5.1138, "mean_token_accuracy": 0.1860414445400238, "num_tokens": 46149161.0, "step": 26610 }, { "entropy": 5.538371276855469, "epoch": 2.070725539778253, "grad_norm": 1.25, "learning_rate": 0.00045666975786925177, "loss": 5.1825, "mean_token_accuracy": 0.17995938807725906, "num_tokens": 46157497.0, "step": 26615 }, { "entropy": 5.4514062881469725, "epoch": 2.071114569149971, "grad_norm": 1.3046875, "learning_rate": 0.0004566534049732923, "loss": 5.0488, "mean_token_accuracy": 0.1849229320883751, "num_tokens": 46165989.0, "step": 26620 }, { "entropy": 5.440406608581543, "epoch": 2.0715035985216885, "grad_norm": 1.125, "learning_rate": 0.00045663704932103166, "loss": 5.0722, "mean_token_accuracy": 0.19279370307922364, "num_tokens": 46174847.0, "step": 26625 }, { "entropy": 5.436432933807373, "epoch": 2.071892627893406, "grad_norm": 1.25, "learning_rate": 0.00045662069091271785, "loss": 5.0611, "mean_token_accuracy": 0.19166813045740128, "num_tokens": 46183680.0, "step": 26630 }, { "entropy": 5.443097829818726, "epoch": 2.0722816572651235, "grad_norm": 1.453125, "learning_rate": 0.00045660432974859924, "loss": 5.0708, "mean_token_accuracy": 0.1911827564239502, "num_tokens": 46192878.0, "step": 26635 }, { "entropy": 5.476205205917358, "epoch": 2.072670686636841, "grad_norm": 1.328125, "learning_rate": 0.00045658796582892383, "loss": 5.1433, "mean_token_accuracy": 0.18601690828800202, "num_tokens": 46200891.0, "step": 26640 }, { "entropy": 5.409503316879272, "epoch": 2.073059716008559, "grad_norm": 1.2109375, "learning_rate": 0.00045657159915394013, "loss": 5.024, "mean_token_accuracy": 0.1971341699361801, "num_tokens": 46210138.0, "step": 26645 }, { "entropy": 5.485125350952148, "epoch": 2.073448745380276, "grad_norm": 1.3359375, "learning_rate": 0.0004565552297238964, "loss": 5.0592, "mean_token_accuracy": 0.18856684118509293, "num_tokens": 46218729.0, "step": 26650 }, { "entropy": 5.380882406234742, "epoch": 2.073837774751994, "grad_norm": 1.2890625, "learning_rate": 0.000456538857539041, "loss": 5.0714, "mean_token_accuracy": 0.18923247158527373, "num_tokens": 46228462.0, "step": 26655 }, { "entropy": 5.435634899139404, "epoch": 2.0742268041237115, "grad_norm": 1.3828125, "learning_rate": 0.00045652248259962254, "loss": 5.0747, "mean_token_accuracy": 0.19677155166864396, "num_tokens": 46237417.0, "step": 26660 }, { "entropy": 5.415677404403686, "epoch": 2.0746158334954288, "grad_norm": 1.328125, "learning_rate": 0.0004565061049058892, "loss": 5.1254, "mean_token_accuracy": 0.17920970618724824, "num_tokens": 46246344.0, "step": 26665 }, { "entropy": 5.469440650939942, "epoch": 2.0750048628671465, "grad_norm": 1.3828125, "learning_rate": 0.00045648972445808963, "loss": 5.1355, "mean_token_accuracy": 0.1877238243818283, "num_tokens": 46255286.0, "step": 26670 }, { "entropy": 5.509819650650025, "epoch": 2.075393892238864, "grad_norm": 1.2578125, "learning_rate": 0.00045647334125647235, "loss": 5.1122, "mean_token_accuracy": 0.1903544098138809, "num_tokens": 46264737.0, "step": 26675 }, { "entropy": 5.404733943939209, "epoch": 2.0757829216105814, "grad_norm": 1.1640625, "learning_rate": 0.000456456955301286, "loss": 5.0166, "mean_token_accuracy": 0.19794097989797593, "num_tokens": 46273159.0, "step": 26680 }, { "entropy": 5.452092266082763, "epoch": 2.076171950982299, "grad_norm": 1.328125, "learning_rate": 0.0004564405665927791, "loss": 5.0906, "mean_token_accuracy": 0.1851406380534172, "num_tokens": 46281559.0, "step": 26685 }, { "entropy": 5.394826936721802, "epoch": 2.076560980354017, "grad_norm": 1.234375, "learning_rate": 0.00045642417513120043, "loss": 5.0289, "mean_token_accuracy": 0.19696059226989746, "num_tokens": 46289941.0, "step": 26690 }, { "entropy": 5.40030345916748, "epoch": 2.076950009725734, "grad_norm": 1.1953125, "learning_rate": 0.00045640778091679876, "loss": 5.0354, "mean_token_accuracy": 0.1922016590833664, "num_tokens": 46298711.0, "step": 26695 }, { "entropy": 5.399805974960327, "epoch": 2.0773390390974518, "grad_norm": 1.2265625, "learning_rate": 0.0004563913839498226, "loss": 4.9964, "mean_token_accuracy": 0.190868778526783, "num_tokens": 46306956.0, "step": 26700 }, { "entropy": 5.474187707901001, "epoch": 2.0777280684691695, "grad_norm": 1.2578125, "learning_rate": 0.000456374984230521, "loss": 5.0144, "mean_token_accuracy": 0.1913638561964035, "num_tokens": 46315165.0, "step": 26705 }, { "entropy": 5.4113133430480955, "epoch": 2.078117097840887, "grad_norm": 1.25, "learning_rate": 0.0004563585817591427, "loss": 4.947, "mean_token_accuracy": 0.20016194581985475, "num_tokens": 46323347.0, "step": 26710 }, { "entropy": 5.4486222743988035, "epoch": 2.0785061272126044, "grad_norm": 1.28125, "learning_rate": 0.0004563421765359365, "loss": 5.075, "mean_token_accuracy": 0.19261564761400224, "num_tokens": 46331302.0, "step": 26715 }, { "entropy": 5.436268615722656, "epoch": 2.078895156584322, "grad_norm": 1.2265625, "learning_rate": 0.00045632576856115156, "loss": 5.0971, "mean_token_accuracy": 0.1845285639166832, "num_tokens": 46339050.0, "step": 26720 }, { "entropy": 5.4048937320709225, "epoch": 2.07928418595604, "grad_norm": 1.1328125, "learning_rate": 0.00045630935783503657, "loss": 5.073, "mean_token_accuracy": 0.19236867129802704, "num_tokens": 46347350.0, "step": 26725 }, { "entropy": 5.523930406570434, "epoch": 2.079673215327757, "grad_norm": 1.3515625, "learning_rate": 0.0004562929443578407, "loss": 5.1607, "mean_token_accuracy": 0.17551758736371995, "num_tokens": 46356951.0, "step": 26730 }, { "entropy": 5.569313859939575, "epoch": 2.0800622446994748, "grad_norm": 1.2890625, "learning_rate": 0.0004562765281298129, "loss": 5.1806, "mean_token_accuracy": 0.18447115272283554, "num_tokens": 46367056.0, "step": 26735 }, { "entropy": 5.418645620346069, "epoch": 2.0804512740711925, "grad_norm": 1.15625, "learning_rate": 0.0004562601091512024, "loss": 5.062, "mean_token_accuracy": 0.1939232885837555, "num_tokens": 46375668.0, "step": 26740 }, { "entropy": 5.414381265640259, "epoch": 2.08084030344291, "grad_norm": 1.1875, "learning_rate": 0.0004562436874222582, "loss": 5.086, "mean_token_accuracy": 0.18924905955791474, "num_tokens": 46384460.0, "step": 26745 }, { "entropy": 5.321546459197998, "epoch": 2.0812293328146274, "grad_norm": 1.1875, "learning_rate": 0.00045622726294322955, "loss": 4.9072, "mean_token_accuracy": 0.19551345109939575, "num_tokens": 46393349.0, "step": 26750 }, { "entropy": 5.435777044296264, "epoch": 2.081618362186345, "grad_norm": 1.1875, "learning_rate": 0.00045621083571436563, "loss": 5.0909, "mean_token_accuracy": 0.18395120948553084, "num_tokens": 46403081.0, "step": 26755 }, { "entropy": 5.3761180400848385, "epoch": 2.082007391558063, "grad_norm": 1.203125, "learning_rate": 0.0004561944057359157, "loss": 4.944, "mean_token_accuracy": 0.199859519302845, "num_tokens": 46412219.0, "step": 26760 }, { "entropy": 5.471138668060303, "epoch": 2.08239642092978, "grad_norm": 1.2890625, "learning_rate": 0.0004561779730081291, "loss": 5.1175, "mean_token_accuracy": 0.19303781688213348, "num_tokens": 46420811.0, "step": 26765 }, { "entropy": 5.33242883682251, "epoch": 2.0827854503014978, "grad_norm": 1.2734375, "learning_rate": 0.0004561615375312551, "loss": 5.0116, "mean_token_accuracy": 0.1910262480378151, "num_tokens": 46429431.0, "step": 26770 }, { "entropy": 5.425367927551269, "epoch": 2.0831744796732155, "grad_norm": 1.25, "learning_rate": 0.00045614509930554304, "loss": 5.0834, "mean_token_accuracy": 0.18684103786945344, "num_tokens": 46438344.0, "step": 26775 }, { "entropy": 5.499448537826538, "epoch": 2.0835635090449327, "grad_norm": 1.25, "learning_rate": 0.00045612865833124253, "loss": 5.1484, "mean_token_accuracy": 0.1878812789916992, "num_tokens": 46446960.0, "step": 26780 }, { "entropy": 5.4102109432220455, "epoch": 2.0839525384166504, "grad_norm": 1.171875, "learning_rate": 0.0004561122146086029, "loss": 5.0397, "mean_token_accuracy": 0.19318843483924866, "num_tokens": 46454862.0, "step": 26785 }, { "entropy": 5.435419607162475, "epoch": 2.084341567788368, "grad_norm": 1.296875, "learning_rate": 0.0004560957681378737, "loss": 5.1569, "mean_token_accuracy": 0.18789760768413544, "num_tokens": 46463208.0, "step": 26790 }, { "entropy": 5.526937437057495, "epoch": 2.084730597160086, "grad_norm": 1.25, "learning_rate": 0.00045607931891930445, "loss": 5.1728, "mean_token_accuracy": 0.18427389115095139, "num_tokens": 46472253.0, "step": 26795 }, { "entropy": 5.575931739807129, "epoch": 2.085119626531803, "grad_norm": 1.25, "learning_rate": 0.0004560628669531447, "loss": 5.1762, "mean_token_accuracy": 0.18843009322881699, "num_tokens": 46482133.0, "step": 26800 }, { "entropy": 5.43471245765686, "epoch": 2.0855086559035207, "grad_norm": 1.2421875, "learning_rate": 0.00045604641223964416, "loss": 5.1283, "mean_token_accuracy": 0.1859818920493126, "num_tokens": 46491566.0, "step": 26805 }, { "entropy": 5.483510065078735, "epoch": 2.0858976852752384, "grad_norm": 1.2421875, "learning_rate": 0.00045602995477905247, "loss": 5.1576, "mean_token_accuracy": 0.17420623004436492, "num_tokens": 46501283.0, "step": 26810 }, { "entropy": 5.5487672805786135, "epoch": 2.0862867146469557, "grad_norm": 1.1171875, "learning_rate": 0.0004560134945716194, "loss": 5.1095, "mean_token_accuracy": 0.18795526921749114, "num_tokens": 46510384.0, "step": 26815 }, { "entropy": 5.519675445556641, "epoch": 2.0866757440186734, "grad_norm": 1.2890625, "learning_rate": 0.00045599703161759464, "loss": 5.0839, "mean_token_accuracy": 0.18378926813602448, "num_tokens": 46519202.0, "step": 26820 }, { "entropy": 5.416194581985474, "epoch": 2.087064773390391, "grad_norm": 1.2265625, "learning_rate": 0.00045598056591722805, "loss": 5.0521, "mean_token_accuracy": 0.19471883177757263, "num_tokens": 46528030.0, "step": 26825 }, { "entropy": 5.476199293136597, "epoch": 2.0874538027621083, "grad_norm": 1.2265625, "learning_rate": 0.00045596409747076936, "loss": 5.1469, "mean_token_accuracy": 0.19041065871715546, "num_tokens": 46537222.0, "step": 26830 }, { "entropy": 5.498877620697021, "epoch": 2.087842832133826, "grad_norm": 1.234375, "learning_rate": 0.0004559476262784686, "loss": 5.0657, "mean_token_accuracy": 0.19220069497823716, "num_tokens": 46546486.0, "step": 26835 }, { "entropy": 5.50741868019104, "epoch": 2.0882318615055437, "grad_norm": 1.21875, "learning_rate": 0.0004559311523405755, "loss": 5.1267, "mean_token_accuracy": 0.18929739892482758, "num_tokens": 46554518.0, "step": 26840 }, { "entropy": 5.5014581203460695, "epoch": 2.0886208908772614, "grad_norm": 1.2421875, "learning_rate": 0.0004559146756573402, "loss": 5.093, "mean_token_accuracy": 0.18957652896642685, "num_tokens": 46563183.0, "step": 26845 }, { "entropy": 5.418142318725586, "epoch": 2.0890099202489787, "grad_norm": 1.265625, "learning_rate": 0.00045589819622901274, "loss": 4.9733, "mean_token_accuracy": 0.19585610330104827, "num_tokens": 46571514.0, "step": 26850 }, { "entropy": 5.427031993865967, "epoch": 2.0893989496206964, "grad_norm": 1.2109375, "learning_rate": 0.000455881714055843, "loss": 5.0884, "mean_token_accuracy": 0.1900682717561722, "num_tokens": 46580827.0, "step": 26855 }, { "entropy": 5.500057506561279, "epoch": 2.089787978992414, "grad_norm": 1.171875, "learning_rate": 0.00045586522913808114, "loss": 5.1467, "mean_token_accuracy": 0.18281211853027343, "num_tokens": 46591254.0, "step": 26860 }, { "entropy": 5.4590778827667235, "epoch": 2.0901770083641313, "grad_norm": 1.21875, "learning_rate": 0.0004558487414759773, "loss": 5.0245, "mean_token_accuracy": 0.19076938182115555, "num_tokens": 46599576.0, "step": 26865 }, { "entropy": 5.408864831924438, "epoch": 2.090566037735849, "grad_norm": 1.3125, "learning_rate": 0.00045583225106978175, "loss": 5.0925, "mean_token_accuracy": 0.1896760046482086, "num_tokens": 46607607.0, "step": 26870 }, { "entropy": 5.35610785484314, "epoch": 2.0909550671075667, "grad_norm": 1.2265625, "learning_rate": 0.0004558157579197446, "loss": 5.0217, "mean_token_accuracy": 0.19266801029443742, "num_tokens": 46616446.0, "step": 26875 }, { "entropy": 5.461592102050782, "epoch": 2.091344096479284, "grad_norm": 1.203125, "learning_rate": 0.00045579926202611603, "loss": 5.0055, "mean_token_accuracy": 0.18817213773727418, "num_tokens": 46624875.0, "step": 26880 }, { "entropy": 5.4236732006073, "epoch": 2.0917331258510017, "grad_norm": 1.1640625, "learning_rate": 0.0004557827633891465, "loss": 5.0104, "mean_token_accuracy": 0.19401447474956512, "num_tokens": 46633354.0, "step": 26885 }, { "entropy": 5.440175342559814, "epoch": 2.0921221552227194, "grad_norm": 1.3359375, "learning_rate": 0.0004557662620090863, "loss": 5.0953, "mean_token_accuracy": 0.1941651865839958, "num_tokens": 46642034.0, "step": 26890 }, { "entropy": 5.438977003097534, "epoch": 2.092511184594437, "grad_norm": 1.296875, "learning_rate": 0.00045574975788618564, "loss": 5.0705, "mean_token_accuracy": 0.18808974027633668, "num_tokens": 46650675.0, "step": 26895 }, { "entropy": 5.405484294891357, "epoch": 2.0929002139661543, "grad_norm": 1.2890625, "learning_rate": 0.0004557332510206953, "loss": 4.9798, "mean_token_accuracy": 0.19802161902189255, "num_tokens": 46658834.0, "step": 26900 }, { "entropy": 5.3337541103363035, "epoch": 2.093289243337872, "grad_norm": 1.140625, "learning_rate": 0.0004557167414128654, "loss": 4.9514, "mean_token_accuracy": 0.20096097737550736, "num_tokens": 46667386.0, "step": 26905 }, { "entropy": 5.372097730636597, "epoch": 2.0936782727095897, "grad_norm": 1.2421875, "learning_rate": 0.0004557002290629467, "loss": 4.9626, "mean_token_accuracy": 0.20097084492444992, "num_tokens": 46675492.0, "step": 26910 }, { "entropy": 5.394836950302124, "epoch": 2.094067302081307, "grad_norm": 1.234375, "learning_rate": 0.00045568371397118954, "loss": 5.0709, "mean_token_accuracy": 0.19426148980855942, "num_tokens": 46684079.0, "step": 26915 }, { "entropy": 5.4286980628967285, "epoch": 2.0944563314530247, "grad_norm": 1.25, "learning_rate": 0.0004556671961378446, "loss": 5.1026, "mean_token_accuracy": 0.1844624862074852, "num_tokens": 46693059.0, "step": 26920 }, { "entropy": 5.51028356552124, "epoch": 2.0948453608247424, "grad_norm": 1.2578125, "learning_rate": 0.00045565067556316264, "loss": 5.0375, "mean_token_accuracy": 0.19147275537252426, "num_tokens": 46701639.0, "step": 26925 }, { "entropy": 5.446740913391113, "epoch": 2.0952343901964596, "grad_norm": 1.1875, "learning_rate": 0.0004556341522473941, "loss": 5.0944, "mean_token_accuracy": 0.19343752562999725, "num_tokens": 46710870.0, "step": 26930 }, { "entropy": 5.504725217819214, "epoch": 2.0956234195681773, "grad_norm": 1.203125, "learning_rate": 0.0004556176261907899, "loss": 5.1207, "mean_token_accuracy": 0.1879246711730957, "num_tokens": 46719236.0, "step": 26935 }, { "entropy": 5.439628601074219, "epoch": 2.096012448939895, "grad_norm": 1.234375, "learning_rate": 0.0004556010973936006, "loss": 5.0609, "mean_token_accuracy": 0.1904678836464882, "num_tokens": 46727595.0, "step": 26940 }, { "entropy": 5.458144617080689, "epoch": 2.0964014783116127, "grad_norm": 1.265625, "learning_rate": 0.0004555845658560772, "loss": 5.0648, "mean_token_accuracy": 0.19215698689222335, "num_tokens": 46735874.0, "step": 26945 }, { "entropy": 5.404890298843384, "epoch": 2.09679050768333, "grad_norm": 1.3984375, "learning_rate": 0.00045556803157847036, "loss": 5.0841, "mean_token_accuracy": 0.1939731389284134, "num_tokens": 46744738.0, "step": 26950 }, { "entropy": 5.475359582901001, "epoch": 2.0971795370550477, "grad_norm": 1.34375, "learning_rate": 0.00045555149456103113, "loss": 5.0566, "mean_token_accuracy": 0.18531084954738616, "num_tokens": 46753252.0, "step": 26955 }, { "entropy": 5.410978078842163, "epoch": 2.0975685664267654, "grad_norm": 1.1640625, "learning_rate": 0.0004555349548040102, "loss": 4.9936, "mean_token_accuracy": 0.192803356051445, "num_tokens": 46761234.0, "step": 26960 }, { "entropy": 5.438618946075439, "epoch": 2.0979575957984826, "grad_norm": 1.1875, "learning_rate": 0.0004555184123076589, "loss": 5.1332, "mean_token_accuracy": 0.17934600114822388, "num_tokens": 46770087.0, "step": 26965 }, { "entropy": 5.403347969055176, "epoch": 2.0983466251702003, "grad_norm": 1.25, "learning_rate": 0.00045550186707222785, "loss": 5.0017, "mean_token_accuracy": 0.19087327569723128, "num_tokens": 46778985.0, "step": 26970 }, { "entropy": 5.431661319732666, "epoch": 2.098735654541918, "grad_norm": 1.234375, "learning_rate": 0.0004554853190979683, "loss": 5.0994, "mean_token_accuracy": 0.19005565643310546, "num_tokens": 46787402.0, "step": 26975 }, { "entropy": 5.4861914157867435, "epoch": 2.0991246839136353, "grad_norm": 1.28125, "learning_rate": 0.00045546876838513134, "loss": 5.1137, "mean_token_accuracy": 0.17927255779504775, "num_tokens": 46796254.0, "step": 26980 }, { "entropy": 5.4192259311676025, "epoch": 2.099513713285353, "grad_norm": 1.21875, "learning_rate": 0.00045545221493396805, "loss": 5.0464, "mean_token_accuracy": 0.1902633339166641, "num_tokens": 46804979.0, "step": 26985 }, { "entropy": 5.3654101371765135, "epoch": 2.0999027426570707, "grad_norm": 1.15625, "learning_rate": 0.00045543565874472963, "loss": 4.9886, "mean_token_accuracy": 0.1958442971110344, "num_tokens": 46813718.0, "step": 26990 }, { "entropy": 5.475353765487671, "epoch": 2.1002917720287884, "grad_norm": 1.203125, "learning_rate": 0.00045541909981766725, "loss": 5.0951, "mean_token_accuracy": 0.1835153505206108, "num_tokens": 46822265.0, "step": 26995 }, { "entropy": 5.432806825637817, "epoch": 2.1006808014005056, "grad_norm": 1.1640625, "learning_rate": 0.0004554025381530322, "loss": 5.0497, "mean_token_accuracy": 0.1957593619823456, "num_tokens": 46831292.0, "step": 27000 }, { "epoch": 2.1006808014005056, "eval_entropy": 5.212705510848984, "eval_loss": 5.211482524871826, "eval_mean_token_accuracy": 0.1925574202302044, "eval_num_tokens": 46831292.0, "eval_runtime": 28.7252, "eval_samples_per_second": 1446.745, "eval_steps_per_second": 180.852, "step": 27000 }, { "entropy": 5.319648027420044, "epoch": 2.1010698307722233, "grad_norm": 1.1328125, "learning_rate": 0.0004553859737510758, "loss": 5.0331, "mean_token_accuracy": 0.20153597891330718, "num_tokens": 46840029.0, "step": 27005 }, { "entropy": 5.408263206481934, "epoch": 2.101458860143941, "grad_norm": 1.1796875, "learning_rate": 0.0004553694066120493, "loss": 4.9651, "mean_token_accuracy": 0.19719047248363494, "num_tokens": 46848475.0, "step": 27010 }, { "entropy": 5.497275447845459, "epoch": 2.1018478895156583, "grad_norm": 1.1953125, "learning_rate": 0.00045535283673620426, "loss": 5.1135, "mean_token_accuracy": 0.1872415155172348, "num_tokens": 46857124.0, "step": 27015 }, { "entropy": 5.560809373855591, "epoch": 2.102236918887376, "grad_norm": 1.3125, "learning_rate": 0.00045533626412379194, "loss": 5.1999, "mean_token_accuracy": 0.18556116968393327, "num_tokens": 46865809.0, "step": 27020 }, { "entropy": 5.440860414505005, "epoch": 2.1026259482590937, "grad_norm": 1.3203125, "learning_rate": 0.0004553196887750638, "loss": 5.1073, "mean_token_accuracy": 0.18493400663137435, "num_tokens": 46874845.0, "step": 27025 }, { "entropy": 5.4391368389129635, "epoch": 2.103014977630811, "grad_norm": 1.25, "learning_rate": 0.0004553031106902714, "loss": 5.0385, "mean_token_accuracy": 0.19123439937829972, "num_tokens": 46883740.0, "step": 27030 }, { "entropy": 5.388023614883423, "epoch": 2.1034040070025286, "grad_norm": 1.1953125, "learning_rate": 0.00045528652986966627, "loss": 5.0239, "mean_token_accuracy": 0.20042583495378494, "num_tokens": 46891936.0, "step": 27035 }, { "entropy": 5.312006092071533, "epoch": 2.1037930363742463, "grad_norm": 1.203125, "learning_rate": 0.00045526994631350006, "loss": 5.0463, "mean_token_accuracy": 0.18921314924955368, "num_tokens": 46900918.0, "step": 27040 }, { "entropy": 5.4372230052948, "epoch": 2.104182065745964, "grad_norm": 1.140625, "learning_rate": 0.0004552533600220243, "loss": 5.0856, "mean_token_accuracy": 0.18699978440999984, "num_tokens": 46910785.0, "step": 27045 }, { "entropy": 5.510256624221801, "epoch": 2.1045710951176813, "grad_norm": 1.34375, "learning_rate": 0.00045523677099549073, "loss": 5.1338, "mean_token_accuracy": 0.1900095283985138, "num_tokens": 46919191.0, "step": 27050 }, { "entropy": 5.340344429016113, "epoch": 2.104960124489399, "grad_norm": 1.109375, "learning_rate": 0.000455220179234151, "loss": 5.0214, "mean_token_accuracy": 0.19161920696496965, "num_tokens": 46927574.0, "step": 27055 }, { "entropy": 5.371052503585815, "epoch": 2.1053491538611167, "grad_norm": 1.28125, "learning_rate": 0.0004552035847382569, "loss": 5.0104, "mean_token_accuracy": 0.19595623165369033, "num_tokens": 46935694.0, "step": 27060 }, { "entropy": 5.485352230072022, "epoch": 2.105738183232834, "grad_norm": 1.3359375, "learning_rate": 0.00045518698750806024, "loss": 5.1502, "mean_token_accuracy": 0.18573129624128343, "num_tokens": 46943929.0, "step": 27065 }, { "entropy": 5.403091287612915, "epoch": 2.1061272126045516, "grad_norm": 1.1953125, "learning_rate": 0.00045517038754381287, "loss": 4.942, "mean_token_accuracy": 0.1995285466313362, "num_tokens": 46952130.0, "step": 27070 }, { "entropy": 5.396305942535401, "epoch": 2.1065162419762693, "grad_norm": 1.203125, "learning_rate": 0.0004551537848457666, "loss": 5.1003, "mean_token_accuracy": 0.1918123722076416, "num_tokens": 46961010.0, "step": 27075 }, { "entropy": 5.45666356086731, "epoch": 2.106905271347987, "grad_norm": 1.265625, "learning_rate": 0.0004551371794141734, "loss": 5.0937, "mean_token_accuracy": 0.18980918377637862, "num_tokens": 46969789.0, "step": 27080 }, { "entropy": 5.515809869766235, "epoch": 2.1072943007197042, "grad_norm": 1.2109375, "learning_rate": 0.0004551205712492852, "loss": 5.1191, "mean_token_accuracy": 0.1911153793334961, "num_tokens": 46977436.0, "step": 27085 }, { "entropy": 5.430668735504151, "epoch": 2.107683330091422, "grad_norm": 1.2890625, "learning_rate": 0.0004551039603513541, "loss": 5.0727, "mean_token_accuracy": 0.1939419686794281, "num_tokens": 46986065.0, "step": 27090 }, { "entropy": 5.4206853866577145, "epoch": 2.1080723594631396, "grad_norm": 1.1953125, "learning_rate": 0.00045508734672063204, "loss": 5.0802, "mean_token_accuracy": 0.18355799168348313, "num_tokens": 46994355.0, "step": 27095 }, { "entropy": 5.3749549865722654, "epoch": 2.108461388834857, "grad_norm": 1.2421875, "learning_rate": 0.0004550707303573711, "loss": 5.0283, "mean_token_accuracy": 0.18941378593444824, "num_tokens": 47003028.0, "step": 27100 }, { "entropy": 5.45003752708435, "epoch": 2.1088504182065746, "grad_norm": 1.28125, "learning_rate": 0.00045505411126182347, "loss": 5.1741, "mean_token_accuracy": 0.18125323504209517, "num_tokens": 47012351.0, "step": 27105 }, { "entropy": 5.516589403152466, "epoch": 2.1092394475782923, "grad_norm": 1.25, "learning_rate": 0.0004550374894342412, "loss": 5.1012, "mean_token_accuracy": 0.2013810694217682, "num_tokens": 47020600.0, "step": 27110 }, { "entropy": 5.386406469345093, "epoch": 2.1096284769500095, "grad_norm": 1.28125, "learning_rate": 0.0004550208648748767, "loss": 5.0605, "mean_token_accuracy": 0.18609558343887328, "num_tokens": 47029276.0, "step": 27115 }, { "entropy": 5.379668283462524, "epoch": 2.1100175063217272, "grad_norm": 1.1328125, "learning_rate": 0.000455004237583982, "loss": 5.0106, "mean_token_accuracy": 0.19206558167934418, "num_tokens": 47037894.0, "step": 27120 }, { "entropy": 5.3908305168151855, "epoch": 2.110406535693445, "grad_norm": 1.1953125, "learning_rate": 0.0004549876075618096, "loss": 5.0097, "mean_token_accuracy": 0.1887384682893753, "num_tokens": 47046602.0, "step": 27125 }, { "entropy": 5.444711303710937, "epoch": 2.110795565065162, "grad_norm": 1.25, "learning_rate": 0.0004549709748086117, "loss": 5.1698, "mean_token_accuracy": 0.18722872734069823, "num_tokens": 47056091.0, "step": 27130 }, { "entropy": 5.517124319076538, "epoch": 2.11118459443688, "grad_norm": 1.21875, "learning_rate": 0.00045495433932464063, "loss": 5.1146, "mean_token_accuracy": 0.17795937955379487, "num_tokens": 47065420.0, "step": 27135 }, { "entropy": 5.478368425369263, "epoch": 2.1115736238085976, "grad_norm": 1.2109375, "learning_rate": 0.000454937701110149, "loss": 5.0554, "mean_token_accuracy": 0.19001957029104233, "num_tokens": 47074247.0, "step": 27140 }, { "entropy": 5.492049312591552, "epoch": 2.1119626531803153, "grad_norm": 1.21875, "learning_rate": 0.00045492106016538917, "loss": 5.1624, "mean_token_accuracy": 0.17680409401655198, "num_tokens": 47083589.0, "step": 27145 }, { "entropy": 5.448315763473511, "epoch": 2.1123516825520325, "grad_norm": 1.3046875, "learning_rate": 0.00045490441649061354, "loss": 5.0281, "mean_token_accuracy": 0.18793509155511856, "num_tokens": 47091861.0, "step": 27150 }, { "entropy": 5.51703462600708, "epoch": 2.1127407119237502, "grad_norm": 1.1796875, "learning_rate": 0.0004548877700860747, "loss": 5.2389, "mean_token_accuracy": 0.17979475408792495, "num_tokens": 47101436.0, "step": 27155 }, { "entropy": 5.447565650939941, "epoch": 2.113129741295468, "grad_norm": 1.1796875, "learning_rate": 0.00045487112095202544, "loss": 5.0732, "mean_token_accuracy": 0.19703569412231445, "num_tokens": 47110390.0, "step": 27160 }, { "entropy": 5.518107795715332, "epoch": 2.113518770667185, "grad_norm": 1.2734375, "learning_rate": 0.0004548544690887181, "loss": 5.227, "mean_token_accuracy": 0.1833069920539856, "num_tokens": 47119001.0, "step": 27165 }, { "entropy": 5.410075855255127, "epoch": 2.113907800038903, "grad_norm": 1.359375, "learning_rate": 0.0004548378144964054, "loss": 5.0382, "mean_token_accuracy": 0.19441525787115096, "num_tokens": 47127067.0, "step": 27170 }, { "entropy": 5.503660440444946, "epoch": 2.1142968294106206, "grad_norm": 1.125, "learning_rate": 0.00045482115717534024, "loss": 5.2423, "mean_token_accuracy": 0.17909064143896103, "num_tokens": 47136747.0, "step": 27175 }, { "entropy": 5.482768297195435, "epoch": 2.1146858587823383, "grad_norm": 1.2421875, "learning_rate": 0.0004548044971257752, "loss": 5.0258, "mean_token_accuracy": 0.1966236039996147, "num_tokens": 47145783.0, "step": 27180 }, { "entropy": 5.4686445713043215, "epoch": 2.1150748881540555, "grad_norm": 1.1796875, "learning_rate": 0.00045478783434796307, "loss": 5.0753, "mean_token_accuracy": 0.18881845027208327, "num_tokens": 47154344.0, "step": 27185 }, { "entropy": 5.386042785644531, "epoch": 2.1154639175257732, "grad_norm": 1.25, "learning_rate": 0.00045477116884215675, "loss": 5.0962, "mean_token_accuracy": 0.18970223963260652, "num_tokens": 47163733.0, "step": 27190 }, { "entropy": 5.414426374435425, "epoch": 2.115852946897491, "grad_norm": 1.1953125, "learning_rate": 0.000454754500608609, "loss": 5.0815, "mean_token_accuracy": 0.19444743543863297, "num_tokens": 47172341.0, "step": 27195 }, { "entropy": 5.2976878643035885, "epoch": 2.116241976269208, "grad_norm": 1.140625, "learning_rate": 0.0004547378296475729, "loss": 4.882, "mean_token_accuracy": 0.20876674503087997, "num_tokens": 47181118.0, "step": 27200 }, { "entropy": 5.422082853317261, "epoch": 2.116631005640926, "grad_norm": 1.2265625, "learning_rate": 0.00045472115595930124, "loss": 5.1567, "mean_token_accuracy": 0.18738051801919936, "num_tokens": 47190348.0, "step": 27205 }, { "entropy": 5.466672468185425, "epoch": 2.1170200350126436, "grad_norm": 1.203125, "learning_rate": 0.00045470447954404716, "loss": 5.1683, "mean_token_accuracy": 0.18718502968549727, "num_tokens": 47199812.0, "step": 27210 }, { "entropy": 5.512445497512817, "epoch": 2.117409064384361, "grad_norm": 1.3359375, "learning_rate": 0.00045468780040206364, "loss": 5.0687, "mean_token_accuracy": 0.19043071269989015, "num_tokens": 47208547.0, "step": 27215 }, { "entropy": 5.396255111694336, "epoch": 2.1177980937560785, "grad_norm": 1.1796875, "learning_rate": 0.0004546711185336037, "loss": 5.0087, "mean_token_accuracy": 0.19955634772777558, "num_tokens": 47216980.0, "step": 27220 }, { "entropy": 5.435706949234008, "epoch": 2.1181871231277962, "grad_norm": 1.25, "learning_rate": 0.00045465443393892047, "loss": 5.1168, "mean_token_accuracy": 0.18398870825767516, "num_tokens": 47225701.0, "step": 27225 }, { "entropy": 5.478459644317627, "epoch": 2.118576152499514, "grad_norm": 1.171875, "learning_rate": 0.0004546377466182673, "loss": 5.1166, "mean_token_accuracy": 0.1901984393596649, "num_tokens": 47234760.0, "step": 27230 }, { "entropy": 5.497698640823364, "epoch": 2.118965181871231, "grad_norm": 1.2421875, "learning_rate": 0.0004546210565718972, "loss": 5.1146, "mean_token_accuracy": 0.18418630361557006, "num_tokens": 47243392.0, "step": 27235 }, { "entropy": 5.440277814865112, "epoch": 2.119354211242949, "grad_norm": 1.2890625, "learning_rate": 0.00045460436380006337, "loss": 5.0706, "mean_token_accuracy": 0.19175945669412614, "num_tokens": 47251297.0, "step": 27240 }, { "entropy": 5.323189783096313, "epoch": 2.1197432406146666, "grad_norm": 1.3359375, "learning_rate": 0.0004545876683030192, "loss": 4.9474, "mean_token_accuracy": 0.19277252554893493, "num_tokens": 47259859.0, "step": 27245 }, { "entropy": 5.479398107528686, "epoch": 2.120132269986384, "grad_norm": 1.265625, "learning_rate": 0.0004545709700810181, "loss": 5.1164, "mean_token_accuracy": 0.19212204664945604, "num_tokens": 47268653.0, "step": 27250 }, { "entropy": 5.485763931274414, "epoch": 2.1205212993581015, "grad_norm": 1.2421875, "learning_rate": 0.0004545542691343133, "loss": 5.0414, "mean_token_accuracy": 0.18908853381872176, "num_tokens": 47277254.0, "step": 27255 }, { "entropy": 5.458822727203369, "epoch": 2.120910328729819, "grad_norm": 1.1875, "learning_rate": 0.0004545375654631582, "loss": 5.1261, "mean_token_accuracy": 0.18795017302036285, "num_tokens": 47285885.0, "step": 27260 }, { "entropy": 5.3482067584991455, "epoch": 2.1212993581015365, "grad_norm": 1.140625, "learning_rate": 0.00045452085906780645, "loss": 5.0457, "mean_token_accuracy": 0.19111974090337752, "num_tokens": 47294025.0, "step": 27265 }, { "entropy": 5.349497747421265, "epoch": 2.121688387473254, "grad_norm": 1.2890625, "learning_rate": 0.00045450414994851123, "loss": 5.0149, "mean_token_accuracy": 0.19197070002555847, "num_tokens": 47303531.0, "step": 27270 }, { "entropy": 5.4431891441345215, "epoch": 2.122077416844972, "grad_norm": 1.2578125, "learning_rate": 0.00045448743810552636, "loss": 5.1466, "mean_token_accuracy": 0.18833398669958115, "num_tokens": 47311753.0, "step": 27275 }, { "entropy": 5.384894466400146, "epoch": 2.1224664462166896, "grad_norm": 1.1953125, "learning_rate": 0.00045447072353910537, "loss": 5.0455, "mean_token_accuracy": 0.18789823949337006, "num_tokens": 47320736.0, "step": 27280 }, { "entropy": 5.505587005615235, "epoch": 2.122855475588407, "grad_norm": 1.2109375, "learning_rate": 0.0004544540062495016, "loss": 5.0716, "mean_token_accuracy": 0.1924387976527214, "num_tokens": 47329498.0, "step": 27285 }, { "entropy": 5.459635448455811, "epoch": 2.1232445049601245, "grad_norm": 1.2109375, "learning_rate": 0.00045443728623696905, "loss": 5.1251, "mean_token_accuracy": 0.18720201402902603, "num_tokens": 47338375.0, "step": 27290 }, { "entropy": 5.359905052185058, "epoch": 2.123633534331842, "grad_norm": 1.2421875, "learning_rate": 0.00045442056350176123, "loss": 5.0777, "mean_token_accuracy": 0.1917021319270134, "num_tokens": 47346608.0, "step": 27295 }, { "entropy": 5.472007989883423, "epoch": 2.1240225637035595, "grad_norm": 1.2734375, "learning_rate": 0.000454403838044132, "loss": 5.1358, "mean_token_accuracy": 0.1864597961306572, "num_tokens": 47355375.0, "step": 27300 }, { "entropy": 5.417171621322632, "epoch": 2.124411593075277, "grad_norm": 1.2109375, "learning_rate": 0.000454387109864335, "loss": 5.0552, "mean_token_accuracy": 0.19496077299118042, "num_tokens": 47363138.0, "step": 27305 }, { "entropy": 5.518266725540161, "epoch": 2.124800622446995, "grad_norm": 1.2734375, "learning_rate": 0.00045437037896262425, "loss": 5.1801, "mean_token_accuracy": 0.17953557819128035, "num_tokens": 47371431.0, "step": 27310 }, { "entropy": 5.419029664993286, "epoch": 2.125189651818712, "grad_norm": 1.171875, "learning_rate": 0.0004543536453392534, "loss": 5.0451, "mean_token_accuracy": 0.1967315211892128, "num_tokens": 47379739.0, "step": 27315 }, { "entropy": 5.448039960861206, "epoch": 2.12557868119043, "grad_norm": 1.203125, "learning_rate": 0.00045433690899447643, "loss": 5.0944, "mean_token_accuracy": 0.18771040290594102, "num_tokens": 47389240.0, "step": 27320 }, { "entropy": 5.429193830490112, "epoch": 2.1259677105621475, "grad_norm": 1.171875, "learning_rate": 0.00045432016992854734, "loss": 4.985, "mean_token_accuracy": 0.19559376835823059, "num_tokens": 47397666.0, "step": 27325 }, { "entropy": 5.403881788253784, "epoch": 2.126356739933865, "grad_norm": 1.2578125, "learning_rate": 0.0004543034281417201, "loss": 5.1311, "mean_token_accuracy": 0.1848018705844879, "num_tokens": 47407419.0, "step": 27330 }, { "entropy": 5.42021803855896, "epoch": 2.1267457693055825, "grad_norm": 1.140625, "learning_rate": 0.0004542866836342488, "loss": 5.1238, "mean_token_accuracy": 0.18618351072072983, "num_tokens": 47416750.0, "step": 27335 }, { "entropy": 5.486727333068847, "epoch": 2.1271347986773, "grad_norm": 1.234375, "learning_rate": 0.0004542699364063873, "loss": 5.0872, "mean_token_accuracy": 0.19028878808021546, "num_tokens": 47425833.0, "step": 27340 }, { "entropy": 5.373021125793457, "epoch": 2.127523828049018, "grad_norm": 1.2421875, "learning_rate": 0.0004542531864583899, "loss": 5.0213, "mean_token_accuracy": 0.18876579254865647, "num_tokens": 47434470.0, "step": 27345 }, { "entropy": 5.5226404666900635, "epoch": 2.127912857420735, "grad_norm": 1.1953125, "learning_rate": 0.0004542364337905108, "loss": 5.0957, "mean_token_accuracy": 0.1855452060699463, "num_tokens": 47442904.0, "step": 27350 }, { "entropy": 5.492037534713745, "epoch": 2.128301886792453, "grad_norm": 1.2421875, "learning_rate": 0.00045421967840300403, "loss": 5.1327, "mean_token_accuracy": 0.19095717668533324, "num_tokens": 47452373.0, "step": 27355 }, { "entropy": 5.402172946929932, "epoch": 2.1286909161641705, "grad_norm": 1.2421875, "learning_rate": 0.0004542029202961239, "loss": 4.9473, "mean_token_accuracy": 0.19280818551778794, "num_tokens": 47460504.0, "step": 27360 }, { "entropy": 5.4122096538543705, "epoch": 2.1290799455358878, "grad_norm": 1.1796875, "learning_rate": 0.00045418615947012464, "loss": 5.0633, "mean_token_accuracy": 0.18990051746368408, "num_tokens": 47469526.0, "step": 27365 }, { "entropy": 5.409101057052612, "epoch": 2.1294689749076054, "grad_norm": 1.2578125, "learning_rate": 0.0004541693959252607, "loss": 5.0344, "mean_token_accuracy": 0.19243221431970597, "num_tokens": 47478241.0, "step": 27370 }, { "entropy": 5.407530307769775, "epoch": 2.129858004279323, "grad_norm": 1.2265625, "learning_rate": 0.00045415262966178635, "loss": 5.0323, "mean_token_accuracy": 0.19911688715219497, "num_tokens": 47486956.0, "step": 27375 }, { "entropy": 5.3898216724395756, "epoch": 2.130247033651041, "grad_norm": 1.2421875, "learning_rate": 0.0004541358606799559, "loss": 4.9619, "mean_token_accuracy": 0.20635183602571489, "num_tokens": 47494817.0, "step": 27380 }, { "entropy": 5.355669021606445, "epoch": 2.130636063022758, "grad_norm": 1.2265625, "learning_rate": 0.000454119088980024, "loss": 5.0647, "mean_token_accuracy": 0.18386910259723663, "num_tokens": 47504124.0, "step": 27385 }, { "entropy": 5.516399478912353, "epoch": 2.131025092394476, "grad_norm": 1.3046875, "learning_rate": 0.0004541023145622449, "loss": 5.0609, "mean_token_accuracy": 0.18649635165929795, "num_tokens": 47513160.0, "step": 27390 }, { "entropy": 5.4230626106262205, "epoch": 2.1314141217661935, "grad_norm": 1.1484375, "learning_rate": 0.00045408553742687336, "loss": 4.9707, "mean_token_accuracy": 0.19775646328926086, "num_tokens": 47521298.0, "step": 27395 }, { "entropy": 5.293092393875122, "epoch": 2.1318031511379107, "grad_norm": 1.3046875, "learning_rate": 0.0004540687575741638, "loss": 5.0, "mean_token_accuracy": 0.1913327768445015, "num_tokens": 47529516.0, "step": 27400 }, { "entropy": 5.374094772338867, "epoch": 2.1321921805096284, "grad_norm": 1.203125, "learning_rate": 0.00045405197500437077, "loss": 5.0333, "mean_token_accuracy": 0.18559107333421707, "num_tokens": 47538311.0, "step": 27405 }, { "entropy": 5.480267953872681, "epoch": 2.132581209881346, "grad_norm": 1.171875, "learning_rate": 0.00045403518971774915, "loss": 5.1555, "mean_token_accuracy": 0.18266653269529343, "num_tokens": 47547186.0, "step": 27410 }, { "entropy": 5.403508234024048, "epoch": 2.132970239253064, "grad_norm": 1.25, "learning_rate": 0.00045401840171455343, "loss": 4.9908, "mean_token_accuracy": 0.19451460838317872, "num_tokens": 47556173.0, "step": 27415 }, { "entropy": 5.435228538513184, "epoch": 2.133359268624781, "grad_norm": 1.203125, "learning_rate": 0.0004540016109950384, "loss": 5.0031, "mean_token_accuracy": 0.19427998661994933, "num_tokens": 47564595.0, "step": 27420 }, { "entropy": 5.38707857131958, "epoch": 2.133748297996499, "grad_norm": 1.3984375, "learning_rate": 0.0004539848175594589, "loss": 5.0327, "mean_token_accuracy": 0.18725859820842744, "num_tokens": 47573559.0, "step": 27425 }, { "entropy": 5.449259519577026, "epoch": 2.1341373273682165, "grad_norm": 1.1796875, "learning_rate": 0.0004539680214080695, "loss": 4.9788, "mean_token_accuracy": 0.19199885427951813, "num_tokens": 47582178.0, "step": 27430 }, { "entropy": 5.3611307621002195, "epoch": 2.1345263567399337, "grad_norm": 1.140625, "learning_rate": 0.00045395122254112536, "loss": 4.9233, "mean_token_accuracy": 0.19895289242267608, "num_tokens": 47590738.0, "step": 27435 }, { "entropy": 5.465515899658203, "epoch": 2.1349153861116514, "grad_norm": 1.3671875, "learning_rate": 0.0004539344209588812, "loss": 5.1783, "mean_token_accuracy": 0.17806089371442796, "num_tokens": 47599339.0, "step": 27440 }, { "entropy": 5.359873580932617, "epoch": 2.135304415483369, "grad_norm": 1.1328125, "learning_rate": 0.00045391761666159204, "loss": 5.0164, "mean_token_accuracy": 0.19119245558977127, "num_tokens": 47608250.0, "step": 27445 }, { "entropy": 5.466415548324585, "epoch": 2.1356934448550864, "grad_norm": 1.2109375, "learning_rate": 0.00045390080964951294, "loss": 5.0789, "mean_token_accuracy": 0.1916109636425972, "num_tokens": 47616823.0, "step": 27450 }, { "entropy": 5.466552305221557, "epoch": 2.136082474226804, "grad_norm": 1.2578125, "learning_rate": 0.00045388399992289864, "loss": 5.1181, "mean_token_accuracy": 0.18937683701515198, "num_tokens": 47627002.0, "step": 27455 }, { "entropy": 5.581350088119507, "epoch": 2.136471503598522, "grad_norm": 1.21875, "learning_rate": 0.00045386718748200436, "loss": 5.178, "mean_token_accuracy": 0.18116298466920852, "num_tokens": 47635588.0, "step": 27460 }, { "entropy": 5.533190441131592, "epoch": 2.136860532970239, "grad_norm": 1.2265625, "learning_rate": 0.00045385037232708534, "loss": 5.1392, "mean_token_accuracy": 0.19071145355701447, "num_tokens": 47645089.0, "step": 27465 }, { "entropy": 5.456801128387451, "epoch": 2.1372495623419567, "grad_norm": 1.171875, "learning_rate": 0.0004538335544583964, "loss": 5.1238, "mean_token_accuracy": 0.1788894295692444, "num_tokens": 47654088.0, "step": 27470 }, { "entropy": 5.474858522415161, "epoch": 2.1376385917136744, "grad_norm": 1.2890625, "learning_rate": 0.00045381673387619306, "loss": 5.1431, "mean_token_accuracy": 0.1856838881969452, "num_tokens": 47662367.0, "step": 27475 }, { "entropy": 5.47779107093811, "epoch": 2.138027621085392, "grad_norm": 1.140625, "learning_rate": 0.00045379991058073035, "loss": 5.0762, "mean_token_accuracy": 0.1819026991724968, "num_tokens": 47670197.0, "step": 27480 }, { "entropy": 5.386983633041382, "epoch": 2.1384166504571094, "grad_norm": 1.1875, "learning_rate": 0.0004537830845722636, "loss": 5.1166, "mean_token_accuracy": 0.19046351164579392, "num_tokens": 47678396.0, "step": 27485 }, { "entropy": 5.370035600662232, "epoch": 2.138805679828827, "grad_norm": 1.1796875, "learning_rate": 0.0004537662558510481, "loss": 4.9871, "mean_token_accuracy": 0.1928339794278145, "num_tokens": 47686671.0, "step": 27490 }, { "entropy": 5.474032306671143, "epoch": 2.1391947092005448, "grad_norm": 1.234375, "learning_rate": 0.00045374942441733925, "loss": 5.08, "mean_token_accuracy": 0.18277022540569304, "num_tokens": 47694923.0, "step": 27495 }, { "entropy": 5.364909315109253, "epoch": 2.139583738572262, "grad_norm": 1.1953125, "learning_rate": 0.0004537325902713923, "loss": 5.0362, "mean_token_accuracy": 0.19324759840965272, "num_tokens": 47702944.0, "step": 27500 }, { "entropy": 5.461622619628907, "epoch": 2.1399727679439797, "grad_norm": 1.2890625, "learning_rate": 0.0004537157534134629, "loss": 5.093, "mean_token_accuracy": 0.20239340513944626, "num_tokens": 47711075.0, "step": 27505 }, { "entropy": 5.430045557022095, "epoch": 2.1403617973156974, "grad_norm": 1.2109375, "learning_rate": 0.00045369891384380623, "loss": 4.9761, "mean_token_accuracy": 0.19512924253940583, "num_tokens": 47719338.0, "step": 27510 }, { "entropy": 5.480515623092652, "epoch": 2.140750826687415, "grad_norm": 1.15625, "learning_rate": 0.0004536820715626781, "loss": 5.1222, "mean_token_accuracy": 0.18416400402784347, "num_tokens": 47728035.0, "step": 27515 }, { "entropy": 5.4787016868591305, "epoch": 2.1411398560591324, "grad_norm": 1.265625, "learning_rate": 0.00045366522657033385, "loss": 5.0818, "mean_token_accuracy": 0.1825898125767708, "num_tokens": 47736438.0, "step": 27520 }, { "entropy": 5.428909015655518, "epoch": 2.14152888543085, "grad_norm": 1.2890625, "learning_rate": 0.00045364837886702924, "loss": 5.0501, "mean_token_accuracy": 0.19144577533006668, "num_tokens": 47744661.0, "step": 27525 }, { "entropy": 5.436733198165894, "epoch": 2.1419179148025678, "grad_norm": 1.3359375, "learning_rate": 0.0004536315284530198, "loss": 4.9586, "mean_token_accuracy": 0.19463801085948945, "num_tokens": 47752550.0, "step": 27530 }, { "entropy": 5.430111217498779, "epoch": 2.142306944174285, "grad_norm": 1.1875, "learning_rate": 0.0004536146753285612, "loss": 5.0545, "mean_token_accuracy": 0.1974322348833084, "num_tokens": 47761116.0, "step": 27535 }, { "entropy": 5.472072792053223, "epoch": 2.1426959735460027, "grad_norm": 1.2421875, "learning_rate": 0.0004535978194939093, "loss": 5.1541, "mean_token_accuracy": 0.1904282122850418, "num_tokens": 47769804.0, "step": 27540 }, { "entropy": 5.41582236289978, "epoch": 2.1430850029177204, "grad_norm": 1.1796875, "learning_rate": 0.00045358096094931966, "loss": 5.0132, "mean_token_accuracy": 0.19200569838285447, "num_tokens": 47777684.0, "step": 27545 }, { "entropy": 5.383411455154419, "epoch": 2.1434740322894377, "grad_norm": 1.1484375, "learning_rate": 0.0004535640996950482, "loss": 5.0008, "mean_token_accuracy": 0.1942657321691513, "num_tokens": 47786443.0, "step": 27550 }, { "entropy": 5.438593578338623, "epoch": 2.1438630616611554, "grad_norm": 1.21875, "learning_rate": 0.0004535472357313507, "loss": 5.1642, "mean_token_accuracy": 0.18987253159284592, "num_tokens": 47795408.0, "step": 27555 }, { "entropy": 5.396753978729248, "epoch": 2.144252091032873, "grad_norm": 1.1875, "learning_rate": 0.00045353036905848316, "loss": 5.0014, "mean_token_accuracy": 0.1942703381180763, "num_tokens": 47804108.0, "step": 27560 }, { "entropy": 5.448256731033325, "epoch": 2.1446411204045903, "grad_norm": 1.1953125, "learning_rate": 0.0004535134996767014, "loss": 5.0605, "mean_token_accuracy": 0.19769213497638702, "num_tokens": 47811972.0, "step": 27565 }, { "entropy": 5.3705707550048825, "epoch": 2.145030149776308, "grad_norm": 1.203125, "learning_rate": 0.0004534966275862614, "loss": 5.1092, "mean_token_accuracy": 0.18637319207191466, "num_tokens": 47820615.0, "step": 27570 }, { "entropy": 5.462299108505249, "epoch": 2.1454191791480257, "grad_norm": 1.1953125, "learning_rate": 0.0004534797527874192, "loss": 5.1255, "mean_token_accuracy": 0.18862320631742477, "num_tokens": 47828773.0, "step": 27575 }, { "entropy": 5.422725343704224, "epoch": 2.1458082085197434, "grad_norm": 1.2109375, "learning_rate": 0.00045346287528043083, "loss": 5.0298, "mean_token_accuracy": 0.18736000806093217, "num_tokens": 47837197.0, "step": 27580 }, { "entropy": 5.4021069526672365, "epoch": 2.1461972378914607, "grad_norm": 1.21875, "learning_rate": 0.00045344599506555244, "loss": 5.1668, "mean_token_accuracy": 0.18078043162822724, "num_tokens": 47846127.0, "step": 27585 }, { "entropy": 5.436137723922729, "epoch": 2.1465862672631784, "grad_norm": 1.1953125, "learning_rate": 0.00045342911214304, "loss": 5.0606, "mean_token_accuracy": 0.19557226896286012, "num_tokens": 47854832.0, "step": 27590 }, { "entropy": 5.4818675994873045, "epoch": 2.146975296634896, "grad_norm": 1.2421875, "learning_rate": 0.0004534122265131498, "loss": 5.1008, "mean_token_accuracy": 0.194764843583107, "num_tokens": 47862621.0, "step": 27595 }, { "entropy": 5.4536529064178465, "epoch": 2.1473643260066133, "grad_norm": 1.3046875, "learning_rate": 0.00045339533817613807, "loss": 5.1035, "mean_token_accuracy": 0.1872079625725746, "num_tokens": 47871406.0, "step": 27600 }, { "entropy": 5.384205102920532, "epoch": 2.147753355378331, "grad_norm": 1.171875, "learning_rate": 0.00045337844713226106, "loss": 5.0086, "mean_token_accuracy": 0.1961725875735283, "num_tokens": 47880361.0, "step": 27605 }, { "entropy": 5.464580917358399, "epoch": 2.1481423847500487, "grad_norm": 1.2109375, "learning_rate": 0.00045336155338177497, "loss": 5.1101, "mean_token_accuracy": 0.18749476671218873, "num_tokens": 47889632.0, "step": 27610 }, { "entropy": 5.395323276519775, "epoch": 2.1485314141217664, "grad_norm": 1.2421875, "learning_rate": 0.0004533446569249362, "loss": 4.9934, "mean_token_accuracy": 0.19297121465206146, "num_tokens": 47898612.0, "step": 27615 }, { "entropy": 5.385963201522827, "epoch": 2.1489204434934837, "grad_norm": 1.3515625, "learning_rate": 0.00045332775776200116, "loss": 5.0866, "mean_token_accuracy": 0.18658825904130935, "num_tokens": 47906628.0, "step": 27620 }, { "entropy": 5.360697221755982, "epoch": 2.1493094728652014, "grad_norm": 1.1484375, "learning_rate": 0.00045331085589322626, "loss": 5.096, "mean_token_accuracy": 0.19419705271720886, "num_tokens": 47915831.0, "step": 27625 }, { "entropy": 5.523052835464478, "epoch": 2.149698502236919, "grad_norm": 1.1640625, "learning_rate": 0.0004532939513188679, "loss": 5.0888, "mean_token_accuracy": 0.19227644801139832, "num_tokens": 47924289.0, "step": 27630 }, { "entropy": 5.514377498626709, "epoch": 2.1500875316086363, "grad_norm": 1.296875, "learning_rate": 0.0004532770440391826, "loss": 5.157, "mean_token_accuracy": 0.18228931874036788, "num_tokens": 47932438.0, "step": 27635 }, { "entropy": 5.410264539718628, "epoch": 2.150476560980354, "grad_norm": 1.234375, "learning_rate": 0.0004532601340544269, "loss": 5.0279, "mean_token_accuracy": 0.18553309738636017, "num_tokens": 47940634.0, "step": 27640 }, { "entropy": 5.467669105529785, "epoch": 2.1508655903520717, "grad_norm": 1.2265625, "learning_rate": 0.0004532432213648574, "loss": 5.1205, "mean_token_accuracy": 0.18643853366374968, "num_tokens": 47949871.0, "step": 27645 }, { "entropy": 5.403092241287231, "epoch": 2.151254619723789, "grad_norm": 1.2265625, "learning_rate": 0.00045322630597073067, "loss": 5.0496, "mean_token_accuracy": 0.19111949503421782, "num_tokens": 47957847.0, "step": 27650 }, { "entropy": 5.3359763622283936, "epoch": 2.1516436490955066, "grad_norm": 1.2265625, "learning_rate": 0.00045320938787230355, "loss": 5.1035, "mean_token_accuracy": 0.1912636250257492, "num_tokens": 47965978.0, "step": 27655 }, { "entropy": 5.506854724884033, "epoch": 2.1520326784672243, "grad_norm": 1.2109375, "learning_rate": 0.00045319246706983257, "loss": 5.2264, "mean_token_accuracy": 0.18004737347364425, "num_tokens": 47975407.0, "step": 27660 }, { "entropy": 5.443437004089356, "epoch": 2.152421707838942, "grad_norm": 1.203125, "learning_rate": 0.00045317554356357446, "loss": 5.0131, "mean_token_accuracy": 0.19553641080856324, "num_tokens": 47983652.0, "step": 27665 }, { "entropy": 5.466415357589722, "epoch": 2.1528107372106593, "grad_norm": 1.140625, "learning_rate": 0.00045315861735378615, "loss": 5.083, "mean_token_accuracy": 0.1845807120203972, "num_tokens": 47992750.0, "step": 27670 }, { "entropy": 5.346964168548584, "epoch": 2.153199766582377, "grad_norm": 1.2734375, "learning_rate": 0.00045314168844072435, "loss": 5.0052, "mean_token_accuracy": 0.1911673754453659, "num_tokens": 48000930.0, "step": 27675 }, { "entropy": 5.397316646575928, "epoch": 2.1535887959540947, "grad_norm": 1.1875, "learning_rate": 0.00045312475682464604, "loss": 5.0619, "mean_token_accuracy": 0.18944141119718552, "num_tokens": 48009285.0, "step": 27680 }, { "entropy": 5.448140430450439, "epoch": 2.153977825325812, "grad_norm": 1.171875, "learning_rate": 0.00045310782250580794, "loss": 5.1217, "mean_token_accuracy": 0.18256623446941375, "num_tokens": 48017806.0, "step": 27685 }, { "entropy": 5.430179119110107, "epoch": 2.1543668546975296, "grad_norm": 1.3515625, "learning_rate": 0.0004530908854844672, "loss": 5.0969, "mean_token_accuracy": 0.1865006670355797, "num_tokens": 48026930.0, "step": 27690 }, { "entropy": 5.489858102798462, "epoch": 2.1547558840692473, "grad_norm": 1.171875, "learning_rate": 0.00045307394576088076, "loss": 5.1772, "mean_token_accuracy": 0.18242247253656388, "num_tokens": 48036039.0, "step": 27695 }, { "entropy": 5.4185450077056885, "epoch": 2.1551449134409646, "grad_norm": 1.09375, "learning_rate": 0.0004530570033353056, "loss": 4.9781, "mean_token_accuracy": 0.20122114568948746, "num_tokens": 48045278.0, "step": 27700 }, { "entropy": 5.46020770072937, "epoch": 2.1555339428126823, "grad_norm": 1.234375, "learning_rate": 0.00045304005820799874, "loss": 5.1161, "mean_token_accuracy": 0.1817747250199318, "num_tokens": 48054448.0, "step": 27705 }, { "entropy": 5.475445222854614, "epoch": 2.1559229721844, "grad_norm": 1.2578125, "learning_rate": 0.0004530231103792175, "loss": 5.122, "mean_token_accuracy": 0.18852549493312837, "num_tokens": 48062672.0, "step": 27710 }, { "entropy": 5.431478118896484, "epoch": 2.1563120015561177, "grad_norm": 1.28125, "learning_rate": 0.0004530061598492188, "loss": 5.0305, "mean_token_accuracy": 0.19085882753133773, "num_tokens": 48072140.0, "step": 27715 }, { "entropy": 5.482812356948853, "epoch": 2.156701030927835, "grad_norm": 1.203125, "learning_rate": 0.00045298920661826004, "loss": 5.1903, "mean_token_accuracy": 0.18097154647111893, "num_tokens": 48080394.0, "step": 27720 }, { "entropy": 5.460504579544067, "epoch": 2.1570900602995526, "grad_norm": 1.1640625, "learning_rate": 0.0004529722506865984, "loss": 5.0983, "mean_token_accuracy": 0.19175025671720505, "num_tokens": 48088947.0, "step": 27725 }, { "entropy": 5.360564470291138, "epoch": 2.1574790896712703, "grad_norm": 1.171875, "learning_rate": 0.000452955292054491, "loss": 5.0106, "mean_token_accuracy": 0.190871225297451, "num_tokens": 48097156.0, "step": 27730 }, { "entropy": 5.400822353363037, "epoch": 2.1578681190429876, "grad_norm": 1.3359375, "learning_rate": 0.00045293833072219535, "loss": 5.0355, "mean_token_accuracy": 0.19466277807950974, "num_tokens": 48105692.0, "step": 27735 }, { "entropy": 5.453074026107788, "epoch": 2.1582571484147053, "grad_norm": 1.2421875, "learning_rate": 0.00045292136668996876, "loss": 5.047, "mean_token_accuracy": 0.1868092894554138, "num_tokens": 48114967.0, "step": 27740 }, { "entropy": 5.427117967605591, "epoch": 2.158646177786423, "grad_norm": 1.2265625, "learning_rate": 0.0004529043999580686, "loss": 5.0436, "mean_token_accuracy": 0.19195033013820648, "num_tokens": 48123933.0, "step": 27745 }, { "entropy": 5.393619537353516, "epoch": 2.1590352071581402, "grad_norm": 1.234375, "learning_rate": 0.00045288743052675234, "loss": 5.0351, "mean_token_accuracy": 0.19574755430221558, "num_tokens": 48131998.0, "step": 27750 }, { "entropy": 5.4142295837402346, "epoch": 2.159424236529858, "grad_norm": 1.2109375, "learning_rate": 0.00045287045839627744, "loss": 5.0044, "mean_token_accuracy": 0.20303898602724074, "num_tokens": 48140111.0, "step": 27755 }, { "entropy": 5.511449193954467, "epoch": 2.1598132659015756, "grad_norm": 1.3515625, "learning_rate": 0.00045285348356690155, "loss": 5.0843, "mean_token_accuracy": 0.19149483889341354, "num_tokens": 48148826.0, "step": 27760 }, { "entropy": 5.459193468093872, "epoch": 2.1602022952732933, "grad_norm": 1.1953125, "learning_rate": 0.000452836506038882, "loss": 5.0543, "mean_token_accuracy": 0.19005140513181687, "num_tokens": 48157242.0, "step": 27765 }, { "entropy": 5.438192081451416, "epoch": 2.1605913246450106, "grad_norm": 1.234375, "learning_rate": 0.00045281952581247654, "loss": 5.1845, "mean_token_accuracy": 0.17860541641712188, "num_tokens": 48166571.0, "step": 27770 }, { "entropy": 5.485002183914185, "epoch": 2.1609803540167283, "grad_norm": 1.34375, "learning_rate": 0.00045280254288794286, "loss": 5.0796, "mean_token_accuracy": 0.19285960197448732, "num_tokens": 48175280.0, "step": 27775 }, { "entropy": 5.52338056564331, "epoch": 2.161369383388446, "grad_norm": 1.21875, "learning_rate": 0.00045278555726553855, "loss": 5.1208, "mean_token_accuracy": 0.1875110000371933, "num_tokens": 48184931.0, "step": 27780 }, { "entropy": 5.338022518157959, "epoch": 2.1617584127601632, "grad_norm": 1.265625, "learning_rate": 0.00045276856894552143, "loss": 5.0056, "mean_token_accuracy": 0.19658712595701217, "num_tokens": 48192945.0, "step": 27785 }, { "entropy": 5.438974857330322, "epoch": 2.162147442131881, "grad_norm": 1.25, "learning_rate": 0.0004527515779281492, "loss": 5.117, "mean_token_accuracy": 0.18399262577295303, "num_tokens": 48201963.0, "step": 27790 }, { "entropy": 5.484705209732056, "epoch": 2.1625364715035986, "grad_norm": 1.1875, "learning_rate": 0.00045273458421367976, "loss": 5.0852, "mean_token_accuracy": 0.19040601551532746, "num_tokens": 48211178.0, "step": 27795 }, { "entropy": 5.431409931182861, "epoch": 2.162925500875316, "grad_norm": 1.203125, "learning_rate": 0.0004527175878023708, "loss": 4.9472, "mean_token_accuracy": 0.19549288600683212, "num_tokens": 48219294.0, "step": 27800 }, { "entropy": 5.357197999954224, "epoch": 2.1633145302470336, "grad_norm": 1.296875, "learning_rate": 0.0004527005886944803, "loss": 5.0502, "mean_token_accuracy": 0.19317653477191926, "num_tokens": 48227782.0, "step": 27805 }, { "entropy": 5.46384711265564, "epoch": 2.1637035596187513, "grad_norm": 1.1796875, "learning_rate": 0.00045268358689026626, "loss": 5.0779, "mean_token_accuracy": 0.18082280158996583, "num_tokens": 48236850.0, "step": 27810 }, { "entropy": 5.475611686706543, "epoch": 2.164092588990469, "grad_norm": 1.21875, "learning_rate": 0.0004526665823899866, "loss": 5.1384, "mean_token_accuracy": 0.1877797469496727, "num_tokens": 48246095.0, "step": 27815 }, { "entropy": 5.45708384513855, "epoch": 2.164481618362186, "grad_norm": 1.1953125, "learning_rate": 0.00045264957519389936, "loss": 5.0694, "mean_token_accuracy": 0.1892252594232559, "num_tokens": 48254943.0, "step": 27820 }, { "entropy": 5.437220335006714, "epoch": 2.164870647733904, "grad_norm": 1.2421875, "learning_rate": 0.00045263256530226253, "loss": 5.0129, "mean_token_accuracy": 0.1956775367259979, "num_tokens": 48263954.0, "step": 27825 }, { "entropy": 5.439289712905884, "epoch": 2.1652596771056216, "grad_norm": 1.3046875, "learning_rate": 0.0004526155527153343, "loss": 5.1197, "mean_token_accuracy": 0.1849600851535797, "num_tokens": 48272708.0, "step": 27830 }, { "entropy": 5.4651939392089846, "epoch": 2.165648706477339, "grad_norm": 1.21875, "learning_rate": 0.0004525985374333727, "loss": 5.0992, "mean_token_accuracy": 0.18519890159368516, "num_tokens": 48280782.0, "step": 27835 }, { "entropy": 5.424927711486816, "epoch": 2.1660377358490566, "grad_norm": 1.1484375, "learning_rate": 0.000452581519456636, "loss": 4.9683, "mean_token_accuracy": 0.19105817526578903, "num_tokens": 48289105.0, "step": 27840 }, { "entropy": 5.428668403625489, "epoch": 2.1664267652207743, "grad_norm": 1.203125, "learning_rate": 0.00045256449878538243, "loss": 5.0737, "mean_token_accuracy": 0.193313392996788, "num_tokens": 48297552.0, "step": 27845 }, { "entropy": 5.358900260925293, "epoch": 2.166815794592492, "grad_norm": 1.2421875, "learning_rate": 0.00045254747541987017, "loss": 5.0532, "mean_token_accuracy": 0.19058728367090225, "num_tokens": 48307541.0, "step": 27850 }, { "entropy": 5.4484563827514645, "epoch": 2.167204823964209, "grad_norm": 1.296875, "learning_rate": 0.0004525304493603576, "loss": 5.0648, "mean_token_accuracy": 0.1963243991136551, "num_tokens": 48316078.0, "step": 27855 }, { "entropy": 5.4707286834716795, "epoch": 2.167593853335927, "grad_norm": 1.296875, "learning_rate": 0.00045251342060710295, "loss": 5.1205, "mean_token_accuracy": 0.18670790642499924, "num_tokens": 48324221.0, "step": 27860 }, { "entropy": 5.464034175872802, "epoch": 2.1679828827076446, "grad_norm": 1.28125, "learning_rate": 0.0004524963891603647, "loss": 5.1963, "mean_token_accuracy": 0.18476096540689468, "num_tokens": 48333047.0, "step": 27865 }, { "entropy": 5.471977853775025, "epoch": 2.168371912079362, "grad_norm": 1.171875, "learning_rate": 0.00045247935502040136, "loss": 5.1441, "mean_token_accuracy": 0.18933992236852645, "num_tokens": 48342255.0, "step": 27870 }, { "entropy": 5.435747861862183, "epoch": 2.1687609414510796, "grad_norm": 1.3828125, "learning_rate": 0.0004524623181874712, "loss": 5.1413, "mean_token_accuracy": 0.18017890602350234, "num_tokens": 48350877.0, "step": 27875 }, { "entropy": 5.564033651351929, "epoch": 2.1691499708227973, "grad_norm": 1.1875, "learning_rate": 0.0004524452786618329, "loss": 5.2507, "mean_token_accuracy": 0.17731962949037552, "num_tokens": 48360537.0, "step": 27880 }, { "entropy": 5.565032911300659, "epoch": 2.1695390001945145, "grad_norm": 1.1328125, "learning_rate": 0.00045242823644374484, "loss": 5.1578, "mean_token_accuracy": 0.18690354377031326, "num_tokens": 48370518.0, "step": 27885 }, { "entropy": 5.408589887619018, "epoch": 2.169928029566232, "grad_norm": 1.1796875, "learning_rate": 0.0004524111915334658, "loss": 4.9778, "mean_token_accuracy": 0.20465470999479293, "num_tokens": 48379379.0, "step": 27890 }, { "entropy": 5.331674385070801, "epoch": 2.17031705893795, "grad_norm": 1.28125, "learning_rate": 0.00045239414393125424, "loss": 4.9693, "mean_token_accuracy": 0.19495616853237152, "num_tokens": 48388090.0, "step": 27895 }, { "entropy": 5.456219577789307, "epoch": 2.170706088309667, "grad_norm": 1.2109375, "learning_rate": 0.0004523770936373689, "loss": 5.0926, "mean_token_accuracy": 0.18139129132032394, "num_tokens": 48396527.0, "step": 27900 }, { "entropy": 5.444386339187622, "epoch": 2.171095117681385, "grad_norm": 1.328125, "learning_rate": 0.0004523600406520685, "loss": 5.083, "mean_token_accuracy": 0.1933899700641632, "num_tokens": 48404632.0, "step": 27905 }, { "entropy": 5.37218074798584, "epoch": 2.1714841470531026, "grad_norm": 1.1875, "learning_rate": 0.0004523429849756118, "loss": 4.9919, "mean_token_accuracy": 0.2036385640501976, "num_tokens": 48413573.0, "step": 27910 }, { "entropy": 5.510362815856934, "epoch": 2.1718731764248203, "grad_norm": 1.2421875, "learning_rate": 0.0004523259266082576, "loss": 5.1678, "mean_token_accuracy": 0.18552769124507903, "num_tokens": 48421252.0, "step": 27915 }, { "entropy": 5.453756952285767, "epoch": 2.1722622057965375, "grad_norm": 1.1640625, "learning_rate": 0.00045230886555026455, "loss": 5.1085, "mean_token_accuracy": 0.18361749351024628, "num_tokens": 48430322.0, "step": 27920 }, { "entropy": 5.466126108169556, "epoch": 2.172651235168255, "grad_norm": 1.1640625, "learning_rate": 0.00045229180180189176, "loss": 5.0396, "mean_token_accuracy": 0.19721615314483643, "num_tokens": 48439570.0, "step": 27925 }, { "entropy": 5.40469765663147, "epoch": 2.173040264539973, "grad_norm": 1.1796875, "learning_rate": 0.00045227473536339817, "loss": 5.0727, "mean_token_accuracy": 0.18553993105888367, "num_tokens": 48447803.0, "step": 27930 }, { "entropy": 5.474167013168335, "epoch": 2.17342929391169, "grad_norm": 1.234375, "learning_rate": 0.0004522576662350425, "loss": 5.1549, "mean_token_accuracy": 0.1882725864648819, "num_tokens": 48456694.0, "step": 27935 }, { "entropy": 5.449743461608887, "epoch": 2.173818323283408, "grad_norm": 1.234375, "learning_rate": 0.000452240594417084, "loss": 5.126, "mean_token_accuracy": 0.18421879410743713, "num_tokens": 48465321.0, "step": 27940 }, { "entropy": 5.465271854400635, "epoch": 2.1742073526551255, "grad_norm": 1.2109375, "learning_rate": 0.0004522235199097815, "loss": 5.1231, "mean_token_accuracy": 0.187352155148983, "num_tokens": 48474299.0, "step": 27945 }, { "entropy": 5.402745485305786, "epoch": 2.1745963820268432, "grad_norm": 1.15625, "learning_rate": 0.0004522064427133942, "loss": 4.9873, "mean_token_accuracy": 0.19438674449920654, "num_tokens": 48483427.0, "step": 27950 }, { "entropy": 5.390454721450806, "epoch": 2.1749854113985605, "grad_norm": 1.2265625, "learning_rate": 0.00045218936282818116, "loss": 4.9983, "mean_token_accuracy": 0.20087809711694718, "num_tokens": 48492610.0, "step": 27955 }, { "entropy": 5.41278829574585, "epoch": 2.175374440770278, "grad_norm": 1.125, "learning_rate": 0.0004521722802544016, "loss": 5.2019, "mean_token_accuracy": 0.18960207849740982, "num_tokens": 48502531.0, "step": 27960 }, { "entropy": 5.511424541473389, "epoch": 2.175763470141996, "grad_norm": 1.265625, "learning_rate": 0.00045215519499231465, "loss": 5.0973, "mean_token_accuracy": 0.19403574168682097, "num_tokens": 48511167.0, "step": 27965 }, { "entropy": 5.4764515399932865, "epoch": 2.176152499513713, "grad_norm": 1.328125, "learning_rate": 0.00045213810704217963, "loss": 5.1409, "mean_token_accuracy": 0.18980092257261277, "num_tokens": 48520355.0, "step": 27970 }, { "entropy": 5.416035413742065, "epoch": 2.176541528885431, "grad_norm": 1.78125, "learning_rate": 0.0004521210164042557, "loss": 5.1243, "mean_token_accuracy": 0.18617822825908661, "num_tokens": 48529269.0, "step": 27975 }, { "entropy": 5.478228807449341, "epoch": 2.1769305582571485, "grad_norm": 1.2421875, "learning_rate": 0.0004521039230788024, "loss": 5.0341, "mean_token_accuracy": 0.1973237156867981, "num_tokens": 48537764.0, "step": 27980 }, { "entropy": 5.390616607666016, "epoch": 2.177319587628866, "grad_norm": 1.1953125, "learning_rate": 0.0004520868270660789, "loss": 5.0744, "mean_token_accuracy": 0.18631513863801957, "num_tokens": 48547168.0, "step": 27985 }, { "entropy": 5.362071084976196, "epoch": 2.1777086170005835, "grad_norm": 1.2734375, "learning_rate": 0.0004520697283663446, "loss": 5.0106, "mean_token_accuracy": 0.1936831995844841, "num_tokens": 48555809.0, "step": 27990 }, { "entropy": 5.518894243240356, "epoch": 2.178097646372301, "grad_norm": 1.2578125, "learning_rate": 0.00045205262697985897, "loss": 5.1004, "mean_token_accuracy": 0.184615258872509, "num_tokens": 48564754.0, "step": 27995 }, { "entropy": 5.381280851364136, "epoch": 2.1784866757440184, "grad_norm": 1.2265625, "learning_rate": 0.0004520355229068816, "loss": 5.0092, "mean_token_accuracy": 0.19297883659601212, "num_tokens": 48573732.0, "step": 28000 }, { "entropy": 5.35177206993103, "epoch": 2.178875705115736, "grad_norm": 1.2578125, "learning_rate": 0.00045201841614767203, "loss": 4.9911, "mean_token_accuracy": 0.1921868994832039, "num_tokens": 48581676.0, "step": 28005 }, { "entropy": 5.395832204818726, "epoch": 2.179264734487454, "grad_norm": 1.140625, "learning_rate": 0.00045200130670248974, "loss": 5.0634, "mean_token_accuracy": 0.18696290254592896, "num_tokens": 48590310.0, "step": 28010 }, { "entropy": 5.41760287284851, "epoch": 2.1796537638591715, "grad_norm": 1.2421875, "learning_rate": 0.00045198419457159424, "loss": 5.0558, "mean_token_accuracy": 0.194281929731369, "num_tokens": 48599306.0, "step": 28015 }, { "entropy": 5.512250185012817, "epoch": 2.180042793230889, "grad_norm": 1.1640625, "learning_rate": 0.0004519670797552453, "loss": 5.1716, "mean_token_accuracy": 0.18363481909036636, "num_tokens": 48608264.0, "step": 28020 }, { "entropy": 5.461954069137573, "epoch": 2.1804318226026065, "grad_norm": 1.1796875, "learning_rate": 0.00045194996225370266, "loss": 5.08, "mean_token_accuracy": 0.19424430131912232, "num_tokens": 48617102.0, "step": 28025 }, { "entropy": 5.5104724884033205, "epoch": 2.180820851974324, "grad_norm": 1.2578125, "learning_rate": 0.00045193284206722595, "loss": 5.1614, "mean_token_accuracy": 0.18416298031806946, "num_tokens": 48626207.0, "step": 28030 }, { "entropy": 5.4618144035339355, "epoch": 2.1812098813460414, "grad_norm": 1.2734375, "learning_rate": 0.0004519157191960749, "loss": 5.008, "mean_token_accuracy": 0.18832229673862458, "num_tokens": 48634322.0, "step": 28035 }, { "entropy": 5.381257724761963, "epoch": 2.181598910717759, "grad_norm": 1.3125, "learning_rate": 0.0004518985936405096, "loss": 5.0378, "mean_token_accuracy": 0.19622325003147126, "num_tokens": 48642026.0, "step": 28040 }, { "entropy": 5.3979002952575685, "epoch": 2.181987940089477, "grad_norm": 1.2265625, "learning_rate": 0.0004518814654007896, "loss": 4.9549, "mean_token_accuracy": 0.19703333377838134, "num_tokens": 48650114.0, "step": 28045 }, { "entropy": 5.491523885726929, "epoch": 2.1823769694611945, "grad_norm": 1.25, "learning_rate": 0.00045186433447717486, "loss": 5.114, "mean_token_accuracy": 0.1812614843249321, "num_tokens": 48660185.0, "step": 28050 }, { "entropy": 5.470400094985962, "epoch": 2.182765998832912, "grad_norm": 1.2421875, "learning_rate": 0.00045184720086992536, "loss": 5.1207, "mean_token_accuracy": 0.1929317981004715, "num_tokens": 48668603.0, "step": 28055 }, { "entropy": 5.443241262435913, "epoch": 2.1831550282046295, "grad_norm": 1.21875, "learning_rate": 0.00045183006457930107, "loss": 5.1027, "mean_token_accuracy": 0.19116961807012559, "num_tokens": 48676962.0, "step": 28060 }, { "entropy": 5.422074317932129, "epoch": 2.183544057576347, "grad_norm": 1.140625, "learning_rate": 0.0004518129256055621, "loss": 5.0979, "mean_token_accuracy": 0.19456173330545426, "num_tokens": 48685823.0, "step": 28065 }, { "entropy": 5.415818929672241, "epoch": 2.1839330869480644, "grad_norm": 1.2734375, "learning_rate": 0.0004517957839489683, "loss": 4.9975, "mean_token_accuracy": 0.1962646797299385, "num_tokens": 48695116.0, "step": 28070 }, { "entropy": 5.349808883666992, "epoch": 2.184322116319782, "grad_norm": 1.2578125, "learning_rate": 0.00045177863960977986, "loss": 5.0531, "mean_token_accuracy": 0.1934889853000641, "num_tokens": 48702725.0, "step": 28075 }, { "entropy": 5.391039180755615, "epoch": 2.1847111456915, "grad_norm": 1.265625, "learning_rate": 0.000451761492588257, "loss": 5.0769, "mean_token_accuracy": 0.19466860592365265, "num_tokens": 48711104.0, "step": 28080 }, { "entropy": 5.42861533164978, "epoch": 2.185100175063217, "grad_norm": 1.2265625, "learning_rate": 0.00045174434288465986, "loss": 5.0308, "mean_token_accuracy": 0.19239652305841445, "num_tokens": 48720177.0, "step": 28085 }, { "entropy": 5.363170957565307, "epoch": 2.1854892044349348, "grad_norm": 1.1640625, "learning_rate": 0.0004517271904992486, "loss": 4.9788, "mean_token_accuracy": 0.19360375553369522, "num_tokens": 48728729.0, "step": 28090 }, { "entropy": 5.346538162231445, "epoch": 2.1858782338066525, "grad_norm": 1.2265625, "learning_rate": 0.0004517100354322835, "loss": 4.9866, "mean_token_accuracy": 0.1936441034078598, "num_tokens": 48736876.0, "step": 28095 }, { "entropy": 5.350077342987061, "epoch": 2.18626726317837, "grad_norm": 1.2265625, "learning_rate": 0.00045169287768402497, "loss": 4.9866, "mean_token_accuracy": 0.193696229159832, "num_tokens": 48745957.0, "step": 28100 }, { "entropy": 5.475774240493775, "epoch": 2.1866562925500874, "grad_norm": 1.3984375, "learning_rate": 0.0004516757172547331, "loss": 5.1631, "mean_token_accuracy": 0.18738242834806443, "num_tokens": 48754488.0, "step": 28105 }, { "entropy": 5.442249965667725, "epoch": 2.187045321921805, "grad_norm": 1.3203125, "learning_rate": 0.0004516585541446685, "loss": 5.0483, "mean_token_accuracy": 0.19367127269506454, "num_tokens": 48762797.0, "step": 28110 }, { "entropy": 5.350644779205322, "epoch": 2.187434351293523, "grad_norm": 1.234375, "learning_rate": 0.00045164138835409153, "loss": 5.0792, "mean_token_accuracy": 0.19054704010486603, "num_tokens": 48771639.0, "step": 28115 }, { "entropy": 5.383282136917114, "epoch": 2.18782338066524, "grad_norm": 1.1875, "learning_rate": 0.00045162421988326266, "loss": 5.0733, "mean_token_accuracy": 0.19311015903949738, "num_tokens": 48779978.0, "step": 28120 }, { "entropy": 5.425003433227539, "epoch": 2.1882124100369578, "grad_norm": 1.1953125, "learning_rate": 0.0004516070487324424, "loss": 5.0928, "mean_token_accuracy": 0.1860708624124527, "num_tokens": 48788202.0, "step": 28125 }, { "entropy": 5.4426717281341555, "epoch": 2.1886014394086755, "grad_norm": 1.234375, "learning_rate": 0.00045158987490189124, "loss": 5.0739, "mean_token_accuracy": 0.18856469243764878, "num_tokens": 48796533.0, "step": 28130 }, { "entropy": 5.482371520996094, "epoch": 2.1889904687803927, "grad_norm": 1.4921875, "learning_rate": 0.0004515726983918697, "loss": 5.1296, "mean_token_accuracy": 0.1837695598602295, "num_tokens": 48805627.0, "step": 28135 }, { "entropy": 5.457989692687988, "epoch": 2.1893794981521104, "grad_norm": 1.2265625, "learning_rate": 0.00045155551920263864, "loss": 5.1042, "mean_token_accuracy": 0.18310075402259826, "num_tokens": 48814132.0, "step": 28140 }, { "entropy": 5.419422626495361, "epoch": 2.189768527523828, "grad_norm": 1.1875, "learning_rate": 0.00045153833733445857, "loss": 5.0242, "mean_token_accuracy": 0.18546267002820968, "num_tokens": 48823210.0, "step": 28145 }, { "entropy": 5.368236017227173, "epoch": 2.190157556895546, "grad_norm": 1.1640625, "learning_rate": 0.0004515211527875903, "loss": 5.0761, "mean_token_accuracy": 0.19146686941385269, "num_tokens": 48831835.0, "step": 28150 }, { "entropy": 5.441962671279907, "epoch": 2.190546586267263, "grad_norm": 1.265625, "learning_rate": 0.0004515039655622943, "loss": 5.1303, "mean_token_accuracy": 0.18572519421577455, "num_tokens": 48840917.0, "step": 28155 }, { "entropy": 5.452027940750122, "epoch": 2.1909356156389808, "grad_norm": 1.25, "learning_rate": 0.00045148677565883167, "loss": 5.0772, "mean_token_accuracy": 0.18325790613889695, "num_tokens": 48849328.0, "step": 28160 }, { "entropy": 5.4154456615447994, "epoch": 2.1913246450106985, "grad_norm": 1.46875, "learning_rate": 0.0004514695830774631, "loss": 5.0645, "mean_token_accuracy": 0.19069142788648605, "num_tokens": 48858511.0, "step": 28165 }, { "entropy": 5.451482534408569, "epoch": 2.1917136743824157, "grad_norm": 1.4375, "learning_rate": 0.00045145238781844953, "loss": 5.131, "mean_token_accuracy": 0.19776459634304047, "num_tokens": 48867152.0, "step": 28170 }, { "entropy": 5.425117921829224, "epoch": 2.1921027037541334, "grad_norm": 1.25, "learning_rate": 0.00045143518988205184, "loss": 5.0355, "mean_token_accuracy": 0.18443744778633117, "num_tokens": 48875233.0, "step": 28175 }, { "entropy": 5.373607349395752, "epoch": 2.192491733125851, "grad_norm": 1.2109375, "learning_rate": 0.00045141798926853094, "loss": 5.0893, "mean_token_accuracy": 0.18793631196022034, "num_tokens": 48884569.0, "step": 28180 }, { "entropy": 5.496940612792969, "epoch": 2.1928807624975684, "grad_norm": 1.1640625, "learning_rate": 0.0004514007859781478, "loss": 5.138, "mean_token_accuracy": 0.18603332340717316, "num_tokens": 48894402.0, "step": 28185 }, { "entropy": 5.5778134822845455, "epoch": 2.193269791869286, "grad_norm": 1.4140625, "learning_rate": 0.0004513835800111635, "loss": 5.0586, "mean_token_accuracy": 0.1922069936990738, "num_tokens": 48902105.0, "step": 28190 }, { "entropy": 5.427403831481934, "epoch": 2.1936588212410038, "grad_norm": 1.2734375, "learning_rate": 0.0004513663713678392, "loss": 5.1712, "mean_token_accuracy": 0.1806142359972, "num_tokens": 48911650.0, "step": 28195 }, { "entropy": 5.4093098640441895, "epoch": 2.1940478506127215, "grad_norm": 1.4140625, "learning_rate": 0.00045134916004843596, "loss": 5.037, "mean_token_accuracy": 0.19125207364559174, "num_tokens": 48920035.0, "step": 28200 }, { "entropy": 5.4056295394897464, "epoch": 2.1944368799844387, "grad_norm": 1.125, "learning_rate": 0.0004513319460532148, "loss": 5.0286, "mean_token_accuracy": 0.19497465193271638, "num_tokens": 48928460.0, "step": 28205 }, { "entropy": 5.4268535614013675, "epoch": 2.1948259093561564, "grad_norm": 1.2578125, "learning_rate": 0.00045131472938243707, "loss": 5.0615, "mean_token_accuracy": 0.1875137984752655, "num_tokens": 48937606.0, "step": 28210 }, { "entropy": 5.376762104034424, "epoch": 2.195214938727874, "grad_norm": 1.1875, "learning_rate": 0.0004512975100363639, "loss": 4.9684, "mean_token_accuracy": 0.19636159092187883, "num_tokens": 48945782.0, "step": 28215 }, { "entropy": 5.440301895141602, "epoch": 2.1956039680995914, "grad_norm": 1.296875, "learning_rate": 0.00045128028801525675, "loss": 5.1213, "mean_token_accuracy": 0.19429844617843628, "num_tokens": 48954243.0, "step": 28220 }, { "entropy": 5.470314168930054, "epoch": 2.195992997471309, "grad_norm": 1.328125, "learning_rate": 0.00045126306331937674, "loss": 5.0536, "mean_token_accuracy": 0.1940629467368126, "num_tokens": 48962578.0, "step": 28225 }, { "entropy": 5.402642869949341, "epoch": 2.1963820268430267, "grad_norm": 1.453125, "learning_rate": 0.0004512458359489853, "loss": 5.0628, "mean_token_accuracy": 0.19591874182224273, "num_tokens": 48971237.0, "step": 28230 }, { "entropy": 5.400737762451172, "epoch": 2.196771056214744, "grad_norm": 1.515625, "learning_rate": 0.0004512286059043437, "loss": 5.0121, "mean_token_accuracy": 0.19429802894592285, "num_tokens": 48979954.0, "step": 28235 }, { "entropy": 5.454825687408447, "epoch": 2.1971600855864617, "grad_norm": 1.265625, "learning_rate": 0.00045121137318571364, "loss": 5.1496, "mean_token_accuracy": 0.18409615457057954, "num_tokens": 48989174.0, "step": 28240 }, { "entropy": 5.43331995010376, "epoch": 2.1975491149581794, "grad_norm": 1.15625, "learning_rate": 0.00045119413779335645, "loss": 5.0816, "mean_token_accuracy": 0.18207580596208572, "num_tokens": 48998341.0, "step": 28245 }, { "entropy": 5.372051811218261, "epoch": 2.197938144329897, "grad_norm": 1.2578125, "learning_rate": 0.0004511768997275336, "loss": 5.0181, "mean_token_accuracy": 0.19545132368803025, "num_tokens": 49007024.0, "step": 28250 }, { "entropy": 5.370613479614258, "epoch": 2.1983271737016143, "grad_norm": 1.25, "learning_rate": 0.0004511596589885068, "loss": 5.0834, "mean_token_accuracy": 0.18728319257497789, "num_tokens": 49015632.0, "step": 28255 }, { "entropy": 5.44011697769165, "epoch": 2.198716203073332, "grad_norm": 1.2421875, "learning_rate": 0.0004511424155765375, "loss": 5.0817, "mean_token_accuracy": 0.19601324647665025, "num_tokens": 49024056.0, "step": 28260 }, { "entropy": 5.38209080696106, "epoch": 2.1991052324450497, "grad_norm": 1.5, "learning_rate": 0.00045112516949188735, "loss": 5.0247, "mean_token_accuracy": 0.19042078107595445, "num_tokens": 49033095.0, "step": 28265 }, { "entropy": 5.378571844100952, "epoch": 2.199494261816767, "grad_norm": 1.1328125, "learning_rate": 0.0004511079207348182, "loss": 5.0163, "mean_token_accuracy": 0.19554224312305452, "num_tokens": 49041632.0, "step": 28270 }, { "entropy": 5.450714015960694, "epoch": 2.1998832911884847, "grad_norm": 1.3828125, "learning_rate": 0.0004510906693055916, "loss": 5.1248, "mean_token_accuracy": 0.18695131242275237, "num_tokens": 49050336.0, "step": 28275 }, { "entropy": 5.407855749130249, "epoch": 2.2002723205602024, "grad_norm": 1.1953125, "learning_rate": 0.0004510734152044694, "loss": 5.0327, "mean_token_accuracy": 0.19591775834560393, "num_tokens": 49058567.0, "step": 28280 }, { "entropy": 5.377872467041016, "epoch": 2.20066134993192, "grad_norm": 1.2890625, "learning_rate": 0.00045105615843171336, "loss": 4.9006, "mean_token_accuracy": 0.20400691777467728, "num_tokens": 49067003.0, "step": 28285 }, { "entropy": 5.407643508911133, "epoch": 2.2010503793036373, "grad_norm": 1.1875, "learning_rate": 0.00045103889898758534, "loss": 5.0529, "mean_token_accuracy": 0.18717027008533477, "num_tokens": 49074965.0, "step": 28290 }, { "entropy": 5.401415538787842, "epoch": 2.201439408675355, "grad_norm": 1.15625, "learning_rate": 0.0004510216368723472, "loss": 5.0604, "mean_token_accuracy": 0.19194337129592895, "num_tokens": 49085106.0, "step": 28295 }, { "entropy": 5.443338251113891, "epoch": 2.2018284380470727, "grad_norm": 1.2265625, "learning_rate": 0.00045100437208626086, "loss": 5.1253, "mean_token_accuracy": 0.18340777456760407, "num_tokens": 49093125.0, "step": 28300 }, { "entropy": 5.4146322250366214, "epoch": 2.20221746741879, "grad_norm": 1.2265625, "learning_rate": 0.00045098710462958844, "loss": 5.0288, "mean_token_accuracy": 0.19164495468139647, "num_tokens": 49101956.0, "step": 28305 }, { "entropy": 5.42751407623291, "epoch": 2.2026064967905077, "grad_norm": 1.1640625, "learning_rate": 0.00045096983450259166, "loss": 5.0988, "mean_token_accuracy": 0.1869824394583702, "num_tokens": 49110942.0, "step": 28310 }, { "entropy": 5.481998062133789, "epoch": 2.2029955261622254, "grad_norm": 1.25, "learning_rate": 0.00045095256170553285, "loss": 5.1297, "mean_token_accuracy": 0.18799692690372466, "num_tokens": 49119181.0, "step": 28315 }, { "entropy": 5.3771728515625, "epoch": 2.2033845555339426, "grad_norm": 1.25, "learning_rate": 0.00045093528623867384, "loss": 5.0198, "mean_token_accuracy": 0.19963831305503846, "num_tokens": 49127451.0, "step": 28320 }, { "entropy": 5.448152685165406, "epoch": 2.2037735849056603, "grad_norm": 1.1953125, "learning_rate": 0.00045091800810227706, "loss": 5.1034, "mean_token_accuracy": 0.18977164775133132, "num_tokens": 49135550.0, "step": 28325 }, { "entropy": 5.3321741104125975, "epoch": 2.204162614277378, "grad_norm": 1.2109375, "learning_rate": 0.0004509007272966044, "loss": 4.8991, "mean_token_accuracy": 0.19848773926496505, "num_tokens": 49144551.0, "step": 28330 }, { "entropy": 5.419197082519531, "epoch": 2.2045516436490953, "grad_norm": 1.2578125, "learning_rate": 0.0004508834438219182, "loss": 5.0417, "mean_token_accuracy": 0.19688933491706848, "num_tokens": 49153079.0, "step": 28335 }, { "entropy": 5.38760290145874, "epoch": 2.204940673020813, "grad_norm": 1.2734375, "learning_rate": 0.0004508661576784807, "loss": 5.0919, "mean_token_accuracy": 0.19122634530067445, "num_tokens": 49161253.0, "step": 28340 }, { "entropy": 5.372367525100708, "epoch": 2.2053297023925307, "grad_norm": 1.296875, "learning_rate": 0.0004508488688665541, "loss": 5.0188, "mean_token_accuracy": 0.1935473635792732, "num_tokens": 49170192.0, "step": 28345 }, { "entropy": 5.493615961074829, "epoch": 2.2057187317642484, "grad_norm": 1.2421875, "learning_rate": 0.0004508315773864009, "loss": 5.0925, "mean_token_accuracy": 0.19202068746089934, "num_tokens": 49179512.0, "step": 28350 }, { "entropy": 5.409499740600586, "epoch": 2.2061077611359656, "grad_norm": 1.125, "learning_rate": 0.00045081428323828337, "loss": 4.9658, "mean_token_accuracy": 0.20301949232816696, "num_tokens": 49188431.0, "step": 28355 }, { "entropy": 5.354013252258301, "epoch": 2.2064967905076833, "grad_norm": 1.1953125, "learning_rate": 0.0004507969864224639, "loss": 5.0229, "mean_token_accuracy": 0.193155437707901, "num_tokens": 49196852.0, "step": 28360 }, { "entropy": 5.41056079864502, "epoch": 2.206885819879401, "grad_norm": 1.1953125, "learning_rate": 0.000450779686939205, "loss": 5.071, "mean_token_accuracy": 0.19184329956769944, "num_tokens": 49206007.0, "step": 28365 }, { "entropy": 5.4016162872314455, "epoch": 2.2072748492511183, "grad_norm": 1.21875, "learning_rate": 0.00045076238478876916, "loss": 5.0128, "mean_token_accuracy": 0.19359312057495118, "num_tokens": 49214016.0, "step": 28370 }, { "entropy": 5.369148063659668, "epoch": 2.207663878622836, "grad_norm": 1.1640625, "learning_rate": 0.0004507450799714188, "loss": 5.0214, "mean_token_accuracy": 0.19977216571569442, "num_tokens": 49222558.0, "step": 28375 }, { "entropy": 5.449032592773437, "epoch": 2.2080529079945537, "grad_norm": 1.21875, "learning_rate": 0.00045072777248741664, "loss": 5.059, "mean_token_accuracy": 0.18759192675352096, "num_tokens": 49230983.0, "step": 28380 }, { "entropy": 5.468269968032837, "epoch": 2.2084419373662714, "grad_norm": 1.453125, "learning_rate": 0.0004507104623370252, "loss": 5.1339, "mean_token_accuracy": 0.18264946192502976, "num_tokens": 49239429.0, "step": 28385 }, { "entropy": 5.4634058475494385, "epoch": 2.2088309667379886, "grad_norm": 1.203125, "learning_rate": 0.0004506931495205072, "loss": 5.0516, "mean_token_accuracy": 0.19091873168945311, "num_tokens": 49247316.0, "step": 28390 }, { "entropy": 5.417049789428711, "epoch": 2.2092199961097063, "grad_norm": 1.1484375, "learning_rate": 0.0004506758340381253, "loss": 5.0182, "mean_token_accuracy": 0.19499534070491792, "num_tokens": 49256293.0, "step": 28395 }, { "entropy": 5.502082347869873, "epoch": 2.209609025481424, "grad_norm": 1.2265625, "learning_rate": 0.0004506585158901422, "loss": 5.1269, "mean_token_accuracy": 0.19277836382389069, "num_tokens": 49264735.0, "step": 28400 }, { "entropy": 5.471552181243896, "epoch": 2.2099980548531413, "grad_norm": 1.2421875, "learning_rate": 0.0004506411950768207, "loss": 5.2091, "mean_token_accuracy": 0.17960940003395082, "num_tokens": 49273370.0, "step": 28405 }, { "entropy": 5.455255222320557, "epoch": 2.210387084224859, "grad_norm": 1.15625, "learning_rate": 0.00045062387159842363, "loss": 5.1606, "mean_token_accuracy": 0.18633482605218887, "num_tokens": 49282850.0, "step": 28410 }, { "entropy": 5.438771152496338, "epoch": 2.2107761135965767, "grad_norm": 1.234375, "learning_rate": 0.00045060654545521386, "loss": 5.0558, "mean_token_accuracy": 0.19522936046123504, "num_tokens": 49290546.0, "step": 28415 }, { "entropy": 5.381656265258789, "epoch": 2.211165142968294, "grad_norm": 1.21875, "learning_rate": 0.00045058921664745436, "loss": 5.0716, "mean_token_accuracy": 0.1923053815960884, "num_tokens": 49298648.0, "step": 28420 }, { "entropy": 5.404882574081421, "epoch": 2.2115541723400116, "grad_norm": 1.1796875, "learning_rate": 0.00045057188517540783, "loss": 5.0737, "mean_token_accuracy": 0.19062569588422776, "num_tokens": 49307134.0, "step": 28425 }, { "entropy": 5.447901821136474, "epoch": 2.2119432017117293, "grad_norm": 1.203125, "learning_rate": 0.0004505545510393374, "loss": 5.0586, "mean_token_accuracy": 0.18720521926879882, "num_tokens": 49315617.0, "step": 28430 }, { "entropy": 5.409620571136474, "epoch": 2.2123322310834466, "grad_norm": 1.2109375, "learning_rate": 0.00045053721423950617, "loss": 5.0896, "mean_token_accuracy": 0.18790622651576996, "num_tokens": 49324435.0, "step": 28435 }, { "entropy": 5.339232730865478, "epoch": 2.2127212604551643, "grad_norm": 1.125, "learning_rate": 0.0004505198747761771, "loss": 5.0046, "mean_token_accuracy": 0.19634063243865968, "num_tokens": 49333758.0, "step": 28440 }, { "entropy": 5.372382593154907, "epoch": 2.213110289826882, "grad_norm": 1.203125, "learning_rate": 0.0004505025326496132, "loss": 4.9331, "mean_token_accuracy": 0.19533218890428544, "num_tokens": 49342643.0, "step": 28445 }, { "entropy": 5.405748128890991, "epoch": 2.2134993191985997, "grad_norm": 1.21875, "learning_rate": 0.00045048518786007784, "loss": 5.0402, "mean_token_accuracy": 0.20078994929790497, "num_tokens": 49351009.0, "step": 28450 }, { "entropy": 5.412637042999267, "epoch": 2.213888348570317, "grad_norm": 1.1875, "learning_rate": 0.00045046784040783395, "loss": 5.0826, "mean_token_accuracy": 0.19002192169427873, "num_tokens": 49359415.0, "step": 28455 }, { "entropy": 5.427623462677002, "epoch": 2.2142773779420346, "grad_norm": 1.21875, "learning_rate": 0.000450450490293145, "loss": 5.1282, "mean_token_accuracy": 0.18631070405244826, "num_tokens": 49367898.0, "step": 28460 }, { "entropy": 5.459657192230225, "epoch": 2.2146664073137523, "grad_norm": 1.2109375, "learning_rate": 0.000450433137516274, "loss": 5.0226, "mean_token_accuracy": 0.19263877719640732, "num_tokens": 49376651.0, "step": 28465 }, { "entropy": 5.346524047851562, "epoch": 2.2150554366854696, "grad_norm": 1.7890625, "learning_rate": 0.0004504157820774844, "loss": 4.9978, "mean_token_accuracy": 0.19707806408405304, "num_tokens": 49385259.0, "step": 28470 }, { "entropy": 5.432752656936645, "epoch": 2.2154444660571873, "grad_norm": 1.234375, "learning_rate": 0.0004503984239770396, "loss": 5.034, "mean_token_accuracy": 0.19362403750419616, "num_tokens": 49393868.0, "step": 28475 }, { "entropy": 5.513563251495361, "epoch": 2.215833495428905, "grad_norm": 1.203125, "learning_rate": 0.0004503810632152028, "loss": 5.0747, "mean_token_accuracy": 0.194164177775383, "num_tokens": 49402062.0, "step": 28480 }, { "entropy": 5.5048255443573, "epoch": 2.2162225248006227, "grad_norm": 1.203125, "learning_rate": 0.0004503636997922375, "loss": 5.1958, "mean_token_accuracy": 0.18427686840295793, "num_tokens": 49411231.0, "step": 28485 }, { "entropy": 5.453837156295776, "epoch": 2.21661155417234, "grad_norm": 1.25, "learning_rate": 0.0004503463337084072, "loss": 5.1438, "mean_token_accuracy": 0.18478370010852813, "num_tokens": 49419410.0, "step": 28490 }, { "entropy": 5.46797924041748, "epoch": 2.2170005835440576, "grad_norm": 1.1640625, "learning_rate": 0.0004503289649639754, "loss": 5.0016, "mean_token_accuracy": 0.19264817535877227, "num_tokens": 49427365.0, "step": 28495 }, { "entropy": 5.424461507797242, "epoch": 2.2173896129157753, "grad_norm": 1.203125, "learning_rate": 0.0004503115935592056, "loss": 5.0423, "mean_token_accuracy": 0.18813115507364273, "num_tokens": 49436395.0, "step": 28500 }, { "entropy": 5.4797711849212645, "epoch": 2.2177786422874926, "grad_norm": 1.4453125, "learning_rate": 0.0004502942194943614, "loss": 5.1259, "mean_token_accuracy": 0.18891520500183107, "num_tokens": 49446021.0, "step": 28505 }, { "entropy": 5.482440614700318, "epoch": 2.2181676716592102, "grad_norm": 1.21875, "learning_rate": 0.00045027684276970645, "loss": 5.1841, "mean_token_accuracy": 0.17942865788936616, "num_tokens": 49454306.0, "step": 28510 }, { "entropy": 5.431322050094605, "epoch": 2.218556701030928, "grad_norm": 1.15625, "learning_rate": 0.00045025946338550434, "loss": 5.0751, "mean_token_accuracy": 0.1899477317929268, "num_tokens": 49462735.0, "step": 28515 }, { "entropy": 5.456733369827271, "epoch": 2.218945730402645, "grad_norm": 1.15625, "learning_rate": 0.0004502420813420189, "loss": 5.1175, "mean_token_accuracy": 0.1880837544798851, "num_tokens": 49471156.0, "step": 28520 }, { "entropy": 5.468562746047974, "epoch": 2.219334759774363, "grad_norm": 1.1796875, "learning_rate": 0.0004502246966395137, "loss": 5.1296, "mean_token_accuracy": 0.18950305134058, "num_tokens": 49479505.0, "step": 28525 }, { "entropy": 5.457633638381958, "epoch": 2.2197237891460806, "grad_norm": 1.171875, "learning_rate": 0.00045020730927825274, "loss": 5.1434, "mean_token_accuracy": 0.18986338824033738, "num_tokens": 49487879.0, "step": 28530 }, { "entropy": 5.421398019790649, "epoch": 2.2201128185177983, "grad_norm": 1.21875, "learning_rate": 0.0004501899192584997, "loss": 4.9773, "mean_token_accuracy": 0.19717420041561126, "num_tokens": 49496321.0, "step": 28535 }, { "entropy": 5.547014236450195, "epoch": 2.2205018478895155, "grad_norm": 1.359375, "learning_rate": 0.0004501725265805185, "loss": 5.3122, "mean_token_accuracy": 0.17927169501781465, "num_tokens": 49504955.0, "step": 28540 }, { "entropy": 5.416229104995727, "epoch": 2.2208908772612332, "grad_norm": 1.171875, "learning_rate": 0.00045015513124457303, "loss": 4.9933, "mean_token_accuracy": 0.1946098431944847, "num_tokens": 49513678.0, "step": 28545 }, { "entropy": 5.388616132736206, "epoch": 2.221279906632951, "grad_norm": 1.2734375, "learning_rate": 0.0004501377332509272, "loss": 5.0373, "mean_token_accuracy": 0.1920957610011101, "num_tokens": 49522315.0, "step": 28550 }, { "entropy": 5.430415630340576, "epoch": 2.221668936004668, "grad_norm": 1.2421875, "learning_rate": 0.00045012033259984494, "loss": 5.1308, "mean_token_accuracy": 0.18593131452798844, "num_tokens": 49531077.0, "step": 28555 }, { "entropy": 5.5044420719146725, "epoch": 2.222057965376386, "grad_norm": 1.2578125, "learning_rate": 0.0004501029292915905, "loss": 5.0978, "mean_token_accuracy": 0.18727333545684816, "num_tokens": 49540327.0, "step": 28560 }, { "entropy": 5.407759284973144, "epoch": 2.2224469947481036, "grad_norm": 1.2109375, "learning_rate": 0.00045008552332642774, "loss": 5.0943, "mean_token_accuracy": 0.18644336014986038, "num_tokens": 49549440.0, "step": 28565 }, { "entropy": 5.457917594909668, "epoch": 2.222836024119821, "grad_norm": 1.328125, "learning_rate": 0.00045006811470462083, "loss": 5.0699, "mean_token_accuracy": 0.19020809531211852, "num_tokens": 49558066.0, "step": 28570 }, { "entropy": 5.500832271575928, "epoch": 2.2232250534915385, "grad_norm": 1.21875, "learning_rate": 0.000450050703426434, "loss": 5.0361, "mean_token_accuracy": 0.20039083808660507, "num_tokens": 49566970.0, "step": 28575 }, { "entropy": 5.30230860710144, "epoch": 2.2236140828632562, "grad_norm": 1.25, "learning_rate": 0.0004500332894921313, "loss": 4.9489, "mean_token_accuracy": 0.19905491471290587, "num_tokens": 49575524.0, "step": 28580 }, { "entropy": 5.485428524017334, "epoch": 2.224003112234974, "grad_norm": 1.265625, "learning_rate": 0.0004500158729019771, "loss": 5.2087, "mean_token_accuracy": 0.17952203750610352, "num_tokens": 49584040.0, "step": 28585 }, { "entropy": 5.540430545806885, "epoch": 2.224392141606691, "grad_norm": 1.28125, "learning_rate": 0.0004499984536562355, "loss": 5.1361, "mean_token_accuracy": 0.18530689626932145, "num_tokens": 49592991.0, "step": 28590 }, { "entropy": 5.420074081420898, "epoch": 2.224781170978409, "grad_norm": 1.21875, "learning_rate": 0.000449981031755171, "loss": 5.0994, "mean_token_accuracy": 0.18820798248052598, "num_tokens": 49601958.0, "step": 28595 }, { "entropy": 5.381592464447022, "epoch": 2.2251702003501266, "grad_norm": 1.3828125, "learning_rate": 0.00044996360719904777, "loss": 5.0187, "mean_token_accuracy": 0.19493012875318527, "num_tokens": 49610624.0, "step": 28600 }, { "entropy": 5.412230062484741, "epoch": 2.225559229721844, "grad_norm": 1.2109375, "learning_rate": 0.0004499461799881303, "loss": 5.0745, "mean_token_accuracy": 0.19116441756486893, "num_tokens": 49619308.0, "step": 28605 }, { "entropy": 5.42528133392334, "epoch": 2.2259482590935615, "grad_norm": 1.28125, "learning_rate": 0.0004499287501226831, "loss": 5.0531, "mean_token_accuracy": 0.18971817791461945, "num_tokens": 49627842.0, "step": 28610 }, { "entropy": 5.4649186611175535, "epoch": 2.2263372884652792, "grad_norm": 1.2265625, "learning_rate": 0.00044991131760297045, "loss": 5.1492, "mean_token_accuracy": 0.18584991842508317, "num_tokens": 49636712.0, "step": 28615 }, { "entropy": 5.498069715499878, "epoch": 2.226726317836997, "grad_norm": 1.203125, "learning_rate": 0.00044989388242925693, "loss": 5.1396, "mean_token_accuracy": 0.1903313785791397, "num_tokens": 49645324.0, "step": 28620 }, { "entropy": 5.420678806304932, "epoch": 2.227115347208714, "grad_norm": 1.21875, "learning_rate": 0.0004498764446018073, "loss": 5.0833, "mean_token_accuracy": 0.19233340322971343, "num_tokens": 49654203.0, "step": 28625 }, { "entropy": 5.476797962188721, "epoch": 2.227504376580432, "grad_norm": 1.1796875, "learning_rate": 0.0004498590041208857, "loss": 5.1332, "mean_token_accuracy": 0.17837443500757216, "num_tokens": 49663197.0, "step": 28630 }, { "entropy": 5.39409122467041, "epoch": 2.2278934059521496, "grad_norm": 1.1328125, "learning_rate": 0.0004498415609867572, "loss": 5.0118, "mean_token_accuracy": 0.18957238495349885, "num_tokens": 49671993.0, "step": 28635 }, { "entropy": 5.324062442779541, "epoch": 2.228282435323867, "grad_norm": 1.25, "learning_rate": 0.00044982411519968625, "loss": 4.9067, "mean_token_accuracy": 0.19392403662204744, "num_tokens": 49680403.0, "step": 28640 }, { "entropy": 5.370967531204224, "epoch": 2.2286714646955845, "grad_norm": 1.1484375, "learning_rate": 0.0004498066667599377, "loss": 4.9371, "mean_token_accuracy": 0.20088836550712585, "num_tokens": 49688667.0, "step": 28645 }, { "entropy": 5.339514923095703, "epoch": 2.2290604940673022, "grad_norm": 1.2421875, "learning_rate": 0.00044978921566777604, "loss": 5.0718, "mean_token_accuracy": 0.1877834066748619, "num_tokens": 49696753.0, "step": 28650 }, { "entropy": 5.4572125434875485, "epoch": 2.2294495234390195, "grad_norm": 1.375, "learning_rate": 0.0004497717619234664, "loss": 5.0418, "mean_token_accuracy": 0.18978618532419206, "num_tokens": 49705222.0, "step": 28655 }, { "entropy": 5.419244575500488, "epoch": 2.229838552810737, "grad_norm": 1.5625, "learning_rate": 0.00044975430552727337, "loss": 5.0502, "mean_token_accuracy": 0.19420383125543594, "num_tokens": 49714133.0, "step": 28660 }, { "entropy": 5.34322075843811, "epoch": 2.230227582182455, "grad_norm": 1.2734375, "learning_rate": 0.0004497368464794619, "loss": 4.9956, "mean_token_accuracy": 0.1938999339938164, "num_tokens": 49722743.0, "step": 28665 }, { "entropy": 5.392423868179321, "epoch": 2.230616611554172, "grad_norm": 1.5703125, "learning_rate": 0.00044971938478029693, "loss": 4.9794, "mean_token_accuracy": 0.20266159474849701, "num_tokens": 49731721.0, "step": 28670 }, { "entropy": 5.373440980911255, "epoch": 2.23100564092589, "grad_norm": 1.2265625, "learning_rate": 0.00044970192043004343, "loss": 4.9583, "mean_token_accuracy": 0.1940787300467491, "num_tokens": 49740373.0, "step": 28675 }, { "entropy": 5.344507455825806, "epoch": 2.2313946702976075, "grad_norm": 1.265625, "learning_rate": 0.0004496844534289663, "loss": 5.0543, "mean_token_accuracy": 0.19620848894119264, "num_tokens": 49748544.0, "step": 28680 }, { "entropy": 5.545773124694824, "epoch": 2.231783699669325, "grad_norm": 1.1875, "learning_rate": 0.00044966698377733064, "loss": 5.1485, "mean_token_accuracy": 0.1830441474914551, "num_tokens": 49757738.0, "step": 28685 }, { "entropy": 5.40210976600647, "epoch": 2.2321727290410425, "grad_norm": 1.234375, "learning_rate": 0.0004496495114754015, "loss": 4.9624, "mean_token_accuracy": 0.19104286432266235, "num_tokens": 49766203.0, "step": 28690 }, { "entropy": 5.348806571960449, "epoch": 2.23256175841276, "grad_norm": 1.1875, "learning_rate": 0.00044963203652344404, "loss": 5.0225, "mean_token_accuracy": 0.1862621620297432, "num_tokens": 49774951.0, "step": 28695 }, { "entropy": 5.315744638442993, "epoch": 2.232950787784478, "grad_norm": 1.1171875, "learning_rate": 0.0004496145589217234, "loss": 5.0177, "mean_token_accuracy": 0.18839140385389327, "num_tokens": 49783250.0, "step": 28700 }, { "entropy": 5.391508865356445, "epoch": 2.233339817156195, "grad_norm": 1.15625, "learning_rate": 0.00044959707867050467, "loss": 4.9774, "mean_token_accuracy": 0.19507981687784196, "num_tokens": 49792832.0, "step": 28705 }, { "entropy": 5.383459138870239, "epoch": 2.233728846527913, "grad_norm": 1.6640625, "learning_rate": 0.0004495795957700532, "loss": 4.9905, "mean_token_accuracy": 0.1987452045083046, "num_tokens": 49800745.0, "step": 28710 }, { "entropy": 5.358058118820191, "epoch": 2.2341178758996305, "grad_norm": 1.125, "learning_rate": 0.00044956211022063424, "loss": 4.9483, "mean_token_accuracy": 0.20443753749132157, "num_tokens": 49809458.0, "step": 28715 }, { "entropy": 5.432945203781128, "epoch": 2.234506905271348, "grad_norm": 1.5, "learning_rate": 0.00044954462202251316, "loss": 5.0485, "mean_token_accuracy": 0.19775092601776123, "num_tokens": 49818122.0, "step": 28720 }, { "entropy": 5.371125364303589, "epoch": 2.2348959346430655, "grad_norm": 1.2109375, "learning_rate": 0.00044952713117595516, "loss": 4.9877, "mean_token_accuracy": 0.19033448845148088, "num_tokens": 49826451.0, "step": 28725 }, { "entropy": 5.484125709533691, "epoch": 2.235284964014783, "grad_norm": 1.234375, "learning_rate": 0.00044950963768122576, "loss": 5.0815, "mean_token_accuracy": 0.18741485923528672, "num_tokens": 49835463.0, "step": 28730 }, { "entropy": 5.393840980529785, "epoch": 2.235673993386501, "grad_norm": 1.25, "learning_rate": 0.0004494921415385905, "loss": 5.0058, "mean_token_accuracy": 0.1955430656671524, "num_tokens": 49843896.0, "step": 28735 }, { "entropy": 5.426755666732788, "epoch": 2.236063022758218, "grad_norm": 1.203125, "learning_rate": 0.00044947464274831464, "loss": 5.0618, "mean_token_accuracy": 0.18466218709945678, "num_tokens": 49852380.0, "step": 28740 }, { "entropy": 5.453187656402588, "epoch": 2.236452052129936, "grad_norm": 1.1015625, "learning_rate": 0.0004494571413106637, "loss": 5.0169, "mean_token_accuracy": 0.1939795657992363, "num_tokens": 49861290.0, "step": 28745 }, { "entropy": 5.468720436096191, "epoch": 2.2368410815016535, "grad_norm": 1.3125, "learning_rate": 0.00044943963722590344, "loss": 5.0676, "mean_token_accuracy": 0.19270249754190444, "num_tokens": 49869295.0, "step": 28750 }, { "entropy": 5.416519832611084, "epoch": 2.2372301108733708, "grad_norm": 1.2734375, "learning_rate": 0.00044942213049429917, "loss": 5.1548, "mean_token_accuracy": 0.19087494760751725, "num_tokens": 49877771.0, "step": 28755 }, { "entropy": 5.422810077667236, "epoch": 2.2376191402450885, "grad_norm": 1.296875, "learning_rate": 0.00044940462111611685, "loss": 5.1267, "mean_token_accuracy": 0.18862754702568055, "num_tokens": 49886531.0, "step": 28760 }, { "entropy": 5.498632097244263, "epoch": 2.238008169616806, "grad_norm": 1.203125, "learning_rate": 0.00044938710909162195, "loss": 5.1466, "mean_token_accuracy": 0.19681938141584396, "num_tokens": 49895323.0, "step": 28765 }, { "entropy": 5.472868013381958, "epoch": 2.2383971989885234, "grad_norm": 1.3046875, "learning_rate": 0.0004493695944210802, "loss": 5.0793, "mean_token_accuracy": 0.1913537636399269, "num_tokens": 49903918.0, "step": 28770 }, { "entropy": 5.372855377197266, "epoch": 2.238786228360241, "grad_norm": 1.1796875, "learning_rate": 0.0004493520771047574, "loss": 5.0133, "mean_token_accuracy": 0.1948249414563179, "num_tokens": 49912754.0, "step": 28775 }, { "entropy": 5.438584613800049, "epoch": 2.239175257731959, "grad_norm": 1.109375, "learning_rate": 0.00044933455714291944, "loss": 5.1382, "mean_token_accuracy": 0.18726300746202468, "num_tokens": 49922188.0, "step": 28780 }, { "entropy": 5.499379587173462, "epoch": 2.2395642871036765, "grad_norm": 1.3046875, "learning_rate": 0.00044931703453583195, "loss": 5.1224, "mean_token_accuracy": 0.18636402487754822, "num_tokens": 49930718.0, "step": 28785 }, { "entropy": 5.410118627548218, "epoch": 2.2399533164753938, "grad_norm": 1.2421875, "learning_rate": 0.00044929950928376095, "loss": 5.1274, "mean_token_accuracy": 0.19219346046447755, "num_tokens": 49939095.0, "step": 28790 }, { "entropy": 5.431325531005859, "epoch": 2.2403423458471114, "grad_norm": 1.3515625, "learning_rate": 0.0004492819813869723, "loss": 5.0525, "mean_token_accuracy": 0.19916273951530455, "num_tokens": 49946996.0, "step": 28795 }, { "entropy": 5.491430044174194, "epoch": 2.240731375218829, "grad_norm": 1.15625, "learning_rate": 0.00044926445084573206, "loss": 5.1067, "mean_token_accuracy": 0.19212830662727357, "num_tokens": 49956262.0, "step": 28800 }, { "entropy": 5.426499891281128, "epoch": 2.2411204045905464, "grad_norm": 1.2578125, "learning_rate": 0.000449246917660306, "loss": 5.0266, "mean_token_accuracy": 0.19874854981899262, "num_tokens": 49964581.0, "step": 28805 }, { "entropy": 5.286220932006836, "epoch": 2.241509433962264, "grad_norm": 1.25, "learning_rate": 0.0004492293818309604, "loss": 4.9045, "mean_token_accuracy": 0.1973341479897499, "num_tokens": 49972876.0, "step": 28810 }, { "entropy": 5.4111871242523195, "epoch": 2.241898463333982, "grad_norm": 1.71875, "learning_rate": 0.0004492118433579613, "loss": 5.0521, "mean_token_accuracy": 0.1908900886774063, "num_tokens": 49981605.0, "step": 28815 }, { "entropy": 5.543170976638794, "epoch": 2.2422874927056995, "grad_norm": 1.2890625, "learning_rate": 0.00044919430224157463, "loss": 5.1933, "mean_token_accuracy": 0.18579653054475784, "num_tokens": 49990576.0, "step": 28820 }, { "entropy": 5.406686449050904, "epoch": 2.2426765220774167, "grad_norm": 1.2265625, "learning_rate": 0.00044917675848206684, "loss": 5.0313, "mean_token_accuracy": 0.19062115699052812, "num_tokens": 49999350.0, "step": 28825 }, { "entropy": 5.374755716323852, "epoch": 2.2430655514491344, "grad_norm": 1.171875, "learning_rate": 0.00044915921207970387, "loss": 5.0278, "mean_token_accuracy": 0.19166239798069, "num_tokens": 50008202.0, "step": 28830 }, { "entropy": 5.358312320709229, "epoch": 2.243454580820852, "grad_norm": 1.1640625, "learning_rate": 0.00044914166303475206, "loss": 4.9353, "mean_token_accuracy": 0.19787064790725709, "num_tokens": 50016600.0, "step": 28835 }, { "entropy": 5.351320123672485, "epoch": 2.2438436101925694, "grad_norm": 1.25, "learning_rate": 0.00044912411134747764, "loss": 4.9857, "mean_token_accuracy": 0.20012570917606354, "num_tokens": 50025029.0, "step": 28840 }, { "entropy": 5.283933448791504, "epoch": 2.244232639564287, "grad_norm": 1.2421875, "learning_rate": 0.00044910655701814705, "loss": 4.9761, "mean_token_accuracy": 0.1964990586042404, "num_tokens": 50033692.0, "step": 28845 }, { "entropy": 5.447194290161133, "epoch": 2.244621668936005, "grad_norm": 1.2890625, "learning_rate": 0.0004490890000470266, "loss": 5.0877, "mean_token_accuracy": 0.1911623165011406, "num_tokens": 50042572.0, "step": 28850 }, { "entropy": 5.535709571838379, "epoch": 2.245010698307722, "grad_norm": 1.203125, "learning_rate": 0.00044907144043438265, "loss": 5.1375, "mean_token_accuracy": 0.19437725096940994, "num_tokens": 50050823.0, "step": 28855 }, { "entropy": 5.39934458732605, "epoch": 2.2453997276794397, "grad_norm": 1.265625, "learning_rate": 0.0004490538781804816, "loss": 4.9785, "mean_token_accuracy": 0.19421305060386657, "num_tokens": 50058596.0, "step": 28860 }, { "entropy": 5.423104906082154, "epoch": 2.2457887570511574, "grad_norm": 1.1875, "learning_rate": 0.00044903631328559, "loss": 4.9741, "mean_token_accuracy": 0.19655991196632386, "num_tokens": 50067482.0, "step": 28865 }, { "entropy": 5.437716484069824, "epoch": 2.246177786422875, "grad_norm": 1.3359375, "learning_rate": 0.00044901874574997444, "loss": 5.1002, "mean_token_accuracy": 0.19409218430519104, "num_tokens": 50075581.0, "step": 28870 }, { "entropy": 5.374107122421265, "epoch": 2.2465668157945924, "grad_norm": 1.4609375, "learning_rate": 0.00044900117557390137, "loss": 4.994, "mean_token_accuracy": 0.19663966596126556, "num_tokens": 50083906.0, "step": 28875 }, { "entropy": 5.430074167251587, "epoch": 2.24695584516631, "grad_norm": 1.296875, "learning_rate": 0.00044898360275763733, "loss": 5.0866, "mean_token_accuracy": 0.1902938663959503, "num_tokens": 50091494.0, "step": 28880 }, { "entropy": 5.460253763198852, "epoch": 2.247344874538028, "grad_norm": 1.2734375, "learning_rate": 0.00044896602730144905, "loss": 5.1619, "mean_token_accuracy": 0.19280390590429305, "num_tokens": 50100576.0, "step": 28885 }, { "entropy": 5.5161497592926025, "epoch": 2.247733903909745, "grad_norm": 1.1953125, "learning_rate": 0.00044894844920560323, "loss": 5.2076, "mean_token_accuracy": 0.17911085188388826, "num_tokens": 50109832.0, "step": 28890 }, { "entropy": 5.454965972900391, "epoch": 2.2481229332814627, "grad_norm": 1.1640625, "learning_rate": 0.0004489308684703666, "loss": 5.1924, "mean_token_accuracy": 0.17899487018585206, "num_tokens": 50120038.0, "step": 28895 }, { "entropy": 5.441544055938721, "epoch": 2.2485119626531804, "grad_norm": 1.15625, "learning_rate": 0.0004489132850960059, "loss": 5.074, "mean_token_accuracy": 0.1898920103907585, "num_tokens": 50128580.0, "step": 28900 }, { "entropy": 5.41399564743042, "epoch": 2.2489009920248977, "grad_norm": 1.203125, "learning_rate": 0.0004488956990827878, "loss": 5.1446, "mean_token_accuracy": 0.18947150111198424, "num_tokens": 50137540.0, "step": 28905 }, { "entropy": 5.4897847175598145, "epoch": 2.2492900213966154, "grad_norm": 1.265625, "learning_rate": 0.0004488781104309793, "loss": 5.1146, "mean_token_accuracy": 0.18805892169475555, "num_tokens": 50146292.0, "step": 28910 }, { "entropy": 5.390196943283081, "epoch": 2.249679050768333, "grad_norm": 1.21875, "learning_rate": 0.00044886051914084726, "loss": 4.9595, "mean_token_accuracy": 0.19698358178138733, "num_tokens": 50154893.0, "step": 28915 }, { "entropy": 5.385761737823486, "epoch": 2.2500680801400508, "grad_norm": 1.234375, "learning_rate": 0.00044884292521265846, "loss": 5.1037, "mean_token_accuracy": 0.18638947308063508, "num_tokens": 50163707.0, "step": 28920 }, { "entropy": 5.42761263847351, "epoch": 2.250457109511768, "grad_norm": 1.1796875, "learning_rate": 0.0004488253286466801, "loss": 5.0519, "mean_token_accuracy": 0.1898472025990486, "num_tokens": 50172062.0, "step": 28925 }, { "entropy": 5.415374374389648, "epoch": 2.2508461388834857, "grad_norm": 1.265625, "learning_rate": 0.00044880772944317905, "loss": 5.0075, "mean_token_accuracy": 0.19126275479793547, "num_tokens": 50180362.0, "step": 28930 }, { "entropy": 5.3909505844116214, "epoch": 2.2512351682552034, "grad_norm": 1.1953125, "learning_rate": 0.00044879012760242224, "loss": 5.0867, "mean_token_accuracy": 0.1932997301220894, "num_tokens": 50189038.0, "step": 28935 }, { "entropy": 5.447734737396241, "epoch": 2.2516241976269207, "grad_norm": 1.2890625, "learning_rate": 0.00044877252312467694, "loss": 5.0367, "mean_token_accuracy": 0.18395038396120073, "num_tokens": 50198288.0, "step": 28940 }, { "entropy": 5.34761757850647, "epoch": 2.2520132269986384, "grad_norm": 1.2109375, "learning_rate": 0.0004487549160102101, "loss": 5.036, "mean_token_accuracy": 0.19511747658252715, "num_tokens": 50207442.0, "step": 28945 }, { "entropy": 5.447969007492065, "epoch": 2.252402256370356, "grad_norm": 1.1484375, "learning_rate": 0.00044873730625928914, "loss": 5.1624, "mean_token_accuracy": 0.18647781759500504, "num_tokens": 50216794.0, "step": 28950 }, { "entropy": 5.439132499694824, "epoch": 2.2527912857420738, "grad_norm": 1.21875, "learning_rate": 0.00044871969387218094, "loss": 5.0052, "mean_token_accuracy": 0.1937894269824028, "num_tokens": 50224764.0, "step": 28955 }, { "entropy": 5.399581575393677, "epoch": 2.253180315113791, "grad_norm": 1.1640625, "learning_rate": 0.000448702078849153, "loss": 5.1171, "mean_token_accuracy": 0.18378374129533767, "num_tokens": 50233256.0, "step": 28960 }, { "entropy": 5.414939117431641, "epoch": 2.2535693444855087, "grad_norm": 1.0859375, "learning_rate": 0.00044868446119047234, "loss": 5.0409, "mean_token_accuracy": 0.1940825402736664, "num_tokens": 50242862.0, "step": 28965 }, { "entropy": 5.410463571548462, "epoch": 2.253958373857226, "grad_norm": 1.2265625, "learning_rate": 0.0004486668408964065, "loss": 5.048, "mean_token_accuracy": 0.18888943642377853, "num_tokens": 50252048.0, "step": 28970 }, { "entropy": 5.455747842788696, "epoch": 2.2543474032289437, "grad_norm": 1.1328125, "learning_rate": 0.0004486492179672228, "loss": 5.162, "mean_token_accuracy": 0.18574519455432892, "num_tokens": 50260545.0, "step": 28975 }, { "entropy": 5.404513311386109, "epoch": 2.2547364326006614, "grad_norm": 1.203125, "learning_rate": 0.00044863159240318863, "loss": 4.9761, "mean_token_accuracy": 0.19828768372535704, "num_tokens": 50268714.0, "step": 28980 }, { "entropy": 5.3327226638793945, "epoch": 2.255125461972379, "grad_norm": 1.140625, "learning_rate": 0.0004486139642045714, "loss": 4.9714, "mean_token_accuracy": 0.2000202015042305, "num_tokens": 50276876.0, "step": 28985 }, { "entropy": 5.441846609115601, "epoch": 2.2555144913440963, "grad_norm": 1.1796875, "learning_rate": 0.0004485963333716385, "loss": 5.1219, "mean_token_accuracy": 0.18513816595077515, "num_tokens": 50285924.0, "step": 28990 }, { "entropy": 5.518434953689575, "epoch": 2.255903520715814, "grad_norm": 1.21875, "learning_rate": 0.0004485786999046576, "loss": 5.1112, "mean_token_accuracy": 0.182501682639122, "num_tokens": 50295358.0, "step": 28995 }, { "entropy": 5.444577646255493, "epoch": 2.2562925500875317, "grad_norm": 1.2890625, "learning_rate": 0.00044856106380389624, "loss": 5.097, "mean_token_accuracy": 0.18781280219554902, "num_tokens": 50303572.0, "step": 29000 }, { "entropy": 5.404143285751343, "epoch": 2.256681579459249, "grad_norm": 1.2578125, "learning_rate": 0.000448543425069622, "loss": 5.021, "mean_token_accuracy": 0.19773191213607788, "num_tokens": 50312533.0, "step": 29005 }, { "entropy": 5.401978158950806, "epoch": 2.2570706088309667, "grad_norm": 1.28125, "learning_rate": 0.0004485257837021025, "loss": 5.0128, "mean_token_accuracy": 0.1936962679028511, "num_tokens": 50321049.0, "step": 29010 }, { "entropy": 5.340402030944825, "epoch": 2.2574596382026844, "grad_norm": 1.2109375, "learning_rate": 0.00044850813970160534, "loss": 4.9734, "mean_token_accuracy": 0.19698132276535035, "num_tokens": 50329308.0, "step": 29015 }, { "entropy": 5.417828845977783, "epoch": 2.257848667574402, "grad_norm": 1.3046875, "learning_rate": 0.0004484904930683984, "loss": 4.9817, "mean_token_accuracy": 0.19921959489583968, "num_tokens": 50337311.0, "step": 29020 }, { "entropy": 5.369078588485718, "epoch": 2.2582376969461193, "grad_norm": 1.2734375, "learning_rate": 0.0004484728438027494, "loss": 5.0673, "mean_token_accuracy": 0.19529227763414383, "num_tokens": 50346557.0, "step": 29025 }, { "entropy": 5.316523790359497, "epoch": 2.258626726317837, "grad_norm": 1.2265625, "learning_rate": 0.0004484551919049261, "loss": 5.0134, "mean_token_accuracy": 0.19744038879871367, "num_tokens": 50354982.0, "step": 29030 }, { "entropy": 5.407460021972656, "epoch": 2.2590157556895547, "grad_norm": 1.34375, "learning_rate": 0.00044843753737519625, "loss": 5.0306, "mean_token_accuracy": 0.18970168083906175, "num_tokens": 50363414.0, "step": 29035 }, { "entropy": 5.4611560821533205, "epoch": 2.259404785061272, "grad_norm": 1.265625, "learning_rate": 0.0004484198802138279, "loss": 4.9862, "mean_token_accuracy": 0.1963168665766716, "num_tokens": 50371803.0, "step": 29040 }, { "entropy": 5.421046543121338, "epoch": 2.2597938144329897, "grad_norm": 1.1875, "learning_rate": 0.0004484022204210889, "loss": 5.0969, "mean_token_accuracy": 0.19071290791034698, "num_tokens": 50380125.0, "step": 29045 }, { "entropy": 5.305266714096069, "epoch": 2.2601828438047074, "grad_norm": 1.1484375, "learning_rate": 0.00044838455799724717, "loss": 4.966, "mean_token_accuracy": 0.18888027369976043, "num_tokens": 50388916.0, "step": 29050 }, { "entropy": 5.4966155052185055, "epoch": 2.260571873176425, "grad_norm": 1.3359375, "learning_rate": 0.00044836689294257075, "loss": 5.1424, "mean_token_accuracy": 0.1934264823794365, "num_tokens": 50397353.0, "step": 29055 }, { "entropy": 5.408742189407349, "epoch": 2.2609609025481423, "grad_norm": 1.328125, "learning_rate": 0.0004483492252573276, "loss": 5.0104, "mean_token_accuracy": 0.1963096097111702, "num_tokens": 50405176.0, "step": 29060 }, { "entropy": 5.316344499588013, "epoch": 2.26134993191986, "grad_norm": 1.2890625, "learning_rate": 0.000448331554941786, "loss": 5.0289, "mean_token_accuracy": 0.19149352014064788, "num_tokens": 50413845.0, "step": 29065 }, { "entropy": 5.403061866760254, "epoch": 2.2617389612915777, "grad_norm": 1.21875, "learning_rate": 0.00044831388199621385, "loss": 5.1175, "mean_token_accuracy": 0.18719917237758638, "num_tokens": 50422343.0, "step": 29070 }, { "entropy": 5.361449766159057, "epoch": 2.262127990663295, "grad_norm": 1.1640625, "learning_rate": 0.00044829620642087946, "loss": 4.978, "mean_token_accuracy": 0.20042907148599626, "num_tokens": 50430438.0, "step": 29075 }, { "entropy": 5.436171627044677, "epoch": 2.2625170200350126, "grad_norm": 1.171875, "learning_rate": 0.0004482785282160509, "loss": 5.0388, "mean_token_accuracy": 0.19168473333120345, "num_tokens": 50438865.0, "step": 29080 }, { "entropy": 5.456004333496094, "epoch": 2.2629060494067303, "grad_norm": 1.1171875, "learning_rate": 0.00044826084738199657, "loss": 5.1194, "mean_token_accuracy": 0.18938930779695512, "num_tokens": 50447784.0, "step": 29085 }, { "entropy": 5.496140670776367, "epoch": 2.2632950787784476, "grad_norm": 1.2265625, "learning_rate": 0.00044824316391898464, "loss": 5.1129, "mean_token_accuracy": 0.1836037814617157, "num_tokens": 50457266.0, "step": 29090 }, { "entropy": 5.5526509284973145, "epoch": 2.2636841081501653, "grad_norm": 1.15625, "learning_rate": 0.00044822547782728334, "loss": 5.2366, "mean_token_accuracy": 0.18093956559896468, "num_tokens": 50466171.0, "step": 29095 }, { "entropy": 5.449325704574585, "epoch": 2.264073137521883, "grad_norm": 1.140625, "learning_rate": 0.0004482077891071612, "loss": 5.0149, "mean_token_accuracy": 0.20048542469739913, "num_tokens": 50474127.0, "step": 29100 }, { "entropy": 5.331634569168091, "epoch": 2.2644621668936002, "grad_norm": 1.125, "learning_rate": 0.00044819009775888655, "loss": 4.9716, "mean_token_accuracy": 0.19020601660013198, "num_tokens": 50482724.0, "step": 29105 }, { "entropy": 5.482419681549072, "epoch": 2.264851196265318, "grad_norm": 1.140625, "learning_rate": 0.00044817240378272784, "loss": 5.1956, "mean_token_accuracy": 0.17646986842155457, "num_tokens": 50491412.0, "step": 29110 }, { "entropy": 5.540668392181397, "epoch": 2.2652402256370356, "grad_norm": 1.390625, "learning_rate": 0.00044815470717895345, "loss": 5.1991, "mean_token_accuracy": 0.18348639756441115, "num_tokens": 50499843.0, "step": 29115 }, { "entropy": 5.535886526107788, "epoch": 2.2656292550087533, "grad_norm": 1.1875, "learning_rate": 0.0004481370079478321, "loss": 5.1177, "mean_token_accuracy": 0.19067116230726242, "num_tokens": 50509501.0, "step": 29120 }, { "entropy": 5.437737131118775, "epoch": 2.2660182843804706, "grad_norm": 1.171875, "learning_rate": 0.0004481193060896322, "loss": 5.0878, "mean_token_accuracy": 0.1952413260936737, "num_tokens": 50518438.0, "step": 29125 }, { "entropy": 5.425158166885376, "epoch": 2.2664073137521883, "grad_norm": 1.265625, "learning_rate": 0.0004481016016046223, "loss": 5.0654, "mean_token_accuracy": 0.18836312741041183, "num_tokens": 50527516.0, "step": 29130 }, { "entropy": 5.434842777252197, "epoch": 2.266796343123906, "grad_norm": 1.109375, "learning_rate": 0.0004480838944930712, "loss": 5.0138, "mean_token_accuracy": 0.18986533731222152, "num_tokens": 50536179.0, "step": 29135 }, { "entropy": 5.448123502731323, "epoch": 2.2671853724956232, "grad_norm": 1.2109375, "learning_rate": 0.0004480661847552474, "loss": 5.0894, "mean_token_accuracy": 0.19332789927721022, "num_tokens": 50545231.0, "step": 29140 }, { "entropy": 5.374819087982178, "epoch": 2.267574401867341, "grad_norm": 1.2578125, "learning_rate": 0.0004480484723914198, "loss": 5.0919, "mean_token_accuracy": 0.18890254199504852, "num_tokens": 50553873.0, "step": 29145 }, { "entropy": 5.475753450393677, "epoch": 2.2679634312390586, "grad_norm": 1.1171875, "learning_rate": 0.0004480307574018571, "loss": 5.1105, "mean_token_accuracy": 0.19271204024553298, "num_tokens": 50563733.0, "step": 29150 }, { "entropy": 5.466091203689575, "epoch": 2.2683524606107763, "grad_norm": 1.140625, "learning_rate": 0.000448013039786828, "loss": 5.036, "mean_token_accuracy": 0.19168713688850403, "num_tokens": 50573187.0, "step": 29155 }, { "entropy": 5.378099346160889, "epoch": 2.2687414899824936, "grad_norm": 1.078125, "learning_rate": 0.00044799531954660133, "loss": 5.0041, "mean_token_accuracy": 0.1955648735165596, "num_tokens": 50581580.0, "step": 29160 }, { "entropy": 5.410655355453491, "epoch": 2.2691305193542113, "grad_norm": 1.3203125, "learning_rate": 0.0004479775966814461, "loss": 5.0454, "mean_token_accuracy": 0.19516540914773942, "num_tokens": 50589471.0, "step": 29165 }, { "entropy": 5.460061407089233, "epoch": 2.269519548725929, "grad_norm": 1.296875, "learning_rate": 0.00044795987119163115, "loss": 5.0984, "mean_token_accuracy": 0.19677649885416032, "num_tokens": 50597923.0, "step": 29170 }, { "entropy": 5.476475620269776, "epoch": 2.2699085780976462, "grad_norm": 1.1875, "learning_rate": 0.0004479421430774255, "loss": 5.1775, "mean_token_accuracy": 0.1796620413661003, "num_tokens": 50606981.0, "step": 29175 }, { "entropy": 5.497299385070801, "epoch": 2.270297607469364, "grad_norm": 1.1875, "learning_rate": 0.0004479244123390981, "loss": 5.0737, "mean_token_accuracy": 0.18257933408021926, "num_tokens": 50615680.0, "step": 29180 }, { "entropy": 5.472466850280762, "epoch": 2.2706866368410816, "grad_norm": 1.1953125, "learning_rate": 0.00044790667897691796, "loss": 5.0384, "mean_token_accuracy": 0.19708404839038848, "num_tokens": 50624053.0, "step": 29185 }, { "entropy": 5.388488245010376, "epoch": 2.271075666212799, "grad_norm": 1.21875, "learning_rate": 0.00044788894299115415, "loss": 5.0828, "mean_token_accuracy": 0.1889742434024811, "num_tokens": 50632671.0, "step": 29190 }, { "entropy": 5.446991729736328, "epoch": 2.2714646955845166, "grad_norm": 1.3359375, "learning_rate": 0.0004478712043820758, "loss": 5.0804, "mean_token_accuracy": 0.19289014488458633, "num_tokens": 50641734.0, "step": 29195 }, { "entropy": 5.387019300460816, "epoch": 2.2718537249562343, "grad_norm": 1.203125, "learning_rate": 0.0004478534631499521, "loss": 4.9959, "mean_token_accuracy": 0.1988363042473793, "num_tokens": 50650711.0, "step": 29200 }, { "entropy": 5.411226081848144, "epoch": 2.2722427543279515, "grad_norm": 1.15625, "learning_rate": 0.00044783571929505223, "loss": 5.074, "mean_token_accuracy": 0.18043090850114823, "num_tokens": 50659814.0, "step": 29205 }, { "entropy": 5.456407642364502, "epoch": 2.2726317836996692, "grad_norm": 1.25, "learning_rate": 0.0004478179728176454, "loss": 5.0283, "mean_token_accuracy": 0.19659682214260102, "num_tokens": 50668340.0, "step": 29210 }, { "entropy": 5.423078441619873, "epoch": 2.273020813071387, "grad_norm": 1.1640625, "learning_rate": 0.0004478002237180009, "loss": 5.0006, "mean_token_accuracy": 0.19361726194620132, "num_tokens": 50676847.0, "step": 29215 }, { "entropy": 5.2886981010437015, "epoch": 2.2734098424431046, "grad_norm": 1.25, "learning_rate": 0.000447782471996388, "loss": 5.021, "mean_token_accuracy": 0.19512952417135238, "num_tokens": 50685074.0, "step": 29220 }, { "entropy": 5.401895570755005, "epoch": 2.273798871814822, "grad_norm": 1.1640625, "learning_rate": 0.0004477647176530762, "loss": 5.0852, "mean_token_accuracy": 0.19187178760766982, "num_tokens": 50693386.0, "step": 29225 }, { "entropy": 5.459427404403686, "epoch": 2.2741879011865396, "grad_norm": 1.375, "learning_rate": 0.0004477469606883347, "loss": 5.0488, "mean_token_accuracy": 0.18817493170499802, "num_tokens": 50701966.0, "step": 29230 }, { "entropy": 5.355460453033447, "epoch": 2.2745769305582573, "grad_norm": 1.1328125, "learning_rate": 0.0004477292011024331, "loss": 5.0032, "mean_token_accuracy": 0.19927186965942384, "num_tokens": 50710630.0, "step": 29235 }, { "entropy": 5.374324131011963, "epoch": 2.2749659599299745, "grad_norm": 1.3046875, "learning_rate": 0.00044771143889564075, "loss": 4.9883, "mean_token_accuracy": 0.19673231542110442, "num_tokens": 50719415.0, "step": 29240 }, { "entropy": 5.434623575210571, "epoch": 2.275354989301692, "grad_norm": 1.1875, "learning_rate": 0.00044769367406822727, "loss": 4.9667, "mean_token_accuracy": 0.20096562951803207, "num_tokens": 50728064.0, "step": 29245 }, { "entropy": 5.34841103553772, "epoch": 2.27574401867341, "grad_norm": 1.109375, "learning_rate": 0.0004476759066204621, "loss": 5.075, "mean_token_accuracy": 0.1870547741651535, "num_tokens": 50736978.0, "step": 29250 }, { "entropy": 5.440932989120483, "epoch": 2.2761330480451276, "grad_norm": 1.2109375, "learning_rate": 0.0004476581365526149, "loss": 5.0319, "mean_token_accuracy": 0.18871684968471528, "num_tokens": 50745368.0, "step": 29255 }, { "entropy": 5.427804183959961, "epoch": 2.276522077416845, "grad_norm": 1.125, "learning_rate": 0.0004476403638649553, "loss": 5.0307, "mean_token_accuracy": 0.20431438386440276, "num_tokens": 50753765.0, "step": 29260 }, { "entropy": 5.41740460395813, "epoch": 2.2769111067885626, "grad_norm": 1.2890625, "learning_rate": 0.00044762258855775294, "loss": 5.1041, "mean_token_accuracy": 0.18782347738742827, "num_tokens": 50762165.0, "step": 29265 }, { "entropy": 5.459023284912109, "epoch": 2.2773001361602803, "grad_norm": 1.2421875, "learning_rate": 0.00044760481063127754, "loss": 5.1308, "mean_token_accuracy": 0.19137006849050522, "num_tokens": 50771837.0, "step": 29270 }, { "entropy": 5.488284969329834, "epoch": 2.2776891655319975, "grad_norm": 1.203125, "learning_rate": 0.000447587030085799, "loss": 5.1033, "mean_token_accuracy": 0.18859454095363617, "num_tokens": 50781518.0, "step": 29275 }, { "entropy": 5.442433023452759, "epoch": 2.278078194903715, "grad_norm": 1.234375, "learning_rate": 0.00044756924692158684, "loss": 5.0603, "mean_token_accuracy": 0.18570311814546586, "num_tokens": 50790708.0, "step": 29280 }, { "entropy": 5.375849294662475, "epoch": 2.278467224275433, "grad_norm": 1.1171875, "learning_rate": 0.0004475514611389111, "loss": 5.076, "mean_token_accuracy": 0.18676667958498, "num_tokens": 50798783.0, "step": 29285 }, { "entropy": 5.391128492355347, "epoch": 2.2788562536471506, "grad_norm": 1.2734375, "learning_rate": 0.0004475336727380415, "loss": 4.9943, "mean_token_accuracy": 0.19031715095043183, "num_tokens": 50807033.0, "step": 29290 }, { "entropy": 5.357386207580566, "epoch": 2.279245283018868, "grad_norm": 1.1953125, "learning_rate": 0.0004475158817192481, "loss": 4.9354, "mean_token_accuracy": 0.19494040310382843, "num_tokens": 50815548.0, "step": 29295 }, { "entropy": 5.479776620864868, "epoch": 2.2796343123905856, "grad_norm": 1.21875, "learning_rate": 0.00044749808808280077, "loss": 5.1051, "mean_token_accuracy": 0.18730299919843674, "num_tokens": 50824268.0, "step": 29300 }, { "entropy": 5.391113042831421, "epoch": 2.280023341762303, "grad_norm": 1.1328125, "learning_rate": 0.00044748029182896956, "loss": 4.9366, "mean_token_accuracy": 0.19704650491476058, "num_tokens": 50833136.0, "step": 29305 }, { "entropy": 5.447116756439209, "epoch": 2.2804123711340205, "grad_norm": 1.1640625, "learning_rate": 0.0004474624929580243, "loss": 5.124, "mean_token_accuracy": 0.1866270437836647, "num_tokens": 50841911.0, "step": 29310 }, { "entropy": 5.482091236114502, "epoch": 2.280801400505738, "grad_norm": 1.1640625, "learning_rate": 0.0004474446914702354, "loss": 5.2607, "mean_token_accuracy": 0.1794453963637352, "num_tokens": 50850402.0, "step": 29315 }, { "entropy": 5.497564172744751, "epoch": 2.281190429877456, "grad_norm": 1.21875, "learning_rate": 0.0004474268873658727, "loss": 5.0668, "mean_token_accuracy": 0.19331685453653336, "num_tokens": 50858473.0, "step": 29320 }, { "entropy": 5.40937180519104, "epoch": 2.281579459249173, "grad_norm": 1.1796875, "learning_rate": 0.0004474090806452064, "loss": 4.9292, "mean_token_accuracy": 0.1995991811156273, "num_tokens": 50866798.0, "step": 29325 }, { "entropy": 5.3183125972747805, "epoch": 2.281968488620891, "grad_norm": 1.1953125, "learning_rate": 0.00044739127130850675, "loss": 5.0383, "mean_token_accuracy": 0.19435769617557525, "num_tokens": 50875279.0, "step": 29330 }, { "entropy": 5.352911949157715, "epoch": 2.2823575179926086, "grad_norm": 1.21875, "learning_rate": 0.00044737345935604397, "loss": 4.9255, "mean_token_accuracy": 0.20354053527116775, "num_tokens": 50884021.0, "step": 29335 }, { "entropy": 5.337819623947143, "epoch": 2.282746547364326, "grad_norm": 1.2421875, "learning_rate": 0.0004473556447880883, "loss": 4.9876, "mean_token_accuracy": 0.1977727770805359, "num_tokens": 50891722.0, "step": 29340 }, { "entropy": 5.389324903488159, "epoch": 2.2831355767360435, "grad_norm": 1.2421875, "learning_rate": 0.00044733782760490997, "loss": 5.0941, "mean_token_accuracy": 0.19295429140329362, "num_tokens": 50900985.0, "step": 29345 }, { "entropy": 5.518482208251953, "epoch": 2.283524606107761, "grad_norm": 1.328125, "learning_rate": 0.0004473200078067795, "loss": 5.147, "mean_token_accuracy": 0.17880460619926453, "num_tokens": 50909750.0, "step": 29350 }, { "entropy": 5.420819664001465, "epoch": 2.283913635479479, "grad_norm": 1.125, "learning_rate": 0.00044730218539396717, "loss": 5.0991, "mean_token_accuracy": 0.18782745748758317, "num_tokens": 50918563.0, "step": 29355 }, { "entropy": 5.40172176361084, "epoch": 2.284302664851196, "grad_norm": 1.140625, "learning_rate": 0.0004472843603667434, "loss": 5.1234, "mean_token_accuracy": 0.18483064621686934, "num_tokens": 50927503.0, "step": 29360 }, { "entropy": 5.392805337905884, "epoch": 2.284691694222914, "grad_norm": 1.2421875, "learning_rate": 0.00044726653272537866, "loss": 5.0061, "mean_token_accuracy": 0.19408462941646576, "num_tokens": 50936198.0, "step": 29365 }, { "entropy": 5.384798192977906, "epoch": 2.2850807235946315, "grad_norm": 1.1328125, "learning_rate": 0.0004472487024701435, "loss": 5.0254, "mean_token_accuracy": 0.19249866902828217, "num_tokens": 50945589.0, "step": 29370 }, { "entropy": 5.373767375946045, "epoch": 2.285469752966349, "grad_norm": 1.2578125, "learning_rate": 0.0004472308696013085, "loss": 5.0031, "mean_token_accuracy": 0.19697571247816087, "num_tokens": 50953524.0, "step": 29375 }, { "entropy": 5.413288354873657, "epoch": 2.2858587823380665, "grad_norm": 1.1953125, "learning_rate": 0.0004472130341191441, "loss": 5.061, "mean_token_accuracy": 0.18685273677110673, "num_tokens": 50962127.0, "step": 29380 }, { "entropy": 5.409551286697388, "epoch": 2.286247811709784, "grad_norm": 1.25, "learning_rate": 0.0004471951960239211, "loss": 5.0506, "mean_token_accuracy": 0.198875330388546, "num_tokens": 50970662.0, "step": 29385 }, { "entropy": 5.373150777816773, "epoch": 2.286636841081502, "grad_norm": 1.2734375, "learning_rate": 0.00044717735531591, "loss": 4.9783, "mean_token_accuracy": 0.19755344539880754, "num_tokens": 50979182.0, "step": 29390 }, { "entropy": 5.402038145065307, "epoch": 2.287025870453219, "grad_norm": 1.265625, "learning_rate": 0.00044715951199538156, "loss": 5.118, "mean_token_accuracy": 0.1900848016142845, "num_tokens": 50987285.0, "step": 29395 }, { "entropy": 5.432511949539185, "epoch": 2.287414899824937, "grad_norm": 1.140625, "learning_rate": 0.00044714166606260657, "loss": 5.0629, "mean_token_accuracy": 0.1923697456717491, "num_tokens": 50995988.0, "step": 29400 }, { "entropy": 5.361797094345093, "epoch": 2.2878039291966545, "grad_norm": 1.328125, "learning_rate": 0.0004471238175178559, "loss": 4.9582, "mean_token_accuracy": 0.19657040387392044, "num_tokens": 51003963.0, "step": 29405 }, { "entropy": 5.380674934387207, "epoch": 2.288192958568372, "grad_norm": 1.359375, "learning_rate": 0.0004471059663614002, "loss": 5.0138, "mean_token_accuracy": 0.1858625367283821, "num_tokens": 51012429.0, "step": 29410 }, { "entropy": 5.4750550270080565, "epoch": 2.2885819879400895, "grad_norm": 1.25, "learning_rate": 0.0004470881125935103, "loss": 5.0615, "mean_token_accuracy": 0.1930341601371765, "num_tokens": 51021321.0, "step": 29415 }, { "entropy": 5.36868691444397, "epoch": 2.288971017311807, "grad_norm": 1.265625, "learning_rate": 0.00044707025621445735, "loss": 4.988, "mean_token_accuracy": 0.19266353100538253, "num_tokens": 51029713.0, "step": 29420 }, { "entropy": 5.349739027023316, "epoch": 2.2893600466835244, "grad_norm": 1.2421875, "learning_rate": 0.00044705239722451194, "loss": 5.072, "mean_token_accuracy": 0.18422227799892427, "num_tokens": 51038832.0, "step": 29425 }, { "entropy": 5.4558004379272464, "epoch": 2.289749076055242, "grad_norm": 1.171875, "learning_rate": 0.00044703453562394544, "loss": 4.977, "mean_token_accuracy": 0.20158940851688384, "num_tokens": 51046786.0, "step": 29430 }, { "entropy": 5.391645002365112, "epoch": 2.29013810542696, "grad_norm": 1.203125, "learning_rate": 0.0004470166714130286, "loss": 5.0462, "mean_token_accuracy": 0.18849603831768036, "num_tokens": 51054855.0, "step": 29435 }, { "entropy": 5.461908960342408, "epoch": 2.290527134798677, "grad_norm": 1.140625, "learning_rate": 0.00044699880459203264, "loss": 5.1694, "mean_token_accuracy": 0.18931534737348557, "num_tokens": 51063098.0, "step": 29440 }, { "entropy": 5.427787113189697, "epoch": 2.290916164170395, "grad_norm": 1.171875, "learning_rate": 0.00044698093516122844, "loss": 4.9331, "mean_token_accuracy": 0.19889785796403886, "num_tokens": 51071140.0, "step": 29445 }, { "entropy": 5.400129556655884, "epoch": 2.2913051935421125, "grad_norm": 1.2265625, "learning_rate": 0.0004469630631208874, "loss": 5.0684, "mean_token_accuracy": 0.19501245617866517, "num_tokens": 51079698.0, "step": 29450 }, { "entropy": 5.395448827743531, "epoch": 2.29169422291383, "grad_norm": 1.2578125, "learning_rate": 0.0004469451884712805, "loss": 5.0734, "mean_token_accuracy": 0.1888278603553772, "num_tokens": 51088900.0, "step": 29455 }, { "entropy": 5.398367261886596, "epoch": 2.2920832522855474, "grad_norm": 1.2734375, "learning_rate": 0.0004469273112126791, "loss": 4.9981, "mean_token_accuracy": 0.19329816550016404, "num_tokens": 51098289.0, "step": 29460 }, { "entropy": 5.475690460205078, "epoch": 2.292472281657265, "grad_norm": 1.1328125, "learning_rate": 0.00044690943134535445, "loss": 5.0153, "mean_token_accuracy": 0.19418433606624602, "num_tokens": 51106795.0, "step": 29465 }, { "entropy": 5.367531061172485, "epoch": 2.292861311028983, "grad_norm": 1.1875, "learning_rate": 0.0004468915488695777, "loss": 5.0219, "mean_token_accuracy": 0.19653323590755462, "num_tokens": 51115329.0, "step": 29470 }, { "entropy": 5.277588558197022, "epoch": 2.2932503404007, "grad_norm": 1.15625, "learning_rate": 0.00044687366378562036, "loss": 5.0074, "mean_token_accuracy": 0.19630371034145355, "num_tokens": 51124215.0, "step": 29475 }, { "entropy": 5.407614517211914, "epoch": 2.293639369772418, "grad_norm": 1.203125, "learning_rate": 0.00044685577609375373, "loss": 5.09, "mean_token_accuracy": 0.1888623610138893, "num_tokens": 51132528.0, "step": 29480 }, { "entropy": 5.442210483551025, "epoch": 2.2940283991441355, "grad_norm": 1.1796875, "learning_rate": 0.0004468378857942492, "loss": 5.1283, "mean_token_accuracy": 0.18535656332969666, "num_tokens": 51140726.0, "step": 29485 }, { "entropy": 5.368334627151489, "epoch": 2.294417428515853, "grad_norm": 1.171875, "learning_rate": 0.00044681999288737826, "loss": 5.024, "mean_token_accuracy": 0.19480169117450713, "num_tokens": 51149312.0, "step": 29490 }, { "entropy": 5.479760932922363, "epoch": 2.2948064578875704, "grad_norm": 1.21875, "learning_rate": 0.00044680209737341244, "loss": 5.1455, "mean_token_accuracy": 0.1908273845911026, "num_tokens": 51157464.0, "step": 29495 }, { "entropy": 5.3976658344268795, "epoch": 2.295195487259288, "grad_norm": 1.1171875, "learning_rate": 0.0004467841992526233, "loss": 4.9731, "mean_token_accuracy": 0.1964695170521736, "num_tokens": 51166331.0, "step": 29500 }, { "entropy": 5.420523071289063, "epoch": 2.295584516631006, "grad_norm": 1.2265625, "learning_rate": 0.00044676629852528226, "loss": 5.048, "mean_token_accuracy": 0.2003919556736946, "num_tokens": 51174404.0, "step": 29505 }, { "entropy": 5.273918390274048, "epoch": 2.295973546002723, "grad_norm": 1.2109375, "learning_rate": 0.00044674839519166104, "loss": 4.8827, "mean_token_accuracy": 0.20315038412809372, "num_tokens": 51182650.0, "step": 29510 }, { "entropy": 5.408922147750855, "epoch": 2.2963625753744408, "grad_norm": 1.2265625, "learning_rate": 0.00044673048925203136, "loss": 5.0708, "mean_token_accuracy": 0.18883897513151168, "num_tokens": 51192107.0, "step": 29515 }, { "entropy": 5.3842743873596195, "epoch": 2.2967516047461585, "grad_norm": 1.2890625, "learning_rate": 0.00044671258070666476, "loss": 4.9988, "mean_token_accuracy": 0.19348547756671905, "num_tokens": 51200506.0, "step": 29520 }, { "entropy": 5.35621280670166, "epoch": 2.2971406341178757, "grad_norm": 1.0546875, "learning_rate": 0.0004466946695558331, "loss": 4.9545, "mean_token_accuracy": 0.19873870611190797, "num_tokens": 51209442.0, "step": 29525 }, { "entropy": 5.386664867401123, "epoch": 2.2975296634895934, "grad_norm": 1.203125, "learning_rate": 0.00044667675579980817, "loss": 5.0264, "mean_token_accuracy": 0.19772400856018066, "num_tokens": 51217520.0, "step": 29530 }, { "entropy": 5.448230361938476, "epoch": 2.297918692861311, "grad_norm": 1.359375, "learning_rate": 0.0004466588394388616, "loss": 5.1389, "mean_token_accuracy": 0.18627449721097947, "num_tokens": 51226228.0, "step": 29535 }, { "entropy": 5.468140697479248, "epoch": 2.2983077222330284, "grad_norm": 1.1015625, "learning_rate": 0.0004466409204732654, "loss": 5.1084, "mean_token_accuracy": 0.18486340939998627, "num_tokens": 51235271.0, "step": 29540 }, { "entropy": 5.391859865188598, "epoch": 2.298696751604746, "grad_norm": 1.15625, "learning_rate": 0.00044662299890329144, "loss": 5.0028, "mean_token_accuracy": 0.19454284608364106, "num_tokens": 51243927.0, "step": 29545 }, { "entropy": 5.458694171905518, "epoch": 2.2990857809764638, "grad_norm": 1.6875, "learning_rate": 0.0004466050747292116, "loss": 5.0669, "mean_token_accuracy": 0.19687831699848174, "num_tokens": 51253097.0, "step": 29550 }, { "entropy": 5.411312627792358, "epoch": 2.2994748103481815, "grad_norm": 1.171875, "learning_rate": 0.000446587147951298, "loss": 5.0481, "mean_token_accuracy": 0.19691979885101318, "num_tokens": 51261275.0, "step": 29555 }, { "entropy": 5.438805675506591, "epoch": 2.2998638397198987, "grad_norm": 1.1796875, "learning_rate": 0.0004465692185698224, "loss": 5.1066, "mean_token_accuracy": 0.18948965072631835, "num_tokens": 51269698.0, "step": 29560 }, { "entropy": 5.359121990203858, "epoch": 2.3002528690916164, "grad_norm": 1.21875, "learning_rate": 0.00044655128658505717, "loss": 4.9722, "mean_token_accuracy": 0.1997550517320633, "num_tokens": 51277850.0, "step": 29565 }, { "entropy": 5.4082457542419435, "epoch": 2.300641898463334, "grad_norm": 1.171875, "learning_rate": 0.0004465333519972741, "loss": 4.9819, "mean_token_accuracy": 0.19506940990686417, "num_tokens": 51285919.0, "step": 29570 }, { "entropy": 5.375007820129395, "epoch": 2.3010309278350514, "grad_norm": 1.140625, "learning_rate": 0.0004465154148067454, "loss": 5.0549, "mean_token_accuracy": 0.19366700798273087, "num_tokens": 51294403.0, "step": 29575 }, { "entropy": 5.489139699935913, "epoch": 2.301419957206769, "grad_norm": 1.1796875, "learning_rate": 0.00044649747501374336, "loss": 5.0687, "mean_token_accuracy": 0.1923191502690315, "num_tokens": 51302820.0, "step": 29580 }, { "entropy": 5.356007146835327, "epoch": 2.3018089865784868, "grad_norm": 1.140625, "learning_rate": 0.0004464795326185401, "loss": 5.0477, "mean_token_accuracy": 0.19427828639745712, "num_tokens": 51311385.0, "step": 29585 }, { "entropy": 5.4268226146698, "epoch": 2.3021980159502045, "grad_norm": 1.2265625, "learning_rate": 0.0004464615876214078, "loss": 5.0875, "mean_token_accuracy": 0.18926291018724442, "num_tokens": 51320928.0, "step": 29590 }, { "entropy": 5.354275894165039, "epoch": 2.3025870453219217, "grad_norm": 1.1796875, "learning_rate": 0.0004464436400226188, "loss": 4.9639, "mean_token_accuracy": 0.20075487792491914, "num_tokens": 51329384.0, "step": 29595 }, { "entropy": 5.3405256271362305, "epoch": 2.3029760746936394, "grad_norm": 1.1875, "learning_rate": 0.0004464256898224455, "loss": 5.0366, "mean_token_accuracy": 0.1833977073431015, "num_tokens": 51337765.0, "step": 29600 }, { "entropy": 5.43039493560791, "epoch": 2.303365104065357, "grad_norm": 1.25, "learning_rate": 0.0004464077370211602, "loss": 5.0644, "mean_token_accuracy": 0.18582940697669983, "num_tokens": 51345947.0, "step": 29605 }, { "entropy": 5.372714805603027, "epoch": 2.3037541334370744, "grad_norm": 1.2265625, "learning_rate": 0.00044638978161903533, "loss": 4.9782, "mean_token_accuracy": 0.18902389109134674, "num_tokens": 51354742.0, "step": 29610 }, { "entropy": 5.328454923629761, "epoch": 2.304143162808792, "grad_norm": 1.1875, "learning_rate": 0.0004463718236163433, "loss": 4.9964, "mean_token_accuracy": 0.19618382900953293, "num_tokens": 51364208.0, "step": 29615 }, { "entropy": 5.424306154251099, "epoch": 2.3045321921805098, "grad_norm": 1.1875, "learning_rate": 0.00044635386301335666, "loss": 5.1717, "mean_token_accuracy": 0.18312696367502213, "num_tokens": 51373081.0, "step": 29620 }, { "entropy": 5.4239577293396, "epoch": 2.304921221552227, "grad_norm": 1.21875, "learning_rate": 0.0004463358998103478, "loss": 5.0664, "mean_token_accuracy": 0.19712869822978973, "num_tokens": 51382561.0, "step": 29625 }, { "entropy": 5.480073022842407, "epoch": 2.3053102509239447, "grad_norm": 1.2734375, "learning_rate": 0.0004463179340075894, "loss": 5.1312, "mean_token_accuracy": 0.18804681301116943, "num_tokens": 51391671.0, "step": 29630 }, { "entropy": 5.382198143005371, "epoch": 2.3056992802956624, "grad_norm": 1.1875, "learning_rate": 0.0004462999656053541, "loss": 4.977, "mean_token_accuracy": 0.1994564101099968, "num_tokens": 51400727.0, "step": 29635 }, { "entropy": 5.4393714427947994, "epoch": 2.3060883096673797, "grad_norm": 1.1640625, "learning_rate": 0.00044628199460391445, "loss": 5.1006, "mean_token_accuracy": 0.18588894605636597, "num_tokens": 51409943.0, "step": 29640 }, { "entropy": 5.432221412658691, "epoch": 2.3064773390390974, "grad_norm": 1.1875, "learning_rate": 0.00044626402100354307, "loss": 5.1651, "mean_token_accuracy": 0.18300071805715562, "num_tokens": 51418511.0, "step": 29645 }, { "entropy": 5.375193166732788, "epoch": 2.306866368410815, "grad_norm": 1.203125, "learning_rate": 0.0004462460448045129, "loss": 5.0003, "mean_token_accuracy": 0.1999703198671341, "num_tokens": 51426304.0, "step": 29650 }, { "entropy": 5.475950288772583, "epoch": 2.3072553977825327, "grad_norm": 1.1640625, "learning_rate": 0.00044622806600709645, "loss": 5.1028, "mean_token_accuracy": 0.1893684148788452, "num_tokens": 51434779.0, "step": 29655 }, { "entropy": 5.426788377761841, "epoch": 2.30764442715425, "grad_norm": 1.1015625, "learning_rate": 0.0004462100846115667, "loss": 5.0398, "mean_token_accuracy": 0.19934193342924117, "num_tokens": 51444275.0, "step": 29660 }, { "entropy": 5.452623319625855, "epoch": 2.3080334565259677, "grad_norm": 1.140625, "learning_rate": 0.0004461921006181964, "loss": 5.0929, "mean_token_accuracy": 0.1869780734181404, "num_tokens": 51453149.0, "step": 29665 }, { "entropy": 5.398927831649781, "epoch": 2.3084224858976854, "grad_norm": 1.2109375, "learning_rate": 0.0004461741140272584, "loss": 5.0648, "mean_token_accuracy": 0.20120845288038253, "num_tokens": 51462302.0, "step": 29670 }, { "entropy": 5.465122270584106, "epoch": 2.3088115152694026, "grad_norm": 1.234375, "learning_rate": 0.0004461561248390257, "loss": 5.1392, "mean_token_accuracy": 0.1798361822962761, "num_tokens": 51471186.0, "step": 29675 }, { "entropy": 5.434913778305054, "epoch": 2.3092005446411203, "grad_norm": 1.21875, "learning_rate": 0.0004461381330537713, "loss": 5.0938, "mean_token_accuracy": 0.18915633112192154, "num_tokens": 51479868.0, "step": 29680 }, { "entropy": 5.342674350738525, "epoch": 2.309589574012838, "grad_norm": 1.1484375, "learning_rate": 0.000446120138671768, "loss": 4.9715, "mean_token_accuracy": 0.19977009147405625, "num_tokens": 51489118.0, "step": 29685 }, { "entropy": 5.394464635848999, "epoch": 2.3099786033845557, "grad_norm": 1.21875, "learning_rate": 0.00044610214169328913, "loss": 5.0252, "mean_token_accuracy": 0.19371685832738877, "num_tokens": 51497933.0, "step": 29690 }, { "entropy": 5.528307294845581, "epoch": 2.310367632756273, "grad_norm": 1.2109375, "learning_rate": 0.0004460841421186075, "loss": 5.0989, "mean_token_accuracy": 0.18722251057624817, "num_tokens": 51507046.0, "step": 29695 }, { "entropy": 5.474293518066406, "epoch": 2.3107566621279907, "grad_norm": 1.2734375, "learning_rate": 0.0004460661399479963, "loss": 5.0884, "mean_token_accuracy": 0.19430774599313735, "num_tokens": 51516558.0, "step": 29700 }, { "entropy": 5.313049745559693, "epoch": 2.3111456914997084, "grad_norm": 1.28125, "learning_rate": 0.00044604813518172876, "loss": 4.9448, "mean_token_accuracy": 0.1992548882961273, "num_tokens": 51524411.0, "step": 29705 }, { "entropy": 5.362483978271484, "epoch": 2.3115347208714256, "grad_norm": 1.2265625, "learning_rate": 0.00044603012782007796, "loss": 5.0447, "mean_token_accuracy": 0.180847629904747, "num_tokens": 51533121.0, "step": 29710 }, { "entropy": 5.406411361694336, "epoch": 2.3119237502431433, "grad_norm": 1.2578125, "learning_rate": 0.0004460121178633172, "loss": 5.0855, "mean_token_accuracy": 0.18723346292972565, "num_tokens": 51541417.0, "step": 29715 }, { "entropy": 5.451214551925659, "epoch": 2.312312779614861, "grad_norm": 1.1171875, "learning_rate": 0.00044599410531171986, "loss": 4.9983, "mean_token_accuracy": 0.20454004406929016, "num_tokens": 51549444.0, "step": 29720 }, { "entropy": 5.42308292388916, "epoch": 2.3127018089865787, "grad_norm": 1.2265625, "learning_rate": 0.000445976090165559, "loss": 5.1523, "mean_token_accuracy": 0.1887134313583374, "num_tokens": 51558090.0, "step": 29725 }, { "entropy": 5.4823503494262695, "epoch": 2.313090838358296, "grad_norm": 1.1953125, "learning_rate": 0.0004459580724251082, "loss": 5.1415, "mean_token_accuracy": 0.18770647943019866, "num_tokens": 51566794.0, "step": 29730 }, { "entropy": 5.348286151885986, "epoch": 2.3134798677300137, "grad_norm": 1.1796875, "learning_rate": 0.00044594005209064064, "loss": 4.9789, "mean_token_accuracy": 0.19568664878606795, "num_tokens": 51575411.0, "step": 29735 }, { "entropy": 5.419104719161988, "epoch": 2.313868897101731, "grad_norm": 1.1796875, "learning_rate": 0.00044592202916243003, "loss": 5.0688, "mean_token_accuracy": 0.1897635743021965, "num_tokens": 51584438.0, "step": 29740 }, { "entropy": 5.401909589767456, "epoch": 2.3142579264734486, "grad_norm": 1.1640625, "learning_rate": 0.0004459040036407495, "loss": 5.058, "mean_token_accuracy": 0.19565843939781188, "num_tokens": 51593517.0, "step": 29745 }, { "entropy": 5.422411870956421, "epoch": 2.3146469558451663, "grad_norm": 1.1953125, "learning_rate": 0.0004458859755258729, "loss": 5.0912, "mean_token_accuracy": 0.18768022060394288, "num_tokens": 51602312.0, "step": 29750 }, { "entropy": 5.365849733352661, "epoch": 2.315035985216884, "grad_norm": 1.1640625, "learning_rate": 0.00044586794481807357, "loss": 4.981, "mean_token_accuracy": 0.20302048325538635, "num_tokens": 51611021.0, "step": 29755 }, { "entropy": 5.384206056594849, "epoch": 2.3154250145886013, "grad_norm": 1.1484375, "learning_rate": 0.00044584991151762506, "loss": 5.056, "mean_token_accuracy": 0.1870503842830658, "num_tokens": 51620322.0, "step": 29760 }, { "entropy": 5.4131112575531, "epoch": 2.315814043960319, "grad_norm": 1.1328125, "learning_rate": 0.0004458318756248011, "loss": 5.0361, "mean_token_accuracy": 0.1950208678841591, "num_tokens": 51628626.0, "step": 29765 }, { "entropy": 5.364333391189575, "epoch": 2.3162030733320367, "grad_norm": 1.1484375, "learning_rate": 0.00044581383713987547, "loss": 5.0153, "mean_token_accuracy": 0.19559272676706313, "num_tokens": 51637868.0, "step": 29770 }, { "entropy": 5.37861967086792, "epoch": 2.316592102703754, "grad_norm": 1.2109375, "learning_rate": 0.0004457957960631216, "loss": 4.9896, "mean_token_accuracy": 0.1930706560611725, "num_tokens": 51645756.0, "step": 29775 }, { "entropy": 5.418609142303467, "epoch": 2.3169811320754716, "grad_norm": 1.1953125, "learning_rate": 0.0004457777523948134, "loss": 5.0896, "mean_token_accuracy": 0.18789514899253845, "num_tokens": 51654959.0, "step": 29780 }, { "entropy": 5.49388952255249, "epoch": 2.3173701614471893, "grad_norm": 1.2109375, "learning_rate": 0.0004457597061352247, "loss": 5.0949, "mean_token_accuracy": 0.19222895354032515, "num_tokens": 51663208.0, "step": 29785 }, { "entropy": 5.404866695404053, "epoch": 2.317759190818907, "grad_norm": 1.125, "learning_rate": 0.0004457416572846291, "loss": 5.1012, "mean_token_accuracy": 0.18278964459896088, "num_tokens": 51671627.0, "step": 29790 }, { "entropy": 5.306273508071899, "epoch": 2.3181482201906243, "grad_norm": 1.3046875, "learning_rate": 0.0004457236058433008, "loss": 4.9733, "mean_token_accuracy": 0.19995750486850739, "num_tokens": 51680870.0, "step": 29795 }, { "entropy": 5.45002121925354, "epoch": 2.318537249562342, "grad_norm": 1.2421875, "learning_rate": 0.00044570555181151333, "loss": 5.1707, "mean_token_accuracy": 0.18445187360048293, "num_tokens": 51690566.0, "step": 29800 }, { "entropy": 5.472688150405884, "epoch": 2.3189262789340597, "grad_norm": 1.203125, "learning_rate": 0.000445687495189541, "loss": 5.1004, "mean_token_accuracy": 0.19017809629440308, "num_tokens": 51698792.0, "step": 29805 }, { "entropy": 5.412845611572266, "epoch": 2.319315308305777, "grad_norm": 1.25, "learning_rate": 0.00044566943597765745, "loss": 5.0687, "mean_token_accuracy": 0.19169116914272308, "num_tokens": 51707821.0, "step": 29810 }, { "entropy": 5.347038888931275, "epoch": 2.3197043376774946, "grad_norm": 1.1875, "learning_rate": 0.00044565137417613694, "loss": 5.02, "mean_token_accuracy": 0.1953651562333107, "num_tokens": 51716802.0, "step": 29815 }, { "entropy": 5.4139646053314205, "epoch": 2.3200933670492123, "grad_norm": 1.1484375, "learning_rate": 0.0004456333097852534, "loss": 5.0539, "mean_token_accuracy": 0.19388844668865204, "num_tokens": 51725644.0, "step": 29820 }, { "entropy": 5.4817342281341555, "epoch": 2.32048239642093, "grad_norm": 1.1875, "learning_rate": 0.00044561524280528104, "loss": 5.1295, "mean_token_accuracy": 0.19017827957868577, "num_tokens": 51734072.0, "step": 29825 }, { "entropy": 5.459099435806275, "epoch": 2.3208714257926473, "grad_norm": 1.1640625, "learning_rate": 0.00044559717323649383, "loss": 5.0789, "mean_token_accuracy": 0.19487529695034028, "num_tokens": 51743112.0, "step": 29830 }, { "entropy": 5.428200149536133, "epoch": 2.321260455164365, "grad_norm": 1.1875, "learning_rate": 0.0004455791010791662, "loss": 5.095, "mean_token_accuracy": 0.18801604807376862, "num_tokens": 51752535.0, "step": 29835 }, { "entropy": 5.415243005752563, "epoch": 2.3216494845360827, "grad_norm": 1.1875, "learning_rate": 0.0004455610263335721, "loss": 5.0179, "mean_token_accuracy": 0.1962419182062149, "num_tokens": 51760595.0, "step": 29840 }, { "entropy": 5.4521159648895265, "epoch": 2.3220385139078, "grad_norm": 1.1328125, "learning_rate": 0.0004455429489999859, "loss": 5.1121, "mean_token_accuracy": 0.19558138251304627, "num_tokens": 51769156.0, "step": 29845 }, { "entropy": 5.452931213378906, "epoch": 2.3224275432795176, "grad_norm": 1.171875, "learning_rate": 0.00044552486907868194, "loss": 5.0334, "mean_token_accuracy": 0.18486237823963164, "num_tokens": 51778091.0, "step": 29850 }, { "entropy": 5.44926438331604, "epoch": 2.3228165726512353, "grad_norm": 1.171875, "learning_rate": 0.00044550678656993454, "loss": 5.0588, "mean_token_accuracy": 0.19071279764175414, "num_tokens": 51787207.0, "step": 29855 }, { "entropy": 5.309511661529541, "epoch": 2.3232056020229526, "grad_norm": 1.0859375, "learning_rate": 0.000445488701474018, "loss": 4.943, "mean_token_accuracy": 0.20208046436309815, "num_tokens": 51796158.0, "step": 29860 }, { "entropy": 5.346232080459595, "epoch": 2.3235946313946703, "grad_norm": 1.1171875, "learning_rate": 0.0004454706137912067, "loss": 4.8967, "mean_token_accuracy": 0.2046591207385063, "num_tokens": 51803762.0, "step": 29865 }, { "entropy": 5.471810150146484, "epoch": 2.323983660766388, "grad_norm": 1.2109375, "learning_rate": 0.0004454525235217753, "loss": 5.0812, "mean_token_accuracy": 0.18785480111837388, "num_tokens": 51812610.0, "step": 29870 }, { "entropy": 5.393780612945557, "epoch": 2.324372690138105, "grad_norm": 1.25, "learning_rate": 0.00044543443066599807, "loss": 5.0745, "mean_token_accuracy": 0.18588633239269256, "num_tokens": 51821398.0, "step": 29875 }, { "entropy": 5.400189685821533, "epoch": 2.324761719509823, "grad_norm": 1.171875, "learning_rate": 0.0004454163352241498, "loss": 5.015, "mean_token_accuracy": 0.1869928225874901, "num_tokens": 51829945.0, "step": 29880 }, { "entropy": 5.420876598358154, "epoch": 2.3251507488815406, "grad_norm": 1.1796875, "learning_rate": 0.00044539823719650463, "loss": 5.0554, "mean_token_accuracy": 0.19794220626354217, "num_tokens": 51838816.0, "step": 29885 }, { "entropy": 5.3814856052398685, "epoch": 2.3255397782532583, "grad_norm": 1.2109375, "learning_rate": 0.0004453801365833376, "loss": 5.0635, "mean_token_accuracy": 0.19703920781612397, "num_tokens": 51847775.0, "step": 29890 }, { "entropy": 5.459873628616333, "epoch": 2.3259288076249756, "grad_norm": 1.1484375, "learning_rate": 0.00044536203338492317, "loss": 5.0187, "mean_token_accuracy": 0.1896474301815033, "num_tokens": 51856934.0, "step": 29895 }, { "entropy": 5.514960908889771, "epoch": 2.3263178369966933, "grad_norm": 1.1328125, "learning_rate": 0.00044534392760153596, "loss": 5.1112, "mean_token_accuracy": 0.17878314852714539, "num_tokens": 51865393.0, "step": 29900 }, { "entropy": 5.354064416885376, "epoch": 2.326706866368411, "grad_norm": 1.2578125, "learning_rate": 0.0004453258192334508, "loss": 4.9932, "mean_token_accuracy": 0.20275797992944716, "num_tokens": 51873783.0, "step": 29905 }, { "entropy": 5.343626546859741, "epoch": 2.327095895740128, "grad_norm": 1.3359375, "learning_rate": 0.0004453077082809425, "loss": 5.1015, "mean_token_accuracy": 0.18707127571105958, "num_tokens": 51882934.0, "step": 29910 }, { "entropy": 5.397631454467773, "epoch": 2.327484925111846, "grad_norm": 1.1953125, "learning_rate": 0.00044528959474428575, "loss": 5.0088, "mean_token_accuracy": 0.19322898387908935, "num_tokens": 51891217.0, "step": 29915 }, { "entropy": 5.460697174072266, "epoch": 2.3278739544835636, "grad_norm": 1.125, "learning_rate": 0.0004452714786237555, "loss": 5.1068, "mean_token_accuracy": 0.18826145976781844, "num_tokens": 51900550.0, "step": 29920 }, { "entropy": 5.418945217132569, "epoch": 2.3282629838552813, "grad_norm": 1.171875, "learning_rate": 0.0004452533599196265, "loss": 5.0507, "mean_token_accuracy": 0.19013779610395432, "num_tokens": 51908436.0, "step": 29925 }, { "entropy": 5.4354567527771, "epoch": 2.3286520132269986, "grad_norm": 1.1640625, "learning_rate": 0.00044523523863217374, "loss": 5.1102, "mean_token_accuracy": 0.1913825437426567, "num_tokens": 51917687.0, "step": 29930 }, { "entropy": 5.433904933929443, "epoch": 2.3290410425987162, "grad_norm": 1.1328125, "learning_rate": 0.0004452171147616723, "loss": 5.1344, "mean_token_accuracy": 0.18713640421628952, "num_tokens": 51927011.0, "step": 29935 }, { "entropy": 5.526001119613648, "epoch": 2.329430071970434, "grad_norm": 1.125, "learning_rate": 0.000445198988308397, "loss": 5.1336, "mean_token_accuracy": 0.1826961010694504, "num_tokens": 51936255.0, "step": 29940 }, { "entropy": 5.364567136764526, "epoch": 2.329819101342151, "grad_norm": 1.1875, "learning_rate": 0.00044518085927262293, "loss": 5.0752, "mean_token_accuracy": 0.19084919840097428, "num_tokens": 51944919.0, "step": 29945 }, { "entropy": 5.459301471710205, "epoch": 2.330208130713869, "grad_norm": 1.1796875, "learning_rate": 0.0004451627276546252, "loss": 5.1167, "mean_token_accuracy": 0.19054297655820845, "num_tokens": 51952963.0, "step": 29950 }, { "entropy": 5.411231231689453, "epoch": 2.3305971600855866, "grad_norm": 1.1484375, "learning_rate": 0.000445144593454679, "loss": 5.0086, "mean_token_accuracy": 0.1937964752316475, "num_tokens": 51961493.0, "step": 29955 }, { "entropy": 5.354438543319702, "epoch": 2.330986189457304, "grad_norm": 1.1640625, "learning_rate": 0.0004451264566730593, "loss": 5.103, "mean_token_accuracy": 0.18868838101625443, "num_tokens": 51969911.0, "step": 29960 }, { "entropy": 5.415657043457031, "epoch": 2.3313752188290215, "grad_norm": 1.2109375, "learning_rate": 0.00044510831731004146, "loss": 5.0021, "mean_token_accuracy": 0.19032670110464095, "num_tokens": 51978936.0, "step": 29965 }, { "entropy": 5.521789026260376, "epoch": 2.3317642482007392, "grad_norm": 1.1953125, "learning_rate": 0.0004450901753659007, "loss": 5.0717, "mean_token_accuracy": 0.1853356584906578, "num_tokens": 51987373.0, "step": 29970 }, { "entropy": 5.3963470458984375, "epoch": 2.3321532775724565, "grad_norm": 1.1484375, "learning_rate": 0.00044507203084091215, "loss": 5.1096, "mean_token_accuracy": 0.18220414519309996, "num_tokens": 51995948.0, "step": 29975 }, { "entropy": 5.404459857940674, "epoch": 2.332542306944174, "grad_norm": 1.265625, "learning_rate": 0.0004450538837353513, "loss": 5.082, "mean_token_accuracy": 0.18861262649297714, "num_tokens": 52004623.0, "step": 29980 }, { "entropy": 5.489960956573486, "epoch": 2.332931336315892, "grad_norm": 1.1953125, "learning_rate": 0.00044503573404949343, "loss": 5.0578, "mean_token_accuracy": 0.1924934834241867, "num_tokens": 52012971.0, "step": 29985 }, { "entropy": 5.438990879058838, "epoch": 2.3333203656876096, "grad_norm": 1.203125, "learning_rate": 0.0004450175817836139, "loss": 5.0913, "mean_token_accuracy": 0.1909508928656578, "num_tokens": 52021462.0, "step": 29990 }, { "entropy": 5.344920682907104, "epoch": 2.333709395059327, "grad_norm": 1.1484375, "learning_rate": 0.00044499942693798823, "loss": 4.9899, "mean_token_accuracy": 0.1946091026067734, "num_tokens": 52030494.0, "step": 29995 }, { "entropy": 5.410649108886719, "epoch": 2.3340984244310445, "grad_norm": 1.1796875, "learning_rate": 0.0004449812695128918, "loss": 5.0144, "mean_token_accuracy": 0.19331903457641603, "num_tokens": 52039120.0, "step": 30000 }, { "epoch": 2.3340984244310445, "eval_entropy": 5.278062728187921, "eval_loss": 5.173376083374023, "eval_mean_token_accuracy": 0.19548090663994014, "eval_num_tokens": 52039120.0, "eval_runtime": 29.4602, "eval_samples_per_second": 1410.649, "eval_steps_per_second": 176.34, "step": 30000 }, { "entropy": 5.531785535812378, "epoch": 2.3344874538027622, "grad_norm": 1.25, "learning_rate": 0.00044496310950860015, "loss": 5.134, "mean_token_accuracy": 0.18347583562135697, "num_tokens": 52047248.0, "step": 30005 }, { "entropy": 5.412385892868042, "epoch": 2.3348764831744795, "grad_norm": 1.2109375, "learning_rate": 0.00044494494692538886, "loss": 5.0592, "mean_token_accuracy": 0.1891682118177414, "num_tokens": 52056359.0, "step": 30010 }, { "entropy": 5.458208751678467, "epoch": 2.335265512546197, "grad_norm": 1.1328125, "learning_rate": 0.00044492678176353347, "loss": 5.0523, "mean_token_accuracy": 0.19029513299465178, "num_tokens": 52065042.0, "step": 30015 }, { "entropy": 5.350721406936645, "epoch": 2.335654541917915, "grad_norm": 1.2265625, "learning_rate": 0.00044490861402330967, "loss": 4.926, "mean_token_accuracy": 0.203727188706398, "num_tokens": 52073830.0, "step": 30020 }, { "entropy": 5.285924482345581, "epoch": 2.3360435712896326, "grad_norm": 1.34375, "learning_rate": 0.0004448904437049931, "loss": 4.91, "mean_token_accuracy": 0.1948888823390007, "num_tokens": 52082605.0, "step": 30025 }, { "entropy": 5.42687578201294, "epoch": 2.33643260066135, "grad_norm": 1.171875, "learning_rate": 0.0004448722708088594, "loss": 5.209, "mean_token_accuracy": 0.17946571111679077, "num_tokens": 52091997.0, "step": 30030 }, { "entropy": 5.425217008590698, "epoch": 2.3368216300330675, "grad_norm": 1.09375, "learning_rate": 0.0004448540953351844, "loss": 5.0481, "mean_token_accuracy": 0.19460586160421373, "num_tokens": 52100690.0, "step": 30035 }, { "entropy": 5.398977279663086, "epoch": 2.3372106594047852, "grad_norm": 1.1953125, "learning_rate": 0.0004448359172842439, "loss": 5.0657, "mean_token_accuracy": 0.19714615792036055, "num_tokens": 52109310.0, "step": 30040 }, { "entropy": 5.484135532379151, "epoch": 2.3375996887765025, "grad_norm": 1.1796875, "learning_rate": 0.00044481773665631355, "loss": 5.0951, "mean_token_accuracy": 0.20113715529441833, "num_tokens": 52118662.0, "step": 30045 }, { "entropy": 5.309747982025146, "epoch": 2.33798871814822, "grad_norm": 1.2890625, "learning_rate": 0.0004447995534516695, "loss": 4.9766, "mean_token_accuracy": 0.2025471344590187, "num_tokens": 52127098.0, "step": 30050 }, { "entropy": 5.3607337951660154, "epoch": 2.338377747519938, "grad_norm": 1.234375, "learning_rate": 0.00044478136767058733, "loss": 5.0899, "mean_token_accuracy": 0.18626188784837722, "num_tokens": 52135539.0, "step": 30055 }, { "entropy": 5.522019386291504, "epoch": 2.338766776891655, "grad_norm": 1.1796875, "learning_rate": 0.0004447631793133432, "loss": 5.0718, "mean_token_accuracy": 0.19150737971067427, "num_tokens": 52144169.0, "step": 30060 }, { "entropy": 5.432363653182984, "epoch": 2.339155806263373, "grad_norm": 1.234375, "learning_rate": 0.0004447449883802131, "loss": 5.0807, "mean_token_accuracy": 0.18884508907794953, "num_tokens": 52152679.0, "step": 30065 }, { "entropy": 5.332374334335327, "epoch": 2.3395448356350905, "grad_norm": 1.2265625, "learning_rate": 0.00044472679487147295, "loss": 5.0168, "mean_token_accuracy": 0.19738177061080933, "num_tokens": 52161407.0, "step": 30070 }, { "entropy": 5.539660453796387, "epoch": 2.339933865006808, "grad_norm": 1.1875, "learning_rate": 0.00044470859878739877, "loss": 5.0821, "mean_token_accuracy": 0.18288897275924682, "num_tokens": 52170285.0, "step": 30075 }, { "entropy": 5.42182879447937, "epoch": 2.3403228943785255, "grad_norm": 1.21875, "learning_rate": 0.00044469040012826676, "loss": 4.9325, "mean_token_accuracy": 0.20403649359941484, "num_tokens": 52178813.0, "step": 30080 }, { "entropy": 5.327577924728393, "epoch": 2.340711923750243, "grad_norm": 1.2578125, "learning_rate": 0.00044467219889435304, "loss": 4.9349, "mean_token_accuracy": 0.19863856881856917, "num_tokens": 52187205.0, "step": 30085 }, { "entropy": 5.393527030944824, "epoch": 2.341100953121961, "grad_norm": 1.140625, "learning_rate": 0.0004446539950859337, "loss": 5.0701, "mean_token_accuracy": 0.18757230639457703, "num_tokens": 52195318.0, "step": 30090 }, { "entropy": 5.340764045715332, "epoch": 2.341489982493678, "grad_norm": 1.21875, "learning_rate": 0.00044463578870328506, "loss": 5.002, "mean_token_accuracy": 0.19450665563344954, "num_tokens": 52204093.0, "step": 30095 }, { "entropy": 5.369998455047607, "epoch": 2.341879011865396, "grad_norm": 1.265625, "learning_rate": 0.0004446175797466834, "loss": 5.0883, "mean_token_accuracy": 0.19455251097679138, "num_tokens": 52212319.0, "step": 30100 }, { "entropy": 5.418159151077271, "epoch": 2.3422680412371135, "grad_norm": 1.1953125, "learning_rate": 0.00044459936821640485, "loss": 5.0361, "mean_token_accuracy": 0.1892719805240631, "num_tokens": 52221878.0, "step": 30105 }, { "entropy": 5.3445008277893065, "epoch": 2.3426570706088308, "grad_norm": 1.125, "learning_rate": 0.0004445811541127258, "loss": 4.9596, "mean_token_accuracy": 0.19711434245109558, "num_tokens": 52230952.0, "step": 30110 }, { "entropy": 5.385547924041748, "epoch": 2.3430460999805485, "grad_norm": 1.1875, "learning_rate": 0.00044456293743592274, "loss": 5.0551, "mean_token_accuracy": 0.19889726340770722, "num_tokens": 52239461.0, "step": 30115 }, { "entropy": 5.421613073348999, "epoch": 2.343435129352266, "grad_norm": 1.1796875, "learning_rate": 0.00044454471818627196, "loss": 5.0408, "mean_token_accuracy": 0.19032577723264693, "num_tokens": 52248478.0, "step": 30120 }, { "entropy": 5.433068895339966, "epoch": 2.343824158723984, "grad_norm": 1.2109375, "learning_rate": 0.00044452649636404995, "loss": 5.0923, "mean_token_accuracy": 0.19105210900306702, "num_tokens": 52256901.0, "step": 30125 }, { "entropy": 5.436404514312744, "epoch": 2.344213188095701, "grad_norm": 1.125, "learning_rate": 0.0004445082719695332, "loss": 5.0501, "mean_token_accuracy": 0.1933584541082382, "num_tokens": 52265249.0, "step": 30130 }, { "entropy": 5.440950012207031, "epoch": 2.344602217467419, "grad_norm": 1.1328125, "learning_rate": 0.00044449004500299815, "loss": 5.0823, "mean_token_accuracy": 0.18953050225973128, "num_tokens": 52274777.0, "step": 30135 }, { "entropy": 5.447582387924195, "epoch": 2.3449912468391365, "grad_norm": 1.1796875, "learning_rate": 0.00044447181546472146, "loss": 5.1117, "mean_token_accuracy": 0.18741219937801362, "num_tokens": 52283392.0, "step": 30140 }, { "entropy": 5.339155817031861, "epoch": 2.3453802762108538, "grad_norm": 1.1640625, "learning_rate": 0.00044445358335497975, "loss": 4.9898, "mean_token_accuracy": 0.19315367192029953, "num_tokens": 52291875.0, "step": 30145 }, { "entropy": 5.363594579696655, "epoch": 2.3457693055825715, "grad_norm": 1.203125, "learning_rate": 0.0004444353486740496, "loss": 5.1246, "mean_token_accuracy": 0.19235342890024185, "num_tokens": 52300194.0, "step": 30150 }, { "entropy": 5.4511157989501955, "epoch": 2.346158334954289, "grad_norm": 1.1484375, "learning_rate": 0.0004444171114222078, "loss": 5.0726, "mean_token_accuracy": 0.19239448457956315, "num_tokens": 52309147.0, "step": 30155 }, { "entropy": 5.513557815551758, "epoch": 2.346547364326007, "grad_norm": 1.171875, "learning_rate": 0.00044439887159973096, "loss": 5.155, "mean_token_accuracy": 0.18252138346433638, "num_tokens": 52317502.0, "step": 30160 }, { "entropy": 5.37524151802063, "epoch": 2.346936393697724, "grad_norm": 1.1953125, "learning_rate": 0.0004443806292068958, "loss": 4.949, "mean_token_accuracy": 0.20163785368204118, "num_tokens": 52325539.0, "step": 30165 }, { "entropy": 5.42692379951477, "epoch": 2.347325423069442, "grad_norm": 1.1953125, "learning_rate": 0.0004443623842439792, "loss": 5.0311, "mean_token_accuracy": 0.1920914828777313, "num_tokens": 52333676.0, "step": 30170 }, { "entropy": 5.413420486450195, "epoch": 2.347714452441159, "grad_norm": 1.1484375, "learning_rate": 0.000444344136711258, "loss": 4.9939, "mean_token_accuracy": 0.20066285282373428, "num_tokens": 52342706.0, "step": 30175 }, { "entropy": 5.377599811553955, "epoch": 2.3481034818128768, "grad_norm": 1.15625, "learning_rate": 0.00044432588660900905, "loss": 5.0697, "mean_token_accuracy": 0.1919751435518265, "num_tokens": 52351409.0, "step": 30180 }, { "entropy": 5.331076145172119, "epoch": 2.3484925111845945, "grad_norm": 1.1640625, "learning_rate": 0.0004443076339375093, "loss": 5.008, "mean_token_accuracy": 0.19617386013269425, "num_tokens": 52359781.0, "step": 30185 }, { "entropy": 5.386291790008545, "epoch": 2.348881540556312, "grad_norm": 1.1484375, "learning_rate": 0.00044428937869703575, "loss": 5.0125, "mean_token_accuracy": 0.19278571754693985, "num_tokens": 52368236.0, "step": 30190 }, { "entropy": 5.419387674331665, "epoch": 2.3492705699280294, "grad_norm": 1.1875, "learning_rate": 0.00044427112088786525, "loss": 5.0603, "mean_token_accuracy": 0.19301276206970214, "num_tokens": 52376449.0, "step": 30195 }, { "entropy": 5.425244474411011, "epoch": 2.349659599299747, "grad_norm": 1.1640625, "learning_rate": 0.0004442528605102749, "loss": 5.0057, "mean_token_accuracy": 0.19385803788900374, "num_tokens": 52384844.0, "step": 30200 }, { "entropy": 5.4809102535247805, "epoch": 2.350048628671465, "grad_norm": 1.2265625, "learning_rate": 0.0004442345975645418, "loss": 5.166, "mean_token_accuracy": 0.1900211215019226, "num_tokens": 52393810.0, "step": 30205 }, { "entropy": 5.473064804077149, "epoch": 2.350437658043182, "grad_norm": 1.2109375, "learning_rate": 0.0004442163320509431, "loss": 5.0292, "mean_token_accuracy": 0.19601163417100906, "num_tokens": 52402081.0, "step": 30210 }, { "entropy": 5.3551130294799805, "epoch": 2.3508266874148998, "grad_norm": 1.421875, "learning_rate": 0.0004441980639697558, "loss": 5.0179, "mean_token_accuracy": 0.19238125234842302, "num_tokens": 52411671.0, "step": 30215 }, { "entropy": 5.331557321548462, "epoch": 2.3512157167866174, "grad_norm": 1.140625, "learning_rate": 0.0004441797933212573, "loss": 5.0608, "mean_token_accuracy": 0.1930033251643181, "num_tokens": 52420255.0, "step": 30220 }, { "entropy": 5.49574728012085, "epoch": 2.351604746158335, "grad_norm": 1.2109375, "learning_rate": 0.0004441615201057247, "loss": 5.2019, "mean_token_accuracy": 0.1814395323395729, "num_tokens": 52429682.0, "step": 30225 }, { "entropy": 5.505518436431885, "epoch": 2.3519937755300524, "grad_norm": 1.2109375, "learning_rate": 0.0004441432443234352, "loss": 5.0533, "mean_token_accuracy": 0.19414226710796356, "num_tokens": 52438719.0, "step": 30230 }, { "entropy": 5.326932907104492, "epoch": 2.35238280490177, "grad_norm": 1.1796875, "learning_rate": 0.00044412496597466626, "loss": 4.948, "mean_token_accuracy": 0.20036731660366058, "num_tokens": 52447543.0, "step": 30235 }, { "entropy": 5.374056482315064, "epoch": 2.352771834273488, "grad_norm": 1.15625, "learning_rate": 0.0004441066850596951, "loss": 4.9984, "mean_token_accuracy": 0.19825717359781264, "num_tokens": 52456606.0, "step": 30240 }, { "entropy": 5.449829244613648, "epoch": 2.353160863645205, "grad_norm": 1.1484375, "learning_rate": 0.0004440884015787992, "loss": 5.0833, "mean_token_accuracy": 0.19108119159936904, "num_tokens": 52465222.0, "step": 30245 }, { "entropy": 5.421074914932251, "epoch": 2.3535498930169227, "grad_norm": 1.1484375, "learning_rate": 0.0004440701155322558, "loss": 5.0942, "mean_token_accuracy": 0.19033259600400926, "num_tokens": 52473955.0, "step": 30250 }, { "entropy": 5.393550205230713, "epoch": 2.3539389223886404, "grad_norm": 1.078125, "learning_rate": 0.0004440518269203427, "loss": 5.1059, "mean_token_accuracy": 0.19346344023942946, "num_tokens": 52483786.0, "step": 30255 }, { "entropy": 5.495344448089599, "epoch": 2.354327951760358, "grad_norm": 1.21875, "learning_rate": 0.00044403353574333715, "loss": 5.0923, "mean_token_accuracy": 0.18991378843784332, "num_tokens": 52492292.0, "step": 30260 }, { "entropy": 5.478783893585205, "epoch": 2.3547169811320754, "grad_norm": 1.25, "learning_rate": 0.00044401524200151667, "loss": 5.0639, "mean_token_accuracy": 0.18241613060235978, "num_tokens": 52501267.0, "step": 30265 }, { "entropy": 5.488956165313721, "epoch": 2.355106010503793, "grad_norm": 1.25, "learning_rate": 0.00044399694569515895, "loss": 5.1135, "mean_token_accuracy": 0.19408838003873824, "num_tokens": 52509515.0, "step": 30270 }, { "entropy": 5.399058723449707, "epoch": 2.355495039875511, "grad_norm": 1.265625, "learning_rate": 0.00044397864682454156, "loss": 5.0789, "mean_token_accuracy": 0.19373828768730164, "num_tokens": 52517757.0, "step": 30275 }, { "entropy": 5.433415031433105, "epoch": 2.355884069247228, "grad_norm": 1.234375, "learning_rate": 0.0004439603453899421, "loss": 5.1406, "mean_token_accuracy": 0.19351146817207338, "num_tokens": 52525996.0, "step": 30280 }, { "entropy": 5.42435507774353, "epoch": 2.3562730986189457, "grad_norm": 1.1953125, "learning_rate": 0.0004439420413916384, "loss": 4.9952, "mean_token_accuracy": 0.2008293554186821, "num_tokens": 52534457.0, "step": 30285 }, { "entropy": 5.44274411201477, "epoch": 2.3566621279906634, "grad_norm": 1.2421875, "learning_rate": 0.00044392373482990817, "loss": 5.1355, "mean_token_accuracy": 0.1857638865709305, "num_tokens": 52543754.0, "step": 30290 }, { "entropy": 5.482491159439087, "epoch": 2.3570511573623807, "grad_norm": 1.1796875, "learning_rate": 0.0004439054257050291, "loss": 5.0827, "mean_token_accuracy": 0.18308962881565094, "num_tokens": 52552857.0, "step": 30295 }, { "entropy": 5.501236200332642, "epoch": 2.3574401867340984, "grad_norm": 1.171875, "learning_rate": 0.0004438871140172789, "loss": 5.1743, "mean_token_accuracy": 0.18104863166809082, "num_tokens": 52562760.0, "step": 30300 }, { "entropy": 5.346593236923217, "epoch": 2.357829216105816, "grad_norm": 1.15625, "learning_rate": 0.0004438687997669357, "loss": 4.9831, "mean_token_accuracy": 0.19781598597764968, "num_tokens": 52571111.0, "step": 30305 }, { "entropy": 5.365532875061035, "epoch": 2.3582182454775333, "grad_norm": 1.1328125, "learning_rate": 0.00044385048295427724, "loss": 4.9684, "mean_token_accuracy": 0.19764413982629775, "num_tokens": 52579541.0, "step": 30310 }, { "entropy": 5.38826355934143, "epoch": 2.358607274849251, "grad_norm": 1.1796875, "learning_rate": 0.0004438321635795814, "loss": 5.0541, "mean_token_accuracy": 0.2004312038421631, "num_tokens": 52588253.0, "step": 30315 }, { "entropy": 5.356149673461914, "epoch": 2.3589963042209687, "grad_norm": 1.1484375, "learning_rate": 0.0004438138416431262, "loss": 5.0171, "mean_token_accuracy": 0.19001378268003463, "num_tokens": 52597922.0, "step": 30320 }, { "entropy": 5.4275548458099365, "epoch": 2.3593853335926864, "grad_norm": 1.1171875, "learning_rate": 0.00044379551714518966, "loss": 4.9358, "mean_token_accuracy": 0.19580564498901368, "num_tokens": 52606167.0, "step": 30325 }, { "entropy": 5.422748756408692, "epoch": 2.3597743629644037, "grad_norm": 1.2578125, "learning_rate": 0.00044377719008604984, "loss": 5.165, "mean_token_accuracy": 0.183042074739933, "num_tokens": 52614534.0, "step": 30330 }, { "entropy": 5.437446403503418, "epoch": 2.3601633923361214, "grad_norm": 1.21875, "learning_rate": 0.0004437588604659848, "loss": 5.0549, "mean_token_accuracy": 0.18915238827466965, "num_tokens": 52623225.0, "step": 30335 }, { "entropy": 5.444179058074951, "epoch": 2.360552421707839, "grad_norm": 1.15625, "learning_rate": 0.0004437405282852726, "loss": 5.0968, "mean_token_accuracy": 0.1912812516093254, "num_tokens": 52632025.0, "step": 30340 }, { "entropy": 5.36928973197937, "epoch": 2.3609414510795563, "grad_norm": 1.1484375, "learning_rate": 0.00044372219354419154, "loss": 4.9113, "mean_token_accuracy": 0.21283333599567414, "num_tokens": 52640731.0, "step": 30345 }, { "entropy": 5.3932994365692135, "epoch": 2.361330480451274, "grad_norm": 1.1640625, "learning_rate": 0.0004437038562430197, "loss": 5.029, "mean_token_accuracy": 0.19691042751073837, "num_tokens": 52648831.0, "step": 30350 }, { "entropy": 5.428686571121216, "epoch": 2.3617195098229917, "grad_norm": 1.15625, "learning_rate": 0.00044368551638203536, "loss": 5.0808, "mean_token_accuracy": 0.1870300754904747, "num_tokens": 52657699.0, "step": 30355 }, { "entropy": 5.355464887619019, "epoch": 2.3621085391947094, "grad_norm": 1.1796875, "learning_rate": 0.0004436671739615168, "loss": 4.9579, "mean_token_accuracy": 0.19669124335050583, "num_tokens": 52666418.0, "step": 30360 }, { "entropy": 5.365160179138184, "epoch": 2.3624975685664267, "grad_norm": 1.1640625, "learning_rate": 0.00044364882898174235, "loss": 5.0406, "mean_token_accuracy": 0.19268265813589097, "num_tokens": 52675014.0, "step": 30365 }, { "entropy": 5.462120914459229, "epoch": 2.3628865979381444, "grad_norm": 1.2578125, "learning_rate": 0.0004436304814429903, "loss": 5.0696, "mean_token_accuracy": 0.18719243556261062, "num_tokens": 52683691.0, "step": 30370 }, { "entropy": 5.47960524559021, "epoch": 2.363275627309862, "grad_norm": 1.2578125, "learning_rate": 0.0004436121313455391, "loss": 5.0045, "mean_token_accuracy": 0.18897877186536788, "num_tokens": 52692317.0, "step": 30375 }, { "entropy": 5.365514755249023, "epoch": 2.3636646566815793, "grad_norm": 1.15625, "learning_rate": 0.0004435937786896673, "loss": 5.0533, "mean_token_accuracy": 0.1879978820681572, "num_tokens": 52701523.0, "step": 30380 }, { "entropy": 5.461100244522095, "epoch": 2.364053686053297, "grad_norm": 1.1484375, "learning_rate": 0.00044357542347565323, "loss": 5.1415, "mean_token_accuracy": 0.18612246662378312, "num_tokens": 52710436.0, "step": 30385 }, { "entropy": 5.454371929168701, "epoch": 2.3644427154250147, "grad_norm": 1.1875, "learning_rate": 0.0004435570657037753, "loss": 5.11, "mean_token_accuracy": 0.19020272493362428, "num_tokens": 52719186.0, "step": 30390 }, { "entropy": 5.396678686141968, "epoch": 2.364831744796732, "grad_norm": 1.171875, "learning_rate": 0.0004435387053743123, "loss": 5.0598, "mean_token_accuracy": 0.19319379776716233, "num_tokens": 52728185.0, "step": 30395 }, { "entropy": 5.43155083656311, "epoch": 2.3652207741684497, "grad_norm": 1.2109375, "learning_rate": 0.00044352034248754265, "loss": 5.124, "mean_token_accuracy": 0.194413959980011, "num_tokens": 52737938.0, "step": 30400 }, { "entropy": 5.400070381164551, "epoch": 2.3656098035401674, "grad_norm": 1.1875, "learning_rate": 0.000443501977043745, "loss": 5.0107, "mean_token_accuracy": 0.1964032232761383, "num_tokens": 52747005.0, "step": 30405 }, { "entropy": 5.348212671279907, "epoch": 2.3659988329118846, "grad_norm": 1.2578125, "learning_rate": 0.0004434836090431981, "loss": 5.003, "mean_token_accuracy": 0.19062833487987518, "num_tokens": 52756251.0, "step": 30410 }, { "entropy": 5.40240888595581, "epoch": 2.3663878622836023, "grad_norm": 1.2109375, "learning_rate": 0.0004434652384861806, "loss": 5.0218, "mean_token_accuracy": 0.19201731234788894, "num_tokens": 52764443.0, "step": 30415 }, { "entropy": 5.355072069168091, "epoch": 2.36677689165532, "grad_norm": 1.203125, "learning_rate": 0.0004434468653729712, "loss": 4.9232, "mean_token_accuracy": 0.2031481072306633, "num_tokens": 52772824.0, "step": 30420 }, { "entropy": 5.373838472366333, "epoch": 2.3671659210270377, "grad_norm": 1.1953125, "learning_rate": 0.00044342848970384876, "loss": 5.0582, "mean_token_accuracy": 0.1894853338599205, "num_tokens": 52782743.0, "step": 30425 }, { "entropy": 5.486165142059326, "epoch": 2.367554950398755, "grad_norm": 1.140625, "learning_rate": 0.00044341011147909206, "loss": 5.2017, "mean_token_accuracy": 0.1820221722126007, "num_tokens": 52791564.0, "step": 30430 }, { "entropy": 5.415500211715698, "epoch": 2.3679439797704727, "grad_norm": 1.1796875, "learning_rate": 0.00044339173069897996, "loss": 4.9991, "mean_token_accuracy": 0.19910618364810945, "num_tokens": 52800229.0, "step": 30435 }, { "entropy": 5.406668567657471, "epoch": 2.3683330091421904, "grad_norm": 1.15625, "learning_rate": 0.00044337334736379143, "loss": 4.9958, "mean_token_accuracy": 0.19860171526670456, "num_tokens": 52808342.0, "step": 30440 }, { "entropy": 5.386832523345947, "epoch": 2.3687220385139076, "grad_norm": 1.1953125, "learning_rate": 0.0004433549614738053, "loss": 5.0748, "mean_token_accuracy": 0.1946864977478981, "num_tokens": 52817462.0, "step": 30445 }, { "entropy": 5.351207065582275, "epoch": 2.3691110678856253, "grad_norm": 1.1171875, "learning_rate": 0.00044333657302930056, "loss": 4.9747, "mean_token_accuracy": 0.1973209038376808, "num_tokens": 52825567.0, "step": 30450 }, { "entropy": 5.400139951705933, "epoch": 2.369500097257343, "grad_norm": 1.140625, "learning_rate": 0.0004433181820305564, "loss": 5.052, "mean_token_accuracy": 0.1825938493013382, "num_tokens": 52835771.0, "step": 30455 }, { "entropy": 5.372045516967773, "epoch": 2.3698891266290607, "grad_norm": 1.171875, "learning_rate": 0.00044329978847785156, "loss": 5.0288, "mean_token_accuracy": 0.19163314253091812, "num_tokens": 52844344.0, "step": 30460 }, { "entropy": 5.451956558227539, "epoch": 2.370278156000778, "grad_norm": 1.1171875, "learning_rate": 0.0004432813923714654, "loss": 5.0553, "mean_token_accuracy": 0.19553797096014022, "num_tokens": 52852918.0, "step": 30465 }, { "entropy": 5.393067455291748, "epoch": 2.3706671853724957, "grad_norm": 1.171875, "learning_rate": 0.00044326299371167695, "loss": 5.092, "mean_token_accuracy": 0.19259517192840575, "num_tokens": 52862142.0, "step": 30470 }, { "entropy": 5.427189826965332, "epoch": 2.3710562147442134, "grad_norm": 1.171875, "learning_rate": 0.00044324459249876536, "loss": 5.0915, "mean_token_accuracy": 0.18962078988552095, "num_tokens": 52870595.0, "step": 30475 }, { "entropy": 5.512401580810547, "epoch": 2.3714452441159306, "grad_norm": 1.296875, "learning_rate": 0.0004432261887330099, "loss": 5.173, "mean_token_accuracy": 0.1887656942009926, "num_tokens": 52879995.0, "step": 30480 }, { "entropy": 5.402894783020019, "epoch": 2.3718342734876483, "grad_norm": 1.1796875, "learning_rate": 0.0004432077824146898, "loss": 4.9765, "mean_token_accuracy": 0.20357853025197983, "num_tokens": 52888341.0, "step": 30485 }, { "entropy": 5.345517349243164, "epoch": 2.372223302859366, "grad_norm": 1.1953125, "learning_rate": 0.0004431893735440843, "loss": 4.9294, "mean_token_accuracy": 0.20372711420059203, "num_tokens": 52896617.0, "step": 30490 }, { "entropy": 5.350107288360595, "epoch": 2.3726123322310833, "grad_norm": 1.1171875, "learning_rate": 0.0004431709621214727, "loss": 4.9685, "mean_token_accuracy": 0.19610204100608825, "num_tokens": 52905071.0, "step": 30495 }, { "entropy": 5.3858555316925045, "epoch": 2.373001361602801, "grad_norm": 1.25, "learning_rate": 0.00044315254814713455, "loss": 4.9835, "mean_token_accuracy": 0.19958054572343825, "num_tokens": 52913756.0, "step": 30500 }, { "entropy": 5.374010181427002, "epoch": 2.3733903909745186, "grad_norm": 1.2578125, "learning_rate": 0.00044313413162134894, "loss": 4.9766, "mean_token_accuracy": 0.20740654766559602, "num_tokens": 52922895.0, "step": 30505 }, { "entropy": 5.422125720977784, "epoch": 2.373779420346236, "grad_norm": 1.25, "learning_rate": 0.0004431157125443958, "loss": 5.1075, "mean_token_accuracy": 0.18850268870592118, "num_tokens": 52931467.0, "step": 30510 }, { "entropy": 5.4414475440979, "epoch": 2.3741684497179536, "grad_norm": 1.0859375, "learning_rate": 0.000443097290916554, "loss": 5.1719, "mean_token_accuracy": 0.18432148844003676, "num_tokens": 52941122.0, "step": 30515 }, { "entropy": 5.4889003276824955, "epoch": 2.3745574790896713, "grad_norm": 1.15625, "learning_rate": 0.0004430788667381035, "loss": 5.1226, "mean_token_accuracy": 0.18984979689121245, "num_tokens": 52949881.0, "step": 30520 }, { "entropy": 5.379704141616822, "epoch": 2.374946508461389, "grad_norm": 1.1328125, "learning_rate": 0.00044306044000932374, "loss": 4.957, "mean_token_accuracy": 0.19538653790950775, "num_tokens": 52957836.0, "step": 30525 }, { "entropy": 5.384369039535523, "epoch": 2.3753355378331062, "grad_norm": 1.1953125, "learning_rate": 0.0004430420107304943, "loss": 5.0102, "mean_token_accuracy": 0.19991744607686995, "num_tokens": 52965948.0, "step": 30530 }, { "entropy": 5.417372131347657, "epoch": 2.375724567204824, "grad_norm": 1.1484375, "learning_rate": 0.00044302357890189475, "loss": 5.0166, "mean_token_accuracy": 0.19412731975317002, "num_tokens": 52974561.0, "step": 30535 }, { "entropy": 5.355967426300049, "epoch": 2.3761135965765416, "grad_norm": 1.109375, "learning_rate": 0.0004430051445238049, "loss": 4.9443, "mean_token_accuracy": 0.20216686129570008, "num_tokens": 52982918.0, "step": 30540 }, { "entropy": 5.4079913139343265, "epoch": 2.376502625948259, "grad_norm": 1.203125, "learning_rate": 0.00044298670759650426, "loss": 5.1231, "mean_token_accuracy": 0.18710657209157944, "num_tokens": 52992119.0, "step": 30545 }, { "entropy": 5.35042142868042, "epoch": 2.3768916553199766, "grad_norm": 1.109375, "learning_rate": 0.0004429682681202728, "loss": 4.9246, "mean_token_accuracy": 0.199246609210968, "num_tokens": 53000427.0, "step": 30550 }, { "entropy": 5.412006473541259, "epoch": 2.3772806846916943, "grad_norm": 1.125, "learning_rate": 0.00044294982609539027, "loss": 5.1053, "mean_token_accuracy": 0.1859336107969284, "num_tokens": 53009615.0, "step": 30555 }, { "entropy": 5.4395664691925045, "epoch": 2.377669714063412, "grad_norm": 1.171875, "learning_rate": 0.0004429313815221363, "loss": 5.0137, "mean_token_accuracy": 0.1973179742693901, "num_tokens": 53018357.0, "step": 30560 }, { "entropy": 5.375616121292114, "epoch": 2.3780587434351292, "grad_norm": 1.1953125, "learning_rate": 0.00044291293440079107, "loss": 5.0312, "mean_token_accuracy": 0.19325622618198396, "num_tokens": 53027209.0, "step": 30565 }, { "entropy": 5.340203332901001, "epoch": 2.378447772806847, "grad_norm": 1.140625, "learning_rate": 0.0004428944847316342, "loss": 4.9967, "mean_token_accuracy": 0.19173188805580138, "num_tokens": 53035621.0, "step": 30570 }, { "entropy": 5.461109685897827, "epoch": 2.3788368021785646, "grad_norm": 1.15625, "learning_rate": 0.0004428760325149458, "loss": 5.0571, "mean_token_accuracy": 0.19204505383968354, "num_tokens": 53044249.0, "step": 30575 }, { "entropy": 5.417042350769043, "epoch": 2.379225831550282, "grad_norm": 1.2734375, "learning_rate": 0.00044285757775100584, "loss": 5.0801, "mean_token_accuracy": 0.19229482859373093, "num_tokens": 53052977.0, "step": 30580 }, { "entropy": 5.394508981704712, "epoch": 2.3796148609219996, "grad_norm": 1.1953125, "learning_rate": 0.00044283912044009436, "loss": 5.0696, "mean_token_accuracy": 0.19335583001375198, "num_tokens": 53061071.0, "step": 30585 }, { "entropy": 5.487398386001587, "epoch": 2.3800038902937173, "grad_norm": 1.125, "learning_rate": 0.00044282066058249123, "loss": 5.0991, "mean_token_accuracy": 0.19450257420539857, "num_tokens": 53069237.0, "step": 30590 }, { "entropy": 5.483643817901611, "epoch": 2.380392919665435, "grad_norm": 1.15625, "learning_rate": 0.0004428021981784768, "loss": 5.0971, "mean_token_accuracy": 0.1901790052652359, "num_tokens": 53077991.0, "step": 30595 }, { "entropy": 5.363138484954834, "epoch": 2.3807819490371522, "grad_norm": 1.171875, "learning_rate": 0.00044278373322833106, "loss": 5.0033, "mean_token_accuracy": 0.19513794034719467, "num_tokens": 53086263.0, "step": 30600 }, { "entropy": 5.407528114318848, "epoch": 2.38117097840887, "grad_norm": 1.203125, "learning_rate": 0.00044276526573233416, "loss": 5.0524, "mean_token_accuracy": 0.19346240013837815, "num_tokens": 53095048.0, "step": 30605 }, { "entropy": 5.507652950286865, "epoch": 2.381560007780587, "grad_norm": 1.1640625, "learning_rate": 0.0004427467956907664, "loss": 5.1044, "mean_token_accuracy": 0.1922258749604225, "num_tokens": 53103199.0, "step": 30610 }, { "entropy": 5.484123182296753, "epoch": 2.381949037152305, "grad_norm": 1.171875, "learning_rate": 0.00044272832310390814, "loss": 5.1039, "mean_token_accuracy": 0.19115294963121415, "num_tokens": 53111677.0, "step": 30615 }, { "entropy": 5.40900297164917, "epoch": 2.3823380665240226, "grad_norm": 1.1875, "learning_rate": 0.0004427098479720394, "loss": 5.0273, "mean_token_accuracy": 0.19584785401821136, "num_tokens": 53120136.0, "step": 30620 }, { "entropy": 5.420268964767456, "epoch": 2.3827270958957403, "grad_norm": 1.3046875, "learning_rate": 0.00044269137029544073, "loss": 5.0468, "mean_token_accuracy": 0.19238786399364471, "num_tokens": 53128847.0, "step": 30625 }, { "entropy": 5.484248256683349, "epoch": 2.3831161252674575, "grad_norm": 1.15625, "learning_rate": 0.0004426728900743924, "loss": 5.1276, "mean_token_accuracy": 0.18973336070775987, "num_tokens": 53137307.0, "step": 30630 }, { "entropy": 5.4402038097381595, "epoch": 2.3835051546391752, "grad_norm": 1.2109375, "learning_rate": 0.00044265440730917484, "loss": 5.002, "mean_token_accuracy": 0.19154655933380127, "num_tokens": 53145854.0, "step": 30635 }, { "entropy": 5.372362041473389, "epoch": 2.383894184010893, "grad_norm": 1.0625, "learning_rate": 0.00044263592200006845, "loss": 5.0836, "mean_token_accuracy": 0.18762978613376619, "num_tokens": 53154779.0, "step": 30640 }, { "entropy": 5.410637855529785, "epoch": 2.38428321338261, "grad_norm": 1.09375, "learning_rate": 0.00044261743414735383, "loss": 5.0344, "mean_token_accuracy": 0.18690712600946427, "num_tokens": 53163344.0, "step": 30645 }, { "entropy": 5.376573371887207, "epoch": 2.384672242754328, "grad_norm": 1.1171875, "learning_rate": 0.0004425989437513114, "loss": 4.9408, "mean_token_accuracy": 0.18951437175273894, "num_tokens": 53171989.0, "step": 30650 }, { "entropy": 5.426846027374268, "epoch": 2.3850612721260456, "grad_norm": 1.2890625, "learning_rate": 0.0004425804508122218, "loss": 5.0714, "mean_token_accuracy": 0.19352902472019196, "num_tokens": 53180612.0, "step": 30655 }, { "entropy": 5.413616085052491, "epoch": 2.3854503014977633, "grad_norm": 1.171875, "learning_rate": 0.00044256195533036566, "loss": 4.9875, "mean_token_accuracy": 0.19385881274938582, "num_tokens": 53188741.0, "step": 30660 }, { "entropy": 5.3680384159088135, "epoch": 2.3858393308694805, "grad_norm": 1.3125, "learning_rate": 0.00044254345730602345, "loss": 5.0034, "mean_token_accuracy": 0.19878605604171753, "num_tokens": 53196857.0, "step": 30665 }, { "entropy": 5.3369770526885985, "epoch": 2.386228360241198, "grad_norm": 1.140625, "learning_rate": 0.0004425249567394759, "loss": 5.065, "mean_token_accuracy": 0.19140659272670746, "num_tokens": 53205264.0, "step": 30670 }, { "entropy": 5.4433478832244875, "epoch": 2.386617389612916, "grad_norm": 1.140625, "learning_rate": 0.00044250645363100386, "loss": 5.0061, "mean_token_accuracy": 0.2015659123659134, "num_tokens": 53213459.0, "step": 30675 }, { "entropy": 5.465548086166382, "epoch": 2.387006418984633, "grad_norm": 1.171875, "learning_rate": 0.00044248794798088805, "loss": 5.0896, "mean_token_accuracy": 0.19106371253728865, "num_tokens": 53221740.0, "step": 30680 }, { "entropy": 5.415329313278198, "epoch": 2.387395448356351, "grad_norm": 1.171875, "learning_rate": 0.0004424694397894091, "loss": 5.0786, "mean_token_accuracy": 0.19390833377838135, "num_tokens": 53230177.0, "step": 30685 }, { "entropy": 5.437094020843506, "epoch": 2.3877844777280686, "grad_norm": 1.265625, "learning_rate": 0.00044245092905684794, "loss": 4.9969, "mean_token_accuracy": 0.19128857403993607, "num_tokens": 53238238.0, "step": 30690 }, { "entropy": 5.420016288757324, "epoch": 2.3881735070997863, "grad_norm": 1.1640625, "learning_rate": 0.00044243241578348553, "loss": 5.0408, "mean_token_accuracy": 0.19420124292373658, "num_tokens": 53246519.0, "step": 30695 }, { "entropy": 5.418330192565918, "epoch": 2.3885625364715035, "grad_norm": 1.125, "learning_rate": 0.0004424138999696027, "loss": 5.1041, "mean_token_accuracy": 0.18944531232118605, "num_tokens": 53255522.0, "step": 30700 }, { "entropy": 5.330473470687866, "epoch": 2.388951565843221, "grad_norm": 1.1953125, "learning_rate": 0.0004423953816154804, "loss": 4.9813, "mean_token_accuracy": 0.20078271329402925, "num_tokens": 53264414.0, "step": 30705 }, { "entropy": 5.405040550231933, "epoch": 2.389340595214939, "grad_norm": 1.2421875, "learning_rate": 0.00044237686072139967, "loss": 5.0681, "mean_token_accuracy": 0.19158532321453095, "num_tokens": 53273403.0, "step": 30710 }, { "entropy": 5.4649817943573, "epoch": 2.389729624586656, "grad_norm": 1.2265625, "learning_rate": 0.0004423583372876414, "loss": 5.0959, "mean_token_accuracy": 0.19103813022375107, "num_tokens": 53282361.0, "step": 30715 }, { "entropy": 5.403137731552124, "epoch": 2.390118653958374, "grad_norm": 1.1953125, "learning_rate": 0.00044233981131448677, "loss": 5.0083, "mean_token_accuracy": 0.19460959434509278, "num_tokens": 53290890.0, "step": 30720 }, { "entropy": 5.301274585723877, "epoch": 2.3905076833300916, "grad_norm": 1.234375, "learning_rate": 0.00044232128280221683, "loss": 4.9549, "mean_token_accuracy": 0.19965063333511351, "num_tokens": 53299781.0, "step": 30725 }, { "entropy": 5.3833301067352295, "epoch": 2.390896712701809, "grad_norm": 1.1953125, "learning_rate": 0.0004423027517511128, "loss": 5.062, "mean_token_accuracy": 0.19672009944915772, "num_tokens": 53308568.0, "step": 30730 }, { "entropy": 5.537405967712402, "epoch": 2.3912857420735265, "grad_norm": 1.1484375, "learning_rate": 0.00044228421816145573, "loss": 5.1174, "mean_token_accuracy": 0.19058251976966858, "num_tokens": 53317310.0, "step": 30735 }, { "entropy": 5.423778963088989, "epoch": 2.391674771445244, "grad_norm": 1.2734375, "learning_rate": 0.00044226568203352694, "loss": 5.0098, "mean_token_accuracy": 0.19284526109695435, "num_tokens": 53326022.0, "step": 30740 }, { "entropy": 5.411894702911377, "epoch": 2.3920638008169615, "grad_norm": 1.1796875, "learning_rate": 0.00044224714336760766, "loss": 5.0478, "mean_token_accuracy": 0.19370235055685042, "num_tokens": 53334090.0, "step": 30745 }, { "entropy": 5.418841600418091, "epoch": 2.392452830188679, "grad_norm": 1.1640625, "learning_rate": 0.0004422286021639792, "loss": 4.9766, "mean_token_accuracy": 0.18813541829586028, "num_tokens": 53342682.0, "step": 30750 }, { "entropy": 5.482299757003784, "epoch": 2.392841859560397, "grad_norm": 1.203125, "learning_rate": 0.0004422100584229228, "loss": 5.1009, "mean_token_accuracy": 0.18999819457530975, "num_tokens": 53350652.0, "step": 30755 }, { "entropy": 5.387788534164429, "epoch": 2.3932308889321146, "grad_norm": 1.1953125, "learning_rate": 0.00044219151214472, "loss": 5.0179, "mean_token_accuracy": 0.19769892394542693, "num_tokens": 53359339.0, "step": 30760 }, { "entropy": 5.415327692031861, "epoch": 2.393619918303832, "grad_norm": 1.21875, "learning_rate": 0.0004421729633296521, "loss": 5.0412, "mean_token_accuracy": 0.19402508735656737, "num_tokens": 53367617.0, "step": 30765 }, { "entropy": 5.470396089553833, "epoch": 2.3940089476755495, "grad_norm": 1.125, "learning_rate": 0.00044215441197800054, "loss": 5.1768, "mean_token_accuracy": 0.1790403351187706, "num_tokens": 53376725.0, "step": 30770 }, { "entropy": 5.437073707580566, "epoch": 2.394397977047267, "grad_norm": 1.203125, "learning_rate": 0.00044213585809004685, "loss": 5.0664, "mean_token_accuracy": 0.19609026312828065, "num_tokens": 53384670.0, "step": 30775 }, { "entropy": 5.375916242599487, "epoch": 2.3947870064189845, "grad_norm": 1.1015625, "learning_rate": 0.0004421173016660725, "loss": 5.0124, "mean_token_accuracy": 0.197798390686512, "num_tokens": 53392944.0, "step": 30780 }, { "entropy": 5.433443593978882, "epoch": 2.395176035790702, "grad_norm": 1.203125, "learning_rate": 0.0004420987427063592, "loss": 5.0988, "mean_token_accuracy": 0.18637786507606507, "num_tokens": 53401301.0, "step": 30785 }, { "entropy": 5.486806440353393, "epoch": 2.39556506516242, "grad_norm": 1.171875, "learning_rate": 0.00044208018121118833, "loss": 5.1098, "mean_token_accuracy": 0.18687624782323836, "num_tokens": 53409490.0, "step": 30790 }, { "entropy": 5.480011415481568, "epoch": 2.3959540945341375, "grad_norm": 1.21875, "learning_rate": 0.00044206161718084164, "loss": 5.1706, "mean_token_accuracy": 0.1847678914666176, "num_tokens": 53418595.0, "step": 30795 }, { "entropy": 5.3955549716949465, "epoch": 2.396343123905855, "grad_norm": 1.1953125, "learning_rate": 0.0004420430506156009, "loss": 5.0112, "mean_token_accuracy": 0.19414662718772888, "num_tokens": 53427217.0, "step": 30800 }, { "entropy": 5.38054347038269, "epoch": 2.3967321532775725, "grad_norm": 1.359375, "learning_rate": 0.00044202448151574764, "loss": 4.9818, "mean_token_accuracy": 0.20417545586824418, "num_tokens": 53435875.0, "step": 30805 }, { "entropy": 5.4141130447387695, "epoch": 2.39712118264929, "grad_norm": 1.1328125, "learning_rate": 0.0004420059098815638, "loss": 5.0706, "mean_token_accuracy": 0.19665136337280273, "num_tokens": 53445466.0, "step": 30810 }, { "entropy": 5.336964464187622, "epoch": 2.3975102120210074, "grad_norm": 1.25, "learning_rate": 0.0004419873357133311, "loss": 4.973, "mean_token_accuracy": 0.19582356959581376, "num_tokens": 53453813.0, "step": 30815 }, { "entropy": 5.41704626083374, "epoch": 2.397899241392725, "grad_norm": 1.1484375, "learning_rate": 0.0004419687590113313, "loss": 5.0577, "mean_token_accuracy": 0.19585483968257905, "num_tokens": 53462819.0, "step": 30820 }, { "entropy": 5.471425914764405, "epoch": 2.398288270764443, "grad_norm": 1.1484375, "learning_rate": 0.00044195017977584637, "loss": 5.0561, "mean_token_accuracy": 0.19361427128314973, "num_tokens": 53471297.0, "step": 30825 }, { "entropy": 5.479360055923462, "epoch": 2.39867730013616, "grad_norm": 1.203125, "learning_rate": 0.00044193159800715823, "loss": 5.0579, "mean_token_accuracy": 0.19361462891101838, "num_tokens": 53479473.0, "step": 30830 }, { "entropy": 5.395021772384643, "epoch": 2.399066329507878, "grad_norm": 1.171875, "learning_rate": 0.00044191301370554874, "loss": 5.0859, "mean_token_accuracy": 0.19065673649311066, "num_tokens": 53488542.0, "step": 30835 }, { "entropy": 5.425838613510132, "epoch": 2.3994553588795955, "grad_norm": 1.1328125, "learning_rate": 0.00044189442687129994, "loss": 4.9874, "mean_token_accuracy": 0.19537625163793565, "num_tokens": 53497586.0, "step": 30840 }, { "entropy": 5.48591046333313, "epoch": 2.3998443882513127, "grad_norm": 1.203125, "learning_rate": 0.0004418758375046939, "loss": 5.0601, "mean_token_accuracy": 0.19503633081912994, "num_tokens": 53506368.0, "step": 30845 }, { "entropy": 5.39187068939209, "epoch": 2.4002334176230304, "grad_norm": 1.1328125, "learning_rate": 0.00044185724560601267, "loss": 5.0372, "mean_token_accuracy": 0.19493753761053084, "num_tokens": 53515735.0, "step": 30850 }, { "entropy": 5.452441883087158, "epoch": 2.400622446994748, "grad_norm": 1.140625, "learning_rate": 0.0004418386511755382, "loss": 5.1159, "mean_token_accuracy": 0.1864190176129341, "num_tokens": 53523780.0, "step": 30855 }, { "entropy": 5.459221076965332, "epoch": 2.401011476366466, "grad_norm": 1.2109375, "learning_rate": 0.0004418200542135528, "loss": 5.0114, "mean_token_accuracy": 0.19394990503787995, "num_tokens": 53532633.0, "step": 30860 }, { "entropy": 5.461785221099854, "epoch": 2.401400505738183, "grad_norm": 1.203125, "learning_rate": 0.0004418014547203386, "loss": 5.1406, "mean_token_accuracy": 0.1962772786617279, "num_tokens": 53540767.0, "step": 30865 }, { "entropy": 5.39872031211853, "epoch": 2.401789535109901, "grad_norm": 1.1875, "learning_rate": 0.0004417828526961778, "loss": 5.1148, "mean_token_accuracy": 0.1927902951836586, "num_tokens": 53548925.0, "step": 30870 }, { "entropy": 5.331558084487915, "epoch": 2.4021785644816185, "grad_norm": 1.140625, "learning_rate": 0.00044176424814135266, "loss": 4.8922, "mean_token_accuracy": 0.20545164942741395, "num_tokens": 53557086.0, "step": 30875 }, { "entropy": 5.447721147537232, "epoch": 2.4025675938533357, "grad_norm": 1.25, "learning_rate": 0.0004417456410561455, "loss": 5.134, "mean_token_accuracy": 0.1820867344737053, "num_tokens": 53565898.0, "step": 30880 }, { "entropy": 5.418444347381592, "epoch": 2.4029566232250534, "grad_norm": 1.1796875, "learning_rate": 0.0004417270314408387, "loss": 5.0977, "mean_token_accuracy": 0.18474151641130448, "num_tokens": 53574695.0, "step": 30885 }, { "entropy": 5.502459907531739, "epoch": 2.403345652596771, "grad_norm": 1.1640625, "learning_rate": 0.00044170841929571454, "loss": 5.1025, "mean_token_accuracy": 0.18591193556785585, "num_tokens": 53583854.0, "step": 30890 }, { "entropy": 5.423509359359741, "epoch": 2.403734681968489, "grad_norm": 1.1484375, "learning_rate": 0.00044168980462105543, "loss": 5.0553, "mean_token_accuracy": 0.2013448491692543, "num_tokens": 53593008.0, "step": 30895 }, { "entropy": 5.45743317604065, "epoch": 2.404123711340206, "grad_norm": 1.1796875, "learning_rate": 0.0004416711874171439, "loss": 4.9919, "mean_token_accuracy": 0.19569877535104752, "num_tokens": 53601548.0, "step": 30900 }, { "entropy": 5.43909797668457, "epoch": 2.404512740711924, "grad_norm": 1.2734375, "learning_rate": 0.0004416525676842624, "loss": 5.1664, "mean_token_accuracy": 0.18866202086210251, "num_tokens": 53609807.0, "step": 30905 }, { "entropy": 5.365352392196655, "epoch": 2.4049017700836415, "grad_norm": 1.203125, "learning_rate": 0.0004416339454226933, "loss": 4.9539, "mean_token_accuracy": 0.20582334101200103, "num_tokens": 53618879.0, "step": 30910 }, { "entropy": 5.399794960021973, "epoch": 2.4052907994553587, "grad_norm": 1.140625, "learning_rate": 0.0004416153206327194, "loss": 4.9783, "mean_token_accuracy": 0.199844391644001, "num_tokens": 53627318.0, "step": 30915 }, { "entropy": 5.331952476501465, "epoch": 2.4056798288270764, "grad_norm": 1.15625, "learning_rate": 0.00044159669331462326, "loss": 5.0261, "mean_token_accuracy": 0.1918699711561203, "num_tokens": 53635872.0, "step": 30920 }, { "entropy": 5.408002233505249, "epoch": 2.406068858198794, "grad_norm": 1.171875, "learning_rate": 0.00044157806346868737, "loss": 5.0255, "mean_token_accuracy": 0.19299423396587373, "num_tokens": 53644434.0, "step": 30925 }, { "entropy": 5.393380165100098, "epoch": 2.406457887570512, "grad_norm": 1.1796875, "learning_rate": 0.00044155943109519454, "loss": 4.9929, "mean_token_accuracy": 0.19712525457143784, "num_tokens": 53652721.0, "step": 30930 }, { "entropy": 5.431900405883789, "epoch": 2.406846916942229, "grad_norm": 1.1640625, "learning_rate": 0.0004415407961944274, "loss": 5.0474, "mean_token_accuracy": 0.1922902509570122, "num_tokens": 53660831.0, "step": 30935 }, { "entropy": 5.479037046432495, "epoch": 2.4072359463139468, "grad_norm": 1.2109375, "learning_rate": 0.00044152215876666883, "loss": 5.0326, "mean_token_accuracy": 0.19873662292957306, "num_tokens": 53669335.0, "step": 30940 }, { "entropy": 5.413552904129029, "epoch": 2.407624975685664, "grad_norm": 1.1640625, "learning_rate": 0.0004415035188122016, "loss": 5.0521, "mean_token_accuracy": 0.19206199944019317, "num_tokens": 53678004.0, "step": 30945 }, { "entropy": 5.385868310928345, "epoch": 2.4080140050573817, "grad_norm": 1.046875, "learning_rate": 0.00044148487633130837, "loss": 5.0444, "mean_token_accuracy": 0.1947902575135231, "num_tokens": 53687300.0, "step": 30950 }, { "entropy": 5.350548505783081, "epoch": 2.4084030344290994, "grad_norm": 1.171875, "learning_rate": 0.00044146623132427213, "loss": 4.9444, "mean_token_accuracy": 0.1985419809818268, "num_tokens": 53695692.0, "step": 30955 }, { "entropy": 5.410242080688477, "epoch": 2.408792063800817, "grad_norm": 1.171875, "learning_rate": 0.00044144758379137584, "loss": 5.1015, "mean_token_accuracy": 0.18972747921943664, "num_tokens": 53704164.0, "step": 30960 }, { "entropy": 5.33400182723999, "epoch": 2.4091810931725344, "grad_norm": 1.2734375, "learning_rate": 0.00044142893373290236, "loss": 4.9767, "mean_token_accuracy": 0.19933097213506698, "num_tokens": 53712681.0, "step": 30965 }, { "entropy": 5.415587520599365, "epoch": 2.409570122544252, "grad_norm": 1.1484375, "learning_rate": 0.0004414102811491348, "loss": 4.9494, "mean_token_accuracy": 0.19964448511600494, "num_tokens": 53721208.0, "step": 30970 }, { "entropy": 5.393646669387818, "epoch": 2.4099591519159698, "grad_norm": 1.1640625, "learning_rate": 0.00044139162604035597, "loss": 5.0596, "mean_token_accuracy": 0.18882953226566315, "num_tokens": 53729590.0, "step": 30975 }, { "entropy": 5.404494142532348, "epoch": 2.410348181287687, "grad_norm": 1.1953125, "learning_rate": 0.00044137296840684917, "loss": 5.0684, "mean_token_accuracy": 0.1813428670167923, "num_tokens": 53737886.0, "step": 30980 }, { "entropy": 5.4490374565124515, "epoch": 2.4107372106594047, "grad_norm": 1.1484375, "learning_rate": 0.0004413543082488973, "loss": 5.0801, "mean_token_accuracy": 0.19190299808979033, "num_tokens": 53746397.0, "step": 30985 }, { "entropy": 5.407914352416992, "epoch": 2.4111262400311224, "grad_norm": 1.1328125, "learning_rate": 0.0004413356455667836, "loss": 5.0263, "mean_token_accuracy": 0.18529820442199707, "num_tokens": 53755319.0, "step": 30990 }, { "entropy": 5.3294103145599365, "epoch": 2.41151526940284, "grad_norm": 1.15625, "learning_rate": 0.0004413169803607913, "loss": 5.0178, "mean_token_accuracy": 0.19203171730041504, "num_tokens": 53763655.0, "step": 30995 }, { "entropy": 5.440981721878051, "epoch": 2.4119042987745574, "grad_norm": 1.1171875, "learning_rate": 0.00044129831263120344, "loss": 5.0385, "mean_token_accuracy": 0.19603734761476516, "num_tokens": 53772922.0, "step": 31000 }, { "entropy": 5.455390310287475, "epoch": 2.412293328146275, "grad_norm": 1.2421875, "learning_rate": 0.0004412796423783034, "loss": 4.9974, "mean_token_accuracy": 0.19312087893486024, "num_tokens": 53781328.0, "step": 31005 }, { "entropy": 5.365654134750367, "epoch": 2.4126823575179928, "grad_norm": 1.1015625, "learning_rate": 0.0004412609696023745, "loss": 5.0183, "mean_token_accuracy": 0.1916339784860611, "num_tokens": 53791025.0, "step": 31010 }, { "entropy": 5.4606303691864015, "epoch": 2.41307138688971, "grad_norm": 1.1953125, "learning_rate": 0.0004412422943037, "loss": 5.0595, "mean_token_accuracy": 0.19348575174808502, "num_tokens": 53799423.0, "step": 31015 }, { "entropy": 5.420235633850098, "epoch": 2.4134604162614277, "grad_norm": 1.1796875, "learning_rate": 0.00044122361648256327, "loss": 5.0899, "mean_token_accuracy": 0.19369147568941117, "num_tokens": 53808001.0, "step": 31020 }, { "entropy": 5.44484429359436, "epoch": 2.4138494456331454, "grad_norm": 1.09375, "learning_rate": 0.00044120493613924766, "loss": 4.9865, "mean_token_accuracy": 0.19721100777387618, "num_tokens": 53816354.0, "step": 31025 }, { "entropy": 5.395365953445435, "epoch": 2.414238475004863, "grad_norm": 1.109375, "learning_rate": 0.00044118625327403677, "loss": 4.9633, "mean_token_accuracy": 0.20180853456258774, "num_tokens": 53825430.0, "step": 31030 }, { "entropy": 5.414460039138794, "epoch": 2.4146275043765804, "grad_norm": 1.1484375, "learning_rate": 0.000441167567887214, "loss": 5.0664, "mean_token_accuracy": 0.19544458240270615, "num_tokens": 53833420.0, "step": 31035 }, { "entropy": 5.4033591747283936, "epoch": 2.415016533748298, "grad_norm": 1.1953125, "learning_rate": 0.0004411488799790629, "loss": 5.1128, "mean_token_accuracy": 0.1854367136955261, "num_tokens": 53841771.0, "step": 31040 }, { "entropy": 5.460783958435059, "epoch": 2.4154055631200158, "grad_norm": 1.1328125, "learning_rate": 0.00044113018954986693, "loss": 5.0424, "mean_token_accuracy": 0.19895725697278976, "num_tokens": 53850485.0, "step": 31045 }, { "entropy": 5.512038135528565, "epoch": 2.415794592491733, "grad_norm": 1.2109375, "learning_rate": 0.0004411114965999098, "loss": 5.1423, "mean_token_accuracy": 0.18421804010868073, "num_tokens": 53859491.0, "step": 31050 }, { "entropy": 5.382263231277466, "epoch": 2.4161836218634507, "grad_norm": 1.171875, "learning_rate": 0.000441092801129475, "loss": 5.0107, "mean_token_accuracy": 0.20050285756587982, "num_tokens": 53868838.0, "step": 31055 }, { "entropy": 5.523654747009277, "epoch": 2.4165726512351684, "grad_norm": 1.2421875, "learning_rate": 0.00044107410313884643, "loss": 5.1306, "mean_token_accuracy": 0.19027836620807648, "num_tokens": 53877689.0, "step": 31060 }, { "entropy": 5.306901597976685, "epoch": 2.4169616806068857, "grad_norm": 1.1640625, "learning_rate": 0.00044105540262830763, "loss": 4.8741, "mean_token_accuracy": 0.210520701110363, "num_tokens": 53885769.0, "step": 31065 }, { "entropy": 5.269044303894043, "epoch": 2.4173507099786034, "grad_norm": 1.21875, "learning_rate": 0.0004410366995981424, "loss": 4.9425, "mean_token_accuracy": 0.19725072383880615, "num_tokens": 53894745.0, "step": 31070 }, { "entropy": 5.364822196960449, "epoch": 2.417739739350321, "grad_norm": 1.203125, "learning_rate": 0.00044101799404863457, "loss": 5.0501, "mean_token_accuracy": 0.19158648550510407, "num_tokens": 53903888.0, "step": 31075 }, { "entropy": 5.444873476028443, "epoch": 2.4181287687220383, "grad_norm": 1.1640625, "learning_rate": 0.0004409992859800679, "loss": 5.0349, "mean_token_accuracy": 0.19962391406297683, "num_tokens": 53912422.0, "step": 31080 }, { "entropy": 5.381535959243775, "epoch": 2.418517798093756, "grad_norm": 1.0703125, "learning_rate": 0.0004409805753927263, "loss": 5.0283, "mean_token_accuracy": 0.19223244488239288, "num_tokens": 53921181.0, "step": 31085 }, { "entropy": 5.463592052459717, "epoch": 2.4189068274654737, "grad_norm": 1.1640625, "learning_rate": 0.0004409618622868936, "loss": 5.1405, "mean_token_accuracy": 0.19051187485456467, "num_tokens": 53929777.0, "step": 31090 }, { "entropy": 5.473381805419922, "epoch": 2.4192958568371914, "grad_norm": 1.140625, "learning_rate": 0.00044094314666285385, "loss": 5.0503, "mean_token_accuracy": 0.1818574607372284, "num_tokens": 53938678.0, "step": 31095 }, { "entropy": 5.412472772598266, "epoch": 2.4196848862089086, "grad_norm": 1.2734375, "learning_rate": 0.00044092442852089095, "loss": 4.9883, "mean_token_accuracy": 0.19464339315891266, "num_tokens": 53946158.0, "step": 31100 }, { "entropy": 5.381982946395874, "epoch": 2.4200739155806263, "grad_norm": 1.28125, "learning_rate": 0.0004409057078612889, "loss": 5.0444, "mean_token_accuracy": 0.1972884863615036, "num_tokens": 53954875.0, "step": 31105 }, { "entropy": 5.399390506744385, "epoch": 2.420462944952344, "grad_norm": 1.203125, "learning_rate": 0.00044088698468433194, "loss": 5.0529, "mean_token_accuracy": 0.18851447701454163, "num_tokens": 53963355.0, "step": 31110 }, { "entropy": 5.395762491226196, "epoch": 2.4208519743240613, "grad_norm": 1.1953125, "learning_rate": 0.00044086825899030383, "loss": 5.0663, "mean_token_accuracy": 0.18999584317207335, "num_tokens": 53971861.0, "step": 31115 }, { "entropy": 5.403166246414185, "epoch": 2.421241003695779, "grad_norm": 1.25, "learning_rate": 0.000440849530779489, "loss": 5.0356, "mean_token_accuracy": 0.18615398406982422, "num_tokens": 53980415.0, "step": 31120 }, { "entropy": 5.466426372528076, "epoch": 2.4216300330674967, "grad_norm": 1.171875, "learning_rate": 0.0004408308000521715, "loss": 5.0282, "mean_token_accuracy": 0.18950492441654204, "num_tokens": 53989107.0, "step": 31125 }, { "entropy": 5.4030272483825685, "epoch": 2.4220190624392144, "grad_norm": 1.1640625, "learning_rate": 0.00044081206680863556, "loss": 5.0083, "mean_token_accuracy": 0.1948394149541855, "num_tokens": 53997938.0, "step": 31130 }, { "entropy": 5.420228958129883, "epoch": 2.4224080918109316, "grad_norm": 1.1796875, "learning_rate": 0.00044079333104916554, "loss": 5.0015, "mean_token_accuracy": 0.19876229166984558, "num_tokens": 54006221.0, "step": 31135 }, { "entropy": 5.420237874984741, "epoch": 2.4227971211826493, "grad_norm": 1.2421875, "learning_rate": 0.0004407745927740454, "loss": 5.0846, "mean_token_accuracy": 0.19395023584365845, "num_tokens": 54014579.0, "step": 31140 }, { "entropy": 5.442969894409179, "epoch": 2.423186150554367, "grad_norm": 1.1875, "learning_rate": 0.0004407558519835598, "loss": 5.0167, "mean_token_accuracy": 0.19489992111921312, "num_tokens": 54024119.0, "step": 31145 }, { "entropy": 5.4802202701568605, "epoch": 2.4235751799260843, "grad_norm": 1.1796875, "learning_rate": 0.00044073710867799295, "loss": 5.1086, "mean_token_accuracy": 0.18980143517255782, "num_tokens": 54032548.0, "step": 31150 }, { "entropy": 5.406494426727295, "epoch": 2.423964209297802, "grad_norm": 1.1953125, "learning_rate": 0.0004407183628576293, "loss": 5.0512, "mean_token_accuracy": 0.19437119513750076, "num_tokens": 54041210.0, "step": 31155 }, { "entropy": 5.429860162734985, "epoch": 2.4243532386695197, "grad_norm": 1.1953125, "learning_rate": 0.0004406996145227532, "loss": 5.0422, "mean_token_accuracy": 0.19113251119852065, "num_tokens": 54050056.0, "step": 31160 }, { "entropy": 5.412154912948608, "epoch": 2.424742268041237, "grad_norm": 1.0625, "learning_rate": 0.0004406808636736492, "loss": 5.0075, "mean_token_accuracy": 0.1904846340417862, "num_tokens": 54058752.0, "step": 31165 }, { "entropy": 5.349294805526734, "epoch": 2.4251312974129546, "grad_norm": 1.203125, "learning_rate": 0.00044066211031060183, "loss": 4.9545, "mean_token_accuracy": 0.19757064431905746, "num_tokens": 54067496.0, "step": 31170 }, { "entropy": 5.331160640716552, "epoch": 2.4255203267846723, "grad_norm": 1.1953125, "learning_rate": 0.0004406433544338956, "loss": 4.9734, "mean_token_accuracy": 0.19501854926347734, "num_tokens": 54075832.0, "step": 31175 }, { "entropy": 5.500713586807251, "epoch": 2.4259093561563896, "grad_norm": 1.265625, "learning_rate": 0.0004406245960438151, "loss": 5.1321, "mean_token_accuracy": 0.18465981185436248, "num_tokens": 54084642.0, "step": 31180 }, { "entropy": 5.359854316711425, "epoch": 2.4262983855281073, "grad_norm": 1.25, "learning_rate": 0.000440605835140645, "loss": 4.9663, "mean_token_accuracy": 0.19971468895673752, "num_tokens": 54092759.0, "step": 31185 }, { "entropy": 5.46321587562561, "epoch": 2.426687414899825, "grad_norm": 1.2109375, "learning_rate": 0.0004405870717246699, "loss": 5.087, "mean_token_accuracy": 0.19501444846391677, "num_tokens": 54101413.0, "step": 31190 }, { "entropy": 5.476794481277466, "epoch": 2.4270764442715427, "grad_norm": 1.109375, "learning_rate": 0.00044056830579617464, "loss": 5.0869, "mean_token_accuracy": 0.1885801687836647, "num_tokens": 54110237.0, "step": 31195 }, { "entropy": 5.439658308029175, "epoch": 2.42746547364326, "grad_norm": 1.1484375, "learning_rate": 0.00044054953735544376, "loss": 5.1595, "mean_token_accuracy": 0.18893886357545853, "num_tokens": 54119103.0, "step": 31200 }, { "entropy": 5.444906425476074, "epoch": 2.4278545030149776, "grad_norm": 1.140625, "learning_rate": 0.0004405307664027622, "loss": 5.0558, "mean_token_accuracy": 0.18948551416397094, "num_tokens": 54127696.0, "step": 31205 }, { "entropy": 5.421993589401245, "epoch": 2.4282435323866953, "grad_norm": 1.2109375, "learning_rate": 0.0004405119929384147, "loss": 4.9636, "mean_token_accuracy": 0.20198196023702622, "num_tokens": 54135607.0, "step": 31210 }, { "entropy": 5.387712001800537, "epoch": 2.4286325617584126, "grad_norm": 1.21875, "learning_rate": 0.0004404932169626862, "loss": 5.0434, "mean_token_accuracy": 0.18951854705810547, "num_tokens": 54144147.0, "step": 31215 }, { "entropy": 5.325083589553833, "epoch": 2.4290215911301303, "grad_norm": 1.203125, "learning_rate": 0.0004404744384758615, "loss": 5.0102, "mean_token_accuracy": 0.19901714771986007, "num_tokens": 54152010.0, "step": 31220 }, { "entropy": 5.411715745925903, "epoch": 2.429410620501848, "grad_norm": 1.15625, "learning_rate": 0.0004404556574782256, "loss": 5.1223, "mean_token_accuracy": 0.19664178490638734, "num_tokens": 54160923.0, "step": 31225 }, { "entropy": 5.443888235092163, "epoch": 2.4297996498735657, "grad_norm": 1.5625, "learning_rate": 0.00044043687397006336, "loss": 5.0337, "mean_token_accuracy": 0.19563821703195572, "num_tokens": 54169688.0, "step": 31230 }, { "entropy": 5.407328128814697, "epoch": 2.430188679245283, "grad_norm": 1.09375, "learning_rate": 0.00044041808795166, "loss": 5.0263, "mean_token_accuracy": 0.19582823812961578, "num_tokens": 54178423.0, "step": 31235 }, { "entropy": 5.368948364257813, "epoch": 2.4305777086170006, "grad_norm": 1.1484375, "learning_rate": 0.0004403992994233004, "loss": 5.046, "mean_token_accuracy": 0.1967637926340103, "num_tokens": 54186939.0, "step": 31240 }, { "entropy": 5.411690425872803, "epoch": 2.4309667379887183, "grad_norm": 1.1015625, "learning_rate": 0.00044038050838526974, "loss": 5.0596, "mean_token_accuracy": 0.19335115253925322, "num_tokens": 54195758.0, "step": 31245 }, { "entropy": 5.387757205963135, "epoch": 2.4313557673604356, "grad_norm": 1.125, "learning_rate": 0.000440361714837853, "loss": 4.922, "mean_token_accuracy": 0.19931000024080275, "num_tokens": 54205139.0, "step": 31250 }, { "entropy": 5.342758750915527, "epoch": 2.4317447967321533, "grad_norm": 1.1953125, "learning_rate": 0.0004403429187813355, "loss": 4.976, "mean_token_accuracy": 0.19883002936840058, "num_tokens": 54213346.0, "step": 31255 }, { "entropy": 5.349114084243775, "epoch": 2.432133826103871, "grad_norm": 1.1796875, "learning_rate": 0.0004403241202160024, "loss": 4.9198, "mean_token_accuracy": 0.20366810858249665, "num_tokens": 54221796.0, "step": 31260 }, { "entropy": 5.484842157363891, "epoch": 2.432522855475588, "grad_norm": 1.125, "learning_rate": 0.0004403053191421388, "loss": 5.1349, "mean_token_accuracy": 0.18344210237264633, "num_tokens": 54230166.0, "step": 31265 }, { "entropy": 5.3375242233276365, "epoch": 2.432911884847306, "grad_norm": 1.1015625, "learning_rate": 0.0004402865155600302, "loss": 4.9842, "mean_token_accuracy": 0.19480786174535752, "num_tokens": 54238986.0, "step": 31270 }, { "entropy": 5.432356643676758, "epoch": 2.4333009142190236, "grad_norm": 1.109375, "learning_rate": 0.00044026770946996183, "loss": 5.0122, "mean_token_accuracy": 0.19712936133146286, "num_tokens": 54248178.0, "step": 31275 }, { "entropy": 5.3971000671386715, "epoch": 2.433689943590741, "grad_norm": 1.171875, "learning_rate": 0.00044024890087221896, "loss": 5.007, "mean_token_accuracy": 0.19304340034723283, "num_tokens": 54256320.0, "step": 31280 }, { "entropy": 5.384117984771729, "epoch": 2.4340789729624586, "grad_norm": 1.1796875, "learning_rate": 0.00044023008976708705, "loss": 4.9895, "mean_token_accuracy": 0.20007553398609162, "num_tokens": 54264209.0, "step": 31285 }, { "entropy": 5.335179376602173, "epoch": 2.4344680023341763, "grad_norm": 1.2734375, "learning_rate": 0.0004402112761548515, "loss": 4.9074, "mean_token_accuracy": 0.20254423916339875, "num_tokens": 54271943.0, "step": 31290 }, { "entropy": 5.374290227890015, "epoch": 2.434857031705894, "grad_norm": 1.1484375, "learning_rate": 0.00044019246003579776, "loss": 5.0655, "mean_token_accuracy": 0.18923926800489427, "num_tokens": 54280524.0, "step": 31295 }, { "entropy": 5.400473356246948, "epoch": 2.435246061077611, "grad_norm": 1.171875, "learning_rate": 0.0004401736414102115, "loss": 5.0425, "mean_token_accuracy": 0.18969919234514238, "num_tokens": 54289479.0, "step": 31300 }, { "entropy": 5.434623289108276, "epoch": 2.435635090449329, "grad_norm": 1.265625, "learning_rate": 0.000440154820278378, "loss": 5.0427, "mean_token_accuracy": 0.19564686119556426, "num_tokens": 54297502.0, "step": 31305 }, { "entropy": 5.43638653755188, "epoch": 2.4360241198210466, "grad_norm": 1.15625, "learning_rate": 0.0004401359966405831, "loss": 5.0592, "mean_token_accuracy": 0.18865828067064286, "num_tokens": 54305691.0, "step": 31310 }, { "entropy": 5.508402585983276, "epoch": 2.436413149192764, "grad_norm": 1.109375, "learning_rate": 0.00044011717049711216, "loss": 5.1115, "mean_token_accuracy": 0.18017209619283675, "num_tokens": 54315582.0, "step": 31315 }, { "entropy": 5.432874870300293, "epoch": 2.4368021785644816, "grad_norm": 1.1640625, "learning_rate": 0.00044009834184825103, "loss": 5.0351, "mean_token_accuracy": 0.19515862911939622, "num_tokens": 54324102.0, "step": 31320 }, { "entropy": 5.472498083114624, "epoch": 2.4371912079361993, "grad_norm": 1.2109375, "learning_rate": 0.0004400795106942853, "loss": 5.0819, "mean_token_accuracy": 0.19353646039962769, "num_tokens": 54332618.0, "step": 31325 }, { "entropy": 5.438711500167846, "epoch": 2.437580237307917, "grad_norm": 1.140625, "learning_rate": 0.00044006067703550083, "loss": 5.0425, "mean_token_accuracy": 0.19505256563425064, "num_tokens": 54341236.0, "step": 31330 }, { "entropy": 5.312912178039551, "epoch": 2.437969266679634, "grad_norm": 1.109375, "learning_rate": 0.0004400418408721833, "loss": 4.9629, "mean_token_accuracy": 0.19714979976415634, "num_tokens": 54349817.0, "step": 31335 }, { "entropy": 5.463261651992798, "epoch": 2.438358296051352, "grad_norm": 1.2265625, "learning_rate": 0.00044002300220461843, "loss": 5.0819, "mean_token_accuracy": 0.18972368091344832, "num_tokens": 54358767.0, "step": 31340 }, { "entropy": 5.336778926849365, "epoch": 2.4387473254230696, "grad_norm": 1.203125, "learning_rate": 0.0004400041610330922, "loss": 4.9287, "mean_token_accuracy": 0.20068173259496688, "num_tokens": 54367208.0, "step": 31345 }, { "entropy": 5.387504148483276, "epoch": 2.439136354794787, "grad_norm": 1.140625, "learning_rate": 0.0004399853173578905, "loss": 5.0549, "mean_token_accuracy": 0.19442448914051055, "num_tokens": 54376234.0, "step": 31350 }, { "entropy": 5.425720977783203, "epoch": 2.4395253841665046, "grad_norm": 1.15625, "learning_rate": 0.00043996647117929916, "loss": 5.0925, "mean_token_accuracy": 0.1931433469057083, "num_tokens": 54384828.0, "step": 31355 }, { "entropy": 5.446771764755249, "epoch": 2.4399144135382222, "grad_norm": 1.1484375, "learning_rate": 0.0004399476224976043, "loss": 5.0705, "mean_token_accuracy": 0.19233834743499756, "num_tokens": 54394068.0, "step": 31360 }, { "entropy": 5.412508821487426, "epoch": 2.44030344290994, "grad_norm": 1.1171875, "learning_rate": 0.00043992877131309165, "loss": 5.0375, "mean_token_accuracy": 0.19527519643306732, "num_tokens": 54403667.0, "step": 31365 }, { "entropy": 5.363367557525635, "epoch": 2.440692472281657, "grad_norm": 1.1875, "learning_rate": 0.0004399099176260475, "loss": 4.955, "mean_token_accuracy": 0.20301275849342346, "num_tokens": 54411614.0, "step": 31370 }, { "entropy": 5.323710107803345, "epoch": 2.441081501653375, "grad_norm": 1.1640625, "learning_rate": 0.0004398910614367579, "loss": 4.9536, "mean_token_accuracy": 0.19913744330406188, "num_tokens": 54420084.0, "step": 31375 }, { "entropy": 5.427762699127197, "epoch": 2.441470531025092, "grad_norm": 1.125, "learning_rate": 0.00043987220274550876, "loss": 5.0765, "mean_token_accuracy": 0.19277286827564238, "num_tokens": 54429100.0, "step": 31380 }, { "entropy": 5.479410171508789, "epoch": 2.44185956039681, "grad_norm": 1.171875, "learning_rate": 0.00043985334155258643, "loss": 5.1231, "mean_token_accuracy": 0.19430676847696304, "num_tokens": 54437900.0, "step": 31385 }, { "entropy": 5.455195474624634, "epoch": 2.4422485897685275, "grad_norm": 1.15625, "learning_rate": 0.000439834477858277, "loss": 5.0195, "mean_token_accuracy": 0.19736503064632416, "num_tokens": 54445840.0, "step": 31390 }, { "entropy": 5.378389596939087, "epoch": 2.4426376191402452, "grad_norm": 1.1640625, "learning_rate": 0.00043981561166286676, "loss": 5.0598, "mean_token_accuracy": 0.1921093463897705, "num_tokens": 54454116.0, "step": 31395 }, { "entropy": 5.394708585739136, "epoch": 2.4430266485119625, "grad_norm": 1.1484375, "learning_rate": 0.000439796742966642, "loss": 5.0124, "mean_token_accuracy": 0.19211949557065963, "num_tokens": 54462787.0, "step": 31400 }, { "entropy": 5.411596393585205, "epoch": 2.44341567788368, "grad_norm": 1.1640625, "learning_rate": 0.00043977787176988884, "loss": 5.0871, "mean_token_accuracy": 0.1917489007115364, "num_tokens": 54472706.0, "step": 31405 }, { "entropy": 5.4799384593963625, "epoch": 2.443804707255398, "grad_norm": 1.2109375, "learning_rate": 0.0004397589980728938, "loss": 5.0443, "mean_token_accuracy": 0.19480502009391784, "num_tokens": 54482016.0, "step": 31410 }, { "entropy": 5.3771449565887455, "epoch": 2.444193736627115, "grad_norm": 1.1953125, "learning_rate": 0.00043974012187594324, "loss": 4.9582, "mean_token_accuracy": 0.20187467634677886, "num_tokens": 54489943.0, "step": 31415 }, { "entropy": 5.404350805282593, "epoch": 2.444582765998833, "grad_norm": 1.140625, "learning_rate": 0.0004397212431793235, "loss": 5.1075, "mean_token_accuracy": 0.18785278797149657, "num_tokens": 54498251.0, "step": 31420 }, { "entropy": 5.335601472854615, "epoch": 2.4449717953705505, "grad_norm": 1.1796875, "learning_rate": 0.00043970236198332107, "loss": 4.938, "mean_token_accuracy": 0.2030004784464836, "num_tokens": 54506862.0, "step": 31425 }, { "entropy": 5.353122520446777, "epoch": 2.4453608247422682, "grad_norm": 1.1875, "learning_rate": 0.00043968347828822246, "loss": 4.9378, "mean_token_accuracy": 0.20174659490585328, "num_tokens": 54515207.0, "step": 31430 }, { "entropy": 5.47895565032959, "epoch": 2.4457498541139855, "grad_norm": 1.1640625, "learning_rate": 0.0004396645920943142, "loss": 5.0788, "mean_token_accuracy": 0.19523707181215286, "num_tokens": 54523643.0, "step": 31435 }, { "entropy": 5.367811775207519, "epoch": 2.446138883485703, "grad_norm": 1.15625, "learning_rate": 0.0004396457034018828, "loss": 4.9397, "mean_token_accuracy": 0.21111776679754257, "num_tokens": 54532805.0, "step": 31440 }, { "entropy": 5.4254895687103275, "epoch": 2.446527912857421, "grad_norm": 1.3125, "learning_rate": 0.000439626812211215, "loss": 5.0798, "mean_token_accuracy": 0.19395567774772643, "num_tokens": 54541525.0, "step": 31445 }, { "entropy": 5.411166477203369, "epoch": 2.446916942229138, "grad_norm": 1.1484375, "learning_rate": 0.00043960791852259735, "loss": 5.1128, "mean_token_accuracy": 0.19040479511022568, "num_tokens": 54550034.0, "step": 31450 }, { "entropy": 5.477800750732422, "epoch": 2.447305971600856, "grad_norm": 1.078125, "learning_rate": 0.0004395890223363165, "loss": 5.0072, "mean_token_accuracy": 0.19512297660112382, "num_tokens": 54559498.0, "step": 31455 }, { "entropy": 5.431726169586182, "epoch": 2.4476950009725735, "grad_norm": 1.3515625, "learning_rate": 0.00043957012365265915, "loss": 5.0564, "mean_token_accuracy": 0.19653663635253907, "num_tokens": 54568397.0, "step": 31460 }, { "entropy": 5.430154037475586, "epoch": 2.4480840303442912, "grad_norm": 1.2109375, "learning_rate": 0.00043955122247191214, "loss": 5.1262, "mean_token_accuracy": 0.1851029083132744, "num_tokens": 54576735.0, "step": 31465 }, { "entropy": 5.480307340621948, "epoch": 2.4484730597160085, "grad_norm": 1.234375, "learning_rate": 0.0004395323187943623, "loss": 5.1143, "mean_token_accuracy": 0.19029008746147155, "num_tokens": 54586265.0, "step": 31470 }, { "entropy": 5.451926946640015, "epoch": 2.448862089087726, "grad_norm": 1.140625, "learning_rate": 0.0004395134126202964, "loss": 5.0451, "mean_token_accuracy": 0.19518058598041535, "num_tokens": 54595307.0, "step": 31475 }, { "entropy": 5.42092752456665, "epoch": 2.449251118459444, "grad_norm": 1.0625, "learning_rate": 0.0004394945039500012, "loss": 5.0362, "mean_token_accuracy": 0.19310922920703888, "num_tokens": 54603886.0, "step": 31480 }, { "entropy": 5.4572642803192135, "epoch": 2.449640147831161, "grad_norm": 1.1953125, "learning_rate": 0.00043947559278376385, "loss": 5.0685, "mean_token_accuracy": 0.19258410930633546, "num_tokens": 54613165.0, "step": 31485 }, { "entropy": 5.4899272441864015, "epoch": 2.450029177202879, "grad_norm": 1.140625, "learning_rate": 0.00043945667912187117, "loss": 5.0122, "mean_token_accuracy": 0.19402024149894714, "num_tokens": 54622226.0, "step": 31490 }, { "entropy": 5.368931913375855, "epoch": 2.4504182065745965, "grad_norm": 1.21875, "learning_rate": 0.0004394377629646101, "loss": 4.9946, "mean_token_accuracy": 0.19558170735836028, "num_tokens": 54631389.0, "step": 31495 }, { "entropy": 5.351899766921997, "epoch": 2.4508072359463138, "grad_norm": 1.1484375, "learning_rate": 0.00043941884431226763, "loss": 5.02, "mean_token_accuracy": 0.19144335240125657, "num_tokens": 54640033.0, "step": 31500 }, { "entropy": 5.416379785537719, "epoch": 2.4511962653180315, "grad_norm": 1.1171875, "learning_rate": 0.000439399923165131, "loss": 4.9331, "mean_token_accuracy": 0.19484292417764665, "num_tokens": 54648828.0, "step": 31505 }, { "entropy": 5.410915422439575, "epoch": 2.451585294689749, "grad_norm": 1.3671875, "learning_rate": 0.0004393809995234872, "loss": 5.0029, "mean_token_accuracy": 0.19869796484708785, "num_tokens": 54657132.0, "step": 31510 }, { "entropy": 5.3974353790283205, "epoch": 2.4519743240614664, "grad_norm": 1.1484375, "learning_rate": 0.0004393620733876233, "loss": 5.0026, "mean_token_accuracy": 0.19140104651451112, "num_tokens": 54666261.0, "step": 31515 }, { "entropy": 5.348959493637085, "epoch": 2.452363353433184, "grad_norm": 1.1171875, "learning_rate": 0.0004393431447578267, "loss": 5.0009, "mean_token_accuracy": 0.19933670163154601, "num_tokens": 54675200.0, "step": 31520 }, { "entropy": 5.376762580871582, "epoch": 2.452752382804902, "grad_norm": 1.1796875, "learning_rate": 0.00043932421363438427, "loss": 4.9724, "mean_token_accuracy": 0.19923997074365615, "num_tokens": 54683659.0, "step": 31525 }, { "entropy": 5.285510110855102, "epoch": 2.4531414121766195, "grad_norm": 1.09375, "learning_rate": 0.0004393052800175835, "loss": 4.9131, "mean_token_accuracy": 0.20845529884099961, "num_tokens": 54691903.0, "step": 31530 }, { "entropy": 5.291647863388062, "epoch": 2.4535304415483368, "grad_norm": 1.171875, "learning_rate": 0.00043928634390771166, "loss": 4.9459, "mean_token_accuracy": 0.19873571246862412, "num_tokens": 54700512.0, "step": 31535 }, { "entropy": 5.392148065567016, "epoch": 2.4539194709200545, "grad_norm": 1.3203125, "learning_rate": 0.00043926740530505603, "loss": 5.0097, "mean_token_accuracy": 0.19435751140117646, "num_tokens": 54709144.0, "step": 31540 }, { "entropy": 5.419566488265991, "epoch": 2.454308500291772, "grad_norm": 1.1796875, "learning_rate": 0.000439248464209904, "loss": 5.0469, "mean_token_accuracy": 0.19954792261123658, "num_tokens": 54717733.0, "step": 31545 }, { "entropy": 5.364417219161988, "epoch": 2.4546975296634894, "grad_norm": 1.1875, "learning_rate": 0.000439229520622543, "loss": 4.9954, "mean_token_accuracy": 0.19962529987096786, "num_tokens": 54726120.0, "step": 31550 }, { "entropy": 5.343695831298828, "epoch": 2.455086559035207, "grad_norm": 1.1015625, "learning_rate": 0.0004392105745432603, "loss": 4.9979, "mean_token_accuracy": 0.20072450637817382, "num_tokens": 54735639.0, "step": 31555 }, { "entropy": 5.401023054122925, "epoch": 2.455475588406925, "grad_norm": 1.2421875, "learning_rate": 0.0004391916259723436, "loss": 4.9504, "mean_token_accuracy": 0.1936843290925026, "num_tokens": 54743928.0, "step": 31560 }, { "entropy": 5.451465749740601, "epoch": 2.4558646177786425, "grad_norm": 1.203125, "learning_rate": 0.00043917267491008023, "loss": 5.0317, "mean_token_accuracy": 0.19650884121656417, "num_tokens": 54752409.0, "step": 31565 }, { "entropy": 5.388997411727905, "epoch": 2.4562536471503598, "grad_norm": 1.15625, "learning_rate": 0.0004391537213567579, "loss": 5.0707, "mean_token_accuracy": 0.19219435900449752, "num_tokens": 54761018.0, "step": 31570 }, { "entropy": 5.376125431060791, "epoch": 2.4566426765220775, "grad_norm": 1.1171875, "learning_rate": 0.0004391347653126641, "loss": 4.9895, "mean_token_accuracy": 0.19735456854104996, "num_tokens": 54769479.0, "step": 31575 }, { "entropy": 5.354591751098633, "epoch": 2.457031705893795, "grad_norm": 1.1328125, "learning_rate": 0.00043911580677808646, "loss": 4.927, "mean_token_accuracy": 0.19936426877975463, "num_tokens": 54778310.0, "step": 31580 }, { "entropy": 5.384905099868774, "epoch": 2.4574207352655124, "grad_norm": 1.09375, "learning_rate": 0.00043909684575331264, "loss": 4.9999, "mean_token_accuracy": 0.19872778803110122, "num_tokens": 54788237.0, "step": 31585 }, { "entropy": 5.37748007774353, "epoch": 2.45780976463723, "grad_norm": 1.5078125, "learning_rate": 0.0004390778822386304, "loss": 5.0354, "mean_token_accuracy": 0.20008478611707686, "num_tokens": 54796746.0, "step": 31590 }, { "entropy": 5.3662457942962645, "epoch": 2.458198794008948, "grad_norm": 1.296875, "learning_rate": 0.00043905891623432754, "loss": 4.9947, "mean_token_accuracy": 0.1929931476712227, "num_tokens": 54805572.0, "step": 31595 }, { "entropy": 5.3702186107635494, "epoch": 2.458587823380665, "grad_norm": 1.1640625, "learning_rate": 0.00043903994774069165, "loss": 4.941, "mean_token_accuracy": 0.2024587407708168, "num_tokens": 54814631.0, "step": 31600 }, { "entropy": 5.452630615234375, "epoch": 2.4589768527523828, "grad_norm": 1.1875, "learning_rate": 0.0004390209767580107, "loss": 4.9784, "mean_token_accuracy": 0.1928611233830452, "num_tokens": 54822753.0, "step": 31605 }, { "entropy": 5.422944116592407, "epoch": 2.4593658821241005, "grad_norm": 1.2109375, "learning_rate": 0.0004390020032865725, "loss": 5.0143, "mean_token_accuracy": 0.19588242918252946, "num_tokens": 54830969.0, "step": 31610 }, { "entropy": 5.336540699005127, "epoch": 2.4597549114958177, "grad_norm": 1.171875, "learning_rate": 0.0004389830273266649, "loss": 5.0377, "mean_token_accuracy": 0.1993071749806404, "num_tokens": 54840295.0, "step": 31615 }, { "entropy": 5.525561952590943, "epoch": 2.4601439408675354, "grad_norm": 1.2421875, "learning_rate": 0.00043896404887857596, "loss": 5.121, "mean_token_accuracy": 0.19116182625293732, "num_tokens": 54848583.0, "step": 31620 }, { "entropy": 5.417760372161865, "epoch": 2.460532970239253, "grad_norm": 1.1171875, "learning_rate": 0.0004389450679425935, "loss": 4.9547, "mean_token_accuracy": 0.19704277217388153, "num_tokens": 54857450.0, "step": 31625 }, { "entropy": 5.401632070541382, "epoch": 2.460921999610971, "grad_norm": 1.1484375, "learning_rate": 0.0004389260845190055, "loss": 5.0747, "mean_token_accuracy": 0.18853639364242553, "num_tokens": 54865928.0, "step": 31630 }, { "entropy": 5.457083034515381, "epoch": 2.461311028982688, "grad_norm": 1.140625, "learning_rate": 0.00043890709860810014, "loss": 5.1018, "mean_token_accuracy": 0.19262714087963104, "num_tokens": 54874983.0, "step": 31635 }, { "entropy": 5.444676065444947, "epoch": 2.4617000583544058, "grad_norm": 1.140625, "learning_rate": 0.00043888811021016545, "loss": 5.0272, "mean_token_accuracy": 0.19169287979602814, "num_tokens": 54883488.0, "step": 31640 }, { "entropy": 5.373010778427124, "epoch": 2.4620890877261234, "grad_norm": 1.140625, "learning_rate": 0.00043886911932548953, "loss": 5.0027, "mean_token_accuracy": 0.19667731672525407, "num_tokens": 54892865.0, "step": 31645 }, { "entropy": 5.464204788208008, "epoch": 2.4624781170978407, "grad_norm": 1.1796875, "learning_rate": 0.0004388501259543605, "loss": 5.1063, "mean_token_accuracy": 0.18693741410970688, "num_tokens": 54901714.0, "step": 31650 }, { "entropy": 5.355846166610718, "epoch": 2.4628671464695584, "grad_norm": 1.1953125, "learning_rate": 0.0004388311300970667, "loss": 5.0776, "mean_token_accuracy": 0.19031663089990616, "num_tokens": 54910912.0, "step": 31655 }, { "entropy": 5.48328742980957, "epoch": 2.463256175841276, "grad_norm": 1.1640625, "learning_rate": 0.0004388121317538962, "loss": 5.1093, "mean_token_accuracy": 0.18409449309110643, "num_tokens": 54919613.0, "step": 31660 }, { "entropy": 5.453497505187988, "epoch": 2.463645205212994, "grad_norm": 1.21875, "learning_rate": 0.0004387931309251374, "loss": 5.0038, "mean_token_accuracy": 0.19350139498710633, "num_tokens": 54928794.0, "step": 31665 }, { "entropy": 5.310459232330322, "epoch": 2.464034234584711, "grad_norm": 1.1875, "learning_rate": 0.0004387741276110785, "loss": 4.9462, "mean_token_accuracy": 0.19767017513513566, "num_tokens": 54937826.0, "step": 31670 }, { "entropy": 5.399421453475952, "epoch": 2.4644232639564287, "grad_norm": 1.1875, "learning_rate": 0.00043875512181200784, "loss": 5.057, "mean_token_accuracy": 0.1864125356078148, "num_tokens": 54946541.0, "step": 31675 }, { "entropy": 5.443987560272217, "epoch": 2.4648122933281464, "grad_norm": 1.15625, "learning_rate": 0.0004387361135282139, "loss": 5.0476, "mean_token_accuracy": 0.19305471032857896, "num_tokens": 54954540.0, "step": 31680 }, { "entropy": 5.337622213363647, "epoch": 2.4652013226998637, "grad_norm": 1.1796875, "learning_rate": 0.00043871710275998507, "loss": 4.996, "mean_token_accuracy": 0.19901976436376573, "num_tokens": 54962784.0, "step": 31685 }, { "entropy": 5.32838921546936, "epoch": 2.4655903520715814, "grad_norm": 1.1875, "learning_rate": 0.0004386980895076097, "loss": 4.9586, "mean_token_accuracy": 0.20501023381948472, "num_tokens": 54971572.0, "step": 31690 }, { "entropy": 5.442321014404297, "epoch": 2.465979381443299, "grad_norm": 1.203125, "learning_rate": 0.00043867907377137646, "loss": 4.9854, "mean_token_accuracy": 0.19663703292608262, "num_tokens": 54980161.0, "step": 31695 }, { "entropy": 5.419276237487793, "epoch": 2.4663684108150163, "grad_norm": 1.1953125, "learning_rate": 0.00043866005555157376, "loss": 5.0199, "mean_token_accuracy": 0.19419140070676805, "num_tokens": 54988219.0, "step": 31700 }, { "entropy": 5.350657320022583, "epoch": 2.466757440186734, "grad_norm": 1.203125, "learning_rate": 0.0004386410348484903, "loss": 4.9603, "mean_token_accuracy": 0.19908930361270905, "num_tokens": 54996550.0, "step": 31705 }, { "entropy": 5.382793045043945, "epoch": 2.4671464695584517, "grad_norm": 1.140625, "learning_rate": 0.0004386220116624145, "loss": 5.1198, "mean_token_accuracy": 0.18964531868696213, "num_tokens": 55005269.0, "step": 31710 }, { "entropy": 5.39800238609314, "epoch": 2.467535498930169, "grad_norm": 1.1796875, "learning_rate": 0.00043860298599363506, "loss": 4.9104, "mean_token_accuracy": 0.20839183628559113, "num_tokens": 55014264.0, "step": 31715 }, { "entropy": 5.345554161071777, "epoch": 2.4679245283018867, "grad_norm": 1.1328125, "learning_rate": 0.0004385839578424408, "loss": 4.9938, "mean_token_accuracy": 0.19470368176698685, "num_tokens": 55023597.0, "step": 31720 }, { "entropy": 5.383526611328125, "epoch": 2.4683135576736044, "grad_norm": 1.1875, "learning_rate": 0.00043856492720912037, "loss": 5.0121, "mean_token_accuracy": 0.19908594340085983, "num_tokens": 55032860.0, "step": 31725 }, { "entropy": 5.4351921558380125, "epoch": 2.468702587045322, "grad_norm": 1.140625, "learning_rate": 0.0004385458940939624, "loss": 4.9907, "mean_token_accuracy": 0.20143966972827912, "num_tokens": 55041275.0, "step": 31730 }, { "entropy": 5.4054240703582765, "epoch": 2.4690916164170393, "grad_norm": 1.1796875, "learning_rate": 0.0004385268584972559, "loss": 5.0827, "mean_token_accuracy": 0.19058404713869095, "num_tokens": 55050871.0, "step": 31735 }, { "entropy": 5.406329345703125, "epoch": 2.469480645788757, "grad_norm": 1.0859375, "learning_rate": 0.0004385078204192896, "loss": 5.0106, "mean_token_accuracy": 0.19181863516569136, "num_tokens": 55060353.0, "step": 31740 }, { "entropy": 5.41583137512207, "epoch": 2.4698696751604747, "grad_norm": 1.265625, "learning_rate": 0.0004384887798603523, "loss": 5.0161, "mean_token_accuracy": 0.19084177613258363, "num_tokens": 55069002.0, "step": 31745 }, { "entropy": 5.421838569641113, "epoch": 2.470258704532192, "grad_norm": 1.1484375, "learning_rate": 0.000438469736820733, "loss": 5.0618, "mean_token_accuracy": 0.18500406444072723, "num_tokens": 55078369.0, "step": 31750 }, { "entropy": 5.523258447647095, "epoch": 2.4706477339039097, "grad_norm": 1.1015625, "learning_rate": 0.00043845069130072067, "loss": 5.1466, "mean_token_accuracy": 0.18580360859632492, "num_tokens": 55087597.0, "step": 31755 }, { "entropy": 5.383196592330933, "epoch": 2.4710367632756274, "grad_norm": 1.15625, "learning_rate": 0.0004384316433006043, "loss": 4.9703, "mean_token_accuracy": 0.20030679553747177, "num_tokens": 55095906.0, "step": 31760 }, { "entropy": 5.34703803062439, "epoch": 2.471425792647345, "grad_norm": 1.15625, "learning_rate": 0.00043841259282067276, "loss": 4.9869, "mean_token_accuracy": 0.19591302424669266, "num_tokens": 55104401.0, "step": 31765 }, { "entropy": 5.3689820766448975, "epoch": 2.4718148220190623, "grad_norm": 1.125, "learning_rate": 0.00043839353986121533, "loss": 5.05, "mean_token_accuracy": 0.193874728679657, "num_tokens": 55113075.0, "step": 31770 }, { "entropy": 5.38634762763977, "epoch": 2.47220385139078, "grad_norm": 1.171875, "learning_rate": 0.0004383744844225209, "loss": 4.9375, "mean_token_accuracy": 0.1977776139974594, "num_tokens": 55122173.0, "step": 31775 }, { "entropy": 5.443068647384644, "epoch": 2.4725928807624977, "grad_norm": 1.796875, "learning_rate": 0.00043835542650487875, "loss": 5.0706, "mean_token_accuracy": 0.19355318546295167, "num_tokens": 55130356.0, "step": 31780 }, { "entropy": 5.382021379470825, "epoch": 2.472981910134215, "grad_norm": 1.1015625, "learning_rate": 0.0004383363661085781, "loss": 5.0201, "mean_token_accuracy": 0.19568648636341096, "num_tokens": 55138985.0, "step": 31785 }, { "entropy": 5.379597568511963, "epoch": 2.4733709395059327, "grad_norm": 1.1328125, "learning_rate": 0.0004383173032339079, "loss": 5.0331, "mean_token_accuracy": 0.20241547077894212, "num_tokens": 55148053.0, "step": 31790 }, { "entropy": 5.482140779495239, "epoch": 2.4737599688776504, "grad_norm": 1.15625, "learning_rate": 0.0004382982378811577, "loss": 5.1237, "mean_token_accuracy": 0.18864275962114335, "num_tokens": 55156815.0, "step": 31795 }, { "entropy": 5.331408071517944, "epoch": 2.474148998249368, "grad_norm": 1.1171875, "learning_rate": 0.0004382791700506166, "loss": 4.8793, "mean_token_accuracy": 0.2092390313744545, "num_tokens": 55165007.0, "step": 31800 }, { "entropy": 5.392003202438355, "epoch": 2.4745380276210853, "grad_norm": 1.140625, "learning_rate": 0.000438260099742574, "loss": 5.0205, "mean_token_accuracy": 0.19403792470693587, "num_tokens": 55173784.0, "step": 31805 }, { "entropy": 5.388980293273926, "epoch": 2.474927056992803, "grad_norm": 1.1640625, "learning_rate": 0.0004382410269573192, "loss": 5.0101, "mean_token_accuracy": 0.1952759474515915, "num_tokens": 55182436.0, "step": 31810 }, { "entropy": 5.475616550445556, "epoch": 2.4753160863645203, "grad_norm": 1.203125, "learning_rate": 0.00043822195169514167, "loss": 5.0568, "mean_token_accuracy": 0.19712310135364533, "num_tokens": 55190083.0, "step": 31815 }, { "entropy": 5.4534073829650875, "epoch": 2.475705115736238, "grad_norm": 1.1484375, "learning_rate": 0.00043820287395633086, "loss": 5.1154, "mean_token_accuracy": 0.1858028158545494, "num_tokens": 55200154.0, "step": 31820 }, { "entropy": 5.453097343444824, "epoch": 2.4760941451079557, "grad_norm": 1.03125, "learning_rate": 0.0004381837937411761, "loss": 5.0405, "mean_token_accuracy": 0.19423019289970397, "num_tokens": 55209672.0, "step": 31825 }, { "entropy": 5.45835313796997, "epoch": 2.4764831744796734, "grad_norm": 1.1953125, "learning_rate": 0.00043816471104996706, "loss": 5.1038, "mean_token_accuracy": 0.1911303699016571, "num_tokens": 55218362.0, "step": 31830 }, { "entropy": 5.389842319488525, "epoch": 2.4768722038513906, "grad_norm": 1.1328125, "learning_rate": 0.0004381456258829933, "loss": 4.9486, "mean_token_accuracy": 0.20077385306358336, "num_tokens": 55226834.0, "step": 31835 }, { "entropy": 5.308271074295044, "epoch": 2.4772612332231083, "grad_norm": 1.171875, "learning_rate": 0.00043812653824054426, "loss": 5.0639, "mean_token_accuracy": 0.18398825079202652, "num_tokens": 55236325.0, "step": 31840 }, { "entropy": 5.393371152877807, "epoch": 2.477650262594826, "grad_norm": 1.1953125, "learning_rate": 0.0004381074481229097, "loss": 4.9844, "mean_token_accuracy": 0.19987611174583436, "num_tokens": 55245007.0, "step": 31845 }, { "entropy": 5.4103227138519285, "epoch": 2.4780392919665433, "grad_norm": 1.203125, "learning_rate": 0.0004380883555303791, "loss": 4.957, "mean_token_accuracy": 0.19747809022665025, "num_tokens": 55253967.0, "step": 31850 }, { "entropy": 5.421306848526001, "epoch": 2.478428321338261, "grad_norm": 1.5, "learning_rate": 0.0004380692604632424, "loss": 5.0255, "mean_token_accuracy": 0.191767817735672, "num_tokens": 55262226.0, "step": 31855 }, { "entropy": 5.490383434295654, "epoch": 2.4788173507099787, "grad_norm": 1.15625, "learning_rate": 0.00043805016292178923, "loss": 5.1205, "mean_token_accuracy": 0.1917422741651535, "num_tokens": 55271523.0, "step": 31860 }, { "entropy": 5.439175081253052, "epoch": 2.4792063800816964, "grad_norm": 1.171875, "learning_rate": 0.0004380310629063094, "loss": 5.0286, "mean_token_accuracy": 0.2009475991129875, "num_tokens": 55280604.0, "step": 31865 }, { "entropy": 5.322654151916504, "epoch": 2.4795954094534136, "grad_norm": 1.1875, "learning_rate": 0.0004380119604170925, "loss": 4.9775, "mean_token_accuracy": 0.19952320158481598, "num_tokens": 55289521.0, "step": 31870 }, { "entropy": 5.408681106567383, "epoch": 2.4799844388251313, "grad_norm": 1.140625, "learning_rate": 0.00043799285545442876, "loss": 4.9856, "mean_token_accuracy": 0.19501469731330873, "num_tokens": 55298211.0, "step": 31875 }, { "entropy": 5.352804708480835, "epoch": 2.480373468196849, "grad_norm": 1.21875, "learning_rate": 0.0004379737480186078, "loss": 4.9256, "mean_token_accuracy": 0.2030505046248436, "num_tokens": 55306984.0, "step": 31880 }, { "entropy": 5.422357892990112, "epoch": 2.4807624975685663, "grad_norm": 1.1640625, "learning_rate": 0.00043795463810991956, "loss": 5.0797, "mean_token_accuracy": 0.18498249500989913, "num_tokens": 55316266.0, "step": 31885 }, { "entropy": 5.360296964645386, "epoch": 2.481151526940284, "grad_norm": 1.1796875, "learning_rate": 0.0004379355257286541, "loss": 4.9267, "mean_token_accuracy": 0.19890151172876358, "num_tokens": 55324698.0, "step": 31890 }, { "entropy": 5.411339998245239, "epoch": 2.4815405563120017, "grad_norm": 1.234375, "learning_rate": 0.00043791641087510136, "loss": 4.9604, "mean_token_accuracy": 0.2020510032773018, "num_tokens": 55333033.0, "step": 31895 }, { "entropy": 5.427025318145752, "epoch": 2.4819295856837194, "grad_norm": 1.1328125, "learning_rate": 0.0004378972935495514, "loss": 5.08, "mean_token_accuracy": 0.1950684204697609, "num_tokens": 55341110.0, "step": 31900 }, { "entropy": 5.407880449295044, "epoch": 2.4823186150554366, "grad_norm": 1.078125, "learning_rate": 0.0004378781737522943, "loss": 4.9981, "mean_token_accuracy": 0.19607090055942536, "num_tokens": 55350156.0, "step": 31905 }, { "entropy": 5.3996399402618405, "epoch": 2.4827076444271543, "grad_norm": 1.1640625, "learning_rate": 0.00043785905148362007, "loss": 5.0666, "mean_token_accuracy": 0.19022821336984636, "num_tokens": 55358737.0, "step": 31910 }, { "entropy": 5.365509796142578, "epoch": 2.483096673798872, "grad_norm": 1.234375, "learning_rate": 0.00043783992674381903, "loss": 4.9482, "mean_token_accuracy": 0.20402962416410447, "num_tokens": 55366872.0, "step": 31915 }, { "entropy": 5.289077615737915, "epoch": 2.4834857031705893, "grad_norm": 1.1015625, "learning_rate": 0.00043782079953318126, "loss": 4.9408, "mean_token_accuracy": 0.19867077022790908, "num_tokens": 55375675.0, "step": 31920 }, { "entropy": 5.383708810806274, "epoch": 2.483874732542307, "grad_norm": 1.2890625, "learning_rate": 0.0004378016698519971, "loss": 4.9572, "mean_token_accuracy": 0.20084453821182252, "num_tokens": 55382750.0, "step": 31925 }, { "entropy": 5.348335599899292, "epoch": 2.4842637619140246, "grad_norm": 1.1640625, "learning_rate": 0.00043778253770055666, "loss": 5.0249, "mean_token_accuracy": 0.1913883313536644, "num_tokens": 55390852.0, "step": 31930 }, { "entropy": 5.363742876052856, "epoch": 2.484652791285742, "grad_norm": 1.1328125, "learning_rate": 0.00043776340307915033, "loss": 5.0025, "mean_token_accuracy": 0.19987063407897948, "num_tokens": 55398789.0, "step": 31935 }, { "entropy": 5.390597486495972, "epoch": 2.4850418206574596, "grad_norm": 1.2109375, "learning_rate": 0.0004377442659880684, "loss": 5.0623, "mean_token_accuracy": 0.19170828461647033, "num_tokens": 55408100.0, "step": 31940 }, { "entropy": 5.38057951927185, "epoch": 2.4854308500291773, "grad_norm": 1.125, "learning_rate": 0.0004377251264276013, "loss": 4.9823, "mean_token_accuracy": 0.19836508333683014, "num_tokens": 55416718.0, "step": 31945 }, { "entropy": 5.467417860031128, "epoch": 2.4858198794008945, "grad_norm": 1.1640625, "learning_rate": 0.00043770598439803936, "loss": 5.0812, "mean_token_accuracy": 0.19347298443317412, "num_tokens": 55426149.0, "step": 31950 }, { "entropy": 5.428702640533447, "epoch": 2.4862089087726122, "grad_norm": 1.1953125, "learning_rate": 0.00043768683989967304, "loss": 4.9969, "mean_token_accuracy": 0.1951591193675995, "num_tokens": 55434379.0, "step": 31955 }, { "entropy": 5.368360614776611, "epoch": 2.48659793814433, "grad_norm": 1.1875, "learning_rate": 0.00043766769293279294, "loss": 5.0436, "mean_token_accuracy": 0.19439576268196107, "num_tokens": 55442880.0, "step": 31960 }, { "entropy": 5.394635534286499, "epoch": 2.4869869675160476, "grad_norm": 1.2421875, "learning_rate": 0.00043764854349768957, "loss": 5.0242, "mean_token_accuracy": 0.19372686445713044, "num_tokens": 55452090.0, "step": 31965 }, { "entropy": 5.448425054550171, "epoch": 2.487375996887765, "grad_norm": 1.1640625, "learning_rate": 0.00043762939159465333, "loss": 5.0513, "mean_token_accuracy": 0.19565532207489014, "num_tokens": 55460271.0, "step": 31970 }, { "entropy": 5.3439233779907225, "epoch": 2.4877650262594826, "grad_norm": 1.1953125, "learning_rate": 0.00043761023722397495, "loss": 4.9164, "mean_token_accuracy": 0.1992787942290306, "num_tokens": 55468414.0, "step": 31975 }, { "entropy": 5.411414957046508, "epoch": 2.4881540556312003, "grad_norm": 1.1875, "learning_rate": 0.000437591080385945, "loss": 5.0172, "mean_token_accuracy": 0.19629014283418655, "num_tokens": 55477658.0, "step": 31980 }, { "entropy": 5.4045580387115475, "epoch": 2.4885430850029175, "grad_norm": 1.1171875, "learning_rate": 0.0004375719210808543, "loss": 4.9432, "mean_token_accuracy": 0.19389043152332305, "num_tokens": 55486536.0, "step": 31985 }, { "entropy": 5.377507257461548, "epoch": 2.4889321143746352, "grad_norm": 1.109375, "learning_rate": 0.0004375527593089934, "loss": 5.0212, "mean_token_accuracy": 0.19533667713403702, "num_tokens": 55494995.0, "step": 31990 }, { "entropy": 5.402934265136719, "epoch": 2.489321143746353, "grad_norm": 1.1171875, "learning_rate": 0.0004375335950706531, "loss": 5.0242, "mean_token_accuracy": 0.18993353843688965, "num_tokens": 55503392.0, "step": 31995 }, { "entropy": 5.363742923736572, "epoch": 2.4897101731180706, "grad_norm": 1.1484375, "learning_rate": 0.0004375144283661242, "loss": 4.985, "mean_token_accuracy": 0.20166463255882264, "num_tokens": 55512211.0, "step": 32000 }, { "entropy": 5.286008834838867, "epoch": 2.490099202489788, "grad_norm": 1.15625, "learning_rate": 0.0004374952591956975, "loss": 4.9453, "mean_token_accuracy": 0.1990015059709549, "num_tokens": 55520412.0, "step": 32005 }, { "entropy": 5.3209484100341795, "epoch": 2.4904882318615056, "grad_norm": 1.15625, "learning_rate": 0.00043747608755966396, "loss": 4.9794, "mean_token_accuracy": 0.19808338433504105, "num_tokens": 55529964.0, "step": 32010 }, { "entropy": 5.406563472747803, "epoch": 2.4908772612332233, "grad_norm": 1.1953125, "learning_rate": 0.0004374569134583143, "loss": 4.9805, "mean_token_accuracy": 0.19372447878122329, "num_tokens": 55539111.0, "step": 32015 }, { "entropy": 5.387434482574463, "epoch": 2.4912662906049405, "grad_norm": 1.1953125, "learning_rate": 0.0004374377368919396, "loss": 4.9411, "mean_token_accuracy": 0.2043435826897621, "num_tokens": 55547520.0, "step": 32020 }, { "entropy": 5.419068956375122, "epoch": 2.4916553199766582, "grad_norm": 1.125, "learning_rate": 0.00043741855786083085, "loss": 5.0649, "mean_token_accuracy": 0.18893383890390397, "num_tokens": 55557111.0, "step": 32025 }, { "entropy": 5.402033948898316, "epoch": 2.492044349348376, "grad_norm": 1.1875, "learning_rate": 0.00043739937636527894, "loss": 5.0354, "mean_token_accuracy": 0.19404893815517427, "num_tokens": 55565383.0, "step": 32030 }, { "entropy": 5.427169561386108, "epoch": 2.492433378720093, "grad_norm": 1.1640625, "learning_rate": 0.00043738019240557494, "loss": 5.0017, "mean_token_accuracy": 0.1955266773700714, "num_tokens": 55573668.0, "step": 32035 }, { "entropy": 5.41478271484375, "epoch": 2.492822408091811, "grad_norm": 1.1796875, "learning_rate": 0.00043736100598201, "loss": 5.0499, "mean_token_accuracy": 0.1939924344420433, "num_tokens": 55582716.0, "step": 32040 }, { "entropy": 5.352471017837525, "epoch": 2.4932114374635286, "grad_norm": 1.1796875, "learning_rate": 0.0004373418170948752, "loss": 4.978, "mean_token_accuracy": 0.19209808111190796, "num_tokens": 55591472.0, "step": 32045 }, { "entropy": 5.488294363021851, "epoch": 2.493600466835246, "grad_norm": 1.171875, "learning_rate": 0.0004373226257444617, "loss": 5.0378, "mean_token_accuracy": 0.19654901027679444, "num_tokens": 55600022.0, "step": 32050 }, { "entropy": 5.47860541343689, "epoch": 2.4939894962069635, "grad_norm": 1.359375, "learning_rate": 0.0004373034319310608, "loss": 5.0589, "mean_token_accuracy": 0.19150239378213882, "num_tokens": 55608854.0, "step": 32055 }, { "entropy": 5.30726809501648, "epoch": 2.4943785255786812, "grad_norm": 1.1953125, "learning_rate": 0.00043728423565496367, "loss": 5.0182, "mean_token_accuracy": 0.1950073629617691, "num_tokens": 55618246.0, "step": 32060 }, { "entropy": 5.479041004180909, "epoch": 2.494767554950399, "grad_norm": 1.25, "learning_rate": 0.0004372650369164615, "loss": 5.0715, "mean_token_accuracy": 0.1917803019285202, "num_tokens": 55626706.0, "step": 32065 }, { "entropy": 5.379968786239624, "epoch": 2.495156584322116, "grad_norm": 1.2265625, "learning_rate": 0.00043724583571584565, "loss": 4.9922, "mean_token_accuracy": 0.199569234251976, "num_tokens": 55634810.0, "step": 32070 }, { "entropy": 5.384361982345581, "epoch": 2.495545613693834, "grad_norm": 1.1796875, "learning_rate": 0.00043722663205340753, "loss": 5.117, "mean_token_accuracy": 0.18615053296089173, "num_tokens": 55643801.0, "step": 32075 }, { "entropy": 5.397097253799439, "epoch": 2.4959346430655516, "grad_norm": 1.15625, "learning_rate": 0.0004372074259294384, "loss": 5.0288, "mean_token_accuracy": 0.20048280656337739, "num_tokens": 55652236.0, "step": 32080 }, { "entropy": 5.419412422180176, "epoch": 2.496323672437269, "grad_norm": 1.1640625, "learning_rate": 0.0004371882173442299, "loss": 5.0651, "mean_token_accuracy": 0.20186380296945572, "num_tokens": 55660996.0, "step": 32085 }, { "entropy": 5.402106666564942, "epoch": 2.4967127018089865, "grad_norm": 1.203125, "learning_rate": 0.00043716900629807323, "loss": 5.0639, "mean_token_accuracy": 0.19183885008096696, "num_tokens": 55669766.0, "step": 32090 }, { "entropy": 5.387622833251953, "epoch": 2.497101731180704, "grad_norm": 1.109375, "learning_rate": 0.00043714979279126006, "loss": 5.0581, "mean_token_accuracy": 0.19885485023260116, "num_tokens": 55679179.0, "step": 32095 }, { "entropy": 5.4496582508087155, "epoch": 2.497490760552422, "grad_norm": 1.15625, "learning_rate": 0.0004371305768240818, "loss": 4.9973, "mean_token_accuracy": 0.1970147654414177, "num_tokens": 55687554.0, "step": 32100 }, { "entropy": 5.3224235534667965, "epoch": 2.497879789924139, "grad_norm": 1.1484375, "learning_rate": 0.0004371113583968302, "loss": 4.886, "mean_token_accuracy": 0.20506118088960648, "num_tokens": 55695537.0, "step": 32105 }, { "entropy": 5.408735752105713, "epoch": 2.498268819295857, "grad_norm": 1.21875, "learning_rate": 0.0004370921375097967, "loss": 5.0959, "mean_token_accuracy": 0.19134239703416825, "num_tokens": 55703432.0, "step": 32110 }, { "entropy": 5.411474752426147, "epoch": 2.4986578486675746, "grad_norm": 1.171875, "learning_rate": 0.00043707291416327307, "loss": 5.0748, "mean_token_accuracy": 0.19670649915933608, "num_tokens": 55712169.0, "step": 32115 }, { "entropy": 5.474319219589233, "epoch": 2.499046878039292, "grad_norm": 1.109375, "learning_rate": 0.0004370536883575509, "loss": 5.0769, "mean_token_accuracy": 0.19291894584894181, "num_tokens": 55720471.0, "step": 32120 }, { "entropy": 5.315148830413818, "epoch": 2.4994359074110095, "grad_norm": 1.2265625, "learning_rate": 0.0004370344600929219, "loss": 4.9496, "mean_token_accuracy": 0.19630141854286193, "num_tokens": 55729188.0, "step": 32125 }, { "entropy": 5.380610752105713, "epoch": 2.499824936782727, "grad_norm": 1.203125, "learning_rate": 0.0004370152293696779, "loss": 5.0068, "mean_token_accuracy": 0.19659818708896637, "num_tokens": 55738313.0, "step": 32130 }, { "entropy": 5.381129407882691, "epoch": 2.500213966154445, "grad_norm": 1.2109375, "learning_rate": 0.0004369959961881107, "loss": 4.9711, "mean_token_accuracy": 0.19231171756982804, "num_tokens": 55746849.0, "step": 32135 }, { "entropy": 5.379983043670654, "epoch": 2.500602995526162, "grad_norm": 1.140625, "learning_rate": 0.000436976760548512, "loss": 5.0402, "mean_token_accuracy": 0.19847173392772674, "num_tokens": 55755151.0, "step": 32140 }, { "entropy": 5.309518766403198, "epoch": 2.50099202489788, "grad_norm": 1.1015625, "learning_rate": 0.00043695752245117393, "loss": 4.928, "mean_token_accuracy": 0.20493041276931762, "num_tokens": 55763716.0, "step": 32145 }, { "entropy": 5.4080119132995605, "epoch": 2.501381054269597, "grad_norm": 1.09375, "learning_rate": 0.0004369382818963882, "loss": 5.0395, "mean_token_accuracy": 0.1925261065363884, "num_tokens": 55772424.0, "step": 32150 }, { "entropy": 5.496874141693115, "epoch": 2.501770083641315, "grad_norm": 1.15625, "learning_rate": 0.0004369190388844467, "loss": 5.1057, "mean_token_accuracy": 0.1981392502784729, "num_tokens": 55780084.0, "step": 32155 }, { "entropy": 5.373549747467041, "epoch": 2.5021591130130325, "grad_norm": 1.1171875, "learning_rate": 0.00043689979341564154, "loss": 4.9365, "mean_token_accuracy": 0.20000428557395936, "num_tokens": 55788717.0, "step": 32160 }, { "entropy": 5.375211477279663, "epoch": 2.50254814238475, "grad_norm": 1.140625, "learning_rate": 0.0004368805454902648, "loss": 4.9509, "mean_token_accuracy": 0.1992054283618927, "num_tokens": 55797166.0, "step": 32165 }, { "entropy": 5.4372090816497805, "epoch": 2.5029371717564675, "grad_norm": 1.1328125, "learning_rate": 0.00043686129510860826, "loss": 5.0585, "mean_token_accuracy": 0.1977046698331833, "num_tokens": 55805702.0, "step": 32170 }, { "entropy": 5.333179998397827, "epoch": 2.503326201128185, "grad_norm": 1.1328125, "learning_rate": 0.00043684204227096435, "loss": 4.9909, "mean_token_accuracy": 0.197385273873806, "num_tokens": 55814938.0, "step": 32175 }, { "entropy": 5.361462163925171, "epoch": 2.503715230499903, "grad_norm": 1.125, "learning_rate": 0.000436822786977625, "loss": 4.9946, "mean_token_accuracy": 0.19971792846918107, "num_tokens": 55823527.0, "step": 32180 }, { "entropy": 5.4863138675689695, "epoch": 2.50410425987162, "grad_norm": 1.28125, "learning_rate": 0.00043680352922888244, "loss": 5.0611, "mean_token_accuracy": 0.19063250571489335, "num_tokens": 55831924.0, "step": 32185 }, { "entropy": 5.367499971389771, "epoch": 2.504493289243338, "grad_norm": 1.171875, "learning_rate": 0.0004367842690250288, "loss": 4.9626, "mean_token_accuracy": 0.20445212870836257, "num_tokens": 55840799.0, "step": 32190 }, { "entropy": 5.2977509021759035, "epoch": 2.5048823186150555, "grad_norm": 1.25, "learning_rate": 0.0004367650063663565, "loss": 4.9316, "mean_token_accuracy": 0.20463903844356537, "num_tokens": 55848950.0, "step": 32195 }, { "entropy": 5.329190969467163, "epoch": 2.505271347986773, "grad_norm": 1.203125, "learning_rate": 0.0004367457412531576, "loss": 4.9736, "mean_token_accuracy": 0.2054935410618782, "num_tokens": 55857140.0, "step": 32200 }, { "entropy": 5.4136405944824215, "epoch": 2.5056603773584905, "grad_norm": 1.171875, "learning_rate": 0.0004367264736857245, "loss": 4.9846, "mean_token_accuracy": 0.19516116976737977, "num_tokens": 55865790.0, "step": 32205 }, { "entropy": 5.350301361083984, "epoch": 2.506049406730208, "grad_norm": 1.2578125, "learning_rate": 0.0004367072036643497, "loss": 4.9351, "mean_token_accuracy": 0.19605758637189866, "num_tokens": 55873598.0, "step": 32210 }, { "entropy": 5.324070405960083, "epoch": 2.506438436101926, "grad_norm": 1.1796875, "learning_rate": 0.00043668793118932536, "loss": 5.0801, "mean_token_accuracy": 0.19455282986164094, "num_tokens": 55882172.0, "step": 32215 }, { "entropy": 5.35164442062378, "epoch": 2.506827465473643, "grad_norm": 1.1640625, "learning_rate": 0.00043666865626094405, "loss": 4.9553, "mean_token_accuracy": 0.1988823965191841, "num_tokens": 55890701.0, "step": 32220 }, { "entropy": 5.479476690292358, "epoch": 2.507216494845361, "grad_norm": 1.1796875, "learning_rate": 0.00043664937887949825, "loss": 5.0716, "mean_token_accuracy": 0.1848250225186348, "num_tokens": 55899470.0, "step": 32225 }, { "entropy": 5.378156614303589, "epoch": 2.5076055242170785, "grad_norm": 1.2734375, "learning_rate": 0.0004366300990452803, "loss": 4.9875, "mean_token_accuracy": 0.1949670895934105, "num_tokens": 55907442.0, "step": 32230 }, { "entropy": 5.369243001937866, "epoch": 2.507994553588796, "grad_norm": 1.2109375, "learning_rate": 0.00043661081675858295, "loss": 5.0058, "mean_token_accuracy": 0.19026459604501725, "num_tokens": 55915761.0, "step": 32235 }, { "entropy": 5.365401411056519, "epoch": 2.5083835829605134, "grad_norm": 1.2265625, "learning_rate": 0.00043659153201969865, "loss": 4.9861, "mean_token_accuracy": 0.20049808770418168, "num_tokens": 55924101.0, "step": 32240 }, { "entropy": 5.475956821441651, "epoch": 2.508772612332231, "grad_norm": 1.171875, "learning_rate": 0.0004365722448289201, "loss": 5.1217, "mean_token_accuracy": 0.18209327459335328, "num_tokens": 55933472.0, "step": 32245 }, { "entropy": 5.374709606170654, "epoch": 2.5091616417039484, "grad_norm": 1.1171875, "learning_rate": 0.0004365529551865399, "loss": 4.9875, "mean_token_accuracy": 0.19523807466030121, "num_tokens": 55941962.0, "step": 32250 }, { "entropy": 5.3876111030578615, "epoch": 2.509550671075666, "grad_norm": 1.09375, "learning_rate": 0.00043653366309285066, "loss": 5.0236, "mean_token_accuracy": 0.19339352250099182, "num_tokens": 55951392.0, "step": 32255 }, { "entropy": 5.405840539932251, "epoch": 2.509939700447384, "grad_norm": 1.1953125, "learning_rate": 0.0004365143685481452, "loss": 4.9861, "mean_token_accuracy": 0.19456800520420076, "num_tokens": 55959995.0, "step": 32260 }, { "entropy": 5.353262615203858, "epoch": 2.5103287298191015, "grad_norm": 1.234375, "learning_rate": 0.0004364950715527164, "loss": 4.9478, "mean_token_accuracy": 0.19543107748031616, "num_tokens": 55967960.0, "step": 32265 }, { "entropy": 5.41112871170044, "epoch": 2.5107177591908187, "grad_norm": 1.125, "learning_rate": 0.0004364757721068568, "loss": 5.0239, "mean_token_accuracy": 0.19811365455389024, "num_tokens": 55976620.0, "step": 32270 }, { "entropy": 5.363190317153931, "epoch": 2.5111067885625364, "grad_norm": 1.125, "learning_rate": 0.00043645647021085945, "loss": 4.9825, "mean_token_accuracy": 0.19481093883514405, "num_tokens": 55985478.0, "step": 32275 }, { "entropy": 5.39055061340332, "epoch": 2.511495817934254, "grad_norm": 1.09375, "learning_rate": 0.00043643716586501706, "loss": 4.9679, "mean_token_accuracy": 0.19641793072223662, "num_tokens": 55994123.0, "step": 32280 }, { "entropy": 5.374627923965454, "epoch": 2.5118848473059714, "grad_norm": 1.109375, "learning_rate": 0.00043641785906962276, "loss": 5.0407, "mean_token_accuracy": 0.19278645068407058, "num_tokens": 56003088.0, "step": 32285 }, { "entropy": 5.314338684082031, "epoch": 2.512273876677689, "grad_norm": 1.140625, "learning_rate": 0.0004363985498249693, "loss": 4.9346, "mean_token_accuracy": 0.20161727219820022, "num_tokens": 56011349.0, "step": 32290 }, { "entropy": 5.378583097457886, "epoch": 2.512662906049407, "grad_norm": 1.1640625, "learning_rate": 0.00043637923813134974, "loss": 4.9037, "mean_token_accuracy": 0.2030582159757614, "num_tokens": 56020225.0, "step": 32295 }, { "entropy": 5.459575176239014, "epoch": 2.5130519354211245, "grad_norm": 1.296875, "learning_rate": 0.00043635992398905713, "loss": 5.0323, "mean_token_accuracy": 0.19823600649833678, "num_tokens": 56028729.0, "step": 32300 }, { "entropy": 5.353182315826416, "epoch": 2.5134409647928417, "grad_norm": 1.140625, "learning_rate": 0.0004363406073983844, "loss": 5.003, "mean_token_accuracy": 0.19163133203983307, "num_tokens": 56037173.0, "step": 32305 }, { "entropy": 5.364936685562133, "epoch": 2.5138299941645594, "grad_norm": 1.0859375, "learning_rate": 0.00043632128835962485, "loss": 5.0637, "mean_token_accuracy": 0.19085622429847718, "num_tokens": 56046013.0, "step": 32310 }, { "entropy": 5.4796045303344725, "epoch": 2.514219023536277, "grad_norm": 1.1875, "learning_rate": 0.00043630196687307156, "loss": 5.1, "mean_token_accuracy": 0.19091798663139342, "num_tokens": 56054942.0, "step": 32315 }, { "entropy": 5.482224082946777, "epoch": 2.5146080529079944, "grad_norm": 1.1171875, "learning_rate": 0.0004362826429390176, "loss": 5.1137, "mean_token_accuracy": 0.18429044783115386, "num_tokens": 56064033.0, "step": 32320 }, { "entropy": 5.388293027877808, "epoch": 2.514997082279712, "grad_norm": 1.140625, "learning_rate": 0.00043626331655775624, "loss": 5.0537, "mean_token_accuracy": 0.19777873903512955, "num_tokens": 56072534.0, "step": 32325 }, { "entropy": 5.363391733169555, "epoch": 2.51538611165143, "grad_norm": 1.109375, "learning_rate": 0.00043624398772958075, "loss": 4.9514, "mean_token_accuracy": 0.19831036925315856, "num_tokens": 56081742.0, "step": 32330 }, { "entropy": 5.383007955551148, "epoch": 2.5157751410231475, "grad_norm": 1.1328125, "learning_rate": 0.0004362246564547844, "loss": 4.9473, "mean_token_accuracy": 0.20103092044591903, "num_tokens": 56090659.0, "step": 32335 }, { "entropy": 5.368412685394287, "epoch": 2.5161641703948647, "grad_norm": 1.1796875, "learning_rate": 0.00043620532273366044, "loss": 4.9989, "mean_token_accuracy": 0.19000377058982848, "num_tokens": 56099795.0, "step": 32340 }, { "entropy": 5.32804012298584, "epoch": 2.5165531997665824, "grad_norm": 1.1640625, "learning_rate": 0.0004361859865665024, "loss": 5.0158, "mean_token_accuracy": 0.19625585228204728, "num_tokens": 56107265.0, "step": 32345 }, { "entropy": 5.363792037963867, "epoch": 2.5169422291382997, "grad_norm": 1.125, "learning_rate": 0.00043616664795360346, "loss": 4.975, "mean_token_accuracy": 0.20111559927463532, "num_tokens": 56116434.0, "step": 32350 }, { "entropy": 5.417178106307984, "epoch": 2.5173312585100174, "grad_norm": 1.171875, "learning_rate": 0.00043614730689525716, "loss": 5.1034, "mean_token_accuracy": 0.18328833431005478, "num_tokens": 56125356.0, "step": 32355 }, { "entropy": 5.500271654129028, "epoch": 2.517720287881735, "grad_norm": 1.1796875, "learning_rate": 0.00043612796339175707, "loss": 5.1374, "mean_token_accuracy": 0.18579833209514618, "num_tokens": 56133732.0, "step": 32360 }, { "entropy": 5.434199523925781, "epoch": 2.5181093172534528, "grad_norm": 1.2265625, "learning_rate": 0.00043610861744339653, "loss": 4.991, "mean_token_accuracy": 0.19995840340852739, "num_tokens": 56142037.0, "step": 32365 }, { "entropy": 5.463851022720337, "epoch": 2.5184983466251705, "grad_norm": 1.234375, "learning_rate": 0.0004360892690504692, "loss": 5.0214, "mean_token_accuracy": 0.1966513529419899, "num_tokens": 56151064.0, "step": 32370 }, { "entropy": 5.403643846511841, "epoch": 2.5188873759968877, "grad_norm": 1.109375, "learning_rate": 0.0004360699182132685, "loss": 4.978, "mean_token_accuracy": 0.1986454263329506, "num_tokens": 56159617.0, "step": 32375 }, { "entropy": 5.381380319595337, "epoch": 2.5192764053686054, "grad_norm": 1.1796875, "learning_rate": 0.00043605056493208825, "loss": 4.9986, "mean_token_accuracy": 0.19302793592214584, "num_tokens": 56168941.0, "step": 32380 }, { "entropy": 5.426887512207031, "epoch": 2.5196654347403227, "grad_norm": 1.15625, "learning_rate": 0.000436031209207222, "loss": 4.9638, "mean_token_accuracy": 0.2005198448896408, "num_tokens": 56177321.0, "step": 32385 }, { "entropy": 5.407274866104126, "epoch": 2.5200544641120404, "grad_norm": 1.125, "learning_rate": 0.00043601185103896346, "loss": 5.0363, "mean_token_accuracy": 0.191109699010849, "num_tokens": 56185775.0, "step": 32390 }, { "entropy": 5.337054586410522, "epoch": 2.520443493483758, "grad_norm": 1.1484375, "learning_rate": 0.00043599249042760636, "loss": 5.0499, "mean_token_accuracy": 0.19688768088817596, "num_tokens": 56194949.0, "step": 32395 }, { "entropy": 5.3785394668579105, "epoch": 2.5208325228554758, "grad_norm": 1.1484375, "learning_rate": 0.00043597312737344446, "loss": 4.9498, "mean_token_accuracy": 0.19493609964847564, "num_tokens": 56203314.0, "step": 32400 }, { "entropy": 5.336468696594238, "epoch": 2.521221552227193, "grad_norm": 1.1171875, "learning_rate": 0.00043595376187677157, "loss": 5.0059, "mean_token_accuracy": 0.19823409765958785, "num_tokens": 56211857.0, "step": 32405 }, { "entropy": 5.396268224716186, "epoch": 2.5216105815989107, "grad_norm": 1.09375, "learning_rate": 0.00043593439393788147, "loss": 5.0012, "mean_token_accuracy": 0.19800431430339813, "num_tokens": 56220331.0, "step": 32410 }, { "entropy": 5.389956903457642, "epoch": 2.5219996109706284, "grad_norm": 1.1953125, "learning_rate": 0.0004359150235570682, "loss": 5.0055, "mean_token_accuracy": 0.19728570878505708, "num_tokens": 56228623.0, "step": 32415 }, { "entropy": 5.310672092437744, "epoch": 2.5223886403423457, "grad_norm": 1.2109375, "learning_rate": 0.0004358956507346255, "loss": 4.9028, "mean_token_accuracy": 0.2062796860933304, "num_tokens": 56237028.0, "step": 32420 }, { "entropy": 5.364142417907715, "epoch": 2.5227776697140634, "grad_norm": 1.234375, "learning_rate": 0.0004358762754708474, "loss": 4.9567, "mean_token_accuracy": 0.19958708584308624, "num_tokens": 56244955.0, "step": 32425 }, { "entropy": 5.335987329483032, "epoch": 2.523166699085781, "grad_norm": 1.1875, "learning_rate": 0.00043585689776602795, "loss": 4.9844, "mean_token_accuracy": 0.19856718331575393, "num_tokens": 56254020.0, "step": 32430 }, { "entropy": 5.39691309928894, "epoch": 2.5235557284574988, "grad_norm": 1.140625, "learning_rate": 0.00043583751762046104, "loss": 5.0372, "mean_token_accuracy": 0.19404468238353728, "num_tokens": 56262829.0, "step": 32435 }, { "entropy": 5.426384305953979, "epoch": 2.523944757829216, "grad_norm": 1.140625, "learning_rate": 0.0004358181350344408, "loss": 5.0093, "mean_token_accuracy": 0.20217810869216918, "num_tokens": 56271289.0, "step": 32440 }, { "entropy": 5.306826591491699, "epoch": 2.5243337872009337, "grad_norm": 1.1484375, "learning_rate": 0.0004357987500082613, "loss": 4.9332, "mean_token_accuracy": 0.20542809665203093, "num_tokens": 56279701.0, "step": 32445 }, { "entropy": 5.4275970458984375, "epoch": 2.524722816572651, "grad_norm": 1.125, "learning_rate": 0.00043577936254221675, "loss": 4.9548, "mean_token_accuracy": 0.2007301613688469, "num_tokens": 56288373.0, "step": 32450 }, { "entropy": 5.40239372253418, "epoch": 2.5251118459443687, "grad_norm": 1.09375, "learning_rate": 0.0004357599726366013, "loss": 4.998, "mean_token_accuracy": 0.19390948861837387, "num_tokens": 56297853.0, "step": 32455 }, { "entropy": 5.447829151153565, "epoch": 2.5255008753160864, "grad_norm": 1.2109375, "learning_rate": 0.0004357405802917091, "loss": 5.1447, "mean_token_accuracy": 0.18836611658334732, "num_tokens": 56306456.0, "step": 32460 }, { "entropy": 5.366394472122193, "epoch": 2.525889904687804, "grad_norm": 1.1015625, "learning_rate": 0.0004357211855078345, "loss": 4.8926, "mean_token_accuracy": 0.19851909726858138, "num_tokens": 56314420.0, "step": 32465 }, { "entropy": 5.393977642059326, "epoch": 2.5262789340595218, "grad_norm": 1.15625, "learning_rate": 0.00043570178828527157, "loss": 5.0811, "mean_token_accuracy": 0.18705134838819504, "num_tokens": 56324011.0, "step": 32470 }, { "entropy": 5.342649936676025, "epoch": 2.526667963431239, "grad_norm": 1.1796875, "learning_rate": 0.0004356823886243149, "loss": 4.958, "mean_token_accuracy": 0.20071180760860444, "num_tokens": 56332830.0, "step": 32475 }, { "entropy": 5.440405035018921, "epoch": 2.5270569928029567, "grad_norm": 1.2421875, "learning_rate": 0.00043566298652525875, "loss": 5.0282, "mean_token_accuracy": 0.19704444110393524, "num_tokens": 56341486.0, "step": 32480 }, { "entropy": 5.409482479095459, "epoch": 2.527446022174674, "grad_norm": 1.109375, "learning_rate": 0.00043564358198839746, "loss": 5.0196, "mean_token_accuracy": 0.19949520379304886, "num_tokens": 56349382.0, "step": 32485 }, { "entropy": 5.407753324508667, "epoch": 2.5278350515463917, "grad_norm": 1.109375, "learning_rate": 0.0004356241750140256, "loss": 5.0704, "mean_token_accuracy": 0.19491202682256697, "num_tokens": 56358335.0, "step": 32490 }, { "entropy": 5.463453960418701, "epoch": 2.5282240809181094, "grad_norm": 1.21875, "learning_rate": 0.00043560476560243743, "loss": 5.0704, "mean_token_accuracy": 0.19193231910467148, "num_tokens": 56366777.0, "step": 32495 }, { "entropy": 5.464003419876098, "epoch": 2.528613110289827, "grad_norm": 1.1796875, "learning_rate": 0.0004355853537539276, "loss": 5.0714, "mean_token_accuracy": 0.19671618938446045, "num_tokens": 56375175.0, "step": 32500 }, { "entropy": 5.302193117141724, "epoch": 2.5290021396615443, "grad_norm": 1.109375, "learning_rate": 0.0004355659394687906, "loss": 4.9836, "mean_token_accuracy": 0.19429001063108445, "num_tokens": 56384442.0, "step": 32505 }, { "entropy": 5.422477340698242, "epoch": 2.529391169033262, "grad_norm": 1.1640625, "learning_rate": 0.0004355465227473211, "loss": 5.0555, "mean_token_accuracy": 0.18986300230026246, "num_tokens": 56392420.0, "step": 32510 }, { "entropy": 5.41943941116333, "epoch": 2.5297801984049797, "grad_norm": 1.1328125, "learning_rate": 0.0004355271035898136, "loss": 5.0809, "mean_token_accuracy": 0.19782855808734895, "num_tokens": 56400633.0, "step": 32515 }, { "entropy": 5.38399305343628, "epoch": 2.530169227776697, "grad_norm": 1.171875, "learning_rate": 0.0004355076819965628, "loss": 4.9798, "mean_token_accuracy": 0.19667167216539383, "num_tokens": 56409606.0, "step": 32520 }, { "entropy": 5.406248712539673, "epoch": 2.5305582571484146, "grad_norm": 1.09375, "learning_rate": 0.00043548825796786353, "loss": 5.0245, "mean_token_accuracy": 0.20279947072267532, "num_tokens": 56417724.0, "step": 32525 }, { "entropy": 5.396423625946045, "epoch": 2.5309472865201323, "grad_norm": 1.1875, "learning_rate": 0.00043546883150401023, "loss": 5.0015, "mean_token_accuracy": 0.19793458729982377, "num_tokens": 56426632.0, "step": 32530 }, { "entropy": 5.348414611816406, "epoch": 2.53133631589185, "grad_norm": 1.15625, "learning_rate": 0.00043544940260529787, "loss": 4.9335, "mean_token_accuracy": 0.19994964003562926, "num_tokens": 56435266.0, "step": 32535 }, { "entropy": 5.452577590942383, "epoch": 2.5317253452635673, "grad_norm": 1.171875, "learning_rate": 0.0004354299712720213, "loss": 5.0483, "mean_token_accuracy": 0.1944741725921631, "num_tokens": 56443335.0, "step": 32540 }, { "entropy": 5.415429401397705, "epoch": 2.532114374635285, "grad_norm": 1.203125, "learning_rate": 0.0004354105375044752, "loss": 5.0079, "mean_token_accuracy": 0.2014174073934555, "num_tokens": 56452657.0, "step": 32545 }, { "entropy": 5.414242315292358, "epoch": 2.5325034040070027, "grad_norm": 1.1484375, "learning_rate": 0.00043539110130295445, "loss": 5.0888, "mean_token_accuracy": 0.19432550221681594, "num_tokens": 56461925.0, "step": 32550 }, { "entropy": 5.39635534286499, "epoch": 2.53289243337872, "grad_norm": 1.1484375, "learning_rate": 0.00043537166266775405, "loss": 4.9974, "mean_token_accuracy": 0.20099618285894394, "num_tokens": 56470356.0, "step": 32555 }, { "entropy": 5.385881185531616, "epoch": 2.5332814627504376, "grad_norm": 1.234375, "learning_rate": 0.000435352221599169, "loss": 5.0535, "mean_token_accuracy": 0.19082618355751038, "num_tokens": 56478754.0, "step": 32560 }, { "entropy": 5.408781290054321, "epoch": 2.5336704921221553, "grad_norm": 1.203125, "learning_rate": 0.0004353327780974941, "loss": 4.9916, "mean_token_accuracy": 0.1979315087199211, "num_tokens": 56487089.0, "step": 32565 }, { "entropy": 5.419483232498169, "epoch": 2.534059521493873, "grad_norm": 1.1328125, "learning_rate": 0.0004353133321630246, "loss": 5.0163, "mean_token_accuracy": 0.1932085156440735, "num_tokens": 56496416.0, "step": 32570 }, { "entropy": 5.31560788154602, "epoch": 2.5344485508655903, "grad_norm": 1.140625, "learning_rate": 0.0004352938837960554, "loss": 5.0124, "mean_token_accuracy": 0.19460261315107347, "num_tokens": 56505675.0, "step": 32575 }, { "entropy": 5.415780258178711, "epoch": 2.534837580237308, "grad_norm": 1.125, "learning_rate": 0.00043527443299688166, "loss": 5.0224, "mean_token_accuracy": 0.19545642882585526, "num_tokens": 56514855.0, "step": 32580 }, { "entropy": 5.514229440689087, "epoch": 2.5352266096090252, "grad_norm": 1.109375, "learning_rate": 0.00043525497976579843, "loss": 5.1121, "mean_token_accuracy": 0.18686698228120804, "num_tokens": 56524073.0, "step": 32585 }, { "entropy": 5.436513948440552, "epoch": 2.535615638980743, "grad_norm": 1.0703125, "learning_rate": 0.000435235524103101, "loss": 5.0518, "mean_token_accuracy": 0.195856511592865, "num_tokens": 56534127.0, "step": 32590 }, { "entropy": 5.522740650177002, "epoch": 2.5360046683524606, "grad_norm": 1.1796875, "learning_rate": 0.0004352160660090846, "loss": 5.1311, "mean_token_accuracy": 0.18736134320497513, "num_tokens": 56543219.0, "step": 32595 }, { "entropy": 5.448683834075927, "epoch": 2.5363936977241783, "grad_norm": 1.1796875, "learning_rate": 0.0004351966054840443, "loss": 5.0834, "mean_token_accuracy": 0.19782322347164155, "num_tokens": 56552146.0, "step": 32600 }, { "entropy": 5.457414627075195, "epoch": 2.5367827270958956, "grad_norm": 1.1796875, "learning_rate": 0.00043517714252827556, "loss": 5.1384, "mean_token_accuracy": 0.18486394435167314, "num_tokens": 56561780.0, "step": 32605 }, { "entropy": 5.37010498046875, "epoch": 2.5371717564676133, "grad_norm": 1.1171875, "learning_rate": 0.0004351576771420737, "loss": 4.944, "mean_token_accuracy": 0.19819338321685792, "num_tokens": 56569864.0, "step": 32610 }, { "entropy": 5.479020404815674, "epoch": 2.537560785839331, "grad_norm": 1.1640625, "learning_rate": 0.0004351382093257339, "loss": 5.124, "mean_token_accuracy": 0.18459818959236146, "num_tokens": 56578506.0, "step": 32615 }, { "entropy": 5.457563018798828, "epoch": 2.5379498152110482, "grad_norm": 1.140625, "learning_rate": 0.0004351187390795517, "loss": 5.0448, "mean_token_accuracy": 0.19855828434228898, "num_tokens": 56587264.0, "step": 32620 }, { "entropy": 5.396497774124145, "epoch": 2.538338844582766, "grad_norm": 1.171875, "learning_rate": 0.00043509926640382244, "loss": 4.9256, "mean_token_accuracy": 0.20001353621482848, "num_tokens": 56595779.0, "step": 32625 }, { "entropy": 5.33933391571045, "epoch": 2.5387278739544836, "grad_norm": 1.1953125, "learning_rate": 0.0004350797912988417, "loss": 4.9563, "mean_token_accuracy": 0.19855376332998276, "num_tokens": 56604251.0, "step": 32630 }, { "entropy": 5.318504428863525, "epoch": 2.5391169033262013, "grad_norm": 1.171875, "learning_rate": 0.0004350603137649049, "loss": 4.9722, "mean_token_accuracy": 0.19659413546323776, "num_tokens": 56612527.0, "step": 32635 }, { "entropy": 5.423489713668824, "epoch": 2.5395059326979186, "grad_norm": 1.203125, "learning_rate": 0.0004350408338023075, "loss": 5.014, "mean_token_accuracy": 0.19397053867578506, "num_tokens": 56621139.0, "step": 32640 }, { "entropy": 5.401403522491455, "epoch": 2.5398949620696363, "grad_norm": 1.171875, "learning_rate": 0.0004350213514113453, "loss": 4.9743, "mean_token_accuracy": 0.19930481016635895, "num_tokens": 56629757.0, "step": 32645 }, { "entropy": 5.312555932998658, "epoch": 2.540283991441354, "grad_norm": 1.1328125, "learning_rate": 0.00043500186659231377, "loss": 4.9156, "mean_token_accuracy": 0.20199532210826873, "num_tokens": 56638518.0, "step": 32650 }, { "entropy": 5.336606359481811, "epoch": 2.5406730208130712, "grad_norm": 1.1640625, "learning_rate": 0.0004349823793455086, "loss": 5.0118, "mean_token_accuracy": 0.18905456513166427, "num_tokens": 56647542.0, "step": 32655 }, { "entropy": 5.42414813041687, "epoch": 2.541062050184789, "grad_norm": 1.1796875, "learning_rate": 0.00043496288967122547, "loss": 4.9969, "mean_token_accuracy": 0.1935635358095169, "num_tokens": 56655771.0, "step": 32660 }, { "entropy": 5.309195566177368, "epoch": 2.5414510795565066, "grad_norm": 1.1640625, "learning_rate": 0.00043494339756976007, "loss": 4.9366, "mean_token_accuracy": 0.2066170781850815, "num_tokens": 56663895.0, "step": 32665 }, { "entropy": 5.333622121810913, "epoch": 2.5418401089282243, "grad_norm": 1.1640625, "learning_rate": 0.0004349239030414082, "loss": 5.0061, "mean_token_accuracy": 0.19302317202091218, "num_tokens": 56672557.0, "step": 32670 }, { "entropy": 5.4179261207580565, "epoch": 2.5422291382999416, "grad_norm": 1.1875, "learning_rate": 0.00043490440608646557, "loss": 5.0766, "mean_token_accuracy": 0.19722854495048522, "num_tokens": 56681095.0, "step": 32675 }, { "entropy": 5.4278827667236325, "epoch": 2.5426181676716593, "grad_norm": 1.1796875, "learning_rate": 0.00043488490670522817, "loss": 5.0723, "mean_token_accuracy": 0.1944474071264267, "num_tokens": 56689347.0, "step": 32680 }, { "entropy": 5.348727130889893, "epoch": 2.5430071970433765, "grad_norm": 1.109375, "learning_rate": 0.0004348654048979918, "loss": 4.9644, "mean_token_accuracy": 0.19775613397359848, "num_tokens": 56698348.0, "step": 32685 }, { "entropy": 5.398197317123413, "epoch": 2.543396226415094, "grad_norm": 1.109375, "learning_rate": 0.0004348459006650523, "loss": 5.0506, "mean_token_accuracy": 0.19802492558956147, "num_tokens": 56707215.0, "step": 32690 }, { "entropy": 5.407253074645996, "epoch": 2.543785255786812, "grad_norm": 1.125, "learning_rate": 0.00043482639400670576, "loss": 5.0713, "mean_token_accuracy": 0.1932977095246315, "num_tokens": 56716190.0, "step": 32695 }, { "entropy": 5.407024383544922, "epoch": 2.5441742851585296, "grad_norm": 1.140625, "learning_rate": 0.000434806884923248, "loss": 4.9545, "mean_token_accuracy": 0.20242834240198135, "num_tokens": 56724494.0, "step": 32700 }, { "entropy": 5.4086089611053465, "epoch": 2.5445633145302473, "grad_norm": 1.1484375, "learning_rate": 0.0004347873734149752, "loss": 4.9587, "mean_token_accuracy": 0.2055629700422287, "num_tokens": 56732648.0, "step": 32705 }, { "entropy": 5.498168420791626, "epoch": 2.5449523439019646, "grad_norm": 1.1640625, "learning_rate": 0.00043476785948218325, "loss": 5.2152, "mean_token_accuracy": 0.18798192143440245, "num_tokens": 56742270.0, "step": 32710 }, { "entropy": 5.420835733413696, "epoch": 2.5453413732736823, "grad_norm": 1.140625, "learning_rate": 0.00043474834312516835, "loss": 4.9927, "mean_token_accuracy": 0.19400714486837387, "num_tokens": 56750982.0, "step": 32715 }, { "entropy": 5.33693528175354, "epoch": 2.5457304026453995, "grad_norm": 1.1484375, "learning_rate": 0.0004347288243442266, "loss": 4.9251, "mean_token_accuracy": 0.20153277218341828, "num_tokens": 56759443.0, "step": 32720 }, { "entropy": 5.45634708404541, "epoch": 2.546119432017117, "grad_norm": 1.140625, "learning_rate": 0.0004347093031396543, "loss": 5.029, "mean_token_accuracy": 0.19521800577640533, "num_tokens": 56768704.0, "step": 32725 }, { "entropy": 5.404246711730957, "epoch": 2.546508461388835, "grad_norm": 1.2109375, "learning_rate": 0.0004346897795117474, "loss": 5.0473, "mean_token_accuracy": 0.1997896119952202, "num_tokens": 56777274.0, "step": 32730 }, { "entropy": 5.434302425384521, "epoch": 2.5468974907605526, "grad_norm": 1.1796875, "learning_rate": 0.0004346702534608023, "loss": 5.0352, "mean_token_accuracy": 0.1949635699391365, "num_tokens": 56786184.0, "step": 32735 }, { "entropy": 5.350253343582153, "epoch": 2.54728652013227, "grad_norm": 1.1328125, "learning_rate": 0.0004346507249871153, "loss": 5.0433, "mean_token_accuracy": 0.19283165484666825, "num_tokens": 56795156.0, "step": 32740 }, { "entropy": 5.444284915924072, "epoch": 2.5476755495039876, "grad_norm": 1.140625, "learning_rate": 0.0004346311940909826, "loss": 5.0543, "mean_token_accuracy": 0.19348152130842208, "num_tokens": 56803829.0, "step": 32745 }, { "entropy": 5.408627128601074, "epoch": 2.5480645788757053, "grad_norm": 1.109375, "learning_rate": 0.00043461166077270056, "loss": 5.0102, "mean_token_accuracy": 0.20693886131048203, "num_tokens": 56813191.0, "step": 32750 }, { "entropy": 5.405750036239624, "epoch": 2.5484536082474225, "grad_norm": 1.125, "learning_rate": 0.00043459212503256566, "loss": 5.0598, "mean_token_accuracy": 0.19557723999023438, "num_tokens": 56822338.0, "step": 32755 }, { "entropy": 5.428199291229248, "epoch": 2.54884263761914, "grad_norm": 1.1015625, "learning_rate": 0.0004345725868708743, "loss": 5.0052, "mean_token_accuracy": 0.19502134174108504, "num_tokens": 56830873.0, "step": 32760 }, { "entropy": 5.382936096191406, "epoch": 2.549231666990858, "grad_norm": 1.125, "learning_rate": 0.00043455304628792294, "loss": 4.9579, "mean_token_accuracy": 0.19868134111166, "num_tokens": 56839462.0, "step": 32765 }, { "entropy": 5.517848968505859, "epoch": 2.5496206963625756, "grad_norm": 1.1796875, "learning_rate": 0.000434533503284008, "loss": 5.0456, "mean_token_accuracy": 0.1939234256744385, "num_tokens": 56847713.0, "step": 32770 }, { "entropy": 5.450197696685791, "epoch": 2.550009725734293, "grad_norm": 1.140625, "learning_rate": 0.0004345139578594261, "loss": 4.9474, "mean_token_accuracy": 0.20427315235137938, "num_tokens": 56856507.0, "step": 32775 }, { "entropy": 5.358585357666016, "epoch": 2.5503987551060106, "grad_norm": 1.2578125, "learning_rate": 0.0004344944100144738, "loss": 5.0707, "mean_token_accuracy": 0.19834039956331254, "num_tokens": 56864772.0, "step": 32780 }, { "entropy": 5.434321546554566, "epoch": 2.550787784477728, "grad_norm": 1.1875, "learning_rate": 0.00043447485974944765, "loss": 5.0417, "mean_token_accuracy": 0.1862793430685997, "num_tokens": 56872886.0, "step": 32785 }, { "entropy": 5.396774673461914, "epoch": 2.5511768138494455, "grad_norm": 1.1796875, "learning_rate": 0.00043445530706464437, "loss": 5.0074, "mean_token_accuracy": 0.1932521790266037, "num_tokens": 56882079.0, "step": 32790 }, { "entropy": 5.376486110687256, "epoch": 2.551565843221163, "grad_norm": 1.234375, "learning_rate": 0.0004344357519603606, "loss": 4.9631, "mean_token_accuracy": 0.1986935555934906, "num_tokens": 56890237.0, "step": 32795 }, { "entropy": 5.492238998413086, "epoch": 2.551954872592881, "grad_norm": 1.109375, "learning_rate": 0.0004344161944368931, "loss": 5.0525, "mean_token_accuracy": 0.18952853828668595, "num_tokens": 56898703.0, "step": 32800 }, { "entropy": 5.4621562480926515, "epoch": 2.5523439019645986, "grad_norm": 1.171875, "learning_rate": 0.0004343966344945385, "loss": 5.1228, "mean_token_accuracy": 0.19284837543964387, "num_tokens": 56907954.0, "step": 32805 }, { "entropy": 5.2630205154418945, "epoch": 2.552732931336316, "grad_norm": 1.15625, "learning_rate": 0.00043437707213359375, "loss": 4.8672, "mean_token_accuracy": 0.20343452841043472, "num_tokens": 56916316.0, "step": 32810 }, { "entropy": 5.339161109924317, "epoch": 2.5531219607080335, "grad_norm": 1.171875, "learning_rate": 0.00043435750735435554, "loss": 4.9479, "mean_token_accuracy": 0.20337121188640594, "num_tokens": 56924386.0, "step": 32815 }, { "entropy": 5.450483703613282, "epoch": 2.553510990079751, "grad_norm": 1.125, "learning_rate": 0.00043433794015712085, "loss": 5.0234, "mean_token_accuracy": 0.20420075803995133, "num_tokens": 56932782.0, "step": 32820 }, { "entropy": 5.365355920791626, "epoch": 2.5539000194514685, "grad_norm": 1.171875, "learning_rate": 0.0004343183705421865, "loss": 4.9564, "mean_token_accuracy": 0.20117889940738679, "num_tokens": 56941030.0, "step": 32825 }, { "entropy": 5.54454402923584, "epoch": 2.554289048823186, "grad_norm": 1.1796875, "learning_rate": 0.0004342987985098495, "loss": 5.2103, "mean_token_accuracy": 0.18563813269138335, "num_tokens": 56949525.0, "step": 32830 }, { "entropy": 5.361660051345825, "epoch": 2.554678078194904, "grad_norm": 1.140625, "learning_rate": 0.00043427922406040676, "loss": 4.9559, "mean_token_accuracy": 0.19782355427742004, "num_tokens": 56958317.0, "step": 32835 }, { "entropy": 5.36912431716919, "epoch": 2.555067107566621, "grad_norm": 1.1484375, "learning_rate": 0.00043425964719415525, "loss": 5.0263, "mean_token_accuracy": 0.20390138328075408, "num_tokens": 56966848.0, "step": 32840 }, { "entropy": 5.482934093475341, "epoch": 2.555456136938339, "grad_norm": 1.2421875, "learning_rate": 0.00043424006791139213, "loss": 5.0955, "mean_token_accuracy": 0.18911695927381517, "num_tokens": 56975448.0, "step": 32845 }, { "entropy": 5.442656755447388, "epoch": 2.5558451663100565, "grad_norm": 1.1953125, "learning_rate": 0.00043422048621241443, "loss": 5.1118, "mean_token_accuracy": 0.19205926209688187, "num_tokens": 56983800.0, "step": 32850 }, { "entropy": 5.452989196777343, "epoch": 2.556234195681774, "grad_norm": 1.125, "learning_rate": 0.00043420090209751933, "loss": 5.0402, "mean_token_accuracy": 0.19671180695295334, "num_tokens": 56992505.0, "step": 32855 }, { "entropy": 5.42435998916626, "epoch": 2.5566232250534915, "grad_norm": 1.234375, "learning_rate": 0.0004341813155670039, "loss": 4.9349, "mean_token_accuracy": 0.20290036350488663, "num_tokens": 57000471.0, "step": 32860 }, { "entropy": 5.4749256610870365, "epoch": 2.557012254425209, "grad_norm": 1.2265625, "learning_rate": 0.0004341617266211654, "loss": 5.0124, "mean_token_accuracy": 0.19197063893079758, "num_tokens": 57008708.0, "step": 32865 }, { "entropy": 5.464524507522583, "epoch": 2.557401283796927, "grad_norm": 1.1484375, "learning_rate": 0.000434142135260301, "loss": 5.116, "mean_token_accuracy": 0.19214038103818892, "num_tokens": 57017395.0, "step": 32870 }, { "entropy": 5.459582424163818, "epoch": 2.557790313168644, "grad_norm": 1.1484375, "learning_rate": 0.000434122541484708, "loss": 4.9621, "mean_token_accuracy": 0.19185912758111953, "num_tokens": 57025535.0, "step": 32875 }, { "entropy": 5.401855564117431, "epoch": 2.558179342540362, "grad_norm": 1.15625, "learning_rate": 0.0004341029452946837, "loss": 4.9664, "mean_token_accuracy": 0.19888245910406113, "num_tokens": 57034029.0, "step": 32880 }, { "entropy": 5.385588788986206, "epoch": 2.558568371912079, "grad_norm": 1.125, "learning_rate": 0.0004340833466905254, "loss": 5.0896, "mean_token_accuracy": 0.19344945400953292, "num_tokens": 57042779.0, "step": 32885 }, { "entropy": 5.443098163604736, "epoch": 2.558957401283797, "grad_norm": 1.1015625, "learning_rate": 0.00043406374567253055, "loss": 5.053, "mean_token_accuracy": 0.19101290851831437, "num_tokens": 57052506.0, "step": 32890 }, { "entropy": 5.492218160629273, "epoch": 2.5593464306555145, "grad_norm": 1.140625, "learning_rate": 0.0004340441422409965, "loss": 5.0858, "mean_token_accuracy": 0.1901238054037094, "num_tokens": 57061307.0, "step": 32895 }, { "entropy": 5.430581760406494, "epoch": 2.559735460027232, "grad_norm": 1.1640625, "learning_rate": 0.0004340245363962209, "loss": 5.0931, "mean_token_accuracy": 0.197430220246315, "num_tokens": 57069991.0, "step": 32900 }, { "entropy": 5.442956018447876, "epoch": 2.56012448939895, "grad_norm": 1.1484375, "learning_rate": 0.00043400492813850083, "loss": 4.9924, "mean_token_accuracy": 0.19772007167339326, "num_tokens": 57077768.0, "step": 32905 }, { "entropy": 5.337126350402832, "epoch": 2.560513518770667, "grad_norm": 1.171875, "learning_rate": 0.00043398531746813426, "loss": 4.981, "mean_token_accuracy": 0.1988024741411209, "num_tokens": 57086666.0, "step": 32910 }, { "entropy": 5.342815780639649, "epoch": 2.560902548142385, "grad_norm": 1.2109375, "learning_rate": 0.00043396570438541845, "loss": 5.0053, "mean_token_accuracy": 0.20065800100564957, "num_tokens": 57095352.0, "step": 32915 }, { "entropy": 5.367441272735595, "epoch": 2.561291577514102, "grad_norm": 1.2265625, "learning_rate": 0.0004339460888906512, "loss": 5.0099, "mean_token_accuracy": 0.20147421360015869, "num_tokens": 57104535.0, "step": 32920 }, { "entropy": 5.463930463790893, "epoch": 2.5616806068858198, "grad_norm": 1.1875, "learning_rate": 0.0004339264709841299, "loss": 4.9982, "mean_token_accuracy": 0.1912730574607849, "num_tokens": 57112523.0, "step": 32925 }, { "entropy": 5.317163133621216, "epoch": 2.5620696362575375, "grad_norm": 1.140625, "learning_rate": 0.00043390685066615244, "loss": 4.8897, "mean_token_accuracy": 0.19990423917770386, "num_tokens": 57120921.0, "step": 32930 }, { "entropy": 5.4058739185333256, "epoch": 2.562458665629255, "grad_norm": 1.140625, "learning_rate": 0.0004338872279370164, "loss": 5.0456, "mean_token_accuracy": 0.19243020862340926, "num_tokens": 57128398.0, "step": 32935 }, { "entropy": 5.4275659084320065, "epoch": 2.5628476950009724, "grad_norm": 1.1328125, "learning_rate": 0.0004338676027970196, "loss": 5.0415, "mean_token_accuracy": 0.19471668303012848, "num_tokens": 57136888.0, "step": 32940 }, { "entropy": 5.398860216140747, "epoch": 2.56323672437269, "grad_norm": 1.1015625, "learning_rate": 0.00043384797524645977, "loss": 4.9933, "mean_token_accuracy": 0.19868036806583406, "num_tokens": 57144795.0, "step": 32945 }, { "entropy": 5.448951768875122, "epoch": 2.563625753744408, "grad_norm": 1.1640625, "learning_rate": 0.0004338283452856348, "loss": 5.127, "mean_token_accuracy": 0.19479160904884338, "num_tokens": 57153073.0, "step": 32950 }, { "entropy": 5.449031019210816, "epoch": 2.564014783116125, "grad_norm": 1.1796875, "learning_rate": 0.0004338087129148425, "loss": 5.0846, "mean_token_accuracy": 0.19696416705846786, "num_tokens": 57161536.0, "step": 32955 }, { "entropy": 5.436656475067139, "epoch": 2.5644038124878428, "grad_norm": 1.34375, "learning_rate": 0.00043378907813438066, "loss": 5.06, "mean_token_accuracy": 0.19759908318519592, "num_tokens": 57170065.0, "step": 32960 }, { "entropy": 5.337686061859131, "epoch": 2.5647928418595605, "grad_norm": 1.1953125, "learning_rate": 0.00043376944094454734, "loss": 4.9291, "mean_token_accuracy": 0.1999871015548706, "num_tokens": 57179063.0, "step": 32965 }, { "entropy": 5.353264236450196, "epoch": 2.565181871231278, "grad_norm": 1.140625, "learning_rate": 0.00043374980134564044, "loss": 4.8604, "mean_token_accuracy": 0.21347493678331375, "num_tokens": 57187803.0, "step": 32970 }, { "entropy": 5.475432920455932, "epoch": 2.5655709006029954, "grad_norm": 1.1484375, "learning_rate": 0.00043373015933795804, "loss": 5.1087, "mean_token_accuracy": 0.18489850014448167, "num_tokens": 57196428.0, "step": 32975 }, { "entropy": 5.4286253452301025, "epoch": 2.565959929974713, "grad_norm": 1.265625, "learning_rate": 0.0004337105149217981, "loss": 5.0758, "mean_token_accuracy": 0.19324132800102234, "num_tokens": 57205541.0, "step": 32980 }, { "entropy": 5.393906211853027, "epoch": 2.566348959346431, "grad_norm": 1.0546875, "learning_rate": 0.00043369086809745875, "loss": 4.9919, "mean_token_accuracy": 0.20310668796300888, "num_tokens": 57214436.0, "step": 32985 }, { "entropy": 5.415428686141968, "epoch": 2.566737988718148, "grad_norm": 1.2578125, "learning_rate": 0.00043367121886523795, "loss": 5.0157, "mean_token_accuracy": 0.19501292407512666, "num_tokens": 57222359.0, "step": 32990 }, { "entropy": 5.361168718338012, "epoch": 2.5671270180898658, "grad_norm": 1.15625, "learning_rate": 0.000433651567225434, "loss": 4.9214, "mean_token_accuracy": 0.1974118486046791, "num_tokens": 57230226.0, "step": 32995 }, { "entropy": 5.38568606376648, "epoch": 2.5675160474615835, "grad_norm": 1.1796875, "learning_rate": 0.0004336319131783451, "loss": 5.0762, "mean_token_accuracy": 0.19096975922584533, "num_tokens": 57239585.0, "step": 33000 }, { "epoch": 2.5675160474615835, "eval_entropy": 5.215213312106825, "eval_loss": 5.131958484649658, "eval_mean_token_accuracy": 0.1991191391880634, "eval_num_tokens": 57239585.0, "eval_runtime": 28.8503, "eval_samples_per_second": 1440.468, "eval_steps_per_second": 180.067, "step": 33000 }, { "entropy": 5.376195192337036, "epoch": 2.567905076833301, "grad_norm": 1.1875, "learning_rate": 0.00043361225672426933, "loss": 5.0413, "mean_token_accuracy": 0.20064694434404373, "num_tokens": 57248108.0, "step": 33005 }, { "entropy": 5.42994270324707, "epoch": 2.5682941062050184, "grad_norm": 1.2109375, "learning_rate": 0.0004335925978635051, "loss": 4.9929, "mean_token_accuracy": 0.19682959765195845, "num_tokens": 57257758.0, "step": 33010 }, { "entropy": 5.441091680526734, "epoch": 2.568683135576736, "grad_norm": 1.21875, "learning_rate": 0.00043357293659635057, "loss": 5.1014, "mean_token_accuracy": 0.18894279152154922, "num_tokens": 57267180.0, "step": 33015 }, { "entropy": 5.381822347640991, "epoch": 2.5690721649484534, "grad_norm": 1.1875, "learning_rate": 0.0004335532729231041, "loss": 4.9959, "mean_token_accuracy": 0.20056770890951156, "num_tokens": 57275756.0, "step": 33020 }, { "entropy": 5.388438367843628, "epoch": 2.569461194320171, "grad_norm": 1.328125, "learning_rate": 0.00043353360684406415, "loss": 5.0348, "mean_token_accuracy": 0.19274474680423737, "num_tokens": 57284593.0, "step": 33025 }, { "entropy": 5.395043230056762, "epoch": 2.5698502236918888, "grad_norm": 1.203125, "learning_rate": 0.000433513938359529, "loss": 5.0681, "mean_token_accuracy": 0.19115755409002305, "num_tokens": 57293304.0, "step": 33030 }, { "entropy": 5.407206392288208, "epoch": 2.5702392530636065, "grad_norm": 1.0625, "learning_rate": 0.0004334942674697971, "loss": 5.0183, "mean_token_accuracy": 0.20076577961444855, "num_tokens": 57302057.0, "step": 33035 }, { "entropy": 5.456658983230591, "epoch": 2.5706282824353237, "grad_norm": 1.1328125, "learning_rate": 0.00043347459417516696, "loss": 5.0438, "mean_token_accuracy": 0.20029698610305785, "num_tokens": 57310576.0, "step": 33040 }, { "entropy": 5.452741622924805, "epoch": 2.5710173118070414, "grad_norm": 1.2421875, "learning_rate": 0.0004334549184759371, "loss": 5.0142, "mean_token_accuracy": 0.196185202896595, "num_tokens": 57319103.0, "step": 33045 }, { "entropy": 5.472675848007202, "epoch": 2.571406341178759, "grad_norm": 1.171875, "learning_rate": 0.0004334352403724062, "loss": 5.1049, "mean_token_accuracy": 0.18930304050445557, "num_tokens": 57329075.0, "step": 33050 }, { "entropy": 5.429934644699097, "epoch": 2.5717953705504764, "grad_norm": 1.5703125, "learning_rate": 0.00043341555986487254, "loss": 4.9844, "mean_token_accuracy": 0.1963612347841263, "num_tokens": 57337986.0, "step": 33055 }, { "entropy": 5.405981779098511, "epoch": 2.572184399922194, "grad_norm": 1.1796875, "learning_rate": 0.0004333958769536349, "loss": 5.0926, "mean_token_accuracy": 0.18935710191726685, "num_tokens": 57346440.0, "step": 33060 }, { "entropy": 5.461093378067017, "epoch": 2.5725734292939118, "grad_norm": 1.171875, "learning_rate": 0.0004333761916389921, "loss": 5.091, "mean_token_accuracy": 0.1845938578248024, "num_tokens": 57354791.0, "step": 33065 }, { "entropy": 5.417821168899536, "epoch": 2.5729624586656294, "grad_norm": 1.2109375, "learning_rate": 0.0004333565039212425, "loss": 5.0061, "mean_token_accuracy": 0.19279139190912248, "num_tokens": 57363200.0, "step": 33070 }, { "entropy": 5.364356899261475, "epoch": 2.5733514880373467, "grad_norm": 1.15625, "learning_rate": 0.0004333368138006851, "loss": 4.9916, "mean_token_accuracy": 0.19710914343595504, "num_tokens": 57371830.0, "step": 33075 }, { "entropy": 5.4708263874053955, "epoch": 2.5737405174090644, "grad_norm": 1.1171875, "learning_rate": 0.0004333171212776185, "loss": 5.1243, "mean_token_accuracy": 0.18771326839923858, "num_tokens": 57380123.0, "step": 33080 }, { "entropy": 5.442349529266357, "epoch": 2.574129546780782, "grad_norm": 1.125, "learning_rate": 0.0004332974263523416, "loss": 5.0978, "mean_token_accuracy": 0.19402647614479065, "num_tokens": 57389093.0, "step": 33085 }, { "entropy": 5.213416290283203, "epoch": 2.5745185761524993, "grad_norm": 1.1171875, "learning_rate": 0.00043327772902515327, "loss": 4.8117, "mean_token_accuracy": 0.2112378090620041, "num_tokens": 57397165.0, "step": 33090 }, { "entropy": 5.367502880096436, "epoch": 2.574907605524217, "grad_norm": 1.1953125, "learning_rate": 0.0004332580292963523, "loss": 5.105, "mean_token_accuracy": 0.19111934751272203, "num_tokens": 57406308.0, "step": 33095 }, { "entropy": 5.390132331848145, "epoch": 2.5752966348959347, "grad_norm": 1.15625, "learning_rate": 0.0004332383271662376, "loss": 4.9116, "mean_token_accuracy": 0.1990741416811943, "num_tokens": 57414964.0, "step": 33100 }, { "entropy": 5.315077543258667, "epoch": 2.5756856642676524, "grad_norm": 1.203125, "learning_rate": 0.00043321862263510816, "loss": 4.8523, "mean_token_accuracy": 0.2151111349463463, "num_tokens": 57422684.0, "step": 33105 }, { "entropy": 5.313579177856445, "epoch": 2.5760746936393697, "grad_norm": 1.1015625, "learning_rate": 0.0004331989157032629, "loss": 4.9788, "mean_token_accuracy": 0.19050878137350083, "num_tokens": 57431784.0, "step": 33110 }, { "entropy": 5.410853672027588, "epoch": 2.5764637230110874, "grad_norm": 1.171875, "learning_rate": 0.00043317920637100097, "loss": 5.0575, "mean_token_accuracy": 0.1955583870410919, "num_tokens": 57440467.0, "step": 33115 }, { "entropy": 5.391645669937134, "epoch": 2.5768527523828046, "grad_norm": 1.203125, "learning_rate": 0.0004331594946386213, "loss": 4.9589, "mean_token_accuracy": 0.1942771404981613, "num_tokens": 57449263.0, "step": 33120 }, { "entropy": 5.39660234451294, "epoch": 2.5772417817545223, "grad_norm": 1.1953125, "learning_rate": 0.00043313978050642303, "loss": 4.9615, "mean_token_accuracy": 0.20407168865203856, "num_tokens": 57457662.0, "step": 33125 }, { "entropy": 5.382514429092407, "epoch": 2.57763081112624, "grad_norm": 1.1484375, "learning_rate": 0.0004331200639747053, "loss": 4.9571, "mean_token_accuracy": 0.20231837034225464, "num_tokens": 57466049.0, "step": 33130 }, { "entropy": 5.35534987449646, "epoch": 2.5780198404979577, "grad_norm": 1.15625, "learning_rate": 0.0004331003450437674, "loss": 5.0532, "mean_token_accuracy": 0.19660445153713227, "num_tokens": 57474923.0, "step": 33135 }, { "entropy": 5.323561954498291, "epoch": 2.5784088698696754, "grad_norm": 1.1328125, "learning_rate": 0.0004330806237139083, "loss": 4.9389, "mean_token_accuracy": 0.19867438375949859, "num_tokens": 57483292.0, "step": 33140 }, { "entropy": 5.316736936569214, "epoch": 2.5787978992413927, "grad_norm": 1.1171875, "learning_rate": 0.0004330608999854273, "loss": 4.9832, "mean_token_accuracy": 0.1959037736058235, "num_tokens": 57491894.0, "step": 33145 }, { "entropy": 5.372809743881225, "epoch": 2.5791869286131104, "grad_norm": 1.2109375, "learning_rate": 0.0004330411738586238, "loss": 5.0248, "mean_token_accuracy": 0.18888262808322906, "num_tokens": 57500999.0, "step": 33150 }, { "entropy": 5.521779632568359, "epoch": 2.5795759579848276, "grad_norm": 1.15625, "learning_rate": 0.000433021445333797, "loss": 5.0869, "mean_token_accuracy": 0.19092299938201904, "num_tokens": 57508964.0, "step": 33155 }, { "entropy": 5.495110511779785, "epoch": 2.5799649873565453, "grad_norm": 1.2109375, "learning_rate": 0.00043300171441124633, "loss": 5.1062, "mean_token_accuracy": 0.19211519956588746, "num_tokens": 57517605.0, "step": 33160 }, { "entropy": 5.480223083496094, "epoch": 2.580354016728263, "grad_norm": 1.1640625, "learning_rate": 0.0004329819810912711, "loss": 5.2056, "mean_token_accuracy": 0.18542506098747252, "num_tokens": 57527043.0, "step": 33165 }, { "entropy": 5.411193943023681, "epoch": 2.5807430460999807, "grad_norm": 1.1015625, "learning_rate": 0.00043296224537417075, "loss": 5.0231, "mean_token_accuracy": 0.19838768988847733, "num_tokens": 57535768.0, "step": 33170 }, { "entropy": 5.428645658493042, "epoch": 2.581132075471698, "grad_norm": 1.1484375, "learning_rate": 0.00043294250726024473, "loss": 5.0295, "mean_token_accuracy": 0.1945171132683754, "num_tokens": 57544060.0, "step": 33175 }, { "entropy": 5.340937709808349, "epoch": 2.5815211048434157, "grad_norm": 1.2265625, "learning_rate": 0.0004329227667497926, "loss": 4.9048, "mean_token_accuracy": 0.20319671779870987, "num_tokens": 57553139.0, "step": 33180 }, { "entropy": 5.30918517112732, "epoch": 2.5819101342151334, "grad_norm": 1.1171875, "learning_rate": 0.00043290302384311373, "loss": 4.945, "mean_token_accuracy": 0.1966753214597702, "num_tokens": 57561388.0, "step": 33185 }, { "entropy": 5.359861564636231, "epoch": 2.5822991635868506, "grad_norm": 1.21875, "learning_rate": 0.00043288327854050794, "loss": 4.9665, "mean_token_accuracy": 0.19830524325370788, "num_tokens": 57570431.0, "step": 33190 }, { "entropy": 5.405405473709107, "epoch": 2.5826881929585683, "grad_norm": 1.1328125, "learning_rate": 0.00043286353084227467, "loss": 5.0097, "mean_token_accuracy": 0.19255893677473068, "num_tokens": 57579047.0, "step": 33195 }, { "entropy": 5.4494822978973385, "epoch": 2.583077222330286, "grad_norm": 1.0390625, "learning_rate": 0.00043284378074871354, "loss": 5.0415, "mean_token_accuracy": 0.1943253755569458, "num_tokens": 57587878.0, "step": 33200 }, { "entropy": 5.407710409164428, "epoch": 2.5834662517020037, "grad_norm": 1.140625, "learning_rate": 0.0004328240282601243, "loss": 5.0408, "mean_token_accuracy": 0.20136262625455856, "num_tokens": 57596823.0, "step": 33205 }, { "entropy": 5.409446048736572, "epoch": 2.583855281073721, "grad_norm": 1.1015625, "learning_rate": 0.0004328042733768066, "loss": 5.1352, "mean_token_accuracy": 0.18554815798997878, "num_tokens": 57605983.0, "step": 33210 }, { "entropy": 5.396353673934937, "epoch": 2.5842443104454387, "grad_norm": 1.1796875, "learning_rate": 0.00043278451609906027, "loss": 4.9775, "mean_token_accuracy": 0.19769710451364517, "num_tokens": 57613987.0, "step": 33215 }, { "entropy": 5.405464315414429, "epoch": 2.584633339817156, "grad_norm": 1.25, "learning_rate": 0.00043276475642718503, "loss": 5.011, "mean_token_accuracy": 0.19645921438932418, "num_tokens": 57622409.0, "step": 33220 }, { "entropy": 5.404412698745728, "epoch": 2.5850223691888736, "grad_norm": 1.1484375, "learning_rate": 0.0004327449943614808, "loss": 4.9824, "mean_token_accuracy": 0.20155560672283174, "num_tokens": 57630664.0, "step": 33225 }, { "entropy": 5.3939738273620605, "epoch": 2.5854113985605913, "grad_norm": 1.1796875, "learning_rate": 0.00043272522990224727, "loss": 5.0483, "mean_token_accuracy": 0.19237309396266938, "num_tokens": 57639745.0, "step": 33230 }, { "entropy": 5.329434251785278, "epoch": 2.585800427932309, "grad_norm": 1.140625, "learning_rate": 0.0004327054630497844, "loss": 4.9858, "mean_token_accuracy": 0.20279276072978974, "num_tokens": 57648628.0, "step": 33235 }, { "entropy": 5.407618713378906, "epoch": 2.5861894573040267, "grad_norm": 1.171875, "learning_rate": 0.00043268569380439223, "loss": 4.9413, "mean_token_accuracy": 0.21495347023010253, "num_tokens": 57656322.0, "step": 33240 }, { "entropy": 5.375839519500732, "epoch": 2.586578486675744, "grad_norm": 1.171875, "learning_rate": 0.0004326659221663705, "loss": 5.0054, "mean_token_accuracy": 0.19711500853300096, "num_tokens": 57664807.0, "step": 33245 }, { "entropy": 5.341571712493897, "epoch": 2.5869675160474617, "grad_norm": 1.2265625, "learning_rate": 0.0004326461481360194, "loss": 5.0045, "mean_token_accuracy": 0.20176856815814972, "num_tokens": 57673216.0, "step": 33250 }, { "entropy": 5.420721340179443, "epoch": 2.587356545419179, "grad_norm": 1.171875, "learning_rate": 0.00043262637171363906, "loss": 5.0519, "mean_token_accuracy": 0.18821411430835724, "num_tokens": 57681615.0, "step": 33255 }, { "entropy": 5.553034543991089, "epoch": 2.5877455747908966, "grad_norm": 1.2109375, "learning_rate": 0.00043260659289952926, "loss": 5.1182, "mean_token_accuracy": 0.1940648838877678, "num_tokens": 57690951.0, "step": 33260 }, { "entropy": 5.443303346633911, "epoch": 2.5881346041626143, "grad_norm": 1.1875, "learning_rate": 0.00043258681169399034, "loss": 5.0221, "mean_token_accuracy": 0.19450205862522124, "num_tokens": 57699723.0, "step": 33265 }, { "entropy": 5.3849842071533205, "epoch": 2.588523633534332, "grad_norm": 1.2265625, "learning_rate": 0.00043256702809732234, "loss": 4.9766, "mean_token_accuracy": 0.19638959914445878, "num_tokens": 57708380.0, "step": 33270 }, { "entropy": 5.4190967082977295, "epoch": 2.5889126629060493, "grad_norm": 1.125, "learning_rate": 0.0004325472421098255, "loss": 5.0327, "mean_token_accuracy": 0.19513487964868545, "num_tokens": 57717183.0, "step": 33275 }, { "entropy": 5.398415565490723, "epoch": 2.589301692277767, "grad_norm": 1.0625, "learning_rate": 0.00043252745373180006, "loss": 4.9634, "mean_token_accuracy": 0.19339249283075333, "num_tokens": 57726369.0, "step": 33280 }, { "entropy": 5.4137535572052, "epoch": 2.5896907216494847, "grad_norm": 1.1328125, "learning_rate": 0.0004325076629635462, "loss": 4.9597, "mean_token_accuracy": 0.20786890238523484, "num_tokens": 57734863.0, "step": 33285 }, { "entropy": 5.403210639953613, "epoch": 2.590079751021202, "grad_norm": 1.140625, "learning_rate": 0.00043248786980536424, "loss": 4.9969, "mean_token_accuracy": 0.20014824271202086, "num_tokens": 57743478.0, "step": 33290 }, { "entropy": 5.369860744476318, "epoch": 2.5904687803929196, "grad_norm": 1.359375, "learning_rate": 0.0004324680742575545, "loss": 5.0718, "mean_token_accuracy": 0.20055337697267533, "num_tokens": 57752300.0, "step": 33295 }, { "entropy": 5.431903457641601, "epoch": 2.5908578097646373, "grad_norm": 1.125, "learning_rate": 0.00043244827632041744, "loss": 4.9999, "mean_token_accuracy": 0.1969797804951668, "num_tokens": 57760377.0, "step": 33300 }, { "entropy": 5.535237073898315, "epoch": 2.591246839136355, "grad_norm": 1.1875, "learning_rate": 0.0004324284759942534, "loss": 5.1868, "mean_token_accuracy": 0.18544953167438508, "num_tokens": 57768665.0, "step": 33305 }, { "entropy": 5.352888774871826, "epoch": 2.5916358685080723, "grad_norm": 1.1015625, "learning_rate": 0.0004324086732793627, "loss": 5.0088, "mean_token_accuracy": 0.1928769215941429, "num_tokens": 57777387.0, "step": 33310 }, { "entropy": 5.522916221618653, "epoch": 2.59202489787979, "grad_norm": 1.140625, "learning_rate": 0.00043238886817604605, "loss": 5.0946, "mean_token_accuracy": 0.1931093618273735, "num_tokens": 57785406.0, "step": 33315 }, { "entropy": 5.397273206710816, "epoch": 2.5924139272515077, "grad_norm": 1.1640625, "learning_rate": 0.0004323690606846039, "loss": 5.0054, "mean_token_accuracy": 0.1989477828145027, "num_tokens": 57794412.0, "step": 33320 }, { "entropy": 5.38226318359375, "epoch": 2.592802956623225, "grad_norm": 1.1484375, "learning_rate": 0.00043234925080533657, "loss": 4.936, "mean_token_accuracy": 0.197903174161911, "num_tokens": 57803310.0, "step": 33325 }, { "entropy": 5.3964029312133786, "epoch": 2.5931919859949426, "grad_norm": 1.1015625, "learning_rate": 0.0004323294385385448, "loss": 5.0174, "mean_token_accuracy": 0.1983078971505165, "num_tokens": 57812968.0, "step": 33330 }, { "entropy": 5.422370529174804, "epoch": 2.5935810153666603, "grad_norm": 1.140625, "learning_rate": 0.0004323096238845293, "loss": 5.1586, "mean_token_accuracy": 0.1875622496008873, "num_tokens": 57821230.0, "step": 33335 }, { "entropy": 5.47182445526123, "epoch": 2.593970044738378, "grad_norm": 1.171875, "learning_rate": 0.0004322898068435906, "loss": 5.0829, "mean_token_accuracy": 0.1912751853466034, "num_tokens": 57829643.0, "step": 33340 }, { "entropy": 5.451434803009033, "epoch": 2.5943590741100953, "grad_norm": 1.1875, "learning_rate": 0.0004322699874160294, "loss": 4.9581, "mean_token_accuracy": 0.20072317719459534, "num_tokens": 57837994.0, "step": 33345 }, { "entropy": 5.421475887298584, "epoch": 2.594748103481813, "grad_norm": 1.1328125, "learning_rate": 0.00043225016560214654, "loss": 5.0678, "mean_token_accuracy": 0.19361352771520615, "num_tokens": 57846764.0, "step": 33350 }, { "entropy": 5.408279705047607, "epoch": 2.59513713285353, "grad_norm": 1.1171875, "learning_rate": 0.00043223034140224266, "loss": 4.9682, "mean_token_accuracy": 0.1983417108654976, "num_tokens": 57854887.0, "step": 33355 }, { "entropy": 5.424863338470459, "epoch": 2.595526162225248, "grad_norm": 1.1640625, "learning_rate": 0.0004322105148166187, "loss": 4.9872, "mean_token_accuracy": 0.19804560989141465, "num_tokens": 57863639.0, "step": 33360 }, { "entropy": 5.360683345794678, "epoch": 2.5959151915969656, "grad_norm": 1.1875, "learning_rate": 0.00043219068584557526, "loss": 4.9182, "mean_token_accuracy": 0.2050188660621643, "num_tokens": 57872037.0, "step": 33365 }, { "entropy": 5.421139907836914, "epoch": 2.5963042209686833, "grad_norm": 1.171875, "learning_rate": 0.0004321708544894134, "loss": 5.026, "mean_token_accuracy": 0.19619489461183548, "num_tokens": 57880809.0, "step": 33370 }, { "entropy": 5.464409446716308, "epoch": 2.5966932503404005, "grad_norm": 1.1875, "learning_rate": 0.00043215102074843403, "loss": 5.1067, "mean_token_accuracy": 0.19468592554330827, "num_tokens": 57889184.0, "step": 33375 }, { "entropy": 5.383119916915893, "epoch": 2.5970822797121182, "grad_norm": 1.15625, "learning_rate": 0.00043213118462293796, "loss": 4.9547, "mean_token_accuracy": 0.19801298826932906, "num_tokens": 57897695.0, "step": 33380 }, { "entropy": 5.458133506774902, "epoch": 2.597471309083836, "grad_norm": 1.15625, "learning_rate": 0.0004321113461132264, "loss": 5.0487, "mean_token_accuracy": 0.1948784440755844, "num_tokens": 57906280.0, "step": 33385 }, { "entropy": 5.456954765319824, "epoch": 2.597860338455553, "grad_norm": 1.296875, "learning_rate": 0.00043209150521960016, "loss": 5.0456, "mean_token_accuracy": 0.19694745242595674, "num_tokens": 57915112.0, "step": 33390 }, { "entropy": 5.439999008178711, "epoch": 2.598249367827271, "grad_norm": 1.1484375, "learning_rate": 0.00043207166194236037, "loss": 5.0196, "mean_token_accuracy": 0.19698575437068938, "num_tokens": 57924210.0, "step": 33395 }, { "entropy": 5.421382713317871, "epoch": 2.5986383971989886, "grad_norm": 1.125, "learning_rate": 0.0004320518162818082, "loss": 4.9831, "mean_token_accuracy": 0.2011178895831108, "num_tokens": 57933030.0, "step": 33400 }, { "entropy": 5.346721363067627, "epoch": 2.5990274265707063, "grad_norm": 1.1484375, "learning_rate": 0.0004320319682382445, "loss": 4.9212, "mean_token_accuracy": 0.19615161269903184, "num_tokens": 57941490.0, "step": 33405 }, { "entropy": 5.36622633934021, "epoch": 2.5994164559424235, "grad_norm": 1.125, "learning_rate": 0.00043201211781197075, "loss": 5.0086, "mean_token_accuracy": 0.19557689726352692, "num_tokens": 57950666.0, "step": 33410 }, { "entropy": 5.395963716506958, "epoch": 2.5998054853141412, "grad_norm": 1.109375, "learning_rate": 0.00043199226500328805, "loss": 5.0711, "mean_token_accuracy": 0.19219135940074922, "num_tokens": 57959740.0, "step": 33415 }, { "entropy": 5.4872652053833, "epoch": 2.600194514685859, "grad_norm": 1.1015625, "learning_rate": 0.0004319724098124975, "loss": 5.0199, "mean_token_accuracy": 0.19232258647680284, "num_tokens": 57968391.0, "step": 33420 }, { "entropy": 5.424953126907349, "epoch": 2.600583544057576, "grad_norm": 1.1875, "learning_rate": 0.00043195255223990055, "loss": 5.0473, "mean_token_accuracy": 0.19112542569637297, "num_tokens": 57976873.0, "step": 33425 }, { "entropy": 5.378559494018555, "epoch": 2.600972573429294, "grad_norm": 1.265625, "learning_rate": 0.0004319326922857984, "loss": 5.0243, "mean_token_accuracy": 0.19390802830457687, "num_tokens": 57985085.0, "step": 33430 }, { "entropy": 5.417693758010865, "epoch": 2.6013616028010116, "grad_norm": 1.1953125, "learning_rate": 0.0004319128299504925, "loss": 5.0056, "mean_token_accuracy": 0.19598936587572097, "num_tokens": 57993686.0, "step": 33435 }, { "entropy": 5.435611963272095, "epoch": 2.6017506321727293, "grad_norm": 1.234375, "learning_rate": 0.00043189296523428407, "loss": 5.113, "mean_token_accuracy": 0.18981040120124817, "num_tokens": 58001877.0, "step": 33440 }, { "entropy": 5.391393041610717, "epoch": 2.6021396615444465, "grad_norm": 1.09375, "learning_rate": 0.00043187309813747464, "loss": 5.0084, "mean_token_accuracy": 0.1983030378818512, "num_tokens": 58010688.0, "step": 33445 }, { "entropy": 5.419939088821411, "epoch": 2.6025286909161642, "grad_norm": 1.140625, "learning_rate": 0.00043185322866036565, "loss": 4.9442, "mean_token_accuracy": 0.20129207670688629, "num_tokens": 58019470.0, "step": 33450 }, { "entropy": 5.445365047454834, "epoch": 2.6029177202878815, "grad_norm": 1.0859375, "learning_rate": 0.00043183335680325866, "loss": 5.0671, "mean_token_accuracy": 0.18568008691072463, "num_tokens": 58028297.0, "step": 33455 }, { "entropy": 5.416705465316772, "epoch": 2.603306749659599, "grad_norm": 1.140625, "learning_rate": 0.00043181348256645497, "loss": 5.1217, "mean_token_accuracy": 0.18392168134450912, "num_tokens": 58036815.0, "step": 33460 }, { "entropy": 5.5014698028564455, "epoch": 2.603695779031317, "grad_norm": 1.203125, "learning_rate": 0.00043179360595025637, "loss": 5.1133, "mean_token_accuracy": 0.1936869889497757, "num_tokens": 58045682.0, "step": 33465 }, { "entropy": 5.432379198074341, "epoch": 2.6040848084030346, "grad_norm": 1.1484375, "learning_rate": 0.0004317737269549643, "loss": 5.073, "mean_token_accuracy": 0.18725499361753464, "num_tokens": 58054530.0, "step": 33470 }, { "entropy": 5.4447393894195555, "epoch": 2.604473837774752, "grad_norm": 1.0859375, "learning_rate": 0.0004317538455808805, "loss": 5.0851, "mean_token_accuracy": 0.19117185473442078, "num_tokens": 58063360.0, "step": 33475 }, { "entropy": 5.4212500095367435, "epoch": 2.6048628671464695, "grad_norm": 1.09375, "learning_rate": 0.0004317339618283065, "loss": 5.054, "mean_token_accuracy": 0.20231692045927047, "num_tokens": 58071198.0, "step": 33480 }, { "entropy": 5.485487461090088, "epoch": 2.6052518965181872, "grad_norm": 1.1875, "learning_rate": 0.0004317140756975442, "loss": 5.1156, "mean_token_accuracy": 0.18765053749084473, "num_tokens": 58080138.0, "step": 33485 }, { "entropy": 5.363854455947876, "epoch": 2.6056409258899045, "grad_norm": 1.109375, "learning_rate": 0.0004316941871888951, "loss": 4.9696, "mean_token_accuracy": 0.2042372077703476, "num_tokens": 58088768.0, "step": 33490 }, { "entropy": 5.333820152282715, "epoch": 2.606029955261622, "grad_norm": 1.0703125, "learning_rate": 0.00043167429630266134, "loss": 5.0093, "mean_token_accuracy": 0.1946773946285248, "num_tokens": 58098309.0, "step": 33495 }, { "entropy": 5.444535589218139, "epoch": 2.60641898463334, "grad_norm": 1.1328125, "learning_rate": 0.0004316544030391444, "loss": 5.0351, "mean_token_accuracy": 0.1943730592727661, "num_tokens": 58106987.0, "step": 33500 }, { "entropy": 5.422795343399048, "epoch": 2.6068080140050576, "grad_norm": 1.1875, "learning_rate": 0.0004316345073986461, "loss": 4.9967, "mean_token_accuracy": 0.1992761343717575, "num_tokens": 58115065.0, "step": 33505 }, { "entropy": 5.404860544204712, "epoch": 2.607197043376775, "grad_norm": 1.1640625, "learning_rate": 0.0004316146093814686, "loss": 5.1084, "mean_token_accuracy": 0.1904493451118469, "num_tokens": 58123995.0, "step": 33510 }, { "entropy": 5.361037492752075, "epoch": 2.6075860727484925, "grad_norm": 1.140625, "learning_rate": 0.0004315947089879137, "loss": 4.9153, "mean_token_accuracy": 0.20740990936756135, "num_tokens": 58132080.0, "step": 33515 }, { "entropy": 5.458073711395263, "epoch": 2.60797510212021, "grad_norm": 1.1796875, "learning_rate": 0.00043157480621828327, "loss": 5.0771, "mean_token_accuracy": 0.194709937274456, "num_tokens": 58140199.0, "step": 33520 }, { "entropy": 5.3023748874664305, "epoch": 2.6083641314919275, "grad_norm": 1.1015625, "learning_rate": 0.00043155490107287935, "loss": 4.9215, "mean_token_accuracy": 0.20740467607975005, "num_tokens": 58148852.0, "step": 33525 }, { "entropy": 5.390206718444825, "epoch": 2.608753160863645, "grad_norm": 1.1640625, "learning_rate": 0.0004315349935520041, "loss": 5.0765, "mean_token_accuracy": 0.1993390366435051, "num_tokens": 58157290.0, "step": 33530 }, { "entropy": 5.478251314163208, "epoch": 2.609142190235363, "grad_norm": 1.1328125, "learning_rate": 0.0004315150836559594, "loss": 5.0337, "mean_token_accuracy": 0.18843597322702407, "num_tokens": 58166086.0, "step": 33535 }, { "entropy": 5.435611629486084, "epoch": 2.6095312196070806, "grad_norm": 1.09375, "learning_rate": 0.0004314951713850474, "loss": 4.9864, "mean_token_accuracy": 0.19927272647619249, "num_tokens": 58174865.0, "step": 33540 }, { "entropy": 5.360013484954834, "epoch": 2.609920248978798, "grad_norm": 1.140625, "learning_rate": 0.00043147525673957026, "loss": 5.0103, "mean_token_accuracy": 0.20238753259181977, "num_tokens": 58182313.0, "step": 33545 }, { "entropy": 5.382126235961914, "epoch": 2.6103092783505155, "grad_norm": 1.1328125, "learning_rate": 0.00043145533971983025, "loss": 5.0407, "mean_token_accuracy": 0.1875401943922043, "num_tokens": 58190758.0, "step": 33550 }, { "entropy": 5.410359954833984, "epoch": 2.6106983077222328, "grad_norm": 1.1015625, "learning_rate": 0.00043143542032612935, "loss": 5.0505, "mean_token_accuracy": 0.19337413012981414, "num_tokens": 58199308.0, "step": 33555 }, { "entropy": 5.421206426620484, "epoch": 2.6110873370939505, "grad_norm": 1.2421875, "learning_rate": 0.0004314154985587701, "loss": 4.9693, "mean_token_accuracy": 0.19400418251752855, "num_tokens": 58206995.0, "step": 33560 }, { "entropy": 5.350102472305298, "epoch": 2.611476366465668, "grad_norm": 1.1640625, "learning_rate": 0.00043139557441805457, "loss": 4.9874, "mean_token_accuracy": 0.2004566088318825, "num_tokens": 58215186.0, "step": 33565 }, { "entropy": 5.455255842208862, "epoch": 2.611865395837386, "grad_norm": 1.0859375, "learning_rate": 0.00043137564790428503, "loss": 5.023, "mean_token_accuracy": 0.19396957159042358, "num_tokens": 58224347.0, "step": 33570 }, { "entropy": 5.324423837661743, "epoch": 2.6122544252091036, "grad_norm": 1.1796875, "learning_rate": 0.00043135571901776397, "loss": 4.9245, "mean_token_accuracy": 0.20258399695158005, "num_tokens": 58232477.0, "step": 33575 }, { "entropy": 5.313129615783692, "epoch": 2.612643454580821, "grad_norm": 1.1328125, "learning_rate": 0.0004313357877587937, "loss": 4.9633, "mean_token_accuracy": 0.20570655465126036, "num_tokens": 58241186.0, "step": 33580 }, { "entropy": 5.399720001220703, "epoch": 2.6130324839525385, "grad_norm": 1.171875, "learning_rate": 0.0004313158541276768, "loss": 5.0261, "mean_token_accuracy": 0.2012824073433876, "num_tokens": 58249140.0, "step": 33585 }, { "entropy": 5.400412845611572, "epoch": 2.6134215133242558, "grad_norm": 1.15625, "learning_rate": 0.0004312959181247156, "loss": 5.0115, "mean_token_accuracy": 0.19189297258853913, "num_tokens": 58258313.0, "step": 33590 }, { "entropy": 5.381920337677002, "epoch": 2.6138105426959735, "grad_norm": 1.1484375, "learning_rate": 0.0004312759797502126, "loss": 4.9868, "mean_token_accuracy": 0.19745534062385559, "num_tokens": 58267013.0, "step": 33595 }, { "entropy": 5.413403606414795, "epoch": 2.614199572067691, "grad_norm": 1.1328125, "learning_rate": 0.00043125603900447026, "loss": 5.0723, "mean_token_accuracy": 0.18996374905109406, "num_tokens": 58275844.0, "step": 33600 }, { "entropy": 5.411362028121948, "epoch": 2.614588601439409, "grad_norm": 1.1875, "learning_rate": 0.0004312360958877913, "loss": 5.0342, "mean_token_accuracy": 0.19286447614431382, "num_tokens": 58284416.0, "step": 33605 }, { "entropy": 5.412449073791504, "epoch": 2.614977630811126, "grad_norm": 1.125, "learning_rate": 0.0004312161504004782, "loss": 5.0201, "mean_token_accuracy": 0.19352453500032424, "num_tokens": 58293564.0, "step": 33610 }, { "entropy": 5.381396770477295, "epoch": 2.615366660182844, "grad_norm": 1.2109375, "learning_rate": 0.00043119620254283375, "loss": 4.9776, "mean_token_accuracy": 0.1954403430223465, "num_tokens": 58302230.0, "step": 33615 }, { "entropy": 5.421072196960449, "epoch": 2.6157556895545615, "grad_norm": 1.1484375, "learning_rate": 0.00043117625231516054, "loss": 5.0113, "mean_token_accuracy": 0.19653632938861848, "num_tokens": 58309540.0, "step": 33620 }, { "entropy": 5.355747032165527, "epoch": 2.6161447189262788, "grad_norm": 1.171875, "learning_rate": 0.0004311562997177612, "loss": 4.9359, "mean_token_accuracy": 0.20713720023632048, "num_tokens": 58317885.0, "step": 33625 }, { "entropy": 5.412367820739746, "epoch": 2.6165337482979965, "grad_norm": 1.203125, "learning_rate": 0.0004311363447509386, "loss": 5.0226, "mean_token_accuracy": 0.18666871786117553, "num_tokens": 58326133.0, "step": 33630 }, { "entropy": 5.421963214874268, "epoch": 2.616922777669714, "grad_norm": 1.25, "learning_rate": 0.0004311163874149955, "loss": 5.0323, "mean_token_accuracy": 0.19386831820011138, "num_tokens": 58335085.0, "step": 33635 }, { "entropy": 5.4929666996002195, "epoch": 2.617311807041432, "grad_norm": 1.171875, "learning_rate": 0.00043109642771023464, "loss": 5.0475, "mean_token_accuracy": 0.19512614160776137, "num_tokens": 58344222.0, "step": 33640 }, { "entropy": 5.38620138168335, "epoch": 2.617700836413149, "grad_norm": 1.15625, "learning_rate": 0.0004310764656369591, "loss": 4.9379, "mean_token_accuracy": 0.19684532433748245, "num_tokens": 58353256.0, "step": 33645 }, { "entropy": 5.451818370819092, "epoch": 2.618089865784867, "grad_norm": 1.1953125, "learning_rate": 0.0004310565011954715, "loss": 5.0364, "mean_token_accuracy": 0.19929524809122084, "num_tokens": 58361197.0, "step": 33650 }, { "entropy": 5.522153663635254, "epoch": 2.618478895156584, "grad_norm": 1.4453125, "learning_rate": 0.0004310365343860748, "loss": 5.1084, "mean_token_accuracy": 0.19607727229595184, "num_tokens": 58370653.0, "step": 33655 }, { "entropy": 5.422746849060059, "epoch": 2.6188679245283017, "grad_norm": 1.1328125, "learning_rate": 0.00043101656520907225, "loss": 5.0787, "mean_token_accuracy": 0.1901749327778816, "num_tokens": 58379804.0, "step": 33660 }, { "entropy": 5.380604839324951, "epoch": 2.6192569539000194, "grad_norm": 1.15625, "learning_rate": 0.0004309965936647665, "loss": 5.01, "mean_token_accuracy": 0.1916694387793541, "num_tokens": 58388443.0, "step": 33665 }, { "entropy": 5.459115505218506, "epoch": 2.619645983271737, "grad_norm": 1.140625, "learning_rate": 0.0004309766197534608, "loss": 5.1225, "mean_token_accuracy": 0.19072893112897873, "num_tokens": 58397165.0, "step": 33670 }, { "entropy": 5.415544891357422, "epoch": 2.620035012643455, "grad_norm": 1.0859375, "learning_rate": 0.00043095664347545816, "loss": 5.0387, "mean_token_accuracy": 0.1935420125722885, "num_tokens": 58405679.0, "step": 33675 }, { "entropy": 5.368338918685913, "epoch": 2.620424042015172, "grad_norm": 1.1015625, "learning_rate": 0.0004309366648310616, "loss": 4.9378, "mean_token_accuracy": 0.2014945402741432, "num_tokens": 58414998.0, "step": 33680 }, { "entropy": 5.441775989532471, "epoch": 2.62081307138689, "grad_norm": 1.203125, "learning_rate": 0.00043091668382057443, "loss": 4.9695, "mean_token_accuracy": 0.19644484668970108, "num_tokens": 58423535.0, "step": 33685 }, { "entropy": 5.367545509338379, "epoch": 2.621202100758607, "grad_norm": 1.1484375, "learning_rate": 0.00043089670044429973, "loss": 4.9467, "mean_token_accuracy": 0.1996975526213646, "num_tokens": 58432379.0, "step": 33690 }, { "entropy": 5.3892780303955075, "epoch": 2.6215911301303247, "grad_norm": 1.21875, "learning_rate": 0.00043087671470254076, "loss": 5.0527, "mean_token_accuracy": 0.19272695928812028, "num_tokens": 58441013.0, "step": 33695 }, { "entropy": 5.4753190040588375, "epoch": 2.6219801595020424, "grad_norm": 1.125, "learning_rate": 0.00043085672659560077, "loss": 5.0742, "mean_token_accuracy": 0.20055238753557206, "num_tokens": 58450353.0, "step": 33700 }, { "entropy": 5.462785148620606, "epoch": 2.62236918887376, "grad_norm": 1.1953125, "learning_rate": 0.00043083673612378295, "loss": 4.9499, "mean_token_accuracy": 0.19458895176649094, "num_tokens": 58458833.0, "step": 33705 }, { "entropy": 5.3792500495910645, "epoch": 2.6227582182454774, "grad_norm": 1.1796875, "learning_rate": 0.00043081674328739066, "loss": 5.0711, "mean_token_accuracy": 0.1904326021671295, "num_tokens": 58468325.0, "step": 33710 }, { "entropy": 5.390144348144531, "epoch": 2.623147247617195, "grad_norm": 1.1875, "learning_rate": 0.00043079674808672744, "loss": 4.9481, "mean_token_accuracy": 0.19750515669584273, "num_tokens": 58476333.0, "step": 33715 }, { "entropy": 5.368268442153931, "epoch": 2.623536276988913, "grad_norm": 1.1328125, "learning_rate": 0.0004307767505220964, "loss": 5.0069, "mean_token_accuracy": 0.20425021648406982, "num_tokens": 58484435.0, "step": 33720 }, { "entropy": 5.386517286300659, "epoch": 2.62392530636063, "grad_norm": 1.140625, "learning_rate": 0.0004307567505938012, "loss": 5.1126, "mean_token_accuracy": 0.1851356491446495, "num_tokens": 58493709.0, "step": 33725 }, { "entropy": 5.449285411834717, "epoch": 2.6243143357323477, "grad_norm": 1.1875, "learning_rate": 0.0004307367483021452, "loss": 5.0006, "mean_token_accuracy": 0.19844175577163697, "num_tokens": 58502522.0, "step": 33730 }, { "entropy": 5.438796043395996, "epoch": 2.6247033651040654, "grad_norm": 1.15625, "learning_rate": 0.000430716743647432, "loss": 5.0396, "mean_token_accuracy": 0.1899079442024231, "num_tokens": 58511459.0, "step": 33735 }, { "entropy": 5.410864019393921, "epoch": 2.625092394475783, "grad_norm": 1.1171875, "learning_rate": 0.000430696736629965, "loss": 5.0676, "mean_token_accuracy": 0.19566015303134918, "num_tokens": 58520197.0, "step": 33740 }, { "entropy": 5.435902690887451, "epoch": 2.6254814238475004, "grad_norm": 1.1640625, "learning_rate": 0.0004306767272500478, "loss": 5.0808, "mean_token_accuracy": 0.1920143887400627, "num_tokens": 58528587.0, "step": 33745 }, { "entropy": 5.440750455856323, "epoch": 2.625870453219218, "grad_norm": 1.2109375, "learning_rate": 0.00043065671550798415, "loss": 4.992, "mean_token_accuracy": 0.19872858226299286, "num_tokens": 58537348.0, "step": 33750 }, { "entropy": 5.341591310501099, "epoch": 2.626259482590936, "grad_norm": 1.171875, "learning_rate": 0.00043063670140407753, "loss": 4.9105, "mean_token_accuracy": 0.21187319606542587, "num_tokens": 58545637.0, "step": 33755 }, { "entropy": 5.3664209842681885, "epoch": 2.626648511962653, "grad_norm": 1.1015625, "learning_rate": 0.0004306166849386317, "loss": 4.996, "mean_token_accuracy": 0.19240718483924865, "num_tokens": 58554575.0, "step": 33760 }, { "entropy": 5.328170299530029, "epoch": 2.6270375413343707, "grad_norm": 1.125, "learning_rate": 0.00043059666611195037, "loss": 4.8427, "mean_token_accuracy": 0.20593435168266297, "num_tokens": 58563150.0, "step": 33765 }, { "entropy": 5.3378674507141115, "epoch": 2.6274265707060884, "grad_norm": 1.1328125, "learning_rate": 0.0004305766449243372, "loss": 4.9961, "mean_token_accuracy": 0.19201348572969437, "num_tokens": 58571790.0, "step": 33770 }, { "entropy": 5.3259368419647215, "epoch": 2.627815600077806, "grad_norm": 1.109375, "learning_rate": 0.0004305566213760962, "loss": 4.9377, "mean_token_accuracy": 0.20279304534196854, "num_tokens": 58581094.0, "step": 33775 }, { "entropy": 5.430250215530395, "epoch": 2.6282046294495234, "grad_norm": 1.1796875, "learning_rate": 0.00043053659546753094, "loss": 5.0094, "mean_token_accuracy": 0.19294605404138565, "num_tokens": 58590836.0, "step": 33780 }, { "entropy": 5.403907108306885, "epoch": 2.628593658821241, "grad_norm": 1.15625, "learning_rate": 0.0004305165671989455, "loss": 4.9914, "mean_token_accuracy": 0.19500521421432496, "num_tokens": 58599315.0, "step": 33785 }, { "entropy": 5.375732135772705, "epoch": 2.6289826881929583, "grad_norm": 1.203125, "learning_rate": 0.0004304965365706437, "loss": 4.9652, "mean_token_accuracy": 0.2018195942044258, "num_tokens": 58607663.0, "step": 33790 }, { "entropy": 5.303044080734253, "epoch": 2.629371717564676, "grad_norm": 1.125, "learning_rate": 0.0004304765035829294, "loss": 4.9781, "mean_token_accuracy": 0.20152345597743987, "num_tokens": 58616513.0, "step": 33795 }, { "entropy": 5.45792145729065, "epoch": 2.6297607469363937, "grad_norm": 1.1875, "learning_rate": 0.00043045646823610664, "loss": 5.1101, "mean_token_accuracy": 0.1933145195245743, "num_tokens": 58625483.0, "step": 33800 }, { "entropy": 5.407931327819824, "epoch": 2.6301497763081114, "grad_norm": 1.140625, "learning_rate": 0.00043043643053047935, "loss": 5.0133, "mean_token_accuracy": 0.19704361408948898, "num_tokens": 58633880.0, "step": 33805 }, { "entropy": 5.43102879524231, "epoch": 2.6305388056798287, "grad_norm": 1.109375, "learning_rate": 0.0004304163904663517, "loss": 5.0039, "mean_token_accuracy": 0.19708012491464616, "num_tokens": 58642940.0, "step": 33810 }, { "entropy": 5.348496198654175, "epoch": 2.6309278350515464, "grad_norm": 1.140625, "learning_rate": 0.00043039634804402767, "loss": 4.9676, "mean_token_accuracy": 0.2047894313931465, "num_tokens": 58651736.0, "step": 33815 }, { "entropy": 5.43419041633606, "epoch": 2.631316864423264, "grad_norm": 1.1171875, "learning_rate": 0.0004303763032638114, "loss": 5.0002, "mean_token_accuracy": 0.19973311424255372, "num_tokens": 58660494.0, "step": 33820 }, { "entropy": 5.3585161685943605, "epoch": 2.6317058937949813, "grad_norm": 1.15625, "learning_rate": 0.0004303562561260071, "loss": 4.9971, "mean_token_accuracy": 0.19196023494005204, "num_tokens": 58669150.0, "step": 33825 }, { "entropy": 5.3444366455078125, "epoch": 2.632094923166699, "grad_norm": 1.171875, "learning_rate": 0.00043033620663091883, "loss": 4.9482, "mean_token_accuracy": 0.21073953956365585, "num_tokens": 58677806.0, "step": 33830 }, { "entropy": 5.34049072265625, "epoch": 2.6324839525384167, "grad_norm": 1.171875, "learning_rate": 0.0004303161547788509, "loss": 4.9465, "mean_token_accuracy": 0.20084349662065507, "num_tokens": 58686406.0, "step": 33835 }, { "entropy": 5.454685163497925, "epoch": 2.6328729819101344, "grad_norm": 1.234375, "learning_rate": 0.0004302961005701074, "loss": 5.071, "mean_token_accuracy": 0.19278971552848817, "num_tokens": 58696074.0, "step": 33840 }, { "entropy": 5.433259057998657, "epoch": 2.6332620112818517, "grad_norm": 1.1640625, "learning_rate": 0.00043027604400499295, "loss": 5.0322, "mean_token_accuracy": 0.20097335129976274, "num_tokens": 58704860.0, "step": 33845 }, { "entropy": 5.439332675933838, "epoch": 2.6336510406535694, "grad_norm": 1.1328125, "learning_rate": 0.00043025598508381155, "loss": 5.013, "mean_token_accuracy": 0.19542540460824967, "num_tokens": 58713455.0, "step": 33850 }, { "entropy": 5.291840124130249, "epoch": 2.634040070025287, "grad_norm": 1.1875, "learning_rate": 0.0004302359238068677, "loss": 4.9266, "mean_token_accuracy": 0.19805506914854049, "num_tokens": 58722382.0, "step": 33855 }, { "entropy": 5.43573226928711, "epoch": 2.6344290993970043, "grad_norm": 1.171875, "learning_rate": 0.00043021586017446585, "loss": 4.9524, "mean_token_accuracy": 0.20068986117839813, "num_tokens": 58730816.0, "step": 33860 }, { "entropy": 5.382688522338867, "epoch": 2.634818128768722, "grad_norm": 1.1640625, "learning_rate": 0.00043019579418691027, "loss": 4.9636, "mean_token_accuracy": 0.2000237688422203, "num_tokens": 58740143.0, "step": 33865 }, { "entropy": 5.30120964050293, "epoch": 2.6352071581404397, "grad_norm": 1.125, "learning_rate": 0.0004301757258445056, "loss": 4.9107, "mean_token_accuracy": 0.20167735517024993, "num_tokens": 58748347.0, "step": 33870 }, { "entropy": 5.287467050552368, "epoch": 2.6355961875121574, "grad_norm": 1.1875, "learning_rate": 0.0004301556551475563, "loss": 4.9432, "mean_token_accuracy": 0.19536378532648085, "num_tokens": 58756274.0, "step": 33875 }, { "entropy": 5.358163356781006, "epoch": 2.6359852168838747, "grad_norm": 1.2265625, "learning_rate": 0.0004301355820963669, "loss": 4.9607, "mean_token_accuracy": 0.20452135801315308, "num_tokens": 58764564.0, "step": 33880 }, { "entropy": 5.321017456054688, "epoch": 2.6363742462555924, "grad_norm": 1.1953125, "learning_rate": 0.0004301155066912419, "loss": 5.0225, "mean_token_accuracy": 0.19594679027795792, "num_tokens": 58772914.0, "step": 33885 }, { "entropy": 5.405888986587525, "epoch": 2.6367632756273096, "grad_norm": 1.25, "learning_rate": 0.000430095428932486, "loss": 5.0139, "mean_token_accuracy": 0.19712991416454315, "num_tokens": 58781572.0, "step": 33890 }, { "entropy": 5.40854663848877, "epoch": 2.6371523049990273, "grad_norm": 1.15625, "learning_rate": 0.00043007534882040385, "loss": 4.9885, "mean_token_accuracy": 0.1997486710548401, "num_tokens": 58789259.0, "step": 33895 }, { "entropy": 5.43879246711731, "epoch": 2.637541334370745, "grad_norm": 1.1328125, "learning_rate": 0.0004300552663553001, "loss": 5.0266, "mean_token_accuracy": 0.20097511857748032, "num_tokens": 58797984.0, "step": 33900 }, { "entropy": 5.399646186828614, "epoch": 2.6379303637424627, "grad_norm": 1.1796875, "learning_rate": 0.0004300351815374795, "loss": 4.9023, "mean_token_accuracy": 0.20719758570194244, "num_tokens": 58806474.0, "step": 33905 }, { "entropy": 5.387241697311401, "epoch": 2.63831939311418, "grad_norm": 1.1328125, "learning_rate": 0.0004300150943672467, "loss": 5.0846, "mean_token_accuracy": 0.19039632081985475, "num_tokens": 58816223.0, "step": 33910 }, { "entropy": 5.415988874435425, "epoch": 2.6387084224858977, "grad_norm": 1.1484375, "learning_rate": 0.0004299950048449067, "loss": 5.0007, "mean_token_accuracy": 0.19084305316209793, "num_tokens": 58824950.0, "step": 33915 }, { "entropy": 5.421756172180176, "epoch": 2.6390974518576154, "grad_norm": 1.25, "learning_rate": 0.0004299749129707641, "loss": 4.9947, "mean_token_accuracy": 0.19469838440418244, "num_tokens": 58833201.0, "step": 33920 }, { "entropy": 5.33601942062378, "epoch": 2.6394864812293326, "grad_norm": 1.203125, "learning_rate": 0.0004299548187451239, "loss": 4.9458, "mean_token_accuracy": 0.20292457491159438, "num_tokens": 58841621.0, "step": 33925 }, { "entropy": 5.321476554870605, "epoch": 2.6398755106010503, "grad_norm": 1.1796875, "learning_rate": 0.00042993472216829097, "loss": 4.9519, "mean_token_accuracy": 0.19912744164466858, "num_tokens": 58849831.0, "step": 33930 }, { "entropy": 5.339437007904053, "epoch": 2.640264539972768, "grad_norm": 1.15625, "learning_rate": 0.00042991462324057025, "loss": 5.0393, "mean_token_accuracy": 0.19632008373737336, "num_tokens": 58858530.0, "step": 33935 }, { "entropy": 5.420591068267822, "epoch": 2.6406535693444857, "grad_norm": 1.1328125, "learning_rate": 0.0004298945219622667, "loss": 5.1068, "mean_token_accuracy": 0.1883932739496231, "num_tokens": 58868127.0, "step": 33940 }, { "entropy": 5.406493902206421, "epoch": 2.641042598716203, "grad_norm": 1.15625, "learning_rate": 0.00042987441833368525, "loss": 4.9675, "mean_token_accuracy": 0.19873608648777008, "num_tokens": 58876959.0, "step": 33945 }, { "entropy": 5.367155504226685, "epoch": 2.6414316280879206, "grad_norm": 1.125, "learning_rate": 0.00042985431235513104, "loss": 4.9915, "mean_token_accuracy": 0.19830975085496902, "num_tokens": 58885534.0, "step": 33950 }, { "entropy": 5.4311511516571045, "epoch": 2.6418206574596383, "grad_norm": 1.1328125, "learning_rate": 0.00042983420402690917, "loss": 5.0398, "mean_token_accuracy": 0.20027358829975128, "num_tokens": 58894600.0, "step": 33955 }, { "entropy": 5.41059455871582, "epoch": 2.6422096868313556, "grad_norm": 1.1640625, "learning_rate": 0.00042981409334932457, "loss": 5.038, "mean_token_accuracy": 0.19373781383037567, "num_tokens": 58903243.0, "step": 33960 }, { "entropy": 5.400194835662842, "epoch": 2.6425987162030733, "grad_norm": 1.1328125, "learning_rate": 0.0004297939803226826, "loss": 5.053, "mean_token_accuracy": 0.19630462527275086, "num_tokens": 58911058.0, "step": 33965 }, { "entropy": 5.432136535644531, "epoch": 2.642987745574791, "grad_norm": 1.15625, "learning_rate": 0.0004297738649472884, "loss": 5.0508, "mean_token_accuracy": 0.19819913655519486, "num_tokens": 58919698.0, "step": 33970 }, { "entropy": 5.4930871486663815, "epoch": 2.6433767749465087, "grad_norm": 1.265625, "learning_rate": 0.00042975374722344713, "loss": 5.1941, "mean_token_accuracy": 0.18508311957120896, "num_tokens": 58929276.0, "step": 33975 }, { "entropy": 5.529504680633545, "epoch": 2.643765804318226, "grad_norm": 1.1171875, "learning_rate": 0.00042973362715146397, "loss": 5.1106, "mean_token_accuracy": 0.1930304065346718, "num_tokens": 58938148.0, "step": 33980 }, { "entropy": 5.413777685165405, "epoch": 2.6441548336899436, "grad_norm": 1.1328125, "learning_rate": 0.0004297135047316444, "loss": 4.9456, "mean_token_accuracy": 0.19399710595607758, "num_tokens": 58946406.0, "step": 33985 }, { "entropy": 5.423583221435547, "epoch": 2.644543863061661, "grad_norm": 1.125, "learning_rate": 0.0004296933799642936, "loss": 5.0627, "mean_token_accuracy": 0.18798491805791856, "num_tokens": 58954914.0, "step": 33990 }, { "entropy": 5.42130036354065, "epoch": 2.6449328924333786, "grad_norm": 1.1484375, "learning_rate": 0.000429673252849717, "loss": 4.9597, "mean_token_accuracy": 0.20014220774173735, "num_tokens": 58963236.0, "step": 33995 }, { "entropy": 5.3958714485168455, "epoch": 2.6453219218050963, "grad_norm": 1.28125, "learning_rate": 0.00042965312338822005, "loss": 5.0339, "mean_token_accuracy": 0.19641783982515335, "num_tokens": 58972141.0, "step": 34000 }, { "entropy": 5.392393398284912, "epoch": 2.645710951176814, "grad_norm": 1.078125, "learning_rate": 0.000429632991580108, "loss": 5.0868, "mean_token_accuracy": 0.1937030404806137, "num_tokens": 58982348.0, "step": 34005 }, { "entropy": 5.448680448532104, "epoch": 2.6460999805485317, "grad_norm": 1.15625, "learning_rate": 0.0004296128574256864, "loss": 5.0166, "mean_token_accuracy": 0.19493293911218643, "num_tokens": 58990858.0, "step": 34010 }, { "entropy": 5.299312353134155, "epoch": 2.646489009920249, "grad_norm": 1.078125, "learning_rate": 0.00042959272092526086, "loss": 4.8856, "mean_token_accuracy": 0.20283929109573365, "num_tokens": 58999841.0, "step": 34015 }, { "entropy": 5.306032752990722, "epoch": 2.6468780392919666, "grad_norm": 1.1953125, "learning_rate": 0.00042957258207913687, "loss": 4.9094, "mean_token_accuracy": 0.20322803109884263, "num_tokens": 59008538.0, "step": 34020 }, { "entropy": 5.318527460098267, "epoch": 2.647267068663684, "grad_norm": 1.203125, "learning_rate": 0.00042955244088761985, "loss": 4.9155, "mean_token_accuracy": 0.19806606322526932, "num_tokens": 59016656.0, "step": 34025 }, { "entropy": 5.4330912113189695, "epoch": 2.6476560980354016, "grad_norm": 1.140625, "learning_rate": 0.0004295322973510156, "loss": 4.9965, "mean_token_accuracy": 0.20220135748386384, "num_tokens": 59025682.0, "step": 34030 }, { "entropy": 5.41906852722168, "epoch": 2.6480451274071193, "grad_norm": 1.1640625, "learning_rate": 0.0004295121514696297, "loss": 5.0676, "mean_token_accuracy": 0.19688004702329637, "num_tokens": 59033448.0, "step": 34035 }, { "entropy": 5.383317661285401, "epoch": 2.648434156778837, "grad_norm": 1.21875, "learning_rate": 0.00042949200324376784, "loss": 4.9809, "mean_token_accuracy": 0.19861141145229338, "num_tokens": 59042220.0, "step": 34040 }, { "entropy": 5.398624849319458, "epoch": 2.6488231861505542, "grad_norm": 1.171875, "learning_rate": 0.0004294718526737357, "loss": 5.0261, "mean_token_accuracy": 0.19952138215303422, "num_tokens": 59050337.0, "step": 34045 }, { "entropy": 5.361309766769409, "epoch": 2.649212215522272, "grad_norm": 1.171875, "learning_rate": 0.0004294516997598391, "loss": 4.998, "mean_token_accuracy": 0.19630155116319656, "num_tokens": 59059186.0, "step": 34050 }, { "entropy": 5.395581007003784, "epoch": 2.6496012448939896, "grad_norm": 1.1015625, "learning_rate": 0.0004294315445023838, "loss": 5.047, "mean_token_accuracy": 0.19041151255369188, "num_tokens": 59068714.0, "step": 34055 }, { "entropy": 5.485059595108032, "epoch": 2.649990274265707, "grad_norm": 1.15625, "learning_rate": 0.00042941138690167556, "loss": 5.1509, "mean_token_accuracy": 0.18468718379735946, "num_tokens": 59077015.0, "step": 34060 }, { "entropy": 5.418365430831909, "epoch": 2.6503793036374246, "grad_norm": 1.1171875, "learning_rate": 0.0004293912269580204, "loss": 5.0105, "mean_token_accuracy": 0.1970279261469841, "num_tokens": 59085766.0, "step": 34065 }, { "entropy": 5.467449903488159, "epoch": 2.6507683330091423, "grad_norm": 1.125, "learning_rate": 0.000429371064671724, "loss": 5.0556, "mean_token_accuracy": 0.1883290097117424, "num_tokens": 59094390.0, "step": 34070 }, { "entropy": 5.48091950416565, "epoch": 2.65115736238086, "grad_norm": 1.1796875, "learning_rate": 0.00042935090004309247, "loss": 5.0319, "mean_token_accuracy": 0.19576746523380278, "num_tokens": 59102310.0, "step": 34075 }, { "entropy": 5.456078004837036, "epoch": 2.6515463917525772, "grad_norm": 1.2109375, "learning_rate": 0.00042933073307243165, "loss": 5.001, "mean_token_accuracy": 0.19584300369024277, "num_tokens": 59111385.0, "step": 34080 }, { "entropy": 5.404288625717163, "epoch": 2.651935421124295, "grad_norm": 1.1484375, "learning_rate": 0.00042931056376004767, "loss": 5.0713, "mean_token_accuracy": 0.19850219488143922, "num_tokens": 59120152.0, "step": 34085 }, { "entropy": 5.381229114532471, "epoch": 2.652324450496012, "grad_norm": 1.171875, "learning_rate": 0.0004292903921062465, "loss": 4.8746, "mean_token_accuracy": 0.21270565390586854, "num_tokens": 59128782.0, "step": 34090 }, { "entropy": 5.441132831573486, "epoch": 2.65271347986773, "grad_norm": 1.1328125, "learning_rate": 0.00042927021811133416, "loss": 5.02, "mean_token_accuracy": 0.19743793159723283, "num_tokens": 59136946.0, "step": 34095 }, { "entropy": 5.355271530151367, "epoch": 2.6531025092394476, "grad_norm": 1.21875, "learning_rate": 0.0004292500417756167, "loss": 4.9521, "mean_token_accuracy": 0.20467088371515274, "num_tokens": 59145845.0, "step": 34100 }, { "entropy": 5.480632495880127, "epoch": 2.6534915386111653, "grad_norm": 1.3125, "learning_rate": 0.00042922986309940054, "loss": 5.0926, "mean_token_accuracy": 0.18817767202854158, "num_tokens": 59154607.0, "step": 34105 }, { "entropy": 5.345821142196655, "epoch": 2.653880567982883, "grad_norm": 1.140625, "learning_rate": 0.00042920968208299165, "loss": 4.9979, "mean_token_accuracy": 0.1961749315261841, "num_tokens": 59164160.0, "step": 34110 }, { "entropy": 5.413113260269165, "epoch": 2.6542695973546, "grad_norm": 1.1953125, "learning_rate": 0.0004291894987266963, "loss": 4.975, "mean_token_accuracy": 0.2036278709769249, "num_tokens": 59171976.0, "step": 34115 }, { "entropy": 5.366276836395263, "epoch": 2.654658626726318, "grad_norm": 1.171875, "learning_rate": 0.00042916931303082064, "loss": 5.0274, "mean_token_accuracy": 0.19248372912406922, "num_tokens": 59181168.0, "step": 34120 }, { "entropy": 5.501958894729614, "epoch": 2.655047656098035, "grad_norm": 1.0703125, "learning_rate": 0.00042914912499567113, "loss": 5.1644, "mean_token_accuracy": 0.18492101430892943, "num_tokens": 59190047.0, "step": 34125 }, { "entropy": 5.442483282089233, "epoch": 2.655436685469753, "grad_norm": 1.078125, "learning_rate": 0.00042912893462155395, "loss": 5.0152, "mean_token_accuracy": 0.1948254033923149, "num_tokens": 59199065.0, "step": 34130 }, { "entropy": 5.347232627868652, "epoch": 2.6558257148414706, "grad_norm": 1.1484375, "learning_rate": 0.00042910874190877545, "loss": 4.9185, "mean_token_accuracy": 0.20756661593914033, "num_tokens": 59207827.0, "step": 34135 }, { "entropy": 5.431786108016968, "epoch": 2.6562147442131883, "grad_norm": 1.1640625, "learning_rate": 0.0004290885468576422, "loss": 5.1286, "mean_token_accuracy": 0.18795362561941148, "num_tokens": 59216429.0, "step": 34140 }, { "entropy": 5.361321020126343, "epoch": 2.6566037735849055, "grad_norm": 1.140625, "learning_rate": 0.0004290683494684604, "loss": 4.97, "mean_token_accuracy": 0.189467254281044, "num_tokens": 59224447.0, "step": 34145 }, { "entropy": 5.4632689476013185, "epoch": 2.656992802956623, "grad_norm": 1.1484375, "learning_rate": 0.0004290481497415367, "loss": 5.066, "mean_token_accuracy": 0.18852092027664186, "num_tokens": 59233124.0, "step": 34150 }, { "entropy": 5.327345323562622, "epoch": 2.657381832328341, "grad_norm": 1.125, "learning_rate": 0.0004290279476771775, "loss": 4.9047, "mean_token_accuracy": 0.20259241312742232, "num_tokens": 59241450.0, "step": 34155 }, { "entropy": 5.403840112686157, "epoch": 2.657770861700058, "grad_norm": 1.1484375, "learning_rate": 0.0004290077432756894, "loss": 5.1408, "mean_token_accuracy": 0.18461692333221436, "num_tokens": 59250797.0, "step": 34160 }, { "entropy": 5.393539953231811, "epoch": 2.658159891071776, "grad_norm": 1.1640625, "learning_rate": 0.0004289875365373788, "loss": 4.9075, "mean_token_accuracy": 0.20092692077159882, "num_tokens": 59258854.0, "step": 34165 }, { "entropy": 5.438014078140259, "epoch": 2.6585489204434936, "grad_norm": 1.1953125, "learning_rate": 0.00042896732746255256, "loss": 5.0034, "mean_token_accuracy": 0.19441579282283783, "num_tokens": 59267797.0, "step": 34170 }, { "entropy": 5.361431407928467, "epoch": 2.6589379498152113, "grad_norm": 1.1015625, "learning_rate": 0.00042894711605151714, "loss": 4.9037, "mean_token_accuracy": 0.2024035394191742, "num_tokens": 59276370.0, "step": 34175 }, { "entropy": 5.352745389938354, "epoch": 2.6593269791869285, "grad_norm": 1.1015625, "learning_rate": 0.00042892690230457924, "loss": 4.9805, "mean_token_accuracy": 0.19391236305236817, "num_tokens": 59285641.0, "step": 34180 }, { "entropy": 5.367085409164429, "epoch": 2.659716008558646, "grad_norm": 1.1640625, "learning_rate": 0.00042890668622204566, "loss": 4.9927, "mean_token_accuracy": 0.1983859658241272, "num_tokens": 59293816.0, "step": 34185 }, { "entropy": 5.387168025970459, "epoch": 2.660105037930364, "grad_norm": 1.125, "learning_rate": 0.000428886467804223, "loss": 4.919, "mean_token_accuracy": 0.20364300012588502, "num_tokens": 59301854.0, "step": 34190 }, { "entropy": 5.289494228363037, "epoch": 2.660494067302081, "grad_norm": 1.125, "learning_rate": 0.00042886624705141825, "loss": 4.9387, "mean_token_accuracy": 0.1990928828716278, "num_tokens": 59310798.0, "step": 34195 }, { "entropy": 5.347465562820434, "epoch": 2.660883096673799, "grad_norm": 1.1953125, "learning_rate": 0.00042884602396393796, "loss": 4.9863, "mean_token_accuracy": 0.19715733379125594, "num_tokens": 59319085.0, "step": 34200 }, { "entropy": 5.381764078140259, "epoch": 2.6612721260455166, "grad_norm": 1.109375, "learning_rate": 0.0004288257985420892, "loss": 5.0505, "mean_token_accuracy": 0.19189455956220627, "num_tokens": 59327805.0, "step": 34205 }, { "entropy": 5.465325927734375, "epoch": 2.6616611554172342, "grad_norm": 1.1328125, "learning_rate": 0.0004288055707861788, "loss": 4.9766, "mean_token_accuracy": 0.20451024919748306, "num_tokens": 59336520.0, "step": 34210 }, { "entropy": 5.375922393798828, "epoch": 2.6620501847889515, "grad_norm": 1.125, "learning_rate": 0.00042878534069651364, "loss": 5.0458, "mean_token_accuracy": 0.19396799355745314, "num_tokens": 59345827.0, "step": 34215 }, { "entropy": 5.384785985946655, "epoch": 2.662439214160669, "grad_norm": 1.2265625, "learning_rate": 0.0004287651082734007, "loss": 5.047, "mean_token_accuracy": 0.2000302717089653, "num_tokens": 59355024.0, "step": 34220 }, { "entropy": 5.360146951675415, "epoch": 2.6628282435323865, "grad_norm": 1.1171875, "learning_rate": 0.000428744873517147, "loss": 4.9317, "mean_token_accuracy": 0.19957145899534226, "num_tokens": 59364461.0, "step": 34225 }, { "entropy": 5.392741584777832, "epoch": 2.663217272904104, "grad_norm": 1.171875, "learning_rate": 0.0004287246364280596, "loss": 5.0904, "mean_token_accuracy": 0.1864723950624466, "num_tokens": 59372807.0, "step": 34230 }, { "entropy": 5.464121723175049, "epoch": 2.663606302275822, "grad_norm": 1.09375, "learning_rate": 0.0004287043970064455, "loss": 5.0407, "mean_token_accuracy": 0.19846223890781403, "num_tokens": 59381824.0, "step": 34235 }, { "entropy": 5.371962642669677, "epoch": 2.6639953316475395, "grad_norm": 1.078125, "learning_rate": 0.0004286841552526118, "loss": 4.9417, "mean_token_accuracy": 0.19834139347076415, "num_tokens": 59391174.0, "step": 34240 }, { "entropy": 5.349871683120727, "epoch": 2.664384361019257, "grad_norm": 1.0546875, "learning_rate": 0.00042866391116686567, "loss": 5.0421, "mean_token_accuracy": 0.19739351272583008, "num_tokens": 59399927.0, "step": 34245 }, { "entropy": 5.431089878082275, "epoch": 2.6647733903909745, "grad_norm": 1.1953125, "learning_rate": 0.0004286436647495142, "loss": 5.0332, "mean_token_accuracy": 0.1994730606675148, "num_tokens": 59408016.0, "step": 34250 }, { "entropy": 5.401451826095581, "epoch": 2.665162419762692, "grad_norm": 1.375, "learning_rate": 0.00042862341600086477, "loss": 5.067, "mean_token_accuracy": 0.19018494635820388, "num_tokens": 59416702.0, "step": 34255 }, { "entropy": 5.391842317581177, "epoch": 2.6655514491344094, "grad_norm": 1.0859375, "learning_rate": 0.00042860316492122447, "loss": 4.9491, "mean_token_accuracy": 0.1969820663332939, "num_tokens": 59424766.0, "step": 34260 }, { "entropy": 5.400101804733277, "epoch": 2.665940478506127, "grad_norm": 1.2265625, "learning_rate": 0.0004285829115109006, "loss": 5.0564, "mean_token_accuracy": 0.19883065670728683, "num_tokens": 59433691.0, "step": 34265 }, { "entropy": 5.43451714515686, "epoch": 2.666329507877845, "grad_norm": 1.0859375, "learning_rate": 0.0004285626557702005, "loss": 5.0533, "mean_token_accuracy": 0.19789710640907288, "num_tokens": 59442495.0, "step": 34270 }, { "entropy": 5.367371845245361, "epoch": 2.6667185372495625, "grad_norm": 1.1484375, "learning_rate": 0.0004285423976994316, "loss": 4.9517, "mean_token_accuracy": 0.20110870003700257, "num_tokens": 59451038.0, "step": 34275 }, { "entropy": 5.298448514938355, "epoch": 2.66710756662128, "grad_norm": 1.1484375, "learning_rate": 0.00042852213729890117, "loss": 4.9649, "mean_token_accuracy": 0.19888628274202347, "num_tokens": 59459119.0, "step": 34280 }, { "entropy": 5.378402948379517, "epoch": 2.6674965959929975, "grad_norm": 1.125, "learning_rate": 0.0004285018745689166, "loss": 4.974, "mean_token_accuracy": 0.20053848773241043, "num_tokens": 59467725.0, "step": 34285 }, { "entropy": 5.42381534576416, "epoch": 2.667885625364715, "grad_norm": 1.3359375, "learning_rate": 0.0004284816095097855, "loss": 4.9761, "mean_token_accuracy": 0.1975323513150215, "num_tokens": 59476231.0, "step": 34290 }, { "entropy": 5.352923011779785, "epoch": 2.6682746547364324, "grad_norm": 1.1171875, "learning_rate": 0.0004284613421218152, "loss": 5.0035, "mean_token_accuracy": 0.19331594705581664, "num_tokens": 59484898.0, "step": 34295 }, { "entropy": 5.359823894500733, "epoch": 2.66866368410815, "grad_norm": 1.109375, "learning_rate": 0.00042844107240531324, "loss": 4.9263, "mean_token_accuracy": 0.200864040851593, "num_tokens": 59493546.0, "step": 34300 }, { "entropy": 5.3814184188842775, "epoch": 2.669052713479868, "grad_norm": 1.109375, "learning_rate": 0.0004284208003605873, "loss": 5.0033, "mean_token_accuracy": 0.19196025282144547, "num_tokens": 59502729.0, "step": 34305 }, { "entropy": 5.3861700057983395, "epoch": 2.6694417428515855, "grad_norm": 1.109375, "learning_rate": 0.000428400525987945, "loss": 5.0584, "mean_token_accuracy": 0.18843467980623246, "num_tokens": 59512069.0, "step": 34310 }, { "entropy": 5.415060997009277, "epoch": 2.669830772223303, "grad_norm": 1.0859375, "learning_rate": 0.00042838024928769375, "loss": 5.0131, "mean_token_accuracy": 0.19946872293949128, "num_tokens": 59520639.0, "step": 34315 }, { "entropy": 5.400388383865357, "epoch": 2.6702198015950205, "grad_norm": 1.125, "learning_rate": 0.00042835997026014145, "loss": 4.9278, "mean_token_accuracy": 0.20618724972009658, "num_tokens": 59528549.0, "step": 34320 }, { "entropy": 5.354205560684204, "epoch": 2.6706088309667377, "grad_norm": 1.125, "learning_rate": 0.0004283396889055957, "loss": 4.9586, "mean_token_accuracy": 0.20648440420627595, "num_tokens": 59537345.0, "step": 34325 }, { "entropy": 5.358095026016235, "epoch": 2.6709978603384554, "grad_norm": 1.109375, "learning_rate": 0.0004283194052243641, "loss": 5.0439, "mean_token_accuracy": 0.1978743180632591, "num_tokens": 59546866.0, "step": 34330 }, { "entropy": 5.457716226577759, "epoch": 2.671386889710173, "grad_norm": 1.109375, "learning_rate": 0.00042829911921675456, "loss": 4.9965, "mean_token_accuracy": 0.2010033667087555, "num_tokens": 59555363.0, "step": 34335 }, { "entropy": 5.331245756149292, "epoch": 2.671775919081891, "grad_norm": 1.0703125, "learning_rate": 0.000428278830883075, "loss": 4.8783, "mean_token_accuracy": 0.2030148908495903, "num_tokens": 59564417.0, "step": 34340 }, { "entropy": 5.502124977111817, "epoch": 2.6721649484536085, "grad_norm": 1.1796875, "learning_rate": 0.00042825854022363307, "loss": 4.9891, "mean_token_accuracy": 0.19220607876777648, "num_tokens": 59572948.0, "step": 34345 }, { "entropy": 5.322700786590576, "epoch": 2.6725539778253258, "grad_norm": 1.1015625, "learning_rate": 0.00042823824723873676, "loss": 4.9359, "mean_token_accuracy": 0.19934329837560655, "num_tokens": 59581764.0, "step": 34350 }, { "entropy": 5.314413452148438, "epoch": 2.6729430071970435, "grad_norm": 1.09375, "learning_rate": 0.00042821795192869407, "loss": 4.9643, "mean_token_accuracy": 0.20451496988534928, "num_tokens": 59590281.0, "step": 34355 }, { "entropy": 5.489963531494141, "epoch": 2.6733320365687607, "grad_norm": 1.2890625, "learning_rate": 0.0004281976542938127, "loss": 5.1313, "mean_token_accuracy": 0.1904164284467697, "num_tokens": 59598497.0, "step": 34360 }, { "entropy": 5.411137866973877, "epoch": 2.6737210659404784, "grad_norm": 1.09375, "learning_rate": 0.00042817735433440076, "loss": 4.9635, "mean_token_accuracy": 0.2024264469742775, "num_tokens": 59606901.0, "step": 34365 }, { "entropy": 5.494289302825928, "epoch": 2.674110095312196, "grad_norm": 1.1015625, "learning_rate": 0.0004281570520507663, "loss": 5.1121, "mean_token_accuracy": 0.19492388814687728, "num_tokens": 59616045.0, "step": 34370 }, { "entropy": 5.472842264175415, "epoch": 2.674499124683914, "grad_norm": 1.09375, "learning_rate": 0.00042813674744321737, "loss": 5.0377, "mean_token_accuracy": 0.20080640465021132, "num_tokens": 59624840.0, "step": 34375 }, { "entropy": 5.411509370803833, "epoch": 2.674888154055631, "grad_norm": 1.21875, "learning_rate": 0.000428116440512062, "loss": 5.0087, "mean_token_accuracy": 0.19539084285497665, "num_tokens": 59632887.0, "step": 34380 }, { "entropy": 5.33553729057312, "epoch": 2.6752771834273488, "grad_norm": 1.1484375, "learning_rate": 0.0004280961312576084, "loss": 4.948, "mean_token_accuracy": 0.20470093041658402, "num_tokens": 59641671.0, "step": 34385 }, { "entropy": 5.269271183013916, "epoch": 2.6756662127990665, "grad_norm": 1.0390625, "learning_rate": 0.0004280758196801646, "loss": 4.8923, "mean_token_accuracy": 0.2071111962199211, "num_tokens": 59649406.0, "step": 34390 }, { "entropy": 5.416578245162964, "epoch": 2.6760552421707837, "grad_norm": 1.046875, "learning_rate": 0.00042805550578003894, "loss": 5.0778, "mean_token_accuracy": 0.19426416754722595, "num_tokens": 59658114.0, "step": 34395 }, { "entropy": 5.437091732025147, "epoch": 2.6764442715425014, "grad_norm": 1.15625, "learning_rate": 0.0004280351895575396, "loss": 5.0175, "mean_token_accuracy": 0.1957835778594017, "num_tokens": 59667174.0, "step": 34400 }, { "entropy": 5.342769956588745, "epoch": 2.676833300914219, "grad_norm": 1.1328125, "learning_rate": 0.0004280148710129748, "loss": 4.9987, "mean_token_accuracy": 0.2011121168732643, "num_tokens": 59675740.0, "step": 34405 }, { "entropy": 5.474993705749512, "epoch": 2.677222330285937, "grad_norm": 1.234375, "learning_rate": 0.00042799455014665296, "loss": 5.1539, "mean_token_accuracy": 0.18720866590738297, "num_tokens": 59684550.0, "step": 34410 }, { "entropy": 5.523981428146362, "epoch": 2.677611359657654, "grad_norm": 1.1875, "learning_rate": 0.00042797422695888226, "loss": 5.0701, "mean_token_accuracy": 0.19565058797597884, "num_tokens": 59692810.0, "step": 34415 }, { "entropy": 5.40265679359436, "epoch": 2.6780003890293718, "grad_norm": 1.15625, "learning_rate": 0.0004279539014499712, "loss": 4.991, "mean_token_accuracy": 0.19077727496623992, "num_tokens": 59701742.0, "step": 34420 }, { "entropy": 5.413672828674317, "epoch": 2.678389418401089, "grad_norm": 1.171875, "learning_rate": 0.0004279335736202281, "loss": 5.0169, "mean_token_accuracy": 0.19683320671319962, "num_tokens": 59710440.0, "step": 34425 }, { "entropy": 5.496515560150146, "epoch": 2.6787784477728067, "grad_norm": 1.09375, "learning_rate": 0.0004279132434699615, "loss": 5.0835, "mean_token_accuracy": 0.19308008402585983, "num_tokens": 59720430.0, "step": 34430 }, { "entropy": 5.342096757888794, "epoch": 2.6791674771445244, "grad_norm": 1.1953125, "learning_rate": 0.0004278929109994798, "loss": 4.95, "mean_token_accuracy": 0.19330374002456666, "num_tokens": 59730249.0, "step": 34435 }, { "entropy": 5.362269926071167, "epoch": 2.679556506516242, "grad_norm": 1.171875, "learning_rate": 0.00042787257620909144, "loss": 4.8993, "mean_token_accuracy": 0.20127840340137482, "num_tokens": 59738815.0, "step": 34440 }, { "entropy": 5.289106607437134, "epoch": 2.67994553588796, "grad_norm": 1.1875, "learning_rate": 0.00042785223909910515, "loss": 4.8953, "mean_token_accuracy": 0.19872929900884628, "num_tokens": 59747092.0, "step": 34445 }, { "entropy": 5.4077647686004635, "epoch": 2.680334565259677, "grad_norm": 1.140625, "learning_rate": 0.0004278318996698294, "loss": 5.0701, "mean_token_accuracy": 0.19181589186191558, "num_tokens": 59756832.0, "step": 34450 }, { "entropy": 5.50298318862915, "epoch": 2.6807235946313948, "grad_norm": 1.265625, "learning_rate": 0.0004278115579215728, "loss": 5.0688, "mean_token_accuracy": 0.19121240228414535, "num_tokens": 59766052.0, "step": 34455 }, { "entropy": 5.407856464385986, "epoch": 2.681112624003112, "grad_norm": 1.171875, "learning_rate": 0.0004277912138546441, "loss": 4.9782, "mean_token_accuracy": 0.19869401752948762, "num_tokens": 59774369.0, "step": 34460 }, { "entropy": 5.313616418838501, "epoch": 2.6815016533748297, "grad_norm": 1.1015625, "learning_rate": 0.0004277708674693519, "loss": 4.9266, "mean_token_accuracy": 0.20080707520246505, "num_tokens": 59782509.0, "step": 34465 }, { "entropy": 5.312063217163086, "epoch": 2.6818906827465474, "grad_norm": 1.1328125, "learning_rate": 0.00042775051876600483, "loss": 4.886, "mean_token_accuracy": 0.20883483588695526, "num_tokens": 59790808.0, "step": 34470 }, { "entropy": 5.364171504974365, "epoch": 2.682279712118265, "grad_norm": 1.1640625, "learning_rate": 0.0004277301677449119, "loss": 4.8725, "mean_token_accuracy": 0.20297887325286865, "num_tokens": 59799260.0, "step": 34475 }, { "entropy": 5.420628786087036, "epoch": 2.6826687414899824, "grad_norm": 1.21875, "learning_rate": 0.0004277098144063818, "loss": 5.0339, "mean_token_accuracy": 0.19999630451202394, "num_tokens": 59807350.0, "step": 34480 }, { "entropy": 5.384455585479737, "epoch": 2.6830577708617, "grad_norm": 1.078125, "learning_rate": 0.00042768945875072326, "loss": 5.0383, "mean_token_accuracy": 0.19103001356124877, "num_tokens": 59816071.0, "step": 34485 }, { "entropy": 5.463081359863281, "epoch": 2.6834468002334178, "grad_norm": 1.1796875, "learning_rate": 0.0004276691007782451, "loss": 5.0159, "mean_token_accuracy": 0.2002073734998703, "num_tokens": 59825332.0, "step": 34490 }, { "entropy": 5.400717067718506, "epoch": 2.683835829605135, "grad_norm": 1.1015625, "learning_rate": 0.0004276487404892565, "loss": 5.0158, "mean_token_accuracy": 0.19342595636844634, "num_tokens": 59834082.0, "step": 34495 }, { "entropy": 5.44166841506958, "epoch": 2.6842248589768527, "grad_norm": 1.1484375, "learning_rate": 0.00042762837788406615, "loss": 5.0308, "mean_token_accuracy": 0.19211960285902024, "num_tokens": 59842633.0, "step": 34500 }, { "entropy": 5.441576242446899, "epoch": 2.6846138883485704, "grad_norm": 1.2109375, "learning_rate": 0.0004276080129629831, "loss": 4.9891, "mean_token_accuracy": 0.19263278543949128, "num_tokens": 59850517.0, "step": 34505 }, { "entropy": 5.427461194992065, "epoch": 2.685002917720288, "grad_norm": 1.5703125, "learning_rate": 0.00042758764572631644, "loss": 5.0889, "mean_token_accuracy": 0.1949665367603302, "num_tokens": 59859112.0, "step": 34510 }, { "entropy": 5.371607875823974, "epoch": 2.6853919470920053, "grad_norm": 1.1328125, "learning_rate": 0.00042756727617437504, "loss": 4.9154, "mean_token_accuracy": 0.20073309987783433, "num_tokens": 59868413.0, "step": 34515 }, { "entropy": 5.493725347518921, "epoch": 2.685780976463723, "grad_norm": 1.171875, "learning_rate": 0.00042754690430746805, "loss": 5.1118, "mean_token_accuracy": 0.18919164538383484, "num_tokens": 59877300.0, "step": 34520 }, { "entropy": 5.385222578048706, "epoch": 2.6861700058354403, "grad_norm": 1.1328125, "learning_rate": 0.0004275265301259046, "loss": 5.0244, "mean_token_accuracy": 0.20145601779222488, "num_tokens": 59885440.0, "step": 34525 }, { "entropy": 5.488229560852051, "epoch": 2.686559035207158, "grad_norm": 1.140625, "learning_rate": 0.00042750615362999395, "loss": 5.1289, "mean_token_accuracy": 0.18318473249673844, "num_tokens": 59893954.0, "step": 34530 }, { "entropy": 5.422585344314575, "epoch": 2.6869480645788757, "grad_norm": 1.109375, "learning_rate": 0.00042748577482004495, "loss": 5.0393, "mean_token_accuracy": 0.19546912014484405, "num_tokens": 59902336.0, "step": 34535 }, { "entropy": 5.309809732437134, "epoch": 2.6873370939505934, "grad_norm": 1.09375, "learning_rate": 0.00042746539369636715, "loss": 4.8922, "mean_token_accuracy": 0.20755211263895035, "num_tokens": 59911134.0, "step": 34540 }, { "entropy": 5.295792007446289, "epoch": 2.687726123322311, "grad_norm": 1.4765625, "learning_rate": 0.00042744501025926966, "loss": 4.8894, "mean_token_accuracy": 0.20303991585969924, "num_tokens": 59920450.0, "step": 34545 }, { "entropy": 5.46213846206665, "epoch": 2.6881151526940283, "grad_norm": 1.125, "learning_rate": 0.0004274246245090618, "loss": 4.9616, "mean_token_accuracy": 0.20705340802669525, "num_tokens": 59928919.0, "step": 34550 }, { "entropy": 5.389980745315552, "epoch": 2.688504182065746, "grad_norm": 1.1328125, "learning_rate": 0.0004274042364460529, "loss": 4.9909, "mean_token_accuracy": 0.19752189218997956, "num_tokens": 59937973.0, "step": 34555 }, { "entropy": 5.34364070892334, "epoch": 2.6888932114374633, "grad_norm": 1.1328125, "learning_rate": 0.00042738384607055214, "loss": 5.0151, "mean_token_accuracy": 0.19624349027872084, "num_tokens": 59946177.0, "step": 34560 }, { "entropy": 5.387221240997315, "epoch": 2.689282240809181, "grad_norm": 1.1953125, "learning_rate": 0.00042736345338286917, "loss": 4.9937, "mean_token_accuracy": 0.20159117877483368, "num_tokens": 59955351.0, "step": 34565 }, { "entropy": 5.474174213409424, "epoch": 2.6896712701808987, "grad_norm": 1.1640625, "learning_rate": 0.0004273430583833133, "loss": 5.0686, "mean_token_accuracy": 0.1945489227771759, "num_tokens": 59963839.0, "step": 34570 }, { "entropy": 5.3866644382476805, "epoch": 2.6900602995526164, "grad_norm": 1.15625, "learning_rate": 0.000427322661072194, "loss": 4.9966, "mean_token_accuracy": 0.19049329310655594, "num_tokens": 59971779.0, "step": 34575 }, { "entropy": 5.392128753662109, "epoch": 2.6904493289243336, "grad_norm": 1.1328125, "learning_rate": 0.0004273022614498208, "loss": 4.9626, "mean_token_accuracy": 0.2020797312259674, "num_tokens": 59980932.0, "step": 34580 }, { "entropy": 5.382230615615844, "epoch": 2.6908383582960513, "grad_norm": 1.171875, "learning_rate": 0.0004272818595165031, "loss": 4.9731, "mean_token_accuracy": 0.20196616351604463, "num_tokens": 59990281.0, "step": 34585 }, { "entropy": 5.297256755828857, "epoch": 2.691227387667769, "grad_norm": 1.1015625, "learning_rate": 0.0004272614552725506, "loss": 4.8847, "mean_token_accuracy": 0.21121360063552858, "num_tokens": 59998642.0, "step": 34590 }, { "entropy": 5.405024909973145, "epoch": 2.6916164170394863, "grad_norm": 1.171875, "learning_rate": 0.00042724104871827293, "loss": 5.0735, "mean_token_accuracy": 0.1906057357788086, "num_tokens": 60006998.0, "step": 34595 }, { "entropy": 5.3436497211456295, "epoch": 2.692005446411204, "grad_norm": 1.1328125, "learning_rate": 0.0004272206398539795, "loss": 4.9472, "mean_token_accuracy": 0.20375546663999558, "num_tokens": 60015279.0, "step": 34600 }, { "entropy": 5.365096139907837, "epoch": 2.6923944757829217, "grad_norm": 1.1953125, "learning_rate": 0.00042720022867998026, "loss": 5.0204, "mean_token_accuracy": 0.20281146764755248, "num_tokens": 60024648.0, "step": 34605 }, { "entropy": 5.503239297866822, "epoch": 2.6927835051546394, "grad_norm": 1.09375, "learning_rate": 0.0004271798151965848, "loss": 5.0943, "mean_token_accuracy": 0.18786617666482924, "num_tokens": 60033821.0, "step": 34610 }, { "entropy": 5.390892791748047, "epoch": 2.6931725345263566, "grad_norm": 1.21875, "learning_rate": 0.0004271593994041029, "loss": 5.0021, "mean_token_accuracy": 0.19315481036901475, "num_tokens": 60041745.0, "step": 34615 }, { "entropy": 5.400434875488282, "epoch": 2.6935615638980743, "grad_norm": 1.1015625, "learning_rate": 0.0004271389813028443, "loss": 5.0292, "mean_token_accuracy": 0.19832102805376053, "num_tokens": 60051659.0, "step": 34620 }, { "entropy": 5.462645769119263, "epoch": 2.693950593269792, "grad_norm": 1.09375, "learning_rate": 0.0004271185608931187, "loss": 5.0768, "mean_token_accuracy": 0.19329693168401718, "num_tokens": 60060498.0, "step": 34625 }, { "entropy": 5.359845685958862, "epoch": 2.6943396226415093, "grad_norm": 1.203125, "learning_rate": 0.00042709813817523617, "loss": 4.9926, "mean_token_accuracy": 0.19633451998233795, "num_tokens": 60068678.0, "step": 34630 }, { "entropy": 5.323875570297242, "epoch": 2.694728652013227, "grad_norm": 1.15625, "learning_rate": 0.00042707771314950645, "loss": 4.9081, "mean_token_accuracy": 0.19849919229745866, "num_tokens": 60077889.0, "step": 34635 }, { "entropy": 5.39540662765503, "epoch": 2.6951176813849447, "grad_norm": 1.1953125, "learning_rate": 0.00042705728581623944, "loss": 4.9748, "mean_token_accuracy": 0.1911034792661667, "num_tokens": 60085989.0, "step": 34640 }, { "entropy": 5.412735319137573, "epoch": 2.6955067107566624, "grad_norm": 1.109375, "learning_rate": 0.0004270368561757452, "loss": 4.9707, "mean_token_accuracy": 0.204974664747715, "num_tokens": 60095012.0, "step": 34645 }, { "entropy": 5.436860370635986, "epoch": 2.6958957401283796, "grad_norm": 1.171875, "learning_rate": 0.0004270164242283336, "loss": 5.013, "mean_token_accuracy": 0.19279265999794007, "num_tokens": 60103894.0, "step": 34650 }, { "entropy": 5.33751277923584, "epoch": 2.6962847695000973, "grad_norm": 1.09375, "learning_rate": 0.0004269959899743148, "loss": 4.9008, "mean_token_accuracy": 0.20609208643436433, "num_tokens": 60112456.0, "step": 34655 }, { "entropy": 5.39109845161438, "epoch": 2.6966737988718146, "grad_norm": 1.15625, "learning_rate": 0.0004269755534139987, "loss": 4.9825, "mean_token_accuracy": 0.20097634792327881, "num_tokens": 60120378.0, "step": 34660 }, { "entropy": 5.446466064453125, "epoch": 2.6970628282435323, "grad_norm": 1.140625, "learning_rate": 0.00042695511454769557, "loss": 5.0586, "mean_token_accuracy": 0.19718556404113768, "num_tokens": 60128091.0, "step": 34665 }, { "entropy": 5.418723487854004, "epoch": 2.69745185761525, "grad_norm": 1.203125, "learning_rate": 0.00042693467337571534, "loss": 5.0478, "mean_token_accuracy": 0.20279632210731507, "num_tokens": 60136298.0, "step": 34670 }, { "entropy": 5.442491340637207, "epoch": 2.6978408869869677, "grad_norm": 1.1875, "learning_rate": 0.0004269142298983684, "loss": 4.9901, "mean_token_accuracy": 0.2012015625834465, "num_tokens": 60145556.0, "step": 34675 }, { "entropy": 5.412729978561401, "epoch": 2.698229916358685, "grad_norm": 1.1171875, "learning_rate": 0.00042689378411596467, "loss": 4.9602, "mean_token_accuracy": 0.1987512767314911, "num_tokens": 60154301.0, "step": 34680 }, { "entropy": 5.2845447063446045, "epoch": 2.6986189457304026, "grad_norm": 1.125, "learning_rate": 0.0004268733360288146, "loss": 4.9098, "mean_token_accuracy": 0.2080233082175255, "num_tokens": 60162646.0, "step": 34685 }, { "entropy": 5.364597988128662, "epoch": 2.6990079751021203, "grad_norm": 1.1484375, "learning_rate": 0.00042685288563722835, "loss": 4.9622, "mean_token_accuracy": 0.1982418715953827, "num_tokens": 60170749.0, "step": 34690 }, { "entropy": 5.3218918800354, "epoch": 2.6993970044738376, "grad_norm": 1.140625, "learning_rate": 0.0004268324329415163, "loss": 4.8866, "mean_token_accuracy": 0.20682495087385178, "num_tokens": 60178798.0, "step": 34695 }, { "entropy": 5.352897453308105, "epoch": 2.6997860338455553, "grad_norm": 1.171875, "learning_rate": 0.0004268119779419887, "loss": 4.9297, "mean_token_accuracy": 0.20208481699228287, "num_tokens": 60186974.0, "step": 34700 }, { "entropy": 5.391630601882935, "epoch": 2.700175063217273, "grad_norm": 1.1015625, "learning_rate": 0.00042679152063895603, "loss": 4.9153, "mean_token_accuracy": 0.20124580711126328, "num_tokens": 60195271.0, "step": 34705 }, { "entropy": 5.404238700866699, "epoch": 2.7005640925889907, "grad_norm": 1.1171875, "learning_rate": 0.00042677106103272867, "loss": 4.9507, "mean_token_accuracy": 0.20059803873300552, "num_tokens": 60204476.0, "step": 34710 }, { "entropy": 5.415479421615601, "epoch": 2.700953121960708, "grad_norm": 1.1171875, "learning_rate": 0.000426750599123617, "loss": 5.0623, "mean_token_accuracy": 0.19499545842409133, "num_tokens": 60213285.0, "step": 34715 }, { "entropy": 5.379653644561768, "epoch": 2.7013421513324256, "grad_norm": 1.0703125, "learning_rate": 0.00042673013491193145, "loss": 4.9693, "mean_token_accuracy": 0.20879622250795365, "num_tokens": 60222321.0, "step": 34720 }, { "entropy": 5.3582813262939455, "epoch": 2.7017311807041433, "grad_norm": 1.1171875, "learning_rate": 0.00042670966839798263, "loss": 4.9474, "mean_token_accuracy": 0.21028258204460143, "num_tokens": 60230759.0, "step": 34725 }, { "entropy": 5.415563917160034, "epoch": 2.7021202100758606, "grad_norm": 1.15625, "learning_rate": 0.0004266891995820811, "loss": 4.9794, "mean_token_accuracy": 0.20133963078260422, "num_tokens": 60238570.0, "step": 34730 }, { "entropy": 5.359295320510864, "epoch": 2.7025092394475783, "grad_norm": 1.1796875, "learning_rate": 0.00042666872846453734, "loss": 5.0461, "mean_token_accuracy": 0.19327437728643418, "num_tokens": 60247445.0, "step": 34735 }, { "entropy": 5.363235855102539, "epoch": 2.702898268819296, "grad_norm": 1.3359375, "learning_rate": 0.00042664825504566206, "loss": 4.9988, "mean_token_accuracy": 0.1964689165353775, "num_tokens": 60256358.0, "step": 34740 }, { "entropy": 5.389095687866211, "epoch": 2.7032872981910137, "grad_norm": 1.203125, "learning_rate": 0.000426627779325766, "loss": 4.9935, "mean_token_accuracy": 0.20379738956689836, "num_tokens": 60264347.0, "step": 34745 }, { "entropy": 5.389885330200196, "epoch": 2.703676327562731, "grad_norm": 1.109375, "learning_rate": 0.0004266073013051595, "loss": 4.9476, "mean_token_accuracy": 0.196377931535244, "num_tokens": 60273858.0, "step": 34750 }, { "entropy": 5.383081769943237, "epoch": 2.7040653569344486, "grad_norm": 1.15625, "learning_rate": 0.0004265868209841537, "loss": 4.9471, "mean_token_accuracy": 0.20187449753284453, "num_tokens": 60282089.0, "step": 34755 }, { "entropy": 5.4112996578216555, "epoch": 2.704454386306166, "grad_norm": 1.1796875, "learning_rate": 0.0004265663383630591, "loss": 5.0469, "mean_token_accuracy": 0.19911534935235978, "num_tokens": 60291253.0, "step": 34760 }, { "entropy": 5.504092645645142, "epoch": 2.7048434156778836, "grad_norm": 1.296875, "learning_rate": 0.00042654585344218657, "loss": 5.0416, "mean_token_accuracy": 0.1932744041085243, "num_tokens": 60300584.0, "step": 34765 }, { "entropy": 5.399906015396118, "epoch": 2.7052324450496013, "grad_norm": 1.1796875, "learning_rate": 0.0004265253662218469, "loss": 5.0002, "mean_token_accuracy": 0.20235911756753922, "num_tokens": 60308822.0, "step": 34770 }, { "entropy": 5.375939226150512, "epoch": 2.705621474421319, "grad_norm": 1.1875, "learning_rate": 0.00042650487670235093, "loss": 5.0596, "mean_token_accuracy": 0.19862616062164307, "num_tokens": 60317466.0, "step": 34775 }, { "entropy": 5.455323505401611, "epoch": 2.7060105037930366, "grad_norm": 1.2421875, "learning_rate": 0.0004264843848840097, "loss": 5.0386, "mean_token_accuracy": 0.19244395494461058, "num_tokens": 60325307.0, "step": 34780 }, { "entropy": 5.439924526214599, "epoch": 2.706399533164754, "grad_norm": 1.203125, "learning_rate": 0.000426463890767134, "loss": 5.1075, "mean_token_accuracy": 0.1866210252046585, "num_tokens": 60334300.0, "step": 34785 }, { "entropy": 5.372380638122559, "epoch": 2.7067885625364716, "grad_norm": 1.234375, "learning_rate": 0.0004264433943520349, "loss": 5.0249, "mean_token_accuracy": 0.19149001687765121, "num_tokens": 60343481.0, "step": 34790 }, { "entropy": 5.407073640823365, "epoch": 2.707177591908189, "grad_norm": 1.0390625, "learning_rate": 0.00042642289563902326, "loss": 4.9988, "mean_token_accuracy": 0.19364880621433259, "num_tokens": 60353134.0, "step": 34795 }, { "entropy": 5.3637144565582275, "epoch": 2.7075666212799065, "grad_norm": 1.0546875, "learning_rate": 0.00042640239462841023, "loss": 4.9335, "mean_token_accuracy": 0.20837823450565338, "num_tokens": 60362389.0, "step": 34800 }, { "entropy": 5.305854320526123, "epoch": 2.7079556506516242, "grad_norm": 1.2578125, "learning_rate": 0.00042638189132050675, "loss": 4.9029, "mean_token_accuracy": 0.20706166028976442, "num_tokens": 60370963.0, "step": 34805 }, { "entropy": 5.354073333740234, "epoch": 2.708344680023342, "grad_norm": 1.203125, "learning_rate": 0.00042636138571562415, "loss": 5.0374, "mean_token_accuracy": 0.18988647758960725, "num_tokens": 60379534.0, "step": 34810 }, { "entropy": 5.43061146736145, "epoch": 2.708733709395059, "grad_norm": 1.078125, "learning_rate": 0.00042634087781407337, "loss": 5.0269, "mean_token_accuracy": 0.19171185344457625, "num_tokens": 60389234.0, "step": 34815 }, { "entropy": 5.415381574630738, "epoch": 2.709122738766777, "grad_norm": 1.09375, "learning_rate": 0.00042632036761616564, "loss": 4.9603, "mean_token_accuracy": 0.1974749132990837, "num_tokens": 60398571.0, "step": 34820 }, { "entropy": 5.407800340652466, "epoch": 2.7095117681384946, "grad_norm": 1.1171875, "learning_rate": 0.00042629985512221224, "loss": 5.0637, "mean_token_accuracy": 0.19485462903976442, "num_tokens": 60407356.0, "step": 34825 }, { "entropy": 5.437600183486938, "epoch": 2.709900797510212, "grad_norm": 1.1328125, "learning_rate": 0.0004262793403325243, "loss": 5.0982, "mean_token_accuracy": 0.2004051223397255, "num_tokens": 60415617.0, "step": 34830 }, { "entropy": 5.417517614364624, "epoch": 2.7102898268819295, "grad_norm": 1.1640625, "learning_rate": 0.00042625882324741316, "loss": 5.0425, "mean_token_accuracy": 0.19766895473003387, "num_tokens": 60424453.0, "step": 34835 }, { "entropy": 5.374994611740112, "epoch": 2.7106788562536472, "grad_norm": 1.140625, "learning_rate": 0.0004262383038671902, "loss": 4.9562, "mean_token_accuracy": 0.19841166585683823, "num_tokens": 60433358.0, "step": 34840 }, { "entropy": 5.341975212097168, "epoch": 2.711067885625365, "grad_norm": 1.1796875, "learning_rate": 0.0004262177821921666, "loss": 4.9821, "mean_token_accuracy": 0.19429868906736375, "num_tokens": 60441793.0, "step": 34845 }, { "entropy": 5.405882501602173, "epoch": 2.711456914997082, "grad_norm": 1.203125, "learning_rate": 0.00042619725822265394, "loss": 4.9934, "mean_token_accuracy": 0.20677744299173356, "num_tokens": 60449981.0, "step": 34850 }, { "entropy": 5.389493465423584, "epoch": 2.7118459443688, "grad_norm": 1.0859375, "learning_rate": 0.00042617673195896345, "loss": 5.0528, "mean_token_accuracy": 0.19665377140045165, "num_tokens": 60459050.0, "step": 34855 }, { "entropy": 5.297450304031372, "epoch": 2.712234973740517, "grad_norm": 1.1953125, "learning_rate": 0.00042615620340140674, "loss": 4.8937, "mean_token_accuracy": 0.2078096389770508, "num_tokens": 60467300.0, "step": 34860 }, { "entropy": 5.301272630691528, "epoch": 2.712624003112235, "grad_norm": 1.171875, "learning_rate": 0.00042613567255029525, "loss": 4.98, "mean_token_accuracy": 0.19621365368366242, "num_tokens": 60475969.0, "step": 34865 }, { "entropy": 5.374357223510742, "epoch": 2.7130130324839525, "grad_norm": 1.140625, "learning_rate": 0.00042611513940594037, "loss": 4.9986, "mean_token_accuracy": 0.2007204368710518, "num_tokens": 60484886.0, "step": 34870 }, { "entropy": 5.4231274127960205, "epoch": 2.7134020618556702, "grad_norm": 1.1328125, "learning_rate": 0.0004260946039686539, "loss": 5.0504, "mean_token_accuracy": 0.1943580761551857, "num_tokens": 60494172.0, "step": 34875 }, { "entropy": 5.402447319030761, "epoch": 2.713791091227388, "grad_norm": 1.15625, "learning_rate": 0.00042607406623874726, "loss": 5.0427, "mean_token_accuracy": 0.19055717885494233, "num_tokens": 60501722.0, "step": 34880 }, { "entropy": 5.349048852920532, "epoch": 2.714180120599105, "grad_norm": 1.1640625, "learning_rate": 0.0004260535262165322, "loss": 4.8908, "mean_token_accuracy": 0.20973397344350814, "num_tokens": 60510613.0, "step": 34885 }, { "entropy": 5.403182554244995, "epoch": 2.714569149970823, "grad_norm": 1.1328125, "learning_rate": 0.00042603298390232015, "loss": 5.0567, "mean_token_accuracy": 0.19642326682806016, "num_tokens": 60519868.0, "step": 34890 }, { "entropy": 5.404860782623291, "epoch": 2.71495817934254, "grad_norm": 1.1640625, "learning_rate": 0.00042601243929642305, "loss": 5.0245, "mean_token_accuracy": 0.19419406950473786, "num_tokens": 60528832.0, "step": 34895 }, { "entropy": 5.360406303405762, "epoch": 2.715347208714258, "grad_norm": 1.1328125, "learning_rate": 0.00042599189239915253, "loss": 4.9529, "mean_token_accuracy": 0.1954007089138031, "num_tokens": 60537870.0, "step": 34900 }, { "entropy": 5.398197650909424, "epoch": 2.7157362380859755, "grad_norm": 1.140625, "learning_rate": 0.0004259713432108204, "loss": 4.9855, "mean_token_accuracy": 0.1972329393029213, "num_tokens": 60546157.0, "step": 34905 }, { "entropy": 5.331812191009521, "epoch": 2.7161252674576932, "grad_norm": 1.1875, "learning_rate": 0.0004259507917317384, "loss": 4.9713, "mean_token_accuracy": 0.19816379994153976, "num_tokens": 60554411.0, "step": 34910 }, { "entropy": 5.458487510681152, "epoch": 2.7165142968294105, "grad_norm": 1.125, "learning_rate": 0.00042593023796221843, "loss": 5.0129, "mean_token_accuracy": 0.19824106991291046, "num_tokens": 60562748.0, "step": 34915 }, { "entropy": 5.4000410556793215, "epoch": 2.716903326201128, "grad_norm": 1.1171875, "learning_rate": 0.0004259096819025723, "loss": 5.0141, "mean_token_accuracy": 0.19799044877290725, "num_tokens": 60572004.0, "step": 34920 }, { "entropy": 5.431330728530884, "epoch": 2.717292355572846, "grad_norm": 1.2421875, "learning_rate": 0.00042588912355311196, "loss": 5.0043, "mean_token_accuracy": 0.20066782236099243, "num_tokens": 60580596.0, "step": 34925 }, { "entropy": 5.336384868621826, "epoch": 2.717681384944563, "grad_norm": 1.2265625, "learning_rate": 0.00042586856291414925, "loss": 4.9949, "mean_token_accuracy": 0.1967260479927063, "num_tokens": 60588734.0, "step": 34930 }, { "entropy": 5.405439376831055, "epoch": 2.718070414316281, "grad_norm": 1.140625, "learning_rate": 0.00042584799998599633, "loss": 5.0027, "mean_token_accuracy": 0.19739606529474257, "num_tokens": 60597302.0, "step": 34935 }, { "entropy": 5.484164619445801, "epoch": 2.7184594436879985, "grad_norm": 1.1015625, "learning_rate": 0.0004258274347689651, "loss": 5.0481, "mean_token_accuracy": 0.1951994627714157, "num_tokens": 60606928.0, "step": 34940 }, { "entropy": 5.366205835342408, "epoch": 2.718848473059716, "grad_norm": 1.1875, "learning_rate": 0.00042580686726336766, "loss": 5.0181, "mean_token_accuracy": 0.19663025289773942, "num_tokens": 60615970.0, "step": 34945 }, { "entropy": 5.3720861911773685, "epoch": 2.7192375024314335, "grad_norm": 1.0859375, "learning_rate": 0.00042578629746951597, "loss": 5.041, "mean_token_accuracy": 0.19405727833509445, "num_tokens": 60625453.0, "step": 34950 }, { "entropy": 5.456085968017578, "epoch": 2.719626531803151, "grad_norm": 1.1171875, "learning_rate": 0.0004257657253877222, "loss": 5.0198, "mean_token_accuracy": 0.19812843799591065, "num_tokens": 60634622.0, "step": 34955 }, { "entropy": 5.4255115509033205, "epoch": 2.720015561174869, "grad_norm": 1.125, "learning_rate": 0.00042574515101829856, "loss": 5.0046, "mean_token_accuracy": 0.1989461973309517, "num_tokens": 60643463.0, "step": 34960 }, { "entropy": 5.336925363540649, "epoch": 2.720404590546586, "grad_norm": 1.15625, "learning_rate": 0.00042572457436155717, "loss": 4.9638, "mean_token_accuracy": 0.205049367249012, "num_tokens": 60652192.0, "step": 34965 }, { "entropy": 5.469555282592774, "epoch": 2.720793619918304, "grad_norm": 1.1484375, "learning_rate": 0.00042570399541781023, "loss": 5.0815, "mean_token_accuracy": 0.19384343028068543, "num_tokens": 60661071.0, "step": 34970 }, { "entropy": 5.526416969299317, "epoch": 2.7211826492900215, "grad_norm": 1.2265625, "learning_rate": 0.00042568341418737016, "loss": 5.1505, "mean_token_accuracy": 0.18243410289287568, "num_tokens": 60670165.0, "step": 34975 }, { "entropy": 5.370257902145386, "epoch": 2.721571678661739, "grad_norm": 1.15625, "learning_rate": 0.000425662830670549, "loss": 4.9527, "mean_token_accuracy": 0.1994159683585167, "num_tokens": 60678260.0, "step": 34980 }, { "entropy": 5.385682678222656, "epoch": 2.7219607080334565, "grad_norm": 1.1171875, "learning_rate": 0.00042564224486765925, "loss": 4.9335, "mean_token_accuracy": 0.19755038619041443, "num_tokens": 60686919.0, "step": 34985 }, { "entropy": 5.281902599334717, "epoch": 2.722349737405174, "grad_norm": 1.109375, "learning_rate": 0.0004256216567790131, "loss": 4.9134, "mean_token_accuracy": 0.20358132123947142, "num_tokens": 60695549.0, "step": 34990 }, { "entropy": 5.311908292770386, "epoch": 2.7227387667768914, "grad_norm": 1.15625, "learning_rate": 0.0004256010664049232, "loss": 4.9416, "mean_token_accuracy": 0.19887105673551558, "num_tokens": 60704258.0, "step": 34995 }, { "entropy": 5.413995981216431, "epoch": 2.723127796148609, "grad_norm": 1.15625, "learning_rate": 0.0004255804737457017, "loss": 5.0102, "mean_token_accuracy": 0.1923614487051964, "num_tokens": 60712860.0, "step": 35000 }, { "entropy": 5.390444612503051, "epoch": 2.723516825520327, "grad_norm": 1.0859375, "learning_rate": 0.00042555987880166127, "loss": 4.9799, "mean_token_accuracy": 0.20344469994306563, "num_tokens": 60721861.0, "step": 35005 }, { "entropy": 5.386259603500366, "epoch": 2.7239058548920445, "grad_norm": 1.1171875, "learning_rate": 0.0004255392815731142, "loss": 5.0002, "mean_token_accuracy": 0.19885495454072952, "num_tokens": 60730760.0, "step": 35010 }, { "entropy": 5.402735900878906, "epoch": 2.7242948842637618, "grad_norm": 1.2421875, "learning_rate": 0.00042551868206037324, "loss": 5.0293, "mean_token_accuracy": 0.19492748826742173, "num_tokens": 60739192.0, "step": 35015 }, { "entropy": 5.363769102096557, "epoch": 2.7246839136354795, "grad_norm": 1.078125, "learning_rate": 0.00042549808026375084, "loss": 4.9711, "mean_token_accuracy": 0.20069366842508315, "num_tokens": 60748009.0, "step": 35020 }, { "entropy": 5.370988368988037, "epoch": 2.725072943007197, "grad_norm": 1.140625, "learning_rate": 0.00042547747618355966, "loss": 4.9991, "mean_token_accuracy": 0.19621071517467498, "num_tokens": 60756663.0, "step": 35025 }, { "entropy": 5.4907842636108395, "epoch": 2.7254619723789144, "grad_norm": 1.078125, "learning_rate": 0.0004254568698201122, "loss": 5.1419, "mean_token_accuracy": 0.19140998870134354, "num_tokens": 60765055.0, "step": 35030 }, { "entropy": 5.451573896408081, "epoch": 2.725851001750632, "grad_norm": 1.1953125, "learning_rate": 0.00042543626117372133, "loss": 5.0592, "mean_token_accuracy": 0.1909284323453903, "num_tokens": 60773745.0, "step": 35035 }, { "entropy": 5.424426651000976, "epoch": 2.72624003112235, "grad_norm": 1.234375, "learning_rate": 0.00042541565024469945, "loss": 5.0374, "mean_token_accuracy": 0.19808966666460037, "num_tokens": 60782244.0, "step": 35040 }, { "entropy": 5.324416589736939, "epoch": 2.7266290604940675, "grad_norm": 1.0703125, "learning_rate": 0.00042539503703335963, "loss": 4.8298, "mean_token_accuracy": 0.20676670521497725, "num_tokens": 60791156.0, "step": 35045 }, { "entropy": 5.353069019317627, "epoch": 2.7270180898657848, "grad_norm": 1.125, "learning_rate": 0.00042537442154001455, "loss": 4.8808, "mean_token_accuracy": 0.19783241003751756, "num_tokens": 60799498.0, "step": 35050 }, { "entropy": 5.388478136062622, "epoch": 2.7274071192375025, "grad_norm": 1.09375, "learning_rate": 0.00042535380376497684, "loss": 5.115, "mean_token_accuracy": 0.18409560173749923, "num_tokens": 60807991.0, "step": 35055 }, { "entropy": 5.480797672271729, "epoch": 2.72779614860922, "grad_norm": 1.203125, "learning_rate": 0.0004253331837085595, "loss": 4.9644, "mean_token_accuracy": 0.19217465519905091, "num_tokens": 60815674.0, "step": 35060 }, { "entropy": 5.3376611232757565, "epoch": 2.7281851779809374, "grad_norm": 1.2890625, "learning_rate": 0.00042531256137107545, "loss": 4.943, "mean_token_accuracy": 0.19427911341190338, "num_tokens": 60823490.0, "step": 35065 }, { "entropy": 5.384861087799072, "epoch": 2.728574207352655, "grad_norm": 1.1328125, "learning_rate": 0.0004252919367528375, "loss": 5.0255, "mean_token_accuracy": 0.19740456193685532, "num_tokens": 60832437.0, "step": 35070 }, { "entropy": 5.415588140487671, "epoch": 2.728963236724373, "grad_norm": 1.1328125, "learning_rate": 0.00042527130985415857, "loss": 5.0185, "mean_token_accuracy": 0.19756570011377333, "num_tokens": 60841450.0, "step": 35075 }, { "entropy": 5.419904136657715, "epoch": 2.7293522660960905, "grad_norm": 1.1640625, "learning_rate": 0.0004252506806753517, "loss": 4.9367, "mean_token_accuracy": 0.20415988564491272, "num_tokens": 60849848.0, "step": 35080 }, { "entropy": 5.267904949188233, "epoch": 2.7297412954678077, "grad_norm": 1.0390625, "learning_rate": 0.00042523004921673, "loss": 4.8579, "mean_token_accuracy": 0.19961386024951935, "num_tokens": 60858912.0, "step": 35085 }, { "entropy": 5.3423693656921385, "epoch": 2.7301303248395254, "grad_norm": 1.09375, "learning_rate": 0.0004252094154786063, "loss": 4.9633, "mean_token_accuracy": 0.19486998915672302, "num_tokens": 60867204.0, "step": 35090 }, { "entropy": 5.416849279403687, "epoch": 2.7305193542112427, "grad_norm": 1.140625, "learning_rate": 0.0004251887794612939, "loss": 5.0127, "mean_token_accuracy": 0.19130531549453736, "num_tokens": 60875921.0, "step": 35095 }, { "entropy": 5.3920722007751465, "epoch": 2.7309083835829604, "grad_norm": 1.1328125, "learning_rate": 0.0004251681411651057, "loss": 4.9638, "mean_token_accuracy": 0.19613010734319686, "num_tokens": 60884639.0, "step": 35100 }, { "entropy": 5.379074192047119, "epoch": 2.731297412954678, "grad_norm": 1.15625, "learning_rate": 0.00042514750059035504, "loss": 5.1116, "mean_token_accuracy": 0.19532786011695863, "num_tokens": 60893517.0, "step": 35105 }, { "entropy": 5.3309181213378904, "epoch": 2.731686442326396, "grad_norm": 1.1484375, "learning_rate": 0.0004251268577373551, "loss": 4.9496, "mean_token_accuracy": 0.20360612571239473, "num_tokens": 60902515.0, "step": 35110 }, { "entropy": 5.401984405517578, "epoch": 2.732075471698113, "grad_norm": 1.0703125, "learning_rate": 0.000425106212606419, "loss": 4.9937, "mean_token_accuracy": 0.1958647385239601, "num_tokens": 60911453.0, "step": 35115 }, { "entropy": 5.398989295959472, "epoch": 2.7324645010698307, "grad_norm": 1.2109375, "learning_rate": 0.00042508556519786004, "loss": 5.0038, "mean_token_accuracy": 0.19824443012475967, "num_tokens": 60920549.0, "step": 35120 }, { "entropy": 5.454034280776978, "epoch": 2.7328535304415484, "grad_norm": 1.109375, "learning_rate": 0.0004250649155119915, "loss": 5.006, "mean_token_accuracy": 0.19725531637668609, "num_tokens": 60929271.0, "step": 35125 }, { "entropy": 5.420857620239258, "epoch": 2.7332425598132657, "grad_norm": 1.171875, "learning_rate": 0.00042504426354912666, "loss": 4.9805, "mean_token_accuracy": 0.19455235302448273, "num_tokens": 60938228.0, "step": 35130 }, { "entropy": 5.423171186447144, "epoch": 2.7336315891849834, "grad_norm": 1.15625, "learning_rate": 0.00042502360930957904, "loss": 5.0379, "mean_token_accuracy": 0.19683623313903809, "num_tokens": 60945777.0, "step": 35135 }, { "entropy": 5.351422882080078, "epoch": 2.734020618556701, "grad_norm": 1.0859375, "learning_rate": 0.00042500295279366196, "loss": 5.0418, "mean_token_accuracy": 0.19246007651090621, "num_tokens": 60954500.0, "step": 35140 }, { "entropy": 5.397111225128174, "epoch": 2.734409647928419, "grad_norm": 1.1875, "learning_rate": 0.00042498229400168874, "loss": 5.0052, "mean_token_accuracy": 0.19866187870502472, "num_tokens": 60962918.0, "step": 35145 }, { "entropy": 5.377806663513184, "epoch": 2.734798677300136, "grad_norm": 1.125, "learning_rate": 0.000424961632933973, "loss": 4.9512, "mean_token_accuracy": 0.20498688668012618, "num_tokens": 60971544.0, "step": 35150 }, { "entropy": 5.377746152877807, "epoch": 2.7351877066718537, "grad_norm": 1.09375, "learning_rate": 0.0004249409695908281, "loss": 4.9728, "mean_token_accuracy": 0.2047186017036438, "num_tokens": 60979637.0, "step": 35155 }, { "entropy": 5.329731082916259, "epoch": 2.7355767360435714, "grad_norm": 1.15625, "learning_rate": 0.0004249203039725677, "loss": 4.9885, "mean_token_accuracy": 0.1947261095046997, "num_tokens": 60988417.0, "step": 35160 }, { "entropy": 5.45766863822937, "epoch": 2.7359657654152887, "grad_norm": 1.109375, "learning_rate": 0.00042489963607950527, "loss": 5.0025, "mean_token_accuracy": 0.19932710528373718, "num_tokens": 60997282.0, "step": 35165 }, { "entropy": 5.402943849563599, "epoch": 2.7363547947870064, "grad_norm": 1.09375, "learning_rate": 0.00042487896591195454, "loss": 4.9889, "mean_token_accuracy": 0.19214026629924774, "num_tokens": 61006191.0, "step": 35170 }, { "entropy": 5.3461854457855225, "epoch": 2.736743824158724, "grad_norm": 1.1484375, "learning_rate": 0.00042485829347022893, "loss": 4.9639, "mean_token_accuracy": 0.2022184759378433, "num_tokens": 61014780.0, "step": 35175 }, { "entropy": 5.424778795242309, "epoch": 2.737132853530442, "grad_norm": 1.21875, "learning_rate": 0.00042483761875464226, "loss": 5.0155, "mean_token_accuracy": 0.19151908159255981, "num_tokens": 61024328.0, "step": 35180 }, { "entropy": 5.406956434249878, "epoch": 2.737521882902159, "grad_norm": 1.1328125, "learning_rate": 0.00042481694176550825, "loss": 4.9776, "mean_token_accuracy": 0.1990225702524185, "num_tokens": 61032716.0, "step": 35185 }, { "entropy": 5.44702525138855, "epoch": 2.7379109122738767, "grad_norm": 1.171875, "learning_rate": 0.00042479626250314066, "loss": 5.0351, "mean_token_accuracy": 0.19466724395751953, "num_tokens": 61041495.0, "step": 35190 }, { "entropy": 5.323679780960083, "epoch": 2.738299941645594, "grad_norm": 1.125, "learning_rate": 0.00042477558096785316, "loss": 4.9859, "mean_token_accuracy": 0.2002753958106041, "num_tokens": 61050275.0, "step": 35195 }, { "entropy": 5.3710469722747805, "epoch": 2.7386889710173117, "grad_norm": 1.15625, "learning_rate": 0.00042475489715995956, "loss": 4.8835, "mean_token_accuracy": 0.2082016348838806, "num_tokens": 61058774.0, "step": 35200 }, { "entropy": 5.420380067825318, "epoch": 2.7390780003890294, "grad_norm": 1.2734375, "learning_rate": 0.00042473421107977385, "loss": 4.9519, "mean_token_accuracy": 0.20523722171783448, "num_tokens": 61067475.0, "step": 35205 }, { "entropy": 5.289706897735596, "epoch": 2.739467029760747, "grad_norm": 1.1171875, "learning_rate": 0.00042471352272760974, "loss": 4.9244, "mean_token_accuracy": 0.20416066497564317, "num_tokens": 61075943.0, "step": 35210 }, { "entropy": 5.388561248779297, "epoch": 2.7398560591324648, "grad_norm": 1.15625, "learning_rate": 0.0004246928321037813, "loss": 5.0067, "mean_token_accuracy": 0.19975289106369018, "num_tokens": 61084460.0, "step": 35215 }, { "entropy": 5.478441047668457, "epoch": 2.740245088504182, "grad_norm": 1.140625, "learning_rate": 0.0004246721392086023, "loss": 5.0753, "mean_token_accuracy": 0.1918073445558548, "num_tokens": 61093423.0, "step": 35220 }, { "entropy": 5.39250545501709, "epoch": 2.7406341178758997, "grad_norm": 1.109375, "learning_rate": 0.00042465144404238686, "loss": 5.0223, "mean_token_accuracy": 0.1852139040827751, "num_tokens": 61102953.0, "step": 35225 }, { "entropy": 5.398007869720459, "epoch": 2.741023147247617, "grad_norm": 1.171875, "learning_rate": 0.00042463074660544897, "loss": 4.9154, "mean_token_accuracy": 0.20541236847639083, "num_tokens": 61112114.0, "step": 35230 }, { "entropy": 5.428777885437012, "epoch": 2.7414121766193347, "grad_norm": 1.1484375, "learning_rate": 0.0004246100468981026, "loss": 4.9947, "mean_token_accuracy": 0.20100147128105164, "num_tokens": 61120603.0, "step": 35235 }, { "entropy": 5.370364999771118, "epoch": 2.7418012059910524, "grad_norm": 1.203125, "learning_rate": 0.000424589344920662, "loss": 4.9721, "mean_token_accuracy": 0.1999620243906975, "num_tokens": 61129238.0, "step": 35240 }, { "entropy": 5.348665809631347, "epoch": 2.74219023536277, "grad_norm": 1.1640625, "learning_rate": 0.0004245686406734411, "loss": 4.8992, "mean_token_accuracy": 0.20454926192760467, "num_tokens": 61138082.0, "step": 35245 }, { "entropy": 5.4401849746704105, "epoch": 2.7425792647344873, "grad_norm": 1.125, "learning_rate": 0.0004245479341567541, "loss": 5.0123, "mean_token_accuracy": 0.1971248522400856, "num_tokens": 61146779.0, "step": 35250 }, { "entropy": 5.2980536937713625, "epoch": 2.742968294106205, "grad_norm": 1.1171875, "learning_rate": 0.0004245272253709154, "loss": 4.8964, "mean_token_accuracy": 0.20928891152143478, "num_tokens": 61155492.0, "step": 35255 }, { "entropy": 5.387368679046631, "epoch": 2.7433573234779227, "grad_norm": 1.15625, "learning_rate": 0.0004245065143162389, "loss": 4.8747, "mean_token_accuracy": 0.20668141096830367, "num_tokens": 61164235.0, "step": 35260 }, { "entropy": 5.380212450027466, "epoch": 2.74374635284964, "grad_norm": 1.1328125, "learning_rate": 0.00042448580099303904, "loss": 4.9548, "mean_token_accuracy": 0.20073190629482268, "num_tokens": 61172203.0, "step": 35265 }, { "entropy": 5.355871725082397, "epoch": 2.7441353822213577, "grad_norm": 1.1328125, "learning_rate": 0.00042446508540163017, "loss": 4.9588, "mean_token_accuracy": 0.1987817496061325, "num_tokens": 61180827.0, "step": 35270 }, { "entropy": 5.39039454460144, "epoch": 2.7445244115930754, "grad_norm": 1.109375, "learning_rate": 0.0004244443675423264, "loss": 5.0118, "mean_token_accuracy": 0.19967636317014695, "num_tokens": 61189899.0, "step": 35275 }, { "entropy": 5.437172698974609, "epoch": 2.744913440964793, "grad_norm": 1.1875, "learning_rate": 0.00042442364741544227, "loss": 5.0225, "mean_token_accuracy": 0.19061192870140076, "num_tokens": 61197981.0, "step": 35280 }, { "entropy": 5.426348304748535, "epoch": 2.7453024703365103, "grad_norm": 1.1171875, "learning_rate": 0.00042440292502129214, "loss": 5.0096, "mean_token_accuracy": 0.2003627225756645, "num_tokens": 61206085.0, "step": 35285 }, { "entropy": 5.368020677566529, "epoch": 2.745691499708228, "grad_norm": 1.1171875, "learning_rate": 0.0004243822003601904, "loss": 4.9733, "mean_token_accuracy": 0.19767421185970308, "num_tokens": 61215124.0, "step": 35290 }, { "entropy": 5.463925075531006, "epoch": 2.7460805290799453, "grad_norm": 1.125, "learning_rate": 0.0004243614734324515, "loss": 5.1337, "mean_token_accuracy": 0.19371851682662963, "num_tokens": 61223926.0, "step": 35295 }, { "entropy": 5.372512006759644, "epoch": 2.746469558451663, "grad_norm": 1.1328125, "learning_rate": 0.0004243407442383901, "loss": 4.9673, "mean_token_accuracy": 0.2006288006901741, "num_tokens": 61232526.0, "step": 35300 }, { "entropy": 5.296121549606323, "epoch": 2.7468585878233807, "grad_norm": 1.0625, "learning_rate": 0.00042432001277832045, "loss": 4.8986, "mean_token_accuracy": 0.20792423337697982, "num_tokens": 61241591.0, "step": 35305 }, { "entropy": 5.385372543334961, "epoch": 2.7472476171950984, "grad_norm": 1.09375, "learning_rate": 0.0004242992790525573, "loss": 4.9722, "mean_token_accuracy": 0.202564936876297, "num_tokens": 61250851.0, "step": 35310 }, { "entropy": 5.365449476242065, "epoch": 2.747636646566816, "grad_norm": 1.0703125, "learning_rate": 0.0004242785430614154, "loss": 4.8962, "mean_token_accuracy": 0.20249408781528472, "num_tokens": 61259600.0, "step": 35315 }, { "entropy": 5.337045288085937, "epoch": 2.7480256759385333, "grad_norm": 1.140625, "learning_rate": 0.00042425780480520906, "loss": 5.0056, "mean_token_accuracy": 0.19437334090471267, "num_tokens": 61268458.0, "step": 35320 }, { "entropy": 5.330884122848511, "epoch": 2.748414705310251, "grad_norm": 1.1171875, "learning_rate": 0.00042423706428425305, "loss": 4.9466, "mean_token_accuracy": 0.20158275365829467, "num_tokens": 61276974.0, "step": 35325 }, { "entropy": 5.489245748519897, "epoch": 2.7488037346819683, "grad_norm": 1.1875, "learning_rate": 0.0004242163214988622, "loss": 5.0897, "mean_token_accuracy": 0.19465400725603105, "num_tokens": 61285165.0, "step": 35330 }, { "entropy": 5.415948009490966, "epoch": 2.749192764053686, "grad_norm": 1.125, "learning_rate": 0.0004241955764493512, "loss": 4.9966, "mean_token_accuracy": 0.20466747730970383, "num_tokens": 61294061.0, "step": 35335 }, { "entropy": 5.366667699813843, "epoch": 2.7495817934254037, "grad_norm": 1.15625, "learning_rate": 0.00042417482913603477, "loss": 4.9195, "mean_token_accuracy": 0.2015632137656212, "num_tokens": 61302435.0, "step": 35340 }, { "entropy": 5.3102428913116455, "epoch": 2.7499708227971214, "grad_norm": 1.15625, "learning_rate": 0.00042415407955922774, "loss": 4.9752, "mean_token_accuracy": 0.20758775472640992, "num_tokens": 61310462.0, "step": 35345 }, { "entropy": 5.460335683822632, "epoch": 2.7503598521688386, "grad_norm": 1.1640625, "learning_rate": 0.00042413332771924496, "loss": 5.1222, "mean_token_accuracy": 0.17978277653455735, "num_tokens": 61319490.0, "step": 35350 }, { "entropy": 5.517118740081787, "epoch": 2.7507488815405563, "grad_norm": 1.15625, "learning_rate": 0.0004241125736164013, "loss": 5.0024, "mean_token_accuracy": 0.1991927981376648, "num_tokens": 61328070.0, "step": 35355 }, { "entropy": 5.364162302017212, "epoch": 2.751137910912274, "grad_norm": 1.1875, "learning_rate": 0.0004240918172510117, "loss": 4.8925, "mean_token_accuracy": 0.204372838139534, "num_tokens": 61336319.0, "step": 35360 }, { "entropy": 5.322314119338989, "epoch": 2.7515269402839913, "grad_norm": 1.0703125, "learning_rate": 0.000424071058623391, "loss": 5.0552, "mean_token_accuracy": 0.19193875342607497, "num_tokens": 61345564.0, "step": 35365 }, { "entropy": 5.393060350418091, "epoch": 2.751915969655709, "grad_norm": 1.1328125, "learning_rate": 0.0004240502977338543, "loss": 5.0264, "mean_token_accuracy": 0.19632163792848586, "num_tokens": 61354823.0, "step": 35370 }, { "entropy": 5.444690084457397, "epoch": 2.7523049990274266, "grad_norm": 1.1171875, "learning_rate": 0.0004240295345827166, "loss": 5.0567, "mean_token_accuracy": 0.19158421456813812, "num_tokens": 61363441.0, "step": 35375 }, { "entropy": 5.33777117729187, "epoch": 2.7526940283991443, "grad_norm": 1.171875, "learning_rate": 0.0004240087691702929, "loss": 4.9364, "mean_token_accuracy": 0.19296832978725434, "num_tokens": 61371795.0, "step": 35380 }, { "entropy": 5.385474061965942, "epoch": 2.7530830577708616, "grad_norm": 1.2109375, "learning_rate": 0.0004239880014968983, "loss": 4.9737, "mean_token_accuracy": 0.19952446967363358, "num_tokens": 61379698.0, "step": 35385 }, { "entropy": 5.3688901424407955, "epoch": 2.7534720871425793, "grad_norm": 1.234375, "learning_rate": 0.00042396723156284786, "loss": 4.9396, "mean_token_accuracy": 0.2054091900587082, "num_tokens": 61388693.0, "step": 35390 }, { "entropy": 5.4397115230560305, "epoch": 2.753861116514297, "grad_norm": 1.03125, "learning_rate": 0.0004239464593684568, "loss": 5.0264, "mean_token_accuracy": 0.1969677522778511, "num_tokens": 61397995.0, "step": 35395 }, { "entropy": 5.486526250839233, "epoch": 2.7542501458860142, "grad_norm": 1.1953125, "learning_rate": 0.00042392568491404043, "loss": 5.0411, "mean_token_accuracy": 0.19704239070415497, "num_tokens": 61405567.0, "step": 35400 }, { "entropy": 5.360042333602905, "epoch": 2.754639175257732, "grad_norm": 1.171875, "learning_rate": 0.00042390490819991367, "loss": 4.955, "mean_token_accuracy": 0.20568713843822478, "num_tokens": 61413458.0, "step": 35405 }, { "entropy": 5.410577487945557, "epoch": 2.7550282046294496, "grad_norm": 1.2421875, "learning_rate": 0.000423884129226392, "loss": 4.9691, "mean_token_accuracy": 0.20628975033760072, "num_tokens": 61422026.0, "step": 35410 }, { "entropy": 5.449905586242676, "epoch": 2.7554172340011673, "grad_norm": 1.1015625, "learning_rate": 0.0004238633479937906, "loss": 4.9932, "mean_token_accuracy": 0.20050131231546403, "num_tokens": 61430843.0, "step": 35415 }, { "entropy": 5.346636056900024, "epoch": 2.7558062633728846, "grad_norm": 1.1875, "learning_rate": 0.0004238425645024249, "loss": 4.9011, "mean_token_accuracy": 0.20080612897872924, "num_tokens": 61438340.0, "step": 35420 }, { "entropy": 5.333720779418945, "epoch": 2.7561952927446023, "grad_norm": 1.0859375, "learning_rate": 0.0004238217787526102, "loss": 4.9632, "mean_token_accuracy": 0.20215589553117752, "num_tokens": 61447302.0, "step": 35425 }, { "entropy": 5.294369077682495, "epoch": 2.7565843221163195, "grad_norm": 1.203125, "learning_rate": 0.0004238009907446618, "loss": 4.896, "mean_token_accuracy": 0.20605918616056443, "num_tokens": 61456688.0, "step": 35430 }, { "entropy": 5.462442255020141, "epoch": 2.7569733514880372, "grad_norm": 1.078125, "learning_rate": 0.00042378020047889527, "loss": 5.0037, "mean_token_accuracy": 0.19084039628505706, "num_tokens": 61465718.0, "step": 35435 }, { "entropy": 5.498924493789673, "epoch": 2.757362380859755, "grad_norm": 1.1875, "learning_rate": 0.00042375940795562594, "loss": 5.0991, "mean_token_accuracy": 0.1949687719345093, "num_tokens": 61474113.0, "step": 35440 }, { "entropy": 5.311561727523804, "epoch": 2.7577514102314726, "grad_norm": 1.15625, "learning_rate": 0.00042373861317516944, "loss": 4.9229, "mean_token_accuracy": 0.20258758068084717, "num_tokens": 61482876.0, "step": 35445 }, { "entropy": 5.36276478767395, "epoch": 2.75814043960319, "grad_norm": 1.078125, "learning_rate": 0.0004237178161378412, "loss": 4.8787, "mean_token_accuracy": 0.2029843121767044, "num_tokens": 61491229.0, "step": 35450 }, { "entropy": 5.337359762191772, "epoch": 2.7585294689749076, "grad_norm": 1.125, "learning_rate": 0.0004236970168439568, "loss": 4.9238, "mean_token_accuracy": 0.19890360832214354, "num_tokens": 61499935.0, "step": 35455 }, { "entropy": 5.473676252365112, "epoch": 2.7589184983466253, "grad_norm": 1.1015625, "learning_rate": 0.00042367621529383186, "loss": 4.9929, "mean_token_accuracy": 0.198628668487072, "num_tokens": 61508249.0, "step": 35460 }, { "entropy": 5.3854443550109865, "epoch": 2.7593075277183425, "grad_norm": 1.1875, "learning_rate": 0.00042365541148778205, "loss": 4.8932, "mean_token_accuracy": 0.20191843211650848, "num_tokens": 61516530.0, "step": 35465 }, { "entropy": 5.411546516418457, "epoch": 2.7596965570900602, "grad_norm": 1.1796875, "learning_rate": 0.00042363460542612285, "loss": 5.0619, "mean_token_accuracy": 0.19656858295202256, "num_tokens": 61524998.0, "step": 35470 }, { "entropy": 5.223538255691528, "epoch": 2.760085586461778, "grad_norm": 1.1796875, "learning_rate": 0.0004236137971091702, "loss": 4.8353, "mean_token_accuracy": 0.21118010729551315, "num_tokens": 61533661.0, "step": 35475 }, { "entropy": 5.367352294921875, "epoch": 2.7604746158334956, "grad_norm": 1.265625, "learning_rate": 0.00042359298653723963, "loss": 4.9603, "mean_token_accuracy": 0.20268310308456422, "num_tokens": 61542387.0, "step": 35480 }, { "entropy": 5.424409294128418, "epoch": 2.760863645205213, "grad_norm": 1.140625, "learning_rate": 0.0004235721737106471, "loss": 4.9282, "mean_token_accuracy": 0.20485030710697175, "num_tokens": 61550626.0, "step": 35485 }, { "entropy": 5.433951568603516, "epoch": 2.7612526745769306, "grad_norm": 1.15625, "learning_rate": 0.0004235513586297082, "loss": 5.0734, "mean_token_accuracy": 0.20028118640184403, "num_tokens": 61559170.0, "step": 35490 }, { "entropy": 5.360174083709717, "epoch": 2.7616417039486483, "grad_norm": 1.171875, "learning_rate": 0.00042353054129473894, "loss": 5.0718, "mean_token_accuracy": 0.19668426513671874, "num_tokens": 61567484.0, "step": 35495 }, { "entropy": 5.360730981826782, "epoch": 2.7620307333203655, "grad_norm": 1.203125, "learning_rate": 0.0004235097217060552, "loss": 4.893, "mean_token_accuracy": 0.2114207550883293, "num_tokens": 61575542.0, "step": 35500 }, { "entropy": 5.393539476394653, "epoch": 2.7624197626920832, "grad_norm": 1.125, "learning_rate": 0.0004234888998639727, "loss": 5.0084, "mean_token_accuracy": 0.19615163058042526, "num_tokens": 61584273.0, "step": 35505 }, { "entropy": 5.341640758514404, "epoch": 2.762808792063801, "grad_norm": 1.1171875, "learning_rate": 0.0004234680757688076, "loss": 4.9751, "mean_token_accuracy": 0.2040863111615181, "num_tokens": 61593514.0, "step": 35510 }, { "entropy": 5.4047425270080565, "epoch": 2.7631978214355186, "grad_norm": 1.203125, "learning_rate": 0.00042344724942087564, "loss": 5.0166, "mean_token_accuracy": 0.2002140074968338, "num_tokens": 61601146.0, "step": 35515 }, { "entropy": 5.422760438919068, "epoch": 2.763586850807236, "grad_norm": 1.1171875, "learning_rate": 0.000423426420820493, "loss": 5.0686, "mean_token_accuracy": 0.19631607681512833, "num_tokens": 61609521.0, "step": 35520 }, { "entropy": 5.421096515655518, "epoch": 2.7639758801789536, "grad_norm": 1.0546875, "learning_rate": 0.00042340558996797564, "loss": 5.0332, "mean_token_accuracy": 0.1936247318983078, "num_tokens": 61618382.0, "step": 35525 }, { "entropy": 5.354607725143433, "epoch": 2.764364909550671, "grad_norm": 1.0703125, "learning_rate": 0.00042338475686363964, "loss": 4.9225, "mean_token_accuracy": 0.20196730196475982, "num_tokens": 61627098.0, "step": 35530 }, { "entropy": 5.312275171279907, "epoch": 2.7647539389223885, "grad_norm": 1.0625, "learning_rate": 0.0004233639215078012, "loss": 4.9691, "mean_token_accuracy": 0.20299019813537597, "num_tokens": 61635747.0, "step": 35535 }, { "entropy": 5.393980216979981, "epoch": 2.765142968294106, "grad_norm": 1.109375, "learning_rate": 0.00042334308390077637, "loss": 4.9938, "mean_token_accuracy": 0.19790416657924653, "num_tokens": 61645151.0, "step": 35540 }, { "entropy": 5.382141494750977, "epoch": 2.765531997665824, "grad_norm": 1.203125, "learning_rate": 0.0004233222440428814, "loss": 5.0151, "mean_token_accuracy": 0.20035903602838517, "num_tokens": 61653216.0, "step": 35545 }, { "entropy": 5.396370124816895, "epoch": 2.765921027037541, "grad_norm": 1.1484375, "learning_rate": 0.0004233014019344324, "loss": 5.0053, "mean_token_accuracy": 0.2015206351876259, "num_tokens": 61661583.0, "step": 35550 }, { "entropy": 5.387295484542847, "epoch": 2.766310056409259, "grad_norm": 1.1875, "learning_rate": 0.0004232805575757457, "loss": 4.9855, "mean_token_accuracy": 0.19570852667093278, "num_tokens": 61670465.0, "step": 35555 }, { "entropy": 5.465928554534912, "epoch": 2.7666990857809766, "grad_norm": 1.1171875, "learning_rate": 0.0004232597109671375, "loss": 4.9669, "mean_token_accuracy": 0.2031568169593811, "num_tokens": 61678670.0, "step": 35560 }, { "entropy": 5.450640058517456, "epoch": 2.767088115152694, "grad_norm": 1.1171875, "learning_rate": 0.0004232388621089242, "loss": 5.0399, "mean_token_accuracy": 0.1926266849040985, "num_tokens": 61687860.0, "step": 35565 }, { "entropy": 5.341442584991455, "epoch": 2.7674771445244115, "grad_norm": 1.15625, "learning_rate": 0.00042321801100142216, "loss": 5.0045, "mean_token_accuracy": 0.20018403977155685, "num_tokens": 61696395.0, "step": 35570 }, { "entropy": 5.464934682846069, "epoch": 2.767866173896129, "grad_norm": 1.1484375, "learning_rate": 0.00042319715764494765, "loss": 5.0615, "mean_token_accuracy": 0.19958362132310867, "num_tokens": 61705029.0, "step": 35575 }, { "entropy": 5.416219472885132, "epoch": 2.768255203267847, "grad_norm": 1.140625, "learning_rate": 0.00042317630203981714, "loss": 4.9695, "mean_token_accuracy": 0.20319342911243438, "num_tokens": 61713160.0, "step": 35580 }, { "entropy": 5.370386028289795, "epoch": 2.768644232639564, "grad_norm": 1.1328125, "learning_rate": 0.00042315544418634714, "loss": 4.9406, "mean_token_accuracy": 0.20982572734355925, "num_tokens": 61722094.0, "step": 35585 }, { "entropy": 5.457256174087524, "epoch": 2.769033262011282, "grad_norm": 1.125, "learning_rate": 0.00042313458408485414, "loss": 5.089, "mean_token_accuracy": 0.19261547774076462, "num_tokens": 61730771.0, "step": 35590 }, { "entropy": 5.383885335922241, "epoch": 2.7694222913829996, "grad_norm": 1.2578125, "learning_rate": 0.00042311372173565456, "loss": 4.9981, "mean_token_accuracy": 0.19807071685791017, "num_tokens": 61740059.0, "step": 35595 }, { "entropy": 5.4095909118652346, "epoch": 2.769811320754717, "grad_norm": 1.125, "learning_rate": 0.000423092857139065, "loss": 4.9568, "mean_token_accuracy": 0.2043505623936653, "num_tokens": 61748466.0, "step": 35600 }, { "entropy": 5.330094909667968, "epoch": 2.7702003501264345, "grad_norm": 1.1796875, "learning_rate": 0.000423071990295402, "loss": 4.9007, "mean_token_accuracy": 0.20384887605905533, "num_tokens": 61756862.0, "step": 35605 }, { "entropy": 5.392449808120728, "epoch": 2.770589379498152, "grad_norm": 1.15625, "learning_rate": 0.0004230511212049822, "loss": 4.9482, "mean_token_accuracy": 0.2052776634693146, "num_tokens": 61765867.0, "step": 35610 }, { "entropy": 5.427014446258545, "epoch": 2.77097840886987, "grad_norm": 1.1796875, "learning_rate": 0.0004230302498681224, "loss": 4.9788, "mean_token_accuracy": 0.19852515459060668, "num_tokens": 61774297.0, "step": 35615 }, { "entropy": 5.32357268333435, "epoch": 2.771367438241587, "grad_norm": 1.1875, "learning_rate": 0.0004230093762851392, "loss": 4.9203, "mean_token_accuracy": 0.20734080374240876, "num_tokens": 61782841.0, "step": 35620 }, { "entropy": 5.391433906555176, "epoch": 2.771756467613305, "grad_norm": 1.0703125, "learning_rate": 0.0004229885004563491, "loss": 5.0967, "mean_token_accuracy": 0.19104552417993545, "num_tokens": 61791719.0, "step": 35625 }, { "entropy": 5.441840314865113, "epoch": 2.772145496985022, "grad_norm": 1.125, "learning_rate": 0.0004229676223820692, "loss": 5.0081, "mean_token_accuracy": 0.19271782636642457, "num_tokens": 61800267.0, "step": 35630 }, { "entropy": 5.403231430053711, "epoch": 2.77253452635674, "grad_norm": 1.140625, "learning_rate": 0.00042294674206261616, "loss": 4.9906, "mean_token_accuracy": 0.2009415417909622, "num_tokens": 61808482.0, "step": 35635 }, { "entropy": 5.290844535827636, "epoch": 2.7729235557284575, "grad_norm": 1.1796875, "learning_rate": 0.0004229258594983067, "loss": 4.8583, "mean_token_accuracy": 0.2154325157403946, "num_tokens": 61816950.0, "step": 35640 }, { "entropy": 5.373343515396118, "epoch": 2.773312585100175, "grad_norm": 1.109375, "learning_rate": 0.0004229049746894578, "loss": 4.9954, "mean_token_accuracy": 0.19665665030479432, "num_tokens": 61826011.0, "step": 35645 }, { "entropy": 5.455793619155884, "epoch": 2.773701614471893, "grad_norm": 1.078125, "learning_rate": 0.0004228840876363864, "loss": 5.0253, "mean_token_accuracy": 0.1907666116952896, "num_tokens": 61834705.0, "step": 35650 }, { "entropy": 5.486746692657471, "epoch": 2.77409064384361, "grad_norm": 1.0859375, "learning_rate": 0.0004228631983394093, "loss": 4.9861, "mean_token_accuracy": 0.1986302465200424, "num_tokens": 61844166.0, "step": 35655 }, { "entropy": 5.396489095687866, "epoch": 2.774479673215328, "grad_norm": 1.1484375, "learning_rate": 0.0004228423067988434, "loss": 5.0007, "mean_token_accuracy": 0.2049995705485344, "num_tokens": 61852141.0, "step": 35660 }, { "entropy": 5.278471422195435, "epoch": 2.774868702587045, "grad_norm": 1.0859375, "learning_rate": 0.00042282141301500597, "loss": 4.9774, "mean_token_accuracy": 0.20007776468992233, "num_tokens": 61861566.0, "step": 35665 }, { "entropy": 5.399405479431152, "epoch": 2.775257731958763, "grad_norm": 1.1328125, "learning_rate": 0.0004228005169882138, "loss": 4.9639, "mean_token_accuracy": 0.2048620566725731, "num_tokens": 61869878.0, "step": 35670 }, { "entropy": 5.367794466018677, "epoch": 2.7756467613304805, "grad_norm": 1.125, "learning_rate": 0.00042277961871878413, "loss": 5.0251, "mean_token_accuracy": 0.18964139074087144, "num_tokens": 61879220.0, "step": 35675 }, { "entropy": 5.433588027954102, "epoch": 2.776035790702198, "grad_norm": 1.28125, "learning_rate": 0.0004227587182070338, "loss": 4.9522, "mean_token_accuracy": 0.20772101283073424, "num_tokens": 61887534.0, "step": 35680 }, { "entropy": 5.42021107673645, "epoch": 2.7764248200739154, "grad_norm": 1.125, "learning_rate": 0.0004227378154532802, "loss": 5.1405, "mean_token_accuracy": 0.18695973008871078, "num_tokens": 61896420.0, "step": 35685 }, { "entropy": 5.4332122802734375, "epoch": 2.776813849445633, "grad_norm": 1.109375, "learning_rate": 0.0004227169104578404, "loss": 5.076, "mean_token_accuracy": 0.19625899195671082, "num_tokens": 61905024.0, "step": 35690 }, { "entropy": 5.320305490493775, "epoch": 2.777202878817351, "grad_norm": 1.125, "learning_rate": 0.00042269600322103164, "loss": 4.9511, "mean_token_accuracy": 0.20457398146390915, "num_tokens": 61913272.0, "step": 35695 }, { "entropy": 5.38574538230896, "epoch": 2.777591908189068, "grad_norm": 1.09375, "learning_rate": 0.000422675093743171, "loss": 4.9458, "mean_token_accuracy": 0.20305030196905136, "num_tokens": 61922142.0, "step": 35700 }, { "entropy": 5.393837881088257, "epoch": 2.777980937560786, "grad_norm": 1.203125, "learning_rate": 0.00042265418202457603, "loss": 4.9685, "mean_token_accuracy": 0.2021106079220772, "num_tokens": 61930140.0, "step": 35705 }, { "entropy": 5.392801141738891, "epoch": 2.7783699669325035, "grad_norm": 1.2890625, "learning_rate": 0.0004226332680655637, "loss": 5.0434, "mean_token_accuracy": 0.1945040225982666, "num_tokens": 61938993.0, "step": 35710 }, { "entropy": 5.361865663528443, "epoch": 2.778758996304221, "grad_norm": 1.1640625, "learning_rate": 0.0004226123518664516, "loss": 5.0282, "mean_token_accuracy": 0.19247539341449738, "num_tokens": 61948063.0, "step": 35715 }, { "entropy": 5.383347892761231, "epoch": 2.7791480256759384, "grad_norm": 1.109375, "learning_rate": 0.0004225914334275569, "loss": 4.9489, "mean_token_accuracy": 0.19550112038850784, "num_tokens": 61956610.0, "step": 35720 }, { "entropy": 5.319733667373657, "epoch": 2.779537055047656, "grad_norm": 1.2109375, "learning_rate": 0.0004225705127491972, "loss": 4.8179, "mean_token_accuracy": 0.20196427702903746, "num_tokens": 61965359.0, "step": 35725 }, { "entropy": 5.34215202331543, "epoch": 2.7799260844193734, "grad_norm": 1.1875, "learning_rate": 0.0004225495898316899, "loss": 4.9901, "mean_token_accuracy": 0.19938546568155288, "num_tokens": 61973523.0, "step": 35730 }, { "entropy": 5.322200965881348, "epoch": 2.780315113791091, "grad_norm": 1.125, "learning_rate": 0.00042252866467535233, "loss": 4.9192, "mean_token_accuracy": 0.2075161561369896, "num_tokens": 61981988.0, "step": 35735 }, { "entropy": 5.392977476119995, "epoch": 2.780704143162809, "grad_norm": 1.140625, "learning_rate": 0.00042250773728050214, "loss": 4.9819, "mean_token_accuracy": 0.19958182126283647, "num_tokens": 61991400.0, "step": 35740 }, { "entropy": 5.3875421524047855, "epoch": 2.7810931725345265, "grad_norm": 1.21875, "learning_rate": 0.0004224868076474568, "loss": 5.0229, "mean_token_accuracy": 0.20196807235479355, "num_tokens": 61999287.0, "step": 35745 }, { "entropy": 5.3896137237548825, "epoch": 2.781482201906244, "grad_norm": 1.109375, "learning_rate": 0.00042246587577653394, "loss": 4.9967, "mean_token_accuracy": 0.19513302594423293, "num_tokens": 62008578.0, "step": 35750 }, { "entropy": 5.370587301254273, "epoch": 2.7818712312779614, "grad_norm": 1.1015625, "learning_rate": 0.0004224449416680511, "loss": 4.9229, "mean_token_accuracy": 0.2039752945303917, "num_tokens": 62017222.0, "step": 35755 }, { "entropy": 5.281582546234131, "epoch": 2.782260260649679, "grad_norm": 1.046875, "learning_rate": 0.00042242400532232593, "loss": 4.8744, "mean_token_accuracy": 0.2103859394788742, "num_tokens": 62026224.0, "step": 35760 }, { "entropy": 5.4089947700500485, "epoch": 2.7826492900213964, "grad_norm": 1.15625, "learning_rate": 0.00042240306673967614, "loss": 5.1603, "mean_token_accuracy": 0.19131201803684234, "num_tokens": 62036201.0, "step": 35765 }, { "entropy": 5.333034467697144, "epoch": 2.783038319393114, "grad_norm": 1.171875, "learning_rate": 0.00042238212592041945, "loss": 4.9071, "mean_token_accuracy": 0.20250097066164016, "num_tokens": 62044780.0, "step": 35770 }, { "entropy": 5.357460880279541, "epoch": 2.7834273487648318, "grad_norm": 1.109375, "learning_rate": 0.00042236118286487364, "loss": 4.9208, "mean_token_accuracy": 0.2043831929564476, "num_tokens": 62052720.0, "step": 35775 }, { "entropy": 5.3845460414886475, "epoch": 2.7838163781365495, "grad_norm": 1.1484375, "learning_rate": 0.00042234023757335633, "loss": 4.9644, "mean_token_accuracy": 0.19399232119321824, "num_tokens": 62061797.0, "step": 35780 }, { "entropy": 5.289451837539673, "epoch": 2.7842054075082667, "grad_norm": 1.1015625, "learning_rate": 0.00042231929004618547, "loss": 4.9158, "mean_token_accuracy": 0.20419395267963408, "num_tokens": 62070543.0, "step": 35785 }, { "entropy": 5.473853540420532, "epoch": 2.7845944368799844, "grad_norm": 1.265625, "learning_rate": 0.0004222983402836789, "loss": 5.0829, "mean_token_accuracy": 0.19314807802438735, "num_tokens": 62079531.0, "step": 35790 }, { "entropy": 5.34035472869873, "epoch": 2.784983466251702, "grad_norm": 1.109375, "learning_rate": 0.00042227738828615435, "loss": 4.9266, "mean_token_accuracy": 0.20471401810646056, "num_tokens": 62088429.0, "step": 35795 }, { "entropy": 5.281514358520508, "epoch": 2.7853724956234194, "grad_norm": 1.15625, "learning_rate": 0.00042225643405392993, "loss": 4.9258, "mean_token_accuracy": 0.20528976768255233, "num_tokens": 62096926.0, "step": 35800 }, { "entropy": 5.383842277526855, "epoch": 2.785761524995137, "grad_norm": 1.1328125, "learning_rate": 0.00042223547758732356, "loss": 5.1224, "mean_token_accuracy": 0.18358878940343856, "num_tokens": 62106673.0, "step": 35805 }, { "entropy": 5.421551465988159, "epoch": 2.7861505543668548, "grad_norm": 1.1171875, "learning_rate": 0.00042221451888665307, "loss": 4.9458, "mean_token_accuracy": 0.19915224313735963, "num_tokens": 62115091.0, "step": 35810 }, { "entropy": 5.440556240081787, "epoch": 2.7865395837385725, "grad_norm": 1.171875, "learning_rate": 0.00042219355795223657, "loss": 5.0159, "mean_token_accuracy": 0.19717124104499817, "num_tokens": 62124062.0, "step": 35815 }, { "entropy": 5.411426973342896, "epoch": 2.7869286131102897, "grad_norm": 1.1328125, "learning_rate": 0.00042217259478439216, "loss": 4.9442, "mean_token_accuracy": 0.2024976819753647, "num_tokens": 62133141.0, "step": 35820 }, { "entropy": 5.384665298461914, "epoch": 2.7873176424820074, "grad_norm": 1.09375, "learning_rate": 0.0004221516293834379, "loss": 4.9771, "mean_token_accuracy": 0.20215948224067687, "num_tokens": 62142056.0, "step": 35825 }, { "entropy": 5.42564287185669, "epoch": 2.787706671853725, "grad_norm": 1.109375, "learning_rate": 0.00042213066174969177, "loss": 4.9673, "mean_token_accuracy": 0.2007246881723404, "num_tokens": 62150064.0, "step": 35830 }, { "entropy": 5.307141351699829, "epoch": 2.7880957012254424, "grad_norm": 1.0859375, "learning_rate": 0.00042210969188347217, "loss": 4.9073, "mean_token_accuracy": 0.2046535938978195, "num_tokens": 62159300.0, "step": 35835 }, { "entropy": 5.322756385803222, "epoch": 2.78848473059716, "grad_norm": 1.125, "learning_rate": 0.0004220887197850971, "loss": 4.8874, "mean_token_accuracy": 0.20173195153474807, "num_tokens": 62167774.0, "step": 35840 }, { "entropy": 5.3925244331359865, "epoch": 2.7888737599688778, "grad_norm": 1.1796875, "learning_rate": 0.00042206774545488476, "loss": 4.9581, "mean_token_accuracy": 0.20503920316696167, "num_tokens": 62176301.0, "step": 35845 }, { "entropy": 5.335413408279419, "epoch": 2.7892627893405955, "grad_norm": 1.0859375, "learning_rate": 0.0004220467688931535, "loss": 4.9492, "mean_token_accuracy": 0.19678831696510315, "num_tokens": 62184804.0, "step": 35850 }, { "entropy": 5.371379423141479, "epoch": 2.7896518187123127, "grad_norm": 1.0859375, "learning_rate": 0.0004220257901002216, "loss": 4.9477, "mean_token_accuracy": 0.19621988236904145, "num_tokens": 62193864.0, "step": 35855 }, { "entropy": 5.379216814041138, "epoch": 2.7900408480840304, "grad_norm": 1.0625, "learning_rate": 0.0004220048090764073, "loss": 4.9578, "mean_token_accuracy": 0.20145267695188523, "num_tokens": 62202906.0, "step": 35860 }, { "entropy": 5.28515853881836, "epoch": 2.7904298774557477, "grad_norm": 1.109375, "learning_rate": 0.00042198382582202905, "loss": 4.8094, "mean_token_accuracy": 0.21349625438451766, "num_tokens": 62211292.0, "step": 35865 }, { "entropy": 5.362348461151123, "epoch": 2.7908189068274654, "grad_norm": 1.109375, "learning_rate": 0.0004219628403374052, "loss": 5.0862, "mean_token_accuracy": 0.19391706436872483, "num_tokens": 62220830.0, "step": 35870 }, { "entropy": 5.383690261840821, "epoch": 2.791207936199183, "grad_norm": 1.2734375, "learning_rate": 0.0004219418526228541, "loss": 4.9777, "mean_token_accuracy": 0.19670870900154114, "num_tokens": 62228659.0, "step": 35875 }, { "entropy": 5.431873559951782, "epoch": 2.7915969655709008, "grad_norm": 1.0703125, "learning_rate": 0.0004219208626786943, "loss": 5.0718, "mean_token_accuracy": 0.18918053209781646, "num_tokens": 62238098.0, "step": 35880 }, { "entropy": 5.476975965499878, "epoch": 2.791985994942618, "grad_norm": 1.0234375, "learning_rate": 0.0004218998705052443, "loss": 5.0867, "mean_token_accuracy": 0.18456562906503676, "num_tokens": 62247523.0, "step": 35885 }, { "entropy": 5.4104971408844, "epoch": 2.7923750243143357, "grad_norm": 1.171875, "learning_rate": 0.00042187887610282255, "loss": 4.9677, "mean_token_accuracy": 0.19273096472024917, "num_tokens": 62255601.0, "step": 35890 }, { "entropy": 5.398213291168213, "epoch": 2.7927640536860534, "grad_norm": 1.1640625, "learning_rate": 0.0004218578794717476, "loss": 4.9799, "mean_token_accuracy": 0.19614312350749968, "num_tokens": 62263650.0, "step": 35895 }, { "entropy": 5.3360267162323, "epoch": 2.7931530830577707, "grad_norm": 1.078125, "learning_rate": 0.00042183688061233813, "loss": 5.0083, "mean_token_accuracy": 0.19483959525823594, "num_tokens": 62272474.0, "step": 35900 }, { "entropy": 5.350556468963623, "epoch": 2.7935421124294884, "grad_norm": 1.0625, "learning_rate": 0.00042181587952491267, "loss": 4.8607, "mean_token_accuracy": 0.21262108087539672, "num_tokens": 62281364.0, "step": 35905 }, { "entropy": 5.40102219581604, "epoch": 2.793931141801206, "grad_norm": 1.1875, "learning_rate": 0.00042179487620978997, "loss": 4.9479, "mean_token_accuracy": 0.19825297594070435, "num_tokens": 62289025.0, "step": 35910 }, { "entropy": 5.34331431388855, "epoch": 2.7943201711729238, "grad_norm": 1.2421875, "learning_rate": 0.0004217738706672886, "loss": 4.9872, "mean_token_accuracy": 0.19918045550584793, "num_tokens": 62298063.0, "step": 35915 }, { "entropy": 5.354018497467041, "epoch": 2.794709200544641, "grad_norm": 1.4140625, "learning_rate": 0.00042175286289772746, "loss": 4.9628, "mean_token_accuracy": 0.19780047237873077, "num_tokens": 62306806.0, "step": 35920 }, { "entropy": 5.337471961975098, "epoch": 2.7950982299163587, "grad_norm": 1.109375, "learning_rate": 0.0004217318529014251, "loss": 4.9636, "mean_token_accuracy": 0.19914084821939468, "num_tokens": 62315119.0, "step": 35925 }, { "entropy": 5.404162311553955, "epoch": 2.7954872592880764, "grad_norm": 1.1640625, "learning_rate": 0.0004217108406787005, "loss": 5.0551, "mean_token_accuracy": 0.19554538875818253, "num_tokens": 62323615.0, "step": 35930 }, { "entropy": 5.422103309631348, "epoch": 2.7958762886597937, "grad_norm": 1.21875, "learning_rate": 0.0004216898262298724, "loss": 4.9811, "mean_token_accuracy": 0.20338421911001206, "num_tokens": 62332313.0, "step": 35935 }, { "entropy": 5.234785079956055, "epoch": 2.7962653180315113, "grad_norm": 1.0625, "learning_rate": 0.0004216688095552596, "loss": 4.808, "mean_token_accuracy": 0.20752618610858917, "num_tokens": 62341060.0, "step": 35940 }, { "entropy": 5.397421216964721, "epoch": 2.796654347403229, "grad_norm": 1.109375, "learning_rate": 0.0004216477906551811, "loss": 5.0463, "mean_token_accuracy": 0.1946691781282425, "num_tokens": 62349616.0, "step": 35945 }, { "entropy": 5.412206935882568, "epoch": 2.7970433767749467, "grad_norm": 1.0625, "learning_rate": 0.00042162676952995585, "loss": 4.9952, "mean_token_accuracy": 0.20287972539663315, "num_tokens": 62358083.0, "step": 35950 }, { "entropy": 5.416095161437989, "epoch": 2.797432406146664, "grad_norm": 1.203125, "learning_rate": 0.00042160574617990267, "loss": 4.9903, "mean_token_accuracy": 0.1979239284992218, "num_tokens": 62366494.0, "step": 35955 }, { "entropy": 5.397483539581299, "epoch": 2.7978214355183817, "grad_norm": 1.140625, "learning_rate": 0.00042158472060534066, "loss": 4.9798, "mean_token_accuracy": 0.19367599338293076, "num_tokens": 62375590.0, "step": 35960 }, { "entropy": 5.478774452209473, "epoch": 2.798210464890099, "grad_norm": 1.1484375, "learning_rate": 0.00042156369280658886, "loss": 5.1304, "mean_token_accuracy": 0.19774450212717057, "num_tokens": 62384186.0, "step": 35965 }, { "entropy": 5.4219160079956055, "epoch": 2.7985994942618166, "grad_norm": 1.171875, "learning_rate": 0.0004215426627839662, "loss": 4.9443, "mean_token_accuracy": 0.2010745882987976, "num_tokens": 62392789.0, "step": 35970 }, { "entropy": 5.322008562088013, "epoch": 2.7989885236335343, "grad_norm": 1.2109375, "learning_rate": 0.00042152163053779196, "loss": 4.9545, "mean_token_accuracy": 0.19932419806718826, "num_tokens": 62401808.0, "step": 35975 }, { "entropy": 5.430076313018799, "epoch": 2.799377553005252, "grad_norm": 1.1953125, "learning_rate": 0.0004215005960683852, "loss": 5.0252, "mean_token_accuracy": 0.1908600762486458, "num_tokens": 62410700.0, "step": 35980 }, { "entropy": 5.437100982666015, "epoch": 2.7997665823769697, "grad_norm": 1.1328125, "learning_rate": 0.0004214795593760651, "loss": 4.9484, "mean_token_accuracy": 0.2061524957418442, "num_tokens": 62419337.0, "step": 35985 }, { "entropy": 5.363708066940307, "epoch": 2.800155611748687, "grad_norm": 1.25, "learning_rate": 0.0004214585204611508, "loss": 5.0308, "mean_token_accuracy": 0.1986408516764641, "num_tokens": 62427189.0, "step": 35990 }, { "entropy": 5.388799667358398, "epoch": 2.8005446411204047, "grad_norm": 1.1640625, "learning_rate": 0.00042143747932396153, "loss": 5.0846, "mean_token_accuracy": 0.19581374078989028, "num_tokens": 62436531.0, "step": 35995 }, { "entropy": 5.432786846160889, "epoch": 2.800933670492122, "grad_norm": 1.21875, "learning_rate": 0.0004214164359648166, "loss": 5.0456, "mean_token_accuracy": 0.19871318340301514, "num_tokens": 62445250.0, "step": 36000 }, { "epoch": 2.800933670492122, "eval_entropy": 5.240249944949403, "eval_loss": 5.0924835205078125, "eval_mean_token_accuracy": 0.2027466549063899, "eval_num_tokens": 62445250.0, "eval_runtime": 28.7364, "eval_samples_per_second": 1446.178, "eval_steps_per_second": 180.781, "step": 36000 }, { "entropy": 5.401690864562989, "epoch": 2.8013226998638396, "grad_norm": 1.1015625, "learning_rate": 0.00042139539038403535, "loss": 4.9324, "mean_token_accuracy": 0.20196448862552643, "num_tokens": 62454221.0, "step": 36005 }, { "entropy": 5.3202269077301025, "epoch": 2.8017117292355573, "grad_norm": 1.2109375, "learning_rate": 0.000421374342581937, "loss": 4.8701, "mean_token_accuracy": 0.21134181767702104, "num_tokens": 62463237.0, "step": 36010 }, { "entropy": 5.384362125396729, "epoch": 2.802100758607275, "grad_norm": 1.1796875, "learning_rate": 0.00042135329255884105, "loss": 4.9941, "mean_token_accuracy": 0.1996095985174179, "num_tokens": 62472227.0, "step": 36015 }, { "entropy": 5.363177728652954, "epoch": 2.8024897879789923, "grad_norm": 1.140625, "learning_rate": 0.0004213322403150668, "loss": 4.9058, "mean_token_accuracy": 0.20486340075731277, "num_tokens": 62480225.0, "step": 36020 }, { "entropy": 5.411304903030396, "epoch": 2.80287881735071, "grad_norm": 1.1171875, "learning_rate": 0.0004213111858509337, "loss": 4.9977, "mean_token_accuracy": 0.19507963806390763, "num_tokens": 62487858.0, "step": 36025 }, { "entropy": 5.432738733291626, "epoch": 2.8032678467224277, "grad_norm": 1.1796875, "learning_rate": 0.0004212901291667612, "loss": 5.1026, "mean_token_accuracy": 0.1950969859957695, "num_tokens": 62496004.0, "step": 36030 }, { "entropy": 5.387632131576538, "epoch": 2.803656876094145, "grad_norm": 1.2109375, "learning_rate": 0.00042126907026286887, "loss": 4.9944, "mean_token_accuracy": 0.19514856934547425, "num_tokens": 62504011.0, "step": 36035 }, { "entropy": 5.420150995254517, "epoch": 2.8040459054658626, "grad_norm": 1.1484375, "learning_rate": 0.00042124800913957624, "loss": 5.0021, "mean_token_accuracy": 0.19884813725948333, "num_tokens": 62512143.0, "step": 36040 }, { "entropy": 5.465098094940186, "epoch": 2.8044349348375803, "grad_norm": 1.140625, "learning_rate": 0.0004212269457972028, "loss": 5.0069, "mean_token_accuracy": 0.19502864480018617, "num_tokens": 62520374.0, "step": 36045 }, { "entropy": 5.491916799545288, "epoch": 2.804823964209298, "grad_norm": 1.1875, "learning_rate": 0.0004212058802360682, "loss": 5.0711, "mean_token_accuracy": 0.1921910747885704, "num_tokens": 62529345.0, "step": 36050 }, { "entropy": 5.326232767105102, "epoch": 2.8052129935810153, "grad_norm": 1.140625, "learning_rate": 0.0004211848124564922, "loss": 4.9309, "mean_token_accuracy": 0.1997879147529602, "num_tokens": 62538622.0, "step": 36055 }, { "entropy": 5.365319871902466, "epoch": 2.805602022952733, "grad_norm": 1.1171875, "learning_rate": 0.0004211637424587942, "loss": 4.9133, "mean_token_accuracy": 0.2012769713997841, "num_tokens": 62547071.0, "step": 36060 }, { "entropy": 5.4547303199768065, "epoch": 2.8059910523244502, "grad_norm": 1.296875, "learning_rate": 0.0004211426702432941, "loss": 5.0209, "mean_token_accuracy": 0.19625279754400254, "num_tokens": 62556321.0, "step": 36065 }, { "entropy": 5.445640611648559, "epoch": 2.806380081696168, "grad_norm": 1.203125, "learning_rate": 0.0004211215958103116, "loss": 5.1363, "mean_token_accuracy": 0.18879806697368623, "num_tokens": 62565549.0, "step": 36070 }, { "entropy": 5.35904541015625, "epoch": 2.8067691110678856, "grad_norm": 1.0703125, "learning_rate": 0.00042110051916016645, "loss": 4.9267, "mean_token_accuracy": 0.20534685552120208, "num_tokens": 62573753.0, "step": 36075 }, { "entropy": 5.373360061645508, "epoch": 2.8071581404396033, "grad_norm": 1.0390625, "learning_rate": 0.0004210794402931785, "loss": 5.0186, "mean_token_accuracy": 0.19346022307872773, "num_tokens": 62583919.0, "step": 36080 }, { "entropy": 5.339261388778686, "epoch": 2.807547169811321, "grad_norm": 1.09375, "learning_rate": 0.0004210583592096675, "loss": 4.9485, "mean_token_accuracy": 0.1957052767276764, "num_tokens": 62592136.0, "step": 36085 }, { "entropy": 5.394687938690185, "epoch": 2.8079361991830383, "grad_norm": 1.171875, "learning_rate": 0.0004210372759099534, "loss": 4.9245, "mean_token_accuracy": 0.20260759443044662, "num_tokens": 62600742.0, "step": 36090 }, { "entropy": 5.388784265518188, "epoch": 2.808325228554756, "grad_norm": 1.234375, "learning_rate": 0.000421016190394356, "loss": 4.9213, "mean_token_accuracy": 0.202702035009861, "num_tokens": 62608239.0, "step": 36095 }, { "entropy": 5.3343925952911375, "epoch": 2.8087142579264732, "grad_norm": 1.1171875, "learning_rate": 0.00042099510266319545, "loss": 4.9612, "mean_token_accuracy": 0.19917184710502625, "num_tokens": 62617445.0, "step": 36100 }, { "entropy": 5.334157466888428, "epoch": 2.809103287298191, "grad_norm": 1.1640625, "learning_rate": 0.0004209740127167915, "loss": 4.9575, "mean_token_accuracy": 0.19956833124160767, "num_tokens": 62625578.0, "step": 36105 }, { "entropy": 5.352154874801636, "epoch": 2.8094923166699086, "grad_norm": 1.0859375, "learning_rate": 0.0004209529205554643, "loss": 4.9561, "mean_token_accuracy": 0.1968429207801819, "num_tokens": 62635028.0, "step": 36110 }, { "entropy": 5.4406829357147215, "epoch": 2.8098813460416263, "grad_norm": 1.1484375, "learning_rate": 0.0004209318261795339, "loss": 4.9796, "mean_token_accuracy": 0.2022951975464821, "num_tokens": 62643739.0, "step": 36115 }, { "entropy": 5.447633266448975, "epoch": 2.8102703754133436, "grad_norm": 1.125, "learning_rate": 0.0004209107295893202, "loss": 5.1049, "mean_token_accuracy": 0.19537079483270645, "num_tokens": 62652769.0, "step": 36120 }, { "entropy": 5.314122486114502, "epoch": 2.8106594047850613, "grad_norm": 1.1484375, "learning_rate": 0.00042088963078514344, "loss": 4.9541, "mean_token_accuracy": 0.19805045425891876, "num_tokens": 62661412.0, "step": 36125 }, { "entropy": 5.335757923126221, "epoch": 2.811048434156779, "grad_norm": 1.125, "learning_rate": 0.0004208685297673238, "loss": 4.9993, "mean_token_accuracy": 0.19910851269960403, "num_tokens": 62670048.0, "step": 36130 }, { "entropy": 5.403274822235107, "epoch": 2.811437463528496, "grad_norm": 1.125, "learning_rate": 0.0004208474265361813, "loss": 4.9761, "mean_token_accuracy": 0.19658947587013245, "num_tokens": 62678901.0, "step": 36135 }, { "entropy": 5.342027091979981, "epoch": 2.811826492900214, "grad_norm": 1.125, "learning_rate": 0.00042082632109203627, "loss": 4.8927, "mean_token_accuracy": 0.20444838851690292, "num_tokens": 62687124.0, "step": 36140 }, { "entropy": 5.390532684326172, "epoch": 2.8122155222719316, "grad_norm": 1.1484375, "learning_rate": 0.000420805213435209, "loss": 5.0231, "mean_token_accuracy": 0.1904981777071953, "num_tokens": 62696029.0, "step": 36145 }, { "entropy": 5.372088289260864, "epoch": 2.8126045516436493, "grad_norm": 1.2109375, "learning_rate": 0.0004207841035660196, "loss": 4.903, "mean_token_accuracy": 0.20387211591005325, "num_tokens": 62704181.0, "step": 36150 }, { "entropy": 5.328259706497192, "epoch": 2.8129935810153666, "grad_norm": 1.1171875, "learning_rate": 0.0004207629914847885, "loss": 5.018, "mean_token_accuracy": 0.20008323043584825, "num_tokens": 62713440.0, "step": 36155 }, { "entropy": 5.330566644668579, "epoch": 2.8133826103870843, "grad_norm": 1.1171875, "learning_rate": 0.000420741877191836, "loss": 4.979, "mean_token_accuracy": 0.20319633185863495, "num_tokens": 62723024.0, "step": 36160 }, { "entropy": 5.3710874080657955, "epoch": 2.8137716397588015, "grad_norm": 1.140625, "learning_rate": 0.0004207207606874825, "loss": 4.9599, "mean_token_accuracy": 0.19447644650936127, "num_tokens": 62731441.0, "step": 36165 }, { "entropy": 5.427125644683838, "epoch": 2.814160669130519, "grad_norm": 1.1953125, "learning_rate": 0.0004206996419720484, "loss": 5.0529, "mean_token_accuracy": 0.1998141050338745, "num_tokens": 62740073.0, "step": 36170 }, { "entropy": 5.305306148529053, "epoch": 2.814549698502237, "grad_norm": 1.109375, "learning_rate": 0.0004206785210458541, "loss": 4.8523, "mean_token_accuracy": 0.20848419070243834, "num_tokens": 62749192.0, "step": 36175 }, { "entropy": 5.362651205062866, "epoch": 2.8149387278739546, "grad_norm": 1.1796875, "learning_rate": 0.0004206573979092202, "loss": 4.9699, "mean_token_accuracy": 0.20324881225824357, "num_tokens": 62757408.0, "step": 36180 }, { "entropy": 5.377953958511353, "epoch": 2.8153277572456723, "grad_norm": 1.078125, "learning_rate": 0.00042063627256246706, "loss": 4.9923, "mean_token_accuracy": 0.20035659074783324, "num_tokens": 62767475.0, "step": 36185 }, { "entropy": 5.308944416046143, "epoch": 2.8157167866173896, "grad_norm": 1.234375, "learning_rate": 0.0004206151450059153, "loss": 4.8636, "mean_token_accuracy": 0.2066209852695465, "num_tokens": 62775802.0, "step": 36190 }, { "entropy": 5.26205587387085, "epoch": 2.8161058159891073, "grad_norm": 1.1015625, "learning_rate": 0.00042059401523988546, "loss": 4.9244, "mean_token_accuracy": 0.19986067712306976, "num_tokens": 62784718.0, "step": 36195 }, { "entropy": 5.358785200119018, "epoch": 2.8164948453608245, "grad_norm": 1.171875, "learning_rate": 0.0004205728832646982, "loss": 5.0446, "mean_token_accuracy": 0.19115493595600128, "num_tokens": 62793692.0, "step": 36200 }, { "entropy": 5.389555263519287, "epoch": 2.816883874732542, "grad_norm": 1.125, "learning_rate": 0.00042055174908067414, "loss": 5.013, "mean_token_accuracy": 0.20038746744394303, "num_tokens": 62802583.0, "step": 36205 }, { "entropy": 5.402655458450317, "epoch": 2.81727290410426, "grad_norm": 1.171875, "learning_rate": 0.00042053061268813397, "loss": 4.9674, "mean_token_accuracy": 0.2008891597390175, "num_tokens": 62812374.0, "step": 36210 }, { "entropy": 5.391308784484863, "epoch": 2.8176619334759776, "grad_norm": 1.140625, "learning_rate": 0.00042050947408739836, "loss": 5.0456, "mean_token_accuracy": 0.19457284212112427, "num_tokens": 62821796.0, "step": 36215 }, { "entropy": 5.405890846252442, "epoch": 2.818050962847695, "grad_norm": 1.09375, "learning_rate": 0.0004204883332787881, "loss": 4.9681, "mean_token_accuracy": 0.19584135562181473, "num_tokens": 62831349.0, "step": 36220 }, { "entropy": 5.362933683395386, "epoch": 2.8184399922194125, "grad_norm": 1.1484375, "learning_rate": 0.00042046719026262396, "loss": 4.9529, "mean_token_accuracy": 0.20298338681459427, "num_tokens": 62838842.0, "step": 36225 }, { "entropy": 5.329693222045899, "epoch": 2.8188290215911302, "grad_norm": 1.1171875, "learning_rate": 0.00042044604503922674, "loss": 4.9331, "mean_token_accuracy": 0.2032444953918457, "num_tokens": 62847067.0, "step": 36230 }, { "entropy": 5.301738548278808, "epoch": 2.8192180509628475, "grad_norm": 1.1484375, "learning_rate": 0.0004204248976089173, "loss": 4.8088, "mean_token_accuracy": 0.2089138373732567, "num_tokens": 62855374.0, "step": 36235 }, { "entropy": 5.345616674423217, "epoch": 2.819607080334565, "grad_norm": 1.1875, "learning_rate": 0.0004204037479720165, "loss": 4.9283, "mean_token_accuracy": 0.20207460671663285, "num_tokens": 62863141.0, "step": 36240 }, { "entropy": 5.3851696968078615, "epoch": 2.819996109706283, "grad_norm": 1.1015625, "learning_rate": 0.00042038259612884514, "loss": 5.0487, "mean_token_accuracy": 0.19783153682947158, "num_tokens": 62872080.0, "step": 36245 }, { "entropy": 5.395944118499756, "epoch": 2.8203851390780006, "grad_norm": 1.15625, "learning_rate": 0.00042036144207972445, "loss": 5.0123, "mean_token_accuracy": 0.20139943361282348, "num_tokens": 62880492.0, "step": 36250 }, { "entropy": 5.366403865814209, "epoch": 2.820774168449718, "grad_norm": 1.140625, "learning_rate": 0.0004203402858249752, "loss": 4.9113, "mean_token_accuracy": 0.20440810173749924, "num_tokens": 62888961.0, "step": 36255 }, { "entropy": 5.383540868759155, "epoch": 2.8211631978214355, "grad_norm": 1.2421875, "learning_rate": 0.0004203191273649184, "loss": 4.9755, "mean_token_accuracy": 0.20121616274118423, "num_tokens": 62897224.0, "step": 36260 }, { "entropy": 5.377414655685425, "epoch": 2.8215522271931532, "grad_norm": 1.140625, "learning_rate": 0.00042029796669987513, "loss": 4.9681, "mean_token_accuracy": 0.20221128165721894, "num_tokens": 62905873.0, "step": 36265 }, { "entropy": 5.408347034454346, "epoch": 2.8219412565648705, "grad_norm": 1.0859375, "learning_rate": 0.0004202768038301665, "loss": 5.0022, "mean_token_accuracy": 0.2004620224237442, "num_tokens": 62914438.0, "step": 36270 }, { "entropy": 5.418831157684326, "epoch": 2.822330285936588, "grad_norm": 1.1640625, "learning_rate": 0.00042025563875611367, "loss": 5.0142, "mean_token_accuracy": 0.19713575541973113, "num_tokens": 62923310.0, "step": 36275 }, { "entropy": 5.380051755905152, "epoch": 2.822719315308306, "grad_norm": 1.171875, "learning_rate": 0.0004202344714780376, "loss": 5.0332, "mean_token_accuracy": 0.19681963473558425, "num_tokens": 62932031.0, "step": 36280 }, { "entropy": 5.381773042678833, "epoch": 2.8231083446800236, "grad_norm": 1.1484375, "learning_rate": 0.00042021330199625966, "loss": 4.9771, "mean_token_accuracy": 0.19716326594352723, "num_tokens": 62939695.0, "step": 36285 }, { "entropy": 5.3902459144592285, "epoch": 2.823497374051741, "grad_norm": 1.109375, "learning_rate": 0.00042019213031110105, "loss": 4.9443, "mean_token_accuracy": 0.20004019886255264, "num_tokens": 62948251.0, "step": 36290 }, { "entropy": 5.414561414718628, "epoch": 2.8238864034234585, "grad_norm": 1.171875, "learning_rate": 0.0004201709564228829, "loss": 4.9783, "mean_token_accuracy": 0.19726343154907228, "num_tokens": 62956881.0, "step": 36295 }, { "entropy": 5.520067548751831, "epoch": 2.824275432795176, "grad_norm": 1.125, "learning_rate": 0.00042014978033192655, "loss": 5.1438, "mean_token_accuracy": 0.18636136502027512, "num_tokens": 62966241.0, "step": 36300 }, { "entropy": 5.349583768844605, "epoch": 2.8246644621668935, "grad_norm": 1.09375, "learning_rate": 0.00042012860203855337, "loss": 4.8555, "mean_token_accuracy": 0.20345052182674409, "num_tokens": 62974826.0, "step": 36305 }, { "entropy": 5.445868492126465, "epoch": 2.825053491538611, "grad_norm": 1.1015625, "learning_rate": 0.00042010742154308453, "loss": 5.0604, "mean_token_accuracy": 0.19412871301174164, "num_tokens": 62983800.0, "step": 36310 }, { "entropy": 5.399209499359131, "epoch": 2.825442520910329, "grad_norm": 1.171875, "learning_rate": 0.00042008623884584167, "loss": 5.0534, "mean_token_accuracy": 0.1923176482319832, "num_tokens": 62993219.0, "step": 36315 }, { "entropy": 5.457874441146851, "epoch": 2.825831550282046, "grad_norm": 1.0390625, "learning_rate": 0.00042006505394714597, "loss": 5.0286, "mean_token_accuracy": 0.19659639596939088, "num_tokens": 63002455.0, "step": 36320 }, { "entropy": 5.479030132293701, "epoch": 2.826220579653764, "grad_norm": 1.2109375, "learning_rate": 0.00042004386684731896, "loss": 5.1029, "mean_token_accuracy": 0.18663970828056337, "num_tokens": 63012200.0, "step": 36325 }, { "entropy": 5.356777143478394, "epoch": 2.8266096090254815, "grad_norm": 1.1328125, "learning_rate": 0.00042002267754668216, "loss": 4.9914, "mean_token_accuracy": 0.20466650277376175, "num_tokens": 63021870.0, "step": 36330 }, { "entropy": 5.414930772781372, "epoch": 2.826998638397199, "grad_norm": 1.1953125, "learning_rate": 0.000420001486045557, "loss": 4.9802, "mean_token_accuracy": 0.19850059300661088, "num_tokens": 63030941.0, "step": 36335 }, { "entropy": 5.465569257736206, "epoch": 2.8273876677689165, "grad_norm": 1.1171875, "learning_rate": 0.0004199802923442652, "loss": 5.0447, "mean_token_accuracy": 0.19225822389125824, "num_tokens": 63039264.0, "step": 36340 }, { "entropy": 5.4531008243560795, "epoch": 2.827776697140634, "grad_norm": 1.15625, "learning_rate": 0.0004199590964431282, "loss": 5.0449, "mean_token_accuracy": 0.19052287936210632, "num_tokens": 63048723.0, "step": 36345 }, { "entropy": 5.362220096588135, "epoch": 2.828165726512352, "grad_norm": 1.0859375, "learning_rate": 0.0004199378983424676, "loss": 4.9565, "mean_token_accuracy": 0.2024417906999588, "num_tokens": 63058147.0, "step": 36350 }, { "entropy": 5.387423753738403, "epoch": 2.828554755884069, "grad_norm": 1.125, "learning_rate": 0.00041991669804260505, "loss": 4.9509, "mean_token_accuracy": 0.19898790270090103, "num_tokens": 63066614.0, "step": 36355 }, { "entropy": 5.364709663391113, "epoch": 2.828943785255787, "grad_norm": 1.109375, "learning_rate": 0.0004198954955438623, "loss": 4.9241, "mean_token_accuracy": 0.20080677717924117, "num_tokens": 63075174.0, "step": 36360 }, { "entropy": 5.3992424488067625, "epoch": 2.8293328146275045, "grad_norm": 1.234375, "learning_rate": 0.000419874290846561, "loss": 4.9634, "mean_token_accuracy": 0.19825672805309297, "num_tokens": 63083375.0, "step": 36365 }, { "entropy": 5.3866822719573975, "epoch": 2.8297218439992218, "grad_norm": 1.1875, "learning_rate": 0.00041985308395102303, "loss": 5.0446, "mean_token_accuracy": 0.20821838080883026, "num_tokens": 63091669.0, "step": 36370 }, { "entropy": 5.385388326644898, "epoch": 2.8301108733709395, "grad_norm": 1.0625, "learning_rate": 0.00041983187485756997, "loss": 5.0218, "mean_token_accuracy": 0.19797692000865935, "num_tokens": 63100597.0, "step": 36375 }, { "entropy": 5.4726152420043945, "epoch": 2.830499902742657, "grad_norm": 1.2109375, "learning_rate": 0.00041981066356652373, "loss": 5.1166, "mean_token_accuracy": 0.19607223123311995, "num_tokens": 63109445.0, "step": 36380 }, { "entropy": 5.426414918899536, "epoch": 2.830888932114375, "grad_norm": 1.109375, "learning_rate": 0.00041978945007820626, "loss": 5.0086, "mean_token_accuracy": 0.19027449935674667, "num_tokens": 63118485.0, "step": 36385 }, { "entropy": 5.365958738327026, "epoch": 2.831277961486092, "grad_norm": 1.09375, "learning_rate": 0.00041976823439293925, "loss": 4.9807, "mean_token_accuracy": 0.20073189437389374, "num_tokens": 63127366.0, "step": 36390 }, { "entropy": 5.331878805160523, "epoch": 2.83166699085781, "grad_norm": 1.1171875, "learning_rate": 0.0004197470165110447, "loss": 5.0146, "mean_token_accuracy": 0.1915379211306572, "num_tokens": 63136192.0, "step": 36395 }, { "entropy": 5.476261854171753, "epoch": 2.832056020229527, "grad_norm": 1.2421875, "learning_rate": 0.0004197257964328446, "loss": 5.0828, "mean_token_accuracy": 0.19480252563953399, "num_tokens": 63144250.0, "step": 36400 }, { "entropy": 5.42934775352478, "epoch": 2.8324450496012448, "grad_norm": 1.1796875, "learning_rate": 0.0004197045741586609, "loss": 4.971, "mean_token_accuracy": 0.20400989949703216, "num_tokens": 63152685.0, "step": 36405 }, { "entropy": 5.389996814727783, "epoch": 2.8328340789729625, "grad_norm": 1.1328125, "learning_rate": 0.0004196833496888156, "loss": 4.9068, "mean_token_accuracy": 0.20530979633331298, "num_tokens": 63161853.0, "step": 36410 }, { "entropy": 5.3254420280456545, "epoch": 2.83322310834468, "grad_norm": 1.1640625, "learning_rate": 0.0004196621230236308, "loss": 4.925, "mean_token_accuracy": 0.20006163418293, "num_tokens": 63170626.0, "step": 36415 }, { "entropy": 5.336709070205688, "epoch": 2.833612137716398, "grad_norm": 1.125, "learning_rate": 0.00041964089416342845, "loss": 4.992, "mean_token_accuracy": 0.19946582168340682, "num_tokens": 63180183.0, "step": 36420 }, { "entropy": 5.435316038131714, "epoch": 2.834001167088115, "grad_norm": 1.1171875, "learning_rate": 0.0004196196631085308, "loss": 5.028, "mean_token_accuracy": 0.19180624485015868, "num_tokens": 63188993.0, "step": 36425 }, { "entropy": 5.39701886177063, "epoch": 2.834390196459833, "grad_norm": 1.1953125, "learning_rate": 0.00041959842985925987, "loss": 5.0259, "mean_token_accuracy": 0.19429241120815277, "num_tokens": 63197592.0, "step": 36430 }, { "entropy": 5.372807312011719, "epoch": 2.83477922583155, "grad_norm": 1.109375, "learning_rate": 0.000419577194415938, "loss": 5.0016, "mean_token_accuracy": 0.19639111757278443, "num_tokens": 63206216.0, "step": 36435 }, { "entropy": 5.3529191493988035, "epoch": 2.8351682552032678, "grad_norm": 1.109375, "learning_rate": 0.00041955595677888735, "loss": 4.9347, "mean_token_accuracy": 0.20346073508262635, "num_tokens": 63214633.0, "step": 36440 }, { "entropy": 5.383954477310181, "epoch": 2.8355572845749855, "grad_norm": 1.109375, "learning_rate": 0.0004195347169484301, "loss": 4.9662, "mean_token_accuracy": 0.19904121309518813, "num_tokens": 63223666.0, "step": 36445 }, { "entropy": 5.320629262924195, "epoch": 2.835946313946703, "grad_norm": 1.1484375, "learning_rate": 0.0004195134749248886, "loss": 4.8769, "mean_token_accuracy": 0.20694139003753662, "num_tokens": 63232192.0, "step": 36450 }, { "entropy": 5.292669868469238, "epoch": 2.8363353433184204, "grad_norm": 1.140625, "learning_rate": 0.0004194922307085851, "loss": 4.9437, "mean_token_accuracy": 0.1955632135272026, "num_tokens": 63241235.0, "step": 36455 }, { "entropy": 5.4641725540161135, "epoch": 2.836724372690138, "grad_norm": 1.15625, "learning_rate": 0.0004194709842998419, "loss": 5.0699, "mean_token_accuracy": 0.19470468610525132, "num_tokens": 63249742.0, "step": 36460 }, { "entropy": 5.365504121780395, "epoch": 2.837113402061856, "grad_norm": 1.1484375, "learning_rate": 0.00041944973569898157, "loss": 4.9409, "mean_token_accuracy": 0.20193239003419877, "num_tokens": 63258004.0, "step": 36465 }, { "entropy": 5.455755376815796, "epoch": 2.837502431433573, "grad_norm": 1.140625, "learning_rate": 0.0004194284849063265, "loss": 5.0415, "mean_token_accuracy": 0.19460777044296265, "num_tokens": 63266478.0, "step": 36470 }, { "entropy": 5.37844295501709, "epoch": 2.8378914608052908, "grad_norm": 1.1015625, "learning_rate": 0.0004194072319221989, "loss": 4.9664, "mean_token_accuracy": 0.20050947964191437, "num_tokens": 63274868.0, "step": 36475 }, { "entropy": 5.38673963546753, "epoch": 2.8382804901770085, "grad_norm": 1.140625, "learning_rate": 0.0004193859767469214, "loss": 5.0803, "mean_token_accuracy": 0.18968232423067094, "num_tokens": 63284207.0, "step": 36480 }, { "entropy": 5.431429052352906, "epoch": 2.838669519548726, "grad_norm": 1.140625, "learning_rate": 0.00041936471938081667, "loss": 5.0033, "mean_token_accuracy": 0.19469614773988725, "num_tokens": 63292477.0, "step": 36485 }, { "entropy": 5.37626314163208, "epoch": 2.8390585489204434, "grad_norm": 1.1328125, "learning_rate": 0.00041934345982420695, "loss": 5.0008, "mean_token_accuracy": 0.19936856925487517, "num_tokens": 63301457.0, "step": 36490 }, { "entropy": 5.445898628234863, "epoch": 2.839447578292161, "grad_norm": 1.2578125, "learning_rate": 0.000419322198077415, "loss": 5.0406, "mean_token_accuracy": 0.1945921376347542, "num_tokens": 63309967.0, "step": 36495 }, { "entropy": 5.381873750686646, "epoch": 2.8398366076638784, "grad_norm": 1.109375, "learning_rate": 0.00041930093414076344, "loss": 4.8829, "mean_token_accuracy": 0.20467058718204498, "num_tokens": 63319329.0, "step": 36500 }, { "entropy": 5.324381256103516, "epoch": 2.840225637035596, "grad_norm": 1.21875, "learning_rate": 0.00041927966801457486, "loss": 4.9846, "mean_token_accuracy": 0.19861678034067154, "num_tokens": 63328600.0, "step": 36505 }, { "entropy": 5.3899774074554445, "epoch": 2.8406146664073137, "grad_norm": 1.1015625, "learning_rate": 0.000419258399699172, "loss": 4.9897, "mean_token_accuracy": 0.19936752766370774, "num_tokens": 63337297.0, "step": 36510 }, { "entropy": 5.37494387626648, "epoch": 2.8410036957790314, "grad_norm": 1.1484375, "learning_rate": 0.0004192371291948775, "loss": 4.9433, "mean_token_accuracy": 0.2073831394314766, "num_tokens": 63346634.0, "step": 36515 }, { "entropy": 5.438672924041748, "epoch": 2.841392725150749, "grad_norm": 1.15625, "learning_rate": 0.00041921585650201413, "loss": 5.0457, "mean_token_accuracy": 0.19019139260053636, "num_tokens": 63354870.0, "step": 36520 }, { "entropy": 5.335669660568238, "epoch": 2.8417817545224664, "grad_norm": 1.15625, "learning_rate": 0.0004191945816209047, "loss": 5.0411, "mean_token_accuracy": 0.1908004492521286, "num_tokens": 63363571.0, "step": 36525 }, { "entropy": 5.416158628463745, "epoch": 2.842170783894184, "grad_norm": 1.125, "learning_rate": 0.00041917330455187195, "loss": 4.9414, "mean_token_accuracy": 0.204941126704216, "num_tokens": 63371716.0, "step": 36530 }, { "entropy": 5.355167102813721, "epoch": 2.8425598132659013, "grad_norm": 1.1171875, "learning_rate": 0.00041915202529523894, "loss": 5.042, "mean_token_accuracy": 0.2016516759991646, "num_tokens": 63381399.0, "step": 36535 }, { "entropy": 5.418057537078857, "epoch": 2.842948842637619, "grad_norm": 1.234375, "learning_rate": 0.0004191307438513283, "loss": 5.0376, "mean_token_accuracy": 0.20107784271240234, "num_tokens": 63390548.0, "step": 36540 }, { "entropy": 5.382865476608276, "epoch": 2.8433378720093367, "grad_norm": 1.171875, "learning_rate": 0.000419109460220463, "loss": 4.9827, "mean_token_accuracy": 0.19784849435091018, "num_tokens": 63400219.0, "step": 36545 }, { "entropy": 5.350049924850464, "epoch": 2.8437269013810544, "grad_norm": 1.1328125, "learning_rate": 0.00041908817440296605, "loss": 4.9057, "mean_token_accuracy": 0.20449953973293306, "num_tokens": 63409131.0, "step": 36550 }, { "entropy": 5.438841056823731, "epoch": 2.8441159307527717, "grad_norm": 1.078125, "learning_rate": 0.00041906688639916035, "loss": 5.1277, "mean_token_accuracy": 0.18973740488290786, "num_tokens": 63418830.0, "step": 36555 }, { "entropy": 5.40243706703186, "epoch": 2.8445049601244894, "grad_norm": 1.1484375, "learning_rate": 0.0004190455962093689, "loss": 4.929, "mean_token_accuracy": 0.19739658683538436, "num_tokens": 63427467.0, "step": 36560 }, { "entropy": 5.386296987533569, "epoch": 2.844893989496207, "grad_norm": 1.1875, "learning_rate": 0.00041902430383391494, "loss": 4.9958, "mean_token_accuracy": 0.1969866618514061, "num_tokens": 63436957.0, "step": 36565 }, { "entropy": 5.362722253799438, "epoch": 2.8452830188679243, "grad_norm": 1.1875, "learning_rate": 0.0004190030092731214, "loss": 5.0419, "mean_token_accuracy": 0.19847180247306823, "num_tokens": 63446010.0, "step": 36570 }, { "entropy": 5.333335208892822, "epoch": 2.845672048239642, "grad_norm": 1.15625, "learning_rate": 0.0004189817125273113, "loss": 4.9273, "mean_token_accuracy": 0.20335300862789155, "num_tokens": 63454666.0, "step": 36575 }, { "entropy": 5.355603742599487, "epoch": 2.8460610776113597, "grad_norm": 1.1796875, "learning_rate": 0.00041896041359680797, "loss": 4.9477, "mean_token_accuracy": 0.20321038514375686, "num_tokens": 63463076.0, "step": 36580 }, { "entropy": 5.429598474502564, "epoch": 2.8464501069830774, "grad_norm": 1.15625, "learning_rate": 0.00041893911248193437, "loss": 4.9523, "mean_token_accuracy": 0.2025564655661583, "num_tokens": 63471547.0, "step": 36585 }, { "entropy": 5.373992919921875, "epoch": 2.8468391363547947, "grad_norm": 1.3125, "learning_rate": 0.000418917809183014, "loss": 4.9905, "mean_token_accuracy": 0.19798582643270493, "num_tokens": 63479710.0, "step": 36590 }, { "entropy": 5.311467599868775, "epoch": 2.8472281657265124, "grad_norm": 1.0625, "learning_rate": 0.00041889650370036986, "loss": 4.9296, "mean_token_accuracy": 0.2042201951146126, "num_tokens": 63488639.0, "step": 36595 }, { "entropy": 5.417302942276001, "epoch": 2.84761719509823, "grad_norm": 1.15625, "learning_rate": 0.0004188751960343253, "loss": 5.042, "mean_token_accuracy": 0.19292029738426208, "num_tokens": 63496956.0, "step": 36600 }, { "entropy": 5.366496562957764, "epoch": 2.8480062244699473, "grad_norm": 1.0625, "learning_rate": 0.0004188538861852037, "loss": 4.9564, "mean_token_accuracy": 0.20153767466545106, "num_tokens": 63505538.0, "step": 36605 }, { "entropy": 5.269507837295532, "epoch": 2.848395253841665, "grad_norm": 1.125, "learning_rate": 0.0004188325741533283, "loss": 4.8585, "mean_token_accuracy": 0.20440756231546403, "num_tokens": 63513664.0, "step": 36610 }, { "entropy": 5.3249414443969725, "epoch": 2.8487842832133827, "grad_norm": 1.15625, "learning_rate": 0.0004188112599390225, "loss": 4.8682, "mean_token_accuracy": 0.20675662010908127, "num_tokens": 63521910.0, "step": 36615 }, { "entropy": 5.3695649147033695, "epoch": 2.8491733125851004, "grad_norm": 1.2109375, "learning_rate": 0.0004187899435426098, "loss": 4.8832, "mean_token_accuracy": 0.20887090265750885, "num_tokens": 63530272.0, "step": 36620 }, { "entropy": 5.343402671813965, "epoch": 2.8495623419568177, "grad_norm": 1.1484375, "learning_rate": 0.00041876862496441347, "loss": 5.0378, "mean_token_accuracy": 0.19705433398485184, "num_tokens": 63538652.0, "step": 36625 }, { "entropy": 5.372191095352173, "epoch": 2.8499513713285354, "grad_norm": 1.1015625, "learning_rate": 0.00041874730420475716, "loss": 4.9426, "mean_token_accuracy": 0.20222785025835038, "num_tokens": 63547016.0, "step": 36630 }, { "entropy": 5.336967658996582, "epoch": 2.8503404007002526, "grad_norm": 1.1171875, "learning_rate": 0.00041872598126396434, "loss": 4.9392, "mean_token_accuracy": 0.20588555186986923, "num_tokens": 63555561.0, "step": 36635 }, { "entropy": 5.365342330932617, "epoch": 2.8507294300719703, "grad_norm": 1.15625, "learning_rate": 0.00041870465614235843, "loss": 4.9973, "mean_token_accuracy": 0.20036884248256684, "num_tokens": 63563510.0, "step": 36640 }, { "entropy": 5.34108681678772, "epoch": 2.851118459443688, "grad_norm": 1.046875, "learning_rate": 0.00041868332884026317, "loss": 4.9607, "mean_token_accuracy": 0.20552650541067125, "num_tokens": 63572495.0, "step": 36645 }, { "entropy": 5.411440229415893, "epoch": 2.8515074888154057, "grad_norm": 1.109375, "learning_rate": 0.0004186619993580021, "loss": 5.0234, "mean_token_accuracy": 0.195866858959198, "num_tokens": 63581525.0, "step": 36650 }, { "entropy": 5.367895936965942, "epoch": 2.851896518187123, "grad_norm": 1.109375, "learning_rate": 0.00041864066769589875, "loss": 4.9444, "mean_token_accuracy": 0.19944222569465636, "num_tokens": 63590136.0, "step": 36655 }, { "entropy": 5.4395287990570065, "epoch": 2.8522855475588407, "grad_norm": 1.1640625, "learning_rate": 0.00041861933385427697, "loss": 5.0611, "mean_token_accuracy": 0.2006852760910988, "num_tokens": 63599353.0, "step": 36660 }, { "entropy": 5.360436248779297, "epoch": 2.8526745769305584, "grad_norm": 1.1796875, "learning_rate": 0.0004185979978334604, "loss": 4.8891, "mean_token_accuracy": 0.20667565912008284, "num_tokens": 63607586.0, "step": 36665 }, { "entropy": 5.338217306137085, "epoch": 2.8530636063022756, "grad_norm": 1.1796875, "learning_rate": 0.0004185766596337727, "loss": 4.9159, "mean_token_accuracy": 0.20061647593975068, "num_tokens": 63616444.0, "step": 36670 }, { "entropy": 5.3502647399902346, "epoch": 2.8534526356739933, "grad_norm": 1.1171875, "learning_rate": 0.00041855531925553773, "loss": 5.0199, "mean_token_accuracy": 0.1964164823293686, "num_tokens": 63625591.0, "step": 36675 }, { "entropy": 5.50525918006897, "epoch": 2.853841665045711, "grad_norm": 1.1484375, "learning_rate": 0.0004185339766990794, "loss": 5.0974, "mean_token_accuracy": 0.19667548388242723, "num_tokens": 63633681.0, "step": 36680 }, { "entropy": 5.385427618026734, "epoch": 2.8542306944174287, "grad_norm": 1.1484375, "learning_rate": 0.0004185126319647213, "loss": 5.0248, "mean_token_accuracy": 0.20020008236169815, "num_tokens": 63642298.0, "step": 36685 }, { "entropy": 5.445777177810669, "epoch": 2.854619723789146, "grad_norm": 1.21875, "learning_rate": 0.0004184912850527875, "loss": 5.0781, "mean_token_accuracy": 0.1971253678202629, "num_tokens": 63650969.0, "step": 36690 }, { "entropy": 5.390744590759278, "epoch": 2.8550087531608637, "grad_norm": 1.1640625, "learning_rate": 0.0004184699359636018, "loss": 4.9363, "mean_token_accuracy": 0.2120387777686119, "num_tokens": 63659477.0, "step": 36695 }, { "entropy": 5.373928785324097, "epoch": 2.8553977825325814, "grad_norm": 1.078125, "learning_rate": 0.0004184485846974882, "loss": 4.9981, "mean_token_accuracy": 0.19902394860982894, "num_tokens": 63668575.0, "step": 36700 }, { "entropy": 5.4341874599456785, "epoch": 2.8557868119042986, "grad_norm": 1.15625, "learning_rate": 0.0004184272312547706, "loss": 5.0452, "mean_token_accuracy": 0.19717740565538405, "num_tokens": 63677818.0, "step": 36705 }, { "entropy": 5.42542839050293, "epoch": 2.8561758412760163, "grad_norm": 1.1796875, "learning_rate": 0.00041840587563577315, "loss": 4.8926, "mean_token_accuracy": 0.20150510519742965, "num_tokens": 63686360.0, "step": 36710 }, { "entropy": 5.33306245803833, "epoch": 2.856564870647734, "grad_norm": 1.109375, "learning_rate": 0.0004183845178408197, "loss": 5.0457, "mean_token_accuracy": 0.19386502355337143, "num_tokens": 63695602.0, "step": 36715 }, { "entropy": 5.333541011810302, "epoch": 2.8569539000194517, "grad_norm": 1.1015625, "learning_rate": 0.00041836315787023456, "loss": 4.9913, "mean_token_accuracy": 0.1991768643260002, "num_tokens": 63704225.0, "step": 36720 }, { "entropy": 5.415351629257202, "epoch": 2.857342929391169, "grad_norm": 1.1328125, "learning_rate": 0.00041834179572434153, "loss": 4.9529, "mean_token_accuracy": 0.1959248185157776, "num_tokens": 63712814.0, "step": 36725 }, { "entropy": 5.386776971817016, "epoch": 2.8577319587628867, "grad_norm": 1.1328125, "learning_rate": 0.00041832043140346495, "loss": 4.9536, "mean_token_accuracy": 0.19837044775485993, "num_tokens": 63721808.0, "step": 36730 }, { "entropy": 5.398809766769409, "epoch": 2.858120988134604, "grad_norm": 1.15625, "learning_rate": 0.0004182990649079289, "loss": 5.0068, "mean_token_accuracy": 0.2005328431725502, "num_tokens": 63730226.0, "step": 36735 }, { "entropy": 5.384431266784668, "epoch": 2.8585100175063216, "grad_norm": 1.203125, "learning_rate": 0.0004182776962380577, "loss": 4.9295, "mean_token_accuracy": 0.20164803862571717, "num_tokens": 63738400.0, "step": 36740 }, { "entropy": 5.3479115009307865, "epoch": 2.8588990468780393, "grad_norm": 1.1328125, "learning_rate": 0.00041825632539417546, "loss": 4.9073, "mean_token_accuracy": 0.20507562458515166, "num_tokens": 63746385.0, "step": 36745 }, { "entropy": 5.383835172653198, "epoch": 2.859288076249757, "grad_norm": 1.125, "learning_rate": 0.0004182349523766065, "loss": 5.0599, "mean_token_accuracy": 0.19847557544708253, "num_tokens": 63755354.0, "step": 36750 }, { "entropy": 5.473566055297852, "epoch": 2.8596771056214743, "grad_norm": 1.125, "learning_rate": 0.00041821357718567514, "loss": 5.0736, "mean_token_accuracy": 0.19454247057437896, "num_tokens": 63764262.0, "step": 36755 }, { "entropy": 5.377267169952392, "epoch": 2.860066134993192, "grad_norm": 1.1015625, "learning_rate": 0.0004181921998217057, "loss": 4.9099, "mean_token_accuracy": 0.20494703501462935, "num_tokens": 63772770.0, "step": 36760 }, { "entropy": 5.405041599273682, "epoch": 2.8604551643649097, "grad_norm": 1.1328125, "learning_rate": 0.0004181708202850225, "loss": 4.9686, "mean_token_accuracy": 0.20490303933620452, "num_tokens": 63781353.0, "step": 36765 }, { "entropy": 5.4674512386322025, "epoch": 2.860844193736627, "grad_norm": 1.2109375, "learning_rate": 0.00041814943857595, "loss": 5.0831, "mean_token_accuracy": 0.1940636232495308, "num_tokens": 63789262.0, "step": 36770 }, { "entropy": 5.4633262157440186, "epoch": 2.8612332231083446, "grad_norm": 1.15625, "learning_rate": 0.0004181280546948127, "loss": 5.1344, "mean_token_accuracy": 0.19183164536952974, "num_tokens": 63797792.0, "step": 36775 }, { "entropy": 5.421915674209595, "epoch": 2.8616222524800623, "grad_norm": 1.203125, "learning_rate": 0.0004181066686419349, "loss": 4.8997, "mean_token_accuracy": 0.2105755552649498, "num_tokens": 63805362.0, "step": 36780 }, { "entropy": 5.3843225002288815, "epoch": 2.86201128185178, "grad_norm": 1.1875, "learning_rate": 0.00041808528041764115, "loss": 4.9683, "mean_token_accuracy": 0.20286853462457657, "num_tokens": 63813942.0, "step": 36785 }, { "entropy": 5.287630224227906, "epoch": 2.8624003112234973, "grad_norm": 1.078125, "learning_rate": 0.0004180638900222561, "loss": 4.8737, "mean_token_accuracy": 0.21257918775081636, "num_tokens": 63823077.0, "step": 36790 }, { "entropy": 5.306641340255737, "epoch": 2.862789340595215, "grad_norm": 1.1796875, "learning_rate": 0.0004180424974561042, "loss": 4.874, "mean_token_accuracy": 0.20539965033531188, "num_tokens": 63831048.0, "step": 36795 }, { "entropy": 5.428457307815552, "epoch": 2.8631783699669326, "grad_norm": 1.1484375, "learning_rate": 0.00041802110271951, "loss": 5.0315, "mean_token_accuracy": 0.191106478869915, "num_tokens": 63839449.0, "step": 36800 }, { "entropy": 5.3788567066192625, "epoch": 2.86356739933865, "grad_norm": 1.2109375, "learning_rate": 0.0004179997058127983, "loss": 4.9828, "mean_token_accuracy": 0.2013300836086273, "num_tokens": 63847945.0, "step": 36805 }, { "entropy": 5.312235975265503, "epoch": 2.8639564287103676, "grad_norm": 1.09375, "learning_rate": 0.0004179783067362936, "loss": 4.9076, "mean_token_accuracy": 0.21026684939861298, "num_tokens": 63857334.0, "step": 36810 }, { "entropy": 5.366594314575195, "epoch": 2.8643454580820853, "grad_norm": 1.1328125, "learning_rate": 0.0004179569054903207, "loss": 5.0197, "mean_token_accuracy": 0.19128962457180024, "num_tokens": 63866272.0, "step": 36815 }, { "entropy": 5.4136659622192385, "epoch": 2.864734487453803, "grad_norm": 1.203125, "learning_rate": 0.00041793550207520436, "loss": 4.943, "mean_token_accuracy": 0.20066686123609542, "num_tokens": 63874798.0, "step": 36820 }, { "entropy": 5.425258827209473, "epoch": 2.8651235168255202, "grad_norm": 1.171875, "learning_rate": 0.0004179140964912692, "loss": 4.9309, "mean_token_accuracy": 0.20420774221420288, "num_tokens": 63883106.0, "step": 36825 }, { "entropy": 5.3564714908599855, "epoch": 2.865512546197238, "grad_norm": 1.15625, "learning_rate": 0.0004178926887388401, "loss": 4.9551, "mean_token_accuracy": 0.20449693500995636, "num_tokens": 63892172.0, "step": 36830 }, { "entropy": 5.411362171173096, "epoch": 2.865901575568955, "grad_norm": 1.1953125, "learning_rate": 0.00041787127881824193, "loss": 5.0768, "mean_token_accuracy": 0.19120672196149827, "num_tokens": 63900436.0, "step": 36835 }, { "entropy": 5.477596092224121, "epoch": 2.866290604940673, "grad_norm": 1.125, "learning_rate": 0.00041784986672979945, "loss": 5.0734, "mean_token_accuracy": 0.19527046382427216, "num_tokens": 63908937.0, "step": 36840 }, { "entropy": 5.392542839050293, "epoch": 2.8666796343123906, "grad_norm": 1.1171875, "learning_rate": 0.00041782845247383767, "loss": 4.992, "mean_token_accuracy": 0.20587743520736695, "num_tokens": 63916350.0, "step": 36845 }, { "entropy": 5.351164865493774, "epoch": 2.8670686636841083, "grad_norm": 1.09375, "learning_rate": 0.00041780703605068145, "loss": 4.98, "mean_token_accuracy": 0.19533114433288573, "num_tokens": 63925227.0, "step": 36850 }, { "entropy": 5.39546046257019, "epoch": 2.867457693055826, "grad_norm": 1.1484375, "learning_rate": 0.0004177856174606558, "loss": 4.968, "mean_token_accuracy": 0.19777505844831467, "num_tokens": 63934075.0, "step": 36855 }, { "entropy": 5.398231506347656, "epoch": 2.8678467224275432, "grad_norm": 1.2421875, "learning_rate": 0.0004177641967040856, "loss": 5.0197, "mean_token_accuracy": 0.19691864401102066, "num_tokens": 63942554.0, "step": 36860 }, { "entropy": 5.332274866104126, "epoch": 2.868235751799261, "grad_norm": 1.140625, "learning_rate": 0.00041774277378129595, "loss": 4.9251, "mean_token_accuracy": 0.20171054899692537, "num_tokens": 63951850.0, "step": 36865 }, { "entropy": 5.448313283920288, "epoch": 2.868624781170978, "grad_norm": 1.09375, "learning_rate": 0.00041772134869261186, "loss": 4.9872, "mean_token_accuracy": 0.19829238057136536, "num_tokens": 63960709.0, "step": 36870 }, { "entropy": 5.361208486557007, "epoch": 2.869013810542696, "grad_norm": 1.15625, "learning_rate": 0.0004176999214383585, "loss": 4.9634, "mean_token_accuracy": 0.2049262449145317, "num_tokens": 63969859.0, "step": 36875 }, { "entropy": 5.397562789916992, "epoch": 2.8694028399144136, "grad_norm": 1.1796875, "learning_rate": 0.00041767849201886103, "loss": 4.9465, "mean_token_accuracy": 0.1991907238960266, "num_tokens": 63977524.0, "step": 36880 }, { "entropy": 5.28074197769165, "epoch": 2.8697918692861313, "grad_norm": 1.140625, "learning_rate": 0.0004176570604344445, "loss": 4.842, "mean_token_accuracy": 0.20927724391222, "num_tokens": 63985938.0, "step": 36885 }, { "entropy": 5.2829827785491945, "epoch": 2.8701808986578485, "grad_norm": 1.0859375, "learning_rate": 0.00041763562668543415, "loss": 4.9888, "mean_token_accuracy": 0.20340211391448976, "num_tokens": 63993864.0, "step": 36890 }, { "entropy": 5.466585874557495, "epoch": 2.8705699280295662, "grad_norm": 1.1484375, "learning_rate": 0.0004176141907721552, "loss": 5.0395, "mean_token_accuracy": 0.1997930407524109, "num_tokens": 64003479.0, "step": 36895 }, { "entropy": 5.46111536026001, "epoch": 2.870958957401284, "grad_norm": 1.109375, "learning_rate": 0.0004175927526949329, "loss": 4.9907, "mean_token_accuracy": 0.20680253505706786, "num_tokens": 64012492.0, "step": 36900 }, { "entropy": 5.452385711669922, "epoch": 2.871347986773001, "grad_norm": 1.125, "learning_rate": 0.0004175713124540925, "loss": 5.0731, "mean_token_accuracy": 0.18616908937692642, "num_tokens": 64021756.0, "step": 36905 }, { "entropy": 5.422436904907227, "epoch": 2.871737016144719, "grad_norm": 1.1484375, "learning_rate": 0.00041754987004995935, "loss": 5.0395, "mean_token_accuracy": 0.19796013385057448, "num_tokens": 64030351.0, "step": 36910 }, { "entropy": 5.3681854724884035, "epoch": 2.8721260455164366, "grad_norm": 1.203125, "learning_rate": 0.00041752842548285887, "loss": 4.884, "mean_token_accuracy": 0.2010513111948967, "num_tokens": 64039523.0, "step": 36915 }, { "entropy": 5.315818881988525, "epoch": 2.8725150748881543, "grad_norm": 1.140625, "learning_rate": 0.0004175069787531163, "loss": 4.8977, "mean_token_accuracy": 0.20945239812135696, "num_tokens": 64048264.0, "step": 36920 }, { "entropy": 5.395058345794678, "epoch": 2.8729041042598715, "grad_norm": 1.09375, "learning_rate": 0.00041748552986105726, "loss": 5.0342, "mean_token_accuracy": 0.1934139460325241, "num_tokens": 64057013.0, "step": 36925 }, { "entropy": 5.353413343429565, "epoch": 2.8732931336315892, "grad_norm": 1.125, "learning_rate": 0.000417464078807007, "loss": 4.9198, "mean_token_accuracy": 0.20274354368448258, "num_tokens": 64065962.0, "step": 36930 }, { "entropy": 5.358920669555664, "epoch": 2.8736821630033065, "grad_norm": 1.171875, "learning_rate": 0.0004174426255912912, "loss": 4.9813, "mean_token_accuracy": 0.2022714853286743, "num_tokens": 64074493.0, "step": 36935 }, { "entropy": 5.422954511642456, "epoch": 2.874071192375024, "grad_norm": 1.1171875, "learning_rate": 0.0004174211702142352, "loss": 5.0682, "mean_token_accuracy": 0.1948063537478447, "num_tokens": 64083351.0, "step": 36940 }, { "entropy": 5.428135108947754, "epoch": 2.874460221746742, "grad_norm": 1.15625, "learning_rate": 0.00041739971267616466, "loss": 4.9508, "mean_token_accuracy": 0.20139007717370988, "num_tokens": 64091775.0, "step": 36945 }, { "entropy": 5.276426696777344, "epoch": 2.8748492511184596, "grad_norm": 1.078125, "learning_rate": 0.0004173782529774051, "loss": 4.9694, "mean_token_accuracy": 0.20655950605869294, "num_tokens": 64100684.0, "step": 36950 }, { "entropy": 5.314303827285767, "epoch": 2.8752382804901773, "grad_norm": 1.140625, "learning_rate": 0.00041735679111828223, "loss": 4.9606, "mean_token_accuracy": 0.20499653965234757, "num_tokens": 64109102.0, "step": 36955 }, { "entropy": 5.3591780185699465, "epoch": 2.8756273098618945, "grad_norm": 1.1484375, "learning_rate": 0.00041733532709912157, "loss": 4.9411, "mean_token_accuracy": 0.2022224098443985, "num_tokens": 64118341.0, "step": 36960 }, { "entropy": 5.357262897491455, "epoch": 2.876016339233612, "grad_norm": 1.140625, "learning_rate": 0.00041731386092024893, "loss": 4.8648, "mean_token_accuracy": 0.20841473937034607, "num_tokens": 64126647.0, "step": 36965 }, { "entropy": 5.2909399509429935, "epoch": 2.8764053686053295, "grad_norm": 1.125, "learning_rate": 0.00041729239258198996, "loss": 4.7731, "mean_token_accuracy": 0.20860371589660645, "num_tokens": 64135534.0, "step": 36970 }, { "entropy": 5.3558337688446045, "epoch": 2.876794397977047, "grad_norm": 1.2109375, "learning_rate": 0.00041727092208467036, "loss": 5.0212, "mean_token_accuracy": 0.1969813048839569, "num_tokens": 64144108.0, "step": 36975 }, { "entropy": 5.316230964660645, "epoch": 2.877183427348765, "grad_norm": 1.15625, "learning_rate": 0.00041724944942861603, "loss": 4.8051, "mean_token_accuracy": 0.210329869389534, "num_tokens": 64152599.0, "step": 36980 }, { "entropy": 5.370316839218139, "epoch": 2.8775724567204826, "grad_norm": 1.1640625, "learning_rate": 0.00041722797461415267, "loss": 4.9447, "mean_token_accuracy": 0.19478170871734618, "num_tokens": 64161733.0, "step": 36985 }, { "entropy": 5.360448884963989, "epoch": 2.8779614860922, "grad_norm": 1.1015625, "learning_rate": 0.0004172064976416062, "loss": 4.9284, "mean_token_accuracy": 0.20668711215257646, "num_tokens": 64171045.0, "step": 36990 }, { "entropy": 5.38868727684021, "epoch": 2.8783505154639175, "grad_norm": 1.0625, "learning_rate": 0.0004171850185113024, "loss": 4.9113, "mean_token_accuracy": 0.20555466562509536, "num_tokens": 64179725.0, "step": 36995 }, { "entropy": 5.32879228591919, "epoch": 2.878739544835635, "grad_norm": 1.2265625, "learning_rate": 0.00041716353722356735, "loss": 5.0013, "mean_token_accuracy": 0.19792623519897462, "num_tokens": 64188799.0, "step": 37000 }, { "entropy": 5.420260858535767, "epoch": 2.8791285742073525, "grad_norm": 1.265625, "learning_rate": 0.0004171420537787269, "loss": 5.0129, "mean_token_accuracy": 0.19890602678060532, "num_tokens": 64197809.0, "step": 37005 }, { "entropy": 5.413884067535401, "epoch": 2.87951760357907, "grad_norm": 1.203125, "learning_rate": 0.00041712056817710697, "loss": 5.0406, "mean_token_accuracy": 0.18851754516363145, "num_tokens": 64207113.0, "step": 37010 }, { "entropy": 5.432380294799804, "epoch": 2.879906632950788, "grad_norm": 1.1953125, "learning_rate": 0.0004170990804190337, "loss": 4.9854, "mean_token_accuracy": 0.20316566973924638, "num_tokens": 64216846.0, "step": 37015 }, { "entropy": 5.331421279907227, "epoch": 2.8802956623225056, "grad_norm": 1.2109375, "learning_rate": 0.00041707759050483304, "loss": 4.9355, "mean_token_accuracy": 0.2037827715277672, "num_tokens": 64225348.0, "step": 37020 }, { "entropy": 5.347870969772339, "epoch": 2.880684691694223, "grad_norm": 1.15625, "learning_rate": 0.000417056098434831, "loss": 4.9465, "mean_token_accuracy": 0.20148575752973558, "num_tokens": 64234065.0, "step": 37025 }, { "entropy": 5.399331045150757, "epoch": 2.8810737210659405, "grad_norm": 1.2109375, "learning_rate": 0.0004170346042093538, "loss": 4.9855, "mean_token_accuracy": 0.2000252291560173, "num_tokens": 64242484.0, "step": 37030 }, { "entropy": 5.27199387550354, "epoch": 2.881462750437658, "grad_norm": 1.140625, "learning_rate": 0.0004170131078287276, "loss": 4.8371, "mean_token_accuracy": 0.21090682595968246, "num_tokens": 64251056.0, "step": 37035 }, { "entropy": 5.3463311195373535, "epoch": 2.8818517798093755, "grad_norm": 1.1484375, "learning_rate": 0.0004169916092932785, "loss": 4.934, "mean_token_accuracy": 0.20172853916883468, "num_tokens": 64258961.0, "step": 37040 }, { "entropy": 5.315022754669189, "epoch": 2.882240809181093, "grad_norm": 1.09375, "learning_rate": 0.0004169701086033327, "loss": 4.9023, "mean_token_accuracy": 0.2012649491429329, "num_tokens": 64268133.0, "step": 37045 }, { "entropy": 5.422477102279663, "epoch": 2.882629838552811, "grad_norm": 1.15625, "learning_rate": 0.00041694860575921654, "loss": 4.9993, "mean_token_accuracy": 0.1935962527990341, "num_tokens": 64276487.0, "step": 37050 }, { "entropy": 5.4019567489624025, "epoch": 2.8830188679245285, "grad_norm": 1.1171875, "learning_rate": 0.00041692710076125615, "loss": 4.9073, "mean_token_accuracy": 0.20424478650093078, "num_tokens": 64284983.0, "step": 37055 }, { "entropy": 5.393069553375244, "epoch": 2.883407897296246, "grad_norm": 1.078125, "learning_rate": 0.000416905593609778, "loss": 4.9842, "mean_token_accuracy": 0.20398012101650237, "num_tokens": 64293875.0, "step": 37060 }, { "entropy": 5.4037182331085205, "epoch": 2.8837969266679635, "grad_norm": 1.1328125, "learning_rate": 0.00041688408430510827, "loss": 4.9563, "mean_token_accuracy": 0.20789678692817687, "num_tokens": 64302628.0, "step": 37065 }, { "entropy": 5.424954032897949, "epoch": 2.8841859560396808, "grad_norm": 1.1796875, "learning_rate": 0.0004168625728475734, "loss": 5.0062, "mean_token_accuracy": 0.20004134774208068, "num_tokens": 64311024.0, "step": 37070 }, { "entropy": 5.325345420837403, "epoch": 2.8845749854113985, "grad_norm": 1.1875, "learning_rate": 0.00041684105923749977, "loss": 4.9737, "mean_token_accuracy": 0.20403173118829726, "num_tokens": 64318836.0, "step": 37075 }, { "entropy": 5.3220258235931395, "epoch": 2.884964014783116, "grad_norm": 1.140625, "learning_rate": 0.0004168195434752139, "loss": 5.0071, "mean_token_accuracy": 0.2015474632382393, "num_tokens": 64326983.0, "step": 37080 }, { "entropy": 5.396118021011352, "epoch": 2.885353044154834, "grad_norm": 1.1875, "learning_rate": 0.00041679802556104207, "loss": 4.9975, "mean_token_accuracy": 0.19967755377292634, "num_tokens": 64335304.0, "step": 37085 }, { "entropy": 5.399141073226929, "epoch": 2.885742073526551, "grad_norm": 1.1953125, "learning_rate": 0.00041677650549531097, "loss": 4.8666, "mean_token_accuracy": 0.2068141371011734, "num_tokens": 64343515.0, "step": 37090 }, { "entropy": 5.34257435798645, "epoch": 2.886131102898269, "grad_norm": 1.1953125, "learning_rate": 0.00041675498327834706, "loss": 4.9584, "mean_token_accuracy": 0.19879851788282393, "num_tokens": 64351936.0, "step": 37095 }, { "entropy": 5.402570629119873, "epoch": 2.8865201322699865, "grad_norm": 1.140625, "learning_rate": 0.00041673345891047686, "loss": 5.0234, "mean_token_accuracy": 0.2007183775305748, "num_tokens": 64360332.0, "step": 37100 }, { "entropy": 5.3923859119415285, "epoch": 2.8869091616417037, "grad_norm": 1.109375, "learning_rate": 0.0004167119323920271, "loss": 4.9691, "mean_token_accuracy": 0.19890433102846145, "num_tokens": 64369615.0, "step": 37105 }, { "entropy": 5.368736124038696, "epoch": 2.8872981910134214, "grad_norm": 1.1796875, "learning_rate": 0.0004166904037233243, "loss": 4.8921, "mean_token_accuracy": 0.20254307687282563, "num_tokens": 64378355.0, "step": 37110 }, { "entropy": 5.264634513854981, "epoch": 2.887687220385139, "grad_norm": 1.1171875, "learning_rate": 0.00041666887290469506, "loss": 4.8627, "mean_token_accuracy": 0.20478395223617554, "num_tokens": 64386120.0, "step": 37115 }, { "entropy": 5.2881354808807375, "epoch": 2.888076249756857, "grad_norm": 1.078125, "learning_rate": 0.0004166473399364663, "loss": 4.9679, "mean_token_accuracy": 0.20222768038511277, "num_tokens": 64395153.0, "step": 37120 }, { "entropy": 5.459886646270752, "epoch": 2.888465279128574, "grad_norm": 1.03125, "learning_rate": 0.00041662580481896446, "loss": 4.9995, "mean_token_accuracy": 0.19711934477090837, "num_tokens": 64404266.0, "step": 37125 }, { "entropy": 5.361165332794189, "epoch": 2.888854308500292, "grad_norm": 1.109375, "learning_rate": 0.0004166042675525165, "loss": 4.9632, "mean_token_accuracy": 0.19904866218566894, "num_tokens": 64412999.0, "step": 37130 }, { "entropy": 5.350707769393921, "epoch": 2.8892433378720095, "grad_norm": 1.2265625, "learning_rate": 0.00041658272813744924, "loss": 4.9473, "mean_token_accuracy": 0.20951907187700272, "num_tokens": 64421561.0, "step": 37135 }, { "entropy": 5.400559282302856, "epoch": 2.8896323672437267, "grad_norm": 1.1171875, "learning_rate": 0.0004165611865740894, "loss": 5.0228, "mean_token_accuracy": 0.19931823015213013, "num_tokens": 64430254.0, "step": 37140 }, { "entropy": 5.387171125411987, "epoch": 2.8900213966154444, "grad_norm": 1.1796875, "learning_rate": 0.0004165396428627638, "loss": 4.9157, "mean_token_accuracy": 0.20624625235795974, "num_tokens": 64438452.0, "step": 37145 }, { "entropy": 5.486778736114502, "epoch": 2.890410425987162, "grad_norm": 1.1328125, "learning_rate": 0.00041651809700379947, "loss": 5.0704, "mean_token_accuracy": 0.1996098443865776, "num_tokens": 64447442.0, "step": 37150 }, { "entropy": 5.399266576766967, "epoch": 2.89079945535888, "grad_norm": 1.1640625, "learning_rate": 0.00041649654899752326, "loss": 5.0458, "mean_token_accuracy": 0.19848165959119796, "num_tokens": 64456179.0, "step": 37155 }, { "entropy": 5.510623598098755, "epoch": 2.891188484730597, "grad_norm": 1.1640625, "learning_rate": 0.0004164749988442621, "loss": 5.0963, "mean_token_accuracy": 0.19883234053850174, "num_tokens": 64464498.0, "step": 37160 }, { "entropy": 5.405330562591553, "epoch": 2.891577514102315, "grad_norm": 1.15625, "learning_rate": 0.000416453446544343, "loss": 4.9214, "mean_token_accuracy": 0.19809215068817138, "num_tokens": 64473047.0, "step": 37165 }, { "entropy": 5.304905891418457, "epoch": 2.891966543474032, "grad_norm": 1.1875, "learning_rate": 0.0004164318920980931, "loss": 4.8519, "mean_token_accuracy": 0.21838342845439912, "num_tokens": 64482338.0, "step": 37170 }, { "entropy": 5.267415761947632, "epoch": 2.8923555728457497, "grad_norm": 1.125, "learning_rate": 0.0004164103355058393, "loss": 4.868, "mean_token_accuracy": 0.20211563110351563, "num_tokens": 64490611.0, "step": 37175 }, { "entropy": 5.334226512908936, "epoch": 2.8927446022174674, "grad_norm": 1.1484375, "learning_rate": 0.0004163887767679087, "loss": 4.896, "mean_token_accuracy": 0.20980583429336547, "num_tokens": 64499180.0, "step": 37180 }, { "entropy": 5.402279281616211, "epoch": 2.893133631589185, "grad_norm": 1.234375, "learning_rate": 0.0004163672158846285, "loss": 4.9983, "mean_token_accuracy": 0.19483935534954072, "num_tokens": 64508664.0, "step": 37185 }, { "entropy": 5.520532321929932, "epoch": 2.8935226609609024, "grad_norm": 1.28125, "learning_rate": 0.00041634565285632573, "loss": 5.1212, "mean_token_accuracy": 0.1844704657793045, "num_tokens": 64518059.0, "step": 37190 }, { "entropy": 5.45718789100647, "epoch": 2.89391169033262, "grad_norm": 1.203125, "learning_rate": 0.00041632408768332776, "loss": 5.0815, "mean_token_accuracy": 0.19127696007490158, "num_tokens": 64526616.0, "step": 37195 }, { "entropy": 5.467284393310547, "epoch": 2.8943007197043378, "grad_norm": 1.1875, "learning_rate": 0.00041630252036596165, "loss": 5.0697, "mean_token_accuracy": 0.19320171028375627, "num_tokens": 64535008.0, "step": 37200 }, { "entropy": 5.358973836898803, "epoch": 2.894689749076055, "grad_norm": 1.125, "learning_rate": 0.0004162809509045547, "loss": 4.8741, "mean_token_accuracy": 0.2024504601955414, "num_tokens": 64543741.0, "step": 37205 }, { "entropy": 5.269455194473267, "epoch": 2.8950787784477727, "grad_norm": 1.09375, "learning_rate": 0.00041625937929943424, "loss": 4.81, "mean_token_accuracy": 0.21030043661594391, "num_tokens": 64552409.0, "step": 37210 }, { "entropy": 5.376355838775635, "epoch": 2.8954678078194904, "grad_norm": 1.3203125, "learning_rate": 0.00041623780555092747, "loss": 5.0671, "mean_token_accuracy": 0.18901106864213943, "num_tokens": 64561308.0, "step": 37215 }, { "entropy": 5.373002243041992, "epoch": 2.895856837191208, "grad_norm": 1.2265625, "learning_rate": 0.0004162162296593618, "loss": 4.8998, "mean_token_accuracy": 0.2083124950528145, "num_tokens": 64569671.0, "step": 37220 }, { "entropy": 5.454429388046265, "epoch": 2.8962458665629254, "grad_norm": 1.09375, "learning_rate": 0.00041619465162506466, "loss": 5.0311, "mean_token_accuracy": 0.19633175432682037, "num_tokens": 64578186.0, "step": 37225 }, { "entropy": 5.350834655761719, "epoch": 2.896634895934643, "grad_norm": 1.1484375, "learning_rate": 0.0004161730714483633, "loss": 4.9484, "mean_token_accuracy": 0.20673643946647643, "num_tokens": 64586703.0, "step": 37230 }, { "entropy": 5.345397567749023, "epoch": 2.8970239253063608, "grad_norm": 1.1640625, "learning_rate": 0.0004161514891295854, "loss": 4.9826, "mean_token_accuracy": 0.19618725031614304, "num_tokens": 64595119.0, "step": 37235 }, { "entropy": 5.432996368408203, "epoch": 2.897412954678078, "grad_norm": 1.1484375, "learning_rate": 0.00041612990466905825, "loss": 5.0147, "mean_token_accuracy": 0.19914722740650176, "num_tokens": 64604312.0, "step": 37240 }, { "entropy": 5.409211730957031, "epoch": 2.8978019840497957, "grad_norm": 1.0859375, "learning_rate": 0.00041610831806710954, "loss": 4.9512, "mean_token_accuracy": 0.20491380840539933, "num_tokens": 64613088.0, "step": 37245 }, { "entropy": 5.46361289024353, "epoch": 2.8981910134215134, "grad_norm": 1.125, "learning_rate": 0.00041608672932406666, "loss": 5.1063, "mean_token_accuracy": 0.1960842028260231, "num_tokens": 64621659.0, "step": 37250 }, { "entropy": 5.405196619033814, "epoch": 2.898580042793231, "grad_norm": 1.1796875, "learning_rate": 0.00041606513844025716, "loss": 4.9216, "mean_token_accuracy": 0.20775201469659804, "num_tokens": 64630436.0, "step": 37255 }, { "entropy": 5.363085556030273, "epoch": 2.8989690721649484, "grad_norm": 1.09375, "learning_rate": 0.0004160435454160087, "loss": 4.9635, "mean_token_accuracy": 0.20452069789171218, "num_tokens": 64639836.0, "step": 37260 }, { "entropy": 5.357938528060913, "epoch": 2.899358101536666, "grad_norm": 1.0859375, "learning_rate": 0.000416021950251649, "loss": 4.9388, "mean_token_accuracy": 0.19422908127307892, "num_tokens": 64648941.0, "step": 37265 }, { "entropy": 5.331830406188965, "epoch": 2.8997471309083833, "grad_norm": 1.1796875, "learning_rate": 0.0004160003529475057, "loss": 5.007, "mean_token_accuracy": 0.19518893510103225, "num_tokens": 64657632.0, "step": 37270 }, { "entropy": 5.411461114883423, "epoch": 2.900136160280101, "grad_norm": 1.1484375, "learning_rate": 0.0004159787535039064, "loss": 5.0154, "mean_token_accuracy": 0.1925535410642624, "num_tokens": 64665733.0, "step": 37275 }, { "entropy": 5.328467178344726, "epoch": 2.9005251896518187, "grad_norm": 1.125, "learning_rate": 0.0004159571519211789, "loss": 4.8844, "mean_token_accuracy": 0.21159991323947908, "num_tokens": 64673873.0, "step": 37280 }, { "entropy": 5.364060115814209, "epoch": 2.9009142190235364, "grad_norm": 1.1875, "learning_rate": 0.000415935548199651, "loss": 4.9918, "mean_token_accuracy": 0.1946658417582512, "num_tokens": 64682282.0, "step": 37285 }, { "entropy": 5.306412220001221, "epoch": 2.901303248395254, "grad_norm": 1.2265625, "learning_rate": 0.0004159139423396504, "loss": 4.9168, "mean_token_accuracy": 0.20639852583408355, "num_tokens": 64690179.0, "step": 37290 }, { "entropy": 5.376539421081543, "epoch": 2.9016922777669714, "grad_norm": 1.1484375, "learning_rate": 0.0004158923343415051, "loss": 5.0582, "mean_token_accuracy": 0.2010296329855919, "num_tokens": 64698935.0, "step": 37295 }, { "entropy": 5.3281032085418705, "epoch": 2.902081307138689, "grad_norm": 1.078125, "learning_rate": 0.0004158707242055429, "loss": 4.8948, "mean_token_accuracy": 0.2016885757446289, "num_tokens": 64708328.0, "step": 37300 }, { "entropy": 5.452783203125, "epoch": 2.9024703365104063, "grad_norm": 1.2109375, "learning_rate": 0.00041584911193209167, "loss": 5.0436, "mean_token_accuracy": 0.19289521276950836, "num_tokens": 64717003.0, "step": 37305 }, { "entropy": 5.343239879608154, "epoch": 2.902859365882124, "grad_norm": 1.1015625, "learning_rate": 0.0004158274975214794, "loss": 4.9347, "mean_token_accuracy": 0.20231957137584686, "num_tokens": 64725951.0, "step": 37310 }, { "entropy": 5.349320602416992, "epoch": 2.9032483952538417, "grad_norm": 1.1640625, "learning_rate": 0.00041580588097403384, "loss": 4.9551, "mean_token_accuracy": 0.19835673719644548, "num_tokens": 64733949.0, "step": 37315 }, { "entropy": 5.400386238098145, "epoch": 2.9036374246255594, "grad_norm": 1.125, "learning_rate": 0.00041578426229008325, "loss": 5.0232, "mean_token_accuracy": 0.2016855537891388, "num_tokens": 64742729.0, "step": 37320 }, { "entropy": 5.38262152671814, "epoch": 2.9040264539972767, "grad_norm": 1.0546875, "learning_rate": 0.00041576264146995557, "loss": 4.965, "mean_token_accuracy": 0.19412308633327485, "num_tokens": 64751655.0, "step": 37325 }, { "entropy": 5.411255264282227, "epoch": 2.9044154833689944, "grad_norm": 1.1171875, "learning_rate": 0.00041574101851397883, "loss": 4.957, "mean_token_accuracy": 0.20771207809448242, "num_tokens": 64760019.0, "step": 37330 }, { "entropy": 5.358091354370117, "epoch": 2.904804512740712, "grad_norm": 1.21875, "learning_rate": 0.0004157193934224811, "loss": 5.0186, "mean_token_accuracy": 0.20424339920282364, "num_tokens": 64768528.0, "step": 37335 }, { "entropy": 5.413808584213257, "epoch": 2.9051935421124293, "grad_norm": 1.1640625, "learning_rate": 0.0004156977661957906, "loss": 4.9997, "mean_token_accuracy": 0.19535810947418214, "num_tokens": 64776903.0, "step": 37340 }, { "entropy": 5.457866764068603, "epoch": 2.905582571484147, "grad_norm": 1.234375, "learning_rate": 0.0004156761368342355, "loss": 5.0795, "mean_token_accuracy": 0.1968183770775795, "num_tokens": 64785361.0, "step": 37345 }, { "entropy": 5.444344472885132, "epoch": 2.9059716008558647, "grad_norm": 1.125, "learning_rate": 0.00041565450533814384, "loss": 5.0061, "mean_token_accuracy": 0.2005004107952118, "num_tokens": 64793720.0, "step": 37350 }, { "entropy": 5.3388941287994385, "epoch": 2.9063606302275824, "grad_norm": 1.1015625, "learning_rate": 0.00041563287170784396, "loss": 4.8984, "mean_token_accuracy": 0.20896690040826799, "num_tokens": 64802049.0, "step": 37355 }, { "entropy": 5.381278848648071, "epoch": 2.9067496595992997, "grad_norm": 1.09375, "learning_rate": 0.0004156112359436641, "loss": 4.9516, "mean_token_accuracy": 0.2014062836766243, "num_tokens": 64810754.0, "step": 37360 }, { "entropy": 5.414401483535767, "epoch": 2.9071386889710173, "grad_norm": 1.1953125, "learning_rate": 0.00041558959804593255, "loss": 5.0502, "mean_token_accuracy": 0.19641206413507462, "num_tokens": 64819466.0, "step": 37365 }, { "entropy": 5.393006086349487, "epoch": 2.9075277183427346, "grad_norm": 1.1953125, "learning_rate": 0.00041556795801497766, "loss": 4.9905, "mean_token_accuracy": 0.19391808211803435, "num_tokens": 64828135.0, "step": 37370 }, { "entropy": 5.413118362426758, "epoch": 2.9079167477144523, "grad_norm": 1.1328125, "learning_rate": 0.0004155463158511277, "loss": 5.0496, "mean_token_accuracy": 0.19979741871356965, "num_tokens": 64836542.0, "step": 37375 }, { "entropy": 5.364656162261963, "epoch": 2.90830577708617, "grad_norm": 1.0859375, "learning_rate": 0.00041552467155471105, "loss": 4.8949, "mean_token_accuracy": 0.2096607968211174, "num_tokens": 64844470.0, "step": 37380 }, { "entropy": 5.364316034317016, "epoch": 2.9086948064578877, "grad_norm": 1.1640625, "learning_rate": 0.0004155030251260563, "loss": 4.9695, "mean_token_accuracy": 0.19923162162303926, "num_tokens": 64854011.0, "step": 37385 }, { "entropy": 5.469547843933105, "epoch": 2.9090838358296054, "grad_norm": 1.09375, "learning_rate": 0.00041548137656549167, "loss": 5.0101, "mean_token_accuracy": 0.20190962851047517, "num_tokens": 64862349.0, "step": 37390 }, { "entropy": 5.43422646522522, "epoch": 2.9094728652013226, "grad_norm": 1.2421875, "learning_rate": 0.0004154597258733457, "loss": 4.9709, "mean_token_accuracy": 0.19839250445365905, "num_tokens": 64870634.0, "step": 37395 }, { "entropy": 5.3955028533935545, "epoch": 2.9098618945730403, "grad_norm": 1.0859375, "learning_rate": 0.0004154380730499472, "loss": 5.0244, "mean_token_accuracy": 0.19922563284635544, "num_tokens": 64879870.0, "step": 37400 }, { "entropy": 5.352818775177002, "epoch": 2.9102509239447576, "grad_norm": 1.109375, "learning_rate": 0.00041541641809562425, "loss": 4.92, "mean_token_accuracy": 0.20635703802108765, "num_tokens": 64888650.0, "step": 37405 }, { "entropy": 5.390845108032226, "epoch": 2.9106399533164753, "grad_norm": 1.125, "learning_rate": 0.0004153947610107057, "loss": 4.9366, "mean_token_accuracy": 0.2032993569970131, "num_tokens": 64896788.0, "step": 37410 }, { "entropy": 5.33636507987976, "epoch": 2.911028982688193, "grad_norm": 1.078125, "learning_rate": 0.00041537310179552017, "loss": 4.8744, "mean_token_accuracy": 0.21089080423116685, "num_tokens": 64905134.0, "step": 37415 }, { "entropy": 5.398211431503296, "epoch": 2.9114180120599107, "grad_norm": 1.2265625, "learning_rate": 0.0004153514404503962, "loss": 5.0227, "mean_token_accuracy": 0.19696078449487686, "num_tokens": 64913662.0, "step": 37420 }, { "entropy": 5.419208908081055, "epoch": 2.911807041431628, "grad_norm": 1.125, "learning_rate": 0.0004153297769756625, "loss": 4.9301, "mean_token_accuracy": 0.20317360311746596, "num_tokens": 64922159.0, "step": 37425 }, { "entropy": 5.394416046142578, "epoch": 2.9121960708033456, "grad_norm": 1.15625, "learning_rate": 0.0004153081113716478, "loss": 4.9205, "mean_token_accuracy": 0.20740756243467331, "num_tokens": 64930672.0, "step": 37430 }, { "entropy": 5.348020076751709, "epoch": 2.9125851001750633, "grad_norm": 1.125, "learning_rate": 0.00041528644363868087, "loss": 4.9662, "mean_token_accuracy": 0.19713263660669328, "num_tokens": 64940424.0, "step": 37435 }, { "entropy": 5.448840856552124, "epoch": 2.9129741295467806, "grad_norm": 1.1171875, "learning_rate": 0.0004152647737770904, "loss": 5.1014, "mean_token_accuracy": 0.19356604665517807, "num_tokens": 64949510.0, "step": 37440 }, { "entropy": 5.372235345840454, "epoch": 2.9133631589184983, "grad_norm": 1.203125, "learning_rate": 0.0004152431017872053, "loss": 4.9177, "mean_token_accuracy": 0.20535041391849518, "num_tokens": 64958240.0, "step": 37445 }, { "entropy": 5.351169204711914, "epoch": 2.913752188290216, "grad_norm": 1.0625, "learning_rate": 0.00041522142766935426, "loss": 4.9136, "mean_token_accuracy": 0.20330470353364943, "num_tokens": 64967071.0, "step": 37450 }, { "entropy": 5.239471054077148, "epoch": 2.9141412176619337, "grad_norm": 1.203125, "learning_rate": 0.00041519975142386627, "loss": 4.9341, "mean_token_accuracy": 0.20740776509046555, "num_tokens": 64974949.0, "step": 37455 }, { "entropy": 5.40181303024292, "epoch": 2.914530247033651, "grad_norm": 1.0234375, "learning_rate": 0.0004151780730510702, "loss": 4.9634, "mean_token_accuracy": 0.19663360416889192, "num_tokens": 64983510.0, "step": 37460 }, { "entropy": 5.521481466293335, "epoch": 2.9149192764053686, "grad_norm": 1.1328125, "learning_rate": 0.00041515639255129504, "loss": 5.125, "mean_token_accuracy": 0.19464604556560516, "num_tokens": 64993055.0, "step": 37465 }, { "entropy": 5.414715576171875, "epoch": 2.9153083057770863, "grad_norm": 1.0625, "learning_rate": 0.0004151347099248697, "loss": 4.9517, "mean_token_accuracy": 0.19747292399406433, "num_tokens": 65002406.0, "step": 37470 }, { "entropy": 5.344550848007202, "epoch": 2.9156973351488036, "grad_norm": 1.1796875, "learning_rate": 0.0004151130251721231, "loss": 5.0652, "mean_token_accuracy": 0.19346767365932466, "num_tokens": 65011949.0, "step": 37475 }, { "entropy": 5.5293275833129885, "epoch": 2.9160863645205213, "grad_norm": 1.1328125, "learning_rate": 0.00041509133829338454, "loss": 5.1143, "mean_token_accuracy": 0.19104818254709244, "num_tokens": 65020215.0, "step": 37480 }, { "entropy": 5.378177356719971, "epoch": 2.916475393892239, "grad_norm": 1.0859375, "learning_rate": 0.0004150696492889827, "loss": 4.9321, "mean_token_accuracy": 0.2071759045124054, "num_tokens": 65028423.0, "step": 37485 }, { "entropy": 5.286511945724487, "epoch": 2.9168644232639567, "grad_norm": 1.1328125, "learning_rate": 0.00041504795815924697, "loss": 4.9084, "mean_token_accuracy": 0.20513925999403, "num_tokens": 65037804.0, "step": 37490 }, { "entropy": 5.353257465362549, "epoch": 2.917253452635674, "grad_norm": 1.125, "learning_rate": 0.00041502626490450635, "loss": 4.887, "mean_token_accuracy": 0.20681657791137695, "num_tokens": 65046389.0, "step": 37495 }, { "entropy": 5.305055713653564, "epoch": 2.9176424820073916, "grad_norm": 1.1171875, "learning_rate": 0.0004150045695250901, "loss": 4.9352, "mean_token_accuracy": 0.20170525163412095, "num_tokens": 65055499.0, "step": 37500 }, { "entropy": 5.314117765426635, "epoch": 2.918031511379109, "grad_norm": 1.2421875, "learning_rate": 0.0004149828720213272, "loss": 4.9003, "mean_token_accuracy": 0.21101456731557847, "num_tokens": 65063170.0, "step": 37505 }, { "entropy": 5.4019958019256595, "epoch": 2.9184205407508266, "grad_norm": 1.15625, "learning_rate": 0.0004149611723935472, "loss": 4.985, "mean_token_accuracy": 0.2028233602643013, "num_tokens": 65071046.0, "step": 37510 }, { "entropy": 5.35547366142273, "epoch": 2.9188095701225443, "grad_norm": 1.0859375, "learning_rate": 0.0004149394706420791, "loss": 4.9781, "mean_token_accuracy": 0.2030557408928871, "num_tokens": 65079135.0, "step": 37515 }, { "entropy": 5.345481014251709, "epoch": 2.919198599494262, "grad_norm": 1.078125, "learning_rate": 0.00041491776676725223, "loss": 4.9795, "mean_token_accuracy": 0.2001962348818779, "num_tokens": 65087861.0, "step": 37520 }, { "entropy": 5.339496850967407, "epoch": 2.9195876288659792, "grad_norm": 1.125, "learning_rate": 0.0004148960607693961, "loss": 4.8978, "mean_token_accuracy": 0.20552366822957993, "num_tokens": 65096561.0, "step": 37525 }, { "entropy": 5.398003673553466, "epoch": 2.919976658237697, "grad_norm": 1.265625, "learning_rate": 0.00041487435264883974, "loss": 4.9797, "mean_token_accuracy": 0.2019769787788391, "num_tokens": 65105383.0, "step": 37530 }, { "entropy": 5.358969831466675, "epoch": 2.9203656876094146, "grad_norm": 1.1328125, "learning_rate": 0.0004148526424059128, "loss": 4.9348, "mean_token_accuracy": 0.1994137316942215, "num_tokens": 65113551.0, "step": 37535 }, { "entropy": 5.329093027114868, "epoch": 2.920754716981132, "grad_norm": 1.1171875, "learning_rate": 0.0004148309300409446, "loss": 4.8745, "mean_token_accuracy": 0.21325115859508514, "num_tokens": 65121599.0, "step": 37540 }, { "entropy": 5.417471265792846, "epoch": 2.9211437463528496, "grad_norm": 1.15625, "learning_rate": 0.0004148092155542646, "loss": 5.0413, "mean_token_accuracy": 0.1939526692032814, "num_tokens": 65130881.0, "step": 37545 }, { "entropy": 5.348291873931885, "epoch": 2.9215327757245673, "grad_norm": 1.1171875, "learning_rate": 0.0004147874989462023, "loss": 4.9987, "mean_token_accuracy": 0.20159822404384614, "num_tokens": 65139233.0, "step": 37550 }, { "entropy": 5.3407673835754395, "epoch": 2.921921805096285, "grad_norm": 1.1015625, "learning_rate": 0.0004147657802170871, "loss": 4.9224, "mean_token_accuracy": 0.20072155743837355, "num_tokens": 65147738.0, "step": 37555 }, { "entropy": 5.403707122802734, "epoch": 2.922310834468002, "grad_norm": 1.1796875, "learning_rate": 0.00041474405936724873, "loss": 4.9644, "mean_token_accuracy": 0.19597127437591552, "num_tokens": 65156413.0, "step": 37560 }, { "entropy": 5.428874731063843, "epoch": 2.92269986383972, "grad_norm": 1.1640625, "learning_rate": 0.0004147223363970166, "loss": 4.9569, "mean_token_accuracy": 0.20637882351875306, "num_tokens": 65164614.0, "step": 37565 }, { "entropy": 5.408313322067261, "epoch": 2.9230888932114376, "grad_norm": 1.1953125, "learning_rate": 0.0004147006113067205, "loss": 4.9934, "mean_token_accuracy": 0.19283372163772583, "num_tokens": 65173159.0, "step": 37570 }, { "entropy": 5.336662626266479, "epoch": 2.923477922583155, "grad_norm": 1.1328125, "learning_rate": 0.0004146788840966901, "loss": 4.9569, "mean_token_accuracy": 0.19978110641241073, "num_tokens": 65181999.0, "step": 37575 }, { "entropy": 5.480209064483643, "epoch": 2.9238669519548726, "grad_norm": 1.109375, "learning_rate": 0.0004146571547672548, "loss": 5.1495, "mean_token_accuracy": 0.18244872689247132, "num_tokens": 65191291.0, "step": 37580 }, { "entropy": 5.407338333129883, "epoch": 2.9242559813265903, "grad_norm": 1.1796875, "learning_rate": 0.00041463542331874443, "loss": 4.8855, "mean_token_accuracy": 0.20636311173439026, "num_tokens": 65198891.0, "step": 37585 }, { "entropy": 5.354855537414551, "epoch": 2.924645010698308, "grad_norm": 1.1484375, "learning_rate": 0.00041461368975148876, "loss": 4.987, "mean_token_accuracy": 0.2017035037279129, "num_tokens": 65208206.0, "step": 37590 }, { "entropy": 5.36383285522461, "epoch": 2.925034040070025, "grad_norm": 1.2265625, "learning_rate": 0.00041459195406581763, "loss": 4.9213, "mean_token_accuracy": 0.20416442304849625, "num_tokens": 65216384.0, "step": 37595 }, { "entropy": 5.366391277313232, "epoch": 2.925423069441743, "grad_norm": 1.1796875, "learning_rate": 0.0004145702162620608, "loss": 4.8911, "mean_token_accuracy": 0.2038661539554596, "num_tokens": 65224612.0, "step": 37600 }, { "entropy": 5.416227102279663, "epoch": 2.92581209881346, "grad_norm": 1.203125, "learning_rate": 0.00041454847634054805, "loss": 4.9761, "mean_token_accuracy": 0.20649711787700653, "num_tokens": 65233389.0, "step": 37605 }, { "entropy": 5.435948514938355, "epoch": 2.926201128185178, "grad_norm": 1.125, "learning_rate": 0.00041452673430160923, "loss": 5.0364, "mean_token_accuracy": 0.20066017359495164, "num_tokens": 65242432.0, "step": 37610 }, { "entropy": 5.301699495315551, "epoch": 2.9265901575568956, "grad_norm": 1.09375, "learning_rate": 0.0004145049901455744, "loss": 4.845, "mean_token_accuracy": 0.20612765550613404, "num_tokens": 65250161.0, "step": 37615 }, { "entropy": 5.362723779678345, "epoch": 2.9269791869286133, "grad_norm": 1.0703125, "learning_rate": 0.00041448324387277337, "loss": 4.9939, "mean_token_accuracy": 0.1973414048552513, "num_tokens": 65258660.0, "step": 37620 }, { "entropy": 5.439974403381347, "epoch": 2.927368216300331, "grad_norm": 1.109375, "learning_rate": 0.00041446149548353606, "loss": 4.9563, "mean_token_accuracy": 0.20136415511369704, "num_tokens": 65267297.0, "step": 37625 }, { "entropy": 5.436471557617187, "epoch": 2.927757245672048, "grad_norm": 1.0390625, "learning_rate": 0.0004144397449781926, "loss": 5.0415, "mean_token_accuracy": 0.19909771978855134, "num_tokens": 65276064.0, "step": 37630 }, { "entropy": 5.425273370742798, "epoch": 2.928146275043766, "grad_norm": 1.109375, "learning_rate": 0.0004144179923570729, "loss": 4.9982, "mean_token_accuracy": 0.20273493081331254, "num_tokens": 65284624.0, "step": 37635 }, { "entropy": 5.335787773132324, "epoch": 2.928535304415483, "grad_norm": 1.1640625, "learning_rate": 0.0004143962376205071, "loss": 4.9383, "mean_token_accuracy": 0.203912653028965, "num_tokens": 65293318.0, "step": 37640 }, { "entropy": 5.4403656959533695, "epoch": 2.928924333787201, "grad_norm": 1.1875, "learning_rate": 0.00041437448076882526, "loss": 5.0628, "mean_token_accuracy": 0.19714379608631133, "num_tokens": 65301379.0, "step": 37645 }, { "entropy": 5.404918622970581, "epoch": 2.9293133631589185, "grad_norm": 1.2734375, "learning_rate": 0.00041435272180235757, "loss": 5.0431, "mean_token_accuracy": 0.19528946429491043, "num_tokens": 65309722.0, "step": 37650 }, { "entropy": 5.3694384574890135, "epoch": 2.9297023925306362, "grad_norm": 1.140625, "learning_rate": 0.000414330960721434, "loss": 4.9711, "mean_token_accuracy": 0.20003531873226166, "num_tokens": 65318616.0, "step": 37655 }, { "entropy": 5.42270302772522, "epoch": 2.9300914219023535, "grad_norm": 1.140625, "learning_rate": 0.00041430919752638497, "loss": 4.9595, "mean_token_accuracy": 0.20351346135139464, "num_tokens": 65327046.0, "step": 37660 }, { "entropy": 5.330277347564698, "epoch": 2.930480451274071, "grad_norm": 1.1484375, "learning_rate": 0.0004142874322175406, "loss": 4.9387, "mean_token_accuracy": 0.19928795099258423, "num_tokens": 65335032.0, "step": 37665 }, { "entropy": 5.358166933059692, "epoch": 2.930869480645789, "grad_norm": 1.09375, "learning_rate": 0.00041426566479523116, "loss": 5.0047, "mean_token_accuracy": 0.1915602207183838, "num_tokens": 65343573.0, "step": 37670 }, { "entropy": 5.352674674987793, "epoch": 2.931258510017506, "grad_norm": 1.109375, "learning_rate": 0.00041424389525978683, "loss": 4.8486, "mean_token_accuracy": 0.2078844279050827, "num_tokens": 65352660.0, "step": 37675 }, { "entropy": 5.396851587295532, "epoch": 2.931647539389224, "grad_norm": 1.140625, "learning_rate": 0.0004142221236115381, "loss": 4.9945, "mean_token_accuracy": 0.19501526951789855, "num_tokens": 65362938.0, "step": 37680 }, { "entropy": 5.359987783432007, "epoch": 2.9320365687609415, "grad_norm": 1.15625, "learning_rate": 0.0004142003498508152, "loss": 4.8996, "mean_token_accuracy": 0.20601724088191986, "num_tokens": 65372000.0, "step": 37685 }, { "entropy": 5.3622230052947994, "epoch": 2.9324255981326592, "grad_norm": 1.1484375, "learning_rate": 0.0004141785739779486, "loss": 4.9302, "mean_token_accuracy": 0.20755930989980698, "num_tokens": 65379389.0, "step": 37690 }, { "entropy": 5.333988952636719, "epoch": 2.9328146275043765, "grad_norm": 1.1015625, "learning_rate": 0.00041415679599326853, "loss": 4.9597, "mean_token_accuracy": 0.19340699911117554, "num_tokens": 65388335.0, "step": 37695 }, { "entropy": 5.405156135559082, "epoch": 2.933203656876094, "grad_norm": 1.15625, "learning_rate": 0.00041413501589710567, "loss": 5.0662, "mean_token_accuracy": 0.19486627131700515, "num_tokens": 65397280.0, "step": 37700 }, { "entropy": 5.473224735260009, "epoch": 2.9335926862478114, "grad_norm": 1.1640625, "learning_rate": 0.0004141132336897904, "loss": 5.1037, "mean_token_accuracy": 0.19134899973869324, "num_tokens": 65406600.0, "step": 37705 }, { "entropy": 5.408292579650879, "epoch": 2.933981715619529, "grad_norm": 1.09375, "learning_rate": 0.0004140914493716533, "loss": 4.9486, "mean_token_accuracy": 0.20452744960784913, "num_tokens": 65415642.0, "step": 37710 }, { "entropy": 5.403013801574707, "epoch": 2.934370744991247, "grad_norm": 1.125, "learning_rate": 0.0004140696629430248, "loss": 4.9582, "mean_token_accuracy": 0.1998807743191719, "num_tokens": 65423977.0, "step": 37715 }, { "entropy": 5.282024669647217, "epoch": 2.9347597743629645, "grad_norm": 1.1484375, "learning_rate": 0.00041404787440423534, "loss": 4.9648, "mean_token_accuracy": 0.20175246745347977, "num_tokens": 65432567.0, "step": 37720 }, { "entropy": 5.3721386909484865, "epoch": 2.9351488037346822, "grad_norm": 1.1328125, "learning_rate": 0.00041402608375561595, "loss": 4.9874, "mean_token_accuracy": 0.2007876768708229, "num_tokens": 65441341.0, "step": 37725 }, { "entropy": 5.34037446975708, "epoch": 2.9355378331063995, "grad_norm": 1.0859375, "learning_rate": 0.00041400429099749687, "loss": 4.88, "mean_token_accuracy": 0.21553498059511184, "num_tokens": 65449612.0, "step": 37730 }, { "entropy": 5.3398548603057865, "epoch": 2.935926862478117, "grad_norm": 1.1796875, "learning_rate": 0.000413982496130209, "loss": 4.9399, "mean_token_accuracy": 0.1986027777194977, "num_tokens": 65457216.0, "step": 37735 }, { "entropy": 5.320475387573242, "epoch": 2.9363158918498344, "grad_norm": 1.0859375, "learning_rate": 0.00041396069915408294, "loss": 4.8778, "mean_token_accuracy": 0.20334037840366365, "num_tokens": 65465420.0, "step": 37740 }, { "entropy": 5.470016670227051, "epoch": 2.936704921221552, "grad_norm": 1.109375, "learning_rate": 0.00041393890006944945, "loss": 4.9852, "mean_token_accuracy": 0.19464935809373857, "num_tokens": 65474608.0, "step": 37745 }, { "entropy": 5.394106674194336, "epoch": 2.93709395059327, "grad_norm": 1.078125, "learning_rate": 0.0004139170988766393, "loss": 4.9326, "mean_token_accuracy": 0.20110880583524704, "num_tokens": 65483204.0, "step": 37750 }, { "entropy": 5.308521032333374, "epoch": 2.9374829799649875, "grad_norm": 1.2578125, "learning_rate": 0.0004138952955759833, "loss": 4.8866, "mean_token_accuracy": 0.2100418284535408, "num_tokens": 65491472.0, "step": 37755 }, { "entropy": 5.404114723205566, "epoch": 2.937872009336705, "grad_norm": 1.109375, "learning_rate": 0.00041387349016781225, "loss": 4.9983, "mean_token_accuracy": 0.199154894053936, "num_tokens": 65500018.0, "step": 37760 }, { "entropy": 5.4392087936401365, "epoch": 2.9382610387084225, "grad_norm": 1.1015625, "learning_rate": 0.000413851682652457, "loss": 5.0502, "mean_token_accuracy": 0.20067093670368194, "num_tokens": 65508845.0, "step": 37765 }, { "entropy": 5.4023490905761715, "epoch": 2.93865006808014, "grad_norm": 1.1015625, "learning_rate": 0.0004138298730302485, "loss": 4.9534, "mean_token_accuracy": 0.20764517188072204, "num_tokens": 65517696.0, "step": 37770 }, { "entropy": 5.304414844512939, "epoch": 2.9390390974518574, "grad_norm": 1.046875, "learning_rate": 0.0004138080613015176, "loss": 4.9281, "mean_token_accuracy": 0.2026049330830574, "num_tokens": 65526563.0, "step": 37775 }, { "entropy": 5.408280849456787, "epoch": 2.939428126823575, "grad_norm": 1.15625, "learning_rate": 0.00041378624746659536, "loss": 5.0128, "mean_token_accuracy": 0.19605775624513627, "num_tokens": 65535719.0, "step": 37780 }, { "entropy": 5.451245594024658, "epoch": 2.939817156195293, "grad_norm": 1.1328125, "learning_rate": 0.00041376443152581265, "loss": 5.0342, "mean_token_accuracy": 0.1945420280098915, "num_tokens": 65543823.0, "step": 37785 }, { "entropy": 5.387151718139648, "epoch": 2.9402061855670105, "grad_norm": 1.2421875, "learning_rate": 0.00041374261347950064, "loss": 4.913, "mean_token_accuracy": 0.20796197950839995, "num_tokens": 65551923.0, "step": 37790 }, { "entropy": 5.3681152820587155, "epoch": 2.9405952149387278, "grad_norm": 1.1953125, "learning_rate": 0.0004137207933279903, "loss": 4.9287, "mean_token_accuracy": 0.20895612835884095, "num_tokens": 65560552.0, "step": 37795 }, { "entropy": 5.371119832992553, "epoch": 2.9409842443104455, "grad_norm": 1.0546875, "learning_rate": 0.00041369897107161266, "loss": 4.9673, "mean_token_accuracy": 0.20324310809373855, "num_tokens": 65568897.0, "step": 37800 }, { "entropy": 5.4015179634094235, "epoch": 2.941373273682163, "grad_norm": 1.0703125, "learning_rate": 0.00041367714671069897, "loss": 4.9889, "mean_token_accuracy": 0.20055605173110963, "num_tokens": 65577611.0, "step": 37805 }, { "entropy": 5.38393087387085, "epoch": 2.9417623030538804, "grad_norm": 1.1328125, "learning_rate": 0.00041365532024558024, "loss": 4.9399, "mean_token_accuracy": 0.2006349191069603, "num_tokens": 65586284.0, "step": 37810 }, { "entropy": 5.420541715621948, "epoch": 2.942151332425598, "grad_norm": 1.1015625, "learning_rate": 0.0004136334916765877, "loss": 5.0047, "mean_token_accuracy": 0.20125560313463212, "num_tokens": 65595065.0, "step": 37815 }, { "entropy": 5.431440114974976, "epoch": 2.942540361797316, "grad_norm": 1.09375, "learning_rate": 0.00041361166100405264, "loss": 5.0072, "mean_token_accuracy": 0.19855813533067704, "num_tokens": 65604478.0, "step": 37820 }, { "entropy": 5.366732978820801, "epoch": 2.9429293911690335, "grad_norm": 1.1328125, "learning_rate": 0.0004135898282283062, "loss": 5.0024, "mean_token_accuracy": 0.20280594676733016, "num_tokens": 65613473.0, "step": 37825 }, { "entropy": 5.369474029541015, "epoch": 2.9433184205407508, "grad_norm": 1.140625, "learning_rate": 0.0004135679933496797, "loss": 4.9526, "mean_token_accuracy": 0.20257633924484253, "num_tokens": 65622498.0, "step": 37830 }, { "entropy": 5.382475900650024, "epoch": 2.9437074499124685, "grad_norm": 1.09375, "learning_rate": 0.0004135461563685045, "loss": 5.0422, "mean_token_accuracy": 0.1956923261284828, "num_tokens": 65630939.0, "step": 37835 }, { "entropy": 5.414383506774902, "epoch": 2.9440964792841857, "grad_norm": 1.15625, "learning_rate": 0.00041352431728511194, "loss": 4.9595, "mean_token_accuracy": 0.1996999442577362, "num_tokens": 65639667.0, "step": 37840 }, { "entropy": 5.424587392807007, "epoch": 2.9444855086559034, "grad_norm": 1.140625, "learning_rate": 0.0004135024760998333, "loss": 4.9682, "mean_token_accuracy": 0.20248344987630845, "num_tokens": 65648413.0, "step": 37845 }, { "entropy": 5.37522702217102, "epoch": 2.944874538027621, "grad_norm": 1.09375, "learning_rate": 0.00041348063281299995, "loss": 5.0522, "mean_token_accuracy": 0.19733929634094238, "num_tokens": 65657486.0, "step": 37850 }, { "entropy": 5.355013132095337, "epoch": 2.945263567399339, "grad_norm": 1.15625, "learning_rate": 0.00041345878742494346, "loss": 4.9309, "mean_token_accuracy": 0.203348571062088, "num_tokens": 65666328.0, "step": 37855 }, { "entropy": 5.32621431350708, "epoch": 2.945652596771056, "grad_norm": 1.1875, "learning_rate": 0.00041343693993599535, "loss": 4.9632, "mean_token_accuracy": 0.19722681641578674, "num_tokens": 65674107.0, "step": 37860 }, { "entropy": 5.300283288955688, "epoch": 2.9460416261427738, "grad_norm": 1.125, "learning_rate": 0.0004134150903464869, "loss": 4.88, "mean_token_accuracy": 0.20362711250782012, "num_tokens": 65682534.0, "step": 37865 }, { "entropy": 5.4423047542572025, "epoch": 2.9464306555144915, "grad_norm": 1.203125, "learning_rate": 0.0004133932386567498, "loss": 5.0885, "mean_token_accuracy": 0.19161452054977418, "num_tokens": 65690781.0, "step": 37870 }, { "entropy": 5.37935881614685, "epoch": 2.9468196848862087, "grad_norm": 1.1875, "learning_rate": 0.0004133713848671156, "loss": 4.9346, "mean_token_accuracy": 0.20045971274375915, "num_tokens": 65698668.0, "step": 37875 }, { "entropy": 5.330772113800049, "epoch": 2.9472087142579264, "grad_norm": 1.15625, "learning_rate": 0.0004133495289779159, "loss": 4.925, "mean_token_accuracy": 0.2017100363969803, "num_tokens": 65706568.0, "step": 37880 }, { "entropy": 5.3536817073822025, "epoch": 2.947597743629644, "grad_norm": 1.1953125, "learning_rate": 0.0004133276709894823, "loss": 4.9539, "mean_token_accuracy": 0.20344362854957582, "num_tokens": 65714652.0, "step": 37885 }, { "entropy": 5.337714719772339, "epoch": 2.947986773001362, "grad_norm": 1.15625, "learning_rate": 0.0004133058109021464, "loss": 4.9459, "mean_token_accuracy": 0.205729678273201, "num_tokens": 65723296.0, "step": 37890 }, { "entropy": 5.4146990299224855, "epoch": 2.948375802373079, "grad_norm": 1.09375, "learning_rate": 0.00041328394871624003, "loss": 5.0331, "mean_token_accuracy": 0.1958726868033409, "num_tokens": 65732257.0, "step": 37895 }, { "entropy": 5.425130605697632, "epoch": 2.9487648317447968, "grad_norm": 1.140625, "learning_rate": 0.0004132620844320948, "loss": 4.9345, "mean_token_accuracy": 0.20518406331539155, "num_tokens": 65740152.0, "step": 37900 }, { "entropy": 5.309505414962769, "epoch": 2.9491538611165145, "grad_norm": 1.2109375, "learning_rate": 0.0004132402180500425, "loss": 4.9483, "mean_token_accuracy": 0.19853665679693222, "num_tokens": 65748927.0, "step": 37905 }, { "entropy": 5.359899663925171, "epoch": 2.9495428904882317, "grad_norm": 1.0859375, "learning_rate": 0.0004132183495704149, "loss": 4.9594, "mean_token_accuracy": 0.20121003836393356, "num_tokens": 65756949.0, "step": 37910 }, { "entropy": 5.462262725830078, "epoch": 2.9499319198599494, "grad_norm": 1.1875, "learning_rate": 0.0004131964789935439, "loss": 5.0823, "mean_token_accuracy": 0.19762555062770842, "num_tokens": 65765076.0, "step": 37915 }, { "entropy": 5.360346126556396, "epoch": 2.950320949231667, "grad_norm": 1.1953125, "learning_rate": 0.0004131746063197612, "loss": 4.9667, "mean_token_accuracy": 0.20599135756492615, "num_tokens": 65773581.0, "step": 37920 }, { "entropy": 5.485965585708618, "epoch": 2.950709978603385, "grad_norm": 1.0625, "learning_rate": 0.0004131527315493989, "loss": 5.1192, "mean_token_accuracy": 0.19339931160211563, "num_tokens": 65782312.0, "step": 37925 }, { "entropy": 5.367971611022949, "epoch": 2.951099007975102, "grad_norm": 1.1015625, "learning_rate": 0.00041313085468278873, "loss": 4.9517, "mean_token_accuracy": 0.20491400212049485, "num_tokens": 65790601.0, "step": 37930 }, { "entropy": 5.395820999145508, "epoch": 2.9514880373468197, "grad_norm": 1.109375, "learning_rate": 0.0004131089757202627, "loss": 4.9664, "mean_token_accuracy": 0.20425473004579545, "num_tokens": 65799393.0, "step": 37935 }, { "entropy": 5.398208093643189, "epoch": 2.951877066718537, "grad_norm": 1.0, "learning_rate": 0.00041308709466215276, "loss": 4.975, "mean_token_accuracy": 0.2023208722472191, "num_tokens": 65808871.0, "step": 37940 }, { "entropy": 5.274767446517944, "epoch": 2.9522660960902547, "grad_norm": 1.1484375, "learning_rate": 0.000413065211508791, "loss": 4.8001, "mean_token_accuracy": 0.2135943055152893, "num_tokens": 65817075.0, "step": 37945 }, { "entropy": 5.347618198394775, "epoch": 2.9526551254619724, "grad_norm": 1.234375, "learning_rate": 0.00041304332626050937, "loss": 4.8674, "mean_token_accuracy": 0.2061361625790596, "num_tokens": 65825081.0, "step": 37950 }, { "entropy": 5.323006534576416, "epoch": 2.95304415483369, "grad_norm": 1.171875, "learning_rate": 0.00041302143891764, "loss": 4.9911, "mean_token_accuracy": 0.196773199737072, "num_tokens": 65833183.0, "step": 37955 }, { "entropy": 5.355693197250366, "epoch": 2.9534331842054073, "grad_norm": 1.109375, "learning_rate": 0.000412999549480515, "loss": 4.8782, "mean_token_accuracy": 0.20206838399171828, "num_tokens": 65841514.0, "step": 37960 }, { "entropy": 5.481353807449341, "epoch": 2.953822213577125, "grad_norm": 1.1328125, "learning_rate": 0.0004129776579494665, "loss": 5.025, "mean_token_accuracy": 0.20750745087862016, "num_tokens": 65850433.0, "step": 37965 }, { "entropy": 5.416760778427124, "epoch": 2.9542112429488427, "grad_norm": 1.203125, "learning_rate": 0.0004129557643248265, "loss": 4.9999, "mean_token_accuracy": 0.19766815900802612, "num_tokens": 65859807.0, "step": 37970 }, { "entropy": 5.311580467224121, "epoch": 2.95460027232056, "grad_norm": 1.1015625, "learning_rate": 0.0004129338686069276, "loss": 4.9436, "mean_token_accuracy": 0.20746409595012666, "num_tokens": 65867901.0, "step": 37975 }, { "entropy": 5.370877265930176, "epoch": 2.9549893016922777, "grad_norm": 1.21875, "learning_rate": 0.0004129119707961016, "loss": 4.9932, "mean_token_accuracy": 0.19823826104402542, "num_tokens": 65876660.0, "step": 37980 }, { "entropy": 5.462342309951782, "epoch": 2.9553783310639954, "grad_norm": 1.1328125, "learning_rate": 0.000412890070892681, "loss": 5.0334, "mean_token_accuracy": 0.1943318650126457, "num_tokens": 65885258.0, "step": 37985 }, { "entropy": 5.443876314163208, "epoch": 2.955767360435713, "grad_norm": 1.171875, "learning_rate": 0.000412868168896998, "loss": 5.0672, "mean_token_accuracy": 0.1881442129611969, "num_tokens": 65894260.0, "step": 37990 }, { "entropy": 5.447087192535401, "epoch": 2.9561563898074303, "grad_norm": 1.1171875, "learning_rate": 0.0004128462648093851, "loss": 4.9889, "mean_token_accuracy": 0.1995323896408081, "num_tokens": 65903000.0, "step": 37995 }, { "entropy": 5.394429302215576, "epoch": 2.956545419179148, "grad_norm": 1.125, "learning_rate": 0.0004128243586301745, "loss": 4.9735, "mean_token_accuracy": 0.20282233506441116, "num_tokens": 65911550.0, "step": 38000 }, { "entropy": 5.3915001392364506, "epoch": 2.9569344485508657, "grad_norm": 1.09375, "learning_rate": 0.0004128024503596986, "loss": 4.9414, "mean_token_accuracy": 0.20307868272066115, "num_tokens": 65920091.0, "step": 38005 }, { "entropy": 5.32342791557312, "epoch": 2.957323477922583, "grad_norm": 1.109375, "learning_rate": 0.00041278053999828986, "loss": 4.956, "mean_token_accuracy": 0.19966159760951996, "num_tokens": 65929313.0, "step": 38010 }, { "entropy": 5.396011304855347, "epoch": 2.9577125072943007, "grad_norm": 1.0859375, "learning_rate": 0.0004127586275462806, "loss": 5.0269, "mean_token_accuracy": 0.1913701370358467, "num_tokens": 65938407.0, "step": 38015 }, { "entropy": 5.414344930648804, "epoch": 2.9581015366660184, "grad_norm": 1.09375, "learning_rate": 0.00041273671300400363, "loss": 4.9412, "mean_token_accuracy": 0.2063109040260315, "num_tokens": 65946644.0, "step": 38020 }, { "entropy": 5.410267686843872, "epoch": 2.958490566037736, "grad_norm": 1.1171875, "learning_rate": 0.00041271479637179116, "loss": 5.0424, "mean_token_accuracy": 0.19689824432134628, "num_tokens": 65955695.0, "step": 38025 }, { "entropy": 5.445426893234253, "epoch": 2.9588795954094533, "grad_norm": 1.15625, "learning_rate": 0.0004126928776499759, "loss": 5.0732, "mean_token_accuracy": 0.18842373937368392, "num_tokens": 65964326.0, "step": 38030 }, { "entropy": 5.357020854949951, "epoch": 2.959268624781171, "grad_norm": 1.1484375, "learning_rate": 0.0004126709568388903, "loss": 4.9057, "mean_token_accuracy": 0.2022950157523155, "num_tokens": 65972986.0, "step": 38035 }, { "entropy": 5.342325878143311, "epoch": 2.9596576541528883, "grad_norm": 1.1171875, "learning_rate": 0.0004126490339388672, "loss": 4.9473, "mean_token_accuracy": 0.20743325650691985, "num_tokens": 65980829.0, "step": 38040 }, { "entropy": 5.367606163024902, "epoch": 2.960046683524606, "grad_norm": 1.1953125, "learning_rate": 0.000412627108950239, "loss": 4.8762, "mean_token_accuracy": 0.20567074716091155, "num_tokens": 65989412.0, "step": 38045 }, { "entropy": 5.3479413986206055, "epoch": 2.9604357128963237, "grad_norm": 1.1640625, "learning_rate": 0.0004126051818733385, "loss": 4.966, "mean_token_accuracy": 0.2013981282711029, "num_tokens": 65998887.0, "step": 38050 }, { "entropy": 5.431630325317383, "epoch": 2.9608247422680414, "grad_norm": 1.1484375, "learning_rate": 0.0004125832527084984, "loss": 5.0082, "mean_token_accuracy": 0.20024715960025788, "num_tokens": 66007266.0, "step": 38055 }, { "entropy": 5.393360614776611, "epoch": 2.961213771639759, "grad_norm": 1.1484375, "learning_rate": 0.00041256132145605143, "loss": 4.9316, "mean_token_accuracy": 0.20378567427396774, "num_tokens": 66015968.0, "step": 38060 }, { "entropy": 5.427715158462524, "epoch": 2.9616028010114763, "grad_norm": 1.078125, "learning_rate": 0.0004125393881163304, "loss": 5.0222, "mean_token_accuracy": 0.1934209167957306, "num_tokens": 66025128.0, "step": 38065 }, { "entropy": 5.3826963901519775, "epoch": 2.961991830383194, "grad_norm": 1.1484375, "learning_rate": 0.00041251745268966797, "loss": 4.9153, "mean_token_accuracy": 0.20436899214982987, "num_tokens": 66033730.0, "step": 38070 }, { "entropy": 5.27549524307251, "epoch": 2.9623808597549113, "grad_norm": 1.125, "learning_rate": 0.0004124955151763971, "loss": 4.8628, "mean_token_accuracy": 0.21150993108749389, "num_tokens": 66042711.0, "step": 38075 }, { "entropy": 5.443307018280029, "epoch": 2.962769889126629, "grad_norm": 1.125, "learning_rate": 0.0004124735755768506, "loss": 4.9639, "mean_token_accuracy": 0.2065073072910309, "num_tokens": 66051107.0, "step": 38080 }, { "entropy": 5.391071796417236, "epoch": 2.9631589184983467, "grad_norm": 1.09375, "learning_rate": 0.0004124516338913615, "loss": 4.9675, "mean_token_accuracy": 0.20651648938655853, "num_tokens": 66059532.0, "step": 38085 }, { "entropy": 5.3682457447052006, "epoch": 2.9635479478700644, "grad_norm": 1.140625, "learning_rate": 0.0004124296901202626, "loss": 4.9938, "mean_token_accuracy": 0.1968667760491371, "num_tokens": 66068034.0, "step": 38090 }, { "entropy": 5.427253723144531, "epoch": 2.9639369772417816, "grad_norm": 1.265625, "learning_rate": 0.00041240774426388685, "loss": 5.0256, "mean_token_accuracy": 0.19464122951030732, "num_tokens": 66077403.0, "step": 38095 }, { "entropy": 5.428533601760864, "epoch": 2.9643260066134993, "grad_norm": 1.140625, "learning_rate": 0.0004123857963225673, "loss": 5.0008, "mean_token_accuracy": 0.19266920089721679, "num_tokens": 66085930.0, "step": 38100 }, { "entropy": 5.411783075332641, "epoch": 2.964715035985217, "grad_norm": 1.203125, "learning_rate": 0.000412363846296637, "loss": 4.9406, "mean_token_accuracy": 0.20242844820022582, "num_tokens": 66094671.0, "step": 38105 }, { "entropy": 5.395580148696899, "epoch": 2.9651040653569343, "grad_norm": 1.1328125, "learning_rate": 0.000412341894186429, "loss": 5.057, "mean_token_accuracy": 0.1989541009068489, "num_tokens": 66103250.0, "step": 38110 }, { "entropy": 5.3936292171478275, "epoch": 2.965493094728652, "grad_norm": 1.1171875, "learning_rate": 0.0004123199399922763, "loss": 4.9664, "mean_token_accuracy": 0.20479229539632798, "num_tokens": 66111073.0, "step": 38115 }, { "entropy": 5.339973211288452, "epoch": 2.9658821241003697, "grad_norm": 1.09375, "learning_rate": 0.00041229798371451203, "loss": 4.9001, "mean_token_accuracy": 0.20256479680538178, "num_tokens": 66119514.0, "step": 38120 }, { "entropy": 5.361181163787842, "epoch": 2.9662711534720874, "grad_norm": 1.1328125, "learning_rate": 0.0004122760253534695, "loss": 4.9288, "mean_token_accuracy": 0.20087486356496811, "num_tokens": 66128804.0, "step": 38125 }, { "entropy": 5.392936277389526, "epoch": 2.9666601828438046, "grad_norm": 1.1953125, "learning_rate": 0.0004122540649094817, "loss": 4.9648, "mean_token_accuracy": 0.20542702972888946, "num_tokens": 66137683.0, "step": 38130 }, { "entropy": 5.4481250762939455, "epoch": 2.9670492122155223, "grad_norm": 1.1328125, "learning_rate": 0.00041223210238288196, "loss": 5.0267, "mean_token_accuracy": 0.19689006209373475, "num_tokens": 66147135.0, "step": 38135 }, { "entropy": 5.411341667175293, "epoch": 2.9674382415872396, "grad_norm": 1.109375, "learning_rate": 0.0004122101377740035, "loss": 4.9148, "mean_token_accuracy": 0.206108221411705, "num_tokens": 66155534.0, "step": 38140 }, { "entropy": 5.391073083877563, "epoch": 2.9678272709589573, "grad_norm": 1.171875, "learning_rate": 0.0004121881710831796, "loss": 4.908, "mean_token_accuracy": 0.20672812014818193, "num_tokens": 66164413.0, "step": 38145 }, { "entropy": 5.382673263549805, "epoch": 2.968216300330675, "grad_norm": 1.1875, "learning_rate": 0.0004121662023107435, "loss": 4.9808, "mean_token_accuracy": 0.20280151963233947, "num_tokens": 66173469.0, "step": 38150 }, { "entropy": 5.351093006134033, "epoch": 2.9686053297023927, "grad_norm": 1.109375, "learning_rate": 0.0004121442314570286, "loss": 4.9007, "mean_token_accuracy": 0.2045367792248726, "num_tokens": 66182183.0, "step": 38155 }, { "entropy": 5.394851446151733, "epoch": 2.9689943590741104, "grad_norm": 1.1796875, "learning_rate": 0.00041212225852236834, "loss": 4.9408, "mean_token_accuracy": 0.20108719170093536, "num_tokens": 66190647.0, "step": 38160 }, { "entropy": 5.274054670333863, "epoch": 2.9693833884458276, "grad_norm": 1.1015625, "learning_rate": 0.0004121002835070961, "loss": 4.816, "mean_token_accuracy": 0.20558966994285582, "num_tokens": 66198536.0, "step": 38165 }, { "entropy": 5.439622306823731, "epoch": 2.9697724178175453, "grad_norm": 1.1328125, "learning_rate": 0.0004120783064115452, "loss": 5.1272, "mean_token_accuracy": 0.18706280291080474, "num_tokens": 66207772.0, "step": 38170 }, { "entropy": 5.4685387134552, "epoch": 2.9701614471892626, "grad_norm": 1.1484375, "learning_rate": 0.0004120563272360492, "loss": 5.0428, "mean_token_accuracy": 0.19492299854755402, "num_tokens": 66216862.0, "step": 38175 }, { "entropy": 5.456356954574585, "epoch": 2.9705504765609803, "grad_norm": 1.1796875, "learning_rate": 0.0004120343459809416, "loss": 5.0112, "mean_token_accuracy": 0.19915633648633957, "num_tokens": 66225817.0, "step": 38180 }, { "entropy": 5.39089183807373, "epoch": 2.970939505932698, "grad_norm": 1.0859375, "learning_rate": 0.0004120123626465559, "loss": 5.0124, "mean_token_accuracy": 0.19599299877882004, "num_tokens": 66234894.0, "step": 38185 }, { "entropy": 5.356740522384643, "epoch": 2.9713285353044157, "grad_norm": 1.1015625, "learning_rate": 0.00041199037723322566, "loss": 4.8964, "mean_token_accuracy": 0.20243219286203384, "num_tokens": 66243800.0, "step": 38190 }, { "entropy": 5.359181118011475, "epoch": 2.971717564676133, "grad_norm": 1.0859375, "learning_rate": 0.00041196838974128446, "loss": 4.9094, "mean_token_accuracy": 0.20440909117460251, "num_tokens": 66253192.0, "step": 38195 }, { "entropy": 5.345286750793457, "epoch": 2.9721065940478506, "grad_norm": 1.109375, "learning_rate": 0.000411946400171066, "loss": 4.9202, "mean_token_accuracy": 0.20844102054834365, "num_tokens": 66261775.0, "step": 38200 }, { "entropy": 5.356602430343628, "epoch": 2.9724956234195683, "grad_norm": 1.0546875, "learning_rate": 0.00041192440852290385, "loss": 4.9532, "mean_token_accuracy": 0.20127539187669755, "num_tokens": 66271069.0, "step": 38205 }, { "entropy": 5.4719208717346195, "epoch": 2.9728846527912856, "grad_norm": 1.15625, "learning_rate": 0.0004119024147971318, "loss": 5.1022, "mean_token_accuracy": 0.19554950296878815, "num_tokens": 66280021.0, "step": 38210 }, { "entropy": 5.39001317024231, "epoch": 2.9732736821630033, "grad_norm": 1.0546875, "learning_rate": 0.00041188041899408345, "loss": 4.9418, "mean_token_accuracy": 0.20625476986169816, "num_tokens": 66288782.0, "step": 38215 }, { "entropy": 5.4133189678192135, "epoch": 2.973662711534721, "grad_norm": 1.25, "learning_rate": 0.0004118584211140926, "loss": 4.9971, "mean_token_accuracy": 0.1953978568315506, "num_tokens": 66297716.0, "step": 38220 }, { "entropy": 5.468969392776489, "epoch": 2.9740517409064386, "grad_norm": 1.171875, "learning_rate": 0.00041183642115749316, "loss": 5.002, "mean_token_accuracy": 0.1991521328687668, "num_tokens": 66305977.0, "step": 38225 }, { "entropy": 5.416920280456543, "epoch": 2.974440770278156, "grad_norm": 1.2265625, "learning_rate": 0.00041181441912461873, "loss": 5.042, "mean_token_accuracy": 0.1990526795387268, "num_tokens": 66314344.0, "step": 38230 }, { "entropy": 5.326670074462891, "epoch": 2.9748297996498736, "grad_norm": 1.171875, "learning_rate": 0.0004117924150158032, "loss": 4.9331, "mean_token_accuracy": 0.20160309672355653, "num_tokens": 66322776.0, "step": 38235 }, { "entropy": 5.42648024559021, "epoch": 2.9752188290215913, "grad_norm": 1.1484375, "learning_rate": 0.00041177040883138064, "loss": 5.0075, "mean_token_accuracy": 0.20792577862739564, "num_tokens": 66331161.0, "step": 38240 }, { "entropy": 5.418236875534058, "epoch": 2.9756078583933085, "grad_norm": 1.15625, "learning_rate": 0.00041174840057168474, "loss": 4.9853, "mean_token_accuracy": 0.20161716789007186, "num_tokens": 66339579.0, "step": 38245 }, { "entropy": 5.229699230194091, "epoch": 2.9759968877650262, "grad_norm": 1.1953125, "learning_rate": 0.0004117263902370495, "loss": 4.8677, "mean_token_accuracy": 0.20782626569271087, "num_tokens": 66348716.0, "step": 38250 }, { "entropy": 5.379639101028443, "epoch": 2.976385917136744, "grad_norm": 1.2265625, "learning_rate": 0.00041170437782780896, "loss": 4.9361, "mean_token_accuracy": 0.19685055017471315, "num_tokens": 66357546.0, "step": 38255 }, { "entropy": 5.351508092880249, "epoch": 2.9767749465084616, "grad_norm": 1.1953125, "learning_rate": 0.000411682363344297, "loss": 4.8539, "mean_token_accuracy": 0.2113683819770813, "num_tokens": 66366024.0, "step": 38260 }, { "entropy": 5.393351888656616, "epoch": 2.977163975880179, "grad_norm": 1.1171875, "learning_rate": 0.00041166034678684777, "loss": 4.9284, "mean_token_accuracy": 0.20496572256088258, "num_tokens": 66374413.0, "step": 38265 }, { "entropy": 5.38733024597168, "epoch": 2.9775530052518966, "grad_norm": 1.1015625, "learning_rate": 0.0004116383281557953, "loss": 5.0058, "mean_token_accuracy": 0.19440943449735643, "num_tokens": 66383131.0, "step": 38270 }, { "entropy": 5.385790205001831, "epoch": 2.977942034623614, "grad_norm": 1.1015625, "learning_rate": 0.00041161630745147374, "loss": 5.0578, "mean_token_accuracy": 0.1938394159078598, "num_tokens": 66392227.0, "step": 38275 }, { "entropy": 5.363867902755738, "epoch": 2.9783310639953315, "grad_norm": 1.0390625, "learning_rate": 0.0004115942846742171, "loss": 4.9721, "mean_token_accuracy": 0.20194346010684966, "num_tokens": 66401384.0, "step": 38280 }, { "entropy": 5.393619155883789, "epoch": 2.9787200933670492, "grad_norm": 1.15625, "learning_rate": 0.0004115722598243596, "loss": 4.9466, "mean_token_accuracy": 0.20679647624492645, "num_tokens": 66409936.0, "step": 38285 }, { "entropy": 5.356252002716064, "epoch": 2.979109122738767, "grad_norm": 1.140625, "learning_rate": 0.00041155023290223537, "loss": 4.8869, "mean_token_accuracy": 0.2110457330942154, "num_tokens": 66418444.0, "step": 38290 }, { "entropy": 5.346478080749511, "epoch": 2.979498152110484, "grad_norm": 1.1484375, "learning_rate": 0.0004115282039081788, "loss": 4.9364, "mean_token_accuracy": 0.20627668499946594, "num_tokens": 66427211.0, "step": 38295 }, { "entropy": 5.350663375854492, "epoch": 2.979887181482202, "grad_norm": 1.09375, "learning_rate": 0.00041150617284252405, "loss": 4.9144, "mean_token_accuracy": 0.20945375859737397, "num_tokens": 66435767.0, "step": 38300 }, { "entropy": 5.420959854125977, "epoch": 2.9802762108539196, "grad_norm": 1.203125, "learning_rate": 0.0004114841397056053, "loss": 4.9681, "mean_token_accuracy": 0.1968962788581848, "num_tokens": 66443647.0, "step": 38305 }, { "entropy": 5.357402706146241, "epoch": 2.980665240225637, "grad_norm": 1.1328125, "learning_rate": 0.00041146210449775704, "loss": 4.9147, "mean_token_accuracy": 0.20758935064077377, "num_tokens": 66452011.0, "step": 38310 }, { "entropy": 5.431408214569092, "epoch": 2.9810542695973545, "grad_norm": 1.109375, "learning_rate": 0.0004114400672193136, "loss": 5.0179, "mean_token_accuracy": 0.1949569046497345, "num_tokens": 66460151.0, "step": 38315 }, { "entropy": 5.443654155731201, "epoch": 2.9814432989690722, "grad_norm": 1.171875, "learning_rate": 0.00041141802787060923, "loss": 4.9999, "mean_token_accuracy": 0.20273821651935578, "num_tokens": 66468409.0, "step": 38320 }, { "entropy": 5.4179483413696286, "epoch": 2.98183232834079, "grad_norm": 1.1796875, "learning_rate": 0.0004113959864519784, "loss": 5.0791, "mean_token_accuracy": 0.1896918535232544, "num_tokens": 66477765.0, "step": 38325 }, { "entropy": 5.45331039428711, "epoch": 2.982221357712507, "grad_norm": 1.1171875, "learning_rate": 0.0004113739429637556, "loss": 5.0787, "mean_token_accuracy": 0.19466610997915268, "num_tokens": 66486726.0, "step": 38330 }, { "entropy": 5.4840254306793215, "epoch": 2.982610387084225, "grad_norm": 1.1640625, "learning_rate": 0.0004113518974062753, "loss": 5.032, "mean_token_accuracy": 0.1924159497022629, "num_tokens": 66495994.0, "step": 38335 }, { "entropy": 5.458738470077515, "epoch": 2.9829994164559426, "grad_norm": 1.1484375, "learning_rate": 0.000411329849779872, "loss": 5.0143, "mean_token_accuracy": 0.19422049522399903, "num_tokens": 66504515.0, "step": 38340 }, { "entropy": 5.350718259811401, "epoch": 2.98338844582766, "grad_norm": 1.078125, "learning_rate": 0.00041130780008488015, "loss": 4.8964, "mean_token_accuracy": 0.20535831898450851, "num_tokens": 66513637.0, "step": 38345 }, { "entropy": 5.332370948791504, "epoch": 2.9837774751993775, "grad_norm": 1.1484375, "learning_rate": 0.0004112857483216344, "loss": 4.8669, "mean_token_accuracy": 0.2118707627058029, "num_tokens": 66521453.0, "step": 38350 }, { "entropy": 5.2376385688781735, "epoch": 2.9841665045710952, "grad_norm": 1.1875, "learning_rate": 0.00041126369449046935, "loss": 4.7757, "mean_token_accuracy": 0.2203754186630249, "num_tokens": 66530888.0, "step": 38355 }, { "entropy": 5.380611181259155, "epoch": 2.984555533942813, "grad_norm": 1.234375, "learning_rate": 0.00041124163859171967, "loss": 5.037, "mean_token_accuracy": 0.19566044509410857, "num_tokens": 66538758.0, "step": 38360 }, { "entropy": 5.435381174087524, "epoch": 2.98494456331453, "grad_norm": 1.15625, "learning_rate": 0.0004112195806257199, "loss": 5.0091, "mean_token_accuracy": 0.19955134242773057, "num_tokens": 66546981.0, "step": 38365 }, { "entropy": 5.405702543258667, "epoch": 2.985333592686248, "grad_norm": 1.1640625, "learning_rate": 0.0004111975205928049, "loss": 4.9648, "mean_token_accuracy": 0.2003589853644371, "num_tokens": 66555375.0, "step": 38370 }, { "entropy": 5.385578584671021, "epoch": 2.985722622057965, "grad_norm": 1.09375, "learning_rate": 0.00041117545849330924, "loss": 4.9416, "mean_token_accuracy": 0.20266453325748443, "num_tokens": 66564581.0, "step": 38375 }, { "entropy": 5.346369504928589, "epoch": 2.986111651429683, "grad_norm": 1.171875, "learning_rate": 0.00041115339432756776, "loss": 4.9908, "mean_token_accuracy": 0.19918077439069748, "num_tokens": 66573876.0, "step": 38380 }, { "entropy": 5.380865907669067, "epoch": 2.9865006808014005, "grad_norm": 1.15625, "learning_rate": 0.0004111313280959152, "loss": 4.9876, "mean_token_accuracy": 0.21135186403989792, "num_tokens": 66582039.0, "step": 38385 }, { "entropy": 5.333020305633545, "epoch": 2.986889710173118, "grad_norm": 1.1640625, "learning_rate": 0.00041110925979868647, "loss": 4.8673, "mean_token_accuracy": 0.21232945322990418, "num_tokens": 66590188.0, "step": 38390 }, { "entropy": 5.334687757492065, "epoch": 2.9872787395448355, "grad_norm": 1.1328125, "learning_rate": 0.0004110871894362163, "loss": 4.9455, "mean_token_accuracy": 0.2013239547610283, "num_tokens": 66598889.0, "step": 38395 }, { "entropy": 5.365055894851684, "epoch": 2.987667768916553, "grad_norm": 1.1171875, "learning_rate": 0.00041106511700883975, "loss": 4.9519, "mean_token_accuracy": 0.20141951143741607, "num_tokens": 66606909.0, "step": 38400 }, { "entropy": 5.396669578552246, "epoch": 2.988056798288271, "grad_norm": 1.15625, "learning_rate": 0.00041104304251689147, "loss": 4.972, "mean_token_accuracy": 0.2027745798230171, "num_tokens": 66615644.0, "step": 38405 }, { "entropy": 5.45669116973877, "epoch": 2.988445827659988, "grad_norm": 1.09375, "learning_rate": 0.00041102096596070666, "loss": 5.1039, "mean_token_accuracy": 0.19714124202728273, "num_tokens": 66624466.0, "step": 38410 }, { "entropy": 5.490889167785644, "epoch": 2.988834857031706, "grad_norm": 1.078125, "learning_rate": 0.00041099888734062013, "loss": 5.124, "mean_token_accuracy": 0.19706136882305145, "num_tokens": 66633907.0, "step": 38415 }, { "entropy": 5.438182592391968, "epoch": 2.9892238864034235, "grad_norm": 1.1484375, "learning_rate": 0.000410976806656967, "loss": 5.0653, "mean_token_accuracy": 0.2002486914396286, "num_tokens": 66643652.0, "step": 38420 }, { "entropy": 5.420694732666016, "epoch": 2.989612915775141, "grad_norm": 1.09375, "learning_rate": 0.0004109547239100822, "loss": 4.9951, "mean_token_accuracy": 0.20185774564743042, "num_tokens": 66652440.0, "step": 38425 }, { "entropy": 5.388789510726928, "epoch": 2.9900019451468585, "grad_norm": 1.140625, "learning_rate": 0.0004109326391003009, "loss": 4.9322, "mean_token_accuracy": 0.20394351333379745, "num_tokens": 66661660.0, "step": 38430 }, { "entropy": 5.419493579864502, "epoch": 2.990390974518576, "grad_norm": 1.2734375, "learning_rate": 0.00041091055222795814, "loss": 4.9586, "mean_token_accuracy": 0.20560043603181838, "num_tokens": 66670289.0, "step": 38435 }, { "entropy": 5.407018852233887, "epoch": 2.990780003890294, "grad_norm": 1.125, "learning_rate": 0.0004108884632933891, "loss": 4.9847, "mean_token_accuracy": 0.20684262365102768, "num_tokens": 66679777.0, "step": 38440 }, { "entropy": 5.476563882827759, "epoch": 2.991169033262011, "grad_norm": 1.171875, "learning_rate": 0.00041086637229692893, "loss": 4.9956, "mean_token_accuracy": 0.19661099463701248, "num_tokens": 66689264.0, "step": 38445 }, { "entropy": 5.420726203918457, "epoch": 2.991558062633729, "grad_norm": 1.1484375, "learning_rate": 0.00041084427923891275, "loss": 5.0124, "mean_token_accuracy": 0.2009250059723854, "num_tokens": 66697632.0, "step": 38450 }, { "entropy": 5.37018051147461, "epoch": 2.9919470920054465, "grad_norm": 1.09375, "learning_rate": 0.00041082218411967586, "loss": 4.9628, "mean_token_accuracy": 0.19962136894464494, "num_tokens": 66706312.0, "step": 38455 }, { "entropy": 5.424208450317383, "epoch": 2.992336121377164, "grad_norm": 1.1484375, "learning_rate": 0.00041080008693955355, "loss": 4.9168, "mean_token_accuracy": 0.20134995132684708, "num_tokens": 66714322.0, "step": 38460 }, { "entropy": 5.32239875793457, "epoch": 2.9927251507488815, "grad_norm": 1.1015625, "learning_rate": 0.0004107779876988811, "loss": 4.9388, "mean_token_accuracy": 0.20026778131723405, "num_tokens": 66723039.0, "step": 38465 }, { "entropy": 5.3899181365966795, "epoch": 2.993114180120599, "grad_norm": 1.1875, "learning_rate": 0.00041075588639799375, "loss": 4.9459, "mean_token_accuracy": 0.2114546686410904, "num_tokens": 66731414.0, "step": 38470 }, { "entropy": 5.4143274307250975, "epoch": 2.9935032094923164, "grad_norm": 1.109375, "learning_rate": 0.0004107337830372269, "loss": 4.9518, "mean_token_accuracy": 0.20306631028652192, "num_tokens": 66740664.0, "step": 38475 }, { "entropy": 5.347423315048218, "epoch": 2.993892238864034, "grad_norm": 1.1328125, "learning_rate": 0.000410711677616916, "loss": 4.8859, "mean_token_accuracy": 0.19792909324169158, "num_tokens": 66749073.0, "step": 38480 }, { "entropy": 5.311897802352905, "epoch": 2.994281268235752, "grad_norm": 1.1328125, "learning_rate": 0.0004106895701373963, "loss": 4.9408, "mean_token_accuracy": 0.20299936980009078, "num_tokens": 66757734.0, "step": 38485 }, { "entropy": 5.344456911087036, "epoch": 2.9946702976074695, "grad_norm": 1.078125, "learning_rate": 0.00041066746059900336, "loss": 4.9175, "mean_token_accuracy": 0.1996750771999359, "num_tokens": 66766699.0, "step": 38490 }, { "entropy": 5.369357872009277, "epoch": 2.995059326979187, "grad_norm": 1.09375, "learning_rate": 0.0004106453490020727, "loss": 5.0767, "mean_token_accuracy": 0.19289746582508088, "num_tokens": 66775398.0, "step": 38495 }, { "entropy": 5.337516641616821, "epoch": 2.9954483563509045, "grad_norm": 1.1953125, "learning_rate": 0.00041062323534693973, "loss": 4.8621, "mean_token_accuracy": 0.20904262065887452, "num_tokens": 66783157.0, "step": 38500 }, { "entropy": 5.311770391464234, "epoch": 2.995837385722622, "grad_norm": 1.171875, "learning_rate": 0.00041060111963394004, "loss": 4.9647, "mean_token_accuracy": 0.19998246133327485, "num_tokens": 66791293.0, "step": 38505 }, { "entropy": 5.2920369625091555, "epoch": 2.9962264150943394, "grad_norm": 1.09375, "learning_rate": 0.00041057900186340917, "loss": 4.8721, "mean_token_accuracy": 0.20782489478588104, "num_tokens": 66800212.0, "step": 38510 }, { "entropy": 5.497542667388916, "epoch": 2.996615444466057, "grad_norm": 1.1953125, "learning_rate": 0.00041055688203568274, "loss": 5.0456, "mean_token_accuracy": 0.1956419438123703, "num_tokens": 66808050.0, "step": 38515 }, { "entropy": 5.424835872650147, "epoch": 2.997004473837775, "grad_norm": 1.1875, "learning_rate": 0.0004105347601510964, "loss": 4.9504, "mean_token_accuracy": 0.21011705994606017, "num_tokens": 66816481.0, "step": 38520 }, { "entropy": 5.328875923156739, "epoch": 2.9973935032094925, "grad_norm": 1.21875, "learning_rate": 0.0004105126362099859, "loss": 4.9474, "mean_token_accuracy": 0.20159079283475875, "num_tokens": 66825294.0, "step": 38525 }, { "entropy": 5.357822322845459, "epoch": 2.9977825325812097, "grad_norm": 1.1171875, "learning_rate": 0.0004104905102126867, "loss": 4.9069, "mean_token_accuracy": 0.2029980644583702, "num_tokens": 66833818.0, "step": 38530 }, { "entropy": 5.435402917861938, "epoch": 2.9981715619529274, "grad_norm": 1.109375, "learning_rate": 0.0004104683821595347, "loss": 5.0168, "mean_token_accuracy": 0.19405477643013, "num_tokens": 66842604.0, "step": 38535 }, { "entropy": 5.453289270401001, "epoch": 2.998560591324645, "grad_norm": 1.1015625, "learning_rate": 0.00041044625205086566, "loss": 5.0817, "mean_token_accuracy": 0.19854393154382705, "num_tokens": 66850974.0, "step": 38540 }, { "entropy": 5.3967334747314455, "epoch": 2.9989496206963624, "grad_norm": 1.0390625, "learning_rate": 0.00041042411988701535, "loss": 4.9243, "mean_token_accuracy": 0.21168268471956253, "num_tokens": 66859671.0, "step": 38545 }, { "entropy": 5.410159921646118, "epoch": 2.99933865006808, "grad_norm": 1.1015625, "learning_rate": 0.00041040198566831944, "loss": 5.007, "mean_token_accuracy": 0.20219929665327072, "num_tokens": 66868864.0, "step": 38550 }, { "entropy": 5.320473957061767, "epoch": 2.999727679439798, "grad_norm": 1.078125, "learning_rate": 0.0004103798493951141, "loss": 4.9439, "mean_token_accuracy": 0.20341742634773255, "num_tokens": 66877547.0, "step": 38555 }, { "entropy": 5.36516793568929, "epoch": 3.0000778058743434, "grad_norm": 1.09375, "learning_rate": 0.00041035771106773483, "loss": 4.8523, "mean_token_accuracy": 0.2093366781870524, "num_tokens": 66884854.0, "step": 38560 }, { "entropy": 5.421144628524781, "epoch": 3.000466835246061, "grad_norm": 1.1796875, "learning_rate": 0.0004103355706865179, "loss": 4.8901, "mean_token_accuracy": 0.19692652374505998, "num_tokens": 66893963.0, "step": 38565 }, { "entropy": 5.311478090286255, "epoch": 3.0008558646177788, "grad_norm": 1.1015625, "learning_rate": 0.000410313428251799, "loss": 4.8479, "mean_token_accuracy": 0.2020140618085861, "num_tokens": 66902788.0, "step": 38570 }, { "entropy": 5.378206491470337, "epoch": 3.001244893989496, "grad_norm": 1.25, "learning_rate": 0.00041029128376391424, "loss": 4.9348, "mean_token_accuracy": 0.20524081736803054, "num_tokens": 66912294.0, "step": 38575 }, { "entropy": 5.335737466812134, "epoch": 3.0016339233612137, "grad_norm": 1.1015625, "learning_rate": 0.00041026913722319954, "loss": 4.7983, "mean_token_accuracy": 0.21404553055763245, "num_tokens": 66920080.0, "step": 38580 }, { "entropy": 5.3069007396698, "epoch": 3.0020229527329314, "grad_norm": 1.15625, "learning_rate": 0.000410246988629991, "loss": 4.8393, "mean_token_accuracy": 0.20780400335788726, "num_tokens": 66928404.0, "step": 38585 }, { "entropy": 5.387386894226074, "epoch": 3.002411982104649, "grad_norm": 1.1171875, "learning_rate": 0.00041022483798462466, "loss": 4.9528, "mean_token_accuracy": 0.20186459869146348, "num_tokens": 66938040.0, "step": 38590 }, { "entropy": 5.407912349700927, "epoch": 3.0028010114763664, "grad_norm": 1.1328125, "learning_rate": 0.0004102026852874367, "loss": 4.918, "mean_token_accuracy": 0.21327041685581208, "num_tokens": 66946605.0, "step": 38595 }, { "entropy": 5.417638301849365, "epoch": 3.003190040848084, "grad_norm": 1.1171875, "learning_rate": 0.00041018053053876316, "loss": 4.9329, "mean_token_accuracy": 0.20908523350954056, "num_tokens": 66955276.0, "step": 38600 }, { "entropy": 5.441386079788208, "epoch": 3.0035790702198017, "grad_norm": 1.203125, "learning_rate": 0.0004101583737389402, "loss": 4.9035, "mean_token_accuracy": 0.2020650878548622, "num_tokens": 66963950.0, "step": 38605 }, { "entropy": 5.3821440696716305, "epoch": 3.003968099591519, "grad_norm": 1.09375, "learning_rate": 0.00041013621488830406, "loss": 4.8666, "mean_token_accuracy": 0.20635460764169694, "num_tokens": 66972101.0, "step": 38610 }, { "entropy": 5.294893550872803, "epoch": 3.0043571289632367, "grad_norm": 1.1484375, "learning_rate": 0.00041011405398719096, "loss": 4.8051, "mean_token_accuracy": 0.20820271223783493, "num_tokens": 66981251.0, "step": 38615 }, { "entropy": 5.442904710769653, "epoch": 3.0047461583349544, "grad_norm": 1.140625, "learning_rate": 0.00041009189103593716, "loss": 4.9227, "mean_token_accuracy": 0.2072306215763092, "num_tokens": 66990292.0, "step": 38620 }, { "entropy": 5.432159280776977, "epoch": 3.0051351877066717, "grad_norm": 1.1484375, "learning_rate": 0.0004100697260348789, "loss": 4.9623, "mean_token_accuracy": 0.20261773318052292, "num_tokens": 66999699.0, "step": 38625 }, { "entropy": 5.384227132797241, "epoch": 3.0055242170783893, "grad_norm": 1.1171875, "learning_rate": 0.00041004755898435254, "loss": 4.8466, "mean_token_accuracy": 0.20569859594106674, "num_tokens": 67008272.0, "step": 38630 }, { "entropy": 5.314862632751465, "epoch": 3.005913246450107, "grad_norm": 1.109375, "learning_rate": 0.0004100253898846945, "loss": 4.8961, "mean_token_accuracy": 0.20325679332017899, "num_tokens": 67016865.0, "step": 38635 }, { "entropy": 5.375717401504517, "epoch": 3.0063022758218247, "grad_norm": 1.21875, "learning_rate": 0.000410003218736241, "loss": 4.9081, "mean_token_accuracy": 0.20962373465299605, "num_tokens": 67025791.0, "step": 38640 }, { "entropy": 5.31078839302063, "epoch": 3.006691305193542, "grad_norm": 1.0078125, "learning_rate": 0.00040998104553932856, "loss": 4.7957, "mean_token_accuracy": 0.20929372906684876, "num_tokens": 67034872.0, "step": 38645 }, { "entropy": 5.319442844390869, "epoch": 3.0070803345652597, "grad_norm": 1.1953125, "learning_rate": 0.0004099588702942936, "loss": 4.8828, "mean_token_accuracy": 0.20637225210666657, "num_tokens": 67043350.0, "step": 38650 }, { "entropy": 5.353558588027954, "epoch": 3.0074693639369774, "grad_norm": 1.1796875, "learning_rate": 0.00040993669300147257, "loss": 4.9593, "mean_token_accuracy": 0.20271400064229966, "num_tokens": 67051593.0, "step": 38655 }, { "entropy": 5.433165407180786, "epoch": 3.0078583933086946, "grad_norm": 1.15625, "learning_rate": 0.00040991451366120205, "loss": 4.9545, "mean_token_accuracy": 0.20145209282636642, "num_tokens": 67060024.0, "step": 38660 }, { "entropy": 5.5142662048339846, "epoch": 3.0082474226804123, "grad_norm": 1.1875, "learning_rate": 0.0004098923322738185, "loss": 5.0027, "mean_token_accuracy": 0.2021059662103653, "num_tokens": 67069136.0, "step": 38665 }, { "entropy": 5.2748268127441404, "epoch": 3.00863645205213, "grad_norm": 1.390625, "learning_rate": 0.00040987014883965843, "loss": 4.7412, "mean_token_accuracy": 0.21629730015993118, "num_tokens": 67078209.0, "step": 38670 }, { "entropy": 5.274156332015991, "epoch": 3.0090254814238473, "grad_norm": 1.0546875, "learning_rate": 0.00040984796335905867, "loss": 4.8621, "mean_token_accuracy": 0.20710614174604416, "num_tokens": 67087676.0, "step": 38675 }, { "entropy": 5.376067113876343, "epoch": 3.009414510795565, "grad_norm": 1.1171875, "learning_rate": 0.0004098257758323556, "loss": 4.9415, "mean_token_accuracy": 0.20264537632465363, "num_tokens": 67096730.0, "step": 38680 }, { "entropy": 5.518951940536499, "epoch": 3.0098035401672827, "grad_norm": 1.1953125, "learning_rate": 0.0004098035862598859, "loss": 5.0267, "mean_token_accuracy": 0.19334909468889236, "num_tokens": 67106017.0, "step": 38685 }, { "entropy": 5.374785089492798, "epoch": 3.0101925695390004, "grad_norm": 1.125, "learning_rate": 0.0004097813946419865, "loss": 4.7811, "mean_token_accuracy": 0.21477905362844468, "num_tokens": 67114708.0, "step": 38690 }, { "entropy": 5.367517375946045, "epoch": 3.0105815989107176, "grad_norm": 1.09375, "learning_rate": 0.0004097592009789939, "loss": 4.9268, "mean_token_accuracy": 0.1958172455430031, "num_tokens": 67124257.0, "step": 38695 }, { "entropy": 5.402484989166259, "epoch": 3.0109706282824353, "grad_norm": 1.0546875, "learning_rate": 0.00040973700527124494, "loss": 4.9219, "mean_token_accuracy": 0.19898533970117568, "num_tokens": 67133066.0, "step": 38700 }, { "entropy": 5.454821968078614, "epoch": 3.011359657654153, "grad_norm": 1.265625, "learning_rate": 0.00040971480751907633, "loss": 4.9179, "mean_token_accuracy": 0.2036113455891609, "num_tokens": 67141906.0, "step": 38705 }, { "entropy": 5.393882608413696, "epoch": 3.0117486870258703, "grad_norm": 1.1953125, "learning_rate": 0.00040969260772282494, "loss": 4.8748, "mean_token_accuracy": 0.203598515689373, "num_tokens": 67150533.0, "step": 38710 }, { "entropy": 5.386877918243409, "epoch": 3.012137716397588, "grad_norm": 1.1484375, "learning_rate": 0.0004096704058828277, "loss": 4.9031, "mean_token_accuracy": 0.20711033046245575, "num_tokens": 67159130.0, "step": 38715 }, { "entropy": 5.393054056167602, "epoch": 3.0125267457693057, "grad_norm": 1.1953125, "learning_rate": 0.00040964820199942135, "loss": 4.8315, "mean_token_accuracy": 0.21248968839645385, "num_tokens": 67168075.0, "step": 38720 }, { "entropy": 5.41006236076355, "epoch": 3.012915775141023, "grad_norm": 1.21875, "learning_rate": 0.0004096259960729428, "loss": 4.8822, "mean_token_accuracy": 0.21490530669689178, "num_tokens": 67176972.0, "step": 38725 }, { "entropy": 5.410172939300537, "epoch": 3.0133048045127406, "grad_norm": 1.140625, "learning_rate": 0.00040960378810372906, "loss": 4.9664, "mean_token_accuracy": 0.20212098211050034, "num_tokens": 67185091.0, "step": 38730 }, { "entropy": 5.3608965396881105, "epoch": 3.0136938338844583, "grad_norm": 1.3046875, "learning_rate": 0.0004095815780921171, "loss": 4.8964, "mean_token_accuracy": 0.21032601445913315, "num_tokens": 67193345.0, "step": 38735 }, { "entropy": 5.321224212646484, "epoch": 3.014082863256176, "grad_norm": 1.1875, "learning_rate": 0.0004095593660384439, "loss": 4.8204, "mean_token_accuracy": 0.21454232633113862, "num_tokens": 67201893.0, "step": 38740 }, { "entropy": 5.424612522125244, "epoch": 3.0144718926278933, "grad_norm": 1.2109375, "learning_rate": 0.0004095371519430465, "loss": 4.9915, "mean_token_accuracy": 0.2006002515554428, "num_tokens": 67211112.0, "step": 38745 }, { "entropy": 5.3595709800720215, "epoch": 3.014860921999611, "grad_norm": 1.125, "learning_rate": 0.00040951493580626195, "loss": 4.7966, "mean_token_accuracy": 0.2097976341843605, "num_tokens": 67220078.0, "step": 38750 }, { "entropy": 5.352951097488403, "epoch": 3.0152499513713287, "grad_norm": 1.140625, "learning_rate": 0.0004094927176284273, "loss": 4.9317, "mean_token_accuracy": 0.20370444655418396, "num_tokens": 67228883.0, "step": 38755 }, { "entropy": 5.447063016891479, "epoch": 3.015638980743046, "grad_norm": 1.1953125, "learning_rate": 0.00040947049740987977, "loss": 4.9989, "mean_token_accuracy": 0.19562507718801497, "num_tokens": 67237377.0, "step": 38760 }, { "entropy": 5.364328050613404, "epoch": 3.0160280101147636, "grad_norm": 1.09375, "learning_rate": 0.0004094482751509565, "loss": 4.8428, "mean_token_accuracy": 0.2077786237001419, "num_tokens": 67245488.0, "step": 38765 }, { "entropy": 5.342042255401611, "epoch": 3.0164170394864813, "grad_norm": 1.1484375, "learning_rate": 0.0004094260508519947, "loss": 4.8691, "mean_token_accuracy": 0.21616282761096955, "num_tokens": 67253791.0, "step": 38770 }, { "entropy": 5.283930492401123, "epoch": 3.0168060688581986, "grad_norm": 1.2421875, "learning_rate": 0.00040940382451333144, "loss": 4.815, "mean_token_accuracy": 0.2101530283689499, "num_tokens": 67262373.0, "step": 38775 }, { "entropy": 5.300125980377198, "epoch": 3.0171950982299163, "grad_norm": 1.2734375, "learning_rate": 0.00040938159613530405, "loss": 4.831, "mean_token_accuracy": 0.21318756490945817, "num_tokens": 67270946.0, "step": 38780 }, { "entropy": 5.39377875328064, "epoch": 3.017584127601634, "grad_norm": 1.15625, "learning_rate": 0.0004093593657182499, "loss": 4.9544, "mean_token_accuracy": 0.20606863647699356, "num_tokens": 67280150.0, "step": 38785 }, { "entropy": 5.467695569992065, "epoch": 3.0179731569733517, "grad_norm": 1.1171875, "learning_rate": 0.0004093371332625062, "loss": 4.8735, "mean_token_accuracy": 0.20999743789434433, "num_tokens": 67288109.0, "step": 38790 }, { "entropy": 5.314780282974243, "epoch": 3.018362186345069, "grad_norm": 1.1171875, "learning_rate": 0.0004093148987684103, "loss": 4.8275, "mean_token_accuracy": 0.20847830474376677, "num_tokens": 67296538.0, "step": 38795 }, { "entropy": 5.340438461303711, "epoch": 3.0187512157167866, "grad_norm": 1.125, "learning_rate": 0.00040929266223629966, "loss": 4.8447, "mean_token_accuracy": 0.20686030387878418, "num_tokens": 67306088.0, "step": 38800 }, { "entropy": 5.357239437103272, "epoch": 3.0191402450885043, "grad_norm": 1.140625, "learning_rate": 0.00040927042366651164, "loss": 4.8695, "mean_token_accuracy": 0.20415499061346054, "num_tokens": 67315101.0, "step": 38805 }, { "entropy": 5.297847700119019, "epoch": 3.0195292744602216, "grad_norm": 1.1640625, "learning_rate": 0.00040924818305938354, "loss": 4.7908, "mean_token_accuracy": 0.2102730467915535, "num_tokens": 67323309.0, "step": 38810 }, { "entropy": 5.361377286911011, "epoch": 3.0199183038319393, "grad_norm": 1.1875, "learning_rate": 0.00040922594041525303, "loss": 4.9319, "mean_token_accuracy": 0.20306951254606248, "num_tokens": 67331893.0, "step": 38815 }, { "entropy": 5.2935832977294925, "epoch": 3.020307333203657, "grad_norm": 1.1796875, "learning_rate": 0.0004092036957344574, "loss": 4.8043, "mean_token_accuracy": 0.21503401398658753, "num_tokens": 67339804.0, "step": 38820 }, { "entropy": 5.339497804641724, "epoch": 3.0206963625753747, "grad_norm": 1.125, "learning_rate": 0.00040918144901733443, "loss": 4.8466, "mean_token_accuracy": 0.2111998289823532, "num_tokens": 67348306.0, "step": 38825 }, { "entropy": 5.391669225692749, "epoch": 3.021085391947092, "grad_norm": 1.078125, "learning_rate": 0.0004091592002642215, "loss": 4.9183, "mean_token_accuracy": 0.20186142176389693, "num_tokens": 67356601.0, "step": 38830 }, { "entropy": 5.285781335830689, "epoch": 3.0214744213188096, "grad_norm": 1.15625, "learning_rate": 0.0004091369494754562, "loss": 4.8705, "mean_token_accuracy": 0.2093329533934593, "num_tokens": 67364990.0, "step": 38835 }, { "entropy": 5.44060001373291, "epoch": 3.0218634506905273, "grad_norm": 1.1484375, "learning_rate": 0.0004091146966513763, "loss": 4.9452, "mean_token_accuracy": 0.20239161998033522, "num_tokens": 67373165.0, "step": 38840 }, { "entropy": 5.403328990936279, "epoch": 3.0222524800622446, "grad_norm": 1.2578125, "learning_rate": 0.00040909244179231926, "loss": 4.9279, "mean_token_accuracy": 0.20034720748662949, "num_tokens": 67381627.0, "step": 38845 }, { "entropy": 5.303368186950683, "epoch": 3.0226415094339623, "grad_norm": 1.1328125, "learning_rate": 0.0004090701848986229, "loss": 4.7896, "mean_token_accuracy": 0.21321910619735718, "num_tokens": 67389928.0, "step": 38850 }, { "entropy": 5.344474411010742, "epoch": 3.02303053880568, "grad_norm": 1.0546875, "learning_rate": 0.0004090479259706247, "loss": 4.8431, "mean_token_accuracy": 0.209566567838192, "num_tokens": 67398377.0, "step": 38855 }, { "entropy": 5.31518406867981, "epoch": 3.023419568177397, "grad_norm": 1.1640625, "learning_rate": 0.0004090256650086628, "loss": 4.761, "mean_token_accuracy": 0.2134068340063095, "num_tokens": 67406490.0, "step": 38860 }, { "entropy": 5.314701795578003, "epoch": 3.023808597549115, "grad_norm": 1.171875, "learning_rate": 0.00040900340201307475, "loss": 4.8686, "mean_token_accuracy": 0.2088356539607048, "num_tokens": 67415178.0, "step": 38865 }, { "entropy": 5.3110496520996096, "epoch": 3.0241976269208326, "grad_norm": 1.078125, "learning_rate": 0.00040898113698419823, "loss": 4.8866, "mean_token_accuracy": 0.20884716212749482, "num_tokens": 67423770.0, "step": 38870 }, { "entropy": 5.37125597000122, "epoch": 3.0245866562925503, "grad_norm": 1.2421875, "learning_rate": 0.0004089588699223713, "loss": 4.9701, "mean_token_accuracy": 0.20181357860565186, "num_tokens": 67432771.0, "step": 38875 }, { "entropy": 5.363561725616455, "epoch": 3.0249756856642676, "grad_norm": 1.109375, "learning_rate": 0.00040893660082793167, "loss": 4.9035, "mean_token_accuracy": 0.20304954499006272, "num_tokens": 67441697.0, "step": 38880 }, { "entropy": 5.390934038162231, "epoch": 3.0253647150359853, "grad_norm": 1.078125, "learning_rate": 0.00040891432970121736, "loss": 4.9809, "mean_token_accuracy": 0.194979690015316, "num_tokens": 67450950.0, "step": 38885 }, { "entropy": 5.333687210083008, "epoch": 3.025753744407703, "grad_norm": 1.0859375, "learning_rate": 0.00040889205654256615, "loss": 4.812, "mean_token_accuracy": 0.21041290163993837, "num_tokens": 67459863.0, "step": 38890 }, { "entropy": 5.397540283203125, "epoch": 3.02614277377942, "grad_norm": 1.140625, "learning_rate": 0.00040886978135231625, "loss": 4.8983, "mean_token_accuracy": 0.20955174863338472, "num_tokens": 67468829.0, "step": 38895 }, { "entropy": 5.323147869110107, "epoch": 3.026531803151138, "grad_norm": 1.1015625, "learning_rate": 0.00040884750413080535, "loss": 4.8122, "mean_token_accuracy": 0.2131826788187027, "num_tokens": 67477979.0, "step": 38900 }, { "entropy": 5.378287696838379, "epoch": 3.0269208325228556, "grad_norm": 1.125, "learning_rate": 0.00040882522487837176, "loss": 4.9376, "mean_token_accuracy": 0.20290352553129196, "num_tokens": 67486929.0, "step": 38905 }, { "entropy": 5.330934715270996, "epoch": 3.027309861894573, "grad_norm": 1.1015625, "learning_rate": 0.00040880294359535327, "loss": 4.8127, "mean_token_accuracy": 0.20899835079908372, "num_tokens": 67495434.0, "step": 38910 }, { "entropy": 5.374479818344116, "epoch": 3.0276988912662905, "grad_norm": 1.1953125, "learning_rate": 0.00040878066028208804, "loss": 4.8956, "mean_token_accuracy": 0.20191641598939897, "num_tokens": 67504437.0, "step": 38915 }, { "entropy": 5.328443574905395, "epoch": 3.0280879206380082, "grad_norm": 1.078125, "learning_rate": 0.00040875837493891434, "loss": 4.9074, "mean_token_accuracy": 0.20944027304649354, "num_tokens": 67512899.0, "step": 38920 }, { "entropy": 5.396648979187011, "epoch": 3.028476950009726, "grad_norm": 1.15625, "learning_rate": 0.0004087360875661701, "loss": 4.9399, "mean_token_accuracy": 0.19821995943784715, "num_tokens": 67521602.0, "step": 38925 }, { "entropy": 5.403042984008789, "epoch": 3.028865979381443, "grad_norm": 1.21875, "learning_rate": 0.00040871379816419376, "loss": 4.909, "mean_token_accuracy": 0.20549943149089814, "num_tokens": 67530808.0, "step": 38930 }, { "entropy": 5.436919832229615, "epoch": 3.029255008753161, "grad_norm": 1.1015625, "learning_rate": 0.0004086915067333232, "loss": 4.8586, "mean_token_accuracy": 0.20334610491991043, "num_tokens": 67539216.0, "step": 38935 }, { "entropy": 5.329461574554443, "epoch": 3.0296440381248786, "grad_norm": 1.1015625, "learning_rate": 0.0004086692132738968, "loss": 4.852, "mean_token_accuracy": 0.20223007649183272, "num_tokens": 67547202.0, "step": 38940 }, { "entropy": 5.406212186813354, "epoch": 3.030033067496596, "grad_norm": 1.046875, "learning_rate": 0.000408646917786253, "loss": 5.0343, "mean_token_accuracy": 0.19755114018917083, "num_tokens": 67556427.0, "step": 38945 }, { "entropy": 5.453958511352539, "epoch": 3.0304220968683135, "grad_norm": 1.171875, "learning_rate": 0.0004086246202707298, "loss": 4.9598, "mean_token_accuracy": 0.20237015336751937, "num_tokens": 67564945.0, "step": 38950 }, { "entropy": 5.438914775848389, "epoch": 3.0308111262400312, "grad_norm": 1.1875, "learning_rate": 0.00040860232072766577, "loss": 5.005, "mean_token_accuracy": 0.20529320538043977, "num_tokens": 67574336.0, "step": 38955 }, { "entropy": 5.428966379165649, "epoch": 3.0312001556117485, "grad_norm": 1.1171875, "learning_rate": 0.0004085800191573991, "loss": 4.9271, "mean_token_accuracy": 0.20519212037324905, "num_tokens": 67583628.0, "step": 38960 }, { "entropy": 5.378624153137207, "epoch": 3.031589184983466, "grad_norm": 1.296875, "learning_rate": 0.0004085577155602683, "loss": 4.8963, "mean_token_accuracy": 0.20692189186811447, "num_tokens": 67592462.0, "step": 38965 }, { "entropy": 5.404040718078614, "epoch": 3.031978214355184, "grad_norm": 1.09375, "learning_rate": 0.00040853540993661175, "loss": 4.8707, "mean_token_accuracy": 0.2100987493991852, "num_tokens": 67601377.0, "step": 38970 }, { "entropy": 5.275073385238647, "epoch": 3.0323672437269016, "grad_norm": 1.1640625, "learning_rate": 0.00040851310228676787, "loss": 4.772, "mean_token_accuracy": 0.215145543217659, "num_tokens": 67610253.0, "step": 38975 }, { "entropy": 5.322058868408203, "epoch": 3.032756273098619, "grad_norm": 1.15625, "learning_rate": 0.0004084907926110752, "loss": 4.9202, "mean_token_accuracy": 0.20278232991695405, "num_tokens": 67618092.0, "step": 38980 }, { "entropy": 5.343905687332153, "epoch": 3.0331453024703365, "grad_norm": 1.15625, "learning_rate": 0.0004084684809098722, "loss": 4.8529, "mean_token_accuracy": 0.21086602061986923, "num_tokens": 67626547.0, "step": 38985 }, { "entropy": 5.447866153717041, "epoch": 3.0335343318420542, "grad_norm": 1.125, "learning_rate": 0.00040844616718349743, "loss": 4.9869, "mean_token_accuracy": 0.1968732863664627, "num_tokens": 67635891.0, "step": 38990 }, { "entropy": 5.385292434692383, "epoch": 3.0339233612137715, "grad_norm": 1.1015625, "learning_rate": 0.00040842385143228946, "loss": 4.8402, "mean_token_accuracy": 0.20671410262584686, "num_tokens": 67645030.0, "step": 38995 }, { "entropy": 5.33613862991333, "epoch": 3.034312390585489, "grad_norm": 1.328125, "learning_rate": 0.00040840153365658693, "loss": 4.9105, "mean_token_accuracy": 0.20903646796941758, "num_tokens": 67652941.0, "step": 39000 }, { "epoch": 3.034312390585489, "eval_entropy": 5.113205782006404, "eval_loss": 5.0559210777282715, "eval_mean_token_accuracy": 0.20652723389536976, "eval_num_tokens": 67652941.0, "eval_runtime": 28.7579, "eval_samples_per_second": 1445.097, "eval_steps_per_second": 180.646, "step": 39000 }, { "entropy": 5.350287580490113, "epoch": 3.034701419957207, "grad_norm": 1.140625, "learning_rate": 0.00040837921385672855, "loss": 4.8354, "mean_token_accuracy": 0.20858560204505922, "num_tokens": 67661600.0, "step": 39005 }, { "entropy": 5.396736669540405, "epoch": 3.035090449328924, "grad_norm": 1.1484375, "learning_rate": 0.00040835689203305275, "loss": 4.9488, "mean_token_accuracy": 0.19933412373065948, "num_tokens": 67670317.0, "step": 39010 }, { "entropy": 5.337585306167602, "epoch": 3.035479478700642, "grad_norm": 1.140625, "learning_rate": 0.00040833456818589845, "loss": 4.8631, "mean_token_accuracy": 0.20599283576011657, "num_tokens": 67679065.0, "step": 39015 }, { "entropy": 5.377735233306884, "epoch": 3.0358685080723595, "grad_norm": 1.1484375, "learning_rate": 0.00040831224231560424, "loss": 4.8546, "mean_token_accuracy": 0.2172616735100746, "num_tokens": 67687724.0, "step": 39020 }, { "entropy": 5.3365734100341795, "epoch": 3.0362575374440772, "grad_norm": 1.1484375, "learning_rate": 0.000408289914422509, "loss": 4.8566, "mean_token_accuracy": 0.21153998672962188, "num_tokens": 67695846.0, "step": 39025 }, { "entropy": 5.381910514831543, "epoch": 3.0366465668157945, "grad_norm": 1.1875, "learning_rate": 0.0004082675845069515, "loss": 4.8807, "mean_token_accuracy": 0.21139136105775833, "num_tokens": 67704675.0, "step": 39030 }, { "entropy": 5.365243911743164, "epoch": 3.037035596187512, "grad_norm": 1.1328125, "learning_rate": 0.0004082452525692704, "loss": 4.8431, "mean_token_accuracy": 0.21302517652511596, "num_tokens": 67713836.0, "step": 39035 }, { "entropy": 5.324962997436524, "epoch": 3.03742462555923, "grad_norm": 1.1796875, "learning_rate": 0.00040822291860980484, "loss": 4.8795, "mean_token_accuracy": 0.20974415838718413, "num_tokens": 67722920.0, "step": 39040 }, { "entropy": 5.3505021095275875, "epoch": 3.037813654930947, "grad_norm": 1.1171875, "learning_rate": 0.00040820058262889343, "loss": 4.945, "mean_token_accuracy": 0.2067013993859291, "num_tokens": 67732285.0, "step": 39045 }, { "entropy": 5.435254144668579, "epoch": 3.038202684302665, "grad_norm": 1.1875, "learning_rate": 0.00040817824462687516, "loss": 4.868, "mean_token_accuracy": 0.21356982439756395, "num_tokens": 67739836.0, "step": 39050 }, { "entropy": 5.314601135253906, "epoch": 3.0385917136743825, "grad_norm": 1.296875, "learning_rate": 0.00040815590460408906, "loss": 4.8494, "mean_token_accuracy": 0.20694127678871155, "num_tokens": 67748833.0, "step": 39055 }, { "entropy": 5.248241901397705, "epoch": 3.0389807430460998, "grad_norm": 1.1796875, "learning_rate": 0.00040813356256087395, "loss": 4.7656, "mean_token_accuracy": 0.21697914153337478, "num_tokens": 67756778.0, "step": 39060 }, { "entropy": 5.390316534042358, "epoch": 3.0393697724178175, "grad_norm": 1.15625, "learning_rate": 0.0004081112184975691, "loss": 4.8888, "mean_token_accuracy": 0.20254572629928588, "num_tokens": 67765691.0, "step": 39065 }, { "entropy": 5.3137260437011715, "epoch": 3.039758801789535, "grad_norm": 1.1640625, "learning_rate": 0.0004080888724145132, "loss": 4.8023, "mean_token_accuracy": 0.21399228423833846, "num_tokens": 67774685.0, "step": 39070 }, { "entropy": 5.346880578994751, "epoch": 3.040147831161253, "grad_norm": 1.203125, "learning_rate": 0.0004080665243120456, "loss": 4.966, "mean_token_accuracy": 0.19960699528455733, "num_tokens": 67783928.0, "step": 39075 }, { "entropy": 5.382338285446167, "epoch": 3.04053686053297, "grad_norm": 1.140625, "learning_rate": 0.0004080441741905053, "loss": 4.8872, "mean_token_accuracy": 0.21014311760663987, "num_tokens": 67792793.0, "step": 39080 }, { "entropy": 5.368513488769532, "epoch": 3.040925889904688, "grad_norm": 1.171875, "learning_rate": 0.0004080218220502314, "loss": 4.8743, "mean_token_accuracy": 0.2098890721797943, "num_tokens": 67801648.0, "step": 39085 }, { "entropy": 5.438955354690552, "epoch": 3.0413149192764055, "grad_norm": 1.09375, "learning_rate": 0.00040799946789156304, "loss": 5.0108, "mean_token_accuracy": 0.19016854614019393, "num_tokens": 67810390.0, "step": 39090 }, { "entropy": 5.3781956195831295, "epoch": 3.0417039486481228, "grad_norm": 1.0859375, "learning_rate": 0.00040797711171483954, "loss": 4.8545, "mean_token_accuracy": 0.20942164212465286, "num_tokens": 67819091.0, "step": 39095 }, { "entropy": 5.388621234893799, "epoch": 3.0420929780198405, "grad_norm": 1.140625, "learning_rate": 0.0004079547535203999, "loss": 4.8963, "mean_token_accuracy": 0.20105807334184647, "num_tokens": 67827901.0, "step": 39100 }, { "entropy": 5.368036079406738, "epoch": 3.042482007391558, "grad_norm": 1.171875, "learning_rate": 0.0004079323933085836, "loss": 4.8627, "mean_token_accuracy": 0.20998878479003907, "num_tokens": 67836221.0, "step": 39105 }, { "entropy": 5.384793758392334, "epoch": 3.0428710367632754, "grad_norm": 1.0703125, "learning_rate": 0.00040791003107972976, "loss": 4.9343, "mean_token_accuracy": 0.2035637229681015, "num_tokens": 67845565.0, "step": 39110 }, { "entropy": 5.406043863296508, "epoch": 3.043260066134993, "grad_norm": 1.1875, "learning_rate": 0.0004078876668341778, "loss": 4.9866, "mean_token_accuracy": 0.20261608213186263, "num_tokens": 67854433.0, "step": 39115 }, { "entropy": 5.40343542098999, "epoch": 3.043649095506711, "grad_norm": 1.1640625, "learning_rate": 0.0004078653005722669, "loss": 4.8605, "mean_token_accuracy": 0.2104961797595024, "num_tokens": 67862511.0, "step": 39120 }, { "entropy": 5.387297296524048, "epoch": 3.0440381248784285, "grad_norm": 1.109375, "learning_rate": 0.0004078429322943366, "loss": 4.8825, "mean_token_accuracy": 0.20340321958065033, "num_tokens": 67871145.0, "step": 39125 }, { "entropy": 5.27274751663208, "epoch": 3.0444271542501458, "grad_norm": 1.109375, "learning_rate": 0.00040782056200072627, "loss": 4.8138, "mean_token_accuracy": 0.21231719255447387, "num_tokens": 67879377.0, "step": 39130 }, { "entropy": 5.303968811035157, "epoch": 3.0448161836218635, "grad_norm": 1.1484375, "learning_rate": 0.00040779818969177527, "loss": 4.8121, "mean_token_accuracy": 0.21548170894384383, "num_tokens": 67888073.0, "step": 39135 }, { "entropy": 5.414448547363281, "epoch": 3.045205212993581, "grad_norm": 1.1484375, "learning_rate": 0.00040777581536782315, "loss": 4.9558, "mean_token_accuracy": 0.1991024613380432, "num_tokens": 67896426.0, "step": 39140 }, { "entropy": 5.356995582580566, "epoch": 3.0455942423652984, "grad_norm": 1.09375, "learning_rate": 0.0004077534390292093, "loss": 4.831, "mean_token_accuracy": 0.21296161264181138, "num_tokens": 67904744.0, "step": 39145 }, { "entropy": 5.322750806808472, "epoch": 3.045983271737016, "grad_norm": 1.2578125, "learning_rate": 0.00040773106067627335, "loss": 4.8225, "mean_token_accuracy": 0.20914295315742493, "num_tokens": 67912893.0, "step": 39150 }, { "entropy": 5.33179497718811, "epoch": 3.046372301108734, "grad_norm": 1.2109375, "learning_rate": 0.00040770868030935486, "loss": 4.8789, "mean_token_accuracy": 0.203414948284626, "num_tokens": 67921150.0, "step": 39155 }, { "entropy": 5.375274276733398, "epoch": 3.046761330480451, "grad_norm": 1.1328125, "learning_rate": 0.00040768629792879344, "loss": 4.8831, "mean_token_accuracy": 0.20690160542726516, "num_tokens": 67929686.0, "step": 39160 }, { "entropy": 5.440552663803101, "epoch": 3.0471503598521688, "grad_norm": 1.1640625, "learning_rate": 0.0004076639135349284, "loss": 4.9485, "mean_token_accuracy": 0.2051393285393715, "num_tokens": 67937523.0, "step": 39165 }, { "entropy": 5.367649126052856, "epoch": 3.0475393892238865, "grad_norm": 1.1796875, "learning_rate": 0.00040764152712809983, "loss": 4.8495, "mean_token_accuracy": 0.20849025696516038, "num_tokens": 67945368.0, "step": 39170 }, { "entropy": 5.4230005741119385, "epoch": 3.047928418595604, "grad_norm": 1.2265625, "learning_rate": 0.0004076191387086472, "loss": 4.9603, "mean_token_accuracy": 0.20741447508335115, "num_tokens": 67953769.0, "step": 39175 }, { "entropy": 5.417774248123169, "epoch": 3.0483174479673214, "grad_norm": 1.1640625, "learning_rate": 0.00040759674827691014, "loss": 4.8883, "mean_token_accuracy": 0.20528468042612075, "num_tokens": 67962131.0, "step": 39180 }, { "entropy": 5.321724796295166, "epoch": 3.048706477339039, "grad_norm": 1.140625, "learning_rate": 0.0004075743558332285, "loss": 4.8746, "mean_token_accuracy": 0.2095373287796974, "num_tokens": 67971344.0, "step": 39185 }, { "entropy": 5.326876640319824, "epoch": 3.049095506710757, "grad_norm": 1.109375, "learning_rate": 0.000407551961377942, "loss": 4.8636, "mean_token_accuracy": 0.20781180262565613, "num_tokens": 67979553.0, "step": 39190 }, { "entropy": 5.35449185371399, "epoch": 3.049484536082474, "grad_norm": 1.046875, "learning_rate": 0.0004075295649113905, "loss": 4.9631, "mean_token_accuracy": 0.20586841851472854, "num_tokens": 67989821.0, "step": 39195 }, { "entropy": 5.476725482940674, "epoch": 3.0498735654541917, "grad_norm": 1.3984375, "learning_rate": 0.00040750716643391384, "loss": 4.9781, "mean_token_accuracy": 0.20524748265743256, "num_tokens": 67998727.0, "step": 39200 }, { "entropy": 5.399300289154053, "epoch": 3.0502625948259094, "grad_norm": 1.140625, "learning_rate": 0.0004074847659458518, "loss": 4.8075, "mean_token_accuracy": 0.20670504868030548, "num_tokens": 68007158.0, "step": 39205 }, { "entropy": 5.292526721954346, "epoch": 3.050651624197627, "grad_norm": 1.2421875, "learning_rate": 0.00040746236344754423, "loss": 4.7599, "mean_token_accuracy": 0.21635707020759581, "num_tokens": 68015196.0, "step": 39210 }, { "entropy": 5.296192359924317, "epoch": 3.0510406535693444, "grad_norm": 1.1484375, "learning_rate": 0.0004074399589393312, "loss": 4.8533, "mean_token_accuracy": 0.20391743779182434, "num_tokens": 68023983.0, "step": 39215 }, { "entropy": 5.366579246520996, "epoch": 3.051429682941062, "grad_norm": 1.1640625, "learning_rate": 0.0004074175524215526, "loss": 4.868, "mean_token_accuracy": 0.20453790724277496, "num_tokens": 68032347.0, "step": 39220 }, { "entropy": 5.333183717727661, "epoch": 3.05181871231278, "grad_norm": 1.125, "learning_rate": 0.0004073951438945484, "loss": 4.8559, "mean_token_accuracy": 0.2089476466178894, "num_tokens": 68041463.0, "step": 39225 }, { "entropy": 5.430872440338135, "epoch": 3.052207741684497, "grad_norm": 1.0546875, "learning_rate": 0.00040737273335865866, "loss": 4.9826, "mean_token_accuracy": 0.20468396544456482, "num_tokens": 68050647.0, "step": 39230 }, { "entropy": 5.339348030090332, "epoch": 3.0525967710562147, "grad_norm": 1.1328125, "learning_rate": 0.00040735032081422334, "loss": 4.7646, "mean_token_accuracy": 0.21750395596027375, "num_tokens": 68059488.0, "step": 39235 }, { "entropy": 5.302882957458496, "epoch": 3.0529858004279324, "grad_norm": 1.1953125, "learning_rate": 0.00040732790626158257, "loss": 4.853, "mean_token_accuracy": 0.20718845427036287, "num_tokens": 68068451.0, "step": 39240 }, { "entropy": 5.3747971534729, "epoch": 3.0533748297996497, "grad_norm": 1.1640625, "learning_rate": 0.00040730548970107646, "loss": 4.8728, "mean_token_accuracy": 0.20101031810045242, "num_tokens": 68077556.0, "step": 39245 }, { "entropy": 5.355021142959595, "epoch": 3.0537638591713674, "grad_norm": 1.140625, "learning_rate": 0.0004072830711330451, "loss": 4.8149, "mean_token_accuracy": 0.20541394203901292, "num_tokens": 68086677.0, "step": 39250 }, { "entropy": 5.311465740203857, "epoch": 3.054152888543085, "grad_norm": 1.125, "learning_rate": 0.0004072606505578287, "loss": 4.829, "mean_token_accuracy": 0.20261309742927552, "num_tokens": 68094968.0, "step": 39255 }, { "entropy": 5.310690546035767, "epoch": 3.054541917914803, "grad_norm": 1.1171875, "learning_rate": 0.00040723822797576737, "loss": 4.85, "mean_token_accuracy": 0.20886177569627762, "num_tokens": 68103563.0, "step": 39260 }, { "entropy": 5.370297431945801, "epoch": 3.05493094728652, "grad_norm": 1.1015625, "learning_rate": 0.0004072158033872015, "loss": 4.9116, "mean_token_accuracy": 0.2063387632369995, "num_tokens": 68111571.0, "step": 39265 }, { "entropy": 5.494987487792969, "epoch": 3.0553199766582377, "grad_norm": 1.1953125, "learning_rate": 0.0004071933767924713, "loss": 5.0806, "mean_token_accuracy": 0.1934620812535286, "num_tokens": 68119955.0, "step": 39270 }, { "entropy": 5.40981125831604, "epoch": 3.0557090060299554, "grad_norm": 1.140625, "learning_rate": 0.00040717094819191685, "loss": 4.845, "mean_token_accuracy": 0.21306700259447098, "num_tokens": 68127989.0, "step": 39275 }, { "entropy": 5.31781268119812, "epoch": 3.0560980354016727, "grad_norm": 1.1875, "learning_rate": 0.00040714851758587875, "loss": 4.7485, "mean_token_accuracy": 0.20780339390039443, "num_tokens": 68136291.0, "step": 39280 }, { "entropy": 5.384258174896241, "epoch": 3.0564870647733904, "grad_norm": 1.09375, "learning_rate": 0.00040712608497469715, "loss": 5.051, "mean_token_accuracy": 0.1990741476416588, "num_tokens": 68145671.0, "step": 39285 }, { "entropy": 5.346583652496338, "epoch": 3.056876094145108, "grad_norm": 1.1953125, "learning_rate": 0.0004071036503587126, "loss": 4.7801, "mean_token_accuracy": 0.2134235084056854, "num_tokens": 68154183.0, "step": 39290 }, { "entropy": 5.433489608764648, "epoch": 3.0572651235168253, "grad_norm": 1.25, "learning_rate": 0.0004070812137382654, "loss": 4.9845, "mean_token_accuracy": 0.19338323622941972, "num_tokens": 68163537.0, "step": 39295 }, { "entropy": 5.360364389419556, "epoch": 3.057654152888543, "grad_norm": 1.1484375, "learning_rate": 0.000407058775113696, "loss": 4.8672, "mean_token_accuracy": 0.20649701952934266, "num_tokens": 68172052.0, "step": 39300 }, { "entropy": 5.370936059951783, "epoch": 3.0580431822602607, "grad_norm": 1.0625, "learning_rate": 0.0004070363344853449, "loss": 4.8867, "mean_token_accuracy": 0.20461745858192443, "num_tokens": 68180807.0, "step": 39305 }, { "entropy": 5.392648410797119, "epoch": 3.0584322116319784, "grad_norm": 1.140625, "learning_rate": 0.00040701389185355256, "loss": 4.9076, "mean_token_accuracy": 0.20824662148952483, "num_tokens": 68189772.0, "step": 39310 }, { "entropy": 5.5143177032470705, "epoch": 3.0588212410036957, "grad_norm": 1.1171875, "learning_rate": 0.0004069914472186595, "loss": 5.004, "mean_token_accuracy": 0.20063359886407853, "num_tokens": 68197816.0, "step": 39315 }, { "entropy": 5.3398984432220455, "epoch": 3.0592102703754134, "grad_norm": 1.1328125, "learning_rate": 0.0004069690005810063, "loss": 4.8075, "mean_token_accuracy": 0.21724888682365417, "num_tokens": 68206799.0, "step": 39320 }, { "entropy": 5.459707021713257, "epoch": 3.059599299747131, "grad_norm": 1.15625, "learning_rate": 0.00040694655194093365, "loss": 5.107, "mean_token_accuracy": 0.19280206710100173, "num_tokens": 68217107.0, "step": 39325 }, { "entropy": 5.385234689712524, "epoch": 3.0599883291188483, "grad_norm": 1.1328125, "learning_rate": 0.00040692410129878205, "loss": 4.9101, "mean_token_accuracy": 0.20619029700756072, "num_tokens": 68225587.0, "step": 39330 }, { "entropy": 5.456292915344238, "epoch": 3.060377358490566, "grad_norm": 1.1796875, "learning_rate": 0.0004069016486548922, "loss": 4.9531, "mean_token_accuracy": 0.20092508643865586, "num_tokens": 68234090.0, "step": 39335 }, { "entropy": 5.296092462539673, "epoch": 3.0607663878622837, "grad_norm": 1.0546875, "learning_rate": 0.0004068791940096048, "loss": 4.8427, "mean_token_accuracy": 0.21250622421503068, "num_tokens": 68242904.0, "step": 39340 }, { "entropy": 5.3931621551513675, "epoch": 3.061155417234001, "grad_norm": 1.078125, "learning_rate": 0.00040685673736326044, "loss": 4.9701, "mean_token_accuracy": 0.20412750095129012, "num_tokens": 68251232.0, "step": 39345 }, { "entropy": 5.4876807689666744, "epoch": 3.0615444466057187, "grad_norm": 1.0625, "learning_rate": 0.0004068342787162001, "loss": 4.9557, "mean_token_accuracy": 0.2000432327389717, "num_tokens": 68259658.0, "step": 39350 }, { "entropy": 5.345956230163575, "epoch": 3.0619334759774364, "grad_norm": 1.09375, "learning_rate": 0.00040681181806876435, "loss": 4.8233, "mean_token_accuracy": 0.2140554592013359, "num_tokens": 68268421.0, "step": 39355 }, { "entropy": 5.3152477741241455, "epoch": 3.062322505349154, "grad_norm": 1.2734375, "learning_rate": 0.000406789355421294, "loss": 4.9453, "mean_token_accuracy": 0.20442201495170592, "num_tokens": 68277564.0, "step": 39360 }, { "entropy": 5.4056840419769285, "epoch": 3.0627115347208713, "grad_norm": 1.1640625, "learning_rate": 0.0004067668907741301, "loss": 4.9581, "mean_token_accuracy": 0.2014770969748497, "num_tokens": 68286305.0, "step": 39365 }, { "entropy": 5.419165372848511, "epoch": 3.063100564092589, "grad_norm": 1.1640625, "learning_rate": 0.0004067444241276132, "loss": 4.8946, "mean_token_accuracy": 0.20499465614557266, "num_tokens": 68294536.0, "step": 39370 }, { "entropy": 5.295297002792358, "epoch": 3.0634895934643067, "grad_norm": 1.1953125, "learning_rate": 0.00040672195548208443, "loss": 4.8431, "mean_token_accuracy": 0.2146304503083229, "num_tokens": 68302995.0, "step": 39375 }, { "entropy": 5.283709764480591, "epoch": 3.063878622836024, "grad_norm": 1.109375, "learning_rate": 0.0004066994848378846, "loss": 4.8304, "mean_token_accuracy": 0.21160885095596313, "num_tokens": 68311643.0, "step": 39380 }, { "entropy": 5.320725059509277, "epoch": 3.0642676522077417, "grad_norm": 1.1796875, "learning_rate": 0.00040667701219535473, "loss": 4.8142, "mean_token_accuracy": 0.21575698107481003, "num_tokens": 68319317.0, "step": 39385 }, { "entropy": 5.32264404296875, "epoch": 3.0646566815794594, "grad_norm": 1.109375, "learning_rate": 0.0004066545375548358, "loss": 4.8198, "mean_token_accuracy": 0.2110499322414398, "num_tokens": 68328116.0, "step": 39390 }, { "entropy": 5.3408191204071045, "epoch": 3.0650457109511766, "grad_norm": 1.1640625, "learning_rate": 0.0004066320609166689, "loss": 4.967, "mean_token_accuracy": 0.2038261592388153, "num_tokens": 68336953.0, "step": 39395 }, { "entropy": 5.363026809692383, "epoch": 3.0654347403228943, "grad_norm": 1.1328125, "learning_rate": 0.0004066095822811949, "loss": 4.9305, "mean_token_accuracy": 0.2025128111243248, "num_tokens": 68346152.0, "step": 39400 }, { "entropy": 5.446612215042114, "epoch": 3.065823769694612, "grad_norm": 1.2421875, "learning_rate": 0.000406587101648755, "loss": 4.9631, "mean_token_accuracy": 0.20267566293478012, "num_tokens": 68354785.0, "step": 39405 }, { "entropy": 5.3995355606079105, "epoch": 3.0662127990663297, "grad_norm": 1.15625, "learning_rate": 0.0004065646190196902, "loss": 4.8641, "mean_token_accuracy": 0.2094322293996811, "num_tokens": 68363323.0, "step": 39410 }, { "entropy": 5.3029882431030275, "epoch": 3.066601828438047, "grad_norm": 1.1640625, "learning_rate": 0.0004065421343943417, "loss": 4.8844, "mean_token_accuracy": 0.2083094373345375, "num_tokens": 68371461.0, "step": 39415 }, { "entropy": 5.400768852233886, "epoch": 3.0669908578097647, "grad_norm": 1.171875, "learning_rate": 0.00040651964777305074, "loss": 4.9174, "mean_token_accuracy": 0.20454638749361037, "num_tokens": 68380356.0, "step": 39420 }, { "entropy": 5.40072808265686, "epoch": 3.0673798871814824, "grad_norm": 1.1484375, "learning_rate": 0.0004064971591561585, "loss": 4.9335, "mean_token_accuracy": 0.20237781405448912, "num_tokens": 68389029.0, "step": 39425 }, { "entropy": 5.291285991668701, "epoch": 3.0677689165531996, "grad_norm": 1.078125, "learning_rate": 0.00040647466854400606, "loss": 4.7826, "mean_token_accuracy": 0.21494049280881883, "num_tokens": 68397481.0, "step": 39430 }, { "entropy": 5.2940027713775635, "epoch": 3.0681579459249173, "grad_norm": 1.28125, "learning_rate": 0.0004064521759369349, "loss": 4.8442, "mean_token_accuracy": 0.21035151034593583, "num_tokens": 68405459.0, "step": 39435 }, { "entropy": 5.243048095703125, "epoch": 3.068546975296635, "grad_norm": 1.1328125, "learning_rate": 0.00040642968133528613, "loss": 4.8084, "mean_token_accuracy": 0.21240645945072173, "num_tokens": 68413840.0, "step": 39440 }, { "entropy": 5.3717375755310055, "epoch": 3.0689360046683523, "grad_norm": 1.15625, "learning_rate": 0.0004064071847394012, "loss": 4.9545, "mean_token_accuracy": 0.2029716983437538, "num_tokens": 68422608.0, "step": 39445 }, { "entropy": 5.36797513961792, "epoch": 3.06932503404007, "grad_norm": 1.078125, "learning_rate": 0.0004063846861496213, "loss": 4.8751, "mean_token_accuracy": 0.20841484665870666, "num_tokens": 68431484.0, "step": 39450 }, { "entropy": 5.405462408065796, "epoch": 3.0697140634117877, "grad_norm": 1.15625, "learning_rate": 0.000406362185566288, "loss": 4.8913, "mean_token_accuracy": 0.20354299247264862, "num_tokens": 68440031.0, "step": 39455 }, { "entropy": 5.371223449707031, "epoch": 3.0701030927835053, "grad_norm": 1.1328125, "learning_rate": 0.0004063396829897426, "loss": 4.9783, "mean_token_accuracy": 0.20123460292816162, "num_tokens": 68449207.0, "step": 39460 }, { "entropy": 5.417889165878296, "epoch": 3.0704921221552226, "grad_norm": 1.125, "learning_rate": 0.0004063171784203265, "loss": 4.8596, "mean_token_accuracy": 0.2032051295042038, "num_tokens": 68457985.0, "step": 39465 }, { "entropy": 5.371247673034668, "epoch": 3.0708811515269403, "grad_norm": 1.0859375, "learning_rate": 0.0004062946718583813, "loss": 4.9342, "mean_token_accuracy": 0.20044719874858857, "num_tokens": 68466364.0, "step": 39470 }, { "entropy": 5.460356616973877, "epoch": 3.071270180898658, "grad_norm": 1.078125, "learning_rate": 0.00040627216330424844, "loss": 4.9465, "mean_token_accuracy": 0.20424651950597764, "num_tokens": 68475250.0, "step": 39475 }, { "entropy": 5.410144901275634, "epoch": 3.0716592102703753, "grad_norm": 1.0703125, "learning_rate": 0.0004062496527582694, "loss": 4.9488, "mean_token_accuracy": 0.20227152109146118, "num_tokens": 68483696.0, "step": 39480 }, { "entropy": 5.371443128585815, "epoch": 3.072048239642093, "grad_norm": 1.1796875, "learning_rate": 0.0004062271402207858, "loss": 4.9115, "mean_token_accuracy": 0.20254356265068055, "num_tokens": 68491988.0, "step": 39485 }, { "entropy": 5.424184703826905, "epoch": 3.0724372690138106, "grad_norm": 1.1484375, "learning_rate": 0.0004062046256921391, "loss": 4.9799, "mean_token_accuracy": 0.19297416210174562, "num_tokens": 68500477.0, "step": 39490 }, { "entropy": 5.369602823257447, "epoch": 3.072826298385528, "grad_norm": 1.125, "learning_rate": 0.00040618210917267117, "loss": 4.8572, "mean_token_accuracy": 0.21553044021129608, "num_tokens": 68509363.0, "step": 39495 }, { "entropy": 5.344871187210083, "epoch": 3.0732153277572456, "grad_norm": 1.125, "learning_rate": 0.00040615959066272355, "loss": 4.8625, "mean_token_accuracy": 0.20982418209314346, "num_tokens": 68518485.0, "step": 39500 }, { "entropy": 5.305203104019165, "epoch": 3.0736043571289633, "grad_norm": 1.1875, "learning_rate": 0.0004061370701626379, "loss": 4.7165, "mean_token_accuracy": 0.21390097141265868, "num_tokens": 68526913.0, "step": 39505 }, { "entropy": 5.365344524383545, "epoch": 3.073993386500681, "grad_norm": 1.125, "learning_rate": 0.0004061145476727559, "loss": 4.8962, "mean_token_accuracy": 0.21064141988754273, "num_tokens": 68535594.0, "step": 39510 }, { "entropy": 5.358437490463257, "epoch": 3.0743824158723982, "grad_norm": 1.0703125, "learning_rate": 0.0004060920231934193, "loss": 4.8861, "mean_token_accuracy": 0.20125058442354202, "num_tokens": 68544380.0, "step": 39515 }, { "entropy": 5.382339668273926, "epoch": 3.074771445244116, "grad_norm": 1.1953125, "learning_rate": 0.0004060694967249699, "loss": 4.8427, "mean_token_accuracy": 0.2104205533862114, "num_tokens": 68552535.0, "step": 39520 }, { "entropy": 5.42639389038086, "epoch": 3.0751604746158336, "grad_norm": 1.1796875, "learning_rate": 0.0004060469682677496, "loss": 5.0394, "mean_token_accuracy": 0.20230480879545212, "num_tokens": 68561920.0, "step": 39525 }, { "entropy": 5.340296411514283, "epoch": 3.075549503987551, "grad_norm": 1.109375, "learning_rate": 0.00040602443782210003, "loss": 4.856, "mean_token_accuracy": 0.2111328735947609, "num_tokens": 68571053.0, "step": 39530 }, { "entropy": 5.394915676116943, "epoch": 3.0759385333592686, "grad_norm": 1.140625, "learning_rate": 0.0004060019053883632, "loss": 4.9075, "mean_token_accuracy": 0.20821771025657654, "num_tokens": 68579716.0, "step": 39535 }, { "entropy": 5.352871036529541, "epoch": 3.0763275627309863, "grad_norm": 1.171875, "learning_rate": 0.000405979370966881, "loss": 4.8275, "mean_token_accuracy": 0.21041016429662704, "num_tokens": 68587982.0, "step": 39540 }, { "entropy": 5.365692472457885, "epoch": 3.0767165921027035, "grad_norm": 1.2578125, "learning_rate": 0.0004059568345579953, "loss": 4.9085, "mean_token_accuracy": 0.19981757253408433, "num_tokens": 68596483.0, "step": 39545 }, { "entropy": 5.402635908126831, "epoch": 3.0771056214744212, "grad_norm": 1.03125, "learning_rate": 0.00040593429616204806, "loss": 4.9698, "mean_token_accuracy": 0.2034299701452255, "num_tokens": 68605841.0, "step": 39550 }, { "entropy": 5.323451375961303, "epoch": 3.077494650846139, "grad_norm": 1.140625, "learning_rate": 0.00040591175577938125, "loss": 4.9287, "mean_token_accuracy": 0.20032303929328918, "num_tokens": 68613912.0, "step": 39555 }, { "entropy": 5.362386274337768, "epoch": 3.0778836802178566, "grad_norm": 1.1171875, "learning_rate": 0.00040588921341033697, "loss": 4.897, "mean_token_accuracy": 0.20890214145183564, "num_tokens": 68623383.0, "step": 39560 }, { "entropy": 5.4454751968383786, "epoch": 3.078272709589574, "grad_norm": 1.1171875, "learning_rate": 0.0004058666690552572, "loss": 4.9303, "mean_token_accuracy": 0.20290555953979492, "num_tokens": 68632099.0, "step": 39565 }, { "entropy": 5.393856191635132, "epoch": 3.0786617389612916, "grad_norm": 1.1640625, "learning_rate": 0.00040584412271448407, "loss": 4.8975, "mean_token_accuracy": 0.20557726472616195, "num_tokens": 68640966.0, "step": 39570 }, { "entropy": 5.356562280654908, "epoch": 3.0790507683330093, "grad_norm": 1.0703125, "learning_rate": 0.0004058215743883595, "loss": 4.9017, "mean_token_accuracy": 0.19891307502985, "num_tokens": 68649608.0, "step": 39575 }, { "entropy": 5.360400772094726, "epoch": 3.0794397977047265, "grad_norm": 1.1015625, "learning_rate": 0.0004057990240772259, "loss": 4.8625, "mean_token_accuracy": 0.22148149609565734, "num_tokens": 68659478.0, "step": 39580 }, { "entropy": 5.422684907913208, "epoch": 3.0798288270764442, "grad_norm": 1.0859375, "learning_rate": 0.00040577647178142523, "loss": 4.9439, "mean_token_accuracy": 0.20765017867088317, "num_tokens": 68668401.0, "step": 39585 }, { "entropy": 5.357463645935058, "epoch": 3.080217856448162, "grad_norm": 1.078125, "learning_rate": 0.0004057539175012998, "loss": 4.8249, "mean_token_accuracy": 0.20827181190252303, "num_tokens": 68676928.0, "step": 39590 }, { "entropy": 5.310135269165039, "epoch": 3.080606885819879, "grad_norm": 1.15625, "learning_rate": 0.00040573136123719174, "loss": 4.9421, "mean_token_accuracy": 0.2026720717549324, "num_tokens": 68685834.0, "step": 39595 }, { "entropy": 5.341330480575562, "epoch": 3.080995915191597, "grad_norm": 1.15625, "learning_rate": 0.00040570880298944334, "loss": 4.8531, "mean_token_accuracy": 0.21399440616369247, "num_tokens": 68694576.0, "step": 39600 }, { "entropy": 5.363631820678711, "epoch": 3.0813849445633146, "grad_norm": 1.15625, "learning_rate": 0.0004056862427583969, "loss": 4.8631, "mean_token_accuracy": 0.21411360651254654, "num_tokens": 68703660.0, "step": 39605 }, { "entropy": 5.285452747344971, "epoch": 3.0817739739350323, "grad_norm": 1.1015625, "learning_rate": 0.0004056636805443948, "loss": 4.9333, "mean_token_accuracy": 0.20576193928718567, "num_tokens": 68713263.0, "step": 39610 }, { "entropy": 5.36211142539978, "epoch": 3.0821630033067495, "grad_norm": 1.15625, "learning_rate": 0.00040564111634777927, "loss": 4.8564, "mean_token_accuracy": 0.2024134397506714, "num_tokens": 68721856.0, "step": 39615 }, { "entropy": 5.392276954650879, "epoch": 3.0825520326784672, "grad_norm": 1.203125, "learning_rate": 0.00040561855016889276, "loss": 4.8947, "mean_token_accuracy": 0.20623093992471694, "num_tokens": 68729887.0, "step": 39620 }, { "entropy": 5.357159852981567, "epoch": 3.082941062050185, "grad_norm": 1.1015625, "learning_rate": 0.00040559598200807763, "loss": 4.9214, "mean_token_accuracy": 0.21215338557958602, "num_tokens": 68739154.0, "step": 39625 }, { "entropy": 5.382906055450439, "epoch": 3.083330091421902, "grad_norm": 1.0703125, "learning_rate": 0.0004055734118656764, "loss": 4.93, "mean_token_accuracy": 0.20204052627086638, "num_tokens": 68748493.0, "step": 39630 }, { "entropy": 5.456566667556762, "epoch": 3.08371912079362, "grad_norm": 1.0703125, "learning_rate": 0.0004055508397420314, "loss": 4.9475, "mean_token_accuracy": 0.20301341116428376, "num_tokens": 68757479.0, "step": 39635 }, { "entropy": 5.354962539672852, "epoch": 3.0841081501653376, "grad_norm": 1.09375, "learning_rate": 0.00040552826563748526, "loss": 4.8898, "mean_token_accuracy": 0.20634498596191406, "num_tokens": 68766438.0, "step": 39640 }, { "entropy": 5.415283632278443, "epoch": 3.0844971795370553, "grad_norm": 1.15625, "learning_rate": 0.0004055056895523804, "loss": 5.0078, "mean_token_accuracy": 0.20093509256839753, "num_tokens": 68774436.0, "step": 39645 }, { "entropy": 5.390762042999268, "epoch": 3.0848862089087725, "grad_norm": 1.0859375, "learning_rate": 0.00040548311148705943, "loss": 4.8544, "mean_token_accuracy": 0.2153600811958313, "num_tokens": 68783576.0, "step": 39650 }, { "entropy": 5.365612125396728, "epoch": 3.08527523828049, "grad_norm": 1.1484375, "learning_rate": 0.0004054605314418649, "loss": 4.8555, "mean_token_accuracy": 0.20721151828765869, "num_tokens": 68792793.0, "step": 39655 }, { "entropy": 5.328716611862182, "epoch": 3.085664267652208, "grad_norm": 1.2265625, "learning_rate": 0.00040543794941713944, "loss": 4.8534, "mean_token_accuracy": 0.20648181587457656, "num_tokens": 68801506.0, "step": 39660 }, { "entropy": 5.376133251190185, "epoch": 3.086053297023925, "grad_norm": 1.0703125, "learning_rate": 0.0004054153654132258, "loss": 4.9391, "mean_token_accuracy": 0.20122779458761214, "num_tokens": 68810999.0, "step": 39665 }, { "entropy": 5.398913860321045, "epoch": 3.086442326395643, "grad_norm": 1.1953125, "learning_rate": 0.0004053927794304665, "loss": 4.9, "mean_token_accuracy": 0.2064869448542595, "num_tokens": 68819688.0, "step": 39670 }, { "entropy": 5.388112783432007, "epoch": 3.0868313557673606, "grad_norm": 1.1796875, "learning_rate": 0.0004053701914692043, "loss": 4.9028, "mean_token_accuracy": 0.19929781556129456, "num_tokens": 68828079.0, "step": 39675 }, { "entropy": 5.324591493606567, "epoch": 3.087220385139078, "grad_norm": 1.1953125, "learning_rate": 0.000405347601529782, "loss": 4.7996, "mean_token_accuracy": 0.21183450371026993, "num_tokens": 68836948.0, "step": 39680 }, { "entropy": 5.318232202529908, "epoch": 3.0876094145107955, "grad_norm": 1.171875, "learning_rate": 0.0004053250096125423, "loss": 4.8791, "mean_token_accuracy": 0.20922672301530837, "num_tokens": 68845023.0, "step": 39685 }, { "entropy": 5.3375632762908936, "epoch": 3.087998443882513, "grad_norm": 1.1484375, "learning_rate": 0.0004053024157178281, "loss": 4.9211, "mean_token_accuracy": 0.20704969763755798, "num_tokens": 68853496.0, "step": 39690 }, { "entropy": 5.39705114364624, "epoch": 3.088387473254231, "grad_norm": 1.328125, "learning_rate": 0.000405279819845982, "loss": 4.9523, "mean_token_accuracy": 0.20426083654165267, "num_tokens": 68861593.0, "step": 39695 }, { "entropy": 5.291562747955322, "epoch": 3.088776502625948, "grad_norm": 1.0703125, "learning_rate": 0.00040525722199734706, "loss": 4.8157, "mean_token_accuracy": 0.2140125498175621, "num_tokens": 68870477.0, "step": 39700 }, { "entropy": 5.389525270462036, "epoch": 3.089165531997666, "grad_norm": 1.2109375, "learning_rate": 0.0004052346221722661, "loss": 4.9433, "mean_token_accuracy": 0.19924015998840333, "num_tokens": 68878353.0, "step": 39705 }, { "entropy": 5.402024364471435, "epoch": 3.0895545613693836, "grad_norm": 1.1875, "learning_rate": 0.00040521202037108205, "loss": 4.8909, "mean_token_accuracy": 0.20416449755430222, "num_tokens": 68886479.0, "step": 39710 }, { "entropy": 5.33320164680481, "epoch": 3.089943590741101, "grad_norm": 1.109375, "learning_rate": 0.0004051894165941378, "loss": 4.8966, "mean_token_accuracy": 0.20517400950193404, "num_tokens": 68895538.0, "step": 39715 }, { "entropy": 5.323169279098511, "epoch": 3.0903326201128185, "grad_norm": 1.1640625, "learning_rate": 0.00040516681084177636, "loss": 4.8245, "mean_token_accuracy": 0.21246874928474427, "num_tokens": 68903893.0, "step": 39720 }, { "entropy": 5.366964435577392, "epoch": 3.090721649484536, "grad_norm": 1.0859375, "learning_rate": 0.00040514420311434085, "loss": 4.9123, "mean_token_accuracy": 0.20191441029310225, "num_tokens": 68913008.0, "step": 39725 }, { "entropy": 5.241947507858276, "epoch": 3.0911106788562535, "grad_norm": 1.0625, "learning_rate": 0.00040512159341217415, "loss": 4.8034, "mean_token_accuracy": 0.2051450490951538, "num_tokens": 68921405.0, "step": 39730 }, { "entropy": 5.393673229217529, "epoch": 3.091499708227971, "grad_norm": 1.1171875, "learning_rate": 0.00040509898173561934, "loss": 4.9666, "mean_token_accuracy": 0.20363552272319793, "num_tokens": 68930205.0, "step": 39735 }, { "entropy": 5.348920106887817, "epoch": 3.091888737599689, "grad_norm": 1.1171875, "learning_rate": 0.0004050763680850196, "loss": 4.8005, "mean_token_accuracy": 0.21652241349220275, "num_tokens": 68938069.0, "step": 39740 }, { "entropy": 5.325261878967285, "epoch": 3.0922777669714065, "grad_norm": 1.109375, "learning_rate": 0.0004050537524607179, "loss": 4.8872, "mean_token_accuracy": 0.20332405865192413, "num_tokens": 68947229.0, "step": 39745 }, { "entropy": 5.3468352317810055, "epoch": 3.092666796343124, "grad_norm": 1.1796875, "learning_rate": 0.00040503113486305766, "loss": 4.8149, "mean_token_accuracy": 0.21073764115571975, "num_tokens": 68955773.0, "step": 39750 }, { "entropy": 5.354019117355347, "epoch": 3.0930558257148415, "grad_norm": 1.140625, "learning_rate": 0.00040500851529238184, "loss": 4.861, "mean_token_accuracy": 0.21193266659975052, "num_tokens": 68964894.0, "step": 39755 }, { "entropy": 5.472339487075805, "epoch": 3.093444855086559, "grad_norm": 1.1640625, "learning_rate": 0.0004049858937490337, "loss": 5.0135, "mean_token_accuracy": 0.2013378232717514, "num_tokens": 68973965.0, "step": 39760 }, { "entropy": 5.346300220489502, "epoch": 3.0938338844582765, "grad_norm": 1.1875, "learning_rate": 0.0004049632702333566, "loss": 4.8149, "mean_token_accuracy": 0.21466439068317414, "num_tokens": 68982166.0, "step": 39765 }, { "entropy": 5.368621730804444, "epoch": 3.094222913829994, "grad_norm": 1.1484375, "learning_rate": 0.00040494064474569375, "loss": 4.8684, "mean_token_accuracy": 0.2058524578809738, "num_tokens": 68990941.0, "step": 39770 }, { "entropy": 5.358957195281983, "epoch": 3.094611943201712, "grad_norm": 1.15625, "learning_rate": 0.00040491801728638835, "loss": 4.8844, "mean_token_accuracy": 0.21037195920944213, "num_tokens": 68999243.0, "step": 39775 }, { "entropy": 5.463205289840698, "epoch": 3.095000972573429, "grad_norm": 1.21875, "learning_rate": 0.00040489538785578385, "loss": 4.8445, "mean_token_accuracy": 0.212743116915226, "num_tokens": 69007547.0, "step": 39780 }, { "entropy": 5.322212076187133, "epoch": 3.095390001945147, "grad_norm": 1.1171875, "learning_rate": 0.00040487275645422356, "loss": 4.8184, "mean_token_accuracy": 0.20714086592197417, "num_tokens": 69017216.0, "step": 39785 }, { "entropy": 5.341900062561035, "epoch": 3.0957790313168645, "grad_norm": 1.15625, "learning_rate": 0.000404850123082051, "loss": 4.8323, "mean_token_accuracy": 0.21671584099531174, "num_tokens": 69025482.0, "step": 39790 }, { "entropy": 5.3719336032867435, "epoch": 3.096168060688582, "grad_norm": 1.1328125, "learning_rate": 0.0004048274877396094, "loss": 4.9551, "mean_token_accuracy": 0.20287248343229294, "num_tokens": 69034027.0, "step": 39795 }, { "entropy": 5.363114500045777, "epoch": 3.0965570900602994, "grad_norm": 1.0546875, "learning_rate": 0.0004048048504272424, "loss": 4.9178, "mean_token_accuracy": 0.20182660669088365, "num_tokens": 69042609.0, "step": 39800 }, { "entropy": 5.400418853759765, "epoch": 3.096946119432017, "grad_norm": 1.1484375, "learning_rate": 0.0004047822111452933, "loss": 4.9121, "mean_token_accuracy": 0.2024646908044815, "num_tokens": 69051277.0, "step": 39805 }, { "entropy": 5.405140542984009, "epoch": 3.097335148803735, "grad_norm": 1.1171875, "learning_rate": 0.00040475956989410584, "loss": 4.8541, "mean_token_accuracy": 0.21522360891103745, "num_tokens": 69059424.0, "step": 39810 }, { "entropy": 5.4380302906036375, "epoch": 3.097724178175452, "grad_norm": 1.203125, "learning_rate": 0.0004047369266740233, "loss": 5.0139, "mean_token_accuracy": 0.20082610994577407, "num_tokens": 69068198.0, "step": 39815 }, { "entropy": 5.436377286911011, "epoch": 3.09811320754717, "grad_norm": 1.078125, "learning_rate": 0.00040471428148538944, "loss": 4.9603, "mean_token_accuracy": 0.2011513441801071, "num_tokens": 69077477.0, "step": 39820 }, { "entropy": 5.359043455123901, "epoch": 3.0985022369188875, "grad_norm": 1.078125, "learning_rate": 0.0004046916343285479, "loss": 4.8567, "mean_token_accuracy": 0.21438123285770416, "num_tokens": 69086452.0, "step": 39825 }, { "entropy": 5.383451509475708, "epoch": 3.0988912662906047, "grad_norm": 1.171875, "learning_rate": 0.00040466898520384213, "loss": 4.9639, "mean_token_accuracy": 0.20630960762500763, "num_tokens": 69095191.0, "step": 39830 }, { "entropy": 5.371219682693481, "epoch": 3.0992802956623224, "grad_norm": 1.109375, "learning_rate": 0.000404646334111616, "loss": 4.9539, "mean_token_accuracy": 0.20594960153102876, "num_tokens": 69104079.0, "step": 39835 }, { "entropy": 5.304137897491455, "epoch": 3.09966932503404, "grad_norm": 1.2578125, "learning_rate": 0.0004046236810522131, "loss": 4.8889, "mean_token_accuracy": 0.20246531665325165, "num_tokens": 69113593.0, "step": 39840 }, { "entropy": 5.336619281768799, "epoch": 3.100058354405758, "grad_norm": 1.109375, "learning_rate": 0.0004046010260259771, "loss": 4.9223, "mean_token_accuracy": 0.200758096575737, "num_tokens": 69122610.0, "step": 39845 }, { "entropy": 5.428775930404663, "epoch": 3.100447383777475, "grad_norm": 1.1640625, "learning_rate": 0.00040457836903325177, "loss": 4.929, "mean_token_accuracy": 0.20713288187980652, "num_tokens": 69130755.0, "step": 39850 }, { "entropy": 5.448776769638061, "epoch": 3.100836413149193, "grad_norm": 1.15625, "learning_rate": 0.00040455571007438104, "loss": 4.8921, "mean_token_accuracy": 0.20961010605096816, "num_tokens": 69139008.0, "step": 39855 }, { "entropy": 5.3793620586395265, "epoch": 3.1012254425209105, "grad_norm": 1.0390625, "learning_rate": 0.0004045330491497085, "loss": 4.9162, "mean_token_accuracy": 0.20687601417303086, "num_tokens": 69148117.0, "step": 39860 }, { "entropy": 5.325445556640625, "epoch": 3.1016144718926277, "grad_norm": 1.1015625, "learning_rate": 0.00040451038625957827, "loss": 4.9138, "mean_token_accuracy": 0.20354344546794892, "num_tokens": 69156072.0, "step": 39865 }, { "entropy": 5.306148481369019, "epoch": 3.1020035012643454, "grad_norm": 1.1171875, "learning_rate": 0.0004044877214043339, "loss": 4.7778, "mean_token_accuracy": 0.21406500041484833, "num_tokens": 69165026.0, "step": 39870 }, { "entropy": 5.425632286071777, "epoch": 3.102392530636063, "grad_norm": 1.109375, "learning_rate": 0.0004044650545843196, "loss": 4.9617, "mean_token_accuracy": 0.19702733904123307, "num_tokens": 69174283.0, "step": 39875 }, { "entropy": 5.370766973495483, "epoch": 3.1027815600077804, "grad_norm": 1.109375, "learning_rate": 0.000404442385799879, "loss": 4.9908, "mean_token_accuracy": 0.19917769283056258, "num_tokens": 69183335.0, "step": 39880 }, { "entropy": 5.469532060623169, "epoch": 3.103170589379498, "grad_norm": 1.109375, "learning_rate": 0.0004044197150513564, "loss": 4.98, "mean_token_accuracy": 0.1970291718840599, "num_tokens": 69192272.0, "step": 39885 }, { "entropy": 5.412269020080567, "epoch": 3.1035596187512158, "grad_norm": 1.1875, "learning_rate": 0.0004043970423390955, "loss": 4.9192, "mean_token_accuracy": 0.20483305305242538, "num_tokens": 69201274.0, "step": 39890 }, { "entropy": 5.433551883697509, "epoch": 3.1039486481229335, "grad_norm": 1.125, "learning_rate": 0.0004043743676634405, "loss": 4.9587, "mean_token_accuracy": 0.2022848382592201, "num_tokens": 69210112.0, "step": 39895 }, { "entropy": 5.46302285194397, "epoch": 3.1043376774946507, "grad_norm": 1.3671875, "learning_rate": 0.0004043516910247353, "loss": 4.9085, "mean_token_accuracy": 0.2100842833518982, "num_tokens": 69218822.0, "step": 39900 }, { "entropy": 5.377660036087036, "epoch": 3.1047267068663684, "grad_norm": 1.1171875, "learning_rate": 0.0004043290124233242, "loss": 4.9178, "mean_token_accuracy": 0.2036944955587387, "num_tokens": 69227683.0, "step": 39905 }, { "entropy": 5.30357985496521, "epoch": 3.105115736238086, "grad_norm": 1.1015625, "learning_rate": 0.0004043063318595511, "loss": 4.8623, "mean_token_accuracy": 0.20263220965862275, "num_tokens": 69236338.0, "step": 39910 }, { "entropy": 5.364724159240723, "epoch": 3.1055047656098034, "grad_norm": 1.171875, "learning_rate": 0.0004042836493337603, "loss": 4.9256, "mean_token_accuracy": 0.20477401912212373, "num_tokens": 69245094.0, "step": 39915 }, { "entropy": 5.354433393478393, "epoch": 3.105893794981521, "grad_norm": 1.09375, "learning_rate": 0.0004042609648462959, "loss": 4.8433, "mean_token_accuracy": 0.2097805604338646, "num_tokens": 69253791.0, "step": 39920 }, { "entropy": 5.396326541900635, "epoch": 3.1062828243532388, "grad_norm": 1.09375, "learning_rate": 0.000404238278397502, "loss": 4.9237, "mean_token_accuracy": 0.20093152523040772, "num_tokens": 69262410.0, "step": 39925 }, { "entropy": 5.352022361755371, "epoch": 3.106671853724956, "grad_norm": 1.1640625, "learning_rate": 0.00040421558998772293, "loss": 4.923, "mean_token_accuracy": 0.20439564287662507, "num_tokens": 69270840.0, "step": 39930 }, { "entropy": 5.349221086502075, "epoch": 3.1070608830966737, "grad_norm": 1.1640625, "learning_rate": 0.000404192899617303, "loss": 4.7998, "mean_token_accuracy": 0.2103898838162422, "num_tokens": 69279385.0, "step": 39935 }, { "entropy": 5.319099760055542, "epoch": 3.1074499124683914, "grad_norm": 1.1171875, "learning_rate": 0.0004041702072865864, "loss": 4.7846, "mean_token_accuracy": 0.21359027922153473, "num_tokens": 69287927.0, "step": 39940 }, { "entropy": 5.398356914520264, "epoch": 3.107838941840109, "grad_norm": 1.25, "learning_rate": 0.0004041475129959176, "loss": 4.8914, "mean_token_accuracy": 0.21204473674297333, "num_tokens": 69297282.0, "step": 39945 }, { "entropy": 5.4548969745635985, "epoch": 3.1082279712118264, "grad_norm": 1.1171875, "learning_rate": 0.0004041248167456408, "loss": 4.9593, "mean_token_accuracy": 0.21003576815128328, "num_tokens": 69305290.0, "step": 39950 }, { "entropy": 5.349700307846069, "epoch": 3.108617000583544, "grad_norm": 1.1171875, "learning_rate": 0.0004041021185361004, "loss": 4.8204, "mean_token_accuracy": 0.21461442708969117, "num_tokens": 69313971.0, "step": 39955 }, { "entropy": 5.324366855621338, "epoch": 3.1090060299552618, "grad_norm": 1.203125, "learning_rate": 0.0004040794183676409, "loss": 4.8916, "mean_token_accuracy": 0.2093067556619644, "num_tokens": 69322117.0, "step": 39960 }, { "entropy": 5.3449869632720945, "epoch": 3.109395059326979, "grad_norm": 1.125, "learning_rate": 0.0004040567162406066, "loss": 4.8791, "mean_token_accuracy": 0.2049208551645279, "num_tokens": 69330910.0, "step": 39965 }, { "entropy": 5.418989276885986, "epoch": 3.1097840886986967, "grad_norm": 1.1328125, "learning_rate": 0.0004040340121553421, "loss": 4.9383, "mean_token_accuracy": 0.1999283879995346, "num_tokens": 69339917.0, "step": 39970 }, { "entropy": 5.413790464401245, "epoch": 3.1101731180704144, "grad_norm": 1.1953125, "learning_rate": 0.0004040113061121918, "loss": 4.8935, "mean_token_accuracy": 0.2031472384929657, "num_tokens": 69348881.0, "step": 39975 }, { "entropy": 5.423224830627442, "epoch": 3.110562147442132, "grad_norm": 1.109375, "learning_rate": 0.00040398859811150036, "loss": 4.9436, "mean_token_accuracy": 0.19647252708673477, "num_tokens": 69358451.0, "step": 39980 }, { "entropy": 5.3403627395629885, "epoch": 3.1109511768138494, "grad_norm": 1.125, "learning_rate": 0.0004039658881536122, "loss": 4.8804, "mean_token_accuracy": 0.20627961456775665, "num_tokens": 69367899.0, "step": 39985 }, { "entropy": 5.3092090606689455, "epoch": 3.111340206185567, "grad_norm": 1.1875, "learning_rate": 0.0004039431762388719, "loss": 4.8926, "mean_token_accuracy": 0.205707448720932, "num_tokens": 69377862.0, "step": 39990 }, { "entropy": 5.392904567718506, "epoch": 3.1117292355572848, "grad_norm": 1.1015625, "learning_rate": 0.0004039204623676242, "loss": 4.8828, "mean_token_accuracy": 0.21372638046741485, "num_tokens": 69386246.0, "step": 39995 }, { "entropy": 5.319687843322754, "epoch": 3.112118264929002, "grad_norm": 1.1484375, "learning_rate": 0.00040389774654021367, "loss": 4.7913, "mean_token_accuracy": 0.22193794548511506, "num_tokens": 69394616.0, "step": 40000 }, { "entropy": 5.306745910644532, "epoch": 3.1125072943007197, "grad_norm": 1.171875, "learning_rate": 0.000403875028756985, "loss": 4.8055, "mean_token_accuracy": 0.2160838097333908, "num_tokens": 69403081.0, "step": 40005 }, { "entropy": 5.3664649486541744, "epoch": 3.1128963236724374, "grad_norm": 1.203125, "learning_rate": 0.0004038523090182829, "loss": 4.9361, "mean_token_accuracy": 0.2002573847770691, "num_tokens": 69411819.0, "step": 40010 }, { "entropy": 5.367674541473389, "epoch": 3.1132853530441547, "grad_norm": 1.1328125, "learning_rate": 0.000403829587324452, "loss": 4.8427, "mean_token_accuracy": 0.21124423742294313, "num_tokens": 69419836.0, "step": 40015 }, { "entropy": 5.367705059051514, "epoch": 3.1136743824158724, "grad_norm": 1.109375, "learning_rate": 0.0004038068636758373, "loss": 4.8946, "mean_token_accuracy": 0.20429813414812087, "num_tokens": 69428524.0, "step": 40020 }, { "entropy": 5.335054397583008, "epoch": 3.11406341178759, "grad_norm": 1.0859375, "learning_rate": 0.0004037841380727834, "loss": 4.8633, "mean_token_accuracy": 0.20352984070777894, "num_tokens": 69436855.0, "step": 40025 }, { "entropy": 5.362209844589233, "epoch": 3.1144524411593073, "grad_norm": 1.15625, "learning_rate": 0.0004037614105156352, "loss": 4.9405, "mean_token_accuracy": 0.20062340945005416, "num_tokens": 69446039.0, "step": 40030 }, { "entropy": 5.361679029464722, "epoch": 3.114841470531025, "grad_norm": 1.15625, "learning_rate": 0.0004037386810047376, "loss": 4.923, "mean_token_accuracy": 0.20735732614994049, "num_tokens": 69454709.0, "step": 40035 }, { "entropy": 5.440235137939453, "epoch": 3.1152304999027427, "grad_norm": 1.1796875, "learning_rate": 0.0004037159495404354, "loss": 4.8878, "mean_token_accuracy": 0.21152849793434142, "num_tokens": 69463983.0, "step": 40040 }, { "entropy": 5.335074520111084, "epoch": 3.1156195292744604, "grad_norm": 1.296875, "learning_rate": 0.00040369321612307343, "loss": 4.8501, "mean_token_accuracy": 0.20511524528265, "num_tokens": 69472073.0, "step": 40045 }, { "entropy": 5.270042514801025, "epoch": 3.1160085586461777, "grad_norm": 1.1484375, "learning_rate": 0.00040367048075299684, "loss": 4.8553, "mean_token_accuracy": 0.2036452114582062, "num_tokens": 69480119.0, "step": 40050 }, { "entropy": 5.377756929397583, "epoch": 3.1163975880178953, "grad_norm": 1.15625, "learning_rate": 0.0004036477434305505, "loss": 4.9372, "mean_token_accuracy": 0.19983848184347153, "num_tokens": 69488517.0, "step": 40055 }, { "entropy": 5.488611173629761, "epoch": 3.116786617389613, "grad_norm": 1.1171875, "learning_rate": 0.0004036250041560794, "loss": 4.9578, "mean_token_accuracy": 0.20647504925727844, "num_tokens": 69496774.0, "step": 40060 }, { "entropy": 5.418052768707275, "epoch": 3.1171756467613303, "grad_norm": 1.1484375, "learning_rate": 0.0004036022629299286, "loss": 4.9777, "mean_token_accuracy": 0.2017388015985489, "num_tokens": 69506015.0, "step": 40065 }, { "entropy": 5.343689441680908, "epoch": 3.117564676133048, "grad_norm": 1.1328125, "learning_rate": 0.0004035795197524431, "loss": 4.9231, "mean_token_accuracy": 0.20114083737134933, "num_tokens": 69514392.0, "step": 40070 }, { "entropy": 5.353210020065307, "epoch": 3.1179537055047657, "grad_norm": 1.1015625, "learning_rate": 0.0004035567746239681, "loss": 4.8059, "mean_token_accuracy": 0.2126919984817505, "num_tokens": 69523186.0, "step": 40075 }, { "entropy": 5.336862230300904, "epoch": 3.1183427348764834, "grad_norm": 1.1328125, "learning_rate": 0.00040353402754484866, "loss": 4.9359, "mean_token_accuracy": 0.20200885236263275, "num_tokens": 69532128.0, "step": 40080 }, { "entropy": 5.332799196243286, "epoch": 3.1187317642482006, "grad_norm": 1.1875, "learning_rate": 0.0004035112785154299, "loss": 4.8677, "mean_token_accuracy": 0.20682823807001113, "num_tokens": 69539846.0, "step": 40085 }, { "entropy": 5.308258104324341, "epoch": 3.1191207936199183, "grad_norm": 1.109375, "learning_rate": 0.00040348852753605707, "loss": 4.8073, "mean_token_accuracy": 0.2081013098359108, "num_tokens": 69548238.0, "step": 40090 }, { "entropy": 5.431467294692993, "epoch": 3.119509822991636, "grad_norm": 1.0625, "learning_rate": 0.00040346577460707535, "loss": 4.9708, "mean_token_accuracy": 0.2026794895529747, "num_tokens": 69557574.0, "step": 40095 }, { "entropy": 5.386212968826294, "epoch": 3.1198988523633533, "grad_norm": 1.0703125, "learning_rate": 0.00040344301972882997, "loss": 4.8441, "mean_token_accuracy": 0.2082304388284683, "num_tokens": 69565711.0, "step": 40100 }, { "entropy": 5.259875345230102, "epoch": 3.120287881735071, "grad_norm": 1.1484375, "learning_rate": 0.0004034202629016662, "loss": 4.8248, "mean_token_accuracy": 0.20505126118659972, "num_tokens": 69574589.0, "step": 40105 }, { "entropy": 5.349554014205933, "epoch": 3.1206769111067887, "grad_norm": 1.25, "learning_rate": 0.00040339750412592937, "loss": 4.8654, "mean_token_accuracy": 0.2117622449994087, "num_tokens": 69583229.0, "step": 40110 }, { "entropy": 5.3815450191497805, "epoch": 3.121065940478506, "grad_norm": 1.0625, "learning_rate": 0.0004033747434019647, "loss": 4.9407, "mean_token_accuracy": 0.20640986561775207, "num_tokens": 69591727.0, "step": 40115 }, { "entropy": 5.337004804611206, "epoch": 3.1214549698502236, "grad_norm": 1.109375, "learning_rate": 0.00040335198073011765, "loss": 4.8375, "mean_token_accuracy": 0.20756037682294845, "num_tokens": 69600192.0, "step": 40120 }, { "entropy": 5.29621696472168, "epoch": 3.1218439992219413, "grad_norm": 1.2109375, "learning_rate": 0.0004033292161107336, "loss": 4.8558, "mean_token_accuracy": 0.21316477209329604, "num_tokens": 69608373.0, "step": 40125 }, { "entropy": 5.334916019439698, "epoch": 3.122233028593659, "grad_norm": 1.1328125, "learning_rate": 0.00040330644954415795, "loss": 4.8743, "mean_token_accuracy": 0.20358263999223708, "num_tokens": 69616140.0, "step": 40130 }, { "entropy": 5.331064033508301, "epoch": 3.1226220579653763, "grad_norm": 1.109375, "learning_rate": 0.0004032836810307362, "loss": 4.8826, "mean_token_accuracy": 0.21480502039194108, "num_tokens": 69624453.0, "step": 40135 }, { "entropy": 5.403168058395385, "epoch": 3.123011087337094, "grad_norm": 1.1640625, "learning_rate": 0.0004032609105708137, "loss": 4.9296, "mean_token_accuracy": 0.204910109937191, "num_tokens": 69633483.0, "step": 40140 }, { "entropy": 5.41729416847229, "epoch": 3.1234001167088117, "grad_norm": 1.21875, "learning_rate": 0.00040323813816473604, "loss": 4.8604, "mean_token_accuracy": 0.20464650690555572, "num_tokens": 69641934.0, "step": 40145 }, { "entropy": 5.285771274566651, "epoch": 3.123789146080529, "grad_norm": 1.140625, "learning_rate": 0.0004032153638128488, "loss": 4.8498, "mean_token_accuracy": 0.20453405976295472, "num_tokens": 69650694.0, "step": 40150 }, { "entropy": 5.298635196685791, "epoch": 3.1241781754522466, "grad_norm": 1.0625, "learning_rate": 0.00040319258751549743, "loss": 4.8507, "mean_token_accuracy": 0.20757994055747986, "num_tokens": 69660138.0, "step": 40155 }, { "entropy": 5.431415367126465, "epoch": 3.1245672048239643, "grad_norm": 1.21875, "learning_rate": 0.00040316980927302765, "loss": 4.908, "mean_token_accuracy": 0.2061296135187149, "num_tokens": 69668238.0, "step": 40160 }, { "entropy": 5.390276956558227, "epoch": 3.1249562341956816, "grad_norm": 1.15625, "learning_rate": 0.00040314702908578496, "loss": 4.9349, "mean_token_accuracy": 0.19668539762496948, "num_tokens": 69677228.0, "step": 40165 }, { "entropy": 5.31136679649353, "epoch": 3.1253452635673993, "grad_norm": 1.328125, "learning_rate": 0.0004031242469541151, "loss": 4.8576, "mean_token_accuracy": 0.20910992175340654, "num_tokens": 69686337.0, "step": 40170 }, { "entropy": 5.409294176101684, "epoch": 3.125734292939117, "grad_norm": 1.1875, "learning_rate": 0.00040310146287836373, "loss": 4.8825, "mean_token_accuracy": 0.20549166798591614, "num_tokens": 69695368.0, "step": 40175 }, { "entropy": 5.376325178146362, "epoch": 3.1261233223108347, "grad_norm": 1.1640625, "learning_rate": 0.00040307867685887653, "loss": 4.872, "mean_token_accuracy": 0.20605642199516297, "num_tokens": 69703811.0, "step": 40180 }, { "entropy": 5.252239561080932, "epoch": 3.126512351682552, "grad_norm": 1.171875, "learning_rate": 0.00040305588889599927, "loss": 4.7211, "mean_token_accuracy": 0.22173484712839125, "num_tokens": 69712619.0, "step": 40185 }, { "entropy": 5.325303363800049, "epoch": 3.1269013810542696, "grad_norm": 1.1328125, "learning_rate": 0.0004030330989900777, "loss": 4.9478, "mean_token_accuracy": 0.20044964998960496, "num_tokens": 69720945.0, "step": 40190 }, { "entropy": 5.435241794586181, "epoch": 3.1272904104259873, "grad_norm": 1.1484375, "learning_rate": 0.00040301030714145764, "loss": 4.9085, "mean_token_accuracy": 0.20907322466373443, "num_tokens": 69729827.0, "step": 40195 }, { "entropy": 5.389410734176636, "epoch": 3.1276794397977046, "grad_norm": 1.125, "learning_rate": 0.000402987513350485, "loss": 4.8806, "mean_token_accuracy": 0.20707599073648453, "num_tokens": 69738719.0, "step": 40200 }, { "entropy": 5.353525924682617, "epoch": 3.1280684691694223, "grad_norm": 1.046875, "learning_rate": 0.0004029647176175055, "loss": 4.8791, "mean_token_accuracy": 0.20640521496534348, "num_tokens": 69747379.0, "step": 40205 }, { "entropy": 5.289103889465332, "epoch": 3.12845749854114, "grad_norm": 1.109375, "learning_rate": 0.00040294191994286513, "loss": 4.7964, "mean_token_accuracy": 0.217774897813797, "num_tokens": 69755926.0, "step": 40210 }, { "entropy": 5.423659753799439, "epoch": 3.1288465279128572, "grad_norm": 1.125, "learning_rate": 0.00040291912032690963, "loss": 4.9151, "mean_token_accuracy": 0.19890027046203612, "num_tokens": 69763851.0, "step": 40215 }, { "entropy": 5.380201387405395, "epoch": 3.129235557284575, "grad_norm": 1.1328125, "learning_rate": 0.0004028963187699852, "loss": 4.8452, "mean_token_accuracy": 0.21401526629924775, "num_tokens": 69771332.0, "step": 40220 }, { "entropy": 5.324225664138794, "epoch": 3.1296245866562926, "grad_norm": 1.1953125, "learning_rate": 0.0004028735152724377, "loss": 4.8299, "mean_token_accuracy": 0.21453750729560853, "num_tokens": 69779878.0, "step": 40225 }, { "entropy": 5.353233528137207, "epoch": 3.1300136160280103, "grad_norm": 1.1171875, "learning_rate": 0.00040285070983461313, "loss": 4.9609, "mean_token_accuracy": 0.2039760172367096, "num_tokens": 69788564.0, "step": 40230 }, { "entropy": 5.365759706497192, "epoch": 3.1304026453997276, "grad_norm": 1.1015625, "learning_rate": 0.00040282790245685753, "loss": 4.9381, "mean_token_accuracy": 0.20766042321920394, "num_tokens": 69797512.0, "step": 40235 }, { "entropy": 5.394866323471069, "epoch": 3.1307916747714453, "grad_norm": 1.1640625, "learning_rate": 0.000402805093139517, "loss": 4.8655, "mean_token_accuracy": 0.21376823931932448, "num_tokens": 69806103.0, "step": 40240 }, { "entropy": 5.297544622421265, "epoch": 3.131180704143163, "grad_norm": 1.171875, "learning_rate": 0.0004027822818829375, "loss": 4.8966, "mean_token_accuracy": 0.2064782425761223, "num_tokens": 69814881.0, "step": 40245 }, { "entropy": 5.395734977722168, "epoch": 3.13156973351488, "grad_norm": 1.140625, "learning_rate": 0.0004027594686874653, "loss": 4.9208, "mean_token_accuracy": 0.20460042655467986, "num_tokens": 69823507.0, "step": 40250 }, { "entropy": 5.342482852935791, "epoch": 3.131958762886598, "grad_norm": 1.203125, "learning_rate": 0.00040273665355344655, "loss": 4.8448, "mean_token_accuracy": 0.2050609052181244, "num_tokens": 69832960.0, "step": 40255 }, { "entropy": 5.3982704162597654, "epoch": 3.1323477922583156, "grad_norm": 1.1796875, "learning_rate": 0.0004027138364812274, "loss": 4.9016, "mean_token_accuracy": 0.2055274710059166, "num_tokens": 69841216.0, "step": 40260 }, { "entropy": 5.3960167407989506, "epoch": 3.132736821630033, "grad_norm": 1.171875, "learning_rate": 0.0004026910174711541, "loss": 4.956, "mean_token_accuracy": 0.20234512388706208, "num_tokens": 69849847.0, "step": 40265 }, { "entropy": 5.442897939682007, "epoch": 3.1331258510017506, "grad_norm": 1.21875, "learning_rate": 0.00040266819652357266, "loss": 5.0305, "mean_token_accuracy": 0.1991891771554947, "num_tokens": 69859616.0, "step": 40270 }, { "entropy": 5.414956521987915, "epoch": 3.1335148803734683, "grad_norm": 1.1171875, "learning_rate": 0.00040264537363882976, "loss": 4.9392, "mean_token_accuracy": 0.2037709727883339, "num_tokens": 69869203.0, "step": 40275 }, { "entropy": 5.4073206901550295, "epoch": 3.133903909745186, "grad_norm": 1.234375, "learning_rate": 0.00040262254881727135, "loss": 4.8025, "mean_token_accuracy": 0.21401309221982956, "num_tokens": 69877127.0, "step": 40280 }, { "entropy": 5.444560813903808, "epoch": 3.134292939116903, "grad_norm": 1.1015625, "learning_rate": 0.00040259972205924395, "loss": 5.0473, "mean_token_accuracy": 0.19441619962453843, "num_tokens": 69885676.0, "step": 40285 }, { "entropy": 5.399515628814697, "epoch": 3.134681968488621, "grad_norm": 1.09375, "learning_rate": 0.00040257689336509385, "loss": 4.9289, "mean_token_accuracy": 0.20139123052358626, "num_tokens": 69894818.0, "step": 40290 }, { "entropy": 5.3704366207122805, "epoch": 3.1350709978603386, "grad_norm": 1.2265625, "learning_rate": 0.0004025540627351675, "loss": 4.8679, "mean_token_accuracy": 0.21071064621210098, "num_tokens": 69902786.0, "step": 40295 }, { "entropy": 5.388719463348389, "epoch": 3.135460027232056, "grad_norm": 1.109375, "learning_rate": 0.0004025312301698112, "loss": 4.8788, "mean_token_accuracy": 0.21232085227966307, "num_tokens": 69911343.0, "step": 40300 }, { "entropy": 5.392844104766846, "epoch": 3.1358490566037736, "grad_norm": 1.15625, "learning_rate": 0.0004025083956693715, "loss": 4.9044, "mean_token_accuracy": 0.2013694539666176, "num_tokens": 69920234.0, "step": 40305 }, { "entropy": 5.415490198135376, "epoch": 3.1362380859754913, "grad_norm": 1.2109375, "learning_rate": 0.0004024855592341948, "loss": 4.8916, "mean_token_accuracy": 0.2073521226644516, "num_tokens": 69928680.0, "step": 40310 }, { "entropy": 5.342182397842407, "epoch": 3.136627115347209, "grad_norm": 1.1875, "learning_rate": 0.0004024627208646277, "loss": 4.8729, "mean_token_accuracy": 0.21834908276796341, "num_tokens": 69937020.0, "step": 40315 }, { "entropy": 5.393909740447998, "epoch": 3.137016144718926, "grad_norm": 1.1875, "learning_rate": 0.00040243988056101667, "loss": 4.8958, "mean_token_accuracy": 0.20862918198108674, "num_tokens": 69946402.0, "step": 40320 }, { "entropy": 5.4395952224731445, "epoch": 3.137405174090644, "grad_norm": 1.15625, "learning_rate": 0.0004024170383237083, "loss": 4.9043, "mean_token_accuracy": 0.21211323738098145, "num_tokens": 69954386.0, "step": 40325 }, { "entropy": 5.281073522567749, "epoch": 3.1377942034623616, "grad_norm": 1.140625, "learning_rate": 0.0004023941941530492, "loss": 4.7498, "mean_token_accuracy": 0.21993305087089537, "num_tokens": 69962825.0, "step": 40330 }, { "entropy": 5.391599225997925, "epoch": 3.138183232834079, "grad_norm": 1.15625, "learning_rate": 0.000402371348049386, "loss": 4.9592, "mean_token_accuracy": 0.20974842309951783, "num_tokens": 69971726.0, "step": 40335 }, { "entropy": 5.398697710037231, "epoch": 3.1385722622057965, "grad_norm": 1.1328125, "learning_rate": 0.0004023485000130653, "loss": 4.8945, "mean_token_accuracy": 0.2095278486609459, "num_tokens": 69979891.0, "step": 40340 }, { "entropy": 5.386595582962036, "epoch": 3.1389612915775142, "grad_norm": 1.1796875, "learning_rate": 0.00040232565004443373, "loss": 4.8299, "mean_token_accuracy": 0.2102814570069313, "num_tokens": 69988052.0, "step": 40345 }, { "entropy": 5.343291521072388, "epoch": 3.1393503209492315, "grad_norm": 1.203125, "learning_rate": 0.0004023027981438382, "loss": 4.8541, "mean_token_accuracy": 0.20610954910516738, "num_tokens": 69996221.0, "step": 40350 }, { "entropy": 5.380416631698608, "epoch": 3.139739350320949, "grad_norm": 1.109375, "learning_rate": 0.00040227994431162517, "loss": 4.9506, "mean_token_accuracy": 0.20314665287733077, "num_tokens": 70004928.0, "step": 40355 }, { "entropy": 5.327496004104614, "epoch": 3.140128379692667, "grad_norm": 1.0546875, "learning_rate": 0.00040225708854814174, "loss": 4.8891, "mean_token_accuracy": 0.20487699806690216, "num_tokens": 70013525.0, "step": 40360 }, { "entropy": 5.409126234054566, "epoch": 3.140517409064384, "grad_norm": 1.09375, "learning_rate": 0.0004022342308537345, "loss": 4.9377, "mean_token_accuracy": 0.20181942582130433, "num_tokens": 70021845.0, "step": 40365 }, { "entropy": 5.3865447521209715, "epoch": 3.140906438436102, "grad_norm": 1.1875, "learning_rate": 0.0004022113712287503, "loss": 4.8947, "mean_token_accuracy": 0.20183716267347335, "num_tokens": 70030370.0, "step": 40370 }, { "entropy": 5.364449691772461, "epoch": 3.1412954678078195, "grad_norm": 1.1328125, "learning_rate": 0.000402188509673536, "loss": 4.9027, "mean_token_accuracy": 0.20568051934242249, "num_tokens": 70038555.0, "step": 40375 }, { "entropy": 5.368240022659302, "epoch": 3.1416844971795372, "grad_norm": 1.1171875, "learning_rate": 0.00040216564618843854, "loss": 4.8879, "mean_token_accuracy": 0.2091048151254654, "num_tokens": 70047416.0, "step": 40380 }, { "entropy": 5.320351839065552, "epoch": 3.1420735265512545, "grad_norm": 1.234375, "learning_rate": 0.0004021427807738048, "loss": 4.9194, "mean_token_accuracy": 0.19994339048862458, "num_tokens": 70056058.0, "step": 40385 }, { "entropy": 5.392819786071778, "epoch": 3.142462555922972, "grad_norm": 1.21875, "learning_rate": 0.0004021199134299817, "loss": 4.9016, "mean_token_accuracy": 0.20911280512809755, "num_tokens": 70064020.0, "step": 40390 }, { "entropy": 5.298990774154663, "epoch": 3.14285158529469, "grad_norm": 1.125, "learning_rate": 0.00040209704415731623, "loss": 4.867, "mean_token_accuracy": 0.211707603931427, "num_tokens": 70072675.0, "step": 40395 }, { "entropy": 5.384028482437134, "epoch": 3.143240614666407, "grad_norm": 1.1875, "learning_rate": 0.00040207417295615546, "loss": 4.8435, "mean_token_accuracy": 0.21490723192691802, "num_tokens": 70081061.0, "step": 40400 }, { "entropy": 5.3710103034973145, "epoch": 3.143629644038125, "grad_norm": 1.1171875, "learning_rate": 0.00040205129982684635, "loss": 4.8469, "mean_token_accuracy": 0.20873931497335435, "num_tokens": 70089837.0, "step": 40405 }, { "entropy": 5.2984226703643795, "epoch": 3.1440186734098425, "grad_norm": 1.1171875, "learning_rate": 0.00040202842476973606, "loss": 4.882, "mean_token_accuracy": 0.2059580534696579, "num_tokens": 70099638.0, "step": 40410 }, { "entropy": 5.394252586364746, "epoch": 3.1444077027815602, "grad_norm": 1.140625, "learning_rate": 0.00040200554778517154, "loss": 4.9322, "mean_token_accuracy": 0.20417493283748628, "num_tokens": 70108156.0, "step": 40415 }, { "entropy": 5.449779844284057, "epoch": 3.1447967321532775, "grad_norm": 1.171875, "learning_rate": 0.00040198266887349994, "loss": 4.9387, "mean_token_accuracy": 0.21387397795915603, "num_tokens": 70116627.0, "step": 40420 }, { "entropy": 5.392884111404419, "epoch": 3.145185761524995, "grad_norm": 1.1484375, "learning_rate": 0.00040195978803506853, "loss": 4.9468, "mean_token_accuracy": 0.20222701132297516, "num_tokens": 70124796.0, "step": 40425 }, { "entropy": 5.401149415969849, "epoch": 3.145574790896713, "grad_norm": 1.0859375, "learning_rate": 0.00040193690527022443, "loss": 4.94, "mean_token_accuracy": 0.2050477609038353, "num_tokens": 70134047.0, "step": 40430 }, { "entropy": 5.333043336868286, "epoch": 3.14596382026843, "grad_norm": 1.171875, "learning_rate": 0.00040191402057931474, "loss": 4.8143, "mean_token_accuracy": 0.20831589698791503, "num_tokens": 70142706.0, "step": 40435 }, { "entropy": 5.4017455101013185, "epoch": 3.146352849640148, "grad_norm": 1.078125, "learning_rate": 0.0004018911339626869, "loss": 4.9241, "mean_token_accuracy": 0.2054540127515793, "num_tokens": 70151775.0, "step": 40440 }, { "entropy": 5.3195658206939695, "epoch": 3.1467418790118655, "grad_norm": 1.09375, "learning_rate": 0.000401868245420688, "loss": 4.8675, "mean_token_accuracy": 0.20930508971214296, "num_tokens": 70160208.0, "step": 40445 }, { "entropy": 5.380018663406372, "epoch": 3.147130908383583, "grad_norm": 1.1484375, "learning_rate": 0.00040184535495366543, "loss": 4.9361, "mean_token_accuracy": 0.20575164556503295, "num_tokens": 70168881.0, "step": 40450 }, { "entropy": 5.40568733215332, "epoch": 3.1475199377553005, "grad_norm": 1.1953125, "learning_rate": 0.0004018224625619664, "loss": 4.8702, "mean_token_accuracy": 0.21192592680454253, "num_tokens": 70176862.0, "step": 40455 }, { "entropy": 5.359659814834595, "epoch": 3.147908967127018, "grad_norm": 1.140625, "learning_rate": 0.00040179956824593847, "loss": 4.8057, "mean_token_accuracy": 0.21260741204023362, "num_tokens": 70185199.0, "step": 40460 }, { "entropy": 5.2732336044311525, "epoch": 3.1482979964987354, "grad_norm": 1.1171875, "learning_rate": 0.00040177667200592894, "loss": 4.8208, "mean_token_accuracy": 0.2140389859676361, "num_tokens": 70193323.0, "step": 40465 }, { "entropy": 5.375649929046631, "epoch": 3.148687025870453, "grad_norm": 1.109375, "learning_rate": 0.0004017537738422852, "loss": 4.8747, "mean_token_accuracy": 0.20643111169338227, "num_tokens": 70202082.0, "step": 40470 }, { "entropy": 5.384236288070679, "epoch": 3.149076055242171, "grad_norm": 1.1796875, "learning_rate": 0.00040173087375535457, "loss": 4.9314, "mean_token_accuracy": 0.20547318309545518, "num_tokens": 70211504.0, "step": 40475 }, { "entropy": 5.484420967102051, "epoch": 3.1494650846138885, "grad_norm": 1.265625, "learning_rate": 0.00040170797174548476, "loss": 5.0041, "mean_token_accuracy": 0.19937659054994583, "num_tokens": 70219717.0, "step": 40480 }, { "entropy": 5.3837755680084225, "epoch": 3.1498541139856058, "grad_norm": 1.1328125, "learning_rate": 0.00040168506781302303, "loss": 4.9273, "mean_token_accuracy": 0.2100866988301277, "num_tokens": 70228877.0, "step": 40485 }, { "entropy": 5.319440031051636, "epoch": 3.1502431433573235, "grad_norm": 1.1328125, "learning_rate": 0.0004016621619583171, "loss": 4.8403, "mean_token_accuracy": 0.20495802462100982, "num_tokens": 70237538.0, "step": 40490 }, { "entropy": 5.340173530578613, "epoch": 3.150632172729041, "grad_norm": 1.1796875, "learning_rate": 0.00040163925418171454, "loss": 4.8656, "mean_token_accuracy": 0.20959947556257247, "num_tokens": 70245977.0, "step": 40495 }, { "entropy": 5.342642498016358, "epoch": 3.1510212021007584, "grad_norm": 1.1171875, "learning_rate": 0.0004016163444835628, "loss": 4.8916, "mean_token_accuracy": 0.20941452085971832, "num_tokens": 70255262.0, "step": 40500 }, { "entropy": 5.341546440124512, "epoch": 3.151410231472476, "grad_norm": 1.09375, "learning_rate": 0.0004015934328642096, "loss": 4.7383, "mean_token_accuracy": 0.2134230449795723, "num_tokens": 70263999.0, "step": 40505 }, { "entropy": 5.340118074417115, "epoch": 3.151799260844194, "grad_norm": 1.09375, "learning_rate": 0.00040157051932400244, "loss": 4.8608, "mean_token_accuracy": 0.20276293456554412, "num_tokens": 70272228.0, "step": 40510 }, { "entropy": 5.309202480316162, "epoch": 3.1521882902159115, "grad_norm": 1.1171875, "learning_rate": 0.0004015476038632892, "loss": 4.9147, "mean_token_accuracy": 0.20733501017093658, "num_tokens": 70281818.0, "step": 40515 }, { "entropy": 5.36655330657959, "epoch": 3.1525773195876288, "grad_norm": 1.2421875, "learning_rate": 0.0004015246864824175, "loss": 4.9278, "mean_token_accuracy": 0.20221686065196992, "num_tokens": 70290298.0, "step": 40520 }, { "entropy": 5.30918779373169, "epoch": 3.1529663489593465, "grad_norm": 1.28125, "learning_rate": 0.00040150176718173504, "loss": 4.8038, "mean_token_accuracy": 0.2186904400587082, "num_tokens": 70299166.0, "step": 40525 }, { "entropy": 5.33083758354187, "epoch": 3.153355378331064, "grad_norm": 1.109375, "learning_rate": 0.0004014788459615896, "loss": 4.8398, "mean_token_accuracy": 0.20933312326669692, "num_tokens": 70308110.0, "step": 40530 }, { "entropy": 5.324524021148681, "epoch": 3.1537444077027814, "grad_norm": 1.125, "learning_rate": 0.0004014559228223291, "loss": 4.7801, "mean_token_accuracy": 0.2150770455598831, "num_tokens": 70317270.0, "step": 40535 }, { "entropy": 5.420511913299561, "epoch": 3.154133437074499, "grad_norm": 1.1484375, "learning_rate": 0.00040143299776430115, "loss": 4.9595, "mean_token_accuracy": 0.20503859370946884, "num_tokens": 70326078.0, "step": 40540 }, { "entropy": 5.37081503868103, "epoch": 3.154522466446217, "grad_norm": 1.140625, "learning_rate": 0.0004014100707878536, "loss": 4.8871, "mean_token_accuracy": 0.21537187397480012, "num_tokens": 70334388.0, "step": 40545 }, { "entropy": 5.389930963516235, "epoch": 3.154911495817934, "grad_norm": 1.1796875, "learning_rate": 0.00040138714189333455, "loss": 4.8869, "mean_token_accuracy": 0.21046380698680878, "num_tokens": 70342844.0, "step": 40550 }, { "entropy": 5.4401164054870605, "epoch": 3.1553005251896518, "grad_norm": 1.21875, "learning_rate": 0.00040136421108109176, "loss": 5.0011, "mean_token_accuracy": 0.20090001076459885, "num_tokens": 70351331.0, "step": 40555 }, { "entropy": 5.395886182785034, "epoch": 3.1556895545613695, "grad_norm": 1.140625, "learning_rate": 0.0004013412783514732, "loss": 4.9119, "mean_token_accuracy": 0.20311810374259948, "num_tokens": 70359573.0, "step": 40560 }, { "entropy": 5.4086761474609375, "epoch": 3.156078583933087, "grad_norm": 1.2265625, "learning_rate": 0.0004013183437048268, "loss": 4.8716, "mean_token_accuracy": 0.2180813029408455, "num_tokens": 70367586.0, "step": 40565 }, { "entropy": 5.337568521499634, "epoch": 3.1564676133048044, "grad_norm": 1.140625, "learning_rate": 0.00040129540714150066, "loss": 4.8337, "mean_token_accuracy": 0.21647854298353195, "num_tokens": 70376399.0, "step": 40570 }, { "entropy": 5.370188903808594, "epoch": 3.156856642676522, "grad_norm": 1.078125, "learning_rate": 0.0004012724686618427, "loss": 4.9439, "mean_token_accuracy": 0.19555094689130784, "num_tokens": 70385221.0, "step": 40575 }, { "entropy": 5.395825529098511, "epoch": 3.15724567204824, "grad_norm": 1.1171875, "learning_rate": 0.000401249528266201, "loss": 4.931, "mean_token_accuracy": 0.20272525697946547, "num_tokens": 70393844.0, "step": 40580 }, { "entropy": 5.366936206817627, "epoch": 3.157634701419957, "grad_norm": 1.25, "learning_rate": 0.00040122658595492366, "loss": 4.8098, "mean_token_accuracy": 0.21259437948465348, "num_tokens": 70402417.0, "step": 40585 }, { "entropy": 5.390923738479614, "epoch": 3.1580237307916748, "grad_norm": 1.1484375, "learning_rate": 0.0004012036417283588, "loss": 4.829, "mean_token_accuracy": 0.21449365615844726, "num_tokens": 70410932.0, "step": 40590 }, { "entropy": 5.303453588485718, "epoch": 3.1584127601633925, "grad_norm": 1.109375, "learning_rate": 0.00040118069558685456, "loss": 4.8188, "mean_token_accuracy": 0.2064634919166565, "num_tokens": 70419528.0, "step": 40595 }, { "entropy": 5.31270809173584, "epoch": 3.1588017895351097, "grad_norm": 1.1640625, "learning_rate": 0.00040115774753075905, "loss": 4.8965, "mean_token_accuracy": 0.2104461297392845, "num_tokens": 70428220.0, "step": 40600 }, { "entropy": 5.290410327911377, "epoch": 3.1591908189068274, "grad_norm": 1.171875, "learning_rate": 0.0004011347975604206, "loss": 4.7685, "mean_token_accuracy": 0.22126491218805314, "num_tokens": 70436155.0, "step": 40605 }, { "entropy": 5.371480274200439, "epoch": 3.159579848278545, "grad_norm": 1.140625, "learning_rate": 0.0004011118456761873, "loss": 4.9479, "mean_token_accuracy": 0.20990384221076966, "num_tokens": 70445618.0, "step": 40610 }, { "entropy": 5.355297660827636, "epoch": 3.159968877650263, "grad_norm": 1.0546875, "learning_rate": 0.0004010888918784075, "loss": 4.8408, "mean_token_accuracy": 0.21679199635982513, "num_tokens": 70454681.0, "step": 40615 }, { "entropy": 5.301231813430786, "epoch": 3.16035790702198, "grad_norm": 1.1796875, "learning_rate": 0.0004010659361674294, "loss": 4.8111, "mean_token_accuracy": 0.21232539564371108, "num_tokens": 70463408.0, "step": 40620 }, { "entropy": 5.405141735076905, "epoch": 3.1607469363936977, "grad_norm": 1.1640625, "learning_rate": 0.00040104297854360145, "loss": 4.9466, "mean_token_accuracy": 0.20330903679132462, "num_tokens": 70472010.0, "step": 40625 }, { "entropy": 5.415031385421753, "epoch": 3.1611359657654154, "grad_norm": 1.1484375, "learning_rate": 0.0004010200190072719, "loss": 4.8986, "mean_token_accuracy": 0.20761923342943192, "num_tokens": 70480869.0, "step": 40630 }, { "entropy": 5.373095226287842, "epoch": 3.1615249951371327, "grad_norm": 1.078125, "learning_rate": 0.0004009970575587891, "loss": 4.8893, "mean_token_accuracy": 0.20356594771146774, "num_tokens": 70489651.0, "step": 40635 }, { "entropy": 5.298930358886719, "epoch": 3.1619140245088504, "grad_norm": 1.140625, "learning_rate": 0.0004009740941985016, "loss": 4.8523, "mean_token_accuracy": 0.2056410938501358, "num_tokens": 70498332.0, "step": 40640 }, { "entropy": 5.42194356918335, "epoch": 3.162303053880568, "grad_norm": 1.21875, "learning_rate": 0.0004009511289267576, "loss": 4.998, "mean_token_accuracy": 0.19585587829351425, "num_tokens": 70507504.0, "step": 40645 }, { "entropy": 5.422905826568604, "epoch": 3.1626920832522853, "grad_norm": 1.09375, "learning_rate": 0.0004009281617439058, "loss": 4.9256, "mean_token_accuracy": 0.20331190079450606, "num_tokens": 70516560.0, "step": 40650 }, { "entropy": 5.370505046844483, "epoch": 3.163081112624003, "grad_norm": 1.140625, "learning_rate": 0.0004009051926502945, "loss": 4.8869, "mean_token_accuracy": 0.21485923379659652, "num_tokens": 70524387.0, "step": 40655 }, { "entropy": 5.34507999420166, "epoch": 3.1634701419957207, "grad_norm": 1.171875, "learning_rate": 0.00040088222164627233, "loss": 4.9253, "mean_token_accuracy": 0.2156902953982353, "num_tokens": 70533393.0, "step": 40660 }, { "entropy": 5.340969133377075, "epoch": 3.1638591713674384, "grad_norm": 1.1484375, "learning_rate": 0.00040085924873218783, "loss": 4.8214, "mean_token_accuracy": 0.20664364099502563, "num_tokens": 70542353.0, "step": 40665 }, { "entropy": 5.332652044296265, "epoch": 3.1642482007391557, "grad_norm": 1.1328125, "learning_rate": 0.0004008362739083895, "loss": 4.8406, "mean_token_accuracy": 0.20525905191898347, "num_tokens": 70550543.0, "step": 40670 }, { "entropy": 5.366426849365235, "epoch": 3.1646372301108734, "grad_norm": 1.140625, "learning_rate": 0.000400813297175226, "loss": 4.8544, "mean_token_accuracy": 0.20537822395563127, "num_tokens": 70558671.0, "step": 40675 }, { "entropy": 5.275816869735718, "epoch": 3.165026259482591, "grad_norm": 1.203125, "learning_rate": 0.000400790318533046, "loss": 4.7717, "mean_token_accuracy": 0.21961667239665986, "num_tokens": 70566938.0, "step": 40680 }, { "entropy": 5.4340015888214115, "epoch": 3.1654152888543083, "grad_norm": 1.1484375, "learning_rate": 0.00040076733798219817, "loss": 4.9479, "mean_token_accuracy": 0.2096466451883316, "num_tokens": 70575281.0, "step": 40685 }, { "entropy": 5.315427827835083, "epoch": 3.165804318226026, "grad_norm": 1.1640625, "learning_rate": 0.0004007443555230312, "loss": 4.8618, "mean_token_accuracy": 0.20321063399314881, "num_tokens": 70584543.0, "step": 40690 }, { "entropy": 5.388792228698731, "epoch": 3.1661933475977437, "grad_norm": 1.109375, "learning_rate": 0.00040072137115589366, "loss": 4.9507, "mean_token_accuracy": 0.19957754164934158, "num_tokens": 70594385.0, "step": 40695 }, { "entropy": 5.388979148864746, "epoch": 3.166582376969461, "grad_norm": 1.21875, "learning_rate": 0.0004006983848811345, "loss": 4.8667, "mean_token_accuracy": 0.21051215082407, "num_tokens": 70602842.0, "step": 40700 }, { "entropy": 5.379982662200928, "epoch": 3.1669714063411787, "grad_norm": 1.1171875, "learning_rate": 0.00040067539669910235, "loss": 4.9211, "mean_token_accuracy": 0.2004130706191063, "num_tokens": 70611845.0, "step": 40705 }, { "entropy": 5.403703451156616, "epoch": 3.1673604357128964, "grad_norm": 1.1171875, "learning_rate": 0.0004006524066101461, "loss": 4.9615, "mean_token_accuracy": 0.19907924979925157, "num_tokens": 70621351.0, "step": 40710 }, { "entropy": 5.422404766082764, "epoch": 3.167749465084614, "grad_norm": 1.1953125, "learning_rate": 0.0004006294146146146, "loss": 4.9207, "mean_token_accuracy": 0.20416584610939026, "num_tokens": 70629765.0, "step": 40715 }, { "entropy": 5.502452802658081, "epoch": 3.1681384944563313, "grad_norm": 1.1640625, "learning_rate": 0.0004006064207128567, "loss": 4.986, "mean_token_accuracy": 0.20159444510936736, "num_tokens": 70637812.0, "step": 40720 }, { "entropy": 5.407199192047119, "epoch": 3.168527523828049, "grad_norm": 1.1171875, "learning_rate": 0.00040058342490522134, "loss": 4.9075, "mean_token_accuracy": 0.20362248569726943, "num_tokens": 70647268.0, "step": 40725 }, { "entropy": 5.257736539840698, "epoch": 3.1689165531997667, "grad_norm": 1.09375, "learning_rate": 0.0004005604271920573, "loss": 4.7246, "mean_token_accuracy": 0.21818455755710603, "num_tokens": 70655911.0, "step": 40730 }, { "entropy": 5.282678031921387, "epoch": 3.169305582571484, "grad_norm": 1.0859375, "learning_rate": 0.00040053742757371365, "loss": 4.8457, "mean_token_accuracy": 0.21023205816745758, "num_tokens": 70664323.0, "step": 40735 }, { "entropy": 5.304571104049683, "epoch": 3.1696946119432017, "grad_norm": 1.0546875, "learning_rate": 0.0004005144260505394, "loss": 4.8334, "mean_token_accuracy": 0.2170025959610939, "num_tokens": 70673081.0, "step": 40740 }, { "entropy": 5.367451810836792, "epoch": 3.1700836413149194, "grad_norm": 1.1015625, "learning_rate": 0.0004004914226228834, "loss": 4.8826, "mean_token_accuracy": 0.2148715525865555, "num_tokens": 70681668.0, "step": 40745 }, { "entropy": 5.3943780899047855, "epoch": 3.170472670686637, "grad_norm": 1.1171875, "learning_rate": 0.0004004684172910949, "loss": 4.8526, "mean_token_accuracy": 0.2119895726442337, "num_tokens": 70689875.0, "step": 40750 }, { "entropy": 5.383929920196533, "epoch": 3.1708617000583543, "grad_norm": 1.1875, "learning_rate": 0.0004004454100555229, "loss": 4.9825, "mean_token_accuracy": 0.20376113206148147, "num_tokens": 70699634.0, "step": 40755 }, { "entropy": 5.457249116897583, "epoch": 3.171250729430072, "grad_norm": 1.1171875, "learning_rate": 0.00040042240091651645, "loss": 4.966, "mean_token_accuracy": 0.20787006318569184, "num_tokens": 70708951.0, "step": 40760 }, { "entropy": 5.404014015197754, "epoch": 3.1716397588017897, "grad_norm": 1.1171875, "learning_rate": 0.00040039938987442464, "loss": 4.8721, "mean_token_accuracy": 0.21195762753486633, "num_tokens": 70717317.0, "step": 40765 }, { "entropy": 5.420404148101807, "epoch": 3.172028788173507, "grad_norm": 1.2265625, "learning_rate": 0.00040037637692959667, "loss": 4.956, "mean_token_accuracy": 0.20098093748092652, "num_tokens": 70725867.0, "step": 40770 }, { "entropy": 5.29369535446167, "epoch": 3.1724178175452247, "grad_norm": 1.125, "learning_rate": 0.00040035336208238176, "loss": 4.8479, "mean_token_accuracy": 0.21436292082071304, "num_tokens": 70734774.0, "step": 40775 }, { "entropy": 5.447038221359253, "epoch": 3.1728068469169424, "grad_norm": 1.2265625, "learning_rate": 0.00040033034533312913, "loss": 4.9017, "mean_token_accuracy": 0.1999308481812477, "num_tokens": 70743420.0, "step": 40780 }, { "entropy": 5.4357240200042725, "epoch": 3.1731958762886596, "grad_norm": 1.1640625, "learning_rate": 0.000400307326682188, "loss": 4.9133, "mean_token_accuracy": 0.20987289249897004, "num_tokens": 70751979.0, "step": 40785 }, { "entropy": 5.355973958969116, "epoch": 3.1735849056603773, "grad_norm": 1.2421875, "learning_rate": 0.00040028430612990755, "loss": 4.8846, "mean_token_accuracy": 0.20614465028047563, "num_tokens": 70760652.0, "step": 40790 }, { "entropy": 5.370217418670654, "epoch": 3.173973935032095, "grad_norm": 1.2109375, "learning_rate": 0.00040026128367663726, "loss": 4.9261, "mean_token_accuracy": 0.20652822107076646, "num_tokens": 70768997.0, "step": 40795 }, { "entropy": 5.3820442199707035, "epoch": 3.1743629644038123, "grad_norm": 1.15625, "learning_rate": 0.00040023825932272635, "loss": 4.9228, "mean_token_accuracy": 0.2064330905675888, "num_tokens": 70777875.0, "step": 40800 }, { "entropy": 5.336959409713745, "epoch": 3.17475199377553, "grad_norm": 1.078125, "learning_rate": 0.00040021523306852416, "loss": 4.8333, "mean_token_accuracy": 0.21253376454114914, "num_tokens": 70786592.0, "step": 40805 }, { "entropy": 5.34142370223999, "epoch": 3.1751410231472477, "grad_norm": 1.125, "learning_rate": 0.00040019220491438007, "loss": 4.9703, "mean_token_accuracy": 0.20435669720172883, "num_tokens": 70795689.0, "step": 40810 }, { "entropy": 5.425786733627319, "epoch": 3.1755300525189654, "grad_norm": 1.0625, "learning_rate": 0.0004001691748606436, "loss": 4.9949, "mean_token_accuracy": 0.19736155718564988, "num_tokens": 70805078.0, "step": 40815 }, { "entropy": 5.418128108978271, "epoch": 3.1759190818906826, "grad_norm": 1.140625, "learning_rate": 0.0004001461429076641, "loss": 4.828, "mean_token_accuracy": 0.2113950654864311, "num_tokens": 70813820.0, "step": 40820 }, { "entropy": 5.383731889724731, "epoch": 3.1763081112624003, "grad_norm": 1.1328125, "learning_rate": 0.0004001231090557912, "loss": 4.9021, "mean_token_accuracy": 0.20247779041528702, "num_tokens": 70821930.0, "step": 40825 }, { "entropy": 5.312462520599365, "epoch": 3.176697140634118, "grad_norm": 1.0546875, "learning_rate": 0.00040010007330537405, "loss": 4.8676, "mean_token_accuracy": 0.20845767110586166, "num_tokens": 70830158.0, "step": 40830 }, { "entropy": 5.480395364761352, "epoch": 3.1770861700058353, "grad_norm": 1.109375, "learning_rate": 0.00040007703565676263, "loss": 4.9639, "mean_token_accuracy": 0.1950363412499428, "num_tokens": 70838774.0, "step": 40835 }, { "entropy": 5.393593502044678, "epoch": 3.177475199377553, "grad_norm": 1.0703125, "learning_rate": 0.00040005399611030615, "loss": 4.9406, "mean_token_accuracy": 0.20137183666229247, "num_tokens": 70848027.0, "step": 40840 }, { "entropy": 5.395750665664673, "epoch": 3.1778642287492707, "grad_norm": 1.1640625, "learning_rate": 0.0004000309546663543, "loss": 4.9256, "mean_token_accuracy": 0.19920625984668733, "num_tokens": 70856629.0, "step": 40845 }, { "entropy": 5.319666051864624, "epoch": 3.1782532581209884, "grad_norm": 1.09375, "learning_rate": 0.00040000791132525676, "loss": 4.842, "mean_token_accuracy": 0.21338384300470353, "num_tokens": 70865248.0, "step": 40850 }, { "entropy": 5.354864883422851, "epoch": 3.1786422874927056, "grad_norm": 1.09375, "learning_rate": 0.00039998486608736305, "loss": 4.8133, "mean_token_accuracy": 0.21008565574884414, "num_tokens": 70874351.0, "step": 40855 }, { "entropy": 5.374858140945435, "epoch": 3.1790313168644233, "grad_norm": 1.25, "learning_rate": 0.0003999618189530231, "loss": 4.7486, "mean_token_accuracy": 0.21425808668136598, "num_tokens": 70882478.0, "step": 40860 }, { "entropy": 5.382241487503052, "epoch": 3.179420346236141, "grad_norm": 1.2109375, "learning_rate": 0.0003999387699225863, "loss": 4.914, "mean_token_accuracy": 0.21170974820852279, "num_tokens": 70890461.0, "step": 40865 }, { "entropy": 5.353551959991455, "epoch": 3.1798093756078583, "grad_norm": 1.140625, "learning_rate": 0.0003999157189964026, "loss": 4.896, "mean_token_accuracy": 0.21025590896606444, "num_tokens": 70898909.0, "step": 40870 }, { "entropy": 5.305985641479492, "epoch": 3.180198404979576, "grad_norm": 1.1796875, "learning_rate": 0.0003998926661748217, "loss": 4.8336, "mean_token_accuracy": 0.2109777733683586, "num_tokens": 70907497.0, "step": 40875 }, { "entropy": 5.421080255508423, "epoch": 3.1805874343512937, "grad_norm": 1.1015625, "learning_rate": 0.0003998696114581933, "loss": 4.9487, "mean_token_accuracy": 0.20963205248117447, "num_tokens": 70916018.0, "step": 40880 }, { "entropy": 5.479217529296875, "epoch": 3.180976463723011, "grad_norm": 1.0859375, "learning_rate": 0.0003998465548468674, "loss": 4.918, "mean_token_accuracy": 0.20002132654190063, "num_tokens": 70924876.0, "step": 40885 }, { "entropy": 5.36046576499939, "epoch": 3.1813654930947286, "grad_norm": 1.15625, "learning_rate": 0.0003998234963411936, "loss": 4.8468, "mean_token_accuracy": 0.21071468591690062, "num_tokens": 70933113.0, "step": 40890 }, { "entropy": 5.359946918487549, "epoch": 3.1817545224664463, "grad_norm": 1.1640625, "learning_rate": 0.0003998004359415221, "loss": 4.8965, "mean_token_accuracy": 0.2105015844106674, "num_tokens": 70941916.0, "step": 40895 }, { "entropy": 5.416924619674683, "epoch": 3.1821435518381636, "grad_norm": 1.125, "learning_rate": 0.00039977737364820247, "loss": 4.9325, "mean_token_accuracy": 0.2027293249964714, "num_tokens": 70950110.0, "step": 40900 }, { "entropy": 5.416379070281982, "epoch": 3.1825325812098813, "grad_norm": 1.171875, "learning_rate": 0.00039975430946158493, "loss": 4.9823, "mean_token_accuracy": 0.20106424391269684, "num_tokens": 70958801.0, "step": 40905 }, { "entropy": 5.425722122192383, "epoch": 3.182921610581599, "grad_norm": 1.171875, "learning_rate": 0.0003997312433820192, "loss": 4.9049, "mean_token_accuracy": 0.20908755362033843, "num_tokens": 70967552.0, "step": 40910 }, { "entropy": 5.413363790512085, "epoch": 3.1833106399533166, "grad_norm": 1.1015625, "learning_rate": 0.00039970817540985545, "loss": 5.0266, "mean_token_accuracy": 0.2080891340970993, "num_tokens": 70975924.0, "step": 40915 }, { "entropy": 5.368432331085205, "epoch": 3.183699669325034, "grad_norm": 1.1015625, "learning_rate": 0.0003996851055454436, "loss": 4.8782, "mean_token_accuracy": 0.20943473577499389, "num_tokens": 70984954.0, "step": 40920 }, { "entropy": 5.497927951812744, "epoch": 3.1840886986967516, "grad_norm": 1.109375, "learning_rate": 0.0003996620337891337, "loss": 5.0031, "mean_token_accuracy": 0.1985649585723877, "num_tokens": 70994773.0, "step": 40925 }, { "entropy": 5.488444805145264, "epoch": 3.1844777280684693, "grad_norm": 1.1171875, "learning_rate": 0.000399638960141276, "loss": 4.9394, "mean_token_accuracy": 0.2036571368575096, "num_tokens": 71003173.0, "step": 40930 }, { "entropy": 5.357963132858276, "epoch": 3.1848667574401865, "grad_norm": 1.1875, "learning_rate": 0.00039961588460222033, "loss": 4.8338, "mean_token_accuracy": 0.21225104182958604, "num_tokens": 71011729.0, "step": 40935 }, { "entropy": 5.402867460250855, "epoch": 3.1852557868119042, "grad_norm": 1.1875, "learning_rate": 0.000399592807172317, "loss": 4.9577, "mean_token_accuracy": 0.20298743844032288, "num_tokens": 71019876.0, "step": 40940 }, { "entropy": 5.342504692077637, "epoch": 3.185644816183622, "grad_norm": 1.109375, "learning_rate": 0.00039956972785191606, "loss": 4.8715, "mean_token_accuracy": 0.20340289771556855, "num_tokens": 71028787.0, "step": 40945 }, { "entropy": 5.336028003692627, "epoch": 3.1860338455553396, "grad_norm": 1.1953125, "learning_rate": 0.00039954664664136787, "loss": 4.8239, "mean_token_accuracy": 0.21322612911462785, "num_tokens": 71037173.0, "step": 40950 }, { "entropy": 5.421294355392456, "epoch": 3.186422874927057, "grad_norm": 1.140625, "learning_rate": 0.0003995235635410225, "loss": 4.8787, "mean_token_accuracy": 0.20794139206409454, "num_tokens": 71045486.0, "step": 40955 }, { "entropy": 5.443972778320313, "epoch": 3.1868119042987746, "grad_norm": 1.21875, "learning_rate": 0.0003995004785512302, "loss": 4.9078, "mean_token_accuracy": 0.207851405441761, "num_tokens": 71053970.0, "step": 40960 }, { "entropy": 5.3299414157867435, "epoch": 3.1872009336704923, "grad_norm": 1.2109375, "learning_rate": 0.0003994773916723414, "loss": 4.8232, "mean_token_accuracy": 0.2099948987364769, "num_tokens": 71062381.0, "step": 40965 }, { "entropy": 5.369425344467163, "epoch": 3.1875899630422095, "grad_norm": 1.171875, "learning_rate": 0.0003994543029047063, "loss": 4.763, "mean_token_accuracy": 0.2149786874651909, "num_tokens": 71069974.0, "step": 40970 }, { "entropy": 5.422058200836181, "epoch": 3.1879789924139272, "grad_norm": 1.1875, "learning_rate": 0.0003994312122486752, "loss": 4.9448, "mean_token_accuracy": 0.20070834159851075, "num_tokens": 71078985.0, "step": 40975 }, { "entropy": 5.317565011978149, "epoch": 3.188368021785645, "grad_norm": 1.171875, "learning_rate": 0.0003994081197045985, "loss": 4.9107, "mean_token_accuracy": 0.2082419604063034, "num_tokens": 71087458.0, "step": 40980 }, { "entropy": 5.461523628234863, "epoch": 3.188757051157362, "grad_norm": 1.09375, "learning_rate": 0.0003993850252728267, "loss": 4.9867, "mean_token_accuracy": 0.2013772562146187, "num_tokens": 71096558.0, "step": 40985 }, { "entropy": 5.433375549316406, "epoch": 3.18914608052908, "grad_norm": 1.0390625, "learning_rate": 0.00039936192895371006, "loss": 4.9297, "mean_token_accuracy": 0.20648936927318573, "num_tokens": 71105507.0, "step": 40990 }, { "entropy": 5.312155532836914, "epoch": 3.1895351099007976, "grad_norm": 1.09375, "learning_rate": 0.000399338830747599, "loss": 4.8707, "mean_token_accuracy": 0.21176324784755707, "num_tokens": 71114237.0, "step": 40995 }, { "entropy": 5.373797988891601, "epoch": 3.1899241392725153, "grad_norm": 1.109375, "learning_rate": 0.0003993157306548442, "loss": 4.9344, "mean_token_accuracy": 0.20594169199466705, "num_tokens": 71123315.0, "step": 41000 }, { "entropy": 5.363411235809326, "epoch": 3.1903131686442325, "grad_norm": 1.2109375, "learning_rate": 0.00039929262867579603, "loss": 4.8984, "mean_token_accuracy": 0.2107297047972679, "num_tokens": 71132081.0, "step": 41005 }, { "entropy": 5.391424655914307, "epoch": 3.1907021980159502, "grad_norm": 1.140625, "learning_rate": 0.00039926952481080495, "loss": 4.8768, "mean_token_accuracy": 0.2033358931541443, "num_tokens": 71140558.0, "step": 41010 }, { "entropy": 5.414814043045044, "epoch": 3.191091227387668, "grad_norm": 1.1640625, "learning_rate": 0.00039924641906022176, "loss": 4.8969, "mean_token_accuracy": 0.20270241647958756, "num_tokens": 71149474.0, "step": 41015 }, { "entropy": 5.375221204757691, "epoch": 3.191480256759385, "grad_norm": 1.1484375, "learning_rate": 0.0003992233114243969, "loss": 4.931, "mean_token_accuracy": 0.1995809033513069, "num_tokens": 71158096.0, "step": 41020 }, { "entropy": 5.350184488296509, "epoch": 3.191869286131103, "grad_norm": 1.265625, "learning_rate": 0.000399200201903681, "loss": 4.8799, "mean_token_accuracy": 0.20536412298679352, "num_tokens": 71166626.0, "step": 41025 }, { "entropy": 5.421692895889282, "epoch": 3.1922583155028206, "grad_norm": 1.1484375, "learning_rate": 0.0003991770904984247, "loss": 4.9652, "mean_token_accuracy": 0.20443134903907775, "num_tokens": 71175390.0, "step": 41030 }, { "entropy": 5.39427604675293, "epoch": 3.192647344874538, "grad_norm": 1.1640625, "learning_rate": 0.0003991539772089787, "loss": 4.9138, "mean_token_accuracy": 0.2091783106327057, "num_tokens": 71183851.0, "step": 41035 }, { "entropy": 5.367454385757446, "epoch": 3.1930363742462555, "grad_norm": 1.2109375, "learning_rate": 0.00039913086203569373, "loss": 4.9358, "mean_token_accuracy": 0.2092101827263832, "num_tokens": 71192592.0, "step": 41040 }, { "entropy": 5.375721025466919, "epoch": 3.1934254036179732, "grad_norm": 1.109375, "learning_rate": 0.00039910774497892046, "loss": 4.9329, "mean_token_accuracy": 0.21254641711711883, "num_tokens": 71201139.0, "step": 41045 }, { "entropy": 5.286424350738526, "epoch": 3.193814432989691, "grad_norm": 1.1171875, "learning_rate": 0.00039908462603900977, "loss": 4.7768, "mean_token_accuracy": 0.2172835499048233, "num_tokens": 71209400.0, "step": 41050 }, { "entropy": 5.304551267623902, "epoch": 3.194203462361408, "grad_norm": 1.15625, "learning_rate": 0.0003990615052163123, "loss": 4.8599, "mean_token_accuracy": 0.21378054469823837, "num_tokens": 71218041.0, "step": 41055 }, { "entropy": 5.408150005340576, "epoch": 3.194592491733126, "grad_norm": 1.234375, "learning_rate": 0.000399038382511179, "loss": 4.9054, "mean_token_accuracy": 0.20234844982624053, "num_tokens": 71227323.0, "step": 41060 }, { "entropy": 5.454283857345581, "epoch": 3.1949815211048436, "grad_norm": 1.140625, "learning_rate": 0.0003990152579239607, "loss": 4.9155, "mean_token_accuracy": 0.2093242809176445, "num_tokens": 71235410.0, "step": 41065 }, { "entropy": 5.3518414974212645, "epoch": 3.195370550476561, "grad_norm": 1.15625, "learning_rate": 0.00039899213145500815, "loss": 4.8632, "mean_token_accuracy": 0.20371057242155075, "num_tokens": 71243577.0, "step": 41070 }, { "entropy": 5.392955350875854, "epoch": 3.1957595798482785, "grad_norm": 1.15625, "learning_rate": 0.00039896900310467244, "loss": 5.1062, "mean_token_accuracy": 0.19635103940963744, "num_tokens": 71252857.0, "step": 41075 }, { "entropy": 5.387083387374878, "epoch": 3.196148609219996, "grad_norm": 1.1328125, "learning_rate": 0.00039894587287330434, "loss": 4.9608, "mean_token_accuracy": 0.1973141074180603, "num_tokens": 71261841.0, "step": 41080 }, { "entropy": 5.448593807220459, "epoch": 3.1965376385917135, "grad_norm": 1.1328125, "learning_rate": 0.00039892274076125503, "loss": 4.8976, "mean_token_accuracy": 0.20215146839618683, "num_tokens": 71270057.0, "step": 41085 }, { "entropy": 5.371054172515869, "epoch": 3.196926667963431, "grad_norm": 1.09375, "learning_rate": 0.0003988996067688753, "loss": 4.8997, "mean_token_accuracy": 0.20316412001848222, "num_tokens": 71279488.0, "step": 41090 }, { "entropy": 5.464171743392944, "epoch": 3.197315697335149, "grad_norm": 1.1328125, "learning_rate": 0.0003988764708965163, "loss": 5.0156, "mean_token_accuracy": 0.19523449689149858, "num_tokens": 71288565.0, "step": 41095 }, { "entropy": 5.389809846878052, "epoch": 3.1977047267068666, "grad_norm": 1.109375, "learning_rate": 0.000398853333144529, "loss": 4.8562, "mean_token_accuracy": 0.21535607874393464, "num_tokens": 71296773.0, "step": 41100 }, { "entropy": 5.438268184661865, "epoch": 3.198093756078584, "grad_norm": 1.0546875, "learning_rate": 0.00039883019351326447, "loss": 4.9223, "mean_token_accuracy": 0.20909268856048585, "num_tokens": 71305665.0, "step": 41105 }, { "entropy": 5.349180126190186, "epoch": 3.1984827854503015, "grad_norm": 1.140625, "learning_rate": 0.00039880705200307377, "loss": 4.8195, "mean_token_accuracy": 0.209517602622509, "num_tokens": 71314410.0, "step": 41110 }, { "entropy": 5.420874691009521, "epoch": 3.198871814822019, "grad_norm": 1.171875, "learning_rate": 0.0003987839086143083, "loss": 4.9589, "mean_token_accuracy": 0.2013794630765915, "num_tokens": 71324362.0, "step": 41115 }, { "entropy": 5.397889757156372, "epoch": 3.1992608441937365, "grad_norm": 1.15625, "learning_rate": 0.00039876076334731885, "loss": 4.9485, "mean_token_accuracy": 0.20154876559972762, "num_tokens": 71333244.0, "step": 41120 }, { "entropy": 5.355621671676635, "epoch": 3.199649873565454, "grad_norm": 1.140625, "learning_rate": 0.000398737616202457, "loss": 4.8393, "mean_token_accuracy": 0.20976633429527283, "num_tokens": 71342191.0, "step": 41125 }, { "entropy": 5.403627538681031, "epoch": 3.200038902937172, "grad_norm": 1.0703125, "learning_rate": 0.00039871446718007364, "loss": 4.9463, "mean_token_accuracy": 0.1990462139248848, "num_tokens": 71350955.0, "step": 41130 }, { "entropy": 5.405143976211548, "epoch": 3.200427932308889, "grad_norm": 1.1953125, "learning_rate": 0.0003986913162805201, "loss": 4.912, "mean_token_accuracy": 0.20801666527986526, "num_tokens": 71359930.0, "step": 41135 }, { "entropy": 5.371746397018432, "epoch": 3.200816961680607, "grad_norm": 1.2109375, "learning_rate": 0.00039866816350414786, "loss": 4.8696, "mean_token_accuracy": 0.20665326863527297, "num_tokens": 71368695.0, "step": 41140 }, { "entropy": 5.327304267883301, "epoch": 3.2012059910523245, "grad_norm": 1.2109375, "learning_rate": 0.000398645008851308, "loss": 4.8721, "mean_token_accuracy": 0.21070967316627504, "num_tokens": 71377360.0, "step": 41145 }, { "entropy": 5.421457433700562, "epoch": 3.201595020424042, "grad_norm": 1.125, "learning_rate": 0.00039862185232235196, "loss": 4.9197, "mean_token_accuracy": 0.2041022762656212, "num_tokens": 71386393.0, "step": 41150 }, { "entropy": 5.367809534072876, "epoch": 3.2019840497957595, "grad_norm": 1.109375, "learning_rate": 0.0003985986939176311, "loss": 4.85, "mean_token_accuracy": 0.2122493118047714, "num_tokens": 71394909.0, "step": 41155 }, { "entropy": 5.37042932510376, "epoch": 3.202373079167477, "grad_norm": 1.203125, "learning_rate": 0.00039857553363749674, "loss": 4.9439, "mean_token_accuracy": 0.20139406323432923, "num_tokens": 71403375.0, "step": 41160 }, { "entropy": 5.428268766403198, "epoch": 3.202762108539195, "grad_norm": 1.0625, "learning_rate": 0.00039855237148230026, "loss": 4.8724, "mean_token_accuracy": 0.2037455677986145, "num_tokens": 71412114.0, "step": 41165 }, { "entropy": 5.4241517066955565, "epoch": 3.203151137910912, "grad_norm": 1.1171875, "learning_rate": 0.00039852920745239343, "loss": 4.9064, "mean_token_accuracy": 0.20287071615457536, "num_tokens": 71420795.0, "step": 41170 }, { "entropy": 5.297631406784058, "epoch": 3.20354016728263, "grad_norm": 1.1328125, "learning_rate": 0.00039850604154812727, "loss": 4.8242, "mean_token_accuracy": 0.21561457216739655, "num_tokens": 71429035.0, "step": 41175 }, { "entropy": 5.287792682647705, "epoch": 3.2039291966543475, "grad_norm": 1.1953125, "learning_rate": 0.0003984828737698536, "loss": 4.8012, "mean_token_accuracy": 0.213507042825222, "num_tokens": 71437322.0, "step": 41180 }, { "entropy": 5.3966796875, "epoch": 3.204318226026065, "grad_norm": 1.1796875, "learning_rate": 0.00039845970411792384, "loss": 4.9188, "mean_token_accuracy": 0.2054111674427986, "num_tokens": 71445713.0, "step": 41185 }, { "entropy": 5.453556728363037, "epoch": 3.2047072553977825, "grad_norm": 1.1953125, "learning_rate": 0.0003984365325926896, "loss": 4.8818, "mean_token_accuracy": 0.20796265453100204, "num_tokens": 71453913.0, "step": 41190 }, { "entropy": 5.466651582717896, "epoch": 3.2050962847695, "grad_norm": 1.0703125, "learning_rate": 0.00039841335919450245, "loss": 4.8959, "mean_token_accuracy": 0.20893990397453308, "num_tokens": 71462036.0, "step": 41195 }, { "entropy": 5.348736238479614, "epoch": 3.205485314141218, "grad_norm": 1.1875, "learning_rate": 0.00039839018392371397, "loss": 4.893, "mean_token_accuracy": 0.20294382721185683, "num_tokens": 71470760.0, "step": 41200 }, { "entropy": 5.382997322082519, "epoch": 3.205874343512935, "grad_norm": 1.1484375, "learning_rate": 0.0003983670067806759, "loss": 4.9249, "mean_token_accuracy": 0.19844181090593338, "num_tokens": 71479612.0, "step": 41205 }, { "entropy": 5.439393806457519, "epoch": 3.206263372884653, "grad_norm": 1.1953125, "learning_rate": 0.0003983438277657398, "loss": 4.8992, "mean_token_accuracy": 0.2106337293982506, "num_tokens": 71487868.0, "step": 41210 }, { "entropy": 5.365131616592407, "epoch": 3.2066524022563705, "grad_norm": 1.0625, "learning_rate": 0.0003983206468792575, "loss": 4.8713, "mean_token_accuracy": 0.20805854648351668, "num_tokens": 71496296.0, "step": 41215 }, { "entropy": 5.271234178543091, "epoch": 3.2070414316280877, "grad_norm": 1.1015625, "learning_rate": 0.0003982974641215806, "loss": 4.8433, "mean_token_accuracy": 0.21512570679187776, "num_tokens": 71505076.0, "step": 41220 }, { "entropy": 5.359581184387207, "epoch": 3.2074304609998054, "grad_norm": 1.15625, "learning_rate": 0.000398274279493061, "loss": 4.8102, "mean_token_accuracy": 0.21830783188343048, "num_tokens": 71513585.0, "step": 41225 }, { "entropy": 5.490751934051514, "epoch": 3.207819490371523, "grad_norm": 1.15625, "learning_rate": 0.00039825109299405036, "loss": 4.9563, "mean_token_accuracy": 0.1992805629968643, "num_tokens": 71521519.0, "step": 41230 }, { "entropy": 5.261100196838379, "epoch": 3.2082085197432404, "grad_norm": 1.203125, "learning_rate": 0.0003982279046249006, "loss": 4.8074, "mean_token_accuracy": 0.21393427550792693, "num_tokens": 71529910.0, "step": 41235 }, { "entropy": 5.270900869369507, "epoch": 3.208597549114958, "grad_norm": 1.0859375, "learning_rate": 0.00039820471438596346, "loss": 4.8562, "mean_token_accuracy": 0.21103986352682114, "num_tokens": 71538716.0, "step": 41240 }, { "entropy": 5.433122253417968, "epoch": 3.208986578486676, "grad_norm": 1.1015625, "learning_rate": 0.00039818152227759097, "loss": 5.0068, "mean_token_accuracy": 0.2008223533630371, "num_tokens": 71548737.0, "step": 41245 }, { "entropy": 5.4912757396698, "epoch": 3.2093756078583935, "grad_norm": 1.2421875, "learning_rate": 0.0003981583283001349, "loss": 4.9266, "mean_token_accuracy": 0.2066113606095314, "num_tokens": 71557356.0, "step": 41250 }, { "entropy": 5.400700283050537, "epoch": 3.2097646372301107, "grad_norm": 1.1328125, "learning_rate": 0.0003981351324539472, "loss": 4.9267, "mean_token_accuracy": 0.20826032906770706, "num_tokens": 71566858.0, "step": 41255 }, { "entropy": 5.3413153171539305, "epoch": 3.2101536666018284, "grad_norm": 1.171875, "learning_rate": 0.0003981119347393799, "loss": 4.8111, "mean_token_accuracy": 0.2137700065970421, "num_tokens": 71575060.0, "step": 41260 }, { "entropy": 5.4415168285369875, "epoch": 3.210542695973546, "grad_norm": 1.0625, "learning_rate": 0.00039808873515678495, "loss": 4.9097, "mean_token_accuracy": 0.2108290284872055, "num_tokens": 71583987.0, "step": 41265 }, { "entropy": 5.293552875518799, "epoch": 3.2109317253452634, "grad_norm": 1.0859375, "learning_rate": 0.0003980655337065144, "loss": 4.9868, "mean_token_accuracy": 0.1928752303123474, "num_tokens": 71593433.0, "step": 41270 }, { "entropy": 5.482369661331177, "epoch": 3.211320754716981, "grad_norm": 1.1796875, "learning_rate": 0.0003980423303889201, "loss": 4.9034, "mean_token_accuracy": 0.20759985744953155, "num_tokens": 71601795.0, "step": 41275 }, { "entropy": 5.402105903625488, "epoch": 3.211709784088699, "grad_norm": 1.1171875, "learning_rate": 0.00039801912520435437, "loss": 4.8162, "mean_token_accuracy": 0.21766954511404038, "num_tokens": 71611566.0, "step": 41280 }, { "entropy": 5.362250566482544, "epoch": 3.2120988134604165, "grad_norm": 1.0703125, "learning_rate": 0.0003979959181531692, "loss": 4.8156, "mean_token_accuracy": 0.21424843817949296, "num_tokens": 71620157.0, "step": 41285 }, { "entropy": 5.432988548278809, "epoch": 3.2124878428321337, "grad_norm": 1.15625, "learning_rate": 0.00039797270923571683, "loss": 4.9586, "mean_token_accuracy": 0.2011295884847641, "num_tokens": 71629342.0, "step": 41290 }, { "entropy": 5.356537246704102, "epoch": 3.2128768722038514, "grad_norm": 1.1171875, "learning_rate": 0.00039794949845234925, "loss": 4.8317, "mean_token_accuracy": 0.2125357583165169, "num_tokens": 71638118.0, "step": 41295 }, { "entropy": 5.367728853225708, "epoch": 3.213265901575569, "grad_norm": 1.0703125, "learning_rate": 0.00039792628580341874, "loss": 4.8632, "mean_token_accuracy": 0.2125856414437294, "num_tokens": 71647261.0, "step": 41300 }, { "entropy": 5.337952756881714, "epoch": 3.2136549309472864, "grad_norm": 1.2109375, "learning_rate": 0.00039790307128927745, "loss": 4.9067, "mean_token_accuracy": 0.20959130227565764, "num_tokens": 71655513.0, "step": 41305 }, { "entropy": 5.372780799865723, "epoch": 3.214043960319004, "grad_norm": 1.2109375, "learning_rate": 0.00039787985491027773, "loss": 4.928, "mean_token_accuracy": 0.20572420060634614, "num_tokens": 71663696.0, "step": 41310 }, { "entropy": 5.388763809204102, "epoch": 3.2144329896907218, "grad_norm": 1.0625, "learning_rate": 0.00039785663666677175, "loss": 4.9228, "mean_token_accuracy": 0.20438790917396546, "num_tokens": 71672860.0, "step": 41315 }, { "entropy": 5.357812929153442, "epoch": 3.214822019062439, "grad_norm": 1.1484375, "learning_rate": 0.00039783341655911185, "loss": 4.8676, "mean_token_accuracy": 0.20539714992046357, "num_tokens": 71681343.0, "step": 41320 }, { "entropy": 5.371541690826416, "epoch": 3.2152110484341567, "grad_norm": 1.125, "learning_rate": 0.0003978101945876504, "loss": 4.8657, "mean_token_accuracy": 0.2110227406024933, "num_tokens": 71689769.0, "step": 41325 }, { "entropy": 5.380926895141601, "epoch": 3.2156000778058744, "grad_norm": 1.203125, "learning_rate": 0.00039778697075273977, "loss": 4.8962, "mean_token_accuracy": 0.21422243416309356, "num_tokens": 71697782.0, "step": 41330 }, { "entropy": 5.4299054622650145, "epoch": 3.2159891071775917, "grad_norm": 1.25, "learning_rate": 0.00039776374505473224, "loss": 4.9256, "mean_token_accuracy": 0.2012175813317299, "num_tokens": 71706050.0, "step": 41335 }, { "entropy": 5.3100344181060795, "epoch": 3.2163781365493094, "grad_norm": 1.203125, "learning_rate": 0.0003977405174939803, "loss": 4.7861, "mean_token_accuracy": 0.21079102754592896, "num_tokens": 71714623.0, "step": 41340 }, { "entropy": 5.294760274887085, "epoch": 3.216767165921027, "grad_norm": 1.203125, "learning_rate": 0.00039771728807083635, "loss": 4.8329, "mean_token_accuracy": 0.2149375006556511, "num_tokens": 71723450.0, "step": 41345 }, { "entropy": 5.3777018070220945, "epoch": 3.2171561952927448, "grad_norm": 1.15625, "learning_rate": 0.00039769405678565287, "loss": 4.8743, "mean_token_accuracy": 0.20640100687742233, "num_tokens": 71731986.0, "step": 41350 }, { "entropy": 5.4244485855102536, "epoch": 3.217545224664462, "grad_norm": 1.0703125, "learning_rate": 0.00039767082363878237, "loss": 4.9893, "mean_token_accuracy": 0.1947380244731903, "num_tokens": 71740650.0, "step": 41355 }, { "entropy": 5.388730573654175, "epoch": 3.2179342540361797, "grad_norm": 1.125, "learning_rate": 0.0003976475886305774, "loss": 4.9021, "mean_token_accuracy": 0.19871594458818437, "num_tokens": 71749358.0, "step": 41360 }, { "entropy": 5.310841608047485, "epoch": 3.2183232834078974, "grad_norm": 1.140625, "learning_rate": 0.0003976243517613904, "loss": 4.8534, "mean_token_accuracy": 0.20978207141160965, "num_tokens": 71757862.0, "step": 41365 }, { "entropy": 5.390683555603028, "epoch": 3.2187123127796147, "grad_norm": 1.0546875, "learning_rate": 0.00039760111303157415, "loss": 4.9471, "mean_token_accuracy": 0.19820580780506133, "num_tokens": 71766321.0, "step": 41370 }, { "entropy": 5.389574003219605, "epoch": 3.2191013421513324, "grad_norm": 1.0625, "learning_rate": 0.000397577872441481, "loss": 4.9134, "mean_token_accuracy": 0.20398980975151063, "num_tokens": 71775726.0, "step": 41375 }, { "entropy": 5.4229738235473635, "epoch": 3.21949037152305, "grad_norm": 1.09375, "learning_rate": 0.0003975546299914639, "loss": 4.9866, "mean_token_accuracy": 0.2040518894791603, "num_tokens": 71785227.0, "step": 41380 }, { "entropy": 5.402367353439331, "epoch": 3.2198794008947678, "grad_norm": 1.0859375, "learning_rate": 0.0003975313856818753, "loss": 4.9302, "mean_token_accuracy": 0.20796280056238176, "num_tokens": 71794226.0, "step": 41385 }, { "entropy": 5.428212690353393, "epoch": 3.220268430266485, "grad_norm": 1.2109375, "learning_rate": 0.0003975081395130679, "loss": 4.892, "mean_token_accuracy": 0.20707811713218688, "num_tokens": 71802758.0, "step": 41390 }, { "entropy": 5.379517841339111, "epoch": 3.2206574596382027, "grad_norm": 1.171875, "learning_rate": 0.0003974848914853946, "loss": 4.906, "mean_token_accuracy": 0.2102273628115654, "num_tokens": 71811156.0, "step": 41395 }, { "entropy": 5.259658670425415, "epoch": 3.2210464890099204, "grad_norm": 1.1171875, "learning_rate": 0.00039746164159920795, "loss": 4.711, "mean_token_accuracy": 0.21655880510807038, "num_tokens": 71819243.0, "step": 41400 }, { "entropy": 5.349394655227661, "epoch": 3.2214355183816377, "grad_norm": 1.109375, "learning_rate": 0.00039743838985486075, "loss": 4.9212, "mean_token_accuracy": 0.200860396027565, "num_tokens": 71827551.0, "step": 41405 }, { "entropy": 5.3924932956695555, "epoch": 3.2218245477533554, "grad_norm": 1.1640625, "learning_rate": 0.0003974151362527059, "loss": 4.8982, "mean_token_accuracy": 0.20760398507118225, "num_tokens": 71835548.0, "step": 41410 }, { "entropy": 5.457680130004883, "epoch": 3.222213577125073, "grad_norm": 1.109375, "learning_rate": 0.00039739188079309626, "loss": 4.9248, "mean_token_accuracy": 0.20420821905136108, "num_tokens": 71844117.0, "step": 41415 }, { "entropy": 5.438068199157715, "epoch": 3.2226026064967903, "grad_norm": 1.0625, "learning_rate": 0.0003973686234763846, "loss": 4.9021, "mean_token_accuracy": 0.20057043731212615, "num_tokens": 71852665.0, "step": 41420 }, { "entropy": 5.332819890975952, "epoch": 3.222991635868508, "grad_norm": 1.078125, "learning_rate": 0.0003973453643029239, "loss": 4.9127, "mean_token_accuracy": 0.2046664074063301, "num_tokens": 71861162.0, "step": 41425 }, { "entropy": 5.408700704574585, "epoch": 3.2233806652402257, "grad_norm": 1.1953125, "learning_rate": 0.0003973221032730669, "loss": 4.9206, "mean_token_accuracy": 0.20650875121355056, "num_tokens": 71870764.0, "step": 41430 }, { "entropy": 5.410676956176758, "epoch": 3.2237696946119434, "grad_norm": 1.09375, "learning_rate": 0.0003972988403871668, "loss": 4.8792, "mean_token_accuracy": 0.21093602925539018, "num_tokens": 71879291.0, "step": 41435 }, { "entropy": 5.3718212127685545, "epoch": 3.2241587239836607, "grad_norm": 1.171875, "learning_rate": 0.0003972755756455764, "loss": 4.9215, "mean_token_accuracy": 0.20503434985876084, "num_tokens": 71888070.0, "step": 41440 }, { "entropy": 5.424950313568115, "epoch": 3.2245477533553784, "grad_norm": 1.1171875, "learning_rate": 0.0003972523090486487, "loss": 4.9767, "mean_token_accuracy": 0.20637868195772172, "num_tokens": 71896314.0, "step": 41445 }, { "entropy": 5.289296960830688, "epoch": 3.224936782727096, "grad_norm": 1.046875, "learning_rate": 0.0003972290405967369, "loss": 4.7337, "mean_token_accuracy": 0.2218379110097885, "num_tokens": 71905786.0, "step": 41450 }, { "entropy": 5.359384775161743, "epoch": 3.2253258120988133, "grad_norm": 1.15625, "learning_rate": 0.0003972057702901939, "loss": 4.8961, "mean_token_accuracy": 0.2042383372783661, "num_tokens": 71914329.0, "step": 41455 }, { "entropy": 5.411332988739014, "epoch": 3.225714841470531, "grad_norm": 1.1875, "learning_rate": 0.0003971824981293729, "loss": 4.9747, "mean_token_accuracy": 0.206637379527092, "num_tokens": 71923615.0, "step": 41460 }, { "entropy": 5.4521955966949465, "epoch": 3.2261038708422487, "grad_norm": 1.21875, "learning_rate": 0.0003971592241146269, "loss": 4.8803, "mean_token_accuracy": 0.20825263112783432, "num_tokens": 71931666.0, "step": 41465 }, { "entropy": 5.48477258682251, "epoch": 3.226492900213966, "grad_norm": 1.171875, "learning_rate": 0.0003971359482463092, "loss": 4.9738, "mean_token_accuracy": 0.20763561129570007, "num_tokens": 71940770.0, "step": 41470 }, { "entropy": 5.290102148056031, "epoch": 3.2268819295856837, "grad_norm": 1.109375, "learning_rate": 0.0003971126705247727, "loss": 4.8192, "mean_token_accuracy": 0.20992695093154906, "num_tokens": 71949626.0, "step": 41475 }, { "entropy": 5.350097608566284, "epoch": 3.2272709589574013, "grad_norm": 1.1015625, "learning_rate": 0.0003970893909503709, "loss": 4.8605, "mean_token_accuracy": 0.2097383812069893, "num_tokens": 71958055.0, "step": 41480 }, { "entropy": 5.380182361602783, "epoch": 3.227659988329119, "grad_norm": 1.2734375, "learning_rate": 0.000397066109523457, "loss": 4.7817, "mean_token_accuracy": 0.2213051900267601, "num_tokens": 71966353.0, "step": 41485 }, { "entropy": 5.39834246635437, "epoch": 3.2280490177008363, "grad_norm": 1.125, "learning_rate": 0.0003970428262443842, "loss": 4.9812, "mean_token_accuracy": 0.20385613292455673, "num_tokens": 71975479.0, "step": 41490 }, { "entropy": 5.335905694961548, "epoch": 3.228438047072554, "grad_norm": 1.1328125, "learning_rate": 0.00039701954111350565, "loss": 4.8077, "mean_token_accuracy": 0.21200876981019973, "num_tokens": 71983859.0, "step": 41495 }, { "entropy": 5.245261573791504, "epoch": 3.2288270764442717, "grad_norm": 1.1328125, "learning_rate": 0.0003969962541311748, "loss": 4.737, "mean_token_accuracy": 0.22028515487909317, "num_tokens": 71992804.0, "step": 41500 }, { "entropy": 5.467371034622192, "epoch": 3.229216105815989, "grad_norm": 1.125, "learning_rate": 0.00039697296529774494, "loss": 5.0008, "mean_token_accuracy": 0.19807840883731842, "num_tokens": 72000942.0, "step": 41505 }, { "entropy": 5.390512084960937, "epoch": 3.2296051351877066, "grad_norm": 1.171875, "learning_rate": 0.00039694967461356944, "loss": 4.8403, "mean_token_accuracy": 0.21506406515836715, "num_tokens": 72009275.0, "step": 41510 }, { "entropy": 5.339192867279053, "epoch": 3.2299941645594243, "grad_norm": 1.078125, "learning_rate": 0.00039692638207900177, "loss": 4.9186, "mean_token_accuracy": 0.2012126177549362, "num_tokens": 72018441.0, "step": 41515 }, { "entropy": 5.416414880752564, "epoch": 3.2303831939311416, "grad_norm": 1.1171875, "learning_rate": 0.0003969030876943954, "loss": 4.8828, "mean_token_accuracy": 0.20821574032306672, "num_tokens": 72026657.0, "step": 41520 }, { "entropy": 5.344050502777099, "epoch": 3.2307722233028593, "grad_norm": 1.125, "learning_rate": 0.00039687979146010367, "loss": 4.7823, "mean_token_accuracy": 0.21662601977586746, "num_tokens": 72034893.0, "step": 41525 }, { "entropy": 5.427075481414795, "epoch": 3.231161252674577, "grad_norm": 1.0703125, "learning_rate": 0.00039685649337648, "loss": 4.9696, "mean_token_accuracy": 0.20820416659116744, "num_tokens": 72044880.0, "step": 41530 }, { "entropy": 5.42249641418457, "epoch": 3.2315502820462947, "grad_norm": 1.078125, "learning_rate": 0.00039683319344387813, "loss": 4.8933, "mean_token_accuracy": 0.20334199219942092, "num_tokens": 72053407.0, "step": 41535 }, { "entropy": 5.343121433258057, "epoch": 3.231939311418012, "grad_norm": 1.15625, "learning_rate": 0.00039680989166265135, "loss": 4.8637, "mean_token_accuracy": 0.21781446039676666, "num_tokens": 72062042.0, "step": 41540 }, { "entropy": 5.338514423370361, "epoch": 3.2323283407897296, "grad_norm": 1.1171875, "learning_rate": 0.00039678658803315336, "loss": 4.8799, "mean_token_accuracy": 0.20290609449148178, "num_tokens": 72070120.0, "step": 41545 }, { "entropy": 5.368254089355469, "epoch": 3.2327173701614473, "grad_norm": 1.2265625, "learning_rate": 0.00039676328255573777, "loss": 4.8856, "mean_token_accuracy": 0.20546307563781738, "num_tokens": 72079271.0, "step": 41550 }, { "entropy": 5.441349601745605, "epoch": 3.2331063995331646, "grad_norm": 1.1640625, "learning_rate": 0.00039673997523075825, "loss": 4.9343, "mean_token_accuracy": 0.2076259508728981, "num_tokens": 72088103.0, "step": 41555 }, { "entropy": 5.46873984336853, "epoch": 3.2334954289048823, "grad_norm": 1.1640625, "learning_rate": 0.00039671666605856825, "loss": 4.9892, "mean_token_accuracy": 0.20788469463586806, "num_tokens": 72097244.0, "step": 41560 }, { "entropy": 5.3720427513122555, "epoch": 3.2338844582766, "grad_norm": 1.1953125, "learning_rate": 0.00039669335503952165, "loss": 4.9478, "mean_token_accuracy": 0.20182398557662964, "num_tokens": 72105778.0, "step": 41565 }, { "entropy": 5.41860065460205, "epoch": 3.2342734876483172, "grad_norm": 1.1875, "learning_rate": 0.00039667004217397206, "loss": 4.9079, "mean_token_accuracy": 0.21269229352474212, "num_tokens": 72113750.0, "step": 41570 }, { "entropy": 5.3342078685760494, "epoch": 3.234662517020035, "grad_norm": 1.1796875, "learning_rate": 0.00039664672746227326, "loss": 4.8597, "mean_token_accuracy": 0.20644067823886872, "num_tokens": 72122181.0, "step": 41575 }, { "entropy": 5.439698886871338, "epoch": 3.2350515463917526, "grad_norm": 1.109375, "learning_rate": 0.0003966234109047789, "loss": 4.9158, "mean_token_accuracy": 0.2072242945432663, "num_tokens": 72131364.0, "step": 41580 }, { "entropy": 5.4215654850006105, "epoch": 3.2354405757634703, "grad_norm": 1.1875, "learning_rate": 0.000396600092501843, "loss": 4.9612, "mean_token_accuracy": 0.2020516276359558, "num_tokens": 72139580.0, "step": 41585 }, { "entropy": 5.340943288803101, "epoch": 3.2358296051351876, "grad_norm": 1.078125, "learning_rate": 0.00039657677225381915, "loss": 4.8641, "mean_token_accuracy": 0.20832016319036484, "num_tokens": 72148414.0, "step": 41590 }, { "entropy": 5.28799033164978, "epoch": 3.2362186345069053, "grad_norm": 1.15625, "learning_rate": 0.0003965534501610613, "loss": 4.7584, "mean_token_accuracy": 0.21945344805717468, "num_tokens": 72156612.0, "step": 41595 }, { "entropy": 5.3809651851654055, "epoch": 3.236607663878623, "grad_norm": 1.125, "learning_rate": 0.0003965301262239234, "loss": 4.9442, "mean_token_accuracy": 0.20541845560073851, "num_tokens": 72164711.0, "step": 41600 }, { "entropy": 5.420930671691894, "epoch": 3.2369966932503402, "grad_norm": 1.046875, "learning_rate": 0.0003965068004427591, "loss": 5.0191, "mean_token_accuracy": 0.19502892196178437, "num_tokens": 72172991.0, "step": 41605 }, { "entropy": 5.442810344696045, "epoch": 3.237385722622058, "grad_norm": 1.1953125, "learning_rate": 0.0003964834728179226, "loss": 4.919, "mean_token_accuracy": 0.20342083722352983, "num_tokens": 72181464.0, "step": 41610 }, { "entropy": 5.448131275177002, "epoch": 3.2377747519937756, "grad_norm": 1.109375, "learning_rate": 0.00039646014334976783, "loss": 4.8894, "mean_token_accuracy": 0.21077728420495986, "num_tokens": 72189984.0, "step": 41615 }, { "entropy": 5.234420108795166, "epoch": 3.2381637813654933, "grad_norm": 1.1640625, "learning_rate": 0.00039643681203864863, "loss": 4.7321, "mean_token_accuracy": 0.21412567496299745, "num_tokens": 72197845.0, "step": 41620 }, { "entropy": 5.343894147872925, "epoch": 3.2385528107372106, "grad_norm": 1.109375, "learning_rate": 0.00039641347888491905, "loss": 4.9238, "mean_token_accuracy": 0.20534812957048415, "num_tokens": 72206307.0, "step": 41625 }, { "entropy": 5.378876972198486, "epoch": 3.2389418401089283, "grad_norm": 1.1015625, "learning_rate": 0.00039639014388893337, "loss": 4.9178, "mean_token_accuracy": 0.20125647783279418, "num_tokens": 72214540.0, "step": 41630 }, { "entropy": 5.379921627044678, "epoch": 3.239330869480646, "grad_norm": 1.0703125, "learning_rate": 0.0003963668070510453, "loss": 4.9205, "mean_token_accuracy": 0.2128364324569702, "num_tokens": 72223287.0, "step": 41635 }, { "entropy": 5.379098892211914, "epoch": 3.2397198988523632, "grad_norm": 1.15625, "learning_rate": 0.0003963434683716091, "loss": 4.8608, "mean_token_accuracy": 0.20771485716104507, "num_tokens": 72232314.0, "step": 41640 }, { "entropy": 5.4644852638244625, "epoch": 3.240108928224081, "grad_norm": 1.0625, "learning_rate": 0.0003963201278509789, "loss": 4.9845, "mean_token_accuracy": 0.19656602144241334, "num_tokens": 72241424.0, "step": 41645 }, { "entropy": 5.343140554428101, "epoch": 3.2404979575957986, "grad_norm": 1.1171875, "learning_rate": 0.0003962967854895089, "loss": 4.8209, "mean_token_accuracy": 0.21585943698883056, "num_tokens": 72249329.0, "step": 41650 }, { "entropy": 5.389833927154541, "epoch": 3.240886986967516, "grad_norm": 1.078125, "learning_rate": 0.0003962734412875533, "loss": 4.964, "mean_token_accuracy": 0.20332630276679992, "num_tokens": 72258484.0, "step": 41655 }, { "entropy": 5.37431902885437, "epoch": 3.2412760163392336, "grad_norm": 1.1484375, "learning_rate": 0.0003962500952454662, "loss": 4.9036, "mean_token_accuracy": 0.21161109805107117, "num_tokens": 72267280.0, "step": 41660 }, { "entropy": 5.3249749660491945, "epoch": 3.2416650457109513, "grad_norm": 1.1484375, "learning_rate": 0.00039622674736360195, "loss": 4.9233, "mean_token_accuracy": 0.20424025058746337, "num_tokens": 72275399.0, "step": 41665 }, { "entropy": 5.340392398834228, "epoch": 3.2420540750826685, "grad_norm": 1.296875, "learning_rate": 0.00039620339764231467, "loss": 4.8754, "mean_token_accuracy": 0.21412305831909179, "num_tokens": 72285202.0, "step": 41670 }, { "entropy": 5.329820013046264, "epoch": 3.242443104454386, "grad_norm": 1.0859375, "learning_rate": 0.00039618004608195877, "loss": 4.7901, "mean_token_accuracy": 0.21443211138248444, "num_tokens": 72293713.0, "step": 41675 }, { "entropy": 5.354944324493408, "epoch": 3.242832133826104, "grad_norm": 1.1171875, "learning_rate": 0.00039615669268288863, "loss": 4.8265, "mean_token_accuracy": 0.21387371718883513, "num_tokens": 72302591.0, "step": 41680 }, { "entropy": 5.36503119468689, "epoch": 3.2432211631978216, "grad_norm": 1.0859375, "learning_rate": 0.00039613333744545836, "loss": 4.8621, "mean_token_accuracy": 0.21321283131837845, "num_tokens": 72310981.0, "step": 41685 }, { "entropy": 5.273787784576416, "epoch": 3.243610192569539, "grad_norm": 1.078125, "learning_rate": 0.0003961099803700226, "loss": 4.8019, "mean_token_accuracy": 0.2164582669734955, "num_tokens": 72319797.0, "step": 41690 }, { "entropy": 5.384508848190308, "epoch": 3.2439992219412566, "grad_norm": 1.171875, "learning_rate": 0.0003960866214569357, "loss": 4.8992, "mean_token_accuracy": 0.20790557712316513, "num_tokens": 72329122.0, "step": 41695 }, { "entropy": 5.320718765258789, "epoch": 3.2443882513129743, "grad_norm": 1.1328125, "learning_rate": 0.00039606326070655204, "loss": 4.8812, "mean_token_accuracy": 0.21045181900262833, "num_tokens": 72337601.0, "step": 41700 }, { "entropy": 5.46179986000061, "epoch": 3.2447772806846915, "grad_norm": 1.1640625, "learning_rate": 0.00039603989811922596, "loss": 4.9663, "mean_token_accuracy": 0.20764378756284713, "num_tokens": 72346484.0, "step": 41705 }, { "entropy": 5.3948663711547855, "epoch": 3.245166310056409, "grad_norm": 1.1328125, "learning_rate": 0.0003960165336953122, "loss": 4.848, "mean_token_accuracy": 0.20332710742950438, "num_tokens": 72354989.0, "step": 41710 }, { "entropy": 5.374741840362549, "epoch": 3.245555339428127, "grad_norm": 1.1015625, "learning_rate": 0.0003959931674351651, "loss": 4.9001, "mean_token_accuracy": 0.2020726591348648, "num_tokens": 72363216.0, "step": 41715 }, { "entropy": 5.338291501998901, "epoch": 3.2459443687998446, "grad_norm": 1.140625, "learning_rate": 0.0003959697993391393, "loss": 4.7937, "mean_token_accuracy": 0.21319809854030608, "num_tokens": 72371994.0, "step": 41720 }, { "entropy": 5.2396196842193605, "epoch": 3.246333398171562, "grad_norm": 1.1640625, "learning_rate": 0.00039594642940758934, "loss": 4.7821, "mean_token_accuracy": 0.21820472031831742, "num_tokens": 72381467.0, "step": 41725 }, { "entropy": 5.337137651443482, "epoch": 3.2467224275432796, "grad_norm": 1.140625, "learning_rate": 0.00039592305764086984, "loss": 4.7491, "mean_token_accuracy": 0.2187451794743538, "num_tokens": 72390087.0, "step": 41730 }, { "entropy": 5.393392419815063, "epoch": 3.2471114569149973, "grad_norm": 1.1640625, "learning_rate": 0.00039589968403933533, "loss": 4.8407, "mean_token_accuracy": 0.20656883865594863, "num_tokens": 72399525.0, "step": 41735 }, { "entropy": 5.2897227764129635, "epoch": 3.2475004862867145, "grad_norm": 1.1796875, "learning_rate": 0.0003958763086033406, "loss": 4.8327, "mean_token_accuracy": 0.22144639641046523, "num_tokens": 72407487.0, "step": 41740 }, { "entropy": 5.2737571716308596, "epoch": 3.247889515658432, "grad_norm": 1.1171875, "learning_rate": 0.0003958529313332403, "loss": 4.8158, "mean_token_accuracy": 0.2136649891734123, "num_tokens": 72416118.0, "step": 41745 }, { "entropy": 5.357871723175049, "epoch": 3.24827854503015, "grad_norm": 1.1171875, "learning_rate": 0.0003958295522293891, "loss": 4.8127, "mean_token_accuracy": 0.21547832041978837, "num_tokens": 72424946.0, "step": 41750 }, { "entropy": 5.3265913963317875, "epoch": 3.248667574401867, "grad_norm": 1.0859375, "learning_rate": 0.0003958061712921417, "loss": 4.8789, "mean_token_accuracy": 0.2070385366678238, "num_tokens": 72435588.0, "step": 41755 }, { "entropy": 5.2481786727905275, "epoch": 3.249056603773585, "grad_norm": 1.1328125, "learning_rate": 0.000395782788521853, "loss": 4.8346, "mean_token_accuracy": 0.2093169704079628, "num_tokens": 72443728.0, "step": 41760 }, { "entropy": 5.334076929092407, "epoch": 3.2494456331453025, "grad_norm": 1.2421875, "learning_rate": 0.0003957594039188778, "loss": 4.8031, "mean_token_accuracy": 0.21667481660842897, "num_tokens": 72452163.0, "step": 41765 }, { "entropy": 5.402799034118653, "epoch": 3.24983466251702, "grad_norm": 1.1015625, "learning_rate": 0.0003957360174835708, "loss": 4.9694, "mean_token_accuracy": 0.20120735019445418, "num_tokens": 72461369.0, "step": 41770 }, { "entropy": 5.332149839401245, "epoch": 3.2502236918887375, "grad_norm": 1.2109375, "learning_rate": 0.0003957126292162868, "loss": 4.7519, "mean_token_accuracy": 0.21207719147205353, "num_tokens": 72470370.0, "step": 41775 }, { "entropy": 5.305440139770508, "epoch": 3.250612721260455, "grad_norm": 1.203125, "learning_rate": 0.0003956892391173809, "loss": 4.7658, "mean_token_accuracy": 0.2052665024995804, "num_tokens": 72478440.0, "step": 41780 }, { "entropy": 5.397833013534546, "epoch": 3.251001750632173, "grad_norm": 1.140625, "learning_rate": 0.00039566584718720793, "loss": 5.0151, "mean_token_accuracy": 0.20426901131868364, "num_tokens": 72487556.0, "step": 41785 }, { "entropy": 5.313311386108398, "epoch": 3.25139078000389, "grad_norm": 1.203125, "learning_rate": 0.0003956424534261227, "loss": 4.8832, "mean_token_accuracy": 0.20929237604141235, "num_tokens": 72495546.0, "step": 41790 }, { "entropy": 5.398889970779419, "epoch": 3.251779809375608, "grad_norm": 1.1484375, "learning_rate": 0.00039561905783448025, "loss": 4.8981, "mean_token_accuracy": 0.19964513480663298, "num_tokens": 72504479.0, "step": 41795 }, { "entropy": 5.361911201477051, "epoch": 3.2521688387473255, "grad_norm": 1.21875, "learning_rate": 0.00039559566041263565, "loss": 4.8997, "mean_token_accuracy": 0.2103080153465271, "num_tokens": 72512758.0, "step": 41800 }, { "entropy": 5.331159782409668, "epoch": 3.252557868119043, "grad_norm": 1.1484375, "learning_rate": 0.0003955722611609438, "loss": 4.8482, "mean_token_accuracy": 0.2054233193397522, "num_tokens": 72520920.0, "step": 41805 }, { "entropy": 5.354918193817139, "epoch": 3.2529468974907605, "grad_norm": 1.15625, "learning_rate": 0.00039554886007975976, "loss": 4.8573, "mean_token_accuracy": 0.20749630331993102, "num_tokens": 72529485.0, "step": 41810 }, { "entropy": 5.3143871307373045, "epoch": 3.253335926862478, "grad_norm": 1.1484375, "learning_rate": 0.00039552545716943873, "loss": 4.8121, "mean_token_accuracy": 0.20750755518674852, "num_tokens": 72538267.0, "step": 41815 }, { "entropy": 5.299352693557739, "epoch": 3.253724956234196, "grad_norm": 1.171875, "learning_rate": 0.0003955020524303358, "loss": 4.8024, "mean_token_accuracy": 0.21294431239366532, "num_tokens": 72546806.0, "step": 41820 }, { "entropy": 5.335839700698853, "epoch": 3.254113985605913, "grad_norm": 1.09375, "learning_rate": 0.00039547864586280583, "loss": 4.9036, "mean_token_accuracy": 0.20338983684778214, "num_tokens": 72554988.0, "step": 41825 }, { "entropy": 5.355981254577637, "epoch": 3.254503014977631, "grad_norm": 1.1640625, "learning_rate": 0.0003954552374672042, "loss": 4.8709, "mean_token_accuracy": 0.2094633847475052, "num_tokens": 72562760.0, "step": 41830 }, { "entropy": 5.287191247940063, "epoch": 3.2548920443493485, "grad_norm": 1.078125, "learning_rate": 0.0003954318272438862, "loss": 4.8476, "mean_token_accuracy": 0.2076736271381378, "num_tokens": 72571908.0, "step": 41835 }, { "entropy": 5.483546733856201, "epoch": 3.255281073721066, "grad_norm": 1.2265625, "learning_rate": 0.0003954084151932067, "loss": 4.9345, "mean_token_accuracy": 0.20738704055547713, "num_tokens": 72579840.0, "step": 41840 }, { "entropy": 5.338909721374511, "epoch": 3.2556701030927835, "grad_norm": 1.140625, "learning_rate": 0.0003953850013155214, "loss": 4.8053, "mean_token_accuracy": 0.20920224189758302, "num_tokens": 72588313.0, "step": 41845 }, { "entropy": 5.372808218002319, "epoch": 3.256059132464501, "grad_norm": 1.2421875, "learning_rate": 0.0003953615856111852, "loss": 4.914, "mean_token_accuracy": 0.20202042013406754, "num_tokens": 72597634.0, "step": 41850 }, { "entropy": 5.391716718673706, "epoch": 3.256448161836219, "grad_norm": 1.1328125, "learning_rate": 0.00039533816808055345, "loss": 4.8689, "mean_token_accuracy": 0.2087606206536293, "num_tokens": 72606092.0, "step": 41855 }, { "entropy": 5.38955249786377, "epoch": 3.256837191207936, "grad_norm": 1.125, "learning_rate": 0.00039531474872398165, "loss": 4.9251, "mean_token_accuracy": 0.20530149340629578, "num_tokens": 72614753.0, "step": 41860 }, { "entropy": 5.381896018981934, "epoch": 3.257226220579654, "grad_norm": 1.15625, "learning_rate": 0.000395291327541825, "loss": 4.9351, "mean_token_accuracy": 0.2010135069489479, "num_tokens": 72624412.0, "step": 41865 }, { "entropy": 5.333378410339355, "epoch": 3.257615249951371, "grad_norm": 1.125, "learning_rate": 0.00039526790453443887, "loss": 4.8509, "mean_token_accuracy": 0.2023446276783943, "num_tokens": 72633680.0, "step": 41870 }, { "entropy": 5.318945264816284, "epoch": 3.258004279323089, "grad_norm": 1.15625, "learning_rate": 0.00039524447970217875, "loss": 4.8599, "mean_token_accuracy": 0.20652349591255187, "num_tokens": 72642077.0, "step": 41875 }, { "entropy": 5.441044044494629, "epoch": 3.2583933086948065, "grad_norm": 1.171875, "learning_rate": 0.00039522105304540007, "loss": 4.9445, "mean_token_accuracy": 0.20762906074523926, "num_tokens": 72650400.0, "step": 41880 }, { "entropy": 5.376451587677002, "epoch": 3.258782338066524, "grad_norm": 1.1328125, "learning_rate": 0.0003951976245644582, "loss": 4.922, "mean_token_accuracy": 0.2064551144838333, "num_tokens": 72659164.0, "step": 41885 }, { "entropy": 5.3774515151977536, "epoch": 3.2591713674382414, "grad_norm": 1.125, "learning_rate": 0.0003951741942597087, "loss": 4.927, "mean_token_accuracy": 0.209536612033844, "num_tokens": 72667771.0, "step": 41890 }, { "entropy": 5.395315456390381, "epoch": 3.259560396809959, "grad_norm": 1.109375, "learning_rate": 0.00039515076213150714, "loss": 4.9168, "mean_token_accuracy": 0.20644933879375457, "num_tokens": 72677547.0, "step": 41895 }, { "entropy": 5.311406803131104, "epoch": 3.259949426181677, "grad_norm": 1.15625, "learning_rate": 0.00039512732818020903, "loss": 4.84, "mean_token_accuracy": 0.21157461702823638, "num_tokens": 72686239.0, "step": 41900 }, { "entropy": 5.4303281784057615, "epoch": 3.260338455553394, "grad_norm": 1.2578125, "learning_rate": 0.0003951038924061698, "loss": 4.9735, "mean_token_accuracy": 0.20099610537290574, "num_tokens": 72694645.0, "step": 41905 }, { "entropy": 5.501288890838623, "epoch": 3.2607274849251118, "grad_norm": 1.1171875, "learning_rate": 0.00039508045480974517, "loss": 4.9785, "mean_token_accuracy": 0.20128174275159835, "num_tokens": 72703166.0, "step": 41910 }, { "entropy": 5.343318843841553, "epoch": 3.2611165142968295, "grad_norm": 1.1171875, "learning_rate": 0.00039505701539129087, "loss": 4.8122, "mean_token_accuracy": 0.21636137068271638, "num_tokens": 72711986.0, "step": 41915 }, { "entropy": 5.338136482238769, "epoch": 3.261505543668547, "grad_norm": 1.2421875, "learning_rate": 0.00039503357415116236, "loss": 4.8513, "mean_token_accuracy": 0.21461150646209717, "num_tokens": 72720410.0, "step": 41920 }, { "entropy": 5.433432865142822, "epoch": 3.2618945730402644, "grad_norm": 1.109375, "learning_rate": 0.00039501013108971547, "loss": 4.9298, "mean_token_accuracy": 0.20563365668058395, "num_tokens": 72729287.0, "step": 41925 }, { "entropy": 5.408391380310059, "epoch": 3.262283602411982, "grad_norm": 1.3125, "learning_rate": 0.0003949866862073059, "loss": 4.9556, "mean_token_accuracy": 0.20406564027071, "num_tokens": 72737183.0, "step": 41930 }, { "entropy": 5.2857671737670895, "epoch": 3.2626726317837, "grad_norm": 1.34375, "learning_rate": 0.00039496323950428925, "loss": 4.9093, "mean_token_accuracy": 0.20963615775108338, "num_tokens": 72745357.0, "step": 41935 }, { "entropy": 5.334775924682617, "epoch": 3.263061661155417, "grad_norm": 1.1796875, "learning_rate": 0.0003949397909810213, "loss": 4.8301, "mean_token_accuracy": 0.21608931720256805, "num_tokens": 72753762.0, "step": 41940 }, { "entropy": 5.376649188995361, "epoch": 3.2634506905271348, "grad_norm": 1.1875, "learning_rate": 0.00039491634063785813, "loss": 4.7948, "mean_token_accuracy": 0.21431507617235185, "num_tokens": 72762259.0, "step": 41945 }, { "entropy": 5.342026853561402, "epoch": 3.2638397198988525, "grad_norm": 1.1640625, "learning_rate": 0.00039489288847515525, "loss": 4.8968, "mean_token_accuracy": 0.20659036189317703, "num_tokens": 72770831.0, "step": 41950 }, { "entropy": 5.347036409378052, "epoch": 3.26422874927057, "grad_norm": 1.1015625, "learning_rate": 0.0003948694344932687, "loss": 4.8618, "mean_token_accuracy": 0.2098207637667656, "num_tokens": 72779337.0, "step": 41955 }, { "entropy": 5.328391456604004, "epoch": 3.2646177786422874, "grad_norm": 1.234375, "learning_rate": 0.0003948459786925542, "loss": 4.7777, "mean_token_accuracy": 0.21717894524335862, "num_tokens": 72788144.0, "step": 41960 }, { "entropy": 5.365144968032837, "epoch": 3.265006808014005, "grad_norm": 1.2265625, "learning_rate": 0.0003948225210733677, "loss": 4.8886, "mean_token_accuracy": 0.20544988363981248, "num_tokens": 72796371.0, "step": 41965 }, { "entropy": 5.317060232162476, "epoch": 3.265395837385723, "grad_norm": 1.15625, "learning_rate": 0.0003947990616360652, "loss": 4.7999, "mean_token_accuracy": 0.2131517767906189, "num_tokens": 72804778.0, "step": 41970 }, { "entropy": 5.397791337966919, "epoch": 3.26578486675744, "grad_norm": 1.2265625, "learning_rate": 0.0003947756003810026, "loss": 4.9271, "mean_token_accuracy": 0.21177922636270524, "num_tokens": 72813507.0, "step": 41975 }, { "entropy": 5.450518083572388, "epoch": 3.2661738961291578, "grad_norm": 1.0859375, "learning_rate": 0.0003947521373085359, "loss": 4.9094, "mean_token_accuracy": 0.20602784156799317, "num_tokens": 72822772.0, "step": 41980 }, { "entropy": 5.3720207691192625, "epoch": 3.2665629255008755, "grad_norm": 1.1171875, "learning_rate": 0.0003947286724190212, "loss": 4.9319, "mean_token_accuracy": 0.20277654528617858, "num_tokens": 72831573.0, "step": 41985 }, { "entropy": 5.367356061935425, "epoch": 3.2669519548725927, "grad_norm": 1.09375, "learning_rate": 0.00039470520571281443, "loss": 4.8559, "mean_token_accuracy": 0.21823744773864745, "num_tokens": 72840461.0, "step": 41990 }, { "entropy": 5.332068634033203, "epoch": 3.2673409842443104, "grad_norm": 1.1796875, "learning_rate": 0.00039468173719027163, "loss": 4.8963, "mean_token_accuracy": 0.20825523436069487, "num_tokens": 72848834.0, "step": 41995 }, { "entropy": 5.41693081855774, "epoch": 3.267730013616028, "grad_norm": 1.25, "learning_rate": 0.0003946582668517491, "loss": 4.8863, "mean_token_accuracy": 0.19776221811771394, "num_tokens": 72857679.0, "step": 42000 }, { "epoch": 3.267730013616028, "eval_entropy": 5.167160672655005, "eval_loss": 5.0328240394592285, "eval_mean_token_accuracy": 0.20931800638430387, "eval_num_tokens": 72857679.0, "eval_runtime": 28.789, "eval_samples_per_second": 1443.539, "eval_steps_per_second": 180.451, "step": 42000 }, { "entropy": 5.428711366653443, "epoch": 3.2681190429877454, "grad_norm": 1.125, "learning_rate": 0.0003946347946976026, "loss": 4.9897, "mean_token_accuracy": 0.20459525287151337, "num_tokens": 72866664.0, "step": 42005 }, { "entropy": 5.321830940246582, "epoch": 3.268508072359463, "grad_norm": 1.078125, "learning_rate": 0.0003946113207281887, "loss": 4.8656, "mean_token_accuracy": 0.20998022258281707, "num_tokens": 72875520.0, "step": 42010 }, { "entropy": 5.3317183494567875, "epoch": 3.2688971017311808, "grad_norm": 1.15625, "learning_rate": 0.00039458784494386337, "loss": 4.8153, "mean_token_accuracy": 0.21449126303195953, "num_tokens": 72884251.0, "step": 42015 }, { "entropy": 5.452831172943116, "epoch": 3.2692861311028985, "grad_norm": 1.125, "learning_rate": 0.00039456436734498275, "loss": 4.9695, "mean_token_accuracy": 0.2007792830467224, "num_tokens": 72893317.0, "step": 42020 }, { "entropy": 5.3890361309051515, "epoch": 3.2696751604746157, "grad_norm": 1.171875, "learning_rate": 0.00039454088793190316, "loss": 4.8561, "mean_token_accuracy": 0.2112349271774292, "num_tokens": 72902118.0, "step": 42025 }, { "entropy": 5.339156150817871, "epoch": 3.2700641898463334, "grad_norm": 1.125, "learning_rate": 0.00039451740670498094, "loss": 4.9121, "mean_token_accuracy": 0.20765883922576905, "num_tokens": 72911165.0, "step": 42030 }, { "entropy": 5.39759259223938, "epoch": 3.270453219218051, "grad_norm": 1.140625, "learning_rate": 0.0003944939236645723, "loss": 4.9832, "mean_token_accuracy": 0.1984483554959297, "num_tokens": 72920348.0, "step": 42035 }, { "entropy": 5.451859664916992, "epoch": 3.2708422485897684, "grad_norm": 1.1484375, "learning_rate": 0.0003944704388110335, "loss": 4.8835, "mean_token_accuracy": 0.20356089770793914, "num_tokens": 72929568.0, "step": 42040 }, { "entropy": 5.362993383407593, "epoch": 3.271231277961486, "grad_norm": 1.21875, "learning_rate": 0.000394446952144721, "loss": 4.8928, "mean_token_accuracy": 0.20983300507068633, "num_tokens": 72937972.0, "step": 42045 }, { "entropy": 5.340504312515259, "epoch": 3.2716203073332037, "grad_norm": 1.109375, "learning_rate": 0.0003944234636659911, "loss": 4.8832, "mean_token_accuracy": 0.21147648990154266, "num_tokens": 72946186.0, "step": 42050 }, { "entropy": 5.3148456573486325, "epoch": 3.2720093367049214, "grad_norm": 1.1640625, "learning_rate": 0.0003943999733752003, "loss": 4.809, "mean_token_accuracy": 0.21389032304286956, "num_tokens": 72954521.0, "step": 42055 }, { "entropy": 5.408980178833008, "epoch": 3.2723983660766387, "grad_norm": 1.171875, "learning_rate": 0.0003943764812727048, "loss": 4.8386, "mean_token_accuracy": 0.21521628946065902, "num_tokens": 72962420.0, "step": 42060 }, { "entropy": 5.391130161285401, "epoch": 3.2727873954483564, "grad_norm": 1.140625, "learning_rate": 0.00039435298735886133, "loss": 4.8341, "mean_token_accuracy": 0.21330428272485732, "num_tokens": 72970528.0, "step": 42065 }, { "entropy": 5.315982389450073, "epoch": 3.273176424820074, "grad_norm": 1.109375, "learning_rate": 0.0003943294916340261, "loss": 4.8507, "mean_token_accuracy": 0.2110617235302925, "num_tokens": 72979618.0, "step": 42070 }, { "entropy": 5.281054306030273, "epoch": 3.2735654541917913, "grad_norm": 1.140625, "learning_rate": 0.0003943059940985559, "loss": 4.7858, "mean_token_accuracy": 0.21885846555233002, "num_tokens": 72988133.0, "step": 42075 }, { "entropy": 5.368542098999024, "epoch": 3.273954483563509, "grad_norm": 1.28125, "learning_rate": 0.00039428249475280706, "loss": 4.8456, "mean_token_accuracy": 0.21754485070705415, "num_tokens": 72996872.0, "step": 42080 }, { "entropy": 5.328502798080445, "epoch": 3.2743435129352267, "grad_norm": 1.2265625, "learning_rate": 0.0003942589935971363, "loss": 4.8719, "mean_token_accuracy": 0.22009753584861755, "num_tokens": 73005494.0, "step": 42085 }, { "entropy": 5.4510582447052, "epoch": 3.274732542306944, "grad_norm": 1.1640625, "learning_rate": 0.0003942354906319001, "loss": 4.9656, "mean_token_accuracy": 0.1984850749373436, "num_tokens": 73013729.0, "step": 42090 }, { "entropy": 5.432101106643676, "epoch": 3.2751215716786617, "grad_norm": 1.1328125, "learning_rate": 0.0003942119858574551, "loss": 4.8924, "mean_token_accuracy": 0.21381503194570542, "num_tokens": 73022337.0, "step": 42095 }, { "entropy": 5.319196939468384, "epoch": 3.2755106010503794, "grad_norm": 1.109375, "learning_rate": 0.000394188479274158, "loss": 4.9356, "mean_token_accuracy": 0.20488589406013488, "num_tokens": 73031758.0, "step": 42100 }, { "entropy": 5.368047428131104, "epoch": 3.2758996304220966, "grad_norm": 1.1953125, "learning_rate": 0.00039416497088236535, "loss": 4.8762, "mean_token_accuracy": 0.20543460547924042, "num_tokens": 73040046.0, "step": 42105 }, { "entropy": 5.337841320037842, "epoch": 3.2762886597938143, "grad_norm": 1.1875, "learning_rate": 0.000394141460682434, "loss": 4.806, "mean_token_accuracy": 0.21679086685180665, "num_tokens": 73048930.0, "step": 42110 }, { "entropy": 5.328960990905761, "epoch": 3.276677689165532, "grad_norm": 1.1328125, "learning_rate": 0.0003941179486747206, "loss": 4.8501, "mean_token_accuracy": 0.21960316300392152, "num_tokens": 73056952.0, "step": 42115 }, { "entropy": 5.3400720119476315, "epoch": 3.2770667185372497, "grad_norm": 1.140625, "learning_rate": 0.0003940944348595819, "loss": 4.9071, "mean_token_accuracy": 0.20288148522377014, "num_tokens": 73066289.0, "step": 42120 }, { "entropy": 5.3371506690979, "epoch": 3.277455747908967, "grad_norm": 1.1171875, "learning_rate": 0.00039407091923737475, "loss": 4.828, "mean_token_accuracy": 0.21449760645627974, "num_tokens": 73074484.0, "step": 42125 }, { "entropy": 5.342686128616333, "epoch": 3.2778447772806847, "grad_norm": 1.46875, "learning_rate": 0.00039404740180845594, "loss": 4.8764, "mean_token_accuracy": 0.2031072735786438, "num_tokens": 73082781.0, "step": 42130 }, { "entropy": 5.434997510910034, "epoch": 3.2782338066524024, "grad_norm": 1.1640625, "learning_rate": 0.00039402388257318236, "loss": 4.8904, "mean_token_accuracy": 0.20807009041309357, "num_tokens": 73091180.0, "step": 42135 }, { "entropy": 5.336933374404907, "epoch": 3.2786228360241196, "grad_norm": 1.171875, "learning_rate": 0.0003940003615319106, "loss": 4.8389, "mean_token_accuracy": 0.20721183866262435, "num_tokens": 73100328.0, "step": 42140 }, { "entropy": 5.389538097381592, "epoch": 3.2790118653958373, "grad_norm": 1.203125, "learning_rate": 0.00039397683868499784, "loss": 4.8576, "mean_token_accuracy": 0.22202855497598648, "num_tokens": 73108912.0, "step": 42145 }, { "entropy": 5.43189435005188, "epoch": 3.279400894767555, "grad_norm": 1.1328125, "learning_rate": 0.000393953314032801, "loss": 4.9359, "mean_token_accuracy": 0.20510950386524202, "num_tokens": 73118136.0, "step": 42150 }, { "entropy": 5.337279891967773, "epoch": 3.2797899241392727, "grad_norm": 1.109375, "learning_rate": 0.0003939297875756769, "loss": 4.8446, "mean_token_accuracy": 0.21122337728738785, "num_tokens": 73126958.0, "step": 42155 }, { "entropy": 5.3868138790130615, "epoch": 3.28017895351099, "grad_norm": 1.03125, "learning_rate": 0.0003939062593139825, "loss": 4.86, "mean_token_accuracy": 0.2001390725374222, "num_tokens": 73135456.0, "step": 42160 }, { "entropy": 5.28518443107605, "epoch": 3.2805679828827077, "grad_norm": 1.1953125, "learning_rate": 0.000393882729248075, "loss": 4.8178, "mean_token_accuracy": 0.21503061801195145, "num_tokens": 73143190.0, "step": 42165 }, { "entropy": 5.264685487747192, "epoch": 3.2809570122544254, "grad_norm": 1.09375, "learning_rate": 0.00039385919737831127, "loss": 4.8361, "mean_token_accuracy": 0.21586661636829377, "num_tokens": 73152275.0, "step": 42170 }, { "entropy": 5.333975696563721, "epoch": 3.2813460416261426, "grad_norm": 1.1484375, "learning_rate": 0.00039383566370504837, "loss": 4.8585, "mean_token_accuracy": 0.21329369395971298, "num_tokens": 73160687.0, "step": 42175 }, { "entropy": 5.357380819320679, "epoch": 3.2817350709978603, "grad_norm": 1.1484375, "learning_rate": 0.0003938121282286434, "loss": 5.0067, "mean_token_accuracy": 0.19609091132879258, "num_tokens": 73168843.0, "step": 42180 }, { "entropy": 5.400076913833618, "epoch": 3.282124100369578, "grad_norm": 1.234375, "learning_rate": 0.00039378859094945366, "loss": 4.885, "mean_token_accuracy": 0.20581024885177612, "num_tokens": 73177121.0, "step": 42185 }, { "entropy": 5.406248235702515, "epoch": 3.2825131297412953, "grad_norm": 1.09375, "learning_rate": 0.0003937650518678359, "loss": 4.8916, "mean_token_accuracy": 0.20771600753068925, "num_tokens": 73184952.0, "step": 42190 }, { "entropy": 5.358709764480591, "epoch": 3.282902159113013, "grad_norm": 1.109375, "learning_rate": 0.0003937415109841476, "loss": 4.8658, "mean_token_accuracy": 0.20596439242362977, "num_tokens": 73193509.0, "step": 42195 }, { "entropy": 5.332316923141479, "epoch": 3.2832911884847307, "grad_norm": 1.21875, "learning_rate": 0.0003937179682987459, "loss": 4.808, "mean_token_accuracy": 0.21530717760324478, "num_tokens": 73201083.0, "step": 42200 }, { "entropy": 5.31600341796875, "epoch": 3.283680217856448, "grad_norm": 1.1640625, "learning_rate": 0.00039369442381198793, "loss": 4.8119, "mean_token_accuracy": 0.21223850548267365, "num_tokens": 73209852.0, "step": 42205 }, { "entropy": 5.311897802352905, "epoch": 3.2840692472281656, "grad_norm": 1.140625, "learning_rate": 0.000393670877524231, "loss": 4.8497, "mean_token_accuracy": 0.2147618815302849, "num_tokens": 73218338.0, "step": 42210 }, { "entropy": 5.200770902633667, "epoch": 3.2844582765998833, "grad_norm": 1.234375, "learning_rate": 0.0003936473294358325, "loss": 4.7511, "mean_token_accuracy": 0.2260725423693657, "num_tokens": 73226820.0, "step": 42215 }, { "entropy": 5.358584880828857, "epoch": 3.284847305971601, "grad_norm": 1.1640625, "learning_rate": 0.0003936237795471495, "loss": 4.8964, "mean_token_accuracy": 0.21270556449890138, "num_tokens": 73235019.0, "step": 42220 }, { "entropy": 5.33240966796875, "epoch": 3.2852363353433183, "grad_norm": 1.140625, "learning_rate": 0.00039360022785853957, "loss": 4.8748, "mean_token_accuracy": 0.2124168947339058, "num_tokens": 73243994.0, "step": 42225 }, { "entropy": 5.355202674865723, "epoch": 3.285625364715036, "grad_norm": 1.1484375, "learning_rate": 0.0003935766743703599, "loss": 4.8846, "mean_token_accuracy": 0.2086198791861534, "num_tokens": 73252259.0, "step": 42230 }, { "entropy": 5.397878122329712, "epoch": 3.2860143940867537, "grad_norm": 1.140625, "learning_rate": 0.00039355311908296787, "loss": 4.9542, "mean_token_accuracy": 0.19856929183006286, "num_tokens": 73261559.0, "step": 42235 }, { "entropy": 5.3442024230957035, "epoch": 3.286403423458471, "grad_norm": 1.1875, "learning_rate": 0.000393529561996721, "loss": 4.8446, "mean_token_accuracy": 0.2225371092557907, "num_tokens": 73269534.0, "step": 42240 }, { "entropy": 5.322185897827149, "epoch": 3.2867924528301886, "grad_norm": 1.15625, "learning_rate": 0.00039350600311197667, "loss": 4.8222, "mean_token_accuracy": 0.2073875054717064, "num_tokens": 73277992.0, "step": 42245 }, { "entropy": 5.411247777938843, "epoch": 3.2871814822019063, "grad_norm": 1.21875, "learning_rate": 0.00039348244242909234, "loss": 4.9138, "mean_token_accuracy": 0.21043745130300523, "num_tokens": 73286551.0, "step": 42250 }, { "entropy": 5.4102812767028805, "epoch": 3.287570511573624, "grad_norm": 1.140625, "learning_rate": 0.00039345887994842566, "loss": 4.8585, "mean_token_accuracy": 0.20302973836660385, "num_tokens": 73294945.0, "step": 42255 }, { "entropy": 5.48405499458313, "epoch": 3.2879595409453413, "grad_norm": 1.15625, "learning_rate": 0.0003934353156703339, "loss": 4.9548, "mean_token_accuracy": 0.20783177465200425, "num_tokens": 73303657.0, "step": 42260 }, { "entropy": 5.3461285591125485, "epoch": 3.288348570317059, "grad_norm": 1.1484375, "learning_rate": 0.0003934117495951748, "loss": 4.9367, "mean_token_accuracy": 0.20636518001556398, "num_tokens": 73312435.0, "step": 42265 }, { "entropy": 5.415168619155883, "epoch": 3.2887375996887767, "grad_norm": 1.140625, "learning_rate": 0.0003933881817233058, "loss": 4.8953, "mean_token_accuracy": 0.2120101898908615, "num_tokens": 73321268.0, "step": 42270 }, { "entropy": 5.408770990371704, "epoch": 3.289126629060494, "grad_norm": 1.1640625, "learning_rate": 0.00039336461205508456, "loss": 4.8803, "mean_token_accuracy": 0.20962822884321214, "num_tokens": 73329608.0, "step": 42275 }, { "entropy": 5.347607803344727, "epoch": 3.2895156584322116, "grad_norm": 1.109375, "learning_rate": 0.0003933410405908689, "loss": 4.8269, "mean_token_accuracy": 0.21456782668828964, "num_tokens": 73338270.0, "step": 42280 }, { "entropy": 5.35476393699646, "epoch": 3.2899046878039293, "grad_norm": 1.078125, "learning_rate": 0.00039331746733101613, "loss": 4.8345, "mean_token_accuracy": 0.21274319291114807, "num_tokens": 73346906.0, "step": 42285 }, { "entropy": 5.35824613571167, "epoch": 3.290293717175647, "grad_norm": 1.125, "learning_rate": 0.00039329389227588416, "loss": 4.9028, "mean_token_accuracy": 0.21392219066619872, "num_tokens": 73355323.0, "step": 42290 }, { "entropy": 5.33562068939209, "epoch": 3.2906827465473643, "grad_norm": 1.125, "learning_rate": 0.00039327031542583067, "loss": 4.8919, "mean_token_accuracy": 0.20039534717798232, "num_tokens": 73364072.0, "step": 42295 }, { "entropy": 5.397718715667724, "epoch": 3.291071775919082, "grad_norm": 1.1015625, "learning_rate": 0.00039324673678121344, "loss": 4.9557, "mean_token_accuracy": 0.20919403433799744, "num_tokens": 73372593.0, "step": 42300 }, { "entropy": 5.438922166824341, "epoch": 3.291460805290799, "grad_norm": 1.234375, "learning_rate": 0.0003932231563423901, "loss": 5.0064, "mean_token_accuracy": 0.19822882860898972, "num_tokens": 73381411.0, "step": 42305 }, { "entropy": 5.330200624465943, "epoch": 3.291849834662517, "grad_norm": 1.1171875, "learning_rate": 0.0003931995741097186, "loss": 4.8155, "mean_token_accuracy": 0.21042453050613402, "num_tokens": 73389867.0, "step": 42310 }, { "entropy": 5.335262155532837, "epoch": 3.2922388640342346, "grad_norm": 1.1015625, "learning_rate": 0.00039317599008355665, "loss": 4.8498, "mean_token_accuracy": 0.20994527339935304, "num_tokens": 73398298.0, "step": 42315 }, { "entropy": 5.282837200164795, "epoch": 3.2926278934059523, "grad_norm": 1.078125, "learning_rate": 0.0003931524042642622, "loss": 4.8004, "mean_token_accuracy": 0.21810285449028016, "num_tokens": 73406566.0, "step": 42320 }, { "entropy": 5.331423759460449, "epoch": 3.2930169227776696, "grad_norm": 1.125, "learning_rate": 0.0003931288166521931, "loss": 4.8193, "mean_token_accuracy": 0.20740996897220612, "num_tokens": 73415390.0, "step": 42325 }, { "entropy": 5.4215796947479244, "epoch": 3.2934059521493873, "grad_norm": 1.0859375, "learning_rate": 0.00039310522724770713, "loss": 4.926, "mean_token_accuracy": 0.20326556414365768, "num_tokens": 73424400.0, "step": 42330 }, { "entropy": 5.397515201568604, "epoch": 3.293794981521105, "grad_norm": 1.2265625, "learning_rate": 0.00039308163605116235, "loss": 4.9787, "mean_token_accuracy": 0.2045031249523163, "num_tokens": 73433359.0, "step": 42335 }, { "entropy": 5.294189453125, "epoch": 3.294184010892822, "grad_norm": 1.109375, "learning_rate": 0.0003930580430629167, "loss": 4.7844, "mean_token_accuracy": 0.21304414570331573, "num_tokens": 73442353.0, "step": 42340 }, { "entropy": 5.394235467910766, "epoch": 3.29457304026454, "grad_norm": 1.1953125, "learning_rate": 0.0003930344482833281, "loss": 4.8604, "mean_token_accuracy": 0.21535392105579376, "num_tokens": 73451122.0, "step": 42345 }, { "entropy": 5.353601503372192, "epoch": 3.2949620696362576, "grad_norm": 1.109375, "learning_rate": 0.00039301085171275475, "loss": 4.8932, "mean_token_accuracy": 0.20417425334453582, "num_tokens": 73459733.0, "step": 42350 }, { "entropy": 5.367926406860351, "epoch": 3.2953510990079753, "grad_norm": 1.1015625, "learning_rate": 0.0003929872533515545, "loss": 4.8206, "mean_token_accuracy": 0.21330493837594985, "num_tokens": 73468454.0, "step": 42355 }, { "entropy": 5.387057876586914, "epoch": 3.2957401283796925, "grad_norm": 1.1171875, "learning_rate": 0.00039296365320008546, "loss": 4.9501, "mean_token_accuracy": 0.203630530834198, "num_tokens": 73477541.0, "step": 42360 }, { "entropy": 5.335952854156494, "epoch": 3.2961291577514102, "grad_norm": 1.1953125, "learning_rate": 0.00039294005125870576, "loss": 4.9403, "mean_token_accuracy": 0.2026025727391243, "num_tokens": 73485625.0, "step": 42365 }, { "entropy": 5.3484447479248045, "epoch": 3.296518187123128, "grad_norm": 1.0703125, "learning_rate": 0.00039291644752777346, "loss": 4.8751, "mean_token_accuracy": 0.21213537603616714, "num_tokens": 73494157.0, "step": 42370 }, { "entropy": 5.353247785568238, "epoch": 3.296907216494845, "grad_norm": 1.1953125, "learning_rate": 0.00039289284200764676, "loss": 4.8791, "mean_token_accuracy": 0.2118928000330925, "num_tokens": 73503322.0, "step": 42375 }, { "entropy": 5.3896036624908445, "epoch": 3.297296245866563, "grad_norm": 1.1015625, "learning_rate": 0.0003928692346986839, "loss": 4.9363, "mean_token_accuracy": 0.19805720895528794, "num_tokens": 73513009.0, "step": 42380 }, { "entropy": 5.410406827926636, "epoch": 3.2976852752382806, "grad_norm": 1.1875, "learning_rate": 0.00039284562560124297, "loss": 4.8555, "mean_token_accuracy": 0.208360156416893, "num_tokens": 73520911.0, "step": 42385 }, { "entropy": 5.344490051269531, "epoch": 3.2980743046099983, "grad_norm": 1.1484375, "learning_rate": 0.0003928220147156822, "loss": 4.8466, "mean_token_accuracy": 0.2149355784058571, "num_tokens": 73529810.0, "step": 42390 }, { "entropy": 5.426161670684815, "epoch": 3.2984633339817155, "grad_norm": 1.09375, "learning_rate": 0.00039279840204235994, "loss": 4.9948, "mean_token_accuracy": 0.20574368089437484, "num_tokens": 73539305.0, "step": 42395 }, { "entropy": 5.407580995559693, "epoch": 3.2988523633534332, "grad_norm": 1.1484375, "learning_rate": 0.00039277478758163443, "loss": 4.9016, "mean_token_accuracy": 0.20561892092227935, "num_tokens": 73548073.0, "step": 42400 }, { "entropy": 5.368300247192383, "epoch": 3.299241392725151, "grad_norm": 1.1484375, "learning_rate": 0.000392751171333864, "loss": 4.8963, "mean_token_accuracy": 0.2087974801659584, "num_tokens": 73556825.0, "step": 42405 }, { "entropy": 5.337278604507446, "epoch": 3.299630422096868, "grad_norm": 1.125, "learning_rate": 0.00039272755329940683, "loss": 4.8705, "mean_token_accuracy": 0.20931815952062607, "num_tokens": 73565966.0, "step": 42410 }, { "entropy": 5.364250564575196, "epoch": 3.300019451468586, "grad_norm": 1.2265625, "learning_rate": 0.00039270393347862155, "loss": 4.9158, "mean_token_accuracy": 0.21052158027887344, "num_tokens": 73574653.0, "step": 42415 }, { "entropy": 5.410108661651611, "epoch": 3.3004084808403036, "grad_norm": 1.2109375, "learning_rate": 0.00039268031187186635, "loss": 4.9031, "mean_token_accuracy": 0.20821256637573243, "num_tokens": 73583608.0, "step": 42420 }, { "entropy": 5.292123031616211, "epoch": 3.300797510212021, "grad_norm": 1.171875, "learning_rate": 0.00039265668847949977, "loss": 4.8325, "mean_token_accuracy": 0.21808480769395827, "num_tokens": 73592431.0, "step": 42425 }, { "entropy": 5.355046319961548, "epoch": 3.3011865395837385, "grad_norm": 1.1328125, "learning_rate": 0.0003926330633018802, "loss": 4.8791, "mean_token_accuracy": 0.20998267978429794, "num_tokens": 73600842.0, "step": 42430 }, { "entropy": 5.404012632369995, "epoch": 3.3015755689554562, "grad_norm": 1.171875, "learning_rate": 0.00039260943633936615, "loss": 4.883, "mean_token_accuracy": 0.20850574672222139, "num_tokens": 73609725.0, "step": 42435 }, { "entropy": 5.283267831802368, "epoch": 3.3019645983271735, "grad_norm": 1.0625, "learning_rate": 0.00039258580759231603, "loss": 4.7608, "mean_token_accuracy": 0.21916815638542175, "num_tokens": 73619429.0, "step": 42440 }, { "entropy": 5.369707775115967, "epoch": 3.302353627698891, "grad_norm": 1.1484375, "learning_rate": 0.0003925621770610885, "loss": 4.9364, "mean_token_accuracy": 0.19841749370098113, "num_tokens": 73628370.0, "step": 42445 }, { "entropy": 5.377126598358155, "epoch": 3.302742657070609, "grad_norm": 1.2265625, "learning_rate": 0.000392538544746042, "loss": 4.8687, "mean_token_accuracy": 0.21084951609373093, "num_tokens": 73637500.0, "step": 42450 }, { "entropy": 5.348564577102661, "epoch": 3.3031316864423266, "grad_norm": 1.1484375, "learning_rate": 0.00039251491064753525, "loss": 4.8504, "mean_token_accuracy": 0.20758171677589415, "num_tokens": 73646597.0, "step": 42455 }, { "entropy": 5.31620717048645, "epoch": 3.303520715814044, "grad_norm": 1.2109375, "learning_rate": 0.0003924912747659267, "loss": 4.7759, "mean_token_accuracy": 0.21321991533041001, "num_tokens": 73654611.0, "step": 42460 }, { "entropy": 5.344032096862793, "epoch": 3.3039097451857615, "grad_norm": 1.0625, "learning_rate": 0.00039246763710157513, "loss": 4.9334, "mean_token_accuracy": 0.2014251559972763, "num_tokens": 73663011.0, "step": 42465 }, { "entropy": 5.367544651031494, "epoch": 3.3042987745574792, "grad_norm": 1.2578125, "learning_rate": 0.0003924439976548391, "loss": 4.8608, "mean_token_accuracy": 0.21135739833116532, "num_tokens": 73670920.0, "step": 42470 }, { "entropy": 5.299671411514282, "epoch": 3.3046878039291965, "grad_norm": 1.109375, "learning_rate": 0.00039242035642607733, "loss": 4.8267, "mean_token_accuracy": 0.211912901699543, "num_tokens": 73680124.0, "step": 42475 }, { "entropy": 5.310601711273193, "epoch": 3.305076833300914, "grad_norm": 1.1640625, "learning_rate": 0.0003923967134156486, "loss": 4.8445, "mean_token_accuracy": 0.2077726572751999, "num_tokens": 73688573.0, "step": 42480 }, { "entropy": 5.354006719589234, "epoch": 3.305465862672632, "grad_norm": 1.1796875, "learning_rate": 0.0003923730686239115, "loss": 4.9103, "mean_token_accuracy": 0.2047051101922989, "num_tokens": 73697617.0, "step": 42485 }, { "entropy": 5.347281789779663, "epoch": 3.3058548920443496, "grad_norm": 1.0625, "learning_rate": 0.0003923494220512249, "loss": 4.7918, "mean_token_accuracy": 0.21237691938877107, "num_tokens": 73706284.0, "step": 42490 }, { "entropy": 5.325585985183716, "epoch": 3.306243921416067, "grad_norm": 1.1328125, "learning_rate": 0.0003923257736979476, "loss": 4.8301, "mean_token_accuracy": 0.2116803526878357, "num_tokens": 73714820.0, "step": 42495 }, { "entropy": 5.3002242088317875, "epoch": 3.3066329507877845, "grad_norm": 1.1484375, "learning_rate": 0.00039230212356443855, "loss": 4.8605, "mean_token_accuracy": 0.20864193588495256, "num_tokens": 73723292.0, "step": 42500 }, { "entropy": 5.393737745285034, "epoch": 3.307021980159502, "grad_norm": 1.1484375, "learning_rate": 0.00039227847165105635, "loss": 4.9093, "mean_token_accuracy": 0.19720976501703263, "num_tokens": 73732063.0, "step": 42505 }, { "entropy": 5.365620374679565, "epoch": 3.3074110095312195, "grad_norm": 1.171875, "learning_rate": 0.00039225481795816016, "loss": 4.9108, "mean_token_accuracy": 0.20839255303144455, "num_tokens": 73741072.0, "step": 42510 }, { "entropy": 5.2999982833862305, "epoch": 3.307800038902937, "grad_norm": 1.0703125, "learning_rate": 0.0003922311624861086, "loss": 4.821, "mean_token_accuracy": 0.21689532697200775, "num_tokens": 73749612.0, "step": 42515 }, { "entropy": 5.335235357284546, "epoch": 3.308189068274655, "grad_norm": 1.1484375, "learning_rate": 0.0003922075052352608, "loss": 4.8705, "mean_token_accuracy": 0.2102089822292328, "num_tokens": 73757829.0, "step": 42520 }, { "entropy": 5.333981084823608, "epoch": 3.308578097646372, "grad_norm": 1.1875, "learning_rate": 0.0003921838462059756, "loss": 4.8528, "mean_token_accuracy": 0.21077800244092942, "num_tokens": 73766760.0, "step": 42525 }, { "entropy": 5.397437047958374, "epoch": 3.30896712701809, "grad_norm": 1.1484375, "learning_rate": 0.00039216018539861217, "loss": 5.0068, "mean_token_accuracy": 0.197414068877697, "num_tokens": 73775851.0, "step": 42530 }, { "entropy": 5.344344997406006, "epoch": 3.3093561563898075, "grad_norm": 1.203125, "learning_rate": 0.0003921365228135293, "loss": 4.7593, "mean_token_accuracy": 0.21201589554548264, "num_tokens": 73784090.0, "step": 42535 }, { "entropy": 5.335421705245972, "epoch": 3.3097451857615248, "grad_norm": 1.171875, "learning_rate": 0.00039211285845108617, "loss": 4.8778, "mean_token_accuracy": 0.20496286749839782, "num_tokens": 73792709.0, "step": 42540 }, { "entropy": 5.3643499374389645, "epoch": 3.3101342151332425, "grad_norm": 1.125, "learning_rate": 0.0003920891923116418, "loss": 4.8951, "mean_token_accuracy": 0.21068963557481765, "num_tokens": 73801017.0, "step": 42545 }, { "entropy": 5.305859184265136, "epoch": 3.31052324450496, "grad_norm": 1.1875, "learning_rate": 0.00039206552439555544, "loss": 4.8372, "mean_token_accuracy": 0.21494196504354476, "num_tokens": 73809701.0, "step": 42550 }, { "entropy": 5.4098351955413815, "epoch": 3.310912273876678, "grad_norm": 1.1328125, "learning_rate": 0.0003920418547031859, "loss": 4.9628, "mean_token_accuracy": 0.21018091291189195, "num_tokens": 73817935.0, "step": 42555 }, { "entropy": 5.281893348693847, "epoch": 3.311301303248395, "grad_norm": 1.0546875, "learning_rate": 0.0003920181832348926, "loss": 4.7658, "mean_token_accuracy": 0.21881279945373536, "num_tokens": 73827212.0, "step": 42560 }, { "entropy": 5.347813272476197, "epoch": 3.311690332620113, "grad_norm": 1.2578125, "learning_rate": 0.0003919945099910346, "loss": 4.9571, "mean_token_accuracy": 0.19738508611917496, "num_tokens": 73835114.0, "step": 42565 }, { "entropy": 5.37152361869812, "epoch": 3.3120793619918305, "grad_norm": 1.09375, "learning_rate": 0.00039197083497197107, "loss": 4.8955, "mean_token_accuracy": 0.2067392274737358, "num_tokens": 73844137.0, "step": 42570 }, { "entropy": 5.386372470855713, "epoch": 3.3124683913635478, "grad_norm": 1.078125, "learning_rate": 0.0003919471581780613, "loss": 4.8638, "mean_token_accuracy": 0.2174961358308792, "num_tokens": 73852949.0, "step": 42575 }, { "entropy": 5.294262456893921, "epoch": 3.3128574207352655, "grad_norm": 1.1171875, "learning_rate": 0.0003919234796096646, "loss": 4.7779, "mean_token_accuracy": 0.2084813505411148, "num_tokens": 73860980.0, "step": 42580 }, { "entropy": 5.358675193786621, "epoch": 3.313246450106983, "grad_norm": 1.0859375, "learning_rate": 0.0003918997992671402, "loss": 4.9183, "mean_token_accuracy": 0.20189463049173356, "num_tokens": 73869895.0, "step": 42585 }, { "entropy": 5.305631256103515, "epoch": 3.313635479478701, "grad_norm": 1.0859375, "learning_rate": 0.0003918761171508475, "loss": 4.7976, "mean_token_accuracy": 0.21584342271089554, "num_tokens": 73879297.0, "step": 42590 }, { "entropy": 5.362803506851196, "epoch": 3.314024508850418, "grad_norm": 1.171875, "learning_rate": 0.0003918524332611456, "loss": 4.8596, "mean_token_accuracy": 0.2136973559856415, "num_tokens": 73887317.0, "step": 42595 }, { "entropy": 5.302360486984253, "epoch": 3.314413538222136, "grad_norm": 1.078125, "learning_rate": 0.0003918287475983941, "loss": 4.84, "mean_token_accuracy": 0.20589075684547425, "num_tokens": 73896744.0, "step": 42600 }, { "entropy": 5.392413854598999, "epoch": 3.3148025675938535, "grad_norm": 1.15625, "learning_rate": 0.00039180506016295226, "loss": 4.8704, "mean_token_accuracy": 0.20439125895500182, "num_tokens": 73905084.0, "step": 42605 }, { "entropy": 5.431194257736206, "epoch": 3.3151915969655708, "grad_norm": 1.1484375, "learning_rate": 0.00039178137095517956, "loss": 4.9361, "mean_token_accuracy": 0.2032051905989647, "num_tokens": 73914342.0, "step": 42610 }, { "entropy": 5.319161319732666, "epoch": 3.3155806263372885, "grad_norm": 1.109375, "learning_rate": 0.0003917576799754354, "loss": 4.8568, "mean_token_accuracy": 0.21430832892656326, "num_tokens": 73923241.0, "step": 42615 }, { "entropy": 5.400479459762574, "epoch": 3.315969655709006, "grad_norm": 1.1640625, "learning_rate": 0.0003917339872240793, "loss": 4.8673, "mean_token_accuracy": 0.20486333221197128, "num_tokens": 73932142.0, "step": 42620 }, { "entropy": 5.326025438308716, "epoch": 3.3163586850807234, "grad_norm": 1.1640625, "learning_rate": 0.0003917102927014708, "loss": 4.802, "mean_token_accuracy": 0.21244189739227295, "num_tokens": 73941163.0, "step": 42625 }, { "entropy": 5.329640531539917, "epoch": 3.316747714452441, "grad_norm": 1.15625, "learning_rate": 0.0003916865964079694, "loss": 4.8182, "mean_token_accuracy": 0.21841903775930405, "num_tokens": 73949766.0, "step": 42630 }, { "entropy": 5.424621486663819, "epoch": 3.317136743824159, "grad_norm": 1.1171875, "learning_rate": 0.0003916628983439345, "loss": 4.9156, "mean_token_accuracy": 0.2007525384426117, "num_tokens": 73958387.0, "step": 42635 }, { "entropy": 5.268437337875366, "epoch": 3.317525773195876, "grad_norm": 1.140625, "learning_rate": 0.00039163919850972585, "loss": 4.8285, "mean_token_accuracy": 0.20940502285957335, "num_tokens": 73967068.0, "step": 42640 }, { "entropy": 5.362547254562378, "epoch": 3.3179148025675937, "grad_norm": 1.078125, "learning_rate": 0.0003916154969057031, "loss": 4.9229, "mean_token_accuracy": 0.20407520234584808, "num_tokens": 73976325.0, "step": 42645 }, { "entropy": 5.407585477828979, "epoch": 3.3183038319393114, "grad_norm": 1.1015625, "learning_rate": 0.00039159179353222566, "loss": 4.833, "mean_token_accuracy": 0.21050372570753098, "num_tokens": 73985403.0, "step": 42650 }, { "entropy": 5.4544507503509525, "epoch": 3.318692861311029, "grad_norm": 1.125, "learning_rate": 0.00039156808838965336, "loss": 4.9448, "mean_token_accuracy": 0.2030564248561859, "num_tokens": 73993832.0, "step": 42655 }, { "entropy": 5.34275484085083, "epoch": 3.3190818906827464, "grad_norm": 1.1171875, "learning_rate": 0.00039154438147834595, "loss": 4.8752, "mean_token_accuracy": 0.21381334960460663, "num_tokens": 74002374.0, "step": 42660 }, { "entropy": 5.357646846771241, "epoch": 3.319470920054464, "grad_norm": 1.1015625, "learning_rate": 0.00039152067279866294, "loss": 4.8461, "mean_token_accuracy": 0.21271135210990905, "num_tokens": 74011655.0, "step": 42665 }, { "entropy": 5.32284026145935, "epoch": 3.319859949426182, "grad_norm": 1.2265625, "learning_rate": 0.0003914969623509643, "loss": 4.8793, "mean_token_accuracy": 0.2072302982211113, "num_tokens": 74020760.0, "step": 42670 }, { "entropy": 5.31123833656311, "epoch": 3.320248978797899, "grad_norm": 1.21875, "learning_rate": 0.0003914732501356096, "loss": 4.8487, "mean_token_accuracy": 0.21172153055667878, "num_tokens": 74029315.0, "step": 42675 }, { "entropy": 5.3893169403076175, "epoch": 3.3206380081696167, "grad_norm": 1.2421875, "learning_rate": 0.00039144953615295877, "loss": 4.8834, "mean_token_accuracy": 0.21309739351272583, "num_tokens": 74038675.0, "step": 42680 }, { "entropy": 5.426571893692016, "epoch": 3.3210270375413344, "grad_norm": 1.1171875, "learning_rate": 0.00039142582040337147, "loss": 4.8796, "mean_token_accuracy": 0.21346623003482817, "num_tokens": 74046836.0, "step": 42685 }, { "entropy": 5.342963409423828, "epoch": 3.321416066913052, "grad_norm": 1.078125, "learning_rate": 0.0003914021028872077, "loss": 4.8465, "mean_token_accuracy": 0.21121364682912827, "num_tokens": 74055903.0, "step": 42690 }, { "entropy": 5.339608573913575, "epoch": 3.3218050962847694, "grad_norm": 1.15625, "learning_rate": 0.0003913783836048274, "loss": 4.8642, "mean_token_accuracy": 0.21063688695430755, "num_tokens": 74064770.0, "step": 42695 }, { "entropy": 5.375512886047363, "epoch": 3.322194125656487, "grad_norm": 1.203125, "learning_rate": 0.0003913546625565902, "loss": 4.9775, "mean_token_accuracy": 0.20126980692148208, "num_tokens": 74072879.0, "step": 42700 }, { "entropy": 5.351089000701904, "epoch": 3.322583155028205, "grad_norm": 1.1171875, "learning_rate": 0.00039133093974285635, "loss": 4.9022, "mean_token_accuracy": 0.20668511986732482, "num_tokens": 74081696.0, "step": 42705 }, { "entropy": 5.398468017578125, "epoch": 3.322972184399922, "grad_norm": 1.109375, "learning_rate": 0.00039130721516398556, "loss": 4.9021, "mean_token_accuracy": 0.20968734920024873, "num_tokens": 74090336.0, "step": 42710 }, { "entropy": 5.456526231765747, "epoch": 3.3233612137716397, "grad_norm": 1.28125, "learning_rate": 0.0003912834888203379, "loss": 4.9924, "mean_token_accuracy": 0.19691791981458664, "num_tokens": 74098720.0, "step": 42715 }, { "entropy": 5.396238374710083, "epoch": 3.3237502431433574, "grad_norm": 1.125, "learning_rate": 0.0003912597607122734, "loss": 4.9002, "mean_token_accuracy": 0.20502217262983322, "num_tokens": 74107441.0, "step": 42720 }, { "entropy": 5.316054344177246, "epoch": 3.324139272515075, "grad_norm": 1.078125, "learning_rate": 0.00039123603084015204, "loss": 4.8925, "mean_token_accuracy": 0.20953400433063507, "num_tokens": 74116200.0, "step": 42725 }, { "entropy": 5.327217483520508, "epoch": 3.3245283018867924, "grad_norm": 1.1953125, "learning_rate": 0.00039121229920433394, "loss": 4.8714, "mean_token_accuracy": 0.2094476714730263, "num_tokens": 74124886.0, "step": 42730 }, { "entropy": 5.426711130142212, "epoch": 3.32491733125851, "grad_norm": 1.1796875, "learning_rate": 0.0003911885658051792, "loss": 4.9065, "mean_token_accuracy": 0.20472918301820756, "num_tokens": 74133204.0, "step": 42735 }, { "entropy": 5.36160249710083, "epoch": 3.3253063606302278, "grad_norm": 1.2109375, "learning_rate": 0.00039116483064304794, "loss": 4.8586, "mean_token_accuracy": 0.20660397112369538, "num_tokens": 74141813.0, "step": 42740 }, { "entropy": 5.328420543670655, "epoch": 3.325695390001945, "grad_norm": 1.2578125, "learning_rate": 0.0003911410937183002, "loss": 4.9055, "mean_token_accuracy": 0.20508962571620942, "num_tokens": 74150170.0, "step": 42745 }, { "entropy": 5.31853756904602, "epoch": 3.3260844193736627, "grad_norm": 1.125, "learning_rate": 0.00039111735503129626, "loss": 4.8419, "mean_token_accuracy": 0.2069627583026886, "num_tokens": 74158935.0, "step": 42750 }, { "entropy": 5.385170030593872, "epoch": 3.3264734487453804, "grad_norm": 1.109375, "learning_rate": 0.0003910936145823962, "loss": 4.8889, "mean_token_accuracy": 0.20804361402988433, "num_tokens": 74167467.0, "step": 42755 }, { "entropy": 5.315180063247681, "epoch": 3.3268624781170977, "grad_norm": 1.1875, "learning_rate": 0.0003910698723719604, "loss": 4.7679, "mean_token_accuracy": 0.21956311613321305, "num_tokens": 74175513.0, "step": 42760 }, { "entropy": 5.396733665466309, "epoch": 3.3272515074888154, "grad_norm": 1.2265625, "learning_rate": 0.00039104612840034904, "loss": 4.9215, "mean_token_accuracy": 0.2123357132077217, "num_tokens": 74183617.0, "step": 42765 }, { "entropy": 5.449248456954956, "epoch": 3.327640536860533, "grad_norm": 1.15625, "learning_rate": 0.00039102238266792234, "loss": 4.9188, "mean_token_accuracy": 0.20871601998806, "num_tokens": 74191662.0, "step": 42770 }, { "entropy": 5.335971403121948, "epoch": 3.3280295662322503, "grad_norm": 1.1328125, "learning_rate": 0.00039099863517504064, "loss": 4.8224, "mean_token_accuracy": 0.21704926788806916, "num_tokens": 74199610.0, "step": 42775 }, { "entropy": 5.29502124786377, "epoch": 3.328418595603968, "grad_norm": 1.25, "learning_rate": 0.0003909748859220644, "loss": 4.8867, "mean_token_accuracy": 0.21051667481660843, "num_tokens": 74207579.0, "step": 42780 }, { "entropy": 5.40522575378418, "epoch": 3.3288076249756857, "grad_norm": 1.25, "learning_rate": 0.00039095113490935377, "loss": 4.8938, "mean_token_accuracy": 0.2075913742184639, "num_tokens": 74215428.0, "step": 42785 }, { "entropy": 5.421006536483764, "epoch": 3.3291966543474034, "grad_norm": 1.1875, "learning_rate": 0.0003909273821372692, "loss": 4.9369, "mean_token_accuracy": 0.20262244790792466, "num_tokens": 74223694.0, "step": 42790 }, { "entropy": 5.370386552810669, "epoch": 3.3295856837191207, "grad_norm": 1.203125, "learning_rate": 0.00039090362760617114, "loss": 4.9443, "mean_token_accuracy": 0.2107130154967308, "num_tokens": 74232791.0, "step": 42795 }, { "entropy": 5.422810173034668, "epoch": 3.3299747130908384, "grad_norm": 1.1640625, "learning_rate": 0.00039087987131642, "loss": 4.9499, "mean_token_accuracy": 0.20726177096366882, "num_tokens": 74241581.0, "step": 42800 }, { "entropy": 5.303895616531372, "epoch": 3.330363742462556, "grad_norm": 1.109375, "learning_rate": 0.0003908561132683762, "loss": 4.8288, "mean_token_accuracy": 0.21727501451969147, "num_tokens": 74250868.0, "step": 42805 }, { "entropy": 5.3522600650787355, "epoch": 3.3307527718342733, "grad_norm": 1.140625, "learning_rate": 0.00039083235346240044, "loss": 4.867, "mean_token_accuracy": 0.20561354607343674, "num_tokens": 74259992.0, "step": 42810 }, { "entropy": 5.396994304656983, "epoch": 3.331141801205991, "grad_norm": 1.1796875, "learning_rate": 0.000390808591898853, "loss": 4.9761, "mean_token_accuracy": 0.20532349050045012, "num_tokens": 74267900.0, "step": 42815 }, { "entropy": 5.418791627883911, "epoch": 3.3315308305777087, "grad_norm": 1.09375, "learning_rate": 0.0003907848285780945, "loss": 4.8323, "mean_token_accuracy": 0.20979541540145874, "num_tokens": 74276448.0, "step": 42820 }, { "entropy": 5.360913562774658, "epoch": 3.3319198599494264, "grad_norm": 1.25, "learning_rate": 0.00039076106350048557, "loss": 4.8886, "mean_token_accuracy": 0.20720884054899216, "num_tokens": 74284878.0, "step": 42825 }, { "entropy": 5.343692922592163, "epoch": 3.3323088893211437, "grad_norm": 1.0859375, "learning_rate": 0.0003907372966663867, "loss": 4.8186, "mean_token_accuracy": 0.20895814448595046, "num_tokens": 74293647.0, "step": 42830 }, { "entropy": 5.37368426322937, "epoch": 3.3326979186928614, "grad_norm": 1.1640625, "learning_rate": 0.0003907135280761585, "loss": 4.9366, "mean_token_accuracy": 0.20624768882989883, "num_tokens": 74302122.0, "step": 42835 }, { "entropy": 5.496716737747192, "epoch": 3.333086948064579, "grad_norm": 1.1171875, "learning_rate": 0.0003906897577301618, "loss": 4.9235, "mean_token_accuracy": 0.2008320301771164, "num_tokens": 74311729.0, "step": 42840 }, { "entropy": 5.389238595962524, "epoch": 3.3334759774362963, "grad_norm": 1.1015625, "learning_rate": 0.0003906659856287571, "loss": 4.857, "mean_token_accuracy": 0.2144181251525879, "num_tokens": 74320694.0, "step": 42845 }, { "entropy": 5.265493679046631, "epoch": 3.333865006808014, "grad_norm": 1.125, "learning_rate": 0.00039064221177230517, "loss": 4.7499, "mean_token_accuracy": 0.22271642088890076, "num_tokens": 74328810.0, "step": 42850 }, { "entropy": 5.280264377593994, "epoch": 3.3342540361797317, "grad_norm": 1.1640625, "learning_rate": 0.00039061843616116683, "loss": 4.8169, "mean_token_accuracy": 0.20777574330568313, "num_tokens": 74337005.0, "step": 42855 }, { "entropy": 5.356982564926147, "epoch": 3.334643065551449, "grad_norm": 1.078125, "learning_rate": 0.00039059465879570264, "loss": 4.8714, "mean_token_accuracy": 0.21355022490024567, "num_tokens": 74346353.0, "step": 42860 }, { "entropy": 5.421571063995361, "epoch": 3.3350320949231667, "grad_norm": 1.1796875, "learning_rate": 0.0003905708796762736, "loss": 5.037, "mean_token_accuracy": 0.20000346153974533, "num_tokens": 74355698.0, "step": 42865 }, { "entropy": 5.438991928100586, "epoch": 3.3354211242948844, "grad_norm": 1.0546875, "learning_rate": 0.0003905470988032403, "loss": 4.9946, "mean_token_accuracy": 0.20593009889125824, "num_tokens": 74365503.0, "step": 42870 }, { "entropy": 5.409659147262573, "epoch": 3.3358101536666016, "grad_norm": 1.078125, "learning_rate": 0.0003905233161769637, "loss": 4.9072, "mean_token_accuracy": 0.20346214175224303, "num_tokens": 74374788.0, "step": 42875 }, { "entropy": 5.3195923328399655, "epoch": 3.3361991830383193, "grad_norm": 1.1171875, "learning_rate": 0.0003904995317978048, "loss": 4.7488, "mean_token_accuracy": 0.2231346294283867, "num_tokens": 74384026.0, "step": 42880 }, { "entropy": 5.429484272003174, "epoch": 3.336588212410037, "grad_norm": 1.1015625, "learning_rate": 0.00039047574566612416, "loss": 4.9564, "mean_token_accuracy": 0.2031549870967865, "num_tokens": 74392454.0, "step": 42885 }, { "entropy": 5.3413434505462645, "epoch": 3.3369772417817547, "grad_norm": 1.25, "learning_rate": 0.00039045195778228295, "loss": 4.8303, "mean_token_accuracy": 0.2143862634897232, "num_tokens": 74401301.0, "step": 42890 }, { "entropy": 5.291250276565552, "epoch": 3.337366271153472, "grad_norm": 1.1484375, "learning_rate": 0.0003904281681466421, "loss": 4.849, "mean_token_accuracy": 0.21049708276987075, "num_tokens": 74409883.0, "step": 42895 }, { "entropy": 5.3549333095550535, "epoch": 3.3377553005251897, "grad_norm": 1.0625, "learning_rate": 0.0003904043767595624, "loss": 4.8922, "mean_token_accuracy": 0.2025994837284088, "num_tokens": 74418999.0, "step": 42900 }, { "entropy": 5.364375829696655, "epoch": 3.3381443298969073, "grad_norm": 1.1171875, "learning_rate": 0.00039038058362140507, "loss": 4.8067, "mean_token_accuracy": 0.2162918508052826, "num_tokens": 74427078.0, "step": 42905 }, { "entropy": 5.401328802108765, "epoch": 3.3385333592686246, "grad_norm": 1.171875, "learning_rate": 0.00039035678873253096, "loss": 4.8839, "mean_token_accuracy": 0.20220344066619872, "num_tokens": 74435537.0, "step": 42910 }, { "entropy": 5.323138570785522, "epoch": 3.3389223886403423, "grad_norm": 1.15625, "learning_rate": 0.0003903329920933012, "loss": 4.8196, "mean_token_accuracy": 0.21777136027812957, "num_tokens": 74444941.0, "step": 42915 }, { "entropy": 5.271149206161499, "epoch": 3.33931141801206, "grad_norm": 1.0546875, "learning_rate": 0.0003903091937040769, "loss": 4.8159, "mean_token_accuracy": 0.20615795701742173, "num_tokens": 74453772.0, "step": 42920 }, { "entropy": 5.398161792755127, "epoch": 3.3397004473837777, "grad_norm": 1.140625, "learning_rate": 0.0003902853935652191, "loss": 4.8249, "mean_token_accuracy": 0.20950998812913896, "num_tokens": 74462548.0, "step": 42925 }, { "entropy": 5.409592771530152, "epoch": 3.340089476755495, "grad_norm": 1.1484375, "learning_rate": 0.0003902615916770889, "loss": 4.9048, "mean_token_accuracy": 0.20714317858219147, "num_tokens": 74471532.0, "step": 42930 }, { "entropy": 5.255369043350219, "epoch": 3.3404785061272126, "grad_norm": 1.0390625, "learning_rate": 0.00039023778804004753, "loss": 4.7568, "mean_token_accuracy": 0.22305561751127242, "num_tokens": 74480754.0, "step": 42935 }, { "entropy": 5.36554708480835, "epoch": 3.3408675354989303, "grad_norm": 1.0546875, "learning_rate": 0.00039021398265445616, "loss": 4.8866, "mean_token_accuracy": 0.20617039054632186, "num_tokens": 74489597.0, "step": 42940 }, { "entropy": 5.471898412704467, "epoch": 3.3412565648706476, "grad_norm": 1.1875, "learning_rate": 0.000390190175520676, "loss": 5.0402, "mean_token_accuracy": 0.20137904584407806, "num_tokens": 74498871.0, "step": 42945 }, { "entropy": 5.330620861053466, "epoch": 3.3416455942423653, "grad_norm": 1.234375, "learning_rate": 0.0003901663666390683, "loss": 4.8643, "mean_token_accuracy": 0.2068793371319771, "num_tokens": 74507613.0, "step": 42950 }, { "entropy": 5.365389442443847, "epoch": 3.342034623614083, "grad_norm": 1.171875, "learning_rate": 0.0003901425560099943, "loss": 4.93, "mean_token_accuracy": 0.20374042987823487, "num_tokens": 74516072.0, "step": 42955 }, { "entropy": 5.354096984863281, "epoch": 3.3424236529858002, "grad_norm": 1.0703125, "learning_rate": 0.00039011874363381523, "loss": 4.791, "mean_token_accuracy": 0.21314190626144408, "num_tokens": 74524947.0, "step": 42960 }, { "entropy": 5.3526490211486815, "epoch": 3.342812682357518, "grad_norm": 1.15625, "learning_rate": 0.00039009492951089236, "loss": 4.9155, "mean_token_accuracy": 0.20947614312171936, "num_tokens": 74533654.0, "step": 42965 }, { "entropy": 5.3304253101348875, "epoch": 3.3432017117292356, "grad_norm": 1.2109375, "learning_rate": 0.0003900711136415873, "loss": 4.8515, "mean_token_accuracy": 0.2180296555161476, "num_tokens": 74541850.0, "step": 42970 }, { "entropy": 5.3708991527557375, "epoch": 3.343590741100953, "grad_norm": 1.078125, "learning_rate": 0.0003900472960262611, "loss": 4.905, "mean_token_accuracy": 0.2054011344909668, "num_tokens": 74550037.0, "step": 42975 }, { "entropy": 5.439033937454224, "epoch": 3.3439797704726706, "grad_norm": 1.1796875, "learning_rate": 0.00039002347666527537, "loss": 4.9602, "mean_token_accuracy": 0.20841556191444396, "num_tokens": 74558680.0, "step": 42980 }, { "entropy": 5.326992607116699, "epoch": 3.3443687998443883, "grad_norm": 1.1953125, "learning_rate": 0.00038999965555899145, "loss": 4.7805, "mean_token_accuracy": 0.21964341402053833, "num_tokens": 74566696.0, "step": 42985 }, { "entropy": 5.299019432067871, "epoch": 3.344757829216106, "grad_norm": 1.1953125, "learning_rate": 0.0003899758327077709, "loss": 4.8509, "mean_token_accuracy": 0.20871831476688385, "num_tokens": 74575621.0, "step": 42990 }, { "entropy": 5.384990787506103, "epoch": 3.3451468585878232, "grad_norm": 1.2421875, "learning_rate": 0.00038995200811197496, "loss": 4.9917, "mean_token_accuracy": 0.20930714756250382, "num_tokens": 74583587.0, "step": 42995 }, { "entropy": 5.419119596481323, "epoch": 3.345535887959541, "grad_norm": 1.15625, "learning_rate": 0.00038992818177196526, "loss": 4.9357, "mean_token_accuracy": 0.20468255430459975, "num_tokens": 74591530.0, "step": 43000 }, { "entropy": 5.323709297180176, "epoch": 3.3459249173312586, "grad_norm": 1.2421875, "learning_rate": 0.0003899043536881034, "loss": 4.9173, "mean_token_accuracy": 0.19933694005012512, "num_tokens": 74599502.0, "step": 43005 }, { "entropy": 5.335243797302246, "epoch": 3.346313946702976, "grad_norm": 1.109375, "learning_rate": 0.00038988052386075084, "loss": 4.8674, "mean_token_accuracy": 0.21189167499542236, "num_tokens": 74608800.0, "step": 43010 }, { "entropy": 5.342799377441406, "epoch": 3.3467029760746936, "grad_norm": 1.1328125, "learning_rate": 0.00038985669229026917, "loss": 4.8155, "mean_token_accuracy": 0.20843221843242646, "num_tokens": 74616801.0, "step": 43015 }, { "entropy": 5.334310102462768, "epoch": 3.3470920054464113, "grad_norm": 1.0859375, "learning_rate": 0.00038983285897702005, "loss": 4.8242, "mean_token_accuracy": 0.21673105359077455, "num_tokens": 74625605.0, "step": 43020 }, { "entropy": 5.3214117050170895, "epoch": 3.347481034818129, "grad_norm": 1.1171875, "learning_rate": 0.00038980902392136496, "loss": 4.837, "mean_token_accuracy": 0.211628258228302, "num_tokens": 74634149.0, "step": 43025 }, { "entropy": 5.371107959747315, "epoch": 3.3478700641898462, "grad_norm": 1.1484375, "learning_rate": 0.0003897851871236657, "loss": 4.878, "mean_token_accuracy": 0.2153734967112541, "num_tokens": 74642408.0, "step": 43030 }, { "entropy": 5.378838968276978, "epoch": 3.348259093561564, "grad_norm": 1.15625, "learning_rate": 0.00038976134858428397, "loss": 4.9076, "mean_token_accuracy": 0.20543947368860244, "num_tokens": 74651003.0, "step": 43035 }, { "entropy": 5.441165113449097, "epoch": 3.3486481229332816, "grad_norm": 1.34375, "learning_rate": 0.00038973750830358144, "loss": 4.9312, "mean_token_accuracy": 0.2076731339097023, "num_tokens": 74659282.0, "step": 43040 }, { "entropy": 5.330021858215332, "epoch": 3.349037152304999, "grad_norm": 1.1484375, "learning_rate": 0.00038971366628191986, "loss": 4.819, "mean_token_accuracy": 0.21209264397621155, "num_tokens": 74667739.0, "step": 43045 }, { "entropy": 5.384643697738648, "epoch": 3.3494261816767166, "grad_norm": 1.203125, "learning_rate": 0.000389689822519661, "loss": 4.9039, "mean_token_accuracy": 0.2035349577665329, "num_tokens": 74675937.0, "step": 43050 }, { "entropy": 5.332985067367554, "epoch": 3.3498152110484343, "grad_norm": 1.140625, "learning_rate": 0.00038966597701716653, "loss": 4.7839, "mean_token_accuracy": 0.2245734304189682, "num_tokens": 74684529.0, "step": 43055 }, { "entropy": 5.327898263931274, "epoch": 3.350204240420152, "grad_norm": 1.28125, "learning_rate": 0.0003896421297747985, "loss": 4.8612, "mean_token_accuracy": 0.21872642040252685, "num_tokens": 74692814.0, "step": 43060 }, { "entropy": 5.386593914031982, "epoch": 3.350593269791869, "grad_norm": 1.1015625, "learning_rate": 0.0003896182807929185, "loss": 4.9225, "mean_token_accuracy": 0.1999619722366333, "num_tokens": 74701477.0, "step": 43065 }, { "entropy": 5.350518417358399, "epoch": 3.350982299163587, "grad_norm": 1.1015625, "learning_rate": 0.0003895944300718885, "loss": 4.8612, "mean_token_accuracy": 0.20919594317674636, "num_tokens": 74710158.0, "step": 43070 }, { "entropy": 5.379569625854492, "epoch": 3.351371328535304, "grad_norm": 1.1875, "learning_rate": 0.00038957057761207053, "loss": 4.8906, "mean_token_accuracy": 0.20774369537830353, "num_tokens": 74718269.0, "step": 43075 }, { "entropy": 5.356180572509766, "epoch": 3.351760357907022, "grad_norm": 1.0703125, "learning_rate": 0.00038954672341382635, "loss": 4.878, "mean_token_accuracy": 0.21265193074941635, "num_tokens": 74726636.0, "step": 43080 }, { "entropy": 5.373827171325684, "epoch": 3.3521493872787396, "grad_norm": 1.15625, "learning_rate": 0.000389522867477518, "loss": 4.8409, "mean_token_accuracy": 0.21258383095264435, "num_tokens": 74735618.0, "step": 43085 }, { "entropy": 5.388303327560425, "epoch": 3.3525384166504573, "grad_norm": 1.1171875, "learning_rate": 0.0003894990098035074, "loss": 4.9924, "mean_token_accuracy": 0.20318834781646727, "num_tokens": 74745161.0, "step": 43090 }, { "entropy": 5.421233224868774, "epoch": 3.3529274460221745, "grad_norm": 1.109375, "learning_rate": 0.0003894751503921566, "loss": 4.8669, "mean_token_accuracy": 0.20351468175649642, "num_tokens": 74753501.0, "step": 43095 }, { "entropy": 5.400782585144043, "epoch": 3.353316475393892, "grad_norm": 1.15625, "learning_rate": 0.0003894512892438275, "loss": 4.9293, "mean_token_accuracy": 0.2031934529542923, "num_tokens": 74761797.0, "step": 43100 }, { "entropy": 5.352028465270996, "epoch": 3.35370550476561, "grad_norm": 1.1875, "learning_rate": 0.00038942742635888236, "loss": 4.9424, "mean_token_accuracy": 0.20495518147945405, "num_tokens": 74771334.0, "step": 43105 }, { "entropy": 5.370048236846924, "epoch": 3.354094534137327, "grad_norm": 1.0625, "learning_rate": 0.00038940356173768303, "loss": 4.8876, "mean_token_accuracy": 0.2133067950606346, "num_tokens": 74780018.0, "step": 43110 }, { "entropy": 5.36496376991272, "epoch": 3.354483563509045, "grad_norm": 1.15625, "learning_rate": 0.0003893796953805919, "loss": 4.8203, "mean_token_accuracy": 0.21126953959465028, "num_tokens": 74788509.0, "step": 43115 }, { "entropy": 5.410099458694458, "epoch": 3.3548725928807626, "grad_norm": 1.109375, "learning_rate": 0.00038935582728797085, "loss": 5.0335, "mean_token_accuracy": 0.2042275384068489, "num_tokens": 74797348.0, "step": 43120 }, { "entropy": 5.408620929718017, "epoch": 3.3552616222524803, "grad_norm": 1.2109375, "learning_rate": 0.00038933195746018213, "loss": 4.8669, "mean_token_accuracy": 0.2087838351726532, "num_tokens": 74805815.0, "step": 43125 }, { "entropy": 5.436784553527832, "epoch": 3.3556506516241975, "grad_norm": 1.1015625, "learning_rate": 0.00038930808589758797, "loss": 4.9311, "mean_token_accuracy": 0.20467423498630524, "num_tokens": 74814577.0, "step": 43130 }, { "entropy": 5.3527976989746096, "epoch": 3.356039680995915, "grad_norm": 1.1953125, "learning_rate": 0.0003892842126005506, "loss": 4.7758, "mean_token_accuracy": 0.2157517120242119, "num_tokens": 74822488.0, "step": 43135 }, { "entropy": 5.366860723495483, "epoch": 3.356428710367633, "grad_norm": 1.265625, "learning_rate": 0.0003892603375694321, "loss": 4.9141, "mean_token_accuracy": 0.2060529738664627, "num_tokens": 74831888.0, "step": 43140 }, { "entropy": 5.388736248016357, "epoch": 3.35681773973935, "grad_norm": 1.1015625, "learning_rate": 0.00038923646080459484, "loss": 4.91, "mean_token_accuracy": 0.2094779133796692, "num_tokens": 74840883.0, "step": 43145 }, { "entropy": 5.3407563209533695, "epoch": 3.357206769111068, "grad_norm": 1.140625, "learning_rate": 0.00038921258230640123, "loss": 4.7432, "mean_token_accuracy": 0.21366207003593446, "num_tokens": 74848517.0, "step": 43150 }, { "entropy": 5.279930686950683, "epoch": 3.3575957984827856, "grad_norm": 1.1640625, "learning_rate": 0.00038918870207521334, "loss": 4.8568, "mean_token_accuracy": 0.2116076961159706, "num_tokens": 74857189.0, "step": 43155 }, { "entropy": 5.361717605590821, "epoch": 3.3579848278545033, "grad_norm": 1.1015625, "learning_rate": 0.00038916482011139373, "loss": 4.9738, "mean_token_accuracy": 0.2036323994398117, "num_tokens": 74866192.0, "step": 43160 }, { "entropy": 5.417784595489502, "epoch": 3.3583738572262205, "grad_norm": 1.078125, "learning_rate": 0.0003891409364153047, "loss": 4.8578, "mean_token_accuracy": 0.21087003648281097, "num_tokens": 74875062.0, "step": 43165 }, { "entropy": 5.373315763473511, "epoch": 3.358762886597938, "grad_norm": 1.15625, "learning_rate": 0.0003891170509873086, "loss": 4.9124, "mean_token_accuracy": 0.20539368838071823, "num_tokens": 74884471.0, "step": 43170 }, { "entropy": 5.2984155178070065, "epoch": 3.359151915969656, "grad_norm": 1.1171875, "learning_rate": 0.00038909316382776784, "loss": 4.8748, "mean_token_accuracy": 0.21019565165042878, "num_tokens": 74892945.0, "step": 43175 }, { "entropy": 5.40103325843811, "epoch": 3.359540945341373, "grad_norm": 1.109375, "learning_rate": 0.0003890692749370449, "loss": 4.8664, "mean_token_accuracy": 0.21363862305879594, "num_tokens": 74901944.0, "step": 43180 }, { "entropy": 5.330128908157349, "epoch": 3.359929974713091, "grad_norm": 1.125, "learning_rate": 0.00038904538431550235, "loss": 4.8615, "mean_token_accuracy": 0.20742748230695723, "num_tokens": 74910387.0, "step": 43185 }, { "entropy": 5.399722671508789, "epoch": 3.3603190040848085, "grad_norm": 1.328125, "learning_rate": 0.0003890214919635026, "loss": 4.8812, "mean_token_accuracy": 0.20547912567853927, "num_tokens": 74918570.0, "step": 43190 }, { "entropy": 5.304295539855957, "epoch": 3.360708033456526, "grad_norm": 1.1796875, "learning_rate": 0.0003889975978814082, "loss": 4.7534, "mean_token_accuracy": 0.2156881496310234, "num_tokens": 74927009.0, "step": 43195 }, { "entropy": 5.372062349319458, "epoch": 3.3610970628282435, "grad_norm": 1.1171875, "learning_rate": 0.0003889737020695817, "loss": 4.9179, "mean_token_accuracy": 0.20980607569217682, "num_tokens": 74935131.0, "step": 43200 }, { "entropy": 5.350213527679443, "epoch": 3.361486092199961, "grad_norm": 1.1015625, "learning_rate": 0.00038894980452838573, "loss": 4.9075, "mean_token_accuracy": 0.20401963889598845, "num_tokens": 74944711.0, "step": 43205 }, { "entropy": 5.504417896270752, "epoch": 3.3618751215716784, "grad_norm": 1.078125, "learning_rate": 0.0003889259052581828, "loss": 4.9588, "mean_token_accuracy": 0.19970207959413527, "num_tokens": 74953721.0, "step": 43210 }, { "entropy": 5.337421941757202, "epoch": 3.362264150943396, "grad_norm": 1.1484375, "learning_rate": 0.00038890200425933545, "loss": 4.8621, "mean_token_accuracy": 0.2100758969783783, "num_tokens": 74962250.0, "step": 43215 }, { "entropy": 5.389607048034668, "epoch": 3.362653180315114, "grad_norm": 1.125, "learning_rate": 0.0003888781015322067, "loss": 4.8956, "mean_token_accuracy": 0.21571268886327744, "num_tokens": 74971279.0, "step": 43220 }, { "entropy": 5.336884260177612, "epoch": 3.3630422096868315, "grad_norm": 1.15625, "learning_rate": 0.00038885419707715885, "loss": 4.9049, "mean_token_accuracy": 0.20179797112941741, "num_tokens": 74980167.0, "step": 43225 }, { "entropy": 5.412335586547852, "epoch": 3.363431239058549, "grad_norm": 1.1328125, "learning_rate": 0.00038883029089455487, "loss": 4.9677, "mean_token_accuracy": 0.20492493510246276, "num_tokens": 74989014.0, "step": 43230 }, { "entropy": 5.360791254043579, "epoch": 3.3638202684302665, "grad_norm": 1.1328125, "learning_rate": 0.0003888063829847574, "loss": 4.8139, "mean_token_accuracy": 0.20741328001022338, "num_tokens": 74997395.0, "step": 43235 }, { "entropy": 5.291745710372925, "epoch": 3.364209297801984, "grad_norm": 1.1796875, "learning_rate": 0.0003887824733481292, "loss": 4.8454, "mean_token_accuracy": 0.20952364355325698, "num_tokens": 75005962.0, "step": 43240 }, { "entropy": 5.2857666015625, "epoch": 3.3645983271737014, "grad_norm": 1.125, "learning_rate": 0.00038875856198503306, "loss": 4.7717, "mean_token_accuracy": 0.21336501985788345, "num_tokens": 75014201.0, "step": 43245 }, { "entropy": 5.3973448276519775, "epoch": 3.364987356545419, "grad_norm": 1.1953125, "learning_rate": 0.00038873464889583177, "loss": 4.8823, "mean_token_accuracy": 0.20233920961618423, "num_tokens": 75022702.0, "step": 43250 }, { "entropy": 5.362800121307373, "epoch": 3.365376385917137, "grad_norm": 1.1328125, "learning_rate": 0.00038871073408088826, "loss": 4.844, "mean_token_accuracy": 0.21447531431913375, "num_tokens": 75031488.0, "step": 43255 }, { "entropy": 5.4675404071807865, "epoch": 3.3657654152888545, "grad_norm": 1.140625, "learning_rate": 0.0003886868175405653, "loss": 5.0217, "mean_token_accuracy": 0.19828703999519348, "num_tokens": 75039511.0, "step": 43260 }, { "entropy": 5.395234823226929, "epoch": 3.366154444660572, "grad_norm": 1.0859375, "learning_rate": 0.0003886628992752259, "loss": 4.913, "mean_token_accuracy": 0.20536805391311647, "num_tokens": 75048989.0, "step": 43265 }, { "entropy": 5.4423919200897215, "epoch": 3.3665434740322895, "grad_norm": 1.078125, "learning_rate": 0.0003886389792852329, "loss": 4.9845, "mean_token_accuracy": 0.200530344247818, "num_tokens": 75057924.0, "step": 43270 }, { "entropy": 5.331408166885376, "epoch": 3.366932503404007, "grad_norm": 1.0625, "learning_rate": 0.00038861505757094923, "loss": 4.8001, "mean_token_accuracy": 0.21004365980625153, "num_tokens": 75066743.0, "step": 43275 }, { "entropy": 5.324078321456909, "epoch": 3.3673215327757244, "grad_norm": 1.1953125, "learning_rate": 0.0003885911341327379, "loss": 4.9174, "mean_token_accuracy": 0.19951648712158204, "num_tokens": 75075784.0, "step": 43280 }, { "entropy": 5.317600727081299, "epoch": 3.367710562147442, "grad_norm": 1.0859375, "learning_rate": 0.000388567208970962, "loss": 4.9168, "mean_token_accuracy": 0.212921079993248, "num_tokens": 75084031.0, "step": 43285 }, { "entropy": 5.296626138687134, "epoch": 3.36809959151916, "grad_norm": 1.0703125, "learning_rate": 0.0003885432820859844, "loss": 4.8693, "mean_token_accuracy": 0.2112334340810776, "num_tokens": 75093029.0, "step": 43290 }, { "entropy": 5.3327374935150145, "epoch": 3.368488620890877, "grad_norm": 1.078125, "learning_rate": 0.00038851935347816827, "loss": 4.7704, "mean_token_accuracy": 0.21931397467851638, "num_tokens": 75101620.0, "step": 43295 }, { "entropy": 5.346506357192993, "epoch": 3.368877650262595, "grad_norm": 1.1484375, "learning_rate": 0.0003884954231478764, "loss": 4.8339, "mean_token_accuracy": 0.21202548146247863, "num_tokens": 75110179.0, "step": 43300 }, { "entropy": 5.38269453048706, "epoch": 3.3692666796343125, "grad_norm": 1.171875, "learning_rate": 0.0003884714910954724, "loss": 4.8976, "mean_token_accuracy": 0.20520093142986298, "num_tokens": 75119254.0, "step": 43305 }, { "entropy": 5.394597482681275, "epoch": 3.3696557090060297, "grad_norm": 1.0859375, "learning_rate": 0.000388447557321319, "loss": 4.8245, "mean_token_accuracy": 0.2072989448904991, "num_tokens": 75127630.0, "step": 43310 }, { "entropy": 5.385781335830688, "epoch": 3.3700447383777474, "grad_norm": 1.140625, "learning_rate": 0.0003884236218257795, "loss": 4.8181, "mean_token_accuracy": 0.21806117743253708, "num_tokens": 75136866.0, "step": 43315 }, { "entropy": 5.327859926223755, "epoch": 3.370433767749465, "grad_norm": 1.1328125, "learning_rate": 0.0003883996846092171, "loss": 4.8264, "mean_token_accuracy": 0.2168169990181923, "num_tokens": 75145570.0, "step": 43320 }, { "entropy": 5.340885257720947, "epoch": 3.370822797121183, "grad_norm": 1.125, "learning_rate": 0.000388375745671995, "loss": 4.9403, "mean_token_accuracy": 0.2121698960661888, "num_tokens": 75154994.0, "step": 43325 }, { "entropy": 5.3572306632995605, "epoch": 3.3712118264929, "grad_norm": 1.1796875, "learning_rate": 0.00038835180501447646, "loss": 4.8082, "mean_token_accuracy": 0.21717213094234467, "num_tokens": 75163018.0, "step": 43330 }, { "entropy": 5.293763780593872, "epoch": 3.3716008558646178, "grad_norm": 1.0625, "learning_rate": 0.0003883278626370245, "loss": 4.7916, "mean_token_accuracy": 0.2100897952914238, "num_tokens": 75172234.0, "step": 43335 }, { "entropy": 5.395349311828613, "epoch": 3.3719898852363355, "grad_norm": 1.1796875, "learning_rate": 0.00038830391854000285, "loss": 4.933, "mean_token_accuracy": 0.21201498657464982, "num_tokens": 75180816.0, "step": 43340 }, { "entropy": 5.3947898864746096, "epoch": 3.3723789146080527, "grad_norm": 1.125, "learning_rate": 0.00038827997272377447, "loss": 4.9095, "mean_token_accuracy": 0.2069484546780586, "num_tokens": 75189676.0, "step": 43345 }, { "entropy": 5.401403951644897, "epoch": 3.3727679439797704, "grad_norm": 1.21875, "learning_rate": 0.00038825602518870276, "loss": 4.8821, "mean_token_accuracy": 0.20872806310653685, "num_tokens": 75198729.0, "step": 43350 }, { "entropy": 5.327141761779785, "epoch": 3.373156973351488, "grad_norm": 1.0859375, "learning_rate": 0.0003882320759351512, "loss": 4.8444, "mean_token_accuracy": 0.21183761060237885, "num_tokens": 75207414.0, "step": 43355 }, { "entropy": 5.306655740737915, "epoch": 3.373546002723206, "grad_norm": 1.1796875, "learning_rate": 0.00038820812496348305, "loss": 4.7942, "mean_token_accuracy": 0.21091445982456208, "num_tokens": 75215454.0, "step": 43360 }, { "entropy": 5.35180697441101, "epoch": 3.373935032094923, "grad_norm": 1.1796875, "learning_rate": 0.00038818417227406185, "loss": 4.8921, "mean_token_accuracy": 0.21308453679084777, "num_tokens": 75223445.0, "step": 43365 }, { "entropy": 5.41229100227356, "epoch": 3.3743240614666408, "grad_norm": 1.2109375, "learning_rate": 0.00038816021786725096, "loss": 4.9026, "mean_token_accuracy": 0.20590450912714003, "num_tokens": 75232120.0, "step": 43370 }, { "entropy": 5.386498355865479, "epoch": 3.3747130908383585, "grad_norm": 1.1640625, "learning_rate": 0.00038813626174341386, "loss": 4.8587, "mean_token_accuracy": 0.20460774451494218, "num_tokens": 75240666.0, "step": 43375 }, { "entropy": 5.419239044189453, "epoch": 3.3751021202100757, "grad_norm": 1.21875, "learning_rate": 0.0003881123039029141, "loss": 4.8878, "mean_token_accuracy": 0.20134558230638505, "num_tokens": 75249523.0, "step": 43380 }, { "entropy": 5.384564638137817, "epoch": 3.3754911495817934, "grad_norm": 1.125, "learning_rate": 0.0003880883443461152, "loss": 4.9685, "mean_token_accuracy": 0.20469918996095657, "num_tokens": 75258720.0, "step": 43385 }, { "entropy": 5.3958922863006595, "epoch": 3.375880178953511, "grad_norm": 1.1875, "learning_rate": 0.0003880643830733806, "loss": 4.9462, "mean_token_accuracy": 0.20746778547763825, "num_tokens": 75267424.0, "step": 43390 }, { "entropy": 5.4532005310058596, "epoch": 3.3762692083252284, "grad_norm": 1.078125, "learning_rate": 0.00038804042008507396, "loss": 4.898, "mean_token_accuracy": 0.2032387763261795, "num_tokens": 75276475.0, "step": 43395 }, { "entropy": 5.348258590698242, "epoch": 3.376658237696946, "grad_norm": 1.0859375, "learning_rate": 0.00038801645538155883, "loss": 4.8371, "mean_token_accuracy": 0.21033633798360823, "num_tokens": 75284648.0, "step": 43400 }, { "entropy": 5.37525372505188, "epoch": 3.3770472670686638, "grad_norm": 1.1953125, "learning_rate": 0.00038799248896319896, "loss": 4.9402, "mean_token_accuracy": 0.20632299780845642, "num_tokens": 75293708.0, "step": 43405 }, { "entropy": 5.329643106460571, "epoch": 3.377436296440381, "grad_norm": 1.1796875, "learning_rate": 0.00038796852083035794, "loss": 4.8494, "mean_token_accuracy": 0.21234897375106812, "num_tokens": 75302484.0, "step": 43410 }, { "entropy": 5.440329122543335, "epoch": 3.3778253258120987, "grad_norm": 1.109375, "learning_rate": 0.0003879445509833993, "loss": 4.8382, "mean_token_accuracy": 0.21537380069494247, "num_tokens": 75311112.0, "step": 43415 }, { "entropy": 5.406229066848755, "epoch": 3.3782143551838164, "grad_norm": 1.234375, "learning_rate": 0.000387920579422687, "loss": 4.932, "mean_token_accuracy": 0.20527267307043076, "num_tokens": 75319126.0, "step": 43420 }, { "entropy": 5.320613622665405, "epoch": 3.378603384555534, "grad_norm": 1.203125, "learning_rate": 0.0003878966061485845, "loss": 4.8679, "mean_token_accuracy": 0.20649921000003815, "num_tokens": 75328296.0, "step": 43425 }, { "entropy": 5.3227332592010494, "epoch": 3.3789924139272514, "grad_norm": 1.125, "learning_rate": 0.00038787263116145577, "loss": 4.8261, "mean_token_accuracy": 0.21385467648506165, "num_tokens": 75337036.0, "step": 43430 }, { "entropy": 5.347154569625855, "epoch": 3.379381443298969, "grad_norm": 1.171875, "learning_rate": 0.00038784865446166454, "loss": 4.8999, "mean_token_accuracy": 0.2154158115386963, "num_tokens": 75345691.0, "step": 43435 }, { "entropy": 5.381141281127929, "epoch": 3.3797704726706868, "grad_norm": 1.2265625, "learning_rate": 0.00038782467604957455, "loss": 4.8626, "mean_token_accuracy": 0.2044912353157997, "num_tokens": 75354469.0, "step": 43440 }, { "entropy": 5.392892169952392, "epoch": 3.380159502042404, "grad_norm": 1.1171875, "learning_rate": 0.00038780069592554977, "loss": 4.8826, "mean_token_accuracy": 0.2129475474357605, "num_tokens": 75363369.0, "step": 43445 }, { "entropy": 5.300584697723389, "epoch": 3.3805485314141217, "grad_norm": 1.15625, "learning_rate": 0.0003877767140899539, "loss": 4.8272, "mean_token_accuracy": 0.2216135859489441, "num_tokens": 75371882.0, "step": 43450 }, { "entropy": 5.295615482330322, "epoch": 3.3809375607858394, "grad_norm": 1.140625, "learning_rate": 0.00038775273054315087, "loss": 4.8475, "mean_token_accuracy": 0.20961885005235673, "num_tokens": 75379801.0, "step": 43455 }, { "entropy": 5.387754631042481, "epoch": 3.381326590157557, "grad_norm": 1.1875, "learning_rate": 0.0003877287452855046, "loss": 4.9187, "mean_token_accuracy": 0.20855819880962373, "num_tokens": 75389588.0, "step": 43460 }, { "entropy": 5.385463285446167, "epoch": 3.3817156195292744, "grad_norm": 1.234375, "learning_rate": 0.00038770475831737905, "loss": 4.8998, "mean_token_accuracy": 0.20854541957378386, "num_tokens": 75398055.0, "step": 43465 }, { "entropy": 5.385175800323486, "epoch": 3.382104648900992, "grad_norm": 1.0390625, "learning_rate": 0.00038768076963913823, "loss": 4.9026, "mean_token_accuracy": 0.20402120500802995, "num_tokens": 75406742.0, "step": 43470 }, { "entropy": 5.300346612930298, "epoch": 3.3824936782727097, "grad_norm": 1.1328125, "learning_rate": 0.00038765677925114614, "loss": 4.7778, "mean_token_accuracy": 0.2219518706202507, "num_tokens": 75415447.0, "step": 43475 }, { "entropy": 5.363443660736084, "epoch": 3.382882707644427, "grad_norm": 1.0859375, "learning_rate": 0.0003876327871537667, "loss": 4.9102, "mean_token_accuracy": 0.2027765095233917, "num_tokens": 75424688.0, "step": 43480 }, { "entropy": 5.452423048019409, "epoch": 3.3832717370161447, "grad_norm": 1.109375, "learning_rate": 0.00038760879334736394, "loss": 4.9149, "mean_token_accuracy": 0.20905605107545852, "num_tokens": 75433334.0, "step": 43485 }, { "entropy": 5.456679010391236, "epoch": 3.3836607663878624, "grad_norm": 1.1015625, "learning_rate": 0.00038758479783230197, "loss": 4.9595, "mean_token_accuracy": 0.1982625588774681, "num_tokens": 75442597.0, "step": 43490 }, { "entropy": 5.302169418334961, "epoch": 3.38404979575958, "grad_norm": 1.2421875, "learning_rate": 0.0003875608006089449, "loss": 4.8721, "mean_token_accuracy": 0.21103187650442123, "num_tokens": 75450547.0, "step": 43495 }, { "entropy": 5.425356101989746, "epoch": 3.3844388251312973, "grad_norm": 1.359375, "learning_rate": 0.0003875368016776569, "loss": 4.9792, "mean_token_accuracy": 0.19147971719503404, "num_tokens": 75460254.0, "step": 43500 }, { "entropy": 5.448147630691528, "epoch": 3.384827854503015, "grad_norm": 1.1484375, "learning_rate": 0.000387512801038802, "loss": 4.9231, "mean_token_accuracy": 0.19829928427934645, "num_tokens": 75469070.0, "step": 43505 }, { "entropy": 5.413862991333008, "epoch": 3.3852168838747323, "grad_norm": 1.1875, "learning_rate": 0.0003874887986927444, "loss": 4.9123, "mean_token_accuracy": 0.20581189393997193, "num_tokens": 75477610.0, "step": 43510 }, { "entropy": 5.301967287063599, "epoch": 3.38560591324645, "grad_norm": 1.171875, "learning_rate": 0.0003874647946398484, "loss": 4.8637, "mean_token_accuracy": 0.21003012210130692, "num_tokens": 75486395.0, "step": 43515 }, { "entropy": 5.439209508895874, "epoch": 3.3859949426181677, "grad_norm": 1.1796875, "learning_rate": 0.0003874407888804781, "loss": 5.0188, "mean_token_accuracy": 0.20199840962886811, "num_tokens": 75495987.0, "step": 43520 }, { "entropy": 5.40192756652832, "epoch": 3.3863839719898854, "grad_norm": 1.2265625, "learning_rate": 0.00038741678141499783, "loss": 4.8929, "mean_token_accuracy": 0.20770883560180664, "num_tokens": 75504407.0, "step": 43525 }, { "entropy": 5.418005132675171, "epoch": 3.3867730013616026, "grad_norm": 1.1796875, "learning_rate": 0.0003873927722437718, "loss": 4.9298, "mean_token_accuracy": 0.20730438232421874, "num_tokens": 75512953.0, "step": 43530 }, { "entropy": 5.358303022384644, "epoch": 3.3871620307333203, "grad_norm": 1.09375, "learning_rate": 0.0003873687613671643, "loss": 4.9221, "mean_token_accuracy": 0.20563029050827025, "num_tokens": 75521349.0, "step": 43535 }, { "entropy": 5.415304803848267, "epoch": 3.387551060105038, "grad_norm": 1.25, "learning_rate": 0.0003873447487855398, "loss": 4.9303, "mean_token_accuracy": 0.2028991773724556, "num_tokens": 75530178.0, "step": 43540 }, { "entropy": 5.400946998596192, "epoch": 3.3879400894767553, "grad_norm": 1.09375, "learning_rate": 0.00038732073449926244, "loss": 4.7939, "mean_token_accuracy": 0.21503149569034577, "num_tokens": 75539033.0, "step": 43545 }, { "entropy": 5.257432842254639, "epoch": 3.388329118848473, "grad_norm": 1.203125, "learning_rate": 0.0003872967185086968, "loss": 4.7008, "mean_token_accuracy": 0.22249925285577773, "num_tokens": 75547198.0, "step": 43550 }, { "entropy": 5.279355573654175, "epoch": 3.3887181482201907, "grad_norm": 1.1796875, "learning_rate": 0.0003872727008142072, "loss": 4.8074, "mean_token_accuracy": 0.2129985898733139, "num_tokens": 75555493.0, "step": 43555 }, { "entropy": 5.353801345825195, "epoch": 3.3891071775919084, "grad_norm": 1.125, "learning_rate": 0.00038724868141615807, "loss": 4.8806, "mean_token_accuracy": 0.20349131524562836, "num_tokens": 75565109.0, "step": 43560 }, { "entropy": 5.417181873321534, "epoch": 3.3894962069636256, "grad_norm": 1.234375, "learning_rate": 0.0003872246603149138, "loss": 4.8767, "mean_token_accuracy": 0.20838109105825425, "num_tokens": 75574156.0, "step": 43565 }, { "entropy": 5.334564208984375, "epoch": 3.3898852363353433, "grad_norm": 1.125, "learning_rate": 0.0003872006375108389, "loss": 4.8613, "mean_token_accuracy": 0.21686425060033798, "num_tokens": 75583160.0, "step": 43570 }, { "entropy": 5.325445938110351, "epoch": 3.390274265707061, "grad_norm": 1.15625, "learning_rate": 0.000387176613004298, "loss": 4.8467, "mean_token_accuracy": 0.20426160991191863, "num_tokens": 75592545.0, "step": 43575 }, { "entropy": 5.3731285572052006, "epoch": 3.3906632950787783, "grad_norm": 1.1953125, "learning_rate": 0.0003871525867956555, "loss": 4.909, "mean_token_accuracy": 0.2015579402446747, "num_tokens": 75600999.0, "step": 43580 }, { "entropy": 5.322982215881348, "epoch": 3.391052324450496, "grad_norm": 1.234375, "learning_rate": 0.00038712855888527604, "loss": 4.9138, "mean_token_accuracy": 0.20270217955112457, "num_tokens": 75609807.0, "step": 43585 }, { "entropy": 5.310770559310913, "epoch": 3.3914413538222137, "grad_norm": 1.125, "learning_rate": 0.00038710452927352414, "loss": 4.831, "mean_token_accuracy": 0.22107521146535875, "num_tokens": 75618209.0, "step": 43590 }, { "entropy": 5.394522953033447, "epoch": 3.3918303831939314, "grad_norm": 1.1328125, "learning_rate": 0.0003870804979607645, "loss": 4.8836, "mean_token_accuracy": 0.21430575996637344, "num_tokens": 75626547.0, "step": 43595 }, { "entropy": 5.434898948669433, "epoch": 3.3922194125656486, "grad_norm": 1.1484375, "learning_rate": 0.00038705646494736163, "loss": 4.9204, "mean_token_accuracy": 0.21737412214279175, "num_tokens": 75634064.0, "step": 43600 }, { "entropy": 5.31025390625, "epoch": 3.3926084419373663, "grad_norm": 1.1796875, "learning_rate": 0.0003870324302336802, "loss": 4.8392, "mean_token_accuracy": 0.2131431743502617, "num_tokens": 75642745.0, "step": 43605 }, { "entropy": 5.374652624130249, "epoch": 3.392997471309084, "grad_norm": 1.171875, "learning_rate": 0.0003870083938200851, "loss": 4.95, "mean_token_accuracy": 0.2056036338210106, "num_tokens": 75651581.0, "step": 43610 }, { "entropy": 5.364953994750977, "epoch": 3.3933865006808013, "grad_norm": 1.0859375, "learning_rate": 0.00038698435570694084, "loss": 4.8835, "mean_token_accuracy": 0.20501182675361634, "num_tokens": 75661031.0, "step": 43615 }, { "entropy": 5.400718641281128, "epoch": 3.393775530052519, "grad_norm": 1.1015625, "learning_rate": 0.0003869603158946122, "loss": 4.8208, "mean_token_accuracy": 0.21555140614509583, "num_tokens": 75669150.0, "step": 43620 }, { "entropy": 5.398316144943237, "epoch": 3.3941645594242367, "grad_norm": 1.1875, "learning_rate": 0.000386936274383464, "loss": 4.8861, "mean_token_accuracy": 0.20907258838415146, "num_tokens": 75677194.0, "step": 43625 }, { "entropy": 5.205297756195068, "epoch": 3.394553588795954, "grad_norm": 1.0859375, "learning_rate": 0.000386912231173861, "loss": 4.7945, "mean_token_accuracy": 0.21576634496450425, "num_tokens": 75685640.0, "step": 43630 }, { "entropy": 5.401810550689698, "epoch": 3.3949426181676716, "grad_norm": 1.203125, "learning_rate": 0.000386888186266168, "loss": 4.9246, "mean_token_accuracy": 0.20529228895902635, "num_tokens": 75693743.0, "step": 43635 }, { "entropy": 5.362131595611572, "epoch": 3.3953316475393893, "grad_norm": 1.328125, "learning_rate": 0.0003868641396607499, "loss": 4.8004, "mean_token_accuracy": 0.21718397587537766, "num_tokens": 75701951.0, "step": 43640 }, { "entropy": 5.336853694915772, "epoch": 3.3957206769111066, "grad_norm": 1.125, "learning_rate": 0.0003868400913579715, "loss": 4.9009, "mean_token_accuracy": 0.20887548625469207, "num_tokens": 75711038.0, "step": 43645 }, { "entropy": 5.404508018493653, "epoch": 3.3961097062828243, "grad_norm": 1.1640625, "learning_rate": 0.00038681604135819774, "loss": 4.9254, "mean_token_accuracy": 0.20015495717525483, "num_tokens": 75719649.0, "step": 43650 }, { "entropy": 5.412271451950073, "epoch": 3.396498735654542, "grad_norm": 1.2734375, "learning_rate": 0.00038679198966179353, "loss": 4.8944, "mean_token_accuracy": 0.208041712641716, "num_tokens": 75727880.0, "step": 43655 }, { "entropy": 5.4065046310424805, "epoch": 3.3968877650262597, "grad_norm": 1.1953125, "learning_rate": 0.00038676793626912375, "loss": 4.9336, "mean_token_accuracy": 0.20958970189094545, "num_tokens": 75736885.0, "step": 43660 }, { "entropy": 5.387508916854858, "epoch": 3.397276794397977, "grad_norm": 1.171875, "learning_rate": 0.00038674388118055354, "loss": 4.9093, "mean_token_accuracy": 0.21266703307628632, "num_tokens": 75745922.0, "step": 43665 }, { "entropy": 5.340303182601929, "epoch": 3.3976658237696946, "grad_norm": 1.1484375, "learning_rate": 0.0003867198243964477, "loss": 4.7948, "mean_token_accuracy": 0.21244871318340303, "num_tokens": 75754526.0, "step": 43670 }, { "entropy": 5.391309404373169, "epoch": 3.3980548531414123, "grad_norm": 1.234375, "learning_rate": 0.0003866957659171714, "loss": 4.9293, "mean_token_accuracy": 0.20475511103868485, "num_tokens": 75763154.0, "step": 43675 }, { "entropy": 5.3852311134338375, "epoch": 3.3984438825131296, "grad_norm": 1.1171875, "learning_rate": 0.0003866717057430896, "loss": 4.8895, "mean_token_accuracy": 0.21061914116144181, "num_tokens": 75772201.0, "step": 43680 }, { "entropy": 5.4077893733978275, "epoch": 3.3988329118848473, "grad_norm": 1.1796875, "learning_rate": 0.0003866476438745675, "loss": 4.886, "mean_token_accuracy": 0.20980178117752074, "num_tokens": 75780351.0, "step": 43685 }, { "entropy": 5.269053936004639, "epoch": 3.399221941256565, "grad_norm": 1.109375, "learning_rate": 0.00038662358031197, "loss": 4.7327, "mean_token_accuracy": 0.22073321789503098, "num_tokens": 75788942.0, "step": 43690 }, { "entropy": 5.37186975479126, "epoch": 3.3996109706282827, "grad_norm": 1.2109375, "learning_rate": 0.0003865995150556624, "loss": 4.9684, "mean_token_accuracy": 0.20149261951446534, "num_tokens": 75797362.0, "step": 43695 }, { "entropy": 5.403136825561523, "epoch": 3.4, "grad_norm": 1.203125, "learning_rate": 0.00038657544810600966, "loss": 4.8546, "mean_token_accuracy": 0.20576683580875396, "num_tokens": 75805839.0, "step": 43700 }, { "entropy": 5.277457571029663, "epoch": 3.4003890293717176, "grad_norm": 1.1640625, "learning_rate": 0.0003865513794633773, "loss": 4.7773, "mean_token_accuracy": 0.21069447696208954, "num_tokens": 75814544.0, "step": 43705 }, { "entropy": 5.276537799835205, "epoch": 3.4007780587434353, "grad_norm": 1.0859375, "learning_rate": 0.0003865273091281301, "loss": 4.7471, "mean_token_accuracy": 0.21929188519716264, "num_tokens": 75822906.0, "step": 43710 }, { "entropy": 5.386422061920166, "epoch": 3.4011670881151526, "grad_norm": 1.1015625, "learning_rate": 0.0003865032371006336, "loss": 4.8646, "mean_token_accuracy": 0.20433398187160492, "num_tokens": 75832115.0, "step": 43715 }, { "entropy": 5.313847303390503, "epoch": 3.4015561174868703, "grad_norm": 1.0546875, "learning_rate": 0.000386479163381253, "loss": 4.7516, "mean_token_accuracy": 0.21593912690877914, "num_tokens": 75840920.0, "step": 43720 }, { "entropy": 5.350656795501709, "epoch": 3.401945146858588, "grad_norm": 1.1171875, "learning_rate": 0.00038645508797035345, "loss": 4.8931, "mean_token_accuracy": 0.2093177020549774, "num_tokens": 75849654.0, "step": 43725 }, { "entropy": 5.3759928226470945, "epoch": 3.402334176230305, "grad_norm": 1.1953125, "learning_rate": 0.00038643101086830036, "loss": 4.8666, "mean_token_accuracy": 0.20057980567216874, "num_tokens": 75857864.0, "step": 43730 }, { "entropy": 5.322567796707153, "epoch": 3.402723205602023, "grad_norm": 1.1953125, "learning_rate": 0.000386406932075459, "loss": 4.8121, "mean_token_accuracy": 0.22517990320920944, "num_tokens": 75866426.0, "step": 43735 }, { "entropy": 5.385067892074585, "epoch": 3.4031122349737406, "grad_norm": 1.1484375, "learning_rate": 0.0003863828515921948, "loss": 4.905, "mean_token_accuracy": 0.21112716645002366, "num_tokens": 75875261.0, "step": 43740 }, { "entropy": 5.339459371566773, "epoch": 3.403501264345458, "grad_norm": 1.1953125, "learning_rate": 0.0003863587694188732, "loss": 4.8134, "mean_token_accuracy": 0.21746813952922822, "num_tokens": 75883675.0, "step": 43745 }, { "entropy": 5.2879527568817135, "epoch": 3.4038902937171756, "grad_norm": 1.1015625, "learning_rate": 0.00038633468555585943, "loss": 4.8155, "mean_token_accuracy": 0.20890948325395584, "num_tokens": 75892209.0, "step": 43750 }, { "entropy": 5.334087944030761, "epoch": 3.4042793230888932, "grad_norm": 1.125, "learning_rate": 0.0003863106000035191, "loss": 4.8923, "mean_token_accuracy": 0.2129145532846451, "num_tokens": 75899870.0, "step": 43755 }, { "entropy": 5.301849699020385, "epoch": 3.404668352460611, "grad_norm": 1.125, "learning_rate": 0.0003862865127622175, "loss": 4.8792, "mean_token_accuracy": 0.21175415366888045, "num_tokens": 75908616.0, "step": 43760 }, { "entropy": 5.361241436004638, "epoch": 3.405057381832328, "grad_norm": 1.1484375, "learning_rate": 0.0003862624238323201, "loss": 4.8844, "mean_token_accuracy": 0.20827001929283143, "num_tokens": 75917065.0, "step": 43765 }, { "entropy": 5.290961790084839, "epoch": 3.405446411204046, "grad_norm": 1.0546875, "learning_rate": 0.0003862383332141927, "loss": 4.786, "mean_token_accuracy": 0.22062335312366485, "num_tokens": 75925691.0, "step": 43770 }, { "entropy": 5.376216554641724, "epoch": 3.4058354405757636, "grad_norm": 1.234375, "learning_rate": 0.0003862142409082006, "loss": 4.8993, "mean_token_accuracy": 0.2098408341407776, "num_tokens": 75934285.0, "step": 43775 }, { "entropy": 5.444793367385865, "epoch": 3.406224469947481, "grad_norm": 1.09375, "learning_rate": 0.0003861901469147093, "loss": 4.9829, "mean_token_accuracy": 0.20457764565944672, "num_tokens": 75942861.0, "step": 43780 }, { "entropy": 5.381565856933594, "epoch": 3.4066134993191985, "grad_norm": 1.1328125, "learning_rate": 0.00038616605123408464, "loss": 4.9058, "mean_token_accuracy": 0.21265919208526612, "num_tokens": 75952172.0, "step": 43785 }, { "entropy": 5.302419662475586, "epoch": 3.4070025286909162, "grad_norm": 1.171875, "learning_rate": 0.00038614195386669207, "loss": 4.8878, "mean_token_accuracy": 0.2124156951904297, "num_tokens": 75960973.0, "step": 43790 }, { "entropy": 5.303713417053222, "epoch": 3.407391558062634, "grad_norm": 1.125, "learning_rate": 0.0003861178548128972, "loss": 4.7643, "mean_token_accuracy": 0.2182506799697876, "num_tokens": 75969220.0, "step": 43795 }, { "entropy": 5.426542186737061, "epoch": 3.407780587434351, "grad_norm": 1.0859375, "learning_rate": 0.00038609375407306566, "loss": 4.9056, "mean_token_accuracy": 0.20692589282989501, "num_tokens": 75977345.0, "step": 43800 }, { "entropy": 5.3514509201049805, "epoch": 3.408169616806069, "grad_norm": 1.1328125, "learning_rate": 0.00038606965164756334, "loss": 4.8914, "mean_token_accuracy": 0.2058811902999878, "num_tokens": 75986500.0, "step": 43805 }, { "entropy": 5.332065677642822, "epoch": 3.4085586461777866, "grad_norm": 1.1171875, "learning_rate": 0.00038604554753675585, "loss": 4.8582, "mean_token_accuracy": 0.210355681180954, "num_tokens": 75995164.0, "step": 43810 }, { "entropy": 5.414210796356201, "epoch": 3.408947675549504, "grad_norm": 1.109375, "learning_rate": 0.0003860214417410089, "loss": 4.9423, "mean_token_accuracy": 0.20678454637527466, "num_tokens": 76003927.0, "step": 43815 }, { "entropy": 5.408791589736938, "epoch": 3.4093367049212215, "grad_norm": 1.125, "learning_rate": 0.00038599733426068826, "loss": 4.9316, "mean_token_accuracy": 0.20415865927934645, "num_tokens": 76012703.0, "step": 43820 }, { "entropy": 5.419067621231079, "epoch": 3.4097257342929392, "grad_norm": 1.1640625, "learning_rate": 0.00038597322509615977, "loss": 4.8966, "mean_token_accuracy": 0.20355138629674913, "num_tokens": 76021218.0, "step": 43825 }, { "entropy": 5.3717231273651125, "epoch": 3.4101147636646565, "grad_norm": 1.0859375, "learning_rate": 0.00038594911424778925, "loss": 4.9255, "mean_token_accuracy": 0.20123552829027175, "num_tokens": 76030430.0, "step": 43830 }, { "entropy": 5.393952465057373, "epoch": 3.410503793036374, "grad_norm": 1.09375, "learning_rate": 0.00038592500171594245, "loss": 4.9442, "mean_token_accuracy": 0.20689460635185242, "num_tokens": 76039201.0, "step": 43835 }, { "entropy": 5.391186618804932, "epoch": 3.410892822408092, "grad_norm": 1.125, "learning_rate": 0.00038590088750098536, "loss": 4.8806, "mean_token_accuracy": 0.21480803489685057, "num_tokens": 76048250.0, "step": 43840 }, { "entropy": 5.414554214477539, "epoch": 3.411281851779809, "grad_norm": 1.140625, "learning_rate": 0.00038587677160328377, "loss": 4.9254, "mean_token_accuracy": 0.20182383805513382, "num_tokens": 76057056.0, "step": 43845 }, { "entropy": 5.379528617858886, "epoch": 3.411670881151527, "grad_norm": 1.1328125, "learning_rate": 0.0003858526540232037, "loss": 4.8457, "mean_token_accuracy": 0.2111973911523819, "num_tokens": 76065602.0, "step": 43850 }, { "entropy": 5.406962156295776, "epoch": 3.4120599105232445, "grad_norm": 1.1640625, "learning_rate": 0.00038582853476111094, "loss": 4.9914, "mean_token_accuracy": 0.20101846158504486, "num_tokens": 76073818.0, "step": 43855 }, { "entropy": 5.407097387313843, "epoch": 3.4124489398949622, "grad_norm": 1.1484375, "learning_rate": 0.0003858044138173717, "loss": 4.9389, "mean_token_accuracy": 0.20374141484498978, "num_tokens": 76082343.0, "step": 43860 }, { "entropy": 5.360495662689209, "epoch": 3.4128379692666795, "grad_norm": 1.15625, "learning_rate": 0.00038578029119235176, "loss": 4.8442, "mean_token_accuracy": 0.21291319727897645, "num_tokens": 76090478.0, "step": 43865 }, { "entropy": 5.308180332183838, "epoch": 3.413226998638397, "grad_norm": 1.109375, "learning_rate": 0.00038575616688641724, "loss": 4.8303, "mean_token_accuracy": 0.21565528064966202, "num_tokens": 76098901.0, "step": 43870 }, { "entropy": 5.31659722328186, "epoch": 3.413616028010115, "grad_norm": 1.109375, "learning_rate": 0.0003857320408999342, "loss": 4.828, "mean_token_accuracy": 0.2142665281891823, "num_tokens": 76107281.0, "step": 43875 }, { "entropy": 5.341084384918213, "epoch": 3.414005057381832, "grad_norm": 1.2578125, "learning_rate": 0.0003857079132332687, "loss": 4.8661, "mean_token_accuracy": 0.2094491645693779, "num_tokens": 76116277.0, "step": 43880 }, { "entropy": 5.403334283828736, "epoch": 3.41439408675355, "grad_norm": 1.2109375, "learning_rate": 0.00038568378388678675, "loss": 4.9533, "mean_token_accuracy": 0.20402031391859055, "num_tokens": 76125412.0, "step": 43885 }, { "entropy": 5.34952335357666, "epoch": 3.4147831161252675, "grad_norm": 1.1015625, "learning_rate": 0.0003856596528608546, "loss": 4.8192, "mean_token_accuracy": 0.21202885657548903, "num_tokens": 76134259.0, "step": 43890 }, { "entropy": 5.263854837417602, "epoch": 3.4151721454969852, "grad_norm": 1.1015625, "learning_rate": 0.0003856355201558384, "loss": 4.7563, "mean_token_accuracy": 0.22410248816013337, "num_tokens": 76142557.0, "step": 43895 }, { "entropy": 5.36772985458374, "epoch": 3.4155611748687025, "grad_norm": 1.2734375, "learning_rate": 0.00038561138577210426, "loss": 4.905, "mean_token_accuracy": 0.21243343949317933, "num_tokens": 76150495.0, "step": 43900 }, { "entropy": 5.32286319732666, "epoch": 3.41595020424042, "grad_norm": 1.171875, "learning_rate": 0.00038558724971001835, "loss": 4.7848, "mean_token_accuracy": 0.21454565972089767, "num_tokens": 76158729.0, "step": 43905 }, { "entropy": 5.322009038925171, "epoch": 3.416339233612138, "grad_norm": 1.1953125, "learning_rate": 0.000385563111969947, "loss": 4.9004, "mean_token_accuracy": 0.2015802413225174, "num_tokens": 76167917.0, "step": 43910 }, { "entropy": 5.336364221572876, "epoch": 3.416728262983855, "grad_norm": 1.109375, "learning_rate": 0.00038553897255225633, "loss": 4.8001, "mean_token_accuracy": 0.2147582694888115, "num_tokens": 76176645.0, "step": 43915 }, { "entropy": 5.282109975814819, "epoch": 3.417117292355573, "grad_norm": 1.09375, "learning_rate": 0.00038551483145731277, "loss": 4.9173, "mean_token_accuracy": 0.210238716006279, "num_tokens": 76185344.0, "step": 43920 }, { "entropy": 5.38662633895874, "epoch": 3.4175063217272905, "grad_norm": 1.1484375, "learning_rate": 0.0003854906886854825, "loss": 4.8893, "mean_token_accuracy": 0.2091282159090042, "num_tokens": 76193303.0, "step": 43925 }, { "entropy": 5.412346315383911, "epoch": 3.417895351099008, "grad_norm": 1.125, "learning_rate": 0.00038546654423713187, "loss": 4.9523, "mean_token_accuracy": 0.1990896373987198, "num_tokens": 76202872.0, "step": 43930 }, { "entropy": 5.4019097805023195, "epoch": 3.4182843804707255, "grad_norm": 1.0703125, "learning_rate": 0.0003854423981126273, "loss": 4.9485, "mean_token_accuracy": 0.20305564999580383, "num_tokens": 76212763.0, "step": 43935 }, { "entropy": 5.415450572967529, "epoch": 3.418673409842443, "grad_norm": 1.1171875, "learning_rate": 0.0003854182503123351, "loss": 4.9399, "mean_token_accuracy": 0.20852164328098297, "num_tokens": 76221336.0, "step": 43940 }, { "entropy": 5.390273332595825, "epoch": 3.4190624392141604, "grad_norm": 1.1171875, "learning_rate": 0.00038539410083662166, "loss": 4.8513, "mean_token_accuracy": 0.21169913411140442, "num_tokens": 76229658.0, "step": 43945 }, { "entropy": 5.441069459915161, "epoch": 3.419451468585878, "grad_norm": 1.0703125, "learning_rate": 0.00038536994968585355, "loss": 5.0374, "mean_token_accuracy": 0.1966761603951454, "num_tokens": 76238745.0, "step": 43950 }, { "entropy": 5.433959007263184, "epoch": 3.419840497957596, "grad_norm": 1.1328125, "learning_rate": 0.00038534579686039705, "loss": 4.9045, "mean_token_accuracy": 0.20257362276315688, "num_tokens": 76247463.0, "step": 43955 }, { "entropy": 5.367196750640869, "epoch": 3.4202295273293135, "grad_norm": 1.21875, "learning_rate": 0.00038532164236061874, "loss": 4.8625, "mean_token_accuracy": 0.21195569187402724, "num_tokens": 76256050.0, "step": 43960 }, { "entropy": 5.422271347045898, "epoch": 3.4206185567010308, "grad_norm": 1.1875, "learning_rate": 0.000385297486186885, "loss": 4.8558, "mean_token_accuracy": 0.21538924425840378, "num_tokens": 76264229.0, "step": 43965 }, { "entropy": 5.256823873519897, "epoch": 3.4210075860727485, "grad_norm": 1.1015625, "learning_rate": 0.0003852733283395626, "loss": 4.8458, "mean_token_accuracy": 0.2113883003592491, "num_tokens": 76273273.0, "step": 43970 }, { "entropy": 5.3312907218933105, "epoch": 3.421396615444466, "grad_norm": 1.078125, "learning_rate": 0.000385249168819018, "loss": 4.7292, "mean_token_accuracy": 0.21911280751228332, "num_tokens": 76281887.0, "step": 43975 }, { "entropy": 5.30733470916748, "epoch": 3.4217856448161834, "grad_norm": 1.078125, "learning_rate": 0.0003852250076256177, "loss": 4.7626, "mean_token_accuracy": 0.21440667361021043, "num_tokens": 76290317.0, "step": 43980 }, { "entropy": 5.297487735748291, "epoch": 3.422174674187901, "grad_norm": 1.109375, "learning_rate": 0.0003852008447597283, "loss": 4.8428, "mean_token_accuracy": 0.2138625428080559, "num_tokens": 76299016.0, "step": 43985 }, { "entropy": 5.339577913284302, "epoch": 3.422563703559619, "grad_norm": 1.140625, "learning_rate": 0.00038517668022171656, "loss": 4.873, "mean_token_accuracy": 0.21290654987096785, "num_tokens": 76307723.0, "step": 43990 }, { "entropy": 5.408030319213867, "epoch": 3.4229527329313365, "grad_norm": 1.2109375, "learning_rate": 0.0003851525140119489, "loss": 4.9662, "mean_token_accuracy": 0.20986070483922958, "num_tokens": 76316615.0, "step": 43995 }, { "entropy": 5.407819032669067, "epoch": 3.4233417623030538, "grad_norm": 1.1171875, "learning_rate": 0.00038512834613079226, "loss": 4.8894, "mean_token_accuracy": 0.214308699965477, "num_tokens": 76325920.0, "step": 44000 }, { "entropy": 5.412186145782471, "epoch": 3.4237307916747715, "grad_norm": 1.0625, "learning_rate": 0.0003851041765786133, "loss": 4.952, "mean_token_accuracy": 0.20249849408864976, "num_tokens": 76334223.0, "step": 44005 }, { "entropy": 5.386535787582398, "epoch": 3.424119821046489, "grad_norm": 1.1640625, "learning_rate": 0.00038508000535577864, "loss": 4.8367, "mean_token_accuracy": 0.21700337380170823, "num_tokens": 76342741.0, "step": 44010 }, { "entropy": 5.371453094482422, "epoch": 3.4245088504182064, "grad_norm": 1.2265625, "learning_rate": 0.0003850558324626552, "loss": 4.9244, "mean_token_accuracy": 0.20780442357063295, "num_tokens": 76351494.0, "step": 44015 }, { "entropy": 5.383586978912353, "epoch": 3.424897879789924, "grad_norm": 1.1171875, "learning_rate": 0.0003850316578996096, "loss": 4.9097, "mean_token_accuracy": 0.20596901029348375, "num_tokens": 76361005.0, "step": 44020 }, { "entropy": 5.447936153411865, "epoch": 3.425286909161642, "grad_norm": 1.171875, "learning_rate": 0.0003850074816670087, "loss": 4.9616, "mean_token_accuracy": 0.20765435099601745, "num_tokens": 76369552.0, "step": 44025 }, { "entropy": 5.409248399734497, "epoch": 3.4256759385333595, "grad_norm": 1.1328125, "learning_rate": 0.00038498330376521945, "loss": 4.9897, "mean_token_accuracy": 0.20015438050031661, "num_tokens": 76378248.0, "step": 44030 }, { "entropy": 5.299365282058716, "epoch": 3.4260649679050768, "grad_norm": 1.1484375, "learning_rate": 0.0003849591241946085, "loss": 4.7968, "mean_token_accuracy": 0.21924690306186675, "num_tokens": 76386022.0, "step": 44035 }, { "entropy": 5.3207704544067385, "epoch": 3.4264539972767944, "grad_norm": 1.2109375, "learning_rate": 0.000384934942955543, "loss": 4.8085, "mean_token_accuracy": 0.22133046239614487, "num_tokens": 76394278.0, "step": 44040 }, { "entropy": 5.379897737503052, "epoch": 3.426843026648512, "grad_norm": 1.1875, "learning_rate": 0.00038491076004838965, "loss": 4.8641, "mean_token_accuracy": 0.21763150691986083, "num_tokens": 76402450.0, "step": 44045 }, { "entropy": 5.285750246047973, "epoch": 3.4272320560202294, "grad_norm": 1.1640625, "learning_rate": 0.00038488657547351544, "loss": 4.8063, "mean_token_accuracy": 0.2224019929766655, "num_tokens": 76410384.0, "step": 44050 }, { "entropy": 5.305353116989136, "epoch": 3.427621085391947, "grad_norm": 1.109375, "learning_rate": 0.0003848623892312874, "loss": 4.8595, "mean_token_accuracy": 0.2090450718998909, "num_tokens": 76418739.0, "step": 44055 }, { "entropy": 5.3538408279418945, "epoch": 3.428010114763665, "grad_norm": 1.140625, "learning_rate": 0.0003848382013220725, "loss": 4.8812, "mean_token_accuracy": 0.21959384828805922, "num_tokens": 76427704.0, "step": 44060 }, { "entropy": 5.367846870422364, "epoch": 3.428399144135382, "grad_norm": 1.1640625, "learning_rate": 0.0003848140117462376, "loss": 4.8321, "mean_token_accuracy": 0.2141658693552017, "num_tokens": 76436247.0, "step": 44065 }, { "entropy": 5.305167293548584, "epoch": 3.4287881735070997, "grad_norm": 1.09375, "learning_rate": 0.0003847898205041499, "loss": 4.9086, "mean_token_accuracy": 0.21031559407711028, "num_tokens": 76445218.0, "step": 44070 }, { "entropy": 5.354399681091309, "epoch": 3.4291772028788174, "grad_norm": 1.140625, "learning_rate": 0.00038476562759617644, "loss": 4.8023, "mean_token_accuracy": 0.21128046959638597, "num_tokens": 76454042.0, "step": 44075 }, { "entropy": 5.399473667144775, "epoch": 3.4295662322505347, "grad_norm": 1.15625, "learning_rate": 0.00038474143302268425, "loss": 4.8985, "mean_token_accuracy": 0.20821607410907744, "num_tokens": 76462659.0, "step": 44080 }, { "entropy": 5.333794116973877, "epoch": 3.4299552616222524, "grad_norm": 1.171875, "learning_rate": 0.0003847172367840406, "loss": 4.9034, "mean_token_accuracy": 0.21613748669624328, "num_tokens": 76471268.0, "step": 44085 }, { "entropy": 5.439135217666626, "epoch": 3.43034429099397, "grad_norm": 1.046875, "learning_rate": 0.0003846930388806124, "loss": 4.9535, "mean_token_accuracy": 0.20176736414432525, "num_tokens": 76479914.0, "step": 44090 }, { "entropy": 5.45746922492981, "epoch": 3.430733320365688, "grad_norm": 1.140625, "learning_rate": 0.00038466883931276703, "loss": 4.9611, "mean_token_accuracy": 0.19856687486171723, "num_tokens": 76488330.0, "step": 44095 }, { "entropy": 5.339880752563476, "epoch": 3.431122349737405, "grad_norm": 1.0703125, "learning_rate": 0.00038464463808087146, "loss": 4.8848, "mean_token_accuracy": 0.2101561412215233, "num_tokens": 76496827.0, "step": 44100 }, { "entropy": 5.304679489135742, "epoch": 3.4315113791091227, "grad_norm": 1.1640625, "learning_rate": 0.0003846204351852931, "loss": 4.8245, "mean_token_accuracy": 0.20712484717369078, "num_tokens": 76505220.0, "step": 44105 }, { "entropy": 5.27211709022522, "epoch": 3.4319004084808404, "grad_norm": 1.0859375, "learning_rate": 0.00038459623062639907, "loss": 4.7367, "mean_token_accuracy": 0.2240686759352684, "num_tokens": 76513823.0, "step": 44110 }, { "entropy": 5.402150440216064, "epoch": 3.4322894378525577, "grad_norm": 1.1171875, "learning_rate": 0.00038457202440455673, "loss": 4.8868, "mean_token_accuracy": 0.21330241560935975, "num_tokens": 76522648.0, "step": 44115 }, { "entropy": 5.353517293930054, "epoch": 3.4326784672242754, "grad_norm": 1.171875, "learning_rate": 0.0003845478165201333, "loss": 4.8763, "mean_token_accuracy": 0.20407778918743133, "num_tokens": 76530288.0, "step": 44120 }, { "entropy": 5.281690454483032, "epoch": 3.433067496595993, "grad_norm": 1.09375, "learning_rate": 0.00038452360697349615, "loss": 4.7612, "mean_token_accuracy": 0.21284128874540328, "num_tokens": 76538428.0, "step": 44125 }, { "entropy": 5.378219079971314, "epoch": 3.433456525967711, "grad_norm": 1.0859375, "learning_rate": 0.0003844993957650125, "loss": 4.8374, "mean_token_accuracy": 0.2128179579973221, "num_tokens": 76547396.0, "step": 44130 }, { "entropy": 5.3518470287322994, "epoch": 3.433845555339428, "grad_norm": 1.1015625, "learning_rate": 0.0003844751828950499, "loss": 4.8759, "mean_token_accuracy": 0.20738088190555573, "num_tokens": 76556163.0, "step": 44135 }, { "entropy": 5.358539819717407, "epoch": 3.4342345847111457, "grad_norm": 1.21875, "learning_rate": 0.00038445096836397564, "loss": 4.8766, "mean_token_accuracy": 0.20768878906965255, "num_tokens": 76564717.0, "step": 44140 }, { "entropy": 5.324561309814453, "epoch": 3.4346236140828634, "grad_norm": 1.109375, "learning_rate": 0.00038442675217215713, "loss": 4.8132, "mean_token_accuracy": 0.21306930780410765, "num_tokens": 76573049.0, "step": 44145 }, { "entropy": 5.371606016159058, "epoch": 3.4350126434545807, "grad_norm": 1.1484375, "learning_rate": 0.00038440253431996175, "loss": 4.8559, "mean_token_accuracy": 0.20912517309188844, "num_tokens": 76581897.0, "step": 44150 }, { "entropy": 5.355568313598633, "epoch": 3.4354016728262984, "grad_norm": 1.1796875, "learning_rate": 0.00038437831480775717, "loss": 4.9052, "mean_token_accuracy": 0.20379181653261186, "num_tokens": 76590443.0, "step": 44155 }, { "entropy": 5.285912561416626, "epoch": 3.435790702198016, "grad_norm": 1.15625, "learning_rate": 0.00038435409363591066, "loss": 4.7599, "mean_token_accuracy": 0.2189452275633812, "num_tokens": 76598979.0, "step": 44160 }, { "entropy": 5.3162689208984375, "epoch": 3.4361797315697333, "grad_norm": 1.09375, "learning_rate": 0.00038432987080478986, "loss": 4.9254, "mean_token_accuracy": 0.206170853972435, "num_tokens": 76607658.0, "step": 44165 }, { "entropy": 5.4633502006530765, "epoch": 3.436568760941451, "grad_norm": 1.1875, "learning_rate": 0.0003843056463147623, "loss": 4.9604, "mean_token_accuracy": 0.2060238838195801, "num_tokens": 76615952.0, "step": 44170 }, { "entropy": 5.328668117523193, "epoch": 3.4369577903131687, "grad_norm": 1.1328125, "learning_rate": 0.00038428142016619555, "loss": 4.8353, "mean_token_accuracy": 0.2159118726849556, "num_tokens": 76624016.0, "step": 44175 }, { "entropy": 5.404518508911133, "epoch": 3.437346819684886, "grad_norm": 1.1640625, "learning_rate": 0.0003842571923594572, "loss": 4.9417, "mean_token_accuracy": 0.20634030252695085, "num_tokens": 76633394.0, "step": 44180 }, { "entropy": 5.361873197555542, "epoch": 3.4377358490566037, "grad_norm": 1.1875, "learning_rate": 0.00038423296289491477, "loss": 4.7824, "mean_token_accuracy": 0.223851278424263, "num_tokens": 76641518.0, "step": 44185 }, { "entropy": 5.34814076423645, "epoch": 3.4381248784283214, "grad_norm": 1.203125, "learning_rate": 0.00038420873177293606, "loss": 4.8992, "mean_token_accuracy": 0.20483697056770325, "num_tokens": 76649823.0, "step": 44190 }, { "entropy": 5.342047643661499, "epoch": 3.438513907800039, "grad_norm": 1.046875, "learning_rate": 0.0003841844989938886, "loss": 4.9488, "mean_token_accuracy": 0.2027640163898468, "num_tokens": 76659704.0, "step": 44195 }, { "entropy": 5.448216295242309, "epoch": 3.4389029371717563, "grad_norm": 1.1484375, "learning_rate": 0.0003841602645581402, "loss": 4.8688, "mean_token_accuracy": 0.20437523275613784, "num_tokens": 76668205.0, "step": 44200 }, { "entropy": 5.440160512924194, "epoch": 3.439291966543474, "grad_norm": 1.1875, "learning_rate": 0.00038413602846605854, "loss": 5.0047, "mean_token_accuracy": 0.20420601218938828, "num_tokens": 76677163.0, "step": 44205 }, { "entropy": 5.316384744644165, "epoch": 3.4396809959151917, "grad_norm": 1.078125, "learning_rate": 0.0003841117907180114, "loss": 4.8804, "mean_token_accuracy": 0.20425205677747726, "num_tokens": 76685437.0, "step": 44210 }, { "entropy": 5.470270824432373, "epoch": 3.440070025286909, "grad_norm": 1.09375, "learning_rate": 0.00038408755131436647, "loss": 4.9737, "mean_token_accuracy": 0.20573582947254182, "num_tokens": 76693648.0, "step": 44215 }, { "entropy": 5.347452783584595, "epoch": 3.4404590546586267, "grad_norm": 1.171875, "learning_rate": 0.00038406331025549157, "loss": 4.7914, "mean_token_accuracy": 0.21655315309762954, "num_tokens": 76701790.0, "step": 44220 }, { "entropy": 5.431823062896728, "epoch": 3.4408480840303444, "grad_norm": 1.0546875, "learning_rate": 0.0003840390675417545, "loss": 5.0024, "mean_token_accuracy": 0.20095865428447723, "num_tokens": 76710696.0, "step": 44225 }, { "entropy": 5.414216136932373, "epoch": 3.441237113402062, "grad_norm": 1.140625, "learning_rate": 0.0003840148231735231, "loss": 4.9461, "mean_token_accuracy": 0.21327468752861023, "num_tokens": 76718731.0, "step": 44230 }, { "entropy": 5.395946025848389, "epoch": 3.4416261427737793, "grad_norm": 1.078125, "learning_rate": 0.00038399057715116536, "loss": 4.9879, "mean_token_accuracy": 0.1980130359530449, "num_tokens": 76727678.0, "step": 44235 }, { "entropy": 5.357743930816651, "epoch": 3.442015172145497, "grad_norm": 1.171875, "learning_rate": 0.00038396632947504904, "loss": 4.8085, "mean_token_accuracy": 0.21749017238616944, "num_tokens": 76736605.0, "step": 44240 }, { "entropy": 5.414746570587158, "epoch": 3.4424042015172147, "grad_norm": 1.1328125, "learning_rate": 0.0003839420801455422, "loss": 4.9918, "mean_token_accuracy": 0.20089211612939833, "num_tokens": 76746050.0, "step": 44245 }, { "entropy": 5.398993110656738, "epoch": 3.442793230888932, "grad_norm": 1.140625, "learning_rate": 0.0003839178291630126, "loss": 4.8678, "mean_token_accuracy": 0.21333519369363785, "num_tokens": 76754825.0, "step": 44250 }, { "entropy": 5.346442222595215, "epoch": 3.4431822602606497, "grad_norm": 1.09375, "learning_rate": 0.00038389357652782836, "loss": 4.843, "mean_token_accuracy": 0.21309790015220642, "num_tokens": 76763761.0, "step": 44255 }, { "entropy": 5.351872348785401, "epoch": 3.4435712896323674, "grad_norm": 1.15625, "learning_rate": 0.00038386932224035734, "loss": 4.8855, "mean_token_accuracy": 0.20804891735315323, "num_tokens": 76772187.0, "step": 44260 }, { "entropy": 5.331553506851196, "epoch": 3.443960319004085, "grad_norm": 1.1640625, "learning_rate": 0.00038384506630096765, "loss": 4.7915, "mean_token_accuracy": 0.21334637552499772, "num_tokens": 76780722.0, "step": 44265 }, { "entropy": 5.360098361968994, "epoch": 3.4443493483758023, "grad_norm": 1.0625, "learning_rate": 0.0003838208087100274, "loss": 4.8726, "mean_token_accuracy": 0.2041327401995659, "num_tokens": 76789752.0, "step": 44270 }, { "entropy": 5.434886169433594, "epoch": 3.44473837774752, "grad_norm": 1.1484375, "learning_rate": 0.0003837965494679045, "loss": 4.8631, "mean_token_accuracy": 0.21674614250659943, "num_tokens": 76798052.0, "step": 44275 }, { "entropy": 5.326298332214355, "epoch": 3.4451274071192373, "grad_norm": 1.1328125, "learning_rate": 0.0003837722885749672, "loss": 4.7856, "mean_token_accuracy": 0.2141245499253273, "num_tokens": 76806543.0, "step": 44280 }, { "entropy": 5.3487707614898685, "epoch": 3.445516436490955, "grad_norm": 1.0703125, "learning_rate": 0.0003837480260315835, "loss": 4.8736, "mean_token_accuracy": 0.21056022197008134, "num_tokens": 76815316.0, "step": 44285 }, { "entropy": 5.264605617523193, "epoch": 3.4459054658626727, "grad_norm": 1.125, "learning_rate": 0.00038372376183812165, "loss": 4.7139, "mean_token_accuracy": 0.21785422265529633, "num_tokens": 76823826.0, "step": 44290 }, { "entropy": 5.356287622451783, "epoch": 3.4462944952343904, "grad_norm": 1.203125, "learning_rate": 0.0003836994959949497, "loss": 4.9122, "mean_token_accuracy": 0.20722005069255828, "num_tokens": 76832225.0, "step": 44295 }, { "entropy": 5.395603227615356, "epoch": 3.4466835246061076, "grad_norm": 1.1796875, "learning_rate": 0.00038367522850243593, "loss": 4.9581, "mean_token_accuracy": 0.20258038938045503, "num_tokens": 76839732.0, "step": 44300 }, { "entropy": 5.275016450881958, "epoch": 3.4470725539778253, "grad_norm": 1.140625, "learning_rate": 0.00038365095936094857, "loss": 4.7782, "mean_token_accuracy": 0.21891596615314485, "num_tokens": 76848041.0, "step": 44305 }, { "entropy": 5.375964069366455, "epoch": 3.447461583349543, "grad_norm": 1.140625, "learning_rate": 0.0003836266885708558, "loss": 4.8697, "mean_token_accuracy": 0.2147322416305542, "num_tokens": 76856869.0, "step": 44310 }, { "entropy": 5.427698564529419, "epoch": 3.4478506127212603, "grad_norm": 1.1640625, "learning_rate": 0.00038360241613252593, "loss": 4.9496, "mean_token_accuracy": 0.20214297920465468, "num_tokens": 76865309.0, "step": 44315 }, { "entropy": 5.340597915649414, "epoch": 3.448239642092978, "grad_norm": 1.2578125, "learning_rate": 0.0003835781420463273, "loss": 4.8438, "mean_token_accuracy": 0.21674845218658448, "num_tokens": 76873300.0, "step": 44320 }, { "entropy": 5.372597551345825, "epoch": 3.4486286714646956, "grad_norm": 1.09375, "learning_rate": 0.0003835538663126282, "loss": 4.8529, "mean_token_accuracy": 0.2088318571448326, "num_tokens": 76881662.0, "step": 44325 }, { "entropy": 5.371818161010742, "epoch": 3.4490177008364133, "grad_norm": 1.1328125, "learning_rate": 0.0003835295889317969, "loss": 4.8236, "mean_token_accuracy": 0.2105466514825821, "num_tokens": 76890537.0, "step": 44330 }, { "entropy": 5.3207779884338375, "epoch": 3.4494067302081306, "grad_norm": 1.15625, "learning_rate": 0.00038350530990420177, "loss": 4.8683, "mean_token_accuracy": 0.2131390690803528, "num_tokens": 76898976.0, "step": 44335 }, { "entropy": 5.351888847351074, "epoch": 3.4497957595798483, "grad_norm": 1.25, "learning_rate": 0.0003834810292302114, "loss": 4.8409, "mean_token_accuracy": 0.21886058896780014, "num_tokens": 76907094.0, "step": 44340 }, { "entropy": 5.370271825790406, "epoch": 3.450184788951566, "grad_norm": 1.2109375, "learning_rate": 0.000383456746910194, "loss": 4.8993, "mean_token_accuracy": 0.21064492911100388, "num_tokens": 76916324.0, "step": 44345 }, { "entropy": 5.300068616867065, "epoch": 3.4505738183232832, "grad_norm": 1.1015625, "learning_rate": 0.0003834324629445182, "loss": 4.8059, "mean_token_accuracy": 0.2198035180568695, "num_tokens": 76925165.0, "step": 44350 }, { "entropy": 5.3317633152008055, "epoch": 3.450962847695001, "grad_norm": 1.1484375, "learning_rate": 0.0003834081773335522, "loss": 4.858, "mean_token_accuracy": 0.2146083101630211, "num_tokens": 76933317.0, "step": 44355 }, { "entropy": 5.369013261795044, "epoch": 3.4513518770667186, "grad_norm": 1.2109375, "learning_rate": 0.00038338389007766473, "loss": 4.883, "mean_token_accuracy": 0.20833025723695756, "num_tokens": 76942353.0, "step": 44360 }, { "entropy": 5.314143800735474, "epoch": 3.4517409064384363, "grad_norm": 1.0859375, "learning_rate": 0.0003833596011772242, "loss": 4.8558, "mean_token_accuracy": 0.2158580645918846, "num_tokens": 76950844.0, "step": 44365 }, { "entropy": 5.30028977394104, "epoch": 3.4521299358101536, "grad_norm": 1.140625, "learning_rate": 0.0003833353106325993, "loss": 4.8608, "mean_token_accuracy": 0.2134937345981598, "num_tokens": 76959159.0, "step": 44370 }, { "entropy": 5.253014707565308, "epoch": 3.4525189651818713, "grad_norm": 1.203125, "learning_rate": 0.0003833110184441584, "loss": 4.8389, "mean_token_accuracy": 0.21132627725601197, "num_tokens": 76967287.0, "step": 44375 }, { "entropy": 5.350424480438233, "epoch": 3.452907994553589, "grad_norm": 1.2109375, "learning_rate": 0.00038328672461227024, "loss": 4.9009, "mean_token_accuracy": 0.21104328334331512, "num_tokens": 76975984.0, "step": 44380 }, { "entropy": 5.389069938659668, "epoch": 3.4532970239253062, "grad_norm": 1.0859375, "learning_rate": 0.0003832624291373034, "loss": 4.9153, "mean_token_accuracy": 0.20550612211227418, "num_tokens": 76985045.0, "step": 44385 }, { "entropy": 5.4156256198883055, "epoch": 3.453686053297024, "grad_norm": 1.265625, "learning_rate": 0.00038323813201962645, "loss": 4.9022, "mean_token_accuracy": 0.20268590599298478, "num_tokens": 76993221.0, "step": 44390 }, { "entropy": 5.367113351821899, "epoch": 3.4540750826687416, "grad_norm": 1.0546875, "learning_rate": 0.00038321383325960816, "loss": 4.9018, "mean_token_accuracy": 0.2048519417643547, "num_tokens": 77002053.0, "step": 44395 }, { "entropy": 5.329811763763428, "epoch": 3.454464112040459, "grad_norm": 1.140625, "learning_rate": 0.0003831895328576172, "loss": 4.8226, "mean_token_accuracy": 0.20851605981588364, "num_tokens": 77011113.0, "step": 44400 }, { "entropy": 5.355357074737549, "epoch": 3.4548531414121766, "grad_norm": 1.1640625, "learning_rate": 0.0003831652308140223, "loss": 4.8814, "mean_token_accuracy": 0.20771587789058685, "num_tokens": 77019975.0, "step": 44405 }, { "entropy": 5.285380220413208, "epoch": 3.4552421707838943, "grad_norm": 1.140625, "learning_rate": 0.0003831409271291921, "loss": 4.8217, "mean_token_accuracy": 0.21427868753671647, "num_tokens": 77027854.0, "step": 44410 }, { "entropy": 5.214561939239502, "epoch": 3.4556312001556115, "grad_norm": 1.078125, "learning_rate": 0.00038311662180349554, "loss": 4.7628, "mean_token_accuracy": 0.22265122532844545, "num_tokens": 77036342.0, "step": 44415 }, { "entropy": 5.290084266662598, "epoch": 3.4560202295273292, "grad_norm": 1.109375, "learning_rate": 0.00038309231483730133, "loss": 4.7542, "mean_token_accuracy": 0.21736222356557847, "num_tokens": 77044403.0, "step": 44420 }, { "entropy": 5.414895391464233, "epoch": 3.456409258899047, "grad_norm": 1.140625, "learning_rate": 0.0003830680062309782, "loss": 4.9067, "mean_token_accuracy": 0.21002959012985228, "num_tokens": 77053096.0, "step": 44425 }, { "entropy": 5.354868459701538, "epoch": 3.4567982882707646, "grad_norm": 1.15625, "learning_rate": 0.00038304369598489516, "loss": 4.849, "mean_token_accuracy": 0.2119813472032547, "num_tokens": 77061902.0, "step": 44430 }, { "entropy": 5.378109312057495, "epoch": 3.457187317642482, "grad_norm": 1.15625, "learning_rate": 0.000383019384099421, "loss": 4.864, "mean_token_accuracy": 0.2117719903588295, "num_tokens": 77070414.0, "step": 44435 }, { "entropy": 5.375939512252808, "epoch": 3.4575763470141996, "grad_norm": 1.1484375, "learning_rate": 0.0003829950705749246, "loss": 4.9414, "mean_token_accuracy": 0.20815983414649963, "num_tokens": 77078799.0, "step": 44440 }, { "entropy": 5.439076328277588, "epoch": 3.4579653763859173, "grad_norm": 1.171875, "learning_rate": 0.00038297075541177496, "loss": 4.9312, "mean_token_accuracy": 0.20850176811218263, "num_tokens": 77088143.0, "step": 44445 }, { "entropy": 5.363088464736938, "epoch": 3.4583544057576345, "grad_norm": 1.0546875, "learning_rate": 0.00038294643861034087, "loss": 4.8744, "mean_token_accuracy": 0.20764935463666917, "num_tokens": 77097566.0, "step": 44450 }, { "entropy": 5.349290752410889, "epoch": 3.4587434351293522, "grad_norm": 1.078125, "learning_rate": 0.0003829221201709914, "loss": 4.7997, "mean_token_accuracy": 0.21626420468091964, "num_tokens": 77105846.0, "step": 44455 }, { "entropy": 5.2779652118682865, "epoch": 3.45913246450107, "grad_norm": 1.21875, "learning_rate": 0.0003828978000940955, "loss": 4.8362, "mean_token_accuracy": 0.21589682698249818, "num_tokens": 77114661.0, "step": 44460 }, { "entropy": 5.3341529846191404, "epoch": 3.4595214938727876, "grad_norm": 1.203125, "learning_rate": 0.0003828734783800223, "loss": 4.8332, "mean_token_accuracy": 0.21051027327775956, "num_tokens": 77122918.0, "step": 44465 }, { "entropy": 5.406696510314942, "epoch": 3.459910523244505, "grad_norm": 1.0703125, "learning_rate": 0.0003828491550291408, "loss": 4.8567, "mean_token_accuracy": 0.2100216567516327, "num_tokens": 77132480.0, "step": 44470 }, { "entropy": 5.360545206069946, "epoch": 3.4602995526162226, "grad_norm": 1.171875, "learning_rate": 0.0003828248300418199, "loss": 4.8638, "mean_token_accuracy": 0.20658172070980071, "num_tokens": 77141277.0, "step": 44475 }, { "entropy": 5.416366147994995, "epoch": 3.4606885819879403, "grad_norm": 1.171875, "learning_rate": 0.00038280050341842894, "loss": 4.9239, "mean_token_accuracy": 0.20729179829359054, "num_tokens": 77149818.0, "step": 44480 }, { "entropy": 5.400912618637085, "epoch": 3.4610776113596575, "grad_norm": 1.1640625, "learning_rate": 0.0003827761751593369, "loss": 4.8589, "mean_token_accuracy": 0.20934441834688186, "num_tokens": 77158368.0, "step": 44485 }, { "entropy": 5.368451452255249, "epoch": 3.461466640731375, "grad_norm": 1.1171875, "learning_rate": 0.0003827518452649129, "loss": 4.9491, "mean_token_accuracy": 0.20282781571149827, "num_tokens": 77167538.0, "step": 44490 }, { "entropy": 5.379152631759643, "epoch": 3.461855670103093, "grad_norm": 1.125, "learning_rate": 0.0003827275137355261, "loss": 4.8472, "mean_token_accuracy": 0.2111928105354309, "num_tokens": 77175920.0, "step": 44495 }, { "entropy": 5.409280109405517, "epoch": 3.46224469947481, "grad_norm": 1.1484375, "learning_rate": 0.0003827031805715458, "loss": 5.0016, "mean_token_accuracy": 0.1978055626153946, "num_tokens": 77184297.0, "step": 44500 }, { "entropy": 5.327898597717285, "epoch": 3.462633728846528, "grad_norm": 1.0546875, "learning_rate": 0.00038267884577334124, "loss": 4.8266, "mean_token_accuracy": 0.2100634142756462, "num_tokens": 77192651.0, "step": 44505 }, { "entropy": 5.315609502792358, "epoch": 3.4630227582182456, "grad_norm": 1.21875, "learning_rate": 0.0003826545093412815, "loss": 4.7488, "mean_token_accuracy": 0.21980190873146058, "num_tokens": 77200997.0, "step": 44510 }, { "entropy": 5.357059717178345, "epoch": 3.463411787589963, "grad_norm": 1.1171875, "learning_rate": 0.00038263017127573596, "loss": 4.8287, "mean_token_accuracy": 0.2075844958424568, "num_tokens": 77209080.0, "step": 44515 }, { "entropy": 5.330939435958863, "epoch": 3.4638008169616805, "grad_norm": 1.1015625, "learning_rate": 0.0003826058315770739, "loss": 4.8523, "mean_token_accuracy": 0.20976097583770753, "num_tokens": 77219167.0, "step": 44520 }, { "entropy": 5.296736001968384, "epoch": 3.464189846333398, "grad_norm": 1.078125, "learning_rate": 0.00038258149024566465, "loss": 4.821, "mean_token_accuracy": 0.20952046811580657, "num_tokens": 77228099.0, "step": 44525 }, { "entropy": 5.38392128944397, "epoch": 3.464578875705116, "grad_norm": 1.109375, "learning_rate": 0.0003825571472818774, "loss": 4.908, "mean_token_accuracy": 0.20585681349039078, "num_tokens": 77237384.0, "step": 44530 }, { "entropy": 5.344997787475586, "epoch": 3.464967905076833, "grad_norm": 1.1875, "learning_rate": 0.0003825328026860817, "loss": 4.7637, "mean_token_accuracy": 0.21872926950454713, "num_tokens": 77245443.0, "step": 44535 }, { "entropy": 5.286933660507202, "epoch": 3.465356934448551, "grad_norm": 1.1484375, "learning_rate": 0.00038250845645864686, "loss": 4.7619, "mean_token_accuracy": 0.22390384078025818, "num_tokens": 77253193.0, "step": 44540 }, { "entropy": 5.326523733139038, "epoch": 3.4657459638202686, "grad_norm": 1.0859375, "learning_rate": 0.0003824841085999423, "loss": 4.9206, "mean_token_accuracy": 0.20267895013093948, "num_tokens": 77263358.0, "step": 44545 }, { "entropy": 5.364959955215454, "epoch": 3.466134993191986, "grad_norm": 1.203125, "learning_rate": 0.0003824597591103375, "loss": 4.9328, "mean_token_accuracy": 0.20369053930044173, "num_tokens": 77271996.0, "step": 44550 }, { "entropy": 5.3641682147979735, "epoch": 3.4665240225637035, "grad_norm": 1.125, "learning_rate": 0.00038243540799020193, "loss": 4.7485, "mean_token_accuracy": 0.22252302765846252, "num_tokens": 77280795.0, "step": 44555 }, { "entropy": 5.345756340026855, "epoch": 3.466913051935421, "grad_norm": 1.125, "learning_rate": 0.00038241105523990497, "loss": 4.8566, "mean_token_accuracy": 0.21098969131708145, "num_tokens": 77289191.0, "step": 44560 }, { "entropy": 5.346543312072754, "epoch": 3.467302081307139, "grad_norm": 1.140625, "learning_rate": 0.0003823867008598163, "loss": 4.9015, "mean_token_accuracy": 0.20031464397907256, "num_tokens": 77298022.0, "step": 44565 }, { "entropy": 5.335916519165039, "epoch": 3.467691110678856, "grad_norm": 1.1171875, "learning_rate": 0.00038236234485030524, "loss": 4.8803, "mean_token_accuracy": 0.20301207304000854, "num_tokens": 77307145.0, "step": 44570 }, { "entropy": 5.340648365020752, "epoch": 3.468080140050574, "grad_norm": 1.171875, "learning_rate": 0.00038233798721174156, "loss": 4.8755, "mean_token_accuracy": 0.21623898148536683, "num_tokens": 77316694.0, "step": 44575 }, { "entropy": 5.415460872650146, "epoch": 3.4684691694222916, "grad_norm": 1.1953125, "learning_rate": 0.0003823136279444948, "loss": 4.9778, "mean_token_accuracy": 0.20616236329078674, "num_tokens": 77325072.0, "step": 44580 }, { "entropy": 5.3838294506072994, "epoch": 3.468858198794009, "grad_norm": 1.15625, "learning_rate": 0.0003822892670489345, "loss": 4.9072, "mean_token_accuracy": 0.21152201294898987, "num_tokens": 77333823.0, "step": 44585 }, { "entropy": 5.400976610183716, "epoch": 3.4692472281657265, "grad_norm": 1.078125, "learning_rate": 0.00038226490452543036, "loss": 4.9007, "mean_token_accuracy": 0.20008691847324372, "num_tokens": 77342753.0, "step": 44590 }, { "entropy": 5.312636470794677, "epoch": 3.469636257537444, "grad_norm": 1.1171875, "learning_rate": 0.000382240540374352, "loss": 4.8396, "mean_token_accuracy": 0.21337733566761016, "num_tokens": 77351345.0, "step": 44595 }, { "entropy": 5.44354944229126, "epoch": 3.4700252869091615, "grad_norm": 1.234375, "learning_rate": 0.0003822161745960691, "loss": 4.9677, "mean_token_accuracy": 0.2047753304243088, "num_tokens": 77360144.0, "step": 44600 }, { "entropy": 5.4501060962677, "epoch": 3.470414316280879, "grad_norm": 1.1796875, "learning_rate": 0.0003821918071909515, "loss": 4.9629, "mean_token_accuracy": 0.20604571998119353, "num_tokens": 77368821.0, "step": 44605 }, { "entropy": 5.381224298477173, "epoch": 3.470803345652597, "grad_norm": 1.0703125, "learning_rate": 0.0003821674381593687, "loss": 4.8847, "mean_token_accuracy": 0.21045186817646028, "num_tokens": 77377904.0, "step": 44610 }, { "entropy": 5.426573944091797, "epoch": 3.471192375024314, "grad_norm": 1.078125, "learning_rate": 0.0003821430675016907, "loss": 4.9995, "mean_token_accuracy": 0.198626746237278, "num_tokens": 77387335.0, "step": 44615 }, { "entropy": 5.353687334060669, "epoch": 3.471581404396032, "grad_norm": 1.125, "learning_rate": 0.00038211869521828716, "loss": 4.9188, "mean_token_accuracy": 0.20529052317142488, "num_tokens": 77396783.0, "step": 44620 }, { "entropy": 5.4907050132751465, "epoch": 3.4719704337677495, "grad_norm": 1.140625, "learning_rate": 0.000382094321309528, "loss": 5.034, "mean_token_accuracy": 0.20266800224781037, "num_tokens": 77406035.0, "step": 44625 }, { "entropy": 5.433233261108398, "epoch": 3.472359463139467, "grad_norm": 1.140625, "learning_rate": 0.0003820699457757829, "loss": 4.8509, "mean_token_accuracy": 0.2108508139848709, "num_tokens": 77415064.0, "step": 44630 }, { "entropy": 5.355993461608887, "epoch": 3.4727484925111844, "grad_norm": 1.0859375, "learning_rate": 0.0003820455686174218, "loss": 4.8194, "mean_token_accuracy": 0.2112145647406578, "num_tokens": 77423001.0, "step": 44635 }, { "entropy": 5.415927124023438, "epoch": 3.473137521882902, "grad_norm": 1.2265625, "learning_rate": 0.00038202118983481456, "loss": 4.9437, "mean_token_accuracy": 0.20275495052337647, "num_tokens": 77431520.0, "step": 44640 }, { "entropy": 5.359023952484131, "epoch": 3.47352655125462, "grad_norm": 1.1171875, "learning_rate": 0.0003819968094283311, "loss": 4.925, "mean_token_accuracy": 0.20460680425167083, "num_tokens": 77439476.0, "step": 44645 }, { "entropy": 5.477322769165039, "epoch": 3.473915580626337, "grad_norm": 1.0859375, "learning_rate": 0.0003819724273983414, "loss": 4.9597, "mean_token_accuracy": 0.20322203636169434, "num_tokens": 77448466.0, "step": 44650 }, { "entropy": 5.3285393714904785, "epoch": 3.474304609998055, "grad_norm": 1.046875, "learning_rate": 0.00038194804374521536, "loss": 4.8369, "mean_token_accuracy": 0.2219265356659889, "num_tokens": 77457858.0, "step": 44655 }, { "entropy": 5.342967319488525, "epoch": 3.4746936393697725, "grad_norm": 1.078125, "learning_rate": 0.0003819236584693229, "loss": 4.8732, "mean_token_accuracy": 0.20543833523988725, "num_tokens": 77467308.0, "step": 44660 }, { "entropy": 5.305013704299927, "epoch": 3.47508266874149, "grad_norm": 1.09375, "learning_rate": 0.00038189927157103427, "loss": 4.8238, "mean_token_accuracy": 0.20706083476543427, "num_tokens": 77476227.0, "step": 44665 }, { "entropy": 5.364732694625855, "epoch": 3.4754716981132074, "grad_norm": 1.171875, "learning_rate": 0.0003818748830507192, "loss": 4.8111, "mean_token_accuracy": 0.21035706549882888, "num_tokens": 77484915.0, "step": 44670 }, { "entropy": 5.4304746150970455, "epoch": 3.475860727484925, "grad_norm": 1.109375, "learning_rate": 0.000381850492908748, "loss": 4.8901, "mean_token_accuracy": 0.2073024183511734, "num_tokens": 77493638.0, "step": 44675 }, { "entropy": 5.394555473327637, "epoch": 3.476249756856643, "grad_norm": 1.0859375, "learning_rate": 0.00038182610114549057, "loss": 4.8972, "mean_token_accuracy": 0.20854175835847855, "num_tokens": 77502834.0, "step": 44680 }, { "entropy": 5.366734266281128, "epoch": 3.47663878622836, "grad_norm": 1.1015625, "learning_rate": 0.00038180170776131714, "loss": 4.8438, "mean_token_accuracy": 0.2094848319888115, "num_tokens": 77511193.0, "step": 44685 }, { "entropy": 5.289023208618164, "epoch": 3.477027815600078, "grad_norm": 1.1015625, "learning_rate": 0.0003817773127565977, "loss": 4.7382, "mean_token_accuracy": 0.22577516585588456, "num_tokens": 77519839.0, "step": 44690 }, { "entropy": 5.35586109161377, "epoch": 3.4774168449717955, "grad_norm": 1.1796875, "learning_rate": 0.00038175291613170247, "loss": 4.8915, "mean_token_accuracy": 0.20742276906967164, "num_tokens": 77528581.0, "step": 44695 }, { "entropy": 5.394116163253784, "epoch": 3.477805874343513, "grad_norm": 1.21875, "learning_rate": 0.00038172851788700174, "loss": 4.936, "mean_token_accuracy": 0.20792502015829087, "num_tokens": 77536426.0, "step": 44700 }, { "entropy": 5.369876050949097, "epoch": 3.4781949037152304, "grad_norm": 1.140625, "learning_rate": 0.0003817041180228657, "loss": 4.8822, "mean_token_accuracy": 0.20722484439611435, "num_tokens": 77544785.0, "step": 44705 }, { "entropy": 5.384251356124878, "epoch": 3.478583933086948, "grad_norm": 1.0859375, "learning_rate": 0.0003816797165396643, "loss": 4.8831, "mean_token_accuracy": 0.21001382619142533, "num_tokens": 77554731.0, "step": 44710 }, { "entropy": 5.346391487121582, "epoch": 3.4789729624586654, "grad_norm": 1.109375, "learning_rate": 0.00038165531343776815, "loss": 4.7432, "mean_token_accuracy": 0.21466246545314788, "num_tokens": 77562953.0, "step": 44715 }, { "entropy": 5.369436120986938, "epoch": 3.479361991830383, "grad_norm": 1.1875, "learning_rate": 0.0003816309087175474, "loss": 4.8756, "mean_token_accuracy": 0.21494832187891005, "num_tokens": 77571740.0, "step": 44720 }, { "entropy": 5.3778684616088865, "epoch": 3.479751021202101, "grad_norm": 1.0546875, "learning_rate": 0.00038160650237937225, "loss": 4.9137, "mean_token_accuracy": 0.21087800562381745, "num_tokens": 77580160.0, "step": 44725 }, { "entropy": 5.338549613952637, "epoch": 3.4801400505738185, "grad_norm": 1.1875, "learning_rate": 0.0003815820944236131, "loss": 4.8461, "mean_token_accuracy": 0.21498069763183594, "num_tokens": 77588562.0, "step": 44730 }, { "entropy": 5.30530276298523, "epoch": 3.4805290799455357, "grad_norm": 1.2421875, "learning_rate": 0.00038155768485064037, "loss": 4.7766, "mean_token_accuracy": 0.2216700568795204, "num_tokens": 77596865.0, "step": 44735 }, { "entropy": 5.374427461624146, "epoch": 3.4809181093172534, "grad_norm": 1.1640625, "learning_rate": 0.00038153327366082434, "loss": 4.9341, "mean_token_accuracy": 0.2070258677005768, "num_tokens": 77604976.0, "step": 44740 }, { "entropy": 5.43536148071289, "epoch": 3.481307138688971, "grad_norm": 1.171875, "learning_rate": 0.00038150886085453546, "loss": 4.9497, "mean_token_accuracy": 0.2060566321015358, "num_tokens": 77614216.0, "step": 44745 }, { "entropy": 5.36468472480774, "epoch": 3.4816961680606884, "grad_norm": 1.1171875, "learning_rate": 0.00038148444643214415, "loss": 4.879, "mean_token_accuracy": 0.21005220264196395, "num_tokens": 77622294.0, "step": 44750 }, { "entropy": 5.4450806140899655, "epoch": 3.482085197432406, "grad_norm": 1.203125, "learning_rate": 0.0003814600303940208, "loss": 4.9136, "mean_token_accuracy": 0.20356812328100204, "num_tokens": 77630231.0, "step": 44755 }, { "entropy": 5.31572322845459, "epoch": 3.4824742268041238, "grad_norm": 1.0703125, "learning_rate": 0.000381435612740536, "loss": 4.7829, "mean_token_accuracy": 0.21263141334056854, "num_tokens": 77638841.0, "step": 44760 }, { "entropy": 5.368469476699829, "epoch": 3.4828632561758415, "grad_norm": 1.1484375, "learning_rate": 0.00038141119347206016, "loss": 4.8853, "mean_token_accuracy": 0.21435127407312393, "num_tokens": 77647487.0, "step": 44765 }, { "entropy": 5.446864175796509, "epoch": 3.4832522855475587, "grad_norm": 1.1484375, "learning_rate": 0.00038138677258896383, "loss": 4.8986, "mean_token_accuracy": 0.2096485748887062, "num_tokens": 77655882.0, "step": 44770 }, { "entropy": 5.295647239685058, "epoch": 3.4836413149192764, "grad_norm": 1.078125, "learning_rate": 0.0003813623500916176, "loss": 4.7546, "mean_token_accuracy": 0.2160818487405777, "num_tokens": 77664919.0, "step": 44775 }, { "entropy": 5.351758670806885, "epoch": 3.484030344290994, "grad_norm": 1.09375, "learning_rate": 0.00038133792598039196, "loss": 4.8636, "mean_token_accuracy": 0.21550663113594054, "num_tokens": 77673848.0, "step": 44780 }, { "entropy": 5.39409441947937, "epoch": 3.4844193736627114, "grad_norm": 1.234375, "learning_rate": 0.0003813135002556575, "loss": 4.8873, "mean_token_accuracy": 0.20722482949495316, "num_tokens": 77682352.0, "step": 44785 }, { "entropy": 5.415047121047974, "epoch": 3.484808403034429, "grad_norm": 1.1640625, "learning_rate": 0.00038128907291778497, "loss": 4.8774, "mean_token_accuracy": 0.20512043982744216, "num_tokens": 77690347.0, "step": 44790 }, { "entropy": 5.314858865737915, "epoch": 3.4851974324061468, "grad_norm": 1.109375, "learning_rate": 0.00038126464396714494, "loss": 4.8041, "mean_token_accuracy": 0.21791022419929504, "num_tokens": 77699172.0, "step": 44795 }, { "entropy": 5.427189540863037, "epoch": 3.4855864617778645, "grad_norm": 1.1640625, "learning_rate": 0.00038124021340410795, "loss": 4.89, "mean_token_accuracy": 0.20650639086961747, "num_tokens": 77707790.0, "step": 44800 }, { "entropy": 5.382651233673096, "epoch": 3.4859754911495817, "grad_norm": 1.140625, "learning_rate": 0.00038121578122904496, "loss": 4.863, "mean_token_accuracy": 0.2135154351592064, "num_tokens": 77716602.0, "step": 44805 }, { "entropy": 5.355307960510254, "epoch": 3.4863645205212994, "grad_norm": 1.140625, "learning_rate": 0.0003811913474423265, "loss": 4.7422, "mean_token_accuracy": 0.22911380976438522, "num_tokens": 77725999.0, "step": 44810 }, { "entropy": 5.420509958267212, "epoch": 3.486753549893017, "grad_norm": 1.109375, "learning_rate": 0.0003811669120443234, "loss": 4.9, "mean_token_accuracy": 0.20644643157720566, "num_tokens": 77733829.0, "step": 44815 }, { "entropy": 5.409259414672851, "epoch": 3.4871425792647344, "grad_norm": 1.2421875, "learning_rate": 0.0003811424750354063, "loss": 4.856, "mean_token_accuracy": 0.21237395852804183, "num_tokens": 77742481.0, "step": 44820 }, { "entropy": 5.311704301834107, "epoch": 3.487531608636452, "grad_norm": 1.109375, "learning_rate": 0.0003811180364159462, "loss": 4.7631, "mean_token_accuracy": 0.21622443050146103, "num_tokens": 77751368.0, "step": 44825 }, { "entropy": 5.321013069152832, "epoch": 3.4879206380081698, "grad_norm": 1.1953125, "learning_rate": 0.00038109359618631374, "loss": 4.8164, "mean_token_accuracy": 0.22115306556224823, "num_tokens": 77759134.0, "step": 44830 }, { "entropy": 5.3124878883361815, "epoch": 3.488309667379887, "grad_norm": 1.1328125, "learning_rate": 0.00038106915434687983, "loss": 4.8117, "mean_token_accuracy": 0.2034165754914284, "num_tokens": 77767337.0, "step": 44835 }, { "entropy": 5.316043996810913, "epoch": 3.4886986967516047, "grad_norm": 1.140625, "learning_rate": 0.0003810447108980153, "loss": 4.8167, "mean_token_accuracy": 0.2115349844098091, "num_tokens": 77776296.0, "step": 44840 }, { "entropy": 5.410290813446045, "epoch": 3.4890877261233224, "grad_norm": 1.046875, "learning_rate": 0.0003810202658400911, "loss": 4.9642, "mean_token_accuracy": 0.1983846366405487, "num_tokens": 77785252.0, "step": 44845 }, { "entropy": 5.4877434253692625, "epoch": 3.4894767554950397, "grad_norm": 1.125, "learning_rate": 0.0003809958191734781, "loss": 4.9434, "mean_token_accuracy": 0.2040013000369072, "num_tokens": 77793971.0, "step": 44850 }, { "entropy": 5.3847955703735355, "epoch": 3.4898657848667574, "grad_norm": 1.0703125, "learning_rate": 0.00038097137089854725, "loss": 4.8244, "mean_token_accuracy": 0.20978716164827346, "num_tokens": 77803060.0, "step": 44855 }, { "entropy": 5.278874158859253, "epoch": 3.490254814238475, "grad_norm": 1.0625, "learning_rate": 0.00038094692101566955, "loss": 4.8236, "mean_token_accuracy": 0.22411368042230606, "num_tokens": 77811046.0, "step": 44860 }, { "entropy": 5.326783895492554, "epoch": 3.4906438436101928, "grad_norm": 1.15625, "learning_rate": 0.0003809224695252159, "loss": 4.8372, "mean_token_accuracy": 0.21200261861085892, "num_tokens": 77819725.0, "step": 44865 }, { "entropy": 5.451242351531983, "epoch": 3.49103287298191, "grad_norm": 1.1640625, "learning_rate": 0.00038089801642755746, "loss": 4.9019, "mean_token_accuracy": 0.21296709775924683, "num_tokens": 77828306.0, "step": 44870 }, { "entropy": 5.330370855331421, "epoch": 3.4914219023536277, "grad_norm": 1.1796875, "learning_rate": 0.00038087356172306514, "loss": 4.8748, "mean_token_accuracy": 0.21634988933801652, "num_tokens": 77836273.0, "step": 44875 }, { "entropy": 5.367626523971557, "epoch": 3.4918109317253454, "grad_norm": 1.078125, "learning_rate": 0.00038084910541211, "loss": 4.9255, "mean_token_accuracy": 0.20553493052721022, "num_tokens": 77846032.0, "step": 44880 }, { "entropy": 5.464908933639526, "epoch": 3.4921999610970627, "grad_norm": 1.1015625, "learning_rate": 0.00038082464749506314, "loss": 5.0436, "mean_token_accuracy": 0.20175820142030715, "num_tokens": 77854943.0, "step": 44885 }, { "entropy": 5.327736282348633, "epoch": 3.4925889904687804, "grad_norm": 1.171875, "learning_rate": 0.00038080018797229576, "loss": 4.8838, "mean_token_accuracy": 0.2106252208352089, "num_tokens": 77864058.0, "step": 44890 }, { "entropy": 5.3849998950958256, "epoch": 3.492978019840498, "grad_norm": 1.1875, "learning_rate": 0.0003807757268441789, "loss": 4.8083, "mean_token_accuracy": 0.20872959792613982, "num_tokens": 77872661.0, "step": 44895 }, { "entropy": 5.457427310943603, "epoch": 3.4933670492122157, "grad_norm": 1.078125, "learning_rate": 0.00038075126411108367, "loss": 4.8898, "mean_token_accuracy": 0.20960034877061845, "num_tokens": 77882141.0, "step": 44900 }, { "entropy": 5.411701202392578, "epoch": 3.493756078583933, "grad_norm": 1.1171875, "learning_rate": 0.00038072679977338143, "loss": 4.9352, "mean_token_accuracy": 0.20882305949926377, "num_tokens": 77891131.0, "step": 44905 }, { "entropy": 5.324038028717041, "epoch": 3.4941451079556507, "grad_norm": 1.1640625, "learning_rate": 0.00038070233383144324, "loss": 4.8213, "mean_token_accuracy": 0.20613412111997603, "num_tokens": 77899444.0, "step": 44910 }, { "entropy": 5.345835208892822, "epoch": 3.4945341373273684, "grad_norm": 1.1015625, "learning_rate": 0.0003806778662856404, "loss": 4.8748, "mean_token_accuracy": 0.20726423859596252, "num_tokens": 77907909.0, "step": 44915 }, { "entropy": 5.33070216178894, "epoch": 3.4949231666990856, "grad_norm": 1.1484375, "learning_rate": 0.0003806533971363441, "loss": 4.8261, "mean_token_accuracy": 0.2166428104043007, "num_tokens": 77915559.0, "step": 44920 }, { "entropy": 5.29870719909668, "epoch": 3.4953121960708033, "grad_norm": 1.28125, "learning_rate": 0.0003806289263839257, "loss": 4.7677, "mean_token_accuracy": 0.22023807018995284, "num_tokens": 77924692.0, "step": 44925 }, { "entropy": 5.3765613555908205, "epoch": 3.495701225442521, "grad_norm": 1.0546875, "learning_rate": 0.0003806044540287564, "loss": 4.9085, "mean_token_accuracy": 0.21011395007371902, "num_tokens": 77933306.0, "step": 44930 }, { "entropy": 5.323753833770752, "epoch": 3.4960902548142383, "grad_norm": 1.2109375, "learning_rate": 0.00038057998007120776, "loss": 4.8151, "mean_token_accuracy": 0.21106274724006652, "num_tokens": 77941537.0, "step": 44935 }, { "entropy": 5.36200213432312, "epoch": 3.496479284185956, "grad_norm": 1.1171875, "learning_rate": 0.00038055550451165086, "loss": 4.9358, "mean_token_accuracy": 0.20609404742717743, "num_tokens": 77950706.0, "step": 44940 }, { "entropy": 5.503410005569458, "epoch": 3.4968683135576737, "grad_norm": 1.0625, "learning_rate": 0.0003805310273504572, "loss": 4.9852, "mean_token_accuracy": 0.2002805605530739, "num_tokens": 77959711.0, "step": 44945 }, { "entropy": 5.485320281982422, "epoch": 3.497257342929391, "grad_norm": 1.234375, "learning_rate": 0.0003805065485879982, "loss": 4.9928, "mean_token_accuracy": 0.19864141643047334, "num_tokens": 77968534.0, "step": 44950 }, { "entropy": 5.369960832595825, "epoch": 3.4976463723011086, "grad_norm": 1.15625, "learning_rate": 0.00038048206822464514, "loss": 4.8821, "mean_token_accuracy": 0.21188917607069016, "num_tokens": 77976752.0, "step": 44955 }, { "entropy": 5.41899676322937, "epoch": 3.4980354016728263, "grad_norm": 1.1875, "learning_rate": 0.00038045758626076965, "loss": 4.8974, "mean_token_accuracy": 0.21283506751060485, "num_tokens": 77985310.0, "step": 44960 }, { "entropy": 5.440156698226929, "epoch": 3.498424431044544, "grad_norm": 1.1484375, "learning_rate": 0.0003804331026967432, "loss": 4.8367, "mean_token_accuracy": 0.2186812564730644, "num_tokens": 77994096.0, "step": 44965 }, { "entropy": 5.403603887557983, "epoch": 3.4988134604162613, "grad_norm": 1.078125, "learning_rate": 0.0003804086175329372, "loss": 4.8703, "mean_token_accuracy": 0.20670704841613768, "num_tokens": 78003341.0, "step": 44970 }, { "entropy": 5.435726833343506, "epoch": 3.499202489787979, "grad_norm": 1.265625, "learning_rate": 0.0003803841307697232, "loss": 4.9366, "mean_token_accuracy": 0.20646716356277467, "num_tokens": 78012102.0, "step": 44975 }, { "entropy": 5.3952288150787355, "epoch": 3.4995915191596967, "grad_norm": 1.09375, "learning_rate": 0.00038035964240747274, "loss": 4.8718, "mean_token_accuracy": 0.2115003690123558, "num_tokens": 78020338.0, "step": 44980 }, { "entropy": 5.389092302322387, "epoch": 3.499980548531414, "grad_norm": 1.1953125, "learning_rate": 0.0003803351524465574, "loss": 4.9125, "mean_token_accuracy": 0.20957560390233992, "num_tokens": 78027762.0, "step": 44985 }, { "entropy": 5.438582515716552, "epoch": 3.5003695779031316, "grad_norm": 1.109375, "learning_rate": 0.00038031066088734883, "loss": 4.9647, "mean_token_accuracy": 0.20572825372219086, "num_tokens": 78037186.0, "step": 44990 }, { "entropy": 5.387633752822876, "epoch": 3.5007586072748493, "grad_norm": 1.1171875, "learning_rate": 0.0003802861677302185, "loss": 4.8957, "mean_token_accuracy": 0.2114165022969246, "num_tokens": 78046214.0, "step": 44995 }, { "entropy": 5.365544176101684, "epoch": 3.501147636646567, "grad_norm": 1.109375, "learning_rate": 0.00038026167297553826, "loss": 4.8859, "mean_token_accuracy": 0.2094174638390541, "num_tokens": 78054411.0, "step": 45000 }, { "epoch": 3.501147636646567, "eval_entropy": 5.134741972867288, "eval_loss": 5.003249168395996, "eval_mean_token_accuracy": 0.213059131343624, "eval_num_tokens": 78054411.0, "eval_runtime": 28.5259, "eval_samples_per_second": 1456.85, "eval_steps_per_second": 182.115, "step": 45000 }, { "entropy": 5.361317920684814, "epoch": 3.5015366660182843, "grad_norm": 1.1015625, "learning_rate": 0.00038023717662367956, "loss": 4.9076, "mean_token_accuracy": 0.20549869686365127, "num_tokens": 78063346.0, "step": 45005 }, { "entropy": 5.350410652160645, "epoch": 3.501925695390002, "grad_norm": 1.109375, "learning_rate": 0.0003802126786750143, "loss": 4.8329, "mean_token_accuracy": 0.20535302758216858, "num_tokens": 78072018.0, "step": 45010 }, { "entropy": 5.411782693862915, "epoch": 3.5023147247617192, "grad_norm": 1.125, "learning_rate": 0.00038018817912991413, "loss": 4.94, "mean_token_accuracy": 0.20410131067037582, "num_tokens": 78080161.0, "step": 45015 }, { "entropy": 5.406914710998535, "epoch": 3.502703754133437, "grad_norm": 1.15625, "learning_rate": 0.00038016367798875074, "loss": 4.8483, "mean_token_accuracy": 0.21136441826820374, "num_tokens": 78089543.0, "step": 45020 }, { "entropy": 5.426284646987915, "epoch": 3.5030927835051546, "grad_norm": 1.109375, "learning_rate": 0.0003801391752518959, "loss": 4.94, "mean_token_accuracy": 0.2026752144098282, "num_tokens": 78098221.0, "step": 45025 }, { "entropy": 5.3190408706665036, "epoch": 3.5034818128768723, "grad_norm": 1.328125, "learning_rate": 0.00038011467091972134, "loss": 4.7997, "mean_token_accuracy": 0.212889364361763, "num_tokens": 78106775.0, "step": 45030 }, { "entropy": 5.36604323387146, "epoch": 3.50387084224859, "grad_norm": 1.203125, "learning_rate": 0.0003800901649925991, "loss": 4.8707, "mean_token_accuracy": 0.2158042922616005, "num_tokens": 78115096.0, "step": 45035 }, { "entropy": 5.326368618011474, "epoch": 3.5042598716203073, "grad_norm": 1.09375, "learning_rate": 0.00038006565747090076, "loss": 4.7968, "mean_token_accuracy": 0.21513827443122863, "num_tokens": 78123739.0, "step": 45040 }, { "entropy": 5.436754608154297, "epoch": 3.504648900992025, "grad_norm": 1.2109375, "learning_rate": 0.00038004114835499833, "loss": 4.9488, "mean_token_accuracy": 0.20664715617895127, "num_tokens": 78132765.0, "step": 45045 }, { "entropy": 5.416302967071533, "epoch": 3.5050379303637422, "grad_norm": 1.1953125, "learning_rate": 0.00038001663764526374, "loss": 4.8779, "mean_token_accuracy": 0.20784488320350647, "num_tokens": 78141152.0, "step": 45050 }, { "entropy": 5.466329336166382, "epoch": 3.50542695973546, "grad_norm": 1.171875, "learning_rate": 0.00037999212534206876, "loss": 4.8987, "mean_token_accuracy": 0.20754835307598113, "num_tokens": 78150396.0, "step": 45055 }, { "entropy": 5.3058679580688475, "epoch": 3.5058159891071776, "grad_norm": 1.1328125, "learning_rate": 0.0003799676114457853, "loss": 4.7979, "mean_token_accuracy": 0.2152017593383789, "num_tokens": 78158678.0, "step": 45060 }, { "entropy": 5.398160123825074, "epoch": 3.5062050184788953, "grad_norm": 1.1484375, "learning_rate": 0.00037994309595678553, "loss": 4.9782, "mean_token_accuracy": 0.1999985620379448, "num_tokens": 78166140.0, "step": 45065 }, { "entropy": 5.446952629089355, "epoch": 3.5065940478506126, "grad_norm": 1.21875, "learning_rate": 0.0003799185788754413, "loss": 4.9546, "mean_token_accuracy": 0.2083387091755867, "num_tokens": 78174321.0, "step": 45070 }, { "entropy": 5.415827846527099, "epoch": 3.5069830772223303, "grad_norm": 1.2421875, "learning_rate": 0.0003798940602021247, "loss": 4.8981, "mean_token_accuracy": 0.2054516300559044, "num_tokens": 78183437.0, "step": 45075 }, { "entropy": 5.355153608322143, "epoch": 3.507372106594048, "grad_norm": 1.2265625, "learning_rate": 0.0003798695399372076, "loss": 4.8415, "mean_token_accuracy": 0.21385342478752137, "num_tokens": 78191619.0, "step": 45080 }, { "entropy": 5.291917896270752, "epoch": 3.507761135965765, "grad_norm": 1.078125, "learning_rate": 0.0003798450180810621, "loss": 4.8022, "mean_token_accuracy": 0.21129710525274276, "num_tokens": 78200178.0, "step": 45085 }, { "entropy": 5.355296182632446, "epoch": 3.508150165337483, "grad_norm": 1.2265625, "learning_rate": 0.00037982049463406044, "loss": 4.8345, "mean_token_accuracy": 0.21269507855176925, "num_tokens": 78209036.0, "step": 45090 }, { "entropy": 5.374589586257935, "epoch": 3.5085391947092006, "grad_norm": 1.1640625, "learning_rate": 0.0003797959695965745, "loss": 4.8886, "mean_token_accuracy": 0.2091663047671318, "num_tokens": 78218668.0, "step": 45095 }, { "entropy": 5.407313680648803, "epoch": 3.5089282240809183, "grad_norm": 1.140625, "learning_rate": 0.00037977144296897665, "loss": 4.8269, "mean_token_accuracy": 0.2064720943570137, "num_tokens": 78226590.0, "step": 45100 }, { "entropy": 5.381232595443725, "epoch": 3.5093172534526356, "grad_norm": 1.1328125, "learning_rate": 0.0003797469147516388, "loss": 4.9012, "mean_token_accuracy": 0.2075979307293892, "num_tokens": 78235714.0, "step": 45105 }, { "entropy": 5.317760705947876, "epoch": 3.5097062828243533, "grad_norm": 1.140625, "learning_rate": 0.00037972238494493333, "loss": 4.7758, "mean_token_accuracy": 0.2148730233311653, "num_tokens": 78244428.0, "step": 45110 }, { "entropy": 5.197449827194214, "epoch": 3.510095312196071, "grad_norm": 1.0859375, "learning_rate": 0.0003796978535492323, "loss": 4.6999, "mean_token_accuracy": 0.22743071168661116, "num_tokens": 78253594.0, "step": 45115 }, { "entropy": 5.355169773101807, "epoch": 3.510484341567788, "grad_norm": 1.1484375, "learning_rate": 0.000379673320564908, "loss": 4.8077, "mean_token_accuracy": 0.21441177874803544, "num_tokens": 78262483.0, "step": 45120 }, { "entropy": 5.456123733520508, "epoch": 3.510873370939506, "grad_norm": 1.0859375, "learning_rate": 0.00037964878599233264, "loss": 4.9337, "mean_token_accuracy": 0.20043265521526338, "num_tokens": 78271659.0, "step": 45125 }, { "entropy": 5.290518712997437, "epoch": 3.5112624003112236, "grad_norm": 1.09375, "learning_rate": 0.00037962424983187856, "loss": 4.8064, "mean_token_accuracy": 0.2148437276482582, "num_tokens": 78280211.0, "step": 45130 }, { "entropy": 5.262149953842163, "epoch": 3.5116514296829413, "grad_norm": 1.3671875, "learning_rate": 0.000379599712083918, "loss": 4.8263, "mean_token_accuracy": 0.21430227011442185, "num_tokens": 78288834.0, "step": 45135 }, { "entropy": 5.315751218795777, "epoch": 3.5120404590546586, "grad_norm": 1.1953125, "learning_rate": 0.0003795751727488233, "loss": 4.7394, "mean_token_accuracy": 0.2179761603474617, "num_tokens": 78298058.0, "step": 45140 }, { "entropy": 5.415918922424316, "epoch": 3.5124294884263763, "grad_norm": 1.015625, "learning_rate": 0.00037955063182696676, "loss": 4.8427, "mean_token_accuracy": 0.21158117651939393, "num_tokens": 78307074.0, "step": 45145 }, { "entropy": 5.352178859710693, "epoch": 3.5128185177980935, "grad_norm": 1.1015625, "learning_rate": 0.00037952608931872086, "loss": 4.8638, "mean_token_accuracy": 0.21605750322341918, "num_tokens": 78315760.0, "step": 45150 }, { "entropy": 5.349720859527588, "epoch": 3.513207547169811, "grad_norm": 1.1953125, "learning_rate": 0.00037950154522445784, "loss": 4.8109, "mean_token_accuracy": 0.21984634846448897, "num_tokens": 78323273.0, "step": 45155 }, { "entropy": 5.4327592849731445, "epoch": 3.513596576541529, "grad_norm": 1.1796875, "learning_rate": 0.0003794769995445502, "loss": 4.9341, "mean_token_accuracy": 0.20415549874305725, "num_tokens": 78332561.0, "step": 45160 }, { "entropy": 5.417402553558349, "epoch": 3.5139856059132466, "grad_norm": 1.15625, "learning_rate": 0.0003794524522793705, "loss": 4.8886, "mean_token_accuracy": 0.20726952701807022, "num_tokens": 78340988.0, "step": 45165 }, { "entropy": 5.300640201568603, "epoch": 3.514374635284964, "grad_norm": 1.1796875, "learning_rate": 0.00037942790342929106, "loss": 4.7554, "mean_token_accuracy": 0.22118674218654633, "num_tokens": 78348910.0, "step": 45170 }, { "entropy": 5.383945369720459, "epoch": 3.5147636646566816, "grad_norm": 1.140625, "learning_rate": 0.00037940335299468437, "loss": 4.8671, "mean_token_accuracy": 0.20781001448631287, "num_tokens": 78357354.0, "step": 45175 }, { "entropy": 5.393444442749024, "epoch": 3.5151526940283992, "grad_norm": 1.140625, "learning_rate": 0.00037937880097592294, "loss": 4.9783, "mean_token_accuracy": 0.19870034158229827, "num_tokens": 78366974.0, "step": 45180 }, { "entropy": 5.388302278518677, "epoch": 3.5155417234001165, "grad_norm": 1.1796875, "learning_rate": 0.00037935424737337936, "loss": 4.8477, "mean_token_accuracy": 0.21021169573068618, "num_tokens": 78375384.0, "step": 45185 }, { "entropy": 5.285903263092041, "epoch": 3.515930752771834, "grad_norm": 1.1640625, "learning_rate": 0.00037932969218742616, "loss": 4.7941, "mean_token_accuracy": 0.21153487414121627, "num_tokens": 78383450.0, "step": 45190 }, { "entropy": 5.276757526397705, "epoch": 3.516319782143552, "grad_norm": 1.140625, "learning_rate": 0.00037930513541843593, "loss": 4.6774, "mean_token_accuracy": 0.2282014861702919, "num_tokens": 78392676.0, "step": 45195 }, { "entropy": 5.378009271621704, "epoch": 3.5167088115152696, "grad_norm": 1.1328125, "learning_rate": 0.00037928057706678136, "loss": 4.8702, "mean_token_accuracy": 0.20442668944597245, "num_tokens": 78401193.0, "step": 45200 }, { "entropy": 5.378287267684937, "epoch": 3.517097840886987, "grad_norm": 1.1015625, "learning_rate": 0.00037925601713283504, "loss": 4.8243, "mean_token_accuracy": 0.21854268014431, "num_tokens": 78409399.0, "step": 45205 }, { "entropy": 5.346860408782959, "epoch": 3.5174868702587045, "grad_norm": 1.1640625, "learning_rate": 0.0003792314556169695, "loss": 4.8466, "mean_token_accuracy": 0.2080584019422531, "num_tokens": 78417973.0, "step": 45210 }, { "entropy": 5.302037000656128, "epoch": 3.5178758996304222, "grad_norm": 1.1171875, "learning_rate": 0.0003792068925195576, "loss": 4.921, "mean_token_accuracy": 0.20893283039331437, "num_tokens": 78426638.0, "step": 45215 }, { "entropy": 5.36264967918396, "epoch": 3.5182649290021395, "grad_norm": 1.3046875, "learning_rate": 0.0003791823278409719, "loss": 4.8964, "mean_token_accuracy": 0.20582932829856873, "num_tokens": 78434394.0, "step": 45220 }, { "entropy": 5.325146341323853, "epoch": 3.518653958373857, "grad_norm": 1.109375, "learning_rate": 0.00037915776158158515, "loss": 4.853, "mean_token_accuracy": 0.20980437994003295, "num_tokens": 78443204.0, "step": 45225 }, { "entropy": 5.389709758758545, "epoch": 3.519042987745575, "grad_norm": 1.2578125, "learning_rate": 0.0003791331937417703, "loss": 4.8163, "mean_token_accuracy": 0.217941777408123, "num_tokens": 78451612.0, "step": 45230 }, { "entropy": 5.3801624298095705, "epoch": 3.5194320171172926, "grad_norm": 1.1328125, "learning_rate": 0.00037910862432189986, "loss": 4.8982, "mean_token_accuracy": 0.20434323102235794, "num_tokens": 78459456.0, "step": 45235 }, { "entropy": 5.308131885528565, "epoch": 3.51982104648901, "grad_norm": 1.171875, "learning_rate": 0.0003790840533223467, "loss": 4.8405, "mean_token_accuracy": 0.20770837962627411, "num_tokens": 78468587.0, "step": 45240 }, { "entropy": 5.363768196105957, "epoch": 3.5202100758607275, "grad_norm": 1.109375, "learning_rate": 0.00037905948074348387, "loss": 4.8504, "mean_token_accuracy": 0.2083433210849762, "num_tokens": 78476229.0, "step": 45245 }, { "entropy": 5.412431812286377, "epoch": 3.520599105232445, "grad_norm": 1.09375, "learning_rate": 0.000379034906585684, "loss": 4.9896, "mean_token_accuracy": 0.2004853218793869, "num_tokens": 78484996.0, "step": 45250 }, { "entropy": 5.424630880355835, "epoch": 3.5209881346041625, "grad_norm": 1.1796875, "learning_rate": 0.00037901033084932, "loss": 4.9842, "mean_token_accuracy": 0.19791247248649596, "num_tokens": 78493597.0, "step": 45255 }, { "entropy": 5.366647672653198, "epoch": 3.52137716397588, "grad_norm": 1.125, "learning_rate": 0.0003789857535347648, "loss": 4.8113, "mean_token_accuracy": 0.2119579493999481, "num_tokens": 78502269.0, "step": 45260 }, { "entropy": 5.312234210968017, "epoch": 3.521766193347598, "grad_norm": 1.171875, "learning_rate": 0.0003789611746423912, "loss": 4.8327, "mean_token_accuracy": 0.21394023001194, "num_tokens": 78510676.0, "step": 45265 }, { "entropy": 5.3032890319824215, "epoch": 3.5221552227193156, "grad_norm": 1.1484375, "learning_rate": 0.00037893659417257233, "loss": 4.8365, "mean_token_accuracy": 0.21103252917528154, "num_tokens": 78518879.0, "step": 45270 }, { "entropy": 5.381455612182617, "epoch": 3.522544252091033, "grad_norm": 1.078125, "learning_rate": 0.00037891201212568107, "loss": 4.8751, "mean_token_accuracy": 0.21435323655605315, "num_tokens": 78527704.0, "step": 45275 }, { "entropy": 5.462736463546753, "epoch": 3.5229332814627505, "grad_norm": 1.21875, "learning_rate": 0.00037888742850209037, "loss": 4.8357, "mean_token_accuracy": 0.21086146980524062, "num_tokens": 78534893.0, "step": 45280 }, { "entropy": 5.350700855255127, "epoch": 3.523322310834468, "grad_norm": 1.109375, "learning_rate": 0.0003788628433021733, "loss": 4.8492, "mean_token_accuracy": 0.21139488369226456, "num_tokens": 78543269.0, "step": 45285 }, { "entropy": 5.311590385437012, "epoch": 3.5237113402061855, "grad_norm": 1.1640625, "learning_rate": 0.000378838256526303, "loss": 4.8144, "mean_token_accuracy": 0.21182577461004257, "num_tokens": 78551508.0, "step": 45290 }, { "entropy": 5.34890718460083, "epoch": 3.524100369577903, "grad_norm": 1.1484375, "learning_rate": 0.0003788136681748523, "loss": 4.8379, "mean_token_accuracy": 0.21465999335050584, "num_tokens": 78560466.0, "step": 45295 }, { "entropy": 5.466533756256103, "epoch": 3.524489398949621, "grad_norm": 1.1796875, "learning_rate": 0.0003787890782481945, "loss": 4.8973, "mean_token_accuracy": 0.20386092513799667, "num_tokens": 78569174.0, "step": 45300 }, { "entropy": 5.338572931289673, "epoch": 3.524878428321338, "grad_norm": 1.1328125, "learning_rate": 0.0003787644867467026, "loss": 4.9301, "mean_token_accuracy": 0.2042231887578964, "num_tokens": 78577955.0, "step": 45305 }, { "entropy": 5.2951642036437985, "epoch": 3.525267457693056, "grad_norm": 1.1640625, "learning_rate": 0.00037873989367074977, "loss": 4.7524, "mean_token_accuracy": 0.2157907873392105, "num_tokens": 78586570.0, "step": 45310 }, { "entropy": 5.387935304641724, "epoch": 3.5256564870647735, "grad_norm": 1.1015625, "learning_rate": 0.00037871529902070924, "loss": 4.8478, "mean_token_accuracy": 0.21014175862073897, "num_tokens": 78594714.0, "step": 45315 }, { "entropy": 5.408081436157227, "epoch": 3.526045516436491, "grad_norm": 1.109375, "learning_rate": 0.00037869070279695404, "loss": 5.0113, "mean_token_accuracy": 0.1987893134355545, "num_tokens": 78604010.0, "step": 45320 }, { "entropy": 5.369876337051392, "epoch": 3.5264345458082085, "grad_norm": 1.171875, "learning_rate": 0.00037866610499985755, "loss": 4.7933, "mean_token_accuracy": 0.21567542254924774, "num_tokens": 78611948.0, "step": 45325 }, { "entropy": 5.3476968765258786, "epoch": 3.526823575179926, "grad_norm": 1.078125, "learning_rate": 0.0003786415056297929, "loss": 4.8758, "mean_token_accuracy": 0.21306609958410264, "num_tokens": 78621047.0, "step": 45330 }, { "entropy": 5.311571073532105, "epoch": 3.527212604551644, "grad_norm": 1.125, "learning_rate": 0.0003786169046871333, "loss": 4.8997, "mean_token_accuracy": 0.2105301395058632, "num_tokens": 78629739.0, "step": 45335 }, { "entropy": 5.32279634475708, "epoch": 3.527601633923361, "grad_norm": 1.15625, "learning_rate": 0.0003785923021722521, "loss": 4.8086, "mean_token_accuracy": 0.21228309571743012, "num_tokens": 78638527.0, "step": 45340 }, { "entropy": 5.3915722370147705, "epoch": 3.527990663295079, "grad_norm": 1.1171875, "learning_rate": 0.00037856769808552267, "loss": 4.9443, "mean_token_accuracy": 0.20455940663814545, "num_tokens": 78648141.0, "step": 45345 }, { "entropy": 5.386763286590576, "epoch": 3.528379692666796, "grad_norm": 1.078125, "learning_rate": 0.0003785430924273182, "loss": 4.8775, "mean_token_accuracy": 0.2176896646618843, "num_tokens": 78657164.0, "step": 45350 }, { "entropy": 5.333935213088989, "epoch": 3.5287687220385138, "grad_norm": 1.078125, "learning_rate": 0.00037851848519801214, "loss": 4.7848, "mean_token_accuracy": 0.21336877048015596, "num_tokens": 78665267.0, "step": 45355 }, { "entropy": 5.284735155105591, "epoch": 3.5291577514102315, "grad_norm": 1.15625, "learning_rate": 0.0003784938763979778, "loss": 4.8789, "mean_token_accuracy": 0.21539074182510376, "num_tokens": 78673423.0, "step": 45360 }, { "entropy": 5.3493256092071535, "epoch": 3.529546780781949, "grad_norm": 1.0625, "learning_rate": 0.0003784692660275886, "loss": 4.8792, "mean_token_accuracy": 0.20247115194797516, "num_tokens": 78682593.0, "step": 45365 }, { "entropy": 5.304942083358765, "epoch": 3.529935810153667, "grad_norm": 1.109375, "learning_rate": 0.0003784446540872181, "loss": 4.8245, "mean_token_accuracy": 0.20344803631305694, "num_tokens": 78690885.0, "step": 45370 }, { "entropy": 5.400669908523559, "epoch": 3.530324839525384, "grad_norm": 1.1328125, "learning_rate": 0.00037842004057723957, "loss": 4.8787, "mean_token_accuracy": 0.21496908813714982, "num_tokens": 78699970.0, "step": 45375 }, { "entropy": 5.413967084884644, "epoch": 3.530713868897102, "grad_norm": 1.078125, "learning_rate": 0.0003783954254980265, "loss": 4.8617, "mean_token_accuracy": 0.2125125288963318, "num_tokens": 78709002.0, "step": 45380 }, { "entropy": 5.3131176948547365, "epoch": 3.531102898268819, "grad_norm": 1.1875, "learning_rate": 0.0003783708088499524, "loss": 4.8419, "mean_token_accuracy": 0.215519018471241, "num_tokens": 78718062.0, "step": 45385 }, { "entropy": 5.285049819946289, "epoch": 3.5314919276405368, "grad_norm": 1.1640625, "learning_rate": 0.00037834619063339085, "loss": 4.8056, "mean_token_accuracy": 0.21343080848455429, "num_tokens": 78726558.0, "step": 45390 }, { "entropy": 5.3680634021759035, "epoch": 3.5318809570122545, "grad_norm": 1.1875, "learning_rate": 0.0003783215708487153, "loss": 4.7946, "mean_token_accuracy": 0.21887348592281342, "num_tokens": 78734939.0, "step": 45395 }, { "entropy": 5.384794902801514, "epoch": 3.532269986383972, "grad_norm": 1.1171875, "learning_rate": 0.0003782969494962994, "loss": 4.9207, "mean_token_accuracy": 0.20882296860218047, "num_tokens": 78744418.0, "step": 45400 }, { "entropy": 5.331861305236816, "epoch": 3.5326590157556894, "grad_norm": 1.1328125, "learning_rate": 0.0003782723265765167, "loss": 4.8576, "mean_token_accuracy": 0.21029502600431443, "num_tokens": 78753021.0, "step": 45405 }, { "entropy": 5.334423398971557, "epoch": 3.533048045127407, "grad_norm": 1.1171875, "learning_rate": 0.00037824770208974085, "loss": 4.7432, "mean_token_accuracy": 0.21413806527853013, "num_tokens": 78761107.0, "step": 45410 }, { "entropy": 5.288662052154541, "epoch": 3.533437074499125, "grad_norm": 1.1484375, "learning_rate": 0.0003782230760363454, "loss": 4.838, "mean_token_accuracy": 0.2075060024857521, "num_tokens": 78770143.0, "step": 45415 }, { "entropy": 5.335245847702026, "epoch": 3.533826103870842, "grad_norm": 1.2109375, "learning_rate": 0.00037819844841670416, "loss": 4.8185, "mean_token_accuracy": 0.2041589230298996, "num_tokens": 78778458.0, "step": 45420 }, { "entropy": 5.360023403167725, "epoch": 3.5342151332425598, "grad_norm": 1.140625, "learning_rate": 0.0003781738192311906, "loss": 4.9204, "mean_token_accuracy": 0.21567057371139525, "num_tokens": 78787510.0, "step": 45425 }, { "entropy": 5.413481521606445, "epoch": 3.5346041626142775, "grad_norm": 1.2109375, "learning_rate": 0.00037814918848017855, "loss": 4.956, "mean_token_accuracy": 0.20616626590490342, "num_tokens": 78796331.0, "step": 45430 }, { "entropy": 5.383185815811157, "epoch": 3.534993191985995, "grad_norm": 1.140625, "learning_rate": 0.0003781245561640418, "loss": 4.9638, "mean_token_accuracy": 0.2106638789176941, "num_tokens": 78805606.0, "step": 45435 }, { "entropy": 5.45123987197876, "epoch": 3.5353822213577124, "grad_norm": 1.109375, "learning_rate": 0.0003780999222831541, "loss": 4.8824, "mean_token_accuracy": 0.20432367771863938, "num_tokens": 78814435.0, "step": 45440 }, { "entropy": 5.47799825668335, "epoch": 3.53577125072943, "grad_norm": 1.25, "learning_rate": 0.0003780752868378892, "loss": 4.9765, "mean_token_accuracy": 0.20623561143875122, "num_tokens": 78822361.0, "step": 45445 }, { "entropy": 5.3703714370727536, "epoch": 3.536160280101148, "grad_norm": 1.09375, "learning_rate": 0.00037805064982862076, "loss": 4.8776, "mean_token_accuracy": 0.211610908806324, "num_tokens": 78831000.0, "step": 45450 }, { "entropy": 5.425612115859986, "epoch": 3.536549309472865, "grad_norm": 1.0859375, "learning_rate": 0.0003780260112557228, "loss": 4.9479, "mean_token_accuracy": 0.20029371082782746, "num_tokens": 78840386.0, "step": 45455 }, { "entropy": 5.3691956996917725, "epoch": 3.5369383388445828, "grad_norm": 1.8828125, "learning_rate": 0.00037800137111956904, "loss": 4.9294, "mean_token_accuracy": 0.20000745356082916, "num_tokens": 78849399.0, "step": 45460 }, { "entropy": 5.372079849243164, "epoch": 3.5373273682163004, "grad_norm": 1.171875, "learning_rate": 0.00037797672942053344, "loss": 4.8001, "mean_token_accuracy": 0.21666875034570693, "num_tokens": 78857116.0, "step": 45465 }, { "entropy": 5.3707356452941895, "epoch": 3.537716397588018, "grad_norm": 1.21875, "learning_rate": 0.00037795208615898997, "loss": 4.9351, "mean_token_accuracy": 0.20827598124742508, "num_tokens": 78865733.0, "step": 45470 }, { "entropy": 5.339529609680175, "epoch": 3.5381054269597354, "grad_norm": 1.171875, "learning_rate": 0.0003779274413353124, "loss": 4.8821, "mean_token_accuracy": 0.20467738062143326, "num_tokens": 78873870.0, "step": 45475 }, { "entropy": 5.412511205673217, "epoch": 3.538494456331453, "grad_norm": 1.109375, "learning_rate": 0.00037790279494987475, "loss": 4.9235, "mean_token_accuracy": 0.21310148239135743, "num_tokens": 78883314.0, "step": 45480 }, { "entropy": 5.348595190048218, "epoch": 3.5388834857031704, "grad_norm": 1.1796875, "learning_rate": 0.00037787814700305096, "loss": 4.8121, "mean_token_accuracy": 0.21185794472694397, "num_tokens": 78892161.0, "step": 45485 }, { "entropy": 5.317692232131958, "epoch": 3.539272515074888, "grad_norm": 1.1015625, "learning_rate": 0.000377853497495215, "loss": 4.763, "mean_token_accuracy": 0.2190377339720726, "num_tokens": 78900432.0, "step": 45490 }, { "entropy": 5.334459733963013, "epoch": 3.5396615444466057, "grad_norm": 1.0625, "learning_rate": 0.00037782884642674085, "loss": 4.8476, "mean_token_accuracy": 0.2072419673204422, "num_tokens": 78910091.0, "step": 45495 }, { "entropy": 5.379205274581909, "epoch": 3.5400505738183234, "grad_norm": 1.1796875, "learning_rate": 0.0003778041937980028, "loss": 4.9303, "mean_token_accuracy": 0.20614203959703445, "num_tokens": 78918863.0, "step": 45500 }, { "entropy": 5.366581916809082, "epoch": 3.5404396031900407, "grad_norm": 1.15625, "learning_rate": 0.00037777953960937467, "loss": 4.8578, "mean_token_accuracy": 0.20734538733959199, "num_tokens": 78927380.0, "step": 45505 }, { "entropy": 5.357504177093506, "epoch": 3.5408286325617584, "grad_norm": 1.1328125, "learning_rate": 0.00037775488386123057, "loss": 4.8215, "mean_token_accuracy": 0.21592286974191666, "num_tokens": 78935847.0, "step": 45510 }, { "entropy": 5.366195440292358, "epoch": 3.541217661933476, "grad_norm": 1.1875, "learning_rate": 0.00037773022655394466, "loss": 4.912, "mean_token_accuracy": 0.21204430609941483, "num_tokens": 78943941.0, "step": 45515 }, { "entropy": 5.4155675888061525, "epoch": 3.5416066913051933, "grad_norm": 1.171875, "learning_rate": 0.00037770556768789115, "loss": 4.905, "mean_token_accuracy": 0.20575576275587082, "num_tokens": 78952966.0, "step": 45520 }, { "entropy": 5.283182859420776, "epoch": 3.541995720676911, "grad_norm": 1.203125, "learning_rate": 0.00037768090726344414, "loss": 4.7407, "mean_token_accuracy": 0.21573355197906494, "num_tokens": 78961502.0, "step": 45525 }, { "entropy": 5.375920963287354, "epoch": 3.5423847500486287, "grad_norm": 1.1796875, "learning_rate": 0.0003776562452809777, "loss": 4.8559, "mean_token_accuracy": 0.21139290034770966, "num_tokens": 78969995.0, "step": 45530 }, { "entropy": 5.4716754913330075, "epoch": 3.5427737794203464, "grad_norm": 1.140625, "learning_rate": 0.00037763158174086616, "loss": 5.0376, "mean_token_accuracy": 0.19798943549394607, "num_tokens": 78978385.0, "step": 45535 }, { "entropy": 5.367848062515259, "epoch": 3.5431628087920637, "grad_norm": 1.09375, "learning_rate": 0.00037760691664348367, "loss": 4.8174, "mean_token_accuracy": 0.20784605741500856, "num_tokens": 78986985.0, "step": 45540 }, { "entropy": 5.2880395412445065, "epoch": 3.5435518381637814, "grad_norm": 1.1328125, "learning_rate": 0.0003775822499892046, "loss": 4.8028, "mean_token_accuracy": 0.21552790105342864, "num_tokens": 78995466.0, "step": 45545 }, { "entropy": 5.356474494934082, "epoch": 3.543940867535499, "grad_norm": 1.171875, "learning_rate": 0.0003775575817784032, "loss": 4.9137, "mean_token_accuracy": 0.2094582661986351, "num_tokens": 79003809.0, "step": 45550 }, { "entropy": 5.3609109878540036, "epoch": 3.5443298969072163, "grad_norm": 1.1484375, "learning_rate": 0.00037753291201145375, "loss": 4.8223, "mean_token_accuracy": 0.21162704676389693, "num_tokens": 79011876.0, "step": 45555 }, { "entropy": 5.295887565612793, "epoch": 3.544718926278934, "grad_norm": 1.109375, "learning_rate": 0.0003775082406887305, "loss": 4.8163, "mean_token_accuracy": 0.216938553750515, "num_tokens": 79021379.0, "step": 45560 }, { "entropy": 5.412968921661377, "epoch": 3.5451079556506517, "grad_norm": 1.1796875, "learning_rate": 0.00037748356781060785, "loss": 4.9688, "mean_token_accuracy": 0.20165472328662873, "num_tokens": 79031006.0, "step": 45565 }, { "entropy": 5.401702260971069, "epoch": 3.5454969850223694, "grad_norm": 1.234375, "learning_rate": 0.0003774588933774602, "loss": 4.9049, "mean_token_accuracy": 0.21031848937273026, "num_tokens": 79039676.0, "step": 45570 }, { "entropy": 5.360059833526611, "epoch": 3.5458860143940867, "grad_norm": 1.1953125, "learning_rate": 0.0003774342173896619, "loss": 4.826, "mean_token_accuracy": 0.21433681696653367, "num_tokens": 79048111.0, "step": 45575 }, { "entropy": 5.369013118743896, "epoch": 3.5462750437658044, "grad_norm": 1.109375, "learning_rate": 0.00037740953984758736, "loss": 4.9274, "mean_token_accuracy": 0.20701586455106735, "num_tokens": 79057447.0, "step": 45580 }, { "entropy": 5.337816858291626, "epoch": 3.5466640731375216, "grad_norm": 1.1328125, "learning_rate": 0.0003773848607516111, "loss": 4.8723, "mean_token_accuracy": 0.21563268899917604, "num_tokens": 79066120.0, "step": 45585 }, { "entropy": 5.434275531768799, "epoch": 3.5470531025092393, "grad_norm": 1.1640625, "learning_rate": 0.0003773601801021075, "loss": 4.8429, "mean_token_accuracy": 0.2121105670928955, "num_tokens": 79074732.0, "step": 45590 }, { "entropy": 5.373475122451782, "epoch": 3.547442131880957, "grad_norm": 1.1015625, "learning_rate": 0.0003773354978994512, "loss": 4.9258, "mean_token_accuracy": 0.20615026652812957, "num_tokens": 79084914.0, "step": 45595 }, { "entropy": 5.251870346069336, "epoch": 3.5478311612526747, "grad_norm": 1.1640625, "learning_rate": 0.00037731081414401653, "loss": 4.8076, "mean_token_accuracy": 0.21933836191892625, "num_tokens": 79093467.0, "step": 45600 }, { "entropy": 5.33868145942688, "epoch": 3.548220190624392, "grad_norm": 1.1015625, "learning_rate": 0.00037728612883617806, "loss": 4.8711, "mean_token_accuracy": 0.21208764910697936, "num_tokens": 79102710.0, "step": 45605 }, { "entropy": 5.4210809707641605, "epoch": 3.5486092199961097, "grad_norm": 1.171875, "learning_rate": 0.0003772614419763104, "loss": 4.9591, "mean_token_accuracy": 0.20685671716928483, "num_tokens": 79111130.0, "step": 45610 }, { "entropy": 5.338911771774292, "epoch": 3.5489982493678274, "grad_norm": 1.1328125, "learning_rate": 0.0003772367535647882, "loss": 4.8097, "mean_token_accuracy": 0.21386290192604065, "num_tokens": 79119775.0, "step": 45615 }, { "entropy": 5.304570627212525, "epoch": 3.5493872787395446, "grad_norm": 1.1875, "learning_rate": 0.00037721206360198596, "loss": 4.8, "mean_token_accuracy": 0.21682381331920625, "num_tokens": 79128543.0, "step": 45620 }, { "entropy": 5.3001853942871096, "epoch": 3.5497763081112623, "grad_norm": 1.1171875, "learning_rate": 0.0003771873720882783, "loss": 4.8641, "mean_token_accuracy": 0.2156204730272293, "num_tokens": 79136372.0, "step": 45625 }, { "entropy": 5.363806962966919, "epoch": 3.55016533748298, "grad_norm": 1.171875, "learning_rate": 0.00037716267902403996, "loss": 4.8791, "mean_token_accuracy": 0.21082372069358826, "num_tokens": 79144638.0, "step": 45630 }, { "entropy": 5.382849597930909, "epoch": 3.5505543668546977, "grad_norm": 1.171875, "learning_rate": 0.0003771379844096456, "loss": 4.951, "mean_token_accuracy": 0.20679997354745866, "num_tokens": 79152626.0, "step": 45635 }, { "entropy": 5.445909643173218, "epoch": 3.550943396226415, "grad_norm": 1.203125, "learning_rate": 0.0003771132882454698, "loss": 4.906, "mean_token_accuracy": 0.20968775898218156, "num_tokens": 79161127.0, "step": 45640 }, { "entropy": 5.330301237106323, "epoch": 3.5513324255981327, "grad_norm": 1.2109375, "learning_rate": 0.0003770885905318874, "loss": 4.8076, "mean_token_accuracy": 0.22205820977687835, "num_tokens": 79169453.0, "step": 45645 }, { "entropy": 5.371573066711425, "epoch": 3.5517214549698504, "grad_norm": 1.140625, "learning_rate": 0.0003770638912692732, "loss": 4.8703, "mean_token_accuracy": 0.20799188911914826, "num_tokens": 79177591.0, "step": 45650 }, { "entropy": 5.351689577102661, "epoch": 3.5521104843415676, "grad_norm": 1.125, "learning_rate": 0.0003770391904580019, "loss": 4.8957, "mean_token_accuracy": 0.20742850005626678, "num_tokens": 79185987.0, "step": 45655 }, { "entropy": 5.46686577796936, "epoch": 3.5524995137132853, "grad_norm": 1.1484375, "learning_rate": 0.0003770144880984482, "loss": 4.9934, "mean_token_accuracy": 0.20019074380397797, "num_tokens": 79194005.0, "step": 45660 }, { "entropy": 5.292559862136841, "epoch": 3.552888543085003, "grad_norm": 1.09375, "learning_rate": 0.00037698978419098704, "loss": 4.7386, "mean_token_accuracy": 0.22500164061784744, "num_tokens": 79202314.0, "step": 45665 }, { "entropy": 5.363996315002441, "epoch": 3.5532775724567207, "grad_norm": 1.1171875, "learning_rate": 0.00037696507873599336, "loss": 4.9527, "mean_token_accuracy": 0.20358259826898575, "num_tokens": 79211213.0, "step": 45670 }, { "entropy": 5.313408613204956, "epoch": 3.553666601828438, "grad_norm": 1.140625, "learning_rate": 0.00037694037173384177, "loss": 4.7459, "mean_token_accuracy": 0.22371175587177278, "num_tokens": 79219489.0, "step": 45675 }, { "entropy": 5.349441289901733, "epoch": 3.5540556312001557, "grad_norm": 1.09375, "learning_rate": 0.0003769156631849074, "loss": 4.8382, "mean_token_accuracy": 0.21773654073476792, "num_tokens": 79228846.0, "step": 45680 }, { "entropy": 5.339849758148193, "epoch": 3.554444660571873, "grad_norm": 1.2421875, "learning_rate": 0.000376890953089565, "loss": 4.8765, "mean_token_accuracy": 0.21128596365451813, "num_tokens": 79236924.0, "step": 45685 }, { "entropy": 5.35886025428772, "epoch": 3.5548336899435906, "grad_norm": 1.140625, "learning_rate": 0.0003768662414481895, "loss": 4.9299, "mean_token_accuracy": 0.21177061647176743, "num_tokens": 79244649.0, "step": 45690 }, { "entropy": 5.4179017543792725, "epoch": 3.5552227193153083, "grad_norm": 1.1953125, "learning_rate": 0.00037684152826115595, "loss": 4.9461, "mean_token_accuracy": 0.21095108538866042, "num_tokens": 79252972.0, "step": 45695 }, { "entropy": 5.375231313705444, "epoch": 3.555611748687026, "grad_norm": 1.09375, "learning_rate": 0.0003768168135288394, "loss": 4.8592, "mean_token_accuracy": 0.20862558037042617, "num_tokens": 79261497.0, "step": 45700 }, { "entropy": 5.354634141921997, "epoch": 3.5560007780587437, "grad_norm": 1.1171875, "learning_rate": 0.0003767920972516147, "loss": 4.8919, "mean_token_accuracy": 0.21257970333099366, "num_tokens": 79270297.0, "step": 45705 }, { "entropy": 5.403325748443604, "epoch": 3.556389807430461, "grad_norm": 1.171875, "learning_rate": 0.00037676737942985697, "loss": 4.8968, "mean_token_accuracy": 0.20933594554662704, "num_tokens": 79278635.0, "step": 45710 }, { "entropy": 5.46719765663147, "epoch": 3.5567788368021787, "grad_norm": 1.2265625, "learning_rate": 0.00037674266006394123, "loss": 4.9233, "mean_token_accuracy": 0.20261537581682204, "num_tokens": 79287816.0, "step": 45715 }, { "entropy": 5.306892347335816, "epoch": 3.557167866173896, "grad_norm": 1.140625, "learning_rate": 0.00037671793915424254, "loss": 4.799, "mean_token_accuracy": 0.2111009478569031, "num_tokens": 79296837.0, "step": 45720 }, { "entropy": 5.4563555240631105, "epoch": 3.5575568955456136, "grad_norm": 1.09375, "learning_rate": 0.000376693216701136, "loss": 4.9797, "mean_token_accuracy": 0.2013792023062706, "num_tokens": 79306442.0, "step": 45725 }, { "entropy": 5.529389142990112, "epoch": 3.5579459249173313, "grad_norm": 1.1328125, "learning_rate": 0.0003766684927049968, "loss": 4.9993, "mean_token_accuracy": 0.20627006143331528, "num_tokens": 79316483.0, "step": 45730 }, { "entropy": 5.3456484317779545, "epoch": 3.558334954289049, "grad_norm": 1.203125, "learning_rate": 0.0003766437671662, "loss": 4.7, "mean_token_accuracy": 0.22627594023942948, "num_tokens": 79324858.0, "step": 45735 }, { "entropy": 5.339090728759766, "epoch": 3.5587239836607663, "grad_norm": 1.140625, "learning_rate": 0.0003766190400851209, "loss": 4.9266, "mean_token_accuracy": 0.21103347837924957, "num_tokens": 79333744.0, "step": 45740 }, { "entropy": 5.385576009750366, "epoch": 3.559113013032484, "grad_norm": 1.0546875, "learning_rate": 0.0003765943114621345, "loss": 4.8149, "mean_token_accuracy": 0.2129213333129883, "num_tokens": 79342589.0, "step": 45745 }, { "entropy": 5.315264940261841, "epoch": 3.5595020424042016, "grad_norm": 1.15625, "learning_rate": 0.00037656958129761626, "loss": 4.808, "mean_token_accuracy": 0.216843618452549, "num_tokens": 79350869.0, "step": 45750 }, { "entropy": 5.3487025737762455, "epoch": 3.559891071775919, "grad_norm": 1.1484375, "learning_rate": 0.00037654484959194126, "loss": 4.8775, "mean_token_accuracy": 0.21131789684295654, "num_tokens": 79359407.0, "step": 45755 }, { "entropy": 5.393037176132202, "epoch": 3.5602801011476366, "grad_norm": 1.1484375, "learning_rate": 0.00037652011634548466, "loss": 4.898, "mean_token_accuracy": 0.21466627717018127, "num_tokens": 79367564.0, "step": 45760 }, { "entropy": 5.3143572330474855, "epoch": 3.5606691305193543, "grad_norm": 1.171875, "learning_rate": 0.000376495381558622, "loss": 4.781, "mean_token_accuracy": 0.21719335168600082, "num_tokens": 79376300.0, "step": 45765 }, { "entropy": 5.402415657043457, "epoch": 3.561058159891072, "grad_norm": 1.1328125, "learning_rate": 0.0003764706452317284, "loss": 4.9138, "mean_token_accuracy": 0.21030608862638472, "num_tokens": 79385484.0, "step": 45770 }, { "entropy": 5.381895875930786, "epoch": 3.5614471892627892, "grad_norm": 1.2265625, "learning_rate": 0.00037644590736517935, "loss": 4.8724, "mean_token_accuracy": 0.215175761282444, "num_tokens": 79393971.0, "step": 45775 }, { "entropy": 5.473497343063355, "epoch": 3.561836218634507, "grad_norm": 1.171875, "learning_rate": 0.0003764211679593501, "loss": 5.0082, "mean_token_accuracy": 0.20043233931064605, "num_tokens": 79402315.0, "step": 45780 }, { "entropy": 5.409636545181274, "epoch": 3.562225248006224, "grad_norm": 1.1875, "learning_rate": 0.00037639642701461603, "loss": 4.8505, "mean_token_accuracy": 0.21595456898212434, "num_tokens": 79411071.0, "step": 45785 }, { "entropy": 5.311245536804199, "epoch": 3.562614277377942, "grad_norm": 1.1875, "learning_rate": 0.0003763716845313526, "loss": 4.8294, "mean_token_accuracy": 0.21633348166942595, "num_tokens": 79418896.0, "step": 45790 }, { "entropy": 5.3709173679351805, "epoch": 3.5630033067496596, "grad_norm": 1.1953125, "learning_rate": 0.0003763469405099352, "loss": 4.8562, "mean_token_accuracy": 0.20685584396123885, "num_tokens": 79427223.0, "step": 45795 }, { "entropy": 5.416921854019165, "epoch": 3.5633923361213773, "grad_norm": 1.21875, "learning_rate": 0.0003763221949507392, "loss": 4.8637, "mean_token_accuracy": 0.21078304052352906, "num_tokens": 79435895.0, "step": 45800 }, { "entropy": 5.419690418243408, "epoch": 3.563781365493095, "grad_norm": 1.15625, "learning_rate": 0.00037629744785414027, "loss": 4.9203, "mean_token_accuracy": 0.20382775962352753, "num_tokens": 79443957.0, "step": 45805 }, { "entropy": 5.387167596817017, "epoch": 3.5641703948648122, "grad_norm": 1.1015625, "learning_rate": 0.00037627269922051377, "loss": 4.8956, "mean_token_accuracy": 0.2097598135471344, "num_tokens": 79452134.0, "step": 45810 }, { "entropy": 5.342566680908203, "epoch": 3.56455942423653, "grad_norm": 1.1796875, "learning_rate": 0.00037624794905023523, "loss": 4.8732, "mean_token_accuracy": 0.2081510528922081, "num_tokens": 79460087.0, "step": 45815 }, { "entropy": 5.374317836761475, "epoch": 3.564948453608247, "grad_norm": 1.1171875, "learning_rate": 0.0003762231973436802, "loss": 4.8978, "mean_token_accuracy": 0.20252387821674347, "num_tokens": 79469869.0, "step": 45820 }, { "entropy": 5.420507907867432, "epoch": 3.565337482979965, "grad_norm": 1.1328125, "learning_rate": 0.0003761984441012243, "loss": 4.8968, "mean_token_accuracy": 0.2083616688847542, "num_tokens": 79478559.0, "step": 45825 }, { "entropy": 5.39992241859436, "epoch": 3.5657265123516826, "grad_norm": 1.09375, "learning_rate": 0.0003761736893232431, "loss": 4.7938, "mean_token_accuracy": 0.2227136731147766, "num_tokens": 79486945.0, "step": 45830 }, { "entropy": 5.264429521560669, "epoch": 3.5661155417234003, "grad_norm": 1.1328125, "learning_rate": 0.00037614893301011223, "loss": 4.7805, "mean_token_accuracy": 0.21383192241191865, "num_tokens": 79496526.0, "step": 45835 }, { "entropy": 5.332279539108276, "epoch": 3.5665045710951175, "grad_norm": 1.1484375, "learning_rate": 0.0003761241751622072, "loss": 4.8995, "mean_token_accuracy": 0.20822951644659043, "num_tokens": 79505503.0, "step": 45840 }, { "entropy": 5.396700000762939, "epoch": 3.5668936004668352, "grad_norm": 1.078125, "learning_rate": 0.0003760994157799038, "loss": 4.9519, "mean_token_accuracy": 0.20017847716808318, "num_tokens": 79514561.0, "step": 45845 }, { "entropy": 5.332700395584107, "epoch": 3.567282629838553, "grad_norm": 1.078125, "learning_rate": 0.0003760746548635777, "loss": 4.8681, "mean_token_accuracy": 0.21444705426692962, "num_tokens": 79522973.0, "step": 45850 }, { "entropy": 5.351207208633423, "epoch": 3.56767165921027, "grad_norm": 1.1171875, "learning_rate": 0.0003760498924136046, "loss": 4.8053, "mean_token_accuracy": 0.2152150899171829, "num_tokens": 79532130.0, "step": 45855 }, { "entropy": 5.387542819976806, "epoch": 3.568060688581988, "grad_norm": 1.1953125, "learning_rate": 0.00037602512843036025, "loss": 4.8939, "mean_token_accuracy": 0.20648878514766694, "num_tokens": 79540581.0, "step": 45860 }, { "entropy": 5.32386884689331, "epoch": 3.5684497179537056, "grad_norm": 1.1875, "learning_rate": 0.0003760003629142203, "loss": 4.7718, "mean_token_accuracy": 0.2246812179684639, "num_tokens": 79548674.0, "step": 45865 }, { "entropy": 5.342483806610107, "epoch": 3.5688387473254233, "grad_norm": 1.1015625, "learning_rate": 0.00037597559586556063, "loss": 4.8286, "mean_token_accuracy": 0.21390326768159867, "num_tokens": 79558300.0, "step": 45870 }, { "entropy": 5.371205615997314, "epoch": 3.5692277766971405, "grad_norm": 1.1015625, "learning_rate": 0.000375950827284757, "loss": 4.8661, "mean_token_accuracy": 0.2090674415230751, "num_tokens": 79566687.0, "step": 45875 }, { "entropy": 5.435831356048584, "epoch": 3.5696168060688582, "grad_norm": 1.1171875, "learning_rate": 0.00037592605717218523, "loss": 4.9039, "mean_token_accuracy": 0.21104466766119004, "num_tokens": 79575204.0, "step": 45880 }, { "entropy": 5.386499214172363, "epoch": 3.570005835440576, "grad_norm": 1.1328125, "learning_rate": 0.00037590128552822123, "loss": 4.8331, "mean_token_accuracy": 0.21853763610124588, "num_tokens": 79583102.0, "step": 45885 }, { "entropy": 5.3587729930877686, "epoch": 3.570394864812293, "grad_norm": 1.140625, "learning_rate": 0.0003758765123532407, "loss": 4.858, "mean_token_accuracy": 0.20406140834093095, "num_tokens": 79591933.0, "step": 45890 }, { "entropy": 5.414136552810669, "epoch": 3.570783894184011, "grad_norm": 1.1875, "learning_rate": 0.0003758517376476198, "loss": 4.8766, "mean_token_accuracy": 0.20506496727466583, "num_tokens": 79600588.0, "step": 45895 }, { "entropy": 5.370579099655151, "epoch": 3.5711729235557286, "grad_norm": 1.1171875, "learning_rate": 0.00037582696141173435, "loss": 4.8369, "mean_token_accuracy": 0.2162756785750389, "num_tokens": 79609252.0, "step": 45900 }, { "entropy": 5.371086597442627, "epoch": 3.5715619529274463, "grad_norm": 1.046875, "learning_rate": 0.00037580218364596015, "loss": 4.8329, "mean_token_accuracy": 0.21743370443582535, "num_tokens": 79617191.0, "step": 45905 }, { "entropy": 5.38363995552063, "epoch": 3.5719509822991635, "grad_norm": 1.203125, "learning_rate": 0.00037577740435067327, "loss": 4.9411, "mean_token_accuracy": 0.20150582045316695, "num_tokens": 79626174.0, "step": 45910 }, { "entropy": 5.392297983169556, "epoch": 3.572340011670881, "grad_norm": 1.125, "learning_rate": 0.00037575262352624965, "loss": 4.8714, "mean_token_accuracy": 0.2171070784330368, "num_tokens": 79634760.0, "step": 45915 }, { "entropy": 5.305218267440796, "epoch": 3.5727290410425985, "grad_norm": 1.2265625, "learning_rate": 0.00037572784117306535, "loss": 4.7519, "mean_token_accuracy": 0.22990741729736328, "num_tokens": 79643335.0, "step": 45920 }, { "entropy": 5.412169075012207, "epoch": 3.573118070414316, "grad_norm": 1.171875, "learning_rate": 0.0003757030572914963, "loss": 4.9576, "mean_token_accuracy": 0.20484157055616378, "num_tokens": 79651695.0, "step": 45925 }, { "entropy": 5.387224817276001, "epoch": 3.573507099786034, "grad_norm": 1.140625, "learning_rate": 0.0003756782718819188, "loss": 4.8715, "mean_token_accuracy": 0.21286609172821044, "num_tokens": 79659674.0, "step": 45930 }, { "entropy": 5.3691725730896, "epoch": 3.5738961291577516, "grad_norm": 1.0859375, "learning_rate": 0.00037565348494470873, "loss": 4.7966, "mean_token_accuracy": 0.2168641433119774, "num_tokens": 79668592.0, "step": 45935 }, { "entropy": 5.288401460647583, "epoch": 3.574285158529469, "grad_norm": 1.1328125, "learning_rate": 0.0003756286964802422, "loss": 4.7461, "mean_token_accuracy": 0.21727731674909592, "num_tokens": 79677828.0, "step": 45940 }, { "entropy": 5.38605899810791, "epoch": 3.5746741879011865, "grad_norm": 1.15625, "learning_rate": 0.0003756039064888954, "loss": 4.8981, "mean_token_accuracy": 0.21261195540428163, "num_tokens": 79686660.0, "step": 45945 }, { "entropy": 5.386173582077026, "epoch": 3.575063217272904, "grad_norm": 1.1015625, "learning_rate": 0.0003755791149710444, "loss": 4.9441, "mean_token_accuracy": 0.2114563375711441, "num_tokens": 79695263.0, "step": 45950 }, { "entropy": 5.405178785324097, "epoch": 3.5754522466446215, "grad_norm": 1.203125, "learning_rate": 0.00037555432192706547, "loss": 4.8446, "mean_token_accuracy": 0.21095335334539414, "num_tokens": 79703602.0, "step": 45955 }, { "entropy": 5.404139184951783, "epoch": 3.575841276016339, "grad_norm": 1.1953125, "learning_rate": 0.00037552952735733466, "loss": 4.8813, "mean_token_accuracy": 0.214123372733593, "num_tokens": 79711783.0, "step": 45960 }, { "entropy": 5.46048903465271, "epoch": 3.576230305388057, "grad_norm": 1.1640625, "learning_rate": 0.0003755047312622283, "loss": 4.9627, "mean_token_accuracy": 0.19972453266382217, "num_tokens": 79721461.0, "step": 45965 }, { "entropy": 5.319296932220459, "epoch": 3.5766193347597746, "grad_norm": 1.171875, "learning_rate": 0.00037547993364212267, "loss": 4.8037, "mean_token_accuracy": 0.21298013627529144, "num_tokens": 79729230.0, "step": 45970 }, { "entropy": 5.35458402633667, "epoch": 3.577008364131492, "grad_norm": 1.15625, "learning_rate": 0.000375455134497394, "loss": 4.8954, "mean_token_accuracy": 0.2101075530052185, "num_tokens": 79738165.0, "step": 45975 }, { "entropy": 5.35061502456665, "epoch": 3.5773973935032095, "grad_norm": 1.109375, "learning_rate": 0.0003754303338284186, "loss": 4.7844, "mean_token_accuracy": 0.21575349420309067, "num_tokens": 79746857.0, "step": 45980 }, { "entropy": 5.458946800231933, "epoch": 3.577786422874927, "grad_norm": 1.1796875, "learning_rate": 0.00037540553163557263, "loss": 4.9483, "mean_token_accuracy": 0.2113783538341522, "num_tokens": 79755172.0, "step": 45985 }, { "entropy": 5.256872367858887, "epoch": 3.5781754522466445, "grad_norm": 1.1171875, "learning_rate": 0.00037538072791923257, "loss": 4.776, "mean_token_accuracy": 0.21889315843582152, "num_tokens": 79763542.0, "step": 45990 }, { "entropy": 5.340472984313965, "epoch": 3.578564481618362, "grad_norm": 1.1328125, "learning_rate": 0.00037535592267977467, "loss": 4.8454, "mean_token_accuracy": 0.20987128615379333, "num_tokens": 79771805.0, "step": 45995 }, { "entropy": 5.407039308547974, "epoch": 3.57895351099008, "grad_norm": 1.15625, "learning_rate": 0.0003753311159175754, "loss": 4.8866, "mean_token_accuracy": 0.21345460712909697, "num_tokens": 79780645.0, "step": 46000 }, { "entropy": 5.293634986877441, "epoch": 3.5793425403617976, "grad_norm": 1.140625, "learning_rate": 0.00037530630763301113, "loss": 4.7717, "mean_token_accuracy": 0.22159164994955063, "num_tokens": 79789218.0, "step": 46005 }, { "entropy": 5.39737458229065, "epoch": 3.579731569733515, "grad_norm": 1.15625, "learning_rate": 0.0003752814978264584, "loss": 4.9166, "mean_token_accuracy": 0.20027800500392914, "num_tokens": 79798214.0, "step": 46010 }, { "entropy": 5.352280235290527, "epoch": 3.5801205991052325, "grad_norm": 1.1015625, "learning_rate": 0.0003752566864982934, "loss": 4.8223, "mean_token_accuracy": 0.21190735697746277, "num_tokens": 79806698.0, "step": 46015 }, { "entropy": 5.315085792541504, "epoch": 3.5805096284769498, "grad_norm": 1.1015625, "learning_rate": 0.00037523187364889293, "loss": 4.8874, "mean_token_accuracy": 0.20557451099157334, "num_tokens": 79814956.0, "step": 46020 }, { "entropy": 5.327392053604126, "epoch": 3.5808986578486675, "grad_norm": 1.2109375, "learning_rate": 0.0003752070592786332, "loss": 4.8152, "mean_token_accuracy": 0.21579249799251557, "num_tokens": 79823955.0, "step": 46025 }, { "entropy": 5.323977661132813, "epoch": 3.581287687220385, "grad_norm": 1.1953125, "learning_rate": 0.00037518224338789084, "loss": 4.728, "mean_token_accuracy": 0.21561214923858643, "num_tokens": 79832383.0, "step": 46030 }, { "entropy": 5.369806480407715, "epoch": 3.581676716592103, "grad_norm": 1.1171875, "learning_rate": 0.0003751574259770424, "loss": 4.8448, "mean_token_accuracy": 0.20796600729227066, "num_tokens": 79841778.0, "step": 46035 }, { "entropy": 5.2708429336547855, "epoch": 3.58206574596382, "grad_norm": 1.0546875, "learning_rate": 0.0003751326070464645, "loss": 4.7758, "mean_token_accuracy": 0.21068284511566163, "num_tokens": 79851024.0, "step": 46040 }, { "entropy": 5.364293336868286, "epoch": 3.582454775335538, "grad_norm": 1.21875, "learning_rate": 0.0003751077865965337, "loss": 4.8831, "mean_token_accuracy": 0.2154039666056633, "num_tokens": 79859987.0, "step": 46045 }, { "entropy": 5.298119688034058, "epoch": 3.5828438047072555, "grad_norm": 1.109375, "learning_rate": 0.00037508296462762647, "loss": 4.7662, "mean_token_accuracy": 0.22345883399248123, "num_tokens": 79868389.0, "step": 46050 }, { "entropy": 5.392587900161743, "epoch": 3.5832328340789728, "grad_norm": 1.109375, "learning_rate": 0.00037505814114011956, "loss": 4.956, "mean_token_accuracy": 0.19964467585086823, "num_tokens": 79877784.0, "step": 46055 }, { "entropy": 5.394743347167969, "epoch": 3.5836218634506904, "grad_norm": 1.2109375, "learning_rate": 0.00037503331613438965, "loss": 4.8606, "mean_token_accuracy": 0.21893921196460725, "num_tokens": 79886118.0, "step": 46060 }, { "entropy": 5.335175466537476, "epoch": 3.584010892822408, "grad_norm": 1.171875, "learning_rate": 0.00037500848961081334, "loss": 4.8138, "mean_token_accuracy": 0.22220377027988433, "num_tokens": 79894753.0, "step": 46065 }, { "entropy": 5.340113878250122, "epoch": 3.584399922194126, "grad_norm": 1.359375, "learning_rate": 0.00037498366156976746, "loss": 4.8354, "mean_token_accuracy": 0.21485548913478852, "num_tokens": 79903285.0, "step": 46070 }, { "entropy": 5.384540939331055, "epoch": 3.584788951565843, "grad_norm": 1.1640625, "learning_rate": 0.00037495883201162854, "loss": 4.8507, "mean_token_accuracy": 0.2106296271085739, "num_tokens": 79912076.0, "step": 46075 }, { "entropy": 5.3170544624328615, "epoch": 3.585177980937561, "grad_norm": 1.1640625, "learning_rate": 0.0003749340009367736, "loss": 4.8282, "mean_token_accuracy": 0.20960128903388978, "num_tokens": 79920942.0, "step": 46080 }, { "entropy": 5.365418338775635, "epoch": 3.5855670103092785, "grad_norm": 1.046875, "learning_rate": 0.00037490916834557916, "loss": 4.9794, "mean_token_accuracy": 0.2040545791387558, "num_tokens": 79929818.0, "step": 46085 }, { "entropy": 5.410957098007202, "epoch": 3.5859560396809957, "grad_norm": 1.046875, "learning_rate": 0.0003748843342384221, "loss": 4.8804, "mean_token_accuracy": 0.21477923393249512, "num_tokens": 79939001.0, "step": 46090 }, { "entropy": 5.4663848876953125, "epoch": 3.5863450690527134, "grad_norm": 1.1875, "learning_rate": 0.00037485949861567925, "loss": 4.9456, "mean_token_accuracy": 0.2039807215332985, "num_tokens": 79947311.0, "step": 46095 }, { "entropy": 5.327258014678955, "epoch": 3.586734098424431, "grad_norm": 1.125, "learning_rate": 0.0003748346614777275, "loss": 4.8163, "mean_token_accuracy": 0.2211000517010689, "num_tokens": 79955266.0, "step": 46100 }, { "entropy": 5.396526670455932, "epoch": 3.587123127796149, "grad_norm": 1.3125, "learning_rate": 0.0003748098228249437, "loss": 4.8672, "mean_token_accuracy": 0.2157622754573822, "num_tokens": 79962465.0, "step": 46105 }, { "entropy": 5.28253583908081, "epoch": 3.587512157167866, "grad_norm": 1.1875, "learning_rate": 0.00037478498265770463, "loss": 4.8308, "mean_token_accuracy": 0.21479502320289612, "num_tokens": 79971040.0, "step": 46110 }, { "entropy": 5.368221759796143, "epoch": 3.587901186539584, "grad_norm": 1.15625, "learning_rate": 0.0003747601409763872, "loss": 4.8532, "mean_token_accuracy": 0.21187446266412735, "num_tokens": 79979454.0, "step": 46115 }, { "entropy": 5.375804996490478, "epoch": 3.588290215911301, "grad_norm": 1.1015625, "learning_rate": 0.00037473529778136853, "loss": 4.8066, "mean_token_accuracy": 0.2162273570895195, "num_tokens": 79988240.0, "step": 46120 }, { "entropy": 5.3784057140350345, "epoch": 3.5886792452830187, "grad_norm": 1.1484375, "learning_rate": 0.00037471045307302544, "loss": 4.9702, "mean_token_accuracy": 0.21573228836059571, "num_tokens": 79997753.0, "step": 46125 }, { "entropy": 5.343861246109009, "epoch": 3.5890682746547364, "grad_norm": 1.0625, "learning_rate": 0.00037468560685173497, "loss": 4.8603, "mean_token_accuracy": 0.20834775269031525, "num_tokens": 80007274.0, "step": 46130 }, { "entropy": 5.368830680847168, "epoch": 3.589457304026454, "grad_norm": 1.1953125, "learning_rate": 0.000374660759117874, "loss": 4.8383, "mean_token_accuracy": 0.21289100199937822, "num_tokens": 80015796.0, "step": 46135 }, { "entropy": 5.331884241104126, "epoch": 3.589846333398172, "grad_norm": 1.140625, "learning_rate": 0.00037463590987181966, "loss": 4.8022, "mean_token_accuracy": 0.21325447112321855, "num_tokens": 80024049.0, "step": 46140 }, { "entropy": 5.223087453842163, "epoch": 3.590235362769889, "grad_norm": 1.1484375, "learning_rate": 0.00037461105911394904, "loss": 4.7046, "mean_token_accuracy": 0.2245904713869095, "num_tokens": 80032284.0, "step": 46145 }, { "entropy": 5.315054893493652, "epoch": 3.590624392141607, "grad_norm": 1.2265625, "learning_rate": 0.00037458620684463907, "loss": 4.8306, "mean_token_accuracy": 0.21044742316007614, "num_tokens": 80040154.0, "step": 46150 }, { "entropy": 5.395602512359619, "epoch": 3.591013421513324, "grad_norm": 1.125, "learning_rate": 0.00037456135306426693, "loss": 4.9123, "mean_token_accuracy": 0.21983245015144348, "num_tokens": 80048156.0, "step": 46155 }, { "entropy": 5.291496419906617, "epoch": 3.5914024508850417, "grad_norm": 1.1484375, "learning_rate": 0.0003745364977732097, "loss": 4.8105, "mean_token_accuracy": 0.21978435218334197, "num_tokens": 80057467.0, "step": 46160 }, { "entropy": 5.364649534225464, "epoch": 3.5917914802567594, "grad_norm": 1.1640625, "learning_rate": 0.0003745116409718446, "loss": 4.8903, "mean_token_accuracy": 0.21300036758184432, "num_tokens": 80066864.0, "step": 46165 }, { "entropy": 5.40105791091919, "epoch": 3.592180509628477, "grad_norm": 1.109375, "learning_rate": 0.0003744867826605488, "loss": 4.927, "mean_token_accuracy": 0.20288191735744476, "num_tokens": 80076940.0, "step": 46170 }, { "entropy": 5.382034683227539, "epoch": 3.5925695390001944, "grad_norm": 1.1171875, "learning_rate": 0.0003744619228396993, "loss": 4.8364, "mean_token_accuracy": 0.2175360456109047, "num_tokens": 80085994.0, "step": 46175 }, { "entropy": 5.3054131984710695, "epoch": 3.592958568371912, "grad_norm": 1.2109375, "learning_rate": 0.0003744370615096734, "loss": 4.7961, "mean_token_accuracy": 0.21235192120075225, "num_tokens": 80093721.0, "step": 46180 }, { "entropy": 5.3134490013122555, "epoch": 3.5933475977436298, "grad_norm": 1.1796875, "learning_rate": 0.0003744121986708485, "loss": 4.8074, "mean_token_accuracy": 0.2174096077680588, "num_tokens": 80101833.0, "step": 46185 }, { "entropy": 5.350430202484131, "epoch": 3.593736627115347, "grad_norm": 1.0703125, "learning_rate": 0.00037438733432360163, "loss": 4.8063, "mean_token_accuracy": 0.2237432599067688, "num_tokens": 80110337.0, "step": 46190 }, { "entropy": 5.339279747009277, "epoch": 3.5941256564870647, "grad_norm": 1.2109375, "learning_rate": 0.0003743624684683102, "loss": 4.7986, "mean_token_accuracy": 0.21971596032381058, "num_tokens": 80118218.0, "step": 46195 }, { "entropy": 5.342680883407593, "epoch": 3.5945146858587824, "grad_norm": 1.1328125, "learning_rate": 0.0003743376011053514, "loss": 4.8802, "mean_token_accuracy": 0.2046196088194847, "num_tokens": 80126409.0, "step": 46200 }, { "entropy": 5.309059000015258, "epoch": 3.5949037152305, "grad_norm": 1.140625, "learning_rate": 0.00037431273223510265, "loss": 4.8489, "mean_token_accuracy": 0.21931012123823165, "num_tokens": 80134415.0, "step": 46205 }, { "entropy": 5.3414427757263185, "epoch": 3.5952927446022174, "grad_norm": 1.1640625, "learning_rate": 0.0003742878618579413, "loss": 4.8754, "mean_token_accuracy": 0.2158853754401207, "num_tokens": 80142504.0, "step": 46210 }, { "entropy": 5.3322498321533205, "epoch": 3.595681773973935, "grad_norm": 1.1484375, "learning_rate": 0.0003742629899742446, "loss": 4.8946, "mean_token_accuracy": 0.21256586760282517, "num_tokens": 80151892.0, "step": 46215 }, { "entropy": 5.391326999664306, "epoch": 3.5960708033456523, "grad_norm": 1.140625, "learning_rate": 0.00037423811658439014, "loss": 4.8579, "mean_token_accuracy": 0.21121630668640137, "num_tokens": 80160194.0, "step": 46220 }, { "entropy": 5.43248872756958, "epoch": 3.59645983271737, "grad_norm": 1.1171875, "learning_rate": 0.00037421324168875503, "loss": 4.9052, "mean_token_accuracy": 0.21015152484178543, "num_tokens": 80168397.0, "step": 46225 }, { "entropy": 5.286218500137329, "epoch": 3.5968488620890877, "grad_norm": 1.1015625, "learning_rate": 0.000374188365287717, "loss": 4.838, "mean_token_accuracy": 0.21344176828861236, "num_tokens": 80177142.0, "step": 46230 }, { "entropy": 5.373470258712769, "epoch": 3.5972378914608054, "grad_norm": 1.078125, "learning_rate": 0.0003741634873816534, "loss": 4.9029, "mean_token_accuracy": 0.20238704681396485, "num_tokens": 80186221.0, "step": 46235 }, { "entropy": 5.42016978263855, "epoch": 3.597626920832523, "grad_norm": 1.2265625, "learning_rate": 0.00037413860797094175, "loss": 4.9192, "mean_token_accuracy": 0.20729054212570192, "num_tokens": 80194334.0, "step": 46240 }, { "entropy": 5.392420673370362, "epoch": 3.5980159502042404, "grad_norm": 1.15625, "learning_rate": 0.00037411372705595947, "loss": 4.9182, "mean_token_accuracy": 0.2054744154214859, "num_tokens": 80202986.0, "step": 46245 }, { "entropy": 5.4008262157440186, "epoch": 3.598404979575958, "grad_norm": 1.1796875, "learning_rate": 0.0003740888446370842, "loss": 4.8833, "mean_token_accuracy": 0.21755042672157288, "num_tokens": 80211392.0, "step": 46250 }, { "entropy": 5.365060615539551, "epoch": 3.5987940089476753, "grad_norm": 1.125, "learning_rate": 0.0003740639607146933, "loss": 4.9182, "mean_token_accuracy": 0.19629386365413665, "num_tokens": 80219572.0, "step": 46255 }, { "entropy": 5.421970796585083, "epoch": 3.599183038319393, "grad_norm": 1.1796875, "learning_rate": 0.00037403907528916455, "loss": 4.9307, "mean_token_accuracy": 0.2074686974287033, "num_tokens": 80227847.0, "step": 46260 }, { "entropy": 5.369739246368408, "epoch": 3.5995720676911107, "grad_norm": 1.09375, "learning_rate": 0.0003740141883608755, "loss": 4.9365, "mean_token_accuracy": 0.2021120235323906, "num_tokens": 80237610.0, "step": 46265 }, { "entropy": 5.346039533615112, "epoch": 3.5999610970628284, "grad_norm": 1.1796875, "learning_rate": 0.0003739892999302037, "loss": 4.8021, "mean_token_accuracy": 0.21924768686294555, "num_tokens": 80245948.0, "step": 46270 }, { "entropy": 5.354439210891724, "epoch": 3.6003501264345457, "grad_norm": 1.1875, "learning_rate": 0.0003739644099975269, "loss": 4.9045, "mean_token_accuracy": 0.21224594116210938, "num_tokens": 80254457.0, "step": 46275 }, { "entropy": 5.4103845119476315, "epoch": 3.6007391558062634, "grad_norm": 1.078125, "learning_rate": 0.00037393951856322263, "loss": 4.9228, "mean_token_accuracy": 0.20880051851272582, "num_tokens": 80264204.0, "step": 46280 }, { "entropy": 5.45153398513794, "epoch": 3.601128185177981, "grad_norm": 1.2421875, "learning_rate": 0.0003739146256276686, "loss": 4.9017, "mean_token_accuracy": 0.21286383122205735, "num_tokens": 80272188.0, "step": 46285 }, { "entropy": 5.361737203598023, "epoch": 3.6015172145496983, "grad_norm": 1.1171875, "learning_rate": 0.00037388973119124267, "loss": 4.8936, "mean_token_accuracy": 0.2037728786468506, "num_tokens": 80282009.0, "step": 46290 }, { "entropy": 5.4231476306915285, "epoch": 3.601906243921416, "grad_norm": 1.140625, "learning_rate": 0.0003738648352543224, "loss": 4.8356, "mean_token_accuracy": 0.21708330363035203, "num_tokens": 80290268.0, "step": 46295 }, { "entropy": 5.385340976715088, "epoch": 3.6022952732931337, "grad_norm": 1.0859375, "learning_rate": 0.0003738399378172856, "loss": 4.8425, "mean_token_accuracy": 0.20730377584695817, "num_tokens": 80298919.0, "step": 46300 }, { "entropy": 5.3667865753173825, "epoch": 3.6026843026648514, "grad_norm": 1.1171875, "learning_rate": 0.0003738150388805101, "loss": 4.8945, "mean_token_accuracy": 0.2113905981183052, "num_tokens": 80308117.0, "step": 46305 }, { "entropy": 5.297799825668335, "epoch": 3.6030733320365687, "grad_norm": 1.1484375, "learning_rate": 0.00037379013844437373, "loss": 4.875, "mean_token_accuracy": 0.21415880918502808, "num_tokens": 80316840.0, "step": 46310 }, { "entropy": 5.370544004440307, "epoch": 3.6034623614082864, "grad_norm": 1.0859375, "learning_rate": 0.00037376523650925415, "loss": 4.788, "mean_token_accuracy": 0.2231057271361351, "num_tokens": 80326044.0, "step": 46315 }, { "entropy": 5.370165252685547, "epoch": 3.603851390780004, "grad_norm": 1.2421875, "learning_rate": 0.0003737403330755293, "loss": 4.852, "mean_token_accuracy": 0.20823064744472503, "num_tokens": 80334297.0, "step": 46320 }, { "entropy": 5.311166095733642, "epoch": 3.6042404201517213, "grad_norm": 1.1953125, "learning_rate": 0.0003737154281435771, "loss": 4.8498, "mean_token_accuracy": 0.21300268471240996, "num_tokens": 80342522.0, "step": 46325 }, { "entropy": 5.396177816390991, "epoch": 3.604629449523439, "grad_norm": 1.0546875, "learning_rate": 0.00037369052171377535, "loss": 4.9279, "mean_token_accuracy": 0.20780676752328872, "num_tokens": 80351055.0, "step": 46330 }, { "entropy": 5.35433783531189, "epoch": 3.6050184788951567, "grad_norm": 1.140625, "learning_rate": 0.0003736656137865021, "loss": 4.8649, "mean_token_accuracy": 0.20731803476810456, "num_tokens": 80359627.0, "step": 46335 }, { "entropy": 5.372165393829346, "epoch": 3.6054075082668744, "grad_norm": 1.1796875, "learning_rate": 0.00037364070436213514, "loss": 4.9294, "mean_token_accuracy": 0.20639152973890304, "num_tokens": 80368080.0, "step": 46340 }, { "entropy": 5.349333477020264, "epoch": 3.6057965376385916, "grad_norm": 1.1171875, "learning_rate": 0.0003736157934410525, "loss": 4.787, "mean_token_accuracy": 0.21628152430057526, "num_tokens": 80376814.0, "step": 46345 }, { "entropy": 5.3038170337677, "epoch": 3.6061855670103093, "grad_norm": 1.1328125, "learning_rate": 0.0003735908810236322, "loss": 4.8714, "mean_token_accuracy": 0.212046779692173, "num_tokens": 80385364.0, "step": 46350 }, { "entropy": 5.376226758956909, "epoch": 3.6065745963820266, "grad_norm": 1.1875, "learning_rate": 0.00037356596711025214, "loss": 4.844, "mean_token_accuracy": 0.21661100536584854, "num_tokens": 80393674.0, "step": 46355 }, { "entropy": 5.371115636825562, "epoch": 3.6069636257537443, "grad_norm": 1.15625, "learning_rate": 0.0003735410517012905, "loss": 4.8703, "mean_token_accuracy": 0.21429896354675293, "num_tokens": 80401981.0, "step": 46360 }, { "entropy": 5.327208566665649, "epoch": 3.607352655125462, "grad_norm": 1.1171875, "learning_rate": 0.0003735161347971252, "loss": 4.8551, "mean_token_accuracy": 0.21539910435676574, "num_tokens": 80410550.0, "step": 46365 }, { "entropy": 5.39033317565918, "epoch": 3.6077416844971797, "grad_norm": 1.0703125, "learning_rate": 0.0003734912163981344, "loss": 4.87, "mean_token_accuracy": 0.20593751221895218, "num_tokens": 80420310.0, "step": 46370 }, { "entropy": 5.297357177734375, "epoch": 3.608130713868897, "grad_norm": 1.203125, "learning_rate": 0.00037346629650469605, "loss": 4.8278, "mean_token_accuracy": 0.21171630322933196, "num_tokens": 80429167.0, "step": 46375 }, { "entropy": 5.2734943389892575, "epoch": 3.6085197432406146, "grad_norm": 1.09375, "learning_rate": 0.00037344137511718847, "loss": 4.7573, "mean_token_accuracy": 0.2259500354528427, "num_tokens": 80438162.0, "step": 46380 }, { "entropy": 5.372167253494263, "epoch": 3.6089087726123323, "grad_norm": 1.0625, "learning_rate": 0.00037341645223598965, "loss": 4.8916, "mean_token_accuracy": 0.21464264243841172, "num_tokens": 80446989.0, "step": 46385 }, { "entropy": 5.424570369720459, "epoch": 3.6092978019840496, "grad_norm": 1.109375, "learning_rate": 0.00037339152786147777, "loss": 4.9332, "mean_token_accuracy": 0.2038123369216919, "num_tokens": 80455696.0, "step": 46390 }, { "entropy": 5.470143032073975, "epoch": 3.6096868313557673, "grad_norm": 1.125, "learning_rate": 0.00037336660199403115, "loss": 4.9826, "mean_token_accuracy": 0.20275453180074693, "num_tokens": 80465029.0, "step": 46395 }, { "entropy": 5.43672285079956, "epoch": 3.610075860727485, "grad_norm": 1.1796875, "learning_rate": 0.0003733416746340279, "loss": 4.9101, "mean_token_accuracy": 0.21647294014692306, "num_tokens": 80472834.0, "step": 46400 }, { "entropy": 5.39040060043335, "epoch": 3.6104648900992027, "grad_norm": 1.1171875, "learning_rate": 0.0003733167457818463, "loss": 4.8316, "mean_token_accuracy": 0.20891461670398712, "num_tokens": 80481689.0, "step": 46405 }, { "entropy": 5.377660512924194, "epoch": 3.61085391947092, "grad_norm": 1.3984375, "learning_rate": 0.0003732918154378645, "loss": 4.9276, "mean_token_accuracy": 0.20984197556972503, "num_tokens": 80489277.0, "step": 46410 }, { "entropy": 5.306615686416626, "epoch": 3.6112429488426376, "grad_norm": 1.296875, "learning_rate": 0.00037326688360246087, "loss": 4.847, "mean_token_accuracy": 0.22103274017572402, "num_tokens": 80497567.0, "step": 46415 }, { "entropy": 5.406009292602539, "epoch": 3.6116319782143553, "grad_norm": 1.078125, "learning_rate": 0.0003732419502760137, "loss": 4.9671, "mean_token_accuracy": 0.2047761559486389, "num_tokens": 80506554.0, "step": 46420 }, { "entropy": 5.3683021545410154, "epoch": 3.6120210075860726, "grad_norm": 1.2578125, "learning_rate": 0.00037321701545890126, "loss": 4.8523, "mean_token_accuracy": 0.21365817040205, "num_tokens": 80515648.0, "step": 46425 }, { "entropy": 5.417666721343994, "epoch": 3.6124100369577903, "grad_norm": 1.125, "learning_rate": 0.0003731920791515019, "loss": 4.9271, "mean_token_accuracy": 0.20564096868038179, "num_tokens": 80524368.0, "step": 46430 }, { "entropy": 5.357018280029297, "epoch": 3.612799066329508, "grad_norm": 1.140625, "learning_rate": 0.0003731671413541942, "loss": 4.8115, "mean_token_accuracy": 0.21313745379447938, "num_tokens": 80533575.0, "step": 46435 }, { "entropy": 5.366616153717041, "epoch": 3.6131880957012257, "grad_norm": 1.1640625, "learning_rate": 0.00037314220206735626, "loss": 4.8187, "mean_token_accuracy": 0.21483396291732787, "num_tokens": 80542053.0, "step": 46440 }, { "entropy": 5.462084484100342, "epoch": 3.613577125072943, "grad_norm": 1.109375, "learning_rate": 0.00037311726129136665, "loss": 4.9228, "mean_token_accuracy": 0.20712907314300538, "num_tokens": 80551903.0, "step": 46445 }, { "entropy": 5.381314611434936, "epoch": 3.6139661544446606, "grad_norm": 1.296875, "learning_rate": 0.0003730923190266038, "loss": 4.8995, "mean_token_accuracy": 0.20371965318918228, "num_tokens": 80559260.0, "step": 46450 }, { "entropy": 5.3936299800872805, "epoch": 3.614355183816378, "grad_norm": 1.140625, "learning_rate": 0.000373067375273446, "loss": 4.9095, "mean_token_accuracy": 0.21196842938661575, "num_tokens": 80568689.0, "step": 46455 }, { "entropy": 5.383879470825195, "epoch": 3.6147442131880956, "grad_norm": 1.109375, "learning_rate": 0.00037304243003227197, "loss": 4.8974, "mean_token_accuracy": 0.20314313620328903, "num_tokens": 80577073.0, "step": 46460 }, { "entropy": 5.304295635223388, "epoch": 3.6151332425598133, "grad_norm": 1.0625, "learning_rate": 0.0003730174833034601, "loss": 4.7857, "mean_token_accuracy": 0.21240022033452988, "num_tokens": 80586595.0, "step": 46465 }, { "entropy": 5.343378257751465, "epoch": 3.615522271931531, "grad_norm": 1.15625, "learning_rate": 0.00037299253508738894, "loss": 4.84, "mean_token_accuracy": 0.2106585130095482, "num_tokens": 80595074.0, "step": 46470 }, { "entropy": 5.354985046386719, "epoch": 3.6159113013032487, "grad_norm": 1.25, "learning_rate": 0.00037296758538443703, "loss": 4.9096, "mean_token_accuracy": 0.20369569212198257, "num_tokens": 80603801.0, "step": 46475 }, { "entropy": 5.436268281936646, "epoch": 3.616300330674966, "grad_norm": 1.109375, "learning_rate": 0.00037294263419498295, "loss": 4.9359, "mean_token_accuracy": 0.2146188110113144, "num_tokens": 80612993.0, "step": 46480 }, { "entropy": 5.352521228790283, "epoch": 3.6166893600466836, "grad_norm": 1.1640625, "learning_rate": 0.0003729176815194053, "loss": 4.7808, "mean_token_accuracy": 0.22187235057353974, "num_tokens": 80621712.0, "step": 46485 }, { "entropy": 5.391929578781128, "epoch": 3.617078389418401, "grad_norm": 1.1015625, "learning_rate": 0.00037289272735808267, "loss": 4.8546, "mean_token_accuracy": 0.21278309524059297, "num_tokens": 80630657.0, "step": 46490 }, { "entropy": 5.378232431411743, "epoch": 3.6174674187901186, "grad_norm": 1.203125, "learning_rate": 0.0003728677717113936, "loss": 4.8815, "mean_token_accuracy": 0.2113603264093399, "num_tokens": 80638967.0, "step": 46495 }, { "entropy": 5.31564884185791, "epoch": 3.6178564481618363, "grad_norm": 1.171875, "learning_rate": 0.00037284281457971707, "loss": 4.8226, "mean_token_accuracy": 0.21725354790687562, "num_tokens": 80647791.0, "step": 46500 }, { "entropy": 5.346744966506958, "epoch": 3.618245477533554, "grad_norm": 1.1328125, "learning_rate": 0.0003728178559634315, "loss": 4.7869, "mean_token_accuracy": 0.22069291770458221, "num_tokens": 80656162.0, "step": 46505 }, { "entropy": 5.330867958068848, "epoch": 3.618634506905271, "grad_norm": 1.046875, "learning_rate": 0.0003727928958629156, "loss": 4.8702, "mean_token_accuracy": 0.2125949129462242, "num_tokens": 80665203.0, "step": 46510 }, { "entropy": 5.3909399032592775, "epoch": 3.619023536276989, "grad_norm": 1.109375, "learning_rate": 0.00037276793427854817, "loss": 4.8789, "mean_token_accuracy": 0.2084796130657196, "num_tokens": 80673748.0, "step": 46515 }, { "entropy": 5.324099063873291, "epoch": 3.6194125656487066, "grad_norm": 1.09375, "learning_rate": 0.00037274297121070796, "loss": 4.7909, "mean_token_accuracy": 0.22222814857959747, "num_tokens": 80682166.0, "step": 46520 }, { "entropy": 5.372356986999511, "epoch": 3.619801595020424, "grad_norm": 1.2265625, "learning_rate": 0.0003727180066597737, "loss": 4.816, "mean_token_accuracy": 0.2135859966278076, "num_tokens": 80689972.0, "step": 46525 }, { "entropy": 5.336402034759521, "epoch": 3.6201906243921416, "grad_norm": 1.2578125, "learning_rate": 0.0003726930406261243, "loss": 4.8523, "mean_token_accuracy": 0.20832593888044357, "num_tokens": 80698193.0, "step": 46530 }, { "entropy": 5.391450262069702, "epoch": 3.6205796537638593, "grad_norm": 1.0390625, "learning_rate": 0.0003726680731101385, "loss": 4.9192, "mean_token_accuracy": 0.20272493064403535, "num_tokens": 80707464.0, "step": 46535 }, { "entropy": 5.379547595977783, "epoch": 3.620968683135577, "grad_norm": 1.140625, "learning_rate": 0.0003726431041121951, "loss": 4.8162, "mean_token_accuracy": 0.21616086959838868, "num_tokens": 80715185.0, "step": 46540 }, { "entropy": 5.355844163894654, "epoch": 3.621357712507294, "grad_norm": 1.203125, "learning_rate": 0.000372618133632673, "loss": 4.8541, "mean_token_accuracy": 0.20428049117326735, "num_tokens": 80723499.0, "step": 46545 }, { "entropy": 5.40355544090271, "epoch": 3.621746741879012, "grad_norm": 1.1015625, "learning_rate": 0.0003725931616719511, "loss": 4.8275, "mean_token_accuracy": 0.21575037389993668, "num_tokens": 80732539.0, "step": 46550 }, { "entropy": 5.482115745544434, "epoch": 3.622135771250729, "grad_norm": 1.140625, "learning_rate": 0.0003725681882304084, "loss": 4.9129, "mean_token_accuracy": 0.20281482338905335, "num_tokens": 80742332.0, "step": 46555 }, { "entropy": 5.321111583709717, "epoch": 3.622524800622447, "grad_norm": 1.21875, "learning_rate": 0.0003725432133084237, "loss": 4.7989, "mean_token_accuracy": 0.22250897735357283, "num_tokens": 80750553.0, "step": 46560 }, { "entropy": 5.373487377166748, "epoch": 3.6229138299941646, "grad_norm": 1.171875, "learning_rate": 0.0003725182369063759, "loss": 4.8442, "mean_token_accuracy": 0.214154152572155, "num_tokens": 80758721.0, "step": 46565 }, { "entropy": 5.360918617248535, "epoch": 3.6233028593658823, "grad_norm": 1.15625, "learning_rate": 0.0003724932590246441, "loss": 4.8852, "mean_token_accuracy": 0.21329243183135987, "num_tokens": 80768242.0, "step": 46570 }, { "entropy": 5.315581560134888, "epoch": 3.6236918887376, "grad_norm": 1.1484375, "learning_rate": 0.0003724682796636073, "loss": 4.7549, "mean_token_accuracy": 0.21743698120117189, "num_tokens": 80776494.0, "step": 46575 }, { "entropy": 5.300078439712524, "epoch": 3.624080918109317, "grad_norm": 1.15625, "learning_rate": 0.0003724432988236445, "loss": 4.7864, "mean_token_accuracy": 0.21626759320497513, "num_tokens": 80785198.0, "step": 46580 }, { "entropy": 5.352545738220215, "epoch": 3.624469947481035, "grad_norm": 1.09375, "learning_rate": 0.0003724183165051347, "loss": 4.9047, "mean_token_accuracy": 0.21085509061813354, "num_tokens": 80794126.0, "step": 46585 }, { "entropy": 5.324484348297119, "epoch": 3.624858976852752, "grad_norm": 1.15625, "learning_rate": 0.00037239333270845714, "loss": 4.7743, "mean_token_accuracy": 0.21440768539905547, "num_tokens": 80802199.0, "step": 46590 }, { "entropy": 5.314590978622436, "epoch": 3.62524800622447, "grad_norm": 1.1875, "learning_rate": 0.0003723683474339907, "loss": 4.8137, "mean_token_accuracy": 0.21393654197454454, "num_tokens": 80810537.0, "step": 46595 }, { "entropy": 5.299376487731934, "epoch": 3.6256370355961876, "grad_norm": 1.265625, "learning_rate": 0.0003723433606821145, "loss": 4.8571, "mean_token_accuracy": 0.21834296882152557, "num_tokens": 80818661.0, "step": 46600 }, { "entropy": 5.28003306388855, "epoch": 3.6260260649679052, "grad_norm": 1.125, "learning_rate": 0.00037231837245320777, "loss": 4.7649, "mean_token_accuracy": 0.22352368682622908, "num_tokens": 80827883.0, "step": 46605 }, { "entropy": 5.406387805938721, "epoch": 3.6264150943396225, "grad_norm": 1.2421875, "learning_rate": 0.00037229338274764965, "loss": 4.9048, "mean_token_accuracy": 0.21257759183645247, "num_tokens": 80836692.0, "step": 46610 }, { "entropy": 5.4556131839752195, "epoch": 3.62680412371134, "grad_norm": 1.1640625, "learning_rate": 0.0003722683915658193, "loss": 4.879, "mean_token_accuracy": 0.2154424488544464, "num_tokens": 80845342.0, "step": 46615 }, { "entropy": 5.280368709564209, "epoch": 3.627193153083058, "grad_norm": 1.1015625, "learning_rate": 0.00037224339890809587, "loss": 4.7535, "mean_token_accuracy": 0.21835696697235107, "num_tokens": 80854393.0, "step": 46620 }, { "entropy": 5.363966655731201, "epoch": 3.627582182454775, "grad_norm": 1.203125, "learning_rate": 0.0003722184047748587, "loss": 4.7853, "mean_token_accuracy": 0.22336314171552657, "num_tokens": 80862712.0, "step": 46625 }, { "entropy": 5.383457040786743, "epoch": 3.627971211826493, "grad_norm": 1.0625, "learning_rate": 0.00037219340916648703, "loss": 4.8996, "mean_token_accuracy": 0.20361993163824083, "num_tokens": 80872455.0, "step": 46630 }, { "entropy": 5.356365919113159, "epoch": 3.6283602411982105, "grad_norm": 1.078125, "learning_rate": 0.00037216841208336, "loss": 4.824, "mean_token_accuracy": 0.21407736241817474, "num_tokens": 80881305.0, "step": 46635 }, { "entropy": 5.388237857818604, "epoch": 3.6287492705699282, "grad_norm": 1.2109375, "learning_rate": 0.00037214341352585697, "loss": 4.8638, "mean_token_accuracy": 0.22094998955726625, "num_tokens": 80890242.0, "step": 46640 }, { "entropy": 5.419369411468506, "epoch": 3.6291382999416455, "grad_norm": 1.140625, "learning_rate": 0.0003721184134943573, "loss": 4.9486, "mean_token_accuracy": 0.21141682118177413, "num_tokens": 80899707.0, "step": 46645 }, { "entropy": 5.346998405456543, "epoch": 3.629527329313363, "grad_norm": 1.09375, "learning_rate": 0.00037209341198924024, "loss": 4.8254, "mean_token_accuracy": 0.21290561705827712, "num_tokens": 80908543.0, "step": 46650 }, { "entropy": 5.363423919677734, "epoch": 3.6299163586850804, "grad_norm": 1.09375, "learning_rate": 0.0003720684090108852, "loss": 4.9203, "mean_token_accuracy": 0.20853622555732726, "num_tokens": 80916916.0, "step": 46655 }, { "entropy": 5.426221561431885, "epoch": 3.630305388056798, "grad_norm": 1.078125, "learning_rate": 0.0003720434045596716, "loss": 4.9877, "mean_token_accuracy": 0.19575837403535842, "num_tokens": 80925782.0, "step": 46660 }, { "entropy": 5.358912420272827, "epoch": 3.630694417428516, "grad_norm": 1.125, "learning_rate": 0.0003720183986359788, "loss": 4.758, "mean_token_accuracy": 0.2226752057671547, "num_tokens": 80933902.0, "step": 46665 }, { "entropy": 5.372754669189453, "epoch": 3.6310834468002335, "grad_norm": 1.1484375, "learning_rate": 0.0003719933912401862, "loss": 4.9117, "mean_token_accuracy": 0.2023972138762474, "num_tokens": 80941993.0, "step": 46670 }, { "entropy": 5.322053050994873, "epoch": 3.6314724761719512, "grad_norm": 1.1640625, "learning_rate": 0.0003719683823726732, "loss": 4.766, "mean_token_accuracy": 0.2157853960990906, "num_tokens": 80950038.0, "step": 46675 }, { "entropy": 5.386645269393921, "epoch": 3.6318615055436685, "grad_norm": 1.21875, "learning_rate": 0.00037194337203381945, "loss": 4.8961, "mean_token_accuracy": 0.20981784760951996, "num_tokens": 80958684.0, "step": 46680 }, { "entropy": 5.393042516708374, "epoch": 3.632250534915386, "grad_norm": 1.03125, "learning_rate": 0.00037191836022400427, "loss": 4.8608, "mean_token_accuracy": 0.2094475194811821, "num_tokens": 80967302.0, "step": 46685 }, { "entropy": 5.322162342071533, "epoch": 3.6326395642871034, "grad_norm": 1.09375, "learning_rate": 0.00037189334694360724, "loss": 4.8696, "mean_token_accuracy": 0.2123696208000183, "num_tokens": 80975691.0, "step": 46690 }, { "entropy": 5.297226762771606, "epoch": 3.633028593658821, "grad_norm": 1.1484375, "learning_rate": 0.0003718683321930079, "loss": 4.8436, "mean_token_accuracy": 0.21797813028097152, "num_tokens": 80984282.0, "step": 46695 }, { "entropy": 5.472274875640869, "epoch": 3.633417623030539, "grad_norm": 1.0703125, "learning_rate": 0.0003718433159725857, "loss": 4.8731, "mean_token_accuracy": 0.21265694946050645, "num_tokens": 80992991.0, "step": 46700 }, { "entropy": 5.383316993713379, "epoch": 3.6338066524022565, "grad_norm": 1.1796875, "learning_rate": 0.0003718182982827205, "loss": 4.8763, "mean_token_accuracy": 0.20865497142076492, "num_tokens": 81001263.0, "step": 46705 }, { "entropy": 5.317346000671387, "epoch": 3.634195681773974, "grad_norm": 1.1796875, "learning_rate": 0.00037179327912379166, "loss": 4.8195, "mean_token_accuracy": 0.21988535374403, "num_tokens": 81010680.0, "step": 46710 }, { "entropy": 5.30451455116272, "epoch": 3.6345847111456915, "grad_norm": 1.078125, "learning_rate": 0.00037176825849617886, "loss": 4.7953, "mean_token_accuracy": 0.21292907297611235, "num_tokens": 81019359.0, "step": 46715 }, { "entropy": 5.453900671005249, "epoch": 3.634973740517409, "grad_norm": 1.1171875, "learning_rate": 0.00037174323640026173, "loss": 4.9784, "mean_token_accuracy": 0.2042897954583168, "num_tokens": 81028808.0, "step": 46720 }, { "entropy": 5.406426048278808, "epoch": 3.6353627698891264, "grad_norm": 1.1796875, "learning_rate": 0.00037171821283642003, "loss": 4.8497, "mean_token_accuracy": 0.2067391097545624, "num_tokens": 81037778.0, "step": 46725 }, { "entropy": 5.413697624206543, "epoch": 3.635751799260844, "grad_norm": 1.171875, "learning_rate": 0.0003716931878050334, "loss": 4.8779, "mean_token_accuracy": 0.20466281622648239, "num_tokens": 81047657.0, "step": 46730 }, { "entropy": 5.294223976135254, "epoch": 3.636140828632562, "grad_norm": 1.1796875, "learning_rate": 0.00037166816130648143, "loss": 4.7521, "mean_token_accuracy": 0.21895309686660766, "num_tokens": 81056585.0, "step": 46735 }, { "entropy": 5.3575067043304445, "epoch": 3.6365298580042795, "grad_norm": 1.15625, "learning_rate": 0.00037164313334114407, "loss": 4.9044, "mean_token_accuracy": 0.2057991772890091, "num_tokens": 81064463.0, "step": 46740 }, { "entropy": 5.324848222732544, "epoch": 3.636918887375997, "grad_norm": 1.140625, "learning_rate": 0.000371618103909401, "loss": 4.9229, "mean_token_accuracy": 0.2141909584403038, "num_tokens": 81073210.0, "step": 46745 }, { "entropy": 5.490639495849609, "epoch": 3.6373079167477145, "grad_norm": 1.21875, "learning_rate": 0.000371593073011632, "loss": 4.9712, "mean_token_accuracy": 0.21098536849021912, "num_tokens": 81081991.0, "step": 46750 }, { "entropy": 5.495748853683471, "epoch": 3.637696946119432, "grad_norm": 1.125, "learning_rate": 0.00037156804064821674, "loss": 4.9506, "mean_token_accuracy": 0.20795520544052123, "num_tokens": 81090592.0, "step": 46755 }, { "entropy": 5.36137170791626, "epoch": 3.6380859754911494, "grad_norm": 1.1484375, "learning_rate": 0.00037154300681953523, "loss": 4.8858, "mean_token_accuracy": 0.20915915668010712, "num_tokens": 81099278.0, "step": 46760 }, { "entropy": 5.3598490238189695, "epoch": 3.638475004862867, "grad_norm": 1.1640625, "learning_rate": 0.0003715179715259673, "loss": 4.8456, "mean_token_accuracy": 0.21495743840932846, "num_tokens": 81108106.0, "step": 46765 }, { "entropy": 5.353936767578125, "epoch": 3.638864034234585, "grad_norm": 1.09375, "learning_rate": 0.00037149293476789277, "loss": 4.7862, "mean_token_accuracy": 0.2128440871834755, "num_tokens": 81116679.0, "step": 46770 }, { "entropy": 5.41002402305603, "epoch": 3.6392530636063025, "grad_norm": 1.1328125, "learning_rate": 0.0003714678965456915, "loss": 4.9084, "mean_token_accuracy": 0.2040422111749649, "num_tokens": 81125308.0, "step": 46775 }, { "entropy": 5.437566232681275, "epoch": 3.6396420929780198, "grad_norm": 1.0859375, "learning_rate": 0.00037144285685974346, "loss": 4.9207, "mean_token_accuracy": 0.21176941096782684, "num_tokens": 81134092.0, "step": 46780 }, { "entropy": 5.425619983673096, "epoch": 3.6400311223497375, "grad_norm": 1.21875, "learning_rate": 0.00037141781571042854, "loss": 4.8821, "mean_token_accuracy": 0.2100697159767151, "num_tokens": 81142413.0, "step": 46785 }, { "entropy": 5.36117639541626, "epoch": 3.6404201517214547, "grad_norm": 1.15625, "learning_rate": 0.00037139277309812676, "loss": 4.876, "mean_token_accuracy": 0.2071504056453705, "num_tokens": 81150952.0, "step": 46790 }, { "entropy": 5.412106990814209, "epoch": 3.6408091810931724, "grad_norm": 1.1328125, "learning_rate": 0.0003713677290232181, "loss": 4.952, "mean_token_accuracy": 0.20451395511627196, "num_tokens": 81161118.0, "step": 46795 }, { "entropy": 5.384509611129761, "epoch": 3.64119821046489, "grad_norm": 1.0078125, "learning_rate": 0.00037134268348608255, "loss": 4.8533, "mean_token_accuracy": 0.21169256567955017, "num_tokens": 81169682.0, "step": 46800 }, { "entropy": 5.42182502746582, "epoch": 3.641587239836608, "grad_norm": 1.1953125, "learning_rate": 0.00037131763648710003, "loss": 4.8368, "mean_token_accuracy": 0.21508550643920898, "num_tokens": 81177892.0, "step": 46805 }, { "entropy": 5.361674642562866, "epoch": 3.641976269208325, "grad_norm": 1.140625, "learning_rate": 0.00037129258802665076, "loss": 4.8629, "mean_token_accuracy": 0.21256581991910933, "num_tokens": 81186612.0, "step": 46810 }, { "entropy": 5.304353952407837, "epoch": 3.6423652985800428, "grad_norm": 1.171875, "learning_rate": 0.0003712675381051147, "loss": 4.8404, "mean_token_accuracy": 0.20409987568855287, "num_tokens": 81195518.0, "step": 46815 }, { "entropy": 5.468058300018311, "epoch": 3.6427543279517605, "grad_norm": 1.1015625, "learning_rate": 0.000371242486722872, "loss": 5.0134, "mean_token_accuracy": 0.20576711893081664, "num_tokens": 81205105.0, "step": 46820 }, { "entropy": 5.49623293876648, "epoch": 3.6431433573234777, "grad_norm": 1.21875, "learning_rate": 0.0003712174338803027, "loss": 4.8946, "mean_token_accuracy": 0.2026061534881592, "num_tokens": 81213629.0, "step": 46825 }, { "entropy": 5.395466470718384, "epoch": 3.6435323866951954, "grad_norm": 1.109375, "learning_rate": 0.000371192379577787, "loss": 4.8537, "mean_token_accuracy": 0.20984504222869874, "num_tokens": 81222387.0, "step": 46830 }, { "entropy": 5.219000673294067, "epoch": 3.643921416066913, "grad_norm": 1.1328125, "learning_rate": 0.0003711673238157051, "loss": 4.7402, "mean_token_accuracy": 0.228009395301342, "num_tokens": 81231280.0, "step": 46835 }, { "entropy": 5.399661874771118, "epoch": 3.644310445438631, "grad_norm": 1.1171875, "learning_rate": 0.00037114226659443704, "loss": 4.9069, "mean_token_accuracy": 0.20749039947986603, "num_tokens": 81239681.0, "step": 46840 }, { "entropy": 5.375925827026367, "epoch": 3.644699474810348, "grad_norm": 1.25, "learning_rate": 0.0003711172079143632, "loss": 4.9007, "mean_token_accuracy": 0.20477538853883742, "num_tokens": 81247909.0, "step": 46845 }, { "entropy": 5.35288372039795, "epoch": 3.6450885041820658, "grad_norm": 1.1171875, "learning_rate": 0.0003710921477758637, "loss": 4.8418, "mean_token_accuracy": 0.2095668375492096, "num_tokens": 81256507.0, "step": 46850 }, { "entropy": 5.410383844375611, "epoch": 3.6454775335537835, "grad_norm": 1.203125, "learning_rate": 0.0003710670861793187, "loss": 5.028, "mean_token_accuracy": 0.2004512906074524, "num_tokens": 81265301.0, "step": 46855 }, { "entropy": 5.399573278427124, "epoch": 3.6458665629255007, "grad_norm": 1.2109375, "learning_rate": 0.0003710420231251087, "loss": 4.8193, "mean_token_accuracy": 0.2150818407535553, "num_tokens": 81273968.0, "step": 46860 }, { "entropy": 5.39545316696167, "epoch": 3.6462555922972184, "grad_norm": 1.1484375, "learning_rate": 0.00037101695861361384, "loss": 4.8666, "mean_token_accuracy": 0.20519386231899261, "num_tokens": 81283511.0, "step": 46865 }, { "entropy": 5.364624309539795, "epoch": 3.646644621668936, "grad_norm": 1.1640625, "learning_rate": 0.00037099189264521446, "loss": 4.8585, "mean_token_accuracy": 0.2102563723921776, "num_tokens": 81292399.0, "step": 46870 }, { "entropy": 5.334155416488647, "epoch": 3.647033651040654, "grad_norm": 1.140625, "learning_rate": 0.0003709668252202909, "loss": 4.909, "mean_token_accuracy": 0.20831002593040465, "num_tokens": 81300670.0, "step": 46875 }, { "entropy": 5.37366828918457, "epoch": 3.647422680412371, "grad_norm": 1.1171875, "learning_rate": 0.0003709417563392235, "loss": 4.8265, "mean_token_accuracy": 0.21570503413677217, "num_tokens": 81309419.0, "step": 46880 }, { "entropy": 5.398037099838257, "epoch": 3.6478117097840888, "grad_norm": 1.1171875, "learning_rate": 0.0003709166860023926, "loss": 4.8604, "mean_token_accuracy": 0.21377164572477342, "num_tokens": 81318349.0, "step": 46885 }, { "entropy": 5.356763887405395, "epoch": 3.648200739155806, "grad_norm": 1.1015625, "learning_rate": 0.00037089161421017874, "loss": 4.8619, "mean_token_accuracy": 0.21135079711675644, "num_tokens": 81326715.0, "step": 46890 }, { "entropy": 5.285213422775269, "epoch": 3.6485897685275237, "grad_norm": 1.125, "learning_rate": 0.00037086654096296217, "loss": 4.7673, "mean_token_accuracy": 0.22384574711322786, "num_tokens": 81335113.0, "step": 46895 }, { "entropy": 5.453222179412842, "epoch": 3.6489787978992414, "grad_norm": 1.1328125, "learning_rate": 0.0003708414662611235, "loss": 4.9635, "mean_token_accuracy": 0.20365542322397232, "num_tokens": 81343928.0, "step": 46900 }, { "entropy": 5.377603530883789, "epoch": 3.649367827270959, "grad_norm": 1.1328125, "learning_rate": 0.0003708163901050432, "loss": 4.8164, "mean_token_accuracy": 0.21860815435647965, "num_tokens": 81352244.0, "step": 46905 }, { "entropy": 5.354126405715943, "epoch": 3.649756856642677, "grad_norm": 1.140625, "learning_rate": 0.00037079131249510155, "loss": 4.8796, "mean_token_accuracy": 0.21360485553741454, "num_tokens": 81361769.0, "step": 46910 }, { "entropy": 5.382349157333374, "epoch": 3.650145886014394, "grad_norm": 1.1015625, "learning_rate": 0.0003707662334316793, "loss": 4.816, "mean_token_accuracy": 0.21640096008777618, "num_tokens": 81369936.0, "step": 46915 }, { "entropy": 5.368713855743408, "epoch": 3.6505349153861117, "grad_norm": 1.0859375, "learning_rate": 0.0003707411529151568, "loss": 4.8638, "mean_token_accuracy": 0.21717785000801088, "num_tokens": 81379846.0, "step": 46920 }, { "entropy": 5.362018394470215, "epoch": 3.650923944757829, "grad_norm": 1.109375, "learning_rate": 0.0003707160709459147, "loss": 4.8188, "mean_token_accuracy": 0.21400633752346038, "num_tokens": 81388123.0, "step": 46925 }, { "entropy": 5.44135799407959, "epoch": 3.6513129741295467, "grad_norm": 1.125, "learning_rate": 0.0003706909875243336, "loss": 4.9276, "mean_token_accuracy": 0.2067818373441696, "num_tokens": 81397000.0, "step": 46930 }, { "entropy": 5.38765025138855, "epoch": 3.6517020035012644, "grad_norm": 1.109375, "learning_rate": 0.000370665902650794, "loss": 4.9191, "mean_token_accuracy": 0.2051563248038292, "num_tokens": 81406218.0, "step": 46935 }, { "entropy": 5.389194583892822, "epoch": 3.652091032872982, "grad_norm": 1.1171875, "learning_rate": 0.00037064081632567675, "loss": 4.7837, "mean_token_accuracy": 0.21756212711334227, "num_tokens": 81414934.0, "step": 46940 }, { "entropy": 5.3309876918792725, "epoch": 3.6524800622446993, "grad_norm": 1.234375, "learning_rate": 0.00037061572854936225, "loss": 4.769, "mean_token_accuracy": 0.2158322274684906, "num_tokens": 81423345.0, "step": 46945 }, { "entropy": 5.344428634643554, "epoch": 3.652869091616417, "grad_norm": 1.0625, "learning_rate": 0.0003705906393222313, "loss": 4.8029, "mean_token_accuracy": 0.21828072369098664, "num_tokens": 81431858.0, "step": 46950 }, { "entropy": 5.438388013839722, "epoch": 3.6532581209881347, "grad_norm": 1.125, "learning_rate": 0.0003705655486446645, "loss": 4.9306, "mean_token_accuracy": 0.2076655849814415, "num_tokens": 81440538.0, "step": 46955 }, { "entropy": 5.480002212524414, "epoch": 3.653647150359852, "grad_norm": 1.1484375, "learning_rate": 0.0003705404565170426, "loss": 4.9274, "mean_token_accuracy": 0.21332752406597139, "num_tokens": 81449187.0, "step": 46960 }, { "entropy": 5.356939315795898, "epoch": 3.6540361797315697, "grad_norm": 1.0703125, "learning_rate": 0.0003705153629397463, "loss": 4.746, "mean_token_accuracy": 0.21789834648370743, "num_tokens": 81456708.0, "step": 46965 }, { "entropy": 5.361954927444458, "epoch": 3.6544252091032874, "grad_norm": 1.2265625, "learning_rate": 0.00037049026791315646, "loss": 4.8838, "mean_token_accuracy": 0.20844581425189973, "num_tokens": 81464933.0, "step": 46970 }, { "entropy": 5.3753955364227295, "epoch": 3.654814238475005, "grad_norm": 1.171875, "learning_rate": 0.0003704651714376538, "loss": 4.9295, "mean_token_accuracy": 0.21061077266931533, "num_tokens": 81473846.0, "step": 46975 }, { "entropy": 5.362191104888916, "epoch": 3.6552032678467223, "grad_norm": 1.140625, "learning_rate": 0.0003704400735136191, "loss": 4.7681, "mean_token_accuracy": 0.22042788714170455, "num_tokens": 81481928.0, "step": 46980 }, { "entropy": 5.427572345733642, "epoch": 3.65559229721844, "grad_norm": 1.1484375, "learning_rate": 0.0003704149741414332, "loss": 4.9871, "mean_token_accuracy": 0.19762064069509505, "num_tokens": 81490913.0, "step": 46985 }, { "entropy": 5.463778257369995, "epoch": 3.6559813265901573, "grad_norm": 1.1015625, "learning_rate": 0.0003703898733214769, "loss": 4.942, "mean_token_accuracy": 0.20737839341163636, "num_tokens": 81499779.0, "step": 46990 }, { "entropy": 5.324742412567138, "epoch": 3.656370355961875, "grad_norm": 1.125, "learning_rate": 0.0003703647710541311, "loss": 4.8302, "mean_token_accuracy": 0.21601635068655015, "num_tokens": 81507707.0, "step": 46995 }, { "entropy": 5.318167304992675, "epoch": 3.6567593853335927, "grad_norm": 1.09375, "learning_rate": 0.0003703396673397768, "loss": 4.848, "mean_token_accuracy": 0.21239372193813325, "num_tokens": 81516418.0, "step": 47000 }, { "entropy": 5.38788104057312, "epoch": 3.6571484147053104, "grad_norm": 1.15625, "learning_rate": 0.0003703145621787947, "loss": 4.8326, "mean_token_accuracy": 0.21541489958763121, "num_tokens": 81525218.0, "step": 47005 }, { "entropy": 5.28867917060852, "epoch": 3.657537444077028, "grad_norm": 1.1484375, "learning_rate": 0.00037028945557156587, "loss": 4.7487, "mean_token_accuracy": 0.22531513571739198, "num_tokens": 81533739.0, "step": 47010 }, { "entropy": 5.315992832183838, "epoch": 3.6579264734487453, "grad_norm": 1.109375, "learning_rate": 0.00037026434751847117, "loss": 4.8126, "mean_token_accuracy": 0.21803421080112456, "num_tokens": 81541967.0, "step": 47015 }, { "entropy": 5.38592209815979, "epoch": 3.658315502820463, "grad_norm": 1.1484375, "learning_rate": 0.00037023923801989163, "loss": 4.8622, "mean_token_accuracy": 0.20761808902025222, "num_tokens": 81549892.0, "step": 47020 }, { "entropy": 5.346289110183716, "epoch": 3.6587045321921803, "grad_norm": 1.1484375, "learning_rate": 0.0003702141270762083, "loss": 4.8172, "mean_token_accuracy": 0.2110361784696579, "num_tokens": 81558441.0, "step": 47025 }, { "entropy": 5.4026021480560305, "epoch": 3.659093561563898, "grad_norm": 1.21875, "learning_rate": 0.00037018901468780207, "loss": 4.9364, "mean_token_accuracy": 0.2145633652806282, "num_tokens": 81566753.0, "step": 47030 }, { "entropy": 5.471596193313599, "epoch": 3.6594825909356157, "grad_norm": 1.0859375, "learning_rate": 0.0003701639008550541, "loss": 4.9614, "mean_token_accuracy": 0.20758402794599534, "num_tokens": 81575038.0, "step": 47035 }, { "entropy": 5.376137733459473, "epoch": 3.6598716203073334, "grad_norm": 1.203125, "learning_rate": 0.0003701387855783454, "loss": 4.8239, "mean_token_accuracy": 0.21505968719720842, "num_tokens": 81584016.0, "step": 47040 }, { "entropy": 5.425729417800904, "epoch": 3.6602606496790506, "grad_norm": 1.1875, "learning_rate": 0.000370113668858057, "loss": 4.8672, "mean_token_accuracy": 0.2121990904211998, "num_tokens": 81592757.0, "step": 47045 }, { "entropy": 5.3454344272613525, "epoch": 3.6606496790507683, "grad_norm": 1.1640625, "learning_rate": 0.0003700885506945701, "loss": 4.857, "mean_token_accuracy": 0.2155336007475853, "num_tokens": 81601225.0, "step": 47050 }, { "entropy": 5.391754627227783, "epoch": 3.661038708422486, "grad_norm": 1.09375, "learning_rate": 0.0003700634310882658, "loss": 4.9223, "mean_token_accuracy": 0.2033282607793808, "num_tokens": 81610043.0, "step": 47055 }, { "entropy": 5.4308788776397705, "epoch": 3.6614277377942033, "grad_norm": 1.234375, "learning_rate": 0.00037003831003952525, "loss": 4.845, "mean_token_accuracy": 0.2185583606362343, "num_tokens": 81618540.0, "step": 47060 }, { "entropy": 5.3553272724151615, "epoch": 3.661816767165921, "grad_norm": 1.1171875, "learning_rate": 0.00037001318754872957, "loss": 4.8034, "mean_token_accuracy": 0.22531151175498962, "num_tokens": 81626682.0, "step": 47065 }, { "entropy": 5.260670137405396, "epoch": 3.6622057965376387, "grad_norm": 1.1953125, "learning_rate": 0.00036998806361626, "loss": 4.8731, "mean_token_accuracy": 0.2156827598810196, "num_tokens": 81635917.0, "step": 47070 }, { "entropy": 5.301696825027466, "epoch": 3.6625948259093564, "grad_norm": 1.1953125, "learning_rate": 0.0003699629382424979, "loss": 4.8204, "mean_token_accuracy": 0.21608836501836776, "num_tokens": 81644306.0, "step": 47075 }, { "entropy": 5.430362844467163, "epoch": 3.6629838552810736, "grad_norm": 1.125, "learning_rate": 0.00036993781142782416, "loss": 4.8949, "mean_token_accuracy": 0.20389288812875747, "num_tokens": 81653207.0, "step": 47080 }, { "entropy": 5.429917192459106, "epoch": 3.6633728846527913, "grad_norm": 1.171875, "learning_rate": 0.00036991268317262033, "loss": 4.8749, "mean_token_accuracy": 0.2133514925837517, "num_tokens": 81661126.0, "step": 47085 }, { "entropy": 5.334979772567749, "epoch": 3.663761914024509, "grad_norm": 1.0703125, "learning_rate": 0.00036988755347726766, "loss": 4.8369, "mean_token_accuracy": 0.2151196852326393, "num_tokens": 81670721.0, "step": 47090 }, { "entropy": 5.367210721969604, "epoch": 3.6641509433962263, "grad_norm": 1.1015625, "learning_rate": 0.00036986242234214736, "loss": 4.9304, "mean_token_accuracy": 0.20234448909759523, "num_tokens": 81680281.0, "step": 47095 }, { "entropy": 5.41204981803894, "epoch": 3.664539972767944, "grad_norm": 1.078125, "learning_rate": 0.00036983728976764074, "loss": 4.825, "mean_token_accuracy": 0.21472640633583068, "num_tokens": 81688727.0, "step": 47100 }, { "entropy": 5.3155848503112795, "epoch": 3.6649290021396617, "grad_norm": 1.1484375, "learning_rate": 0.00036981215575412923, "loss": 4.8198, "mean_token_accuracy": 0.2170701116323471, "num_tokens": 81697903.0, "step": 47105 }, { "entropy": 5.31125545501709, "epoch": 3.6653180315113794, "grad_norm": 1.1796875, "learning_rate": 0.0003697870203019942, "loss": 4.8554, "mean_token_accuracy": 0.21162189543247223, "num_tokens": 81705712.0, "step": 47110 }, { "entropy": 5.397530841827392, "epoch": 3.6657070608830966, "grad_norm": 1.109375, "learning_rate": 0.00036976188341161694, "loss": 4.9079, "mean_token_accuracy": 0.21045473366975784, "num_tokens": 81714787.0, "step": 47115 }, { "entropy": 5.355281972885132, "epoch": 3.6660960902548143, "grad_norm": 1.125, "learning_rate": 0.0003697367450833789, "loss": 4.8537, "mean_token_accuracy": 0.2026073768734932, "num_tokens": 81723891.0, "step": 47120 }, { "entropy": 5.299651098251343, "epoch": 3.6664851196265316, "grad_norm": 1.1796875, "learning_rate": 0.00036971160531766155, "loss": 4.7882, "mean_token_accuracy": 0.2148401767015457, "num_tokens": 81733054.0, "step": 47125 }, { "entropy": 5.342397403717041, "epoch": 3.6668741489982493, "grad_norm": 1.125, "learning_rate": 0.0003696864641148465, "loss": 4.8464, "mean_token_accuracy": 0.2183964654803276, "num_tokens": 81742065.0, "step": 47130 }, { "entropy": 5.325996446609497, "epoch": 3.667263178369967, "grad_norm": 1.1015625, "learning_rate": 0.00036966132147531487, "loss": 4.8359, "mean_token_accuracy": 0.22014235109090804, "num_tokens": 81751011.0, "step": 47135 }, { "entropy": 5.430106687545776, "epoch": 3.6676522077416847, "grad_norm": 1.1796875, "learning_rate": 0.00036963617739944844, "loss": 4.9158, "mean_token_accuracy": 0.21342725306749344, "num_tokens": 81759864.0, "step": 47140 }, { "entropy": 5.388666200637817, "epoch": 3.668041237113402, "grad_norm": 1.1484375, "learning_rate": 0.00036961103188762866, "loss": 4.8818, "mean_token_accuracy": 0.20579354017972945, "num_tokens": 81769420.0, "step": 47145 }, { "entropy": 5.297831201553345, "epoch": 3.6684302664851196, "grad_norm": 1.21875, "learning_rate": 0.00036958588494023705, "loss": 4.8027, "mean_token_accuracy": 0.21736599057912825, "num_tokens": 81777544.0, "step": 47150 }, { "entropy": 5.332208824157715, "epoch": 3.6688192958568373, "grad_norm": 1.09375, "learning_rate": 0.0003695607365576551, "loss": 4.7744, "mean_token_accuracy": 0.2245257467031479, "num_tokens": 81785418.0, "step": 47155 }, { "entropy": 5.32034649848938, "epoch": 3.6692083252285546, "grad_norm": 1.0546875, "learning_rate": 0.0003695355867402646, "loss": 4.88, "mean_token_accuracy": 0.21258388310670853, "num_tokens": 81794584.0, "step": 47160 }, { "entropy": 5.322759437561035, "epoch": 3.6695973546002723, "grad_norm": 1.125, "learning_rate": 0.000369510435488447, "loss": 4.8047, "mean_token_accuracy": 0.21999323666095733, "num_tokens": 81802950.0, "step": 47165 }, { "entropy": 5.338032007217407, "epoch": 3.66998638397199, "grad_norm": 1.125, "learning_rate": 0.000369485282802584, "loss": 4.7593, "mean_token_accuracy": 0.2175430417060852, "num_tokens": 81812092.0, "step": 47170 }, { "entropy": 5.417027711868286, "epoch": 3.6703754133437076, "grad_norm": 1.0703125, "learning_rate": 0.00036946012868305716, "loss": 4.9271, "mean_token_accuracy": 0.20586876422166825, "num_tokens": 81821437.0, "step": 47175 }, { "entropy": 5.378199195861816, "epoch": 3.670764442715425, "grad_norm": 1.15625, "learning_rate": 0.0003694349731302483, "loss": 4.9328, "mean_token_accuracy": 0.20728449523448944, "num_tokens": 81830207.0, "step": 47180 }, { "entropy": 5.446003437042236, "epoch": 3.6711534720871426, "grad_norm": 1.1953125, "learning_rate": 0.0003694098161445389, "loss": 4.9787, "mean_token_accuracy": 0.20525303930044175, "num_tokens": 81838664.0, "step": 47185 }, { "entropy": 5.336422634124756, "epoch": 3.6715425014588603, "grad_norm": 1.1328125, "learning_rate": 0.0003693846577263109, "loss": 4.8433, "mean_token_accuracy": 0.21650296002626418, "num_tokens": 81846606.0, "step": 47190 }, { "entropy": 5.380356645584106, "epoch": 3.6719315308305776, "grad_norm": 1.03125, "learning_rate": 0.0003693594978759459, "loss": 4.954, "mean_token_accuracy": 0.20728806406259537, "num_tokens": 81855925.0, "step": 47195 }, { "entropy": 5.358998012542725, "epoch": 3.6723205602022952, "grad_norm": 1.1484375, "learning_rate": 0.00036933433659382575, "loss": 4.7907, "mean_token_accuracy": 0.21966007649898528, "num_tokens": 81864113.0, "step": 47200 }, { "entropy": 5.338566541671753, "epoch": 3.672709589574013, "grad_norm": 1.1015625, "learning_rate": 0.0003693091738803322, "loss": 4.8895, "mean_token_accuracy": 0.20016815215349198, "num_tokens": 81873325.0, "step": 47205 }, { "entropy": 5.382515907287598, "epoch": 3.6730986189457306, "grad_norm": 1.0859375, "learning_rate": 0.000369284009735847, "loss": 4.9019, "mean_token_accuracy": 0.21370816379785537, "num_tokens": 81881835.0, "step": 47210 }, { "entropy": 5.466736221313477, "epoch": 3.673487648317448, "grad_norm": 1.203125, "learning_rate": 0.0003692588441607521, "loss": 4.9885, "mean_token_accuracy": 0.2003921702504158, "num_tokens": 81890402.0, "step": 47215 }, { "entropy": 5.4390253067016605, "epoch": 3.6738766776891656, "grad_norm": 1.1875, "learning_rate": 0.00036923367715542923, "loss": 4.8789, "mean_token_accuracy": 0.2064184531569481, "num_tokens": 81898742.0, "step": 47220 }, { "entropy": 5.3671056747436525, "epoch": 3.674265707060883, "grad_norm": 1.1953125, "learning_rate": 0.00036920850872026025, "loss": 4.8298, "mean_token_accuracy": 0.21612456291913987, "num_tokens": 81906845.0, "step": 47225 }, { "entropy": 5.275747680664063, "epoch": 3.6746547364326005, "grad_norm": 1.109375, "learning_rate": 0.0003691833388556272, "loss": 4.6896, "mean_token_accuracy": 0.2199362874031067, "num_tokens": 81914825.0, "step": 47230 }, { "entropy": 5.36029839515686, "epoch": 3.6750437658043182, "grad_norm": 1.0859375, "learning_rate": 0.0003691581675619118, "loss": 4.8302, "mean_token_accuracy": 0.21252372860908508, "num_tokens": 81923626.0, "step": 47235 }, { "entropy": 5.363822889328003, "epoch": 3.675432795176036, "grad_norm": 1.09375, "learning_rate": 0.0003691329948394961, "loss": 4.8715, "mean_token_accuracy": 0.2050026535987854, "num_tokens": 81932515.0, "step": 47240 }, { "entropy": 5.388404083251953, "epoch": 3.675821824547753, "grad_norm": 1.1328125, "learning_rate": 0.00036910782068876204, "loss": 4.834, "mean_token_accuracy": 0.21149262934923171, "num_tokens": 81941797.0, "step": 47245 }, { "entropy": 5.359037208557129, "epoch": 3.676210853919471, "grad_norm": 1.078125, "learning_rate": 0.00036908264511009155, "loss": 4.8572, "mean_token_accuracy": 0.21346010714769365, "num_tokens": 81949917.0, "step": 47250 }, { "entropy": 5.408670282363891, "epoch": 3.6765998832911886, "grad_norm": 1.078125, "learning_rate": 0.0003690574681038667, "loss": 4.8944, "mean_token_accuracy": 0.20366846919059753, "num_tokens": 81958901.0, "step": 47255 }, { "entropy": 5.372065258026123, "epoch": 3.676988912662906, "grad_norm": 1.0390625, "learning_rate": 0.00036903228967046946, "loss": 4.8671, "mean_token_accuracy": 0.21343590468168258, "num_tokens": 81967491.0, "step": 47260 }, { "entropy": 5.307934999465942, "epoch": 3.6773779420346235, "grad_norm": 1.1875, "learning_rate": 0.0003690071098102819, "loss": 4.743, "mean_token_accuracy": 0.21796633750200273, "num_tokens": 81976046.0, "step": 47265 }, { "entropy": 5.386505222320556, "epoch": 3.6777669714063412, "grad_norm": 1.125, "learning_rate": 0.0003689819285236861, "loss": 4.8994, "mean_token_accuracy": 0.20982520580291747, "num_tokens": 81984573.0, "step": 47270 }, { "entropy": 5.333456802368164, "epoch": 3.678156000778059, "grad_norm": 1.1015625, "learning_rate": 0.00036895674581106415, "loss": 4.8238, "mean_token_accuracy": 0.2167393907904625, "num_tokens": 81993992.0, "step": 47275 }, { "entropy": 5.399825572967529, "epoch": 3.678545030149776, "grad_norm": 1.2421875, "learning_rate": 0.00036893156167279803, "loss": 4.8164, "mean_token_accuracy": 0.21511218100786209, "num_tokens": 82002715.0, "step": 47280 }, { "entropy": 5.33726806640625, "epoch": 3.678934059521494, "grad_norm": 1.1328125, "learning_rate": 0.0003689063761092701, "loss": 4.8766, "mean_token_accuracy": 0.21589206159114838, "num_tokens": 82011692.0, "step": 47285 }, { "entropy": 5.301930952072143, "epoch": 3.6793230888932116, "grad_norm": 1.0234375, "learning_rate": 0.00036888118912086225, "loss": 4.8191, "mean_token_accuracy": 0.21329231411218644, "num_tokens": 82021082.0, "step": 47290 }, { "entropy": 5.325025606155395, "epoch": 3.679712118264929, "grad_norm": 1.2265625, "learning_rate": 0.0003688560007079569, "loss": 4.8032, "mean_token_accuracy": 0.2181471109390259, "num_tokens": 82029834.0, "step": 47295 }, { "entropy": 5.380826616287232, "epoch": 3.6801011476366465, "grad_norm": 1.125, "learning_rate": 0.000368830810870936, "loss": 4.838, "mean_token_accuracy": 0.21597159206867217, "num_tokens": 82038486.0, "step": 47300 }, { "entropy": 5.427830410003662, "epoch": 3.6804901770083642, "grad_norm": 1.140625, "learning_rate": 0.000368805619610182, "loss": 4.8848, "mean_token_accuracy": 0.20869013667106628, "num_tokens": 82047034.0, "step": 47305 }, { "entropy": 5.325745534896851, "epoch": 3.680879206380082, "grad_norm": 1.1015625, "learning_rate": 0.00036878042692607693, "loss": 4.792, "mean_token_accuracy": 0.2241353139281273, "num_tokens": 82056243.0, "step": 47310 }, { "entropy": 5.366618347167969, "epoch": 3.681268235751799, "grad_norm": 1.1484375, "learning_rate": 0.00036875523281900324, "loss": 4.8776, "mean_token_accuracy": 0.22416869550943375, "num_tokens": 82064345.0, "step": 47315 }, { "entropy": 5.260969114303589, "epoch": 3.681657265123517, "grad_norm": 1.2109375, "learning_rate": 0.0003687300372893431, "loss": 4.7393, "mean_token_accuracy": 0.21943260878324508, "num_tokens": 82071755.0, "step": 47320 }, { "entropy": 5.274215841293335, "epoch": 3.682046294495234, "grad_norm": 1.078125, "learning_rate": 0.00036870484033747883, "loss": 4.8347, "mean_token_accuracy": 0.2142368584871292, "num_tokens": 82080435.0, "step": 47325 }, { "entropy": 5.334148597717285, "epoch": 3.682435323866952, "grad_norm": 1.1875, "learning_rate": 0.00036867964196379274, "loss": 4.9406, "mean_token_accuracy": 0.20686953365802765, "num_tokens": 82089092.0, "step": 47330 }, { "entropy": 5.335886907577515, "epoch": 3.6828243532386695, "grad_norm": 1.1796875, "learning_rate": 0.0003686544421686672, "loss": 4.7988, "mean_token_accuracy": 0.21934151500463486, "num_tokens": 82097431.0, "step": 47335 }, { "entropy": 5.417931938171387, "epoch": 3.683213382610387, "grad_norm": 1.359375, "learning_rate": 0.00036862924095248457, "loss": 4.9147, "mean_token_accuracy": 0.2179303526878357, "num_tokens": 82106785.0, "step": 47340 }, { "entropy": 5.35706582069397, "epoch": 3.683602411982105, "grad_norm": 1.234375, "learning_rate": 0.00036860403831562717, "loss": 4.917, "mean_token_accuracy": 0.20302112251520157, "num_tokens": 82115742.0, "step": 47345 }, { "entropy": 5.320372295379639, "epoch": 3.683991441353822, "grad_norm": 1.1015625, "learning_rate": 0.0003685788342584775, "loss": 4.8422, "mean_token_accuracy": 0.2185914024710655, "num_tokens": 82124316.0, "step": 47350 }, { "entropy": 5.373825645446777, "epoch": 3.68438047072554, "grad_norm": 1.1796875, "learning_rate": 0.000368553628781418, "loss": 4.8031, "mean_token_accuracy": 0.21866165697574616, "num_tokens": 82133057.0, "step": 47355 }, { "entropy": 5.355614280700683, "epoch": 3.684769500097257, "grad_norm": 1.1640625, "learning_rate": 0.0003685284218848311, "loss": 4.8797, "mean_token_accuracy": 0.21816698610782623, "num_tokens": 82141680.0, "step": 47360 }, { "entropy": 5.294845485687256, "epoch": 3.685158529468975, "grad_norm": 1.234375, "learning_rate": 0.00036850321356909926, "loss": 4.84, "mean_token_accuracy": 0.21362229138612748, "num_tokens": 82150336.0, "step": 47365 }, { "entropy": 5.456057691574097, "epoch": 3.6855475588406925, "grad_norm": 1.1796875, "learning_rate": 0.00036847800383460493, "loss": 4.9012, "mean_token_accuracy": 0.21581654995679855, "num_tokens": 82158651.0, "step": 47370 }, { "entropy": 5.380819606781006, "epoch": 3.68593658821241, "grad_norm": 1.09375, "learning_rate": 0.00036845279268173076, "loss": 4.8334, "mean_token_accuracy": 0.21854581981897353, "num_tokens": 82167364.0, "step": 47375 }, { "entropy": 5.3959205627441404, "epoch": 3.6863256175841275, "grad_norm": 1.0546875, "learning_rate": 0.00036842758011085914, "loss": 4.9125, "mean_token_accuracy": 0.2078518897294998, "num_tokens": 82176841.0, "step": 47380 }, { "entropy": 5.414372825622559, "epoch": 3.686714646955845, "grad_norm": 1.1484375, "learning_rate": 0.0003684023661223727, "loss": 4.8923, "mean_token_accuracy": 0.20744656175374984, "num_tokens": 82185541.0, "step": 47385 }, { "entropy": 5.359154844284058, "epoch": 3.687103676327563, "grad_norm": 1.125, "learning_rate": 0.00036837715071665403, "loss": 4.8886, "mean_token_accuracy": 0.20280827432870865, "num_tokens": 82194406.0, "step": 47390 }, { "entropy": 5.339507293701172, "epoch": 3.68749270569928, "grad_norm": 1.140625, "learning_rate": 0.0003683519338940857, "loss": 4.8164, "mean_token_accuracy": 0.21961307674646377, "num_tokens": 82203372.0, "step": 47395 }, { "entropy": 5.45060977935791, "epoch": 3.687881735070998, "grad_norm": 1.1953125, "learning_rate": 0.00036832671565505045, "loss": 4.9398, "mean_token_accuracy": 0.21270493865013124, "num_tokens": 82211467.0, "step": 47400 }, { "entropy": 5.413046550750733, "epoch": 3.6882707644427155, "grad_norm": 1.109375, "learning_rate": 0.0003683014959999307, "loss": 4.9226, "mean_token_accuracy": 0.2089463546872139, "num_tokens": 82220317.0, "step": 47405 }, { "entropy": 5.406777667999267, "epoch": 3.688659793814433, "grad_norm": 1.234375, "learning_rate": 0.0003682762749291094, "loss": 4.8302, "mean_token_accuracy": 0.21259994059801102, "num_tokens": 82228474.0, "step": 47410 }, { "entropy": 5.346289873123169, "epoch": 3.6890488231861505, "grad_norm": 1.09375, "learning_rate": 0.000368251052442969, "loss": 4.8298, "mean_token_accuracy": 0.21342036575078965, "num_tokens": 82237463.0, "step": 47415 }, { "entropy": 5.353835868835449, "epoch": 3.689437852557868, "grad_norm": 1.0625, "learning_rate": 0.00036822582854189234, "loss": 4.9171, "mean_token_accuracy": 0.20954884588718414, "num_tokens": 82245909.0, "step": 47420 }, { "entropy": 5.383306455612183, "epoch": 3.6898268819295854, "grad_norm": 1.078125, "learning_rate": 0.000368200603226262, "loss": 4.8304, "mean_token_accuracy": 0.2177188888192177, "num_tokens": 82254497.0, "step": 47425 }, { "entropy": 5.431554460525513, "epoch": 3.690215911301303, "grad_norm": 1.2421875, "learning_rate": 0.000368175376496461, "loss": 4.9673, "mean_token_accuracy": 0.200039803981781, "num_tokens": 82262250.0, "step": 47430 }, { "entropy": 5.399050188064575, "epoch": 3.690604940673021, "grad_norm": 1.1796875, "learning_rate": 0.0003681501483528719, "loss": 4.9471, "mean_token_accuracy": 0.2116875097155571, "num_tokens": 82271645.0, "step": 47435 }, { "entropy": 5.360663986206054, "epoch": 3.6909939700447385, "grad_norm": 1.1796875, "learning_rate": 0.0003681249187958776, "loss": 4.7818, "mean_token_accuracy": 0.21456883400678634, "num_tokens": 82280244.0, "step": 47440 }, { "entropy": 5.417734384536743, "epoch": 3.691382999416456, "grad_norm": 1.21875, "learning_rate": 0.00036809968782586087, "loss": 4.8733, "mean_token_accuracy": 0.2139945611357689, "num_tokens": 82288777.0, "step": 47445 }, { "entropy": 5.401992464065552, "epoch": 3.6917720287881735, "grad_norm": 1.03125, "learning_rate": 0.0003680744554432045, "loss": 4.9001, "mean_token_accuracy": 0.206680503487587, "num_tokens": 82297651.0, "step": 47450 }, { "entropy": 5.412092971801758, "epoch": 3.692161058159891, "grad_norm": 1.2890625, "learning_rate": 0.00036804922164829153, "loss": 4.9212, "mean_token_accuracy": 0.20225875824689865, "num_tokens": 82306142.0, "step": 47455 }, { "entropy": 5.419519138336182, "epoch": 3.6925500875316084, "grad_norm": 1.2421875, "learning_rate": 0.0003680239864415046, "loss": 4.9479, "mean_token_accuracy": 0.20086863040924072, "num_tokens": 82314812.0, "step": 47460 }, { "entropy": 5.359300422668457, "epoch": 3.692939116903326, "grad_norm": 1.1875, "learning_rate": 0.0003679987498232268, "loss": 4.7848, "mean_token_accuracy": 0.2154761478304863, "num_tokens": 82323776.0, "step": 47465 }, { "entropy": 5.390937185287475, "epoch": 3.693328146275044, "grad_norm": 1.234375, "learning_rate": 0.000367973511793841, "loss": 4.7839, "mean_token_accuracy": 0.223929700255394, "num_tokens": 82331846.0, "step": 47470 }, { "entropy": 5.334718132019043, "epoch": 3.6937171756467615, "grad_norm": 1.1640625, "learning_rate": 0.00036794827235373006, "loss": 4.9106, "mean_token_accuracy": 0.20874475836753845, "num_tokens": 82340609.0, "step": 47475 }, { "entropy": 5.406247186660766, "epoch": 3.6941062050184788, "grad_norm": 1.1328125, "learning_rate": 0.0003679230315032772, "loss": 4.864, "mean_token_accuracy": 0.21097481697797776, "num_tokens": 82350023.0, "step": 47480 }, { "entropy": 5.405655097961426, "epoch": 3.6944952343901964, "grad_norm": 1.109375, "learning_rate": 0.0003678977892428651, "loss": 4.8516, "mean_token_accuracy": 0.21300053894519805, "num_tokens": 82358570.0, "step": 47485 }, { "entropy": 5.354764461517334, "epoch": 3.694884263761914, "grad_norm": 1.078125, "learning_rate": 0.0003678725455728769, "loss": 4.8184, "mean_token_accuracy": 0.21519537270069122, "num_tokens": 82366747.0, "step": 47490 }, { "entropy": 5.447524309158325, "epoch": 3.6952732931336314, "grad_norm": 1.125, "learning_rate": 0.00036784730049369577, "loss": 4.9965, "mean_token_accuracy": 0.19718868732452394, "num_tokens": 82376553.0, "step": 47495 }, { "entropy": 5.348805236816406, "epoch": 3.695662322505349, "grad_norm": 1.203125, "learning_rate": 0.0003678220540057045, "loss": 4.7802, "mean_token_accuracy": 0.21932324320077895, "num_tokens": 82384859.0, "step": 47500 }, { "entropy": 5.346302175521851, "epoch": 3.696051351877067, "grad_norm": 1.3046875, "learning_rate": 0.00036779680610928635, "loss": 4.8264, "mean_token_accuracy": 0.21634551733732224, "num_tokens": 82392636.0, "step": 47505 }, { "entropy": 5.360527086257934, "epoch": 3.6964403812487845, "grad_norm": 1.140625, "learning_rate": 0.0003677715568048244, "loss": 4.8742, "mean_token_accuracy": 0.21590301245450974, "num_tokens": 82401833.0, "step": 47510 }, { "entropy": 5.25359354019165, "epoch": 3.6968294106205017, "grad_norm": 1.109375, "learning_rate": 0.00036774630609270165, "loss": 4.683, "mean_token_accuracy": 0.22805102467536925, "num_tokens": 82410081.0, "step": 47515 }, { "entropy": 5.433086109161377, "epoch": 3.6972184399922194, "grad_norm": 1.125, "learning_rate": 0.00036772105397330147, "loss": 4.9338, "mean_token_accuracy": 0.20512235313653945, "num_tokens": 82418652.0, "step": 47520 }, { "entropy": 5.3614586353302, "epoch": 3.697607469363937, "grad_norm": 1.171875, "learning_rate": 0.0003676958004470067, "loss": 4.8149, "mean_token_accuracy": 0.21614805459976197, "num_tokens": 82426776.0, "step": 47525 }, { "entropy": 5.245257329940796, "epoch": 3.6979964987356544, "grad_norm": 1.21875, "learning_rate": 0.0003676705455142009, "loss": 4.7467, "mean_token_accuracy": 0.2233837604522705, "num_tokens": 82435624.0, "step": 47530 }, { "entropy": 5.384545135498047, "epoch": 3.698385528107372, "grad_norm": 1.1171875, "learning_rate": 0.0003676452891752669, "loss": 4.9131, "mean_token_accuracy": 0.21032561957836152, "num_tokens": 82444224.0, "step": 47535 }, { "entropy": 5.447855710983276, "epoch": 3.69877455747909, "grad_norm": 1.1796875, "learning_rate": 0.0003676200314305882, "loss": 4.9538, "mean_token_accuracy": 0.20316437929868697, "num_tokens": 82452527.0, "step": 47540 }, { "entropy": 5.411064910888672, "epoch": 3.6991635868508075, "grad_norm": 1.1484375, "learning_rate": 0.0003675947722805479, "loss": 4.8051, "mean_token_accuracy": 0.22199366241693497, "num_tokens": 82460180.0, "step": 47545 }, { "entropy": 5.37548828125, "epoch": 3.6995526162225247, "grad_norm": 1.140625, "learning_rate": 0.0003675695117255293, "loss": 4.8527, "mean_token_accuracy": 0.20894798189401625, "num_tokens": 82468725.0, "step": 47550 }, { "entropy": 5.406736755371094, "epoch": 3.6999416455942424, "grad_norm": 1.15625, "learning_rate": 0.0003675442497659157, "loss": 4.8867, "mean_token_accuracy": 0.20724343955516816, "num_tokens": 82477070.0, "step": 47555 }, { "entropy": 5.340423345565796, "epoch": 3.7003306749659597, "grad_norm": 1.1328125, "learning_rate": 0.0003675189864020905, "loss": 4.8139, "mean_token_accuracy": 0.2193831041455269, "num_tokens": 82485960.0, "step": 47560 }, { "entropy": 5.268238639831543, "epoch": 3.7007197043376774, "grad_norm": 1.078125, "learning_rate": 0.0003674937216344368, "loss": 4.7338, "mean_token_accuracy": 0.21971870511770247, "num_tokens": 82494498.0, "step": 47565 }, { "entropy": 5.387840986251831, "epoch": 3.701108733709395, "grad_norm": 1.09375, "learning_rate": 0.0003674684554633382, "loss": 4.8695, "mean_token_accuracy": 0.20704305320978164, "num_tokens": 82504505.0, "step": 47570 }, { "entropy": 5.326870632171631, "epoch": 3.701497763081113, "grad_norm": 1.203125, "learning_rate": 0.0003674431878891779, "loss": 4.8475, "mean_token_accuracy": 0.2131541058421135, "num_tokens": 82513747.0, "step": 47575 }, { "entropy": 5.422780752182007, "epoch": 3.70188679245283, "grad_norm": 1.109375, "learning_rate": 0.0003674179189123393, "loss": 4.7839, "mean_token_accuracy": 0.21281896829605101, "num_tokens": 82522621.0, "step": 47580 }, { "entropy": 5.331941938400268, "epoch": 3.7022758218245477, "grad_norm": 1.1328125, "learning_rate": 0.00036739264853320606, "loss": 4.7559, "mean_token_accuracy": 0.22189822643995286, "num_tokens": 82530286.0, "step": 47585 }, { "entropy": 5.285174322128296, "epoch": 3.7026648511962654, "grad_norm": 1.15625, "learning_rate": 0.00036736737675216127, "loss": 4.8147, "mean_token_accuracy": 0.21306973248720168, "num_tokens": 82539288.0, "step": 47590 }, { "entropy": 5.396151924133301, "epoch": 3.7030538805679827, "grad_norm": 1.1328125, "learning_rate": 0.0003673421035695887, "loss": 4.8828, "mean_token_accuracy": 0.20856768041849136, "num_tokens": 82547271.0, "step": 47595 }, { "entropy": 5.432281112670898, "epoch": 3.7034429099397004, "grad_norm": 1.1953125, "learning_rate": 0.0003673168289858716, "loss": 4.9296, "mean_token_accuracy": 0.2029433473944664, "num_tokens": 82555997.0, "step": 47600 }, { "entropy": 5.417050123214722, "epoch": 3.703831939311418, "grad_norm": 1.078125, "learning_rate": 0.0003672915530013936, "loss": 4.8405, "mean_token_accuracy": 0.21640387624502183, "num_tokens": 82565181.0, "step": 47605 }, { "entropy": 5.382005500793457, "epoch": 3.7042209686831358, "grad_norm": 1.15625, "learning_rate": 0.00036726627561653815, "loss": 4.879, "mean_token_accuracy": 0.21240968406200408, "num_tokens": 82573691.0, "step": 47610 }, { "entropy": 5.420676374435425, "epoch": 3.704609998054853, "grad_norm": 1.171875, "learning_rate": 0.0003672409968316888, "loss": 4.9355, "mean_token_accuracy": 0.20527132153511046, "num_tokens": 82582562.0, "step": 47615 }, { "entropy": 5.401203870773315, "epoch": 3.7049990274265707, "grad_norm": 1.1640625, "learning_rate": 0.00036721571664722914, "loss": 4.9011, "mean_token_accuracy": 0.2141050338745117, "num_tokens": 82591051.0, "step": 47620 }, { "entropy": 5.438391399383545, "epoch": 3.7053880567982884, "grad_norm": 1.1484375, "learning_rate": 0.0003671904350635428, "loss": 4.8655, "mean_token_accuracy": 0.2139350637793541, "num_tokens": 82599385.0, "step": 47625 }, { "entropy": 5.4277503490448, "epoch": 3.7057770861700057, "grad_norm": 1.109375, "learning_rate": 0.00036716515208101334, "loss": 4.8127, "mean_token_accuracy": 0.21528344452381135, "num_tokens": 82607688.0, "step": 47630 }, { "entropy": 5.37467942237854, "epoch": 3.7061661155417234, "grad_norm": 1.1640625, "learning_rate": 0.0003671398677000244, "loss": 4.8647, "mean_token_accuracy": 0.21550339460372925, "num_tokens": 82615471.0, "step": 47635 }, { "entropy": 5.302372074127197, "epoch": 3.706555144913441, "grad_norm": 1.109375, "learning_rate": 0.0003671145819209596, "loss": 4.7818, "mean_token_accuracy": 0.21941887736320495, "num_tokens": 82624243.0, "step": 47640 }, { "entropy": 5.390410757064819, "epoch": 3.7069441742851588, "grad_norm": 1.203125, "learning_rate": 0.0003670892947442026, "loss": 4.8466, "mean_token_accuracy": 0.21348970681428908, "num_tokens": 82632821.0, "step": 47645 }, { "entropy": 5.494918346405029, "epoch": 3.707333203656876, "grad_norm": 1.109375, "learning_rate": 0.0003670640061701371, "loss": 5.0658, "mean_token_accuracy": 0.1995412901043892, "num_tokens": 82641225.0, "step": 47650 }, { "entropy": 5.438647270202637, "epoch": 3.7077222330285937, "grad_norm": 1.171875, "learning_rate": 0.0003670387161991469, "loss": 4.9116, "mean_token_accuracy": 0.21429473012685776, "num_tokens": 82649885.0, "step": 47655 }, { "entropy": 5.3290777683258055, "epoch": 3.708111262400311, "grad_norm": 1.140625, "learning_rate": 0.0003670134248316157, "loss": 4.7759, "mean_token_accuracy": 0.2215218335390091, "num_tokens": 82658589.0, "step": 47660 }, { "entropy": 5.399945163726807, "epoch": 3.7085002917720287, "grad_norm": 1.09375, "learning_rate": 0.00036698813206792724, "loss": 4.9289, "mean_token_accuracy": 0.20571202486753465, "num_tokens": 82666676.0, "step": 47665 }, { "entropy": 5.365212106704712, "epoch": 3.7088893211437464, "grad_norm": 1.1953125, "learning_rate": 0.00036696283790846524, "loss": 4.8026, "mean_token_accuracy": 0.2154592514038086, "num_tokens": 82675007.0, "step": 47670 }, { "entropy": 5.384629106521606, "epoch": 3.709278350515464, "grad_norm": 1.21875, "learning_rate": 0.00036693754235361364, "loss": 4.8697, "mean_token_accuracy": 0.21132962107658387, "num_tokens": 82684060.0, "step": 47675 }, { "entropy": 5.34520411491394, "epoch": 3.7096673798871818, "grad_norm": 1.2734375, "learning_rate": 0.0003669122454037561, "loss": 4.9336, "mean_token_accuracy": 0.21316074430942536, "num_tokens": 82693280.0, "step": 47680 }, { "entropy": 5.347713041305542, "epoch": 3.710056409258899, "grad_norm": 1.2578125, "learning_rate": 0.0003668869470592765, "loss": 4.7597, "mean_token_accuracy": 0.22360343039035796, "num_tokens": 82701176.0, "step": 47685 }, { "entropy": 5.327824878692627, "epoch": 3.7104454386306167, "grad_norm": 1.2421875, "learning_rate": 0.00036686164732055876, "loss": 4.7891, "mean_token_accuracy": 0.22305157780647278, "num_tokens": 82709410.0, "step": 47690 }, { "entropy": 5.318912315368652, "epoch": 3.710834468002334, "grad_norm": 1.1171875, "learning_rate": 0.00036683634618798675, "loss": 4.8226, "mean_token_accuracy": 0.2101035714149475, "num_tokens": 82718535.0, "step": 47695 }, { "entropy": 5.389748430252075, "epoch": 3.7112234973740517, "grad_norm": 1.296875, "learning_rate": 0.0003668110436619443, "loss": 4.8932, "mean_token_accuracy": 0.21471327543258667, "num_tokens": 82727524.0, "step": 47700 }, { "entropy": 5.392421436309815, "epoch": 3.7116125267457694, "grad_norm": 1.1328125, "learning_rate": 0.00036678573974281546, "loss": 4.9204, "mean_token_accuracy": 0.20711326450109482, "num_tokens": 82735605.0, "step": 47705 }, { "entropy": 5.39943265914917, "epoch": 3.712001556117487, "grad_norm": 1.1484375, "learning_rate": 0.0003667604344309841, "loss": 4.9097, "mean_token_accuracy": 0.21048038601875305, "num_tokens": 82745046.0, "step": 47710 }, { "entropy": 5.482069778442383, "epoch": 3.7123905854892043, "grad_norm": 1.09375, "learning_rate": 0.00036673512772683424, "loss": 4.9108, "mean_token_accuracy": 0.2126159578561783, "num_tokens": 82753961.0, "step": 47715 }, { "entropy": 5.35315580368042, "epoch": 3.712779614860922, "grad_norm": 1.1328125, "learning_rate": 0.0003667098196307498, "loss": 4.8327, "mean_token_accuracy": 0.2193732365965843, "num_tokens": 82762684.0, "step": 47720 }, { "entropy": 5.476911211013794, "epoch": 3.7131686442326397, "grad_norm": 1.125, "learning_rate": 0.00036668451014311475, "loss": 4.9174, "mean_token_accuracy": 0.21720012575387954, "num_tokens": 82770958.0, "step": 47725 }, { "entropy": 5.412020587921143, "epoch": 3.713557673604357, "grad_norm": 1.1875, "learning_rate": 0.00036665919926431325, "loss": 4.8529, "mean_token_accuracy": 0.21815908402204515, "num_tokens": 82779891.0, "step": 47730 }, { "entropy": 5.34972071647644, "epoch": 3.7139467029760747, "grad_norm": 1.1875, "learning_rate": 0.0003666338869947293, "loss": 4.8692, "mean_token_accuracy": 0.20911203622817992, "num_tokens": 82788835.0, "step": 47735 }, { "entropy": 5.385988044738769, "epoch": 3.7143357323477924, "grad_norm": 1.109375, "learning_rate": 0.0003666085733347469, "loss": 4.8777, "mean_token_accuracy": 0.20787182599306106, "num_tokens": 82797119.0, "step": 47740 }, { "entropy": 5.413204574584961, "epoch": 3.71472476171951, "grad_norm": 1.109375, "learning_rate": 0.00036658325828475033, "loss": 4.7897, "mean_token_accuracy": 0.2148541271686554, "num_tokens": 82805210.0, "step": 47745 }, { "entropy": 5.381630945205688, "epoch": 3.7151137910912273, "grad_norm": 1.0859375, "learning_rate": 0.0003665579418451235, "loss": 4.7868, "mean_token_accuracy": 0.2153421998023987, "num_tokens": 82813916.0, "step": 47750 }, { "entropy": 5.349843072891235, "epoch": 3.715502820462945, "grad_norm": 1.1171875, "learning_rate": 0.0003665326240162506, "loss": 4.8848, "mean_token_accuracy": 0.2132158175110817, "num_tokens": 82822938.0, "step": 47755 }, { "entropy": 5.4200750350952145, "epoch": 3.7158918498346623, "grad_norm": 1.1484375, "learning_rate": 0.00036650730479851593, "loss": 4.9601, "mean_token_accuracy": 0.20464060008525847, "num_tokens": 82831473.0, "step": 47760 }, { "entropy": 5.356255388259887, "epoch": 3.71628087920638, "grad_norm": 1.1953125, "learning_rate": 0.00036648198419230344, "loss": 4.9325, "mean_token_accuracy": 0.20896043479442597, "num_tokens": 82840233.0, "step": 47765 }, { "entropy": 5.397795629501343, "epoch": 3.7166699085780976, "grad_norm": 1.1484375, "learning_rate": 0.00036645666219799753, "loss": 4.8603, "mean_token_accuracy": 0.21931437253952027, "num_tokens": 82848982.0, "step": 47770 }, { "entropy": 5.427029418945312, "epoch": 3.7170589379498153, "grad_norm": 1.125, "learning_rate": 0.0003664313388159823, "loss": 4.8982, "mean_token_accuracy": 0.20943263322114944, "num_tokens": 82858029.0, "step": 47775 }, { "entropy": 5.432743501663208, "epoch": 3.717447967321533, "grad_norm": 1.109375, "learning_rate": 0.000366406014046642, "loss": 4.8849, "mean_token_accuracy": 0.20868797302246095, "num_tokens": 82866138.0, "step": 47780 }, { "entropy": 5.464727163314819, "epoch": 3.7178369966932503, "grad_norm": 1.1484375, "learning_rate": 0.000366380687890361, "loss": 4.9936, "mean_token_accuracy": 0.2028328776359558, "num_tokens": 82875330.0, "step": 47785 }, { "entropy": 5.422740030288696, "epoch": 3.718226026064968, "grad_norm": 1.0859375, "learning_rate": 0.0003663553603475235, "loss": 4.9127, "mean_token_accuracy": 0.20891542136669158, "num_tokens": 82884456.0, "step": 47790 }, { "entropy": 5.380167436599732, "epoch": 3.7186150554366852, "grad_norm": 1.09375, "learning_rate": 0.00036633003141851373, "loss": 4.8278, "mean_token_accuracy": 0.22119367271661758, "num_tokens": 82893148.0, "step": 47795 }, { "entropy": 5.390344429016113, "epoch": 3.719004084808403, "grad_norm": 1.2109375, "learning_rate": 0.0003663047011037162, "loss": 4.8481, "mean_token_accuracy": 0.21996967494487762, "num_tokens": 82901065.0, "step": 47800 }, { "entropy": 5.297053003311158, "epoch": 3.7193931141801206, "grad_norm": 1.078125, "learning_rate": 0.0003662793694035151, "loss": 4.8348, "mean_token_accuracy": 0.21533189415931703, "num_tokens": 82910162.0, "step": 47805 }, { "entropy": 5.39837417602539, "epoch": 3.7197821435518383, "grad_norm": 1.1953125, "learning_rate": 0.0003662540363182949, "loss": 4.9165, "mean_token_accuracy": 0.20835154354572297, "num_tokens": 82918393.0, "step": 47810 }, { "entropy": 5.321748542785644, "epoch": 3.7201711729235556, "grad_norm": 1.1171875, "learning_rate": 0.0003662287018484398, "loss": 4.795, "mean_token_accuracy": 0.22680991888046265, "num_tokens": 82927607.0, "step": 47815 }, { "entropy": 5.377447700500488, "epoch": 3.7205602022952733, "grad_norm": 1.171875, "learning_rate": 0.0003662033659943345, "loss": 4.9198, "mean_token_accuracy": 0.21109362244606017, "num_tokens": 82936743.0, "step": 47820 }, { "entropy": 5.432659435272217, "epoch": 3.720949231666991, "grad_norm": 1.171875, "learning_rate": 0.00036617802875636333, "loss": 4.943, "mean_token_accuracy": 0.20714199244976045, "num_tokens": 82946027.0, "step": 47825 }, { "entropy": 5.41870083808899, "epoch": 3.7213382610387082, "grad_norm": 1.1640625, "learning_rate": 0.0003661526901349106, "loss": 4.8232, "mean_token_accuracy": 0.21017409563064576, "num_tokens": 82954442.0, "step": 47830 }, { "entropy": 5.33777551651001, "epoch": 3.721727290410426, "grad_norm": 1.2734375, "learning_rate": 0.00036612735013036085, "loss": 4.7641, "mean_token_accuracy": 0.2219604194164276, "num_tokens": 82962518.0, "step": 47835 }, { "entropy": 5.434994411468506, "epoch": 3.7221163197821436, "grad_norm": 1.0859375, "learning_rate": 0.0003661020087430987, "loss": 4.9781, "mean_token_accuracy": 0.20242183059453964, "num_tokens": 82971544.0, "step": 47840 }, { "entropy": 5.401493692398072, "epoch": 3.7225053491538613, "grad_norm": 1.1953125, "learning_rate": 0.0003660766659735086, "loss": 4.8006, "mean_token_accuracy": 0.218464894592762, "num_tokens": 82980771.0, "step": 47845 }, { "entropy": 5.390036916732788, "epoch": 3.7228943785255786, "grad_norm": 1.2890625, "learning_rate": 0.0003660513218219749, "loss": 4.8682, "mean_token_accuracy": 0.2119361251592636, "num_tokens": 82989525.0, "step": 47850 }, { "entropy": 5.359787559509277, "epoch": 3.7232834078972963, "grad_norm": 1.1328125, "learning_rate": 0.0003660259762888824, "loss": 4.861, "mean_token_accuracy": 0.21262769401073456, "num_tokens": 82998135.0, "step": 47855 }, { "entropy": 5.451057481765747, "epoch": 3.7236724372690135, "grad_norm": 1.171875, "learning_rate": 0.0003660006293746156, "loss": 4.9243, "mean_token_accuracy": 0.20308346748352052, "num_tokens": 83007068.0, "step": 47860 }, { "entropy": 5.401442337036133, "epoch": 3.7240614666407312, "grad_norm": 1.1640625, "learning_rate": 0.00036597528107955914, "loss": 4.8792, "mean_token_accuracy": 0.20906789749860763, "num_tokens": 83015819.0, "step": 47865 }, { "entropy": 5.478734254837036, "epoch": 3.724450496012449, "grad_norm": 1.203125, "learning_rate": 0.00036594993140409753, "loss": 4.936, "mean_token_accuracy": 0.20496702790260315, "num_tokens": 83025096.0, "step": 47870 }, { "entropy": 5.3364794731140135, "epoch": 3.7248395253841666, "grad_norm": 1.109375, "learning_rate": 0.0003659245803486155, "loss": 4.7415, "mean_token_accuracy": 0.21970428824424743, "num_tokens": 83033181.0, "step": 47875 }, { "entropy": 5.314488697052002, "epoch": 3.7252285547558843, "grad_norm": 1.1484375, "learning_rate": 0.0003658992279134977, "loss": 4.8577, "mean_token_accuracy": 0.21468538343906401, "num_tokens": 83042315.0, "step": 47880 }, { "entropy": 5.337536191940307, "epoch": 3.7256175841276016, "grad_norm": 1.0859375, "learning_rate": 0.0003658738740991287, "loss": 4.8799, "mean_token_accuracy": 0.2071785882115364, "num_tokens": 83051565.0, "step": 47885 }, { "entropy": 5.413470458984375, "epoch": 3.7260066134993193, "grad_norm": 1.1875, "learning_rate": 0.00036584851890589335, "loss": 4.8746, "mean_token_accuracy": 0.20534023493528367, "num_tokens": 83059889.0, "step": 47890 }, { "entropy": 5.366611289978027, "epoch": 3.7263956428710365, "grad_norm": 1.1015625, "learning_rate": 0.00036582316233417636, "loss": 4.8636, "mean_token_accuracy": 0.214415942132473, "num_tokens": 83068764.0, "step": 47895 }, { "entropy": 5.317829656600952, "epoch": 3.7267846722427542, "grad_norm": 1.1484375, "learning_rate": 0.00036579780438436246, "loss": 4.7795, "mean_token_accuracy": 0.2132525622844696, "num_tokens": 83077605.0, "step": 47900 }, { "entropy": 5.297066354751587, "epoch": 3.727173701614472, "grad_norm": 1.1484375, "learning_rate": 0.0003657724450568363, "loss": 4.7894, "mean_token_accuracy": 0.21438853442668915, "num_tokens": 83086080.0, "step": 47905 }, { "entropy": 5.320501852035522, "epoch": 3.7275627309861896, "grad_norm": 1.3046875, "learning_rate": 0.0003657470843519829, "loss": 4.7659, "mean_token_accuracy": 0.2174546793103218, "num_tokens": 83094070.0, "step": 47910 }, { "entropy": 5.299572420120239, "epoch": 3.727951760357907, "grad_norm": 1.125, "learning_rate": 0.0003657217222701868, "loss": 4.7579, "mean_token_accuracy": 0.2212927371263504, "num_tokens": 83102213.0, "step": 47915 }, { "entropy": 5.285571002960205, "epoch": 3.7283407897296246, "grad_norm": 1.171875, "learning_rate": 0.000365696358811833, "loss": 4.8004, "mean_token_accuracy": 0.22055469453334808, "num_tokens": 83110525.0, "step": 47920 }, { "entropy": 5.31011438369751, "epoch": 3.7287298191013423, "grad_norm": 1.140625, "learning_rate": 0.00036567099397730635, "loss": 4.8345, "mean_token_accuracy": 0.21674588322639465, "num_tokens": 83119206.0, "step": 47925 }, { "entropy": 5.392427110671997, "epoch": 3.7291188484730595, "grad_norm": 1.125, "learning_rate": 0.0003656456277669917, "loss": 4.924, "mean_token_accuracy": 0.20751623511314393, "num_tokens": 83127713.0, "step": 47930 }, { "entropy": 5.452603769302368, "epoch": 3.729507877844777, "grad_norm": 1.140625, "learning_rate": 0.00036562026018127386, "loss": 4.8977, "mean_token_accuracy": 0.21085544675588608, "num_tokens": 83135785.0, "step": 47935 }, { "entropy": 5.368570327758789, "epoch": 3.729896907216495, "grad_norm": 1.09375, "learning_rate": 0.00036559489122053786, "loss": 4.7982, "mean_token_accuracy": 0.21598514765501023, "num_tokens": 83144623.0, "step": 47940 }, { "entropy": 5.388584804534912, "epoch": 3.7302859365882126, "grad_norm": 1.1796875, "learning_rate": 0.0003655695208851686, "loss": 4.8405, "mean_token_accuracy": 0.21508225202560424, "num_tokens": 83153189.0, "step": 47945 }, { "entropy": 5.3912904262542725, "epoch": 3.73067496595993, "grad_norm": 1.0859375, "learning_rate": 0.00036554414917555096, "loss": 4.8578, "mean_token_accuracy": 0.21852099448442458, "num_tokens": 83161821.0, "step": 47950 }, { "entropy": 5.399232339859009, "epoch": 3.7310639953316476, "grad_norm": 1.140625, "learning_rate": 0.00036551877609207, "loss": 4.8635, "mean_token_accuracy": 0.2144806981086731, "num_tokens": 83170527.0, "step": 47955 }, { "entropy": 5.338731288909912, "epoch": 3.7314530247033653, "grad_norm": 1.1484375, "learning_rate": 0.0003654934016351107, "loss": 4.7715, "mean_token_accuracy": 0.22164586782455445, "num_tokens": 83178983.0, "step": 47960 }, { "entropy": 5.353824281692505, "epoch": 3.7318420540750825, "grad_norm": 1.1953125, "learning_rate": 0.00036546802580505805, "loss": 4.8147, "mean_token_accuracy": 0.21759581416845322, "num_tokens": 83188177.0, "step": 47965 }, { "entropy": 5.3596964359283445, "epoch": 3.7322310834468, "grad_norm": 1.0546875, "learning_rate": 0.0003654426486022971, "loss": 4.8398, "mean_token_accuracy": 0.2099335566163063, "num_tokens": 83197090.0, "step": 47970 }, { "entropy": 5.378551244735718, "epoch": 3.732620112818518, "grad_norm": 1.234375, "learning_rate": 0.0003654172700272129, "loss": 4.922, "mean_token_accuracy": 0.21393698900938035, "num_tokens": 83205347.0, "step": 47975 }, { "entropy": 5.375136280059815, "epoch": 3.7330091421902356, "grad_norm": 1.15625, "learning_rate": 0.0003653918900801905, "loss": 4.8016, "mean_token_accuracy": 0.2193748787045479, "num_tokens": 83213378.0, "step": 47980 }, { "entropy": 5.468813800811768, "epoch": 3.733398171561953, "grad_norm": 1.09375, "learning_rate": 0.00036536650876161514, "loss": 4.9132, "mean_token_accuracy": 0.20753172487020494, "num_tokens": 83221898.0, "step": 47985 }, { "entropy": 5.363307666778565, "epoch": 3.7337872009336706, "grad_norm": 1.1953125, "learning_rate": 0.0003653411260718718, "loss": 4.8035, "mean_token_accuracy": 0.21766814291477204, "num_tokens": 83231176.0, "step": 47990 }, { "entropy": 5.416937971115113, "epoch": 3.734176230305388, "grad_norm": 1.140625, "learning_rate": 0.0003653157420113457, "loss": 4.9577, "mean_token_accuracy": 0.2091292291879654, "num_tokens": 83239777.0, "step": 47995 }, { "entropy": 5.3985882759094235, "epoch": 3.7345652596771055, "grad_norm": 1.09375, "learning_rate": 0.0003652903565804219, "loss": 4.852, "mean_token_accuracy": 0.2179276466369629, "num_tokens": 83248941.0, "step": 48000 }, { "epoch": 3.7345652596771055, "eval_entropy": 5.2014463453136806, "eval_loss": 4.981439590454102, "eval_mean_token_accuracy": 0.2157636579567131, "eval_num_tokens": 83248941.0, "eval_runtime": 28.8246, "eval_samples_per_second": 1441.754, "eval_steps_per_second": 180.228, "step": 48000 }, { "entropy": 5.386441373825074, "epoch": 3.734954289048823, "grad_norm": 1.203125, "learning_rate": 0.00036526496977948574, "loss": 4.8592, "mean_token_accuracy": 0.21433609127998351, "num_tokens": 83257324.0, "step": 48005 }, { "entropy": 5.33705358505249, "epoch": 3.735343318420541, "grad_norm": 1.15625, "learning_rate": 0.00036523958160892227, "loss": 4.8724, "mean_token_accuracy": 0.21342201828956603, "num_tokens": 83265655.0, "step": 48010 }, { "entropy": 5.4089569568634035, "epoch": 3.735732347792258, "grad_norm": 1.0625, "learning_rate": 0.00036521419206911684, "loss": 4.8504, "mean_token_accuracy": 0.21217601448297502, "num_tokens": 83274743.0, "step": 48015 }, { "entropy": 5.4215648651123045, "epoch": 3.736121377163976, "grad_norm": 1.1640625, "learning_rate": 0.0003651888011604545, "loss": 4.9235, "mean_token_accuracy": 0.2090612009167671, "num_tokens": 83284344.0, "step": 48020 }, { "entropy": 5.305263328552246, "epoch": 3.7365104065356936, "grad_norm": 1.109375, "learning_rate": 0.00036516340888332076, "loss": 4.7926, "mean_token_accuracy": 0.2263455718755722, "num_tokens": 83292855.0, "step": 48025 }, { "entropy": 5.376588201522827, "epoch": 3.736899435907411, "grad_norm": 1.109375, "learning_rate": 0.00036513801523810075, "loss": 4.8574, "mean_token_accuracy": 0.20942715257406236, "num_tokens": 83301624.0, "step": 48030 }, { "entropy": 5.473322010040283, "epoch": 3.7372884652791285, "grad_norm": 1.0703125, "learning_rate": 0.0003651126202251799, "loss": 4.9167, "mean_token_accuracy": 0.20920263081789017, "num_tokens": 83311052.0, "step": 48035 }, { "entropy": 5.432959079742432, "epoch": 3.737677494650846, "grad_norm": 1.15625, "learning_rate": 0.0003650872238449434, "loss": 4.838, "mean_token_accuracy": 0.218114210665226, "num_tokens": 83319382.0, "step": 48040 }, { "entropy": 5.38957781791687, "epoch": 3.738066524022564, "grad_norm": 1.3359375, "learning_rate": 0.0003650618260977767, "loss": 4.9018, "mean_token_accuracy": 0.22011256217956543, "num_tokens": 83327548.0, "step": 48045 }, { "entropy": 5.321341180801392, "epoch": 3.738455553394281, "grad_norm": 1.15625, "learning_rate": 0.0003650364269840651, "loss": 4.7914, "mean_token_accuracy": 0.21491991430521012, "num_tokens": 83336463.0, "step": 48050 }, { "entropy": 5.4038755893707275, "epoch": 3.738844582765999, "grad_norm": 1.203125, "learning_rate": 0.0003650110265041941, "loss": 4.8268, "mean_token_accuracy": 0.22047334164381027, "num_tokens": 83344404.0, "step": 48055 }, { "entropy": 5.285020112991333, "epoch": 3.7392336121377165, "grad_norm": 1.203125, "learning_rate": 0.00036498562465854897, "loss": 4.748, "mean_token_accuracy": 0.2192089632153511, "num_tokens": 83352016.0, "step": 48060 }, { "entropy": 5.2938337326049805, "epoch": 3.739622641509434, "grad_norm": 1.1484375, "learning_rate": 0.0003649602214475152, "loss": 4.8054, "mean_token_accuracy": 0.21537040024995804, "num_tokens": 83360424.0, "step": 48065 }, { "entropy": 5.392592525482177, "epoch": 3.7400116708811515, "grad_norm": 1.1640625, "learning_rate": 0.00036493481687147836, "loss": 4.8127, "mean_token_accuracy": 0.21050431579351425, "num_tokens": 83369413.0, "step": 48070 }, { "entropy": 5.3297539234161375, "epoch": 3.740400700252869, "grad_norm": 1.1171875, "learning_rate": 0.0003649094109308237, "loss": 4.8379, "mean_token_accuracy": 0.20785255134105682, "num_tokens": 83378493.0, "step": 48075 }, { "entropy": 5.288585233688354, "epoch": 3.740789729624587, "grad_norm": 1.203125, "learning_rate": 0.00036488400362593695, "loss": 4.853, "mean_token_accuracy": 0.21077035665512084, "num_tokens": 83386668.0, "step": 48080 }, { "entropy": 5.334759664535523, "epoch": 3.741178758996304, "grad_norm": 1.140625, "learning_rate": 0.00036485859495720337, "loss": 4.868, "mean_token_accuracy": 0.21185035407543182, "num_tokens": 83395961.0, "step": 48085 }, { "entropy": 5.347606468200683, "epoch": 3.741567788368022, "grad_norm": 1.1484375, "learning_rate": 0.00036483318492500875, "loss": 4.8718, "mean_token_accuracy": 0.210748353600502, "num_tokens": 83405346.0, "step": 48090 }, { "entropy": 5.442207765579224, "epoch": 3.741956817739739, "grad_norm": 1.234375, "learning_rate": 0.00036480777352973856, "loss": 4.9081, "mean_token_accuracy": 0.21370006948709488, "num_tokens": 83413798.0, "step": 48095 }, { "entropy": 5.506014442443847, "epoch": 3.742345847111457, "grad_norm": 1.328125, "learning_rate": 0.00036478236077177825, "loss": 4.9759, "mean_token_accuracy": 0.20348286032676696, "num_tokens": 83421961.0, "step": 48100 }, { "entropy": 5.385786819458008, "epoch": 3.7427348764831745, "grad_norm": 1.1640625, "learning_rate": 0.00036475694665151357, "loss": 4.9736, "mean_token_accuracy": 0.20576438754796983, "num_tokens": 83430615.0, "step": 48105 }, { "entropy": 5.397714757919312, "epoch": 3.743123905854892, "grad_norm": 1.1328125, "learning_rate": 0.00036473153116933007, "loss": 4.8872, "mean_token_accuracy": 0.21386412233114244, "num_tokens": 83439142.0, "step": 48110 }, { "entropy": 5.34433217048645, "epoch": 3.74351293522661, "grad_norm": 1.21875, "learning_rate": 0.00036470611432561334, "loss": 4.7719, "mean_token_accuracy": 0.2239024117588997, "num_tokens": 83447421.0, "step": 48115 }, { "entropy": 5.3372032165527346, "epoch": 3.743901964598327, "grad_norm": 1.125, "learning_rate": 0.0003646806961207492, "loss": 4.8637, "mean_token_accuracy": 0.2122753605246544, "num_tokens": 83456090.0, "step": 48120 }, { "entropy": 5.378424549102784, "epoch": 3.744290993970045, "grad_norm": 1.09375, "learning_rate": 0.00036465527655512323, "loss": 4.8345, "mean_token_accuracy": 0.2170809879899025, "num_tokens": 83464527.0, "step": 48125 }, { "entropy": 5.366263055801392, "epoch": 3.744680023341762, "grad_norm": 1.1796875, "learning_rate": 0.0003646298556291211, "loss": 4.8224, "mean_token_accuracy": 0.21746802628040313, "num_tokens": 83472648.0, "step": 48130 }, { "entropy": 5.293454647064209, "epoch": 3.74506905271348, "grad_norm": 1.0625, "learning_rate": 0.00036460443334312867, "loss": 4.7867, "mean_token_accuracy": 0.21619207561016082, "num_tokens": 83481598.0, "step": 48135 }, { "entropy": 5.370912647247314, "epoch": 3.7454580820851975, "grad_norm": 1.1328125, "learning_rate": 0.0003645790096975315, "loss": 4.8375, "mean_token_accuracy": 0.21149327009916305, "num_tokens": 83490153.0, "step": 48140 }, { "entropy": 5.397190952301026, "epoch": 3.745847111456915, "grad_norm": 1.3046875, "learning_rate": 0.00036455358469271546, "loss": 4.8637, "mean_token_accuracy": 0.2142141968011856, "num_tokens": 83499617.0, "step": 48145 }, { "entropy": 5.320184850692749, "epoch": 3.7462361408286324, "grad_norm": 1.125, "learning_rate": 0.00036452815832906625, "loss": 4.8564, "mean_token_accuracy": 0.20838571190834046, "num_tokens": 83507793.0, "step": 48150 }, { "entropy": 5.351131629943848, "epoch": 3.74662517020035, "grad_norm": 1.234375, "learning_rate": 0.00036450273060696984, "loss": 4.79, "mean_token_accuracy": 0.21538684964179994, "num_tokens": 83516490.0, "step": 48155 }, { "entropy": 5.3430657386779785, "epoch": 3.747014199572068, "grad_norm": 1.078125, "learning_rate": 0.0003644773015268118, "loss": 4.8888, "mean_token_accuracy": 0.21065460443496703, "num_tokens": 83524812.0, "step": 48160 }, { "entropy": 5.374954080581665, "epoch": 3.747403228943785, "grad_norm": 1.203125, "learning_rate": 0.00036445187108897825, "loss": 4.8542, "mean_token_accuracy": 0.21244678497314454, "num_tokens": 83533242.0, "step": 48165 }, { "entropy": 5.372977304458618, "epoch": 3.747792258315503, "grad_norm": 1.140625, "learning_rate": 0.0003644264392938549, "loss": 4.8011, "mean_token_accuracy": 0.22270214259624482, "num_tokens": 83541233.0, "step": 48170 }, { "entropy": 5.433784437179566, "epoch": 3.7481812876872205, "grad_norm": 1.4375, "learning_rate": 0.00036440100614182775, "loss": 4.9774, "mean_token_accuracy": 0.20909656286239625, "num_tokens": 83549561.0, "step": 48175 }, { "entropy": 5.419878625869751, "epoch": 3.748570317058938, "grad_norm": 1.1796875, "learning_rate": 0.00036437557163328255, "loss": 4.9103, "mean_token_accuracy": 0.2062024340033531, "num_tokens": 83558384.0, "step": 48180 }, { "entropy": 5.375685739517212, "epoch": 3.7489593464306554, "grad_norm": 1.0703125, "learning_rate": 0.0003643501357686053, "loss": 4.9295, "mean_token_accuracy": 0.20656861811876298, "num_tokens": 83567573.0, "step": 48185 }, { "entropy": 5.3838108539581295, "epoch": 3.749348375802373, "grad_norm": 1.1484375, "learning_rate": 0.00036432469854818194, "loss": 4.875, "mean_token_accuracy": 0.21278886049985885, "num_tokens": 83576632.0, "step": 48190 }, { "entropy": 5.413621616363526, "epoch": 3.7497374051740904, "grad_norm": 1.125, "learning_rate": 0.0003642992599723985, "loss": 4.9313, "mean_token_accuracy": 0.20403687804937362, "num_tokens": 83585995.0, "step": 48195 }, { "entropy": 5.356377124786377, "epoch": 3.750126434545808, "grad_norm": 1.1796875, "learning_rate": 0.0003642738200416409, "loss": 4.8104, "mean_token_accuracy": 0.213023741543293, "num_tokens": 83594985.0, "step": 48200 }, { "entropy": 5.366329908370972, "epoch": 3.7505154639175258, "grad_norm": 1.2109375, "learning_rate": 0.00036424837875629517, "loss": 4.831, "mean_token_accuracy": 0.21570476293563842, "num_tokens": 83603179.0, "step": 48205 }, { "entropy": 5.43712158203125, "epoch": 3.7509044932892435, "grad_norm": 1.2265625, "learning_rate": 0.00036422293611674736, "loss": 4.9707, "mean_token_accuracy": 0.2096259340643883, "num_tokens": 83612890.0, "step": 48210 }, { "entropy": 5.433262348175049, "epoch": 3.751293522660961, "grad_norm": 1.0546875, "learning_rate": 0.00036419749212338346, "loss": 4.9867, "mean_token_accuracy": 0.20604695081710817, "num_tokens": 83623249.0, "step": 48215 }, { "entropy": 5.407290935516357, "epoch": 3.7516825520326784, "grad_norm": 1.1328125, "learning_rate": 0.0003641720467765897, "loss": 4.837, "mean_token_accuracy": 0.2184054121375084, "num_tokens": 83632899.0, "step": 48220 }, { "entropy": 5.405412673950195, "epoch": 3.752071581404396, "grad_norm": 1.1953125, "learning_rate": 0.000364146600076752, "loss": 4.9021, "mean_token_accuracy": 0.2075895830988884, "num_tokens": 83641773.0, "step": 48225 }, { "entropy": 5.392686557769776, "epoch": 3.7524606107761134, "grad_norm": 1.1328125, "learning_rate": 0.0003641211520242565, "loss": 4.899, "mean_token_accuracy": 0.21425518691539763, "num_tokens": 83649740.0, "step": 48230 }, { "entropy": 5.430963706970215, "epoch": 3.752849640147831, "grad_norm": 1.1953125, "learning_rate": 0.00036409570261948943, "loss": 4.8738, "mean_token_accuracy": 0.2098555698990822, "num_tokens": 83658764.0, "step": 48235 }, { "entropy": 5.304048824310303, "epoch": 3.7532386695195488, "grad_norm": 1.0859375, "learning_rate": 0.0003640702518628369, "loss": 4.7986, "mean_token_accuracy": 0.21282921582460404, "num_tokens": 83667350.0, "step": 48240 }, { "entropy": 5.338675260543823, "epoch": 3.7536276988912665, "grad_norm": 1.140625, "learning_rate": 0.000364044799754685, "loss": 4.8152, "mean_token_accuracy": 0.2132792592048645, "num_tokens": 83676012.0, "step": 48245 }, { "entropy": 5.389057636260986, "epoch": 3.7540167282629837, "grad_norm": 1.15625, "learning_rate": 0.00036401934629542, "loss": 4.8684, "mean_token_accuracy": 0.22021762728691102, "num_tokens": 83684606.0, "step": 48250 }, { "entropy": 5.4090039253234865, "epoch": 3.7544057576347014, "grad_norm": 1.1328125, "learning_rate": 0.00036399389148542813, "loss": 4.8994, "mean_token_accuracy": 0.20691086649894713, "num_tokens": 83692735.0, "step": 48255 }, { "entropy": 5.346251630783081, "epoch": 3.754794787006419, "grad_norm": 1.1171875, "learning_rate": 0.00036396843532509563, "loss": 4.8, "mean_token_accuracy": 0.22138732373714448, "num_tokens": 83701487.0, "step": 48260 }, { "entropy": 5.379057550430298, "epoch": 3.7551838163781364, "grad_norm": 1.1953125, "learning_rate": 0.0003639429778148087, "loss": 4.8781, "mean_token_accuracy": 0.20976461917161943, "num_tokens": 83709660.0, "step": 48265 }, { "entropy": 5.415218305587769, "epoch": 3.755572845749854, "grad_norm": 1.203125, "learning_rate": 0.0003639175189549536, "loss": 4.9148, "mean_token_accuracy": 0.20973466634750365, "num_tokens": 83719267.0, "step": 48270 }, { "entropy": 5.408178329467773, "epoch": 3.7559618751215718, "grad_norm": 1.1796875, "learning_rate": 0.00036389205874591676, "loss": 4.8969, "mean_token_accuracy": 0.2174176901578903, "num_tokens": 83727479.0, "step": 48275 }, { "entropy": 5.356724548339844, "epoch": 3.7563509044932895, "grad_norm": 1.203125, "learning_rate": 0.00036386659718808437, "loss": 4.7476, "mean_token_accuracy": 0.21856663823127748, "num_tokens": 83735447.0, "step": 48280 }, { "entropy": 5.399404668807984, "epoch": 3.7567399338650067, "grad_norm": 1.1171875, "learning_rate": 0.00036384113428184286, "loss": 4.9111, "mean_token_accuracy": 0.20864460617303848, "num_tokens": 83744147.0, "step": 48285 }, { "entropy": 5.362719535827637, "epoch": 3.7571289632367244, "grad_norm": 1.1640625, "learning_rate": 0.0003638156700275784, "loss": 4.8915, "mean_token_accuracy": 0.2060146600008011, "num_tokens": 83752898.0, "step": 48290 }, { "entropy": 5.336288690567017, "epoch": 3.757517992608442, "grad_norm": 1.046875, "learning_rate": 0.0003637902044256777, "loss": 4.8195, "mean_token_accuracy": 0.2140578180551529, "num_tokens": 83762378.0, "step": 48295 }, { "entropy": 5.381037473678589, "epoch": 3.7579070219801594, "grad_norm": 1.15625, "learning_rate": 0.0003637647374765269, "loss": 4.8342, "mean_token_accuracy": 0.21446406990289688, "num_tokens": 83770938.0, "step": 48300 }, { "entropy": 5.365966939926148, "epoch": 3.758296051351877, "grad_norm": 1.1796875, "learning_rate": 0.00036373926918051243, "loss": 4.8427, "mean_token_accuracy": 0.21584258377552032, "num_tokens": 83778676.0, "step": 48305 }, { "entropy": 5.353034782409668, "epoch": 3.7586850807235948, "grad_norm": 1.21875, "learning_rate": 0.00036371379953802085, "loss": 4.854, "mean_token_accuracy": 0.21512504816055297, "num_tokens": 83787764.0, "step": 48310 }, { "entropy": 5.351162576675415, "epoch": 3.7590741100953124, "grad_norm": 1.1640625, "learning_rate": 0.00036368832854943856, "loss": 4.9019, "mean_token_accuracy": 0.2080257922410965, "num_tokens": 83795913.0, "step": 48315 }, { "entropy": 5.3098742961883545, "epoch": 3.7594631394670297, "grad_norm": 1.171875, "learning_rate": 0.00036366285621515206, "loss": 4.6771, "mean_token_accuracy": 0.22400540709495545, "num_tokens": 83805537.0, "step": 48320 }, { "entropy": 5.420927095413208, "epoch": 3.7598521688387474, "grad_norm": 1.125, "learning_rate": 0.0003636373825355478, "loss": 4.8724, "mean_token_accuracy": 0.20868360698223115, "num_tokens": 83813411.0, "step": 48325 }, { "entropy": 5.32913908958435, "epoch": 3.7602411982104647, "grad_norm": 1.125, "learning_rate": 0.0003636119075110124, "loss": 4.9283, "mean_token_accuracy": 0.20932894945144653, "num_tokens": 83822110.0, "step": 48330 }, { "entropy": 5.33929443359375, "epoch": 3.7606302275821823, "grad_norm": 1.21875, "learning_rate": 0.0003635864311419323, "loss": 4.7887, "mean_token_accuracy": 0.21437810212373734, "num_tokens": 83830302.0, "step": 48335 }, { "entropy": 5.373210334777832, "epoch": 3.7610192569539, "grad_norm": 1.0859375, "learning_rate": 0.00036356095342869414, "loss": 4.7673, "mean_token_accuracy": 0.21564409732818604, "num_tokens": 83838595.0, "step": 48340 }, { "entropy": 5.37248969078064, "epoch": 3.7614082863256177, "grad_norm": 1.1484375, "learning_rate": 0.0003635354743716844, "loss": 4.8652, "mean_token_accuracy": 0.21085265129804612, "num_tokens": 83847036.0, "step": 48345 }, { "entropy": 5.402022647857666, "epoch": 3.761797315697335, "grad_norm": 1.125, "learning_rate": 0.0003635099939712898, "loss": 4.8405, "mean_token_accuracy": 0.21138464510440827, "num_tokens": 83855256.0, "step": 48350 }, { "entropy": 5.371267318725586, "epoch": 3.7621863450690527, "grad_norm": 1.15625, "learning_rate": 0.00036348451222789694, "loss": 4.8173, "mean_token_accuracy": 0.22107304781675338, "num_tokens": 83864019.0, "step": 48355 }, { "entropy": 5.412528085708618, "epoch": 3.7625753744407704, "grad_norm": 1.0859375, "learning_rate": 0.00036345902914189246, "loss": 4.8681, "mean_token_accuracy": 0.21484641134738922, "num_tokens": 83873263.0, "step": 48360 }, { "entropy": 5.4595037460327145, "epoch": 3.7629644038124876, "grad_norm": 1.0859375, "learning_rate": 0.000363433544713663, "loss": 4.9628, "mean_token_accuracy": 0.19982558637857437, "num_tokens": 83882226.0, "step": 48365 }, { "entropy": 5.393287086486817, "epoch": 3.7633534331842053, "grad_norm": 1.015625, "learning_rate": 0.00036340805894359524, "loss": 4.7813, "mean_token_accuracy": 0.21854738891124725, "num_tokens": 83891140.0, "step": 48370 }, { "entropy": 5.32624921798706, "epoch": 3.763742462555923, "grad_norm": 1.15625, "learning_rate": 0.00036338257183207587, "loss": 4.8205, "mean_token_accuracy": 0.22004197239875795, "num_tokens": 83899183.0, "step": 48375 }, { "entropy": 5.366065406799317, "epoch": 3.7641314919276407, "grad_norm": 1.21875, "learning_rate": 0.00036335708337949165, "loss": 4.8331, "mean_token_accuracy": 0.2206488609313965, "num_tokens": 83907631.0, "step": 48380 }, { "entropy": 5.298793840408325, "epoch": 3.764520521299358, "grad_norm": 1.171875, "learning_rate": 0.0003633315935862293, "loss": 4.7622, "mean_token_accuracy": 0.22630729526281357, "num_tokens": 83916201.0, "step": 48385 }, { "entropy": 5.34281358718872, "epoch": 3.7649095506710757, "grad_norm": 1.1640625, "learning_rate": 0.0003633061024526757, "loss": 4.8078, "mean_token_accuracy": 0.2214032381772995, "num_tokens": 83924566.0, "step": 48390 }, { "entropy": 5.404642868041992, "epoch": 3.7652985800427934, "grad_norm": 1.1171875, "learning_rate": 0.0003632806099792175, "loss": 4.8689, "mean_token_accuracy": 0.21534093469381332, "num_tokens": 83932766.0, "step": 48395 }, { "entropy": 5.386739492416382, "epoch": 3.7656876094145106, "grad_norm": 1.1171875, "learning_rate": 0.00036325511616624155, "loss": 4.7536, "mean_token_accuracy": 0.219247530400753, "num_tokens": 83941068.0, "step": 48400 }, { "entropy": 5.4157476902008055, "epoch": 3.7660766387862283, "grad_norm": 1.0859375, "learning_rate": 0.0003632296210141348, "loss": 4.9263, "mean_token_accuracy": 0.20605076253414153, "num_tokens": 83950711.0, "step": 48405 }, { "entropy": 5.314728450775147, "epoch": 3.766465668157946, "grad_norm": 1.078125, "learning_rate": 0.00036320412452328383, "loss": 4.8563, "mean_token_accuracy": 0.20861955285072326, "num_tokens": 83959712.0, "step": 48410 }, { "entropy": 5.366595315933227, "epoch": 3.7668546975296637, "grad_norm": 1.0625, "learning_rate": 0.0003631786266940757, "loss": 4.7675, "mean_token_accuracy": 0.2185141324996948, "num_tokens": 83968868.0, "step": 48415 }, { "entropy": 5.362298774719238, "epoch": 3.767243726901381, "grad_norm": 1.1796875, "learning_rate": 0.00036315312752689726, "loss": 4.7622, "mean_token_accuracy": 0.21828568279743193, "num_tokens": 83977620.0, "step": 48420 }, { "entropy": 5.3667113304138185, "epoch": 3.7676327562730987, "grad_norm": 1.15625, "learning_rate": 0.0003631276270221354, "loss": 4.7894, "mean_token_accuracy": 0.21562462598085402, "num_tokens": 83987057.0, "step": 48425 }, { "entropy": 5.372176170349121, "epoch": 3.768021785644816, "grad_norm": 1.1875, "learning_rate": 0.00036310212518017717, "loss": 4.8007, "mean_token_accuracy": 0.2119729071855545, "num_tokens": 83995851.0, "step": 48430 }, { "entropy": 5.365168237686158, "epoch": 3.7684108150165336, "grad_norm": 1.1015625, "learning_rate": 0.00036307662200140935, "loss": 4.8456, "mean_token_accuracy": 0.21332936137914657, "num_tokens": 84005276.0, "step": 48435 }, { "entropy": 5.3854395866394045, "epoch": 3.7687998443882513, "grad_norm": 1.1328125, "learning_rate": 0.0003630511174862189, "loss": 4.9195, "mean_token_accuracy": 0.21133777499198914, "num_tokens": 84014259.0, "step": 48440 }, { "entropy": 5.358669757843018, "epoch": 3.769188873759969, "grad_norm": 1.1171875, "learning_rate": 0.0003630256116349931, "loss": 4.8915, "mean_token_accuracy": 0.21274707615375518, "num_tokens": 84023518.0, "step": 48445 }, { "entropy": 5.414945983886719, "epoch": 3.7695779031316863, "grad_norm": 1.1875, "learning_rate": 0.0003630001044481186, "loss": 4.9728, "mean_token_accuracy": 0.2091632142663002, "num_tokens": 84032274.0, "step": 48450 }, { "entropy": 5.469515466690064, "epoch": 3.769966932503404, "grad_norm": 1.09375, "learning_rate": 0.00036297459592598256, "loss": 4.8924, "mean_token_accuracy": 0.2042225033044815, "num_tokens": 84041334.0, "step": 48455 }, { "entropy": 5.348917818069458, "epoch": 3.7703559618751217, "grad_norm": 1.1171875, "learning_rate": 0.0003629490860689721, "loss": 4.8272, "mean_token_accuracy": 0.21530359387397766, "num_tokens": 84050443.0, "step": 48460 }, { "entropy": 5.327214479446411, "epoch": 3.770744991246839, "grad_norm": 1.15625, "learning_rate": 0.00036292357487747426, "loss": 4.8172, "mean_token_accuracy": 0.21303404718637467, "num_tokens": 84059130.0, "step": 48465 }, { "entropy": 5.37951626777649, "epoch": 3.7711340206185566, "grad_norm": 1.1875, "learning_rate": 0.00036289806235187606, "loss": 4.7766, "mean_token_accuracy": 0.22568628787994385, "num_tokens": 84068514.0, "step": 48470 }, { "entropy": 5.372968912124634, "epoch": 3.7715230499902743, "grad_norm": 1.1015625, "learning_rate": 0.0003628725484925647, "loss": 4.7322, "mean_token_accuracy": 0.22189069986343385, "num_tokens": 84076551.0, "step": 48475 }, { "entropy": 5.417578506469726, "epoch": 3.771912079361992, "grad_norm": 1.140625, "learning_rate": 0.00036284703329992734, "loss": 5.0068, "mean_token_accuracy": 0.1988322153687477, "num_tokens": 84086332.0, "step": 48480 }, { "entropy": 5.351701879501343, "epoch": 3.7723011087337093, "grad_norm": 1.2578125, "learning_rate": 0.000362821516774351, "loss": 4.7682, "mean_token_accuracy": 0.22622643709182738, "num_tokens": 84094538.0, "step": 48485 }, { "entropy": 5.433412504196167, "epoch": 3.772690138105427, "grad_norm": 1.1484375, "learning_rate": 0.00036279599891622297, "loss": 4.8328, "mean_token_accuracy": 0.21462987065315248, "num_tokens": 84104034.0, "step": 48490 }, { "entropy": 5.357803106307983, "epoch": 3.7730791674771447, "grad_norm": 1.1875, "learning_rate": 0.00036277047972593036, "loss": 4.8977, "mean_token_accuracy": 0.2121119201183319, "num_tokens": 84112893.0, "step": 48495 }, { "entropy": 5.341241121292114, "epoch": 3.773468196848862, "grad_norm": 1.265625, "learning_rate": 0.0003627449592038604, "loss": 4.8684, "mean_token_accuracy": 0.21817442327737807, "num_tokens": 84120805.0, "step": 48500 }, { "entropy": 5.3794197082519535, "epoch": 3.7738572262205796, "grad_norm": 1.109375, "learning_rate": 0.0003627194373504004, "loss": 4.8931, "mean_token_accuracy": 0.2160290524363518, "num_tokens": 84129355.0, "step": 48505 }, { "entropy": 5.3089488506317135, "epoch": 3.7742462555922973, "grad_norm": 1.1796875, "learning_rate": 0.00036269391416593753, "loss": 4.7937, "mean_token_accuracy": 0.21713491529226303, "num_tokens": 84137302.0, "step": 48510 }, { "entropy": 5.396674156188965, "epoch": 3.774635284964015, "grad_norm": 1.1171875, "learning_rate": 0.0003626683896508591, "loss": 4.9394, "mean_token_accuracy": 0.20451409816741944, "num_tokens": 84146164.0, "step": 48515 }, { "entropy": 5.344146966934204, "epoch": 3.7750243143357323, "grad_norm": 1.1640625, "learning_rate": 0.0003626428638055524, "loss": 4.7551, "mean_token_accuracy": 0.21822899132966994, "num_tokens": 84154495.0, "step": 48520 }, { "entropy": 5.525819921493531, "epoch": 3.77541334370745, "grad_norm": 1.140625, "learning_rate": 0.00036261733663040473, "loss": 4.9442, "mean_token_accuracy": 0.20247694700956345, "num_tokens": 84163239.0, "step": 48525 }, { "entropy": 5.330809545516968, "epoch": 3.775802373079167, "grad_norm": 1.1328125, "learning_rate": 0.00036259180812580347, "loss": 4.802, "mean_token_accuracy": 0.21730223000049592, "num_tokens": 84171934.0, "step": 48530 }, { "entropy": 5.309118700027466, "epoch": 3.776191402450885, "grad_norm": 1.1015625, "learning_rate": 0.00036256627829213585, "loss": 4.8574, "mean_token_accuracy": 0.21307612508535384, "num_tokens": 84180149.0, "step": 48535 }, { "entropy": 5.393866062164307, "epoch": 3.7765804318226026, "grad_norm": 1.1171875, "learning_rate": 0.00036254074712978947, "loss": 4.8325, "mean_token_accuracy": 0.21931487023830415, "num_tokens": 84188290.0, "step": 48540 }, { "entropy": 5.3707677841186525, "epoch": 3.7769694611943203, "grad_norm": 1.0703125, "learning_rate": 0.00036251521463915144, "loss": 4.8251, "mean_token_accuracy": 0.2168906733393669, "num_tokens": 84196906.0, "step": 48545 }, { "entropy": 5.245473194122314, "epoch": 3.777358490566038, "grad_norm": 1.125, "learning_rate": 0.0003624896808206093, "loss": 4.7744, "mean_token_accuracy": 0.212023563683033, "num_tokens": 84205416.0, "step": 48550 }, { "entropy": 5.442719602584839, "epoch": 3.7777475199377553, "grad_norm": 1.1015625, "learning_rate": 0.0003624641456745507, "loss": 4.9986, "mean_token_accuracy": 0.198079614341259, "num_tokens": 84214279.0, "step": 48555 }, { "entropy": 5.48408088684082, "epoch": 3.778136549309473, "grad_norm": 1.125, "learning_rate": 0.00036243860920136283, "loss": 4.911, "mean_token_accuracy": 0.208728563785553, "num_tokens": 84222976.0, "step": 48560 }, { "entropy": 5.356388235092163, "epoch": 3.77852557868119, "grad_norm": 1.203125, "learning_rate": 0.00036241307140143323, "loss": 4.8393, "mean_token_accuracy": 0.2090616136789322, "num_tokens": 84231315.0, "step": 48565 }, { "entropy": 5.330193424224854, "epoch": 3.778914608052908, "grad_norm": 1.1796875, "learning_rate": 0.00036238753227514934, "loss": 4.8484, "mean_token_accuracy": 0.21083036065101624, "num_tokens": 84239691.0, "step": 48570 }, { "entropy": 5.494891214370727, "epoch": 3.7793036374246256, "grad_norm": 1.25, "learning_rate": 0.00036236199182289883, "loss": 4.9346, "mean_token_accuracy": 0.21492374688386917, "num_tokens": 84247542.0, "step": 48575 }, { "entropy": 5.439738988876343, "epoch": 3.7796926667963433, "grad_norm": 1.1640625, "learning_rate": 0.000362336450045069, "loss": 5.0324, "mean_token_accuracy": 0.20039337277412414, "num_tokens": 84255843.0, "step": 48580 }, { "entropy": 5.325422286987305, "epoch": 3.7800816961680606, "grad_norm": 1.15625, "learning_rate": 0.00036231090694204763, "loss": 4.7882, "mean_token_accuracy": 0.2215324744582176, "num_tokens": 84264404.0, "step": 48585 }, { "entropy": 5.403598117828369, "epoch": 3.7804707255397783, "grad_norm": 1.125, "learning_rate": 0.00036228536251422226, "loss": 4.8369, "mean_token_accuracy": 0.2147928550839424, "num_tokens": 84273596.0, "step": 48590 }, { "entropy": 5.363894367218018, "epoch": 3.780859754911496, "grad_norm": 1.1875, "learning_rate": 0.00036225981676198045, "loss": 4.7865, "mean_token_accuracy": 0.2110724702477455, "num_tokens": 84283138.0, "step": 48595 }, { "entropy": 5.316057395935059, "epoch": 3.781248784283213, "grad_norm": 1.09375, "learning_rate": 0.0003622342696857098, "loss": 4.7684, "mean_token_accuracy": 0.21990798264741898, "num_tokens": 84291539.0, "step": 48600 }, { "entropy": 5.311081790924073, "epoch": 3.781637813654931, "grad_norm": 1.171875, "learning_rate": 0.0003622087212857979, "loss": 4.8248, "mean_token_accuracy": 0.22024541795253755, "num_tokens": 84299896.0, "step": 48605 }, { "entropy": 5.383578443527222, "epoch": 3.7820268430266486, "grad_norm": 1.15625, "learning_rate": 0.0003621831715626325, "loss": 4.8781, "mean_token_accuracy": 0.21606519669294358, "num_tokens": 84308195.0, "step": 48610 }, { "entropy": 5.3811619758605955, "epoch": 3.7824158723983663, "grad_norm": 1.09375, "learning_rate": 0.00036215762051660115, "loss": 4.8778, "mean_token_accuracy": 0.20864836424589156, "num_tokens": 84316636.0, "step": 48615 }, { "entropy": 5.346364736557007, "epoch": 3.7828049017700835, "grad_norm": 1.09375, "learning_rate": 0.00036213206814809175, "loss": 4.8324, "mean_token_accuracy": 0.21636251211166382, "num_tokens": 84325634.0, "step": 48620 }, { "entropy": 5.315078926086426, "epoch": 3.7831939311418012, "grad_norm": 1.1171875, "learning_rate": 0.0003621065144574919, "loss": 4.8053, "mean_token_accuracy": 0.22245784252882003, "num_tokens": 84334477.0, "step": 48625 }, { "entropy": 5.397788095474243, "epoch": 3.7835829605135185, "grad_norm": 1.1640625, "learning_rate": 0.0003620809594451893, "loss": 4.931, "mean_token_accuracy": 0.21175595819950105, "num_tokens": 84342738.0, "step": 48630 }, { "entropy": 5.474747991561889, "epoch": 3.783971989885236, "grad_norm": 1.140625, "learning_rate": 0.0003620554031115718, "loss": 4.8742, "mean_token_accuracy": 0.20963586419820784, "num_tokens": 84351305.0, "step": 48635 }, { "entropy": 5.429792070388794, "epoch": 3.784361019256954, "grad_norm": 1.203125, "learning_rate": 0.0003620298454570271, "loss": 4.8604, "mean_token_accuracy": 0.20984972268342972, "num_tokens": 84360500.0, "step": 48640 }, { "entropy": 5.4192845821380615, "epoch": 3.7847500486286716, "grad_norm": 1.078125, "learning_rate": 0.0003620042864819429, "loss": 4.864, "mean_token_accuracy": 0.20919908285140992, "num_tokens": 84369160.0, "step": 48645 }, { "entropy": 5.458877325057983, "epoch": 3.7851390780003893, "grad_norm": 1.25, "learning_rate": 0.0003619787261867072, "loss": 4.9479, "mean_token_accuracy": 0.20863496512174606, "num_tokens": 84377784.0, "step": 48650 }, { "entropy": 5.42494010925293, "epoch": 3.7855281073721065, "grad_norm": 1.109375, "learning_rate": 0.0003619531645717078, "loss": 4.8806, "mean_token_accuracy": 0.21045134216547012, "num_tokens": 84386502.0, "step": 48655 }, { "entropy": 5.392590427398682, "epoch": 3.7859171367438242, "grad_norm": 1.1484375, "learning_rate": 0.0003619276016373325, "loss": 4.9012, "mean_token_accuracy": 0.2129158928990364, "num_tokens": 84396100.0, "step": 48660 }, { "entropy": 5.404166603088379, "epoch": 3.7863061661155415, "grad_norm": 1.125, "learning_rate": 0.0003619020373839693, "loss": 4.8858, "mean_token_accuracy": 0.20430890023708342, "num_tokens": 84404917.0, "step": 48665 }, { "entropy": 5.407828998565674, "epoch": 3.786695195487259, "grad_norm": 1.1484375, "learning_rate": 0.0003618764718120059, "loss": 4.8449, "mean_token_accuracy": 0.21955275982618333, "num_tokens": 84413510.0, "step": 48670 }, { "entropy": 5.3997344970703125, "epoch": 3.787084224858977, "grad_norm": 1.2109375, "learning_rate": 0.0003618509049218304, "loss": 4.8862, "mean_token_accuracy": 0.20779266953468323, "num_tokens": 84421689.0, "step": 48675 }, { "entropy": 5.417587232589722, "epoch": 3.7874732542306946, "grad_norm": 1.171875, "learning_rate": 0.00036182533671383056, "loss": 4.8526, "mean_token_accuracy": 0.211449034512043, "num_tokens": 84430362.0, "step": 48680 }, { "entropy": 5.291483783721924, "epoch": 3.787862283602412, "grad_norm": 1.1875, "learning_rate": 0.0003617997671883944, "loss": 4.7861, "mean_token_accuracy": 0.22451868802309036, "num_tokens": 84438066.0, "step": 48685 }, { "entropy": 5.31300950050354, "epoch": 3.7882513129741295, "grad_norm": 1.1015625, "learning_rate": 0.00036177419634591, "loss": 4.7442, "mean_token_accuracy": 0.2250799521803856, "num_tokens": 84446995.0, "step": 48690 }, { "entropy": 5.3887574672698975, "epoch": 3.7886403423458472, "grad_norm": 1.09375, "learning_rate": 0.0003617486241867654, "loss": 4.8761, "mean_token_accuracy": 0.21271787136793135, "num_tokens": 84455879.0, "step": 48695 }, { "entropy": 5.381903791427613, "epoch": 3.7890293717175645, "grad_norm": 1.1171875, "learning_rate": 0.0003617230507113483, "loss": 4.7296, "mean_token_accuracy": 0.2204664543271065, "num_tokens": 84464006.0, "step": 48700 }, { "entropy": 5.36190447807312, "epoch": 3.789418401089282, "grad_norm": 1.125, "learning_rate": 0.00036169747592004704, "loss": 4.8442, "mean_token_accuracy": 0.2118131309747696, "num_tokens": 84472116.0, "step": 48705 }, { "entropy": 5.369759941101075, "epoch": 3.789807430461, "grad_norm": 1.109375, "learning_rate": 0.00036167189981324956, "loss": 4.9289, "mean_token_accuracy": 0.20844001621007918, "num_tokens": 84481303.0, "step": 48710 }, { "entropy": 5.440121841430664, "epoch": 3.7901964598327176, "grad_norm": 1.1015625, "learning_rate": 0.000361646322391344, "loss": 4.7804, "mean_token_accuracy": 0.21621585190296172, "num_tokens": 84490920.0, "step": 48715 }, { "entropy": 5.356743907928466, "epoch": 3.790585489204435, "grad_norm": 1.15625, "learning_rate": 0.0003616207436547183, "loss": 4.7909, "mean_token_accuracy": 0.22211736738681792, "num_tokens": 84498904.0, "step": 48720 }, { "entropy": 5.3964691162109375, "epoch": 3.7909745185761525, "grad_norm": 1.203125, "learning_rate": 0.00036159516360376084, "loss": 4.983, "mean_token_accuracy": 0.20178569108247757, "num_tokens": 84507718.0, "step": 48725 }, { "entropy": 5.356824731826782, "epoch": 3.7913635479478702, "grad_norm": 1.03125, "learning_rate": 0.00036156958223885945, "loss": 4.8558, "mean_token_accuracy": 0.21116693168878556, "num_tokens": 84516859.0, "step": 48730 }, { "entropy": 5.502367544174194, "epoch": 3.7917525773195875, "grad_norm": 1.125, "learning_rate": 0.0003615439995604025, "loss": 4.9184, "mean_token_accuracy": 0.21280080825090408, "num_tokens": 84526554.0, "step": 48735 }, { "entropy": 5.4064232349395756, "epoch": 3.792141606691305, "grad_norm": 1.1640625, "learning_rate": 0.0003615184155687781, "loss": 4.8248, "mean_token_accuracy": 0.21581604778766633, "num_tokens": 84535884.0, "step": 48740 }, { "entropy": 5.334324216842651, "epoch": 3.792530636063023, "grad_norm": 1.125, "learning_rate": 0.00036149283026437444, "loss": 4.7858, "mean_token_accuracy": 0.22141025960445404, "num_tokens": 84544022.0, "step": 48745 }, { "entropy": 5.378333616256714, "epoch": 3.7929196654347406, "grad_norm": 1.125, "learning_rate": 0.00036146724364757984, "loss": 4.9518, "mean_token_accuracy": 0.19941932410001756, "num_tokens": 84553408.0, "step": 48750 }, { "entropy": 5.36847152709961, "epoch": 3.793308694806458, "grad_norm": 1.0546875, "learning_rate": 0.00036144165571878233, "loss": 4.8414, "mean_token_accuracy": 0.20652897506952286, "num_tokens": 84562794.0, "step": 48755 }, { "entropy": 5.3042103290557865, "epoch": 3.7936977241781755, "grad_norm": 1.1484375, "learning_rate": 0.0003614160664783703, "loss": 4.7323, "mean_token_accuracy": 0.22932633459568025, "num_tokens": 84571064.0, "step": 48760 }, { "entropy": 5.419686317443848, "epoch": 3.7940867535498928, "grad_norm": 1.234375, "learning_rate": 0.000361390475926732, "loss": 4.7957, "mean_token_accuracy": 0.22320399582386016, "num_tokens": 84579343.0, "step": 48765 }, { "entropy": 5.394041538238525, "epoch": 3.7944757829216105, "grad_norm": 1.1328125, "learning_rate": 0.0003613648840642558, "loss": 4.9287, "mean_token_accuracy": 0.20517850816249847, "num_tokens": 84587726.0, "step": 48770 }, { "entropy": 5.375931024551392, "epoch": 3.794864812293328, "grad_norm": 1.109375, "learning_rate": 0.0003613392908913299, "loss": 4.8382, "mean_token_accuracy": 0.2109801411628723, "num_tokens": 84596293.0, "step": 48775 }, { "entropy": 5.419444274902344, "epoch": 3.795253841665046, "grad_norm": 1.140625, "learning_rate": 0.0003613136964083427, "loss": 4.8763, "mean_token_accuracy": 0.21804671585559846, "num_tokens": 84605102.0, "step": 48780 }, { "entropy": 5.449718284606933, "epoch": 3.795642871036763, "grad_norm": 1.109375, "learning_rate": 0.0003612881006156826, "loss": 4.8833, "mean_token_accuracy": 0.20645925402641296, "num_tokens": 84613696.0, "step": 48785 }, { "entropy": 5.393892288208008, "epoch": 3.796031900408481, "grad_norm": 1.1640625, "learning_rate": 0.00036126250351373786, "loss": 4.8751, "mean_token_accuracy": 0.21512623131275177, "num_tokens": 84622439.0, "step": 48790 }, { "entropy": 5.36529688835144, "epoch": 3.7964209297801985, "grad_norm": 1.171875, "learning_rate": 0.00036123690510289684, "loss": 4.8683, "mean_token_accuracy": 0.21317328065633773, "num_tokens": 84631167.0, "step": 48795 }, { "entropy": 5.429307651519776, "epoch": 3.7968099591519158, "grad_norm": 1.3203125, "learning_rate": 0.0003612113053835482, "loss": 4.9338, "mean_token_accuracy": 0.2109585151076317, "num_tokens": 84640130.0, "step": 48800 }, { "entropy": 5.507963991165161, "epoch": 3.7971989885236335, "grad_norm": 1.09375, "learning_rate": 0.0003611857043560801, "loss": 4.9691, "mean_token_accuracy": 0.2054226815700531, "num_tokens": 84648719.0, "step": 48805 }, { "entropy": 5.4106368064880375, "epoch": 3.797588017895351, "grad_norm": 1.1796875, "learning_rate": 0.0003611601020208812, "loss": 4.8614, "mean_token_accuracy": 0.21271366328001023, "num_tokens": 84656891.0, "step": 48810 }, { "entropy": 5.401108694076538, "epoch": 3.797977047267069, "grad_norm": 1.1875, "learning_rate": 0.0003611344983783398, "loss": 4.8663, "mean_token_accuracy": 0.21545614302158356, "num_tokens": 84665678.0, "step": 48815 }, { "entropy": 5.4180670261383055, "epoch": 3.798366076638786, "grad_norm": 1.1796875, "learning_rate": 0.0003611088934288445, "loss": 4.8211, "mean_token_accuracy": 0.21985283941030503, "num_tokens": 84674112.0, "step": 48820 }, { "entropy": 5.329475927352905, "epoch": 3.798755106010504, "grad_norm": 1.1484375, "learning_rate": 0.00036108328717278387, "loss": 4.8809, "mean_token_accuracy": 0.2107171446084976, "num_tokens": 84682294.0, "step": 48825 }, { "entropy": 5.305478143692016, "epoch": 3.7991441353822215, "grad_norm": 1.28125, "learning_rate": 0.00036105767961054636, "loss": 4.7925, "mean_token_accuracy": 0.22056083083152772, "num_tokens": 84690399.0, "step": 48830 }, { "entropy": 5.394183206558227, "epoch": 3.7995331647539388, "grad_norm": 1.234375, "learning_rate": 0.0003610320707425205, "loss": 4.8466, "mean_token_accuracy": 0.2176917463541031, "num_tokens": 84698451.0, "step": 48835 }, { "entropy": 5.414718151092529, "epoch": 3.7999221941256565, "grad_norm": 1.1328125, "learning_rate": 0.000361006460569095, "loss": 4.8402, "mean_token_accuracy": 0.2216223493218422, "num_tokens": 84707808.0, "step": 48840 }, { "entropy": 5.413246917724609, "epoch": 3.800311223497374, "grad_norm": 1.1328125, "learning_rate": 0.00036098084909065814, "loss": 4.8931, "mean_token_accuracy": 0.21050593703985215, "num_tokens": 84716915.0, "step": 48845 }, { "entropy": 5.34749960899353, "epoch": 3.800700252869092, "grad_norm": 1.21875, "learning_rate": 0.0003609552363075989, "loss": 4.8096, "mean_token_accuracy": 0.21784162670373916, "num_tokens": 84724691.0, "step": 48850 }, { "entropy": 5.364886999130249, "epoch": 3.801089282240809, "grad_norm": 1.1875, "learning_rate": 0.00036092962222030573, "loss": 4.8249, "mean_token_accuracy": 0.2102698117494583, "num_tokens": 84733680.0, "step": 48855 }, { "entropy": 5.358042192459107, "epoch": 3.801478311612527, "grad_norm": 1.09375, "learning_rate": 0.0003609040068291673, "loss": 4.8136, "mean_token_accuracy": 0.21756737679243088, "num_tokens": 84742722.0, "step": 48860 }, { "entropy": 5.330917072296143, "epoch": 3.801867340984244, "grad_norm": 1.109375, "learning_rate": 0.0003608783901345724, "loss": 4.8004, "mean_token_accuracy": 0.21604165881872178, "num_tokens": 84751320.0, "step": 48865 }, { "entropy": 5.368800783157349, "epoch": 3.8022563703559618, "grad_norm": 1.09375, "learning_rate": 0.00036085277213690947, "loss": 4.842, "mean_token_accuracy": 0.21910916417837142, "num_tokens": 84759905.0, "step": 48870 }, { "entropy": 5.378180885314942, "epoch": 3.8026453997276795, "grad_norm": 1.0546875, "learning_rate": 0.0003608271528365675, "loss": 4.9363, "mean_token_accuracy": 0.1978272795677185, "num_tokens": 84768821.0, "step": 48875 }, { "entropy": 5.397261619567871, "epoch": 3.803034429099397, "grad_norm": 1.1875, "learning_rate": 0.000360801532233935, "loss": 4.784, "mean_token_accuracy": 0.21749879866838456, "num_tokens": 84776809.0, "step": 48880 }, { "entropy": 5.336229944229126, "epoch": 3.8034234584711144, "grad_norm": 1.1640625, "learning_rate": 0.0003607759103294008, "loss": 4.8012, "mean_token_accuracy": 0.2177709475159645, "num_tokens": 84785043.0, "step": 48885 }, { "entropy": 5.297978830337525, "epoch": 3.803812487842832, "grad_norm": 1.1171875, "learning_rate": 0.0003607502871233538, "loss": 4.825, "mean_token_accuracy": 0.2129688337445259, "num_tokens": 84793369.0, "step": 48890 }, { "entropy": 5.285146570205688, "epoch": 3.80420151721455, "grad_norm": 1.1953125, "learning_rate": 0.0003607246626161826, "loss": 4.7341, "mean_token_accuracy": 0.21907636374235154, "num_tokens": 84801792.0, "step": 48895 }, { "entropy": 5.3475878715515135, "epoch": 3.804590546586267, "grad_norm": 1.109375, "learning_rate": 0.000360699036808276, "loss": 4.8143, "mean_token_accuracy": 0.21554414182901382, "num_tokens": 84810381.0, "step": 48900 }, { "entropy": 5.380750465393066, "epoch": 3.8049795759579847, "grad_norm": 1.1015625, "learning_rate": 0.0003606734097000231, "loss": 4.7767, "mean_token_accuracy": 0.21850337833166122, "num_tokens": 84818979.0, "step": 48905 }, { "entropy": 5.333633136749268, "epoch": 3.8053686053297024, "grad_norm": 1.109375, "learning_rate": 0.0003606477812918125, "loss": 4.7922, "mean_token_accuracy": 0.22206557244062425, "num_tokens": 84827844.0, "step": 48910 }, { "entropy": 5.28030366897583, "epoch": 3.80575763470142, "grad_norm": 1.25, "learning_rate": 0.0003606221515840331, "loss": 4.8476, "mean_token_accuracy": 0.21228626519441604, "num_tokens": 84836336.0, "step": 48915 }, { "entropy": 5.3466136932373045, "epoch": 3.8061466640731374, "grad_norm": 1.171875, "learning_rate": 0.00036059652057707394, "loss": 4.8395, "mean_token_accuracy": 0.22071217596530915, "num_tokens": 84844340.0, "step": 48920 }, { "entropy": 5.304082679748535, "epoch": 3.806535693444855, "grad_norm": 1.0625, "learning_rate": 0.0003605708882713237, "loss": 4.8062, "mean_token_accuracy": 0.2210530400276184, "num_tokens": 84853201.0, "step": 48925 }, { "entropy": 5.343185186386108, "epoch": 3.806924722816573, "grad_norm": 1.21875, "learning_rate": 0.00036054525466717145, "loss": 4.9108, "mean_token_accuracy": 0.2129480168223381, "num_tokens": 84861764.0, "step": 48930 }, { "entropy": 5.314773893356323, "epoch": 3.80731375218829, "grad_norm": 1.03125, "learning_rate": 0.0003605196197650062, "loss": 4.7982, "mean_token_accuracy": 0.212201789021492, "num_tokens": 84870536.0, "step": 48935 }, { "entropy": 5.470804834365845, "epoch": 3.8077027815600077, "grad_norm": 1.15625, "learning_rate": 0.0003604939835652167, "loss": 4.961, "mean_token_accuracy": 0.20273516178131104, "num_tokens": 84879258.0, "step": 48940 }, { "entropy": 5.281630563735962, "epoch": 3.8080918109317254, "grad_norm": 1.140625, "learning_rate": 0.00036046834606819224, "loss": 4.7424, "mean_token_accuracy": 0.22670885175466537, "num_tokens": 84888212.0, "step": 48945 }, { "entropy": 5.390174293518067, "epoch": 3.808480840303443, "grad_norm": 1.109375, "learning_rate": 0.0003604427072743216, "loss": 4.8683, "mean_token_accuracy": 0.21703223139047623, "num_tokens": 84896877.0, "step": 48950 }, { "entropy": 5.3506804466247555, "epoch": 3.8088698696751604, "grad_norm": 1.1875, "learning_rate": 0.00036041706718399386, "loss": 4.8725, "mean_token_accuracy": 0.2105171948671341, "num_tokens": 84905594.0, "step": 48955 }, { "entropy": 5.332077598571777, "epoch": 3.809258899046878, "grad_norm": 1.1640625, "learning_rate": 0.000360391425797598, "loss": 4.8344, "mean_token_accuracy": 0.21445717066526412, "num_tokens": 84914658.0, "step": 48960 }, { "entropy": 5.475912094116211, "epoch": 3.8096479284185953, "grad_norm": 1.2265625, "learning_rate": 0.0003603657831155233, "loss": 4.952, "mean_token_accuracy": 0.2087505877017975, "num_tokens": 84924053.0, "step": 48965 }, { "entropy": 5.3516120433807375, "epoch": 3.810036957790313, "grad_norm": 1.203125, "learning_rate": 0.0003603401391381587, "loss": 4.7599, "mean_token_accuracy": 0.2216384917497635, "num_tokens": 84932445.0, "step": 48970 }, { "entropy": 5.331463623046875, "epoch": 3.8104259871620307, "grad_norm": 1.140625, "learning_rate": 0.00036031449386589326, "loss": 4.8263, "mean_token_accuracy": 0.21812264025211334, "num_tokens": 84940889.0, "step": 48975 }, { "entropy": 5.377898216247559, "epoch": 3.8108150165337484, "grad_norm": 1.15625, "learning_rate": 0.0003602888472991162, "loss": 4.8953, "mean_token_accuracy": 0.1996566101908684, "num_tokens": 84949314.0, "step": 48980 }, { "entropy": 5.40591025352478, "epoch": 3.811204045905466, "grad_norm": 1.109375, "learning_rate": 0.00036026319943821664, "loss": 4.8468, "mean_token_accuracy": 0.2203821524977684, "num_tokens": 84958313.0, "step": 48985 }, { "entropy": 5.4249590873718265, "epoch": 3.8115930752771834, "grad_norm": 1.234375, "learning_rate": 0.0003602375502835837, "loss": 4.903, "mean_token_accuracy": 0.21262612491846083, "num_tokens": 84967367.0, "step": 48990 }, { "entropy": 5.420601224899292, "epoch": 3.811982104648901, "grad_norm": 1.171875, "learning_rate": 0.00036021189983560667, "loss": 4.957, "mean_token_accuracy": 0.2099213793873787, "num_tokens": 84975890.0, "step": 48995 }, { "entropy": 5.418737602233887, "epoch": 3.8123711340206183, "grad_norm": 1.0546875, "learning_rate": 0.00036018624809467466, "loss": 4.8721, "mean_token_accuracy": 0.20916310101747512, "num_tokens": 84985089.0, "step": 49000 }, { "entropy": 5.421949338912964, "epoch": 3.812760163392336, "grad_norm": 1.1640625, "learning_rate": 0.00036016059506117687, "loss": 4.8619, "mean_token_accuracy": 0.21321135759353638, "num_tokens": 84993825.0, "step": 49005 }, { "entropy": 5.457699489593506, "epoch": 3.8131491927640537, "grad_norm": 1.109375, "learning_rate": 0.0003601349407355027, "loss": 4.9491, "mean_token_accuracy": 0.20711114257574081, "num_tokens": 85003301.0, "step": 49010 }, { "entropy": 5.392137479782105, "epoch": 3.8135382221357714, "grad_norm": 1.1328125, "learning_rate": 0.0003601092851180412, "loss": 4.9422, "mean_token_accuracy": 0.20204103887081146, "num_tokens": 85012082.0, "step": 49015 }, { "entropy": 5.489521598815918, "epoch": 3.8139272515074887, "grad_norm": 1.1328125, "learning_rate": 0.00036008362820918186, "loss": 4.8921, "mean_token_accuracy": 0.20815909504890442, "num_tokens": 85021299.0, "step": 49020 }, { "entropy": 5.383515405654907, "epoch": 3.8143162808792064, "grad_norm": 1.1328125, "learning_rate": 0.0003600579700093138, "loss": 4.8501, "mean_token_accuracy": 0.21293762028217317, "num_tokens": 85030418.0, "step": 49025 }, { "entropy": 5.35365047454834, "epoch": 3.814705310250924, "grad_norm": 1.15625, "learning_rate": 0.00036003231051882646, "loss": 4.8482, "mean_token_accuracy": 0.2144520327448845, "num_tokens": 85038780.0, "step": 49030 }, { "entropy": 5.39434027671814, "epoch": 3.8150943396226413, "grad_norm": 1.1640625, "learning_rate": 0.00036000664973810914, "loss": 4.9476, "mean_token_accuracy": 0.2117200881242752, "num_tokens": 85048456.0, "step": 49035 }, { "entropy": 5.406230068206787, "epoch": 3.815483368994359, "grad_norm": 1.1015625, "learning_rate": 0.0003599809876675513, "loss": 4.8467, "mean_token_accuracy": 0.21495288908481597, "num_tokens": 85057058.0, "step": 49040 }, { "entropy": 5.407706642150879, "epoch": 3.8158723983660767, "grad_norm": 1.09375, "learning_rate": 0.00035995532430754205, "loss": 4.8304, "mean_token_accuracy": 0.21891197562217712, "num_tokens": 85066156.0, "step": 49045 }, { "entropy": 5.428645610809326, "epoch": 3.8162614277377944, "grad_norm": 1.2265625, "learning_rate": 0.0003599296596584711, "loss": 4.8909, "mean_token_accuracy": 0.21328189373016357, "num_tokens": 85075412.0, "step": 49050 }, { "entropy": 5.457464027404785, "epoch": 3.8166504571095117, "grad_norm": 1.078125, "learning_rate": 0.0003599039937207278, "loss": 4.9538, "mean_token_accuracy": 0.209725458920002, "num_tokens": 85085140.0, "step": 49055 }, { "entropy": 5.345560741424561, "epoch": 3.8170394864812294, "grad_norm": 1.1640625, "learning_rate": 0.0003598783264947015, "loss": 4.8291, "mean_token_accuracy": 0.21992829144001008, "num_tokens": 85093707.0, "step": 49060 }, { "entropy": 5.272307920455932, "epoch": 3.8174285158529466, "grad_norm": 1.1640625, "learning_rate": 0.00035985265798078165, "loss": 4.7416, "mean_token_accuracy": 0.22282542884349824, "num_tokens": 85102060.0, "step": 49065 }, { "entropy": 5.291296863555909, "epoch": 3.8178175452246643, "grad_norm": 1.1328125, "learning_rate": 0.00035982698817935783, "loss": 4.7643, "mean_token_accuracy": 0.2261415332555771, "num_tokens": 85110603.0, "step": 49070 }, { "entropy": 5.438015985488891, "epoch": 3.818206574596382, "grad_norm": 1.140625, "learning_rate": 0.0003598013170908194, "loss": 4.8447, "mean_token_accuracy": 0.21482376009225845, "num_tokens": 85118371.0, "step": 49075 }, { "entropy": 5.3634607791900635, "epoch": 3.8185956039680997, "grad_norm": 1.1953125, "learning_rate": 0.0003597756447155559, "loss": 4.8731, "mean_token_accuracy": 0.2145504340529442, "num_tokens": 85127498.0, "step": 49080 }, { "entropy": 5.4380635738372805, "epoch": 3.8189846333398174, "grad_norm": 1.203125, "learning_rate": 0.00035974997105395705, "loss": 4.9062, "mean_token_accuracy": 0.20289222598075868, "num_tokens": 85136321.0, "step": 49085 }, { "entropy": 5.43972749710083, "epoch": 3.8193736627115347, "grad_norm": 1.1171875, "learning_rate": 0.00035972429610641224, "loss": 4.8671, "mean_token_accuracy": 0.20698008090257644, "num_tokens": 85144509.0, "step": 49090 }, { "entropy": 5.467578649520874, "epoch": 3.8197626920832524, "grad_norm": 1.0859375, "learning_rate": 0.00035969861987331114, "loss": 4.9324, "mean_token_accuracy": 0.21168333888053895, "num_tokens": 85153151.0, "step": 49095 }, { "entropy": 5.373190832138062, "epoch": 3.8201517214549696, "grad_norm": 1.1640625, "learning_rate": 0.0003596729423550433, "loss": 4.8762, "mean_token_accuracy": 0.20938099622726442, "num_tokens": 85161481.0, "step": 49100 }, { "entropy": 5.387825536727905, "epoch": 3.8205407508266873, "grad_norm": 1.1796875, "learning_rate": 0.0003596472635519983, "loss": 4.8378, "mean_token_accuracy": 0.21613711565732957, "num_tokens": 85170540.0, "step": 49105 }, { "entropy": 5.376368522644043, "epoch": 3.820929780198405, "grad_norm": 1.1328125, "learning_rate": 0.0003596215834645657, "loss": 4.9133, "mean_token_accuracy": 0.21119810342788697, "num_tokens": 85179559.0, "step": 49110 }, { "entropy": 5.404464769363403, "epoch": 3.8213188095701227, "grad_norm": 1.265625, "learning_rate": 0.00035959590209313537, "loss": 4.7728, "mean_token_accuracy": 0.21895685642957688, "num_tokens": 85187877.0, "step": 49115 }, { "entropy": 5.443701839447021, "epoch": 3.82170783894184, "grad_norm": 1.1875, "learning_rate": 0.0003595702194380968, "loss": 4.847, "mean_token_accuracy": 0.21235233098268508, "num_tokens": 85196909.0, "step": 49120 }, { "entropy": 5.270828199386597, "epoch": 3.8220968683135577, "grad_norm": 1.09375, "learning_rate": 0.00035954453549983984, "loss": 4.7282, "mean_token_accuracy": 0.22367016822099686, "num_tokens": 85205647.0, "step": 49125 }, { "entropy": 5.378337574005127, "epoch": 3.8224858976852754, "grad_norm": 1.1796875, "learning_rate": 0.00035951885027875406, "loss": 4.8696, "mean_token_accuracy": 0.205944162607193, "num_tokens": 85214533.0, "step": 49130 }, { "entropy": 5.45755295753479, "epoch": 3.8228749270569926, "grad_norm": 1.078125, "learning_rate": 0.00035949316377522934, "loss": 4.96, "mean_token_accuracy": 0.20505741238594055, "num_tokens": 85222658.0, "step": 49135 }, { "entropy": 5.449260091781616, "epoch": 3.8232639564287103, "grad_norm": 1.0546875, "learning_rate": 0.0003594674759896553, "loss": 4.9227, "mean_token_accuracy": 0.20826692879199982, "num_tokens": 85231547.0, "step": 49140 }, { "entropy": 5.362991619110107, "epoch": 3.823652985800428, "grad_norm": 1.1015625, "learning_rate": 0.0003594417869224217, "loss": 4.857, "mean_token_accuracy": 0.20972586274147034, "num_tokens": 85240494.0, "step": 49145 }, { "entropy": 5.345929908752441, "epoch": 3.8240420151721457, "grad_norm": 1.140625, "learning_rate": 0.00035941609657391845, "loss": 4.7523, "mean_token_accuracy": 0.22582974433898925, "num_tokens": 85248887.0, "step": 49150 }, { "entropy": 5.44267692565918, "epoch": 3.824431044543863, "grad_norm": 1.2109375, "learning_rate": 0.0003593904049445353, "loss": 4.9026, "mean_token_accuracy": 0.20788061022758483, "num_tokens": 85257472.0, "step": 49155 }, { "entropy": 5.308692359924317, "epoch": 3.8248200739155807, "grad_norm": 1.1484375, "learning_rate": 0.00035936471203466206, "loss": 4.8236, "mean_token_accuracy": 0.21016405075788497, "num_tokens": 85265809.0, "step": 49160 }, { "entropy": 5.3967290878295895, "epoch": 3.8252091032872984, "grad_norm": 1.171875, "learning_rate": 0.0003593390178446886, "loss": 4.914, "mean_token_accuracy": 0.21247025579214096, "num_tokens": 85273933.0, "step": 49165 }, { "entropy": 5.409799575805664, "epoch": 3.8255981326590156, "grad_norm": 1.2109375, "learning_rate": 0.0003593133223750047, "loss": 4.8955, "mean_token_accuracy": 0.2122568815946579, "num_tokens": 85281916.0, "step": 49170 }, { "entropy": 5.366797256469726, "epoch": 3.8259871620307333, "grad_norm": 1.1171875, "learning_rate": 0.0003592876256260004, "loss": 4.837, "mean_token_accuracy": 0.20937739312648773, "num_tokens": 85291613.0, "step": 49175 }, { "entropy": 5.420622777938843, "epoch": 3.826376191402451, "grad_norm": 1.2265625, "learning_rate": 0.0003592619275980656, "loss": 4.9431, "mean_token_accuracy": 0.20032470375299455, "num_tokens": 85300027.0, "step": 49180 }, { "entropy": 5.45319013595581, "epoch": 3.8267652207741687, "grad_norm": 1.1015625, "learning_rate": 0.00035923622829159014, "loss": 4.8739, "mean_token_accuracy": 0.21081397384405137, "num_tokens": 85309251.0, "step": 49185 }, { "entropy": 5.343557739257813, "epoch": 3.827154250145886, "grad_norm": 1.21875, "learning_rate": 0.0003592105277069639, "loss": 4.7673, "mean_token_accuracy": 0.21544500738382338, "num_tokens": 85316849.0, "step": 49190 }, { "entropy": 5.377697420120239, "epoch": 3.8275432795176036, "grad_norm": 1.1640625, "learning_rate": 0.000359184825844577, "loss": 4.8873, "mean_token_accuracy": 0.20978275686502457, "num_tokens": 85325673.0, "step": 49195 }, { "entropy": 5.370963430404663, "epoch": 3.827932308889321, "grad_norm": 1.1015625, "learning_rate": 0.00035915912270481935, "loss": 4.8475, "mean_token_accuracy": 0.21689437776803971, "num_tokens": 85334485.0, "step": 49200 }, { "entropy": 5.352567291259765, "epoch": 3.8283213382610386, "grad_norm": 1.1015625, "learning_rate": 0.000359133418288081, "loss": 4.8446, "mean_token_accuracy": 0.21981618851423262, "num_tokens": 85342459.0, "step": 49205 }, { "entropy": 5.402795934677124, "epoch": 3.8287103676327563, "grad_norm": 1.171875, "learning_rate": 0.00035910771259475187, "loss": 4.8633, "mean_token_accuracy": 0.21429249346256257, "num_tokens": 85351163.0, "step": 49210 }, { "entropy": 5.410806608200073, "epoch": 3.829099397004474, "grad_norm": 1.3203125, "learning_rate": 0.0003590820056252222, "loss": 4.9107, "mean_token_accuracy": 0.20597064048051833, "num_tokens": 85359378.0, "step": 49215 }, { "entropy": 5.427314424514771, "epoch": 3.8294884263761912, "grad_norm": 1.15625, "learning_rate": 0.0003590562973798818, "loss": 4.9246, "mean_token_accuracy": 0.21375837922096252, "num_tokens": 85368113.0, "step": 49220 }, { "entropy": 5.354839181900024, "epoch": 3.829877455747909, "grad_norm": 1.1484375, "learning_rate": 0.0003590305878591209, "loss": 4.8696, "mean_token_accuracy": 0.20545235723257066, "num_tokens": 85376757.0, "step": 49225 }, { "entropy": 5.452987337112427, "epoch": 3.8302664851196266, "grad_norm": 1.1484375, "learning_rate": 0.00035900487706332963, "loss": 4.9879, "mean_token_accuracy": 0.20366422235965728, "num_tokens": 85385382.0, "step": 49230 }, { "entropy": 5.382672929763794, "epoch": 3.830655514491344, "grad_norm": 1.125, "learning_rate": 0.000358979164992898, "loss": 4.786, "mean_token_accuracy": 0.22284211069345475, "num_tokens": 85393947.0, "step": 49235 }, { "entropy": 5.367537784576416, "epoch": 3.8310445438630616, "grad_norm": 1.140625, "learning_rate": 0.00035895345164821624, "loss": 4.7522, "mean_token_accuracy": 0.22473657727241517, "num_tokens": 85402083.0, "step": 49240 }, { "entropy": 5.341214275360107, "epoch": 3.8314335732347793, "grad_norm": 1.1875, "learning_rate": 0.0003589277370296745, "loss": 4.8692, "mean_token_accuracy": 0.21610562652349471, "num_tokens": 85410589.0, "step": 49245 }, { "entropy": 5.448135852813721, "epoch": 3.831822602606497, "grad_norm": 1.15625, "learning_rate": 0.00035890202113766283, "loss": 4.8931, "mean_token_accuracy": 0.21050004065036773, "num_tokens": 85419413.0, "step": 49250 }, { "entropy": 5.46400260925293, "epoch": 3.8322116319782142, "grad_norm": 1.09375, "learning_rate": 0.00035887630397257167, "loss": 4.927, "mean_token_accuracy": 0.2058223694562912, "num_tokens": 85428539.0, "step": 49255 }, { "entropy": 5.347223424911499, "epoch": 3.832600661349932, "grad_norm": 1.4296875, "learning_rate": 0.000358850585534791, "loss": 4.858, "mean_token_accuracy": 0.21469225287437438, "num_tokens": 85437260.0, "step": 49260 }, { "entropy": 5.35832724571228, "epoch": 3.8329896907216496, "grad_norm": 1.1328125, "learning_rate": 0.00035882486582471124, "loss": 4.8716, "mean_token_accuracy": 0.21331861168146132, "num_tokens": 85446026.0, "step": 49265 }, { "entropy": 5.397970247268677, "epoch": 3.833378720093367, "grad_norm": 1.1171875, "learning_rate": 0.0003587991448427225, "loss": 4.9174, "mean_token_accuracy": 0.20954670906066894, "num_tokens": 85455024.0, "step": 49270 }, { "entropy": 5.313426685333252, "epoch": 3.8337677494650846, "grad_norm": 1.078125, "learning_rate": 0.00035877342258921514, "loss": 4.7859, "mean_token_accuracy": 0.22052097022533418, "num_tokens": 85464089.0, "step": 49275 }, { "entropy": 5.406452751159668, "epoch": 3.8341567788368023, "grad_norm": 1.2109375, "learning_rate": 0.00035874769906457936, "loss": 4.925, "mean_token_accuracy": 0.21464455723762513, "num_tokens": 85471909.0, "step": 49280 }, { "entropy": 5.272440576553345, "epoch": 3.83454580820852, "grad_norm": 1.2109375, "learning_rate": 0.00035872197426920567, "loss": 4.7333, "mean_token_accuracy": 0.2214886650443077, "num_tokens": 85480291.0, "step": 49285 }, { "entropy": 5.314004230499267, "epoch": 3.8349348375802372, "grad_norm": 1.25, "learning_rate": 0.0003586962482034842, "loss": 4.7386, "mean_token_accuracy": 0.22440838664770127, "num_tokens": 85489155.0, "step": 49290 }, { "entropy": 5.260528039932251, "epoch": 3.835323866951955, "grad_norm": 1.1640625, "learning_rate": 0.00035867052086780544, "loss": 4.7547, "mean_token_accuracy": 0.2201266512274742, "num_tokens": 85497610.0, "step": 49295 }, { "entropy": 5.2254434585571286, "epoch": 3.835712896323672, "grad_norm": 1.171875, "learning_rate": 0.0003586447922625596, "loss": 4.7554, "mean_token_accuracy": 0.2247130960226059, "num_tokens": 85506037.0, "step": 49300 }, { "entropy": 5.441733312606812, "epoch": 3.83610192569539, "grad_norm": 1.1328125, "learning_rate": 0.00035861906238813726, "loss": 4.9222, "mean_token_accuracy": 0.20879645198583602, "num_tokens": 85515154.0, "step": 49305 }, { "entropy": 5.433365535736084, "epoch": 3.8364909550671076, "grad_norm": 1.046875, "learning_rate": 0.00035859333124492866, "loss": 4.8582, "mean_token_accuracy": 0.2182568773627281, "num_tokens": 85524090.0, "step": 49310 }, { "entropy": 5.443056583404541, "epoch": 3.8368799844388253, "grad_norm": 1.140625, "learning_rate": 0.0003585675988333244, "loss": 4.8925, "mean_token_accuracy": 0.21472567170858384, "num_tokens": 85532946.0, "step": 49315 }, { "entropy": 5.400026273727417, "epoch": 3.837269013810543, "grad_norm": 1.0390625, "learning_rate": 0.0003585418651537147, "loss": 4.8107, "mean_token_accuracy": 0.21380586475133895, "num_tokens": 85542720.0, "step": 49320 }, { "entropy": 5.352134037017822, "epoch": 3.8376580431822602, "grad_norm": 1.1171875, "learning_rate": 0.00035851613020649036, "loss": 4.8377, "mean_token_accuracy": 0.22012614458799362, "num_tokens": 85551710.0, "step": 49325 }, { "entropy": 5.406709241867065, "epoch": 3.838047072553978, "grad_norm": 1.1015625, "learning_rate": 0.00035849039399204157, "loss": 4.8768, "mean_token_accuracy": 0.21051025837659837, "num_tokens": 85560270.0, "step": 49330 }, { "entropy": 5.3659967422485355, "epoch": 3.838436101925695, "grad_norm": 1.3203125, "learning_rate": 0.00035846465651075897, "loss": 4.8132, "mean_token_accuracy": 0.2115047514438629, "num_tokens": 85568166.0, "step": 49335 }, { "entropy": 5.357828950881958, "epoch": 3.838825131297413, "grad_norm": 1.171875, "learning_rate": 0.00035843891776303304, "loss": 4.8677, "mean_token_accuracy": 0.21093716323375702, "num_tokens": 85576183.0, "step": 49340 }, { "entropy": 5.3142406940460205, "epoch": 3.8392141606691306, "grad_norm": 1.171875, "learning_rate": 0.0003584131777492543, "loss": 4.7841, "mean_token_accuracy": 0.21688947975635528, "num_tokens": 85584789.0, "step": 49345 }, { "entropy": 5.393529272079467, "epoch": 3.8396031900408483, "grad_norm": 1.125, "learning_rate": 0.0003583874364698134, "loss": 4.9237, "mean_token_accuracy": 0.21380278915166856, "num_tokens": 85593094.0, "step": 49350 }, { "entropy": 5.457193088531494, "epoch": 3.8399922194125655, "grad_norm": 1.2421875, "learning_rate": 0.0003583616939251009, "loss": 5.0086, "mean_token_accuracy": 0.198978029191494, "num_tokens": 85601673.0, "step": 49355 }, { "entropy": 5.431853246688843, "epoch": 3.840381248784283, "grad_norm": 1.1953125, "learning_rate": 0.0003583359501155073, "loss": 4.9163, "mean_token_accuracy": 0.2131246730685234, "num_tokens": 85609622.0, "step": 49360 }, { "entropy": 5.405243158340454, "epoch": 3.840770278156001, "grad_norm": 1.15625, "learning_rate": 0.0003583102050414234, "loss": 4.9109, "mean_token_accuracy": 0.20622801780700684, "num_tokens": 85619131.0, "step": 49365 }, { "entropy": 5.317914056777954, "epoch": 3.841159307527718, "grad_norm": 1.1484375, "learning_rate": 0.00035828445870323967, "loss": 4.7956, "mean_token_accuracy": 0.21311789900064468, "num_tokens": 85626802.0, "step": 49370 }, { "entropy": 5.336965036392212, "epoch": 3.841548336899436, "grad_norm": 1.1171875, "learning_rate": 0.0003582587111013469, "loss": 4.7895, "mean_token_accuracy": 0.2215505674481392, "num_tokens": 85635927.0, "step": 49375 }, { "entropy": 5.359397077560425, "epoch": 3.8419373662711536, "grad_norm": 1.15625, "learning_rate": 0.0003582329622361356, "loss": 4.7835, "mean_token_accuracy": 0.21502152532339097, "num_tokens": 85644152.0, "step": 49380 }, { "entropy": 5.377920246124267, "epoch": 3.8423263956428713, "grad_norm": 1.140625, "learning_rate": 0.0003582072121079966, "loss": 4.8501, "mean_token_accuracy": 0.21364355683326722, "num_tokens": 85652436.0, "step": 49385 }, { "entropy": 5.372662019729614, "epoch": 3.8427154250145885, "grad_norm": 1.3359375, "learning_rate": 0.00035818146071732064, "loss": 4.8996, "mean_token_accuracy": 0.20561764985322953, "num_tokens": 85661836.0, "step": 49390 }, { "entropy": 5.319490909576416, "epoch": 3.843104454386306, "grad_norm": 1.109375, "learning_rate": 0.00035815570806449845, "loss": 4.8571, "mean_token_accuracy": 0.20462923496961594, "num_tokens": 85671079.0, "step": 49395 }, { "entropy": 5.40166711807251, "epoch": 3.8434934837580235, "grad_norm": 1.046875, "learning_rate": 0.00035812995414992075, "loss": 4.855, "mean_token_accuracy": 0.21832002997398375, "num_tokens": 85680226.0, "step": 49400 }, { "entropy": 5.398334550857544, "epoch": 3.843882513129741, "grad_norm": 1.171875, "learning_rate": 0.00035810419897397823, "loss": 4.8103, "mean_token_accuracy": 0.21397507935762405, "num_tokens": 85688161.0, "step": 49405 }, { "entropy": 5.3294501304626465, "epoch": 3.844271542501459, "grad_norm": 1.15625, "learning_rate": 0.0003580784425370618, "loss": 4.7938, "mean_token_accuracy": 0.22475031465291978, "num_tokens": 85697065.0, "step": 49410 }, { "entropy": 5.406174516677856, "epoch": 3.8446605718731766, "grad_norm": 1.1484375, "learning_rate": 0.0003580526848395622, "loss": 4.8546, "mean_token_accuracy": 0.2149505689740181, "num_tokens": 85705863.0, "step": 49415 }, { "entropy": 5.445010805130005, "epoch": 3.8450496012448943, "grad_norm": 1.15625, "learning_rate": 0.00035802692588187036, "loss": 4.8976, "mean_token_accuracy": 0.20930345058441163, "num_tokens": 85714475.0, "step": 49420 }, { "entropy": 5.40729832649231, "epoch": 3.8454386306166115, "grad_norm": 1.1328125, "learning_rate": 0.000358001165664377, "loss": 4.8743, "mean_token_accuracy": 0.21048289835453032, "num_tokens": 85723217.0, "step": 49425 }, { "entropy": 5.438900184631348, "epoch": 3.845827659988329, "grad_norm": 1.1328125, "learning_rate": 0.0003579754041874731, "loss": 4.8592, "mean_token_accuracy": 0.2158377930521965, "num_tokens": 85731324.0, "step": 49430 }, { "entropy": 5.426533651351929, "epoch": 3.8462166893600465, "grad_norm": 1.2109375, "learning_rate": 0.0003579496414515495, "loss": 4.8471, "mean_token_accuracy": 0.2072739452123642, "num_tokens": 85739407.0, "step": 49435 }, { "entropy": 5.414934825897217, "epoch": 3.846605718731764, "grad_norm": 1.2109375, "learning_rate": 0.00035792387745699715, "loss": 4.8036, "mean_token_accuracy": 0.2222285345196724, "num_tokens": 85747749.0, "step": 49440 }, { "entropy": 5.433607149124145, "epoch": 3.846994748103482, "grad_norm": 1.1484375, "learning_rate": 0.0003578981122042069, "loss": 4.8901, "mean_token_accuracy": 0.20729900449514388, "num_tokens": 85756008.0, "step": 49445 }, { "entropy": 5.334391975402832, "epoch": 3.8473837774751996, "grad_norm": 1.109375, "learning_rate": 0.0003578723456935698, "loss": 4.8862, "mean_token_accuracy": 0.21168475598096848, "num_tokens": 85764796.0, "step": 49450 }, { "entropy": 5.467380428314209, "epoch": 3.847772806846917, "grad_norm": 1.2421875, "learning_rate": 0.0003578465779254768, "loss": 4.8482, "mean_token_accuracy": 0.2108509510755539, "num_tokens": 85773160.0, "step": 49455 }, { "entropy": 5.392522096633911, "epoch": 3.8481618362186345, "grad_norm": 1.1640625, "learning_rate": 0.00035782080890031876, "loss": 4.84, "mean_token_accuracy": 0.21254764795303344, "num_tokens": 85781625.0, "step": 49460 }, { "entropy": 5.340482091903686, "epoch": 3.848550865590352, "grad_norm": 1.171875, "learning_rate": 0.00035779503861848677, "loss": 4.8146, "mean_token_accuracy": 0.2167460709810257, "num_tokens": 85790173.0, "step": 49465 }, { "entropy": 5.3352930545806885, "epoch": 3.8489398949620695, "grad_norm": 1.078125, "learning_rate": 0.0003577692670803719, "loss": 4.8161, "mean_token_accuracy": 0.21474898755550384, "num_tokens": 85799965.0, "step": 49470 }, { "entropy": 5.428297138214111, "epoch": 3.849328924333787, "grad_norm": 1.1953125, "learning_rate": 0.0003577434942863651, "loss": 4.8984, "mean_token_accuracy": 0.21247785091400145, "num_tokens": 85809293.0, "step": 49475 }, { "entropy": 5.417802476882935, "epoch": 3.849717953705505, "grad_norm": 1.171875, "learning_rate": 0.0003577177202368575, "loss": 4.9235, "mean_token_accuracy": 0.2178581103682518, "num_tokens": 85818321.0, "step": 49480 }, { "entropy": 5.380562973022461, "epoch": 3.8501069830772225, "grad_norm": 1.1171875, "learning_rate": 0.00035769194493224014, "loss": 4.8311, "mean_token_accuracy": 0.2170521527528763, "num_tokens": 85826709.0, "step": 49485 }, { "entropy": 5.396248626708984, "epoch": 3.85049601244894, "grad_norm": 1.1171875, "learning_rate": 0.00035766616837290413, "loss": 4.9298, "mean_token_accuracy": 0.20876024961471557, "num_tokens": 85835630.0, "step": 49490 }, { "entropy": 5.326535940170288, "epoch": 3.8508850418206575, "grad_norm": 1.1015625, "learning_rate": 0.0003576403905592406, "loss": 4.7735, "mean_token_accuracy": 0.21734911501407622, "num_tokens": 85845133.0, "step": 49495 }, { "entropy": 5.40862250328064, "epoch": 3.8512740711923747, "grad_norm": 1.0546875, "learning_rate": 0.00035761461149164066, "loss": 4.8787, "mean_token_accuracy": 0.2097112938761711, "num_tokens": 85854589.0, "step": 49500 }, { "entropy": 5.400992393493652, "epoch": 3.8516631005640924, "grad_norm": 1.078125, "learning_rate": 0.00035758883117049543, "loss": 4.8162, "mean_token_accuracy": 0.2167309269309044, "num_tokens": 85863037.0, "step": 49505 }, { "entropy": 5.225657987594604, "epoch": 3.85205212993581, "grad_norm": 1.2265625, "learning_rate": 0.0003575630495961962, "loss": 4.6946, "mean_token_accuracy": 0.22563563734292985, "num_tokens": 85871450.0, "step": 49510 }, { "entropy": 5.343592596054077, "epoch": 3.852441159307528, "grad_norm": 1.265625, "learning_rate": 0.00035753726676913413, "loss": 4.8916, "mean_token_accuracy": 0.21279727518558503, "num_tokens": 85879962.0, "step": 49515 }, { "entropy": 5.451533222198487, "epoch": 3.8528301886792455, "grad_norm": 1.1640625, "learning_rate": 0.00035751148268970046, "loss": 4.9377, "mean_token_accuracy": 0.21166047751903533, "num_tokens": 85888236.0, "step": 49520 }, { "entropy": 5.384769344329834, "epoch": 3.853219218050963, "grad_norm": 1.1015625, "learning_rate": 0.0003574856973582863, "loss": 4.806, "mean_token_accuracy": 0.21624423414468766, "num_tokens": 85897168.0, "step": 49525 }, { "entropy": 5.308226871490478, "epoch": 3.8536082474226805, "grad_norm": 1.28125, "learning_rate": 0.00035745991077528296, "loss": 4.7305, "mean_token_accuracy": 0.22079455256462097, "num_tokens": 85905156.0, "step": 49530 }, { "entropy": 5.283204793930054, "epoch": 3.8539972767943977, "grad_norm": 1.2109375, "learning_rate": 0.00035743412294108175, "loss": 4.7777, "mean_token_accuracy": 0.21717469394207, "num_tokens": 85913050.0, "step": 49535 }, { "entropy": 5.225965118408203, "epoch": 3.8543863061661154, "grad_norm": 1.1328125, "learning_rate": 0.0003574083338560739, "loss": 4.674, "mean_token_accuracy": 0.22293821573257447, "num_tokens": 85921983.0, "step": 49540 }, { "entropy": 5.3748854637146, "epoch": 3.854775335537833, "grad_norm": 1.1640625, "learning_rate": 0.00035738254352065074, "loss": 4.7434, "mean_token_accuracy": 0.21783807426691054, "num_tokens": 85930730.0, "step": 49545 }, { "entropy": 5.398989248275757, "epoch": 3.855164364909551, "grad_norm": 1.109375, "learning_rate": 0.00035735675193520364, "loss": 4.9014, "mean_token_accuracy": 0.20490865558385848, "num_tokens": 85939372.0, "step": 49550 }, { "entropy": 5.3850404739379885, "epoch": 3.855553394281268, "grad_norm": 1.1484375, "learning_rate": 0.0003573309591001239, "loss": 4.8434, "mean_token_accuracy": 0.21465734839439393, "num_tokens": 85947701.0, "step": 49555 }, { "entropy": 5.375218629837036, "epoch": 3.855942423652986, "grad_norm": 1.1484375, "learning_rate": 0.000357305165015803, "loss": 4.8523, "mean_token_accuracy": 0.2174821451306343, "num_tokens": 85955314.0, "step": 49560 }, { "entropy": 5.434342241287231, "epoch": 3.8563314530247035, "grad_norm": 1.046875, "learning_rate": 0.00035727936968263206, "loss": 4.8534, "mean_token_accuracy": 0.21463609039783477, "num_tokens": 85964236.0, "step": 49565 }, { "entropy": 5.354101848602295, "epoch": 3.8567204823964207, "grad_norm": 1.1484375, "learning_rate": 0.0003572535731010028, "loss": 4.7564, "mean_token_accuracy": 0.2221148893237114, "num_tokens": 85972287.0, "step": 49570 }, { "entropy": 5.295447111129761, "epoch": 3.8571095117681384, "grad_norm": 1.1328125, "learning_rate": 0.0003572277752713063, "loss": 4.8188, "mean_token_accuracy": 0.21898875385522842, "num_tokens": 85980661.0, "step": 49575 }, { "entropy": 5.339267778396606, "epoch": 3.857498541139856, "grad_norm": 1.125, "learning_rate": 0.0003572019761939343, "loss": 4.8643, "mean_token_accuracy": 0.22298433035612106, "num_tokens": 85989397.0, "step": 49580 }, { "entropy": 5.363077306747437, "epoch": 3.857887570511574, "grad_norm": 1.171875, "learning_rate": 0.00035717617586927814, "loss": 4.8266, "mean_token_accuracy": 0.21804153621196748, "num_tokens": 85997842.0, "step": 49585 }, { "entropy": 5.375947380065918, "epoch": 3.858276599883291, "grad_norm": 1.1015625, "learning_rate": 0.00035715037429772935, "loss": 4.8654, "mean_token_accuracy": 0.21511486023664475, "num_tokens": 86006878.0, "step": 49590 }, { "entropy": 5.4156862735748295, "epoch": 3.8586656292550088, "grad_norm": 1.140625, "learning_rate": 0.0003571245714796793, "loss": 4.8804, "mean_token_accuracy": 0.21092199981212617, "num_tokens": 86015443.0, "step": 49595 }, { "entropy": 5.426168489456177, "epoch": 3.8590546586267265, "grad_norm": 1.203125, "learning_rate": 0.0003570987674155197, "loss": 4.9288, "mean_token_accuracy": 0.2071852818131447, "num_tokens": 86024588.0, "step": 49600 }, { "entropy": 5.442469644546509, "epoch": 3.8594436879984437, "grad_norm": 1.2734375, "learning_rate": 0.0003570729621056419, "loss": 4.8806, "mean_token_accuracy": 0.21255477666854858, "num_tokens": 86033175.0, "step": 49605 }, { "entropy": 5.3730326175689695, "epoch": 3.8598327173701614, "grad_norm": 1.2109375, "learning_rate": 0.00035704715555043753, "loss": 4.811, "mean_token_accuracy": 0.21449954062700272, "num_tokens": 86041422.0, "step": 49610 }, { "entropy": 5.464237928390503, "epoch": 3.860221746741879, "grad_norm": 1.109375, "learning_rate": 0.00035702134775029813, "loss": 5.0295, "mean_token_accuracy": 0.19675232619047164, "num_tokens": 86050186.0, "step": 49615 }, { "entropy": 5.479752922058106, "epoch": 3.860610776113597, "grad_norm": 1.2265625, "learning_rate": 0.0003569955387056154, "loss": 4.9069, "mean_token_accuracy": 0.2154562696814537, "num_tokens": 86057809.0, "step": 49620 }, { "entropy": 5.391401052474976, "epoch": 3.860999805485314, "grad_norm": 1.125, "learning_rate": 0.00035696972841678094, "loss": 4.8645, "mean_token_accuracy": 0.21277629882097243, "num_tokens": 86066127.0, "step": 49625 }, { "entropy": 5.3678525447845455, "epoch": 3.8613888348570318, "grad_norm": 1.1640625, "learning_rate": 0.0003569439168841862, "loss": 4.8429, "mean_token_accuracy": 0.21454396098852158, "num_tokens": 86075013.0, "step": 49630 }, { "entropy": 5.410279607772827, "epoch": 3.861777864228749, "grad_norm": 1.1484375, "learning_rate": 0.00035691810410822303, "loss": 4.8188, "mean_token_accuracy": 0.21628714203834534, "num_tokens": 86083140.0, "step": 49635 }, { "entropy": 5.376409482955933, "epoch": 3.8621668936004667, "grad_norm": 1.1875, "learning_rate": 0.00035689229008928304, "loss": 4.7809, "mean_token_accuracy": 0.2223998248577118, "num_tokens": 86091882.0, "step": 49640 }, { "entropy": 5.385114049911499, "epoch": 3.8625559229721844, "grad_norm": 1.1171875, "learning_rate": 0.00035686647482775774, "loss": 4.8486, "mean_token_accuracy": 0.22324987798929213, "num_tokens": 86100588.0, "step": 49645 }, { "entropy": 5.414225912094116, "epoch": 3.862944952343902, "grad_norm": 1.21875, "learning_rate": 0.00035684065832403903, "loss": 4.875, "mean_token_accuracy": 0.21872392445802688, "num_tokens": 86108859.0, "step": 49650 }, { "entropy": 5.377131652832031, "epoch": 3.8633339817156194, "grad_norm": 1.1875, "learning_rate": 0.0003568148405785187, "loss": 4.8259, "mean_token_accuracy": 0.21533940434455873, "num_tokens": 86117978.0, "step": 49655 }, { "entropy": 5.429769992828369, "epoch": 3.863723011087337, "grad_norm": 1.078125, "learning_rate": 0.0003567890215915883, "loss": 4.8971, "mean_token_accuracy": 0.20989787578582764, "num_tokens": 86127265.0, "step": 49660 }, { "entropy": 5.428150367736817, "epoch": 3.8641120404590548, "grad_norm": 1.1171875, "learning_rate": 0.00035676320136363975, "loss": 4.8643, "mean_token_accuracy": 0.2101878419518471, "num_tokens": 86136064.0, "step": 49665 }, { "entropy": 5.495558500289917, "epoch": 3.864501069830772, "grad_norm": 1.15625, "learning_rate": 0.0003567373798950647, "loss": 4.9059, "mean_token_accuracy": 0.20507902204990386, "num_tokens": 86144550.0, "step": 49670 }, { "entropy": 5.458512496948242, "epoch": 3.8648900992024897, "grad_norm": 1.140625, "learning_rate": 0.00035671155718625504, "loss": 4.953, "mean_token_accuracy": 0.20621129721403123, "num_tokens": 86153776.0, "step": 49675 }, { "entropy": 5.439413118362427, "epoch": 3.8652791285742074, "grad_norm": 1.1875, "learning_rate": 0.0003566857332376025, "loss": 4.89, "mean_token_accuracy": 0.21585310250520706, "num_tokens": 86162903.0, "step": 49680 }, { "entropy": 5.437718629837036, "epoch": 3.865668157945925, "grad_norm": 1.265625, "learning_rate": 0.00035665990804949904, "loss": 4.9313, "mean_token_accuracy": 0.20729794651269912, "num_tokens": 86171521.0, "step": 49685 }, { "entropy": 5.370537137985229, "epoch": 3.8660571873176424, "grad_norm": 1.1953125, "learning_rate": 0.0003566340816223364, "loss": 4.86, "mean_token_accuracy": 0.21997511386871338, "num_tokens": 86180057.0, "step": 49690 }, { "entropy": 5.480142402648926, "epoch": 3.86644621668936, "grad_norm": 1.1953125, "learning_rate": 0.0003566082539565066, "loss": 4.8901, "mean_token_accuracy": 0.21017359048128129, "num_tokens": 86188497.0, "step": 49695 }, { "entropy": 5.390807676315307, "epoch": 3.8668352460610778, "grad_norm": 1.1171875, "learning_rate": 0.0003565824250524013, "loss": 4.7859, "mean_token_accuracy": 0.21848454773426057, "num_tokens": 86197454.0, "step": 49700 }, { "entropy": 5.372758960723877, "epoch": 3.867224275432795, "grad_norm": 1.046875, "learning_rate": 0.00035655659491041266, "loss": 4.8713, "mean_token_accuracy": 0.2149476021528244, "num_tokens": 86206680.0, "step": 49705 }, { "entropy": 5.381614446640015, "epoch": 3.8676133048045127, "grad_norm": 1.2265625, "learning_rate": 0.0003565307635309325, "loss": 4.8167, "mean_token_accuracy": 0.22494980543851853, "num_tokens": 86215214.0, "step": 49710 }, { "entropy": 5.396752262115479, "epoch": 3.8680023341762304, "grad_norm": 1.1328125, "learning_rate": 0.0003565049309143527, "loss": 4.8718, "mean_token_accuracy": 0.21875571757555007, "num_tokens": 86223506.0, "step": 49715 }, { "entropy": 5.380212783813477, "epoch": 3.868391363547948, "grad_norm": 1.1328125, "learning_rate": 0.00035647909706106533, "loss": 4.8311, "mean_token_accuracy": 0.21216350495815278, "num_tokens": 86231875.0, "step": 49720 }, { "entropy": 5.438787794113159, "epoch": 3.8687803929196654, "grad_norm": 1.078125, "learning_rate": 0.0003564532619714624, "loss": 4.8315, "mean_token_accuracy": 0.2131131500005722, "num_tokens": 86240920.0, "step": 49725 }, { "entropy": 5.495491170883179, "epoch": 3.869169422291383, "grad_norm": 1.1640625, "learning_rate": 0.0003564274256459358, "loss": 4.9986, "mean_token_accuracy": 0.2044559046626091, "num_tokens": 86248815.0, "step": 49730 }, { "entropy": 5.406834125518799, "epoch": 3.8695584516631003, "grad_norm": 1.2109375, "learning_rate": 0.0003564015880848777, "loss": 4.8525, "mean_token_accuracy": 0.2138305574655533, "num_tokens": 86257251.0, "step": 49735 }, { "entropy": 5.468204689025879, "epoch": 3.869947481034818, "grad_norm": 1.15625, "learning_rate": 0.00035637574928867996, "loss": 4.9404, "mean_token_accuracy": 0.2075471594929695, "num_tokens": 86266349.0, "step": 49740 }, { "entropy": 5.41004490852356, "epoch": 3.8703365104065357, "grad_norm": 1.1875, "learning_rate": 0.00035634990925773475, "loss": 4.8743, "mean_token_accuracy": 0.2104436159133911, "num_tokens": 86274417.0, "step": 49745 }, { "entropy": 5.3878051280975345, "epoch": 3.8707255397782534, "grad_norm": 1.1015625, "learning_rate": 0.0003563240679924342, "loss": 4.8831, "mean_token_accuracy": 0.2164582446217537, "num_tokens": 86283637.0, "step": 49750 }, { "entropy": 5.329652547836304, "epoch": 3.871114569149971, "grad_norm": 1.140625, "learning_rate": 0.0003562982254931704, "loss": 4.8158, "mean_token_accuracy": 0.21619013398885728, "num_tokens": 86292544.0, "step": 49755 }, { "entropy": 5.369157838821411, "epoch": 3.8715035985216883, "grad_norm": 1.140625, "learning_rate": 0.0003562723817603354, "loss": 4.8342, "mean_token_accuracy": 0.21063119769096375, "num_tokens": 86301654.0, "step": 49760 }, { "entropy": 5.42558741569519, "epoch": 3.871892627893406, "grad_norm": 1.1953125, "learning_rate": 0.00035624653679432135, "loss": 4.8344, "mean_token_accuracy": 0.21468476206064224, "num_tokens": 86310158.0, "step": 49765 }, { "entropy": 5.424980926513672, "epoch": 3.8722816572651233, "grad_norm": 1.15625, "learning_rate": 0.00035622069059552036, "loss": 4.8572, "mean_token_accuracy": 0.22494109869003295, "num_tokens": 86318233.0, "step": 49770 }, { "entropy": 5.3506293296813965, "epoch": 3.872670686636841, "grad_norm": 1.0859375, "learning_rate": 0.0003561948431643247, "loss": 4.8921, "mean_token_accuracy": 0.21584369391202926, "num_tokens": 86327538.0, "step": 49775 }, { "entropy": 5.43976936340332, "epoch": 3.8730597160085587, "grad_norm": 1.140625, "learning_rate": 0.00035616899450112655, "loss": 4.8766, "mean_token_accuracy": 0.21599012911319732, "num_tokens": 86336351.0, "step": 49780 }, { "entropy": 5.435955476760864, "epoch": 3.8734487453802764, "grad_norm": 1.1640625, "learning_rate": 0.00035614314460631814, "loss": 4.8214, "mean_token_accuracy": 0.21309615671634674, "num_tokens": 86344591.0, "step": 49785 }, { "entropy": 5.337998294830323, "epoch": 3.8738377747519936, "grad_norm": 1.0703125, "learning_rate": 0.0003561172934802917, "loss": 4.8595, "mean_token_accuracy": 0.2178523898124695, "num_tokens": 86354155.0, "step": 49790 }, { "entropy": 5.335957479476929, "epoch": 3.8742268041237113, "grad_norm": 1.171875, "learning_rate": 0.0003560914411234393, "loss": 4.838, "mean_token_accuracy": 0.21353577673435212, "num_tokens": 86363510.0, "step": 49795 }, { "entropy": 5.392968320846558, "epoch": 3.874615833495429, "grad_norm": 1.1015625, "learning_rate": 0.0003560655875361535, "loss": 4.774, "mean_token_accuracy": 0.22466313242912292, "num_tokens": 86372226.0, "step": 49800 }, { "entropy": 5.364480352401733, "epoch": 3.8750048628671463, "grad_norm": 1.25, "learning_rate": 0.0003560397327188263, "loss": 4.8801, "mean_token_accuracy": 0.20917447060346603, "num_tokens": 86380286.0, "step": 49805 }, { "entropy": 5.378635358810425, "epoch": 3.875393892238864, "grad_norm": 1.1328125, "learning_rate": 0.0003560138766718502, "loss": 4.8864, "mean_token_accuracy": 0.21298673003911972, "num_tokens": 86388566.0, "step": 49810 }, { "entropy": 5.425533771514893, "epoch": 3.8757829216105817, "grad_norm": 1.1796875, "learning_rate": 0.00035598801939561755, "loss": 4.7879, "mean_token_accuracy": 0.22374901920557022, "num_tokens": 86397151.0, "step": 49815 }, { "entropy": 5.374747610092163, "epoch": 3.8761719509822994, "grad_norm": 1.1953125, "learning_rate": 0.00035596216089052045, "loss": 4.901, "mean_token_accuracy": 0.20932171642780303, "num_tokens": 86405530.0, "step": 49820 }, { "entropy": 5.3583649635314945, "epoch": 3.8765609803540166, "grad_norm": 1.171875, "learning_rate": 0.00035593630115695154, "loss": 4.7559, "mean_token_accuracy": 0.21755784004926682, "num_tokens": 86414292.0, "step": 49825 }, { "entropy": 5.431084680557251, "epoch": 3.8769500097257343, "grad_norm": 1.1484375, "learning_rate": 0.0003559104401953031, "loss": 4.832, "mean_token_accuracy": 0.22004285901784898, "num_tokens": 86422656.0, "step": 49830 }, { "entropy": 5.4137303829193115, "epoch": 3.8773390390974516, "grad_norm": 1.171875, "learning_rate": 0.00035588457800596747, "loss": 4.9335, "mean_token_accuracy": 0.20738827288150788, "num_tokens": 86430783.0, "step": 49835 }, { "entropy": 5.35724983215332, "epoch": 3.8777280684691693, "grad_norm": 1.1171875, "learning_rate": 0.0003558587145893371, "loss": 4.7731, "mean_token_accuracy": 0.22251655012369156, "num_tokens": 86439137.0, "step": 49840 }, { "entropy": 5.359764957427979, "epoch": 3.878117097840887, "grad_norm": 1.1640625, "learning_rate": 0.0003558328499458044, "loss": 4.8205, "mean_token_accuracy": 0.22498827129602433, "num_tokens": 86447225.0, "step": 49845 }, { "entropy": 5.348977708816529, "epoch": 3.8785061272126047, "grad_norm": 1.09375, "learning_rate": 0.0003558069840757619, "loss": 4.8664, "mean_token_accuracy": 0.2158392623066902, "num_tokens": 86456095.0, "step": 49850 }, { "entropy": 5.409688806533813, "epoch": 3.8788951565843224, "grad_norm": 1.1015625, "learning_rate": 0.000355781116979602, "loss": 4.9126, "mean_token_accuracy": 0.2062249720096588, "num_tokens": 86464993.0, "step": 49855 }, { "entropy": 5.3507880687713625, "epoch": 3.8792841859560396, "grad_norm": 1.125, "learning_rate": 0.0003557552486577173, "loss": 4.7713, "mean_token_accuracy": 0.21847150921821595, "num_tokens": 86474269.0, "step": 49860 }, { "entropy": 5.514620399475097, "epoch": 3.8796732153277573, "grad_norm": 1.3046875, "learning_rate": 0.0003557293791105002, "loss": 4.9514, "mean_token_accuracy": 0.21215716302394866, "num_tokens": 86482523.0, "step": 49865 }, { "entropy": 5.338932514190674, "epoch": 3.8800622446994746, "grad_norm": 1.1640625, "learning_rate": 0.00035570350833834334, "loss": 4.8221, "mean_token_accuracy": 0.22817907929420472, "num_tokens": 86491091.0, "step": 49870 }, { "entropy": 5.4831572532653805, "epoch": 3.8804512740711923, "grad_norm": 1.09375, "learning_rate": 0.00035567763634163904, "loss": 4.9798, "mean_token_accuracy": 0.20209675431251525, "num_tokens": 86500069.0, "step": 49875 }, { "entropy": 5.4740653991699215, "epoch": 3.88084030344291, "grad_norm": 1.140625, "learning_rate": 0.0003556517631207802, "loss": 4.9376, "mean_token_accuracy": 0.21789976954460144, "num_tokens": 86508499.0, "step": 49880 }, { "entropy": 5.395103406906128, "epoch": 3.8812293328146277, "grad_norm": 1.0625, "learning_rate": 0.00035562588867615907, "loss": 4.91, "mean_token_accuracy": 0.20759719163179396, "num_tokens": 86517036.0, "step": 49885 }, { "entropy": 5.43130087852478, "epoch": 3.881618362186345, "grad_norm": 1.1875, "learning_rate": 0.00035560001300816846, "loss": 4.9017, "mean_token_accuracy": 0.21313188523054122, "num_tokens": 86525764.0, "step": 49890 }, { "entropy": 5.406771087646485, "epoch": 3.8820073915580626, "grad_norm": 1.140625, "learning_rate": 0.00035557413611720095, "loss": 4.8244, "mean_token_accuracy": 0.22007715106010436, "num_tokens": 86534858.0, "step": 49895 }, { "entropy": 5.330812788009643, "epoch": 3.8823964209297803, "grad_norm": 1.21875, "learning_rate": 0.00035554825800364917, "loss": 4.7761, "mean_token_accuracy": 0.22074450999498368, "num_tokens": 86543509.0, "step": 49900 }, { "entropy": 5.362614440917969, "epoch": 3.8827854503014976, "grad_norm": 1.1015625, "learning_rate": 0.0003555223786679058, "loss": 4.8269, "mean_token_accuracy": 0.22002876847982406, "num_tokens": 86552278.0, "step": 49905 }, { "entropy": 5.387450122833252, "epoch": 3.8831744796732153, "grad_norm": 1.046875, "learning_rate": 0.00035549649811036346, "loss": 4.8301, "mean_token_accuracy": 0.21801259219646454, "num_tokens": 86560684.0, "step": 49910 }, { "entropy": 5.496552515029907, "epoch": 3.883563509044933, "grad_norm": 1.2265625, "learning_rate": 0.00035547061633141487, "loss": 4.9193, "mean_token_accuracy": 0.20778851360082626, "num_tokens": 86569015.0, "step": 49915 }, { "entropy": 5.353770112991333, "epoch": 3.8839525384166507, "grad_norm": 1.125, "learning_rate": 0.00035544473333145275, "loss": 4.8539, "mean_token_accuracy": 0.21856000125408173, "num_tokens": 86578544.0, "step": 49920 }, { "entropy": 5.311742973327637, "epoch": 3.884341567788368, "grad_norm": 1.171875, "learning_rate": 0.0003554188491108699, "loss": 4.8162, "mean_token_accuracy": 0.20862941294908524, "num_tokens": 86587176.0, "step": 49925 }, { "entropy": 5.394986724853515, "epoch": 3.8847305971600856, "grad_norm": 1.1796875, "learning_rate": 0.000355392963670059, "loss": 4.8289, "mean_token_accuracy": 0.21128001511096955, "num_tokens": 86595472.0, "step": 49930 }, { "entropy": 5.427108240127564, "epoch": 3.8851196265318033, "grad_norm": 1.1484375, "learning_rate": 0.0003553670770094129, "loss": 4.843, "mean_token_accuracy": 0.21036445796489717, "num_tokens": 86603958.0, "step": 49935 }, { "entropy": 5.466770029067993, "epoch": 3.8855086559035206, "grad_norm": 1.1953125, "learning_rate": 0.00035534118912932425, "loss": 4.9558, "mean_token_accuracy": 0.2056156128644943, "num_tokens": 86613128.0, "step": 49940 }, { "entropy": 5.4814760208129885, "epoch": 3.8858976852752383, "grad_norm": 1.0234375, "learning_rate": 0.00035531530003018584, "loss": 4.8389, "mean_token_accuracy": 0.21914105266332626, "num_tokens": 86621790.0, "step": 49945 }, { "entropy": 5.364697074890136, "epoch": 3.886286714646956, "grad_norm": 1.0859375, "learning_rate": 0.0003552894097123907, "loss": 4.8606, "mean_token_accuracy": 0.21530188024044036, "num_tokens": 86630774.0, "step": 49950 }, { "entropy": 5.37090482711792, "epoch": 3.8866757440186737, "grad_norm": 1.1953125, "learning_rate": 0.00035526351817633157, "loss": 4.8602, "mean_token_accuracy": 0.21424614042043685, "num_tokens": 86639372.0, "step": 49955 }, { "entropy": 5.383608150482178, "epoch": 3.887064773390391, "grad_norm": 1.109375, "learning_rate": 0.0003552376254224013, "loss": 4.8043, "mean_token_accuracy": 0.21705559343099595, "num_tokens": 86648114.0, "step": 49960 }, { "entropy": 5.378827476501465, "epoch": 3.8874538027621086, "grad_norm": 1.1484375, "learning_rate": 0.0003552117314509928, "loss": 4.8895, "mean_token_accuracy": 0.21185476183891297, "num_tokens": 86656823.0, "step": 49965 }, { "entropy": 5.310986471176148, "epoch": 3.887842832133826, "grad_norm": 1.1171875, "learning_rate": 0.0003551858362624989, "loss": 4.7835, "mean_token_accuracy": 0.22240580171346663, "num_tokens": 86664899.0, "step": 49970 }, { "entropy": 5.393229675292969, "epoch": 3.8882318615055436, "grad_norm": 1.1328125, "learning_rate": 0.0003551599398573125, "loss": 4.8125, "mean_token_accuracy": 0.2182297185063362, "num_tokens": 86673520.0, "step": 49975 }, { "entropy": 5.336479663848877, "epoch": 3.8886208908772613, "grad_norm": 1.1171875, "learning_rate": 0.00035513404223582666, "loss": 4.7969, "mean_token_accuracy": 0.21849294751882553, "num_tokens": 86682068.0, "step": 49980 }, { "entropy": 5.314722347259521, "epoch": 3.889009920248979, "grad_norm": 1.1796875, "learning_rate": 0.00035510814339843427, "loss": 4.8321, "mean_token_accuracy": 0.20771203190088272, "num_tokens": 86690569.0, "step": 49985 }, { "entropy": 5.413291501998901, "epoch": 3.889398949620696, "grad_norm": 1.109375, "learning_rate": 0.00035508224334552835, "loss": 4.847, "mean_token_accuracy": 0.21426754742860793, "num_tokens": 86699243.0, "step": 49990 }, { "entropy": 5.329246997833252, "epoch": 3.889787978992414, "grad_norm": 1.1171875, "learning_rate": 0.0003550563420775018, "loss": 4.7639, "mean_token_accuracy": 0.21970055848360062, "num_tokens": 86707920.0, "step": 49995 }, { "entropy": 5.348993492126465, "epoch": 3.8901770083641316, "grad_norm": 1.078125, "learning_rate": 0.00035503043959474775, "loss": 4.8013, "mean_token_accuracy": 0.220321723818779, "num_tokens": 86716793.0, "step": 50000 }, { "entropy": 5.385060739517212, "epoch": 3.890566037735849, "grad_norm": 1.109375, "learning_rate": 0.00035500453589765906, "loss": 4.8675, "mean_token_accuracy": 0.21564192324876785, "num_tokens": 86725594.0, "step": 50005 }, { "entropy": 5.306797695159912, "epoch": 3.8909550671075666, "grad_norm": 1.109375, "learning_rate": 0.00035497863098662893, "loss": 4.7659, "mean_token_accuracy": 0.22446653246879578, "num_tokens": 86734637.0, "step": 50010 }, { "entropy": 5.373083543777466, "epoch": 3.8913440964792843, "grad_norm": 1.2109375, "learning_rate": 0.00035495272486205033, "loss": 4.8023, "mean_token_accuracy": 0.2130637064576149, "num_tokens": 86743159.0, "step": 50015 }, { "entropy": 5.365118217468262, "epoch": 3.891733125851002, "grad_norm": 1.125, "learning_rate": 0.0003549268175243165, "loss": 4.7994, "mean_token_accuracy": 0.22018594890832902, "num_tokens": 86751345.0, "step": 50020 }, { "entropy": 5.384858179092407, "epoch": 3.892122155222719, "grad_norm": 1.078125, "learning_rate": 0.0003549009089738204, "loss": 4.9259, "mean_token_accuracy": 0.21618716716766356, "num_tokens": 86760692.0, "step": 50025 }, { "entropy": 5.413939952850342, "epoch": 3.892511184594437, "grad_norm": 1.0859375, "learning_rate": 0.0003548749992109551, "loss": 4.8418, "mean_token_accuracy": 0.21532336473464966, "num_tokens": 86769560.0, "step": 50030 }, { "entropy": 5.478565311431884, "epoch": 3.8929002139661546, "grad_norm": 1.140625, "learning_rate": 0.0003548490882361139, "loss": 4.9198, "mean_token_accuracy": 0.2093125730752945, "num_tokens": 86778223.0, "step": 50035 }, { "entropy": 5.33926362991333, "epoch": 3.893289243337872, "grad_norm": 1.125, "learning_rate": 0.0003548231760496898, "loss": 4.7762, "mean_token_accuracy": 0.22014688402414323, "num_tokens": 86786976.0, "step": 50040 }, { "entropy": 5.398734426498413, "epoch": 3.8936782727095895, "grad_norm": 1.15625, "learning_rate": 0.00035479726265207604, "loss": 4.9146, "mean_token_accuracy": 0.21150938272476197, "num_tokens": 86795528.0, "step": 50045 }, { "entropy": 5.436475324630737, "epoch": 3.8940673020813072, "grad_norm": 1.1328125, "learning_rate": 0.0003547713480436659, "loss": 4.908, "mean_token_accuracy": 0.20612601488828658, "num_tokens": 86804160.0, "step": 50050 }, { "entropy": 5.452000761032105, "epoch": 3.894456331453025, "grad_norm": 1.1796875, "learning_rate": 0.00035474543222485254, "loss": 4.8701, "mean_token_accuracy": 0.21208083033561706, "num_tokens": 86812224.0, "step": 50055 }, { "entropy": 5.337144184112549, "epoch": 3.894845360824742, "grad_norm": 1.1015625, "learning_rate": 0.00035471951519602926, "loss": 4.7987, "mean_token_accuracy": 0.21609776467084885, "num_tokens": 86821649.0, "step": 50060 }, { "entropy": 5.410448455810547, "epoch": 3.89523439019646, "grad_norm": 1.125, "learning_rate": 0.00035469359695758905, "loss": 4.8561, "mean_token_accuracy": 0.2155676931142807, "num_tokens": 86830642.0, "step": 50065 }, { "entropy": 5.353119802474976, "epoch": 3.895623419568177, "grad_norm": 1.1484375, "learning_rate": 0.0003546676775099254, "loss": 4.7695, "mean_token_accuracy": 0.2249339923262596, "num_tokens": 86839306.0, "step": 50070 }, { "entropy": 5.316918659210205, "epoch": 3.896012448939895, "grad_norm": 1.1015625, "learning_rate": 0.0003546417568534315, "loss": 4.7637, "mean_token_accuracy": 0.21667125076055527, "num_tokens": 86847389.0, "step": 50075 }, { "entropy": 5.27915678024292, "epoch": 3.8964014783116125, "grad_norm": 1.046875, "learning_rate": 0.00035461583498850083, "loss": 4.7949, "mean_token_accuracy": 0.21421377658843993, "num_tokens": 86857160.0, "step": 50080 }, { "entropy": 5.491142702102661, "epoch": 3.8967905076833302, "grad_norm": 1.25, "learning_rate": 0.0003545899119155265, "loss": 4.9521, "mean_token_accuracy": 0.2104384794831276, "num_tokens": 86865236.0, "step": 50085 }, { "entropy": 5.4923743724823, "epoch": 3.8971795370550475, "grad_norm": 1.125, "learning_rate": 0.00035456398763490193, "loss": 4.9075, "mean_token_accuracy": 0.20678262263536454, "num_tokens": 86873623.0, "step": 50090 }, { "entropy": 5.32187557220459, "epoch": 3.897568566426765, "grad_norm": 1.1171875, "learning_rate": 0.0003545380621470205, "loss": 4.7763, "mean_token_accuracy": 0.22341914623975753, "num_tokens": 86883075.0, "step": 50095 }, { "entropy": 5.388635873794556, "epoch": 3.897957595798483, "grad_norm": 1.09375, "learning_rate": 0.0003545121354522756, "loss": 4.9122, "mean_token_accuracy": 0.20871062725782394, "num_tokens": 86892247.0, "step": 50100 }, { "entropy": 5.407228803634643, "epoch": 3.8983466251702, "grad_norm": 1.265625, "learning_rate": 0.00035448620755106064, "loss": 4.8563, "mean_token_accuracy": 0.21403463035821915, "num_tokens": 86901795.0, "step": 50105 }, { "entropy": 5.368407440185547, "epoch": 3.898735654541918, "grad_norm": 1.1796875, "learning_rate": 0.0003544602784437689, "loss": 4.8201, "mean_token_accuracy": 0.21264290809631348, "num_tokens": 86910720.0, "step": 50110 }, { "entropy": 5.3248663425445555, "epoch": 3.8991246839136355, "grad_norm": 1.109375, "learning_rate": 0.00035443434813079393, "loss": 4.8307, "mean_token_accuracy": 0.21907418966293335, "num_tokens": 86919350.0, "step": 50115 }, { "entropy": 5.405660581588745, "epoch": 3.8995137132853532, "grad_norm": 1.1875, "learning_rate": 0.0003544084166125292, "loss": 4.8782, "mean_token_accuracy": 0.21362458765506745, "num_tokens": 86927612.0, "step": 50120 }, { "entropy": 5.410800552368164, "epoch": 3.8999027426570705, "grad_norm": 1.265625, "learning_rate": 0.0003543824838893682, "loss": 4.8382, "mean_token_accuracy": 0.21727649122476578, "num_tokens": 86936416.0, "step": 50125 }, { "entropy": 5.385420131683349, "epoch": 3.900291772028788, "grad_norm": 1.21875, "learning_rate": 0.00035435654996170417, "loss": 4.9067, "mean_token_accuracy": 0.20990137457847596, "num_tokens": 86945764.0, "step": 50130 }, { "entropy": 5.386343193054199, "epoch": 3.900680801400506, "grad_norm": 1.125, "learning_rate": 0.000354330614829931, "loss": 4.8428, "mean_token_accuracy": 0.21837088018655776, "num_tokens": 86953952.0, "step": 50135 }, { "entropy": 5.451874160766602, "epoch": 3.901069830772223, "grad_norm": 1.3359375, "learning_rate": 0.0003543046784944419, "loss": 4.8234, "mean_token_accuracy": 0.21493812501430512, "num_tokens": 86962295.0, "step": 50140 }, { "entropy": 5.499092388153076, "epoch": 3.901458860143941, "grad_norm": 1.4140625, "learning_rate": 0.00035427874095563054, "loss": 4.9488, "mean_token_accuracy": 0.21205949783325195, "num_tokens": 86970361.0, "step": 50145 }, { "entropy": 5.358064937591553, "epoch": 3.9018478895156585, "grad_norm": 1.125, "learning_rate": 0.0003542528022138905, "loss": 4.7548, "mean_token_accuracy": 0.21842140108346939, "num_tokens": 86979131.0, "step": 50150 }, { "entropy": 5.293951845169067, "epoch": 3.9022369188873762, "grad_norm": 1.0625, "learning_rate": 0.0003542268622696153, "loss": 4.8004, "mean_token_accuracy": 0.21640967279672624, "num_tokens": 86988088.0, "step": 50155 }, { "entropy": 5.490346097946167, "epoch": 3.9026259482590935, "grad_norm": 1.1875, "learning_rate": 0.0003542009211231986, "loss": 4.9426, "mean_token_accuracy": 0.20485568046569824, "num_tokens": 86996792.0, "step": 50160 }, { "entropy": 5.436500406265258, "epoch": 3.903014977630811, "grad_norm": 1.109375, "learning_rate": 0.00035417497877503396, "loss": 4.8969, "mean_token_accuracy": 0.21138523072004317, "num_tokens": 87005547.0, "step": 50165 }, { "entropy": 5.4955888271331785, "epoch": 3.9034040070025284, "grad_norm": 1.09375, "learning_rate": 0.00035414903522551505, "loss": 5.0202, "mean_token_accuracy": 0.2018817499279976, "num_tokens": 87014923.0, "step": 50170 }, { "entropy": 5.402669048309326, "epoch": 3.903793036374246, "grad_norm": 1.0703125, "learning_rate": 0.00035412309047503553, "loss": 4.8752, "mean_token_accuracy": 0.21724965870380403, "num_tokens": 87023842.0, "step": 50175 }, { "entropy": 5.467564487457276, "epoch": 3.904182065745964, "grad_norm": 1.15625, "learning_rate": 0.000354097144523989, "loss": 4.8701, "mean_token_accuracy": 0.21566506326198578, "num_tokens": 87032251.0, "step": 50180 }, { "entropy": 5.4003565311431885, "epoch": 3.9045710951176815, "grad_norm": 1.1875, "learning_rate": 0.0003540711973727693, "loss": 4.9059, "mean_token_accuracy": 0.20854803621768953, "num_tokens": 87041052.0, "step": 50185 }, { "entropy": 5.409228229522705, "epoch": 3.904960124489399, "grad_norm": 1.1640625, "learning_rate": 0.0003540452490217699, "loss": 4.8707, "mean_token_accuracy": 0.2156693994998932, "num_tokens": 87049908.0, "step": 50190 }, { "entropy": 5.407024812698364, "epoch": 3.9053491538611165, "grad_norm": 1.0390625, "learning_rate": 0.0003540192994713847, "loss": 4.8452, "mean_token_accuracy": 0.2093372568488121, "num_tokens": 87059458.0, "step": 50195 }, { "entropy": 5.462924337387085, "epoch": 3.905738183232834, "grad_norm": 1.1796875, "learning_rate": 0.00035399334872200747, "loss": 4.9253, "mean_token_accuracy": 0.20550031810998917, "num_tokens": 87067856.0, "step": 50200 }, { "entropy": 5.474410343170166, "epoch": 3.9061272126045514, "grad_norm": 1.25, "learning_rate": 0.0003539673967740318, "loss": 4.9476, "mean_token_accuracy": 0.21095436960458755, "num_tokens": 87076427.0, "step": 50205 }, { "entropy": 5.395767641067505, "epoch": 3.906516241976269, "grad_norm": 1.1328125, "learning_rate": 0.0003539414436278516, "loss": 4.8465, "mean_token_accuracy": 0.211288383603096, "num_tokens": 87084576.0, "step": 50210 }, { "entropy": 5.425954723358155, "epoch": 3.906905271347987, "grad_norm": 1.15625, "learning_rate": 0.00035391548928386077, "loss": 4.9243, "mean_token_accuracy": 0.21403887569904329, "num_tokens": 87092788.0, "step": 50215 }, { "entropy": 5.3314220905303955, "epoch": 3.9072943007197045, "grad_norm": 1.1875, "learning_rate": 0.0003538895337424529, "loss": 4.7132, "mean_token_accuracy": 0.2256551504135132, "num_tokens": 87101780.0, "step": 50220 }, { "entropy": 5.4562421321868895, "epoch": 3.9076833300914218, "grad_norm": 1.1484375, "learning_rate": 0.00035386357700402187, "loss": 4.9371, "mean_token_accuracy": 0.2142144039273262, "num_tokens": 87111234.0, "step": 50225 }, { "entropy": 5.338387966156006, "epoch": 3.9080723594631395, "grad_norm": 1.1328125, "learning_rate": 0.0003538376190689616, "loss": 4.7551, "mean_token_accuracy": 0.2238451972603798, "num_tokens": 87119488.0, "step": 50230 }, { "entropy": 5.433273983001709, "epoch": 3.908461388834857, "grad_norm": 1.2265625, "learning_rate": 0.0003538116599376661, "loss": 4.976, "mean_token_accuracy": 0.20233719497919084, "num_tokens": 87129479.0, "step": 50235 }, { "entropy": 5.407299757003784, "epoch": 3.9088504182065744, "grad_norm": 1.3046875, "learning_rate": 0.00035378569961052887, "loss": 4.7957, "mean_token_accuracy": 0.215228670835495, "num_tokens": 87137711.0, "step": 50240 }, { "entropy": 5.389112377166748, "epoch": 3.909239447578292, "grad_norm": 1.125, "learning_rate": 0.00035375973808794416, "loss": 4.8198, "mean_token_accuracy": 0.21694521903991698, "num_tokens": 87145858.0, "step": 50245 }, { "entropy": 5.316772031784057, "epoch": 3.90962847695001, "grad_norm": 1.0859375, "learning_rate": 0.0003537337753703058, "loss": 4.7949, "mean_token_accuracy": 0.22099514603614806, "num_tokens": 87154200.0, "step": 50250 }, { "entropy": 5.416736078262329, "epoch": 3.9100175063217275, "grad_norm": 1.1171875, "learning_rate": 0.0003537078114580077, "loss": 4.922, "mean_token_accuracy": 0.20738909542560577, "num_tokens": 87163329.0, "step": 50255 }, { "entropy": 5.468604612350464, "epoch": 3.9104065356934448, "grad_norm": 1.1875, "learning_rate": 0.0003536818463514438, "loss": 4.8745, "mean_token_accuracy": 0.21667521446943283, "num_tokens": 87172459.0, "step": 50260 }, { "entropy": 5.432321214675904, "epoch": 3.9107955650651625, "grad_norm": 1.125, "learning_rate": 0.00035365588005100817, "loss": 4.8727, "mean_token_accuracy": 0.21274207830429076, "num_tokens": 87181155.0, "step": 50265 }, { "entropy": 5.360682439804077, "epoch": 3.9111845944368797, "grad_norm": 1.1953125, "learning_rate": 0.0003536299125570947, "loss": 4.8461, "mean_token_accuracy": 0.2174878776073456, "num_tokens": 87190191.0, "step": 50270 }, { "entropy": 5.444006156921387, "epoch": 3.9115736238085974, "grad_norm": 1.3515625, "learning_rate": 0.0003536039438700975, "loss": 4.889, "mean_token_accuracy": 0.214572736620903, "num_tokens": 87199023.0, "step": 50275 }, { "entropy": 5.4204004287719725, "epoch": 3.911962653180315, "grad_norm": 1.234375, "learning_rate": 0.00035357797399041056, "loss": 4.9364, "mean_token_accuracy": 0.20699241161346435, "num_tokens": 87207694.0, "step": 50280 }, { "entropy": 5.394293880462646, "epoch": 3.912351682552033, "grad_norm": 1.1171875, "learning_rate": 0.0003535520029184279, "loss": 4.8517, "mean_token_accuracy": 0.21236144751310349, "num_tokens": 87216019.0, "step": 50285 }, { "entropy": 5.4463968753814695, "epoch": 3.9127407119237505, "grad_norm": 1.2109375, "learning_rate": 0.0003535260306545437, "loss": 4.8462, "mean_token_accuracy": 0.212478905916214, "num_tokens": 87224737.0, "step": 50290 }, { "entropy": 5.455323696136475, "epoch": 3.9131297412954678, "grad_norm": 1.078125, "learning_rate": 0.00035350005719915196, "loss": 4.8895, "mean_token_accuracy": 0.2139474242925644, "num_tokens": 87233797.0, "step": 50295 }, { "entropy": 5.359736061096191, "epoch": 3.9135187706671855, "grad_norm": 1.171875, "learning_rate": 0.00035347408255264674, "loss": 4.7508, "mean_token_accuracy": 0.2244486153125763, "num_tokens": 87242767.0, "step": 50300 }, { "entropy": 5.3581804752349855, "epoch": 3.9139078000389027, "grad_norm": 1.1171875, "learning_rate": 0.0003534481067154223, "loss": 4.8102, "mean_token_accuracy": 0.2247103199362755, "num_tokens": 87251684.0, "step": 50305 }, { "entropy": 5.437606859207153, "epoch": 3.9142968294106204, "grad_norm": 1.140625, "learning_rate": 0.0003534221296878726, "loss": 4.9182, "mean_token_accuracy": 0.2135276824235916, "num_tokens": 87260730.0, "step": 50310 }, { "entropy": 5.41645245552063, "epoch": 3.914685858782338, "grad_norm": 1.109375, "learning_rate": 0.00035339615147039196, "loss": 4.8792, "mean_token_accuracy": 0.2062883198261261, "num_tokens": 87270241.0, "step": 50315 }, { "entropy": 5.366668319702148, "epoch": 3.915074888154056, "grad_norm": 1.1484375, "learning_rate": 0.00035337017206337444, "loss": 4.8061, "mean_token_accuracy": 0.21917391270399095, "num_tokens": 87279463.0, "step": 50320 }, { "entropy": 5.418638610839844, "epoch": 3.915463917525773, "grad_norm": 1.1953125, "learning_rate": 0.0003533441914672144, "loss": 4.8483, "mean_token_accuracy": 0.20943626910448074, "num_tokens": 87287887.0, "step": 50325 }, { "entropy": 5.458248090744019, "epoch": 3.9158529468974907, "grad_norm": 1.140625, "learning_rate": 0.00035331820968230595, "loss": 4.8679, "mean_token_accuracy": 0.2148660510778427, "num_tokens": 87296832.0, "step": 50330 }, { "entropy": 5.506937456130982, "epoch": 3.9162419762692084, "grad_norm": 1.1875, "learning_rate": 0.00035329222670904325, "loss": 4.9774, "mean_token_accuracy": 0.20019400417804717, "num_tokens": 87304867.0, "step": 50335 }, { "entropy": 5.415652465820313, "epoch": 3.9166310056409257, "grad_norm": 1.0859375, "learning_rate": 0.0003532662425478206, "loss": 4.9068, "mean_token_accuracy": 0.21732494086027146, "num_tokens": 87313541.0, "step": 50340 }, { "entropy": 5.396382999420166, "epoch": 3.9170200350126434, "grad_norm": 1.09375, "learning_rate": 0.00035324025719903236, "loss": 4.9029, "mean_token_accuracy": 0.21252136379480363, "num_tokens": 87322462.0, "step": 50345 }, { "entropy": 5.385149621963501, "epoch": 3.917409064384361, "grad_norm": 1.1484375, "learning_rate": 0.00035321427066307276, "loss": 4.8617, "mean_token_accuracy": 0.21457833051681519, "num_tokens": 87331519.0, "step": 50350 }, { "entropy": 5.468873500823975, "epoch": 3.917798093756079, "grad_norm": 1.15625, "learning_rate": 0.0003531882829403361, "loss": 4.9295, "mean_token_accuracy": 0.20591126680374144, "num_tokens": 87340380.0, "step": 50355 }, { "entropy": 5.426613664627075, "epoch": 3.918187123127796, "grad_norm": 1.1796875, "learning_rate": 0.00035316229403121666, "loss": 4.8379, "mean_token_accuracy": 0.2114797681570053, "num_tokens": 87348022.0, "step": 50360 }, { "entropy": 5.329485321044922, "epoch": 3.9185761524995137, "grad_norm": 1.171875, "learning_rate": 0.0003531363039361088, "loss": 4.7713, "mean_token_accuracy": 0.21548608988523482, "num_tokens": 87357080.0, "step": 50365 }, { "entropy": 5.359896516799926, "epoch": 3.9189651818712314, "grad_norm": 1.125, "learning_rate": 0.00035311031265540695, "loss": 4.8321, "mean_token_accuracy": 0.21243430823087692, "num_tokens": 87365576.0, "step": 50370 }, { "entropy": 5.424797439575196, "epoch": 3.9193542112429487, "grad_norm": 1.171875, "learning_rate": 0.00035308432018950537, "loss": 4.9418, "mean_token_accuracy": 0.21028377562761308, "num_tokens": 87375149.0, "step": 50375 }, { "entropy": 5.405410671234131, "epoch": 3.9197432406146664, "grad_norm": 1.1328125, "learning_rate": 0.00035305832653879856, "loss": 4.8199, "mean_token_accuracy": 0.22140689492225646, "num_tokens": 87384299.0, "step": 50380 }, { "entropy": 5.367635917663574, "epoch": 3.920132269986384, "grad_norm": 1.125, "learning_rate": 0.00035303233170368083, "loss": 4.8212, "mean_token_accuracy": 0.21972196847200393, "num_tokens": 87392836.0, "step": 50385 }, { "entropy": 5.4342375755310055, "epoch": 3.920521299358102, "grad_norm": 1.1015625, "learning_rate": 0.00035300633568454673, "loss": 4.8996, "mean_token_accuracy": 0.2113592192530632, "num_tokens": 87401798.0, "step": 50390 }, { "entropy": 5.378832769393921, "epoch": 3.920910328729819, "grad_norm": 1.1328125, "learning_rate": 0.00035298033848179064, "loss": 4.7707, "mean_token_accuracy": 0.22155203223228453, "num_tokens": 87410487.0, "step": 50395 }, { "entropy": 5.472595691680908, "epoch": 3.9212993581015367, "grad_norm": 1.1015625, "learning_rate": 0.000352954340095807, "loss": 5.0425, "mean_token_accuracy": 0.20302307456731797, "num_tokens": 87419664.0, "step": 50400 }, { "entropy": 5.471971940994263, "epoch": 3.921688387473254, "grad_norm": 1.15625, "learning_rate": 0.00035292834052699036, "loss": 4.8879, "mean_token_accuracy": 0.21246059536933898, "num_tokens": 87428073.0, "step": 50405 }, { "entropy": 5.4853757381439205, "epoch": 3.9220774168449717, "grad_norm": 1.2109375, "learning_rate": 0.0003529023397757351, "loss": 4.9033, "mean_token_accuracy": 0.2101770117878914, "num_tokens": 87436250.0, "step": 50410 }, { "entropy": 5.358656597137451, "epoch": 3.9224664462166894, "grad_norm": 1.1953125, "learning_rate": 0.00035287633784243595, "loss": 4.769, "mean_token_accuracy": 0.21716036945581435, "num_tokens": 87445131.0, "step": 50415 }, { "entropy": 5.336965322494507, "epoch": 3.922855475588407, "grad_norm": 1.09375, "learning_rate": 0.00035285033472748725, "loss": 4.8593, "mean_token_accuracy": 0.2167794182896614, "num_tokens": 87454428.0, "step": 50420 }, { "entropy": 5.4946959018707275, "epoch": 3.9232445049601243, "grad_norm": 1.234375, "learning_rate": 0.0003528243304312837, "loss": 4.9406, "mean_token_accuracy": 0.20968398749828338, "num_tokens": 87462956.0, "step": 50425 }, { "entropy": 5.434648704528809, "epoch": 3.923633534331842, "grad_norm": 1.1640625, "learning_rate": 0.0003527983249542197, "loss": 4.8979, "mean_token_accuracy": 0.21172115355730056, "num_tokens": 87471437.0, "step": 50430 }, { "entropy": 5.3298088073730465, "epoch": 3.9240225637035597, "grad_norm": 1.1328125, "learning_rate": 0.00035277231829669006, "loss": 4.752, "mean_token_accuracy": 0.21640150249004364, "num_tokens": 87480327.0, "step": 50435 }, { "entropy": 5.359810543060303, "epoch": 3.924411593075277, "grad_norm": 1.1640625, "learning_rate": 0.0003527463104590892, "loss": 4.7786, "mean_token_accuracy": 0.22254247069358826, "num_tokens": 87489365.0, "step": 50440 }, { "entropy": 5.41688904762268, "epoch": 3.9248006224469947, "grad_norm": 1.0625, "learning_rate": 0.0003527203014418119, "loss": 4.9171, "mean_token_accuracy": 0.21648739278316498, "num_tokens": 87499267.0, "step": 50445 }, { "entropy": 5.386222982406617, "epoch": 3.9251896518187124, "grad_norm": 1.1328125, "learning_rate": 0.0003526942912452526, "loss": 4.832, "mean_token_accuracy": 0.20916824489831926, "num_tokens": 87508713.0, "step": 50450 }, { "entropy": 5.417311000823974, "epoch": 3.92557868119043, "grad_norm": 1.0859375, "learning_rate": 0.0003526682798698062, "loss": 4.9265, "mean_token_accuracy": 0.20548066049814223, "num_tokens": 87517783.0, "step": 50455 }, { "entropy": 5.401719284057617, "epoch": 3.9259677105621473, "grad_norm": 1.234375, "learning_rate": 0.0003526422673158673, "loss": 4.8462, "mean_token_accuracy": 0.21406918615102768, "num_tokens": 87525592.0, "step": 50460 }, { "entropy": 5.281982851028443, "epoch": 3.926356739933865, "grad_norm": 1.1015625, "learning_rate": 0.0003526162535838305, "loss": 4.8031, "mean_token_accuracy": 0.21481645703315735, "num_tokens": 87534540.0, "step": 50465 }, { "entropy": 5.431277942657471, "epoch": 3.9267457693055827, "grad_norm": 1.140625, "learning_rate": 0.00035259023867409065, "loss": 4.9237, "mean_token_accuracy": 0.2117403730750084, "num_tokens": 87543540.0, "step": 50470 }, { "entropy": 5.495229721069336, "epoch": 3.9271347986773, "grad_norm": 1.1328125, "learning_rate": 0.0003525642225870423, "loss": 4.9142, "mean_token_accuracy": 0.21537659019231797, "num_tokens": 87552913.0, "step": 50475 }, { "entropy": 5.464085388183594, "epoch": 3.9275238280490177, "grad_norm": 1.1796875, "learning_rate": 0.00035253820532308043, "loss": 4.9236, "mean_token_accuracy": 0.21554374992847442, "num_tokens": 87561548.0, "step": 50480 }, { "entropy": 5.391648674011231, "epoch": 3.9279128574207354, "grad_norm": 1.140625, "learning_rate": 0.0003525121868825997, "loss": 4.9049, "mean_token_accuracy": 0.211708103120327, "num_tokens": 87569877.0, "step": 50485 }, { "entropy": 5.412351989746094, "epoch": 3.928301886792453, "grad_norm": 1.1171875, "learning_rate": 0.0003524861672659949, "loss": 4.8396, "mean_token_accuracy": 0.2201072543859482, "num_tokens": 87578125.0, "step": 50490 }, { "entropy": 5.433688402175903, "epoch": 3.9286909161641703, "grad_norm": 1.1953125, "learning_rate": 0.0003524601464736609, "loss": 4.962, "mean_token_accuracy": 0.20101673007011414, "num_tokens": 87586637.0, "step": 50495 }, { "entropy": 5.480445623397827, "epoch": 3.929079945535888, "grad_norm": 1.1875, "learning_rate": 0.0003524341245059924, "loss": 4.9545, "mean_token_accuracy": 0.20769410729408264, "num_tokens": 87595674.0, "step": 50500 }, { "entropy": 5.49881386756897, "epoch": 3.9294689749076053, "grad_norm": 1.1171875, "learning_rate": 0.0003524081013633843, "loss": 5.0103, "mean_token_accuracy": 0.20782867521047593, "num_tokens": 87605404.0, "step": 50505 }, { "entropy": 5.388889980316162, "epoch": 3.929858004279323, "grad_norm": 1.125, "learning_rate": 0.00035238207704623147, "loss": 4.7843, "mean_token_accuracy": 0.2169026866555214, "num_tokens": 87613511.0, "step": 50510 }, { "entropy": 5.363560676574707, "epoch": 3.9302470336510407, "grad_norm": 1.0625, "learning_rate": 0.00035235605155492885, "loss": 4.8612, "mean_token_accuracy": 0.21667470484972, "num_tokens": 87622554.0, "step": 50515 }, { "entropy": 5.288969326019287, "epoch": 3.9306360630227584, "grad_norm": 1.28125, "learning_rate": 0.00035233002488987123, "loss": 4.6937, "mean_token_accuracy": 0.22188831865787506, "num_tokens": 87630628.0, "step": 50520 }, { "entropy": 5.458449840545654, "epoch": 3.9310250923944756, "grad_norm": 1.140625, "learning_rate": 0.00035230399705145365, "loss": 4.9094, "mean_token_accuracy": 0.20983887314796448, "num_tokens": 87639292.0, "step": 50525 }, { "entropy": 5.479224681854248, "epoch": 3.9314141217661933, "grad_norm": 1.1484375, "learning_rate": 0.0003522779680400709, "loss": 4.9229, "mean_token_accuracy": 0.20914674997329713, "num_tokens": 87646949.0, "step": 50530 }, { "entropy": 5.426835536956787, "epoch": 3.931803151137911, "grad_norm": 1.109375, "learning_rate": 0.00035225193785611795, "loss": 4.8898, "mean_token_accuracy": 0.21294473856687546, "num_tokens": 87656247.0, "step": 50535 }, { "entropy": 5.392188215255738, "epoch": 3.9321921805096283, "grad_norm": 1.109375, "learning_rate": 0.0003522259064999898, "loss": 4.9591, "mean_token_accuracy": 0.20332612097263336, "num_tokens": 87665297.0, "step": 50540 }, { "entropy": 5.387047481536865, "epoch": 3.932581209881346, "grad_norm": 1.1328125, "learning_rate": 0.00035219987397208137, "loss": 4.8664, "mean_token_accuracy": 0.21492185741662978, "num_tokens": 87674055.0, "step": 50545 }, { "entropy": 5.388765716552735, "epoch": 3.9329702392530637, "grad_norm": 1.2578125, "learning_rate": 0.0003521738402727878, "loss": 4.8441, "mean_token_accuracy": 0.21532511264085769, "num_tokens": 87682717.0, "step": 50550 }, { "entropy": 5.43828935623169, "epoch": 3.9333592686247814, "grad_norm": 1.109375, "learning_rate": 0.0003521478054025041, "loss": 4.9688, "mean_token_accuracy": 0.20688313692808152, "num_tokens": 87691683.0, "step": 50555 }, { "entropy": 5.41693000793457, "epoch": 3.9337482979964986, "grad_norm": 1.1484375, "learning_rate": 0.00035212176936162524, "loss": 4.8088, "mean_token_accuracy": 0.2135939747095108, "num_tokens": 87699953.0, "step": 50560 }, { "entropy": 5.376069259643555, "epoch": 3.9341373273682163, "grad_norm": 1.125, "learning_rate": 0.0003520957321505462, "loss": 4.8584, "mean_token_accuracy": 0.21170159578323364, "num_tokens": 87708278.0, "step": 50565 }, { "entropy": 5.418861627578735, "epoch": 3.934526356739934, "grad_norm": 1.0546875, "learning_rate": 0.00035206969376966226, "loss": 4.8932, "mean_token_accuracy": 0.2074375182390213, "num_tokens": 87717737.0, "step": 50570 }, { "entropy": 5.4540667057037355, "epoch": 3.9349153861116513, "grad_norm": 1.1171875, "learning_rate": 0.00035204365421936826, "loss": 4.8771, "mean_token_accuracy": 0.21065657138824462, "num_tokens": 87726907.0, "step": 50575 }, { "entropy": 5.400401306152344, "epoch": 3.935304415483369, "grad_norm": 1.109375, "learning_rate": 0.0003520176135000594, "loss": 4.852, "mean_token_accuracy": 0.21460242122411727, "num_tokens": 87735433.0, "step": 50580 }, { "entropy": 5.381544065475464, "epoch": 3.9356934448550867, "grad_norm": 1.1796875, "learning_rate": 0.0003519915716121309, "loss": 4.7991, "mean_token_accuracy": 0.21764929592609406, "num_tokens": 87744021.0, "step": 50585 }, { "entropy": 5.366984844207764, "epoch": 3.9360824742268044, "grad_norm": 1.171875, "learning_rate": 0.0003519655285559779, "loss": 4.8807, "mean_token_accuracy": 0.20591518878936768, "num_tokens": 87752525.0, "step": 50590 }, { "entropy": 5.460814523696899, "epoch": 3.9364715035985216, "grad_norm": 1.125, "learning_rate": 0.00035193948433199547, "loss": 4.8732, "mean_token_accuracy": 0.2186979666352272, "num_tokens": 87760806.0, "step": 50595 }, { "entropy": 5.412738037109375, "epoch": 3.9368605329702393, "grad_norm": 1.203125, "learning_rate": 0.00035191343894057885, "loss": 4.853, "mean_token_accuracy": 0.215633824467659, "num_tokens": 87769091.0, "step": 50600 }, { "entropy": 5.41365761756897, "epoch": 3.9372495623419566, "grad_norm": 1.15625, "learning_rate": 0.00035188739238212316, "loss": 4.9637, "mean_token_accuracy": 0.2000601261854172, "num_tokens": 87778096.0, "step": 50605 }, { "entropy": 5.37999153137207, "epoch": 3.9376385917136743, "grad_norm": 1.0546875, "learning_rate": 0.0003518613446570237, "loss": 4.8672, "mean_token_accuracy": 0.21605005115270615, "num_tokens": 87787439.0, "step": 50610 }, { "entropy": 5.5152545928955075, "epoch": 3.938027621085392, "grad_norm": 1.1015625, "learning_rate": 0.00035183529576567567, "loss": 4.8825, "mean_token_accuracy": 0.21816454827785492, "num_tokens": 87796592.0, "step": 50615 }, { "entropy": 5.312342834472656, "epoch": 3.9384166504571096, "grad_norm": 1.125, "learning_rate": 0.0003518092457084743, "loss": 4.7643, "mean_token_accuracy": 0.2259387880563736, "num_tokens": 87805283.0, "step": 50620 }, { "entropy": 5.359522724151612, "epoch": 3.9388056798288273, "grad_norm": 1.1328125, "learning_rate": 0.0003517831944858149, "loss": 4.9049, "mean_token_accuracy": 0.21658210456371307, "num_tokens": 87813474.0, "step": 50625 }, { "entropy": 5.4475172996521, "epoch": 3.9391947092005446, "grad_norm": 1.1875, "learning_rate": 0.00035175714209809275, "loss": 4.9483, "mean_token_accuracy": 0.21095891743898393, "num_tokens": 87822826.0, "step": 50630 }, { "entropy": 5.508661222457886, "epoch": 3.9395837385722623, "grad_norm": 1.1640625, "learning_rate": 0.0003517310885457032, "loss": 4.8517, "mean_token_accuracy": 0.21135308891534804, "num_tokens": 87831582.0, "step": 50635 }, { "entropy": 5.364058017730713, "epoch": 3.9399727679439795, "grad_norm": 1.2421875, "learning_rate": 0.0003517050338290414, "loss": 4.7872, "mean_token_accuracy": 0.21874913275241853, "num_tokens": 87839527.0, "step": 50640 }, { "entropy": 5.37795729637146, "epoch": 3.9403617973156972, "grad_norm": 1.09375, "learning_rate": 0.00035167897794850285, "loss": 4.7791, "mean_token_accuracy": 0.22116046845912934, "num_tokens": 87847973.0, "step": 50645 }, { "entropy": 5.395332527160645, "epoch": 3.940750826687415, "grad_norm": 1.171875, "learning_rate": 0.00035165292090448287, "loss": 4.9138, "mean_token_accuracy": 0.20966066420078278, "num_tokens": 87857802.0, "step": 50650 }, { "entropy": 5.307913208007813, "epoch": 3.9411398560591326, "grad_norm": 1.1640625, "learning_rate": 0.00035162686269737676, "loss": 4.7448, "mean_token_accuracy": 0.22276515662670135, "num_tokens": 87865771.0, "step": 50655 }, { "entropy": 5.328939485549927, "epoch": 3.94152888543085, "grad_norm": 1.1796875, "learning_rate": 0.00035160080332758006, "loss": 4.7614, "mean_token_accuracy": 0.22130703777074814, "num_tokens": 87874434.0, "step": 50660 }, { "entropy": 5.3313539028167725, "epoch": 3.9419179148025676, "grad_norm": 1.1015625, "learning_rate": 0.000351574742795488, "loss": 4.7151, "mean_token_accuracy": 0.22628068178892136, "num_tokens": 87882509.0, "step": 50665 }, { "entropy": 5.398054361343384, "epoch": 3.9423069441742853, "grad_norm": 1.1875, "learning_rate": 0.0003515486811014962, "loss": 4.9256, "mean_token_accuracy": 0.20837249457836152, "num_tokens": 87891440.0, "step": 50670 }, { "entropy": 5.322513437271118, "epoch": 3.9426959735460025, "grad_norm": 1.1953125, "learning_rate": 0.0003515226182459999, "loss": 4.7111, "mean_token_accuracy": 0.22443006932735443, "num_tokens": 87900275.0, "step": 50675 }, { "entropy": 5.410129642486572, "epoch": 3.9430850029177202, "grad_norm": 1.171875, "learning_rate": 0.00035149655422939477, "loss": 4.8634, "mean_token_accuracy": 0.21086281090974807, "num_tokens": 87908473.0, "step": 50680 }, { "entropy": 5.292223358154297, "epoch": 3.943474032289438, "grad_norm": 1.03125, "learning_rate": 0.0003514704890520761, "loss": 4.7199, "mean_token_accuracy": 0.23270262479782106, "num_tokens": 87917927.0, "step": 50685 }, { "entropy": 5.353907871246338, "epoch": 3.9438630616611556, "grad_norm": 1.046875, "learning_rate": 0.0003514444227144395, "loss": 4.8536, "mean_token_accuracy": 0.21157536804676055, "num_tokens": 87926982.0, "step": 50690 }, { "entropy": 5.439753103256225, "epoch": 3.944252091032873, "grad_norm": 1.1953125, "learning_rate": 0.0003514183552168804, "loss": 4.8373, "mean_token_accuracy": 0.21096294820308686, "num_tokens": 87935539.0, "step": 50695 }, { "entropy": 5.466404628753662, "epoch": 3.9446411204045906, "grad_norm": 1.1640625, "learning_rate": 0.00035139228655979457, "loss": 4.8434, "mean_token_accuracy": 0.21368503719568252, "num_tokens": 87943285.0, "step": 50700 }, { "entropy": 5.406633901596069, "epoch": 3.945030149776308, "grad_norm": 1.1796875, "learning_rate": 0.00035136621674357717, "loss": 4.9069, "mean_token_accuracy": 0.2108253076672554, "num_tokens": 87952634.0, "step": 50705 }, { "entropy": 5.393271207809448, "epoch": 3.9454191791480255, "grad_norm": 1.1640625, "learning_rate": 0.0003513401457686242, "loss": 4.807, "mean_token_accuracy": 0.21426254361867905, "num_tokens": 87960453.0, "step": 50710 }, { "entropy": 5.444956350326538, "epoch": 3.9458082085197432, "grad_norm": 1.109375, "learning_rate": 0.00035131407363533083, "loss": 4.8884, "mean_token_accuracy": 0.2068654254078865, "num_tokens": 87969696.0, "step": 50715 }, { "entropy": 5.389322710037232, "epoch": 3.946197237891461, "grad_norm": 1.125, "learning_rate": 0.0003512880003440929, "loss": 4.8475, "mean_token_accuracy": 0.21339569687843324, "num_tokens": 87978747.0, "step": 50720 }, { "entropy": 5.373222541809082, "epoch": 3.9465862672631786, "grad_norm": 1.1875, "learning_rate": 0.0003512619258953061, "loss": 4.855, "mean_token_accuracy": 0.20999928712844848, "num_tokens": 87987043.0, "step": 50725 }, { "entropy": 5.343416309356689, "epoch": 3.946975296634896, "grad_norm": 1.1484375, "learning_rate": 0.0003512358502893658, "loss": 4.8547, "mean_token_accuracy": 0.21480091214179992, "num_tokens": 87996390.0, "step": 50730 }, { "entropy": 5.460316705703735, "epoch": 3.9473643260066136, "grad_norm": 1.125, "learning_rate": 0.000351209773526668, "loss": 4.947, "mean_token_accuracy": 0.20860592573881148, "num_tokens": 88004341.0, "step": 50735 }, { "entropy": 5.36925482749939, "epoch": 3.947753355378331, "grad_norm": 1.171875, "learning_rate": 0.000351183695607608, "loss": 4.8018, "mean_token_accuracy": 0.21551977694034577, "num_tokens": 88013087.0, "step": 50740 }, { "entropy": 5.393372678756714, "epoch": 3.9481423847500485, "grad_norm": 1.1171875, "learning_rate": 0.00035115761653258177, "loss": 4.8309, "mean_token_accuracy": 0.21662657409906388, "num_tokens": 88021631.0, "step": 50745 }, { "entropy": 5.393382167816162, "epoch": 3.9485314141217662, "grad_norm": 1.0546875, "learning_rate": 0.00035113153630198494, "loss": 4.8746, "mean_token_accuracy": 0.20753007233142853, "num_tokens": 88030201.0, "step": 50750 }, { "entropy": 5.28232159614563, "epoch": 3.948920443493484, "grad_norm": 1.15625, "learning_rate": 0.0003511054549162132, "loss": 4.7049, "mean_token_accuracy": 0.22619131058454514, "num_tokens": 88038332.0, "step": 50755 }, { "entropy": 5.372884225845337, "epoch": 3.949309472865201, "grad_norm": 1.3125, "learning_rate": 0.00035107937237566233, "loss": 4.8556, "mean_token_accuracy": 0.22293240278959275, "num_tokens": 88046606.0, "step": 50760 }, { "entropy": 5.351950788497925, "epoch": 3.949698502236919, "grad_norm": 1.2265625, "learning_rate": 0.0003510532886807281, "loss": 4.7752, "mean_token_accuracy": 0.21822787672281266, "num_tokens": 88054783.0, "step": 50765 }, { "entropy": 5.388687086105347, "epoch": 3.9500875316086366, "grad_norm": 1.265625, "learning_rate": 0.0003510272038318062, "loss": 4.8176, "mean_token_accuracy": 0.2255735531449318, "num_tokens": 88062649.0, "step": 50770 }, { "entropy": 5.377196168899536, "epoch": 3.950476560980354, "grad_norm": 1.0390625, "learning_rate": 0.0003510011178292925, "loss": 4.8486, "mean_token_accuracy": 0.21770191788673401, "num_tokens": 88071597.0, "step": 50775 }, { "entropy": 5.422373342514038, "epoch": 3.9508655903520715, "grad_norm": 0.98828125, "learning_rate": 0.0003509750306735828, "loss": 4.8169, "mean_token_accuracy": 0.21476075649261475, "num_tokens": 88081229.0, "step": 50780 }, { "entropy": 5.401809549331665, "epoch": 3.951254619723789, "grad_norm": 1.140625, "learning_rate": 0.000350948942365073, "loss": 4.8413, "mean_token_accuracy": 0.2183124914765358, "num_tokens": 88089509.0, "step": 50785 }, { "entropy": 5.453243684768677, "epoch": 3.951643649095507, "grad_norm": 1.125, "learning_rate": 0.00035092285290415885, "loss": 4.9145, "mean_token_accuracy": 0.21121155619621276, "num_tokens": 88098420.0, "step": 50790 }, { "entropy": 5.4251936912536625, "epoch": 3.952032678467224, "grad_norm": 1.2578125, "learning_rate": 0.0003508967622912362, "loss": 4.8531, "mean_token_accuracy": 0.21462558060884476, "num_tokens": 88106956.0, "step": 50795 }, { "entropy": 5.395204401016235, "epoch": 3.952421707838942, "grad_norm": 1.109375, "learning_rate": 0.00035087067052670115, "loss": 4.8112, "mean_token_accuracy": 0.22056625485420228, "num_tokens": 88116021.0, "step": 50800 }, { "entropy": 5.355083847045899, "epoch": 3.9528107372106596, "grad_norm": 1.1953125, "learning_rate": 0.00035084457761094925, "loss": 4.7053, "mean_token_accuracy": 0.22740679532289504, "num_tokens": 88124496.0, "step": 50805 }, { "entropy": 5.365011262893677, "epoch": 3.953199766582377, "grad_norm": 1.1953125, "learning_rate": 0.0003508184835443766, "loss": 4.8073, "mean_token_accuracy": 0.2163566529750824, "num_tokens": 88132468.0, "step": 50810 }, { "entropy": 5.40766978263855, "epoch": 3.9535887959540945, "grad_norm": 1.09375, "learning_rate": 0.00035079238832737926, "loss": 4.9911, "mean_token_accuracy": 0.20699509531259536, "num_tokens": 88142028.0, "step": 50815 }, { "entropy": 5.375790119171143, "epoch": 3.953977825325812, "grad_norm": 1.1484375, "learning_rate": 0.000350766291960353, "loss": 4.801, "mean_token_accuracy": 0.2165253773331642, "num_tokens": 88150309.0, "step": 50820 }, { "entropy": 5.3817614078521725, "epoch": 3.95436685469753, "grad_norm": 1.1640625, "learning_rate": 0.0003507401944436939, "loss": 4.8163, "mean_token_accuracy": 0.21508964151144028, "num_tokens": 88159271.0, "step": 50825 }, { "entropy": 5.473111867904663, "epoch": 3.954755884069247, "grad_norm": 1.09375, "learning_rate": 0.0003507140957777979, "loss": 4.9356, "mean_token_accuracy": 0.21270115822553634, "num_tokens": 88168320.0, "step": 50830 }, { "entropy": 5.4673761367797855, "epoch": 3.955144913440965, "grad_norm": 1.125, "learning_rate": 0.00035068799596306096, "loss": 4.8992, "mean_token_accuracy": 0.2103220120072365, "num_tokens": 88177078.0, "step": 50835 }, { "entropy": 5.464989233016968, "epoch": 3.955533942812682, "grad_norm": 1.1875, "learning_rate": 0.0003506618949998791, "loss": 4.8916, "mean_token_accuracy": 0.21005450338125228, "num_tokens": 88184843.0, "step": 50840 }, { "entropy": 5.464234972000122, "epoch": 3.9559229721844, "grad_norm": 1.2578125, "learning_rate": 0.00035063579288864853, "loss": 4.9172, "mean_token_accuracy": 0.2137076050043106, "num_tokens": 88193623.0, "step": 50845 }, { "entropy": 5.337448310852051, "epoch": 3.9563120015561175, "grad_norm": 1.1484375, "learning_rate": 0.0003506096896297651, "loss": 4.796, "mean_token_accuracy": 0.21619633138179778, "num_tokens": 88202097.0, "step": 50850 }, { "entropy": 5.382431602478027, "epoch": 3.956701030927835, "grad_norm": 1.265625, "learning_rate": 0.00035058358522362505, "loss": 4.8758, "mean_token_accuracy": 0.2093554198741913, "num_tokens": 88210537.0, "step": 50855 }, { "entropy": 5.326663160324097, "epoch": 3.9570900602995525, "grad_norm": 1.140625, "learning_rate": 0.00035055747967062433, "loss": 4.7984, "mean_token_accuracy": 0.2235502526164055, "num_tokens": 88219427.0, "step": 50860 }, { "entropy": 5.3365637302398685, "epoch": 3.95747908967127, "grad_norm": 1.0703125, "learning_rate": 0.0003505313729711592, "loss": 4.7544, "mean_token_accuracy": 0.22244355231523513, "num_tokens": 88227886.0, "step": 50865 }, { "entropy": 5.353641605377197, "epoch": 3.957868119042988, "grad_norm": 1.0859375, "learning_rate": 0.00035050526512562564, "loss": 4.7642, "mean_token_accuracy": 0.22035931199789047, "num_tokens": 88236783.0, "step": 50870 }, { "entropy": 5.392473363876343, "epoch": 3.958257148414705, "grad_norm": 1.1171875, "learning_rate": 0.0003504791561344199, "loss": 4.851, "mean_token_accuracy": 0.20735141038894653, "num_tokens": 88245576.0, "step": 50875 }, { "entropy": 5.371248054504394, "epoch": 3.958646177786423, "grad_norm": 1.1796875, "learning_rate": 0.00035045304599793807, "loss": 4.8579, "mean_token_accuracy": 0.21282961517572402, "num_tokens": 88253675.0, "step": 50880 }, { "entropy": 5.24962010383606, "epoch": 3.9590352071581405, "grad_norm": 1.171875, "learning_rate": 0.00035042693471657637, "loss": 4.6674, "mean_token_accuracy": 0.2272094801068306, "num_tokens": 88261870.0, "step": 50885 }, { "entropy": 5.358071899414062, "epoch": 3.959424236529858, "grad_norm": 1.15625, "learning_rate": 0.00035040082229073096, "loss": 4.8057, "mean_token_accuracy": 0.2221774011850357, "num_tokens": 88270204.0, "step": 50890 }, { "entropy": 5.465081310272216, "epoch": 3.9598132659015755, "grad_norm": 1.2265625, "learning_rate": 0.0003503747087207981, "loss": 4.9162, "mean_token_accuracy": 0.21159758418798447, "num_tokens": 88278722.0, "step": 50895 }, { "entropy": 5.424841451644897, "epoch": 3.960202295273293, "grad_norm": 1.1953125, "learning_rate": 0.00035034859400717407, "loss": 4.8761, "mean_token_accuracy": 0.21334708482027054, "num_tokens": 88288110.0, "step": 50900 }, { "entropy": 5.4268371105194095, "epoch": 3.960591324645011, "grad_norm": 1.1015625, "learning_rate": 0.00035032247815025504, "loss": 4.8613, "mean_token_accuracy": 0.21504829227924346, "num_tokens": 88297469.0, "step": 50905 }, { "entropy": 5.387601900100708, "epoch": 3.960980354016728, "grad_norm": 1.1015625, "learning_rate": 0.00035029636115043724, "loss": 4.8629, "mean_token_accuracy": 0.20823004692792893, "num_tokens": 88306588.0, "step": 50910 }, { "entropy": 5.386000347137451, "epoch": 3.961369383388446, "grad_norm": 1.1640625, "learning_rate": 0.00035027024300811707, "loss": 4.8725, "mean_token_accuracy": 0.21385190337896348, "num_tokens": 88316275.0, "step": 50915 }, { "entropy": 5.398382472991943, "epoch": 3.9617584127601635, "grad_norm": 1.0625, "learning_rate": 0.0003502441237236907, "loss": 4.8805, "mean_token_accuracy": 0.20613760501146317, "num_tokens": 88325314.0, "step": 50920 }, { "entropy": 5.424760866165161, "epoch": 3.962147442131881, "grad_norm": 1.1796875, "learning_rate": 0.0003502180032975545, "loss": 4.8788, "mean_token_accuracy": 0.21617455333471297, "num_tokens": 88335252.0, "step": 50925 }, { "entropy": 5.349911165237427, "epoch": 3.9625364715035984, "grad_norm": 1.078125, "learning_rate": 0.0003501918817301049, "loss": 4.7855, "mean_token_accuracy": 0.21747283041477203, "num_tokens": 88343467.0, "step": 50930 }, { "entropy": 5.402218675613403, "epoch": 3.962925500875316, "grad_norm": 1.2421875, "learning_rate": 0.00035016575902173814, "loss": 4.9044, "mean_token_accuracy": 0.21832928508520127, "num_tokens": 88351432.0, "step": 50935 }, { "entropy": 5.392431545257568, "epoch": 3.9633145302470334, "grad_norm": 1.125, "learning_rate": 0.00035013963517285064, "loss": 4.879, "mean_token_accuracy": 0.21080988496541977, "num_tokens": 88360665.0, "step": 50940 }, { "entropy": 5.3835530281066895, "epoch": 3.963703559618751, "grad_norm": 1.1953125, "learning_rate": 0.00035011351018383874, "loss": 4.7768, "mean_token_accuracy": 0.2142104059457779, "num_tokens": 88368980.0, "step": 50945 }, { "entropy": 5.3297926902771, "epoch": 3.964092588990469, "grad_norm": 1.109375, "learning_rate": 0.0003500873840550989, "loss": 4.7768, "mean_token_accuracy": 0.22513724118471146, "num_tokens": 88377888.0, "step": 50950 }, { "entropy": 5.2133149147033695, "epoch": 3.9644816183621865, "grad_norm": 1.1328125, "learning_rate": 0.00035006125678702755, "loss": 4.7124, "mean_token_accuracy": 0.2217951625585556, "num_tokens": 88385845.0, "step": 50955 }, { "entropy": 5.368986511230469, "epoch": 3.964870647733904, "grad_norm": 1.1015625, "learning_rate": 0.00035003512838002103, "loss": 4.8254, "mean_token_accuracy": 0.2150809422135353, "num_tokens": 88394608.0, "step": 50960 }, { "entropy": 5.404612493515015, "epoch": 3.9652596771056214, "grad_norm": 1.1484375, "learning_rate": 0.0003500089988344759, "loss": 4.7876, "mean_token_accuracy": 0.22453247010707855, "num_tokens": 88402857.0, "step": 50965 }, { "entropy": 5.380050897598267, "epoch": 3.965648706477339, "grad_norm": 1.1484375, "learning_rate": 0.00034998286815078855, "loss": 4.8672, "mean_token_accuracy": 0.20557522773742676, "num_tokens": 88410977.0, "step": 50970 }, { "entropy": 5.505987882614136, "epoch": 3.9660377358490564, "grad_norm": 1.078125, "learning_rate": 0.00034995673632935557, "loss": 5.0108, "mean_token_accuracy": 0.20224587470293046, "num_tokens": 88420409.0, "step": 50975 }, { "entropy": 5.378875350952148, "epoch": 3.966426765220774, "grad_norm": 1.1328125, "learning_rate": 0.0003499306033705735, "loss": 4.7935, "mean_token_accuracy": 0.21617303192615508, "num_tokens": 88429389.0, "step": 50980 }, { "entropy": 5.435645246505738, "epoch": 3.966815794592492, "grad_norm": 1.2109375, "learning_rate": 0.00034990446927483877, "loss": 4.8638, "mean_token_accuracy": 0.2078116089105606, "num_tokens": 88437758.0, "step": 50985 }, { "entropy": 5.380201148986816, "epoch": 3.9672048239642095, "grad_norm": 1.1875, "learning_rate": 0.0003498783340425479, "loss": 4.7734, "mean_token_accuracy": 0.22040392756462096, "num_tokens": 88446205.0, "step": 50990 }, { "entropy": 5.3852544784545895, "epoch": 3.9675938533359267, "grad_norm": 1.15625, "learning_rate": 0.00034985219767409747, "loss": 4.811, "mean_token_accuracy": 0.21162720322608947, "num_tokens": 88453808.0, "step": 50995 }, { "entropy": 5.288815355300903, "epoch": 3.9679828827076444, "grad_norm": 1.1484375, "learning_rate": 0.00034982606016988407, "loss": 4.8088, "mean_token_accuracy": 0.21983133107423783, "num_tokens": 88462559.0, "step": 51000 }, { "epoch": 3.9679828827076444, "eval_entropy": 5.098066503159465, "eval_loss": 4.967385292053223, "eval_mean_token_accuracy": 0.21750381170871513, "eval_num_tokens": 88462559.0, "eval_runtime": 28.7204, "eval_samples_per_second": 1446.984, "eval_steps_per_second": 180.882, "step": 51000 }, { "entropy": 5.343781900405884, "epoch": 3.968371912079362, "grad_norm": 1.078125, "learning_rate": 0.00034979992153030424, "loss": 4.8418, "mean_token_accuracy": 0.21697256416082383, "num_tokens": 88471633.0, "step": 51005 }, { "entropy": 5.355787229537964, "epoch": 3.9687609414510794, "grad_norm": 1.109375, "learning_rate": 0.0003497737817557548, "loss": 4.888, "mean_token_accuracy": 0.20885892510414122, "num_tokens": 88481362.0, "step": 51010 }, { "entropy": 5.341981029510498, "epoch": 3.969149970822797, "grad_norm": 1.1953125, "learning_rate": 0.00034974764084663213, "loss": 4.7324, "mean_token_accuracy": 0.22860104441642762, "num_tokens": 88489742.0, "step": 51015 }, { "entropy": 5.323961877822876, "epoch": 3.9695390001945148, "grad_norm": 1.140625, "learning_rate": 0.00034972149880333316, "loss": 4.7854, "mean_token_accuracy": 0.2207481548190117, "num_tokens": 88499049.0, "step": 51020 }, { "entropy": 5.324609184265137, "epoch": 3.9699280295662325, "grad_norm": 1.0859375, "learning_rate": 0.0003496953556262542, "loss": 4.794, "mean_token_accuracy": 0.2267455130815506, "num_tokens": 88507810.0, "step": 51025 }, { "entropy": 5.3938860416412355, "epoch": 3.9703170589379497, "grad_norm": 1.203125, "learning_rate": 0.00034966921131579216, "loss": 4.7855, "mean_token_accuracy": 0.21184342801570893, "num_tokens": 88515807.0, "step": 51030 }, { "entropy": 5.374936819076538, "epoch": 3.9707060883096674, "grad_norm": 1.0859375, "learning_rate": 0.00034964306587234367, "loss": 4.8588, "mean_token_accuracy": 0.22285531908273698, "num_tokens": 88524493.0, "step": 51035 }, { "entropy": 5.412810373306274, "epoch": 3.9710951176813847, "grad_norm": 1.109375, "learning_rate": 0.00034961691929630544, "loss": 4.8959, "mean_token_accuracy": 0.20716042667627335, "num_tokens": 88533241.0, "step": 51040 }, { "entropy": 5.443279027938843, "epoch": 3.9714841470531024, "grad_norm": 1.1328125, "learning_rate": 0.0003495907715880743, "loss": 4.96, "mean_token_accuracy": 0.21013213843107223, "num_tokens": 88542889.0, "step": 51045 }, { "entropy": 5.385065412521362, "epoch": 3.97187317642482, "grad_norm": 1.109375, "learning_rate": 0.0003495646227480469, "loss": 4.8166, "mean_token_accuracy": 0.21199689507484437, "num_tokens": 88551894.0, "step": 51050 }, { "entropy": 5.3824756145477295, "epoch": 3.9722622057965378, "grad_norm": 1.140625, "learning_rate": 0.00034953847277662, "loss": 4.8854, "mean_token_accuracy": 0.22265829443931578, "num_tokens": 88560518.0, "step": 51055 }, { "entropy": 5.382286262512207, "epoch": 3.9726512351682555, "grad_norm": 1.140625, "learning_rate": 0.00034951232167419044, "loss": 4.885, "mean_token_accuracy": 0.2071485236287117, "num_tokens": 88569270.0, "step": 51060 }, { "entropy": 5.3590740203857425, "epoch": 3.9730402645399727, "grad_norm": 1.046875, "learning_rate": 0.00034948616944115504, "loss": 4.7976, "mean_token_accuracy": 0.21538321524858475, "num_tokens": 88579208.0, "step": 51065 }, { "entropy": 5.3422284603118895, "epoch": 3.9734292939116904, "grad_norm": 1.140625, "learning_rate": 0.0003494600160779105, "loss": 4.7529, "mean_token_accuracy": 0.22014327645301818, "num_tokens": 88587654.0, "step": 51070 }, { "entropy": 5.39596996307373, "epoch": 3.9738183232834077, "grad_norm": 1.1328125, "learning_rate": 0.0003494338615848537, "loss": 4.869, "mean_token_accuracy": 0.2166467010974884, "num_tokens": 88596049.0, "step": 51075 }, { "entropy": 5.306340265274048, "epoch": 3.9742073526551254, "grad_norm": 1.15625, "learning_rate": 0.0003494077059623816, "loss": 4.8067, "mean_token_accuracy": 0.21405717134475707, "num_tokens": 88604939.0, "step": 51080 }, { "entropy": 5.349564552307129, "epoch": 3.974596382026843, "grad_norm": 1.15625, "learning_rate": 0.00034938154921089097, "loss": 4.8202, "mean_token_accuracy": 0.21656274646520615, "num_tokens": 88613191.0, "step": 51085 }, { "entropy": 5.442694282531738, "epoch": 3.9749854113985608, "grad_norm": 1.234375, "learning_rate": 0.0003493553913307788, "loss": 4.8909, "mean_token_accuracy": 0.21238974928855897, "num_tokens": 88621520.0, "step": 51090 }, { "entropy": 5.3690577983856205, "epoch": 3.975374440770278, "grad_norm": 1.1484375, "learning_rate": 0.00034932923232244183, "loss": 4.8444, "mean_token_accuracy": 0.21954160183668137, "num_tokens": 88630216.0, "step": 51095 }, { "entropy": 5.463378095626831, "epoch": 3.9757634701419957, "grad_norm": 1.3984375, "learning_rate": 0.00034930307218627706, "loss": 4.8806, "mean_token_accuracy": 0.2092505007982254, "num_tokens": 88638677.0, "step": 51100 }, { "entropy": 5.429535388946533, "epoch": 3.9761524995137134, "grad_norm": 1.140625, "learning_rate": 0.0003492769109226815, "loss": 4.8571, "mean_token_accuracy": 0.20684039145708083, "num_tokens": 88646955.0, "step": 51105 }, { "entropy": 5.297150468826294, "epoch": 3.9765415288854307, "grad_norm": 1.1484375, "learning_rate": 0.00034925074853205194, "loss": 4.6729, "mean_token_accuracy": 0.23237662613391877, "num_tokens": 88655120.0, "step": 51110 }, { "entropy": 5.32683916091919, "epoch": 3.9769305582571484, "grad_norm": 1.1796875, "learning_rate": 0.00034922458501478556, "loss": 4.9106, "mean_token_accuracy": 0.2098128542304039, "num_tokens": 88663942.0, "step": 51115 }, { "entropy": 5.4396649360656735, "epoch": 3.977319587628866, "grad_norm": 1.125, "learning_rate": 0.0003491984203712792, "loss": 4.8684, "mean_token_accuracy": 0.21191660761833192, "num_tokens": 88672490.0, "step": 51120 }, { "entropy": 5.507908964157105, "epoch": 3.9777086170005838, "grad_norm": 1.171875, "learning_rate": 0.0003491722546019299, "loss": 4.9225, "mean_token_accuracy": 0.21909769028425216, "num_tokens": 88681091.0, "step": 51125 }, { "entropy": 5.321393346786499, "epoch": 3.978097646372301, "grad_norm": 1.1328125, "learning_rate": 0.0003491460877071347, "loss": 4.8268, "mean_token_accuracy": 0.21862240731716157, "num_tokens": 88690473.0, "step": 51130 }, { "entropy": 5.527681159973144, "epoch": 3.9784866757440187, "grad_norm": 1.2734375, "learning_rate": 0.0003491199196872906, "loss": 4.9713, "mean_token_accuracy": 0.20171018540859223, "num_tokens": 88699036.0, "step": 51135 }, { "entropy": 5.476132535934449, "epoch": 3.978875705115736, "grad_norm": 1.1796875, "learning_rate": 0.0003490937505427947, "loss": 4.8899, "mean_token_accuracy": 0.21066357046365738, "num_tokens": 88707893.0, "step": 51140 }, { "entropy": 5.432781934738159, "epoch": 3.9792647344874537, "grad_norm": 1.171875, "learning_rate": 0.0003490675802740441, "loss": 4.809, "mean_token_accuracy": 0.21702309548854828, "num_tokens": 88716743.0, "step": 51145 }, { "entropy": 5.354176187515259, "epoch": 3.9796537638591714, "grad_norm": 1.1640625, "learning_rate": 0.0003490414088814359, "loss": 4.9084, "mean_token_accuracy": 0.21376069039106368, "num_tokens": 88724970.0, "step": 51150 }, { "entropy": 5.312931823730469, "epoch": 3.980042793230889, "grad_norm": 1.0625, "learning_rate": 0.0003490152363653671, "loss": 4.7129, "mean_token_accuracy": 0.22563090771436692, "num_tokens": 88733207.0, "step": 51155 }, { "entropy": 5.443997240066528, "epoch": 3.9804318226026068, "grad_norm": 1.140625, "learning_rate": 0.0003489890627262349, "loss": 4.9283, "mean_token_accuracy": 0.20759814381599426, "num_tokens": 88741907.0, "step": 51160 }, { "entropy": 5.45283145904541, "epoch": 3.980820851974324, "grad_norm": 1.1796875, "learning_rate": 0.00034896288796443654, "loss": 4.8055, "mean_token_accuracy": 0.20930091738700868, "num_tokens": 88751080.0, "step": 51165 }, { "entropy": 5.3644510269165036, "epoch": 3.9812098813460417, "grad_norm": 1.2421875, "learning_rate": 0.00034893671208036895, "loss": 4.8314, "mean_token_accuracy": 0.21665865033864976, "num_tokens": 88759387.0, "step": 51170 }, { "entropy": 5.416509389877319, "epoch": 3.981598910717759, "grad_norm": 1.1796875, "learning_rate": 0.00034891053507442944, "loss": 4.8495, "mean_token_accuracy": 0.21289546191692352, "num_tokens": 88768785.0, "step": 51175 }, { "entropy": 5.474390172958374, "epoch": 3.9819879400894767, "grad_norm": 1.2109375, "learning_rate": 0.0003488843569470153, "loss": 4.8722, "mean_token_accuracy": 0.2128552094101906, "num_tokens": 88777835.0, "step": 51180 }, { "entropy": 5.399246501922607, "epoch": 3.9823769694611943, "grad_norm": 1.1484375, "learning_rate": 0.00034885817769852355, "loss": 4.8402, "mean_token_accuracy": 0.20878460109233857, "num_tokens": 88786447.0, "step": 51185 }, { "entropy": 5.392108345031739, "epoch": 3.982765998832912, "grad_norm": 1.1640625, "learning_rate": 0.00034883199732935156, "loss": 4.8271, "mean_token_accuracy": 0.2162730023264885, "num_tokens": 88795235.0, "step": 51190 }, { "entropy": 5.397614192962647, "epoch": 3.9831550282046293, "grad_norm": 1.15625, "learning_rate": 0.00034880581583989655, "loss": 4.8213, "mean_token_accuracy": 0.2091386005282402, "num_tokens": 88803975.0, "step": 51195 }, { "entropy": 5.4236688137054445, "epoch": 3.983544057576347, "grad_norm": 1.109375, "learning_rate": 0.0003487796332305557, "loss": 4.9108, "mean_token_accuracy": 0.21045883893966674, "num_tokens": 88813332.0, "step": 51200 }, { "entropy": 5.440752410888672, "epoch": 3.9839330869480647, "grad_norm": 1.15625, "learning_rate": 0.00034875344950172635, "loss": 4.9397, "mean_token_accuracy": 0.20393143594264984, "num_tokens": 88822230.0, "step": 51205 }, { "entropy": 5.399003362655639, "epoch": 3.984322116319782, "grad_norm": 1.171875, "learning_rate": 0.0003487272646538058, "loss": 4.7896, "mean_token_accuracy": 0.2177165001630783, "num_tokens": 88830790.0, "step": 51210 }, { "entropy": 5.486355257034302, "epoch": 3.9847111456914996, "grad_norm": 1.2421875, "learning_rate": 0.00034870107868719135, "loss": 4.9464, "mean_token_accuracy": 0.2047772690653801, "num_tokens": 88839191.0, "step": 51215 }, { "entropy": 5.357129955291748, "epoch": 3.9851001750632173, "grad_norm": 1.125, "learning_rate": 0.0003486748916022804, "loss": 4.7712, "mean_token_accuracy": 0.22061035931110382, "num_tokens": 88848066.0, "step": 51220 }, { "entropy": 5.340689468383789, "epoch": 3.985489204434935, "grad_norm": 1.125, "learning_rate": 0.0003486487033994702, "loss": 4.8437, "mean_token_accuracy": 0.21492844223976135, "num_tokens": 88856323.0, "step": 51225 }, { "entropy": 5.3923829078674315, "epoch": 3.9858782338066523, "grad_norm": 1.2109375, "learning_rate": 0.00034862251407915813, "loss": 4.8309, "mean_token_accuracy": 0.21588771641254426, "num_tokens": 88865294.0, "step": 51230 }, { "entropy": 5.446277713775634, "epoch": 3.98626726317837, "grad_norm": 1.1015625, "learning_rate": 0.00034859632364174167, "loss": 4.8728, "mean_token_accuracy": 0.21527935415506363, "num_tokens": 88873572.0, "step": 51235 }, { "entropy": 5.432677698135376, "epoch": 3.9866562925500877, "grad_norm": 1.1640625, "learning_rate": 0.000348570132087618, "loss": 4.8293, "mean_token_accuracy": 0.21862333565950393, "num_tokens": 88881861.0, "step": 51240 }, { "entropy": 5.368596982955933, "epoch": 3.987045321921805, "grad_norm": 1.0703125, "learning_rate": 0.0003485439394171847, "loss": 4.9306, "mean_token_accuracy": 0.2149570792913437, "num_tokens": 88891805.0, "step": 51245 }, { "entropy": 5.431462240219116, "epoch": 3.9874343512935226, "grad_norm": 1.171875, "learning_rate": 0.00034851774563083925, "loss": 4.9155, "mean_token_accuracy": 0.20740412324666976, "num_tokens": 88899913.0, "step": 51250 }, { "entropy": 5.436556482315064, "epoch": 3.9878233806652403, "grad_norm": 1.1171875, "learning_rate": 0.0003484915507289791, "loss": 4.841, "mean_token_accuracy": 0.2212355688214302, "num_tokens": 88908684.0, "step": 51255 }, { "entropy": 5.433439064025879, "epoch": 3.988212410036958, "grad_norm": 1.15625, "learning_rate": 0.00034846535471200153, "loss": 4.9055, "mean_token_accuracy": 0.21381947845220567, "num_tokens": 88917514.0, "step": 51260 }, { "entropy": 5.319541311264038, "epoch": 3.9886014394086753, "grad_norm": 1.109375, "learning_rate": 0.0003484391575803041, "loss": 4.8479, "mean_token_accuracy": 0.22130178660154343, "num_tokens": 88926065.0, "step": 51265 }, { "entropy": 5.392234754562378, "epoch": 3.988990468780393, "grad_norm": 1.078125, "learning_rate": 0.0003484129593342844, "loss": 4.8001, "mean_token_accuracy": 0.21393730044364928, "num_tokens": 88934389.0, "step": 51270 }, { "entropy": 5.457669925689697, "epoch": 3.9893794981521102, "grad_norm": 1.15625, "learning_rate": 0.00034838675997433987, "loss": 4.8342, "mean_token_accuracy": 0.2130183070898056, "num_tokens": 88943691.0, "step": 51275 }, { "entropy": 5.409145450592041, "epoch": 3.989768527523828, "grad_norm": 1.1640625, "learning_rate": 0.0003483605595008681, "loss": 4.9274, "mean_token_accuracy": 0.20783212184906005, "num_tokens": 88952318.0, "step": 51280 }, { "entropy": 5.361263656616211, "epoch": 3.9901575568955456, "grad_norm": 1.15625, "learning_rate": 0.00034833435791426653, "loss": 4.7326, "mean_token_accuracy": 0.2281709060072899, "num_tokens": 88960689.0, "step": 51285 }, { "entropy": 5.306232213973999, "epoch": 3.9905465862672633, "grad_norm": 1.109375, "learning_rate": 0.00034830815521493295, "loss": 4.7723, "mean_token_accuracy": 0.22109062671661378, "num_tokens": 88969533.0, "step": 51290 }, { "entropy": 5.422588348388672, "epoch": 3.9909356156389806, "grad_norm": 1.171875, "learning_rate": 0.0003482819514032647, "loss": 4.8298, "mean_token_accuracy": 0.21314404010772706, "num_tokens": 88978512.0, "step": 51295 }, { "entropy": 5.420740222930908, "epoch": 3.9913246450106983, "grad_norm": 1.140625, "learning_rate": 0.00034825574647965945, "loss": 4.8398, "mean_token_accuracy": 0.21670727878808976, "num_tokens": 88987120.0, "step": 51300 }, { "entropy": 5.417478132247925, "epoch": 3.991713674382416, "grad_norm": 1.1484375, "learning_rate": 0.00034822954044451485, "loss": 4.8883, "mean_token_accuracy": 0.210420124232769, "num_tokens": 88996271.0, "step": 51305 }, { "entropy": 5.412640762329102, "epoch": 3.9921027037541332, "grad_norm": 1.1484375, "learning_rate": 0.0003482033332982286, "loss": 4.8467, "mean_token_accuracy": 0.20758840143680574, "num_tokens": 89004538.0, "step": 51310 }, { "entropy": 5.430873775482178, "epoch": 3.992491733125851, "grad_norm": 1.15625, "learning_rate": 0.0003481771250411982, "loss": 4.8945, "mean_token_accuracy": 0.21125626415014268, "num_tokens": 89013662.0, "step": 51315 }, { "entropy": 5.3577282428741455, "epoch": 3.9928807624975686, "grad_norm": 1.1484375, "learning_rate": 0.0003481509156738214, "loss": 4.8276, "mean_token_accuracy": 0.2193271279335022, "num_tokens": 89022451.0, "step": 51320 }, { "entropy": 5.345005798339844, "epoch": 3.9932697918692863, "grad_norm": 1.109375, "learning_rate": 0.00034812470519649593, "loss": 4.8155, "mean_token_accuracy": 0.20838116258382797, "num_tokens": 89030968.0, "step": 51325 }, { "entropy": 5.368816232681274, "epoch": 3.9936588212410036, "grad_norm": 1.0859375, "learning_rate": 0.0003480984936096194, "loss": 4.8481, "mean_token_accuracy": 0.21497409045696259, "num_tokens": 89039614.0, "step": 51330 }, { "entropy": 5.368923711776733, "epoch": 3.9940478506127213, "grad_norm": 1.171875, "learning_rate": 0.00034807228091358964, "loss": 4.7879, "mean_token_accuracy": 0.2193361535668373, "num_tokens": 89048245.0, "step": 51335 }, { "entropy": 5.336399888992309, "epoch": 3.994436879984439, "grad_norm": 1.1015625, "learning_rate": 0.0003480460671088043, "loss": 4.7835, "mean_token_accuracy": 0.21289712935686111, "num_tokens": 89057486.0, "step": 51340 }, { "entropy": 5.4264050960540775, "epoch": 3.9948259093561562, "grad_norm": 1.2578125, "learning_rate": 0.00034801985219566124, "loss": 4.8657, "mean_token_accuracy": 0.2153733879327774, "num_tokens": 89065833.0, "step": 51345 }, { "entropy": 5.333083200454712, "epoch": 3.995214938727874, "grad_norm": 1.1328125, "learning_rate": 0.000347993636174558, "loss": 4.8685, "mean_token_accuracy": 0.21378479450941085, "num_tokens": 89074562.0, "step": 51350 }, { "entropy": 5.3985615253448485, "epoch": 3.9956039680995916, "grad_norm": 1.1796875, "learning_rate": 0.00034796741904589263, "loss": 4.9388, "mean_token_accuracy": 0.21665503531694413, "num_tokens": 89083013.0, "step": 51355 }, { "entropy": 5.411608934402466, "epoch": 3.9959929974713093, "grad_norm": 1.171875, "learning_rate": 0.00034794120081006275, "loss": 4.8365, "mean_token_accuracy": 0.21547756642103194, "num_tokens": 89090926.0, "step": 51360 }, { "entropy": 5.397363710403442, "epoch": 3.9963820268430266, "grad_norm": 1.1875, "learning_rate": 0.0003479149814674663, "loss": 4.8134, "mean_token_accuracy": 0.22248280942440032, "num_tokens": 89099251.0, "step": 51365 }, { "entropy": 5.301083898544311, "epoch": 3.9967710562147443, "grad_norm": 1.2109375, "learning_rate": 0.000347888761018501, "loss": 4.8713, "mean_token_accuracy": 0.20601505041122437, "num_tokens": 89108227.0, "step": 51370 }, { "entropy": 5.3769653797149655, "epoch": 3.9971600855864615, "grad_norm": 1.203125, "learning_rate": 0.0003478625394635648, "loss": 4.8394, "mean_token_accuracy": 0.21165846586227416, "num_tokens": 89116434.0, "step": 51375 }, { "entropy": 5.3993518352508545, "epoch": 3.997549114958179, "grad_norm": 1.1875, "learning_rate": 0.00034783631680305554, "loss": 4.7999, "mean_token_accuracy": 0.21658010482788087, "num_tokens": 89124855.0, "step": 51380 }, { "entropy": 5.321805191040039, "epoch": 3.997938144329897, "grad_norm": 1.125, "learning_rate": 0.0003478100930373711, "loss": 4.7863, "mean_token_accuracy": 0.2177918165922165, "num_tokens": 89133476.0, "step": 51385 }, { "entropy": 5.29525318145752, "epoch": 3.9983271737016146, "grad_norm": 1.234375, "learning_rate": 0.0003477838681669094, "loss": 4.8008, "mean_token_accuracy": 0.22052622586488724, "num_tokens": 89142306.0, "step": 51390 }, { "entropy": 5.36322546005249, "epoch": 3.9987162030733323, "grad_norm": 1.1640625, "learning_rate": 0.0003477576421920682, "loss": 4.8024, "mean_token_accuracy": 0.22153883278369904, "num_tokens": 89151101.0, "step": 51395 }, { "entropy": 5.404524421691894, "epoch": 3.9991052324450496, "grad_norm": 1.125, "learning_rate": 0.0003477314151132458, "loss": 4.835, "mean_token_accuracy": 0.2151877373456955, "num_tokens": 89159311.0, "step": 51400 }, { "entropy": 5.4113623142242435, "epoch": 3.9994942618167673, "grad_norm": 1.1640625, "learning_rate": 0.00034770518693083986, "loss": 4.8516, "mean_token_accuracy": 0.2121650144457817, "num_tokens": 89167130.0, "step": 51405 }, { "entropy": 5.406304502487183, "epoch": 3.9998832911884845, "grad_norm": 1.09375, "learning_rate": 0.00034767895764524845, "loss": 4.9047, "mean_token_accuracy": 0.20899797976016998, "num_tokens": 89175732.0, "step": 51410 }, { "entropy": 5.426645225948757, "epoch": 4.000233417623031, "grad_norm": 1.171875, "learning_rate": 0.00034765272725686947, "loss": 4.8293, "mean_token_accuracy": 0.2202550686068005, "num_tokens": 89182536.0, "step": 51415 }, { "entropy": 5.370031404495239, "epoch": 4.000622446994748, "grad_norm": 1.1796875, "learning_rate": 0.00034762649576610105, "loss": 4.7549, "mean_token_accuracy": 0.21045888513326644, "num_tokens": 89191431.0, "step": 51420 }, { "entropy": 5.351933288574219, "epoch": 4.0010114763664655, "grad_norm": 1.171875, "learning_rate": 0.00034760026317334113, "loss": 4.7834, "mean_token_accuracy": 0.21218374818563462, "num_tokens": 89200365.0, "step": 51425 }, { "entropy": 5.404979085922241, "epoch": 4.001400505738183, "grad_norm": 1.2109375, "learning_rate": 0.0003475740294789878, "loss": 4.8271, "mean_token_accuracy": 0.2177969053387642, "num_tokens": 89208968.0, "step": 51430 }, { "entropy": 5.470998620986938, "epoch": 4.001789535109901, "grad_norm": 1.3359375, "learning_rate": 0.000347547794683439, "loss": 4.9017, "mean_token_accuracy": 0.2125532314181328, "num_tokens": 89217543.0, "step": 51435 }, { "entropy": 5.358471393585205, "epoch": 4.002178564481619, "grad_norm": 1.1875, "learning_rate": 0.0003475215587870929, "loss": 4.6941, "mean_token_accuracy": 0.2282708540558815, "num_tokens": 89225847.0, "step": 51440 }, { "entropy": 5.477706241607666, "epoch": 4.002567593853336, "grad_norm": 1.140625, "learning_rate": 0.0003474953217903477, "loss": 4.9038, "mean_token_accuracy": 0.20762912780046464, "num_tokens": 89235010.0, "step": 51445 }, { "entropy": 5.473307991027832, "epoch": 4.002956623225053, "grad_norm": 1.1953125, "learning_rate": 0.0003474690836936013, "loss": 4.8143, "mean_token_accuracy": 0.21996689587831497, "num_tokens": 89243827.0, "step": 51450 }, { "entropy": 5.425415277481079, "epoch": 4.003345652596771, "grad_norm": 1.1171875, "learning_rate": 0.0003474428444972519, "loss": 4.8921, "mean_token_accuracy": 0.21453977525234222, "num_tokens": 89252574.0, "step": 51455 }, { "entropy": 5.350248718261719, "epoch": 4.0037346819684885, "grad_norm": 1.2578125, "learning_rate": 0.0003474166042016977, "loss": 4.7973, "mean_token_accuracy": 0.2211287260055542, "num_tokens": 89260827.0, "step": 51460 }, { "entropy": 5.3988597869873045, "epoch": 4.004123711340206, "grad_norm": 1.171875, "learning_rate": 0.00034739036280733674, "loss": 4.8422, "mean_token_accuracy": 0.2146250605583191, "num_tokens": 89269635.0, "step": 51465 }, { "entropy": 5.485918378829956, "epoch": 4.004512740711924, "grad_norm": 1.171875, "learning_rate": 0.00034736412031456714, "loss": 4.8878, "mean_token_accuracy": 0.21481534987688064, "num_tokens": 89278490.0, "step": 51470 }, { "entropy": 5.497883892059326, "epoch": 4.004901770083642, "grad_norm": 1.265625, "learning_rate": 0.00034733787672378734, "loss": 4.8299, "mean_token_accuracy": 0.2133852571249008, "num_tokens": 89287337.0, "step": 51475 }, { "entropy": 5.386208534240723, "epoch": 4.005290799455359, "grad_norm": 1.2109375, "learning_rate": 0.0003473116320353953, "loss": 4.7574, "mean_token_accuracy": 0.22357117533683776, "num_tokens": 89295703.0, "step": 51480 }, { "entropy": 5.420983934402466, "epoch": 4.005679828827076, "grad_norm": 1.1484375, "learning_rate": 0.0003472853862497895, "loss": 4.8394, "mean_token_accuracy": 0.22127819806337357, "num_tokens": 89304470.0, "step": 51485 }, { "entropy": 5.225989484786988, "epoch": 4.006068858198794, "grad_norm": 1.2578125, "learning_rate": 0.0003472591393673679, "loss": 4.6128, "mean_token_accuracy": 0.2307997763156891, "num_tokens": 89313344.0, "step": 51490 }, { "entropy": 5.289905214309693, "epoch": 4.0064578875705115, "grad_norm": 1.1875, "learning_rate": 0.00034723289138852885, "loss": 4.7212, "mean_token_accuracy": 0.22366084307432174, "num_tokens": 89322112.0, "step": 51495 }, { "entropy": 5.383905601501465, "epoch": 4.006846916942229, "grad_norm": 1.1953125, "learning_rate": 0.0003472066423136707, "loss": 4.7316, "mean_token_accuracy": 0.22573547810316086, "num_tokens": 89331972.0, "step": 51500 }, { "entropy": 5.3920598983764645, "epoch": 4.007235946313947, "grad_norm": 1.1484375, "learning_rate": 0.0003471803921431917, "loss": 4.7119, "mean_token_accuracy": 0.233779576420784, "num_tokens": 89340343.0, "step": 51505 }, { "entropy": 5.328002643585205, "epoch": 4.007624975685665, "grad_norm": 1.1875, "learning_rate": 0.00034715414087749003, "loss": 4.8527, "mean_token_accuracy": 0.2161891222000122, "num_tokens": 89349063.0, "step": 51510 }, { "entropy": 5.305205011367798, "epoch": 4.008014005057382, "grad_norm": 1.09375, "learning_rate": 0.0003471278885169642, "loss": 4.7423, "mean_token_accuracy": 0.2289646103978157, "num_tokens": 89357648.0, "step": 51515 }, { "entropy": 5.420944738388061, "epoch": 4.008403034429099, "grad_norm": 1.125, "learning_rate": 0.00034710163506201247, "loss": 4.8851, "mean_token_accuracy": 0.21347897052764891, "num_tokens": 89366168.0, "step": 51520 }, { "entropy": 5.285510778427124, "epoch": 4.008792063800817, "grad_norm": 1.125, "learning_rate": 0.00034707538051303316, "loss": 4.6728, "mean_token_accuracy": 0.2204428121447563, "num_tokens": 89374314.0, "step": 51525 }, { "entropy": 5.372182559967041, "epoch": 4.0091810931725345, "grad_norm": 1.1640625, "learning_rate": 0.0003470491248704247, "loss": 4.8202, "mean_token_accuracy": 0.21968117654323577, "num_tokens": 89383377.0, "step": 51530 }, { "entropy": 5.414815950393677, "epoch": 4.009570122544252, "grad_norm": 1.1328125, "learning_rate": 0.00034702286813458543, "loss": 4.7916, "mean_token_accuracy": 0.21997666656970977, "num_tokens": 89392456.0, "step": 51535 }, { "entropy": 5.4210433006286625, "epoch": 4.00995915191597, "grad_norm": 1.2734375, "learning_rate": 0.00034699661030591374, "loss": 4.9036, "mean_token_accuracy": 0.21345265507698058, "num_tokens": 89401398.0, "step": 51540 }, { "entropy": 5.460687255859375, "epoch": 4.0103481812876876, "grad_norm": 1.203125, "learning_rate": 0.0003469703513848081, "loss": 4.8225, "mean_token_accuracy": 0.21796278953552245, "num_tokens": 89411138.0, "step": 51545 }, { "entropy": 5.348271608352661, "epoch": 4.010737210659404, "grad_norm": 1.1875, "learning_rate": 0.000346944091371667, "loss": 4.7235, "mean_token_accuracy": 0.22763839215040207, "num_tokens": 89420121.0, "step": 51550 }, { "entropy": 5.410749769210815, "epoch": 4.011126240031122, "grad_norm": 1.1484375, "learning_rate": 0.0003469178302668888, "loss": 4.8223, "mean_token_accuracy": 0.20881318002939225, "num_tokens": 89429381.0, "step": 51555 }, { "entropy": 5.349842977523804, "epoch": 4.01151526940284, "grad_norm": 1.1015625, "learning_rate": 0.0003468915680708719, "loss": 4.806, "mean_token_accuracy": 0.22515250444412233, "num_tokens": 89438658.0, "step": 51560 }, { "entropy": 5.353598499298096, "epoch": 4.0119042987745575, "grad_norm": 1.1640625, "learning_rate": 0.000346865304784015, "loss": 4.7728, "mean_token_accuracy": 0.21572664976119996, "num_tokens": 89447336.0, "step": 51565 }, { "entropy": 5.344105005264282, "epoch": 4.012293328146275, "grad_norm": 1.1171875, "learning_rate": 0.0003468390404067164, "loss": 4.6714, "mean_token_accuracy": 0.2243387967348099, "num_tokens": 89456006.0, "step": 51570 }, { "entropy": 5.423496532440185, "epoch": 4.012682357517993, "grad_norm": 1.0625, "learning_rate": 0.0003468127749393747, "loss": 4.8228, "mean_token_accuracy": 0.21916327029466628, "num_tokens": 89465238.0, "step": 51575 }, { "entropy": 5.405986309051514, "epoch": 4.0130713868897105, "grad_norm": 1.0859375, "learning_rate": 0.0003467865083823885, "loss": 4.8664, "mean_token_accuracy": 0.2188045084476471, "num_tokens": 89474969.0, "step": 51580 }, { "entropy": 5.360036849975586, "epoch": 4.013460416261427, "grad_norm": 1.078125, "learning_rate": 0.0003467602407361563, "loss": 4.7646, "mean_token_accuracy": 0.21831746846437455, "num_tokens": 89483678.0, "step": 51585 }, { "entropy": 5.331708669662476, "epoch": 4.013849445633145, "grad_norm": 1.1875, "learning_rate": 0.00034673397200107663, "loss": 4.7415, "mean_token_accuracy": 0.22091909348964692, "num_tokens": 89492640.0, "step": 51590 }, { "entropy": 5.357826995849609, "epoch": 4.014238475004863, "grad_norm": 1.1875, "learning_rate": 0.0003467077021775481, "loss": 4.7211, "mean_token_accuracy": 0.22746371626853942, "num_tokens": 89500771.0, "step": 51595 }, { "entropy": 5.39482011795044, "epoch": 4.0146275043765804, "grad_norm": 1.1953125, "learning_rate": 0.00034668143126596933, "loss": 4.8235, "mean_token_accuracy": 0.21425239443778993, "num_tokens": 89509182.0, "step": 51600 }, { "entropy": 5.3698913097381595, "epoch": 4.015016533748298, "grad_norm": 1.1875, "learning_rate": 0.00034665515926673903, "loss": 4.7326, "mean_token_accuracy": 0.22454380840063096, "num_tokens": 89517747.0, "step": 51605 }, { "entropy": 5.458690452575683, "epoch": 4.015405563120016, "grad_norm": 1.0703125, "learning_rate": 0.0003466288861802556, "loss": 4.8742, "mean_token_accuracy": 0.20842254310846328, "num_tokens": 89527386.0, "step": 51610 }, { "entropy": 5.416431140899658, "epoch": 4.0157945924917335, "grad_norm": 1.1640625, "learning_rate": 0.0003466026120069179, "loss": 4.7325, "mean_token_accuracy": 0.22741924226284027, "num_tokens": 89537116.0, "step": 51615 }, { "entropy": 5.391231489181519, "epoch": 4.01618362186345, "grad_norm": 1.1796875, "learning_rate": 0.0003465763367471245, "loss": 4.8135, "mean_token_accuracy": 0.22424491196870805, "num_tokens": 89545725.0, "step": 51620 }, { "entropy": 5.360003852844239, "epoch": 4.016572651235168, "grad_norm": 1.1953125, "learning_rate": 0.00034655006040127415, "loss": 4.7459, "mean_token_accuracy": 0.22644126117229463, "num_tokens": 89554055.0, "step": 51625 }, { "entropy": 5.381274461746216, "epoch": 4.016961680606886, "grad_norm": 1.21875, "learning_rate": 0.0003465237829697655, "loss": 4.7756, "mean_token_accuracy": 0.22149696201086044, "num_tokens": 89563438.0, "step": 51630 }, { "entropy": 5.368740367889404, "epoch": 4.017350709978603, "grad_norm": 1.21875, "learning_rate": 0.00034649750445299725, "loss": 4.7963, "mean_token_accuracy": 0.22239546626806259, "num_tokens": 89571847.0, "step": 51635 }, { "entropy": 5.42005934715271, "epoch": 4.017739739350321, "grad_norm": 1.2578125, "learning_rate": 0.0003464712248513682, "loss": 4.8972, "mean_token_accuracy": 0.21729420721530915, "num_tokens": 89581295.0, "step": 51640 }, { "entropy": 5.393592882156372, "epoch": 4.018128768722039, "grad_norm": 1.125, "learning_rate": 0.0003464449441652771, "loss": 4.7141, "mean_token_accuracy": 0.22602360397577287, "num_tokens": 89590029.0, "step": 51645 }, { "entropy": 5.368975257873535, "epoch": 4.018517798093756, "grad_norm": 1.2265625, "learning_rate": 0.0003464186623951227, "loss": 4.7423, "mean_token_accuracy": 0.21539913415908812, "num_tokens": 89598508.0, "step": 51650 }, { "entropy": 5.4092296123504635, "epoch": 4.018906827465473, "grad_norm": 1.203125, "learning_rate": 0.0003463923795413037, "loss": 4.8519, "mean_token_accuracy": 0.21575629562139512, "num_tokens": 89607199.0, "step": 51655 }, { "entropy": 5.349124622344971, "epoch": 4.019295856837191, "grad_norm": 1.125, "learning_rate": 0.00034636609560421906, "loss": 4.7666, "mean_token_accuracy": 0.22525476664304733, "num_tokens": 89616048.0, "step": 51660 }, { "entropy": 5.341390657424927, "epoch": 4.019684886208909, "grad_norm": 1.25, "learning_rate": 0.00034633981058426744, "loss": 4.7437, "mean_token_accuracy": 0.22339099794626235, "num_tokens": 89624652.0, "step": 51665 }, { "entropy": 5.380967617034912, "epoch": 4.020073915580626, "grad_norm": 1.15625, "learning_rate": 0.0003463135244818477, "loss": 4.7328, "mean_token_accuracy": 0.222388331592083, "num_tokens": 89633132.0, "step": 51670 }, { "entropy": 5.266452074050903, "epoch": 4.020462944952344, "grad_norm": 1.171875, "learning_rate": 0.0003462872372973588, "loss": 4.7421, "mean_token_accuracy": 0.2155402272939682, "num_tokens": 89641590.0, "step": 51675 }, { "entropy": 5.4299884796142575, "epoch": 4.020851974324062, "grad_norm": 1.1484375, "learning_rate": 0.0003462609490311996, "loss": 4.8594, "mean_token_accuracy": 0.21134717166423797, "num_tokens": 89650269.0, "step": 51680 }, { "entropy": 5.41226978302002, "epoch": 4.021241003695779, "grad_norm": 1.21875, "learning_rate": 0.0003462346596837689, "loss": 4.7661, "mean_token_accuracy": 0.22699035406112672, "num_tokens": 89658493.0, "step": 51685 }, { "entropy": 5.371568489074707, "epoch": 4.021630033067496, "grad_norm": 1.328125, "learning_rate": 0.0003462083692554655, "loss": 4.6814, "mean_token_accuracy": 0.2242964118719101, "num_tokens": 89667128.0, "step": 51690 }, { "entropy": 5.345443916320801, "epoch": 4.022019062439214, "grad_norm": 1.1484375, "learning_rate": 0.00034618207774668854, "loss": 4.8148, "mean_token_accuracy": 0.21781099289655687, "num_tokens": 89675728.0, "step": 51695 }, { "entropy": 5.363828516006469, "epoch": 4.022408091810932, "grad_norm": 1.125, "learning_rate": 0.00034615578515783687, "loss": 4.7548, "mean_token_accuracy": 0.2261461451649666, "num_tokens": 89683392.0, "step": 51700 }, { "entropy": 5.3925196647644045, "epoch": 4.022797121182649, "grad_norm": 1.09375, "learning_rate": 0.00034612949148930935, "loss": 4.7678, "mean_token_accuracy": 0.2247040182352066, "num_tokens": 89691541.0, "step": 51705 }, { "entropy": 5.3680929183959964, "epoch": 4.023186150554367, "grad_norm": 1.1484375, "learning_rate": 0.000346103196741505, "loss": 4.7251, "mean_token_accuracy": 0.2261888012290001, "num_tokens": 89700445.0, "step": 51710 }, { "entropy": 5.372253704071045, "epoch": 4.023575179926085, "grad_norm": 1.3515625, "learning_rate": 0.00034607690091482284, "loss": 4.7574, "mean_token_accuracy": 0.21877697110176086, "num_tokens": 89708902.0, "step": 51715 }, { "entropy": 5.305436992645264, "epoch": 4.023964209297802, "grad_norm": 1.1796875, "learning_rate": 0.0003460506040096619, "loss": 4.6567, "mean_token_accuracy": 0.2233501300215721, "num_tokens": 89716804.0, "step": 51720 }, { "entropy": 5.340112638473511, "epoch": 4.024353238669519, "grad_norm": 1.1953125, "learning_rate": 0.0003460243060264211, "loss": 4.763, "mean_token_accuracy": 0.22873058915138245, "num_tokens": 89726046.0, "step": 51725 }, { "entropy": 5.324047994613648, "epoch": 4.024742268041237, "grad_norm": 1.0546875, "learning_rate": 0.00034599800696549944, "loss": 4.7215, "mean_token_accuracy": 0.22683578580617905, "num_tokens": 89735106.0, "step": 51730 }, { "entropy": 5.37718710899353, "epoch": 4.025131297412955, "grad_norm": 1.203125, "learning_rate": 0.000345971706827296, "loss": 4.7737, "mean_token_accuracy": 0.21645358353853225, "num_tokens": 89744456.0, "step": 51735 }, { "entropy": 5.377193117141724, "epoch": 4.025520326784672, "grad_norm": 1.3046875, "learning_rate": 0.00034594540561221, "loss": 4.8117, "mean_token_accuracy": 0.220954991877079, "num_tokens": 89753179.0, "step": 51740 }, { "entropy": 5.339804601669312, "epoch": 4.02590935615639, "grad_norm": 1.125, "learning_rate": 0.00034591910332064027, "loss": 4.7814, "mean_token_accuracy": 0.22279227524995804, "num_tokens": 89762063.0, "step": 51745 }, { "entropy": 5.408343887329101, "epoch": 4.026298385528108, "grad_norm": 1.1484375, "learning_rate": 0.0003458927999529861, "loss": 4.831, "mean_token_accuracy": 0.21686457395553588, "num_tokens": 89770501.0, "step": 51750 }, { "entropy": 5.429909753799438, "epoch": 4.026687414899825, "grad_norm": 1.0859375, "learning_rate": 0.00034586649550964656, "loss": 4.7762, "mean_token_accuracy": 0.21429161876440048, "num_tokens": 89778921.0, "step": 51755 }, { "entropy": 5.431669473648071, "epoch": 4.027076444271542, "grad_norm": 1.1640625, "learning_rate": 0.00034584018999102073, "loss": 4.7999, "mean_token_accuracy": 0.21284226030111314, "num_tokens": 89786663.0, "step": 51760 }, { "entropy": 5.41167106628418, "epoch": 4.02746547364326, "grad_norm": 1.1171875, "learning_rate": 0.00034581388339750775, "loss": 4.8063, "mean_token_accuracy": 0.21779376417398452, "num_tokens": 89795614.0, "step": 51765 }, { "entropy": 5.333299350738526, "epoch": 4.027854503014978, "grad_norm": 1.171875, "learning_rate": 0.0003457875757295067, "loss": 4.6423, "mean_token_accuracy": 0.22810730040073396, "num_tokens": 89804145.0, "step": 51770 }, { "entropy": 5.377498388290405, "epoch": 4.028243532386695, "grad_norm": 1.203125, "learning_rate": 0.00034576126698741697, "loss": 4.739, "mean_token_accuracy": 0.21500207334756852, "num_tokens": 89812229.0, "step": 51775 }, { "entropy": 5.352486848831177, "epoch": 4.028632561758413, "grad_norm": 1.234375, "learning_rate": 0.0003457349571716376, "loss": 4.7681, "mean_token_accuracy": 0.22426032721996308, "num_tokens": 89820665.0, "step": 51780 }, { "entropy": 5.344851875305176, "epoch": 4.02902159113013, "grad_norm": 1.171875, "learning_rate": 0.00034570864628256795, "loss": 4.693, "mean_token_accuracy": 0.22825457155704498, "num_tokens": 89829219.0, "step": 51785 }, { "entropy": 5.333939695358277, "epoch": 4.029410620501848, "grad_norm": 1.1796875, "learning_rate": 0.00034568233432060705, "loss": 4.6858, "mean_token_accuracy": 0.22687558233737945, "num_tokens": 89837059.0, "step": 51790 }, { "entropy": 5.3606898307800295, "epoch": 4.029799649873565, "grad_norm": 1.1953125, "learning_rate": 0.0003456560212861543, "loss": 4.7914, "mean_token_accuracy": 0.2176296055316925, "num_tokens": 89845431.0, "step": 51795 }, { "entropy": 5.4825756549835205, "epoch": 4.030188679245283, "grad_norm": 1.203125, "learning_rate": 0.0003456297071796087, "loss": 4.9273, "mean_token_accuracy": 0.21746211498975754, "num_tokens": 89854602.0, "step": 51800 }, { "entropy": 5.295718479156494, "epoch": 4.030577708617001, "grad_norm": 1.2109375, "learning_rate": 0.00034560339200136983, "loss": 4.648, "mean_token_accuracy": 0.2252985119819641, "num_tokens": 89863156.0, "step": 51805 }, { "entropy": 5.360506677627564, "epoch": 4.030966737988718, "grad_norm": 1.203125, "learning_rate": 0.00034557707575183684, "loss": 4.758, "mean_token_accuracy": 0.22467788308858871, "num_tokens": 89872484.0, "step": 51810 }, { "entropy": 5.456721258163452, "epoch": 4.031355767360436, "grad_norm": 1.171875, "learning_rate": 0.00034555075843140917, "loss": 4.7935, "mean_token_accuracy": 0.22436410039663315, "num_tokens": 89880955.0, "step": 51815 }, { "entropy": 5.400187301635742, "epoch": 4.031744796732153, "grad_norm": 1.2578125, "learning_rate": 0.00034552444004048587, "loss": 4.7822, "mean_token_accuracy": 0.21881779581308364, "num_tokens": 89889025.0, "step": 51820 }, { "entropy": 5.370055198669434, "epoch": 4.032133826103871, "grad_norm": 1.234375, "learning_rate": 0.00034549812057946657, "loss": 4.7721, "mean_token_accuracy": 0.2208339214324951, "num_tokens": 89897319.0, "step": 51825 }, { "entropy": 5.323062372207642, "epoch": 4.032522855475588, "grad_norm": 1.109375, "learning_rate": 0.0003454718000487505, "loss": 4.718, "mean_token_accuracy": 0.23115455806255342, "num_tokens": 89905821.0, "step": 51830 }, { "entropy": 5.426640844345092, "epoch": 4.032911884847306, "grad_norm": 1.296875, "learning_rate": 0.0003454454784487369, "loss": 4.7817, "mean_token_accuracy": 0.22063681930303575, "num_tokens": 89913982.0, "step": 51835 }, { "entropy": 5.419381141662598, "epoch": 4.033300914219024, "grad_norm": 1.1640625, "learning_rate": 0.0003454191557798254, "loss": 4.7784, "mean_token_accuracy": 0.22214216738939285, "num_tokens": 89923237.0, "step": 51840 }, { "entropy": 5.390461397171021, "epoch": 4.033689943590741, "grad_norm": 1.1875, "learning_rate": 0.00034539283204241525, "loss": 4.8247, "mean_token_accuracy": 0.218178454041481, "num_tokens": 89932836.0, "step": 51845 }, { "entropy": 5.399798345565796, "epoch": 4.034078972962459, "grad_norm": 1.125, "learning_rate": 0.00034536650723690596, "loss": 4.7204, "mean_token_accuracy": 0.22843819707632065, "num_tokens": 89941585.0, "step": 51850 }, { "entropy": 5.276509380340576, "epoch": 4.034468002334176, "grad_norm": 1.109375, "learning_rate": 0.00034534018136369687, "loss": 4.6914, "mean_token_accuracy": 0.22913856208324432, "num_tokens": 89950561.0, "step": 51855 }, { "entropy": 5.333795595169067, "epoch": 4.034857031705894, "grad_norm": 1.109375, "learning_rate": 0.0003453138544231875, "loss": 4.7551, "mean_token_accuracy": 0.22338641285896302, "num_tokens": 89959471.0, "step": 51860 }, { "entropy": 5.373469829559326, "epoch": 4.035246061077611, "grad_norm": 1.15625, "learning_rate": 0.0003452875264157774, "loss": 4.7661, "mean_token_accuracy": 0.21219884157180785, "num_tokens": 89967394.0, "step": 51865 }, { "entropy": 5.357634162902832, "epoch": 4.035635090449329, "grad_norm": 1.203125, "learning_rate": 0.00034526119734186586, "loss": 4.7573, "mean_token_accuracy": 0.2217332974076271, "num_tokens": 89975074.0, "step": 51870 }, { "entropy": 5.34039716720581, "epoch": 4.036024119821047, "grad_norm": 1.1640625, "learning_rate": 0.00034523486720185246, "loss": 4.7464, "mean_token_accuracy": 0.2247933715581894, "num_tokens": 89983353.0, "step": 51875 }, { "entropy": 5.352906131744385, "epoch": 4.036413149192764, "grad_norm": 1.25, "learning_rate": 0.00034520853599613675, "loss": 4.8253, "mean_token_accuracy": 0.2196851924061775, "num_tokens": 89991982.0, "step": 51880 }, { "entropy": 5.2764379501342775, "epoch": 4.036802178564481, "grad_norm": 1.171875, "learning_rate": 0.00034518220372511835, "loss": 4.6973, "mean_token_accuracy": 0.2330554708838463, "num_tokens": 90000804.0, "step": 51885 }, { "entropy": 5.371105432510376, "epoch": 4.037191207936199, "grad_norm": 1.1484375, "learning_rate": 0.0003451558703891967, "loss": 4.7999, "mean_token_accuracy": 0.2268224135041237, "num_tokens": 90009500.0, "step": 51890 }, { "entropy": 5.4443882465362545, "epoch": 4.037580237307917, "grad_norm": 1.1875, "learning_rate": 0.0003451295359887713, "loss": 4.7912, "mean_token_accuracy": 0.21527750343084334, "num_tokens": 90017753.0, "step": 51895 }, { "entropy": 5.282799100875854, "epoch": 4.037969266679634, "grad_norm": 1.078125, "learning_rate": 0.0003451032005242418, "loss": 4.6201, "mean_token_accuracy": 0.2321004018187523, "num_tokens": 90027475.0, "step": 51900 }, { "entropy": 5.378875684738159, "epoch": 4.038358296051352, "grad_norm": 1.1953125, "learning_rate": 0.00034507686399600786, "loss": 4.8012, "mean_token_accuracy": 0.2131760910153389, "num_tokens": 90035510.0, "step": 51905 }, { "entropy": 5.3661887645721436, "epoch": 4.03874732542307, "grad_norm": 1.1796875, "learning_rate": 0.00034505052640446907, "loss": 4.745, "mean_token_accuracy": 0.22031114548444747, "num_tokens": 90043858.0, "step": 51910 }, { "entropy": 5.422360420227051, "epoch": 4.039136354794787, "grad_norm": 1.21875, "learning_rate": 0.000345024187750025, "loss": 4.9155, "mean_token_accuracy": 0.21772330701351167, "num_tokens": 90052361.0, "step": 51915 }, { "entropy": 5.372708034515381, "epoch": 4.039525384166504, "grad_norm": 1.171875, "learning_rate": 0.00034499784803307534, "loss": 4.7604, "mean_token_accuracy": 0.22407192289829253, "num_tokens": 90060856.0, "step": 51920 }, { "entropy": 5.409184503555298, "epoch": 4.039914413538222, "grad_norm": 1.1875, "learning_rate": 0.0003449715072540198, "loss": 4.7884, "mean_token_accuracy": 0.2158753827214241, "num_tokens": 90069452.0, "step": 51925 }, { "entropy": 5.34556212425232, "epoch": 4.04030344290994, "grad_norm": 1.171875, "learning_rate": 0.00034494516541325795, "loss": 4.7443, "mean_token_accuracy": 0.2192401483654976, "num_tokens": 90078077.0, "step": 51930 }, { "entropy": 5.3824131965637205, "epoch": 4.040692472281657, "grad_norm": 1.203125, "learning_rate": 0.0003449188225111895, "loss": 4.8016, "mean_token_accuracy": 0.21611636132001877, "num_tokens": 90087492.0, "step": 51935 }, { "entropy": 5.353448343276978, "epoch": 4.041081501653375, "grad_norm": 1.1875, "learning_rate": 0.00034489247854821426, "loss": 4.7526, "mean_token_accuracy": 0.225431627035141, "num_tokens": 90095988.0, "step": 51940 }, { "entropy": 5.342483568191528, "epoch": 4.041470531025093, "grad_norm": 1.0859375, "learning_rate": 0.00034486613352473195, "loss": 4.8083, "mean_token_accuracy": 0.23163609057664872, "num_tokens": 90105135.0, "step": 51945 }, { "entropy": 5.344291925430298, "epoch": 4.04185956039681, "grad_norm": 1.2265625, "learning_rate": 0.00034483978744114224, "loss": 4.7672, "mean_token_accuracy": 0.21563464254140854, "num_tokens": 90113800.0, "step": 51950 }, { "entropy": 5.428956460952759, "epoch": 4.042248589768527, "grad_norm": 1.21875, "learning_rate": 0.0003448134402978449, "loss": 4.8313, "mean_token_accuracy": 0.22251420170068742, "num_tokens": 90121828.0, "step": 51955 }, { "entropy": 5.4242266654968265, "epoch": 4.042637619140245, "grad_norm": 1.1875, "learning_rate": 0.00034478709209523974, "loss": 4.7672, "mean_token_accuracy": 0.22554436773061753, "num_tokens": 90129688.0, "step": 51960 }, { "entropy": 5.393194580078125, "epoch": 4.043026648511963, "grad_norm": 1.1875, "learning_rate": 0.0003447607428337265, "loss": 4.7746, "mean_token_accuracy": 0.21797650009393693, "num_tokens": 90138282.0, "step": 51965 }, { "entropy": 5.401811408996582, "epoch": 4.04341567788368, "grad_norm": 1.1015625, "learning_rate": 0.00034473439251370505, "loss": 4.8303, "mean_token_accuracy": 0.22346438318490983, "num_tokens": 90147356.0, "step": 51970 }, { "entropy": 5.399550580978394, "epoch": 4.043804707255398, "grad_norm": 1.203125, "learning_rate": 0.0003447080411355752, "loss": 4.8585, "mean_token_accuracy": 0.21167974472045897, "num_tokens": 90156135.0, "step": 51975 }, { "entropy": 5.394518232345581, "epoch": 4.044193736627116, "grad_norm": 1.140625, "learning_rate": 0.00034468168869973673, "loss": 4.8047, "mean_token_accuracy": 0.21095367819070815, "num_tokens": 90164691.0, "step": 51980 }, { "entropy": 5.352939939498901, "epoch": 4.0445827659988325, "grad_norm": 1.2109375, "learning_rate": 0.00034465533520658967, "loss": 4.7561, "mean_token_accuracy": 0.2213965818285942, "num_tokens": 90173258.0, "step": 51985 }, { "entropy": 5.370508098602295, "epoch": 4.04497179537055, "grad_norm": 1.15625, "learning_rate": 0.00034462898065653366, "loss": 4.7769, "mean_token_accuracy": 0.22174972742795945, "num_tokens": 90182228.0, "step": 51990 }, { "entropy": 5.365706586837769, "epoch": 4.045360824742268, "grad_norm": 1.0859375, "learning_rate": 0.0003446026250499687, "loss": 4.7344, "mean_token_accuracy": 0.22278038859367372, "num_tokens": 90191046.0, "step": 51995 }, { "entropy": 5.374742317199707, "epoch": 4.045749854113986, "grad_norm": 1.171875, "learning_rate": 0.0003445762683872946, "loss": 4.7289, "mean_token_accuracy": 0.2245160937309265, "num_tokens": 90200201.0, "step": 52000 }, { "entropy": 5.435004615783692, "epoch": 4.046138883485703, "grad_norm": 1.1796875, "learning_rate": 0.0003445499106689115, "loss": 4.8033, "mean_token_accuracy": 0.21891851276159285, "num_tokens": 90209817.0, "step": 52005 }, { "entropy": 5.3787538528442385, "epoch": 4.046527912857421, "grad_norm": 1.3515625, "learning_rate": 0.00034452355189521915, "loss": 4.8306, "mean_token_accuracy": 0.21442177295684814, "num_tokens": 90219560.0, "step": 52010 }, { "entropy": 5.410332155227661, "epoch": 4.046916942229139, "grad_norm": 1.15625, "learning_rate": 0.0003444971920666176, "loss": 4.8281, "mean_token_accuracy": 0.21440242379903793, "num_tokens": 90228549.0, "step": 52015 }, { "entropy": 5.389546060562134, "epoch": 4.0473059716008555, "grad_norm": 1.109375, "learning_rate": 0.0003444708311835068, "loss": 4.766, "mean_token_accuracy": 0.21882151961326599, "num_tokens": 90237415.0, "step": 52020 }, { "entropy": 5.278520250320435, "epoch": 4.047695000972573, "grad_norm": 1.234375, "learning_rate": 0.00034444446924628664, "loss": 4.6638, "mean_token_accuracy": 0.23016985058784484, "num_tokens": 90246546.0, "step": 52025 }, { "entropy": 5.330224514007568, "epoch": 4.048084030344291, "grad_norm": 1.3046875, "learning_rate": 0.00034441810625535725, "loss": 4.8432, "mean_token_accuracy": 0.211902217566967, "num_tokens": 90254657.0, "step": 52030 }, { "entropy": 5.352524185180664, "epoch": 4.048473059716009, "grad_norm": 1.2890625, "learning_rate": 0.0003443917422111185, "loss": 4.7261, "mean_token_accuracy": 0.22042022943496703, "num_tokens": 90263760.0, "step": 52035 }, { "entropy": 5.380495691299439, "epoch": 4.048862089087726, "grad_norm": 1.125, "learning_rate": 0.00034436537711397054, "loss": 4.7062, "mean_token_accuracy": 0.23094047158956527, "num_tokens": 90272483.0, "step": 52040 }, { "entropy": 5.2680768966674805, "epoch": 4.049251118459444, "grad_norm": 1.2421875, "learning_rate": 0.0003443390109643134, "loss": 4.6678, "mean_token_accuracy": 0.22946900874376297, "num_tokens": 90280789.0, "step": 52045 }, { "entropy": 5.279154491424561, "epoch": 4.049640147831162, "grad_norm": 1.1796875, "learning_rate": 0.0003443126437625472, "loss": 4.7905, "mean_token_accuracy": 0.2201910838484764, "num_tokens": 90289511.0, "step": 52050 }, { "entropy": 5.324139785766602, "epoch": 4.0500291772028785, "grad_norm": 1.0859375, "learning_rate": 0.0003442862755090719, "loss": 4.7942, "mean_token_accuracy": 0.21852817982435227, "num_tokens": 90298716.0, "step": 52055 }, { "entropy": 5.397677564620972, "epoch": 4.050418206574596, "grad_norm": 1.140625, "learning_rate": 0.00034425990620428763, "loss": 4.7247, "mean_token_accuracy": 0.22933153808116913, "num_tokens": 90307072.0, "step": 52060 }, { "entropy": 5.374121379852295, "epoch": 4.050807235946314, "grad_norm": 1.15625, "learning_rate": 0.0003442335358485946, "loss": 4.7779, "mean_token_accuracy": 0.22530280202627181, "num_tokens": 90315388.0, "step": 52065 }, { "entropy": 5.418425369262695, "epoch": 4.051196265318032, "grad_norm": 1.09375, "learning_rate": 0.0003442071644423928, "loss": 4.8146, "mean_token_accuracy": 0.21885016113519667, "num_tokens": 90323858.0, "step": 52070 }, { "entropy": 5.371873235702514, "epoch": 4.051585294689749, "grad_norm": 1.21875, "learning_rate": 0.0003441807919860824, "loss": 4.8161, "mean_token_accuracy": 0.2153049737215042, "num_tokens": 90332425.0, "step": 52075 }, { "entropy": 5.423493957519531, "epoch": 4.051974324061467, "grad_norm": 1.1640625, "learning_rate": 0.00034415441848006364, "loss": 4.816, "mean_token_accuracy": 0.2210131138563156, "num_tokens": 90340982.0, "step": 52080 }, { "entropy": 5.348751974105835, "epoch": 4.052363353433184, "grad_norm": 1.1796875, "learning_rate": 0.00034412804392473665, "loss": 4.72, "mean_token_accuracy": 0.224295973777771, "num_tokens": 90348876.0, "step": 52085 }, { "entropy": 5.307561922073364, "epoch": 4.0527523828049015, "grad_norm": 1.109375, "learning_rate": 0.0003441016683205016, "loss": 4.6865, "mean_token_accuracy": 0.22735846489667894, "num_tokens": 90357531.0, "step": 52090 }, { "entropy": 5.412411785125732, "epoch": 4.053141412176619, "grad_norm": 1.171875, "learning_rate": 0.00034407529166775874, "loss": 4.8784, "mean_token_accuracy": 0.2177929922938347, "num_tokens": 90365542.0, "step": 52095 }, { "entropy": 5.419761800765992, "epoch": 4.053530441548337, "grad_norm": 1.1875, "learning_rate": 0.0003440489139669083, "loss": 4.7881, "mean_token_accuracy": 0.22033295035362244, "num_tokens": 90374295.0, "step": 52100 }, { "entropy": 5.401559162139892, "epoch": 4.053919470920055, "grad_norm": 1.1171875, "learning_rate": 0.00034402253521835036, "loss": 4.7802, "mean_token_accuracy": 0.21651293188333512, "num_tokens": 90382605.0, "step": 52105 }, { "entropy": 5.3376569747924805, "epoch": 4.054308500291772, "grad_norm": 1.1015625, "learning_rate": 0.0003439961554224855, "loss": 4.7504, "mean_token_accuracy": 0.21553211361169816, "num_tokens": 90391220.0, "step": 52110 }, { "entropy": 5.328606653213501, "epoch": 4.05469752966349, "grad_norm": 1.1328125, "learning_rate": 0.0003439697745797137, "loss": 4.7286, "mean_token_accuracy": 0.2215635061264038, "num_tokens": 90398986.0, "step": 52115 }, { "entropy": 5.3276190757751465, "epoch": 4.055086559035207, "grad_norm": 1.0703125, "learning_rate": 0.00034394339269043533, "loss": 4.7711, "mean_token_accuracy": 0.21543273627758025, "num_tokens": 90407671.0, "step": 52120 }, { "entropy": 5.425623989105224, "epoch": 4.0554755884069245, "grad_norm": 1.171875, "learning_rate": 0.0003439170097550507, "loss": 4.8233, "mean_token_accuracy": 0.21875323951244355, "num_tokens": 90416184.0, "step": 52125 }, { "entropy": 5.393656826019287, "epoch": 4.055864617778642, "grad_norm": 1.1875, "learning_rate": 0.0003438906257739602, "loss": 4.7627, "mean_token_accuracy": 0.2208339527249336, "num_tokens": 90424992.0, "step": 52130 }, { "entropy": 5.330661869049072, "epoch": 4.05625364715036, "grad_norm": 1.125, "learning_rate": 0.0003438642407475641, "loss": 4.751, "mean_token_accuracy": 0.22340321242809297, "num_tokens": 90433802.0, "step": 52135 }, { "entropy": 5.35253119468689, "epoch": 4.0566426765220776, "grad_norm": 1.1796875, "learning_rate": 0.0003438378546762627, "loss": 4.8403, "mean_token_accuracy": 0.22153252959251404, "num_tokens": 90441831.0, "step": 52140 }, { "entropy": 5.432820081710815, "epoch": 4.057031705893795, "grad_norm": 1.1875, "learning_rate": 0.0003438114675604565, "loss": 4.7716, "mean_token_accuracy": 0.21511563062667846, "num_tokens": 90450327.0, "step": 52145 }, { "entropy": 5.429895305633545, "epoch": 4.057420735265513, "grad_norm": 1.15625, "learning_rate": 0.0003437850794005457, "loss": 4.7517, "mean_token_accuracy": 0.21933069527149202, "num_tokens": 90459012.0, "step": 52150 }, { "entropy": 5.388191986083984, "epoch": 4.05780976463723, "grad_norm": 1.1796875, "learning_rate": 0.0003437586901969309, "loss": 4.7638, "mean_token_accuracy": 0.22187469899654388, "num_tokens": 90467296.0, "step": 52155 }, { "entropy": 5.310207080841065, "epoch": 4.0581987940089475, "grad_norm": 1.1875, "learning_rate": 0.0003437322999500124, "loss": 4.7904, "mean_token_accuracy": 0.22073110342025756, "num_tokens": 90475953.0, "step": 52160 }, { "entropy": 5.376143503189087, "epoch": 4.058587823380665, "grad_norm": 1.15625, "learning_rate": 0.00034370590866019063, "loss": 4.7787, "mean_token_accuracy": 0.2197295218706131, "num_tokens": 90483562.0, "step": 52165 }, { "entropy": 5.386682224273682, "epoch": 4.058976852752383, "grad_norm": 1.1875, "learning_rate": 0.000343679516327866, "loss": 4.8061, "mean_token_accuracy": 0.21905774623155594, "num_tokens": 90491479.0, "step": 52170 }, { "entropy": 5.352588415145874, "epoch": 4.0593658821241005, "grad_norm": 1.125, "learning_rate": 0.0003436531229534391, "loss": 4.7613, "mean_token_accuracy": 0.2201991781592369, "num_tokens": 90499674.0, "step": 52175 }, { "entropy": 5.270554113388061, "epoch": 4.059754911495818, "grad_norm": 1.1484375, "learning_rate": 0.0003436267285373103, "loss": 4.6855, "mean_token_accuracy": 0.22640990167856218, "num_tokens": 90508453.0, "step": 52180 }, { "entropy": 5.3475282192230225, "epoch": 4.060143940867536, "grad_norm": 1.171875, "learning_rate": 0.00034360033307988014, "loss": 4.7079, "mean_token_accuracy": 0.2266128733754158, "num_tokens": 90516698.0, "step": 52185 }, { "entropy": 5.358474397659302, "epoch": 4.060532970239253, "grad_norm": 1.171875, "learning_rate": 0.00034357393658154914, "loss": 4.7585, "mean_token_accuracy": 0.21921961307525634, "num_tokens": 90525260.0, "step": 52190 }, { "entropy": 5.394729471206665, "epoch": 4.0609219996109704, "grad_norm": 1.34375, "learning_rate": 0.0003435475390427178, "loss": 4.8099, "mean_token_accuracy": 0.22491785287857055, "num_tokens": 90534468.0, "step": 52195 }, { "entropy": 5.300397253036499, "epoch": 4.061311028982688, "grad_norm": 1.203125, "learning_rate": 0.00034352114046378655, "loss": 4.698, "mean_token_accuracy": 0.22872281819581985, "num_tokens": 90543559.0, "step": 52200 }, { "entropy": 5.439226150512695, "epoch": 4.061700058354406, "grad_norm": 1.2109375, "learning_rate": 0.00034349474084515607, "loss": 4.8764, "mean_token_accuracy": 0.21539284586906432, "num_tokens": 90552161.0, "step": 52205 }, { "entropy": 5.408782911300659, "epoch": 4.0620890877261235, "grad_norm": 1.1953125, "learning_rate": 0.00034346834018722706, "loss": 4.8167, "mean_token_accuracy": 0.21707588732242583, "num_tokens": 90560175.0, "step": 52210 }, { "entropy": 5.357005310058594, "epoch": 4.062478117097841, "grad_norm": 1.1484375, "learning_rate": 0.00034344193849039997, "loss": 4.7726, "mean_token_accuracy": 0.2200980708003044, "num_tokens": 90569791.0, "step": 52215 }, { "entropy": 5.315792036056519, "epoch": 4.062867146469558, "grad_norm": 1.171875, "learning_rate": 0.0003434155357550753, "loss": 4.7357, "mean_token_accuracy": 0.21849081963300704, "num_tokens": 90578407.0, "step": 52220 }, { "entropy": 5.37729549407959, "epoch": 4.063256175841276, "grad_norm": 1.1484375, "learning_rate": 0.00034338913198165373, "loss": 4.7488, "mean_token_accuracy": 0.21839040368795395, "num_tokens": 90586705.0, "step": 52225 }, { "entropy": 5.375359725952149, "epoch": 4.063645205212993, "grad_norm": 1.171875, "learning_rate": 0.000343362727170536, "loss": 4.7409, "mean_token_accuracy": 0.22002536803483963, "num_tokens": 90595766.0, "step": 52230 }, { "entropy": 5.411321210861206, "epoch": 4.064034234584711, "grad_norm": 1.1953125, "learning_rate": 0.0003433363213221227, "loss": 4.791, "mean_token_accuracy": 0.21863074898719786, "num_tokens": 90604550.0, "step": 52235 }, { "entropy": 5.475142478942871, "epoch": 4.064423263956429, "grad_norm": 1.21875, "learning_rate": 0.00034330991443681444, "loss": 4.8815, "mean_token_accuracy": 0.21274033635854722, "num_tokens": 90613070.0, "step": 52240 }, { "entropy": 5.409522628784179, "epoch": 4.0648122933281465, "grad_norm": 1.1328125, "learning_rate": 0.000343283506515012, "loss": 4.8252, "mean_token_accuracy": 0.21623256504535676, "num_tokens": 90623073.0, "step": 52245 }, { "entropy": 5.384593105316162, "epoch": 4.065201322699864, "grad_norm": 1.1640625, "learning_rate": 0.00034325709755711606, "loss": 4.7948, "mean_token_accuracy": 0.22112827003002167, "num_tokens": 90631944.0, "step": 52250 }, { "entropy": 5.312540864944458, "epoch": 4.065590352071581, "grad_norm": 1.078125, "learning_rate": 0.00034323068756352725, "loss": 4.6653, "mean_token_accuracy": 0.22913322001695632, "num_tokens": 90641007.0, "step": 52255 }, { "entropy": 5.4324099063873295, "epoch": 4.065979381443299, "grad_norm": 1.140625, "learning_rate": 0.0003432042765346464, "loss": 4.8906, "mean_token_accuracy": 0.20163841545581818, "num_tokens": 90649628.0, "step": 52260 }, { "entropy": 5.344708204269409, "epoch": 4.066368410815016, "grad_norm": 1.2265625, "learning_rate": 0.0003431778644708742, "loss": 4.7584, "mean_token_accuracy": 0.2204756811261177, "num_tokens": 90658301.0, "step": 52265 }, { "entropy": 5.344548940658569, "epoch": 4.066757440186734, "grad_norm": 1.1640625, "learning_rate": 0.0003431514513726114, "loss": 4.7804, "mean_token_accuracy": 0.22245070934295655, "num_tokens": 90667080.0, "step": 52270 }, { "entropy": 5.3291051387786865, "epoch": 4.067146469558452, "grad_norm": 1.1875, "learning_rate": 0.0003431250372402588, "loss": 4.7805, "mean_token_accuracy": 0.2230556935071945, "num_tokens": 90675658.0, "step": 52275 }, { "entropy": 5.3004528999328615, "epoch": 4.0675354989301695, "grad_norm": 1.125, "learning_rate": 0.00034309862207421724, "loss": 4.7251, "mean_token_accuracy": 0.22948587089776992, "num_tokens": 90684345.0, "step": 52280 }, { "entropy": 5.330675983428955, "epoch": 4.067924528301887, "grad_norm": 1.328125, "learning_rate": 0.00034307220587488743, "loss": 4.7687, "mean_token_accuracy": 0.21936175376176834, "num_tokens": 90693342.0, "step": 52285 }, { "entropy": 5.348571157455444, "epoch": 4.068313557673604, "grad_norm": 1.15625, "learning_rate": 0.00034304578864267026, "loss": 4.6922, "mean_token_accuracy": 0.22144949436187744, "num_tokens": 90701948.0, "step": 52290 }, { "entropy": 5.356941604614258, "epoch": 4.068702587045322, "grad_norm": 1.265625, "learning_rate": 0.00034301937037796654, "loss": 4.7113, "mean_token_accuracy": 0.22795185148715974, "num_tokens": 90710273.0, "step": 52295 }, { "entropy": 5.2557933807373045, "epoch": 4.069091616417039, "grad_norm": 1.15625, "learning_rate": 0.00034299295108117716, "loss": 4.7266, "mean_token_accuracy": 0.22502560913562775, "num_tokens": 90718993.0, "step": 52300 }, { "entropy": 5.340765380859375, "epoch": 4.069480645788757, "grad_norm": 1.265625, "learning_rate": 0.00034296653075270296, "loss": 4.7707, "mean_token_accuracy": 0.22065045386552812, "num_tokens": 90727655.0, "step": 52305 }, { "entropy": 5.355353498458863, "epoch": 4.069869675160475, "grad_norm": 1.2109375, "learning_rate": 0.00034294010939294486, "loss": 4.7511, "mean_token_accuracy": 0.22449631243944168, "num_tokens": 90735512.0, "step": 52310 }, { "entropy": 5.328531408309937, "epoch": 4.0702587045321925, "grad_norm": 1.2109375, "learning_rate": 0.00034291368700230376, "loss": 4.6929, "mean_token_accuracy": 0.23198579698801042, "num_tokens": 90743858.0, "step": 52315 }, { "entropy": 5.435466384887695, "epoch": 4.070647733903909, "grad_norm": 1.2109375, "learning_rate": 0.0003428872635811804, "loss": 4.837, "mean_token_accuracy": 0.20896072685718536, "num_tokens": 90752194.0, "step": 52320 }, { "entropy": 5.345551061630249, "epoch": 4.071036763275627, "grad_norm": 1.1484375, "learning_rate": 0.000342860839129976, "loss": 4.8004, "mean_token_accuracy": 0.21859817653894426, "num_tokens": 90761213.0, "step": 52325 }, { "entropy": 5.322601318359375, "epoch": 4.071425792647345, "grad_norm": 1.140625, "learning_rate": 0.0003428344136490914, "loss": 4.7177, "mean_token_accuracy": 0.2264167070388794, "num_tokens": 90770634.0, "step": 52330 }, { "entropy": 5.380029678344727, "epoch": 4.071814822019062, "grad_norm": 1.140625, "learning_rate": 0.00034280798713892744, "loss": 4.777, "mean_token_accuracy": 0.2196333095431328, "num_tokens": 90779861.0, "step": 52335 }, { "entropy": 5.300431442260742, "epoch": 4.07220385139078, "grad_norm": 1.21875, "learning_rate": 0.0003427815595998853, "loss": 4.667, "mean_token_accuracy": 0.2213229089975357, "num_tokens": 90788773.0, "step": 52340 }, { "entropy": 5.371387481689453, "epoch": 4.072592880762498, "grad_norm": 1.125, "learning_rate": 0.0003427551310323658, "loss": 4.8542, "mean_token_accuracy": 0.21457189321517944, "num_tokens": 90797372.0, "step": 52345 }, { "entropy": 5.396743726730347, "epoch": 4.0729819101342155, "grad_norm": 1.203125, "learning_rate": 0.00034272870143677015, "loss": 4.787, "mean_token_accuracy": 0.21719556748867036, "num_tokens": 90806065.0, "step": 52350 }, { "entropy": 5.430783033370972, "epoch": 4.073370939505932, "grad_norm": 1.1640625, "learning_rate": 0.00034270227081349913, "loss": 4.8275, "mean_token_accuracy": 0.22698843777179717, "num_tokens": 90815531.0, "step": 52355 }, { "entropy": 5.491317224502564, "epoch": 4.07375996887765, "grad_norm": 1.171875, "learning_rate": 0.000342675839162954, "loss": 4.9478, "mean_token_accuracy": 0.2141076698899269, "num_tokens": 90823416.0, "step": 52360 }, { "entropy": 5.445312213897705, "epoch": 4.074148998249368, "grad_norm": 1.109375, "learning_rate": 0.00034264940648553565, "loss": 4.8353, "mean_token_accuracy": 0.21536418199539184, "num_tokens": 90832441.0, "step": 52365 }, { "entropy": 5.267932319641114, "epoch": 4.074538027621085, "grad_norm": 1.171875, "learning_rate": 0.0003426229727816453, "loss": 4.6378, "mean_token_accuracy": 0.2348220467567444, "num_tokens": 90840453.0, "step": 52370 }, { "entropy": 5.374851131439209, "epoch": 4.074927056992803, "grad_norm": 1.1875, "learning_rate": 0.0003425965380516839, "loss": 4.7752, "mean_token_accuracy": 0.22357335835695266, "num_tokens": 90848802.0, "step": 52375 }, { "entropy": 5.33278226852417, "epoch": 4.075316086364521, "grad_norm": 1.1328125, "learning_rate": 0.0003425701022960527, "loss": 4.9172, "mean_token_accuracy": 0.21150824427604675, "num_tokens": 90856950.0, "step": 52380 }, { "entropy": 5.408066129684448, "epoch": 4.0757051157362385, "grad_norm": 1.203125, "learning_rate": 0.00034254366551515276, "loss": 4.778, "mean_token_accuracy": 0.2194082260131836, "num_tokens": 90866100.0, "step": 52385 }, { "entropy": 5.438610649108886, "epoch": 4.076094145107955, "grad_norm": 1.1640625, "learning_rate": 0.0003425172277093852, "loss": 4.8348, "mean_token_accuracy": 0.21268681287765503, "num_tokens": 90875323.0, "step": 52390 }, { "entropy": 5.371421813964844, "epoch": 4.076483174479673, "grad_norm": 1.046875, "learning_rate": 0.000342490788879151, "loss": 4.7799, "mean_token_accuracy": 0.22356570959091188, "num_tokens": 90884287.0, "step": 52395 }, { "entropy": 5.38052773475647, "epoch": 4.076872203851391, "grad_norm": 1.140625, "learning_rate": 0.00034246434902485156, "loss": 4.7975, "mean_token_accuracy": 0.22307640165090561, "num_tokens": 90893311.0, "step": 52400 }, { "entropy": 5.344840240478516, "epoch": 4.077261233223108, "grad_norm": 1.171875, "learning_rate": 0.00034243790814688816, "loss": 4.746, "mean_token_accuracy": 0.22306982427835464, "num_tokens": 90901977.0, "step": 52405 }, { "entropy": 5.308395004272461, "epoch": 4.077650262594826, "grad_norm": 1.1171875, "learning_rate": 0.00034241146624566175, "loss": 4.7537, "mean_token_accuracy": 0.2193320170044899, "num_tokens": 90910739.0, "step": 52410 }, { "entropy": 5.483261489868164, "epoch": 4.078039291966544, "grad_norm": 1.109375, "learning_rate": 0.0003423850233215737, "loss": 4.946, "mean_token_accuracy": 0.20557509809732438, "num_tokens": 90920329.0, "step": 52415 }, { "entropy": 5.272234201431274, "epoch": 4.078428321338261, "grad_norm": 1.15625, "learning_rate": 0.0003423585793750251, "loss": 4.6727, "mean_token_accuracy": 0.2269975021481514, "num_tokens": 90928697.0, "step": 52420 }, { "entropy": 5.417020320892334, "epoch": 4.078817350709978, "grad_norm": 1.2109375, "learning_rate": 0.00034233213440641724, "loss": 4.8119, "mean_token_accuracy": 0.22041169852018355, "num_tokens": 90937483.0, "step": 52425 }, { "entropy": 5.394551563262939, "epoch": 4.079206380081696, "grad_norm": 1.1640625, "learning_rate": 0.00034230568841615145, "loss": 4.8406, "mean_token_accuracy": 0.21279986053705216, "num_tokens": 90946467.0, "step": 52430 }, { "entropy": 5.407749223709106, "epoch": 4.079595409453414, "grad_norm": 1.234375, "learning_rate": 0.000342279241404629, "loss": 4.7601, "mean_token_accuracy": 0.21768074631690978, "num_tokens": 90954498.0, "step": 52435 }, { "entropy": 5.437407302856445, "epoch": 4.079984438825131, "grad_norm": 1.2734375, "learning_rate": 0.00034225279337225106, "loss": 4.865, "mean_token_accuracy": 0.211087167263031, "num_tokens": 90962683.0, "step": 52440 }, { "entropy": 5.305998373031616, "epoch": 4.080373468196849, "grad_norm": 1.2421875, "learning_rate": 0.0003422263443194191, "loss": 4.7013, "mean_token_accuracy": 0.23345850706100463, "num_tokens": 90971083.0, "step": 52445 }, { "entropy": 5.330578994750977, "epoch": 4.080762497568567, "grad_norm": 1.1796875, "learning_rate": 0.0003421998942465344, "loss": 4.8039, "mean_token_accuracy": 0.22398509979248046, "num_tokens": 90980369.0, "step": 52450 }, { "entropy": 5.2651355266571045, "epoch": 4.081151526940284, "grad_norm": 1.203125, "learning_rate": 0.00034217344315399823, "loss": 4.6888, "mean_token_accuracy": 0.2270424857735634, "num_tokens": 90988833.0, "step": 52455 }, { "entropy": 5.4009312152862545, "epoch": 4.081540556312001, "grad_norm": 1.2109375, "learning_rate": 0.000342146991042212, "loss": 4.8323, "mean_token_accuracy": 0.21593854576349258, "num_tokens": 90997281.0, "step": 52460 }, { "entropy": 5.453297853469849, "epoch": 4.081929585683719, "grad_norm": 1.140625, "learning_rate": 0.00034212053791157695, "loss": 4.8856, "mean_token_accuracy": 0.21697194129228592, "num_tokens": 91006471.0, "step": 52465 }, { "entropy": 5.472080135345459, "epoch": 4.082318615055437, "grad_norm": 1.1796875, "learning_rate": 0.00034209408376249464, "loss": 4.7784, "mean_token_accuracy": 0.2218833714723587, "num_tokens": 91016090.0, "step": 52470 }, { "entropy": 5.295069837570191, "epoch": 4.082707644427154, "grad_norm": 1.125, "learning_rate": 0.0003420676285953664, "loss": 4.7043, "mean_token_accuracy": 0.22152167111635207, "num_tokens": 91025778.0, "step": 52475 }, { "entropy": 5.37457857131958, "epoch": 4.083096673798872, "grad_norm": 1.1875, "learning_rate": 0.0003420411724105937, "loss": 4.8179, "mean_token_accuracy": 0.21502785980701447, "num_tokens": 91033401.0, "step": 52480 }, { "entropy": 5.330930137634278, "epoch": 4.08348570317059, "grad_norm": 1.1875, "learning_rate": 0.00034201471520857793, "loss": 4.711, "mean_token_accuracy": 0.2322893038392067, "num_tokens": 91042792.0, "step": 52485 }, { "entropy": 5.460653066635132, "epoch": 4.083874732542307, "grad_norm": 1.2734375, "learning_rate": 0.0003419882569897204, "loss": 4.8454, "mean_token_accuracy": 0.21239145547151567, "num_tokens": 91052060.0, "step": 52490 }, { "entropy": 5.326344108581543, "epoch": 4.084263761914024, "grad_norm": 1.1796875, "learning_rate": 0.00034196179775442274, "loss": 4.7696, "mean_token_accuracy": 0.2205837771296501, "num_tokens": 91060676.0, "step": 52495 }, { "entropy": 5.362199783325195, "epoch": 4.084652791285742, "grad_norm": 1.21875, "learning_rate": 0.0003419353375030864, "loss": 4.7892, "mean_token_accuracy": 0.21621714234352113, "num_tokens": 91068986.0, "step": 52500 }, { "entropy": 5.402423095703125, "epoch": 4.08504182065746, "grad_norm": 1.2265625, "learning_rate": 0.0003419088762361128, "loss": 4.7619, "mean_token_accuracy": 0.2265496239066124, "num_tokens": 91077045.0, "step": 52505 }, { "entropy": 5.382566118240357, "epoch": 4.085430850029177, "grad_norm": 1.1875, "learning_rate": 0.0003418824139539035, "loss": 4.8393, "mean_token_accuracy": 0.2142954096198082, "num_tokens": 91085352.0, "step": 52510 }, { "entropy": 5.373075199127197, "epoch": 4.085819879400895, "grad_norm": 1.1640625, "learning_rate": 0.0003418559506568601, "loss": 4.7863, "mean_token_accuracy": 0.22040842175483705, "num_tokens": 91094369.0, "step": 52515 }, { "entropy": 5.443074703216553, "epoch": 4.086208908772612, "grad_norm": 1.1953125, "learning_rate": 0.00034182948634538403, "loss": 4.8128, "mean_token_accuracy": 0.227288319170475, "num_tokens": 91102452.0, "step": 52520 }, { "entropy": 5.430651569366455, "epoch": 4.08659793814433, "grad_norm": 1.109375, "learning_rate": 0.0003418030210198769, "loss": 4.8689, "mean_token_accuracy": 0.21718371361494065, "num_tokens": 91111202.0, "step": 52525 }, { "entropy": 5.419070148468018, "epoch": 4.086986967516047, "grad_norm": 1.1875, "learning_rate": 0.00034177655468074027, "loss": 4.7991, "mean_token_accuracy": 0.23089154958724975, "num_tokens": 91119245.0, "step": 52530 }, { "entropy": 5.372449445724487, "epoch": 4.087375996887765, "grad_norm": 1.171875, "learning_rate": 0.0003417500873283756, "loss": 4.8311, "mean_token_accuracy": 0.2131991684436798, "num_tokens": 91128504.0, "step": 52535 }, { "entropy": 5.318690061569214, "epoch": 4.087765026259483, "grad_norm": 1.1328125, "learning_rate": 0.0003417236189631846, "loss": 4.7833, "mean_token_accuracy": 0.22270189523696898, "num_tokens": 91137484.0, "step": 52540 }, { "entropy": 5.385479879379273, "epoch": 4.0881540556312, "grad_norm": 1.140625, "learning_rate": 0.000341697149585569, "loss": 4.7931, "mean_token_accuracy": 0.21593436151742934, "num_tokens": 91146318.0, "step": 52545 }, { "entropy": 5.429203224182129, "epoch": 4.088543085002918, "grad_norm": 1.171875, "learning_rate": 0.0003416706791959302, "loss": 4.8558, "mean_token_accuracy": 0.2158903583884239, "num_tokens": 91153813.0, "step": 52550 }, { "entropy": 5.398557519912719, "epoch": 4.088932114374635, "grad_norm": 1.203125, "learning_rate": 0.00034164420779467003, "loss": 4.8257, "mean_token_accuracy": 0.22059576362371444, "num_tokens": 91162975.0, "step": 52555 }, { "entropy": 5.262619590759277, "epoch": 4.089321143746353, "grad_norm": 1.171875, "learning_rate": 0.0003416177353821901, "loss": 4.622, "mean_token_accuracy": 0.23538741171360017, "num_tokens": 91171489.0, "step": 52560 }, { "entropy": 5.2323156833648685, "epoch": 4.08971017311807, "grad_norm": 1.2109375, "learning_rate": 0.000341591261958892, "loss": 4.7674, "mean_token_accuracy": 0.21679968386888504, "num_tokens": 91180199.0, "step": 52565 }, { "entropy": 5.481382989883423, "epoch": 4.090099202489788, "grad_norm": 1.1953125, "learning_rate": 0.00034156478752517754, "loss": 4.8681, "mean_token_accuracy": 0.2065044417977333, "num_tokens": 91189525.0, "step": 52570 }, { "entropy": 5.477007675170898, "epoch": 4.090488231861506, "grad_norm": 1.1328125, "learning_rate": 0.00034153831208144837, "loss": 4.8746, "mean_token_accuracy": 0.21310272812843323, "num_tokens": 91198324.0, "step": 52575 }, { "entropy": 5.33432903289795, "epoch": 4.090877261233223, "grad_norm": 1.1796875, "learning_rate": 0.0003415118356281062, "loss": 4.699, "mean_token_accuracy": 0.22883144170045852, "num_tokens": 91206988.0, "step": 52580 }, { "entropy": 5.275058698654175, "epoch": 4.091266290604941, "grad_norm": 1.1640625, "learning_rate": 0.0003414853581655528, "loss": 4.7462, "mean_token_accuracy": 0.22622264921665192, "num_tokens": 91215646.0, "step": 52585 }, { "entropy": 5.4465028762817385, "epoch": 4.091655319976658, "grad_norm": 1.0859375, "learning_rate": 0.00034145887969419, "loss": 4.8883, "mean_token_accuracy": 0.217190720140934, "num_tokens": 91224816.0, "step": 52590 }, { "entropy": 5.471168279647827, "epoch": 4.092044349348376, "grad_norm": 1.140625, "learning_rate": 0.00034143240021441935, "loss": 4.8469, "mean_token_accuracy": 0.22079011797904968, "num_tokens": 91232962.0, "step": 52595 }, { "entropy": 5.428801393508911, "epoch": 4.092433378720093, "grad_norm": 1.125, "learning_rate": 0.0003414059197266428, "loss": 4.747, "mean_token_accuracy": 0.22090332955121994, "num_tokens": 91242508.0, "step": 52600 }, { "entropy": 5.371498870849609, "epoch": 4.092822408091811, "grad_norm": 1.140625, "learning_rate": 0.00034137943823126215, "loss": 4.7702, "mean_token_accuracy": 0.21542719304561614, "num_tokens": 91250632.0, "step": 52605 }, { "entropy": 5.372362756729126, "epoch": 4.093211437463529, "grad_norm": 1.296875, "learning_rate": 0.0003413529557286792, "loss": 4.8106, "mean_token_accuracy": 0.21525839865207672, "num_tokens": 91259835.0, "step": 52610 }, { "entropy": 5.336719369888305, "epoch": 4.093600466835246, "grad_norm": 1.1875, "learning_rate": 0.0003413264722192957, "loss": 4.7208, "mean_token_accuracy": 0.224212945997715, "num_tokens": 91267999.0, "step": 52615 }, { "entropy": 5.338137769699097, "epoch": 4.093989496206964, "grad_norm": 1.15625, "learning_rate": 0.0003412999877035136, "loss": 4.7428, "mean_token_accuracy": 0.22048081755638121, "num_tokens": 91276695.0, "step": 52620 }, { "entropy": 5.3595024108886715, "epoch": 4.094378525578681, "grad_norm": 1.09375, "learning_rate": 0.00034127350218173463, "loss": 4.7554, "mean_token_accuracy": 0.21681054085493087, "num_tokens": 91285474.0, "step": 52625 }, { "entropy": 5.410590028762817, "epoch": 4.094767554950399, "grad_norm": 1.2109375, "learning_rate": 0.00034124701565436076, "loss": 4.8217, "mean_token_accuracy": 0.21871497482061386, "num_tokens": 91293333.0, "step": 52630 }, { "entropy": 5.374338865280151, "epoch": 4.095156584322116, "grad_norm": 1.1171875, "learning_rate": 0.000341220528121794, "loss": 4.7879, "mean_token_accuracy": 0.22420702427625655, "num_tokens": 91301881.0, "step": 52635 }, { "entropy": 5.310370254516601, "epoch": 4.095545613693834, "grad_norm": 1.1953125, "learning_rate": 0.000341194039584436, "loss": 4.7387, "mean_token_accuracy": 0.22733586579561232, "num_tokens": 91309922.0, "step": 52640 }, { "entropy": 5.357850551605225, "epoch": 4.095934643065552, "grad_norm": 1.1953125, "learning_rate": 0.0003411675500426888, "loss": 4.8089, "mean_token_accuracy": 0.21542946994304657, "num_tokens": 91317844.0, "step": 52645 }, { "entropy": 5.439244270324707, "epoch": 4.096323672437269, "grad_norm": 1.046875, "learning_rate": 0.00034114105949695445, "loss": 4.8716, "mean_token_accuracy": 0.21526251137256622, "num_tokens": 91326754.0, "step": 52650 }, { "entropy": 5.485074043273926, "epoch": 4.096712701808986, "grad_norm": 1.1953125, "learning_rate": 0.0003411145679476347, "loss": 4.8595, "mean_token_accuracy": 0.22414433509111403, "num_tokens": 91335885.0, "step": 52655 }, { "entropy": 5.3343198776245115, "epoch": 4.097101731180704, "grad_norm": 1.1796875, "learning_rate": 0.0003410880753951317, "loss": 4.7976, "mean_token_accuracy": 0.21626466810703276, "num_tokens": 91345120.0, "step": 52660 }, { "entropy": 5.3816393375396725, "epoch": 4.097490760552422, "grad_norm": 1.1640625, "learning_rate": 0.0003410615818398473, "loss": 4.8225, "mean_token_accuracy": 0.21757972687482835, "num_tokens": 91353854.0, "step": 52665 }, { "entropy": 5.377091121673584, "epoch": 4.097879789924139, "grad_norm": 1.171875, "learning_rate": 0.0003410350872821835, "loss": 4.7462, "mean_token_accuracy": 0.22134456932544708, "num_tokens": 91362787.0, "step": 52670 }, { "entropy": 5.319772815704345, "epoch": 4.098268819295857, "grad_norm": 1.1328125, "learning_rate": 0.00034100859172254245, "loss": 4.7457, "mean_token_accuracy": 0.22878327667713166, "num_tokens": 91372332.0, "step": 52675 }, { "entropy": 5.300218725204468, "epoch": 4.098657848667575, "grad_norm": 1.140625, "learning_rate": 0.00034098209516132607, "loss": 4.6808, "mean_token_accuracy": 0.22906354069709778, "num_tokens": 91380760.0, "step": 52680 }, { "entropy": 5.4391580581665036, "epoch": 4.099046878039292, "grad_norm": 1.28125, "learning_rate": 0.0003409555975989363, "loss": 4.8978, "mean_token_accuracy": 0.2069607600569725, "num_tokens": 91390139.0, "step": 52685 }, { "entropy": 5.328381061553955, "epoch": 4.099435907411009, "grad_norm": 1.1875, "learning_rate": 0.00034092909903577547, "loss": 4.7922, "mean_token_accuracy": 0.2183182030916214, "num_tokens": 91398460.0, "step": 52690 }, { "entropy": 5.405427169799805, "epoch": 4.099824936782727, "grad_norm": 1.1796875, "learning_rate": 0.0003409025994722454, "loss": 4.8356, "mean_token_accuracy": 0.22259434014558793, "num_tokens": 91407689.0, "step": 52695 }, { "entropy": 5.455458068847657, "epoch": 4.100213966154445, "grad_norm": 1.203125, "learning_rate": 0.0003408760989087482, "loss": 4.8761, "mean_token_accuracy": 0.21131756901741028, "num_tokens": 91416559.0, "step": 52700 }, { "entropy": 5.312933683395386, "epoch": 4.100602995526162, "grad_norm": 1.078125, "learning_rate": 0.00034084959734568616, "loss": 4.685, "mean_token_accuracy": 0.2254567936062813, "num_tokens": 91425785.0, "step": 52705 }, { "entropy": 5.355159425735474, "epoch": 4.10099202489788, "grad_norm": 1.1328125, "learning_rate": 0.00034082309478346127, "loss": 4.8119, "mean_token_accuracy": 0.2128932312130928, "num_tokens": 91433710.0, "step": 52710 }, { "entropy": 5.323598766326905, "epoch": 4.101381054269598, "grad_norm": 1.203125, "learning_rate": 0.00034079659122247574, "loss": 4.7181, "mean_token_accuracy": 0.23461543768644333, "num_tokens": 91441943.0, "step": 52715 }, { "entropy": 5.473953580856323, "epoch": 4.101770083641315, "grad_norm": 1.140625, "learning_rate": 0.0003407700866631317, "loss": 4.8428, "mean_token_accuracy": 0.21693453788757325, "num_tokens": 91450928.0, "step": 52720 }, { "entropy": 5.404916524887085, "epoch": 4.102159113013032, "grad_norm": 1.1328125, "learning_rate": 0.0003407435811058312, "loss": 4.8044, "mean_token_accuracy": 0.21938394010066986, "num_tokens": 91458893.0, "step": 52725 }, { "entropy": 5.381249284744262, "epoch": 4.10254814238475, "grad_norm": 1.1796875, "learning_rate": 0.0003407170745509764, "loss": 4.8272, "mean_token_accuracy": 0.22328583896160126, "num_tokens": 91467545.0, "step": 52730 }, { "entropy": 5.439403104782104, "epoch": 4.1029371717564675, "grad_norm": 1.1796875, "learning_rate": 0.00034069056699896974, "loss": 4.8844, "mean_token_accuracy": 0.20948629081249237, "num_tokens": 91476288.0, "step": 52735 }, { "entropy": 5.462603044509888, "epoch": 4.103326201128185, "grad_norm": 1.140625, "learning_rate": 0.0003406640584502132, "loss": 4.8492, "mean_token_accuracy": 0.2114051342010498, "num_tokens": 91484302.0, "step": 52740 }, { "entropy": 5.411507272720337, "epoch": 4.103715230499903, "grad_norm": 1.15625, "learning_rate": 0.0003406375489051091, "loss": 4.8208, "mean_token_accuracy": 0.21463291794061662, "num_tokens": 91492084.0, "step": 52745 }, { "entropy": 5.307044124603271, "epoch": 4.104104259871621, "grad_norm": 1.234375, "learning_rate": 0.0003406110383640597, "loss": 4.7261, "mean_token_accuracy": 0.22005556523799896, "num_tokens": 91500512.0, "step": 52750 }, { "entropy": 5.304315710067749, "epoch": 4.1044932892433375, "grad_norm": 1.21875, "learning_rate": 0.00034058452682746734, "loss": 4.688, "mean_token_accuracy": 0.23027225434780121, "num_tokens": 91508720.0, "step": 52755 }, { "entropy": 5.358227634429932, "epoch": 4.104882318615055, "grad_norm": 1.21875, "learning_rate": 0.000340558014295734, "loss": 4.8009, "mean_token_accuracy": 0.2190185621380806, "num_tokens": 91517372.0, "step": 52760 }, { "entropy": 5.293401193618775, "epoch": 4.105271347986773, "grad_norm": 1.296875, "learning_rate": 0.00034053150076926214, "loss": 4.6451, "mean_token_accuracy": 0.22750626057386397, "num_tokens": 91525047.0, "step": 52765 }, { "entropy": 5.397005796432495, "epoch": 4.1056603773584905, "grad_norm": 1.109375, "learning_rate": 0.0003405049862484541, "loss": 4.8239, "mean_token_accuracy": 0.20831654369831085, "num_tokens": 91533819.0, "step": 52770 }, { "entropy": 5.3624519348144535, "epoch": 4.106049406730208, "grad_norm": 1.15625, "learning_rate": 0.0003404784707337122, "loss": 4.8716, "mean_token_accuracy": 0.21115259528160096, "num_tokens": 91542846.0, "step": 52775 }, { "entropy": 5.445082950592041, "epoch": 4.106438436101926, "grad_norm": 1.1640625, "learning_rate": 0.00034045195422543865, "loss": 4.8544, "mean_token_accuracy": 0.22222942858934402, "num_tokens": 91552402.0, "step": 52780 }, { "entropy": 5.344077110290527, "epoch": 4.106827465473644, "grad_norm": 1.2890625, "learning_rate": 0.00034042543672403594, "loss": 4.7557, "mean_token_accuracy": 0.2256408542394638, "num_tokens": 91560490.0, "step": 52785 }, { "entropy": 5.374427127838135, "epoch": 4.10721649484536, "grad_norm": 1.1015625, "learning_rate": 0.00034039891822990634, "loss": 4.7493, "mean_token_accuracy": 0.21630677133798598, "num_tokens": 91569221.0, "step": 52790 }, { "entropy": 5.303769636154175, "epoch": 4.107605524217078, "grad_norm": 1.1484375, "learning_rate": 0.0003403723987434523, "loss": 4.6976, "mean_token_accuracy": 0.22296379506587982, "num_tokens": 91577546.0, "step": 52795 }, { "entropy": 5.393552684783936, "epoch": 4.107994553588796, "grad_norm": 1.15625, "learning_rate": 0.00034034587826507604, "loss": 4.8156, "mean_token_accuracy": 0.21757666021585464, "num_tokens": 91586273.0, "step": 52800 }, { "entropy": 5.465078973770142, "epoch": 4.1083835829605135, "grad_norm": 1.15625, "learning_rate": 0.00034031935679518016, "loss": 4.846, "mean_token_accuracy": 0.211498661339283, "num_tokens": 91595478.0, "step": 52805 }, { "entropy": 5.406665325164795, "epoch": 4.108772612332231, "grad_norm": 1.15625, "learning_rate": 0.000340292834334167, "loss": 4.842, "mean_token_accuracy": 0.21079651564359664, "num_tokens": 91604983.0, "step": 52810 }, { "entropy": 5.395997714996338, "epoch": 4.109161641703949, "grad_norm": 1.1640625, "learning_rate": 0.000340266310882439, "loss": 4.7654, "mean_token_accuracy": 0.22088808417320252, "num_tokens": 91613404.0, "step": 52815 }, { "entropy": 5.385249042510987, "epoch": 4.109550671075667, "grad_norm": 1.1171875, "learning_rate": 0.00034023978644039864, "loss": 4.8536, "mean_token_accuracy": 0.2169533208012581, "num_tokens": 91622511.0, "step": 52820 }, { "entropy": 5.405751466751099, "epoch": 4.109939700447383, "grad_norm": 1.2265625, "learning_rate": 0.0003402132610084483, "loss": 4.8226, "mean_token_accuracy": 0.21513909697532654, "num_tokens": 91630722.0, "step": 52825 }, { "entropy": 5.419298791885376, "epoch": 4.110328729819101, "grad_norm": 1.265625, "learning_rate": 0.00034018673458699055, "loss": 4.8085, "mean_token_accuracy": 0.2190310224890709, "num_tokens": 91638747.0, "step": 52830 }, { "entropy": 5.3629697322845455, "epoch": 4.110717759190819, "grad_norm": 1.0390625, "learning_rate": 0.0003401602071764279, "loss": 4.7599, "mean_token_accuracy": 0.22039033621549606, "num_tokens": 91646990.0, "step": 52835 }, { "entropy": 5.344353342056275, "epoch": 4.1111067885625365, "grad_norm": 1.140625, "learning_rate": 0.00034013367877716284, "loss": 4.7984, "mean_token_accuracy": 0.2251903533935547, "num_tokens": 91655205.0, "step": 52840 }, { "entropy": 5.306543159484863, "epoch": 4.111495817934254, "grad_norm": 1.1328125, "learning_rate": 0.0003401071493895977, "loss": 4.6656, "mean_token_accuracy": 0.22465095669031143, "num_tokens": 91663869.0, "step": 52845 }, { "entropy": 5.3391838550567625, "epoch": 4.111884847305972, "grad_norm": 1.15625, "learning_rate": 0.0003400806190141354, "loss": 4.7357, "mean_token_accuracy": 0.22322702407836914, "num_tokens": 91672048.0, "step": 52850 }, { "entropy": 5.37914810180664, "epoch": 4.112273876677689, "grad_norm": 1.125, "learning_rate": 0.00034005408765117815, "loss": 4.7619, "mean_token_accuracy": 0.2206842929124832, "num_tokens": 91680669.0, "step": 52855 }, { "entropy": 5.421321058273316, "epoch": 4.112662906049406, "grad_norm": 1.1015625, "learning_rate": 0.00034002755530112877, "loss": 4.7918, "mean_token_accuracy": 0.22741796523332597, "num_tokens": 91690060.0, "step": 52860 }, { "entropy": 5.373548412322998, "epoch": 4.113051935421124, "grad_norm": 1.203125, "learning_rate": 0.0003400010219643897, "loss": 4.6964, "mean_token_accuracy": 0.23401701003313063, "num_tokens": 91698108.0, "step": 52865 }, { "entropy": 5.3752960681915285, "epoch": 4.113440964792842, "grad_norm": 1.25, "learning_rate": 0.0003399744876413636, "loss": 4.7782, "mean_token_accuracy": 0.21769324839115142, "num_tokens": 91707003.0, "step": 52870 }, { "entropy": 5.371784496307373, "epoch": 4.1138299941645595, "grad_norm": 1.125, "learning_rate": 0.000339947952332453, "loss": 4.7932, "mean_token_accuracy": 0.21545062512159346, "num_tokens": 91715539.0, "step": 52875 }, { "entropy": 5.375323295593262, "epoch": 4.114219023536277, "grad_norm": 1.1484375, "learning_rate": 0.00033992141603806064, "loss": 4.7994, "mean_token_accuracy": 0.21191147565841675, "num_tokens": 91724410.0, "step": 52880 }, { "entropy": 5.394019031524659, "epoch": 4.114608052907995, "grad_norm": 1.21875, "learning_rate": 0.00033989487875858915, "loss": 4.7888, "mean_token_accuracy": 0.22593642622232438, "num_tokens": 91732744.0, "step": 52885 }, { "entropy": 5.3799807071685795, "epoch": 4.114997082279712, "grad_norm": 1.1484375, "learning_rate": 0.00033986834049444113, "loss": 4.7167, "mean_token_accuracy": 0.2253296598792076, "num_tokens": 91741406.0, "step": 52890 }, { "entropy": 5.356348991394043, "epoch": 4.115386111651429, "grad_norm": 1.1875, "learning_rate": 0.00033984180124601936, "loss": 4.7753, "mean_token_accuracy": 0.2189260959625244, "num_tokens": 91749998.0, "step": 52895 }, { "entropy": 5.352110862731934, "epoch": 4.115775141023147, "grad_norm": 1.1796875, "learning_rate": 0.00033981526101372635, "loss": 4.7781, "mean_token_accuracy": 0.21984853893518447, "num_tokens": 91758175.0, "step": 52900 }, { "entropy": 5.332473945617676, "epoch": 4.116164170394865, "grad_norm": 1.1328125, "learning_rate": 0.000339788719797965, "loss": 4.7111, "mean_token_accuracy": 0.22017756700515748, "num_tokens": 91766606.0, "step": 52905 }, { "entropy": 5.349628067016601, "epoch": 4.1165531997665825, "grad_norm": 1.2109375, "learning_rate": 0.0003397621775991379, "loss": 4.7126, "mean_token_accuracy": 0.2264467492699623, "num_tokens": 91775446.0, "step": 52910 }, { "entropy": 5.349782419204712, "epoch": 4.1169422291383, "grad_norm": 1.203125, "learning_rate": 0.0003397356344176479, "loss": 4.7166, "mean_token_accuracy": 0.22759489119052886, "num_tokens": 91783954.0, "step": 52915 }, { "entropy": 5.2686354637146, "epoch": 4.117331258510018, "grad_norm": 1.1640625, "learning_rate": 0.0003397090902538976, "loss": 4.6661, "mean_token_accuracy": 0.23432971835136412, "num_tokens": 91793169.0, "step": 52920 }, { "entropy": 5.3940552234649655, "epoch": 4.117720287881735, "grad_norm": 1.25, "learning_rate": 0.00033968254510828995, "loss": 4.849, "mean_token_accuracy": 0.21371231228113174, "num_tokens": 91802011.0, "step": 52925 }, { "entropy": 5.394496202468872, "epoch": 4.118109317253452, "grad_norm": 1.15625, "learning_rate": 0.0003396559989812275, "loss": 4.8102, "mean_token_accuracy": 0.21799286901950837, "num_tokens": 91811120.0, "step": 52930 }, { "entropy": 5.471392631530762, "epoch": 4.11849834662517, "grad_norm": 1.1328125, "learning_rate": 0.0003396294518731133, "loss": 4.8759, "mean_token_accuracy": 0.214100281894207, "num_tokens": 91819837.0, "step": 52935 }, { "entropy": 5.3466535091400145, "epoch": 4.118887375996888, "grad_norm": 1.203125, "learning_rate": 0.00033960290378435, "loss": 4.7262, "mean_token_accuracy": 0.22798630297183992, "num_tokens": 91828955.0, "step": 52940 }, { "entropy": 5.306018447875976, "epoch": 4.1192764053686055, "grad_norm": 1.1328125, "learning_rate": 0.00033957635471534045, "loss": 4.7052, "mean_token_accuracy": 0.21883408576250077, "num_tokens": 91837508.0, "step": 52945 }, { "entropy": 5.327532482147217, "epoch": 4.119665434740323, "grad_norm": 1.1640625, "learning_rate": 0.0003395498046664875, "loss": 4.7455, "mean_token_accuracy": 0.21889119148254393, "num_tokens": 91847030.0, "step": 52950 }, { "entropy": 5.389635610580444, "epoch": 4.120054464112041, "grad_norm": 1.1484375, "learning_rate": 0.000339523253638194, "loss": 4.7255, "mean_token_accuracy": 0.22487041354179382, "num_tokens": 91855823.0, "step": 52955 }, { "entropy": 5.3975457668304445, "epoch": 4.120443493483758, "grad_norm": 1.2421875, "learning_rate": 0.0003394967016308629, "loss": 4.8093, "mean_token_accuracy": 0.2149109274148941, "num_tokens": 91864741.0, "step": 52960 }, { "entropy": 5.321229791641235, "epoch": 4.120832522855475, "grad_norm": 1.1328125, "learning_rate": 0.0003394701486448968, "loss": 4.7394, "mean_token_accuracy": 0.22114581763744354, "num_tokens": 91872780.0, "step": 52965 }, { "entropy": 5.396734046936035, "epoch": 4.121221552227193, "grad_norm": 1.2421875, "learning_rate": 0.00033944359468069903, "loss": 4.7836, "mean_token_accuracy": 0.22365962117910385, "num_tokens": 91881394.0, "step": 52970 }, { "entropy": 5.315213775634765, "epoch": 4.121610581598911, "grad_norm": 1.203125, "learning_rate": 0.00033941703973867216, "loss": 4.7488, "mean_token_accuracy": 0.22400761395692825, "num_tokens": 91889758.0, "step": 52975 }, { "entropy": 5.367676734924316, "epoch": 4.1219996109706285, "grad_norm": 1.1875, "learning_rate": 0.00033939048381921935, "loss": 4.7108, "mean_token_accuracy": 0.22394270598888397, "num_tokens": 91897799.0, "step": 52980 }, { "entropy": 5.345440673828125, "epoch": 4.122388640342346, "grad_norm": 1.2265625, "learning_rate": 0.0003393639269227434, "loss": 4.7674, "mean_token_accuracy": 0.22346251159906388, "num_tokens": 91907016.0, "step": 52985 }, { "entropy": 5.255563116073608, "epoch": 4.122777669714063, "grad_norm": 1.078125, "learning_rate": 0.0003393373690496473, "loss": 4.6656, "mean_token_accuracy": 0.23237578868865966, "num_tokens": 91914934.0, "step": 52990 }, { "entropy": 5.385871887207031, "epoch": 4.123166699085781, "grad_norm": 1.171875, "learning_rate": 0.000339310810200334, "loss": 4.8255, "mean_token_accuracy": 0.21754276603460312, "num_tokens": 91923640.0, "step": 52995 }, { "entropy": 5.407751607894897, "epoch": 4.123555728457498, "grad_norm": 1.1953125, "learning_rate": 0.00033928425037520643, "loss": 4.8318, "mean_token_accuracy": 0.2173330694437027, "num_tokens": 91931768.0, "step": 53000 }, { "entropy": 5.405064725875855, "epoch": 4.123944757829216, "grad_norm": 1.1328125, "learning_rate": 0.0003392576895746678, "loss": 4.7851, "mean_token_accuracy": 0.21746721714735032, "num_tokens": 91940681.0, "step": 53005 }, { "entropy": 5.5169349193573, "epoch": 4.124333787200934, "grad_norm": 1.1953125, "learning_rate": 0.0003392311277991209, "loss": 4.9074, "mean_token_accuracy": 0.20890201181173323, "num_tokens": 91948578.0, "step": 53010 }, { "entropy": 5.358961153030395, "epoch": 4.1247228165726515, "grad_norm": 1.2578125, "learning_rate": 0.00033920456504896895, "loss": 4.7208, "mean_token_accuracy": 0.2272202715277672, "num_tokens": 91956706.0, "step": 53015 }, { "entropy": 5.333904457092285, "epoch": 4.125111845944369, "grad_norm": 1.1640625, "learning_rate": 0.00033917800132461493, "loss": 4.739, "mean_token_accuracy": 0.2236358180642128, "num_tokens": 91966071.0, "step": 53020 }, { "entropy": 5.398079252243042, "epoch": 4.125500875316086, "grad_norm": 1.1953125, "learning_rate": 0.0003391514366264619, "loss": 4.7747, "mean_token_accuracy": 0.22605164498090743, "num_tokens": 91973713.0, "step": 53025 }, { "entropy": 5.3161111831665036, "epoch": 4.125889904687804, "grad_norm": 1.25, "learning_rate": 0.0003391248709549129, "loss": 4.7613, "mean_token_accuracy": 0.21622918248176576, "num_tokens": 91982945.0, "step": 53030 }, { "entropy": 5.366640424728393, "epoch": 4.126278934059521, "grad_norm": 1.1328125, "learning_rate": 0.0003390983043103711, "loss": 4.8909, "mean_token_accuracy": 0.21523632258176803, "num_tokens": 91991943.0, "step": 53035 }, { "entropy": 5.397830486297607, "epoch": 4.126667963431239, "grad_norm": 1.3515625, "learning_rate": 0.0003390717366932395, "loss": 4.8211, "mean_token_accuracy": 0.21124104112386705, "num_tokens": 92000480.0, "step": 53040 }, { "entropy": 5.4509178638458256, "epoch": 4.127056992802957, "grad_norm": 1.1015625, "learning_rate": 0.0003390451681039212, "loss": 4.8706, "mean_token_accuracy": 0.2118455797433853, "num_tokens": 92009922.0, "step": 53045 }, { "entropy": 5.356840991973877, "epoch": 4.1274460221746745, "grad_norm": 1.1796875, "learning_rate": 0.00033901859854281954, "loss": 4.67, "mean_token_accuracy": 0.22865425199270248, "num_tokens": 92017978.0, "step": 53050 }, { "entropy": 5.342997121810913, "epoch": 4.127835051546391, "grad_norm": 1.1640625, "learning_rate": 0.0003389920280103375, "loss": 4.7703, "mean_token_accuracy": 0.2188594475388527, "num_tokens": 92026649.0, "step": 53055 }, { "entropy": 5.30946102142334, "epoch": 4.128224080918109, "grad_norm": 1.09375, "learning_rate": 0.00033896545650687824, "loss": 4.726, "mean_token_accuracy": 0.22779389917850495, "num_tokens": 92035393.0, "step": 53060 }, { "entropy": 5.43549165725708, "epoch": 4.128613110289827, "grad_norm": 1.203125, "learning_rate": 0.0003389388840328451, "loss": 4.7823, "mean_token_accuracy": 0.2170545592904091, "num_tokens": 92043644.0, "step": 53065 }, { "entropy": 5.427477407455444, "epoch": 4.129002139661544, "grad_norm": 1.21875, "learning_rate": 0.0003389123105886411, "loss": 4.8226, "mean_token_accuracy": 0.21947708874940872, "num_tokens": 92052469.0, "step": 53070 }, { "entropy": 5.337659311294556, "epoch": 4.129391169033262, "grad_norm": 1.203125, "learning_rate": 0.0003388857361746695, "loss": 4.7218, "mean_token_accuracy": 0.22316092848777772, "num_tokens": 92060887.0, "step": 53075 }, { "entropy": 5.324646091461181, "epoch": 4.12978019840498, "grad_norm": 1.1484375, "learning_rate": 0.00033885916079133354, "loss": 4.7082, "mean_token_accuracy": 0.22857169359922408, "num_tokens": 92069344.0, "step": 53080 }, { "entropy": 5.3360028743743895, "epoch": 4.1301692277766975, "grad_norm": 1.2265625, "learning_rate": 0.00033883258443903646, "loss": 4.7039, "mean_token_accuracy": 0.22247749716043472, "num_tokens": 92078634.0, "step": 53085 }, { "entropy": 5.293679666519165, "epoch": 4.130558257148414, "grad_norm": 1.171875, "learning_rate": 0.00033880600711818157, "loss": 4.6323, "mean_token_accuracy": 0.22789670079946517, "num_tokens": 92086790.0, "step": 53090 }, { "entropy": 5.409792900085449, "epoch": 4.130947286520132, "grad_norm": 1.171875, "learning_rate": 0.00033877942882917203, "loss": 4.7792, "mean_token_accuracy": 0.22417913675308226, "num_tokens": 92094944.0, "step": 53095 }, { "entropy": 5.346992635726929, "epoch": 4.13133631589185, "grad_norm": 1.359375, "learning_rate": 0.00033875284957241117, "loss": 4.7929, "mean_token_accuracy": 0.2221509724855423, "num_tokens": 92102845.0, "step": 53100 }, { "entropy": 5.368960332870484, "epoch": 4.131725345263567, "grad_norm": 1.2109375, "learning_rate": 0.0003387262693483023, "loss": 4.7728, "mean_token_accuracy": 0.22582782655954362, "num_tokens": 92110895.0, "step": 53105 }, { "entropy": 5.364451217651367, "epoch": 4.132114374635285, "grad_norm": 1.140625, "learning_rate": 0.00033869968815724866, "loss": 4.7691, "mean_token_accuracy": 0.22725868821144105, "num_tokens": 92119400.0, "step": 53110 }, { "entropy": 5.459622573852539, "epoch": 4.132503404007003, "grad_norm": 1.0703125, "learning_rate": 0.0003386731059996537, "loss": 4.899, "mean_token_accuracy": 0.21772991269826888, "num_tokens": 92129014.0, "step": 53115 }, { "entropy": 5.451181888580322, "epoch": 4.1328924333787205, "grad_norm": 1.2109375, "learning_rate": 0.00033864652287592074, "loss": 4.9078, "mean_token_accuracy": 0.216256944835186, "num_tokens": 92137659.0, "step": 53120 }, { "entropy": 5.3701056957244875, "epoch": 4.133281462750437, "grad_norm": 1.1875, "learning_rate": 0.00033861993878645305, "loss": 4.7603, "mean_token_accuracy": 0.22163394391536712, "num_tokens": 92146467.0, "step": 53125 }, { "entropy": 5.431371784210205, "epoch": 4.133670492122155, "grad_norm": 1.1796875, "learning_rate": 0.000338593353731654, "loss": 4.7489, "mean_token_accuracy": 0.22166501432657243, "num_tokens": 92155180.0, "step": 53130 }, { "entropy": 5.364253807067871, "epoch": 4.134059521493873, "grad_norm": 1.2734375, "learning_rate": 0.0003385667677119271, "loss": 4.8099, "mean_token_accuracy": 0.22661019563674928, "num_tokens": 92163531.0, "step": 53135 }, { "entropy": 5.343440008163452, "epoch": 4.13444855086559, "grad_norm": 1.171875, "learning_rate": 0.00033854018072767574, "loss": 4.8356, "mean_token_accuracy": 0.21555633693933487, "num_tokens": 92172148.0, "step": 53140 }, { "entropy": 5.381349515914917, "epoch": 4.134837580237308, "grad_norm": 1.3828125, "learning_rate": 0.00033851359277930316, "loss": 4.7291, "mean_token_accuracy": 0.22282301485538483, "num_tokens": 92180666.0, "step": 53145 }, { "entropy": 5.274835538864136, "epoch": 4.135226609609026, "grad_norm": 1.1484375, "learning_rate": 0.0003384870038672129, "loss": 4.6996, "mean_token_accuracy": 0.22787546813488008, "num_tokens": 92189894.0, "step": 53150 }, { "entropy": 5.417509412765503, "epoch": 4.1356156389807435, "grad_norm": 1.203125, "learning_rate": 0.0003384604139918085, "loss": 4.7822, "mean_token_accuracy": 0.22020720243453978, "num_tokens": 92199029.0, "step": 53155 }, { "entropy": 5.339353847503662, "epoch": 4.13600466835246, "grad_norm": 1.140625, "learning_rate": 0.00033843382315349325, "loss": 4.7265, "mean_token_accuracy": 0.22383989542722701, "num_tokens": 92207388.0, "step": 53160 }, { "entropy": 5.344620895385742, "epoch": 4.136393697724178, "grad_norm": 1.1953125, "learning_rate": 0.00033840723135267073, "loss": 4.7428, "mean_token_accuracy": 0.22348374873399734, "num_tokens": 92216194.0, "step": 53165 }, { "entropy": 5.334713172912598, "epoch": 4.136782727095896, "grad_norm": 1.1640625, "learning_rate": 0.00033838063858974434, "loss": 4.7425, "mean_token_accuracy": 0.21988310515880585, "num_tokens": 92224322.0, "step": 53170 }, { "entropy": 5.342411756515503, "epoch": 4.137171756467613, "grad_norm": 1.1015625, "learning_rate": 0.0003383540448651177, "loss": 4.7318, "mean_token_accuracy": 0.22171326726675034, "num_tokens": 92232635.0, "step": 53175 }, { "entropy": 5.395830678939819, "epoch": 4.137560785839331, "grad_norm": 1.21875, "learning_rate": 0.00033832745017919424, "loss": 4.772, "mean_token_accuracy": 0.224443481862545, "num_tokens": 92240609.0, "step": 53180 }, { "entropy": 5.299058485031128, "epoch": 4.137949815211049, "grad_norm": 1.125, "learning_rate": 0.00033830085453237757, "loss": 4.6726, "mean_token_accuracy": 0.22355888783931732, "num_tokens": 92248699.0, "step": 53185 }, { "entropy": 5.369287300109863, "epoch": 4.138338844582766, "grad_norm": 1.125, "learning_rate": 0.0003382742579250712, "loss": 4.8298, "mean_token_accuracy": 0.2149367719888687, "num_tokens": 92256882.0, "step": 53190 }, { "entropy": 5.305195569992065, "epoch": 4.138727873954483, "grad_norm": 1.1875, "learning_rate": 0.0003382476603576785, "loss": 4.7099, "mean_token_accuracy": 0.2203458368778229, "num_tokens": 92264729.0, "step": 53195 }, { "entropy": 5.404139661788941, "epoch": 4.139116903326201, "grad_norm": 1.234375, "learning_rate": 0.0003382210618306034, "loss": 4.9153, "mean_token_accuracy": 0.21020956635475158, "num_tokens": 92273924.0, "step": 53200 }, { "entropy": 5.395939731597901, "epoch": 4.139505932697919, "grad_norm": 1.25, "learning_rate": 0.0003381944623442492, "loss": 4.7289, "mean_token_accuracy": 0.22420473247766495, "num_tokens": 92282116.0, "step": 53205 }, { "entropy": 5.375788593292237, "epoch": 4.139894962069636, "grad_norm": 1.1953125, "learning_rate": 0.0003381678618990197, "loss": 4.7095, "mean_token_accuracy": 0.22707545310258864, "num_tokens": 92290478.0, "step": 53210 }, { "entropy": 5.279119253158569, "epoch": 4.140283991441354, "grad_norm": 1.296875, "learning_rate": 0.0003381412604953185, "loss": 4.7353, "mean_token_accuracy": 0.22536227703094483, "num_tokens": 92298524.0, "step": 53215 }, { "entropy": 5.2842484474182125, "epoch": 4.140673020813072, "grad_norm": 1.2265625, "learning_rate": 0.0003381146581335491, "loss": 4.687, "mean_token_accuracy": 0.22839209586381912, "num_tokens": 92306532.0, "step": 53220 }, { "entropy": 5.476403284072876, "epoch": 4.141062050184789, "grad_norm": 1.1640625, "learning_rate": 0.0003380880548141152, "loss": 4.9156, "mean_token_accuracy": 0.20746221393346786, "num_tokens": 92316194.0, "step": 53225 }, { "entropy": 5.3446704864501955, "epoch": 4.141451079556506, "grad_norm": 1.1875, "learning_rate": 0.00033806145053742043, "loss": 4.7167, "mean_token_accuracy": 0.2221660539507866, "num_tokens": 92324233.0, "step": 53230 }, { "entropy": 5.378196477890015, "epoch": 4.141840108928224, "grad_norm": 1.0859375, "learning_rate": 0.0003380348453038686, "loss": 4.8449, "mean_token_accuracy": 0.22004768550395964, "num_tokens": 92333823.0, "step": 53235 }, { "entropy": 5.465040302276611, "epoch": 4.142229138299942, "grad_norm": 1.1484375, "learning_rate": 0.0003380082391138633, "loss": 4.8263, "mean_token_accuracy": 0.22028243839740752, "num_tokens": 92342584.0, "step": 53240 }, { "entropy": 5.4392725944519045, "epoch": 4.142618167671659, "grad_norm": 1.265625, "learning_rate": 0.0003379816319678083, "loss": 4.7706, "mean_token_accuracy": 0.2245413839817047, "num_tokens": 92350111.0, "step": 53245 }, { "entropy": 5.350080347061157, "epoch": 4.143007197043377, "grad_norm": 1.171875, "learning_rate": 0.0003379550238661072, "loss": 4.8457, "mean_token_accuracy": 0.22499995827674865, "num_tokens": 92358731.0, "step": 53250 }, { "entropy": 5.304732084274292, "epoch": 4.143396226415095, "grad_norm": 1.21875, "learning_rate": 0.00033792841480916394, "loss": 4.7235, "mean_token_accuracy": 0.22588523626327514, "num_tokens": 92367426.0, "step": 53255 }, { "entropy": 5.382920169830323, "epoch": 4.143785255786812, "grad_norm": 1.1796875, "learning_rate": 0.00033790180479738205, "loss": 4.759, "mean_token_accuracy": 0.21844741553068162, "num_tokens": 92376937.0, "step": 53260 }, { "entropy": 5.387865829467773, "epoch": 4.144174285158529, "grad_norm": 1.2109375, "learning_rate": 0.0003378751938311654, "loss": 4.778, "mean_token_accuracy": 0.22013824582099914, "num_tokens": 92385562.0, "step": 53265 }, { "entropy": 5.340405654907227, "epoch": 4.144563314530247, "grad_norm": 1.234375, "learning_rate": 0.0003378485819109177, "loss": 4.7442, "mean_token_accuracy": 0.22913311421871185, "num_tokens": 92393774.0, "step": 53270 }, { "entropy": 5.332422590255737, "epoch": 4.144952343901965, "grad_norm": 1.21875, "learning_rate": 0.00033782196903704286, "loss": 4.7593, "mean_token_accuracy": 0.22248225659132004, "num_tokens": 92402711.0, "step": 53275 }, { "entropy": 5.395894479751587, "epoch": 4.145341373273682, "grad_norm": 1.1796875, "learning_rate": 0.0003377953552099447, "loss": 4.8072, "mean_token_accuracy": 0.21800800710916518, "num_tokens": 92411071.0, "step": 53280 }, { "entropy": 5.394516468048096, "epoch": 4.1457304026454, "grad_norm": 1.109375, "learning_rate": 0.0003377687404300269, "loss": 4.8227, "mean_token_accuracy": 0.21692912876605988, "num_tokens": 92420842.0, "step": 53285 }, { "entropy": 5.472236299514771, "epoch": 4.146119432017118, "grad_norm": 1.484375, "learning_rate": 0.0003377421246976934, "loss": 4.9298, "mean_token_accuracy": 0.2098902463912964, "num_tokens": 92430157.0, "step": 53290 }, { "entropy": 5.366793060302735, "epoch": 4.1465084613888346, "grad_norm": 1.1796875, "learning_rate": 0.00033771550801334806, "loss": 4.7286, "mean_token_accuracy": 0.22010661214590072, "num_tokens": 92439171.0, "step": 53295 }, { "entropy": 5.319917392730713, "epoch": 4.146897490760552, "grad_norm": 1.1640625, "learning_rate": 0.00033768889037739464, "loss": 4.721, "mean_token_accuracy": 0.2218250811100006, "num_tokens": 92447906.0, "step": 53300 }, { "entropy": 5.304881763458252, "epoch": 4.14728652013227, "grad_norm": 1.15625, "learning_rate": 0.00033766227179023704, "loss": 4.8003, "mean_token_accuracy": 0.20814212113618852, "num_tokens": 92456676.0, "step": 53305 }, { "entropy": 5.349608850479126, "epoch": 4.147675549503988, "grad_norm": 1.125, "learning_rate": 0.00033763565225227934, "loss": 4.727, "mean_token_accuracy": 0.2260004013776779, "num_tokens": 92465388.0, "step": 53310 }, { "entropy": 5.425984525680542, "epoch": 4.148064578875705, "grad_norm": 1.1015625, "learning_rate": 0.0003376090317639252, "loss": 4.8329, "mean_token_accuracy": 0.21115414053201675, "num_tokens": 92473347.0, "step": 53315 }, { "entropy": 5.299237680435181, "epoch": 4.148453608247423, "grad_norm": 1.0859375, "learning_rate": 0.00033758241032557875, "loss": 4.7505, "mean_token_accuracy": 0.2238055869936943, "num_tokens": 92482375.0, "step": 53320 }, { "entropy": 5.30037522315979, "epoch": 4.14884263761914, "grad_norm": 1.09375, "learning_rate": 0.00033755578793764375, "loss": 4.7579, "mean_token_accuracy": 0.21774219572544098, "num_tokens": 92490680.0, "step": 53325 }, { "entropy": 5.346386289596557, "epoch": 4.1492316669908575, "grad_norm": 1.1484375, "learning_rate": 0.0003375291646005243, "loss": 4.7717, "mean_token_accuracy": 0.2234201028943062, "num_tokens": 92499627.0, "step": 53330 }, { "entropy": 5.392048120498657, "epoch": 4.149620696362575, "grad_norm": 1.2265625, "learning_rate": 0.00033750254031462425, "loss": 4.7491, "mean_token_accuracy": 0.2158157929778099, "num_tokens": 92507895.0, "step": 53335 }, { "entropy": 5.333922672271728, "epoch": 4.150009725734293, "grad_norm": 1.1640625, "learning_rate": 0.00033747591508034765, "loss": 4.7737, "mean_token_accuracy": 0.22023155838251113, "num_tokens": 92516569.0, "step": 53340 }, { "entropy": 5.290148735046387, "epoch": 4.150398755106011, "grad_norm": 1.1953125, "learning_rate": 0.0003374492888980985, "loss": 4.7721, "mean_token_accuracy": 0.2167720004916191, "num_tokens": 92525389.0, "step": 53345 }, { "entropy": 5.36008038520813, "epoch": 4.150787784477728, "grad_norm": 1.1875, "learning_rate": 0.00033742266176828073, "loss": 4.7504, "mean_token_accuracy": 0.22173051536083221, "num_tokens": 92533734.0, "step": 53350 }, { "entropy": 5.360470819473266, "epoch": 4.151176813849446, "grad_norm": 1.2734375, "learning_rate": 0.00033739603369129846, "loss": 4.7059, "mean_token_accuracy": 0.22798762023448943, "num_tokens": 92541525.0, "step": 53355 }, { "entropy": 5.404436445236206, "epoch": 4.151565843221163, "grad_norm": 1.28125, "learning_rate": 0.00033736940466755566, "loss": 4.8137, "mean_token_accuracy": 0.22372468262910844, "num_tokens": 92550344.0, "step": 53360 }, { "entropy": 5.287572431564331, "epoch": 4.1519548725928805, "grad_norm": 1.203125, "learning_rate": 0.00033734277469745644, "loss": 4.7336, "mean_token_accuracy": 0.2302241951227188, "num_tokens": 92559661.0, "step": 53365 }, { "entropy": 5.372905969619751, "epoch": 4.152343901964598, "grad_norm": 1.1875, "learning_rate": 0.0003373161437814049, "loss": 4.8226, "mean_token_accuracy": 0.21798766106367112, "num_tokens": 92567810.0, "step": 53370 }, { "entropy": 5.435521125793457, "epoch": 4.152732931336316, "grad_norm": 1.1796875, "learning_rate": 0.00033728951191980505, "loss": 4.8516, "mean_token_accuracy": 0.21409981399774553, "num_tokens": 92576051.0, "step": 53375 }, { "entropy": 5.4103669166564945, "epoch": 4.153121960708034, "grad_norm": 1.1796875, "learning_rate": 0.00033726287911306095, "loss": 4.9404, "mean_token_accuracy": 0.21267235428094863, "num_tokens": 92584990.0, "step": 53380 }, { "entropy": 5.422621154785157, "epoch": 4.153510990079751, "grad_norm": 1.2578125, "learning_rate": 0.0003372362453615768, "loss": 4.8711, "mean_token_accuracy": 0.21617391109466552, "num_tokens": 92593598.0, "step": 53385 }, { "entropy": 5.450185871124267, "epoch": 4.153900019451468, "grad_norm": 1.1328125, "learning_rate": 0.0003372096106657566, "loss": 4.8223, "mean_token_accuracy": 0.21277300268411636, "num_tokens": 92602757.0, "step": 53390 }, { "entropy": 5.373446416854859, "epoch": 4.154289048823186, "grad_norm": 1.203125, "learning_rate": 0.00033718297502600465, "loss": 4.747, "mean_token_accuracy": 0.21843497455120087, "num_tokens": 92611316.0, "step": 53395 }, { "entropy": 5.378171730041504, "epoch": 4.1546780781949035, "grad_norm": 1.265625, "learning_rate": 0.00033715633844272504, "loss": 4.731, "mean_token_accuracy": 0.22910406589508056, "num_tokens": 92619467.0, "step": 53400 }, { "entropy": 5.344860935211182, "epoch": 4.155067107566621, "grad_norm": 1.1171875, "learning_rate": 0.00033712970091632187, "loss": 4.7521, "mean_token_accuracy": 0.22574177980422974, "num_tokens": 92627858.0, "step": 53405 }, { "entropy": 5.317840480804444, "epoch": 4.155456136938339, "grad_norm": 1.1640625, "learning_rate": 0.00033710306244719954, "loss": 4.7173, "mean_token_accuracy": 0.22209156453609466, "num_tokens": 92636553.0, "step": 53410 }, { "entropy": 5.3687304019927975, "epoch": 4.155845166310057, "grad_norm": 1.1484375, "learning_rate": 0.0003370764230357619, "loss": 4.7716, "mean_token_accuracy": 0.22491025775671006, "num_tokens": 92645100.0, "step": 53415 }, { "entropy": 5.299055814743042, "epoch": 4.156234195681774, "grad_norm": 1.234375, "learning_rate": 0.0003370497826824134, "loss": 4.6551, "mean_token_accuracy": 0.22994706332683562, "num_tokens": 92653885.0, "step": 53420 }, { "entropy": 5.319966888427734, "epoch": 4.156623225053491, "grad_norm": 1.1328125, "learning_rate": 0.0003370231413875582, "loss": 4.7397, "mean_token_accuracy": 0.22184529155492783, "num_tokens": 92662534.0, "step": 53425 }, { "entropy": 5.324884462356567, "epoch": 4.157012254425209, "grad_norm": 1.171875, "learning_rate": 0.00033699649915160053, "loss": 4.6748, "mean_token_accuracy": 0.23044501394033431, "num_tokens": 92670616.0, "step": 53430 }, { "entropy": 5.304740905761719, "epoch": 4.1574012837969265, "grad_norm": 1.140625, "learning_rate": 0.00033696985597494474, "loss": 4.7177, "mean_token_accuracy": 0.2221129685640335, "num_tokens": 92678403.0, "step": 53435 }, { "entropy": 5.293106508255005, "epoch": 4.157790313168644, "grad_norm": 1.1953125, "learning_rate": 0.000336943211857995, "loss": 4.7587, "mean_token_accuracy": 0.2160153269767761, "num_tokens": 92688122.0, "step": 53440 }, { "entropy": 5.4493824481964115, "epoch": 4.158179342540362, "grad_norm": 1.25, "learning_rate": 0.0003369165668011556, "loss": 4.787, "mean_token_accuracy": 0.22683054953813553, "num_tokens": 92696909.0, "step": 53445 }, { "entropy": 5.375456142425537, "epoch": 4.15856837191208, "grad_norm": 1.1875, "learning_rate": 0.0003368899208048308, "loss": 4.7411, "mean_token_accuracy": 0.2240825116634369, "num_tokens": 92705773.0, "step": 53450 }, { "entropy": 5.378240442276001, "epoch": 4.158957401283797, "grad_norm": 1.1796875, "learning_rate": 0.00033686327386942504, "loss": 4.8966, "mean_token_accuracy": 0.220670647919178, "num_tokens": 92713746.0, "step": 53455 }, { "entropy": 5.371901369094848, "epoch": 4.159346430655514, "grad_norm": 1.265625, "learning_rate": 0.0003368366259953425, "loss": 4.7896, "mean_token_accuracy": 0.22070140689611434, "num_tokens": 92722144.0, "step": 53460 }, { "entropy": 5.340295076370239, "epoch": 4.159735460027232, "grad_norm": 1.15625, "learning_rate": 0.00033680997718298756, "loss": 4.6821, "mean_token_accuracy": 0.23180922269821166, "num_tokens": 92730472.0, "step": 53465 }, { "entropy": 5.356926345825196, "epoch": 4.1601244893989495, "grad_norm": 1.265625, "learning_rate": 0.00033678332743276466, "loss": 4.8201, "mean_token_accuracy": 0.22179990112781525, "num_tokens": 92738722.0, "step": 53470 }, { "entropy": 5.275622797012329, "epoch": 4.160513518770667, "grad_norm": 1.140625, "learning_rate": 0.0003367566767450781, "loss": 4.765, "mean_token_accuracy": 0.22227921485900878, "num_tokens": 92748115.0, "step": 53475 }, { "entropy": 5.31640043258667, "epoch": 4.160902548142385, "grad_norm": 1.2109375, "learning_rate": 0.00033673002512033223, "loss": 4.6787, "mean_token_accuracy": 0.22584378272294997, "num_tokens": 92756346.0, "step": 53480 }, { "entropy": 5.401664400100708, "epoch": 4.161291577514103, "grad_norm": 1.1328125, "learning_rate": 0.0003367033725589315, "loss": 4.8542, "mean_token_accuracy": 0.21716010868549346, "num_tokens": 92764779.0, "step": 53485 }, { "entropy": 5.38063645362854, "epoch": 4.16168060688582, "grad_norm": 1.1484375, "learning_rate": 0.0003366767190612804, "loss": 4.7548, "mean_token_accuracy": 0.2241999924182892, "num_tokens": 92773011.0, "step": 53490 }, { "entropy": 5.300395250320435, "epoch": 4.162069636257537, "grad_norm": 1.09375, "learning_rate": 0.0003366500646277831, "loss": 4.779, "mean_token_accuracy": 0.21551187187433243, "num_tokens": 92781928.0, "step": 53495 }, { "entropy": 5.281224012374878, "epoch": 4.162458665629255, "grad_norm": 1.125, "learning_rate": 0.0003366234092588443, "loss": 4.6711, "mean_token_accuracy": 0.23258210122585296, "num_tokens": 92790481.0, "step": 53500 }, { "entropy": 5.4500421524047855, "epoch": 4.1628476950009725, "grad_norm": 1.265625, "learning_rate": 0.00033659675295486826, "loss": 4.8466, "mean_token_accuracy": 0.21680304557085037, "num_tokens": 92799528.0, "step": 53505 }, { "entropy": 5.437161588668824, "epoch": 4.16323672437269, "grad_norm": 1.1640625, "learning_rate": 0.00033657009571625964, "loss": 4.8368, "mean_token_accuracy": 0.2186627596616745, "num_tokens": 92807964.0, "step": 53510 }, { "entropy": 5.33622899055481, "epoch": 4.163625753744408, "grad_norm": 1.109375, "learning_rate": 0.0003365434375434227, "loss": 4.7753, "mean_token_accuracy": 0.2174113780260086, "num_tokens": 92817010.0, "step": 53515 }, { "entropy": 5.35538878440857, "epoch": 4.164014783116126, "grad_norm": 1.125, "learning_rate": 0.00033651677843676213, "loss": 4.6977, "mean_token_accuracy": 0.2303978681564331, "num_tokens": 92826080.0, "step": 53520 }, { "entropy": 5.357707834243774, "epoch": 4.164403812487842, "grad_norm": 1.1796875, "learning_rate": 0.0003364901183966824, "loss": 4.7457, "mean_token_accuracy": 0.22311279326677322, "num_tokens": 92834837.0, "step": 53525 }, { "entropy": 5.428171539306641, "epoch": 4.16479284185956, "grad_norm": 1.140625, "learning_rate": 0.0003364634574235879, "loss": 4.8468, "mean_token_accuracy": 0.20580584406852723, "num_tokens": 92843618.0, "step": 53530 }, { "entropy": 5.441087245941162, "epoch": 4.165181871231278, "grad_norm": 1.1953125, "learning_rate": 0.00033643679551788325, "loss": 4.8529, "mean_token_accuracy": 0.21888138800859452, "num_tokens": 92851762.0, "step": 53535 }, { "entropy": 5.421589756011963, "epoch": 4.1655709006029955, "grad_norm": 1.2265625, "learning_rate": 0.00033641013267997317, "loss": 4.8889, "mean_token_accuracy": 0.21543263494968415, "num_tokens": 92861266.0, "step": 53540 }, { "entropy": 5.364040565490723, "epoch": 4.165959929974713, "grad_norm": 1.2265625, "learning_rate": 0.00033638346891026196, "loss": 4.6628, "mean_token_accuracy": 0.23844515085220336, "num_tokens": 92869519.0, "step": 53545 }, { "entropy": 5.4244238376617435, "epoch": 4.166348959346431, "grad_norm": 1.1171875, "learning_rate": 0.00033635680420915424, "loss": 4.8192, "mean_token_accuracy": 0.21743252426385878, "num_tokens": 92878363.0, "step": 53550 }, { "entropy": 5.3774501323699955, "epoch": 4.166737988718149, "grad_norm": 1.1328125, "learning_rate": 0.0003363301385770548, "loss": 4.8375, "mean_token_accuracy": 0.22313880771398545, "num_tokens": 92887319.0, "step": 53555 }, { "entropy": 5.414543676376343, "epoch": 4.167127018089865, "grad_norm": 1.203125, "learning_rate": 0.00033630347201436806, "loss": 4.738, "mean_token_accuracy": 0.22755542248487473, "num_tokens": 92896066.0, "step": 53560 }, { "entropy": 5.349680709838867, "epoch": 4.167516047461583, "grad_norm": 1.234375, "learning_rate": 0.00033627680452149873, "loss": 4.7576, "mean_token_accuracy": 0.22861727476119995, "num_tokens": 92904203.0, "step": 53565 }, { "entropy": 5.45750937461853, "epoch": 4.167905076833301, "grad_norm": 1.21875, "learning_rate": 0.0003362501360988514, "loss": 4.8241, "mean_token_accuracy": 0.2139332264661789, "num_tokens": 92913349.0, "step": 53570 }, { "entropy": 5.360860681533813, "epoch": 4.1682941062050185, "grad_norm": 1.1875, "learning_rate": 0.0003362234667468308, "loss": 4.7549, "mean_token_accuracy": 0.21687950789928437, "num_tokens": 92922250.0, "step": 53575 }, { "entropy": 5.3319714069366455, "epoch": 4.168683135576736, "grad_norm": 1.15625, "learning_rate": 0.0003361967964658415, "loss": 4.7219, "mean_token_accuracy": 0.22402497082948686, "num_tokens": 92930310.0, "step": 53580 }, { "entropy": 5.370862197875977, "epoch": 4.169072164948454, "grad_norm": 1.203125, "learning_rate": 0.0003361701252562882, "loss": 4.8233, "mean_token_accuracy": 0.2208467900753021, "num_tokens": 92938483.0, "step": 53585 }, { "entropy": 5.399597024917602, "epoch": 4.169461194320172, "grad_norm": 1.15625, "learning_rate": 0.00033614345311857566, "loss": 4.8123, "mean_token_accuracy": 0.21261609196662903, "num_tokens": 92948121.0, "step": 53590 }, { "entropy": 5.345770692825317, "epoch": 4.169850223691888, "grad_norm": 1.140625, "learning_rate": 0.0003361167800531085, "loss": 4.73, "mean_token_accuracy": 0.22886659651994706, "num_tokens": 92956714.0, "step": 53595 }, { "entropy": 5.400656270980835, "epoch": 4.170239253063606, "grad_norm": 1.203125, "learning_rate": 0.0003360901060602915, "loss": 4.8349, "mean_token_accuracy": 0.21506787836551666, "num_tokens": 92965494.0, "step": 53600 }, { "entropy": 5.376948642730713, "epoch": 4.170628282435324, "grad_norm": 1.125, "learning_rate": 0.00033606343114052936, "loss": 4.7835, "mean_token_accuracy": 0.222150619328022, "num_tokens": 92974909.0, "step": 53605 }, { "entropy": 5.394308757781983, "epoch": 4.1710173118070415, "grad_norm": 1.15625, "learning_rate": 0.00033603675529422685, "loss": 4.8198, "mean_token_accuracy": 0.2192682832479477, "num_tokens": 92983969.0, "step": 53610 }, { "entropy": 5.358304738998413, "epoch": 4.171406341178759, "grad_norm": 1.0859375, "learning_rate": 0.0003360100785217887, "loss": 4.7665, "mean_token_accuracy": 0.22236955910921097, "num_tokens": 92992461.0, "step": 53615 }, { "entropy": 5.409924650192261, "epoch": 4.171795370550477, "grad_norm": 1.1953125, "learning_rate": 0.0003359834008236198, "loss": 4.8436, "mean_token_accuracy": 0.20980946868658065, "num_tokens": 93000821.0, "step": 53620 }, { "entropy": 5.425667238235474, "epoch": 4.172184399922194, "grad_norm": 1.15625, "learning_rate": 0.0003359567222001248, "loss": 4.794, "mean_token_accuracy": 0.22910916209220886, "num_tokens": 93009092.0, "step": 53625 }, { "entropy": 5.350609874725341, "epoch": 4.172573429293911, "grad_norm": 1.2109375, "learning_rate": 0.0003359300426517085, "loss": 4.7061, "mean_token_accuracy": 0.2254367798566818, "num_tokens": 93017435.0, "step": 53630 }, { "entropy": 5.2702055931091305, "epoch": 4.172962458665629, "grad_norm": 1.125, "learning_rate": 0.0003359033621787759, "loss": 4.6885, "mean_token_accuracy": 0.2324233964085579, "num_tokens": 93026209.0, "step": 53635 }, { "entropy": 5.426909589767456, "epoch": 4.173351488037347, "grad_norm": 1.140625, "learning_rate": 0.0003358766807817317, "loss": 4.9137, "mean_token_accuracy": 0.21116809844970702, "num_tokens": 93035512.0, "step": 53640 }, { "entropy": 5.40611629486084, "epoch": 4.1737405174090645, "grad_norm": 1.109375, "learning_rate": 0.0003358499984609807, "loss": 4.8119, "mean_token_accuracy": 0.21704673916101455, "num_tokens": 93043837.0, "step": 53645 }, { "entropy": 5.3912139415740965, "epoch": 4.174129546780782, "grad_norm": 1.2109375, "learning_rate": 0.0003358233152169278, "loss": 4.7929, "mean_token_accuracy": 0.21657272428274155, "num_tokens": 93053253.0, "step": 53650 }, { "entropy": 5.395614862442017, "epoch": 4.1745185761525, "grad_norm": 1.1875, "learning_rate": 0.00033579663104997803, "loss": 4.795, "mean_token_accuracy": 0.22104662358760835, "num_tokens": 93061400.0, "step": 53655 }, { "entropy": 5.313544464111328, "epoch": 4.174907605524217, "grad_norm": 1.21875, "learning_rate": 0.00033576994596053606, "loss": 4.7035, "mean_token_accuracy": 0.2292048841714859, "num_tokens": 93070421.0, "step": 53660 }, { "entropy": 5.337964057922363, "epoch": 4.175296634895934, "grad_norm": 1.109375, "learning_rate": 0.0003357432599490069, "loss": 4.8215, "mean_token_accuracy": 0.2203061267733574, "num_tokens": 93079629.0, "step": 53665 }, { "entropy": 5.343481349945068, "epoch": 4.175685664267652, "grad_norm": 1.1953125, "learning_rate": 0.00033571657301579547, "loss": 4.7341, "mean_token_accuracy": 0.22378868013620376, "num_tokens": 93087778.0, "step": 53670 }, { "entropy": 5.284874677658081, "epoch": 4.17607469363937, "grad_norm": 1.0859375, "learning_rate": 0.0003356898851613067, "loss": 4.683, "mean_token_accuracy": 0.21865817308425903, "num_tokens": 93096450.0, "step": 53675 }, { "entropy": 5.316546297073364, "epoch": 4.1764637230110875, "grad_norm": 1.203125, "learning_rate": 0.0003356631963859455, "loss": 4.783, "mean_token_accuracy": 0.22254587858915328, "num_tokens": 93105225.0, "step": 53680 }, { "entropy": 5.470517635345459, "epoch": 4.176852752382805, "grad_norm": 1.2421875, "learning_rate": 0.0003356365066901168, "loss": 4.8655, "mean_token_accuracy": 0.2184503570199013, "num_tokens": 93114386.0, "step": 53685 }, { "entropy": 5.485641002655029, "epoch": 4.177241781754523, "grad_norm": 1.1953125, "learning_rate": 0.00033560981607422567, "loss": 4.8479, "mean_token_accuracy": 0.22222215682268143, "num_tokens": 93122900.0, "step": 53690 }, { "entropy": 5.337961912155151, "epoch": 4.17763081112624, "grad_norm": 1.234375, "learning_rate": 0.00033558312453867703, "loss": 4.7526, "mean_token_accuracy": 0.21666055917739868, "num_tokens": 93131542.0, "step": 53695 }, { "entropy": 5.365678167343139, "epoch": 4.178019840497957, "grad_norm": 1.0859375, "learning_rate": 0.00033555643208387593, "loss": 4.7946, "mean_token_accuracy": 0.2182489812374115, "num_tokens": 93140128.0, "step": 53700 }, { "entropy": 5.33752555847168, "epoch": 4.178408869869675, "grad_norm": 1.1484375, "learning_rate": 0.00033552973871022737, "loss": 4.7898, "mean_token_accuracy": 0.2201438680291176, "num_tokens": 93147966.0, "step": 53705 }, { "entropy": 5.431756639480591, "epoch": 4.178797899241393, "grad_norm": 1.1796875, "learning_rate": 0.00033550304441813634, "loss": 4.9159, "mean_token_accuracy": 0.20920156687498093, "num_tokens": 93156915.0, "step": 53710 }, { "entropy": 5.383739852905274, "epoch": 4.1791869286131105, "grad_norm": 1.0703125, "learning_rate": 0.0003354763492080079, "loss": 4.7606, "mean_token_accuracy": 0.22537904977798462, "num_tokens": 93165844.0, "step": 53715 }, { "entropy": 5.364845275878906, "epoch": 4.179575957984828, "grad_norm": 1.1953125, "learning_rate": 0.0003354496530802472, "loss": 4.7742, "mean_token_accuracy": 0.2161043554544449, "num_tokens": 93174653.0, "step": 53720 }, { "entropy": 5.390312671661377, "epoch": 4.179964987356545, "grad_norm": 1.1796875, "learning_rate": 0.0003354229560352592, "loss": 4.7963, "mean_token_accuracy": 0.22337675392627715, "num_tokens": 93183407.0, "step": 53725 }, { "entropy": 5.46422643661499, "epoch": 4.180354016728263, "grad_norm": 1.203125, "learning_rate": 0.0003353962580734489, "loss": 4.8527, "mean_token_accuracy": 0.22105470001697541, "num_tokens": 93192103.0, "step": 53730 }, { "entropy": 5.30750994682312, "epoch": 4.18074304609998, "grad_norm": 1.1640625, "learning_rate": 0.00033536955919522167, "loss": 4.6999, "mean_token_accuracy": 0.2252844676375389, "num_tokens": 93200018.0, "step": 53735 }, { "entropy": 5.419745445251465, "epoch": 4.181132075471698, "grad_norm": 1.296875, "learning_rate": 0.0003353428594009824, "loss": 4.7868, "mean_token_accuracy": 0.22511323988437654, "num_tokens": 93207927.0, "step": 53740 }, { "entropy": 5.3652387142181395, "epoch": 4.181521104843416, "grad_norm": 1.1171875, "learning_rate": 0.00033531615869113624, "loss": 4.771, "mean_token_accuracy": 0.2224264308810234, "num_tokens": 93217027.0, "step": 53745 }, { "entropy": 5.4007316589355465, "epoch": 4.1819101342151335, "grad_norm": 1.0390625, "learning_rate": 0.00033528945706608844, "loss": 4.8004, "mean_token_accuracy": 0.22059719413518905, "num_tokens": 93225415.0, "step": 53750 }, { "entropy": 5.421299934387207, "epoch": 4.182299163586851, "grad_norm": 1.2265625, "learning_rate": 0.00033526275452624407, "loss": 4.7843, "mean_token_accuracy": 0.21150245219469072, "num_tokens": 93234054.0, "step": 53755 }, { "entropy": 5.38250207901001, "epoch": 4.182688192958568, "grad_norm": 1.1328125, "learning_rate": 0.00033523605107200826, "loss": 4.7604, "mean_token_accuracy": 0.220413476228714, "num_tokens": 93242135.0, "step": 53760 }, { "entropy": 5.299374294281006, "epoch": 4.183077222330286, "grad_norm": 1.1640625, "learning_rate": 0.00033520934670378634, "loss": 4.6694, "mean_token_accuracy": 0.22988593727350234, "num_tokens": 93249946.0, "step": 53765 }, { "entropy": 5.472810077667236, "epoch": 4.183466251702003, "grad_norm": 1.1796875, "learning_rate": 0.00033518264142198335, "loss": 4.906, "mean_token_accuracy": 0.2101896196603775, "num_tokens": 93258692.0, "step": 53770 }, { "entropy": 5.408917045593261, "epoch": 4.183855281073721, "grad_norm": 1.1796875, "learning_rate": 0.0003351559352270047, "loss": 4.7715, "mean_token_accuracy": 0.2248375177383423, "num_tokens": 93267882.0, "step": 53775 }, { "entropy": 5.4407814025878904, "epoch": 4.184244310445439, "grad_norm": 1.1875, "learning_rate": 0.00033512922811925535, "loss": 4.903, "mean_token_accuracy": 0.2104749083518982, "num_tokens": 93276922.0, "step": 53780 }, { "entropy": 5.440193557739258, "epoch": 4.1846333398171565, "grad_norm": 1.140625, "learning_rate": 0.0003351025200991406, "loss": 4.8148, "mean_token_accuracy": 0.21636549532413482, "num_tokens": 93285918.0, "step": 53785 }, { "entropy": 5.4235235214233395, "epoch": 4.185022369188874, "grad_norm": 1.1640625, "learning_rate": 0.0003350758111670659, "loss": 4.7368, "mean_token_accuracy": 0.22986736744642258, "num_tokens": 93294116.0, "step": 53790 }, { "entropy": 5.234165143966675, "epoch": 4.185411398560591, "grad_norm": 1.71875, "learning_rate": 0.0003350491013234364, "loss": 4.5842, "mean_token_accuracy": 0.241888128221035, "num_tokens": 93303108.0, "step": 53795 }, { "entropy": 5.328868055343628, "epoch": 4.185800427932309, "grad_norm": 1.1171875, "learning_rate": 0.0003350223905686573, "loss": 4.722, "mean_token_accuracy": 0.22303550243377684, "num_tokens": 93311774.0, "step": 53800 }, { "entropy": 5.42891936302185, "epoch": 4.186189457304026, "grad_norm": 1.2265625, "learning_rate": 0.000334995678903134, "loss": 4.8092, "mean_token_accuracy": 0.22451190054416656, "num_tokens": 93320312.0, "step": 53805 }, { "entropy": 5.3681875705719, "epoch": 4.186578486675744, "grad_norm": 1.171875, "learning_rate": 0.0003349689663272718, "loss": 4.7244, "mean_token_accuracy": 0.22296006083488465, "num_tokens": 93328963.0, "step": 53810 }, { "entropy": 5.473629760742187, "epoch": 4.186967516047462, "grad_norm": 1.21875, "learning_rate": 0.0003349422528414759, "loss": 4.8343, "mean_token_accuracy": 0.21576391011476517, "num_tokens": 93337323.0, "step": 53815 }, { "entropy": 5.311782026290894, "epoch": 4.1873565454191795, "grad_norm": 1.25, "learning_rate": 0.0003349155384461517, "loss": 4.7578, "mean_token_accuracy": 0.21739377379417418, "num_tokens": 93345571.0, "step": 53820 }, { "entropy": 5.357076501846313, "epoch": 4.187745574790897, "grad_norm": 1.2265625, "learning_rate": 0.00033488882314170463, "loss": 4.8018, "mean_token_accuracy": 0.21984760612249374, "num_tokens": 93355297.0, "step": 53825 }, { "entropy": 5.366396093368531, "epoch": 4.188134604162614, "grad_norm": 1.1328125, "learning_rate": 0.00033486210692854, "loss": 4.6997, "mean_token_accuracy": 0.2271649032831192, "num_tokens": 93363885.0, "step": 53830 }, { "entropy": 5.413512802124023, "epoch": 4.188523633534332, "grad_norm": 1.21875, "learning_rate": 0.0003348353898070631, "loss": 4.8102, "mean_token_accuracy": 0.21603149622678758, "num_tokens": 93372231.0, "step": 53835 }, { "entropy": 5.301718807220459, "epoch": 4.188912662906049, "grad_norm": 1.1640625, "learning_rate": 0.0003348086717776795, "loss": 4.715, "mean_token_accuracy": 0.2264656290411949, "num_tokens": 93381391.0, "step": 53840 }, { "entropy": 5.403948831558227, "epoch": 4.189301692277767, "grad_norm": 1.3359375, "learning_rate": 0.00033478195284079447, "loss": 4.7943, "mean_token_accuracy": 0.22427505552768706, "num_tokens": 93390916.0, "step": 53845 }, { "entropy": 5.436588621139526, "epoch": 4.189690721649485, "grad_norm": 1.234375, "learning_rate": 0.0003347552329968134, "loss": 4.8179, "mean_token_accuracy": 0.22005128860473633, "num_tokens": 93399318.0, "step": 53850 }, { "entropy": 5.409006929397583, "epoch": 4.1900797510212024, "grad_norm": 1.1328125, "learning_rate": 0.0003347285122461419, "loss": 4.872, "mean_token_accuracy": 0.21279677003622055, "num_tokens": 93408319.0, "step": 53855 }, { "entropy": 5.300862646102905, "epoch": 4.190468780392919, "grad_norm": 1.1875, "learning_rate": 0.0003347017905891852, "loss": 4.7336, "mean_token_accuracy": 0.22485802322626114, "num_tokens": 93416765.0, "step": 53860 }, { "entropy": 5.402885246276855, "epoch": 4.190857809764637, "grad_norm": 1.09375, "learning_rate": 0.0003346750680263488, "loss": 4.7662, "mean_token_accuracy": 0.21827685683965684, "num_tokens": 93425256.0, "step": 53865 }, { "entropy": 5.421969223022461, "epoch": 4.191246839136355, "grad_norm": 1.25, "learning_rate": 0.0003346483445580384, "loss": 4.7693, "mean_token_accuracy": 0.22109905183315276, "num_tokens": 93433513.0, "step": 53870 }, { "entropy": 5.449046802520752, "epoch": 4.191635868508072, "grad_norm": 1.2890625, "learning_rate": 0.00033462162018465917, "loss": 4.8902, "mean_token_accuracy": 0.2043241187930107, "num_tokens": 93441978.0, "step": 53875 }, { "entropy": 5.358885049819946, "epoch": 4.19202489787979, "grad_norm": 1.171875, "learning_rate": 0.00033459489490661676, "loss": 4.7333, "mean_token_accuracy": 0.22785516381263732, "num_tokens": 93450943.0, "step": 53880 }, { "entropy": 5.402722501754761, "epoch": 4.192413927251508, "grad_norm": 1.171875, "learning_rate": 0.00033456816872431673, "loss": 4.838, "mean_token_accuracy": 0.22170499116182327, "num_tokens": 93459408.0, "step": 53885 }, { "entropy": 5.4166364669799805, "epoch": 4.192802956623225, "grad_norm": 1.171875, "learning_rate": 0.0003345414416381645, "loss": 4.8286, "mean_token_accuracy": 0.22364921271800994, "num_tokens": 93466959.0, "step": 53890 }, { "entropy": 5.431374263763428, "epoch": 4.193191985994942, "grad_norm": 1.171875, "learning_rate": 0.00033451471364856565, "loss": 4.8368, "mean_token_accuracy": 0.21590153127908707, "num_tokens": 93475584.0, "step": 53895 }, { "entropy": 5.3815165042877195, "epoch": 4.19358101536666, "grad_norm": 1.265625, "learning_rate": 0.00033448798475592585, "loss": 4.8888, "mean_token_accuracy": 0.22040918320417405, "num_tokens": 93484081.0, "step": 53900 }, { "entropy": 5.4178613185882565, "epoch": 4.193970044738378, "grad_norm": 1.1875, "learning_rate": 0.0003344612549606505, "loss": 4.7908, "mean_token_accuracy": 0.2203831657767296, "num_tokens": 93492499.0, "step": 53905 }, { "entropy": 5.328008127212525, "epoch": 4.194359074110095, "grad_norm": 1.2421875, "learning_rate": 0.0003344345242631453, "loss": 4.7443, "mean_token_accuracy": 0.2275153651833534, "num_tokens": 93500676.0, "step": 53910 }, { "entropy": 5.357608032226563, "epoch": 4.194748103481813, "grad_norm": 1.140625, "learning_rate": 0.0003344077926638157, "loss": 4.8141, "mean_token_accuracy": 0.2158311665058136, "num_tokens": 93509486.0, "step": 53915 }, { "entropy": 5.349962902069092, "epoch": 4.195137132853531, "grad_norm": 1.1484375, "learning_rate": 0.00033438106016306753, "loss": 4.6808, "mean_token_accuracy": 0.22268983572721482, "num_tokens": 93517864.0, "step": 53920 }, { "entropy": 5.382796955108643, "epoch": 4.195526162225248, "grad_norm": 1.203125, "learning_rate": 0.0003343543267613062, "loss": 4.7904, "mean_token_accuracy": 0.21313904076814652, "num_tokens": 93526452.0, "step": 53925 }, { "entropy": 5.369426441192627, "epoch": 4.195915191596965, "grad_norm": 1.1171875, "learning_rate": 0.0003343275924589374, "loss": 4.7939, "mean_token_accuracy": 0.22036897391080856, "num_tokens": 93535114.0, "step": 53930 }, { "entropy": 5.291434717178345, "epoch": 4.196304220968683, "grad_norm": 1.2109375, "learning_rate": 0.00033430085725636685, "loss": 4.7738, "mean_token_accuracy": 0.2182529389858246, "num_tokens": 93543844.0, "step": 53935 }, { "entropy": 5.353103065490723, "epoch": 4.196693250340401, "grad_norm": 1.109375, "learning_rate": 0.0003342741211540002, "loss": 4.7266, "mean_token_accuracy": 0.21847303956747055, "num_tokens": 93552439.0, "step": 53940 }, { "entropy": 5.377645492553711, "epoch": 4.197082279712118, "grad_norm": 1.1015625, "learning_rate": 0.0003342473841522431, "loss": 4.8568, "mean_token_accuracy": 0.21479688137769698, "num_tokens": 93561655.0, "step": 53945 }, { "entropy": 5.4018879413604735, "epoch": 4.197471309083836, "grad_norm": 1.21875, "learning_rate": 0.00033422064625150124, "loss": 4.7929, "mean_token_accuracy": 0.21797087043523788, "num_tokens": 93570070.0, "step": 53950 }, { "entropy": 5.344179677963257, "epoch": 4.197860338455554, "grad_norm": 1.125, "learning_rate": 0.0003341939074521804, "loss": 4.7414, "mean_token_accuracy": 0.22746467739343643, "num_tokens": 93579052.0, "step": 53955 }, { "entropy": 5.374979066848755, "epoch": 4.1982493678272705, "grad_norm": 1.078125, "learning_rate": 0.0003341671677546861, "loss": 4.7494, "mean_token_accuracy": 0.224351404607296, "num_tokens": 93588873.0, "step": 53960 }, { "entropy": 5.330835247039795, "epoch": 4.198638397198988, "grad_norm": 1.125, "learning_rate": 0.00033414042715942423, "loss": 4.7666, "mean_token_accuracy": 0.22554274648427963, "num_tokens": 93597132.0, "step": 53965 }, { "entropy": 5.388536882400513, "epoch": 4.199027426570706, "grad_norm": 1.1484375, "learning_rate": 0.0003341136856668005, "loss": 4.7338, "mean_token_accuracy": 0.22246773689985275, "num_tokens": 93604881.0, "step": 53970 }, { "entropy": 5.377799415588379, "epoch": 4.199416455942424, "grad_norm": 1.140625, "learning_rate": 0.0003340869432772207, "loss": 4.7718, "mean_token_accuracy": 0.21984119713306427, "num_tokens": 93612935.0, "step": 53975 }, { "entropy": 5.399924802780151, "epoch": 4.199805485314141, "grad_norm": 1.171875, "learning_rate": 0.00033406019999109065, "loss": 4.8131, "mean_token_accuracy": 0.22094771564006804, "num_tokens": 93621551.0, "step": 53980 }, { "entropy": 5.374249267578125, "epoch": 4.200194514685859, "grad_norm": 1.1953125, "learning_rate": 0.00033403345580881606, "loss": 4.7782, "mean_token_accuracy": 0.22279789447784423, "num_tokens": 93630275.0, "step": 53985 }, { "entropy": 5.370848178863525, "epoch": 4.200583544057577, "grad_norm": 1.2421875, "learning_rate": 0.00033400671073080274, "loss": 4.8331, "mean_token_accuracy": 0.2096216171979904, "num_tokens": 93639823.0, "step": 53990 }, { "entropy": 5.472932052612305, "epoch": 4.2009725734292935, "grad_norm": 1.25, "learning_rate": 0.0003339799647574564, "loss": 4.7637, "mean_token_accuracy": 0.2204767420887947, "num_tokens": 93647779.0, "step": 53995 }, { "entropy": 5.4163245677948, "epoch": 4.201361602801011, "grad_norm": 1.1875, "learning_rate": 0.0003339532178891831, "loss": 4.7986, "mean_token_accuracy": 0.21846953332424163, "num_tokens": 93656282.0, "step": 54000 }, { "epoch": 4.201361602801011, "eval_entropy": 5.1061626067175325, "eval_loss": 4.952186584472656, "eval_mean_token_accuracy": 0.2207359118915958, "eval_num_tokens": 93656282.0, "eval_runtime": 28.8446, "eval_samples_per_second": 1440.757, "eval_steps_per_second": 180.103, "step": 54000 }, { "entropy": 5.413721227645874, "epoch": 4.201750632172729, "grad_norm": 1.1796875, "learning_rate": 0.0003339264701263885, "loss": 4.8783, "mean_token_accuracy": 0.21241841912269593, "num_tokens": 93664593.0, "step": 54005 }, { "entropy": 5.322483015060425, "epoch": 4.202139661544447, "grad_norm": 1.109375, "learning_rate": 0.0003338997214694784, "loss": 4.6668, "mean_token_accuracy": 0.22761227041482926, "num_tokens": 93672608.0, "step": 54010 }, { "entropy": 5.394267129898071, "epoch": 4.202528690916164, "grad_norm": 1.203125, "learning_rate": 0.00033387297191885896, "loss": 4.8586, "mean_token_accuracy": 0.21157996207475663, "num_tokens": 93681635.0, "step": 54015 }, { "entropy": 5.404514217376709, "epoch": 4.202917720287882, "grad_norm": 1.15625, "learning_rate": 0.0003338462214749358, "loss": 4.787, "mean_token_accuracy": 0.2195822149515152, "num_tokens": 93690346.0, "step": 54020 }, { "entropy": 5.411816167831421, "epoch": 4.2033067496596, "grad_norm": 1.1953125, "learning_rate": 0.0003338194701381148, "loss": 4.8318, "mean_token_accuracy": 0.2175027996301651, "num_tokens": 93698629.0, "step": 54025 }, { "entropy": 5.4680705070495605, "epoch": 4.2036957790313165, "grad_norm": 1.2578125, "learning_rate": 0.00033379271790880203, "loss": 4.8792, "mean_token_accuracy": 0.2168081820011139, "num_tokens": 93707173.0, "step": 54030 }, { "entropy": 5.37090106010437, "epoch": 4.204084808403034, "grad_norm": 1.2109375, "learning_rate": 0.0003337659647874034, "loss": 4.7643, "mean_token_accuracy": 0.22579385042190553, "num_tokens": 93715999.0, "step": 54035 }, { "entropy": 5.406820631027221, "epoch": 4.204473837774752, "grad_norm": 1.1953125, "learning_rate": 0.0003337392107743248, "loss": 4.8112, "mean_token_accuracy": 0.22400469183921815, "num_tokens": 93725446.0, "step": 54040 }, { "entropy": 5.440329122543335, "epoch": 4.20486286714647, "grad_norm": 1.125, "learning_rate": 0.0003337124558699721, "loss": 4.7644, "mean_token_accuracy": 0.22213332056999208, "num_tokens": 93733652.0, "step": 54045 }, { "entropy": 5.381520223617554, "epoch": 4.205251896518187, "grad_norm": 1.203125, "learning_rate": 0.00033368570007475133, "loss": 4.7646, "mean_token_accuracy": 0.2228358954191208, "num_tokens": 93742007.0, "step": 54050 }, { "entropy": 5.438037967681884, "epoch": 4.205640925889905, "grad_norm": 1.2734375, "learning_rate": 0.0003336589433890685, "loss": 4.889, "mean_token_accuracy": 0.21007149964570998, "num_tokens": 93751009.0, "step": 54055 }, { "entropy": 5.271495962142945, "epoch": 4.206029955261622, "grad_norm": 1.2265625, "learning_rate": 0.00033363218581332956, "loss": 4.7069, "mean_token_accuracy": 0.22716987133026123, "num_tokens": 93760412.0, "step": 54060 }, { "entropy": 5.3505784034729, "epoch": 4.2064189846333395, "grad_norm": 1.2109375, "learning_rate": 0.0003336054273479405, "loss": 4.7254, "mean_token_accuracy": 0.22015329152345658, "num_tokens": 93768786.0, "step": 54065 }, { "entropy": 5.4974394798278805, "epoch": 4.206808014005057, "grad_norm": 1.2265625, "learning_rate": 0.00033357866799330743, "loss": 4.9267, "mean_token_accuracy": 0.20547130405902864, "num_tokens": 93778537.0, "step": 54070 }, { "entropy": 5.311965751647949, "epoch": 4.207197043376775, "grad_norm": 1.1875, "learning_rate": 0.00033355190774983626, "loss": 4.6907, "mean_token_accuracy": 0.22096313387155533, "num_tokens": 93786742.0, "step": 54075 }, { "entropy": 5.300377130508423, "epoch": 4.207586072748493, "grad_norm": 1.171875, "learning_rate": 0.00033352514661793306, "loss": 4.7779, "mean_token_accuracy": 0.22542177885770798, "num_tokens": 93795837.0, "step": 54080 }, { "entropy": 5.310730075836181, "epoch": 4.20797510212021, "grad_norm": 1.1484375, "learning_rate": 0.00033349838459800394, "loss": 4.7743, "mean_token_accuracy": 0.22179348170757293, "num_tokens": 93805080.0, "step": 54085 }, { "entropy": 5.543870210647583, "epoch": 4.208364131491928, "grad_norm": 1.2265625, "learning_rate": 0.000333471621690455, "loss": 4.8939, "mean_token_accuracy": 0.20702438205480575, "num_tokens": 93813934.0, "step": 54090 }, { "entropy": 5.437402629852295, "epoch": 4.208753160863645, "grad_norm": 1.2421875, "learning_rate": 0.0003334448578956921, "loss": 4.8325, "mean_token_accuracy": 0.21717978566884993, "num_tokens": 93822728.0, "step": 54095 }, { "entropy": 5.397933530807495, "epoch": 4.2091421902353625, "grad_norm": 1.234375, "learning_rate": 0.0003334180932141217, "loss": 4.7437, "mean_token_accuracy": 0.2236942544579506, "num_tokens": 93831649.0, "step": 54100 }, { "entropy": 5.429098606109619, "epoch": 4.20953121960708, "grad_norm": 1.1953125, "learning_rate": 0.0003333913276461497, "loss": 4.8341, "mean_token_accuracy": 0.21753476560115814, "num_tokens": 93840634.0, "step": 54105 }, { "entropy": 5.432504415512085, "epoch": 4.209920248978798, "grad_norm": 1.21875, "learning_rate": 0.00033336456119218214, "loss": 4.8095, "mean_token_accuracy": 0.22509506046772004, "num_tokens": 93848332.0, "step": 54110 }, { "entropy": 5.308867979049682, "epoch": 4.210309278350516, "grad_norm": 1.1953125, "learning_rate": 0.00033333779385262525, "loss": 4.7016, "mean_token_accuracy": 0.22646436393260955, "num_tokens": 93856867.0, "step": 54115 }, { "entropy": 5.271472501754761, "epoch": 4.210698307722233, "grad_norm": 1.1171875, "learning_rate": 0.00033331102562788527, "loss": 4.7271, "mean_token_accuracy": 0.22100264728069305, "num_tokens": 93864803.0, "step": 54120 }, { "entropy": 5.394699478149414, "epoch": 4.211087337093951, "grad_norm": 1.3125, "learning_rate": 0.0003332842565183682, "loss": 4.817, "mean_token_accuracy": 0.21922930628061293, "num_tokens": 93872804.0, "step": 54125 }, { "entropy": 5.3162439346313475, "epoch": 4.211476366465668, "grad_norm": 1.1484375, "learning_rate": 0.00033325748652448037, "loss": 4.7067, "mean_token_accuracy": 0.22851113677024842, "num_tokens": 93881147.0, "step": 54130 }, { "entropy": 5.460040044784546, "epoch": 4.2118653958373855, "grad_norm": 1.125, "learning_rate": 0.00033323071564662796, "loss": 4.8435, "mean_token_accuracy": 0.21293179243803023, "num_tokens": 93890062.0, "step": 54135 }, { "entropy": 5.369645833969116, "epoch": 4.212254425209103, "grad_norm": 1.1640625, "learning_rate": 0.00033320394388521707, "loss": 4.7584, "mean_token_accuracy": 0.22452980428934097, "num_tokens": 93899032.0, "step": 54140 }, { "entropy": 5.433514785766602, "epoch": 4.212643454580821, "grad_norm": 1.1015625, "learning_rate": 0.000333177171240654, "loss": 4.8225, "mean_token_accuracy": 0.22203367352485656, "num_tokens": 93907977.0, "step": 54145 }, { "entropy": 5.319333600997925, "epoch": 4.213032483952539, "grad_norm": 1.1796875, "learning_rate": 0.00033315039771334494, "loss": 4.7437, "mean_token_accuracy": 0.22303917557001113, "num_tokens": 93915818.0, "step": 54150 }, { "entropy": 5.351129674911499, "epoch": 4.213421513324256, "grad_norm": 1.1875, "learning_rate": 0.0003331236233036961, "loss": 4.8073, "mean_token_accuracy": 0.2211129143834114, "num_tokens": 93924628.0, "step": 54155 }, { "entropy": 5.347161197662354, "epoch": 4.213810542695974, "grad_norm": 1.1640625, "learning_rate": 0.0003330968480121138, "loss": 4.7662, "mean_token_accuracy": 0.2211957648396492, "num_tokens": 93933173.0, "step": 54160 }, { "entropy": 5.313761472702026, "epoch": 4.214199572067691, "grad_norm": 1.2734375, "learning_rate": 0.0003330700718390043, "loss": 4.7138, "mean_token_accuracy": 0.23115722984075546, "num_tokens": 93941797.0, "step": 54165 }, { "entropy": 5.395924186706543, "epoch": 4.2145886014394085, "grad_norm": 1.2265625, "learning_rate": 0.00033304329478477395, "loss": 4.7917, "mean_token_accuracy": 0.22322095781564713, "num_tokens": 93950668.0, "step": 54170 }, { "entropy": 5.465241527557373, "epoch": 4.214977630811126, "grad_norm": 1.1796875, "learning_rate": 0.00033301651684982894, "loss": 4.8911, "mean_token_accuracy": 0.21785181760787964, "num_tokens": 93959508.0, "step": 54175 }, { "entropy": 5.393065547943115, "epoch": 4.215366660182844, "grad_norm": 1.1875, "learning_rate": 0.0003329897380345757, "loss": 4.8347, "mean_token_accuracy": 0.22152369171380998, "num_tokens": 93967762.0, "step": 54180 }, { "entropy": 5.4191831111907955, "epoch": 4.215755689554562, "grad_norm": 1.1796875, "learning_rate": 0.0003329629583394204, "loss": 4.8411, "mean_token_accuracy": 0.21768186688423158, "num_tokens": 93976139.0, "step": 54185 }, { "entropy": 5.337548494338989, "epoch": 4.216144718926279, "grad_norm": 1.2265625, "learning_rate": 0.0003329361777647695, "loss": 4.7687, "mean_token_accuracy": 0.2307794988155365, "num_tokens": 93984833.0, "step": 54190 }, { "entropy": 5.388611316680908, "epoch": 4.216533748297996, "grad_norm": 1.1171875, "learning_rate": 0.0003329093963110293, "loss": 4.8239, "mean_token_accuracy": 0.21922485828399657, "num_tokens": 93992868.0, "step": 54195 }, { "entropy": 5.427775144577026, "epoch": 4.216922777669714, "grad_norm": 1.203125, "learning_rate": 0.00033288261397860613, "loss": 4.7516, "mean_token_accuracy": 0.22263300120830537, "num_tokens": 94000832.0, "step": 54200 }, { "entropy": 5.436736345291138, "epoch": 4.2173118070414315, "grad_norm": 1.1875, "learning_rate": 0.00033285583076790646, "loss": 4.8423, "mean_token_accuracy": 0.21735973805189132, "num_tokens": 94009511.0, "step": 54205 }, { "entropy": 5.334018039703369, "epoch": 4.217700836413149, "grad_norm": 1.1328125, "learning_rate": 0.00033282904667933675, "loss": 4.7058, "mean_token_accuracy": 0.22501945346593857, "num_tokens": 94017431.0, "step": 54210 }, { "entropy": 5.34884991645813, "epoch": 4.218089865784867, "grad_norm": 1.2109375, "learning_rate": 0.0003328022617133032, "loss": 4.8155, "mean_token_accuracy": 0.22382503300905227, "num_tokens": 94025818.0, "step": 54215 }, { "entropy": 5.419087648391724, "epoch": 4.218478895156585, "grad_norm": 1.15625, "learning_rate": 0.0003327754758702124, "loss": 4.8293, "mean_token_accuracy": 0.2125893473625183, "num_tokens": 94033871.0, "step": 54220 }, { "entropy": 5.362149000167847, "epoch": 4.218867924528302, "grad_norm": 1.1953125, "learning_rate": 0.00033274868915047064, "loss": 4.8126, "mean_token_accuracy": 0.21389147490262986, "num_tokens": 94042377.0, "step": 54225 }, { "entropy": 5.440541410446167, "epoch": 4.219256953900019, "grad_norm": 1.2421875, "learning_rate": 0.00033272190155448446, "loss": 4.8686, "mean_token_accuracy": 0.20961861461400985, "num_tokens": 94051070.0, "step": 54230 }, { "entropy": 5.331201791763306, "epoch": 4.219645983271737, "grad_norm": 1.1796875, "learning_rate": 0.0003326951130826603, "loss": 4.7061, "mean_token_accuracy": 0.21504910290241241, "num_tokens": 94059239.0, "step": 54235 }, { "entropy": 5.331786155700684, "epoch": 4.2200350126434545, "grad_norm": 1.1953125, "learning_rate": 0.00033266832373540463, "loss": 4.6967, "mean_token_accuracy": 0.23223818391561507, "num_tokens": 94068104.0, "step": 54240 }, { "entropy": 5.326653337478637, "epoch": 4.220424042015172, "grad_norm": 1.2421875, "learning_rate": 0.0003326415335131239, "loss": 4.7567, "mean_token_accuracy": 0.22703139036893843, "num_tokens": 94077228.0, "step": 54245 }, { "entropy": 5.412949085235596, "epoch": 4.22081307138689, "grad_norm": 1.2421875, "learning_rate": 0.00033261474241622475, "loss": 4.8261, "mean_token_accuracy": 0.21173980981111526, "num_tokens": 94085504.0, "step": 54250 }, { "entropy": 5.411124801635742, "epoch": 4.221202100758608, "grad_norm": 1.1640625, "learning_rate": 0.0003325879504451135, "loss": 4.7354, "mean_token_accuracy": 0.22245051413774491, "num_tokens": 94094159.0, "step": 54255 }, { "entropy": 5.357756662368774, "epoch": 4.221591130130324, "grad_norm": 1.1953125, "learning_rate": 0.00033256115760019677, "loss": 4.8223, "mean_token_accuracy": 0.21488324254751207, "num_tokens": 94102936.0, "step": 54260 }, { "entropy": 5.390393924713135, "epoch": 4.221980159502042, "grad_norm": 1.21875, "learning_rate": 0.00033253436388188106, "loss": 4.8609, "mean_token_accuracy": 0.21579848378896713, "num_tokens": 94112542.0, "step": 54265 }, { "entropy": 5.4438127994537355, "epoch": 4.22236918887376, "grad_norm": 1.1796875, "learning_rate": 0.000332507569290573, "loss": 4.8349, "mean_token_accuracy": 0.21339676529169083, "num_tokens": 94121835.0, "step": 54270 }, { "entropy": 5.407558298110962, "epoch": 4.2227582182454775, "grad_norm": 1.140625, "learning_rate": 0.00033248077382667913, "loss": 4.7645, "mean_token_accuracy": 0.21629995107650757, "num_tokens": 94130862.0, "step": 54275 }, { "entropy": 5.363882207870484, "epoch": 4.223147247617195, "grad_norm": 1.1953125, "learning_rate": 0.000332453977490606, "loss": 4.6618, "mean_token_accuracy": 0.23720863759517669, "num_tokens": 94138824.0, "step": 54280 }, { "entropy": 5.327428245544434, "epoch": 4.223536276988913, "grad_norm": 1.21875, "learning_rate": 0.0003324271802827602, "loss": 4.7693, "mean_token_accuracy": 0.21825953125953673, "num_tokens": 94147454.0, "step": 54285 }, { "entropy": 5.4311034202575685, "epoch": 4.223925306360631, "grad_norm": 1.21875, "learning_rate": 0.0003324003822035483, "loss": 4.8164, "mean_token_accuracy": 0.2180324003100395, "num_tokens": 94155824.0, "step": 54290 }, { "entropy": 5.402398109436035, "epoch": 4.224314335732347, "grad_norm": 1.15625, "learning_rate": 0.0003323735832533771, "loss": 4.7758, "mean_token_accuracy": 0.2224586397409439, "num_tokens": 94164698.0, "step": 54295 }, { "entropy": 5.294981861114502, "epoch": 4.224703365104065, "grad_norm": 1.1953125, "learning_rate": 0.00033234678343265297, "loss": 4.7065, "mean_token_accuracy": 0.2342843860387802, "num_tokens": 94172843.0, "step": 54300 }, { "entropy": 5.351537561416626, "epoch": 4.225092394475783, "grad_norm": 1.1171875, "learning_rate": 0.0003323199827417827, "loss": 4.7549, "mean_token_accuracy": 0.21461116671562194, "num_tokens": 94181318.0, "step": 54305 }, { "entropy": 5.427299642562867, "epoch": 4.2254814238475005, "grad_norm": 1.25, "learning_rate": 0.00033229318118117293, "loss": 4.8931, "mean_token_accuracy": 0.2248120576143265, "num_tokens": 94189704.0, "step": 54310 }, { "entropy": 5.422319555282593, "epoch": 4.225870453219218, "grad_norm": 1.1953125, "learning_rate": 0.00033226637875123026, "loss": 4.7451, "mean_token_accuracy": 0.2226056694984436, "num_tokens": 94197893.0, "step": 54315 }, { "entropy": 5.327775287628174, "epoch": 4.226259482590936, "grad_norm": 1.09375, "learning_rate": 0.00033223957545236156, "loss": 4.7249, "mean_token_accuracy": 0.23564747720956802, "num_tokens": 94207120.0, "step": 54320 }, { "entropy": 5.465853881835938, "epoch": 4.226648511962654, "grad_norm": 1.1328125, "learning_rate": 0.0003322127712849733, "loss": 4.7893, "mean_token_accuracy": 0.21810625791549682, "num_tokens": 94215992.0, "step": 54325 }, { "entropy": 5.382071685791016, "epoch": 4.22703754133437, "grad_norm": 1.1875, "learning_rate": 0.0003321859662494724, "loss": 4.7878, "mean_token_accuracy": 0.21572877764701842, "num_tokens": 94224807.0, "step": 54330 }, { "entropy": 5.398567152023316, "epoch": 4.227426570706088, "grad_norm": 1.15625, "learning_rate": 0.0003321591603462654, "loss": 4.8435, "mean_token_accuracy": 0.21412058025598527, "num_tokens": 94233339.0, "step": 54335 }, { "entropy": 5.371603107452392, "epoch": 4.227815600077806, "grad_norm": 1.2265625, "learning_rate": 0.0003321323535757592, "loss": 4.693, "mean_token_accuracy": 0.22949099987745286, "num_tokens": 94241269.0, "step": 54340 }, { "entropy": 5.346029281616211, "epoch": 4.2282046294495235, "grad_norm": 1.1953125, "learning_rate": 0.0003321055459383604, "loss": 4.7916, "mean_token_accuracy": 0.21783567667007447, "num_tokens": 94250259.0, "step": 54345 }, { "entropy": 5.331884908676147, "epoch": 4.228593658821241, "grad_norm": 1.203125, "learning_rate": 0.00033207873743447587, "loss": 4.6972, "mean_token_accuracy": 0.23068632930517197, "num_tokens": 94259021.0, "step": 54350 }, { "entropy": 5.450727558135986, "epoch": 4.228982688192959, "grad_norm": 1.2265625, "learning_rate": 0.00033205192806451227, "loss": 4.8254, "mean_token_accuracy": 0.2157275676727295, "num_tokens": 94267641.0, "step": 54355 }, { "entropy": 5.4195441722869875, "epoch": 4.229371717564677, "grad_norm": 1.1875, "learning_rate": 0.00033202511782887655, "loss": 4.9035, "mean_token_accuracy": 0.2134892076253891, "num_tokens": 94276779.0, "step": 54360 }, { "entropy": 5.4301167011260985, "epoch": 4.229760746936393, "grad_norm": 1.1484375, "learning_rate": 0.00033199830672797545, "loss": 4.8605, "mean_token_accuracy": 0.21585453003644944, "num_tokens": 94285642.0, "step": 54365 }, { "entropy": 5.392042541503907, "epoch": 4.230149776308111, "grad_norm": 1.1484375, "learning_rate": 0.0003319714947622157, "loss": 4.7109, "mean_token_accuracy": 0.22836248874664306, "num_tokens": 94293994.0, "step": 54370 }, { "entropy": 5.318151903152466, "epoch": 4.230538805679829, "grad_norm": 1.1796875, "learning_rate": 0.0003319446819320043, "loss": 4.7167, "mean_token_accuracy": 0.22675875723361968, "num_tokens": 94302661.0, "step": 54375 }, { "entropy": 5.3777501583099365, "epoch": 4.2309278350515465, "grad_norm": 1.171875, "learning_rate": 0.0003319178682377479, "loss": 4.8315, "mean_token_accuracy": 0.21500447243452073, "num_tokens": 94311996.0, "step": 54380 }, { "entropy": 5.349651050567627, "epoch": 4.231316864423264, "grad_norm": 1.1171875, "learning_rate": 0.00033189105367985343, "loss": 4.7115, "mean_token_accuracy": 0.22938310652971267, "num_tokens": 94320123.0, "step": 54385 }, { "entropy": 5.395993041992187, "epoch": 4.231705893794982, "grad_norm": 1.1484375, "learning_rate": 0.00033186423825872787, "loss": 4.7784, "mean_token_accuracy": 0.2277523994445801, "num_tokens": 94328027.0, "step": 54390 }, { "entropy": 5.412885236740112, "epoch": 4.232094923166699, "grad_norm": 1.140625, "learning_rate": 0.0003318374219747779, "loss": 4.8642, "mean_token_accuracy": 0.21883898824453354, "num_tokens": 94337740.0, "step": 54395 }, { "entropy": 5.29658727645874, "epoch": 4.232483952538416, "grad_norm": 1.2265625, "learning_rate": 0.00033181060482841054, "loss": 4.6799, "mean_token_accuracy": 0.22856923788785935, "num_tokens": 94346203.0, "step": 54400 }, { "entropy": 5.31383261680603, "epoch": 4.232872981910134, "grad_norm": 1.21875, "learning_rate": 0.0003317837868200327, "loss": 4.7529, "mean_token_accuracy": 0.22265704721212387, "num_tokens": 94354690.0, "step": 54405 }, { "entropy": 5.408491516113282, "epoch": 4.233262011281852, "grad_norm": 1.296875, "learning_rate": 0.00033175696795005133, "loss": 4.838, "mean_token_accuracy": 0.21839593201875687, "num_tokens": 94363102.0, "step": 54410 }, { "entropy": 5.499411630630493, "epoch": 4.2336510406535695, "grad_norm": 1.2890625, "learning_rate": 0.0003317301482188732, "loss": 4.7604, "mean_token_accuracy": 0.2193394973874092, "num_tokens": 94370937.0, "step": 54415 }, { "entropy": 5.417542743682861, "epoch": 4.234040070025287, "grad_norm": 1.1875, "learning_rate": 0.0003317033276269054, "loss": 4.8406, "mean_token_accuracy": 0.21558397859334946, "num_tokens": 94379746.0, "step": 54420 }, { "entropy": 5.269739294052124, "epoch": 4.234429099397005, "grad_norm": 1.1796875, "learning_rate": 0.00033167650617455484, "loss": 4.7195, "mean_token_accuracy": 0.23051675111055375, "num_tokens": 94388835.0, "step": 54425 }, { "entropy": 5.3575685024261475, "epoch": 4.234818128768722, "grad_norm": 1.1484375, "learning_rate": 0.00033164968386222856, "loss": 4.7005, "mean_token_accuracy": 0.22701139450073243, "num_tokens": 94397075.0, "step": 54430 }, { "entropy": 5.469365406036377, "epoch": 4.235207158140439, "grad_norm": 1.2265625, "learning_rate": 0.0003316228606903334, "loss": 4.8031, "mean_token_accuracy": 0.21975116729736327, "num_tokens": 94405554.0, "step": 54435 }, { "entropy": 5.362374973297119, "epoch": 4.235596187512157, "grad_norm": 1.25, "learning_rate": 0.00033159603665927655, "loss": 4.7746, "mean_token_accuracy": 0.21678227484226226, "num_tokens": 94414187.0, "step": 54440 }, { "entropy": 5.397217893600464, "epoch": 4.235985216883875, "grad_norm": 1.1640625, "learning_rate": 0.00033156921176946496, "loss": 4.8332, "mean_token_accuracy": 0.22247289419174193, "num_tokens": 94422756.0, "step": 54445 }, { "entropy": 5.355980634689331, "epoch": 4.2363742462555924, "grad_norm": 1.09375, "learning_rate": 0.0003315423860213057, "loss": 4.7547, "mean_token_accuracy": 0.2213354751467705, "num_tokens": 94431562.0, "step": 54450 }, { "entropy": 5.424383544921875, "epoch": 4.23676327562731, "grad_norm": 1.1015625, "learning_rate": 0.0003315155594152055, "loss": 4.8548, "mean_token_accuracy": 0.215184023976326, "num_tokens": 94440452.0, "step": 54455 }, { "entropy": 5.423150539398193, "epoch": 4.237152304999028, "grad_norm": 1.1953125, "learning_rate": 0.0003314887319515717, "loss": 4.8323, "mean_token_accuracy": 0.21593841016292573, "num_tokens": 94448966.0, "step": 54460 }, { "entropy": 5.403658437728882, "epoch": 4.237541334370745, "grad_norm": 1.2265625, "learning_rate": 0.0003314619036308113, "loss": 4.7072, "mean_token_accuracy": 0.22892588824033738, "num_tokens": 94457190.0, "step": 54465 }, { "entropy": 5.349455976486206, "epoch": 4.237930363742462, "grad_norm": 1.171875, "learning_rate": 0.00033143507445333145, "loss": 4.7612, "mean_token_accuracy": 0.22519470900297164, "num_tokens": 94465799.0, "step": 54470 }, { "entropy": 5.307358074188232, "epoch": 4.23831939311418, "grad_norm": 1.2578125, "learning_rate": 0.00033140824441953913, "loss": 4.7523, "mean_token_accuracy": 0.22900066077709197, "num_tokens": 94474544.0, "step": 54475 }, { "entropy": 5.456830167770386, "epoch": 4.238708422485898, "grad_norm": 1.1953125, "learning_rate": 0.00033138141352984145, "loss": 4.8812, "mean_token_accuracy": 0.22218739688396455, "num_tokens": 94482884.0, "step": 54480 }, { "entropy": 5.418743896484375, "epoch": 4.239097451857615, "grad_norm": 1.0625, "learning_rate": 0.00033135458178464565, "loss": 4.7482, "mean_token_accuracy": 0.21810485869646073, "num_tokens": 94492096.0, "step": 54485 }, { "entropy": 5.36443338394165, "epoch": 4.239486481229333, "grad_norm": 1.2734375, "learning_rate": 0.0003313277491843587, "loss": 4.7302, "mean_token_accuracy": 0.2224389061331749, "num_tokens": 94499945.0, "step": 54490 }, { "entropy": 5.421720886230469, "epoch": 4.239875510601051, "grad_norm": 1.1796875, "learning_rate": 0.00033130091572938786, "loss": 4.8218, "mean_token_accuracy": 0.22085587978363036, "num_tokens": 94508200.0, "step": 54495 }, { "entropy": 5.327809000015259, "epoch": 4.240264539972768, "grad_norm": 1.21875, "learning_rate": 0.0003312740814201402, "loss": 4.748, "mean_token_accuracy": 0.22709480673074722, "num_tokens": 94516876.0, "step": 54500 }, { "entropy": 5.350952768325806, "epoch": 4.240653569344485, "grad_norm": 1.203125, "learning_rate": 0.0003312472462570229, "loss": 4.7004, "mean_token_accuracy": 0.2274550601840019, "num_tokens": 94525535.0, "step": 54505 }, { "entropy": 5.332509136199951, "epoch": 4.241042598716203, "grad_norm": 1.21875, "learning_rate": 0.00033122041024044325, "loss": 4.7452, "mean_token_accuracy": 0.2222794249653816, "num_tokens": 94533596.0, "step": 54510 }, { "entropy": 5.373179626464844, "epoch": 4.241431628087921, "grad_norm": 1.140625, "learning_rate": 0.00033119357337080827, "loss": 4.7521, "mean_token_accuracy": 0.2288521945476532, "num_tokens": 94542696.0, "step": 54515 }, { "entropy": 5.392169618606568, "epoch": 4.241820657459638, "grad_norm": 1.203125, "learning_rate": 0.0003311667356485253, "loss": 4.7703, "mean_token_accuracy": 0.22014668732881545, "num_tokens": 94551724.0, "step": 54520 }, { "entropy": 5.330758762359619, "epoch": 4.242209686831356, "grad_norm": 1.203125, "learning_rate": 0.0003311398970740015, "loss": 4.7103, "mean_token_accuracy": 0.2214592769742012, "num_tokens": 94559603.0, "step": 54525 }, { "entropy": 5.340587568283081, "epoch": 4.242598716203073, "grad_norm": 1.140625, "learning_rate": 0.0003311130576476441, "loss": 4.7519, "mean_token_accuracy": 0.231382854282856, "num_tokens": 94568726.0, "step": 54530 }, { "entropy": 5.419903945922852, "epoch": 4.242987745574791, "grad_norm": 1.1875, "learning_rate": 0.0003310862173698604, "loss": 4.7492, "mean_token_accuracy": 0.22232337296009064, "num_tokens": 94577224.0, "step": 54535 }, { "entropy": 5.3452558517456055, "epoch": 4.243376774946508, "grad_norm": 1.140625, "learning_rate": 0.0003310593762410576, "loss": 4.785, "mean_token_accuracy": 0.2187017947435379, "num_tokens": 94586092.0, "step": 54540 }, { "entropy": 5.425574541091919, "epoch": 4.243765804318226, "grad_norm": 1.2265625, "learning_rate": 0.000331032534261643, "loss": 4.9049, "mean_token_accuracy": 0.21400449872016908, "num_tokens": 94594874.0, "step": 54545 }, { "entropy": 5.376405239105225, "epoch": 4.244154833689944, "grad_norm": 1.140625, "learning_rate": 0.0003310056914320239, "loss": 4.6793, "mean_token_accuracy": 0.23173997849225997, "num_tokens": 94604088.0, "step": 54550 }, { "entropy": 5.460483121871948, "epoch": 4.244543863061661, "grad_norm": 1.2421875, "learning_rate": 0.00033097884775260754, "loss": 4.8238, "mean_token_accuracy": 0.21691634505987167, "num_tokens": 94613046.0, "step": 54555 }, { "entropy": 5.379615116119385, "epoch": 4.244932892433379, "grad_norm": 1.1484375, "learning_rate": 0.00033095200322380124, "loss": 4.6577, "mean_token_accuracy": 0.23409704864025116, "num_tokens": 94621423.0, "step": 54560 }, { "entropy": 5.358602142333984, "epoch": 4.245321921805096, "grad_norm": 1.265625, "learning_rate": 0.00033092515784601245, "loss": 4.7892, "mean_token_accuracy": 0.21795368641614915, "num_tokens": 94630499.0, "step": 54565 }, { "entropy": 5.430104112625122, "epoch": 4.245710951176814, "grad_norm": 1.1484375, "learning_rate": 0.0003308983116196483, "loss": 4.8234, "mean_token_accuracy": 0.21049887090921401, "num_tokens": 94639347.0, "step": 54570 }, { "entropy": 5.450504732131958, "epoch": 4.246099980548531, "grad_norm": 1.1796875, "learning_rate": 0.0003308714645451163, "loss": 4.803, "mean_token_accuracy": 0.22142817825078964, "num_tokens": 94648242.0, "step": 54575 }, { "entropy": 5.362428379058838, "epoch": 4.246489009920249, "grad_norm": 1.1328125, "learning_rate": 0.0003308446166228237, "loss": 4.7603, "mean_token_accuracy": 0.2240766316652298, "num_tokens": 94657534.0, "step": 54580 }, { "entropy": 5.375988149642945, "epoch": 4.246878039291967, "grad_norm": 1.140625, "learning_rate": 0.00033081776785317803, "loss": 4.7821, "mean_token_accuracy": 0.2171188622713089, "num_tokens": 94666552.0, "step": 54585 }, { "entropy": 5.325899076461792, "epoch": 4.247267068663684, "grad_norm": 1.1796875, "learning_rate": 0.00033079091823658645, "loss": 4.6542, "mean_token_accuracy": 0.22637958079576492, "num_tokens": 94675577.0, "step": 54590 }, { "entropy": 5.3656309127807615, "epoch": 4.247656098035401, "grad_norm": 1.2109375, "learning_rate": 0.0003307640677734566, "loss": 4.7627, "mean_token_accuracy": 0.21637412756681443, "num_tokens": 94684119.0, "step": 54595 }, { "entropy": 5.317989921569824, "epoch": 4.248045127407119, "grad_norm": 1.1796875, "learning_rate": 0.0003307372164641957, "loss": 4.7354, "mean_token_accuracy": 0.22322663813829421, "num_tokens": 94692020.0, "step": 54600 }, { "entropy": 5.391620922088623, "epoch": 4.248434156778837, "grad_norm": 1.2109375, "learning_rate": 0.00033071036430921133, "loss": 4.8179, "mean_token_accuracy": 0.22123800814151764, "num_tokens": 94699966.0, "step": 54605 }, { "entropy": 5.411776399612426, "epoch": 4.248823186150554, "grad_norm": 1.2421875, "learning_rate": 0.00033068351130891076, "loss": 4.76, "mean_token_accuracy": 0.21453149020671844, "num_tokens": 94708033.0, "step": 54610 }, { "entropy": 5.4739244937896725, "epoch": 4.249212215522272, "grad_norm": 1.2109375, "learning_rate": 0.0003306566574637016, "loss": 4.883, "mean_token_accuracy": 0.2199149951338768, "num_tokens": 94716425.0, "step": 54615 }, { "entropy": 5.4653795719146725, "epoch": 4.24960124489399, "grad_norm": 1.1328125, "learning_rate": 0.00033062980277399125, "loss": 4.8342, "mean_token_accuracy": 0.21589039862155915, "num_tokens": 94724759.0, "step": 54620 }, { "entropy": 5.470993232727051, "epoch": 4.249990274265707, "grad_norm": 1.078125, "learning_rate": 0.0003306029472401871, "loss": 4.852, "mean_token_accuracy": 0.2119984358549118, "num_tokens": 94734594.0, "step": 54625 }, { "entropy": 5.424247312545776, "epoch": 4.250379303637424, "grad_norm": 1.1171875, "learning_rate": 0.0003305760908626968, "loss": 4.7927, "mean_token_accuracy": 0.2198279857635498, "num_tokens": 94743601.0, "step": 54630 }, { "entropy": 5.427798652648926, "epoch": 4.250768333009142, "grad_norm": 1.15625, "learning_rate": 0.0003305492336419277, "loss": 4.8406, "mean_token_accuracy": 0.21741432100534439, "num_tokens": 94752560.0, "step": 54635 }, { "entropy": 5.428102588653564, "epoch": 4.25115736238086, "grad_norm": 1.2109375, "learning_rate": 0.00033052237557828763, "loss": 4.7998, "mean_token_accuracy": 0.22330515831708908, "num_tokens": 94760533.0, "step": 54640 }, { "entropy": 5.381521320343017, "epoch": 4.251546391752577, "grad_norm": 1.2265625, "learning_rate": 0.0003304955166721837, "loss": 4.7864, "mean_token_accuracy": 0.2172737404704094, "num_tokens": 94768746.0, "step": 54645 }, { "entropy": 5.43982424736023, "epoch": 4.251935421124295, "grad_norm": 1.171875, "learning_rate": 0.0003304686569240237, "loss": 4.8817, "mean_token_accuracy": 0.21746079623699188, "num_tokens": 94777844.0, "step": 54650 }, { "entropy": 5.422416830062867, "epoch": 4.252324450496013, "grad_norm": 1.234375, "learning_rate": 0.000330441796334215, "loss": 4.7552, "mean_token_accuracy": 0.21707698106765747, "num_tokens": 94786100.0, "step": 54655 }, { "entropy": 5.432130813598633, "epoch": 4.25271347986773, "grad_norm": 1.140625, "learning_rate": 0.0003304149349031653, "loss": 4.7686, "mean_token_accuracy": 0.21576109379529954, "num_tokens": 94795262.0, "step": 54660 }, { "entropy": 5.438127040863037, "epoch": 4.253102509239447, "grad_norm": 1.203125, "learning_rate": 0.0003303880726312822, "loss": 4.8735, "mean_token_accuracy": 0.2176504209637642, "num_tokens": 94804758.0, "step": 54665 }, { "entropy": 5.414253282546997, "epoch": 4.253491538611165, "grad_norm": 1.1484375, "learning_rate": 0.00033036120951897334, "loss": 4.7363, "mean_token_accuracy": 0.22886774092912673, "num_tokens": 94812704.0, "step": 54670 }, { "entropy": 5.322176790237426, "epoch": 4.253880567982883, "grad_norm": 1.1015625, "learning_rate": 0.0003303343455666462, "loss": 4.6686, "mean_token_accuracy": 0.23109240531921388, "num_tokens": 94821240.0, "step": 54675 }, { "entropy": 5.373547029495239, "epoch": 4.2542695973546, "grad_norm": 1.234375, "learning_rate": 0.00033030748077470846, "loss": 4.8533, "mean_token_accuracy": 0.2141409084200859, "num_tokens": 94830369.0, "step": 54680 }, { "entropy": 5.46383957862854, "epoch": 4.254658626726318, "grad_norm": 1.234375, "learning_rate": 0.00033028061514356766, "loss": 4.8227, "mean_token_accuracy": 0.21968912631273269, "num_tokens": 94838809.0, "step": 54685 }, { "entropy": 5.478913068771362, "epoch": 4.255047656098036, "grad_norm": 1.140625, "learning_rate": 0.0003302537486736315, "loss": 4.797, "mean_token_accuracy": 0.22018113732337952, "num_tokens": 94847805.0, "step": 54690 }, { "entropy": 5.369990873336792, "epoch": 4.255436685469753, "grad_norm": 1.203125, "learning_rate": 0.0003302268813653077, "loss": 4.7495, "mean_token_accuracy": 0.2225884735584259, "num_tokens": 94856703.0, "step": 54695 }, { "entropy": 5.452295255661011, "epoch": 4.25582571484147, "grad_norm": 1.1875, "learning_rate": 0.0003302000132190039, "loss": 4.8254, "mean_token_accuracy": 0.21446521282196046, "num_tokens": 94865301.0, "step": 54700 }, { "entropy": 5.442586469650268, "epoch": 4.256214744213188, "grad_norm": 1.234375, "learning_rate": 0.0003301731442351277, "loss": 4.7748, "mean_token_accuracy": 0.21602004617452622, "num_tokens": 94873269.0, "step": 54705 }, { "entropy": 5.418471193313598, "epoch": 4.256603773584906, "grad_norm": 1.1171875, "learning_rate": 0.0003301462744140869, "loss": 4.8134, "mean_token_accuracy": 0.2135033518075943, "num_tokens": 94882668.0, "step": 54710 }, { "entropy": 5.4302692890167235, "epoch": 4.256992802956623, "grad_norm": 1.125, "learning_rate": 0.0003301194037562892, "loss": 4.9118, "mean_token_accuracy": 0.20727849900722503, "num_tokens": 94892826.0, "step": 54715 }, { "entropy": 5.331305694580078, "epoch": 4.257381832328341, "grad_norm": 1.0546875, "learning_rate": 0.0003300925322621422, "loss": 4.7106, "mean_token_accuracy": 0.22634776085615158, "num_tokens": 94901854.0, "step": 54720 }, { "entropy": 5.397252988815308, "epoch": 4.257770861700059, "grad_norm": 1.1796875, "learning_rate": 0.0003300656599320537, "loss": 4.764, "mean_token_accuracy": 0.22191890478134155, "num_tokens": 94910573.0, "step": 54725 }, { "entropy": 5.529209136962891, "epoch": 4.2581598910717755, "grad_norm": 1.1328125, "learning_rate": 0.0003300387867664315, "loss": 5.0019, "mean_token_accuracy": 0.20054250210523605, "num_tokens": 94920019.0, "step": 54730 }, { "entropy": 5.323495769500733, "epoch": 4.258548920443493, "grad_norm": 1.1796875, "learning_rate": 0.0003300119127656833, "loss": 4.6639, "mean_token_accuracy": 0.23303650915622712, "num_tokens": 94928795.0, "step": 54735 }, { "entropy": 5.367957305908203, "epoch": 4.258937949815211, "grad_norm": 1.1953125, "learning_rate": 0.00032998503793021694, "loss": 4.7734, "mean_token_accuracy": 0.21868903785943986, "num_tokens": 94936585.0, "step": 54740 }, { "entropy": 5.429840469360352, "epoch": 4.259326979186929, "grad_norm": 1.21875, "learning_rate": 0.0003299581622604401, "loss": 4.795, "mean_token_accuracy": 0.23060788512229918, "num_tokens": 94944480.0, "step": 54745 }, { "entropy": 5.433448934555054, "epoch": 4.259716008558646, "grad_norm": 1.09375, "learning_rate": 0.00032993128575676064, "loss": 4.8581, "mean_token_accuracy": 0.21371012628078462, "num_tokens": 94954148.0, "step": 54750 }, { "entropy": 5.4394707679748535, "epoch": 4.260105037930364, "grad_norm": 1.21875, "learning_rate": 0.00032990440841958635, "loss": 4.8534, "mean_token_accuracy": 0.21667168140411378, "num_tokens": 94962563.0, "step": 54755 }, { "entropy": 5.385912752151489, "epoch": 4.260494067302082, "grad_norm": 1.1484375, "learning_rate": 0.000329877530249325, "loss": 4.8559, "mean_token_accuracy": 0.21686408966779708, "num_tokens": 94970737.0, "step": 54760 }, { "entropy": 5.382293796539306, "epoch": 4.2608830966737985, "grad_norm": 1.15625, "learning_rate": 0.0003298506512463845, "loss": 4.7279, "mean_token_accuracy": 0.23097594678401948, "num_tokens": 94979418.0, "step": 54765 }, { "entropy": 5.363255262374878, "epoch": 4.261272126045516, "grad_norm": 1.234375, "learning_rate": 0.0003298237714111727, "loss": 4.7628, "mean_token_accuracy": 0.2224505290389061, "num_tokens": 94988219.0, "step": 54770 }, { "entropy": 5.342290019989013, "epoch": 4.261661155417234, "grad_norm": 1.125, "learning_rate": 0.0003297968907440974, "loss": 4.7186, "mean_token_accuracy": 0.22236937135457993, "num_tokens": 94996013.0, "step": 54775 }, { "entropy": 5.430433225631714, "epoch": 4.262050184788952, "grad_norm": 1.125, "learning_rate": 0.0003297700092455665, "loss": 4.7946, "mean_token_accuracy": 0.21952625960111619, "num_tokens": 95004570.0, "step": 54780 }, { "entropy": 5.401397037506103, "epoch": 4.262439214160669, "grad_norm": 1.1484375, "learning_rate": 0.00032974312691598794, "loss": 4.7794, "mean_token_accuracy": 0.2282458171248436, "num_tokens": 95013460.0, "step": 54785 }, { "entropy": 5.341152048110962, "epoch": 4.262828243532387, "grad_norm": 1.1796875, "learning_rate": 0.00032971624375576956, "loss": 4.7329, "mean_token_accuracy": 0.22794912457466127, "num_tokens": 95022620.0, "step": 54790 }, { "entropy": 5.418966341018677, "epoch": 4.263217272904104, "grad_norm": 1.1640625, "learning_rate": 0.0003296893597653192, "loss": 4.8663, "mean_token_accuracy": 0.20991597026586534, "num_tokens": 95031402.0, "step": 54795 }, { "entropy": 5.397003841400147, "epoch": 4.2636063022758215, "grad_norm": 1.203125, "learning_rate": 0.0003296624749450448, "loss": 4.7478, "mean_token_accuracy": 0.22213748544454576, "num_tokens": 95039421.0, "step": 54800 }, { "entropy": 5.352946376800537, "epoch": 4.263995331647539, "grad_norm": 1.1484375, "learning_rate": 0.0003296355892953545, "loss": 4.729, "mean_token_accuracy": 0.22223538011312485, "num_tokens": 95048238.0, "step": 54805 }, { "entropy": 5.374114942550659, "epoch": 4.264384361019257, "grad_norm": 1.1484375, "learning_rate": 0.000329608702816656, "loss": 4.7693, "mean_token_accuracy": 0.2207953780889511, "num_tokens": 95057481.0, "step": 54810 }, { "entropy": 5.374326944351196, "epoch": 4.264773390390975, "grad_norm": 1.140625, "learning_rate": 0.0003295818155093574, "loss": 4.7379, "mean_token_accuracy": 0.22741443961858748, "num_tokens": 95065754.0, "step": 54815 }, { "entropy": 5.4718602180480955, "epoch": 4.265162419762692, "grad_norm": 1.1484375, "learning_rate": 0.00032955492737386663, "loss": 4.9144, "mean_token_accuracy": 0.2132245972752571, "num_tokens": 95075045.0, "step": 54820 }, { "entropy": 5.4313380241394045, "epoch": 4.26555144913441, "grad_norm": 1.296875, "learning_rate": 0.0003295280384105916, "loss": 4.7389, "mean_token_accuracy": 0.2324862450361252, "num_tokens": 95084021.0, "step": 54825 }, { "entropy": 5.518976068496704, "epoch": 4.265940478506128, "grad_norm": 1.1015625, "learning_rate": 0.00032950114861994047, "loss": 4.9641, "mean_token_accuracy": 0.20754128992557525, "num_tokens": 95093843.0, "step": 54830 }, { "entropy": 5.419281911849976, "epoch": 4.2663295078778445, "grad_norm": 1.1484375, "learning_rate": 0.00032947425800232107, "loss": 4.8156, "mean_token_accuracy": 0.21986821740865709, "num_tokens": 95103107.0, "step": 54835 }, { "entropy": 5.299954891204834, "epoch": 4.266718537249562, "grad_norm": 1.1875, "learning_rate": 0.0003294473665581415, "loss": 4.646, "mean_token_accuracy": 0.2342312142252922, "num_tokens": 95111173.0, "step": 54840 }, { "entropy": 5.394480037689209, "epoch": 4.26710756662128, "grad_norm": 1.1796875, "learning_rate": 0.00032942047428780985, "loss": 4.8295, "mean_token_accuracy": 0.22379353493452073, "num_tokens": 95119999.0, "step": 54845 }, { "entropy": 5.430253648757935, "epoch": 4.267496595992998, "grad_norm": 1.15625, "learning_rate": 0.0003293935811917342, "loss": 4.7969, "mean_token_accuracy": 0.21630345433950424, "num_tokens": 95128733.0, "step": 54850 }, { "entropy": 5.342151165008545, "epoch": 4.267885625364715, "grad_norm": 1.1796875, "learning_rate": 0.0003293666872703224, "loss": 4.8049, "mean_token_accuracy": 0.22271167784929274, "num_tokens": 95138000.0, "step": 54855 }, { "entropy": 5.352104902267456, "epoch": 4.268274654736433, "grad_norm": 1.25, "learning_rate": 0.0003293397925239827, "loss": 4.7371, "mean_token_accuracy": 0.22325584292411804, "num_tokens": 95146207.0, "step": 54860 }, { "entropy": 5.468888235092163, "epoch": 4.26866368410815, "grad_norm": 1.2734375, "learning_rate": 0.0003293128969531231, "loss": 4.8711, "mean_token_accuracy": 0.21632730215787888, "num_tokens": 95154607.0, "step": 54865 }, { "entropy": 5.397152757644653, "epoch": 4.2690527134798675, "grad_norm": 1.3125, "learning_rate": 0.0003292860005581518, "loss": 4.8097, "mean_token_accuracy": 0.22666308730840684, "num_tokens": 95163441.0, "step": 54870 }, { "entropy": 5.372730398178101, "epoch": 4.269441742851585, "grad_norm": 1.09375, "learning_rate": 0.00032925910333947694, "loss": 4.7975, "mean_token_accuracy": 0.21812900602817537, "num_tokens": 95172822.0, "step": 54875 }, { "entropy": 5.430889701843261, "epoch": 4.269830772223303, "grad_norm": 1.1640625, "learning_rate": 0.0003292322052975064, "loss": 4.8394, "mean_token_accuracy": 0.22389072328805923, "num_tokens": 95181538.0, "step": 54880 }, { "entropy": 5.433111000061035, "epoch": 4.270219801595021, "grad_norm": 1.203125, "learning_rate": 0.0003292053064326485, "loss": 4.7905, "mean_token_accuracy": 0.2216987982392311, "num_tokens": 95190182.0, "step": 54885 }, { "entropy": 5.348947668075562, "epoch": 4.270608830966738, "grad_norm": 1.1796875, "learning_rate": 0.0003291784067453114, "loss": 4.7702, "mean_token_accuracy": 0.22684161365032196, "num_tokens": 95198757.0, "step": 54890 }, { "entropy": 5.407661867141724, "epoch": 4.270997860338456, "grad_norm": 1.15625, "learning_rate": 0.00032915150623590304, "loss": 4.7641, "mean_token_accuracy": 0.22177619040012359, "num_tokens": 95207890.0, "step": 54895 }, { "entropy": 5.348844289779663, "epoch": 4.271386889710173, "grad_norm": 1.3203125, "learning_rate": 0.00032912460490483193, "loss": 4.7347, "mean_token_accuracy": 0.22969955056905747, "num_tokens": 95217011.0, "step": 54900 }, { "entropy": 5.3903872013092045, "epoch": 4.2717759190818905, "grad_norm": 1.125, "learning_rate": 0.0003290977027525061, "loss": 4.8119, "mean_token_accuracy": 0.2146987110376358, "num_tokens": 95226570.0, "step": 54905 }, { "entropy": 5.420358324050904, "epoch": 4.272164948453608, "grad_norm": 1.1171875, "learning_rate": 0.00032907079977933373, "loss": 4.82, "mean_token_accuracy": 0.22445839792490005, "num_tokens": 95235509.0, "step": 54910 }, { "entropy": 5.352297401428222, "epoch": 4.272553977825326, "grad_norm": 1.125, "learning_rate": 0.00032904389598572295, "loss": 4.6819, "mean_token_accuracy": 0.2313300922513008, "num_tokens": 95244347.0, "step": 54915 }, { "entropy": 5.372861719131469, "epoch": 4.272943007197044, "grad_norm": 1.1875, "learning_rate": 0.00032901699137208215, "loss": 4.6732, "mean_token_accuracy": 0.23583931475877762, "num_tokens": 95252371.0, "step": 54920 }, { "entropy": 5.292420291900635, "epoch": 4.273332036568761, "grad_norm": 1.1953125, "learning_rate": 0.0003289900859388194, "loss": 4.788, "mean_token_accuracy": 0.22562117874622345, "num_tokens": 95261501.0, "step": 54925 }, { "entropy": 5.308648681640625, "epoch": 4.273721065940478, "grad_norm": 1.0234375, "learning_rate": 0.00032896317968634305, "loss": 4.7055, "mean_token_accuracy": 0.22571118026971818, "num_tokens": 95271101.0, "step": 54930 }, { "entropy": 5.416075897216797, "epoch": 4.274110095312196, "grad_norm": 1.21875, "learning_rate": 0.0003289362726150614, "loss": 4.8079, "mean_token_accuracy": 0.21698296964168548, "num_tokens": 95279150.0, "step": 54935 }, { "entropy": 5.449749279022217, "epoch": 4.2744991246839135, "grad_norm": 1.1015625, "learning_rate": 0.00032890936472538255, "loss": 4.8066, "mean_token_accuracy": 0.21875184625387192, "num_tokens": 95287527.0, "step": 54940 }, { "entropy": 5.34789400100708, "epoch": 4.274888154055631, "grad_norm": 1.234375, "learning_rate": 0.000328882456017715, "loss": 4.7474, "mean_token_accuracy": 0.22220712900161743, "num_tokens": 95295941.0, "step": 54945 }, { "entropy": 5.292721605300903, "epoch": 4.275277183427349, "grad_norm": 1.2109375, "learning_rate": 0.00032885554649246697, "loss": 4.6849, "mean_token_accuracy": 0.23374254405498504, "num_tokens": 95304801.0, "step": 54950 }, { "entropy": 5.333906650543213, "epoch": 4.275666212799067, "grad_norm": 1.1875, "learning_rate": 0.0003288286361500467, "loss": 4.6906, "mean_token_accuracy": 0.23225993812084197, "num_tokens": 95313097.0, "step": 54955 }, { "entropy": 5.379891681671142, "epoch": 4.276055242170784, "grad_norm": 1.3515625, "learning_rate": 0.00032880172499086247, "loss": 4.7585, "mean_token_accuracy": 0.23272813856601715, "num_tokens": 95321326.0, "step": 54960 }, { "entropy": 5.446313142776489, "epoch": 4.276444271542501, "grad_norm": 1.1015625, "learning_rate": 0.0003287748130153228, "loss": 4.7743, "mean_token_accuracy": 0.22863819748163222, "num_tokens": 95331018.0, "step": 54965 }, { "entropy": 5.4627063274383545, "epoch": 4.276833300914219, "grad_norm": 1.1015625, "learning_rate": 0.0003287479002238359, "loss": 4.7804, "mean_token_accuracy": 0.2279689058661461, "num_tokens": 95339581.0, "step": 54970 }, { "entropy": 5.339817667007447, "epoch": 4.2772223302859365, "grad_norm": 1.2265625, "learning_rate": 0.0003287209866168102, "loss": 4.6883, "mean_token_accuracy": 0.22522517293691635, "num_tokens": 95348156.0, "step": 54975 }, { "entropy": 5.275270986557007, "epoch": 4.277611359657654, "grad_norm": 1.1875, "learning_rate": 0.000328694072194654, "loss": 4.7456, "mean_token_accuracy": 0.22237711846828462, "num_tokens": 95356777.0, "step": 54980 }, { "entropy": 5.343167686462403, "epoch": 4.278000389029372, "grad_norm": 1.2421875, "learning_rate": 0.00032866715695777565, "loss": 4.7286, "mean_token_accuracy": 0.22108532041311263, "num_tokens": 95365714.0, "step": 54985 }, { "entropy": 5.416306352615356, "epoch": 4.2783894184010896, "grad_norm": 1.1875, "learning_rate": 0.0003286402409065837, "loss": 4.7943, "mean_token_accuracy": 0.22188184559345245, "num_tokens": 95374769.0, "step": 54990 }, { "entropy": 5.394586849212646, "epoch": 4.278778447772807, "grad_norm": 1.1796875, "learning_rate": 0.00032861332404148647, "loss": 4.7602, "mean_token_accuracy": 0.230273599922657, "num_tokens": 95383690.0, "step": 54995 }, { "entropy": 5.407264614105225, "epoch": 4.279167477144524, "grad_norm": 1.1171875, "learning_rate": 0.00032858640636289235, "loss": 4.8324, "mean_token_accuracy": 0.21614464670419692, "num_tokens": 95392351.0, "step": 55000 }, { "entropy": 5.379932022094726, "epoch": 4.279556506516242, "grad_norm": 1.1953125, "learning_rate": 0.0003285594878712098, "loss": 4.7379, "mean_token_accuracy": 0.21958334296941756, "num_tokens": 95401076.0, "step": 55005 }, { "entropy": 5.424181127548218, "epoch": 4.2799455358879595, "grad_norm": 1.171875, "learning_rate": 0.0003285325685668473, "loss": 4.7376, "mean_token_accuracy": 0.22724032104015351, "num_tokens": 95409560.0, "step": 55010 }, { "entropy": 5.2767064571380615, "epoch": 4.280334565259677, "grad_norm": 1.1484375, "learning_rate": 0.00032850564845021327, "loss": 4.6379, "mean_token_accuracy": 0.2340892508625984, "num_tokens": 95418091.0, "step": 55015 }, { "entropy": 5.40285005569458, "epoch": 4.280723594631395, "grad_norm": 1.1953125, "learning_rate": 0.00032847872752171615, "loss": 4.9008, "mean_token_accuracy": 0.21234452724456787, "num_tokens": 95426396.0, "step": 55020 }, { "entropy": 5.3986128807067875, "epoch": 4.2811126240031125, "grad_norm": 1.15625, "learning_rate": 0.00032845180578176456, "loss": 4.7588, "mean_token_accuracy": 0.22324058115482331, "num_tokens": 95435354.0, "step": 55025 }, { "entropy": 5.406235074996948, "epoch": 4.28150165337483, "grad_norm": 1.171875, "learning_rate": 0.00032842488323076675, "loss": 4.8066, "mean_token_accuracy": 0.2182815507054329, "num_tokens": 95444341.0, "step": 55030 }, { "entropy": 5.331027412414551, "epoch": 4.281890682746547, "grad_norm": 1.09375, "learning_rate": 0.00032839795986913146, "loss": 4.7688, "mean_token_accuracy": 0.21797224432229995, "num_tokens": 95453042.0, "step": 55035 }, { "entropy": 5.41580228805542, "epoch": 4.282279712118265, "grad_norm": 1.2734375, "learning_rate": 0.00032837103569726713, "loss": 4.808, "mean_token_accuracy": 0.21793263107538224, "num_tokens": 95461777.0, "step": 55040 }, { "entropy": 5.416983413696289, "epoch": 4.2826687414899824, "grad_norm": 1.1796875, "learning_rate": 0.0003283441107155822, "loss": 4.8221, "mean_token_accuracy": 0.2109811618924141, "num_tokens": 95469377.0, "step": 55045 }, { "entropy": 5.309278297424316, "epoch": 4.2830577708617, "grad_norm": 1.078125, "learning_rate": 0.0003283171849244854, "loss": 4.6925, "mean_token_accuracy": 0.22799475938081742, "num_tokens": 95478224.0, "step": 55050 }, { "entropy": 5.419901418685913, "epoch": 4.283446800233418, "grad_norm": 1.140625, "learning_rate": 0.00032829025832438507, "loss": 4.8116, "mean_token_accuracy": 0.21582454591989517, "num_tokens": 95487138.0, "step": 55055 }, { "entropy": 5.471138858795166, "epoch": 4.2838358296051355, "grad_norm": 1.1796875, "learning_rate": 0.00032826333091569, "loss": 4.7848, "mean_token_accuracy": 0.2206636980175972, "num_tokens": 95495801.0, "step": 55060 }, { "entropy": 5.329667425155639, "epoch": 4.284224858976852, "grad_norm": 1.1875, "learning_rate": 0.0003282364026988087, "loss": 4.6992, "mean_token_accuracy": 0.23080913722515106, "num_tokens": 95504893.0, "step": 55065 }, { "entropy": 5.341891431808472, "epoch": 4.28461388834857, "grad_norm": 1.09375, "learning_rate": 0.00032820947367414953, "loss": 4.7501, "mean_token_accuracy": 0.22822415679693223, "num_tokens": 95513282.0, "step": 55070 }, { "entropy": 5.339668846130371, "epoch": 4.285002917720288, "grad_norm": 1.15625, "learning_rate": 0.0003281825438421215, "loss": 4.7576, "mean_token_accuracy": 0.22095125913619995, "num_tokens": 95521896.0, "step": 55075 }, { "entropy": 5.338019847869873, "epoch": 4.285391947092005, "grad_norm": 1.1953125, "learning_rate": 0.00032815561320313286, "loss": 4.649, "mean_token_accuracy": 0.22917956709861756, "num_tokens": 95529597.0, "step": 55080 }, { "entropy": 5.3562116622924805, "epoch": 4.285780976463723, "grad_norm": 1.2578125, "learning_rate": 0.00032812868175759245, "loss": 4.8331, "mean_token_accuracy": 0.21707769483327866, "num_tokens": 95538353.0, "step": 55085 }, { "entropy": 5.3809033870697025, "epoch": 4.286170005835441, "grad_norm": 1.125, "learning_rate": 0.0003281017495059088, "loss": 4.7874, "mean_token_accuracy": 0.2250244438648224, "num_tokens": 95546687.0, "step": 55090 }, { "entropy": 5.452684164047241, "epoch": 4.2865590352071585, "grad_norm": 1.1328125, "learning_rate": 0.0003280748164484907, "loss": 4.9072, "mean_token_accuracy": 0.2108091503381729, "num_tokens": 95556294.0, "step": 55095 }, { "entropy": 5.432414627075195, "epoch": 4.286948064578875, "grad_norm": 1.1953125, "learning_rate": 0.0003280478825857468, "loss": 4.8071, "mean_token_accuracy": 0.2165073722600937, "num_tokens": 95564421.0, "step": 55100 }, { "entropy": 5.351851224899292, "epoch": 4.287337093950593, "grad_norm": 1.1171875, "learning_rate": 0.00032802094791808565, "loss": 4.7286, "mean_token_accuracy": 0.23017796874046326, "num_tokens": 95572765.0, "step": 55105 }, { "entropy": 5.369527339935303, "epoch": 4.287726123322311, "grad_norm": 1.2109375, "learning_rate": 0.000327994012445916, "loss": 4.759, "mean_token_accuracy": 0.22622842639684676, "num_tokens": 95581383.0, "step": 55110 }, { "entropy": 5.386286687850952, "epoch": 4.288115152694028, "grad_norm": 1.1875, "learning_rate": 0.0003279670761696465, "loss": 4.7996, "mean_token_accuracy": 0.22207498997449876, "num_tokens": 95590536.0, "step": 55115 }, { "entropy": 5.404020500183106, "epoch": 4.288504182065746, "grad_norm": 1.203125, "learning_rate": 0.00032794013908968593, "loss": 4.7657, "mean_token_accuracy": 0.2186480402946472, "num_tokens": 95599123.0, "step": 55120 }, { "entropy": 5.402689838409424, "epoch": 4.288893211437464, "grad_norm": 1.171875, "learning_rate": 0.0003279132012064431, "loss": 4.7667, "mean_token_accuracy": 0.2230912536382675, "num_tokens": 95607875.0, "step": 55125 }, { "entropy": 5.3230818748474125, "epoch": 4.289282240809181, "grad_norm": 1.328125, "learning_rate": 0.0003278862625203266, "loss": 4.6727, "mean_token_accuracy": 0.2332807660102844, "num_tokens": 95615168.0, "step": 55130 }, { "entropy": 5.437061548233032, "epoch": 4.289671270180898, "grad_norm": 1.2109375, "learning_rate": 0.00032785932303174524, "loss": 4.9046, "mean_token_accuracy": 0.20923303663730622, "num_tokens": 95623972.0, "step": 55135 }, { "entropy": 5.515171957015991, "epoch": 4.290060299552616, "grad_norm": 1.1015625, "learning_rate": 0.00032783238274110787, "loss": 4.9005, "mean_token_accuracy": 0.21681196838617325, "num_tokens": 95634162.0, "step": 55140 }, { "entropy": 5.469407606124878, "epoch": 4.290449328924334, "grad_norm": 1.1015625, "learning_rate": 0.00032780544164882317, "loss": 4.8274, "mean_token_accuracy": 0.21699175536632537, "num_tokens": 95642710.0, "step": 55145 }, { "entropy": 5.352968549728393, "epoch": 4.290838358296051, "grad_norm": 1.203125, "learning_rate": 0.0003277784997552999, "loss": 4.6659, "mean_token_accuracy": 0.22392785549163818, "num_tokens": 95650457.0, "step": 55150 }, { "entropy": 5.445080947875977, "epoch": 4.291227387667769, "grad_norm": 1.1875, "learning_rate": 0.00032775155706094684, "loss": 4.8486, "mean_token_accuracy": 0.22245485782623292, "num_tokens": 95658984.0, "step": 55155 }, { "entropy": 5.395202350616455, "epoch": 4.291616417039487, "grad_norm": 1.1171875, "learning_rate": 0.0003277246135661729, "loss": 4.8563, "mean_token_accuracy": 0.21954651027917862, "num_tokens": 95668014.0, "step": 55160 }, { "entropy": 5.488106918334961, "epoch": 4.2920054464112045, "grad_norm": 1.1328125, "learning_rate": 0.0003276976692713869, "loss": 4.932, "mean_token_accuracy": 0.2152042105793953, "num_tokens": 95676476.0, "step": 55165 }, { "entropy": 5.571859502792359, "epoch": 4.292394475782921, "grad_norm": 1.1015625, "learning_rate": 0.0003276707241769976, "loss": 4.8649, "mean_token_accuracy": 0.2157810151576996, "num_tokens": 95685100.0, "step": 55170 }, { "entropy": 5.451015138626099, "epoch": 4.292783505154639, "grad_norm": 1.15625, "learning_rate": 0.000327643778283414, "loss": 4.8091, "mean_token_accuracy": 0.21961962580680847, "num_tokens": 95693513.0, "step": 55175 }, { "entropy": 5.3230345249176025, "epoch": 4.293172534526357, "grad_norm": 1.2265625, "learning_rate": 0.00032761683159104475, "loss": 4.7756, "mean_token_accuracy": 0.22002748250961304, "num_tokens": 95701513.0, "step": 55180 }, { "entropy": 5.392961168289185, "epoch": 4.293561563898074, "grad_norm": 1.2265625, "learning_rate": 0.0003275898841002989, "loss": 4.7982, "mean_token_accuracy": 0.2207813322544098, "num_tokens": 95710193.0, "step": 55185 }, { "entropy": 5.410181665420533, "epoch": 4.293950593269792, "grad_norm": 1.265625, "learning_rate": 0.00032756293581158517, "loss": 4.7562, "mean_token_accuracy": 0.23110752254724504, "num_tokens": 95718027.0, "step": 55190 }, { "entropy": 5.457648992538452, "epoch": 4.29433962264151, "grad_norm": 1.2265625, "learning_rate": 0.0003275359867253127, "loss": 4.8268, "mean_token_accuracy": 0.2198631316423416, "num_tokens": 95726708.0, "step": 55195 }, { "entropy": 5.349709701538086, "epoch": 4.294728652013227, "grad_norm": 1.1796875, "learning_rate": 0.0003275090368418901, "loss": 4.8018, "mean_token_accuracy": 0.21630767732858658, "num_tokens": 95735935.0, "step": 55200 }, { "entropy": 5.3614753723144535, "epoch": 4.295117681384944, "grad_norm": 1.1875, "learning_rate": 0.0003274820861617265, "loss": 4.7608, "mean_token_accuracy": 0.22329528480768204, "num_tokens": 95745215.0, "step": 55205 }, { "entropy": 5.386175489425659, "epoch": 4.295506710756662, "grad_norm": 1.046875, "learning_rate": 0.0003274551346852308, "loss": 4.7344, "mean_token_accuracy": 0.22658830434083937, "num_tokens": 95753815.0, "step": 55210 }, { "entropy": 5.330118560791016, "epoch": 4.29589574012838, "grad_norm": 1.1484375, "learning_rate": 0.0003274281824128119, "loss": 4.6828, "mean_token_accuracy": 0.21901508420705795, "num_tokens": 95763047.0, "step": 55215 }, { "entropy": 5.421271133422851, "epoch": 4.296284769500097, "grad_norm": 1.0859375, "learning_rate": 0.00032740122934487876, "loss": 4.6812, "mean_token_accuracy": 0.2286879003047943, "num_tokens": 95771925.0, "step": 55220 }, { "entropy": 5.365105009078979, "epoch": 4.296673798871815, "grad_norm": 1.1484375, "learning_rate": 0.0003273742754818405, "loss": 4.7025, "mean_token_accuracy": 0.22676587104797363, "num_tokens": 95780478.0, "step": 55225 }, { "entropy": 5.442048025131226, "epoch": 4.297062828243533, "grad_norm": 1.203125, "learning_rate": 0.0003273473208241058, "loss": 4.8562, "mean_token_accuracy": 0.2161581888794899, "num_tokens": 95790122.0, "step": 55230 }, { "entropy": 5.350823593139649, "epoch": 4.29745185761525, "grad_norm": 1.109375, "learning_rate": 0.00032732036537208386, "loss": 4.6822, "mean_token_accuracy": 0.22177618145942687, "num_tokens": 95798820.0, "step": 55235 }, { "entropy": 5.281313037872314, "epoch": 4.297840886986967, "grad_norm": 1.1953125, "learning_rate": 0.0003272934091261837, "loss": 4.6761, "mean_token_accuracy": 0.23342006504535676, "num_tokens": 95807789.0, "step": 55240 }, { "entropy": 5.28552474975586, "epoch": 4.298229916358685, "grad_norm": 1.203125, "learning_rate": 0.00032726645208681427, "loss": 4.7281, "mean_token_accuracy": 0.22298945784568786, "num_tokens": 95815946.0, "step": 55245 }, { "entropy": 5.410597324371338, "epoch": 4.298618945730403, "grad_norm": 1.1875, "learning_rate": 0.00032723949425438465, "loss": 4.794, "mean_token_accuracy": 0.21872412115335466, "num_tokens": 95824736.0, "step": 55250 }, { "entropy": 5.360561418533325, "epoch": 4.29900797510212, "grad_norm": 1.125, "learning_rate": 0.00032721253562930383, "loss": 4.6756, "mean_token_accuracy": 0.23224624395370483, "num_tokens": 95833130.0, "step": 55255 }, { "entropy": 5.444640207290649, "epoch": 4.299397004473838, "grad_norm": 1.125, "learning_rate": 0.00032718557621198087, "loss": 4.8644, "mean_token_accuracy": 0.2175348147749901, "num_tokens": 95841836.0, "step": 55260 }, { "entropy": 5.3505411624908445, "epoch": 4.299786033845555, "grad_norm": 1.1953125, "learning_rate": 0.0003271586160028249, "loss": 4.6922, "mean_token_accuracy": 0.2270873323082924, "num_tokens": 95850413.0, "step": 55265 }, { "entropy": 5.357793951034546, "epoch": 4.300175063217273, "grad_norm": 1.2265625, "learning_rate": 0.0003271316550022449, "loss": 4.8175, "mean_token_accuracy": 0.21754152625799178, "num_tokens": 95859177.0, "step": 55270 }, { "entropy": 5.402596569061279, "epoch": 4.30056409258899, "grad_norm": 1.203125, "learning_rate": 0.00032710469321065, "loss": 4.8344, "mean_token_accuracy": 0.21562788635492325, "num_tokens": 95868835.0, "step": 55275 }, { "entropy": 5.389941310882568, "epoch": 4.300953121960708, "grad_norm": 1.15625, "learning_rate": 0.0003270777306284493, "loss": 4.77, "mean_token_accuracy": 0.22567924857139587, "num_tokens": 95877425.0, "step": 55280 }, { "entropy": 5.4478906154632565, "epoch": 4.301342151332426, "grad_norm": 1.171875, "learning_rate": 0.000327050767256052, "loss": 4.8014, "mean_token_accuracy": 0.2183885544538498, "num_tokens": 95886816.0, "step": 55285 }, { "entropy": 5.422271394729615, "epoch": 4.301731180704143, "grad_norm": 1.171875, "learning_rate": 0.00032702380309386714, "loss": 4.8976, "mean_token_accuracy": 0.21046326458454132, "num_tokens": 95896284.0, "step": 55290 }, { "entropy": 5.411538982391358, "epoch": 4.302120210075861, "grad_norm": 1.265625, "learning_rate": 0.00032699683814230385, "loss": 4.808, "mean_token_accuracy": 0.21849098205566406, "num_tokens": 95904451.0, "step": 55295 }, { "entropy": 5.422853088378906, "epoch": 4.302509239447578, "grad_norm": 1.1953125, "learning_rate": 0.0003269698724017713, "loss": 4.7801, "mean_token_accuracy": 0.2241199567914009, "num_tokens": 95913190.0, "step": 55300 }, { "entropy": 5.4452223777771, "epoch": 4.302898268819296, "grad_norm": 1.203125, "learning_rate": 0.00032694290587267867, "loss": 4.7952, "mean_token_accuracy": 0.22249393910169601, "num_tokens": 95921564.0, "step": 55305 }, { "entropy": 5.3123260021209715, "epoch": 4.303287298191013, "grad_norm": 1.2578125, "learning_rate": 0.0003269159385554352, "loss": 4.6703, "mean_token_accuracy": 0.22812095433473586, "num_tokens": 95930653.0, "step": 55310 }, { "entropy": 5.3373703956604, "epoch": 4.303676327562731, "grad_norm": 1.21875, "learning_rate": 0.0003268889704504499, "loss": 4.7568, "mean_token_accuracy": 0.22075141668319703, "num_tokens": 95939125.0, "step": 55315 }, { "entropy": 5.335182332992554, "epoch": 4.304065356934449, "grad_norm": 1.3515625, "learning_rate": 0.00032686200155813196, "loss": 4.7059, "mean_token_accuracy": 0.23106219470500947, "num_tokens": 95947792.0, "step": 55320 }, { "entropy": 5.389108324050904, "epoch": 4.304454386306166, "grad_norm": 1.203125, "learning_rate": 0.0003268350318788908, "loss": 4.7799, "mean_token_accuracy": 0.21855859458446503, "num_tokens": 95955532.0, "step": 55325 }, { "entropy": 5.452947330474854, "epoch": 4.304843415677884, "grad_norm": 1.1953125, "learning_rate": 0.0003268080614131356, "loss": 4.831, "mean_token_accuracy": 0.21524378806352615, "num_tokens": 95964564.0, "step": 55330 }, { "entropy": 5.426184463500976, "epoch": 4.305232445049601, "grad_norm": 1.109375, "learning_rate": 0.0003267810901612754, "loss": 4.8333, "mean_token_accuracy": 0.21540775299072265, "num_tokens": 95973122.0, "step": 55335 }, { "entropy": 5.395905160903931, "epoch": 4.305621474421319, "grad_norm": 1.203125, "learning_rate": 0.00032675411812371975, "loss": 4.7798, "mean_token_accuracy": 0.22293207943439483, "num_tokens": 95980920.0, "step": 55340 }, { "entropy": 5.408984375, "epoch": 4.306010503793036, "grad_norm": 1.2734375, "learning_rate": 0.00032672714530087763, "loss": 4.7705, "mean_token_accuracy": 0.21723743677139282, "num_tokens": 95989372.0, "step": 55345 }, { "entropy": 5.4025181293487545, "epoch": 4.306399533164754, "grad_norm": 1.171875, "learning_rate": 0.00032670017169315836, "loss": 4.7459, "mean_token_accuracy": 0.22096821069717407, "num_tokens": 95997737.0, "step": 55350 }, { "entropy": 5.336916208267212, "epoch": 4.306788562536472, "grad_norm": 1.203125, "learning_rate": 0.0003266731973009713, "loss": 4.7562, "mean_token_accuracy": 0.2201735034584999, "num_tokens": 96006412.0, "step": 55355 }, { "entropy": 5.422471380233764, "epoch": 4.307177591908189, "grad_norm": 1.234375, "learning_rate": 0.0003266462221247257, "loss": 4.8014, "mean_token_accuracy": 0.22605425715446473, "num_tokens": 96014986.0, "step": 55360 }, { "entropy": 5.384347629547119, "epoch": 4.307566621279907, "grad_norm": 1.2890625, "learning_rate": 0.000326619246164831, "loss": 4.7488, "mean_token_accuracy": 0.21650106757879256, "num_tokens": 96023402.0, "step": 55365 }, { "entropy": 5.38533353805542, "epoch": 4.307955650651624, "grad_norm": 1.15625, "learning_rate": 0.0003265922694216963, "loss": 4.8456, "mean_token_accuracy": 0.21930623799562454, "num_tokens": 96031836.0, "step": 55370 }, { "entropy": 5.356522417068481, "epoch": 4.308344680023342, "grad_norm": 1.1796875, "learning_rate": 0.00032656529189573107, "loss": 4.6803, "mean_token_accuracy": 0.22192334979772568, "num_tokens": 96040365.0, "step": 55375 }, { "entropy": 5.422477531433105, "epoch": 4.308733709395059, "grad_norm": 1.28125, "learning_rate": 0.0003265383135873446, "loss": 4.8597, "mean_token_accuracy": 0.21980943977832795, "num_tokens": 96049000.0, "step": 55380 }, { "entropy": 5.476351022720337, "epoch": 4.309122738766777, "grad_norm": 1.1640625, "learning_rate": 0.0003265113344969462, "loss": 4.8069, "mean_token_accuracy": 0.220074363052845, "num_tokens": 96058141.0, "step": 55385 }, { "entropy": 5.445583248138428, "epoch": 4.309511768138495, "grad_norm": 1.1640625, "learning_rate": 0.0003264843546249453, "loss": 4.7531, "mean_token_accuracy": 0.23095903992652894, "num_tokens": 96066755.0, "step": 55390 }, { "entropy": 5.300701856613159, "epoch": 4.309900797510212, "grad_norm": 1.1328125, "learning_rate": 0.00032645737397175135, "loss": 4.6495, "mean_token_accuracy": 0.23668957352638245, "num_tokens": 96075266.0, "step": 55395 }, { "entropy": 5.305155515670776, "epoch": 4.310289826881929, "grad_norm": 1.203125, "learning_rate": 0.00032643039253777356, "loss": 4.7441, "mean_token_accuracy": 0.21834357380867003, "num_tokens": 96083118.0, "step": 55400 }, { "entropy": 5.374486303329467, "epoch": 4.310678856253647, "grad_norm": 1.1640625, "learning_rate": 0.00032640341032342147, "loss": 4.7521, "mean_token_accuracy": 0.22649578452110292, "num_tokens": 96091958.0, "step": 55405 }, { "entropy": 5.391165494918823, "epoch": 4.311067885625365, "grad_norm": 1.2421875, "learning_rate": 0.00032637642732910447, "loss": 4.8096, "mean_token_accuracy": 0.218907231092453, "num_tokens": 96100789.0, "step": 55410 }, { "entropy": 5.398464155197144, "epoch": 4.311456914997082, "grad_norm": 1.171875, "learning_rate": 0.00032634944355523196, "loss": 4.8105, "mean_token_accuracy": 0.22169774174690246, "num_tokens": 96109117.0, "step": 55415 }, { "entropy": 5.374966812133789, "epoch": 4.3118459443688, "grad_norm": 1.109375, "learning_rate": 0.0003263224590022133, "loss": 4.8413, "mean_token_accuracy": 0.21848445236682892, "num_tokens": 96117676.0, "step": 55420 }, { "entropy": 5.389714765548706, "epoch": 4.312234973740518, "grad_norm": 1.1171875, "learning_rate": 0.00032629547367045805, "loss": 4.7729, "mean_token_accuracy": 0.22224421948194503, "num_tokens": 96127330.0, "step": 55425 }, { "entropy": 5.469387578964233, "epoch": 4.312624003112235, "grad_norm": 1.15625, "learning_rate": 0.00032626848756037565, "loss": 4.93, "mean_token_accuracy": 0.21103732734918595, "num_tokens": 96136477.0, "step": 55430 }, { "entropy": 5.342172145843506, "epoch": 4.313013032483952, "grad_norm": 1.2109375, "learning_rate": 0.00032624150067237553, "loss": 4.7122, "mean_token_accuracy": 0.22278120070695878, "num_tokens": 96145719.0, "step": 55435 }, { "entropy": 5.305167961120605, "epoch": 4.31340206185567, "grad_norm": 1.203125, "learning_rate": 0.0003262145130068672, "loss": 4.7367, "mean_token_accuracy": 0.22570502161979675, "num_tokens": 96155004.0, "step": 55440 }, { "entropy": 5.404322719573974, "epoch": 4.313791091227388, "grad_norm": 1.15625, "learning_rate": 0.00032618752456426017, "loss": 4.8483, "mean_token_accuracy": 0.22060937732458114, "num_tokens": 96165544.0, "step": 55445 }, { "entropy": 5.387012338638305, "epoch": 4.314180120599105, "grad_norm": 1.1640625, "learning_rate": 0.00032616053534496387, "loss": 4.7295, "mean_token_accuracy": 0.23154066503047943, "num_tokens": 96173572.0, "step": 55450 }, { "entropy": 5.360696506500244, "epoch": 4.314569149970823, "grad_norm": 1.1796875, "learning_rate": 0.0003261335453493879, "loss": 4.8375, "mean_token_accuracy": 0.22176438719034194, "num_tokens": 96182275.0, "step": 55455 }, { "entropy": 5.420110368728638, "epoch": 4.314958179342541, "grad_norm": 1.1875, "learning_rate": 0.00032610655457794184, "loss": 4.7913, "mean_token_accuracy": 0.2202710121870041, "num_tokens": 96190538.0, "step": 55460 }, { "entropy": 5.414336442947388, "epoch": 4.3153472087142575, "grad_norm": 1.1953125, "learning_rate": 0.00032607956303103516, "loss": 4.7479, "mean_token_accuracy": 0.22611221820116043, "num_tokens": 96198783.0, "step": 55465 }, { "entropy": 5.394220542907715, "epoch": 4.315736238085975, "grad_norm": 1.234375, "learning_rate": 0.00032605257070907734, "loss": 4.7746, "mean_token_accuracy": 0.22512691766023635, "num_tokens": 96207291.0, "step": 55470 }, { "entropy": 5.368642807006836, "epoch": 4.316125267457693, "grad_norm": 1.25, "learning_rate": 0.00032602557761247805, "loss": 4.8471, "mean_token_accuracy": 0.2155747666954994, "num_tokens": 96215493.0, "step": 55475 }, { "entropy": 5.378756523132324, "epoch": 4.316514296829411, "grad_norm": 1.109375, "learning_rate": 0.0003259985837416468, "loss": 4.7641, "mean_token_accuracy": 0.2223289802670479, "num_tokens": 96225095.0, "step": 55480 }, { "entropy": 5.408122539520264, "epoch": 4.316903326201128, "grad_norm": 1.2421875, "learning_rate": 0.0003259715890969932, "loss": 4.7061, "mean_token_accuracy": 0.2230312630534172, "num_tokens": 96232957.0, "step": 55485 }, { "entropy": 5.3922735214233395, "epoch": 4.317292355572846, "grad_norm": 1.1875, "learning_rate": 0.0003259445936789269, "loss": 4.8539, "mean_token_accuracy": 0.21551900058984758, "num_tokens": 96242005.0, "step": 55490 }, { "entropy": 5.321115159988404, "epoch": 4.317681384944564, "grad_norm": 1.1875, "learning_rate": 0.00032591759748785753, "loss": 4.73, "mean_token_accuracy": 0.22020068019628525, "num_tokens": 96251014.0, "step": 55495 }, { "entropy": 5.292581272125244, "epoch": 4.3180704143162805, "grad_norm": 1.140625, "learning_rate": 0.0003258906005241946, "loss": 4.7395, "mean_token_accuracy": 0.22166526913642884, "num_tokens": 96259894.0, "step": 55500 }, { "entropy": 5.335675621032715, "epoch": 4.318459443687998, "grad_norm": 1.2421875, "learning_rate": 0.0003258636027883478, "loss": 4.6927, "mean_token_accuracy": 0.22346720546483995, "num_tokens": 96268257.0, "step": 55505 }, { "entropy": 5.3699757099151615, "epoch": 4.318848473059716, "grad_norm": 1.234375, "learning_rate": 0.0003258366042807269, "loss": 4.7294, "mean_token_accuracy": 0.22322644293308258, "num_tokens": 96277366.0, "step": 55510 }, { "entropy": 5.358770084381104, "epoch": 4.319237502431434, "grad_norm": 1.265625, "learning_rate": 0.0003258096050017413, "loss": 4.7837, "mean_token_accuracy": 0.2219999313354492, "num_tokens": 96286306.0, "step": 55515 }, { "entropy": 5.35988221168518, "epoch": 4.319626531803151, "grad_norm": 1.140625, "learning_rate": 0.0003257826049518008, "loss": 4.739, "mean_token_accuracy": 0.21961160153150558, "num_tokens": 96295582.0, "step": 55520 }, { "entropy": 5.427718687057495, "epoch": 4.320015561174869, "grad_norm": 1.2421875, "learning_rate": 0.0003257556041313153, "loss": 4.8162, "mean_token_accuracy": 0.22021132707595825, "num_tokens": 96304540.0, "step": 55525 }, { "entropy": 5.2953760623931885, "epoch": 4.320404590546587, "grad_norm": 1.1953125, "learning_rate": 0.0003257286025406941, "loss": 4.6804, "mean_token_accuracy": 0.22188996970653535, "num_tokens": 96312872.0, "step": 55530 }, { "entropy": 5.424187231063843, "epoch": 4.3207936199183035, "grad_norm": 1.265625, "learning_rate": 0.00032570160018034717, "loss": 4.7719, "mean_token_accuracy": 0.22222257554531097, "num_tokens": 96321378.0, "step": 55535 }, { "entropy": 5.352781200408936, "epoch": 4.321182649290021, "grad_norm": 1.1640625, "learning_rate": 0.00032567459705068415, "loss": 4.7454, "mean_token_accuracy": 0.228916797041893, "num_tokens": 96329751.0, "step": 55540 }, { "entropy": 5.409131622314453, "epoch": 4.321571678661739, "grad_norm": 1.3515625, "learning_rate": 0.00032564759315211475, "loss": 4.8251, "mean_token_accuracy": 0.21533117443323135, "num_tokens": 96337928.0, "step": 55545 }, { "entropy": 5.4032628536224365, "epoch": 4.3219607080334566, "grad_norm": 1.2734375, "learning_rate": 0.00032562058848504877, "loss": 4.8452, "mean_token_accuracy": 0.21290225237607957, "num_tokens": 96347017.0, "step": 55550 }, { "entropy": 5.376733112335205, "epoch": 4.322349737405174, "grad_norm": 1.1953125, "learning_rate": 0.0003255935830498959, "loss": 4.7621, "mean_token_accuracy": 0.2229041799902916, "num_tokens": 96356195.0, "step": 55555 }, { "entropy": 5.488920211791992, "epoch": 4.322738766776892, "grad_norm": 1.125, "learning_rate": 0.000325566576847066, "loss": 4.9037, "mean_token_accuracy": 0.20501357614994048, "num_tokens": 96364980.0, "step": 55560 }, { "entropy": 5.467865943908691, "epoch": 4.32312779614861, "grad_norm": 1.28125, "learning_rate": 0.0003255395698769687, "loss": 4.8805, "mean_token_accuracy": 0.21121373921632766, "num_tokens": 96372978.0, "step": 55565 }, { "entropy": 5.403638410568237, "epoch": 4.3235168255203265, "grad_norm": 1.1484375, "learning_rate": 0.0003255125621400139, "loss": 4.7538, "mean_token_accuracy": 0.21785937249660492, "num_tokens": 96381209.0, "step": 55570 }, { "entropy": 5.438088655471802, "epoch": 4.323905854892044, "grad_norm": 1.1328125, "learning_rate": 0.0003254855536366114, "loss": 4.8552, "mean_token_accuracy": 0.2178419291973114, "num_tokens": 96390625.0, "step": 55575 }, { "entropy": 5.484043312072754, "epoch": 4.324294884263762, "grad_norm": 1.1484375, "learning_rate": 0.000325458544367171, "loss": 4.8188, "mean_token_accuracy": 0.22014171481132508, "num_tokens": 96399629.0, "step": 55580 }, { "entropy": 5.393654298782349, "epoch": 4.3246839136354795, "grad_norm": 1.203125, "learning_rate": 0.00032543153433210243, "loss": 4.714, "mean_token_accuracy": 0.22539501786231994, "num_tokens": 96407718.0, "step": 55585 }, { "entropy": 5.365255117416382, "epoch": 4.325072943007197, "grad_norm": 1.171875, "learning_rate": 0.0003254045235318156, "loss": 4.7092, "mean_token_accuracy": 0.23057196140289307, "num_tokens": 96416422.0, "step": 55590 }, { "entropy": 5.279518938064575, "epoch": 4.325461972378915, "grad_norm": 1.296875, "learning_rate": 0.00032537751196672033, "loss": 4.6665, "mean_token_accuracy": 0.2265308678150177, "num_tokens": 96424582.0, "step": 55595 }, { "entropy": 5.533742523193359, "epoch": 4.325851001750632, "grad_norm": 1.265625, "learning_rate": 0.0003253504996372266, "loss": 4.9855, "mean_token_accuracy": 0.20255263447761535, "num_tokens": 96433272.0, "step": 55600 }, { "entropy": 5.417198276519775, "epoch": 4.3262400311223494, "grad_norm": 1.1796875, "learning_rate": 0.0003253234865437442, "loss": 4.6997, "mean_token_accuracy": 0.23361830562353134, "num_tokens": 96442432.0, "step": 55605 }, { "entropy": 5.417437124252319, "epoch": 4.326629060494067, "grad_norm": 1.1328125, "learning_rate": 0.0003252964726866829, "loss": 4.8151, "mean_token_accuracy": 0.21862059384584426, "num_tokens": 96451233.0, "step": 55610 }, { "entropy": 5.363316392898559, "epoch": 4.327018089865785, "grad_norm": 1.1484375, "learning_rate": 0.00032526945806645265, "loss": 4.8629, "mean_token_accuracy": 0.21029772758483886, "num_tokens": 96460393.0, "step": 55615 }, { "entropy": 5.372008991241455, "epoch": 4.3274071192375025, "grad_norm": 1.265625, "learning_rate": 0.0003252424426834634, "loss": 4.7087, "mean_token_accuracy": 0.22971729040145875, "num_tokens": 96467865.0, "step": 55620 }, { "entropy": 5.33195013999939, "epoch": 4.32779614860922, "grad_norm": 1.21875, "learning_rate": 0.0003252154265381251, "loss": 4.689, "mean_token_accuracy": 0.22645098268985747, "num_tokens": 96475931.0, "step": 55625 }, { "entropy": 5.381135368347168, "epoch": 4.328185177980938, "grad_norm": 1.1328125, "learning_rate": 0.0003251884096308476, "loss": 4.7752, "mean_token_accuracy": 0.22809132635593415, "num_tokens": 96484532.0, "step": 55630 }, { "entropy": 5.367303943634033, "epoch": 4.328574207352655, "grad_norm": 1.203125, "learning_rate": 0.00032516139196204087, "loss": 4.757, "mean_token_accuracy": 0.23212565779685973, "num_tokens": 96492182.0, "step": 55635 }, { "entropy": 5.418198680877685, "epoch": 4.328963236724372, "grad_norm": 1.1875, "learning_rate": 0.00032513437353211483, "loss": 4.771, "mean_token_accuracy": 0.23258078396320342, "num_tokens": 96500146.0, "step": 55640 }, { "entropy": 5.419314336776734, "epoch": 4.32935226609609, "grad_norm": 1.1796875, "learning_rate": 0.0003251073543414796, "loss": 4.8295, "mean_token_accuracy": 0.21825287640094757, "num_tokens": 96509116.0, "step": 55645 }, { "entropy": 5.448482275009155, "epoch": 4.329741295467808, "grad_norm": 1.2734375, "learning_rate": 0.00032508033439054493, "loss": 4.8405, "mean_token_accuracy": 0.21710984259843827, "num_tokens": 96517846.0, "step": 55650 }, { "entropy": 5.348165798187256, "epoch": 4.3301303248395255, "grad_norm": 1.2265625, "learning_rate": 0.0003250533136797208, "loss": 4.7077, "mean_token_accuracy": 0.22872622013092042, "num_tokens": 96526639.0, "step": 55655 }, { "entropy": 5.4071722507476805, "epoch": 4.330519354211243, "grad_norm": 1.2109375, "learning_rate": 0.00032502629220941743, "loss": 4.8547, "mean_token_accuracy": 0.21390550285577775, "num_tokens": 96535689.0, "step": 55660 }, { "entropy": 5.392814588546753, "epoch": 4.33090838358296, "grad_norm": 1.109375, "learning_rate": 0.00032499926998004464, "loss": 4.7854, "mean_token_accuracy": 0.22436124384403228, "num_tokens": 96545071.0, "step": 55665 }, { "entropy": 5.403608703613282, "epoch": 4.331297412954678, "grad_norm": 1.1796875, "learning_rate": 0.0003249722469920126, "loss": 4.7334, "mean_token_accuracy": 0.22524525076150895, "num_tokens": 96553077.0, "step": 55670 }, { "entropy": 5.329644823074341, "epoch": 4.331686442326395, "grad_norm": 1.140625, "learning_rate": 0.0003249452232457312, "loss": 4.7115, "mean_token_accuracy": 0.2247196242213249, "num_tokens": 96561928.0, "step": 55675 }, { "entropy": 5.395749759674072, "epoch": 4.332075471698113, "grad_norm": 1.1015625, "learning_rate": 0.00032491819874161046, "loss": 4.8615, "mean_token_accuracy": 0.22728123515844345, "num_tokens": 96570695.0, "step": 55680 }, { "entropy": 5.403173589706421, "epoch": 4.332464501069831, "grad_norm": 1.2109375, "learning_rate": 0.0003248911734800606, "loss": 4.7574, "mean_token_accuracy": 0.22319168150424956, "num_tokens": 96578727.0, "step": 55685 }, { "entropy": 5.490252304077148, "epoch": 4.3328535304415485, "grad_norm": 1.203125, "learning_rate": 0.00032486414746149154, "loss": 4.8686, "mean_token_accuracy": 0.20879190564155578, "num_tokens": 96587759.0, "step": 55690 }, { "entropy": 5.40419487953186, "epoch": 4.333242559813266, "grad_norm": 1.1953125, "learning_rate": 0.00032483712068631345, "loss": 4.8014, "mean_token_accuracy": 0.22317678183317186, "num_tokens": 96596456.0, "step": 55695 }, { "entropy": 5.377751350402832, "epoch": 4.333631589184984, "grad_norm": 1.1796875, "learning_rate": 0.0003248100931549364, "loss": 4.7725, "mean_token_accuracy": 0.22799796611070633, "num_tokens": 96605877.0, "step": 55700 }, { "entropy": 5.464987707138062, "epoch": 4.334020618556701, "grad_norm": 1.1640625, "learning_rate": 0.00032478306486777037, "loss": 4.7394, "mean_token_accuracy": 0.22770272493362426, "num_tokens": 96614327.0, "step": 55705 }, { "entropy": 5.371473264694214, "epoch": 4.334409647928418, "grad_norm": 1.2109375, "learning_rate": 0.0003247560358252256, "loss": 4.721, "mean_token_accuracy": 0.22613715529441833, "num_tokens": 96622826.0, "step": 55710 }, { "entropy": 5.309128522872925, "epoch": 4.334798677300136, "grad_norm": 1.25, "learning_rate": 0.00032472900602771224, "loss": 4.7589, "mean_token_accuracy": 0.22518249750137329, "num_tokens": 96631639.0, "step": 55715 }, { "entropy": 5.433979797363281, "epoch": 4.335187706671854, "grad_norm": 1.1796875, "learning_rate": 0.00032470197547564036, "loss": 4.8487, "mean_token_accuracy": 0.21633694916963578, "num_tokens": 96639711.0, "step": 55720 }, { "entropy": 5.433394050598144, "epoch": 4.3355767360435715, "grad_norm": 1.21875, "learning_rate": 0.00032467494416942006, "loss": 4.7524, "mean_token_accuracy": 0.224424247443676, "num_tokens": 96648046.0, "step": 55725 }, { "entropy": 5.357724189758301, "epoch": 4.335965765415289, "grad_norm": 1.2265625, "learning_rate": 0.0003246479121094616, "loss": 4.6462, "mean_token_accuracy": 0.23440519124269485, "num_tokens": 96657794.0, "step": 55730 }, { "entropy": 5.353157567977905, "epoch": 4.336354794787006, "grad_norm": 1.1796875, "learning_rate": 0.000324620879296175, "loss": 4.7885, "mean_token_accuracy": 0.2139231637120247, "num_tokens": 96666282.0, "step": 55735 }, { "entropy": 5.455154275894165, "epoch": 4.336743824158724, "grad_norm": 1.1640625, "learning_rate": 0.0003245938457299706, "loss": 4.854, "mean_token_accuracy": 0.2165993332862854, "num_tokens": 96675189.0, "step": 55740 }, { "entropy": 5.43734073638916, "epoch": 4.337132853530441, "grad_norm": 1.1796875, "learning_rate": 0.00032456681141125853, "loss": 4.8026, "mean_token_accuracy": 0.2215997964143753, "num_tokens": 96683637.0, "step": 55745 }, { "entropy": 5.399583911895752, "epoch": 4.337521882902159, "grad_norm": 1.15625, "learning_rate": 0.000324539776340449, "loss": 4.7807, "mean_token_accuracy": 0.2228444203734398, "num_tokens": 96693000.0, "step": 55750 }, { "entropy": 5.328756809234619, "epoch": 4.337910912273877, "grad_norm": 1.140625, "learning_rate": 0.0003245127405179522, "loss": 4.7423, "mean_token_accuracy": 0.22194072753190994, "num_tokens": 96702088.0, "step": 55755 }, { "entropy": 5.390795087814331, "epoch": 4.3382999416455945, "grad_norm": 1.1796875, "learning_rate": 0.0003244857039441784, "loss": 4.8095, "mean_token_accuracy": 0.2224502071738243, "num_tokens": 96710497.0, "step": 55760 }, { "entropy": 5.488256645202637, "epoch": 4.338688971017312, "grad_norm": 1.109375, "learning_rate": 0.00032445866661953774, "loss": 4.8482, "mean_token_accuracy": 0.21836442053318023, "num_tokens": 96720175.0, "step": 55765 }, { "entropy": 5.404442930221558, "epoch": 4.339078000389029, "grad_norm": 1.1953125, "learning_rate": 0.00032443162854444064, "loss": 4.8185, "mean_token_accuracy": 0.2181785762310028, "num_tokens": 96728760.0, "step": 55770 }, { "entropy": 5.4370355129241945, "epoch": 4.339467029760747, "grad_norm": 1.2578125, "learning_rate": 0.0003244045897192972, "loss": 4.868, "mean_token_accuracy": 0.21257621049880981, "num_tokens": 96737105.0, "step": 55775 }, { "entropy": 5.428970623016357, "epoch": 4.339856059132464, "grad_norm": 1.203125, "learning_rate": 0.00032437755014451777, "loss": 4.8931, "mean_token_accuracy": 0.21427603513002397, "num_tokens": 96745881.0, "step": 55780 }, { "entropy": 5.491665601730347, "epoch": 4.340245088504182, "grad_norm": 1.2421875, "learning_rate": 0.00032435050982051246, "loss": 4.8208, "mean_token_accuracy": 0.22051716297864915, "num_tokens": 96754427.0, "step": 55785 }, { "entropy": 5.402885866165161, "epoch": 4.3406341178759, "grad_norm": 1.1875, "learning_rate": 0.00032432346874769187, "loss": 4.81, "mean_token_accuracy": 0.2187369093298912, "num_tokens": 96763517.0, "step": 55790 }, { "entropy": 5.417707872390747, "epoch": 4.3410231472476175, "grad_norm": 1.15625, "learning_rate": 0.00032429642692646614, "loss": 4.8399, "mean_token_accuracy": 0.21524917036294938, "num_tokens": 96772872.0, "step": 55795 }, { "entropy": 5.471979141235352, "epoch": 4.341412176619334, "grad_norm": 1.140625, "learning_rate": 0.00032426938435724554, "loss": 4.7752, "mean_token_accuracy": 0.21772324442863464, "num_tokens": 96781249.0, "step": 55800 }, { "entropy": 5.365498685836792, "epoch": 4.341801205991052, "grad_norm": 1.15625, "learning_rate": 0.00032424234104044055, "loss": 4.7462, "mean_token_accuracy": 0.22384527921676636, "num_tokens": 96789769.0, "step": 55805 }, { "entropy": 5.39996337890625, "epoch": 4.34219023536277, "grad_norm": 1.2109375, "learning_rate": 0.0003242152969764613, "loss": 4.8796, "mean_token_accuracy": 0.21005725711584092, "num_tokens": 96798859.0, "step": 55810 }, { "entropy": 5.405779027938843, "epoch": 4.342579264734487, "grad_norm": 1.2734375, "learning_rate": 0.0003241882521657183, "loss": 4.7363, "mean_token_accuracy": 0.22263825982809066, "num_tokens": 96807301.0, "step": 55815 }, { "entropy": 5.398718786239624, "epoch": 4.342968294106205, "grad_norm": 1.21875, "learning_rate": 0.00032416120660862187, "loss": 4.7427, "mean_token_accuracy": 0.22943371683359146, "num_tokens": 96815302.0, "step": 55820 }, { "entropy": 5.361724615097046, "epoch": 4.343357323477923, "grad_norm": 1.25, "learning_rate": 0.0003241341603055823, "loss": 4.7743, "mean_token_accuracy": 0.2285906746983528, "num_tokens": 96823206.0, "step": 55825 }, { "entropy": 5.4169398784637455, "epoch": 4.3437463528496405, "grad_norm": 1.15625, "learning_rate": 0.0003241071132570101, "loss": 4.7902, "mean_token_accuracy": 0.22267747521400452, "num_tokens": 96831843.0, "step": 55830 }, { "entropy": 5.488817644119263, "epoch": 4.344135382221357, "grad_norm": 1.15625, "learning_rate": 0.0003240800654633157, "loss": 4.8871, "mean_token_accuracy": 0.2118205487728119, "num_tokens": 96841221.0, "step": 55835 }, { "entropy": 5.428368139266968, "epoch": 4.344524411593075, "grad_norm": 1.2265625, "learning_rate": 0.0003240530169249094, "loss": 4.8347, "mean_token_accuracy": 0.21994154155254364, "num_tokens": 96849970.0, "step": 55840 }, { "entropy": 5.418295955657959, "epoch": 4.344913440964793, "grad_norm": 1.03125, "learning_rate": 0.0003240259676422016, "loss": 4.7728, "mean_token_accuracy": 0.2156427890062332, "num_tokens": 96858970.0, "step": 55845 }, { "entropy": 5.324556446075439, "epoch": 4.34530247033651, "grad_norm": 1.125, "learning_rate": 0.00032399891761560274, "loss": 4.6808, "mean_token_accuracy": 0.23872142434120178, "num_tokens": 96867546.0, "step": 55850 }, { "entropy": 5.287373495101929, "epoch": 4.345691499708228, "grad_norm": 1.1953125, "learning_rate": 0.0003239718668455233, "loss": 4.6828, "mean_token_accuracy": 0.23273766934871673, "num_tokens": 96877038.0, "step": 55855 }, { "entropy": 5.460830640792847, "epoch": 4.346080529079946, "grad_norm": 1.296875, "learning_rate": 0.0003239448153323737, "loss": 4.8989, "mean_token_accuracy": 0.20918368697166442, "num_tokens": 96886502.0, "step": 55860 }, { "entropy": 5.491157007217407, "epoch": 4.3464695584516635, "grad_norm": 1.1875, "learning_rate": 0.00032391776307656456, "loss": 4.8605, "mean_token_accuracy": 0.21206588298082352, "num_tokens": 96895629.0, "step": 55865 }, { "entropy": 5.442399978637695, "epoch": 4.34685858782338, "grad_norm": 1.140625, "learning_rate": 0.00032389071007850616, "loss": 4.8014, "mean_token_accuracy": 0.21925843954086305, "num_tokens": 96903907.0, "step": 55870 }, { "entropy": 5.350760889053345, "epoch": 4.347247617195098, "grad_norm": 1.2421875, "learning_rate": 0.00032386365633860914, "loss": 4.8005, "mean_token_accuracy": 0.2209215611219406, "num_tokens": 96911860.0, "step": 55875 }, { "entropy": 5.267929124832153, "epoch": 4.347636646566816, "grad_norm": 1.15625, "learning_rate": 0.0003238366018572838, "loss": 4.6943, "mean_token_accuracy": 0.22725993394851685, "num_tokens": 96920449.0, "step": 55880 }, { "entropy": 5.365199899673462, "epoch": 4.348025675938533, "grad_norm": 1.1640625, "learning_rate": 0.0003238095466349407, "loss": 4.6974, "mean_token_accuracy": 0.22886136919260025, "num_tokens": 96929256.0, "step": 55885 }, { "entropy": 5.357767391204834, "epoch": 4.348414705310251, "grad_norm": 1.15625, "learning_rate": 0.0003237824906719905, "loss": 4.7499, "mean_token_accuracy": 0.21974247545003892, "num_tokens": 96937945.0, "step": 55890 }, { "entropy": 5.419110679626465, "epoch": 4.348803734681969, "grad_norm": 1.1484375, "learning_rate": 0.00032375543396884367, "loss": 4.8698, "mean_token_accuracy": 0.22124201208353042, "num_tokens": 96948296.0, "step": 55895 }, { "entropy": 5.310656309127808, "epoch": 4.3491927640536865, "grad_norm": 1.0859375, "learning_rate": 0.0003237283765259107, "loss": 4.5903, "mean_token_accuracy": 0.2321484535932541, "num_tokens": 96957515.0, "step": 55900 }, { "entropy": 5.447336673736572, "epoch": 4.349581793425403, "grad_norm": 1.1953125, "learning_rate": 0.00032370131834360215, "loss": 4.8715, "mean_token_accuracy": 0.21613024473190307, "num_tokens": 96966051.0, "step": 55905 }, { "entropy": 5.368315839767456, "epoch": 4.349970822797121, "grad_norm": 1.203125, "learning_rate": 0.0003236742594223287, "loss": 4.7261, "mean_token_accuracy": 0.22677332758903504, "num_tokens": 96973963.0, "step": 55910 }, { "entropy": 5.31332802772522, "epoch": 4.350359852168839, "grad_norm": 1.2578125, "learning_rate": 0.0003236471997625008, "loss": 4.7507, "mean_token_accuracy": 0.22661279290914535, "num_tokens": 96983207.0, "step": 55915 }, { "entropy": 5.37418007850647, "epoch": 4.350748881540556, "grad_norm": 1.2421875, "learning_rate": 0.0003236201393645291, "loss": 4.7451, "mean_token_accuracy": 0.23111149072647094, "num_tokens": 96992542.0, "step": 55920 }, { "entropy": 5.386187934875489, "epoch": 4.351137910912274, "grad_norm": 1.21875, "learning_rate": 0.00032359307822882403, "loss": 4.7993, "mean_token_accuracy": 0.2202426239848137, "num_tokens": 97000678.0, "step": 55925 }, { "entropy": 5.4081987857818605, "epoch": 4.351526940283992, "grad_norm": 1.203125, "learning_rate": 0.00032356601635579645, "loss": 4.7592, "mean_token_accuracy": 0.22231945842504502, "num_tokens": 97009120.0, "step": 55930 }, { "entropy": 5.338505506515503, "epoch": 4.351915969655709, "grad_norm": 1.1953125, "learning_rate": 0.0003235389537458569, "loss": 4.7365, "mean_token_accuracy": 0.22983648777008056, "num_tokens": 97018340.0, "step": 55935 }, { "entropy": 5.3908055305480955, "epoch": 4.352304999027426, "grad_norm": 1.1328125, "learning_rate": 0.00032351189039941594, "loss": 4.7553, "mean_token_accuracy": 0.23117996752262115, "num_tokens": 97027250.0, "step": 55940 }, { "entropy": 5.387021017074585, "epoch": 4.352694028399144, "grad_norm": 1.203125, "learning_rate": 0.00032348482631688424, "loss": 4.7528, "mean_token_accuracy": 0.22428754717111588, "num_tokens": 97035335.0, "step": 55945 }, { "entropy": 5.338643789291382, "epoch": 4.353083057770862, "grad_norm": 1.109375, "learning_rate": 0.0003234577614986725, "loss": 4.7725, "mean_token_accuracy": 0.21736646741628646, "num_tokens": 97043851.0, "step": 55950 }, { "entropy": 5.342312955856324, "epoch": 4.353472087142579, "grad_norm": 1.1796875, "learning_rate": 0.0003234306959451914, "loss": 4.7856, "mean_token_accuracy": 0.22453118860721588, "num_tokens": 97052155.0, "step": 55955 }, { "entropy": 5.385831356048584, "epoch": 4.353861116514297, "grad_norm": 1.1875, "learning_rate": 0.00032340362965685145, "loss": 4.7188, "mean_token_accuracy": 0.22177911996841432, "num_tokens": 97061173.0, "step": 55960 }, { "entropy": 5.4687456607818605, "epoch": 4.354250145886015, "grad_norm": 1.15625, "learning_rate": 0.0003233765626340636, "loss": 4.8427, "mean_token_accuracy": 0.2141509473323822, "num_tokens": 97069686.0, "step": 55965 }, { "entropy": 5.422771167755127, "epoch": 4.354639175257732, "grad_norm": 1.078125, "learning_rate": 0.0003233494948772384, "loss": 4.8427, "mean_token_accuracy": 0.2132783442735672, "num_tokens": 97079066.0, "step": 55970 }, { "entropy": 5.4230124950408936, "epoch": 4.355028204629449, "grad_norm": 1.0703125, "learning_rate": 0.00032332242638678647, "loss": 4.8234, "mean_token_accuracy": 0.21738970875740052, "num_tokens": 97089238.0, "step": 55975 }, { "entropy": 5.416968154907226, "epoch": 4.355417234001167, "grad_norm": 1.21875, "learning_rate": 0.0003232953571631187, "loss": 4.7778, "mean_token_accuracy": 0.22134379893541337, "num_tokens": 97098042.0, "step": 55980 }, { "entropy": 5.511040830612183, "epoch": 4.355806263372885, "grad_norm": 1.2265625, "learning_rate": 0.0003232682872066457, "loss": 4.8173, "mean_token_accuracy": 0.21987354904413223, "num_tokens": 97107173.0, "step": 55985 }, { "entropy": 5.335352802276612, "epoch": 4.356195292744602, "grad_norm": 1.1328125, "learning_rate": 0.0003232412165177783, "loss": 4.6467, "mean_token_accuracy": 0.22969443649053572, "num_tokens": 97115813.0, "step": 55990 }, { "entropy": 5.461706113815308, "epoch": 4.35658432211632, "grad_norm": 1.1953125, "learning_rate": 0.00032321414509692726, "loss": 4.8587, "mean_token_accuracy": 0.21749609112739562, "num_tokens": 97124106.0, "step": 55995 }, { "entropy": 5.372380208969116, "epoch": 4.356973351488037, "grad_norm": 1.1640625, "learning_rate": 0.00032318707294450326, "loss": 4.7833, "mean_token_accuracy": 0.22204227298498153, "num_tokens": 97133703.0, "step": 56000 }, { "entropy": 5.405798768997192, "epoch": 4.357362380859755, "grad_norm": 1.0703125, "learning_rate": 0.0003231600000609171, "loss": 4.7399, "mean_token_accuracy": 0.22545213550329207, "num_tokens": 97142826.0, "step": 56005 }, { "entropy": 5.368091583251953, "epoch": 4.357751410231472, "grad_norm": 1.234375, "learning_rate": 0.00032313292644657967, "loss": 4.7327, "mean_token_accuracy": 0.22490902841091157, "num_tokens": 97151408.0, "step": 56010 }, { "entropy": 5.393712759017944, "epoch": 4.35814043960319, "grad_norm": 1.171875, "learning_rate": 0.0003231058521019017, "loss": 4.8536, "mean_token_accuracy": 0.21505127251148223, "num_tokens": 97160210.0, "step": 56015 }, { "entropy": 5.505608749389649, "epoch": 4.358529468974908, "grad_norm": 1.3046875, "learning_rate": 0.0003230787770272939, "loss": 4.8429, "mean_token_accuracy": 0.22239350378513337, "num_tokens": 97168618.0, "step": 56020 }, { "entropy": 5.472224473953247, "epoch": 4.358918498346625, "grad_norm": 1.2734375, "learning_rate": 0.0003230517012231673, "loss": 4.822, "mean_token_accuracy": 0.22635573595762254, "num_tokens": 97176668.0, "step": 56025 }, { "entropy": 5.265771102905274, "epoch": 4.359307527718343, "grad_norm": 1.25, "learning_rate": 0.00032302462468993253, "loss": 4.7331, "mean_token_accuracy": 0.2277931347489357, "num_tokens": 97184195.0, "step": 56030 }, { "entropy": 5.381201553344726, "epoch": 4.359696557090061, "grad_norm": 1.3046875, "learning_rate": 0.0003229975474280006, "loss": 4.8734, "mean_token_accuracy": 0.21844094395637512, "num_tokens": 97192535.0, "step": 56035 }, { "entropy": 5.400267457962036, "epoch": 4.360085586461778, "grad_norm": 1.09375, "learning_rate": 0.00032297046943778216, "loss": 4.7268, "mean_token_accuracy": 0.22568205147981643, "num_tokens": 97201334.0, "step": 56040 }, { "entropy": 5.3981232166290285, "epoch": 4.360474615833495, "grad_norm": 1.1953125, "learning_rate": 0.00032294339071968833, "loss": 4.7555, "mean_token_accuracy": 0.22293631136417388, "num_tokens": 97209826.0, "step": 56045 }, { "entropy": 5.353059148788452, "epoch": 4.360863645205213, "grad_norm": 1.1640625, "learning_rate": 0.00032291631127412976, "loss": 4.7772, "mean_token_accuracy": 0.21820842772722243, "num_tokens": 97218469.0, "step": 56050 }, { "entropy": 5.395062255859375, "epoch": 4.361252674576931, "grad_norm": 1.2734375, "learning_rate": 0.0003228892311015174, "loss": 4.7633, "mean_token_accuracy": 0.21846552789211274, "num_tokens": 97227341.0, "step": 56055 }, { "entropy": 5.456218576431274, "epoch": 4.361641703948648, "grad_norm": 1.1484375, "learning_rate": 0.00032286215020226224, "loss": 4.8193, "mean_token_accuracy": 0.22159145623445511, "num_tokens": 97236582.0, "step": 56060 }, { "entropy": 5.451393365859985, "epoch": 4.362030733320366, "grad_norm": 1.1484375, "learning_rate": 0.00032283506857677517, "loss": 4.8346, "mean_token_accuracy": 0.2176318049430847, "num_tokens": 97244390.0, "step": 56065 }, { "entropy": 5.3915690898895265, "epoch": 4.362419762692083, "grad_norm": 1.3828125, "learning_rate": 0.0003228079862254671, "loss": 4.7573, "mean_token_accuracy": 0.23124109506607055, "num_tokens": 97252889.0, "step": 56070 }, { "entropy": 5.335072946548462, "epoch": 4.362808792063801, "grad_norm": 1.1484375, "learning_rate": 0.00032278090314874887, "loss": 4.7587, "mean_token_accuracy": 0.22069679498672484, "num_tokens": 97260928.0, "step": 56075 }, { "entropy": 5.359328269958496, "epoch": 4.363197821435518, "grad_norm": 1.2109375, "learning_rate": 0.00032275381934703147, "loss": 4.7381, "mean_token_accuracy": 0.22488827258348465, "num_tokens": 97268654.0, "step": 56080 }, { "entropy": 5.336133289337158, "epoch": 4.363586850807236, "grad_norm": 1.1875, "learning_rate": 0.0003227267348207258, "loss": 4.7534, "mean_token_accuracy": 0.21835248321294784, "num_tokens": 97277233.0, "step": 56085 }, { "entropy": 5.420194387435913, "epoch": 4.363975880178954, "grad_norm": 1.0859375, "learning_rate": 0.00032269964957024305, "loss": 4.8162, "mean_token_accuracy": 0.22223170548677446, "num_tokens": 97285955.0, "step": 56090 }, { "entropy": 5.423932027816773, "epoch": 4.364364909550671, "grad_norm": 1.1328125, "learning_rate": 0.00032267256359599396, "loss": 4.7992, "mean_token_accuracy": 0.2197403132915497, "num_tokens": 97294524.0, "step": 56095 }, { "entropy": 5.3944244384765625, "epoch": 4.364753938922389, "grad_norm": 1.1328125, "learning_rate": 0.00032264547689838963, "loss": 4.7236, "mean_token_accuracy": 0.2224283277988434, "num_tokens": 97303325.0, "step": 56100 }, { "entropy": 5.372149133682251, "epoch": 4.365142968294106, "grad_norm": 1.1953125, "learning_rate": 0.00032261838947784103, "loss": 4.7336, "mean_token_accuracy": 0.2247239261865616, "num_tokens": 97311512.0, "step": 56105 }, { "entropy": 5.313755655288697, "epoch": 4.365531997665824, "grad_norm": 1.171875, "learning_rate": 0.0003225913013347591, "loss": 4.7779, "mean_token_accuracy": 0.22200810462236403, "num_tokens": 97320381.0, "step": 56110 }, { "entropy": 5.37011833190918, "epoch": 4.365921027037541, "grad_norm": 1.2421875, "learning_rate": 0.00032256421246955504, "loss": 4.7345, "mean_token_accuracy": 0.22982241809368134, "num_tokens": 97329021.0, "step": 56115 }, { "entropy": 5.341499376296997, "epoch": 4.366310056409259, "grad_norm": 1.234375, "learning_rate": 0.0003225371228826396, "loss": 4.6795, "mean_token_accuracy": 0.2306458443403244, "num_tokens": 97337307.0, "step": 56120 }, { "entropy": 5.403027629852295, "epoch": 4.366699085780977, "grad_norm": 1.0859375, "learning_rate": 0.0003225100325744241, "loss": 4.8289, "mean_token_accuracy": 0.2215326502919197, "num_tokens": 97346538.0, "step": 56125 }, { "entropy": 5.444408559799195, "epoch": 4.367088115152694, "grad_norm": 1.3125, "learning_rate": 0.0003224829415453194, "loss": 4.7464, "mean_token_accuracy": 0.22983803153038024, "num_tokens": 97355135.0, "step": 56130 }, { "entropy": 5.360068655014038, "epoch": 4.367477144524411, "grad_norm": 1.109375, "learning_rate": 0.0003224558497957367, "loss": 4.7362, "mean_token_accuracy": 0.22589855790138244, "num_tokens": 97364800.0, "step": 56135 }, { "entropy": 5.412807893753052, "epoch": 4.367866173896129, "grad_norm": 1.25, "learning_rate": 0.00032242875732608697, "loss": 4.856, "mean_token_accuracy": 0.21397557556629182, "num_tokens": 97373860.0, "step": 56140 }, { "entropy": 5.447054386138916, "epoch": 4.3682552032678466, "grad_norm": 1.28125, "learning_rate": 0.0003224016641367814, "loss": 4.7934, "mean_token_accuracy": 0.21940065324306487, "num_tokens": 97382232.0, "step": 56145 }, { "entropy": 5.4790791988372805, "epoch": 4.368644232639564, "grad_norm": 1.1640625, "learning_rate": 0.00032237457022823095, "loss": 4.848, "mean_token_accuracy": 0.22616732716560364, "num_tokens": 97391785.0, "step": 56150 }, { "entropy": 5.3922828197479244, "epoch": 4.369033262011282, "grad_norm": 1.171875, "learning_rate": 0.00032234747560084675, "loss": 4.7833, "mean_token_accuracy": 0.21653473228216172, "num_tokens": 97400179.0, "step": 56155 }, { "entropy": 5.381615209579468, "epoch": 4.369422291383, "grad_norm": 1.109375, "learning_rate": 0.00032232038025504015, "loss": 4.8218, "mean_token_accuracy": 0.22236624211072922, "num_tokens": 97409108.0, "step": 56160 }, { "entropy": 5.403571367263794, "epoch": 4.369811320754717, "grad_norm": 1.203125, "learning_rate": 0.00032229328419122196, "loss": 4.7624, "mean_token_accuracy": 0.22837934494018555, "num_tokens": 97417578.0, "step": 56165 }, { "entropy": 5.34228024482727, "epoch": 4.370200350126434, "grad_norm": 1.1015625, "learning_rate": 0.0003222661874098035, "loss": 4.7372, "mean_token_accuracy": 0.22372948229312897, "num_tokens": 97426147.0, "step": 56170 }, { "entropy": 5.366935110092163, "epoch": 4.370589379498152, "grad_norm": 1.0703125, "learning_rate": 0.0003222390899111959, "loss": 4.7846, "mean_token_accuracy": 0.22217825055122375, "num_tokens": 97435551.0, "step": 56175 }, { "entropy": 5.366704511642456, "epoch": 4.3709784088698695, "grad_norm": 1.1484375, "learning_rate": 0.0003222119916958103, "loss": 4.7337, "mean_token_accuracy": 0.22579503804445267, "num_tokens": 97444245.0, "step": 56180 }, { "entropy": 5.370033073425293, "epoch": 4.371367438241587, "grad_norm": 1.1875, "learning_rate": 0.00032218489276405777, "loss": 4.7337, "mean_token_accuracy": 0.22305500209331514, "num_tokens": 97452756.0, "step": 56185 }, { "entropy": 5.352962589263916, "epoch": 4.371756467613305, "grad_norm": 1.140625, "learning_rate": 0.00032215779311634967, "loss": 4.6913, "mean_token_accuracy": 0.23692746758460997, "num_tokens": 97461151.0, "step": 56190 }, { "entropy": 5.3922467708587645, "epoch": 4.372145496985023, "grad_norm": 1.1953125, "learning_rate": 0.00032213069275309714, "loss": 4.7677, "mean_token_accuracy": 0.22473716884851455, "num_tokens": 97470310.0, "step": 56195 }, { "entropy": 5.3499339580535885, "epoch": 4.37253452635674, "grad_norm": 1.1875, "learning_rate": 0.00032210359167471136, "loss": 4.6815, "mean_token_accuracy": 0.2313734546303749, "num_tokens": 97479037.0, "step": 56200 }, { "entropy": 5.344713878631592, "epoch": 4.372923555728457, "grad_norm": 1.28125, "learning_rate": 0.0003220764898816035, "loss": 4.7797, "mean_token_accuracy": 0.22320988029241562, "num_tokens": 97487418.0, "step": 56205 }, { "entropy": 5.342199373245239, "epoch": 4.373312585100175, "grad_norm": 1.1171875, "learning_rate": 0.00032204938737418495, "loss": 4.8065, "mean_token_accuracy": 0.2276156023144722, "num_tokens": 97495871.0, "step": 56210 }, { "entropy": 5.423250484466553, "epoch": 4.3737016144718925, "grad_norm": 1.171875, "learning_rate": 0.00032202228415286664, "loss": 4.7608, "mean_token_accuracy": 0.22285333126783372, "num_tokens": 97504109.0, "step": 56215 }, { "entropy": 5.365264558792115, "epoch": 4.37409064384361, "grad_norm": 1.140625, "learning_rate": 0.0003219951802180602, "loss": 4.7668, "mean_token_accuracy": 0.22619300484657287, "num_tokens": 97513882.0, "step": 56220 }, { "entropy": 5.414183712005615, "epoch": 4.374479673215328, "grad_norm": 1.1640625, "learning_rate": 0.0003219680755701766, "loss": 4.8224, "mean_token_accuracy": 0.22421636879444123, "num_tokens": 97523130.0, "step": 56225 }, { "entropy": 5.4847901344299315, "epoch": 4.374868702587046, "grad_norm": 1.1875, "learning_rate": 0.00032194097020962726, "loss": 4.9092, "mean_token_accuracy": 0.21692904680967331, "num_tokens": 97531179.0, "step": 56230 }, { "entropy": 5.381154108047485, "epoch": 4.375257731958763, "grad_norm": 1.1875, "learning_rate": 0.0003219138641368234, "loss": 4.7495, "mean_token_accuracy": 0.22420942038297653, "num_tokens": 97540131.0, "step": 56235 }, { "entropy": 5.336398696899414, "epoch": 4.37564676133048, "grad_norm": 1.1640625, "learning_rate": 0.00032188675735217627, "loss": 4.7282, "mean_token_accuracy": 0.22687490731477739, "num_tokens": 97548592.0, "step": 56240 }, { "entropy": 5.446547031402588, "epoch": 4.376035790702198, "grad_norm": 1.21875, "learning_rate": 0.0003218596498560973, "loss": 4.7684, "mean_token_accuracy": 0.2272908478975296, "num_tokens": 97557589.0, "step": 56245 }, { "entropy": 5.331271457672119, "epoch": 4.3764248200739155, "grad_norm": 1.203125, "learning_rate": 0.0003218325416489976, "loss": 4.7387, "mean_token_accuracy": 0.22876322865486146, "num_tokens": 97565676.0, "step": 56250 }, { "entropy": 5.371689081192017, "epoch": 4.376813849445633, "grad_norm": 1.265625, "learning_rate": 0.0003218054327312888, "loss": 4.6903, "mean_token_accuracy": 0.22380103170871735, "num_tokens": 97573368.0, "step": 56255 }, { "entropy": 5.301996088027954, "epoch": 4.377202878817351, "grad_norm": 1.125, "learning_rate": 0.00032177832310338193, "loss": 4.7143, "mean_token_accuracy": 0.23484406918287276, "num_tokens": 97582424.0, "step": 56260 }, { "entropy": 5.351057052612305, "epoch": 4.377591908189069, "grad_norm": 1.3046875, "learning_rate": 0.00032175121276568853, "loss": 4.7653, "mean_token_accuracy": 0.22647581547498702, "num_tokens": 97591402.0, "step": 56265 }, { "entropy": 5.396567726135254, "epoch": 4.377980937560785, "grad_norm": 1.1640625, "learning_rate": 0.00032172410171861987, "loss": 4.8025, "mean_token_accuracy": 0.21755914390087128, "num_tokens": 97600465.0, "step": 56270 }, { "entropy": 5.374724912643432, "epoch": 4.378369966932503, "grad_norm": 1.2421875, "learning_rate": 0.00032169698996258733, "loss": 4.6914, "mean_token_accuracy": 0.225983364880085, "num_tokens": 97608248.0, "step": 56275 }, { "entropy": 5.507989025115966, "epoch": 4.378758996304221, "grad_norm": 1.171875, "learning_rate": 0.0003216698774980023, "loss": 4.9155, "mean_token_accuracy": 0.21362703293561935, "num_tokens": 97617035.0, "step": 56280 }, { "entropy": 5.3750029563903805, "epoch": 4.3791480256759385, "grad_norm": 1.15625, "learning_rate": 0.00032164276432527605, "loss": 4.7571, "mean_token_accuracy": 0.22198230773210526, "num_tokens": 97625264.0, "step": 56285 }, { "entropy": 5.4048809051513675, "epoch": 4.379537055047656, "grad_norm": 1.15625, "learning_rate": 0.0003216156504448202, "loss": 4.8275, "mean_token_accuracy": 0.2204088792204857, "num_tokens": 97633446.0, "step": 56290 }, { "entropy": 5.458734798431396, "epoch": 4.379926084419374, "grad_norm": 1.2109375, "learning_rate": 0.0003215885358570461, "loss": 4.8007, "mean_token_accuracy": 0.22244305461645125, "num_tokens": 97641440.0, "step": 56295 }, { "entropy": 5.373304033279419, "epoch": 4.380315113791092, "grad_norm": 1.1796875, "learning_rate": 0.0003215614205623651, "loss": 4.712, "mean_token_accuracy": 0.22935060560703277, "num_tokens": 97649396.0, "step": 56300 }, { "entropy": 5.384699058532715, "epoch": 4.380704143162808, "grad_norm": 1.3046875, "learning_rate": 0.0003215343045611886, "loss": 4.8024, "mean_token_accuracy": 0.22392283976078034, "num_tokens": 97658126.0, "step": 56305 }, { "entropy": 5.450688219070434, "epoch": 4.381093172534526, "grad_norm": 1.15625, "learning_rate": 0.0003215071878539281, "loss": 4.7634, "mean_token_accuracy": 0.21931175887584686, "num_tokens": 97667177.0, "step": 56310 }, { "entropy": 5.390646314620971, "epoch": 4.381482201906244, "grad_norm": 1.21875, "learning_rate": 0.00032148007044099507, "loss": 4.7663, "mean_token_accuracy": 0.22120947241783143, "num_tokens": 97675548.0, "step": 56315 }, { "entropy": 5.332130384445191, "epoch": 4.3818712312779615, "grad_norm": 1.140625, "learning_rate": 0.0003214529523228009, "loss": 4.6842, "mean_token_accuracy": 0.2317298099398613, "num_tokens": 97683580.0, "step": 56320 }, { "entropy": 5.455280065536499, "epoch": 4.382260260649679, "grad_norm": 1.1328125, "learning_rate": 0.0003214258334997572, "loss": 4.849, "mean_token_accuracy": 0.21339709758758546, "num_tokens": 97692179.0, "step": 56325 }, { "entropy": 5.348147392272949, "epoch": 4.382649290021397, "grad_norm": 1.203125, "learning_rate": 0.0003213987139722753, "loss": 4.7321, "mean_token_accuracy": 0.2255592241883278, "num_tokens": 97700989.0, "step": 56330 }, { "entropy": 5.368076324462891, "epoch": 4.383038319393114, "grad_norm": 1.15625, "learning_rate": 0.00032137159374076693, "loss": 4.7595, "mean_token_accuracy": 0.2170540601015091, "num_tokens": 97709445.0, "step": 56335 }, { "entropy": 5.447507047653199, "epoch": 4.383427348764831, "grad_norm": 1.1875, "learning_rate": 0.0003213444728056432, "loss": 4.8422, "mean_token_accuracy": 0.21912931650877, "num_tokens": 97719561.0, "step": 56340 }, { "entropy": 5.307501554489136, "epoch": 4.383816378136549, "grad_norm": 1.1796875, "learning_rate": 0.00032131735116731604, "loss": 4.6445, "mean_token_accuracy": 0.23574916273355484, "num_tokens": 97728015.0, "step": 56345 }, { "entropy": 5.453648042678833, "epoch": 4.384205407508267, "grad_norm": 1.140625, "learning_rate": 0.0003212902288261966, "loss": 4.9269, "mean_token_accuracy": 0.2149940699338913, "num_tokens": 97737135.0, "step": 56350 }, { "entropy": 5.353962230682373, "epoch": 4.3845944368799845, "grad_norm": 1.171875, "learning_rate": 0.0003212631057826968, "loss": 4.7233, "mean_token_accuracy": 0.2235427737236023, "num_tokens": 97745744.0, "step": 56355 }, { "entropy": 5.4424351215362545, "epoch": 4.384983466251702, "grad_norm": 1.1875, "learning_rate": 0.00032123598203722786, "loss": 4.8007, "mean_token_accuracy": 0.2105320230126381, "num_tokens": 97754778.0, "step": 56360 }, { "entropy": 5.46599440574646, "epoch": 4.38537249562342, "grad_norm": 1.171875, "learning_rate": 0.0003212088575902016, "loss": 4.8706, "mean_token_accuracy": 0.21225354820489883, "num_tokens": 97763988.0, "step": 56365 }, { "entropy": 5.400659227371216, "epoch": 4.385761524995137, "grad_norm": 1.15625, "learning_rate": 0.00032118173244202947, "loss": 4.8208, "mean_token_accuracy": 0.21859641075134278, "num_tokens": 97773303.0, "step": 56370 }, { "entropy": 5.343986225128174, "epoch": 4.386150554366854, "grad_norm": 1.09375, "learning_rate": 0.00032115460659312304, "loss": 4.7568, "mean_token_accuracy": 0.22588880658149718, "num_tokens": 97781756.0, "step": 56375 }, { "entropy": 5.318846654891968, "epoch": 4.386539583738572, "grad_norm": 1.2265625, "learning_rate": 0.0003211274800438939, "loss": 4.6645, "mean_token_accuracy": 0.2343151107430458, "num_tokens": 97789703.0, "step": 56380 }, { "entropy": 5.340959548950195, "epoch": 4.38692861311029, "grad_norm": 1.3203125, "learning_rate": 0.0003211003527947537, "loss": 4.7578, "mean_token_accuracy": 0.2216591417789459, "num_tokens": 97797407.0, "step": 56385 }, { "entropy": 5.354788970947266, "epoch": 4.3873176424820075, "grad_norm": 1.15625, "learning_rate": 0.00032107322484611396, "loss": 4.7637, "mean_token_accuracy": 0.22668472975492476, "num_tokens": 97805779.0, "step": 56390 }, { "entropy": 5.376725196838379, "epoch": 4.387706671853725, "grad_norm": 1.1796875, "learning_rate": 0.00032104609619838635, "loss": 4.7474, "mean_token_accuracy": 0.22612350136041642, "num_tokens": 97813735.0, "step": 56395 }, { "entropy": 5.332343339920044, "epoch": 4.388095701225443, "grad_norm": 1.1171875, "learning_rate": 0.0003210189668519826, "loss": 4.7512, "mean_token_accuracy": 0.22069841027259826, "num_tokens": 97822548.0, "step": 56400 }, { "entropy": 5.364507627487183, "epoch": 4.38848473059716, "grad_norm": 1.3125, "learning_rate": 0.0003209918368073143, "loss": 4.74, "mean_token_accuracy": 0.22095053791999816, "num_tokens": 97830784.0, "step": 56405 }, { "entropy": 5.3569377899169925, "epoch": 4.388873759968877, "grad_norm": 1.21875, "learning_rate": 0.000320964706064793, "loss": 4.7963, "mean_token_accuracy": 0.22228676974773406, "num_tokens": 97839292.0, "step": 56410 }, { "entropy": 5.396024608612061, "epoch": 4.389262789340595, "grad_norm": 1.2109375, "learning_rate": 0.00032093757462483055, "loss": 4.7964, "mean_token_accuracy": 0.2156072199344635, "num_tokens": 97847427.0, "step": 56415 }, { "entropy": 5.402605676651001, "epoch": 4.389651818712313, "grad_norm": 1.2109375, "learning_rate": 0.00032091044248783835, "loss": 4.7211, "mean_token_accuracy": 0.2312668666243553, "num_tokens": 97855240.0, "step": 56420 }, { "entropy": 5.464087009429932, "epoch": 4.3900408480840305, "grad_norm": 1.2421875, "learning_rate": 0.00032088330965422836, "loss": 4.7871, "mean_token_accuracy": 0.223911052942276, "num_tokens": 97862620.0, "step": 56425 }, { "entropy": 5.336995840072632, "epoch": 4.390429877455748, "grad_norm": 1.1875, "learning_rate": 0.00032085617612441215, "loss": 4.6857, "mean_token_accuracy": 0.23047897666692735, "num_tokens": 97871835.0, "step": 56430 }, { "entropy": 5.423362588882446, "epoch": 4.390818906827466, "grad_norm": 1.2109375, "learning_rate": 0.0003208290418988015, "loss": 4.7609, "mean_token_accuracy": 0.23372793048620225, "num_tokens": 97880690.0, "step": 56435 }, { "entropy": 5.404538679122925, "epoch": 4.391207936199183, "grad_norm": 1.1484375, "learning_rate": 0.000320801906977808, "loss": 4.7964, "mean_token_accuracy": 0.22281818985939025, "num_tokens": 97889604.0, "step": 56440 }, { "entropy": 5.302058553695678, "epoch": 4.3915969655709, "grad_norm": 1.203125, "learning_rate": 0.00032077477136184356, "loss": 4.727, "mean_token_accuracy": 0.224255833029747, "num_tokens": 97897606.0, "step": 56445 }, { "entropy": 5.4425006866455075, "epoch": 4.391985994942618, "grad_norm": 1.2578125, "learning_rate": 0.0003207476350513198, "loss": 4.8741, "mean_token_accuracy": 0.2114188253879547, "num_tokens": 97905886.0, "step": 56450 }, { "entropy": 5.3370747566223145, "epoch": 4.392375024314336, "grad_norm": 1.1171875, "learning_rate": 0.0003207204980466485, "loss": 4.7013, "mean_token_accuracy": 0.23470528274774552, "num_tokens": 97914141.0, "step": 56455 }, { "entropy": 5.429505825042725, "epoch": 4.3927640536860535, "grad_norm": 1.25, "learning_rate": 0.00032069336034824136, "loss": 4.856, "mean_token_accuracy": 0.213875350356102, "num_tokens": 97922321.0, "step": 56460 }, { "entropy": 5.4151349544525145, "epoch": 4.393153083057771, "grad_norm": 1.1875, "learning_rate": 0.00032066622195651024, "loss": 4.7978, "mean_token_accuracy": 0.22905352115631103, "num_tokens": 97931045.0, "step": 56465 }, { "entropy": 5.327529239654541, "epoch": 4.393542112429488, "grad_norm": 1.1015625, "learning_rate": 0.00032063908287186687, "loss": 4.6957, "mean_token_accuracy": 0.22773615270853043, "num_tokens": 97940998.0, "step": 56470 }, { "entropy": 5.437001752853393, "epoch": 4.393931141801206, "grad_norm": 1.1875, "learning_rate": 0.00032061194309472314, "loss": 4.8447, "mean_token_accuracy": 0.2172312006354332, "num_tokens": 97949530.0, "step": 56475 }, { "entropy": 5.424756813049316, "epoch": 4.394320171172923, "grad_norm": 1.265625, "learning_rate": 0.00032058480262549065, "loss": 4.8013, "mean_token_accuracy": 0.22273593097925187, "num_tokens": 97958291.0, "step": 56480 }, { "entropy": 5.401621961593628, "epoch": 4.394709200544641, "grad_norm": 1.171875, "learning_rate": 0.0003205576614645814, "loss": 4.8132, "mean_token_accuracy": 0.22325518280267714, "num_tokens": 97966452.0, "step": 56485 }, { "entropy": 5.3582805633544925, "epoch": 4.395098229916359, "grad_norm": 1.1484375, "learning_rate": 0.00032053051961240716, "loss": 4.7058, "mean_token_accuracy": 0.2339236244559288, "num_tokens": 97974586.0, "step": 56490 }, { "entropy": 5.369989585876465, "epoch": 4.3954872592880765, "grad_norm": 1.15625, "learning_rate": 0.0003205033770693797, "loss": 4.7432, "mean_token_accuracy": 0.22153111547231674, "num_tokens": 97983725.0, "step": 56495 }, { "entropy": 5.392746782302856, "epoch": 4.395876288659794, "grad_norm": 1.15625, "learning_rate": 0.000320476233835911, "loss": 4.7421, "mean_token_accuracy": 0.22314399480819702, "num_tokens": 97992241.0, "step": 56500 }, { "entropy": 5.385956764221191, "epoch": 4.396265318031511, "grad_norm": 1.21875, "learning_rate": 0.00032044908991241274, "loss": 4.7528, "mean_token_accuracy": 0.2258208692073822, "num_tokens": 98001297.0, "step": 56505 }, { "entropy": 5.355286693572998, "epoch": 4.396654347403229, "grad_norm": 1.109375, "learning_rate": 0.00032042194529929694, "loss": 4.7085, "mean_token_accuracy": 0.2205297753214836, "num_tokens": 98009897.0, "step": 56510 }, { "entropy": 5.291087055206299, "epoch": 4.397043376774946, "grad_norm": 1.1640625, "learning_rate": 0.00032039479999697545, "loss": 4.6946, "mean_token_accuracy": 0.23060269206762313, "num_tokens": 98018390.0, "step": 56515 }, { "entropy": 5.399711322784424, "epoch": 4.397432406146664, "grad_norm": 1.21875, "learning_rate": 0.00032036765400586005, "loss": 4.7892, "mean_token_accuracy": 0.22231783270835875, "num_tokens": 98026885.0, "step": 56520 }, { "entropy": 5.469669342041016, "epoch": 4.397821435518382, "grad_norm": 1.1640625, "learning_rate": 0.00032034050732636274, "loss": 4.816, "mean_token_accuracy": 0.2219847947359085, "num_tokens": 98035432.0, "step": 56525 }, { "entropy": 5.428636598587036, "epoch": 4.3982104648900995, "grad_norm": 1.1171875, "learning_rate": 0.0003203133599588954, "loss": 4.8457, "mean_token_accuracy": 0.21817982345819473, "num_tokens": 98044849.0, "step": 56530 }, { "entropy": 5.406703329086303, "epoch": 4.398599494261817, "grad_norm": 1.1328125, "learning_rate": 0.00032028621190386997, "loss": 4.797, "mean_token_accuracy": 0.22317960113286972, "num_tokens": 98053258.0, "step": 56535 }, { "entropy": 5.315113067626953, "epoch": 4.398988523633534, "grad_norm": 1.25, "learning_rate": 0.00032025906316169835, "loss": 4.7622, "mean_token_accuracy": 0.22249849885702133, "num_tokens": 98062446.0, "step": 56540 }, { "entropy": 5.280483150482178, "epoch": 4.399377553005252, "grad_norm": 1.2421875, "learning_rate": 0.0003202319137327924, "loss": 4.788, "mean_token_accuracy": 0.22238420844078063, "num_tokens": 98070965.0, "step": 56545 }, { "entropy": 5.407123470306397, "epoch": 4.399766582376969, "grad_norm": 1.15625, "learning_rate": 0.00032020476361756424, "loss": 4.8271, "mean_token_accuracy": 0.22398722767829896, "num_tokens": 98078818.0, "step": 56550 }, { "entropy": 5.406821060180664, "epoch": 4.400155611748687, "grad_norm": 1.203125, "learning_rate": 0.00032017761281642564, "loss": 4.8241, "mean_token_accuracy": 0.22521023452281952, "num_tokens": 98088841.0, "step": 56555 }, { "entropy": 5.3922301769256595, "epoch": 4.400544641120405, "grad_norm": 1.0859375, "learning_rate": 0.0003201504613297888, "loss": 4.7175, "mean_token_accuracy": 0.22613370716571807, "num_tokens": 98098046.0, "step": 56560 }, { "entropy": 5.327527713775635, "epoch": 4.4009336704921225, "grad_norm": 1.1953125, "learning_rate": 0.00032012330915806553, "loss": 4.7071, "mean_token_accuracy": 0.22706825733184816, "num_tokens": 98106411.0, "step": 56565 }, { "entropy": 5.410301542282104, "epoch": 4.40132269986384, "grad_norm": 1.203125, "learning_rate": 0.00032009615630166786, "loss": 4.8536, "mean_token_accuracy": 0.21100362688302993, "num_tokens": 98115519.0, "step": 56570 }, { "entropy": 5.394170093536377, "epoch": 4.401711729235557, "grad_norm": 1.0859375, "learning_rate": 0.0003200690027610078, "loss": 4.7487, "mean_token_accuracy": 0.22798893004655837, "num_tokens": 98124988.0, "step": 56575 }, { "entropy": 5.440633296966553, "epoch": 4.402100758607275, "grad_norm": 1.078125, "learning_rate": 0.0003200418485364974, "loss": 4.7373, "mean_token_accuracy": 0.22475164383649826, "num_tokens": 98133712.0, "step": 56580 }, { "entropy": 5.444111728668213, "epoch": 4.402489787978992, "grad_norm": 1.2421875, "learning_rate": 0.0003200146936285485, "loss": 4.9087, "mean_token_accuracy": 0.21857898384332658, "num_tokens": 98142022.0, "step": 56585 }, { "entropy": 5.333130264282227, "epoch": 4.40287881735071, "grad_norm": 1.1953125, "learning_rate": 0.0003199875380375734, "loss": 4.7008, "mean_token_accuracy": 0.2301072284579277, "num_tokens": 98150482.0, "step": 56590 }, { "entropy": 5.4020861148834225, "epoch": 4.403267846722428, "grad_norm": 1.171875, "learning_rate": 0.000319960381763984, "loss": 4.8187, "mean_token_accuracy": 0.21445932388305664, "num_tokens": 98158546.0, "step": 56595 }, { "entropy": 5.455578756332398, "epoch": 4.4036568760941455, "grad_norm": 1.2734375, "learning_rate": 0.0003199332248081923, "loss": 4.8342, "mean_token_accuracy": 0.21237119287252426, "num_tokens": 98166703.0, "step": 56600 }, { "entropy": 5.41999397277832, "epoch": 4.404045905465862, "grad_norm": 1.1484375, "learning_rate": 0.00031990606717061055, "loss": 4.8138, "mean_token_accuracy": 0.22752324044704436, "num_tokens": 98176210.0, "step": 56605 }, { "entropy": 5.448330593109131, "epoch": 4.40443493483758, "grad_norm": 1.0859375, "learning_rate": 0.0003198789088516506, "loss": 4.8882, "mean_token_accuracy": 0.21632859259843826, "num_tokens": 98185144.0, "step": 56610 }, { "entropy": 5.391887569427491, "epoch": 4.404823964209298, "grad_norm": 1.109375, "learning_rate": 0.00031985174985172467, "loss": 4.7851, "mean_token_accuracy": 0.22056968063116072, "num_tokens": 98194274.0, "step": 56615 }, { "entropy": 5.324222612380981, "epoch": 4.405212993581015, "grad_norm": 1.2734375, "learning_rate": 0.0003198245901712449, "loss": 4.761, "mean_token_accuracy": 0.22647663503885268, "num_tokens": 98202790.0, "step": 56620 }, { "entropy": 5.4077253341674805, "epoch": 4.405602022952733, "grad_norm": 1.1640625, "learning_rate": 0.0003197974298106232, "loss": 4.8581, "mean_token_accuracy": 0.2165965810418129, "num_tokens": 98211491.0, "step": 56625 }, { "entropy": 5.454235982894898, "epoch": 4.405991052324451, "grad_norm": 1.125, "learning_rate": 0.00031977026877027186, "loss": 4.792, "mean_token_accuracy": 0.22515439242124557, "num_tokens": 98221506.0, "step": 56630 }, { "entropy": 5.384983921051026, "epoch": 4.4063800816961685, "grad_norm": 1.21875, "learning_rate": 0.00031974310705060297, "loss": 4.7857, "mean_token_accuracy": 0.22442274987697602, "num_tokens": 98229555.0, "step": 56635 }, { "entropy": 5.353589630126953, "epoch": 4.406769111067885, "grad_norm": 1.1953125, "learning_rate": 0.0003197159446520286, "loss": 4.8008, "mean_token_accuracy": 0.21323480159044267, "num_tokens": 98238239.0, "step": 56640 }, { "entropy": 5.459129047393799, "epoch": 4.407158140439603, "grad_norm": 1.359375, "learning_rate": 0.00031968878157496105, "loss": 4.7925, "mean_token_accuracy": 0.22283149212598802, "num_tokens": 98247437.0, "step": 56645 }, { "entropy": 5.423033285140991, "epoch": 4.407547169811321, "grad_norm": 1.1796875, "learning_rate": 0.00031966161781981224, "loss": 4.8475, "mean_token_accuracy": 0.21883999109268187, "num_tokens": 98256244.0, "step": 56650 }, { "entropy": 5.286911296844482, "epoch": 4.407936199183038, "grad_norm": 1.2890625, "learning_rate": 0.00031963445338699446, "loss": 4.5891, "mean_token_accuracy": 0.23325791209936142, "num_tokens": 98264331.0, "step": 56655 }, { "entropy": 5.377865505218506, "epoch": 4.408325228554756, "grad_norm": 1.09375, "learning_rate": 0.00031960728827692, "loss": 4.7523, "mean_token_accuracy": 0.2225775197148323, "num_tokens": 98272753.0, "step": 56660 }, { "entropy": 5.368564653396606, "epoch": 4.408714257926474, "grad_norm": 1.109375, "learning_rate": 0.0003195801224900009, "loss": 4.7619, "mean_token_accuracy": 0.22827353328466415, "num_tokens": 98281664.0, "step": 56665 }, { "entropy": 5.389024543762207, "epoch": 4.409103287298191, "grad_norm": 1.1640625, "learning_rate": 0.00031955295602664936, "loss": 4.8584, "mean_token_accuracy": 0.21355960071086882, "num_tokens": 98290576.0, "step": 56670 }, { "entropy": 5.468315076828003, "epoch": 4.409492316669908, "grad_norm": 1.234375, "learning_rate": 0.00031952578888727763, "loss": 4.8822, "mean_token_accuracy": 0.214592607319355, "num_tokens": 98300108.0, "step": 56675 }, { "entropy": 5.5010699272155765, "epoch": 4.409881346041626, "grad_norm": 1.140625, "learning_rate": 0.00031949862107229796, "loss": 4.8444, "mean_token_accuracy": 0.21984684020280837, "num_tokens": 98308071.0, "step": 56680 }, { "entropy": 5.476771354675293, "epoch": 4.410270375413344, "grad_norm": 1.140625, "learning_rate": 0.0003194714525821225, "loss": 4.8786, "mean_token_accuracy": 0.21113119572401046, "num_tokens": 98316614.0, "step": 56685 }, { "entropy": 5.434524917602539, "epoch": 4.410659404785061, "grad_norm": 1.15625, "learning_rate": 0.0003194442834171636, "loss": 4.804, "mean_token_accuracy": 0.2225937142968178, "num_tokens": 98325464.0, "step": 56690 }, { "entropy": 5.387014579772949, "epoch": 4.411048434156779, "grad_norm": 1.1796875, "learning_rate": 0.0003194171135778334, "loss": 4.7843, "mean_token_accuracy": 0.22121630162000655, "num_tokens": 98334559.0, "step": 56695 }, { "entropy": 5.350517892837525, "epoch": 4.411437463528497, "grad_norm": 1.203125, "learning_rate": 0.0003193899430645442, "loss": 4.7282, "mean_token_accuracy": 0.22359798848628998, "num_tokens": 98342853.0, "step": 56700 }, { "entropy": 5.368137311935425, "epoch": 4.411826492900214, "grad_norm": 1.21875, "learning_rate": 0.00031936277187770824, "loss": 4.7528, "mean_token_accuracy": 0.2278421014547348, "num_tokens": 98351600.0, "step": 56705 }, { "entropy": 5.403238201141358, "epoch": 4.412215522271931, "grad_norm": 1.2578125, "learning_rate": 0.0003193356000177378, "loss": 4.7753, "mean_token_accuracy": 0.22316981554031373, "num_tokens": 98360045.0, "step": 56710 }, { "entropy": 5.4411109447479244, "epoch": 4.412604551643649, "grad_norm": 1.2265625, "learning_rate": 0.0003193084274850453, "loss": 4.8565, "mean_token_accuracy": 0.21883872002363206, "num_tokens": 98367721.0, "step": 56715 }, { "entropy": 5.4236836433410645, "epoch": 4.412993581015367, "grad_norm": 1.1953125, "learning_rate": 0.00031928125428004286, "loss": 4.8996, "mean_token_accuracy": 0.21294945925474168, "num_tokens": 98376314.0, "step": 56720 }, { "entropy": 5.37960901260376, "epoch": 4.413382610387084, "grad_norm": 1.09375, "learning_rate": 0.0003192540804031429, "loss": 4.8468, "mean_token_accuracy": 0.2191078320145607, "num_tokens": 98385369.0, "step": 56725 }, { "entropy": 5.361766815185547, "epoch": 4.413771639758802, "grad_norm": 1.1875, "learning_rate": 0.0003192269058547577, "loss": 4.7107, "mean_token_accuracy": 0.22600883096456528, "num_tokens": 98393733.0, "step": 56730 }, { "entropy": 5.415708208084107, "epoch": 4.41416066913052, "grad_norm": 1.1640625, "learning_rate": 0.0003191997306352996, "loss": 4.7988, "mean_token_accuracy": 0.23034971952438354, "num_tokens": 98403188.0, "step": 56735 }, { "entropy": 5.398107814788818, "epoch": 4.4145496985022366, "grad_norm": 1.1484375, "learning_rate": 0.000319172554745181, "loss": 4.7877, "mean_token_accuracy": 0.2256931781768799, "num_tokens": 98411839.0, "step": 56740 }, { "entropy": 5.482608222961426, "epoch": 4.414938727873954, "grad_norm": 1.1484375, "learning_rate": 0.00031914537818481404, "loss": 4.9543, "mean_token_accuracy": 0.21508198529481887, "num_tokens": 98420333.0, "step": 56745 }, { "entropy": 5.483489942550659, "epoch": 4.415327757245672, "grad_norm": 1.4609375, "learning_rate": 0.0003191182009546113, "loss": 4.8328, "mean_token_accuracy": 0.22132343649864197, "num_tokens": 98428903.0, "step": 56750 }, { "entropy": 5.368740653991699, "epoch": 4.41571678661739, "grad_norm": 1.1171875, "learning_rate": 0.00031909102305498514, "loss": 4.7631, "mean_token_accuracy": 0.22474606484174728, "num_tokens": 98437088.0, "step": 56755 }, { "entropy": 5.435957765579223, "epoch": 4.416105815989107, "grad_norm": 1.1328125, "learning_rate": 0.00031906384448634784, "loss": 4.8394, "mean_token_accuracy": 0.21721961796283723, "num_tokens": 98447124.0, "step": 56760 }, { "entropy": 5.349113988876343, "epoch": 4.416494845360825, "grad_norm": 1.0703125, "learning_rate": 0.00031903666524911185, "loss": 4.7171, "mean_token_accuracy": 0.22939716130495072, "num_tokens": 98456144.0, "step": 56765 }, { "entropy": 5.440991067886353, "epoch": 4.416883874732543, "grad_norm": 1.125, "learning_rate": 0.00031900948534368954, "loss": 4.8542, "mean_token_accuracy": 0.21945908516645432, "num_tokens": 98466011.0, "step": 56770 }, { "entropy": 5.360636806488037, "epoch": 4.4172729041042595, "grad_norm": 1.2734375, "learning_rate": 0.00031898230477049334, "loss": 4.7138, "mean_token_accuracy": 0.22861912548542024, "num_tokens": 98474633.0, "step": 56775 }, { "entropy": 5.333235263824463, "epoch": 4.417661933475977, "grad_norm": 1.1640625, "learning_rate": 0.0003189551235299357, "loss": 4.6929, "mean_token_accuracy": 0.23141441941261293, "num_tokens": 98483217.0, "step": 56780 }, { "entropy": 5.424423122406006, "epoch": 4.418050962847695, "grad_norm": 1.2265625, "learning_rate": 0.0003189279416224289, "loss": 4.8822, "mean_token_accuracy": 0.2162069112062454, "num_tokens": 98491797.0, "step": 56785 }, { "entropy": 5.347007083892822, "epoch": 4.418439992219413, "grad_norm": 1.140625, "learning_rate": 0.00031890075904838556, "loss": 4.7911, "mean_token_accuracy": 0.21958240866661072, "num_tokens": 98501051.0, "step": 56790 }, { "entropy": 5.452200078964234, "epoch": 4.41882902159113, "grad_norm": 1.234375, "learning_rate": 0.00031887357580821817, "loss": 4.8638, "mean_token_accuracy": 0.21950167715549468, "num_tokens": 98509130.0, "step": 56795 }, { "entropy": 5.424875545501709, "epoch": 4.419218050962848, "grad_norm": 1.203125, "learning_rate": 0.00031884639190233905, "loss": 4.7645, "mean_token_accuracy": 0.21998487263917924, "num_tokens": 98517750.0, "step": 56800 }, { "entropy": 5.340837717056274, "epoch": 4.419607080334565, "grad_norm": 1.1484375, "learning_rate": 0.0003188192073311608, "loss": 4.7523, "mean_token_accuracy": 0.2215457633137703, "num_tokens": 98526515.0, "step": 56805 }, { "entropy": 5.319750499725342, "epoch": 4.4199961097062825, "grad_norm": 1.1953125, "learning_rate": 0.00031879202209509564, "loss": 4.7366, "mean_token_accuracy": 0.23112548142671585, "num_tokens": 98535067.0, "step": 56810 }, { "entropy": 5.381924152374268, "epoch": 4.420385139078, "grad_norm": 1.1875, "learning_rate": 0.00031876483619455633, "loss": 4.7171, "mean_token_accuracy": 0.23041563630104064, "num_tokens": 98543040.0, "step": 56815 }, { "entropy": 5.303400564193725, "epoch": 4.420774168449718, "grad_norm": 1.2265625, "learning_rate": 0.0003187376496299553, "loss": 4.7548, "mean_token_accuracy": 0.22649939805269242, "num_tokens": 98551988.0, "step": 56820 }, { "entropy": 5.320533561706543, "epoch": 4.421163197821436, "grad_norm": 1.1640625, "learning_rate": 0.000318710462401705, "loss": 4.6877, "mean_token_accuracy": 0.22183310985565186, "num_tokens": 98560866.0, "step": 56825 }, { "entropy": 5.363276720046997, "epoch": 4.421552227193153, "grad_norm": 1.1953125, "learning_rate": 0.00031868327451021816, "loss": 4.804, "mean_token_accuracy": 0.22242223471403122, "num_tokens": 98569258.0, "step": 56830 }, { "entropy": 5.394886589050293, "epoch": 4.421941256564871, "grad_norm": 1.1875, "learning_rate": 0.00031865608595590706, "loss": 4.8254, "mean_token_accuracy": 0.21386872082948685, "num_tokens": 98577152.0, "step": 56835 }, { "entropy": 5.386197900772094, "epoch": 4.422330285936588, "grad_norm": 1.15625, "learning_rate": 0.00031862889673918437, "loss": 4.7846, "mean_token_accuracy": 0.21988025456666946, "num_tokens": 98585677.0, "step": 56840 }, { "entropy": 5.430694103240967, "epoch": 4.4227193153083055, "grad_norm": 1.1015625, "learning_rate": 0.0003186017068604626, "loss": 4.7901, "mean_token_accuracy": 0.22707925438880922, "num_tokens": 98595425.0, "step": 56845 }, { "entropy": 5.474516725540161, "epoch": 4.423108344680023, "grad_norm": 1.125, "learning_rate": 0.0003185745163201543, "loss": 4.8459, "mean_token_accuracy": 0.21679288893938065, "num_tokens": 98603738.0, "step": 56850 }, { "entropy": 5.339152908325195, "epoch": 4.423497374051741, "grad_norm": 1.125, "learning_rate": 0.0003185473251186721, "loss": 4.6818, "mean_token_accuracy": 0.2299037054181099, "num_tokens": 98612144.0, "step": 56855 }, { "entropy": 5.403916692733764, "epoch": 4.423886403423459, "grad_norm": 1.25, "learning_rate": 0.0003185201332564285, "loss": 4.7806, "mean_token_accuracy": 0.2258450523018837, "num_tokens": 98619841.0, "step": 56860 }, { "entropy": 5.346432065963745, "epoch": 4.424275432795176, "grad_norm": 1.1171875, "learning_rate": 0.0003184929407338362, "loss": 4.7236, "mean_token_accuracy": 0.2239163488149643, "num_tokens": 98628136.0, "step": 56865 }, { "entropy": 5.477701044082641, "epoch": 4.424664462166893, "grad_norm": 1.2421875, "learning_rate": 0.00031846574755130773, "loss": 4.8458, "mean_token_accuracy": 0.2170452892780304, "num_tokens": 98636965.0, "step": 56870 }, { "entropy": 5.379834747314453, "epoch": 4.425053491538611, "grad_norm": 1.1640625, "learning_rate": 0.00031843855370925574, "loss": 4.79, "mean_token_accuracy": 0.21598914861679078, "num_tokens": 98646527.0, "step": 56875 }, { "entropy": 5.369980382919311, "epoch": 4.4254425209103285, "grad_norm": 1.109375, "learning_rate": 0.00031841135920809285, "loss": 4.7787, "mean_token_accuracy": 0.2245008021593094, "num_tokens": 98655489.0, "step": 56880 }, { "entropy": 5.442750930786133, "epoch": 4.425831550282046, "grad_norm": 1.125, "learning_rate": 0.0003183841640482316, "loss": 4.7801, "mean_token_accuracy": 0.222225821018219, "num_tokens": 98664134.0, "step": 56885 }, { "entropy": 5.391176223754883, "epoch": 4.426220579653764, "grad_norm": 1.1796875, "learning_rate": 0.00031835696823008476, "loss": 4.7053, "mean_token_accuracy": 0.22763820439577104, "num_tokens": 98672307.0, "step": 56890 }, { "entropy": 5.426659488677979, "epoch": 4.426609609025482, "grad_norm": 1.25, "learning_rate": 0.00031832977175406496, "loss": 4.8923, "mean_token_accuracy": 0.22413357049226762, "num_tokens": 98680550.0, "step": 56895 }, { "entropy": 5.412976408004761, "epoch": 4.426998638397199, "grad_norm": 1.1640625, "learning_rate": 0.0003183025746205848, "loss": 4.7715, "mean_token_accuracy": 0.23026934266090393, "num_tokens": 98689313.0, "step": 56900 }, { "entropy": 5.4550799369812015, "epoch": 4.427387667768917, "grad_norm": 1.2421875, "learning_rate": 0.0003182753768300571, "loss": 4.8268, "mean_token_accuracy": 0.22053991556167601, "num_tokens": 98698658.0, "step": 56905 }, { "entropy": 5.461801481246948, "epoch": 4.427776697140634, "grad_norm": 1.3671875, "learning_rate": 0.0003182481783828943, "loss": 4.8187, "mean_token_accuracy": 0.2197228491306305, "num_tokens": 98707583.0, "step": 56910 }, { "entropy": 5.412831163406372, "epoch": 4.4281657265123515, "grad_norm": 1.171875, "learning_rate": 0.00031822097927950934, "loss": 4.7736, "mean_token_accuracy": 0.22417523711919785, "num_tokens": 98716306.0, "step": 56915 }, { "entropy": 5.435632133483887, "epoch": 4.428554755884069, "grad_norm": 1.2578125, "learning_rate": 0.00031819377952031476, "loss": 4.9035, "mean_token_accuracy": 0.2131044462323189, "num_tokens": 98724394.0, "step": 56920 }, { "entropy": 5.427605438232422, "epoch": 4.428943785255787, "grad_norm": 1.2109375, "learning_rate": 0.00031816657910572327, "loss": 4.8331, "mean_token_accuracy": 0.21631375551223755, "num_tokens": 98733537.0, "step": 56925 }, { "entropy": 5.4513959884643555, "epoch": 4.429332814627505, "grad_norm": 1.1484375, "learning_rate": 0.00031813937803614774, "loss": 4.8292, "mean_token_accuracy": 0.2173965334892273, "num_tokens": 98742373.0, "step": 56930 }, { "entropy": 5.408585023880005, "epoch": 4.429721843999222, "grad_norm": 1.2109375, "learning_rate": 0.0003181121763120008, "loss": 4.7986, "mean_token_accuracy": 0.21813859343528746, "num_tokens": 98751184.0, "step": 56935 }, { "entropy": 5.505879831314087, "epoch": 4.430110873370939, "grad_norm": 1.1484375, "learning_rate": 0.0003180849739336952, "loss": 4.8606, "mean_token_accuracy": 0.217446368932724, "num_tokens": 98760589.0, "step": 56940 }, { "entropy": 5.449555158615112, "epoch": 4.430499902742657, "grad_norm": 1.203125, "learning_rate": 0.00031805777090164364, "loss": 4.751, "mean_token_accuracy": 0.21862780898809434, "num_tokens": 98768929.0, "step": 56945 }, { "entropy": 5.367335844039917, "epoch": 4.4308889321143745, "grad_norm": 1.1953125, "learning_rate": 0.000318030567216259, "loss": 4.6631, "mean_token_accuracy": 0.22898049503564835, "num_tokens": 98777102.0, "step": 56950 }, { "entropy": 5.4575944423675535, "epoch": 4.431277961486092, "grad_norm": 1.171875, "learning_rate": 0.00031800336287795395, "loss": 4.8348, "mean_token_accuracy": 0.21976025700569152, "num_tokens": 98785315.0, "step": 56955 }, { "entropy": 5.424097871780395, "epoch": 4.43166699085781, "grad_norm": 1.3203125, "learning_rate": 0.00031797615788714133, "loss": 4.7563, "mean_token_accuracy": 0.21845750212669374, "num_tokens": 98793689.0, "step": 56960 }, { "entropy": 5.441212558746338, "epoch": 4.432056020229528, "grad_norm": 1.25, "learning_rate": 0.00031794895224423396, "loss": 4.8752, "mean_token_accuracy": 0.2216723769903183, "num_tokens": 98802628.0, "step": 56965 }, { "entropy": 5.420555591583252, "epoch": 4.432445049601245, "grad_norm": 1.1875, "learning_rate": 0.0003179217459496446, "loss": 4.7524, "mean_token_accuracy": 0.22800272554159165, "num_tokens": 98810722.0, "step": 56970 }, { "entropy": 5.458615684509278, "epoch": 4.432834078972962, "grad_norm": 1.1328125, "learning_rate": 0.000317894539003786, "loss": 4.7912, "mean_token_accuracy": 0.2256120651960373, "num_tokens": 98819398.0, "step": 56975 }, { "entropy": 5.426866817474365, "epoch": 4.43322310834468, "grad_norm": 1.2421875, "learning_rate": 0.000317867331407071, "loss": 4.8428, "mean_token_accuracy": 0.22009177953004838, "num_tokens": 98827724.0, "step": 56980 }, { "entropy": 5.438529109954834, "epoch": 4.4336121377163975, "grad_norm": 1.328125, "learning_rate": 0.0003178401231599126, "loss": 4.7777, "mean_token_accuracy": 0.22300432473421097, "num_tokens": 98836680.0, "step": 56985 }, { "entropy": 5.2925543785095215, "epoch": 4.434001167088115, "grad_norm": 1.125, "learning_rate": 0.00031781291426272347, "loss": 4.6747, "mean_token_accuracy": 0.23232204467058182, "num_tokens": 98845746.0, "step": 56990 }, { "entropy": 5.4284608364105225, "epoch": 4.434390196459833, "grad_norm": 1.140625, "learning_rate": 0.0003177857047159165, "loss": 4.7995, "mean_token_accuracy": 0.21908573806285858, "num_tokens": 98854293.0, "step": 56995 }, { "entropy": 5.396098947525024, "epoch": 4.434779225831551, "grad_norm": 1.15625, "learning_rate": 0.0003177584945199046, "loss": 4.7598, "mean_token_accuracy": 0.21752981543540956, "num_tokens": 98862747.0, "step": 57000 }, { "epoch": 4.434779225831551, "eval_entropy": 5.132750196108116, "eval_loss": 4.937704563140869, "eval_mean_token_accuracy": 0.22257486845692037, "eval_num_tokens": 98862747.0, "eval_runtime": 28.6287, "eval_samples_per_second": 1451.62, "eval_steps_per_second": 181.461, "step": 57000 }, { "entropy": 5.3947896480560305, "epoch": 4.435168255203267, "grad_norm": 1.203125, "learning_rate": 0.0003177312836751005, "loss": 4.8259, "mean_token_accuracy": 0.21537525057792664, "num_tokens": 98871867.0, "step": 57005 }, { "entropy": 5.435635566711426, "epoch": 4.435557284574985, "grad_norm": 1.109375, "learning_rate": 0.00031770407218191727, "loss": 4.787, "mean_token_accuracy": 0.2182581678032875, "num_tokens": 98880780.0, "step": 57010 }, { "entropy": 5.334830284118652, "epoch": 4.435946313946703, "grad_norm": 1.34375, "learning_rate": 0.0003176768600407677, "loss": 4.7652, "mean_token_accuracy": 0.23272209167480468, "num_tokens": 98890265.0, "step": 57015 }, { "entropy": 5.41881217956543, "epoch": 4.4363353433184205, "grad_norm": 1.15625, "learning_rate": 0.0003176496472520647, "loss": 4.7641, "mean_token_accuracy": 0.21972244381904601, "num_tokens": 98899406.0, "step": 57020 }, { "entropy": 5.402377367019653, "epoch": 4.436724372690138, "grad_norm": 1.203125, "learning_rate": 0.0003176224338162212, "loss": 4.8138, "mean_token_accuracy": 0.22147863060235978, "num_tokens": 98908492.0, "step": 57025 }, { "entropy": 5.313281869888305, "epoch": 4.437113402061856, "grad_norm": 1.1015625, "learning_rate": 0.00031759521973365006, "loss": 4.716, "mean_token_accuracy": 0.23108238726854324, "num_tokens": 98917339.0, "step": 57030 }, { "entropy": 5.362147665023803, "epoch": 4.437502431433574, "grad_norm": 1.09375, "learning_rate": 0.00031756800500476435, "loss": 4.7478, "mean_token_accuracy": 0.2226343870162964, "num_tokens": 98926350.0, "step": 57035 }, { "entropy": 5.3626714706420895, "epoch": 4.43789146080529, "grad_norm": 1.1953125, "learning_rate": 0.00031754078962997686, "loss": 4.7903, "mean_token_accuracy": 0.22022322565317154, "num_tokens": 98936009.0, "step": 57040 }, { "entropy": 5.35137038230896, "epoch": 4.438280490177008, "grad_norm": 1.125, "learning_rate": 0.0003175135736097006, "loss": 4.7574, "mean_token_accuracy": 0.2237767830491066, "num_tokens": 98944350.0, "step": 57045 }, { "entropy": 5.409536218643188, "epoch": 4.438669519548726, "grad_norm": 1.265625, "learning_rate": 0.00031748635694434844, "loss": 4.8169, "mean_token_accuracy": 0.22062480300664902, "num_tokens": 98953611.0, "step": 57050 }, { "entropy": 5.373613023757935, "epoch": 4.4390585489204435, "grad_norm": 1.203125, "learning_rate": 0.0003174591396343336, "loss": 4.6692, "mean_token_accuracy": 0.23507629632949828, "num_tokens": 98962084.0, "step": 57055 }, { "entropy": 5.334583473205567, "epoch": 4.439447578292161, "grad_norm": 1.1796875, "learning_rate": 0.0003174319216800688, "loss": 4.7664, "mean_token_accuracy": 0.22832910865545272, "num_tokens": 98971278.0, "step": 57060 }, { "entropy": 5.328181648254395, "epoch": 4.439836607663879, "grad_norm": 1.2109375, "learning_rate": 0.00031740470308196724, "loss": 4.6921, "mean_token_accuracy": 0.23726969212293625, "num_tokens": 98979597.0, "step": 57065 }, { "entropy": 5.419636964797974, "epoch": 4.440225637035597, "grad_norm": 1.1484375, "learning_rate": 0.0003173774838404417, "loss": 4.7352, "mean_token_accuracy": 0.22396946996450423, "num_tokens": 98988326.0, "step": 57070 }, { "entropy": 5.4224522590637205, "epoch": 4.440614666407313, "grad_norm": 1.28125, "learning_rate": 0.00031735026395590535, "loss": 4.7752, "mean_token_accuracy": 0.22019947469234466, "num_tokens": 98996809.0, "step": 57075 }, { "entropy": 5.398856115341187, "epoch": 4.441003695779031, "grad_norm": 1.1328125, "learning_rate": 0.000317323043428771, "loss": 4.7432, "mean_token_accuracy": 0.22793539315462114, "num_tokens": 99005934.0, "step": 57080 }, { "entropy": 5.366226053237915, "epoch": 4.441392725150749, "grad_norm": 1.1484375, "learning_rate": 0.0003172958222594519, "loss": 4.8199, "mean_token_accuracy": 0.2224924236536026, "num_tokens": 99014940.0, "step": 57085 }, { "entropy": 5.394231510162354, "epoch": 4.4417817545224665, "grad_norm": 1.2109375, "learning_rate": 0.0003172686004483611, "loss": 4.8296, "mean_token_accuracy": 0.22607219517230986, "num_tokens": 99023609.0, "step": 57090 }, { "entropy": 5.419731330871582, "epoch": 4.442170783894184, "grad_norm": 1.1953125, "learning_rate": 0.00031724137799591154, "loss": 4.7948, "mean_token_accuracy": 0.22202716916799545, "num_tokens": 99032018.0, "step": 57095 }, { "entropy": 5.460139799118042, "epoch": 4.442559813265902, "grad_norm": 1.1328125, "learning_rate": 0.00031721415490251634, "loss": 4.8845, "mean_token_accuracy": 0.208880278468132, "num_tokens": 99040605.0, "step": 57100 }, { "entropy": 5.462630939483643, "epoch": 4.44294884263762, "grad_norm": 1.234375, "learning_rate": 0.0003171869311685885, "loss": 4.8028, "mean_token_accuracy": 0.22756650149822236, "num_tokens": 99048540.0, "step": 57105 }, { "entropy": 5.311354541778565, "epoch": 4.443337872009336, "grad_norm": 1.1953125, "learning_rate": 0.0003171597067945411, "loss": 4.6696, "mean_token_accuracy": 0.23524145931005477, "num_tokens": 99057923.0, "step": 57110 }, { "entropy": 5.388445854187012, "epoch": 4.443726901381054, "grad_norm": 1.2265625, "learning_rate": 0.00031713248178078717, "loss": 4.7299, "mean_token_accuracy": 0.22386448830366135, "num_tokens": 99066537.0, "step": 57115 }, { "entropy": 5.4314391136169435, "epoch": 4.444115930752772, "grad_norm": 1.140625, "learning_rate": 0.00031710525612774, "loss": 4.8302, "mean_token_accuracy": 0.2184027150273323, "num_tokens": 99074780.0, "step": 57120 }, { "entropy": 5.362411022186279, "epoch": 4.4445049601244895, "grad_norm": 1.1875, "learning_rate": 0.0003170780298358126, "loss": 4.7372, "mean_token_accuracy": 0.2222791314125061, "num_tokens": 99082883.0, "step": 57125 }, { "entropy": 5.389003324508667, "epoch": 4.444893989496207, "grad_norm": 1.1796875, "learning_rate": 0.00031705080290541797, "loss": 4.7825, "mean_token_accuracy": 0.22626209259033203, "num_tokens": 99091877.0, "step": 57130 }, { "entropy": 5.426477766036987, "epoch": 4.445283018867925, "grad_norm": 1.140625, "learning_rate": 0.00031702357533696946, "loss": 4.7005, "mean_token_accuracy": 0.23964035660028457, "num_tokens": 99099860.0, "step": 57135 }, { "entropy": 5.357645845413208, "epoch": 4.445672048239642, "grad_norm": 1.1796875, "learning_rate": 0.00031699634713088, "loss": 4.7174, "mean_token_accuracy": 0.23085438907146455, "num_tokens": 99107940.0, "step": 57140 }, { "entropy": 5.381301975250244, "epoch": 4.446061077611359, "grad_norm": 1.0859375, "learning_rate": 0.0003169691182875628, "loss": 4.8088, "mean_token_accuracy": 0.2232929363846779, "num_tokens": 99116786.0, "step": 57145 }, { "entropy": 5.399720287322998, "epoch": 4.446450106983077, "grad_norm": 1.140625, "learning_rate": 0.0003169418888074311, "loss": 4.7248, "mean_token_accuracy": 0.22199890464544297, "num_tokens": 99126444.0, "step": 57150 }, { "entropy": 5.4557818412780765, "epoch": 4.446839136354795, "grad_norm": 1.1953125, "learning_rate": 0.00031691465869089795, "loss": 4.8164, "mean_token_accuracy": 0.21623874008655547, "num_tokens": 99134537.0, "step": 57155 }, { "entropy": 5.3911937236785885, "epoch": 4.4472281657265125, "grad_norm": 1.2265625, "learning_rate": 0.0003168874279383766, "loss": 4.7609, "mean_token_accuracy": 0.22416484355926514, "num_tokens": 99142871.0, "step": 57160 }, { "entropy": 5.333127498626709, "epoch": 4.44761719509823, "grad_norm": 1.2421875, "learning_rate": 0.0003168601965502802, "loss": 4.6995, "mean_token_accuracy": 0.22946427166461944, "num_tokens": 99150444.0, "step": 57165 }, { "entropy": 5.342962980270386, "epoch": 4.448006224469948, "grad_norm": 1.4296875, "learning_rate": 0.0003168329645270219, "loss": 4.7509, "mean_token_accuracy": 0.2350730910897255, "num_tokens": 99159332.0, "step": 57170 }, { "entropy": 5.435609483718872, "epoch": 4.448395253841665, "grad_norm": 1.2578125, "learning_rate": 0.000316805731869015, "loss": 4.8977, "mean_token_accuracy": 0.21870713531970978, "num_tokens": 99168927.0, "step": 57175 }, { "entropy": 5.389696788787842, "epoch": 4.448784283213382, "grad_norm": 1.2421875, "learning_rate": 0.00031677849857667266, "loss": 4.7949, "mean_token_accuracy": 0.2257964640855789, "num_tokens": 99177491.0, "step": 57180 }, { "entropy": 5.4416810989379885, "epoch": 4.4491733125851, "grad_norm": 1.2578125, "learning_rate": 0.0003167512646504081, "loss": 4.8012, "mean_token_accuracy": 0.21793338507413865, "num_tokens": 99186392.0, "step": 57185 }, { "entropy": 5.392916822433472, "epoch": 4.449562341956818, "grad_norm": 1.2109375, "learning_rate": 0.0003167240300906345, "loss": 4.8399, "mean_token_accuracy": 0.22277383655309677, "num_tokens": 99195242.0, "step": 57190 }, { "entropy": 5.449929428100586, "epoch": 4.4499513713285355, "grad_norm": 1.203125, "learning_rate": 0.0003166967948977652, "loss": 4.7966, "mean_token_accuracy": 0.2263351112604141, "num_tokens": 99203167.0, "step": 57195 }, { "entropy": 5.413981819152832, "epoch": 4.450340400700253, "grad_norm": 1.1640625, "learning_rate": 0.0003166695590722134, "loss": 4.7073, "mean_token_accuracy": 0.2333373725414276, "num_tokens": 99211417.0, "step": 57200 }, { "entropy": 5.378722095489502, "epoch": 4.45072943007197, "grad_norm": 1.203125, "learning_rate": 0.00031664232261439235, "loss": 4.7502, "mean_token_accuracy": 0.2209574967622757, "num_tokens": 99219658.0, "step": 57205 }, { "entropy": 5.31967306137085, "epoch": 4.451118459443688, "grad_norm": 1.1640625, "learning_rate": 0.0003166150855247153, "loss": 4.7495, "mean_token_accuracy": 0.22316686809062958, "num_tokens": 99228335.0, "step": 57210 }, { "entropy": 5.40112419128418, "epoch": 4.451507488815405, "grad_norm": 1.2265625, "learning_rate": 0.0003165878478035956, "loss": 4.7662, "mean_token_accuracy": 0.2244488388299942, "num_tokens": 99236500.0, "step": 57215 }, { "entropy": 5.468771314620971, "epoch": 4.451896518187123, "grad_norm": 1.09375, "learning_rate": 0.0003165606094514465, "loss": 4.8312, "mean_token_accuracy": 0.21763159483671188, "num_tokens": 99246834.0, "step": 57220 }, { "entropy": 5.383902454376221, "epoch": 4.452285547558841, "grad_norm": 1.15625, "learning_rate": 0.00031653337046868137, "loss": 4.7558, "mean_token_accuracy": 0.2263956770300865, "num_tokens": 99255387.0, "step": 57225 }, { "entropy": 5.330097293853759, "epoch": 4.4526745769305585, "grad_norm": 1.15625, "learning_rate": 0.00031650613085571334, "loss": 4.6032, "mean_token_accuracy": 0.23518190979957582, "num_tokens": 99263403.0, "step": 57230 }, { "entropy": 5.340671110153198, "epoch": 4.453063606302276, "grad_norm": 1.1796875, "learning_rate": 0.0003164788906129559, "loss": 4.7459, "mean_token_accuracy": 0.23140041083097457, "num_tokens": 99271563.0, "step": 57235 }, { "entropy": 5.330229234695435, "epoch": 4.453452635673994, "grad_norm": 1.125, "learning_rate": 0.0003164516497408223, "loss": 4.6761, "mean_token_accuracy": 0.22964081913232803, "num_tokens": 99280075.0, "step": 57240 }, { "entropy": 5.3949438571929935, "epoch": 4.453841665045711, "grad_norm": 1.2265625, "learning_rate": 0.0003164244082397259, "loss": 4.7703, "mean_token_accuracy": 0.22245306968688966, "num_tokens": 99288907.0, "step": 57245 }, { "entropy": 5.39880862236023, "epoch": 4.454230694417428, "grad_norm": 1.2109375, "learning_rate": 0.00031639716611008, "loss": 4.7508, "mean_token_accuracy": 0.22721540331840515, "num_tokens": 99297468.0, "step": 57250 }, { "entropy": 5.372001647949219, "epoch": 4.454619723789146, "grad_norm": 1.2421875, "learning_rate": 0.0003163699233522981, "loss": 4.7322, "mean_token_accuracy": 0.23018756359815598, "num_tokens": 99306161.0, "step": 57255 }, { "entropy": 5.422857475280762, "epoch": 4.455008753160864, "grad_norm": 1.1484375, "learning_rate": 0.0003163426799667934, "loss": 4.7314, "mean_token_accuracy": 0.23585088104009627, "num_tokens": 99315531.0, "step": 57260 }, { "entropy": 5.3585618019104, "epoch": 4.4553977825325815, "grad_norm": 1.1171875, "learning_rate": 0.0003163154359539793, "loss": 4.7975, "mean_token_accuracy": 0.22313887625932693, "num_tokens": 99324263.0, "step": 57265 }, { "entropy": 5.370906686782837, "epoch": 4.455786811904299, "grad_norm": 1.2265625, "learning_rate": 0.00031628819131426924, "loss": 4.799, "mean_token_accuracy": 0.2234163150191307, "num_tokens": 99333542.0, "step": 57270 }, { "entropy": 5.421927881240845, "epoch": 4.456175841276016, "grad_norm": 1.234375, "learning_rate": 0.0003162609460480766, "loss": 4.7789, "mean_token_accuracy": 0.2176763042807579, "num_tokens": 99341860.0, "step": 57275 }, { "entropy": 5.431547689437866, "epoch": 4.456564870647734, "grad_norm": 1.21875, "learning_rate": 0.0003162337001558147, "loss": 4.8458, "mean_token_accuracy": 0.21868441104888917, "num_tokens": 99351060.0, "step": 57280 }, { "entropy": 5.4300354480743405, "epoch": 4.456953900019451, "grad_norm": 1.1640625, "learning_rate": 0.00031620645363789713, "loss": 4.7882, "mean_token_accuracy": 0.22376328557729722, "num_tokens": 99359318.0, "step": 57285 }, { "entropy": 5.385527420043945, "epoch": 4.457342929391169, "grad_norm": 1.2578125, "learning_rate": 0.0003161792064947372, "loss": 4.6957, "mean_token_accuracy": 0.23153160512447357, "num_tokens": 99367538.0, "step": 57290 }, { "entropy": 5.324669981002808, "epoch": 4.457731958762887, "grad_norm": 1.234375, "learning_rate": 0.00031615195872674836, "loss": 4.7005, "mean_token_accuracy": 0.22496049702167512, "num_tokens": 99375649.0, "step": 57295 }, { "entropy": 5.378129148483277, "epoch": 4.4581209881346044, "grad_norm": 1.1953125, "learning_rate": 0.00031612471033434406, "loss": 4.7699, "mean_token_accuracy": 0.22402811497449876, "num_tokens": 99384557.0, "step": 57300 }, { "entropy": 5.384200620651245, "epoch": 4.458510017506322, "grad_norm": 1.25, "learning_rate": 0.0003160974613179377, "loss": 4.7326, "mean_token_accuracy": 0.23265922963619232, "num_tokens": 99392752.0, "step": 57305 }, { "entropy": 5.430941820144653, "epoch": 4.458899046878039, "grad_norm": 1.1953125, "learning_rate": 0.0003160702116779428, "loss": 4.8545, "mean_token_accuracy": 0.2132594957947731, "num_tokens": 99402060.0, "step": 57310 }, { "entropy": 5.452469825744629, "epoch": 4.459288076249757, "grad_norm": 1.1953125, "learning_rate": 0.0003160429614147727, "loss": 4.8459, "mean_token_accuracy": 0.21793683767318725, "num_tokens": 99410992.0, "step": 57315 }, { "entropy": 5.423767232894898, "epoch": 4.459677105621474, "grad_norm": 1.125, "learning_rate": 0.00031601571052884117, "loss": 4.8159, "mean_token_accuracy": 0.21756284236907958, "num_tokens": 99419703.0, "step": 57320 }, { "entropy": 5.469342136383057, "epoch": 4.460066134993192, "grad_norm": 1.2734375, "learning_rate": 0.0003159884590205613, "loss": 4.8221, "mean_token_accuracy": 0.22593525499105455, "num_tokens": 99428305.0, "step": 57325 }, { "entropy": 5.361087656021118, "epoch": 4.46045516436491, "grad_norm": 1.140625, "learning_rate": 0.000315961206890347, "loss": 4.7743, "mean_token_accuracy": 0.2220757097005844, "num_tokens": 99437056.0, "step": 57330 }, { "entropy": 5.448331737518311, "epoch": 4.460844193736627, "grad_norm": 1.125, "learning_rate": 0.0003159339541386115, "loss": 4.9536, "mean_token_accuracy": 0.21096302717924117, "num_tokens": 99446122.0, "step": 57335 }, { "entropy": 5.524873495101929, "epoch": 4.461233223108344, "grad_norm": 1.2421875, "learning_rate": 0.00031590670076576846, "loss": 4.8352, "mean_token_accuracy": 0.2186709001660347, "num_tokens": 99454064.0, "step": 57340 }, { "entropy": 5.3967857837677, "epoch": 4.461622252480062, "grad_norm": 1.2109375, "learning_rate": 0.00031587944677223133, "loss": 4.7924, "mean_token_accuracy": 0.22580429017543793, "num_tokens": 99462871.0, "step": 57345 }, { "entropy": 5.377498006820678, "epoch": 4.46201128185178, "grad_norm": 1.203125, "learning_rate": 0.0003158521921584136, "loss": 4.739, "mean_token_accuracy": 0.22834757566452027, "num_tokens": 99470251.0, "step": 57350 }, { "entropy": 5.311630296707153, "epoch": 4.462400311223497, "grad_norm": 1.1796875, "learning_rate": 0.00031582493692472886, "loss": 4.7806, "mean_token_accuracy": 0.22358567267656326, "num_tokens": 99478761.0, "step": 57355 }, { "entropy": 5.386785173416138, "epoch": 4.462789340595215, "grad_norm": 1.171875, "learning_rate": 0.0003157976810715907, "loss": 4.7772, "mean_token_accuracy": 0.22461158484220506, "num_tokens": 99487753.0, "step": 57360 }, { "entropy": 5.422971153259278, "epoch": 4.463178369966933, "grad_norm": 1.1640625, "learning_rate": 0.00031577042459941275, "loss": 4.7418, "mean_token_accuracy": 0.23000783771276473, "num_tokens": 99496566.0, "step": 57365 }, { "entropy": 5.338047695159912, "epoch": 4.46356739933865, "grad_norm": 1.2734375, "learning_rate": 0.00031574316750860844, "loss": 4.7624, "mean_token_accuracy": 0.2265368342399597, "num_tokens": 99504384.0, "step": 57370 }, { "entropy": 5.356696939468383, "epoch": 4.463956428710367, "grad_norm": 1.234375, "learning_rate": 0.0003157159097995914, "loss": 4.7902, "mean_token_accuracy": 0.2200967401266098, "num_tokens": 99512945.0, "step": 57375 }, { "entropy": 5.456883716583252, "epoch": 4.464345458082085, "grad_norm": 1.25, "learning_rate": 0.00031568865147277525, "loss": 4.8372, "mean_token_accuracy": 0.22017484456300734, "num_tokens": 99521188.0, "step": 57380 }, { "entropy": 5.449392318725586, "epoch": 4.464734487453803, "grad_norm": 1.3515625, "learning_rate": 0.00031566139252857357, "loss": 4.7622, "mean_token_accuracy": 0.22014689445495605, "num_tokens": 99528938.0, "step": 57385 }, { "entropy": 5.45880618095398, "epoch": 4.46512351682552, "grad_norm": 1.21875, "learning_rate": 0.0003156341329674, "loss": 4.8512, "mean_token_accuracy": 0.21641667634248735, "num_tokens": 99538418.0, "step": 57390 }, { "entropy": 5.34148097038269, "epoch": 4.465512546197238, "grad_norm": 1.3359375, "learning_rate": 0.0003156068727896681, "loss": 4.6977, "mean_token_accuracy": 0.22954367101192474, "num_tokens": 99546513.0, "step": 57395 }, { "entropy": 5.417756080627441, "epoch": 4.465901575568956, "grad_norm": 1.265625, "learning_rate": 0.0003155796119957915, "loss": 4.8703, "mean_token_accuracy": 0.20931911170482637, "num_tokens": 99554665.0, "step": 57400 }, { "entropy": 5.4124205112457275, "epoch": 4.466290604940673, "grad_norm": 1.1328125, "learning_rate": 0.00031555235058618403, "loss": 4.8282, "mean_token_accuracy": 0.2141205370426178, "num_tokens": 99563953.0, "step": 57405 }, { "entropy": 5.465652799606323, "epoch": 4.46667963431239, "grad_norm": 1.234375, "learning_rate": 0.00031552508856125906, "loss": 4.8644, "mean_token_accuracy": 0.22333737909793855, "num_tokens": 99572809.0, "step": 57410 }, { "entropy": 5.406736421585083, "epoch": 4.467068663684108, "grad_norm": 1.1796875, "learning_rate": 0.0003154978259214304, "loss": 4.7083, "mean_token_accuracy": 0.22489060312509537, "num_tokens": 99581642.0, "step": 57415 }, { "entropy": 5.328680610656738, "epoch": 4.467457693055826, "grad_norm": 1.1640625, "learning_rate": 0.00031547056266711173, "loss": 4.7105, "mean_token_accuracy": 0.2273159831762314, "num_tokens": 99590261.0, "step": 57420 }, { "entropy": 5.37578501701355, "epoch": 4.467846722427543, "grad_norm": 1.1796875, "learning_rate": 0.0003154432987987166, "loss": 4.7857, "mean_token_accuracy": 0.2249089926481247, "num_tokens": 99598866.0, "step": 57425 }, { "entropy": 5.415650224685669, "epoch": 4.468235751799261, "grad_norm": 1.328125, "learning_rate": 0.0003154160343166589, "loss": 4.7439, "mean_token_accuracy": 0.22042347341775895, "num_tokens": 99607198.0, "step": 57430 }, { "entropy": 5.4388586521148685, "epoch": 4.468624781170979, "grad_norm": 1.1171875, "learning_rate": 0.00031538876922135214, "loss": 4.913, "mean_token_accuracy": 0.20446106940507888, "num_tokens": 99615776.0, "step": 57435 }, { "entropy": 5.408769512176514, "epoch": 4.469013810542696, "grad_norm": 1.109375, "learning_rate": 0.0003153615035132101, "loss": 4.7987, "mean_token_accuracy": 0.22756477296352387, "num_tokens": 99624240.0, "step": 57440 }, { "entropy": 5.380187511444092, "epoch": 4.469402839914413, "grad_norm": 1.15625, "learning_rate": 0.00031533423719264645, "loss": 4.6908, "mean_token_accuracy": 0.2310074970126152, "num_tokens": 99632547.0, "step": 57445 }, { "entropy": 5.374131107330323, "epoch": 4.469791869286131, "grad_norm": 1.1953125, "learning_rate": 0.000315306970260075, "loss": 4.8044, "mean_token_accuracy": 0.21942253708839415, "num_tokens": 99641678.0, "step": 57450 }, { "entropy": 5.4187358856201175, "epoch": 4.470180898657849, "grad_norm": 1.1640625, "learning_rate": 0.0003152797027159094, "loss": 4.8647, "mean_token_accuracy": 0.22007633745670319, "num_tokens": 99650090.0, "step": 57455 }, { "entropy": 5.413580274581909, "epoch": 4.470569928029566, "grad_norm": 1.09375, "learning_rate": 0.00031525243456056345, "loss": 4.7582, "mean_token_accuracy": 0.22532665580511094, "num_tokens": 99659469.0, "step": 57460 }, { "entropy": 5.452715253829956, "epoch": 4.470958957401284, "grad_norm": 1.1328125, "learning_rate": 0.0003152251657944509, "loss": 4.8164, "mean_token_accuracy": 0.22347097098827362, "num_tokens": 99668056.0, "step": 57465 }, { "entropy": 5.348944664001465, "epoch": 4.471347986773002, "grad_norm": 1.203125, "learning_rate": 0.0003151978964179854, "loss": 4.6819, "mean_token_accuracy": 0.23364021331071855, "num_tokens": 99676905.0, "step": 57470 }, { "entropy": 5.354820442199707, "epoch": 4.4717370161447185, "grad_norm": 1.203125, "learning_rate": 0.00031517062643158085, "loss": 4.7585, "mean_token_accuracy": 0.22438254207372665, "num_tokens": 99684518.0, "step": 57475 }, { "entropy": 5.365765571594238, "epoch": 4.472126045516436, "grad_norm": 1.21875, "learning_rate": 0.00031514335583565097, "loss": 4.7779, "mean_token_accuracy": 0.22294967770576476, "num_tokens": 99692541.0, "step": 57480 }, { "entropy": 5.417402648925782, "epoch": 4.472515074888154, "grad_norm": 1.15625, "learning_rate": 0.00031511608463060954, "loss": 4.8297, "mean_token_accuracy": 0.21504515260457993, "num_tokens": 99701866.0, "step": 57485 }, { "entropy": 5.400264120101928, "epoch": 4.472904104259872, "grad_norm": 1.1328125, "learning_rate": 0.00031508881281687044, "loss": 4.7705, "mean_token_accuracy": 0.2200484722852707, "num_tokens": 99711825.0, "step": 57490 }, { "entropy": 5.37727108001709, "epoch": 4.473293133631589, "grad_norm": 1.1875, "learning_rate": 0.00031506154039484736, "loss": 4.785, "mean_token_accuracy": 0.2261470824480057, "num_tokens": 99720635.0, "step": 57495 }, { "entropy": 5.429576396942139, "epoch": 4.473682163003307, "grad_norm": 1.203125, "learning_rate": 0.00031503426736495424, "loss": 4.7831, "mean_token_accuracy": 0.21691728979349137, "num_tokens": 99728938.0, "step": 57500 }, { "entropy": 5.380933666229248, "epoch": 4.474071192375025, "grad_norm": 1.2109375, "learning_rate": 0.00031500699372760476, "loss": 4.7485, "mean_token_accuracy": 0.226787032186985, "num_tokens": 99737403.0, "step": 57505 }, { "entropy": 5.358431386947632, "epoch": 4.4744602217467415, "grad_norm": 1.2421875, "learning_rate": 0.00031497971948321287, "loss": 4.7239, "mean_token_accuracy": 0.22793036997318267, "num_tokens": 99746004.0, "step": 57510 }, { "entropy": 5.419115018844605, "epoch": 4.474849251118459, "grad_norm": 1.171875, "learning_rate": 0.0003149524446321923, "loss": 4.7782, "mean_token_accuracy": 0.22354136556386947, "num_tokens": 99755337.0, "step": 57515 }, { "entropy": 5.412204551696777, "epoch": 4.475238280490177, "grad_norm": 1.203125, "learning_rate": 0.000314925169174957, "loss": 4.7958, "mean_token_accuracy": 0.22437187284231186, "num_tokens": 99763428.0, "step": 57520 }, { "entropy": 5.405033683776855, "epoch": 4.475627309861895, "grad_norm": 1.1875, "learning_rate": 0.00031489789311192086, "loss": 4.8248, "mean_token_accuracy": 0.22013988494873046, "num_tokens": 99771939.0, "step": 57525 }, { "entropy": 5.416330194473266, "epoch": 4.476016339233612, "grad_norm": 1.1796875, "learning_rate": 0.0003148706164434977, "loss": 4.7824, "mean_token_accuracy": 0.21838113218545913, "num_tokens": 99780877.0, "step": 57530 }, { "entropy": 5.40864143371582, "epoch": 4.47640536860533, "grad_norm": 1.2109375, "learning_rate": 0.0003148433391701014, "loss": 4.7325, "mean_token_accuracy": 0.22760019749403, "num_tokens": 99789309.0, "step": 57535 }, { "entropy": 5.354705333709717, "epoch": 4.476794397977047, "grad_norm": 1.1328125, "learning_rate": 0.0003148160612921457, "loss": 4.7636, "mean_token_accuracy": 0.2218502104282379, "num_tokens": 99798124.0, "step": 57540 }, { "entropy": 5.369080114364624, "epoch": 4.4771834273487645, "grad_norm": 1.15625, "learning_rate": 0.00031478878281004474, "loss": 4.8875, "mean_token_accuracy": 0.2189884975552559, "num_tokens": 99806773.0, "step": 57545 }, { "entropy": 5.326339960098267, "epoch": 4.477572456720482, "grad_norm": 1.1171875, "learning_rate": 0.00031476150372421234, "loss": 4.7376, "mean_token_accuracy": 0.21797392815351485, "num_tokens": 99815825.0, "step": 57550 }, { "entropy": 5.395896339416504, "epoch": 4.4779614860922, "grad_norm": 1.1328125, "learning_rate": 0.0003147342240350625, "loss": 4.7739, "mean_token_accuracy": 0.22774604707956314, "num_tokens": 99823737.0, "step": 57555 }, { "entropy": 5.43360390663147, "epoch": 4.478350515463918, "grad_norm": 1.1328125, "learning_rate": 0.0003147069437430089, "loss": 4.8318, "mean_token_accuracy": 0.22052946984767913, "num_tokens": 99832601.0, "step": 57560 }, { "entropy": 5.3546778678894045, "epoch": 4.478739544835635, "grad_norm": 1.1875, "learning_rate": 0.00031467966284846573, "loss": 4.7248, "mean_token_accuracy": 0.2260730728507042, "num_tokens": 99840817.0, "step": 57565 }, { "entropy": 5.451509618759156, "epoch": 4.479128574207353, "grad_norm": 1.1953125, "learning_rate": 0.0003146523813518468, "loss": 4.7729, "mean_token_accuracy": 0.2280184507369995, "num_tokens": 99848525.0, "step": 57570 }, { "entropy": 5.338032913208008, "epoch": 4.47951760357907, "grad_norm": 1.1796875, "learning_rate": 0.00031462509925356616, "loss": 4.7861, "mean_token_accuracy": 0.22469336539506912, "num_tokens": 99857756.0, "step": 57575 }, { "entropy": 5.3849865913391115, "epoch": 4.4799066329507875, "grad_norm": 1.1171875, "learning_rate": 0.00031459781655403756, "loss": 4.7247, "mean_token_accuracy": 0.22604879438877107, "num_tokens": 99866171.0, "step": 57580 }, { "entropy": 5.364056777954102, "epoch": 4.480295662322505, "grad_norm": 1.2265625, "learning_rate": 0.0003145705332536752, "loss": 4.76, "mean_token_accuracy": 0.21728412806987762, "num_tokens": 99874842.0, "step": 57585 }, { "entropy": 5.393701648712158, "epoch": 4.480684691694223, "grad_norm": 1.21875, "learning_rate": 0.000314543249352893, "loss": 4.8051, "mean_token_accuracy": 0.22341737449169158, "num_tokens": 99882840.0, "step": 57590 }, { "entropy": 5.454952621459961, "epoch": 4.481073721065941, "grad_norm": 1.1640625, "learning_rate": 0.00031451596485210486, "loss": 4.7868, "mean_token_accuracy": 0.21950131356716157, "num_tokens": 99891633.0, "step": 57595 }, { "entropy": 5.473793172836304, "epoch": 4.481462750437658, "grad_norm": 1.2109375, "learning_rate": 0.00031448867975172493, "loss": 4.7985, "mean_token_accuracy": 0.2265819415450096, "num_tokens": 99900181.0, "step": 57600 }, { "entropy": 5.447542667388916, "epoch": 4.481851779809376, "grad_norm": 1.125, "learning_rate": 0.00031446139405216713, "loss": 4.8181, "mean_token_accuracy": 0.22350174337625503, "num_tokens": 99909333.0, "step": 57605 }, { "entropy": 5.387915515899659, "epoch": 4.482240809181093, "grad_norm": 1.25, "learning_rate": 0.0003144341077538455, "loss": 4.8402, "mean_token_accuracy": 0.21899865120649337, "num_tokens": 99918639.0, "step": 57610 }, { "entropy": 5.407594108581543, "epoch": 4.4826298385528105, "grad_norm": 1.1640625, "learning_rate": 0.000314406820857174, "loss": 4.8041, "mean_token_accuracy": 0.22440048158168793, "num_tokens": 99927693.0, "step": 57615 }, { "entropy": 5.37995753288269, "epoch": 4.483018867924528, "grad_norm": 1.171875, "learning_rate": 0.00031437953336256667, "loss": 4.6935, "mean_token_accuracy": 0.23045378923416138, "num_tokens": 99935885.0, "step": 57620 }, { "entropy": 5.474698114395141, "epoch": 4.483407897296246, "grad_norm": 1.2890625, "learning_rate": 0.0003143522452704377, "loss": 4.8845, "mean_token_accuracy": 0.21683274656534196, "num_tokens": 99944472.0, "step": 57625 }, { "entropy": 5.39496340751648, "epoch": 4.483796926667964, "grad_norm": 1.15625, "learning_rate": 0.000314324956581201, "loss": 4.7603, "mean_token_accuracy": 0.22516266703605653, "num_tokens": 99952376.0, "step": 57630 }, { "entropy": 5.397978782653809, "epoch": 4.484185956039681, "grad_norm": 1.203125, "learning_rate": 0.0003142976672952707, "loss": 4.7984, "mean_token_accuracy": 0.21861375123262405, "num_tokens": 99961277.0, "step": 57635 }, { "entropy": 5.48889422416687, "epoch": 4.484574985411399, "grad_norm": 1.2578125, "learning_rate": 0.00031427037741306083, "loss": 4.8832, "mean_token_accuracy": 0.21433400511741638, "num_tokens": 99970195.0, "step": 57640 }, { "entropy": 5.3329792499542235, "epoch": 4.484964014783116, "grad_norm": 1.1953125, "learning_rate": 0.0003142430869349855, "loss": 4.6956, "mean_token_accuracy": 0.22559254318475724, "num_tokens": 99978580.0, "step": 57645 }, { "entropy": 5.348759031295776, "epoch": 4.4853530441548335, "grad_norm": 1.125, "learning_rate": 0.0003142157958614588, "loss": 4.8135, "mean_token_accuracy": 0.2236206516623497, "num_tokens": 99986848.0, "step": 57650 }, { "entropy": 5.416388511657715, "epoch": 4.485742073526551, "grad_norm": 1.1640625, "learning_rate": 0.0003141885041928948, "loss": 4.7886, "mean_token_accuracy": 0.21941682696342468, "num_tokens": 99995664.0, "step": 57655 }, { "entropy": 5.4966721534729, "epoch": 4.486131102898269, "grad_norm": 1.1875, "learning_rate": 0.00031416121192970754, "loss": 4.9302, "mean_token_accuracy": 0.21860788762569427, "num_tokens": 100003750.0, "step": 57660 }, { "entropy": 5.410041570663452, "epoch": 4.486520132269987, "grad_norm": 1.1875, "learning_rate": 0.00031413391907231133, "loss": 4.7819, "mean_token_accuracy": 0.22354753613471984, "num_tokens": 100012074.0, "step": 57665 }, { "entropy": 5.2828134059906, "epoch": 4.486909161641704, "grad_norm": 1.1640625, "learning_rate": 0.00031410662562112015, "loss": 4.6907, "mean_token_accuracy": 0.2316438302397728, "num_tokens": 100020666.0, "step": 57670 }, { "entropy": 5.416921472549438, "epoch": 4.487298191013421, "grad_norm": 1.1171875, "learning_rate": 0.00031407933157654816, "loss": 4.8543, "mean_token_accuracy": 0.21581071615219116, "num_tokens": 100028973.0, "step": 57675 }, { "entropy": 5.340580606460572, "epoch": 4.487687220385139, "grad_norm": 1.1953125, "learning_rate": 0.0003140520369390095, "loss": 4.6583, "mean_token_accuracy": 0.23521411865949632, "num_tokens": 100037324.0, "step": 57680 }, { "entropy": 5.426223659515381, "epoch": 4.4880762497568565, "grad_norm": 1.171875, "learning_rate": 0.0003140247417089184, "loss": 4.8836, "mean_token_accuracy": 0.21098316907882692, "num_tokens": 100046383.0, "step": 57685 }, { "entropy": 5.277834939956665, "epoch": 4.488465279128574, "grad_norm": 1.1171875, "learning_rate": 0.0003139974458866889, "loss": 4.6452, "mean_token_accuracy": 0.2338574454188347, "num_tokens": 100054857.0, "step": 57690 }, { "entropy": 5.407357263565063, "epoch": 4.488854308500292, "grad_norm": 1.1640625, "learning_rate": 0.0003139701494727353, "loss": 4.8486, "mean_token_accuracy": 0.21710706502199173, "num_tokens": 100064228.0, "step": 57695 }, { "entropy": 5.439156007766724, "epoch": 4.48924333787201, "grad_norm": 1.2734375, "learning_rate": 0.0003139428524674716, "loss": 4.7672, "mean_token_accuracy": 0.2210906371474266, "num_tokens": 100072580.0, "step": 57700 }, { "entropy": 5.337649011611939, "epoch": 4.489632367243727, "grad_norm": 1.1796875, "learning_rate": 0.0003139155548713122, "loss": 4.7051, "mean_token_accuracy": 0.22351212054491043, "num_tokens": 100081119.0, "step": 57705 }, { "entropy": 5.343809461593628, "epoch": 4.490021396615444, "grad_norm": 1.1953125, "learning_rate": 0.00031388825668467115, "loss": 4.7599, "mean_token_accuracy": 0.22047473937273027, "num_tokens": 100089814.0, "step": 57710 }, { "entropy": 5.407919597625733, "epoch": 4.490410425987162, "grad_norm": 1.296875, "learning_rate": 0.00031386095790796265, "loss": 4.8152, "mean_token_accuracy": 0.22950376719236373, "num_tokens": 100098311.0, "step": 57715 }, { "entropy": 5.4462785720825195, "epoch": 4.4907994553588795, "grad_norm": 1.1875, "learning_rate": 0.00031383365854160104, "loss": 4.8049, "mean_token_accuracy": 0.22170085906982423, "num_tokens": 100106028.0, "step": 57720 }, { "entropy": 5.35135817527771, "epoch": 4.491188484730597, "grad_norm": 1.21875, "learning_rate": 0.0003138063585860005, "loss": 4.7207, "mean_token_accuracy": 0.2340254992246628, "num_tokens": 100114227.0, "step": 57725 }, { "entropy": 5.30558443069458, "epoch": 4.491577514102315, "grad_norm": 1.1640625, "learning_rate": 0.0003137790580415752, "loss": 4.7254, "mean_token_accuracy": 0.22943395227193833, "num_tokens": 100123026.0, "step": 57730 }, { "entropy": 5.407859849929809, "epoch": 4.491966543474033, "grad_norm": 1.0546875, "learning_rate": 0.00031375175690873943, "loss": 4.791, "mean_token_accuracy": 0.22014037221670152, "num_tokens": 100132018.0, "step": 57735 }, { "entropy": 5.48375973701477, "epoch": 4.49235557284575, "grad_norm": 1.1640625, "learning_rate": 0.00031372445518790737, "loss": 4.906, "mean_token_accuracy": 0.20902176797389985, "num_tokens": 100140142.0, "step": 57740 }, { "entropy": 5.3409325122833256, "epoch": 4.492744602217467, "grad_norm": 1.171875, "learning_rate": 0.00031369715287949334, "loss": 4.7682, "mean_token_accuracy": 0.2285037085413933, "num_tokens": 100148666.0, "step": 57745 }, { "entropy": 5.43045859336853, "epoch": 4.493133631589185, "grad_norm": 1.21875, "learning_rate": 0.00031366984998391163, "loss": 4.8053, "mean_token_accuracy": 0.2134558767080307, "num_tokens": 100157149.0, "step": 57750 }, { "entropy": 5.320727348327637, "epoch": 4.4935226609609025, "grad_norm": 1.1875, "learning_rate": 0.00031364254650157646, "loss": 4.7285, "mean_token_accuracy": 0.22789667397737504, "num_tokens": 100165742.0, "step": 57755 }, { "entropy": 5.426425170898438, "epoch": 4.49391169033262, "grad_norm": 1.28125, "learning_rate": 0.0003136152424329023, "loss": 4.7729, "mean_token_accuracy": 0.21458699852228164, "num_tokens": 100174208.0, "step": 57760 }, { "entropy": 5.496550989151001, "epoch": 4.494300719704338, "grad_norm": 1.1484375, "learning_rate": 0.0003135879377783032, "loss": 4.8894, "mean_token_accuracy": 0.20936702489852904, "num_tokens": 100183356.0, "step": 57765 }, { "entropy": 5.386419200897217, "epoch": 4.494689749076056, "grad_norm": 1.1875, "learning_rate": 0.00031356063253819354, "loss": 4.82, "mean_token_accuracy": 0.21511639207601546, "num_tokens": 100192136.0, "step": 57770 }, { "entropy": 5.437817907333374, "epoch": 4.495078778447773, "grad_norm": 1.1796875, "learning_rate": 0.0003135333267129877, "loss": 4.8153, "mean_token_accuracy": 0.21417911499738693, "num_tokens": 100200274.0, "step": 57775 }, { "entropy": 5.3432456970214846, "epoch": 4.49546780781949, "grad_norm": 1.1796875, "learning_rate": 0.0003135060203030999, "loss": 4.697, "mean_token_accuracy": 0.23537123054265977, "num_tokens": 100208510.0, "step": 57780 }, { "entropy": 5.335248565673828, "epoch": 4.495856837191208, "grad_norm": 1.1875, "learning_rate": 0.00031347871330894464, "loss": 4.7187, "mean_token_accuracy": 0.2289268285036087, "num_tokens": 100216725.0, "step": 57785 }, { "entropy": 5.308446979522705, "epoch": 4.4962458665629255, "grad_norm": 1.1015625, "learning_rate": 0.000313451405730936, "loss": 4.6819, "mean_token_accuracy": 0.22728558480739594, "num_tokens": 100225283.0, "step": 57790 }, { "entropy": 5.3715136528015135, "epoch": 4.496634895934643, "grad_norm": 1.203125, "learning_rate": 0.0003134240975694886, "loss": 4.7758, "mean_token_accuracy": 0.22343828678131103, "num_tokens": 100234598.0, "step": 57795 }, { "entropy": 5.455445623397827, "epoch": 4.497023925306361, "grad_norm": 1.1796875, "learning_rate": 0.00031339678882501667, "loss": 4.7797, "mean_token_accuracy": 0.22201773077249526, "num_tokens": 100243291.0, "step": 57800 }, { "entropy": 5.399333143234253, "epoch": 4.497412954678079, "grad_norm": 1.234375, "learning_rate": 0.00031336947949793455, "loss": 4.8026, "mean_token_accuracy": 0.21889971047639847, "num_tokens": 100251137.0, "step": 57805 }, { "entropy": 5.3522453784942625, "epoch": 4.497801984049795, "grad_norm": 1.1796875, "learning_rate": 0.00031334216958865663, "loss": 4.7435, "mean_token_accuracy": 0.22608824223279952, "num_tokens": 100259458.0, "step": 57810 }, { "entropy": 5.352729320526123, "epoch": 4.498191013421513, "grad_norm": 1.1171875, "learning_rate": 0.00031331485909759734, "loss": 4.7188, "mean_token_accuracy": 0.22311104238033294, "num_tokens": 100267806.0, "step": 57815 }, { "entropy": 5.378627824783325, "epoch": 4.498580042793231, "grad_norm": 1.109375, "learning_rate": 0.000313287548025171, "loss": 4.793, "mean_token_accuracy": 0.22081533670425416, "num_tokens": 100276391.0, "step": 57820 }, { "entropy": 5.3758782863616945, "epoch": 4.4989690721649485, "grad_norm": 1.1796875, "learning_rate": 0.0003132602363717921, "loss": 4.7413, "mean_token_accuracy": 0.23077651858329773, "num_tokens": 100284437.0, "step": 57825 }, { "entropy": 5.360558414459229, "epoch": 4.499358101536666, "grad_norm": 1.140625, "learning_rate": 0.00031323292413787504, "loss": 4.7926, "mean_token_accuracy": 0.22399294078350068, "num_tokens": 100293463.0, "step": 57830 }, { "entropy": 5.401128053665161, "epoch": 4.499747130908384, "grad_norm": 1.1640625, "learning_rate": 0.0003132056113238341, "loss": 4.7818, "mean_token_accuracy": 0.22694533467292785, "num_tokens": 100302053.0, "step": 57835 }, { "entropy": 5.475760841369629, "epoch": 4.5001361602801015, "grad_norm": 1.3125, "learning_rate": 0.00031317829793008403, "loss": 4.8815, "mean_token_accuracy": 0.21565925180912018, "num_tokens": 100309746.0, "step": 57840 }, { "entropy": 5.419690084457398, "epoch": 4.500525189651818, "grad_norm": 1.1171875, "learning_rate": 0.0003131509839570389, "loss": 4.7554, "mean_token_accuracy": 0.22166290879249573, "num_tokens": 100318297.0, "step": 57845 }, { "entropy": 5.511315631866455, "epoch": 4.500914219023536, "grad_norm": 1.1015625, "learning_rate": 0.00031312366940511327, "loss": 4.9056, "mean_token_accuracy": 0.2157449260354042, "num_tokens": 100327300.0, "step": 57850 }, { "entropy": 5.40597620010376, "epoch": 4.501303248395254, "grad_norm": 1.1484375, "learning_rate": 0.0003130963542747217, "loss": 4.7508, "mean_token_accuracy": 0.2217692106962204, "num_tokens": 100335479.0, "step": 57855 }, { "entropy": 5.416769695281983, "epoch": 4.5016922777669715, "grad_norm": 1.2109375, "learning_rate": 0.00031306903856627866, "loss": 4.7842, "mean_token_accuracy": 0.22478729337453843, "num_tokens": 100344225.0, "step": 57860 }, { "entropy": 5.4443529605865475, "epoch": 4.502081307138689, "grad_norm": 1.1640625, "learning_rate": 0.00031304172228019845, "loss": 4.918, "mean_token_accuracy": 0.20887303054332734, "num_tokens": 100353005.0, "step": 57865 }, { "entropy": 5.466445350646973, "epoch": 4.502470336510407, "grad_norm": 1.2265625, "learning_rate": 0.00031301440541689577, "loss": 4.8318, "mean_token_accuracy": 0.213143952190876, "num_tokens": 100361716.0, "step": 57870 }, { "entropy": 5.395691347122193, "epoch": 4.502859365882124, "grad_norm": 1.28125, "learning_rate": 0.0003129870879767849, "loss": 4.6863, "mean_token_accuracy": 0.23259471356868744, "num_tokens": 100370305.0, "step": 57875 }, { "entropy": 5.31770887374878, "epoch": 4.503248395253841, "grad_norm": 1.15625, "learning_rate": 0.0003129597699602804, "loss": 4.6673, "mean_token_accuracy": 0.23455159217119217, "num_tokens": 100378616.0, "step": 57880 }, { "entropy": 5.396580362319947, "epoch": 4.503637424625559, "grad_norm": 1.15625, "learning_rate": 0.0003129324513677969, "loss": 4.8601, "mean_token_accuracy": 0.21577189713716508, "num_tokens": 100388303.0, "step": 57885 }, { "entropy": 5.4653116226196286, "epoch": 4.504026453997277, "grad_norm": 1.203125, "learning_rate": 0.00031290513219974875, "loss": 4.7804, "mean_token_accuracy": 0.22436352968215942, "num_tokens": 100396331.0, "step": 57890 }, { "entropy": 5.422437524795532, "epoch": 4.504415483368994, "grad_norm": 1.1875, "learning_rate": 0.00031287781245655064, "loss": 4.7809, "mean_token_accuracy": 0.22076030522584916, "num_tokens": 100405441.0, "step": 57895 }, { "entropy": 5.373691987991333, "epoch": 4.504804512740712, "grad_norm": 1.1875, "learning_rate": 0.000312850492138617, "loss": 4.7428, "mean_token_accuracy": 0.22496703267097473, "num_tokens": 100413255.0, "step": 57900 }, { "entropy": 5.381462335586548, "epoch": 4.50519354211243, "grad_norm": 1.140625, "learning_rate": 0.0003128231712463623, "loss": 4.8336, "mean_token_accuracy": 0.21518344432115555, "num_tokens": 100422641.0, "step": 57905 }, { "entropy": 5.427124500274658, "epoch": 4.5055825714841475, "grad_norm": 1.1328125, "learning_rate": 0.0003127958497802012, "loss": 4.691, "mean_token_accuracy": 0.22952450960874557, "num_tokens": 100431634.0, "step": 57910 }, { "entropy": 5.477061605453491, "epoch": 4.505971600855864, "grad_norm": 1.1640625, "learning_rate": 0.0003127685277405483, "loss": 4.8263, "mean_token_accuracy": 0.21461721062660216, "num_tokens": 100439977.0, "step": 57915 }, { "entropy": 5.323012256622315, "epoch": 4.506360630227582, "grad_norm": 1.1953125, "learning_rate": 0.00031274120512781806, "loss": 4.7689, "mean_token_accuracy": 0.22612911015748977, "num_tokens": 100449697.0, "step": 57920 }, { "entropy": 5.4165356159210205, "epoch": 4.5067496595993, "grad_norm": 1.1328125, "learning_rate": 0.0003127138819424252, "loss": 4.8238, "mean_token_accuracy": 0.221655935049057, "num_tokens": 100458510.0, "step": 57925 }, { "entropy": 5.512553310394287, "epoch": 4.507138688971017, "grad_norm": 1.3203125, "learning_rate": 0.0003126865581847841, "loss": 4.8451, "mean_token_accuracy": 0.22541442066431044, "num_tokens": 100466169.0, "step": 57930 }, { "entropy": 5.458947324752808, "epoch": 4.507527718342735, "grad_norm": 1.265625, "learning_rate": 0.00031265923385530943, "loss": 4.8102, "mean_token_accuracy": 0.2168567255139351, "num_tokens": 100473503.0, "step": 57935 }, { "entropy": 5.299635314941407, "epoch": 4.507916747714452, "grad_norm": 1.1640625, "learning_rate": 0.0003126319089544159, "loss": 4.7127, "mean_token_accuracy": 0.22135361582040786, "num_tokens": 100482437.0, "step": 57940 }, { "entropy": 5.404043102264405, "epoch": 4.50830577708617, "grad_norm": 1.25, "learning_rate": 0.000312604583482518, "loss": 4.7666, "mean_token_accuracy": 0.22112592905759812, "num_tokens": 100491705.0, "step": 57945 }, { "entropy": 5.450191307067871, "epoch": 4.508694806457887, "grad_norm": 1.2421875, "learning_rate": 0.0003125772574400305, "loss": 4.797, "mean_token_accuracy": 0.23065756410360336, "num_tokens": 100499566.0, "step": 57950 }, { "entropy": 5.390372562408447, "epoch": 4.509083835829605, "grad_norm": 1.1015625, "learning_rate": 0.0003125499308273679, "loss": 4.7766, "mean_token_accuracy": 0.22196501195430757, "num_tokens": 100508326.0, "step": 57955 }, { "entropy": 5.408315277099609, "epoch": 4.509472865201323, "grad_norm": 1.171875, "learning_rate": 0.00031252260364494477, "loss": 4.7473, "mean_token_accuracy": 0.22300993502140046, "num_tokens": 100517334.0, "step": 57960 }, { "entropy": 5.3416139602661135, "epoch": 4.50986189457304, "grad_norm": 1.109375, "learning_rate": 0.00031249527589317596, "loss": 4.7968, "mean_token_accuracy": 0.22325329184532167, "num_tokens": 100526326.0, "step": 57965 }, { "entropy": 5.388043832778931, "epoch": 4.510250923944758, "grad_norm": 1.1953125, "learning_rate": 0.0003124679475724759, "loss": 4.7183, "mean_token_accuracy": 0.2335127428174019, "num_tokens": 100534865.0, "step": 57970 }, { "entropy": 5.400729990005493, "epoch": 4.510639953316476, "grad_norm": 1.171875, "learning_rate": 0.0003124406186832595, "loss": 4.7669, "mean_token_accuracy": 0.22801960110664368, "num_tokens": 100543320.0, "step": 57975 }, { "entropy": 5.3139852523803714, "epoch": 4.511028982688193, "grad_norm": 1.1328125, "learning_rate": 0.0003124132892259412, "loss": 4.7229, "mean_token_accuracy": 0.22526452392339708, "num_tokens": 100552924.0, "step": 57980 }, { "entropy": 5.386468982696533, "epoch": 4.51141801205991, "grad_norm": 1.25, "learning_rate": 0.00031238595920093584, "loss": 4.7415, "mean_token_accuracy": 0.228739832341671, "num_tokens": 100561350.0, "step": 57985 }, { "entropy": 5.375076532363892, "epoch": 4.511807041431628, "grad_norm": 1.1875, "learning_rate": 0.00031235862860865807, "loss": 4.7755, "mean_token_accuracy": 0.23037723153829576, "num_tokens": 100569843.0, "step": 57990 }, { "entropy": 5.345647144317627, "epoch": 4.512196070803346, "grad_norm": 1.2734375, "learning_rate": 0.0003123312974495226, "loss": 4.7781, "mean_token_accuracy": 0.2167186915874481, "num_tokens": 100578286.0, "step": 57995 }, { "entropy": 5.352966260910034, "epoch": 4.512585100175063, "grad_norm": 1.1875, "learning_rate": 0.00031230396572394406, "loss": 4.7436, "mean_token_accuracy": 0.22409137040376664, "num_tokens": 100587035.0, "step": 58000 }, { "entropy": 5.372035789489746, "epoch": 4.512974129546781, "grad_norm": 1.15625, "learning_rate": 0.0003122766334323372, "loss": 4.7726, "mean_token_accuracy": 0.22840918600559235, "num_tokens": 100594959.0, "step": 58005 }, { "entropy": 5.331689548492432, "epoch": 4.513363158918498, "grad_norm": 1.2734375, "learning_rate": 0.00031224930057511673, "loss": 4.7238, "mean_token_accuracy": 0.2250116065144539, "num_tokens": 100603368.0, "step": 58010 }, { "entropy": 5.328898620605469, "epoch": 4.513752188290216, "grad_norm": 1.125, "learning_rate": 0.0003122219671526974, "loss": 4.7263, "mean_token_accuracy": 0.22797801792621614, "num_tokens": 100612254.0, "step": 58015 }, { "entropy": 5.48079891204834, "epoch": 4.514141217661933, "grad_norm": 1.1796875, "learning_rate": 0.00031219463316549406, "loss": 4.8278, "mean_token_accuracy": 0.22416602224111556, "num_tokens": 100620227.0, "step": 58020 }, { "entropy": 5.464543676376342, "epoch": 4.514530247033651, "grad_norm": 1.2578125, "learning_rate": 0.00031216729861392137, "loss": 4.9239, "mean_token_accuracy": 0.21303140074014665, "num_tokens": 100628740.0, "step": 58025 }, { "entropy": 5.393756008148193, "epoch": 4.514919276405369, "grad_norm": 1.203125, "learning_rate": 0.0003121399634983941, "loss": 4.7761, "mean_token_accuracy": 0.2287479594349861, "num_tokens": 100637671.0, "step": 58030 }, { "entropy": 5.389538240432739, "epoch": 4.515308305777086, "grad_norm": 1.09375, "learning_rate": 0.00031211262781932693, "loss": 4.7572, "mean_token_accuracy": 0.21432053595781325, "num_tokens": 100645681.0, "step": 58035 }, { "entropy": 5.4296613216400145, "epoch": 4.515697335148804, "grad_norm": 1.1796875, "learning_rate": 0.00031208529157713465, "loss": 4.7991, "mean_token_accuracy": 0.22633033692836763, "num_tokens": 100654477.0, "step": 58040 }, { "entropy": 5.4257865905761715, "epoch": 4.516086364520521, "grad_norm": 1.2109375, "learning_rate": 0.00031205795477223217, "loss": 4.8685, "mean_token_accuracy": 0.21169258952140807, "num_tokens": 100662919.0, "step": 58045 }, { "entropy": 5.382138729095459, "epoch": 4.516475393892239, "grad_norm": 1.21875, "learning_rate": 0.00031203061740503414, "loss": 4.7564, "mean_token_accuracy": 0.231247578561306, "num_tokens": 100671795.0, "step": 58050 }, { "entropy": 5.442680883407593, "epoch": 4.516864423263956, "grad_norm": 1.2265625, "learning_rate": 0.0003120032794759555, "loss": 4.8112, "mean_token_accuracy": 0.21712231636047363, "num_tokens": 100680330.0, "step": 58055 }, { "entropy": 5.407100486755371, "epoch": 4.517253452635674, "grad_norm": 1.25, "learning_rate": 0.000311975940985411, "loss": 4.6936, "mean_token_accuracy": 0.23344154357910157, "num_tokens": 100688286.0, "step": 58060 }, { "entropy": 5.338248062133789, "epoch": 4.517642482007392, "grad_norm": 1.171875, "learning_rate": 0.0003119486019338154, "loss": 4.7934, "mean_token_accuracy": 0.22439491003751755, "num_tokens": 100698379.0, "step": 58065 }, { "entropy": 5.458255434036255, "epoch": 4.518031511379109, "grad_norm": 1.078125, "learning_rate": 0.00031192126232158367, "loss": 4.899, "mean_token_accuracy": 0.21628058403730394, "num_tokens": 100707946.0, "step": 58070 }, { "entropy": 5.476126718521118, "epoch": 4.518420540750826, "grad_norm": 1.109375, "learning_rate": 0.0003118939221491305, "loss": 4.8828, "mean_token_accuracy": 0.21490413099527358, "num_tokens": 100716180.0, "step": 58075 }, { "entropy": 5.3755530834198, "epoch": 4.518809570122544, "grad_norm": 1.1953125, "learning_rate": 0.0003118665814168707, "loss": 4.7191, "mean_token_accuracy": 0.23380044996738433, "num_tokens": 100724033.0, "step": 58080 }, { "entropy": 5.259496879577637, "epoch": 4.519198599494262, "grad_norm": 1.2109375, "learning_rate": 0.00031183924012521925, "loss": 4.6055, "mean_token_accuracy": 0.23686518371105195, "num_tokens": 100732749.0, "step": 58085 }, { "entropy": 5.427208042144775, "epoch": 4.519587628865979, "grad_norm": 1.1875, "learning_rate": 0.000311811898274591, "loss": 4.7975, "mean_token_accuracy": 0.22220032811164855, "num_tokens": 100742250.0, "step": 58090 }, { "entropy": 5.315772819519043, "epoch": 4.519976658237697, "grad_norm": 1.1875, "learning_rate": 0.00031178455586540076, "loss": 4.7348, "mean_token_accuracy": 0.22659672945737838, "num_tokens": 100751390.0, "step": 58095 }, { "entropy": 5.4787829399108885, "epoch": 4.520365687609415, "grad_norm": 1.203125, "learning_rate": 0.00031175721289806345, "loss": 4.8263, "mean_token_accuracy": 0.21820921897888185, "num_tokens": 100760796.0, "step": 58100 }, { "entropy": 5.338122367858887, "epoch": 4.520754716981132, "grad_norm": 1.1484375, "learning_rate": 0.00031172986937299396, "loss": 4.6653, "mean_token_accuracy": 0.23375268578529357, "num_tokens": 100769303.0, "step": 58105 }, { "entropy": 5.361729955673217, "epoch": 4.52114374635285, "grad_norm": 1.1796875, "learning_rate": 0.00031170252529060715, "loss": 4.7757, "mean_token_accuracy": 0.22059105783700944, "num_tokens": 100777588.0, "step": 58110 }, { "entropy": 5.368405342102051, "epoch": 4.521532775724567, "grad_norm": 1.1953125, "learning_rate": 0.0003116751806513179, "loss": 4.7195, "mean_token_accuracy": 0.22722605764865875, "num_tokens": 100785908.0, "step": 58115 }, { "entropy": 5.42820782661438, "epoch": 4.521921805096285, "grad_norm": 1.1640625, "learning_rate": 0.0003116478354555412, "loss": 4.736, "mean_token_accuracy": 0.22856306731700898, "num_tokens": 100794440.0, "step": 58120 }, { "entropy": 5.388200187683106, "epoch": 4.522310834468002, "grad_norm": 1.1796875, "learning_rate": 0.00031162048970369196, "loss": 4.8058, "mean_token_accuracy": 0.21930038779973984, "num_tokens": 100803100.0, "step": 58125 }, { "entropy": 5.40218596458435, "epoch": 4.52269986383972, "grad_norm": 1.140625, "learning_rate": 0.000311593143396185, "loss": 4.8732, "mean_token_accuracy": 0.21446277648210527, "num_tokens": 100811734.0, "step": 58130 }, { "entropy": 5.478357744216919, "epoch": 4.523088893211438, "grad_norm": 1.1796875, "learning_rate": 0.00031156579653343543, "loss": 4.7903, "mean_token_accuracy": 0.22012398391962051, "num_tokens": 100819690.0, "step": 58135 }, { "entropy": 5.424999189376831, "epoch": 4.523477922583155, "grad_norm": 1.1640625, "learning_rate": 0.000311538449115858, "loss": 4.7237, "mean_token_accuracy": 0.22409381568431855, "num_tokens": 100827786.0, "step": 58140 }, { "entropy": 5.375665950775146, "epoch": 4.523866951954872, "grad_norm": 1.1875, "learning_rate": 0.0003115111011438678, "loss": 4.7693, "mean_token_accuracy": 0.22417058795690536, "num_tokens": 100836527.0, "step": 58145 }, { "entropy": 5.453056573867798, "epoch": 4.52425598132659, "grad_norm": 1.1796875, "learning_rate": 0.0003114837526178797, "loss": 4.7485, "mean_token_accuracy": 0.22356841564178467, "num_tokens": 100845341.0, "step": 58150 }, { "entropy": 5.418053531646729, "epoch": 4.524645010698308, "grad_norm": 1.1953125, "learning_rate": 0.0003114564035383088, "loss": 4.8128, "mean_token_accuracy": 0.21992308050394058, "num_tokens": 100853895.0, "step": 58155 }, { "entropy": 5.35748176574707, "epoch": 4.525034040070025, "grad_norm": 1.1796875, "learning_rate": 0.00031142905390556995, "loss": 4.7911, "mean_token_accuracy": 0.21773683726787568, "num_tokens": 100862196.0, "step": 58160 }, { "entropy": 5.462615871429444, "epoch": 4.525423069441743, "grad_norm": 1.15625, "learning_rate": 0.0003114017037200782, "loss": 4.8468, "mean_token_accuracy": 0.2246977612376213, "num_tokens": 100870393.0, "step": 58165 }, { "entropy": 5.418280792236328, "epoch": 4.525812098813461, "grad_norm": 1.078125, "learning_rate": 0.00031137435298224863, "loss": 4.7524, "mean_token_accuracy": 0.2236534282565117, "num_tokens": 100880326.0, "step": 58170 }, { "entropy": 5.400307750701904, "epoch": 4.526201128185178, "grad_norm": 1.078125, "learning_rate": 0.0003113470016924961, "loss": 4.7441, "mean_token_accuracy": 0.22486046701669693, "num_tokens": 100888738.0, "step": 58175 }, { "entropy": 5.431799268722534, "epoch": 4.526590157556895, "grad_norm": 1.140625, "learning_rate": 0.00031131964985123555, "loss": 4.779, "mean_token_accuracy": 0.22227229475975036, "num_tokens": 100896903.0, "step": 58180 }, { "entropy": 5.378903865814209, "epoch": 4.526979186928613, "grad_norm": 1.1328125, "learning_rate": 0.0003112922974588822, "loss": 4.7351, "mean_token_accuracy": 0.22840025275945663, "num_tokens": 100906051.0, "step": 58185 }, { "entropy": 5.40859432220459, "epoch": 4.527368216300331, "grad_norm": 1.1875, "learning_rate": 0.000311264944515851, "loss": 4.8233, "mean_token_accuracy": 0.2159008651971817, "num_tokens": 100914523.0, "step": 58190 }, { "entropy": 5.378433418273926, "epoch": 4.527757245672048, "grad_norm": 1.140625, "learning_rate": 0.00031123759102255714, "loss": 4.7271, "mean_token_accuracy": 0.22145889550447465, "num_tokens": 100922670.0, "step": 58195 }, { "entropy": 5.359075927734375, "epoch": 4.528146275043766, "grad_norm": 1.2578125, "learning_rate": 0.0003112102369794153, "loss": 4.7895, "mean_token_accuracy": 0.22025570571422576, "num_tokens": 100932246.0, "step": 58200 }, { "entropy": 5.37579574584961, "epoch": 4.528535304415484, "grad_norm": 1.3046875, "learning_rate": 0.00031118288238684086, "loss": 4.7883, "mean_token_accuracy": 0.2188274383544922, "num_tokens": 100941517.0, "step": 58205 }, { "entropy": 5.35895266532898, "epoch": 4.5289243337872005, "grad_norm": 1.203125, "learning_rate": 0.0003111555272452486, "loss": 4.7565, "mean_token_accuracy": 0.22843674570322037, "num_tokens": 100949387.0, "step": 58210 }, { "entropy": 5.311302995681762, "epoch": 4.529313363158918, "grad_norm": 1.0390625, "learning_rate": 0.00031112817155505394, "loss": 4.7089, "mean_token_accuracy": 0.2280023068189621, "num_tokens": 100958488.0, "step": 58215 }, { "entropy": 5.401602697372437, "epoch": 4.529702392530636, "grad_norm": 1.1875, "learning_rate": 0.00031110081531667184, "loss": 4.8155, "mean_token_accuracy": 0.22135763466358185, "num_tokens": 100966709.0, "step": 58220 }, { "entropy": 5.3420384407043455, "epoch": 4.530091421902354, "grad_norm": 1.171875, "learning_rate": 0.00031107345853051714, "loss": 4.6867, "mean_token_accuracy": 0.22972368746995925, "num_tokens": 100975230.0, "step": 58225 }, { "entropy": 5.408716535568237, "epoch": 4.530480451274071, "grad_norm": 1.0859375, "learning_rate": 0.00031104610119700525, "loss": 4.8045, "mean_token_accuracy": 0.22842177748680115, "num_tokens": 100983845.0, "step": 58230 }, { "entropy": 5.378239440917969, "epoch": 4.530869480645789, "grad_norm": 1.1015625, "learning_rate": 0.0003110187433165511, "loss": 4.7761, "mean_token_accuracy": 0.22688053995370866, "num_tokens": 100993189.0, "step": 58235 }, { "entropy": 5.410401439666748, "epoch": 4.531258510017507, "grad_norm": 1.203125, "learning_rate": 0.0003109913848895699, "loss": 4.7672, "mean_token_accuracy": 0.22082017958164216, "num_tokens": 101001738.0, "step": 58240 }, { "entropy": 5.4208934783935545, "epoch": 4.531647539389224, "grad_norm": 1.2265625, "learning_rate": 0.0003109640259164766, "loss": 4.7267, "mean_token_accuracy": 0.22999136298894882, "num_tokens": 101009614.0, "step": 58245 }, { "entropy": 5.418928527832032, "epoch": 4.532036568760941, "grad_norm": 1.2109375, "learning_rate": 0.00031093666639768654, "loss": 4.8201, "mean_token_accuracy": 0.2128514438867569, "num_tokens": 101017953.0, "step": 58250 }, { "entropy": 5.3761701583862305, "epoch": 4.532425598132659, "grad_norm": 1.140625, "learning_rate": 0.0003109093063336147, "loss": 4.765, "mean_token_accuracy": 0.2330994799733162, "num_tokens": 101026214.0, "step": 58255 }, { "entropy": 5.366291618347168, "epoch": 4.532814627504377, "grad_norm": 1.0859375, "learning_rate": 0.0003108819457246764, "loss": 4.7578, "mean_token_accuracy": 0.22493016570806504, "num_tokens": 101035323.0, "step": 58260 }, { "entropy": 5.417659139633178, "epoch": 4.533203656876094, "grad_norm": 1.203125, "learning_rate": 0.00031085458457128667, "loss": 4.8118, "mean_token_accuracy": 0.21742163002490997, "num_tokens": 101044349.0, "step": 58265 }, { "entropy": 5.339498138427734, "epoch": 4.533592686247812, "grad_norm": 1.1328125, "learning_rate": 0.00031082722287386065, "loss": 4.7184, "mean_token_accuracy": 0.2315596118569374, "num_tokens": 101052964.0, "step": 58270 }, { "entropy": 5.394572973251343, "epoch": 4.533981715619529, "grad_norm": 1.203125, "learning_rate": 0.0003107998606328135, "loss": 4.7836, "mean_token_accuracy": 0.21632648557424544, "num_tokens": 101061696.0, "step": 58275 }, { "entropy": 5.35782265663147, "epoch": 4.5343707449912465, "grad_norm": 1.1171875, "learning_rate": 0.00031077249784856057, "loss": 4.7667, "mean_token_accuracy": 0.2224101424217224, "num_tokens": 101070651.0, "step": 58280 }, { "entropy": 5.410215377807617, "epoch": 4.534759774362964, "grad_norm": 1.1484375, "learning_rate": 0.00031074513452151683, "loss": 4.8694, "mean_token_accuracy": 0.22474585473537445, "num_tokens": 101079770.0, "step": 58285 }, { "entropy": 5.462438535690308, "epoch": 4.535148803734682, "grad_norm": 1.265625, "learning_rate": 0.0003107177706520975, "loss": 4.768, "mean_token_accuracy": 0.2227836385369301, "num_tokens": 101088262.0, "step": 58290 }, { "entropy": 5.382482194900513, "epoch": 4.5355378331064, "grad_norm": 1.1171875, "learning_rate": 0.000310690406240718, "loss": 4.8018, "mean_token_accuracy": 0.21591911017894744, "num_tokens": 101097448.0, "step": 58295 }, { "entropy": 5.400859594345093, "epoch": 4.535926862478117, "grad_norm": 1.2109375, "learning_rate": 0.00031066304128779336, "loss": 4.8555, "mean_token_accuracy": 0.2132144570350647, "num_tokens": 101106327.0, "step": 58300 }, { "entropy": 5.492597150802612, "epoch": 4.536315891849835, "grad_norm": 1.1640625, "learning_rate": 0.00031063567579373876, "loss": 4.9104, "mean_token_accuracy": 0.20826180875301362, "num_tokens": 101115183.0, "step": 58305 }, { "entropy": 5.417735052108765, "epoch": 4.536704921221553, "grad_norm": 1.1640625, "learning_rate": 0.00031060830975896954, "loss": 4.7157, "mean_token_accuracy": 0.23095286786556243, "num_tokens": 101123664.0, "step": 58310 }, { "entropy": 5.351444673538208, "epoch": 4.5370939505932695, "grad_norm": 1.2265625, "learning_rate": 0.00031058094318390085, "loss": 4.825, "mean_token_accuracy": 0.22114546746015548, "num_tokens": 101133277.0, "step": 58315 }, { "entropy": 5.4151404857635494, "epoch": 4.537482979964987, "grad_norm": 1.1875, "learning_rate": 0.00031055357606894806, "loss": 4.8194, "mean_token_accuracy": 0.22099029123783112, "num_tokens": 101141564.0, "step": 58320 }, { "entropy": 5.342559671401977, "epoch": 4.537872009336705, "grad_norm": 1.1484375, "learning_rate": 0.0003105262084145263, "loss": 4.6724, "mean_token_accuracy": 0.23135567605495452, "num_tokens": 101150373.0, "step": 58325 }, { "entropy": 5.401526212692261, "epoch": 4.538261038708423, "grad_norm": 1.234375, "learning_rate": 0.0003104988402210509, "loss": 4.805, "mean_token_accuracy": 0.22245359569787979, "num_tokens": 101159402.0, "step": 58330 }, { "entropy": 5.3302545070648195, "epoch": 4.53865006808014, "grad_norm": 1.09375, "learning_rate": 0.0003104714714889371, "loss": 4.6842, "mean_token_accuracy": 0.23220265954732894, "num_tokens": 101167990.0, "step": 58335 }, { "entropy": 5.405477285385132, "epoch": 4.539039097451858, "grad_norm": 1.25, "learning_rate": 0.00031044410221860017, "loss": 4.7996, "mean_token_accuracy": 0.2277314320206642, "num_tokens": 101176528.0, "step": 58340 }, { "entropy": 5.375904941558838, "epoch": 4.539428126823575, "grad_norm": 1.2265625, "learning_rate": 0.0003104167324104553, "loss": 4.7696, "mean_token_accuracy": 0.23114805519580842, "num_tokens": 101185364.0, "step": 58345 }, { "entropy": 5.4028733253479, "epoch": 4.5398171561952925, "grad_norm": 1.234375, "learning_rate": 0.00031038936206491803, "loss": 4.8213, "mean_token_accuracy": 0.22057699114084245, "num_tokens": 101193873.0, "step": 58350 }, { "entropy": 5.484736680984497, "epoch": 4.54020618556701, "grad_norm": 1.234375, "learning_rate": 0.0003103619911824035, "loss": 4.8819, "mean_token_accuracy": 0.21697301417589188, "num_tokens": 101202491.0, "step": 58355 }, { "entropy": 5.393422937393188, "epoch": 4.540595214938728, "grad_norm": 1.2265625, "learning_rate": 0.000310334619763327, "loss": 4.748, "mean_token_accuracy": 0.22058592289686202, "num_tokens": 101210011.0, "step": 58360 }, { "entropy": 5.372115230560302, "epoch": 4.540984244310446, "grad_norm": 1.171875, "learning_rate": 0.00031030724780810385, "loss": 4.7386, "mean_token_accuracy": 0.22441744804382324, "num_tokens": 101219027.0, "step": 58365 }, { "entropy": 5.3576085567474365, "epoch": 4.541373273682163, "grad_norm": 1.25, "learning_rate": 0.00031027987531714944, "loss": 4.8127, "mean_token_accuracy": 0.22582671493291856, "num_tokens": 101227553.0, "step": 58370 }, { "entropy": 5.336372804641724, "epoch": 4.541762303053881, "grad_norm": 1.15625, "learning_rate": 0.00031025250229087915, "loss": 4.7286, "mean_token_accuracy": 0.23139597922563554, "num_tokens": 101235859.0, "step": 58375 }, { "entropy": 5.306879663467408, "epoch": 4.542151332425598, "grad_norm": 1.125, "learning_rate": 0.00031022512872970823, "loss": 4.6496, "mean_token_accuracy": 0.23559586703777313, "num_tokens": 101244514.0, "step": 58380 }, { "entropy": 5.374550724029541, "epoch": 4.5425403617973155, "grad_norm": 1.125, "learning_rate": 0.000310197754634052, "loss": 4.7234, "mean_token_accuracy": 0.23451983630657197, "num_tokens": 101253148.0, "step": 58385 }, { "entropy": 5.35664963722229, "epoch": 4.542929391169033, "grad_norm": 1.40625, "learning_rate": 0.0003101703800043258, "loss": 4.7556, "mean_token_accuracy": 0.21944353580474854, "num_tokens": 101262372.0, "step": 58390 }, { "entropy": 5.404948568344116, "epoch": 4.543318420540751, "grad_norm": 1.234375, "learning_rate": 0.00031014300484094516, "loss": 4.7846, "mean_token_accuracy": 0.22497855573892594, "num_tokens": 101271560.0, "step": 58395 }, { "entropy": 5.409999132156372, "epoch": 4.5437074499124686, "grad_norm": 1.171875, "learning_rate": 0.0003101156291443254, "loss": 4.7952, "mean_token_accuracy": 0.23000595569610596, "num_tokens": 101279546.0, "step": 58400 }, { "entropy": 5.491427755355835, "epoch": 4.544096479284186, "grad_norm": 1.15625, "learning_rate": 0.0003100882529148817, "loss": 4.9136, "mean_token_accuracy": 0.21337536871433258, "num_tokens": 101288197.0, "step": 58405 }, { "entropy": 5.425955772399902, "epoch": 4.544485508655903, "grad_norm": 1.15625, "learning_rate": 0.00031006087615302976, "loss": 4.8656, "mean_token_accuracy": 0.21235856860876084, "num_tokens": 101297503.0, "step": 58410 }, { "entropy": 5.375863838195801, "epoch": 4.544874538027621, "grad_norm": 1.1484375, "learning_rate": 0.00031003349885918473, "loss": 4.7743, "mean_token_accuracy": 0.2260446399450302, "num_tokens": 101306629.0, "step": 58415 }, { "entropy": 5.333800983428955, "epoch": 4.5452635673993385, "grad_norm": 1.2109375, "learning_rate": 0.00031000612103376226, "loss": 4.7391, "mean_token_accuracy": 0.22388123869895935, "num_tokens": 101314556.0, "step": 58420 }, { "entropy": 5.440681457519531, "epoch": 4.545652596771056, "grad_norm": 1.1796875, "learning_rate": 0.0003099787426771775, "loss": 4.8037, "mean_token_accuracy": 0.22522311210632323, "num_tokens": 101322641.0, "step": 58425 }, { "entropy": 5.462031745910645, "epoch": 4.546041626142774, "grad_norm": 1.21875, "learning_rate": 0.000309951363789846, "loss": 4.8264, "mean_token_accuracy": 0.2190435454249382, "num_tokens": 101330941.0, "step": 58430 }, { "entropy": 5.293946075439453, "epoch": 4.5464306555144915, "grad_norm": 1.1640625, "learning_rate": 0.00030992398437218314, "loss": 4.7219, "mean_token_accuracy": 0.22934822887182235, "num_tokens": 101339898.0, "step": 58435 }, { "entropy": 5.371078395843506, "epoch": 4.546819684886209, "grad_norm": 1.3125, "learning_rate": 0.0003098966044246045, "loss": 4.749, "mean_token_accuracy": 0.22495688498020172, "num_tokens": 101348964.0, "step": 58440 }, { "entropy": 5.43597378730774, "epoch": 4.547208714257927, "grad_norm": 1.203125, "learning_rate": 0.00030986922394752534, "loss": 4.8647, "mean_token_accuracy": 0.21258753687143325, "num_tokens": 101358550.0, "step": 58445 }, { "entropy": 5.363087320327759, "epoch": 4.547597743629644, "grad_norm": 1.1328125, "learning_rate": 0.00030984184294136134, "loss": 4.7369, "mean_token_accuracy": 0.23031437247991562, "num_tokens": 101367306.0, "step": 58450 }, { "entropy": 5.3149699687957765, "epoch": 4.5479867730013614, "grad_norm": 1.21875, "learning_rate": 0.00030981446140652773, "loss": 4.6904, "mean_token_accuracy": 0.22936820536851882, "num_tokens": 101375166.0, "step": 58455 }, { "entropy": 5.29676570892334, "epoch": 4.548375802373079, "grad_norm": 1.2265625, "learning_rate": 0.00030978707934344014, "loss": 4.6955, "mean_token_accuracy": 0.22530278712511062, "num_tokens": 101383257.0, "step": 58460 }, { "entropy": 5.347620868682862, "epoch": 4.548764831744797, "grad_norm": 1.25, "learning_rate": 0.000309759696752514, "loss": 4.762, "mean_token_accuracy": 0.21836528927087784, "num_tokens": 101391645.0, "step": 58465 }, { "entropy": 5.339993667602539, "epoch": 4.5491538611165145, "grad_norm": 1.234375, "learning_rate": 0.0003097323136341647, "loss": 4.6664, "mean_token_accuracy": 0.2246425434947014, "num_tokens": 101400439.0, "step": 58470 }, { "entropy": 5.349112129211425, "epoch": 4.549542890488232, "grad_norm": 1.1171875, "learning_rate": 0.0003097049299888078, "loss": 4.7712, "mean_token_accuracy": 0.22329528927803038, "num_tokens": 101408197.0, "step": 58475 }, { "entropy": 5.372624254226684, "epoch": 4.549931919859949, "grad_norm": 1.2734375, "learning_rate": 0.0003096775458168589, "loss": 4.7805, "mean_token_accuracy": 0.2206585094332695, "num_tokens": 101416537.0, "step": 58480 }, { "entropy": 5.344941711425781, "epoch": 4.550320949231667, "grad_norm": 1.1953125, "learning_rate": 0.00030965016111873345, "loss": 4.7497, "mean_token_accuracy": 0.22840164303779603, "num_tokens": 101425215.0, "step": 58485 }, { "entropy": 5.384683656692505, "epoch": 4.550709978603384, "grad_norm": 1.1875, "learning_rate": 0.00030962277589484697, "loss": 4.8012, "mean_token_accuracy": 0.21754027605056764, "num_tokens": 101434177.0, "step": 58490 }, { "entropy": 5.358398532867431, "epoch": 4.551099007975102, "grad_norm": 1.2421875, "learning_rate": 0.00030959539014561494, "loss": 4.7942, "mean_token_accuracy": 0.22111717909574508, "num_tokens": 101443270.0, "step": 58495 }, { "entropy": 5.4394614696502686, "epoch": 4.55148803734682, "grad_norm": 1.171875, "learning_rate": 0.00030956800387145294, "loss": 4.8082, "mean_token_accuracy": 0.22035863250494003, "num_tokens": 101451860.0, "step": 58500 }, { "entropy": 5.375517416000366, "epoch": 4.5518770667185375, "grad_norm": 1.2734375, "learning_rate": 0.00030954061707277647, "loss": 4.6996, "mean_token_accuracy": 0.233867147564888, "num_tokens": 101460566.0, "step": 58505 }, { "entropy": 5.361736154556274, "epoch": 4.552266096090255, "grad_norm": 1.1796875, "learning_rate": 0.0003095132297500011, "loss": 4.8488, "mean_token_accuracy": 0.2174581378698349, "num_tokens": 101469650.0, "step": 58510 }, { "entropy": 5.384230470657348, "epoch": 4.552655125461972, "grad_norm": 1.28125, "learning_rate": 0.00030948584190354246, "loss": 4.7019, "mean_token_accuracy": 0.22824659794569016, "num_tokens": 101477840.0, "step": 58515 }, { "entropy": 5.43159441947937, "epoch": 4.55304415483369, "grad_norm": 1.1875, "learning_rate": 0.000309458453533816, "loss": 4.8281, "mean_token_accuracy": 0.22008295655250548, "num_tokens": 101486174.0, "step": 58520 }, { "entropy": 5.371632146835327, "epoch": 4.553433184205407, "grad_norm": 1.1328125, "learning_rate": 0.00030943106464123744, "loss": 4.7674, "mean_token_accuracy": 0.2267102539539337, "num_tokens": 101495108.0, "step": 58525 }, { "entropy": 5.326167917251587, "epoch": 4.553822213577125, "grad_norm": 1.15625, "learning_rate": 0.00030940367522622224, "loss": 4.7503, "mean_token_accuracy": 0.22753020673990249, "num_tokens": 101503690.0, "step": 58530 }, { "entropy": 5.439635753631592, "epoch": 4.554211242948843, "grad_norm": 1.234375, "learning_rate": 0.000309376285289186, "loss": 4.8356, "mean_token_accuracy": 0.21505067944526673, "num_tokens": 101512227.0, "step": 58535 }, { "entropy": 5.408129739761352, "epoch": 4.5546002723205605, "grad_norm": 1.203125, "learning_rate": 0.00030934889483054433, "loss": 4.771, "mean_token_accuracy": 0.21732620000839234, "num_tokens": 101521258.0, "step": 58540 }, { "entropy": 5.415787982940674, "epoch": 4.554989301692277, "grad_norm": 1.1328125, "learning_rate": 0.0003093215038507129, "loss": 4.8183, "mean_token_accuracy": 0.21869875192642213, "num_tokens": 101530327.0, "step": 58545 }, { "entropy": 5.451783084869385, "epoch": 4.555378331063995, "grad_norm": 1.1328125, "learning_rate": 0.0003092941123501073, "loss": 4.8865, "mean_token_accuracy": 0.21311419159173967, "num_tokens": 101538969.0, "step": 58550 }, { "entropy": 5.473888540267945, "epoch": 4.555767360435713, "grad_norm": 1.25, "learning_rate": 0.00030926672032914306, "loss": 4.8781, "mean_token_accuracy": 0.20768835693597792, "num_tokens": 101547945.0, "step": 58555 }, { "entropy": 5.44500412940979, "epoch": 4.55615638980743, "grad_norm": 1.1953125, "learning_rate": 0.0003092393277882359, "loss": 4.7755, "mean_token_accuracy": 0.22230335921049119, "num_tokens": 101556080.0, "step": 58560 }, { "entropy": 5.351024007797241, "epoch": 4.556545419179148, "grad_norm": 1.1484375, "learning_rate": 0.00030921193472780144, "loss": 4.7393, "mean_token_accuracy": 0.22503097951412201, "num_tokens": 101564301.0, "step": 58565 }, { "entropy": 5.339399242401123, "epoch": 4.556934448550866, "grad_norm": 1.3828125, "learning_rate": 0.0003091845411482554, "loss": 4.7955, "mean_token_accuracy": 0.23197293281555176, "num_tokens": 101573458.0, "step": 58570 }, { "entropy": 5.381864452362061, "epoch": 4.5573234779225835, "grad_norm": 1.1640625, "learning_rate": 0.00030915714705001323, "loss": 4.7427, "mean_token_accuracy": 0.22622648924589156, "num_tokens": 101582507.0, "step": 58575 }, { "entropy": 5.334383630752564, "epoch": 4.557712507294301, "grad_norm": 1.2109375, "learning_rate": 0.0003091297524334908, "loss": 4.7229, "mean_token_accuracy": 0.22965901345014572, "num_tokens": 101591341.0, "step": 58580 }, { "entropy": 5.415007781982422, "epoch": 4.558101536666018, "grad_norm": 1.1796875, "learning_rate": 0.0003091023572991036, "loss": 4.8827, "mean_token_accuracy": 0.2142559051513672, "num_tokens": 101599945.0, "step": 58585 }, { "entropy": 5.426520442962646, "epoch": 4.558490566037736, "grad_norm": 1.28125, "learning_rate": 0.0003090749616472675, "loss": 4.8172, "mean_token_accuracy": 0.2246808663010597, "num_tokens": 101608186.0, "step": 58590 }, { "entropy": 5.39422721862793, "epoch": 4.558879595409453, "grad_norm": 1.3125, "learning_rate": 0.0003090475654783981, "loss": 4.7907, "mean_token_accuracy": 0.2310628205537796, "num_tokens": 101616591.0, "step": 58595 }, { "entropy": 5.420369100570679, "epoch": 4.559268624781171, "grad_norm": 1.1015625, "learning_rate": 0.0003090201687929111, "loss": 4.8788, "mean_token_accuracy": 0.22207229286432267, "num_tokens": 101625410.0, "step": 58600 }, { "entropy": 5.421879386901855, "epoch": 4.559657654152889, "grad_norm": 1.1640625, "learning_rate": 0.00030899277159122213, "loss": 4.7687, "mean_token_accuracy": 0.21609336286783218, "num_tokens": 101633320.0, "step": 58605 }, { "entropy": 5.419233512878418, "epoch": 4.560046683524606, "grad_norm": 1.1484375, "learning_rate": 0.00030896537387374703, "loss": 4.8402, "mean_token_accuracy": 0.22356653213500977, "num_tokens": 101642043.0, "step": 58610 }, { "entropy": 5.434904527664185, "epoch": 4.560435712896323, "grad_norm": 1.296875, "learning_rate": 0.00030893797564090136, "loss": 4.8486, "mean_token_accuracy": 0.21413152366876603, "num_tokens": 101650479.0, "step": 58615 }, { "entropy": 5.407833433151245, "epoch": 4.560824742268041, "grad_norm": 1.203125, "learning_rate": 0.00030891057689310097, "loss": 4.7708, "mean_token_accuracy": 0.22305862009525299, "num_tokens": 101660412.0, "step": 58620 }, { "entropy": 5.497016477584839, "epoch": 4.561213771639759, "grad_norm": 1.203125, "learning_rate": 0.0003088831776307616, "loss": 4.9228, "mean_token_accuracy": 0.21400541812181473, "num_tokens": 101668845.0, "step": 58625 }, { "entropy": 5.428175926208496, "epoch": 4.561602801011476, "grad_norm": 1.1875, "learning_rate": 0.00030885577785429885, "loss": 4.7964, "mean_token_accuracy": 0.22050926834344864, "num_tokens": 101677443.0, "step": 58630 }, { "entropy": 5.382854032516479, "epoch": 4.561991830383194, "grad_norm": 1.2109375, "learning_rate": 0.0003088283775641286, "loss": 4.7696, "mean_token_accuracy": 0.2241586998105049, "num_tokens": 101685421.0, "step": 58635 }, { "entropy": 5.372738456726074, "epoch": 4.562380859754912, "grad_norm": 1.25, "learning_rate": 0.00030880097676066646, "loss": 4.7493, "mean_token_accuracy": 0.2297380656003952, "num_tokens": 101694362.0, "step": 58640 }, { "entropy": 5.397185325622559, "epoch": 4.5627698891266295, "grad_norm": 1.1171875, "learning_rate": 0.0003087735754443285, "loss": 4.8125, "mean_token_accuracy": 0.22512245178222656, "num_tokens": 101703504.0, "step": 58645 }, { "entropy": 5.359457778930664, "epoch": 4.563158918498346, "grad_norm": 1.234375, "learning_rate": 0.0003087461736155301, "loss": 4.6197, "mean_token_accuracy": 0.2305836036801338, "num_tokens": 101712044.0, "step": 58650 }, { "entropy": 5.344888496398926, "epoch": 4.563547947870064, "grad_norm": 1.2421875, "learning_rate": 0.0003087187712746873, "loss": 4.6392, "mean_token_accuracy": 0.23510736227035522, "num_tokens": 101720592.0, "step": 58655 }, { "entropy": 5.377733993530273, "epoch": 4.563936977241782, "grad_norm": 1.171875, "learning_rate": 0.0003086913684222159, "loss": 4.8336, "mean_token_accuracy": 0.22147910594940184, "num_tokens": 101729286.0, "step": 58660 }, { "entropy": 5.433221101760864, "epoch": 4.564326006613499, "grad_norm": 1.421875, "learning_rate": 0.0003086639650585315, "loss": 4.8306, "mean_token_accuracy": 0.22062344700098038, "num_tokens": 101738356.0, "step": 58665 }, { "entropy": 5.3957380771636965, "epoch": 4.564715035985217, "grad_norm": 1.21875, "learning_rate": 0.00030863656118405007, "loss": 4.7896, "mean_token_accuracy": 0.21831643730401992, "num_tokens": 101746610.0, "step": 58670 }, { "entropy": 5.412343311309814, "epoch": 4.565104065356935, "grad_norm": 1.21875, "learning_rate": 0.00030860915679918724, "loss": 4.7961, "mean_token_accuracy": 0.222471784055233, "num_tokens": 101755541.0, "step": 58675 }, { "entropy": 5.437191200256348, "epoch": 4.565493094728652, "grad_norm": 1.28125, "learning_rate": 0.00030858175190435913, "loss": 4.8482, "mean_token_accuracy": 0.2153368577361107, "num_tokens": 101764573.0, "step": 58680 }, { "entropy": 5.465342330932617, "epoch": 4.565882124100369, "grad_norm": 1.1484375, "learning_rate": 0.0003085543464999813, "loss": 4.8106, "mean_token_accuracy": 0.22372996658086777, "num_tokens": 101773261.0, "step": 58685 }, { "entropy": 5.42166428565979, "epoch": 4.566271153472087, "grad_norm": 1.234375, "learning_rate": 0.0003085269405864697, "loss": 4.7997, "mean_token_accuracy": 0.22234020084142686, "num_tokens": 101781579.0, "step": 58690 }, { "entropy": 5.405756139755249, "epoch": 4.566660182843805, "grad_norm": 1.2109375, "learning_rate": 0.0003084995341642401, "loss": 4.7692, "mean_token_accuracy": 0.22910643368959427, "num_tokens": 101790976.0, "step": 58695 }, { "entropy": 5.435870885848999, "epoch": 4.567049212215522, "grad_norm": 1.1640625, "learning_rate": 0.0003084721272337084, "loss": 4.8183, "mean_token_accuracy": 0.21318754851818084, "num_tokens": 101799276.0, "step": 58700 }, { "entropy": 5.405096101760864, "epoch": 4.56743824158724, "grad_norm": 1.2421875, "learning_rate": 0.0003084447197952904, "loss": 4.8419, "mean_token_accuracy": 0.22381850630044936, "num_tokens": 101807621.0, "step": 58705 }, { "entropy": 5.401069402694702, "epoch": 4.567827270958958, "grad_norm": 1.25, "learning_rate": 0.00030841731184940205, "loss": 4.7855, "mean_token_accuracy": 0.21901678442955017, "num_tokens": 101816355.0, "step": 58710 }, { "entropy": 5.374290990829468, "epoch": 4.568216300330675, "grad_norm": 1.2734375, "learning_rate": 0.00030838990339645915, "loss": 4.6567, "mean_token_accuracy": 0.23098761290311814, "num_tokens": 101824509.0, "step": 58715 }, { "entropy": 5.326511335372925, "epoch": 4.568605329702392, "grad_norm": 1.2421875, "learning_rate": 0.00030836249443687774, "loss": 4.7342, "mean_token_accuracy": 0.23187603503465654, "num_tokens": 101832558.0, "step": 58720 }, { "entropy": 5.387884330749512, "epoch": 4.56899435907411, "grad_norm": 1.15625, "learning_rate": 0.00030833508497107344, "loss": 4.7613, "mean_token_accuracy": 0.23114885985851288, "num_tokens": 101840719.0, "step": 58725 }, { "entropy": 5.454538345336914, "epoch": 4.569383388445828, "grad_norm": 1.171875, "learning_rate": 0.0003083076749994623, "loss": 4.8613, "mean_token_accuracy": 0.21562547236680984, "num_tokens": 101848996.0, "step": 58730 }, { "entropy": 5.443039846420288, "epoch": 4.569772417817545, "grad_norm": 1.1484375, "learning_rate": 0.0003082802645224603, "loss": 4.7928, "mean_token_accuracy": 0.2177319809794426, "num_tokens": 101857831.0, "step": 58735 }, { "entropy": 5.416802644729614, "epoch": 4.570161447189263, "grad_norm": 1.171875, "learning_rate": 0.0003082528535404832, "loss": 4.8477, "mean_token_accuracy": 0.22361548990011215, "num_tokens": 101866321.0, "step": 58740 }, { "entropy": 5.381209087371826, "epoch": 4.57055047656098, "grad_norm": 1.25, "learning_rate": 0.00030822544205394686, "loss": 4.8359, "mean_token_accuracy": 0.21768156588077545, "num_tokens": 101875711.0, "step": 58745 }, { "entropy": 5.443686008453369, "epoch": 4.570939505932698, "grad_norm": 1.2265625, "learning_rate": 0.00030819803006326745, "loss": 4.8062, "mean_token_accuracy": 0.22209957391023635, "num_tokens": 101884631.0, "step": 58750 }, { "entropy": 5.3167304515838625, "epoch": 4.571328535304415, "grad_norm": 1.125, "learning_rate": 0.00030817061756886077, "loss": 4.6176, "mean_token_accuracy": 0.22973824441432952, "num_tokens": 101893195.0, "step": 58755 }, { "entropy": 5.418706607818604, "epoch": 4.571717564676133, "grad_norm": 1.15625, "learning_rate": 0.00030814320457114283, "loss": 4.8079, "mean_token_accuracy": 0.22279595583677292, "num_tokens": 101901886.0, "step": 58760 }, { "entropy": 5.406677675247193, "epoch": 4.572106594047851, "grad_norm": 1.234375, "learning_rate": 0.00030811579107052937, "loss": 4.8012, "mean_token_accuracy": 0.22246210873126984, "num_tokens": 101910432.0, "step": 58765 }, { "entropy": 5.347889518737793, "epoch": 4.572495623419568, "grad_norm": 1.125, "learning_rate": 0.00030808837706743666, "loss": 4.7201, "mean_token_accuracy": 0.2269265204668045, "num_tokens": 101919271.0, "step": 58770 }, { "entropy": 5.395749807357788, "epoch": 4.572884652791286, "grad_norm": 1.171875, "learning_rate": 0.0003080609625622803, "loss": 4.7677, "mean_token_accuracy": 0.2205295369029045, "num_tokens": 101927684.0, "step": 58775 }, { "entropy": 5.342611360549927, "epoch": 4.573273682163004, "grad_norm": 1.1640625, "learning_rate": 0.00030803354755547653, "loss": 4.7301, "mean_token_accuracy": 0.23668060898780824, "num_tokens": 101936286.0, "step": 58780 }, { "entropy": 5.397234535217285, "epoch": 4.573662711534721, "grad_norm": 1.1953125, "learning_rate": 0.0003080061320474412, "loss": 4.7735, "mean_token_accuracy": 0.22345242500305176, "num_tokens": 101944884.0, "step": 58785 }, { "entropy": 5.370807075500489, "epoch": 4.574051740906438, "grad_norm": 1.1953125, "learning_rate": 0.0003079787160385905, "loss": 4.7191, "mean_token_accuracy": 0.223422609269619, "num_tokens": 101952717.0, "step": 58790 }, { "entropy": 5.368356704711914, "epoch": 4.574440770278156, "grad_norm": 1.2109375, "learning_rate": 0.0003079512995293402, "loss": 4.7403, "mean_token_accuracy": 0.23128392547369003, "num_tokens": 101961520.0, "step": 58795 }, { "entropy": 5.381726408004761, "epoch": 4.574829799649874, "grad_norm": 1.203125, "learning_rate": 0.0003079238825201064, "loss": 4.8285, "mean_token_accuracy": 0.22042268812656401, "num_tokens": 101970327.0, "step": 58800 }, { "entropy": 5.4600725173950195, "epoch": 4.575218829021591, "grad_norm": 1.1875, "learning_rate": 0.000307896465011305, "loss": 4.848, "mean_token_accuracy": 0.2149516835808754, "num_tokens": 101978788.0, "step": 58805 }, { "entropy": 5.330757331848145, "epoch": 4.575607858393309, "grad_norm": 1.2421875, "learning_rate": 0.00030786904700335217, "loss": 4.6571, "mean_token_accuracy": 0.232748444378376, "num_tokens": 101986815.0, "step": 58810 }, { "entropy": 5.450636529922486, "epoch": 4.575996887765026, "grad_norm": 1.15625, "learning_rate": 0.0003078416284966639, "loss": 4.8957, "mean_token_accuracy": 0.2180438295006752, "num_tokens": 101996441.0, "step": 58815 }, { "entropy": 5.407009220123291, "epoch": 4.576385917136744, "grad_norm": 1.2109375, "learning_rate": 0.00030781420949165607, "loss": 4.7719, "mean_token_accuracy": 0.2268631175160408, "num_tokens": 102004711.0, "step": 58820 }, { "entropy": 5.380636930465698, "epoch": 4.576774946508461, "grad_norm": 1.171875, "learning_rate": 0.00030778678998874494, "loss": 4.7145, "mean_token_accuracy": 0.23312707096338273, "num_tokens": 102013190.0, "step": 58825 }, { "entropy": 5.38257327079773, "epoch": 4.577163975880179, "grad_norm": 1.1015625, "learning_rate": 0.0003077593699883465, "loss": 4.7584, "mean_token_accuracy": 0.21515025049448014, "num_tokens": 102022330.0, "step": 58830 }, { "entropy": 5.361949634552002, "epoch": 4.577553005251897, "grad_norm": 1.1875, "learning_rate": 0.00030773194949087665, "loss": 4.7573, "mean_token_accuracy": 0.22889523953199387, "num_tokens": 102030689.0, "step": 58835 }, { "entropy": 5.438253593444824, "epoch": 4.577942034623614, "grad_norm": 1.2578125, "learning_rate": 0.0003077045284967516, "loss": 4.8654, "mean_token_accuracy": 0.21740335673093797, "num_tokens": 102039496.0, "step": 58840 }, { "entropy": 5.39219069480896, "epoch": 4.578331063995332, "grad_norm": 1.171875, "learning_rate": 0.0003076771070063874, "loss": 4.7693, "mean_token_accuracy": 0.2261998772621155, "num_tokens": 102048406.0, "step": 58845 }, { "entropy": 5.41925163269043, "epoch": 4.578720093367049, "grad_norm": 1.1953125, "learning_rate": 0.0003076496850202001, "loss": 4.7101, "mean_token_accuracy": 0.23082437515258789, "num_tokens": 102057188.0, "step": 58850 }, { "entropy": 5.327297306060791, "epoch": 4.579109122738767, "grad_norm": 1.125, "learning_rate": 0.00030762226253860584, "loss": 4.7263, "mean_token_accuracy": 0.22330184131860734, "num_tokens": 102066231.0, "step": 58855 }, { "entropy": 5.4057886600494385, "epoch": 4.579498152110484, "grad_norm": 1.25, "learning_rate": 0.0003075948395620206, "loss": 4.7619, "mean_token_accuracy": 0.22150541841983795, "num_tokens": 102074345.0, "step": 58860 }, { "entropy": 5.441884756088257, "epoch": 4.579887181482202, "grad_norm": 1.1796875, "learning_rate": 0.00030756741609086057, "loss": 4.73, "mean_token_accuracy": 0.2274385869503021, "num_tokens": 102083887.0, "step": 58865 }, { "entropy": 5.470286083221436, "epoch": 4.58027621085392, "grad_norm": 1.2578125, "learning_rate": 0.00030753999212554183, "loss": 4.8535, "mean_token_accuracy": 0.2109972208738327, "num_tokens": 102092625.0, "step": 58870 }, { "entropy": 5.375290966033935, "epoch": 4.580665240225637, "grad_norm": 1.171875, "learning_rate": 0.0003075125676664806, "loss": 4.7604, "mean_token_accuracy": 0.22446558028459548, "num_tokens": 102101904.0, "step": 58875 }, { "entropy": 5.306251478195191, "epoch": 4.581054269597354, "grad_norm": 1.171875, "learning_rate": 0.0003074851427140928, "loss": 4.762, "mean_token_accuracy": 0.21854794919490814, "num_tokens": 102110407.0, "step": 58880 }, { "entropy": 5.359929990768433, "epoch": 4.581443298969072, "grad_norm": 1.1640625, "learning_rate": 0.00030745771726879467, "loss": 4.7329, "mean_token_accuracy": 0.22457651942968368, "num_tokens": 102119046.0, "step": 58885 }, { "entropy": 5.453454637527466, "epoch": 4.58183232834079, "grad_norm": 1.0859375, "learning_rate": 0.0003074302913310024, "loss": 4.8461, "mean_token_accuracy": 0.21435781568288803, "num_tokens": 102128262.0, "step": 58890 }, { "entropy": 5.400657272338867, "epoch": 4.582221357712507, "grad_norm": 1.1328125, "learning_rate": 0.000307402864901132, "loss": 4.8039, "mean_token_accuracy": 0.2247469574213028, "num_tokens": 102136660.0, "step": 58895 }, { "entropy": 5.356222009658813, "epoch": 4.582610387084225, "grad_norm": 1.1484375, "learning_rate": 0.0003073754379795998, "loss": 4.7814, "mean_token_accuracy": 0.22670048773288726, "num_tokens": 102146039.0, "step": 58900 }, { "entropy": 5.382696580886841, "epoch": 4.582999416455943, "grad_norm": 1.203125, "learning_rate": 0.00030734801056682176, "loss": 4.7613, "mean_token_accuracy": 0.2263263449072838, "num_tokens": 102154561.0, "step": 58905 }, { "entropy": 5.466377115249633, "epoch": 4.58338844582766, "grad_norm": 1.203125, "learning_rate": 0.00030732058266321415, "loss": 4.8468, "mean_token_accuracy": 0.21772095412015915, "num_tokens": 102163652.0, "step": 58910 }, { "entropy": 5.505028104782104, "epoch": 4.583777475199377, "grad_norm": 1.15625, "learning_rate": 0.0003072931542691932, "loss": 4.7687, "mean_token_accuracy": 0.22600067853927613, "num_tokens": 102172557.0, "step": 58915 }, { "entropy": 5.417150259017944, "epoch": 4.584166504571095, "grad_norm": 1.2265625, "learning_rate": 0.000307265725385175, "loss": 4.7907, "mean_token_accuracy": 0.22122683823108674, "num_tokens": 102181793.0, "step": 58920 }, { "entropy": 5.354289627075195, "epoch": 4.584555533942813, "grad_norm": 1.28125, "learning_rate": 0.0003072382960115758, "loss": 4.7516, "mean_token_accuracy": 0.2292405441403389, "num_tokens": 102190988.0, "step": 58925 }, { "entropy": 5.353587055206299, "epoch": 4.58494456331453, "grad_norm": 1.1640625, "learning_rate": 0.00030721086614881183, "loss": 4.7147, "mean_token_accuracy": 0.22879569381475448, "num_tokens": 102200217.0, "step": 58930 }, { "entropy": 5.376117277145386, "epoch": 4.585333592686248, "grad_norm": 1.1484375, "learning_rate": 0.0003071834357972991, "loss": 4.6702, "mean_token_accuracy": 0.23176377713680268, "num_tokens": 102209322.0, "step": 58935 }, { "entropy": 5.385023832321167, "epoch": 4.585722622057966, "grad_norm": 1.140625, "learning_rate": 0.000307156004957454, "loss": 4.7244, "mean_token_accuracy": 0.2259310245513916, "num_tokens": 102218943.0, "step": 58940 }, { "entropy": 5.375421237945557, "epoch": 4.5861116514296825, "grad_norm": 1.171875, "learning_rate": 0.0003071285736296928, "loss": 4.7198, "mean_token_accuracy": 0.23241844028234482, "num_tokens": 102227769.0, "step": 58945 }, { "entropy": 5.3893256187438965, "epoch": 4.5865006808014, "grad_norm": 1.1875, "learning_rate": 0.0003071011418144315, "loss": 4.7705, "mean_token_accuracy": 0.22214339971542357, "num_tokens": 102235885.0, "step": 58950 }, { "entropy": 5.359109163284302, "epoch": 4.586889710173118, "grad_norm": 1.1484375, "learning_rate": 0.00030707370951208655, "loss": 4.7633, "mean_token_accuracy": 0.2270162045955658, "num_tokens": 102244854.0, "step": 58955 }, { "entropy": 5.40849666595459, "epoch": 4.587278739544836, "grad_norm": 1.1875, "learning_rate": 0.0003070462767230741, "loss": 4.7744, "mean_token_accuracy": 0.22259124517440795, "num_tokens": 102253576.0, "step": 58960 }, { "entropy": 5.439527177810669, "epoch": 4.587667768916553, "grad_norm": 1.2109375, "learning_rate": 0.0003070188434478104, "loss": 4.8589, "mean_token_accuracy": 0.21885799914598464, "num_tokens": 102261649.0, "step": 58965 }, { "entropy": 5.367828130722046, "epoch": 4.588056798288271, "grad_norm": 1.2578125, "learning_rate": 0.0003069914096867117, "loss": 4.6932, "mean_token_accuracy": 0.22745512723922728, "num_tokens": 102270138.0, "step": 58970 }, { "entropy": 5.34058895111084, "epoch": 4.588445827659989, "grad_norm": 1.1875, "learning_rate": 0.0003069639754401942, "loss": 4.7532, "mean_token_accuracy": 0.22583162933588027, "num_tokens": 102278056.0, "step": 58975 }, { "entropy": 5.42393651008606, "epoch": 4.588834857031706, "grad_norm": 1.203125, "learning_rate": 0.0003069365407086744, "loss": 4.8319, "mean_token_accuracy": 0.21723568737506865, "num_tokens": 102287037.0, "step": 58980 }, { "entropy": 5.48359522819519, "epoch": 4.589223886403423, "grad_norm": 1.1953125, "learning_rate": 0.00030690910549256836, "loss": 4.808, "mean_token_accuracy": 0.22290144115686417, "num_tokens": 102295435.0, "step": 58985 }, { "entropy": 5.4370780944824215, "epoch": 4.589612915775141, "grad_norm": 1.1875, "learning_rate": 0.0003068816697922925, "loss": 4.8065, "mean_token_accuracy": 0.2203659862279892, "num_tokens": 102304153.0, "step": 58990 }, { "entropy": 5.406552696228028, "epoch": 4.5900019451468586, "grad_norm": 1.2578125, "learning_rate": 0.0003068542336082629, "loss": 4.8237, "mean_token_accuracy": 0.22332260608673096, "num_tokens": 102312514.0, "step": 58995 }, { "entropy": 5.398936080932617, "epoch": 4.590390974518576, "grad_norm": 1.1953125, "learning_rate": 0.00030682679694089615, "loss": 4.7755, "mean_token_accuracy": 0.22708785831928252, "num_tokens": 102321480.0, "step": 59000 }, { "entropy": 5.474066257476807, "epoch": 4.590780003890294, "grad_norm": 1.1953125, "learning_rate": 0.0003067993597906083, "loss": 4.866, "mean_token_accuracy": 0.21117934584617615, "num_tokens": 102329451.0, "step": 59005 }, { "entropy": 5.413908958435059, "epoch": 4.591169033262012, "grad_norm": 1.1484375, "learning_rate": 0.0003067719221578158, "loss": 4.803, "mean_token_accuracy": 0.22612608671188356, "num_tokens": 102338020.0, "step": 59010 }, { "entropy": 5.3281008243560795, "epoch": 4.5915580626337285, "grad_norm": 1.1171875, "learning_rate": 0.000306744484042935, "loss": 4.6907, "mean_token_accuracy": 0.2314828872680664, "num_tokens": 102346749.0, "step": 59015 }, { "entropy": 5.460558462142944, "epoch": 4.591947092005446, "grad_norm": 1.265625, "learning_rate": 0.0003067170454463822, "loss": 4.8693, "mean_token_accuracy": 0.2255280002951622, "num_tokens": 102354915.0, "step": 59020 }, { "entropy": 5.4052471160888675, "epoch": 4.592336121377164, "grad_norm": 1.15625, "learning_rate": 0.00030668960636857364, "loss": 4.7286, "mean_token_accuracy": 0.22246203422546387, "num_tokens": 102363682.0, "step": 59025 }, { "entropy": 5.426143550872803, "epoch": 4.5927251507488815, "grad_norm": 1.1953125, "learning_rate": 0.0003066621668099258, "loss": 4.7356, "mean_token_accuracy": 0.2227473884820938, "num_tokens": 102371421.0, "step": 59030 }, { "entropy": 5.333470964431763, "epoch": 4.593114180120599, "grad_norm": 1.171875, "learning_rate": 0.00030663472677085494, "loss": 4.7461, "mean_token_accuracy": 0.22326613664627076, "num_tokens": 102380204.0, "step": 59035 }, { "entropy": 5.306757402420044, "epoch": 4.593503209492317, "grad_norm": 1.2109375, "learning_rate": 0.00030660728625177746, "loss": 4.6638, "mean_token_accuracy": 0.22726166844367982, "num_tokens": 102388877.0, "step": 59040 }, { "entropy": 5.40672869682312, "epoch": 4.593892238864035, "grad_norm": 1.1484375, "learning_rate": 0.0003065798452531097, "loss": 4.8394, "mean_token_accuracy": 0.21499379128217697, "num_tokens": 102397608.0, "step": 59045 }, { "entropy": 5.464392566680909, "epoch": 4.5942812682357514, "grad_norm": 1.3359375, "learning_rate": 0.00030655240377526813, "loss": 4.8597, "mean_token_accuracy": 0.2227764144539833, "num_tokens": 102406458.0, "step": 59050 }, { "entropy": 5.393937826156616, "epoch": 4.594670297607469, "grad_norm": 1.1171875, "learning_rate": 0.000306524961818669, "loss": 4.7471, "mean_token_accuracy": 0.2202335849404335, "num_tokens": 102415351.0, "step": 59055 }, { "entropy": 5.4614198207855225, "epoch": 4.595059326979187, "grad_norm": 1.1484375, "learning_rate": 0.0003064975193837287, "loss": 4.8174, "mean_token_accuracy": 0.2166559636592865, "num_tokens": 102423442.0, "step": 59060 }, { "entropy": 5.516652011871338, "epoch": 4.5954483563509045, "grad_norm": 1.234375, "learning_rate": 0.0003064700764708638, "loss": 4.8601, "mean_token_accuracy": 0.21895045787096024, "num_tokens": 102431780.0, "step": 59065 }, { "entropy": 5.441657543182373, "epoch": 4.595837385722622, "grad_norm": 1.1796875, "learning_rate": 0.00030644263308049046, "loss": 4.8162, "mean_token_accuracy": 0.22027312517166137, "num_tokens": 102440298.0, "step": 59070 }, { "entropy": 5.430720710754395, "epoch": 4.59622641509434, "grad_norm": 1.203125, "learning_rate": 0.0003064151892130252, "loss": 4.7657, "mean_token_accuracy": 0.22761312872171402, "num_tokens": 102449002.0, "step": 59075 }, { "entropy": 5.447211599349975, "epoch": 4.596615444466057, "grad_norm": 1.1796875, "learning_rate": 0.0003063877448688846, "loss": 4.7641, "mean_token_accuracy": 0.22692374289035797, "num_tokens": 102457171.0, "step": 59080 }, { "entropy": 5.460038089752198, "epoch": 4.597004473837774, "grad_norm": 1.1328125, "learning_rate": 0.0003063603000484848, "loss": 4.7914, "mean_token_accuracy": 0.22247145026922227, "num_tokens": 102465866.0, "step": 59085 }, { "entropy": 5.300097274780273, "epoch": 4.597393503209492, "grad_norm": 1.234375, "learning_rate": 0.00030633285475224244, "loss": 4.6827, "mean_token_accuracy": 0.22482237368822097, "num_tokens": 102474026.0, "step": 59090 }, { "entropy": 5.436284589767456, "epoch": 4.59778253258121, "grad_norm": 1.3203125, "learning_rate": 0.00030630540898057384, "loss": 4.9477, "mean_token_accuracy": 0.20357305854558944, "num_tokens": 102482327.0, "step": 59095 }, { "entropy": 5.432371044158936, "epoch": 4.5981715619529275, "grad_norm": 1.3125, "learning_rate": 0.00030627796273389546, "loss": 4.8684, "mean_token_accuracy": 0.21978526711463928, "num_tokens": 102490618.0, "step": 59100 }, { "entropy": 5.468838739395141, "epoch": 4.598560591324645, "grad_norm": 1.21875, "learning_rate": 0.00030625051601262384, "loss": 4.7784, "mean_token_accuracy": 0.22034766972064973, "num_tokens": 102498976.0, "step": 59105 }, { "entropy": 5.355074024200439, "epoch": 4.598949620696363, "grad_norm": 1.1640625, "learning_rate": 0.0003062230688171753, "loss": 4.7119, "mean_token_accuracy": 0.22980451732873916, "num_tokens": 102508118.0, "step": 59110 }, { "entropy": 5.313330745697021, "epoch": 4.599338650068081, "grad_norm": 1.2109375, "learning_rate": 0.0003061956211479665, "loss": 4.7794, "mean_token_accuracy": 0.22101232558488845, "num_tokens": 102516575.0, "step": 59115 }, { "entropy": 5.417083978652954, "epoch": 4.599727679439797, "grad_norm": 1.15625, "learning_rate": 0.0003061681730054137, "loss": 4.8203, "mean_token_accuracy": 0.21364429146051406, "num_tokens": 102526207.0, "step": 59120 }, { "entropy": 5.486366415023804, "epoch": 4.600116708811515, "grad_norm": 1.1953125, "learning_rate": 0.0003061407243899335, "loss": 4.8515, "mean_token_accuracy": 0.22342208176851272, "num_tokens": 102536135.0, "step": 59125 }, { "entropy": 5.534539031982422, "epoch": 4.600505738183233, "grad_norm": 1.4765625, "learning_rate": 0.00030611327530194243, "loss": 4.8359, "mean_token_accuracy": 0.21975705474615098, "num_tokens": 102545294.0, "step": 59130 }, { "entropy": 5.425827312469482, "epoch": 4.6008947675549505, "grad_norm": 1.1796875, "learning_rate": 0.0003060858257418569, "loss": 4.7919, "mean_token_accuracy": 0.2206922397017479, "num_tokens": 102554128.0, "step": 59135 }, { "entropy": 5.316024208068848, "epoch": 4.601283796926668, "grad_norm": 1.2265625, "learning_rate": 0.0003060583757100934, "loss": 4.75, "mean_token_accuracy": 0.2240620583295822, "num_tokens": 102562530.0, "step": 59140 }, { "entropy": 5.463724660873413, "epoch": 4.601672826298385, "grad_norm": 1.25, "learning_rate": 0.0003060309252070685, "loss": 4.9222, "mean_token_accuracy": 0.21036737859249116, "num_tokens": 102571002.0, "step": 59145 }, { "entropy": 5.454732465744018, "epoch": 4.602061855670103, "grad_norm": 1.2734375, "learning_rate": 0.0003060034742331987, "loss": 4.7366, "mean_token_accuracy": 0.22658173441886903, "num_tokens": 102579462.0, "step": 59150 }, { "entropy": 5.462719058990478, "epoch": 4.60245088504182, "grad_norm": 1.1875, "learning_rate": 0.0003059760227889006, "loss": 4.8221, "mean_token_accuracy": 0.21942254155874252, "num_tokens": 102587968.0, "step": 59155 }, { "entropy": 5.353231143951416, "epoch": 4.602839914413538, "grad_norm": 1.1640625, "learning_rate": 0.0003059485708745906, "loss": 4.7798, "mean_token_accuracy": 0.22457939982414246, "num_tokens": 102597126.0, "step": 59160 }, { "entropy": 5.368075275421143, "epoch": 4.603228943785256, "grad_norm": 1.203125, "learning_rate": 0.0003059211184906853, "loss": 4.8156, "mean_token_accuracy": 0.2187693491578102, "num_tokens": 102606742.0, "step": 59165 }, { "entropy": 5.423300504684448, "epoch": 4.6036179731569735, "grad_norm": 1.09375, "learning_rate": 0.00030589366563760125, "loss": 4.8129, "mean_token_accuracy": 0.22047675102949144, "num_tokens": 102616849.0, "step": 59170 }, { "entropy": 5.434229040145874, "epoch": 4.604007002528691, "grad_norm": 1.1875, "learning_rate": 0.00030586621231575494, "loss": 4.8328, "mean_token_accuracy": 0.2177261933684349, "num_tokens": 102625810.0, "step": 59175 }, { "entropy": 5.375242710113525, "epoch": 4.604396031900409, "grad_norm": 1.2265625, "learning_rate": 0.000305838758525563, "loss": 4.7552, "mean_token_accuracy": 0.2240580901503563, "num_tokens": 102634672.0, "step": 59180 }, { "entropy": 5.425861549377442, "epoch": 4.604785061272126, "grad_norm": 1.1484375, "learning_rate": 0.0003058113042674421, "loss": 4.8819, "mean_token_accuracy": 0.2118202567100525, "num_tokens": 102644500.0, "step": 59185 }, { "entropy": 5.485645914077759, "epoch": 4.605174090643843, "grad_norm": 1.21875, "learning_rate": 0.00030578384954180866, "loss": 4.8468, "mean_token_accuracy": 0.2232686385512352, "num_tokens": 102653453.0, "step": 59190 }, { "entropy": 5.462964868545532, "epoch": 4.605563120015561, "grad_norm": 1.1484375, "learning_rate": 0.0003057563943490792, "loss": 4.8128, "mean_token_accuracy": 0.22442420274019242, "num_tokens": 102662203.0, "step": 59195 }, { "entropy": 5.361122989654541, "epoch": 4.605952149387279, "grad_norm": 1.2421875, "learning_rate": 0.00030572893868967044, "loss": 4.6935, "mean_token_accuracy": 0.23159783631563186, "num_tokens": 102670837.0, "step": 59200 }, { "entropy": 5.362486505508423, "epoch": 4.6063411787589965, "grad_norm": 1.3203125, "learning_rate": 0.000305701482563999, "loss": 4.7904, "mean_token_accuracy": 0.22988068908452988, "num_tokens": 102678941.0, "step": 59205 }, { "entropy": 5.371567869186402, "epoch": 4.606730208130714, "grad_norm": 1.2421875, "learning_rate": 0.0003056740259724814, "loss": 4.7045, "mean_token_accuracy": 0.22389051765203477, "num_tokens": 102687246.0, "step": 59210 }, { "entropy": 5.41153473854065, "epoch": 4.607119237502431, "grad_norm": 1.171875, "learning_rate": 0.0003056465689155342, "loss": 4.8195, "mean_token_accuracy": 0.2231117993593216, "num_tokens": 102695966.0, "step": 59215 }, { "entropy": 5.385826110839844, "epoch": 4.607508266874149, "grad_norm": 1.1328125, "learning_rate": 0.00030561911139357424, "loss": 4.7223, "mean_token_accuracy": 0.22547744810581208, "num_tokens": 102705517.0, "step": 59220 }, { "entropy": 5.419586229324341, "epoch": 4.607897296245866, "grad_norm": 1.03125, "learning_rate": 0.00030559165340701797, "loss": 4.8144, "mean_token_accuracy": 0.2193841814994812, "num_tokens": 102715451.0, "step": 59225 }, { "entropy": 5.367695045471192, "epoch": 4.608286325617584, "grad_norm": 1.21875, "learning_rate": 0.000305564194956282, "loss": 4.6657, "mean_token_accuracy": 0.22789881080389024, "num_tokens": 102724171.0, "step": 59230 }, { "entropy": 5.33506064414978, "epoch": 4.608675354989302, "grad_norm": 1.2109375, "learning_rate": 0.00030553673604178305, "loss": 4.7471, "mean_token_accuracy": 0.23264963179826736, "num_tokens": 102732752.0, "step": 59235 }, { "entropy": 5.359577465057373, "epoch": 4.6090643843610195, "grad_norm": 1.203125, "learning_rate": 0.00030550927666393767, "loss": 4.7783, "mean_token_accuracy": 0.22995106279850006, "num_tokens": 102740838.0, "step": 59240 }, { "entropy": 5.395800161361694, "epoch": 4.609453413732737, "grad_norm": 1.21875, "learning_rate": 0.00030548181682316263, "loss": 4.7573, "mean_token_accuracy": 0.22783261090517043, "num_tokens": 102748670.0, "step": 59245 }, { "entropy": 5.451660633087158, "epoch": 4.609842443104454, "grad_norm": 1.2265625, "learning_rate": 0.00030545435651987453, "loss": 4.9499, "mean_token_accuracy": 0.20696998983621598, "num_tokens": 102757649.0, "step": 59250 }, { "entropy": 5.417370700836182, "epoch": 4.610231472476172, "grad_norm": 1.203125, "learning_rate": 0.0003054268957544901, "loss": 4.7965, "mean_token_accuracy": 0.22761355191469193, "num_tokens": 102765836.0, "step": 59255 }, { "entropy": 5.3944920063018795, "epoch": 4.610620501847889, "grad_norm": 1.0625, "learning_rate": 0.00030539943452742585, "loss": 4.7952, "mean_token_accuracy": 0.2207413613796234, "num_tokens": 102774193.0, "step": 59260 }, { "entropy": 5.3830560684204105, "epoch": 4.611009531219607, "grad_norm": 1.1875, "learning_rate": 0.00030537197283909875, "loss": 4.7868, "mean_token_accuracy": 0.22193364799022675, "num_tokens": 102782991.0, "step": 59265 }, { "entropy": 5.396105194091797, "epoch": 4.611398560591325, "grad_norm": 1.1484375, "learning_rate": 0.00030534451068992506, "loss": 4.8035, "mean_token_accuracy": 0.2198040172457695, "num_tokens": 102791736.0, "step": 59270 }, { "entropy": 5.447607517242432, "epoch": 4.6117875899630425, "grad_norm": 1.2265625, "learning_rate": 0.00030531704808032183, "loss": 4.8163, "mean_token_accuracy": 0.21752910166978837, "num_tokens": 102799909.0, "step": 59275 }, { "entropy": 5.406945514678955, "epoch": 4.612176619334759, "grad_norm": 1.2109375, "learning_rate": 0.0003052895850107057, "loss": 4.7496, "mean_token_accuracy": 0.22497616559267045, "num_tokens": 102808465.0, "step": 59280 }, { "entropy": 5.3510266780853275, "epoch": 4.612565648706477, "grad_norm": 1.3515625, "learning_rate": 0.00030526212148149326, "loss": 4.6659, "mean_token_accuracy": 0.23037125617265702, "num_tokens": 102816868.0, "step": 59285 }, { "entropy": 5.337236404418945, "epoch": 4.612954678078195, "grad_norm": 1.234375, "learning_rate": 0.0003052346574931013, "loss": 4.8242, "mean_token_accuracy": 0.2219412788748741, "num_tokens": 102825235.0, "step": 59290 }, { "entropy": 5.45988130569458, "epoch": 4.613343707449912, "grad_norm": 1.1796875, "learning_rate": 0.0003052071930459465, "loss": 4.8389, "mean_token_accuracy": 0.213229401409626, "num_tokens": 102833543.0, "step": 59295 }, { "entropy": 5.455262231826782, "epoch": 4.61373273682163, "grad_norm": 1.03125, "learning_rate": 0.0003051797281404457, "loss": 4.8379, "mean_token_accuracy": 0.21948667168617247, "num_tokens": 102842825.0, "step": 59300 }, { "entropy": 5.406916999816895, "epoch": 4.614121766193348, "grad_norm": 1.1953125, "learning_rate": 0.00030515226277701553, "loss": 4.7651, "mean_token_accuracy": 0.22625656723976134, "num_tokens": 102850644.0, "step": 59305 }, { "entropy": 5.355059862136841, "epoch": 4.6145107955650655, "grad_norm": 1.2265625, "learning_rate": 0.0003051247969560728, "loss": 4.7853, "mean_token_accuracy": 0.2188876137137413, "num_tokens": 102859134.0, "step": 59310 }, { "entropy": 5.294962596893311, "epoch": 4.614899824936783, "grad_norm": 1.21875, "learning_rate": 0.0003050973306780342, "loss": 4.6932, "mean_token_accuracy": 0.22890383154153823, "num_tokens": 102867780.0, "step": 59315 }, { "entropy": 5.365436172485351, "epoch": 4.6152888543085, "grad_norm": 1.1328125, "learning_rate": 0.00030506986394331656, "loss": 4.6467, "mean_token_accuracy": 0.23533979207277297, "num_tokens": 102876331.0, "step": 59320 }, { "entropy": 5.406923246383667, "epoch": 4.615677883680218, "grad_norm": 1.203125, "learning_rate": 0.00030504239675233655, "loss": 4.8013, "mean_token_accuracy": 0.2200856477022171, "num_tokens": 102885373.0, "step": 59325 }, { "entropy": 5.312823724746704, "epoch": 4.616066913051935, "grad_norm": 1.15625, "learning_rate": 0.00030501492910551094, "loss": 4.7425, "mean_token_accuracy": 0.22548244744539261, "num_tokens": 102894235.0, "step": 59330 }, { "entropy": 5.398810863494873, "epoch": 4.616455942423653, "grad_norm": 1.1015625, "learning_rate": 0.00030498746100325656, "loss": 4.7593, "mean_token_accuracy": 0.22378096580505372, "num_tokens": 102903017.0, "step": 59335 }, { "entropy": 5.428119087219239, "epoch": 4.616844971795371, "grad_norm": 1.1796875, "learning_rate": 0.0003049599924459903, "loss": 4.7907, "mean_token_accuracy": 0.22568943500518798, "num_tokens": 102911979.0, "step": 59340 }, { "entropy": 5.285250902175903, "epoch": 4.6172340011670885, "grad_norm": 1.34375, "learning_rate": 0.0003049325234341287, "loss": 4.6342, "mean_token_accuracy": 0.23229753226041794, "num_tokens": 102919829.0, "step": 59345 }, { "entropy": 5.351491832733155, "epoch": 4.617623030538805, "grad_norm": 1.1875, "learning_rate": 0.00030490505396808874, "loss": 4.8229, "mean_token_accuracy": 0.22476918995380402, "num_tokens": 102928742.0, "step": 59350 }, { "entropy": 5.43349552154541, "epoch": 4.618012059910523, "grad_norm": 1.15625, "learning_rate": 0.0003048775840482873, "loss": 4.8147, "mean_token_accuracy": 0.22231560796499253, "num_tokens": 102937113.0, "step": 59355 }, { "entropy": 5.404096698760986, "epoch": 4.618401089282241, "grad_norm": 1.2734375, "learning_rate": 0.000304850113675141, "loss": 4.745, "mean_token_accuracy": 0.22368726134300232, "num_tokens": 102945551.0, "step": 59360 }, { "entropy": 5.421985769271851, "epoch": 4.618790118653958, "grad_norm": 1.3515625, "learning_rate": 0.0003048226428490666, "loss": 4.8708, "mean_token_accuracy": 0.21244501918554307, "num_tokens": 102954150.0, "step": 59365 }, { "entropy": 5.381055736541748, "epoch": 4.619179148025676, "grad_norm": 1.296875, "learning_rate": 0.00030479517157048125, "loss": 4.7329, "mean_token_accuracy": 0.22612216025590898, "num_tokens": 102962673.0, "step": 59370 }, { "entropy": 5.455684089660645, "epoch": 4.619568177397394, "grad_norm": 1.046875, "learning_rate": 0.0003047676998398015, "loss": 4.7956, "mean_token_accuracy": 0.22503697574138642, "num_tokens": 102971063.0, "step": 59375 }, { "entropy": 5.454899883270263, "epoch": 4.6199572067691115, "grad_norm": 1.171875, "learning_rate": 0.00030474022765744434, "loss": 4.8132, "mean_token_accuracy": 0.22912015914916992, "num_tokens": 102979618.0, "step": 59380 }, { "entropy": 5.457771301269531, "epoch": 4.620346236140828, "grad_norm": 1.1953125, "learning_rate": 0.00030471275502382656, "loss": 4.7697, "mean_token_accuracy": 0.21079721599817275, "num_tokens": 102988627.0, "step": 59385 }, { "entropy": 5.428489828109742, "epoch": 4.620735265512546, "grad_norm": 1.21875, "learning_rate": 0.000304685281939365, "loss": 4.7882, "mean_token_accuracy": 0.22390297949314117, "num_tokens": 102998086.0, "step": 59390 }, { "entropy": 5.473314619064331, "epoch": 4.621124294884264, "grad_norm": 1.203125, "learning_rate": 0.0003046578084044765, "loss": 4.7782, "mean_token_accuracy": 0.22288812398910524, "num_tokens": 103006617.0, "step": 59395 }, { "entropy": 5.300986623764038, "epoch": 4.621513324255981, "grad_norm": 1.1171875, "learning_rate": 0.000304630334419578, "loss": 4.6246, "mean_token_accuracy": 0.23913885951042174, "num_tokens": 103015536.0, "step": 59400 }, { "entropy": 5.29842848777771, "epoch": 4.621902353627699, "grad_norm": 1.125, "learning_rate": 0.0003046028599850863, "loss": 4.7215, "mean_token_accuracy": 0.2285516619682312, "num_tokens": 103025201.0, "step": 59405 }, { "entropy": 5.358543729782104, "epoch": 4.622291382999417, "grad_norm": 1.265625, "learning_rate": 0.0003045753851014184, "loss": 4.687, "mean_token_accuracy": 0.23344453424215317, "num_tokens": 103034806.0, "step": 59410 }, { "entropy": 5.506098937988281, "epoch": 4.622680412371134, "grad_norm": 1.25, "learning_rate": 0.00030454790976899105, "loss": 4.9411, "mean_token_accuracy": 0.21753142774105072, "num_tokens": 103043591.0, "step": 59415 }, { "entropy": 5.356209325790405, "epoch": 4.623069441742851, "grad_norm": 1.203125, "learning_rate": 0.0003045204339882212, "loss": 4.7054, "mean_token_accuracy": 0.22725777328014374, "num_tokens": 103051807.0, "step": 59420 }, { "entropy": 5.367528438568115, "epoch": 4.623458471114569, "grad_norm": 1.0546875, "learning_rate": 0.0003044929577595257, "loss": 4.7934, "mean_token_accuracy": 0.21963736563920974, "num_tokens": 103060626.0, "step": 59425 }, { "entropy": 5.4177892208099365, "epoch": 4.623847500486287, "grad_norm": 1.1484375, "learning_rate": 0.00030446548108332164, "loss": 4.8443, "mean_token_accuracy": 0.22301000356674194, "num_tokens": 103069154.0, "step": 59430 }, { "entropy": 5.429731559753418, "epoch": 4.624236529858004, "grad_norm": 1.1328125, "learning_rate": 0.00030443800396002575, "loss": 4.8027, "mean_token_accuracy": 0.2201646164059639, "num_tokens": 103078715.0, "step": 59435 }, { "entropy": 5.433872079849243, "epoch": 4.624625559229722, "grad_norm": 1.140625, "learning_rate": 0.0003044105263900549, "loss": 4.8255, "mean_token_accuracy": 0.21911799907684326, "num_tokens": 103087258.0, "step": 59440 }, { "entropy": 5.3350742816925045, "epoch": 4.62501458860144, "grad_norm": 1.1328125, "learning_rate": 0.0003043830483738262, "loss": 4.6662, "mean_token_accuracy": 0.22980394661426545, "num_tokens": 103096593.0, "step": 59445 }, { "entropy": 5.365390491485596, "epoch": 4.6254036179731575, "grad_norm": 1.1328125, "learning_rate": 0.0003043555699117565, "loss": 4.7328, "mean_token_accuracy": 0.22823262512683867, "num_tokens": 103104894.0, "step": 59450 }, { "entropy": 5.376445865631103, "epoch": 4.625792647344874, "grad_norm": 1.25, "learning_rate": 0.00030432809100426286, "loss": 4.7692, "mean_token_accuracy": 0.21576579064130783, "num_tokens": 103113252.0, "step": 59455 }, { "entropy": 5.3977968215942385, "epoch": 4.626181676716592, "grad_norm": 1.140625, "learning_rate": 0.0003043006116517619, "loss": 4.8299, "mean_token_accuracy": 0.21935662925243377, "num_tokens": 103123103.0, "step": 59460 }, { "entropy": 5.441963052749633, "epoch": 4.62657070608831, "grad_norm": 1.203125, "learning_rate": 0.00030427313185467104, "loss": 4.8148, "mean_token_accuracy": 0.22613126486539842, "num_tokens": 103131492.0, "step": 59465 }, { "entropy": 5.364855813980102, "epoch": 4.626959735460027, "grad_norm": 1.1640625, "learning_rate": 0.0003042456516134068, "loss": 4.761, "mean_token_accuracy": 0.22040342837572097, "num_tokens": 103140160.0, "step": 59470 }, { "entropy": 5.405936765670776, "epoch": 4.627348764831745, "grad_norm": 1.2265625, "learning_rate": 0.00030421817092838644, "loss": 4.7667, "mean_token_accuracy": 0.2189886152744293, "num_tokens": 103148532.0, "step": 59475 }, { "entropy": 5.335491037368774, "epoch": 4.627737794203462, "grad_norm": 1.234375, "learning_rate": 0.0003041906898000268, "loss": 4.7144, "mean_token_accuracy": 0.22896186709403993, "num_tokens": 103156981.0, "step": 59480 }, { "entropy": 5.503323554992676, "epoch": 4.62812682357518, "grad_norm": 1.203125, "learning_rate": 0.0003041632082287449, "loss": 4.8865, "mean_token_accuracy": 0.20630740821361543, "num_tokens": 103166308.0, "step": 59485 }, { "entropy": 5.441832780838013, "epoch": 4.628515852946897, "grad_norm": 1.1953125, "learning_rate": 0.0003041357262149577, "loss": 4.6996, "mean_token_accuracy": 0.22959533035755159, "num_tokens": 103174495.0, "step": 59490 }, { "entropy": 5.344913721084595, "epoch": 4.628904882318615, "grad_norm": 1.2265625, "learning_rate": 0.0003041082437590824, "loss": 4.7596, "mean_token_accuracy": 0.2203319936990738, "num_tokens": 103184670.0, "step": 59495 }, { "entropy": 5.386821031570435, "epoch": 4.629293911690333, "grad_norm": 1.28125, "learning_rate": 0.00030408076086153575, "loss": 4.7835, "mean_token_accuracy": 0.22132351547479628, "num_tokens": 103192630.0, "step": 59500 }, { "entropy": 5.420797634124756, "epoch": 4.62968294106205, "grad_norm": 1.3359375, "learning_rate": 0.0003040532775227347, "loss": 4.7796, "mean_token_accuracy": 0.21238777935504913, "num_tokens": 103201125.0, "step": 59505 }, { "entropy": 5.497645473480224, "epoch": 4.630071970433768, "grad_norm": 1.2265625, "learning_rate": 0.00030402579374309656, "loss": 4.9178, "mean_token_accuracy": 0.21161684393882751, "num_tokens": 103209806.0, "step": 59510 }, { "entropy": 5.449560737609863, "epoch": 4.630460999805486, "grad_norm": 1.265625, "learning_rate": 0.00030399830952303815, "loss": 4.7124, "mean_token_accuracy": 0.22842631340026856, "num_tokens": 103219514.0, "step": 59515 }, { "entropy": 5.4249976634979244, "epoch": 4.630850029177203, "grad_norm": 1.3203125, "learning_rate": 0.00030397082486297657, "loss": 4.8244, "mean_token_accuracy": 0.2244926944375038, "num_tokens": 103228777.0, "step": 59520 }, { "entropy": 5.29830117225647, "epoch": 4.63123905854892, "grad_norm": 1.1015625, "learning_rate": 0.0003039433397633288, "loss": 4.6932, "mean_token_accuracy": 0.221771302819252, "num_tokens": 103237844.0, "step": 59525 }, { "entropy": 5.363972139358521, "epoch": 4.631628087920638, "grad_norm": 1.1953125, "learning_rate": 0.00030391585422451196, "loss": 4.7127, "mean_token_accuracy": 0.2308679535984993, "num_tokens": 103246038.0, "step": 59530 }, { "entropy": 5.3501287460327145, "epoch": 4.632017117292356, "grad_norm": 1.25, "learning_rate": 0.00030388836824694307, "loss": 4.7349, "mean_token_accuracy": 0.22470701336860657, "num_tokens": 103254383.0, "step": 59535 }, { "entropy": 5.439510631561279, "epoch": 4.632406146664073, "grad_norm": 1.234375, "learning_rate": 0.0003038608818310391, "loss": 4.8126, "mean_token_accuracy": 0.22790600955486298, "num_tokens": 103262110.0, "step": 59540 }, { "entropy": 5.365524339675903, "epoch": 4.632795176035791, "grad_norm": 1.2421875, "learning_rate": 0.00030383339497721726, "loss": 4.7199, "mean_token_accuracy": 0.2330671012401581, "num_tokens": 103270206.0, "step": 59545 }, { "entropy": 5.396467781066894, "epoch": 4.633184205407508, "grad_norm": 1.2109375, "learning_rate": 0.0003038059076858944, "loss": 4.7717, "mean_token_accuracy": 0.22478654384613037, "num_tokens": 103279764.0, "step": 59550 }, { "entropy": 5.467930459976197, "epoch": 4.633573234779226, "grad_norm": 1.2109375, "learning_rate": 0.0003037784199574879, "loss": 4.8357, "mean_token_accuracy": 0.22245290428400039, "num_tokens": 103288848.0, "step": 59555 }, { "entropy": 5.428844404220581, "epoch": 4.633962264150943, "grad_norm": 1.1640625, "learning_rate": 0.00030375093179241464, "loss": 4.8204, "mean_token_accuracy": 0.22605613768100738, "num_tokens": 103297517.0, "step": 59560 }, { "entropy": 5.363326930999756, "epoch": 4.634351293522661, "grad_norm": 1.265625, "learning_rate": 0.00030372344319109173, "loss": 4.7957, "mean_token_accuracy": 0.22415723353624345, "num_tokens": 103306075.0, "step": 59565 }, { "entropy": 5.402189683914185, "epoch": 4.634740322894379, "grad_norm": 1.2578125, "learning_rate": 0.0003036959541539363, "loss": 4.7746, "mean_token_accuracy": 0.22701624929904937, "num_tokens": 103315857.0, "step": 59570 }, { "entropy": 5.408189153671264, "epoch": 4.635129352266096, "grad_norm": 1.2109375, "learning_rate": 0.00030366846468136543, "loss": 4.7663, "mean_token_accuracy": 0.22891604155302048, "num_tokens": 103325458.0, "step": 59575 }, { "entropy": 5.4254982471466064, "epoch": 4.635518381637814, "grad_norm": 1.1875, "learning_rate": 0.0003036409747737963, "loss": 4.8975, "mean_token_accuracy": 0.21704998314380647, "num_tokens": 103334933.0, "step": 59580 }, { "entropy": 5.387787342071533, "epoch": 4.635907411009531, "grad_norm": 1.265625, "learning_rate": 0.00030361348443164583, "loss": 4.7231, "mean_token_accuracy": 0.22778742462396623, "num_tokens": 103343624.0, "step": 59585 }, { "entropy": 5.348550605773926, "epoch": 4.6362964403812486, "grad_norm": 1.15625, "learning_rate": 0.0003035859936553314, "loss": 4.667, "mean_token_accuracy": 0.23422258645296096, "num_tokens": 103352510.0, "step": 59590 }, { "entropy": 5.411761808395386, "epoch": 4.636685469752966, "grad_norm": 1.09375, "learning_rate": 0.00030355850244527, "loss": 4.8493, "mean_token_accuracy": 0.22011567801237106, "num_tokens": 103361360.0, "step": 59595 }, { "entropy": 5.305577230453491, "epoch": 4.637074499124684, "grad_norm": 1.15625, "learning_rate": 0.0003035310108018787, "loss": 4.7297, "mean_token_accuracy": 0.22526883333921432, "num_tokens": 103370891.0, "step": 59600 }, { "entropy": 5.42244668006897, "epoch": 4.637463528496402, "grad_norm": 1.1640625, "learning_rate": 0.0003035035187255748, "loss": 4.6382, "mean_token_accuracy": 0.23618705868721007, "num_tokens": 103378615.0, "step": 59605 }, { "entropy": 5.46828327178955, "epoch": 4.637852557868119, "grad_norm": 1.21875, "learning_rate": 0.00030347602621677534, "loss": 4.9186, "mean_token_accuracy": 0.2191417396068573, "num_tokens": 103388114.0, "step": 59610 }, { "entropy": 5.410670804977417, "epoch": 4.638241587239836, "grad_norm": 1.2265625, "learning_rate": 0.0003034485332758975, "loss": 4.8405, "mean_token_accuracy": 0.2116706922650337, "num_tokens": 103396124.0, "step": 59615 }, { "entropy": 5.479038906097412, "epoch": 4.638630616611554, "grad_norm": 1.2890625, "learning_rate": 0.00030342103990335846, "loss": 4.8331, "mean_token_accuracy": 0.2161700189113617, "num_tokens": 103404454.0, "step": 59620 }, { "entropy": 5.348663187026977, "epoch": 4.6390196459832715, "grad_norm": 1.2734375, "learning_rate": 0.00030339354609957545, "loss": 4.7019, "mean_token_accuracy": 0.22383491843938827, "num_tokens": 103412453.0, "step": 59625 }, { "entropy": 5.324551677703857, "epoch": 4.639408675354989, "grad_norm": 1.1875, "learning_rate": 0.00030336605186496546, "loss": 4.7131, "mean_token_accuracy": 0.22779101133346558, "num_tokens": 103420432.0, "step": 59630 }, { "entropy": 5.460262155532837, "epoch": 4.639797704726707, "grad_norm": 1.203125, "learning_rate": 0.00030333855719994585, "loss": 4.875, "mean_token_accuracy": 0.21412641704082488, "num_tokens": 103429973.0, "step": 59635 }, { "entropy": 5.469717931747437, "epoch": 4.640186734098425, "grad_norm": 1.1484375, "learning_rate": 0.0003033110621049336, "loss": 4.8373, "mean_token_accuracy": 0.21623394787311553, "num_tokens": 103439809.0, "step": 59640 }, { "entropy": 5.470744371414185, "epoch": 4.640575763470142, "grad_norm": 1.1328125, "learning_rate": 0.00030328356658034623, "loss": 4.7125, "mean_token_accuracy": 0.21844536811113358, "num_tokens": 103448364.0, "step": 59645 }, { "entropy": 5.418440151214599, "epoch": 4.64096479284186, "grad_norm": 1.125, "learning_rate": 0.00030325607062660066, "loss": 4.7846, "mean_token_accuracy": 0.2236788973212242, "num_tokens": 103457513.0, "step": 59650 }, { "entropy": 5.393074607849121, "epoch": 4.641353822213577, "grad_norm": 1.1484375, "learning_rate": 0.0003032285742441143, "loss": 4.7818, "mean_token_accuracy": 0.22212940007448195, "num_tokens": 103465898.0, "step": 59655 }, { "entropy": 5.334016895294189, "epoch": 4.6417428515852945, "grad_norm": 1.2109375, "learning_rate": 0.0003032010774333041, "loss": 4.7224, "mean_token_accuracy": 0.23126882761716844, "num_tokens": 103474106.0, "step": 59660 }, { "entropy": 5.317964935302735, "epoch": 4.642131880957012, "grad_norm": 1.1640625, "learning_rate": 0.00030317358019458753, "loss": 4.674, "mean_token_accuracy": 0.22896128743886948, "num_tokens": 103482843.0, "step": 59665 }, { "entropy": 5.431198072433472, "epoch": 4.64252091032873, "grad_norm": 1.34375, "learning_rate": 0.0003031460825283817, "loss": 4.7495, "mean_token_accuracy": 0.22788007706403732, "num_tokens": 103492305.0, "step": 59670 }, { "entropy": 5.427869272232056, "epoch": 4.642909939700448, "grad_norm": 1.171875, "learning_rate": 0.00030311858443510383, "loss": 4.7968, "mean_token_accuracy": 0.22938809543848038, "num_tokens": 103500304.0, "step": 59675 }, { "entropy": 5.354594898223877, "epoch": 4.643298969072165, "grad_norm": 1.1875, "learning_rate": 0.0003030910859151712, "loss": 4.6972, "mean_token_accuracy": 0.22967077046632767, "num_tokens": 103508743.0, "step": 59680 }, { "entropy": 5.321511840820312, "epoch": 4.643687998443882, "grad_norm": 1.15625, "learning_rate": 0.00030306358696900114, "loss": 4.6669, "mean_token_accuracy": 0.23482585698366165, "num_tokens": 103517400.0, "step": 59685 }, { "entropy": 5.435042381286621, "epoch": 4.6440770278156, "grad_norm": 1.4296875, "learning_rate": 0.00030303608759701077, "loss": 4.7809, "mean_token_accuracy": 0.2281481683254242, "num_tokens": 103525240.0, "step": 59690 }, { "entropy": 5.420337724685669, "epoch": 4.6444660571873175, "grad_norm": 1.09375, "learning_rate": 0.0003030085877996174, "loss": 4.8619, "mean_token_accuracy": 0.21933754980564119, "num_tokens": 103533668.0, "step": 59695 }, { "entropy": 5.378507804870606, "epoch": 4.644855086559035, "grad_norm": 1.1875, "learning_rate": 0.00030298108757723823, "loss": 4.7108, "mean_token_accuracy": 0.23457382023334503, "num_tokens": 103542436.0, "step": 59700 }, { "entropy": 5.319800662994385, "epoch": 4.645244115930753, "grad_norm": 1.1328125, "learning_rate": 0.0003029535869302906, "loss": 4.6478, "mean_token_accuracy": 0.22903958410024644, "num_tokens": 103550289.0, "step": 59705 }, { "entropy": 5.424223804473877, "epoch": 4.645633145302471, "grad_norm": 1.15625, "learning_rate": 0.00030292608585919185, "loss": 4.8036, "mean_token_accuracy": 0.2269161492586136, "num_tokens": 103558606.0, "step": 59710 }, { "entropy": 5.446231889724731, "epoch": 4.646022174674188, "grad_norm": 1.1953125, "learning_rate": 0.00030289858436435916, "loss": 4.7944, "mean_token_accuracy": 0.21791634410619737, "num_tokens": 103567481.0, "step": 59715 }, { "entropy": 5.469941425323486, "epoch": 4.646411204045905, "grad_norm": 1.3125, "learning_rate": 0.00030287108244620993, "loss": 4.8445, "mean_token_accuracy": 0.21667399108409882, "num_tokens": 103575460.0, "step": 59720 }, { "entropy": 5.434540462493897, "epoch": 4.646800233417623, "grad_norm": 1.2421875, "learning_rate": 0.00030284358010516135, "loss": 4.7999, "mean_token_accuracy": 0.2228355199098587, "num_tokens": 103583913.0, "step": 59725 }, { "entropy": 5.328849649429321, "epoch": 4.6471892627893405, "grad_norm": 1.1875, "learning_rate": 0.0003028160773416307, "loss": 4.7702, "mean_token_accuracy": 0.223815481364727, "num_tokens": 103592711.0, "step": 59730 }, { "entropy": 5.396610975265503, "epoch": 4.647578292161058, "grad_norm": 1.2109375, "learning_rate": 0.00030278857415603534, "loss": 4.804, "mean_token_accuracy": 0.22200295180082322, "num_tokens": 103600886.0, "step": 59735 }, { "entropy": 5.381673288345337, "epoch": 4.647967321532776, "grad_norm": 1.1953125, "learning_rate": 0.00030276107054879263, "loss": 4.7712, "mean_token_accuracy": 0.2297120586037636, "num_tokens": 103610099.0, "step": 59740 }, { "entropy": 5.478265857696533, "epoch": 4.648356350904494, "grad_norm": 1.2734375, "learning_rate": 0.00030273356652031993, "loss": 4.8983, "mean_token_accuracy": 0.21882153004407884, "num_tokens": 103619009.0, "step": 59745 }, { "entropy": 5.439951658248901, "epoch": 4.64874538027621, "grad_norm": 1.3046875, "learning_rate": 0.0003027060620710344, "loss": 4.8136, "mean_token_accuracy": 0.22527068853378296, "num_tokens": 103626831.0, "step": 59750 }, { "entropy": 5.400478935241699, "epoch": 4.649134409647928, "grad_norm": 1.140625, "learning_rate": 0.00030267855720135343, "loss": 4.7694, "mean_token_accuracy": 0.2236724704504013, "num_tokens": 103636907.0, "step": 59755 }, { "entropy": 5.3751373291015625, "epoch": 4.649523439019646, "grad_norm": 1.1328125, "learning_rate": 0.0003026510519116946, "loss": 4.7631, "mean_token_accuracy": 0.22680717557668686, "num_tokens": 103646517.0, "step": 59760 }, { "entropy": 5.485721778869629, "epoch": 4.6499124683913635, "grad_norm": 1.3125, "learning_rate": 0.000302623546202475, "loss": 4.8462, "mean_token_accuracy": 0.2155029892921448, "num_tokens": 103655050.0, "step": 59765 }, { "entropy": 5.591313457489013, "epoch": 4.650301497763081, "grad_norm": 1.203125, "learning_rate": 0.0003025960400741119, "loss": 4.9849, "mean_token_accuracy": 0.2018994376063347, "num_tokens": 103664505.0, "step": 59770 }, { "entropy": 5.434939622879028, "epoch": 4.650690527134799, "grad_norm": 1.1953125, "learning_rate": 0.000302568533527023, "loss": 4.7712, "mean_token_accuracy": 0.22444880306720733, "num_tokens": 103673176.0, "step": 59775 }, { "entropy": 5.353394460678101, "epoch": 4.651079556506517, "grad_norm": 1.1796875, "learning_rate": 0.0003025410265616254, "loss": 4.7117, "mean_token_accuracy": 0.2253936305642128, "num_tokens": 103681219.0, "step": 59780 }, { "entropy": 5.356380796432495, "epoch": 4.651468585878233, "grad_norm": 1.265625, "learning_rate": 0.0003025135191783366, "loss": 4.7248, "mean_token_accuracy": 0.22505516260862352, "num_tokens": 103688792.0, "step": 59785 }, { "entropy": 5.343975400924682, "epoch": 4.651857615249951, "grad_norm": 1.171875, "learning_rate": 0.00030248601137757394, "loss": 4.6822, "mean_token_accuracy": 0.2284650757908821, "num_tokens": 103697242.0, "step": 59790 }, { "entropy": 5.452278709411621, "epoch": 4.652246644621669, "grad_norm": 1.2578125, "learning_rate": 0.0003024585031597547, "loss": 4.7435, "mean_token_accuracy": 0.2308778077363968, "num_tokens": 103706277.0, "step": 59795 }, { "entropy": 5.443483638763428, "epoch": 4.6526356739933865, "grad_norm": 1.1328125, "learning_rate": 0.0003024309945252965, "loss": 4.8642, "mean_token_accuracy": 0.21820130795240403, "num_tokens": 103714924.0, "step": 59800 }, { "entropy": 5.392613267898559, "epoch": 4.653024703365104, "grad_norm": 1.2421875, "learning_rate": 0.00030240348547461653, "loss": 4.8088, "mean_token_accuracy": 0.2163159132003784, "num_tokens": 103722982.0, "step": 59805 }, { "entropy": 5.379876375198364, "epoch": 4.653413732736822, "grad_norm": 1.171875, "learning_rate": 0.00030237597600813235, "loss": 4.7831, "mean_token_accuracy": 0.22688182890415193, "num_tokens": 103731838.0, "step": 59810 }, { "entropy": 5.42807412147522, "epoch": 4.653802762108539, "grad_norm": 1.1015625, "learning_rate": 0.0003023484661262613, "loss": 4.7391, "mean_token_accuracy": 0.22742576003074647, "num_tokens": 103740310.0, "step": 59815 }, { "entropy": 5.345364427566528, "epoch": 4.654191791480256, "grad_norm": 1.109375, "learning_rate": 0.0003023209558294208, "loss": 4.6733, "mean_token_accuracy": 0.2352745532989502, "num_tokens": 103748981.0, "step": 59820 }, { "entropy": 5.361807250976563, "epoch": 4.654580820851974, "grad_norm": 1.3125, "learning_rate": 0.00030229344511802824, "loss": 4.7104, "mean_token_accuracy": 0.23067983835935593, "num_tokens": 103757443.0, "step": 59825 }, { "entropy": 5.3469208717346195, "epoch": 4.654969850223692, "grad_norm": 1.2265625, "learning_rate": 0.00030226593399250114, "loss": 4.7617, "mean_token_accuracy": 0.2221172034740448, "num_tokens": 103767323.0, "step": 59830 }, { "entropy": 5.358058881759644, "epoch": 4.6553588795954095, "grad_norm": 1.1953125, "learning_rate": 0.00030223842245325687, "loss": 4.7436, "mean_token_accuracy": 0.2205578938126564, "num_tokens": 103776513.0, "step": 59835 }, { "entropy": 5.43656177520752, "epoch": 4.655747908967127, "grad_norm": 1.109375, "learning_rate": 0.00030221091050071293, "loss": 4.8327, "mean_token_accuracy": 0.2160925328731537, "num_tokens": 103785043.0, "step": 59840 }, { "entropy": 5.376711082458496, "epoch": 4.656136938338845, "grad_norm": 1.1171875, "learning_rate": 0.00030218339813528665, "loss": 4.7113, "mean_token_accuracy": 0.22611784487962722, "num_tokens": 103794015.0, "step": 59845 }, { "entropy": 5.345044803619385, "epoch": 4.656525967710563, "grad_norm": 1.09375, "learning_rate": 0.0003021558853573957, "loss": 4.7825, "mean_token_accuracy": 0.22772388458251952, "num_tokens": 103803687.0, "step": 59850 }, { "entropy": 5.439833784103394, "epoch": 4.656914997082279, "grad_norm": 1.1953125, "learning_rate": 0.0003021283721674573, "loss": 4.8595, "mean_token_accuracy": 0.22572697699069977, "num_tokens": 103812355.0, "step": 59855 }, { "entropy": 5.361315393447876, "epoch": 4.657304026453997, "grad_norm": 1.2265625, "learning_rate": 0.0003021008585658891, "loss": 4.7169, "mean_token_accuracy": 0.22691328823566437, "num_tokens": 103820363.0, "step": 59860 }, { "entropy": 5.376403188705444, "epoch": 4.657693055825715, "grad_norm": 1.1484375, "learning_rate": 0.00030207334455310846, "loss": 4.7966, "mean_token_accuracy": 0.22476357072591782, "num_tokens": 103828665.0, "step": 59865 }, { "entropy": 5.46757869720459, "epoch": 4.6580820851974325, "grad_norm": 1.2265625, "learning_rate": 0.0003020458301295329, "loss": 4.8249, "mean_token_accuracy": 0.23431562185287474, "num_tokens": 103838495.0, "step": 59870 }, { "entropy": 5.376807355880738, "epoch": 4.65847111456915, "grad_norm": 1.2265625, "learning_rate": 0.00030201831529557994, "loss": 4.7439, "mean_token_accuracy": 0.21982259452342987, "num_tokens": 103846476.0, "step": 59875 }, { "entropy": 5.436042356491089, "epoch": 4.658860143940868, "grad_norm": 1.1875, "learning_rate": 0.0003019908000516671, "loss": 4.86, "mean_token_accuracy": 0.21401695609092714, "num_tokens": 103854926.0, "step": 59880 }, { "entropy": 5.421493291854858, "epoch": 4.659249173312585, "grad_norm": 1.1484375, "learning_rate": 0.0003019632843982117, "loss": 4.8431, "mean_token_accuracy": 0.22191568613052368, "num_tokens": 103863372.0, "step": 59885 }, { "entropy": 5.398956203460694, "epoch": 4.659638202684302, "grad_norm": 1.171875, "learning_rate": 0.00030193576833563153, "loss": 4.8125, "mean_token_accuracy": 0.2237105131149292, "num_tokens": 103871830.0, "step": 59890 }, { "entropy": 5.439985036849976, "epoch": 4.66002723205602, "grad_norm": 1.3046875, "learning_rate": 0.0003019082518643438, "loss": 4.7875, "mean_token_accuracy": 0.21817277371883392, "num_tokens": 103879976.0, "step": 59895 }, { "entropy": 5.431389951705933, "epoch": 4.660416261427738, "grad_norm": 1.2421875, "learning_rate": 0.00030188073498476633, "loss": 4.7836, "mean_token_accuracy": 0.22518945336341858, "num_tokens": 103888362.0, "step": 59900 }, { "entropy": 5.47089147567749, "epoch": 4.6608052907994555, "grad_norm": 1.3515625, "learning_rate": 0.0003018532176973163, "loss": 4.8609, "mean_token_accuracy": 0.2085472524166107, "num_tokens": 103897526.0, "step": 59905 }, { "entropy": 5.364666366577149, "epoch": 4.661194320171173, "grad_norm": 1.203125, "learning_rate": 0.00030182570000241154, "loss": 4.7372, "mean_token_accuracy": 0.2255645364522934, "num_tokens": 103906292.0, "step": 59910 }, { "entropy": 5.347701787948608, "epoch": 4.661583349542891, "grad_norm": 1.0625, "learning_rate": 0.0003017981819004696, "loss": 4.7219, "mean_token_accuracy": 0.2291928917169571, "num_tokens": 103915688.0, "step": 59915 }, { "entropy": 5.361847543716431, "epoch": 4.661972378914608, "grad_norm": 1.171875, "learning_rate": 0.0003017706633919078, "loss": 4.8118, "mean_token_accuracy": 0.2193927437067032, "num_tokens": 103924749.0, "step": 59920 }, { "entropy": 5.338251066207886, "epoch": 4.662361408286325, "grad_norm": 1.21875, "learning_rate": 0.0003017431444771437, "loss": 4.6762, "mean_token_accuracy": 0.23218585252761842, "num_tokens": 103932731.0, "step": 59925 }, { "entropy": 5.4523766040802, "epoch": 4.662750437658043, "grad_norm": 1.2109375, "learning_rate": 0.00030171562515659504, "loss": 4.9115, "mean_token_accuracy": 0.21043730676174163, "num_tokens": 103941284.0, "step": 59930 }, { "entropy": 5.3361071109771725, "epoch": 4.663139467029761, "grad_norm": 1.2265625, "learning_rate": 0.0003016881054306793, "loss": 4.7422, "mean_token_accuracy": 0.22682922780513765, "num_tokens": 103950304.0, "step": 59935 }, { "entropy": 5.382370662689209, "epoch": 4.6635284964014785, "grad_norm": 1.2578125, "learning_rate": 0.0003016605852998139, "loss": 4.7551, "mean_token_accuracy": 0.22328772097826005, "num_tokens": 103958472.0, "step": 59940 }, { "entropy": 5.4095337867736815, "epoch": 4.663917525773196, "grad_norm": 1.1875, "learning_rate": 0.00030163306476441675, "loss": 4.7747, "mean_token_accuracy": 0.2267397537827492, "num_tokens": 103967068.0, "step": 59945 }, { "entropy": 5.485649299621582, "epoch": 4.664306555144913, "grad_norm": 1.2734375, "learning_rate": 0.0003016055438249051, "loss": 4.9259, "mean_token_accuracy": 0.21011196374893187, "num_tokens": 103975615.0, "step": 59950 }, { "entropy": 5.523872041702271, "epoch": 4.664695584516631, "grad_norm": 1.1953125, "learning_rate": 0.0003015780224816968, "loss": 4.9018, "mean_token_accuracy": 0.2133241131901741, "num_tokens": 103984524.0, "step": 59955 }, { "entropy": 5.411612129211425, "epoch": 4.665084613888348, "grad_norm": 1.2890625, "learning_rate": 0.0003015505007352093, "loss": 4.7405, "mean_token_accuracy": 0.23036046028137208, "num_tokens": 103993217.0, "step": 59960 }, { "entropy": 5.373046016693115, "epoch": 4.665473643260066, "grad_norm": 1.2734375, "learning_rate": 0.00030152297858586016, "loss": 4.8103, "mean_token_accuracy": 0.2201085388660431, "num_tokens": 104001623.0, "step": 59965 }, { "entropy": 5.311851692199707, "epoch": 4.665862672631784, "grad_norm": 1.2109375, "learning_rate": 0.00030149545603406694, "loss": 4.773, "mean_token_accuracy": 0.21999589651823043, "num_tokens": 104010794.0, "step": 59970 }, { "entropy": 5.395993566513061, "epoch": 4.6662517020035015, "grad_norm": 1.2421875, "learning_rate": 0.0003014679330802474, "loss": 4.7713, "mean_token_accuracy": 0.21992125660181044, "num_tokens": 104019118.0, "step": 59975 }, { "entropy": 5.537430667877198, "epoch": 4.666640731375219, "grad_norm": 1.2734375, "learning_rate": 0.00030144040972481916, "loss": 4.8951, "mean_token_accuracy": 0.21607646495103836, "num_tokens": 104027823.0, "step": 59980 }, { "entropy": 5.480741214752197, "epoch": 4.667029760746937, "grad_norm": 1.140625, "learning_rate": 0.00030141288596819977, "loss": 4.9219, "mean_token_accuracy": 0.20840731710195542, "num_tokens": 104036995.0, "step": 59985 }, { "entropy": 5.428569412231445, "epoch": 4.667418790118654, "grad_norm": 1.21875, "learning_rate": 0.00030138536181080683, "loss": 4.8005, "mean_token_accuracy": 0.227342689037323, "num_tokens": 104045998.0, "step": 59990 }, { "entropy": 5.379879093170166, "epoch": 4.667807819490371, "grad_norm": 1.171875, "learning_rate": 0.00030135783725305815, "loss": 4.6564, "mean_token_accuracy": 0.229261215031147, "num_tokens": 104054380.0, "step": 59995 }, { "entropy": 5.287859058380127, "epoch": 4.668196848862089, "grad_norm": 1.1484375, "learning_rate": 0.0003013303122953712, "loss": 4.6829, "mean_token_accuracy": 0.23285471200942992, "num_tokens": 104063672.0, "step": 60000 }, { "epoch": 4.668196848862089, "eval_entropy": 5.151966845564709, "eval_loss": 4.928664207458496, "eval_mean_token_accuracy": 0.22482802388011777, "eval_num_tokens": 104063672.0, "eval_runtime": 28.6068, "eval_samples_per_second": 1452.729, "eval_steps_per_second": 181.6, "step": 60000 }, { "entropy": 5.410231733322144, "epoch": 4.668585878233807, "grad_norm": 1.171875, "learning_rate": 0.0003013027869381635, "loss": 4.7895, "mean_token_accuracy": 0.2236448273062706, "num_tokens": 104073128.0, "step": 60005 }, { "entropy": 5.406169033050537, "epoch": 4.6689749076055245, "grad_norm": 1.1640625, "learning_rate": 0.000301275261181853, "loss": 4.738, "mean_token_accuracy": 0.21737637668848037, "num_tokens": 104081957.0, "step": 60010 }, { "entropy": 5.390545845031738, "epoch": 4.669363936977242, "grad_norm": 1.140625, "learning_rate": 0.0003012477350268572, "loss": 4.8253, "mean_token_accuracy": 0.22602433413267137, "num_tokens": 104090678.0, "step": 60015 }, { "entropy": 5.429363489151001, "epoch": 4.669752966348959, "grad_norm": 1.171875, "learning_rate": 0.00030122020847359385, "loss": 4.7009, "mean_token_accuracy": 0.22935028076171876, "num_tokens": 104099729.0, "step": 60020 }, { "entropy": 5.4134115219116214, "epoch": 4.670141995720677, "grad_norm": 1.15625, "learning_rate": 0.0003011926815224805, "loss": 4.7333, "mean_token_accuracy": 0.22642356008291245, "num_tokens": 104108343.0, "step": 60025 }, { "entropy": 5.396613597869873, "epoch": 4.670531025092394, "grad_norm": 1.171875, "learning_rate": 0.00030116515417393495, "loss": 4.7769, "mean_token_accuracy": 0.2232011675834656, "num_tokens": 104117347.0, "step": 60030 }, { "entropy": 5.340514516830444, "epoch": 4.670920054464112, "grad_norm": 1.1796875, "learning_rate": 0.00030113762642837487, "loss": 4.7837, "mean_token_accuracy": 0.22642913907766343, "num_tokens": 104126193.0, "step": 60035 }, { "entropy": 5.409164667129517, "epoch": 4.67130908383583, "grad_norm": 1.09375, "learning_rate": 0.00030111009828621786, "loss": 4.7417, "mean_token_accuracy": 0.21985155791044236, "num_tokens": 104134806.0, "step": 60040 }, { "entropy": 5.345441293716431, "epoch": 4.6716981132075475, "grad_norm": 1.2109375, "learning_rate": 0.0003010825697478817, "loss": 4.7187, "mean_token_accuracy": 0.22869377136230468, "num_tokens": 104143092.0, "step": 60045 }, { "entropy": 5.403673505783081, "epoch": 4.672087142579265, "grad_norm": 1.1640625, "learning_rate": 0.000301055040813784, "loss": 4.7734, "mean_token_accuracy": 0.22186497896909713, "num_tokens": 104151561.0, "step": 60050 }, { "entropy": 5.421459054946899, "epoch": 4.672476171950982, "grad_norm": 1.1640625, "learning_rate": 0.00030102751148434255, "loss": 4.7488, "mean_token_accuracy": 0.2309314489364624, "num_tokens": 104159468.0, "step": 60055 }, { "entropy": 5.320933723449707, "epoch": 4.6728652013227, "grad_norm": 1.21875, "learning_rate": 0.000300999981759975, "loss": 4.6787, "mean_token_accuracy": 0.23188885897397996, "num_tokens": 104167452.0, "step": 60060 }, { "entropy": 5.278049468994141, "epoch": 4.673254230694417, "grad_norm": 1.1484375, "learning_rate": 0.0003009724516410992, "loss": 4.6384, "mean_token_accuracy": 0.23615677505731583, "num_tokens": 104175821.0, "step": 60065 }, { "entropy": 5.210593843460083, "epoch": 4.673643260066135, "grad_norm": 1.1875, "learning_rate": 0.0003009449211281328, "loss": 4.6804, "mean_token_accuracy": 0.23629230558872222, "num_tokens": 104184221.0, "step": 60070 }, { "entropy": 5.399457836151123, "epoch": 4.674032289437853, "grad_norm": 1.1484375, "learning_rate": 0.0003009173902214934, "loss": 4.7612, "mean_token_accuracy": 0.21897516697645186, "num_tokens": 104192991.0, "step": 60075 }, { "entropy": 5.388724946975708, "epoch": 4.6744213188095705, "grad_norm": 1.1875, "learning_rate": 0.0003008898589215989, "loss": 4.7079, "mean_token_accuracy": 0.22104968279600143, "num_tokens": 104201262.0, "step": 60080 }, { "entropy": 5.4223753929138185, "epoch": 4.674810348181287, "grad_norm": 1.140625, "learning_rate": 0.00030086232722886704, "loss": 4.9469, "mean_token_accuracy": 0.20952533334493637, "num_tokens": 104209794.0, "step": 60085 }, { "entropy": 5.506208276748657, "epoch": 4.675199377553005, "grad_norm": 1.3046875, "learning_rate": 0.00030083479514371545, "loss": 4.9284, "mean_token_accuracy": 0.20567905008792878, "num_tokens": 104217941.0, "step": 60090 }, { "entropy": 5.42679877281189, "epoch": 4.675588406924723, "grad_norm": 1.1640625, "learning_rate": 0.00030080726266656205, "loss": 4.8363, "mean_token_accuracy": 0.21523621827363967, "num_tokens": 104227077.0, "step": 60095 }, { "entropy": 5.440836429595947, "epoch": 4.67597743629644, "grad_norm": 1.21875, "learning_rate": 0.0003007797297978245, "loss": 4.7659, "mean_token_accuracy": 0.22364491671323777, "num_tokens": 104236015.0, "step": 60100 }, { "entropy": 5.41000599861145, "epoch": 4.676366465668158, "grad_norm": 1.25, "learning_rate": 0.0003007521965379206, "loss": 4.7287, "mean_token_accuracy": 0.225263774394989, "num_tokens": 104244390.0, "step": 60105 }, { "entropy": 5.419080543518066, "epoch": 4.676755495039876, "grad_norm": 1.28125, "learning_rate": 0.000300724662887268, "loss": 4.8213, "mean_token_accuracy": 0.21655511111021042, "num_tokens": 104253307.0, "step": 60110 }, { "entropy": 5.378915500640869, "epoch": 4.6771445244115935, "grad_norm": 1.1953125, "learning_rate": 0.00030069712884628477, "loss": 4.7425, "mean_token_accuracy": 0.23066506236791612, "num_tokens": 104261378.0, "step": 60115 }, { "entropy": 5.339394855499267, "epoch": 4.67753355378331, "grad_norm": 1.2421875, "learning_rate": 0.0003006695944153883, "loss": 4.6844, "mean_token_accuracy": 0.23073328882455826, "num_tokens": 104270008.0, "step": 60120 }, { "entropy": 5.404970407485962, "epoch": 4.677922583155028, "grad_norm": 1.2109375, "learning_rate": 0.0003006420595949967, "loss": 4.8144, "mean_token_accuracy": 0.22418383955955506, "num_tokens": 104278495.0, "step": 60125 }, { "entropy": 5.402882146835327, "epoch": 4.678311612526746, "grad_norm": 1.2421875, "learning_rate": 0.00030061452438552767, "loss": 4.7452, "mean_token_accuracy": 0.22842894792556762, "num_tokens": 104286227.0, "step": 60130 }, { "entropy": 5.401876974105835, "epoch": 4.678700641898463, "grad_norm": 1.2421875, "learning_rate": 0.000300586988787399, "loss": 4.82, "mean_token_accuracy": 0.225905741751194, "num_tokens": 104295279.0, "step": 60135 }, { "entropy": 5.388350772857666, "epoch": 4.679089671270181, "grad_norm": 1.140625, "learning_rate": 0.00030055945280102844, "loss": 4.7488, "mean_token_accuracy": 0.22071312814950944, "num_tokens": 104304551.0, "step": 60140 }, { "entropy": 5.374317026138305, "epoch": 4.679478700641899, "grad_norm": 1.125, "learning_rate": 0.00030053191642683393, "loss": 4.7138, "mean_token_accuracy": 0.22631774693727494, "num_tokens": 104313072.0, "step": 60145 }, { "entropy": 5.467886638641358, "epoch": 4.679867730013616, "grad_norm": 1.2421875, "learning_rate": 0.0003005043796652332, "loss": 4.8496, "mean_token_accuracy": 0.21799646317958832, "num_tokens": 104321556.0, "step": 60150 }, { "entropy": 5.420023632049561, "epoch": 4.680256759385333, "grad_norm": 1.1640625, "learning_rate": 0.00030047684251664417, "loss": 4.8225, "mean_token_accuracy": 0.22314722537994386, "num_tokens": 104331076.0, "step": 60155 }, { "entropy": 5.349316501617432, "epoch": 4.680645788757051, "grad_norm": 1.15625, "learning_rate": 0.0003004493049814845, "loss": 4.7845, "mean_token_accuracy": 0.22418000549077988, "num_tokens": 104340550.0, "step": 60160 }, { "entropy": 5.386523914337158, "epoch": 4.681034818128769, "grad_norm": 1.1640625, "learning_rate": 0.00030042176706017215, "loss": 4.7413, "mean_token_accuracy": 0.22461476027965546, "num_tokens": 104349189.0, "step": 60165 }, { "entropy": 5.425446653366089, "epoch": 4.681423847500486, "grad_norm": 1.21875, "learning_rate": 0.00030039422875312495, "loss": 4.7864, "mean_token_accuracy": 0.2179361790418625, "num_tokens": 104357272.0, "step": 60170 }, { "entropy": 5.396423578262329, "epoch": 4.681812876872204, "grad_norm": 1.2578125, "learning_rate": 0.00030036669006076075, "loss": 4.8112, "mean_token_accuracy": 0.22226592153310776, "num_tokens": 104365876.0, "step": 60175 }, { "entropy": 5.286186933517456, "epoch": 4.682201906243922, "grad_norm": 1.0859375, "learning_rate": 0.00030033915098349746, "loss": 4.6998, "mean_token_accuracy": 0.23372445851564408, "num_tokens": 104374819.0, "step": 60180 }, { "entropy": 5.3681684017181395, "epoch": 4.682590935615639, "grad_norm": 1.1796875, "learning_rate": 0.0003003116115217529, "loss": 4.7737, "mean_token_accuracy": 0.22794780135154724, "num_tokens": 104383108.0, "step": 60185 }, { "entropy": 5.3533162593841555, "epoch": 4.682979964987356, "grad_norm": 1.2578125, "learning_rate": 0.00030028407167594486, "loss": 4.7958, "mean_token_accuracy": 0.22355110794305802, "num_tokens": 104391765.0, "step": 60190 }, { "entropy": 5.441995143890381, "epoch": 4.683368994359074, "grad_norm": 1.1484375, "learning_rate": 0.0003002565314464913, "loss": 4.8266, "mean_token_accuracy": 0.21691330671310424, "num_tokens": 104400148.0, "step": 60195 }, { "entropy": 5.388433933258057, "epoch": 4.683758023730792, "grad_norm": 1.203125, "learning_rate": 0.00030022899083381006, "loss": 4.7043, "mean_token_accuracy": 0.2246743142604828, "num_tokens": 104409071.0, "step": 60200 }, { "entropy": 5.3608098983764645, "epoch": 4.684147053102509, "grad_norm": 1.2109375, "learning_rate": 0.000300201449838319, "loss": 4.7096, "mean_token_accuracy": 0.2297302395105362, "num_tokens": 104418009.0, "step": 60205 }, { "entropy": 5.346059799194336, "epoch": 4.684536082474227, "grad_norm": 1.1640625, "learning_rate": 0.0003001739084604361, "loss": 4.7892, "mean_token_accuracy": 0.23155113607645034, "num_tokens": 104426705.0, "step": 60210 }, { "entropy": 5.450073766708374, "epoch": 4.684925111845945, "grad_norm": 1.1875, "learning_rate": 0.00030014636670057913, "loss": 4.8621, "mean_token_accuracy": 0.2165462151169777, "num_tokens": 104435366.0, "step": 60215 }, { "entropy": 5.455569744110107, "epoch": 4.6853141412176615, "grad_norm": 1.1640625, "learning_rate": 0.0003001188245591662, "loss": 4.902, "mean_token_accuracy": 0.21186133623123168, "num_tokens": 104443441.0, "step": 60220 }, { "entropy": 5.414336442947388, "epoch": 4.685703170589379, "grad_norm": 1.2734375, "learning_rate": 0.0003000912820366151, "loss": 4.7343, "mean_token_accuracy": 0.2263411447405815, "num_tokens": 104452397.0, "step": 60225 }, { "entropy": 5.4703319549560545, "epoch": 4.686092199961097, "grad_norm": 1.1875, "learning_rate": 0.00030006373913334366, "loss": 4.895, "mean_token_accuracy": 0.21586623340845107, "num_tokens": 104461819.0, "step": 60230 }, { "entropy": 5.3592884063720705, "epoch": 4.686481229332815, "grad_norm": 1.1875, "learning_rate": 0.0003000361958497699, "loss": 4.6695, "mean_token_accuracy": 0.22960598021745682, "num_tokens": 104469654.0, "step": 60235 }, { "entropy": 5.365390300750732, "epoch": 4.686870258704532, "grad_norm": 1.234375, "learning_rate": 0.0003000086521863116, "loss": 4.742, "mean_token_accuracy": 0.23242188096046448, "num_tokens": 104477909.0, "step": 60240 }, { "entropy": 5.354189205169678, "epoch": 4.68725928807625, "grad_norm": 1.203125, "learning_rate": 0.000299981108143387, "loss": 4.7268, "mean_token_accuracy": 0.22358058243989945, "num_tokens": 104486849.0, "step": 60245 }, { "entropy": 5.360296821594238, "epoch": 4.687648317447968, "grad_norm": 1.1640625, "learning_rate": 0.00029995356372141367, "loss": 4.7764, "mean_token_accuracy": 0.2258102849125862, "num_tokens": 104496036.0, "step": 60250 }, { "entropy": 5.290598392486572, "epoch": 4.6880373468196845, "grad_norm": 1.125, "learning_rate": 0.0002999260189208098, "loss": 4.6637, "mean_token_accuracy": 0.2367432877421379, "num_tokens": 104504755.0, "step": 60255 }, { "entropy": 5.404932117462158, "epoch": 4.688426376191402, "grad_norm": 1.2265625, "learning_rate": 0.00029989847374199333, "loss": 4.747, "mean_token_accuracy": 0.2247995063662529, "num_tokens": 104512375.0, "step": 60260 }, { "entropy": 5.387936449050903, "epoch": 4.68881540556312, "grad_norm": 1.0625, "learning_rate": 0.00029987092818538217, "loss": 4.7109, "mean_token_accuracy": 0.22521898299455642, "num_tokens": 104521351.0, "step": 60265 }, { "entropy": 5.338318586349487, "epoch": 4.689204434934838, "grad_norm": 1.15625, "learning_rate": 0.00029984338225139405, "loss": 4.7487, "mean_token_accuracy": 0.229100102186203, "num_tokens": 104529854.0, "step": 60270 }, { "entropy": 5.401294183731079, "epoch": 4.689593464306555, "grad_norm": 1.2890625, "learning_rate": 0.0002998158359404473, "loss": 4.8573, "mean_token_accuracy": 0.21474246084690093, "num_tokens": 104538417.0, "step": 60275 }, { "entropy": 5.407567930221558, "epoch": 4.689982493678273, "grad_norm": 1.1875, "learning_rate": 0.0002997882892529597, "loss": 4.8497, "mean_token_accuracy": 0.22154248952865602, "num_tokens": 104547572.0, "step": 60280 }, { "entropy": 5.416397619247436, "epoch": 4.69037152304999, "grad_norm": 1.21875, "learning_rate": 0.0002997607421893493, "loss": 4.7737, "mean_token_accuracy": 0.2249545469880104, "num_tokens": 104556529.0, "step": 60285 }, { "entropy": 5.374614429473877, "epoch": 4.6907605524217075, "grad_norm": 1.1328125, "learning_rate": 0.000299733194750034, "loss": 4.6591, "mean_token_accuracy": 0.22901337146759032, "num_tokens": 104564810.0, "step": 60290 }, { "entropy": 5.45711932182312, "epoch": 4.691149581793425, "grad_norm": 1.3203125, "learning_rate": 0.0002997056469354319, "loss": 4.8869, "mean_token_accuracy": 0.21583421975374223, "num_tokens": 104573983.0, "step": 60295 }, { "entropy": 5.45582218170166, "epoch": 4.691538611165143, "grad_norm": 1.2421875, "learning_rate": 0.0002996780987459609, "loss": 4.8235, "mean_token_accuracy": 0.2177221342921257, "num_tokens": 104582026.0, "step": 60300 }, { "entropy": 5.439003562927246, "epoch": 4.691927640536861, "grad_norm": 1.265625, "learning_rate": 0.0002996505501820391, "loss": 4.8528, "mean_token_accuracy": 0.218086639046669, "num_tokens": 104590455.0, "step": 60305 }, { "entropy": 5.352758884429932, "epoch": 4.692316669908578, "grad_norm": 1.3515625, "learning_rate": 0.0002996230012440843, "loss": 4.7658, "mean_token_accuracy": 0.22782424092292786, "num_tokens": 104597970.0, "step": 60310 }, { "entropy": 5.323047542572022, "epoch": 4.692705699280296, "grad_norm": 1.140625, "learning_rate": 0.00029959545193251473, "loss": 4.7055, "mean_token_accuracy": 0.2321253687143326, "num_tokens": 104606633.0, "step": 60315 }, { "entropy": 5.420656681060791, "epoch": 4.693094728652014, "grad_norm": 1.203125, "learning_rate": 0.00029956790224774834, "loss": 4.8286, "mean_token_accuracy": 0.21114153563976287, "num_tokens": 104614943.0, "step": 60320 }, { "entropy": 5.413617897033691, "epoch": 4.6934837580237305, "grad_norm": 1.1796875, "learning_rate": 0.00029954035219020305, "loss": 4.8269, "mean_token_accuracy": 0.2167972892522812, "num_tokens": 104624031.0, "step": 60325 }, { "entropy": 5.384133958816529, "epoch": 4.693872787395448, "grad_norm": 1.2890625, "learning_rate": 0.00029951280176029703, "loss": 4.7219, "mean_token_accuracy": 0.22871862649917601, "num_tokens": 104632923.0, "step": 60330 }, { "entropy": 5.399416303634643, "epoch": 4.694261816767166, "grad_norm": 1.2265625, "learning_rate": 0.00029948525095844825, "loss": 4.7763, "mean_token_accuracy": 0.21840869784355163, "num_tokens": 104641551.0, "step": 60335 }, { "entropy": 5.303564500808716, "epoch": 4.694650846138884, "grad_norm": 1.203125, "learning_rate": 0.0002994576997850748, "loss": 4.6789, "mean_token_accuracy": 0.23053375482559205, "num_tokens": 104649851.0, "step": 60340 }, { "entropy": 5.413760328292847, "epoch": 4.695039875510601, "grad_norm": 1.109375, "learning_rate": 0.0002994301482405946, "loss": 4.8525, "mean_token_accuracy": 0.21939559876918793, "num_tokens": 104658388.0, "step": 60345 }, { "entropy": 5.386781930923462, "epoch": 4.695428904882318, "grad_norm": 1.15625, "learning_rate": 0.0002994025963254259, "loss": 4.7528, "mean_token_accuracy": 0.22399701327085494, "num_tokens": 104667117.0, "step": 60350 }, { "entropy": 5.377438116073608, "epoch": 4.695817934254036, "grad_norm": 1.078125, "learning_rate": 0.0002993750440399866, "loss": 4.7269, "mean_token_accuracy": 0.22762708216905594, "num_tokens": 104675877.0, "step": 60355 }, { "entropy": 5.479869985580445, "epoch": 4.6962069636257535, "grad_norm": 1.25, "learning_rate": 0.0002993474913846948, "loss": 4.949, "mean_token_accuracy": 0.21404290348291397, "num_tokens": 104684872.0, "step": 60360 }, { "entropy": 5.477115774154663, "epoch": 4.696595992997471, "grad_norm": 1.1328125, "learning_rate": 0.0002993199383599685, "loss": 4.8385, "mean_token_accuracy": 0.2203797683119774, "num_tokens": 104694015.0, "step": 60365 }, { "entropy": 5.578516483306885, "epoch": 4.696985022369189, "grad_norm": 1.2421875, "learning_rate": 0.0002992923849662259, "loss": 4.9793, "mean_token_accuracy": 0.21035704761743546, "num_tokens": 104702627.0, "step": 60370 }, { "entropy": 5.486182689666748, "epoch": 4.697374051740907, "grad_norm": 1.1953125, "learning_rate": 0.00029926483120388506, "loss": 4.8378, "mean_token_accuracy": 0.2162863075733185, "num_tokens": 104711738.0, "step": 60375 }, { "entropy": 5.44186692237854, "epoch": 4.697763081112624, "grad_norm": 1.2109375, "learning_rate": 0.000299237277073364, "loss": 4.7411, "mean_token_accuracy": 0.22660953551530838, "num_tokens": 104721066.0, "step": 60380 }, { "entropy": 5.391833877563476, "epoch": 4.698152110484342, "grad_norm": 1.1640625, "learning_rate": 0.0002992097225750808, "loss": 4.7871, "mean_token_accuracy": 0.2217494234442711, "num_tokens": 104729747.0, "step": 60385 }, { "entropy": 5.351077222824097, "epoch": 4.698541139856059, "grad_norm": 1.171875, "learning_rate": 0.00029918216770945363, "loss": 4.6236, "mean_token_accuracy": 0.23450458645820618, "num_tokens": 104738630.0, "step": 60390 }, { "entropy": 5.271799373626709, "epoch": 4.6989301692277765, "grad_norm": 1.25, "learning_rate": 0.0002991546124769005, "loss": 4.6957, "mean_token_accuracy": 0.2337660387158394, "num_tokens": 104746564.0, "step": 60395 }, { "entropy": 5.247576951980591, "epoch": 4.699319198599494, "grad_norm": 1.140625, "learning_rate": 0.0002991270568778396, "loss": 4.6706, "mean_token_accuracy": 0.23339837044477463, "num_tokens": 104755589.0, "step": 60400 }, { "entropy": 5.3798693180084225, "epoch": 4.699708227971212, "grad_norm": 1.2109375, "learning_rate": 0.0002990995009126891, "loss": 4.849, "mean_token_accuracy": 0.21535152941942215, "num_tokens": 104764608.0, "step": 60405 }, { "entropy": 5.442778825759888, "epoch": 4.70009725734293, "grad_norm": 1.2734375, "learning_rate": 0.0002990719445818669, "loss": 4.8127, "mean_token_accuracy": 0.22578059434890746, "num_tokens": 104772363.0, "step": 60410 }, { "entropy": 5.371535015106201, "epoch": 4.700486286714647, "grad_norm": 1.21875, "learning_rate": 0.0002990443878857914, "loss": 4.7557, "mean_token_accuracy": 0.23090972900390624, "num_tokens": 104781461.0, "step": 60415 }, { "entropy": 5.25320839881897, "epoch": 4.700875316086364, "grad_norm": 1.2265625, "learning_rate": 0.00029901683082488045, "loss": 4.6448, "mean_token_accuracy": 0.23372883051633836, "num_tokens": 104789966.0, "step": 60420 }, { "entropy": 5.322723817825318, "epoch": 4.701264345458082, "grad_norm": 1.1640625, "learning_rate": 0.0002989892733995524, "loss": 4.7448, "mean_token_accuracy": 0.22545391619205474, "num_tokens": 104798289.0, "step": 60425 }, { "entropy": 5.4582967281341555, "epoch": 4.7016533748297995, "grad_norm": 1.234375, "learning_rate": 0.0002989617156102253, "loss": 4.8655, "mean_token_accuracy": 0.22121088206768036, "num_tokens": 104807189.0, "step": 60430 }, { "entropy": 5.369121456146241, "epoch": 4.702042404201517, "grad_norm": 1.203125, "learning_rate": 0.0002989341574573172, "loss": 4.672, "mean_token_accuracy": 0.22906961292028427, "num_tokens": 104816150.0, "step": 60435 }, { "entropy": 5.318262195587158, "epoch": 4.702431433573235, "grad_norm": 1.1640625, "learning_rate": 0.00029890659894124647, "loss": 4.6514, "mean_token_accuracy": 0.22709394842386246, "num_tokens": 104824323.0, "step": 60440 }, { "entropy": 5.32560248374939, "epoch": 4.702820462944953, "grad_norm": 1.1875, "learning_rate": 0.0002988790400624312, "loss": 4.7901, "mean_token_accuracy": 0.2174514651298523, "num_tokens": 104833341.0, "step": 60445 }, { "entropy": 5.411396837234497, "epoch": 4.70320949231667, "grad_norm": 1.1875, "learning_rate": 0.0002988514808212894, "loss": 4.7711, "mean_token_accuracy": 0.22721890807151796, "num_tokens": 104841570.0, "step": 60450 }, { "entropy": 5.518634796142578, "epoch": 4.703598521688387, "grad_norm": 1.1796875, "learning_rate": 0.0002988239212182394, "loss": 4.8852, "mean_token_accuracy": 0.21117112338542937, "num_tokens": 104851673.0, "step": 60455 }, { "entropy": 5.419036436080932, "epoch": 4.703987551060105, "grad_norm": 1.21875, "learning_rate": 0.0002987963612536993, "loss": 4.7759, "mean_token_accuracy": 0.22906404733657837, "num_tokens": 104860198.0, "step": 60460 }, { "entropy": 5.369667959213257, "epoch": 4.7043765804318225, "grad_norm": 1.171875, "learning_rate": 0.00029876880092808724, "loss": 4.7221, "mean_token_accuracy": 0.22666166424751283, "num_tokens": 104868243.0, "step": 60465 }, { "entropy": 5.377785158157349, "epoch": 4.70476560980354, "grad_norm": 1.1875, "learning_rate": 0.0002987412402418215, "loss": 4.818, "mean_token_accuracy": 0.23084015697240828, "num_tokens": 104877473.0, "step": 60470 }, { "entropy": 5.361766386032104, "epoch": 4.705154639175258, "grad_norm": 1.1953125, "learning_rate": 0.00029871367919532014, "loss": 4.6882, "mean_token_accuracy": 0.23672889471054076, "num_tokens": 104885942.0, "step": 60475 }, { "entropy": 5.479023551940918, "epoch": 4.705543668546976, "grad_norm": 1.3125, "learning_rate": 0.0002986861177890016, "loss": 4.7813, "mean_token_accuracy": 0.227249351143837, "num_tokens": 104894299.0, "step": 60480 }, { "entropy": 5.313975715637207, "epoch": 4.705932697918692, "grad_norm": 1.2109375, "learning_rate": 0.0002986585560232838, "loss": 4.6812, "mean_token_accuracy": 0.2312782123684883, "num_tokens": 104902658.0, "step": 60485 }, { "entropy": 5.277635812759399, "epoch": 4.70632172729041, "grad_norm": 1.203125, "learning_rate": 0.00029863099389858516, "loss": 4.6515, "mean_token_accuracy": 0.22762805074453354, "num_tokens": 104911351.0, "step": 60490 }, { "entropy": 5.472627115249634, "epoch": 4.706710756662128, "grad_norm": 1.1875, "learning_rate": 0.0002986034314153238, "loss": 4.8532, "mean_token_accuracy": 0.2159953758120537, "num_tokens": 104921064.0, "step": 60495 }, { "entropy": 5.450775289535523, "epoch": 4.7070997860338455, "grad_norm": 1.140625, "learning_rate": 0.00029857586857391796, "loss": 4.7667, "mean_token_accuracy": 0.2128722682595253, "num_tokens": 104929723.0, "step": 60500 }, { "entropy": 5.39575161933899, "epoch": 4.707488815405563, "grad_norm": 1.2109375, "learning_rate": 0.00029854830537478567, "loss": 4.8334, "mean_token_accuracy": 0.2261297360062599, "num_tokens": 104939215.0, "step": 60505 }, { "entropy": 5.413983583450317, "epoch": 4.707877844777281, "grad_norm": 1.234375, "learning_rate": 0.00029852074181834545, "loss": 4.7898, "mean_token_accuracy": 0.22414161264896393, "num_tokens": 104948062.0, "step": 60510 }, { "entropy": 5.460183715820312, "epoch": 4.708266874148999, "grad_norm": 1.1640625, "learning_rate": 0.00029849317790501536, "loss": 4.7875, "mean_token_accuracy": 0.22126740366220474, "num_tokens": 104957495.0, "step": 60515 }, { "entropy": 5.413878107070923, "epoch": 4.708655903520716, "grad_norm": 1.203125, "learning_rate": 0.00029846561363521375, "loss": 4.9029, "mean_token_accuracy": 0.21352116912603378, "num_tokens": 104966049.0, "step": 60520 }, { "entropy": 5.362669801712036, "epoch": 4.709044932892433, "grad_norm": 1.25, "learning_rate": 0.0002984380490093588, "loss": 4.6737, "mean_token_accuracy": 0.23406160920858382, "num_tokens": 104973957.0, "step": 60525 }, { "entropy": 5.410939264297485, "epoch": 4.709433962264151, "grad_norm": 1.1484375, "learning_rate": 0.0002984104840278687, "loss": 4.8374, "mean_token_accuracy": 0.2175553858280182, "num_tokens": 104982960.0, "step": 60530 }, { "entropy": 5.385405778884888, "epoch": 4.7098229916358685, "grad_norm": 1.2109375, "learning_rate": 0.0002983829186911618, "loss": 4.845, "mean_token_accuracy": 0.21627107411623, "num_tokens": 104992251.0, "step": 60535 }, { "entropy": 5.374772548675537, "epoch": 4.710212021007586, "grad_norm": 1.21875, "learning_rate": 0.00029835535299965635, "loss": 4.7867, "mean_token_accuracy": 0.22377547919750213, "num_tokens": 105000304.0, "step": 60540 }, { "entropy": 5.474846220016479, "epoch": 4.710601050379304, "grad_norm": 1.1484375, "learning_rate": 0.00029832778695377057, "loss": 4.8227, "mean_token_accuracy": 0.21919759064912797, "num_tokens": 105008643.0, "step": 60545 }, { "entropy": 5.31832480430603, "epoch": 4.710990079751022, "grad_norm": 1.125, "learning_rate": 0.00029830022055392277, "loss": 4.6869, "mean_token_accuracy": 0.2293759897351265, "num_tokens": 105017865.0, "step": 60550 }, { "entropy": 5.381431007385254, "epoch": 4.711379109122738, "grad_norm": 1.25, "learning_rate": 0.00029827265380053116, "loss": 4.7726, "mean_token_accuracy": 0.2261948898434639, "num_tokens": 105025638.0, "step": 60555 }, { "entropy": 5.46579008102417, "epoch": 4.711768138494456, "grad_norm": 1.203125, "learning_rate": 0.0002982450866940141, "loss": 4.9033, "mean_token_accuracy": 0.2154247835278511, "num_tokens": 105034526.0, "step": 60560 }, { "entropy": 5.3371203422546385, "epoch": 4.712157167866174, "grad_norm": 1.25, "learning_rate": 0.0002982175192347899, "loss": 4.645, "mean_token_accuracy": 0.23753733783960343, "num_tokens": 105043059.0, "step": 60565 }, { "entropy": 5.415519332885742, "epoch": 4.7125461972378915, "grad_norm": 1.15625, "learning_rate": 0.0002981899514232767, "loss": 4.8439, "mean_token_accuracy": 0.22339830547571182, "num_tokens": 105051937.0, "step": 60570 }, { "entropy": 5.328790140151978, "epoch": 4.712935226609609, "grad_norm": 1.1015625, "learning_rate": 0.000298162383259893, "loss": 4.7305, "mean_token_accuracy": 0.2258306249976158, "num_tokens": 105061304.0, "step": 60575 }, { "entropy": 5.345498752593994, "epoch": 4.713324255981327, "grad_norm": 1.2265625, "learning_rate": 0.00029813481474505693, "loss": 4.7145, "mean_token_accuracy": 0.22235454022884368, "num_tokens": 105069871.0, "step": 60580 }, { "entropy": 5.417628955841065, "epoch": 4.713713285353045, "grad_norm": 1.2109375, "learning_rate": 0.00029810724587918684, "loss": 4.7601, "mean_token_accuracy": 0.22741216868162156, "num_tokens": 105078616.0, "step": 60585 }, { "entropy": 5.332662153244018, "epoch": 4.714102314724761, "grad_norm": 1.296875, "learning_rate": 0.0002980796766627012, "loss": 4.6432, "mean_token_accuracy": 0.23454943150281907, "num_tokens": 105086135.0, "step": 60590 }, { "entropy": 5.344504499435425, "epoch": 4.714491344096479, "grad_norm": 1.1640625, "learning_rate": 0.0002980521070960181, "loss": 4.765, "mean_token_accuracy": 0.2268511325120926, "num_tokens": 105094933.0, "step": 60595 }, { "entropy": 5.422547769546509, "epoch": 4.714880373468197, "grad_norm": 1.1640625, "learning_rate": 0.00029802453717955597, "loss": 4.8481, "mean_token_accuracy": 0.22450993210077286, "num_tokens": 105104198.0, "step": 60600 }, { "entropy": 5.361999273300171, "epoch": 4.7152694028399145, "grad_norm": 1.2578125, "learning_rate": 0.0002979969669137332, "loss": 4.7538, "mean_token_accuracy": 0.2271420270204544, "num_tokens": 105112733.0, "step": 60605 }, { "entropy": 5.464924478530884, "epoch": 4.715658432211632, "grad_norm": 1.1875, "learning_rate": 0.000297969396298968, "loss": 4.8138, "mean_token_accuracy": 0.22097700834274292, "num_tokens": 105121296.0, "step": 60610 }, { "entropy": 5.3705606937408445, "epoch": 4.71604746158335, "grad_norm": 1.1640625, "learning_rate": 0.0002979418253356788, "loss": 4.7698, "mean_token_accuracy": 0.22860443890094756, "num_tokens": 105130056.0, "step": 60615 }, { "entropy": 5.40941596031189, "epoch": 4.716436490955067, "grad_norm": 1.265625, "learning_rate": 0.0002979142540242839, "loss": 4.7048, "mean_token_accuracy": 0.23447709083557128, "num_tokens": 105138400.0, "step": 60620 }, { "entropy": 5.348446226119995, "epoch": 4.716825520326784, "grad_norm": 1.296875, "learning_rate": 0.00029788668236520164, "loss": 4.8352, "mean_token_accuracy": 0.22121359258890153, "num_tokens": 105146544.0, "step": 60625 }, { "entropy": 5.497742319107056, "epoch": 4.717214549698502, "grad_norm": 1.1640625, "learning_rate": 0.00029785911035885046, "loss": 4.8976, "mean_token_accuracy": 0.2159128487110138, "num_tokens": 105155404.0, "step": 60630 }, { "entropy": 5.479377555847168, "epoch": 4.71760357907022, "grad_norm": 1.2109375, "learning_rate": 0.00029783153800564863, "loss": 4.8624, "mean_token_accuracy": 0.2220592603087425, "num_tokens": 105165292.0, "step": 60635 }, { "entropy": 5.470874881744384, "epoch": 4.7179926084419375, "grad_norm": 1.25, "learning_rate": 0.00029780396530601456, "loss": 4.8766, "mean_token_accuracy": 0.21533263027667998, "num_tokens": 105174149.0, "step": 60640 }, { "entropy": 5.4024450302124025, "epoch": 4.718381637813655, "grad_norm": 1.1875, "learning_rate": 0.00029777639226036663, "loss": 4.7966, "mean_token_accuracy": 0.21946212649345398, "num_tokens": 105183277.0, "step": 60645 }, { "entropy": 5.506145906448364, "epoch": 4.718770667185373, "grad_norm": 1.28125, "learning_rate": 0.0002977488188691232, "loss": 4.9637, "mean_token_accuracy": 0.21099164783954621, "num_tokens": 105191789.0, "step": 60650 }, { "entropy": 5.45927882194519, "epoch": 4.7191596965570906, "grad_norm": 1.1171875, "learning_rate": 0.0002977212451327026, "loss": 4.7724, "mean_token_accuracy": 0.22717005610466004, "num_tokens": 105200619.0, "step": 60655 }, { "entropy": 5.364016914367676, "epoch": 4.719548725928807, "grad_norm": 1.125, "learning_rate": 0.0002976936710515233, "loss": 4.8542, "mean_token_accuracy": 0.21881923973560333, "num_tokens": 105209657.0, "step": 60660 }, { "entropy": 5.411705112457275, "epoch": 4.719937755300525, "grad_norm": 1.1875, "learning_rate": 0.00029766609662600367, "loss": 4.8079, "mean_token_accuracy": 0.2255818858742714, "num_tokens": 105218788.0, "step": 60665 }, { "entropy": 5.394647169113159, "epoch": 4.720326784672243, "grad_norm": 1.203125, "learning_rate": 0.00029763852185656206, "loss": 4.7456, "mean_token_accuracy": 0.22670212984085084, "num_tokens": 105227185.0, "step": 60670 }, { "entropy": 5.3910784244537355, "epoch": 4.7207158140439605, "grad_norm": 1.21875, "learning_rate": 0.00029761094674361695, "loss": 4.7964, "mean_token_accuracy": 0.22627199292182923, "num_tokens": 105235594.0, "step": 60675 }, { "entropy": 5.426207828521728, "epoch": 4.721104843415678, "grad_norm": 1.1640625, "learning_rate": 0.00029758337128758675, "loss": 4.8422, "mean_token_accuracy": 0.2224229410290718, "num_tokens": 105244281.0, "step": 60680 }, { "entropy": 5.384992074966431, "epoch": 4.721493872787395, "grad_norm": 1.203125, "learning_rate": 0.0002975557954888898, "loss": 4.7245, "mean_token_accuracy": 0.22402421087026597, "num_tokens": 105252212.0, "step": 60685 }, { "entropy": 5.468262338638306, "epoch": 4.721882902159113, "grad_norm": 1.265625, "learning_rate": 0.00029752821934794457, "loss": 4.9707, "mean_token_accuracy": 0.2129919484257698, "num_tokens": 105260704.0, "step": 60690 }, { "entropy": 5.395763921737671, "epoch": 4.72227193153083, "grad_norm": 1.1875, "learning_rate": 0.00029750064286516943, "loss": 4.7595, "mean_token_accuracy": 0.22723571956157684, "num_tokens": 105270262.0, "step": 60695 }, { "entropy": 5.463924980163574, "epoch": 4.722660960902548, "grad_norm": 1.21875, "learning_rate": 0.0002974730660409828, "loss": 4.8356, "mean_token_accuracy": 0.21521886438131332, "num_tokens": 105278647.0, "step": 60700 }, { "entropy": 5.3655601978302006, "epoch": 4.723049990274266, "grad_norm": 1.203125, "learning_rate": 0.00029744548887580325, "loss": 4.7586, "mean_token_accuracy": 0.22643764764070512, "num_tokens": 105287239.0, "step": 60705 }, { "entropy": 5.401728391647339, "epoch": 4.7234390196459834, "grad_norm": 1.1953125, "learning_rate": 0.00029741791137004916, "loss": 4.7576, "mean_token_accuracy": 0.22341520041227342, "num_tokens": 105295636.0, "step": 60710 }, { "entropy": 5.407438898086548, "epoch": 4.723828049017701, "grad_norm": 1.21875, "learning_rate": 0.00029739033352413883, "loss": 4.8147, "mean_token_accuracy": 0.22686165571212769, "num_tokens": 105304370.0, "step": 60715 }, { "entropy": 5.385833883285523, "epoch": 4.724217078389419, "grad_norm": 1.2265625, "learning_rate": 0.00029736275533849094, "loss": 4.8682, "mean_token_accuracy": 0.2145046263933182, "num_tokens": 105313293.0, "step": 60720 }, { "entropy": 5.452903366088867, "epoch": 4.724606107761136, "grad_norm": 1.28125, "learning_rate": 0.0002973351768135239, "loss": 4.7791, "mean_token_accuracy": 0.22150887697935104, "num_tokens": 105320902.0, "step": 60725 }, { "entropy": 5.437490367889405, "epoch": 4.724995137132853, "grad_norm": 1.21875, "learning_rate": 0.00029730759794965595, "loss": 4.8871, "mean_token_accuracy": 0.21357990503311158, "num_tokens": 105329869.0, "step": 60730 }, { "entropy": 5.445147132873535, "epoch": 4.725384166504571, "grad_norm": 1.21875, "learning_rate": 0.0002972800187473057, "loss": 4.831, "mean_token_accuracy": 0.21722299307584764, "num_tokens": 105338310.0, "step": 60735 }, { "entropy": 5.426887083053589, "epoch": 4.725773195876289, "grad_norm": 1.2890625, "learning_rate": 0.00029725243920689163, "loss": 4.7823, "mean_token_accuracy": 0.21699030548334122, "num_tokens": 105347265.0, "step": 60740 }, { "entropy": 5.402003526687622, "epoch": 4.726162225248006, "grad_norm": 1.2265625, "learning_rate": 0.00029722485932883233, "loss": 4.7716, "mean_token_accuracy": 0.2251127690076828, "num_tokens": 105355368.0, "step": 60745 }, { "entropy": 5.388609790802002, "epoch": 4.726551254619724, "grad_norm": 1.1484375, "learning_rate": 0.00029719727911354604, "loss": 4.8186, "mean_token_accuracy": 0.21800445765256882, "num_tokens": 105364977.0, "step": 60750 }, { "entropy": 5.481606769561767, "epoch": 4.726940283991441, "grad_norm": 1.25, "learning_rate": 0.00029716969856145143, "loss": 4.827, "mean_token_accuracy": 0.2246081590652466, "num_tokens": 105374088.0, "step": 60755 }, { "entropy": 5.386549949645996, "epoch": 4.727329313363159, "grad_norm": 1.140625, "learning_rate": 0.00029714211767296693, "loss": 4.6793, "mean_token_accuracy": 0.23195631802082062, "num_tokens": 105382925.0, "step": 60760 }, { "entropy": 5.4242490291595455, "epoch": 4.727718342734876, "grad_norm": 1.125, "learning_rate": 0.0002971145364485111, "loss": 4.74, "mean_token_accuracy": 0.22623523324728012, "num_tokens": 105392586.0, "step": 60765 }, { "entropy": 5.373070526123047, "epoch": 4.728107372106594, "grad_norm": 1.1796875, "learning_rate": 0.0002970869548885023, "loss": 4.7528, "mean_token_accuracy": 0.22661541104316713, "num_tokens": 105401092.0, "step": 60770 }, { "entropy": 5.358581781387329, "epoch": 4.728496401478312, "grad_norm": 1.0859375, "learning_rate": 0.0002970593729933591, "loss": 4.8154, "mean_token_accuracy": 0.21873392313718795, "num_tokens": 105410225.0, "step": 60775 }, { "entropy": 5.371318387985229, "epoch": 4.728885430850029, "grad_norm": 1.21875, "learning_rate": 0.00029703179076350005, "loss": 4.7156, "mean_token_accuracy": 0.22888160943984986, "num_tokens": 105418214.0, "step": 60780 }, { "entropy": 5.443757772445679, "epoch": 4.729274460221747, "grad_norm": 1.1796875, "learning_rate": 0.00029700420819934363, "loss": 4.8575, "mean_token_accuracy": 0.22139487117528917, "num_tokens": 105427196.0, "step": 60785 }, { "entropy": 5.390106964111328, "epoch": 4.729663489593464, "grad_norm": 1.203125, "learning_rate": 0.00029697662530130836, "loss": 4.7944, "mean_token_accuracy": 0.22351303100585937, "num_tokens": 105435496.0, "step": 60790 }, { "entropy": 5.390697336196899, "epoch": 4.730052518965182, "grad_norm": 1.28125, "learning_rate": 0.0002969490420698129, "loss": 4.7258, "mean_token_accuracy": 0.22501311153173448, "num_tokens": 105443353.0, "step": 60795 }, { "entropy": 5.344409990310669, "epoch": 4.730441548336899, "grad_norm": 1.15625, "learning_rate": 0.00029692145850527553, "loss": 4.7875, "mean_token_accuracy": 0.21797986924648285, "num_tokens": 105451969.0, "step": 60800 }, { "entropy": 5.397104358673095, "epoch": 4.730830577708617, "grad_norm": 1.1328125, "learning_rate": 0.00029689387460811494, "loss": 4.7027, "mean_token_accuracy": 0.22758535146713257, "num_tokens": 105460582.0, "step": 60805 }, { "entropy": 5.287304210662842, "epoch": 4.731219607080335, "grad_norm": 1.265625, "learning_rate": 0.0002968662903787497, "loss": 4.6509, "mean_token_accuracy": 0.23784717917442322, "num_tokens": 105469045.0, "step": 60810 }, { "entropy": 5.4265531539917, "epoch": 4.731608636452052, "grad_norm": 1.25, "learning_rate": 0.0002968387058175983, "loss": 4.7923, "mean_token_accuracy": 0.21973309218883513, "num_tokens": 105477175.0, "step": 60815 }, { "entropy": 5.33932466506958, "epoch": 4.731997665823769, "grad_norm": 1.2109375, "learning_rate": 0.0002968111209250792, "loss": 4.7314, "mean_token_accuracy": 0.2341986194252968, "num_tokens": 105485569.0, "step": 60820 }, { "entropy": 5.47452301979065, "epoch": 4.732386695195487, "grad_norm": 1.203125, "learning_rate": 0.00029678353570161117, "loss": 4.8646, "mean_token_accuracy": 0.2159319654107094, "num_tokens": 105494177.0, "step": 60825 }, { "entropy": 5.430749702453613, "epoch": 4.732775724567205, "grad_norm": 1.1796875, "learning_rate": 0.0002967559501476126, "loss": 4.8401, "mean_token_accuracy": 0.22461995333433152, "num_tokens": 105503678.0, "step": 60830 }, { "entropy": 5.4184314727783205, "epoch": 4.733164753938922, "grad_norm": 1.1796875, "learning_rate": 0.00029672836426350213, "loss": 4.8059, "mean_token_accuracy": 0.22504674643278122, "num_tokens": 105511988.0, "step": 60835 }, { "entropy": 5.489646673202515, "epoch": 4.73355378331064, "grad_norm": 1.203125, "learning_rate": 0.00029670077804969835, "loss": 4.8226, "mean_token_accuracy": 0.22241744101047517, "num_tokens": 105520377.0, "step": 60840 }, { "entropy": 5.459394931793213, "epoch": 4.733942812682358, "grad_norm": 1.2109375, "learning_rate": 0.00029667319150661976, "loss": 4.7217, "mean_token_accuracy": 0.2245567485690117, "num_tokens": 105528863.0, "step": 60845 }, { "entropy": 5.296284008026123, "epoch": 4.734331842054075, "grad_norm": 1.203125, "learning_rate": 0.000296645604634685, "loss": 4.6307, "mean_token_accuracy": 0.23047300726175307, "num_tokens": 105537543.0, "step": 60850 }, { "entropy": 5.350412464141845, "epoch": 4.734720871425793, "grad_norm": 1.1484375, "learning_rate": 0.0002966180174343127, "loss": 4.7837, "mean_token_accuracy": 0.22362377643585205, "num_tokens": 105546895.0, "step": 60855 }, { "entropy": 5.445178842544555, "epoch": 4.73510990079751, "grad_norm": 1.1484375, "learning_rate": 0.00029659042990592125, "loss": 4.8893, "mean_token_accuracy": 0.20818587392568588, "num_tokens": 105555857.0, "step": 60860 }, { "entropy": 5.5068724155426025, "epoch": 4.735498930169228, "grad_norm": 1.2109375, "learning_rate": 0.0002965628420499295, "loss": 4.8321, "mean_token_accuracy": 0.2190171793103218, "num_tokens": 105563835.0, "step": 60865 }, { "entropy": 5.406539344787598, "epoch": 4.735887959540945, "grad_norm": 1.1875, "learning_rate": 0.0002965352538667559, "loss": 4.7933, "mean_token_accuracy": 0.2189328595995903, "num_tokens": 105573001.0, "step": 60870 }, { "entropy": 5.335478782653809, "epoch": 4.736276988912663, "grad_norm": 1.265625, "learning_rate": 0.00029650766535681917, "loss": 4.7314, "mean_token_accuracy": 0.23009627610445021, "num_tokens": 105581718.0, "step": 60875 }, { "entropy": 5.377077913284301, "epoch": 4.736666018284381, "grad_norm": 1.1484375, "learning_rate": 0.00029648007652053774, "loss": 4.7797, "mean_token_accuracy": 0.22028095722198487, "num_tokens": 105590932.0, "step": 60880 }, { "entropy": 5.445408153533935, "epoch": 4.737055047656098, "grad_norm": 1.203125, "learning_rate": 0.00029645248735833045, "loss": 4.7512, "mean_token_accuracy": 0.23277106285095214, "num_tokens": 105599113.0, "step": 60885 }, { "entropy": 5.459812641143799, "epoch": 4.737444077027815, "grad_norm": 1.1484375, "learning_rate": 0.00029642489787061574, "loss": 4.7588, "mean_token_accuracy": 0.2190199926495552, "num_tokens": 105607596.0, "step": 60890 }, { "entropy": 5.399894905090332, "epoch": 4.737833106399533, "grad_norm": 1.2578125, "learning_rate": 0.0002963973080578123, "loss": 4.8338, "mean_token_accuracy": 0.22014791369438172, "num_tokens": 105615667.0, "step": 60895 }, { "entropy": 5.276633024215698, "epoch": 4.738222135771251, "grad_norm": 1.2109375, "learning_rate": 0.00029636971792033873, "loss": 4.6731, "mean_token_accuracy": 0.23273625522851943, "num_tokens": 105624231.0, "step": 60900 }, { "entropy": 5.3891528129577635, "epoch": 4.738611165142968, "grad_norm": 1.2265625, "learning_rate": 0.0002963421274586138, "loss": 4.7212, "mean_token_accuracy": 0.22100729793310164, "num_tokens": 105633415.0, "step": 60905 }, { "entropy": 5.4625410556793215, "epoch": 4.739000194514686, "grad_norm": 1.2265625, "learning_rate": 0.00029631453667305603, "loss": 4.8345, "mean_token_accuracy": 0.21750265955924988, "num_tokens": 105642203.0, "step": 60910 }, { "entropy": 5.499260425567627, "epoch": 4.739389223886404, "grad_norm": 1.359375, "learning_rate": 0.0002962869455640841, "loss": 4.8637, "mean_token_accuracy": 0.2206459864974022, "num_tokens": 105650816.0, "step": 60915 }, { "entropy": 5.362947750091553, "epoch": 4.739778253258121, "grad_norm": 1.234375, "learning_rate": 0.0002962593541321167, "loss": 4.7564, "mean_token_accuracy": 0.22616415470838547, "num_tokens": 105659770.0, "step": 60920 }, { "entropy": 5.442066192626953, "epoch": 4.740167282629838, "grad_norm": 1.203125, "learning_rate": 0.0002962317623775723, "loss": 4.8324, "mean_token_accuracy": 0.21902460008859634, "num_tokens": 105668251.0, "step": 60925 }, { "entropy": 5.394265270233154, "epoch": 4.740556312001556, "grad_norm": 1.2109375, "learning_rate": 0.00029620417030086976, "loss": 4.7643, "mean_token_accuracy": 0.22255380749702453, "num_tokens": 105676945.0, "step": 60930 }, { "entropy": 5.491617107391358, "epoch": 4.740945341373274, "grad_norm": 1.1953125, "learning_rate": 0.00029617657790242767, "loss": 4.8873, "mean_token_accuracy": 0.21985943466424943, "num_tokens": 105686129.0, "step": 60935 }, { "entropy": 5.483660364151001, "epoch": 4.741334370744991, "grad_norm": 1.1796875, "learning_rate": 0.00029614898518266476, "loss": 4.8512, "mean_token_accuracy": 0.2255292519927025, "num_tokens": 105694837.0, "step": 60940 }, { "entropy": 5.393662357330323, "epoch": 4.741723400116709, "grad_norm": 1.203125, "learning_rate": 0.0002961213921419997, "loss": 4.7576, "mean_token_accuracy": 0.2267066165804863, "num_tokens": 105702794.0, "step": 60945 }, { "entropy": 5.314022541046143, "epoch": 4.742112429488427, "grad_norm": 1.21875, "learning_rate": 0.000296093798780851, "loss": 4.6537, "mean_token_accuracy": 0.22447141706943513, "num_tokens": 105711049.0, "step": 60950 }, { "entropy": 5.385110902786255, "epoch": 4.7425014588601435, "grad_norm": 1.1796875, "learning_rate": 0.0002960662050996377, "loss": 4.7283, "mean_token_accuracy": 0.22648329436779022, "num_tokens": 105720071.0, "step": 60955 }, { "entropy": 5.34975962638855, "epoch": 4.742890488231861, "grad_norm": 1.1953125, "learning_rate": 0.00029603861109877807, "loss": 4.8014, "mean_token_accuracy": 0.22421453148126602, "num_tokens": 105728863.0, "step": 60960 }, { "entropy": 5.469671058654785, "epoch": 4.743279517603579, "grad_norm": 1.2265625, "learning_rate": 0.00029601101677869106, "loss": 4.8465, "mean_token_accuracy": 0.21905567049980162, "num_tokens": 105736727.0, "step": 60965 }, { "entropy": 5.441883325576782, "epoch": 4.743668546975297, "grad_norm": 1.21875, "learning_rate": 0.0002959834221397952, "loss": 4.8332, "mean_token_accuracy": 0.219450481235981, "num_tokens": 105745111.0, "step": 60970 }, { "entropy": 5.32754373550415, "epoch": 4.744057576347014, "grad_norm": 1.2421875, "learning_rate": 0.00029595582718250954, "loss": 4.6389, "mean_token_accuracy": 0.2277310609817505, "num_tokens": 105753319.0, "step": 60975 }, { "entropy": 5.278686237335205, "epoch": 4.744446605718732, "grad_norm": 1.3828125, "learning_rate": 0.0002959282319072524, "loss": 4.6651, "mean_token_accuracy": 0.23588953018188477, "num_tokens": 105761973.0, "step": 60980 }, { "entropy": 5.37761435508728, "epoch": 4.74483563509045, "grad_norm": 1.1484375, "learning_rate": 0.0002959006363144427, "loss": 4.7499, "mean_token_accuracy": 0.22775333225727082, "num_tokens": 105770752.0, "step": 60985 }, { "entropy": 5.401414585113526, "epoch": 4.7452246644621665, "grad_norm": 1.3203125, "learning_rate": 0.0002958730404044991, "loss": 4.6861, "mean_token_accuracy": 0.23078614920377732, "num_tokens": 105779148.0, "step": 60990 }, { "entropy": 5.3770476341247555, "epoch": 4.745613693833884, "grad_norm": 1.171875, "learning_rate": 0.0002958454441778403, "loss": 4.7756, "mean_token_accuracy": 0.2263579860329628, "num_tokens": 105787794.0, "step": 60995 }, { "entropy": 5.378298759460449, "epoch": 4.746002723205602, "grad_norm": 1.1640625, "learning_rate": 0.00029581784763488506, "loss": 4.8048, "mean_token_accuracy": 0.2203591674566269, "num_tokens": 105796827.0, "step": 61000 }, { "entropy": 5.479292201995849, "epoch": 4.74639175257732, "grad_norm": 1.2421875, "learning_rate": 0.0002957902507760522, "loss": 4.8009, "mean_token_accuracy": 0.2199700027704239, "num_tokens": 105805638.0, "step": 61005 }, { "entropy": 5.460744190216064, "epoch": 4.746780781949037, "grad_norm": 1.1796875, "learning_rate": 0.0002957626536017603, "loss": 4.7698, "mean_token_accuracy": 0.22634891271591187, "num_tokens": 105814374.0, "step": 61010 }, { "entropy": 5.35067458152771, "epoch": 4.747169811320755, "grad_norm": 1.28125, "learning_rate": 0.0002957350561124282, "loss": 4.691, "mean_token_accuracy": 0.23094465136528014, "num_tokens": 105822938.0, "step": 61015 }, { "entropy": 5.442540836334229, "epoch": 4.747558840692472, "grad_norm": 1.3125, "learning_rate": 0.0002957074583084747, "loss": 4.9308, "mean_token_accuracy": 0.2212826132774353, "num_tokens": 105831770.0, "step": 61020 }, { "entropy": 5.404641199111938, "epoch": 4.7479478700641895, "grad_norm": 1.234375, "learning_rate": 0.0002956798601903184, "loss": 4.7397, "mean_token_accuracy": 0.23217836618423462, "num_tokens": 105840517.0, "step": 61025 }, { "entropy": 5.432840967178345, "epoch": 4.748336899435907, "grad_norm": 1.3046875, "learning_rate": 0.00029565226175837814, "loss": 4.6944, "mean_token_accuracy": 0.23149009943008422, "num_tokens": 105848299.0, "step": 61030 }, { "entropy": 5.339942216873169, "epoch": 4.748725928807625, "grad_norm": 1.234375, "learning_rate": 0.0002956246630130727, "loss": 4.694, "mean_token_accuracy": 0.22761086672544478, "num_tokens": 105856430.0, "step": 61035 }, { "entropy": 5.325467538833618, "epoch": 4.749114958179343, "grad_norm": 1.140625, "learning_rate": 0.00029559706395482075, "loss": 4.8155, "mean_token_accuracy": 0.22007054090499878, "num_tokens": 105865578.0, "step": 61040 }, { "entropy": 5.388486671447754, "epoch": 4.74950398755106, "grad_norm": 1.2109375, "learning_rate": 0.00029556946458404124, "loss": 4.8227, "mean_token_accuracy": 0.21596349030733109, "num_tokens": 105874380.0, "step": 61045 }, { "entropy": 5.479332637786865, "epoch": 4.749893016922778, "grad_norm": 1.203125, "learning_rate": 0.00029554186490115284, "loss": 4.7569, "mean_token_accuracy": 0.22599659115076065, "num_tokens": 105882822.0, "step": 61050 }, { "entropy": 5.404797983169556, "epoch": 4.750282046294496, "grad_norm": 1.0546875, "learning_rate": 0.0002955142649065743, "loss": 4.7616, "mean_token_accuracy": 0.21996737718582154, "num_tokens": 105891904.0, "step": 61055 }, { "entropy": 5.385646867752075, "epoch": 4.7506710756662125, "grad_norm": 1.1015625, "learning_rate": 0.0002954866646007244, "loss": 4.7808, "mean_token_accuracy": 0.2255269855260849, "num_tokens": 105900103.0, "step": 61060 }, { "entropy": 5.359794664382934, "epoch": 4.75106010503793, "grad_norm": 1.1796875, "learning_rate": 0.00029545906398402205, "loss": 4.7479, "mean_token_accuracy": 0.23442851305007933, "num_tokens": 105908868.0, "step": 61065 }, { "entropy": 5.346950435638428, "epoch": 4.751449134409648, "grad_norm": 1.1875, "learning_rate": 0.00029543146305688594, "loss": 4.6585, "mean_token_accuracy": 0.23449019193649293, "num_tokens": 105916846.0, "step": 61070 }, { "entropy": 5.292568397521973, "epoch": 4.751838163781366, "grad_norm": 1.21875, "learning_rate": 0.0002954038618197349, "loss": 4.658, "mean_token_accuracy": 0.23252671211957932, "num_tokens": 105925497.0, "step": 61075 }, { "entropy": 5.440683078765869, "epoch": 4.752227193153083, "grad_norm": 1.3046875, "learning_rate": 0.0002953762602729877, "loss": 4.8037, "mean_token_accuracy": 0.2161116987466812, "num_tokens": 105934049.0, "step": 61080 }, { "entropy": 5.311450862884522, "epoch": 4.752616222524801, "grad_norm": 1.1953125, "learning_rate": 0.00029534865841706324, "loss": 4.6653, "mean_token_accuracy": 0.23404623866081237, "num_tokens": 105942170.0, "step": 61085 }, { "entropy": 5.355849409103394, "epoch": 4.753005251896518, "grad_norm": 1.140625, "learning_rate": 0.0002953210562523803, "loss": 4.6929, "mean_token_accuracy": 0.23151392489671707, "num_tokens": 105950324.0, "step": 61090 }, { "entropy": 5.435976362228393, "epoch": 4.7533942812682355, "grad_norm": 1.15625, "learning_rate": 0.0002952934537793576, "loss": 4.9333, "mean_token_accuracy": 0.21799732446670533, "num_tokens": 105959675.0, "step": 61095 }, { "entropy": 5.336900234222412, "epoch": 4.753783310639953, "grad_norm": 1.21875, "learning_rate": 0.00029526585099841395, "loss": 4.6828, "mean_token_accuracy": 0.22844017148017884, "num_tokens": 105967856.0, "step": 61100 }, { "entropy": 5.396536064147949, "epoch": 4.754172340011671, "grad_norm": 1.140625, "learning_rate": 0.00029523824790996845, "loss": 4.7912, "mean_token_accuracy": 0.22316533476114273, "num_tokens": 105976069.0, "step": 61105 }, { "entropy": 5.354799032211304, "epoch": 4.754561369383389, "grad_norm": 1.203125, "learning_rate": 0.00029521064451443966, "loss": 4.6978, "mean_token_accuracy": 0.2298081785440445, "num_tokens": 105984249.0, "step": 61110 }, { "entropy": 5.384209728240966, "epoch": 4.754950398755106, "grad_norm": 1.2890625, "learning_rate": 0.00029518304081224656, "loss": 4.773, "mean_token_accuracy": 0.22394746989011766, "num_tokens": 105992551.0, "step": 61115 }, { "entropy": 5.4783533096313475, "epoch": 4.755339428126824, "grad_norm": 1.28125, "learning_rate": 0.00029515543680380793, "loss": 4.9362, "mean_token_accuracy": 0.21320951581001282, "num_tokens": 106001687.0, "step": 61120 }, { "entropy": 5.423759126663208, "epoch": 4.755728457498541, "grad_norm": 1.25, "learning_rate": 0.00029512783248954253, "loss": 4.7815, "mean_token_accuracy": 0.22356802970170975, "num_tokens": 106009610.0, "step": 61125 }, { "entropy": 5.425961446762085, "epoch": 4.7561174868702585, "grad_norm": 1.234375, "learning_rate": 0.0002951002278698695, "loss": 4.8413, "mean_token_accuracy": 0.2166310042142868, "num_tokens": 106017801.0, "step": 61130 }, { "entropy": 5.411542129516602, "epoch": 4.756506516241976, "grad_norm": 1.109375, "learning_rate": 0.00029507262294520726, "loss": 4.8092, "mean_token_accuracy": 0.2213703751564026, "num_tokens": 106026805.0, "step": 61135 }, { "entropy": 5.43509202003479, "epoch": 4.756895545613694, "grad_norm": 1.21875, "learning_rate": 0.0002950450177159751, "loss": 4.7594, "mean_token_accuracy": 0.22402465492486953, "num_tokens": 106035685.0, "step": 61140 }, { "entropy": 5.384979295730591, "epoch": 4.757284574985412, "grad_norm": 1.203125, "learning_rate": 0.00029501741218259167, "loss": 4.8505, "mean_token_accuracy": 0.21784700453281403, "num_tokens": 106044556.0, "step": 61145 }, { "entropy": 5.355625057220459, "epoch": 4.757673604357129, "grad_norm": 1.1484375, "learning_rate": 0.00029498980634547585, "loss": 4.7562, "mean_token_accuracy": 0.22328538894653321, "num_tokens": 106053706.0, "step": 61150 }, { "entropy": 5.336162424087524, "epoch": 4.758062633728846, "grad_norm": 1.1171875, "learning_rate": 0.00029496220020504656, "loss": 4.7532, "mean_token_accuracy": 0.2334196835756302, "num_tokens": 106062498.0, "step": 61155 }, { "entropy": 5.370337057113647, "epoch": 4.758451663100564, "grad_norm": 1.0703125, "learning_rate": 0.00029493459376172263, "loss": 4.6802, "mean_token_accuracy": 0.227053901553154, "num_tokens": 106071689.0, "step": 61160 }, { "entropy": 5.408340311050415, "epoch": 4.7588406924722815, "grad_norm": 1.2734375, "learning_rate": 0.0002949069870159229, "loss": 4.8178, "mean_token_accuracy": 0.22431112229824066, "num_tokens": 106080331.0, "step": 61165 }, { "entropy": 5.516005516052246, "epoch": 4.759229721843999, "grad_norm": 1.1640625, "learning_rate": 0.00029487937996806635, "loss": 4.896, "mean_token_accuracy": 0.20779773890972136, "num_tokens": 106089419.0, "step": 61170 }, { "entropy": 5.418132352828979, "epoch": 4.759618751215717, "grad_norm": 1.28125, "learning_rate": 0.00029485177261857193, "loss": 4.7453, "mean_token_accuracy": 0.23355381786823273, "num_tokens": 106097588.0, "step": 61175 }, { "entropy": 5.371577167510987, "epoch": 4.760007780587435, "grad_norm": 1.1875, "learning_rate": 0.0002948241649678584, "loss": 4.7629, "mean_token_accuracy": 0.22706762105226516, "num_tokens": 106107213.0, "step": 61180 }, { "entropy": 5.319773578643799, "epoch": 4.760396809959152, "grad_norm": 1.1796875, "learning_rate": 0.0002947965570163448, "loss": 4.6877, "mean_token_accuracy": 0.23044611066579818, "num_tokens": 106116230.0, "step": 61185 }, { "entropy": 5.427718019485473, "epoch": 4.76078583933087, "grad_norm": 1.265625, "learning_rate": 0.0002947689487644499, "loss": 4.7767, "mean_token_accuracy": 0.2304047539830208, "num_tokens": 106124795.0, "step": 61190 }, { "entropy": 5.407531023025513, "epoch": 4.761174868702587, "grad_norm": 1.1796875, "learning_rate": 0.0002947413402125927, "loss": 4.8288, "mean_token_accuracy": 0.2258199483156204, "num_tokens": 106134562.0, "step": 61195 }, { "entropy": 5.4292937278747555, "epoch": 4.7615638980743045, "grad_norm": 1.3125, "learning_rate": 0.0002947137313611919, "loss": 4.7817, "mean_token_accuracy": 0.22134263217449188, "num_tokens": 106142756.0, "step": 61200 }, { "entropy": 5.418309450149536, "epoch": 4.761952927446022, "grad_norm": 1.234375, "learning_rate": 0.00029468612221066683, "loss": 4.8063, "mean_token_accuracy": 0.2242311105132103, "num_tokens": 106151576.0, "step": 61205 }, { "entropy": 5.362037324905396, "epoch": 4.76234195681774, "grad_norm": 1.296875, "learning_rate": 0.0002946585127614361, "loss": 4.7431, "mean_token_accuracy": 0.22929263412952422, "num_tokens": 106160091.0, "step": 61210 }, { "entropy": 5.409893655776978, "epoch": 4.762730986189458, "grad_norm": 1.1875, "learning_rate": 0.0002946309030139188, "loss": 4.8294, "mean_token_accuracy": 0.21888908445835115, "num_tokens": 106168314.0, "step": 61215 }, { "entropy": 5.351134443283081, "epoch": 4.763120015561174, "grad_norm": 1.25, "learning_rate": 0.0002946032929685337, "loss": 4.7285, "mean_token_accuracy": 0.23142897188663483, "num_tokens": 106176659.0, "step": 61220 }, { "entropy": 5.4166546821594235, "epoch": 4.763509044932892, "grad_norm": 1.1640625, "learning_rate": 0.0002945756826256999, "loss": 4.7906, "mean_token_accuracy": 0.22887581586837769, "num_tokens": 106185781.0, "step": 61225 }, { "entropy": 5.464412021636963, "epoch": 4.76389807430461, "grad_norm": 1.1875, "learning_rate": 0.0002945480719858363, "loss": 4.7718, "mean_token_accuracy": 0.22435036301612854, "num_tokens": 106193851.0, "step": 61230 }, { "entropy": 5.310726118087769, "epoch": 4.7642871036763275, "grad_norm": 1.140625, "learning_rate": 0.0002945204610493617, "loss": 4.7115, "mean_token_accuracy": 0.2256808266043663, "num_tokens": 106202148.0, "step": 61235 }, { "entropy": 5.300835371017456, "epoch": 4.764676133048045, "grad_norm": 1.1875, "learning_rate": 0.00029449284981669524, "loss": 4.7886, "mean_token_accuracy": 0.22049281001091003, "num_tokens": 106210473.0, "step": 61240 }, { "entropy": 5.394700765609741, "epoch": 4.765065162419763, "grad_norm": 1.1484375, "learning_rate": 0.00029446523828825577, "loss": 4.8114, "mean_token_accuracy": 0.22652681469917296, "num_tokens": 106219307.0, "step": 61245 }, { "entropy": 5.401035499572754, "epoch": 4.7654541917914806, "grad_norm": 1.2421875, "learning_rate": 0.0002944376264644624, "loss": 4.7587, "mean_token_accuracy": 0.22903700321912765, "num_tokens": 106227618.0, "step": 61250 }, { "entropy": 5.448077869415283, "epoch": 4.765843221163198, "grad_norm": 1.1640625, "learning_rate": 0.0002944100143457339, "loss": 4.8556, "mean_token_accuracy": 0.21209297925233841, "num_tokens": 106235681.0, "step": 61255 }, { "entropy": 5.337272310256958, "epoch": 4.766232250534915, "grad_norm": 1.15625, "learning_rate": 0.0002943824019324893, "loss": 4.6677, "mean_token_accuracy": 0.23288217335939407, "num_tokens": 106243786.0, "step": 61260 }, { "entropy": 5.361037826538086, "epoch": 4.766621279906633, "grad_norm": 1.25, "learning_rate": 0.0002943547892251476, "loss": 4.7331, "mean_token_accuracy": 0.22878089398145676, "num_tokens": 106252117.0, "step": 61265 }, { "entropy": 5.352073001861572, "epoch": 4.7670103092783505, "grad_norm": 1.15625, "learning_rate": 0.00029432717622412784, "loss": 4.7609, "mean_token_accuracy": 0.2292614310979843, "num_tokens": 106260473.0, "step": 61270 }, { "entropy": 5.317076683044434, "epoch": 4.767399338650068, "grad_norm": 1.140625, "learning_rate": 0.00029429956292984893, "loss": 4.6985, "mean_token_accuracy": 0.23215328603982927, "num_tokens": 106269713.0, "step": 61275 }, { "entropy": 5.398649787902832, "epoch": 4.767788368021786, "grad_norm": 1.2109375, "learning_rate": 0.0002942719493427299, "loss": 4.7944, "mean_token_accuracy": 0.2272867813706398, "num_tokens": 106278909.0, "step": 61280 }, { "entropy": 5.33880500793457, "epoch": 4.7681773973935035, "grad_norm": 1.1171875, "learning_rate": 0.0002942443354631897, "loss": 4.7311, "mean_token_accuracy": 0.2279257595539093, "num_tokens": 106287475.0, "step": 61285 }, { "entropy": 5.418565511703491, "epoch": 4.76856642676522, "grad_norm": 1.1640625, "learning_rate": 0.00029421672129164726, "loss": 4.8105, "mean_token_accuracy": 0.21864811778068544, "num_tokens": 106295605.0, "step": 61290 }, { "entropy": 5.42115216255188, "epoch": 4.768955456136938, "grad_norm": 1.234375, "learning_rate": 0.00029418910682852176, "loss": 4.7803, "mean_token_accuracy": 0.22009591162204742, "num_tokens": 106303947.0, "step": 61295 }, { "entropy": 5.435758256912232, "epoch": 4.769344485508656, "grad_norm": 1.171875, "learning_rate": 0.00029416149207423203, "loss": 4.8161, "mean_token_accuracy": 0.21683825701475143, "num_tokens": 106312423.0, "step": 61300 }, { "entropy": 5.327768564224243, "epoch": 4.7697335148803734, "grad_norm": 1.2265625, "learning_rate": 0.00029413387702919723, "loss": 4.6392, "mean_token_accuracy": 0.2345084249973297, "num_tokens": 106320904.0, "step": 61305 }, { "entropy": 5.335542058944702, "epoch": 4.770122544252091, "grad_norm": 1.1484375, "learning_rate": 0.00029410626169383623, "loss": 4.7497, "mean_token_accuracy": 0.2255782812833786, "num_tokens": 106330096.0, "step": 61310 }, { "entropy": 5.3593590259552, "epoch": 4.770511573623809, "grad_norm": 1.0859375, "learning_rate": 0.00029407864606856814, "loss": 4.8042, "mean_token_accuracy": 0.21647580116987228, "num_tokens": 106338980.0, "step": 61315 }, { "entropy": 5.422854900360107, "epoch": 4.7709006029955265, "grad_norm": 1.203125, "learning_rate": 0.000294051030153812, "loss": 4.799, "mean_token_accuracy": 0.21937923282384872, "num_tokens": 106347623.0, "step": 61320 }, { "entropy": 5.401127052307129, "epoch": 4.771289632367243, "grad_norm": 1.15625, "learning_rate": 0.0002940234139499868, "loss": 4.7894, "mean_token_accuracy": 0.2201191484928131, "num_tokens": 106356051.0, "step": 61325 }, { "entropy": 5.441878032684326, "epoch": 4.771678661738961, "grad_norm": 1.171875, "learning_rate": 0.00029399579745751156, "loss": 4.8022, "mean_token_accuracy": 0.22014029771089555, "num_tokens": 106364618.0, "step": 61330 }, { "entropy": 5.399563598632812, "epoch": 4.772067691110679, "grad_norm": 1.140625, "learning_rate": 0.00029396818067680525, "loss": 4.7475, "mean_token_accuracy": 0.23158082813024522, "num_tokens": 106373455.0, "step": 61335 }, { "entropy": 5.413110208511353, "epoch": 4.772456720482396, "grad_norm": 1.140625, "learning_rate": 0.00029394056360828707, "loss": 4.7769, "mean_token_accuracy": 0.22744117975234984, "num_tokens": 106383522.0, "step": 61340 }, { "entropy": 5.374820232391357, "epoch": 4.772845749854114, "grad_norm": 1.1953125, "learning_rate": 0.00029391294625237595, "loss": 4.7358, "mean_token_accuracy": 0.22248922884464264, "num_tokens": 106392277.0, "step": 61345 }, { "entropy": 5.405362319946289, "epoch": 4.773234779225832, "grad_norm": 1.21875, "learning_rate": 0.0002938853286094911, "loss": 4.7773, "mean_token_accuracy": 0.2287943869829178, "num_tokens": 106401154.0, "step": 61350 }, { "entropy": 5.451045560836792, "epoch": 4.773623808597549, "grad_norm": 1.1796875, "learning_rate": 0.00029385771068005123, "loss": 4.7502, "mean_token_accuracy": 0.2267290860414505, "num_tokens": 106409452.0, "step": 61355 }, { "entropy": 5.411964368820191, "epoch": 4.774012837969266, "grad_norm": 1.09375, "learning_rate": 0.0002938300924644757, "loss": 4.7711, "mean_token_accuracy": 0.21638796478509903, "num_tokens": 106417490.0, "step": 61360 }, { "entropy": 5.412882614135742, "epoch": 4.774401867340984, "grad_norm": 1.1875, "learning_rate": 0.00029380247396318355, "loss": 4.7552, "mean_token_accuracy": 0.2285612240433693, "num_tokens": 106425913.0, "step": 61365 }, { "entropy": 5.476139163970947, "epoch": 4.774790896712702, "grad_norm": 1.2734375, "learning_rate": 0.0002937748551765937, "loss": 4.8423, "mean_token_accuracy": 0.22279808819293975, "num_tokens": 106434192.0, "step": 61370 }, { "entropy": 5.4088210105896, "epoch": 4.775179926084419, "grad_norm": 1.2109375, "learning_rate": 0.0002937472361051254, "loss": 4.7989, "mean_token_accuracy": 0.22200180739164352, "num_tokens": 106442761.0, "step": 61375 }, { "entropy": 5.423699474334716, "epoch": 4.775568955456137, "grad_norm": 1.1875, "learning_rate": 0.0002937196167491976, "loss": 4.7804, "mean_token_accuracy": 0.22812281399965287, "num_tokens": 106451172.0, "step": 61380 }, { "entropy": 5.461946058273315, "epoch": 4.775957984827855, "grad_norm": 1.2265625, "learning_rate": 0.00029369199710922944, "loss": 4.8118, "mean_token_accuracy": 0.21687264740467072, "num_tokens": 106459482.0, "step": 61385 }, { "entropy": 5.313634300231934, "epoch": 4.7763470141995725, "grad_norm": 1.1796875, "learning_rate": 0.00029366437718563994, "loss": 4.6485, "mean_token_accuracy": 0.23619213551282883, "num_tokens": 106467959.0, "step": 61390 }, { "entropy": 5.384954643249512, "epoch": 4.776736043571289, "grad_norm": 1.203125, "learning_rate": 0.0002936367569788482, "loss": 4.7418, "mean_token_accuracy": 0.22847955226898192, "num_tokens": 106475833.0, "step": 61395 }, { "entropy": 5.41038932800293, "epoch": 4.777125072943007, "grad_norm": 1.140625, "learning_rate": 0.0002936091364892733, "loss": 4.8411, "mean_token_accuracy": 0.2217931792140007, "num_tokens": 106485045.0, "step": 61400 }, { "entropy": 5.383838033676147, "epoch": 4.777514102314725, "grad_norm": 1.1328125, "learning_rate": 0.00029358151571733446, "loss": 4.7673, "mean_token_accuracy": 0.22453367859125137, "num_tokens": 106494074.0, "step": 61405 }, { "entropy": 5.378242444992066, "epoch": 4.777903131686442, "grad_norm": 1.2421875, "learning_rate": 0.00029355389466345064, "loss": 4.7822, "mean_token_accuracy": 0.22574361860752107, "num_tokens": 106502706.0, "step": 61410 }, { "entropy": 5.36213173866272, "epoch": 4.77829216105816, "grad_norm": 1.15625, "learning_rate": 0.00029352627332804104, "loss": 4.7506, "mean_token_accuracy": 0.22445164024829864, "num_tokens": 106511263.0, "step": 61415 }, { "entropy": 5.442114019393921, "epoch": 4.778681190429878, "grad_norm": 1.1484375, "learning_rate": 0.00029349865171152475, "loss": 4.804, "mean_token_accuracy": 0.23096578270196916, "num_tokens": 106520324.0, "step": 61420 }, { "entropy": 5.343964862823486, "epoch": 4.779070219801595, "grad_norm": 1.1640625, "learning_rate": 0.00029347102981432084, "loss": 4.6709, "mean_token_accuracy": 0.23022420853376388, "num_tokens": 106529175.0, "step": 61425 }, { "entropy": 5.336801195144654, "epoch": 4.779459249173312, "grad_norm": 1.203125, "learning_rate": 0.0002934434076368484, "loss": 4.7508, "mean_token_accuracy": 0.22757611572742462, "num_tokens": 106538107.0, "step": 61430 }, { "entropy": 5.4528985023498535, "epoch": 4.77984827854503, "grad_norm": 1.28125, "learning_rate": 0.0002934157851795266, "loss": 4.9114, "mean_token_accuracy": 0.2119425430893898, "num_tokens": 106546050.0, "step": 61435 }, { "entropy": 5.3592689514160154, "epoch": 4.780237307916748, "grad_norm": 1.203125, "learning_rate": 0.0002933881624427746, "loss": 4.6905, "mean_token_accuracy": 0.22445545941591263, "num_tokens": 106554266.0, "step": 61440 }, { "entropy": 5.375132751464844, "epoch": 4.780626337288465, "grad_norm": 1.140625, "learning_rate": 0.0002933605394270116, "loss": 4.7398, "mean_token_accuracy": 0.23191299736499787, "num_tokens": 106562897.0, "step": 61445 }, { "entropy": 5.291368913650513, "epoch": 4.781015366660183, "grad_norm": 1.125, "learning_rate": 0.0002933329161326565, "loss": 4.668, "mean_token_accuracy": 0.23306576311588287, "num_tokens": 106571815.0, "step": 61450 }, { "entropy": 5.350451803207397, "epoch": 4.781404396031901, "grad_norm": 1.21875, "learning_rate": 0.00029330529256012863, "loss": 4.756, "mean_token_accuracy": 0.2275736689567566, "num_tokens": 106580074.0, "step": 61455 }, { "entropy": 5.442710065841675, "epoch": 4.781793425403618, "grad_norm": 1.3203125, "learning_rate": 0.00029327766870984714, "loss": 4.8172, "mean_token_accuracy": 0.22009642869234086, "num_tokens": 106589385.0, "step": 61460 }, { "entropy": 5.423815155029297, "epoch": 4.782182454775335, "grad_norm": 1.21875, "learning_rate": 0.00029325004458223097, "loss": 4.7553, "mean_token_accuracy": 0.22562260776758195, "num_tokens": 106598779.0, "step": 61465 }, { "entropy": 5.460942888259888, "epoch": 4.782571484147053, "grad_norm": 1.2890625, "learning_rate": 0.00029322242017769954, "loss": 4.8958, "mean_token_accuracy": 0.21253805011510848, "num_tokens": 106607412.0, "step": 61470 }, { "entropy": 5.350466012954712, "epoch": 4.782960513518771, "grad_norm": 1.234375, "learning_rate": 0.00029319479549667183, "loss": 4.6233, "mean_token_accuracy": 0.23295226842164993, "num_tokens": 106615703.0, "step": 61475 }, { "entropy": 5.402147102355957, "epoch": 4.783349542890488, "grad_norm": 1.1640625, "learning_rate": 0.0002931671705395671, "loss": 4.7646, "mean_token_accuracy": 0.2222425401210785, "num_tokens": 106624541.0, "step": 61480 }, { "entropy": 5.37731704711914, "epoch": 4.783738572262206, "grad_norm": 1.1796875, "learning_rate": 0.00029313954530680447, "loss": 4.807, "mean_token_accuracy": 0.22690728306770325, "num_tokens": 106633307.0, "step": 61485 }, { "entropy": 5.484022188186645, "epoch": 4.784127601633923, "grad_norm": 1.1640625, "learning_rate": 0.00029311191979880313, "loss": 4.8812, "mean_token_accuracy": 0.21933328360319138, "num_tokens": 106642645.0, "step": 61490 }, { "entropy": 5.437813329696655, "epoch": 4.784516631005641, "grad_norm": 1.140625, "learning_rate": 0.0002930842940159822, "loss": 4.7301, "mean_token_accuracy": 0.22371327877044678, "num_tokens": 106651860.0, "step": 61495 }, { "entropy": 5.36376166343689, "epoch": 4.784905660377358, "grad_norm": 1.140625, "learning_rate": 0.00029305666795876093, "loss": 4.7141, "mean_token_accuracy": 0.22501543313264846, "num_tokens": 106660704.0, "step": 61500 }, { "entropy": 5.394883251190185, "epoch": 4.785294689749076, "grad_norm": 1.171875, "learning_rate": 0.00029302904162755843, "loss": 4.7439, "mean_token_accuracy": 0.22623571306467055, "num_tokens": 106669190.0, "step": 61505 }, { "entropy": 5.394026041030884, "epoch": 4.785683719120794, "grad_norm": 1.1953125, "learning_rate": 0.00029300141502279395, "loss": 4.7466, "mean_token_accuracy": 0.221255424618721, "num_tokens": 106677018.0, "step": 61510 }, { "entropy": 5.351914548873902, "epoch": 4.786072748492511, "grad_norm": 1.234375, "learning_rate": 0.00029297378814488657, "loss": 4.7035, "mean_token_accuracy": 0.2184475004673004, "num_tokens": 106685971.0, "step": 61515 }, { "entropy": 5.362134885787964, "epoch": 4.786461777864229, "grad_norm": 1.1015625, "learning_rate": 0.00029294616099425556, "loss": 4.7014, "mean_token_accuracy": 0.22833310663700104, "num_tokens": 106694478.0, "step": 61520 }, { "entropy": 5.367424392700196, "epoch": 4.786850807235947, "grad_norm": 1.0859375, "learning_rate": 0.0002929185335713202, "loss": 4.7906, "mean_token_accuracy": 0.22128487527370452, "num_tokens": 106702527.0, "step": 61525 }, { "entropy": 5.394149923324585, "epoch": 4.787239836607664, "grad_norm": 1.1640625, "learning_rate": 0.00029289090587649965, "loss": 4.7777, "mean_token_accuracy": 0.22110269069671631, "num_tokens": 106710793.0, "step": 61530 }, { "entropy": 5.393852567672729, "epoch": 4.787628865979381, "grad_norm": 1.125, "learning_rate": 0.000292863277910213, "loss": 4.8084, "mean_token_accuracy": 0.22059060633182526, "num_tokens": 106718992.0, "step": 61535 }, { "entropy": 5.381119203567505, "epoch": 4.788017895351099, "grad_norm": 1.15625, "learning_rate": 0.0002928356496728796, "loss": 4.8085, "mean_token_accuracy": 0.22847482413053513, "num_tokens": 106727921.0, "step": 61540 }, { "entropy": 5.404296636581421, "epoch": 4.788406924722817, "grad_norm": 1.125, "learning_rate": 0.00029280802116491854, "loss": 4.7632, "mean_token_accuracy": 0.21876602470874787, "num_tokens": 106736264.0, "step": 61545 }, { "entropy": 5.3030198097229, "epoch": 4.788795954094534, "grad_norm": 1.234375, "learning_rate": 0.00029278039238674915, "loss": 4.7017, "mean_token_accuracy": 0.2334312990307808, "num_tokens": 106744531.0, "step": 61550 }, { "entropy": 5.368652629852295, "epoch": 4.789184983466251, "grad_norm": 1.2578125, "learning_rate": 0.0002927527633387906, "loss": 4.7854, "mean_token_accuracy": 0.2235810711979866, "num_tokens": 106752780.0, "step": 61555 }, { "entropy": 5.418041229248047, "epoch": 4.789574012837969, "grad_norm": 1.1640625, "learning_rate": 0.00029272513402146203, "loss": 4.7831, "mean_token_accuracy": 0.2270827278494835, "num_tokens": 106762276.0, "step": 61560 }, { "entropy": 5.393799734115601, "epoch": 4.789963042209687, "grad_norm": 1.15625, "learning_rate": 0.0002926975044351828, "loss": 4.7752, "mean_token_accuracy": 0.22876435667276382, "num_tokens": 106771200.0, "step": 61565 }, { "entropy": 5.338265037536621, "epoch": 4.790352071581404, "grad_norm": 1.1484375, "learning_rate": 0.0002926698745803723, "loss": 4.706, "mean_token_accuracy": 0.22634213119745256, "num_tokens": 106779871.0, "step": 61570 }, { "entropy": 5.492870140075683, "epoch": 4.790741100953122, "grad_norm": 1.15625, "learning_rate": 0.00029264224445744937, "loss": 4.9244, "mean_token_accuracy": 0.2143673062324524, "num_tokens": 106788980.0, "step": 61575 }, { "entropy": 5.502860403060913, "epoch": 4.79113013032484, "grad_norm": 1.171875, "learning_rate": 0.00029261461406683353, "loss": 4.8785, "mean_token_accuracy": 0.21506026834249498, "num_tokens": 106798263.0, "step": 61580 }, { "entropy": 5.466037225723267, "epoch": 4.791519159696557, "grad_norm": 1.21875, "learning_rate": 0.00029258698340894397, "loss": 4.8692, "mean_token_accuracy": 0.21764410138130189, "num_tokens": 106807593.0, "step": 61585 }, { "entropy": 5.472850513458252, "epoch": 4.791908189068275, "grad_norm": 1.1328125, "learning_rate": 0.00029255935248419983, "loss": 4.7926, "mean_token_accuracy": 0.2255539372563362, "num_tokens": 106815982.0, "step": 61590 }, { "entropy": 5.426155471801758, "epoch": 4.792297218439992, "grad_norm": 1.1171875, "learning_rate": 0.0002925317212930206, "loss": 4.7575, "mean_token_accuracy": 0.2253747284412384, "num_tokens": 106824264.0, "step": 61595 }, { "entropy": 5.363981103897094, "epoch": 4.79268624781171, "grad_norm": 1.234375, "learning_rate": 0.00029250408983582527, "loss": 4.797, "mean_token_accuracy": 0.2229149594902992, "num_tokens": 106833572.0, "step": 61600 }, { "entropy": 5.377031326293945, "epoch": 4.793075277183427, "grad_norm": 1.25, "learning_rate": 0.0002924764581130333, "loss": 4.8131, "mean_token_accuracy": 0.21402206867933274, "num_tokens": 106841841.0, "step": 61605 }, { "entropy": 5.371603059768677, "epoch": 4.793464306555145, "grad_norm": 1.1328125, "learning_rate": 0.000292448826125064, "loss": 4.776, "mean_token_accuracy": 0.22759679555892945, "num_tokens": 106850543.0, "step": 61610 }, { "entropy": 5.437587118148803, "epoch": 4.793853335926863, "grad_norm": 1.1953125, "learning_rate": 0.0002924211938723364, "loss": 4.7754, "mean_token_accuracy": 0.2211402729153633, "num_tokens": 106859078.0, "step": 61615 }, { "entropy": 5.391442966461182, "epoch": 4.79424236529858, "grad_norm": 1.1875, "learning_rate": 0.00029239356135526994, "loss": 4.6844, "mean_token_accuracy": 0.23005143404006959, "num_tokens": 106867158.0, "step": 61620 }, { "entropy": 5.45987720489502, "epoch": 4.794631394670297, "grad_norm": 1.1953125, "learning_rate": 0.000292365928574284, "loss": 4.7859, "mean_token_accuracy": 0.2250692993402481, "num_tokens": 106875072.0, "step": 61625 }, { "entropy": 5.40940227508545, "epoch": 4.795020424042015, "grad_norm": 1.3125, "learning_rate": 0.0002923382955297975, "loss": 4.8063, "mean_token_accuracy": 0.22032802551984787, "num_tokens": 106883243.0, "step": 61630 }, { "entropy": 5.376550149917603, "epoch": 4.795409453413733, "grad_norm": 1.171875, "learning_rate": 0.0002923106622222301, "loss": 4.7508, "mean_token_accuracy": 0.22749942392110825, "num_tokens": 106891572.0, "step": 61635 }, { "entropy": 5.373151540756226, "epoch": 4.79579848278545, "grad_norm": 1.1484375, "learning_rate": 0.0002922830286520009, "loss": 4.7769, "mean_token_accuracy": 0.22584119588136672, "num_tokens": 106899857.0, "step": 61640 }, { "entropy": 5.361700344085693, "epoch": 4.796187512157168, "grad_norm": 1.1015625, "learning_rate": 0.00029225539481952934, "loss": 4.7327, "mean_token_accuracy": 0.22513916045427323, "num_tokens": 106909774.0, "step": 61645 }, { "entropy": 5.407968473434448, "epoch": 4.796576541528886, "grad_norm": 1.2578125, "learning_rate": 0.0002922277607252346, "loss": 4.7579, "mean_token_accuracy": 0.22356380969285966, "num_tokens": 106917952.0, "step": 61650 }, { "entropy": 5.424052000045776, "epoch": 4.796965570900603, "grad_norm": 1.3203125, "learning_rate": 0.000292200126369536, "loss": 4.8569, "mean_token_accuracy": 0.2200043573975563, "num_tokens": 106926652.0, "step": 61655 }, { "entropy": 5.434649085998535, "epoch": 4.79735460027232, "grad_norm": 1.2109375, "learning_rate": 0.00029217249175285284, "loss": 4.8384, "mean_token_accuracy": 0.22024600058794022, "num_tokens": 106935134.0, "step": 61660 }, { "entropy": 5.38742241859436, "epoch": 4.797743629644038, "grad_norm": 1.21875, "learning_rate": 0.00029214485687560437, "loss": 4.7964, "mean_token_accuracy": 0.22090229392051697, "num_tokens": 106943948.0, "step": 61665 }, { "entropy": 5.440089511871338, "epoch": 4.798132659015756, "grad_norm": 1.1796875, "learning_rate": 0.0002921172217382101, "loss": 4.8984, "mean_token_accuracy": 0.2167525440454483, "num_tokens": 106953226.0, "step": 61670 }, { "entropy": 5.4425108432769775, "epoch": 4.798521688387473, "grad_norm": 1.2890625, "learning_rate": 0.00029208958634108917, "loss": 4.8043, "mean_token_accuracy": 0.21372335106134416, "num_tokens": 106962153.0, "step": 61675 }, { "entropy": 5.402464103698731, "epoch": 4.798910717759191, "grad_norm": 1.2734375, "learning_rate": 0.000292061950684661, "loss": 4.7613, "mean_token_accuracy": 0.2225642666220665, "num_tokens": 106970660.0, "step": 61680 }, { "entropy": 5.391481018066406, "epoch": 4.799299747130909, "grad_norm": 1.2578125, "learning_rate": 0.00029203431476934496, "loss": 4.7384, "mean_token_accuracy": 0.23120226562023163, "num_tokens": 106979676.0, "step": 61685 }, { "entropy": 5.428488731384277, "epoch": 4.7996887765026255, "grad_norm": 1.1953125, "learning_rate": 0.00029200667859556026, "loss": 4.8072, "mean_token_accuracy": 0.22111489474773408, "num_tokens": 106988819.0, "step": 61690 }, { "entropy": 5.375599384307861, "epoch": 4.800077805874343, "grad_norm": 1.1796875, "learning_rate": 0.0002919790421637262, "loss": 4.6894, "mean_token_accuracy": 0.22531514912843703, "num_tokens": 106998075.0, "step": 61695 }, { "entropy": 5.413203287124634, "epoch": 4.800466835246061, "grad_norm": 1.2578125, "learning_rate": 0.0002919514054742622, "loss": 4.7234, "mean_token_accuracy": 0.23364122956991196, "num_tokens": 107006598.0, "step": 61700 }, { "entropy": 5.408813953399658, "epoch": 4.800855864617779, "grad_norm": 1.1953125, "learning_rate": 0.00029192376852758774, "loss": 4.7747, "mean_token_accuracy": 0.22132117301225662, "num_tokens": 107015439.0, "step": 61705 }, { "entropy": 5.4127601146697994, "epoch": 4.801244893989496, "grad_norm": 1.234375, "learning_rate": 0.0002918961313241219, "loss": 4.8091, "mean_token_accuracy": 0.2270084574818611, "num_tokens": 107023487.0, "step": 61710 }, { "entropy": 5.362775754928589, "epoch": 4.801633923361214, "grad_norm": 1.2578125, "learning_rate": 0.0002918684938642842, "loss": 4.7266, "mean_token_accuracy": 0.2315456598997116, "num_tokens": 107031905.0, "step": 61715 }, { "entropy": 5.352206230163574, "epoch": 4.802022952732932, "grad_norm": 1.1953125, "learning_rate": 0.00029184085614849403, "loss": 4.7331, "mean_token_accuracy": 0.23020475208759308, "num_tokens": 107040667.0, "step": 61720 }, { "entropy": 5.496997594833374, "epoch": 4.802411982104649, "grad_norm": 1.1953125, "learning_rate": 0.0002918132181771706, "loss": 4.9237, "mean_token_accuracy": 0.20938269942998886, "num_tokens": 107049032.0, "step": 61725 }, { "entropy": 5.415164756774902, "epoch": 4.802801011476366, "grad_norm": 1.1171875, "learning_rate": 0.00029178557995073335, "loss": 4.7844, "mean_token_accuracy": 0.2253414899110794, "num_tokens": 107057729.0, "step": 61730 }, { "entropy": 5.346363925933838, "epoch": 4.803190040848084, "grad_norm": 1.171875, "learning_rate": 0.0002917579414696017, "loss": 4.67, "mean_token_accuracy": 0.23532794564962387, "num_tokens": 107066113.0, "step": 61735 }, { "entropy": 5.349463558197021, "epoch": 4.803579070219802, "grad_norm": 1.2890625, "learning_rate": 0.00029173030273419484, "loss": 4.6961, "mean_token_accuracy": 0.22976571172475815, "num_tokens": 107074873.0, "step": 61740 }, { "entropy": 5.263867664337158, "epoch": 4.803968099591519, "grad_norm": 1.1171875, "learning_rate": 0.0002917026637449323, "loss": 4.6254, "mean_token_accuracy": 0.23173534870147705, "num_tokens": 107083485.0, "step": 61745 }, { "entropy": 5.445455074310303, "epoch": 4.804357128963237, "grad_norm": 1.1875, "learning_rate": 0.0002916750245022335, "loss": 4.8343, "mean_token_accuracy": 0.21726056039333344, "num_tokens": 107092064.0, "step": 61750 }, { "entropy": 5.451920747756958, "epoch": 4.804746158334955, "grad_norm": 1.2109375, "learning_rate": 0.0002916473850065177, "loss": 4.6678, "mean_token_accuracy": 0.23108033686876298, "num_tokens": 107100744.0, "step": 61755 }, { "entropy": 5.359065294265747, "epoch": 4.8051351877066715, "grad_norm": 1.2265625, "learning_rate": 0.00029161974525820434, "loss": 4.6868, "mean_token_accuracy": 0.2253183200955391, "num_tokens": 107109185.0, "step": 61760 }, { "entropy": 5.355554819107056, "epoch": 4.805524217078389, "grad_norm": 1.1953125, "learning_rate": 0.0002915921052577127, "loss": 4.7423, "mean_token_accuracy": 0.22153462916612626, "num_tokens": 107118628.0, "step": 61765 }, { "entropy": 5.363520765304566, "epoch": 4.805913246450107, "grad_norm": 1.25, "learning_rate": 0.00029156446500546243, "loss": 4.7569, "mean_token_accuracy": 0.22124791145324707, "num_tokens": 107128017.0, "step": 61770 }, { "entropy": 5.435674142837525, "epoch": 4.806302275821825, "grad_norm": 1.1484375, "learning_rate": 0.00029153682450187265, "loss": 4.7462, "mean_token_accuracy": 0.2220491275191307, "num_tokens": 107136393.0, "step": 61775 }, { "entropy": 5.412199878692627, "epoch": 4.806691305193542, "grad_norm": 1.1640625, "learning_rate": 0.00029150918374736294, "loss": 4.755, "mean_token_accuracy": 0.22044182121753692, "num_tokens": 107144936.0, "step": 61780 }, { "entropy": 5.330133628845215, "epoch": 4.80708033456526, "grad_norm": 1.1796875, "learning_rate": 0.0002914815427423526, "loss": 4.7177, "mean_token_accuracy": 0.23071602880954742, "num_tokens": 107153579.0, "step": 61785 }, { "entropy": 5.412717342376709, "epoch": 4.807469363936978, "grad_norm": 1.1484375, "learning_rate": 0.0002914539014872612, "loss": 4.811, "mean_token_accuracy": 0.22447938919067384, "num_tokens": 107162213.0, "step": 61790 }, { "entropy": 5.4631859302520756, "epoch": 4.8078583933086945, "grad_norm": 1.1953125, "learning_rate": 0.00029142625998250786, "loss": 4.9048, "mean_token_accuracy": 0.22075000852346421, "num_tokens": 107170493.0, "step": 61795 }, { "entropy": 5.41983733177185, "epoch": 4.808247422680412, "grad_norm": 1.2578125, "learning_rate": 0.00029139861822851233, "loss": 4.7613, "mean_token_accuracy": 0.22606029808521272, "num_tokens": 107179309.0, "step": 61800 }, { "entropy": 5.425087881088257, "epoch": 4.80863645205213, "grad_norm": 1.1875, "learning_rate": 0.00029137097622569376, "loss": 4.755, "mean_token_accuracy": 0.22315050661563873, "num_tokens": 107187852.0, "step": 61805 }, { "entropy": 5.445657873153687, "epoch": 4.809025481423848, "grad_norm": 1.2265625, "learning_rate": 0.0002913433339744718, "loss": 4.8563, "mean_token_accuracy": 0.21579809486865997, "num_tokens": 107196198.0, "step": 61810 }, { "entropy": 5.493415832519531, "epoch": 4.809414510795565, "grad_norm": 1.2578125, "learning_rate": 0.0002913156914752656, "loss": 4.8607, "mean_token_accuracy": 0.21620033979415892, "num_tokens": 107205133.0, "step": 61815 }, { "entropy": 5.384306001663208, "epoch": 4.809803540167283, "grad_norm": 1.296875, "learning_rate": 0.0002912880487284948, "loss": 4.7986, "mean_token_accuracy": 0.22225674986839294, "num_tokens": 107213962.0, "step": 61820 }, { "entropy": 5.445097303390503, "epoch": 4.810192569539, "grad_norm": 1.25, "learning_rate": 0.00029126040573457886, "loss": 4.7722, "mean_token_accuracy": 0.2181605726480484, "num_tokens": 107222692.0, "step": 61825 }, { "entropy": 5.3659978866577145, "epoch": 4.8105815989107175, "grad_norm": 1.2421875, "learning_rate": 0.00029123276249393707, "loss": 4.6539, "mean_token_accuracy": 0.23161963522434234, "num_tokens": 107231474.0, "step": 61830 }, { "entropy": 5.363829326629639, "epoch": 4.810970628282435, "grad_norm": 1.203125, "learning_rate": 0.00029120511900698894, "loss": 4.781, "mean_token_accuracy": 0.2266690820455551, "num_tokens": 107239436.0, "step": 61835 }, { "entropy": 5.322675323486328, "epoch": 4.811359657654153, "grad_norm": 1.25, "learning_rate": 0.000291177475274154, "loss": 4.7081, "mean_token_accuracy": 0.23004014194011688, "num_tokens": 107247832.0, "step": 61840 }, { "entropy": 5.356645011901856, "epoch": 4.8117486870258706, "grad_norm": 1.2578125, "learning_rate": 0.0002911498312958516, "loss": 4.7586, "mean_token_accuracy": 0.22210778892040253, "num_tokens": 107256995.0, "step": 61845 }, { "entropy": 5.4442463397979735, "epoch": 4.812137716397588, "grad_norm": 1.2734375, "learning_rate": 0.00029112218707250115, "loss": 4.7302, "mean_token_accuracy": 0.23682008534669877, "num_tokens": 107265412.0, "step": 61850 }, { "entropy": 5.372488212585449, "epoch": 4.812526745769306, "grad_norm": 1.1328125, "learning_rate": 0.00029109454260452223, "loss": 4.7086, "mean_token_accuracy": 0.2288095012307167, "num_tokens": 107273882.0, "step": 61855 }, { "entropy": 5.400299882888794, "epoch": 4.812915775141024, "grad_norm": 1.140625, "learning_rate": 0.00029106689789233425, "loss": 4.8299, "mean_token_accuracy": 0.21648874282836914, "num_tokens": 107283074.0, "step": 61860 }, { "entropy": 5.2955059051513675, "epoch": 4.8133048045127405, "grad_norm": 1.1015625, "learning_rate": 0.0002910392529363566, "loss": 4.6378, "mean_token_accuracy": 0.23276097923517228, "num_tokens": 107292072.0, "step": 61865 }, { "entropy": 5.454576826095581, "epoch": 4.813693833884458, "grad_norm": 1.15625, "learning_rate": 0.00029101160773700887, "loss": 4.8266, "mean_token_accuracy": 0.22787625193595887, "num_tokens": 107300275.0, "step": 61870 }, { "entropy": 5.499374198913574, "epoch": 4.814082863256176, "grad_norm": 1.21875, "learning_rate": 0.0002909839622947104, "loss": 4.8507, "mean_token_accuracy": 0.21894708275794983, "num_tokens": 107309157.0, "step": 61875 }, { "entropy": 5.451032400131226, "epoch": 4.8144718926278935, "grad_norm": 1.109375, "learning_rate": 0.0002909563166098809, "loss": 4.8099, "mean_token_accuracy": 0.22242779433727264, "num_tokens": 107318408.0, "step": 61880 }, { "entropy": 5.44443826675415, "epoch": 4.814860921999611, "grad_norm": 1.1875, "learning_rate": 0.00029092867068293966, "loss": 4.8147, "mean_token_accuracy": 0.22431010156869888, "num_tokens": 107327273.0, "step": 61885 }, { "entropy": 5.441891241073608, "epoch": 4.815249951371328, "grad_norm": 1.25, "learning_rate": 0.0002909010245143061, "loss": 4.8076, "mean_token_accuracy": 0.22640783488750457, "num_tokens": 107336047.0, "step": 61890 }, { "entropy": 5.380611801147461, "epoch": 4.815638980743046, "grad_norm": 1.15625, "learning_rate": 0.0002908733781043998, "loss": 4.7614, "mean_token_accuracy": 0.22540556341409684, "num_tokens": 107344481.0, "step": 61895 }, { "entropy": 5.361806154251099, "epoch": 4.8160280101147634, "grad_norm": 1.109375, "learning_rate": 0.0002908457314536403, "loss": 4.7118, "mean_token_accuracy": 0.2339036777615547, "num_tokens": 107353502.0, "step": 61900 }, { "entropy": 5.372123050689697, "epoch": 4.816417039486481, "grad_norm": 1.1875, "learning_rate": 0.00029081808456244703, "loss": 4.7828, "mean_token_accuracy": 0.22410992681980133, "num_tokens": 107362067.0, "step": 61905 }, { "entropy": 5.404747676849365, "epoch": 4.816806068858199, "grad_norm": 1.1796875, "learning_rate": 0.00029079043743123953, "loss": 4.8182, "mean_token_accuracy": 0.22547973543405533, "num_tokens": 107371107.0, "step": 61910 }, { "entropy": 5.407158851623535, "epoch": 4.8171950982299165, "grad_norm": 1.2109375, "learning_rate": 0.00029076279006043723, "loss": 4.7563, "mean_token_accuracy": 0.22345586270093917, "num_tokens": 107379707.0, "step": 61915 }, { "entropy": 5.495927381515503, "epoch": 4.817584127601634, "grad_norm": 1.1328125, "learning_rate": 0.0002907351424504597, "loss": 4.8522, "mean_token_accuracy": 0.22566048800945282, "num_tokens": 107389481.0, "step": 61920 }, { "entropy": 5.435864639282227, "epoch": 4.817973156973352, "grad_norm": 1.2421875, "learning_rate": 0.0002907074946017265, "loss": 4.8059, "mean_token_accuracy": 0.22802118957042694, "num_tokens": 107397463.0, "step": 61925 }, { "entropy": 5.414382362365723, "epoch": 4.818362186345069, "grad_norm": 1.171875, "learning_rate": 0.000290679846514657, "loss": 4.7936, "mean_token_accuracy": 0.2212691605091095, "num_tokens": 107405563.0, "step": 61930 }, { "entropy": 5.343133974075317, "epoch": 4.818751215716786, "grad_norm": 1.140625, "learning_rate": 0.00029065219818967075, "loss": 4.7205, "mean_token_accuracy": 0.23624372631311416, "num_tokens": 107414641.0, "step": 61935 }, { "entropy": 5.42290358543396, "epoch": 4.819140245088504, "grad_norm": 1.2890625, "learning_rate": 0.00029062454962718736, "loss": 4.751, "mean_token_accuracy": 0.22517256140708924, "num_tokens": 107423269.0, "step": 61940 }, { "entropy": 5.453370571136475, "epoch": 4.819529274460222, "grad_norm": 1.171875, "learning_rate": 0.0002905969008276263, "loss": 4.7507, "mean_token_accuracy": 0.2292963147163391, "num_tokens": 107432025.0, "step": 61945 }, { "entropy": 5.360519886016846, "epoch": 4.8199183038319395, "grad_norm": 1.2109375, "learning_rate": 0.0002905692517914071, "loss": 4.6606, "mean_token_accuracy": 0.23068249970674515, "num_tokens": 107440454.0, "step": 61950 }, { "entropy": 5.30904598236084, "epoch": 4.820307333203657, "grad_norm": 1.3125, "learning_rate": 0.00029054160251894924, "loss": 4.6882, "mean_token_accuracy": 0.2366346076130867, "num_tokens": 107448574.0, "step": 61955 }, { "entropy": 5.409383487701416, "epoch": 4.820696362575374, "grad_norm": 1.1953125, "learning_rate": 0.0002905139530106724, "loss": 4.8237, "mean_token_accuracy": 0.21846911013126374, "num_tokens": 107457102.0, "step": 61960 }, { "entropy": 5.458728694915772, "epoch": 4.821085391947092, "grad_norm": 1.2265625, "learning_rate": 0.00029048630326699594, "loss": 4.8606, "mean_token_accuracy": 0.21428277790546418, "num_tokens": 107465290.0, "step": 61965 }, { "entropy": 5.396546506881714, "epoch": 4.821474421318809, "grad_norm": 1.1796875, "learning_rate": 0.00029045865328833944, "loss": 4.7754, "mean_token_accuracy": 0.22858381867408753, "num_tokens": 107473724.0, "step": 61970 }, { "entropy": 5.398178291320801, "epoch": 4.821863450690527, "grad_norm": 1.1484375, "learning_rate": 0.00029043100307512247, "loss": 4.6844, "mean_token_accuracy": 0.23349391669034958, "num_tokens": 107482065.0, "step": 61975 }, { "entropy": 5.356892919540405, "epoch": 4.822252480062245, "grad_norm": 1.2578125, "learning_rate": 0.00029040335262776467, "loss": 4.7099, "mean_token_accuracy": 0.23352280557155608, "num_tokens": 107491630.0, "step": 61980 }, { "entropy": 5.427842283248902, "epoch": 4.8226415094339625, "grad_norm": 1.1953125, "learning_rate": 0.0002903757019466855, "loss": 4.836, "mean_token_accuracy": 0.21833476275205613, "num_tokens": 107500119.0, "step": 61985 }, { "entropy": 5.404071187973022, "epoch": 4.82303053880568, "grad_norm": 1.21875, "learning_rate": 0.00029034805103230453, "loss": 4.752, "mean_token_accuracy": 0.2241002842783928, "num_tokens": 107508832.0, "step": 61990 }, { "entropy": 5.448879098892212, "epoch": 4.823419568177397, "grad_norm": 1.25, "learning_rate": 0.00029032039988504126, "loss": 4.7762, "mean_token_accuracy": 0.22887902706861496, "num_tokens": 107517432.0, "step": 61995 }, { "entropy": 5.3534400939941404, "epoch": 4.823808597549115, "grad_norm": 1.203125, "learning_rate": 0.00029029274850531534, "loss": 4.6589, "mean_token_accuracy": 0.2358362630009651, "num_tokens": 107526700.0, "step": 62000 }, { "entropy": 5.362733173370361, "epoch": 4.824197626920832, "grad_norm": 1.1015625, "learning_rate": 0.00029026509689354635, "loss": 4.785, "mean_token_accuracy": 0.21853710561990738, "num_tokens": 107536811.0, "step": 62005 }, { "entropy": 5.297612857818604, "epoch": 4.82458665629255, "grad_norm": 1.2421875, "learning_rate": 0.00029023744505015373, "loss": 4.6093, "mean_token_accuracy": 0.2395670160651207, "num_tokens": 107545919.0, "step": 62010 }, { "entropy": 5.31793098449707, "epoch": 4.824975685664268, "grad_norm": 1.203125, "learning_rate": 0.00029020979297555717, "loss": 4.6837, "mean_token_accuracy": 0.23302997499704362, "num_tokens": 107554044.0, "step": 62015 }, { "entropy": 5.363417768478394, "epoch": 4.8253647150359855, "grad_norm": 1.15625, "learning_rate": 0.00029018214067017624, "loss": 4.7431, "mean_token_accuracy": 0.22819169461727143, "num_tokens": 107563200.0, "step": 62020 }, { "entropy": 5.353820180892944, "epoch": 4.825753744407702, "grad_norm": 1.1875, "learning_rate": 0.0002901544881344305, "loss": 4.7287, "mean_token_accuracy": 0.2338038444519043, "num_tokens": 107572219.0, "step": 62025 }, { "entropy": 5.47909951210022, "epoch": 4.82614277377942, "grad_norm": 1.171875, "learning_rate": 0.0002901268353687394, "loss": 4.8699, "mean_token_accuracy": 0.2224046915769577, "num_tokens": 107580891.0, "step": 62030 }, { "entropy": 5.417860746383667, "epoch": 4.826531803151138, "grad_norm": 1.296875, "learning_rate": 0.00029009918237352274, "loss": 4.8466, "mean_token_accuracy": 0.2248125985264778, "num_tokens": 107589342.0, "step": 62035 }, { "entropy": 5.459008836746216, "epoch": 4.826920832522855, "grad_norm": 1.1640625, "learning_rate": 0.0002900715291492, "loss": 4.8764, "mean_token_accuracy": 0.22367976903915404, "num_tokens": 107598748.0, "step": 62040 }, { "entropy": 5.4241491794586185, "epoch": 4.827309861894573, "grad_norm": 1.1640625, "learning_rate": 0.0002900438756961908, "loss": 4.7129, "mean_token_accuracy": 0.22881414443254472, "num_tokens": 107606733.0, "step": 62045 }, { "entropy": 5.419542360305786, "epoch": 4.827698891266291, "grad_norm": 1.2265625, "learning_rate": 0.0002900162220149148, "loss": 4.7938, "mean_token_accuracy": 0.2243785575032234, "num_tokens": 107615582.0, "step": 62050 }, { "entropy": 5.349026918411255, "epoch": 4.8280879206380085, "grad_norm": 1.2265625, "learning_rate": 0.00028998856810579144, "loss": 4.6771, "mean_token_accuracy": 0.2338649407029152, "num_tokens": 107624245.0, "step": 62055 }, { "entropy": 5.337031126022339, "epoch": 4.828476950009726, "grad_norm": 1.1796875, "learning_rate": 0.0002899609139692405, "loss": 4.7032, "mean_token_accuracy": 0.23185718208551406, "num_tokens": 107632398.0, "step": 62060 }, { "entropy": 5.301353454589844, "epoch": 4.828865979381443, "grad_norm": 1.109375, "learning_rate": 0.00028993325960568133, "loss": 4.7901, "mean_token_accuracy": 0.22813630551099778, "num_tokens": 107641674.0, "step": 62065 }, { "entropy": 5.476647567749024, "epoch": 4.829255008753161, "grad_norm": 1.2265625, "learning_rate": 0.0002899056050155339, "loss": 4.804, "mean_token_accuracy": 0.22075988799333573, "num_tokens": 107650086.0, "step": 62070 }, { "entropy": 5.4539049625396725, "epoch": 4.829644038124878, "grad_norm": 1.2109375, "learning_rate": 0.0002898779501992176, "loss": 4.8115, "mean_token_accuracy": 0.22158151268959045, "num_tokens": 107658954.0, "step": 62075 }, { "entropy": 5.394329833984375, "epoch": 4.830033067496596, "grad_norm": 1.2109375, "learning_rate": 0.000289850295157152, "loss": 4.7464, "mean_token_accuracy": 0.22531236857175826, "num_tokens": 107668130.0, "step": 62080 }, { "entropy": 5.503174734115601, "epoch": 4.830422096868314, "grad_norm": 1.2109375, "learning_rate": 0.00028982263988975687, "loss": 4.8771, "mean_token_accuracy": 0.21520103961229325, "num_tokens": 107676657.0, "step": 62085 }, { "entropy": 5.396610307693481, "epoch": 4.8308111262400315, "grad_norm": 1.15625, "learning_rate": 0.0002897949843974518, "loss": 4.6795, "mean_token_accuracy": 0.2386665537953377, "num_tokens": 107685961.0, "step": 62090 }, { "entropy": 5.400670862197876, "epoch": 4.831200155611748, "grad_norm": 1.2265625, "learning_rate": 0.0002897673286806562, "loss": 4.7509, "mean_token_accuracy": 0.2308945521712303, "num_tokens": 107694781.0, "step": 62095 }, { "entropy": 5.395420074462891, "epoch": 4.831589184983466, "grad_norm": 1.234375, "learning_rate": 0.0002897396727397901, "loss": 4.7726, "mean_token_accuracy": 0.22023675143718718, "num_tokens": 107703096.0, "step": 62100 }, { "entropy": 5.352065849304199, "epoch": 4.831978214355184, "grad_norm": 1.140625, "learning_rate": 0.0002897120165752729, "loss": 4.7936, "mean_token_accuracy": 0.2225321963429451, "num_tokens": 107712390.0, "step": 62105 }, { "entropy": 5.394181537628174, "epoch": 4.832367243726901, "grad_norm": 1.265625, "learning_rate": 0.0002896843601875243, "loss": 4.7314, "mean_token_accuracy": 0.23118022680282593, "num_tokens": 107721205.0, "step": 62110 }, { "entropy": 5.371083307266235, "epoch": 4.832756273098619, "grad_norm": 1.2734375, "learning_rate": 0.00028965670357696384, "loss": 4.7385, "mean_token_accuracy": 0.22614828497171402, "num_tokens": 107730217.0, "step": 62115 }, { "entropy": 5.377795028686523, "epoch": 4.833145302470337, "grad_norm": 1.171875, "learning_rate": 0.00028962904674401124, "loss": 4.7595, "mean_token_accuracy": 0.2262401208281517, "num_tokens": 107739153.0, "step": 62120 }, { "entropy": 5.309487247467041, "epoch": 4.8335343318420545, "grad_norm": 1.2578125, "learning_rate": 0.0002896013896890862, "loss": 4.6599, "mean_token_accuracy": 0.23767198771238326, "num_tokens": 107747551.0, "step": 62125 }, { "entropy": 5.401728010177612, "epoch": 4.833923361213771, "grad_norm": 1.2578125, "learning_rate": 0.00028957373241260816, "loss": 4.8308, "mean_token_accuracy": 0.21870179027318953, "num_tokens": 107755763.0, "step": 62130 }, { "entropy": 5.517660427093506, "epoch": 4.834312390585489, "grad_norm": 1.171875, "learning_rate": 0.000289546074914997, "loss": 4.8709, "mean_token_accuracy": 0.21933193355798722, "num_tokens": 107763431.0, "step": 62135 }, { "entropy": 5.483182001113891, "epoch": 4.834701419957207, "grad_norm": 1.1796875, "learning_rate": 0.0002895184171966724, "loss": 4.8738, "mean_token_accuracy": 0.21124197393655778, "num_tokens": 107772601.0, "step": 62140 }, { "entropy": 5.40276403427124, "epoch": 4.835090449328924, "grad_norm": 1.21875, "learning_rate": 0.0002894907592580538, "loss": 4.847, "mean_token_accuracy": 0.22624280154705048, "num_tokens": 107780855.0, "step": 62145 }, { "entropy": 5.381205654144287, "epoch": 4.835479478700642, "grad_norm": 1.09375, "learning_rate": 0.00028946310109956107, "loss": 4.7524, "mean_token_accuracy": 0.23215004801750183, "num_tokens": 107790428.0, "step": 62150 }, { "entropy": 5.518284463882447, "epoch": 4.83586850807236, "grad_norm": 1.3359375, "learning_rate": 0.0002894354427216138, "loss": 4.8762, "mean_token_accuracy": 0.2150247186422348, "num_tokens": 107798816.0, "step": 62155 }, { "entropy": 5.3940025806427006, "epoch": 4.836257537444077, "grad_norm": 1.1640625, "learning_rate": 0.00028940778412463164, "loss": 4.7636, "mean_token_accuracy": 0.22035638689994813, "num_tokens": 107807387.0, "step": 62160 }, { "entropy": 5.296510410308838, "epoch": 4.836646566815794, "grad_norm": 1.21875, "learning_rate": 0.00028938012530903425, "loss": 4.6691, "mean_token_accuracy": 0.23735246062278748, "num_tokens": 107816447.0, "step": 62165 }, { "entropy": 5.318221616744995, "epoch": 4.837035596187512, "grad_norm": 1.203125, "learning_rate": 0.0002893524662752414, "loss": 4.725, "mean_token_accuracy": 0.2266872227191925, "num_tokens": 107824852.0, "step": 62170 }, { "entropy": 5.297435569763183, "epoch": 4.83742462555923, "grad_norm": 1.21875, "learning_rate": 0.00028932480702367264, "loss": 4.6459, "mean_token_accuracy": 0.23211088329553603, "num_tokens": 107833266.0, "step": 62175 }, { "entropy": 5.3077410697937015, "epoch": 4.837813654930947, "grad_norm": 1.2578125, "learning_rate": 0.0002892971475547478, "loss": 4.7377, "mean_token_accuracy": 0.23364885449409484, "num_tokens": 107841723.0, "step": 62180 }, { "entropy": 5.3862865447998045, "epoch": 4.838202684302665, "grad_norm": 1.125, "learning_rate": 0.00028926948786888655, "loss": 4.7705, "mean_token_accuracy": 0.2240111380815506, "num_tokens": 107850731.0, "step": 62185 }, { "entropy": 5.428891372680664, "epoch": 4.838591713674383, "grad_norm": 1.1796875, "learning_rate": 0.00028924182796650854, "loss": 4.7952, "mean_token_accuracy": 0.22418223172426224, "num_tokens": 107859251.0, "step": 62190 }, { "entropy": 5.484386396408081, "epoch": 4.8389807430461, "grad_norm": 1.2265625, "learning_rate": 0.00028921416784803336, "loss": 4.8003, "mean_token_accuracy": 0.22607420682907103, "num_tokens": 107867584.0, "step": 62195 }, { "entropy": 5.3803760528564455, "epoch": 4.839369772417817, "grad_norm": 1.203125, "learning_rate": 0.0002891865075138809, "loss": 4.8142, "mean_token_accuracy": 0.22114376723766327, "num_tokens": 107876509.0, "step": 62200 }, { "entropy": 5.345442295074463, "epoch": 4.839758801789535, "grad_norm": 1.1875, "learning_rate": 0.00028915884696447064, "loss": 4.6897, "mean_token_accuracy": 0.23121631294488906, "num_tokens": 107885591.0, "step": 62205 }, { "entropy": 5.384468841552734, "epoch": 4.840147831161253, "grad_norm": 1.21875, "learning_rate": 0.0002891311862002225, "loss": 4.6574, "mean_token_accuracy": 0.23188535422086715, "num_tokens": 107893896.0, "step": 62210 }, { "entropy": 5.3528882503509525, "epoch": 4.84053686053297, "grad_norm": 1.1796875, "learning_rate": 0.0002891035252215561, "loss": 4.792, "mean_token_accuracy": 0.22083986848592757, "num_tokens": 107901769.0, "step": 62215 }, { "entropy": 5.363465690612793, "epoch": 4.840925889904688, "grad_norm": 1.3671875, "learning_rate": 0.00028907586402889115, "loss": 4.7788, "mean_token_accuracy": 0.22365833669900895, "num_tokens": 107909790.0, "step": 62220 }, { "entropy": 5.316484785079956, "epoch": 4.841314919276405, "grad_norm": 1.1640625, "learning_rate": 0.0002890482026226473, "loss": 4.7315, "mean_token_accuracy": 0.22493889778852463, "num_tokens": 107918239.0, "step": 62225 }, { "entropy": 5.364662170410156, "epoch": 4.841703948648123, "grad_norm": 1.21875, "learning_rate": 0.00028902054100324445, "loss": 4.7756, "mean_token_accuracy": 0.22463614195585252, "num_tokens": 107926416.0, "step": 62230 }, { "entropy": 5.42995777130127, "epoch": 4.84209297801984, "grad_norm": 1.140625, "learning_rate": 0.00028899287917110214, "loss": 4.7854, "mean_token_accuracy": 0.229339662194252, "num_tokens": 107935595.0, "step": 62235 }, { "entropy": 5.501901912689209, "epoch": 4.842482007391558, "grad_norm": 1.28125, "learning_rate": 0.0002889652171266402, "loss": 4.8335, "mean_token_accuracy": 0.22634778320789337, "num_tokens": 107943214.0, "step": 62240 }, { "entropy": 5.304883623123169, "epoch": 4.842871036763276, "grad_norm": 1.2578125, "learning_rate": 0.00028893755487027827, "loss": 4.6607, "mean_token_accuracy": 0.23679470270872116, "num_tokens": 107951404.0, "step": 62245 }, { "entropy": 5.396559429168701, "epoch": 4.843260066134993, "grad_norm": 1.1953125, "learning_rate": 0.00028890989240243614, "loss": 4.8784, "mean_token_accuracy": 0.21596727520227432, "num_tokens": 107960611.0, "step": 62250 }, { "entropy": 5.354087591171265, "epoch": 4.843649095506711, "grad_norm": 1.171875, "learning_rate": 0.00028888222972353356, "loss": 4.7312, "mean_token_accuracy": 0.2322120800614357, "num_tokens": 107969217.0, "step": 62255 }, { "entropy": 5.4852887153625485, "epoch": 4.844038124878429, "grad_norm": 1.1484375, "learning_rate": 0.00028885456683399024, "loss": 4.8117, "mean_token_accuracy": 0.2228536769747734, "num_tokens": 107978448.0, "step": 62260 }, { "entropy": 5.429894351959229, "epoch": 4.844427154250146, "grad_norm": 1.2734375, "learning_rate": 0.00028882690373422586, "loss": 4.7439, "mean_token_accuracy": 0.2218604639172554, "num_tokens": 107987578.0, "step": 62265 }, { "entropy": 5.449800872802735, "epoch": 4.844816183621863, "grad_norm": 1.171875, "learning_rate": 0.0002887992404246603, "loss": 4.832, "mean_token_accuracy": 0.222810734808445, "num_tokens": 107996868.0, "step": 62270 }, { "entropy": 5.478562498092652, "epoch": 4.845205212993581, "grad_norm": 1.3203125, "learning_rate": 0.0002887715769057132, "loss": 4.8057, "mean_token_accuracy": 0.22171455323696138, "num_tokens": 108005100.0, "step": 62275 }, { "entropy": 5.373879671096802, "epoch": 4.845594242365299, "grad_norm": 1.1796875, "learning_rate": 0.00028874391317780437, "loss": 4.7383, "mean_token_accuracy": 0.23460486382246018, "num_tokens": 108013712.0, "step": 62280 }, { "entropy": 5.444703149795532, "epoch": 4.845983271737016, "grad_norm": 1.25, "learning_rate": 0.0002887162492413534, "loss": 4.888, "mean_token_accuracy": 0.2198150336742401, "num_tokens": 108022423.0, "step": 62285 }, { "entropy": 5.38258810043335, "epoch": 4.846372301108734, "grad_norm": 1.2734375, "learning_rate": 0.0002886885850967803, "loss": 4.705, "mean_token_accuracy": 0.22793688774108886, "num_tokens": 108031531.0, "step": 62290 }, { "entropy": 5.391807556152344, "epoch": 4.846761330480451, "grad_norm": 1.203125, "learning_rate": 0.00028866092074450467, "loss": 4.7515, "mean_token_accuracy": 0.21793063133955, "num_tokens": 108040753.0, "step": 62295 }, { "entropy": 5.422497320175171, "epoch": 4.847150359852169, "grad_norm": 1.265625, "learning_rate": 0.0002886332561849464, "loss": 4.8703, "mean_token_accuracy": 0.22131213545799255, "num_tokens": 108050185.0, "step": 62300 }, { "entropy": 5.494942903518677, "epoch": 4.847539389223886, "grad_norm": 1.2421875, "learning_rate": 0.00028860559141852504, "loss": 4.8565, "mean_token_accuracy": 0.2275303289294243, "num_tokens": 108058116.0, "step": 62305 }, { "entropy": 5.437143611907959, "epoch": 4.847928418595604, "grad_norm": 1.265625, "learning_rate": 0.00028857792644566057, "loss": 4.7711, "mean_token_accuracy": 0.22440730333328246, "num_tokens": 108066150.0, "step": 62310 }, { "entropy": 5.330299615859985, "epoch": 4.848317447967322, "grad_norm": 1.15625, "learning_rate": 0.0002885502612667727, "loss": 4.6802, "mean_token_accuracy": 0.23074383586645125, "num_tokens": 108075519.0, "step": 62315 }, { "entropy": 5.288139772415161, "epoch": 4.848706477339039, "grad_norm": 1.2734375, "learning_rate": 0.00028852259588228106, "loss": 4.6897, "mean_token_accuracy": 0.230577951669693, "num_tokens": 108084506.0, "step": 62320 }, { "entropy": 5.43466796875, "epoch": 4.849095506710757, "grad_norm": 1.1953125, "learning_rate": 0.00028849493029260573, "loss": 4.8113, "mean_token_accuracy": 0.23240932673215867, "num_tokens": 108093311.0, "step": 62325 }, { "entropy": 5.372525644302368, "epoch": 4.849484536082474, "grad_norm": 1.3671875, "learning_rate": 0.0002884672644981661, "loss": 4.7197, "mean_token_accuracy": 0.23194820433855057, "num_tokens": 108102110.0, "step": 62330 }, { "entropy": 5.4318877220153805, "epoch": 4.849873565454192, "grad_norm": 1.1328125, "learning_rate": 0.0002884395984993823, "loss": 4.7927, "mean_token_accuracy": 0.21765922605991364, "num_tokens": 108110805.0, "step": 62335 }, { "entropy": 5.481058120727539, "epoch": 4.850262594825909, "grad_norm": 1.1484375, "learning_rate": 0.000288411932296674, "loss": 4.8604, "mean_token_accuracy": 0.2180154800415039, "num_tokens": 108119717.0, "step": 62340 }, { "entropy": 5.4526838779449465, "epoch": 4.850651624197627, "grad_norm": 1.1953125, "learning_rate": 0.0002883842658904609, "loss": 4.7512, "mean_token_accuracy": 0.23140333443880082, "num_tokens": 108128091.0, "step": 62345 }, { "entropy": 5.456583786010742, "epoch": 4.851040653569345, "grad_norm": 1.125, "learning_rate": 0.0002883565992811629, "loss": 4.7917, "mean_token_accuracy": 0.22166844457387924, "num_tokens": 108136766.0, "step": 62350 }, { "entropy": 5.403702592849731, "epoch": 4.851429682941062, "grad_norm": 1.171875, "learning_rate": 0.0002883289324691998, "loss": 4.7881, "mean_token_accuracy": 0.22381279468536378, "num_tokens": 108145327.0, "step": 62355 }, { "entropy": 5.415755653381348, "epoch": 4.851818712312779, "grad_norm": 1.171875, "learning_rate": 0.0002883012654549913, "loss": 4.742, "mean_token_accuracy": 0.22388166934251785, "num_tokens": 108153692.0, "step": 62360 }, { "entropy": 5.477291488647461, "epoch": 4.852207741684497, "grad_norm": 1.2265625, "learning_rate": 0.00028827359823895726, "loss": 4.8358, "mean_token_accuracy": 0.2089389219880104, "num_tokens": 108162406.0, "step": 62365 }, { "entropy": 5.474725532531738, "epoch": 4.852596771056215, "grad_norm": 1.2421875, "learning_rate": 0.00028824593082151754, "loss": 4.9243, "mean_token_accuracy": 0.211528879404068, "num_tokens": 108170787.0, "step": 62370 }, { "entropy": 5.383820295333862, "epoch": 4.852985800427932, "grad_norm": 1.1640625, "learning_rate": 0.0002882182632030919, "loss": 4.7262, "mean_token_accuracy": 0.22840136289596558, "num_tokens": 108179719.0, "step": 62375 }, { "entropy": 5.434463548660278, "epoch": 4.85337482979965, "grad_norm": 1.171875, "learning_rate": 0.0002881905953841002, "loss": 4.8469, "mean_token_accuracy": 0.22321785539388656, "num_tokens": 108188098.0, "step": 62380 }, { "entropy": 5.389695835113526, "epoch": 4.853763859171368, "grad_norm": 1.2265625, "learning_rate": 0.0002881629273649621, "loss": 4.8007, "mean_token_accuracy": 0.2230105072259903, "num_tokens": 108196912.0, "step": 62385 }, { "entropy": 5.3954854011535645, "epoch": 4.854152888543085, "grad_norm": 1.234375, "learning_rate": 0.00028813525914609767, "loss": 4.6979, "mean_token_accuracy": 0.2234781041741371, "num_tokens": 108205574.0, "step": 62390 }, { "entropy": 5.508768224716187, "epoch": 4.854541917914803, "grad_norm": 1.3046875, "learning_rate": 0.00028810759072792644, "loss": 4.8489, "mean_token_accuracy": 0.2176006019115448, "num_tokens": 108213493.0, "step": 62395 }, { "entropy": 5.333204364776611, "epoch": 4.85493094728652, "grad_norm": 1.1953125, "learning_rate": 0.0002880799221108684, "loss": 4.6861, "mean_token_accuracy": 0.22731382995843888, "num_tokens": 108221852.0, "step": 62400 }, { "entropy": 5.405997467041016, "epoch": 4.855319976658238, "grad_norm": 1.1796875, "learning_rate": 0.0002880522532953435, "loss": 4.7073, "mean_token_accuracy": 0.22474607825279236, "num_tokens": 108229517.0, "step": 62405 }, { "entropy": 5.337581729888916, "epoch": 4.855709006029955, "grad_norm": 1.1953125, "learning_rate": 0.0002880245842817713, "loss": 4.789, "mean_token_accuracy": 0.22694811522960662, "num_tokens": 108238666.0, "step": 62410 }, { "entropy": 5.392370748519897, "epoch": 4.856098035401673, "grad_norm": 1.2734375, "learning_rate": 0.0002879969150705718, "loss": 4.8039, "mean_token_accuracy": 0.22382072508335113, "num_tokens": 108246971.0, "step": 62415 }, { "entropy": 5.480716180801392, "epoch": 4.856487064773391, "grad_norm": 1.2109375, "learning_rate": 0.0002879692456621649, "loss": 4.7948, "mean_token_accuracy": 0.2158706530928612, "num_tokens": 108255123.0, "step": 62420 }, { "entropy": 5.385247611999512, "epoch": 4.8568760941451075, "grad_norm": 1.2890625, "learning_rate": 0.0002879415760569702, "loss": 4.7671, "mean_token_accuracy": 0.22791349440813063, "num_tokens": 108263737.0, "step": 62425 }, { "entropy": 5.387014722824096, "epoch": 4.857265123516825, "grad_norm": 1.1484375, "learning_rate": 0.0002879139062554077, "loss": 4.7487, "mean_token_accuracy": 0.22671225816011428, "num_tokens": 108272356.0, "step": 62430 }, { "entropy": 5.5118879795074465, "epoch": 4.857654152888543, "grad_norm": 1.2578125, "learning_rate": 0.00028788623625789725, "loss": 4.9372, "mean_token_accuracy": 0.21839599758386613, "num_tokens": 108280431.0, "step": 62435 }, { "entropy": 5.399744319915771, "epoch": 4.8580431822602606, "grad_norm": 1.2109375, "learning_rate": 0.0002878585660648587, "loss": 4.6685, "mean_token_accuracy": 0.23119349777698517, "num_tokens": 108288966.0, "step": 62440 }, { "entropy": 5.308374118804932, "epoch": 4.858432211631978, "grad_norm": 1.2578125, "learning_rate": 0.0002878308956767118, "loss": 4.7086, "mean_token_accuracy": 0.2357080787420273, "num_tokens": 108297630.0, "step": 62445 }, { "entropy": 5.382984733581543, "epoch": 4.858821241003696, "grad_norm": 1.2265625, "learning_rate": 0.0002878032250938766, "loss": 4.7292, "mean_token_accuracy": 0.23048530220985414, "num_tokens": 108305828.0, "step": 62450 }, { "entropy": 5.541228485107422, "epoch": 4.859210270375414, "grad_norm": 1.1875, "learning_rate": 0.00028777555431677276, "loss": 4.8799, "mean_token_accuracy": 0.21814603358507156, "num_tokens": 108315192.0, "step": 62455 }, { "entropy": 5.426833534240723, "epoch": 4.859599299747131, "grad_norm": 1.265625, "learning_rate": 0.00028774788334582025, "loss": 4.7722, "mean_token_accuracy": 0.21955320090055466, "num_tokens": 108324934.0, "step": 62460 }, { "entropy": 5.372299337387085, "epoch": 4.859988329118848, "grad_norm": 1.140625, "learning_rate": 0.0002877202121814389, "loss": 4.6612, "mean_token_accuracy": 0.23443253338336945, "num_tokens": 108333549.0, "step": 62465 }, { "entropy": 5.3668749809265135, "epoch": 4.860377358490566, "grad_norm": 1.28125, "learning_rate": 0.0002876925408240485, "loss": 4.735, "mean_token_accuracy": 0.22402966022491455, "num_tokens": 108342782.0, "step": 62470 }, { "entropy": 5.46300892829895, "epoch": 4.8607663878622835, "grad_norm": 1.171875, "learning_rate": 0.0002876648692740691, "loss": 4.8868, "mean_token_accuracy": 0.2169716700911522, "num_tokens": 108352272.0, "step": 62475 }, { "entropy": 5.391826725006103, "epoch": 4.861155417234001, "grad_norm": 1.2265625, "learning_rate": 0.00028763719753192044, "loss": 4.74, "mean_token_accuracy": 0.2264694795012474, "num_tokens": 108362015.0, "step": 62480 }, { "entropy": 5.361153173446655, "epoch": 4.861544446605719, "grad_norm": 1.15625, "learning_rate": 0.0002876095255980224, "loss": 4.7118, "mean_token_accuracy": 0.23048152029514313, "num_tokens": 108370307.0, "step": 62485 }, { "entropy": 5.451849126815796, "epoch": 4.861933475977437, "grad_norm": 1.140625, "learning_rate": 0.00028758185347279485, "loss": 4.7998, "mean_token_accuracy": 0.22439068108797072, "num_tokens": 108379803.0, "step": 62490 }, { "entropy": 5.46420316696167, "epoch": 4.8623225053491534, "grad_norm": 1.1484375, "learning_rate": 0.0002875541811566578, "loss": 4.7585, "mean_token_accuracy": 0.22957368642091752, "num_tokens": 108388499.0, "step": 62495 }, { "entropy": 5.3534770011901855, "epoch": 4.862711534720871, "grad_norm": 1.265625, "learning_rate": 0.0002875265086500309, "loss": 4.6393, "mean_token_accuracy": 0.23172218054533006, "num_tokens": 108396437.0, "step": 62500 }, { "entropy": 5.336780118942261, "epoch": 4.863100564092589, "grad_norm": 1.296875, "learning_rate": 0.00028749883595333424, "loss": 4.7119, "mean_token_accuracy": 0.23219569772481918, "num_tokens": 108405011.0, "step": 62505 }, { "entropy": 5.416940546035766, "epoch": 4.8634895934643065, "grad_norm": 1.203125, "learning_rate": 0.0002874711630669876, "loss": 4.6986, "mean_token_accuracy": 0.23322720676660538, "num_tokens": 108413068.0, "step": 62510 }, { "entropy": 5.465639686584472, "epoch": 4.863878622836024, "grad_norm": 1.34375, "learning_rate": 0.000287443489991411, "loss": 4.7517, "mean_token_accuracy": 0.22750117778778076, "num_tokens": 108422088.0, "step": 62515 }, { "entropy": 5.459622192382812, "epoch": 4.864267652207742, "grad_norm": 1.2265625, "learning_rate": 0.0002874158167270242, "loss": 4.8817, "mean_token_accuracy": 0.21617176085710527, "num_tokens": 108430580.0, "step": 62520 }, { "entropy": 5.430044317245484, "epoch": 4.86465668157946, "grad_norm": 1.296875, "learning_rate": 0.00028738814327424714, "loss": 4.7358, "mean_token_accuracy": 0.22372561544179917, "num_tokens": 108439187.0, "step": 62525 }, { "entropy": 5.46817626953125, "epoch": 4.865045710951176, "grad_norm": 1.1796875, "learning_rate": 0.0002873604696334997, "loss": 4.767, "mean_token_accuracy": 0.2224241927266121, "num_tokens": 108447547.0, "step": 62530 }, { "entropy": 5.462680435180664, "epoch": 4.865434740322894, "grad_norm": 1.0859375, "learning_rate": 0.00028733279580520185, "loss": 4.8172, "mean_token_accuracy": 0.22280648946762086, "num_tokens": 108456398.0, "step": 62535 }, { "entropy": 5.411099243164062, "epoch": 4.865823769694612, "grad_norm": 1.2109375, "learning_rate": 0.00028730512178977343, "loss": 4.7793, "mean_token_accuracy": 0.2245758056640625, "num_tokens": 108465156.0, "step": 62540 }, { "entropy": 5.399336194992065, "epoch": 4.8662127990663295, "grad_norm": 1.140625, "learning_rate": 0.00028727744758763434, "loss": 4.7507, "mean_token_accuracy": 0.22699066549539565, "num_tokens": 108474133.0, "step": 62545 }, { "entropy": 5.449962902069092, "epoch": 4.866601828438047, "grad_norm": 1.25, "learning_rate": 0.00028724977319920453, "loss": 4.8236, "mean_token_accuracy": 0.22399901747703552, "num_tokens": 108482243.0, "step": 62550 }, { "entropy": 5.373311614990234, "epoch": 4.866990857809765, "grad_norm": 1.0859375, "learning_rate": 0.00028722209862490393, "loss": 4.7847, "mean_token_accuracy": 0.22300568521022796, "num_tokens": 108491892.0, "step": 62555 }, { "entropy": 5.450145530700683, "epoch": 4.867379887181482, "grad_norm": 1.2578125, "learning_rate": 0.00028719442386515245, "loss": 4.8743, "mean_token_accuracy": 0.21830102503299714, "num_tokens": 108500991.0, "step": 62560 }, { "entropy": 5.4401695251464846, "epoch": 4.867768916553199, "grad_norm": 1.1875, "learning_rate": 0.00028716674892036994, "loss": 4.724, "mean_token_accuracy": 0.22529653012752532, "num_tokens": 108509182.0, "step": 62565 }, { "entropy": 5.429437446594238, "epoch": 4.868157945924917, "grad_norm": 1.1875, "learning_rate": 0.0002871390737909765, "loss": 4.6777, "mean_token_accuracy": 0.23882465064525604, "num_tokens": 108517472.0, "step": 62570 }, { "entropy": 5.375689172744751, "epoch": 4.868546975296635, "grad_norm": 1.2578125, "learning_rate": 0.00028711139847739187, "loss": 4.7382, "mean_token_accuracy": 0.22955442517995833, "num_tokens": 108525874.0, "step": 62575 }, { "entropy": 5.421518564224243, "epoch": 4.8689360046683525, "grad_norm": 1.2265625, "learning_rate": 0.00028708372298003607, "loss": 4.8796, "mean_token_accuracy": 0.22388354539871216, "num_tokens": 108534964.0, "step": 62580 }, { "entropy": 5.505806541442871, "epoch": 4.86932503404007, "grad_norm": 1.3203125, "learning_rate": 0.00028705604729932895, "loss": 4.8472, "mean_token_accuracy": 0.2168989822268486, "num_tokens": 108543145.0, "step": 62585 }, { "entropy": 5.412068939208984, "epoch": 4.869714063411788, "grad_norm": 1.234375, "learning_rate": 0.00028702837143569057, "loss": 4.8001, "mean_token_accuracy": 0.22655394971370696, "num_tokens": 108551434.0, "step": 62590 }, { "entropy": 5.3919289112091064, "epoch": 4.870103092783506, "grad_norm": 1.28125, "learning_rate": 0.00028700069538954064, "loss": 4.7692, "mean_token_accuracy": 0.22733844667673112, "num_tokens": 108559968.0, "step": 62595 }, { "entropy": 5.388823127746582, "epoch": 4.870492122155222, "grad_norm": 1.1796875, "learning_rate": 0.00028697301916129944, "loss": 4.7882, "mean_token_accuracy": 0.22116948217153548, "num_tokens": 108569817.0, "step": 62600 }, { "entropy": 5.550229454040528, "epoch": 4.87088115152694, "grad_norm": 1.1953125, "learning_rate": 0.0002869453427513866, "loss": 4.8735, "mean_token_accuracy": 0.2204594776034355, "num_tokens": 108578487.0, "step": 62605 }, { "entropy": 5.337610244750977, "epoch": 4.871270180898658, "grad_norm": 1.203125, "learning_rate": 0.00028691766616022234, "loss": 4.6799, "mean_token_accuracy": 0.2340213492512703, "num_tokens": 108587794.0, "step": 62610 }, { "entropy": 5.344323396682739, "epoch": 4.8716592102703755, "grad_norm": 1.1875, "learning_rate": 0.0002868899893882264, "loss": 4.7506, "mean_token_accuracy": 0.23071829974651337, "num_tokens": 108595796.0, "step": 62615 }, { "entropy": 5.391664171218872, "epoch": 4.872048239642093, "grad_norm": 1.2109375, "learning_rate": 0.00028686231243581873, "loss": 4.712, "mean_token_accuracy": 0.2227457195520401, "num_tokens": 108604661.0, "step": 62620 }, { "entropy": 5.455424070358276, "epoch": 4.872437269013811, "grad_norm": 1.2890625, "learning_rate": 0.00028683463530341944, "loss": 4.7712, "mean_token_accuracy": 0.2272370532155037, "num_tokens": 108612569.0, "step": 62625 }, { "entropy": 5.346637535095215, "epoch": 4.872826298385528, "grad_norm": 1.2890625, "learning_rate": 0.0002868069579914483, "loss": 4.6788, "mean_token_accuracy": 0.22973189055919646, "num_tokens": 108620622.0, "step": 62630 }, { "entropy": 5.341037225723267, "epoch": 4.873215327757245, "grad_norm": 1.09375, "learning_rate": 0.00028677928050032547, "loss": 4.6826, "mean_token_accuracy": 0.23535866886377335, "num_tokens": 108628775.0, "step": 62635 }, { "entropy": 5.379862594604492, "epoch": 4.873604357128963, "grad_norm": 1.21875, "learning_rate": 0.00028675160283047073, "loss": 4.7358, "mean_token_accuracy": 0.22782426178455353, "num_tokens": 108637545.0, "step": 62640 }, { "entropy": 5.406108236312866, "epoch": 4.873993386500681, "grad_norm": 1.2734375, "learning_rate": 0.00028672392498230414, "loss": 4.7905, "mean_token_accuracy": 0.22281149476766587, "num_tokens": 108647074.0, "step": 62645 }, { "entropy": 5.3663191318511965, "epoch": 4.8743824158723985, "grad_norm": 1.203125, "learning_rate": 0.00028669624695624573, "loss": 4.7257, "mean_token_accuracy": 0.22987242490053178, "num_tokens": 108654711.0, "step": 62650 }, { "entropy": 5.362139701843262, "epoch": 4.874771445244116, "grad_norm": 1.2734375, "learning_rate": 0.00028666856875271535, "loss": 4.8113, "mean_token_accuracy": 0.22371883541345597, "num_tokens": 108663641.0, "step": 62655 }, { "entropy": 5.294822120666504, "epoch": 4.875160474615834, "grad_norm": 1.328125, "learning_rate": 0.0002866408903721329, "loss": 4.6864, "mean_token_accuracy": 0.23326313197612764, "num_tokens": 108672454.0, "step": 62660 }, { "entropy": 5.353326845169067, "epoch": 4.875549503987551, "grad_norm": 1.125, "learning_rate": 0.00028661321181491854, "loss": 4.8333, "mean_token_accuracy": 0.22589156180620193, "num_tokens": 108681356.0, "step": 62665 }, { "entropy": 5.530039262771607, "epoch": 4.875938533359268, "grad_norm": 1.2265625, "learning_rate": 0.0002865855330814922, "loss": 4.9034, "mean_token_accuracy": 0.21265966147184373, "num_tokens": 108690751.0, "step": 62670 }, { "entropy": 5.385809421539307, "epoch": 4.876327562730986, "grad_norm": 1.25, "learning_rate": 0.0002865578541722738, "loss": 4.7026, "mean_token_accuracy": 0.22740580439567565, "num_tokens": 108699747.0, "step": 62675 }, { "entropy": 5.393407249450684, "epoch": 4.876716592102704, "grad_norm": 1.1328125, "learning_rate": 0.0002865301750876834, "loss": 4.7501, "mean_token_accuracy": 0.2221317023038864, "num_tokens": 108708741.0, "step": 62680 }, { "entropy": 5.429852628707886, "epoch": 4.8771056214744215, "grad_norm": 1.140625, "learning_rate": 0.0002865024958281409, "loss": 4.7515, "mean_token_accuracy": 0.2280532017350197, "num_tokens": 108717220.0, "step": 62685 }, { "entropy": 5.444710922241211, "epoch": 4.877494650846139, "grad_norm": 1.203125, "learning_rate": 0.00028647481639406644, "loss": 4.8089, "mean_token_accuracy": 0.2285093456506729, "num_tokens": 108725939.0, "step": 62690 }, { "entropy": 5.441153717041016, "epoch": 4.877883680217856, "grad_norm": 1.1953125, "learning_rate": 0.00028644713678587983, "loss": 4.7856, "mean_token_accuracy": 0.23086303919553758, "num_tokens": 108734738.0, "step": 62695 }, { "entropy": 5.26664662361145, "epoch": 4.878272709589574, "grad_norm": 1.3125, "learning_rate": 0.00028641945700400104, "loss": 4.6234, "mean_token_accuracy": 0.24106180518865586, "num_tokens": 108743755.0, "step": 62700 }, { "entropy": 5.406527662277222, "epoch": 4.878661738961291, "grad_norm": 1.1640625, "learning_rate": 0.00028639177704885033, "loss": 4.8695, "mean_token_accuracy": 0.21789133697748184, "num_tokens": 108752494.0, "step": 62705 }, { "entropy": 5.383164310455323, "epoch": 4.879050768333009, "grad_norm": 1.1875, "learning_rate": 0.00028636409692084743, "loss": 4.7882, "mean_token_accuracy": 0.21786618530750274, "num_tokens": 108761669.0, "step": 62710 }, { "entropy": 5.369325351715088, "epoch": 4.879439797704727, "grad_norm": 1.2890625, "learning_rate": 0.0002863364166204125, "loss": 4.7069, "mean_token_accuracy": 0.2256480112671852, "num_tokens": 108769699.0, "step": 62715 }, { "entropy": 5.389443826675415, "epoch": 4.8798288270764445, "grad_norm": 1.234375, "learning_rate": 0.00028630873614796543, "loss": 4.7486, "mean_token_accuracy": 0.21982354670763016, "num_tokens": 108777799.0, "step": 62720 }, { "entropy": 5.387789344787597, "epoch": 4.880217856448162, "grad_norm": 1.265625, "learning_rate": 0.00028628105550392637, "loss": 4.8235, "mean_token_accuracy": 0.22200949639081954, "num_tokens": 108786547.0, "step": 62725 }, { "entropy": 5.463385343551636, "epoch": 4.88060688581988, "grad_norm": 1.2265625, "learning_rate": 0.0002862533746887152, "loss": 4.8269, "mean_token_accuracy": 0.22086931020021439, "num_tokens": 108795268.0, "step": 62730 }, { "entropy": 5.415080308914185, "epoch": 4.880995915191597, "grad_norm": 1.1875, "learning_rate": 0.00028622569370275196, "loss": 4.724, "mean_token_accuracy": 0.2270495191216469, "num_tokens": 108804496.0, "step": 62735 }, { "entropy": 5.416050052642822, "epoch": 4.881384944563314, "grad_norm": 1.328125, "learning_rate": 0.00028619801254645675, "loss": 4.8093, "mean_token_accuracy": 0.22286012023687363, "num_tokens": 108813717.0, "step": 62740 }, { "entropy": 5.336078834533692, "epoch": 4.881773973935032, "grad_norm": 1.2421875, "learning_rate": 0.0002861703312202495, "loss": 4.7903, "mean_token_accuracy": 0.22591417878866196, "num_tokens": 108822265.0, "step": 62745 }, { "entropy": 5.435274648666382, "epoch": 4.88216300330675, "grad_norm": 1.203125, "learning_rate": 0.00028614264972455023, "loss": 4.7968, "mean_token_accuracy": 0.22205123007297517, "num_tokens": 108830678.0, "step": 62750 }, { "entropy": 5.407142877578735, "epoch": 4.8825520326784675, "grad_norm": 1.1875, "learning_rate": 0.00028611496805977906, "loss": 4.7069, "mean_token_accuracy": 0.2327314332127571, "num_tokens": 108839253.0, "step": 62755 }, { "entropy": 5.370106172561646, "epoch": 4.882941062050184, "grad_norm": 1.3359375, "learning_rate": 0.00028608728622635585, "loss": 4.7411, "mean_token_accuracy": 0.22633830606937408, "num_tokens": 108847175.0, "step": 62760 }, { "entropy": 5.460643243789673, "epoch": 4.883330091421902, "grad_norm": 1.2421875, "learning_rate": 0.00028605960422470073, "loss": 4.8931, "mean_token_accuracy": 0.21166498810052872, "num_tokens": 108856640.0, "step": 62765 }, { "entropy": 5.459381484985352, "epoch": 4.88371912079362, "grad_norm": 1.1171875, "learning_rate": 0.0002860319220552338, "loss": 4.7997, "mean_token_accuracy": 0.22016754150390624, "num_tokens": 108865207.0, "step": 62770 }, { "entropy": 5.414637184143066, "epoch": 4.884108150165337, "grad_norm": 1.1796875, "learning_rate": 0.00028600423971837484, "loss": 4.7343, "mean_token_accuracy": 0.22254758328199387, "num_tokens": 108874841.0, "step": 62775 }, { "entropy": 5.448733901977539, "epoch": 4.884497179537055, "grad_norm": 1.421875, "learning_rate": 0.00028597655721454427, "loss": 4.8352, "mean_token_accuracy": 0.22089233100414277, "num_tokens": 108883974.0, "step": 62780 }, { "entropy": 5.376339864730835, "epoch": 4.884886208908773, "grad_norm": 1.1484375, "learning_rate": 0.00028594887454416176, "loss": 4.7555, "mean_token_accuracy": 0.23052518218755721, "num_tokens": 108892665.0, "step": 62785 }, { "entropy": 5.387379837036133, "epoch": 4.8852752382804905, "grad_norm": 1.21875, "learning_rate": 0.0002859211917076476, "loss": 4.7214, "mean_token_accuracy": 0.24001228511333467, "num_tokens": 108901441.0, "step": 62790 }, { "entropy": 5.402598476409912, "epoch": 4.885664267652208, "grad_norm": 1.15625, "learning_rate": 0.00028589350870542165, "loss": 4.7913, "mean_token_accuracy": 0.2221328377723694, "num_tokens": 108909958.0, "step": 62795 }, { "entropy": 5.478853178024292, "epoch": 4.886053297023925, "grad_norm": 1.1796875, "learning_rate": 0.0002858658255379041, "loss": 4.8495, "mean_token_accuracy": 0.22005851417779923, "num_tokens": 108918259.0, "step": 62800 }, { "entropy": 5.346837186813355, "epoch": 4.886442326395643, "grad_norm": 1.1953125, "learning_rate": 0.00028583814220551495, "loss": 4.6404, "mean_token_accuracy": 0.2347148761153221, "num_tokens": 108926170.0, "step": 62805 }, { "entropy": 5.371564435958862, "epoch": 4.88683135576736, "grad_norm": 1.265625, "learning_rate": 0.0002858104587086742, "loss": 4.8006, "mean_token_accuracy": 0.22204282879829407, "num_tokens": 108934996.0, "step": 62810 }, { "entropy": 5.390116262435913, "epoch": 4.887220385139078, "grad_norm": 1.2578125, "learning_rate": 0.000285782775047802, "loss": 4.7719, "mean_token_accuracy": 0.22440939992666245, "num_tokens": 108943402.0, "step": 62815 }, { "entropy": 5.404979562759399, "epoch": 4.887609414510796, "grad_norm": 1.1875, "learning_rate": 0.0002857550912233183, "loss": 4.7263, "mean_token_accuracy": 0.22750645577907563, "num_tokens": 108951938.0, "step": 62820 }, { "entropy": 5.359935569763183, "epoch": 4.8879984438825135, "grad_norm": 1.1171875, "learning_rate": 0.0002857274072356432, "loss": 4.744, "mean_token_accuracy": 0.2267139360308647, "num_tokens": 108960656.0, "step": 62825 }, { "entropy": 5.40571231842041, "epoch": 4.88838747325423, "grad_norm": 1.1640625, "learning_rate": 0.00028569972308519674, "loss": 4.7535, "mean_token_accuracy": 0.22500782907009126, "num_tokens": 108969375.0, "step": 62830 }, { "entropy": 5.425194215774536, "epoch": 4.888776502625948, "grad_norm": 1.0546875, "learning_rate": 0.00028567203877239914, "loss": 4.8296, "mean_token_accuracy": 0.22712219953536988, "num_tokens": 108978804.0, "step": 62835 }, { "entropy": 5.442486572265625, "epoch": 4.889165531997666, "grad_norm": 1.2578125, "learning_rate": 0.00028564435429767035, "loss": 4.7175, "mean_token_accuracy": 0.2255354791879654, "num_tokens": 108986687.0, "step": 62840 }, { "entropy": 5.402191209793091, "epoch": 4.889554561369383, "grad_norm": 1.1484375, "learning_rate": 0.0002856166696614303, "loss": 4.7833, "mean_token_accuracy": 0.2247421771287918, "num_tokens": 108995664.0, "step": 62845 }, { "entropy": 5.370953893661499, "epoch": 4.889943590741101, "grad_norm": 1.1328125, "learning_rate": 0.0002855889848640992, "loss": 4.7292, "mean_token_accuracy": 0.2312014266848564, "num_tokens": 109004614.0, "step": 62850 }, { "entropy": 5.426415205001831, "epoch": 4.890332620112819, "grad_norm": 1.234375, "learning_rate": 0.0002855612999060971, "loss": 4.7885, "mean_token_accuracy": 0.22780075669288635, "num_tokens": 109012982.0, "step": 62855 }, { "entropy": 5.392883062362671, "epoch": 4.8907216494845365, "grad_norm": 1.171875, "learning_rate": 0.0002855336147878442, "loss": 4.7611, "mean_token_accuracy": 0.22393666058778763, "num_tokens": 109020913.0, "step": 62860 }, { "entropy": 5.386337852478027, "epoch": 4.891110678856253, "grad_norm": 1.2109375, "learning_rate": 0.00028550592950976036, "loss": 4.7644, "mean_token_accuracy": 0.22652415186166763, "num_tokens": 109029746.0, "step": 62865 }, { "entropy": 5.264884901046753, "epoch": 4.891499708227971, "grad_norm": 1.109375, "learning_rate": 0.00028547824407226574, "loss": 4.6522, "mean_token_accuracy": 0.23311558812856675, "num_tokens": 109038980.0, "step": 62870 }, { "entropy": 5.361165857315063, "epoch": 4.891888737599689, "grad_norm": 1.2578125, "learning_rate": 0.0002854505584757805, "loss": 4.7285, "mean_token_accuracy": 0.22874753922224045, "num_tokens": 109047120.0, "step": 62875 }, { "entropy": 5.4155913352966305, "epoch": 4.892277766971406, "grad_norm": 1.1875, "learning_rate": 0.00028542287272072475, "loss": 4.7419, "mean_token_accuracy": 0.22763350009918212, "num_tokens": 109056138.0, "step": 62880 }, { "entropy": 5.425210618972779, "epoch": 4.892666796343124, "grad_norm": 1.15625, "learning_rate": 0.0002853951868075184, "loss": 4.7631, "mean_token_accuracy": 0.2293737143278122, "num_tokens": 109064977.0, "step": 62885 }, { "entropy": 5.444200897216797, "epoch": 4.893055825714842, "grad_norm": 1.1328125, "learning_rate": 0.0002853675007365816, "loss": 4.8157, "mean_token_accuracy": 0.22457858622074128, "num_tokens": 109073884.0, "step": 62890 }, { "entropy": 5.43964900970459, "epoch": 4.893444855086559, "grad_norm": 1.171875, "learning_rate": 0.0002853398145083345, "loss": 4.8314, "mean_token_accuracy": 0.21981510818004607, "num_tokens": 109082804.0, "step": 62895 }, { "entropy": 5.37054328918457, "epoch": 4.893833884458276, "grad_norm": 1.125, "learning_rate": 0.00028531212812319724, "loss": 4.6965, "mean_token_accuracy": 0.23577572405338287, "num_tokens": 109092327.0, "step": 62900 }, { "entropy": 5.444842433929443, "epoch": 4.894222913829994, "grad_norm": 1.15625, "learning_rate": 0.0002852844415815898, "loss": 4.8183, "mean_token_accuracy": 0.22608525454998016, "num_tokens": 109100366.0, "step": 62905 }, { "entropy": 5.411284923553467, "epoch": 4.894611943201712, "grad_norm": 1.125, "learning_rate": 0.00028525675488393234, "loss": 4.7711, "mean_token_accuracy": 0.2226783737540245, "num_tokens": 109109504.0, "step": 62910 }, { "entropy": 5.407434034347534, "epoch": 4.895000972573429, "grad_norm": 1.109375, "learning_rate": 0.00028522906803064494, "loss": 4.7951, "mean_token_accuracy": 0.22046105712652206, "num_tokens": 109118538.0, "step": 62915 }, { "entropy": 5.42401614189148, "epoch": 4.895390001945147, "grad_norm": 1.2578125, "learning_rate": 0.0002852013810221477, "loss": 4.7672, "mean_token_accuracy": 0.22073305547237396, "num_tokens": 109127057.0, "step": 62920 }, { "entropy": 5.477816247940064, "epoch": 4.895779031316865, "grad_norm": 1.21875, "learning_rate": 0.0002851736938588607, "loss": 4.8342, "mean_token_accuracy": 0.21699199676513672, "num_tokens": 109135836.0, "step": 62925 }, { "entropy": 5.4339141845703125, "epoch": 4.8961680606885825, "grad_norm": 1.15625, "learning_rate": 0.0002851460065412042, "loss": 4.8137, "mean_token_accuracy": 0.21796138137578963, "num_tokens": 109144224.0, "step": 62930 }, { "entropy": 5.399669647216797, "epoch": 4.896557090060299, "grad_norm": 1.1796875, "learning_rate": 0.0002851183190695981, "loss": 4.7981, "mean_token_accuracy": 0.22110403776168824, "num_tokens": 109152899.0, "step": 62935 }, { "entropy": 5.369991302490234, "epoch": 4.896946119432017, "grad_norm": 1.234375, "learning_rate": 0.0002850906314444627, "loss": 4.7663, "mean_token_accuracy": 0.22514845579862594, "num_tokens": 109161429.0, "step": 62940 }, { "entropy": 5.467168951034546, "epoch": 4.897335148803735, "grad_norm": 1.203125, "learning_rate": 0.00028506294366621796, "loss": 4.8698, "mean_token_accuracy": 0.21920322328805925, "num_tokens": 109169954.0, "step": 62945 }, { "entropy": 5.393003654479981, "epoch": 4.897724178175452, "grad_norm": 1.2109375, "learning_rate": 0.00028503525573528413, "loss": 4.7436, "mean_token_accuracy": 0.22532564401626587, "num_tokens": 109178750.0, "step": 62950 }, { "entropy": 5.43347053527832, "epoch": 4.89811320754717, "grad_norm": 1.234375, "learning_rate": 0.0002850075676520812, "loss": 4.7857, "mean_token_accuracy": 0.22208648025989533, "num_tokens": 109187728.0, "step": 62955 }, { "entropy": 5.39475417137146, "epoch": 4.898502236918888, "grad_norm": 1.1796875, "learning_rate": 0.0002849798794170294, "loss": 4.7695, "mean_token_accuracy": 0.2267370417714119, "num_tokens": 109196721.0, "step": 62960 }, { "entropy": 5.3381688594818115, "epoch": 4.898891266290605, "grad_norm": 1.171875, "learning_rate": 0.0002849521910305488, "loss": 4.7356, "mean_token_accuracy": 0.22488946169614793, "num_tokens": 109205333.0, "step": 62965 }, { "entropy": 5.354612827301025, "epoch": 4.899280295662322, "grad_norm": 1.171875, "learning_rate": 0.00028492450249305957, "loss": 4.7185, "mean_token_accuracy": 0.23347699046134948, "num_tokens": 109213475.0, "step": 62970 }, { "entropy": 5.471864986419678, "epoch": 4.89966932503404, "grad_norm": 1.5390625, "learning_rate": 0.00028489681380498177, "loss": 4.8205, "mean_token_accuracy": 0.22297414541244506, "num_tokens": 109220827.0, "step": 62975 }, { "entropy": 5.317643499374389, "epoch": 4.900058354405758, "grad_norm": 1.1796875, "learning_rate": 0.00028486912496673557, "loss": 4.6437, "mean_token_accuracy": 0.23712167888879776, "num_tokens": 109229188.0, "step": 62980 }, { "entropy": 5.3704406261444095, "epoch": 4.900447383777475, "grad_norm": 1.125, "learning_rate": 0.00028484143597874115, "loss": 4.789, "mean_token_accuracy": 0.2239796847105026, "num_tokens": 109237567.0, "step": 62985 }, { "entropy": 5.383840274810791, "epoch": 4.900836413149193, "grad_norm": 1.2265625, "learning_rate": 0.0002848137468414186, "loss": 4.7572, "mean_token_accuracy": 0.22657978385686875, "num_tokens": 109245907.0, "step": 62990 }, { "entropy": 5.451814651489258, "epoch": 4.901225442520911, "grad_norm": 1.234375, "learning_rate": 0.000284786057555188, "loss": 4.7499, "mean_token_accuracy": 0.22753514498472213, "num_tokens": 109254824.0, "step": 62995 }, { "entropy": 5.4983679294586185, "epoch": 4.9016144718926276, "grad_norm": 1.2109375, "learning_rate": 0.0002847583681204696, "loss": 4.8646, "mean_token_accuracy": 0.2200871616601944, "num_tokens": 109263385.0, "step": 63000 }, { "epoch": 4.9016144718926276, "eval_entropy": 5.17692167196742, "eval_loss": 4.915230751037598, "eval_mean_token_accuracy": 0.226935276271519, "eval_num_tokens": 109263385.0, "eval_runtime": 28.9113, "eval_samples_per_second": 1437.431, "eval_steps_per_second": 179.688, "step": 63000 }, { "entropy": 5.419268465042114, "epoch": 4.902003501264345, "grad_norm": 1.15625, "learning_rate": 0.00028473067853768347, "loss": 4.7276, "mean_token_accuracy": 0.22985544949769973, "num_tokens": 109271567.0, "step": 63005 }, { "entropy": 5.394822359085083, "epoch": 4.902392530636063, "grad_norm": 1.203125, "learning_rate": 0.00028470298880724985, "loss": 4.7959, "mean_token_accuracy": 0.2280418574810028, "num_tokens": 109281714.0, "step": 63010 }, { "entropy": 5.3772705554962155, "epoch": 4.902781560007781, "grad_norm": 1.2109375, "learning_rate": 0.0002846752989295888, "loss": 4.7206, "mean_token_accuracy": 0.23254650533199311, "num_tokens": 109289994.0, "step": 63015 }, { "entropy": 5.418342256546021, "epoch": 4.903170589379498, "grad_norm": 1.1640625, "learning_rate": 0.0002846476089051204, "loss": 4.7806, "mean_token_accuracy": 0.22455807477235795, "num_tokens": 109299088.0, "step": 63020 }, { "entropy": 5.41381869316101, "epoch": 4.903559618751216, "grad_norm": 1.09375, "learning_rate": 0.00028461991873426494, "loss": 4.8353, "mean_token_accuracy": 0.22176656424999236, "num_tokens": 109308375.0, "step": 63025 }, { "entropy": 5.414546537399292, "epoch": 4.903948648122933, "grad_norm": 1.2109375, "learning_rate": 0.0002845922284174426, "loss": 4.747, "mean_token_accuracy": 0.22666281312704087, "num_tokens": 109317255.0, "step": 63030 }, { "entropy": 5.475347232818604, "epoch": 4.9043376774946505, "grad_norm": 1.203125, "learning_rate": 0.00028456453795507335, "loss": 4.7772, "mean_token_accuracy": 0.22808314859867096, "num_tokens": 109325960.0, "step": 63035 }, { "entropy": 5.375293445587158, "epoch": 4.904726706866368, "grad_norm": 1.2734375, "learning_rate": 0.0002845368473475776, "loss": 4.6782, "mean_token_accuracy": 0.22865275144577027, "num_tokens": 109334629.0, "step": 63040 }, { "entropy": 5.486982822418213, "epoch": 4.905115736238086, "grad_norm": 1.2578125, "learning_rate": 0.00028450915659537524, "loss": 4.846, "mean_token_accuracy": 0.21578042060136796, "num_tokens": 109342899.0, "step": 63045 }, { "entropy": 5.283858728408814, "epoch": 4.905504765609804, "grad_norm": 1.125, "learning_rate": 0.0002844814656988866, "loss": 4.6175, "mean_token_accuracy": 0.24462829083204268, "num_tokens": 109351288.0, "step": 63050 }, { "entropy": 5.38515830039978, "epoch": 4.905893794981521, "grad_norm": 1.203125, "learning_rate": 0.00028445377465853176, "loss": 4.8476, "mean_token_accuracy": 0.21698755770921707, "num_tokens": 109360131.0, "step": 63055 }, { "entropy": 5.445740222930908, "epoch": 4.906282824353239, "grad_norm": 1.265625, "learning_rate": 0.00028442608347473093, "loss": 4.7859, "mean_token_accuracy": 0.2304176777601242, "num_tokens": 109368921.0, "step": 63060 }, { "entropy": 5.477333879470825, "epoch": 4.906671853724957, "grad_norm": 1.140625, "learning_rate": 0.00028439839214790437, "loss": 4.7765, "mean_token_accuracy": 0.223940509557724, "num_tokens": 109377027.0, "step": 63065 }, { "entropy": 5.42976746559143, "epoch": 4.9070608830966735, "grad_norm": 1.1171875, "learning_rate": 0.0002843707006784722, "loss": 4.7029, "mean_token_accuracy": 0.23074968606233598, "num_tokens": 109385320.0, "step": 63070 }, { "entropy": 5.420126008987427, "epoch": 4.907449912468391, "grad_norm": 1.328125, "learning_rate": 0.0002843430090668545, "loss": 4.8003, "mean_token_accuracy": 0.22134614288806914, "num_tokens": 109394365.0, "step": 63075 }, { "entropy": 5.411204528808594, "epoch": 4.907838941840109, "grad_norm": 1.1640625, "learning_rate": 0.00028431531731347155, "loss": 4.8139, "mean_token_accuracy": 0.2219046652317047, "num_tokens": 109402901.0, "step": 63080 }, { "entropy": 5.429065942764282, "epoch": 4.908227971211827, "grad_norm": 1.1328125, "learning_rate": 0.0002842876254187434, "loss": 4.8403, "mean_token_accuracy": 0.22110950499773024, "num_tokens": 109411490.0, "step": 63085 }, { "entropy": 5.405127429962159, "epoch": 4.908617000583544, "grad_norm": 1.140625, "learning_rate": 0.00028425993338309036, "loss": 4.8539, "mean_token_accuracy": 0.21818794310092926, "num_tokens": 109421415.0, "step": 63090 }, { "entropy": 5.434456634521484, "epoch": 4.909006029955261, "grad_norm": 1.28125, "learning_rate": 0.0002842322412069325, "loss": 4.8266, "mean_token_accuracy": 0.22471297681331634, "num_tokens": 109429845.0, "step": 63095 }, { "entropy": 5.458617067337036, "epoch": 4.909395059326979, "grad_norm": 1.1796875, "learning_rate": 0.0002842045488906902, "loss": 4.7846, "mean_token_accuracy": 0.22964616864919662, "num_tokens": 109438850.0, "step": 63100 }, { "entropy": 5.425916147232056, "epoch": 4.9097840886986965, "grad_norm": 1.140625, "learning_rate": 0.00028417685643478347, "loss": 4.8063, "mean_token_accuracy": 0.22048405557870865, "num_tokens": 109447317.0, "step": 63105 }, { "entropy": 5.374573802947998, "epoch": 4.910173118070414, "grad_norm": 1.1875, "learning_rate": 0.00028414916383963265, "loss": 4.7563, "mean_token_accuracy": 0.22972544133663178, "num_tokens": 109455404.0, "step": 63110 }, { "entropy": 5.308570671081543, "epoch": 4.910562147442132, "grad_norm": 1.3046875, "learning_rate": 0.0002841214711056577, "loss": 4.6981, "mean_token_accuracy": 0.22467648684978486, "num_tokens": 109463208.0, "step": 63115 }, { "entropy": 5.3775146484375, "epoch": 4.91095117681385, "grad_norm": 1.171875, "learning_rate": 0.000284093778233279, "loss": 4.7646, "mean_token_accuracy": 0.22987503856420516, "num_tokens": 109471981.0, "step": 63120 }, { "entropy": 5.436327791213989, "epoch": 4.911340206185567, "grad_norm": 1.1171875, "learning_rate": 0.0002840660852229166, "loss": 4.7736, "mean_token_accuracy": 0.2208330363035202, "num_tokens": 109480968.0, "step": 63125 }, { "entropy": 5.378834342956543, "epoch": 4.911729235557285, "grad_norm": 1.359375, "learning_rate": 0.0002840383920749908, "loss": 4.871, "mean_token_accuracy": 0.20854863971471788, "num_tokens": 109489628.0, "step": 63130 }, { "entropy": 5.401764345169068, "epoch": 4.912118264929002, "grad_norm": 1.265625, "learning_rate": 0.0002840106987899219, "loss": 4.7309, "mean_token_accuracy": 0.22283015102148057, "num_tokens": 109498293.0, "step": 63135 }, { "entropy": 5.357742023468018, "epoch": 4.9125072943007195, "grad_norm": 1.296875, "learning_rate": 0.0002839830053681299, "loss": 4.6937, "mean_token_accuracy": 0.22523528933525086, "num_tokens": 109506589.0, "step": 63140 }, { "entropy": 5.398295211791992, "epoch": 4.912896323672437, "grad_norm": 1.1796875, "learning_rate": 0.00028395531181003516, "loss": 4.834, "mean_token_accuracy": 0.2291323721408844, "num_tokens": 109514838.0, "step": 63145 }, { "entropy": 5.374823474884034, "epoch": 4.913285353044155, "grad_norm": 1.203125, "learning_rate": 0.0002839276181160577, "loss": 4.7791, "mean_token_accuracy": 0.22140555828809738, "num_tokens": 109523532.0, "step": 63150 }, { "entropy": 5.411004114151001, "epoch": 4.913674382415873, "grad_norm": 1.1328125, "learning_rate": 0.000283899924286618, "loss": 4.8917, "mean_token_accuracy": 0.21481716632843018, "num_tokens": 109531851.0, "step": 63155 }, { "entropy": 5.428954362869263, "epoch": 4.91406341178759, "grad_norm": 1.203125, "learning_rate": 0.000283872230322136, "loss": 4.7585, "mean_token_accuracy": 0.23031252324581147, "num_tokens": 109540375.0, "step": 63160 }, { "entropy": 5.432012414932251, "epoch": 4.914452441159307, "grad_norm": 1.0625, "learning_rate": 0.00028384453622303207, "loss": 4.7348, "mean_token_accuracy": 0.22383230477571486, "num_tokens": 109550174.0, "step": 63165 }, { "entropy": 5.3848670482635494, "epoch": 4.914841470531025, "grad_norm": 1.2734375, "learning_rate": 0.00028381684198972636, "loss": 4.7447, "mean_token_accuracy": 0.2323377773165703, "num_tokens": 109559261.0, "step": 63170 }, { "entropy": 5.419246673583984, "epoch": 4.9152304999027425, "grad_norm": 1.15625, "learning_rate": 0.00028378914762263905, "loss": 4.9395, "mean_token_accuracy": 0.21558811366558076, "num_tokens": 109568314.0, "step": 63175 }, { "entropy": 5.3990076065063475, "epoch": 4.91561952927446, "grad_norm": 1.1875, "learning_rate": 0.00028376145312219054, "loss": 4.8196, "mean_token_accuracy": 0.22069069147109985, "num_tokens": 109576795.0, "step": 63180 }, { "entropy": 5.4721112728118895, "epoch": 4.916008558646178, "grad_norm": 1.1796875, "learning_rate": 0.0002837337584888009, "loss": 4.7383, "mean_token_accuracy": 0.22581649124622344, "num_tokens": 109585292.0, "step": 63185 }, { "entropy": 5.390499877929687, "epoch": 4.916397588017896, "grad_norm": 1.265625, "learning_rate": 0.0002837060637228903, "loss": 4.7338, "mean_token_accuracy": 0.2259834885597229, "num_tokens": 109594133.0, "step": 63190 }, { "entropy": 5.378627443313599, "epoch": 4.916786617389613, "grad_norm": 1.3125, "learning_rate": 0.00028367836882487905, "loss": 4.8793, "mean_token_accuracy": 0.21766443848609923, "num_tokens": 109603638.0, "step": 63195 }, { "entropy": 5.318688535690308, "epoch": 4.91717564676133, "grad_norm": 1.140625, "learning_rate": 0.0002836506737951875, "loss": 4.7023, "mean_token_accuracy": 0.22679270803928375, "num_tokens": 109612199.0, "step": 63200 }, { "entropy": 5.40428352355957, "epoch": 4.917564676133048, "grad_norm": 1.1328125, "learning_rate": 0.0002836229786342356, "loss": 4.7421, "mean_token_accuracy": 0.2264079213142395, "num_tokens": 109620655.0, "step": 63205 }, { "entropy": 5.466332817077637, "epoch": 4.9179537055047655, "grad_norm": 1.21875, "learning_rate": 0.0002835952833424438, "loss": 4.8725, "mean_token_accuracy": 0.21746882945299148, "num_tokens": 109630150.0, "step": 63210 }, { "entropy": 5.447049951553344, "epoch": 4.918342734876483, "grad_norm": 1.2265625, "learning_rate": 0.00028356758792023217, "loss": 4.8085, "mean_token_accuracy": 0.22153561115264891, "num_tokens": 109638884.0, "step": 63215 }, { "entropy": 5.408453130722046, "epoch": 4.918731764248201, "grad_norm": 1.1953125, "learning_rate": 0.00028353989236802114, "loss": 4.733, "mean_token_accuracy": 0.22793289572000502, "num_tokens": 109647549.0, "step": 63220 }, { "entropy": 5.416606760025024, "epoch": 4.919120793619919, "grad_norm": 1.1328125, "learning_rate": 0.00028351219668623076, "loss": 4.7984, "mean_token_accuracy": 0.22233612686395646, "num_tokens": 109656302.0, "step": 63225 }, { "entropy": 5.3860808372497555, "epoch": 4.919509822991635, "grad_norm": 1.1640625, "learning_rate": 0.0002834845008752813, "loss": 4.8402, "mean_token_accuracy": 0.21991758942604064, "num_tokens": 109665219.0, "step": 63230 }, { "entropy": 5.330677938461304, "epoch": 4.919898852363353, "grad_norm": 1.140625, "learning_rate": 0.00028345680493559313, "loss": 4.7249, "mean_token_accuracy": 0.22920001745224, "num_tokens": 109674001.0, "step": 63235 }, { "entropy": 5.373510408401489, "epoch": 4.920287881735071, "grad_norm": 1.1953125, "learning_rate": 0.0002834291088675864, "loss": 4.7253, "mean_token_accuracy": 0.22384131997823714, "num_tokens": 109682673.0, "step": 63240 }, { "entropy": 5.452417087554932, "epoch": 4.9206769111067885, "grad_norm": 1.1953125, "learning_rate": 0.00028340141267168135, "loss": 4.8224, "mean_token_accuracy": 0.22424065619707106, "num_tokens": 109692004.0, "step": 63245 }, { "entropy": 5.512565422058105, "epoch": 4.921065940478506, "grad_norm": 1.1484375, "learning_rate": 0.00028337371634829824, "loss": 4.8339, "mean_token_accuracy": 0.21913688778877258, "num_tokens": 109701018.0, "step": 63250 }, { "entropy": 5.400132465362549, "epoch": 4.921454969850224, "grad_norm": 1.3671875, "learning_rate": 0.0002833460198978573, "loss": 4.7341, "mean_token_accuracy": 0.22517583668231964, "num_tokens": 109708955.0, "step": 63255 }, { "entropy": 5.377708530426025, "epoch": 4.921843999221942, "grad_norm": 1.1015625, "learning_rate": 0.0002833183233207788, "loss": 4.7994, "mean_token_accuracy": 0.22168483287096025, "num_tokens": 109717343.0, "step": 63260 }, { "entropy": 5.35015721321106, "epoch": 4.922233028593659, "grad_norm": 1.203125, "learning_rate": 0.00028329062661748295, "loss": 4.7214, "mean_token_accuracy": 0.22882865220308304, "num_tokens": 109725629.0, "step": 63265 }, { "entropy": 5.323612308502197, "epoch": 4.922622057965376, "grad_norm": 1.1796875, "learning_rate": 0.00028326292978839005, "loss": 4.736, "mean_token_accuracy": 0.2307807207107544, "num_tokens": 109734760.0, "step": 63270 }, { "entropy": 5.42139310836792, "epoch": 4.923011087337094, "grad_norm": 1.3046875, "learning_rate": 0.00028323523283392034, "loss": 4.746, "mean_token_accuracy": 0.22891620248556138, "num_tokens": 109743570.0, "step": 63275 }, { "entropy": 5.383662843704224, "epoch": 4.9234001167088115, "grad_norm": 1.25, "learning_rate": 0.00028320753575449415, "loss": 4.7597, "mean_token_accuracy": 0.22544941008090974, "num_tokens": 109752619.0, "step": 63280 }, { "entropy": 5.346390676498413, "epoch": 4.923789146080529, "grad_norm": 1.21875, "learning_rate": 0.0002831798385505316, "loss": 4.7184, "mean_token_accuracy": 0.22730448693037034, "num_tokens": 109761137.0, "step": 63285 }, { "entropy": 5.361239814758301, "epoch": 4.924178175452247, "grad_norm": 1.140625, "learning_rate": 0.00028315214122245295, "loss": 4.7325, "mean_token_accuracy": 0.2257252424955368, "num_tokens": 109769290.0, "step": 63290 }, { "entropy": 5.340511083602905, "epoch": 4.924567204823965, "grad_norm": 1.1875, "learning_rate": 0.0002831244437706786, "loss": 4.7457, "mean_token_accuracy": 0.2321557268500328, "num_tokens": 109777906.0, "step": 63295 }, { "entropy": 5.303054475784302, "epoch": 4.924956234195681, "grad_norm": 1.2421875, "learning_rate": 0.0002830967461956288, "loss": 4.6952, "mean_token_accuracy": 0.2333715409040451, "num_tokens": 109786649.0, "step": 63300 }, { "entropy": 5.364556455612183, "epoch": 4.925345263567399, "grad_norm": 1.25, "learning_rate": 0.00028306904849772374, "loss": 4.6962, "mean_token_accuracy": 0.23071868866682052, "num_tokens": 109795183.0, "step": 63305 }, { "entropy": 5.304232883453369, "epoch": 4.925734292939117, "grad_norm": 1.15625, "learning_rate": 0.0002830413506773837, "loss": 4.6737, "mean_token_accuracy": 0.22667007893323898, "num_tokens": 109804062.0, "step": 63310 }, { "entropy": 5.381059074401856, "epoch": 4.9261233223108345, "grad_norm": 1.1875, "learning_rate": 0.000283013652735029, "loss": 4.8327, "mean_token_accuracy": 0.21904452592134477, "num_tokens": 109813258.0, "step": 63315 }, { "entropy": 5.389257574081421, "epoch": 4.926512351682552, "grad_norm": 1.1484375, "learning_rate": 0.00028298595467107985, "loss": 4.74, "mean_token_accuracy": 0.2296806275844574, "num_tokens": 109821772.0, "step": 63320 }, { "entropy": 5.524547147750854, "epoch": 4.92690138105427, "grad_norm": 1.2734375, "learning_rate": 0.0002829582564859565, "loss": 4.9333, "mean_token_accuracy": 0.21344909220933914, "num_tokens": 109830204.0, "step": 63325 }, { "entropy": 5.356841373443603, "epoch": 4.927290410425988, "grad_norm": 1.203125, "learning_rate": 0.0002829305581800793, "loss": 4.7627, "mean_token_accuracy": 0.2246478393673897, "num_tokens": 109838128.0, "step": 63330 }, { "entropy": 5.35327115058899, "epoch": 4.927679439797704, "grad_norm": 1.1875, "learning_rate": 0.0002829028597538685, "loss": 4.8031, "mean_token_accuracy": 0.22021936923265456, "num_tokens": 109846887.0, "step": 63335 }, { "entropy": 5.404262256622315, "epoch": 4.928068469169422, "grad_norm": 1.140625, "learning_rate": 0.00028287516120774445, "loss": 4.7697, "mean_token_accuracy": 0.23114107996225358, "num_tokens": 109855980.0, "step": 63340 }, { "entropy": 5.391396856307983, "epoch": 4.92845749854114, "grad_norm": 1.1796875, "learning_rate": 0.0002828474625421273, "loss": 4.6779, "mean_token_accuracy": 0.2259627491235733, "num_tokens": 109864568.0, "step": 63345 }, { "entropy": 5.436896657943725, "epoch": 4.9288465279128575, "grad_norm": 1.1875, "learning_rate": 0.0002828197637574374, "loss": 4.8261, "mean_token_accuracy": 0.22185804396867753, "num_tokens": 109873351.0, "step": 63350 }, { "entropy": 5.42801570892334, "epoch": 4.929235557284575, "grad_norm": 1.1640625, "learning_rate": 0.00028279206485409505, "loss": 4.7474, "mean_token_accuracy": 0.2223198816180229, "num_tokens": 109882221.0, "step": 63355 }, { "entropy": 5.454281806945801, "epoch": 4.929624586656293, "grad_norm": 1.2109375, "learning_rate": 0.0002827643658325205, "loss": 4.8162, "mean_token_accuracy": 0.2198670208454132, "num_tokens": 109890701.0, "step": 63360 }, { "entropy": 5.461422252655029, "epoch": 4.93001361602801, "grad_norm": 1.1796875, "learning_rate": 0.000282736666693134, "loss": 4.7902, "mean_token_accuracy": 0.22446550875902177, "num_tokens": 109899201.0, "step": 63365 }, { "entropy": 5.387375736236573, "epoch": 4.930402645399727, "grad_norm": 1.203125, "learning_rate": 0.0002827089674363559, "loss": 4.6903, "mean_token_accuracy": 0.23478329330682754, "num_tokens": 109907134.0, "step": 63370 }, { "entropy": 5.383121061325073, "epoch": 4.930791674771445, "grad_norm": 1.265625, "learning_rate": 0.0002826812680626066, "loss": 4.6772, "mean_token_accuracy": 0.23114899843931197, "num_tokens": 109915317.0, "step": 63375 }, { "entropy": 5.437287521362305, "epoch": 4.931180704143163, "grad_norm": 1.2109375, "learning_rate": 0.0002826535685723062, "loss": 4.8874, "mean_token_accuracy": 0.21267596632242203, "num_tokens": 109924408.0, "step": 63380 }, { "entropy": 5.421556806564331, "epoch": 4.9315697335148805, "grad_norm": 1.1640625, "learning_rate": 0.00028262586896587517, "loss": 4.8011, "mean_token_accuracy": 0.23014312833547593, "num_tokens": 109933138.0, "step": 63385 }, { "entropy": 5.487618780136108, "epoch": 4.931958762886598, "grad_norm": 1.1328125, "learning_rate": 0.0002825981692437336, "loss": 4.8723, "mean_token_accuracy": 0.2169387087225914, "num_tokens": 109941857.0, "step": 63390 }, { "entropy": 5.34007158279419, "epoch": 4.932347792258316, "grad_norm": 1.1953125, "learning_rate": 0.00028257046940630197, "loss": 4.7738, "mean_token_accuracy": 0.22501509189605712, "num_tokens": 109950676.0, "step": 63395 }, { "entropy": 5.35067343711853, "epoch": 4.932736821630033, "grad_norm": 1.2265625, "learning_rate": 0.00028254276945400056, "loss": 4.6749, "mean_token_accuracy": 0.2400803431868553, "num_tokens": 109959326.0, "step": 63400 }, { "entropy": 5.411648082733154, "epoch": 4.93312585100175, "grad_norm": 1.328125, "learning_rate": 0.00028251506938724953, "loss": 4.7474, "mean_token_accuracy": 0.23206363320350648, "num_tokens": 109967369.0, "step": 63405 }, { "entropy": 5.410942077636719, "epoch": 4.933514880373468, "grad_norm": 1.234375, "learning_rate": 0.00028248736920646927, "loss": 4.7733, "mean_token_accuracy": 0.2258870631456375, "num_tokens": 109975849.0, "step": 63410 }, { "entropy": 5.458699655532837, "epoch": 4.933903909745186, "grad_norm": 1.3046875, "learning_rate": 0.00028245966891208017, "loss": 4.7707, "mean_token_accuracy": 0.22098077237606048, "num_tokens": 109985042.0, "step": 63415 }, { "entropy": 5.419143438339233, "epoch": 4.9342929391169035, "grad_norm": 1.25, "learning_rate": 0.0002824319685045025, "loss": 4.7666, "mean_token_accuracy": 0.21788403689861296, "num_tokens": 109994330.0, "step": 63420 }, { "entropy": 5.385769701004028, "epoch": 4.934681968488621, "grad_norm": 1.28125, "learning_rate": 0.00028240426798415645, "loss": 4.7273, "mean_token_accuracy": 0.22928309440612793, "num_tokens": 110003565.0, "step": 63425 }, { "entropy": 5.284177970886231, "epoch": 4.935070997860338, "grad_norm": 1.1484375, "learning_rate": 0.0002823765673514625, "loss": 4.6803, "mean_token_accuracy": 0.23430462181568146, "num_tokens": 110012501.0, "step": 63430 }, { "entropy": 5.358765506744385, "epoch": 4.935460027232056, "grad_norm": 1.2734375, "learning_rate": 0.00028234886660684084, "loss": 4.7839, "mean_token_accuracy": 0.22104683220386506, "num_tokens": 110020831.0, "step": 63435 }, { "entropy": 5.44643726348877, "epoch": 4.935849056603773, "grad_norm": 1.125, "learning_rate": 0.0002823211657507118, "loss": 4.8673, "mean_token_accuracy": 0.21490197479724885, "num_tokens": 110030838.0, "step": 63440 }, { "entropy": 5.378885412216187, "epoch": 4.936238085975491, "grad_norm": 1.1640625, "learning_rate": 0.0002822934647834958, "loss": 4.7103, "mean_token_accuracy": 0.23360484689474106, "num_tokens": 110040178.0, "step": 63445 }, { "entropy": 5.391190004348755, "epoch": 4.936627115347209, "grad_norm": 1.140625, "learning_rate": 0.00028226576370561304, "loss": 4.7704, "mean_token_accuracy": 0.22496458292007446, "num_tokens": 110048838.0, "step": 63450 }, { "entropy": 5.379943323135376, "epoch": 4.9370161447189265, "grad_norm": 1.296875, "learning_rate": 0.00028223806251748384, "loss": 4.7434, "mean_token_accuracy": 0.23784064501523972, "num_tokens": 110057140.0, "step": 63455 }, { "entropy": 5.432900905609131, "epoch": 4.937405174090644, "grad_norm": 1.2734375, "learning_rate": 0.0002822103612195286, "loss": 4.7125, "mean_token_accuracy": 0.23619811981916428, "num_tokens": 110065294.0, "step": 63460 }, { "entropy": 5.4168439388275145, "epoch": 4.937794203462362, "grad_norm": 1.2109375, "learning_rate": 0.0002821826598121676, "loss": 4.8214, "mean_token_accuracy": 0.22423195838928223, "num_tokens": 110073810.0, "step": 63465 }, { "entropy": 5.415780925750733, "epoch": 4.938183232834079, "grad_norm": 1.1484375, "learning_rate": 0.0002821549582958212, "loss": 4.8079, "mean_token_accuracy": 0.21808325201272966, "num_tokens": 110082446.0, "step": 63470 }, { "entropy": 5.405220174789429, "epoch": 4.938572262205796, "grad_norm": 1.125, "learning_rate": 0.0002821272566709096, "loss": 4.7684, "mean_token_accuracy": 0.23130155950784684, "num_tokens": 110090815.0, "step": 63475 }, { "entropy": 5.387920665740967, "epoch": 4.938961291577514, "grad_norm": 1.21875, "learning_rate": 0.00028209955493785333, "loss": 4.7436, "mean_token_accuracy": 0.21858742386102675, "num_tokens": 110100295.0, "step": 63480 }, { "entropy": 5.433146810531616, "epoch": 4.939350320949232, "grad_norm": 1.1640625, "learning_rate": 0.0002820718530970726, "loss": 4.8315, "mean_token_accuracy": 0.21839747726917266, "num_tokens": 110109194.0, "step": 63485 }, { "entropy": 5.403715562820435, "epoch": 4.9397393503209495, "grad_norm": 1.265625, "learning_rate": 0.00028204415114898765, "loss": 4.7963, "mean_token_accuracy": 0.21995267868041993, "num_tokens": 110117554.0, "step": 63490 }, { "entropy": 5.413893556594848, "epoch": 4.940128379692667, "grad_norm": 1.1328125, "learning_rate": 0.00028201644909401903, "loss": 4.8388, "mean_token_accuracy": 0.22244620472192764, "num_tokens": 110126166.0, "step": 63495 }, { "entropy": 5.428742980957031, "epoch": 4.940517409064384, "grad_norm": 1.1328125, "learning_rate": 0.00028198874693258696, "loss": 4.7995, "mean_token_accuracy": 0.22940473556518554, "num_tokens": 110134517.0, "step": 63500 }, { "entropy": 5.3981846332550045, "epoch": 4.940906438436102, "grad_norm": 1.265625, "learning_rate": 0.0002819610446651117, "loss": 4.7358, "mean_token_accuracy": 0.22687412798404694, "num_tokens": 110143172.0, "step": 63505 }, { "entropy": 5.408468341827392, "epoch": 4.941295467807819, "grad_norm": 1.15625, "learning_rate": 0.00028193334229201374, "loss": 4.8155, "mean_token_accuracy": 0.21854631304740907, "num_tokens": 110152871.0, "step": 63510 }, { "entropy": 5.419909286499023, "epoch": 4.941684497179537, "grad_norm": 1.1796875, "learning_rate": 0.00028190563981371334, "loss": 4.7163, "mean_token_accuracy": 0.22186665683984758, "num_tokens": 110160993.0, "step": 63515 }, { "entropy": 5.44317364692688, "epoch": 4.942073526551255, "grad_norm": 1.1171875, "learning_rate": 0.0002818779372306308, "loss": 4.7379, "mean_token_accuracy": 0.22576926052570342, "num_tokens": 110169701.0, "step": 63520 }, { "entropy": 5.428468179702759, "epoch": 4.9424625559229725, "grad_norm": 1.1953125, "learning_rate": 0.00028185023454318646, "loss": 4.8236, "mean_token_accuracy": 0.21897818446159362, "num_tokens": 110178354.0, "step": 63525 }, { "entropy": 5.3757377624511715, "epoch": 4.94285158529469, "grad_norm": 1.2578125, "learning_rate": 0.00028182253175180084, "loss": 4.758, "mean_token_accuracy": 0.2247410848736763, "num_tokens": 110186865.0, "step": 63530 }, { "entropy": 5.425506734848023, "epoch": 4.943240614666407, "grad_norm": 1.203125, "learning_rate": 0.0002817948288568942, "loss": 4.7999, "mean_token_accuracy": 0.22424442172050477, "num_tokens": 110195333.0, "step": 63535 }, { "entropy": 5.282755708694458, "epoch": 4.943629644038125, "grad_norm": 1.078125, "learning_rate": 0.0002817671258588868, "loss": 4.5886, "mean_token_accuracy": 0.23865402936935426, "num_tokens": 110204375.0, "step": 63540 }, { "entropy": 5.323008966445923, "epoch": 4.944018673409842, "grad_norm": 1.1484375, "learning_rate": 0.0002817394227581989, "loss": 4.7516, "mean_token_accuracy": 0.23320356011390686, "num_tokens": 110212833.0, "step": 63545 }, { "entropy": 5.3404326915740965, "epoch": 4.94440770278156, "grad_norm": 1.265625, "learning_rate": 0.0002817117195552511, "loss": 4.6994, "mean_token_accuracy": 0.22850479781627656, "num_tokens": 110220667.0, "step": 63550 }, { "entropy": 5.325035810470581, "epoch": 4.944796732153278, "grad_norm": 1.265625, "learning_rate": 0.00028168401625046363, "loss": 4.5693, "mean_token_accuracy": 0.2424585700035095, "num_tokens": 110228981.0, "step": 63555 }, { "entropy": 5.337361240386963, "epoch": 4.9451857615249954, "grad_norm": 1.125, "learning_rate": 0.0002816563128442568, "loss": 4.7297, "mean_token_accuracy": 0.2248943939805031, "num_tokens": 110237449.0, "step": 63560 }, { "entropy": 5.425177335739136, "epoch": 4.945574790896712, "grad_norm": 1.3046875, "learning_rate": 0.00028162860933705105, "loss": 4.7893, "mean_token_accuracy": 0.2260083809494972, "num_tokens": 110246175.0, "step": 63565 }, { "entropy": 5.375520515441894, "epoch": 4.94596382026843, "grad_norm": 1.1640625, "learning_rate": 0.0002816009057292667, "loss": 4.724, "mean_token_accuracy": 0.23735830783843995, "num_tokens": 110255381.0, "step": 63570 }, { "entropy": 5.460589981079101, "epoch": 4.946352849640148, "grad_norm": 1.1796875, "learning_rate": 0.00028157320202132417, "loss": 4.798, "mean_token_accuracy": 0.22056447267532348, "num_tokens": 110264508.0, "step": 63575 }, { "entropy": 5.4892627716064455, "epoch": 4.946741879011865, "grad_norm": 1.1640625, "learning_rate": 0.00028154549821364375, "loss": 4.92, "mean_token_accuracy": 0.2124575361609459, "num_tokens": 110273542.0, "step": 63580 }, { "entropy": 5.3830235481262205, "epoch": 4.947130908383583, "grad_norm": 1.1875, "learning_rate": 0.00028151779430664575, "loss": 4.7575, "mean_token_accuracy": 0.22668575644493102, "num_tokens": 110282310.0, "step": 63585 }, { "entropy": 5.337215709686279, "epoch": 4.947519937755301, "grad_norm": 1.1328125, "learning_rate": 0.00028149009030075056, "loss": 4.6841, "mean_token_accuracy": 0.23601720184087754, "num_tokens": 110290596.0, "step": 63590 }, { "entropy": 5.356709146499634, "epoch": 4.947908967127018, "grad_norm": 1.3046875, "learning_rate": 0.00028146238619637865, "loss": 4.6437, "mean_token_accuracy": 0.23606915920972824, "num_tokens": 110298520.0, "step": 63595 }, { "entropy": 5.385938024520874, "epoch": 4.948297996498736, "grad_norm": 1.25, "learning_rate": 0.00028143468199395036, "loss": 4.8028, "mean_token_accuracy": 0.22657362520694732, "num_tokens": 110307615.0, "step": 63600 }, { "entropy": 5.378319168090821, "epoch": 4.948687025870453, "grad_norm": 1.1796875, "learning_rate": 0.00028140697769388597, "loss": 4.7325, "mean_token_accuracy": 0.23165423274040223, "num_tokens": 110316166.0, "step": 63605 }, { "entropy": 5.394776153564453, "epoch": 4.949076055242171, "grad_norm": 1.15625, "learning_rate": 0.0002813792732966059, "loss": 4.6605, "mean_token_accuracy": 0.23094343394041061, "num_tokens": 110324562.0, "step": 63610 }, { "entropy": 5.39465446472168, "epoch": 4.949465084613888, "grad_norm": 1.21875, "learning_rate": 0.0002813515688025305, "loss": 4.8263, "mean_token_accuracy": 0.21294835358858108, "num_tokens": 110332195.0, "step": 63615 }, { "entropy": 5.311608791351318, "epoch": 4.949854113985606, "grad_norm": 1.328125, "learning_rate": 0.0002813238642120802, "loss": 4.681, "mean_token_accuracy": 0.23552799075841904, "num_tokens": 110341360.0, "step": 63620 }, { "entropy": 5.409696006774903, "epoch": 4.950243143357324, "grad_norm": 1.234375, "learning_rate": 0.00028129615952567517, "loss": 4.7787, "mean_token_accuracy": 0.22397578954696656, "num_tokens": 110349609.0, "step": 63625 }, { "entropy": 5.386757469177246, "epoch": 4.9506321727290405, "grad_norm": 1.25, "learning_rate": 0.0002812684547437361, "loss": 4.7645, "mean_token_accuracy": 0.22112909257411956, "num_tokens": 110357703.0, "step": 63630 }, { "entropy": 5.429359197616577, "epoch": 4.951021202100758, "grad_norm": 1.2890625, "learning_rate": 0.0002812407498666831, "loss": 4.7438, "mean_token_accuracy": 0.22850308567285538, "num_tokens": 110365822.0, "step": 63635 }, { "entropy": 5.337197113037109, "epoch": 4.951410231472476, "grad_norm": 1.1171875, "learning_rate": 0.0002812130448949367, "loss": 4.7528, "mean_token_accuracy": 0.22177010774612427, "num_tokens": 110375352.0, "step": 63640 }, { "entropy": 5.358320236206055, "epoch": 4.951799260844194, "grad_norm": 1.140625, "learning_rate": 0.00028118533982891727, "loss": 4.6219, "mean_token_accuracy": 0.22965431213378906, "num_tokens": 110383616.0, "step": 63645 }, { "entropy": 5.44491491317749, "epoch": 4.952188290215911, "grad_norm": 1.1953125, "learning_rate": 0.0002811576346690451, "loss": 4.8532, "mean_token_accuracy": 0.21897365897893906, "num_tokens": 110392425.0, "step": 63650 }, { "entropy": 5.3238396644592285, "epoch": 4.952577319587629, "grad_norm": 1.1484375, "learning_rate": 0.00028112992941574074, "loss": 4.6472, "mean_token_accuracy": 0.2351665362715721, "num_tokens": 110400621.0, "step": 63655 }, { "entropy": 5.402384185791016, "epoch": 4.952966348959347, "grad_norm": 1.28125, "learning_rate": 0.00028110222406942424, "loss": 4.8391, "mean_token_accuracy": 0.21989277452230455, "num_tokens": 110410123.0, "step": 63660 }, { "entropy": 5.413518714904785, "epoch": 4.953355378331064, "grad_norm": 1.1796875, "learning_rate": 0.0002810745186305164, "loss": 4.7862, "mean_token_accuracy": 0.21957554668188095, "num_tokens": 110418775.0, "step": 63665 }, { "entropy": 5.4003688335418705, "epoch": 4.953744407702781, "grad_norm": 1.1484375, "learning_rate": 0.0002810468130994373, "loss": 4.7881, "mean_token_accuracy": 0.21991329193115233, "num_tokens": 110428202.0, "step": 63670 }, { "entropy": 5.4698686599731445, "epoch": 4.954133437074499, "grad_norm": 1.15625, "learning_rate": 0.00028101910747660745, "loss": 4.8182, "mean_token_accuracy": 0.21917980164289474, "num_tokens": 110437398.0, "step": 63675 }, { "entropy": 5.466535425186157, "epoch": 4.954522466446217, "grad_norm": 1.1796875, "learning_rate": 0.0002809914017624472, "loss": 4.8484, "mean_token_accuracy": 0.22227211445569992, "num_tokens": 110446366.0, "step": 63680 }, { "entropy": 5.522869729995728, "epoch": 4.954911495817934, "grad_norm": 1.21875, "learning_rate": 0.0002809636959573771, "loss": 4.8576, "mean_token_accuracy": 0.2190161943435669, "num_tokens": 110454951.0, "step": 63685 }, { "entropy": 5.42654128074646, "epoch": 4.955300525189652, "grad_norm": 1.2109375, "learning_rate": 0.0002809359900618173, "loss": 4.7635, "mean_token_accuracy": 0.23206537812948227, "num_tokens": 110463331.0, "step": 63690 }, { "entropy": 5.493383550643921, "epoch": 4.95568955456137, "grad_norm": 1.28125, "learning_rate": 0.00028090828407618837, "loss": 4.8741, "mean_token_accuracy": 0.21942332088947297, "num_tokens": 110472999.0, "step": 63695 }, { "entropy": 5.389278841018677, "epoch": 4.9560785839330865, "grad_norm": 1.109375, "learning_rate": 0.00028088057800091054, "loss": 4.7786, "mean_token_accuracy": 0.22670643776655197, "num_tokens": 110482132.0, "step": 63700 }, { "entropy": 5.458418178558349, "epoch": 4.956467613304804, "grad_norm": 1.171875, "learning_rate": 0.0002808528718364043, "loss": 4.8122, "mean_token_accuracy": 0.21769326478242873, "num_tokens": 110491402.0, "step": 63705 }, { "entropy": 5.4723974704742435, "epoch": 4.956856642676522, "grad_norm": 1.1640625, "learning_rate": 0.00028082516558309005, "loss": 4.7719, "mean_token_accuracy": 0.225288924574852, "num_tokens": 110500148.0, "step": 63710 }, { "entropy": 5.345379114151001, "epoch": 4.95724567204824, "grad_norm": 1.234375, "learning_rate": 0.0002807974592413883, "loss": 4.713, "mean_token_accuracy": 0.23639550656080247, "num_tokens": 110508297.0, "step": 63715 }, { "entropy": 5.323996305465698, "epoch": 4.957634701419957, "grad_norm": 1.203125, "learning_rate": 0.00028076975281171926, "loss": 4.7126, "mean_token_accuracy": 0.23683362156152726, "num_tokens": 110516428.0, "step": 63720 }, { "entropy": 5.350346612930298, "epoch": 4.958023730791675, "grad_norm": 1.1484375, "learning_rate": 0.00028074204629450334, "loss": 4.7615, "mean_token_accuracy": 0.22429319471120834, "num_tokens": 110525488.0, "step": 63725 }, { "entropy": 5.3793299198150635, "epoch": 4.958412760163393, "grad_norm": 1.21875, "learning_rate": 0.0002807143396901611, "loss": 4.6642, "mean_token_accuracy": 0.2296088606119156, "num_tokens": 110533665.0, "step": 63730 }, { "entropy": 5.466081428527832, "epoch": 4.9588017895351095, "grad_norm": 1.1875, "learning_rate": 0.00028068663299911286, "loss": 4.7907, "mean_token_accuracy": 0.22824931889772415, "num_tokens": 110541812.0, "step": 63735 }, { "entropy": 5.375364160537719, "epoch": 4.959190818906827, "grad_norm": 1.1875, "learning_rate": 0.0002806589262217789, "loss": 4.688, "mean_token_accuracy": 0.23833245784044266, "num_tokens": 110550231.0, "step": 63740 }, { "entropy": 5.392983293533325, "epoch": 4.959579848278545, "grad_norm": 1.2109375, "learning_rate": 0.00028063121935857985, "loss": 4.7773, "mean_token_accuracy": 0.22600287497043609, "num_tokens": 110559192.0, "step": 63745 }, { "entropy": 5.362807989120483, "epoch": 4.959968877650263, "grad_norm": 1.1875, "learning_rate": 0.0002806035124099359, "loss": 4.766, "mean_token_accuracy": 0.22804066985845567, "num_tokens": 110567998.0, "step": 63750 }, { "entropy": 5.344998073577881, "epoch": 4.96035790702198, "grad_norm": 1.21875, "learning_rate": 0.00028057580537626766, "loss": 4.6868, "mean_token_accuracy": 0.22626933306455613, "num_tokens": 110576910.0, "step": 63755 }, { "entropy": 5.348239707946777, "epoch": 4.960746936393698, "grad_norm": 1.1484375, "learning_rate": 0.00028054809825799537, "loss": 4.6894, "mean_token_accuracy": 0.23627488166093827, "num_tokens": 110585574.0, "step": 63760 }, { "entropy": 5.428102254867554, "epoch": 4.961135965765415, "grad_norm": 1.2578125, "learning_rate": 0.00028052039105553965, "loss": 4.7711, "mean_token_accuracy": 0.22135983854532243, "num_tokens": 110593612.0, "step": 63765 }, { "entropy": 5.369566488265991, "epoch": 4.9615249951371325, "grad_norm": 1.2734375, "learning_rate": 0.0002804926837693207, "loss": 4.8402, "mean_token_accuracy": 0.22553509920835496, "num_tokens": 110601796.0, "step": 63770 }, { "entropy": 5.376843738555908, "epoch": 4.96191402450885, "grad_norm": 1.1953125, "learning_rate": 0.000280464976399759, "loss": 4.7534, "mean_token_accuracy": 0.23063101172447203, "num_tokens": 110610104.0, "step": 63775 }, { "entropy": 5.406345319747925, "epoch": 4.962303053880568, "grad_norm": 1.1328125, "learning_rate": 0.000280437268947275, "loss": 4.7028, "mean_token_accuracy": 0.23415306806564332, "num_tokens": 110618980.0, "step": 63780 }, { "entropy": 5.427701139450074, "epoch": 4.962692083252286, "grad_norm": 1.1796875, "learning_rate": 0.0002804095614122891, "loss": 4.8143, "mean_token_accuracy": 0.22397271394729615, "num_tokens": 110627804.0, "step": 63785 }, { "entropy": 5.402082347869873, "epoch": 4.963081112624003, "grad_norm": 1.140625, "learning_rate": 0.00028038185379522176, "loss": 4.8311, "mean_token_accuracy": 0.22169987559318544, "num_tokens": 110636149.0, "step": 63790 }, { "entropy": 5.342545700073242, "epoch": 4.963470141995721, "grad_norm": 1.140625, "learning_rate": 0.00028035414609649327, "loss": 4.695, "mean_token_accuracy": 0.23131568729877472, "num_tokens": 110644430.0, "step": 63795 }, { "entropy": 5.434930467605591, "epoch": 4.963859171367439, "grad_norm": 1.125, "learning_rate": 0.00028032643831652415, "loss": 4.8285, "mean_token_accuracy": 0.22235576212406158, "num_tokens": 110654451.0, "step": 63800 }, { "entropy": 5.488545560836792, "epoch": 4.9642482007391555, "grad_norm": 1.234375, "learning_rate": 0.0002802987304557349, "loss": 4.7944, "mean_token_accuracy": 0.2286959633231163, "num_tokens": 110662519.0, "step": 63805 }, { "entropy": 5.457192277908325, "epoch": 4.964637230110873, "grad_norm": 1.2109375, "learning_rate": 0.0002802710225145458, "loss": 4.8624, "mean_token_accuracy": 0.22379558384418488, "num_tokens": 110670954.0, "step": 63810 }, { "entropy": 5.433698415756226, "epoch": 4.965026259482591, "grad_norm": 1.2578125, "learning_rate": 0.00028024331449337726, "loss": 4.8576, "mean_token_accuracy": 0.21783299148082733, "num_tokens": 110679628.0, "step": 63815 }, { "entropy": 5.408075189590454, "epoch": 4.965415288854309, "grad_norm": 1.28125, "learning_rate": 0.00028021560639264985, "loss": 4.6989, "mean_token_accuracy": 0.23267098516225815, "num_tokens": 110688372.0, "step": 63820 }, { "entropy": 5.474450206756591, "epoch": 4.965804318226026, "grad_norm": 1.1796875, "learning_rate": 0.0002801878982127838, "loss": 4.7977, "mean_token_accuracy": 0.22783046811819077, "num_tokens": 110696567.0, "step": 63825 }, { "entropy": 5.383289051055908, "epoch": 4.966193347597744, "grad_norm": 1.203125, "learning_rate": 0.0002801601899541998, "loss": 4.7597, "mean_token_accuracy": 0.22773262858390808, "num_tokens": 110705650.0, "step": 63830 }, { "entropy": 5.320143795013427, "epoch": 4.966582376969461, "grad_norm": 1.1640625, "learning_rate": 0.000280132481617318, "loss": 4.7217, "mean_token_accuracy": 0.22731700539588928, "num_tokens": 110714793.0, "step": 63835 }, { "entropy": 5.315478277206421, "epoch": 4.9669714063411785, "grad_norm": 1.1953125, "learning_rate": 0.00028010477320255904, "loss": 4.6885, "mean_token_accuracy": 0.23174546658992767, "num_tokens": 110722914.0, "step": 63840 }, { "entropy": 5.431572914123535, "epoch": 4.967360435712896, "grad_norm": 1.15625, "learning_rate": 0.0002800770647103433, "loss": 4.7829, "mean_token_accuracy": 0.23041789531707763, "num_tokens": 110731702.0, "step": 63845 }, { "entropy": 5.445021867752075, "epoch": 4.967749465084614, "grad_norm": 1.265625, "learning_rate": 0.0002800493561410911, "loss": 4.7724, "mean_token_accuracy": 0.23257410973310472, "num_tokens": 110740252.0, "step": 63850 }, { "entropy": 5.458088731765747, "epoch": 4.968138494456332, "grad_norm": 1.2734375, "learning_rate": 0.000280021647495223, "loss": 4.9148, "mean_token_accuracy": 0.21065183877944946, "num_tokens": 110750369.0, "step": 63855 }, { "entropy": 5.544083547592163, "epoch": 4.968527523828049, "grad_norm": 1.203125, "learning_rate": 0.00027999393877315944, "loss": 4.9339, "mean_token_accuracy": 0.20953608602285384, "num_tokens": 110759149.0, "step": 63860 }, { "entropy": 5.509131526947021, "epoch": 4.968916553199767, "grad_norm": 1.140625, "learning_rate": 0.0002799662299753207, "loss": 4.8083, "mean_token_accuracy": 0.22567250579595566, "num_tokens": 110767438.0, "step": 63865 }, { "entropy": 5.344177961349487, "epoch": 4.969305582571484, "grad_norm": 1.125, "learning_rate": 0.00027993852110212735, "loss": 4.7007, "mean_token_accuracy": 0.2332465097308159, "num_tokens": 110775061.0, "step": 63870 }, { "entropy": 5.462042331695557, "epoch": 4.9696946119432015, "grad_norm": 1.2109375, "learning_rate": 0.0002799108121539999, "loss": 4.9758, "mean_token_accuracy": 0.2123553514480591, "num_tokens": 110783596.0, "step": 63875 }, { "entropy": 5.412834358215332, "epoch": 4.970083641314919, "grad_norm": 1.2265625, "learning_rate": 0.00027988310313135857, "loss": 4.7892, "mean_token_accuracy": 0.2268381506204605, "num_tokens": 110792897.0, "step": 63880 }, { "entropy": 5.4380754947662355, "epoch": 4.970472670686637, "grad_norm": 1.1640625, "learning_rate": 0.00027985539403462407, "loss": 4.8223, "mean_token_accuracy": 0.22155838906764985, "num_tokens": 110801769.0, "step": 63885 }, { "entropy": 5.289813470840454, "epoch": 4.970861700058355, "grad_norm": 1.1796875, "learning_rate": 0.00027982768486421657, "loss": 4.6498, "mean_token_accuracy": 0.23127272576093674, "num_tokens": 110811170.0, "step": 63890 }, { "entropy": 5.434076118469238, "epoch": 4.971250729430072, "grad_norm": 1.125, "learning_rate": 0.00027979997562055663, "loss": 4.8518, "mean_token_accuracy": 0.21941933929920196, "num_tokens": 110819681.0, "step": 63895 }, { "entropy": 5.37553973197937, "epoch": 4.971639758801789, "grad_norm": 1.1484375, "learning_rate": 0.00027977226630406476, "loss": 4.72, "mean_token_accuracy": 0.2285078153014183, "num_tokens": 110828362.0, "step": 63900 }, { "entropy": 5.4117316722869875, "epoch": 4.972028788173507, "grad_norm": 1.1484375, "learning_rate": 0.0002797445569151613, "loss": 4.796, "mean_token_accuracy": 0.22335676550865174, "num_tokens": 110836768.0, "step": 63905 }, { "entropy": 5.427364015579224, "epoch": 4.9724178175452245, "grad_norm": 1.234375, "learning_rate": 0.0002797168474542668, "loss": 4.8445, "mean_token_accuracy": 0.20969960689544678, "num_tokens": 110846238.0, "step": 63910 }, { "entropy": 5.3649420738220215, "epoch": 4.972806846916942, "grad_norm": 1.1953125, "learning_rate": 0.00027968913792180154, "loss": 4.7401, "mean_token_accuracy": 0.23378137946128846, "num_tokens": 110854845.0, "step": 63915 }, { "entropy": 5.3783773422241214, "epoch": 4.97319587628866, "grad_norm": 1.1953125, "learning_rate": 0.0002796614283181862, "loss": 4.749, "mean_token_accuracy": 0.22303928434848785, "num_tokens": 110863393.0, "step": 63920 }, { "entropy": 5.448866271972657, "epoch": 4.973584905660378, "grad_norm": 1.1953125, "learning_rate": 0.000279633718643841, "loss": 4.8192, "mean_token_accuracy": 0.22450248748064042, "num_tokens": 110871963.0, "step": 63925 }, { "entropy": 5.376678848266602, "epoch": 4.973973935032095, "grad_norm": 1.109375, "learning_rate": 0.00027960600889918657, "loss": 4.6893, "mean_token_accuracy": 0.22881503254175187, "num_tokens": 110881080.0, "step": 63930 }, { "entropy": 5.460013008117675, "epoch": 4.974362964403813, "grad_norm": 1.1171875, "learning_rate": 0.0002795782990846433, "loss": 4.8095, "mean_token_accuracy": 0.22481611222028733, "num_tokens": 110890449.0, "step": 63935 }, { "entropy": 5.457606363296509, "epoch": 4.97475199377553, "grad_norm": 1.2109375, "learning_rate": 0.0002795505892006316, "loss": 4.8531, "mean_token_accuracy": 0.2138216257095337, "num_tokens": 110899559.0, "step": 63940 }, { "entropy": 5.377870750427246, "epoch": 4.9751410231472475, "grad_norm": 1.3046875, "learning_rate": 0.0002795228792475719, "loss": 4.7381, "mean_token_accuracy": 0.23463571816682816, "num_tokens": 110908499.0, "step": 63945 }, { "entropy": 5.403241443634033, "epoch": 4.975530052518965, "grad_norm": 1.2890625, "learning_rate": 0.0002794951692258848, "loss": 4.7575, "mean_token_accuracy": 0.22593780755996704, "num_tokens": 110917279.0, "step": 63950 }, { "entropy": 5.41656904220581, "epoch": 4.975919081890683, "grad_norm": 1.2109375, "learning_rate": 0.0002794674591359906, "loss": 4.7866, "mean_token_accuracy": 0.22414452135562896, "num_tokens": 110927126.0, "step": 63955 }, { "entropy": 5.39356164932251, "epoch": 4.976308111262401, "grad_norm": 1.1953125, "learning_rate": 0.0002794397489783098, "loss": 4.758, "mean_token_accuracy": 0.22097909599542617, "num_tokens": 110935850.0, "step": 63960 }, { "entropy": 5.390287113189697, "epoch": 4.976697140634117, "grad_norm": 1.1953125, "learning_rate": 0.0002794120387532629, "loss": 4.7317, "mean_token_accuracy": 0.2292109414935112, "num_tokens": 110944279.0, "step": 63965 }, { "entropy": 5.371587800979614, "epoch": 4.977086170005835, "grad_norm": 1.234375, "learning_rate": 0.0002793843284612703, "loss": 4.7566, "mean_token_accuracy": 0.22940073758363724, "num_tokens": 110952354.0, "step": 63970 }, { "entropy": 5.351665830612182, "epoch": 4.977475199377553, "grad_norm": 1.1015625, "learning_rate": 0.0002793566181027526, "loss": 4.7677, "mean_token_accuracy": 0.2244884788990021, "num_tokens": 110961216.0, "step": 63975 }, { "entropy": 5.445906639099121, "epoch": 4.9778642287492705, "grad_norm": 1.21875, "learning_rate": 0.00027932890767813005, "loss": 4.7774, "mean_token_accuracy": 0.22335783541202545, "num_tokens": 110969162.0, "step": 63980 }, { "entropy": 5.415161037445069, "epoch": 4.978253258120988, "grad_norm": 1.2421875, "learning_rate": 0.0002793011971878233, "loss": 4.7289, "mean_token_accuracy": 0.2312667429447174, "num_tokens": 110977746.0, "step": 63985 }, { "entropy": 5.355083465576172, "epoch": 4.978642287492706, "grad_norm": 1.2578125, "learning_rate": 0.0002792734866322526, "loss": 4.738, "mean_token_accuracy": 0.2325270652770996, "num_tokens": 110986387.0, "step": 63990 }, { "entropy": 5.412277460098267, "epoch": 4.979031316864424, "grad_norm": 1.3203125, "learning_rate": 0.0002792457760118387, "loss": 4.8192, "mean_token_accuracy": 0.22542303651571274, "num_tokens": 110995709.0, "step": 63995 }, { "entropy": 5.435282278060913, "epoch": 4.979420346236141, "grad_norm": 1.1796875, "learning_rate": 0.00027921806532700186, "loss": 4.8013, "mean_token_accuracy": 0.2206418216228485, "num_tokens": 111003825.0, "step": 64000 }, { "entropy": 5.418638563156128, "epoch": 4.979809375607858, "grad_norm": 1.203125, "learning_rate": 0.0002791903545781625, "loss": 4.7931, "mean_token_accuracy": 0.22615060955286026, "num_tokens": 111013106.0, "step": 64005 }, { "entropy": 5.425638103485108, "epoch": 4.980198404979576, "grad_norm": 1.1015625, "learning_rate": 0.00027916264376574124, "loss": 4.8247, "mean_token_accuracy": 0.2186003014445305, "num_tokens": 111021755.0, "step": 64010 }, { "entropy": 5.394620418548584, "epoch": 4.9805874343512935, "grad_norm": 1.078125, "learning_rate": 0.00027913493289015857, "loss": 4.7222, "mean_token_accuracy": 0.2289113849401474, "num_tokens": 111030815.0, "step": 64015 }, { "entropy": 5.360451698303223, "epoch": 4.980976463723011, "grad_norm": 1.1171875, "learning_rate": 0.00027910722195183474, "loss": 4.7518, "mean_token_accuracy": 0.23672803044319152, "num_tokens": 111039398.0, "step": 64020 }, { "entropy": 5.391369867324829, "epoch": 4.981365493094729, "grad_norm": 1.2421875, "learning_rate": 0.0002790795109511904, "loss": 4.7599, "mean_token_accuracy": 0.2260148212313652, "num_tokens": 111048075.0, "step": 64025 }, { "entropy": 5.439908981323242, "epoch": 4.981754522466447, "grad_norm": 1.2421875, "learning_rate": 0.00027905179988864593, "loss": 4.7714, "mean_token_accuracy": 0.23065318465232848, "num_tokens": 111056270.0, "step": 64030 }, { "entropy": 5.414389562606812, "epoch": 4.982143551838163, "grad_norm": 1.1953125, "learning_rate": 0.0002790240887646219, "loss": 4.7733, "mean_token_accuracy": 0.2269987791776657, "num_tokens": 111065416.0, "step": 64035 }, { "entropy": 5.423352384567261, "epoch": 4.982532581209881, "grad_norm": 1.21875, "learning_rate": 0.00027899637757953876, "loss": 4.8406, "mean_token_accuracy": 0.2221213921904564, "num_tokens": 111073715.0, "step": 64040 }, { "entropy": 5.482796907424927, "epoch": 4.982921610581599, "grad_norm": 1.171875, "learning_rate": 0.00027896866633381694, "loss": 4.885, "mean_token_accuracy": 0.21826411485671998, "num_tokens": 111082801.0, "step": 64045 }, { "entropy": 5.474845838546753, "epoch": 4.9833106399533165, "grad_norm": 1.1171875, "learning_rate": 0.0002789409550278769, "loss": 4.8251, "mean_token_accuracy": 0.21935138255357742, "num_tokens": 111091583.0, "step": 64050 }, { "entropy": 5.354418039321899, "epoch": 4.983699669325034, "grad_norm": 1.3359375, "learning_rate": 0.0002789132436621391, "loss": 4.6305, "mean_token_accuracy": 0.24013043195009232, "num_tokens": 111100008.0, "step": 64055 }, { "entropy": 5.389859437942505, "epoch": 4.984088698696752, "grad_norm": 1.125, "learning_rate": 0.0002788855322370241, "loss": 4.7594, "mean_token_accuracy": 0.22591807395219804, "num_tokens": 111108536.0, "step": 64060 }, { "entropy": 5.515747690200806, "epoch": 4.98447772806847, "grad_norm": 1.21875, "learning_rate": 0.00027885782075295234, "loss": 4.8969, "mean_token_accuracy": 0.21636863946914672, "num_tokens": 111116866.0, "step": 64065 }, { "entropy": 5.418009614944458, "epoch": 4.984866757440186, "grad_norm": 1.1875, "learning_rate": 0.0002788301092103443, "loss": 4.75, "mean_token_accuracy": 0.22806775718927383, "num_tokens": 111125385.0, "step": 64070 }, { "entropy": 5.411872625350952, "epoch": 4.985255786811904, "grad_norm": 1.1640625, "learning_rate": 0.00027880239760962044, "loss": 4.8021, "mean_token_accuracy": 0.2322111964225769, "num_tokens": 111134548.0, "step": 64075 }, { "entropy": 5.351829576492309, "epoch": 4.985644816183622, "grad_norm": 1.1171875, "learning_rate": 0.00027877468595120125, "loss": 4.7152, "mean_token_accuracy": 0.22233431935310363, "num_tokens": 111143082.0, "step": 64080 }, { "entropy": 5.4896769523620605, "epoch": 4.9860338455553395, "grad_norm": 1.1640625, "learning_rate": 0.0002787469742355072, "loss": 4.8748, "mean_token_accuracy": 0.22104825973510742, "num_tokens": 111152722.0, "step": 64085 }, { "entropy": 5.507826042175293, "epoch": 4.986422874927057, "grad_norm": 1.1875, "learning_rate": 0.0002787192624629587, "loss": 4.9148, "mean_token_accuracy": 0.22559223920106888, "num_tokens": 111162416.0, "step": 64090 }, { "entropy": 5.4191066265106205, "epoch": 4.986811904298775, "grad_norm": 1.1640625, "learning_rate": 0.0002786915506339764, "loss": 4.7845, "mean_token_accuracy": 0.21721385568380355, "num_tokens": 111171501.0, "step": 64095 }, { "entropy": 5.452735757827758, "epoch": 4.987200933670492, "grad_norm": 1.2265625, "learning_rate": 0.0002786638387489807, "loss": 4.8333, "mean_token_accuracy": 0.2147175043821335, "num_tokens": 111180765.0, "step": 64100 }, { "entropy": 5.475985193252564, "epoch": 4.987589963042209, "grad_norm": 1.140625, "learning_rate": 0.00027863612680839204, "loss": 4.865, "mean_token_accuracy": 0.2151520788669586, "num_tokens": 111189477.0, "step": 64105 }, { "entropy": 5.442052268981934, "epoch": 4.987978992413927, "grad_norm": 1.125, "learning_rate": 0.000278608414812631, "loss": 4.7809, "mean_token_accuracy": 0.21815894693136215, "num_tokens": 111198239.0, "step": 64110 }, { "entropy": 5.365978479385376, "epoch": 4.988368021785645, "grad_norm": 1.171875, "learning_rate": 0.00027858070276211804, "loss": 4.7841, "mean_token_accuracy": 0.22990026772022248, "num_tokens": 111207330.0, "step": 64115 }, { "entropy": 5.3681844711303714, "epoch": 4.9887570511573625, "grad_norm": 1.2734375, "learning_rate": 0.0002785529906572735, "loss": 4.7392, "mean_token_accuracy": 0.2290705293416977, "num_tokens": 111216038.0, "step": 64120 }, { "entropy": 5.465754842758178, "epoch": 4.98914608052908, "grad_norm": 1.2265625, "learning_rate": 0.000278525278498518, "loss": 4.8131, "mean_token_accuracy": 0.21883846670389176, "num_tokens": 111224980.0, "step": 64125 }, { "entropy": 5.487655448913574, "epoch": 4.989535109900798, "grad_norm": 1.125, "learning_rate": 0.00027849756628627205, "loss": 4.8133, "mean_token_accuracy": 0.22330766320228576, "num_tokens": 111234394.0, "step": 64130 }, { "entropy": 5.377928781509399, "epoch": 4.9899241392725155, "grad_norm": 1.1875, "learning_rate": 0.0002784698540209561, "loss": 4.7178, "mean_token_accuracy": 0.2260890558362007, "num_tokens": 111242260.0, "step": 64135 }, { "entropy": 5.387384605407715, "epoch": 4.990313168644232, "grad_norm": 1.171875, "learning_rate": 0.00027844214170299065, "loss": 4.6443, "mean_token_accuracy": 0.24159384220838548, "num_tokens": 111250706.0, "step": 64140 }, { "entropy": 5.372367334365845, "epoch": 4.99070219801595, "grad_norm": 1.2265625, "learning_rate": 0.00027841442933279614, "loss": 4.8146, "mean_token_accuracy": 0.21741727739572525, "num_tokens": 111259965.0, "step": 64145 }, { "entropy": 5.3532792091369625, "epoch": 4.991091227387668, "grad_norm": 1.34375, "learning_rate": 0.00027838671691079314, "loss": 4.6869, "mean_token_accuracy": 0.22441308498382567, "num_tokens": 111269422.0, "step": 64150 }, { "entropy": 5.437767076492309, "epoch": 4.9914802567593854, "grad_norm": 1.2421875, "learning_rate": 0.0002783590044374021, "loss": 4.7344, "mean_token_accuracy": 0.23423292338848115, "num_tokens": 111278505.0, "step": 64155 }, { "entropy": 5.4433564186096195, "epoch": 4.991869286131103, "grad_norm": 1.1640625, "learning_rate": 0.0002783312919130435, "loss": 4.7472, "mean_token_accuracy": 0.22648418992757796, "num_tokens": 111288194.0, "step": 64160 }, { "entropy": 5.359408617019653, "epoch": 4.992258315502821, "grad_norm": 1.1640625, "learning_rate": 0.0002783035793381378, "loss": 4.7842, "mean_token_accuracy": 0.22051894813776016, "num_tokens": 111297425.0, "step": 64165 }, { "entropy": 5.413225793838501, "epoch": 4.992647344874538, "grad_norm": 1.359375, "learning_rate": 0.00027827586671310556, "loss": 4.8335, "mean_token_accuracy": 0.22535801380872728, "num_tokens": 111307008.0, "step": 64170 }, { "entropy": 5.4240659236907955, "epoch": 4.993036374246255, "grad_norm": 1.2421875, "learning_rate": 0.0002782481540383673, "loss": 4.7318, "mean_token_accuracy": 0.23277881890535354, "num_tokens": 111315311.0, "step": 64175 }, { "entropy": 5.461198186874389, "epoch": 4.993425403617973, "grad_norm": 1.15625, "learning_rate": 0.00027822044131434344, "loss": 4.7862, "mean_token_accuracy": 0.22127892524003984, "num_tokens": 111323734.0, "step": 64180 }, { "entropy": 5.394426155090332, "epoch": 4.993814432989691, "grad_norm": 1.3125, "learning_rate": 0.0002781927285414545, "loss": 4.6455, "mean_token_accuracy": 0.23338836431503296, "num_tokens": 111331696.0, "step": 64185 }, { "entropy": 5.3852911472320555, "epoch": 4.994203462361408, "grad_norm": 1.296875, "learning_rate": 0.00027816501572012104, "loss": 4.8584, "mean_token_accuracy": 0.21642314344644548, "num_tokens": 111341266.0, "step": 64190 }, { "entropy": 5.443745422363281, "epoch": 4.994592491733126, "grad_norm": 1.28125, "learning_rate": 0.0002781373028507634, "loss": 4.8619, "mean_token_accuracy": 0.2204653352499008, "num_tokens": 111350509.0, "step": 64195 }, { "entropy": 5.448437023162842, "epoch": 4.994981521104844, "grad_norm": 1.21875, "learning_rate": 0.0002781095899338023, "loss": 4.8222, "mean_token_accuracy": 0.2221800908446312, "num_tokens": 111359408.0, "step": 64200 }, { "entropy": 5.422222042083741, "epoch": 4.995370550476561, "grad_norm": 1.2578125, "learning_rate": 0.0002780818769696581, "loss": 4.7367, "mean_token_accuracy": 0.22704196870326995, "num_tokens": 111367523.0, "step": 64205 }, { "entropy": 5.487494802474975, "epoch": 4.995759579848278, "grad_norm": 1.171875, "learning_rate": 0.00027805416395875127, "loss": 4.9156, "mean_token_accuracy": 0.21983126997947694, "num_tokens": 111376157.0, "step": 64210 }, { "entropy": 5.340842342376709, "epoch": 4.996148609219996, "grad_norm": 1.296875, "learning_rate": 0.0002780264509015024, "loss": 4.6969, "mean_token_accuracy": 0.22905329763889312, "num_tokens": 111384300.0, "step": 64215 }, { "entropy": 5.3841142654418945, "epoch": 4.996537638591714, "grad_norm": 1.234375, "learning_rate": 0.00027799873779833193, "loss": 4.7079, "mean_token_accuracy": 0.23045638650655748, "num_tokens": 111393207.0, "step": 64220 }, { "entropy": 5.443645286560058, "epoch": 4.996926667963431, "grad_norm": 1.234375, "learning_rate": 0.0002779710246496604, "loss": 4.7432, "mean_token_accuracy": 0.22990184128284455, "num_tokens": 111401543.0, "step": 64225 }, { "entropy": 5.4928313255310055, "epoch": 4.997315697335149, "grad_norm": 1.2109375, "learning_rate": 0.0002779433114559083, "loss": 4.9022, "mean_token_accuracy": 0.21773283034563065, "num_tokens": 111410055.0, "step": 64230 }, { "entropy": 5.425173377990722, "epoch": 4.997704726706866, "grad_norm": 1.2421875, "learning_rate": 0.00027791559821749615, "loss": 4.8164, "mean_token_accuracy": 0.21817171722650527, "num_tokens": 111419244.0, "step": 64235 }, { "entropy": 5.422532844543457, "epoch": 4.998093756078584, "grad_norm": 1.1484375, "learning_rate": 0.00027788788493484447, "loss": 4.6954, "mean_token_accuracy": 0.2294187068939209, "num_tokens": 111428144.0, "step": 64240 }, { "entropy": 5.393340396881103, "epoch": 4.998482785450301, "grad_norm": 1.1953125, "learning_rate": 0.0002778601716083736, "loss": 4.7409, "mean_token_accuracy": 0.22522320300340654, "num_tokens": 111437459.0, "step": 64245 }, { "entropy": 5.494318962097168, "epoch": 4.998871814822019, "grad_norm": 1.1484375, "learning_rate": 0.0002778324582385043, "loss": 4.9344, "mean_token_accuracy": 0.21052779853343964, "num_tokens": 111446771.0, "step": 64250 }, { "entropy": 5.3928529739379885, "epoch": 4.999260844193737, "grad_norm": 1.2265625, "learning_rate": 0.00027780474482565687, "loss": 4.7686, "mean_token_accuracy": 0.22472599744796753, "num_tokens": 111455725.0, "step": 64255 }, { "entropy": 5.491280794143677, "epoch": 4.999649873565454, "grad_norm": 1.1640625, "learning_rate": 0.00027777703137025193, "loss": 4.8446, "mean_token_accuracy": 0.2185389444231987, "num_tokens": 111464343.0, "step": 64260 }, { "entropy": 5.467421054840088, "epoch": 5.0, "grad_norm": 2.765625, "learning_rate": 0.00027774931787271, "loss": 4.7557, "mean_token_accuracy": 0.22578904032707214, "num_tokens": 111471835.0, "step": 64265 }, { "entropy": 5.393160772323609, "epoch": 5.000389029371718, "grad_norm": 1.15625, "learning_rate": 0.0002777216043334516, "loss": 4.6693, "mean_token_accuracy": 0.22942399978637695, "num_tokens": 111481644.0, "step": 64270 }, { "entropy": 5.359787368774414, "epoch": 5.000778058743435, "grad_norm": 1.078125, "learning_rate": 0.00027769389075289714, "loss": 4.7041, "mean_token_accuracy": 0.23059123158454894, "num_tokens": 111490873.0, "step": 64275 }, { "entropy": 5.350889062881469, "epoch": 5.001167088115153, "grad_norm": 1.2265625, "learning_rate": 0.0002776661771314671, "loss": 4.6615, "mean_token_accuracy": 0.23821038901805877, "num_tokens": 111499059.0, "step": 64280 }, { "entropy": 5.390213966369629, "epoch": 5.00155611748687, "grad_norm": 1.2109375, "learning_rate": 0.0002776384634695821, "loss": 4.6287, "mean_token_accuracy": 0.24267079383134843, "num_tokens": 111507406.0, "step": 64285 }, { "entropy": 5.384152269363403, "epoch": 5.001945146858588, "grad_norm": 1.1484375, "learning_rate": 0.0002776107497676626, "loss": 4.6374, "mean_token_accuracy": 0.23686433881521224, "num_tokens": 111516998.0, "step": 64290 }, { "entropy": 5.326612710952759, "epoch": 5.002334176230305, "grad_norm": 1.21875, "learning_rate": 0.0002775830360261291, "loss": 4.7304, "mean_token_accuracy": 0.23271764516830445, "num_tokens": 111525636.0, "step": 64295 }, { "entropy": 5.372388887405395, "epoch": 5.002723205602023, "grad_norm": 1.234375, "learning_rate": 0.00027755532224540226, "loss": 4.6879, "mean_token_accuracy": 0.2348104938864708, "num_tokens": 111533057.0, "step": 64300 }, { "entropy": 5.346791553497314, "epoch": 5.003112234973741, "grad_norm": 1.1796875, "learning_rate": 0.00027752760842590245, "loss": 4.6558, "mean_token_accuracy": 0.23345253318548204, "num_tokens": 111541852.0, "step": 64305 }, { "entropy": 5.452053833007812, "epoch": 5.003501264345458, "grad_norm": 1.265625, "learning_rate": 0.0002774998945680502, "loss": 4.7031, "mean_token_accuracy": 0.23394353538751603, "num_tokens": 111551195.0, "step": 64310 }, { "entropy": 5.407734823226929, "epoch": 5.003890293717176, "grad_norm": 1.3828125, "learning_rate": 0.000277472180672266, "loss": 4.7192, "mean_token_accuracy": 0.23333755880594254, "num_tokens": 111559483.0, "step": 64315 }, { "entropy": 5.4497997760772705, "epoch": 5.004279323088893, "grad_norm": 1.2109375, "learning_rate": 0.00027744446673897034, "loss": 4.7625, "mean_token_accuracy": 0.222392338514328, "num_tokens": 111568410.0, "step": 64320 }, { "entropy": 5.417685174942017, "epoch": 5.004668352460611, "grad_norm": 1.2109375, "learning_rate": 0.00027741675276858374, "loss": 4.7283, "mean_token_accuracy": 0.2289823114871979, "num_tokens": 111577095.0, "step": 64325 }, { "entropy": 5.346709585189819, "epoch": 5.005057381832328, "grad_norm": 1.140625, "learning_rate": 0.00027738903876152693, "loss": 4.5628, "mean_token_accuracy": 0.24600160270929336, "num_tokens": 111585592.0, "step": 64330 }, { "entropy": 5.392195463180542, "epoch": 5.005446411204046, "grad_norm": 1.1953125, "learning_rate": 0.0002773613247182202, "loss": 4.6627, "mean_token_accuracy": 0.2382856711745262, "num_tokens": 111594012.0, "step": 64335 }, { "entropy": 5.352856159210205, "epoch": 5.005835440575764, "grad_norm": 1.28125, "learning_rate": 0.00027733361063908405, "loss": 4.6551, "mean_token_accuracy": 0.24531556218862532, "num_tokens": 111602756.0, "step": 64340 }, { "entropy": 5.435971736907959, "epoch": 5.006224469947481, "grad_norm": 1.140625, "learning_rate": 0.0002773058965245393, "loss": 4.7776, "mean_token_accuracy": 0.23149231374263762, "num_tokens": 111611411.0, "step": 64345 }, { "entropy": 5.4332164287567135, "epoch": 5.006613499319198, "grad_norm": 1.1484375, "learning_rate": 0.000277278182375006, "loss": 4.7224, "mean_token_accuracy": 0.22553129196166993, "num_tokens": 111621190.0, "step": 64350 }, { "entropy": 5.503264713287353, "epoch": 5.007002528690916, "grad_norm": 1.234375, "learning_rate": 0.0002772504681909049, "loss": 4.812, "mean_token_accuracy": 0.22305875569581984, "num_tokens": 111629834.0, "step": 64355 }, { "entropy": 5.3610021591186525, "epoch": 5.007391558062634, "grad_norm": 1.1875, "learning_rate": 0.0002772227539726566, "loss": 4.6114, "mean_token_accuracy": 0.23325600177049638, "num_tokens": 111638260.0, "step": 64360 }, { "entropy": 5.362676095962525, "epoch": 5.007780587434351, "grad_norm": 1.1484375, "learning_rate": 0.0002771950397206816, "loss": 4.672, "mean_token_accuracy": 0.23826683461666107, "num_tokens": 111646643.0, "step": 64365 }, { "entropy": 5.44324951171875, "epoch": 5.008169616806069, "grad_norm": 1.328125, "learning_rate": 0.0002771673254354003, "loss": 4.7551, "mean_token_accuracy": 0.22555161416530609, "num_tokens": 111654725.0, "step": 64370 }, { "entropy": 5.302894878387451, "epoch": 5.008558646177787, "grad_norm": 1.15625, "learning_rate": 0.00027713961111723335, "loss": 4.614, "mean_token_accuracy": 0.23836666196584702, "num_tokens": 111663638.0, "step": 64375 }, { "entropy": 5.3154296875, "epoch": 5.008947675549504, "grad_norm": 1.1953125, "learning_rate": 0.00027711189676660116, "loss": 4.5682, "mean_token_accuracy": 0.2404208540916443, "num_tokens": 111672855.0, "step": 64380 }, { "entropy": 5.399192476272583, "epoch": 5.009336704921221, "grad_norm": 1.1484375, "learning_rate": 0.00027708418238392435, "loss": 4.6691, "mean_token_accuracy": 0.23871610015630723, "num_tokens": 111682328.0, "step": 64385 }, { "entropy": 5.41549596786499, "epoch": 5.009725734292939, "grad_norm": 1.28125, "learning_rate": 0.0002770564679696233, "loss": 4.6888, "mean_token_accuracy": 0.23409728556871415, "num_tokens": 111690713.0, "step": 64390 }, { "entropy": 5.362019491195679, "epoch": 5.010114763664657, "grad_norm": 1.25, "learning_rate": 0.00027702875352411866, "loss": 4.6916, "mean_token_accuracy": 0.23450776189565659, "num_tokens": 111699466.0, "step": 64395 }, { "entropy": 5.403151226043701, "epoch": 5.010503793036374, "grad_norm": 1.328125, "learning_rate": 0.0002770010390478309, "loss": 4.7285, "mean_token_accuracy": 0.22748700976371766, "num_tokens": 111708331.0, "step": 64400 }, { "entropy": 5.39559006690979, "epoch": 5.010892822408092, "grad_norm": 1.140625, "learning_rate": 0.00027697332454118057, "loss": 4.7008, "mean_token_accuracy": 0.2342975452542305, "num_tokens": 111716564.0, "step": 64405 }, { "entropy": 5.425977182388306, "epoch": 5.01128185177981, "grad_norm": 1.140625, "learning_rate": 0.00027694561000458825, "loss": 4.678, "mean_token_accuracy": 0.23416243344545365, "num_tokens": 111725241.0, "step": 64410 }, { "entropy": 5.457909631729126, "epoch": 5.011670881151527, "grad_norm": 1.25, "learning_rate": 0.0002769178954384743, "loss": 4.7774, "mean_token_accuracy": 0.22220711261034012, "num_tokens": 111733569.0, "step": 64415 }, { "entropy": 5.39597339630127, "epoch": 5.012059910523244, "grad_norm": 1.2109375, "learning_rate": 0.0002768901808432594, "loss": 4.7009, "mean_token_accuracy": 0.24136213958263397, "num_tokens": 111742599.0, "step": 64420 }, { "entropy": 5.424000406265259, "epoch": 5.012448939894962, "grad_norm": 1.3203125, "learning_rate": 0.000276862466219364, "loss": 4.6896, "mean_token_accuracy": 0.2359243080019951, "num_tokens": 111751562.0, "step": 64425 }, { "entropy": 5.375463199615479, "epoch": 5.01283796926668, "grad_norm": 1.203125, "learning_rate": 0.0002768347515672086, "loss": 4.6018, "mean_token_accuracy": 0.23400613218545913, "num_tokens": 111760649.0, "step": 64430 }, { "entropy": 5.432074165344238, "epoch": 5.013226998638397, "grad_norm": 1.3125, "learning_rate": 0.00027680703688721383, "loss": 4.7361, "mean_token_accuracy": 0.2317538008093834, "num_tokens": 111768850.0, "step": 64435 }, { "entropy": 5.378588008880615, "epoch": 5.013616028010115, "grad_norm": 1.15625, "learning_rate": 0.00027677932217980004, "loss": 4.684, "mean_token_accuracy": 0.2459005519747734, "num_tokens": 111777791.0, "step": 64440 }, { "entropy": 5.402051067352295, "epoch": 5.014005057381833, "grad_norm": 1.1328125, "learning_rate": 0.000276751607445388, "loss": 4.7213, "mean_token_accuracy": 0.2279883250594139, "num_tokens": 111787248.0, "step": 64445 }, { "entropy": 5.33976035118103, "epoch": 5.0143940867535495, "grad_norm": 1.2109375, "learning_rate": 0.000276723892684398, "loss": 4.6474, "mean_token_accuracy": 0.2304422900080681, "num_tokens": 111795218.0, "step": 64450 }, { "entropy": 5.4128748893737795, "epoch": 5.014783116125267, "grad_norm": 1.140625, "learning_rate": 0.00027669617789725074, "loss": 4.7052, "mean_token_accuracy": 0.23688170909881592, "num_tokens": 111803769.0, "step": 64455 }, { "entropy": 5.403263854980469, "epoch": 5.015172145496985, "grad_norm": 1.296875, "learning_rate": 0.0002766684630843667, "loss": 4.6115, "mean_token_accuracy": 0.2430353507399559, "num_tokens": 111811841.0, "step": 64460 }, { "entropy": 5.392855405807495, "epoch": 5.015561174868703, "grad_norm": 1.2734375, "learning_rate": 0.0002766407482461663, "loss": 4.697, "mean_token_accuracy": 0.2374156594276428, "num_tokens": 111820836.0, "step": 64465 }, { "entropy": 5.3530598163604735, "epoch": 5.01595020424042, "grad_norm": 1.1796875, "learning_rate": 0.0002766130333830702, "loss": 4.6653, "mean_token_accuracy": 0.23851159065961838, "num_tokens": 111829917.0, "step": 64470 }, { "entropy": 5.363078546524048, "epoch": 5.016339233612138, "grad_norm": 1.171875, "learning_rate": 0.00027658531849549894, "loss": 4.6537, "mean_token_accuracy": 0.2352581024169922, "num_tokens": 111839336.0, "step": 64475 }, { "entropy": 5.442423343658447, "epoch": 5.016728262983856, "grad_norm": 1.234375, "learning_rate": 0.0002765576035838729, "loss": 4.7161, "mean_token_accuracy": 0.23403845727443695, "num_tokens": 111847495.0, "step": 64480 }, { "entropy": 5.318526029586792, "epoch": 5.0171172923555725, "grad_norm": 1.1171875, "learning_rate": 0.0002765298886486128, "loss": 4.6567, "mean_token_accuracy": 0.23740802109241485, "num_tokens": 111855903.0, "step": 64485 }, { "entropy": 5.3797626972198485, "epoch": 5.01750632172729, "grad_norm": 1.1796875, "learning_rate": 0.0002765021736901389, "loss": 4.7385, "mean_token_accuracy": 0.23324352502822876, "num_tokens": 111864910.0, "step": 64490 }, { "entropy": 5.407120323181152, "epoch": 5.017895351099008, "grad_norm": 1.25, "learning_rate": 0.0002764744587088721, "loss": 4.7157, "mean_token_accuracy": 0.2326302334666252, "num_tokens": 111873201.0, "step": 64495 }, { "entropy": 5.350489091873169, "epoch": 5.018284380470726, "grad_norm": 1.1875, "learning_rate": 0.0002764467437052327, "loss": 4.6321, "mean_token_accuracy": 0.23700974136590958, "num_tokens": 111882002.0, "step": 64500 }, { "entropy": 5.387865352630615, "epoch": 5.018673409842443, "grad_norm": 1.2265625, "learning_rate": 0.00027641902867964126, "loss": 4.7366, "mean_token_accuracy": 0.22644797414541246, "num_tokens": 111891330.0, "step": 64505 }, { "entropy": 5.409853124618531, "epoch": 5.019062439214161, "grad_norm": 1.296875, "learning_rate": 0.00027639131363251825, "loss": 4.7406, "mean_token_accuracy": 0.23686837255954743, "num_tokens": 111899743.0, "step": 64510 }, { "entropy": 5.42524151802063, "epoch": 5.019451468585879, "grad_norm": 1.2421875, "learning_rate": 0.00027636359856428436, "loss": 4.7075, "mean_token_accuracy": 0.24052108079195023, "num_tokens": 111907844.0, "step": 64515 }, { "entropy": 5.401770973205567, "epoch": 5.0198404979575955, "grad_norm": 1.2109375, "learning_rate": 0.0002763358834753599, "loss": 4.7308, "mean_token_accuracy": 0.23089895248413086, "num_tokens": 111916151.0, "step": 64520 }, { "entropy": 5.403537559509277, "epoch": 5.020229527329313, "grad_norm": 1.1875, "learning_rate": 0.00027630816836616564, "loss": 4.6592, "mean_token_accuracy": 0.23611665815114974, "num_tokens": 111924576.0, "step": 64525 }, { "entropy": 5.414581775665283, "epoch": 5.020618556701031, "grad_norm": 1.328125, "learning_rate": 0.00027628045323712194, "loss": 4.7652, "mean_token_accuracy": 0.23140973150730132, "num_tokens": 111932909.0, "step": 64530 }, { "entropy": 5.4493695259094235, "epoch": 5.0210075860727486, "grad_norm": 1.21875, "learning_rate": 0.00027625273808864955, "loss": 4.7276, "mean_token_accuracy": 0.23673717975616454, "num_tokens": 111941539.0, "step": 64535 }, { "entropy": 5.416542291641235, "epoch": 5.021396615444466, "grad_norm": 1.2578125, "learning_rate": 0.0002762250229211687, "loss": 4.759, "mean_token_accuracy": 0.22537968456745147, "num_tokens": 111950186.0, "step": 64540 }, { "entropy": 5.418787908554077, "epoch": 5.021785644816184, "grad_norm": 1.296875, "learning_rate": 0.00027619730773510015, "loss": 4.8008, "mean_token_accuracy": 0.22744613587856294, "num_tokens": 111959264.0, "step": 64545 }, { "entropy": 5.3736530303955075, "epoch": 5.022174674187901, "grad_norm": 1.21875, "learning_rate": 0.00027616959253086437, "loss": 4.6842, "mean_token_accuracy": 0.23682726174592972, "num_tokens": 111968553.0, "step": 64550 }, { "entropy": 5.474446868896484, "epoch": 5.0225637035596185, "grad_norm": 1.171875, "learning_rate": 0.0002761418773088818, "loss": 4.7216, "mean_token_accuracy": 0.23695174008607864, "num_tokens": 111977380.0, "step": 64555 }, { "entropy": 5.4269242763519285, "epoch": 5.022952732931336, "grad_norm": 1.15625, "learning_rate": 0.0002761141620695731, "loss": 4.7051, "mean_token_accuracy": 0.23576796650886536, "num_tokens": 111986008.0, "step": 64560 }, { "entropy": 5.252368068695068, "epoch": 5.023341762303054, "grad_norm": 1.15625, "learning_rate": 0.00027608644681335876, "loss": 4.5546, "mean_token_accuracy": 0.24408508092164993, "num_tokens": 111994863.0, "step": 64565 }, { "entropy": 5.48540768623352, "epoch": 5.0237307916747715, "grad_norm": 1.2421875, "learning_rate": 0.00027605873154065935, "loss": 4.8269, "mean_token_accuracy": 0.22523840963840486, "num_tokens": 112003612.0, "step": 64570 }, { "entropy": 5.342392873764038, "epoch": 5.024119821046489, "grad_norm": 1.234375, "learning_rate": 0.00027603101625189543, "loss": 4.5647, "mean_token_accuracy": 0.2354205936193466, "num_tokens": 112012034.0, "step": 64575 }, { "entropy": 5.478159093856812, "epoch": 5.024508850418207, "grad_norm": 1.25, "learning_rate": 0.0002760033009474874, "loss": 4.8373, "mean_token_accuracy": 0.2164052426815033, "num_tokens": 112021207.0, "step": 64580 }, { "entropy": 5.329247331619262, "epoch": 5.024897879789924, "grad_norm": 1.1796875, "learning_rate": 0.0002759755856278558, "loss": 4.7051, "mean_token_accuracy": 0.22684061527252197, "num_tokens": 112029677.0, "step": 64585 }, { "entropy": 5.306162738800049, "epoch": 5.0252869091616414, "grad_norm": 1.15625, "learning_rate": 0.0002759478702934213, "loss": 4.5952, "mean_token_accuracy": 0.24477420896291732, "num_tokens": 112038024.0, "step": 64590 }, { "entropy": 5.462326431274414, "epoch": 5.025675938533359, "grad_norm": 1.171875, "learning_rate": 0.00027592015494460443, "loss": 4.7151, "mean_token_accuracy": 0.22498405426740647, "num_tokens": 112046320.0, "step": 64595 }, { "entropy": 5.471684360504151, "epoch": 5.026064967905077, "grad_norm": 1.21875, "learning_rate": 0.00027589243958182566, "loss": 4.8028, "mean_token_accuracy": 0.22004290372133256, "num_tokens": 112055539.0, "step": 64600 }, { "entropy": 5.40683798789978, "epoch": 5.0264539972767945, "grad_norm": 1.2421875, "learning_rate": 0.00027586472420550553, "loss": 4.6509, "mean_token_accuracy": 0.22683300077915192, "num_tokens": 112064282.0, "step": 64605 }, { "entropy": 5.414402341842651, "epoch": 5.026843026648512, "grad_norm": 1.390625, "learning_rate": 0.0002758370088160646, "loss": 4.6514, "mean_token_accuracy": 0.23657518923282622, "num_tokens": 112072641.0, "step": 64610 }, { "entropy": 5.2838493347167965, "epoch": 5.02723205602023, "grad_norm": 1.3046875, "learning_rate": 0.0002758092934139234, "loss": 4.587, "mean_token_accuracy": 0.2451772376894951, "num_tokens": 112081026.0, "step": 64615 }, { "entropy": 5.342365550994873, "epoch": 5.027621085391947, "grad_norm": 1.171875, "learning_rate": 0.0002757815779995023, "loss": 4.6906, "mean_token_accuracy": 0.23365252763032912, "num_tokens": 112089810.0, "step": 64620 }, { "entropy": 5.492216348648071, "epoch": 5.028010114763664, "grad_norm": 1.265625, "learning_rate": 0.0002757538625732222, "loss": 4.8311, "mean_token_accuracy": 0.2206197127699852, "num_tokens": 112098279.0, "step": 64625 }, { "entropy": 5.436621856689453, "epoch": 5.028399144135382, "grad_norm": 1.2421875, "learning_rate": 0.0002757261471355034, "loss": 4.7505, "mean_token_accuracy": 0.23636455535888673, "num_tokens": 112107456.0, "step": 64630 }, { "entropy": 5.374758863449097, "epoch": 5.0287881735071, "grad_norm": 1.1171875, "learning_rate": 0.00027569843168676647, "loss": 4.6771, "mean_token_accuracy": 0.22461806386709213, "num_tokens": 112116595.0, "step": 64635 }, { "entropy": 5.347405624389649, "epoch": 5.0291772028788175, "grad_norm": 1.21875, "learning_rate": 0.0002756707162274319, "loss": 4.6954, "mean_token_accuracy": 0.22683172523975373, "num_tokens": 112126468.0, "step": 64640 }, { "entropy": 5.335866498947143, "epoch": 5.029566232250535, "grad_norm": 1.1953125, "learning_rate": 0.00027564300075792026, "loss": 4.6587, "mean_token_accuracy": 0.2302749916911125, "num_tokens": 112135178.0, "step": 64645 }, { "entropy": 5.377702140808106, "epoch": 5.029955261622252, "grad_norm": 1.25, "learning_rate": 0.00027561528527865215, "loss": 4.6622, "mean_token_accuracy": 0.24113797545433044, "num_tokens": 112143792.0, "step": 64650 }, { "entropy": 5.344615173339844, "epoch": 5.03034429099397, "grad_norm": 1.296875, "learning_rate": 0.0002755875697900481, "loss": 4.6074, "mean_token_accuracy": 0.23290932476520537, "num_tokens": 112152160.0, "step": 64655 }, { "entropy": 5.395511770248413, "epoch": 5.030733320365687, "grad_norm": 1.125, "learning_rate": 0.00027555985429252857, "loss": 4.7694, "mean_token_accuracy": 0.23126326501369476, "num_tokens": 112161223.0, "step": 64660 }, { "entropy": 5.353583240509034, "epoch": 5.031122349737405, "grad_norm": 1.28125, "learning_rate": 0.0002755321387865141, "loss": 4.6049, "mean_token_accuracy": 0.24054396897554398, "num_tokens": 112169031.0, "step": 64665 }, { "entropy": 5.3820137023925785, "epoch": 5.031511379109123, "grad_norm": 1.25, "learning_rate": 0.0002755044232724253, "loss": 4.6492, "mean_token_accuracy": 0.2416839987039566, "num_tokens": 112177481.0, "step": 64670 }, { "entropy": 5.321760463714599, "epoch": 5.0319004084808405, "grad_norm": 1.203125, "learning_rate": 0.00027547670775068274, "loss": 4.6423, "mean_token_accuracy": 0.23692483752965926, "num_tokens": 112185494.0, "step": 64675 }, { "entropy": 5.310522651672363, "epoch": 5.032289437852558, "grad_norm": 1.203125, "learning_rate": 0.00027544899222170684, "loss": 4.681, "mean_token_accuracy": 0.23392193466424943, "num_tokens": 112194110.0, "step": 64680 }, { "entropy": 5.31445198059082, "epoch": 5.032678467224275, "grad_norm": 1.1796875, "learning_rate": 0.00027542127668591824, "loss": 4.6469, "mean_token_accuracy": 0.23335846215486528, "num_tokens": 112204135.0, "step": 64685 }, { "entropy": 5.364391708374024, "epoch": 5.033067496595993, "grad_norm": 1.2109375, "learning_rate": 0.0002753935611437374, "loss": 4.6408, "mean_token_accuracy": 0.22939473539590835, "num_tokens": 112212610.0, "step": 64690 }, { "entropy": 5.372741413116455, "epoch": 5.03345652596771, "grad_norm": 1.125, "learning_rate": 0.00027536584559558494, "loss": 4.733, "mean_token_accuracy": 0.22856444865465164, "num_tokens": 112222095.0, "step": 64695 }, { "entropy": 5.3948705196380615, "epoch": 5.033845555339428, "grad_norm": 1.1875, "learning_rate": 0.0002753381300418813, "loss": 4.6953, "mean_token_accuracy": 0.23481495529413224, "num_tokens": 112230699.0, "step": 64700 }, { "entropy": 5.31956262588501, "epoch": 5.034234584711146, "grad_norm": 1.1875, "learning_rate": 0.0002753104144830471, "loss": 4.6664, "mean_token_accuracy": 0.23793037831783295, "num_tokens": 112240462.0, "step": 64705 }, { "entropy": 5.333866310119629, "epoch": 5.0346236140828635, "grad_norm": 1.234375, "learning_rate": 0.00027528269891950285, "loss": 4.6705, "mean_token_accuracy": 0.22964534759521485, "num_tokens": 112249237.0, "step": 64710 }, { "entropy": 5.405124282836914, "epoch": 5.035012643454581, "grad_norm": 1.2578125, "learning_rate": 0.0002752549833516691, "loss": 4.7483, "mean_token_accuracy": 0.22826498597860337, "num_tokens": 112258498.0, "step": 64715 }, { "entropy": 5.457015609741211, "epoch": 5.035401672826298, "grad_norm": 1.171875, "learning_rate": 0.0002752272677799664, "loss": 4.6826, "mean_token_accuracy": 0.2325483113527298, "num_tokens": 112266749.0, "step": 64720 }, { "entropy": 5.365266418457031, "epoch": 5.035790702198016, "grad_norm": 1.1796875, "learning_rate": 0.00027519955220481525, "loss": 4.6682, "mean_token_accuracy": 0.23372434377670287, "num_tokens": 112275871.0, "step": 64725 }, { "entropy": 5.3376555919647215, "epoch": 5.036179731569733, "grad_norm": 1.234375, "learning_rate": 0.0002751718366266362, "loss": 4.7062, "mean_token_accuracy": 0.2284228429198265, "num_tokens": 112284371.0, "step": 64730 }, { "entropy": 5.420383071899414, "epoch": 5.036568760941451, "grad_norm": 1.25, "learning_rate": 0.0002751441210458498, "loss": 4.7812, "mean_token_accuracy": 0.22827626913785934, "num_tokens": 112293481.0, "step": 64735 }, { "entropy": 5.485768175125122, "epoch": 5.036957790313169, "grad_norm": 1.3671875, "learning_rate": 0.00027511640546287665, "loss": 4.7898, "mean_token_accuracy": 0.21717797815799714, "num_tokens": 112301482.0, "step": 64740 }, { "entropy": 5.411526775360107, "epoch": 5.0373468196848865, "grad_norm": 1.2109375, "learning_rate": 0.0002750886898781372, "loss": 4.6733, "mean_token_accuracy": 0.23777484893798828, "num_tokens": 112309687.0, "step": 64745 }, { "entropy": 5.335828590393066, "epoch": 5.037735849056604, "grad_norm": 1.1875, "learning_rate": 0.000275060974292052, "loss": 4.6842, "mean_token_accuracy": 0.23297895938158036, "num_tokens": 112318351.0, "step": 64750 }, { "entropy": 5.378765439987182, "epoch": 5.038124878428321, "grad_norm": 1.1640625, "learning_rate": 0.0002750332587050416, "loss": 4.7215, "mean_token_accuracy": 0.2273263469338417, "num_tokens": 112327937.0, "step": 64755 }, { "entropy": 5.484892416000366, "epoch": 5.038513907800039, "grad_norm": 1.1328125, "learning_rate": 0.0002750055431175266, "loss": 4.836, "mean_token_accuracy": 0.22341853827238084, "num_tokens": 112337336.0, "step": 64760 }, { "entropy": 5.449134349822998, "epoch": 5.038902937171756, "grad_norm": 1.1953125, "learning_rate": 0.00027497782752992743, "loss": 4.6902, "mean_token_accuracy": 0.23522359728813172, "num_tokens": 112345486.0, "step": 64765 }, { "entropy": 5.424623155593872, "epoch": 5.039291966543474, "grad_norm": 1.21875, "learning_rate": 0.0002749501119426647, "loss": 4.668, "mean_token_accuracy": 0.23256232887506484, "num_tokens": 112354642.0, "step": 64770 }, { "entropy": 5.3984095573425295, "epoch": 5.039680995915192, "grad_norm": 1.25, "learning_rate": 0.00027492239635615903, "loss": 4.7035, "mean_token_accuracy": 0.2291734039783478, "num_tokens": 112362979.0, "step": 64775 }, { "entropy": 5.329232931137085, "epoch": 5.0400700252869095, "grad_norm": 1.1796875, "learning_rate": 0.0002748946807708308, "loss": 4.5869, "mean_token_accuracy": 0.24202586561441422, "num_tokens": 112371710.0, "step": 64780 }, { "entropy": 5.290570163726807, "epoch": 5.040459054658626, "grad_norm": 1.234375, "learning_rate": 0.0002748669651871006, "loss": 4.5967, "mean_token_accuracy": 0.24343384355306624, "num_tokens": 112380174.0, "step": 64785 }, { "entropy": 5.45467848777771, "epoch": 5.040848084030344, "grad_norm": 1.1875, "learning_rate": 0.00027483924960538907, "loss": 4.8011, "mean_token_accuracy": 0.22138925790786743, "num_tokens": 112388531.0, "step": 64790 }, { "entropy": 5.4193531513214115, "epoch": 5.041237113402062, "grad_norm": 1.234375, "learning_rate": 0.00027481153402611664, "loss": 4.6948, "mean_token_accuracy": 0.2288118839263916, "num_tokens": 112397586.0, "step": 64795 }, { "entropy": 5.419966173171997, "epoch": 5.041626142773779, "grad_norm": 1.171875, "learning_rate": 0.00027478381844970386, "loss": 4.7385, "mean_token_accuracy": 0.23690458089113237, "num_tokens": 112406459.0, "step": 64800 }, { "entropy": 5.423429107666015, "epoch": 5.042015172145497, "grad_norm": 1.2734375, "learning_rate": 0.0002747561028765713, "loss": 4.7269, "mean_token_accuracy": 0.22894801795482636, "num_tokens": 112415010.0, "step": 64805 }, { "entropy": 5.505279207229615, "epoch": 5.042404201517215, "grad_norm": 1.359375, "learning_rate": 0.00027472838730713956, "loss": 4.7615, "mean_token_accuracy": 0.2295281931757927, "num_tokens": 112424209.0, "step": 64810 }, { "entropy": 5.381301164627075, "epoch": 5.0427932308889325, "grad_norm": 1.265625, "learning_rate": 0.00027470067174182905, "loss": 4.6349, "mean_token_accuracy": 0.23473345935344697, "num_tokens": 112432449.0, "step": 64815 }, { "entropy": 5.3743537902832035, "epoch": 5.043182260260649, "grad_norm": 1.265625, "learning_rate": 0.0002746729561810604, "loss": 4.7099, "mean_token_accuracy": 0.23365440219640732, "num_tokens": 112440919.0, "step": 64820 }, { "entropy": 5.331893825531006, "epoch": 5.043571289632367, "grad_norm": 1.234375, "learning_rate": 0.00027464524062525405, "loss": 4.6665, "mean_token_accuracy": 0.23441773205995559, "num_tokens": 112449843.0, "step": 64825 }, { "entropy": 5.529669141769409, "epoch": 5.043960319004085, "grad_norm": 1.203125, "learning_rate": 0.0002746175250748306, "loss": 4.8027, "mean_token_accuracy": 0.2144353449344635, "num_tokens": 112459361.0, "step": 64830 }, { "entropy": 5.446399259567261, "epoch": 5.044349348375802, "grad_norm": 1.1796875, "learning_rate": 0.0002745898095302106, "loss": 4.7635, "mean_token_accuracy": 0.22380660474300385, "num_tokens": 112469496.0, "step": 64835 }, { "entropy": 5.403471231460571, "epoch": 5.04473837774752, "grad_norm": 1.328125, "learning_rate": 0.00027456209399181466, "loss": 4.6529, "mean_token_accuracy": 0.23784971237182617, "num_tokens": 112477886.0, "step": 64840 }, { "entropy": 5.345551586151123, "epoch": 5.045127407119238, "grad_norm": 1.15625, "learning_rate": 0.00027453437846006325, "loss": 4.7229, "mean_token_accuracy": 0.22638411521911622, "num_tokens": 112486993.0, "step": 64845 }, { "entropy": 5.504258251190185, "epoch": 5.0455164364909555, "grad_norm": 1.1875, "learning_rate": 0.00027450666293537683, "loss": 4.7581, "mean_token_accuracy": 0.2275029182434082, "num_tokens": 112495560.0, "step": 64850 }, { "entropy": 5.343051719665527, "epoch": 5.045905465862672, "grad_norm": 1.296875, "learning_rate": 0.000274478947418176, "loss": 4.6575, "mean_token_accuracy": 0.2371336653828621, "num_tokens": 112504104.0, "step": 64855 }, { "entropy": 5.413698434829712, "epoch": 5.04629449523439, "grad_norm": 1.2265625, "learning_rate": 0.0002744512319088814, "loss": 4.814, "mean_token_accuracy": 0.2279406428337097, "num_tokens": 112512453.0, "step": 64860 }, { "entropy": 5.41165828704834, "epoch": 5.046683524606108, "grad_norm": 1.328125, "learning_rate": 0.0002744235164079135, "loss": 4.7538, "mean_token_accuracy": 0.2235019952058792, "num_tokens": 112520734.0, "step": 64865 }, { "entropy": 5.38701696395874, "epoch": 5.047072553977825, "grad_norm": 1.2265625, "learning_rate": 0.0002743958009156928, "loss": 4.7143, "mean_token_accuracy": 0.2301914468407631, "num_tokens": 112529235.0, "step": 64870 }, { "entropy": 5.322866678237915, "epoch": 5.047461583349543, "grad_norm": 1.2265625, "learning_rate": 0.0002743680854326398, "loss": 4.636, "mean_token_accuracy": 0.23839350640773774, "num_tokens": 112538244.0, "step": 64875 }, { "entropy": 5.352987384796142, "epoch": 5.047850612721261, "grad_norm": 1.15625, "learning_rate": 0.0002743403699591751, "loss": 4.6793, "mean_token_accuracy": 0.2254127651453018, "num_tokens": 112546341.0, "step": 64880 }, { "entropy": 5.454830265045166, "epoch": 5.048239642092978, "grad_norm": 1.1953125, "learning_rate": 0.00027431265449571937, "loss": 4.7723, "mean_token_accuracy": 0.2201244443655014, "num_tokens": 112554820.0, "step": 64885 }, { "entropy": 5.421988534927368, "epoch": 5.048628671464695, "grad_norm": 1.1875, "learning_rate": 0.00027428493904269285, "loss": 4.713, "mean_token_accuracy": 0.22906819730997086, "num_tokens": 112563071.0, "step": 64890 }, { "entropy": 5.397017478942871, "epoch": 5.049017700836413, "grad_norm": 1.1796875, "learning_rate": 0.0002742572236005164, "loss": 4.6691, "mean_token_accuracy": 0.2386128529906273, "num_tokens": 112572121.0, "step": 64895 }, { "entropy": 5.374479722976685, "epoch": 5.049406730208131, "grad_norm": 1.234375, "learning_rate": 0.00027422950816961025, "loss": 4.6976, "mean_token_accuracy": 0.23231341391801835, "num_tokens": 112580812.0, "step": 64900 }, { "entropy": 5.417215061187744, "epoch": 5.049795759579848, "grad_norm": 1.2421875, "learning_rate": 0.000274201792750395, "loss": 4.7232, "mean_token_accuracy": 0.22661048024892808, "num_tokens": 112589196.0, "step": 64905 }, { "entropy": 5.360439968109131, "epoch": 5.050184788951566, "grad_norm": 1.234375, "learning_rate": 0.0002741740773432914, "loss": 4.6688, "mean_token_accuracy": 0.2244074523448944, "num_tokens": 112597741.0, "step": 64910 }, { "entropy": 5.319122266769409, "epoch": 5.050573818323284, "grad_norm": 1.234375, "learning_rate": 0.0002741463619487199, "loss": 4.5822, "mean_token_accuracy": 0.25064396262168886, "num_tokens": 112605755.0, "step": 64915 }, { "entropy": 5.383066082000733, "epoch": 5.050962847695001, "grad_norm": 1.1796875, "learning_rate": 0.0002741186465671011, "loss": 4.7315, "mean_token_accuracy": 0.23073919862508774, "num_tokens": 112615068.0, "step": 64920 }, { "entropy": 5.438505744934082, "epoch": 5.051351877066718, "grad_norm": 1.1484375, "learning_rate": 0.0002740909311988553, "loss": 4.819, "mean_token_accuracy": 0.22049048393964768, "num_tokens": 112624507.0, "step": 64925 }, { "entropy": 5.39831314086914, "epoch": 5.051740906438436, "grad_norm": 1.25, "learning_rate": 0.0002740632158444031, "loss": 4.6433, "mean_token_accuracy": 0.24046834260225297, "num_tokens": 112632276.0, "step": 64930 }, { "entropy": 5.400159549713135, "epoch": 5.052129935810154, "grad_norm": 1.3984375, "learning_rate": 0.0002740355005041652, "loss": 4.7268, "mean_token_accuracy": 0.23603378236293793, "num_tokens": 112641333.0, "step": 64935 }, { "entropy": 5.357839870452881, "epoch": 5.052518965181871, "grad_norm": 1.171875, "learning_rate": 0.0002740077851785621, "loss": 4.5922, "mean_token_accuracy": 0.23776448667049407, "num_tokens": 112649807.0, "step": 64940 }, { "entropy": 5.367248630523681, "epoch": 5.052907994553589, "grad_norm": 1.1875, "learning_rate": 0.00027398006986801415, "loss": 4.7497, "mean_token_accuracy": 0.23069133162498473, "num_tokens": 112658794.0, "step": 64945 }, { "entropy": 5.328583240509033, "epoch": 5.053297023925307, "grad_norm": 1.2734375, "learning_rate": 0.0002739523545729421, "loss": 4.5711, "mean_token_accuracy": 0.24034045040607452, "num_tokens": 112667748.0, "step": 64950 }, { "entropy": 5.442044496536255, "epoch": 5.053686053297024, "grad_norm": 1.3203125, "learning_rate": 0.0002739246392937664, "loss": 4.7749, "mean_token_accuracy": 0.22431700527668, "num_tokens": 112675750.0, "step": 64955 }, { "entropy": 5.436061525344849, "epoch": 5.054075082668741, "grad_norm": 1.171875, "learning_rate": 0.00027389692403090754, "loss": 4.7306, "mean_token_accuracy": 0.23467322438955307, "num_tokens": 112683997.0, "step": 64960 }, { "entropy": 5.26345911026001, "epoch": 5.054464112040459, "grad_norm": 1.2421875, "learning_rate": 0.00027386920878478616, "loss": 4.5149, "mean_token_accuracy": 0.2488034784793854, "num_tokens": 112692664.0, "step": 64965 }, { "entropy": 5.322584772109986, "epoch": 5.054853141412177, "grad_norm": 1.265625, "learning_rate": 0.00027384149355582266, "loss": 4.6581, "mean_token_accuracy": 0.2341347649693489, "num_tokens": 112701265.0, "step": 64970 }, { "entropy": 5.436297416687012, "epoch": 5.055242170783894, "grad_norm": 1.265625, "learning_rate": 0.0002738137783444377, "loss": 4.7608, "mean_token_accuracy": 0.23288995921611785, "num_tokens": 112709657.0, "step": 64975 }, { "entropy": 5.34898738861084, "epoch": 5.055631200155612, "grad_norm": 1.125, "learning_rate": 0.00027378606315105175, "loss": 4.6874, "mean_token_accuracy": 0.23395895212888718, "num_tokens": 112718782.0, "step": 64980 }, { "entropy": 5.392288494110107, "epoch": 5.056020229527329, "grad_norm": 1.21875, "learning_rate": 0.0002737583479760854, "loss": 4.809, "mean_token_accuracy": 0.2315194472670555, "num_tokens": 112727564.0, "step": 64985 }, { "entropy": 5.466008520126342, "epoch": 5.056409258899047, "grad_norm": 1.234375, "learning_rate": 0.0002737306328199591, "loss": 4.7463, "mean_token_accuracy": 0.22870464622974396, "num_tokens": 112735916.0, "step": 64990 }, { "entropy": 5.410093593597412, "epoch": 5.056798288270764, "grad_norm": 1.21875, "learning_rate": 0.00027370291768309354, "loss": 4.6586, "mean_token_accuracy": 0.23945223838090895, "num_tokens": 112744995.0, "step": 64995 }, { "entropy": 5.35861029624939, "epoch": 5.057187317642482, "grad_norm": 1.21875, "learning_rate": 0.000273675202565909, "loss": 4.7128, "mean_token_accuracy": 0.2328049585223198, "num_tokens": 112753342.0, "step": 65000 }, { "entropy": 5.372970867156982, "epoch": 5.0575763470142, "grad_norm": 1.234375, "learning_rate": 0.00027364748746882623, "loss": 4.6495, "mean_token_accuracy": 0.2309429958462715, "num_tokens": 112761341.0, "step": 65005 }, { "entropy": 5.42521333694458, "epoch": 5.057965376385917, "grad_norm": 1.2578125, "learning_rate": 0.00027361977239226566, "loss": 4.7348, "mean_token_accuracy": 0.23603052496910096, "num_tokens": 112770373.0, "step": 65010 }, { "entropy": 5.380546712875367, "epoch": 5.058354405757635, "grad_norm": 1.1328125, "learning_rate": 0.0002735920573366478, "loss": 4.709, "mean_token_accuracy": 0.2269685983657837, "num_tokens": 112779362.0, "step": 65015 }, { "entropy": 5.356908655166626, "epoch": 5.058743435129352, "grad_norm": 1.21875, "learning_rate": 0.0002735643423023933, "loss": 4.6269, "mean_token_accuracy": 0.23911878019571303, "num_tokens": 112787402.0, "step": 65020 }, { "entropy": 5.519896221160889, "epoch": 5.05913246450107, "grad_norm": 1.2109375, "learning_rate": 0.0002735366272899226, "loss": 4.7903, "mean_token_accuracy": 0.2192848339676857, "num_tokens": 112796505.0, "step": 65025 }, { "entropy": 5.463559675216675, "epoch": 5.059521493872787, "grad_norm": 1.1875, "learning_rate": 0.00027350891229965623, "loss": 4.7898, "mean_token_accuracy": 0.2208764836192131, "num_tokens": 112805333.0, "step": 65030 }, { "entropy": 5.3769806861877445, "epoch": 5.059910523244505, "grad_norm": 1.2421875, "learning_rate": 0.0002734811973320147, "loss": 4.6343, "mean_token_accuracy": 0.24255779832601548, "num_tokens": 112813661.0, "step": 65035 }, { "entropy": 5.279697418212891, "epoch": 5.060299552616223, "grad_norm": 1.2734375, "learning_rate": 0.00027345348238741864, "loss": 4.5951, "mean_token_accuracy": 0.24546021968126297, "num_tokens": 112822053.0, "step": 65040 }, { "entropy": 5.304648065567017, "epoch": 5.06068858198794, "grad_norm": 1.15625, "learning_rate": 0.00027342576746628854, "loss": 4.6234, "mean_token_accuracy": 0.2434864327311516, "num_tokens": 112831009.0, "step": 65045 }, { "entropy": 5.364735317230225, "epoch": 5.061077611359658, "grad_norm": 1.25, "learning_rate": 0.0002733980525690449, "loss": 4.6682, "mean_token_accuracy": 0.23628709465265274, "num_tokens": 112839648.0, "step": 65050 }, { "entropy": 5.45759015083313, "epoch": 5.061466640731375, "grad_norm": 1.234375, "learning_rate": 0.00027337033769610827, "loss": 4.7636, "mean_token_accuracy": 0.22799090296030045, "num_tokens": 112848645.0, "step": 65055 }, { "entropy": 5.39937539100647, "epoch": 5.061855670103093, "grad_norm": 1.2578125, "learning_rate": 0.0002733426228478991, "loss": 4.6222, "mean_token_accuracy": 0.2395276427268982, "num_tokens": 112856610.0, "step": 65060 }, { "entropy": 5.31654920578003, "epoch": 5.06224469947481, "grad_norm": 1.140625, "learning_rate": 0.0002733149080248381, "loss": 4.6494, "mean_token_accuracy": 0.23598543852567672, "num_tokens": 112865604.0, "step": 65065 }, { "entropy": 5.351459407806397, "epoch": 5.062633728846528, "grad_norm": 1.2265625, "learning_rate": 0.0002732871932273456, "loss": 4.6582, "mean_token_accuracy": 0.23824625462293625, "num_tokens": 112874135.0, "step": 65070 }, { "entropy": 5.466893672943115, "epoch": 5.063022758218246, "grad_norm": 1.2890625, "learning_rate": 0.0002732594784558423, "loss": 4.7951, "mean_token_accuracy": 0.22274016886949538, "num_tokens": 112882914.0, "step": 65075 }, { "entropy": 5.40595965385437, "epoch": 5.063411787589963, "grad_norm": 1.1796875, "learning_rate": 0.0002732317637107486, "loss": 4.7132, "mean_token_accuracy": 0.2303855001926422, "num_tokens": 112892385.0, "step": 65080 }, { "entropy": 5.481871557235718, "epoch": 5.063800816961681, "grad_norm": 1.2734375, "learning_rate": 0.00027320404899248507, "loss": 4.7562, "mean_token_accuracy": 0.23073528707027435, "num_tokens": 112901279.0, "step": 65085 }, { "entropy": 5.504454040527344, "epoch": 5.064189846333398, "grad_norm": 1.203125, "learning_rate": 0.0002731763343014722, "loss": 4.9156, "mean_token_accuracy": 0.21177886724472045, "num_tokens": 112911068.0, "step": 65090 }, { "entropy": 5.389797019958496, "epoch": 5.064578875705116, "grad_norm": 1.1640625, "learning_rate": 0.00027314861963813065, "loss": 4.7077, "mean_token_accuracy": 0.23947293907403946, "num_tokens": 112920301.0, "step": 65095 }, { "entropy": 5.4264328956604, "epoch": 5.064967905076833, "grad_norm": 1.25, "learning_rate": 0.00027312090500288065, "loss": 4.6787, "mean_token_accuracy": 0.23058042526245118, "num_tokens": 112929139.0, "step": 65100 }, { "entropy": 5.384863758087159, "epoch": 5.065356934448551, "grad_norm": 1.125, "learning_rate": 0.0002730931903961431, "loss": 4.7021, "mean_token_accuracy": 0.22919297367334365, "num_tokens": 112938609.0, "step": 65105 }, { "entropy": 5.383109092712402, "epoch": 5.065745963820269, "grad_norm": 1.2421875, "learning_rate": 0.00027306547581833836, "loss": 4.7303, "mean_token_accuracy": 0.23381359577178956, "num_tokens": 112946881.0, "step": 65110 }, { "entropy": 5.427600622177124, "epoch": 5.066134993191986, "grad_norm": 1.2109375, "learning_rate": 0.00027303776126988687, "loss": 4.7089, "mean_token_accuracy": 0.22714405953884126, "num_tokens": 112955286.0, "step": 65115 }, { "entropy": 5.396959447860718, "epoch": 5.066524022563703, "grad_norm": 1.2109375, "learning_rate": 0.00027301004675120926, "loss": 4.6582, "mean_token_accuracy": 0.2346645712852478, "num_tokens": 112963778.0, "step": 65120 }, { "entropy": 5.3928210735321045, "epoch": 5.066913051935421, "grad_norm": 1.3203125, "learning_rate": 0.0002729823322627261, "loss": 4.7172, "mean_token_accuracy": 0.23274625539779664, "num_tokens": 112972434.0, "step": 65125 }, { "entropy": 5.357746934890747, "epoch": 5.0673020813071386, "grad_norm": 1.3359375, "learning_rate": 0.0002729546178048577, "loss": 4.6821, "mean_token_accuracy": 0.23654775470495223, "num_tokens": 112980342.0, "step": 65130 }, { "entropy": 5.521769857406616, "epoch": 5.067691110678856, "grad_norm": 1.203125, "learning_rate": 0.0002729269033780248, "loss": 4.8674, "mean_token_accuracy": 0.22088621109724044, "num_tokens": 112990387.0, "step": 65135 }, { "entropy": 5.366834115982056, "epoch": 5.068080140050574, "grad_norm": 1.21875, "learning_rate": 0.00027289918898264784, "loss": 4.6231, "mean_token_accuracy": 0.23591775000095366, "num_tokens": 112999166.0, "step": 65140 }, { "entropy": 5.44498839378357, "epoch": 5.068469169422292, "grad_norm": 1.2734375, "learning_rate": 0.0002728714746191473, "loss": 4.759, "mean_token_accuracy": 0.2263491556048393, "num_tokens": 113007604.0, "step": 65145 }, { "entropy": 5.435696029663086, "epoch": 5.068858198794009, "grad_norm": 1.3125, "learning_rate": 0.00027284376028794376, "loss": 4.725, "mean_token_accuracy": 0.23516846299171448, "num_tokens": 113015265.0, "step": 65150 }, { "entropy": 5.4280181407928465, "epoch": 5.069247228165726, "grad_norm": 1.359375, "learning_rate": 0.00027281604598945774, "loss": 4.7268, "mean_token_accuracy": 0.2252932757139206, "num_tokens": 113023541.0, "step": 65155 }, { "entropy": 5.355860853195191, "epoch": 5.069636257537444, "grad_norm": 1.203125, "learning_rate": 0.0002727883317241098, "loss": 4.6716, "mean_token_accuracy": 0.24173108041286467, "num_tokens": 113032726.0, "step": 65160 }, { "entropy": 5.357446765899658, "epoch": 5.0700252869091615, "grad_norm": 1.15625, "learning_rate": 0.00027276061749232034, "loss": 4.6673, "mean_token_accuracy": 0.23370827734470367, "num_tokens": 113041418.0, "step": 65165 }, { "entropy": 5.371289491653442, "epoch": 5.070414316280879, "grad_norm": 1.171875, "learning_rate": 0.0002727329032945099, "loss": 4.6632, "mean_token_accuracy": 0.2274712309241295, "num_tokens": 113050097.0, "step": 65170 }, { "entropy": 5.4087423324584964, "epoch": 5.070803345652597, "grad_norm": 1.2734375, "learning_rate": 0.0002727051891310991, "loss": 4.712, "mean_token_accuracy": 0.23062759190797805, "num_tokens": 113058010.0, "step": 65175 }, { "entropy": 5.38252592086792, "epoch": 5.071192375024315, "grad_norm": 1.28125, "learning_rate": 0.0002726774750025084, "loss": 4.7098, "mean_token_accuracy": 0.2291048213839531, "num_tokens": 113066307.0, "step": 65180 }, { "entropy": 5.402387189865112, "epoch": 5.071581404396032, "grad_norm": 1.15625, "learning_rate": 0.00027264976090915835, "loss": 4.7185, "mean_token_accuracy": 0.22869402319192886, "num_tokens": 113074653.0, "step": 65185 }, { "entropy": 5.326604843139648, "epoch": 5.071970433767749, "grad_norm": 1.1953125, "learning_rate": 0.0002726220468514694, "loss": 4.6287, "mean_token_accuracy": 0.2319682404398918, "num_tokens": 113082505.0, "step": 65190 }, { "entropy": 5.336994791030884, "epoch": 5.072359463139467, "grad_norm": 1.1015625, "learning_rate": 0.0002725943328298621, "loss": 4.6523, "mean_token_accuracy": 0.24229722768068312, "num_tokens": 113091262.0, "step": 65195 }, { "entropy": 5.43653359413147, "epoch": 5.0727484925111845, "grad_norm": 1.296875, "learning_rate": 0.000272566618844757, "loss": 4.7382, "mean_token_accuracy": 0.23399693369865418, "num_tokens": 113100122.0, "step": 65200 }, { "entropy": 5.354515600204468, "epoch": 5.073137521882902, "grad_norm": 1.2890625, "learning_rate": 0.00027253890489657457, "loss": 4.6275, "mean_token_accuracy": 0.2403170570731163, "num_tokens": 113108502.0, "step": 65205 }, { "entropy": 5.3438811779022215, "epoch": 5.07352655125462, "grad_norm": 1.1484375, "learning_rate": 0.00027251119098573533, "loss": 4.6775, "mean_token_accuracy": 0.23231572657823563, "num_tokens": 113117791.0, "step": 65210 }, { "entropy": 5.3999104499816895, "epoch": 5.073915580626338, "grad_norm": 1.25, "learning_rate": 0.00027248347711265983, "loss": 4.7369, "mean_token_accuracy": 0.22982853055000305, "num_tokens": 113126387.0, "step": 65215 }, { "entropy": 5.368460369110108, "epoch": 5.074304609998054, "grad_norm": 1.234375, "learning_rate": 0.0002724557632777686, "loss": 4.7231, "mean_token_accuracy": 0.2350810706615448, "num_tokens": 113134856.0, "step": 65220 }, { "entropy": 5.325463533401489, "epoch": 5.074693639369772, "grad_norm": 1.1640625, "learning_rate": 0.00027242804948148197, "loss": 4.593, "mean_token_accuracy": 0.24041689038276673, "num_tokens": 113143431.0, "step": 65225 }, { "entropy": 5.397089242935181, "epoch": 5.07508266874149, "grad_norm": 1.1875, "learning_rate": 0.0002724003357242207, "loss": 4.6766, "mean_token_accuracy": 0.23118810951709748, "num_tokens": 113151471.0, "step": 65230 }, { "entropy": 5.38531002998352, "epoch": 5.0754716981132075, "grad_norm": 1.1875, "learning_rate": 0.0002723726220064051, "loss": 4.7356, "mean_token_accuracy": 0.22910382747650146, "num_tokens": 113160486.0, "step": 65235 }, { "entropy": 5.378416967391968, "epoch": 5.075860727484925, "grad_norm": 1.2578125, "learning_rate": 0.0002723449083284559, "loss": 4.604, "mean_token_accuracy": 0.2464513823390007, "num_tokens": 113168141.0, "step": 65240 }, { "entropy": 5.363914918899536, "epoch": 5.076249756856643, "grad_norm": 1.2890625, "learning_rate": 0.00027231719469079344, "loss": 4.7157, "mean_token_accuracy": 0.2285948872566223, "num_tokens": 113177185.0, "step": 65245 }, { "entropy": 5.381011819839477, "epoch": 5.076638786228361, "grad_norm": 1.234375, "learning_rate": 0.00027228948109383826, "loss": 4.6883, "mean_token_accuracy": 0.23764241188764573, "num_tokens": 113185557.0, "step": 65250 }, { "entropy": 5.366472244262695, "epoch": 5.077027815600077, "grad_norm": 1.1796875, "learning_rate": 0.00027226176753801095, "loss": 4.6643, "mean_token_accuracy": 0.2350686401128769, "num_tokens": 113194235.0, "step": 65255 }, { "entropy": 5.368444204330444, "epoch": 5.077416844971795, "grad_norm": 1.1953125, "learning_rate": 0.00027223405402373194, "loss": 4.7636, "mean_token_accuracy": 0.22911095768213272, "num_tokens": 113203843.0, "step": 65260 }, { "entropy": 5.346606731414795, "epoch": 5.077805874343513, "grad_norm": 1.328125, "learning_rate": 0.00027220634055142174, "loss": 4.682, "mean_token_accuracy": 0.23661319613456727, "num_tokens": 113212229.0, "step": 65265 }, { "entropy": 5.415178871154785, "epoch": 5.0781949037152305, "grad_norm": 1.21875, "learning_rate": 0.0002721786271215009, "loss": 4.8116, "mean_token_accuracy": 0.21662216782569885, "num_tokens": 113220577.0, "step": 65270 }, { "entropy": 5.301629161834716, "epoch": 5.078583933086948, "grad_norm": 1.375, "learning_rate": 0.0002721509137343899, "loss": 4.5159, "mean_token_accuracy": 0.24785857349634172, "num_tokens": 113228445.0, "step": 65275 }, { "entropy": 5.333738899230957, "epoch": 5.078972962458666, "grad_norm": 1.234375, "learning_rate": 0.00027212320039050924, "loss": 4.599, "mean_token_accuracy": 0.2419826328754425, "num_tokens": 113236988.0, "step": 65280 }, { "entropy": 5.380702638626099, "epoch": 5.079361991830384, "grad_norm": 1.2421875, "learning_rate": 0.00027209548709027944, "loss": 4.7219, "mean_token_accuracy": 0.22917523980140686, "num_tokens": 113245655.0, "step": 65285 }, { "entropy": 5.335486555099488, "epoch": 5.0797510212021, "grad_norm": 1.171875, "learning_rate": 0.000272067773834121, "loss": 4.695, "mean_token_accuracy": 0.22945841401815414, "num_tokens": 113254900.0, "step": 65290 }, { "entropy": 5.298296976089477, "epoch": 5.080140050573818, "grad_norm": 1.328125, "learning_rate": 0.0002720400606224544, "loss": 4.5718, "mean_token_accuracy": 0.23297424912452697, "num_tokens": 113262983.0, "step": 65295 }, { "entropy": 5.412521028518677, "epoch": 5.080529079945536, "grad_norm": 1.203125, "learning_rate": 0.00027201234745570014, "loss": 4.786, "mean_token_accuracy": 0.21966168880462647, "num_tokens": 113271704.0, "step": 65300 }, { "entropy": 5.358068656921387, "epoch": 5.0809181093172535, "grad_norm": 1.2109375, "learning_rate": 0.0002719846343342788, "loss": 4.6154, "mean_token_accuracy": 0.23228641003370284, "num_tokens": 113280564.0, "step": 65305 }, { "entropy": 5.348234415054321, "epoch": 5.081307138688971, "grad_norm": 1.3203125, "learning_rate": 0.0002719569212586108, "loss": 4.5945, "mean_token_accuracy": 0.24256988763809204, "num_tokens": 113288462.0, "step": 65310 }, { "entropy": 5.337446546554565, "epoch": 5.081696168060689, "grad_norm": 1.3359375, "learning_rate": 0.0002719292082291167, "loss": 4.7182, "mean_token_accuracy": 0.23657677173614503, "num_tokens": 113296554.0, "step": 65315 }, { "entropy": 5.418079853057861, "epoch": 5.082085197432406, "grad_norm": 1.1875, "learning_rate": 0.000271901495246217, "loss": 4.7363, "mean_token_accuracy": 0.2304416850209236, "num_tokens": 113305359.0, "step": 65320 }, { "entropy": 5.430291318893433, "epoch": 5.082474226804123, "grad_norm": 1.234375, "learning_rate": 0.0002718737823103322, "loss": 4.7093, "mean_token_accuracy": 0.2349811926484108, "num_tokens": 113313902.0, "step": 65325 }, { "entropy": 5.367583560943603, "epoch": 5.082863256175841, "grad_norm": 1.21875, "learning_rate": 0.00027184606942188275, "loss": 4.6627, "mean_token_accuracy": 0.23261507153511046, "num_tokens": 113322150.0, "step": 65330 }, { "entropy": 5.370856618881225, "epoch": 5.083252285547559, "grad_norm": 1.2265625, "learning_rate": 0.00027181835658128913, "loss": 4.6895, "mean_token_accuracy": 0.24248858243227006, "num_tokens": 113331066.0, "step": 65335 }, { "entropy": 5.417171812057495, "epoch": 5.0836413149192765, "grad_norm": 1.234375, "learning_rate": 0.0002717906437889719, "loss": 4.8017, "mean_token_accuracy": 0.23062849491834642, "num_tokens": 113339795.0, "step": 65340 }, { "entropy": 5.418705415725708, "epoch": 5.084030344290994, "grad_norm": 1.2734375, "learning_rate": 0.00027176293104535154, "loss": 4.698, "mean_token_accuracy": 0.23209146708250045, "num_tokens": 113348153.0, "step": 65345 }, { "entropy": 5.344709396362305, "epoch": 5.084419373662712, "grad_norm": 1.203125, "learning_rate": 0.00027173521835084863, "loss": 4.6283, "mean_token_accuracy": 0.24109508246183395, "num_tokens": 113356887.0, "step": 65350 }, { "entropy": 5.311906099319458, "epoch": 5.084808403034429, "grad_norm": 1.3046875, "learning_rate": 0.0002717075057058835, "loss": 4.5629, "mean_token_accuracy": 0.2501395508646965, "num_tokens": 113364883.0, "step": 65355 }, { "entropy": 5.401915597915649, "epoch": 5.085197432406146, "grad_norm": 1.234375, "learning_rate": 0.0002716797931108768, "loss": 4.7574, "mean_token_accuracy": 0.2282385140657425, "num_tokens": 113374157.0, "step": 65360 }, { "entropy": 5.328366088867187, "epoch": 5.085586461777864, "grad_norm": 1.140625, "learning_rate": 0.0002716520805662489, "loss": 4.5946, "mean_token_accuracy": 0.24097496122121811, "num_tokens": 113382463.0, "step": 65365 }, { "entropy": 5.347125434875489, "epoch": 5.085975491149582, "grad_norm": 1.203125, "learning_rate": 0.00027162436807242024, "loss": 4.6249, "mean_token_accuracy": 0.22953520715236664, "num_tokens": 113391960.0, "step": 65370 }, { "entropy": 5.399878263473511, "epoch": 5.0863645205212995, "grad_norm": 1.2265625, "learning_rate": 0.00027159665562981154, "loss": 4.7765, "mean_token_accuracy": 0.2258735254406929, "num_tokens": 113401119.0, "step": 65375 }, { "entropy": 5.429216384887695, "epoch": 5.086753549893017, "grad_norm": 1.3359375, "learning_rate": 0.0002715689432388433, "loss": 4.7464, "mean_token_accuracy": 0.2259046271443367, "num_tokens": 113409048.0, "step": 65380 }, { "entropy": 5.396190357208252, "epoch": 5.087142579264735, "grad_norm": 1.203125, "learning_rate": 0.0002715412308999357, "loss": 4.7887, "mean_token_accuracy": 0.22731771171092988, "num_tokens": 113417572.0, "step": 65385 }, { "entropy": 5.407434415817261, "epoch": 5.087531608636452, "grad_norm": 1.3203125, "learning_rate": 0.00027151351861350953, "loss": 4.6586, "mean_token_accuracy": 0.23978892117738723, "num_tokens": 113426043.0, "step": 65390 }, { "entropy": 5.431021404266358, "epoch": 5.087920638008169, "grad_norm": 1.2265625, "learning_rate": 0.0002714858063799851, "loss": 4.6963, "mean_token_accuracy": 0.23497094660997392, "num_tokens": 113435268.0, "step": 65395 }, { "entropy": 5.3180399417877195, "epoch": 5.088309667379887, "grad_norm": 1.2109375, "learning_rate": 0.00027145809419978293, "loss": 4.6335, "mean_token_accuracy": 0.2320336729288101, "num_tokens": 113443495.0, "step": 65400 }, { "entropy": 5.387393283843994, "epoch": 5.088698696751605, "grad_norm": 1.28125, "learning_rate": 0.00027143038207332363, "loss": 4.6805, "mean_token_accuracy": 0.23501917570829392, "num_tokens": 113451615.0, "step": 65405 }, { "entropy": 5.356422996520996, "epoch": 5.0890877261233225, "grad_norm": 1.203125, "learning_rate": 0.00027140267000102755, "loss": 4.6329, "mean_token_accuracy": 0.230201655626297, "num_tokens": 113460134.0, "step": 65410 }, { "entropy": 5.404710054397583, "epoch": 5.08947675549504, "grad_norm": 1.1796875, "learning_rate": 0.00027137495798331524, "loss": 4.6868, "mean_token_accuracy": 0.23152797371149064, "num_tokens": 113468388.0, "step": 65415 }, { "entropy": 5.401102113723755, "epoch": 5.089865784866757, "grad_norm": 1.234375, "learning_rate": 0.00027134724602060717, "loss": 4.7242, "mean_token_accuracy": 0.23266421854496003, "num_tokens": 113477562.0, "step": 65420 }, { "entropy": 5.400466060638427, "epoch": 5.090254814238475, "grad_norm": 1.28125, "learning_rate": 0.00027131953411332384, "loss": 4.7524, "mean_token_accuracy": 0.23158220052719117, "num_tokens": 113485798.0, "step": 65425 }, { "entropy": 5.515975522994995, "epoch": 5.090643843610192, "grad_norm": 1.2578125, "learning_rate": 0.00027129182226188575, "loss": 4.8185, "mean_token_accuracy": 0.21520659923553467, "num_tokens": 113494396.0, "step": 65430 }, { "entropy": 5.372452163696289, "epoch": 5.09103287298191, "grad_norm": 1.234375, "learning_rate": 0.0002712641104667132, "loss": 4.6472, "mean_token_accuracy": 0.23959426432847977, "num_tokens": 113503017.0, "step": 65435 }, { "entropy": 5.408333730697632, "epoch": 5.091421902353628, "grad_norm": 1.296875, "learning_rate": 0.000271236398728227, "loss": 4.695, "mean_token_accuracy": 0.2335971936583519, "num_tokens": 113512059.0, "step": 65440 }, { "entropy": 5.366698408126831, "epoch": 5.0918109317253455, "grad_norm": 1.2109375, "learning_rate": 0.00027120868704684736, "loss": 4.6929, "mean_token_accuracy": 0.23536107540130616, "num_tokens": 113520368.0, "step": 65445 }, { "entropy": 5.3476447582244875, "epoch": 5.092199961097063, "grad_norm": 1.203125, "learning_rate": 0.0002711809754229949, "loss": 4.7475, "mean_token_accuracy": 0.22523743361234666, "num_tokens": 113528486.0, "step": 65450 }, { "entropy": 5.452898168563843, "epoch": 5.09258899046878, "grad_norm": 1.1875, "learning_rate": 0.00027115326385709004, "loss": 4.8047, "mean_token_accuracy": 0.22994998544454576, "num_tokens": 113537390.0, "step": 65455 }, { "entropy": 5.30726957321167, "epoch": 5.092978019840498, "grad_norm": 1.234375, "learning_rate": 0.0002711255523495534, "loss": 4.6275, "mean_token_accuracy": 0.242209230363369, "num_tokens": 113545388.0, "step": 65460 }, { "entropy": 5.369461107254028, "epoch": 5.093367049212215, "grad_norm": 1.2109375, "learning_rate": 0.0002710978409008052, "loss": 4.6726, "mean_token_accuracy": 0.2417624920606613, "num_tokens": 113553341.0, "step": 65465 }, { "entropy": 5.307066631317139, "epoch": 5.093756078583933, "grad_norm": 1.203125, "learning_rate": 0.00027107012951126607, "loss": 4.6792, "mean_token_accuracy": 0.23374118208885192, "num_tokens": 113561970.0, "step": 65470 }, { "entropy": 5.3758939743042, "epoch": 5.094145107955651, "grad_norm": 1.3828125, "learning_rate": 0.00027104241818135655, "loss": 4.7168, "mean_token_accuracy": 0.22601673156023025, "num_tokens": 113570088.0, "step": 65475 }, { "entropy": 5.509513330459595, "epoch": 5.0945341373273685, "grad_norm": 1.21875, "learning_rate": 0.00027101470691149693, "loss": 4.8637, "mean_token_accuracy": 0.21794642508029938, "num_tokens": 113579161.0, "step": 65480 }, { "entropy": 5.440929889678955, "epoch": 5.094923166699086, "grad_norm": 1.265625, "learning_rate": 0.00027098699570210787, "loss": 4.7084, "mean_token_accuracy": 0.22382608950138091, "num_tokens": 113588195.0, "step": 65485 }, { "entropy": 5.36814661026001, "epoch": 5.095312196070803, "grad_norm": 1.2890625, "learning_rate": 0.00027095928455360977, "loss": 4.6277, "mean_token_accuracy": 0.24170744717121123, "num_tokens": 113596730.0, "step": 65490 }, { "entropy": 5.403841590881347, "epoch": 5.095701225442521, "grad_norm": 1.2734375, "learning_rate": 0.000270931573466423, "loss": 4.685, "mean_token_accuracy": 0.23899894654750825, "num_tokens": 113604889.0, "step": 65495 }, { "entropy": 5.318054246902466, "epoch": 5.096090254814238, "grad_norm": 1.2265625, "learning_rate": 0.0002709038624409681, "loss": 4.6618, "mean_token_accuracy": 0.2315066635608673, "num_tokens": 113614387.0, "step": 65500 }, { "entropy": 5.405959224700927, "epoch": 5.096479284185956, "grad_norm": 1.375, "learning_rate": 0.00027087615147766567, "loss": 4.6254, "mean_token_accuracy": 0.23597293049097062, "num_tokens": 113623083.0, "step": 65505 }, { "entropy": 5.296598625183106, "epoch": 5.096868313557674, "grad_norm": 1.2578125, "learning_rate": 0.000270848440576936, "loss": 4.6202, "mean_token_accuracy": 0.23955265879631044, "num_tokens": 113631435.0, "step": 65510 }, { "entropy": 5.342639589309693, "epoch": 5.0972573429293915, "grad_norm": 1.265625, "learning_rate": 0.00027082072973919974, "loss": 4.7256, "mean_token_accuracy": 0.23370078653097154, "num_tokens": 113640562.0, "step": 65515 }, { "entropy": 5.352981519699097, "epoch": 5.097646372301108, "grad_norm": 1.140625, "learning_rate": 0.00027079301896487716, "loss": 4.6539, "mean_token_accuracy": 0.2374591961503029, "num_tokens": 113649388.0, "step": 65520 }, { "entropy": 5.470557737350464, "epoch": 5.098035401672826, "grad_norm": 1.21875, "learning_rate": 0.0002707653082543889, "loss": 4.8449, "mean_token_accuracy": 0.2149989828467369, "num_tokens": 113658212.0, "step": 65525 }, { "entropy": 5.412865018844604, "epoch": 5.098424431044544, "grad_norm": 1.2421875, "learning_rate": 0.0002707375976081553, "loss": 4.7714, "mean_token_accuracy": 0.22632641047239305, "num_tokens": 113666773.0, "step": 65530 }, { "entropy": 5.326788997650146, "epoch": 5.098813460416261, "grad_norm": 1.28125, "learning_rate": 0.00027070988702659687, "loss": 4.6479, "mean_token_accuracy": 0.23933408856391908, "num_tokens": 113675429.0, "step": 65535 }, { "entropy": 5.367677450180054, "epoch": 5.099202489787979, "grad_norm": 1.34375, "learning_rate": 0.00027068217651013415, "loss": 4.703, "mean_token_accuracy": 0.22788191437721253, "num_tokens": 113684085.0, "step": 65540 }, { "entropy": 5.40313491821289, "epoch": 5.099591519159697, "grad_norm": 1.3046875, "learning_rate": 0.0002706544660591875, "loss": 4.6913, "mean_token_accuracy": 0.22958648651838304, "num_tokens": 113692185.0, "step": 65545 }, { "entropy": 5.346821403503418, "epoch": 5.0999805485314145, "grad_norm": 1.1953125, "learning_rate": 0.00027062675567417736, "loss": 4.6662, "mean_token_accuracy": 0.2285730227828026, "num_tokens": 113700537.0, "step": 65550 }, { "entropy": 5.368384170532226, "epoch": 5.100369577903131, "grad_norm": 1.3125, "learning_rate": 0.00027059904535552424, "loss": 4.7745, "mean_token_accuracy": 0.23148514032363893, "num_tokens": 113709052.0, "step": 65555 }, { "entropy": 5.401798248291016, "epoch": 5.100758607274849, "grad_norm": 1.28125, "learning_rate": 0.00027057133510364866, "loss": 4.7635, "mean_token_accuracy": 0.23300737738609315, "num_tokens": 113717350.0, "step": 65560 }, { "entropy": 5.4771534442901615, "epoch": 5.101147636646567, "grad_norm": 1.1875, "learning_rate": 0.0002705436249189709, "loss": 4.77, "mean_token_accuracy": 0.22975452542304992, "num_tokens": 113726090.0, "step": 65565 }, { "entropy": 5.424429130554199, "epoch": 5.101536666018284, "grad_norm": 1.359375, "learning_rate": 0.00027051591480191167, "loss": 4.8082, "mean_token_accuracy": 0.22800733149051666, "num_tokens": 113734445.0, "step": 65570 }, { "entropy": 5.45571460723877, "epoch": 5.101925695390002, "grad_norm": 1.2421875, "learning_rate": 0.0002704882047528912, "loss": 4.832, "mean_token_accuracy": 0.2218543455004692, "num_tokens": 113742743.0, "step": 65575 }, { "entropy": 5.377057123184204, "epoch": 5.10231472476172, "grad_norm": 1.25, "learning_rate": 0.00027046049477233013, "loss": 4.6393, "mean_token_accuracy": 0.2363483041524887, "num_tokens": 113751339.0, "step": 65580 }, { "entropy": 5.462052917480468, "epoch": 5.1027037541334375, "grad_norm": 1.359375, "learning_rate": 0.0002704327848606488, "loss": 4.7444, "mean_token_accuracy": 0.23309819400310516, "num_tokens": 113759372.0, "step": 65585 }, { "entropy": 5.395617198944092, "epoch": 5.103092783505154, "grad_norm": 1.21875, "learning_rate": 0.0002704050750182677, "loss": 4.7836, "mean_token_accuracy": 0.22500190734863282, "num_tokens": 113768121.0, "step": 65590 }, { "entropy": 5.432155609130859, "epoch": 5.103481812876872, "grad_norm": 1.2890625, "learning_rate": 0.00027037736524560717, "loss": 4.7744, "mean_token_accuracy": 0.22170761227607727, "num_tokens": 113776583.0, "step": 65595 }, { "entropy": 5.3910950183868405, "epoch": 5.10387084224859, "grad_norm": 1.21875, "learning_rate": 0.0002703496555430879, "loss": 4.6661, "mean_token_accuracy": 0.2371536076068878, "num_tokens": 113784364.0, "step": 65600 }, { "entropy": 5.42143235206604, "epoch": 5.104259871620307, "grad_norm": 1.2890625, "learning_rate": 0.00027032194591113015, "loss": 4.7656, "mean_token_accuracy": 0.22701077312231063, "num_tokens": 113792714.0, "step": 65605 }, { "entropy": 5.3945355892181395, "epoch": 5.104648900992025, "grad_norm": 1.21875, "learning_rate": 0.0002702942363501544, "loss": 4.7606, "mean_token_accuracy": 0.23320869654417037, "num_tokens": 113801401.0, "step": 65610 }, { "entropy": 5.428937339782715, "epoch": 5.105037930363743, "grad_norm": 1.25, "learning_rate": 0.00027026652686058117, "loss": 4.7788, "mean_token_accuracy": 0.2287493571639061, "num_tokens": 113810110.0, "step": 65615 }, { "entropy": 5.3436315059661865, "epoch": 5.1054269597354605, "grad_norm": 1.3515625, "learning_rate": 0.00027023881744283083, "loss": 4.582, "mean_token_accuracy": 0.24200268536806108, "num_tokens": 113818795.0, "step": 65620 }, { "entropy": 5.358218717575073, "epoch": 5.105815989107177, "grad_norm": 1.21875, "learning_rate": 0.0002702111080973239, "loss": 4.6583, "mean_token_accuracy": 0.23327534794807434, "num_tokens": 113827323.0, "step": 65625 }, { "entropy": 5.340360164642334, "epoch": 5.106205018478895, "grad_norm": 1.21875, "learning_rate": 0.0002701833988244808, "loss": 4.708, "mean_token_accuracy": 0.23821092545986175, "num_tokens": 113835837.0, "step": 65630 }, { "entropy": 5.423778963088989, "epoch": 5.106594047850613, "grad_norm": 1.1953125, "learning_rate": 0.00027015568962472175, "loss": 4.7425, "mean_token_accuracy": 0.2352370023727417, "num_tokens": 113844730.0, "step": 65635 }, { "entropy": 5.402863264083862, "epoch": 5.10698307722233, "grad_norm": 1.2734375, "learning_rate": 0.00027012798049846757, "loss": 4.6995, "mean_token_accuracy": 0.2298349305987358, "num_tokens": 113853546.0, "step": 65640 }, { "entropy": 5.437662982940674, "epoch": 5.107372106594048, "grad_norm": 1.3125, "learning_rate": 0.0002701002714461385, "loss": 4.7095, "mean_token_accuracy": 0.22861822247505187, "num_tokens": 113862361.0, "step": 65645 }, { "entropy": 5.375363492965699, "epoch": 5.107761135965766, "grad_norm": 1.2109375, "learning_rate": 0.0002700725624681551, "loss": 4.6, "mean_token_accuracy": 0.23485542833805084, "num_tokens": 113871000.0, "step": 65650 }, { "entropy": 5.4757880687713625, "epoch": 5.108150165337483, "grad_norm": 1.2265625, "learning_rate": 0.00027004485356493763, "loss": 4.7978, "mean_token_accuracy": 0.2202759027481079, "num_tokens": 113879285.0, "step": 65655 }, { "entropy": 5.403604364395141, "epoch": 5.1085391947092, "grad_norm": 1.2421875, "learning_rate": 0.00027001714473690665, "loss": 4.722, "mean_token_accuracy": 0.22698740363121034, "num_tokens": 113888453.0, "step": 65660 }, { "entropy": 5.306671524047852, "epoch": 5.108928224080918, "grad_norm": 1.1953125, "learning_rate": 0.00026998943598448256, "loss": 4.6321, "mean_token_accuracy": 0.2407928854227066, "num_tokens": 113896652.0, "step": 65665 }, { "entropy": 5.407342100143433, "epoch": 5.109317253452636, "grad_norm": 1.3203125, "learning_rate": 0.0002699617273080858, "loss": 4.6927, "mean_token_accuracy": 0.22324788719415664, "num_tokens": 113904697.0, "step": 65670 }, { "entropy": 5.438044118881225, "epoch": 5.109706282824353, "grad_norm": 1.171875, "learning_rate": 0.0002699340187081368, "loss": 4.8255, "mean_token_accuracy": 0.2273674115538597, "num_tokens": 113913775.0, "step": 65675 }, { "entropy": 5.447125053405761, "epoch": 5.110095312196071, "grad_norm": 1.265625, "learning_rate": 0.000269906310185056, "loss": 4.7095, "mean_token_accuracy": 0.22697632610797883, "num_tokens": 113922265.0, "step": 65680 }, { "entropy": 5.417784309387207, "epoch": 5.110484341567789, "grad_norm": 1.125, "learning_rate": 0.00026987860173926387, "loss": 4.707, "mean_token_accuracy": 0.2313396766781807, "num_tokens": 113931204.0, "step": 65685 }, { "entropy": 5.449784898757935, "epoch": 5.1108733709395056, "grad_norm": 1.4375, "learning_rate": 0.00026985089337118077, "loss": 4.7865, "mean_token_accuracy": 0.2242250993847847, "num_tokens": 113939764.0, "step": 65690 }, { "entropy": 5.374001741409302, "epoch": 5.111262400311223, "grad_norm": 1.1796875, "learning_rate": 0.00026982318508122724, "loss": 4.6958, "mean_token_accuracy": 0.2310997411608696, "num_tokens": 113949574.0, "step": 65695 }, { "entropy": 5.4805694103240965, "epoch": 5.111651429682941, "grad_norm": 1.234375, "learning_rate": 0.0002697954768698235, "loss": 4.7899, "mean_token_accuracy": 0.22505026459693908, "num_tokens": 113958104.0, "step": 65700 }, { "entropy": 5.4374746799469, "epoch": 5.112040459054659, "grad_norm": 1.1640625, "learning_rate": 0.00026976776873739017, "loss": 4.6728, "mean_token_accuracy": 0.23078602999448777, "num_tokens": 113967492.0, "step": 65705 }, { "entropy": 5.427159309387207, "epoch": 5.112429488426376, "grad_norm": 1.2578125, "learning_rate": 0.0002697400606843477, "loss": 4.7818, "mean_token_accuracy": 0.2219594955444336, "num_tokens": 113975663.0, "step": 65710 }, { "entropy": 5.414811325073242, "epoch": 5.112818517798094, "grad_norm": 1.2734375, "learning_rate": 0.00026971235271111636, "loss": 4.8132, "mean_token_accuracy": 0.22500250935554506, "num_tokens": 113984977.0, "step": 65715 }, { "entropy": 5.481187534332276, "epoch": 5.113207547169812, "grad_norm": 1.109375, "learning_rate": 0.00026968464481811667, "loss": 4.7458, "mean_token_accuracy": 0.2319274663925171, "num_tokens": 113994016.0, "step": 65720 }, { "entropy": 5.492456102371216, "epoch": 5.1135965765415285, "grad_norm": 1.1953125, "learning_rate": 0.00026965693700576904, "loss": 4.8247, "mean_token_accuracy": 0.22845372259616853, "num_tokens": 114002129.0, "step": 65725 }, { "entropy": 5.46475510597229, "epoch": 5.113985605913246, "grad_norm": 1.3359375, "learning_rate": 0.00026962922927449394, "loss": 4.7254, "mean_token_accuracy": 0.22603096812963486, "num_tokens": 114011250.0, "step": 65730 }, { "entropy": 5.4055990219116214, "epoch": 5.114374635284964, "grad_norm": 1.2578125, "learning_rate": 0.0002696015216247117, "loss": 4.6904, "mean_token_accuracy": 0.22688232511281967, "num_tokens": 114020909.0, "step": 65735 }, { "entropy": 5.5107887268066404, "epoch": 5.114763664656682, "grad_norm": 1.1328125, "learning_rate": 0.0002695738140568427, "loss": 4.8162, "mean_token_accuracy": 0.22227773815393448, "num_tokens": 114029972.0, "step": 65740 }, { "entropy": 5.3652996063232425, "epoch": 5.115152694028399, "grad_norm": 1.2421875, "learning_rate": 0.0002695461065713075, "loss": 4.6303, "mean_token_accuracy": 0.24354414492845536, "num_tokens": 114038290.0, "step": 65745 }, { "entropy": 5.392593622207642, "epoch": 5.115541723400117, "grad_norm": 1.21875, "learning_rate": 0.00026951839916852647, "loss": 4.6824, "mean_token_accuracy": 0.23378140181303025, "num_tokens": 114046959.0, "step": 65750 }, { "entropy": 5.472382307052612, "epoch": 5.115930752771834, "grad_norm": 1.203125, "learning_rate": 0.00026949069184892, "loss": 4.7363, "mean_token_accuracy": 0.2257254406809807, "num_tokens": 114055463.0, "step": 65755 }, { "entropy": 5.448762607574463, "epoch": 5.1163197821435515, "grad_norm": 1.25, "learning_rate": 0.00026946298461290845, "loss": 4.7524, "mean_token_accuracy": 0.23017695546150208, "num_tokens": 114064477.0, "step": 65760 }, { "entropy": 5.388959980010986, "epoch": 5.116708811515269, "grad_norm": 1.28125, "learning_rate": 0.0002694352774609123, "loss": 4.7226, "mean_token_accuracy": 0.22926197201013565, "num_tokens": 114073531.0, "step": 65765 }, { "entropy": 5.366010665893555, "epoch": 5.117097840886987, "grad_norm": 1.28125, "learning_rate": 0.000269407570393352, "loss": 4.6486, "mean_token_accuracy": 0.23572139739990233, "num_tokens": 114081624.0, "step": 65770 }, { "entropy": 5.388136386871338, "epoch": 5.117486870258705, "grad_norm": 1.21875, "learning_rate": 0.000269379863410648, "loss": 4.7061, "mean_token_accuracy": 0.237593112885952, "num_tokens": 114090026.0, "step": 65775 }, { "entropy": 5.3389817237854, "epoch": 5.117875899630422, "grad_norm": 1.1640625, "learning_rate": 0.0002693521565132205, "loss": 4.6523, "mean_token_accuracy": 0.23590691536664962, "num_tokens": 114099687.0, "step": 65780 }, { "entropy": 5.447558450698852, "epoch": 5.11826492900214, "grad_norm": 1.15625, "learning_rate": 0.00026932444970149006, "loss": 4.6958, "mean_token_accuracy": 0.23552740961313248, "num_tokens": 114108150.0, "step": 65785 }, { "entropy": 5.406824254989624, "epoch": 5.118653958373857, "grad_norm": 1.3125, "learning_rate": 0.0002692967429758771, "loss": 4.6336, "mean_token_accuracy": 0.24625136107206344, "num_tokens": 114117387.0, "step": 65790 }, { "entropy": 5.425927400588989, "epoch": 5.1190429877455745, "grad_norm": 1.2109375, "learning_rate": 0.00026926903633680193, "loss": 4.7813, "mean_token_accuracy": 0.2240218460559845, "num_tokens": 114126295.0, "step": 65795 }, { "entropy": 5.3068506717681885, "epoch": 5.119432017117292, "grad_norm": 1.203125, "learning_rate": 0.00026924132978468505, "loss": 4.6641, "mean_token_accuracy": 0.23176830857992173, "num_tokens": 114134953.0, "step": 65800 }, { "entropy": 5.48882269859314, "epoch": 5.11982104648901, "grad_norm": 1.140625, "learning_rate": 0.00026921362331994684, "loss": 4.7152, "mean_token_accuracy": 0.23103980273008345, "num_tokens": 114143780.0, "step": 65805 }, { "entropy": 5.473871421813965, "epoch": 5.120210075860728, "grad_norm": 1.3125, "learning_rate": 0.00026918591694300776, "loss": 4.8075, "mean_token_accuracy": 0.22674141228199005, "num_tokens": 114151605.0, "step": 65810 }, { "entropy": 5.3538306713104244, "epoch": 5.120599105232445, "grad_norm": 1.2421875, "learning_rate": 0.00026915821065428804, "loss": 4.6416, "mean_token_accuracy": 0.24022527188062667, "num_tokens": 114159833.0, "step": 65815 }, { "entropy": 5.430729770660401, "epoch": 5.120988134604163, "grad_norm": 1.2734375, "learning_rate": 0.0002691305044542082, "loss": 4.7281, "mean_token_accuracy": 0.23793275207281112, "num_tokens": 114168199.0, "step": 65820 }, { "entropy": 5.390360879898071, "epoch": 5.12137716397588, "grad_norm": 1.3203125, "learning_rate": 0.00026910279834318855, "loss": 4.696, "mean_token_accuracy": 0.22909157425165178, "num_tokens": 114176652.0, "step": 65825 }, { "entropy": 5.355378150939941, "epoch": 5.1217661933475975, "grad_norm": 1.2265625, "learning_rate": 0.00026907509232164964, "loss": 4.6321, "mean_token_accuracy": 0.23824428468942643, "num_tokens": 114185323.0, "step": 65830 }, { "entropy": 5.365657949447632, "epoch": 5.122155222719315, "grad_norm": 1.1640625, "learning_rate": 0.00026904738639001163, "loss": 4.5944, "mean_token_accuracy": 0.23856932371854783, "num_tokens": 114193747.0, "step": 65835 }, { "entropy": 5.3128900051116945, "epoch": 5.122544252091033, "grad_norm": 1.1953125, "learning_rate": 0.0002690196805486952, "loss": 4.5883, "mean_token_accuracy": 0.24285732209682465, "num_tokens": 114202116.0, "step": 65840 }, { "entropy": 5.269998836517334, "epoch": 5.122933281462751, "grad_norm": 1.1171875, "learning_rate": 0.00026899197479812053, "loss": 4.5588, "mean_token_accuracy": 0.2432888925075531, "num_tokens": 114210269.0, "step": 65845 }, { "entropy": 5.386642932891846, "epoch": 5.123322310834468, "grad_norm": 1.2421875, "learning_rate": 0.0002689642691387081, "loss": 4.7266, "mean_token_accuracy": 0.22190095782279967, "num_tokens": 114219206.0, "step": 65850 }, { "entropy": 5.456344747543335, "epoch": 5.123711340206185, "grad_norm": 1.2578125, "learning_rate": 0.00026893656357087833, "loss": 4.7169, "mean_token_accuracy": 0.2329949989914894, "num_tokens": 114228597.0, "step": 65855 }, { "entropy": 5.505204582214356, "epoch": 5.124100369577903, "grad_norm": 1.2109375, "learning_rate": 0.0002689088580950515, "loss": 4.7598, "mean_token_accuracy": 0.2297585353255272, "num_tokens": 114236768.0, "step": 65860 }, { "entropy": 5.4713225841522215, "epoch": 5.1244893989496205, "grad_norm": 1.203125, "learning_rate": 0.000268881152711648, "loss": 4.8354, "mean_token_accuracy": 0.2224276155233383, "num_tokens": 114245297.0, "step": 65865 }, { "entropy": 5.429941272735595, "epoch": 5.124878428321338, "grad_norm": 1.1875, "learning_rate": 0.0002688534474210884, "loss": 4.721, "mean_token_accuracy": 0.2285181149840355, "num_tokens": 114253955.0, "step": 65870 }, { "entropy": 5.322048139572144, "epoch": 5.125267457693056, "grad_norm": 1.2890625, "learning_rate": 0.00026882574222379283, "loss": 4.6408, "mean_token_accuracy": 0.24228358268737793, "num_tokens": 114262513.0, "step": 65875 }, { "entropy": 5.36185131072998, "epoch": 5.125656487064774, "grad_norm": 1.1640625, "learning_rate": 0.00026879803712018187, "loss": 4.6845, "mean_token_accuracy": 0.23195052295923232, "num_tokens": 114271172.0, "step": 65880 }, { "entropy": 5.3886323928833, "epoch": 5.126045516436491, "grad_norm": 1.2734375, "learning_rate": 0.0002687703321106758, "loss": 4.716, "mean_token_accuracy": 0.22585140615701677, "num_tokens": 114278877.0, "step": 65885 }, { "entropy": 5.4015813827514645, "epoch": 5.126434545808208, "grad_norm": 1.1875, "learning_rate": 0.0002687426271956951, "loss": 4.6576, "mean_token_accuracy": 0.23162325769662856, "num_tokens": 114287163.0, "step": 65890 }, { "entropy": 5.400324916839599, "epoch": 5.126823575179926, "grad_norm": 1.1171875, "learning_rate": 0.00026871492237566, "loss": 4.7194, "mean_token_accuracy": 0.2343520149588585, "num_tokens": 114296187.0, "step": 65895 }, { "entropy": 5.314103889465332, "epoch": 5.1272126045516435, "grad_norm": 1.1640625, "learning_rate": 0.00026868721765099086, "loss": 4.5324, "mean_token_accuracy": 0.24911223948001862, "num_tokens": 114304548.0, "step": 65900 }, { "entropy": 5.495078992843628, "epoch": 5.127601633923361, "grad_norm": 1.1796875, "learning_rate": 0.0002686595130221082, "loss": 4.8412, "mean_token_accuracy": 0.22773391455411912, "num_tokens": 114313163.0, "step": 65905 }, { "entropy": 5.356654357910156, "epoch": 5.127990663295079, "grad_norm": 1.2734375, "learning_rate": 0.00026863180848943244, "loss": 4.6622, "mean_token_accuracy": 0.24243556708097458, "num_tokens": 114321350.0, "step": 65910 }, { "entropy": 5.39908995628357, "epoch": 5.128379692666797, "grad_norm": 1.2890625, "learning_rate": 0.0002686041040533838, "loss": 4.6888, "mean_token_accuracy": 0.2335049331188202, "num_tokens": 114330155.0, "step": 65915 }, { "entropy": 5.362762022018432, "epoch": 5.128768722038514, "grad_norm": 1.203125, "learning_rate": 0.0002685763997143827, "loss": 4.6502, "mean_token_accuracy": 0.233978570997715, "num_tokens": 114338932.0, "step": 65920 }, { "entropy": 5.450249576568604, "epoch": 5.129157751410231, "grad_norm": 1.2890625, "learning_rate": 0.00026854869547284947, "loss": 4.7581, "mean_token_accuracy": 0.23521080911159514, "num_tokens": 114347239.0, "step": 65925 }, { "entropy": 5.304029130935669, "epoch": 5.129546780781949, "grad_norm": 1.171875, "learning_rate": 0.00026852099132920455, "loss": 4.6467, "mean_token_accuracy": 0.23812558650970458, "num_tokens": 114356421.0, "step": 65930 }, { "entropy": 5.402892255783081, "epoch": 5.1299358101536665, "grad_norm": 1.265625, "learning_rate": 0.0002684932872838683, "loss": 4.6567, "mean_token_accuracy": 0.23382177650928498, "num_tokens": 114365524.0, "step": 65935 }, { "entropy": 5.406023597717285, "epoch": 5.130324839525384, "grad_norm": 1.296875, "learning_rate": 0.000268465583337261, "loss": 4.7535, "mean_token_accuracy": 0.2272989943623543, "num_tokens": 114374731.0, "step": 65940 }, { "entropy": 5.475456047058105, "epoch": 5.130713868897102, "grad_norm": 1.3046875, "learning_rate": 0.0002684378794898031, "loss": 4.8441, "mean_token_accuracy": 0.22046840339899063, "num_tokens": 114383051.0, "step": 65945 }, { "entropy": 5.450339984893799, "epoch": 5.13110289826882, "grad_norm": 1.3203125, "learning_rate": 0.00026841017574191496, "loss": 4.7089, "mean_token_accuracy": 0.23366149365901948, "num_tokens": 114391512.0, "step": 65950 }, { "entropy": 5.4329948902130125, "epoch": 5.131491927640537, "grad_norm": 1.296875, "learning_rate": 0.0002683824720940168, "loss": 4.7347, "mean_token_accuracy": 0.23419105410575866, "num_tokens": 114399808.0, "step": 65955 }, { "entropy": 5.403705644607544, "epoch": 5.131880957012254, "grad_norm": 1.2265625, "learning_rate": 0.00026835476854652926, "loss": 4.6794, "mean_token_accuracy": 0.23160973638296128, "num_tokens": 114408593.0, "step": 65960 }, { "entropy": 5.3698242664337155, "epoch": 5.132269986383972, "grad_norm": 1.2890625, "learning_rate": 0.0002683270650998724, "loss": 4.751, "mean_token_accuracy": 0.2253437116742134, "num_tokens": 114416705.0, "step": 65965 }, { "entropy": 5.364916133880615, "epoch": 5.1326590157556895, "grad_norm": 1.203125, "learning_rate": 0.0002682993617544667, "loss": 4.6134, "mean_token_accuracy": 0.24272384792566298, "num_tokens": 114425255.0, "step": 65970 }, { "entropy": 5.380217695236206, "epoch": 5.133048045127407, "grad_norm": 1.3046875, "learning_rate": 0.0002682716585107326, "loss": 4.6489, "mean_token_accuracy": 0.2349974974989891, "num_tokens": 114432832.0, "step": 65975 }, { "entropy": 5.449956846237183, "epoch": 5.133437074499125, "grad_norm": 1.46875, "learning_rate": 0.00026824395536909036, "loss": 4.8199, "mean_token_accuracy": 0.22321844547986985, "num_tokens": 114442060.0, "step": 65980 }, { "entropy": 5.497336149215698, "epoch": 5.133826103870843, "grad_norm": 1.265625, "learning_rate": 0.0002682162523299603, "loss": 4.8619, "mean_token_accuracy": 0.22482421100139618, "num_tokens": 114450586.0, "step": 65985 }, { "entropy": 5.427227735519409, "epoch": 5.134215133242559, "grad_norm": 1.2890625, "learning_rate": 0.00026818854939376284, "loss": 4.6956, "mean_token_accuracy": 0.23442237377166747, "num_tokens": 114458636.0, "step": 65990 }, { "entropy": 5.400297927856445, "epoch": 5.134604162614277, "grad_norm": 1.234375, "learning_rate": 0.00026816084656091835, "loss": 4.7037, "mean_token_accuracy": 0.23371173739433287, "num_tokens": 114467920.0, "step": 65995 }, { "entropy": 5.39310884475708, "epoch": 5.134993191985995, "grad_norm": 1.1953125, "learning_rate": 0.00026813314383184714, "loss": 4.7067, "mean_token_accuracy": 0.240615876019001, "num_tokens": 114476131.0, "step": 66000 }, { "epoch": 5.134993191985995, "eval_entropy": 5.139688380712265, "eval_loss": 4.9139790534973145, "eval_mean_token_accuracy": 0.22861279457434652, "eval_num_tokens": 114476131.0, "eval_runtime": 28.7239, "eval_samples_per_second": 1446.808, "eval_steps_per_second": 180.86, "step": 66000 }, { "entropy": 5.417403602600098, "epoch": 5.1353822213577125, "grad_norm": 1.2421875, "learning_rate": 0.00026810544120696943, "loss": 4.7298, "mean_token_accuracy": 0.2260174885392189, "num_tokens": 114484709.0, "step": 66005 }, { "entropy": 5.424469900131226, "epoch": 5.13577125072943, "grad_norm": 1.171875, "learning_rate": 0.00026807773868670575, "loss": 4.7065, "mean_token_accuracy": 0.231908118724823, "num_tokens": 114493045.0, "step": 66010 }, { "entropy": 5.375827789306641, "epoch": 5.136160280101148, "grad_norm": 1.2421875, "learning_rate": 0.0002680500362714764, "loss": 4.68, "mean_token_accuracy": 0.22803279459476472, "num_tokens": 114501506.0, "step": 66015 }, { "entropy": 5.491504335403443, "epoch": 5.136549309472866, "grad_norm": 1.296875, "learning_rate": 0.00026802233396170164, "loss": 4.775, "mean_token_accuracy": 0.22315797358751296, "num_tokens": 114510353.0, "step": 66020 }, { "entropy": 5.4479516506195065, "epoch": 5.136938338844582, "grad_norm": 1.21875, "learning_rate": 0.0002679946317578018, "loss": 4.7926, "mean_token_accuracy": 0.22691000998020172, "num_tokens": 114519363.0, "step": 66025 }, { "entropy": 5.430318593978882, "epoch": 5.1373273682163, "grad_norm": 1.28125, "learning_rate": 0.0002679669296601973, "loss": 4.7204, "mean_token_accuracy": 0.23339899480342866, "num_tokens": 114528002.0, "step": 66030 }, { "entropy": 5.467751789093017, "epoch": 5.137716397588018, "grad_norm": 1.1953125, "learning_rate": 0.00026793922766930845, "loss": 4.8392, "mean_token_accuracy": 0.22155335992574693, "num_tokens": 114537683.0, "step": 66035 }, { "entropy": 5.372335815429688, "epoch": 5.1381054269597355, "grad_norm": 1.2265625, "learning_rate": 0.00026791152578555563, "loss": 4.6484, "mean_token_accuracy": 0.23907072395086287, "num_tokens": 114546946.0, "step": 66040 }, { "entropy": 5.406434679031372, "epoch": 5.138494456331453, "grad_norm": 1.3828125, "learning_rate": 0.00026788382400935913, "loss": 4.658, "mean_token_accuracy": 0.24150171726942063, "num_tokens": 114555906.0, "step": 66045 }, { "entropy": 5.354548025131225, "epoch": 5.138883485703171, "grad_norm": 1.140625, "learning_rate": 0.0002678561223411392, "loss": 4.6268, "mean_token_accuracy": 0.22765659391880036, "num_tokens": 114564658.0, "step": 66050 }, { "entropy": 5.385910558700561, "epoch": 5.139272515074889, "grad_norm": 1.2265625, "learning_rate": 0.0002678284207813163, "loss": 4.7293, "mean_token_accuracy": 0.23187315464019775, "num_tokens": 114573316.0, "step": 66055 }, { "entropy": 5.332181835174561, "epoch": 5.139661544446605, "grad_norm": 1.3515625, "learning_rate": 0.0002678007193303107, "loss": 4.6617, "mean_token_accuracy": 0.2324550211429596, "num_tokens": 114581058.0, "step": 66060 }, { "entropy": 5.4508984088897705, "epoch": 5.140050573818323, "grad_norm": 1.1875, "learning_rate": 0.0002677730179885427, "loss": 4.8537, "mean_token_accuracy": 0.2183619111776352, "num_tokens": 114590991.0, "step": 66065 }, { "entropy": 5.376085042953491, "epoch": 5.140439603190041, "grad_norm": 1.28125, "learning_rate": 0.00026774531675643267, "loss": 4.6951, "mean_token_accuracy": 0.2333232879638672, "num_tokens": 114599656.0, "step": 66070 }, { "entropy": 5.453762054443359, "epoch": 5.1408286325617585, "grad_norm": 1.2109375, "learning_rate": 0.0002677176156344009, "loss": 4.7911, "mean_token_accuracy": 0.22020739316940308, "num_tokens": 114608176.0, "step": 66075 }, { "entropy": 5.406126832962036, "epoch": 5.141217661933476, "grad_norm": 1.1640625, "learning_rate": 0.0002676899146228678, "loss": 4.6754, "mean_token_accuracy": 0.23196159303188324, "num_tokens": 114617445.0, "step": 66080 }, { "entropy": 5.323542165756225, "epoch": 5.141606691305194, "grad_norm": 1.1875, "learning_rate": 0.00026766221372225354, "loss": 4.6911, "mean_token_accuracy": 0.2348223090171814, "num_tokens": 114626433.0, "step": 66085 }, { "entropy": 5.447685241699219, "epoch": 5.141995720676911, "grad_norm": 1.171875, "learning_rate": 0.0002676345129329785, "loss": 4.7943, "mean_token_accuracy": 0.22686877697706223, "num_tokens": 114635008.0, "step": 66090 }, { "entropy": 5.373812437057495, "epoch": 5.142384750048628, "grad_norm": 1.21875, "learning_rate": 0.00026760681225546296, "loss": 4.7182, "mean_token_accuracy": 0.23642105758190154, "num_tokens": 114643595.0, "step": 66095 }, { "entropy": 5.338349294662476, "epoch": 5.142773779420346, "grad_norm": 1.234375, "learning_rate": 0.0002675791116901273, "loss": 4.6492, "mean_token_accuracy": 0.23315968066453935, "num_tokens": 114652595.0, "step": 66100 }, { "entropy": 5.405515575408936, "epoch": 5.143162808792064, "grad_norm": 1.25, "learning_rate": 0.0002675514112373918, "loss": 4.6724, "mean_token_accuracy": 0.24144977033138276, "num_tokens": 114660765.0, "step": 66105 }, { "entropy": 5.385930585861206, "epoch": 5.1435518381637815, "grad_norm": 1.203125, "learning_rate": 0.00026752371089767686, "loss": 4.62, "mean_token_accuracy": 0.23673540055751802, "num_tokens": 114668894.0, "step": 66110 }, { "entropy": 5.527282285690307, "epoch": 5.143940867535499, "grad_norm": 1.3046875, "learning_rate": 0.0002674960106714026, "loss": 4.8314, "mean_token_accuracy": 0.2227616935968399, "num_tokens": 114676896.0, "step": 66115 }, { "entropy": 5.429725551605225, "epoch": 5.144329896907217, "grad_norm": 1.203125, "learning_rate": 0.00026746831055898953, "loss": 4.7674, "mean_token_accuracy": 0.22142336070537566, "num_tokens": 114685945.0, "step": 66120 }, { "entropy": 5.416826295852661, "epoch": 5.144718926278934, "grad_norm": 1.359375, "learning_rate": 0.0002674406105608578, "loss": 4.7137, "mean_token_accuracy": 0.24404677301645278, "num_tokens": 114695039.0, "step": 66125 }, { "entropy": 5.343321990966797, "epoch": 5.145107955650651, "grad_norm": 1.296875, "learning_rate": 0.0002674129106774278, "loss": 4.7136, "mean_token_accuracy": 0.229978746175766, "num_tokens": 114704357.0, "step": 66130 }, { "entropy": 5.48281626701355, "epoch": 5.145496985022369, "grad_norm": 1.3359375, "learning_rate": 0.00026738521090911984, "loss": 4.8355, "mean_token_accuracy": 0.2230332687497139, "num_tokens": 114713766.0, "step": 66135 }, { "entropy": 5.5071120262146, "epoch": 5.145886014394087, "grad_norm": 1.125, "learning_rate": 0.0002673575112563541, "loss": 4.748, "mean_token_accuracy": 0.23243640661239623, "num_tokens": 114723840.0, "step": 66140 }, { "entropy": 5.404505443572998, "epoch": 5.1462750437658045, "grad_norm": 1.234375, "learning_rate": 0.000267329811719551, "loss": 4.7124, "mean_token_accuracy": 0.23389067649841308, "num_tokens": 114733083.0, "step": 66145 }, { "entropy": 5.374289703369141, "epoch": 5.146664073137522, "grad_norm": 1.25, "learning_rate": 0.0002673021122991308, "loss": 4.6446, "mean_token_accuracy": 0.23164769858121873, "num_tokens": 114741444.0, "step": 66150 }, { "entropy": 5.3094391345977785, "epoch": 5.14705310250924, "grad_norm": 1.2734375, "learning_rate": 0.0002672744129955138, "loss": 4.6335, "mean_token_accuracy": 0.22914784401655197, "num_tokens": 114750095.0, "step": 66155 }, { "entropy": 5.374258804321289, "epoch": 5.147442131880957, "grad_norm": 1.234375, "learning_rate": 0.0002672467138091204, "loss": 4.7474, "mean_token_accuracy": 0.22606673538684846, "num_tokens": 114759075.0, "step": 66160 }, { "entropy": 5.388504266738892, "epoch": 5.147831161252674, "grad_norm": 1.265625, "learning_rate": 0.0002672190147403705, "loss": 4.6435, "mean_token_accuracy": 0.2358704164624214, "num_tokens": 114767909.0, "step": 66165 }, { "entropy": 5.507593059539795, "epoch": 5.148220190624392, "grad_norm": 1.1953125, "learning_rate": 0.0002671913157896849, "loss": 4.8484, "mean_token_accuracy": 0.219556924700737, "num_tokens": 114777329.0, "step": 66170 }, { "entropy": 5.430430555343628, "epoch": 5.14860921999611, "grad_norm": 1.1796875, "learning_rate": 0.00026716361695748353, "loss": 4.7953, "mean_token_accuracy": 0.2295788899064064, "num_tokens": 114785971.0, "step": 66175 }, { "entropy": 5.4729015827178955, "epoch": 5.1489982493678275, "grad_norm": 1.28125, "learning_rate": 0.0002671359182441868, "loss": 4.8283, "mean_token_accuracy": 0.22070123702287675, "num_tokens": 114794682.0, "step": 66180 }, { "entropy": 5.341976881027222, "epoch": 5.149387278739545, "grad_norm": 1.171875, "learning_rate": 0.00026710821965021507, "loss": 4.6541, "mean_token_accuracy": 0.23373156934976577, "num_tokens": 114803989.0, "step": 66185 }, { "entropy": 5.469167900085449, "epoch": 5.149776308111262, "grad_norm": 1.2265625, "learning_rate": 0.0002670805211759886, "loss": 4.8043, "mean_token_accuracy": 0.22123969793319703, "num_tokens": 114812176.0, "step": 66190 }, { "entropy": 5.375462675094605, "epoch": 5.15016533748298, "grad_norm": 1.1328125, "learning_rate": 0.0002670528228219275, "loss": 4.6541, "mean_token_accuracy": 0.23139166831970215, "num_tokens": 114820697.0, "step": 66195 }, { "entropy": 5.462036609649658, "epoch": 5.150554366854697, "grad_norm": 1.171875, "learning_rate": 0.00026702512458845224, "loss": 4.7687, "mean_token_accuracy": 0.22422267645597457, "num_tokens": 114829907.0, "step": 66200 }, { "entropy": 5.476194286346436, "epoch": 5.150943396226415, "grad_norm": 1.1875, "learning_rate": 0.00026699742647598294, "loss": 4.7265, "mean_token_accuracy": 0.22197712510824202, "num_tokens": 114839254.0, "step": 66205 }, { "entropy": 5.432609701156617, "epoch": 5.151332425598133, "grad_norm": 1.1640625, "learning_rate": 0.00026696972848494005, "loss": 4.6426, "mean_token_accuracy": 0.22954562306404114, "num_tokens": 114847599.0, "step": 66210 }, { "entropy": 5.4027856349945065, "epoch": 5.1517214549698505, "grad_norm": 1.1953125, "learning_rate": 0.00026694203061574366, "loss": 4.7726, "mean_token_accuracy": 0.22356075197458267, "num_tokens": 114857020.0, "step": 66215 }, { "entropy": 5.3387861251831055, "epoch": 5.152110484341568, "grad_norm": 1.234375, "learning_rate": 0.00026691433286881415, "loss": 4.6544, "mean_token_accuracy": 0.23844123184680938, "num_tokens": 114865861.0, "step": 66220 }, { "entropy": 5.3935342788696286, "epoch": 5.152499513713285, "grad_norm": 1.2734375, "learning_rate": 0.0002668866352445718, "loss": 4.6296, "mean_token_accuracy": 0.2350833833217621, "num_tokens": 114874128.0, "step": 66225 }, { "entropy": 5.331000328063965, "epoch": 5.152888543085003, "grad_norm": 1.3203125, "learning_rate": 0.0002668589377434368, "loss": 4.5404, "mean_token_accuracy": 0.24898185282945634, "num_tokens": 114882685.0, "step": 66230 }, { "entropy": 5.271511220932007, "epoch": 5.15327757245672, "grad_norm": 1.21875, "learning_rate": 0.0002668312403658295, "loss": 4.568, "mean_token_accuracy": 0.23852672725915908, "num_tokens": 114891624.0, "step": 66235 }, { "entropy": 5.307132053375244, "epoch": 5.153666601828438, "grad_norm": 1.1796875, "learning_rate": 0.00026680354311217006, "loss": 4.6324, "mean_token_accuracy": 0.23841010183095931, "num_tokens": 114900438.0, "step": 66240 }, { "entropy": 5.299925899505615, "epoch": 5.154055631200156, "grad_norm": 1.203125, "learning_rate": 0.00026677584598287893, "loss": 4.6376, "mean_token_accuracy": 0.23247755765914918, "num_tokens": 114909625.0, "step": 66245 }, { "entropy": 5.411219072341919, "epoch": 5.1544446605718734, "grad_norm": 1.265625, "learning_rate": 0.00026674814897837616, "loss": 4.7552, "mean_token_accuracy": 0.23449126332998277, "num_tokens": 114918807.0, "step": 66250 }, { "entropy": 5.360559749603271, "epoch": 5.154833689943591, "grad_norm": 1.2578125, "learning_rate": 0.00026672045209908215, "loss": 4.6051, "mean_token_accuracy": 0.2413678452372551, "num_tokens": 114927267.0, "step": 66255 }, { "entropy": 5.377671957015991, "epoch": 5.155222719315308, "grad_norm": 1.2109375, "learning_rate": 0.00026669275534541703, "loss": 4.7546, "mean_token_accuracy": 0.2295221731066704, "num_tokens": 114935877.0, "step": 66260 }, { "entropy": 5.4117724895477295, "epoch": 5.155611748687026, "grad_norm": 1.3359375, "learning_rate": 0.00026666505871780115, "loss": 4.675, "mean_token_accuracy": 0.2331179141998291, "num_tokens": 114943998.0, "step": 66265 }, { "entropy": 5.41001558303833, "epoch": 5.156000778058743, "grad_norm": 1.2421875, "learning_rate": 0.0002666373622166548, "loss": 4.7276, "mean_token_accuracy": 0.2355026423931122, "num_tokens": 114952802.0, "step": 66270 }, { "entropy": 5.377454710006714, "epoch": 5.156389807430461, "grad_norm": 1.1640625, "learning_rate": 0.00026660966584239815, "loss": 4.6809, "mean_token_accuracy": 0.23454331010580062, "num_tokens": 114961680.0, "step": 66275 }, { "entropy": 5.387762403488159, "epoch": 5.156778836802179, "grad_norm": 1.328125, "learning_rate": 0.00026658196959545145, "loss": 4.7556, "mean_token_accuracy": 0.22974208295345305, "num_tokens": 114970395.0, "step": 66280 }, { "entropy": 5.428138065338135, "epoch": 5.157167866173896, "grad_norm": 1.1875, "learning_rate": 0.00026655427347623494, "loss": 4.7717, "mean_token_accuracy": 0.2305280700325966, "num_tokens": 114979245.0, "step": 66285 }, { "entropy": 5.349743509292603, "epoch": 5.157556895545614, "grad_norm": 1.34375, "learning_rate": 0.0002665265774851689, "loss": 4.6679, "mean_token_accuracy": 0.23415318876504898, "num_tokens": 114988826.0, "step": 66290 }, { "entropy": 5.334540176391601, "epoch": 5.157945924917331, "grad_norm": 1.2109375, "learning_rate": 0.00026649888162267357, "loss": 4.5987, "mean_token_accuracy": 0.2385523021221161, "num_tokens": 114997214.0, "step": 66295 }, { "entropy": 5.477506685256958, "epoch": 5.158334954289049, "grad_norm": 1.265625, "learning_rate": 0.0002664711858891691, "loss": 4.775, "mean_token_accuracy": 0.22298480272293092, "num_tokens": 115005600.0, "step": 66300 }, { "entropy": 5.496365880966186, "epoch": 5.158723983660766, "grad_norm": 1.1796875, "learning_rate": 0.0002664434902850759, "loss": 4.7822, "mean_token_accuracy": 0.22870756089687347, "num_tokens": 115014605.0, "step": 66305 }, { "entropy": 5.541705894470215, "epoch": 5.159113013032484, "grad_norm": 1.2421875, "learning_rate": 0.00026641579481081405, "loss": 4.8555, "mean_token_accuracy": 0.22103175520896912, "num_tokens": 115023810.0, "step": 66310 }, { "entropy": 5.452320337295532, "epoch": 5.159502042404202, "grad_norm": 1.1953125, "learning_rate": 0.00026638809946680393, "loss": 4.6593, "mean_token_accuracy": 0.23280279338359833, "num_tokens": 115033129.0, "step": 66315 }, { "entropy": 5.497965288162232, "epoch": 5.159891071775919, "grad_norm": 1.21875, "learning_rate": 0.00026636040425346565, "loss": 4.8625, "mean_token_accuracy": 0.22063197642564775, "num_tokens": 115042204.0, "step": 66320 }, { "entropy": 5.513740348815918, "epoch": 5.160280101147636, "grad_norm": 1.171875, "learning_rate": 0.0002663327091712195, "loss": 4.8601, "mean_token_accuracy": 0.2238878384232521, "num_tokens": 115052103.0, "step": 66325 }, { "entropy": 5.372989463806152, "epoch": 5.160669130519354, "grad_norm": 1.2578125, "learning_rate": 0.0002663050142204856, "loss": 4.5859, "mean_token_accuracy": 0.24200529754161834, "num_tokens": 115060212.0, "step": 66330 }, { "entropy": 5.3416666984558105, "epoch": 5.161058159891072, "grad_norm": 1.2421875, "learning_rate": 0.00026627731940168445, "loss": 4.5768, "mean_token_accuracy": 0.24907450377941132, "num_tokens": 115069203.0, "step": 66335 }, { "entropy": 5.399899101257324, "epoch": 5.161447189262789, "grad_norm": 1.2265625, "learning_rate": 0.00026624962471523595, "loss": 4.6831, "mean_token_accuracy": 0.23013395667076111, "num_tokens": 115077847.0, "step": 66340 }, { "entropy": 5.400329065322876, "epoch": 5.161836218634507, "grad_norm": 1.3359375, "learning_rate": 0.00026622193016156054, "loss": 4.7399, "mean_token_accuracy": 0.226437309384346, "num_tokens": 115086300.0, "step": 66345 }, { "entropy": 5.424882936477661, "epoch": 5.162225248006225, "grad_norm": 1.265625, "learning_rate": 0.0002661942357410784, "loss": 4.6344, "mean_token_accuracy": 0.23460484594106673, "num_tokens": 115095041.0, "step": 66350 }, { "entropy": 5.354291343688965, "epoch": 5.162614277377942, "grad_norm": 1.234375, "learning_rate": 0.0002661665414542097, "loss": 4.6027, "mean_token_accuracy": 0.23665731996297837, "num_tokens": 115103131.0, "step": 66355 }, { "entropy": 5.464250564575195, "epoch": 5.163003306749659, "grad_norm": 1.234375, "learning_rate": 0.00026613884730137454, "loss": 4.7487, "mean_token_accuracy": 0.23160839974880218, "num_tokens": 115112336.0, "step": 66360 }, { "entropy": 5.344486999511719, "epoch": 5.163392336121377, "grad_norm": 1.2421875, "learning_rate": 0.0002661111532829933, "loss": 4.6744, "mean_token_accuracy": 0.23536170423030853, "num_tokens": 115121488.0, "step": 66365 }, { "entropy": 5.343558597564697, "epoch": 5.163781365493095, "grad_norm": 1.15625, "learning_rate": 0.00026608345939948625, "loss": 4.6278, "mean_token_accuracy": 0.24175651222467423, "num_tokens": 115129536.0, "step": 66370 }, { "entropy": 5.3458113193511965, "epoch": 5.164170394864812, "grad_norm": 1.203125, "learning_rate": 0.0002660557656512734, "loss": 4.6711, "mean_token_accuracy": 0.23355360329151154, "num_tokens": 115137793.0, "step": 66375 }, { "entropy": 5.3754056930542, "epoch": 5.16455942423653, "grad_norm": 1.2734375, "learning_rate": 0.00026602807203877525, "loss": 4.6943, "mean_token_accuracy": 0.23153086155653, "num_tokens": 115146628.0, "step": 66380 }, { "entropy": 5.3893506050109865, "epoch": 5.164948453608248, "grad_norm": 1.15625, "learning_rate": 0.00026600037856241174, "loss": 4.7137, "mean_token_accuracy": 0.22357339709997176, "num_tokens": 115155423.0, "step": 66385 }, { "entropy": 5.36907992362976, "epoch": 5.1653374829799645, "grad_norm": 1.203125, "learning_rate": 0.00026597268522260317, "loss": 4.7184, "mean_token_accuracy": 0.23372651040554046, "num_tokens": 115163632.0, "step": 66390 }, { "entropy": 5.419540786743164, "epoch": 5.165726512351682, "grad_norm": 1.2109375, "learning_rate": 0.00026594499201976966, "loss": 4.7339, "mean_token_accuracy": 0.22615587413311006, "num_tokens": 115172738.0, "step": 66395 }, { "entropy": 5.523875761032104, "epoch": 5.1661155417234, "grad_norm": 1.234375, "learning_rate": 0.00026591729895433157, "loss": 4.8184, "mean_token_accuracy": 0.2119523987174034, "num_tokens": 115181587.0, "step": 66400 }, { "entropy": 5.348265314102173, "epoch": 5.166504571095118, "grad_norm": 1.171875, "learning_rate": 0.00026588960602670896, "loss": 4.5959, "mean_token_accuracy": 0.24473153799772263, "num_tokens": 115190243.0, "step": 66405 }, { "entropy": 5.359602737426758, "epoch": 5.166893600466835, "grad_norm": 1.234375, "learning_rate": 0.00026586191323732213, "loss": 4.689, "mean_token_accuracy": 0.24254054725170135, "num_tokens": 115198725.0, "step": 66410 }, { "entropy": 5.411100435256958, "epoch": 5.167282629838553, "grad_norm": 1.2734375, "learning_rate": 0.0002658342205865912, "loss": 4.7322, "mean_token_accuracy": 0.22872708290815352, "num_tokens": 115207344.0, "step": 66415 }, { "entropy": 5.454765367507934, "epoch": 5.167671659210271, "grad_norm": 1.2109375, "learning_rate": 0.0002658065280749363, "loss": 4.7395, "mean_token_accuracy": 0.2290185958147049, "num_tokens": 115216744.0, "step": 66420 }, { "entropy": 5.335331201553345, "epoch": 5.1680606885819875, "grad_norm": 1.28125, "learning_rate": 0.00026577883570277786, "loss": 4.7042, "mean_token_accuracy": 0.2287403479218483, "num_tokens": 115226243.0, "step": 66425 }, { "entropy": 5.423353958129883, "epoch": 5.168449717953705, "grad_norm": 1.25, "learning_rate": 0.00026575114347053574, "loss": 4.7179, "mean_token_accuracy": 0.2296246334910393, "num_tokens": 115234687.0, "step": 66430 }, { "entropy": 5.429052209854126, "epoch": 5.168838747325423, "grad_norm": 1.21875, "learning_rate": 0.0002657234513786304, "loss": 4.7533, "mean_token_accuracy": 0.23035000115633011, "num_tokens": 115243799.0, "step": 66435 }, { "entropy": 5.414677143096924, "epoch": 5.169227776697141, "grad_norm": 1.21875, "learning_rate": 0.0002656957594274819, "loss": 4.774, "mean_token_accuracy": 0.231318461894989, "num_tokens": 115252637.0, "step": 66440 }, { "entropy": 5.404609060287475, "epoch": 5.169616806068858, "grad_norm": 1.34375, "learning_rate": 0.00026566806761751043, "loss": 4.7208, "mean_token_accuracy": 0.23430444151163102, "num_tokens": 115261093.0, "step": 66445 }, { "entropy": 5.304970026016235, "epoch": 5.170005835440576, "grad_norm": 1.2578125, "learning_rate": 0.0002656403759491362, "loss": 4.5581, "mean_token_accuracy": 0.24215611666440964, "num_tokens": 115270148.0, "step": 66450 }, { "entropy": 5.422722005844117, "epoch": 5.170394864812294, "grad_norm": 1.3203125, "learning_rate": 0.0002656126844227794, "loss": 4.7347, "mean_token_accuracy": 0.2373960554599762, "num_tokens": 115278491.0, "step": 66455 }, { "entropy": 5.39317626953125, "epoch": 5.1707838941840105, "grad_norm": 1.2109375, "learning_rate": 0.00026558499303886015, "loss": 4.636, "mean_token_accuracy": 0.23231945484876632, "num_tokens": 115287756.0, "step": 66460 }, { "entropy": 5.414976596832275, "epoch": 5.171172923555728, "grad_norm": 1.234375, "learning_rate": 0.00026555730179779864, "loss": 4.7326, "mean_token_accuracy": 0.2338121324777603, "num_tokens": 115296817.0, "step": 66465 }, { "entropy": 5.419347667694092, "epoch": 5.171561952927446, "grad_norm": 1.21875, "learning_rate": 0.000265529610700015, "loss": 4.6616, "mean_token_accuracy": 0.23219528198242187, "num_tokens": 115305145.0, "step": 66470 }, { "entropy": 5.364060878753662, "epoch": 5.171950982299164, "grad_norm": 1.296875, "learning_rate": 0.0002655019197459295, "loss": 4.6635, "mean_token_accuracy": 0.2307695910334587, "num_tokens": 115314040.0, "step": 66475 }, { "entropy": 5.3408125877380375, "epoch": 5.172340011670881, "grad_norm": 1.3125, "learning_rate": 0.00026547422893596223, "loss": 4.6804, "mean_token_accuracy": 0.2298760488629341, "num_tokens": 115321936.0, "step": 66480 }, { "entropy": 5.344593906402588, "epoch": 5.172729041042599, "grad_norm": 1.21875, "learning_rate": 0.00026544653827053336, "loss": 4.6997, "mean_token_accuracy": 0.22792448252439498, "num_tokens": 115331148.0, "step": 66485 }, { "entropy": 5.4350574016571045, "epoch": 5.173118070414317, "grad_norm": 1.1875, "learning_rate": 0.0002654188477500631, "loss": 4.7181, "mean_token_accuracy": 0.22526077181100845, "num_tokens": 115339599.0, "step": 66490 }, { "entropy": 5.406511545181274, "epoch": 5.1735070997860335, "grad_norm": 1.2421875, "learning_rate": 0.0002653911573749715, "loss": 4.6486, "mean_token_accuracy": 0.24284175932407379, "num_tokens": 115347850.0, "step": 66495 }, { "entropy": 5.361261892318725, "epoch": 5.173896129157751, "grad_norm": 1.25, "learning_rate": 0.00026536346714567887, "loss": 4.6237, "mean_token_accuracy": 0.23030744791030883, "num_tokens": 115356686.0, "step": 66500 }, { "entropy": 5.364866447448731, "epoch": 5.174285158529469, "grad_norm": 1.40625, "learning_rate": 0.00026533577706260524, "loss": 4.7521, "mean_token_accuracy": 0.2323892369866371, "num_tokens": 115366003.0, "step": 66505 }, { "entropy": 5.355849647521973, "epoch": 5.174674187901187, "grad_norm": 1.2109375, "learning_rate": 0.0002653080871261709, "loss": 4.6653, "mean_token_accuracy": 0.2354801744222641, "num_tokens": 115373876.0, "step": 66510 }, { "entropy": 5.458825588226318, "epoch": 5.175063217272904, "grad_norm": 1.265625, "learning_rate": 0.0002652803973367958, "loss": 4.783, "mean_token_accuracy": 0.22823418974876403, "num_tokens": 115383175.0, "step": 66515 }, { "entropy": 5.411269998550415, "epoch": 5.175452246644622, "grad_norm": 1.1484375, "learning_rate": 0.00026525270769490024, "loss": 4.6751, "mean_token_accuracy": 0.24501416236162185, "num_tokens": 115391885.0, "step": 66520 }, { "entropy": 5.35424542427063, "epoch": 5.175841276016339, "grad_norm": 1.15625, "learning_rate": 0.00026522501820090433, "loss": 4.6143, "mean_token_accuracy": 0.23891518861055375, "num_tokens": 115400948.0, "step": 66525 }, { "entropy": 5.367395305633545, "epoch": 5.1762303053880565, "grad_norm": 1.171875, "learning_rate": 0.00026519732885522826, "loss": 4.6984, "mean_token_accuracy": 0.23093351870775222, "num_tokens": 115409702.0, "step": 66530 }, { "entropy": 5.3480242729187015, "epoch": 5.176619334759774, "grad_norm": 1.2265625, "learning_rate": 0.00026516963965829204, "loss": 4.69, "mean_token_accuracy": 0.23169441819190978, "num_tokens": 115418213.0, "step": 66535 }, { "entropy": 5.407758331298828, "epoch": 5.177008364131492, "grad_norm": 1.2265625, "learning_rate": 0.000265141950610516, "loss": 4.7319, "mean_token_accuracy": 0.232973350584507, "num_tokens": 115426918.0, "step": 66540 }, { "entropy": 5.437516117095948, "epoch": 5.17739739350321, "grad_norm": 1.28125, "learning_rate": 0.0002651142617123201, "loss": 4.7501, "mean_token_accuracy": 0.23080938011407853, "num_tokens": 115435624.0, "step": 66545 }, { "entropy": 5.407209634780884, "epoch": 5.177786422874927, "grad_norm": 1.21875, "learning_rate": 0.0002650865729641246, "loss": 4.6489, "mean_token_accuracy": 0.2442161485552788, "num_tokens": 115443921.0, "step": 66550 }, { "entropy": 5.38073239326477, "epoch": 5.178175452246645, "grad_norm": 1.1484375, "learning_rate": 0.0002650588843663495, "loss": 4.7763, "mean_token_accuracy": 0.22102256417274474, "num_tokens": 115453110.0, "step": 66555 }, { "entropy": 5.353304004669189, "epoch": 5.178564481618362, "grad_norm": 1.25, "learning_rate": 0.000265031195919415, "loss": 4.6581, "mean_token_accuracy": 0.23622562885284423, "num_tokens": 115461374.0, "step": 66560 }, { "entropy": 5.458454895019531, "epoch": 5.1789535109900795, "grad_norm": 1.21875, "learning_rate": 0.00026500350762374115, "loss": 4.8031, "mean_token_accuracy": 0.2235411912202835, "num_tokens": 115470483.0, "step": 66565 }, { "entropy": 5.350240468978882, "epoch": 5.179342540361797, "grad_norm": 1.265625, "learning_rate": 0.00026497581947974836, "loss": 4.5439, "mean_token_accuracy": 0.24542067795991898, "num_tokens": 115479644.0, "step": 66570 }, { "entropy": 5.407918453216553, "epoch": 5.179731569733515, "grad_norm": 1.2265625, "learning_rate": 0.00026494813148785645, "loss": 4.7614, "mean_token_accuracy": 0.22682550698518752, "num_tokens": 115488353.0, "step": 66575 }, { "entropy": 5.357215642929077, "epoch": 5.180120599105233, "grad_norm": 1.171875, "learning_rate": 0.00026492044364848566, "loss": 4.6195, "mean_token_accuracy": 0.23776522427797317, "num_tokens": 115497137.0, "step": 66580 }, { "entropy": 5.2926239490509035, "epoch": 5.18050962847695, "grad_norm": 1.1328125, "learning_rate": 0.0002648927559620561, "loss": 4.5748, "mean_token_accuracy": 0.24359971284866333, "num_tokens": 115506289.0, "step": 66585 }, { "entropy": 5.433597755432129, "epoch": 5.180898657848668, "grad_norm": 1.4140625, "learning_rate": 0.0002648650684289879, "loss": 4.7014, "mean_token_accuracy": 0.22783830761909485, "num_tokens": 115514704.0, "step": 66590 }, { "entropy": 5.312577915191651, "epoch": 5.181287687220385, "grad_norm": 1.25, "learning_rate": 0.0002648373810497011, "loss": 4.6575, "mean_token_accuracy": 0.2387799620628357, "num_tokens": 115523381.0, "step": 66595 }, { "entropy": 5.405880546569824, "epoch": 5.1816767165921025, "grad_norm": 1.28125, "learning_rate": 0.0002648096938246159, "loss": 4.7305, "mean_token_accuracy": 0.23448034673929213, "num_tokens": 115532128.0, "step": 66600 }, { "entropy": 5.462495756149292, "epoch": 5.18206574596382, "grad_norm": 1.2578125, "learning_rate": 0.0002647820067541524, "loss": 4.7757, "mean_token_accuracy": 0.23255939781665802, "num_tokens": 115541018.0, "step": 66605 }, { "entropy": 5.4276063442230225, "epoch": 5.182454775335538, "grad_norm": 1.1875, "learning_rate": 0.00026475431983873066, "loss": 4.7561, "mean_token_accuracy": 0.22834536731243132, "num_tokens": 115550273.0, "step": 66610 }, { "entropy": 5.474047756195068, "epoch": 5.182843804707256, "grad_norm": 1.2421875, "learning_rate": 0.0002647266330787708, "loss": 4.7131, "mean_token_accuracy": 0.23367710262537003, "num_tokens": 115558735.0, "step": 66615 }, { "entropy": 5.479162406921387, "epoch": 5.183232834078973, "grad_norm": 1.28125, "learning_rate": 0.00026469894647469295, "loss": 4.8239, "mean_token_accuracy": 0.22698970437049865, "num_tokens": 115567359.0, "step": 66620 }, { "entropy": 5.355253219604492, "epoch": 5.183621863450691, "grad_norm": 1.265625, "learning_rate": 0.0002646712600269172, "loss": 4.6481, "mean_token_accuracy": 0.2414157435297966, "num_tokens": 115575119.0, "step": 66625 }, { "entropy": 5.4224800109863285, "epoch": 5.184010892822408, "grad_norm": 1.2734375, "learning_rate": 0.0002646435737358635, "loss": 4.7406, "mean_token_accuracy": 0.23100375831127168, "num_tokens": 115583691.0, "step": 66630 }, { "entropy": 5.4344069480896, "epoch": 5.1843999221941255, "grad_norm": 1.296875, "learning_rate": 0.0002646158876019522, "loss": 4.7263, "mean_token_accuracy": 0.23520067632198333, "num_tokens": 115592425.0, "step": 66635 }, { "entropy": 5.417125701904297, "epoch": 5.184788951565843, "grad_norm": 1.15625, "learning_rate": 0.0002645882016256033, "loss": 4.685, "mean_token_accuracy": 0.2304583102464676, "num_tokens": 115602317.0, "step": 66640 }, { "entropy": 5.391387271881103, "epoch": 5.185177980937561, "grad_norm": 1.3125, "learning_rate": 0.0002645605158072368, "loss": 4.7441, "mean_token_accuracy": 0.23463061451911926, "num_tokens": 115610596.0, "step": 66645 }, { "entropy": 5.371836709976196, "epoch": 5.185567010309279, "grad_norm": 1.3125, "learning_rate": 0.000264532830147273, "loss": 4.6892, "mean_token_accuracy": 0.22938281297683716, "num_tokens": 115619737.0, "step": 66650 }, { "entropy": 5.425459289550782, "epoch": 5.185956039680996, "grad_norm": 1.2265625, "learning_rate": 0.00026450514464613177, "loss": 4.7041, "mean_token_accuracy": 0.22937609106302262, "num_tokens": 115628160.0, "step": 66655 }, { "entropy": 5.3927388191223145, "epoch": 5.186345069052713, "grad_norm": 1.3046875, "learning_rate": 0.0002644774593042332, "loss": 4.7353, "mean_token_accuracy": 0.23127149492502214, "num_tokens": 115636267.0, "step": 66660 }, { "entropy": 5.396825504302979, "epoch": 5.186734098424431, "grad_norm": 1.2265625, "learning_rate": 0.0002644497741219975, "loss": 4.6858, "mean_token_accuracy": 0.23586197346448898, "num_tokens": 115645043.0, "step": 66665 }, { "entropy": 5.3639326095581055, "epoch": 5.1871231277961485, "grad_norm": 1.234375, "learning_rate": 0.0002644220890998447, "loss": 4.5971, "mean_token_accuracy": 0.24752693325281144, "num_tokens": 115653073.0, "step": 66670 }, { "entropy": 5.354261684417724, "epoch": 5.187512157167866, "grad_norm": 1.2109375, "learning_rate": 0.00026439440423819483, "loss": 4.7086, "mean_token_accuracy": 0.23109793215990065, "num_tokens": 115661979.0, "step": 66675 }, { "entropy": 5.378603410720825, "epoch": 5.187901186539584, "grad_norm": 1.1953125, "learning_rate": 0.000264366719537468, "loss": 4.6686, "mean_token_accuracy": 0.23499181121587753, "num_tokens": 115670623.0, "step": 66680 }, { "entropy": 5.409667587280273, "epoch": 5.188290215911302, "grad_norm": 1.1953125, "learning_rate": 0.0002643390349980843, "loss": 4.7159, "mean_token_accuracy": 0.22925227284431457, "num_tokens": 115679127.0, "step": 66685 }, { "entropy": 5.349870204925537, "epoch": 5.188679245283019, "grad_norm": 1.1875, "learning_rate": 0.0002643113506204637, "loss": 4.6897, "mean_token_accuracy": 0.23326584398746492, "num_tokens": 115687918.0, "step": 66690 }, { "entropy": 5.386233949661255, "epoch": 5.189068274654736, "grad_norm": 1.1953125, "learning_rate": 0.0002642836664050263, "loss": 4.638, "mean_token_accuracy": 0.24373760521411897, "num_tokens": 115696002.0, "step": 66695 }, { "entropy": 5.3983948707580565, "epoch": 5.189457304026454, "grad_norm": 1.2109375, "learning_rate": 0.00026425598235219235, "loss": 4.7082, "mean_token_accuracy": 0.2280642047524452, "num_tokens": 115705158.0, "step": 66700 }, { "entropy": 5.398994398117066, "epoch": 5.1898463333981715, "grad_norm": 1.21875, "learning_rate": 0.00026422829846238174, "loss": 4.6625, "mean_token_accuracy": 0.23604964315891266, "num_tokens": 115713674.0, "step": 66705 }, { "entropy": 5.471413421630859, "epoch": 5.190235362769889, "grad_norm": 1.2265625, "learning_rate": 0.00026420061473601445, "loss": 4.7565, "mean_token_accuracy": 0.22825206071138382, "num_tokens": 115722535.0, "step": 66710 }, { "entropy": 5.4131622314453125, "epoch": 5.190624392141607, "grad_norm": 1.21875, "learning_rate": 0.00026417293117351077, "loss": 4.694, "mean_token_accuracy": 0.23339079171419144, "num_tokens": 115730997.0, "step": 66715 }, { "entropy": 5.424811506271363, "epoch": 5.191013421513325, "grad_norm": 1.171875, "learning_rate": 0.00026414524777529055, "loss": 4.7293, "mean_token_accuracy": 0.22487339228391648, "num_tokens": 115739653.0, "step": 66720 }, { "entropy": 5.4809552192687985, "epoch": 5.191402450885041, "grad_norm": 1.375, "learning_rate": 0.0002641175645417739, "loss": 4.7618, "mean_token_accuracy": 0.22200549393892288, "num_tokens": 115747778.0, "step": 66725 }, { "entropy": 5.416953086853027, "epoch": 5.191791480256759, "grad_norm": 1.171875, "learning_rate": 0.000264089881473381, "loss": 4.7557, "mean_token_accuracy": 0.22009914070367814, "num_tokens": 115757451.0, "step": 66730 }, { "entropy": 5.49046573638916, "epoch": 5.192180509628477, "grad_norm": 1.25, "learning_rate": 0.0002640621985705318, "loss": 4.7453, "mean_token_accuracy": 0.22851253747940065, "num_tokens": 115766091.0, "step": 66735 }, { "entropy": 5.461507320404053, "epoch": 5.1925695390001945, "grad_norm": 1.2578125, "learning_rate": 0.00026403451583364616, "loss": 4.7116, "mean_token_accuracy": 0.23616015613079072, "num_tokens": 115774329.0, "step": 66740 }, { "entropy": 5.366433906555176, "epoch": 5.192958568371912, "grad_norm": 1.34375, "learning_rate": 0.0002640068332631444, "loss": 4.6621, "mean_token_accuracy": 0.23427434414625167, "num_tokens": 115782601.0, "step": 66745 }, { "entropy": 5.393208360671997, "epoch": 5.19334759774363, "grad_norm": 1.3046875, "learning_rate": 0.0002639791508594464, "loss": 4.704, "mean_token_accuracy": 0.23692605644464493, "num_tokens": 115791261.0, "step": 66750 }, { "entropy": 5.3969056606292725, "epoch": 5.193736627115348, "grad_norm": 1.28125, "learning_rate": 0.00026395146862297225, "loss": 4.7063, "mean_token_accuracy": 0.2316366031765938, "num_tokens": 115800268.0, "step": 66755 }, { "entropy": 5.394565582275391, "epoch": 5.194125656487064, "grad_norm": 1.1953125, "learning_rate": 0.000263923786554142, "loss": 4.6543, "mean_token_accuracy": 0.23227832168340684, "num_tokens": 115809098.0, "step": 66760 }, { "entropy": 5.4379448890686035, "epoch": 5.194514685858782, "grad_norm": 1.296875, "learning_rate": 0.0002638961046533756, "loss": 4.7823, "mean_token_accuracy": 0.22195144593715668, "num_tokens": 115817694.0, "step": 66765 }, { "entropy": 5.40190019607544, "epoch": 5.1949037152305, "grad_norm": 1.2421875, "learning_rate": 0.0002638684229210932, "loss": 4.7034, "mean_token_accuracy": 0.23486540615558624, "num_tokens": 115826684.0, "step": 66770 }, { "entropy": 5.426560115814209, "epoch": 5.1952927446022175, "grad_norm": 1.2578125, "learning_rate": 0.00026384074135771474, "loss": 4.7482, "mean_token_accuracy": 0.22626017034053802, "num_tokens": 115835229.0, "step": 66775 }, { "entropy": 5.4902793884277346, "epoch": 5.195681773973935, "grad_norm": 1.296875, "learning_rate": 0.0002638130599636603, "loss": 4.7247, "mean_token_accuracy": 0.23835522681474686, "num_tokens": 115843442.0, "step": 66780 }, { "entropy": 5.466753244400024, "epoch": 5.196070803345653, "grad_norm": 1.203125, "learning_rate": 0.00026378537873934983, "loss": 4.7745, "mean_token_accuracy": 0.2245756655931473, "num_tokens": 115852427.0, "step": 66785 }, { "entropy": 5.420783042907715, "epoch": 5.1964598327173706, "grad_norm": 1.34375, "learning_rate": 0.00026375769768520344, "loss": 4.734, "mean_token_accuracy": 0.22221490144729614, "num_tokens": 115860651.0, "step": 66790 }, { "entropy": 5.426042366027832, "epoch": 5.196848862089087, "grad_norm": 1.2578125, "learning_rate": 0.000263730016801641, "loss": 4.7933, "mean_token_accuracy": 0.22274277359247208, "num_tokens": 115868344.0, "step": 66795 }, { "entropy": 5.418788146972656, "epoch": 5.197237891460805, "grad_norm": 1.171875, "learning_rate": 0.0002637023360890827, "loss": 4.7246, "mean_token_accuracy": 0.22883989065885543, "num_tokens": 115876652.0, "step": 66800 }, { "entropy": 5.293851757049561, "epoch": 5.197626920832523, "grad_norm": 1.2265625, "learning_rate": 0.00026367465554794843, "loss": 4.6189, "mean_token_accuracy": 0.23460931032896043, "num_tokens": 115885478.0, "step": 66805 }, { "entropy": 5.3742919921875, "epoch": 5.1980159502042405, "grad_norm": 1.2109375, "learning_rate": 0.00026364697517865834, "loss": 4.7583, "mean_token_accuracy": 0.2306802451610565, "num_tokens": 115894196.0, "step": 66810 }, { "entropy": 5.429883623123169, "epoch": 5.198404979575958, "grad_norm": 1.2265625, "learning_rate": 0.0002636192949816322, "loss": 4.7055, "mean_token_accuracy": 0.23416150063276292, "num_tokens": 115902559.0, "step": 66815 }, { "entropy": 5.519118928909302, "epoch": 5.198794008947676, "grad_norm": 1.375, "learning_rate": 0.0002635916149572902, "loss": 4.8137, "mean_token_accuracy": 0.22269026190042496, "num_tokens": 115910710.0, "step": 66820 }, { "entropy": 5.446938800811767, "epoch": 5.1991830383193935, "grad_norm": 1.2421875, "learning_rate": 0.00026356393510605224, "loss": 4.7921, "mean_token_accuracy": 0.22143012285232544, "num_tokens": 115919306.0, "step": 66825 }, { "entropy": 5.419488382339478, "epoch": 5.19957206769111, "grad_norm": 1.2890625, "learning_rate": 0.0002635362554283383, "loss": 4.7385, "mean_token_accuracy": 0.23185072392225264, "num_tokens": 115928446.0, "step": 66830 }, { "entropy": 5.4105418682098385, "epoch": 5.199961097062828, "grad_norm": 1.203125, "learning_rate": 0.0002635085759245686, "loss": 4.7009, "mean_token_accuracy": 0.23526550084352493, "num_tokens": 115937487.0, "step": 66835 }, { "entropy": 5.422021770477295, "epoch": 5.200350126434546, "grad_norm": 1.3203125, "learning_rate": 0.0002634808965951629, "loss": 4.7143, "mean_token_accuracy": 0.23393051624298095, "num_tokens": 115946056.0, "step": 66840 }, { "entropy": 5.394704055786133, "epoch": 5.2007391558062634, "grad_norm": 1.2265625, "learning_rate": 0.0002634532174405413, "loss": 4.8149, "mean_token_accuracy": 0.2219460964202881, "num_tokens": 115954773.0, "step": 66845 }, { "entropy": 5.358224010467529, "epoch": 5.201128185177981, "grad_norm": 1.2734375, "learning_rate": 0.00026342553846112364, "loss": 4.6886, "mean_token_accuracy": 0.22903091013431548, "num_tokens": 115964305.0, "step": 66850 }, { "entropy": 5.377748250961304, "epoch": 5.201517214549699, "grad_norm": 1.2578125, "learning_rate": 0.0002633978596573301, "loss": 4.6304, "mean_token_accuracy": 0.23878708779811858, "num_tokens": 115972276.0, "step": 66855 }, { "entropy": 5.37067666053772, "epoch": 5.201906243921416, "grad_norm": 1.2734375, "learning_rate": 0.00026337018102958056, "loss": 4.6633, "mean_token_accuracy": 0.23262891322374343, "num_tokens": 115980284.0, "step": 66860 }, { "entropy": 5.391755771636963, "epoch": 5.202295273293133, "grad_norm": 1.2734375, "learning_rate": 0.000263342502578295, "loss": 4.6712, "mean_token_accuracy": 0.2420029178261757, "num_tokens": 115988793.0, "step": 66865 }, { "entropy": 5.443074893951416, "epoch": 5.202684302664851, "grad_norm": 1.2109375, "learning_rate": 0.00026331482430389343, "loss": 4.7163, "mean_token_accuracy": 0.23009722232818602, "num_tokens": 115997141.0, "step": 66870 }, { "entropy": 5.453098154067993, "epoch": 5.203073332036569, "grad_norm": 1.21875, "learning_rate": 0.00026328714620679576, "loss": 4.7571, "mean_token_accuracy": 0.2267243191599846, "num_tokens": 116005096.0, "step": 66875 }, { "entropy": 5.284905672073364, "epoch": 5.203462361408286, "grad_norm": 1.3203125, "learning_rate": 0.00026325946828742203, "loss": 4.6652, "mean_token_accuracy": 0.23756748288869858, "num_tokens": 116013294.0, "step": 66880 }, { "entropy": 5.303067398071289, "epoch": 5.203851390780004, "grad_norm": 1.3046875, "learning_rate": 0.00026323179054619215, "loss": 4.5792, "mean_token_accuracy": 0.2421253055334091, "num_tokens": 116021607.0, "step": 66885 }, { "entropy": 5.350574779510498, "epoch": 5.204240420151722, "grad_norm": 1.2421875, "learning_rate": 0.0002632041129835262, "loss": 4.6495, "mean_token_accuracy": 0.23439411967992782, "num_tokens": 116030082.0, "step": 66890 }, { "entropy": 5.409378337860107, "epoch": 5.204629449523439, "grad_norm": 1.234375, "learning_rate": 0.00026317643559984396, "loss": 4.7582, "mean_token_accuracy": 0.2289731428027153, "num_tokens": 116038469.0, "step": 66895 }, { "entropy": 5.37337703704834, "epoch": 5.205018478895156, "grad_norm": 1.234375, "learning_rate": 0.0002631487583955655, "loss": 4.6208, "mean_token_accuracy": 0.23720172345638274, "num_tokens": 116046703.0, "step": 66900 }, { "entropy": 5.35559983253479, "epoch": 5.205407508266874, "grad_norm": 1.2265625, "learning_rate": 0.00026312108137111086, "loss": 4.6157, "mean_token_accuracy": 0.2374376654624939, "num_tokens": 116055140.0, "step": 66905 }, { "entropy": 5.414861679077148, "epoch": 5.205796537638592, "grad_norm": 1.2265625, "learning_rate": 0.0002630934045268998, "loss": 4.7378, "mean_token_accuracy": 0.23329027444124223, "num_tokens": 116064279.0, "step": 66910 }, { "entropy": 5.375687837600708, "epoch": 5.206185567010309, "grad_norm": 1.296875, "learning_rate": 0.0002630657278633525, "loss": 4.6508, "mean_token_accuracy": 0.23344203531742097, "num_tokens": 116072847.0, "step": 66915 }, { "entropy": 5.411289358139038, "epoch": 5.206574596382027, "grad_norm": 1.2890625, "learning_rate": 0.0002630380513808887, "loss": 4.7431, "mean_token_accuracy": 0.2310434341430664, "num_tokens": 116081536.0, "step": 66920 }, { "entropy": 5.443298625946045, "epoch": 5.206963625753745, "grad_norm": 1.21875, "learning_rate": 0.0002630103750799284, "loss": 4.6894, "mean_token_accuracy": 0.2339365914463997, "num_tokens": 116089936.0, "step": 66925 }, { "entropy": 5.404892826080323, "epoch": 5.207352655125462, "grad_norm": 1.3828125, "learning_rate": 0.00026298269896089164, "loss": 4.6914, "mean_token_accuracy": 0.2374357610940933, "num_tokens": 116098202.0, "step": 66930 }, { "entropy": 5.314939165115357, "epoch": 5.207741684497179, "grad_norm": 1.21875, "learning_rate": 0.00026295502302419826, "loss": 4.6423, "mean_token_accuracy": 0.2358327627182007, "num_tokens": 116107429.0, "step": 66935 }, { "entropy": 5.273540449142456, "epoch": 5.208130713868897, "grad_norm": 1.2421875, "learning_rate": 0.0002629273472702683, "loss": 4.568, "mean_token_accuracy": 0.2419932261109352, "num_tokens": 116116294.0, "step": 66940 }, { "entropy": 5.397609519958496, "epoch": 5.208519743240615, "grad_norm": 1.171875, "learning_rate": 0.0002628996716995215, "loss": 4.7699, "mean_token_accuracy": 0.2224861592054367, "num_tokens": 116125102.0, "step": 66945 }, { "entropy": 5.394065713882446, "epoch": 5.208908772612332, "grad_norm": 1.3125, "learning_rate": 0.000262871996312378, "loss": 4.6644, "mean_token_accuracy": 0.23367744237184523, "num_tokens": 116133467.0, "step": 66950 }, { "entropy": 5.414559459686279, "epoch": 5.20929780198405, "grad_norm": 1.2109375, "learning_rate": 0.00026284432110925765, "loss": 4.6755, "mean_token_accuracy": 0.2348521575331688, "num_tokens": 116142374.0, "step": 66955 }, { "entropy": 5.523514366149902, "epoch": 5.209686831355767, "grad_norm": 1.3046875, "learning_rate": 0.00026281664609058037, "loss": 4.8171, "mean_token_accuracy": 0.2244883418083191, "num_tokens": 116151222.0, "step": 66960 }, { "entropy": 5.414645004272461, "epoch": 5.210075860727485, "grad_norm": 1.3515625, "learning_rate": 0.0002627889712567661, "loss": 4.7078, "mean_token_accuracy": 0.23553937077522277, "num_tokens": 116160621.0, "step": 66965 }, { "entropy": 5.408946990966797, "epoch": 5.210464890099202, "grad_norm": 1.140625, "learning_rate": 0.00026276129660823475, "loss": 4.7879, "mean_token_accuracy": 0.23229963928461075, "num_tokens": 116170419.0, "step": 66970 }, { "entropy": 5.421690893173218, "epoch": 5.21085391947092, "grad_norm": 1.2265625, "learning_rate": 0.00026273362214540623, "loss": 4.7362, "mean_token_accuracy": 0.2221705883741379, "num_tokens": 116179357.0, "step": 66975 }, { "entropy": 5.329740762710571, "epoch": 5.211242948842638, "grad_norm": 1.2265625, "learning_rate": 0.0002627059478687005, "loss": 4.5871, "mean_token_accuracy": 0.2394294708967209, "num_tokens": 116188306.0, "step": 66980 }, { "entropy": 5.442807054519653, "epoch": 5.211631978214355, "grad_norm": 1.2890625, "learning_rate": 0.0002626782737785374, "loss": 4.7631, "mean_token_accuracy": 0.2313667953014374, "num_tokens": 116197100.0, "step": 66985 }, { "entropy": 5.348980045318603, "epoch": 5.212021007586073, "grad_norm": 1.265625, "learning_rate": 0.00026265059987533697, "loss": 4.7781, "mean_token_accuracy": 0.23036125302314758, "num_tokens": 116205924.0, "step": 66990 }, { "entropy": 5.35806188583374, "epoch": 5.21241003695779, "grad_norm": 1.1875, "learning_rate": 0.00026262292615951893, "loss": 4.6892, "mean_token_accuracy": 0.23715207427740098, "num_tokens": 116215255.0, "step": 66995 }, { "entropy": 5.432737493515015, "epoch": 5.212799066329508, "grad_norm": 1.734375, "learning_rate": 0.0002625952526315034, "loss": 4.7348, "mean_token_accuracy": 0.2308162823319435, "num_tokens": 116224723.0, "step": 67000 }, { "entropy": 5.419402456283569, "epoch": 5.213188095701225, "grad_norm": 1.1796875, "learning_rate": 0.0002625675792917101, "loss": 4.6977, "mean_token_accuracy": 0.23954665362834932, "num_tokens": 116234251.0, "step": 67005 }, { "entropy": 5.424380588531494, "epoch": 5.213577125072943, "grad_norm": 1.2421875, "learning_rate": 0.000262539906140559, "loss": 4.7674, "mean_token_accuracy": 0.22445859014987946, "num_tokens": 116243402.0, "step": 67010 }, { "entropy": 5.346519184112549, "epoch": 5.213966154444661, "grad_norm": 1.1875, "learning_rate": 0.00026251223317847003, "loss": 4.6723, "mean_token_accuracy": 0.23416320681571962, "num_tokens": 116251883.0, "step": 67015 }, { "entropy": 5.480128765106201, "epoch": 5.214355183816378, "grad_norm": 1.15625, "learning_rate": 0.000262484560405863, "loss": 4.8746, "mean_token_accuracy": 0.21486998796463014, "num_tokens": 116260721.0, "step": 67020 }, { "entropy": 5.449476337432861, "epoch": 5.214744213188096, "grad_norm": 1.1875, "learning_rate": 0.00026245688782315787, "loss": 4.6959, "mean_token_accuracy": 0.23218224048614503, "num_tokens": 116270008.0, "step": 67025 }, { "entropy": 5.464039897918701, "epoch": 5.215133242559813, "grad_norm": 1.171875, "learning_rate": 0.00026242921543077435, "loss": 4.8087, "mean_token_accuracy": 0.22978552728891372, "num_tokens": 116278920.0, "step": 67030 }, { "entropy": 5.393578147888183, "epoch": 5.215522271931531, "grad_norm": 1.1484375, "learning_rate": 0.0002624015432291326, "loss": 4.7506, "mean_token_accuracy": 0.2244909703731537, "num_tokens": 116287896.0, "step": 67035 }, { "entropy": 5.337471342086792, "epoch": 5.215911301303248, "grad_norm": 1.1796875, "learning_rate": 0.0002623738712186525, "loss": 4.6171, "mean_token_accuracy": 0.24403032809495925, "num_tokens": 116297117.0, "step": 67040 }, { "entropy": 5.37034797668457, "epoch": 5.216300330674966, "grad_norm": 1.2265625, "learning_rate": 0.00026234619939975365, "loss": 4.6886, "mean_token_accuracy": 0.2300478160381317, "num_tokens": 116305729.0, "step": 67045 }, { "entropy": 5.3906717777252195, "epoch": 5.216689360046684, "grad_norm": 1.1640625, "learning_rate": 0.00026231852777285606, "loss": 4.683, "mean_token_accuracy": 0.23300980031490326, "num_tokens": 116314542.0, "step": 67050 }, { "entropy": 5.41131625175476, "epoch": 5.217078389418401, "grad_norm": 1.2421875, "learning_rate": 0.00026229085633837975, "loss": 4.7058, "mean_token_accuracy": 0.22886818945407866, "num_tokens": 116324315.0, "step": 67055 }, { "entropy": 5.433721494674683, "epoch": 5.217467418790118, "grad_norm": 1.2734375, "learning_rate": 0.0002622631850967444, "loss": 4.7022, "mean_token_accuracy": 0.23028027266263962, "num_tokens": 116332837.0, "step": 67060 }, { "entropy": 5.395877552032471, "epoch": 5.217856448161836, "grad_norm": 1.3984375, "learning_rate": 0.00026223551404837, "loss": 4.6219, "mean_token_accuracy": 0.24128084182739257, "num_tokens": 116341219.0, "step": 67065 }, { "entropy": 5.310512924194336, "epoch": 5.218245477533554, "grad_norm": 1.2421875, "learning_rate": 0.00026220784319367626, "loss": 4.6805, "mean_token_accuracy": 0.2342594474554062, "num_tokens": 116349233.0, "step": 67070 }, { "entropy": 5.4932088375091555, "epoch": 5.218634506905271, "grad_norm": 1.203125, "learning_rate": 0.0002621801725330832, "loss": 4.8079, "mean_token_accuracy": 0.2190869376063347, "num_tokens": 116358449.0, "step": 67075 }, { "entropy": 5.42773699760437, "epoch": 5.219023536276989, "grad_norm": 1.1875, "learning_rate": 0.0002621525020670106, "loss": 4.7383, "mean_token_accuracy": 0.22296229004859924, "num_tokens": 116366608.0, "step": 67080 }, { "entropy": 5.517432928085327, "epoch": 5.219412565648707, "grad_norm": 1.2109375, "learning_rate": 0.0002621248317958784, "loss": 4.8073, "mean_token_accuracy": 0.2235269770026207, "num_tokens": 116374906.0, "step": 67085 }, { "entropy": 5.472274494171143, "epoch": 5.219801595020424, "grad_norm": 1.2578125, "learning_rate": 0.00026209716172010636, "loss": 4.7647, "mean_token_accuracy": 0.22768107205629348, "num_tokens": 116384630.0, "step": 67090 }, { "entropy": 5.39162311553955, "epoch": 5.220190624392141, "grad_norm": 1.2109375, "learning_rate": 0.0002620694918401142, "loss": 4.6125, "mean_token_accuracy": 0.23564833998680115, "num_tokens": 116393473.0, "step": 67095 }, { "entropy": 5.327333450317383, "epoch": 5.220579653763859, "grad_norm": 1.3125, "learning_rate": 0.000262041822156322, "loss": 4.5598, "mean_token_accuracy": 0.2506711736321449, "num_tokens": 116401144.0, "step": 67100 }, { "entropy": 5.332838439941407, "epoch": 5.220968683135577, "grad_norm": 1.1484375, "learning_rate": 0.0002620141526691496, "loss": 4.6817, "mean_token_accuracy": 0.23285489082336425, "num_tokens": 116409994.0, "step": 67105 }, { "entropy": 5.343691492080689, "epoch": 5.221357712507294, "grad_norm": 1.2734375, "learning_rate": 0.00026198648337901674, "loss": 4.6639, "mean_token_accuracy": 0.24353963881731033, "num_tokens": 116418399.0, "step": 67110 }, { "entropy": 5.38607120513916, "epoch": 5.221746741879012, "grad_norm": 1.125, "learning_rate": 0.00026195881428634334, "loss": 4.6536, "mean_token_accuracy": 0.23533177226781846, "num_tokens": 116427683.0, "step": 67115 }, { "entropy": 5.348475408554077, "epoch": 5.22213577125073, "grad_norm": 1.1796875, "learning_rate": 0.00026193114539154903, "loss": 4.661, "mean_token_accuracy": 0.23248441368341446, "num_tokens": 116436333.0, "step": 67120 }, { "entropy": 5.402314376831055, "epoch": 5.222524800622447, "grad_norm": 1.2421875, "learning_rate": 0.0002619034766950539, "loss": 4.714, "mean_token_accuracy": 0.23208766132593156, "num_tokens": 116444823.0, "step": 67125 }, { "entropy": 5.390159177780151, "epoch": 5.222913829994164, "grad_norm": 1.296875, "learning_rate": 0.0002618758081972776, "loss": 4.6974, "mean_token_accuracy": 0.23342971056699752, "num_tokens": 116453245.0, "step": 67130 }, { "entropy": 5.428356504440307, "epoch": 5.223302859365882, "grad_norm": 1.2109375, "learning_rate": 0.0002618481398986401, "loss": 4.8284, "mean_token_accuracy": 0.22293556928634645, "num_tokens": 116461921.0, "step": 67135 }, { "entropy": 5.405839490890503, "epoch": 5.2236918887376, "grad_norm": 1.2890625, "learning_rate": 0.00026182047179956107, "loss": 4.7624, "mean_token_accuracy": 0.23294555246829987, "num_tokens": 116470037.0, "step": 67140 }, { "entropy": 5.316297435760498, "epoch": 5.224080918109317, "grad_norm": 1.265625, "learning_rate": 0.00026179280390046047, "loss": 4.668, "mean_token_accuracy": 0.24213544875383378, "num_tokens": 116478881.0, "step": 67145 }, { "entropy": 5.34333176612854, "epoch": 5.224469947481035, "grad_norm": 1.25, "learning_rate": 0.00026176513620175795, "loss": 4.6799, "mean_token_accuracy": 0.2334248125553131, "num_tokens": 116487305.0, "step": 67150 }, { "entropy": 5.371088123321533, "epoch": 5.224858976852753, "grad_norm": 1.1875, "learning_rate": 0.0002617374687038735, "loss": 4.6598, "mean_token_accuracy": 0.23291896432638168, "num_tokens": 116496646.0, "step": 67155 }, { "entropy": 5.412616014480591, "epoch": 5.22524800622447, "grad_norm": 1.2265625, "learning_rate": 0.00026170980140722677, "loss": 4.6666, "mean_token_accuracy": 0.23399246037006377, "num_tokens": 116505356.0, "step": 67160 }, { "entropy": 5.385659837722779, "epoch": 5.225637035596187, "grad_norm": 1.25, "learning_rate": 0.00026168213431223777, "loss": 4.7726, "mean_token_accuracy": 0.22493771314620972, "num_tokens": 116514008.0, "step": 67165 }, { "entropy": 5.385939455032348, "epoch": 5.226026064967905, "grad_norm": 1.21875, "learning_rate": 0.00026165446741932606, "loss": 4.5951, "mean_token_accuracy": 0.24019682705402373, "num_tokens": 116522513.0, "step": 67170 }, { "entropy": 5.331109285354614, "epoch": 5.226415094339623, "grad_norm": 1.34375, "learning_rate": 0.00026162680072891166, "loss": 4.6217, "mean_token_accuracy": 0.23934606313705445, "num_tokens": 116530706.0, "step": 67175 }, { "entropy": 5.32786455154419, "epoch": 5.22680412371134, "grad_norm": 1.2578125, "learning_rate": 0.00026159913424141426, "loss": 4.6696, "mean_token_accuracy": 0.23382638841867448, "num_tokens": 116539277.0, "step": 67180 }, { "entropy": 5.389493083953857, "epoch": 5.227193153083058, "grad_norm": 1.234375, "learning_rate": 0.0002615714679572536, "loss": 4.6894, "mean_token_accuracy": 0.23388569951057434, "num_tokens": 116548586.0, "step": 67185 }, { "entropy": 5.300423336029053, "epoch": 5.227582182454776, "grad_norm": 1.1875, "learning_rate": 0.00026154380187684963, "loss": 4.5889, "mean_token_accuracy": 0.23865025490522385, "num_tokens": 116557121.0, "step": 67190 }, { "entropy": 5.37852110862732, "epoch": 5.2279712118264925, "grad_norm": 1.265625, "learning_rate": 0.000261516136000622, "loss": 4.6776, "mean_token_accuracy": 0.22680604457855225, "num_tokens": 116565698.0, "step": 67195 }, { "entropy": 5.383540678024292, "epoch": 5.22836024119821, "grad_norm": 1.3046875, "learning_rate": 0.0002614884703289906, "loss": 4.7322, "mean_token_accuracy": 0.23250954300165178, "num_tokens": 116573751.0, "step": 67200 }, { "entropy": 5.31975531578064, "epoch": 5.228749270569928, "grad_norm": 1.2734375, "learning_rate": 0.00026146080486237513, "loss": 4.6481, "mean_token_accuracy": 0.242208856344223, "num_tokens": 116581901.0, "step": 67205 }, { "entropy": 5.407828235626221, "epoch": 5.229138299941646, "grad_norm": 1.296875, "learning_rate": 0.00026143313960119534, "loss": 4.7359, "mean_token_accuracy": 0.2288748502731323, "num_tokens": 116590827.0, "step": 67210 }, { "entropy": 5.426082563400269, "epoch": 5.229527329313363, "grad_norm": 1.1953125, "learning_rate": 0.0002614054745458711, "loss": 4.7335, "mean_token_accuracy": 0.23252734690904617, "num_tokens": 116599319.0, "step": 67215 }, { "entropy": 5.333526134490967, "epoch": 5.229916358685081, "grad_norm": 1.3046875, "learning_rate": 0.00026137780969682215, "loss": 4.664, "mean_token_accuracy": 0.2276516705751419, "num_tokens": 116607573.0, "step": 67220 }, { "entropy": 5.275151062011719, "epoch": 5.230305388056799, "grad_norm": 1.1953125, "learning_rate": 0.0002613501450544683, "loss": 4.6454, "mean_token_accuracy": 0.23069819808006287, "num_tokens": 116615998.0, "step": 67225 }, { "entropy": 5.397999095916748, "epoch": 5.2306944174285155, "grad_norm": 1.2890625, "learning_rate": 0.0002613224806192291, "loss": 4.6758, "mean_token_accuracy": 0.2346273899078369, "num_tokens": 116624557.0, "step": 67230 }, { "entropy": 5.395716428756714, "epoch": 5.231083446800233, "grad_norm": 1.328125, "learning_rate": 0.0002612948163915247, "loss": 4.7019, "mean_token_accuracy": 0.22342079281806945, "num_tokens": 116633443.0, "step": 67235 }, { "entropy": 5.437121343612671, "epoch": 5.231472476171951, "grad_norm": 1.3125, "learning_rate": 0.0002612671523717745, "loss": 4.8846, "mean_token_accuracy": 0.21760348826646805, "num_tokens": 116641988.0, "step": 67240 }, { "entropy": 5.438926267623901, "epoch": 5.231861505543669, "grad_norm": 1.1875, "learning_rate": 0.0002612394885603985, "loss": 4.7298, "mean_token_accuracy": 0.2255731701850891, "num_tokens": 116649831.0, "step": 67245 }, { "entropy": 5.42825493812561, "epoch": 5.232250534915386, "grad_norm": 1.28125, "learning_rate": 0.0002612118249578163, "loss": 4.6929, "mean_token_accuracy": 0.23583969175815583, "num_tokens": 116658856.0, "step": 67250 }, { "entropy": 5.404086637496948, "epoch": 5.232639564287104, "grad_norm": 1.2421875, "learning_rate": 0.0002611841615644477, "loss": 4.6937, "mean_token_accuracy": 0.2371744155883789, "num_tokens": 116666731.0, "step": 67255 }, { "entropy": 5.398430395126343, "epoch": 5.233028593658822, "grad_norm": 1.2578125, "learning_rate": 0.00026115649838071253, "loss": 4.6949, "mean_token_accuracy": 0.23271084427833558, "num_tokens": 116674953.0, "step": 67260 }, { "entropy": 5.374135446548462, "epoch": 5.2334176230305385, "grad_norm": 1.3125, "learning_rate": 0.0002611288354070304, "loss": 4.6578, "mean_token_accuracy": 0.24367496222257615, "num_tokens": 116683825.0, "step": 67265 }, { "entropy": 5.48495922088623, "epoch": 5.233806652402256, "grad_norm": 1.328125, "learning_rate": 0.0002611011726438212, "loss": 4.9284, "mean_token_accuracy": 0.2215125471353531, "num_tokens": 116693128.0, "step": 67270 }, { "entropy": 5.399789476394654, "epoch": 5.234195681773974, "grad_norm": 1.1171875, "learning_rate": 0.00026107351009150453, "loss": 4.7169, "mean_token_accuracy": 0.2307500198483467, "num_tokens": 116701789.0, "step": 67275 }, { "entropy": 5.401145935058594, "epoch": 5.234584711145692, "grad_norm": 1.2109375, "learning_rate": 0.0002610458477505002, "loss": 4.6972, "mean_token_accuracy": 0.23181137144565583, "num_tokens": 116710187.0, "step": 67280 }, { "entropy": 5.442689895629883, "epoch": 5.234973740517409, "grad_norm": 1.2890625, "learning_rate": 0.0002610181856212279, "loss": 4.7713, "mean_token_accuracy": 0.22508362978696822, "num_tokens": 116719245.0, "step": 67285 }, { "entropy": 5.376486968994141, "epoch": 5.235362769889127, "grad_norm": 1.2109375, "learning_rate": 0.0002609905237041074, "loss": 4.6593, "mean_token_accuracy": 0.23711671233177184, "num_tokens": 116726977.0, "step": 67290 }, { "entropy": 5.418247127532959, "epoch": 5.235751799260844, "grad_norm": 1.203125, "learning_rate": 0.0002609628619995582, "loss": 4.68, "mean_token_accuracy": 0.23080794215202333, "num_tokens": 116735078.0, "step": 67295 }, { "entropy": 5.425756454467773, "epoch": 5.2361408286325615, "grad_norm": 1.3125, "learning_rate": 0.00026093520050800046, "loss": 4.7432, "mean_token_accuracy": 0.2296899974346161, "num_tokens": 116744015.0, "step": 67300 }, { "entropy": 5.441672277450562, "epoch": 5.236529858004279, "grad_norm": 1.28125, "learning_rate": 0.0002609075392298536, "loss": 4.8129, "mean_token_accuracy": 0.22739205956459047, "num_tokens": 116752152.0, "step": 67305 }, { "entropy": 5.380702829360962, "epoch": 5.236918887375997, "grad_norm": 1.1796875, "learning_rate": 0.0002608798781655374, "loss": 4.6371, "mean_token_accuracy": 0.23781922310590745, "num_tokens": 116761598.0, "step": 67310 }, { "entropy": 5.358177280426025, "epoch": 5.237307916747715, "grad_norm": 1.265625, "learning_rate": 0.0002608522173154716, "loss": 4.5965, "mean_token_accuracy": 0.24128767251968383, "num_tokens": 116770673.0, "step": 67315 }, { "entropy": 5.379529762268066, "epoch": 5.237696946119432, "grad_norm": 1.171875, "learning_rate": 0.0002608245566800759, "loss": 4.7258, "mean_token_accuracy": 0.22561502754688262, "num_tokens": 116779750.0, "step": 67320 }, { "entropy": 5.484083604812622, "epoch": 5.23808597549115, "grad_norm": 1.3359375, "learning_rate": 0.00026079689625976995, "loss": 4.7156, "mean_token_accuracy": 0.22590613663196563, "num_tokens": 116788044.0, "step": 67325 }, { "entropy": 5.433552026748657, "epoch": 5.238475004862867, "grad_norm": 1.28125, "learning_rate": 0.00026076923605497347, "loss": 4.7516, "mean_token_accuracy": 0.22788045108318328, "num_tokens": 116795981.0, "step": 67330 }, { "entropy": 5.445416641235352, "epoch": 5.2388640342345845, "grad_norm": 1.234375, "learning_rate": 0.00026074157606610626, "loss": 4.7017, "mean_token_accuracy": 0.2383514702320099, "num_tokens": 116804610.0, "step": 67335 }, { "entropy": 5.479588651657105, "epoch": 5.239253063606302, "grad_norm": 1.3125, "learning_rate": 0.00026071391629358786, "loss": 4.825, "mean_token_accuracy": 0.22355996519327165, "num_tokens": 116813499.0, "step": 67340 }, { "entropy": 5.453675270080566, "epoch": 5.23964209297802, "grad_norm": 1.25, "learning_rate": 0.00026068625673783807, "loss": 4.7813, "mean_token_accuracy": 0.22704491913318633, "num_tokens": 116823208.0, "step": 67345 }, { "entropy": 5.4371918678283695, "epoch": 5.240031122349738, "grad_norm": 1.3359375, "learning_rate": 0.00026065859739927657, "loss": 4.7373, "mean_token_accuracy": 0.23173634111881256, "num_tokens": 116831335.0, "step": 67350 }, { "entropy": 5.508289813995361, "epoch": 5.240420151721455, "grad_norm": 1.3203125, "learning_rate": 0.000260630938278323, "loss": 4.8155, "mean_token_accuracy": 0.22185618281364441, "num_tokens": 116839897.0, "step": 67355 }, { "entropy": 5.414023447036743, "epoch": 5.240809181093173, "grad_norm": 1.25, "learning_rate": 0.00026060327937539704, "loss": 4.6748, "mean_token_accuracy": 0.23026626259088517, "num_tokens": 116847919.0, "step": 67360 }, { "entropy": 5.376636409759522, "epoch": 5.24119821046489, "grad_norm": 1.2421875, "learning_rate": 0.00026057562069091845, "loss": 4.6979, "mean_token_accuracy": 0.23264960944652557, "num_tokens": 116856139.0, "step": 67365 }, { "entropy": 5.349032783508301, "epoch": 5.2415872398366075, "grad_norm": 1.1875, "learning_rate": 0.00026054796222530684, "loss": 4.6513, "mean_token_accuracy": 0.24196869879961014, "num_tokens": 116864211.0, "step": 67370 }, { "entropy": 5.428495407104492, "epoch": 5.241976269208325, "grad_norm": 1.2109375, "learning_rate": 0.0002605203039789819, "loss": 4.7557, "mean_token_accuracy": 0.22287316173315047, "num_tokens": 116873032.0, "step": 67375 }, { "entropy": 5.462880229949951, "epoch": 5.242365298580043, "grad_norm": 1.34375, "learning_rate": 0.0002604926459523633, "loss": 4.7643, "mean_token_accuracy": 0.2276371479034424, "num_tokens": 116880941.0, "step": 67380 }, { "entropy": 5.400443649291992, "epoch": 5.2427543279517606, "grad_norm": 1.328125, "learning_rate": 0.00026046498814587076, "loss": 4.7012, "mean_token_accuracy": 0.2283831387758255, "num_tokens": 116888833.0, "step": 67385 }, { "entropy": 5.387718534469604, "epoch": 5.243143357323478, "grad_norm": 1.2265625, "learning_rate": 0.00026043733055992386, "loss": 4.6753, "mean_token_accuracy": 0.23279907703399658, "num_tokens": 116897450.0, "step": 67390 }, { "entropy": 5.312741088867187, "epoch": 5.243532386695195, "grad_norm": 1.1640625, "learning_rate": 0.00026040967319494225, "loss": 4.6465, "mean_token_accuracy": 0.23524246513843536, "num_tokens": 116906615.0, "step": 67395 }, { "entropy": 5.385815095901489, "epoch": 5.243921416066913, "grad_norm": 1.3359375, "learning_rate": 0.00026038201605134567, "loss": 4.6932, "mean_token_accuracy": 0.23378511071205138, "num_tokens": 116914972.0, "step": 67400 }, { "entropy": 5.345600748062134, "epoch": 5.2443104454386305, "grad_norm": 1.25, "learning_rate": 0.00026035435912955375, "loss": 4.6834, "mean_token_accuracy": 0.2387162059545517, "num_tokens": 116923316.0, "step": 67405 }, { "entropy": 5.354609155654908, "epoch": 5.244699474810348, "grad_norm": 1.2265625, "learning_rate": 0.0002603267024299861, "loss": 4.7167, "mean_token_accuracy": 0.23606501668691635, "num_tokens": 116932180.0, "step": 67410 }, { "entropy": 5.3945677280426025, "epoch": 5.245088504182066, "grad_norm": 1.171875, "learning_rate": 0.0002602990459530623, "loss": 4.7133, "mean_token_accuracy": 0.23605251759290696, "num_tokens": 116941102.0, "step": 67415 }, { "entropy": 5.449324369430542, "epoch": 5.2454775335537835, "grad_norm": 1.3203125, "learning_rate": 0.0002602713896992022, "loss": 4.6862, "mean_token_accuracy": 0.2336167261004448, "num_tokens": 116948888.0, "step": 67420 }, { "entropy": 5.447108888626099, "epoch": 5.245866562925501, "grad_norm": 1.2421875, "learning_rate": 0.0002602437336688252, "loss": 4.7862, "mean_token_accuracy": 0.22331737726926804, "num_tokens": 116958386.0, "step": 67425 }, { "entropy": 5.33681287765503, "epoch": 5.246255592297218, "grad_norm": 1.1640625, "learning_rate": 0.0002602160778623511, "loss": 4.6224, "mean_token_accuracy": 0.24246330559253693, "num_tokens": 116967378.0, "step": 67430 }, { "entropy": 5.490798616409302, "epoch": 5.246644621668936, "grad_norm": 1.2265625, "learning_rate": 0.00026018842228019953, "loss": 4.8148, "mean_token_accuracy": 0.22208707630634308, "num_tokens": 116976537.0, "step": 67435 }, { "entropy": 5.374784803390503, "epoch": 5.2470336510406534, "grad_norm": 1.2734375, "learning_rate": 0.00026016076692279003, "loss": 4.6598, "mean_token_accuracy": 0.23650529235601425, "num_tokens": 116984911.0, "step": 67440 }, { "entropy": 5.3797601699829105, "epoch": 5.247422680412371, "grad_norm": 1.2421875, "learning_rate": 0.0002601331117905423, "loss": 4.6939, "mean_token_accuracy": 0.23245563209056855, "num_tokens": 116993847.0, "step": 67445 }, { "entropy": 5.355009078979492, "epoch": 5.247811709784089, "grad_norm": 1.2109375, "learning_rate": 0.00026010545688387595, "loss": 4.6476, "mean_token_accuracy": 0.23593928962945937, "num_tokens": 117002114.0, "step": 67450 }, { "entropy": 5.369286060333252, "epoch": 5.2482007391558065, "grad_norm": 1.1796875, "learning_rate": 0.00026007780220321054, "loss": 4.7077, "mean_token_accuracy": 0.23278801888227463, "num_tokens": 117010617.0, "step": 67455 }, { "entropy": 5.366733980178833, "epoch": 5.248589768527524, "grad_norm": 1.234375, "learning_rate": 0.00026005014774896574, "loss": 4.6698, "mean_token_accuracy": 0.23100989013910295, "num_tokens": 117019235.0, "step": 67460 }, { "entropy": 5.406934213638306, "epoch": 5.248978797899241, "grad_norm": 1.265625, "learning_rate": 0.00026002249352156124, "loss": 4.7963, "mean_token_accuracy": 0.22444510757923125, "num_tokens": 117027911.0, "step": 67465 }, { "entropy": 5.4959064483642575, "epoch": 5.249367827270959, "grad_norm": 1.6015625, "learning_rate": 0.0002599948395214165, "loss": 4.7685, "mean_token_accuracy": 0.22609095573425292, "num_tokens": 117036331.0, "step": 67470 }, { "entropy": 5.459526109695434, "epoch": 5.249756856642676, "grad_norm": 1.4140625, "learning_rate": 0.00025996718574895116, "loss": 4.769, "mean_token_accuracy": 0.22066522240638733, "num_tokens": 117043707.0, "step": 67475 }, { "entropy": 5.475381326675415, "epoch": 5.250145886014394, "grad_norm": 1.3046875, "learning_rate": 0.00025993953220458487, "loss": 4.7812, "mean_token_accuracy": 0.23207593262195586, "num_tokens": 117052050.0, "step": 67480 }, { "entropy": 5.437155437469483, "epoch": 5.250534915386112, "grad_norm": 1.390625, "learning_rate": 0.0002599118788887372, "loss": 4.7063, "mean_token_accuracy": 0.23764725774526596, "num_tokens": 117060793.0, "step": 67485 }, { "entropy": 5.381167268753051, "epoch": 5.2509239447578295, "grad_norm": 1.09375, "learning_rate": 0.00025988422580182775, "loss": 4.6712, "mean_token_accuracy": 0.22808973342180253, "num_tokens": 117070221.0, "step": 67490 }, { "entropy": 5.394053363800049, "epoch": 5.251312974129547, "grad_norm": 1.0625, "learning_rate": 0.0002598565729442761, "loss": 4.7542, "mean_token_accuracy": 0.22572365701198577, "num_tokens": 117079792.0, "step": 67495 }, { "entropy": 5.412895202636719, "epoch": 5.251702003501264, "grad_norm": 1.203125, "learning_rate": 0.00025982892031650186, "loss": 4.6812, "mean_token_accuracy": 0.22866483330726622, "num_tokens": 117088455.0, "step": 67500 }, { "entropy": 5.3610734939575195, "epoch": 5.252091032872982, "grad_norm": 1.25, "learning_rate": 0.0002598012679189246, "loss": 4.7354, "mean_token_accuracy": 0.23251037001609803, "num_tokens": 117096902.0, "step": 67505 }, { "entropy": 5.3349268436431885, "epoch": 5.252480062244699, "grad_norm": 1.34375, "learning_rate": 0.00025977361575196394, "loss": 4.6687, "mean_token_accuracy": 0.23329002261161805, "num_tokens": 117105252.0, "step": 67510 }, { "entropy": 5.308884572982788, "epoch": 5.252869091616417, "grad_norm": 1.1640625, "learning_rate": 0.00025974596381603943, "loss": 4.5642, "mean_token_accuracy": 0.2355449005961418, "num_tokens": 117113288.0, "step": 67515 }, { "entropy": 5.37100396156311, "epoch": 5.253258120988135, "grad_norm": 1.25, "learning_rate": 0.0002597183121115707, "loss": 4.6524, "mean_token_accuracy": 0.24688079506158828, "num_tokens": 117121942.0, "step": 67520 }, { "entropy": 5.419775581359863, "epoch": 5.2536471503598525, "grad_norm": 1.3359375, "learning_rate": 0.0002596906606389771, "loss": 4.686, "mean_token_accuracy": 0.23545729219913483, "num_tokens": 117130133.0, "step": 67525 }, { "entropy": 5.404507112503052, "epoch": 5.254036179731569, "grad_norm": 1.1796875, "learning_rate": 0.00025966300939867843, "loss": 4.6881, "mean_token_accuracy": 0.23277096152305604, "num_tokens": 117138979.0, "step": 67530 }, { "entropy": 5.356218576431274, "epoch": 5.254425209103287, "grad_norm": 1.28125, "learning_rate": 0.0002596353583910942, "loss": 4.7375, "mean_token_accuracy": 0.22256511002779006, "num_tokens": 117148348.0, "step": 67535 }, { "entropy": 5.343806552886963, "epoch": 5.254814238475005, "grad_norm": 1.2578125, "learning_rate": 0.00025960770761664396, "loss": 4.601, "mean_token_accuracy": 0.2461948126554489, "num_tokens": 117156440.0, "step": 67540 }, { "entropy": 5.320831966400147, "epoch": 5.255203267846722, "grad_norm": 1.140625, "learning_rate": 0.00025958005707574726, "loss": 4.6852, "mean_token_accuracy": 0.2345167353749275, "num_tokens": 117165858.0, "step": 67545 }, { "entropy": 5.390328502655029, "epoch": 5.25559229721844, "grad_norm": 1.1640625, "learning_rate": 0.0002595524067688237, "loss": 4.7412, "mean_token_accuracy": 0.22469160556793213, "num_tokens": 117175984.0, "step": 67550 }, { "entropy": 5.510164499282837, "epoch": 5.255981326590158, "grad_norm": 1.15625, "learning_rate": 0.00025952475669629267, "loss": 4.7593, "mean_token_accuracy": 0.2326524406671524, "num_tokens": 117185166.0, "step": 67555 }, { "entropy": 5.4184250831604, "epoch": 5.2563703559618755, "grad_norm": 1.1953125, "learning_rate": 0.00025949710685857383, "loss": 4.7112, "mean_token_accuracy": 0.22882448732852936, "num_tokens": 117193701.0, "step": 67560 }, { "entropy": 5.366162443161011, "epoch": 5.256759385333592, "grad_norm": 1.1953125, "learning_rate": 0.00025946945725608675, "loss": 4.7371, "mean_token_accuracy": 0.2323720335960388, "num_tokens": 117202683.0, "step": 67565 }, { "entropy": 5.367905616760254, "epoch": 5.25714841470531, "grad_norm": 1.3671875, "learning_rate": 0.0002594418078892509, "loss": 4.6549, "mean_token_accuracy": 0.23404959738254547, "num_tokens": 117211164.0, "step": 67570 }, { "entropy": 5.435426712036133, "epoch": 5.257537444077028, "grad_norm": 1.28125, "learning_rate": 0.000259414158758486, "loss": 4.7261, "mean_token_accuracy": 0.2247810110449791, "num_tokens": 117219033.0, "step": 67575 }, { "entropy": 5.452024650573731, "epoch": 5.257926473448745, "grad_norm": 1.2578125, "learning_rate": 0.00025938650986421125, "loss": 4.7605, "mean_token_accuracy": 0.22904880195856095, "num_tokens": 117227948.0, "step": 67580 }, { "entropy": 5.441284894943237, "epoch": 5.258315502820463, "grad_norm": 1.2890625, "learning_rate": 0.0002593588612068465, "loss": 4.7213, "mean_token_accuracy": 0.24183682799339296, "num_tokens": 117236169.0, "step": 67585 }, { "entropy": 5.34754433631897, "epoch": 5.258704532192181, "grad_norm": 1.25, "learning_rate": 0.000259331212786811, "loss": 4.783, "mean_token_accuracy": 0.22686605304479598, "num_tokens": 117245371.0, "step": 67590 }, { "entropy": 5.3409229755401615, "epoch": 5.259093561563898, "grad_norm": 1.15625, "learning_rate": 0.00025930356460452454, "loss": 4.6949, "mean_token_accuracy": 0.2237337589263916, "num_tokens": 117254357.0, "step": 67595 }, { "entropy": 5.432412433624267, "epoch": 5.259482590935615, "grad_norm": 1.2421875, "learning_rate": 0.0002592759166604064, "loss": 4.7034, "mean_token_accuracy": 0.2325456351041794, "num_tokens": 117263188.0, "step": 67600 }, { "entropy": 5.438701725006103, "epoch": 5.259871620307333, "grad_norm": 1.265625, "learning_rate": 0.00025924826895487623, "loss": 4.7823, "mean_token_accuracy": 0.23559650033712387, "num_tokens": 117272103.0, "step": 67605 }, { "entropy": 5.3339701175689695, "epoch": 5.260260649679051, "grad_norm": 1.296875, "learning_rate": 0.00025922062148835357, "loss": 4.715, "mean_token_accuracy": 0.2287560820579529, "num_tokens": 117280356.0, "step": 67610 }, { "entropy": 5.4158868312835695, "epoch": 5.260649679050768, "grad_norm": 1.234375, "learning_rate": 0.0002591929742612578, "loss": 4.7132, "mean_token_accuracy": 0.22876811772584915, "num_tokens": 117288173.0, "step": 67615 }, { "entropy": 5.414004898071289, "epoch": 5.261038708422486, "grad_norm": 1.3125, "learning_rate": 0.0002591653272740085, "loss": 4.7235, "mean_token_accuracy": 0.22858828753232957, "num_tokens": 117295795.0, "step": 67620 }, { "entropy": 5.434411430358887, "epoch": 5.261427737794204, "grad_norm": 1.3203125, "learning_rate": 0.00025913768052702514, "loss": 4.734, "mean_token_accuracy": 0.2232011839747429, "num_tokens": 117304509.0, "step": 67625 }, { "entropy": 5.44519305229187, "epoch": 5.261816767165921, "grad_norm": 1.2890625, "learning_rate": 0.0002591100340207272, "loss": 4.7315, "mean_token_accuracy": 0.23461957573890685, "num_tokens": 117312151.0, "step": 67630 }, { "entropy": 5.305275964736938, "epoch": 5.262205796537638, "grad_norm": 1.203125, "learning_rate": 0.0002590823877555343, "loss": 4.6711, "mean_token_accuracy": 0.23494940400123596, "num_tokens": 117320743.0, "step": 67635 }, { "entropy": 5.323049068450928, "epoch": 5.262594825909356, "grad_norm": 1.3046875, "learning_rate": 0.0002590547417318657, "loss": 4.6972, "mean_token_accuracy": 0.2328971281647682, "num_tokens": 117330169.0, "step": 67640 }, { "entropy": 5.3841142654418945, "epoch": 5.262983855281074, "grad_norm": 1.359375, "learning_rate": 0.0002590270959501411, "loss": 4.6729, "mean_token_accuracy": 0.23634839355945586, "num_tokens": 117338081.0, "step": 67645 }, { "entropy": 5.398157453536987, "epoch": 5.263372884652791, "grad_norm": 1.234375, "learning_rate": 0.00025899945041077995, "loss": 4.6693, "mean_token_accuracy": 0.23173351883888244, "num_tokens": 117346770.0, "step": 67650 }, { "entropy": 5.403488445281982, "epoch": 5.263761914024509, "grad_norm": 1.265625, "learning_rate": 0.00025897180511420164, "loss": 4.6893, "mean_token_accuracy": 0.23138634413480758, "num_tokens": 117355646.0, "step": 67655 }, { "entropy": 5.3779195785522464, "epoch": 5.264150943396227, "grad_norm": 1.1953125, "learning_rate": 0.00025894416006082564, "loss": 4.7019, "mean_token_accuracy": 0.2267584979534149, "num_tokens": 117364592.0, "step": 67660 }, { "entropy": 5.419485998153687, "epoch": 5.264539972767944, "grad_norm": 1.2109375, "learning_rate": 0.00025891651525107145, "loss": 4.7146, "mean_token_accuracy": 0.2303535148501396, "num_tokens": 117373302.0, "step": 67665 }, { "entropy": 5.39093861579895, "epoch": 5.264929002139661, "grad_norm": 1.2578125, "learning_rate": 0.00025888887068535853, "loss": 4.7086, "mean_token_accuracy": 0.23065055459737777, "num_tokens": 117381310.0, "step": 67670 }, { "entropy": 5.4331550121307375, "epoch": 5.265318031511379, "grad_norm": 1.2734375, "learning_rate": 0.00025886122636410643, "loss": 4.7539, "mean_token_accuracy": 0.22767216414213182, "num_tokens": 117389680.0, "step": 67675 }, { "entropy": 5.518896675109863, "epoch": 5.265707060883097, "grad_norm": 1.3046875, "learning_rate": 0.00025883358228773445, "loss": 4.806, "mean_token_accuracy": 0.2279020980000496, "num_tokens": 117398253.0, "step": 67680 }, { "entropy": 5.487711095809937, "epoch": 5.266096090254814, "grad_norm": 1.3203125, "learning_rate": 0.0002588059384566622, "loss": 4.773, "mean_token_accuracy": 0.22800550609827042, "num_tokens": 117406633.0, "step": 67685 }, { "entropy": 5.406185674667358, "epoch": 5.266485119626532, "grad_norm": 1.2421875, "learning_rate": 0.00025877829487130894, "loss": 4.7308, "mean_token_accuracy": 0.23067347705364227, "num_tokens": 117414755.0, "step": 67690 }, { "entropy": 5.457627964019776, "epoch": 5.26687414899825, "grad_norm": 1.1796875, "learning_rate": 0.0002587506515320943, "loss": 4.7708, "mean_token_accuracy": 0.23172007501125336, "num_tokens": 117423310.0, "step": 67695 }, { "entropy": 5.413216638565063, "epoch": 5.267263178369967, "grad_norm": 1.2890625, "learning_rate": 0.0002587230084394377, "loss": 4.6736, "mean_token_accuracy": 0.22678678035736083, "num_tokens": 117431931.0, "step": 67700 }, { "entropy": 5.463682794570923, "epoch": 5.267652207741684, "grad_norm": 1.2734375, "learning_rate": 0.0002586953655937585, "loss": 4.7249, "mean_token_accuracy": 0.2321800947189331, "num_tokens": 117440233.0, "step": 67705 }, { "entropy": 5.419193410873413, "epoch": 5.268041237113402, "grad_norm": 1.1875, "learning_rate": 0.0002586677229954761, "loss": 4.7588, "mean_token_accuracy": 0.22933555394411087, "num_tokens": 117449679.0, "step": 67710 }, { "entropy": 5.390128946304321, "epoch": 5.26843026648512, "grad_norm": 1.296875, "learning_rate": 0.0002586400806450102, "loss": 4.7052, "mean_token_accuracy": 0.23210811614990234, "num_tokens": 117458000.0, "step": 67715 }, { "entropy": 5.475764513015747, "epoch": 5.268819295856837, "grad_norm": 1.15625, "learning_rate": 0.00025861243854277986, "loss": 4.8332, "mean_token_accuracy": 0.2188028946518898, "num_tokens": 117467856.0, "step": 67720 }, { "entropy": 5.455661106109619, "epoch": 5.269208325228555, "grad_norm": 1.3984375, "learning_rate": 0.0002585847966892048, "loss": 4.7305, "mean_token_accuracy": 0.22966277003288268, "num_tokens": 117475723.0, "step": 67725 }, { "entropy": 5.44646201133728, "epoch": 5.269597354600272, "grad_norm": 1.2578125, "learning_rate": 0.0002585571550847042, "loss": 4.734, "mean_token_accuracy": 0.22961940318346025, "num_tokens": 117484784.0, "step": 67730 }, { "entropy": 5.358654975891113, "epoch": 5.26998638397199, "grad_norm": 1.1640625, "learning_rate": 0.0002585295137296978, "loss": 4.6778, "mean_token_accuracy": 0.23610725849866868, "num_tokens": 117493490.0, "step": 67735 }, { "entropy": 5.398290395736694, "epoch": 5.270375413343707, "grad_norm": 1.1875, "learning_rate": 0.0002585018726246047, "loss": 4.779, "mean_token_accuracy": 0.2247351661324501, "num_tokens": 117502582.0, "step": 67740 }, { "entropy": 5.341506052017212, "epoch": 5.270764442715425, "grad_norm": 1.2578125, "learning_rate": 0.0002584742317698444, "loss": 4.6499, "mean_token_accuracy": 0.23633422553539277, "num_tokens": 117511381.0, "step": 67745 }, { "entropy": 5.442134237289428, "epoch": 5.271153472087143, "grad_norm": 1.375, "learning_rate": 0.00025844659116583635, "loss": 4.8114, "mean_token_accuracy": 0.2309001460671425, "num_tokens": 117520177.0, "step": 67750 }, { "entropy": 5.466410827636719, "epoch": 5.27154250145886, "grad_norm": 1.203125, "learning_rate": 0.0002584189508129999, "loss": 4.7937, "mean_token_accuracy": 0.22736624479293824, "num_tokens": 117529763.0, "step": 67755 }, { "entropy": 5.47055344581604, "epoch": 5.271931530830578, "grad_norm": 1.2109375, "learning_rate": 0.0002583913107117544, "loss": 4.7429, "mean_token_accuracy": 0.23290761262178422, "num_tokens": 117538309.0, "step": 67760 }, { "entropy": 5.38823971748352, "epoch": 5.272320560202295, "grad_norm": 1.203125, "learning_rate": 0.0002583636708625195, "loss": 4.8049, "mean_token_accuracy": 0.22759881019592285, "num_tokens": 117546608.0, "step": 67765 }, { "entropy": 5.428650712966919, "epoch": 5.272709589574013, "grad_norm": 1.21875, "learning_rate": 0.0002583360312657143, "loss": 4.7177, "mean_token_accuracy": 0.23121925294399262, "num_tokens": 117555136.0, "step": 67770 }, { "entropy": 5.425867080688477, "epoch": 5.27309861894573, "grad_norm": 1.296875, "learning_rate": 0.00025830839192175835, "loss": 4.731, "mean_token_accuracy": 0.234566330909729, "num_tokens": 117563304.0, "step": 67775 }, { "entropy": 5.465944814682007, "epoch": 5.273487648317448, "grad_norm": 1.2421875, "learning_rate": 0.000258280752831071, "loss": 4.8256, "mean_token_accuracy": 0.22526848912239075, "num_tokens": 117572707.0, "step": 67780 }, { "entropy": 5.508855772018433, "epoch": 5.273876677689166, "grad_norm": 1.3359375, "learning_rate": 0.00025825311399407157, "loss": 4.8184, "mean_token_accuracy": 0.2193262681365013, "num_tokens": 117581169.0, "step": 67785 }, { "entropy": 5.457820177078247, "epoch": 5.274265707060883, "grad_norm": 1.1640625, "learning_rate": 0.0002582254754111795, "loss": 4.6832, "mean_token_accuracy": 0.23896281868219377, "num_tokens": 117589508.0, "step": 67790 }, { "entropy": 5.416562128067016, "epoch": 5.274654736432601, "grad_norm": 1.2734375, "learning_rate": 0.0002581978370828142, "loss": 4.7467, "mean_token_accuracy": 0.225620137155056, "num_tokens": 117598211.0, "step": 67795 }, { "entropy": 5.39215931892395, "epoch": 5.275043765804318, "grad_norm": 1.34375, "learning_rate": 0.0002581701990093949, "loss": 4.6348, "mean_token_accuracy": 0.23864491879940034, "num_tokens": 117606425.0, "step": 67800 }, { "entropy": 5.40304970741272, "epoch": 5.275432795176036, "grad_norm": 1.21875, "learning_rate": 0.0002581425611913411, "loss": 4.6841, "mean_token_accuracy": 0.2346534788608551, "num_tokens": 117615420.0, "step": 67805 }, { "entropy": 5.384714078903198, "epoch": 5.275821824547753, "grad_norm": 1.2421875, "learning_rate": 0.0002581149236290721, "loss": 4.6623, "mean_token_accuracy": 0.24034376740455626, "num_tokens": 117624427.0, "step": 67810 }, { "entropy": 5.4182086944580075, "epoch": 5.276210853919471, "grad_norm": 1.2578125, "learning_rate": 0.0002580872863230072, "loss": 4.7328, "mean_token_accuracy": 0.2357745960354805, "num_tokens": 117633097.0, "step": 67815 }, { "entropy": 5.387362623214722, "epoch": 5.276599883291189, "grad_norm": 1.234375, "learning_rate": 0.00025805964927356584, "loss": 4.7471, "mean_token_accuracy": 0.23142085820436478, "num_tokens": 117642493.0, "step": 67820 }, { "entropy": 5.417189264297486, "epoch": 5.276988912662906, "grad_norm": 1.25, "learning_rate": 0.00025803201248116725, "loss": 4.7572, "mean_token_accuracy": 0.22613672465085982, "num_tokens": 117651064.0, "step": 67825 }, { "entropy": 5.475321435928345, "epoch": 5.277377942034624, "grad_norm": 1.15625, "learning_rate": 0.00025800437594623095, "loss": 4.8464, "mean_token_accuracy": 0.21559946089982987, "num_tokens": 117660461.0, "step": 67830 }, { "entropy": 5.472397327423096, "epoch": 5.277766971406341, "grad_norm": 1.2265625, "learning_rate": 0.0002579767396691762, "loss": 4.753, "mean_token_accuracy": 0.22670711129903792, "num_tokens": 117669169.0, "step": 67835 }, { "entropy": 5.391211748123169, "epoch": 5.278156000778059, "grad_norm": 1.2890625, "learning_rate": 0.00025794910365042233, "loss": 4.6124, "mean_token_accuracy": 0.2359376445412636, "num_tokens": 117677284.0, "step": 67840 }, { "entropy": 5.430466890335083, "epoch": 5.278545030149776, "grad_norm": 1.359375, "learning_rate": 0.00025792146789038875, "loss": 4.7589, "mean_token_accuracy": 0.22917403131723404, "num_tokens": 117685708.0, "step": 67845 }, { "entropy": 5.344880771636963, "epoch": 5.278934059521494, "grad_norm": 1.1796875, "learning_rate": 0.0002578938323894946, "loss": 4.7167, "mean_token_accuracy": 0.23063499331474305, "num_tokens": 117693994.0, "step": 67850 }, { "entropy": 5.432592248916626, "epoch": 5.279323088893212, "grad_norm": 1.2578125, "learning_rate": 0.00025786619714815933, "loss": 4.7211, "mean_token_accuracy": 0.2311262920498848, "num_tokens": 117702384.0, "step": 67855 }, { "entropy": 5.441815614700317, "epoch": 5.279712118264929, "grad_norm": 1.1875, "learning_rate": 0.0002578385621668023, "loss": 4.6635, "mean_token_accuracy": 0.23401136249303817, "num_tokens": 117710707.0, "step": 67860 }, { "entropy": 5.43959641456604, "epoch": 5.280101147636646, "grad_norm": 1.28125, "learning_rate": 0.0002578109274458427, "loss": 4.7296, "mean_token_accuracy": 0.23360033035278321, "num_tokens": 117719321.0, "step": 67865 }, { "entropy": 5.473988056182861, "epoch": 5.280490177008364, "grad_norm": 1.1875, "learning_rate": 0.00025778329298569997, "loss": 4.8444, "mean_token_accuracy": 0.2215265616774559, "num_tokens": 117729867.0, "step": 67870 }, { "entropy": 5.572522401809692, "epoch": 5.280879206380082, "grad_norm": 1.1484375, "learning_rate": 0.0002577556587867934, "loss": 4.8544, "mean_token_accuracy": 0.2229031503200531, "num_tokens": 117738921.0, "step": 67875 }, { "entropy": 5.421004343032837, "epoch": 5.281268235751799, "grad_norm": 1.1953125, "learning_rate": 0.00025772802484954217, "loss": 4.7026, "mean_token_accuracy": 0.2268058553338051, "num_tokens": 117747182.0, "step": 67880 }, { "entropy": 5.373906660079956, "epoch": 5.281657265123517, "grad_norm": 1.2421875, "learning_rate": 0.00025770039117436566, "loss": 4.6493, "mean_token_accuracy": 0.23034662306308745, "num_tokens": 117755454.0, "step": 67885 }, { "entropy": 5.362284851074219, "epoch": 5.282046294495235, "grad_norm": 1.28125, "learning_rate": 0.0002576727577616832, "loss": 4.7456, "mean_token_accuracy": 0.23015681952238082, "num_tokens": 117764940.0, "step": 67890 }, { "entropy": 5.475304698944091, "epoch": 5.282435323866952, "grad_norm": 1.1796875, "learning_rate": 0.00025764512461191413, "loss": 4.7215, "mean_token_accuracy": 0.2319142132997513, "num_tokens": 117772699.0, "step": 67895 }, { "entropy": 5.399413299560547, "epoch": 5.282824353238669, "grad_norm": 1.2421875, "learning_rate": 0.0002576174917254776, "loss": 4.6185, "mean_token_accuracy": 0.2434467077255249, "num_tokens": 117781793.0, "step": 67900 }, { "entropy": 5.451322460174561, "epoch": 5.283213382610387, "grad_norm": 1.359375, "learning_rate": 0.00025758985910279304, "loss": 4.7603, "mean_token_accuracy": 0.22349606901407243, "num_tokens": 117791675.0, "step": 67905 }, { "entropy": 5.331875371932983, "epoch": 5.283602411982105, "grad_norm": 1.078125, "learning_rate": 0.0002575622267442796, "loss": 4.6529, "mean_token_accuracy": 0.22651276737451553, "num_tokens": 117801328.0, "step": 67910 }, { "entropy": 5.399914693832398, "epoch": 5.283991441353822, "grad_norm": 1.1484375, "learning_rate": 0.0002575345946503566, "loss": 4.752, "mean_token_accuracy": 0.2273305058479309, "num_tokens": 117810320.0, "step": 67915 }, { "entropy": 5.423849248886109, "epoch": 5.28438047072554, "grad_norm": 1.2578125, "learning_rate": 0.00025750696282144335, "loss": 4.6999, "mean_token_accuracy": 0.23206643760204315, "num_tokens": 117818411.0, "step": 67920 }, { "entropy": 5.4297792434692385, "epoch": 5.284769500097258, "grad_norm": 1.21875, "learning_rate": 0.0002574793312579592, "loss": 4.7654, "mean_token_accuracy": 0.2329715833067894, "num_tokens": 117827437.0, "step": 67925 }, { "entropy": 5.388472080230713, "epoch": 5.2851585294689745, "grad_norm": 1.2734375, "learning_rate": 0.00025745169996032317, "loss": 4.6584, "mean_token_accuracy": 0.2284606173634529, "num_tokens": 117835061.0, "step": 67930 }, { "entropy": 5.365268087387085, "epoch": 5.285547558840692, "grad_norm": 1.328125, "learning_rate": 0.0002574240689289547, "loss": 4.7698, "mean_token_accuracy": 0.22489264905452727, "num_tokens": 117843205.0, "step": 67935 }, { "entropy": 5.34759488105774, "epoch": 5.28593658821241, "grad_norm": 1.2109375, "learning_rate": 0.00025739643816427305, "loss": 4.6317, "mean_token_accuracy": 0.2360741138458252, "num_tokens": 117851797.0, "step": 67940 }, { "entropy": 5.4044536590576175, "epoch": 5.286325617584128, "grad_norm": 1.296875, "learning_rate": 0.0002573688076666974, "loss": 4.7246, "mean_token_accuracy": 0.2280576005578041, "num_tokens": 117859915.0, "step": 67945 }, { "entropy": 5.379363965988159, "epoch": 5.286714646955845, "grad_norm": 1.3125, "learning_rate": 0.00025734117743664704, "loss": 4.7473, "mean_token_accuracy": 0.22872845381498336, "num_tokens": 117868877.0, "step": 67950 }, { "entropy": 5.359675025939941, "epoch": 5.287103676327563, "grad_norm": 1.140625, "learning_rate": 0.0002573135474745412, "loss": 4.6431, "mean_token_accuracy": 0.2399894878268242, "num_tokens": 117877930.0, "step": 67955 }, { "entropy": 5.3367678165435795, "epoch": 5.287492705699281, "grad_norm": 1.4140625, "learning_rate": 0.00025728591778079906, "loss": 4.6348, "mean_token_accuracy": 0.2404622033238411, "num_tokens": 117886083.0, "step": 67960 }, { "entropy": 5.377387523651123, "epoch": 5.2878817350709975, "grad_norm": 1.2890625, "learning_rate": 0.00025725828835584, "loss": 4.7019, "mean_token_accuracy": 0.22656186521053315, "num_tokens": 117894047.0, "step": 67965 }, { "entropy": 5.451760959625244, "epoch": 5.288270764442715, "grad_norm": 1.28125, "learning_rate": 0.00025723065920008314, "loss": 4.7284, "mean_token_accuracy": 0.2294162020087242, "num_tokens": 117902875.0, "step": 67970 }, { "entropy": 5.445099592208862, "epoch": 5.288659793814433, "grad_norm": 1.234375, "learning_rate": 0.0002572030303139477, "loss": 4.7645, "mean_token_accuracy": 0.22684448808431626, "num_tokens": 117911090.0, "step": 67975 }, { "entropy": 5.465509128570557, "epoch": 5.2890488231861505, "grad_norm": 1.1953125, "learning_rate": 0.00025717540169785304, "loss": 4.7575, "mean_token_accuracy": 0.23597677648067475, "num_tokens": 117920388.0, "step": 67980 }, { "entropy": 5.473395252227784, "epoch": 5.289437852557868, "grad_norm": 1.203125, "learning_rate": 0.0002571477733522183, "loss": 4.78, "mean_token_accuracy": 0.22574895173311232, "num_tokens": 117929458.0, "step": 67985 }, { "entropy": 5.39021258354187, "epoch": 5.289826881929586, "grad_norm": 1.171875, "learning_rate": 0.00025712014527746264, "loss": 4.7066, "mean_token_accuracy": 0.2375793218612671, "num_tokens": 117939239.0, "step": 67990 }, { "entropy": 5.42416410446167, "epoch": 5.290215911301304, "grad_norm": 1.2109375, "learning_rate": 0.0002570925174740053, "loss": 4.7968, "mean_token_accuracy": 0.2296088680624962, "num_tokens": 117949010.0, "step": 67995 }, { "entropy": 5.372650957107544, "epoch": 5.2906049406730205, "grad_norm": 1.3125, "learning_rate": 0.0002570648899422655, "loss": 4.6425, "mean_token_accuracy": 0.23721289485692978, "num_tokens": 117957431.0, "step": 68000 }, { "entropy": 5.448591518402099, "epoch": 5.290993970044738, "grad_norm": 1.2421875, "learning_rate": 0.0002570372626826625, "loss": 4.7441, "mean_token_accuracy": 0.22351339608430862, "num_tokens": 117965679.0, "step": 68005 }, { "entropy": 5.4630186557769775, "epoch": 5.291382999416456, "grad_norm": 1.171875, "learning_rate": 0.0002570096356956155, "loss": 4.6965, "mean_token_accuracy": 0.2300425574183464, "num_tokens": 117974326.0, "step": 68010 }, { "entropy": 5.439398288726807, "epoch": 5.2917720287881735, "grad_norm": 1.3125, "learning_rate": 0.00025698200898154354, "loss": 4.725, "mean_token_accuracy": 0.23586793392896652, "num_tokens": 117984038.0, "step": 68015 }, { "entropy": 5.339920282363892, "epoch": 5.292161058159891, "grad_norm": 1.1953125, "learning_rate": 0.00025695438254086595, "loss": 4.6318, "mean_token_accuracy": 0.24165019094944, "num_tokens": 117992402.0, "step": 68020 }, { "entropy": 5.34862961769104, "epoch": 5.292550087531609, "grad_norm": 1.1953125, "learning_rate": 0.0002569267563740018, "loss": 4.7125, "mean_token_accuracy": 0.23222738802433013, "num_tokens": 118001762.0, "step": 68025 }, { "entropy": 5.344294309616089, "epoch": 5.292939116903327, "grad_norm": 1.21875, "learning_rate": 0.0002568991304813704, "loss": 4.6577, "mean_token_accuracy": 0.23492414504289627, "num_tokens": 118010198.0, "step": 68030 }, { "entropy": 5.40525369644165, "epoch": 5.2933281462750434, "grad_norm": 1.3046875, "learning_rate": 0.00025687150486339094, "loss": 4.6835, "mean_token_accuracy": 0.22730460166931152, "num_tokens": 118019027.0, "step": 68035 }, { "entropy": 5.432329320907593, "epoch": 5.293717175646761, "grad_norm": 1.2265625, "learning_rate": 0.00025684387952048247, "loss": 4.785, "mean_token_accuracy": 0.23295140415430068, "num_tokens": 118027507.0, "step": 68040 }, { "entropy": 5.4012213230133055, "epoch": 5.294106205018479, "grad_norm": 1.125, "learning_rate": 0.00025681625445306435, "loss": 4.7557, "mean_token_accuracy": 0.23130976408720016, "num_tokens": 118036269.0, "step": 68045 }, { "entropy": 5.417764329910279, "epoch": 5.2944952343901965, "grad_norm": 1.2421875, "learning_rate": 0.0002567886296615555, "loss": 4.6436, "mean_token_accuracy": 0.2363480031490326, "num_tokens": 118044634.0, "step": 68050 }, { "entropy": 5.33132791519165, "epoch": 5.294884263761914, "grad_norm": 1.1953125, "learning_rate": 0.00025676100514637523, "loss": 4.6156, "mean_token_accuracy": 0.23988511860370637, "num_tokens": 118053151.0, "step": 68055 }, { "entropy": 5.35179967880249, "epoch": 5.295273293133632, "grad_norm": 1.234375, "learning_rate": 0.00025673338090794276, "loss": 4.708, "mean_token_accuracy": 0.23388061672449112, "num_tokens": 118061554.0, "step": 68060 }, { "entropy": 5.4061057567596436, "epoch": 5.295662322505349, "grad_norm": 1.2421875, "learning_rate": 0.0002567057569466771, "loss": 4.7306, "mean_token_accuracy": 0.23217600136995314, "num_tokens": 118070201.0, "step": 68065 }, { "entropy": 5.3677606105804445, "epoch": 5.296051351877066, "grad_norm": 1.203125, "learning_rate": 0.00025667813326299746, "loss": 4.6529, "mean_token_accuracy": 0.2347490206360817, "num_tokens": 118078397.0, "step": 68070 }, { "entropy": 5.3858870506286625, "epoch": 5.296440381248784, "grad_norm": 1.2578125, "learning_rate": 0.00025665050985732295, "loss": 4.6554, "mean_token_accuracy": 0.2424492210149765, "num_tokens": 118086127.0, "step": 68075 }, { "entropy": 5.31528902053833, "epoch": 5.296829410620502, "grad_norm": 1.2109375, "learning_rate": 0.00025662288673007286, "loss": 4.6622, "mean_token_accuracy": 0.2249770477414131, "num_tokens": 118095466.0, "step": 68080 }, { "entropy": 5.375209856033325, "epoch": 5.2972184399922195, "grad_norm": 1.1484375, "learning_rate": 0.00025659526388166617, "loss": 4.7286, "mean_token_accuracy": 0.222996324300766, "num_tokens": 118104452.0, "step": 68085 }, { "entropy": 5.4704029083251955, "epoch": 5.297607469363937, "grad_norm": 1.296875, "learning_rate": 0.00025656764131252194, "loss": 4.7593, "mean_token_accuracy": 0.22569903880357742, "num_tokens": 118113347.0, "step": 68090 }, { "entropy": 5.446114826202392, "epoch": 5.297996498735655, "grad_norm": 1.2109375, "learning_rate": 0.0002565400190230595, "loss": 4.7698, "mean_token_accuracy": 0.2239377588033676, "num_tokens": 118122460.0, "step": 68095 }, { "entropy": 5.4446149349212645, "epoch": 5.298385528107372, "grad_norm": 1.25, "learning_rate": 0.0002565123970136978, "loss": 4.8144, "mean_token_accuracy": 0.22506532967090606, "num_tokens": 118131191.0, "step": 68100 }, { "entropy": 5.372435569763184, "epoch": 5.298774557479089, "grad_norm": 1.171875, "learning_rate": 0.0002564847752848562, "loss": 4.7228, "mean_token_accuracy": 0.2330501824617386, "num_tokens": 118140202.0, "step": 68105 }, { "entropy": 5.4700723648071286, "epoch": 5.299163586850807, "grad_norm": 1.234375, "learning_rate": 0.00025645715383695357, "loss": 4.764, "mean_token_accuracy": 0.22737912684679032, "num_tokens": 118149038.0, "step": 68110 }, { "entropy": 5.367864322662354, "epoch": 5.299552616222525, "grad_norm": 1.1953125, "learning_rate": 0.0002564295326704092, "loss": 4.6119, "mean_token_accuracy": 0.23903272151947022, "num_tokens": 118157524.0, "step": 68115 }, { "entropy": 5.372653245925903, "epoch": 5.2999416455942425, "grad_norm": 1.2890625, "learning_rate": 0.0002564019117856421, "loss": 4.6961, "mean_token_accuracy": 0.23593139201402663, "num_tokens": 118165399.0, "step": 68120 }, { "entropy": 5.334555816650391, "epoch": 5.30033067496596, "grad_norm": 1.296875, "learning_rate": 0.00025637429118307133, "loss": 4.6275, "mean_token_accuracy": 0.24422341734170913, "num_tokens": 118173875.0, "step": 68125 }, { "entropy": 5.33554630279541, "epoch": 5.300719704337677, "grad_norm": 1.2578125, "learning_rate": 0.0002563466708631161, "loss": 4.7274, "mean_token_accuracy": 0.2325017660856247, "num_tokens": 118182854.0, "step": 68130 }, { "entropy": 5.368835735321045, "epoch": 5.301108733709395, "grad_norm": 1.21875, "learning_rate": 0.0002563190508261954, "loss": 4.685, "mean_token_accuracy": 0.22467972636222838, "num_tokens": 118192409.0, "step": 68135 }, { "entropy": 5.447922849655152, "epoch": 5.301497763081112, "grad_norm": 1.3125, "learning_rate": 0.00025629143107272837, "loss": 4.7521, "mean_token_accuracy": 0.22505049109458924, "num_tokens": 118200441.0, "step": 68140 }, { "entropy": 5.37948784828186, "epoch": 5.30188679245283, "grad_norm": 1.2109375, "learning_rate": 0.0002562638116031341, "loss": 4.7157, "mean_token_accuracy": 0.23519937694072723, "num_tokens": 118209618.0, "step": 68145 }, { "entropy": 5.405431890487671, "epoch": 5.302275821824548, "grad_norm": 1.2890625, "learning_rate": 0.0002562361924178317, "loss": 4.6858, "mean_token_accuracy": 0.22774650901556015, "num_tokens": 118218284.0, "step": 68150 }, { "entropy": 5.4235821723937985, "epoch": 5.3026648511962655, "grad_norm": 1.2734375, "learning_rate": 0.00025620857351724017, "loss": 4.7619, "mean_token_accuracy": 0.23083454519510269, "num_tokens": 118226760.0, "step": 68155 }, { "entropy": 5.331353092193604, "epoch": 5.303053880567983, "grad_norm": 1.2890625, "learning_rate": 0.00025618095490177864, "loss": 4.652, "mean_token_accuracy": 0.2351802483201027, "num_tokens": 118235511.0, "step": 68160 }, { "entropy": 5.392614841461182, "epoch": 5.303442909939701, "grad_norm": 1.3125, "learning_rate": 0.00025615333657186615, "loss": 4.7404, "mean_token_accuracy": 0.22456002086400986, "num_tokens": 118243665.0, "step": 68165 }, { "entropy": 5.449662160873413, "epoch": 5.303831939311418, "grad_norm": 1.453125, "learning_rate": 0.0002561257185279218, "loss": 4.7977, "mean_token_accuracy": 0.22283245474100113, "num_tokens": 118252996.0, "step": 68170 }, { "entropy": 5.4242912292480465, "epoch": 5.304220968683135, "grad_norm": 1.1875, "learning_rate": 0.00025609810077036467, "loss": 4.7157, "mean_token_accuracy": 0.23114178329706192, "num_tokens": 118261436.0, "step": 68175 }, { "entropy": 5.426201915740966, "epoch": 5.304609998054853, "grad_norm": 1.328125, "learning_rate": 0.0002560704832996137, "loss": 4.7429, "mean_token_accuracy": 0.23235445469617844, "num_tokens": 118269537.0, "step": 68180 }, { "entropy": 5.379454755783081, "epoch": 5.304999027426571, "grad_norm": 1.2578125, "learning_rate": 0.0002560428661160881, "loss": 4.6869, "mean_token_accuracy": 0.23679289519786834, "num_tokens": 118277207.0, "step": 68185 }, { "entropy": 5.437486219406128, "epoch": 5.3053880567982885, "grad_norm": 1.2421875, "learning_rate": 0.00025601524922020676, "loss": 4.7564, "mean_token_accuracy": 0.2364332288503647, "num_tokens": 118285210.0, "step": 68190 }, { "entropy": 5.4189800262451175, "epoch": 5.305777086170006, "grad_norm": 1.2109375, "learning_rate": 0.0002559876326123889, "loss": 4.7566, "mean_token_accuracy": 0.22733357399702073, "num_tokens": 118293668.0, "step": 68195 }, { "entropy": 5.517509031295776, "epoch": 5.306166115541723, "grad_norm": 1.3671875, "learning_rate": 0.0002559600162930534, "loss": 4.8368, "mean_token_accuracy": 0.22202365100383759, "num_tokens": 118302203.0, "step": 68200 }, { "entropy": 5.469154214859008, "epoch": 5.306555144913441, "grad_norm": 1.328125, "learning_rate": 0.0002559324002626193, "loss": 4.7401, "mean_token_accuracy": 0.2301134094595909, "num_tokens": 118311252.0, "step": 68205 }, { "entropy": 5.392446708679199, "epoch": 5.306944174285158, "grad_norm": 1.1484375, "learning_rate": 0.0002559047845215057, "loss": 4.6874, "mean_token_accuracy": 0.2311457797884941, "num_tokens": 118320136.0, "step": 68210 }, { "entropy": 5.383842945098877, "epoch": 5.307333203656876, "grad_norm": 1.2109375, "learning_rate": 0.0002558771690701316, "loss": 4.6694, "mean_token_accuracy": 0.23015664368867875, "num_tokens": 118328871.0, "step": 68215 }, { "entropy": 5.420992994308472, "epoch": 5.307722233028594, "grad_norm": 1.2109375, "learning_rate": 0.000255849553908916, "loss": 4.6759, "mean_token_accuracy": 0.23601814806461335, "num_tokens": 118337588.0, "step": 68220 }, { "entropy": 5.4108617305755615, "epoch": 5.3081112624003115, "grad_norm": 1.1875, "learning_rate": 0.00025582193903827795, "loss": 4.7184, "mean_token_accuracy": 0.22655766308307648, "num_tokens": 118347200.0, "step": 68225 }, { "entropy": 5.426698350906372, "epoch": 5.308500291772029, "grad_norm": 1.25, "learning_rate": 0.0002557943244586365, "loss": 4.6559, "mean_token_accuracy": 0.23621433079242707, "num_tokens": 118355226.0, "step": 68230 }, { "entropy": 5.374127340316773, "epoch": 5.308889321143746, "grad_norm": 1.2421875, "learning_rate": 0.00025576671017041053, "loss": 4.6349, "mean_token_accuracy": 0.24040888845920563, "num_tokens": 118363491.0, "step": 68235 }, { "entropy": 5.416652250289917, "epoch": 5.309278350515464, "grad_norm": 1.265625, "learning_rate": 0.0002557390961740192, "loss": 4.8012, "mean_token_accuracy": 0.22745504677295686, "num_tokens": 118372070.0, "step": 68240 }, { "entropy": 5.397065162658691, "epoch": 5.309667379887181, "grad_norm": 1.3203125, "learning_rate": 0.00025571148246988137, "loss": 4.8041, "mean_token_accuracy": 0.2236845538020134, "num_tokens": 118380093.0, "step": 68245 }, { "entropy": 5.473998928070069, "epoch": 5.310056409258899, "grad_norm": 1.2734375, "learning_rate": 0.00025568386905841614, "loss": 4.7503, "mean_token_accuracy": 0.2338694825768471, "num_tokens": 118388795.0, "step": 68250 }, { "entropy": 5.497718715667725, "epoch": 5.310445438630617, "grad_norm": 1.2109375, "learning_rate": 0.0002556562559400424, "loss": 4.7594, "mean_token_accuracy": 0.23210667073726654, "num_tokens": 118397155.0, "step": 68255 }, { "entropy": 5.475577878952026, "epoch": 5.3108344680023345, "grad_norm": 1.3125, "learning_rate": 0.0002556286431151792, "loss": 4.7716, "mean_token_accuracy": 0.2255820944905281, "num_tokens": 118405431.0, "step": 68260 }, { "entropy": 5.354866075515747, "epoch": 5.311223497374051, "grad_norm": 1.2890625, "learning_rate": 0.0002556010305842456, "loss": 4.6815, "mean_token_accuracy": 0.23072147369384766, "num_tokens": 118413882.0, "step": 68265 }, { "entropy": 5.4126180648803714, "epoch": 5.311612526745769, "grad_norm": 1.21875, "learning_rate": 0.0002555734183476603, "loss": 4.727, "mean_token_accuracy": 0.2353020116686821, "num_tokens": 118422101.0, "step": 68270 }, { "entropy": 5.449949598312378, "epoch": 5.312001556117487, "grad_norm": 1.2734375, "learning_rate": 0.0002555458064058427, "loss": 4.7719, "mean_token_accuracy": 0.23055623322725297, "num_tokens": 118431100.0, "step": 68275 }, { "entropy": 5.447512578964234, "epoch": 5.312390585489204, "grad_norm": 1.203125, "learning_rate": 0.00025551819475921135, "loss": 4.8008, "mean_token_accuracy": 0.22128179371356965, "num_tokens": 118440398.0, "step": 68280 }, { "entropy": 5.419225120544434, "epoch": 5.312779614860922, "grad_norm": 1.3671875, "learning_rate": 0.0002554905834081854, "loss": 4.6395, "mean_token_accuracy": 0.23864019215106963, "num_tokens": 118448106.0, "step": 68285 }, { "entropy": 5.353057479858398, "epoch": 5.31316864423264, "grad_norm": 1.234375, "learning_rate": 0.0002554629723531838, "loss": 4.6845, "mean_token_accuracy": 0.23960304111242295, "num_tokens": 118457381.0, "step": 68290 }, { "entropy": 5.323422288894653, "epoch": 5.3135576736043575, "grad_norm": 1.2421875, "learning_rate": 0.0002554353615946255, "loss": 4.6605, "mean_token_accuracy": 0.2350957587361336, "num_tokens": 118466064.0, "step": 68295 }, { "entropy": 5.424555730819702, "epoch": 5.313946702976074, "grad_norm": 1.2734375, "learning_rate": 0.00025540775113292943, "loss": 4.777, "mean_token_accuracy": 0.23124974071979523, "num_tokens": 118474781.0, "step": 68300 }, { "entropy": 5.5154975891113285, "epoch": 5.314335732347792, "grad_norm": 1.2734375, "learning_rate": 0.0002553801409685146, "loss": 4.7737, "mean_token_accuracy": 0.23112404048442842, "num_tokens": 118484090.0, "step": 68305 }, { "entropy": 5.383425760269165, "epoch": 5.31472476171951, "grad_norm": 1.203125, "learning_rate": 0.00025535253110179994, "loss": 4.6353, "mean_token_accuracy": 0.2288293421268463, "num_tokens": 118492238.0, "step": 68310 }, { "entropy": 5.409465551376343, "epoch": 5.315113791091227, "grad_norm": 1.2734375, "learning_rate": 0.0002553249215332043, "loss": 4.7616, "mean_token_accuracy": 0.22517294883728028, "num_tokens": 118501121.0, "step": 68315 }, { "entropy": 5.349946689605713, "epoch": 5.315502820462945, "grad_norm": 1.265625, "learning_rate": 0.00025529731226314663, "loss": 4.6686, "mean_token_accuracy": 0.24075792878866195, "num_tokens": 118509594.0, "step": 68320 }, { "entropy": 5.501828527450561, "epoch": 5.315891849834663, "grad_norm": 1.21875, "learning_rate": 0.0002552697032920459, "loss": 4.8809, "mean_token_accuracy": 0.22262437641620636, "num_tokens": 118518261.0, "step": 68325 }, { "entropy": 5.449336147308349, "epoch": 5.3162808792063805, "grad_norm": 1.328125, "learning_rate": 0.00025524209462032105, "loss": 4.7749, "mean_token_accuracy": 0.22266142219305038, "num_tokens": 118527075.0, "step": 68330 }, { "entropy": 5.461490726470947, "epoch": 5.316669908578097, "grad_norm": 1.25, "learning_rate": 0.0002552144862483909, "loss": 4.7012, "mean_token_accuracy": 0.23407820910215377, "num_tokens": 118536235.0, "step": 68335 }, { "entropy": 5.393811988830566, "epoch": 5.317058937949815, "grad_norm": 1.2890625, "learning_rate": 0.0002551868781766745, "loss": 4.6954, "mean_token_accuracy": 0.23548172861337663, "num_tokens": 118544372.0, "step": 68340 }, { "entropy": 5.428950452804566, "epoch": 5.317447967321533, "grad_norm": 1.3125, "learning_rate": 0.0002551592704055907, "loss": 4.7507, "mean_token_accuracy": 0.23705195039510726, "num_tokens": 118552719.0, "step": 68345 }, { "entropy": 5.35980486869812, "epoch": 5.31783699669325, "grad_norm": 1.2421875, "learning_rate": 0.00025513166293555836, "loss": 4.6744, "mean_token_accuracy": 0.24016321450471878, "num_tokens": 118560976.0, "step": 68350 }, { "entropy": 5.430757808685303, "epoch": 5.318226026064968, "grad_norm": 1.1171875, "learning_rate": 0.00025510405576699636, "loss": 4.8909, "mean_token_accuracy": 0.21354012489318847, "num_tokens": 118570003.0, "step": 68355 }, { "entropy": 5.368334484100342, "epoch": 5.318615055436686, "grad_norm": 1.296875, "learning_rate": 0.0002550764489003237, "loss": 4.6548, "mean_token_accuracy": 0.23521031439304352, "num_tokens": 118578500.0, "step": 68360 }, { "entropy": 5.433859539031983, "epoch": 5.3190040848084035, "grad_norm": 1.1953125, "learning_rate": 0.0002550488423359592, "loss": 4.7115, "mean_token_accuracy": 0.2260461613535881, "num_tokens": 118586508.0, "step": 68365 }, { "entropy": 5.4215172290802, "epoch": 5.31939311418012, "grad_norm": 1.1953125, "learning_rate": 0.00025502123607432174, "loss": 4.8028, "mean_token_accuracy": 0.21999171376228333, "num_tokens": 118595395.0, "step": 68370 }, { "entropy": 5.357114171981811, "epoch": 5.319782143551838, "grad_norm": 1.203125, "learning_rate": 0.00025499363011583024, "loss": 4.6694, "mean_token_accuracy": 0.23116080164909364, "num_tokens": 118604698.0, "step": 68375 }, { "entropy": 5.399623107910156, "epoch": 5.320171172923556, "grad_norm": 1.3125, "learning_rate": 0.0002549660244609036, "loss": 4.6855, "mean_token_accuracy": 0.23996977657079696, "num_tokens": 118613575.0, "step": 68380 }, { "entropy": 5.429344987869262, "epoch": 5.320560202295273, "grad_norm": 1.1796875, "learning_rate": 0.0002549384191099607, "loss": 4.7736, "mean_token_accuracy": 0.23215679824352264, "num_tokens": 118622709.0, "step": 68385 }, { "entropy": 5.404136228561401, "epoch": 5.320949231666991, "grad_norm": 1.34375, "learning_rate": 0.00025491081406342025, "loss": 4.6728, "mean_token_accuracy": 0.23223583102226258, "num_tokens": 118631744.0, "step": 68390 }, { "entropy": 5.462610816955566, "epoch": 5.321338261038709, "grad_norm": 1.25, "learning_rate": 0.00025488320932170127, "loss": 4.7388, "mean_token_accuracy": 0.2320067048072815, "num_tokens": 118639833.0, "step": 68395 }, { "entropy": 5.462297582626343, "epoch": 5.321727290410426, "grad_norm": 1.34375, "learning_rate": 0.0002548556048852226, "loss": 4.7932, "mean_token_accuracy": 0.22314848005771637, "num_tokens": 118647870.0, "step": 68400 }, { "entropy": 5.345164203643799, "epoch": 5.322116319782143, "grad_norm": 1.1953125, "learning_rate": 0.00025482800075440296, "loss": 4.6762, "mean_token_accuracy": 0.2361781567335129, "num_tokens": 118656572.0, "step": 68405 }, { "entropy": 5.32938585281372, "epoch": 5.322505349153861, "grad_norm": 1.203125, "learning_rate": 0.0002548003969296614, "loss": 4.664, "mean_token_accuracy": 0.23306829184293748, "num_tokens": 118665226.0, "step": 68410 }, { "entropy": 5.381419944763183, "epoch": 5.322894378525579, "grad_norm": 1.2734375, "learning_rate": 0.00025477279341141665, "loss": 4.7996, "mean_token_accuracy": 0.22352965623140336, "num_tokens": 118674736.0, "step": 68415 }, { "entropy": 5.370222282409668, "epoch": 5.323283407897296, "grad_norm": 1.2265625, "learning_rate": 0.0002547451902000875, "loss": 4.7068, "mean_token_accuracy": 0.2351436510682106, "num_tokens": 118682670.0, "step": 68420 }, { "entropy": 5.367035150527954, "epoch": 5.323672437269014, "grad_norm": 1.2890625, "learning_rate": 0.00025471758729609284, "loss": 4.7163, "mean_token_accuracy": 0.23232802152633666, "num_tokens": 118691758.0, "step": 68425 }, { "entropy": 5.3664836406707765, "epoch": 5.324061466640732, "grad_norm": 1.1640625, "learning_rate": 0.00025468998469985155, "loss": 4.6175, "mean_token_accuracy": 0.23248442262411118, "num_tokens": 118700634.0, "step": 68430 }, { "entropy": 5.323926734924316, "epoch": 5.324450496012449, "grad_norm": 1.234375, "learning_rate": 0.0002546623824117824, "loss": 4.5741, "mean_token_accuracy": 0.2437952384352684, "num_tokens": 118708968.0, "step": 68435 }, { "entropy": 5.420853614807129, "epoch": 5.324839525384166, "grad_norm": 1.234375, "learning_rate": 0.0002546347804323043, "loss": 4.7697, "mean_token_accuracy": 0.23351432979106904, "num_tokens": 118717555.0, "step": 68440 }, { "entropy": 5.379099035263062, "epoch": 5.325228554755884, "grad_norm": 1.3984375, "learning_rate": 0.0002546071787618359, "loss": 4.7132, "mean_token_accuracy": 0.23423105776309966, "num_tokens": 118725815.0, "step": 68445 }, { "entropy": 5.444296550750733, "epoch": 5.325617584127602, "grad_norm": 1.2421875, "learning_rate": 0.0002545795774007962, "loss": 4.7259, "mean_token_accuracy": 0.23276938647031784, "num_tokens": 118734573.0, "step": 68450 }, { "entropy": 5.4277605533599855, "epoch": 5.326006613499319, "grad_norm": 1.3046875, "learning_rate": 0.0002545519763496038, "loss": 4.7288, "mean_token_accuracy": 0.22015426456928253, "num_tokens": 118743580.0, "step": 68455 }, { "entropy": 5.408220911026001, "epoch": 5.326395642871037, "grad_norm": 1.203125, "learning_rate": 0.00025452437560867774, "loss": 4.6802, "mean_token_accuracy": 0.2388938769698143, "num_tokens": 118751778.0, "step": 68460 }, { "entropy": 5.386774492263794, "epoch": 5.326784672242754, "grad_norm": 1.1875, "learning_rate": 0.0002544967751784367, "loss": 4.7395, "mean_token_accuracy": 0.23511845022439956, "num_tokens": 118759756.0, "step": 68465 }, { "entropy": 5.387465143203736, "epoch": 5.327173701614472, "grad_norm": 1.2421875, "learning_rate": 0.00025446917505929937, "loss": 4.7487, "mean_token_accuracy": 0.2242644503712654, "num_tokens": 118767971.0, "step": 68470 }, { "entropy": 5.460736989974976, "epoch": 5.327562730986189, "grad_norm": 1.2890625, "learning_rate": 0.0002544415752516846, "loss": 4.8147, "mean_token_accuracy": 0.21734969019889833, "num_tokens": 118776484.0, "step": 68475 }, { "entropy": 5.432301568984985, "epoch": 5.327951760357907, "grad_norm": 1.25, "learning_rate": 0.00025441397575601125, "loss": 4.7346, "mean_token_accuracy": 0.22482049763202666, "num_tokens": 118785967.0, "step": 68480 }, { "entropy": 5.423052215576172, "epoch": 5.328340789729625, "grad_norm": 1.1796875, "learning_rate": 0.00025438637657269805, "loss": 4.7718, "mean_token_accuracy": 0.2262672781944275, "num_tokens": 118794663.0, "step": 68485 }, { "entropy": 5.380197906494141, "epoch": 5.328729819101342, "grad_norm": 1.265625, "learning_rate": 0.0002543587777021636, "loss": 4.7041, "mean_token_accuracy": 0.23597897738218307, "num_tokens": 118803231.0, "step": 68490 }, { "entropy": 5.434101486206055, "epoch": 5.32911884847306, "grad_norm": 1.265625, "learning_rate": 0.0002543311791448271, "loss": 4.7151, "mean_token_accuracy": 0.2352515786886215, "num_tokens": 118811499.0, "step": 68495 }, { "entropy": 5.412351083755493, "epoch": 5.329507877844778, "grad_norm": 1.234375, "learning_rate": 0.00025430358090110705, "loss": 4.7532, "mean_token_accuracy": 0.22926274687051773, "num_tokens": 118820355.0, "step": 68500 }, { "entropy": 5.428201007843017, "epoch": 5.329896907216495, "grad_norm": 1.2734375, "learning_rate": 0.00025427598297142213, "loss": 4.7337, "mean_token_accuracy": 0.23664519786834717, "num_tokens": 118829509.0, "step": 68505 }, { "entropy": 5.425869369506836, "epoch": 5.330285936588212, "grad_norm": 1.296875, "learning_rate": 0.0002542483853561912, "loss": 4.7289, "mean_token_accuracy": 0.23558319807052613, "num_tokens": 118837430.0, "step": 68510 }, { "entropy": 5.405182123184204, "epoch": 5.33067496595993, "grad_norm": 1.2578125, "learning_rate": 0.000254220788055833, "loss": 4.6777, "mean_token_accuracy": 0.23449928611516951, "num_tokens": 118845512.0, "step": 68515 }, { "entropy": 5.450462102890015, "epoch": 5.331063995331648, "grad_norm": 1.3671875, "learning_rate": 0.0002541931910707662, "loss": 4.6985, "mean_token_accuracy": 0.22829007357358932, "num_tokens": 118854076.0, "step": 68520 }, { "entropy": 5.350256252288818, "epoch": 5.331453024703365, "grad_norm": 1.3046875, "learning_rate": 0.0002541655944014097, "loss": 4.6339, "mean_token_accuracy": 0.24013522416353225, "num_tokens": 118862383.0, "step": 68525 }, { "entropy": 5.409934759140015, "epoch": 5.331842054075083, "grad_norm": 1.3359375, "learning_rate": 0.0002541379980481821, "loss": 4.6616, "mean_token_accuracy": 0.23402135223150253, "num_tokens": 118870227.0, "step": 68530 }, { "entropy": 5.364732551574707, "epoch": 5.3322310834468, "grad_norm": 1.234375, "learning_rate": 0.0002541104020115022, "loss": 4.7026, "mean_token_accuracy": 0.23599833250045776, "num_tokens": 118878760.0, "step": 68535 }, { "entropy": 5.3500714778900145, "epoch": 5.3326201128185176, "grad_norm": 1.25, "learning_rate": 0.00025408280629178864, "loss": 4.6691, "mean_token_accuracy": 0.23276754468679428, "num_tokens": 118887273.0, "step": 68540 }, { "entropy": 5.4352583408355715, "epoch": 5.333009142190235, "grad_norm": 1.203125, "learning_rate": 0.0002540552108894603, "loss": 4.6839, "mean_token_accuracy": 0.2357409879565239, "num_tokens": 118896076.0, "step": 68545 }, { "entropy": 5.3710356712341305, "epoch": 5.333398171561953, "grad_norm": 1.1796875, "learning_rate": 0.0002540276158049358, "loss": 4.7254, "mean_token_accuracy": 0.2263556882739067, "num_tokens": 118905287.0, "step": 68550 }, { "entropy": 5.420057010650635, "epoch": 5.333787200933671, "grad_norm": 1.34375, "learning_rate": 0.00025400002103863367, "loss": 4.7671, "mean_token_accuracy": 0.22344884872436524, "num_tokens": 118913644.0, "step": 68555 }, { "entropy": 5.5147096633911135, "epoch": 5.334176230305388, "grad_norm": 1.25, "learning_rate": 0.00025397242659097293, "loss": 4.7805, "mean_token_accuracy": 0.23348459750413894, "num_tokens": 118922394.0, "step": 68560 }, { "entropy": 5.41204195022583, "epoch": 5.334565259677106, "grad_norm": 1.421875, "learning_rate": 0.0002539448324623722, "loss": 4.6885, "mean_token_accuracy": 0.2329455643892288, "num_tokens": 118930164.0, "step": 68565 }, { "entropy": 5.434147310256958, "epoch": 5.334954289048823, "grad_norm": 1.2890625, "learning_rate": 0.00025391723865325, "loss": 4.7715, "mean_token_accuracy": 0.22877319306135177, "num_tokens": 118938711.0, "step": 68570 }, { "entropy": 5.389657354354858, "epoch": 5.3353433184205405, "grad_norm": 1.25, "learning_rate": 0.00025388964516402527, "loss": 4.7766, "mean_token_accuracy": 0.22858673930168152, "num_tokens": 118947334.0, "step": 68575 }, { "entropy": 5.434982109069824, "epoch": 5.335732347792258, "grad_norm": 1.3125, "learning_rate": 0.0002538620519951165, "loss": 4.6716, "mean_token_accuracy": 0.24100470840930938, "num_tokens": 118955219.0, "step": 68580 }, { "entropy": 5.38073844909668, "epoch": 5.336121377163976, "grad_norm": 1.25, "learning_rate": 0.00025383445914694245, "loss": 4.7021, "mean_token_accuracy": 0.2291403204202652, "num_tokens": 118963723.0, "step": 68585 }, { "entropy": 5.447078037261963, "epoch": 5.336510406535694, "grad_norm": 1.1953125, "learning_rate": 0.0002538068666199218, "loss": 4.7665, "mean_token_accuracy": 0.222410124540329, "num_tokens": 118972024.0, "step": 68590 }, { "entropy": 5.458129739761352, "epoch": 5.336899435907411, "grad_norm": 1.28125, "learning_rate": 0.0002537792744144732, "loss": 4.7973, "mean_token_accuracy": 0.22942695915699005, "num_tokens": 118980970.0, "step": 68595 }, { "entropy": 5.5080572128295895, "epoch": 5.337288465279128, "grad_norm": 1.3671875, "learning_rate": 0.0002537516825310154, "loss": 4.842, "mean_token_accuracy": 0.22439451068639754, "num_tokens": 118988883.0, "step": 68600 }, { "entropy": 5.441296720504761, "epoch": 5.337677494650846, "grad_norm": 1.3359375, "learning_rate": 0.0002537240909699669, "loss": 4.6828, "mean_token_accuracy": 0.23301975429058075, "num_tokens": 118997392.0, "step": 68605 }, { "entropy": 5.398757982254028, "epoch": 5.3380665240225635, "grad_norm": 1.2421875, "learning_rate": 0.0002536964997317465, "loss": 4.6686, "mean_token_accuracy": 0.2338730812072754, "num_tokens": 119005769.0, "step": 68610 }, { "entropy": 5.280376958847046, "epoch": 5.338455553394281, "grad_norm": 1.359375, "learning_rate": 0.00025366890881677284, "loss": 4.5705, "mean_token_accuracy": 0.238440403342247, "num_tokens": 119014885.0, "step": 68615 }, { "entropy": 5.360273933410644, "epoch": 5.338844582765999, "grad_norm": 1.203125, "learning_rate": 0.0002536413182254645, "loss": 4.7131, "mean_token_accuracy": 0.23360236436128617, "num_tokens": 119024209.0, "step": 68620 }, { "entropy": 5.359929513931275, "epoch": 5.339233612137717, "grad_norm": 1.21875, "learning_rate": 0.00025361372795824015, "loss": 4.6245, "mean_token_accuracy": 0.23610697239637374, "num_tokens": 119032977.0, "step": 68625 }, { "entropy": 5.401269769668579, "epoch": 5.339622641509434, "grad_norm": 1.2578125, "learning_rate": 0.0002535861380155185, "loss": 4.6733, "mean_token_accuracy": 0.23241161853075026, "num_tokens": 119041085.0, "step": 68630 }, { "entropy": 5.3947608947753904, "epoch": 5.340011670881151, "grad_norm": 1.2421875, "learning_rate": 0.00025355854839771805, "loss": 4.6944, "mean_token_accuracy": 0.22551728636026383, "num_tokens": 119049407.0, "step": 68635 }, { "entropy": 5.3811286926269535, "epoch": 5.340400700252869, "grad_norm": 1.2421875, "learning_rate": 0.00025353095910525753, "loss": 4.7352, "mean_token_accuracy": 0.23292427361011506, "num_tokens": 119057994.0, "step": 68640 }, { "entropy": 5.400046634674072, "epoch": 5.3407897296245865, "grad_norm": 1.234375, "learning_rate": 0.0002535033701385555, "loss": 4.6607, "mean_token_accuracy": 0.23283186852931975, "num_tokens": 119066230.0, "step": 68645 }, { "entropy": 5.325264406204224, "epoch": 5.341178758996304, "grad_norm": 1.2421875, "learning_rate": 0.0002534757814980307, "loss": 4.6329, "mean_token_accuracy": 0.23990606367588044, "num_tokens": 119075146.0, "step": 68650 }, { "entropy": 5.452472972869873, "epoch": 5.341567788368022, "grad_norm": 1.2890625, "learning_rate": 0.00025344819318410167, "loss": 4.778, "mean_token_accuracy": 0.23047917932271958, "num_tokens": 119084297.0, "step": 68655 }, { "entropy": 5.47597484588623, "epoch": 5.34195681773974, "grad_norm": 1.4453125, "learning_rate": 0.00025342060519718693, "loss": 4.7704, "mean_token_accuracy": 0.2309277355670929, "num_tokens": 119093430.0, "step": 68660 }, { "entropy": 5.402373266220093, "epoch": 5.342345847111457, "grad_norm": 1.34375, "learning_rate": 0.00025339301753770515, "loss": 4.831, "mean_token_accuracy": 0.22837504744529724, "num_tokens": 119103213.0, "step": 68665 }, { "entropy": 5.44883246421814, "epoch": 5.342734876483174, "grad_norm": 1.265625, "learning_rate": 0.000253365430206075, "loss": 4.7693, "mean_token_accuracy": 0.22818135917186738, "num_tokens": 119111412.0, "step": 68670 }, { "entropy": 5.526308870315551, "epoch": 5.343123905854892, "grad_norm": 1.203125, "learning_rate": 0.0002533378432027149, "loss": 4.8157, "mean_token_accuracy": 0.2234542429447174, "num_tokens": 119120733.0, "step": 68675 }, { "entropy": 5.450880098342895, "epoch": 5.3435129352266095, "grad_norm": 1.359375, "learning_rate": 0.0002533102565280437, "loss": 4.7185, "mean_token_accuracy": 0.2334365352988243, "num_tokens": 119129344.0, "step": 68680 }, { "entropy": 5.422966766357422, "epoch": 5.343901964598327, "grad_norm": 1.3359375, "learning_rate": 0.0002532826701824797, "loss": 4.7482, "mean_token_accuracy": 0.23017943054437637, "num_tokens": 119137520.0, "step": 68685 }, { "entropy": 5.423976087570191, "epoch": 5.344290993970045, "grad_norm": 1.234375, "learning_rate": 0.0002532550841664416, "loss": 4.7841, "mean_token_accuracy": 0.2284732535481453, "num_tokens": 119146723.0, "step": 68690 }, { "entropy": 5.367533826828003, "epoch": 5.344680023341763, "grad_norm": 1.2421875, "learning_rate": 0.0002532274984803481, "loss": 4.5999, "mean_token_accuracy": 0.24107391238212586, "num_tokens": 119154937.0, "step": 68695 }, { "entropy": 5.394929647445679, "epoch": 5.34506905271348, "grad_norm": 1.2421875, "learning_rate": 0.0002531999131246176, "loss": 4.7298, "mean_token_accuracy": 0.2282811611890793, "num_tokens": 119164514.0, "step": 68700 }, { "entropy": 5.454681062698365, "epoch": 5.345458082085197, "grad_norm": 1.3046875, "learning_rate": 0.0002531723280996687, "loss": 4.8509, "mean_token_accuracy": 0.21593959778547286, "num_tokens": 119173449.0, "step": 68705 }, { "entropy": 5.432226467132568, "epoch": 5.345847111456915, "grad_norm": 1.1796875, "learning_rate": 0.00025314474340592, "loss": 4.719, "mean_token_accuracy": 0.2242790177464485, "num_tokens": 119182390.0, "step": 68710 }, { "entropy": 5.451701068878174, "epoch": 5.3462361408286325, "grad_norm": 1.1953125, "learning_rate": 0.00025311715904379004, "loss": 4.7082, "mean_token_accuracy": 0.23050553798675538, "num_tokens": 119191595.0, "step": 68715 }, { "entropy": 5.378251075744629, "epoch": 5.34662517020035, "grad_norm": 1.1875, "learning_rate": 0.00025308957501369737, "loss": 4.6821, "mean_token_accuracy": 0.23130507320165633, "num_tokens": 119200678.0, "step": 68720 }, { "entropy": 5.400723600387574, "epoch": 5.347014199572068, "grad_norm": 1.2109375, "learning_rate": 0.00025306199131606055, "loss": 4.7175, "mean_token_accuracy": 0.23373725712299348, "num_tokens": 119208916.0, "step": 68725 }, { "entropy": 5.426167583465576, "epoch": 5.347403228943786, "grad_norm": 1.2265625, "learning_rate": 0.0002530344079512981, "loss": 4.7932, "mean_token_accuracy": 0.21691125333309175, "num_tokens": 119218013.0, "step": 68730 }, { "entropy": 5.373668384552002, "epoch": 5.347792258315502, "grad_norm": 1.359375, "learning_rate": 0.00025300682491982853, "loss": 4.67, "mean_token_accuracy": 0.23482376635074614, "num_tokens": 119226419.0, "step": 68735 }, { "entropy": 5.237364816665649, "epoch": 5.34818128768722, "grad_norm": 1.2890625, "learning_rate": 0.0002529792422220704, "loss": 4.5112, "mean_token_accuracy": 0.24689252227544783, "num_tokens": 119234979.0, "step": 68740 }, { "entropy": 5.407399415969849, "epoch": 5.348570317058938, "grad_norm": 1.2734375, "learning_rate": 0.00025295165985844215, "loss": 4.7603, "mean_token_accuracy": 0.23636563420295714, "num_tokens": 119243873.0, "step": 68745 }, { "entropy": 5.415172910690307, "epoch": 5.3489593464306555, "grad_norm": 1.1875, "learning_rate": 0.0002529240778293624, "loss": 4.6909, "mean_token_accuracy": 0.23319346606731414, "num_tokens": 119252933.0, "step": 68750 }, { "entropy": 5.320423221588134, "epoch": 5.349348375802373, "grad_norm": 1.2578125, "learning_rate": 0.00025289649613524954, "loss": 4.564, "mean_token_accuracy": 0.24214782565832138, "num_tokens": 119261820.0, "step": 68755 }, { "entropy": 5.407308673858642, "epoch": 5.349737405174091, "grad_norm": 1.2109375, "learning_rate": 0.0002528689147765223, "loss": 4.785, "mean_token_accuracy": 0.21885529160499573, "num_tokens": 119270345.0, "step": 68760 }, { "entropy": 5.359142827987671, "epoch": 5.350126434545809, "grad_norm": 1.2578125, "learning_rate": 0.00025284133375359904, "loss": 4.6447, "mean_token_accuracy": 0.24187510311603547, "num_tokens": 119278093.0, "step": 68765 }, { "entropy": 5.424220085144043, "epoch": 5.350515463917525, "grad_norm": 1.2578125, "learning_rate": 0.00025281375306689824, "loss": 4.7757, "mean_token_accuracy": 0.2207789897918701, "num_tokens": 119286368.0, "step": 68770 }, { "entropy": 5.378355216979981, "epoch": 5.350904493289243, "grad_norm": 1.21875, "learning_rate": 0.00025278617271683846, "loss": 4.6811, "mean_token_accuracy": 0.22932713627815246, "num_tokens": 119295024.0, "step": 68775 }, { "entropy": 5.333453130722046, "epoch": 5.351293522660961, "grad_norm": 1.2734375, "learning_rate": 0.0002527585927038381, "loss": 4.6172, "mean_token_accuracy": 0.24416085481643676, "num_tokens": 119304120.0, "step": 68780 }, { "entropy": 5.338000679016114, "epoch": 5.3516825520326785, "grad_norm": 1.203125, "learning_rate": 0.00025273101302831575, "loss": 4.733, "mean_token_accuracy": 0.23005841225385665, "num_tokens": 119313528.0, "step": 68785 }, { "entropy": 5.370725393295288, "epoch": 5.352071581404396, "grad_norm": 1.125, "learning_rate": 0.00025270343369068976, "loss": 4.6786, "mean_token_accuracy": 0.23533975780010224, "num_tokens": 119322204.0, "step": 68790 }, { "entropy": 5.477041816711425, "epoch": 5.352460610776114, "grad_norm": 1.2578125, "learning_rate": 0.0002526758546913787, "loss": 4.8192, "mean_token_accuracy": 0.2263139456510544, "num_tokens": 119332060.0, "step": 68795 }, { "entropy": 5.309518241882325, "epoch": 5.352849640147831, "grad_norm": 1.1953125, "learning_rate": 0.0002526482760308011, "loss": 4.5299, "mean_token_accuracy": 0.24503831267356874, "num_tokens": 119340494.0, "step": 68800 }, { "entropy": 5.362177228927612, "epoch": 5.353238669519548, "grad_norm": 1.2734375, "learning_rate": 0.00025262069770937525, "loss": 4.7862, "mean_token_accuracy": 0.23022763282060624, "num_tokens": 119349859.0, "step": 68805 }, { "entropy": 5.403043127059936, "epoch": 5.353627698891266, "grad_norm": 1.203125, "learning_rate": 0.0002525931197275197, "loss": 4.7801, "mean_token_accuracy": 0.225228151679039, "num_tokens": 119358775.0, "step": 68810 }, { "entropy": 5.440681838989258, "epoch": 5.354016728262984, "grad_norm": 1.3125, "learning_rate": 0.00025256554208565296, "loss": 4.699, "mean_token_accuracy": 0.2298225149512291, "num_tokens": 119367319.0, "step": 68815 }, { "entropy": 5.374055051803589, "epoch": 5.3544057576347015, "grad_norm": 1.3984375, "learning_rate": 0.00025253796478419323, "loss": 4.6068, "mean_token_accuracy": 0.24403384625911712, "num_tokens": 119376087.0, "step": 68820 }, { "entropy": 5.295899868011475, "epoch": 5.354794787006419, "grad_norm": 1.171875, "learning_rate": 0.0002525103878235593, "loss": 4.5875, "mean_token_accuracy": 0.23225358128547668, "num_tokens": 119384552.0, "step": 68825 }, { "entropy": 5.394383239746094, "epoch": 5.355183816378137, "grad_norm": 1.25, "learning_rate": 0.0002524828112041694, "loss": 4.7081, "mean_token_accuracy": 0.2345711037516594, "num_tokens": 119392918.0, "step": 68830 }, { "entropy": 5.5039954662323, "epoch": 5.355572845749854, "grad_norm": 1.1796875, "learning_rate": 0.00025245523492644197, "loss": 4.7922, "mean_token_accuracy": 0.23035633265972139, "num_tokens": 119401598.0, "step": 68835 }, { "entropy": 5.389233779907227, "epoch": 5.355961875121571, "grad_norm": 1.1953125, "learning_rate": 0.0002524276589907955, "loss": 4.7023, "mean_token_accuracy": 0.2388235807418823, "num_tokens": 119410576.0, "step": 68840 }, { "entropy": 5.404110670089722, "epoch": 5.356350904493289, "grad_norm": 1.203125, "learning_rate": 0.00025240008339764844, "loss": 4.779, "mean_token_accuracy": 0.23233670443296434, "num_tokens": 119419509.0, "step": 68845 }, { "entropy": 5.395064926147461, "epoch": 5.356739933865007, "grad_norm": 1.2578125, "learning_rate": 0.000252372508147419, "loss": 4.6957, "mean_token_accuracy": 0.22916206568479539, "num_tokens": 119427505.0, "step": 68850 }, { "entropy": 5.397454023361206, "epoch": 5.3571289632367245, "grad_norm": 1.2421875, "learning_rate": 0.0002523449332405258, "loss": 4.6915, "mean_token_accuracy": 0.23323444724082948, "num_tokens": 119435637.0, "step": 68855 }, { "entropy": 5.443812561035156, "epoch": 5.357517992608442, "grad_norm": 1.25, "learning_rate": 0.0002523173586773872, "loss": 4.7011, "mean_token_accuracy": 0.22972651869058608, "num_tokens": 119443277.0, "step": 68860 }, { "entropy": 5.432233238220215, "epoch": 5.35790702198016, "grad_norm": 1.296875, "learning_rate": 0.0002522897844584216, "loss": 4.7501, "mean_token_accuracy": 0.2290879711508751, "num_tokens": 119450623.0, "step": 68865 }, { "entropy": 5.395141363143921, "epoch": 5.358296051351877, "grad_norm": 1.25, "learning_rate": 0.00025226221058404733, "loss": 4.8018, "mean_token_accuracy": 0.22612121999263762, "num_tokens": 119459175.0, "step": 68870 }, { "entropy": 5.3890715599060055, "epoch": 5.358685080723594, "grad_norm": 1.2421875, "learning_rate": 0.0002522346370546828, "loss": 4.6834, "mean_token_accuracy": 0.23337047100067138, "num_tokens": 119468100.0, "step": 68875 }, { "entropy": 5.422239208221436, "epoch": 5.359074110095312, "grad_norm": 1.296875, "learning_rate": 0.0002522070638707465, "loss": 4.7585, "mean_token_accuracy": 0.22786082923412324, "num_tokens": 119477097.0, "step": 68880 }, { "entropy": 5.3970122814178465, "epoch": 5.35946313946703, "grad_norm": 1.2578125, "learning_rate": 0.00025217949103265665, "loss": 4.6614, "mean_token_accuracy": 0.2400321453809738, "num_tokens": 119485197.0, "step": 68885 }, { "entropy": 5.377818441390991, "epoch": 5.3598521688387475, "grad_norm": 1.2265625, "learning_rate": 0.00025215191854083166, "loss": 4.6636, "mean_token_accuracy": 0.24129363894462585, "num_tokens": 119495207.0, "step": 68890 }, { "entropy": 5.506122016906739, "epoch": 5.360241198210465, "grad_norm": 1.28125, "learning_rate": 0.00025212434639568996, "loss": 4.8191, "mean_token_accuracy": 0.22204598635435105, "num_tokens": 119503630.0, "step": 68895 }, { "entropy": 5.463771820068359, "epoch": 5.360630227582183, "grad_norm": 1.1171875, "learning_rate": 0.00025209677459765, "loss": 4.7085, "mean_token_accuracy": 0.22663309276103974, "num_tokens": 119512425.0, "step": 68900 }, { "entropy": 5.436154365539551, "epoch": 5.3610192569539, "grad_norm": 1.3046875, "learning_rate": 0.0002520692031471299, "loss": 4.7858, "mean_token_accuracy": 0.2295249342918396, "num_tokens": 119521318.0, "step": 68905 }, { "entropy": 5.385901927947998, "epoch": 5.361408286325617, "grad_norm": 1.2890625, "learning_rate": 0.00025204163204454826, "loss": 4.6681, "mean_token_accuracy": 0.23272046595811843, "num_tokens": 119529953.0, "step": 68910 }, { "entropy": 5.4182476043701175, "epoch": 5.361797315697335, "grad_norm": 1.21875, "learning_rate": 0.0002520140612903233, "loss": 4.784, "mean_token_accuracy": 0.22548335194587707, "num_tokens": 119539071.0, "step": 68915 }, { "entropy": 5.415350008010864, "epoch": 5.362186345069053, "grad_norm": 1.15625, "learning_rate": 0.0002519864908848733, "loss": 4.6856, "mean_token_accuracy": 0.2372490480542183, "num_tokens": 119547548.0, "step": 68920 }, { "entropy": 5.363909196853638, "epoch": 5.3625753744407705, "grad_norm": 1.2578125, "learning_rate": 0.00025195892082861674, "loss": 4.6459, "mean_token_accuracy": 0.23845205157995225, "num_tokens": 119556113.0, "step": 68925 }, { "entropy": 5.4693207263946535, "epoch": 5.362964403812488, "grad_norm": 1.234375, "learning_rate": 0.0002519313511219719, "loss": 4.8087, "mean_token_accuracy": 0.22240106910467147, "num_tokens": 119565510.0, "step": 68930 }, { "entropy": 5.382143211364746, "epoch": 5.363353433184205, "grad_norm": 1.359375, "learning_rate": 0.00025190378176535703, "loss": 4.6991, "mean_token_accuracy": 0.233941014111042, "num_tokens": 119574433.0, "step": 68935 }, { "entropy": 5.473196649551392, "epoch": 5.363742462555923, "grad_norm": 1.234375, "learning_rate": 0.0002518762127591905, "loss": 4.7106, "mean_token_accuracy": 0.2276538997888565, "num_tokens": 119582227.0, "step": 68940 }, { "entropy": 5.42279200553894, "epoch": 5.36413149192764, "grad_norm": 1.21875, "learning_rate": 0.0002518486441038907, "loss": 4.723, "mean_token_accuracy": 0.22491416186094285, "num_tokens": 119590875.0, "step": 68945 }, { "entropy": 5.374335145950317, "epoch": 5.364520521299358, "grad_norm": 1.2421875, "learning_rate": 0.0002518210757998758, "loss": 4.7544, "mean_token_accuracy": 0.22617409825325013, "num_tokens": 119599306.0, "step": 68950 }, { "entropy": 5.450578784942627, "epoch": 5.364909550671076, "grad_norm": 1.3515625, "learning_rate": 0.0002517935078475642, "loss": 4.8067, "mean_token_accuracy": 0.22319098562002182, "num_tokens": 119608111.0, "step": 68955 }, { "entropy": 5.46391077041626, "epoch": 5.3652985800427935, "grad_norm": 1.265625, "learning_rate": 0.0002517659402473742, "loss": 4.706, "mean_token_accuracy": 0.2312758147716522, "num_tokens": 119616559.0, "step": 68960 }, { "entropy": 5.415202379226685, "epoch": 5.365687609414511, "grad_norm": 1.2421875, "learning_rate": 0.0002517383729997241, "loss": 4.7217, "mean_token_accuracy": 0.22680216729640962, "num_tokens": 119626256.0, "step": 68965 }, { "entropy": 5.361013650894165, "epoch": 5.366076638786228, "grad_norm": 1.234375, "learning_rate": 0.0002517108061050321, "loss": 4.7107, "mean_token_accuracy": 0.2294347271323204, "num_tokens": 119634716.0, "step": 68970 }, { "entropy": 5.462832736968994, "epoch": 5.366465668157946, "grad_norm": 1.375, "learning_rate": 0.00025168323956371657, "loss": 4.7711, "mean_token_accuracy": 0.2257754847407341, "num_tokens": 119642869.0, "step": 68975 }, { "entropy": 5.400960254669189, "epoch": 5.366854697529663, "grad_norm": 1.1875, "learning_rate": 0.00025165567337619583, "loss": 4.6587, "mean_token_accuracy": 0.23154679238796233, "num_tokens": 119651715.0, "step": 68980 }, { "entropy": 5.362062406539917, "epoch": 5.367243726901381, "grad_norm": 1.265625, "learning_rate": 0.000251628107542888, "loss": 4.6333, "mean_token_accuracy": 0.2406027004122734, "num_tokens": 119659782.0, "step": 68985 }, { "entropy": 5.43506350517273, "epoch": 5.367632756273099, "grad_norm": 1.3671875, "learning_rate": 0.00025160054206421143, "loss": 4.8085, "mean_token_accuracy": 0.22444754242897033, "num_tokens": 119668444.0, "step": 68990 }, { "entropy": 5.484446811676025, "epoch": 5.3680217856448165, "grad_norm": 1.3046875, "learning_rate": 0.0002515729769405845, "loss": 4.7528, "mean_token_accuracy": 0.2260366603732109, "num_tokens": 119677011.0, "step": 68995 }, { "entropy": 5.39534101486206, "epoch": 5.368410815016533, "grad_norm": 1.296875, "learning_rate": 0.0002515454121724253, "loss": 4.7168, "mean_token_accuracy": 0.2317987471818924, "num_tokens": 119685398.0, "step": 69000 }, { "epoch": 5.368410815016533, "eval_entropy": 5.118699841274449, "eval_loss": 4.900583267211914, "eval_mean_token_accuracy": 0.2297408799665036, "eval_num_tokens": 119685398.0, "eval_runtime": 28.7309, "eval_samples_per_second": 1446.456, "eval_steps_per_second": 180.816, "step": 69000 }, { "entropy": 5.423506355285644, "epoch": 5.368799844388251, "grad_norm": 1.1796875, "learning_rate": 0.00025151784776015216, "loss": 4.808, "mean_token_accuracy": 0.22472999691963197, "num_tokens": 119694815.0, "step": 69005 }, { "entropy": 5.427844572067261, "epoch": 5.369188873759969, "grad_norm": 1.296875, "learning_rate": 0.0002514902837041833, "loss": 4.6851, "mean_token_accuracy": 0.23454775363206865, "num_tokens": 119703366.0, "step": 69010 }, { "entropy": 5.327227067947388, "epoch": 5.369577903131686, "grad_norm": 1.328125, "learning_rate": 0.00025146272000493695, "loss": 4.6433, "mean_token_accuracy": 0.23572032451629638, "num_tokens": 119711784.0, "step": 69015 }, { "entropy": 5.393718004226685, "epoch": 5.369966932503404, "grad_norm": 1.2109375, "learning_rate": 0.0002514351566628313, "loss": 4.7478, "mean_token_accuracy": 0.2223072960972786, "num_tokens": 119720579.0, "step": 69020 }, { "entropy": 5.4213700771331785, "epoch": 5.370355961875122, "grad_norm": 1.203125, "learning_rate": 0.0002514075936782847, "loss": 4.7315, "mean_token_accuracy": 0.23256743848323821, "num_tokens": 119728512.0, "step": 69025 }, { "entropy": 5.456785249710083, "epoch": 5.3707449912468395, "grad_norm": 1.2109375, "learning_rate": 0.0002513800310517153, "loss": 4.7557, "mean_token_accuracy": 0.2401050701737404, "num_tokens": 119738867.0, "step": 69030 }, { "entropy": 5.470073652267456, "epoch": 5.371134020618557, "grad_norm": 1.3046875, "learning_rate": 0.0002513524687835414, "loss": 4.8383, "mean_token_accuracy": 0.22278754860162736, "num_tokens": 119748363.0, "step": 69035 }, { "entropy": 5.423344373703003, "epoch": 5.371523049990274, "grad_norm": 1.25, "learning_rate": 0.0002513249068741811, "loss": 4.7159, "mean_token_accuracy": 0.2281084507703781, "num_tokens": 119757032.0, "step": 69040 }, { "entropy": 5.399194622039795, "epoch": 5.371912079361992, "grad_norm": 1.3359375, "learning_rate": 0.00025129734532405265, "loss": 4.7174, "mean_token_accuracy": 0.23328703939914702, "num_tokens": 119766137.0, "step": 69045 }, { "entropy": 5.388381433486939, "epoch": 5.372301108733709, "grad_norm": 1.28125, "learning_rate": 0.00025126978413357424, "loss": 4.627, "mean_token_accuracy": 0.2414829507470131, "num_tokens": 119775487.0, "step": 69050 }, { "entropy": 5.3747858047485355, "epoch": 5.372690138105427, "grad_norm": 1.2734375, "learning_rate": 0.0002512422233031641, "loss": 4.7198, "mean_token_accuracy": 0.2361586272716522, "num_tokens": 119784398.0, "step": 69055 }, { "entropy": 5.377015113830566, "epoch": 5.373079167477145, "grad_norm": 1.2109375, "learning_rate": 0.0002512146628332404, "loss": 4.735, "mean_token_accuracy": 0.2317363739013672, "num_tokens": 119793249.0, "step": 69060 }, { "entropy": 5.398827743530274, "epoch": 5.3734681968488625, "grad_norm": 1.1953125, "learning_rate": 0.0002511871027242214, "loss": 4.7104, "mean_token_accuracy": 0.23233886659145356, "num_tokens": 119802513.0, "step": 69065 }, { "entropy": 5.458522653579712, "epoch": 5.373857226220579, "grad_norm": 1.265625, "learning_rate": 0.0002511595429765251, "loss": 4.7209, "mean_token_accuracy": 0.23024237006902695, "num_tokens": 119811318.0, "step": 69070 }, { "entropy": 5.447855615615845, "epoch": 5.374246255592297, "grad_norm": 1.2578125, "learning_rate": 0.00025113198359056986, "loss": 4.6898, "mean_token_accuracy": 0.23032086938619614, "num_tokens": 119820057.0, "step": 69075 }, { "entropy": 5.4283051013946535, "epoch": 5.374635284964015, "grad_norm": 1.1796875, "learning_rate": 0.0002511044245667738, "loss": 4.6899, "mean_token_accuracy": 0.24170751869678497, "num_tokens": 119828931.0, "step": 69080 }, { "entropy": 5.43586802482605, "epoch": 5.375024314335732, "grad_norm": 1.171875, "learning_rate": 0.000251076865905555, "loss": 4.6954, "mean_token_accuracy": 0.2353301003575325, "num_tokens": 119837511.0, "step": 69085 }, { "entropy": 5.293330335617066, "epoch": 5.37541334370745, "grad_norm": 1.2421875, "learning_rate": 0.00025104930760733163, "loss": 4.6154, "mean_token_accuracy": 0.23397128283977509, "num_tokens": 119845236.0, "step": 69090 }, { "entropy": 5.406250715255737, "epoch": 5.375802373079168, "grad_norm": 1.203125, "learning_rate": 0.000251021749672522, "loss": 4.7218, "mean_token_accuracy": 0.23249758034944534, "num_tokens": 119854465.0, "step": 69095 }, { "entropy": 5.5244039535522464, "epoch": 5.3761914024508854, "grad_norm": 1.09375, "learning_rate": 0.00025099419210154413, "loss": 4.774, "mean_token_accuracy": 0.22775956094264985, "num_tokens": 119863336.0, "step": 69100 }, { "entropy": 5.412106275558472, "epoch": 5.376580431822602, "grad_norm": 1.1640625, "learning_rate": 0.0002509666348948162, "loss": 4.7438, "mean_token_accuracy": 0.23257628828287125, "num_tokens": 119872394.0, "step": 69105 }, { "entropy": 5.374779891967774, "epoch": 5.37696946119432, "grad_norm": 1.34375, "learning_rate": 0.00025093907805275636, "loss": 4.7154, "mean_token_accuracy": 0.22919257432222367, "num_tokens": 119881663.0, "step": 69110 }, { "entropy": 5.317596101760865, "epoch": 5.377358490566038, "grad_norm": 1.171875, "learning_rate": 0.00025091152157578266, "loss": 4.619, "mean_token_accuracy": 0.23752924352884291, "num_tokens": 119891087.0, "step": 69115 }, { "entropy": 5.386262321472168, "epoch": 5.377747519937755, "grad_norm": 1.3515625, "learning_rate": 0.0002508839654643133, "loss": 4.6889, "mean_token_accuracy": 0.234139022231102, "num_tokens": 119899224.0, "step": 69120 }, { "entropy": 5.481901454925537, "epoch": 5.378136549309473, "grad_norm": 1.140625, "learning_rate": 0.0002508564097187664, "loss": 4.7914, "mean_token_accuracy": 0.22064066380262376, "num_tokens": 119908520.0, "step": 69125 }, { "entropy": 5.468776512145996, "epoch": 5.378525578681191, "grad_norm": 1.3125, "learning_rate": 0.00025082885433956007, "loss": 4.7747, "mean_token_accuracy": 0.22460367232561113, "num_tokens": 119917034.0, "step": 69130 }, { "entropy": 5.428314638137818, "epoch": 5.3789146080529076, "grad_norm": 1.2578125, "learning_rate": 0.00025080129932711234, "loss": 4.6752, "mean_token_accuracy": 0.23307447582483293, "num_tokens": 119925518.0, "step": 69135 }, { "entropy": 5.474184989929199, "epoch": 5.379303637424625, "grad_norm": 1.2890625, "learning_rate": 0.0002507737446818414, "loss": 4.7982, "mean_token_accuracy": 0.2275997966527939, "num_tokens": 119934280.0, "step": 69140 }, { "entropy": 5.301259613037109, "epoch": 5.379692666796343, "grad_norm": 1.2109375, "learning_rate": 0.0002507461904041653, "loss": 4.602, "mean_token_accuracy": 0.24738617688417436, "num_tokens": 119941847.0, "step": 69145 }, { "entropy": 5.402604341506958, "epoch": 5.380081696168061, "grad_norm": 1.25, "learning_rate": 0.00025071863649450216, "loss": 4.7578, "mean_token_accuracy": 0.23561530262231828, "num_tokens": 119950481.0, "step": 69150 }, { "entropy": 5.36326847076416, "epoch": 5.380470725539778, "grad_norm": 1.21875, "learning_rate": 0.00025069108295327006, "loss": 4.6007, "mean_token_accuracy": 0.2424105942249298, "num_tokens": 119959050.0, "step": 69155 }, { "entropy": 5.397031307220459, "epoch": 5.380859754911496, "grad_norm": 1.3125, "learning_rate": 0.00025066352978088706, "loss": 4.6603, "mean_token_accuracy": 0.23416541665792465, "num_tokens": 119967827.0, "step": 69160 }, { "entropy": 5.358386039733887, "epoch": 5.381248784283214, "grad_norm": 1.2265625, "learning_rate": 0.0002506359769777713, "loss": 4.6522, "mean_token_accuracy": 0.2340443640947342, "num_tokens": 119975979.0, "step": 69165 }, { "entropy": 5.411128950119019, "epoch": 5.3816378136549305, "grad_norm": 1.3125, "learning_rate": 0.0002506084245443408, "loss": 4.7216, "mean_token_accuracy": 0.23196171522140502, "num_tokens": 119984241.0, "step": 69170 }, { "entropy": 5.463791227340698, "epoch": 5.382026843026648, "grad_norm": 1.2421875, "learning_rate": 0.0002505808724810137, "loss": 4.7862, "mean_token_accuracy": 0.22687575370073318, "num_tokens": 119992728.0, "step": 69175 }, { "entropy": 5.399555015563965, "epoch": 5.382415872398366, "grad_norm": 1.1328125, "learning_rate": 0.00025055332078820794, "loss": 4.6779, "mean_token_accuracy": 0.22688824385404588, "num_tokens": 120001417.0, "step": 69180 }, { "entropy": 5.493369770050049, "epoch": 5.382804901770084, "grad_norm": 1.3671875, "learning_rate": 0.0002505257694663416, "loss": 4.8086, "mean_token_accuracy": 0.23114608228206635, "num_tokens": 120010086.0, "step": 69185 }, { "entropy": 5.43845009803772, "epoch": 5.383193931141801, "grad_norm": 1.265625, "learning_rate": 0.0002504982185158328, "loss": 4.7321, "mean_token_accuracy": 0.22903282940387726, "num_tokens": 120018854.0, "step": 69190 }, { "entropy": 5.459960699081421, "epoch": 5.383582960513519, "grad_norm": 1.3125, "learning_rate": 0.0002504706679370995, "loss": 4.7208, "mean_token_accuracy": 0.23157539665699006, "num_tokens": 120027215.0, "step": 69195 }, { "entropy": 5.421270799636841, "epoch": 5.383971989885237, "grad_norm": 1.2109375, "learning_rate": 0.0002504431177305598, "loss": 4.6995, "mean_token_accuracy": 0.2412053257226944, "num_tokens": 120036251.0, "step": 69200 }, { "entropy": 5.393804502487183, "epoch": 5.3843610192569535, "grad_norm": 1.2265625, "learning_rate": 0.0002504155678966317, "loss": 4.6964, "mean_token_accuracy": 0.23098417222499848, "num_tokens": 120045453.0, "step": 69205 }, { "entropy": 5.380233955383301, "epoch": 5.384750048628671, "grad_norm": 1.25, "learning_rate": 0.0002503880184357333, "loss": 4.6639, "mean_token_accuracy": 0.23818280100822448, "num_tokens": 120055155.0, "step": 69210 }, { "entropy": 5.506730270385742, "epoch": 5.385139078000389, "grad_norm": 1.25, "learning_rate": 0.00025036046934828244, "loss": 4.8387, "mean_token_accuracy": 0.22549087107181548, "num_tokens": 120063642.0, "step": 69215 }, { "entropy": 5.469258117675781, "epoch": 5.385528107372107, "grad_norm": 1.2890625, "learning_rate": 0.00025033292063469714, "loss": 4.7285, "mean_token_accuracy": 0.22771794497966766, "num_tokens": 120072983.0, "step": 69220 }, { "entropy": 5.368207216262817, "epoch": 5.385917136743824, "grad_norm": 1.21875, "learning_rate": 0.00025030537229539567, "loss": 4.672, "mean_token_accuracy": 0.2337014004588127, "num_tokens": 120081382.0, "step": 69225 }, { "entropy": 5.437441205978393, "epoch": 5.386306166115542, "grad_norm": 1.2734375, "learning_rate": 0.0002502778243307958, "loss": 4.7096, "mean_token_accuracy": 0.23622626066207886, "num_tokens": 120089954.0, "step": 69230 }, { "entropy": 5.376938676834106, "epoch": 5.38669519548726, "grad_norm": 1.265625, "learning_rate": 0.00025025027674131567, "loss": 4.7538, "mean_token_accuracy": 0.23352345526218415, "num_tokens": 120098409.0, "step": 69235 }, { "entropy": 5.335484790802002, "epoch": 5.3870842248589765, "grad_norm": 1.4453125, "learning_rate": 0.00025022272952737317, "loss": 4.6285, "mean_token_accuracy": 0.24056220352649688, "num_tokens": 120106554.0, "step": 69240 }, { "entropy": 5.3137535572052, "epoch": 5.387473254230694, "grad_norm": 1.34375, "learning_rate": 0.0002501951826893863, "loss": 4.5644, "mean_token_accuracy": 0.25208657532930373, "num_tokens": 120116296.0, "step": 69245 }, { "entropy": 5.3971131324768065, "epoch": 5.387862283602412, "grad_norm": 1.171875, "learning_rate": 0.0002501676362277731, "loss": 4.7464, "mean_token_accuracy": 0.23212269991636275, "num_tokens": 120126000.0, "step": 69250 }, { "entropy": 5.3636579513549805, "epoch": 5.38825131297413, "grad_norm": 1.265625, "learning_rate": 0.00025014009014295136, "loss": 4.7602, "mean_token_accuracy": 0.22827396541833878, "num_tokens": 120134869.0, "step": 69255 }, { "entropy": 5.33865180015564, "epoch": 5.388640342345847, "grad_norm": 1.1171875, "learning_rate": 0.0002501125444353393, "loss": 4.6616, "mean_token_accuracy": 0.23312715142965318, "num_tokens": 120144073.0, "step": 69260 }, { "entropy": 5.494708681106568, "epoch": 5.389029371717565, "grad_norm": 1.28125, "learning_rate": 0.0002500849991053547, "loss": 4.7817, "mean_token_accuracy": 0.2263398826122284, "num_tokens": 120151561.0, "step": 69265 }, { "entropy": 5.46658182144165, "epoch": 5.389418401089282, "grad_norm": 1.171875, "learning_rate": 0.00025005745415341565, "loss": 4.8065, "mean_token_accuracy": 0.22815714478492738, "num_tokens": 120160915.0, "step": 69270 }, { "entropy": 5.4578447341918945, "epoch": 5.3898074304609995, "grad_norm": 1.2890625, "learning_rate": 0.00025002990957994, "loss": 4.7176, "mean_token_accuracy": 0.23403708040714263, "num_tokens": 120168723.0, "step": 69275 }, { "entropy": 5.313422775268554, "epoch": 5.390196459832717, "grad_norm": 1.359375, "learning_rate": 0.00025000236538534577, "loss": 4.623, "mean_token_accuracy": 0.23663442134857177, "num_tokens": 120176804.0, "step": 69280 }, { "entropy": 5.448632860183716, "epoch": 5.390585489204435, "grad_norm": 1.3203125, "learning_rate": 0.00024997482157005074, "loss": 4.8243, "mean_token_accuracy": 0.22312912940979004, "num_tokens": 120185618.0, "step": 69285 }, { "entropy": 5.484459733963012, "epoch": 5.390974518576153, "grad_norm": 1.3671875, "learning_rate": 0.000249947278134473, "loss": 4.8344, "mean_token_accuracy": 0.2237105891108513, "num_tokens": 120194303.0, "step": 69290 }, { "entropy": 5.45878963470459, "epoch": 5.39136354794787, "grad_norm": 1.2578125, "learning_rate": 0.0002499197350790305, "loss": 4.7803, "mean_token_accuracy": 0.2273254707455635, "num_tokens": 120202700.0, "step": 69295 }, { "entropy": 5.427468204498291, "epoch": 5.391752577319588, "grad_norm": 1.3359375, "learning_rate": 0.00024989219240414105, "loss": 4.7284, "mean_token_accuracy": 0.23186143040657042, "num_tokens": 120211028.0, "step": 69300 }, { "entropy": 5.345390653610229, "epoch": 5.392141606691305, "grad_norm": 1.25, "learning_rate": 0.00024986465011022263, "loss": 4.5625, "mean_token_accuracy": 0.2510059863328934, "num_tokens": 120219103.0, "step": 69305 }, { "entropy": 5.377266502380371, "epoch": 5.3925306360630225, "grad_norm": 1.1484375, "learning_rate": 0.00024983710819769325, "loss": 4.7347, "mean_token_accuracy": 0.23217184394598006, "num_tokens": 120227910.0, "step": 69310 }, { "entropy": 5.433395051956177, "epoch": 5.39291966543474, "grad_norm": 1.140625, "learning_rate": 0.0002498095666669706, "loss": 4.7031, "mean_token_accuracy": 0.23660168498754502, "num_tokens": 120236514.0, "step": 69315 }, { "entropy": 5.370156145095825, "epoch": 5.393308694806458, "grad_norm": 1.2421875, "learning_rate": 0.0002497820255184727, "loss": 4.6981, "mean_token_accuracy": 0.22830221503973008, "num_tokens": 120246073.0, "step": 69320 }, { "entropy": 5.451698732376099, "epoch": 5.393697724178176, "grad_norm": 1.2890625, "learning_rate": 0.00024975448475261737, "loss": 4.7788, "mean_token_accuracy": 0.22433886379003526, "num_tokens": 120254836.0, "step": 69325 }, { "entropy": 5.460968780517578, "epoch": 5.394086753549893, "grad_norm": 1.1796875, "learning_rate": 0.00024972694436982255, "loss": 4.7949, "mean_token_accuracy": 0.2321621671319008, "num_tokens": 120264104.0, "step": 69330 }, { "entropy": 5.452217960357666, "epoch": 5.39447578292161, "grad_norm": 1.1953125, "learning_rate": 0.0002496994043705062, "loss": 4.7235, "mean_token_accuracy": 0.23301835358142853, "num_tokens": 120273021.0, "step": 69335 }, { "entropy": 5.388124084472656, "epoch": 5.394864812293328, "grad_norm": 1.2890625, "learning_rate": 0.0002496718647550861, "loss": 4.7161, "mean_token_accuracy": 0.22977873533964158, "num_tokens": 120281237.0, "step": 69340 }, { "entropy": 5.401782703399658, "epoch": 5.3952538416650455, "grad_norm": 1.234375, "learning_rate": 0.0002496443255239801, "loss": 4.7364, "mean_token_accuracy": 0.23282259553670884, "num_tokens": 120289597.0, "step": 69345 }, { "entropy": 5.4439377784729, "epoch": 5.395642871036763, "grad_norm": 1.296875, "learning_rate": 0.0002496167866776061, "loss": 4.7044, "mean_token_accuracy": 0.23319983333349228, "num_tokens": 120297451.0, "step": 69350 }, { "entropy": 5.388371706008911, "epoch": 5.396031900408481, "grad_norm": 1.28125, "learning_rate": 0.00024958924821638195, "loss": 4.6613, "mean_token_accuracy": 0.23830080181360244, "num_tokens": 120306524.0, "step": 69355 }, { "entropy": 5.463131237030029, "epoch": 5.396420929780199, "grad_norm": 1.171875, "learning_rate": 0.00024956171014072555, "loss": 4.7498, "mean_token_accuracy": 0.22492137551307678, "num_tokens": 120315299.0, "step": 69360 }, { "entropy": 5.4397077560424805, "epoch": 5.396809959151916, "grad_norm": 1.3203125, "learning_rate": 0.00024953417245105467, "loss": 4.7659, "mean_token_accuracy": 0.22942063063383103, "num_tokens": 120323591.0, "step": 69365 }, { "entropy": 5.3833495616912845, "epoch": 5.397198988523634, "grad_norm": 1.1953125, "learning_rate": 0.00024950663514778726, "loss": 4.7391, "mean_token_accuracy": 0.2292529821395874, "num_tokens": 120333280.0, "step": 69370 }, { "entropy": 5.4590222358703615, "epoch": 5.397588017895351, "grad_norm": 1.265625, "learning_rate": 0.00024947909823134107, "loss": 4.8118, "mean_token_accuracy": 0.2257261887192726, "num_tokens": 120342063.0, "step": 69375 }, { "entropy": 5.386949729919434, "epoch": 5.3979770472670685, "grad_norm": 1.3515625, "learning_rate": 0.0002494515617021339, "loss": 4.6713, "mean_token_accuracy": 0.23412439674139024, "num_tokens": 120350179.0, "step": 69380 }, { "entropy": 5.361656713485718, "epoch": 5.398366076638786, "grad_norm": 1.2265625, "learning_rate": 0.00024942402556058364, "loss": 4.684, "mean_token_accuracy": 0.23524031937122344, "num_tokens": 120358888.0, "step": 69385 }, { "entropy": 5.44440279006958, "epoch": 5.398755106010504, "grad_norm": 1.3046875, "learning_rate": 0.0002493964898071081, "loss": 4.722, "mean_token_accuracy": 0.2364642933011055, "num_tokens": 120367077.0, "step": 69390 }, { "entropy": 5.369498348236084, "epoch": 5.399144135382222, "grad_norm": 1.125, "learning_rate": 0.0002493689544421251, "loss": 4.646, "mean_token_accuracy": 0.2398667111992836, "num_tokens": 120375964.0, "step": 69395 }, { "entropy": 5.383589506149292, "epoch": 5.399533164753939, "grad_norm": 1.15625, "learning_rate": 0.00024934141946605237, "loss": 4.6591, "mean_token_accuracy": 0.23259367048740387, "num_tokens": 120384812.0, "step": 69400 }, { "entropy": 5.434037399291992, "epoch": 5.399922194125656, "grad_norm": 1.2265625, "learning_rate": 0.00024931388487930777, "loss": 4.788, "mean_token_accuracy": 0.22993735522031783, "num_tokens": 120393659.0, "step": 69405 }, { "entropy": 5.357564449310303, "epoch": 5.400311223497374, "grad_norm": 1.2421875, "learning_rate": 0.000249286350682309, "loss": 4.7033, "mean_token_accuracy": 0.2283765435218811, "num_tokens": 120401876.0, "step": 69410 }, { "entropy": 5.451650524139405, "epoch": 5.4007002528690915, "grad_norm": 1.3203125, "learning_rate": 0.0002492588168754741, "loss": 4.8434, "mean_token_accuracy": 0.23228127360343934, "num_tokens": 120410129.0, "step": 69415 }, { "entropy": 5.395188903808593, "epoch": 5.401089282240809, "grad_norm": 1.2109375, "learning_rate": 0.00024923128345922055, "loss": 4.6827, "mean_token_accuracy": 0.23758058845996857, "num_tokens": 120419525.0, "step": 69420 }, { "entropy": 5.436212348937988, "epoch": 5.401478311612527, "grad_norm": 1.171875, "learning_rate": 0.0002492037504339663, "loss": 4.6982, "mean_token_accuracy": 0.23145072758197785, "num_tokens": 120427808.0, "step": 69425 }, { "entropy": 5.394135332107544, "epoch": 5.401867340984245, "grad_norm": 1.15625, "learning_rate": 0.00024917621780012905, "loss": 4.6999, "mean_token_accuracy": 0.2338148057460785, "num_tokens": 120436737.0, "step": 69430 }, { "entropy": 5.397472333908081, "epoch": 5.402256370355962, "grad_norm": 1.2265625, "learning_rate": 0.00024914868555812663, "loss": 4.7911, "mean_token_accuracy": 0.22699290364980698, "num_tokens": 120445547.0, "step": 69435 }, { "entropy": 5.462872076034546, "epoch": 5.402645399727679, "grad_norm": 1.2578125, "learning_rate": 0.0002491211537083768, "loss": 4.8303, "mean_token_accuracy": 0.2173090770840645, "num_tokens": 120453659.0, "step": 69440 }, { "entropy": 5.379418468475341, "epoch": 5.403034429099397, "grad_norm": 1.234375, "learning_rate": 0.0002490936222512972, "loss": 4.6488, "mean_token_accuracy": 0.23608698844909667, "num_tokens": 120462828.0, "step": 69445 }, { "entropy": 5.464342021942139, "epoch": 5.4034234584711145, "grad_norm": 1.2890625, "learning_rate": 0.0002490660911873057, "loss": 4.7201, "mean_token_accuracy": 0.22766397297382354, "num_tokens": 120470625.0, "step": 69450 }, { "entropy": 5.335444355010987, "epoch": 5.403812487842832, "grad_norm": 1.109375, "learning_rate": 0.00024903856051681995, "loss": 4.6311, "mean_token_accuracy": 0.23547475337982177, "num_tokens": 120479555.0, "step": 69455 }, { "entropy": 5.2983945369720455, "epoch": 5.40420151721455, "grad_norm": 1.4921875, "learning_rate": 0.0002490110302402577, "loss": 4.6096, "mean_token_accuracy": 0.2378025010228157, "num_tokens": 120486929.0, "step": 69460 }, { "entropy": 5.353688383102417, "epoch": 5.404590546586268, "grad_norm": 1.28125, "learning_rate": 0.0002489835003580367, "loss": 4.6256, "mean_token_accuracy": 0.23577210903167725, "num_tokens": 120495757.0, "step": 69465 }, { "entropy": 5.399839782714844, "epoch": 5.404979575957984, "grad_norm": 1.2265625, "learning_rate": 0.00024895597087057483, "loss": 4.6645, "mean_token_accuracy": 0.23598668426275254, "num_tokens": 120503598.0, "step": 69470 }, { "entropy": 5.299967861175537, "epoch": 5.405368605329702, "grad_norm": 1.265625, "learning_rate": 0.0002489284417782895, "loss": 4.5772, "mean_token_accuracy": 0.24173648208379744, "num_tokens": 120511656.0, "step": 69475 }, { "entropy": 5.343464994430542, "epoch": 5.40575763470142, "grad_norm": 1.2421875, "learning_rate": 0.0002489009130815986, "loss": 4.7058, "mean_token_accuracy": 0.22958036214113237, "num_tokens": 120520861.0, "step": 69480 }, { "entropy": 5.275725984573365, "epoch": 5.4061466640731375, "grad_norm": 1.1953125, "learning_rate": 0.0002488733847809197, "loss": 4.5853, "mean_token_accuracy": 0.24319858103990555, "num_tokens": 120529910.0, "step": 69485 }, { "entropy": 5.378789186477661, "epoch": 5.406535693444855, "grad_norm": 1.234375, "learning_rate": 0.0002488458568766707, "loss": 4.67, "mean_token_accuracy": 0.23692481964826584, "num_tokens": 120538649.0, "step": 69490 }, { "entropy": 5.386489295959473, "epoch": 5.406924722816573, "grad_norm": 1.2109375, "learning_rate": 0.0002488183293692692, "loss": 4.7515, "mean_token_accuracy": 0.2358615905046463, "num_tokens": 120547649.0, "step": 69495 }, { "entropy": 5.377122592926026, "epoch": 5.407313752188291, "grad_norm": 1.3203125, "learning_rate": 0.0002487908022591329, "loss": 4.706, "mean_token_accuracy": 0.2325155183672905, "num_tokens": 120556043.0, "step": 69500 }, { "entropy": 5.391704130172729, "epoch": 5.407702781560007, "grad_norm": 1.1640625, "learning_rate": 0.00024876327554667943, "loss": 4.7342, "mean_token_accuracy": 0.23460321724414826, "num_tokens": 120564735.0, "step": 69505 }, { "entropy": 5.436771106719971, "epoch": 5.408091810931725, "grad_norm": 1.21875, "learning_rate": 0.0002487357492323265, "loss": 4.8042, "mean_token_accuracy": 0.22642077803611754, "num_tokens": 120574203.0, "step": 69510 }, { "entropy": 5.489454984664917, "epoch": 5.408480840303443, "grad_norm": 1.15625, "learning_rate": 0.0002487082233164918, "loss": 4.794, "mean_token_accuracy": 0.23582003265619278, "num_tokens": 120583396.0, "step": 69515 }, { "entropy": 5.435397052764893, "epoch": 5.4088698696751605, "grad_norm": 1.21875, "learning_rate": 0.0002486806977995929, "loss": 4.779, "mean_token_accuracy": 0.22473386228084563, "num_tokens": 120592431.0, "step": 69520 }, { "entropy": 5.443766784667969, "epoch": 5.409258899046878, "grad_norm": 1.15625, "learning_rate": 0.0002486531726820476, "loss": 4.7119, "mean_token_accuracy": 0.23093476742506028, "num_tokens": 120602632.0, "step": 69525 }, { "entropy": 5.458692216873169, "epoch": 5.409647928418596, "grad_norm": 1.3515625, "learning_rate": 0.00024862564796427337, "loss": 4.836, "mean_token_accuracy": 0.21941891610622405, "num_tokens": 120611475.0, "step": 69530 }, { "entropy": 5.558376979827881, "epoch": 5.410036957790314, "grad_norm": 1.15625, "learning_rate": 0.000248598123646688, "loss": 4.8709, "mean_token_accuracy": 0.21736570298671723, "num_tokens": 120620754.0, "step": 69535 }, { "entropy": 5.53126482963562, "epoch": 5.41042598716203, "grad_norm": 1.2421875, "learning_rate": 0.0002485705997297091, "loss": 4.7227, "mean_token_accuracy": 0.22985261976718901, "num_tokens": 120628606.0, "step": 69540 }, { "entropy": 5.3579840660095215, "epoch": 5.410815016533748, "grad_norm": 1.296875, "learning_rate": 0.00024854307621375427, "loss": 4.6421, "mean_token_accuracy": 0.23879548758268357, "num_tokens": 120636064.0, "step": 69545 }, { "entropy": 5.36305570602417, "epoch": 5.411204045905466, "grad_norm": 1.1953125, "learning_rate": 0.0002485155530992411, "loss": 4.7353, "mean_token_accuracy": 0.23055816292762757, "num_tokens": 120644805.0, "step": 69550 }, { "entropy": 5.393668222427368, "epoch": 5.4115930752771835, "grad_norm": 1.1875, "learning_rate": 0.0002484880303865873, "loss": 4.6885, "mean_token_accuracy": 0.23358451426029206, "num_tokens": 120653331.0, "step": 69555 }, { "entropy": 5.405296277999878, "epoch": 5.411982104648901, "grad_norm": 1.1875, "learning_rate": 0.0002484605080762104, "loss": 4.6987, "mean_token_accuracy": 0.2383778989315033, "num_tokens": 120661927.0, "step": 69560 }, { "entropy": 5.378438425064087, "epoch": 5.412371134020619, "grad_norm": 1.359375, "learning_rate": 0.0002484329861685281, "loss": 4.7357, "mean_token_accuracy": 0.2447812184691429, "num_tokens": 120669586.0, "step": 69565 }, { "entropy": 5.383087825775147, "epoch": 5.412760163392337, "grad_norm": 1.2109375, "learning_rate": 0.00024840546466395796, "loss": 4.6686, "mean_token_accuracy": 0.23115828037261962, "num_tokens": 120678776.0, "step": 69570 }, { "entropy": 5.48199462890625, "epoch": 5.413149192764053, "grad_norm": 1.3203125, "learning_rate": 0.00024837794356291756, "loss": 4.8083, "mean_token_accuracy": 0.22595032453536987, "num_tokens": 120686938.0, "step": 69575 }, { "entropy": 5.544227552413941, "epoch": 5.413538222135771, "grad_norm": 1.3203125, "learning_rate": 0.0002483504228658245, "loss": 4.819, "mean_token_accuracy": 0.2253738060593605, "num_tokens": 120694816.0, "step": 69580 }, { "entropy": 5.348663854598999, "epoch": 5.413927251507489, "grad_norm": 1.234375, "learning_rate": 0.0002483229025730963, "loss": 4.6623, "mean_token_accuracy": 0.2359575092792511, "num_tokens": 120704172.0, "step": 69585 }, { "entropy": 5.47953953742981, "epoch": 5.4143162808792065, "grad_norm": 1.265625, "learning_rate": 0.0002482953826851506, "loss": 4.8531, "mean_token_accuracy": 0.22059032171964646, "num_tokens": 120712914.0, "step": 69590 }, { "entropy": 5.458735036849975, "epoch": 5.414705310250924, "grad_norm": 1.296875, "learning_rate": 0.000248267863202405, "loss": 4.7828, "mean_token_accuracy": 0.2275280773639679, "num_tokens": 120721703.0, "step": 69595 }, { "entropy": 5.443139362335205, "epoch": 5.415094339622642, "grad_norm": 1.2265625, "learning_rate": 0.00024824034412527704, "loss": 4.692, "mean_token_accuracy": 0.23016002625226975, "num_tokens": 120729841.0, "step": 69600 }, { "entropy": 5.399218511581421, "epoch": 5.415483368994359, "grad_norm": 1.3515625, "learning_rate": 0.0002482128254541842, "loss": 4.6911, "mean_token_accuracy": 0.22917818129062653, "num_tokens": 120737416.0, "step": 69605 }, { "entropy": 5.397141551971435, "epoch": 5.415872398366076, "grad_norm": 1.1875, "learning_rate": 0.0002481853071895442, "loss": 4.6578, "mean_token_accuracy": 0.23408349901437758, "num_tokens": 120746618.0, "step": 69610 }, { "entropy": 5.332381725311279, "epoch": 5.416261427737794, "grad_norm": 1.265625, "learning_rate": 0.0002481577893317744, "loss": 4.6408, "mean_token_accuracy": 0.2368878483772278, "num_tokens": 120755259.0, "step": 69615 }, { "entropy": 5.413399028778076, "epoch": 5.416650457109512, "grad_norm": 1.28125, "learning_rate": 0.0002481302718812924, "loss": 4.7387, "mean_token_accuracy": 0.23045077174901962, "num_tokens": 120763986.0, "step": 69620 }, { "entropy": 5.454868793487549, "epoch": 5.4170394864812295, "grad_norm": 1.2421875, "learning_rate": 0.0002481027548385158, "loss": 4.7489, "mean_token_accuracy": 0.23709761798381807, "num_tokens": 120771976.0, "step": 69625 }, { "entropy": 5.429926443099975, "epoch": 5.417428515852947, "grad_norm": 1.234375, "learning_rate": 0.00024807523820386207, "loss": 4.7379, "mean_token_accuracy": 0.22935721427202224, "num_tokens": 120780426.0, "step": 69630 }, { "entropy": 5.47351336479187, "epoch": 5.417817545224665, "grad_norm": 1.3125, "learning_rate": 0.0002480477219777488, "loss": 4.7664, "mean_token_accuracy": 0.22802679985761642, "num_tokens": 120789438.0, "step": 69635 }, { "entropy": 5.467291927337646, "epoch": 5.418206574596382, "grad_norm": 1.3046875, "learning_rate": 0.0002480202061605933, "loss": 4.7472, "mean_token_accuracy": 0.2314481645822525, "num_tokens": 120797705.0, "step": 69640 }, { "entropy": 5.43750524520874, "epoch": 5.418595603968099, "grad_norm": 1.2421875, "learning_rate": 0.0002479926907528134, "loss": 4.7702, "mean_token_accuracy": 0.2306249037384987, "num_tokens": 120806015.0, "step": 69645 }, { "entropy": 5.326909303665161, "epoch": 5.418984633339817, "grad_norm": 1.1875, "learning_rate": 0.00024796517575482633, "loss": 4.6782, "mean_token_accuracy": 0.23661180287599565, "num_tokens": 120815051.0, "step": 69650 }, { "entropy": 5.462689781188965, "epoch": 5.419373662711535, "grad_norm": 1.3046875, "learning_rate": 0.0002479376611670498, "loss": 4.6801, "mean_token_accuracy": 0.23674658983945845, "num_tokens": 120823108.0, "step": 69655 }, { "entropy": 5.428510618209839, "epoch": 5.4197626920832525, "grad_norm": 1.3125, "learning_rate": 0.00024791014698990116, "loss": 4.7067, "mean_token_accuracy": 0.2435269370675087, "num_tokens": 120831049.0, "step": 69660 }, { "entropy": 5.361752080917358, "epoch": 5.42015172145497, "grad_norm": 1.1953125, "learning_rate": 0.00024788263322379783, "loss": 4.757, "mean_token_accuracy": 0.22787317931652068, "num_tokens": 120840264.0, "step": 69665 }, { "entropy": 5.418995141983032, "epoch": 5.420540750826687, "grad_norm": 1.203125, "learning_rate": 0.00024785511986915746, "loss": 4.7482, "mean_token_accuracy": 0.23244829177856446, "num_tokens": 120849006.0, "step": 69670 }, { "entropy": 5.425528526306152, "epoch": 5.420929780198405, "grad_norm": 1.1796875, "learning_rate": 0.0002478276069263974, "loss": 4.6785, "mean_token_accuracy": 0.23997917026281357, "num_tokens": 120857876.0, "step": 69675 }, { "entropy": 5.4137050151824955, "epoch": 5.421318809570122, "grad_norm": 1.1953125, "learning_rate": 0.00024780009439593514, "loss": 4.7007, "mean_token_accuracy": 0.2324400097131729, "num_tokens": 120867462.0, "step": 69680 }, { "entropy": 5.427243423461914, "epoch": 5.42170783894184, "grad_norm": 1.2734375, "learning_rate": 0.0002477725822781881, "loss": 4.6932, "mean_token_accuracy": 0.23979664891958236, "num_tokens": 120876326.0, "step": 69685 }, { "entropy": 5.288679027557373, "epoch": 5.422096868313558, "grad_norm": 1.2578125, "learning_rate": 0.0002477450705735739, "loss": 4.5848, "mean_token_accuracy": 0.24881603717803955, "num_tokens": 120885339.0, "step": 69690 }, { "entropy": 5.385456371307373, "epoch": 5.4224858976852754, "grad_norm": 1.296875, "learning_rate": 0.00024771755928250984, "loss": 4.685, "mean_token_accuracy": 0.233632892370224, "num_tokens": 120893337.0, "step": 69695 }, { "entropy": 5.409089612960815, "epoch": 5.422874927056993, "grad_norm": 1.328125, "learning_rate": 0.00024769004840541337, "loss": 4.773, "mean_token_accuracy": 0.22381669282913208, "num_tokens": 120902267.0, "step": 69700 }, { "entropy": 5.337218713760376, "epoch": 5.42326395642871, "grad_norm": 1.265625, "learning_rate": 0.000247662537942702, "loss": 4.6915, "mean_token_accuracy": 0.23128504157066346, "num_tokens": 120910925.0, "step": 69705 }, { "entropy": 5.431468725204468, "epoch": 5.423652985800428, "grad_norm": 1.3828125, "learning_rate": 0.0002476350278947931, "loss": 4.7388, "mean_token_accuracy": 0.2329317718744278, "num_tokens": 120918965.0, "step": 69710 }, { "entropy": 5.436700057983399, "epoch": 5.424042015172145, "grad_norm": 1.171875, "learning_rate": 0.000247607518262104, "loss": 4.7466, "mean_token_accuracy": 0.23125744014978408, "num_tokens": 120927609.0, "step": 69715 }, { "entropy": 5.443602228164673, "epoch": 5.424431044543863, "grad_norm": 1.265625, "learning_rate": 0.0002475800090450523, "loss": 4.7372, "mean_token_accuracy": 0.23425329625606536, "num_tokens": 120936334.0, "step": 69720 }, { "entropy": 5.418461465835572, "epoch": 5.424820073915581, "grad_norm": 1.2265625, "learning_rate": 0.0002475525002440553, "loss": 4.747, "mean_token_accuracy": 0.23060865253210067, "num_tokens": 120944753.0, "step": 69725 }, { "entropy": 5.418678522109985, "epoch": 5.425209103287298, "grad_norm": 1.265625, "learning_rate": 0.00024752499185953043, "loss": 4.7056, "mean_token_accuracy": 0.23293332904577255, "num_tokens": 120953678.0, "step": 69730 }, { "entropy": 5.426810455322266, "epoch": 5.425598132659016, "grad_norm": 1.3046875, "learning_rate": 0.0002474974838918951, "loss": 4.7339, "mean_token_accuracy": 0.23009037226438522, "num_tokens": 120962000.0, "step": 69735 }, { "entropy": 5.4070981502532955, "epoch": 5.425987162030733, "grad_norm": 1.2109375, "learning_rate": 0.0002474699763415667, "loss": 4.68, "mean_token_accuracy": 0.23633635938167571, "num_tokens": 120970633.0, "step": 69740 }, { "entropy": 5.388733196258545, "epoch": 5.426376191402451, "grad_norm": 1.203125, "learning_rate": 0.00024744246920896243, "loss": 4.7433, "mean_token_accuracy": 0.2228708028793335, "num_tokens": 120979404.0, "step": 69745 }, { "entropy": 5.381824254989624, "epoch": 5.426765220774168, "grad_norm": 1.203125, "learning_rate": 0.0002474149624944999, "loss": 4.6391, "mean_token_accuracy": 0.2393185406923294, "num_tokens": 120988260.0, "step": 69750 }, { "entropy": 5.44990906715393, "epoch": 5.427154250145886, "grad_norm": 1.203125, "learning_rate": 0.00024738745619859643, "loss": 4.8114, "mean_token_accuracy": 0.21840309202671052, "num_tokens": 120996880.0, "step": 69755 }, { "entropy": 5.420956230163574, "epoch": 5.427543279517604, "grad_norm": 1.2734375, "learning_rate": 0.00024735995032166934, "loss": 4.6596, "mean_token_accuracy": 0.2332982674241066, "num_tokens": 121005173.0, "step": 69760 }, { "entropy": 5.418930864334106, "epoch": 5.427932308889321, "grad_norm": 1.34375, "learning_rate": 0.0002473324448641361, "loss": 4.7104, "mean_token_accuracy": 0.23531652688980104, "num_tokens": 121013945.0, "step": 69765 }, { "entropy": 5.496822547912598, "epoch": 5.428321338261039, "grad_norm": 1.296875, "learning_rate": 0.00024730493982641396, "loss": 4.7292, "mean_token_accuracy": 0.23161191195249559, "num_tokens": 121023110.0, "step": 69770 }, { "entropy": 5.402050733566284, "epoch": 5.428710367632756, "grad_norm": 1.21875, "learning_rate": 0.0002472774352089202, "loss": 4.7265, "mean_token_accuracy": 0.2261809378862381, "num_tokens": 121031542.0, "step": 69775 }, { "entropy": 5.516595315933228, "epoch": 5.429099397004474, "grad_norm": 1.375, "learning_rate": 0.0002472499310120723, "loss": 4.8246, "mean_token_accuracy": 0.21990877091884614, "num_tokens": 121040152.0, "step": 69780 }, { "entropy": 5.345261812210083, "epoch": 5.429488426376191, "grad_norm": 1.3125, "learning_rate": 0.0002472224272362875, "loss": 4.613, "mean_token_accuracy": 0.24509314447641373, "num_tokens": 121048806.0, "step": 69785 }, { "entropy": 5.392209720611572, "epoch": 5.429877455747909, "grad_norm": 1.3125, "learning_rate": 0.00024719492388198313, "loss": 4.7415, "mean_token_accuracy": 0.23578960299491883, "num_tokens": 121057477.0, "step": 69790 }, { "entropy": 5.476546955108643, "epoch": 5.430266485119627, "grad_norm": 1.1875, "learning_rate": 0.0002471674209495765, "loss": 4.7556, "mean_token_accuracy": 0.22759706228971482, "num_tokens": 121066567.0, "step": 69795 }, { "entropy": 5.370533275604248, "epoch": 5.430655514491344, "grad_norm": 1.234375, "learning_rate": 0.00024713991843948506, "loss": 4.6347, "mean_token_accuracy": 0.23870881050825118, "num_tokens": 121075962.0, "step": 69800 }, { "entropy": 5.33057861328125, "epoch": 5.431044543863061, "grad_norm": 1.1875, "learning_rate": 0.00024711241635212597, "loss": 4.6613, "mean_token_accuracy": 0.23056967705488204, "num_tokens": 121084603.0, "step": 69805 }, { "entropy": 5.376582908630371, "epoch": 5.431433573234779, "grad_norm": 1.203125, "learning_rate": 0.00024708491468791656, "loss": 4.7561, "mean_token_accuracy": 0.23227910697460175, "num_tokens": 121093583.0, "step": 69810 }, { "entropy": 5.396458911895752, "epoch": 5.431822602606497, "grad_norm": 1.25, "learning_rate": 0.0002470574134472741, "loss": 4.6769, "mean_token_accuracy": 0.23346876800060273, "num_tokens": 121102012.0, "step": 69815 }, { "entropy": 5.4126996994018555, "epoch": 5.432211631978214, "grad_norm": 1.2265625, "learning_rate": 0.00024702991263061595, "loss": 4.8177, "mean_token_accuracy": 0.21887790709733962, "num_tokens": 121110366.0, "step": 69820 }, { "entropy": 5.431943082809449, "epoch": 5.432600661349932, "grad_norm": 1.171875, "learning_rate": 0.00024700241223835935, "loss": 4.8112, "mean_token_accuracy": 0.22494069039821624, "num_tokens": 121120132.0, "step": 69825 }, { "entropy": 5.340444564819336, "epoch": 5.43298969072165, "grad_norm": 1.1953125, "learning_rate": 0.00024697491227092163, "loss": 4.6126, "mean_token_accuracy": 0.24079171121120452, "num_tokens": 121129093.0, "step": 69830 }, { "entropy": 5.436751842498779, "epoch": 5.433378720093367, "grad_norm": 1.28125, "learning_rate": 0.00024694741272872, "loss": 4.7612, "mean_token_accuracy": 0.23306770622730255, "num_tokens": 121137332.0, "step": 69835 }, { "entropy": 5.497312021255493, "epoch": 5.433767749465084, "grad_norm": 1.28125, "learning_rate": 0.00024691991361217166, "loss": 4.76, "mean_token_accuracy": 0.22322983741760255, "num_tokens": 121145933.0, "step": 69840 }, { "entropy": 5.401016902923584, "epoch": 5.434156778836802, "grad_norm": 1.296875, "learning_rate": 0.00024689241492169403, "loss": 4.7414, "mean_token_accuracy": 0.23306696563959123, "num_tokens": 121154423.0, "step": 69845 }, { "entropy": 5.430587244033814, "epoch": 5.43454580820852, "grad_norm": 1.171875, "learning_rate": 0.00024686491665770424, "loss": 4.7063, "mean_token_accuracy": 0.23358284831047058, "num_tokens": 121162853.0, "step": 69850 }, { "entropy": 5.454870080947876, "epoch": 5.434934837580237, "grad_norm": 1.3046875, "learning_rate": 0.00024683741882061954, "loss": 4.7897, "mean_token_accuracy": 0.232746858894825, "num_tokens": 121171002.0, "step": 69855 }, { "entropy": 5.429724216461182, "epoch": 5.435323866951955, "grad_norm": 1.2578125, "learning_rate": 0.0002468099214108572, "loss": 4.8542, "mean_token_accuracy": 0.2178139865398407, "num_tokens": 121179537.0, "step": 69860 }, { "entropy": 5.458304786682129, "epoch": 5.435712896323673, "grad_norm": 1.1640625, "learning_rate": 0.00024678242442883444, "loss": 4.7646, "mean_token_accuracy": 0.21891040056943895, "num_tokens": 121189225.0, "step": 69865 }, { "entropy": 5.344929504394531, "epoch": 5.43610192569539, "grad_norm": 1.25, "learning_rate": 0.00024675492787496844, "loss": 4.6952, "mean_token_accuracy": 0.2282920867204666, "num_tokens": 121198203.0, "step": 69870 }, { "entropy": 5.416469621658325, "epoch": 5.436490955067107, "grad_norm": 1.171875, "learning_rate": 0.00024672743174967645, "loss": 4.7152, "mean_token_accuracy": 0.23307677507400512, "num_tokens": 121206277.0, "step": 69875 }, { "entropy": 5.4137365341186525, "epoch": 5.436879984438825, "grad_norm": 1.3125, "learning_rate": 0.0002466999360533757, "loss": 4.7148, "mean_token_accuracy": 0.2301306888461113, "num_tokens": 121214887.0, "step": 69880 }, { "entropy": 5.378177452087402, "epoch": 5.437269013810543, "grad_norm": 1.3125, "learning_rate": 0.0002466724407864833, "loss": 4.671, "mean_token_accuracy": 0.2308019742369652, "num_tokens": 121223559.0, "step": 69885 }, { "entropy": 5.359039831161499, "epoch": 5.43765804318226, "grad_norm": 1.203125, "learning_rate": 0.00024664494594941664, "loss": 4.6787, "mean_token_accuracy": 0.23452642410993577, "num_tokens": 121232936.0, "step": 69890 }, { "entropy": 5.382229518890381, "epoch": 5.438047072553978, "grad_norm": 1.25, "learning_rate": 0.00024661745154259273, "loss": 4.7242, "mean_token_accuracy": 0.22653417587280272, "num_tokens": 121241074.0, "step": 69895 }, { "entropy": 5.401311302185059, "epoch": 5.438436101925696, "grad_norm": 1.234375, "learning_rate": 0.0002465899575664289, "loss": 4.709, "mean_token_accuracy": 0.23395226001739503, "num_tokens": 121249874.0, "step": 69900 }, { "entropy": 5.417638635635376, "epoch": 5.438825131297413, "grad_norm": 1.203125, "learning_rate": 0.00024656246402134216, "loss": 4.7134, "mean_token_accuracy": 0.23267678320407867, "num_tokens": 121258925.0, "step": 69905 }, { "entropy": 5.365522146224976, "epoch": 5.43921416066913, "grad_norm": 1.140625, "learning_rate": 0.0002465349709077498, "loss": 4.6694, "mean_token_accuracy": 0.24021781980991364, "num_tokens": 121268351.0, "step": 69910 }, { "entropy": 5.407857608795166, "epoch": 5.439603190040848, "grad_norm": 1.2734375, "learning_rate": 0.0002465074782260689, "loss": 4.7249, "mean_token_accuracy": 0.23254556804895402, "num_tokens": 121277018.0, "step": 69915 }, { "entropy": 5.402533864974975, "epoch": 5.439992219412566, "grad_norm": 1.2265625, "learning_rate": 0.00024647998597671674, "loss": 4.7161, "mean_token_accuracy": 0.23502183109521865, "num_tokens": 121285030.0, "step": 69920 }, { "entropy": 5.460343599319458, "epoch": 5.440381248784283, "grad_norm": 1.2109375, "learning_rate": 0.0002464524941601103, "loss": 4.7965, "mean_token_accuracy": 0.22272115349769592, "num_tokens": 121293487.0, "step": 69925 }, { "entropy": 5.413256359100342, "epoch": 5.440770278156001, "grad_norm": 1.3515625, "learning_rate": 0.00024642500277666696, "loss": 4.7631, "mean_token_accuracy": 0.2316405341029167, "num_tokens": 121301859.0, "step": 69930 }, { "entropy": 5.474071025848389, "epoch": 5.441159307527719, "grad_norm": 1.234375, "learning_rate": 0.00024639751182680363, "loss": 4.7632, "mean_token_accuracy": 0.22675004750490188, "num_tokens": 121310178.0, "step": 69935 }, { "entropy": 5.351826477050781, "epoch": 5.4415483368994355, "grad_norm": 1.21875, "learning_rate": 0.0002463700213109376, "loss": 4.7027, "mean_token_accuracy": 0.2316521629691124, "num_tokens": 121318479.0, "step": 69940 }, { "entropy": 5.353415584564209, "epoch": 5.441937366271153, "grad_norm": 1.21875, "learning_rate": 0.00024634253122948584, "loss": 4.6754, "mean_token_accuracy": 0.23054594844579696, "num_tokens": 121327477.0, "step": 69945 }, { "entropy": 5.4395331859588625, "epoch": 5.442326395642871, "grad_norm": 1.234375, "learning_rate": 0.00024631504158286556, "loss": 4.7231, "mean_token_accuracy": 0.2321978658437729, "num_tokens": 121336470.0, "step": 69950 }, { "entropy": 5.457323741912842, "epoch": 5.442715425014589, "grad_norm": 1.28125, "learning_rate": 0.00024628755237149385, "loss": 4.7612, "mean_token_accuracy": 0.2316087543964386, "num_tokens": 121344750.0, "step": 69955 }, { "entropy": 5.442560243606567, "epoch": 5.443104454386306, "grad_norm": 1.3203125, "learning_rate": 0.00024626006359578797, "loss": 4.7424, "mean_token_accuracy": 0.2308705136179924, "num_tokens": 121352999.0, "step": 69960 }, { "entropy": 5.394291114807129, "epoch": 5.443493483758024, "grad_norm": 1.265625, "learning_rate": 0.00024623257525616484, "loss": 4.6968, "mean_token_accuracy": 0.23462053537368774, "num_tokens": 121361262.0, "step": 69965 }, { "entropy": 5.381725740432739, "epoch": 5.443882513129742, "grad_norm": 1.25, "learning_rate": 0.00024620508735304146, "loss": 4.6804, "mean_token_accuracy": 0.23458803743124007, "num_tokens": 121369730.0, "step": 69970 }, { "entropy": 5.449749517440796, "epoch": 5.4442715425014585, "grad_norm": 1.28125, "learning_rate": 0.0002461775998868352, "loss": 4.7857, "mean_token_accuracy": 0.22504192888736724, "num_tokens": 121378282.0, "step": 69975 }, { "entropy": 5.372137928009034, "epoch": 5.444660571873176, "grad_norm": 1.265625, "learning_rate": 0.00024615011285796293, "loss": 4.6626, "mean_token_accuracy": 0.23253389000892638, "num_tokens": 121387032.0, "step": 69980 }, { "entropy": 5.304735946655273, "epoch": 5.445049601244894, "grad_norm": 1.2421875, "learning_rate": 0.00024612262626684176, "loss": 4.6351, "mean_token_accuracy": 0.23193720132112502, "num_tokens": 121395225.0, "step": 69985 }, { "entropy": 5.412107610702515, "epoch": 5.445438630616612, "grad_norm": 1.1875, "learning_rate": 0.0002460951401138888, "loss": 4.7067, "mean_token_accuracy": 0.2321212559938431, "num_tokens": 121404662.0, "step": 69990 }, { "entropy": 5.444408273696899, "epoch": 5.445827659988329, "grad_norm": 1.171875, "learning_rate": 0.00024606765439952105, "loss": 4.7544, "mean_token_accuracy": 0.22917400151491166, "num_tokens": 121414671.0, "step": 69995 }, { "entropy": 5.51793475151062, "epoch": 5.446216689360047, "grad_norm": 1.2578125, "learning_rate": 0.0002460401691241556, "loss": 4.7658, "mean_token_accuracy": 0.22215323597192765, "num_tokens": 121423497.0, "step": 70000 }, { "entropy": 5.483133125305176, "epoch": 5.446605718731764, "grad_norm": 1.265625, "learning_rate": 0.00024601268428820947, "loss": 4.7445, "mean_token_accuracy": 0.22411587685346604, "num_tokens": 121432303.0, "step": 70005 }, { "entropy": 5.419503784179687, "epoch": 5.4469947481034815, "grad_norm": 1.234375, "learning_rate": 0.00024598519989209983, "loss": 4.7584, "mean_token_accuracy": 0.22890669405460357, "num_tokens": 121440799.0, "step": 70010 }, { "entropy": 5.4231503963470455, "epoch": 5.447383777475199, "grad_norm": 1.3046875, "learning_rate": 0.0002459577159362434, "loss": 4.8076, "mean_token_accuracy": 0.22493340075016022, "num_tokens": 121448754.0, "step": 70015 }, { "entropy": 5.39298906326294, "epoch": 5.447772806846917, "grad_norm": 1.25, "learning_rate": 0.0002459302324210575, "loss": 4.705, "mean_token_accuracy": 0.23102498203516006, "num_tokens": 121457097.0, "step": 70020 }, { "entropy": 5.478921937942505, "epoch": 5.448161836218635, "grad_norm": 1.234375, "learning_rate": 0.0002459027493469591, "loss": 4.728, "mean_token_accuracy": 0.2270919233560562, "num_tokens": 121465936.0, "step": 70025 }, { "entropy": 5.415809965133667, "epoch": 5.448550865590352, "grad_norm": 1.3515625, "learning_rate": 0.00024587526671436517, "loss": 4.7353, "mean_token_accuracy": 0.23051173090934754, "num_tokens": 121474693.0, "step": 70030 }, { "entropy": 5.369022274017334, "epoch": 5.44893989496207, "grad_norm": 1.2265625, "learning_rate": 0.00024584778452369264, "loss": 4.6531, "mean_token_accuracy": 0.236466483771801, "num_tokens": 121483667.0, "step": 70035 }, { "entropy": 5.386430454254151, "epoch": 5.449328924333787, "grad_norm": 1.234375, "learning_rate": 0.00024582030277535866, "loss": 4.7178, "mean_token_accuracy": 0.22982580810785294, "num_tokens": 121492866.0, "step": 70040 }, { "entropy": 5.440623378753662, "epoch": 5.4497179537055045, "grad_norm": 1.1796875, "learning_rate": 0.00024579282146978016, "loss": 4.7028, "mean_token_accuracy": 0.22673131078481673, "num_tokens": 121502225.0, "step": 70045 }, { "entropy": 5.42845573425293, "epoch": 5.450106983077222, "grad_norm": 1.2421875, "learning_rate": 0.000245765340607374, "loss": 4.7631, "mean_token_accuracy": 0.22806007117033006, "num_tokens": 121511430.0, "step": 70050 }, { "entropy": 5.35962815284729, "epoch": 5.45049601244894, "grad_norm": 1.203125, "learning_rate": 0.0002457378601885573, "loss": 4.6992, "mean_token_accuracy": 0.2309756502509117, "num_tokens": 121520468.0, "step": 70055 }, { "entropy": 5.407279539108276, "epoch": 5.450885041820658, "grad_norm": 1.328125, "learning_rate": 0.00024571038021374705, "loss": 4.7152, "mean_token_accuracy": 0.23406866639852525, "num_tokens": 121529071.0, "step": 70060 }, { "entropy": 5.417733764648437, "epoch": 5.451274071192375, "grad_norm": 1.28125, "learning_rate": 0.00024568290068336014, "loss": 4.7746, "mean_token_accuracy": 0.22933125793933867, "num_tokens": 121538035.0, "step": 70065 }, { "entropy": 5.402890968322754, "epoch": 5.451663100564093, "grad_norm": 1.3203125, "learning_rate": 0.0002456554215978135, "loss": 4.7282, "mean_token_accuracy": 0.22448500990867615, "num_tokens": 121546987.0, "step": 70070 }, { "entropy": 5.46339602470398, "epoch": 5.45205212993581, "grad_norm": 1.2890625, "learning_rate": 0.0002456279429575242, "loss": 4.692, "mean_token_accuracy": 0.23416840881109238, "num_tokens": 121555872.0, "step": 70075 }, { "entropy": 5.470245695114135, "epoch": 5.4524411593075275, "grad_norm": 1.25, "learning_rate": 0.00024560046476290905, "loss": 4.7466, "mean_token_accuracy": 0.22516052573919296, "num_tokens": 121564873.0, "step": 70080 }, { "entropy": 5.418851518630982, "epoch": 5.452830188679245, "grad_norm": 1.1796875, "learning_rate": 0.00024557298701438504, "loss": 4.7793, "mean_token_accuracy": 0.23250671923160554, "num_tokens": 121573479.0, "step": 70085 }, { "entropy": 5.341291284561157, "epoch": 5.453219218050963, "grad_norm": 1.2421875, "learning_rate": 0.0002455455097123691, "loss": 4.6511, "mean_token_accuracy": 0.23310232758522034, "num_tokens": 121581831.0, "step": 70090 }, { "entropy": 5.483042812347412, "epoch": 5.453608247422681, "grad_norm": 1.296875, "learning_rate": 0.0002455180328572783, "loss": 4.7368, "mean_token_accuracy": 0.24039117246866226, "num_tokens": 121590028.0, "step": 70095 }, { "entropy": 5.414647150039673, "epoch": 5.453997276794398, "grad_norm": 1.2265625, "learning_rate": 0.00024549055644952926, "loss": 4.7229, "mean_token_accuracy": 0.22803862392902374, "num_tokens": 121599110.0, "step": 70100 }, { "entropy": 5.39364538192749, "epoch": 5.454386306166116, "grad_norm": 1.1328125, "learning_rate": 0.0002454630804895392, "loss": 4.7733, "mean_token_accuracy": 0.22963395714759827, "num_tokens": 121608355.0, "step": 70105 }, { "entropy": 5.3686693668365475, "epoch": 5.454775335537833, "grad_norm": 1.3984375, "learning_rate": 0.0002454356049777248, "loss": 4.6353, "mean_token_accuracy": 0.23543082177639008, "num_tokens": 121616415.0, "step": 70110 }, { "entropy": 5.444333076477051, "epoch": 5.4551643649095505, "grad_norm": 1.3671875, "learning_rate": 0.00024540812991450306, "loss": 4.776, "mean_token_accuracy": 0.22534285634756088, "num_tokens": 121624213.0, "step": 70115 }, { "entropy": 5.462574672698975, "epoch": 5.455553394281268, "grad_norm": 1.203125, "learning_rate": 0.00024538065530029093, "loss": 4.7355, "mean_token_accuracy": 0.23439619988203048, "num_tokens": 121632866.0, "step": 70120 }, { "entropy": 5.433603715896607, "epoch": 5.455942423652986, "grad_norm": 1.296875, "learning_rate": 0.0002453531811355051, "loss": 4.7684, "mean_token_accuracy": 0.2310313731431961, "num_tokens": 121641381.0, "step": 70125 }, { "entropy": 5.396178150177002, "epoch": 5.456331453024704, "grad_norm": 1.1796875, "learning_rate": 0.00024532570742056257, "loss": 4.7217, "mean_token_accuracy": 0.23286139369010925, "num_tokens": 121650784.0, "step": 70130 }, { "entropy": 5.39460825920105, "epoch": 5.456720482396421, "grad_norm": 1.2109375, "learning_rate": 0.00024529823415588025, "loss": 4.7605, "mean_token_accuracy": 0.23404355198144913, "num_tokens": 121660355.0, "step": 70135 }, { "entropy": 5.400440835952759, "epoch": 5.457109511768138, "grad_norm": 1.28125, "learning_rate": 0.0002452707613418749, "loss": 4.66, "mean_token_accuracy": 0.2350002110004425, "num_tokens": 121668725.0, "step": 70140 }, { "entropy": 5.47832760810852, "epoch": 5.457498541139856, "grad_norm": 1.265625, "learning_rate": 0.00024524328897896345, "loss": 4.7688, "mean_token_accuracy": 0.2324103221297264, "num_tokens": 121677675.0, "step": 70145 }, { "entropy": 5.420437479019165, "epoch": 5.4578875705115735, "grad_norm": 1.1640625, "learning_rate": 0.00024521581706756266, "loss": 4.756, "mean_token_accuracy": 0.2251098558306694, "num_tokens": 121686957.0, "step": 70150 }, { "entropy": 5.494581270217895, "epoch": 5.458276599883291, "grad_norm": 1.15625, "learning_rate": 0.00024518834560808954, "loss": 4.7399, "mean_token_accuracy": 0.22734930813312532, "num_tokens": 121694804.0, "step": 70155 }, { "entropy": 5.40276575088501, "epoch": 5.458665629255009, "grad_norm": 1.3359375, "learning_rate": 0.00024516087460096074, "loss": 4.6999, "mean_token_accuracy": 0.23059821724891663, "num_tokens": 121703461.0, "step": 70160 }, { "entropy": 5.395367383956909, "epoch": 5.459054658626727, "grad_norm": 1.3125, "learning_rate": 0.0002451334040465933, "loss": 4.7217, "mean_token_accuracy": 0.22919812053442, "num_tokens": 121711762.0, "step": 70165 }, { "entropy": 5.368811988830567, "epoch": 5.459443687998444, "grad_norm": 1.2265625, "learning_rate": 0.00024510593394540383, "loss": 4.7505, "mean_token_accuracy": 0.23197755813598633, "num_tokens": 121720935.0, "step": 70170 }, { "entropy": 5.472686767578125, "epoch": 5.459832717370161, "grad_norm": 1.234375, "learning_rate": 0.0002450784642978092, "loss": 4.8021, "mean_token_accuracy": 0.2263358026742935, "num_tokens": 121730120.0, "step": 70175 }, { "entropy": 5.491389369964599, "epoch": 5.460221746741879, "grad_norm": 1.3828125, "learning_rate": 0.0002450509951042263, "loss": 4.7047, "mean_token_accuracy": 0.23597283512353898, "num_tokens": 121738551.0, "step": 70180 }, { "entropy": 5.4011345386505125, "epoch": 5.4606107761135965, "grad_norm": 1.3671875, "learning_rate": 0.00024502352636507184, "loss": 4.7241, "mean_token_accuracy": 0.22926971763372422, "num_tokens": 121747079.0, "step": 70185 }, { "entropy": 5.385000276565552, "epoch": 5.460999805485314, "grad_norm": 1.2890625, "learning_rate": 0.00024499605808076273, "loss": 4.7644, "mean_token_accuracy": 0.22729700803756714, "num_tokens": 121755589.0, "step": 70190 }, { "entropy": 5.425689315795898, "epoch": 5.461388834857032, "grad_norm": 1.25, "learning_rate": 0.00024496859025171564, "loss": 4.7008, "mean_token_accuracy": 0.23764138668775558, "num_tokens": 121764320.0, "step": 70195 }, { "entropy": 5.440693998336792, "epoch": 5.46177786422875, "grad_norm": 1.1953125, "learning_rate": 0.0002449411228783474, "loss": 4.7272, "mean_token_accuracy": 0.22770379483699799, "num_tokens": 121773421.0, "step": 70200 }, { "entropy": 5.40166335105896, "epoch": 5.462166893600466, "grad_norm": 1.3203125, "learning_rate": 0.00024491365596107477, "loss": 4.7385, "mean_token_accuracy": 0.23650240451097487, "num_tokens": 121783636.0, "step": 70205 }, { "entropy": 5.34289140701294, "epoch": 5.462555922972184, "grad_norm": 1.1953125, "learning_rate": 0.00024488618950031457, "loss": 4.6438, "mean_token_accuracy": 0.23462988883256913, "num_tokens": 121791731.0, "step": 70210 }, { "entropy": 5.347463226318359, "epoch": 5.462944952343902, "grad_norm": 1.2421875, "learning_rate": 0.00024485872349648335, "loss": 4.6413, "mean_token_accuracy": 0.2441320076584816, "num_tokens": 121799876.0, "step": 70215 }, { "entropy": 5.302077436447144, "epoch": 5.4633339817156195, "grad_norm": 1.296875, "learning_rate": 0.00024483125794999815, "loss": 4.6677, "mean_token_accuracy": 0.23624372333288193, "num_tokens": 121808342.0, "step": 70220 }, { "entropy": 5.408740043640137, "epoch": 5.463723011087337, "grad_norm": 1.265625, "learning_rate": 0.0002448037928612756, "loss": 4.7222, "mean_token_accuracy": 0.23087164312601088, "num_tokens": 121816896.0, "step": 70225 }, { "entropy": 5.3666877269744875, "epoch": 5.464112040459055, "grad_norm": 1.265625, "learning_rate": 0.0002447763282307324, "loss": 4.6583, "mean_token_accuracy": 0.2328501895070076, "num_tokens": 121825474.0, "step": 70230 }, { "entropy": 5.455490303039551, "epoch": 5.4645010698307726, "grad_norm": 1.34375, "learning_rate": 0.0002447488640587854, "loss": 4.704, "mean_token_accuracy": 0.23164235800504684, "num_tokens": 121833604.0, "step": 70235 }, { "entropy": 5.339203500747681, "epoch": 5.46489009920249, "grad_norm": 1.25, "learning_rate": 0.00024472140034585113, "loss": 4.681, "mean_token_accuracy": 0.23588096350431442, "num_tokens": 121842610.0, "step": 70240 }, { "entropy": 5.386895179748535, "epoch": 5.465279128574207, "grad_norm": 1.2109375, "learning_rate": 0.00024469393709234647, "loss": 4.7607, "mean_token_accuracy": 0.22210632115602494, "num_tokens": 121851116.0, "step": 70245 }, { "entropy": 5.387976884841919, "epoch": 5.465668157945925, "grad_norm": 1.296875, "learning_rate": 0.00024466647429868804, "loss": 4.6488, "mean_token_accuracy": 0.23826704919338226, "num_tokens": 121859674.0, "step": 70250 }, { "entropy": 5.409866189956665, "epoch": 5.4660571873176425, "grad_norm": 1.1640625, "learning_rate": 0.0002446390119652926, "loss": 4.6775, "mean_token_accuracy": 0.23887744992971421, "num_tokens": 121869528.0, "step": 70255 }, { "entropy": 5.471185731887817, "epoch": 5.46644621668936, "grad_norm": 1.359375, "learning_rate": 0.00024461155009257684, "loss": 4.7873, "mean_token_accuracy": 0.22727449089288712, "num_tokens": 121878449.0, "step": 70260 }, { "entropy": 5.451321315765381, "epoch": 5.466835246061078, "grad_norm": 1.2265625, "learning_rate": 0.00024458408868095744, "loss": 4.7627, "mean_token_accuracy": 0.22335440516471863, "num_tokens": 121887255.0, "step": 70265 }, { "entropy": 5.416892099380493, "epoch": 5.4672242754327955, "grad_norm": 1.296875, "learning_rate": 0.00024455662773085107, "loss": 4.7338, "mean_token_accuracy": 0.23399961292743682, "num_tokens": 121895424.0, "step": 70270 }, { "entropy": 5.421973609924317, "epoch": 5.467613304804512, "grad_norm": 1.203125, "learning_rate": 0.0002445291672426744, "loss": 4.63, "mean_token_accuracy": 0.2390149265527725, "num_tokens": 121903114.0, "step": 70275 }, { "entropy": 5.409581661224365, "epoch": 5.46800233417623, "grad_norm": 1.375, "learning_rate": 0.00024450170721684416, "loss": 4.6927, "mean_token_accuracy": 0.23465573489665986, "num_tokens": 121911177.0, "step": 70280 }, { "entropy": 5.428075551986694, "epoch": 5.468391363547948, "grad_norm": 1.265625, "learning_rate": 0.0002444742476537769, "loss": 4.7335, "mean_token_accuracy": 0.23092661499977113, "num_tokens": 121919541.0, "step": 70285 }, { "entropy": 5.323449897766113, "epoch": 5.4687803929196654, "grad_norm": 1.28125, "learning_rate": 0.00024444678855388934, "loss": 4.6969, "mean_token_accuracy": 0.22235329151153566, "num_tokens": 121927939.0, "step": 70290 }, { "entropy": 5.398689317703247, "epoch": 5.469169422291383, "grad_norm": 1.1875, "learning_rate": 0.00024441932991759824, "loss": 4.7438, "mean_token_accuracy": 0.22741694152355194, "num_tokens": 121936831.0, "step": 70295 }, { "entropy": 5.443511819839477, "epoch": 5.469558451663101, "grad_norm": 1.2578125, "learning_rate": 0.0002443918717453201, "loss": 4.7433, "mean_token_accuracy": 0.2218385621905327, "num_tokens": 121945767.0, "step": 70300 }, { "entropy": 5.516142845153809, "epoch": 5.4699474810348185, "grad_norm": 1.21875, "learning_rate": 0.0002443644140374715, "loss": 4.7963, "mean_token_accuracy": 0.22677680999040603, "num_tokens": 121954601.0, "step": 70305 }, { "entropy": 5.485755252838135, "epoch": 5.470336510406535, "grad_norm": 1.34375, "learning_rate": 0.00024433695679446934, "loss": 4.7716, "mean_token_accuracy": 0.22823964208364486, "num_tokens": 121962886.0, "step": 70310 }, { "entropy": 5.378139543533325, "epoch": 5.470725539778253, "grad_norm": 1.28125, "learning_rate": 0.0002443095000167299, "loss": 4.7487, "mean_token_accuracy": 0.22553160935640335, "num_tokens": 121971074.0, "step": 70315 }, { "entropy": 5.36142053604126, "epoch": 5.471114569149971, "grad_norm": 1.3671875, "learning_rate": 0.00024428204370467, "loss": 4.6616, "mean_token_accuracy": 0.23273782432079315, "num_tokens": 121978970.0, "step": 70320 }, { "entropy": 5.387151479721069, "epoch": 5.471503598521688, "grad_norm": 1.25, "learning_rate": 0.00024425458785870617, "loss": 4.7128, "mean_token_accuracy": 0.23110346347093583, "num_tokens": 121987520.0, "step": 70325 }, { "entropy": 5.393017530441284, "epoch": 5.471892627893406, "grad_norm": 1.25, "learning_rate": 0.00024422713247925507, "loss": 4.7119, "mean_token_accuracy": 0.23527584969997406, "num_tokens": 121996122.0, "step": 70330 }, { "entropy": 5.402265834808349, "epoch": 5.472281657265124, "grad_norm": 1.2578125, "learning_rate": 0.0002441996775667332, "loss": 4.6613, "mean_token_accuracy": 0.23618454486131668, "num_tokens": 122004857.0, "step": 70335 }, { "entropy": 5.390559148788452, "epoch": 5.472670686636841, "grad_norm": 1.375, "learning_rate": 0.0002441722231215572, "loss": 4.7234, "mean_token_accuracy": 0.23340353965759278, "num_tokens": 122013374.0, "step": 70340 }, { "entropy": 5.401590347290039, "epoch": 5.473059716008558, "grad_norm": 1.1953125, "learning_rate": 0.00024414476914414373, "loss": 4.6754, "mean_token_accuracy": 0.23696849793195723, "num_tokens": 122022027.0, "step": 70345 }, { "entropy": 5.328091716766357, "epoch": 5.473448745380276, "grad_norm": 1.2265625, "learning_rate": 0.00024411731563490918, "loss": 4.6472, "mean_token_accuracy": 0.23487296104431152, "num_tokens": 122030942.0, "step": 70350 }, { "entropy": 5.428375911712647, "epoch": 5.473837774751994, "grad_norm": 1.2578125, "learning_rate": 0.00024408986259427025, "loss": 4.7646, "mean_token_accuracy": 0.23261837363243104, "num_tokens": 122039675.0, "step": 70355 }, { "entropy": 5.526067113876342, "epoch": 5.474226804123711, "grad_norm": 1.3671875, "learning_rate": 0.00024406241002264346, "loss": 4.8488, "mean_token_accuracy": 0.22678534984588622, "num_tokens": 122047457.0, "step": 70360 }, { "entropy": 5.416643810272217, "epoch": 5.474615833495429, "grad_norm": 1.2421875, "learning_rate": 0.00024403495792044532, "loss": 4.7007, "mean_token_accuracy": 0.22972971498966216, "num_tokens": 122056890.0, "step": 70365 }, { "entropy": 5.490651082992554, "epoch": 5.475004862867147, "grad_norm": 1.3203125, "learning_rate": 0.00024400750628809247, "loss": 4.7993, "mean_token_accuracy": 0.2294788032770157, "num_tokens": 122066144.0, "step": 70370 }, { "entropy": 5.401970958709716, "epoch": 5.475393892238864, "grad_norm": 1.1875, "learning_rate": 0.00024398005512600134, "loss": 4.7157, "mean_token_accuracy": 0.2314816564321518, "num_tokens": 122074719.0, "step": 70375 }, { "entropy": 5.424728965759277, "epoch": 5.475782921610581, "grad_norm": 1.2421875, "learning_rate": 0.00024395260443458856, "loss": 4.793, "mean_token_accuracy": 0.22512896209955216, "num_tokens": 122083149.0, "step": 70380 }, { "entropy": 5.425227785110474, "epoch": 5.476171950982299, "grad_norm": 1.171875, "learning_rate": 0.00024392515421427054, "loss": 4.7518, "mean_token_accuracy": 0.22736071646213532, "num_tokens": 122092467.0, "step": 70385 }, { "entropy": 5.435410404205323, "epoch": 5.476560980354017, "grad_norm": 1.265625, "learning_rate": 0.00024389770446546388, "loss": 4.7471, "mean_token_accuracy": 0.2288050591945648, "num_tokens": 122100885.0, "step": 70390 }, { "entropy": 5.414276361465454, "epoch": 5.476950009725734, "grad_norm": 1.2109375, "learning_rate": 0.00024387025518858503, "loss": 4.7745, "mean_token_accuracy": 0.23943827897310258, "num_tokens": 122109542.0, "step": 70395 }, { "entropy": 5.4028712749481205, "epoch": 5.477339039097452, "grad_norm": 1.28125, "learning_rate": 0.0002438428063840505, "loss": 4.7126, "mean_token_accuracy": 0.2270074248313904, "num_tokens": 122117979.0, "step": 70400 }, { "entropy": 5.446815347671508, "epoch": 5.47772806846917, "grad_norm": 1.203125, "learning_rate": 0.00024381535805227677, "loss": 4.8004, "mean_token_accuracy": 0.22397871166467667, "num_tokens": 122126559.0, "step": 70405 }, { "entropy": 5.39161524772644, "epoch": 5.478117097840887, "grad_norm": 1.2265625, "learning_rate": 0.00024378791019368036, "loss": 4.6477, "mean_token_accuracy": 0.23972657322883606, "num_tokens": 122135322.0, "step": 70410 }, { "entropy": 5.385728359222412, "epoch": 5.478506127212604, "grad_norm": 1.1875, "learning_rate": 0.00024376046280867765, "loss": 4.7188, "mean_token_accuracy": 0.23373919129371643, "num_tokens": 122143657.0, "step": 70415 }, { "entropy": 5.381788539886474, "epoch": 5.478895156584322, "grad_norm": 1.328125, "learning_rate": 0.00024373301589768531, "loss": 4.7384, "mean_token_accuracy": 0.2314128577709198, "num_tokens": 122152577.0, "step": 70420 }, { "entropy": 5.409402704238891, "epoch": 5.47928418595604, "grad_norm": 1.2109375, "learning_rate": 0.0002437055694611197, "loss": 4.6855, "mean_token_accuracy": 0.2417663410305977, "num_tokens": 122161008.0, "step": 70425 }, { "entropy": 5.424704265594483, "epoch": 5.479673215327757, "grad_norm": 1.1953125, "learning_rate": 0.00024367812349939723, "loss": 4.6959, "mean_token_accuracy": 0.23634953647851945, "num_tokens": 122169691.0, "step": 70430 }, { "entropy": 5.40051383972168, "epoch": 5.480062244699475, "grad_norm": 1.3046875, "learning_rate": 0.00024365067801293438, "loss": 4.6843, "mean_token_accuracy": 0.24186121076345443, "num_tokens": 122177652.0, "step": 70435 }, { "entropy": 5.393773412704467, "epoch": 5.480451274071193, "grad_norm": 1.25, "learning_rate": 0.00024362323300214755, "loss": 4.612, "mean_token_accuracy": 0.2360119953751564, "num_tokens": 122186748.0, "step": 70440 }, { "entropy": 5.343697118759155, "epoch": 5.48084030344291, "grad_norm": 1.2890625, "learning_rate": 0.0002435957884674533, "loss": 4.6826, "mean_token_accuracy": 0.23318090289831161, "num_tokens": 122194984.0, "step": 70445 }, { "entropy": 5.310951662063599, "epoch": 5.481229332814627, "grad_norm": 1.1796875, "learning_rate": 0.0002435683444092679, "loss": 4.5507, "mean_token_accuracy": 0.24514065980911254, "num_tokens": 122204137.0, "step": 70450 }, { "entropy": 5.467765522003174, "epoch": 5.481618362186345, "grad_norm": 1.28125, "learning_rate": 0.0002435409008280079, "loss": 4.8528, "mean_token_accuracy": 0.2173578679561615, "num_tokens": 122212098.0, "step": 70455 }, { "entropy": 5.44714035987854, "epoch": 5.482007391558063, "grad_norm": 1.2578125, "learning_rate": 0.0002435134577240896, "loss": 4.7276, "mean_token_accuracy": 0.22981563508510588, "num_tokens": 122220359.0, "step": 70460 }, { "entropy": 5.418879127502441, "epoch": 5.48239642092978, "grad_norm": 1.125, "learning_rate": 0.00024348601509792956, "loss": 4.7439, "mean_token_accuracy": 0.22894397377967834, "num_tokens": 122229526.0, "step": 70465 }, { "entropy": 5.357851552963257, "epoch": 5.482785450301498, "grad_norm": 1.1484375, "learning_rate": 0.00024345857294994405, "loss": 4.6833, "mean_token_accuracy": 0.2333046019077301, "num_tokens": 122239382.0, "step": 70470 }, { "entropy": 5.453622627258301, "epoch": 5.483174479673215, "grad_norm": 1.328125, "learning_rate": 0.00024343113128054945, "loss": 4.7508, "mean_token_accuracy": 0.23433923721313477, "num_tokens": 122247820.0, "step": 70475 }, { "entropy": 5.4468272686004635, "epoch": 5.483563509044933, "grad_norm": 1.296875, "learning_rate": 0.0002434036900901621, "loss": 4.7933, "mean_token_accuracy": 0.2309975102543831, "num_tokens": 122256016.0, "step": 70480 }, { "entropy": 5.385533952713013, "epoch": 5.48395253841665, "grad_norm": 1.203125, "learning_rate": 0.00024337624937919856, "loss": 4.6546, "mean_token_accuracy": 0.2305649846792221, "num_tokens": 122264518.0, "step": 70485 }, { "entropy": 5.463404273986816, "epoch": 5.484341567788368, "grad_norm": 1.296875, "learning_rate": 0.00024334880914807512, "loss": 4.7981, "mean_token_accuracy": 0.22577558904886247, "num_tokens": 122272828.0, "step": 70490 }, { "entropy": 5.3370969772338865, "epoch": 5.484730597160086, "grad_norm": 1.1484375, "learning_rate": 0.00024332136939720806, "loss": 4.6563, "mean_token_accuracy": 0.24142964333295822, "num_tokens": 122281297.0, "step": 70495 }, { "entropy": 5.378442716598511, "epoch": 5.485119626531803, "grad_norm": 1.2421875, "learning_rate": 0.00024329393012701396, "loss": 4.7559, "mean_token_accuracy": 0.2269502252340317, "num_tokens": 122290668.0, "step": 70500 }, { "entropy": 5.384352970123291, "epoch": 5.485508655903521, "grad_norm": 1.28125, "learning_rate": 0.00024326649133790885, "loss": 4.6951, "mean_token_accuracy": 0.23127108812332153, "num_tokens": 122298998.0, "step": 70505 }, { "entropy": 5.310858917236328, "epoch": 5.485897685275238, "grad_norm": 1.375, "learning_rate": 0.00024323905303030925, "loss": 4.59, "mean_token_accuracy": 0.24498870968818665, "num_tokens": 122308341.0, "step": 70510 }, { "entropy": 5.394557666778565, "epoch": 5.486286714646956, "grad_norm": 1.265625, "learning_rate": 0.00024321161520463147, "loss": 4.6702, "mean_token_accuracy": 0.23696606010198593, "num_tokens": 122316674.0, "step": 70515 }, { "entropy": 5.439527559280395, "epoch": 5.486675744018673, "grad_norm": 1.21875, "learning_rate": 0.00024318417786129188, "loss": 4.7193, "mean_token_accuracy": 0.23310763537883758, "num_tokens": 122326179.0, "step": 70520 }, { "entropy": 5.317496204376221, "epoch": 5.487064773390391, "grad_norm": 1.2421875, "learning_rate": 0.00024315674100070672, "loss": 4.6531, "mean_token_accuracy": 0.24737457185983658, "num_tokens": 122334838.0, "step": 70525 }, { "entropy": 5.419668769836425, "epoch": 5.487453802762109, "grad_norm": 1.234375, "learning_rate": 0.0002431293046232923, "loss": 4.7205, "mean_token_accuracy": 0.23586111068725585, "num_tokens": 122343204.0, "step": 70530 }, { "entropy": 5.288944101333618, "epoch": 5.487842832133826, "grad_norm": 1.265625, "learning_rate": 0.00024310186872946498, "loss": 4.6164, "mean_token_accuracy": 0.23930510133504868, "num_tokens": 122352313.0, "step": 70535 }, { "entropy": 5.424410676956176, "epoch": 5.488231861505543, "grad_norm": 1.265625, "learning_rate": 0.00024307443331964107, "loss": 4.6981, "mean_token_accuracy": 0.2280837044119835, "num_tokens": 122361468.0, "step": 70540 }, { "entropy": 5.420333909988403, "epoch": 5.488620890877261, "grad_norm": 1.296875, "learning_rate": 0.00024304699839423677, "loss": 4.7465, "mean_token_accuracy": 0.22988288700580597, "num_tokens": 122369621.0, "step": 70545 }, { "entropy": 5.439290761947632, "epoch": 5.489009920248979, "grad_norm": 1.21875, "learning_rate": 0.00024301956395366838, "loss": 4.7468, "mean_token_accuracy": 0.2286800518631935, "num_tokens": 122377553.0, "step": 70550 }, { "entropy": 5.343237113952637, "epoch": 5.489398949620696, "grad_norm": 1.15625, "learning_rate": 0.00024299212999835223, "loss": 4.64, "mean_token_accuracy": 0.23968700915575028, "num_tokens": 122386322.0, "step": 70555 }, { "entropy": 5.429993724822998, "epoch": 5.489787978992414, "grad_norm": 1.21875, "learning_rate": 0.00024296469652870456, "loss": 4.8048, "mean_token_accuracy": 0.21803846061229706, "num_tokens": 122395196.0, "step": 70560 }, { "entropy": 5.475716924667358, "epoch": 5.490177008364132, "grad_norm": 1.359375, "learning_rate": 0.00024293726354514166, "loss": 4.7456, "mean_token_accuracy": 0.23227256834506987, "num_tokens": 122403324.0, "step": 70565 }, { "entropy": 5.305783224105835, "epoch": 5.490566037735849, "grad_norm": 1.171875, "learning_rate": 0.0002429098310480798, "loss": 4.6203, "mean_token_accuracy": 0.2392679914832115, "num_tokens": 122411651.0, "step": 70570 }, { "entropy": 5.437867307662964, "epoch": 5.490955067107567, "grad_norm": 1.3203125, "learning_rate": 0.00024288239903793508, "loss": 4.7814, "mean_token_accuracy": 0.2225402131676674, "num_tokens": 122419710.0, "step": 70575 }, { "entropy": 5.33840126991272, "epoch": 5.491344096479284, "grad_norm": 1.171875, "learning_rate": 0.00024285496751512393, "loss": 4.6687, "mean_token_accuracy": 0.238345967233181, "num_tokens": 122428213.0, "step": 70580 }, { "entropy": 5.3512654304504395, "epoch": 5.491733125851002, "grad_norm": 1.1640625, "learning_rate": 0.0002428275364800624, "loss": 4.6672, "mean_token_accuracy": 0.24225182235240936, "num_tokens": 122437376.0, "step": 70585 }, { "entropy": 5.378974962234497, "epoch": 5.492122155222719, "grad_norm": 1.109375, "learning_rate": 0.00024280010593316683, "loss": 4.7067, "mean_token_accuracy": 0.23174707144498824, "num_tokens": 122446581.0, "step": 70590 }, { "entropy": 5.421217346191407, "epoch": 5.492511184594437, "grad_norm": 1.1796875, "learning_rate": 0.0002427726758748534, "loss": 4.7507, "mean_token_accuracy": 0.22842974364757537, "num_tokens": 122455470.0, "step": 70595 }, { "entropy": 5.450832176208496, "epoch": 5.492900213966155, "grad_norm": 1.1953125, "learning_rate": 0.0002427452463055383, "loss": 4.7424, "mean_token_accuracy": 0.23095162361860275, "num_tokens": 122464943.0, "step": 70600 }, { "entropy": 5.415422439575195, "epoch": 5.493289243337872, "grad_norm": 1.1484375, "learning_rate": 0.00024271781722563773, "loss": 4.7381, "mean_token_accuracy": 0.22880372852087022, "num_tokens": 122474058.0, "step": 70605 }, { "entropy": 5.346107864379883, "epoch": 5.493678272709589, "grad_norm": 1.296875, "learning_rate": 0.00024269038863556798, "loss": 4.6511, "mean_token_accuracy": 0.23167358934879304, "num_tokens": 122482018.0, "step": 70610 }, { "entropy": 5.303422451019287, "epoch": 5.494067302081307, "grad_norm": 1.28125, "learning_rate": 0.00024266296053574506, "loss": 4.6365, "mean_token_accuracy": 0.23482999801635743, "num_tokens": 122490419.0, "step": 70615 }, { "entropy": 5.410489559173584, "epoch": 5.494456331453025, "grad_norm": 1.2265625, "learning_rate": 0.0002426355329265853, "loss": 4.7613, "mean_token_accuracy": 0.22721103131771087, "num_tokens": 122500299.0, "step": 70620 }, { "entropy": 5.292138719558716, "epoch": 5.494845360824742, "grad_norm": 1.15625, "learning_rate": 0.00024260810580850479, "loss": 4.5829, "mean_token_accuracy": 0.24799180924892425, "num_tokens": 122509218.0, "step": 70625 }, { "entropy": 5.332752418518067, "epoch": 5.49523439019646, "grad_norm": 1.2265625, "learning_rate": 0.00024258067918191971, "loss": 4.669, "mean_token_accuracy": 0.22938060909509658, "num_tokens": 122517995.0, "step": 70630 }, { "entropy": 5.417664289474487, "epoch": 5.495623419568178, "grad_norm": 1.171875, "learning_rate": 0.0002425532530472463, "loss": 4.766, "mean_token_accuracy": 0.22538333982229233, "num_tokens": 122526229.0, "step": 70635 }, { "entropy": 5.379167795181274, "epoch": 5.496012448939895, "grad_norm": 1.3203125, "learning_rate": 0.00024252582740490053, "loss": 4.6965, "mean_token_accuracy": 0.2346435844898224, "num_tokens": 122535197.0, "step": 70640 }, { "entropy": 5.389390230178833, "epoch": 5.496401478311612, "grad_norm": 1.34375, "learning_rate": 0.00024249840225529874, "loss": 4.6594, "mean_token_accuracy": 0.23427533060312272, "num_tokens": 122543382.0, "step": 70645 }, { "entropy": 5.378939867019653, "epoch": 5.49679050768333, "grad_norm": 1.1484375, "learning_rate": 0.0002424709775988569, "loss": 4.6944, "mean_token_accuracy": 0.23746426403522491, "num_tokens": 122552001.0, "step": 70650 }, { "entropy": 5.414185190200806, "epoch": 5.497179537055048, "grad_norm": 1.2734375, "learning_rate": 0.00024244355343599116, "loss": 4.7336, "mean_token_accuracy": 0.23340862840414048, "num_tokens": 122560070.0, "step": 70655 }, { "entropy": 5.451605033874512, "epoch": 5.497568566426765, "grad_norm": 1.2265625, "learning_rate": 0.00024241612976711786, "loss": 4.7706, "mean_token_accuracy": 0.22580428719520568, "num_tokens": 122569097.0, "step": 70660 }, { "entropy": 5.526263809204101, "epoch": 5.497957595798483, "grad_norm": 1.203125, "learning_rate": 0.00024238870659265278, "loss": 4.8124, "mean_token_accuracy": 0.23014591187238692, "num_tokens": 122577857.0, "step": 70665 }, { "entropy": 5.378426647186279, "epoch": 5.498346625170201, "grad_norm": 1.3359375, "learning_rate": 0.00024236128391301215, "loss": 4.6796, "mean_token_accuracy": 0.2276335760951042, "num_tokens": 122586587.0, "step": 70670 }, { "entropy": 5.3087965965271, "epoch": 5.4987356545419175, "grad_norm": 1.296875, "learning_rate": 0.00024233386172861217, "loss": 4.5938, "mean_token_accuracy": 0.23619831651449202, "num_tokens": 122594789.0, "step": 70675 }, { "entropy": 5.380229377746582, "epoch": 5.499124683913635, "grad_norm": 1.203125, "learning_rate": 0.00024230644003986869, "loss": 4.7391, "mean_token_accuracy": 0.22821490913629533, "num_tokens": 122603274.0, "step": 70680 }, { "entropy": 5.427090501785278, "epoch": 5.499513713285353, "grad_norm": 1.21875, "learning_rate": 0.00024227901884719806, "loss": 4.745, "mean_token_accuracy": 0.23368096649646758, "num_tokens": 122612192.0, "step": 70685 }, { "entropy": 5.406390571594239, "epoch": 5.499902742657071, "grad_norm": 1.25, "learning_rate": 0.00024225159815101626, "loss": 4.7125, "mean_token_accuracy": 0.23338521122932435, "num_tokens": 122620411.0, "step": 70690 }, { "entropy": 5.41592435836792, "epoch": 5.500291772028788, "grad_norm": 1.2421875, "learning_rate": 0.00024222417795173929, "loss": 4.7421, "mean_token_accuracy": 0.22602510452270508, "num_tokens": 122629327.0, "step": 70695 }, { "entropy": 5.43199577331543, "epoch": 5.500680801400506, "grad_norm": 1.21875, "learning_rate": 0.00024219675824978332, "loss": 4.7891, "mean_token_accuracy": 0.22640966027975082, "num_tokens": 122638536.0, "step": 70700 }, { "entropy": 5.4074396133422855, "epoch": 5.501069830772224, "grad_norm": 1.1953125, "learning_rate": 0.00024216933904556425, "loss": 4.6251, "mean_token_accuracy": 0.24110499620437623, "num_tokens": 122647144.0, "step": 70705 }, { "entropy": 5.418401145935059, "epoch": 5.501458860143941, "grad_norm": 1.2265625, "learning_rate": 0.00024214192033949827, "loss": 4.6796, "mean_token_accuracy": 0.2351738005876541, "num_tokens": 122656689.0, "step": 70710 }, { "entropy": 5.333641481399536, "epoch": 5.501847889515658, "grad_norm": 1.3671875, "learning_rate": 0.00024211450213200132, "loss": 4.692, "mean_token_accuracy": 0.23685812801122666, "num_tokens": 122665599.0, "step": 70715 }, { "entropy": 5.315492630004883, "epoch": 5.502236918887376, "grad_norm": 1.265625, "learning_rate": 0.00024208708442348943, "loss": 4.6274, "mean_token_accuracy": 0.24509831219911576, "num_tokens": 122674048.0, "step": 70720 }, { "entropy": 5.404406213760376, "epoch": 5.502625948259094, "grad_norm": 1.359375, "learning_rate": 0.00024205966721437867, "loss": 4.6836, "mean_token_accuracy": 0.2368836835026741, "num_tokens": 122682447.0, "step": 70725 }, { "entropy": 5.463923454284668, "epoch": 5.503014977630811, "grad_norm": 1.2734375, "learning_rate": 0.00024203225050508503, "loss": 4.7794, "mean_token_accuracy": 0.22529825419187546, "num_tokens": 122691221.0, "step": 70730 }, { "entropy": 5.3641749858856205, "epoch": 5.503404007002529, "grad_norm": 1.3359375, "learning_rate": 0.0002420048342960245, "loss": 4.6631, "mean_token_accuracy": 0.23389590084552764, "num_tokens": 122699728.0, "step": 70735 }, { "entropy": 5.417591381072998, "epoch": 5.503793036374246, "grad_norm": 1.1171875, "learning_rate": 0.00024197741858761318, "loss": 4.7748, "mean_token_accuracy": 0.22758532464504241, "num_tokens": 122708858.0, "step": 70740 }, { "entropy": 5.33610258102417, "epoch": 5.5041820657459635, "grad_norm": 1.2578125, "learning_rate": 0.0002419500033802669, "loss": 4.6953, "mean_token_accuracy": 0.2365904375910759, "num_tokens": 122718027.0, "step": 70745 }, { "entropy": 5.4062799453735355, "epoch": 5.504571095117681, "grad_norm": 1.3203125, "learning_rate": 0.0002419225886744016, "loss": 4.6638, "mean_token_accuracy": 0.23261490166187287, "num_tokens": 122726090.0, "step": 70750 }, { "entropy": 5.389040899276734, "epoch": 5.504960124489399, "grad_norm": 1.2109375, "learning_rate": 0.00024189517447043352, "loss": 4.6957, "mean_token_accuracy": 0.23550100326538087, "num_tokens": 122734969.0, "step": 70755 }, { "entropy": 5.471482133865356, "epoch": 5.505349153861117, "grad_norm": 1.25, "learning_rate": 0.00024186776076877843, "loss": 4.8008, "mean_token_accuracy": 0.2269164577126503, "num_tokens": 122743759.0, "step": 70760 }, { "entropy": 5.356032466888427, "epoch": 5.505738183232834, "grad_norm": 1.1875, "learning_rate": 0.00024184034756985235, "loss": 4.6756, "mean_token_accuracy": 0.23498995900154113, "num_tokens": 122752586.0, "step": 70765 }, { "entropy": 5.341942834854126, "epoch": 5.506127212604552, "grad_norm": 1.2890625, "learning_rate": 0.00024181293487407125, "loss": 4.6077, "mean_token_accuracy": 0.23939125537872313, "num_tokens": 122761306.0, "step": 70770 }, { "entropy": 5.332425975799561, "epoch": 5.50651624197627, "grad_norm": 1.171875, "learning_rate": 0.000241785522681851, "loss": 4.6449, "mean_token_accuracy": 0.23213035315275193, "num_tokens": 122769676.0, "step": 70775 }, { "entropy": 5.430518722534179, "epoch": 5.5069052713479865, "grad_norm": 1.265625, "learning_rate": 0.00024175811099360757, "loss": 4.8012, "mean_token_accuracy": 0.22427190840244293, "num_tokens": 122778035.0, "step": 70780 }, { "entropy": 5.33522744178772, "epoch": 5.507294300719704, "grad_norm": 1.2109375, "learning_rate": 0.00024173069980975691, "loss": 4.6404, "mean_token_accuracy": 0.23808291852474212, "num_tokens": 122786861.0, "step": 70785 }, { "entropy": 5.517639303207398, "epoch": 5.507683330091422, "grad_norm": 1.421875, "learning_rate": 0.00024170328913071493, "loss": 4.8879, "mean_token_accuracy": 0.2208481639623642, "num_tokens": 122796022.0, "step": 70790 }, { "entropy": 5.369570112228393, "epoch": 5.5080723594631396, "grad_norm": 1.3515625, "learning_rate": 0.00024167587895689753, "loss": 4.605, "mean_token_accuracy": 0.23616992086172103, "num_tokens": 122804795.0, "step": 70795 }, { "entropy": 5.420101737976074, "epoch": 5.508461388834857, "grad_norm": 1.28125, "learning_rate": 0.00024164846928872064, "loss": 4.7798, "mean_token_accuracy": 0.2234449177980423, "num_tokens": 122813570.0, "step": 70800 }, { "entropy": 5.415718698501587, "epoch": 5.508850418206575, "grad_norm": 1.3359375, "learning_rate": 0.00024162106012660012, "loss": 4.6709, "mean_token_accuracy": 0.2309708997607231, "num_tokens": 122822141.0, "step": 70805 }, { "entropy": 5.441112947463989, "epoch": 5.509239447578292, "grad_norm": 1.1640625, "learning_rate": 0.0002415936514709519, "loss": 4.7613, "mean_token_accuracy": 0.22063748091459273, "num_tokens": 122831443.0, "step": 70810 }, { "entropy": 5.404898977279663, "epoch": 5.5096284769500095, "grad_norm": 1.203125, "learning_rate": 0.0002415662433221918, "loss": 4.7527, "mean_token_accuracy": 0.22742810398340224, "num_tokens": 122840424.0, "step": 70815 }, { "entropy": 5.404451608657837, "epoch": 5.510017506321727, "grad_norm": 1.2890625, "learning_rate": 0.00024153883568073576, "loss": 4.7332, "mean_token_accuracy": 0.22831309139728545, "num_tokens": 122848858.0, "step": 70820 }, { "entropy": 5.381207704544067, "epoch": 5.510406535693445, "grad_norm": 1.3046875, "learning_rate": 0.0002415114285469997, "loss": 4.6804, "mean_token_accuracy": 0.23861832022666932, "num_tokens": 122857576.0, "step": 70825 }, { "entropy": 5.3526207447052006, "epoch": 5.5107955650651625, "grad_norm": 1.265625, "learning_rate": 0.00024148402192139935, "loss": 4.737, "mean_token_accuracy": 0.2295311525464058, "num_tokens": 122865968.0, "step": 70830 }, { "entropy": 5.452864360809326, "epoch": 5.51118459443688, "grad_norm": 1.2734375, "learning_rate": 0.00024145661580435063, "loss": 4.7583, "mean_token_accuracy": 0.23404245674610138, "num_tokens": 122874286.0, "step": 70835 }, { "entropy": 5.431307649612426, "epoch": 5.511573623808598, "grad_norm": 1.25, "learning_rate": 0.00024142921019626933, "loss": 4.709, "mean_token_accuracy": 0.23288986533880235, "num_tokens": 122882633.0, "step": 70840 }, { "entropy": 5.395624780654908, "epoch": 5.511962653180315, "grad_norm": 1.2109375, "learning_rate": 0.00024140180509757143, "loss": 4.7017, "mean_token_accuracy": 0.2306210994720459, "num_tokens": 122892065.0, "step": 70845 }, { "entropy": 5.392498016357422, "epoch": 5.5123516825520325, "grad_norm": 1.2421875, "learning_rate": 0.00024137440050867265, "loss": 4.6823, "mean_token_accuracy": 0.23606627881526948, "num_tokens": 122900477.0, "step": 70850 }, { "entropy": 5.388213396072388, "epoch": 5.51274071192375, "grad_norm": 1.359375, "learning_rate": 0.00024134699642998882, "loss": 4.7215, "mean_token_accuracy": 0.2273784190416336, "num_tokens": 122908868.0, "step": 70855 }, { "entropy": 5.325706338882446, "epoch": 5.513129741295468, "grad_norm": 1.203125, "learning_rate": 0.00024131959286193572, "loss": 4.6502, "mean_token_accuracy": 0.2348801776766777, "num_tokens": 122917725.0, "step": 70860 }, { "entropy": 5.43540587425232, "epoch": 5.5135187706671855, "grad_norm": 1.25, "learning_rate": 0.00024129218980492917, "loss": 4.7374, "mean_token_accuracy": 0.22922678887844086, "num_tokens": 122927450.0, "step": 70865 }, { "entropy": 5.41433801651001, "epoch": 5.513907800038903, "grad_norm": 1.296875, "learning_rate": 0.000241264787259385, "loss": 4.7062, "mean_token_accuracy": 0.23392146974802017, "num_tokens": 122935766.0, "step": 70870 }, { "entropy": 5.444930744171143, "epoch": 5.51429682941062, "grad_norm": 1.3515625, "learning_rate": 0.00024123738522571902, "loss": 4.7241, "mean_token_accuracy": 0.23529625982046126, "num_tokens": 122943202.0, "step": 70875 }, { "entropy": 5.439007711410523, "epoch": 5.514685858782338, "grad_norm": 1.2109375, "learning_rate": 0.0002412099837043469, "loss": 4.7136, "mean_token_accuracy": 0.2285680204629898, "num_tokens": 122951543.0, "step": 70880 }, { "entropy": 5.37492561340332, "epoch": 5.515074888154055, "grad_norm": 1.2265625, "learning_rate": 0.00024118258269568456, "loss": 4.7229, "mean_token_accuracy": 0.22959576398134232, "num_tokens": 122960175.0, "step": 70885 }, { "entropy": 5.448202800750733, "epoch": 5.515463917525773, "grad_norm": 1.2890625, "learning_rate": 0.00024115518220014771, "loss": 4.7473, "mean_token_accuracy": 0.22924584299325942, "num_tokens": 122968779.0, "step": 70890 }, { "entropy": 5.458621311187744, "epoch": 5.515852946897491, "grad_norm": 1.203125, "learning_rate": 0.00024112778221815206, "loss": 4.7343, "mean_token_accuracy": 0.22659550607204437, "num_tokens": 122977523.0, "step": 70895 }, { "entropy": 5.4293070316314695, "epoch": 5.5162419762692085, "grad_norm": 1.203125, "learning_rate": 0.00024110038275011343, "loss": 4.7935, "mean_token_accuracy": 0.22974894493818282, "num_tokens": 122986260.0, "step": 70900 }, { "entropy": 5.408854961395264, "epoch": 5.516631005640926, "grad_norm": 1.2265625, "learning_rate": 0.00024107298379644754, "loss": 4.7316, "mean_token_accuracy": 0.23334001898765563, "num_tokens": 122995073.0, "step": 70905 }, { "entropy": 5.368807125091553, "epoch": 5.517020035012644, "grad_norm": 1.2265625, "learning_rate": 0.0002410455853575701, "loss": 4.6576, "mean_token_accuracy": 0.24093288332223892, "num_tokens": 123003913.0, "step": 70910 }, { "entropy": 5.348622608184814, "epoch": 5.517409064384361, "grad_norm": 1.2734375, "learning_rate": 0.00024101818743389687, "loss": 4.611, "mean_token_accuracy": 0.24176746159791945, "num_tokens": 123012851.0, "step": 70915 }, { "entropy": 5.436102819442749, "epoch": 5.517798093756078, "grad_norm": 1.296875, "learning_rate": 0.00024099079002584355, "loss": 4.772, "mean_token_accuracy": 0.22975777089595795, "num_tokens": 123020912.0, "step": 70920 }, { "entropy": 5.328731632232666, "epoch": 5.518187123127796, "grad_norm": 1.3046875, "learning_rate": 0.00024096339313382586, "loss": 4.6528, "mean_token_accuracy": 0.23784373998641967, "num_tokens": 123029351.0, "step": 70925 }, { "entropy": 5.347149181365967, "epoch": 5.518576152499514, "grad_norm": 1.2265625, "learning_rate": 0.00024093599675825954, "loss": 4.5796, "mean_token_accuracy": 0.24292432367801667, "num_tokens": 123037238.0, "step": 70930 }, { "entropy": 5.43596248626709, "epoch": 5.5189651818712315, "grad_norm": 1.15625, "learning_rate": 0.00024090860089956024, "loss": 4.7763, "mean_token_accuracy": 0.22721119225025177, "num_tokens": 123046444.0, "step": 70935 }, { "entropy": 5.351435995101928, "epoch": 5.519354211242949, "grad_norm": 1.2578125, "learning_rate": 0.0002408812055581437, "loss": 4.6955, "mean_token_accuracy": 0.23849013596773147, "num_tokens": 123055485.0, "step": 70940 }, { "entropy": 5.429844903945923, "epoch": 5.519743240614666, "grad_norm": 1.3359375, "learning_rate": 0.00024085381073442536, "loss": 4.7454, "mean_token_accuracy": 0.2330682545900345, "num_tokens": 123063430.0, "step": 70945 }, { "entropy": 5.329717826843262, "epoch": 5.520132269986384, "grad_norm": 1.265625, "learning_rate": 0.00024082641642882125, "loss": 4.5789, "mean_token_accuracy": 0.243253855407238, "num_tokens": 123071510.0, "step": 70950 }, { "entropy": 5.420927667617798, "epoch": 5.520521299358101, "grad_norm": 1.234375, "learning_rate": 0.00024079902264174686, "loss": 4.7369, "mean_token_accuracy": 0.23120331317186354, "num_tokens": 123080263.0, "step": 70955 }, { "entropy": 5.343746566772461, "epoch": 5.520910328729819, "grad_norm": 1.328125, "learning_rate": 0.0002407716293736179, "loss": 4.6178, "mean_token_accuracy": 0.24677411317825318, "num_tokens": 123089540.0, "step": 70960 }, { "entropy": 5.383777713775634, "epoch": 5.521299358101537, "grad_norm": 1.2421875, "learning_rate": 0.00024074423662484996, "loss": 4.7357, "mean_token_accuracy": 0.2361590340733528, "num_tokens": 123098350.0, "step": 70965 }, { "entropy": 5.421955299377442, "epoch": 5.5216883874732545, "grad_norm": 1.2578125, "learning_rate": 0.0002407168443958587, "loss": 4.7612, "mean_token_accuracy": 0.23810844421386718, "num_tokens": 123107041.0, "step": 70970 }, { "entropy": 5.362704801559448, "epoch": 5.522077416844972, "grad_norm": 1.109375, "learning_rate": 0.00024068945268705978, "loss": 4.6385, "mean_token_accuracy": 0.24241780787706374, "num_tokens": 123115612.0, "step": 70975 }, { "entropy": 5.317593812942505, "epoch": 5.522466446216689, "grad_norm": 1.15625, "learning_rate": 0.00024066206149886876, "loss": 4.6186, "mean_token_accuracy": 0.2315910741686821, "num_tokens": 123124154.0, "step": 70980 }, { "entropy": 5.348397350311279, "epoch": 5.522855475588407, "grad_norm": 1.1875, "learning_rate": 0.00024063467083170132, "loss": 4.6422, "mean_token_accuracy": 0.24015880078077317, "num_tokens": 123133197.0, "step": 70985 }, { "entropy": 5.381210899353027, "epoch": 5.523244504960124, "grad_norm": 1.2734375, "learning_rate": 0.0002406072806859731, "loss": 4.7213, "mean_token_accuracy": 0.23230430632829666, "num_tokens": 123141153.0, "step": 70990 }, { "entropy": 5.393314933776855, "epoch": 5.523633534331842, "grad_norm": 1.2578125, "learning_rate": 0.0002405798910620996, "loss": 4.6779, "mean_token_accuracy": 0.234355691075325, "num_tokens": 123149015.0, "step": 70995 }, { "entropy": 5.406496858596801, "epoch": 5.52402256370356, "grad_norm": 1.3671875, "learning_rate": 0.0002405525019604965, "loss": 4.7095, "mean_token_accuracy": 0.2298208236694336, "num_tokens": 123156902.0, "step": 71000 }, { "entropy": 5.398468494415283, "epoch": 5.5244115930752775, "grad_norm": 1.2109375, "learning_rate": 0.00024052511338157928, "loss": 4.6881, "mean_token_accuracy": 0.23288017213344575, "num_tokens": 123166988.0, "step": 71005 }, { "entropy": 5.422676277160645, "epoch": 5.524800622446994, "grad_norm": 1.3828125, "learning_rate": 0.00024049772532576364, "loss": 4.7408, "mean_token_accuracy": 0.2305937498807907, "num_tokens": 123175287.0, "step": 71010 }, { "entropy": 5.388989400863648, "epoch": 5.525189651818712, "grad_norm": 1.2421875, "learning_rate": 0.00024047033779346505, "loss": 4.74, "mean_token_accuracy": 0.22371324598789216, "num_tokens": 123183846.0, "step": 71015 }, { "entropy": 5.392907619476318, "epoch": 5.52557868119043, "grad_norm": 1.34375, "learning_rate": 0.0002404429507850992, "loss": 4.6954, "mean_token_accuracy": 0.2265216514468193, "num_tokens": 123192448.0, "step": 71020 }, { "entropy": 5.3461230278015135, "epoch": 5.525967710562147, "grad_norm": 1.234375, "learning_rate": 0.0002404155643010815, "loss": 4.7208, "mean_token_accuracy": 0.2307633489370346, "num_tokens": 123201523.0, "step": 71025 }, { "entropy": 5.402951240539551, "epoch": 5.526356739933865, "grad_norm": 1.34375, "learning_rate": 0.00024038817834182762, "loss": 4.6923, "mean_token_accuracy": 0.2337244287133217, "num_tokens": 123210115.0, "step": 71030 }, { "entropy": 5.3267021656036375, "epoch": 5.526745769305583, "grad_norm": 1.2421875, "learning_rate": 0.00024036079290775308, "loss": 4.6271, "mean_token_accuracy": 0.23818755149841309, "num_tokens": 123219045.0, "step": 71035 }, { "entropy": 5.3926914691925045, "epoch": 5.5271347986773005, "grad_norm": 1.265625, "learning_rate": 0.00024033340799927338, "loss": 4.7622, "mean_token_accuracy": 0.23074618875980377, "num_tokens": 123228762.0, "step": 71040 }, { "entropy": 5.360033893585205, "epoch": 5.527523828049017, "grad_norm": 1.1796875, "learning_rate": 0.000240306023616804, "loss": 4.6947, "mean_token_accuracy": 0.23364813774824142, "num_tokens": 123237596.0, "step": 71045 }, { "entropy": 5.3927061557769775, "epoch": 5.527912857420735, "grad_norm": 1.21875, "learning_rate": 0.00024027863976076047, "loss": 4.7655, "mean_token_accuracy": 0.23065024614334106, "num_tokens": 123246066.0, "step": 71050 }, { "entropy": 5.343384838104248, "epoch": 5.528301886792453, "grad_norm": 1.2734375, "learning_rate": 0.0002402512564315583, "loss": 4.6447, "mean_token_accuracy": 0.2433573231101036, "num_tokens": 123254337.0, "step": 71055 }, { "entropy": 5.411526441574097, "epoch": 5.52869091616417, "grad_norm": 1.2265625, "learning_rate": 0.00024022387362961306, "loss": 4.7311, "mean_token_accuracy": 0.2284692943096161, "num_tokens": 123262765.0, "step": 71060 }, { "entropy": 5.450392961502075, "epoch": 5.529079945535888, "grad_norm": 1.1328125, "learning_rate": 0.00024019649135534015, "loss": 4.7418, "mean_token_accuracy": 0.23703196793794631, "num_tokens": 123271287.0, "step": 71065 }, { "entropy": 5.401127433776855, "epoch": 5.529468974907606, "grad_norm": 1.2109375, "learning_rate": 0.00024016910960915512, "loss": 4.7105, "mean_token_accuracy": 0.22997922003269194, "num_tokens": 123280629.0, "step": 71070 }, { "entropy": 5.458154582977295, "epoch": 5.529858004279323, "grad_norm": 1.265625, "learning_rate": 0.00024014172839147336, "loss": 4.7178, "mean_token_accuracy": 0.23531197607517243, "num_tokens": 123289295.0, "step": 71075 }, { "entropy": 5.461092567443847, "epoch": 5.53024703365104, "grad_norm": 1.2109375, "learning_rate": 0.00024011434770271033, "loss": 4.8297, "mean_token_accuracy": 0.218813981115818, "num_tokens": 123298626.0, "step": 71080 }, { "entropy": 5.391166734695434, "epoch": 5.530636063022758, "grad_norm": 1.265625, "learning_rate": 0.0002400869675432817, "loss": 4.7151, "mean_token_accuracy": 0.23841411769390106, "num_tokens": 123307449.0, "step": 71085 }, { "entropy": 5.386625909805298, "epoch": 5.531025092394476, "grad_norm": 1.28125, "learning_rate": 0.00024005958791360266, "loss": 4.727, "mean_token_accuracy": 0.22424560487270356, "num_tokens": 123316285.0, "step": 71090 }, { "entropy": 5.411904573440552, "epoch": 5.531414121766193, "grad_norm": 1.1953125, "learning_rate": 0.00024003220881408882, "loss": 4.7561, "mean_token_accuracy": 0.22617663592100143, "num_tokens": 123324866.0, "step": 71095 }, { "entropy": 5.431642246246338, "epoch": 5.531803151137911, "grad_norm": 1.2421875, "learning_rate": 0.00024000483024515552, "loss": 4.7311, "mean_token_accuracy": 0.23143961876630784, "num_tokens": 123333304.0, "step": 71100 }, { "entropy": 5.429759740829468, "epoch": 5.532192180509629, "grad_norm": 1.3046875, "learning_rate": 0.00023997745220721823, "loss": 4.7347, "mean_token_accuracy": 0.23136481791734695, "num_tokens": 123341918.0, "step": 71105 }, { "entropy": 5.307168865203858, "epoch": 5.5325812098813465, "grad_norm": 1.203125, "learning_rate": 0.00023995007470069236, "loss": 4.607, "mean_token_accuracy": 0.2420688271522522, "num_tokens": 123350323.0, "step": 71110 }, { "entropy": 5.384808158874511, "epoch": 5.532970239253063, "grad_norm": 1.15625, "learning_rate": 0.00023992269772599335, "loss": 4.7881, "mean_token_accuracy": 0.22650383561849594, "num_tokens": 123359342.0, "step": 71115 }, { "entropy": 5.484365653991699, "epoch": 5.533359268624781, "grad_norm": 1.328125, "learning_rate": 0.00023989532128353654, "loss": 4.7935, "mean_token_accuracy": 0.2248683899641037, "num_tokens": 123366924.0, "step": 71120 }, { "entropy": 5.277698183059693, "epoch": 5.533748297996499, "grad_norm": 1.25, "learning_rate": 0.0002398679453737374, "loss": 4.5963, "mean_token_accuracy": 0.24192337244749068, "num_tokens": 123376457.0, "step": 71125 }, { "entropy": 5.429205131530762, "epoch": 5.534137327368216, "grad_norm": 1.265625, "learning_rate": 0.00023984056999701121, "loss": 4.7923, "mean_token_accuracy": 0.22591836154460906, "num_tokens": 123385174.0, "step": 71130 }, { "entropy": 5.388508558273315, "epoch": 5.534526356739934, "grad_norm": 1.2265625, "learning_rate": 0.00023981319515377347, "loss": 4.6366, "mean_token_accuracy": 0.24139496833086013, "num_tokens": 123393619.0, "step": 71135 }, { "entropy": 5.436376762390137, "epoch": 5.534915386111652, "grad_norm": 1.25, "learning_rate": 0.00023978582084443939, "loss": 4.6972, "mean_token_accuracy": 0.224521666765213, "num_tokens": 123401259.0, "step": 71140 }, { "entropy": 5.366864585876465, "epoch": 5.535304415483369, "grad_norm": 1.3828125, "learning_rate": 0.0002397584470694244, "loss": 4.6572, "mean_token_accuracy": 0.23841806650161743, "num_tokens": 123410067.0, "step": 71145 }, { "entropy": 5.396704530715942, "epoch": 5.535693444855086, "grad_norm": 1.203125, "learning_rate": 0.000239731073829144, "loss": 4.7211, "mean_token_accuracy": 0.22803351134061814, "num_tokens": 123418280.0, "step": 71150 }, { "entropy": 5.408065509796143, "epoch": 5.536082474226804, "grad_norm": 1.234375, "learning_rate": 0.0002397037011240134, "loss": 4.7286, "mean_token_accuracy": 0.23040994107723237, "num_tokens": 123427531.0, "step": 71155 }, { "entropy": 5.436710500717163, "epoch": 5.536471503598522, "grad_norm": 1.1640625, "learning_rate": 0.00023967632895444796, "loss": 4.7587, "mean_token_accuracy": 0.2270273357629776, "num_tokens": 123435976.0, "step": 71160 }, { "entropy": 5.399189376831055, "epoch": 5.536860532970239, "grad_norm": 1.34375, "learning_rate": 0.000239648957320863, "loss": 4.7092, "mean_token_accuracy": 0.23579172939062118, "num_tokens": 123444417.0, "step": 71165 }, { "entropy": 5.372974634170532, "epoch": 5.537249562341957, "grad_norm": 1.2265625, "learning_rate": 0.0002396215862236738, "loss": 4.7131, "mean_token_accuracy": 0.22912664860486984, "num_tokens": 123452528.0, "step": 71170 }, { "entropy": 5.437200355529785, "epoch": 5.537638591713675, "grad_norm": 1.3125, "learning_rate": 0.00023959421566329574, "loss": 4.7427, "mean_token_accuracy": 0.23424499928951265, "num_tokens": 123461090.0, "step": 71175 }, { "entropy": 5.450372505187988, "epoch": 5.538027621085392, "grad_norm": 1.3515625, "learning_rate": 0.00023956684564014415, "loss": 4.717, "mean_token_accuracy": 0.23116310983896254, "num_tokens": 123469529.0, "step": 71180 }, { "entropy": 5.33239426612854, "epoch": 5.538416650457109, "grad_norm": 1.3046875, "learning_rate": 0.00023953947615463423, "loss": 4.5769, "mean_token_accuracy": 0.2445661410689354, "num_tokens": 123477816.0, "step": 71185 }, { "entropy": 5.378343725204468, "epoch": 5.538805679828827, "grad_norm": 1.3359375, "learning_rate": 0.0002395121072071813, "loss": 4.697, "mean_token_accuracy": 0.2306036412715912, "num_tokens": 123486805.0, "step": 71190 }, { "entropy": 5.420285367965699, "epoch": 5.539194709200545, "grad_norm": 1.203125, "learning_rate": 0.00023948473879820072, "loss": 4.7457, "mean_token_accuracy": 0.2234325036406517, "num_tokens": 123495393.0, "step": 71195 }, { "entropy": 5.467308092117309, "epoch": 5.539583738572262, "grad_norm": 1.2578125, "learning_rate": 0.00023945737092810764, "loss": 4.7352, "mean_token_accuracy": 0.22717151045799255, "num_tokens": 123503319.0, "step": 71200 }, { "entropy": 5.360679769515992, "epoch": 5.53997276794398, "grad_norm": 1.1953125, "learning_rate": 0.0002394300035973175, "loss": 4.622, "mean_token_accuracy": 0.2428535759449005, "num_tokens": 123512051.0, "step": 71205 }, { "entropy": 5.406475830078125, "epoch": 5.540361797315697, "grad_norm": 1.3125, "learning_rate": 0.00023940263680624535, "loss": 4.6747, "mean_token_accuracy": 0.23111325055360793, "num_tokens": 123520812.0, "step": 71210 }, { "entropy": 5.371293687820435, "epoch": 5.540750826687415, "grad_norm": 1.2109375, "learning_rate": 0.00023937527055530643, "loss": 4.6837, "mean_token_accuracy": 0.23089441359043122, "num_tokens": 123530079.0, "step": 71215 }, { "entropy": 5.390916776657105, "epoch": 5.541139856059132, "grad_norm": 1.2890625, "learning_rate": 0.0002393479048449162, "loss": 4.6909, "mean_token_accuracy": 0.2386585980653763, "num_tokens": 123538437.0, "step": 71220 }, { "entropy": 5.324668264389038, "epoch": 5.54152888543085, "grad_norm": 1.2578125, "learning_rate": 0.00023932053967548971, "loss": 4.6005, "mean_token_accuracy": 0.2368892699480057, "num_tokens": 123547565.0, "step": 71225 }, { "entropy": 5.390067625045776, "epoch": 5.541917914802568, "grad_norm": 1.3359375, "learning_rate": 0.00023929317504744235, "loss": 4.6801, "mean_token_accuracy": 0.2334108754992485, "num_tokens": 123555983.0, "step": 71230 }, { "entropy": 5.383025407791138, "epoch": 5.542306944174285, "grad_norm": 1.2890625, "learning_rate": 0.00023926581096118916, "loss": 4.6188, "mean_token_accuracy": 0.2459752917289734, "num_tokens": 123564440.0, "step": 71235 }, { "entropy": 5.398411512374878, "epoch": 5.542695973546003, "grad_norm": 1.203125, "learning_rate": 0.0002392384474171454, "loss": 4.7225, "mean_token_accuracy": 0.23337140083312988, "num_tokens": 123573283.0, "step": 71240 }, { "entropy": 5.398371934890747, "epoch": 5.543085002917721, "grad_norm": 1.3515625, "learning_rate": 0.00023921108441572625, "loss": 4.6761, "mean_token_accuracy": 0.23508528918027877, "num_tokens": 123582002.0, "step": 71245 }, { "entropy": 5.393572044372559, "epoch": 5.543474032289438, "grad_norm": 1.40625, "learning_rate": 0.000239183721957347, "loss": 4.7707, "mean_token_accuracy": 0.2334441736340523, "num_tokens": 123590557.0, "step": 71250 }, { "entropy": 5.379699468612671, "epoch": 5.543863061661155, "grad_norm": 1.1796875, "learning_rate": 0.00023915636004242274, "loss": 4.6352, "mean_token_accuracy": 0.23921067714691163, "num_tokens": 123599548.0, "step": 71255 }, { "entropy": 5.380928945541382, "epoch": 5.544252091032873, "grad_norm": 1.3515625, "learning_rate": 0.0002391289986713686, "loss": 4.6028, "mean_token_accuracy": 0.24641335904598236, "num_tokens": 123607958.0, "step": 71260 }, { "entropy": 5.50011887550354, "epoch": 5.544641120404591, "grad_norm": 1.28125, "learning_rate": 0.00023910163784459986, "loss": 4.8626, "mean_token_accuracy": 0.21921878606081008, "num_tokens": 123615867.0, "step": 71265 }, { "entropy": 5.381432247161865, "epoch": 5.545030149776308, "grad_norm": 1.234375, "learning_rate": 0.0002390742775625317, "loss": 4.6219, "mean_token_accuracy": 0.24499341398477553, "num_tokens": 123624133.0, "step": 71270 }, { "entropy": 5.352582216262817, "epoch": 5.545419179148025, "grad_norm": 1.3359375, "learning_rate": 0.00023904691782557908, "loss": 4.6117, "mean_token_accuracy": 0.2438999205827713, "num_tokens": 123632306.0, "step": 71275 }, { "entropy": 5.406718826293945, "epoch": 5.545808208519743, "grad_norm": 1.2109375, "learning_rate": 0.00023901955863415725, "loss": 4.7403, "mean_token_accuracy": 0.22616302818059922, "num_tokens": 123641225.0, "step": 71280 }, { "entropy": 5.38878288269043, "epoch": 5.546197237891461, "grad_norm": 1.1796875, "learning_rate": 0.00023899219998868142, "loss": 4.7108, "mean_token_accuracy": 0.22584101259708406, "num_tokens": 123650291.0, "step": 71285 }, { "entropy": 5.350390529632568, "epoch": 5.546586267263178, "grad_norm": 1.234375, "learning_rate": 0.00023896484188956664, "loss": 4.6463, "mean_token_accuracy": 0.23685629814863204, "num_tokens": 123659552.0, "step": 71290 }, { "entropy": 5.476536607742309, "epoch": 5.546975296634896, "grad_norm": 1.171875, "learning_rate": 0.000238937484337228, "loss": 4.7947, "mean_token_accuracy": 0.2296607404947281, "num_tokens": 123668440.0, "step": 71295 }, { "entropy": 5.358720684051514, "epoch": 5.547364326006614, "grad_norm": 1.203125, "learning_rate": 0.00023891012733208062, "loss": 4.6843, "mean_token_accuracy": 0.22796618938446045, "num_tokens": 123677310.0, "step": 71300 }, { "entropy": 5.252505445480347, "epoch": 5.547753355378331, "grad_norm": 1.171875, "learning_rate": 0.00023888277087453962, "loss": 4.5642, "mean_token_accuracy": 0.24780309051275254, "num_tokens": 123686560.0, "step": 71305 }, { "entropy": 5.362309360504151, "epoch": 5.548142384750049, "grad_norm": 1.3671875, "learning_rate": 0.00023885541496502017, "loss": 4.739, "mean_token_accuracy": 0.23092172294855118, "num_tokens": 123695223.0, "step": 71310 }, { "entropy": 5.451550436019898, "epoch": 5.548531414121766, "grad_norm": 1.28125, "learning_rate": 0.00023882805960393722, "loss": 4.7691, "mean_token_accuracy": 0.23090124726295472, "num_tokens": 123704415.0, "step": 71315 }, { "entropy": 5.516361665725708, "epoch": 5.548920443493484, "grad_norm": 1.3125, "learning_rate": 0.0002388007047917059, "loss": 4.7619, "mean_token_accuracy": 0.23531751781702043, "num_tokens": 123713506.0, "step": 71320 }, { "entropy": 5.410640573501587, "epoch": 5.549309472865201, "grad_norm": 1.3359375, "learning_rate": 0.00023877335052874122, "loss": 4.7242, "mean_token_accuracy": 0.2308322086930275, "num_tokens": 123721999.0, "step": 71325 }, { "entropy": 5.357743549346924, "epoch": 5.549698502236919, "grad_norm": 1.265625, "learning_rate": 0.00023874599681545833, "loss": 4.7005, "mean_token_accuracy": 0.23016363978385926, "num_tokens": 123731297.0, "step": 71330 }, { "entropy": 5.280794858932495, "epoch": 5.550087531608637, "grad_norm": 1.4375, "learning_rate": 0.0002387186436522722, "loss": 4.5529, "mean_token_accuracy": 0.2422693818807602, "num_tokens": 123739704.0, "step": 71335 }, { "entropy": 5.4853137016296385, "epoch": 5.550476560980354, "grad_norm": 1.3515625, "learning_rate": 0.0002386912910395979, "loss": 4.7751, "mean_token_accuracy": 0.22573849111795424, "num_tokens": 123748811.0, "step": 71340 }, { "entropy": 5.4452026844024655, "epoch": 5.550865590352071, "grad_norm": 1.2890625, "learning_rate": 0.00023866393897785049, "loss": 4.7419, "mean_token_accuracy": 0.2291549935936928, "num_tokens": 123758226.0, "step": 71345 }, { "entropy": 5.410419368743897, "epoch": 5.551254619723789, "grad_norm": 1.21875, "learning_rate": 0.00023863658746744494, "loss": 4.6806, "mean_token_accuracy": 0.22997353971004486, "num_tokens": 123766362.0, "step": 71350 }, { "entropy": 5.324558067321777, "epoch": 5.551643649095507, "grad_norm": 1.3515625, "learning_rate": 0.00023860923650879636, "loss": 4.6323, "mean_token_accuracy": 0.25093170553445815, "num_tokens": 123774238.0, "step": 71355 }, { "entropy": 5.396375608444214, "epoch": 5.552032678467224, "grad_norm": 1.2109375, "learning_rate": 0.0002385818861023197, "loss": 4.7054, "mean_token_accuracy": 0.23085001558065416, "num_tokens": 123782618.0, "step": 71360 }, { "entropy": 5.423918151855469, "epoch": 5.552421707838942, "grad_norm": 1.3671875, "learning_rate": 0.00023855453624842986, "loss": 4.7232, "mean_token_accuracy": 0.225795878469944, "num_tokens": 123790968.0, "step": 71365 }, { "entropy": 5.402528619766235, "epoch": 5.55281073721066, "grad_norm": 1.3203125, "learning_rate": 0.000238527186947542, "loss": 4.6959, "mean_token_accuracy": 0.23518263548612595, "num_tokens": 123799933.0, "step": 71370 }, { "entropy": 5.404820728302002, "epoch": 5.553199766582377, "grad_norm": 1.2265625, "learning_rate": 0.000238499838200071, "loss": 4.6337, "mean_token_accuracy": 0.2423001766204834, "num_tokens": 123808950.0, "step": 71375 }, { "entropy": 5.415762042999267, "epoch": 5.553588795954094, "grad_norm": 1.328125, "learning_rate": 0.00023847249000643185, "loss": 4.7147, "mean_token_accuracy": 0.23493777215480804, "num_tokens": 123817200.0, "step": 71380 }, { "entropy": 5.3805653095245365, "epoch": 5.553977825325812, "grad_norm": 1.3046875, "learning_rate": 0.00023844514236703952, "loss": 4.6634, "mean_token_accuracy": 0.23659783601760864, "num_tokens": 123825459.0, "step": 71385 }, { "entropy": 5.439620542526245, "epoch": 5.5543668546975296, "grad_norm": 1.2265625, "learning_rate": 0.000238417795282309, "loss": 4.7989, "mean_token_accuracy": 0.22537942230701447, "num_tokens": 123834880.0, "step": 71390 }, { "entropy": 5.511213874816894, "epoch": 5.554755884069247, "grad_norm": 1.2890625, "learning_rate": 0.00023839044875265526, "loss": 4.7774, "mean_token_accuracy": 0.2272901192307472, "num_tokens": 123842954.0, "step": 71395 }, { "entropy": 5.422222852706909, "epoch": 5.555144913440965, "grad_norm": 1.2578125, "learning_rate": 0.0002383631027784931, "loss": 4.6899, "mean_token_accuracy": 0.22925954610109328, "num_tokens": 123851863.0, "step": 71400 }, { "entropy": 5.394540071487427, "epoch": 5.555533942812683, "grad_norm": 1.1953125, "learning_rate": 0.00023833575736023754, "loss": 4.7594, "mean_token_accuracy": 0.22967920303344727, "num_tokens": 123860796.0, "step": 71405 }, { "entropy": 5.411272811889648, "epoch": 5.5559229721843995, "grad_norm": 1.1953125, "learning_rate": 0.00023830841249830348, "loss": 4.6535, "mean_token_accuracy": 0.23939443677663802, "num_tokens": 123869197.0, "step": 71410 }, { "entropy": 5.433346843719482, "epoch": 5.556312001556117, "grad_norm": 1.3125, "learning_rate": 0.0002382810681931059, "loss": 4.7671, "mean_token_accuracy": 0.2311771109700203, "num_tokens": 123879172.0, "step": 71415 }, { "entropy": 5.4561436653137205, "epoch": 5.556701030927835, "grad_norm": 1.234375, "learning_rate": 0.00023825372444505967, "loss": 4.7223, "mean_token_accuracy": 0.22813272029161452, "num_tokens": 123887776.0, "step": 71420 }, { "entropy": 5.348863029479981, "epoch": 5.5570900602995525, "grad_norm": 1.3828125, "learning_rate": 0.00023822638125457974, "loss": 4.6752, "mean_token_accuracy": 0.23891769349575043, "num_tokens": 123896280.0, "step": 71425 }, { "entropy": 5.360417175292969, "epoch": 5.55747908967127, "grad_norm": 1.1953125, "learning_rate": 0.00023819903862208093, "loss": 4.6961, "mean_token_accuracy": 0.2308642566204071, "num_tokens": 123905658.0, "step": 71430 }, { "entropy": 5.365459728240967, "epoch": 5.557868119042988, "grad_norm": 1.234375, "learning_rate": 0.0002381716965479781, "loss": 4.6778, "mean_token_accuracy": 0.23635804355144502, "num_tokens": 123914580.0, "step": 71435 }, { "entropy": 5.3354442596435545, "epoch": 5.558257148414706, "grad_norm": 1.25, "learning_rate": 0.00023814435503268617, "loss": 4.6211, "mean_token_accuracy": 0.2492464080452919, "num_tokens": 123923713.0, "step": 71440 }, { "entropy": 5.340963125228882, "epoch": 5.558646177786423, "grad_norm": 1.2421875, "learning_rate": 0.00023811701407661995, "loss": 4.611, "mean_token_accuracy": 0.2370154470205307, "num_tokens": 123932887.0, "step": 71445 }, { "entropy": 5.368391418457032, "epoch": 5.55903520715814, "grad_norm": 1.1953125, "learning_rate": 0.00023808967368019434, "loss": 4.7249, "mean_token_accuracy": 0.2351517766714096, "num_tokens": 123941148.0, "step": 71450 }, { "entropy": 5.412996625900268, "epoch": 5.559424236529858, "grad_norm": 1.234375, "learning_rate": 0.0002380623338438242, "loss": 4.6922, "mean_token_accuracy": 0.23314565271139145, "num_tokens": 123950150.0, "step": 71455 }, { "entropy": 5.472694969177246, "epoch": 5.5598132659015755, "grad_norm": 1.3359375, "learning_rate": 0.0002380349945679244, "loss": 4.782, "mean_token_accuracy": 0.2208203062415123, "num_tokens": 123958066.0, "step": 71460 }, { "entropy": 5.396882009506226, "epoch": 5.560202295273293, "grad_norm": 1.2109375, "learning_rate": 0.00023800765585290967, "loss": 4.7038, "mean_token_accuracy": 0.23330495059490203, "num_tokens": 123966958.0, "step": 71465 }, { "entropy": 5.450788259506226, "epoch": 5.560591324645011, "grad_norm": 1.265625, "learning_rate": 0.00023798031769919488, "loss": 4.6988, "mean_token_accuracy": 0.23637136220932006, "num_tokens": 123975513.0, "step": 71470 }, { "entropy": 5.378251361846924, "epoch": 5.560980354016729, "grad_norm": 1.1953125, "learning_rate": 0.0002379529801071949, "loss": 4.6389, "mean_token_accuracy": 0.23775823712348937, "num_tokens": 123983741.0, "step": 71475 }, { "entropy": 5.4551694869995115, "epoch": 5.561369383388445, "grad_norm": 1.203125, "learning_rate": 0.0002379256430773244, "loss": 4.8105, "mean_token_accuracy": 0.22398041188716888, "num_tokens": 123992949.0, "step": 71480 }, { "entropy": 5.368277740478516, "epoch": 5.561758412760163, "grad_norm": 1.2109375, "learning_rate": 0.00023789830660999822, "loss": 4.6441, "mean_token_accuracy": 0.23273210376501083, "num_tokens": 124001583.0, "step": 71485 }, { "entropy": 5.449559688568115, "epoch": 5.562147442131881, "grad_norm": 1.2421875, "learning_rate": 0.0002378709707056313, "loss": 4.7326, "mean_token_accuracy": 0.23272522687911987, "num_tokens": 124010101.0, "step": 71490 }, { "entropy": 5.375598335266114, "epoch": 5.5625364715035985, "grad_norm": 1.171875, "learning_rate": 0.00023784363536463827, "loss": 4.7059, "mean_token_accuracy": 0.2336138054728508, "num_tokens": 124019198.0, "step": 71495 }, { "entropy": 5.391961145401001, "epoch": 5.562925500875316, "grad_norm": 1.28125, "learning_rate": 0.00023781630058743392, "loss": 4.7197, "mean_token_accuracy": 0.2336716741323471, "num_tokens": 124027476.0, "step": 71500 }, { "entropy": 5.371859884262085, "epoch": 5.563314530247034, "grad_norm": 1.3359375, "learning_rate": 0.0002377889663744331, "loss": 4.6378, "mean_token_accuracy": 0.23823229670524598, "num_tokens": 124035902.0, "step": 71505 }, { "entropy": 5.345307779312134, "epoch": 5.563703559618752, "grad_norm": 1.3359375, "learning_rate": 0.0002377616327260504, "loss": 4.5935, "mean_token_accuracy": 0.24612261354923248, "num_tokens": 124044413.0, "step": 71510 }, { "entropy": 5.3350670337677, "epoch": 5.564092588990468, "grad_norm": 1.375, "learning_rate": 0.00023773429964270065, "loss": 4.721, "mean_token_accuracy": 0.23531905114650725, "num_tokens": 124053655.0, "step": 71515 }, { "entropy": 5.394557666778565, "epoch": 5.564481618362186, "grad_norm": 1.3125, "learning_rate": 0.0002377069671247986, "loss": 4.7424, "mean_token_accuracy": 0.22312032133340837, "num_tokens": 124062694.0, "step": 71520 }, { "entropy": 5.3451872825622555, "epoch": 5.564870647733904, "grad_norm": 1.25, "learning_rate": 0.00023767963517275903, "loss": 4.6427, "mean_token_accuracy": 0.23714347630739213, "num_tokens": 124072437.0, "step": 71525 }, { "entropy": 5.43124794960022, "epoch": 5.5652596771056215, "grad_norm": 1.2890625, "learning_rate": 0.0002376523037869965, "loss": 4.7004, "mean_token_accuracy": 0.22921424210071564, "num_tokens": 124081151.0, "step": 71530 }, { "entropy": 5.411799192428589, "epoch": 5.565648706477339, "grad_norm": 1.28125, "learning_rate": 0.00023762497296792585, "loss": 4.7428, "mean_token_accuracy": 0.2230130761861801, "num_tokens": 124089242.0, "step": 71535 }, { "entropy": 5.48844575881958, "epoch": 5.566037735849057, "grad_norm": 1.2578125, "learning_rate": 0.00023759764271596173, "loss": 4.7856, "mean_token_accuracy": 0.22754015326499938, "num_tokens": 124097594.0, "step": 71540 }, { "entropy": 5.3827889919281, "epoch": 5.566426765220774, "grad_norm": 1.2734375, "learning_rate": 0.00023757031303151888, "loss": 4.677, "mean_token_accuracy": 0.2411901205778122, "num_tokens": 124106425.0, "step": 71545 }, { "entropy": 5.39788703918457, "epoch": 5.566815794592491, "grad_norm": 1.2578125, "learning_rate": 0.00023754298391501195, "loss": 4.7137, "mean_token_accuracy": 0.23502082824707032, "num_tokens": 124115320.0, "step": 71550 }, { "entropy": 5.366327238082886, "epoch": 5.567204823964209, "grad_norm": 1.203125, "learning_rate": 0.0002375156553668556, "loss": 4.6975, "mean_token_accuracy": 0.23709276616573333, "num_tokens": 124124689.0, "step": 71555 }, { "entropy": 5.350233173370361, "epoch": 5.567593853335927, "grad_norm": 1.1484375, "learning_rate": 0.0002374883273874645, "loss": 4.7211, "mean_token_accuracy": 0.22450742572546006, "num_tokens": 124133540.0, "step": 71560 }, { "entropy": 5.453421497344971, "epoch": 5.5679828827076445, "grad_norm": 1.3359375, "learning_rate": 0.0002374609999772534, "loss": 4.7404, "mean_token_accuracy": 0.22793408781290053, "num_tokens": 124142089.0, "step": 71565 }, { "entropy": 5.53364839553833, "epoch": 5.568371912079362, "grad_norm": 1.15625, "learning_rate": 0.00023743367313663682, "loss": 4.8821, "mean_token_accuracy": 0.21759896576404572, "num_tokens": 124151214.0, "step": 71570 }, { "entropy": 5.429281377792359, "epoch": 5.56876094145108, "grad_norm": 1.2265625, "learning_rate": 0.00023740634686602945, "loss": 4.68, "mean_token_accuracy": 0.22854895740747452, "num_tokens": 124159814.0, "step": 71575 }, { "entropy": 5.4113121509552, "epoch": 5.569149970822798, "grad_norm": 1.3125, "learning_rate": 0.00023737902116584598, "loss": 4.7984, "mean_token_accuracy": 0.2253943130373955, "num_tokens": 124168562.0, "step": 71580 }, { "entropy": 5.4698254585266115, "epoch": 5.569539000194514, "grad_norm": 1.3125, "learning_rate": 0.00023735169603650104, "loss": 4.8763, "mean_token_accuracy": 0.21940825283527374, "num_tokens": 124177519.0, "step": 71585 }, { "entropy": 5.362502670288086, "epoch": 5.569928029566232, "grad_norm": 1.296875, "learning_rate": 0.00023732437147840906, "loss": 4.6525, "mean_token_accuracy": 0.2379278361797333, "num_tokens": 124185292.0, "step": 71590 }, { "entropy": 5.438634824752808, "epoch": 5.57031705893795, "grad_norm": 1.2109375, "learning_rate": 0.00023729704749198482, "loss": 4.752, "mean_token_accuracy": 0.22713001519441606, "num_tokens": 124194599.0, "step": 71595 }, { "entropy": 5.42065110206604, "epoch": 5.5707060883096675, "grad_norm": 1.2734375, "learning_rate": 0.00023726972407764286, "loss": 4.6712, "mean_token_accuracy": 0.23801439702510835, "num_tokens": 124202455.0, "step": 71600 }, { "entropy": 5.441595792770386, "epoch": 5.571095117681385, "grad_norm": 1.2578125, "learning_rate": 0.00023724240123579782, "loss": 4.7847, "mean_token_accuracy": 0.23056374937295915, "num_tokens": 124211115.0, "step": 71605 }, { "entropy": 5.402417135238648, "epoch": 5.571484147053102, "grad_norm": 1.296875, "learning_rate": 0.00023721507896686412, "loss": 4.7176, "mean_token_accuracy": 0.2333522006869316, "num_tokens": 124220518.0, "step": 71610 }, { "entropy": 5.305482053756714, "epoch": 5.57187317642482, "grad_norm": 1.2265625, "learning_rate": 0.00023718775727125658, "loss": 4.5749, "mean_token_accuracy": 0.2447166308760643, "num_tokens": 124229293.0, "step": 71615 }, { "entropy": 5.432966852188111, "epoch": 5.572262205796537, "grad_norm": 1.328125, "learning_rate": 0.00023716043614938965, "loss": 4.7491, "mean_token_accuracy": 0.2401465192437172, "num_tokens": 124238584.0, "step": 71620 }, { "entropy": 5.333869171142578, "epoch": 5.572651235168255, "grad_norm": 1.28125, "learning_rate": 0.00023713311560167783, "loss": 4.7028, "mean_token_accuracy": 0.23468175679445266, "num_tokens": 124246386.0, "step": 71625 }, { "entropy": 5.289809465408325, "epoch": 5.573040264539973, "grad_norm": 1.234375, "learning_rate": 0.00023710579562853573, "loss": 4.6751, "mean_token_accuracy": 0.23592764437198638, "num_tokens": 124254707.0, "step": 71630 }, { "entropy": 5.340475797653198, "epoch": 5.5734292939116905, "grad_norm": 1.2890625, "learning_rate": 0.00023707847623037783, "loss": 4.6377, "mean_token_accuracy": 0.24429748207330704, "num_tokens": 124262325.0, "step": 71635 }, { "entropy": 5.2711773872375485, "epoch": 5.573818323283408, "grad_norm": 1.3203125, "learning_rate": 0.00023705115740761874, "loss": 4.6033, "mean_token_accuracy": 0.24414844512939454, "num_tokens": 124270117.0, "step": 71640 }, { "entropy": 5.417718362808228, "epoch": 5.574207352655126, "grad_norm": 1.15625, "learning_rate": 0.00023702383916067294, "loss": 4.7576, "mean_token_accuracy": 0.2212275579571724, "num_tokens": 124279192.0, "step": 71645 }, { "entropy": 5.339358234405518, "epoch": 5.574596382026843, "grad_norm": 1.15625, "learning_rate": 0.00023699652148995488, "loss": 4.6326, "mean_token_accuracy": 0.23752682358026506, "num_tokens": 124288000.0, "step": 71650 }, { "entropy": 5.426206588745117, "epoch": 5.57498541139856, "grad_norm": 1.21875, "learning_rate": 0.00023696920439587917, "loss": 4.7955, "mean_token_accuracy": 0.22723033279180527, "num_tokens": 124297804.0, "step": 71655 }, { "entropy": 5.355615520477295, "epoch": 5.575374440770278, "grad_norm": 1.15625, "learning_rate": 0.00023694188787886023, "loss": 4.6585, "mean_token_accuracy": 0.24313735514879226, "num_tokens": 124306212.0, "step": 71660 }, { "entropy": 5.3077844142913815, "epoch": 5.575763470141996, "grad_norm": 1.15625, "learning_rate": 0.0002369145719393126, "loss": 4.6048, "mean_token_accuracy": 0.23837098032236098, "num_tokens": 124314362.0, "step": 71665 }, { "entropy": 5.442368602752685, "epoch": 5.5761524995137135, "grad_norm": 1.265625, "learning_rate": 0.0002368872565776507, "loss": 4.8215, "mean_token_accuracy": 0.22159159183502197, "num_tokens": 124323577.0, "step": 71670 }, { "entropy": 5.456831598281861, "epoch": 5.576541528885431, "grad_norm": 1.1953125, "learning_rate": 0.00023685994179428887, "loss": 4.7513, "mean_token_accuracy": 0.22676711827516555, "num_tokens": 124332914.0, "step": 71675 }, { "entropy": 5.417503356933594, "epoch": 5.576930558257148, "grad_norm": 1.28125, "learning_rate": 0.00023683262758964185, "loss": 4.6902, "mean_token_accuracy": 0.2387118011713028, "num_tokens": 124341285.0, "step": 71680 }, { "entropy": 5.454626607894897, "epoch": 5.577319587628866, "grad_norm": 1.328125, "learning_rate": 0.00023680531396412397, "loss": 4.8088, "mean_token_accuracy": 0.22863685786724092, "num_tokens": 124349229.0, "step": 71685 }, { "entropy": 5.367154121398926, "epoch": 5.577708617000583, "grad_norm": 1.3515625, "learning_rate": 0.00023677800091814966, "loss": 4.7301, "mean_token_accuracy": 0.23102815300226212, "num_tokens": 124357420.0, "step": 71690 }, { "entropy": 5.502103805541992, "epoch": 5.578097646372301, "grad_norm": 1.3515625, "learning_rate": 0.0002367506884521334, "loss": 4.8707, "mean_token_accuracy": 0.22316930294036866, "num_tokens": 124366085.0, "step": 71695 }, { "entropy": 5.415379381179809, "epoch": 5.578486675744019, "grad_norm": 1.15625, "learning_rate": 0.00023672337656648951, "loss": 4.6871, "mean_token_accuracy": 0.23156578540802003, "num_tokens": 124375046.0, "step": 71700 }, { "entropy": 5.52207760810852, "epoch": 5.5788757051157365, "grad_norm": 1.28125, "learning_rate": 0.0002366960652616324, "loss": 4.7698, "mean_token_accuracy": 0.2249188542366028, "num_tokens": 124383557.0, "step": 71705 }, { "entropy": 5.35969557762146, "epoch": 5.579264734487454, "grad_norm": 1.171875, "learning_rate": 0.0002366687545379766, "loss": 4.6849, "mean_token_accuracy": 0.23182230442762375, "num_tokens": 124392912.0, "step": 71710 }, { "entropy": 5.3644969940185545, "epoch": 5.579653763859171, "grad_norm": 1.375, "learning_rate": 0.00023664144439593644, "loss": 4.6811, "mean_token_accuracy": 0.2413771629333496, "num_tokens": 124402136.0, "step": 71715 }, { "entropy": 5.465112400054932, "epoch": 5.580042793230889, "grad_norm": 1.1796875, "learning_rate": 0.00023661413483592626, "loss": 4.8315, "mean_token_accuracy": 0.22710364013910295, "num_tokens": 124412144.0, "step": 71720 }, { "entropy": 5.4108020782470705, "epoch": 5.580431822602606, "grad_norm": 1.2890625, "learning_rate": 0.00023658682585836049, "loss": 4.6934, "mean_token_accuracy": 0.23729199320077896, "num_tokens": 124420379.0, "step": 71725 }, { "entropy": 5.409643983840942, "epoch": 5.580820851974324, "grad_norm": 1.2578125, "learning_rate": 0.00023655951746365356, "loss": 4.6562, "mean_token_accuracy": 0.2363213613629341, "num_tokens": 124428708.0, "step": 71730 }, { "entropy": 5.275825166702271, "epoch": 5.581209881346042, "grad_norm": 1.2109375, "learning_rate": 0.00023653220965221973, "loss": 4.6297, "mean_token_accuracy": 0.2399386629462242, "num_tokens": 124437403.0, "step": 71735 }, { "entropy": 5.38487401008606, "epoch": 5.5815989107177595, "grad_norm": 1.2421875, "learning_rate": 0.00023650490242447338, "loss": 4.7186, "mean_token_accuracy": 0.22153247892856598, "num_tokens": 124446853.0, "step": 71740 }, { "entropy": 5.438062381744385, "epoch": 5.581987940089476, "grad_norm": 1.21875, "learning_rate": 0.00023647759578082883, "loss": 4.7055, "mean_token_accuracy": 0.2302195832133293, "num_tokens": 124456414.0, "step": 71745 }, { "entropy": 5.46565203666687, "epoch": 5.582376969461194, "grad_norm": 1.2421875, "learning_rate": 0.00023645028972170046, "loss": 4.6761, "mean_token_accuracy": 0.2342332735657692, "num_tokens": 124464976.0, "step": 71750 }, { "entropy": 5.39146671295166, "epoch": 5.582765998832912, "grad_norm": 1.296875, "learning_rate": 0.00023642298424750264, "loss": 4.773, "mean_token_accuracy": 0.22837668359279634, "num_tokens": 124473568.0, "step": 71755 }, { "entropy": 5.319103193283081, "epoch": 5.583155028204629, "grad_norm": 1.21875, "learning_rate": 0.00023639567935864958, "loss": 4.6966, "mean_token_accuracy": 0.2299676477909088, "num_tokens": 124482395.0, "step": 71760 }, { "entropy": 5.389864492416382, "epoch": 5.583544057576347, "grad_norm": 1.1953125, "learning_rate": 0.0002363683750555557, "loss": 4.6848, "mean_token_accuracy": 0.2371253177523613, "num_tokens": 124490444.0, "step": 71765 }, { "entropy": 5.343293714523315, "epoch": 5.583933086948065, "grad_norm": 1.203125, "learning_rate": 0.0002363410713386352, "loss": 4.6595, "mean_token_accuracy": 0.2299022912979126, "num_tokens": 124499068.0, "step": 71770 }, { "entropy": 5.376804447174072, "epoch": 5.5843221163197825, "grad_norm": 1.34375, "learning_rate": 0.00023631376820830248, "loss": 4.6835, "mean_token_accuracy": 0.23131352961063384, "num_tokens": 124508071.0, "step": 71775 }, { "entropy": 5.372738361358643, "epoch": 5.5847111456915, "grad_norm": 1.1953125, "learning_rate": 0.0002362864656649717, "loss": 4.7037, "mean_token_accuracy": 0.2388909563422203, "num_tokens": 124516689.0, "step": 71780 }, { "entropy": 5.431550598144531, "epoch": 5.585100175063217, "grad_norm": 1.34375, "learning_rate": 0.00023625916370905714, "loss": 4.7596, "mean_token_accuracy": 0.2341059237718582, "num_tokens": 124524752.0, "step": 71785 }, { "entropy": 5.4365678310394285, "epoch": 5.585489204434935, "grad_norm": 1.265625, "learning_rate": 0.00023623186234097315, "loss": 4.7298, "mean_token_accuracy": 0.23439615815877915, "num_tokens": 124533605.0, "step": 71790 }, { "entropy": 5.383245897293091, "epoch": 5.585878233806652, "grad_norm": 1.1328125, "learning_rate": 0.00023620456156113397, "loss": 4.7445, "mean_token_accuracy": 0.23875697702169418, "num_tokens": 124542910.0, "step": 71795 }, { "entropy": 5.446283149719238, "epoch": 5.58626726317837, "grad_norm": 1.21875, "learning_rate": 0.00023617726136995377, "loss": 4.7145, "mean_token_accuracy": 0.23030093759298326, "num_tokens": 124551880.0, "step": 71800 }, { "entropy": 5.368617916107178, "epoch": 5.586656292550088, "grad_norm": 1.2421875, "learning_rate": 0.00023614996176784687, "loss": 4.6293, "mean_token_accuracy": 0.23986468613147735, "num_tokens": 124560455.0, "step": 71805 }, { "entropy": 5.377729654312134, "epoch": 5.5870453219218055, "grad_norm": 1.203125, "learning_rate": 0.00023612266275522737, "loss": 4.6251, "mean_token_accuracy": 0.2405630975961685, "num_tokens": 124568925.0, "step": 71810 }, { "entropy": 5.40814242362976, "epoch": 5.587434351293522, "grad_norm": 1.28125, "learning_rate": 0.00023609536433250966, "loss": 4.7692, "mean_token_accuracy": 0.227486352622509, "num_tokens": 124577162.0, "step": 71815 }, { "entropy": 5.4459450244903564, "epoch": 5.58782338066524, "grad_norm": 1.296875, "learning_rate": 0.00023606806650010786, "loss": 4.7416, "mean_token_accuracy": 0.23575246334075928, "num_tokens": 124584892.0, "step": 71820 }, { "entropy": 5.369396591186524, "epoch": 5.588212410036958, "grad_norm": 1.2578125, "learning_rate": 0.00023604076925843622, "loss": 4.6529, "mean_token_accuracy": 0.2368028059601784, "num_tokens": 124594646.0, "step": 71825 }, { "entropy": 5.427077770233154, "epoch": 5.588601439408675, "grad_norm": 1.28125, "learning_rate": 0.00023601347260790884, "loss": 4.7439, "mean_token_accuracy": 0.23060963600873946, "num_tokens": 124602047.0, "step": 71830 }, { "entropy": 5.392776203155518, "epoch": 5.588990468780393, "grad_norm": 1.171875, "learning_rate": 0.00023598617654894006, "loss": 4.7152, "mean_token_accuracy": 0.23863882273435594, "num_tokens": 124610783.0, "step": 71835 }, { "entropy": 5.412454271316529, "epoch": 5.589379498152111, "grad_norm": 1.203125, "learning_rate": 0.00023595888108194385, "loss": 4.7489, "mean_token_accuracy": 0.23145599514245987, "num_tokens": 124619733.0, "step": 71840 }, { "entropy": 5.405062055587768, "epoch": 5.5897685275238285, "grad_norm": 1.3125, "learning_rate": 0.0002359315862073345, "loss": 4.7231, "mean_token_accuracy": 0.23359524458646774, "num_tokens": 124629245.0, "step": 71845 }, { "entropy": 5.407244348526001, "epoch": 5.590157556895545, "grad_norm": 1.34375, "learning_rate": 0.0002359042919255262, "loss": 4.6842, "mean_token_accuracy": 0.23674705177545546, "num_tokens": 124637542.0, "step": 71850 }, { "entropy": 5.383553600311279, "epoch": 5.590546586267263, "grad_norm": 1.3203125, "learning_rate": 0.00023587699823693304, "loss": 4.6593, "mean_token_accuracy": 0.23010266721248626, "num_tokens": 124645891.0, "step": 71855 }, { "entropy": 5.344635152816773, "epoch": 5.590935615638981, "grad_norm": 1.2265625, "learning_rate": 0.00023584970514196912, "loss": 4.6527, "mean_token_accuracy": 0.2364268496632576, "num_tokens": 124656210.0, "step": 71860 }, { "entropy": 5.449120807647705, "epoch": 5.591324645010698, "grad_norm": 1.2421875, "learning_rate": 0.00023582241264104864, "loss": 4.775, "mean_token_accuracy": 0.23100472390651702, "num_tokens": 124663854.0, "step": 71865 }, { "entropy": 5.484356498718261, "epoch": 5.591713674382416, "grad_norm": 1.140625, "learning_rate": 0.00023579512073458565, "loss": 4.8036, "mean_token_accuracy": 0.22345139533281327, "num_tokens": 124672339.0, "step": 71870 }, { "entropy": 5.3695759773254395, "epoch": 5.592102703754134, "grad_norm": 1.28125, "learning_rate": 0.00023576782942299424, "loss": 4.7115, "mean_token_accuracy": 0.22701380848884584, "num_tokens": 124682231.0, "step": 71875 }, { "entropy": 5.373459005355835, "epoch": 5.592491733125851, "grad_norm": 1.28125, "learning_rate": 0.0002357405387066886, "loss": 4.7173, "mean_token_accuracy": 0.23830377459526061, "num_tokens": 124691140.0, "step": 71880 }, { "entropy": 5.411927938461304, "epoch": 5.592880762497568, "grad_norm": 1.2265625, "learning_rate": 0.0002357132485860829, "loss": 4.7564, "mean_token_accuracy": 0.22921765297651292, "num_tokens": 124700388.0, "step": 71885 }, { "entropy": 5.496766138076782, "epoch": 5.593269791869286, "grad_norm": 1.328125, "learning_rate": 0.00023568595906159107, "loss": 4.7573, "mean_token_accuracy": 0.23379006683826448, "num_tokens": 124709145.0, "step": 71890 }, { "entropy": 5.496967601776123, "epoch": 5.593658821241004, "grad_norm": 1.2265625, "learning_rate": 0.00023565867013362725, "loss": 4.7532, "mean_token_accuracy": 0.2251088798046112, "num_tokens": 124717463.0, "step": 71895 }, { "entropy": 5.4037847995758055, "epoch": 5.594047850612721, "grad_norm": 1.234375, "learning_rate": 0.00023563138180260552, "loss": 4.8253, "mean_token_accuracy": 0.22761937975883484, "num_tokens": 124725812.0, "step": 71900 }, { "entropy": 5.402643775939941, "epoch": 5.594436879984439, "grad_norm": 1.2421875, "learning_rate": 0.00023560409406893986, "loss": 4.704, "mean_token_accuracy": 0.23644114136695862, "num_tokens": 124735210.0, "step": 71905 }, { "entropy": 5.443668699264526, "epoch": 5.594825909356157, "grad_norm": 1.21875, "learning_rate": 0.00023557680693304435, "loss": 4.7585, "mean_token_accuracy": 0.23380009531974794, "num_tokens": 124744863.0, "step": 71910 }, { "entropy": 5.424369144439697, "epoch": 5.595214938727874, "grad_norm": 1.3515625, "learning_rate": 0.00023554952039533307, "loss": 4.7035, "mean_token_accuracy": 0.2284855216741562, "num_tokens": 124753519.0, "step": 71915 }, { "entropy": 5.36265230178833, "epoch": 5.595603968099591, "grad_norm": 1.1796875, "learning_rate": 0.00023552223445622006, "loss": 4.6531, "mean_token_accuracy": 0.23201710879802703, "num_tokens": 124762313.0, "step": 71920 }, { "entropy": 5.352631616592407, "epoch": 5.595992997471309, "grad_norm": 1.296875, "learning_rate": 0.00023549494911611924, "loss": 4.6932, "mean_token_accuracy": 0.24650082141160964, "num_tokens": 124771101.0, "step": 71925 }, { "entropy": 5.434217405319214, "epoch": 5.596382026843027, "grad_norm": 1.1171875, "learning_rate": 0.00023546766437544477, "loss": 4.7672, "mean_token_accuracy": 0.2260288655757904, "num_tokens": 124780342.0, "step": 71930 }, { "entropy": 5.3966950416564945, "epoch": 5.596771056214744, "grad_norm": 1.2578125, "learning_rate": 0.00023544038023461057, "loss": 4.7061, "mean_token_accuracy": 0.23255095034837722, "num_tokens": 124788833.0, "step": 71935 }, { "entropy": 5.37835431098938, "epoch": 5.597160085586462, "grad_norm": 1.2265625, "learning_rate": 0.0002354130966940306, "loss": 4.6805, "mean_token_accuracy": 0.23502848893404008, "num_tokens": 124798247.0, "step": 71940 }, { "entropy": 5.415205001831055, "epoch": 5.597549114958179, "grad_norm": 1.1640625, "learning_rate": 0.00023538581375411876, "loss": 4.7104, "mean_token_accuracy": 0.2310178682208061, "num_tokens": 124806800.0, "step": 71945 }, { "entropy": 5.48044056892395, "epoch": 5.597938144329897, "grad_norm": 1.2890625, "learning_rate": 0.00023535853141528923, "loss": 4.7611, "mean_token_accuracy": 0.23090974539518355, "num_tokens": 124815068.0, "step": 71950 }, { "entropy": 5.4402683734893795, "epoch": 5.598327173701614, "grad_norm": 1.1953125, "learning_rate": 0.00023533124967795594, "loss": 4.7862, "mean_token_accuracy": 0.23309133052825928, "num_tokens": 124823660.0, "step": 71955 }, { "entropy": 5.288178205490112, "epoch": 5.598716203073332, "grad_norm": 1.1953125, "learning_rate": 0.00023530396854253276, "loss": 4.5726, "mean_token_accuracy": 0.24579740762710572, "num_tokens": 124832409.0, "step": 71960 }, { "entropy": 5.434702062606812, "epoch": 5.59910523244505, "grad_norm": 1.234375, "learning_rate": 0.00023527668800943374, "loss": 4.898, "mean_token_accuracy": 0.2217651829123497, "num_tokens": 124841691.0, "step": 71965 }, { "entropy": 5.475157785415649, "epoch": 5.599494261816767, "grad_norm": 1.296875, "learning_rate": 0.0002352494080790727, "loss": 4.8094, "mean_token_accuracy": 0.22080370634794236, "num_tokens": 124850544.0, "step": 71970 }, { "entropy": 5.341800737380981, "epoch": 5.599883291188485, "grad_norm": 1.3203125, "learning_rate": 0.0002352221287518636, "loss": 4.5794, "mean_token_accuracy": 0.23962318301200866, "num_tokens": 124858516.0, "step": 71975 }, { "entropy": 5.487163352966308, "epoch": 5.600272320560203, "grad_norm": 1.21875, "learning_rate": 0.00023519485002822038, "loss": 4.8442, "mean_token_accuracy": 0.21879047453403472, "num_tokens": 124867779.0, "step": 71980 }, { "entropy": 5.402089786529541, "epoch": 5.6006613499319196, "grad_norm": 1.3125, "learning_rate": 0.00023516757190855705, "loss": 4.6863, "mean_token_accuracy": 0.23127496838569642, "num_tokens": 124877039.0, "step": 71985 }, { "entropy": 5.384178161621094, "epoch": 5.601050379303637, "grad_norm": 1.2109375, "learning_rate": 0.00023514029439328734, "loss": 4.6933, "mean_token_accuracy": 0.23888282775878905, "num_tokens": 124885743.0, "step": 71990 }, { "entropy": 5.370058059692383, "epoch": 5.601439408675355, "grad_norm": 1.234375, "learning_rate": 0.0002351130174828252, "loss": 4.6477, "mean_token_accuracy": 0.23281227499246598, "num_tokens": 124894814.0, "step": 71995 }, { "entropy": 5.398576927185059, "epoch": 5.601828438047073, "grad_norm": 1.2109375, "learning_rate": 0.00023508574117758453, "loss": 4.7229, "mean_token_accuracy": 0.2389881432056427, "num_tokens": 124903261.0, "step": 72000 }, { "epoch": 5.601828438047073, "eval_entropy": 5.119988270742143, "eval_loss": 4.893167495727539, "eval_mean_token_accuracy": 0.23082889535027817, "eval_num_tokens": 124903261.0, "eval_runtime": 29.239, "eval_samples_per_second": 1421.319, "eval_steps_per_second": 177.673, "step": 72000 }, { "entropy": 5.347326612472534, "epoch": 5.60221746741879, "grad_norm": 1.3515625, "learning_rate": 0.00023505846547797928, "loss": 4.7149, "mean_token_accuracy": 0.22731718122959138, "num_tokens": 124912108.0, "step": 72005 }, { "entropy": 5.4922833919525145, "epoch": 5.602606496790508, "grad_norm": 1.34375, "learning_rate": 0.00023503119038442312, "loss": 4.8176, "mean_token_accuracy": 0.22356500178575517, "num_tokens": 124920808.0, "step": 72010 }, { "entropy": 5.458099269866944, "epoch": 5.602995526162225, "grad_norm": 1.2421875, "learning_rate": 0.0002350039158973301, "loss": 4.6974, "mean_token_accuracy": 0.24435170441865922, "num_tokens": 124929920.0, "step": 72015 }, { "entropy": 5.4221728324890135, "epoch": 5.6033845555339425, "grad_norm": 1.1796875, "learning_rate": 0.000234976642017114, "loss": 4.7212, "mean_token_accuracy": 0.23643734753131868, "num_tokens": 124938905.0, "step": 72020 }, { "entropy": 5.448312377929687, "epoch": 5.60377358490566, "grad_norm": 1.3125, "learning_rate": 0.00023494936874418864, "loss": 4.7305, "mean_token_accuracy": 0.23173199445009232, "num_tokens": 124947413.0, "step": 72025 }, { "entropy": 5.420518398284912, "epoch": 5.604162614277378, "grad_norm": 1.328125, "learning_rate": 0.00023492209607896793, "loss": 4.7379, "mean_token_accuracy": 0.22735135853290558, "num_tokens": 124955548.0, "step": 72030 }, { "entropy": 5.448617458343506, "epoch": 5.604551643649096, "grad_norm": 1.3046875, "learning_rate": 0.00023489482402186558, "loss": 4.749, "mean_token_accuracy": 0.23065790683031082, "num_tokens": 124963821.0, "step": 72035 }, { "entropy": 5.375195646286011, "epoch": 5.604940673020813, "grad_norm": 1.34375, "learning_rate": 0.0002348675525732954, "loss": 4.6593, "mean_token_accuracy": 0.2345134809613228, "num_tokens": 124972436.0, "step": 72040 }, { "entropy": 5.385494565963745, "epoch": 5.605329702392531, "grad_norm": 1.2109375, "learning_rate": 0.00023484028173367127, "loss": 4.7249, "mean_token_accuracy": 0.23292153477668762, "num_tokens": 124981802.0, "step": 72045 }, { "entropy": 5.3511707305908205, "epoch": 5.605718731764248, "grad_norm": 1.1484375, "learning_rate": 0.000234813011503407, "loss": 4.6965, "mean_token_accuracy": 0.23428622633218765, "num_tokens": 124990780.0, "step": 72050 }, { "entropy": 5.413948583602905, "epoch": 5.6061077611359655, "grad_norm": 1.1796875, "learning_rate": 0.00023478574188291623, "loss": 4.7352, "mean_token_accuracy": 0.22952142506837844, "num_tokens": 124999892.0, "step": 72055 }, { "entropy": 5.489055013656616, "epoch": 5.606496790507683, "grad_norm": 1.328125, "learning_rate": 0.00023475847287261282, "loss": 4.803, "mean_token_accuracy": 0.2266104504466057, "num_tokens": 125009319.0, "step": 72060 }, { "entropy": 5.4248046875, "epoch": 5.606885819879401, "grad_norm": 1.2890625, "learning_rate": 0.00023473120447291057, "loss": 4.6789, "mean_token_accuracy": 0.23381361961364747, "num_tokens": 125017825.0, "step": 72065 }, { "entropy": 5.4662433624267575, "epoch": 5.607274849251119, "grad_norm": 1.3125, "learning_rate": 0.0002347039366842232, "loss": 4.8408, "mean_token_accuracy": 0.22155664563179017, "num_tokens": 125026171.0, "step": 72070 }, { "entropy": 5.395715951919556, "epoch": 5.607663878622836, "grad_norm": 1.2890625, "learning_rate": 0.00023467666950696442, "loss": 4.721, "mean_token_accuracy": 0.22939751148223878, "num_tokens": 125034931.0, "step": 72075 }, { "entropy": 5.431500577926636, "epoch": 5.608052907994553, "grad_norm": 1.25, "learning_rate": 0.00023464940294154796, "loss": 4.7361, "mean_token_accuracy": 0.2296561911702156, "num_tokens": 125044162.0, "step": 72080 }, { "entropy": 5.465833520889282, "epoch": 5.608441937366271, "grad_norm": 1.28125, "learning_rate": 0.00023462213698838762, "loss": 4.7794, "mean_token_accuracy": 0.22939728200435638, "num_tokens": 125052081.0, "step": 72085 }, { "entropy": 5.416418600082397, "epoch": 5.6088309667379885, "grad_norm": 1.1640625, "learning_rate": 0.00023459487164789717, "loss": 4.6817, "mean_token_accuracy": 0.24313343316316605, "num_tokens": 125061546.0, "step": 72090 }, { "entropy": 5.411910104751587, "epoch": 5.609219996109706, "grad_norm": 1.203125, "learning_rate": 0.0002345676069204901, "loss": 4.7677, "mean_token_accuracy": 0.23238570988178253, "num_tokens": 125070861.0, "step": 72095 }, { "entropy": 5.381026935577393, "epoch": 5.609609025481424, "grad_norm": 1.203125, "learning_rate": 0.00023454034280658036, "loss": 4.6155, "mean_token_accuracy": 0.24289755821228026, "num_tokens": 125079008.0, "step": 72100 }, { "entropy": 5.451247835159302, "epoch": 5.609998054853142, "grad_norm": 1.3125, "learning_rate": 0.00023451307930658145, "loss": 4.7716, "mean_token_accuracy": 0.23669869601726531, "num_tokens": 125088028.0, "step": 72105 }, { "entropy": 5.413648366928101, "epoch": 5.610387084224859, "grad_norm": 1.3671875, "learning_rate": 0.00023448581642090716, "loss": 4.8091, "mean_token_accuracy": 0.22671463638544082, "num_tokens": 125096076.0, "step": 72110 }, { "entropy": 5.399301290512085, "epoch": 5.610776113596577, "grad_norm": 1.2265625, "learning_rate": 0.00023445855414997108, "loss": 4.7597, "mean_token_accuracy": 0.22801882773637772, "num_tokens": 125104986.0, "step": 72115 }, { "entropy": 5.402620315551758, "epoch": 5.611165142968294, "grad_norm": 1.34375, "learning_rate": 0.00023443129249418694, "loss": 4.6437, "mean_token_accuracy": 0.23342441469430925, "num_tokens": 125113201.0, "step": 72120 }, { "entropy": 5.364388036727905, "epoch": 5.6115541723400115, "grad_norm": 1.15625, "learning_rate": 0.00023440403145396838, "loss": 4.6208, "mean_token_accuracy": 0.24096485525369643, "num_tokens": 125122474.0, "step": 72125 }, { "entropy": 5.406528949737549, "epoch": 5.611943201711729, "grad_norm": 1.28125, "learning_rate": 0.00023437677102972903, "loss": 4.7171, "mean_token_accuracy": 0.23398844450712203, "num_tokens": 125131151.0, "step": 72130 }, { "entropy": 5.344950389862061, "epoch": 5.612332231083447, "grad_norm": 1.3671875, "learning_rate": 0.00023434951122188247, "loss": 4.6778, "mean_token_accuracy": 0.2397386685013771, "num_tokens": 125140219.0, "step": 72135 }, { "entropy": 5.36824221611023, "epoch": 5.612721260455165, "grad_norm": 1.2734375, "learning_rate": 0.0002343222520308423, "loss": 4.7256, "mean_token_accuracy": 0.22888956367969512, "num_tokens": 125147642.0, "step": 72140 }, { "entropy": 5.47944746017456, "epoch": 5.613110289826882, "grad_norm": 1.1796875, "learning_rate": 0.0002342949934570223, "loss": 4.7851, "mean_token_accuracy": 0.2188117817044258, "num_tokens": 125156504.0, "step": 72145 }, { "entropy": 5.43713002204895, "epoch": 5.613499319198599, "grad_norm": 1.390625, "learning_rate": 0.00023426773550083602, "loss": 4.6407, "mean_token_accuracy": 0.23788010478019714, "num_tokens": 125164400.0, "step": 72150 }, { "entropy": 5.438969707489013, "epoch": 5.613888348570317, "grad_norm": 1.1796875, "learning_rate": 0.00023424047816269705, "loss": 4.7717, "mean_token_accuracy": 0.23499398827552795, "num_tokens": 125173255.0, "step": 72155 }, { "entropy": 5.3402317523956295, "epoch": 5.6142773779420345, "grad_norm": 1.1953125, "learning_rate": 0.00023421322144301889, "loss": 4.6901, "mean_token_accuracy": 0.23190366178750993, "num_tokens": 125182403.0, "step": 72160 }, { "entropy": 5.443404960632324, "epoch": 5.614666407313752, "grad_norm": 1.2890625, "learning_rate": 0.0002341859653422152, "loss": 4.7909, "mean_token_accuracy": 0.22575951665639876, "num_tokens": 125190329.0, "step": 72165 }, { "entropy": 5.419959974288941, "epoch": 5.61505543668547, "grad_norm": 1.2421875, "learning_rate": 0.00023415870986069948, "loss": 4.6554, "mean_token_accuracy": 0.23340196311473846, "num_tokens": 125198580.0, "step": 72170 }, { "entropy": 5.366064405441284, "epoch": 5.615444466057188, "grad_norm": 1.140625, "learning_rate": 0.00023413145499888533, "loss": 4.6498, "mean_token_accuracy": 0.24136442691087723, "num_tokens": 125207528.0, "step": 72175 }, { "entropy": 5.406661415100098, "epoch": 5.615833495428905, "grad_norm": 1.2578125, "learning_rate": 0.00023410420075718635, "loss": 4.733, "mean_token_accuracy": 0.23382801413536072, "num_tokens": 125216060.0, "step": 72180 }, { "entropy": 5.441198492050171, "epoch": 5.616222524800622, "grad_norm": 1.203125, "learning_rate": 0.00023407694713601602, "loss": 4.7506, "mean_token_accuracy": 0.2276070937514305, "num_tokens": 125224805.0, "step": 72185 }, { "entropy": 5.372823047637939, "epoch": 5.61661155417234, "grad_norm": 1.265625, "learning_rate": 0.00023404969413578787, "loss": 4.6239, "mean_token_accuracy": 0.23438760936260222, "num_tokens": 125233046.0, "step": 72190 }, { "entropy": 5.381484174728394, "epoch": 5.6170005835440575, "grad_norm": 1.3125, "learning_rate": 0.0002340224417569154, "loss": 4.6655, "mean_token_accuracy": 0.23331774324178695, "num_tokens": 125241601.0, "step": 72195 }, { "entropy": 5.393099451065064, "epoch": 5.617389612915775, "grad_norm": 1.234375, "learning_rate": 0.0002339951899998122, "loss": 4.7189, "mean_token_accuracy": 0.22967860400676726, "num_tokens": 125250225.0, "step": 72200 }, { "entropy": 5.50399227142334, "epoch": 5.617778642287493, "grad_norm": 1.234375, "learning_rate": 0.00023396793886489177, "loss": 4.7429, "mean_token_accuracy": 0.23074330687522887, "num_tokens": 125259110.0, "step": 72205 }, { "entropy": 5.478127527236938, "epoch": 5.618167671659211, "grad_norm": 1.296875, "learning_rate": 0.00023394068835256738, "loss": 4.724, "mean_token_accuracy": 0.23487377911806107, "num_tokens": 125267070.0, "step": 72210 }, { "entropy": 5.3454516410827635, "epoch": 5.618556701030927, "grad_norm": 1.203125, "learning_rate": 0.00023391343846325286, "loss": 4.7012, "mean_token_accuracy": 0.23785390257835387, "num_tokens": 125276007.0, "step": 72215 }, { "entropy": 5.488029193878174, "epoch": 5.618945730402645, "grad_norm": 1.2265625, "learning_rate": 0.00023388618919736143, "loss": 4.7806, "mean_token_accuracy": 0.23102326244115828, "num_tokens": 125284540.0, "step": 72220 }, { "entropy": 5.392019605636596, "epoch": 5.619334759774363, "grad_norm": 1.21875, "learning_rate": 0.00023385894055530666, "loss": 4.7617, "mean_token_accuracy": 0.2277224063873291, "num_tokens": 125293522.0, "step": 72225 }, { "entropy": 5.396182584762573, "epoch": 5.6197237891460805, "grad_norm": 1.140625, "learning_rate": 0.00023383169253750203, "loss": 4.72, "mean_token_accuracy": 0.2376866579055786, "num_tokens": 125301947.0, "step": 72230 }, { "entropy": 5.4437408447265625, "epoch": 5.620112818517798, "grad_norm": 1.171875, "learning_rate": 0.00023380444514436093, "loss": 4.7323, "mean_token_accuracy": 0.22811394184827805, "num_tokens": 125310555.0, "step": 72235 }, { "entropy": 5.360163450241089, "epoch": 5.620501847889516, "grad_norm": 1.15625, "learning_rate": 0.0002337771983762968, "loss": 4.6711, "mean_token_accuracy": 0.23130515664815904, "num_tokens": 125319077.0, "step": 72240 }, { "entropy": 5.401445055007935, "epoch": 5.620890877261234, "grad_norm": 1.1953125, "learning_rate": 0.00023374995223372308, "loss": 4.719, "mean_token_accuracy": 0.23090377300977707, "num_tokens": 125327732.0, "step": 72245 }, { "entropy": 5.435986566543579, "epoch": 5.62127990663295, "grad_norm": 1.2890625, "learning_rate": 0.00023372270671705313, "loss": 4.7216, "mean_token_accuracy": 0.23113974928855896, "num_tokens": 125337098.0, "step": 72250 }, { "entropy": 5.3828071594238285, "epoch": 5.621668936004668, "grad_norm": 1.2265625, "learning_rate": 0.00023369546182670044, "loss": 4.7227, "mean_token_accuracy": 0.2283797562122345, "num_tokens": 125344848.0, "step": 72255 }, { "entropy": 5.415948009490966, "epoch": 5.622057965376386, "grad_norm": 1.2890625, "learning_rate": 0.00023366821756307837, "loss": 4.7351, "mean_token_accuracy": 0.22856331318616868, "num_tokens": 125354057.0, "step": 72260 }, { "entropy": 5.488615942001343, "epoch": 5.6224469947481035, "grad_norm": 1.2578125, "learning_rate": 0.00023364097392660033, "loss": 4.8012, "mean_token_accuracy": 0.22498073875904084, "num_tokens": 125362245.0, "step": 72265 }, { "entropy": 5.425380802154541, "epoch": 5.622836024119821, "grad_norm": 1.265625, "learning_rate": 0.00023361373091767963, "loss": 4.66, "mean_token_accuracy": 0.2359096437692642, "num_tokens": 125371380.0, "step": 72270 }, { "entropy": 5.331160306930542, "epoch": 5.623225053491539, "grad_norm": 1.140625, "learning_rate": 0.0002335864885367297, "loss": 4.6421, "mean_token_accuracy": 0.24448014199733734, "num_tokens": 125380554.0, "step": 72275 }, { "entropy": 5.428044986724854, "epoch": 5.623614082863256, "grad_norm": 1.2578125, "learning_rate": 0.0002335592467841639, "loss": 4.7804, "mean_token_accuracy": 0.2330235332250595, "num_tokens": 125389612.0, "step": 72280 }, { "entropy": 5.381367826461792, "epoch": 5.624003112234973, "grad_norm": 1.3125, "learning_rate": 0.00023353200566039557, "loss": 4.701, "mean_token_accuracy": 0.2307939663529396, "num_tokens": 125397973.0, "step": 72285 }, { "entropy": 5.482031774520874, "epoch": 5.624392141606691, "grad_norm": 1.2578125, "learning_rate": 0.00023350476516583807, "loss": 4.8563, "mean_token_accuracy": 0.22164613008499146, "num_tokens": 125407380.0, "step": 72290 }, { "entropy": 5.3957549095153805, "epoch": 5.624781170978409, "grad_norm": 1.2890625, "learning_rate": 0.00023347752530090472, "loss": 4.6875, "mean_token_accuracy": 0.2306345134973526, "num_tokens": 125415917.0, "step": 72295 }, { "entropy": 5.411555814743042, "epoch": 5.6251702003501265, "grad_norm": 1.234375, "learning_rate": 0.0002334502860660088, "loss": 4.647, "mean_token_accuracy": 0.23868130296468734, "num_tokens": 125424942.0, "step": 72300 }, { "entropy": 5.38042049407959, "epoch": 5.625559229721844, "grad_norm": 1.1640625, "learning_rate": 0.00023342304746156367, "loss": 4.6393, "mean_token_accuracy": 0.23487719297409057, "num_tokens": 125434172.0, "step": 72305 }, { "entropy": 5.311665964126587, "epoch": 5.625948259093562, "grad_norm": 1.2265625, "learning_rate": 0.00023339580948798262, "loss": 4.6043, "mean_token_accuracy": 0.24396300166845322, "num_tokens": 125443509.0, "step": 72310 }, { "entropy": 5.409530258178711, "epoch": 5.62633728846528, "grad_norm": 1.1796875, "learning_rate": 0.00023336857214567897, "loss": 4.7282, "mean_token_accuracy": 0.22486346513032912, "num_tokens": 125452556.0, "step": 72315 }, { "entropy": 5.372827529907227, "epoch": 5.626726317836996, "grad_norm": 1.2421875, "learning_rate": 0.00023334133543506598, "loss": 4.6717, "mean_token_accuracy": 0.23830690532922744, "num_tokens": 125461466.0, "step": 72320 }, { "entropy": 5.462872886657715, "epoch": 5.627115347208714, "grad_norm": 1.3203125, "learning_rate": 0.0002333140993565569, "loss": 4.8534, "mean_token_accuracy": 0.22249109745025636, "num_tokens": 125469212.0, "step": 72325 }, { "entropy": 5.431930780410767, "epoch": 5.627504376580432, "grad_norm": 1.2890625, "learning_rate": 0.00023328686391056497, "loss": 4.6652, "mean_token_accuracy": 0.23590313494205475, "num_tokens": 125478099.0, "step": 72330 }, { "entropy": 5.554479122161865, "epoch": 5.6278934059521495, "grad_norm": 1.2265625, "learning_rate": 0.00023325962909750349, "loss": 4.85, "mean_token_accuracy": 0.22178691029548644, "num_tokens": 125486617.0, "step": 72335 }, { "entropy": 5.41433801651001, "epoch": 5.628282435323867, "grad_norm": 1.4375, "learning_rate": 0.00023323239491778564, "loss": 4.718, "mean_token_accuracy": 0.23739317804574966, "num_tokens": 125494323.0, "step": 72340 }, { "entropy": 5.420104598999023, "epoch": 5.628671464695585, "grad_norm": 1.2890625, "learning_rate": 0.00023320516137182484, "loss": 4.7562, "mean_token_accuracy": 0.2273334965109825, "num_tokens": 125502628.0, "step": 72345 }, { "entropy": 5.426651334762573, "epoch": 5.629060494067302, "grad_norm": 1.1640625, "learning_rate": 0.00023317792846003416, "loss": 4.7681, "mean_token_accuracy": 0.22136711776256562, "num_tokens": 125511697.0, "step": 72350 }, { "entropy": 5.4469069480896, "epoch": 5.629449523439019, "grad_norm": 1.1953125, "learning_rate": 0.00023315069618282686, "loss": 4.7847, "mean_token_accuracy": 0.2292821764945984, "num_tokens": 125520688.0, "step": 72355 }, { "entropy": 5.475170469284057, "epoch": 5.629838552810737, "grad_norm": 1.203125, "learning_rate": 0.0002331234645406161, "loss": 4.78, "mean_token_accuracy": 0.22754317671060562, "num_tokens": 125528972.0, "step": 72360 }, { "entropy": 5.431169891357422, "epoch": 5.630227582182455, "grad_norm": 1.2109375, "learning_rate": 0.00023309623353381516, "loss": 4.6969, "mean_token_accuracy": 0.23814399987459184, "num_tokens": 125536794.0, "step": 72365 }, { "entropy": 5.402341079711914, "epoch": 5.6306166115541725, "grad_norm": 1.21875, "learning_rate": 0.00023306900316283713, "loss": 4.79, "mean_token_accuracy": 0.22258255779743194, "num_tokens": 125546692.0, "step": 72370 }, { "entropy": 5.475697994232178, "epoch": 5.63100564092589, "grad_norm": 1.296875, "learning_rate": 0.0002330417734280953, "loss": 4.7344, "mean_token_accuracy": 0.22960766553878784, "num_tokens": 125555113.0, "step": 72375 }, { "entropy": 5.400759077072143, "epoch": 5.631394670297608, "grad_norm": 1.265625, "learning_rate": 0.00023301454433000268, "loss": 4.6594, "mean_token_accuracy": 0.2413504660129547, "num_tokens": 125563201.0, "step": 72380 }, { "entropy": 5.358392906188965, "epoch": 5.631783699669325, "grad_norm": 1.34375, "learning_rate": 0.0002329873158689726, "loss": 4.5569, "mean_token_accuracy": 0.24572102576494217, "num_tokens": 125570523.0, "step": 72385 }, { "entropy": 5.339574766159058, "epoch": 5.632172729041042, "grad_norm": 1.28125, "learning_rate": 0.00023296008804541812, "loss": 4.7489, "mean_token_accuracy": 0.2302490234375, "num_tokens": 125578553.0, "step": 72390 }, { "entropy": 5.410540580749512, "epoch": 5.63256175841276, "grad_norm": 1.1953125, "learning_rate": 0.0002329328608597524, "loss": 4.7398, "mean_token_accuracy": 0.23531377613544463, "num_tokens": 125587987.0, "step": 72395 }, { "entropy": 5.412122058868408, "epoch": 5.632950787784478, "grad_norm": 1.3671875, "learning_rate": 0.00023290563431238852, "loss": 4.7039, "mean_token_accuracy": 0.23779755234718322, "num_tokens": 125596187.0, "step": 72400 }, { "entropy": 5.470497417449951, "epoch": 5.6333398171561955, "grad_norm": 1.21875, "learning_rate": 0.0002328784084037397, "loss": 4.8376, "mean_token_accuracy": 0.21667806357145308, "num_tokens": 125604481.0, "step": 72405 }, { "entropy": 5.437833404541015, "epoch": 5.633728846527913, "grad_norm": 1.328125, "learning_rate": 0.00023285118313421887, "loss": 4.7203, "mean_token_accuracy": 0.2265430673956871, "num_tokens": 125612755.0, "step": 72410 }, { "entropy": 5.424828815460205, "epoch": 5.63411787589963, "grad_norm": 1.3671875, "learning_rate": 0.0002328239585042393, "loss": 4.702, "mean_token_accuracy": 0.24112111181020737, "num_tokens": 125621112.0, "step": 72415 }, { "entropy": 5.4787229061126705, "epoch": 5.634506905271348, "grad_norm": 1.2265625, "learning_rate": 0.00023279673451421406, "loss": 4.8012, "mean_token_accuracy": 0.22654237300157548, "num_tokens": 125630215.0, "step": 72420 }, { "entropy": 5.344723796844482, "epoch": 5.634895934643065, "grad_norm": 1.234375, "learning_rate": 0.00023276951116455626, "loss": 4.6849, "mean_token_accuracy": 0.23177414238452912, "num_tokens": 125639187.0, "step": 72425 }, { "entropy": 5.425217199325561, "epoch": 5.635284964014783, "grad_norm": 1.2265625, "learning_rate": 0.00023274228845567886, "loss": 4.7025, "mean_token_accuracy": 0.23032159805297853, "num_tokens": 125647663.0, "step": 72430 }, { "entropy": 5.421003580093384, "epoch": 5.635673993386501, "grad_norm": 1.28125, "learning_rate": 0.00023271506638799494, "loss": 4.7723, "mean_token_accuracy": 0.2195465698838234, "num_tokens": 125656184.0, "step": 72435 }, { "entropy": 5.346044111251831, "epoch": 5.6360630227582185, "grad_norm": 1.1796875, "learning_rate": 0.00023268784496191758, "loss": 4.6634, "mean_token_accuracy": 0.2411385342478752, "num_tokens": 125664668.0, "step": 72440 }, { "entropy": 5.394611978530884, "epoch": 5.636452052129936, "grad_norm": 1.34375, "learning_rate": 0.00023266062417785988, "loss": 4.6975, "mean_token_accuracy": 0.22927230298519136, "num_tokens": 125672466.0, "step": 72445 }, { "entropy": 5.426716470718384, "epoch": 5.636841081501654, "grad_norm": 1.328125, "learning_rate": 0.00023263340403623477, "loss": 4.7659, "mean_token_accuracy": 0.22525952905416488, "num_tokens": 125682352.0, "step": 72450 }, { "entropy": 5.4373414516448975, "epoch": 5.637230110873371, "grad_norm": 1.28125, "learning_rate": 0.0002326061845374553, "loss": 4.7033, "mean_token_accuracy": 0.2304536834359169, "num_tokens": 125691057.0, "step": 72455 }, { "entropy": 5.431629657745361, "epoch": 5.637619140245088, "grad_norm": 1.2890625, "learning_rate": 0.00023257896568193459, "loss": 4.7031, "mean_token_accuracy": 0.2360530525445938, "num_tokens": 125699792.0, "step": 72460 }, { "entropy": 5.419316959381104, "epoch": 5.638008169616806, "grad_norm": 1.375, "learning_rate": 0.0002325517474700855, "loss": 4.8048, "mean_token_accuracy": 0.2303388833999634, "num_tokens": 125709247.0, "step": 72465 }, { "entropy": 5.449718618392945, "epoch": 5.638397198988524, "grad_norm": 1.3671875, "learning_rate": 0.0002325245299023211, "loss": 4.7807, "mean_token_accuracy": 0.2269246682524681, "num_tokens": 125718574.0, "step": 72470 }, { "entropy": 5.410255813598633, "epoch": 5.6387862283602415, "grad_norm": 1.3515625, "learning_rate": 0.00023249731297905423, "loss": 4.7105, "mean_token_accuracy": 0.23775288164615632, "num_tokens": 125727379.0, "step": 72475 }, { "entropy": 5.483776330947876, "epoch": 5.639175257731958, "grad_norm": 1.2890625, "learning_rate": 0.00023247009670069812, "loss": 4.7771, "mean_token_accuracy": 0.22576013058423997, "num_tokens": 125735661.0, "step": 72480 }, { "entropy": 5.405849838256836, "epoch": 5.639564287103676, "grad_norm": 1.25, "learning_rate": 0.0002324428810676656, "loss": 4.7273, "mean_token_accuracy": 0.23246633261442184, "num_tokens": 125744178.0, "step": 72485 }, { "entropy": 5.375057649612427, "epoch": 5.639953316475394, "grad_norm": 1.2578125, "learning_rate": 0.00023241566608036957, "loss": 4.659, "mean_token_accuracy": 0.23629247695207595, "num_tokens": 125752212.0, "step": 72490 }, { "entropy": 5.375062274932861, "epoch": 5.640342345847111, "grad_norm": 1.203125, "learning_rate": 0.00023238845173922308, "loss": 4.6932, "mean_token_accuracy": 0.2352395996451378, "num_tokens": 125761012.0, "step": 72495 }, { "entropy": 5.405709838867187, "epoch": 5.640731375218829, "grad_norm": 1.21875, "learning_rate": 0.00023236123804463898, "loss": 4.71, "mean_token_accuracy": 0.23747551143169404, "num_tokens": 125770324.0, "step": 72500 }, { "entropy": 5.500503587722778, "epoch": 5.641120404590547, "grad_norm": 1.25, "learning_rate": 0.00023233402499703027, "loss": 4.7842, "mean_token_accuracy": 0.2330962300300598, "num_tokens": 125778607.0, "step": 72505 }, { "entropy": 5.359725427627564, "epoch": 5.6415094339622645, "grad_norm": 1.1171875, "learning_rate": 0.0002323068125968098, "loss": 4.6269, "mean_token_accuracy": 0.2376995399594307, "num_tokens": 125787647.0, "step": 72510 }, { "entropy": 5.387204837799072, "epoch": 5.641898463333982, "grad_norm": 1.2734375, "learning_rate": 0.0002322796008443905, "loss": 4.7016, "mean_token_accuracy": 0.2317735180258751, "num_tokens": 125796535.0, "step": 72515 }, { "entropy": 5.349104118347168, "epoch": 5.642287492705699, "grad_norm": 1.1796875, "learning_rate": 0.0002322523897401852, "loss": 4.6486, "mean_token_accuracy": 0.2381506845355034, "num_tokens": 125805373.0, "step": 72520 }, { "entropy": 5.405121517181397, "epoch": 5.642676522077417, "grad_norm": 1.3046875, "learning_rate": 0.00023222517928460685, "loss": 4.732, "mean_token_accuracy": 0.22640008628368377, "num_tokens": 125813680.0, "step": 72525 }, { "entropy": 5.405535316467285, "epoch": 5.643065551449134, "grad_norm": 1.3125, "learning_rate": 0.00023219796947806842, "loss": 4.736, "mean_token_accuracy": 0.23710206151008606, "num_tokens": 125822486.0, "step": 72530 }, { "entropy": 5.3523273944854735, "epoch": 5.643454580820852, "grad_norm": 1.25, "learning_rate": 0.00023217076032098255, "loss": 4.6572, "mean_token_accuracy": 0.23039786219596864, "num_tokens": 125831976.0, "step": 72535 }, { "entropy": 5.358572292327881, "epoch": 5.64384361019257, "grad_norm": 1.453125, "learning_rate": 0.00023214355181376222, "loss": 4.6865, "mean_token_accuracy": 0.23739436119794846, "num_tokens": 125840639.0, "step": 72540 }, { "entropy": 5.421099615097046, "epoch": 5.6442326395642874, "grad_norm": 1.28125, "learning_rate": 0.00023211634395682042, "loss": 4.7037, "mean_token_accuracy": 0.22991849780082702, "num_tokens": 125848967.0, "step": 72545 }, { "entropy": 5.3703697681427, "epoch": 5.644621668936004, "grad_norm": 1.1328125, "learning_rate": 0.00023208913675056976, "loss": 4.6884, "mean_token_accuracy": 0.23977784663438798, "num_tokens": 125858167.0, "step": 72550 }, { "entropy": 5.481612634658814, "epoch": 5.645010698307722, "grad_norm": 1.2734375, "learning_rate": 0.0002320619301954231, "loss": 4.7641, "mean_token_accuracy": 0.22612367272377015, "num_tokens": 125866928.0, "step": 72555 }, { "entropy": 5.400071907043457, "epoch": 5.64539972767944, "grad_norm": 1.2578125, "learning_rate": 0.0002320347242917934, "loss": 4.6739, "mean_token_accuracy": 0.240340693295002, "num_tokens": 125875675.0, "step": 72560 }, { "entropy": 5.454366445541382, "epoch": 5.645788757051157, "grad_norm": 1.21875, "learning_rate": 0.00023200751904009332, "loss": 4.7152, "mean_token_accuracy": 0.23141793608665467, "num_tokens": 125885200.0, "step": 72565 }, { "entropy": 5.437732601165772, "epoch": 5.646177786422875, "grad_norm": 1.2734375, "learning_rate": 0.00023198031444073575, "loss": 4.7599, "mean_token_accuracy": 0.23076641261577607, "num_tokens": 125893416.0, "step": 72570 }, { "entropy": 5.32085952758789, "epoch": 5.646566815794593, "grad_norm": 1.2734375, "learning_rate": 0.00023195311049413337, "loss": 4.6721, "mean_token_accuracy": 0.24063338935375214, "num_tokens": 125902023.0, "step": 72575 }, { "entropy": 5.442850542068482, "epoch": 5.64695584516631, "grad_norm": 1.3046875, "learning_rate": 0.00023192590720069907, "loss": 4.7399, "mean_token_accuracy": 0.23738535195589067, "num_tokens": 125910667.0, "step": 72580 }, { "entropy": 5.341724109649658, "epoch": 5.647344874538027, "grad_norm": 1.234375, "learning_rate": 0.00023189870456084561, "loss": 4.6416, "mean_token_accuracy": 0.23882248401641845, "num_tokens": 125919310.0, "step": 72585 }, { "entropy": 5.458663845062256, "epoch": 5.647733903909745, "grad_norm": 1.1875, "learning_rate": 0.00023187150257498567, "loss": 4.808, "mean_token_accuracy": 0.22109094262123108, "num_tokens": 125928437.0, "step": 72590 }, { "entropy": 5.447936105728149, "epoch": 5.648122933281463, "grad_norm": 1.234375, "learning_rate": 0.000231844301243532, "loss": 4.8006, "mean_token_accuracy": 0.22713441848754884, "num_tokens": 125937018.0, "step": 72595 }, { "entropy": 5.393181657791137, "epoch": 5.64851196265318, "grad_norm": 1.2421875, "learning_rate": 0.0002318171005668974, "loss": 4.6448, "mean_token_accuracy": 0.24214270412921907, "num_tokens": 125946816.0, "step": 72600 }, { "entropy": 5.358700513839722, "epoch": 5.648900992024898, "grad_norm": 1.296875, "learning_rate": 0.00023178990054549447, "loss": 4.6639, "mean_token_accuracy": 0.2298433244228363, "num_tokens": 125955554.0, "step": 72605 }, { "entropy": 5.410617160797119, "epoch": 5.649290021396616, "grad_norm": 1.328125, "learning_rate": 0.00023176270117973607, "loss": 4.7605, "mean_token_accuracy": 0.22394885569810868, "num_tokens": 125964506.0, "step": 72610 }, { "entropy": 5.457949829101563, "epoch": 5.6496790507683325, "grad_norm": 1.3046875, "learning_rate": 0.000231735502470035, "loss": 4.7822, "mean_token_accuracy": 0.22689732164144516, "num_tokens": 125972244.0, "step": 72615 }, { "entropy": 5.351337528228759, "epoch": 5.65006808014005, "grad_norm": 1.2421875, "learning_rate": 0.00023170830441680368, "loss": 4.6607, "mean_token_accuracy": 0.2354472503066063, "num_tokens": 125980671.0, "step": 72620 }, { "entropy": 5.356338310241699, "epoch": 5.650457109511768, "grad_norm": 1.1640625, "learning_rate": 0.00023168110702045496, "loss": 4.6429, "mean_token_accuracy": 0.23138432651758195, "num_tokens": 125989509.0, "step": 72625 }, { "entropy": 5.454546689987183, "epoch": 5.650846138883486, "grad_norm": 1.375, "learning_rate": 0.00023165391028140154, "loss": 4.8336, "mean_token_accuracy": 0.22842520773410796, "num_tokens": 125997315.0, "step": 72630 }, { "entropy": 5.351788330078125, "epoch": 5.651235168255203, "grad_norm": 1.4375, "learning_rate": 0.000231626714200056, "loss": 4.6172, "mean_token_accuracy": 0.24125102907419205, "num_tokens": 126005630.0, "step": 72635 }, { "entropy": 5.314880609512329, "epoch": 5.651624197626921, "grad_norm": 1.1796875, "learning_rate": 0.00023159951877683099, "loss": 4.5325, "mean_token_accuracy": 0.24736319929361344, "num_tokens": 126014256.0, "step": 72640 }, { "entropy": 5.318935108184815, "epoch": 5.652013226998639, "grad_norm": 1.234375, "learning_rate": 0.0002315723240121393, "loss": 4.6594, "mean_token_accuracy": 0.23997568488121032, "num_tokens": 126023259.0, "step": 72645 }, { "entropy": 5.363811874389649, "epoch": 5.652402256370356, "grad_norm": 1.328125, "learning_rate": 0.00023154512990639336, "loss": 4.6583, "mean_token_accuracy": 0.23529096841812133, "num_tokens": 126031327.0, "step": 72650 }, { "entropy": 5.375575017929077, "epoch": 5.652791285742073, "grad_norm": 1.3671875, "learning_rate": 0.00023151793646000602, "loss": 4.6631, "mean_token_accuracy": 0.23313061743974686, "num_tokens": 126039349.0, "step": 72655 }, { "entropy": 5.382173871994018, "epoch": 5.653180315113791, "grad_norm": 1.4140625, "learning_rate": 0.00023149074367338974, "loss": 4.6812, "mean_token_accuracy": 0.2276252254843712, "num_tokens": 126049358.0, "step": 72660 }, { "entropy": 5.4068522453308105, "epoch": 5.653569344485509, "grad_norm": 1.421875, "learning_rate": 0.0002314635515469572, "loss": 4.6605, "mean_token_accuracy": 0.23354194313287735, "num_tokens": 126057033.0, "step": 72665 }, { "entropy": 5.358712959289551, "epoch": 5.653958373857226, "grad_norm": 1.3203125, "learning_rate": 0.00023143636008112096, "loss": 4.6784, "mean_token_accuracy": 0.24706904739141464, "num_tokens": 126065690.0, "step": 72670 }, { "entropy": 5.433232021331787, "epoch": 5.654347403228944, "grad_norm": 1.2578125, "learning_rate": 0.00023140916927629352, "loss": 4.6879, "mean_token_accuracy": 0.23464627861976622, "num_tokens": 126073674.0, "step": 72675 }, { "entropy": 5.355509996414185, "epoch": 5.654736432600662, "grad_norm": 1.1953125, "learning_rate": 0.0002313819791328876, "loss": 4.6246, "mean_token_accuracy": 0.23583958446979522, "num_tokens": 126082280.0, "step": 72680 }, { "entropy": 5.448341321945191, "epoch": 5.6551254619723785, "grad_norm": 1.3046875, "learning_rate": 0.00023135478965131574, "loss": 4.8133, "mean_token_accuracy": 0.22511283904314042, "num_tokens": 126090524.0, "step": 72685 }, { "entropy": 5.357402992248535, "epoch": 5.655514491344096, "grad_norm": 1.2578125, "learning_rate": 0.0002313276008319905, "loss": 4.6872, "mean_token_accuracy": 0.24125647395849228, "num_tokens": 126099342.0, "step": 72690 }, { "entropy": 5.247012138366699, "epoch": 5.655903520715814, "grad_norm": 1.171875, "learning_rate": 0.00023130041267532443, "loss": 4.4909, "mean_token_accuracy": 0.24988892376422883, "num_tokens": 126107941.0, "step": 72695 }, { "entropy": 5.279316329956055, "epoch": 5.656292550087532, "grad_norm": 1.234375, "learning_rate": 0.00023127322518173, "loss": 4.5807, "mean_token_accuracy": 0.23865536898374556, "num_tokens": 126116408.0, "step": 72700 }, { "entropy": 5.400543689727783, "epoch": 5.656681579459249, "grad_norm": 1.140625, "learning_rate": 0.0002312460383516198, "loss": 4.7816, "mean_token_accuracy": 0.2230025351047516, "num_tokens": 126125611.0, "step": 72705 }, { "entropy": 5.410463428497314, "epoch": 5.657070608830967, "grad_norm": 1.25, "learning_rate": 0.00023121885218540627, "loss": 4.7119, "mean_token_accuracy": 0.23383795022964476, "num_tokens": 126133985.0, "step": 72710 }, { "entropy": 5.400418615341186, "epoch": 5.657459638202685, "grad_norm": 1.3125, "learning_rate": 0.00023119166668350205, "loss": 4.679, "mean_token_accuracy": 0.2326354369521141, "num_tokens": 126141943.0, "step": 72715 }, { "entropy": 5.361264371871949, "epoch": 5.6578486675744015, "grad_norm": 1.203125, "learning_rate": 0.0002311644818463195, "loss": 4.7609, "mean_token_accuracy": 0.23643314391374587, "num_tokens": 126150897.0, "step": 72720 }, { "entropy": 5.434242391586304, "epoch": 5.658237696946119, "grad_norm": 1.2421875, "learning_rate": 0.0002311372976742712, "loss": 4.6948, "mean_token_accuracy": 0.238344307243824, "num_tokens": 126159665.0, "step": 72725 }, { "entropy": 5.378707695007324, "epoch": 5.658626726317837, "grad_norm": 1.1875, "learning_rate": 0.0002311101141677696, "loss": 4.6838, "mean_token_accuracy": 0.2381883829832077, "num_tokens": 126169695.0, "step": 72730 }, { "entropy": 5.371230411529541, "epoch": 5.659015755689555, "grad_norm": 1.4140625, "learning_rate": 0.00023108293132722714, "loss": 4.7341, "mean_token_accuracy": 0.23118516206741332, "num_tokens": 126178285.0, "step": 72735 }, { "entropy": 5.4683599948883055, "epoch": 5.659404785061272, "grad_norm": 1.2109375, "learning_rate": 0.00023105574915305627, "loss": 4.7999, "mean_token_accuracy": 0.22866797894239427, "num_tokens": 126186386.0, "step": 72740 }, { "entropy": 5.488535594940186, "epoch": 5.65979381443299, "grad_norm": 1.2265625, "learning_rate": 0.0002310285676456695, "loss": 4.829, "mean_token_accuracy": 0.22845159024000167, "num_tokens": 126194957.0, "step": 72745 }, { "entropy": 5.4724440574646, "epoch": 5.660182843804707, "grad_norm": 1.25, "learning_rate": 0.00023100138680547921, "loss": 4.773, "mean_token_accuracy": 0.22741208225488663, "num_tokens": 126204561.0, "step": 72750 }, { "entropy": 5.408730411529541, "epoch": 5.6605718731764245, "grad_norm": 1.34375, "learning_rate": 0.00023097420663289786, "loss": 4.6883, "mean_token_accuracy": 0.2338494598865509, "num_tokens": 126212347.0, "step": 72755 }, { "entropy": 5.371700954437256, "epoch": 5.660960902548142, "grad_norm": 1.2421875, "learning_rate": 0.00023094702712833786, "loss": 4.6756, "mean_token_accuracy": 0.2347867399454117, "num_tokens": 126221043.0, "step": 72760 }, { "entropy": 5.462869310379029, "epoch": 5.66134993191986, "grad_norm": 1.3671875, "learning_rate": 0.00023091984829221157, "loss": 4.7574, "mean_token_accuracy": 0.22716951221227646, "num_tokens": 126229428.0, "step": 72765 }, { "entropy": 5.4716941833496096, "epoch": 5.661738961291578, "grad_norm": 1.140625, "learning_rate": 0.00023089267012493141, "loss": 4.7794, "mean_token_accuracy": 0.22727224230766296, "num_tokens": 126238398.0, "step": 72770 }, { "entropy": 5.408424425125122, "epoch": 5.662127990663295, "grad_norm": 1.265625, "learning_rate": 0.00023086549262690993, "loss": 4.666, "mean_token_accuracy": 0.23357924520969392, "num_tokens": 126246617.0, "step": 72775 }, { "entropy": 5.360152292251587, "epoch": 5.662517020035013, "grad_norm": 1.234375, "learning_rate": 0.00023083831579855918, "loss": 4.6787, "mean_token_accuracy": 0.23525431752204895, "num_tokens": 126255473.0, "step": 72780 }, { "entropy": 5.390235805511475, "epoch": 5.662906049406731, "grad_norm": 1.28125, "learning_rate": 0.00023081113964029177, "loss": 4.7142, "mean_token_accuracy": 0.23409533351659775, "num_tokens": 126263789.0, "step": 72785 }, { "entropy": 5.431692218780517, "epoch": 5.6632950787784475, "grad_norm": 1.296875, "learning_rate": 0.00023078396415251995, "loss": 4.8308, "mean_token_accuracy": 0.22908511012792587, "num_tokens": 126272981.0, "step": 72790 }, { "entropy": 5.387952136993408, "epoch": 5.663684108150165, "grad_norm": 1.3046875, "learning_rate": 0.00023075678933565615, "loss": 4.6926, "mean_token_accuracy": 0.2355685606598854, "num_tokens": 126281553.0, "step": 72795 }, { "entropy": 5.394940137863159, "epoch": 5.664073137521883, "grad_norm": 1.3125, "learning_rate": 0.0002307296151901126, "loss": 4.6685, "mean_token_accuracy": 0.23252781182527543, "num_tokens": 126289825.0, "step": 72800 }, { "entropy": 5.309852504730225, "epoch": 5.664462166893601, "grad_norm": 1.28125, "learning_rate": 0.0002307024417163016, "loss": 4.6256, "mean_token_accuracy": 0.23973995745182036, "num_tokens": 126298415.0, "step": 72805 }, { "entropy": 5.38768253326416, "epoch": 5.664851196265318, "grad_norm": 1.25, "learning_rate": 0.00023067526891463563, "loss": 4.6713, "mean_token_accuracy": 0.23421543836593628, "num_tokens": 126306938.0, "step": 72810 }, { "entropy": 5.445178556442261, "epoch": 5.665240225637035, "grad_norm": 1.3203125, "learning_rate": 0.0002306480967855269, "loss": 4.8115, "mean_token_accuracy": 0.22096768170595169, "num_tokens": 126315578.0, "step": 72815 }, { "entropy": 5.393955659866333, "epoch": 5.665629255008753, "grad_norm": 1.265625, "learning_rate": 0.00023062092532938772, "loss": 4.7068, "mean_token_accuracy": 0.2346803814172745, "num_tokens": 126324688.0, "step": 72820 }, { "entropy": 5.482540845870972, "epoch": 5.6660182843804705, "grad_norm": 1.2421875, "learning_rate": 0.00023059375454663033, "loss": 4.7666, "mean_token_accuracy": 0.22929286658763887, "num_tokens": 126332848.0, "step": 72825 }, { "entropy": 5.393543767929077, "epoch": 5.666407313752188, "grad_norm": 1.21875, "learning_rate": 0.0002305665844376671, "loss": 4.6586, "mean_token_accuracy": 0.24205812215805053, "num_tokens": 126342039.0, "step": 72830 }, { "entropy": 5.418577337265015, "epoch": 5.666796343123906, "grad_norm": 1.265625, "learning_rate": 0.00023053941500291014, "loss": 4.7118, "mean_token_accuracy": 0.22892982214689256, "num_tokens": 126350471.0, "step": 72835 }, { "entropy": 5.432271480560303, "epoch": 5.667185372495624, "grad_norm": 1.3515625, "learning_rate": 0.00023051224624277185, "loss": 4.7197, "mean_token_accuracy": 0.2281401723623276, "num_tokens": 126359277.0, "step": 72840 }, { "entropy": 5.292291498184204, "epoch": 5.667574401867341, "grad_norm": 1.28125, "learning_rate": 0.0002304850781576644, "loss": 4.5603, "mean_token_accuracy": 0.2403411567211151, "num_tokens": 126367198.0, "step": 72845 }, { "entropy": 5.375256776809692, "epoch": 5.667963431239059, "grad_norm": 1.265625, "learning_rate": 0.00023045791074800004, "loss": 4.6998, "mean_token_accuracy": 0.23899523466825484, "num_tokens": 126375442.0, "step": 72850 }, { "entropy": 5.395594787597656, "epoch": 5.668352460610776, "grad_norm": 1.2421875, "learning_rate": 0.000230430744014191, "loss": 4.7256, "mean_token_accuracy": 0.2299175128340721, "num_tokens": 126383591.0, "step": 72855 }, { "entropy": 5.425896406173706, "epoch": 5.6687414899824935, "grad_norm": 1.28125, "learning_rate": 0.00023040357795664945, "loss": 4.7123, "mean_token_accuracy": 0.23457378000020981, "num_tokens": 126392090.0, "step": 72860 }, { "entropy": 5.4521399974823, "epoch": 5.669130519354211, "grad_norm": 1.3046875, "learning_rate": 0.00023037641257578768, "loss": 4.7886, "mean_token_accuracy": 0.22863523215055465, "num_tokens": 126400562.0, "step": 72865 }, { "entropy": 5.448321151733398, "epoch": 5.669519548725929, "grad_norm": 1.28125, "learning_rate": 0.00023034924787201778, "loss": 4.7178, "mean_token_accuracy": 0.23340074867010116, "num_tokens": 126408925.0, "step": 72870 }, { "entropy": 5.454074907302856, "epoch": 5.669908578097647, "grad_norm": 1.1953125, "learning_rate": 0.00023032208384575188, "loss": 4.7758, "mean_token_accuracy": 0.21978185921907425, "num_tokens": 126417662.0, "step": 72875 }, { "entropy": 5.406777954101562, "epoch": 5.670297607469364, "grad_norm": 1.328125, "learning_rate": 0.00023029492049740232, "loss": 4.6676, "mean_token_accuracy": 0.24047560393810272, "num_tokens": 126426513.0, "step": 72880 }, { "entropy": 5.386661005020142, "epoch": 5.670686636841081, "grad_norm": 1.3203125, "learning_rate": 0.00023026775782738123, "loss": 4.6557, "mean_token_accuracy": 0.23544493764638902, "num_tokens": 126435161.0, "step": 72885 }, { "entropy": 5.446522188186646, "epoch": 5.671075666212799, "grad_norm": 1.2890625, "learning_rate": 0.0002302405958361007, "loss": 4.7285, "mean_token_accuracy": 0.2313833862543106, "num_tokens": 126443051.0, "step": 72890 }, { "entropy": 5.4804431915283205, "epoch": 5.6714646955845165, "grad_norm": 1.328125, "learning_rate": 0.00023021343452397287, "loss": 4.8317, "mean_token_accuracy": 0.21914747655391692, "num_tokens": 126451764.0, "step": 72895 }, { "entropy": 5.504642486572266, "epoch": 5.671853724956234, "grad_norm": 1.3359375, "learning_rate": 0.00023018627389140989, "loss": 4.7712, "mean_token_accuracy": 0.22312382757663726, "num_tokens": 126460168.0, "step": 72900 }, { "entropy": 5.40142297744751, "epoch": 5.672242754327952, "grad_norm": 1.3203125, "learning_rate": 0.0002301591139388239, "loss": 4.7312, "mean_token_accuracy": 0.23557184189558028, "num_tokens": 126469867.0, "step": 72905 }, { "entropy": 5.3769838333129885, "epoch": 5.67263178369967, "grad_norm": 1.2421875, "learning_rate": 0.00023013195466662696, "loss": 4.6151, "mean_token_accuracy": 0.24287677854299544, "num_tokens": 126478668.0, "step": 72910 }, { "entropy": 5.444123983383179, "epoch": 5.673020813071387, "grad_norm": 1.234375, "learning_rate": 0.00023010479607523123, "loss": 4.7646, "mean_token_accuracy": 0.22491187751293182, "num_tokens": 126488247.0, "step": 72915 }, { "entropy": 5.326867771148682, "epoch": 5.673409842443104, "grad_norm": 1.1953125, "learning_rate": 0.00023007763816504866, "loss": 4.6005, "mean_token_accuracy": 0.2393566220998764, "num_tokens": 126497907.0, "step": 72920 }, { "entropy": 5.309686756134033, "epoch": 5.673798871814822, "grad_norm": 1.2890625, "learning_rate": 0.00023005048093649157, "loss": 4.5642, "mean_token_accuracy": 0.2420080006122589, "num_tokens": 126506482.0, "step": 72925 }, { "entropy": 5.378862810134888, "epoch": 5.6741879011865395, "grad_norm": 1.2421875, "learning_rate": 0.00023002332438997174, "loss": 4.7005, "mean_token_accuracy": 0.2350958377122879, "num_tokens": 126515312.0, "step": 72930 }, { "entropy": 5.415233373641968, "epoch": 5.674576930558257, "grad_norm": 1.3203125, "learning_rate": 0.00022999616852590148, "loss": 4.7374, "mean_token_accuracy": 0.2279706656932831, "num_tokens": 126522980.0, "step": 72935 }, { "entropy": 5.427444267272949, "epoch": 5.674965959929975, "grad_norm": 1.203125, "learning_rate": 0.00022996901334469268, "loss": 4.7982, "mean_token_accuracy": 0.23050489872694016, "num_tokens": 126531721.0, "step": 72940 }, { "entropy": 5.4019331455230715, "epoch": 5.675354989301693, "grad_norm": 1.1640625, "learning_rate": 0.00022994185884675738, "loss": 4.737, "mean_token_accuracy": 0.23016547858715058, "num_tokens": 126540433.0, "step": 72945 }, { "entropy": 5.46684160232544, "epoch": 5.675744018673409, "grad_norm": 1.2734375, "learning_rate": 0.00022991470503250778, "loss": 4.7524, "mean_token_accuracy": 0.235315765440464, "num_tokens": 126549520.0, "step": 72950 }, { "entropy": 5.483026027679443, "epoch": 5.676133048045127, "grad_norm": 1.2578125, "learning_rate": 0.00022988755190235573, "loss": 4.8103, "mean_token_accuracy": 0.22309497892856597, "num_tokens": 126558559.0, "step": 72955 }, { "entropy": 5.461029529571533, "epoch": 5.676522077416845, "grad_norm": 1.328125, "learning_rate": 0.00022986039945671323, "loss": 4.7332, "mean_token_accuracy": 0.22894856929779053, "num_tokens": 126567675.0, "step": 72960 }, { "entropy": 5.444576930999756, "epoch": 5.6769111067885625, "grad_norm": 1.1796875, "learning_rate": 0.00022983324769599239, "loss": 4.6636, "mean_token_accuracy": 0.23762525469064713, "num_tokens": 126576154.0, "step": 72965 }, { "entropy": 5.499536657333374, "epoch": 5.67730013616028, "grad_norm": 1.265625, "learning_rate": 0.0002298060966206051, "loss": 4.8263, "mean_token_accuracy": 0.22560214400291442, "num_tokens": 126585042.0, "step": 72970 }, { "entropy": 5.388808107376098, "epoch": 5.677689165531998, "grad_norm": 1.234375, "learning_rate": 0.00022977894623096336, "loss": 4.7062, "mean_token_accuracy": 0.23710624277591705, "num_tokens": 126594334.0, "step": 72975 }, { "entropy": 5.503040838241577, "epoch": 5.678078194903716, "grad_norm": 1.328125, "learning_rate": 0.00022975179652747908, "loss": 4.7589, "mean_token_accuracy": 0.2315505936741829, "num_tokens": 126602139.0, "step": 72980 }, { "entropy": 5.529133272171021, "epoch": 5.678467224275433, "grad_norm": 1.2890625, "learning_rate": 0.00022972464751056432, "loss": 4.8763, "mean_token_accuracy": 0.2189146801829338, "num_tokens": 126610164.0, "step": 72985 }, { "entropy": 5.4394598484039305, "epoch": 5.67885625364715, "grad_norm": 1.296875, "learning_rate": 0.00022969749918063092, "loss": 4.7649, "mean_token_accuracy": 0.22823501974344254, "num_tokens": 126619075.0, "step": 72990 }, { "entropy": 5.390476846694947, "epoch": 5.679245283018868, "grad_norm": 1.34375, "learning_rate": 0.00022967035153809097, "loss": 4.71, "mean_token_accuracy": 0.2352984994649887, "num_tokens": 126627124.0, "step": 72995 }, { "entropy": 5.450757694244385, "epoch": 5.6796343123905855, "grad_norm": 1.234375, "learning_rate": 0.0002296432045833562, "loss": 4.7729, "mean_token_accuracy": 0.23114334046840668, "num_tokens": 126636476.0, "step": 73000 }, { "entropy": 5.511966419219971, "epoch": 5.680023341762303, "grad_norm": 1.1875, "learning_rate": 0.00022961605831683856, "loss": 4.8022, "mean_token_accuracy": 0.22343357503414155, "num_tokens": 126644542.0, "step": 73005 }, { "entropy": 5.403992462158203, "epoch": 5.680412371134021, "grad_norm": 1.1953125, "learning_rate": 0.00022958891273895004, "loss": 4.6306, "mean_token_accuracy": 0.2356755778193474, "num_tokens": 126652828.0, "step": 73010 }, { "entropy": 5.375300455093384, "epoch": 5.680801400505739, "grad_norm": 1.28125, "learning_rate": 0.00022956176785010252, "loss": 4.6481, "mean_token_accuracy": 0.24217975586652757, "num_tokens": 126660941.0, "step": 73015 }, { "entropy": 5.430912971496582, "epoch": 5.681190429877455, "grad_norm": 1.2421875, "learning_rate": 0.0002295346236507079, "loss": 4.725, "mean_token_accuracy": 0.2348072946071625, "num_tokens": 126670171.0, "step": 73020 }, { "entropy": 5.367882251739502, "epoch": 5.681579459249173, "grad_norm": 1.28125, "learning_rate": 0.0002295074801411779, "loss": 4.6681, "mean_token_accuracy": 0.2383909523487091, "num_tokens": 126678845.0, "step": 73025 }, { "entropy": 5.351116514205932, "epoch": 5.681968488620891, "grad_norm": 1.296875, "learning_rate": 0.00022948033732192452, "loss": 4.5805, "mean_token_accuracy": 0.23803758919239043, "num_tokens": 126686977.0, "step": 73030 }, { "entropy": 5.389431190490723, "epoch": 5.6823575179926085, "grad_norm": 1.3828125, "learning_rate": 0.00022945319519335962, "loss": 4.6817, "mean_token_accuracy": 0.23209336698055266, "num_tokens": 126695411.0, "step": 73035 }, { "entropy": 5.319335651397705, "epoch": 5.682746547364326, "grad_norm": 1.2421875, "learning_rate": 0.0002294260537558949, "loss": 4.6514, "mean_token_accuracy": 0.23948210179805757, "num_tokens": 126704530.0, "step": 73040 }, { "entropy": 5.362835693359375, "epoch": 5.683135576736044, "grad_norm": 1.328125, "learning_rate": 0.00022939891300994238, "loss": 4.6582, "mean_token_accuracy": 0.23780689835548402, "num_tokens": 126713027.0, "step": 73045 }, { "entropy": 5.420645761489868, "epoch": 5.683524606107762, "grad_norm": 1.359375, "learning_rate": 0.0002293717729559137, "loss": 4.7901, "mean_token_accuracy": 0.22488992363214494, "num_tokens": 126721718.0, "step": 73050 }, { "entropy": 5.449434232711792, "epoch": 5.683913635479478, "grad_norm": 1.203125, "learning_rate": 0.00022934463359422074, "loss": 4.7385, "mean_token_accuracy": 0.22876913249492645, "num_tokens": 126729658.0, "step": 73055 }, { "entropy": 5.4059131145477295, "epoch": 5.684302664851196, "grad_norm": 1.25, "learning_rate": 0.0002293174949252753, "loss": 4.6854, "mean_token_accuracy": 0.2340743750333786, "num_tokens": 126737936.0, "step": 73060 }, { "entropy": 5.372838687896729, "epoch": 5.684691694222914, "grad_norm": 1.21875, "learning_rate": 0.0002292903569494892, "loss": 4.7, "mean_token_accuracy": 0.2338390365242958, "num_tokens": 126746544.0, "step": 73065 }, { "entropy": 5.361047887802124, "epoch": 5.6850807235946315, "grad_norm": 1.3125, "learning_rate": 0.00022926321966727404, "loss": 4.6462, "mean_token_accuracy": 0.2376161888241768, "num_tokens": 126755627.0, "step": 73070 }, { "entropy": 5.385217809677124, "epoch": 5.685469752966349, "grad_norm": 1.3515625, "learning_rate": 0.00022923608307904192, "loss": 4.6316, "mean_token_accuracy": 0.2429195985198021, "num_tokens": 126763751.0, "step": 73075 }, { "entropy": 5.403415536880493, "epoch": 5.685858782338067, "grad_norm": 1.3203125, "learning_rate": 0.0002292089471852043, "loss": 4.7381, "mean_token_accuracy": 0.23219627588987352, "num_tokens": 126771959.0, "step": 73080 }, { "entropy": 5.367689371109009, "epoch": 5.686247811709784, "grad_norm": 1.2734375, "learning_rate": 0.00022918181198617306, "loss": 4.6621, "mean_token_accuracy": 0.2419017106294632, "num_tokens": 126779354.0, "step": 73085 }, { "entropy": 5.393605089187622, "epoch": 5.686636841081501, "grad_norm": 1.1796875, "learning_rate": 0.00022915467748235984, "loss": 4.734, "mean_token_accuracy": 0.23124941140413285, "num_tokens": 126787812.0, "step": 73090 }, { "entropy": 5.423824119567871, "epoch": 5.687025870453219, "grad_norm": 1.1875, "learning_rate": 0.00022912754367417648, "loss": 4.7312, "mean_token_accuracy": 0.23051079362630844, "num_tokens": 126795919.0, "step": 73095 }, { "entropy": 5.406348657608032, "epoch": 5.687414899824937, "grad_norm": 1.2734375, "learning_rate": 0.00022910041056203458, "loss": 4.7427, "mean_token_accuracy": 0.24181899875402452, "num_tokens": 126804328.0, "step": 73100 }, { "entropy": 5.359303998947143, "epoch": 5.6878039291966545, "grad_norm": 1.2421875, "learning_rate": 0.00022907327814634593, "loss": 4.7343, "mean_token_accuracy": 0.22814283967018129, "num_tokens": 126812591.0, "step": 73105 }, { "entropy": 5.352538824081421, "epoch": 5.688192958568372, "grad_norm": 1.234375, "learning_rate": 0.00022904614642752218, "loss": 4.7082, "mean_token_accuracy": 0.2286165550351143, "num_tokens": 126821783.0, "step": 73110 }, { "entropy": 5.511131381988525, "epoch": 5.68858198794009, "grad_norm": 1.296875, "learning_rate": 0.00022901901540597498, "loss": 4.7904, "mean_token_accuracy": 0.22671881020069123, "num_tokens": 126830199.0, "step": 73115 }, { "entropy": 5.464781188964844, "epoch": 5.688971017311807, "grad_norm": 1.3046875, "learning_rate": 0.0002289918850821161, "loss": 4.7319, "mean_token_accuracy": 0.2273805946111679, "num_tokens": 126838971.0, "step": 73120 }, { "entropy": 5.414956092834473, "epoch": 5.689360046683524, "grad_norm": 1.328125, "learning_rate": 0.00022896475545635704, "loss": 4.6539, "mean_token_accuracy": 0.2305045709013939, "num_tokens": 126847240.0, "step": 73125 }, { "entropy": 5.420384216308594, "epoch": 5.689749076055242, "grad_norm": 1.1796875, "learning_rate": 0.00022893762652910965, "loss": 4.7635, "mean_token_accuracy": 0.2282832846045494, "num_tokens": 126856447.0, "step": 73130 }, { "entropy": 5.366698122024536, "epoch": 5.69013810542696, "grad_norm": 1.21875, "learning_rate": 0.00022891049830078543, "loss": 4.6769, "mean_token_accuracy": 0.23292567878961562, "num_tokens": 126865486.0, "step": 73135 }, { "entropy": 5.4012562274932865, "epoch": 5.6905271347986774, "grad_norm": 1.140625, "learning_rate": 0.00022888337077179595, "loss": 4.6931, "mean_token_accuracy": 0.22868673652410507, "num_tokens": 126874432.0, "step": 73140 }, { "entropy": 5.486894655227661, "epoch": 5.690916164170395, "grad_norm": 1.171875, "learning_rate": 0.00022885624394255294, "loss": 4.857, "mean_token_accuracy": 0.21694085448980333, "num_tokens": 126883247.0, "step": 73145 }, { "entropy": 5.460770082473755, "epoch": 5.691305193542112, "grad_norm": 1.265625, "learning_rate": 0.00022882911781346805, "loss": 4.7567, "mean_token_accuracy": 0.22933626621961595, "num_tokens": 126892060.0, "step": 73150 }, { "entropy": 5.52426815032959, "epoch": 5.69169422291383, "grad_norm": 1.2109375, "learning_rate": 0.0002288019923849528, "loss": 4.8092, "mean_token_accuracy": 0.2238599732518196, "num_tokens": 126900960.0, "step": 73155 }, { "entropy": 5.479573011398315, "epoch": 5.692083252285547, "grad_norm": 1.2109375, "learning_rate": 0.0002287748676574188, "loss": 4.8221, "mean_token_accuracy": 0.2262978732585907, "num_tokens": 126911093.0, "step": 73160 }, { "entropy": 5.416458797454834, "epoch": 5.692472281657265, "grad_norm": 1.28125, "learning_rate": 0.0002287477436312776, "loss": 4.7217, "mean_token_accuracy": 0.22899159938097, "num_tokens": 126920017.0, "step": 73165 }, { "entropy": 5.459509468078613, "epoch": 5.692861311028983, "grad_norm": 1.296875, "learning_rate": 0.00022872062030694073, "loss": 4.8072, "mean_token_accuracy": 0.22413868457078934, "num_tokens": 126928272.0, "step": 73170 }, { "entropy": 5.423401021957398, "epoch": 5.6932503404007, "grad_norm": 1.2421875, "learning_rate": 0.0002286934976848198, "loss": 4.7231, "mean_token_accuracy": 0.2434844881296158, "num_tokens": 126937205.0, "step": 73175 }, { "entropy": 5.384331798553466, "epoch": 5.693639369772418, "grad_norm": 1.25, "learning_rate": 0.00022866637576532633, "loss": 4.6617, "mean_token_accuracy": 0.22852024734020232, "num_tokens": 126945865.0, "step": 73180 }, { "entropy": 5.332643795013428, "epoch": 5.694028399144136, "grad_norm": 1.34375, "learning_rate": 0.0002286392545488719, "loss": 4.6912, "mean_token_accuracy": 0.22895937114953996, "num_tokens": 126954432.0, "step": 73185 }, { "entropy": 5.409226799011231, "epoch": 5.694417428515853, "grad_norm": 1.171875, "learning_rate": 0.00022861213403586802, "loss": 4.7124, "mean_token_accuracy": 0.23355409055948256, "num_tokens": 126962989.0, "step": 73190 }, { "entropy": 5.418423843383789, "epoch": 5.69480645788757, "grad_norm": 1.25, "learning_rate": 0.00022858501422672606, "loss": 4.688, "mean_token_accuracy": 0.23599325716495514, "num_tokens": 126970994.0, "step": 73195 }, { "entropy": 5.367571878433227, "epoch": 5.695195487259288, "grad_norm": 1.296875, "learning_rate": 0.0002285578951218577, "loss": 4.7471, "mean_token_accuracy": 0.23247490972280502, "num_tokens": 126979387.0, "step": 73200 }, { "entropy": 5.411379146575928, "epoch": 5.695584516631006, "grad_norm": 1.1796875, "learning_rate": 0.00022853077672167432, "loss": 4.7435, "mean_token_accuracy": 0.22461799532175064, "num_tokens": 126988317.0, "step": 73205 }, { "entropy": 5.403444147109985, "epoch": 5.695973546002723, "grad_norm": 1.203125, "learning_rate": 0.0002285036590265875, "loss": 4.7101, "mean_token_accuracy": 0.23746386617422105, "num_tokens": 126997172.0, "step": 73210 }, { "entropy": 5.4229989528656, "epoch": 5.696362575374441, "grad_norm": 1.2578125, "learning_rate": 0.00022847654203700857, "loss": 4.7028, "mean_token_accuracy": 0.23142081499099731, "num_tokens": 127006251.0, "step": 73215 }, { "entropy": 5.401953268051147, "epoch": 5.696751604746158, "grad_norm": 1.2421875, "learning_rate": 0.00022844942575334914, "loss": 4.6555, "mean_token_accuracy": 0.23450588881969453, "num_tokens": 127014471.0, "step": 73220 }, { "entropy": 5.478708744049072, "epoch": 5.697140634117876, "grad_norm": 1.2578125, "learning_rate": 0.00022842231017602055, "loss": 4.8084, "mean_token_accuracy": 0.22336014956235886, "num_tokens": 127023987.0, "step": 73225 }, { "entropy": 5.547585725784302, "epoch": 5.697529663489593, "grad_norm": 1.296875, "learning_rate": 0.00022839519530543423, "loss": 4.9336, "mean_token_accuracy": 0.2143992677330971, "num_tokens": 127033287.0, "step": 73230 }, { "entropy": 5.4086614608764645, "epoch": 5.697918692861311, "grad_norm": 1.296875, "learning_rate": 0.0002283680811420017, "loss": 4.6685, "mean_token_accuracy": 0.24128328263759613, "num_tokens": 127042074.0, "step": 73235 }, { "entropy": 5.373089456558228, "epoch": 5.698307722233029, "grad_norm": 1.296875, "learning_rate": 0.00022834096768613437, "loss": 4.6077, "mean_token_accuracy": 0.2423490032553673, "num_tokens": 127049852.0, "step": 73240 }, { "entropy": 5.35197491645813, "epoch": 5.698696751604746, "grad_norm": 1.171875, "learning_rate": 0.00022831385493824353, "loss": 4.7068, "mean_token_accuracy": 0.235366028547287, "num_tokens": 127058812.0, "step": 73245 }, { "entropy": 5.35046763420105, "epoch": 5.699085780976464, "grad_norm": 1.1796875, "learning_rate": 0.00022828674289874064, "loss": 4.6346, "mean_token_accuracy": 0.23686148822307587, "num_tokens": 127067657.0, "step": 73250 }, { "entropy": 5.40112829208374, "epoch": 5.699474810348181, "grad_norm": 1.234375, "learning_rate": 0.00022825963156803704, "loss": 4.677, "mean_token_accuracy": 0.23847858607769012, "num_tokens": 127075779.0, "step": 73255 }, { "entropy": 5.340543603897094, "epoch": 5.699863839719899, "grad_norm": 1.2421875, "learning_rate": 0.00022823252094654413, "loss": 4.6522, "mean_token_accuracy": 0.23514725863933564, "num_tokens": 127084384.0, "step": 73260 }, { "entropy": 5.371319961547852, "epoch": 5.700252869091616, "grad_norm": 1.234375, "learning_rate": 0.0002282054110346733, "loss": 4.6637, "mean_token_accuracy": 0.2378919690847397, "num_tokens": 127092686.0, "step": 73265 }, { "entropy": 5.445283651351929, "epoch": 5.700641898463334, "grad_norm": 1.3125, "learning_rate": 0.00022817830183283582, "loss": 4.7717, "mean_token_accuracy": 0.2296251967549324, "num_tokens": 127100588.0, "step": 73270 }, { "entropy": 5.365663385391235, "epoch": 5.701030927835052, "grad_norm": 1.2421875, "learning_rate": 0.00022815119334144312, "loss": 4.6646, "mean_token_accuracy": 0.23461905866861343, "num_tokens": 127109474.0, "step": 73275 }, { "entropy": 5.416236734390258, "epoch": 5.701419957206769, "grad_norm": 1.203125, "learning_rate": 0.00022812408556090657, "loss": 4.6703, "mean_token_accuracy": 0.23859499543905258, "num_tokens": 127118166.0, "step": 73280 }, { "entropy": 5.41538553237915, "epoch": 5.701808986578486, "grad_norm": 1.1953125, "learning_rate": 0.00022809697849163736, "loss": 4.7229, "mean_token_accuracy": 0.23413300961256028, "num_tokens": 127127060.0, "step": 73285 }, { "entropy": 5.318397331237793, "epoch": 5.702198015950204, "grad_norm": 1.2421875, "learning_rate": 0.00022806987213404685, "loss": 4.6117, "mean_token_accuracy": 0.23752814084291457, "num_tokens": 127135030.0, "step": 73290 }, { "entropy": 5.384644079208374, "epoch": 5.702587045321922, "grad_norm": 1.3203125, "learning_rate": 0.00022804276648854632, "loss": 4.7284, "mean_token_accuracy": 0.23244843780994415, "num_tokens": 127142872.0, "step": 73295 }, { "entropy": 5.399064397811889, "epoch": 5.702976074693639, "grad_norm": 1.34375, "learning_rate": 0.00022801566155554708, "loss": 4.6652, "mean_token_accuracy": 0.2374661907553673, "num_tokens": 127151242.0, "step": 73300 }, { "entropy": 5.433575248718261, "epoch": 5.703365104065357, "grad_norm": 1.203125, "learning_rate": 0.00022798855733546038, "loss": 4.7523, "mean_token_accuracy": 0.22547928988933563, "num_tokens": 127160168.0, "step": 73305 }, { "entropy": 5.457707786560059, "epoch": 5.703754133437075, "grad_norm": 1.3515625, "learning_rate": 0.0002279614538286975, "loss": 4.7997, "mean_token_accuracy": 0.2203005760908127, "num_tokens": 127168568.0, "step": 73310 }, { "entropy": 5.513027477264404, "epoch": 5.704143162808792, "grad_norm": 1.265625, "learning_rate": 0.00022793435103566972, "loss": 4.8018, "mean_token_accuracy": 0.22134671211242676, "num_tokens": 127177394.0, "step": 73315 }, { "entropy": 5.449186229705811, "epoch": 5.70453219218051, "grad_norm": 1.2421875, "learning_rate": 0.00022790724895678822, "loss": 4.7342, "mean_token_accuracy": 0.2303750455379486, "num_tokens": 127185533.0, "step": 73320 }, { "entropy": 5.406860303878784, "epoch": 5.704921221552227, "grad_norm": 1.2734375, "learning_rate": 0.00022788014759246429, "loss": 4.7318, "mean_token_accuracy": 0.233727864921093, "num_tokens": 127193917.0, "step": 73325 }, { "entropy": 5.260691785812378, "epoch": 5.705310250923945, "grad_norm": 1.203125, "learning_rate": 0.0002278530469431091, "loss": 4.5603, "mean_token_accuracy": 0.2437954366207123, "num_tokens": 127204164.0, "step": 73330 }, { "entropy": 5.400282669067383, "epoch": 5.705699280295662, "grad_norm": 1.3359375, "learning_rate": 0.0002278259470091339, "loss": 4.6946, "mean_token_accuracy": 0.23294628858566285, "num_tokens": 127212780.0, "step": 73335 }, { "entropy": 5.4572361469268795, "epoch": 5.70608830966738, "grad_norm": 1.328125, "learning_rate": 0.00022779884779094972, "loss": 4.7409, "mean_token_accuracy": 0.2317083641886711, "num_tokens": 127221022.0, "step": 73340 }, { "entropy": 5.512049674987793, "epoch": 5.706477339039098, "grad_norm": 1.140625, "learning_rate": 0.00022777174928896804, "loss": 4.7884, "mean_token_accuracy": 0.2269298255443573, "num_tokens": 127229742.0, "step": 73345 }, { "entropy": 5.399073505401612, "epoch": 5.706866368410815, "grad_norm": 1.2578125, "learning_rate": 0.0002277446515035999, "loss": 4.66, "mean_token_accuracy": 0.2347613051533699, "num_tokens": 127238008.0, "step": 73350 }, { "entropy": 5.421376037597656, "epoch": 5.707255397782532, "grad_norm": 1.40625, "learning_rate": 0.00022771755443525644, "loss": 4.6475, "mean_token_accuracy": 0.2414591506123543, "num_tokens": 127246824.0, "step": 73355 }, { "entropy": 5.437095880508423, "epoch": 5.70764442715425, "grad_norm": 1.2421875, "learning_rate": 0.00022769045808434884, "loss": 4.7357, "mean_token_accuracy": 0.22985170483589173, "num_tokens": 127255174.0, "step": 73360 }, { "entropy": 5.409363794326782, "epoch": 5.708033456525968, "grad_norm": 1.3046875, "learning_rate": 0.0002276633624512882, "loss": 4.7152, "mean_token_accuracy": 0.2317097082734108, "num_tokens": 127263888.0, "step": 73365 }, { "entropy": 5.413269567489624, "epoch": 5.708422485897685, "grad_norm": 1.296875, "learning_rate": 0.00022763626753648575, "loss": 4.7492, "mean_token_accuracy": 0.23427136838436127, "num_tokens": 127272259.0, "step": 73370 }, { "entropy": 5.404621267318726, "epoch": 5.708811515269403, "grad_norm": 1.2890625, "learning_rate": 0.00022760917334035252, "loss": 4.6344, "mean_token_accuracy": 0.24147583693265914, "num_tokens": 127280018.0, "step": 73375 }, { "entropy": 5.315544891357422, "epoch": 5.709200544641121, "grad_norm": 1.265625, "learning_rate": 0.00022758207986329964, "loss": 4.5822, "mean_token_accuracy": 0.24037724286317824, "num_tokens": 127287879.0, "step": 73380 }, { "entropy": 5.457150983810425, "epoch": 5.709589574012838, "grad_norm": 1.28125, "learning_rate": 0.00022755498710573825, "loss": 4.7585, "mean_token_accuracy": 0.22876127511262895, "num_tokens": 127295872.0, "step": 73385 }, { "entropy": 5.419118452072143, "epoch": 5.709978603384555, "grad_norm": 1.2421875, "learning_rate": 0.00022752789506807935, "loss": 4.7468, "mean_token_accuracy": 0.23326620310544968, "num_tokens": 127304250.0, "step": 73390 }, { "entropy": 5.369149589538575, "epoch": 5.710367632756273, "grad_norm": 1.203125, "learning_rate": 0.00022750080375073418, "loss": 4.6341, "mean_token_accuracy": 0.23289757072925568, "num_tokens": 127312668.0, "step": 73395 }, { "entropy": 5.418279218673706, "epoch": 5.710756662127991, "grad_norm": 1.2578125, "learning_rate": 0.00022747371315411368, "loss": 4.7385, "mean_token_accuracy": 0.23330868631601334, "num_tokens": 127321691.0, "step": 73400 }, { "entropy": 5.416310405731201, "epoch": 5.711145691499708, "grad_norm": 1.203125, "learning_rate": 0.00022744662327862887, "loss": 4.6868, "mean_token_accuracy": 0.23808684200048447, "num_tokens": 127331005.0, "step": 73405 }, { "entropy": 5.3581915378570555, "epoch": 5.711534720871426, "grad_norm": 1.1953125, "learning_rate": 0.0002274195341246909, "loss": 4.6118, "mean_token_accuracy": 0.23715014308691024, "num_tokens": 127339103.0, "step": 73410 }, { "entropy": 5.3850304126739506, "epoch": 5.711923750243144, "grad_norm": 1.2734375, "learning_rate": 0.00022739244569271077, "loss": 4.7263, "mean_token_accuracy": 0.2280083566904068, "num_tokens": 127347455.0, "step": 73415 }, { "entropy": 5.468974351882935, "epoch": 5.7123127796148605, "grad_norm": 1.2265625, "learning_rate": 0.00022736535798309953, "loss": 4.7939, "mean_token_accuracy": 0.2233325406908989, "num_tokens": 127356940.0, "step": 73420 }, { "entropy": 5.448297786712646, "epoch": 5.712701808986578, "grad_norm": 1.28125, "learning_rate": 0.00022733827099626815, "loss": 4.6818, "mean_token_accuracy": 0.24207652509212493, "num_tokens": 127365479.0, "step": 73425 }, { "entropy": 5.483569717407226, "epoch": 5.713090838358296, "grad_norm": 1.1953125, "learning_rate": 0.0002273111847326277, "loss": 4.7378, "mean_token_accuracy": 0.22649875581264495, "num_tokens": 127375076.0, "step": 73430 }, { "entropy": 5.490187168121338, "epoch": 5.713479867730014, "grad_norm": 1.3125, "learning_rate": 0.00022728409919258908, "loss": 4.7656, "mean_token_accuracy": 0.22399675995111465, "num_tokens": 127383544.0, "step": 73435 }, { "entropy": 5.396808910369873, "epoch": 5.713868897101731, "grad_norm": 1.28125, "learning_rate": 0.00022725701437656328, "loss": 4.6449, "mean_token_accuracy": 0.2402901291847229, "num_tokens": 127391405.0, "step": 73440 }, { "entropy": 5.402274179458618, "epoch": 5.714257926473449, "grad_norm": 1.3203125, "learning_rate": 0.0002272299302849613, "loss": 4.7307, "mean_token_accuracy": 0.23221128135919572, "num_tokens": 127399580.0, "step": 73445 }, { "entropy": 5.3394567489624025, "epoch": 5.714646955845167, "grad_norm": 1.2421875, "learning_rate": 0.0002272028469181941, "loss": 4.6495, "mean_token_accuracy": 0.23874157071113586, "num_tokens": 127408670.0, "step": 73450 }, { "entropy": 5.383472728729248, "epoch": 5.7150359852168835, "grad_norm": 1.1953125, "learning_rate": 0.00022717576427667258, "loss": 4.6686, "mean_token_accuracy": 0.2384016200900078, "num_tokens": 127417217.0, "step": 73455 }, { "entropy": 5.422609186172485, "epoch": 5.715425014588601, "grad_norm": 1.3046875, "learning_rate": 0.00022714868236080776, "loss": 4.6273, "mean_token_accuracy": 0.24762362539768218, "num_tokens": 127425398.0, "step": 73460 }, { "entropy": 5.456642818450928, "epoch": 5.715814043960319, "grad_norm": 1.328125, "learning_rate": 0.00022712160117101054, "loss": 4.8015, "mean_token_accuracy": 0.2252141758799553, "num_tokens": 127433478.0, "step": 73465 }, { "entropy": 5.415934038162232, "epoch": 5.716203073332037, "grad_norm": 1.296875, "learning_rate": 0.00022709452070769176, "loss": 4.6851, "mean_token_accuracy": 0.2337421640753746, "num_tokens": 127441752.0, "step": 73470 }, { "entropy": 5.473828744888306, "epoch": 5.716592102703754, "grad_norm": 1.390625, "learning_rate": 0.00022706744097126242, "loss": 4.7496, "mean_token_accuracy": 0.23114845752716065, "num_tokens": 127450731.0, "step": 73475 }, { "entropy": 5.380221605300903, "epoch": 5.716981132075472, "grad_norm": 1.2578125, "learning_rate": 0.00022704036196213336, "loss": 4.6524, "mean_token_accuracy": 0.23269561678171158, "num_tokens": 127459556.0, "step": 73480 }, { "entropy": 5.378362131118775, "epoch": 5.717370161447189, "grad_norm": 1.3203125, "learning_rate": 0.00022701328368071545, "loss": 4.6748, "mean_token_accuracy": 0.23598323464393617, "num_tokens": 127467418.0, "step": 73485 }, { "entropy": 5.428715467453003, "epoch": 5.7177591908189065, "grad_norm": 1.2109375, "learning_rate": 0.00022698620612741962, "loss": 4.7865, "mean_token_accuracy": 0.227668334543705, "num_tokens": 127476461.0, "step": 73490 }, { "entropy": 5.367031764984131, "epoch": 5.718148220190624, "grad_norm": 1.203125, "learning_rate": 0.00022695912930265666, "loss": 4.6857, "mean_token_accuracy": 0.23061956465244293, "num_tokens": 127485476.0, "step": 73495 }, { "entropy": 5.417669439315796, "epoch": 5.718537249562342, "grad_norm": 1.2421875, "learning_rate": 0.0002269320532068375, "loss": 4.6713, "mean_token_accuracy": 0.23877793699502944, "num_tokens": 127493783.0, "step": 73500 }, { "entropy": 5.37351393699646, "epoch": 5.71892627893406, "grad_norm": 1.375, "learning_rate": 0.0002269049778403729, "loss": 4.6636, "mean_token_accuracy": 0.23703791052103043, "num_tokens": 127502243.0, "step": 73505 }, { "entropy": 5.399152708053589, "epoch": 5.719315308305777, "grad_norm": 1.3984375, "learning_rate": 0.00022687790320367375, "loss": 4.7393, "mean_token_accuracy": 0.22813319861888887, "num_tokens": 127510879.0, "step": 73510 }, { "entropy": 5.417322397232056, "epoch": 5.719704337677495, "grad_norm": 1.296875, "learning_rate": 0.00022685082929715074, "loss": 4.6766, "mean_token_accuracy": 0.23632766157388688, "num_tokens": 127518918.0, "step": 73515 }, { "entropy": 5.415064954757691, "epoch": 5.720093367049213, "grad_norm": 1.2265625, "learning_rate": 0.00022682375612121481, "loss": 4.7544, "mean_token_accuracy": 0.22950664907693863, "num_tokens": 127527782.0, "step": 73520 }, { "entropy": 5.383284950256348, "epoch": 5.7204823964209295, "grad_norm": 1.2265625, "learning_rate": 0.0002267966836762767, "loss": 4.6631, "mean_token_accuracy": 0.234574593603611, "num_tokens": 127537015.0, "step": 73525 }, { "entropy": 5.385509729385376, "epoch": 5.720871425792647, "grad_norm": 1.1953125, "learning_rate": 0.00022676961196274714, "loss": 4.7061, "mean_token_accuracy": 0.23799406439065934, "num_tokens": 127545634.0, "step": 73530 }, { "entropy": 5.4751664161682125, "epoch": 5.721260455164365, "grad_norm": 1.1875, "learning_rate": 0.00022674254098103692, "loss": 4.7887, "mean_token_accuracy": 0.23128096163272857, "num_tokens": 127554019.0, "step": 73535 }, { "entropy": 5.465732908248901, "epoch": 5.721649484536083, "grad_norm": 1.2578125, "learning_rate": 0.0002267154707315569, "loss": 4.8241, "mean_token_accuracy": 0.2262078508734703, "num_tokens": 127562996.0, "step": 73540 }, { "entropy": 5.471660995483399, "epoch": 5.7220385139078, "grad_norm": 1.234375, "learning_rate": 0.0002266884012147178, "loss": 4.6736, "mean_token_accuracy": 0.23983193337917327, "num_tokens": 127572603.0, "step": 73545 }, { "entropy": 5.460847520828247, "epoch": 5.722427543279518, "grad_norm": 1.2421875, "learning_rate": 0.0002266613324309303, "loss": 4.7384, "mean_token_accuracy": 0.22942037880420685, "num_tokens": 127580708.0, "step": 73550 }, { "entropy": 5.370373821258545, "epoch": 5.722816572651235, "grad_norm": 1.2421875, "learning_rate": 0.00022663426438060508, "loss": 4.6651, "mean_token_accuracy": 0.2355080172419548, "num_tokens": 127589062.0, "step": 73555 }, { "entropy": 5.431367492675781, "epoch": 5.7232056020229525, "grad_norm": 1.40625, "learning_rate": 0.00022660719706415295, "loss": 4.6845, "mean_token_accuracy": 0.24026960581541063, "num_tokens": 127597322.0, "step": 73560 }, { "entropy": 5.474208784103394, "epoch": 5.72359463139467, "grad_norm": 1.2890625, "learning_rate": 0.00022658013048198455, "loss": 4.7671, "mean_token_accuracy": 0.22355885356664656, "num_tokens": 127605698.0, "step": 73565 }, { "entropy": 5.417050218582153, "epoch": 5.723983660766388, "grad_norm": 1.3515625, "learning_rate": 0.00022655306463451063, "loss": 4.6844, "mean_token_accuracy": 0.2399067685008049, "num_tokens": 127614178.0, "step": 73570 }, { "entropy": 5.385628032684326, "epoch": 5.724372690138106, "grad_norm": 1.1640625, "learning_rate": 0.00022652599952214186, "loss": 4.6277, "mean_token_accuracy": 0.2406775489449501, "num_tokens": 127623069.0, "step": 73575 }, { "entropy": 5.441081619262695, "epoch": 5.724761719509823, "grad_norm": 1.2421875, "learning_rate": 0.00022649893514528892, "loss": 4.7361, "mean_token_accuracy": 0.22981414794921876, "num_tokens": 127631284.0, "step": 73580 }, { "entropy": 5.371806240081787, "epoch": 5.725150748881541, "grad_norm": 1.3359375, "learning_rate": 0.0002264718715043624, "loss": 4.6667, "mean_token_accuracy": 0.2376416563987732, "num_tokens": 127639810.0, "step": 73585 }, { "entropy": 5.501563882827758, "epoch": 5.725539778253258, "grad_norm": 1.2109375, "learning_rate": 0.000226444808599773, "loss": 4.8531, "mean_token_accuracy": 0.23133372366428376, "num_tokens": 127648298.0, "step": 73590 }, { "entropy": 5.466367435455322, "epoch": 5.7259288076249755, "grad_norm": 1.328125, "learning_rate": 0.00022641774643193137, "loss": 4.7174, "mean_token_accuracy": 0.23105482757091522, "num_tokens": 127656990.0, "step": 73595 }, { "entropy": 5.40721378326416, "epoch": 5.726317836996693, "grad_norm": 1.234375, "learning_rate": 0.00022639068500124803, "loss": 4.5878, "mean_token_accuracy": 0.24179897159337999, "num_tokens": 127665284.0, "step": 73600 }, { "entropy": 5.397235965728759, "epoch": 5.726706866368411, "grad_norm": 1.265625, "learning_rate": 0.00022636362430813363, "loss": 4.6838, "mean_token_accuracy": 0.24110848754644393, "num_tokens": 127674770.0, "step": 73605 }, { "entropy": 5.506020641326904, "epoch": 5.727095895740129, "grad_norm": 1.2265625, "learning_rate": 0.00022633656435299893, "loss": 4.8489, "mean_token_accuracy": 0.22367931455373763, "num_tokens": 127683409.0, "step": 73610 }, { "entropy": 5.435642862319947, "epoch": 5.727484925111846, "grad_norm": 1.234375, "learning_rate": 0.00022630950513625436, "loss": 4.6905, "mean_token_accuracy": 0.23249044120311738, "num_tokens": 127692699.0, "step": 73615 }, { "entropy": 5.532311201095581, "epoch": 5.727873954483563, "grad_norm": 1.3203125, "learning_rate": 0.00022628244665831067, "loss": 4.7883, "mean_token_accuracy": 0.22562696486711503, "num_tokens": 127701720.0, "step": 73620 }, { "entropy": 5.493682432174682, "epoch": 5.728262983855281, "grad_norm": 1.265625, "learning_rate": 0.0002262553889195782, "loss": 4.7378, "mean_token_accuracy": 0.22634753137826918, "num_tokens": 127710420.0, "step": 73625 }, { "entropy": 5.386697769165039, "epoch": 5.7286520132269985, "grad_norm": 1.28125, "learning_rate": 0.00022622833192046765, "loss": 4.6504, "mean_token_accuracy": 0.2333774283528328, "num_tokens": 127718505.0, "step": 73630 }, { "entropy": 5.435186862945557, "epoch": 5.729041042598716, "grad_norm": 1.4140625, "learning_rate": 0.00022620127566138948, "loss": 4.7943, "mean_token_accuracy": 0.22910430878400803, "num_tokens": 127727372.0, "step": 73635 }, { "entropy": 5.444840145111084, "epoch": 5.729430071970434, "grad_norm": 1.40625, "learning_rate": 0.00022617422014275436, "loss": 4.7554, "mean_token_accuracy": 0.2180034562945366, "num_tokens": 127735731.0, "step": 73640 }, { "entropy": 5.391874551773071, "epoch": 5.7298191013421516, "grad_norm": 1.2734375, "learning_rate": 0.0002261471653649727, "loss": 4.7146, "mean_token_accuracy": 0.22967735975980758, "num_tokens": 127744442.0, "step": 73645 }, { "entropy": 5.380767917633056, "epoch": 5.730208130713869, "grad_norm": 1.2421875, "learning_rate": 0.00022612011132845506, "loss": 4.6737, "mean_token_accuracy": 0.2314346179366112, "num_tokens": 127753548.0, "step": 73650 }, { "entropy": 5.4210546016693115, "epoch": 5.730597160085587, "grad_norm": 1.265625, "learning_rate": 0.0002260930580336119, "loss": 4.7364, "mean_token_accuracy": 0.22596848011016846, "num_tokens": 127762734.0, "step": 73655 }, { "entropy": 5.39854588508606, "epoch": 5.730986189457304, "grad_norm": 1.2109375, "learning_rate": 0.00022606600548085375, "loss": 4.7481, "mean_token_accuracy": 0.2308316186070442, "num_tokens": 127772032.0, "step": 73660 }, { "entropy": 5.518133115768433, "epoch": 5.7313752188290215, "grad_norm": 1.2109375, "learning_rate": 0.00022603895367059109, "loss": 4.7917, "mean_token_accuracy": 0.2305429458618164, "num_tokens": 127780731.0, "step": 73665 }, { "entropy": 5.483555126190185, "epoch": 5.731764248200739, "grad_norm": 1.28125, "learning_rate": 0.00022601190260323434, "loss": 4.6596, "mean_token_accuracy": 0.23248251676559448, "num_tokens": 127789404.0, "step": 73670 }, { "entropy": 5.461701583862305, "epoch": 5.732153277572457, "grad_norm": 1.265625, "learning_rate": 0.000225984852279194, "loss": 4.7672, "mean_token_accuracy": 0.22734092324972152, "num_tokens": 127798232.0, "step": 73675 }, { "entropy": 5.367747640609741, "epoch": 5.7325423069441745, "grad_norm": 1.3671875, "learning_rate": 0.00022595780269888055, "loss": 4.6567, "mean_token_accuracy": 0.23423434048891068, "num_tokens": 127806952.0, "step": 73680 }, { "entropy": 5.445312070846557, "epoch": 5.732931336315891, "grad_norm": 1.234375, "learning_rate": 0.00022593075386270438, "loss": 4.782, "mean_token_accuracy": 0.22917819321155547, "num_tokens": 127816178.0, "step": 73685 }, { "entropy": 5.413422155380249, "epoch": 5.733320365687609, "grad_norm": 1.234375, "learning_rate": 0.00022590370577107595, "loss": 4.703, "mean_token_accuracy": 0.23152417689561844, "num_tokens": 127825381.0, "step": 73690 }, { "entropy": 5.4223192691802975, "epoch": 5.733709395059327, "grad_norm": 1.4375, "learning_rate": 0.0002258766584244056, "loss": 4.6732, "mean_token_accuracy": 0.23360444903373717, "num_tokens": 127834232.0, "step": 73695 }, { "entropy": 5.429973793029785, "epoch": 5.7340984244310444, "grad_norm": 1.25, "learning_rate": 0.00022584961182310382, "loss": 4.7126, "mean_token_accuracy": 0.241447576880455, "num_tokens": 127842677.0, "step": 73700 }, { "entropy": 5.444335699081421, "epoch": 5.734487453802762, "grad_norm": 1.3125, "learning_rate": 0.00022582256596758094, "loss": 4.6391, "mean_token_accuracy": 0.24439713209867478, "num_tokens": 127851021.0, "step": 73705 }, { "entropy": 5.450626945495605, "epoch": 5.73487648317448, "grad_norm": 1.2734375, "learning_rate": 0.00022579552085824728, "loss": 4.7583, "mean_token_accuracy": 0.2255527749657631, "num_tokens": 127859393.0, "step": 73710 }, { "entropy": 5.408960342407227, "epoch": 5.7352655125461975, "grad_norm": 1.234375, "learning_rate": 0.0002257684764955133, "loss": 4.7515, "mean_token_accuracy": 0.22435106039047242, "num_tokens": 127867967.0, "step": 73715 }, { "entropy": 5.424421501159668, "epoch": 5.735654541917915, "grad_norm": 1.3359375, "learning_rate": 0.00022574143287978937, "loss": 4.7115, "mean_token_accuracy": 0.23482483327388765, "num_tokens": 127876761.0, "step": 73720 }, { "entropy": 5.422431468963623, "epoch": 5.736043571289632, "grad_norm": 1.3984375, "learning_rate": 0.00022571439001148574, "loss": 4.7027, "mean_token_accuracy": 0.2413535788655281, "num_tokens": 127885326.0, "step": 73725 }, { "entropy": 5.403384733200073, "epoch": 5.73643260066135, "grad_norm": 1.234375, "learning_rate": 0.00022568734789101287, "loss": 4.7057, "mean_token_accuracy": 0.23271361440420152, "num_tokens": 127894404.0, "step": 73730 }, { "entropy": 5.401701974868774, "epoch": 5.736821630033067, "grad_norm": 1.2109375, "learning_rate": 0.0002256603065187809, "loss": 4.6396, "mean_token_accuracy": 0.23960778266191482, "num_tokens": 127903790.0, "step": 73735 }, { "entropy": 5.414132928848266, "epoch": 5.737210659404785, "grad_norm": 1.2265625, "learning_rate": 0.00022563326589520027, "loss": 4.7151, "mean_token_accuracy": 0.23212529569864274, "num_tokens": 127911588.0, "step": 73740 }, { "entropy": 5.389629793167114, "epoch": 5.737599688776503, "grad_norm": 1.2421875, "learning_rate": 0.00022560622602068125, "loss": 4.725, "mean_token_accuracy": 0.23009524792432784, "num_tokens": 127919773.0, "step": 73745 }, { "entropy": 5.370613145828247, "epoch": 5.7379887181482205, "grad_norm": 1.3046875, "learning_rate": 0.00022557918689563423, "loss": 4.6567, "mean_token_accuracy": 0.23385123461484908, "num_tokens": 127927895.0, "step": 73750 }, { "entropy": 5.417871189117432, "epoch": 5.738377747519937, "grad_norm": 1.2734375, "learning_rate": 0.0002255521485204693, "loss": 4.7176, "mean_token_accuracy": 0.23000911325216294, "num_tokens": 127937245.0, "step": 73755 }, { "entropy": 5.418044662475586, "epoch": 5.738766776891655, "grad_norm": 1.234375, "learning_rate": 0.00022552511089559684, "loss": 4.686, "mean_token_accuracy": 0.23142379969358445, "num_tokens": 127946256.0, "step": 73760 }, { "entropy": 5.481625127792358, "epoch": 5.739155806263373, "grad_norm": 1.3359375, "learning_rate": 0.0002254980740214271, "loss": 4.858, "mean_token_accuracy": 0.2227955400943756, "num_tokens": 127954916.0, "step": 73765 }, { "entropy": 5.3974974155426025, "epoch": 5.73954483563509, "grad_norm": 1.25, "learning_rate": 0.0002254710378983702, "loss": 4.6953, "mean_token_accuracy": 0.23457067161798478, "num_tokens": 127963442.0, "step": 73770 }, { "entropy": 5.464633989334106, "epoch": 5.739933865006808, "grad_norm": 1.2578125, "learning_rate": 0.00022544400252683656, "loss": 4.7986, "mean_token_accuracy": 0.22650066167116165, "num_tokens": 127972586.0, "step": 73775 }, { "entropy": 5.377392578125, "epoch": 5.740322894378526, "grad_norm": 1.3046875, "learning_rate": 0.0002254169679072363, "loss": 4.5663, "mean_token_accuracy": 0.2482578918337822, "num_tokens": 127980895.0, "step": 73780 }, { "entropy": 5.391235399246216, "epoch": 5.7407119237502435, "grad_norm": 1.2109375, "learning_rate": 0.00022538993403997966, "loss": 4.5942, "mean_token_accuracy": 0.24795944690704347, "num_tokens": 127989350.0, "step": 73785 }, { "entropy": 5.378514814376831, "epoch": 5.74110095312196, "grad_norm": 1.3359375, "learning_rate": 0.00022536290092547672, "loss": 4.7042, "mean_token_accuracy": 0.23347381204366685, "num_tokens": 127997621.0, "step": 73790 }, { "entropy": 5.512717151641846, "epoch": 5.741489982493678, "grad_norm": 1.203125, "learning_rate": 0.0002253358685641378, "loss": 4.792, "mean_token_accuracy": 0.22682008594274522, "num_tokens": 128006749.0, "step": 73795 }, { "entropy": 5.408950662612915, "epoch": 5.741879011865396, "grad_norm": 1.2578125, "learning_rate": 0.000225308836956373, "loss": 4.6566, "mean_token_accuracy": 0.23567890375852585, "num_tokens": 128015786.0, "step": 73800 }, { "entropy": 5.4045709609985355, "epoch": 5.742268041237113, "grad_norm": 1.3046875, "learning_rate": 0.00022528180610259247, "loss": 4.6649, "mean_token_accuracy": 0.23491364419460298, "num_tokens": 128024175.0, "step": 73805 }, { "entropy": 5.425813865661621, "epoch": 5.742657070608831, "grad_norm": 1.203125, "learning_rate": 0.0002252547760032065, "loss": 4.7364, "mean_token_accuracy": 0.22760885059833527, "num_tokens": 128034492.0, "step": 73810 }, { "entropy": 5.446305513381958, "epoch": 5.743046099980549, "grad_norm": 1.28125, "learning_rate": 0.00022522774665862506, "loss": 4.8118, "mean_token_accuracy": 0.22012476921081542, "num_tokens": 128043562.0, "step": 73815 }, { "entropy": 5.360762739181519, "epoch": 5.743435129352266, "grad_norm": 1.2109375, "learning_rate": 0.0002252007180692584, "loss": 4.6433, "mean_token_accuracy": 0.2385942667722702, "num_tokens": 128051964.0, "step": 73820 }, { "entropy": 5.367166185379029, "epoch": 5.743824158723983, "grad_norm": 1.2421875, "learning_rate": 0.00022517369023551654, "loss": 4.6443, "mean_token_accuracy": 0.24060625731945037, "num_tokens": 128060907.0, "step": 73825 }, { "entropy": 5.396235752105713, "epoch": 5.744213188095701, "grad_norm": 1.265625, "learning_rate": 0.00022514666315780963, "loss": 4.721, "mean_token_accuracy": 0.227887424826622, "num_tokens": 128070157.0, "step": 73830 }, { "entropy": 5.391544437408447, "epoch": 5.744602217467419, "grad_norm": 1.203125, "learning_rate": 0.00022511963683654774, "loss": 4.6756, "mean_token_accuracy": 0.23627124428749086, "num_tokens": 128078204.0, "step": 73835 }, { "entropy": 5.434022092819214, "epoch": 5.744991246839136, "grad_norm": 1.265625, "learning_rate": 0.00022509261127214098, "loss": 4.711, "mean_token_accuracy": 0.22877957671880722, "num_tokens": 128087137.0, "step": 73840 }, { "entropy": 5.374085140228272, "epoch": 5.745380276210854, "grad_norm": 1.171875, "learning_rate": 0.0002250655864649994, "loss": 4.6551, "mean_token_accuracy": 0.23768645524978638, "num_tokens": 128096225.0, "step": 73845 }, { "entropy": 5.364320182800293, "epoch": 5.745769305582572, "grad_norm": 1.2421875, "learning_rate": 0.0002250385624155331, "loss": 4.6715, "mean_token_accuracy": 0.23089954107999802, "num_tokens": 128104511.0, "step": 73850 }, { "entropy": 5.45472993850708, "epoch": 5.7461583349542895, "grad_norm": 1.2109375, "learning_rate": 0.00022501153912415206, "loss": 4.7477, "mean_token_accuracy": 0.23879833221435548, "num_tokens": 128113925.0, "step": 73855 }, { "entropy": 5.486845874786377, "epoch": 5.746547364326006, "grad_norm": 1.234375, "learning_rate": 0.00022498451659126639, "loss": 4.8043, "mean_token_accuracy": 0.22685846090316772, "num_tokens": 128122325.0, "step": 73860 }, { "entropy": 5.409062051773072, "epoch": 5.746936393697724, "grad_norm": 1.3125, "learning_rate": 0.00022495749481728604, "loss": 4.6891, "mean_token_accuracy": 0.23553712666034698, "num_tokens": 128130547.0, "step": 73865 }, { "entropy": 5.410422706604004, "epoch": 5.747325423069442, "grad_norm": 1.3046875, "learning_rate": 0.000224930473802621, "loss": 4.6992, "mean_token_accuracy": 0.2317163109779358, "num_tokens": 128138602.0, "step": 73870 }, { "entropy": 5.439382410049438, "epoch": 5.747714452441159, "grad_norm": 1.234375, "learning_rate": 0.00022490345354768138, "loss": 4.6878, "mean_token_accuracy": 0.23932355046272277, "num_tokens": 128147094.0, "step": 73875 }, { "entropy": 5.326736259460449, "epoch": 5.748103481812877, "grad_norm": 1.203125, "learning_rate": 0.0002248764340528771, "loss": 4.6641, "mean_token_accuracy": 0.24019404649734497, "num_tokens": 128156360.0, "step": 73880 }, { "entropy": 5.417441940307617, "epoch": 5.748492511184595, "grad_norm": 1.2890625, "learning_rate": 0.0002248494153186182, "loss": 4.7166, "mean_token_accuracy": 0.23182264864444732, "num_tokens": 128165566.0, "step": 73885 }, { "entropy": 5.392944765090943, "epoch": 5.748881540556312, "grad_norm": 1.265625, "learning_rate": 0.00022482239734531462, "loss": 4.7017, "mean_token_accuracy": 0.22837583720684052, "num_tokens": 128174533.0, "step": 73890 }, { "entropy": 5.370966386795044, "epoch": 5.749270569928029, "grad_norm": 1.25, "learning_rate": 0.00022479538013337624, "loss": 4.6524, "mean_token_accuracy": 0.2363009497523308, "num_tokens": 128182707.0, "step": 73895 }, { "entropy": 5.447098445892334, "epoch": 5.749659599299747, "grad_norm": 1.171875, "learning_rate": 0.00022476836368321302, "loss": 4.7808, "mean_token_accuracy": 0.22568032294511794, "num_tokens": 128191327.0, "step": 73900 }, { "entropy": 5.4696861743927006, "epoch": 5.750048628671465, "grad_norm": 1.2890625, "learning_rate": 0.00022474134799523499, "loss": 4.7725, "mean_token_accuracy": 0.23010928630828859, "num_tokens": 128199317.0, "step": 73905 }, { "entropy": 5.468022871017456, "epoch": 5.750437658043182, "grad_norm": 1.2734375, "learning_rate": 0.00022471433306985202, "loss": 4.7717, "mean_token_accuracy": 0.22585202157497405, "num_tokens": 128207936.0, "step": 73910 }, { "entropy": 5.47581114768982, "epoch": 5.7508266874149, "grad_norm": 1.21875, "learning_rate": 0.00022468731890747397, "loss": 4.7523, "mean_token_accuracy": 0.2323294073343277, "num_tokens": 128216355.0, "step": 73915 }, { "entropy": 5.445416641235352, "epoch": 5.751215716786618, "grad_norm": 1.2890625, "learning_rate": 0.0002246603055085108, "loss": 4.6943, "mean_token_accuracy": 0.2362087622284889, "num_tokens": 128224418.0, "step": 73920 }, { "entropy": 5.374938201904297, "epoch": 5.751604746158335, "grad_norm": 1.1796875, "learning_rate": 0.00022463329287337235, "loss": 4.7128, "mean_token_accuracy": 0.23209499716758727, "num_tokens": 128233165.0, "step": 73925 }, { "entropy": 5.442474269866944, "epoch": 5.751993775530052, "grad_norm": 1.1953125, "learning_rate": 0.0002246062810024685, "loss": 4.7899, "mean_token_accuracy": 0.22759284675121308, "num_tokens": 128242225.0, "step": 73930 }, { "entropy": 5.432229328155517, "epoch": 5.75238280490177, "grad_norm": 1.3203125, "learning_rate": 0.00022457926989620915, "loss": 4.688, "mean_token_accuracy": 0.23734041899442673, "num_tokens": 128251145.0, "step": 73935 }, { "entropy": 5.46351466178894, "epoch": 5.752771834273488, "grad_norm": 1.3125, "learning_rate": 0.00022455225955500408, "loss": 4.7498, "mean_token_accuracy": 0.2310709297657013, "num_tokens": 128259089.0, "step": 73940 }, { "entropy": 5.4063269138336185, "epoch": 5.753160863645205, "grad_norm": 1.2109375, "learning_rate": 0.00022452524997926322, "loss": 4.6978, "mean_token_accuracy": 0.23250336945056915, "num_tokens": 128267919.0, "step": 73945 }, { "entropy": 5.4855663776397705, "epoch": 5.753549893016923, "grad_norm": 1.265625, "learning_rate": 0.0002244982411693964, "loss": 4.8055, "mean_token_accuracy": 0.2275300294160843, "num_tokens": 128277095.0, "step": 73950 }, { "entropy": 5.356501340866089, "epoch": 5.75393892238864, "grad_norm": 1.2890625, "learning_rate": 0.0002244712331258133, "loss": 4.6186, "mean_token_accuracy": 0.24129323810338973, "num_tokens": 128285579.0, "step": 73955 }, { "entropy": 5.427411937713623, "epoch": 5.754327951760358, "grad_norm": 1.2578125, "learning_rate": 0.0002244442258489238, "loss": 4.6994, "mean_token_accuracy": 0.23572994023561478, "num_tokens": 128294436.0, "step": 73960 }, { "entropy": 5.423990392684937, "epoch": 5.754716981132075, "grad_norm": 1.203125, "learning_rate": 0.00022441721933913778, "loss": 4.7973, "mean_token_accuracy": 0.22555950433015823, "num_tokens": 128304019.0, "step": 73965 }, { "entropy": 5.452146530151367, "epoch": 5.755106010503793, "grad_norm": 1.1875, "learning_rate": 0.000224390213596865, "loss": 4.7322, "mean_token_accuracy": 0.22729984819889068, "num_tokens": 128313121.0, "step": 73970 }, { "entropy": 5.390659475326538, "epoch": 5.755495039875511, "grad_norm": 1.265625, "learning_rate": 0.0002243632086225151, "loss": 4.6646, "mean_token_accuracy": 0.2346356064081192, "num_tokens": 128321965.0, "step": 73975 }, { "entropy": 5.435939025878906, "epoch": 5.755884069247228, "grad_norm": 1.25, "learning_rate": 0.0002243362044164979, "loss": 4.7291, "mean_token_accuracy": 0.2328208401799202, "num_tokens": 128331163.0, "step": 73980 }, { "entropy": 5.441748237609863, "epoch": 5.756273098618946, "grad_norm": 1.328125, "learning_rate": 0.00022430920097922313, "loss": 4.7748, "mean_token_accuracy": 0.2238151967525482, "num_tokens": 128339475.0, "step": 73985 }, { "entropy": 5.403398418426514, "epoch": 5.756662127990664, "grad_norm": 1.25, "learning_rate": 0.00022428219831110063, "loss": 4.69, "mean_token_accuracy": 0.23782752603292465, "num_tokens": 128347470.0, "step": 73990 }, { "entropy": 5.428991746902466, "epoch": 5.757051157362381, "grad_norm": 1.3203125, "learning_rate": 0.00022425519641254, "loss": 4.7555, "mean_token_accuracy": 0.22936067581176758, "num_tokens": 128356149.0, "step": 73995 }, { "entropy": 5.482574939727783, "epoch": 5.757440186734098, "grad_norm": 1.296875, "learning_rate": 0.00022422819528395094, "loss": 4.793, "mean_token_accuracy": 0.22717421501874924, "num_tokens": 128364377.0, "step": 74000 }, { "entropy": 5.378600788116455, "epoch": 5.757829216105816, "grad_norm": 1.2421875, "learning_rate": 0.00022420119492574326, "loss": 4.6563, "mean_token_accuracy": 0.2377389192581177, "num_tokens": 128373019.0, "step": 74005 }, { "entropy": 5.396333360671997, "epoch": 5.758218245477534, "grad_norm": 1.2578125, "learning_rate": 0.00022417419533832662, "loss": 4.6073, "mean_token_accuracy": 0.24184005856513976, "num_tokens": 128380591.0, "step": 74010 }, { "entropy": 5.4169658660888675, "epoch": 5.758607274849251, "grad_norm": 1.2265625, "learning_rate": 0.00022414719652211063, "loss": 4.7051, "mean_token_accuracy": 0.23891893327236174, "num_tokens": 128389826.0, "step": 74015 }, { "entropy": 5.343662738800049, "epoch": 5.758996304220968, "grad_norm": 1.25, "learning_rate": 0.00022412019847750498, "loss": 4.5654, "mean_token_accuracy": 0.24480109959840773, "num_tokens": 128397868.0, "step": 74020 }, { "entropy": 5.435055541992187, "epoch": 5.759385333592686, "grad_norm": 1.3828125, "learning_rate": 0.0002240932012049194, "loss": 4.7136, "mean_token_accuracy": 0.23906700164079667, "num_tokens": 128405314.0, "step": 74025 }, { "entropy": 5.319104909896851, "epoch": 5.759774362964404, "grad_norm": 1.1875, "learning_rate": 0.0002240662047047634, "loss": 4.6029, "mean_token_accuracy": 0.24366777390241623, "num_tokens": 128414267.0, "step": 74030 }, { "entropy": 5.426264762878418, "epoch": 5.760163392336121, "grad_norm": 1.234375, "learning_rate": 0.00022403920897744672, "loss": 4.7773, "mean_token_accuracy": 0.22767980992794037, "num_tokens": 128422492.0, "step": 74035 }, { "entropy": 5.419209718704224, "epoch": 5.760552421707839, "grad_norm": 1.234375, "learning_rate": 0.0002240122140233789, "loss": 4.6753, "mean_token_accuracy": 0.23965973556041717, "num_tokens": 128430841.0, "step": 74040 }, { "entropy": 5.349329900741577, "epoch": 5.760941451079557, "grad_norm": 1.2734375, "learning_rate": 0.0002239852198429696, "loss": 4.662, "mean_token_accuracy": 0.23828287720680236, "num_tokens": 128439055.0, "step": 74045 }, { "entropy": 5.3890949249267575, "epoch": 5.761330480451274, "grad_norm": 1.2421875, "learning_rate": 0.00022395822643662844, "loss": 4.6844, "mean_token_accuracy": 0.23531799763441086, "num_tokens": 128447929.0, "step": 74050 }, { "entropy": 5.339063310623169, "epoch": 5.761719509822992, "grad_norm": 1.3671875, "learning_rate": 0.00022393123380476488, "loss": 4.6153, "mean_token_accuracy": 0.23798087388277053, "num_tokens": 128456111.0, "step": 74055 }, { "entropy": 5.373596334457398, "epoch": 5.762108539194709, "grad_norm": 1.203125, "learning_rate": 0.00022390424194778858, "loss": 4.7139, "mean_token_accuracy": 0.23050627559423448, "num_tokens": 128464594.0, "step": 74060 }, { "entropy": 5.4263232231140135, "epoch": 5.762497568566427, "grad_norm": 1.3515625, "learning_rate": 0.00022387725086610904, "loss": 4.659, "mean_token_accuracy": 0.23774437010288238, "num_tokens": 128472620.0, "step": 74065 }, { "entropy": 5.433831262588501, "epoch": 5.762886597938144, "grad_norm": 1.1796875, "learning_rate": 0.0002238502605601358, "loss": 4.7137, "mean_token_accuracy": 0.23045556098222733, "num_tokens": 128481570.0, "step": 74070 }, { "entropy": 5.349554538726807, "epoch": 5.763275627309862, "grad_norm": 1.296875, "learning_rate": 0.00022382327103027854, "loss": 4.6208, "mean_token_accuracy": 0.23337680101394653, "num_tokens": 128489703.0, "step": 74075 }, { "entropy": 5.459225034713745, "epoch": 5.76366465668158, "grad_norm": 1.375, "learning_rate": 0.00022379628227694675, "loss": 4.7086, "mean_token_accuracy": 0.23332745879888533, "num_tokens": 128497172.0, "step": 74080 }, { "entropy": 5.386168050765991, "epoch": 5.764053686053297, "grad_norm": 1.453125, "learning_rate": 0.00022376929430054982, "loss": 4.6125, "mean_token_accuracy": 0.24308489710092546, "num_tokens": 128504890.0, "step": 74085 }, { "entropy": 5.39875340461731, "epoch": 5.764442715425014, "grad_norm": 1.3125, "learning_rate": 0.00022374230710149723, "loss": 4.6249, "mean_token_accuracy": 0.24026311188936234, "num_tokens": 128512410.0, "step": 74090 }, { "entropy": 5.437826108932495, "epoch": 5.764831744796732, "grad_norm": 1.28125, "learning_rate": 0.00022371532068019863, "loss": 4.8167, "mean_token_accuracy": 0.22937958985567092, "num_tokens": 128521556.0, "step": 74095 }, { "entropy": 5.397477293014527, "epoch": 5.76522077416845, "grad_norm": 1.34375, "learning_rate": 0.00022368833503706338, "loss": 4.6703, "mean_token_accuracy": 0.23650281578302385, "num_tokens": 128530226.0, "step": 74100 }, { "entropy": 5.371507072448731, "epoch": 5.765609803540167, "grad_norm": 1.296875, "learning_rate": 0.000223661350172501, "loss": 4.5868, "mean_token_accuracy": 0.24629130959510803, "num_tokens": 128538178.0, "step": 74105 }, { "entropy": 5.371761751174927, "epoch": 5.765998832911885, "grad_norm": 1.3515625, "learning_rate": 0.00022363436608692085, "loss": 4.6705, "mean_token_accuracy": 0.23747970014810563, "num_tokens": 128546371.0, "step": 74110 }, { "entropy": 5.41437554359436, "epoch": 5.766387862283603, "grad_norm": 1.265625, "learning_rate": 0.0002236073827807325, "loss": 4.6771, "mean_token_accuracy": 0.23324495404958726, "num_tokens": 128554764.0, "step": 74115 }, { "entropy": 5.397982835769653, "epoch": 5.76677689165532, "grad_norm": 1.28125, "learning_rate": 0.0002235804002543453, "loss": 4.6587, "mean_token_accuracy": 0.244511678814888, "num_tokens": 128562759.0, "step": 74120 }, { "entropy": 5.326992034912109, "epoch": 5.767165921027037, "grad_norm": 1.25, "learning_rate": 0.0002235534185081687, "loss": 4.6663, "mean_token_accuracy": 0.2325431987643242, "num_tokens": 128571656.0, "step": 74125 }, { "entropy": 5.41493706703186, "epoch": 5.767554950398755, "grad_norm": 1.2109375, "learning_rate": 0.0002235264375426121, "loss": 4.7169, "mean_token_accuracy": 0.2352779671549797, "num_tokens": 128581202.0, "step": 74130 }, { "entropy": 5.433605623245239, "epoch": 5.767943979770473, "grad_norm": 1.265625, "learning_rate": 0.00022349945735808475, "loss": 4.6487, "mean_token_accuracy": 0.24327562749385834, "num_tokens": 128589188.0, "step": 74135 }, { "entropy": 5.408305025100708, "epoch": 5.76833300914219, "grad_norm": 1.1875, "learning_rate": 0.00022347247795499625, "loss": 4.6922, "mean_token_accuracy": 0.23074866235256195, "num_tokens": 128597923.0, "step": 74140 }, { "entropy": 5.3879234790802, "epoch": 5.768722038513908, "grad_norm": 1.2890625, "learning_rate": 0.00022344549933375597, "loss": 4.6759, "mean_token_accuracy": 0.23637087941169738, "num_tokens": 128606478.0, "step": 74145 }, { "entropy": 5.359304618835449, "epoch": 5.769111067885626, "grad_norm": 1.265625, "learning_rate": 0.00022341852149477309, "loss": 4.5827, "mean_token_accuracy": 0.24708991050720214, "num_tokens": 128614707.0, "step": 74150 }, { "entropy": 5.442174005508423, "epoch": 5.7695000972573425, "grad_norm": 1.203125, "learning_rate": 0.00022339154443845705, "loss": 4.8125, "mean_token_accuracy": 0.22557737678289413, "num_tokens": 128623182.0, "step": 74155 }, { "entropy": 5.4692711353302, "epoch": 5.76988912662906, "grad_norm": 1.2578125, "learning_rate": 0.00022336456816521722, "loss": 4.7858, "mean_token_accuracy": 0.234621761739254, "num_tokens": 128631924.0, "step": 74160 }, { "entropy": 5.5559131622314455, "epoch": 5.770278156000778, "grad_norm": 1.1171875, "learning_rate": 0.0002233375926754629, "loss": 4.8156, "mean_token_accuracy": 0.2298200473189354, "num_tokens": 128640196.0, "step": 74165 }, { "entropy": 5.493968296051025, "epoch": 5.770667185372496, "grad_norm": 1.2265625, "learning_rate": 0.00022331061796960328, "loss": 4.7266, "mean_token_accuracy": 0.2375857263803482, "num_tokens": 128648842.0, "step": 74170 }, { "entropy": 5.37688570022583, "epoch": 5.771056214744213, "grad_norm": 1.171875, "learning_rate": 0.00022328364404804784, "loss": 4.6355, "mean_token_accuracy": 0.24683040827512742, "num_tokens": 128657678.0, "step": 74175 }, { "entropy": 5.458963298797608, "epoch": 5.771445244115931, "grad_norm": 1.2578125, "learning_rate": 0.00022325667091120576, "loss": 4.7233, "mean_token_accuracy": 0.23484363108873368, "num_tokens": 128665655.0, "step": 74180 }, { "entropy": 5.405974674224853, "epoch": 5.771834273487649, "grad_norm": 1.3984375, "learning_rate": 0.00022322969855948638, "loss": 4.7287, "mean_token_accuracy": 0.22520939856767655, "num_tokens": 128674858.0, "step": 74185 }, { "entropy": 5.393363904953003, "epoch": 5.772223302859366, "grad_norm": 1.3046875, "learning_rate": 0.00022320272699329885, "loss": 4.5886, "mean_token_accuracy": 0.23660751879215242, "num_tokens": 128683541.0, "step": 74190 }, { "entropy": 5.442883729934692, "epoch": 5.772612332231083, "grad_norm": 1.3203125, "learning_rate": 0.00022317575621305254, "loss": 4.7516, "mean_token_accuracy": 0.2295124813914299, "num_tokens": 128692031.0, "step": 74195 }, { "entropy": 5.369556999206543, "epoch": 5.773001361602801, "grad_norm": 1.2734375, "learning_rate": 0.00022314878621915656, "loss": 4.6361, "mean_token_accuracy": 0.23340573012828827, "num_tokens": 128701352.0, "step": 74200 }, { "entropy": 5.46612515449524, "epoch": 5.773390390974519, "grad_norm": 1.25, "learning_rate": 0.00022312181701202033, "loss": 4.7678, "mean_token_accuracy": 0.23648154735565186, "num_tokens": 128710025.0, "step": 74205 }, { "entropy": 5.416579961776733, "epoch": 5.773779420346236, "grad_norm": 1.21875, "learning_rate": 0.00022309484859205293, "loss": 4.7182, "mean_token_accuracy": 0.22983547300100327, "num_tokens": 128719243.0, "step": 74210 }, { "entropy": 5.431369209289551, "epoch": 5.774168449717954, "grad_norm": 1.234375, "learning_rate": 0.00022306788095966356, "loss": 4.6966, "mean_token_accuracy": 0.23154416382312776, "num_tokens": 128727591.0, "step": 74215 }, { "entropy": 5.428254652023315, "epoch": 5.774557479089672, "grad_norm": 1.1875, "learning_rate": 0.00022304091411526144, "loss": 4.8233, "mean_token_accuracy": 0.2282763496041298, "num_tokens": 128736712.0, "step": 74220 }, { "entropy": 5.4492286205291744, "epoch": 5.7749465084613885, "grad_norm": 1.15625, "learning_rate": 0.0002230139480592558, "loss": 4.6757, "mean_token_accuracy": 0.23108662366867067, "num_tokens": 128745347.0, "step": 74225 }, { "entropy": 5.424688482284546, "epoch": 5.775335537833106, "grad_norm": 1.296875, "learning_rate": 0.00022298698279205571, "loss": 4.7002, "mean_token_accuracy": 0.23164417296648027, "num_tokens": 128753605.0, "step": 74230 }, { "entropy": 5.464305973052978, "epoch": 5.775724567204824, "grad_norm": 1.2265625, "learning_rate": 0.00022296001831407036, "loss": 4.7734, "mean_token_accuracy": 0.22795771062374115, "num_tokens": 128762206.0, "step": 74235 }, { "entropy": 5.409697675704956, "epoch": 5.7761135965765416, "grad_norm": 1.296875, "learning_rate": 0.00022293305462570896, "loss": 4.6824, "mean_token_accuracy": 0.2267390936613083, "num_tokens": 128770673.0, "step": 74240 }, { "entropy": 5.474594926834106, "epoch": 5.776502625948259, "grad_norm": 1.265625, "learning_rate": 0.00022290609172738058, "loss": 4.767, "mean_token_accuracy": 0.22980809062719346, "num_tokens": 128779162.0, "step": 74245 }, { "entropy": 5.399310111999512, "epoch": 5.776891655319977, "grad_norm": 1.1796875, "learning_rate": 0.00022287912961949425, "loss": 4.6485, "mean_token_accuracy": 0.24672498255968095, "num_tokens": 128788156.0, "step": 74250 }, { "entropy": 5.443849039077759, "epoch": 5.777280684691695, "grad_norm": 1.3046875, "learning_rate": 0.00022285216830245924, "loss": 4.7092, "mean_token_accuracy": 0.2387464836239815, "num_tokens": 128796061.0, "step": 74255 }, { "entropy": 5.371252012252808, "epoch": 5.7776697140634115, "grad_norm": 1.2734375, "learning_rate": 0.0002228252077766846, "loss": 4.621, "mean_token_accuracy": 0.24149923175573348, "num_tokens": 128804629.0, "step": 74260 }, { "entropy": 5.387916183471679, "epoch": 5.778058743435129, "grad_norm": 1.328125, "learning_rate": 0.0002227982480425793, "loss": 4.6451, "mean_token_accuracy": 0.23638035506010055, "num_tokens": 128812626.0, "step": 74265 }, { "entropy": 5.458868980407715, "epoch": 5.778447772806847, "grad_norm": 1.0859375, "learning_rate": 0.0002227712891005525, "loss": 4.7805, "mean_token_accuracy": 0.23028348833322526, "num_tokens": 128822471.0, "step": 74270 }, { "entropy": 5.48684549331665, "epoch": 5.7788368021785645, "grad_norm": 1.234375, "learning_rate": 0.00022274433095101332, "loss": 4.769, "mean_token_accuracy": 0.2296008959412575, "num_tokens": 128831980.0, "step": 74275 }, { "entropy": 5.491603660583496, "epoch": 5.779225831550282, "grad_norm": 1.3125, "learning_rate": 0.00022271737359437073, "loss": 4.7682, "mean_token_accuracy": 0.23590102791786194, "num_tokens": 128840090.0, "step": 74280 }, { "entropy": 5.360780239105225, "epoch": 5.779614860922, "grad_norm": 1.2890625, "learning_rate": 0.00022269041703103375, "loss": 4.5644, "mean_token_accuracy": 0.2381490260362625, "num_tokens": 128848101.0, "step": 74285 }, { "entropy": 5.3654265880584715, "epoch": 5.780003890293717, "grad_norm": 1.296875, "learning_rate": 0.00022266346126141145, "loss": 4.66, "mean_token_accuracy": 0.23792554289102555, "num_tokens": 128856873.0, "step": 74290 }, { "entropy": 5.382408666610718, "epoch": 5.7803929196654344, "grad_norm": 1.2265625, "learning_rate": 0.0002226365062859128, "loss": 4.7238, "mean_token_accuracy": 0.23125093430280685, "num_tokens": 128865519.0, "step": 74295 }, { "entropy": 5.383880472183227, "epoch": 5.780781949037152, "grad_norm": 1.328125, "learning_rate": 0.00022260955210494688, "loss": 4.6633, "mean_token_accuracy": 0.23730054646730422, "num_tokens": 128874487.0, "step": 74300 }, { "entropy": 5.48652024269104, "epoch": 5.78117097840887, "grad_norm": 1.2421875, "learning_rate": 0.00022258259871892256, "loss": 4.8522, "mean_token_accuracy": 0.22080710977315904, "num_tokens": 128883696.0, "step": 74305 }, { "entropy": 5.461329936981201, "epoch": 5.7815600077805875, "grad_norm": 1.25, "learning_rate": 0.0002225556461282489, "loss": 4.713, "mean_token_accuracy": 0.2350350558757782, "num_tokens": 128892117.0, "step": 74310 }, { "entropy": 5.479112577438355, "epoch": 5.781949037152305, "grad_norm": 1.234375, "learning_rate": 0.00022252869433333483, "loss": 4.7489, "mean_token_accuracy": 0.23064574748277664, "num_tokens": 128900660.0, "step": 74315 }, { "entropy": 5.309270429611206, "epoch": 5.782338066524023, "grad_norm": 1.25, "learning_rate": 0.0002225017433345894, "loss": 4.5595, "mean_token_accuracy": 0.2465588390827179, "num_tokens": 128909491.0, "step": 74320 }, { "entropy": 5.43945541381836, "epoch": 5.78272709589574, "grad_norm": 1.3125, "learning_rate": 0.00022247479313242135, "loss": 4.7892, "mean_token_accuracy": 0.22952382117509842, "num_tokens": 128918476.0, "step": 74325 }, { "entropy": 5.445417881011963, "epoch": 5.783116125267457, "grad_norm": 1.171875, "learning_rate": 0.00022244784372723976, "loss": 4.6828, "mean_token_accuracy": 0.24167085886001588, "num_tokens": 128927192.0, "step": 74330 }, { "entropy": 5.437497091293335, "epoch": 5.783505154639175, "grad_norm": 1.2578125, "learning_rate": 0.00022242089511945336, "loss": 4.715, "mean_token_accuracy": 0.23190619349479674, "num_tokens": 128935467.0, "step": 74335 }, { "entropy": 5.394255781173706, "epoch": 5.783894184010893, "grad_norm": 1.453125, "learning_rate": 0.00022239394730947127, "loss": 4.7223, "mean_token_accuracy": 0.22848013639450074, "num_tokens": 128943440.0, "step": 74340 }, { "entropy": 5.519095134735108, "epoch": 5.7842832133826105, "grad_norm": 1.3515625, "learning_rate": 0.00022236700029770235, "loss": 4.8066, "mean_token_accuracy": 0.23265400826931, "num_tokens": 128952020.0, "step": 74345 }, { "entropy": 5.32225866317749, "epoch": 5.784672242754328, "grad_norm": 1.328125, "learning_rate": 0.00022234005408455543, "loss": 4.5446, "mean_token_accuracy": 0.24647454917430878, "num_tokens": 128960799.0, "step": 74350 }, { "entropy": 5.410928010940552, "epoch": 5.785061272126045, "grad_norm": 1.25, "learning_rate": 0.00022231310867043934, "loss": 4.7463, "mean_token_accuracy": 0.23711289018392562, "num_tokens": 128969331.0, "step": 74355 }, { "entropy": 5.431405878067016, "epoch": 5.785450301497763, "grad_norm": 1.2578125, "learning_rate": 0.00022228616405576296, "loss": 4.7089, "mean_token_accuracy": 0.22777220755815505, "num_tokens": 128978014.0, "step": 74360 }, { "entropy": 5.3731261730194095, "epoch": 5.78583933086948, "grad_norm": 1.3125, "learning_rate": 0.00022225922024093515, "loss": 4.6813, "mean_token_accuracy": 0.23613603115081788, "num_tokens": 128986678.0, "step": 74365 }, { "entropy": 5.381593179702759, "epoch": 5.786228360241198, "grad_norm": 1.2265625, "learning_rate": 0.00022223227722636474, "loss": 4.6506, "mean_token_accuracy": 0.23816826939582825, "num_tokens": 128995292.0, "step": 74370 }, { "entropy": 5.3938836574554445, "epoch": 5.786617389612916, "grad_norm": 1.2421875, "learning_rate": 0.00022220533501246049, "loss": 4.6873, "mean_token_accuracy": 0.2386918395757675, "num_tokens": 129003886.0, "step": 74375 }, { "entropy": 5.347758817672729, "epoch": 5.7870064189846335, "grad_norm": 1.3203125, "learning_rate": 0.00022217839359963133, "loss": 4.6517, "mean_token_accuracy": 0.24117647856473923, "num_tokens": 129012548.0, "step": 74380 }, { "entropy": 5.473883390426636, "epoch": 5.787395448356351, "grad_norm": 1.1796875, "learning_rate": 0.00022215145298828587, "loss": 4.837, "mean_token_accuracy": 0.22882620096206666, "num_tokens": 129020882.0, "step": 74385 }, { "entropy": 5.396356058120728, "epoch": 5.787784477728069, "grad_norm": 1.2578125, "learning_rate": 0.0002221245131788331, "loss": 4.7069, "mean_token_accuracy": 0.2335044413805008, "num_tokens": 129029317.0, "step": 74390 }, { "entropy": 5.4961690425872805, "epoch": 5.788173507099786, "grad_norm": 1.296875, "learning_rate": 0.0002220975741716816, "loss": 4.7547, "mean_token_accuracy": 0.23673991709947587, "num_tokens": 129036731.0, "step": 74395 }, { "entropy": 5.433673524856568, "epoch": 5.788562536471503, "grad_norm": 1.2578125, "learning_rate": 0.0002220706359672402, "loss": 4.8183, "mean_token_accuracy": 0.22737989872694014, "num_tokens": 129045868.0, "step": 74400 }, { "entropy": 5.458584403991699, "epoch": 5.788951565843221, "grad_norm": 1.28125, "learning_rate": 0.00022204369856591765, "loss": 4.7754, "mean_token_accuracy": 0.22906596809625626, "num_tokens": 129054380.0, "step": 74405 }, { "entropy": 5.36266679763794, "epoch": 5.789340595214939, "grad_norm": 1.28125, "learning_rate": 0.00022201676196812275, "loss": 4.6357, "mean_token_accuracy": 0.24031752794981004, "num_tokens": 129062571.0, "step": 74410 }, { "entropy": 5.371146631240845, "epoch": 5.7897296245866565, "grad_norm": 1.2421875, "learning_rate": 0.00022198982617426417, "loss": 4.6854, "mean_token_accuracy": 0.24225378036499023, "num_tokens": 129070997.0, "step": 74415 }, { "entropy": 5.429295015335083, "epoch": 5.790118653958374, "grad_norm": 1.2578125, "learning_rate": 0.00022196289118475056, "loss": 4.7203, "mean_token_accuracy": 0.23503382056951522, "num_tokens": 129078494.0, "step": 74420 }, { "entropy": 5.355884265899658, "epoch": 5.790507683330091, "grad_norm": 1.2578125, "learning_rate": 0.00022193595699999063, "loss": 4.6476, "mean_token_accuracy": 0.24502550065517426, "num_tokens": 129086925.0, "step": 74425 }, { "entropy": 5.416491222381592, "epoch": 5.790896712701809, "grad_norm": 1.3046875, "learning_rate": 0.00022190902362039316, "loss": 4.7291, "mean_token_accuracy": 0.2254323199391365, "num_tokens": 129094765.0, "step": 74430 }, { "entropy": 5.465409612655639, "epoch": 5.791285742073526, "grad_norm": 1.2421875, "learning_rate": 0.00022188209104636675, "loss": 4.8012, "mean_token_accuracy": 0.22590084373950958, "num_tokens": 129103098.0, "step": 74435 }, { "entropy": 5.403447055816651, "epoch": 5.791674771445244, "grad_norm": 1.21875, "learning_rate": 0.00022185515927832, "loss": 4.7397, "mean_token_accuracy": 0.232652048766613, "num_tokens": 129112315.0, "step": 74440 }, { "entropy": 5.514015960693359, "epoch": 5.792063800816962, "grad_norm": 1.25, "learning_rate": 0.00022182822831666167, "loss": 4.8215, "mean_token_accuracy": 0.22247550636529922, "num_tokens": 129121111.0, "step": 74445 }, { "entropy": 5.426935195922852, "epoch": 5.7924528301886795, "grad_norm": 1.1796875, "learning_rate": 0.00022180129816180033, "loss": 4.7084, "mean_token_accuracy": 0.23662593066692353, "num_tokens": 129129974.0, "step": 74450 }, { "entropy": 5.475278902053833, "epoch": 5.792841859560397, "grad_norm": 1.2421875, "learning_rate": 0.00022177436881414458, "loss": 4.7038, "mean_token_accuracy": 0.23413096964359284, "num_tokens": 129138786.0, "step": 74455 }, { "entropy": 5.397673654556274, "epoch": 5.793230888932114, "grad_norm": 1.25, "learning_rate": 0.00022174744027410315, "loss": 4.67, "mean_token_accuracy": 0.23068359792232512, "num_tokens": 129147244.0, "step": 74460 }, { "entropy": 5.4286301612854, "epoch": 5.793619918303832, "grad_norm": 1.1796875, "learning_rate": 0.00022172051254208442, "loss": 4.7399, "mean_token_accuracy": 0.23031911253929138, "num_tokens": 129156613.0, "step": 74465 }, { "entropy": 5.410142612457276, "epoch": 5.794008947675549, "grad_norm": 1.3203125, "learning_rate": 0.00022169358561849724, "loss": 4.6695, "mean_token_accuracy": 0.23844918459653855, "num_tokens": 129165361.0, "step": 74470 }, { "entropy": 5.514263486862182, "epoch": 5.794397977047267, "grad_norm": 1.3203125, "learning_rate": 0.00022166665950374998, "loss": 4.7906, "mean_token_accuracy": 0.22912862300872802, "num_tokens": 129173479.0, "step": 74475 }, { "entropy": 5.342743062973023, "epoch": 5.794787006418985, "grad_norm": 1.2578125, "learning_rate": 0.00022163973419825128, "loss": 4.6053, "mean_token_accuracy": 0.23137644231319426, "num_tokens": 129182294.0, "step": 74480 }, { "entropy": 5.404165840148925, "epoch": 5.7951760357907025, "grad_norm": 1.5546875, "learning_rate": 0.0002216128097024097, "loss": 4.7456, "mean_token_accuracy": 0.23067908585071564, "num_tokens": 129190518.0, "step": 74485 }, { "entropy": 5.340090322494507, "epoch": 5.795565065162419, "grad_norm": 1.2421875, "learning_rate": 0.00022158588601663376, "loss": 4.5905, "mean_token_accuracy": 0.24503228068351746, "num_tokens": 129199465.0, "step": 74490 }, { "entropy": 5.365250444412231, "epoch": 5.795954094534137, "grad_norm": 1.1953125, "learning_rate": 0.00022155896314133194, "loss": 4.5999, "mean_token_accuracy": 0.24214914739131926, "num_tokens": 129208302.0, "step": 74495 }, { "entropy": 5.399610233306885, "epoch": 5.796343123905855, "grad_norm": 1.2578125, "learning_rate": 0.00022153204107691287, "loss": 4.6345, "mean_token_accuracy": 0.23436587750911714, "num_tokens": 129216827.0, "step": 74500 }, { "entropy": 5.39179425239563, "epoch": 5.796732153277572, "grad_norm": 1.203125, "learning_rate": 0.00022150511982378491, "loss": 4.6874, "mean_token_accuracy": 0.23448649048805237, "num_tokens": 129225097.0, "step": 74505 }, { "entropy": 5.354122972488403, "epoch": 5.79712118264929, "grad_norm": 1.3125, "learning_rate": 0.0002214781993823567, "loss": 4.6383, "mean_token_accuracy": 0.2402149721980095, "num_tokens": 129233289.0, "step": 74510 }, { "entropy": 5.445846128463745, "epoch": 5.797510212021008, "grad_norm": 1.1875, "learning_rate": 0.00022145127975303658, "loss": 4.8242, "mean_token_accuracy": 0.22951031625270843, "num_tokens": 129242261.0, "step": 74515 }, { "entropy": 5.421792507171631, "epoch": 5.7978992413927255, "grad_norm": 1.2578125, "learning_rate": 0.00022142436093623304, "loss": 4.7742, "mean_token_accuracy": 0.2321198508143425, "num_tokens": 129251408.0, "step": 74520 }, { "entropy": 5.478861474990845, "epoch": 5.798288270764443, "grad_norm": 1.1875, "learning_rate": 0.00022139744293235453, "loss": 4.8017, "mean_token_accuracy": 0.22436314225196838, "num_tokens": 129260950.0, "step": 74525 }, { "entropy": 5.486075162887573, "epoch": 5.79867730013616, "grad_norm": 1.28125, "learning_rate": 0.00022137052574180955, "loss": 4.7252, "mean_token_accuracy": 0.2276096075773239, "num_tokens": 129269136.0, "step": 74530 }, { "entropy": 5.457859134674072, "epoch": 5.799066329507878, "grad_norm": 1.1640625, "learning_rate": 0.00022134360936500636, "loss": 4.7982, "mean_token_accuracy": 0.220009046792984, "num_tokens": 129278443.0, "step": 74535 }, { "entropy": 5.337863969802856, "epoch": 5.799455358879595, "grad_norm": 1.265625, "learning_rate": 0.00022131669380235364, "loss": 4.5996, "mean_token_accuracy": 0.23430920094251634, "num_tokens": 129287423.0, "step": 74540 }, { "entropy": 5.316799163818359, "epoch": 5.799844388251313, "grad_norm": 1.2890625, "learning_rate": 0.00022128977905425955, "loss": 4.6197, "mean_token_accuracy": 0.24310948848724365, "num_tokens": 129295974.0, "step": 74545 }, { "entropy": 5.429731798171997, "epoch": 5.800233417623031, "grad_norm": 1.3515625, "learning_rate": 0.00022126286512113265, "loss": 4.7767, "mean_token_accuracy": 0.22923233807086946, "num_tokens": 129304269.0, "step": 74550 }, { "entropy": 5.454990816116333, "epoch": 5.800622446994748, "grad_norm": 1.1640625, "learning_rate": 0.0002212359520033812, "loss": 4.7799, "mean_token_accuracy": 0.22976387441158294, "num_tokens": 129313493.0, "step": 74555 }, { "entropy": 5.4604839324951175, "epoch": 5.801011476366465, "grad_norm": 1.265625, "learning_rate": 0.00022120903970141364, "loss": 4.7058, "mean_token_accuracy": 0.23522233664989473, "num_tokens": 129321634.0, "step": 74560 }, { "entropy": 5.36354022026062, "epoch": 5.801400505738183, "grad_norm": 1.140625, "learning_rate": 0.00022118212821563827, "loss": 4.6927, "mean_token_accuracy": 0.22870127409696578, "num_tokens": 129332285.0, "step": 74565 }, { "entropy": 5.4068482398986815, "epoch": 5.801789535109901, "grad_norm": 1.34375, "learning_rate": 0.00022115521754646346, "loss": 4.6765, "mean_token_accuracy": 0.24199732393026352, "num_tokens": 129340890.0, "step": 74570 }, { "entropy": 5.435033559799194, "epoch": 5.802178564481618, "grad_norm": 1.2421875, "learning_rate": 0.00022112830769429744, "loss": 4.7345, "mean_token_accuracy": 0.2355238229036331, "num_tokens": 129349327.0, "step": 74575 }, { "entropy": 5.484268522262573, "epoch": 5.802567593853336, "grad_norm": 1.2734375, "learning_rate": 0.00022110139865954865, "loss": 4.7307, "mean_token_accuracy": 0.2255270451307297, "num_tokens": 129357588.0, "step": 74580 }, { "entropy": 5.4908465385437015, "epoch": 5.802956623225054, "grad_norm": 1.21875, "learning_rate": 0.0002210744904426254, "loss": 4.7311, "mean_token_accuracy": 0.226112200319767, "num_tokens": 129366473.0, "step": 74585 }, { "entropy": 5.534784603118896, "epoch": 5.8033456525967715, "grad_norm": 1.3203125, "learning_rate": 0.0002210475830439359, "loss": 4.8348, "mean_token_accuracy": 0.21948008984327316, "num_tokens": 129374639.0, "step": 74590 }, { "entropy": 5.392705249786377, "epoch": 5.803734681968488, "grad_norm": 1.21875, "learning_rate": 0.00022102067646388845, "loss": 4.6725, "mean_token_accuracy": 0.2400367259979248, "num_tokens": 129383334.0, "step": 74595 }, { "entropy": 5.324016475677491, "epoch": 5.804123711340206, "grad_norm": 1.234375, "learning_rate": 0.00022099377070289124, "loss": 4.6695, "mean_token_accuracy": 0.23413713425397872, "num_tokens": 129391267.0, "step": 74600 }, { "entropy": 5.374117231369018, "epoch": 5.804512740711924, "grad_norm": 1.171875, "learning_rate": 0.00022096686576135268, "loss": 4.6645, "mean_token_accuracy": 0.23549238890409468, "num_tokens": 129399631.0, "step": 74605 }, { "entropy": 5.508076810836792, "epoch": 5.804901770083641, "grad_norm": 1.2890625, "learning_rate": 0.00022093996163968088, "loss": 4.8077, "mean_token_accuracy": 0.22782034426927567, "num_tokens": 129408742.0, "step": 74610 }, { "entropy": 5.450793266296387, "epoch": 5.805290799455359, "grad_norm": 1.296875, "learning_rate": 0.00022091305833828412, "loss": 4.7224, "mean_token_accuracy": 0.2326617181301117, "num_tokens": 129416793.0, "step": 74615 }, { "entropy": 5.386793851852417, "epoch": 5.805679828827077, "grad_norm": 1.1953125, "learning_rate": 0.00022088615585757072, "loss": 4.685, "mean_token_accuracy": 0.23962218016386033, "num_tokens": 129425785.0, "step": 74620 }, { "entropy": 5.367297744750976, "epoch": 5.806068858198794, "grad_norm": 1.2265625, "learning_rate": 0.00022085925419794872, "loss": 4.6607, "mean_token_accuracy": 0.2411056786775589, "num_tokens": 129434962.0, "step": 74625 }, { "entropy": 5.401784038543701, "epoch": 5.806457887570511, "grad_norm": 1.2890625, "learning_rate": 0.00022083235335982633, "loss": 4.7868, "mean_token_accuracy": 0.22850004583597183, "num_tokens": 129444034.0, "step": 74630 }, { "entropy": 5.346003913879395, "epoch": 5.806846916942229, "grad_norm": 1.2109375, "learning_rate": 0.00022080545334361175, "loss": 4.6402, "mean_token_accuracy": 0.23843393176794053, "num_tokens": 129453278.0, "step": 74635 }, { "entropy": 5.435863971710205, "epoch": 5.807235946313947, "grad_norm": 1.2734375, "learning_rate": 0.0002207785541497132, "loss": 4.7527, "mean_token_accuracy": 0.2252323567867279, "num_tokens": 129461541.0, "step": 74640 }, { "entropy": 5.4055928707122805, "epoch": 5.807624975685664, "grad_norm": 1.2109375, "learning_rate": 0.00022075165577853872, "loss": 4.7088, "mean_token_accuracy": 0.23647991120815276, "num_tokens": 129470098.0, "step": 74645 }, { "entropy": 5.353036642074585, "epoch": 5.808014005057382, "grad_norm": 1.390625, "learning_rate": 0.0002207247582304966, "loss": 4.6058, "mean_token_accuracy": 0.23366523087024688, "num_tokens": 129477970.0, "step": 74650 }, { "entropy": 5.418648958206177, "epoch": 5.8084030344291, "grad_norm": 1.28125, "learning_rate": 0.00022069786150599486, "loss": 4.6587, "mean_token_accuracy": 0.23883021175861358, "num_tokens": 129486115.0, "step": 74655 }, { "entropy": 5.401842832565308, "epoch": 5.808792063800817, "grad_norm": 1.2890625, "learning_rate": 0.00022067096560544165, "loss": 4.6821, "mean_token_accuracy": 0.23765720576047897, "num_tokens": 129494360.0, "step": 74660 }, { "entropy": 5.382536792755127, "epoch": 5.809181093172534, "grad_norm": 1.3359375, "learning_rate": 0.00022064407052924494, "loss": 4.7044, "mean_token_accuracy": 0.24210364371538162, "num_tokens": 129503547.0, "step": 74665 }, { "entropy": 5.351253938674927, "epoch": 5.809570122544252, "grad_norm": 1.2890625, "learning_rate": 0.00022061717627781308, "loss": 4.6619, "mean_token_accuracy": 0.2442904904484749, "num_tokens": 129511723.0, "step": 74670 }, { "entropy": 5.420757102966308, "epoch": 5.80995915191597, "grad_norm": 1.265625, "learning_rate": 0.00022059028285155397, "loss": 4.6625, "mean_token_accuracy": 0.23985886871814727, "num_tokens": 129519965.0, "step": 74675 }, { "entropy": 5.613866567611694, "epoch": 5.810348181287687, "grad_norm": 1.2890625, "learning_rate": 0.00022056339025087573, "loss": 4.872, "mean_token_accuracy": 0.22071827352046966, "num_tokens": 129529059.0, "step": 74680 }, { "entropy": 5.406025314331055, "epoch": 5.810737210659405, "grad_norm": 1.1484375, "learning_rate": 0.0002205364984761864, "loss": 4.6648, "mean_token_accuracy": 0.24102855920791627, "num_tokens": 129537536.0, "step": 74685 }, { "entropy": 5.355253410339356, "epoch": 5.811126240031122, "grad_norm": 1.2890625, "learning_rate": 0.000220509607527894, "loss": 4.7019, "mean_token_accuracy": 0.23133934140205384, "num_tokens": 129546579.0, "step": 74690 }, { "entropy": 5.311376285552979, "epoch": 5.81151526940284, "grad_norm": 1.3515625, "learning_rate": 0.0002204827174064066, "loss": 4.5972, "mean_token_accuracy": 0.2452852413058281, "num_tokens": 129555878.0, "step": 74695 }, { "entropy": 5.347614002227783, "epoch": 5.811904298774557, "grad_norm": 1.234375, "learning_rate": 0.00022045582811213221, "loss": 4.6539, "mean_token_accuracy": 0.23980513364076614, "num_tokens": 129564612.0, "step": 74700 }, { "entropy": 5.478641080856323, "epoch": 5.812293328146275, "grad_norm": 1.2109375, "learning_rate": 0.00022042893964547877, "loss": 4.7506, "mean_token_accuracy": 0.2272763356566429, "num_tokens": 129573084.0, "step": 74705 }, { "entropy": 5.4538696765899655, "epoch": 5.812682357517993, "grad_norm": 1.265625, "learning_rate": 0.0002204020520068543, "loss": 4.7387, "mean_token_accuracy": 0.23256502002477647, "num_tokens": 129581446.0, "step": 74710 }, { "entropy": 5.42230257987976, "epoch": 5.81307138688971, "grad_norm": 1.2734375, "learning_rate": 0.00022037516519666684, "loss": 4.7568, "mean_token_accuracy": 0.2264723852276802, "num_tokens": 129590935.0, "step": 74715 }, { "entropy": 5.47996335029602, "epoch": 5.813460416261428, "grad_norm": 1.2734375, "learning_rate": 0.0002203482792153243, "loss": 4.7578, "mean_token_accuracy": 0.2241360515356064, "num_tokens": 129599237.0, "step": 74720 }, { "entropy": 5.4172422885894775, "epoch": 5.813849445633146, "grad_norm": 1.1875, "learning_rate": 0.0002203213940632346, "loss": 4.6106, "mean_token_accuracy": 0.2370064750313759, "num_tokens": 129607915.0, "step": 74725 }, { "entropy": 5.4401463031768795, "epoch": 5.814238475004863, "grad_norm": 1.2890625, "learning_rate": 0.00022029450974080572, "loss": 4.7376, "mean_token_accuracy": 0.2277721256017685, "num_tokens": 129616659.0, "step": 74730 }, { "entropy": 5.386662817001342, "epoch": 5.81462750437658, "grad_norm": 1.3046875, "learning_rate": 0.00022026762624844555, "loss": 4.6854, "mean_token_accuracy": 0.23934656977653504, "num_tokens": 129624950.0, "step": 74735 }, { "entropy": 5.3544025897979735, "epoch": 5.815016533748298, "grad_norm": 1.2421875, "learning_rate": 0.00022024074358656205, "loss": 4.644, "mean_token_accuracy": 0.23759970515966417, "num_tokens": 129633977.0, "step": 74740 }, { "entropy": 5.3817283630371096, "epoch": 5.815405563120016, "grad_norm": 1.2578125, "learning_rate": 0.00022021386175556318, "loss": 4.6426, "mean_token_accuracy": 0.23941560089588165, "num_tokens": 129641926.0, "step": 74745 }, { "entropy": 5.3997111320495605, "epoch": 5.815794592491733, "grad_norm": 1.265625, "learning_rate": 0.0002201869807558567, "loss": 4.7394, "mean_token_accuracy": 0.22222796976566314, "num_tokens": 129651030.0, "step": 74750 }, { "entropy": 5.455397605895996, "epoch": 5.816183621863451, "grad_norm": 1.296875, "learning_rate": 0.00022016010058785053, "loss": 4.7558, "mean_token_accuracy": 0.2309670552611351, "num_tokens": 129658701.0, "step": 74755 }, { "entropy": 5.4305548667907715, "epoch": 5.816572651235168, "grad_norm": 1.21875, "learning_rate": 0.00022013322125195256, "loss": 4.6775, "mean_token_accuracy": 0.23988669067621232, "num_tokens": 129666641.0, "step": 74760 }, { "entropy": 5.384586048126221, "epoch": 5.816961680606886, "grad_norm": 1.28125, "learning_rate": 0.0002201063427485706, "loss": 4.7764, "mean_token_accuracy": 0.23116834163665773, "num_tokens": 129674575.0, "step": 74765 }, { "entropy": 5.366006517410279, "epoch": 5.817350709978603, "grad_norm": 1.2109375, "learning_rate": 0.0002200794650781126, "loss": 4.7118, "mean_token_accuracy": 0.23996674865484238, "num_tokens": 129683593.0, "step": 74770 }, { "entropy": 5.367778539657593, "epoch": 5.817739739350321, "grad_norm": 1.3671875, "learning_rate": 0.00022005258824098624, "loss": 4.698, "mean_token_accuracy": 0.23109169453382492, "num_tokens": 129692009.0, "step": 74775 }, { "entropy": 5.399206018447876, "epoch": 5.818128768722039, "grad_norm": 1.21875, "learning_rate": 0.0002200257122375995, "loss": 4.6402, "mean_token_accuracy": 0.24286833852529527, "num_tokens": 129701156.0, "step": 74780 }, { "entropy": 5.4480749607086185, "epoch": 5.818517798093756, "grad_norm": 1.1953125, "learning_rate": 0.00021999883706835994, "loss": 4.7337, "mean_token_accuracy": 0.23289646506309508, "num_tokens": 129709985.0, "step": 74785 }, { "entropy": 5.40141487121582, "epoch": 5.818906827465474, "grad_norm": 1.203125, "learning_rate": 0.00021997196273367553, "loss": 4.6788, "mean_token_accuracy": 0.23765258938074113, "num_tokens": 129718723.0, "step": 74790 }, { "entropy": 5.358666276931762, "epoch": 5.819295856837191, "grad_norm": 1.1953125, "learning_rate": 0.000219945089233954, "loss": 4.6325, "mean_token_accuracy": 0.23483209311962128, "num_tokens": 129727557.0, "step": 74795 }, { "entropy": 5.457809066772461, "epoch": 5.819684886208909, "grad_norm": 1.2734375, "learning_rate": 0.00021991821656960303, "loss": 4.8202, "mean_token_accuracy": 0.22609094977378846, "num_tokens": 129736514.0, "step": 74800 }, { "entropy": 5.408131694793701, "epoch": 5.820073915580626, "grad_norm": 1.234375, "learning_rate": 0.00021989134474103056, "loss": 4.6778, "mean_token_accuracy": 0.23687091171741487, "num_tokens": 129745327.0, "step": 74805 }, { "entropy": 5.335020542144775, "epoch": 5.820462944952344, "grad_norm": 1.2265625, "learning_rate": 0.00021986447374864422, "loss": 4.6585, "mean_token_accuracy": 0.2289414331316948, "num_tokens": 129753843.0, "step": 74810 }, { "entropy": 5.533915328979492, "epoch": 5.820851974324062, "grad_norm": 1.3828125, "learning_rate": 0.00021983760359285171, "loss": 4.8504, "mean_token_accuracy": 0.2298211023211479, "num_tokens": 129762438.0, "step": 74815 }, { "entropy": 5.425169467926025, "epoch": 5.821241003695779, "grad_norm": 1.4296875, "learning_rate": 0.0002198107342740608, "loss": 4.6794, "mean_token_accuracy": 0.23923430740833282, "num_tokens": 129770996.0, "step": 74820 }, { "entropy": 5.402015447616577, "epoch": 5.821630033067496, "grad_norm": 1.25, "learning_rate": 0.00021978386579267907, "loss": 4.6607, "mean_token_accuracy": 0.23781231194734573, "num_tokens": 129779379.0, "step": 74825 }, { "entropy": 5.419774150848388, "epoch": 5.822019062439214, "grad_norm": 1.2890625, "learning_rate": 0.00021975699814911432, "loss": 4.7018, "mean_token_accuracy": 0.23461648374795913, "num_tokens": 129788320.0, "step": 74830 }, { "entropy": 5.451441144943237, "epoch": 5.8224080918109316, "grad_norm": 1.140625, "learning_rate": 0.00021973013134377422, "loss": 4.795, "mean_token_accuracy": 0.228517609834671, "num_tokens": 129798004.0, "step": 74835 }, { "entropy": 5.38828673362732, "epoch": 5.822797121182649, "grad_norm": 1.171875, "learning_rate": 0.00021970326537706643, "loss": 4.6374, "mean_token_accuracy": 0.24212099313735963, "num_tokens": 129807504.0, "step": 74840 }, { "entropy": 5.47853946685791, "epoch": 5.823186150554367, "grad_norm": 1.2890625, "learning_rate": 0.00021967640024939851, "loss": 4.7609, "mean_token_accuracy": 0.23351117521524428, "num_tokens": 129815552.0, "step": 74845 }, { "entropy": 5.359498596191406, "epoch": 5.823575179926085, "grad_norm": 1.234375, "learning_rate": 0.0002196495359611782, "loss": 4.6618, "mean_token_accuracy": 0.2350616231560707, "num_tokens": 129824522.0, "step": 74850 }, { "entropy": 5.327143287658691, "epoch": 5.823964209297802, "grad_norm": 1.203125, "learning_rate": 0.0002196226725128131, "loss": 4.6484, "mean_token_accuracy": 0.23251783400774, "num_tokens": 129833682.0, "step": 74855 }, { "entropy": 5.470075988769532, "epoch": 5.82435323866952, "grad_norm": 1.2109375, "learning_rate": 0.00021959580990471073, "loss": 4.8327, "mean_token_accuracy": 0.22469857037067414, "num_tokens": 129842090.0, "step": 74860 }, { "entropy": 5.541165447235107, "epoch": 5.824742268041237, "grad_norm": 1.2578125, "learning_rate": 0.0002195689481372788, "loss": 4.8214, "mean_token_accuracy": 0.2250499337911606, "num_tokens": 129850636.0, "step": 74865 }, { "entropy": 5.415022945404052, "epoch": 5.8251312974129545, "grad_norm": 1.2734375, "learning_rate": 0.00021954208721092482, "loss": 4.6825, "mean_token_accuracy": 0.24056483507156373, "num_tokens": 129859501.0, "step": 74870 }, { "entropy": 5.491297960281372, "epoch": 5.825520326784672, "grad_norm": 1.265625, "learning_rate": 0.00021951522712605648, "loss": 4.8737, "mean_token_accuracy": 0.21909617632627487, "num_tokens": 129868064.0, "step": 74875 }, { "entropy": 5.450510263442993, "epoch": 5.82590935615639, "grad_norm": 1.3046875, "learning_rate": 0.00021948836788308117, "loss": 4.7974, "mean_token_accuracy": 0.230095711350441, "num_tokens": 129877322.0, "step": 74880 }, { "entropy": 5.440655326843261, "epoch": 5.826298385528108, "grad_norm": 1.2265625, "learning_rate": 0.00021946150948240657, "loss": 4.7157, "mean_token_accuracy": 0.22622565031051636, "num_tokens": 129887319.0, "step": 74885 }, { "entropy": 5.413228511810303, "epoch": 5.8266874148998244, "grad_norm": 1.2734375, "learning_rate": 0.00021943465192444023, "loss": 4.6673, "mean_token_accuracy": 0.24003024995326996, "num_tokens": 129895726.0, "step": 74890 }, { "entropy": 5.519196891784668, "epoch": 5.827076444271542, "grad_norm": 1.3046875, "learning_rate": 0.00021940779520958952, "loss": 4.8341, "mean_token_accuracy": 0.221943299472332, "num_tokens": 129905011.0, "step": 74895 }, { "entropy": 5.285239362716675, "epoch": 5.82746547364326, "grad_norm": 1.1171875, "learning_rate": 0.0002193809393382621, "loss": 4.6113, "mean_token_accuracy": 0.23783642649650574, "num_tokens": 129914912.0, "step": 74900 }, { "entropy": 5.401373481750488, "epoch": 5.8278545030149775, "grad_norm": 1.28125, "learning_rate": 0.00021935408431086528, "loss": 4.7177, "mean_token_accuracy": 0.2349007546901703, "num_tokens": 129923602.0, "step": 74905 }, { "entropy": 5.351676750183105, "epoch": 5.828243532386695, "grad_norm": 1.375, "learning_rate": 0.00021932723012780677, "loss": 4.6181, "mean_token_accuracy": 0.23882330060005189, "num_tokens": 129931626.0, "step": 74910 }, { "entropy": 5.4146496772766115, "epoch": 5.828632561758413, "grad_norm": 1.3203125, "learning_rate": 0.00021930037678949388, "loss": 4.7239, "mean_token_accuracy": 0.236628982424736, "num_tokens": 129940097.0, "step": 74915 }, { "entropy": 5.350550508499145, "epoch": 5.829021591130131, "grad_norm": 1.2578125, "learning_rate": 0.00021927352429633413, "loss": 4.719, "mean_token_accuracy": 0.23776727318763732, "num_tokens": 129948500.0, "step": 74920 }, { "entropy": 5.441208171844482, "epoch": 5.829410620501848, "grad_norm": 1.328125, "learning_rate": 0.00021924667264873492, "loss": 4.7547, "mean_token_accuracy": 0.2314123332500458, "num_tokens": 129957224.0, "step": 74925 }, { "entropy": 5.485840463638306, "epoch": 5.829799649873565, "grad_norm": 1.4375, "learning_rate": 0.0002192198218471037, "loss": 4.7617, "mean_token_accuracy": 0.2331481471657753, "num_tokens": 129965962.0, "step": 74930 }, { "entropy": 5.3584291458129885, "epoch": 5.830188679245283, "grad_norm": 1.2578125, "learning_rate": 0.00021919297189184795, "loss": 4.6123, "mean_token_accuracy": 0.23515749871730804, "num_tokens": 129973984.0, "step": 74935 }, { "entropy": 5.466229486465454, "epoch": 5.8305777086170005, "grad_norm": 1.2734375, "learning_rate": 0.000219166122783375, "loss": 4.8219, "mean_token_accuracy": 0.22972820401191713, "num_tokens": 129982509.0, "step": 74940 }, { "entropy": 5.384138059616089, "epoch": 5.830966737988718, "grad_norm": 1.390625, "learning_rate": 0.00021913927452209232, "loss": 4.7097, "mean_token_accuracy": 0.23329777121543885, "num_tokens": 129990682.0, "step": 74945 }, { "entropy": 5.4293050289154055, "epoch": 5.831355767360436, "grad_norm": 1.328125, "learning_rate": 0.00021911242710840717, "loss": 4.7058, "mean_token_accuracy": 0.2347875416278839, "num_tokens": 129999727.0, "step": 74950 }, { "entropy": 5.378530359268188, "epoch": 5.831744796732154, "grad_norm": 1.28125, "learning_rate": 0.00021908558054272703, "loss": 4.6285, "mean_token_accuracy": 0.24019158780574798, "num_tokens": 130008584.0, "step": 74955 }, { "entropy": 5.352772378921509, "epoch": 5.83213382610387, "grad_norm": 1.2421875, "learning_rate": 0.0002190587348254592, "loss": 4.6592, "mean_token_accuracy": 0.2342011421918869, "num_tokens": 130017277.0, "step": 74960 }, { "entropy": 5.307932138442993, "epoch": 5.832522855475588, "grad_norm": 1.2578125, "learning_rate": 0.000219031889957011, "loss": 4.6304, "mean_token_accuracy": 0.2356787458062172, "num_tokens": 130025863.0, "step": 74965 }, { "entropy": 5.458473777770996, "epoch": 5.832911884847306, "grad_norm": 1.2265625, "learning_rate": 0.00021900504593778985, "loss": 4.8697, "mean_token_accuracy": 0.21456712037324904, "num_tokens": 130034475.0, "step": 74970 }, { "entropy": 5.3968682289123535, "epoch": 5.8333009142190235, "grad_norm": 1.234375, "learning_rate": 0.00021897820276820296, "loss": 4.6614, "mean_token_accuracy": 0.24137951880693437, "num_tokens": 130043332.0, "step": 74975 }, { "entropy": 5.471196794509888, "epoch": 5.833689943590741, "grad_norm": 1.28125, "learning_rate": 0.0002189513604486577, "loss": 4.7754, "mean_token_accuracy": 0.22156031876802446, "num_tokens": 130051988.0, "step": 74980 }, { "entropy": 5.386880874633789, "epoch": 5.834078972962459, "grad_norm": 1.25, "learning_rate": 0.0002189245189795613, "loss": 4.6835, "mean_token_accuracy": 0.23673636168241502, "num_tokens": 130060136.0, "step": 74985 }, { "entropy": 5.378296184539795, "epoch": 5.834468002334177, "grad_norm": 1.2265625, "learning_rate": 0.00021889767836132107, "loss": 4.6871, "mean_token_accuracy": 0.23277265429496766, "num_tokens": 130068653.0, "step": 74990 }, { "entropy": 5.427887630462647, "epoch": 5.834857031705893, "grad_norm": 1.234375, "learning_rate": 0.00021887083859434433, "loss": 4.7747, "mean_token_accuracy": 0.22601681798696518, "num_tokens": 130077681.0, "step": 74995 }, { "entropy": 5.420094966888428, "epoch": 5.835246061077611, "grad_norm": 1.265625, "learning_rate": 0.00021884399967903818, "loss": 4.6979, "mean_token_accuracy": 0.23909737914800644, "num_tokens": 130085977.0, "step": 75000 }, { "epoch": 5.835246061077611, "eval_entropy": 5.189041754279261, "eval_loss": 4.8822550773620605, "eval_mean_token_accuracy": 0.23228316240378363, "eval_num_tokens": 130085977.0, "eval_runtime": 28.6477, "eval_samples_per_second": 1450.656, "eval_steps_per_second": 181.341, "step": 75000 }, { "entropy": 5.440436220169067, "epoch": 5.835635090449329, "grad_norm": 1.25, "learning_rate": 0.00021881716161581, "loss": 4.771, "mean_token_accuracy": 0.22901004999876023, "num_tokens": 130093954.0, "step": 75005 }, { "entropy": 5.393560552597046, "epoch": 5.8360241198210465, "grad_norm": 1.234375, "learning_rate": 0.00021879032440506697, "loss": 4.7215, "mean_token_accuracy": 0.22607511132955552, "num_tokens": 130102268.0, "step": 75010 }, { "entropy": 5.4361615657806395, "epoch": 5.836413149192764, "grad_norm": 1.3046875, "learning_rate": 0.0002187634880472163, "loss": 4.6851, "mean_token_accuracy": 0.2343365117907524, "num_tokens": 130109988.0, "step": 75015 }, { "entropy": 5.353677415847779, "epoch": 5.836802178564482, "grad_norm": 1.2109375, "learning_rate": 0.00021873665254266517, "loss": 4.7159, "mean_token_accuracy": 0.235113725066185, "num_tokens": 130119140.0, "step": 75020 }, { "entropy": 5.389383220672608, "epoch": 5.837191207936199, "grad_norm": 1.2265625, "learning_rate": 0.00021870981789182082, "loss": 4.6796, "mean_token_accuracy": 0.23319031149148942, "num_tokens": 130127956.0, "step": 75025 }, { "entropy": 5.417613315582275, "epoch": 5.837580237307916, "grad_norm": 1.265625, "learning_rate": 0.0002186829840950904, "loss": 4.7685, "mean_token_accuracy": 0.23745323419570924, "num_tokens": 130137405.0, "step": 75030 }, { "entropy": 5.492853450775146, "epoch": 5.837969266679634, "grad_norm": 1.3125, "learning_rate": 0.000218656151152881, "loss": 4.7212, "mean_token_accuracy": 0.23608200252056122, "num_tokens": 130145972.0, "step": 75035 }, { "entropy": 5.443893098831177, "epoch": 5.838358296051352, "grad_norm": 1.1796875, "learning_rate": 0.00021862931906559992, "loss": 4.7775, "mean_token_accuracy": 0.22974815368652343, "num_tokens": 130155575.0, "step": 75040 }, { "entropy": 5.403016376495361, "epoch": 5.8387473254230695, "grad_norm": 1.1640625, "learning_rate": 0.00021860248783365412, "loss": 4.6462, "mean_token_accuracy": 0.23377186805009842, "num_tokens": 130164737.0, "step": 75045 }, { "entropy": 5.369895124435425, "epoch": 5.839136354794787, "grad_norm": 1.1640625, "learning_rate": 0.00021857565745745083, "loss": 4.7085, "mean_token_accuracy": 0.2369548961520195, "num_tokens": 130174376.0, "step": 75050 }, { "entropy": 5.432428932189941, "epoch": 5.839525384166505, "grad_norm": 1.140625, "learning_rate": 0.00021854882793739716, "loss": 4.7835, "mean_token_accuracy": 0.2221780851483345, "num_tokens": 130183321.0, "step": 75055 }, { "entropy": 5.312546873092652, "epoch": 5.839914413538223, "grad_norm": 1.15625, "learning_rate": 0.00021852199927390015, "loss": 4.589, "mean_token_accuracy": 0.23595236241817474, "num_tokens": 130191766.0, "step": 75060 }, { "entropy": 5.384715223312378, "epoch": 5.840303442909939, "grad_norm": 1.15625, "learning_rate": 0.0002184951714673668, "loss": 4.7476, "mean_token_accuracy": 0.23173545002937318, "num_tokens": 130201033.0, "step": 75065 }, { "entropy": 5.374744987487793, "epoch": 5.840692472281657, "grad_norm": 1.171875, "learning_rate": 0.00021846834451820437, "loss": 4.6638, "mean_token_accuracy": 0.23468036353588104, "num_tokens": 130210397.0, "step": 75070 }, { "entropy": 5.333154249191284, "epoch": 5.841081501653375, "grad_norm": 1.25, "learning_rate": 0.00021844151842681986, "loss": 4.5843, "mean_token_accuracy": 0.2460404485464096, "num_tokens": 130219297.0, "step": 75075 }, { "entropy": 5.411053466796875, "epoch": 5.8414705310250925, "grad_norm": 1.3125, "learning_rate": 0.00021841469319362034, "loss": 4.7437, "mean_token_accuracy": 0.23074395209550858, "num_tokens": 130227606.0, "step": 75080 }, { "entropy": 5.371033191680908, "epoch": 5.84185956039681, "grad_norm": 1.234375, "learning_rate": 0.00021838786881901267, "loss": 4.6881, "mean_token_accuracy": 0.24003113955259323, "num_tokens": 130236636.0, "step": 75085 }, { "entropy": 5.412061786651611, "epoch": 5.842248589768528, "grad_norm": 1.3359375, "learning_rate": 0.00021836104530340407, "loss": 4.6553, "mean_token_accuracy": 0.2395092263817787, "num_tokens": 130244705.0, "step": 75090 }, { "entropy": 5.511723852157592, "epoch": 5.842637619140245, "grad_norm": 1.21875, "learning_rate": 0.00021833422264720136, "loss": 4.8694, "mean_token_accuracy": 0.21953065097332, "num_tokens": 130252914.0, "step": 75095 }, { "entropy": 5.414542961120605, "epoch": 5.843026648511962, "grad_norm": 1.265625, "learning_rate": 0.00021830740085081169, "loss": 4.7495, "mean_token_accuracy": 0.23152572959661483, "num_tokens": 130262533.0, "step": 75100 }, { "entropy": 5.406823253631591, "epoch": 5.84341567788368, "grad_norm": 1.34375, "learning_rate": 0.000218280579914642, "loss": 4.6301, "mean_token_accuracy": 0.23029024600982667, "num_tokens": 130270104.0, "step": 75105 }, { "entropy": 5.3930768966674805, "epoch": 5.843804707255398, "grad_norm": 1.2734375, "learning_rate": 0.00021825375983909918, "loss": 4.706, "mean_token_accuracy": 0.2328567162156105, "num_tokens": 130279101.0, "step": 75110 }, { "entropy": 5.423156023025513, "epoch": 5.8441937366271155, "grad_norm": 1.2421875, "learning_rate": 0.0002182269406245903, "loss": 4.7127, "mean_token_accuracy": 0.2351074695587158, "num_tokens": 130288343.0, "step": 75115 }, { "entropy": 5.412784624099731, "epoch": 5.844582765998833, "grad_norm": 1.296875, "learning_rate": 0.00021820012227152214, "loss": 4.6644, "mean_token_accuracy": 0.24363360702991485, "num_tokens": 130297755.0, "step": 75120 }, { "entropy": 5.379198694229126, "epoch": 5.844971795370551, "grad_norm": 1.328125, "learning_rate": 0.00021817330478030177, "loss": 4.6914, "mean_token_accuracy": 0.23391299843788146, "num_tokens": 130306517.0, "step": 75125 }, { "entropy": 5.3564064502716064, "epoch": 5.845360824742268, "grad_norm": 1.2109375, "learning_rate": 0.00021814648815133604, "loss": 4.723, "mean_token_accuracy": 0.23891696184873581, "num_tokens": 130315633.0, "step": 75130 }, { "entropy": 5.373842477798462, "epoch": 5.845749854113985, "grad_norm": 1.2265625, "learning_rate": 0.00021811967238503184, "loss": 4.6155, "mean_token_accuracy": 0.23208567202091218, "num_tokens": 130324241.0, "step": 75135 }, { "entropy": 5.449653196334839, "epoch": 5.846138883485703, "grad_norm": 1.28125, "learning_rate": 0.00021809285748179612, "loss": 4.7778, "mean_token_accuracy": 0.22367812991142272, "num_tokens": 130332569.0, "step": 75140 }, { "entropy": 5.420026731491089, "epoch": 5.846527912857421, "grad_norm": 1.1484375, "learning_rate": 0.0002180660434420357, "loss": 4.6786, "mean_token_accuracy": 0.23103420287370682, "num_tokens": 130341667.0, "step": 75145 }, { "entropy": 5.472999000549317, "epoch": 5.8469169422291385, "grad_norm": 1.203125, "learning_rate": 0.00021803923026615746, "loss": 4.7945, "mean_token_accuracy": 0.22467969506978988, "num_tokens": 130350659.0, "step": 75150 }, { "entropy": 5.435426235198975, "epoch": 5.847305971600856, "grad_norm": 1.328125, "learning_rate": 0.0002180124179545682, "loss": 4.689, "mean_token_accuracy": 0.23886821717023848, "num_tokens": 130359010.0, "step": 75155 }, { "entropy": 5.384161520004272, "epoch": 5.847695000972573, "grad_norm": 1.203125, "learning_rate": 0.00021798560650767486, "loss": 4.7649, "mean_token_accuracy": 0.23188586831092833, "num_tokens": 130368649.0, "step": 75160 }, { "entropy": 5.328509712219239, "epoch": 5.848084030344291, "grad_norm": 1.1953125, "learning_rate": 0.00021795879592588418, "loss": 4.6639, "mean_token_accuracy": 0.23339553624391557, "num_tokens": 130377123.0, "step": 75165 }, { "entropy": 5.38571720123291, "epoch": 5.848473059716008, "grad_norm": 1.265625, "learning_rate": 0.00021793198620960293, "loss": 4.6094, "mean_token_accuracy": 0.24373237937688827, "num_tokens": 130385408.0, "step": 75170 }, { "entropy": 5.493203735351562, "epoch": 5.848862089087726, "grad_norm": 1.328125, "learning_rate": 0.00021790517735923798, "loss": 4.8478, "mean_token_accuracy": 0.21712367981672287, "num_tokens": 130394359.0, "step": 75175 }, { "entropy": 5.362399530410767, "epoch": 5.849251118459444, "grad_norm": 1.234375, "learning_rate": 0.0002178783693751961, "loss": 4.5868, "mean_token_accuracy": 0.24853430092334747, "num_tokens": 130403155.0, "step": 75180 }, { "entropy": 5.407753562927246, "epoch": 5.8496401478311615, "grad_norm": 1.2578125, "learning_rate": 0.000217851562257884, "loss": 4.7515, "mean_token_accuracy": 0.23204280585050582, "num_tokens": 130411281.0, "step": 75185 }, { "entropy": 5.430237531661987, "epoch": 5.850029177202879, "grad_norm": 1.28125, "learning_rate": 0.00021782475600770856, "loss": 4.7906, "mean_token_accuracy": 0.22574642300605774, "num_tokens": 130419310.0, "step": 75190 }, { "entropy": 5.459553909301758, "epoch": 5.850418206574597, "grad_norm": 1.265625, "learning_rate": 0.00021779795062507634, "loss": 4.6999, "mean_token_accuracy": 0.23933560252189637, "num_tokens": 130427668.0, "step": 75195 }, { "entropy": 5.400187587738037, "epoch": 5.850807235946314, "grad_norm": 1.1953125, "learning_rate": 0.00021777114611039422, "loss": 4.7116, "mean_token_accuracy": 0.23006826341152192, "num_tokens": 130436727.0, "step": 75200 }, { "entropy": 5.433020114898682, "epoch": 5.851196265318031, "grad_norm": 1.3046875, "learning_rate": 0.00021774434246406887, "loss": 4.7671, "mean_token_accuracy": 0.23111289441585542, "num_tokens": 130445347.0, "step": 75205 }, { "entropy": 5.4675311088562015, "epoch": 5.851585294689749, "grad_norm": 1.28125, "learning_rate": 0.00021771753968650705, "loss": 4.7775, "mean_token_accuracy": 0.23570704609155654, "num_tokens": 130454410.0, "step": 75210 }, { "entropy": 5.4735596656799315, "epoch": 5.851974324061467, "grad_norm": 1.296875, "learning_rate": 0.00021769073777811533, "loss": 4.7999, "mean_token_accuracy": 0.22724099457263947, "num_tokens": 130463289.0, "step": 75215 }, { "entropy": 5.377410745620727, "epoch": 5.8523633534331845, "grad_norm": 1.234375, "learning_rate": 0.00021766393673930046, "loss": 4.6233, "mean_token_accuracy": 0.2403624624013901, "num_tokens": 130471645.0, "step": 75220 }, { "entropy": 5.397852087020874, "epoch": 5.852752382804901, "grad_norm": 1.265625, "learning_rate": 0.00021763713657046906, "loss": 4.6725, "mean_token_accuracy": 0.23484694063663483, "num_tokens": 130480246.0, "step": 75225 }, { "entropy": 5.341460943222046, "epoch": 5.853141412176619, "grad_norm": 1.2265625, "learning_rate": 0.00021761033727202782, "loss": 4.7109, "mean_token_accuracy": 0.23132773190736772, "num_tokens": 130488960.0, "step": 75230 }, { "entropy": 5.26563081741333, "epoch": 5.853530441548337, "grad_norm": 1.1796875, "learning_rate": 0.00021758353884438343, "loss": 4.5422, "mean_token_accuracy": 0.24834733009338378, "num_tokens": 130497776.0, "step": 75235 }, { "entropy": 5.3771710872650145, "epoch": 5.853919470920054, "grad_norm": 1.2734375, "learning_rate": 0.0002175567412879424, "loss": 4.6718, "mean_token_accuracy": 0.2354313999414444, "num_tokens": 130507108.0, "step": 75240 }, { "entropy": 5.452317571640014, "epoch": 5.854308500291772, "grad_norm": 1.2421875, "learning_rate": 0.00021752994460311144, "loss": 4.7389, "mean_token_accuracy": 0.23730547726154327, "num_tokens": 130515675.0, "step": 75245 }, { "entropy": 5.482429695129395, "epoch": 5.85469752966349, "grad_norm": 1.328125, "learning_rate": 0.00021750314879029708, "loss": 4.794, "mean_token_accuracy": 0.23259347826242446, "num_tokens": 130524528.0, "step": 75250 }, { "entropy": 5.456248760223389, "epoch": 5.8550865590352075, "grad_norm": 1.3046875, "learning_rate": 0.0002174763538499059, "loss": 4.7622, "mean_token_accuracy": 0.22153889685869216, "num_tokens": 130533126.0, "step": 75255 }, { "entropy": 5.409974908828735, "epoch": 5.855475588406925, "grad_norm": 1.25, "learning_rate": 0.00021744955978234449, "loss": 4.7303, "mean_token_accuracy": 0.2326360210776329, "num_tokens": 130541820.0, "step": 75260 }, { "entropy": 5.308184719085693, "epoch": 5.855864617778642, "grad_norm": 1.2734375, "learning_rate": 0.0002174227665880193, "loss": 4.4939, "mean_token_accuracy": 0.24678035080432892, "num_tokens": 130550438.0, "step": 75265 }, { "entropy": 5.401589870452881, "epoch": 5.85625364715036, "grad_norm": 1.21875, "learning_rate": 0.00021739597426733714, "loss": 4.7928, "mean_token_accuracy": 0.23371152728796005, "num_tokens": 130559694.0, "step": 75270 }, { "entropy": 5.373457527160644, "epoch": 5.856642676522077, "grad_norm": 1.21875, "learning_rate": 0.00021736918282070435, "loss": 4.7087, "mean_token_accuracy": 0.23313440829515458, "num_tokens": 130568442.0, "step": 75275 }, { "entropy": 5.487116050720215, "epoch": 5.857031705893795, "grad_norm": 1.1875, "learning_rate": 0.00021734239224852742, "loss": 4.6914, "mean_token_accuracy": 0.22669809460639953, "num_tokens": 130577934.0, "step": 75280 }, { "entropy": 5.378036594390869, "epoch": 5.857420735265513, "grad_norm": 1.296875, "learning_rate": 0.00021731560255121296, "loss": 4.597, "mean_token_accuracy": 0.245254448056221, "num_tokens": 130586083.0, "step": 75285 }, { "entropy": 5.425135135650635, "epoch": 5.8578097646372305, "grad_norm": 1.3046875, "learning_rate": 0.00021728881372916743, "loss": 4.6723, "mean_token_accuracy": 0.2345619887113571, "num_tokens": 130594645.0, "step": 75290 }, { "entropy": 5.345851230621338, "epoch": 5.858198794008947, "grad_norm": 1.234375, "learning_rate": 0.0002172620257827973, "loss": 4.7421, "mean_token_accuracy": 0.23869220167398453, "num_tokens": 130602626.0, "step": 75295 }, { "entropy": 5.333785581588745, "epoch": 5.858587823380665, "grad_norm": 1.2734375, "learning_rate": 0.00021723523871250905, "loss": 4.723, "mean_token_accuracy": 0.2388553574681282, "num_tokens": 130611204.0, "step": 75300 }, { "entropy": 5.457787704467774, "epoch": 5.858976852752383, "grad_norm": 1.21875, "learning_rate": 0.00021720845251870907, "loss": 4.8097, "mean_token_accuracy": 0.22408759742975234, "num_tokens": 130619989.0, "step": 75305 }, { "entropy": 5.400807809829712, "epoch": 5.8593658821241, "grad_norm": 1.203125, "learning_rate": 0.00021718166720180384, "loss": 4.659, "mean_token_accuracy": 0.24193836003541946, "num_tokens": 130628288.0, "step": 75310 }, { "entropy": 5.413465309143066, "epoch": 5.859754911495818, "grad_norm": 1.1953125, "learning_rate": 0.0002171548827621998, "loss": 4.7394, "mean_token_accuracy": 0.23456821739673614, "num_tokens": 130636682.0, "step": 75315 }, { "entropy": 5.376766300201416, "epoch": 5.860143940867536, "grad_norm": 1.2578125, "learning_rate": 0.0002171280992003033, "loss": 4.7574, "mean_token_accuracy": 0.231772518157959, "num_tokens": 130645702.0, "step": 75320 }, { "entropy": 5.452128648757935, "epoch": 5.8605329702392535, "grad_norm": 1.2265625, "learning_rate": 0.00021710131651652087, "loss": 4.7965, "mean_token_accuracy": 0.2315473288297653, "num_tokens": 130655254.0, "step": 75325 }, { "entropy": 5.452722692489624, "epoch": 5.86092199961097, "grad_norm": 1.25, "learning_rate": 0.00021707453471125866, "loss": 4.6241, "mean_token_accuracy": 0.23871950209140777, "num_tokens": 130663411.0, "step": 75330 }, { "entropy": 5.451143074035644, "epoch": 5.861311028982688, "grad_norm": 1.3046875, "learning_rate": 0.00021704775378492326, "loss": 4.7535, "mean_token_accuracy": 0.23164176642894746, "num_tokens": 130671731.0, "step": 75335 }, { "entropy": 5.384535551071167, "epoch": 5.861700058354406, "grad_norm": 1.171875, "learning_rate": 0.00021702097373792095, "loss": 4.7315, "mean_token_accuracy": 0.2344660699367523, "num_tokens": 130681095.0, "step": 75340 }, { "entropy": 5.452794361114502, "epoch": 5.862089087726123, "grad_norm": 1.203125, "learning_rate": 0.00021699419457065812, "loss": 4.7586, "mean_token_accuracy": 0.23082228600978852, "num_tokens": 130690005.0, "step": 75345 }, { "entropy": 5.37485785484314, "epoch": 5.862478117097841, "grad_norm": 1.203125, "learning_rate": 0.00021696741628354104, "loss": 4.5965, "mean_token_accuracy": 0.24523642808198928, "num_tokens": 130697788.0, "step": 75350 }, { "entropy": 5.284783029556275, "epoch": 5.862867146469559, "grad_norm": 1.2734375, "learning_rate": 0.00021694063887697614, "loss": 4.5576, "mean_token_accuracy": 0.24906431436538695, "num_tokens": 130706968.0, "step": 75355 }, { "entropy": 5.429599571228027, "epoch": 5.863256175841276, "grad_norm": 1.2109375, "learning_rate": 0.00021691386235136951, "loss": 4.7126, "mean_token_accuracy": 0.23352719098329544, "num_tokens": 130715428.0, "step": 75360 }, { "entropy": 5.307359218597412, "epoch": 5.863645205212993, "grad_norm": 1.3515625, "learning_rate": 0.00021688708670712764, "loss": 4.652, "mean_token_accuracy": 0.23202627450227736, "num_tokens": 130724101.0, "step": 75365 }, { "entropy": 5.358681583404541, "epoch": 5.864034234584711, "grad_norm": 1.1640625, "learning_rate": 0.00021686031194465666, "loss": 4.7232, "mean_token_accuracy": 0.22714757174253464, "num_tokens": 130732549.0, "step": 75370 }, { "entropy": 5.357511234283447, "epoch": 5.864423263956429, "grad_norm": 1.28125, "learning_rate": 0.00021683353806436296, "loss": 4.644, "mean_token_accuracy": 0.23871582746505737, "num_tokens": 130741011.0, "step": 75375 }, { "entropy": 5.423283815383911, "epoch": 5.864812293328146, "grad_norm": 1.2578125, "learning_rate": 0.0002168067650666527, "loss": 4.6659, "mean_token_accuracy": 0.23612017929553986, "num_tokens": 130749722.0, "step": 75380 }, { "entropy": 5.432904005050659, "epoch": 5.865201322699864, "grad_norm": 1.3203125, "learning_rate": 0.00021677999295193224, "loss": 4.7371, "mean_token_accuracy": 0.2311698317527771, "num_tokens": 130757984.0, "step": 75385 }, { "entropy": 5.413618659973144, "epoch": 5.865590352071582, "grad_norm": 1.1875, "learning_rate": 0.00021675322172060764, "loss": 4.7181, "mean_token_accuracy": 0.2324267655611038, "num_tokens": 130766341.0, "step": 75390 }, { "entropy": 5.444217109680176, "epoch": 5.8659793814432994, "grad_norm": 1.28125, "learning_rate": 0.00021672645137308516, "loss": 4.6791, "mean_token_accuracy": 0.23747870028018953, "num_tokens": 130774711.0, "step": 75395 }, { "entropy": 5.3784956455230715, "epoch": 5.866368410815016, "grad_norm": 1.25, "learning_rate": 0.00021669968190977107, "loss": 4.7325, "mean_token_accuracy": 0.23173762261867523, "num_tokens": 130784297.0, "step": 75400 }, { "entropy": 5.309084081649781, "epoch": 5.866757440186734, "grad_norm": 1.3515625, "learning_rate": 0.00021667291333107153, "loss": 4.5827, "mean_token_accuracy": 0.24605681896209716, "num_tokens": 130792562.0, "step": 75405 }, { "entropy": 5.36782054901123, "epoch": 5.867146469558452, "grad_norm": 1.2109375, "learning_rate": 0.00021664614563739266, "loss": 4.6837, "mean_token_accuracy": 0.23487478792667388, "num_tokens": 130801089.0, "step": 75410 }, { "entropy": 5.483813810348511, "epoch": 5.867535498930169, "grad_norm": 1.2890625, "learning_rate": 0.00021661937882914067, "loss": 4.8506, "mean_token_accuracy": 0.22688038945198058, "num_tokens": 130810047.0, "step": 75415 }, { "entropy": 5.439763689041138, "epoch": 5.867924528301887, "grad_norm": 1.203125, "learning_rate": 0.00021659261290672168, "loss": 4.8066, "mean_token_accuracy": 0.22324874848127366, "num_tokens": 130819997.0, "step": 75420 }, { "entropy": 5.428563117980957, "epoch": 5.868313557673605, "grad_norm": 1.21875, "learning_rate": 0.00021656584787054184, "loss": 4.6611, "mean_token_accuracy": 0.24274247735738755, "num_tokens": 130828513.0, "step": 75425 }, { "entropy": 5.357526779174805, "epoch": 5.8687025870453216, "grad_norm": 1.375, "learning_rate": 0.00021653908372100728, "loss": 4.6485, "mean_token_accuracy": 0.23672694265842437, "num_tokens": 130837371.0, "step": 75430 }, { "entropy": 5.411957263946533, "epoch": 5.869091616417039, "grad_norm": 1.1796875, "learning_rate": 0.00021651232045852403, "loss": 4.7296, "mean_token_accuracy": 0.2305314436554909, "num_tokens": 130846270.0, "step": 75435 }, { "entropy": 5.422478199005127, "epoch": 5.869480645788757, "grad_norm": 1.2109375, "learning_rate": 0.0002164855580834983, "loss": 4.7404, "mean_token_accuracy": 0.22998669147491455, "num_tokens": 130855228.0, "step": 75440 }, { "entropy": 5.3998371124267575, "epoch": 5.869869675160475, "grad_norm": 1.234375, "learning_rate": 0.000216458796596336, "loss": 4.6729, "mean_token_accuracy": 0.23512174040079117, "num_tokens": 130863795.0, "step": 75445 }, { "entropy": 5.35286774635315, "epoch": 5.870258704532192, "grad_norm": 1.5859375, "learning_rate": 0.00021643203599744327, "loss": 4.6411, "mean_token_accuracy": 0.23935913890600205, "num_tokens": 130871561.0, "step": 75450 }, { "entropy": 5.440907764434814, "epoch": 5.87064773390391, "grad_norm": 1.296875, "learning_rate": 0.00021640527628722622, "loss": 4.7872, "mean_token_accuracy": 0.23571144491434098, "num_tokens": 130881142.0, "step": 75455 }, { "entropy": 5.3262245655059814, "epoch": 5.871036763275628, "grad_norm": 1.421875, "learning_rate": 0.00021637851746609082, "loss": 4.5578, "mean_token_accuracy": 0.2419270396232605, "num_tokens": 130889959.0, "step": 75460 }, { "entropy": 5.415669107437134, "epoch": 5.8714257926473445, "grad_norm": 1.2734375, "learning_rate": 0.00021635175953444314, "loss": 4.7009, "mean_token_accuracy": 0.23700659424066545, "num_tokens": 130899404.0, "step": 75465 }, { "entropy": 5.429981231689453, "epoch": 5.871814822019062, "grad_norm": 1.2578125, "learning_rate": 0.0002163250024926891, "loss": 4.7639, "mean_token_accuracy": 0.22510949671268463, "num_tokens": 130908428.0, "step": 75470 }, { "entropy": 5.352370071411133, "epoch": 5.87220385139078, "grad_norm": 1.2578125, "learning_rate": 0.00021629824634123479, "loss": 4.6429, "mean_token_accuracy": 0.23536140620708465, "num_tokens": 130917100.0, "step": 75475 }, { "entropy": 5.353133583068848, "epoch": 5.872592880762498, "grad_norm": 1.203125, "learning_rate": 0.00021627149108048615, "loss": 4.6668, "mean_token_accuracy": 0.24075983017683028, "num_tokens": 130926600.0, "step": 75480 }, { "entropy": 5.375202560424805, "epoch": 5.872981910134215, "grad_norm": 1.2109375, "learning_rate": 0.0002162447367108492, "loss": 4.7541, "mean_token_accuracy": 0.230471433699131, "num_tokens": 130935726.0, "step": 75485 }, { "entropy": 5.522343158721924, "epoch": 5.873370939505933, "grad_norm": 1.34375, "learning_rate": 0.00021621798323272985, "loss": 4.7978, "mean_token_accuracy": 0.2298094928264618, "num_tokens": 130944543.0, "step": 75490 }, { "entropy": 5.407302570343018, "epoch": 5.87375996887765, "grad_norm": 1.2421875, "learning_rate": 0.000216191230646534, "loss": 4.6611, "mean_token_accuracy": 0.24088895469903945, "num_tokens": 130952872.0, "step": 75495 }, { "entropy": 5.413905906677246, "epoch": 5.8741489982493675, "grad_norm": 1.34375, "learning_rate": 0.00021616447895266762, "loss": 4.7554, "mean_token_accuracy": 0.23421289771795273, "num_tokens": 130961552.0, "step": 75500 }, { "entropy": 5.384846210479736, "epoch": 5.874538027621085, "grad_norm": 1.28125, "learning_rate": 0.00021613772815153666, "loss": 4.6331, "mean_token_accuracy": 0.23659877181053163, "num_tokens": 130969985.0, "step": 75505 }, { "entropy": 5.407803153991699, "epoch": 5.874927056992803, "grad_norm": 1.171875, "learning_rate": 0.00021611097824354697, "loss": 4.6736, "mean_token_accuracy": 0.2402425229549408, "num_tokens": 130978631.0, "step": 75510 }, { "entropy": 5.4554932594299315, "epoch": 5.875316086364521, "grad_norm": 1.1875, "learning_rate": 0.0002160842292291045, "loss": 4.7071, "mean_token_accuracy": 0.22992434054613115, "num_tokens": 130987049.0, "step": 75515 }, { "entropy": 5.411276912689209, "epoch": 5.875705115736238, "grad_norm": 1.3125, "learning_rate": 0.00021605748110861507, "loss": 4.6565, "mean_token_accuracy": 0.23444025665521623, "num_tokens": 130995440.0, "step": 75520 }, { "entropy": 5.440057277679443, "epoch": 5.876094145107956, "grad_norm": 1.2734375, "learning_rate": 0.00021603073388248452, "loss": 4.7202, "mean_token_accuracy": 0.23721881508827208, "num_tokens": 131003812.0, "step": 75525 }, { "entropy": 5.342504501342773, "epoch": 5.876483174479673, "grad_norm": 1.4296875, "learning_rate": 0.0002160039875511186, "loss": 4.6789, "mean_token_accuracy": 0.23969455659389496, "num_tokens": 131012719.0, "step": 75530 }, { "entropy": 5.336475276947022, "epoch": 5.8768722038513905, "grad_norm": 1.203125, "learning_rate": 0.00021597724211492336, "loss": 4.6158, "mean_token_accuracy": 0.24498770385980606, "num_tokens": 131020982.0, "step": 75535 }, { "entropy": 5.497298336029052, "epoch": 5.877261233223108, "grad_norm": 1.3046875, "learning_rate": 0.00021595049757430458, "loss": 4.7876, "mean_token_accuracy": 0.22875746190547944, "num_tokens": 131029772.0, "step": 75540 }, { "entropy": 5.442143058776855, "epoch": 5.877650262594826, "grad_norm": 1.3203125, "learning_rate": 0.00021592375392966802, "loss": 4.7701, "mean_token_accuracy": 0.23075332641601562, "num_tokens": 131038050.0, "step": 75545 }, { "entropy": 5.306444835662842, "epoch": 5.878039291966544, "grad_norm": 1.2890625, "learning_rate": 0.00021589701118141942, "loss": 4.5394, "mean_token_accuracy": 0.2478276401758194, "num_tokens": 131046969.0, "step": 75550 }, { "entropy": 5.443571424484253, "epoch": 5.878428321338261, "grad_norm": 1.2890625, "learning_rate": 0.00021587026932996456, "loss": 4.7914, "mean_token_accuracy": 0.226687516272068, "num_tokens": 131055670.0, "step": 75555 }, { "entropy": 5.327049922943115, "epoch": 5.878817350709978, "grad_norm": 1.34375, "learning_rate": 0.00021584352837570936, "loss": 4.6028, "mean_token_accuracy": 0.24279688894748688, "num_tokens": 131064596.0, "step": 75560 }, { "entropy": 5.414186000823975, "epoch": 5.879206380081696, "grad_norm": 1.21875, "learning_rate": 0.00021581678831905939, "loss": 4.6956, "mean_token_accuracy": 0.2394741579890251, "num_tokens": 131073853.0, "step": 75565 }, { "entropy": 5.404716205596924, "epoch": 5.8795954094534135, "grad_norm": 1.2265625, "learning_rate": 0.00021579004916042044, "loss": 4.7353, "mean_token_accuracy": 0.2250706285238266, "num_tokens": 131082562.0, "step": 75570 }, { "entropy": 5.463085651397705, "epoch": 5.879984438825131, "grad_norm": 1.2265625, "learning_rate": 0.00021576331090019825, "loss": 4.8081, "mean_token_accuracy": 0.2226671114563942, "num_tokens": 131091649.0, "step": 75575 }, { "entropy": 5.437637567520142, "epoch": 5.880373468196849, "grad_norm": 1.2265625, "learning_rate": 0.00021573657353879855, "loss": 4.793, "mean_token_accuracy": 0.23455215692520143, "num_tokens": 131100095.0, "step": 75580 }, { "entropy": 5.449171304702759, "epoch": 5.880762497568567, "grad_norm": 1.21875, "learning_rate": 0.00021570983707662705, "loss": 4.7126, "mean_token_accuracy": 0.23134711980819703, "num_tokens": 131108882.0, "step": 75585 }, { "entropy": 5.364608716964722, "epoch": 5.881151526940284, "grad_norm": 1.265625, "learning_rate": 0.00021568310151408939, "loss": 4.606, "mean_token_accuracy": 0.23858586549758912, "num_tokens": 131117181.0, "step": 75590 }, { "entropy": 5.418085050582886, "epoch": 5.881540556312002, "grad_norm": 1.359375, "learning_rate": 0.00021565636685159117, "loss": 4.704, "mean_token_accuracy": 0.23170534819364547, "num_tokens": 131125524.0, "step": 75595 }, { "entropy": 5.456203269958496, "epoch": 5.881929585683719, "grad_norm": 1.1484375, "learning_rate": 0.0002156296330895382, "loss": 4.8395, "mean_token_accuracy": 0.21729145348072051, "num_tokens": 131134158.0, "step": 75600 }, { "entropy": 5.321143674850464, "epoch": 5.8823186150554365, "grad_norm": 1.1484375, "learning_rate": 0.00021560290022833606, "loss": 4.5967, "mean_token_accuracy": 0.2384444311261177, "num_tokens": 131142778.0, "step": 75605 }, { "entropy": 5.393635702133179, "epoch": 5.882707644427154, "grad_norm": 1.265625, "learning_rate": 0.0002155761682683904, "loss": 4.7073, "mean_token_accuracy": 0.23169841468334199, "num_tokens": 131151534.0, "step": 75610 }, { "entropy": 5.42937445640564, "epoch": 5.883096673798872, "grad_norm": 1.3046875, "learning_rate": 0.00021554943721010673, "loss": 4.7576, "mean_token_accuracy": 0.22836636751890182, "num_tokens": 131159487.0, "step": 75615 }, { "entropy": 5.475813913345337, "epoch": 5.88348570317059, "grad_norm": 1.2734375, "learning_rate": 0.0002155227070538907, "loss": 4.815, "mean_token_accuracy": 0.22410892993211745, "num_tokens": 131167854.0, "step": 75620 }, { "entropy": 5.357760000228882, "epoch": 5.883874732542307, "grad_norm": 1.3203125, "learning_rate": 0.00021549597780014807, "loss": 4.6124, "mean_token_accuracy": 0.23711044937372208, "num_tokens": 131176359.0, "step": 75625 }, { "entropy": 5.423770427703857, "epoch": 5.884263761914024, "grad_norm": 1.15625, "learning_rate": 0.0002154692494492842, "loss": 4.736, "mean_token_accuracy": 0.22697033435106279, "num_tokens": 131185277.0, "step": 75630 }, { "entropy": 5.47053165435791, "epoch": 5.884652791285742, "grad_norm": 1.234375, "learning_rate": 0.00021544252200170465, "loss": 4.7376, "mean_token_accuracy": 0.22495833784341812, "num_tokens": 131193397.0, "step": 75635 }, { "entropy": 5.478902387619018, "epoch": 5.8850418206574595, "grad_norm": 1.296875, "learning_rate": 0.0002154157954578151, "loss": 4.644, "mean_token_accuracy": 0.23610741794109344, "num_tokens": 131201902.0, "step": 75640 }, { "entropy": 5.353312587738037, "epoch": 5.885430850029177, "grad_norm": 1.21875, "learning_rate": 0.000215389069818021, "loss": 4.6493, "mean_token_accuracy": 0.23242338448762895, "num_tokens": 131210794.0, "step": 75645 }, { "entropy": 5.380631160736084, "epoch": 5.885819879400895, "grad_norm": 1.1640625, "learning_rate": 0.00021536234508272783, "loss": 4.654, "mean_token_accuracy": 0.24049709588289261, "num_tokens": 131219607.0, "step": 75650 }, { "entropy": 5.42310528755188, "epoch": 5.886208908772613, "grad_norm": 1.1953125, "learning_rate": 0.00021533562125234125, "loss": 4.7497, "mean_token_accuracy": 0.2324309080839157, "num_tokens": 131228480.0, "step": 75655 }, { "entropy": 5.320685529708863, "epoch": 5.88659793814433, "grad_norm": 1.1640625, "learning_rate": 0.00021530889832726652, "loss": 4.65, "mean_token_accuracy": 0.23750785291194915, "num_tokens": 131237727.0, "step": 75660 }, { "entropy": 5.377548933029175, "epoch": 5.886986967516047, "grad_norm": 1.171875, "learning_rate": 0.00021528217630790937, "loss": 4.6256, "mean_token_accuracy": 0.24403776824474335, "num_tokens": 131246490.0, "step": 75665 }, { "entropy": 5.393870162963867, "epoch": 5.887375996887765, "grad_norm": 1.21875, "learning_rate": 0.00021525545519467506, "loss": 4.6625, "mean_token_accuracy": 0.23279063105583192, "num_tokens": 131255443.0, "step": 75670 }, { "entropy": 5.447005653381348, "epoch": 5.8877650262594825, "grad_norm": 1.21875, "learning_rate": 0.00021522873498796912, "loss": 4.7181, "mean_token_accuracy": 0.23437806069850922, "num_tokens": 131264153.0, "step": 75675 }, { "entropy": 5.416633129119873, "epoch": 5.8881540556312, "grad_norm": 1.1953125, "learning_rate": 0.00021520201568819708, "loss": 4.6961, "mean_token_accuracy": 0.23607893884181977, "num_tokens": 131272732.0, "step": 75680 }, { "entropy": 5.353087949752807, "epoch": 5.888543085002918, "grad_norm": 1.2265625, "learning_rate": 0.00021517529729576425, "loss": 4.6613, "mean_token_accuracy": 0.2362336665391922, "num_tokens": 131281305.0, "step": 75685 }, { "entropy": 5.4908417701721195, "epoch": 5.888932114374636, "grad_norm": 1.2578125, "learning_rate": 0.00021514857981107604, "loss": 4.8235, "mean_token_accuracy": 0.21835297495126724, "num_tokens": 131290091.0, "step": 75690 }, { "entropy": 5.4522357940673825, "epoch": 5.889321143746352, "grad_norm": 1.3515625, "learning_rate": 0.00021512186323453786, "loss": 4.7301, "mean_token_accuracy": 0.23350744545459748, "num_tokens": 131298086.0, "step": 75695 }, { "entropy": 5.389719724655151, "epoch": 5.88971017311807, "grad_norm": 1.265625, "learning_rate": 0.00021509514756655514, "loss": 4.5941, "mean_token_accuracy": 0.24608222097158433, "num_tokens": 131306209.0, "step": 75700 }, { "entropy": 5.447935152053833, "epoch": 5.890099202489788, "grad_norm": 1.2734375, "learning_rate": 0.00021506843280753318, "loss": 4.8163, "mean_token_accuracy": 0.22604831159114838, "num_tokens": 131315059.0, "step": 75705 }, { "entropy": 5.380401134490967, "epoch": 5.8904882318615055, "grad_norm": 1.2578125, "learning_rate": 0.00021504171895787738, "loss": 4.6649, "mean_token_accuracy": 0.2372438684105873, "num_tokens": 131323086.0, "step": 75710 }, { "entropy": 5.403443813323975, "epoch": 5.890877261233223, "grad_norm": 1.3203125, "learning_rate": 0.000215015006017993, "loss": 4.6912, "mean_token_accuracy": 0.23732939809560777, "num_tokens": 131331883.0, "step": 75715 }, { "entropy": 5.42533016204834, "epoch": 5.891266290604941, "grad_norm": 1.3515625, "learning_rate": 0.0002149882939882855, "loss": 4.75, "mean_token_accuracy": 0.2265559196472168, "num_tokens": 131340404.0, "step": 75720 }, { "entropy": 5.383144283294678, "epoch": 5.891655319976659, "grad_norm": 1.2578125, "learning_rate": 0.00021496158286916011, "loss": 4.6753, "mean_token_accuracy": 0.236497662961483, "num_tokens": 131348974.0, "step": 75725 }, { "entropy": 5.360157775878906, "epoch": 5.892044349348376, "grad_norm": 1.1796875, "learning_rate": 0.00021493487266102202, "loss": 4.7116, "mean_token_accuracy": 0.23610188961029052, "num_tokens": 131357671.0, "step": 75730 }, { "entropy": 5.359032440185547, "epoch": 5.892433378720093, "grad_norm": 1.1796875, "learning_rate": 0.00021490816336427676, "loss": 4.6784, "mean_token_accuracy": 0.23339841961860658, "num_tokens": 131366997.0, "step": 75735 }, { "entropy": 5.400457239151001, "epoch": 5.892822408091811, "grad_norm": 1.2265625, "learning_rate": 0.00021488145497932949, "loss": 4.7014, "mean_token_accuracy": 0.23129364401102065, "num_tokens": 131375371.0, "step": 75740 }, { "entropy": 5.5018024921417235, "epoch": 5.8932114374635285, "grad_norm": 1.265625, "learning_rate": 0.00021485474750658536, "loss": 4.8227, "mean_token_accuracy": 0.2217098668217659, "num_tokens": 131384599.0, "step": 75745 }, { "entropy": 5.41101450920105, "epoch": 5.893600466835246, "grad_norm": 1.2890625, "learning_rate": 0.00021482804094644976, "loss": 4.669, "mean_token_accuracy": 0.2319781646132469, "num_tokens": 131393699.0, "step": 75750 }, { "entropy": 5.460923099517823, "epoch": 5.893989496206964, "grad_norm": 1.25, "learning_rate": 0.00021480133529932789, "loss": 4.7437, "mean_token_accuracy": 0.23407427668571473, "num_tokens": 131401988.0, "step": 75755 }, { "entropy": 5.3761261940002445, "epoch": 5.894378525578681, "grad_norm": 1.25, "learning_rate": 0.0002147746305656249, "loss": 4.6771, "mean_token_accuracy": 0.2330164596438408, "num_tokens": 131410717.0, "step": 75760 }, { "entropy": 5.311336946487427, "epoch": 5.894767554950398, "grad_norm": 1.2890625, "learning_rate": 0.000214747926745746, "loss": 4.5466, "mean_token_accuracy": 0.25152658224105834, "num_tokens": 131419622.0, "step": 75765 }, { "entropy": 5.404670524597168, "epoch": 5.895156584322116, "grad_norm": 1.3125, "learning_rate": 0.00021472122384009646, "loss": 4.7314, "mean_token_accuracy": 0.22854116559028625, "num_tokens": 131428273.0, "step": 75770 }, { "entropy": 5.457834005355835, "epoch": 5.895545613693834, "grad_norm": 1.3828125, "learning_rate": 0.0002146945218490814, "loss": 4.7753, "mean_token_accuracy": 0.22752442806959153, "num_tokens": 131437025.0, "step": 75775 }, { "entropy": 5.358960866928101, "epoch": 5.8959346430655515, "grad_norm": 1.265625, "learning_rate": 0.00021466782077310598, "loss": 4.6605, "mean_token_accuracy": 0.24315745383501053, "num_tokens": 131445363.0, "step": 75780 }, { "entropy": 5.447675132751465, "epoch": 5.896323672437269, "grad_norm": 1.1953125, "learning_rate": 0.0002146411206125754, "loss": 4.7423, "mean_token_accuracy": 0.22962729930877684, "num_tokens": 131454823.0, "step": 75785 }, { "entropy": 5.487676382064819, "epoch": 5.896712701808987, "grad_norm": 1.28125, "learning_rate": 0.00021461442136789472, "loss": 4.773, "mean_token_accuracy": 0.23070111572742463, "num_tokens": 131462836.0, "step": 75790 }, { "entropy": 5.449763059616089, "epoch": 5.897101731180705, "grad_norm": 1.3359375, "learning_rate": 0.00021458772303946895, "loss": 4.7819, "mean_token_accuracy": 0.22161486446857454, "num_tokens": 131471755.0, "step": 75795 }, { "entropy": 5.459450435638428, "epoch": 5.897490760552421, "grad_norm": 1.21875, "learning_rate": 0.00021456102562770346, "loss": 4.6997, "mean_token_accuracy": 0.23135231733322142, "num_tokens": 131480902.0, "step": 75800 }, { "entropy": 5.416858386993408, "epoch": 5.897879789924139, "grad_norm": 1.296875, "learning_rate": 0.0002145343291330032, "loss": 4.7771, "mean_token_accuracy": 0.22894878834486007, "num_tokens": 131489705.0, "step": 75805 }, { "entropy": 5.397819948196411, "epoch": 5.898268819295857, "grad_norm": 1.3046875, "learning_rate": 0.00021450763355577318, "loss": 4.7305, "mean_token_accuracy": 0.22951875180006026, "num_tokens": 131497501.0, "step": 75810 }, { "entropy": 5.463372898101807, "epoch": 5.8986578486675745, "grad_norm": 1.3359375, "learning_rate": 0.00021448093889641867, "loss": 4.7419, "mean_token_accuracy": 0.23163956254720688, "num_tokens": 131506412.0, "step": 75815 }, { "entropy": 5.438165760040283, "epoch": 5.899046878039292, "grad_norm": 1.296875, "learning_rate": 0.0002144542451553445, "loss": 4.7322, "mean_token_accuracy": 0.23713373988866807, "num_tokens": 131515473.0, "step": 75820 }, { "entropy": 5.279882431030273, "epoch": 5.89943590741101, "grad_norm": 1.2109375, "learning_rate": 0.0002144275523329558, "loss": 4.5713, "mean_token_accuracy": 0.24541660100221635, "num_tokens": 131524224.0, "step": 75825 }, { "entropy": 5.410733366012574, "epoch": 5.899824936782727, "grad_norm": 1.2734375, "learning_rate": 0.00021440086042965762, "loss": 4.719, "mean_token_accuracy": 0.2402533173561096, "num_tokens": 131532916.0, "step": 75830 }, { "entropy": 5.387822771072388, "epoch": 5.900213966154444, "grad_norm": 1.2890625, "learning_rate": 0.00021437416944585487, "loss": 4.7066, "mean_token_accuracy": 0.2368634134531021, "num_tokens": 131541466.0, "step": 75835 }, { "entropy": 5.286342477798462, "epoch": 5.900602995526162, "grad_norm": 1.25, "learning_rate": 0.00021434747938195266, "loss": 4.5514, "mean_token_accuracy": 0.24460933059453965, "num_tokens": 131550830.0, "step": 75840 }, { "entropy": 5.380221796035767, "epoch": 5.90099202489788, "grad_norm": 1.3359375, "learning_rate": 0.00021432079023835587, "loss": 4.7384, "mean_token_accuracy": 0.22526040226221083, "num_tokens": 131559113.0, "step": 75845 }, { "entropy": 5.392773962020874, "epoch": 5.9013810542695975, "grad_norm": 1.328125, "learning_rate": 0.0002142941020154695, "loss": 4.7277, "mean_token_accuracy": 0.23377591669559478, "num_tokens": 131567102.0, "step": 75850 }, { "entropy": 5.483459568023681, "epoch": 5.901770083641315, "grad_norm": 1.2265625, "learning_rate": 0.00021426741471369855, "loss": 4.7294, "mean_token_accuracy": 0.22994182407855987, "num_tokens": 131576177.0, "step": 75855 }, { "entropy": 5.43617615699768, "epoch": 5.902159113013033, "grad_norm": 1.2890625, "learning_rate": 0.00021424072833344781, "loss": 4.7179, "mean_token_accuracy": 0.23620351999998093, "num_tokens": 131584860.0, "step": 75860 }, { "entropy": 5.403309726715088, "epoch": 5.90254814238475, "grad_norm": 1.2421875, "learning_rate": 0.0002142140428751224, "loss": 4.7296, "mean_token_accuracy": 0.23249084055423735, "num_tokens": 131594464.0, "step": 75865 }, { "entropy": 5.3663276672363285, "epoch": 5.902937171756467, "grad_norm": 1.2734375, "learning_rate": 0.0002141873583391271, "loss": 4.6963, "mean_token_accuracy": 0.23175112754106522, "num_tokens": 131603116.0, "step": 75870 }, { "entropy": 5.318330144882202, "epoch": 5.903326201128185, "grad_norm": 1.2890625, "learning_rate": 0.00021416067472586692, "loss": 4.5783, "mean_token_accuracy": 0.2420200377702713, "num_tokens": 131611273.0, "step": 75875 }, { "entropy": 5.400623798370361, "epoch": 5.903715230499903, "grad_norm": 1.2265625, "learning_rate": 0.00021413399203574658, "loss": 4.7705, "mean_token_accuracy": 0.2247158706188202, "num_tokens": 131620141.0, "step": 75880 }, { "entropy": 5.410860776901245, "epoch": 5.9041042598716205, "grad_norm": 1.25, "learning_rate": 0.00021410731026917106, "loss": 4.7516, "mean_token_accuracy": 0.2289738655090332, "num_tokens": 131629020.0, "step": 75885 }, { "entropy": 5.418546152114868, "epoch": 5.904493289243338, "grad_norm": 1.328125, "learning_rate": 0.0002140806294265452, "loss": 4.62, "mean_token_accuracy": 0.23874539285898208, "num_tokens": 131636982.0, "step": 75890 }, { "entropy": 5.418768501281738, "epoch": 5.904882318615055, "grad_norm": 1.2265625, "learning_rate": 0.0002140539495082739, "loss": 4.7298, "mean_token_accuracy": 0.2272329270839691, "num_tokens": 131646124.0, "step": 75895 }, { "entropy": 5.3883003234863285, "epoch": 5.905271347986773, "grad_norm": 1.2265625, "learning_rate": 0.00021402727051476184, "loss": 4.668, "mean_token_accuracy": 0.23712324351072311, "num_tokens": 131655021.0, "step": 75900 }, { "entropy": 5.401298475265503, "epoch": 5.90566037735849, "grad_norm": 1.2109375, "learning_rate": 0.0002140005924464139, "loss": 4.7033, "mean_token_accuracy": 0.23961022049188613, "num_tokens": 131664146.0, "step": 75905 }, { "entropy": 5.439096260070801, "epoch": 5.906049406730208, "grad_norm": 1.34375, "learning_rate": 0.00021397391530363487, "loss": 4.7166, "mean_token_accuracy": 0.2325331449508667, "num_tokens": 131671861.0, "step": 75910 }, { "entropy": 5.431197881698608, "epoch": 5.906438436101926, "grad_norm": 1.375, "learning_rate": 0.00021394723908682955, "loss": 4.6797, "mean_token_accuracy": 0.2432627186179161, "num_tokens": 131679936.0, "step": 75915 }, { "entropy": 5.354474592208862, "epoch": 5.9068274654736435, "grad_norm": 1.328125, "learning_rate": 0.00021392056379640267, "loss": 4.6726, "mean_token_accuracy": 0.23982449769973754, "num_tokens": 131687902.0, "step": 75920 }, { "entropy": 5.318656492233276, "epoch": 5.907216494845361, "grad_norm": 1.2421875, "learning_rate": 0.00021389388943275907, "loss": 4.569, "mean_token_accuracy": 0.25642589628696444, "num_tokens": 131696386.0, "step": 75925 }, { "entropy": 5.347502088546753, "epoch": 5.907605524217079, "grad_norm": 1.234375, "learning_rate": 0.00021386721599630333, "loss": 4.6253, "mean_token_accuracy": 0.24499854296445847, "num_tokens": 131704763.0, "step": 75930 }, { "entropy": 5.43164644241333, "epoch": 5.907994553588796, "grad_norm": 1.34375, "learning_rate": 0.00021384054348744035, "loss": 4.8059, "mean_token_accuracy": 0.22562328726053238, "num_tokens": 131713272.0, "step": 75935 }, { "entropy": 5.428429079055786, "epoch": 5.908383582960513, "grad_norm": 1.21875, "learning_rate": 0.0002138138719065748, "loss": 4.7243, "mean_token_accuracy": 0.22657574564218522, "num_tokens": 131722084.0, "step": 75940 }, { "entropy": 5.5224555969238285, "epoch": 5.908772612332231, "grad_norm": 1.1953125, "learning_rate": 0.0002137872012541114, "loss": 4.8029, "mean_token_accuracy": 0.22344074547290801, "num_tokens": 131730576.0, "step": 75945 }, { "entropy": 5.494440698623658, "epoch": 5.909161641703949, "grad_norm": 1.234375, "learning_rate": 0.00021376053153045473, "loss": 4.797, "mean_token_accuracy": 0.22645127177238464, "num_tokens": 131739715.0, "step": 75950 }, { "entropy": 5.397754144668579, "epoch": 5.9095506710756665, "grad_norm": 1.21875, "learning_rate": 0.00021373386273600953, "loss": 4.6735, "mean_token_accuracy": 0.2362038552761078, "num_tokens": 131749006.0, "step": 75955 }, { "entropy": 5.451133823394775, "epoch": 5.909939700447384, "grad_norm": 1.171875, "learning_rate": 0.00021370719487118046, "loss": 4.8163, "mean_token_accuracy": 0.22346639782190322, "num_tokens": 131757909.0, "step": 75960 }, { "entropy": 5.370549249649048, "epoch": 5.910328729819101, "grad_norm": 1.203125, "learning_rate": 0.0002136805279363721, "loss": 4.6771, "mean_token_accuracy": 0.23761456608772277, "num_tokens": 131766932.0, "step": 75965 }, { "entropy": 5.395207834243775, "epoch": 5.910717759190819, "grad_norm": 1.2109375, "learning_rate": 0.00021365386193198917, "loss": 4.7383, "mean_token_accuracy": 0.23079489022493363, "num_tokens": 131775765.0, "step": 75970 }, { "entropy": 5.465735673904419, "epoch": 5.911106788562536, "grad_norm": 1.40625, "learning_rate": 0.0002136271968584363, "loss": 4.7305, "mean_token_accuracy": 0.2312104359269142, "num_tokens": 131784266.0, "step": 75975 }, { "entropy": 5.461711502075195, "epoch": 5.911495817934254, "grad_norm": 1.3125, "learning_rate": 0.00021360053271611795, "loss": 4.7226, "mean_token_accuracy": 0.23457106500864028, "num_tokens": 131792345.0, "step": 75980 }, { "entropy": 5.368264150619507, "epoch": 5.911884847305972, "grad_norm": 1.2265625, "learning_rate": 0.00021357386950543884, "loss": 4.6613, "mean_token_accuracy": 0.23398571461439133, "num_tokens": 131801213.0, "step": 75985 }, { "entropy": 5.363194513320923, "epoch": 5.912273876677689, "grad_norm": 1.34375, "learning_rate": 0.00021354720722680347, "loss": 4.6587, "mean_token_accuracy": 0.24018124341964722, "num_tokens": 131809530.0, "step": 75990 }, { "entropy": 5.3555890083312985, "epoch": 5.912662906049407, "grad_norm": 1.25, "learning_rate": 0.00021352054588061632, "loss": 4.6523, "mean_token_accuracy": 0.23964514285326005, "num_tokens": 131817686.0, "step": 75995 }, { "entropy": 5.408930921554566, "epoch": 5.913051935421124, "grad_norm": 1.15625, "learning_rate": 0.0002134938854672821, "loss": 4.6699, "mean_token_accuracy": 0.23864445984363555, "num_tokens": 131827199.0, "step": 76000 }, { "entropy": 5.390394926071167, "epoch": 5.913440964792842, "grad_norm": 1.328125, "learning_rate": 0.00021346722598720536, "loss": 4.742, "mean_token_accuracy": 0.23177618980407716, "num_tokens": 131835899.0, "step": 76005 }, { "entropy": 5.317753505706787, "epoch": 5.913829994164559, "grad_norm": 1.2734375, "learning_rate": 0.00021344056744079044, "loss": 4.5299, "mean_token_accuracy": 0.24599709063768388, "num_tokens": 131843862.0, "step": 76010 }, { "entropy": 5.381081247329712, "epoch": 5.914219023536277, "grad_norm": 1.3046875, "learning_rate": 0.00021341390982844194, "loss": 4.6797, "mean_token_accuracy": 0.24037142992019653, "num_tokens": 131852970.0, "step": 76015 }, { "entropy": 5.4305901527404785, "epoch": 5.914608052907995, "grad_norm": 1.2734375, "learning_rate": 0.00021338725315056434, "loss": 4.7662, "mean_token_accuracy": 0.2277293771505356, "num_tokens": 131861623.0, "step": 76020 }, { "entropy": 5.360603475570679, "epoch": 5.914997082279712, "grad_norm": 1.328125, "learning_rate": 0.00021336059740756214, "loss": 4.6498, "mean_token_accuracy": 0.23802496641874313, "num_tokens": 131869813.0, "step": 76025 }, { "entropy": 5.436095476150513, "epoch": 5.915386111651429, "grad_norm": 1.2421875, "learning_rate": 0.00021333394259983975, "loss": 4.7624, "mean_token_accuracy": 0.2325201690196991, "num_tokens": 131879634.0, "step": 76030 }, { "entropy": 5.384984874725342, "epoch": 5.915775141023147, "grad_norm": 1.2734375, "learning_rate": 0.00021330728872780158, "loss": 4.6649, "mean_token_accuracy": 0.2393465295433998, "num_tokens": 131888962.0, "step": 76035 }, { "entropy": 5.394105243682861, "epoch": 5.916164170394865, "grad_norm": 1.25, "learning_rate": 0.00021328063579185213, "loss": 4.6441, "mean_token_accuracy": 0.2384956106543541, "num_tokens": 131897356.0, "step": 76040 }, { "entropy": 5.4822228908538815, "epoch": 5.916553199766582, "grad_norm": 1.34375, "learning_rate": 0.0002132539837923958, "loss": 4.8027, "mean_token_accuracy": 0.2314058557152748, "num_tokens": 131905466.0, "step": 76045 }, { "entropy": 5.421515798568725, "epoch": 5.9169422291383, "grad_norm": 1.296875, "learning_rate": 0.00021322733272983703, "loss": 4.7862, "mean_token_accuracy": 0.2252401739358902, "num_tokens": 131914098.0, "step": 76050 }, { "entropy": 5.503602981567383, "epoch": 5.917331258510018, "grad_norm": 1.234375, "learning_rate": 0.00021320068260458015, "loss": 4.7247, "mean_token_accuracy": 0.2342439815402031, "num_tokens": 131921736.0, "step": 76055 }, { "entropy": 5.424953269958496, "epoch": 5.917720287881735, "grad_norm": 1.265625, "learning_rate": 0.00021317403341702945, "loss": 4.6984, "mean_token_accuracy": 0.23516819924116134, "num_tokens": 131929748.0, "step": 76060 }, { "entropy": 5.39015154838562, "epoch": 5.918109317253453, "grad_norm": 1.21875, "learning_rate": 0.00021314738516758946, "loss": 4.7531, "mean_token_accuracy": 0.22663253247737886, "num_tokens": 131938924.0, "step": 76065 }, { "entropy": 5.467780113220215, "epoch": 5.91849834662517, "grad_norm": 1.2734375, "learning_rate": 0.0002131207378566644, "loss": 4.7703, "mean_token_accuracy": 0.23378603011369706, "num_tokens": 131946960.0, "step": 76070 }, { "entropy": 5.496523809432984, "epoch": 5.918887375996888, "grad_norm": 1.1640625, "learning_rate": 0.00021309409148465876, "loss": 4.8002, "mean_token_accuracy": 0.23000468760728837, "num_tokens": 131955340.0, "step": 76075 }, { "entropy": 5.500981855392456, "epoch": 5.919276405368605, "grad_norm": 1.4140625, "learning_rate": 0.0002130674460519767, "loss": 4.7705, "mean_token_accuracy": 0.22325754463672637, "num_tokens": 131963573.0, "step": 76080 }, { "entropy": 5.369329118728638, "epoch": 5.919665434740323, "grad_norm": 1.1875, "learning_rate": 0.00021304080155902256, "loss": 4.6837, "mean_token_accuracy": 0.23269959390163422, "num_tokens": 131971753.0, "step": 76085 }, { "entropy": 5.458973979949951, "epoch": 5.920054464112041, "grad_norm": 1.3828125, "learning_rate": 0.00021301415800620066, "loss": 4.7915, "mean_token_accuracy": 0.22604616731405258, "num_tokens": 131980221.0, "step": 76090 }, { "entropy": 5.42647910118103, "epoch": 5.9204434934837575, "grad_norm": 1.1796875, "learning_rate": 0.00021298751539391525, "loss": 4.8037, "mean_token_accuracy": 0.22318702787160874, "num_tokens": 131989104.0, "step": 76095 }, { "entropy": 5.417198276519775, "epoch": 5.920832522855475, "grad_norm": 1.1484375, "learning_rate": 0.0002129608737225706, "loss": 4.7112, "mean_token_accuracy": 0.2349577948451042, "num_tokens": 131997596.0, "step": 76100 }, { "entropy": 5.463526630401612, "epoch": 5.921221552227193, "grad_norm": 1.3203125, "learning_rate": 0.00021293423299257092, "loss": 4.7261, "mean_token_accuracy": 0.23496688455343245, "num_tokens": 132006056.0, "step": 76105 }, { "entropy": 5.451560306549072, "epoch": 5.921610581598911, "grad_norm": 1.375, "learning_rate": 0.00021290759320432046, "loss": 4.7201, "mean_token_accuracy": 0.23233759105205537, "num_tokens": 132014068.0, "step": 76110 }, { "entropy": 5.400394296646118, "epoch": 5.921999610970628, "grad_norm": 1.21875, "learning_rate": 0.0002128809543582234, "loss": 4.6837, "mean_token_accuracy": 0.2356068804860115, "num_tokens": 132023567.0, "step": 76115 }, { "entropy": 5.386044263839722, "epoch": 5.922388640342346, "grad_norm": 1.2265625, "learning_rate": 0.00021285431645468405, "loss": 4.7099, "mean_token_accuracy": 0.23647297620773317, "num_tokens": 132032993.0, "step": 76120 }, { "entropy": 5.475244951248169, "epoch": 5.922777669714064, "grad_norm": 1.3203125, "learning_rate": 0.00021282767949410653, "loss": 4.7874, "mean_token_accuracy": 0.22518738806247712, "num_tokens": 132041625.0, "step": 76125 }, { "entropy": 5.544586896896362, "epoch": 5.923166699085781, "grad_norm": 1.2734375, "learning_rate": 0.00021280104347689495, "loss": 4.7748, "mean_token_accuracy": 0.231954625248909, "num_tokens": 132050227.0, "step": 76130 }, { "entropy": 5.405128288269043, "epoch": 5.923555728457498, "grad_norm": 1.2578125, "learning_rate": 0.00021277440840345363, "loss": 4.7015, "mean_token_accuracy": 0.23236709237098693, "num_tokens": 132058813.0, "step": 76135 }, { "entropy": 5.364491176605225, "epoch": 5.923944757829216, "grad_norm": 1.40625, "learning_rate": 0.00021274777427418657, "loss": 4.6956, "mean_token_accuracy": 0.23926969319581987, "num_tokens": 132066485.0, "step": 76140 }, { "entropy": 5.383483362197876, "epoch": 5.924333787200934, "grad_norm": 1.2578125, "learning_rate": 0.00021272114108949797, "loss": 4.6822, "mean_token_accuracy": 0.23116630911827088, "num_tokens": 132075531.0, "step": 76145 }, { "entropy": 5.360352897644043, "epoch": 5.924722816572651, "grad_norm": 1.25, "learning_rate": 0.0002126945088497919, "loss": 4.6548, "mean_token_accuracy": 0.2338838368654251, "num_tokens": 132084531.0, "step": 76150 }, { "entropy": 5.373699045181274, "epoch": 5.925111845944369, "grad_norm": 1.4140625, "learning_rate": 0.0002126678775554725, "loss": 4.7207, "mean_token_accuracy": 0.22971969544887544, "num_tokens": 132093462.0, "step": 76155 }, { "entropy": 5.4652563571929935, "epoch": 5.925500875316087, "grad_norm": 1.359375, "learning_rate": 0.0002126412472069439, "loss": 4.7205, "mean_token_accuracy": 0.22945373505353928, "num_tokens": 132102035.0, "step": 76160 }, { "entropy": 5.352635431289673, "epoch": 5.9258899046878035, "grad_norm": 1.15625, "learning_rate": 0.00021261461780461006, "loss": 4.6302, "mean_token_accuracy": 0.2402480885386467, "num_tokens": 132110488.0, "step": 76165 }, { "entropy": 5.3912210941314695, "epoch": 5.926278934059521, "grad_norm": 1.453125, "learning_rate": 0.00021258798934887513, "loss": 4.6484, "mean_token_accuracy": 0.24137549996376037, "num_tokens": 132118459.0, "step": 76170 }, { "entropy": 5.369686269760132, "epoch": 5.926667963431239, "grad_norm": 1.1875, "learning_rate": 0.00021256136184014313, "loss": 4.6567, "mean_token_accuracy": 0.2321525976061821, "num_tokens": 132126768.0, "step": 76175 }, { "entropy": 5.392707014083863, "epoch": 5.927056992802957, "grad_norm": 1.296875, "learning_rate": 0.00021253473527881806, "loss": 4.6854, "mean_token_accuracy": 0.2317980170249939, "num_tokens": 132135295.0, "step": 76180 }, { "entropy": 5.416296005249023, "epoch": 5.927446022174674, "grad_norm": 1.2421875, "learning_rate": 0.00021250810966530392, "loss": 4.7414, "mean_token_accuracy": 0.23518838584423066, "num_tokens": 132144805.0, "step": 76185 }, { "entropy": 5.344917297363281, "epoch": 5.927835051546392, "grad_norm": 1.171875, "learning_rate": 0.0002124814850000048, "loss": 4.6545, "mean_token_accuracy": 0.2364877536892891, "num_tokens": 132153359.0, "step": 76190 }, { "entropy": 5.355239295959473, "epoch": 5.92822408091811, "grad_norm": 1.1640625, "learning_rate": 0.00021245486128332458, "loss": 4.6292, "mean_token_accuracy": 0.23918001651763915, "num_tokens": 132162390.0, "step": 76195 }, { "entropy": 5.383667898178101, "epoch": 5.9286131102898265, "grad_norm": 1.21875, "learning_rate": 0.00021242823851566733, "loss": 4.6677, "mean_token_accuracy": 0.22867198288440704, "num_tokens": 132170880.0, "step": 76200 }, { "entropy": 5.3855204582214355, "epoch": 5.929002139661544, "grad_norm": 1.1875, "learning_rate": 0.00021240161669743696, "loss": 4.7512, "mean_token_accuracy": 0.2263859450817108, "num_tokens": 132180966.0, "step": 76205 }, { "entropy": 5.41846981048584, "epoch": 5.929391169033262, "grad_norm": 1.25, "learning_rate": 0.0002123749958290374, "loss": 4.6571, "mean_token_accuracy": 0.23393280804157257, "num_tokens": 132189339.0, "step": 76210 }, { "entropy": 5.391187906265259, "epoch": 5.92978019840498, "grad_norm": 1.2734375, "learning_rate": 0.0002123483759108727, "loss": 4.6677, "mean_token_accuracy": 0.24157705008983613, "num_tokens": 132197654.0, "step": 76215 }, { "entropy": 5.451472568511963, "epoch": 5.930169227776697, "grad_norm": 1.3125, "learning_rate": 0.00021232175694334653, "loss": 4.7025, "mean_token_accuracy": 0.2315573662519455, "num_tokens": 132206479.0, "step": 76220 }, { "entropy": 5.350254535675049, "epoch": 5.930558257148415, "grad_norm": 1.171875, "learning_rate": 0.00021229513892686303, "loss": 4.6751, "mean_token_accuracy": 0.23381597101688384, "num_tokens": 132215930.0, "step": 76225 }, { "entropy": 5.359291934967041, "epoch": 5.930947286520132, "grad_norm": 1.203125, "learning_rate": 0.000212268521861826, "loss": 4.6158, "mean_token_accuracy": 0.23722731322050095, "num_tokens": 132224133.0, "step": 76230 }, { "entropy": 5.428776454925537, "epoch": 5.9313363158918495, "grad_norm": 1.2890625, "learning_rate": 0.0002122419057486393, "loss": 4.7052, "mean_token_accuracy": 0.23858193159103394, "num_tokens": 132233171.0, "step": 76235 }, { "entropy": 5.441717529296875, "epoch": 5.931725345263567, "grad_norm": 1.2265625, "learning_rate": 0.00021221529058770673, "loss": 4.8059, "mean_token_accuracy": 0.2207982137799263, "num_tokens": 132242111.0, "step": 76240 }, { "entropy": 5.406039762496948, "epoch": 5.932114374635285, "grad_norm": 1.3125, "learning_rate": 0.00021218867637943224, "loss": 4.7367, "mean_token_accuracy": 0.23015722930431365, "num_tokens": 132250817.0, "step": 76245 }, { "entropy": 5.303554534912109, "epoch": 5.932503404007003, "grad_norm": 1.265625, "learning_rate": 0.0002121620631242196, "loss": 4.5595, "mean_token_accuracy": 0.25084811449050903, "num_tokens": 132259081.0, "step": 76250 }, { "entropy": 5.36400785446167, "epoch": 5.93289243337872, "grad_norm": 1.2265625, "learning_rate": 0.00021213545082247266, "loss": 4.6544, "mean_token_accuracy": 0.23282447308301926, "num_tokens": 132268174.0, "step": 76255 }, { "entropy": 5.311514949798584, "epoch": 5.933281462750438, "grad_norm": 1.265625, "learning_rate": 0.00021210883947459509, "loss": 4.6593, "mean_token_accuracy": 0.24024641811847686, "num_tokens": 132276834.0, "step": 76260 }, { "entropy": 5.4077270984649655, "epoch": 5.933670492122156, "grad_norm": 1.2265625, "learning_rate": 0.00021208222908099085, "loss": 4.6969, "mean_token_accuracy": 0.22875261157751084, "num_tokens": 132285384.0, "step": 76265 }, { "entropy": 5.427400207519531, "epoch": 5.9340595214938725, "grad_norm": 1.1484375, "learning_rate": 0.0002120556196420636, "loss": 4.754, "mean_token_accuracy": 0.2294132798910141, "num_tokens": 132294485.0, "step": 76270 }, { "entropy": 5.434949970245361, "epoch": 5.93444855086559, "grad_norm": 1.25, "learning_rate": 0.00021202901115821728, "loss": 4.7643, "mean_token_accuracy": 0.23428494930267335, "num_tokens": 132303277.0, "step": 76275 }, { "entropy": 5.421936988830566, "epoch": 5.934837580237308, "grad_norm": 1.2265625, "learning_rate": 0.0002120024036298554, "loss": 4.7202, "mean_token_accuracy": 0.23176118433475495, "num_tokens": 132311795.0, "step": 76280 }, { "entropy": 5.393312740325928, "epoch": 5.935226609609026, "grad_norm": 1.25, "learning_rate": 0.00021197579705738173, "loss": 4.7372, "mean_token_accuracy": 0.23162569105625153, "num_tokens": 132320349.0, "step": 76285 }, { "entropy": 5.369066858291626, "epoch": 5.935615638980743, "grad_norm": 1.4140625, "learning_rate": 0.00021194919144120006, "loss": 4.6097, "mean_token_accuracy": 0.2417198449373245, "num_tokens": 132328595.0, "step": 76290 }, { "entropy": 5.44274115562439, "epoch": 5.936004668352461, "grad_norm": 1.1640625, "learning_rate": 0.00021192258678171406, "loss": 4.7651, "mean_token_accuracy": 0.23599553257226943, "num_tokens": 132338782.0, "step": 76295 }, { "entropy": 5.506654262542725, "epoch": 5.936393697724178, "grad_norm": 1.1640625, "learning_rate": 0.0002118959830793274, "loss": 4.8028, "mean_token_accuracy": 0.2305076688528061, "num_tokens": 132347222.0, "step": 76300 }, { "entropy": 5.507441759109497, "epoch": 5.9367827270958955, "grad_norm": 1.265625, "learning_rate": 0.00021186938033444382, "loss": 4.8367, "mean_token_accuracy": 0.2293297231197357, "num_tokens": 132355881.0, "step": 76305 }, { "entropy": 5.491884374618531, "epoch": 5.937171756467613, "grad_norm": 1.2578125, "learning_rate": 0.00021184277854746682, "loss": 4.7392, "mean_token_accuracy": 0.22916317731142044, "num_tokens": 132365951.0, "step": 76310 }, { "entropy": 5.41453070640564, "epoch": 5.937560785839331, "grad_norm": 1.2421875, "learning_rate": 0.00021181617771880013, "loss": 4.7717, "mean_token_accuracy": 0.22971153110265732, "num_tokens": 132374522.0, "step": 76315 }, { "entropy": 5.395865392684937, "epoch": 5.937949815211049, "grad_norm": 1.328125, "learning_rate": 0.00021178957784884745, "loss": 4.6952, "mean_token_accuracy": 0.2322625383734703, "num_tokens": 132383242.0, "step": 76320 }, { "entropy": 5.4336583614349365, "epoch": 5.938338844582766, "grad_norm": 1.453125, "learning_rate": 0.00021176297893801222, "loss": 4.6561, "mean_token_accuracy": 0.24170120805501938, "num_tokens": 132391894.0, "step": 76325 }, { "entropy": 5.463323354721069, "epoch": 5.938727873954484, "grad_norm": 1.21875, "learning_rate": 0.00021173638098669818, "loss": 4.7663, "mean_token_accuracy": 0.231906895339489, "num_tokens": 132400260.0, "step": 76330 }, { "entropy": 5.4831788539886475, "epoch": 5.939116903326201, "grad_norm": 1.390625, "learning_rate": 0.0002117097839953089, "loss": 4.8219, "mean_token_accuracy": 0.22252528071403505, "num_tokens": 132408341.0, "step": 76335 }, { "entropy": 5.438129663467407, "epoch": 5.9395059326979185, "grad_norm": 1.1640625, "learning_rate": 0.00021168318796424784, "loss": 4.7608, "mean_token_accuracy": 0.23347238451242447, "num_tokens": 132417507.0, "step": 76340 }, { "entropy": 5.4105963706970215, "epoch": 5.939894962069636, "grad_norm": 1.2890625, "learning_rate": 0.00021165659289391865, "loss": 4.7314, "mean_token_accuracy": 0.22635268568992614, "num_tokens": 132426440.0, "step": 76345 }, { "entropy": 5.3511568069458, "epoch": 5.940283991441354, "grad_norm": 1.203125, "learning_rate": 0.0002116299987847249, "loss": 4.6548, "mean_token_accuracy": 0.23678378909826278, "num_tokens": 132434740.0, "step": 76350 }, { "entropy": 5.453312778472901, "epoch": 5.940673020813072, "grad_norm": 1.3125, "learning_rate": 0.00021160340563707004, "loss": 4.7697, "mean_token_accuracy": 0.2272647276520729, "num_tokens": 132443070.0, "step": 76355 }, { "entropy": 5.432166719436646, "epoch": 5.941062050184789, "grad_norm": 1.1484375, "learning_rate": 0.00021157681345135754, "loss": 4.7353, "mean_token_accuracy": 0.2346034973859787, "num_tokens": 132451587.0, "step": 76360 }, { "entropy": 5.367437314987183, "epoch": 5.941451079556506, "grad_norm": 1.25, "learning_rate": 0.00021155022222799097, "loss": 4.6647, "mean_token_accuracy": 0.23171533197164534, "num_tokens": 132460017.0, "step": 76365 }, { "entropy": 5.3677257061004635, "epoch": 5.941840108928224, "grad_norm": 1.234375, "learning_rate": 0.00021152363196737378, "loss": 4.6695, "mean_token_accuracy": 0.24204727858304978, "num_tokens": 132468470.0, "step": 76370 }, { "entropy": 5.372550201416016, "epoch": 5.9422291382999415, "grad_norm": 1.2890625, "learning_rate": 0.0002114970426699095, "loss": 4.6713, "mean_token_accuracy": 0.23977320194244384, "num_tokens": 132476827.0, "step": 76375 }, { "entropy": 5.363492059707641, "epoch": 5.942618167671659, "grad_norm": 1.25, "learning_rate": 0.00021147045433600142, "loss": 4.6788, "mean_token_accuracy": 0.23303119391202926, "num_tokens": 132485346.0, "step": 76380 }, { "entropy": 5.490091466903687, "epoch": 5.943007197043377, "grad_norm": 1.2734375, "learning_rate": 0.00021144386696605316, "loss": 4.7844, "mean_token_accuracy": 0.22473648935556412, "num_tokens": 132493470.0, "step": 76385 }, { "entropy": 5.403557300567627, "epoch": 5.943396226415095, "grad_norm": 1.34375, "learning_rate": 0.00021141728056046804, "loss": 4.6176, "mean_token_accuracy": 0.24426782727241517, "num_tokens": 132502228.0, "step": 76390 }, { "entropy": 5.46008415222168, "epoch": 5.943785255786812, "grad_norm": 1.2890625, "learning_rate": 0.00021139069511964942, "loss": 4.7546, "mean_token_accuracy": 0.23142188936471939, "num_tokens": 132510489.0, "step": 76395 }, { "entropy": 5.436754369735718, "epoch": 5.944174285158529, "grad_norm": 1.171875, "learning_rate": 0.0002113641106440008, "loss": 4.7202, "mean_token_accuracy": 0.23291650265455247, "num_tokens": 132519372.0, "step": 76400 }, { "entropy": 5.443526554107666, "epoch": 5.944563314530247, "grad_norm": 1.2109375, "learning_rate": 0.0002113375271339255, "loss": 4.7669, "mean_token_accuracy": 0.23147513419389726, "num_tokens": 132527924.0, "step": 76405 }, { "entropy": 5.431633710861206, "epoch": 5.9449523439019645, "grad_norm": 1.1875, "learning_rate": 0.0002113109445898269, "loss": 4.6948, "mean_token_accuracy": 0.23597197979688644, "num_tokens": 132537440.0, "step": 76410 }, { "entropy": 5.49529185295105, "epoch": 5.945341373273682, "grad_norm": 1.265625, "learning_rate": 0.00021128436301210842, "loss": 4.812, "mean_token_accuracy": 0.22199621498584748, "num_tokens": 132546134.0, "step": 76415 }, { "entropy": 5.466610765457153, "epoch": 5.9457304026454, "grad_norm": 1.359375, "learning_rate": 0.00021125778240117327, "loss": 4.7213, "mean_token_accuracy": 0.23033841997385024, "num_tokens": 132554590.0, "step": 76420 }, { "entropy": 5.424131631851196, "epoch": 5.946119432017118, "grad_norm": 1.2578125, "learning_rate": 0.0002112312027574248, "loss": 4.6885, "mean_token_accuracy": 0.23711908757686614, "num_tokens": 132563934.0, "step": 76425 }, { "entropy": 5.446535921096801, "epoch": 5.946508461388834, "grad_norm": 1.3203125, "learning_rate": 0.00021120462408126634, "loss": 4.794, "mean_token_accuracy": 0.22354500889778137, "num_tokens": 132572581.0, "step": 76430 }, { "entropy": 5.436050748825073, "epoch": 5.946897490760552, "grad_norm": 1.2265625, "learning_rate": 0.00021117804637310123, "loss": 4.8246, "mean_token_accuracy": 0.22417698204517364, "num_tokens": 132580363.0, "step": 76435 }, { "entropy": 5.392775249481201, "epoch": 5.94728652013227, "grad_norm": 1.25, "learning_rate": 0.0002111514696333326, "loss": 4.7042, "mean_token_accuracy": 0.23352446854114534, "num_tokens": 132589116.0, "step": 76440 }, { "entropy": 5.384840774536133, "epoch": 5.9476755495039875, "grad_norm": 1.1640625, "learning_rate": 0.00021112489386236383, "loss": 4.6617, "mean_token_accuracy": 0.2400180831551552, "num_tokens": 132598114.0, "step": 76445 }, { "entropy": 5.355743169784546, "epoch": 5.948064578875705, "grad_norm": 1.1640625, "learning_rate": 0.00021109831906059807, "loss": 4.6663, "mean_token_accuracy": 0.23696862310171127, "num_tokens": 132608219.0, "step": 76450 }, { "entropy": 5.404343461990356, "epoch": 5.948453608247423, "grad_norm": 1.234375, "learning_rate": 0.0002110717452284387, "loss": 4.7239, "mean_token_accuracy": 0.2336655542254448, "num_tokens": 132617469.0, "step": 76455 }, { "entropy": 5.355747222900391, "epoch": 5.948842637619141, "grad_norm": 1.265625, "learning_rate": 0.00021104517236628868, "loss": 4.6149, "mean_token_accuracy": 0.2373715177178383, "num_tokens": 132626696.0, "step": 76460 }, { "entropy": 5.397546625137329, "epoch": 5.949231666990858, "grad_norm": 1.3671875, "learning_rate": 0.0002110186004745515, "loss": 4.7557, "mean_token_accuracy": 0.23237808644771576, "num_tokens": 132635392.0, "step": 76465 }, { "entropy": 5.4194964408874515, "epoch": 5.949620696362575, "grad_norm": 1.140625, "learning_rate": 0.00021099202955363023, "loss": 4.7628, "mean_token_accuracy": 0.22070899605751038, "num_tokens": 132644538.0, "step": 76470 }, { "entropy": 5.382121753692627, "epoch": 5.950009725734293, "grad_norm": 1.296875, "learning_rate": 0.00021096545960392805, "loss": 4.6722, "mean_token_accuracy": 0.23862248957157134, "num_tokens": 132653663.0, "step": 76475 }, { "entropy": 5.330176877975464, "epoch": 5.9503987551060105, "grad_norm": 1.1796875, "learning_rate": 0.00021093889062584803, "loss": 4.6393, "mean_token_accuracy": 0.24172260314226152, "num_tokens": 132662044.0, "step": 76480 }, { "entropy": 5.286471748352051, "epoch": 5.950787784477728, "grad_norm": 1.3125, "learning_rate": 0.00021091232261979343, "loss": 4.6335, "mean_token_accuracy": 0.24145150780677796, "num_tokens": 132670654.0, "step": 76485 }, { "entropy": 5.429275560379028, "epoch": 5.951176813849446, "grad_norm": 1.2265625, "learning_rate": 0.0002108857555861673, "loss": 4.7741, "mean_token_accuracy": 0.22701884657144547, "num_tokens": 132680060.0, "step": 76490 }, { "entropy": 5.398393201828003, "epoch": 5.9515658432211636, "grad_norm": 1.28125, "learning_rate": 0.00021085918952537275, "loss": 4.709, "mean_token_accuracy": 0.23249875903129577, "num_tokens": 132689385.0, "step": 76495 }, { "entropy": 5.370587921142578, "epoch": 5.95195487259288, "grad_norm": 1.1796875, "learning_rate": 0.00021083262443781297, "loss": 4.6185, "mean_token_accuracy": 0.23504396378993989, "num_tokens": 132698009.0, "step": 76500 }, { "entropy": 5.449375343322754, "epoch": 5.952343901964598, "grad_norm": 1.453125, "learning_rate": 0.00021080606032389094, "loss": 4.7952, "mean_token_accuracy": 0.235028176009655, "num_tokens": 132705889.0, "step": 76505 }, { "entropy": 5.406833791732788, "epoch": 5.952732931336316, "grad_norm": 1.28125, "learning_rate": 0.0002107794971840098, "loss": 4.7406, "mean_token_accuracy": 0.23015243262052537, "num_tokens": 132714964.0, "step": 76510 }, { "entropy": 5.395500564575196, "epoch": 5.9531219607080335, "grad_norm": 1.2578125, "learning_rate": 0.00021075293501857264, "loss": 4.6896, "mean_token_accuracy": 0.2335689917206764, "num_tokens": 132724347.0, "step": 76515 }, { "entropy": 5.437651014328003, "epoch": 5.953510990079751, "grad_norm": 1.3671875, "learning_rate": 0.00021072637382798232, "loss": 4.7015, "mean_token_accuracy": 0.2274057000875473, "num_tokens": 132732236.0, "step": 76520 }, { "entropy": 5.441507053375244, "epoch": 5.953900019451469, "grad_norm": 1.375, "learning_rate": 0.00021069981361264195, "loss": 4.7653, "mean_token_accuracy": 0.22785140573978424, "num_tokens": 132740164.0, "step": 76525 }, { "entropy": 5.4347742080688475, "epoch": 5.9542890488231865, "grad_norm": 1.4921875, "learning_rate": 0.0002106732543729546, "loss": 4.7282, "mean_token_accuracy": 0.22833696007728577, "num_tokens": 132748446.0, "step": 76530 }, { "entropy": 5.394736623764038, "epoch": 5.954678078194903, "grad_norm": 1.3671875, "learning_rate": 0.00021064669610932325, "loss": 4.7759, "mean_token_accuracy": 0.23221419602632523, "num_tokens": 132757428.0, "step": 76535 }, { "entropy": 5.416598224639893, "epoch": 5.955067107566621, "grad_norm": 1.234375, "learning_rate": 0.00021062013882215086, "loss": 4.7506, "mean_token_accuracy": 0.22751812934875487, "num_tokens": 132765854.0, "step": 76540 }, { "entropy": 5.453408432006836, "epoch": 5.955456136938339, "grad_norm": 1.2578125, "learning_rate": 0.00021059358251184046, "loss": 4.7558, "mean_token_accuracy": 0.22911751568317412, "num_tokens": 132773576.0, "step": 76545 }, { "entropy": 5.401673126220703, "epoch": 5.9558451663100564, "grad_norm": 1.25, "learning_rate": 0.00021056702717879482, "loss": 4.7385, "mean_token_accuracy": 0.23613151460886, "num_tokens": 132782371.0, "step": 76550 }, { "entropy": 5.438835763931275, "epoch": 5.956234195681774, "grad_norm": 1.2265625, "learning_rate": 0.00021054047282341703, "loss": 4.7682, "mean_token_accuracy": 0.22956449985504152, "num_tokens": 132790991.0, "step": 76555 }, { "entropy": 5.419137287139892, "epoch": 5.956623225053492, "grad_norm": 1.1953125, "learning_rate": 0.00021051391944610997, "loss": 4.6743, "mean_token_accuracy": 0.24255043566226958, "num_tokens": 132799817.0, "step": 76560 }, { "entropy": 5.3667065620422365, "epoch": 5.957012254425209, "grad_norm": 1.2734375, "learning_rate": 0.00021048736704727656, "loss": 4.6427, "mean_token_accuracy": 0.23503957390785218, "num_tokens": 132807523.0, "step": 76565 }, { "entropy": 5.388102865219116, "epoch": 5.957401283796926, "grad_norm": 1.2109375, "learning_rate": 0.00021046081562731966, "loss": 4.6925, "mean_token_accuracy": 0.24372862726449968, "num_tokens": 132816314.0, "step": 76570 }, { "entropy": 5.455353593826294, "epoch": 5.957790313168644, "grad_norm": 1.203125, "learning_rate": 0.00021043426518664216, "loss": 4.8079, "mean_token_accuracy": 0.21809467673301697, "num_tokens": 132824738.0, "step": 76575 }, { "entropy": 5.430813026428223, "epoch": 5.958179342540362, "grad_norm": 1.2578125, "learning_rate": 0.00021040771572564693, "loss": 4.713, "mean_token_accuracy": 0.237574964761734, "num_tokens": 132833395.0, "step": 76580 }, { "entropy": 5.431329584121704, "epoch": 5.958568371912079, "grad_norm": 1.390625, "learning_rate": 0.00021038116724473677, "loss": 4.6647, "mean_token_accuracy": 0.23489255011081694, "num_tokens": 132841798.0, "step": 76585 }, { "entropy": 5.465257692337036, "epoch": 5.958957401283797, "grad_norm": 1.296875, "learning_rate": 0.00021035461974431446, "loss": 4.7852, "mean_token_accuracy": 0.21890774518251419, "num_tokens": 132850087.0, "step": 76590 }, { "entropy": 5.436032629013061, "epoch": 5.959346430655515, "grad_norm": 1.375, "learning_rate": 0.00021032807322478303, "loss": 4.7851, "mean_token_accuracy": 0.2263456255197525, "num_tokens": 132858012.0, "step": 76595 }, { "entropy": 5.387731218338013, "epoch": 5.9597354600272325, "grad_norm": 1.296875, "learning_rate": 0.00021030152768654515, "loss": 4.6757, "mean_token_accuracy": 0.23943857699632645, "num_tokens": 132866521.0, "step": 76600 }, { "entropy": 5.44189944267273, "epoch": 5.960124489398949, "grad_norm": 1.296875, "learning_rate": 0.00021027498313000358, "loss": 4.6983, "mean_token_accuracy": 0.23528296649456024, "num_tokens": 132874997.0, "step": 76605 }, { "entropy": 5.475102281570434, "epoch": 5.960513518770667, "grad_norm": 1.296875, "learning_rate": 0.00021024843955556112, "loss": 4.8038, "mean_token_accuracy": 0.21828186959028245, "num_tokens": 132883030.0, "step": 76610 }, { "entropy": 5.3733603954315186, "epoch": 5.960902548142385, "grad_norm": 1.203125, "learning_rate": 0.00021022189696362053, "loss": 4.6543, "mean_token_accuracy": 0.23544911891222, "num_tokens": 132891283.0, "step": 76615 }, { "entropy": 5.3570554733276365, "epoch": 5.961291577514102, "grad_norm": 1.2734375, "learning_rate": 0.0002101953553545845, "loss": 4.6557, "mean_token_accuracy": 0.2361129567027092, "num_tokens": 132899652.0, "step": 76620 }, { "entropy": 5.398224592208862, "epoch": 5.96168060688582, "grad_norm": 1.21875, "learning_rate": 0.0002101688147288559, "loss": 4.7106, "mean_token_accuracy": 0.23126392662525178, "num_tokens": 132908127.0, "step": 76625 }, { "entropy": 5.419182252883911, "epoch": 5.962069636257538, "grad_norm": 1.2265625, "learning_rate": 0.0002101422750868373, "loss": 4.7407, "mean_token_accuracy": 0.2256474807858467, "num_tokens": 132917003.0, "step": 76630 }, { "entropy": 5.4841399669647215, "epoch": 5.962458665629255, "grad_norm": 1.3984375, "learning_rate": 0.0002101157364289315, "loss": 4.817, "mean_token_accuracy": 0.2278971180319786, "num_tokens": 132925008.0, "step": 76635 }, { "entropy": 5.472033834457397, "epoch": 5.962847695000972, "grad_norm": 1.28125, "learning_rate": 0.00021008919875554105, "loss": 4.7369, "mean_token_accuracy": 0.23309367001056672, "num_tokens": 132933238.0, "step": 76640 }, { "entropy": 5.326199388504028, "epoch": 5.96323672437269, "grad_norm": 1.28125, "learning_rate": 0.0002100626620670687, "loss": 4.5771, "mean_token_accuracy": 0.24518004059791565, "num_tokens": 132941469.0, "step": 76645 }, { "entropy": 5.437912368774414, "epoch": 5.963625753744408, "grad_norm": 1.265625, "learning_rate": 0.0002100361263639171, "loss": 4.7642, "mean_token_accuracy": 0.22345100790262223, "num_tokens": 132950888.0, "step": 76650 }, { "entropy": 5.448306655883789, "epoch": 5.964014783116125, "grad_norm": 1.2265625, "learning_rate": 0.00021000959164648892, "loss": 4.7976, "mean_token_accuracy": 0.2331244707107544, "num_tokens": 132959602.0, "step": 76655 }, { "entropy": 5.408717012405395, "epoch": 5.964403812487843, "grad_norm": 1.3125, "learning_rate": 0.00020998305791518668, "loss": 4.7054, "mean_token_accuracy": 0.23554112911224365, "num_tokens": 132967606.0, "step": 76660 }, { "entropy": 5.433862924575806, "epoch": 5.964792841859561, "grad_norm": 1.1640625, "learning_rate": 0.0002099565251704131, "loss": 4.7418, "mean_token_accuracy": 0.2312801092863083, "num_tokens": 132976574.0, "step": 76665 }, { "entropy": 5.303404092788696, "epoch": 5.965181871231278, "grad_norm": 1.2421875, "learning_rate": 0.00020992999341257069, "loss": 4.5951, "mean_token_accuracy": 0.23995437622070312, "num_tokens": 132985778.0, "step": 76670 }, { "entropy": 5.390028429031372, "epoch": 5.965570900602995, "grad_norm": 1.359375, "learning_rate": 0.00020990346264206206, "loss": 4.6381, "mean_token_accuracy": 0.23171315640211104, "num_tokens": 132994755.0, "step": 76675 }, { "entropy": 5.383834266662598, "epoch": 5.965959929974713, "grad_norm": 1.25, "learning_rate": 0.00020987693285928977, "loss": 4.642, "mean_token_accuracy": 0.23269011378288268, "num_tokens": 133003212.0, "step": 76680 }, { "entropy": 5.349404191970825, "epoch": 5.966348959346431, "grad_norm": 1.1484375, "learning_rate": 0.00020985040406465644, "loss": 4.6395, "mean_token_accuracy": 0.2379076063632965, "num_tokens": 133012536.0, "step": 76685 }, { "entropy": 5.353804445266723, "epoch": 5.966737988718148, "grad_norm": 1.1640625, "learning_rate": 0.00020982387625856447, "loss": 4.6609, "mean_token_accuracy": 0.24110918194055558, "num_tokens": 133020960.0, "step": 76690 }, { "entropy": 5.353933238983155, "epoch": 5.967127018089866, "grad_norm": 1.3671875, "learning_rate": 0.0002097973494414165, "loss": 4.6516, "mean_token_accuracy": 0.24323512464761735, "num_tokens": 133029251.0, "step": 76695 }, { "entropy": 5.418486070632935, "epoch": 5.967516047461583, "grad_norm": 1.46875, "learning_rate": 0.00020977082361361488, "loss": 4.7402, "mean_token_accuracy": 0.23197925835847855, "num_tokens": 133037971.0, "step": 76700 }, { "entropy": 5.397760486602783, "epoch": 5.967905076833301, "grad_norm": 1.1484375, "learning_rate": 0.00020974429877556228, "loss": 4.7048, "mean_token_accuracy": 0.2319283053278923, "num_tokens": 133047716.0, "step": 76705 }, { "entropy": 5.548833322525025, "epoch": 5.968294106205018, "grad_norm": 1.3203125, "learning_rate": 0.00020971777492766102, "loss": 4.8258, "mean_token_accuracy": 0.22473503202199935, "num_tokens": 133056072.0, "step": 76710 }, { "entropy": 5.403546905517578, "epoch": 5.968683135576736, "grad_norm": 1.3515625, "learning_rate": 0.00020969125207031365, "loss": 4.6829, "mean_token_accuracy": 0.24093794971704482, "num_tokens": 133064776.0, "step": 76715 }, { "entropy": 5.45290322303772, "epoch": 5.969072164948454, "grad_norm": 1.21875, "learning_rate": 0.00020966473020392256, "loss": 4.7314, "mean_token_accuracy": 0.23198643177747727, "num_tokens": 133073881.0, "step": 76720 }, { "entropy": 5.450905275344849, "epoch": 5.969461194320171, "grad_norm": 1.2578125, "learning_rate": 0.0002096382093288901, "loss": 4.7755, "mean_token_accuracy": 0.22857358455657958, "num_tokens": 133083852.0, "step": 76725 }, { "entropy": 5.415627956390381, "epoch": 5.969850223691889, "grad_norm": 1.296875, "learning_rate": 0.00020961168944561888, "loss": 4.7533, "mean_token_accuracy": 0.23025662302970887, "num_tokens": 133093020.0, "step": 76730 }, { "entropy": 5.422198104858398, "epoch": 5.970239253063606, "grad_norm": 1.1328125, "learning_rate": 0.00020958517055451125, "loss": 4.8085, "mean_token_accuracy": 0.23157608062028884, "num_tokens": 133102027.0, "step": 76735 }, { "entropy": 5.442161512374878, "epoch": 5.970628282435324, "grad_norm": 1.234375, "learning_rate": 0.00020955865265596946, "loss": 4.7047, "mean_token_accuracy": 0.22445060759782792, "num_tokens": 133111248.0, "step": 76740 }, { "entropy": 5.48015513420105, "epoch": 5.971017311807041, "grad_norm": 1.3203125, "learning_rate": 0.000209532135750396, "loss": 4.7423, "mean_token_accuracy": 0.233413402736187, "num_tokens": 133120057.0, "step": 76745 }, { "entropy": 5.457960176467895, "epoch": 5.971406341178759, "grad_norm": 1.328125, "learning_rate": 0.00020950561983819316, "loss": 4.7205, "mean_token_accuracy": 0.23223910182714463, "num_tokens": 133128444.0, "step": 76750 }, { "entropy": 5.355844259262085, "epoch": 5.971795370550477, "grad_norm": 1.3125, "learning_rate": 0.0002094791049197633, "loss": 4.6649, "mean_token_accuracy": 0.23633837699890137, "num_tokens": 133136280.0, "step": 76755 }, { "entropy": 5.328870534896851, "epoch": 5.972184399922194, "grad_norm": 1.2578125, "learning_rate": 0.00020945259099550866, "loss": 4.6786, "mean_token_accuracy": 0.23170171231031417, "num_tokens": 133145190.0, "step": 76760 }, { "entropy": 5.341886806488037, "epoch": 5.972573429293911, "grad_norm": 1.2890625, "learning_rate": 0.00020942607806583174, "loss": 4.6255, "mean_token_accuracy": 0.23914496451616288, "num_tokens": 133153728.0, "step": 76765 }, { "entropy": 5.425568771362305, "epoch": 5.972962458665629, "grad_norm": 1.2578125, "learning_rate": 0.00020939956613113465, "loss": 4.7195, "mean_token_accuracy": 0.22827187329530715, "num_tokens": 133161661.0, "step": 76770 }, { "entropy": 5.382685041427612, "epoch": 5.973351488037347, "grad_norm": 1.3828125, "learning_rate": 0.00020937305519181976, "loss": 4.6334, "mean_token_accuracy": 0.23986938446760178, "num_tokens": 133169591.0, "step": 76775 }, { "entropy": 5.308913469314575, "epoch": 5.973740517409064, "grad_norm": 1.2890625, "learning_rate": 0.00020934654524828927, "loss": 4.5732, "mean_token_accuracy": 0.2455882653594017, "num_tokens": 133178385.0, "step": 76780 }, { "entropy": 5.412352895736694, "epoch": 5.974129546780782, "grad_norm": 1.3671875, "learning_rate": 0.0002093200363009455, "loss": 4.6682, "mean_token_accuracy": 0.2339445799589157, "num_tokens": 133186425.0, "step": 76785 }, { "entropy": 5.467498111724853, "epoch": 5.9745185761525, "grad_norm": 1.2890625, "learning_rate": 0.00020929352835019055, "loss": 4.8113, "mean_token_accuracy": 0.2229521855711937, "num_tokens": 133194378.0, "step": 76790 }, { "entropy": 5.425801753997803, "epoch": 5.974907605524217, "grad_norm": 1.3203125, "learning_rate": 0.00020926702139642677, "loss": 4.674, "mean_token_accuracy": 0.23077545017004014, "num_tokens": 133203113.0, "step": 76795 }, { "entropy": 5.3758197784423825, "epoch": 5.975296634895935, "grad_norm": 1.296875, "learning_rate": 0.00020924051544005636, "loss": 4.6824, "mean_token_accuracy": 0.23808724731206893, "num_tokens": 133212311.0, "step": 76800 }, { "entropy": 5.378590393066406, "epoch": 5.975685664267652, "grad_norm": 1.2421875, "learning_rate": 0.00020921401048148137, "loss": 4.7026, "mean_token_accuracy": 0.2287675067782402, "num_tokens": 133220630.0, "step": 76805 }, { "entropy": 5.353485870361328, "epoch": 5.97607469363937, "grad_norm": 1.2421875, "learning_rate": 0.00020918750652110414, "loss": 4.6469, "mean_token_accuracy": 0.2384280100464821, "num_tokens": 133229095.0, "step": 76810 }, { "entropy": 5.375460052490235, "epoch": 5.976463723011087, "grad_norm": 1.1640625, "learning_rate": 0.00020916100355932677, "loss": 4.7337, "mean_token_accuracy": 0.2304761603474617, "num_tokens": 133238303.0, "step": 76815 }, { "entropy": 5.512848043441773, "epoch": 5.976852752382805, "grad_norm": 1.265625, "learning_rate": 0.00020913450159655133, "loss": 4.793, "mean_token_accuracy": 0.22664903104305267, "num_tokens": 133247380.0, "step": 76820 }, { "entropy": 5.492810344696045, "epoch": 5.977241781754523, "grad_norm": 1.359375, "learning_rate": 0.00020910800063318004, "loss": 4.7434, "mean_token_accuracy": 0.2311605766415596, "num_tokens": 133256180.0, "step": 76825 }, { "entropy": 5.372041320800781, "epoch": 5.97763081112624, "grad_norm": 1.2109375, "learning_rate": 0.0002090815006696149, "loss": 4.6271, "mean_token_accuracy": 0.24168868213891984, "num_tokens": 133263776.0, "step": 76830 }, { "entropy": 5.396262741088867, "epoch": 5.978019840497957, "grad_norm": 1.390625, "learning_rate": 0.00020905500170625808, "loss": 4.7167, "mean_token_accuracy": 0.23224983513355255, "num_tokens": 133272570.0, "step": 76835 }, { "entropy": 5.346427392959595, "epoch": 5.978408869869675, "grad_norm": 1.1640625, "learning_rate": 0.00020902850374351168, "loss": 4.7114, "mean_token_accuracy": 0.23214575201272963, "num_tokens": 133282215.0, "step": 76840 }, { "entropy": 5.357039880752564, "epoch": 5.978797899241393, "grad_norm": 1.234375, "learning_rate": 0.00020900200678177766, "loss": 4.681, "mean_token_accuracy": 0.23055184185504912, "num_tokens": 133290723.0, "step": 76845 }, { "entropy": 5.491289854049683, "epoch": 5.97918692861311, "grad_norm": 1.2578125, "learning_rate": 0.0002089755108214582, "loss": 4.7916, "mean_token_accuracy": 0.2280765637755394, "num_tokens": 133300508.0, "step": 76850 }, { "entropy": 5.3928163051605225, "epoch": 5.979575957984828, "grad_norm": 1.3203125, "learning_rate": 0.00020894901586295529, "loss": 4.6299, "mean_token_accuracy": 0.23911733776330948, "num_tokens": 133309101.0, "step": 76855 }, { "entropy": 5.396538162231446, "epoch": 5.979964987356546, "grad_norm": 1.25, "learning_rate": 0.00020892252190667088, "loss": 4.7025, "mean_token_accuracy": 0.22850079834461212, "num_tokens": 133317586.0, "step": 76860 }, { "entropy": 5.365128374099731, "epoch": 5.980354016728263, "grad_norm": 1.1953125, "learning_rate": 0.000208896028953007, "loss": 4.6528, "mean_token_accuracy": 0.24026117473840714, "num_tokens": 133326335.0, "step": 76865 }, { "entropy": 5.373180675506592, "epoch": 5.98074304609998, "grad_norm": 1.203125, "learning_rate": 0.00020886953700236576, "loss": 4.6607, "mean_token_accuracy": 0.2394168734550476, "num_tokens": 133335219.0, "step": 76870 }, { "entropy": 5.454305171966553, "epoch": 5.981132075471698, "grad_norm": 1.34375, "learning_rate": 0.00020884304605514899, "loss": 4.7711, "mean_token_accuracy": 0.23274015337228776, "num_tokens": 133343620.0, "step": 76875 }, { "entropy": 5.360507965087891, "epoch": 5.981521104843416, "grad_norm": 1.25, "learning_rate": 0.00020881655611175865, "loss": 4.6647, "mean_token_accuracy": 0.23662790805101394, "num_tokens": 133351919.0, "step": 76880 }, { "entropy": 5.408464860916138, "epoch": 5.981910134215133, "grad_norm": 1.3125, "learning_rate": 0.0002087900671725968, "loss": 4.6627, "mean_token_accuracy": 0.23448052108287812, "num_tokens": 133360437.0, "step": 76885 }, { "entropy": 5.355269956588745, "epoch": 5.982299163586851, "grad_norm": 1.359375, "learning_rate": 0.00020876357923806527, "loss": 4.6311, "mean_token_accuracy": 0.2424807220697403, "num_tokens": 133368835.0, "step": 76890 }, { "entropy": 5.40399956703186, "epoch": 5.982688192958569, "grad_norm": 1.234375, "learning_rate": 0.00020873709230856608, "loss": 4.6983, "mean_token_accuracy": 0.23902825117111207, "num_tokens": 133377677.0, "step": 76895 }, { "entropy": 5.438564300537109, "epoch": 5.9830772223302855, "grad_norm": 1.359375, "learning_rate": 0.00020871060638450101, "loss": 4.7355, "mean_token_accuracy": 0.2246285006403923, "num_tokens": 133385694.0, "step": 76900 }, { "entropy": 5.371127033233643, "epoch": 5.983466251702003, "grad_norm": 1.3046875, "learning_rate": 0.0002086841214662719, "loss": 4.6203, "mean_token_accuracy": 0.24992749840021133, "num_tokens": 133393917.0, "step": 76905 }, { "entropy": 5.502904844284058, "epoch": 5.983855281073721, "grad_norm": 1.25, "learning_rate": 0.00020865763755428075, "loss": 4.8552, "mean_token_accuracy": 0.22348951995372773, "num_tokens": 133402784.0, "step": 76910 }, { "entropy": 5.4192009449005125, "epoch": 5.984244310445439, "grad_norm": 1.25, "learning_rate": 0.00020863115464892935, "loss": 4.7198, "mean_token_accuracy": 0.2285832241177559, "num_tokens": 133411693.0, "step": 76915 }, { "entropy": 5.508400535583496, "epoch": 5.984633339817156, "grad_norm": 1.2265625, "learning_rate": 0.00020860467275061952, "loss": 4.8303, "mean_token_accuracy": 0.22432257235050201, "num_tokens": 133420230.0, "step": 76920 }, { "entropy": 5.454340267181396, "epoch": 5.985022369188874, "grad_norm": 1.328125, "learning_rate": 0.00020857819185975308, "loss": 4.681, "mean_token_accuracy": 0.24011431336402894, "num_tokens": 133429069.0, "step": 76925 }, { "entropy": 5.382234907150268, "epoch": 5.985411398560592, "grad_norm": 1.28125, "learning_rate": 0.00020855171197673185, "loss": 4.6833, "mean_token_accuracy": 0.2321868807077408, "num_tokens": 133437133.0, "step": 76930 }, { "entropy": 5.494383811950684, "epoch": 5.985800427932309, "grad_norm": 1.3203125, "learning_rate": 0.0002085252331019577, "loss": 4.879, "mean_token_accuracy": 0.22386016994714736, "num_tokens": 133445575.0, "step": 76935 }, { "entropy": 5.500679588317871, "epoch": 5.986189457304026, "grad_norm": 1.3125, "learning_rate": 0.00020849875523583234, "loss": 4.7436, "mean_token_accuracy": 0.23273541629314423, "num_tokens": 133454735.0, "step": 76940 }, { "entropy": 5.5073107242584225, "epoch": 5.986578486675744, "grad_norm": 1.2109375, "learning_rate": 0.00020847227837875743, "loss": 4.8172, "mean_token_accuracy": 0.22638939172029496, "num_tokens": 133463537.0, "step": 76945 }, { "entropy": 5.382311773300171, "epoch": 5.986967516047462, "grad_norm": 1.234375, "learning_rate": 0.00020844580253113486, "loss": 4.6491, "mean_token_accuracy": 0.23310198038816451, "num_tokens": 133472680.0, "step": 76950 }, { "entropy": 5.404653120040893, "epoch": 5.987356545419179, "grad_norm": 1.3359375, "learning_rate": 0.0002084193276933663, "loss": 4.7091, "mean_token_accuracy": 0.232947938144207, "num_tokens": 133480838.0, "step": 76955 }, { "entropy": 5.394693088531494, "epoch": 5.987745574790897, "grad_norm": 1.40625, "learning_rate": 0.0002083928538658535, "loss": 4.6678, "mean_token_accuracy": 0.23421524912118913, "num_tokens": 133488942.0, "step": 76960 }, { "entropy": 5.40740556716919, "epoch": 5.988134604162614, "grad_norm": 1.2421875, "learning_rate": 0.00020836638104899808, "loss": 4.748, "mean_token_accuracy": 0.22634749561548234, "num_tokens": 133497852.0, "step": 76965 }, { "entropy": 5.516544771194458, "epoch": 5.9885236335343315, "grad_norm": 1.171875, "learning_rate": 0.0002083399092432018, "loss": 4.8144, "mean_token_accuracy": 0.22548949271440505, "num_tokens": 133506383.0, "step": 76970 }, { "entropy": 5.504531812667847, "epoch": 5.988912662906049, "grad_norm": 1.234375, "learning_rate": 0.00020831343844886625, "loss": 4.8104, "mean_token_accuracy": 0.22740807831287385, "num_tokens": 133516045.0, "step": 76975 }, { "entropy": 5.350978183746338, "epoch": 5.989301692277767, "grad_norm": 1.1484375, "learning_rate": 0.00020828696866639324, "loss": 4.6243, "mean_token_accuracy": 0.23697672486305238, "num_tokens": 133525076.0, "step": 76980 }, { "entropy": 5.423917293548584, "epoch": 5.989690721649485, "grad_norm": 1.171875, "learning_rate": 0.00020826049989618422, "loss": 4.7456, "mean_token_accuracy": 0.23019199669361115, "num_tokens": 133533986.0, "step": 76985 }, { "entropy": 5.4026953220367435, "epoch": 5.990079751021202, "grad_norm": 1.25, "learning_rate": 0.00020823403213864077, "loss": 4.6798, "mean_token_accuracy": 0.23516948521137238, "num_tokens": 133542344.0, "step": 76990 }, { "entropy": 5.410585975646972, "epoch": 5.99046878039292, "grad_norm": 1.234375, "learning_rate": 0.00020820756539416475, "loss": 4.6983, "mean_token_accuracy": 0.2353983297944069, "num_tokens": 133552045.0, "step": 76995 }, { "entropy": 5.432126855850219, "epoch": 5.990857809764638, "grad_norm": 1.328125, "learning_rate": 0.00020818109966315757, "loss": 4.6737, "mean_token_accuracy": 0.23556697219610215, "num_tokens": 133560854.0, "step": 77000 }, { "entropy": 5.487018680572509, "epoch": 5.9912468391363545, "grad_norm": 1.21875, "learning_rate": 0.00020815463494602095, "loss": 4.8386, "mean_token_accuracy": 0.22504654675722122, "num_tokens": 133569920.0, "step": 77005 }, { "entropy": 5.378811597824097, "epoch": 5.991635868508072, "grad_norm": 1.25, "learning_rate": 0.00020812817124315626, "loss": 4.6416, "mean_token_accuracy": 0.24096276462078095, "num_tokens": 133578769.0, "step": 77010 }, { "entropy": 5.447092962265015, "epoch": 5.99202489787979, "grad_norm": 1.21875, "learning_rate": 0.00020810170855496514, "loss": 4.7812, "mean_token_accuracy": 0.23128073364496232, "num_tokens": 133586700.0, "step": 77015 }, { "entropy": 5.43983302116394, "epoch": 5.992413927251508, "grad_norm": 1.2109375, "learning_rate": 0.00020807524688184914, "loss": 4.7312, "mean_token_accuracy": 0.22870711982250214, "num_tokens": 133596137.0, "step": 77020 }, { "entropy": 5.428747177124023, "epoch": 5.992802956623225, "grad_norm": 1.1875, "learning_rate": 0.0002080487862242097, "loss": 4.7532, "mean_token_accuracy": 0.22952639907598496, "num_tokens": 133604964.0, "step": 77025 }, { "entropy": 5.461842823028564, "epoch": 5.993191985994943, "grad_norm": 1.203125, "learning_rate": 0.0002080223265824484, "loss": 4.7926, "mean_token_accuracy": 0.22888732254505156, "num_tokens": 133614277.0, "step": 77030 }, { "entropy": 5.36994161605835, "epoch": 5.99358101536666, "grad_norm": 1.265625, "learning_rate": 0.00020799586795696668, "loss": 4.6176, "mean_token_accuracy": 0.24013999253511428, "num_tokens": 133623467.0, "step": 77035 }, { "entropy": 5.393704652786255, "epoch": 5.9939700447383775, "grad_norm": 1.234375, "learning_rate": 0.00020796941034816602, "loss": 4.6542, "mean_token_accuracy": 0.23727721124887466, "num_tokens": 133632695.0, "step": 77040 }, { "entropy": 5.4600080966949465, "epoch": 5.994359074110095, "grad_norm": 1.3203125, "learning_rate": 0.0002079429537564479, "loss": 4.6937, "mean_token_accuracy": 0.23909743130207062, "num_tokens": 133641158.0, "step": 77045 }, { "entropy": 5.350060558319091, "epoch": 5.994748103481813, "grad_norm": 1.328125, "learning_rate": 0.00020791649818221365, "loss": 4.6488, "mean_token_accuracy": 0.23353536128997804, "num_tokens": 133650143.0, "step": 77050 }, { "entropy": 5.369654560089112, "epoch": 5.995137132853531, "grad_norm": 1.2578125, "learning_rate": 0.00020789004362586477, "loss": 4.6546, "mean_token_accuracy": 0.2333401322364807, "num_tokens": 133658483.0, "step": 77055 }, { "entropy": 5.417748689651489, "epoch": 5.995526162225248, "grad_norm": 1.2421875, "learning_rate": 0.0002078635900878027, "loss": 4.7246, "mean_token_accuracy": 0.23428456038236617, "num_tokens": 133667125.0, "step": 77060 }, { "entropy": 5.4392753601074215, "epoch": 5.995915191596966, "grad_norm": 1.3984375, "learning_rate": 0.00020783713756842876, "loss": 4.7031, "mean_token_accuracy": 0.23410880863666533, "num_tokens": 133675445.0, "step": 77065 }, { "entropy": 5.351079654693604, "epoch": 5.996304220968683, "grad_norm": 1.21875, "learning_rate": 0.0002078106860681444, "loss": 4.698, "mean_token_accuracy": 0.23442161828279495, "num_tokens": 133684153.0, "step": 77070 }, { "entropy": 5.4541308879852295, "epoch": 5.9966932503404005, "grad_norm": 1.296875, "learning_rate": 0.00020778423558735087, "loss": 4.7435, "mean_token_accuracy": 0.23942455947399138, "num_tokens": 133692635.0, "step": 77075 }, { "entropy": 5.410097265243531, "epoch": 5.997082279712118, "grad_norm": 1.25, "learning_rate": 0.0002077577861264497, "loss": 4.6472, "mean_token_accuracy": 0.23771531879901886, "num_tokens": 133700900.0, "step": 77080 }, { "entropy": 5.369327259063721, "epoch": 5.997471309083836, "grad_norm": 1.234375, "learning_rate": 0.00020773133768584208, "loss": 4.6812, "mean_token_accuracy": 0.24013512432575226, "num_tokens": 133710020.0, "step": 77085 }, { "entropy": 5.383687973022461, "epoch": 5.9978603384555536, "grad_norm": 1.3359375, "learning_rate": 0.00020770489026592927, "loss": 4.7596, "mean_token_accuracy": 0.23252297937870026, "num_tokens": 133719195.0, "step": 77090 }, { "entropy": 5.423875761032105, "epoch": 5.998249367827271, "grad_norm": 1.2578125, "learning_rate": 0.00020767844386711265, "loss": 4.7006, "mean_token_accuracy": 0.23653915971517564, "num_tokens": 133728378.0, "step": 77095 }, { "entropy": 5.449291133880616, "epoch": 5.998638397198988, "grad_norm": 1.3125, "learning_rate": 0.0002076519984897935, "loss": 4.7074, "mean_token_accuracy": 0.23889687806367874, "num_tokens": 133736788.0, "step": 77100 }, { "entropy": 5.466154766082764, "epoch": 5.999027426570706, "grad_norm": 1.296875, "learning_rate": 0.00020762555413437306, "loss": 4.7934, "mean_token_accuracy": 0.22288607954978942, "num_tokens": 133745236.0, "step": 77105 }, { "entropy": 5.414954757690429, "epoch": 5.9994164559424235, "grad_norm": 1.34375, "learning_rate": 0.0002075991108012526, "loss": 4.6903, "mean_token_accuracy": 0.23577385991811753, "num_tokens": 133753464.0, "step": 77110 }, { "entropy": 5.495847940444946, "epoch": 5.999805485314141, "grad_norm": 1.34375, "learning_rate": 0.0002075726684908334, "loss": 4.7714, "mean_token_accuracy": 0.2259894922375679, "num_tokens": 133762280.0, "step": 77115 }, { "entropy": 5.534921222262913, "epoch": 6.000155611748687, "grad_norm": 1.34375, "learning_rate": 0.00020754622720351663, "loss": 4.7676, "mean_token_accuracy": 0.2317834115690655, "num_tokens": 133769307.0, "step": 77120 }, { "entropy": 5.438278436660767, "epoch": 6.000544641120404, "grad_norm": 1.328125, "learning_rate": 0.00020751978693970335, "loss": 4.6478, "mean_token_accuracy": 0.248997662961483, "num_tokens": 133778219.0, "step": 77125 }, { "entropy": 5.331284666061402, "epoch": 6.000933670492122, "grad_norm": 1.296875, "learning_rate": 0.00020749334769979506, "loss": 4.5485, "mean_token_accuracy": 0.24521005749702454, "num_tokens": 133787213.0, "step": 77130 }, { "entropy": 5.431422853469849, "epoch": 6.00132269986384, "grad_norm": 1.2109375, "learning_rate": 0.00020746690948419272, "loss": 4.6674, "mean_token_accuracy": 0.2399682432413101, "num_tokens": 133795403.0, "step": 77135 }, { "entropy": 5.370991468429565, "epoch": 6.0017117292355575, "grad_norm": 1.2265625, "learning_rate": 0.00020744047229329755, "loss": 4.6549, "mean_token_accuracy": 0.23694311380386351, "num_tokens": 133804656.0, "step": 77140 }, { "entropy": 5.34413161277771, "epoch": 6.002100758607275, "grad_norm": 1.453125, "learning_rate": 0.0002074140361275107, "loss": 4.5194, "mean_token_accuracy": 0.24938977807760238, "num_tokens": 133812172.0, "step": 77145 }, { "entropy": 5.311563873291016, "epoch": 6.002489787978992, "grad_norm": 1.328125, "learning_rate": 0.00020738760098723324, "loss": 4.6054, "mean_token_accuracy": 0.2485032483935356, "num_tokens": 133820635.0, "step": 77150 }, { "entropy": 5.428660440444946, "epoch": 6.00287881735071, "grad_norm": 1.1875, "learning_rate": 0.00020736116687286634, "loss": 4.6787, "mean_token_accuracy": 0.236958110332489, "num_tokens": 133830056.0, "step": 77155 }, { "entropy": 5.3535058975219725, "epoch": 6.003267846722427, "grad_norm": 1.296875, "learning_rate": 0.00020733473378481112, "loss": 4.5657, "mean_token_accuracy": 0.24297693073749543, "num_tokens": 133838688.0, "step": 77160 }, { "entropy": 5.362388658523559, "epoch": 6.003656876094145, "grad_norm": 1.2265625, "learning_rate": 0.0002073083017234685, "loss": 4.5706, "mean_token_accuracy": 0.2524039775133133, "num_tokens": 133847525.0, "step": 77165 }, { "entropy": 5.343952178955078, "epoch": 6.004045905465863, "grad_norm": 1.2421875, "learning_rate": 0.00020728187068923975, "loss": 4.666, "mean_token_accuracy": 0.23959900587797164, "num_tokens": 133856186.0, "step": 77170 }, { "entropy": 5.302262639999389, "epoch": 6.0044349348375805, "grad_norm": 1.25, "learning_rate": 0.00020725544068252584, "loss": 4.5156, "mean_token_accuracy": 0.25107404589653015, "num_tokens": 133864509.0, "step": 77175 }, { "entropy": 5.379871511459351, "epoch": 6.004823964209298, "grad_norm": 1.21875, "learning_rate": 0.0002072290117037277, "loss": 4.6181, "mean_token_accuracy": 0.24093781560659408, "num_tokens": 133873285.0, "step": 77180 }, { "entropy": 5.455144166946411, "epoch": 6.005212993581015, "grad_norm": 1.1640625, "learning_rate": 0.00020720258375324653, "loss": 4.7144, "mean_token_accuracy": 0.2286084219813347, "num_tokens": 133882053.0, "step": 77185 }, { "entropy": 5.429717397689819, "epoch": 6.005602022952733, "grad_norm": 1.3046875, "learning_rate": 0.0002071761568314831, "loss": 4.7057, "mean_token_accuracy": 0.23580383956432344, "num_tokens": 133891048.0, "step": 77190 }, { "entropy": 5.367566728591919, "epoch": 6.00599105232445, "grad_norm": 1.296875, "learning_rate": 0.0002071497309388387, "loss": 4.6492, "mean_token_accuracy": 0.24195114076137542, "num_tokens": 133899689.0, "step": 77195 }, { "entropy": 5.487112283706665, "epoch": 6.006380081696168, "grad_norm": 1.28125, "learning_rate": 0.00020712330607571407, "loss": 4.6804, "mean_token_accuracy": 0.23912966698408128, "num_tokens": 133907874.0, "step": 77200 }, { "entropy": 5.347855567932129, "epoch": 6.006769111067886, "grad_norm": 1.125, "learning_rate": 0.00020709688224251029, "loss": 4.5642, "mean_token_accuracy": 0.24595350474119188, "num_tokens": 133917124.0, "step": 77205 }, { "entropy": 5.467001867294312, "epoch": 6.0071581404396035, "grad_norm": 1.5, "learning_rate": 0.00020707045943962817, "loss": 4.7333, "mean_token_accuracy": 0.23261107504367828, "num_tokens": 133926381.0, "step": 77210 }, { "entropy": 5.482918214797974, "epoch": 6.007547169811321, "grad_norm": 1.265625, "learning_rate": 0.0002070440376674687, "loss": 4.7332, "mean_token_accuracy": 0.23646429032087327, "num_tokens": 133934459.0, "step": 77215 }, { "entropy": 5.429720306396485, "epoch": 6.007936199183038, "grad_norm": 1.3828125, "learning_rate": 0.00020701761692643283, "loss": 4.6425, "mean_token_accuracy": 0.24333780407905578, "num_tokens": 133943216.0, "step": 77220 }, { "entropy": 5.342742586135865, "epoch": 6.008325228554756, "grad_norm": 1.2734375, "learning_rate": 0.00020699119721692138, "loss": 4.5096, "mean_token_accuracy": 0.25699692517518996, "num_tokens": 133951762.0, "step": 77225 }, { "entropy": 5.3234082698822025, "epoch": 6.008714257926473, "grad_norm": 1.1328125, "learning_rate": 0.00020696477853933531, "loss": 4.579, "mean_token_accuracy": 0.24454302787780763, "num_tokens": 133961107.0, "step": 77230 }, { "entropy": 5.440021276473999, "epoch": 6.009103287298191, "grad_norm": 1.4609375, "learning_rate": 0.0002069383608940754, "loss": 4.7446, "mean_token_accuracy": 0.22733221352100372, "num_tokens": 133969485.0, "step": 77235 }, { "entropy": 5.376610469818115, "epoch": 6.009492316669909, "grad_norm": 1.359375, "learning_rate": 0.00020691194428154258, "loss": 4.6283, "mean_token_accuracy": 0.24553134739398957, "num_tokens": 133977528.0, "step": 77240 }, { "entropy": 5.453963327407837, "epoch": 6.0098813460416265, "grad_norm": 1.2109375, "learning_rate": 0.00020688552870213762, "loss": 4.7329, "mean_token_accuracy": 0.2372319296002388, "num_tokens": 133986205.0, "step": 77245 }, { "entropy": 5.397297334671021, "epoch": 6.010270375413343, "grad_norm": 1.3671875, "learning_rate": 0.0002068591141562614, "loss": 4.609, "mean_token_accuracy": 0.24004323929548263, "num_tokens": 133994843.0, "step": 77250 }, { "entropy": 5.4881233215332035, "epoch": 6.010659404785061, "grad_norm": 1.2578125, "learning_rate": 0.00020683270064431454, "loss": 4.8094, "mean_token_accuracy": 0.2298088014125824, "num_tokens": 134004005.0, "step": 77255 }, { "entropy": 5.3949610710144045, "epoch": 6.011048434156779, "grad_norm": 1.296875, "learning_rate": 0.000206806288166698, "loss": 4.6679, "mean_token_accuracy": 0.23687061965465545, "num_tokens": 134012765.0, "step": 77260 }, { "entropy": 5.455898714065552, "epoch": 6.011437463528496, "grad_norm": 1.2578125, "learning_rate": 0.00020677987672381248, "loss": 4.6581, "mean_token_accuracy": 0.23155538886785507, "num_tokens": 134021397.0, "step": 77265 }, { "entropy": 5.454668283462524, "epoch": 6.011826492900214, "grad_norm": 1.2734375, "learning_rate": 0.0002067534663160588, "loss": 4.6687, "mean_token_accuracy": 0.23130126148462296, "num_tokens": 134029803.0, "step": 77270 }, { "entropy": 5.365855598449707, "epoch": 6.012215522271932, "grad_norm": 1.265625, "learning_rate": 0.00020672705694383759, "loss": 4.5896, "mean_token_accuracy": 0.25146892219781875, "num_tokens": 134038804.0, "step": 77275 }, { "entropy": 5.3507527828216555, "epoch": 6.0126045516436495, "grad_norm": 1.234375, "learning_rate": 0.00020670064860754973, "loss": 4.5786, "mean_token_accuracy": 0.24565448462963105, "num_tokens": 134047642.0, "step": 77280 }, { "entropy": 5.3595164775848385, "epoch": 6.012993581015366, "grad_norm": 1.234375, "learning_rate": 0.0002066742413075957, "loss": 4.598, "mean_token_accuracy": 0.2372659847140312, "num_tokens": 134055968.0, "step": 77285 }, { "entropy": 5.366675615310669, "epoch": 6.013382610387084, "grad_norm": 1.3671875, "learning_rate": 0.00020664783504437635, "loss": 4.6129, "mean_token_accuracy": 0.2429476037621498, "num_tokens": 134064236.0, "step": 77290 }, { "entropy": 5.411853790283203, "epoch": 6.013771639758802, "grad_norm": 1.3671875, "learning_rate": 0.0002066214298182923, "loss": 4.7298, "mean_token_accuracy": 0.2253555178642273, "num_tokens": 134072713.0, "step": 77295 }, { "entropy": 5.330868101119995, "epoch": 6.014160669130519, "grad_norm": 1.328125, "learning_rate": 0.00020659502562974424, "loss": 4.5553, "mean_token_accuracy": 0.2555545374751091, "num_tokens": 134081889.0, "step": 77300 }, { "entropy": 5.375437927246094, "epoch": 6.014549698502237, "grad_norm": 1.28125, "learning_rate": 0.00020656862247913277, "loss": 4.5999, "mean_token_accuracy": 0.24149583727121354, "num_tokens": 134090163.0, "step": 77305 }, { "entropy": 5.399028539657593, "epoch": 6.014938727873955, "grad_norm": 1.265625, "learning_rate": 0.00020654222036685854, "loss": 4.6409, "mean_token_accuracy": 0.24319502860307693, "num_tokens": 134099421.0, "step": 77310 }, { "entropy": 5.453107690811157, "epoch": 6.0153277572456725, "grad_norm": 1.171875, "learning_rate": 0.00020651581929332215, "loss": 4.7006, "mean_token_accuracy": 0.23674021512269974, "num_tokens": 134108132.0, "step": 77315 }, { "entropy": 5.3733922958374025, "epoch": 6.015716786617389, "grad_norm": 1.328125, "learning_rate": 0.00020648941925892418, "loss": 4.6844, "mean_token_accuracy": 0.23622374534606932, "num_tokens": 134116292.0, "step": 77320 }, { "entropy": 5.420813083648682, "epoch": 6.016105815989107, "grad_norm": 1.3125, "learning_rate": 0.00020646302026406516, "loss": 4.6797, "mean_token_accuracy": 0.23304443061351776, "num_tokens": 134124261.0, "step": 77325 }, { "entropy": 5.35989465713501, "epoch": 6.016494845360825, "grad_norm": 1.375, "learning_rate": 0.00020643662230914584, "loss": 4.554, "mean_token_accuracy": 0.24283139258623124, "num_tokens": 134131853.0, "step": 77330 }, { "entropy": 5.364595031738281, "epoch": 6.016883874732542, "grad_norm": 1.2734375, "learning_rate": 0.00020641022539456661, "loss": 4.6474, "mean_token_accuracy": 0.24322579652071, "num_tokens": 134141164.0, "step": 77335 }, { "entropy": 5.2948705673217775, "epoch": 6.01727290410426, "grad_norm": 1.2109375, "learning_rate": 0.00020638382952072805, "loss": 4.5691, "mean_token_accuracy": 0.24413906633853913, "num_tokens": 134150145.0, "step": 77340 }, { "entropy": 5.4313396453857425, "epoch": 6.017661933475978, "grad_norm": 1.2578125, "learning_rate": 0.00020635743468803064, "loss": 4.6716, "mean_token_accuracy": 0.23640408366918564, "num_tokens": 134158705.0, "step": 77345 }, { "entropy": 5.415476369857788, "epoch": 6.018050962847695, "grad_norm": 1.2421875, "learning_rate": 0.0002063310408968749, "loss": 4.6572, "mean_token_accuracy": 0.2484483614563942, "num_tokens": 134166852.0, "step": 77350 }, { "entropy": 5.355245161056518, "epoch": 6.018439992219412, "grad_norm": 1.3359375, "learning_rate": 0.0002063046481476613, "loss": 4.603, "mean_token_accuracy": 0.24671286940574647, "num_tokens": 134175607.0, "step": 77355 }, { "entropy": 5.3549168586730955, "epoch": 6.01882902159113, "grad_norm": 1.328125, "learning_rate": 0.0002062782564407904, "loss": 4.5825, "mean_token_accuracy": 0.25098644345998766, "num_tokens": 134184958.0, "step": 77360 }, { "entropy": 5.369450473785401, "epoch": 6.019218050962848, "grad_norm": 1.34375, "learning_rate": 0.00020625186577666256, "loss": 4.5672, "mean_token_accuracy": 0.2531695455312729, "num_tokens": 134193250.0, "step": 77365 }, { "entropy": 5.434607410430909, "epoch": 6.019607080334565, "grad_norm": 1.1953125, "learning_rate": 0.00020622547615567816, "loss": 4.734, "mean_token_accuracy": 0.23089329600334169, "num_tokens": 134202459.0, "step": 77370 }, { "entropy": 5.3298104763031, "epoch": 6.019996109706283, "grad_norm": 1.3046875, "learning_rate": 0.0002061990875782378, "loss": 4.6206, "mean_token_accuracy": 0.2451135203242302, "num_tokens": 134211073.0, "step": 77375 }, { "entropy": 5.42009916305542, "epoch": 6.020385139078001, "grad_norm": 1.390625, "learning_rate": 0.00020617270004474165, "loss": 4.6818, "mean_token_accuracy": 0.23192584961652757, "num_tokens": 134220633.0, "step": 77380 }, { "entropy": 5.432529067993164, "epoch": 6.020774168449718, "grad_norm": 1.1875, "learning_rate": 0.00020614631355559033, "loss": 4.6239, "mean_token_accuracy": 0.24781686812639236, "num_tokens": 134229574.0, "step": 77385 }, { "entropy": 5.340813302993775, "epoch": 6.021163197821435, "grad_norm": 1.2265625, "learning_rate": 0.000206119928111184, "loss": 4.5804, "mean_token_accuracy": 0.234741273522377, "num_tokens": 134238927.0, "step": 77390 }, { "entropy": 5.405009460449219, "epoch": 6.021552227193153, "grad_norm": 1.2421875, "learning_rate": 0.00020609354371192324, "loss": 4.6577, "mean_token_accuracy": 0.24255121052265166, "num_tokens": 134247635.0, "step": 77395 }, { "entropy": 5.429850912094116, "epoch": 6.021941256564871, "grad_norm": 1.21875, "learning_rate": 0.00020606716035820823, "loss": 4.6017, "mean_token_accuracy": 0.24273055791854858, "num_tokens": 134255973.0, "step": 77400 }, { "entropy": 5.338968992233276, "epoch": 6.022330285936588, "grad_norm": 1.171875, "learning_rate": 0.00020604077805043932, "loss": 4.6162, "mean_token_accuracy": 0.24828810691833497, "num_tokens": 134264482.0, "step": 77405 }, { "entropy": 5.4235467433929445, "epoch": 6.022719315308306, "grad_norm": 1.2265625, "learning_rate": 0.0002060143967890169, "loss": 4.7943, "mean_token_accuracy": 0.23333940505981446, "num_tokens": 134273849.0, "step": 77410 }, { "entropy": 5.391621017456055, "epoch": 6.023108344680024, "grad_norm": 1.265625, "learning_rate": 0.00020598801657434118, "loss": 4.6676, "mean_token_accuracy": 0.23804791569709777, "num_tokens": 134282421.0, "step": 77415 }, { "entropy": 5.348129606246948, "epoch": 6.023497374051741, "grad_norm": 1.296875, "learning_rate": 0.00020596163740681245, "loss": 4.5869, "mean_token_accuracy": 0.24492659866809846, "num_tokens": 134290832.0, "step": 77420 }, { "entropy": 5.415919637680053, "epoch": 6.023886403423458, "grad_norm": 1.3359375, "learning_rate": 0.000205935259286831, "loss": 4.7072, "mean_token_accuracy": 0.23694663792848586, "num_tokens": 134298762.0, "step": 77425 }, { "entropy": 5.461903095245361, "epoch": 6.024275432795176, "grad_norm": 1.2421875, "learning_rate": 0.0002059088822147971, "loss": 4.7066, "mean_token_accuracy": 0.23211790174245833, "num_tokens": 134307058.0, "step": 77430 }, { "entropy": 5.432510805130005, "epoch": 6.024664462166894, "grad_norm": 1.2578125, "learning_rate": 0.00020588250619111087, "loss": 4.6324, "mean_token_accuracy": 0.24352308511734008, "num_tokens": 134316081.0, "step": 77435 }, { "entropy": 5.409109973907471, "epoch": 6.025053491538611, "grad_norm": 1.21875, "learning_rate": 0.0002058561312161727, "loss": 4.6453, "mean_token_accuracy": 0.23787467628717424, "num_tokens": 134325033.0, "step": 77440 }, { "entropy": 5.53907356262207, "epoch": 6.025442520910329, "grad_norm": 1.3515625, "learning_rate": 0.00020582975729038262, "loss": 4.7793, "mean_token_accuracy": 0.23341430723667145, "num_tokens": 134333954.0, "step": 77445 }, { "entropy": 5.482991743087768, "epoch": 6.025831550282046, "grad_norm": 1.265625, "learning_rate": 0.00020580338441414088, "loss": 4.7381, "mean_token_accuracy": 0.23181652128696442, "num_tokens": 134343686.0, "step": 77450 }, { "entropy": 5.496955823898316, "epoch": 6.026220579653764, "grad_norm": 1.2421875, "learning_rate": 0.00020577701258784754, "loss": 4.6876, "mean_token_accuracy": 0.23586950004100798, "num_tokens": 134351977.0, "step": 77455 }, { "entropy": 5.388966083526611, "epoch": 6.026609609025481, "grad_norm": 1.1875, "learning_rate": 0.00020575064181190295, "loss": 4.6554, "mean_token_accuracy": 0.23672526925802231, "num_tokens": 134360809.0, "step": 77460 }, { "entropy": 5.338500118255615, "epoch": 6.026998638397199, "grad_norm": 1.28125, "learning_rate": 0.00020572427208670713, "loss": 4.5703, "mean_token_accuracy": 0.23825763314962387, "num_tokens": 134370027.0, "step": 77465 }, { "entropy": 5.3764149188995365, "epoch": 6.027387667768917, "grad_norm": 1.3671875, "learning_rate": 0.00020569790341266027, "loss": 4.6011, "mean_token_accuracy": 0.24512943774461746, "num_tokens": 134378081.0, "step": 77470 }, { "entropy": 5.493074035644531, "epoch": 6.027776697140634, "grad_norm": 1.2734375, "learning_rate": 0.0002056715357901624, "loss": 4.8286, "mean_token_accuracy": 0.22392419576644898, "num_tokens": 134386529.0, "step": 77475 }, { "entropy": 5.41727499961853, "epoch": 6.028165726512352, "grad_norm": 1.328125, "learning_rate": 0.00020564516921961362, "loss": 4.6641, "mean_token_accuracy": 0.23065652698278427, "num_tokens": 134394899.0, "step": 77480 }, { "entropy": 5.457625246047973, "epoch": 6.028554755884069, "grad_norm": 1.328125, "learning_rate": 0.000205618803701414, "loss": 4.639, "mean_token_accuracy": 0.24349479377269745, "num_tokens": 134403724.0, "step": 77485 }, { "entropy": 5.444463872909546, "epoch": 6.028943785255787, "grad_norm": 1.2734375, "learning_rate": 0.0002055924392359636, "loss": 4.7205, "mean_token_accuracy": 0.2358221247792244, "num_tokens": 134412491.0, "step": 77490 }, { "entropy": 5.359148979187012, "epoch": 6.029332814627504, "grad_norm": 1.203125, "learning_rate": 0.0002055660758236625, "loss": 4.6576, "mean_token_accuracy": 0.23717488944530488, "num_tokens": 134421232.0, "step": 77495 }, { "entropy": 5.312301158905029, "epoch": 6.029721843999222, "grad_norm": 1.2421875, "learning_rate": 0.00020553971346491063, "loss": 4.5496, "mean_token_accuracy": 0.24213007241487502, "num_tokens": 134429976.0, "step": 77500 }, { "entropy": 5.413352108001709, "epoch": 6.03011087337094, "grad_norm": 1.2109375, "learning_rate": 0.00020551335216010804, "loss": 4.6575, "mean_token_accuracy": 0.23858368694782256, "num_tokens": 134439214.0, "step": 77505 }, { "entropy": 5.436894369125366, "epoch": 6.030499902742657, "grad_norm": 1.2734375, "learning_rate": 0.0002054869919096548, "loss": 4.6705, "mean_token_accuracy": 0.23456440716981888, "num_tokens": 134447392.0, "step": 77510 }, { "entropy": 5.358858728408814, "epoch": 6.030888932114375, "grad_norm": 1.3671875, "learning_rate": 0.00020546063271395076, "loss": 4.522, "mean_token_accuracy": 0.2514137804508209, "num_tokens": 134454825.0, "step": 77515 }, { "entropy": 5.434662294387818, "epoch": 6.031277961486092, "grad_norm": 1.25, "learning_rate": 0.00020543427457339592, "loss": 4.7025, "mean_token_accuracy": 0.23259417414665223, "num_tokens": 134463195.0, "step": 77520 }, { "entropy": 5.344886398315429, "epoch": 6.0316669908578096, "grad_norm": 1.1875, "learning_rate": 0.00020540791748839028, "loss": 4.5801, "mean_token_accuracy": 0.24360698610544204, "num_tokens": 134471714.0, "step": 77525 }, { "entropy": 5.457853746414185, "epoch": 6.032056020229527, "grad_norm": 1.25, "learning_rate": 0.00020538156145933373, "loss": 4.6745, "mean_token_accuracy": 0.23651942759752273, "num_tokens": 134479952.0, "step": 77530 }, { "entropy": 5.393327617645264, "epoch": 6.032445049601245, "grad_norm": 1.3671875, "learning_rate": 0.00020535520648662614, "loss": 4.6552, "mean_token_accuracy": 0.24701514542102815, "num_tokens": 134488776.0, "step": 77535 }, { "entropy": 5.324007892608643, "epoch": 6.032834078972963, "grad_norm": 1.375, "learning_rate": 0.00020532885257066748, "loss": 4.6066, "mean_token_accuracy": 0.23661684691905976, "num_tokens": 134497493.0, "step": 77540 }, { "entropy": 5.431989336013794, "epoch": 6.03322310834468, "grad_norm": 1.2890625, "learning_rate": 0.00020530249971185754, "loss": 4.7552, "mean_token_accuracy": 0.23398895412683487, "num_tokens": 134507491.0, "step": 77545 }, { "entropy": 5.5316530704498295, "epoch": 6.033612137716397, "grad_norm": 1.421875, "learning_rate": 0.00020527614791059635, "loss": 4.7337, "mean_token_accuracy": 0.2320709139108658, "num_tokens": 134515561.0, "step": 77550 }, { "entropy": 5.343206167221069, "epoch": 6.034001167088115, "grad_norm": 1.3046875, "learning_rate": 0.00020524979716728353, "loss": 4.5463, "mean_token_accuracy": 0.25084415823221207, "num_tokens": 134524160.0, "step": 77555 }, { "entropy": 5.403464031219483, "epoch": 6.0343901964598325, "grad_norm": 1.3046875, "learning_rate": 0.00020522344748231903, "loss": 4.7009, "mean_token_accuracy": 0.24279077649116515, "num_tokens": 134533045.0, "step": 77560 }, { "entropy": 5.406049585342407, "epoch": 6.03477922583155, "grad_norm": 1.3984375, "learning_rate": 0.00020519709885610267, "loss": 4.658, "mean_token_accuracy": 0.23879704028367996, "num_tokens": 134541254.0, "step": 77565 }, { "entropy": 5.349804544448853, "epoch": 6.035168255203268, "grad_norm": 1.265625, "learning_rate": 0.00020517075128903423, "loss": 4.5813, "mean_token_accuracy": 0.2480908066034317, "num_tokens": 134549873.0, "step": 77570 }, { "entropy": 5.496742010116577, "epoch": 6.035557284574986, "grad_norm": 1.3359375, "learning_rate": 0.00020514440478151352, "loss": 4.7539, "mean_token_accuracy": 0.23577855676412582, "num_tokens": 134558971.0, "step": 77575 }, { "entropy": 5.442083406448364, "epoch": 6.035946313946703, "grad_norm": 1.3515625, "learning_rate": 0.00020511805933394022, "loss": 4.7215, "mean_token_accuracy": 0.23782805353403091, "num_tokens": 134567675.0, "step": 77580 }, { "entropy": 5.440418338775634, "epoch": 6.03633534331842, "grad_norm": 1.3515625, "learning_rate": 0.00020509171494671418, "loss": 4.7577, "mean_token_accuracy": 0.23647967278957366, "num_tokens": 134575737.0, "step": 77585 }, { "entropy": 5.444126033782959, "epoch": 6.036724372690138, "grad_norm": 1.2890625, "learning_rate": 0.00020506537162023503, "loss": 4.6956, "mean_token_accuracy": 0.23379986733198166, "num_tokens": 134585098.0, "step": 77590 }, { "entropy": 5.310971879959107, "epoch": 6.0371134020618555, "grad_norm": 1.28125, "learning_rate": 0.00020503902935490266, "loss": 4.5183, "mean_token_accuracy": 0.2511457070708275, "num_tokens": 134594125.0, "step": 77595 }, { "entropy": 5.334113883972168, "epoch": 6.037502431433573, "grad_norm": 1.171875, "learning_rate": 0.00020501268815111657, "loss": 4.6063, "mean_token_accuracy": 0.24488144963979722, "num_tokens": 134602993.0, "step": 77600 }, { "entropy": 5.346925544738769, "epoch": 6.037891460805291, "grad_norm": 1.2890625, "learning_rate": 0.00020498634800927663, "loss": 4.5693, "mean_token_accuracy": 0.2447124019265175, "num_tokens": 134611363.0, "step": 77605 }, { "entropy": 5.386383152008056, "epoch": 6.038280490177009, "grad_norm": 1.2734375, "learning_rate": 0.00020496000892978233, "loss": 4.7031, "mean_token_accuracy": 0.23290566653013228, "num_tokens": 134619785.0, "step": 77610 }, { "entropy": 5.399725341796875, "epoch": 6.038669519548726, "grad_norm": 1.359375, "learning_rate": 0.0002049336709130335, "loss": 4.637, "mean_token_accuracy": 0.2401324227452278, "num_tokens": 134627753.0, "step": 77615 }, { "entropy": 5.406328916549683, "epoch": 6.039058548920443, "grad_norm": 1.2734375, "learning_rate": 0.00020490733395942969, "loss": 4.6806, "mean_token_accuracy": 0.24063858091831208, "num_tokens": 134636302.0, "step": 77620 }, { "entropy": 5.286217546463012, "epoch": 6.039447578292161, "grad_norm": 1.328125, "learning_rate": 0.00020488099806937043, "loss": 4.513, "mean_token_accuracy": 0.255272401869297, "num_tokens": 134645398.0, "step": 77625 }, { "entropy": 5.417007493972778, "epoch": 6.0398366076638785, "grad_norm": 1.296875, "learning_rate": 0.0002048546632432555, "loss": 4.5983, "mean_token_accuracy": 0.24469622522592543, "num_tokens": 134653751.0, "step": 77630 }, { "entropy": 5.344275712966919, "epoch": 6.040225637035596, "grad_norm": 1.28125, "learning_rate": 0.00020482832948148444, "loss": 4.6186, "mean_token_accuracy": 0.23836632519960405, "num_tokens": 134662226.0, "step": 77635 }, { "entropy": 5.275543260574341, "epoch": 6.040614666407314, "grad_norm": 1.390625, "learning_rate": 0.0002048019967844567, "loss": 4.5993, "mean_token_accuracy": 0.24343917965888978, "num_tokens": 134670108.0, "step": 77640 }, { "entropy": 5.412452697753906, "epoch": 6.041003695779032, "grad_norm": 1.296875, "learning_rate": 0.00020477566515257197, "loss": 4.6759, "mean_token_accuracy": 0.23912333250045775, "num_tokens": 134678521.0, "step": 77645 }, { "entropy": 5.42821192741394, "epoch": 6.041392725150749, "grad_norm": 1.3515625, "learning_rate": 0.00020474933458622974, "loss": 4.6726, "mean_token_accuracy": 0.23464707136154175, "num_tokens": 134687504.0, "step": 77650 }, { "entropy": 5.369917297363282, "epoch": 6.041781754522466, "grad_norm": 1.3203125, "learning_rate": 0.00020472300508582946, "loss": 4.5893, "mean_token_accuracy": 0.2439635291695595, "num_tokens": 134696119.0, "step": 77655 }, { "entropy": 5.381813001632691, "epoch": 6.042170783894184, "grad_norm": 1.3359375, "learning_rate": 0.00020469667665177084, "loss": 4.6071, "mean_token_accuracy": 0.2444898694753647, "num_tokens": 134704497.0, "step": 77660 }, { "entropy": 5.36807861328125, "epoch": 6.0425598132659015, "grad_norm": 1.3203125, "learning_rate": 0.00020467034928445323, "loss": 4.6621, "mean_token_accuracy": 0.23884664922952653, "num_tokens": 134713108.0, "step": 77665 }, { "entropy": 5.4359273433685305, "epoch": 6.042948842637619, "grad_norm": 1.2890625, "learning_rate": 0.00020464402298427608, "loss": 4.7173, "mean_token_accuracy": 0.23718032687902452, "num_tokens": 134721747.0, "step": 77670 }, { "entropy": 5.426615810394287, "epoch": 6.043337872009337, "grad_norm": 1.2734375, "learning_rate": 0.00020461769775163897, "loss": 4.6956, "mean_token_accuracy": 0.2366696611046791, "num_tokens": 134730595.0, "step": 77675 }, { "entropy": 5.364318895339966, "epoch": 6.043726901381055, "grad_norm": 1.4375, "learning_rate": 0.00020459137358694126, "loss": 4.5714, "mean_token_accuracy": 0.24899971038103103, "num_tokens": 134738359.0, "step": 77680 }, { "entropy": 5.365635013580322, "epoch": 6.044115930752771, "grad_norm": 1.234375, "learning_rate": 0.00020456505049058234, "loss": 4.6476, "mean_token_accuracy": 0.24341872334480286, "num_tokens": 134747427.0, "step": 77685 }, { "entropy": 5.373874282836914, "epoch": 6.044504960124489, "grad_norm": 1.375, "learning_rate": 0.00020453872846296168, "loss": 4.6803, "mean_token_accuracy": 0.23554707914590836, "num_tokens": 134756177.0, "step": 77690 }, { "entropy": 5.430577182769776, "epoch": 6.044893989496207, "grad_norm": 1.46875, "learning_rate": 0.00020451240750447868, "loss": 4.6787, "mean_token_accuracy": 0.24205006659030914, "num_tokens": 134764715.0, "step": 77695 }, { "entropy": 5.313101577758789, "epoch": 6.0452830188679245, "grad_norm": 1.265625, "learning_rate": 0.00020448608761553273, "loss": 4.5327, "mean_token_accuracy": 0.24447813630104065, "num_tokens": 134773934.0, "step": 77700 }, { "entropy": 5.414363622665405, "epoch": 6.045672048239642, "grad_norm": 1.3671875, "learning_rate": 0.00020445976879652312, "loss": 4.7215, "mean_token_accuracy": 0.23208819329738617, "num_tokens": 134781957.0, "step": 77705 }, { "entropy": 5.377001047134399, "epoch": 6.04606107761136, "grad_norm": 1.3828125, "learning_rate": 0.00020443345104784934, "loss": 4.5883, "mean_token_accuracy": 0.2485720098018646, "num_tokens": 134790228.0, "step": 77710 }, { "entropy": 5.4520289421081545, "epoch": 6.046450106983078, "grad_norm": 1.5, "learning_rate": 0.00020440713436991055, "loss": 4.7041, "mean_token_accuracy": 0.2431233271956444, "num_tokens": 134798298.0, "step": 77715 }, { "entropy": 5.379271411895752, "epoch": 6.046839136354794, "grad_norm": 1.2578125, "learning_rate": 0.000204380818763106, "loss": 4.5882, "mean_token_accuracy": 0.24223340451717376, "num_tokens": 134807623.0, "step": 77720 }, { "entropy": 5.389578723907471, "epoch": 6.047228165726512, "grad_norm": 1.265625, "learning_rate": 0.00020435450422783525, "loss": 4.6399, "mean_token_accuracy": 0.24712451696395873, "num_tokens": 134816004.0, "step": 77725 }, { "entropy": 5.349229621887207, "epoch": 6.04761719509823, "grad_norm": 1.3046875, "learning_rate": 0.00020432819076449745, "loss": 4.6097, "mean_token_accuracy": 0.24354492872953415, "num_tokens": 134825059.0, "step": 77730 }, { "entropy": 5.385253524780273, "epoch": 6.0480062244699475, "grad_norm": 1.3515625, "learning_rate": 0.00020430187837349186, "loss": 4.6294, "mean_token_accuracy": 0.2420099124312401, "num_tokens": 134833526.0, "step": 77735 }, { "entropy": 5.327546548843384, "epoch": 6.048395253841665, "grad_norm": 1.34375, "learning_rate": 0.00020427556705521777, "loss": 4.5617, "mean_token_accuracy": 0.24564434736967086, "num_tokens": 134841575.0, "step": 77740 }, { "entropy": 5.442416191101074, "epoch": 6.048784283213383, "grad_norm": 1.2421875, "learning_rate": 0.0002042492568100744, "loss": 4.6746, "mean_token_accuracy": 0.24136011600494384, "num_tokens": 134850506.0, "step": 77745 }, { "entropy": 5.369341468811035, "epoch": 6.049173312585101, "grad_norm": 1.296875, "learning_rate": 0.0002042229476384609, "loss": 4.6804, "mean_token_accuracy": 0.23446427285671234, "num_tokens": 134858954.0, "step": 77750 }, { "entropy": 5.358863973617554, "epoch": 6.049562341956817, "grad_norm": 1.1953125, "learning_rate": 0.00020419663954077656, "loss": 4.6, "mean_token_accuracy": 0.24840070456266403, "num_tokens": 134867390.0, "step": 77755 }, { "entropy": 5.309463167190552, "epoch": 6.049951371328535, "grad_norm": 1.2890625, "learning_rate": 0.00020417033251742046, "loss": 4.5522, "mean_token_accuracy": 0.24821835160255432, "num_tokens": 134876499.0, "step": 77760 }, { "entropy": 5.3706114292144775, "epoch": 6.050340400700253, "grad_norm": 1.34375, "learning_rate": 0.0002041440265687919, "loss": 4.6251, "mean_token_accuracy": 0.24118445813655853, "num_tokens": 134885215.0, "step": 77765 }, { "entropy": 5.315656518936157, "epoch": 6.0507294300719705, "grad_norm": 1.3203125, "learning_rate": 0.00020411772169528987, "loss": 4.5089, "mean_token_accuracy": 0.2516279101371765, "num_tokens": 134893834.0, "step": 77770 }, { "entropy": 5.456667947769165, "epoch": 6.051118459443688, "grad_norm": 1.25, "learning_rate": 0.00020409141789731362, "loss": 4.7455, "mean_token_accuracy": 0.2319573163986206, "num_tokens": 134902376.0, "step": 77775 }, { "entropy": 5.3662622451782225, "epoch": 6.051507488815406, "grad_norm": 1.28125, "learning_rate": 0.00020406511517526228, "loss": 4.6237, "mean_token_accuracy": 0.24100393205881118, "num_tokens": 134911066.0, "step": 77780 }, { "entropy": 5.418172073364258, "epoch": 6.051896518187123, "grad_norm": 1.296875, "learning_rate": 0.00020403881352953486, "loss": 4.721, "mean_token_accuracy": 0.2305980369448662, "num_tokens": 134919259.0, "step": 77785 }, { "entropy": 5.367647409439087, "epoch": 6.05228554755884, "grad_norm": 1.2734375, "learning_rate": 0.00020401251296053047, "loss": 4.6212, "mean_token_accuracy": 0.23806293904781342, "num_tokens": 134928052.0, "step": 77790 }, { "entropy": 5.492748212814331, "epoch": 6.052674576930558, "grad_norm": 1.28125, "learning_rate": 0.00020398621346864827, "loss": 4.8058, "mean_token_accuracy": 0.22472223043441772, "num_tokens": 134936570.0, "step": 77795 }, { "entropy": 5.425838851928711, "epoch": 6.053063606302276, "grad_norm": 1.3984375, "learning_rate": 0.00020395991505428723, "loss": 4.6482, "mean_token_accuracy": 0.2324936121702194, "num_tokens": 134945376.0, "step": 77800 }, { "entropy": 5.508853197097778, "epoch": 6.0534526356739935, "grad_norm": 1.296875, "learning_rate": 0.00020393361771784647, "loss": 4.7286, "mean_token_accuracy": 0.22682449519634246, "num_tokens": 134954748.0, "step": 77805 }, { "entropy": 5.410128593444824, "epoch": 6.053841665045711, "grad_norm": 1.2890625, "learning_rate": 0.0002039073214597249, "loss": 4.6579, "mean_token_accuracy": 0.23687517493963242, "num_tokens": 134963039.0, "step": 77810 }, { "entropy": 5.364406728744507, "epoch": 6.054230694417429, "grad_norm": 1.3125, "learning_rate": 0.00020388102628032156, "loss": 4.6177, "mean_token_accuracy": 0.23688792437314987, "num_tokens": 134971721.0, "step": 77815 }, { "entropy": 5.437514066696167, "epoch": 6.054619723789146, "grad_norm": 1.2890625, "learning_rate": 0.00020385473218003546, "loss": 4.7142, "mean_token_accuracy": 0.2358041912317276, "num_tokens": 134980287.0, "step": 77820 }, { "entropy": 5.332333183288574, "epoch": 6.055008753160863, "grad_norm": 1.3828125, "learning_rate": 0.00020382843915926557, "loss": 4.5685, "mean_token_accuracy": 0.2465401753783226, "num_tokens": 134989128.0, "step": 77825 }, { "entropy": 5.363819408416748, "epoch": 6.055397782532581, "grad_norm": 1.28125, "learning_rate": 0.00020380214721841083, "loss": 4.6604, "mean_token_accuracy": 0.2352599561214447, "num_tokens": 134998182.0, "step": 77830 }, { "entropy": 5.411900424957276, "epoch": 6.055786811904299, "grad_norm": 1.234375, "learning_rate": 0.00020377585635787015, "loss": 4.7158, "mean_token_accuracy": 0.24174374341964722, "num_tokens": 135007581.0, "step": 77835 }, { "entropy": 5.443863439559936, "epoch": 6.0561758412760165, "grad_norm": 1.265625, "learning_rate": 0.00020374956657804254, "loss": 4.6952, "mean_token_accuracy": 0.23185891211032866, "num_tokens": 135016207.0, "step": 77840 }, { "entropy": 5.383582067489624, "epoch": 6.056564870647734, "grad_norm": 1.28125, "learning_rate": 0.0002037232778793268, "loss": 4.555, "mean_token_accuracy": 0.24811094105243683, "num_tokens": 135024516.0, "step": 77845 }, { "entropy": 5.4438573837280275, "epoch": 6.056953900019452, "grad_norm": 1.3515625, "learning_rate": 0.0002036969902621219, "loss": 4.7496, "mean_token_accuracy": 0.23171769976615905, "num_tokens": 135032653.0, "step": 77850 }, { "entropy": 5.426685523986817, "epoch": 6.057342929391169, "grad_norm": 1.3984375, "learning_rate": 0.0002036707037268266, "loss": 4.6668, "mean_token_accuracy": 0.2369655728340149, "num_tokens": 135041341.0, "step": 77855 }, { "entropy": 5.390874719619751, "epoch": 6.057731958762886, "grad_norm": 1.3046875, "learning_rate": 0.00020364441827383994, "loss": 4.6252, "mean_token_accuracy": 0.25102262794971464, "num_tokens": 135049297.0, "step": 77860 }, { "entropy": 5.300956153869629, "epoch": 6.058120988134604, "grad_norm": 1.2890625, "learning_rate": 0.00020361813390356066, "loss": 4.5314, "mean_token_accuracy": 0.24673874527215958, "num_tokens": 135057919.0, "step": 77865 }, { "entropy": 5.386100149154663, "epoch": 6.058510017506322, "grad_norm": 1.3984375, "learning_rate": 0.00020359185061638753, "loss": 4.6181, "mean_token_accuracy": 0.24043917506933213, "num_tokens": 135066452.0, "step": 77870 }, { "entropy": 5.473205661773681, "epoch": 6.0588990468780395, "grad_norm": 1.40625, "learning_rate": 0.0002035655684127194, "loss": 4.7348, "mean_token_accuracy": 0.2284441828727722, "num_tokens": 135074558.0, "step": 77875 }, { "entropy": 5.2776771068573, "epoch": 6.059288076249757, "grad_norm": 1.25, "learning_rate": 0.0002035392872929551, "loss": 4.5298, "mean_token_accuracy": 0.24325364977121353, "num_tokens": 135083118.0, "step": 77880 }, { "entropy": 5.399184608459473, "epoch": 6.059677105621474, "grad_norm": 1.234375, "learning_rate": 0.00020351300725749338, "loss": 4.6052, "mean_token_accuracy": 0.23999981135129927, "num_tokens": 135091832.0, "step": 77885 }, { "entropy": 5.443254613876343, "epoch": 6.060066134993192, "grad_norm": 1.2890625, "learning_rate": 0.000203486728306733, "loss": 4.7572, "mean_token_accuracy": 0.23332567363977433, "num_tokens": 135100025.0, "step": 77890 }, { "entropy": 5.333177757263184, "epoch": 6.060455164364909, "grad_norm": 1.265625, "learning_rate": 0.00020346045044107269, "loss": 4.5889, "mean_token_accuracy": 0.2422758847475052, "num_tokens": 135108414.0, "step": 77895 }, { "entropy": 5.355976200103759, "epoch": 6.060844193736627, "grad_norm": 1.296875, "learning_rate": 0.0002034341736609112, "loss": 4.5853, "mean_token_accuracy": 0.24422654062509536, "num_tokens": 135117409.0, "step": 77900 }, { "entropy": 5.353270673751831, "epoch": 6.061233223108345, "grad_norm": 1.2734375, "learning_rate": 0.00020340789796664715, "loss": 4.6139, "mean_token_accuracy": 0.24613844454288483, "num_tokens": 135125757.0, "step": 77905 }, { "entropy": 5.344522857666016, "epoch": 6.0616222524800625, "grad_norm": 1.25, "learning_rate": 0.00020338162335867938, "loss": 4.6505, "mean_token_accuracy": 0.23396904468536378, "num_tokens": 135134334.0, "step": 77910 }, { "entropy": 5.452578067779541, "epoch": 6.06201128185178, "grad_norm": 1.2265625, "learning_rate": 0.00020335534983740645, "loss": 4.6934, "mean_token_accuracy": 0.23344435542821884, "num_tokens": 135142992.0, "step": 77915 }, { "entropy": 5.332722949981689, "epoch": 6.062400311223497, "grad_norm": 1.2578125, "learning_rate": 0.00020332907740322693, "loss": 4.5864, "mean_token_accuracy": 0.24226741194725038, "num_tokens": 135151401.0, "step": 77920 }, { "entropy": 5.470785665512085, "epoch": 6.062789340595215, "grad_norm": 1.2578125, "learning_rate": 0.00020330280605653967, "loss": 4.7259, "mean_token_accuracy": 0.2371002107858658, "num_tokens": 135160120.0, "step": 77925 }, { "entropy": 5.431211996078491, "epoch": 6.063178369966932, "grad_norm": 1.4140625, "learning_rate": 0.00020327653579774331, "loss": 4.6778, "mean_token_accuracy": 0.23626890927553176, "num_tokens": 135169012.0, "step": 77930 }, { "entropy": 5.336164236068726, "epoch": 6.06356739933865, "grad_norm": 1.234375, "learning_rate": 0.00020325026662723622, "loss": 4.57, "mean_token_accuracy": 0.2500456467270851, "num_tokens": 135178001.0, "step": 77935 }, { "entropy": 5.380569219589233, "epoch": 6.063956428710368, "grad_norm": 1.28125, "learning_rate": 0.00020322399854541724, "loss": 4.6569, "mean_token_accuracy": 0.2396145209670067, "num_tokens": 135186881.0, "step": 77940 }, { "entropy": 5.32777156829834, "epoch": 6.0643454580820855, "grad_norm": 1.3359375, "learning_rate": 0.0002031977315526848, "loss": 4.54, "mean_token_accuracy": 0.24685431271791458, "num_tokens": 135195591.0, "step": 77945 }, { "entropy": 5.4235669612884525, "epoch": 6.064734487453803, "grad_norm": 1.2734375, "learning_rate": 0.00020317146564943745, "loss": 4.6907, "mean_token_accuracy": 0.23657889515161515, "num_tokens": 135204327.0, "step": 77950 }, { "entropy": 5.338595771789551, "epoch": 6.06512351682552, "grad_norm": 1.3203125, "learning_rate": 0.0002031452008360738, "loss": 4.5892, "mean_token_accuracy": 0.2426821455359459, "num_tokens": 135213233.0, "step": 77955 }, { "entropy": 5.340740156173706, "epoch": 6.065512546197238, "grad_norm": 1.3125, "learning_rate": 0.0002031189371129924, "loss": 4.6201, "mean_token_accuracy": 0.24165795147418975, "num_tokens": 135221977.0, "step": 77960 }, { "entropy": 5.301126003265381, "epoch": 6.065901575568955, "grad_norm": 1.234375, "learning_rate": 0.0002030926744805917, "loss": 4.5509, "mean_token_accuracy": 0.24297299981117249, "num_tokens": 135231234.0, "step": 77965 }, { "entropy": 5.3734029769897464, "epoch": 6.066290604940673, "grad_norm": 1.265625, "learning_rate": 0.0002030664129392702, "loss": 4.6207, "mean_token_accuracy": 0.2408313736319542, "num_tokens": 135240110.0, "step": 77970 }, { "entropy": 5.45770902633667, "epoch": 6.066679634312391, "grad_norm": 1.2890625, "learning_rate": 0.00020304015248942642, "loss": 4.6509, "mean_token_accuracy": 0.24261791557073592, "num_tokens": 135248280.0, "step": 77975 }, { "entropy": 5.353919982910156, "epoch": 6.0670686636841085, "grad_norm": 1.3125, "learning_rate": 0.00020301389313145886, "loss": 4.6067, "mean_token_accuracy": 0.23615747392177583, "num_tokens": 135256842.0, "step": 77980 }, { "entropy": 5.4359081268310545, "epoch": 6.067457693055825, "grad_norm": 1.3828125, "learning_rate": 0.00020298763486576566, "loss": 4.6891, "mean_token_accuracy": 0.23562852293252945, "num_tokens": 135265088.0, "step": 77985 }, { "entropy": 5.4074122428894045, "epoch": 6.067846722427543, "grad_norm": 1.25, "learning_rate": 0.00020296137769274563, "loss": 4.664, "mean_token_accuracy": 0.24390268325805664, "num_tokens": 135273544.0, "step": 77990 }, { "entropy": 5.3657269954681395, "epoch": 6.068235751799261, "grad_norm": 1.3515625, "learning_rate": 0.00020293512161279704, "loss": 4.6597, "mean_token_accuracy": 0.2351357415318489, "num_tokens": 135282059.0, "step": 77995 }, { "entropy": 5.4972363948822025, "epoch": 6.068624781170978, "grad_norm": 1.4375, "learning_rate": 0.00020290886662631825, "loss": 4.7335, "mean_token_accuracy": 0.23032846450805664, "num_tokens": 135290112.0, "step": 78000 }, { "epoch": 6.068624781170978, "eval_entropy": 5.146211392978158, "eval_loss": 4.877217769622803, "eval_mean_token_accuracy": 0.23330182733876528, "eval_num_tokens": 135290112.0, "eval_runtime": 28.9243, "eval_samples_per_second": 1436.786, "eval_steps_per_second": 179.607, "step": 78000 }, { "entropy": 5.4060132026672365, "epoch": 6.069013810542696, "grad_norm": 1.25, "learning_rate": 0.00020288261273370767, "loss": 4.6182, "mean_token_accuracy": 0.2393279105424881, "num_tokens": 135298314.0, "step": 78005 }, { "entropy": 5.308161449432373, "epoch": 6.069402839914414, "grad_norm": 1.359375, "learning_rate": 0.00020285635993536372, "loss": 4.5937, "mean_token_accuracy": 0.24137768000364304, "num_tokens": 135306557.0, "step": 78010 }, { "entropy": 5.325861072540283, "epoch": 6.0697918692861315, "grad_norm": 1.3359375, "learning_rate": 0.00020283010823168464, "loss": 4.6518, "mean_token_accuracy": 0.23814892321825026, "num_tokens": 135315100.0, "step": 78015 }, { "entropy": 5.42292857170105, "epoch": 6.070180898657848, "grad_norm": 1.3359375, "learning_rate": 0.00020280385762306874, "loss": 4.622, "mean_token_accuracy": 0.2399055615067482, "num_tokens": 135323426.0, "step": 78020 }, { "entropy": 5.332621717453003, "epoch": 6.070569928029566, "grad_norm": 1.328125, "learning_rate": 0.00020277760810991446, "loss": 4.5428, "mean_token_accuracy": 0.25161524713039396, "num_tokens": 135331706.0, "step": 78025 }, { "entropy": 5.416768360137939, "epoch": 6.070958957401284, "grad_norm": 1.2890625, "learning_rate": 0.00020275135969262, "loss": 4.6018, "mean_token_accuracy": 0.23867940455675124, "num_tokens": 135340552.0, "step": 78030 }, { "entropy": 5.38787727355957, "epoch": 6.071347986773001, "grad_norm": 1.3125, "learning_rate": 0.00020272511237158364, "loss": 4.6064, "mean_token_accuracy": 0.23204150348901748, "num_tokens": 135349100.0, "step": 78035 }, { "entropy": 5.358548974990844, "epoch": 6.071737016144719, "grad_norm": 1.3828125, "learning_rate": 0.00020269886614720367, "loss": 4.6085, "mean_token_accuracy": 0.24614261388778685, "num_tokens": 135357447.0, "step": 78040 }, { "entropy": 5.379813718795776, "epoch": 6.072126045516437, "grad_norm": 1.25, "learning_rate": 0.00020267262101987833, "loss": 4.6054, "mean_token_accuracy": 0.242340749502182, "num_tokens": 135366132.0, "step": 78045 }, { "entropy": 5.35446949005127, "epoch": 6.0725150748881545, "grad_norm": 1.390625, "learning_rate": 0.00020264637699000587, "loss": 4.5612, "mean_token_accuracy": 0.2479987159371376, "num_tokens": 135374436.0, "step": 78050 }, { "entropy": 5.370483303070069, "epoch": 6.072904104259871, "grad_norm": 1.2890625, "learning_rate": 0.0002026201340579844, "loss": 4.559, "mean_token_accuracy": 0.244822359085083, "num_tokens": 135382951.0, "step": 78055 }, { "entropy": 5.452025461196899, "epoch": 6.073293133631589, "grad_norm": 1.3203125, "learning_rate": 0.00020259389222421225, "loss": 4.7917, "mean_token_accuracy": 0.22936633080244065, "num_tokens": 135392549.0, "step": 78060 }, { "entropy": 5.342155456542969, "epoch": 6.073682163003307, "grad_norm": 1.2578125, "learning_rate": 0.00020256765148908752, "loss": 4.5841, "mean_token_accuracy": 0.2426443174481392, "num_tokens": 135400548.0, "step": 78065 }, { "entropy": 5.391656303405762, "epoch": 6.074071192375024, "grad_norm": 1.2890625, "learning_rate": 0.0002025414118530084, "loss": 4.5835, "mean_token_accuracy": 0.24599498957395555, "num_tokens": 135409501.0, "step": 78070 }, { "entropy": 5.393645572662353, "epoch": 6.074460221746742, "grad_norm": 1.3828125, "learning_rate": 0.00020251517331637303, "loss": 4.6538, "mean_token_accuracy": 0.2417784109711647, "num_tokens": 135417753.0, "step": 78075 }, { "entropy": 5.3836315155029295, "epoch": 6.07484925111846, "grad_norm": 1.296875, "learning_rate": 0.00020248893587957955, "loss": 4.6482, "mean_token_accuracy": 0.24358249753713607, "num_tokens": 135426485.0, "step": 78080 }, { "entropy": 5.373294544219971, "epoch": 6.0752382804901774, "grad_norm": 1.3359375, "learning_rate": 0.00020246269954302603, "loss": 4.614, "mean_token_accuracy": 0.24455467760562896, "num_tokens": 135435292.0, "step": 78085 }, { "entropy": 5.324078798294067, "epoch": 6.075627309861894, "grad_norm": 1.1875, "learning_rate": 0.00020243646430711065, "loss": 4.5683, "mean_token_accuracy": 0.25234498232603075, "num_tokens": 135443990.0, "step": 78090 }, { "entropy": 5.343260288238525, "epoch": 6.076016339233612, "grad_norm": 1.234375, "learning_rate": 0.00020241023017223138, "loss": 4.6236, "mean_token_accuracy": 0.24609242081642152, "num_tokens": 135452798.0, "step": 78095 }, { "entropy": 5.383029747009277, "epoch": 6.07640536860533, "grad_norm": 1.234375, "learning_rate": 0.00020238399713878635, "loss": 4.6219, "mean_token_accuracy": 0.23520573377609252, "num_tokens": 135461158.0, "step": 78100 }, { "entropy": 5.419666481018067, "epoch": 6.076794397977047, "grad_norm": 1.4140625, "learning_rate": 0.00020235776520717352, "loss": 4.6741, "mean_token_accuracy": 0.23241727203130721, "num_tokens": 135469890.0, "step": 78105 }, { "entropy": 5.446431970596313, "epoch": 6.077183427348765, "grad_norm": 1.3515625, "learning_rate": 0.000202331534377791, "loss": 4.7075, "mean_token_accuracy": 0.23330069184303284, "num_tokens": 135478042.0, "step": 78110 }, { "entropy": 5.404907655715943, "epoch": 6.077572456720483, "grad_norm": 1.296875, "learning_rate": 0.00020230530465103686, "loss": 4.6755, "mean_token_accuracy": 0.23925051242113113, "num_tokens": 135486595.0, "step": 78115 }, { "entropy": 5.329097652435303, "epoch": 6.0779614860921996, "grad_norm": 1.28125, "learning_rate": 0.00020227907602730888, "loss": 4.5735, "mean_token_accuracy": 0.24599978178739548, "num_tokens": 135495093.0, "step": 78120 }, { "entropy": 5.334168291091919, "epoch": 6.078350515463917, "grad_norm": 1.2421875, "learning_rate": 0.00020225284850700526, "loss": 4.5984, "mean_token_accuracy": 0.24583181291818618, "num_tokens": 135503917.0, "step": 78125 }, { "entropy": 5.393647193908691, "epoch": 6.078739544835635, "grad_norm": 1.2890625, "learning_rate": 0.00020222662209052388, "loss": 4.6158, "mean_token_accuracy": 0.23712670356035231, "num_tokens": 135512430.0, "step": 78130 }, { "entropy": 5.4796082973480225, "epoch": 6.079128574207353, "grad_norm": 1.25, "learning_rate": 0.00020220039677826263, "loss": 4.7248, "mean_token_accuracy": 0.2333470866084099, "num_tokens": 135521116.0, "step": 78135 }, { "entropy": 5.403421640396118, "epoch": 6.07951760357907, "grad_norm": 1.296875, "learning_rate": 0.00020217417257061953, "loss": 4.5055, "mean_token_accuracy": 0.25195791125297545, "num_tokens": 135529044.0, "step": 78140 }, { "entropy": 5.373752117156982, "epoch": 6.079906632950788, "grad_norm": 1.328125, "learning_rate": 0.00020214794946799247, "loss": 4.7334, "mean_token_accuracy": 0.22973351925611496, "num_tokens": 135537172.0, "step": 78145 }, { "entropy": 5.4183669090271, "epoch": 6.080295662322506, "grad_norm": 1.296875, "learning_rate": 0.0002021217274707793, "loss": 4.6809, "mean_token_accuracy": 0.23833460062742234, "num_tokens": 135545613.0, "step": 78150 }, { "entropy": 5.4724328994750975, "epoch": 6.0806846916942225, "grad_norm": 1.3671875, "learning_rate": 0.00020209550657937787, "loss": 4.7936, "mean_token_accuracy": 0.23817306011915207, "num_tokens": 135554418.0, "step": 78155 }, { "entropy": 5.439923095703125, "epoch": 6.08107372106594, "grad_norm": 1.2734375, "learning_rate": 0.00020206928679418612, "loss": 4.6746, "mean_token_accuracy": 0.2423946738243103, "num_tokens": 135563667.0, "step": 78160 }, { "entropy": 5.332416439056397, "epoch": 6.081462750437658, "grad_norm": 1.2578125, "learning_rate": 0.00020204306811560187, "loss": 4.53, "mean_token_accuracy": 0.24317148476839065, "num_tokens": 135572156.0, "step": 78165 }, { "entropy": 5.347363996505737, "epoch": 6.081851779809376, "grad_norm": 1.375, "learning_rate": 0.00020201685054402303, "loss": 4.5526, "mean_token_accuracy": 0.2427965745329857, "num_tokens": 135580397.0, "step": 78170 }, { "entropy": 5.32891812324524, "epoch": 6.082240809181093, "grad_norm": 1.3125, "learning_rate": 0.0002019906340798472, "loss": 4.6706, "mean_token_accuracy": 0.24101684838533402, "num_tokens": 135588649.0, "step": 78175 }, { "entropy": 5.333479738235473, "epoch": 6.082629838552811, "grad_norm": 1.34375, "learning_rate": 0.00020196441872347232, "loss": 4.6121, "mean_token_accuracy": 0.23681754767894744, "num_tokens": 135597548.0, "step": 78180 }, { "entropy": 5.350278234481811, "epoch": 6.083018867924529, "grad_norm": 1.3515625, "learning_rate": 0.00020193820447529605, "loss": 4.5703, "mean_token_accuracy": 0.25180537402629855, "num_tokens": 135606121.0, "step": 78185 }, { "entropy": 5.509008741378784, "epoch": 6.0834078972962455, "grad_norm": 1.484375, "learning_rate": 0.0002019119913357163, "loss": 4.7829, "mean_token_accuracy": 0.23049566596746446, "num_tokens": 135615092.0, "step": 78190 }, { "entropy": 5.409129476547241, "epoch": 6.083796926667963, "grad_norm": 1.3203125, "learning_rate": 0.00020188577930513074, "loss": 4.6077, "mean_token_accuracy": 0.23699478209018707, "num_tokens": 135622916.0, "step": 78195 }, { "entropy": 5.338917636871338, "epoch": 6.084185956039681, "grad_norm": 1.234375, "learning_rate": 0.0002018595683839372, "loss": 4.6751, "mean_token_accuracy": 0.24006969928741456, "num_tokens": 135631816.0, "step": 78200 }, { "entropy": 5.417550563812256, "epoch": 6.084574985411399, "grad_norm": 1.265625, "learning_rate": 0.00020183335857253327, "loss": 4.6291, "mean_token_accuracy": 0.23627813011407853, "num_tokens": 135640501.0, "step": 78205 }, { "entropy": 5.419645833969116, "epoch": 6.084964014783116, "grad_norm": 1.296875, "learning_rate": 0.00020180714987131658, "loss": 4.6692, "mean_token_accuracy": 0.23422762900590896, "num_tokens": 135649978.0, "step": 78210 }, { "entropy": 5.361103916168213, "epoch": 6.085353044154834, "grad_norm": 1.3125, "learning_rate": 0.000201780942280685, "loss": 4.6258, "mean_token_accuracy": 0.2394057795405388, "num_tokens": 135658552.0, "step": 78215 }, { "entropy": 5.359128618240357, "epoch": 6.085742073526551, "grad_norm": 1.3046875, "learning_rate": 0.000201754735801036, "loss": 4.7068, "mean_token_accuracy": 0.2343481585383415, "num_tokens": 135667756.0, "step": 78220 }, { "entropy": 5.3251978874206545, "epoch": 6.0861311028982685, "grad_norm": 1.3828125, "learning_rate": 0.00020172853043276735, "loss": 4.5869, "mean_token_accuracy": 0.24228523671627045, "num_tokens": 135675763.0, "step": 78225 }, { "entropy": 5.321824169158935, "epoch": 6.086520132269986, "grad_norm": 1.265625, "learning_rate": 0.0002017023261762766, "loss": 4.583, "mean_token_accuracy": 0.24340703189373017, "num_tokens": 135684211.0, "step": 78230 }, { "entropy": 5.409508895874024, "epoch": 6.086909161641704, "grad_norm": 1.234375, "learning_rate": 0.0002016761230319613, "loss": 4.7598, "mean_token_accuracy": 0.23273080587387085, "num_tokens": 135692792.0, "step": 78235 }, { "entropy": 5.500107336044311, "epoch": 6.087298191013422, "grad_norm": 1.296875, "learning_rate": 0.00020164992100021924, "loss": 4.7555, "mean_token_accuracy": 0.22770076990127563, "num_tokens": 135701178.0, "step": 78240 }, { "entropy": 5.414925289154053, "epoch": 6.087687220385139, "grad_norm": 1.265625, "learning_rate": 0.00020162372008144792, "loss": 4.6757, "mean_token_accuracy": 0.23936578780412673, "num_tokens": 135710453.0, "step": 78245 }, { "entropy": 5.448999547958374, "epoch": 6.088076249756857, "grad_norm": 1.4609375, "learning_rate": 0.00020159752027604477, "loss": 4.6837, "mean_token_accuracy": 0.23721446543931962, "num_tokens": 135718996.0, "step": 78250 }, { "entropy": 5.288850879669189, "epoch": 6.088465279128574, "grad_norm": 1.2578125, "learning_rate": 0.00020157132158440732, "loss": 4.4845, "mean_token_accuracy": 0.25437273383140563, "num_tokens": 135727587.0, "step": 78255 }, { "entropy": 5.454306983947754, "epoch": 6.0888543085002915, "grad_norm": 1.296875, "learning_rate": 0.00020154512400693338, "loss": 4.8231, "mean_token_accuracy": 0.22893631011247634, "num_tokens": 135737228.0, "step": 78260 }, { "entropy": 5.345508670806884, "epoch": 6.089243337872009, "grad_norm": 1.3046875, "learning_rate": 0.0002015189275440202, "loss": 4.5916, "mean_token_accuracy": 0.24814069271087646, "num_tokens": 135745753.0, "step": 78265 }, { "entropy": 5.430965375900269, "epoch": 6.089632367243727, "grad_norm": 1.3515625, "learning_rate": 0.00020149273219606528, "loss": 4.5841, "mean_token_accuracy": 0.24944130033254625, "num_tokens": 135753930.0, "step": 78270 }, { "entropy": 5.4203132629394535, "epoch": 6.090021396615445, "grad_norm": 1.359375, "learning_rate": 0.0002014665379634662, "loss": 4.7058, "mean_token_accuracy": 0.233579421043396, "num_tokens": 135762762.0, "step": 78275 }, { "entropy": 5.342609834671021, "epoch": 6.090410425987162, "grad_norm": 1.2578125, "learning_rate": 0.00020144034484662044, "loss": 4.6148, "mean_token_accuracy": 0.24460069239139556, "num_tokens": 135770887.0, "step": 78280 }, { "entropy": 5.386258125305176, "epoch": 6.09079945535888, "grad_norm": 1.3046875, "learning_rate": 0.00020141415284592528, "loss": 4.6376, "mean_token_accuracy": 0.23933984190225602, "num_tokens": 135779545.0, "step": 78285 }, { "entropy": 5.336141872406006, "epoch": 6.091188484730597, "grad_norm": 1.25, "learning_rate": 0.00020138796196177827, "loss": 4.5384, "mean_token_accuracy": 0.2491322413086891, "num_tokens": 135787886.0, "step": 78290 }, { "entropy": 5.364180088043213, "epoch": 6.0915775141023145, "grad_norm": 1.3515625, "learning_rate": 0.00020136177219457675, "loss": 4.5716, "mean_token_accuracy": 0.249770849943161, "num_tokens": 135796883.0, "step": 78295 }, { "entropy": 5.392657136917114, "epoch": 6.091966543474032, "grad_norm": 1.2734375, "learning_rate": 0.0002013355835447181, "loss": 4.6926, "mean_token_accuracy": 0.22681605964899063, "num_tokens": 135805347.0, "step": 78300 }, { "entropy": 5.4189722537994385, "epoch": 6.09235557284575, "grad_norm": 1.3203125, "learning_rate": 0.00020130939601259974, "loss": 4.7437, "mean_token_accuracy": 0.2345716953277588, "num_tokens": 135813791.0, "step": 78305 }, { "entropy": 5.46801061630249, "epoch": 6.092744602217468, "grad_norm": 1.3125, "learning_rate": 0.00020128320959861902, "loss": 4.6749, "mean_token_accuracy": 0.23406531512737275, "num_tokens": 135822523.0, "step": 78310 }, { "entropy": 5.367745494842529, "epoch": 6.093133631589185, "grad_norm": 1.203125, "learning_rate": 0.00020125702430317323, "loss": 4.5641, "mean_token_accuracy": 0.24882566183805466, "num_tokens": 135831155.0, "step": 78315 }, { "entropy": 5.415117597579956, "epoch": 6.093522660960902, "grad_norm": 1.53125, "learning_rate": 0.0002012308401266597, "loss": 4.6171, "mean_token_accuracy": 0.2403356358408928, "num_tokens": 135838928.0, "step": 78320 }, { "entropy": 5.3508056640625, "epoch": 6.09391169033262, "grad_norm": 1.3125, "learning_rate": 0.00020120465706947584, "loss": 4.6363, "mean_token_accuracy": 0.2362497106194496, "num_tokens": 135847774.0, "step": 78325 }, { "entropy": 5.26229681968689, "epoch": 6.0943007197043375, "grad_norm": 1.25, "learning_rate": 0.00020117847513201876, "loss": 4.4997, "mean_token_accuracy": 0.2513694614171982, "num_tokens": 135856279.0, "step": 78330 }, { "entropy": 5.2496318340301515, "epoch": 6.094689749076055, "grad_norm": 1.2890625, "learning_rate": 0.0002011522943146859, "loss": 4.475, "mean_token_accuracy": 0.25967146903276445, "num_tokens": 135864989.0, "step": 78335 }, { "entropy": 5.346390581130981, "epoch": 6.095078778447773, "grad_norm": 1.359375, "learning_rate": 0.0002011261146178744, "loss": 4.6781, "mean_token_accuracy": 0.23574930876493455, "num_tokens": 135873621.0, "step": 78340 }, { "entropy": 5.435528945922852, "epoch": 6.095467807819491, "grad_norm": 1.34375, "learning_rate": 0.00020109993604198152, "loss": 4.6918, "mean_token_accuracy": 0.2408699259161949, "num_tokens": 135881648.0, "step": 78345 }, { "entropy": 5.4342247486114506, "epoch": 6.095856837191208, "grad_norm": 1.2578125, "learning_rate": 0.0002010737585874045, "loss": 4.6707, "mean_token_accuracy": 0.2374473676085472, "num_tokens": 135890291.0, "step": 78350 }, { "entropy": 5.405874490737915, "epoch": 6.096245866562925, "grad_norm": 1.3203125, "learning_rate": 0.0002010475822545405, "loss": 4.5995, "mean_token_accuracy": 0.24467612504959108, "num_tokens": 135898546.0, "step": 78355 }, { "entropy": 5.427912473678589, "epoch": 6.096634895934643, "grad_norm": 1.2421875, "learning_rate": 0.0002010214070437868, "loss": 4.7628, "mean_token_accuracy": 0.22852298021316528, "num_tokens": 135907836.0, "step": 78360 }, { "entropy": 5.451780509948731, "epoch": 6.0970239253063605, "grad_norm": 1.2734375, "learning_rate": 0.00020099523295554045, "loss": 4.6572, "mean_token_accuracy": 0.24187387377023697, "num_tokens": 135916268.0, "step": 78365 }, { "entropy": 5.437407350540161, "epoch": 6.097412954678078, "grad_norm": 1.2109375, "learning_rate": 0.00020096905999019871, "loss": 4.6954, "mean_token_accuracy": 0.24311623275279998, "num_tokens": 135924637.0, "step": 78370 }, { "entropy": 5.416843032836914, "epoch": 6.097801984049796, "grad_norm": 1.28125, "learning_rate": 0.00020094288814815858, "loss": 4.7034, "mean_token_accuracy": 0.2385851949453354, "num_tokens": 135934109.0, "step": 78375 }, { "entropy": 5.410534143447876, "epoch": 6.098191013421514, "grad_norm": 1.265625, "learning_rate": 0.00020091671742981725, "loss": 4.6272, "mean_token_accuracy": 0.2447964444756508, "num_tokens": 135942630.0, "step": 78380 }, { "entropy": 5.439756202697754, "epoch": 6.098580042793231, "grad_norm": 1.2421875, "learning_rate": 0.00020089054783557176, "loss": 4.6184, "mean_token_accuracy": 0.2420434072613716, "num_tokens": 135950857.0, "step": 78385 }, { "entropy": 5.383828401565552, "epoch": 6.098969072164948, "grad_norm": 1.28125, "learning_rate": 0.00020086437936581936, "loss": 4.6651, "mean_token_accuracy": 0.2389864668250084, "num_tokens": 135958991.0, "step": 78390 }, { "entropy": 5.403201246261597, "epoch": 6.099358101536666, "grad_norm": 1.296875, "learning_rate": 0.00020083821202095697, "loss": 4.6034, "mean_token_accuracy": 0.2437028169631958, "num_tokens": 135966793.0, "step": 78395 }, { "entropy": 5.380572986602783, "epoch": 6.0997471309083835, "grad_norm": 1.34375, "learning_rate": 0.00020081204580138162, "loss": 4.6182, "mean_token_accuracy": 0.23512735813856125, "num_tokens": 135975878.0, "step": 78400 }, { "entropy": 5.318931150436401, "epoch": 6.100136160280101, "grad_norm": 1.2734375, "learning_rate": 0.00020078588070749048, "loss": 4.5191, "mean_token_accuracy": 0.2505130484700203, "num_tokens": 135984107.0, "step": 78405 }, { "entropy": 5.388053894042969, "epoch": 6.100525189651819, "grad_norm": 1.328125, "learning_rate": 0.00020075971673968042, "loss": 4.7015, "mean_token_accuracy": 0.2288355365395546, "num_tokens": 135992724.0, "step": 78410 }, { "entropy": 5.368625926971435, "epoch": 6.100914219023537, "grad_norm": 1.296875, "learning_rate": 0.00020073355389834852, "loss": 4.6744, "mean_token_accuracy": 0.23834931403398513, "num_tokens": 136001712.0, "step": 78415 }, { "entropy": 5.413221836090088, "epoch": 6.101303248395254, "grad_norm": 1.2734375, "learning_rate": 0.00020070739218389173, "loss": 4.6484, "mean_token_accuracy": 0.24068213552236556, "num_tokens": 136010756.0, "step": 78420 }, { "entropy": 5.41457314491272, "epoch": 6.101692277766971, "grad_norm": 1.3359375, "learning_rate": 0.00020068123159670698, "loss": 4.6137, "mean_token_accuracy": 0.24685857594013214, "num_tokens": 136019150.0, "step": 78425 }, { "entropy": 5.4194879055023195, "epoch": 6.102081307138689, "grad_norm": 1.3046875, "learning_rate": 0.00020065507213719132, "loss": 4.6654, "mean_token_accuracy": 0.2342357352375984, "num_tokens": 136028889.0, "step": 78430 }, { "entropy": 5.476228857040406, "epoch": 6.1024703365104065, "grad_norm": 1.3125, "learning_rate": 0.00020062891380574156, "loss": 4.6804, "mean_token_accuracy": 0.2393524870276451, "num_tokens": 136037833.0, "step": 78435 }, { "entropy": 5.401272964477539, "epoch": 6.102859365882124, "grad_norm": 1.2578125, "learning_rate": 0.00020060275660275468, "loss": 4.6526, "mean_token_accuracy": 0.2363521307706833, "num_tokens": 136046479.0, "step": 78440 }, { "entropy": 5.368519830703735, "epoch": 6.103248395253842, "grad_norm": 1.359375, "learning_rate": 0.00020057660052862753, "loss": 4.6704, "mean_token_accuracy": 0.2414141997694969, "num_tokens": 136054985.0, "step": 78445 }, { "entropy": 5.393288660049438, "epoch": 6.10363742462556, "grad_norm": 1.3046875, "learning_rate": 0.00020055044558375695, "loss": 4.6369, "mean_token_accuracy": 0.2390091061592102, "num_tokens": 136063539.0, "step": 78450 }, { "entropy": 5.4311028003692625, "epoch": 6.104026453997276, "grad_norm": 1.25, "learning_rate": 0.00020052429176853993, "loss": 4.6273, "mean_token_accuracy": 0.24230020642280578, "num_tokens": 136072476.0, "step": 78455 }, { "entropy": 5.383445119857788, "epoch": 6.104415483368994, "grad_norm": 1.125, "learning_rate": 0.00020049813908337323, "loss": 4.6434, "mean_token_accuracy": 0.2392372101545334, "num_tokens": 136081153.0, "step": 78460 }, { "entropy": 5.445254468917847, "epoch": 6.104804512740712, "grad_norm": 1.3984375, "learning_rate": 0.0002004719875286537, "loss": 4.69, "mean_token_accuracy": 0.23070433139801025, "num_tokens": 136089875.0, "step": 78465 }, { "entropy": 5.440861797332763, "epoch": 6.1051935421124295, "grad_norm": 1.2734375, "learning_rate": 0.0002004458371047782, "loss": 4.6872, "mean_token_accuracy": 0.23757457882165908, "num_tokens": 136098115.0, "step": 78470 }, { "entropy": 5.311525106430054, "epoch": 6.105582571484147, "grad_norm": 1.25, "learning_rate": 0.00020041968781214336, "loss": 4.5822, "mean_token_accuracy": 0.24353455752134323, "num_tokens": 136106591.0, "step": 78475 }, { "entropy": 5.42152247428894, "epoch": 6.105971600855865, "grad_norm": 1.234375, "learning_rate": 0.0002003935396511461, "loss": 4.7476, "mean_token_accuracy": 0.2334782987833023, "num_tokens": 136116953.0, "step": 78480 }, { "entropy": 5.388136386871338, "epoch": 6.106360630227583, "grad_norm": 1.3359375, "learning_rate": 0.00020036739262218313, "loss": 4.6125, "mean_token_accuracy": 0.2413247123360634, "num_tokens": 136126220.0, "step": 78485 }, { "entropy": 5.403662967681885, "epoch": 6.106749659599299, "grad_norm": 1.3515625, "learning_rate": 0.00020034124672565112, "loss": 4.6159, "mean_token_accuracy": 0.24158646017313004, "num_tokens": 136134902.0, "step": 78490 }, { "entropy": 5.372243118286133, "epoch": 6.107138688971017, "grad_norm": 1.3125, "learning_rate": 0.0002003151019619469, "loss": 4.5953, "mean_token_accuracy": 0.24275404661893846, "num_tokens": 136143199.0, "step": 78495 }, { "entropy": 5.403549480438232, "epoch": 6.107527718342735, "grad_norm": 1.3671875, "learning_rate": 0.00020028895833146715, "loss": 4.688, "mean_token_accuracy": 0.24496107399463654, "num_tokens": 136151444.0, "step": 78500 }, { "entropy": 5.47201018333435, "epoch": 6.1079167477144525, "grad_norm": 1.2578125, "learning_rate": 0.00020026281583460854, "loss": 4.7863, "mean_token_accuracy": 0.22825094163417817, "num_tokens": 136160316.0, "step": 78505 }, { "entropy": 5.416810178756714, "epoch": 6.10830577708617, "grad_norm": 1.390625, "learning_rate": 0.00020023667447176776, "loss": 4.6178, "mean_token_accuracy": 0.2448534846305847, "num_tokens": 136168537.0, "step": 78510 }, { "entropy": 5.45249309539795, "epoch": 6.108694806457888, "grad_norm": 1.34375, "learning_rate": 0.00020021053424334142, "loss": 4.6548, "mean_token_accuracy": 0.24075135439634324, "num_tokens": 136176974.0, "step": 78515 }, { "entropy": 5.304251480102539, "epoch": 6.109083835829606, "grad_norm": 1.2578125, "learning_rate": 0.00020018439514972615, "loss": 4.5876, "mean_token_accuracy": 0.2412341922521591, "num_tokens": 136185164.0, "step": 78520 }, { "entropy": 5.38652868270874, "epoch": 6.109472865201322, "grad_norm": 1.28125, "learning_rate": 0.0002001582571913186, "loss": 4.6588, "mean_token_accuracy": 0.24100582003593446, "num_tokens": 136193526.0, "step": 78525 }, { "entropy": 5.331762218475342, "epoch": 6.10986189457304, "grad_norm": 1.3828125, "learning_rate": 0.00020013212036851542, "loss": 4.5815, "mean_token_accuracy": 0.25378274768590925, "num_tokens": 136202873.0, "step": 78530 }, { "entropy": 5.372622680664063, "epoch": 6.110250923944758, "grad_norm": 1.421875, "learning_rate": 0.00020010598468171316, "loss": 4.6153, "mean_token_accuracy": 0.23556251525878907, "num_tokens": 136211870.0, "step": 78535 }, { "entropy": 5.393870496749878, "epoch": 6.1106399533164755, "grad_norm": 1.25, "learning_rate": 0.0002000798501313083, "loss": 4.6494, "mean_token_accuracy": 0.24751973003149033, "num_tokens": 136220244.0, "step": 78540 }, { "entropy": 5.4217931747436525, "epoch": 6.111028982688193, "grad_norm": 1.34375, "learning_rate": 0.00020005371671769756, "loss": 4.6978, "mean_token_accuracy": 0.2300085261464119, "num_tokens": 136229184.0, "step": 78545 }, { "entropy": 5.4494706153869625, "epoch": 6.111418012059911, "grad_norm": 1.390625, "learning_rate": 0.00020002758444127738, "loss": 4.6749, "mean_token_accuracy": 0.23971299082040787, "num_tokens": 136238049.0, "step": 78550 }, { "entropy": 5.544940662384033, "epoch": 6.111807041431628, "grad_norm": 1.3671875, "learning_rate": 0.00020000145330244424, "loss": 4.8538, "mean_token_accuracy": 0.22665495574474334, "num_tokens": 136246656.0, "step": 78555 }, { "entropy": 5.394204092025757, "epoch": 6.112196070803345, "grad_norm": 1.3046875, "learning_rate": 0.0001999753233015947, "loss": 4.6366, "mean_token_accuracy": 0.23951656967401505, "num_tokens": 136255067.0, "step": 78560 }, { "entropy": 5.3613770484924315, "epoch": 6.112585100175063, "grad_norm": 1.3203125, "learning_rate": 0.00019994919443912514, "loss": 4.6067, "mean_token_accuracy": 0.24936345219612122, "num_tokens": 136264089.0, "step": 78565 }, { "entropy": 5.400396347045898, "epoch": 6.112974129546781, "grad_norm": 1.3046875, "learning_rate": 0.00019992306671543213, "loss": 4.6203, "mean_token_accuracy": 0.23989343494176865, "num_tokens": 136272115.0, "step": 78570 }, { "entropy": 5.407944011688232, "epoch": 6.1133631589184985, "grad_norm": 1.3046875, "learning_rate": 0.00019989694013091214, "loss": 4.5682, "mean_token_accuracy": 0.2481945797801018, "num_tokens": 136280468.0, "step": 78575 }, { "entropy": 5.375766801834106, "epoch": 6.113752188290216, "grad_norm": 1.2421875, "learning_rate": 0.00019987081468596146, "loss": 4.6496, "mean_token_accuracy": 0.23621022701263428, "num_tokens": 136288834.0, "step": 78580 }, { "entropy": 5.251183986663818, "epoch": 6.114141217661934, "grad_norm": 1.328125, "learning_rate": 0.00019984469038097658, "loss": 4.4715, "mean_token_accuracy": 0.25766897201538086, "num_tokens": 136297487.0, "step": 78585 }, { "entropy": 5.378200960159302, "epoch": 6.114530247033651, "grad_norm": 1.3203125, "learning_rate": 0.000199818567216354, "loss": 4.5597, "mean_token_accuracy": 0.24707991927862166, "num_tokens": 136305606.0, "step": 78590 }, { "entropy": 5.409097480773926, "epoch": 6.114919276405368, "grad_norm": 1.28125, "learning_rate": 0.00019979244519248996, "loss": 4.6916, "mean_token_accuracy": 0.24260441362857818, "num_tokens": 136314306.0, "step": 78595 }, { "entropy": 5.314045667648315, "epoch": 6.115308305777086, "grad_norm": 1.265625, "learning_rate": 0.0001997663243097808, "loss": 4.5545, "mean_token_accuracy": 0.2475971356034279, "num_tokens": 136323285.0, "step": 78600 }, { "entropy": 5.398833703994751, "epoch": 6.115697335148804, "grad_norm": 1.375, "learning_rate": 0.00019974020456862295, "loss": 4.6802, "mean_token_accuracy": 0.2368849530816078, "num_tokens": 136331885.0, "step": 78605 }, { "entropy": 5.429479455947876, "epoch": 6.1160863645205215, "grad_norm": 1.3203125, "learning_rate": 0.00019971408596941283, "loss": 4.6957, "mean_token_accuracy": 0.23618034273386002, "num_tokens": 136340356.0, "step": 78610 }, { "entropy": 5.465973234176635, "epoch": 6.116475393892239, "grad_norm": 1.203125, "learning_rate": 0.0001996879685125465, "loss": 4.7638, "mean_token_accuracy": 0.23170444667339324, "num_tokens": 136348780.0, "step": 78615 }, { "entropy": 5.3300282001495365, "epoch": 6.116864423263957, "grad_norm": 1.2578125, "learning_rate": 0.00019966185219842038, "loss": 4.5135, "mean_token_accuracy": 0.2544509008526802, "num_tokens": 136358142.0, "step": 78620 }, { "entropy": 5.3742622375488285, "epoch": 6.117253452635674, "grad_norm": 1.2890625, "learning_rate": 0.00019963573702743077, "loss": 4.6213, "mean_token_accuracy": 0.24851785153150557, "num_tokens": 136367105.0, "step": 78625 }, { "entropy": 5.384827327728272, "epoch": 6.117642482007391, "grad_norm": 1.3046875, "learning_rate": 0.00019960962299997394, "loss": 4.6863, "mean_token_accuracy": 0.2396633118391037, "num_tokens": 136376469.0, "step": 78630 }, { "entropy": 5.42590012550354, "epoch": 6.118031511379109, "grad_norm": 1.3828125, "learning_rate": 0.00019958351011644605, "loss": 4.6558, "mean_token_accuracy": 0.23362908661365508, "num_tokens": 136384755.0, "step": 78635 }, { "entropy": 5.390380239486694, "epoch": 6.118420540750827, "grad_norm": 1.2265625, "learning_rate": 0.0001995573983772433, "loss": 4.6073, "mean_token_accuracy": 0.2402822345495224, "num_tokens": 136393920.0, "step": 78640 }, { "entropy": 5.4698608875274655, "epoch": 6.1188095701225445, "grad_norm": 1.2265625, "learning_rate": 0.00019953128778276197, "loss": 4.6866, "mean_token_accuracy": 0.22820471078157425, "num_tokens": 136402053.0, "step": 78645 }, { "entropy": 5.36732931137085, "epoch": 6.119198599494262, "grad_norm": 1.234375, "learning_rate": 0.0001995051783333982, "loss": 4.6305, "mean_token_accuracy": 0.23818558752536773, "num_tokens": 136411447.0, "step": 78650 }, { "entropy": 5.376296949386597, "epoch": 6.119587628865979, "grad_norm": 1.2109375, "learning_rate": 0.00019947907002954818, "loss": 4.5818, "mean_token_accuracy": 0.24653354585170745, "num_tokens": 136420588.0, "step": 78655 }, { "entropy": 5.2859306812286375, "epoch": 6.119976658237697, "grad_norm": 1.2734375, "learning_rate": 0.00019945296287160818, "loss": 4.5772, "mean_token_accuracy": 0.24933183342218398, "num_tokens": 136428935.0, "step": 78660 }, { "entropy": 5.432226228713989, "epoch": 6.120365687609414, "grad_norm": 1.265625, "learning_rate": 0.0001994268568599742, "loss": 4.6884, "mean_token_accuracy": 0.23573703914880753, "num_tokens": 136437990.0, "step": 78665 }, { "entropy": 5.401709747314453, "epoch": 6.120754716981132, "grad_norm": 1.3359375, "learning_rate": 0.00019940075199504232, "loss": 4.6278, "mean_token_accuracy": 0.24394212514162064, "num_tokens": 136445819.0, "step": 78670 }, { "entropy": 5.400432348251343, "epoch": 6.12114374635285, "grad_norm": 1.2890625, "learning_rate": 0.00019937464827720874, "loss": 4.6936, "mean_token_accuracy": 0.2342011660337448, "num_tokens": 136454902.0, "step": 78675 }, { "entropy": 5.455522346496582, "epoch": 6.121532775724567, "grad_norm": 1.4140625, "learning_rate": 0.00019934854570686944, "loss": 4.6604, "mean_token_accuracy": 0.23763135075569153, "num_tokens": 136463314.0, "step": 78680 }, { "entropy": 5.425014162063599, "epoch": 6.121921805096285, "grad_norm": 1.3125, "learning_rate": 0.00019932244428442065, "loss": 4.6955, "mean_token_accuracy": 0.23292257636785507, "num_tokens": 136471903.0, "step": 78685 }, { "entropy": 5.463228178024292, "epoch": 6.122310834468002, "grad_norm": 1.234375, "learning_rate": 0.00019929634401025825, "loss": 4.7576, "mean_token_accuracy": 0.22872737050056458, "num_tokens": 136480955.0, "step": 78690 }, { "entropy": 5.424966955184937, "epoch": 6.12269986383972, "grad_norm": 1.2578125, "learning_rate": 0.0001992702448847783, "loss": 4.6785, "mean_token_accuracy": 0.23830610662698745, "num_tokens": 136489974.0, "step": 78695 }, { "entropy": 5.346819877624512, "epoch": 6.123088893211437, "grad_norm": 1.2578125, "learning_rate": 0.00019924414690837688, "loss": 4.6012, "mean_token_accuracy": 0.24029412716627122, "num_tokens": 136499111.0, "step": 78700 }, { "entropy": 5.333548498153687, "epoch": 6.123477922583155, "grad_norm": 1.2890625, "learning_rate": 0.00019921805008145, "loss": 4.612, "mean_token_accuracy": 0.24185976535081863, "num_tokens": 136508077.0, "step": 78705 }, { "entropy": 5.411976385116577, "epoch": 6.123866951954873, "grad_norm": 1.296875, "learning_rate": 0.00019919195440439358, "loss": 4.6457, "mean_token_accuracy": 0.23717589378356935, "num_tokens": 136517138.0, "step": 78710 }, { "entropy": 5.437945556640625, "epoch": 6.12425598132659, "grad_norm": 1.3671875, "learning_rate": 0.00019916585987760356, "loss": 4.6711, "mean_token_accuracy": 0.23220251202583314, "num_tokens": 136526112.0, "step": 78715 }, { "entropy": 5.467208909988403, "epoch": 6.124645010698308, "grad_norm": 1.375, "learning_rate": 0.00019913976650147585, "loss": 4.7084, "mean_token_accuracy": 0.2441462278366089, "num_tokens": 136535138.0, "step": 78720 }, { "entropy": 5.376082277297973, "epoch": 6.125034040070025, "grad_norm": 1.3203125, "learning_rate": 0.00019911367427640647, "loss": 4.5849, "mean_token_accuracy": 0.2531227692961693, "num_tokens": 136543550.0, "step": 78725 }, { "entropy": 5.432673120498658, "epoch": 6.125423069441743, "grad_norm": 1.265625, "learning_rate": 0.00019908758320279134, "loss": 4.74, "mean_token_accuracy": 0.22677767872810364, "num_tokens": 136551892.0, "step": 78730 }, { "entropy": 5.448094463348388, "epoch": 6.12581209881346, "grad_norm": 1.328125, "learning_rate": 0.00019906149328102635, "loss": 4.7245, "mean_token_accuracy": 0.23276785910129547, "num_tokens": 136560575.0, "step": 78735 }, { "entropy": 5.386369752883911, "epoch": 6.126201128185178, "grad_norm": 1.234375, "learning_rate": 0.00019903540451150732, "loss": 4.6916, "mean_token_accuracy": 0.24483714401721954, "num_tokens": 136569388.0, "step": 78740 }, { "entropy": 5.364436054229737, "epoch": 6.126590157556896, "grad_norm": 1.296875, "learning_rate": 0.00019900931689463008, "loss": 4.6121, "mean_token_accuracy": 0.2412711039185524, "num_tokens": 136576780.0, "step": 78745 }, { "entropy": 5.439519548416138, "epoch": 6.126979186928613, "grad_norm": 1.2734375, "learning_rate": 0.00019898323043079054, "loss": 4.7164, "mean_token_accuracy": 0.2306882008910179, "num_tokens": 136584966.0, "step": 78750 }, { "entropy": 5.347755432128906, "epoch": 6.127368216300331, "grad_norm": 1.4296875, "learning_rate": 0.00019895714512038436, "loss": 4.5882, "mean_token_accuracy": 0.24828485995531083, "num_tokens": 136592783.0, "step": 78755 }, { "entropy": 5.474159049987793, "epoch": 6.127757245672048, "grad_norm": 1.3203125, "learning_rate": 0.00019893106096380763, "loss": 4.741, "mean_token_accuracy": 0.2391098454594612, "num_tokens": 136602247.0, "step": 78760 }, { "entropy": 5.417570304870606, "epoch": 6.128146275043766, "grad_norm": 1.3203125, "learning_rate": 0.00019890497796145584, "loss": 4.6281, "mean_token_accuracy": 0.2407189592719078, "num_tokens": 136611333.0, "step": 78765 }, { "entropy": 5.397199440002441, "epoch": 6.128535304415483, "grad_norm": 1.3203125, "learning_rate": 0.00019887889611372502, "loss": 4.6675, "mean_token_accuracy": 0.2364713355898857, "num_tokens": 136620568.0, "step": 78770 }, { "entropy": 5.357023477554321, "epoch": 6.128924333787201, "grad_norm": 1.2109375, "learning_rate": 0.0001988528154210107, "loss": 4.6811, "mean_token_accuracy": 0.23577784299850463, "num_tokens": 136629814.0, "step": 78775 }, { "entropy": 5.414559745788575, "epoch": 6.129313363158919, "grad_norm": 1.2890625, "learning_rate": 0.0001988267358837087, "loss": 4.6257, "mean_token_accuracy": 0.2457575261592865, "num_tokens": 136637677.0, "step": 78780 }, { "entropy": 5.371972990036011, "epoch": 6.129702392530636, "grad_norm": 1.3046875, "learning_rate": 0.0001988006575022147, "loss": 4.5924, "mean_token_accuracy": 0.24243347942829133, "num_tokens": 136646089.0, "step": 78785 }, { "entropy": 5.364004421234131, "epoch": 6.130091421902353, "grad_norm": 1.234375, "learning_rate": 0.00019877458027692458, "loss": 4.5982, "mean_token_accuracy": 0.24705359488725662, "num_tokens": 136654593.0, "step": 78790 }, { "entropy": 5.430990219116211, "epoch": 6.130480451274071, "grad_norm": 1.375, "learning_rate": 0.00019874850420823376, "loss": 4.6963, "mean_token_accuracy": 0.23520189821720122, "num_tokens": 136662487.0, "step": 78795 }, { "entropy": 5.305890941619873, "epoch": 6.130869480645789, "grad_norm": 1.2734375, "learning_rate": 0.00019872242929653812, "loss": 4.5721, "mean_token_accuracy": 0.24916601777076722, "num_tokens": 136671008.0, "step": 78800 }, { "entropy": 5.403901863098144, "epoch": 6.131258510017506, "grad_norm": 1.3125, "learning_rate": 0.00019869635554223313, "loss": 4.6991, "mean_token_accuracy": 0.2359052374958992, "num_tokens": 136680627.0, "step": 78805 }, { "entropy": 5.377779388427735, "epoch": 6.131647539389224, "grad_norm": 1.34375, "learning_rate": 0.00019867028294571454, "loss": 4.5645, "mean_token_accuracy": 0.2528917476534843, "num_tokens": 136688777.0, "step": 78810 }, { "entropy": 5.367270040512085, "epoch": 6.132036568760942, "grad_norm": 1.359375, "learning_rate": 0.00019864421150737787, "loss": 4.6066, "mean_token_accuracy": 0.2446463868021965, "num_tokens": 136698245.0, "step": 78815 }, { "entropy": 5.424227476119995, "epoch": 6.132425598132659, "grad_norm": 1.3203125, "learning_rate": 0.00019861814122761883, "loss": 4.6571, "mean_token_accuracy": 0.24348833858966829, "num_tokens": 136707422.0, "step": 78820 }, { "entropy": 5.313541030883789, "epoch": 6.132814627504376, "grad_norm": 1.3046875, "learning_rate": 0.0001985920721068329, "loss": 4.5704, "mean_token_accuracy": 0.2517102718353271, "num_tokens": 136716271.0, "step": 78825 }, { "entropy": 5.461903238296509, "epoch": 6.133203656876094, "grad_norm": 1.2265625, "learning_rate": 0.00019856600414541566, "loss": 4.7452, "mean_token_accuracy": 0.22699992805719377, "num_tokens": 136724671.0, "step": 78830 }, { "entropy": 5.344994926452637, "epoch": 6.133592686247812, "grad_norm": 1.328125, "learning_rate": 0.00019853993734376263, "loss": 4.5999, "mean_token_accuracy": 0.24475709050893785, "num_tokens": 136733421.0, "step": 78835 }, { "entropy": 5.317690134048462, "epoch": 6.133981715619529, "grad_norm": 1.2578125, "learning_rate": 0.00019851387170226936, "loss": 4.5444, "mean_token_accuracy": 0.2592227280139923, "num_tokens": 136741906.0, "step": 78840 }, { "entropy": 5.369586324691772, "epoch": 6.134370744991247, "grad_norm": 1.375, "learning_rate": 0.0001984878072213313, "loss": 4.6155, "mean_token_accuracy": 0.24382208436727523, "num_tokens": 136750519.0, "step": 78845 }, { "entropy": 5.467478036880493, "epoch": 6.134759774362965, "grad_norm": 1.2265625, "learning_rate": 0.00019846174390134396, "loss": 4.6685, "mean_token_accuracy": 0.2351030796766281, "num_tokens": 136758654.0, "step": 78850 }, { "entropy": 5.396537113189697, "epoch": 6.1351488037346815, "grad_norm": 1.34375, "learning_rate": 0.00019843568174270293, "loss": 4.6888, "mean_token_accuracy": 0.24944429397583007, "num_tokens": 136767423.0, "step": 78855 }, { "entropy": 5.362281370162964, "epoch": 6.135537833106399, "grad_norm": 1.5, "learning_rate": 0.00019840962074580348, "loss": 4.677, "mean_token_accuracy": 0.24165502786636353, "num_tokens": 136776333.0, "step": 78860 }, { "entropy": 5.401207113265992, "epoch": 6.135926862478117, "grad_norm": 1.1796875, "learning_rate": 0.0001983835609110412, "loss": 4.6538, "mean_token_accuracy": 0.24165072590112685, "num_tokens": 136785006.0, "step": 78865 }, { "entropy": 5.326067495346069, "epoch": 6.136315891849835, "grad_norm": 1.3203125, "learning_rate": 0.00019835750223881144, "loss": 4.5693, "mean_token_accuracy": 0.24751589447259903, "num_tokens": 136793773.0, "step": 78870 }, { "entropy": 5.346798372268677, "epoch": 6.136704921221552, "grad_norm": 1.2734375, "learning_rate": 0.00019833144472950953, "loss": 4.6725, "mean_token_accuracy": 0.24423033744096756, "num_tokens": 136802485.0, "step": 78875 }, { "entropy": 5.432577657699585, "epoch": 6.13709395059327, "grad_norm": 1.421875, "learning_rate": 0.000198305388383531, "loss": 4.6888, "mean_token_accuracy": 0.23250516206026078, "num_tokens": 136810873.0, "step": 78880 }, { "entropy": 5.441373205184936, "epoch": 6.137482979964988, "grad_norm": 1.34375, "learning_rate": 0.00019827933320127106, "loss": 4.7249, "mean_token_accuracy": 0.22696203142404556, "num_tokens": 136818717.0, "step": 78885 }, { "entropy": 5.448186302185059, "epoch": 6.1378720093367045, "grad_norm": 1.2890625, "learning_rate": 0.00019825327918312515, "loss": 4.7247, "mean_token_accuracy": 0.22789814025163652, "num_tokens": 136827462.0, "step": 78890 }, { "entropy": 5.485416555404663, "epoch": 6.138261038708422, "grad_norm": 1.2578125, "learning_rate": 0.00019822722632948858, "loss": 4.7347, "mean_token_accuracy": 0.2327155962586403, "num_tokens": 136836256.0, "step": 78895 }, { "entropy": 5.474920082092285, "epoch": 6.13865006808014, "grad_norm": 1.4453125, "learning_rate": 0.0001982011746407567, "loss": 4.6989, "mean_token_accuracy": 0.2365957260131836, "num_tokens": 136844124.0, "step": 78900 }, { "entropy": 5.430308103561401, "epoch": 6.139039097451858, "grad_norm": 1.421875, "learning_rate": 0.0001981751241173247, "loss": 4.6869, "mean_token_accuracy": 0.24781902730464936, "num_tokens": 136853240.0, "step": 78905 }, { "entropy": 5.438841056823731, "epoch": 6.139428126823575, "grad_norm": 1.2734375, "learning_rate": 0.00019814907475958793, "loss": 4.6477, "mean_token_accuracy": 0.23496609330177307, "num_tokens": 136861806.0, "step": 78910 }, { "entropy": 5.448329448699951, "epoch": 6.139817156195293, "grad_norm": 1.28125, "learning_rate": 0.0001981230265679415, "loss": 4.6894, "mean_token_accuracy": 0.22877499610185623, "num_tokens": 136869557.0, "step": 78915 }, { "entropy": 5.449795150756836, "epoch": 6.140206185567011, "grad_norm": 1.296875, "learning_rate": 0.00019809697954278088, "loss": 4.7933, "mean_token_accuracy": 0.2255861148238182, "num_tokens": 136879419.0, "step": 78920 }, { "entropy": 5.4592588424682615, "epoch": 6.1405952149387275, "grad_norm": 1.25, "learning_rate": 0.0001980709336845012, "loss": 4.6714, "mean_token_accuracy": 0.23592642545700074, "num_tokens": 136888290.0, "step": 78925 }, { "entropy": 5.429002857208252, "epoch": 6.140984244310445, "grad_norm": 1.3671875, "learning_rate": 0.00019804488899349772, "loss": 4.7318, "mean_token_accuracy": 0.2355785682797432, "num_tokens": 136897034.0, "step": 78930 }, { "entropy": 5.425620126724243, "epoch": 6.141373273682163, "grad_norm": 1.28125, "learning_rate": 0.00019801884547016553, "loss": 4.6765, "mean_token_accuracy": 0.2403073400259018, "num_tokens": 136906155.0, "step": 78935 }, { "entropy": 5.522509622573852, "epoch": 6.141762303053881, "grad_norm": 1.390625, "learning_rate": 0.0001979928031148998, "loss": 4.6987, "mean_token_accuracy": 0.23565604388713837, "num_tokens": 136914641.0, "step": 78940 }, { "entropy": 5.450054502487182, "epoch": 6.142151332425598, "grad_norm": 1.296875, "learning_rate": 0.0001979667619280957, "loss": 4.7438, "mean_token_accuracy": 0.23120893388986588, "num_tokens": 136922819.0, "step": 78945 }, { "entropy": 5.465826463699341, "epoch": 6.142540361797316, "grad_norm": 1.3671875, "learning_rate": 0.00019794072191014838, "loss": 4.8755, "mean_token_accuracy": 0.22128087133169175, "num_tokens": 136931981.0, "step": 78950 }, { "entropy": 5.4688468933105465, "epoch": 6.142929391169034, "grad_norm": 1.3359375, "learning_rate": 0.00019791468306145298, "loss": 4.7517, "mean_token_accuracy": 0.22968698740005494, "num_tokens": 136940377.0, "step": 78955 }, { "entropy": 5.518280458450318, "epoch": 6.1433184205407505, "grad_norm": 1.28125, "learning_rate": 0.0001978886453824046, "loss": 4.6772, "mean_token_accuracy": 0.24540621489286424, "num_tokens": 136949042.0, "step": 78960 }, { "entropy": 5.4317841053009035, "epoch": 6.143707449912468, "grad_norm": 1.25, "learning_rate": 0.0001978626088733982, "loss": 4.6359, "mean_token_accuracy": 0.23654134422540665, "num_tokens": 136957625.0, "step": 78965 }, { "entropy": 5.372042608261109, "epoch": 6.144096479284186, "grad_norm": 1.328125, "learning_rate": 0.00019783657353482904, "loss": 4.5659, "mean_token_accuracy": 0.2506356716156006, "num_tokens": 136966915.0, "step": 78970 }, { "entropy": 5.350477886199951, "epoch": 6.144485508655904, "grad_norm": 1.3671875, "learning_rate": 0.00019781053936709198, "loss": 4.5745, "mean_token_accuracy": 0.24752390533685684, "num_tokens": 136975850.0, "step": 78975 }, { "entropy": 5.343332958221436, "epoch": 6.144874538027621, "grad_norm": 1.359375, "learning_rate": 0.00019778450637058216, "loss": 4.63, "mean_token_accuracy": 0.23954952359199524, "num_tokens": 136984526.0, "step": 78980 }, { "entropy": 5.396504640579224, "epoch": 6.145263567399339, "grad_norm": 1.28125, "learning_rate": 0.00019775847454569446, "loss": 4.5996, "mean_token_accuracy": 0.24154503345489503, "num_tokens": 136992947.0, "step": 78985 }, { "entropy": 5.363021564483643, "epoch": 6.145652596771056, "grad_norm": 1.296875, "learning_rate": 0.00019773244389282408, "loss": 4.6315, "mean_token_accuracy": 0.23812874257564545, "num_tokens": 137002186.0, "step": 78990 }, { "entropy": 5.3873930931091305, "epoch": 6.1460416261427735, "grad_norm": 1.3828125, "learning_rate": 0.0001977064144123658, "loss": 4.6354, "mean_token_accuracy": 0.2386369675397873, "num_tokens": 137010587.0, "step": 78995 }, { "entropy": 5.419131278991699, "epoch": 6.146430655514491, "grad_norm": 1.296875, "learning_rate": 0.00019768038610471473, "loss": 4.7393, "mean_token_accuracy": 0.2293958529829979, "num_tokens": 137018806.0, "step": 79000 }, { "entropy": 5.470091104507446, "epoch": 6.146819684886209, "grad_norm": 1.28125, "learning_rate": 0.00019765435897026575, "loss": 4.7306, "mean_token_accuracy": 0.2350328490138054, "num_tokens": 137027958.0, "step": 79005 }, { "entropy": 5.43677282333374, "epoch": 6.147208714257927, "grad_norm": 1.2734375, "learning_rate": 0.00019762833300941373, "loss": 4.6542, "mean_token_accuracy": 0.24548936188220977, "num_tokens": 137036257.0, "step": 79010 }, { "entropy": 5.397232294082642, "epoch": 6.147597743629644, "grad_norm": 1.40625, "learning_rate": 0.00019760230822255358, "loss": 4.6355, "mean_token_accuracy": 0.24341279566287993, "num_tokens": 137045098.0, "step": 79015 }, { "entropy": 5.417088460922241, "epoch": 6.147986773001362, "grad_norm": 1.2890625, "learning_rate": 0.00019757628461008025, "loss": 4.6177, "mean_token_accuracy": 0.24664041250944138, "num_tokens": 137053997.0, "step": 79020 }, { "entropy": 5.36372594833374, "epoch": 6.148375802373079, "grad_norm": 1.296875, "learning_rate": 0.0001975502621723886, "loss": 4.624, "mean_token_accuracy": 0.2483044907450676, "num_tokens": 137062953.0, "step": 79025 }, { "entropy": 5.29890809059143, "epoch": 6.1487648317447965, "grad_norm": 1.28125, "learning_rate": 0.00019752424090987338, "loss": 4.4874, "mean_token_accuracy": 0.2565107852220535, "num_tokens": 137071563.0, "step": 79030 }, { "entropy": 5.346020936965942, "epoch": 6.149153861116514, "grad_norm": 1.3125, "learning_rate": 0.00019749822082292947, "loss": 4.5628, "mean_token_accuracy": 0.24831537753343583, "num_tokens": 137079372.0, "step": 79035 }, { "entropy": 5.435690402984619, "epoch": 6.149542890488232, "grad_norm": 1.390625, "learning_rate": 0.00019747220191195175, "loss": 4.7064, "mean_token_accuracy": 0.24443809688091278, "num_tokens": 137087646.0, "step": 79040 }, { "entropy": 5.326570749282837, "epoch": 6.14993191985995, "grad_norm": 1.3125, "learning_rate": 0.00019744618417733494, "loss": 4.612, "mean_token_accuracy": 0.2442912682890892, "num_tokens": 137095899.0, "step": 79045 }, { "entropy": 5.439183235168457, "epoch": 6.150320949231667, "grad_norm": 1.3359375, "learning_rate": 0.0001974201676194738, "loss": 4.6825, "mean_token_accuracy": 0.23681214898824693, "num_tokens": 137104479.0, "step": 79050 }, { "entropy": 5.402071285247803, "epoch": 6.150709978603385, "grad_norm": 1.390625, "learning_rate": 0.00019739415223876322, "loss": 4.7507, "mean_token_accuracy": 0.22732164114713668, "num_tokens": 137112950.0, "step": 79055 }, { "entropy": 5.326495170593262, "epoch": 6.151099007975102, "grad_norm": 1.3359375, "learning_rate": 0.00019736813803559783, "loss": 4.5343, "mean_token_accuracy": 0.24398083239793777, "num_tokens": 137122407.0, "step": 79060 }, { "entropy": 5.443326663970947, "epoch": 6.1514880373468195, "grad_norm": 1.4453125, "learning_rate": 0.0001973421250103724, "loss": 4.7241, "mean_token_accuracy": 0.22959715723991395, "num_tokens": 137131172.0, "step": 79065 }, { "entropy": 5.295599126815796, "epoch": 6.151877066718537, "grad_norm": 1.34375, "learning_rate": 0.00019731611316348158, "loss": 4.5872, "mean_token_accuracy": 0.2469363957643509, "num_tokens": 137139393.0, "step": 79070 }, { "entropy": 5.333982372283936, "epoch": 6.152266096090255, "grad_norm": 1.3046875, "learning_rate": 0.00019729010249532015, "loss": 4.6813, "mean_token_accuracy": 0.2387621209025383, "num_tokens": 137149154.0, "step": 79075 }, { "entropy": 5.380866670608521, "epoch": 6.152655125461973, "grad_norm": 1.3515625, "learning_rate": 0.00019726409300628266, "loss": 4.631, "mean_token_accuracy": 0.2356287121772766, "num_tokens": 137157500.0, "step": 79080 }, { "entropy": 5.3818169116973875, "epoch": 6.15304415483369, "grad_norm": 1.2265625, "learning_rate": 0.00019723808469676384, "loss": 4.5801, "mean_token_accuracy": 0.24681150317192077, "num_tokens": 137166388.0, "step": 79085 }, { "entropy": 5.4126551151275635, "epoch": 6.153433184205407, "grad_norm": 1.328125, "learning_rate": 0.00019721207756715842, "loss": 4.5855, "mean_token_accuracy": 0.24178925305604934, "num_tokens": 137175174.0, "step": 79090 }, { "entropy": 5.45515718460083, "epoch": 6.153822213577125, "grad_norm": 1.2578125, "learning_rate": 0.00019718607161786083, "loss": 4.7633, "mean_token_accuracy": 0.23033933937549592, "num_tokens": 137184334.0, "step": 79095 }, { "entropy": 5.459223699569702, "epoch": 6.1542112429488425, "grad_norm": 1.4765625, "learning_rate": 0.0001971600668492658, "loss": 4.7423, "mean_token_accuracy": 0.2361503705382347, "num_tokens": 137192543.0, "step": 79100 }, { "entropy": 5.4387311935424805, "epoch": 6.15460027232056, "grad_norm": 1.21875, "learning_rate": 0.00019713406326176775, "loss": 4.6493, "mean_token_accuracy": 0.2353041484951973, "num_tokens": 137200992.0, "step": 79105 }, { "entropy": 5.405796337127685, "epoch": 6.154989301692278, "grad_norm": 1.2421875, "learning_rate": 0.00019710806085576144, "loss": 4.6241, "mean_token_accuracy": 0.24453434199094773, "num_tokens": 137209093.0, "step": 79110 }, { "entropy": 5.420788288116455, "epoch": 6.155378331063996, "grad_norm": 1.28125, "learning_rate": 0.0001970820596316412, "loss": 4.6774, "mean_token_accuracy": 0.23129548728466034, "num_tokens": 137217500.0, "step": 79115 }, { "entropy": 5.503490686416626, "epoch": 6.155767360435713, "grad_norm": 1.25, "learning_rate": 0.00019705605958980182, "loss": 4.79, "mean_token_accuracy": 0.2300945922732353, "num_tokens": 137226642.0, "step": 79120 }, { "entropy": 5.516183948516845, "epoch": 6.15615638980743, "grad_norm": 1.3125, "learning_rate": 0.00019703006073063767, "loss": 4.7022, "mean_token_accuracy": 0.241116301715374, "num_tokens": 137234893.0, "step": 79125 }, { "entropy": 5.334193992614746, "epoch": 6.156545419179148, "grad_norm": 1.28125, "learning_rate": 0.00019700406305454322, "loss": 4.56, "mean_token_accuracy": 0.24646274149417877, "num_tokens": 137243524.0, "step": 79130 }, { "entropy": 5.424464130401612, "epoch": 6.1569344485508655, "grad_norm": 1.3359375, "learning_rate": 0.00019697806656191296, "loss": 4.7139, "mean_token_accuracy": 0.23481153100728988, "num_tokens": 137251277.0, "step": 79135 }, { "entropy": 5.38928713798523, "epoch": 6.157323477922583, "grad_norm": 1.4453125, "learning_rate": 0.0001969520712531414, "loss": 4.5558, "mean_token_accuracy": 0.25526061207056044, "num_tokens": 137260032.0, "step": 79140 }, { "entropy": 5.343547201156616, "epoch": 6.157712507294301, "grad_norm": 1.296875, "learning_rate": 0.00019692607712862287, "loss": 4.6324, "mean_token_accuracy": 0.2342696711421013, "num_tokens": 137268506.0, "step": 79145 }, { "entropy": 5.305695056915283, "epoch": 6.158101536666019, "grad_norm": 1.2578125, "learning_rate": 0.00019690008418875188, "loss": 4.5899, "mean_token_accuracy": 0.2441267728805542, "num_tokens": 137277054.0, "step": 79150 }, { "entropy": 5.444936466217041, "epoch": 6.158490566037736, "grad_norm": 1.3203125, "learning_rate": 0.00019687409243392278, "loss": 4.7466, "mean_token_accuracy": 0.2337896093726158, "num_tokens": 137285293.0, "step": 79155 }, { "entropy": 5.371608448028565, "epoch": 6.158879595409453, "grad_norm": 1.2734375, "learning_rate": 0.00019684810186453, "loss": 4.6208, "mean_token_accuracy": 0.24750885963439942, "num_tokens": 137294367.0, "step": 79160 }, { "entropy": 5.50307297706604, "epoch": 6.159268624781171, "grad_norm": 1.2734375, "learning_rate": 0.00019682211248096793, "loss": 4.7344, "mean_token_accuracy": 0.23041231632232667, "num_tokens": 137303050.0, "step": 79165 }, { "entropy": 5.405861282348633, "epoch": 6.1596576541528885, "grad_norm": 1.3359375, "learning_rate": 0.0001967961242836308, "loss": 4.6182, "mean_token_accuracy": 0.24997203797101974, "num_tokens": 137311225.0, "step": 79170 }, { "entropy": 5.42248420715332, "epoch": 6.160046683524606, "grad_norm": 1.28125, "learning_rate": 0.0001967701372729131, "loss": 4.6814, "mean_token_accuracy": 0.23063574731349945, "num_tokens": 137320629.0, "step": 79175 }, { "entropy": 5.466156530380249, "epoch": 6.160435712896324, "grad_norm": 1.3046875, "learning_rate": 0.00019674415144920894, "loss": 4.7085, "mean_token_accuracy": 0.2359488919377327, "num_tokens": 137329661.0, "step": 79180 }, { "entropy": 5.442575740814209, "epoch": 6.1608247422680416, "grad_norm": 1.28125, "learning_rate": 0.0001967181668129127, "loss": 4.6845, "mean_token_accuracy": 0.23231832236051558, "num_tokens": 137337655.0, "step": 79185 }, { "entropy": 5.417653560638428, "epoch": 6.161213771639758, "grad_norm": 1.3671875, "learning_rate": 0.00019669218336441875, "loss": 4.686, "mean_token_accuracy": 0.23088178038597107, "num_tokens": 137346407.0, "step": 79190 }, { "entropy": 5.300498676300049, "epoch": 6.161602801011476, "grad_norm": 1.3046875, "learning_rate": 0.00019666620110412125, "loss": 4.533, "mean_token_accuracy": 0.24398079067468642, "num_tokens": 137354983.0, "step": 79195 }, { "entropy": 5.431863737106323, "epoch": 6.161991830383194, "grad_norm": 1.234375, "learning_rate": 0.00019664022003241456, "loss": 4.7401, "mean_token_accuracy": 0.23567648082971573, "num_tokens": 137364568.0, "step": 79200 }, { "entropy": 5.386041784286499, "epoch": 6.1623808597549115, "grad_norm": 1.28125, "learning_rate": 0.00019661424014969276, "loss": 4.6233, "mean_token_accuracy": 0.23776525557041167, "num_tokens": 137373132.0, "step": 79205 }, { "entropy": 5.389340162277222, "epoch": 6.162769889126629, "grad_norm": 1.2734375, "learning_rate": 0.00019658826145635007, "loss": 4.646, "mean_token_accuracy": 0.23617079555988313, "num_tokens": 137382051.0, "step": 79210 }, { "entropy": 5.338533067703247, "epoch": 6.163158918498347, "grad_norm": 1.3828125, "learning_rate": 0.00019656228395278076, "loss": 4.6032, "mean_token_accuracy": 0.24431201815605164, "num_tokens": 137390144.0, "step": 79215 }, { "entropy": 5.401076936721802, "epoch": 6.1635479478700645, "grad_norm": 1.3515625, "learning_rate": 0.0001965363076393789, "loss": 4.6879, "mean_token_accuracy": 0.23491137623786926, "num_tokens": 137398313.0, "step": 79220 }, { "entropy": 5.346828031539917, "epoch": 6.163936977241781, "grad_norm": 1.28125, "learning_rate": 0.00019651033251653866, "loss": 4.6427, "mean_token_accuracy": 0.24152909070253373, "num_tokens": 137407081.0, "step": 79225 }, { "entropy": 5.355836200714111, "epoch": 6.164326006613499, "grad_norm": 1.375, "learning_rate": 0.00019648435858465424, "loss": 4.6818, "mean_token_accuracy": 0.23410223722457885, "num_tokens": 137415448.0, "step": 79230 }, { "entropy": 5.441721105575562, "epoch": 6.164715035985217, "grad_norm": 1.4296875, "learning_rate": 0.00019645838584411967, "loss": 4.7636, "mean_token_accuracy": 0.23450849950313568, "num_tokens": 137424710.0, "step": 79235 }, { "entropy": 5.409655046463013, "epoch": 6.1651040653569344, "grad_norm": 1.25, "learning_rate": 0.00019643241429532916, "loss": 4.6934, "mean_token_accuracy": 0.2325771078467369, "num_tokens": 137434472.0, "step": 79240 }, { "entropy": 5.349524974822998, "epoch": 6.165493094728652, "grad_norm": 1.1875, "learning_rate": 0.00019640644393867663, "loss": 4.5941, "mean_token_accuracy": 0.24110008776187897, "num_tokens": 137442452.0, "step": 79245 }, { "entropy": 5.337251424789429, "epoch": 6.16588212410037, "grad_norm": 1.359375, "learning_rate": 0.00019638047477455616, "loss": 4.6419, "mean_token_accuracy": 0.2397637441754341, "num_tokens": 137451758.0, "step": 79250 }, { "entropy": 5.408027505874633, "epoch": 6.1662711534720875, "grad_norm": 1.3515625, "learning_rate": 0.00019635450680336198, "loss": 4.733, "mean_token_accuracy": 0.23420953303575515, "num_tokens": 137460335.0, "step": 79255 }, { "entropy": 5.383549737930298, "epoch": 6.166660182843804, "grad_norm": 1.3046875, "learning_rate": 0.00019632854002548796, "loss": 4.6157, "mean_token_accuracy": 0.23964510709047318, "num_tokens": 137468113.0, "step": 79260 }, { "entropy": 5.439716815948486, "epoch": 6.167049212215522, "grad_norm": 1.3125, "learning_rate": 0.00019630257444132803, "loss": 4.722, "mean_token_accuracy": 0.23583550453186036, "num_tokens": 137477277.0, "step": 79265 }, { "entropy": 5.372001218795776, "epoch": 6.16743824158724, "grad_norm": 1.375, "learning_rate": 0.00019627661005127634, "loss": 4.7296, "mean_token_accuracy": 0.23639536052942275, "num_tokens": 137486033.0, "step": 79270 }, { "entropy": 5.428027868270874, "epoch": 6.167827270958957, "grad_norm": 1.265625, "learning_rate": 0.0001962506468557268, "loss": 4.7002, "mean_token_accuracy": 0.24111622273921968, "num_tokens": 137494414.0, "step": 79275 }, { "entropy": 5.322297477722168, "epoch": 6.168216300330675, "grad_norm": 1.28125, "learning_rate": 0.0001962246848550734, "loss": 4.5601, "mean_token_accuracy": 0.24543844014406205, "num_tokens": 137502173.0, "step": 79280 }, { "entropy": 5.404531812667846, "epoch": 6.168605329702393, "grad_norm": 1.3125, "learning_rate": 0.00019619872404971002, "loss": 4.6391, "mean_token_accuracy": 0.2438809171319008, "num_tokens": 137511028.0, "step": 79285 }, { "entropy": 5.363803958892822, "epoch": 6.1689943590741105, "grad_norm": 1.34375, "learning_rate": 0.00019617276444003053, "loss": 4.6261, "mean_token_accuracy": 0.23028571903705597, "num_tokens": 137519415.0, "step": 79290 }, { "entropy": 5.371300411224365, "epoch": 6.169383388445827, "grad_norm": 1.2421875, "learning_rate": 0.00019614680602642886, "loss": 4.6002, "mean_token_accuracy": 0.24473311603069306, "num_tokens": 137527957.0, "step": 79295 }, { "entropy": 5.362251901626587, "epoch": 6.169772417817545, "grad_norm": 1.3828125, "learning_rate": 0.00019612084880929888, "loss": 4.5941, "mean_token_accuracy": 0.24410882443189622, "num_tokens": 137535965.0, "step": 79300 }, { "entropy": 5.397421169281006, "epoch": 6.170161447189263, "grad_norm": 1.3203125, "learning_rate": 0.00019609489278903452, "loss": 4.6896, "mean_token_accuracy": 0.23279963433742523, "num_tokens": 137545051.0, "step": 79305 }, { "entropy": 5.401891231536865, "epoch": 6.17055047656098, "grad_norm": 1.34375, "learning_rate": 0.00019606893796602953, "loss": 4.6485, "mean_token_accuracy": 0.23451224565505982, "num_tokens": 137553451.0, "step": 79310 }, { "entropy": 5.426145553588867, "epoch": 6.170939505932698, "grad_norm": 1.2890625, "learning_rate": 0.0001960429843406778, "loss": 4.7048, "mean_token_accuracy": 0.2308053269982338, "num_tokens": 137562424.0, "step": 79315 }, { "entropy": 5.3988243579864506, "epoch": 6.171328535304416, "grad_norm": 1.28125, "learning_rate": 0.0001960170319133731, "loss": 4.6822, "mean_token_accuracy": 0.2299165576696396, "num_tokens": 137570722.0, "step": 79320 }, { "entropy": 5.399321556091309, "epoch": 6.171717564676133, "grad_norm": 1.296875, "learning_rate": 0.00019599108068450922, "loss": 4.6463, "mean_token_accuracy": 0.2440319299697876, "num_tokens": 137579544.0, "step": 79325 }, { "entropy": 5.401704025268555, "epoch": 6.17210659404785, "grad_norm": 1.296875, "learning_rate": 0.00019596513065447995, "loss": 4.6344, "mean_token_accuracy": 0.24342752397060394, "num_tokens": 137587993.0, "step": 79330 }, { "entropy": 5.421851873397827, "epoch": 6.172495623419568, "grad_norm": 1.3984375, "learning_rate": 0.00019593918182367903, "loss": 4.6799, "mean_token_accuracy": 0.24177489280700684, "num_tokens": 137596665.0, "step": 79335 }, { "entropy": 5.355125522613525, "epoch": 6.172884652791286, "grad_norm": 1.3515625, "learning_rate": 0.00019591323419250017, "loss": 4.5972, "mean_token_accuracy": 0.24165622591972352, "num_tokens": 137605265.0, "step": 79340 }, { "entropy": 5.339280080795288, "epoch": 6.173273682163003, "grad_norm": 1.2265625, "learning_rate": 0.00019588728776133714, "loss": 4.6183, "mean_token_accuracy": 0.23938302099704742, "num_tokens": 137613950.0, "step": 79345 }, { "entropy": 5.369203329086304, "epoch": 6.173662711534721, "grad_norm": 1.203125, "learning_rate": 0.00019586134253058357, "loss": 4.6597, "mean_token_accuracy": 0.23759396970272065, "num_tokens": 137622753.0, "step": 79350 }, { "entropy": 5.345684814453125, "epoch": 6.174051740906439, "grad_norm": 1.3359375, "learning_rate": 0.00019583539850063315, "loss": 4.6101, "mean_token_accuracy": 0.24625101685523987, "num_tokens": 137631401.0, "step": 79355 }, { "entropy": 5.351523685455322, "epoch": 6.174440770278156, "grad_norm": 1.3203125, "learning_rate": 0.00019580945567187956, "loss": 4.5662, "mean_token_accuracy": 0.24811996072530745, "num_tokens": 137640368.0, "step": 79360 }, { "entropy": 5.386639738082886, "epoch": 6.174829799649873, "grad_norm": 1.2421875, "learning_rate": 0.0001957835140447165, "loss": 4.6927, "mean_token_accuracy": 0.23124420195817946, "num_tokens": 137649327.0, "step": 79365 }, { "entropy": 5.408903884887695, "epoch": 6.175218829021591, "grad_norm": 1.3671875, "learning_rate": 0.0001957575736195375, "loss": 4.6785, "mean_token_accuracy": 0.24356093555688857, "num_tokens": 137657225.0, "step": 79370 }, { "entropy": 5.46279935836792, "epoch": 6.175607858393309, "grad_norm": 1.3359375, "learning_rate": 0.0001957316343967362, "loss": 4.7073, "mean_token_accuracy": 0.23467136025428773, "num_tokens": 137666552.0, "step": 79375 }, { "entropy": 5.334253311157227, "epoch": 6.175996887765026, "grad_norm": 1.3515625, "learning_rate": 0.00019570569637670604, "loss": 4.5983, "mean_token_accuracy": 0.24107507169246672, "num_tokens": 137675776.0, "step": 79380 }, { "entropy": 5.364078187942505, "epoch": 6.176385917136744, "grad_norm": 1.3359375, "learning_rate": 0.00019567975955984079, "loss": 4.6365, "mean_token_accuracy": 0.24801819175481796, "num_tokens": 137684242.0, "step": 79385 }, { "entropy": 5.356059312820435, "epoch": 6.176774946508462, "grad_norm": 1.328125, "learning_rate": 0.00019565382394653403, "loss": 4.677, "mean_token_accuracy": 0.239322529733181, "num_tokens": 137692724.0, "step": 79390 }, { "entropy": 5.413623094558716, "epoch": 6.177163975880179, "grad_norm": 1.28125, "learning_rate": 0.0001956278895371792, "loss": 4.6469, "mean_token_accuracy": 0.24042658805847167, "num_tokens": 137701373.0, "step": 79395 }, { "entropy": 5.28484616279602, "epoch": 6.177553005251896, "grad_norm": 1.328125, "learning_rate": 0.00019560195633216976, "loss": 4.5653, "mean_token_accuracy": 0.24396198838949204, "num_tokens": 137709751.0, "step": 79400 }, { "entropy": 5.38649091720581, "epoch": 6.177942034623614, "grad_norm": 1.296875, "learning_rate": 0.00019557602433189925, "loss": 4.7061, "mean_token_accuracy": 0.23197105377912522, "num_tokens": 137718928.0, "step": 79405 }, { "entropy": 5.374450445175171, "epoch": 6.178331063995332, "grad_norm": 1.34375, "learning_rate": 0.00019555009353676116, "loss": 4.6428, "mean_token_accuracy": 0.23928750306367874, "num_tokens": 137727157.0, "step": 79410 }, { "entropy": 5.429249811172485, "epoch": 6.178720093367049, "grad_norm": 1.3125, "learning_rate": 0.00019552416394714894, "loss": 4.715, "mean_token_accuracy": 0.22579919993877412, "num_tokens": 137735954.0, "step": 79415 }, { "entropy": 5.44999132156372, "epoch": 6.179109122738767, "grad_norm": 1.3828125, "learning_rate": 0.00019549823556345603, "loss": 4.7136, "mean_token_accuracy": 0.2429208368062973, "num_tokens": 137743992.0, "step": 79420 }, { "entropy": 5.473904228210449, "epoch": 6.179498152110484, "grad_norm": 1.34375, "learning_rate": 0.00019547230838607593, "loss": 4.7325, "mean_token_accuracy": 0.23508021980524063, "num_tokens": 137752070.0, "step": 79425 }, { "entropy": 5.379948329925537, "epoch": 6.179887181482202, "grad_norm": 1.2578125, "learning_rate": 0.00019544638241540186, "loss": 4.6747, "mean_token_accuracy": 0.2350342482328415, "num_tokens": 137760675.0, "step": 79430 }, { "entropy": 5.424725151062011, "epoch": 6.180276210853919, "grad_norm": 1.3203125, "learning_rate": 0.00019542045765182737, "loss": 4.7651, "mean_token_accuracy": 0.2324303299188614, "num_tokens": 137769724.0, "step": 79435 }, { "entropy": 5.462090969085693, "epoch": 6.180665240225637, "grad_norm": 1.328125, "learning_rate": 0.00019539453409574576, "loss": 4.7334, "mean_token_accuracy": 0.23942847698926925, "num_tokens": 137777972.0, "step": 79440 }, { "entropy": 5.376684093475342, "epoch": 6.181054269597355, "grad_norm": 1.28125, "learning_rate": 0.00019536861174755045, "loss": 4.5413, "mean_token_accuracy": 0.2480020761489868, "num_tokens": 137786599.0, "step": 79445 }, { "entropy": 5.45131402015686, "epoch": 6.181443298969072, "grad_norm": 1.2890625, "learning_rate": 0.00019534269060763454, "loss": 4.632, "mean_token_accuracy": 0.23995295017957688, "num_tokens": 137794300.0, "step": 79450 }, { "entropy": 5.3206517696380615, "epoch": 6.18183232834079, "grad_norm": 1.2734375, "learning_rate": 0.00019531677067639164, "loss": 4.55, "mean_token_accuracy": 0.24876846373081207, "num_tokens": 137802487.0, "step": 79455 }, { "entropy": 5.319809627532959, "epoch": 6.182221357712507, "grad_norm": 1.234375, "learning_rate": 0.00019529085195421492, "loss": 4.6964, "mean_token_accuracy": 0.23383576422929764, "num_tokens": 137811626.0, "step": 79460 }, { "entropy": 5.366305255889893, "epoch": 6.182610387084225, "grad_norm": 1.390625, "learning_rate": 0.00019526493444149763, "loss": 4.6429, "mean_token_accuracy": 0.24318985342979432, "num_tokens": 137820105.0, "step": 79465 }, { "entropy": 5.395595645904541, "epoch": 6.182999416455942, "grad_norm": 1.3671875, "learning_rate": 0.00019523901813863303, "loss": 4.7296, "mean_token_accuracy": 0.22988881319761276, "num_tokens": 137829491.0, "step": 79470 }, { "entropy": 5.360602378845215, "epoch": 6.18338844582766, "grad_norm": 1.2734375, "learning_rate": 0.00019521310304601447, "loss": 4.6283, "mean_token_accuracy": 0.2401544541120529, "num_tokens": 137837787.0, "step": 79475 }, { "entropy": 5.450046873092651, "epoch": 6.183777475199378, "grad_norm": 1.3359375, "learning_rate": 0.000195187189164035, "loss": 4.7226, "mean_token_accuracy": 0.230457603931427, "num_tokens": 137846272.0, "step": 79480 }, { "entropy": 5.375442361831665, "epoch": 6.184166504571095, "grad_norm": 1.25, "learning_rate": 0.0001951612764930879, "loss": 4.6476, "mean_token_accuracy": 0.23887607753276824, "num_tokens": 137854434.0, "step": 79485 }, { "entropy": 5.2854009628295895, "epoch": 6.184555533942813, "grad_norm": 1.1953125, "learning_rate": 0.00019513536503356637, "loss": 4.5122, "mean_token_accuracy": 0.24911149889230727, "num_tokens": 137863871.0, "step": 79490 }, { "entropy": 5.3375180721282955, "epoch": 6.18494456331453, "grad_norm": 1.234375, "learning_rate": 0.00019510945478586351, "loss": 4.6047, "mean_token_accuracy": 0.24016215652227402, "num_tokens": 137873028.0, "step": 79495 }, { "entropy": 5.385112619400024, "epoch": 6.185333592686248, "grad_norm": 1.296875, "learning_rate": 0.00019508354575037258, "loss": 4.693, "mean_token_accuracy": 0.23691432178020477, "num_tokens": 137881467.0, "step": 79500 }, { "entropy": 5.349452543258667, "epoch": 6.185722622057965, "grad_norm": 1.2890625, "learning_rate": 0.0001950576379274866, "loss": 4.6223, "mean_token_accuracy": 0.23969205021858214, "num_tokens": 137890368.0, "step": 79505 }, { "entropy": 5.383006286621094, "epoch": 6.186111651429683, "grad_norm": 1.3125, "learning_rate": 0.0001950317313175987, "loss": 4.633, "mean_token_accuracy": 0.24486603438854218, "num_tokens": 137898830.0, "step": 79510 }, { "entropy": 5.445719051361084, "epoch": 6.186500680801401, "grad_norm": 1.390625, "learning_rate": 0.00019500582592110207, "loss": 4.6727, "mean_token_accuracy": 0.2389020875096321, "num_tokens": 137907402.0, "step": 79515 }, { "entropy": 5.437014627456665, "epoch": 6.186889710173118, "grad_norm": 1.203125, "learning_rate": 0.00019497992173838963, "loss": 4.74, "mean_token_accuracy": 0.2357453003525734, "num_tokens": 137916206.0, "step": 79520 }, { "entropy": 5.462190914154053, "epoch": 6.187278739544835, "grad_norm": 1.390625, "learning_rate": 0.00019495401876985457, "loss": 4.6837, "mean_token_accuracy": 0.23994932174682618, "num_tokens": 137925558.0, "step": 79525 }, { "entropy": 5.411999368667603, "epoch": 6.187667768916553, "grad_norm": 1.25, "learning_rate": 0.00019492811701588982, "loss": 4.6518, "mean_token_accuracy": 0.24090273827314376, "num_tokens": 137934317.0, "step": 79530 }, { "entropy": 5.401230001449585, "epoch": 6.188056798288271, "grad_norm": 1.34375, "learning_rate": 0.0001949022164768885, "loss": 4.7002, "mean_token_accuracy": 0.2349329560995102, "num_tokens": 137942325.0, "step": 79535 }, { "entropy": 5.328482007980346, "epoch": 6.188445827659988, "grad_norm": 1.3046875, "learning_rate": 0.0001948763171532435, "loss": 4.652, "mean_token_accuracy": 0.23770998418331146, "num_tokens": 137951076.0, "step": 79540 }, { "entropy": 5.37667932510376, "epoch": 6.188834857031706, "grad_norm": 1.4453125, "learning_rate": 0.0001948504190453479, "loss": 4.6463, "mean_token_accuracy": 0.2392538845539093, "num_tokens": 137960060.0, "step": 79545 }, { "entropy": 5.386412954330444, "epoch": 6.189223886403424, "grad_norm": 1.3828125, "learning_rate": 0.00019482452215359463, "loss": 4.6402, "mean_token_accuracy": 0.2414134532213211, "num_tokens": 137968780.0, "step": 79550 }, { "entropy": 5.295425319671631, "epoch": 6.189612915775141, "grad_norm": 1.1640625, "learning_rate": 0.00019479862647837665, "loss": 4.5269, "mean_token_accuracy": 0.2573930099606514, "num_tokens": 137977805.0, "step": 79555 }, { "entropy": 5.261436986923218, "epoch": 6.190001945146858, "grad_norm": 1.3203125, "learning_rate": 0.00019477273202008678, "loss": 4.5922, "mean_token_accuracy": 0.2438929334282875, "num_tokens": 137986210.0, "step": 79560 }, { "entropy": 5.400560760498047, "epoch": 6.190390974518576, "grad_norm": 1.3359375, "learning_rate": 0.00019474683877911808, "loss": 4.7467, "mean_token_accuracy": 0.23514029681682586, "num_tokens": 137994590.0, "step": 79565 }, { "entropy": 5.447697162628174, "epoch": 6.190780003890294, "grad_norm": 1.3515625, "learning_rate": 0.00019472094675586333, "loss": 4.6207, "mean_token_accuracy": 0.24900805503129958, "num_tokens": 138002578.0, "step": 79570 }, { "entropy": 5.494809675216675, "epoch": 6.191169033262011, "grad_norm": 1.40625, "learning_rate": 0.0001946950559507154, "loss": 4.7143, "mean_token_accuracy": 0.23388391137123107, "num_tokens": 138011186.0, "step": 79575 }, { "entropy": 5.359992742538452, "epoch": 6.191558062633729, "grad_norm": 1.3203125, "learning_rate": 0.00019466916636406718, "loss": 4.6051, "mean_token_accuracy": 0.24019882678985596, "num_tokens": 138020000.0, "step": 79580 }, { "entropy": 5.406331396102905, "epoch": 6.191947092005447, "grad_norm": 1.3203125, "learning_rate": 0.00019464327799631153, "loss": 4.6009, "mean_token_accuracy": 0.2418159916996956, "num_tokens": 138028873.0, "step": 79585 }, { "entropy": 5.404008674621582, "epoch": 6.192336121377164, "grad_norm": 1.3984375, "learning_rate": 0.00019461739084784124, "loss": 4.7031, "mean_token_accuracy": 0.2306203305721283, "num_tokens": 138037377.0, "step": 79590 }, { "entropy": 5.297249698638916, "epoch": 6.192725150748881, "grad_norm": 1.3125, "learning_rate": 0.0001945915049190491, "loss": 4.5167, "mean_token_accuracy": 0.254434609413147, "num_tokens": 138045701.0, "step": 79595 }, { "entropy": 5.379953384399414, "epoch": 6.193114180120599, "grad_norm": 1.2265625, "learning_rate": 0.00019456562021032787, "loss": 4.663, "mean_token_accuracy": 0.24161863476037979, "num_tokens": 138054051.0, "step": 79600 }, { "entropy": 5.417987108230591, "epoch": 6.193503209492317, "grad_norm": 1.359375, "learning_rate": 0.00019453973672207037, "loss": 4.7277, "mean_token_accuracy": 0.23365566581487657, "num_tokens": 138063383.0, "step": 79605 }, { "entropy": 5.439590167999268, "epoch": 6.193892238864034, "grad_norm": 1.28125, "learning_rate": 0.0001945138544546693, "loss": 4.6472, "mean_token_accuracy": 0.2409509927034378, "num_tokens": 138072212.0, "step": 79610 }, { "entropy": 5.348165225982666, "epoch": 6.194281268235752, "grad_norm": 1.3046875, "learning_rate": 0.0001944879734085173, "loss": 4.517, "mean_token_accuracy": 0.25133979320526123, "num_tokens": 138080971.0, "step": 79615 }, { "entropy": 5.416686201095581, "epoch": 6.19467029760747, "grad_norm": 1.3203125, "learning_rate": 0.00019446209358400723, "loss": 4.704, "mean_token_accuracy": 0.2385067492723465, "num_tokens": 138089581.0, "step": 79620 }, { "entropy": 5.434207582473755, "epoch": 6.195059326979187, "grad_norm": 1.203125, "learning_rate": 0.0001944362149815317, "loss": 4.7589, "mean_token_accuracy": 0.23387827724218369, "num_tokens": 138097910.0, "step": 79625 }, { "entropy": 5.381994533538818, "epoch": 6.195448356350904, "grad_norm": 1.3828125, "learning_rate": 0.00019441033760148337, "loss": 4.6136, "mean_token_accuracy": 0.24343781769275666, "num_tokens": 138106884.0, "step": 79630 }, { "entropy": 5.3677996635437015, "epoch": 6.195837385722622, "grad_norm": 1.3671875, "learning_rate": 0.00019438446144425493, "loss": 4.6326, "mean_token_accuracy": 0.2453823834657669, "num_tokens": 138115350.0, "step": 79635 }, { "entropy": 5.408381366729737, "epoch": 6.19622641509434, "grad_norm": 1.2421875, "learning_rate": 0.00019435858651023892, "loss": 4.7098, "mean_token_accuracy": 0.24581923633813857, "num_tokens": 138124315.0, "step": 79640 }, { "entropy": 5.36551342010498, "epoch": 6.196615444466057, "grad_norm": 1.375, "learning_rate": 0.00019433271279982795, "loss": 4.5971, "mean_token_accuracy": 0.24363201707601548, "num_tokens": 138132534.0, "step": 79645 }, { "entropy": 5.252813053131104, "epoch": 6.197004473837775, "grad_norm": 1.2578125, "learning_rate": 0.0001943068403134147, "loss": 4.5615, "mean_token_accuracy": 0.24849214106798173, "num_tokens": 138141040.0, "step": 79650 }, { "entropy": 5.315002870559693, "epoch": 6.197393503209493, "grad_norm": 1.265625, "learning_rate": 0.00019428096905139175, "loss": 4.6091, "mean_token_accuracy": 0.2416517272591591, "num_tokens": 138149934.0, "step": 79655 }, { "entropy": 5.450355482101441, "epoch": 6.1977825325812095, "grad_norm": 1.3203125, "learning_rate": 0.00019425509901415162, "loss": 4.7696, "mean_token_accuracy": 0.2297012209892273, "num_tokens": 138158455.0, "step": 79660 }, { "entropy": 5.407970333099366, "epoch": 6.198171561952927, "grad_norm": 1.4140625, "learning_rate": 0.00019422923020208688, "loss": 4.6009, "mean_token_accuracy": 0.24301806688308716, "num_tokens": 138167121.0, "step": 79665 }, { "entropy": 5.4395670890808105, "epoch": 6.198560591324645, "grad_norm": 1.3828125, "learning_rate": 0.00019420336261558995, "loss": 4.7238, "mean_token_accuracy": 0.23100040405988692, "num_tokens": 138176545.0, "step": 79670 }, { "entropy": 5.395820093154907, "epoch": 6.198949620696363, "grad_norm": 1.421875, "learning_rate": 0.00019417749625505343, "loss": 4.6299, "mean_token_accuracy": 0.24387394040822982, "num_tokens": 138184320.0, "step": 79675 }, { "entropy": 5.43826813697815, "epoch": 6.19933865006808, "grad_norm": 1.2734375, "learning_rate": 0.00019415163112086975, "loss": 4.7461, "mean_token_accuracy": 0.23201263099908828, "num_tokens": 138193374.0, "step": 79680 }, { "entropy": 5.426840925216675, "epoch": 6.199727679439798, "grad_norm": 1.4140625, "learning_rate": 0.00019412576721343134, "loss": 4.6503, "mean_token_accuracy": 0.2419420674443245, "num_tokens": 138201652.0, "step": 79685 }, { "entropy": 5.349707221984863, "epoch": 6.200116708811516, "grad_norm": 1.34375, "learning_rate": 0.00019409990453313076, "loss": 4.5937, "mean_token_accuracy": 0.2412685662508011, "num_tokens": 138211520.0, "step": 79690 }, { "entropy": 5.464655447006225, "epoch": 6.2005057381832325, "grad_norm": 1.34375, "learning_rate": 0.0001940740430803603, "loss": 4.7451, "mean_token_accuracy": 0.23529671132564545, "num_tokens": 138219964.0, "step": 79695 }, { "entropy": 5.324163436889648, "epoch": 6.20089476755495, "grad_norm": 1.3671875, "learning_rate": 0.00019404818285551252, "loss": 4.6781, "mean_token_accuracy": 0.2403939202427864, "num_tokens": 138228636.0, "step": 79700 }, { "entropy": 5.337571430206299, "epoch": 6.201283796926668, "grad_norm": 1.28125, "learning_rate": 0.0001940223238589796, "loss": 4.661, "mean_token_accuracy": 0.2322801023721695, "num_tokens": 138237557.0, "step": 79705 }, { "entropy": 5.388698101043701, "epoch": 6.201672826298386, "grad_norm": 1.328125, "learning_rate": 0.00019399646609115408, "loss": 4.6627, "mean_token_accuracy": 0.23783407360315323, "num_tokens": 138245790.0, "step": 79710 }, { "entropy": 5.502856063842773, "epoch": 6.202061855670103, "grad_norm": 1.40625, "learning_rate": 0.00019397060955242824, "loss": 4.7281, "mean_token_accuracy": 0.23926471322774887, "num_tokens": 138253926.0, "step": 79715 }, { "entropy": 5.366575860977173, "epoch": 6.202450885041821, "grad_norm": 1.359375, "learning_rate": 0.00019394475424319442, "loss": 4.681, "mean_token_accuracy": 0.23168591409921646, "num_tokens": 138262267.0, "step": 79720 }, { "entropy": 5.3291308879852295, "epoch": 6.202839914413538, "grad_norm": 1.359375, "learning_rate": 0.00019391890016384495, "loss": 4.6295, "mean_token_accuracy": 0.23911878764629363, "num_tokens": 138271667.0, "step": 79725 }, { "entropy": 5.377816820144654, "epoch": 6.2032289437852555, "grad_norm": 1.2109375, "learning_rate": 0.00019389304731477213, "loss": 4.5984, "mean_token_accuracy": 0.2513256996870041, "num_tokens": 138280548.0, "step": 79730 }, { "entropy": 5.479285144805909, "epoch": 6.203617973156973, "grad_norm": 1.1875, "learning_rate": 0.00019386719569636823, "loss": 4.6855, "mean_token_accuracy": 0.2388111963868141, "num_tokens": 138288950.0, "step": 79735 }, { "entropy": 5.445222854614258, "epoch": 6.204007002528691, "grad_norm": 1.1796875, "learning_rate": 0.00019384134530902553, "loss": 4.8147, "mean_token_accuracy": 0.22782792448997496, "num_tokens": 138297998.0, "step": 79740 }, { "entropy": 5.412259531021118, "epoch": 6.204396031900409, "grad_norm": 1.3046875, "learning_rate": 0.0001938154961531362, "loss": 4.6403, "mean_token_accuracy": 0.2391327440738678, "num_tokens": 138306518.0, "step": 79745 }, { "entropy": 5.422231960296631, "epoch": 6.204785061272126, "grad_norm": 1.1953125, "learning_rate": 0.0001937896482290925, "loss": 4.6543, "mean_token_accuracy": 0.23523647487163543, "num_tokens": 138315783.0, "step": 79750 }, { "entropy": 5.4698422908782955, "epoch": 6.205174090643844, "grad_norm": 1.3984375, "learning_rate": 0.00019376380153728667, "loss": 4.7056, "mean_token_accuracy": 0.23454420119524003, "num_tokens": 138323993.0, "step": 79755 }, { "entropy": 5.441685533523559, "epoch": 6.205563120015561, "grad_norm": 1.28125, "learning_rate": 0.00019373795607811078, "loss": 4.7067, "mean_token_accuracy": 0.2368060380220413, "num_tokens": 138333158.0, "step": 79760 }, { "entropy": 5.351660966873169, "epoch": 6.2059521493872785, "grad_norm": 1.4296875, "learning_rate": 0.00019371211185195708, "loss": 4.6309, "mean_token_accuracy": 0.2397200807929039, "num_tokens": 138341430.0, "step": 79765 }, { "entropy": 5.399773263931275, "epoch": 6.206341178758996, "grad_norm": 1.34375, "learning_rate": 0.0001936862688592177, "loss": 4.7283, "mean_token_accuracy": 0.23391542136669158, "num_tokens": 138350299.0, "step": 79770 }, { "entropy": 5.405533313751221, "epoch": 6.206730208130714, "grad_norm": 1.234375, "learning_rate": 0.0001936604271002848, "loss": 4.6147, "mean_token_accuracy": 0.24709745049476622, "num_tokens": 138359500.0, "step": 79775 }, { "entropy": 5.380837249755859, "epoch": 6.2071192375024316, "grad_norm": 1.3671875, "learning_rate": 0.00019363458657555038, "loss": 4.5734, "mean_token_accuracy": 0.24708219468593598, "num_tokens": 138367919.0, "step": 79780 }, { "entropy": 5.337766790390015, "epoch": 6.207508266874149, "grad_norm": 1.359375, "learning_rate": 0.00019360874728540668, "loss": 4.5418, "mean_token_accuracy": 0.24348196834325792, "num_tokens": 138376196.0, "step": 79785 }, { "entropy": 5.297143173217774, "epoch": 6.207897296245867, "grad_norm": 1.234375, "learning_rate": 0.00019358290923024562, "loss": 4.6134, "mean_token_accuracy": 0.23904112875461578, "num_tokens": 138385719.0, "step": 79790 }, { "entropy": 5.453077602386474, "epoch": 6.208286325617584, "grad_norm": 1.28125, "learning_rate": 0.0001935570724104594, "loss": 4.7058, "mean_token_accuracy": 0.2348807469010353, "num_tokens": 138394035.0, "step": 79795 }, { "entropy": 5.371989297866821, "epoch": 6.2086753549893015, "grad_norm": 1.484375, "learning_rate": 0.00019353123682643998, "loss": 4.5695, "mean_token_accuracy": 0.24460267275571823, "num_tokens": 138401838.0, "step": 79800 }, { "entropy": 5.36424708366394, "epoch": 6.209064384361019, "grad_norm": 1.3203125, "learning_rate": 0.00019350540247857928, "loss": 4.6086, "mean_token_accuracy": 0.2410960853099823, "num_tokens": 138410191.0, "step": 79805 }, { "entropy": 5.355542898178101, "epoch": 6.209453413732737, "grad_norm": 1.3359375, "learning_rate": 0.00019347956936726946, "loss": 4.6172, "mean_token_accuracy": 0.2405377671122551, "num_tokens": 138418426.0, "step": 79810 }, { "entropy": 5.351362657546997, "epoch": 6.2098424431044545, "grad_norm": 1.3203125, "learning_rate": 0.0001934537374929024, "loss": 4.624, "mean_token_accuracy": 0.2394194096326828, "num_tokens": 138426208.0, "step": 79815 }, { "entropy": 5.265998506546021, "epoch": 6.210231472476172, "grad_norm": 1.28125, "learning_rate": 0.00019342790685587008, "loss": 4.5232, "mean_token_accuracy": 0.2580756083130836, "num_tokens": 138435187.0, "step": 79820 }, { "entropy": 5.340147161483765, "epoch": 6.21062050184789, "grad_norm": 1.34375, "learning_rate": 0.0001934020774565645, "loss": 4.6525, "mean_token_accuracy": 0.24407271295785904, "num_tokens": 138443721.0, "step": 79825 }, { "entropy": 5.463840627670288, "epoch": 6.211009531219607, "grad_norm": 1.3125, "learning_rate": 0.0001933762492953775, "loss": 4.7334, "mean_token_accuracy": 0.23506601452827453, "num_tokens": 138451813.0, "step": 79830 }, { "entropy": 5.35977463722229, "epoch": 6.2113985605913244, "grad_norm": 1.3125, "learning_rate": 0.00019335042237270095, "loss": 4.6287, "mean_token_accuracy": 0.23949581682682036, "num_tokens": 138460235.0, "step": 79835 }, { "entropy": 5.327545833587647, "epoch": 6.211787589963042, "grad_norm": 1.3515625, "learning_rate": 0.00019332459668892676, "loss": 4.567, "mean_token_accuracy": 0.24725427031517028, "num_tokens": 138468796.0, "step": 79840 }, { "entropy": 5.351621961593628, "epoch": 6.21217661933476, "grad_norm": 1.296875, "learning_rate": 0.00019329877224444675, "loss": 4.6142, "mean_token_accuracy": 0.23658262193202972, "num_tokens": 138477343.0, "step": 79845 }, { "entropy": 5.427374315261841, "epoch": 6.2125656487064775, "grad_norm": 1.265625, "learning_rate": 0.0001932729490396529, "loss": 4.7385, "mean_token_accuracy": 0.2314409926533699, "num_tokens": 138486471.0, "step": 79850 }, { "entropy": 5.425639820098877, "epoch": 6.212954678078195, "grad_norm": 1.359375, "learning_rate": 0.00019324712707493707, "loss": 4.6545, "mean_token_accuracy": 0.2411415159702301, "num_tokens": 138495164.0, "step": 79855 }, { "entropy": 5.467065763473511, "epoch": 6.213343707449912, "grad_norm": 1.2890625, "learning_rate": 0.0001932213063506909, "loss": 4.716, "mean_token_accuracy": 0.24003915786743163, "num_tokens": 138503339.0, "step": 79860 }, { "entropy": 5.417418193817139, "epoch": 6.21373273682163, "grad_norm": 1.3671875, "learning_rate": 0.00019319548686730625, "loss": 4.6534, "mean_token_accuracy": 0.24243364185094834, "num_tokens": 138512115.0, "step": 79865 }, { "entropy": 5.360242557525635, "epoch": 6.214121766193347, "grad_norm": 1.3046875, "learning_rate": 0.00019316966862517482, "loss": 4.5965, "mean_token_accuracy": 0.24542619436979293, "num_tokens": 138520710.0, "step": 79870 }, { "entropy": 5.3844828605651855, "epoch": 6.214510795565065, "grad_norm": 1.3125, "learning_rate": 0.0001931438516246885, "loss": 4.6699, "mean_token_accuracy": 0.24177227318286895, "num_tokens": 138528989.0, "step": 79875 }, { "entropy": 5.376661109924316, "epoch": 6.214899824936783, "grad_norm": 1.1171875, "learning_rate": 0.0001931180358662389, "loss": 4.6739, "mean_token_accuracy": 0.2335123211145401, "num_tokens": 138537920.0, "step": 79880 }, { "entropy": 5.43037223815918, "epoch": 6.2152888543085005, "grad_norm": 1.21875, "learning_rate": 0.00019309222135021776, "loss": 4.6376, "mean_token_accuracy": 0.2388914242386818, "num_tokens": 138546516.0, "step": 79885 }, { "entropy": 5.431724500656128, "epoch": 6.215677883680218, "grad_norm": 1.296875, "learning_rate": 0.0001930664080770168, "loss": 4.7276, "mean_token_accuracy": 0.2335727334022522, "num_tokens": 138555262.0, "step": 79890 }, { "entropy": 5.431961393356323, "epoch": 6.216066913051935, "grad_norm": 1.359375, "learning_rate": 0.00019304059604702772, "loss": 4.6901, "mean_token_accuracy": 0.2328224927186966, "num_tokens": 138563773.0, "step": 79895 }, { "entropy": 5.4424591064453125, "epoch": 6.216455942423653, "grad_norm": 1.2890625, "learning_rate": 0.00019301478526064213, "loss": 4.7198, "mean_token_accuracy": 0.23592216670513153, "num_tokens": 138572298.0, "step": 79900 }, { "entropy": 5.420798063278198, "epoch": 6.21684497179537, "grad_norm": 1.375, "learning_rate": 0.00019298897571825175, "loss": 4.7522, "mean_token_accuracy": 0.22739098072052003, "num_tokens": 138580951.0, "step": 79905 }, { "entropy": 5.304519462585449, "epoch": 6.217234001167088, "grad_norm": 1.2890625, "learning_rate": 0.00019296316742024806, "loss": 4.5423, "mean_token_accuracy": 0.2525974214076996, "num_tokens": 138589069.0, "step": 79910 }, { "entropy": 5.404778671264649, "epoch": 6.217623030538806, "grad_norm": 1.2265625, "learning_rate": 0.00019293736036702259, "loss": 4.6902, "mean_token_accuracy": 0.2397646948695183, "num_tokens": 138597955.0, "step": 79915 }, { "entropy": 5.350574588775634, "epoch": 6.2180120599105235, "grad_norm": 1.4453125, "learning_rate": 0.0001929115545589672, "loss": 4.5852, "mean_token_accuracy": 0.24022107124328612, "num_tokens": 138606168.0, "step": 79920 }, { "entropy": 5.365299034118652, "epoch": 6.218401089282241, "grad_norm": 1.3359375, "learning_rate": 0.0001928857499964733, "loss": 4.6614, "mean_token_accuracy": 0.23673480600118638, "num_tokens": 138615004.0, "step": 79925 }, { "entropy": 5.365364360809326, "epoch": 6.218790118653958, "grad_norm": 1.2890625, "learning_rate": 0.00019285994667993245, "loss": 4.6523, "mean_token_accuracy": 0.24387177973985671, "num_tokens": 138623994.0, "step": 79930 }, { "entropy": 5.426820755004883, "epoch": 6.219179148025676, "grad_norm": 1.390625, "learning_rate": 0.00019283414460973626, "loss": 4.6674, "mean_token_accuracy": 0.23529060035943986, "num_tokens": 138632387.0, "step": 79935 }, { "entropy": 5.462334251403808, "epoch": 6.219568177397393, "grad_norm": 1.4140625, "learning_rate": 0.00019280834378627605, "loss": 4.6766, "mean_token_accuracy": 0.23831190168857574, "num_tokens": 138640826.0, "step": 79940 }, { "entropy": 5.404705047607422, "epoch": 6.219957206769111, "grad_norm": 1.1640625, "learning_rate": 0.0001927825442099434, "loss": 4.6469, "mean_token_accuracy": 0.24509579986333846, "num_tokens": 138649993.0, "step": 79945 }, { "entropy": 5.278166151046753, "epoch": 6.220346236140829, "grad_norm": 1.2734375, "learning_rate": 0.0001927567458811298, "loss": 4.5293, "mean_token_accuracy": 0.2563353955745697, "num_tokens": 138659305.0, "step": 79950 }, { "entropy": 5.3453442573547365, "epoch": 6.2207352655125465, "grad_norm": 1.421875, "learning_rate": 0.00019273094880022662, "loss": 4.6343, "mean_token_accuracy": 0.2367136910557747, "num_tokens": 138667889.0, "step": 79955 }, { "entropy": 5.426275682449341, "epoch": 6.221124294884264, "grad_norm": 1.3671875, "learning_rate": 0.00019270515296762543, "loss": 4.6887, "mean_token_accuracy": 0.23379596173763276, "num_tokens": 138675819.0, "step": 79960 }, { "entropy": 5.467107772827148, "epoch": 6.221513324255981, "grad_norm": 1.3125, "learning_rate": 0.00019267935838371752, "loss": 4.6757, "mean_token_accuracy": 0.23296771049499512, "num_tokens": 138684049.0, "step": 79965 }, { "entropy": 5.390197372436523, "epoch": 6.221902353627699, "grad_norm": 1.375, "learning_rate": 0.0001926535650488943, "loss": 4.6354, "mean_token_accuracy": 0.23491803854703902, "num_tokens": 138692778.0, "step": 79970 }, { "entropy": 5.372357749938965, "epoch": 6.222291382999416, "grad_norm": 1.3359375, "learning_rate": 0.0001926277729635472, "loss": 4.6492, "mean_token_accuracy": 0.2371863067150116, "num_tokens": 138701440.0, "step": 79975 }, { "entropy": 5.4828802108764645, "epoch": 6.222680412371134, "grad_norm": 1.328125, "learning_rate": 0.00019260198212806747, "loss": 4.6819, "mean_token_accuracy": 0.23703991770744323, "num_tokens": 138710145.0, "step": 79980 }, { "entropy": 5.425070428848267, "epoch": 6.223069441742852, "grad_norm": 1.1640625, "learning_rate": 0.0001925761925428466, "loss": 4.7237, "mean_token_accuracy": 0.24031783193349837, "num_tokens": 138719644.0, "step": 79985 }, { "entropy": 5.445164155960083, "epoch": 6.2234584711145695, "grad_norm": 1.328125, "learning_rate": 0.00019255040420827576, "loss": 4.6877, "mean_token_accuracy": 0.23490922152996063, "num_tokens": 138728089.0, "step": 79990 }, { "entropy": 5.422434520721436, "epoch": 6.223847500486286, "grad_norm": 1.2734375, "learning_rate": 0.00019252461712474629, "loss": 4.6771, "mean_token_accuracy": 0.23843155801296234, "num_tokens": 138736948.0, "step": 79995 }, { "entropy": 5.410606813430786, "epoch": 6.224236529858004, "grad_norm": 1.3828125, "learning_rate": 0.0001924988312926495, "loss": 4.7362, "mean_token_accuracy": 0.2325963333249092, "num_tokens": 138745897.0, "step": 80000 }, { "entropy": 5.452065467834473, "epoch": 6.224625559229722, "grad_norm": 1.203125, "learning_rate": 0.00019247304671237664, "loss": 4.767, "mean_token_accuracy": 0.22549825310707092, "num_tokens": 138755814.0, "step": 80005 }, { "entropy": 5.431494569778442, "epoch": 6.225014588601439, "grad_norm": 1.3125, "learning_rate": 0.00019244726338431896, "loss": 4.6776, "mean_token_accuracy": 0.2380765274167061, "num_tokens": 138764910.0, "step": 80010 }, { "entropy": 5.36698579788208, "epoch": 6.225403617973157, "grad_norm": 1.34375, "learning_rate": 0.00019242148130886773, "loss": 4.5878, "mean_token_accuracy": 0.24124503284692764, "num_tokens": 138772901.0, "step": 80015 }, { "entropy": 5.358956527709961, "epoch": 6.225792647344875, "grad_norm": 1.3515625, "learning_rate": 0.00019239570048641398, "loss": 4.6123, "mean_token_accuracy": 0.2508848637342453, "num_tokens": 138781219.0, "step": 80020 }, { "entropy": 5.392642545700073, "epoch": 6.2261816767165925, "grad_norm": 1.3828125, "learning_rate": 0.000192369920917349, "loss": 4.7079, "mean_token_accuracy": 0.23904809802770616, "num_tokens": 138789359.0, "step": 80025 }, { "entropy": 5.389347696304322, "epoch": 6.226570706088309, "grad_norm": 1.2890625, "learning_rate": 0.000192344142602064, "loss": 4.6831, "mean_token_accuracy": 0.23707407265901564, "num_tokens": 138798375.0, "step": 80030 }, { "entropy": 5.396453809738159, "epoch": 6.226959735460027, "grad_norm": 1.3203125, "learning_rate": 0.00019231836554095, "loss": 4.66, "mean_token_accuracy": 0.24134524315595626, "num_tokens": 138807358.0, "step": 80035 }, { "entropy": 5.3784623622894285, "epoch": 6.227348764831745, "grad_norm": 1.2265625, "learning_rate": 0.00019229258973439827, "loss": 4.6511, "mean_token_accuracy": 0.23737898766994475, "num_tokens": 138816109.0, "step": 80040 }, { "entropy": 5.380625915527344, "epoch": 6.227737794203462, "grad_norm": 1.328125, "learning_rate": 0.00019226681518279975, "loss": 4.6622, "mean_token_accuracy": 0.22804000079631806, "num_tokens": 138824613.0, "step": 80045 }, { "entropy": 5.414347457885742, "epoch": 6.22812682357518, "grad_norm": 1.421875, "learning_rate": 0.00019224104188654572, "loss": 4.6284, "mean_token_accuracy": 0.23702718764543534, "num_tokens": 138832516.0, "step": 80050 }, { "entropy": 5.402330684661865, "epoch": 6.228515852946898, "grad_norm": 1.3125, "learning_rate": 0.00019221526984602717, "loss": 4.6244, "mean_token_accuracy": 0.24230293482542037, "num_tokens": 138841690.0, "step": 80055 }, { "entropy": 5.361441802978516, "epoch": 6.228904882318615, "grad_norm": 1.34375, "learning_rate": 0.0001921894990616351, "loss": 4.612, "mean_token_accuracy": 0.23755445778369905, "num_tokens": 138850045.0, "step": 80060 }, { "entropy": 5.352422094345092, "epoch": 6.229293911690332, "grad_norm": 1.296875, "learning_rate": 0.00019216372953376055, "loss": 4.6746, "mean_token_accuracy": 0.23036280125379563, "num_tokens": 138858878.0, "step": 80065 }, { "entropy": 5.36416711807251, "epoch": 6.22968294106205, "grad_norm": 1.3359375, "learning_rate": 0.0001921379612627946, "loss": 4.6478, "mean_token_accuracy": 0.2341684579849243, "num_tokens": 138866956.0, "step": 80070 }, { "entropy": 5.438803577423096, "epoch": 6.230071970433768, "grad_norm": 1.2578125, "learning_rate": 0.00019211219424912818, "loss": 4.746, "mean_token_accuracy": 0.23682404905557633, "num_tokens": 138876097.0, "step": 80075 }, { "entropy": 5.387078952789307, "epoch": 6.230460999805485, "grad_norm": 1.25, "learning_rate": 0.0001920864284931523, "loss": 4.6457, "mean_token_accuracy": 0.24215710759162903, "num_tokens": 138884721.0, "step": 80080 }, { "entropy": 5.467601776123047, "epoch": 6.230850029177203, "grad_norm": 1.375, "learning_rate": 0.00019206066399525784, "loss": 4.7297, "mean_token_accuracy": 0.2294338807463646, "num_tokens": 138893243.0, "step": 80085 }, { "entropy": 5.428174734115601, "epoch": 6.231239058548921, "grad_norm": 1.265625, "learning_rate": 0.00019203490075583586, "loss": 4.6676, "mean_token_accuracy": 0.23627914637327194, "num_tokens": 138901621.0, "step": 80090 }, { "entropy": 5.441163158416748, "epoch": 6.231628087920638, "grad_norm": 1.34375, "learning_rate": 0.0001920091387752772, "loss": 4.6927, "mean_token_accuracy": 0.23248979896306993, "num_tokens": 138910807.0, "step": 80095 }, { "entropy": 5.4242078304290775, "epoch": 6.232017117292355, "grad_norm": 1.3671875, "learning_rate": 0.00019198337805397282, "loss": 4.6373, "mean_token_accuracy": 0.23331674486398696, "num_tokens": 138919202.0, "step": 80100 }, { "entropy": 5.4012044906616214, "epoch": 6.232406146664073, "grad_norm": 1.2421875, "learning_rate": 0.00019195761859231342, "loss": 4.7971, "mean_token_accuracy": 0.2282021388411522, "num_tokens": 138928711.0, "step": 80105 }, { "entropy": 5.334251880645752, "epoch": 6.232795176035791, "grad_norm": 1.1875, "learning_rate": 0.00019193186039068993, "loss": 4.5859, "mean_token_accuracy": 0.242653751373291, "num_tokens": 138938023.0, "step": 80110 }, { "entropy": 5.415680170059204, "epoch": 6.233184205407508, "grad_norm": 1.3125, "learning_rate": 0.00019190610344949337, "loss": 4.6906, "mean_token_accuracy": 0.24405065774917603, "num_tokens": 138946216.0, "step": 80115 }, { "entropy": 5.405815649032593, "epoch": 6.233573234779226, "grad_norm": 1.328125, "learning_rate": 0.00019188034776911438, "loss": 4.6735, "mean_token_accuracy": 0.24194093495607377, "num_tokens": 138954749.0, "step": 80120 }, { "entropy": 5.415266990661621, "epoch": 6.233962264150944, "grad_norm": 1.2578125, "learning_rate": 0.00019185459334994387, "loss": 4.6752, "mean_token_accuracy": 0.23676856607198715, "num_tokens": 138964064.0, "step": 80125 }, { "entropy": 5.377191543579102, "epoch": 6.234351293522661, "grad_norm": 1.328125, "learning_rate": 0.00019182884019237258, "loss": 4.6957, "mean_token_accuracy": 0.24328095763921737, "num_tokens": 138973156.0, "step": 80130 }, { "entropy": 5.381244087219239, "epoch": 6.234740322894378, "grad_norm": 1.375, "learning_rate": 0.0001918030882967912, "loss": 4.6344, "mean_token_accuracy": 0.24285353273153304, "num_tokens": 138981307.0, "step": 80135 }, { "entropy": 5.347476863861084, "epoch": 6.235129352266096, "grad_norm": 1.25, "learning_rate": 0.00019177733766359057, "loss": 4.5991, "mean_token_accuracy": 0.24503027498722077, "num_tokens": 138990537.0, "step": 80140 }, { "entropy": 5.397099256515503, "epoch": 6.235518381637814, "grad_norm": 1.4296875, "learning_rate": 0.00019175158829316135, "loss": 4.6059, "mean_token_accuracy": 0.24933990836143494, "num_tokens": 138999740.0, "step": 80145 }, { "entropy": 5.268996715545654, "epoch": 6.235907411009531, "grad_norm": 1.2578125, "learning_rate": 0.00019172584018589429, "loss": 4.587, "mean_token_accuracy": 0.23901741057634354, "num_tokens": 139008257.0, "step": 80150 }, { "entropy": 5.342515373229981, "epoch": 6.236296440381249, "grad_norm": 1.296875, "learning_rate": 0.00019170009334218004, "loss": 4.6657, "mean_token_accuracy": 0.2384684920310974, "num_tokens": 139017386.0, "step": 80155 }, { "entropy": 5.385322189331054, "epoch": 6.236685469752967, "grad_norm": 1.3828125, "learning_rate": 0.00019167434776240933, "loss": 4.645, "mean_token_accuracy": 0.24339460581541061, "num_tokens": 139025579.0, "step": 80160 }, { "entropy": 5.32856330871582, "epoch": 6.237074499124684, "grad_norm": 1.3515625, "learning_rate": 0.00019164860344697272, "loss": 4.5721, "mean_token_accuracy": 0.24736848026514052, "num_tokens": 139033753.0, "step": 80165 }, { "entropy": 5.384770154953003, "epoch": 6.237463528496401, "grad_norm": 1.28125, "learning_rate": 0.00019162286039626093, "loss": 4.6895, "mean_token_accuracy": 0.24098296761512755, "num_tokens": 139043217.0, "step": 80170 }, { "entropy": 5.432442903518677, "epoch": 6.237852557868119, "grad_norm": 1.3046875, "learning_rate": 0.00019159711861066453, "loss": 4.7237, "mean_token_accuracy": 0.2292504593729973, "num_tokens": 139051872.0, "step": 80175 }, { "entropy": 5.47056884765625, "epoch": 6.238241587239837, "grad_norm": 1.359375, "learning_rate": 0.000191571378090574, "loss": 4.7545, "mean_token_accuracy": 0.22625083923339845, "num_tokens": 139060402.0, "step": 80180 }, { "entropy": 5.4540447235107425, "epoch": 6.238630616611554, "grad_norm": 1.234375, "learning_rate": 0.0001915456388363801, "loss": 4.7254, "mean_token_accuracy": 0.236455500125885, "num_tokens": 139069189.0, "step": 80185 }, { "entropy": 5.374243831634521, "epoch": 6.239019645983272, "grad_norm": 1.3203125, "learning_rate": 0.0001915199008484733, "loss": 4.6412, "mean_token_accuracy": 0.23824235200881957, "num_tokens": 139078596.0, "step": 80190 }, { "entropy": 5.384951114654541, "epoch": 6.239408675354989, "grad_norm": 1.3671875, "learning_rate": 0.00019149416412724414, "loss": 4.6453, "mean_token_accuracy": 0.23983217477798463, "num_tokens": 139087108.0, "step": 80195 }, { "entropy": 5.435272169113159, "epoch": 6.239797704726707, "grad_norm": 1.3515625, "learning_rate": 0.00019146842867308306, "loss": 4.7552, "mean_token_accuracy": 0.23350372165441513, "num_tokens": 139095484.0, "step": 80200 }, { "entropy": 5.505098867416382, "epoch": 6.240186734098424, "grad_norm": 1.3828125, "learning_rate": 0.00019144269448638073, "loss": 4.7535, "mean_token_accuracy": 0.23539184778928757, "num_tokens": 139104261.0, "step": 80205 }, { "entropy": 5.365941381454467, "epoch": 6.240575763470142, "grad_norm": 1.5, "learning_rate": 0.00019141696156752748, "loss": 4.6413, "mean_token_accuracy": 0.2406003639101982, "num_tokens": 139112466.0, "step": 80210 }, { "entropy": 5.343252038955688, "epoch": 6.24096479284186, "grad_norm": 1.2421875, "learning_rate": 0.00019139122991691378, "loss": 4.6096, "mean_token_accuracy": 0.2436447873711586, "num_tokens": 139121077.0, "step": 80215 }, { "entropy": 5.386625671386719, "epoch": 6.241353822213577, "grad_norm": 1.3828125, "learning_rate": 0.0001913654995349301, "loss": 4.6233, "mean_token_accuracy": 0.24164265394210815, "num_tokens": 139129224.0, "step": 80220 }, { "entropy": 5.56432695388794, "epoch": 6.241742851585295, "grad_norm": 1.2265625, "learning_rate": 0.00019133977042196682, "loss": 4.7861, "mean_token_accuracy": 0.22455255687236786, "num_tokens": 139137418.0, "step": 80225 }, { "entropy": 5.368259572982788, "epoch": 6.242131880957012, "grad_norm": 1.1875, "learning_rate": 0.0001913140425784144, "loss": 4.5903, "mean_token_accuracy": 0.24392179250717164, "num_tokens": 139146286.0, "step": 80230 }, { "entropy": 5.314634990692139, "epoch": 6.24252091032873, "grad_norm": 1.3046875, "learning_rate": 0.00019128831600466313, "loss": 4.5464, "mean_token_accuracy": 0.2463858738541603, "num_tokens": 139154745.0, "step": 80235 }, { "entropy": 5.353270196914673, "epoch": 6.242909939700447, "grad_norm": 1.2890625, "learning_rate": 0.00019126259070110347, "loss": 4.754, "mean_token_accuracy": 0.23059714287519456, "num_tokens": 139163563.0, "step": 80240 }, { "entropy": 5.390217256546021, "epoch": 6.243298969072165, "grad_norm": 1.1796875, "learning_rate": 0.00019123686666812562, "loss": 4.6684, "mean_token_accuracy": 0.24012877196073532, "num_tokens": 139171964.0, "step": 80245 }, { "entropy": 5.35038275718689, "epoch": 6.243687998443883, "grad_norm": 1.4296875, "learning_rate": 0.0001912111439061201, "loss": 4.5338, "mean_token_accuracy": 0.24900649338960648, "num_tokens": 139180673.0, "step": 80250 }, { "entropy": 5.408588123321533, "epoch": 6.2440770278156, "grad_norm": 1.4765625, "learning_rate": 0.0001911854224154771, "loss": 4.6378, "mean_token_accuracy": 0.23947800993919371, "num_tokens": 139189815.0, "step": 80255 }, { "entropy": 5.403171682357788, "epoch": 6.244466057187318, "grad_norm": 1.3359375, "learning_rate": 0.0001911597021965869, "loss": 4.6539, "mean_token_accuracy": 0.2397583693265915, "num_tokens": 139197852.0, "step": 80260 }, { "entropy": 5.398620080947876, "epoch": 6.244855086559035, "grad_norm": 1.375, "learning_rate": 0.00019113398324983972, "loss": 4.6274, "mean_token_accuracy": 0.24101149737834932, "num_tokens": 139206752.0, "step": 80265 }, { "entropy": 5.386550951004028, "epoch": 6.245244115930753, "grad_norm": 1.2890625, "learning_rate": 0.00019110826557562594, "loss": 4.6185, "mean_token_accuracy": 0.23750204890966414, "num_tokens": 139215686.0, "step": 80270 }, { "entropy": 5.33972134590149, "epoch": 6.24563314530247, "grad_norm": 1.2265625, "learning_rate": 0.00019108254917433564, "loss": 4.5515, "mean_token_accuracy": 0.23720190525054932, "num_tokens": 139224680.0, "step": 80275 }, { "entropy": 5.357876348495483, "epoch": 6.246022174674188, "grad_norm": 1.3125, "learning_rate": 0.00019105683404635915, "loss": 4.5749, "mean_token_accuracy": 0.24470401406288148, "num_tokens": 139233263.0, "step": 80280 }, { "entropy": 5.375097608566284, "epoch": 6.246411204045906, "grad_norm": 1.734375, "learning_rate": 0.00019103112019208662, "loss": 4.677, "mean_token_accuracy": 0.2349293276667595, "num_tokens": 139241970.0, "step": 80285 }, { "entropy": 5.407288694381714, "epoch": 6.246800233417623, "grad_norm": 1.421875, "learning_rate": 0.00019100540761190815, "loss": 4.6583, "mean_token_accuracy": 0.22442522794008254, "num_tokens": 139250634.0, "step": 80290 }, { "entropy": 5.454122114181518, "epoch": 6.24718926278934, "grad_norm": 1.3125, "learning_rate": 0.00019097969630621386, "loss": 4.7141, "mean_token_accuracy": 0.23517605364322663, "num_tokens": 139259473.0, "step": 80295 }, { "entropy": 5.367725801467896, "epoch": 6.247578292161058, "grad_norm": 1.3125, "learning_rate": 0.000190953986275394, "loss": 4.5974, "mean_token_accuracy": 0.24284541755914688, "num_tokens": 139268199.0, "step": 80300 }, { "entropy": 5.393930864334107, "epoch": 6.247967321532776, "grad_norm": 1.2578125, "learning_rate": 0.00019092827751983866, "loss": 4.7253, "mean_token_accuracy": 0.23260626941919327, "num_tokens": 139277130.0, "step": 80305 }, { "entropy": 5.400803279876709, "epoch": 6.248356350904493, "grad_norm": 1.2890625, "learning_rate": 0.0001909025700399377, "loss": 4.7084, "mean_token_accuracy": 0.23934050947427749, "num_tokens": 139285776.0, "step": 80310 }, { "entropy": 5.458319902420044, "epoch": 6.248745380276211, "grad_norm": 1.3359375, "learning_rate": 0.0001908768638360816, "loss": 4.7803, "mean_token_accuracy": 0.2337967962026596, "num_tokens": 139294796.0, "step": 80315 }, { "entropy": 5.504234457015992, "epoch": 6.249134409647929, "grad_norm": 1.3046875, "learning_rate": 0.00019085115890866018, "loss": 4.7262, "mean_token_accuracy": 0.23483271300792694, "num_tokens": 139303770.0, "step": 80320 }, { "entropy": 5.415128087997436, "epoch": 6.249523439019646, "grad_norm": 1.375, "learning_rate": 0.00019082545525806344, "loss": 4.5478, "mean_token_accuracy": 0.24559057056903838, "num_tokens": 139311298.0, "step": 80325 }, { "entropy": 5.414852952957153, "epoch": 6.249912468391363, "grad_norm": 1.3359375, "learning_rate": 0.00019079975288468142, "loss": 4.6416, "mean_token_accuracy": 0.24122584760189056, "num_tokens": 139319572.0, "step": 80330 }, { "entropy": 5.377610445022583, "epoch": 6.250301497763081, "grad_norm": 1.296875, "learning_rate": 0.00019077405178890417, "loss": 4.6439, "mean_token_accuracy": 0.2359106123447418, "num_tokens": 139327296.0, "step": 80335 }, { "entropy": 5.379631280899048, "epoch": 6.250690527134799, "grad_norm": 1.28125, "learning_rate": 0.00019074835197112162, "loss": 4.6763, "mean_token_accuracy": 0.23707904815673828, "num_tokens": 139336212.0, "step": 80340 }, { "entropy": 5.417950820922852, "epoch": 6.251079556506516, "grad_norm": 1.2734375, "learning_rate": 0.00019072265343172368, "loss": 4.6473, "mean_token_accuracy": 0.2485795646905899, "num_tokens": 139344538.0, "step": 80345 }, { "entropy": 5.397574329376221, "epoch": 6.251468585878234, "grad_norm": 1.328125, "learning_rate": 0.00019069695617110038, "loss": 4.5975, "mean_token_accuracy": 0.24355843663215637, "num_tokens": 139353205.0, "step": 80350 }, { "entropy": 5.296426105499267, "epoch": 6.251857615249952, "grad_norm": 1.34375, "learning_rate": 0.0001906712601896416, "loss": 4.5262, "mean_token_accuracy": 0.2529544472694397, "num_tokens": 139362205.0, "step": 80355 }, { "entropy": 5.495827531814575, "epoch": 6.252246644621669, "grad_norm": 1.2734375, "learning_rate": 0.0001906455654877372, "loss": 4.7365, "mean_token_accuracy": 0.22831109911203384, "num_tokens": 139369977.0, "step": 80360 }, { "entropy": 5.365428400039673, "epoch": 6.252635673993386, "grad_norm": 1.34375, "learning_rate": 0.00019061987206577712, "loss": 4.6598, "mean_token_accuracy": 0.2404581278562546, "num_tokens": 139378401.0, "step": 80365 }, { "entropy": 5.399304056167603, "epoch": 6.253024703365104, "grad_norm": 1.2734375, "learning_rate": 0.0001905941799241511, "loss": 4.6244, "mean_token_accuracy": 0.2493083357810974, "num_tokens": 139387651.0, "step": 80370 }, { "entropy": 5.439533758163452, "epoch": 6.2534137327368216, "grad_norm": 1.3671875, "learning_rate": 0.00019056848906324914, "loss": 4.7235, "mean_token_accuracy": 0.23571151047945021, "num_tokens": 139396428.0, "step": 80375 }, { "entropy": 5.405953121185303, "epoch": 6.253802762108539, "grad_norm": 1.3203125, "learning_rate": 0.0001905427994834608, "loss": 4.6203, "mean_token_accuracy": 0.24121590852737426, "num_tokens": 139405861.0, "step": 80380 }, { "entropy": 5.356570672988892, "epoch": 6.254191791480257, "grad_norm": 1.2734375, "learning_rate": 0.00019051711118517618, "loss": 4.6711, "mean_token_accuracy": 0.2392266035079956, "num_tokens": 139415403.0, "step": 80385 }, { "entropy": 5.386609888076782, "epoch": 6.254580820851975, "grad_norm": 1.328125, "learning_rate": 0.00019049142416878496, "loss": 4.6361, "mean_token_accuracy": 0.2461826503276825, "num_tokens": 139424360.0, "step": 80390 }, { "entropy": 5.356417465209961, "epoch": 6.2549698502236915, "grad_norm": 1.296875, "learning_rate": 0.00019046573843467684, "loss": 4.5616, "mean_token_accuracy": 0.24548180550336837, "num_tokens": 139432833.0, "step": 80395 }, { "entropy": 5.394099235534668, "epoch": 6.255358879595409, "grad_norm": 1.2890625, "learning_rate": 0.0001904400539832416, "loss": 4.6715, "mean_token_accuracy": 0.2481598824262619, "num_tokens": 139442715.0, "step": 80400 }, { "entropy": 5.470827245712281, "epoch": 6.255747908967127, "grad_norm": 1.4140625, "learning_rate": 0.00019041437081486896, "loss": 4.665, "mean_token_accuracy": 0.24230485856533052, "num_tokens": 139451179.0, "step": 80405 }, { "entropy": 5.369745540618896, "epoch": 6.2561369383388445, "grad_norm": 1.25, "learning_rate": 0.00019038868892994854, "loss": 4.6888, "mean_token_accuracy": 0.23095116317272185, "num_tokens": 139460286.0, "step": 80410 }, { "entropy": 5.431776809692383, "epoch": 6.256525967710562, "grad_norm": 1.2734375, "learning_rate": 0.00019036300832887015, "loss": 4.7018, "mean_token_accuracy": 0.23521775305271148, "num_tokens": 139468888.0, "step": 80415 }, { "entropy": 5.453109979629517, "epoch": 6.25691499708228, "grad_norm": 1.2734375, "learning_rate": 0.00019033732901202339, "loss": 4.6602, "mean_token_accuracy": 0.23661701679229735, "num_tokens": 139477123.0, "step": 80420 }, { "entropy": 5.423855257034302, "epoch": 6.257304026453998, "grad_norm": 1.2578125, "learning_rate": 0.0001903116509797979, "loss": 4.6417, "mean_token_accuracy": 0.23728996366262436, "num_tokens": 139486211.0, "step": 80425 }, { "entropy": 5.383970117568969, "epoch": 6.2576930558257144, "grad_norm": 1.3671875, "learning_rate": 0.0001902859742325833, "loss": 4.5875, "mean_token_accuracy": 0.25242227166891096, "num_tokens": 139495389.0, "step": 80430 }, { "entropy": 5.3530810356140135, "epoch": 6.258082085197432, "grad_norm": 1.34375, "learning_rate": 0.00019026029877076923, "loss": 4.5874, "mean_token_accuracy": 0.24760037213563918, "num_tokens": 139503649.0, "step": 80435 }, { "entropy": 5.389848279953003, "epoch": 6.25847111456915, "grad_norm": 1.328125, "learning_rate": 0.0001902346245947452, "loss": 4.7814, "mean_token_accuracy": 0.2215313196182251, "num_tokens": 139511679.0, "step": 80440 }, { "entropy": 5.384269189834595, "epoch": 6.2588601439408675, "grad_norm": 1.390625, "learning_rate": 0.00019020895170490082, "loss": 4.6092, "mean_token_accuracy": 0.24144149720668792, "num_tokens": 139520095.0, "step": 80445 }, { "entropy": 5.399913263320923, "epoch": 6.259249173312585, "grad_norm": 1.3671875, "learning_rate": 0.00019018328010162567, "loss": 4.6015, "mean_token_accuracy": 0.24492089748382567, "num_tokens": 139528955.0, "step": 80450 }, { "entropy": 5.394786834716797, "epoch": 6.259638202684303, "grad_norm": 1.4296875, "learning_rate": 0.00019015760978530926, "loss": 4.6633, "mean_token_accuracy": 0.24236784726381302, "num_tokens": 139536907.0, "step": 80455 }, { "entropy": 5.353962421417236, "epoch": 6.260027232056021, "grad_norm": 1.3046875, "learning_rate": 0.00019013194075634106, "loss": 4.6374, "mean_token_accuracy": 0.2408549204468727, "num_tokens": 139545500.0, "step": 80460 }, { "entropy": 5.438731908798218, "epoch": 6.260416261427737, "grad_norm": 1.3203125, "learning_rate": 0.00019010627301511057, "loss": 4.67, "mean_token_accuracy": 0.23069639950990678, "num_tokens": 139553877.0, "step": 80465 }, { "entropy": 5.386192655563354, "epoch": 6.260805290799455, "grad_norm": 1.265625, "learning_rate": 0.00019008060656200732, "loss": 4.5683, "mean_token_accuracy": 0.2467222183942795, "num_tokens": 139562504.0, "step": 80470 }, { "entropy": 5.435913944244385, "epoch": 6.261194320171173, "grad_norm": 1.421875, "learning_rate": 0.00019005494139742068, "loss": 4.7214, "mean_token_accuracy": 0.23638402074575424, "num_tokens": 139570969.0, "step": 80475 }, { "entropy": 5.397916555404663, "epoch": 6.2615833495428905, "grad_norm": 1.2421875, "learning_rate": 0.0001900292775217401, "loss": 4.6522, "mean_token_accuracy": 0.2320972502231598, "num_tokens": 139579615.0, "step": 80480 }, { "entropy": 5.388457012176514, "epoch": 6.261972378914608, "grad_norm": 1.40625, "learning_rate": 0.000190003614935355, "loss": 4.6128, "mean_token_accuracy": 0.24789093881845475, "num_tokens": 139587660.0, "step": 80485 }, { "entropy": 5.364661359786988, "epoch": 6.262361408286326, "grad_norm": 1.3046875, "learning_rate": 0.00018997795363865473, "loss": 4.6784, "mean_token_accuracy": 0.23412997275590897, "num_tokens": 139596822.0, "step": 80490 }, { "entropy": 5.465862226486206, "epoch": 6.262750437658044, "grad_norm": 1.25, "learning_rate": 0.0001899522936320287, "loss": 4.7171, "mean_token_accuracy": 0.23117563277482986, "num_tokens": 139605639.0, "step": 80495 }, { "entropy": 5.379311656951904, "epoch": 6.26313946702976, "grad_norm": 1.296875, "learning_rate": 0.0001899266349158662, "loss": 4.5879, "mean_token_accuracy": 0.24366039633750916, "num_tokens": 139614511.0, "step": 80500 }, { "entropy": 5.417331266403198, "epoch": 6.263528496401478, "grad_norm": 1.3984375, "learning_rate": 0.00018990097749055669, "loss": 4.6977, "mean_token_accuracy": 0.2411031022667885, "num_tokens": 139622856.0, "step": 80505 }, { "entropy": 5.33144474029541, "epoch": 6.263917525773196, "grad_norm": 1.3203125, "learning_rate": 0.00018987532135648926, "loss": 4.5647, "mean_token_accuracy": 0.2460334524512291, "num_tokens": 139631718.0, "step": 80510 }, { "entropy": 5.315123701095581, "epoch": 6.2643065551449135, "grad_norm": 1.359375, "learning_rate": 0.0001898496665140535, "loss": 4.564, "mean_token_accuracy": 0.24318933337926865, "num_tokens": 139640252.0, "step": 80515 }, { "entropy": 5.313232278823852, "epoch": 6.264695584516631, "grad_norm": 1.3515625, "learning_rate": 0.00018982401296363844, "loss": 4.63, "mean_token_accuracy": 0.23560360372066497, "num_tokens": 139649013.0, "step": 80520 }, { "entropy": 5.408234739303589, "epoch": 6.265084613888349, "grad_norm": 1.390625, "learning_rate": 0.00018979836070563339, "loss": 4.6446, "mean_token_accuracy": 0.2374725192785263, "num_tokens": 139658113.0, "step": 80525 }, { "entropy": 5.362346363067627, "epoch": 6.265473643260066, "grad_norm": 1.296875, "learning_rate": 0.00018977270974042764, "loss": 4.6271, "mean_token_accuracy": 0.24053695797920227, "num_tokens": 139666430.0, "step": 80530 }, { "entropy": 5.463942384719848, "epoch": 6.265862672631783, "grad_norm": 1.34375, "learning_rate": 0.00018974706006841035, "loss": 4.68, "mean_token_accuracy": 0.24543213993310928, "num_tokens": 139675283.0, "step": 80535 }, { "entropy": 5.3325052738189695, "epoch": 6.266251702003501, "grad_norm": 1.421875, "learning_rate": 0.00018972141168997075, "loss": 4.5359, "mean_token_accuracy": 0.24635443687438965, "num_tokens": 139683487.0, "step": 80540 }, { "entropy": 5.376246356964112, "epoch": 6.266640731375219, "grad_norm": 1.2734375, "learning_rate": 0.00018969576460549798, "loss": 4.661, "mean_token_accuracy": 0.2364721938967705, "num_tokens": 139692376.0, "step": 80545 }, { "entropy": 5.381367254257202, "epoch": 6.2670297607469365, "grad_norm": 1.3125, "learning_rate": 0.00018967011881538122, "loss": 4.6077, "mean_token_accuracy": 0.24235492646694184, "num_tokens": 139700855.0, "step": 80550 }, { "entropy": 5.388552904129028, "epoch": 6.267418790118654, "grad_norm": 1.296875, "learning_rate": 0.00018964447432000964, "loss": 4.6846, "mean_token_accuracy": 0.23735942244529723, "num_tokens": 139709689.0, "step": 80555 }, { "entropy": 5.446264600753784, "epoch": 6.267807819490372, "grad_norm": 1.3203125, "learning_rate": 0.00018961883111977225, "loss": 4.6971, "mean_token_accuracy": 0.23705108761787413, "num_tokens": 139718016.0, "step": 80560 }, { "entropy": 5.373779392242431, "epoch": 6.268196848862089, "grad_norm": 1.3671875, "learning_rate": 0.0001895931892150582, "loss": 4.6269, "mean_token_accuracy": 0.2398022949695587, "num_tokens": 139726464.0, "step": 80565 }, { "entropy": 5.417043256759643, "epoch": 6.268585878233806, "grad_norm": 1.4140625, "learning_rate": 0.00018956754860625653, "loss": 4.6176, "mean_token_accuracy": 0.23868566751480103, "num_tokens": 139735074.0, "step": 80570 }, { "entropy": 5.384158992767334, "epoch": 6.268974907605524, "grad_norm": 1.328125, "learning_rate": 0.00018954190929375625, "loss": 4.613, "mean_token_accuracy": 0.2355734646320343, "num_tokens": 139743915.0, "step": 80575 }, { "entropy": 5.446339464187622, "epoch": 6.269363936977242, "grad_norm": 1.34375, "learning_rate": 0.00018951627127794656, "loss": 4.6959, "mean_token_accuracy": 0.23905368596315385, "num_tokens": 139751839.0, "step": 80580 }, { "entropy": 5.3889909267425535, "epoch": 6.2697529663489595, "grad_norm": 1.265625, "learning_rate": 0.0001894906345592165, "loss": 4.6365, "mean_token_accuracy": 0.23967001140117644, "num_tokens": 139761155.0, "step": 80585 }, { "entropy": 5.35652527809143, "epoch": 6.270141995720677, "grad_norm": 1.3046875, "learning_rate": 0.0001894649991379549, "loss": 4.5839, "mean_token_accuracy": 0.24570319056510925, "num_tokens": 139768916.0, "step": 80590 }, { "entropy": 5.40945725440979, "epoch": 6.270531025092394, "grad_norm": 1.359375, "learning_rate": 0.00018943936501455077, "loss": 4.6615, "mean_token_accuracy": 0.23720156252384186, "num_tokens": 139777065.0, "step": 80595 }, { "entropy": 5.422574424743653, "epoch": 6.270920054464112, "grad_norm": 1.28125, "learning_rate": 0.00018941373218939306, "loss": 4.6438, "mean_token_accuracy": 0.23594748824834824, "num_tokens": 139785633.0, "step": 80600 }, { "entropy": 5.349172353744507, "epoch": 6.271309083835829, "grad_norm": 1.171875, "learning_rate": 0.00018938810066287078, "loss": 4.5972, "mean_token_accuracy": 0.23926064372062683, "num_tokens": 139794601.0, "step": 80605 }, { "entropy": 5.419375467300415, "epoch": 6.271698113207547, "grad_norm": 1.3203125, "learning_rate": 0.0001893624704353728, "loss": 4.7497, "mean_token_accuracy": 0.23352694511413574, "num_tokens": 139804169.0, "step": 80610 }, { "entropy": 5.360839557647705, "epoch": 6.272087142579265, "grad_norm": 1.3203125, "learning_rate": 0.00018933684150728802, "loss": 4.6138, "mean_token_accuracy": 0.2471909612417221, "num_tokens": 139813003.0, "step": 80615 }, { "entropy": 5.351366138458252, "epoch": 6.2724761719509825, "grad_norm": 1.28125, "learning_rate": 0.00018931121387900536, "loss": 4.5867, "mean_token_accuracy": 0.24640681147575377, "num_tokens": 139821941.0, "step": 80620 }, { "entropy": 5.385867738723755, "epoch": 6.2728652013227, "grad_norm": 1.3125, "learning_rate": 0.00018928558755091358, "loss": 4.7004, "mean_token_accuracy": 0.23446635156869888, "num_tokens": 139830080.0, "step": 80625 }, { "entropy": 5.4055643558502195, "epoch": 6.273254230694418, "grad_norm": 1.28125, "learning_rate": 0.00018925996252340167, "loss": 4.6936, "mean_token_accuracy": 0.2436074882745743, "num_tokens": 139838660.0, "step": 80630 }, { "entropy": 5.346486616134643, "epoch": 6.273643260066135, "grad_norm": 1.28125, "learning_rate": 0.0001892343387968583, "loss": 4.6234, "mean_token_accuracy": 0.2451077178120613, "num_tokens": 139846915.0, "step": 80635 }, { "entropy": 5.349494314193725, "epoch": 6.274032289437852, "grad_norm": 1.3515625, "learning_rate": 0.00018920871637167236, "loss": 4.6108, "mean_token_accuracy": 0.24402038007974625, "num_tokens": 139855507.0, "step": 80640 }, { "entropy": 5.459961223602295, "epoch": 6.27442131880957, "grad_norm": 1.359375, "learning_rate": 0.00018918309524823247, "loss": 4.6567, "mean_token_accuracy": 0.24426183104515076, "num_tokens": 139863895.0, "step": 80645 }, { "entropy": 5.446266508102417, "epoch": 6.274810348181288, "grad_norm": 1.2421875, "learning_rate": 0.00018915747542692758, "loss": 4.7131, "mean_token_accuracy": 0.23641157597303392, "num_tokens": 139872636.0, "step": 80650 }, { "entropy": 5.454562044143676, "epoch": 6.2751993775530055, "grad_norm": 1.34375, "learning_rate": 0.00018913185690814637, "loss": 4.7336, "mean_token_accuracy": 0.23571633845567702, "num_tokens": 139881147.0, "step": 80655 }, { "entropy": 5.329338407516479, "epoch": 6.275588406924723, "grad_norm": 1.28125, "learning_rate": 0.00018910623969227764, "loss": 4.5654, "mean_token_accuracy": 0.24510546028614044, "num_tokens": 139890009.0, "step": 80660 }, { "entropy": 5.387473726272583, "epoch": 6.27597743629644, "grad_norm": 1.40625, "learning_rate": 0.00018908062377971, "loss": 4.6465, "mean_token_accuracy": 0.24790654927492142, "num_tokens": 139899255.0, "step": 80665 }, { "entropy": 5.345875930786133, "epoch": 6.276366465668158, "grad_norm": 1.3359375, "learning_rate": 0.00018905500917083213, "loss": 4.6637, "mean_token_accuracy": 0.2340237095952034, "num_tokens": 139908119.0, "step": 80670 }, { "entropy": 5.45190920829773, "epoch": 6.276755495039875, "grad_norm": 1.421875, "learning_rate": 0.00018902939586603262, "loss": 4.6488, "mean_token_accuracy": 0.2409891664981842, "num_tokens": 139916819.0, "step": 80675 }, { "entropy": 5.430678796768189, "epoch": 6.277144524411593, "grad_norm": 1.28125, "learning_rate": 0.00018900378386570027, "loss": 4.7093, "mean_token_accuracy": 0.2340683728456497, "num_tokens": 139925334.0, "step": 80680 }, { "entropy": 5.42761082649231, "epoch": 6.277533553783311, "grad_norm": 1.2109375, "learning_rate": 0.0001889781731702236, "loss": 4.668, "mean_token_accuracy": 0.24220959544181825, "num_tokens": 139934458.0, "step": 80685 }, { "entropy": 5.417144155502319, "epoch": 6.2779225831550285, "grad_norm": 1.2890625, "learning_rate": 0.00018895256377999121, "loss": 4.6779, "mean_token_accuracy": 0.23350462764501573, "num_tokens": 139943227.0, "step": 80690 }, { "entropy": 5.327381944656372, "epoch": 6.278311612526746, "grad_norm": 1.2890625, "learning_rate": 0.0001889269556953917, "loss": 4.547, "mean_token_accuracy": 0.25325956642627717, "num_tokens": 139952580.0, "step": 80695 }, { "entropy": 5.425938749313355, "epoch": 6.278700641898463, "grad_norm": 1.3046875, "learning_rate": 0.0001889013489168137, "loss": 4.6854, "mean_token_accuracy": 0.2421893984079361, "num_tokens": 139961239.0, "step": 80700 }, { "entropy": 5.377617454528808, "epoch": 6.279089671270181, "grad_norm": 1.34375, "learning_rate": 0.00018887574344464563, "loss": 4.6381, "mean_token_accuracy": 0.23616444319486618, "num_tokens": 139969646.0, "step": 80705 }, { "entropy": 5.451131868362427, "epoch": 6.279478700641898, "grad_norm": 1.3984375, "learning_rate": 0.00018885013927927608, "loss": 4.7057, "mean_token_accuracy": 0.23788418024778366, "num_tokens": 139977674.0, "step": 80710 }, { "entropy": 5.388899230957032, "epoch": 6.279867730013616, "grad_norm": 1.28125, "learning_rate": 0.00018882453642109353, "loss": 4.6776, "mean_token_accuracy": 0.23725140541791917, "num_tokens": 139986957.0, "step": 80715 }, { "entropy": 5.445253849029541, "epoch": 6.280256759385334, "grad_norm": 1.2734375, "learning_rate": 0.0001887989348704865, "loss": 4.7516, "mean_token_accuracy": 0.23832908421754836, "num_tokens": 139996532.0, "step": 80720 }, { "entropy": 5.279995965957641, "epoch": 6.2806457887570515, "grad_norm": 1.25, "learning_rate": 0.00018877333462784346, "loss": 4.5009, "mean_token_accuracy": 0.2641653805971146, "num_tokens": 140005859.0, "step": 80725 }, { "entropy": 5.473435115814209, "epoch": 6.281034818128768, "grad_norm": 1.3515625, "learning_rate": 0.0001887477356935528, "loss": 4.7472, "mean_token_accuracy": 0.22952835857868195, "num_tokens": 140015113.0, "step": 80730 }, { "entropy": 5.369877815246582, "epoch": 6.281423847500486, "grad_norm": 1.21875, "learning_rate": 0.00018872213806800297, "loss": 4.6231, "mean_token_accuracy": 0.23888950496912004, "num_tokens": 140023944.0, "step": 80735 }, { "entropy": 5.428376626968384, "epoch": 6.281812876872204, "grad_norm": 1.4375, "learning_rate": 0.00018869654175158234, "loss": 4.6476, "mean_token_accuracy": 0.24705903530120848, "num_tokens": 140032287.0, "step": 80740 }, { "entropy": 5.44474515914917, "epoch": 6.282201906243921, "grad_norm": 1.46875, "learning_rate": 0.0001886709467446794, "loss": 4.7759, "mean_token_accuracy": 0.23433725386857987, "num_tokens": 140040344.0, "step": 80745 }, { "entropy": 5.379383087158203, "epoch": 6.282590935615639, "grad_norm": 1.265625, "learning_rate": 0.00018864535304768238, "loss": 4.6911, "mean_token_accuracy": 0.23669513016939164, "num_tokens": 140048661.0, "step": 80750 }, { "entropy": 5.332699823379516, "epoch": 6.282979964987357, "grad_norm": 1.3359375, "learning_rate": 0.00018861976066097968, "loss": 4.6223, "mean_token_accuracy": 0.2412927195429802, "num_tokens": 140057573.0, "step": 80755 }, { "entropy": 5.435874700546265, "epoch": 6.2833689943590745, "grad_norm": 1.3046875, "learning_rate": 0.00018859416958495962, "loss": 4.7095, "mean_token_accuracy": 0.2424481675028801, "num_tokens": 140066850.0, "step": 80760 }, { "entropy": 5.420366001129151, "epoch": 6.283758023730791, "grad_norm": 1.2265625, "learning_rate": 0.00018856857982001051, "loss": 4.7108, "mean_token_accuracy": 0.23222759366035461, "num_tokens": 140076067.0, "step": 80765 }, { "entropy": 5.369050788879394, "epoch": 6.284147053102509, "grad_norm": 1.21875, "learning_rate": 0.0001885429913665207, "loss": 4.6313, "mean_token_accuracy": 0.24103206098079683, "num_tokens": 140085417.0, "step": 80770 }, { "entropy": 5.374463367462158, "epoch": 6.284536082474227, "grad_norm": 1.4296875, "learning_rate": 0.00018851740422487829, "loss": 4.5843, "mean_token_accuracy": 0.24336903989315034, "num_tokens": 140094569.0, "step": 80775 }, { "entropy": 5.366031885147095, "epoch": 6.284925111845944, "grad_norm": 1.2421875, "learning_rate": 0.00018849181839547164, "loss": 4.6207, "mean_token_accuracy": 0.2436074748635292, "num_tokens": 140103518.0, "step": 80780 }, { "entropy": 5.44331316947937, "epoch": 6.285314141217662, "grad_norm": 1.3984375, "learning_rate": 0.00018846623387868894, "loss": 4.6867, "mean_token_accuracy": 0.22773874402046204, "num_tokens": 140111352.0, "step": 80785 }, { "entropy": 5.3641032695770265, "epoch": 6.28570317058938, "grad_norm": 1.3359375, "learning_rate": 0.00018844065067491844, "loss": 4.5772, "mean_token_accuracy": 0.24944186508655547, "num_tokens": 140119417.0, "step": 80790 }, { "entropy": 5.383664989471436, "epoch": 6.2860921999610975, "grad_norm": 1.25, "learning_rate": 0.00018841506878454828, "loss": 4.6643, "mean_token_accuracy": 0.23693789690732955, "num_tokens": 140128171.0, "step": 80795 }, { "entropy": 5.302205371856689, "epoch": 6.286481229332814, "grad_norm": 1.3046875, "learning_rate": 0.00018838948820796664, "loss": 4.6041, "mean_token_accuracy": 0.24092597812414168, "num_tokens": 140137594.0, "step": 80800 }, { "entropy": 5.418511819839478, "epoch": 6.286870258704532, "grad_norm": 1.2265625, "learning_rate": 0.00018836390894556165, "loss": 4.6908, "mean_token_accuracy": 0.2334694132208824, "num_tokens": 140146415.0, "step": 80805 }, { "entropy": 5.528481960296631, "epoch": 6.28725928807625, "grad_norm": 1.2734375, "learning_rate": 0.00018833833099772147, "loss": 4.8212, "mean_token_accuracy": 0.22140052169561386, "num_tokens": 140154414.0, "step": 80810 }, { "entropy": 5.345439815521241, "epoch": 6.287648317447967, "grad_norm": 1.390625, "learning_rate": 0.00018831275436483418, "loss": 4.6023, "mean_token_accuracy": 0.24361783862113953, "num_tokens": 140162947.0, "step": 80815 }, { "entropy": 5.459061241149902, "epoch": 6.288037346819685, "grad_norm": 1.3671875, "learning_rate": 0.00018828717904728788, "loss": 4.7638, "mean_token_accuracy": 0.23411581963300704, "num_tokens": 140171853.0, "step": 80820 }, { "entropy": 5.490664100646972, "epoch": 6.288426376191403, "grad_norm": 1.234375, "learning_rate": 0.00018826160504547063, "loss": 4.7824, "mean_token_accuracy": 0.23064191341400148, "num_tokens": 140181090.0, "step": 80825 }, { "entropy": 5.416301727294922, "epoch": 6.2888154055631205, "grad_norm": 1.3046875, "learning_rate": 0.00018823603235977043, "loss": 4.6359, "mean_token_accuracy": 0.24007037580013274, "num_tokens": 140189725.0, "step": 80830 }, { "entropy": 5.359653043746948, "epoch": 6.289204434934837, "grad_norm": 1.265625, "learning_rate": 0.00018821046099057532, "loss": 4.5873, "mean_token_accuracy": 0.24688362032175065, "num_tokens": 140197791.0, "step": 80835 }, { "entropy": 5.324598598480224, "epoch": 6.289593464306555, "grad_norm": 1.296875, "learning_rate": 0.00018818489093827334, "loss": 4.5822, "mean_token_accuracy": 0.25362949818372726, "num_tokens": 140207029.0, "step": 80840 }, { "entropy": 5.395852041244507, "epoch": 6.289982493678273, "grad_norm": 1.265625, "learning_rate": 0.00018815932220325239, "loss": 4.6426, "mean_token_accuracy": 0.2395107626914978, "num_tokens": 140216295.0, "step": 80845 }, { "entropy": 5.371996450424194, "epoch": 6.29037152304999, "grad_norm": 1.3515625, "learning_rate": 0.0001881337547859006, "loss": 4.6489, "mean_token_accuracy": 0.23724377304315566, "num_tokens": 140225219.0, "step": 80850 }, { "entropy": 5.425933599472046, "epoch": 6.290760552421708, "grad_norm": 1.28125, "learning_rate": 0.00018810818868660585, "loss": 4.6497, "mean_token_accuracy": 0.24207971841096879, "num_tokens": 140233437.0, "step": 80855 }, { "entropy": 5.397924089431763, "epoch": 6.291149581793426, "grad_norm": 1.34375, "learning_rate": 0.00018808262390575598, "loss": 4.6797, "mean_token_accuracy": 0.23178303837776185, "num_tokens": 140242084.0, "step": 80860 }, { "entropy": 5.375138950347901, "epoch": 6.291538611165143, "grad_norm": 1.234375, "learning_rate": 0.00018805706044373893, "loss": 4.6235, "mean_token_accuracy": 0.23665915578603744, "num_tokens": 140250889.0, "step": 80865 }, { "entropy": 5.322999477386475, "epoch": 6.29192764053686, "grad_norm": 1.3125, "learning_rate": 0.00018803149830094268, "loss": 4.6268, "mean_token_accuracy": 0.2407200291752815, "num_tokens": 140259149.0, "step": 80870 }, { "entropy": 5.4123610496521, "epoch": 6.292316669908578, "grad_norm": 1.2578125, "learning_rate": 0.00018800593747775492, "loss": 4.702, "mean_token_accuracy": 0.22775417268276216, "num_tokens": 140267905.0, "step": 80875 }, { "entropy": 5.387538766860962, "epoch": 6.292705699280296, "grad_norm": 1.265625, "learning_rate": 0.00018798037797456368, "loss": 4.5653, "mean_token_accuracy": 0.24655814170837403, "num_tokens": 140276990.0, "step": 80880 }, { "entropy": 5.432442617416382, "epoch": 6.293094728652013, "grad_norm": 1.3125, "learning_rate": 0.0001879548197917566, "loss": 4.6861, "mean_token_accuracy": 0.23746777921915055, "num_tokens": 140284897.0, "step": 80885 }, { "entropy": 5.387422800064087, "epoch": 6.293483758023731, "grad_norm": 1.375, "learning_rate": 0.00018792926292972168, "loss": 4.6508, "mean_token_accuracy": 0.2403615042567253, "num_tokens": 140293737.0, "step": 80890 }, { "entropy": 5.437067365646362, "epoch": 6.293872787395449, "grad_norm": 1.3828125, "learning_rate": 0.00018790370738884653, "loss": 4.738, "mean_token_accuracy": 0.2402784824371338, "num_tokens": 140302544.0, "step": 80895 }, { "entropy": 5.376826810836792, "epoch": 6.294261816767166, "grad_norm": 1.296875, "learning_rate": 0.00018787815316951905, "loss": 4.632, "mean_token_accuracy": 0.24814800173044205, "num_tokens": 140312052.0, "step": 80900 }, { "entropy": 5.396762323379517, "epoch": 6.294650846138883, "grad_norm": 1.296875, "learning_rate": 0.00018785260027212692, "loss": 4.7373, "mean_token_accuracy": 0.23124824166297914, "num_tokens": 140321429.0, "step": 80905 }, { "entropy": 5.443631219863891, "epoch": 6.295039875510601, "grad_norm": 1.3671875, "learning_rate": 0.0001878270486970578, "loss": 4.667, "mean_token_accuracy": 0.24035699516534806, "num_tokens": 140329503.0, "step": 80910 }, { "entropy": 5.361793088912964, "epoch": 6.295428904882319, "grad_norm": 1.3203125, "learning_rate": 0.00018780149844469958, "loss": 4.5446, "mean_token_accuracy": 0.244250525534153, "num_tokens": 140338355.0, "step": 80915 }, { "entropy": 5.32082233428955, "epoch": 6.295817934254036, "grad_norm": 1.3203125, "learning_rate": 0.00018777594951543974, "loss": 4.5653, "mean_token_accuracy": 0.24929204136133193, "num_tokens": 140347292.0, "step": 80920 }, { "entropy": 5.323388719558716, "epoch": 6.296206963625754, "grad_norm": 1.34375, "learning_rate": 0.00018775040190966607, "loss": 4.6138, "mean_token_accuracy": 0.24406735897064208, "num_tokens": 140356137.0, "step": 80925 }, { "entropy": 5.410298919677734, "epoch": 6.296595992997471, "grad_norm": 1.3359375, "learning_rate": 0.0001877248556277662, "loss": 4.6981, "mean_token_accuracy": 0.22988900393247605, "num_tokens": 140364352.0, "step": 80930 }, { "entropy": 5.429219484329224, "epoch": 6.296985022369189, "grad_norm": 1.40625, "learning_rate": 0.00018769931067012775, "loss": 4.6928, "mean_token_accuracy": 0.23361212760210037, "num_tokens": 140373075.0, "step": 80935 }, { "entropy": 5.44643349647522, "epoch": 6.297374051740906, "grad_norm": 1.4140625, "learning_rate": 0.00018767376703713828, "loss": 4.6833, "mean_token_accuracy": 0.24257458746433258, "num_tokens": 140382463.0, "step": 80940 }, { "entropy": 5.4415696144104, "epoch": 6.297763081112624, "grad_norm": 1.3828125, "learning_rate": 0.00018764822472918535, "loss": 4.6784, "mean_token_accuracy": 0.23956273943185807, "num_tokens": 140390747.0, "step": 80945 }, { "entropy": 5.406580972671509, "epoch": 6.298152110484342, "grad_norm": 1.3046875, "learning_rate": 0.00018762268374665665, "loss": 4.6893, "mean_token_accuracy": 0.23705904930830002, "num_tokens": 140399656.0, "step": 80950 }, { "entropy": 5.342750597000122, "epoch": 6.298541139856059, "grad_norm": 1.15625, "learning_rate": 0.00018759714408993962, "loss": 4.6293, "mean_token_accuracy": 0.2334432601928711, "num_tokens": 140408483.0, "step": 80955 }, { "entropy": 5.3609397411346436, "epoch": 6.298930169227777, "grad_norm": 1.359375, "learning_rate": 0.00018757160575942183, "loss": 4.631, "mean_token_accuracy": 0.24056716561317443, "num_tokens": 140417186.0, "step": 80960 }, { "entropy": 5.387080192565918, "epoch": 6.299319198599494, "grad_norm": 1.3671875, "learning_rate": 0.00018754606875549074, "loss": 4.6466, "mean_token_accuracy": 0.23672270625829697, "num_tokens": 140425302.0, "step": 80965 }, { "entropy": 5.365395021438599, "epoch": 6.2997082279712115, "grad_norm": 1.2890625, "learning_rate": 0.00018752053307853384, "loss": 4.6618, "mean_token_accuracy": 0.23655004501342775, "num_tokens": 140433738.0, "step": 80970 }, { "entropy": 5.395830059051514, "epoch": 6.300097257342929, "grad_norm": 1.3984375, "learning_rate": 0.0001874949987289386, "loss": 4.7404, "mean_token_accuracy": 0.2288475066423416, "num_tokens": 140442131.0, "step": 80975 }, { "entropy": 5.388530111312866, "epoch": 6.300486286714647, "grad_norm": 1.28125, "learning_rate": 0.0001874694657070925, "loss": 4.6064, "mean_token_accuracy": 0.24498714357614518, "num_tokens": 140449757.0, "step": 80980 }, { "entropy": 5.480423307418823, "epoch": 6.300875316086365, "grad_norm": 1.3203125, "learning_rate": 0.00018744393401338294, "loss": 4.7635, "mean_token_accuracy": 0.22712938636541366, "num_tokens": 140458101.0, "step": 80985 }, { "entropy": 5.438992834091186, "epoch": 6.301264345458082, "grad_norm": 1.3203125, "learning_rate": 0.00018741840364819735, "loss": 4.6687, "mean_token_accuracy": 0.24204365015029908, "num_tokens": 140466006.0, "step": 80990 }, { "entropy": 5.465781354904175, "epoch": 6.3016533748298, "grad_norm": 1.3671875, "learning_rate": 0.00018739287461192307, "loss": 4.8018, "mean_token_accuracy": 0.2240292027592659, "num_tokens": 140474101.0, "step": 80995 }, { "entropy": 5.413680219650269, "epoch": 6.302042404201517, "grad_norm": 1.2578125, "learning_rate": 0.00018736734690494745, "loss": 4.6341, "mean_token_accuracy": 0.24746754318475722, "num_tokens": 140482564.0, "step": 81000 }, { "epoch": 6.302042404201517, "eval_entropy": 5.1702743285200246, "eval_loss": 4.871466636657715, "eval_mean_token_accuracy": 0.23425593627571945, "eval_num_tokens": 140482564.0, "eval_runtime": 28.9505, "eval_samples_per_second": 1435.486, "eval_steps_per_second": 179.444, "step": 81000 }, { "entropy": 5.492792844772339, "epoch": 6.3024314335732345, "grad_norm": 1.3125, "learning_rate": 0.0001873418205276579, "loss": 4.7178, "mean_token_accuracy": 0.2378475472331047, "num_tokens": 140492149.0, "step": 81005 }, { "entropy": 5.456882953643799, "epoch": 6.302820462944952, "grad_norm": 1.25, "learning_rate": 0.00018731629548044166, "loss": 4.6964, "mean_token_accuracy": 0.24167658686637877, "num_tokens": 140500869.0, "step": 81010 }, { "entropy": 5.433547782897949, "epoch": 6.30320949231667, "grad_norm": 1.2890625, "learning_rate": 0.00018729077176368614, "loss": 4.6593, "mean_token_accuracy": 0.24496403187513352, "num_tokens": 140509531.0, "step": 81015 }, { "entropy": 5.369193744659424, "epoch": 6.303598521688388, "grad_norm": 1.421875, "learning_rate": 0.00018726524937777856, "loss": 4.6153, "mean_token_accuracy": 0.23776921182870864, "num_tokens": 140518368.0, "step": 81020 }, { "entropy": 5.372480344772339, "epoch": 6.303987551060105, "grad_norm": 1.4453125, "learning_rate": 0.0001872397283231061, "loss": 4.6043, "mean_token_accuracy": 0.24504177123308182, "num_tokens": 140526062.0, "step": 81025 }, { "entropy": 5.4226398944854735, "epoch": 6.304376580431823, "grad_norm": 1.25, "learning_rate": 0.00018721420860005612, "loss": 4.72, "mean_token_accuracy": 0.24133848547935485, "num_tokens": 140534982.0, "step": 81030 }, { "entropy": 5.437431716918946, "epoch": 6.30476560980354, "grad_norm": 1.328125, "learning_rate": 0.00018718869020901575, "loss": 4.7102, "mean_token_accuracy": 0.23205984085798265, "num_tokens": 140543105.0, "step": 81035 }, { "entropy": 5.3646622657775875, "epoch": 6.3051546391752575, "grad_norm": 1.2578125, "learning_rate": 0.00018716317315037217, "loss": 4.6474, "mean_token_accuracy": 0.24133993238210677, "num_tokens": 140551747.0, "step": 81040 }, { "entropy": 5.322890186309815, "epoch": 6.305543668546975, "grad_norm": 1.2421875, "learning_rate": 0.00018713765742451284, "loss": 4.5592, "mean_token_accuracy": 0.2465199872851372, "num_tokens": 140560594.0, "step": 81045 }, { "entropy": 5.395346832275391, "epoch": 6.305932697918693, "grad_norm": 1.3515625, "learning_rate": 0.00018711214303182455, "loss": 4.6322, "mean_token_accuracy": 0.24815107882022858, "num_tokens": 140569955.0, "step": 81050 }, { "entropy": 5.461027002334594, "epoch": 6.306321727290411, "grad_norm": 1.453125, "learning_rate": 0.00018708662997269466, "loss": 4.7449, "mean_token_accuracy": 0.23678188621997834, "num_tokens": 140578296.0, "step": 81055 }, { "entropy": 5.480560207366944, "epoch": 6.306710756662128, "grad_norm": 1.390625, "learning_rate": 0.00018706111824751026, "loss": 4.6617, "mean_token_accuracy": 0.2437663272023201, "num_tokens": 140586456.0, "step": 81060 }, { "entropy": 5.405377292633057, "epoch": 6.307099786033845, "grad_norm": 1.359375, "learning_rate": 0.0001870356078566584, "loss": 4.6903, "mean_token_accuracy": 0.23729097247123718, "num_tokens": 140595512.0, "step": 81065 }, { "entropy": 5.37175235748291, "epoch": 6.307488815405563, "grad_norm": 1.28125, "learning_rate": 0.00018701009880052615, "loss": 4.6751, "mean_token_accuracy": 0.23304772526025772, "num_tokens": 140604383.0, "step": 81070 }, { "entropy": 5.446683597564697, "epoch": 6.3078778447772805, "grad_norm": 1.390625, "learning_rate": 0.00018698459107950062, "loss": 4.714, "mean_token_accuracy": 0.23509371727705003, "num_tokens": 140612800.0, "step": 81075 }, { "entropy": 5.424234771728516, "epoch": 6.308266874148998, "grad_norm": 1.375, "learning_rate": 0.00018695908469396882, "loss": 4.7054, "mean_token_accuracy": 0.23271385878324508, "num_tokens": 140622238.0, "step": 81080 }, { "entropy": 5.448532962799073, "epoch": 6.308655903520716, "grad_norm": 1.3828125, "learning_rate": 0.00018693357964431778, "loss": 4.713, "mean_token_accuracy": 0.23707250207662584, "num_tokens": 140631976.0, "step": 81085 }, { "entropy": 5.321987867355347, "epoch": 6.309044932892434, "grad_norm": 1.3984375, "learning_rate": 0.0001869080759309345, "loss": 4.5722, "mean_token_accuracy": 0.24573880881071092, "num_tokens": 140640574.0, "step": 81090 }, { "entropy": 5.351877117156983, "epoch": 6.309433962264151, "grad_norm": 1.28125, "learning_rate": 0.000186882573554206, "loss": 4.6426, "mean_token_accuracy": 0.24525856971740723, "num_tokens": 140649387.0, "step": 81095 }, { "entropy": 5.312054014205932, "epoch": 6.309822991635868, "grad_norm": 1.296875, "learning_rate": 0.00018685707251451923, "loss": 4.5095, "mean_token_accuracy": 0.25375395715236665, "num_tokens": 140657745.0, "step": 81100 }, { "entropy": 5.388836526870728, "epoch": 6.310212021007586, "grad_norm": 1.40625, "learning_rate": 0.000186831572812261, "loss": 4.6609, "mean_token_accuracy": 0.24664531350135804, "num_tokens": 140666005.0, "step": 81105 }, { "entropy": 5.373680591583252, "epoch": 6.3106010503793035, "grad_norm": 1.28125, "learning_rate": 0.00018680607444781822, "loss": 4.6448, "mean_token_accuracy": 0.23789597749710084, "num_tokens": 140674754.0, "step": 81110 }, { "entropy": 5.35059700012207, "epoch": 6.310990079751021, "grad_norm": 1.375, "learning_rate": 0.000186780577421578, "loss": 4.6961, "mean_token_accuracy": 0.23871206790208815, "num_tokens": 140683039.0, "step": 81115 }, { "entropy": 5.336535930633545, "epoch": 6.311379109122739, "grad_norm": 1.3203125, "learning_rate": 0.00018675508173392715, "loss": 4.6639, "mean_token_accuracy": 0.24021504074335098, "num_tokens": 140691637.0, "step": 81120 }, { "entropy": 5.288360118865967, "epoch": 6.311768138494457, "grad_norm": 1.390625, "learning_rate": 0.00018672958738525242, "loss": 4.5585, "mean_token_accuracy": 0.24004936963319778, "num_tokens": 140699711.0, "step": 81125 }, { "entropy": 5.384496974945068, "epoch": 6.312157167866174, "grad_norm": 1.21875, "learning_rate": 0.0001867040943759407, "loss": 4.6188, "mean_token_accuracy": 0.23622289150953293, "num_tokens": 140708784.0, "step": 81130 }, { "entropy": 5.382076215744019, "epoch": 6.312546197237891, "grad_norm": 1.3125, "learning_rate": 0.00018667860270637883, "loss": 4.626, "mean_token_accuracy": 0.2470238596200943, "num_tokens": 140717302.0, "step": 81135 }, { "entropy": 5.380614423751831, "epoch": 6.312935226609609, "grad_norm": 1.2734375, "learning_rate": 0.00018665311237695358, "loss": 4.6772, "mean_token_accuracy": 0.23968446105718613, "num_tokens": 140726101.0, "step": 81140 }, { "entropy": 5.388350772857666, "epoch": 6.3133242559813265, "grad_norm": 1.1953125, "learning_rate": 0.00018662762338805174, "loss": 4.6452, "mean_token_accuracy": 0.24135989099740982, "num_tokens": 140735350.0, "step": 81145 }, { "entropy": 5.384521484375, "epoch": 6.313713285353044, "grad_norm": 1.2890625, "learning_rate": 0.00018660213574006007, "loss": 4.6256, "mean_token_accuracy": 0.240645532310009, "num_tokens": 140744544.0, "step": 81150 }, { "entropy": 5.304063415527343, "epoch": 6.314102314724762, "grad_norm": 1.3125, "learning_rate": 0.00018657664943336528, "loss": 4.5217, "mean_token_accuracy": 0.24785464406013488, "num_tokens": 140753140.0, "step": 81155 }, { "entropy": 5.341644716262818, "epoch": 6.31449134409648, "grad_norm": 1.515625, "learning_rate": 0.00018655116446835408, "loss": 4.5604, "mean_token_accuracy": 0.25025922656059263, "num_tokens": 140761643.0, "step": 81160 }, { "entropy": 5.4166912078857425, "epoch": 6.314880373468197, "grad_norm": 1.3984375, "learning_rate": 0.00018652568084541316, "loss": 4.6842, "mean_token_accuracy": 0.23657781928777694, "num_tokens": 140770551.0, "step": 81165 }, { "entropy": 5.334477472305298, "epoch": 6.315269402839914, "grad_norm": 1.359375, "learning_rate": 0.00018650019856492924, "loss": 4.5742, "mean_token_accuracy": 0.24270375221967697, "num_tokens": 140779663.0, "step": 81170 }, { "entropy": 5.320580387115479, "epoch": 6.315658432211632, "grad_norm": 1.3046875, "learning_rate": 0.0001864747176272889, "loss": 4.5879, "mean_token_accuracy": 0.24315948486328126, "num_tokens": 140788723.0, "step": 81175 }, { "entropy": 5.339796876907348, "epoch": 6.3160474615833495, "grad_norm": 1.265625, "learning_rate": 0.00018644923803287882, "loss": 4.6052, "mean_token_accuracy": 0.2427134245634079, "num_tokens": 140796963.0, "step": 81180 }, { "entropy": 5.391323184967041, "epoch": 6.316436490955067, "grad_norm": 1.234375, "learning_rate": 0.00018642375978208565, "loss": 4.662, "mean_token_accuracy": 0.2399229645729065, "num_tokens": 140805449.0, "step": 81185 }, { "entropy": 5.391846227645874, "epoch": 6.316825520326785, "grad_norm": 1.46875, "learning_rate": 0.00018639828287529591, "loss": 4.6752, "mean_token_accuracy": 0.23541017025709152, "num_tokens": 140813976.0, "step": 81190 }, { "entropy": 5.3814839839935305, "epoch": 6.317214549698503, "grad_norm": 1.3828125, "learning_rate": 0.00018637280731289625, "loss": 4.6732, "mean_token_accuracy": 0.23460946828126908, "num_tokens": 140823371.0, "step": 81195 }, { "entropy": 5.33790602684021, "epoch": 6.317603579070219, "grad_norm": 1.2734375, "learning_rate": 0.0001863473330952732, "loss": 4.6473, "mean_token_accuracy": 0.23416151404380797, "num_tokens": 140833015.0, "step": 81200 }, { "entropy": 5.3981811046600345, "epoch": 6.317992608441937, "grad_norm": 1.265625, "learning_rate": 0.00018632186022281315, "loss": 4.6395, "mean_token_accuracy": 0.2366352215409279, "num_tokens": 140840899.0, "step": 81205 }, { "entropy": 5.368739748001099, "epoch": 6.318381637813655, "grad_norm": 1.453125, "learning_rate": 0.00018629638869590288, "loss": 4.6562, "mean_token_accuracy": 0.24022720009088516, "num_tokens": 140849437.0, "step": 81210 }, { "entropy": 5.400656032562256, "epoch": 6.3187706671853725, "grad_norm": 1.2421875, "learning_rate": 0.0001862709185149286, "loss": 4.689, "mean_token_accuracy": 0.23592578768730163, "num_tokens": 140858500.0, "step": 81215 }, { "entropy": 5.413471841812134, "epoch": 6.31915969655709, "grad_norm": 1.3984375, "learning_rate": 0.00018624544968027696, "loss": 4.6866, "mean_token_accuracy": 0.2459576576948166, "num_tokens": 140867288.0, "step": 81220 }, { "entropy": 5.381202745437622, "epoch": 6.319548725928808, "grad_norm": 1.28125, "learning_rate": 0.00018621998219233438, "loss": 4.6401, "mean_token_accuracy": 0.23597426265478133, "num_tokens": 140876076.0, "step": 81225 }, { "entropy": 5.3892652034759525, "epoch": 6.319937755300526, "grad_norm": 1.3125, "learning_rate": 0.00018619451605148717, "loss": 4.695, "mean_token_accuracy": 0.22948427200317384, "num_tokens": 140884456.0, "step": 81230 }, { "entropy": 5.420752811431885, "epoch": 6.320326784672242, "grad_norm": 1.3515625, "learning_rate": 0.00018616905125812188, "loss": 4.6692, "mean_token_accuracy": 0.24222567528486252, "num_tokens": 140892688.0, "step": 81235 }, { "entropy": 5.370156621932983, "epoch": 6.32071581404396, "grad_norm": 1.2734375, "learning_rate": 0.00018614358781262485, "loss": 4.5986, "mean_token_accuracy": 0.24845696091651917, "num_tokens": 140900705.0, "step": 81240 }, { "entropy": 5.470141124725342, "epoch": 6.321104843415678, "grad_norm": 1.3984375, "learning_rate": 0.0001861181257153824, "loss": 4.6983, "mean_token_accuracy": 0.23500063121318818, "num_tokens": 140909234.0, "step": 81245 }, { "entropy": 5.342524003982544, "epoch": 6.3214938727873955, "grad_norm": 1.3515625, "learning_rate": 0.00018609266496678095, "loss": 4.6018, "mean_token_accuracy": 0.23946299105882646, "num_tokens": 140917410.0, "step": 81250 }, { "entropy": 5.357816171646118, "epoch": 6.321882902159113, "grad_norm": 1.3515625, "learning_rate": 0.00018606720556720686, "loss": 4.6305, "mean_token_accuracy": 0.2347670614719391, "num_tokens": 140925930.0, "step": 81255 }, { "entropy": 5.417809200286865, "epoch": 6.322271931530831, "grad_norm": 1.25, "learning_rate": 0.00018604174751704633, "loss": 4.6805, "mean_token_accuracy": 0.2429317131638527, "num_tokens": 140934197.0, "step": 81260 }, { "entropy": 5.527235078811645, "epoch": 6.322660960902548, "grad_norm": 1.34375, "learning_rate": 0.0001860162908166857, "loss": 4.7774, "mean_token_accuracy": 0.2270856335759163, "num_tokens": 140943468.0, "step": 81265 }, { "entropy": 5.4127270698547365, "epoch": 6.323049990274265, "grad_norm": 1.2734375, "learning_rate": 0.00018599083546651119, "loss": 4.6735, "mean_token_accuracy": 0.23654923141002654, "num_tokens": 140952979.0, "step": 81270 }, { "entropy": 5.466534566879273, "epoch": 6.323439019645983, "grad_norm": 1.25, "learning_rate": 0.0001859653814669091, "loss": 4.7331, "mean_token_accuracy": 0.2366110473871231, "num_tokens": 140961488.0, "step": 81275 }, { "entropy": 5.350458145141602, "epoch": 6.323828049017701, "grad_norm": 1.25, "learning_rate": 0.00018593992881826566, "loss": 4.5891, "mean_token_accuracy": 0.24671894907951356, "num_tokens": 140970144.0, "step": 81280 }, { "entropy": 5.454417181015015, "epoch": 6.3242170783894185, "grad_norm": 1.3515625, "learning_rate": 0.00018591447752096702, "loss": 4.7548, "mean_token_accuracy": 0.23188957571983337, "num_tokens": 140979533.0, "step": 81285 }, { "entropy": 5.398789739608764, "epoch": 6.324606107761136, "grad_norm": 1.328125, "learning_rate": 0.00018588902757539944, "loss": 4.7132, "mean_token_accuracy": 0.2318116009235382, "num_tokens": 140987860.0, "step": 81290 }, { "entropy": 5.286217117309571, "epoch": 6.324995137132854, "grad_norm": 1.4140625, "learning_rate": 0.000185863578981949, "loss": 4.5603, "mean_token_accuracy": 0.26059999614953994, "num_tokens": 140996697.0, "step": 81295 }, { "entropy": 5.381032466888428, "epoch": 6.325384166504571, "grad_norm": 1.3203125, "learning_rate": 0.00018583813174100183, "loss": 4.6654, "mean_token_accuracy": 0.24351117312908171, "num_tokens": 141005287.0, "step": 81300 }, { "entropy": 5.352812814712524, "epoch": 6.325773195876288, "grad_norm": 1.2734375, "learning_rate": 0.00018581268585294414, "loss": 4.6373, "mean_token_accuracy": 0.2463349297642708, "num_tokens": 141013651.0, "step": 81305 }, { "entropy": 5.353053712844849, "epoch": 6.326162225248006, "grad_norm": 1.3515625, "learning_rate": 0.00018578724131816183, "loss": 4.6424, "mean_token_accuracy": 0.23821027874946593, "num_tokens": 141022508.0, "step": 81310 }, { "entropy": 5.330224657058716, "epoch": 6.326551254619724, "grad_norm": 1.40625, "learning_rate": 0.0001857617981370413, "loss": 4.5831, "mean_token_accuracy": 0.2505003586411476, "num_tokens": 141031280.0, "step": 81315 }, { "entropy": 5.368175411224366, "epoch": 6.3269402839914415, "grad_norm": 1.359375, "learning_rate": 0.00018573635630996844, "loss": 4.5695, "mean_token_accuracy": 0.24152146726846696, "num_tokens": 141040232.0, "step": 81320 }, { "entropy": 5.357767581939697, "epoch": 6.327329313363159, "grad_norm": 1.2890625, "learning_rate": 0.0001857109158373293, "loss": 4.6427, "mean_token_accuracy": 0.24082940816879272, "num_tokens": 141048556.0, "step": 81325 }, { "entropy": 5.346646070480347, "epoch": 6.327718342734877, "grad_norm": 1.3671875, "learning_rate": 0.00018568547671950986, "loss": 4.6072, "mean_token_accuracy": 0.2389387845993042, "num_tokens": 141056623.0, "step": 81330 }, { "entropy": 5.302301692962646, "epoch": 6.328107372106594, "grad_norm": 1.3125, "learning_rate": 0.00018566003895689615, "loss": 4.544, "mean_token_accuracy": 0.24730204194784164, "num_tokens": 141064840.0, "step": 81335 }, { "entropy": 5.34109354019165, "epoch": 6.328496401478311, "grad_norm": 1.2734375, "learning_rate": 0.00018563460254987418, "loss": 4.6427, "mean_token_accuracy": 0.24042963832616807, "num_tokens": 141073964.0, "step": 81340 }, { "entropy": 5.422534799575805, "epoch": 6.328885430850029, "grad_norm": 1.328125, "learning_rate": 0.0001856091674988299, "loss": 4.7437, "mean_token_accuracy": 0.23336666822433472, "num_tokens": 141082808.0, "step": 81345 }, { "entropy": 5.395958089828492, "epoch": 6.329274460221747, "grad_norm": 1.421875, "learning_rate": 0.00018558373380414916, "loss": 4.6317, "mean_token_accuracy": 0.24446526318788528, "num_tokens": 141091665.0, "step": 81350 }, { "entropy": 5.37772421836853, "epoch": 6.3296634895934645, "grad_norm": 1.265625, "learning_rate": 0.00018555830146621793, "loss": 4.6713, "mean_token_accuracy": 0.23446041196584702, "num_tokens": 141101090.0, "step": 81355 }, { "entropy": 5.414840316772461, "epoch": 6.330052518965182, "grad_norm": 1.3515625, "learning_rate": 0.00018553287048542216, "loss": 4.6934, "mean_token_accuracy": 0.23614775538444518, "num_tokens": 141109950.0, "step": 81360 }, { "entropy": 5.389267158508301, "epoch": 6.3304415483369, "grad_norm": 1.2890625, "learning_rate": 0.00018550744086214766, "loss": 4.6182, "mean_token_accuracy": 0.25309999734163285, "num_tokens": 141118653.0, "step": 81365 }, { "entropy": 5.372490930557251, "epoch": 6.330830577708617, "grad_norm": 1.3203125, "learning_rate": 0.0001854820125967804, "loss": 4.6062, "mean_token_accuracy": 0.24692053943872452, "num_tokens": 141127293.0, "step": 81370 }, { "entropy": 5.338057899475098, "epoch": 6.331219607080334, "grad_norm": 1.3671875, "learning_rate": 0.00018545658568970585, "loss": 4.558, "mean_token_accuracy": 0.2484857991337776, "num_tokens": 141136046.0, "step": 81375 }, { "entropy": 5.261360168457031, "epoch": 6.331608636452052, "grad_norm": 1.203125, "learning_rate": 0.0001854311601413103, "loss": 4.5122, "mean_token_accuracy": 0.2576581031084061, "num_tokens": 141144609.0, "step": 81380 }, { "entropy": 5.400969314575195, "epoch": 6.33199766582377, "grad_norm": 1.28125, "learning_rate": 0.0001854057359519793, "loss": 4.6874, "mean_token_accuracy": 0.23151611685752868, "num_tokens": 141153478.0, "step": 81385 }, { "entropy": 5.384892416000366, "epoch": 6.3323866951954875, "grad_norm": 1.328125, "learning_rate": 0.00018538031312209863, "loss": 4.6075, "mean_token_accuracy": 0.24390310198068618, "num_tokens": 141161615.0, "step": 81390 }, { "entropy": 5.284872579574585, "epoch": 6.332775724567205, "grad_norm": 1.234375, "learning_rate": 0.0001853548916520541, "loss": 4.5209, "mean_token_accuracy": 0.24744713604450225, "num_tokens": 141169816.0, "step": 81395 }, { "entropy": 5.324034070968628, "epoch": 6.333164753938922, "grad_norm": 1.2578125, "learning_rate": 0.0001853294715422314, "loss": 4.5625, "mean_token_accuracy": 0.24780093431472777, "num_tokens": 141178534.0, "step": 81400 }, { "entropy": 5.406375741958618, "epoch": 6.33355378331064, "grad_norm": 1.359375, "learning_rate": 0.0001853040527930162, "loss": 4.7243, "mean_token_accuracy": 0.23195602297782897, "num_tokens": 141187645.0, "step": 81405 }, { "entropy": 5.294068384170532, "epoch": 6.333942812682357, "grad_norm": 1.2109375, "learning_rate": 0.00018527863540479427, "loss": 4.5718, "mean_token_accuracy": 0.2476823151111603, "num_tokens": 141196700.0, "step": 81410 }, { "entropy": 5.410242891311645, "epoch": 6.334331842054075, "grad_norm": 1.296875, "learning_rate": 0.00018525321937795127, "loss": 4.7193, "mean_token_accuracy": 0.2285415455698967, "num_tokens": 141205885.0, "step": 81415 }, { "entropy": 5.347273588180542, "epoch": 6.334720871425793, "grad_norm": 1.3046875, "learning_rate": 0.00018522780471287277, "loss": 4.6131, "mean_token_accuracy": 0.25738555043935774, "num_tokens": 141214291.0, "step": 81420 }, { "entropy": 5.3703343868255615, "epoch": 6.3351099007975105, "grad_norm": 1.3046875, "learning_rate": 0.00018520239140994445, "loss": 4.6488, "mean_token_accuracy": 0.23806258291006088, "num_tokens": 141223367.0, "step": 81425 }, { "entropy": 5.358229303359986, "epoch": 6.335498930169228, "grad_norm": 1.3203125, "learning_rate": 0.0001851769794695519, "loss": 4.6135, "mean_token_accuracy": 0.23853325545787812, "num_tokens": 141231510.0, "step": 81430 }, { "entropy": 5.372674942016602, "epoch": 6.335887959540945, "grad_norm": 1.3515625, "learning_rate": 0.00018515156889208079, "loss": 4.6921, "mean_token_accuracy": 0.23693556487560272, "num_tokens": 141239731.0, "step": 81435 }, { "entropy": 5.392068147659302, "epoch": 6.336276988912663, "grad_norm": 1.375, "learning_rate": 0.0001851261596779165, "loss": 4.6887, "mean_token_accuracy": 0.23697367012500764, "num_tokens": 141247728.0, "step": 81440 }, { "entropy": 5.32354211807251, "epoch": 6.33666601828438, "grad_norm": 1.3359375, "learning_rate": 0.00018510075182744473, "loss": 4.5643, "mean_token_accuracy": 0.24208179712295533, "num_tokens": 141256408.0, "step": 81445 }, { "entropy": 5.364908599853516, "epoch": 6.337055047656098, "grad_norm": 1.2265625, "learning_rate": 0.00018507534534105102, "loss": 4.6313, "mean_token_accuracy": 0.2366676524281502, "num_tokens": 141265115.0, "step": 81450 }, { "entropy": 5.446081924438476, "epoch": 6.337444077027816, "grad_norm": 1.3515625, "learning_rate": 0.00018504994021912075, "loss": 4.7411, "mean_token_accuracy": 0.22627198100090026, "num_tokens": 141273850.0, "step": 81455 }, { "entropy": 5.438184404373169, "epoch": 6.3378331063995335, "grad_norm": 1.328125, "learning_rate": 0.00018502453646203947, "loss": 4.726, "mean_token_accuracy": 0.23495671451091765, "num_tokens": 141283150.0, "step": 81460 }, { "entropy": 5.445001173019409, "epoch": 6.33822213577125, "grad_norm": 1.359375, "learning_rate": 0.0001849991340701927, "loss": 4.746, "mean_token_accuracy": 0.23022539913654327, "num_tokens": 141291748.0, "step": 81465 }, { "entropy": 5.406159925460815, "epoch": 6.338611165142968, "grad_norm": 1.3203125, "learning_rate": 0.0001849737330439658, "loss": 4.6401, "mean_token_accuracy": 0.24514369070529937, "num_tokens": 141299948.0, "step": 81470 }, { "entropy": 5.3478223323822025, "epoch": 6.339000194514686, "grad_norm": 1.34375, "learning_rate": 0.00018494833338374416, "loss": 4.5961, "mean_token_accuracy": 0.24438956379890442, "num_tokens": 141308108.0, "step": 81475 }, { "entropy": 5.369941663742066, "epoch": 6.339389223886403, "grad_norm": 1.3828125, "learning_rate": 0.0001849229350899133, "loss": 4.5926, "mean_token_accuracy": 0.24449653774499894, "num_tokens": 141316776.0, "step": 81480 }, { "entropy": 5.383547163009643, "epoch": 6.339778253258121, "grad_norm": 1.390625, "learning_rate": 0.0001848975381628585, "loss": 4.7699, "mean_token_accuracy": 0.23061421811580657, "num_tokens": 141325580.0, "step": 81485 }, { "entropy": 5.37119836807251, "epoch": 6.340167282629839, "grad_norm": 1.3046875, "learning_rate": 0.00018487214260296515, "loss": 4.6038, "mean_token_accuracy": 0.2491126298904419, "num_tokens": 141333895.0, "step": 81490 }, { "entropy": 5.420374774932862, "epoch": 6.3405563120015564, "grad_norm": 1.34375, "learning_rate": 0.00018484674841061854, "loss": 4.6663, "mean_token_accuracy": 0.2458408921957016, "num_tokens": 141342418.0, "step": 81495 }, { "entropy": 5.361188316345215, "epoch": 6.340945341373274, "grad_norm": 1.40625, "learning_rate": 0.00018482135558620406, "loss": 4.6848, "mean_token_accuracy": 0.237904454767704, "num_tokens": 141351001.0, "step": 81500 }, { "entropy": 5.388563632965088, "epoch": 6.341334370744991, "grad_norm": 1.21875, "learning_rate": 0.0001847959641301069, "loss": 4.7017, "mean_token_accuracy": 0.2412562131881714, "num_tokens": 141360296.0, "step": 81505 }, { "entropy": 5.282053899765015, "epoch": 6.341723400116709, "grad_norm": 1.375, "learning_rate": 0.00018477057404271246, "loss": 4.5945, "mean_token_accuracy": 0.23875509053468705, "num_tokens": 141368719.0, "step": 81510 }, { "entropy": 5.497072649002075, "epoch": 6.342112429488426, "grad_norm": 1.328125, "learning_rate": 0.000184745185324406, "loss": 4.8174, "mean_token_accuracy": 0.2303106278181076, "num_tokens": 141377342.0, "step": 81515 }, { "entropy": 5.467520475387573, "epoch": 6.342501458860144, "grad_norm": 1.3046875, "learning_rate": 0.00018471979797557265, "loss": 4.7381, "mean_token_accuracy": 0.232885479927063, "num_tokens": 141385276.0, "step": 81520 }, { "entropy": 5.346171188354492, "epoch": 6.342890488231862, "grad_norm": 1.28125, "learning_rate": 0.0001846944119965977, "loss": 4.6736, "mean_token_accuracy": 0.2336803361773491, "num_tokens": 141395070.0, "step": 81525 }, { "entropy": 5.449671983718872, "epoch": 6.343279517603579, "grad_norm": 1.34375, "learning_rate": 0.0001846690273878663, "loss": 4.6512, "mean_token_accuracy": 0.24038079679012297, "num_tokens": 141403263.0, "step": 81530 }, { "entropy": 5.45230770111084, "epoch": 6.343668546975296, "grad_norm": 1.3359375, "learning_rate": 0.00018464364414976365, "loss": 4.7301, "mean_token_accuracy": 0.23384605646133422, "num_tokens": 141411666.0, "step": 81535 }, { "entropy": 5.37118558883667, "epoch": 6.344057576347014, "grad_norm": 1.359375, "learning_rate": 0.0001846182622826748, "loss": 4.6383, "mean_token_accuracy": 0.2437436357140541, "num_tokens": 141419668.0, "step": 81540 }, { "entropy": 5.417099952697754, "epoch": 6.344446605718732, "grad_norm": 1.3046875, "learning_rate": 0.00018459288178698503, "loss": 4.7154, "mean_token_accuracy": 0.23912646770477294, "num_tokens": 141427413.0, "step": 81545 }, { "entropy": 5.312813568115234, "epoch": 6.344835635090449, "grad_norm": 1.3828125, "learning_rate": 0.0001845675026630794, "loss": 4.5676, "mean_token_accuracy": 0.24752648919820786, "num_tokens": 141436079.0, "step": 81550 }, { "entropy": 5.342815017700195, "epoch": 6.345224664462167, "grad_norm": 1.265625, "learning_rate": 0.00018454212491134293, "loss": 4.6627, "mean_token_accuracy": 0.24328865259885787, "num_tokens": 141444734.0, "step": 81555 }, { "entropy": 5.40089979171753, "epoch": 6.345613693833885, "grad_norm": 1.3203125, "learning_rate": 0.00018451674853216084, "loss": 4.7126, "mean_token_accuracy": 0.2367200180888176, "num_tokens": 141453346.0, "step": 81560 }, { "entropy": 5.434236335754394, "epoch": 6.346002723205602, "grad_norm": 1.4140625, "learning_rate": 0.00018449137352591794, "loss": 4.7107, "mean_token_accuracy": 0.2329110860824585, "num_tokens": 141462029.0, "step": 81565 }, { "entropy": 5.363843297958374, "epoch": 6.346391752577319, "grad_norm": 1.2265625, "learning_rate": 0.00018446599989299946, "loss": 4.5728, "mean_token_accuracy": 0.24300796389579774, "num_tokens": 141471221.0, "step": 81570 }, { "entropy": 5.308146572113037, "epoch": 6.346780781949037, "grad_norm": 1.2734375, "learning_rate": 0.00018444062763379023, "loss": 4.5383, "mean_token_accuracy": 0.24766848534345626, "num_tokens": 141479531.0, "step": 81575 }, { "entropy": 5.3172389507293705, "epoch": 6.347169811320755, "grad_norm": 1.3671875, "learning_rate": 0.00018441525674867544, "loss": 4.6372, "mean_token_accuracy": 0.23629772812128066, "num_tokens": 141488423.0, "step": 81580 }, { "entropy": 5.341009902954101, "epoch": 6.347558840692472, "grad_norm": 1.3671875, "learning_rate": 0.0001843898872380399, "loss": 4.6214, "mean_token_accuracy": 0.23789576888084413, "num_tokens": 141496406.0, "step": 81585 }, { "entropy": 5.40327091217041, "epoch": 6.34794787006419, "grad_norm": 1.296875, "learning_rate": 0.00018436451910226864, "loss": 4.7026, "mean_token_accuracy": 0.23814139813184737, "num_tokens": 141504670.0, "step": 81590 }, { "entropy": 5.327240324020385, "epoch": 6.348336899435908, "grad_norm": 1.234375, "learning_rate": 0.00018433915234174653, "loss": 4.6855, "mean_token_accuracy": 0.24208236187696458, "num_tokens": 141514095.0, "step": 81595 }, { "entropy": 5.38925313949585, "epoch": 6.3487259288076245, "grad_norm": 1.265625, "learning_rate": 0.00018431378695685845, "loss": 4.6524, "mean_token_accuracy": 0.24351726323366166, "num_tokens": 141522735.0, "step": 81600 }, { "entropy": 5.355852794647217, "epoch": 6.349114958179342, "grad_norm": 1.2578125, "learning_rate": 0.00018428842294798936, "loss": 4.5913, "mean_token_accuracy": 0.25054378658533094, "num_tokens": 141531932.0, "step": 81605 }, { "entropy": 5.3909155368804935, "epoch": 6.34950398755106, "grad_norm": 1.3828125, "learning_rate": 0.00018426306031552408, "loss": 4.595, "mean_token_accuracy": 0.24641761630773545, "num_tokens": 141540951.0, "step": 81610 }, { "entropy": 5.315446853637695, "epoch": 6.349893016922778, "grad_norm": 1.3515625, "learning_rate": 0.00018423769905984738, "loss": 4.5867, "mean_token_accuracy": 0.2426667556166649, "num_tokens": 141549524.0, "step": 81615 }, { "entropy": 5.342108345031738, "epoch": 6.350282046294495, "grad_norm": 1.3203125, "learning_rate": 0.00018421233918134418, "loss": 4.6401, "mean_token_accuracy": 0.2486641824245453, "num_tokens": 141557348.0, "step": 81620 }, { "entropy": 5.360350942611694, "epoch": 6.350671075666213, "grad_norm": 1.3359375, "learning_rate": 0.0001841869806803992, "loss": 4.6562, "mean_token_accuracy": 0.23844075947999954, "num_tokens": 141565571.0, "step": 81625 }, { "entropy": 5.3840258598327635, "epoch": 6.351060105037931, "grad_norm": 1.34375, "learning_rate": 0.00018416162355739725, "loss": 4.6818, "mean_token_accuracy": 0.2327819988131523, "num_tokens": 141574231.0, "step": 81630 }, { "entropy": 5.383302068710327, "epoch": 6.3514491344096475, "grad_norm": 1.34375, "learning_rate": 0.0001841362678127231, "loss": 4.6206, "mean_token_accuracy": 0.24712872505187988, "num_tokens": 141582653.0, "step": 81635 }, { "entropy": 5.402147245407105, "epoch": 6.351838163781365, "grad_norm": 1.328125, "learning_rate": 0.0001841109134467614, "loss": 4.7056, "mean_token_accuracy": 0.23616975247859956, "num_tokens": 141591131.0, "step": 81640 }, { "entropy": 5.369479322433472, "epoch": 6.352227193153083, "grad_norm": 1.265625, "learning_rate": 0.00018408556045989693, "loss": 4.6496, "mean_token_accuracy": 0.24195281118154527, "num_tokens": 141600352.0, "step": 81645 }, { "entropy": 5.377424049377441, "epoch": 6.352616222524801, "grad_norm": 1.265625, "learning_rate": 0.0001840602088525144, "loss": 4.6687, "mean_token_accuracy": 0.24609695076942445, "num_tokens": 141608908.0, "step": 81650 }, { "entropy": 5.4525219917297365, "epoch": 6.353005251896518, "grad_norm": 1.2421875, "learning_rate": 0.00018403485862499846, "loss": 4.7483, "mean_token_accuracy": 0.2348211631178856, "num_tokens": 141619012.0, "step": 81655 }, { "entropy": 5.419418668746948, "epoch": 6.353394281268236, "grad_norm": 1.28125, "learning_rate": 0.00018400950977773379, "loss": 4.6502, "mean_token_accuracy": 0.24188035130500793, "num_tokens": 141628922.0, "step": 81660 }, { "entropy": 5.3910266876220705, "epoch": 6.353783310639954, "grad_norm": 1.34375, "learning_rate": 0.00018398416231110492, "loss": 4.6726, "mean_token_accuracy": 0.24056272357702255, "num_tokens": 141637628.0, "step": 81665 }, { "entropy": 5.34161958694458, "epoch": 6.3541723400116705, "grad_norm": 1.40625, "learning_rate": 0.0001839588162254966, "loss": 4.6119, "mean_token_accuracy": 0.24218100756406785, "num_tokens": 141646362.0, "step": 81670 }, { "entropy": 5.290633726119995, "epoch": 6.354561369383388, "grad_norm": 1.2734375, "learning_rate": 0.0001839334715212933, "loss": 4.612, "mean_token_accuracy": 0.24143652319908143, "num_tokens": 141656120.0, "step": 81675 }, { "entropy": 5.4283034324646, "epoch": 6.354950398755106, "grad_norm": 1.34375, "learning_rate": 0.0001839081281988796, "loss": 4.707, "mean_token_accuracy": 0.23435209542512894, "num_tokens": 141664833.0, "step": 81680 }, { "entropy": 5.488491344451904, "epoch": 6.355339428126824, "grad_norm": 1.390625, "learning_rate": 0.00018388278625864008, "loss": 4.714, "mean_token_accuracy": 0.23372249007225038, "num_tokens": 141673823.0, "step": 81685 }, { "entropy": 5.325438070297241, "epoch": 6.355728457498541, "grad_norm": 1.2890625, "learning_rate": 0.00018385744570095924, "loss": 4.5165, "mean_token_accuracy": 0.25430536866188047, "num_tokens": 141682086.0, "step": 81690 }, { "entropy": 5.383369112014771, "epoch": 6.356117486870259, "grad_norm": 1.2890625, "learning_rate": 0.0001838321065262216, "loss": 4.666, "mean_token_accuracy": 0.24089957624673844, "num_tokens": 141691167.0, "step": 81695 }, { "entropy": 5.360728359222412, "epoch": 6.356506516241977, "grad_norm": 1.3671875, "learning_rate": 0.00018380676873481168, "loss": 4.671, "mean_token_accuracy": 0.23873160928487777, "num_tokens": 141699781.0, "step": 81700 }, { "entropy": 5.375424194335937, "epoch": 6.3568955456136935, "grad_norm": 1.2890625, "learning_rate": 0.00018378143232711375, "loss": 4.6201, "mean_token_accuracy": 0.24610953778028488, "num_tokens": 141708646.0, "step": 81705 }, { "entropy": 5.3503447532653805, "epoch": 6.357284574985411, "grad_norm": 1.359375, "learning_rate": 0.0001837560973035125, "loss": 4.5863, "mean_token_accuracy": 0.24339659959077836, "num_tokens": 141717105.0, "step": 81710 }, { "entropy": 5.3968620777130125, "epoch": 6.357673604357129, "grad_norm": 1.390625, "learning_rate": 0.00018373076366439228, "loss": 4.6245, "mean_token_accuracy": 0.23972884118556975, "num_tokens": 141725712.0, "step": 81715 }, { "entropy": 5.366573333740234, "epoch": 6.358062633728847, "grad_norm": 1.2421875, "learning_rate": 0.0001837054314101374, "loss": 4.6461, "mean_token_accuracy": 0.2380531519651413, "num_tokens": 141735142.0, "step": 81720 }, { "entropy": 5.387720060348511, "epoch": 6.358451663100564, "grad_norm": 1.3515625, "learning_rate": 0.00018368010054113233, "loss": 4.5899, "mean_token_accuracy": 0.24297941774129866, "num_tokens": 141743732.0, "step": 81725 }, { "entropy": 5.460933637619019, "epoch": 6.358840692472282, "grad_norm": 1.375, "learning_rate": 0.0001836547710577613, "loss": 4.666, "mean_token_accuracy": 0.23835860341787338, "num_tokens": 141752459.0, "step": 81730 }, { "entropy": 5.478852891921997, "epoch": 6.359229721843999, "grad_norm": 1.3046875, "learning_rate": 0.0001836294429604088, "loss": 4.7983, "mean_token_accuracy": 0.23477291762828828, "num_tokens": 141761345.0, "step": 81735 }, { "entropy": 5.441839361190796, "epoch": 6.3596187512157165, "grad_norm": 1.40625, "learning_rate": 0.00018360411624945906, "loss": 4.7293, "mean_token_accuracy": 0.22620386332273484, "num_tokens": 141770326.0, "step": 81740 }, { "entropy": 5.475213432312012, "epoch": 6.360007780587434, "grad_norm": 1.390625, "learning_rate": 0.0001835787909252964, "loss": 4.7563, "mean_token_accuracy": 0.2387345850467682, "num_tokens": 141778794.0, "step": 81745 }, { "entropy": 5.472924900054932, "epoch": 6.360396809959152, "grad_norm": 1.2890625, "learning_rate": 0.00018355346698830505, "loss": 4.7818, "mean_token_accuracy": 0.23250727355480194, "num_tokens": 141787885.0, "step": 81750 }, { "entropy": 5.402604818344116, "epoch": 6.36078583933087, "grad_norm": 1.1953125, "learning_rate": 0.00018352814443886928, "loss": 4.6261, "mean_token_accuracy": 0.2402128666639328, "num_tokens": 141796974.0, "step": 81755 }, { "entropy": 5.460384559631348, "epoch": 6.361174868702587, "grad_norm": 1.2734375, "learning_rate": 0.00018350282327737338, "loss": 4.6876, "mean_token_accuracy": 0.24160350412130355, "num_tokens": 141805712.0, "step": 81760 }, { "entropy": 5.4405077457427975, "epoch": 6.361563898074305, "grad_norm": 1.2734375, "learning_rate": 0.00018347750350420145, "loss": 4.7107, "mean_token_accuracy": 0.23920608460903167, "num_tokens": 141814597.0, "step": 81765 }, { "entropy": 5.417399883270264, "epoch": 6.361952927446022, "grad_norm": 1.328125, "learning_rate": 0.00018345218511973773, "loss": 4.7357, "mean_token_accuracy": 0.2342400997877121, "num_tokens": 141823668.0, "step": 81770 }, { "entropy": 5.331061840057373, "epoch": 6.3623419568177395, "grad_norm": 1.21875, "learning_rate": 0.00018342686812436633, "loss": 4.6442, "mean_token_accuracy": 0.2369713693857193, "num_tokens": 141832040.0, "step": 81775 }, { "entropy": 5.342257452011109, "epoch": 6.362730986189457, "grad_norm": 1.21875, "learning_rate": 0.00018340155251847157, "loss": 4.5861, "mean_token_accuracy": 0.24306774884462357, "num_tokens": 141840768.0, "step": 81780 }, { "entropy": 5.4087584018707275, "epoch": 6.363120015561175, "grad_norm": 1.40625, "learning_rate": 0.0001833762383024374, "loss": 4.7076, "mean_token_accuracy": 0.22625284641981125, "num_tokens": 141849931.0, "step": 81785 }, { "entropy": 5.349915027618408, "epoch": 6.363509044932893, "grad_norm": 1.2890625, "learning_rate": 0.000183350925476648, "loss": 4.6443, "mean_token_accuracy": 0.23782870769500733, "num_tokens": 141858955.0, "step": 81790 }, { "entropy": 5.2893274307250975, "epoch": 6.36389807430461, "grad_norm": 1.3828125, "learning_rate": 0.00018332561404148739, "loss": 4.5283, "mean_token_accuracy": 0.25127232670783994, "num_tokens": 141867675.0, "step": 81795 }, { "entropy": 5.380553722381592, "epoch": 6.364287103676327, "grad_norm": 1.2890625, "learning_rate": 0.0001833003039973397, "loss": 4.5793, "mean_token_accuracy": 0.24327391088008882, "num_tokens": 141876264.0, "step": 81800 }, { "entropy": 5.457530879974366, "epoch": 6.364676133048045, "grad_norm": 1.4296875, "learning_rate": 0.00018327499534458896, "loss": 4.7301, "mean_token_accuracy": 0.233053158223629, "num_tokens": 141884805.0, "step": 81805 }, { "entropy": 5.417302036285401, "epoch": 6.3650651624197625, "grad_norm": 1.2890625, "learning_rate": 0.00018324968808361913, "loss": 4.6416, "mean_token_accuracy": 0.2443991258740425, "num_tokens": 141892825.0, "step": 81810 }, { "entropy": 5.41368293762207, "epoch": 6.36545419179148, "grad_norm": 1.5078125, "learning_rate": 0.0001832243822148143, "loss": 4.7199, "mean_token_accuracy": 0.23828549683094025, "num_tokens": 141902011.0, "step": 81815 }, { "entropy": 5.485558271408081, "epoch": 6.365843221163198, "grad_norm": 1.3125, "learning_rate": 0.00018319907773855837, "loss": 4.775, "mean_token_accuracy": 0.23361821174621583, "num_tokens": 141910837.0, "step": 81820 }, { "entropy": 5.388908433914184, "epoch": 6.366232250534916, "grad_norm": 1.2890625, "learning_rate": 0.00018317377465523532, "loss": 4.6231, "mean_token_accuracy": 0.23674268573522567, "num_tokens": 141919447.0, "step": 81825 }, { "entropy": 5.417634391784668, "epoch": 6.366621279906633, "grad_norm": 1.296875, "learning_rate": 0.00018314847296522908, "loss": 4.6649, "mean_token_accuracy": 0.2364397391676903, "num_tokens": 141927628.0, "step": 81830 }, { "entropy": 5.418837594985962, "epoch": 6.36701030927835, "grad_norm": 1.25, "learning_rate": 0.00018312317266892358, "loss": 4.6513, "mean_token_accuracy": 0.23429521471261977, "num_tokens": 141936248.0, "step": 81835 }, { "entropy": 5.376932859420776, "epoch": 6.367399338650068, "grad_norm": 1.328125, "learning_rate": 0.0001830978737667026, "loss": 4.6234, "mean_token_accuracy": 0.234259994328022, "num_tokens": 141944821.0, "step": 81840 }, { "entropy": 5.411740684509278, "epoch": 6.3677883680217855, "grad_norm": 1.328125, "learning_rate": 0.0001830725762589502, "loss": 4.7029, "mean_token_accuracy": 0.23760416656732558, "num_tokens": 141953954.0, "step": 81845 }, { "entropy": 5.331614875793457, "epoch": 6.368177397393503, "grad_norm": 1.3046875, "learning_rate": 0.0001830472801460501, "loss": 4.595, "mean_token_accuracy": 0.24298890829086303, "num_tokens": 141962969.0, "step": 81850 }, { "entropy": 5.3686851978302, "epoch": 6.368566426765221, "grad_norm": 1.40625, "learning_rate": 0.00018302198542838622, "loss": 4.7064, "mean_token_accuracy": 0.23919731229543686, "num_tokens": 141971008.0, "step": 81855 }, { "entropy": 5.3630022525787355, "epoch": 6.368955456136939, "grad_norm": 1.2109375, "learning_rate": 0.00018299669210634234, "loss": 4.6683, "mean_token_accuracy": 0.24461256414651872, "num_tokens": 141980802.0, "step": 81860 }, { "entropy": 5.378611040115357, "epoch": 6.369344485508656, "grad_norm": 1.515625, "learning_rate": 0.00018297140018030212, "loss": 4.5941, "mean_token_accuracy": 0.23938099592924117, "num_tokens": 141989303.0, "step": 81865 }, { "entropy": 5.46697154045105, "epoch": 6.369733514880373, "grad_norm": 1.3046875, "learning_rate": 0.00018294610965064945, "loss": 4.7358, "mean_token_accuracy": 0.22796095609664918, "num_tokens": 141998146.0, "step": 81870 }, { "entropy": 5.367310476303101, "epoch": 6.370122544252091, "grad_norm": 1.296875, "learning_rate": 0.00018292082051776809, "loss": 4.6227, "mean_token_accuracy": 0.24019922763109208, "num_tokens": 142006303.0, "step": 81875 }, { "entropy": 5.2997650623321535, "epoch": 6.3705115736238085, "grad_norm": 1.3125, "learning_rate": 0.00018289553278204174, "loss": 4.5498, "mean_token_accuracy": 0.240702848136425, "num_tokens": 142014540.0, "step": 81880 }, { "entropy": 5.421625804901123, "epoch": 6.370900602995526, "grad_norm": 1.453125, "learning_rate": 0.00018287024644385397, "loss": 4.6242, "mean_token_accuracy": 0.23887188732624054, "num_tokens": 142022910.0, "step": 81885 }, { "entropy": 5.4814472675323485, "epoch": 6.371289632367244, "grad_norm": 1.3203125, "learning_rate": 0.00018284496150358865, "loss": 4.7576, "mean_token_accuracy": 0.23407843559980393, "num_tokens": 142032271.0, "step": 81890 }, { "entropy": 5.386371660232544, "epoch": 6.371678661738962, "grad_norm": 1.2890625, "learning_rate": 0.00018281967796162935, "loss": 4.6156, "mean_token_accuracy": 0.24722603261470794, "num_tokens": 142040934.0, "step": 81895 }, { "entropy": 5.373214149475098, "epoch": 6.372067691110679, "grad_norm": 1.3046875, "learning_rate": 0.0001827943958183597, "loss": 4.6629, "mean_token_accuracy": 0.23342284113168715, "num_tokens": 142049127.0, "step": 81900 }, { "entropy": 5.3290375709533695, "epoch": 6.372456720482396, "grad_norm": 1.2734375, "learning_rate": 0.00018276911507416333, "loss": 4.6203, "mean_token_accuracy": 0.2354627639055252, "num_tokens": 142057535.0, "step": 81905 }, { "entropy": 5.39911470413208, "epoch": 6.372845749854114, "grad_norm": 1.3203125, "learning_rate": 0.0001827438357294238, "loss": 4.6748, "mean_token_accuracy": 0.23726222962141036, "num_tokens": 142065962.0, "step": 81910 }, { "entropy": 5.376339054107666, "epoch": 6.3732347792258315, "grad_norm": 1.390625, "learning_rate": 0.00018271855778452485, "loss": 4.6465, "mean_token_accuracy": 0.2407628744840622, "num_tokens": 142074531.0, "step": 81915 }, { "entropy": 5.351188516616821, "epoch": 6.373623808597549, "grad_norm": 1.234375, "learning_rate": 0.0001826932812398498, "loss": 4.6111, "mean_token_accuracy": 0.24652115851640702, "num_tokens": 142083554.0, "step": 81920 }, { "entropy": 5.392584943771363, "epoch": 6.374012837969267, "grad_norm": 1.265625, "learning_rate": 0.00018266800609578233, "loss": 4.6315, "mean_token_accuracy": 0.24688238203525542, "num_tokens": 142092117.0, "step": 81925 }, { "entropy": 5.379878139495849, "epoch": 6.374401867340985, "grad_norm": 1.3515625, "learning_rate": 0.0001826427323527059, "loss": 4.6954, "mean_token_accuracy": 0.23215968906879425, "num_tokens": 142101415.0, "step": 81930 }, { "entropy": 5.403899812698365, "epoch": 6.374790896712701, "grad_norm": 1.2734375, "learning_rate": 0.000182617460011004, "loss": 4.6614, "mean_token_accuracy": 0.23737689703702927, "num_tokens": 142110100.0, "step": 81935 }, { "entropy": 5.4512005805969235, "epoch": 6.375179926084419, "grad_norm": 1.25, "learning_rate": 0.00018259218907106013, "loss": 4.6159, "mean_token_accuracy": 0.24001251459121703, "num_tokens": 142118405.0, "step": 81940 }, { "entropy": 5.27708215713501, "epoch": 6.375568955456137, "grad_norm": 1.203125, "learning_rate": 0.00018256691953325767, "loss": 4.5305, "mean_token_accuracy": 0.24942998290061952, "num_tokens": 142127332.0, "step": 81945 }, { "entropy": 5.393292856216431, "epoch": 6.3759579848278545, "grad_norm": 1.375, "learning_rate": 0.00018254165139798006, "loss": 4.6208, "mean_token_accuracy": 0.24353747814893723, "num_tokens": 142136018.0, "step": 81950 }, { "entropy": 5.3412312984466555, "epoch": 6.376347014199572, "grad_norm": 1.3203125, "learning_rate": 0.00018251638466561083, "loss": 4.7083, "mean_token_accuracy": 0.23640664368867875, "num_tokens": 142145040.0, "step": 81955 }, { "entropy": 5.379727935791015, "epoch": 6.37673604357129, "grad_norm": 1.46875, "learning_rate": 0.00018249111933653313, "loss": 4.5924, "mean_token_accuracy": 0.24310518950223922, "num_tokens": 142153879.0, "step": 81960 }, { "entropy": 5.367972373962402, "epoch": 6.377125072943008, "grad_norm": 1.3984375, "learning_rate": 0.00018246585541113053, "loss": 4.6269, "mean_token_accuracy": 0.24690053164958953, "num_tokens": 142162269.0, "step": 81965 }, { "entropy": 5.398870229721069, "epoch": 6.377514102314724, "grad_norm": 1.375, "learning_rate": 0.0001824405928897862, "loss": 4.6896, "mean_token_accuracy": 0.2368488445878029, "num_tokens": 142170535.0, "step": 81970 }, { "entropy": 5.373088455200195, "epoch": 6.377903131686442, "grad_norm": 1.234375, "learning_rate": 0.00018241533177288367, "loss": 4.6473, "mean_token_accuracy": 0.2376559481024742, "num_tokens": 142180043.0, "step": 81975 }, { "entropy": 5.321472454071045, "epoch": 6.37829216105816, "grad_norm": 1.3359375, "learning_rate": 0.00018239007206080605, "loss": 4.583, "mean_token_accuracy": 0.24278482645750046, "num_tokens": 142188322.0, "step": 81980 }, { "entropy": 5.46144289970398, "epoch": 6.3786811904298775, "grad_norm": 1.390625, "learning_rate": 0.0001823648137539367, "loss": 4.6917, "mean_token_accuracy": 0.24894859939813613, "num_tokens": 142196828.0, "step": 81985 }, { "entropy": 5.350796699523926, "epoch": 6.379070219801595, "grad_norm": 1.2734375, "learning_rate": 0.00018233955685265885, "loss": 4.551, "mean_token_accuracy": 0.2485095053911209, "num_tokens": 142205943.0, "step": 81990 }, { "entropy": 5.363320541381836, "epoch": 6.379459249173313, "grad_norm": 1.2890625, "learning_rate": 0.00018231430135735573, "loss": 4.6011, "mean_token_accuracy": 0.25058511942625045, "num_tokens": 142214732.0, "step": 81995 }, { "entropy": 5.398632049560547, "epoch": 6.379848278545031, "grad_norm": 1.3359375, "learning_rate": 0.00018228904726841062, "loss": 4.6933, "mean_token_accuracy": 0.23812761306762695, "num_tokens": 142224053.0, "step": 82000 }, { "entropy": 5.315751028060913, "epoch": 6.380237307916747, "grad_norm": 1.25, "learning_rate": 0.00018226379458620656, "loss": 4.5815, "mean_token_accuracy": 0.2454157754778862, "num_tokens": 142232715.0, "step": 82005 }, { "entropy": 5.34528341293335, "epoch": 6.380626337288465, "grad_norm": 1.3046875, "learning_rate": 0.00018223854331112695, "loss": 4.6575, "mean_token_accuracy": 0.23794249147176744, "num_tokens": 142241277.0, "step": 82010 }, { "entropy": 5.460067367553711, "epoch": 6.381015366660183, "grad_norm": 1.3828125, "learning_rate": 0.00018221329344355464, "loss": 4.7708, "mean_token_accuracy": 0.23725757449865342, "num_tokens": 142250646.0, "step": 82015 }, { "entropy": 5.517052078247071, "epoch": 6.3814043960319005, "grad_norm": 1.265625, "learning_rate": 0.00018218804498387308, "loss": 4.76, "mean_token_accuracy": 0.23118478804826736, "num_tokens": 142259983.0, "step": 82020 }, { "entropy": 5.465401268005371, "epoch": 6.381793425403618, "grad_norm": 1.3828125, "learning_rate": 0.0001821627979324651, "loss": 4.6741, "mean_token_accuracy": 0.23786509335041045, "num_tokens": 142269029.0, "step": 82025 }, { "entropy": 5.4050312519073485, "epoch": 6.382182454775336, "grad_norm": 1.359375, "learning_rate": 0.0001821375522897139, "loss": 4.6153, "mean_token_accuracy": 0.24565163254737854, "num_tokens": 142277445.0, "step": 82030 }, { "entropy": 5.33351731300354, "epoch": 6.3825714841470536, "grad_norm": 1.2265625, "learning_rate": 0.0001821123080560026, "loss": 4.5901, "mean_token_accuracy": 0.252828748524189, "num_tokens": 142286400.0, "step": 82035 }, { "entropy": 5.271478605270386, "epoch": 6.38296051351877, "grad_norm": 1.2578125, "learning_rate": 0.00018208706523171404, "loss": 4.5503, "mean_token_accuracy": 0.24840150028467178, "num_tokens": 142295528.0, "step": 82040 }, { "entropy": 5.391713237762451, "epoch": 6.383349542890488, "grad_norm": 1.3515625, "learning_rate": 0.00018206182381723146, "loss": 4.6961, "mean_token_accuracy": 0.24021245539188385, "num_tokens": 142304148.0, "step": 82045 }, { "entropy": 5.402368545532227, "epoch": 6.383738572262206, "grad_norm": 1.28125, "learning_rate": 0.00018203658381293786, "loss": 4.6953, "mean_token_accuracy": 0.23334311693906784, "num_tokens": 142312720.0, "step": 82050 }, { "entropy": 5.466646814346314, "epoch": 6.3841276016339235, "grad_norm": 1.2265625, "learning_rate": 0.00018201134521921602, "loss": 4.6889, "mean_token_accuracy": 0.2347816750407219, "num_tokens": 142322422.0, "step": 82055 }, { "entropy": 5.3408647060394285, "epoch": 6.384516631005641, "grad_norm": 1.3828125, "learning_rate": 0.0001819861080364491, "loss": 4.5598, "mean_token_accuracy": 0.24860088229179383, "num_tokens": 142330081.0, "step": 82060 }, { "entropy": 5.331630086898803, "epoch": 6.384905660377359, "grad_norm": 1.3359375, "learning_rate": 0.0001819608722650199, "loss": 4.5793, "mean_token_accuracy": 0.24902829229831697, "num_tokens": 142338588.0, "step": 82065 }, { "entropy": 5.375982713699341, "epoch": 6.385294689749076, "grad_norm": 1.4453125, "learning_rate": 0.00018193563790531138, "loss": 4.7203, "mean_token_accuracy": 0.24178221821784973, "num_tokens": 142347680.0, "step": 82070 }, { "entropy": 5.399868488311768, "epoch": 6.385683719120793, "grad_norm": 1.359375, "learning_rate": 0.0001819104049577064, "loss": 4.6937, "mean_token_accuracy": 0.23545539677143096, "num_tokens": 142356503.0, "step": 82075 }, { "entropy": 5.401919794082642, "epoch": 6.386072748492511, "grad_norm": 1.3515625, "learning_rate": 0.00018188517342258793, "loss": 4.6375, "mean_token_accuracy": 0.23690478056669234, "num_tokens": 142364985.0, "step": 82080 }, { "entropy": 5.478675603866577, "epoch": 6.386461777864229, "grad_norm": 1.296875, "learning_rate": 0.00018185994330033867, "loss": 4.7636, "mean_token_accuracy": 0.22478411793708802, "num_tokens": 142373322.0, "step": 82085 }, { "entropy": 5.444008922576904, "epoch": 6.3868508072359464, "grad_norm": 1.3125, "learning_rate": 0.00018183471459134155, "loss": 4.7221, "mean_token_accuracy": 0.23277215510606766, "num_tokens": 142382424.0, "step": 82090 }, { "entropy": 5.40822696685791, "epoch": 6.387239836607664, "grad_norm": 1.3046875, "learning_rate": 0.00018180948729597935, "loss": 4.5735, "mean_token_accuracy": 0.24074033945798873, "num_tokens": 142390727.0, "step": 82095 }, { "entropy": 5.378018093109131, "epoch": 6.387628865979382, "grad_norm": 1.2734375, "learning_rate": 0.00018178426141463489, "loss": 4.6573, "mean_token_accuracy": 0.23915650844573974, "num_tokens": 142399730.0, "step": 82100 }, { "entropy": 5.3933806896209715, "epoch": 6.388017895351099, "grad_norm": 1.2578125, "learning_rate": 0.00018175903694769074, "loss": 4.6636, "mean_token_accuracy": 0.23441509753465653, "num_tokens": 142408839.0, "step": 82105 }, { "entropy": 5.441501760482788, "epoch": 6.388406924722816, "grad_norm": 1.2109375, "learning_rate": 0.00018173381389552994, "loss": 4.6273, "mean_token_accuracy": 0.244753797352314, "num_tokens": 142417752.0, "step": 82110 }, { "entropy": 5.472310733795166, "epoch": 6.388795954094534, "grad_norm": 1.5859375, "learning_rate": 0.00018170859225853504, "loss": 4.7082, "mean_token_accuracy": 0.235901902616024, "num_tokens": 142425593.0, "step": 82115 }, { "entropy": 5.282119464874268, "epoch": 6.389184983466252, "grad_norm": 1.1484375, "learning_rate": 0.0001816833720370888, "loss": 4.5791, "mean_token_accuracy": 0.2447889655828476, "num_tokens": 142434572.0, "step": 82120 }, { "entropy": 5.355295658111572, "epoch": 6.389574012837969, "grad_norm": 1.3046875, "learning_rate": 0.00018165815323157377, "loss": 4.6522, "mean_token_accuracy": 0.23986128866672515, "num_tokens": 142443388.0, "step": 82125 }, { "entropy": 5.485706949234009, "epoch": 6.389963042209687, "grad_norm": 1.5234375, "learning_rate": 0.0001816329358423728, "loss": 4.7697, "mean_token_accuracy": 0.23387398272752763, "num_tokens": 142451763.0, "step": 82130 }, { "entropy": 5.420133876800537, "epoch": 6.390352071581404, "grad_norm": 1.296875, "learning_rate": 0.00018160771986986836, "loss": 4.6341, "mean_token_accuracy": 0.23864349573850632, "num_tokens": 142459949.0, "step": 82135 }, { "entropy": 5.436772441864013, "epoch": 6.390741100953122, "grad_norm": 1.265625, "learning_rate": 0.00018158250531444316, "loss": 4.6801, "mean_token_accuracy": 0.24552912563085555, "num_tokens": 142468915.0, "step": 82140 }, { "entropy": 5.458391809463501, "epoch": 6.391130130324839, "grad_norm": 1.328125, "learning_rate": 0.0001815572921764797, "loss": 4.6829, "mean_token_accuracy": 0.23844251185655593, "num_tokens": 142477040.0, "step": 82145 }, { "entropy": 5.370807123184204, "epoch": 6.391519159696557, "grad_norm": 1.34375, "learning_rate": 0.0001815320804563606, "loss": 4.6127, "mean_token_accuracy": 0.25233336091041564, "num_tokens": 142485953.0, "step": 82150 }, { "entropy": 5.362776136398315, "epoch": 6.391908189068275, "grad_norm": 1.359375, "learning_rate": 0.00018150687015446842, "loss": 4.6676, "mean_token_accuracy": 0.2354375198483467, "num_tokens": 142494074.0, "step": 82155 }, { "entropy": 5.424072217941284, "epoch": 6.392297218439992, "grad_norm": 1.328125, "learning_rate": 0.0001814816612711857, "loss": 4.7416, "mean_token_accuracy": 0.23425615727901458, "num_tokens": 142504241.0, "step": 82160 }, { "entropy": 5.3328159809112545, "epoch": 6.39268624781171, "grad_norm": 1.375, "learning_rate": 0.0001814564538068949, "loss": 4.6194, "mean_token_accuracy": 0.24161644876003266, "num_tokens": 142514154.0, "step": 82165 }, { "entropy": 5.395192432403564, "epoch": 6.393075277183427, "grad_norm": 1.3515625, "learning_rate": 0.00018143124776197851, "loss": 4.6553, "mean_token_accuracy": 0.2379287913441658, "num_tokens": 142522958.0, "step": 82170 }, { "entropy": 5.410838079452515, "epoch": 6.393464306555145, "grad_norm": 1.28125, "learning_rate": 0.00018140604313681902, "loss": 4.6611, "mean_token_accuracy": 0.23812813460826873, "num_tokens": 142531878.0, "step": 82175 }, { "entropy": 5.376241302490234, "epoch": 6.393853335926862, "grad_norm": 1.328125, "learning_rate": 0.0001813808399317989, "loss": 4.5557, "mean_token_accuracy": 0.24799149185419084, "num_tokens": 142539974.0, "step": 82180 }, { "entropy": 5.291793394088745, "epoch": 6.39424236529858, "grad_norm": 1.2421875, "learning_rate": 0.00018135563814730056, "loss": 4.5501, "mean_token_accuracy": 0.24842403531074525, "num_tokens": 142548607.0, "step": 82185 }, { "entropy": 5.406942653656006, "epoch": 6.394631394670298, "grad_norm": 1.359375, "learning_rate": 0.00018133043778370623, "loss": 4.7543, "mean_token_accuracy": 0.234139883518219, "num_tokens": 142557975.0, "step": 82190 }, { "entropy": 5.400814437866211, "epoch": 6.395020424042015, "grad_norm": 1.40625, "learning_rate": 0.0001813052388413985, "loss": 4.7087, "mean_token_accuracy": 0.23189706206321717, "num_tokens": 142566202.0, "step": 82195 }, { "entropy": 5.37941346168518, "epoch": 6.395409453413733, "grad_norm": 1.3203125, "learning_rate": 0.00018128004132075953, "loss": 4.5918, "mean_token_accuracy": 0.24848803728818894, "num_tokens": 142574318.0, "step": 82200 }, { "entropy": 5.399551868438721, "epoch": 6.39579848278545, "grad_norm": 1.3125, "learning_rate": 0.00018125484522217195, "loss": 4.6182, "mean_token_accuracy": 0.2469880610704422, "num_tokens": 142581910.0, "step": 82205 }, { "entropy": 5.402128553390503, "epoch": 6.396187512157168, "grad_norm": 1.53125, "learning_rate": 0.0001812296505460177, "loss": 4.7084, "mean_token_accuracy": 0.23227871656417848, "num_tokens": 142590306.0, "step": 82210 }, { "entropy": 5.413269424438477, "epoch": 6.396576541528885, "grad_norm": 1.3125, "learning_rate": 0.00018120445729267936, "loss": 4.6914, "mean_token_accuracy": 0.23969131857156753, "num_tokens": 142599305.0, "step": 82215 }, { "entropy": 5.415508031845093, "epoch": 6.396965570900603, "grad_norm": 1.46875, "learning_rate": 0.00018117926546253906, "loss": 4.7172, "mean_token_accuracy": 0.23408996313810349, "num_tokens": 142607852.0, "step": 82220 }, { "entropy": 5.392915105819702, "epoch": 6.397354600272321, "grad_norm": 1.3046875, "learning_rate": 0.00018115407505597909, "loss": 4.7124, "mean_token_accuracy": 0.23461237251758577, "num_tokens": 142617276.0, "step": 82225 }, { "entropy": 5.356106996536255, "epoch": 6.397743629644038, "grad_norm": 1.2578125, "learning_rate": 0.00018112888607338162, "loss": 4.6024, "mean_token_accuracy": 0.23891111761331557, "num_tokens": 142625978.0, "step": 82230 }, { "entropy": 5.342175149917603, "epoch": 6.398132659015756, "grad_norm": 1.2890625, "learning_rate": 0.000181103698515129, "loss": 4.5585, "mean_token_accuracy": 0.24532577097415925, "num_tokens": 142634525.0, "step": 82235 }, { "entropy": 5.46988959312439, "epoch": 6.398521688387473, "grad_norm": 1.3203125, "learning_rate": 0.00018107851238160312, "loss": 4.7467, "mean_token_accuracy": 0.23420187830924988, "num_tokens": 142643468.0, "step": 82240 }, { "entropy": 5.3753949165344235, "epoch": 6.398910717759191, "grad_norm": 1.359375, "learning_rate": 0.00018105332767318638, "loss": 4.6426, "mean_token_accuracy": 0.24643555134534836, "num_tokens": 142651761.0, "step": 82245 }, { "entropy": 5.384146642684937, "epoch": 6.399299747130908, "grad_norm": 1.3984375, "learning_rate": 0.000181028144390261, "loss": 4.6374, "mean_token_accuracy": 0.23885766863822938, "num_tokens": 142660400.0, "step": 82250 }, { "entropy": 5.3627174377441404, "epoch": 6.399688776502626, "grad_norm": 1.2578125, "learning_rate": 0.0001810029625332088, "loss": 4.5905, "mean_token_accuracy": 0.24726342111825944, "num_tokens": 142669100.0, "step": 82255 }, { "entropy": 5.360354471206665, "epoch": 6.400077805874344, "grad_norm": 1.328125, "learning_rate": 0.0001809777821024121, "loss": 4.6297, "mean_token_accuracy": 0.23754183501005172, "num_tokens": 142677996.0, "step": 82260 }, { "entropy": 5.245414733886719, "epoch": 6.400466835246061, "grad_norm": 1.2734375, "learning_rate": 0.00018095260309825296, "loss": 4.5027, "mean_token_accuracy": 0.26008217632770536, "num_tokens": 142686644.0, "step": 82265 }, { "entropy": 5.435843181610108, "epoch": 6.400855864617778, "grad_norm": 1.3515625, "learning_rate": 0.0001809274255211133, "loss": 4.7166, "mean_token_accuracy": 0.234586638212204, "num_tokens": 142695420.0, "step": 82270 }, { "entropy": 5.406366062164307, "epoch": 6.401244893989496, "grad_norm": 1.3125, "learning_rate": 0.00018090224937137529, "loss": 4.6784, "mean_token_accuracy": 0.23823073506355286, "num_tokens": 142704128.0, "step": 82275 }, { "entropy": 5.338760280609131, "epoch": 6.401633923361214, "grad_norm": 1.328125, "learning_rate": 0.00018087707464942078, "loss": 4.6316, "mean_token_accuracy": 0.24388722330331802, "num_tokens": 142712247.0, "step": 82280 }, { "entropy": 5.368616962432862, "epoch": 6.402022952732931, "grad_norm": 1.234375, "learning_rate": 0.00018085190135563194, "loss": 4.6137, "mean_token_accuracy": 0.24260696917772293, "num_tokens": 142720847.0, "step": 82285 }, { "entropy": 5.389946460723877, "epoch": 6.402411982104649, "grad_norm": 1.5, "learning_rate": 0.00018082672949039057, "loss": 4.6076, "mean_token_accuracy": 0.24145932942628862, "num_tokens": 142729054.0, "step": 82290 }, { "entropy": 5.325081253051758, "epoch": 6.402801011476367, "grad_norm": 1.21875, "learning_rate": 0.00018080155905407874, "loss": 4.5693, "mean_token_accuracy": 0.24333367496728897, "num_tokens": 142738125.0, "step": 82295 }, { "entropy": 5.30859785079956, "epoch": 6.403190040848084, "grad_norm": 1.359375, "learning_rate": 0.0001807763900470783, "loss": 4.5882, "mean_token_accuracy": 0.24494532644748687, "num_tokens": 142747092.0, "step": 82300 }, { "entropy": 5.412494850158692, "epoch": 6.403579070219801, "grad_norm": 1.421875, "learning_rate": 0.0001807512224697711, "loss": 4.7363, "mean_token_accuracy": 0.23632404208183289, "num_tokens": 142755537.0, "step": 82305 }, { "entropy": 5.4143472671508786, "epoch": 6.403968099591519, "grad_norm": 1.390625, "learning_rate": 0.0001807260563225392, "loss": 4.6516, "mean_token_accuracy": 0.24171083122491838, "num_tokens": 142763493.0, "step": 82310 }, { "entropy": 5.378700828552246, "epoch": 6.404357128963237, "grad_norm": 1.1640625, "learning_rate": 0.00018070089160576424, "loss": 4.6077, "mean_token_accuracy": 0.25079862028360367, "num_tokens": 142772411.0, "step": 82315 }, { "entropy": 5.397850751876831, "epoch": 6.404746158334954, "grad_norm": 1.34375, "learning_rate": 0.00018067572831982826, "loss": 4.6303, "mean_token_accuracy": 0.2384672537446022, "num_tokens": 142780773.0, "step": 82320 }, { "entropy": 5.410871982574463, "epoch": 6.405135187706672, "grad_norm": 1.2890625, "learning_rate": 0.00018065056646511285, "loss": 4.729, "mean_token_accuracy": 0.2367436781525612, "num_tokens": 142788849.0, "step": 82325 }, { "entropy": 5.298367691040039, "epoch": 6.40552421707839, "grad_norm": 1.3046875, "learning_rate": 0.00018062540604200006, "loss": 4.5614, "mean_token_accuracy": 0.24917505979537963, "num_tokens": 142797263.0, "step": 82330 }, { "entropy": 5.474892854690552, "epoch": 6.4059132464501065, "grad_norm": 1.3359375, "learning_rate": 0.0001806002470508714, "loss": 4.7482, "mean_token_accuracy": 0.23943687975406647, "num_tokens": 142805506.0, "step": 82335 }, { "entropy": 5.462739372253418, "epoch": 6.406302275821824, "grad_norm": 1.328125, "learning_rate": 0.00018057508949210888, "loss": 4.7714, "mean_token_accuracy": 0.22545326948165895, "num_tokens": 142814152.0, "step": 82340 }, { "entropy": 5.4240296363830565, "epoch": 6.406691305193542, "grad_norm": 1.375, "learning_rate": 0.00018054993336609398, "loss": 4.6622, "mean_token_accuracy": 0.2343586951494217, "num_tokens": 142822948.0, "step": 82345 }, { "entropy": 5.361614227294922, "epoch": 6.40708033456526, "grad_norm": 1.2421875, "learning_rate": 0.00018052477867320854, "loss": 4.6335, "mean_token_accuracy": 0.23653846085071564, "num_tokens": 142831710.0, "step": 82350 }, { "entropy": 5.392384481430054, "epoch": 6.407469363936977, "grad_norm": 1.421875, "learning_rate": 0.00018049962541383425, "loss": 4.6284, "mean_token_accuracy": 0.24847085773944855, "num_tokens": 142840163.0, "step": 82355 }, { "entropy": 5.40827751159668, "epoch": 6.407858393308695, "grad_norm": 1.25, "learning_rate": 0.0001804744735883526, "loss": 4.68, "mean_token_accuracy": 0.23137565106153488, "num_tokens": 142848454.0, "step": 82360 }, { "entropy": 5.285017013549805, "epoch": 6.408247422680413, "grad_norm": 1.3203125, "learning_rate": 0.00018044932319714546, "loss": 4.6028, "mean_token_accuracy": 0.24156380146741868, "num_tokens": 142856956.0, "step": 82365 }, { "entropy": 5.403048706054688, "epoch": 6.40863645205213, "grad_norm": 1.2421875, "learning_rate": 0.0001804241742405942, "loss": 4.6772, "mean_token_accuracy": 0.23438923358917235, "num_tokens": 142865804.0, "step": 82370 }, { "entropy": 5.395246696472168, "epoch": 6.409025481423847, "grad_norm": 1.359375, "learning_rate": 0.00018039902671908076, "loss": 4.7213, "mean_token_accuracy": 0.2313644528388977, "num_tokens": 142874382.0, "step": 82375 }, { "entropy": 5.430659437179566, "epoch": 6.409414510795565, "grad_norm": 1.3671875, "learning_rate": 0.00018037388063298648, "loss": 4.7254, "mean_token_accuracy": 0.23973845392465593, "num_tokens": 142883489.0, "step": 82380 }, { "entropy": 5.394609117507935, "epoch": 6.409803540167283, "grad_norm": 1.3125, "learning_rate": 0.0001803487359826929, "loss": 4.6146, "mean_token_accuracy": 0.24025665372610092, "num_tokens": 142892279.0, "step": 82385 }, { "entropy": 5.417500734329224, "epoch": 6.410192569539, "grad_norm": 1.359375, "learning_rate": 0.00018032359276858167, "loss": 4.6723, "mean_token_accuracy": 0.23485136926174163, "num_tokens": 142901571.0, "step": 82390 }, { "entropy": 5.398145771026611, "epoch": 6.410581598910718, "grad_norm": 1.3984375, "learning_rate": 0.00018029845099103414, "loss": 4.6169, "mean_token_accuracy": 0.24927266538143159, "num_tokens": 142909296.0, "step": 82395 }, { "entropy": 5.30060658454895, "epoch": 6.410970628282436, "grad_norm": 1.3046875, "learning_rate": 0.0001802733106504319, "loss": 4.5603, "mean_token_accuracy": 0.2482319578528404, "num_tokens": 142917249.0, "step": 82400 }, { "entropy": 5.450872230529785, "epoch": 6.4113596576541525, "grad_norm": 1.296875, "learning_rate": 0.0001802481717471564, "loss": 4.6992, "mean_token_accuracy": 0.23405710756778716, "num_tokens": 142925910.0, "step": 82405 }, { "entropy": 5.365111398696899, "epoch": 6.41174868702587, "grad_norm": 1.3125, "learning_rate": 0.00018022303428158915, "loss": 4.6425, "mean_token_accuracy": 0.23882312178611756, "num_tokens": 142934468.0, "step": 82410 }, { "entropy": 5.422766447067261, "epoch": 6.412137716397588, "grad_norm": 1.421875, "learning_rate": 0.00018019789825411136, "loss": 4.6462, "mean_token_accuracy": 0.23503439575433732, "num_tokens": 142942854.0, "step": 82415 }, { "entropy": 5.416478204727173, "epoch": 6.412526745769306, "grad_norm": 1.25, "learning_rate": 0.0001801727636651047, "loss": 4.6529, "mean_token_accuracy": 0.23765443861484528, "num_tokens": 142951656.0, "step": 82420 }, { "entropy": 5.437187242507934, "epoch": 6.412915775141023, "grad_norm": 1.328125, "learning_rate": 0.00018014763051495047, "loss": 4.716, "mean_token_accuracy": 0.2361622154712677, "num_tokens": 142959294.0, "step": 82425 }, { "entropy": 5.447124719619751, "epoch": 6.413304804512741, "grad_norm": 1.390625, "learning_rate": 0.0001801224988040298, "loss": 4.7486, "mean_token_accuracy": 0.22954119741916656, "num_tokens": 142967526.0, "step": 82430 }, { "entropy": 5.432141971588135, "epoch": 6.413693833884459, "grad_norm": 1.359375, "learning_rate": 0.00018009736853272424, "loss": 4.7576, "mean_token_accuracy": 0.23075587898492814, "num_tokens": 142976676.0, "step": 82435 }, { "entropy": 5.461958694458008, "epoch": 6.4140828632561755, "grad_norm": 1.296875, "learning_rate": 0.00018007223970141505, "loss": 4.7452, "mean_token_accuracy": 0.23252155631780624, "num_tokens": 142986004.0, "step": 82440 }, { "entropy": 5.386804628372192, "epoch": 6.414471892627893, "grad_norm": 1.34375, "learning_rate": 0.0001800471123104836, "loss": 4.6028, "mean_token_accuracy": 0.24331078678369522, "num_tokens": 142994367.0, "step": 82445 }, { "entropy": 5.381896591186523, "epoch": 6.414860921999611, "grad_norm": 1.3203125, "learning_rate": 0.00018002198636031102, "loss": 4.5834, "mean_token_accuracy": 0.24277009516954423, "num_tokens": 143002913.0, "step": 82450 }, { "entropy": 5.39580135345459, "epoch": 6.415249951371329, "grad_norm": 1.25, "learning_rate": 0.00017999686185127871, "loss": 4.6866, "mean_token_accuracy": 0.23713803440332412, "num_tokens": 143012000.0, "step": 82455 }, { "entropy": 5.414807224273682, "epoch": 6.415638980743046, "grad_norm": 1.3515625, "learning_rate": 0.00017997173878376782, "loss": 4.6672, "mean_token_accuracy": 0.24279556125402452, "num_tokens": 143020595.0, "step": 82460 }, { "entropy": 5.356094026565552, "epoch": 6.416028010114764, "grad_norm": 1.3515625, "learning_rate": 0.00017994661715815946, "loss": 4.5955, "mean_token_accuracy": 0.25009226351976394, "num_tokens": 143029243.0, "step": 82465 }, { "entropy": 5.358830356597901, "epoch": 6.416417039486481, "grad_norm": 1.3828125, "learning_rate": 0.00017992149697483494, "loss": 4.6411, "mean_token_accuracy": 0.24308784753084184, "num_tokens": 143038456.0, "step": 82470 }, { "entropy": 5.422231864929199, "epoch": 6.4168060688581985, "grad_norm": 1.3046875, "learning_rate": 0.00017989637823417532, "loss": 4.7382, "mean_token_accuracy": 0.23100993484258653, "num_tokens": 143047033.0, "step": 82475 }, { "entropy": 5.377179479598999, "epoch": 6.417195098229916, "grad_norm": 1.21875, "learning_rate": 0.00017987126093656187, "loss": 4.6095, "mean_token_accuracy": 0.2589604452252388, "num_tokens": 143056103.0, "step": 82480 }, { "entropy": 5.395293426513672, "epoch": 6.417584127601634, "grad_norm": 1.234375, "learning_rate": 0.0001798461450823755, "loss": 4.6664, "mean_token_accuracy": 0.23565146774053575, "num_tokens": 143064403.0, "step": 82485 }, { "entropy": 5.396309900283813, "epoch": 6.417973156973352, "grad_norm": 1.3125, "learning_rate": 0.00017982103067199756, "loss": 4.6518, "mean_token_accuracy": 0.24212147444486617, "num_tokens": 143072681.0, "step": 82490 }, { "entropy": 5.374069261550903, "epoch": 6.418362186345069, "grad_norm": 1.2890625, "learning_rate": 0.00017979591770580884, "loss": 4.6486, "mean_token_accuracy": 0.24003251641988754, "num_tokens": 143081360.0, "step": 82495 }, { "entropy": 5.444823360443115, "epoch": 6.418751215716787, "grad_norm": 1.3359375, "learning_rate": 0.00017977080618419066, "loss": 4.7323, "mean_token_accuracy": 0.23150442093610762, "num_tokens": 143090267.0, "step": 82500 }, { "entropy": 5.444047164916992, "epoch": 6.419140245088504, "grad_norm": 1.2578125, "learning_rate": 0.00017974569610752384, "loss": 4.6656, "mean_token_accuracy": 0.23649680316448213, "num_tokens": 143098884.0, "step": 82505 }, { "entropy": 5.5026328563690186, "epoch": 6.4195292744602215, "grad_norm": 1.3046875, "learning_rate": 0.00017972058747618946, "loss": 4.8003, "mean_token_accuracy": 0.23001947849988938, "num_tokens": 143107512.0, "step": 82510 }, { "entropy": 5.428179359436035, "epoch": 6.419918303831939, "grad_norm": 1.390625, "learning_rate": 0.00017969548029056858, "loss": 4.6303, "mean_token_accuracy": 0.23728398978710175, "num_tokens": 143115253.0, "step": 82515 }, { "entropy": 5.315980243682861, "epoch": 6.420307333203657, "grad_norm": 1.28125, "learning_rate": 0.00017967037455104208, "loss": 4.6095, "mean_token_accuracy": 0.24113020896911622, "num_tokens": 143124094.0, "step": 82520 }, { "entropy": 5.356109666824341, "epoch": 6.420696362575375, "grad_norm": 1.2890625, "learning_rate": 0.00017964527025799093, "loss": 4.6908, "mean_token_accuracy": 0.24234326034784318, "num_tokens": 143133109.0, "step": 82525 }, { "entropy": 5.294205904006958, "epoch": 6.421085391947092, "grad_norm": 1.3359375, "learning_rate": 0.00017962016741179592, "loss": 4.6556, "mean_token_accuracy": 0.24496525079011916, "num_tokens": 143141930.0, "step": 82530 }, { "entropy": 5.32760066986084, "epoch": 6.42147442131881, "grad_norm": 1.28125, "learning_rate": 0.00017959506601283827, "loss": 4.576, "mean_token_accuracy": 0.24812858402729035, "num_tokens": 143150687.0, "step": 82535 }, { "entropy": 5.430657768249512, "epoch": 6.421863450690527, "grad_norm": 1.3203125, "learning_rate": 0.0001795699660614985, "loss": 4.6857, "mean_token_accuracy": 0.23502505123615264, "num_tokens": 143159636.0, "step": 82540 }, { "entropy": 5.444018316268921, "epoch": 6.4222524800622445, "grad_norm": 1.28125, "learning_rate": 0.00017954486755815757, "loss": 4.6888, "mean_token_accuracy": 0.23968026489019395, "num_tokens": 143168227.0, "step": 82545 }, { "entropy": 5.311178350448609, "epoch": 6.422641509433962, "grad_norm": 1.359375, "learning_rate": 0.00017951977050319646, "loss": 4.611, "mean_token_accuracy": 0.2364587441086769, "num_tokens": 143177328.0, "step": 82550 }, { "entropy": 5.378188180923462, "epoch": 6.42303053880568, "grad_norm": 1.2890625, "learning_rate": 0.00017949467489699572, "loss": 4.6586, "mean_token_accuracy": 0.2442087411880493, "num_tokens": 143185648.0, "step": 82555 }, { "entropy": 5.422831296920776, "epoch": 6.423419568177398, "grad_norm": 1.296875, "learning_rate": 0.00017946958073993642, "loss": 4.7126, "mean_token_accuracy": 0.22931693345308304, "num_tokens": 143194210.0, "step": 82560 }, { "entropy": 5.294196367263794, "epoch": 6.423808597549115, "grad_norm": 1.3203125, "learning_rate": 0.00017944448803239904, "loss": 4.542, "mean_token_accuracy": 0.24147382378578186, "num_tokens": 143202771.0, "step": 82565 }, { "entropy": 5.43730411529541, "epoch": 6.424197626920833, "grad_norm": 1.3125, "learning_rate": 0.0001794193967747645, "loss": 4.6435, "mean_token_accuracy": 0.24095530956983566, "num_tokens": 143211618.0, "step": 82570 }, { "entropy": 5.394436883926391, "epoch": 6.42458665629255, "grad_norm": 1.3203125, "learning_rate": 0.00017939430696741355, "loss": 4.6331, "mean_token_accuracy": 0.23825594484806062, "num_tokens": 143219828.0, "step": 82575 }, { "entropy": 5.302516603469849, "epoch": 6.4249756856642675, "grad_norm": 1.4375, "learning_rate": 0.00017936921861072674, "loss": 4.5366, "mean_token_accuracy": 0.24871233105659485, "num_tokens": 143228281.0, "step": 82580 }, { "entropy": 5.27856559753418, "epoch": 6.425364715035985, "grad_norm": 1.296875, "learning_rate": 0.0001793441317050849, "loss": 4.4542, "mean_token_accuracy": 0.25426729321479796, "num_tokens": 143236656.0, "step": 82585 }, { "entropy": 5.362694597244262, "epoch": 6.425753744407703, "grad_norm": 1.3671875, "learning_rate": 0.00017931904625086853, "loss": 4.6201, "mean_token_accuracy": 0.24828188568353654, "num_tokens": 143245231.0, "step": 82590 }, { "entropy": 5.370662069320678, "epoch": 6.426142773779421, "grad_norm": 1.375, "learning_rate": 0.00017929396224845845, "loss": 4.6314, "mean_token_accuracy": 0.23676994889974595, "num_tokens": 143254115.0, "step": 82595 }, { "entropy": 5.359732532501221, "epoch": 6.426531803151138, "grad_norm": 1.2734375, "learning_rate": 0.00017926887969823503, "loss": 4.6368, "mean_token_accuracy": 0.23817794471979142, "num_tokens": 143262591.0, "step": 82600 }, { "entropy": 5.382681894302368, "epoch": 6.426920832522855, "grad_norm": 1.5, "learning_rate": 0.0001792437986005791, "loss": 4.6259, "mean_token_accuracy": 0.23873403966426848, "num_tokens": 143271343.0, "step": 82605 }, { "entropy": 5.3405029296875, "epoch": 6.427309861894573, "grad_norm": 1.3984375, "learning_rate": 0.000179218718955871, "loss": 4.6296, "mean_token_accuracy": 0.25048225969076154, "num_tokens": 143279344.0, "step": 82610 }, { "entropy": 5.373542213439942, "epoch": 6.4276988912662905, "grad_norm": 1.3203125, "learning_rate": 0.0001791936407644915, "loss": 4.663, "mean_token_accuracy": 0.23606383204460143, "num_tokens": 143287896.0, "step": 82615 }, { "entropy": 5.386887645721435, "epoch": 6.428087920638008, "grad_norm": 1.3515625, "learning_rate": 0.00017916856402682102, "loss": 4.626, "mean_token_accuracy": 0.24582363665103912, "num_tokens": 143296144.0, "step": 82620 }, { "entropy": 5.3436016082763675, "epoch": 6.428476950009726, "grad_norm": 1.375, "learning_rate": 0.00017914348874323993, "loss": 4.5661, "mean_token_accuracy": 0.24722502380609512, "num_tokens": 143304299.0, "step": 82625 }, { "entropy": 5.337892532348633, "epoch": 6.4288659793814436, "grad_norm": 1.3125, "learning_rate": 0.00017911841491412894, "loss": 4.5634, "mean_token_accuracy": 0.24097222089767456, "num_tokens": 143312478.0, "step": 82630 }, { "entropy": 5.31866946220398, "epoch": 6.429255008753161, "grad_norm": 1.3984375, "learning_rate": 0.00017909334253986826, "loss": 4.5188, "mean_token_accuracy": 0.251820707321167, "num_tokens": 143321075.0, "step": 82635 }, { "entropy": 5.324297666549683, "epoch": 6.429644038124878, "grad_norm": 1.28125, "learning_rate": 0.00017906827162083856, "loss": 4.6387, "mean_token_accuracy": 0.24618198126554489, "num_tokens": 143330142.0, "step": 82640 }, { "entropy": 5.297784519195557, "epoch": 6.430033067496596, "grad_norm": 1.171875, "learning_rate": 0.0001790432021574202, "loss": 4.6495, "mean_token_accuracy": 0.23837926387786865, "num_tokens": 143339008.0, "step": 82645 }, { "entropy": 5.34595308303833, "epoch": 6.4304220968683135, "grad_norm": 1.2421875, "learning_rate": 0.00017901813414999336, "loss": 4.665, "mean_token_accuracy": 0.24033653885126113, "num_tokens": 143348841.0, "step": 82650 }, { "entropy": 5.400599622726441, "epoch": 6.430811126240031, "grad_norm": 1.375, "learning_rate": 0.00017899306759893875, "loss": 4.6592, "mean_token_accuracy": 0.24718987345695495, "num_tokens": 143356681.0, "step": 82655 }, { "entropy": 5.4087811470031735, "epoch": 6.431200155611749, "grad_norm": 1.3359375, "learning_rate": 0.00017896800250463636, "loss": 4.6724, "mean_token_accuracy": 0.242009998857975, "num_tokens": 143365396.0, "step": 82660 }, { "entropy": 5.332721185684204, "epoch": 6.4315891849834665, "grad_norm": 1.2734375, "learning_rate": 0.00017894293886746676, "loss": 4.5469, "mean_token_accuracy": 0.24421672374010087, "num_tokens": 143374678.0, "step": 82665 }, { "entropy": 5.359928131103516, "epoch": 6.431978214355183, "grad_norm": 1.3515625, "learning_rate": 0.0001789178766878101, "loss": 4.6075, "mean_token_accuracy": 0.24772242605686187, "num_tokens": 143383423.0, "step": 82670 }, { "entropy": 5.35410442352295, "epoch": 6.432367243726901, "grad_norm": 1.2890625, "learning_rate": 0.00017889281596604684, "loss": 4.6413, "mean_token_accuracy": 0.24685716181993483, "num_tokens": 143392366.0, "step": 82675 }, { "entropy": 5.44408769607544, "epoch": 6.432756273098619, "grad_norm": 1.359375, "learning_rate": 0.00017886775670255707, "loss": 4.754, "mean_token_accuracy": 0.23950789123773575, "num_tokens": 143400815.0, "step": 82680 }, { "entropy": 5.328939771652221, "epoch": 6.4331453024703364, "grad_norm": 1.3125, "learning_rate": 0.00017884269889772116, "loss": 4.5276, "mean_token_accuracy": 0.247337943315506, "num_tokens": 143410319.0, "step": 82685 }, { "entropy": 5.345132064819336, "epoch": 6.433534331842054, "grad_norm": 1.3203125, "learning_rate": 0.00017881764255191912, "loss": 4.6627, "mean_token_accuracy": 0.2379737988114357, "num_tokens": 143419177.0, "step": 82690 }, { "entropy": 5.34805121421814, "epoch": 6.433923361213772, "grad_norm": 1.2578125, "learning_rate": 0.00017879258766553136, "loss": 4.6714, "mean_token_accuracy": 0.2511689379811287, "num_tokens": 143428030.0, "step": 82695 }, { "entropy": 5.389418268203736, "epoch": 6.4343123905854895, "grad_norm": 1.28125, "learning_rate": 0.00017876753423893792, "loss": 4.6642, "mean_token_accuracy": 0.23998350501060486, "num_tokens": 143436930.0, "step": 82700 }, { "entropy": 5.406605768203735, "epoch": 6.434701419957207, "grad_norm": 1.4375, "learning_rate": 0.00017874248227251887, "loss": 4.7228, "mean_token_accuracy": 0.23316849768161774, "num_tokens": 143445831.0, "step": 82705 }, { "entropy": 5.399896621704102, "epoch": 6.435090449328924, "grad_norm": 1.3125, "learning_rate": 0.00017871743176665455, "loss": 4.6348, "mean_token_accuracy": 0.24600838720798493, "num_tokens": 143454345.0, "step": 82710 }, { "entropy": 5.526035642623901, "epoch": 6.435479478700642, "grad_norm": 1.34375, "learning_rate": 0.00017869238272172493, "loss": 4.7978, "mean_token_accuracy": 0.22638158947229386, "num_tokens": 143462770.0, "step": 82715 }, { "entropy": 5.455417060852051, "epoch": 6.435868508072359, "grad_norm": 1.359375, "learning_rate": 0.00017866733513811016, "loss": 4.7059, "mean_token_accuracy": 0.2342896968126297, "num_tokens": 143470495.0, "step": 82720 }, { "entropy": 5.287090015411377, "epoch": 6.436257537444077, "grad_norm": 1.2265625, "learning_rate": 0.00017864228901619028, "loss": 4.5918, "mean_token_accuracy": 0.24382158517837524, "num_tokens": 143479479.0, "step": 82725 }, { "entropy": 5.357227468490601, "epoch": 6.436646566815795, "grad_norm": 1.2890625, "learning_rate": 0.0001786172443563452, "loss": 4.6235, "mean_token_accuracy": 0.24275797754526138, "num_tokens": 143488823.0, "step": 82730 }, { "entropy": 5.329410600662231, "epoch": 6.4370355961875125, "grad_norm": 1.375, "learning_rate": 0.0001785922011589551, "loss": 4.606, "mean_token_accuracy": 0.24503783136606216, "num_tokens": 143497305.0, "step": 82735 }, { "entropy": 5.41592378616333, "epoch": 6.437424625559229, "grad_norm": 1.2578125, "learning_rate": 0.00017856715942439982, "loss": 4.695, "mean_token_accuracy": 0.23348598182201385, "num_tokens": 143507312.0, "step": 82740 }, { "entropy": 5.4380169868469235, "epoch": 6.437813654930947, "grad_norm": 1.2421875, "learning_rate": 0.00017854211915305945, "loss": 4.7373, "mean_token_accuracy": 0.23575616627931595, "num_tokens": 143515898.0, "step": 82745 }, { "entropy": 5.353181791305542, "epoch": 6.438202684302665, "grad_norm": 1.4453125, "learning_rate": 0.0001785170803453139, "loss": 4.6052, "mean_token_accuracy": 0.24803001284599305, "num_tokens": 143523708.0, "step": 82750 }, { "entropy": 5.357293510437012, "epoch": 6.438591713674382, "grad_norm": 1.25, "learning_rate": 0.0001784920430015431, "loss": 4.5987, "mean_token_accuracy": 0.24204165637493133, "num_tokens": 143532507.0, "step": 82755 }, { "entropy": 5.4409888744354244, "epoch": 6.4389807430461, "grad_norm": 1.296875, "learning_rate": 0.0001784670071221269, "loss": 4.7485, "mean_token_accuracy": 0.22733623087406157, "num_tokens": 143541221.0, "step": 82760 }, { "entropy": 5.3728498935699465, "epoch": 6.439369772417818, "grad_norm": 1.3359375, "learning_rate": 0.0001784419727074452, "loss": 4.7145, "mean_token_accuracy": 0.2306716576218605, "num_tokens": 143549885.0, "step": 82765 }, { "entropy": 5.331688261032104, "epoch": 6.4397588017895355, "grad_norm": 1.2421875, "learning_rate": 0.00017841693975787791, "loss": 4.5989, "mean_token_accuracy": 0.24704163521528244, "num_tokens": 143558871.0, "step": 82770 }, { "entropy": 5.369926404953003, "epoch": 6.440147831161252, "grad_norm": 1.359375, "learning_rate": 0.0001783919082738048, "loss": 4.6112, "mean_token_accuracy": 0.23526297211647035, "num_tokens": 143567483.0, "step": 82775 }, { "entropy": 5.318182897567749, "epoch": 6.44053686053297, "grad_norm": 1.40625, "learning_rate": 0.00017836687825560578, "loss": 4.6087, "mean_token_accuracy": 0.239929136633873, "num_tokens": 143576919.0, "step": 82780 }, { "entropy": 5.370616054534912, "epoch": 6.440925889904688, "grad_norm": 1.3515625, "learning_rate": 0.0001783418497036605, "loss": 4.5892, "mean_token_accuracy": 0.2424986407160759, "num_tokens": 143585575.0, "step": 82785 }, { "entropy": 5.447087526321411, "epoch": 6.441314919276405, "grad_norm": 1.3046875, "learning_rate": 0.0001783168226183489, "loss": 4.6691, "mean_token_accuracy": 0.2354416325688362, "num_tokens": 143595050.0, "step": 82790 }, { "entropy": 5.383753728866577, "epoch": 6.441703948648123, "grad_norm": 1.296875, "learning_rate": 0.00017829179700005056, "loss": 4.6575, "mean_token_accuracy": 0.2362608253955841, "num_tokens": 143603145.0, "step": 82795 }, { "entropy": 5.3817009925842285, "epoch": 6.442092978019841, "grad_norm": 1.390625, "learning_rate": 0.00017826677284914533, "loss": 4.6469, "mean_token_accuracy": 0.24037082940340043, "num_tokens": 143611889.0, "step": 82800 }, { "entropy": 5.43207950592041, "epoch": 6.442482007391558, "grad_norm": 1.4609375, "learning_rate": 0.00017824175016601285, "loss": 4.6936, "mean_token_accuracy": 0.23874589949846267, "num_tokens": 143619854.0, "step": 82805 }, { "entropy": 5.3997721672058105, "epoch": 6.442871036763275, "grad_norm": 1.3671875, "learning_rate": 0.0001782167289510327, "loss": 4.6544, "mean_token_accuracy": 0.23907834887504578, "num_tokens": 143627882.0, "step": 82810 }, { "entropy": 5.445751523971557, "epoch": 6.443260066134993, "grad_norm": 1.359375, "learning_rate": 0.00017819170920458478, "loss": 4.7703, "mean_token_accuracy": 0.228787662088871, "num_tokens": 143636882.0, "step": 82815 }, { "entropy": 5.4082811832427975, "epoch": 6.443649095506711, "grad_norm": 1.3359375, "learning_rate": 0.00017816669092704846, "loss": 4.6316, "mean_token_accuracy": 0.24099887460470198, "num_tokens": 143644372.0, "step": 82820 }, { "entropy": 5.374001216888428, "epoch": 6.444038124878428, "grad_norm": 1.28125, "learning_rate": 0.00017814167411880354, "loss": 4.5304, "mean_token_accuracy": 0.2501221776008606, "num_tokens": 143652764.0, "step": 82825 }, { "entropy": 5.457921028137207, "epoch": 6.444427154250146, "grad_norm": 1.3828125, "learning_rate": 0.00017811665878022953, "loss": 4.7587, "mean_token_accuracy": 0.2417881429195404, "num_tokens": 143661722.0, "step": 82830 }, { "entropy": 5.390911960601807, "epoch": 6.444816183621864, "grad_norm": 1.3671875, "learning_rate": 0.00017809164491170597, "loss": 4.5971, "mean_token_accuracy": 0.24584528654813767, "num_tokens": 143670097.0, "step": 82835 }, { "entropy": 5.387441110610962, "epoch": 6.445205212993581, "grad_norm": 1.359375, "learning_rate": 0.0001780666325136126, "loss": 4.6429, "mean_token_accuracy": 0.2411521017551422, "num_tokens": 143678954.0, "step": 82840 }, { "entropy": 5.357714033126831, "epoch": 6.445594242365298, "grad_norm": 1.3046875, "learning_rate": 0.00017804162158632864, "loss": 4.642, "mean_token_accuracy": 0.2400539055466652, "num_tokens": 143687329.0, "step": 82845 }, { "entropy": 5.338862371444702, "epoch": 6.445983271737016, "grad_norm": 1.234375, "learning_rate": 0.00017801661213023384, "loss": 4.6206, "mean_token_accuracy": 0.24225640147924424, "num_tokens": 143697445.0, "step": 82850 }, { "entropy": 5.400271320343018, "epoch": 6.446372301108734, "grad_norm": 1.3203125, "learning_rate": 0.00017799160414570754, "loss": 4.6967, "mean_token_accuracy": 0.24033423513174057, "num_tokens": 143706627.0, "step": 82855 }, { "entropy": 5.465586757659912, "epoch": 6.446761330480451, "grad_norm": 1.3359375, "learning_rate": 0.00017796659763312934, "loss": 4.7074, "mean_token_accuracy": 0.23926141113042831, "num_tokens": 143715108.0, "step": 82860 }, { "entropy": 5.317722749710083, "epoch": 6.447150359852169, "grad_norm": 1.3828125, "learning_rate": 0.00017794159259287845, "loss": 4.5346, "mean_token_accuracy": 0.24749047607183455, "num_tokens": 143723422.0, "step": 82865 }, { "entropy": 5.402229881286621, "epoch": 6.447539389223887, "grad_norm": 1.3203125, "learning_rate": 0.00017791658902533447, "loss": 4.6624, "mean_token_accuracy": 0.24272151440382003, "num_tokens": 143731784.0, "step": 82870 }, { "entropy": 5.343760776519775, "epoch": 6.447928418595604, "grad_norm": 1.3046875, "learning_rate": 0.0001778915869308767, "loss": 4.6736, "mean_token_accuracy": 0.23606982678174973, "num_tokens": 143740851.0, "step": 82875 }, { "entropy": 5.3634425640106205, "epoch": 6.448317447967321, "grad_norm": 1.3046875, "learning_rate": 0.00017786658630988462, "loss": 4.61, "mean_token_accuracy": 0.24724558144807815, "num_tokens": 143749444.0, "step": 82880 }, { "entropy": 5.414980459213257, "epoch": 6.448706477339039, "grad_norm": 1.3828125, "learning_rate": 0.00017784158716273746, "loss": 4.6934, "mean_token_accuracy": 0.24275663495063782, "num_tokens": 143758027.0, "step": 82885 }, { "entropy": 5.286357975006103, "epoch": 6.449095506710757, "grad_norm": 1.390625, "learning_rate": 0.00017781658948981449, "loss": 4.5018, "mean_token_accuracy": 0.26249654591083527, "num_tokens": 143766413.0, "step": 82890 }, { "entropy": 5.456971788406372, "epoch": 6.449484536082474, "grad_norm": 1.2890625, "learning_rate": 0.00017779159329149515, "loss": 4.7674, "mean_token_accuracy": 0.22810399085283278, "num_tokens": 143775014.0, "step": 82895 }, { "entropy": 5.339426803588867, "epoch": 6.449873565454192, "grad_norm": 1.4375, "learning_rate": 0.00017776659856815852, "loss": 4.5752, "mean_token_accuracy": 0.24826463013887407, "num_tokens": 143783921.0, "step": 82900 }, { "entropy": 5.3621879577636715, "epoch": 6.45026259482591, "grad_norm": 1.34375, "learning_rate": 0.00017774160532018417, "loss": 4.613, "mean_token_accuracy": 0.25057166814804077, "num_tokens": 143792714.0, "step": 82905 }, { "entropy": 5.375015449523926, "epoch": 6.450651624197627, "grad_norm": 1.3984375, "learning_rate": 0.00017771661354795104, "loss": 4.5844, "mean_token_accuracy": 0.24597897082567216, "num_tokens": 143801153.0, "step": 82910 }, { "entropy": 5.377874279022217, "epoch": 6.451040653569344, "grad_norm": 1.265625, "learning_rate": 0.00017769162325183857, "loss": 4.5852, "mean_token_accuracy": 0.24732966125011444, "num_tokens": 143810068.0, "step": 82915 }, { "entropy": 5.379004955291748, "epoch": 6.451429682941062, "grad_norm": 1.328125, "learning_rate": 0.00017766663443222585, "loss": 4.6237, "mean_token_accuracy": 0.23434246480464935, "num_tokens": 143817844.0, "step": 82920 }, { "entropy": 5.380799770355225, "epoch": 6.45181871231278, "grad_norm": 1.328125, "learning_rate": 0.00017764164708949194, "loss": 4.6596, "mean_token_accuracy": 0.23932394087314607, "num_tokens": 143826291.0, "step": 82925 }, { "entropy": 5.43578462600708, "epoch": 6.452207741684497, "grad_norm": 1.328125, "learning_rate": 0.0001776166612240161, "loss": 4.6954, "mean_token_accuracy": 0.23862385153770446, "num_tokens": 143834985.0, "step": 82930 }, { "entropy": 5.339512729644776, "epoch": 6.452596771056215, "grad_norm": 1.234375, "learning_rate": 0.00017759167683617738, "loss": 4.6465, "mean_token_accuracy": 0.24068357050418854, "num_tokens": 143844369.0, "step": 82935 }, { "entropy": 5.496247625350952, "epoch": 6.452985800427932, "grad_norm": 1.390625, "learning_rate": 0.000177566693926355, "loss": 4.7513, "mean_token_accuracy": 0.23614590018987655, "num_tokens": 143853000.0, "step": 82940 }, { "entropy": 5.442478942871094, "epoch": 6.45337482979965, "grad_norm": 1.203125, "learning_rate": 0.0001775417124949279, "loss": 4.731, "mean_token_accuracy": 0.23147838115692138, "num_tokens": 143861623.0, "step": 82945 }, { "entropy": 5.344984102249145, "epoch": 6.453763859171367, "grad_norm": 1.3671875, "learning_rate": 0.0001775167325422753, "loss": 4.5786, "mean_token_accuracy": 0.2535018652677536, "num_tokens": 143870148.0, "step": 82950 }, { "entropy": 5.369374847412109, "epoch": 6.454152888543085, "grad_norm": 1.296875, "learning_rate": 0.00017749175406877598, "loss": 4.6569, "mean_token_accuracy": 0.23541801869869233, "num_tokens": 143880379.0, "step": 82955 }, { "entropy": 5.376127099990844, "epoch": 6.454541917914803, "grad_norm": 1.421875, "learning_rate": 0.0001774667770748092, "loss": 4.6916, "mean_token_accuracy": 0.23773810118436814, "num_tokens": 143889027.0, "step": 82960 }, { "entropy": 5.3560628414154055, "epoch": 6.45493094728652, "grad_norm": 1.40625, "learning_rate": 0.00017744180156075372, "loss": 4.6129, "mean_token_accuracy": 0.2472979798913002, "num_tokens": 143897411.0, "step": 82965 }, { "entropy": 5.350114631652832, "epoch": 6.455319976658238, "grad_norm": 1.2890625, "learning_rate": 0.00017741682752698868, "loss": 4.628, "mean_token_accuracy": 0.24208532124757767, "num_tokens": 143905314.0, "step": 82970 }, { "entropy": 5.424723958969116, "epoch": 6.455709006029955, "grad_norm": 1.2890625, "learning_rate": 0.00017739185497389298, "loss": 4.6715, "mean_token_accuracy": 0.23854233026504518, "num_tokens": 143914037.0, "step": 82975 }, { "entropy": 5.407558488845825, "epoch": 6.456098035401673, "grad_norm": 1.3125, "learning_rate": 0.00017736688390184552, "loss": 4.6744, "mean_token_accuracy": 0.23678355664014816, "num_tokens": 143922816.0, "step": 82980 }, { "entropy": 5.352316856384277, "epoch": 6.45648706477339, "grad_norm": 1.375, "learning_rate": 0.0001773419143112252, "loss": 4.5705, "mean_token_accuracy": 0.24099220633506774, "num_tokens": 143930862.0, "step": 82985 }, { "entropy": 5.473547744750976, "epoch": 6.456876094145108, "grad_norm": 1.328125, "learning_rate": 0.00017731694620241084, "loss": 4.7749, "mean_token_accuracy": 0.2313386917114258, "num_tokens": 143939630.0, "step": 82990 }, { "entropy": 5.405443334579468, "epoch": 6.457265123516826, "grad_norm": 1.3671875, "learning_rate": 0.0001772919795757814, "loss": 4.5958, "mean_token_accuracy": 0.24345363676548004, "num_tokens": 143948361.0, "step": 82995 }, { "entropy": 5.4167420864105225, "epoch": 6.457654152888543, "grad_norm": 1.328125, "learning_rate": 0.00017726701443171572, "loss": 4.6272, "mean_token_accuracy": 0.24736629724502562, "num_tokens": 143957460.0, "step": 83000 }, { "entropy": 5.3337325096130375, "epoch": 6.45804318226026, "grad_norm": 1.296875, "learning_rate": 0.0001772420507705924, "loss": 4.624, "mean_token_accuracy": 0.24406273514032364, "num_tokens": 143966404.0, "step": 83005 }, { "entropy": 5.262674856185913, "epoch": 6.458432211631978, "grad_norm": 1.3359375, "learning_rate": 0.00017721708859279046, "loss": 4.5657, "mean_token_accuracy": 0.24264351427555084, "num_tokens": 143975064.0, "step": 83010 }, { "entropy": 5.317763185501098, "epoch": 6.458821241003696, "grad_norm": 1.296875, "learning_rate": 0.0001771921278986885, "loss": 4.5363, "mean_token_accuracy": 0.2511401042342186, "num_tokens": 143983780.0, "step": 83015 }, { "entropy": 5.367264080047607, "epoch": 6.459210270375413, "grad_norm": 1.328125, "learning_rate": 0.0001771671686886654, "loss": 4.6875, "mean_token_accuracy": 0.237623693048954, "num_tokens": 143993344.0, "step": 83020 }, { "entropy": 5.378525876998902, "epoch": 6.459599299747131, "grad_norm": 1.265625, "learning_rate": 0.00017714221096309967, "loss": 4.6444, "mean_token_accuracy": 0.23488162457942963, "num_tokens": 144002678.0, "step": 83025 }, { "entropy": 5.449579668045044, "epoch": 6.459988329118849, "grad_norm": 1.265625, "learning_rate": 0.00017711725472237028, "loss": 4.6412, "mean_token_accuracy": 0.24572697281837463, "num_tokens": 144010553.0, "step": 83030 }, { "entropy": 5.402384614944458, "epoch": 6.460377358490566, "grad_norm": 1.3203125, "learning_rate": 0.00017709229996685567, "loss": 4.6678, "mean_token_accuracy": 0.23952512443065643, "num_tokens": 144019587.0, "step": 83035 }, { "entropy": 5.410198545455932, "epoch": 6.460766387862283, "grad_norm": 1.5, "learning_rate": 0.00017706734669693447, "loss": 4.6733, "mean_token_accuracy": 0.23823703229427337, "num_tokens": 144027889.0, "step": 83040 }, { "entropy": 5.423977661132812, "epoch": 6.461155417234001, "grad_norm": 1.3828125, "learning_rate": 0.00017704239491298556, "loss": 4.7003, "mean_token_accuracy": 0.23039052486419678, "num_tokens": 144036618.0, "step": 83045 }, { "entropy": 5.39475383758545, "epoch": 6.461544446605719, "grad_norm": 1.328125, "learning_rate": 0.00017701744461538733, "loss": 4.6854, "mean_token_accuracy": 0.23890471011400222, "num_tokens": 144046171.0, "step": 83050 }, { "entropy": 5.366714811325073, "epoch": 6.461933475977436, "grad_norm": 1.3359375, "learning_rate": 0.00017699249580451848, "loss": 4.5689, "mean_token_accuracy": 0.24190766364336014, "num_tokens": 144054564.0, "step": 83055 }, { "entropy": 5.2825024127960205, "epoch": 6.462322505349154, "grad_norm": 1.2109375, "learning_rate": 0.0001769675484807574, "loss": 4.492, "mean_token_accuracy": 0.25035585165023805, "num_tokens": 144062808.0, "step": 83060 }, { "entropy": 5.351992130279541, "epoch": 6.462711534720872, "grad_norm": 1.359375, "learning_rate": 0.00017694260264448287, "loss": 4.5962, "mean_token_accuracy": 0.2456778109073639, "num_tokens": 144071542.0, "step": 83065 }, { "entropy": 5.337395238876343, "epoch": 6.463100564092589, "grad_norm": 1.2109375, "learning_rate": 0.0001769176582960732, "loss": 4.7133, "mean_token_accuracy": 0.23347149640321732, "num_tokens": 144080878.0, "step": 83070 }, { "entropy": 5.31376953125, "epoch": 6.463489593464306, "grad_norm": 1.2734375, "learning_rate": 0.00017689271543590702, "loss": 4.6278, "mean_token_accuracy": 0.2330754280090332, "num_tokens": 144089817.0, "step": 83075 }, { "entropy": 5.4150779247283936, "epoch": 6.463878622836024, "grad_norm": 1.3515625, "learning_rate": 0.00017686777406436267, "loss": 4.727, "mean_token_accuracy": 0.23348935395479203, "num_tokens": 144099105.0, "step": 83080 }, { "entropy": 5.35163631439209, "epoch": 6.464267652207742, "grad_norm": 1.2421875, "learning_rate": 0.00017684283418181862, "loss": 4.5938, "mean_token_accuracy": 0.24613300412893296, "num_tokens": 144107433.0, "step": 83085 }, { "entropy": 5.280055284500122, "epoch": 6.464656681579459, "grad_norm": 1.359375, "learning_rate": 0.00017681789578865342, "loss": 4.4464, "mean_token_accuracy": 0.2616216540336609, "num_tokens": 144116014.0, "step": 83090 }, { "entropy": 5.352335357666016, "epoch": 6.465045710951177, "grad_norm": 1.3515625, "learning_rate": 0.00017679295888524526, "loss": 4.6164, "mean_token_accuracy": 0.2486771896481514, "num_tokens": 144124524.0, "step": 83095 }, { "entropy": 5.431673288345337, "epoch": 6.465434740322895, "grad_norm": 1.3046875, "learning_rate": 0.00017676802347197268, "loss": 4.7013, "mean_token_accuracy": 0.23786157816648484, "num_tokens": 144134194.0, "step": 83100 }, { "entropy": 5.416635227203369, "epoch": 6.465823769694612, "grad_norm": 1.375, "learning_rate": 0.00017674308954921403, "loss": 4.6527, "mean_token_accuracy": 0.23166165202856065, "num_tokens": 144142975.0, "step": 83105 }, { "entropy": 5.434501981735229, "epoch": 6.466212799066329, "grad_norm": 1.34375, "learning_rate": 0.0001767181571173475, "loss": 4.7677, "mean_token_accuracy": 0.23253786265850068, "num_tokens": 144152160.0, "step": 83110 }, { "entropy": 5.51481032371521, "epoch": 6.466601828438047, "grad_norm": 1.359375, "learning_rate": 0.0001766932261767517, "loss": 4.7508, "mean_token_accuracy": 0.23270728588104247, "num_tokens": 144160275.0, "step": 83115 }, { "entropy": 5.435375070571899, "epoch": 6.466990857809765, "grad_norm": 1.3359375, "learning_rate": 0.00017666829672780454, "loss": 4.7002, "mean_token_accuracy": 0.23971298038959504, "num_tokens": 144168830.0, "step": 83120 }, { "entropy": 5.3598182678222654, "epoch": 6.467379887181482, "grad_norm": 1.2109375, "learning_rate": 0.00017664336877088455, "loss": 4.6843, "mean_token_accuracy": 0.23895858824253083, "num_tokens": 144177532.0, "step": 83125 }, { "entropy": 5.381075048446656, "epoch": 6.4677689165532, "grad_norm": 1.3125, "learning_rate": 0.00017661844230636986, "loss": 4.6461, "mean_token_accuracy": 0.24438221007585526, "num_tokens": 144186522.0, "step": 83130 }, { "entropy": 5.369091463088989, "epoch": 6.468157945924918, "grad_norm": 1.171875, "learning_rate": 0.00017659351733463879, "loss": 4.6695, "mean_token_accuracy": 0.23817451894283295, "num_tokens": 144195265.0, "step": 83135 }, { "entropy": 5.2811665534973145, "epoch": 6.4685469752966345, "grad_norm": 1.296875, "learning_rate": 0.00017656859385606938, "loss": 4.5577, "mean_token_accuracy": 0.24444673508405684, "num_tokens": 144204035.0, "step": 83140 }, { "entropy": 5.478275394439697, "epoch": 6.468936004668352, "grad_norm": 1.34375, "learning_rate": 0.00017654367187103993, "loss": 4.7658, "mean_token_accuracy": 0.23258228451013566, "num_tokens": 144213719.0, "step": 83145 }, { "entropy": 5.423763656616211, "epoch": 6.46932503404007, "grad_norm": 1.2734375, "learning_rate": 0.0001765187513799285, "loss": 4.5578, "mean_token_accuracy": 0.2460702881217003, "num_tokens": 144222339.0, "step": 83150 }, { "entropy": 5.430379009246826, "epoch": 6.469714063411788, "grad_norm": 1.375, "learning_rate": 0.00017649383238311334, "loss": 4.6843, "mean_token_accuracy": 0.23618950098752975, "num_tokens": 144230538.0, "step": 83155 }, { "entropy": 5.419036054611206, "epoch": 6.470103092783505, "grad_norm": 1.3515625, "learning_rate": 0.00017646891488097249, "loss": 4.6879, "mean_token_accuracy": 0.2372881218791008, "num_tokens": 144239515.0, "step": 83160 }, { "entropy": 5.403009223937988, "epoch": 6.470492122155223, "grad_norm": 1.3671875, "learning_rate": 0.00017644399887388395, "loss": 4.6246, "mean_token_accuracy": 0.24060717225074768, "num_tokens": 144248415.0, "step": 83165 }, { "entropy": 5.352075433731079, "epoch": 6.470881151526941, "grad_norm": 1.3125, "learning_rate": 0.00017641908436222582, "loss": 4.6019, "mean_token_accuracy": 0.24918050467967987, "num_tokens": 144256911.0, "step": 83170 }, { "entropy": 5.383292198181152, "epoch": 6.4712701808986575, "grad_norm": 1.2109375, "learning_rate": 0.00017639417134637626, "loss": 4.7333, "mean_token_accuracy": 0.22776828557252884, "num_tokens": 144266495.0, "step": 83175 }, { "entropy": 5.3731663703918455, "epoch": 6.471659210270375, "grad_norm": 1.2734375, "learning_rate": 0.0001763692598267132, "loss": 4.6339, "mean_token_accuracy": 0.24725642800331116, "num_tokens": 144275036.0, "step": 83180 }, { "entropy": 5.432977151870728, "epoch": 6.472048239642093, "grad_norm": 1.3203125, "learning_rate": 0.0001763443498036147, "loss": 4.6342, "mean_token_accuracy": 0.24487248808145523, "num_tokens": 144283063.0, "step": 83185 }, { "entropy": 5.350069665908814, "epoch": 6.472437269013811, "grad_norm": 1.3828125, "learning_rate": 0.00017631944127745853, "loss": 4.5786, "mean_token_accuracy": 0.2431916981935501, "num_tokens": 144291918.0, "step": 83190 }, { "entropy": 5.353489923477173, "epoch": 6.472826298385528, "grad_norm": 1.28125, "learning_rate": 0.0001762945342486229, "loss": 4.6198, "mean_token_accuracy": 0.23948957920074462, "num_tokens": 144300950.0, "step": 83195 }, { "entropy": 5.379969072341919, "epoch": 6.473215327757246, "grad_norm": 1.359375, "learning_rate": 0.00017626962871748547, "loss": 4.6049, "mean_token_accuracy": 0.2385811135172844, "num_tokens": 144309726.0, "step": 83200 }, { "entropy": 5.384865379333496, "epoch": 6.473604357128964, "grad_norm": 1.3984375, "learning_rate": 0.00017624472468442444, "loss": 4.6355, "mean_token_accuracy": 0.24071792364120484, "num_tokens": 144318172.0, "step": 83205 }, { "entropy": 5.3996976852417, "epoch": 6.4739933865006805, "grad_norm": 1.296875, "learning_rate": 0.0001762198221498174, "loss": 4.7347, "mean_token_accuracy": 0.23437222689390183, "num_tokens": 144327651.0, "step": 83210 }, { "entropy": 5.371520853042602, "epoch": 6.474382415872398, "grad_norm": 1.296875, "learning_rate": 0.0001761949211140424, "loss": 4.5978, "mean_token_accuracy": 0.2415680393576622, "num_tokens": 144336461.0, "step": 83215 }, { "entropy": 5.353822851181031, "epoch": 6.474771445244116, "grad_norm": 1.328125, "learning_rate": 0.00017617002157747713, "loss": 4.5992, "mean_token_accuracy": 0.24708184599876404, "num_tokens": 144344873.0, "step": 83220 }, { "entropy": 5.4636212348937985, "epoch": 6.4751604746158336, "grad_norm": 1.34375, "learning_rate": 0.00017614512354049956, "loss": 4.7315, "mean_token_accuracy": 0.2276887536048889, "num_tokens": 144354009.0, "step": 83225 }, { "entropy": 5.256934785842896, "epoch": 6.475549503987551, "grad_norm": 1.328125, "learning_rate": 0.00017612022700348734, "loss": 4.5065, "mean_token_accuracy": 0.25481875985860825, "num_tokens": 144362835.0, "step": 83230 }, { "entropy": 5.3872823238372805, "epoch": 6.475938533359269, "grad_norm": 1.40625, "learning_rate": 0.00017609533196681827, "loss": 4.7105, "mean_token_accuracy": 0.23734594881534576, "num_tokens": 144371390.0, "step": 83235 }, { "entropy": 5.415806436538697, "epoch": 6.476327562730987, "grad_norm": 1.3671875, "learning_rate": 0.00017607043843087024, "loss": 4.6786, "mean_token_accuracy": 0.2336479753255844, "num_tokens": 144379929.0, "step": 83240 }, { "entropy": 5.451193809509277, "epoch": 6.4767165921027035, "grad_norm": 1.359375, "learning_rate": 0.0001760455463960207, "loss": 4.8381, "mean_token_accuracy": 0.22816236019134523, "num_tokens": 144389218.0, "step": 83245 }, { "entropy": 5.4189568042755125, "epoch": 6.477105621474421, "grad_norm": 1.296875, "learning_rate": 0.0001760206558626476, "loss": 4.6398, "mean_token_accuracy": 0.24005489945411682, "num_tokens": 144398026.0, "step": 83250 }, { "entropy": 5.319013166427612, "epoch": 6.477494650846139, "grad_norm": 1.21875, "learning_rate": 0.00017599576683112843, "loss": 4.5606, "mean_token_accuracy": 0.24223515540361404, "num_tokens": 144406951.0, "step": 83255 }, { "entropy": 5.44429759979248, "epoch": 6.4778836802178565, "grad_norm": 1.3203125, "learning_rate": 0.00017597087930184096, "loss": 4.7072, "mean_token_accuracy": 0.2340103343129158, "num_tokens": 144416307.0, "step": 83260 }, { "entropy": 5.368282318115234, "epoch": 6.478272709589574, "grad_norm": 1.2890625, "learning_rate": 0.00017594599327516275, "loss": 4.6499, "mean_token_accuracy": 0.24169748723506929, "num_tokens": 144424553.0, "step": 83265 }, { "entropy": 5.380005884170532, "epoch": 6.478661738961292, "grad_norm": 1.3359375, "learning_rate": 0.0001759211087514715, "loss": 4.6563, "mean_token_accuracy": 0.23348379582166673, "num_tokens": 144432965.0, "step": 83270 }, { "entropy": 5.417811870574951, "epoch": 6.479050768333009, "grad_norm": 1.328125, "learning_rate": 0.00017589622573114473, "loss": 4.6618, "mean_token_accuracy": 0.23485977053642274, "num_tokens": 144442246.0, "step": 83275 }, { "entropy": 5.3904369354248045, "epoch": 6.4794397977047264, "grad_norm": 1.3046875, "learning_rate": 0.00017587134421455985, "loss": 4.6345, "mean_token_accuracy": 0.24311417192220688, "num_tokens": 144450769.0, "step": 83280 }, { "entropy": 5.456230640411377, "epoch": 6.479828827076444, "grad_norm": 1.328125, "learning_rate": 0.00017584646420209471, "loss": 4.7351, "mean_token_accuracy": 0.23157899379730223, "num_tokens": 144459316.0, "step": 83285 }, { "entropy": 5.314313220977783, "epoch": 6.480217856448162, "grad_norm": 1.34375, "learning_rate": 0.00017582158569412655, "loss": 4.5794, "mean_token_accuracy": 0.24161757230758668, "num_tokens": 144468129.0, "step": 83290 }, { "entropy": 5.327884340286255, "epoch": 6.4806068858198795, "grad_norm": 1.3125, "learning_rate": 0.00017579670869103298, "loss": 4.5809, "mean_token_accuracy": 0.24892695546150206, "num_tokens": 144477231.0, "step": 83295 }, { "entropy": 5.488379621505738, "epoch": 6.480995915191597, "grad_norm": 1.3828125, "learning_rate": 0.00017577183319319146, "loss": 4.7505, "mean_token_accuracy": 0.23556938171386718, "num_tokens": 144485564.0, "step": 83300 }, { "entropy": 5.4518866539001465, "epoch": 6.481384944563315, "grad_norm": 1.34375, "learning_rate": 0.0001757469592009794, "loss": 4.7263, "mean_token_accuracy": 0.23517630100250245, "num_tokens": 144495001.0, "step": 83305 }, { "entropy": 5.400519466400146, "epoch": 6.481773973935032, "grad_norm": 1.3125, "learning_rate": 0.00017572208671477434, "loss": 4.6299, "mean_token_accuracy": 0.24035293310880662, "num_tokens": 144503201.0, "step": 83310 }, { "entropy": 5.375655746459961, "epoch": 6.482163003306749, "grad_norm": 1.3125, "learning_rate": 0.00017569721573495355, "loss": 4.7024, "mean_token_accuracy": 0.23829648345708848, "num_tokens": 144511117.0, "step": 83315 }, { "entropy": 5.3682609558105465, "epoch": 6.482552032678467, "grad_norm": 1.328125, "learning_rate": 0.0001756723462618945, "loss": 4.6645, "mean_token_accuracy": 0.23648438453674317, "num_tokens": 144519697.0, "step": 83320 }, { "entropy": 5.4353930950164795, "epoch": 6.482941062050185, "grad_norm": 1.359375, "learning_rate": 0.00017564747829597438, "loss": 4.6199, "mean_token_accuracy": 0.2387355834245682, "num_tokens": 144528031.0, "step": 83325 }, { "entropy": 5.388996505737305, "epoch": 6.4833300914219025, "grad_norm": 1.359375, "learning_rate": 0.00017562261183757077, "loss": 4.6697, "mean_token_accuracy": 0.24037218242883682, "num_tokens": 144536971.0, "step": 83330 }, { "entropy": 5.329874706268311, "epoch": 6.48371912079362, "grad_norm": 1.46875, "learning_rate": 0.00017559774688706076, "loss": 4.5203, "mean_token_accuracy": 0.26216619163751603, "num_tokens": 144545407.0, "step": 83335 }, { "entropy": 5.401223945617676, "epoch": 6.484108150165337, "grad_norm": 1.390625, "learning_rate": 0.0001755728834448218, "loss": 4.628, "mean_token_accuracy": 0.24279364794492722, "num_tokens": 144554025.0, "step": 83340 }, { "entropy": 5.376631879806519, "epoch": 6.484497179537055, "grad_norm": 1.3046875, "learning_rate": 0.000175548021511231, "loss": 4.6482, "mean_token_accuracy": 0.24557300060987472, "num_tokens": 144562529.0, "step": 83345 }, { "entropy": 5.336154317855835, "epoch": 6.484886208908772, "grad_norm": 1.21875, "learning_rate": 0.00017552316108666584, "loss": 4.6549, "mean_token_accuracy": 0.23849573284387587, "num_tokens": 144572085.0, "step": 83350 }, { "entropy": 5.369937705993652, "epoch": 6.48527523828049, "grad_norm": 1.2890625, "learning_rate": 0.00017549830217150327, "loss": 4.6377, "mean_token_accuracy": 0.24205496907234192, "num_tokens": 144581187.0, "step": 83355 }, { "entropy": 5.4559544086456295, "epoch": 6.485664267652208, "grad_norm": 1.3515625, "learning_rate": 0.00017547344476612054, "loss": 4.7003, "mean_token_accuracy": 0.23278297185897828, "num_tokens": 144589266.0, "step": 83360 }, { "entropy": 5.400863218307495, "epoch": 6.4860532970239255, "grad_norm": 1.3203125, "learning_rate": 0.00017544858887089487, "loss": 4.757, "mean_token_accuracy": 0.2346418097615242, "num_tokens": 144598662.0, "step": 83365 }, { "entropy": 5.322594690322876, "epoch": 6.486442326395643, "grad_norm": 1.1796875, "learning_rate": 0.0001754237344862034, "loss": 4.6297, "mean_token_accuracy": 0.23753974437713624, "num_tokens": 144607721.0, "step": 83370 }, { "entropy": 5.421631097793579, "epoch": 6.48683135576736, "grad_norm": 1.3671875, "learning_rate": 0.0001753988816124234, "loss": 4.7043, "mean_token_accuracy": 0.2296262189745903, "num_tokens": 144615860.0, "step": 83375 }, { "entropy": 5.393128395080566, "epoch": 6.487220385139078, "grad_norm": 1.3203125, "learning_rate": 0.00017537403024993182, "loss": 4.6045, "mean_token_accuracy": 0.24792427867650985, "num_tokens": 144624243.0, "step": 83380 }, { "entropy": 5.413813066482544, "epoch": 6.487609414510795, "grad_norm": 1.3828125, "learning_rate": 0.00017534918039910564, "loss": 4.6419, "mean_token_accuracy": 0.23878444135189056, "num_tokens": 144632924.0, "step": 83385 }, { "entropy": 5.389645576477051, "epoch": 6.487998443882513, "grad_norm": 1.3515625, "learning_rate": 0.00017532433206032217, "loss": 4.693, "mean_token_accuracy": 0.2284933552145958, "num_tokens": 144641664.0, "step": 83390 }, { "entropy": 5.260879325866699, "epoch": 6.488387473254231, "grad_norm": 1.328125, "learning_rate": 0.00017529948523395817, "loss": 4.6019, "mean_token_accuracy": 0.24544305801391603, "num_tokens": 144650376.0, "step": 83395 }, { "entropy": 5.392789220809936, "epoch": 6.4887765026259485, "grad_norm": 1.34375, "learning_rate": 0.00017527463992039093, "loss": 4.7005, "mean_token_accuracy": 0.2376922160387039, "num_tokens": 144659295.0, "step": 83400 }, { "entropy": 5.3748095512390135, "epoch": 6.489165531997666, "grad_norm": 1.3125, "learning_rate": 0.0001752497961199972, "loss": 4.586, "mean_token_accuracy": 0.24188725501298905, "num_tokens": 144667291.0, "step": 83405 }, { "entropy": 5.450176525115967, "epoch": 6.489554561369383, "grad_norm": 1.2578125, "learning_rate": 0.00017522495383315412, "loss": 4.7079, "mean_token_accuracy": 0.22790154218673705, "num_tokens": 144676178.0, "step": 83410 }, { "entropy": 5.382223892211914, "epoch": 6.489943590741101, "grad_norm": 1.265625, "learning_rate": 0.00017520011306023847, "loss": 4.6562, "mean_token_accuracy": 0.24365486055612565, "num_tokens": 144685099.0, "step": 83415 }, { "entropy": 5.477406454086304, "epoch": 6.490332620112818, "grad_norm": 1.25, "learning_rate": 0.0001751752738016274, "loss": 4.7046, "mean_token_accuracy": 0.23478867560625077, "num_tokens": 144694159.0, "step": 83420 }, { "entropy": 5.400271987915039, "epoch": 6.490721649484536, "grad_norm": 1.2890625, "learning_rate": 0.0001751504360576975, "loss": 4.6641, "mean_token_accuracy": 0.2375238299369812, "num_tokens": 144702377.0, "step": 83425 }, { "entropy": 5.41828670501709, "epoch": 6.491110678856254, "grad_norm": 1.3203125, "learning_rate": 0.00017512559982882592, "loss": 4.7073, "mean_token_accuracy": 0.2315768525004387, "num_tokens": 144711024.0, "step": 83430 }, { "entropy": 5.34035472869873, "epoch": 6.4914997082279715, "grad_norm": 1.2578125, "learning_rate": 0.0001751007651153893, "loss": 4.6499, "mean_token_accuracy": 0.23761221617460251, "num_tokens": 144719948.0, "step": 83435 }, { "entropy": 5.380842065811157, "epoch": 6.491888737599689, "grad_norm": 1.3046875, "learning_rate": 0.00017507593191776454, "loss": 4.6441, "mean_token_accuracy": 0.2363035723567009, "num_tokens": 144728303.0, "step": 83440 }, { "entropy": 5.354175472259522, "epoch": 6.492277766971406, "grad_norm": 1.359375, "learning_rate": 0.00017505110023632858, "loss": 4.6216, "mean_token_accuracy": 0.24454816728830336, "num_tokens": 144736614.0, "step": 83445 }, { "entropy": 5.395017528533936, "epoch": 6.492666796343124, "grad_norm": 1.421875, "learning_rate": 0.00017502627007145804, "loss": 4.6354, "mean_token_accuracy": 0.24412447810173035, "num_tokens": 144745225.0, "step": 83450 }, { "entropy": 5.396701049804688, "epoch": 6.493055825714841, "grad_norm": 1.3359375, "learning_rate": 0.00017500144142352974, "loss": 4.7659, "mean_token_accuracy": 0.23419586718082427, "num_tokens": 144753691.0, "step": 83455 }, { "entropy": 5.37310152053833, "epoch": 6.493444855086559, "grad_norm": 1.3984375, "learning_rate": 0.0001749766142929205, "loss": 4.5724, "mean_token_accuracy": 0.24771341383457185, "num_tokens": 144761623.0, "step": 83460 }, { "entropy": 5.33272066116333, "epoch": 6.493833884458277, "grad_norm": 1.3984375, "learning_rate": 0.00017495178868000679, "loss": 4.5398, "mean_token_accuracy": 0.24511287957429886, "num_tokens": 144770119.0, "step": 83465 }, { "entropy": 5.4937763690948485, "epoch": 6.4942229138299945, "grad_norm": 1.359375, "learning_rate": 0.0001749269645851655, "loss": 4.7742, "mean_token_accuracy": 0.23412951976060867, "num_tokens": 144778535.0, "step": 83470 }, { "entropy": 5.4095234870910645, "epoch": 6.494611943201711, "grad_norm": 1.3984375, "learning_rate": 0.00017490214200877323, "loss": 4.7165, "mean_token_accuracy": 0.23663477897644042, "num_tokens": 144787377.0, "step": 83475 }, { "entropy": 5.368360137939453, "epoch": 6.495000972573429, "grad_norm": 1.40625, "learning_rate": 0.00017487732095120665, "loss": 4.6441, "mean_token_accuracy": 0.23645565509796143, "num_tokens": 144795627.0, "step": 83480 }, { "entropy": 5.365503311157227, "epoch": 6.495390001945147, "grad_norm": 1.359375, "learning_rate": 0.0001748525014128423, "loss": 4.6106, "mean_token_accuracy": 0.23636668622493745, "num_tokens": 144804566.0, "step": 83485 }, { "entropy": 5.366048860549927, "epoch": 6.495779031316864, "grad_norm": 1.3671875, "learning_rate": 0.0001748276833940569, "loss": 4.6629, "mean_token_accuracy": 0.24267521351575852, "num_tokens": 144812947.0, "step": 83490 }, { "entropy": 5.296392440795898, "epoch": 6.496168060688582, "grad_norm": 1.3359375, "learning_rate": 0.00017480286689522693, "loss": 4.5359, "mean_token_accuracy": 0.24629462659358978, "num_tokens": 144820845.0, "step": 83495 }, { "entropy": 5.363618612289429, "epoch": 6.4965570900603, "grad_norm": 1.3515625, "learning_rate": 0.00017477805191672897, "loss": 4.6564, "mean_token_accuracy": 0.24040672332048416, "num_tokens": 144829796.0, "step": 83500 }, { "entropy": 5.350198602676391, "epoch": 6.4969461194320175, "grad_norm": 1.2578125, "learning_rate": 0.0001747532384589396, "loss": 4.6378, "mean_token_accuracy": 0.2524542972445488, "num_tokens": 144838603.0, "step": 83505 }, { "entropy": 5.407485103607177, "epoch": 6.497335148803734, "grad_norm": 1.3125, "learning_rate": 0.0001747284265222352, "loss": 4.6566, "mean_token_accuracy": 0.23786742091178895, "num_tokens": 144846947.0, "step": 83510 }, { "entropy": 5.306180095672607, "epoch": 6.497724178175452, "grad_norm": 1.2421875, "learning_rate": 0.00017470361610699242, "loss": 4.5784, "mean_token_accuracy": 0.24295345991849898, "num_tokens": 144856526.0, "step": 83515 }, { "entropy": 5.308623838424682, "epoch": 6.49811320754717, "grad_norm": 1.265625, "learning_rate": 0.00017467880721358753, "loss": 4.5811, "mean_token_accuracy": 0.25063242465257646, "num_tokens": 144865108.0, "step": 83520 }, { "entropy": 5.372726345062256, "epoch": 6.498502236918887, "grad_norm": 1.28125, "learning_rate": 0.0001746539998423972, "loss": 4.6847, "mean_token_accuracy": 0.23263390362262726, "num_tokens": 144874099.0, "step": 83525 }, { "entropy": 5.399352216720581, "epoch": 6.498891266290605, "grad_norm": 1.3203125, "learning_rate": 0.00017462919399379757, "loss": 4.6513, "mean_token_accuracy": 0.23591966181993484, "num_tokens": 144882622.0, "step": 83530 }, { "entropy": 5.397777080535889, "epoch": 6.499280295662323, "grad_norm": 1.375, "learning_rate": 0.00017460438966816525, "loss": 4.694, "mean_token_accuracy": 0.23270392268896103, "num_tokens": 144891143.0, "step": 83535 }, { "entropy": 5.336880302429199, "epoch": 6.49966932503404, "grad_norm": 1.2109375, "learning_rate": 0.00017457958686587654, "loss": 4.5252, "mean_token_accuracy": 0.24792672246694564, "num_tokens": 144900487.0, "step": 83540 }, { "entropy": 5.3179912090301515, "epoch": 6.500058354405757, "grad_norm": 1.1953125, "learning_rate": 0.00017455478558730769, "loss": 4.6041, "mean_token_accuracy": 0.24024751484394075, "num_tokens": 144909116.0, "step": 83545 }, { "entropy": 5.408647918701172, "epoch": 6.500447383777475, "grad_norm": 1.2734375, "learning_rate": 0.00017452998583283513, "loss": 4.6972, "mean_token_accuracy": 0.23305072635412216, "num_tokens": 144918053.0, "step": 83550 }, { "entropy": 5.4168976783752445, "epoch": 6.500836413149193, "grad_norm": 1.2421875, "learning_rate": 0.00017450518760283508, "loss": 4.7059, "mean_token_accuracy": 0.23590434491634368, "num_tokens": 144926801.0, "step": 83555 }, { "entropy": 5.3464583396911625, "epoch": 6.50122544252091, "grad_norm": 1.3359375, "learning_rate": 0.00017448039089768393, "loss": 4.5756, "mean_token_accuracy": 0.24794217944145203, "num_tokens": 144935373.0, "step": 83560 }, { "entropy": 5.380363130569458, "epoch": 6.501614471892628, "grad_norm": 1.3515625, "learning_rate": 0.00017445559571775766, "loss": 4.6318, "mean_token_accuracy": 0.2436601012945175, "num_tokens": 144943925.0, "step": 83565 }, { "entropy": 5.439556837081909, "epoch": 6.502003501264346, "grad_norm": 1.359375, "learning_rate": 0.0001744308020634329, "loss": 4.6761, "mean_token_accuracy": 0.23909944891929627, "num_tokens": 144952186.0, "step": 83570 }, { "entropy": 5.378495550155639, "epoch": 6.5023925306360635, "grad_norm": 1.40625, "learning_rate": 0.00017440600993508563, "loss": 4.58, "mean_token_accuracy": 0.24732628464698792, "num_tokens": 144961399.0, "step": 83575 }, { "entropy": 5.42419753074646, "epoch": 6.50278156000778, "grad_norm": 1.28125, "learning_rate": 0.00017438121933309198, "loss": 4.6952, "mean_token_accuracy": 0.2412168115377426, "num_tokens": 144969858.0, "step": 83580 }, { "entropy": 5.340136766433716, "epoch": 6.503170589379498, "grad_norm": 1.4375, "learning_rate": 0.00017435643025782822, "loss": 4.5822, "mean_token_accuracy": 0.24464589953422547, "num_tokens": 144978261.0, "step": 83585 }, { "entropy": 5.400950622558594, "epoch": 6.503559618751216, "grad_norm": 1.4140625, "learning_rate": 0.00017433164270967038, "loss": 4.6367, "mean_token_accuracy": 0.2401440218091011, "num_tokens": 144986373.0, "step": 83590 }, { "entropy": 5.408540058135986, "epoch": 6.503948648122933, "grad_norm": 1.59375, "learning_rate": 0.00017430685668899472, "loss": 4.6803, "mean_token_accuracy": 0.24499937742948533, "num_tokens": 144995046.0, "step": 83595 }, { "entropy": 5.379244565963745, "epoch": 6.504337677494651, "grad_norm": 1.3828125, "learning_rate": 0.00017428207219617715, "loss": 4.7014, "mean_token_accuracy": 0.23217418491840364, "num_tokens": 145003878.0, "step": 83600 }, { "entropy": 5.379294443130493, "epoch": 6.504726706866369, "grad_norm": 1.265625, "learning_rate": 0.00017425728923159392, "loss": 4.6587, "mean_token_accuracy": 0.24162754714488982, "num_tokens": 145013195.0, "step": 83605 }, { "entropy": 5.327761316299439, "epoch": 6.505115736238086, "grad_norm": 1.2734375, "learning_rate": 0.0001742325077956209, "loss": 4.6443, "mean_token_accuracy": 0.2402042031288147, "num_tokens": 145021874.0, "step": 83610 }, { "entropy": 5.390652704238891, "epoch": 6.505504765609803, "grad_norm": 1.3125, "learning_rate": 0.00017420772788863422, "loss": 4.6587, "mean_token_accuracy": 0.2386966183781624, "num_tokens": 145030055.0, "step": 83615 }, { "entropy": 5.366240406036377, "epoch": 6.505893794981521, "grad_norm": 1.2890625, "learning_rate": 0.00017418294951100988, "loss": 4.6501, "mean_token_accuracy": 0.2400822952389717, "num_tokens": 145039136.0, "step": 83620 }, { "entropy": 5.356420183181763, "epoch": 6.506282824353239, "grad_norm": 1.3203125, "learning_rate": 0.00017415817266312373, "loss": 4.6144, "mean_token_accuracy": 0.25107798874378207, "num_tokens": 145048021.0, "step": 83625 }, { "entropy": 5.350440168380738, "epoch": 6.506671853724956, "grad_norm": 1.21875, "learning_rate": 0.0001741333973453518, "loss": 4.6291, "mean_token_accuracy": 0.24473216235637665, "num_tokens": 145056891.0, "step": 83630 }, { "entropy": 5.45037202835083, "epoch": 6.507060883096674, "grad_norm": 1.34375, "learning_rate": 0.00017410862355807, "loss": 4.7281, "mean_token_accuracy": 0.23751418441534042, "num_tokens": 145064959.0, "step": 83635 }, { "entropy": 5.4057104110717775, "epoch": 6.507449912468392, "grad_norm": 1.3828125, "learning_rate": 0.0001740838513016544, "loss": 4.6734, "mean_token_accuracy": 0.23462863266468048, "num_tokens": 145073000.0, "step": 83640 }, { "entropy": 5.368985509872436, "epoch": 6.507838941840109, "grad_norm": 1.328125, "learning_rate": 0.00017405908057648055, "loss": 4.5999, "mean_token_accuracy": 0.24118918925523758, "num_tokens": 145081984.0, "step": 83645 }, { "entropy": 5.403512907028198, "epoch": 6.508227971211826, "grad_norm": 1.2890625, "learning_rate": 0.00017403431138292465, "loss": 4.6662, "mean_token_accuracy": 0.24083335548639298, "num_tokens": 145091038.0, "step": 83650 }, { "entropy": 5.391356468200684, "epoch": 6.508617000583544, "grad_norm": 1.25, "learning_rate": 0.00017400954372136235, "loss": 4.7057, "mean_token_accuracy": 0.24033572673797607, "num_tokens": 145099829.0, "step": 83655 }, { "entropy": 5.3741413116455075, "epoch": 6.509006029955262, "grad_norm": 1.328125, "learning_rate": 0.00017398477759216939, "loss": 4.5606, "mean_token_accuracy": 0.2511690020561218, "num_tokens": 145109039.0, "step": 83660 }, { "entropy": 5.413078641891479, "epoch": 6.509395059326979, "grad_norm": 1.390625, "learning_rate": 0.00017396001299572174, "loss": 4.7016, "mean_token_accuracy": 0.23531747460365296, "num_tokens": 145117156.0, "step": 83665 }, { "entropy": 5.4354172706604, "epoch": 6.509784088698697, "grad_norm": 1.4453125, "learning_rate": 0.00017393524993239496, "loss": 4.705, "mean_token_accuracy": 0.2352612242102623, "num_tokens": 145124774.0, "step": 83670 }, { "entropy": 5.252783393859863, "epoch": 6.510173118070414, "grad_norm": 1.2265625, "learning_rate": 0.00017391048840256502, "loss": 4.5743, "mean_token_accuracy": 0.2417900413274765, "num_tokens": 145133471.0, "step": 83675 }, { "entropy": 5.412714719772339, "epoch": 6.510562147442132, "grad_norm": 1.328125, "learning_rate": 0.00017388572840660742, "loss": 4.7412, "mean_token_accuracy": 0.23891898840665818, "num_tokens": 145141839.0, "step": 83680 }, { "entropy": 5.414959192276001, "epoch": 6.510951176813849, "grad_norm": 1.3203125, "learning_rate": 0.00017386096994489802, "loss": 4.6893, "mean_token_accuracy": 0.2417949065566063, "num_tokens": 145150258.0, "step": 83685 }, { "entropy": 5.501168251037598, "epoch": 6.511340206185567, "grad_norm": 1.3046875, "learning_rate": 0.0001738362130178124, "loss": 4.8125, "mean_token_accuracy": 0.22415529787540436, "num_tokens": 145159325.0, "step": 83690 }, { "entropy": 5.4057403087615965, "epoch": 6.511729235557285, "grad_norm": 1.2890625, "learning_rate": 0.00017381145762572622, "loss": 4.655, "mean_token_accuracy": 0.23063469678163528, "num_tokens": 145168223.0, "step": 83695 }, { "entropy": 5.403976106643677, "epoch": 6.512118264929002, "grad_norm": 1.328125, "learning_rate": 0.00017378670376901506, "loss": 4.6322, "mean_token_accuracy": 0.2381923660635948, "num_tokens": 145177510.0, "step": 83700 }, { "entropy": 5.295703601837158, "epoch": 6.51250729430072, "grad_norm": 1.28125, "learning_rate": 0.00017376195144805463, "loss": 4.4998, "mean_token_accuracy": 0.24944690763950347, "num_tokens": 145186323.0, "step": 83705 }, { "entropy": 5.3563133716583256, "epoch": 6.512896323672438, "grad_norm": 1.2890625, "learning_rate": 0.00017373720066322048, "loss": 4.6157, "mean_token_accuracy": 0.24090910255908965, "num_tokens": 145195363.0, "step": 83710 }, { "entropy": 5.381863451004028, "epoch": 6.513285353044155, "grad_norm": 1.296875, "learning_rate": 0.00017371245141488805, "loss": 4.6385, "mean_token_accuracy": 0.2459246277809143, "num_tokens": 145204179.0, "step": 83715 }, { "entropy": 5.439093589782715, "epoch": 6.513674382415872, "grad_norm": 1.25, "learning_rate": 0.00017368770370343307, "loss": 4.7523, "mean_token_accuracy": 0.23796629309654235, "num_tokens": 145213116.0, "step": 83720 }, { "entropy": 5.428942537307739, "epoch": 6.51406341178759, "grad_norm": 1.4453125, "learning_rate": 0.00017366295752923078, "loss": 4.654, "mean_token_accuracy": 0.23647023290395736, "num_tokens": 145221626.0, "step": 83725 }, { "entropy": 5.394447565078735, "epoch": 6.514452441159308, "grad_norm": 1.234375, "learning_rate": 0.000173638212892657, "loss": 4.6136, "mean_token_accuracy": 0.2380926489830017, "num_tokens": 145230243.0, "step": 83730 }, { "entropy": 5.3869202613830565, "epoch": 6.514841470531025, "grad_norm": 1.3046875, "learning_rate": 0.00017361346979408694, "loss": 4.6477, "mean_token_accuracy": 0.23749045580625533, "num_tokens": 145238314.0, "step": 83735 }, { "entropy": 5.376548910140992, "epoch": 6.515230499902742, "grad_norm": 1.25, "learning_rate": 0.000173588728233896, "loss": 4.6322, "mean_token_accuracy": 0.24324368238449096, "num_tokens": 145246867.0, "step": 83740 }, { "entropy": 5.363338565826416, "epoch": 6.51561952927446, "grad_norm": 1.328125, "learning_rate": 0.00017356398821245984, "loss": 4.6949, "mean_token_accuracy": 0.23921376913785936, "num_tokens": 145255436.0, "step": 83745 }, { "entropy": 5.367169046401978, "epoch": 6.516008558646178, "grad_norm": 1.28125, "learning_rate": 0.00017353924973015358, "loss": 4.6783, "mean_token_accuracy": 0.2320227265357971, "num_tokens": 145264089.0, "step": 83750 }, { "entropy": 5.394724702835083, "epoch": 6.516397588017895, "grad_norm": 1.3828125, "learning_rate": 0.0001735145127873528, "loss": 4.6668, "mean_token_accuracy": 0.23478420376777648, "num_tokens": 145273119.0, "step": 83755 }, { "entropy": 5.321128940582275, "epoch": 6.516786617389613, "grad_norm": 1.3046875, "learning_rate": 0.00017348977738443266, "loss": 4.5583, "mean_token_accuracy": 0.24828683733940124, "num_tokens": 145281254.0, "step": 83760 }, { "entropy": 5.455593681335449, "epoch": 6.517175646761331, "grad_norm": 1.34375, "learning_rate": 0.00017346504352176863, "loss": 4.7276, "mean_token_accuracy": 0.2350144475698471, "num_tokens": 145289839.0, "step": 83765 }, { "entropy": 5.493970632553101, "epoch": 6.517564676133048, "grad_norm": 1.265625, "learning_rate": 0.00017344031119973603, "loss": 4.7783, "mean_token_accuracy": 0.2354137971997261, "num_tokens": 145298517.0, "step": 83770 }, { "entropy": 5.404459428787232, "epoch": 6.517953705504766, "grad_norm": 1.328125, "learning_rate": 0.00017341558041870995, "loss": 4.692, "mean_token_accuracy": 0.23664177656173707, "num_tokens": 145307390.0, "step": 83775 }, { "entropy": 5.368070983886719, "epoch": 6.518342734876483, "grad_norm": 1.2109375, "learning_rate": 0.00017339085117906583, "loss": 4.6166, "mean_token_accuracy": 0.24402675926685333, "num_tokens": 145316555.0, "step": 83780 }, { "entropy": 5.359530353546143, "epoch": 6.5187317642482006, "grad_norm": 1.296875, "learning_rate": 0.00017336612348117875, "loss": 4.7184, "mean_token_accuracy": 0.24068852216005326, "num_tokens": 145325337.0, "step": 83785 }, { "entropy": 5.41115026473999, "epoch": 6.519120793619918, "grad_norm": 1.34375, "learning_rate": 0.00017334139732542403, "loss": 4.6374, "mean_token_accuracy": 0.24156950265169144, "num_tokens": 145334048.0, "step": 83790 }, { "entropy": 5.376961708068848, "epoch": 6.519509822991636, "grad_norm": 1.3671875, "learning_rate": 0.00017331667271217675, "loss": 4.6782, "mean_token_accuracy": 0.2332757368683815, "num_tokens": 145343200.0, "step": 83795 }, { "entropy": 5.51034369468689, "epoch": 6.519898852363354, "grad_norm": 1.25, "learning_rate": 0.00017329194964181219, "loss": 4.7767, "mean_token_accuracy": 0.2358574777841568, "num_tokens": 145351656.0, "step": 83800 }, { "entropy": 5.375264120101929, "epoch": 6.520287881735071, "grad_norm": 1.2890625, "learning_rate": 0.00017326722811470533, "loss": 4.6496, "mean_token_accuracy": 0.24498433172702788, "num_tokens": 145360381.0, "step": 83805 }, { "entropy": 5.392841482162476, "epoch": 6.520676911106788, "grad_norm": 1.515625, "learning_rate": 0.00017324250813123145, "loss": 4.6598, "mean_token_accuracy": 0.2369341015815735, "num_tokens": 145368889.0, "step": 83810 }, { "entropy": 5.302327442169189, "epoch": 6.521065940478506, "grad_norm": 1.1953125, "learning_rate": 0.0001732177896917655, "loss": 4.6072, "mean_token_accuracy": 0.23790445178747177, "num_tokens": 145377921.0, "step": 83815 }, { "entropy": 5.331922483444214, "epoch": 6.5214549698502235, "grad_norm": 1.2890625, "learning_rate": 0.00017319307279668256, "loss": 4.6125, "mean_token_accuracy": 0.24864569902420045, "num_tokens": 145387162.0, "step": 83820 }, { "entropy": 5.304832887649536, "epoch": 6.521843999221941, "grad_norm": 1.265625, "learning_rate": 0.00017316835744635777, "loss": 4.5387, "mean_token_accuracy": 0.24892952740192414, "num_tokens": 145395665.0, "step": 83825 }, { "entropy": 5.39853687286377, "epoch": 6.522233028593659, "grad_norm": 1.203125, "learning_rate": 0.00017314364364116587, "loss": 4.6491, "mean_token_accuracy": 0.24374651461839675, "num_tokens": 145404577.0, "step": 83830 }, { "entropy": 5.378909730911255, "epoch": 6.522622057965377, "grad_norm": 1.328125, "learning_rate": 0.00017311893138148227, "loss": 4.6161, "mean_token_accuracy": 0.2442230299115181, "num_tokens": 145413042.0, "step": 83835 }, { "entropy": 5.439112901687622, "epoch": 6.523011087337094, "grad_norm": 1.4140625, "learning_rate": 0.0001730942206676817, "loss": 4.7345, "mean_token_accuracy": 0.23397388756275178, "num_tokens": 145421261.0, "step": 83840 }, { "entropy": 5.284405136108399, "epoch": 6.523400116708811, "grad_norm": 1.3203125, "learning_rate": 0.00017306951150013904, "loss": 4.5188, "mean_token_accuracy": 0.24985456317663193, "num_tokens": 145430120.0, "step": 83845 }, { "entropy": 5.3332709789276125, "epoch": 6.523789146080529, "grad_norm": 1.2890625, "learning_rate": 0.00017304480387922945, "loss": 4.6284, "mean_token_accuracy": 0.24427114874124528, "num_tokens": 145439210.0, "step": 83850 }, { "entropy": 5.34494252204895, "epoch": 6.5241781754522465, "grad_norm": 1.4921875, "learning_rate": 0.00017302009780532752, "loss": 4.5656, "mean_token_accuracy": 0.2410481885075569, "num_tokens": 145447604.0, "step": 83855 }, { "entropy": 5.352521753311157, "epoch": 6.524567204823964, "grad_norm": 1.3828125, "learning_rate": 0.0001729953932788084, "loss": 4.5831, "mean_token_accuracy": 0.2410559758543968, "num_tokens": 145455405.0, "step": 83860 }, { "entropy": 5.34260745048523, "epoch": 6.524956234195682, "grad_norm": 1.3046875, "learning_rate": 0.00017297069030004672, "loss": 4.6003, "mean_token_accuracy": 0.24615536034107208, "num_tokens": 145463812.0, "step": 83865 }, { "entropy": 5.367448091506958, "epoch": 6.5253452635674, "grad_norm": 1.3125, "learning_rate": 0.00017294598886941754, "loss": 4.6749, "mean_token_accuracy": 0.24046464264392853, "num_tokens": 145473022.0, "step": 83870 }, { "entropy": 5.292556571960449, "epoch": 6.525734292939116, "grad_norm": 1.3046875, "learning_rate": 0.00017292128898729544, "loss": 4.5794, "mean_token_accuracy": 0.24306445717811584, "num_tokens": 145481730.0, "step": 83875 }, { "entropy": 5.306625318527222, "epoch": 6.526123322310834, "grad_norm": 1.34375, "learning_rate": 0.00017289659065405542, "loss": 4.5989, "mean_token_accuracy": 0.2454576388001442, "num_tokens": 145490865.0, "step": 83880 }, { "entropy": 5.321991109848023, "epoch": 6.526512351682552, "grad_norm": 1.15625, "learning_rate": 0.00017287189387007201, "loss": 4.6169, "mean_token_accuracy": 0.2442027822136879, "num_tokens": 145500449.0, "step": 83885 }, { "entropy": 5.408231210708618, "epoch": 6.5269013810542695, "grad_norm": 1.296875, "learning_rate": 0.00017284719863572013, "loss": 4.6203, "mean_token_accuracy": 0.24066005945205687, "num_tokens": 145508909.0, "step": 83890 }, { "entropy": 5.418175458908081, "epoch": 6.527290410425987, "grad_norm": 1.234375, "learning_rate": 0.00017282250495137444, "loss": 4.6675, "mean_token_accuracy": 0.23974123001098632, "num_tokens": 145517382.0, "step": 83895 }, { "entropy": 5.275529909133911, "epoch": 6.527679439797705, "grad_norm": 1.3046875, "learning_rate": 0.00017279781281740944, "loss": 4.5843, "mean_token_accuracy": 0.25030107200145724, "num_tokens": 145527207.0, "step": 83900 }, { "entropy": 5.301412963867188, "epoch": 6.528068469169423, "grad_norm": 1.2890625, "learning_rate": 0.00017277312223420012, "loss": 4.6054, "mean_token_accuracy": 0.23936323523521424, "num_tokens": 145535833.0, "step": 83905 }, { "entropy": 5.383844995498658, "epoch": 6.52845749854114, "grad_norm": 1.28125, "learning_rate": 0.00017274843320212087, "loss": 4.757, "mean_token_accuracy": 0.23228081315755844, "num_tokens": 145544168.0, "step": 83910 }, { "entropy": 5.4047401428222654, "epoch": 6.528846527912857, "grad_norm": 1.3046875, "learning_rate": 0.0001727237457215465, "loss": 4.6647, "mean_token_accuracy": 0.236198353767395, "num_tokens": 145552382.0, "step": 83915 }, { "entropy": 5.414656019210815, "epoch": 6.529235557284575, "grad_norm": 1.2734375, "learning_rate": 0.00017269905979285148, "loss": 4.6896, "mean_token_accuracy": 0.23490134179592131, "num_tokens": 145561647.0, "step": 83920 }, { "entropy": 5.3888702392578125, "epoch": 6.5296245866562925, "grad_norm": 1.3515625, "learning_rate": 0.00017267437541641033, "loss": 4.5747, "mean_token_accuracy": 0.25093753039836886, "num_tokens": 145569687.0, "step": 83925 }, { "entropy": 5.444630861282349, "epoch": 6.53001361602801, "grad_norm": 1.3515625, "learning_rate": 0.00017264969259259773, "loss": 4.6901, "mean_token_accuracy": 0.23507392257452012, "num_tokens": 145578056.0, "step": 83930 }, { "entropy": 5.3281152725219725, "epoch": 6.530402645399728, "grad_norm": 1.4140625, "learning_rate": 0.00017262501132178805, "loss": 4.606, "mean_token_accuracy": 0.24108273088932036, "num_tokens": 145586454.0, "step": 83935 }, { "entropy": 5.308131694793701, "epoch": 6.530791674771446, "grad_norm": 1.28125, "learning_rate": 0.00017260033160435595, "loss": 4.5357, "mean_token_accuracy": 0.2548290640115738, "num_tokens": 145594514.0, "step": 83940 }, { "entropy": 5.342011833190918, "epoch": 6.531180704143162, "grad_norm": 1.3828125, "learning_rate": 0.00017257565344067576, "loss": 4.6439, "mean_token_accuracy": 0.24256763309240342, "num_tokens": 145602834.0, "step": 83945 }, { "entropy": 5.354339838027954, "epoch": 6.53156973351488, "grad_norm": 1.2109375, "learning_rate": 0.00017255097683112214, "loss": 4.6503, "mean_token_accuracy": 0.2321965605020523, "num_tokens": 145611353.0, "step": 83950 }, { "entropy": 5.443689060211182, "epoch": 6.531958762886598, "grad_norm": 1.3515625, "learning_rate": 0.00017252630177606924, "loss": 4.6794, "mean_token_accuracy": 0.23898309767246245, "num_tokens": 145619896.0, "step": 83955 }, { "entropy": 5.363357973098755, "epoch": 6.5323477922583155, "grad_norm": 1.3359375, "learning_rate": 0.00017250162827589171, "loss": 4.6155, "mean_token_accuracy": 0.24339344948530198, "num_tokens": 145628214.0, "step": 83960 }, { "entropy": 5.3466917991638185, "epoch": 6.532736821630033, "grad_norm": 1.296875, "learning_rate": 0.0001724769563309637, "loss": 4.6032, "mean_token_accuracy": 0.23967114388942717, "num_tokens": 145637528.0, "step": 83965 }, { "entropy": 5.32107720375061, "epoch": 6.533125851001751, "grad_norm": 1.296875, "learning_rate": 0.00017245228594165978, "loss": 4.6097, "mean_token_accuracy": 0.23968523889780044, "num_tokens": 145646259.0, "step": 83970 }, { "entropy": 5.424398708343506, "epoch": 6.533514880373469, "grad_norm": 1.34375, "learning_rate": 0.00017242761710835425, "loss": 4.6838, "mean_token_accuracy": 0.24035162031650542, "num_tokens": 145655256.0, "step": 83975 }, { "entropy": 5.427449798583984, "epoch": 6.533903909745185, "grad_norm": 1.2421875, "learning_rate": 0.00017240294983142125, "loss": 4.6792, "mean_token_accuracy": 0.23770765960216522, "num_tokens": 145664261.0, "step": 83980 }, { "entropy": 5.4089349746704105, "epoch": 6.534292939116903, "grad_norm": 1.4140625, "learning_rate": 0.0001723782841112353, "loss": 4.6323, "mean_token_accuracy": 0.23705004751682282, "num_tokens": 145672036.0, "step": 83985 }, { "entropy": 5.381989479064941, "epoch": 6.534681968488621, "grad_norm": 1.40625, "learning_rate": 0.00017235361994817044, "loss": 4.6581, "mean_token_accuracy": 0.24577950537204743, "num_tokens": 145680953.0, "step": 83990 }, { "entropy": 5.410299491882324, "epoch": 6.5350709978603385, "grad_norm": 1.3203125, "learning_rate": 0.00017232895734260113, "loss": 4.6641, "mean_token_accuracy": 0.24226383119821548, "num_tokens": 145690121.0, "step": 83995 }, { "entropy": 5.369603490829467, "epoch": 6.535460027232056, "grad_norm": 1.359375, "learning_rate": 0.00017230429629490153, "loss": 4.6229, "mean_token_accuracy": 0.23694472908973693, "num_tokens": 145698350.0, "step": 84000 }, { "epoch": 6.535460027232056, "eval_entropy": 5.121053772826282, "eval_loss": 4.862063407897949, "eval_mean_token_accuracy": 0.23522837958132797, "eval_num_tokens": 145698350.0, "eval_runtime": 28.7926, "eval_samples_per_second": 1443.358, "eval_steps_per_second": 180.428, "step": 84000 }, { "entropy": 5.393476676940918, "epoch": 6.535849056603774, "grad_norm": 1.4453125, "learning_rate": 0.00017227963680544562, "loss": 4.6556, "mean_token_accuracy": 0.24038407504558562, "num_tokens": 145706525.0, "step": 84005 }, { "entropy": 5.381467628479004, "epoch": 6.536238085975491, "grad_norm": 1.328125, "learning_rate": 0.00017225497887460778, "loss": 4.6988, "mean_token_accuracy": 0.2302231878042221, "num_tokens": 145715492.0, "step": 84010 }, { "entropy": 5.338558626174927, "epoch": 6.536627115347208, "grad_norm": 1.2734375, "learning_rate": 0.00017223032250276204, "loss": 4.5774, "mean_token_accuracy": 0.24618176519870758, "num_tokens": 145725016.0, "step": 84015 }, { "entropy": 5.390619897842408, "epoch": 6.537016144718926, "grad_norm": 1.2578125, "learning_rate": 0.0001722056676902827, "loss": 4.6548, "mean_token_accuracy": 0.2448733702301979, "num_tokens": 145734390.0, "step": 84020 }, { "entropy": 5.417832374572754, "epoch": 6.537405174090644, "grad_norm": 1.3359375, "learning_rate": 0.00017218101443754365, "loss": 4.6744, "mean_token_accuracy": 0.23179246336221696, "num_tokens": 145742937.0, "step": 84025 }, { "entropy": 5.413867378234864, "epoch": 6.5377942034623615, "grad_norm": 1.328125, "learning_rate": 0.00017215636274491903, "loss": 4.6641, "mean_token_accuracy": 0.24020789563655853, "num_tokens": 145752324.0, "step": 84030 }, { "entropy": 5.4198668003082275, "epoch": 6.538183232834079, "grad_norm": 1.265625, "learning_rate": 0.00017213171261278297, "loss": 4.6586, "mean_token_accuracy": 0.23608543276786803, "num_tokens": 145760867.0, "step": 84035 }, { "entropy": 5.434342956542968, "epoch": 6.538572262205797, "grad_norm": 1.3515625, "learning_rate": 0.0001721070640415094, "loss": 4.7072, "mean_token_accuracy": 0.2364867314696312, "num_tokens": 145770271.0, "step": 84040 }, { "entropy": 5.448533916473389, "epoch": 6.538961291577515, "grad_norm": 1.359375, "learning_rate": 0.00017208241703147248, "loss": 4.7627, "mean_token_accuracy": 0.22755660861730576, "num_tokens": 145778966.0, "step": 84045 }, { "entropy": 5.359823751449585, "epoch": 6.539350320949231, "grad_norm": 1.28125, "learning_rate": 0.00017205777158304592, "loss": 4.6081, "mean_token_accuracy": 0.24489447027444838, "num_tokens": 145787242.0, "step": 84050 }, { "entropy": 5.392895936965942, "epoch": 6.539739350320949, "grad_norm": 1.359375, "learning_rate": 0.00017203312769660395, "loss": 4.6567, "mean_token_accuracy": 0.23839914351701735, "num_tokens": 145795574.0, "step": 84055 }, { "entropy": 5.342375946044922, "epoch": 6.540128379692667, "grad_norm": 1.375, "learning_rate": 0.00017200848537252028, "loss": 4.5905, "mean_token_accuracy": 0.24331727176904677, "num_tokens": 145804478.0, "step": 84060 }, { "entropy": 5.348700952529907, "epoch": 6.5405174090643845, "grad_norm": 1.2734375, "learning_rate": 0.000171983844611169, "loss": 4.5941, "mean_token_accuracy": 0.24122008234262465, "num_tokens": 145813002.0, "step": 84065 }, { "entropy": 5.433027124404907, "epoch": 6.540906438436102, "grad_norm": 1.2890625, "learning_rate": 0.00017195920541292382, "loss": 4.6644, "mean_token_accuracy": 0.24166579991579057, "num_tokens": 145822095.0, "step": 84070 }, { "entropy": 5.438534164428711, "epoch": 6.541295467807819, "grad_norm": 1.3671875, "learning_rate": 0.00017193456777815877, "loss": 4.6358, "mean_token_accuracy": 0.24057725667953492, "num_tokens": 145831731.0, "step": 84075 }, { "entropy": 5.452589654922486, "epoch": 6.541684497179537, "grad_norm": 1.5078125, "learning_rate": 0.00017190993170724766, "loss": 4.7284, "mean_token_accuracy": 0.23002278208732604, "num_tokens": 145840464.0, "step": 84080 }, { "entropy": 5.417345714569092, "epoch": 6.542073526551254, "grad_norm": 1.3828125, "learning_rate": 0.0001718852972005641, "loss": 4.6294, "mean_token_accuracy": 0.24934646785259246, "num_tokens": 145849294.0, "step": 84085 }, { "entropy": 5.422814512252808, "epoch": 6.542462555922972, "grad_norm": 1.265625, "learning_rate": 0.00017186066425848215, "loss": 4.6893, "mean_token_accuracy": 0.23790296018123627, "num_tokens": 145858055.0, "step": 84090 }, { "entropy": 5.304858636856079, "epoch": 6.54285158529469, "grad_norm": 1.2578125, "learning_rate": 0.00017183603288137527, "loss": 4.6146, "mean_token_accuracy": 0.24345111101865768, "num_tokens": 145867576.0, "step": 84095 }, { "entropy": 5.345287847518921, "epoch": 6.5432406146664075, "grad_norm": 1.296875, "learning_rate": 0.0001718114030696176, "loss": 4.6097, "mean_token_accuracy": 0.24089200645685196, "num_tokens": 145876564.0, "step": 84100 }, { "entropy": 5.42977294921875, "epoch": 6.543629644038125, "grad_norm": 1.296875, "learning_rate": 0.0001717867748235825, "loss": 4.7495, "mean_token_accuracy": 0.22662174105644226, "num_tokens": 145885536.0, "step": 84105 }, { "entropy": 5.338153886795044, "epoch": 6.544018673409843, "grad_norm": 1.3515625, "learning_rate": 0.00017176214814364394, "loss": 4.5238, "mean_token_accuracy": 0.2548313319683075, "num_tokens": 145893234.0, "step": 84110 }, { "entropy": 5.364932584762573, "epoch": 6.54440770278156, "grad_norm": 1.3671875, "learning_rate": 0.00017173752303017542, "loss": 4.6572, "mean_token_accuracy": 0.24212122857570648, "num_tokens": 145901942.0, "step": 84115 }, { "entropy": 5.328374004364013, "epoch": 6.544796732153277, "grad_norm": 1.2578125, "learning_rate": 0.0001717128994835506, "loss": 4.5475, "mean_token_accuracy": 0.2529362618923187, "num_tokens": 145910342.0, "step": 84120 }, { "entropy": 5.346514654159546, "epoch": 6.545185761524995, "grad_norm": 1.296875, "learning_rate": 0.00017168827750414317, "loss": 4.6363, "mean_token_accuracy": 0.24813128411769866, "num_tokens": 145919059.0, "step": 84125 }, { "entropy": 5.345714569091797, "epoch": 6.545574790896713, "grad_norm": 1.3125, "learning_rate": 0.0001716636570923266, "loss": 4.5656, "mean_token_accuracy": 0.2530625581741333, "num_tokens": 145927396.0, "step": 84130 }, { "entropy": 5.325767660140992, "epoch": 6.5459638202684305, "grad_norm": 1.2265625, "learning_rate": 0.00017163903824847471, "loss": 4.6023, "mean_token_accuracy": 0.25125242620706556, "num_tokens": 145936262.0, "step": 84135 }, { "entropy": 5.339072895050049, "epoch": 6.546352849640148, "grad_norm": 1.234375, "learning_rate": 0.00017161442097296076, "loss": 4.6205, "mean_token_accuracy": 0.2428480327129364, "num_tokens": 145946328.0, "step": 84140 }, { "entropy": 5.297600889205933, "epoch": 6.546741879011865, "grad_norm": 1.3046875, "learning_rate": 0.00017158980526615854, "loss": 4.5646, "mean_token_accuracy": 0.24329643100500106, "num_tokens": 145954537.0, "step": 84145 }, { "entropy": 5.4114377975463865, "epoch": 6.547130908383583, "grad_norm": 1.375, "learning_rate": 0.00017156519112844132, "loss": 4.6566, "mean_token_accuracy": 0.24016353189945222, "num_tokens": 145963379.0, "step": 84150 }, { "entropy": 5.325254917144775, "epoch": 6.5475199377553, "grad_norm": 1.2734375, "learning_rate": 0.00017154057856018275, "loss": 4.6352, "mean_token_accuracy": 0.2456674799323082, "num_tokens": 145971808.0, "step": 84155 }, { "entropy": 5.357063484191895, "epoch": 6.547908967127018, "grad_norm": 1.2890625, "learning_rate": 0.0001715159675617563, "loss": 4.6767, "mean_token_accuracy": 0.2364422485232353, "num_tokens": 145981089.0, "step": 84160 }, { "entropy": 5.347199535369873, "epoch": 6.548297996498736, "grad_norm": 1.2890625, "learning_rate": 0.00017149135813353508, "loss": 4.6427, "mean_token_accuracy": 0.23932726979255675, "num_tokens": 145989810.0, "step": 84165 }, { "entropy": 5.321401977539063, "epoch": 6.5486870258704535, "grad_norm": 1.28125, "learning_rate": 0.00017146675027589296, "loss": 4.5695, "mean_token_accuracy": 0.24530381113290786, "num_tokens": 145997771.0, "step": 84170 }, { "entropy": 5.336527919769287, "epoch": 6.549076055242171, "grad_norm": 1.3046875, "learning_rate": 0.00017144214398920302, "loss": 4.5737, "mean_token_accuracy": 0.2472361296415329, "num_tokens": 146006266.0, "step": 84175 }, { "entropy": 5.359685182571411, "epoch": 6.549465084613888, "grad_norm": 1.3046875, "learning_rate": 0.0001714175392738388, "loss": 4.6665, "mean_token_accuracy": 0.2403781995177269, "num_tokens": 146016097.0, "step": 84180 }, { "entropy": 5.318788671493531, "epoch": 6.549854113985606, "grad_norm": 1.3671875, "learning_rate": 0.0001713929361301735, "loss": 4.5898, "mean_token_accuracy": 0.24367111176252365, "num_tokens": 146024377.0, "step": 84185 }, { "entropy": 5.412964868545532, "epoch": 6.550243143357323, "grad_norm": 1.421875, "learning_rate": 0.00017136833455858052, "loss": 4.7014, "mean_token_accuracy": 0.23616087734699248, "num_tokens": 146033105.0, "step": 84190 }, { "entropy": 5.3331825733184814, "epoch": 6.550632172729041, "grad_norm": 1.28125, "learning_rate": 0.00017134373455943315, "loss": 4.6121, "mean_token_accuracy": 0.2447109505534172, "num_tokens": 146041973.0, "step": 84195 }, { "entropy": 5.391699552536011, "epoch": 6.551021202100759, "grad_norm": 1.3046875, "learning_rate": 0.0001713191361331045, "loss": 4.6927, "mean_token_accuracy": 0.23643915355205536, "num_tokens": 146051288.0, "step": 84200 }, { "entropy": 5.444328641891479, "epoch": 6.5514102314724765, "grad_norm": 1.3125, "learning_rate": 0.00017129453927996804, "loss": 4.7213, "mean_token_accuracy": 0.23552737534046173, "num_tokens": 146060384.0, "step": 84205 }, { "entropy": 5.342244005203247, "epoch": 6.551799260844193, "grad_norm": 1.234375, "learning_rate": 0.0001712699440003968, "loss": 4.56, "mean_token_accuracy": 0.24780899286270142, "num_tokens": 146069308.0, "step": 84210 }, { "entropy": 5.35835075378418, "epoch": 6.552188290215911, "grad_norm": 1.3671875, "learning_rate": 0.0001712453502947642, "loss": 4.7067, "mean_token_accuracy": 0.23354239910840988, "num_tokens": 146077828.0, "step": 84215 }, { "entropy": 5.427068614959717, "epoch": 6.552577319587629, "grad_norm": 1.3125, "learning_rate": 0.00017122075816344314, "loss": 4.7367, "mean_token_accuracy": 0.22425749003887177, "num_tokens": 146086835.0, "step": 84220 }, { "entropy": 5.418323230743408, "epoch": 6.552966348959346, "grad_norm": 1.359375, "learning_rate": 0.00017119616760680688, "loss": 4.6803, "mean_token_accuracy": 0.24538735300302505, "num_tokens": 146095405.0, "step": 84225 }, { "entropy": 5.401887702941894, "epoch": 6.553355378331064, "grad_norm": 1.1484375, "learning_rate": 0.0001711715786252286, "loss": 4.6136, "mean_token_accuracy": 0.24039352536201478, "num_tokens": 146104656.0, "step": 84230 }, { "entropy": 5.43229398727417, "epoch": 6.553744407702782, "grad_norm": 1.453125, "learning_rate": 0.00017114699121908132, "loss": 4.6263, "mean_token_accuracy": 0.24385692179203033, "num_tokens": 146113128.0, "step": 84235 }, { "entropy": 5.331828165054321, "epoch": 6.5541334370744995, "grad_norm": 1.234375, "learning_rate": 0.0001711224053887382, "loss": 4.6006, "mean_token_accuracy": 0.2475523218512535, "num_tokens": 146122667.0, "step": 84240 }, { "entropy": 5.393920135498047, "epoch": 6.554522466446217, "grad_norm": 1.390625, "learning_rate": 0.00017109782113457217, "loss": 4.6398, "mean_token_accuracy": 0.23725885152816772, "num_tokens": 146130931.0, "step": 84245 }, { "entropy": 5.327795553207397, "epoch": 6.554911495817934, "grad_norm": 1.3359375, "learning_rate": 0.00017107323845695643, "loss": 4.5939, "mean_token_accuracy": 0.24004062861204148, "num_tokens": 146140271.0, "step": 84250 }, { "entropy": 5.37441987991333, "epoch": 6.555300525189652, "grad_norm": 1.359375, "learning_rate": 0.0001710486573562638, "loss": 4.6341, "mean_token_accuracy": 0.2427230194211006, "num_tokens": 146149084.0, "step": 84255 }, { "entropy": 5.376166343688965, "epoch": 6.555689554561369, "grad_norm": 1.359375, "learning_rate": 0.00017102407783286738, "loss": 4.638, "mean_token_accuracy": 0.237137046456337, "num_tokens": 146157836.0, "step": 84260 }, { "entropy": 5.3544927597045895, "epoch": 6.556078583933087, "grad_norm": 1.3671875, "learning_rate": 0.00017099949988714006, "loss": 4.6047, "mean_token_accuracy": 0.24785349220037461, "num_tokens": 146165922.0, "step": 84265 }, { "entropy": 5.310955810546875, "epoch": 6.556467613304805, "grad_norm": 1.2890625, "learning_rate": 0.00017097492351945482, "loss": 4.5598, "mean_token_accuracy": 0.25023695826530457, "num_tokens": 146174191.0, "step": 84270 }, { "entropy": 5.376591157913208, "epoch": 6.5568566426765225, "grad_norm": 1.3828125, "learning_rate": 0.00017095034873018458, "loss": 4.6828, "mean_token_accuracy": 0.25139724314212797, "num_tokens": 146182665.0, "step": 84275 }, { "entropy": 5.421943473815918, "epoch": 6.557245672048239, "grad_norm": 1.3046875, "learning_rate": 0.0001709257755197021, "loss": 4.6626, "mean_token_accuracy": 0.24305889159440994, "num_tokens": 146190848.0, "step": 84280 }, { "entropy": 5.417236185073852, "epoch": 6.557634701419957, "grad_norm": 1.328125, "learning_rate": 0.00017090120388838043, "loss": 4.6724, "mean_token_accuracy": 0.24581272900104523, "num_tokens": 146199273.0, "step": 84285 }, { "entropy": 5.318183851242066, "epoch": 6.558023730791675, "grad_norm": 1.421875, "learning_rate": 0.00017087663383659216, "loss": 4.506, "mean_token_accuracy": 0.24811684638261794, "num_tokens": 146207549.0, "step": 84290 }, { "entropy": 5.445098781585694, "epoch": 6.558412760163392, "grad_norm": 1.265625, "learning_rate": 0.00017085206536471026, "loss": 4.6487, "mean_token_accuracy": 0.24554549008607865, "num_tokens": 146216643.0, "step": 84295 }, { "entropy": 5.410681056976318, "epoch": 6.55880178953511, "grad_norm": 1.421875, "learning_rate": 0.00017082749847310757, "loss": 4.676, "mean_token_accuracy": 0.23692795485258103, "num_tokens": 146225834.0, "step": 84300 }, { "entropy": 5.309787654876709, "epoch": 6.559190818906828, "grad_norm": 1.3515625, "learning_rate": 0.0001708029331621568, "loss": 4.5357, "mean_token_accuracy": 0.24205396622419356, "num_tokens": 146234553.0, "step": 84305 }, { "entropy": 5.3737420558929445, "epoch": 6.5595798482785455, "grad_norm": 1.2890625, "learning_rate": 0.00017077836943223064, "loss": 4.6947, "mean_token_accuracy": 0.23523975610733033, "num_tokens": 146243803.0, "step": 84310 }, { "entropy": 5.491117668151856, "epoch": 6.559968877650262, "grad_norm": 1.34375, "learning_rate": 0.00017075380728370182, "loss": 4.8376, "mean_token_accuracy": 0.22225705683231353, "num_tokens": 146252599.0, "step": 84315 }, { "entropy": 5.3212621212005615, "epoch": 6.56035790702198, "grad_norm": 1.390625, "learning_rate": 0.0001707292467169431, "loss": 4.5196, "mean_token_accuracy": 0.250051286816597, "num_tokens": 146260574.0, "step": 84320 }, { "entropy": 5.43336033821106, "epoch": 6.560746936393698, "grad_norm": 1.3046875, "learning_rate": 0.000170704687732327, "loss": 4.6941, "mean_token_accuracy": 0.239984230697155, "num_tokens": 146269457.0, "step": 84325 }, { "entropy": 5.4719713687896725, "epoch": 6.561135965765415, "grad_norm": 1.2890625, "learning_rate": 0.0001706801303302264, "loss": 4.7688, "mean_token_accuracy": 0.22898236215114592, "num_tokens": 146279851.0, "step": 84330 }, { "entropy": 5.465330696105957, "epoch": 6.561524995137133, "grad_norm": 1.3203125, "learning_rate": 0.00017065557451101366, "loss": 4.7279, "mean_token_accuracy": 0.23887331038713455, "num_tokens": 146288911.0, "step": 84335 }, { "entropy": 5.3912557601928714, "epoch": 6.561914024508851, "grad_norm": 1.328125, "learning_rate": 0.00017063102027506155, "loss": 4.6667, "mean_token_accuracy": 0.24109784960746766, "num_tokens": 146297820.0, "step": 84340 }, { "entropy": 5.427685880661011, "epoch": 6.562303053880568, "grad_norm": 1.328125, "learning_rate": 0.00017060646762274254, "loss": 4.6772, "mean_token_accuracy": 0.2452961176633835, "num_tokens": 146306421.0, "step": 84345 }, { "entropy": 5.339828586578369, "epoch": 6.562692083252285, "grad_norm": 1.40625, "learning_rate": 0.00017058191655442928, "loss": 4.5342, "mean_token_accuracy": 0.245089989900589, "num_tokens": 146313496.0, "step": 84350 }, { "entropy": 5.373449420928955, "epoch": 6.563081112624003, "grad_norm": 1.28125, "learning_rate": 0.0001705573670704943, "loss": 4.664, "mean_token_accuracy": 0.2332203656435013, "num_tokens": 146323080.0, "step": 84355 }, { "entropy": 5.385708427429199, "epoch": 6.563470141995721, "grad_norm": 1.3828125, "learning_rate": 0.00017053281917130993, "loss": 4.6024, "mean_token_accuracy": 0.24575001299381255, "num_tokens": 146332205.0, "step": 84360 }, { "entropy": 5.366835832595825, "epoch": 6.563859171367438, "grad_norm": 1.328125, "learning_rate": 0.00017050827285724872, "loss": 4.6298, "mean_token_accuracy": 0.2418859377503395, "num_tokens": 146340894.0, "step": 84365 }, { "entropy": 5.330213308334351, "epoch": 6.564248200739156, "grad_norm": 1.3125, "learning_rate": 0.00017048372812868316, "loss": 4.578, "mean_token_accuracy": 0.24439503848552704, "num_tokens": 146349592.0, "step": 84370 }, { "entropy": 5.333413410186767, "epoch": 6.564637230110874, "grad_norm": 1.2734375, "learning_rate": 0.0001704591849859858, "loss": 4.5265, "mean_token_accuracy": 0.2485651507973671, "num_tokens": 146358012.0, "step": 84375 }, { "entropy": 5.378177118301392, "epoch": 6.5650262594825906, "grad_norm": 1.3671875, "learning_rate": 0.00017043464342952883, "loss": 4.6278, "mean_token_accuracy": 0.24400155395269393, "num_tokens": 146366427.0, "step": 84380 }, { "entropy": 5.376384973526001, "epoch": 6.565415288854308, "grad_norm": 1.3125, "learning_rate": 0.00017041010345968468, "loss": 4.6448, "mean_token_accuracy": 0.24679746180772782, "num_tokens": 146375356.0, "step": 84385 }, { "entropy": 5.437932538986206, "epoch": 6.565804318226026, "grad_norm": 1.328125, "learning_rate": 0.00017038556507682586, "loss": 4.7177, "mean_token_accuracy": 0.24367764443159104, "num_tokens": 146384486.0, "step": 84390 }, { "entropy": 5.416551113128662, "epoch": 6.566193347597744, "grad_norm": 1.28125, "learning_rate": 0.00017036102828132444, "loss": 4.67, "mean_token_accuracy": 0.23539976626634598, "num_tokens": 146393421.0, "step": 84395 }, { "entropy": 5.385421705245972, "epoch": 6.566582376969461, "grad_norm": 1.46875, "learning_rate": 0.00017033649307355295, "loss": 4.6122, "mean_token_accuracy": 0.24254804998636245, "num_tokens": 146403419.0, "step": 84400 }, { "entropy": 5.404775953292846, "epoch": 6.566971406341179, "grad_norm": 1.3046875, "learning_rate": 0.0001703119594538835, "loss": 4.6425, "mean_token_accuracy": 0.235706102848053, "num_tokens": 146412277.0, "step": 84405 }, { "entropy": 5.425418281555176, "epoch": 6.567360435712896, "grad_norm": 1.328125, "learning_rate": 0.00017028742742268856, "loss": 4.6947, "mean_token_accuracy": 0.23312044739723206, "num_tokens": 146420847.0, "step": 84410 }, { "entropy": 5.35340723991394, "epoch": 6.5677494650846135, "grad_norm": 1.328125, "learning_rate": 0.00017026289698034015, "loss": 4.6789, "mean_token_accuracy": 0.24067778438329696, "num_tokens": 146429632.0, "step": 84415 }, { "entropy": 5.393985843658447, "epoch": 6.568138494456331, "grad_norm": 1.34375, "learning_rate": 0.00017023836812721062, "loss": 4.6165, "mean_token_accuracy": 0.2482227012515068, "num_tokens": 146438206.0, "step": 84420 }, { "entropy": 5.441124725341797, "epoch": 6.568527523828049, "grad_norm": 1.2421875, "learning_rate": 0.00017021384086367204, "loss": 4.7284, "mean_token_accuracy": 0.24350121170282363, "num_tokens": 146447403.0, "step": 84425 }, { "entropy": 5.362552690505981, "epoch": 6.568916553199767, "grad_norm": 1.3203125, "learning_rate": 0.00017018931519009663, "loss": 4.6072, "mean_token_accuracy": 0.24852775186300277, "num_tokens": 146456192.0, "step": 84430 }, { "entropy": 5.448221826553345, "epoch": 6.569305582571484, "grad_norm": 1.53125, "learning_rate": 0.00017016479110685667, "loss": 4.7287, "mean_token_accuracy": 0.23243789076805116, "num_tokens": 146464763.0, "step": 84435 }, { "entropy": 5.325114488601685, "epoch": 6.569694611943202, "grad_norm": 1.34375, "learning_rate": 0.00017014026861432403, "loss": 4.602, "mean_token_accuracy": 0.24513457268476485, "num_tokens": 146473149.0, "step": 84440 }, { "entropy": 5.350306034088135, "epoch": 6.57008364131492, "grad_norm": 1.28125, "learning_rate": 0.000170115747712871, "loss": 4.6138, "mean_token_accuracy": 0.24640905261039733, "num_tokens": 146481616.0, "step": 84445 }, { "entropy": 5.460289096832275, "epoch": 6.5704726706866365, "grad_norm": 1.34375, "learning_rate": 0.00017009122840286943, "loss": 4.7307, "mean_token_accuracy": 0.23854437470436096, "num_tokens": 146490491.0, "step": 84450 }, { "entropy": 5.444174194335938, "epoch": 6.570861700058354, "grad_norm": 1.328125, "learning_rate": 0.00017006671068469165, "loss": 4.6648, "mean_token_accuracy": 0.24520158320665358, "num_tokens": 146499986.0, "step": 84455 }, { "entropy": 5.367552280426025, "epoch": 6.571250729430072, "grad_norm": 1.421875, "learning_rate": 0.00017004219455870947, "loss": 4.6039, "mean_token_accuracy": 0.2479190245270729, "num_tokens": 146508361.0, "step": 84460 }, { "entropy": 5.470309734344482, "epoch": 6.57163975880179, "grad_norm": 1.2890625, "learning_rate": 0.00017001768002529487, "loss": 4.7349, "mean_token_accuracy": 0.239715813100338, "num_tokens": 146517673.0, "step": 84465 }, { "entropy": 5.396499109268189, "epoch": 6.572028788173507, "grad_norm": 1.2890625, "learning_rate": 0.00016999316708481992, "loss": 4.6866, "mean_token_accuracy": 0.2461523488163948, "num_tokens": 146526378.0, "step": 84470 }, { "entropy": 5.3315455436706545, "epoch": 6.572417817545225, "grad_norm": 1.296875, "learning_rate": 0.0001699686557376565, "loss": 4.5572, "mean_token_accuracy": 0.24175869822502136, "num_tokens": 146535521.0, "step": 84475 }, { "entropy": 5.381885147094726, "epoch": 6.572806846916942, "grad_norm": 1.265625, "learning_rate": 0.00016994414598417662, "loss": 4.6292, "mean_token_accuracy": 0.24499955773353577, "num_tokens": 146544567.0, "step": 84480 }, { "entropy": 5.427047157287598, "epoch": 6.5731958762886595, "grad_norm": 1.4375, "learning_rate": 0.000169919637824752, "loss": 4.6761, "mean_token_accuracy": 0.23921978920698167, "num_tokens": 146552838.0, "step": 84485 }, { "entropy": 5.438476324081421, "epoch": 6.573584905660377, "grad_norm": 1.390625, "learning_rate": 0.0001698951312597547, "loss": 4.7514, "mean_token_accuracy": 0.2375622197985649, "num_tokens": 146560883.0, "step": 84490 }, { "entropy": 5.3991138458251955, "epoch": 6.573973935032095, "grad_norm": 1.265625, "learning_rate": 0.00016987062628955646, "loss": 4.6314, "mean_token_accuracy": 0.24775750786066056, "num_tokens": 146569352.0, "step": 84495 }, { "entropy": 5.400540113449097, "epoch": 6.574362964403813, "grad_norm": 1.3046875, "learning_rate": 0.00016984612291452909, "loss": 4.6629, "mean_token_accuracy": 0.24056964367628098, "num_tokens": 146577926.0, "step": 84500 }, { "entropy": 5.385214233398438, "epoch": 6.57475199377553, "grad_norm": 1.2734375, "learning_rate": 0.0001698216211350445, "loss": 4.6687, "mean_token_accuracy": 0.23299350440502167, "num_tokens": 146587240.0, "step": 84505 }, { "entropy": 5.442490768432617, "epoch": 6.575141023147248, "grad_norm": 1.328125, "learning_rate": 0.00016979712095147438, "loss": 4.6961, "mean_token_accuracy": 0.23248315304517747, "num_tokens": 146595461.0, "step": 84510 }, { "entropy": 5.388933515548706, "epoch": 6.575530052518965, "grad_norm": 1.4765625, "learning_rate": 0.00016977262236419057, "loss": 4.6276, "mean_token_accuracy": 0.23133996576070787, "num_tokens": 146604128.0, "step": 84515 }, { "entropy": 5.42922945022583, "epoch": 6.5759190818906825, "grad_norm": 1.4296875, "learning_rate": 0.00016974812537356459, "loss": 4.7031, "mean_token_accuracy": 0.23677914589643478, "num_tokens": 146612187.0, "step": 84520 }, { "entropy": 5.360751104354859, "epoch": 6.5763081112624, "grad_norm": 1.3125, "learning_rate": 0.00016972362997996846, "loss": 4.6123, "mean_token_accuracy": 0.24134421944618226, "num_tokens": 146620206.0, "step": 84525 }, { "entropy": 5.4562609672546385, "epoch": 6.576697140634118, "grad_norm": 1.3046875, "learning_rate": 0.00016969913618377353, "loss": 4.7393, "mean_token_accuracy": 0.22760725766420364, "num_tokens": 146629567.0, "step": 84530 }, { "entropy": 5.411977481842041, "epoch": 6.577086170005836, "grad_norm": 1.40625, "learning_rate": 0.0001696746439853517, "loss": 4.6721, "mean_token_accuracy": 0.2410157486796379, "num_tokens": 146638511.0, "step": 84535 }, { "entropy": 5.424694633483886, "epoch": 6.577475199377553, "grad_norm": 1.3359375, "learning_rate": 0.00016965015338507453, "loss": 4.6889, "mean_token_accuracy": 0.24234678149223327, "num_tokens": 146647468.0, "step": 84540 }, { "entropy": 5.320657873153687, "epoch": 6.57786422874927, "grad_norm": 1.296875, "learning_rate": 0.00016962566438331352, "loss": 4.507, "mean_token_accuracy": 0.25057934373617174, "num_tokens": 146656400.0, "step": 84545 }, { "entropy": 5.3214905738830565, "epoch": 6.578253258120988, "grad_norm": 1.4296875, "learning_rate": 0.00016960117698044036, "loss": 4.5988, "mean_token_accuracy": 0.24446096867322922, "num_tokens": 146664761.0, "step": 84550 }, { "entropy": 5.376437664031982, "epoch": 6.5786422874927055, "grad_norm": 1.359375, "learning_rate": 0.00016957669117682652, "loss": 4.6245, "mean_token_accuracy": 0.23707259744405745, "num_tokens": 146672986.0, "step": 84555 }, { "entropy": 5.385486268997193, "epoch": 6.579031316864423, "grad_norm": 1.3515625, "learning_rate": 0.00016955220697284363, "loss": 4.6942, "mean_token_accuracy": 0.24149303883314133, "num_tokens": 146681828.0, "step": 84560 }, { "entropy": 5.346033906936645, "epoch": 6.579420346236141, "grad_norm": 1.3515625, "learning_rate": 0.00016952772436886306, "loss": 4.6389, "mean_token_accuracy": 0.241556316614151, "num_tokens": 146690137.0, "step": 84565 }, { "entropy": 5.326116991043091, "epoch": 6.579809375607859, "grad_norm": 1.3203125, "learning_rate": 0.00016950324336525657, "loss": 4.5592, "mean_token_accuracy": 0.24523078352212907, "num_tokens": 146699131.0, "step": 84570 }, { "entropy": 5.401447725296021, "epoch": 6.580198404979576, "grad_norm": 1.28125, "learning_rate": 0.00016947876396239544, "loss": 4.7022, "mean_token_accuracy": 0.23353791236877441, "num_tokens": 146707937.0, "step": 84575 }, { "entropy": 5.363683605194092, "epoch": 6.580587434351294, "grad_norm": 1.2578125, "learning_rate": 0.00016945428616065104, "loss": 4.6443, "mean_token_accuracy": 0.24058277010917664, "num_tokens": 146716294.0, "step": 84580 }, { "entropy": 5.349463701248169, "epoch": 6.580976463723011, "grad_norm": 1.328125, "learning_rate": 0.0001694298099603949, "loss": 4.6696, "mean_token_accuracy": 0.24491775929927825, "num_tokens": 146724729.0, "step": 84585 }, { "entropy": 5.425011730194091, "epoch": 6.5813654930947285, "grad_norm": 1.3515625, "learning_rate": 0.0001694053353619983, "loss": 4.7282, "mean_token_accuracy": 0.23404111862182617, "num_tokens": 146734169.0, "step": 84590 }, { "entropy": 5.357710361480713, "epoch": 6.581754522466446, "grad_norm": 1.28125, "learning_rate": 0.00016938086236583272, "loss": 4.6391, "mean_token_accuracy": 0.24091438055038453, "num_tokens": 146743085.0, "step": 84595 }, { "entropy": 5.421069097518921, "epoch": 6.582143551838164, "grad_norm": 1.3125, "learning_rate": 0.0001693563909722694, "loss": 4.6466, "mean_token_accuracy": 0.24066193848848344, "num_tokens": 146751716.0, "step": 84600 }, { "entropy": 5.348891878128052, "epoch": 6.582532581209882, "grad_norm": 1.3125, "learning_rate": 0.00016933192118167976, "loss": 4.5778, "mean_token_accuracy": 0.2498205304145813, "num_tokens": 146759769.0, "step": 84605 }, { "entropy": 5.357227754592896, "epoch": 6.582921610581598, "grad_norm": 1.265625, "learning_rate": 0.00016930745299443496, "loss": 4.7118, "mean_token_accuracy": 0.23699511140584945, "num_tokens": 146768702.0, "step": 84610 }, { "entropy": 5.355023002624511, "epoch": 6.583310639953316, "grad_norm": 1.28125, "learning_rate": 0.0001692829864109064, "loss": 4.6399, "mean_token_accuracy": 0.2422180563211441, "num_tokens": 146777338.0, "step": 84615 }, { "entropy": 5.383370304107666, "epoch": 6.583699669325034, "grad_norm": 1.375, "learning_rate": 0.00016925852143146526, "loss": 4.6003, "mean_token_accuracy": 0.24811945259571075, "num_tokens": 146786168.0, "step": 84620 }, { "entropy": 5.518668985366821, "epoch": 6.5840886986967515, "grad_norm": 1.3203125, "learning_rate": 0.00016923405805648268, "loss": 4.8094, "mean_token_accuracy": 0.23005206435918807, "num_tokens": 146796015.0, "step": 84625 }, { "entropy": 5.406057262420655, "epoch": 6.584477728068469, "grad_norm": 1.2421875, "learning_rate": 0.00016920959628632988, "loss": 4.6889, "mean_token_accuracy": 0.24273302853107454, "num_tokens": 146805637.0, "step": 84630 }, { "entropy": 5.465916585922241, "epoch": 6.584866757440187, "grad_norm": 1.3203125, "learning_rate": 0.00016918513612137809, "loss": 4.7824, "mean_token_accuracy": 0.23126621544361115, "num_tokens": 146815095.0, "step": 84635 }, { "entropy": 5.410434532165527, "epoch": 6.585255786811905, "grad_norm": 1.328125, "learning_rate": 0.0001691606775619986, "loss": 4.7135, "mean_token_accuracy": 0.23429333716630935, "num_tokens": 146824437.0, "step": 84640 }, { "entropy": 5.4217798709869385, "epoch": 6.585644816183622, "grad_norm": 1.3359375, "learning_rate": 0.00016913622060856217, "loss": 4.6848, "mean_token_accuracy": 0.24033688008785248, "num_tokens": 146833216.0, "step": 84645 }, { "entropy": 5.359645223617553, "epoch": 6.586033845555339, "grad_norm": 1.3828125, "learning_rate": 0.00016911176526144024, "loss": 4.5601, "mean_token_accuracy": 0.2509561315178871, "num_tokens": 146841136.0, "step": 84650 }, { "entropy": 5.338476085662842, "epoch": 6.586422874927057, "grad_norm": 1.4140625, "learning_rate": 0.00016908731152100374, "loss": 4.613, "mean_token_accuracy": 0.24283459335565566, "num_tokens": 146849592.0, "step": 84655 }, { "entropy": 5.287589836120605, "epoch": 6.5868119042987745, "grad_norm": 1.390625, "learning_rate": 0.0001690628593876236, "loss": 4.603, "mean_token_accuracy": 0.2446575567126274, "num_tokens": 146859010.0, "step": 84660 }, { "entropy": 5.332306432723999, "epoch": 6.587200933670492, "grad_norm": 1.265625, "learning_rate": 0.00016903840886167104, "loss": 4.6066, "mean_token_accuracy": 0.24302032589912415, "num_tokens": 146867221.0, "step": 84665 }, { "entropy": 5.3716552734375, "epoch": 6.58758996304221, "grad_norm": 1.2578125, "learning_rate": 0.00016901395994351688, "loss": 4.6089, "mean_token_accuracy": 0.24078522622585297, "num_tokens": 146875948.0, "step": 84670 }, { "entropy": 5.279925107955933, "epoch": 6.587978992413928, "grad_norm": 1.4140625, "learning_rate": 0.00016898951263353228, "loss": 4.4908, "mean_token_accuracy": 0.24956051558256148, "num_tokens": 146884376.0, "step": 84675 }, { "entropy": 5.3656940937042235, "epoch": 6.588368021785644, "grad_norm": 1.2578125, "learning_rate": 0.00016896506693208802, "loss": 4.6513, "mean_token_accuracy": 0.24646958112716674, "num_tokens": 146893572.0, "step": 84680 }, { "entropy": 5.405946397781372, "epoch": 6.588757051157362, "grad_norm": 1.3046875, "learning_rate": 0.00016894062283955515, "loss": 4.6657, "mean_token_accuracy": 0.23959125727415084, "num_tokens": 146901722.0, "step": 84685 }, { "entropy": 5.424219083786011, "epoch": 6.58914608052908, "grad_norm": 1.34375, "learning_rate": 0.00016891618035630446, "loss": 4.6961, "mean_token_accuracy": 0.24392360150814058, "num_tokens": 146910580.0, "step": 84690 }, { "entropy": 5.369238710403442, "epoch": 6.5895351099007975, "grad_norm": 1.359375, "learning_rate": 0.00016889173948270687, "loss": 4.5686, "mean_token_accuracy": 0.24335096031427383, "num_tokens": 146918444.0, "step": 84695 }, { "entropy": 5.340540027618408, "epoch": 6.589924139272515, "grad_norm": 1.3046875, "learning_rate": 0.00016886730021913336, "loss": 4.564, "mean_token_accuracy": 0.2444102570414543, "num_tokens": 146927252.0, "step": 84700 }, { "entropy": 5.3123572826385494, "epoch": 6.590313168644233, "grad_norm": 1.375, "learning_rate": 0.00016884286256595456, "loss": 4.631, "mean_token_accuracy": 0.24328398406505586, "num_tokens": 146935517.0, "step": 84705 }, { "entropy": 5.282245254516601, "epoch": 6.590702198015951, "grad_norm": 1.328125, "learning_rate": 0.00016881842652354136, "loss": 4.5288, "mean_token_accuracy": 0.2472146987915039, "num_tokens": 146944549.0, "step": 84710 }, { "entropy": 5.385653066635132, "epoch": 6.591091227387667, "grad_norm": 1.3203125, "learning_rate": 0.0001687939920922645, "loss": 4.7421, "mean_token_accuracy": 0.23724108040332795, "num_tokens": 146952418.0, "step": 84715 }, { "entropy": 5.435217571258545, "epoch": 6.591480256759385, "grad_norm": 1.28125, "learning_rate": 0.0001687695592724949, "loss": 4.7498, "mean_token_accuracy": 0.23667190968990326, "num_tokens": 146961248.0, "step": 84720 }, { "entropy": 5.375254774093628, "epoch": 6.591869286131103, "grad_norm": 1.25, "learning_rate": 0.00016874512806460296, "loss": 4.6728, "mean_token_accuracy": 0.24463984370231628, "num_tokens": 146970062.0, "step": 84725 }, { "entropy": 5.505873537063598, "epoch": 6.5922583155028205, "grad_norm": 1.390625, "learning_rate": 0.00016872069846895978, "loss": 4.7693, "mean_token_accuracy": 0.23443709164857865, "num_tokens": 146978487.0, "step": 84730 }, { "entropy": 5.313940620422363, "epoch": 6.592647344874538, "grad_norm": 1.296875, "learning_rate": 0.00016869627048593573, "loss": 4.5458, "mean_token_accuracy": 0.24701424688100815, "num_tokens": 146986715.0, "step": 84735 }, { "entropy": 5.389333581924438, "epoch": 6.593036374246256, "grad_norm": 1.421875, "learning_rate": 0.00016867184411590154, "loss": 4.6683, "mean_token_accuracy": 0.2395954415202141, "num_tokens": 146994968.0, "step": 84740 }, { "entropy": 5.396217393875122, "epoch": 6.593425403617973, "grad_norm": 1.3125, "learning_rate": 0.000168647419359228, "loss": 4.6428, "mean_token_accuracy": 0.24097407460212708, "num_tokens": 147003679.0, "step": 84745 }, { "entropy": 5.48943133354187, "epoch": 6.59381443298969, "grad_norm": 1.3828125, "learning_rate": 0.00016862299621628546, "loss": 4.7303, "mean_token_accuracy": 0.23437334597110748, "num_tokens": 147012637.0, "step": 84750 }, { "entropy": 5.435339498519897, "epoch": 6.594203462361408, "grad_norm": 1.2734375, "learning_rate": 0.00016859857468744471, "loss": 4.7035, "mean_token_accuracy": 0.23244636207818986, "num_tokens": 147021294.0, "step": 84755 }, { "entropy": 5.461569118499756, "epoch": 6.594592491733126, "grad_norm": 1.40625, "learning_rate": 0.0001685741547730762, "loss": 4.7494, "mean_token_accuracy": 0.24023213237524033, "num_tokens": 147029998.0, "step": 84760 }, { "entropy": 5.494941854476929, "epoch": 6.5949815211048435, "grad_norm": 1.390625, "learning_rate": 0.00016854973647355045, "loss": 4.7367, "mean_token_accuracy": 0.23438269048929214, "num_tokens": 147038790.0, "step": 84765 }, { "entropy": 5.423483180999756, "epoch": 6.595370550476561, "grad_norm": 1.3046875, "learning_rate": 0.00016852531978923816, "loss": 4.6321, "mean_token_accuracy": 0.24188441187143325, "num_tokens": 147046906.0, "step": 84770 }, { "entropy": 5.41530933380127, "epoch": 6.595759579848279, "grad_norm": 1.3125, "learning_rate": 0.00016850090472050956, "loss": 4.6975, "mean_token_accuracy": 0.235201495885849, "num_tokens": 147055958.0, "step": 84775 }, { "entropy": 5.367156648635865, "epoch": 6.596148609219997, "grad_norm": 1.2734375, "learning_rate": 0.00016847649126773526, "loss": 4.6788, "mean_token_accuracy": 0.23820467442274093, "num_tokens": 147064533.0, "step": 84780 }, { "entropy": 5.37761492729187, "epoch": 6.596537638591713, "grad_norm": 1.3515625, "learning_rate": 0.0001684520794312856, "loss": 4.6032, "mean_token_accuracy": 0.24528128504753113, "num_tokens": 147072377.0, "step": 84785 }, { "entropy": 5.430870723724365, "epoch": 6.596926667963431, "grad_norm": 1.296875, "learning_rate": 0.00016842766921153113, "loss": 4.6483, "mean_token_accuracy": 0.24028197824954986, "num_tokens": 147080301.0, "step": 84790 }, { "entropy": 5.423362398147583, "epoch": 6.597315697335149, "grad_norm": 1.296875, "learning_rate": 0.00016840326060884206, "loss": 4.7395, "mean_token_accuracy": 0.23221496641635894, "num_tokens": 147089231.0, "step": 84795 }, { "entropy": 5.375909948348999, "epoch": 6.5977047267068665, "grad_norm": 1.3515625, "learning_rate": 0.00016837885362358895, "loss": 4.6124, "mean_token_accuracy": 0.24140287190675735, "num_tokens": 147098174.0, "step": 84800 }, { "entropy": 5.344957160949707, "epoch": 6.598093756078584, "grad_norm": 1.3203125, "learning_rate": 0.00016835444825614193, "loss": 4.6304, "mean_token_accuracy": 0.24658889472484588, "num_tokens": 147106178.0, "step": 84805 }, { "entropy": 5.299638366699218, "epoch": 6.598482785450302, "grad_norm": 1.34375, "learning_rate": 0.0001683300445068715, "loss": 4.5776, "mean_token_accuracy": 0.23834228515625, "num_tokens": 147115512.0, "step": 84810 }, { "entropy": 5.294767570495606, "epoch": 6.598871814822019, "grad_norm": 1.3203125, "learning_rate": 0.0001683056423761479, "loss": 4.5105, "mean_token_accuracy": 0.2546794727444649, "num_tokens": 147123784.0, "step": 84815 }, { "entropy": 5.474394273757935, "epoch": 6.599260844193736, "grad_norm": 1.5078125, "learning_rate": 0.00016828124186434121, "loss": 4.7325, "mean_token_accuracy": 0.23575533032417298, "num_tokens": 147131559.0, "step": 84820 }, { "entropy": 5.327744770050049, "epoch": 6.599649873565454, "grad_norm": 1.3359375, "learning_rate": 0.00016825684297182194, "loss": 4.5967, "mean_token_accuracy": 0.24534608721733092, "num_tokens": 147140253.0, "step": 84825 }, { "entropy": 5.347218704223633, "epoch": 6.600038902937172, "grad_norm": 1.3359375, "learning_rate": 0.00016823244569896, "loss": 4.6087, "mean_token_accuracy": 0.24162197560071946, "num_tokens": 147149245.0, "step": 84830 }, { "entropy": 5.46824951171875, "epoch": 6.6004279323088895, "grad_norm": 1.25, "learning_rate": 0.00016820805004612595, "loss": 4.7011, "mean_token_accuracy": 0.24054159522056578, "num_tokens": 147158305.0, "step": 84835 }, { "entropy": 5.353557538986206, "epoch": 6.600816961680607, "grad_norm": 1.3046875, "learning_rate": 0.00016818365601368974, "loss": 4.6123, "mean_token_accuracy": 0.24318811893463135, "num_tokens": 147167022.0, "step": 84840 }, { "entropy": 5.422938346862793, "epoch": 6.601205991052325, "grad_norm": 1.328125, "learning_rate": 0.00016815926360202145, "loss": 4.6821, "mean_token_accuracy": 0.2423985242843628, "num_tokens": 147176061.0, "step": 84845 }, { "entropy": 5.356579351425171, "epoch": 6.601595020424042, "grad_norm": 1.2578125, "learning_rate": 0.0001681348728114913, "loss": 4.6239, "mean_token_accuracy": 0.240465883910656, "num_tokens": 147184923.0, "step": 84850 }, { "entropy": 5.3260753631591795, "epoch": 6.601984049795759, "grad_norm": 1.40625, "learning_rate": 0.00016811048364246938, "loss": 4.5062, "mean_token_accuracy": 0.24692298769950866, "num_tokens": 147193366.0, "step": 84855 }, { "entropy": 5.313503170013428, "epoch": 6.602373079167477, "grad_norm": 1.359375, "learning_rate": 0.00016808609609532578, "loss": 4.5732, "mean_token_accuracy": 0.24501850008964537, "num_tokens": 147201778.0, "step": 84860 }, { "entropy": 5.4345612049102785, "epoch": 6.602762108539195, "grad_norm": 1.28125, "learning_rate": 0.0001680617101704304, "loss": 4.7815, "mean_token_accuracy": 0.23034237325191498, "num_tokens": 147211999.0, "step": 84865 }, { "entropy": 5.3611139297485355, "epoch": 6.6031511379109125, "grad_norm": 1.3125, "learning_rate": 0.00016803732586815346, "loss": 4.6324, "mean_token_accuracy": 0.24090876132249833, "num_tokens": 147220353.0, "step": 84870 }, { "entropy": 5.348388767242431, "epoch": 6.60354016728263, "grad_norm": 1.3046875, "learning_rate": 0.00016801294318886478, "loss": 4.5788, "mean_token_accuracy": 0.24277048110961913, "num_tokens": 147229180.0, "step": 84875 }, { "entropy": 5.362228775024414, "epoch": 6.603929196654347, "grad_norm": 1.296875, "learning_rate": 0.0001679885621329345, "loss": 4.559, "mean_token_accuracy": 0.24239525347948074, "num_tokens": 147237367.0, "step": 84880 }, { "entropy": 5.305191946029663, "epoch": 6.604318226026065, "grad_norm": 1.328125, "learning_rate": 0.00016796418270073233, "loss": 4.6019, "mean_token_accuracy": 0.24548857808113098, "num_tokens": 147246089.0, "step": 84885 }, { "entropy": 5.417315101623535, "epoch": 6.604707255397782, "grad_norm": 1.4609375, "learning_rate": 0.0001679398048926284, "loss": 4.6356, "mean_token_accuracy": 0.24127229899168015, "num_tokens": 147254735.0, "step": 84890 }, { "entropy": 5.340967893600464, "epoch": 6.6050962847695, "grad_norm": 1.3515625, "learning_rate": 0.00016791542870899252, "loss": 4.6506, "mean_token_accuracy": 0.241156867146492, "num_tokens": 147263070.0, "step": 84895 }, { "entropy": 5.326006937026977, "epoch": 6.605485314141218, "grad_norm": 1.296875, "learning_rate": 0.00016789105415019448, "loss": 4.6349, "mean_token_accuracy": 0.23975169360637666, "num_tokens": 147271891.0, "step": 84900 }, { "entropy": 5.3107250213623045, "epoch": 6.6058743435129355, "grad_norm": 1.25, "learning_rate": 0.00016786668121660433, "loss": 4.612, "mean_token_accuracy": 0.24616075307130814, "num_tokens": 147280868.0, "step": 84905 }, { "entropy": 5.395116853713989, "epoch": 6.606263372884653, "grad_norm": 1.3671875, "learning_rate": 0.00016784230990859173, "loss": 4.6782, "mean_token_accuracy": 0.24300650209188462, "num_tokens": 147290394.0, "step": 84910 }, { "entropy": 5.430595064163208, "epoch": 6.606652402256371, "grad_norm": 1.4140625, "learning_rate": 0.00016781794022652656, "loss": 4.7249, "mean_token_accuracy": 0.2295028895139694, "num_tokens": 147298671.0, "step": 84915 }, { "entropy": 5.457510757446289, "epoch": 6.607041431628088, "grad_norm": 1.3515625, "learning_rate": 0.00016779357217077851, "loss": 4.6875, "mean_token_accuracy": 0.2369174227118492, "num_tokens": 147306877.0, "step": 84920 }, { "entropy": 5.529739809036255, "epoch": 6.607430460999805, "grad_norm": 1.359375, "learning_rate": 0.00016776920574171735, "loss": 4.8239, "mean_token_accuracy": 0.2308649316430092, "num_tokens": 147315543.0, "step": 84925 }, { "entropy": 5.357408618927002, "epoch": 6.607819490371523, "grad_norm": 1.3203125, "learning_rate": 0.00016774484093971288, "loss": 4.5691, "mean_token_accuracy": 0.2458970680832863, "num_tokens": 147323522.0, "step": 84930 }, { "entropy": 5.3845543384552, "epoch": 6.608208519743241, "grad_norm": 1.390625, "learning_rate": 0.00016772047776513464, "loss": 4.6907, "mean_token_accuracy": 0.24160870015621186, "num_tokens": 147332403.0, "step": 84935 }, { "entropy": 5.292087411880493, "epoch": 6.6085975491149584, "grad_norm": 1.3046875, "learning_rate": 0.00016769611621835252, "loss": 4.5882, "mean_token_accuracy": 0.2479159951210022, "num_tokens": 147340486.0, "step": 84940 }, { "entropy": 5.395690965652466, "epoch": 6.608986578486675, "grad_norm": 1.421875, "learning_rate": 0.0001676717562997359, "loss": 4.6284, "mean_token_accuracy": 0.24656738340854645, "num_tokens": 147348262.0, "step": 84945 }, { "entropy": 5.371829700469971, "epoch": 6.609375607858393, "grad_norm": 1.296875, "learning_rate": 0.00016764739800965468, "loss": 4.5725, "mean_token_accuracy": 0.25084731727838516, "num_tokens": 147356214.0, "step": 84950 }, { "entropy": 5.301826286315918, "epoch": 6.609764637230111, "grad_norm": 1.3125, "learning_rate": 0.0001676230413484782, "loss": 4.5534, "mean_token_accuracy": 0.2503005161881447, "num_tokens": 147364819.0, "step": 84955 }, { "entropy": 5.333249902725219, "epoch": 6.610153666601828, "grad_norm": 1.3046875, "learning_rate": 0.0001675986863165762, "loss": 4.57, "mean_token_accuracy": 0.24635596871376036, "num_tokens": 147372955.0, "step": 84960 }, { "entropy": 5.3653754711151125, "epoch": 6.610542695973546, "grad_norm": 1.3203125, "learning_rate": 0.00016757433291431822, "loss": 4.6395, "mean_token_accuracy": 0.235653255879879, "num_tokens": 147380958.0, "step": 84965 }, { "entropy": 5.372679710388184, "epoch": 6.610931725345264, "grad_norm": 1.2421875, "learning_rate": 0.0001675499811420737, "loss": 4.5926, "mean_token_accuracy": 0.2409351646900177, "num_tokens": 147390552.0, "step": 84970 }, { "entropy": 5.458901596069336, "epoch": 6.611320754716981, "grad_norm": 1.328125, "learning_rate": 0.00016752563100021228, "loss": 4.7176, "mean_token_accuracy": 0.2386649176478386, "num_tokens": 147398952.0, "step": 84975 }, { "entropy": 5.418434381484985, "epoch": 6.611709784088699, "grad_norm": 1.3984375, "learning_rate": 0.00016750128248910328, "loss": 4.7212, "mean_token_accuracy": 0.2442736104130745, "num_tokens": 147407608.0, "step": 84980 }, { "entropy": 5.401566457748413, "epoch": 6.612098813460416, "grad_norm": 1.2890625, "learning_rate": 0.00016747693560911626, "loss": 4.6954, "mean_token_accuracy": 0.24070698916912078, "num_tokens": 147416462.0, "step": 84985 }, { "entropy": 5.353321218490601, "epoch": 6.612487842832134, "grad_norm": 1.25, "learning_rate": 0.00016745259036062056, "loss": 4.6087, "mean_token_accuracy": 0.24540013819932938, "num_tokens": 147424685.0, "step": 84990 }, { "entropy": 5.364633321762085, "epoch": 6.612876872203851, "grad_norm": 1.2890625, "learning_rate": 0.0001674282467439857, "loss": 4.633, "mean_token_accuracy": 0.2417902246117592, "num_tokens": 147433750.0, "step": 84995 }, { "entropy": 5.303768539428711, "epoch": 6.613265901575569, "grad_norm": 1.3359375, "learning_rate": 0.00016740390475958095, "loss": 4.542, "mean_token_accuracy": 0.24556280076503753, "num_tokens": 147441999.0, "step": 85000 }, { "entropy": 5.316144227981567, "epoch": 6.613654930947287, "grad_norm": 1.3046875, "learning_rate": 0.00016737956440777564, "loss": 4.6246, "mean_token_accuracy": 0.2416437089443207, "num_tokens": 147450945.0, "step": 85005 }, { "entropy": 5.362026262283325, "epoch": 6.614043960319004, "grad_norm": 1.4140625, "learning_rate": 0.0001673552256889392, "loss": 4.722, "mean_token_accuracy": 0.23605990707874297, "num_tokens": 147459541.0, "step": 85010 }, { "entropy": 5.338880586624145, "epoch": 6.614432989690721, "grad_norm": 1.3671875, "learning_rate": 0.0001673308886034408, "loss": 4.5975, "mean_token_accuracy": 0.24209969341754914, "num_tokens": 147467904.0, "step": 85015 }, { "entropy": 5.429802274703979, "epoch": 6.614822019062439, "grad_norm": 1.3125, "learning_rate": 0.00016730655315164985, "loss": 4.7035, "mean_token_accuracy": 0.2403227210044861, "num_tokens": 147476679.0, "step": 85020 }, { "entropy": 5.349461841583252, "epoch": 6.615211048434157, "grad_norm": 1.3515625, "learning_rate": 0.0001672822193339354, "loss": 4.5948, "mean_token_accuracy": 0.24181448817253112, "num_tokens": 147485081.0, "step": 85025 }, { "entropy": 5.465399742126465, "epoch": 6.615600077805874, "grad_norm": 1.2578125, "learning_rate": 0.00016725788715066698, "loss": 4.7435, "mean_token_accuracy": 0.23700958639383315, "num_tokens": 147493808.0, "step": 85030 }, { "entropy": 5.396971082687378, "epoch": 6.615989107177592, "grad_norm": 1.265625, "learning_rate": 0.00016723355660221368, "loss": 4.6666, "mean_token_accuracy": 0.24058808386325836, "num_tokens": 147502696.0, "step": 85035 }, { "entropy": 5.426829671859741, "epoch": 6.61637813654931, "grad_norm": 1.34375, "learning_rate": 0.00016720922768894447, "loss": 4.6999, "mean_token_accuracy": 0.23768509328365325, "num_tokens": 147511034.0, "step": 85040 }, { "entropy": 5.4506837844848635, "epoch": 6.616767165921027, "grad_norm": 1.3515625, "learning_rate": 0.0001671849004112288, "loss": 4.7435, "mean_token_accuracy": 0.23680549710989, "num_tokens": 147520506.0, "step": 85045 }, { "entropy": 5.386112451553345, "epoch": 6.617156195292744, "grad_norm": 1.28125, "learning_rate": 0.00016716057476943554, "loss": 4.6802, "mean_token_accuracy": 0.24078678488731384, "num_tokens": 147529398.0, "step": 85050 }, { "entropy": 5.353237152099609, "epoch": 6.617545224664462, "grad_norm": 1.2421875, "learning_rate": 0.00016713625076393403, "loss": 4.5929, "mean_token_accuracy": 0.24861593395471573, "num_tokens": 147538199.0, "step": 85055 }, { "entropy": 5.317676591873169, "epoch": 6.61793425403618, "grad_norm": 1.296875, "learning_rate": 0.00016711192839509315, "loss": 4.602, "mean_token_accuracy": 0.24197246134281158, "num_tokens": 147547460.0, "step": 85060 }, { "entropy": 5.3474658012390135, "epoch": 6.618323283407897, "grad_norm": 1.2734375, "learning_rate": 0.0001670876076632821, "loss": 4.5924, "mean_token_accuracy": 0.24277315735816957, "num_tokens": 147555938.0, "step": 85065 }, { "entropy": 5.39335265159607, "epoch": 6.618712312779615, "grad_norm": 1.328125, "learning_rate": 0.00016706328856886976, "loss": 4.6297, "mean_token_accuracy": 0.24416491836309434, "num_tokens": 147564293.0, "step": 85070 }, { "entropy": 5.420904588699341, "epoch": 6.619101342151333, "grad_norm": 1.3359375, "learning_rate": 0.00016703897111222532, "loss": 4.7129, "mean_token_accuracy": 0.23345373719930648, "num_tokens": 147572755.0, "step": 85075 }, { "entropy": 5.397638654708862, "epoch": 6.6194903715230495, "grad_norm": 1.3515625, "learning_rate": 0.00016701465529371753, "loss": 4.7244, "mean_token_accuracy": 0.22805369049310684, "num_tokens": 147581677.0, "step": 85080 }, { "entropy": 5.429655075073242, "epoch": 6.619879400894767, "grad_norm": 1.34375, "learning_rate": 0.00016699034111371564, "loss": 4.7088, "mean_token_accuracy": 0.23997960537672042, "num_tokens": 147590830.0, "step": 85085 }, { "entropy": 5.385819339752198, "epoch": 6.620268430266485, "grad_norm": 1.2421875, "learning_rate": 0.00016696602857258833, "loss": 4.609, "mean_token_accuracy": 0.2437571480870247, "num_tokens": 147599746.0, "step": 85090 }, { "entropy": 5.3169252395629885, "epoch": 6.620657459638203, "grad_norm": 1.2734375, "learning_rate": 0.00016694171767070443, "loss": 4.54, "mean_token_accuracy": 0.25219019055366515, "num_tokens": 147608138.0, "step": 85095 }, { "entropy": 5.3297018051147464, "epoch": 6.62104648900992, "grad_norm": 1.375, "learning_rate": 0.00016691740840843315, "loss": 4.5844, "mean_token_accuracy": 0.24312763065099716, "num_tokens": 147616425.0, "step": 85100 }, { "entropy": 5.3773948669433596, "epoch": 6.621435518381638, "grad_norm": 1.4296875, "learning_rate": 0.00016689310078614307, "loss": 4.6407, "mean_token_accuracy": 0.2373705491423607, "num_tokens": 147623758.0, "step": 85105 }, { "entropy": 5.405201625823975, "epoch": 6.621824547753356, "grad_norm": 1.3671875, "learning_rate": 0.0001668687948042032, "loss": 4.7049, "mean_token_accuracy": 0.23456077873706818, "num_tokens": 147631516.0, "step": 85110 }, { "entropy": 5.291733121871948, "epoch": 6.622213577125073, "grad_norm": 1.234375, "learning_rate": 0.00016684449046298227, "loss": 4.5699, "mean_token_accuracy": 0.2517614096403122, "num_tokens": 147639346.0, "step": 85115 }, { "entropy": 5.430687475204468, "epoch": 6.62260260649679, "grad_norm": 1.296875, "learning_rate": 0.00016682018776284898, "loss": 4.6832, "mean_token_accuracy": 0.2405116379261017, "num_tokens": 147647850.0, "step": 85120 }, { "entropy": 5.506042623519898, "epoch": 6.622991635868508, "grad_norm": 1.3515625, "learning_rate": 0.0001667958867041722, "loss": 4.8014, "mean_token_accuracy": 0.22759669423103332, "num_tokens": 147656101.0, "step": 85125 }, { "entropy": 5.384186458587647, "epoch": 6.623380665240226, "grad_norm": 1.3046875, "learning_rate": 0.00016677158728732055, "loss": 4.6297, "mean_token_accuracy": 0.24604760706424714, "num_tokens": 147664416.0, "step": 85130 }, { "entropy": 5.360487699508667, "epoch": 6.623769694611943, "grad_norm": 1.3984375, "learning_rate": 0.0001667472895126629, "loss": 4.597, "mean_token_accuracy": 0.24831484854221345, "num_tokens": 147673396.0, "step": 85135 }, { "entropy": 5.296630382537842, "epoch": 6.624158723983661, "grad_norm": 1.3671875, "learning_rate": 0.00016672299338056773, "loss": 4.5864, "mean_token_accuracy": 0.2457493305206299, "num_tokens": 147681389.0, "step": 85140 }, { "entropy": 5.3259330749511715, "epoch": 6.624547753355379, "grad_norm": 1.328125, "learning_rate": 0.00016669869889140388, "loss": 4.5853, "mean_token_accuracy": 0.2446097120642662, "num_tokens": 147689486.0, "step": 85145 }, { "entropy": 5.405546712875366, "epoch": 6.6249367827270955, "grad_norm": 1.2578125, "learning_rate": 0.0001666744060455398, "loss": 4.725, "mean_token_accuracy": 0.23502719402313232, "num_tokens": 147698301.0, "step": 85150 }, { "entropy": 5.408657217025757, "epoch": 6.625325812098813, "grad_norm": 1.328125, "learning_rate": 0.0001666501148433443, "loss": 4.6597, "mean_token_accuracy": 0.24079445898532867, "num_tokens": 147707539.0, "step": 85155 }, { "entropy": 5.3553760051727295, "epoch": 6.625714841470531, "grad_norm": 1.453125, "learning_rate": 0.00016662582528518578, "loss": 4.6468, "mean_token_accuracy": 0.2402677431702614, "num_tokens": 147716017.0, "step": 85160 }, { "entropy": 5.328882360458374, "epoch": 6.626103870842249, "grad_norm": 1.5078125, "learning_rate": 0.00016660153737143283, "loss": 4.621, "mean_token_accuracy": 0.2557135999202728, "num_tokens": 147724475.0, "step": 85165 }, { "entropy": 5.466624355316162, "epoch": 6.626492900213966, "grad_norm": 1.390625, "learning_rate": 0.00016657725110245412, "loss": 4.7412, "mean_token_accuracy": 0.2377592593431473, "num_tokens": 147733064.0, "step": 85170 }, { "entropy": 5.302232265472412, "epoch": 6.626881929585684, "grad_norm": 1.265625, "learning_rate": 0.00016655296647861796, "loss": 4.5393, "mean_token_accuracy": 0.2535153031349182, "num_tokens": 147742224.0, "step": 85175 }, { "entropy": 5.344184875488281, "epoch": 6.627270958957402, "grad_norm": 1.21875, "learning_rate": 0.000166528683500293, "loss": 4.6178, "mean_token_accuracy": 0.24734582901000976, "num_tokens": 147751160.0, "step": 85180 }, { "entropy": 5.2657266616821286, "epoch": 6.6276599883291185, "grad_norm": 1.3359375, "learning_rate": 0.00016650440216784754, "loss": 4.5229, "mean_token_accuracy": 0.2464326038956642, "num_tokens": 147759507.0, "step": 85185 }, { "entropy": 5.270854043960571, "epoch": 6.628049017700836, "grad_norm": 1.359375, "learning_rate": 0.00016648012248165017, "loss": 4.5873, "mean_token_accuracy": 0.24960466474294662, "num_tokens": 147767740.0, "step": 85190 }, { "entropy": 5.269649314880371, "epoch": 6.628438047072554, "grad_norm": 1.375, "learning_rate": 0.0001664558444420692, "loss": 4.5597, "mean_token_accuracy": 0.25650366991758344, "num_tokens": 147776401.0, "step": 85195 }, { "entropy": 5.377918672561646, "epoch": 6.628827076444272, "grad_norm": 1.34375, "learning_rate": 0.00016643156804947297, "loss": 4.6772, "mean_token_accuracy": 0.2402199164032936, "num_tokens": 147784408.0, "step": 85200 }, { "entropy": 5.460059595108032, "epoch": 6.629216105815989, "grad_norm": 1.3515625, "learning_rate": 0.00016640729330422992, "loss": 4.7143, "mean_token_accuracy": 0.23713289499282836, "num_tokens": 147793150.0, "step": 85205 }, { "entropy": 5.404957628250122, "epoch": 6.629605135187707, "grad_norm": 1.28125, "learning_rate": 0.0001663830202067083, "loss": 4.6067, "mean_token_accuracy": 0.24149061292409896, "num_tokens": 147801820.0, "step": 85210 }, { "entropy": 5.421248579025269, "epoch": 6.629994164559424, "grad_norm": 1.25, "learning_rate": 0.00016635874875727658, "loss": 4.6836, "mean_token_accuracy": 0.2415817067027092, "num_tokens": 147810637.0, "step": 85215 }, { "entropy": 5.429814052581787, "epoch": 6.6303831939311415, "grad_norm": 1.1953125, "learning_rate": 0.00016633447895630284, "loss": 4.7339, "mean_token_accuracy": 0.23105303943157196, "num_tokens": 147819310.0, "step": 85220 }, { "entropy": 5.401655387878418, "epoch": 6.630772223302859, "grad_norm": 1.328125, "learning_rate": 0.0001663102108041554, "loss": 4.6773, "mean_token_accuracy": 0.2368190884590149, "num_tokens": 147828255.0, "step": 85225 }, { "entropy": 5.426845216751099, "epoch": 6.631161252674577, "grad_norm": 1.3359375, "learning_rate": 0.00016628594430120262, "loss": 4.7457, "mean_token_accuracy": 0.23459971845149993, "num_tokens": 147837309.0, "step": 85230 }, { "entropy": 5.361053085327148, "epoch": 6.631550282046295, "grad_norm": 1.296875, "learning_rate": 0.00016626167944781248, "loss": 4.5661, "mean_token_accuracy": 0.24625769555568694, "num_tokens": 147845869.0, "step": 85235 }, { "entropy": 5.425272703170776, "epoch": 6.631939311418012, "grad_norm": 1.34375, "learning_rate": 0.0001662374162443534, "loss": 4.694, "mean_token_accuracy": 0.24079749584197999, "num_tokens": 147854025.0, "step": 85240 }, { "entropy": 5.388816165924072, "epoch": 6.63232834078973, "grad_norm": 1.375, "learning_rate": 0.0001662131546911933, "loss": 4.6375, "mean_token_accuracy": 0.24436034858226777, "num_tokens": 147862219.0, "step": 85245 }, { "entropy": 5.348510313034057, "epoch": 6.632717370161447, "grad_norm": 1.375, "learning_rate": 0.00016618889478870052, "loss": 4.6145, "mean_token_accuracy": 0.24737160354852678, "num_tokens": 147870585.0, "step": 85250 }, { "entropy": 5.37085452079773, "epoch": 6.6331063995331645, "grad_norm": 1.34375, "learning_rate": 0.000166164636537243, "loss": 4.6513, "mean_token_accuracy": 0.24065429270267485, "num_tokens": 147878969.0, "step": 85255 }, { "entropy": 5.387342882156372, "epoch": 6.633495428904882, "grad_norm": 1.375, "learning_rate": 0.00016614037993718895, "loss": 4.6252, "mean_token_accuracy": 0.23824930787086487, "num_tokens": 147887186.0, "step": 85260 }, { "entropy": 5.357514667510986, "epoch": 6.6338844582766, "grad_norm": 1.3125, "learning_rate": 0.0001661161249889063, "loss": 4.6304, "mean_token_accuracy": 0.24571343660354614, "num_tokens": 147896151.0, "step": 85265 }, { "entropy": 5.421031141281128, "epoch": 6.634273487648318, "grad_norm": 1.2734375, "learning_rate": 0.00016609187169276324, "loss": 4.759, "mean_token_accuracy": 0.23388646245002748, "num_tokens": 147904707.0, "step": 85270 }, { "entropy": 5.383432388305664, "epoch": 6.634662517020035, "grad_norm": 1.3515625, "learning_rate": 0.00016606762004912762, "loss": 4.6627, "mean_token_accuracy": 0.24441962391138078, "num_tokens": 147912871.0, "step": 85275 }, { "entropy": 5.4062706470489506, "epoch": 6.635051546391752, "grad_norm": 1.3203125, "learning_rate": 0.00016604337005836752, "loss": 4.7174, "mean_token_accuracy": 0.24571072161197663, "num_tokens": 147921762.0, "step": 85280 }, { "entropy": 5.427821063995362, "epoch": 6.63544057576347, "grad_norm": 1.40625, "learning_rate": 0.00016601912172085082, "loss": 4.6764, "mean_token_accuracy": 0.23166516274213791, "num_tokens": 147930781.0, "step": 85285 }, { "entropy": 5.444191026687622, "epoch": 6.6358296051351875, "grad_norm": 1.3203125, "learning_rate": 0.00016599487503694545, "loss": 4.6468, "mean_token_accuracy": 0.24590632915496827, "num_tokens": 147940029.0, "step": 85290 }, { "entropy": 5.423157644271851, "epoch": 6.636218634506905, "grad_norm": 1.4140625, "learning_rate": 0.00016597063000701936, "loss": 4.6604, "mean_token_accuracy": 0.2413393720984459, "num_tokens": 147948597.0, "step": 85295 }, { "entropy": 5.392226362228394, "epoch": 6.636607663878623, "grad_norm": 1.3203125, "learning_rate": 0.0001659463866314404, "loss": 4.6837, "mean_token_accuracy": 0.2324478045105934, "num_tokens": 147957030.0, "step": 85300 }, { "entropy": 5.336175489425659, "epoch": 6.636996693250341, "grad_norm": 1.359375, "learning_rate": 0.00016592214491057653, "loss": 4.6257, "mean_token_accuracy": 0.23795036673545839, "num_tokens": 147965757.0, "step": 85305 }, { "entropy": 5.338454627990723, "epoch": 6.637385722622058, "grad_norm": 1.359375, "learning_rate": 0.00016589790484479553, "loss": 4.6282, "mean_token_accuracy": 0.2338057965040207, "num_tokens": 147974334.0, "step": 85310 }, { "entropy": 5.358457803726196, "epoch": 6.637774751993776, "grad_norm": 1.328125, "learning_rate": 0.00016587366643446504, "loss": 4.6374, "mean_token_accuracy": 0.24028546810150148, "num_tokens": 147983122.0, "step": 85315 }, { "entropy": 5.385693883895874, "epoch": 6.638163781365493, "grad_norm": 1.3828125, "learning_rate": 0.00016584942967995308, "loss": 4.6142, "mean_token_accuracy": 0.2455917313694954, "num_tokens": 147991834.0, "step": 85320 }, { "entropy": 5.396356678009033, "epoch": 6.6385528107372105, "grad_norm": 1.4453125, "learning_rate": 0.0001658251945816272, "loss": 4.6337, "mean_token_accuracy": 0.24554928094148637, "num_tokens": 148001534.0, "step": 85325 }, { "entropy": 5.354276561737061, "epoch": 6.638941840108928, "grad_norm": 1.2734375, "learning_rate": 0.00016580096113985536, "loss": 4.5468, "mean_token_accuracy": 0.2516625002026558, "num_tokens": 148009787.0, "step": 85330 }, { "entropy": 5.287834119796753, "epoch": 6.639330869480646, "grad_norm": 1.328125, "learning_rate": 0.000165776729355005, "loss": 4.5867, "mean_token_accuracy": 0.24549387991428376, "num_tokens": 148018538.0, "step": 85335 }, { "entropy": 5.375620746612549, "epoch": 6.639719898852364, "grad_norm": 1.453125, "learning_rate": 0.00016575249922744402, "loss": 4.7084, "mean_token_accuracy": 0.2332543283700943, "num_tokens": 148027375.0, "step": 85340 }, { "entropy": 5.407729578018189, "epoch": 6.640108928224081, "grad_norm": 1.359375, "learning_rate": 0.00016572827075753987, "loss": 4.6124, "mean_token_accuracy": 0.24296474158763887, "num_tokens": 148035638.0, "step": 85345 }, { "entropy": 5.324307823181153, "epoch": 6.640497957595798, "grad_norm": 1.28125, "learning_rate": 0.0001657040439456604, "loss": 4.4712, "mean_token_accuracy": 0.25399318933486936, "num_tokens": 148044458.0, "step": 85350 }, { "entropy": 5.339103698730469, "epoch": 6.640886986967516, "grad_norm": 1.2890625, "learning_rate": 0.00016567981879217307, "loss": 4.6416, "mean_token_accuracy": 0.24069348573684693, "num_tokens": 148054046.0, "step": 85355 }, { "entropy": 5.3384088516235355, "epoch": 6.6412760163392335, "grad_norm": 1.2578125, "learning_rate": 0.0001656555952974453, "loss": 4.6307, "mean_token_accuracy": 0.24218022227287292, "num_tokens": 148062590.0, "step": 85360 }, { "entropy": 5.323037624359131, "epoch": 6.641665045710951, "grad_norm": 1.25, "learning_rate": 0.00016563137346184504, "loss": 4.6383, "mean_token_accuracy": 0.2352748543024063, "num_tokens": 148071039.0, "step": 85365 }, { "entropy": 5.353954267501831, "epoch": 6.642054075082669, "grad_norm": 1.328125, "learning_rate": 0.00016560715328573953, "loss": 4.6459, "mean_token_accuracy": 0.23778789937496186, "num_tokens": 148079579.0, "step": 85370 }, { "entropy": 5.347445821762085, "epoch": 6.642443104454387, "grad_norm": 1.5, "learning_rate": 0.00016558293476949643, "loss": 4.6571, "mean_token_accuracy": 0.24544587284326552, "num_tokens": 148088389.0, "step": 85375 }, { "entropy": 5.380689477920532, "epoch": 6.642832133826104, "grad_norm": 1.265625, "learning_rate": 0.00016555871791348303, "loss": 4.6538, "mean_token_accuracy": 0.24249397665262223, "num_tokens": 148097558.0, "step": 85380 }, { "entropy": 5.3454516410827635, "epoch": 6.643221163197821, "grad_norm": 1.34375, "learning_rate": 0.00016553450271806702, "loss": 4.5319, "mean_token_accuracy": 0.24773604720830916, "num_tokens": 148105803.0, "step": 85385 }, { "entropy": 5.315246105194092, "epoch": 6.643610192569539, "grad_norm": 1.2890625, "learning_rate": 0.00016551028918361567, "loss": 4.5955, "mean_token_accuracy": 0.23978111743927003, "num_tokens": 148114209.0, "step": 85390 }, { "entropy": 5.38988037109375, "epoch": 6.6439992219412565, "grad_norm": 1.453125, "learning_rate": 0.00016548607731049634, "loss": 4.7168, "mean_token_accuracy": 0.23563034534454347, "num_tokens": 148122461.0, "step": 85395 }, { "entropy": 5.417348861694336, "epoch": 6.644388251312974, "grad_norm": 1.2421875, "learning_rate": 0.00016546186709907656, "loss": 4.7061, "mean_token_accuracy": 0.23760205507278442, "num_tokens": 148131806.0, "step": 85400 }, { "entropy": 5.412226629257202, "epoch": 6.644777280684692, "grad_norm": 1.4375, "learning_rate": 0.00016543765854972354, "loss": 4.7454, "mean_token_accuracy": 0.23512753695249558, "num_tokens": 148140869.0, "step": 85405 }, { "entropy": 5.344978761672974, "epoch": 6.64516631005641, "grad_norm": 1.3984375, "learning_rate": 0.00016541345166280467, "loss": 4.5716, "mean_token_accuracy": 0.2509961470961571, "num_tokens": 148149676.0, "step": 85410 }, { "entropy": 5.295153045654297, "epoch": 6.645555339428126, "grad_norm": 1.2734375, "learning_rate": 0.0001653892464386872, "loss": 4.4918, "mean_token_accuracy": 0.250806125998497, "num_tokens": 148157926.0, "step": 85415 }, { "entropy": 5.313762950897217, "epoch": 6.645944368799844, "grad_norm": 1.3984375, "learning_rate": 0.00016536504287773858, "loss": 4.6046, "mean_token_accuracy": 0.24608051925897598, "num_tokens": 148167151.0, "step": 85420 }, { "entropy": 5.338822269439698, "epoch": 6.646333398171562, "grad_norm": 1.3203125, "learning_rate": 0.0001653408409803258, "loss": 4.6145, "mean_token_accuracy": 0.2462860658764839, "num_tokens": 148175557.0, "step": 85425 }, { "entropy": 5.404410696029663, "epoch": 6.6467224275432795, "grad_norm": 1.2109375, "learning_rate": 0.00016531664074681624, "loss": 4.6917, "mean_token_accuracy": 0.22996897548437117, "num_tokens": 148184278.0, "step": 85430 }, { "entropy": 5.353729248046875, "epoch": 6.647111456914997, "grad_norm": 1.2578125, "learning_rate": 0.00016529244217757718, "loss": 4.5939, "mean_token_accuracy": 0.24608834087848663, "num_tokens": 148192778.0, "step": 85435 }, { "entropy": 5.356325674057007, "epoch": 6.647500486286715, "grad_norm": 1.234375, "learning_rate": 0.00016526824527297553, "loss": 4.6049, "mean_token_accuracy": 0.24799669831991195, "num_tokens": 148202376.0, "step": 85440 }, { "entropy": 5.3778783798217775, "epoch": 6.647889515658433, "grad_norm": 1.3515625, "learning_rate": 0.00016524405003337877, "loss": 4.6661, "mean_token_accuracy": 0.23516835421323776, "num_tokens": 148210266.0, "step": 85445 }, { "entropy": 5.383705472946167, "epoch": 6.64827854503015, "grad_norm": 1.34375, "learning_rate": 0.0001652198564591537, "loss": 4.6896, "mean_token_accuracy": 0.23982729464769365, "num_tokens": 148218820.0, "step": 85450 }, { "entropy": 5.477152252197266, "epoch": 6.648667574401867, "grad_norm": 1.3125, "learning_rate": 0.00016519566455066773, "loss": 4.7463, "mean_token_accuracy": 0.23034174144268035, "num_tokens": 148227737.0, "step": 85455 }, { "entropy": 5.442525339126587, "epoch": 6.649056603773585, "grad_norm": 1.328125, "learning_rate": 0.00016517147430828767, "loss": 4.6808, "mean_token_accuracy": 0.23237675279378892, "num_tokens": 148236963.0, "step": 85460 }, { "entropy": 5.390676212310791, "epoch": 6.6494456331453025, "grad_norm": 1.2890625, "learning_rate": 0.00016514728573238077, "loss": 4.6116, "mean_token_accuracy": 0.2443060517311096, "num_tokens": 148246374.0, "step": 85465 }, { "entropy": 5.358269357681275, "epoch": 6.64983466251702, "grad_norm": 1.390625, "learning_rate": 0.00016512309882331394, "loss": 4.6515, "mean_token_accuracy": 0.2373913824558258, "num_tokens": 148254920.0, "step": 85470 }, { "entropy": 5.357132291793823, "epoch": 6.650223691888738, "grad_norm": 1.3046875, "learning_rate": 0.00016509891358145414, "loss": 4.644, "mean_token_accuracy": 0.23675850927829742, "num_tokens": 148263322.0, "step": 85475 }, { "entropy": 5.331697750091553, "epoch": 6.6506127212604556, "grad_norm": 1.328125, "learning_rate": 0.00016507473000716843, "loss": 4.6169, "mean_token_accuracy": 0.2437201127409935, "num_tokens": 148272221.0, "step": 85480 }, { "entropy": 5.364223861694336, "epoch": 6.651001750632172, "grad_norm": 1.3828125, "learning_rate": 0.0001650505481008237, "loss": 4.6644, "mean_token_accuracy": 0.23907559961080552, "num_tokens": 148281086.0, "step": 85485 }, { "entropy": 5.355470132827759, "epoch": 6.65139078000389, "grad_norm": 1.2265625, "learning_rate": 0.00016502636786278686, "loss": 4.5965, "mean_token_accuracy": 0.23912649899721145, "num_tokens": 148289257.0, "step": 85490 }, { "entropy": 5.343170785903931, "epoch": 6.651779809375608, "grad_norm": 1.25, "learning_rate": 0.00016500218929342496, "loss": 4.6508, "mean_token_accuracy": 0.23619042783975602, "num_tokens": 148298188.0, "step": 85495 }, { "entropy": 5.3839606761932375, "epoch": 6.6521688387473255, "grad_norm": 1.2890625, "learning_rate": 0.00016497801239310464, "loss": 4.7004, "mean_token_accuracy": 0.2332440733909607, "num_tokens": 148307374.0, "step": 85500 }, { "entropy": 5.399441242218018, "epoch": 6.652557868119043, "grad_norm": 1.34375, "learning_rate": 0.000164953837162193, "loss": 4.6554, "mean_token_accuracy": 0.23956432640552522, "num_tokens": 148316059.0, "step": 85505 }, { "entropy": 5.50105299949646, "epoch": 6.652946897490761, "grad_norm": 1.3046875, "learning_rate": 0.0001649296636010566, "loss": 4.7939, "mean_token_accuracy": 0.22809799313545226, "num_tokens": 148325429.0, "step": 85510 }, { "entropy": 5.450500583648681, "epoch": 6.6533359268624785, "grad_norm": 1.3125, "learning_rate": 0.00016490549171006247, "loss": 4.6948, "mean_token_accuracy": 0.23416401147842408, "num_tokens": 148334540.0, "step": 85515 }, { "entropy": 5.413470029830933, "epoch": 6.653724956234195, "grad_norm": 1.2421875, "learning_rate": 0.0001648813214895772, "loss": 4.6656, "mean_token_accuracy": 0.24416756331920625, "num_tokens": 148343211.0, "step": 85520 }, { "entropy": 5.305610036849975, "epoch": 6.654113985605913, "grad_norm": 1.390625, "learning_rate": 0.00016485715293996763, "loss": 4.5425, "mean_token_accuracy": 0.24662694334983826, "num_tokens": 148351899.0, "step": 85525 }, { "entropy": 5.343322849273681, "epoch": 6.654503014977631, "grad_norm": 1.40625, "learning_rate": 0.0001648329860616004, "loss": 4.6233, "mean_token_accuracy": 0.24089870005846023, "num_tokens": 148360220.0, "step": 85530 }, { "entropy": 5.306836557388306, "epoch": 6.6548920443493484, "grad_norm": 1.3671875, "learning_rate": 0.00016480882085484233, "loss": 4.5761, "mean_token_accuracy": 0.24908214807510376, "num_tokens": 148368867.0, "step": 85535 }, { "entropy": 5.420171546936035, "epoch": 6.655281073721066, "grad_norm": 1.296875, "learning_rate": 0.00016478465732006, "loss": 4.7045, "mean_token_accuracy": 0.22974404990673064, "num_tokens": 148377201.0, "step": 85540 }, { "entropy": 5.432074642181396, "epoch": 6.655670103092784, "grad_norm": 1.390625, "learning_rate": 0.00016476049545762007, "loss": 4.6756, "mean_token_accuracy": 0.24211029708385468, "num_tokens": 148386022.0, "step": 85545 }, { "entropy": 5.4201983451843265, "epoch": 6.656059132464501, "grad_norm": 1.25, "learning_rate": 0.00016473633526788918, "loss": 4.6998, "mean_token_accuracy": 0.23235575258731841, "num_tokens": 148394937.0, "step": 85550 }, { "entropy": 5.502428293228149, "epoch": 6.656448161836218, "grad_norm": 1.3671875, "learning_rate": 0.0001647121767512338, "loss": 4.7974, "mean_token_accuracy": 0.23492847234010697, "num_tokens": 148403741.0, "step": 85555 }, { "entropy": 5.439122915267944, "epoch": 6.656837191207936, "grad_norm": 1.3828125, "learning_rate": 0.00016468801990802062, "loss": 4.6361, "mean_token_accuracy": 0.24071057438850402, "num_tokens": 148413014.0, "step": 85560 }, { "entropy": 5.423998308181763, "epoch": 6.657226220579654, "grad_norm": 1.4296875, "learning_rate": 0.00016466386473861617, "loss": 4.697, "mean_token_accuracy": 0.24356161803007126, "num_tokens": 148421672.0, "step": 85565 }, { "entropy": 5.41186203956604, "epoch": 6.657615249951371, "grad_norm": 1.453125, "learning_rate": 0.000164639711243387, "loss": 4.7599, "mean_token_accuracy": 0.23111544102430343, "num_tokens": 148430810.0, "step": 85570 }, { "entropy": 5.347298574447632, "epoch": 6.658004279323089, "grad_norm": 1.4609375, "learning_rate": 0.0001646155594226996, "loss": 4.6207, "mean_token_accuracy": 0.244733028113842, "num_tokens": 148439463.0, "step": 85575 }, { "entropy": 5.417573928833008, "epoch": 6.658393308694807, "grad_norm": 1.234375, "learning_rate": 0.00016459140927692028, "loss": 4.6392, "mean_token_accuracy": 0.24074405431747437, "num_tokens": 148448089.0, "step": 85580 }, { "entropy": 5.341724491119384, "epoch": 6.658782338066524, "grad_norm": 1.3046875, "learning_rate": 0.00016456726080641567, "loss": 4.5883, "mean_token_accuracy": 0.2562005206942558, "num_tokens": 148456580.0, "step": 85585 }, { "entropy": 5.322108364105224, "epoch": 6.659171367438241, "grad_norm": 1.2578125, "learning_rate": 0.00016454311401155206, "loss": 4.6359, "mean_token_accuracy": 0.23228022158145906, "num_tokens": 148465484.0, "step": 85590 }, { "entropy": 5.451080656051635, "epoch": 6.659560396809959, "grad_norm": 1.3515625, "learning_rate": 0.00016451896889269595, "loss": 4.6553, "mean_token_accuracy": 0.23936405777931213, "num_tokens": 148474050.0, "step": 85595 }, { "entropy": 5.345937299728393, "epoch": 6.659949426181677, "grad_norm": 1.375, "learning_rate": 0.00016449482545021353, "loss": 4.6233, "mean_token_accuracy": 0.23817439675331115, "num_tokens": 148482613.0, "step": 85600 }, { "entropy": 5.3842803001403805, "epoch": 6.660338455553394, "grad_norm": 1.421875, "learning_rate": 0.00016447068368447137, "loss": 4.6232, "mean_token_accuracy": 0.24066583216190338, "num_tokens": 148491576.0, "step": 85605 }, { "entropy": 5.357517862319947, "epoch": 6.660727484925112, "grad_norm": 1.359375, "learning_rate": 0.0001644465435958355, "loss": 4.6352, "mean_token_accuracy": 0.24488113969564437, "num_tokens": 148499915.0, "step": 85610 }, { "entropy": 5.345045709609986, "epoch": 6.661116514296829, "grad_norm": 1.2734375, "learning_rate": 0.00016442240518467252, "loss": 4.6233, "mean_token_accuracy": 0.24977737069129943, "num_tokens": 148509554.0, "step": 85615 }, { "entropy": 5.327544450759888, "epoch": 6.661505543668547, "grad_norm": 1.34375, "learning_rate": 0.00016439826845134845, "loss": 4.5554, "mean_token_accuracy": 0.25001082122325896, "num_tokens": 148518366.0, "step": 85620 }, { "entropy": 5.370396280288697, "epoch": 6.661894573040264, "grad_norm": 1.3359375, "learning_rate": 0.00016437413339622962, "loss": 4.6422, "mean_token_accuracy": 0.24231666177511216, "num_tokens": 148527629.0, "step": 85625 }, { "entropy": 5.392465353012085, "epoch": 6.662283602411982, "grad_norm": 1.265625, "learning_rate": 0.00016435000001968232, "loss": 4.6596, "mean_token_accuracy": 0.24017878472805024, "num_tokens": 148536641.0, "step": 85630 }, { "entropy": 5.3613543033599855, "epoch": 6.6626726317837, "grad_norm": 1.2265625, "learning_rate": 0.00016432586832207253, "loss": 4.5991, "mean_token_accuracy": 0.24646140336990358, "num_tokens": 148545543.0, "step": 85635 }, { "entropy": 5.367738914489746, "epoch": 6.663061661155417, "grad_norm": 1.3203125, "learning_rate": 0.00016430173830376665, "loss": 4.6532, "mean_token_accuracy": 0.24289954602718353, "num_tokens": 148554706.0, "step": 85640 }, { "entropy": 5.410859680175781, "epoch": 6.663450690527135, "grad_norm": 1.375, "learning_rate": 0.00016427760996513057, "loss": 4.6744, "mean_token_accuracy": 0.24617674350738525, "num_tokens": 148562691.0, "step": 85645 }, { "entropy": 5.37871561050415, "epoch": 6.663839719898853, "grad_norm": 1.2578125, "learning_rate": 0.00016425348330653065, "loss": 4.6621, "mean_token_accuracy": 0.2414600670337677, "num_tokens": 148571040.0, "step": 85650 }, { "entropy": 5.42986536026001, "epoch": 6.66422874927057, "grad_norm": 1.28125, "learning_rate": 0.00016422935832833286, "loss": 4.6992, "mean_token_accuracy": 0.23579649925231932, "num_tokens": 148580335.0, "step": 85655 }, { "entropy": 5.39847240447998, "epoch": 6.664617778642287, "grad_norm": 1.3046875, "learning_rate": 0.0001642052350309031, "loss": 4.6642, "mean_token_accuracy": 0.24066114127635957, "num_tokens": 148589634.0, "step": 85660 }, { "entropy": 5.407503700256347, "epoch": 6.665006808014005, "grad_norm": 1.3515625, "learning_rate": 0.00016418111341460773, "loss": 4.6594, "mean_token_accuracy": 0.24357927292585374, "num_tokens": 148598395.0, "step": 85665 }, { "entropy": 5.3296877384185795, "epoch": 6.665395837385723, "grad_norm": 1.3828125, "learning_rate": 0.00016415699347981243, "loss": 4.5856, "mean_token_accuracy": 0.24505438655614853, "num_tokens": 148606767.0, "step": 85670 }, { "entropy": 5.33421483039856, "epoch": 6.66578486675744, "grad_norm": 1.4140625, "learning_rate": 0.00016413287522688342, "loss": 4.5606, "mean_token_accuracy": 0.2471531003713608, "num_tokens": 148614802.0, "step": 85675 }, { "entropy": 5.4209237575531, "epoch": 6.666173896129158, "grad_norm": 1.34375, "learning_rate": 0.00016410875865618645, "loss": 4.6837, "mean_token_accuracy": 0.23804503828287124, "num_tokens": 148623584.0, "step": 85680 }, { "entropy": 5.448467350006103, "epoch": 6.666562925500875, "grad_norm": 1.25, "learning_rate": 0.00016408464376808774, "loss": 4.6769, "mean_token_accuracy": 0.2375603809952736, "num_tokens": 148632110.0, "step": 85685 }, { "entropy": 5.315150165557862, "epoch": 6.666951954872593, "grad_norm": 1.265625, "learning_rate": 0.00016406053056295286, "loss": 4.5388, "mean_token_accuracy": 0.257371523976326, "num_tokens": 148640507.0, "step": 85690 }, { "entropy": 5.367241144180298, "epoch": 6.66734098424431, "grad_norm": 1.2265625, "learning_rate": 0.00016403641904114786, "loss": 4.6133, "mean_token_accuracy": 0.23839765340089797, "num_tokens": 148649200.0, "step": 85695 }, { "entropy": 5.3596227169036865, "epoch": 6.667730013616028, "grad_norm": 1.34375, "learning_rate": 0.0001640123092030387, "loss": 4.6839, "mean_token_accuracy": 0.2451276734471321, "num_tokens": 148657551.0, "step": 85700 }, { "entropy": 5.420835399627686, "epoch": 6.668119042987746, "grad_norm": 1.21875, "learning_rate": 0.000163988201048991, "loss": 4.7776, "mean_token_accuracy": 0.22760249227285384, "num_tokens": 148666424.0, "step": 85705 }, { "entropy": 5.409557914733886, "epoch": 6.668508072359463, "grad_norm": 1.3203125, "learning_rate": 0.00016396409457937073, "loss": 4.7031, "mean_token_accuracy": 0.2373543992638588, "num_tokens": 148674971.0, "step": 85710 }, { "entropy": 5.320564842224121, "epoch": 6.668897101731181, "grad_norm": 1.3359375, "learning_rate": 0.0001639399897945435, "loss": 4.5422, "mean_token_accuracy": 0.2542125850915909, "num_tokens": 148682857.0, "step": 85715 }, { "entropy": 5.427887678146362, "epoch": 6.669286131102898, "grad_norm": 1.4296875, "learning_rate": 0.00016391588669487526, "loss": 4.7451, "mean_token_accuracy": 0.23499433547258378, "num_tokens": 148692406.0, "step": 85720 }, { "entropy": 5.417051124572754, "epoch": 6.669675160474616, "grad_norm": 1.265625, "learning_rate": 0.00016389178528073152, "loss": 4.6291, "mean_token_accuracy": 0.2396501272916794, "num_tokens": 148700862.0, "step": 85725 }, { "entropy": 5.470126628875732, "epoch": 6.670064189846333, "grad_norm": 1.2265625, "learning_rate": 0.00016386768555247822, "loss": 4.7626, "mean_token_accuracy": 0.23526046127080918, "num_tokens": 148708877.0, "step": 85730 }, { "entropy": 5.419955205917359, "epoch": 6.670453219218051, "grad_norm": 1.2578125, "learning_rate": 0.00016384358751048085, "loss": 4.6513, "mean_token_accuracy": 0.24558581858873368, "num_tokens": 148717239.0, "step": 85735 }, { "entropy": 5.42053256034851, "epoch": 6.670842248589769, "grad_norm": 1.2734375, "learning_rate": 0.00016381949115510503, "loss": 4.6264, "mean_token_accuracy": 0.24132100343704224, "num_tokens": 148726146.0, "step": 85740 }, { "entropy": 5.442404413223267, "epoch": 6.671231277961486, "grad_norm": 1.3515625, "learning_rate": 0.00016379539648671659, "loss": 4.6653, "mean_token_accuracy": 0.23514719009399415, "num_tokens": 148734941.0, "step": 85745 }, { "entropy": 5.419620180130005, "epoch": 6.671620307333203, "grad_norm": 1.34375, "learning_rate": 0.00016377130350568093, "loss": 4.7596, "mean_token_accuracy": 0.2328447699546814, "num_tokens": 148743260.0, "step": 85750 }, { "entropy": 5.427387332916259, "epoch": 6.672009336704921, "grad_norm": 1.359375, "learning_rate": 0.00016374721221236376, "loss": 4.6744, "mean_token_accuracy": 0.24535293132066727, "num_tokens": 148752171.0, "step": 85755 }, { "entropy": 5.39915452003479, "epoch": 6.672398366076639, "grad_norm": 1.3671875, "learning_rate": 0.00016372312260713043, "loss": 4.6804, "mean_token_accuracy": 0.23130587190389634, "num_tokens": 148760703.0, "step": 85760 }, { "entropy": 5.395666217803955, "epoch": 6.672787395448356, "grad_norm": 1.3984375, "learning_rate": 0.00016369903469034674, "loss": 4.6381, "mean_token_accuracy": 0.23776402026414872, "num_tokens": 148769357.0, "step": 85765 }, { "entropy": 5.423109722137451, "epoch": 6.673176424820074, "grad_norm": 1.3203125, "learning_rate": 0.00016367494846237805, "loss": 4.6875, "mean_token_accuracy": 0.23275558948516845, "num_tokens": 148777528.0, "step": 85770 }, { "entropy": 5.421376371383667, "epoch": 6.673565454191792, "grad_norm": 1.4375, "learning_rate": 0.00016365086392358975, "loss": 4.733, "mean_token_accuracy": 0.23971307426691055, "num_tokens": 148786106.0, "step": 85775 }, { "entropy": 5.376003265380859, "epoch": 6.673954483563509, "grad_norm": 1.2578125, "learning_rate": 0.00016362678107434745, "loss": 4.6502, "mean_token_accuracy": 0.23705280423164368, "num_tokens": 148795263.0, "step": 85780 }, { "entropy": 5.298519659042358, "epoch": 6.674343512935227, "grad_norm": 1.359375, "learning_rate": 0.00016360269991501635, "loss": 4.5479, "mean_token_accuracy": 0.2490735098719597, "num_tokens": 148803861.0, "step": 85785 }, { "entropy": 5.358462190628051, "epoch": 6.674732542306944, "grad_norm": 1.3125, "learning_rate": 0.00016357862044596208, "loss": 4.6323, "mean_token_accuracy": 0.23823629021644593, "num_tokens": 148813023.0, "step": 85790 }, { "entropy": 5.373043489456177, "epoch": 6.675121571678662, "grad_norm": 1.2578125, "learning_rate": 0.0001635545426675498, "loss": 4.6461, "mean_token_accuracy": 0.24289888739585877, "num_tokens": 148821873.0, "step": 85795 }, { "entropy": 5.3703758239746096, "epoch": 6.675510601050379, "grad_norm": 1.2890625, "learning_rate": 0.0001635304665801451, "loss": 4.5889, "mean_token_accuracy": 0.2529910862445831, "num_tokens": 148831140.0, "step": 85800 }, { "entropy": 5.426456069946289, "epoch": 6.675899630422097, "grad_norm": 1.375, "learning_rate": 0.00016350639218411304, "loss": 4.5917, "mean_token_accuracy": 0.24542993903160096, "num_tokens": 148840217.0, "step": 85805 }, { "entropy": 5.319226551055908, "epoch": 6.676288659793815, "grad_norm": 1.390625, "learning_rate": 0.00016348231947981907, "loss": 4.5832, "mean_token_accuracy": 0.24326183646917343, "num_tokens": 148848837.0, "step": 85810 }, { "entropy": 5.346635580062866, "epoch": 6.6766776891655315, "grad_norm": 1.2890625, "learning_rate": 0.00016345824846762842, "loss": 4.6292, "mean_token_accuracy": 0.24182516038417817, "num_tokens": 148857478.0, "step": 85815 }, { "entropy": 5.368225336074829, "epoch": 6.677066718537249, "grad_norm": 1.3515625, "learning_rate": 0.0001634341791479062, "loss": 4.6273, "mean_token_accuracy": 0.24243911802768708, "num_tokens": 148865284.0, "step": 85820 }, { "entropy": 5.432206392288208, "epoch": 6.677455747908967, "grad_norm": 1.3671875, "learning_rate": 0.00016341011152101783, "loss": 4.7275, "mean_token_accuracy": 0.23467491269111634, "num_tokens": 148874134.0, "step": 85825 }, { "entropy": 5.385148620605468, "epoch": 6.677844777280685, "grad_norm": 1.21875, "learning_rate": 0.00016338604558732828, "loss": 4.6039, "mean_token_accuracy": 0.23824471831321717, "num_tokens": 148883070.0, "step": 85830 }, { "entropy": 5.346499490737915, "epoch": 6.678233806652402, "grad_norm": 1.171875, "learning_rate": 0.00016336198134720299, "loss": 4.6139, "mean_token_accuracy": 0.23946797847747803, "num_tokens": 148892093.0, "step": 85835 }, { "entropy": 5.411632537841797, "epoch": 6.67862283602412, "grad_norm": 1.578125, "learning_rate": 0.00016333791880100682, "loss": 4.7143, "mean_token_accuracy": 0.23436293452978135, "num_tokens": 148900450.0, "step": 85840 }, { "entropy": 5.387404060363769, "epoch": 6.679011865395838, "grad_norm": 1.2578125, "learning_rate": 0.00016331385794910515, "loss": 4.6635, "mean_token_accuracy": 0.24276360869407654, "num_tokens": 148909334.0, "step": 85845 }, { "entropy": 5.418674802780151, "epoch": 6.679400894767555, "grad_norm": 1.34375, "learning_rate": 0.00016328979879186284, "loss": 4.7416, "mean_token_accuracy": 0.22215415239334108, "num_tokens": 148918333.0, "step": 85850 }, { "entropy": 5.437266874313354, "epoch": 6.679789924139272, "grad_norm": 1.28125, "learning_rate": 0.000163265741329645, "loss": 4.7139, "mean_token_accuracy": 0.2301343098282814, "num_tokens": 148928211.0, "step": 85855 }, { "entropy": 5.4409264087677, "epoch": 6.68017895351099, "grad_norm": 1.2421875, "learning_rate": 0.00016324168556281678, "loss": 4.662, "mean_token_accuracy": 0.2368478611111641, "num_tokens": 148936870.0, "step": 85860 }, { "entropy": 5.389806652069092, "epoch": 6.680567982882708, "grad_norm": 1.3515625, "learning_rate": 0.000163217631491743, "loss": 4.672, "mean_token_accuracy": 0.23888297528028488, "num_tokens": 148945171.0, "step": 85865 }, { "entropy": 5.432330226898193, "epoch": 6.680957012254425, "grad_norm": 1.3984375, "learning_rate": 0.00016319357911678885, "loss": 4.6445, "mean_token_accuracy": 0.23784528225660323, "num_tokens": 148953607.0, "step": 85870 }, { "entropy": 5.335233736038208, "epoch": 6.681346041626143, "grad_norm": 1.3828125, "learning_rate": 0.000163169528438319, "loss": 4.5725, "mean_token_accuracy": 0.24724780768156052, "num_tokens": 148962611.0, "step": 85875 }, { "entropy": 5.366178369522094, "epoch": 6.681735070997861, "grad_norm": 1.4296875, "learning_rate": 0.00016314547945669872, "loss": 4.6726, "mean_token_accuracy": 0.23614899069070816, "num_tokens": 148970687.0, "step": 85880 }, { "entropy": 5.246035051345825, "epoch": 6.6821241003695775, "grad_norm": 1.375, "learning_rate": 0.0001631214321722927, "loss": 4.5004, "mean_token_accuracy": 0.25127984285354615, "num_tokens": 148979026.0, "step": 85885 }, { "entropy": 5.358155345916748, "epoch": 6.682513129741295, "grad_norm": 1.25, "learning_rate": 0.0001630973865854658, "loss": 4.6401, "mean_token_accuracy": 0.2361677184700966, "num_tokens": 148987533.0, "step": 85890 }, { "entropy": 5.3530029296875, "epoch": 6.682902159113013, "grad_norm": 1.328125, "learning_rate": 0.0001630733426965831, "loss": 4.638, "mean_token_accuracy": 0.24057910591363907, "num_tokens": 148996389.0, "step": 85895 }, { "entropy": 5.362461519241333, "epoch": 6.683291188484731, "grad_norm": 1.296875, "learning_rate": 0.00016304930050600915, "loss": 4.5832, "mean_token_accuracy": 0.24250404834747313, "num_tokens": 149004863.0, "step": 85900 }, { "entropy": 5.4327695846557615, "epoch": 6.683680217856448, "grad_norm": 1.265625, "learning_rate": 0.00016302526001410895, "loss": 4.7061, "mean_token_accuracy": 0.230624458193779, "num_tokens": 149013887.0, "step": 85905 }, { "entropy": 5.438835525512696, "epoch": 6.684069247228166, "grad_norm": 1.3125, "learning_rate": 0.00016300122122124712, "loss": 4.6904, "mean_token_accuracy": 0.23745026290416718, "num_tokens": 149022034.0, "step": 85910 }, { "entropy": 5.379136180877685, "epoch": 6.684458276599884, "grad_norm": 1.34375, "learning_rate": 0.0001629771841277886, "loss": 4.7018, "mean_token_accuracy": 0.2290496975183487, "num_tokens": 149030690.0, "step": 85915 }, { "entropy": 5.403381443023681, "epoch": 6.6848473059716005, "grad_norm": 1.296875, "learning_rate": 0.00016295314873409795, "loss": 4.6459, "mean_token_accuracy": 0.23669716268777846, "num_tokens": 149039414.0, "step": 85920 }, { "entropy": 5.38030424118042, "epoch": 6.685236335343318, "grad_norm": 1.3671875, "learning_rate": 0.00016292911504053997, "loss": 4.6919, "mean_token_accuracy": 0.241168549656868, "num_tokens": 149048044.0, "step": 85925 }, { "entropy": 5.3759987354278564, "epoch": 6.685625364715036, "grad_norm": 1.265625, "learning_rate": 0.00016290508304747932, "loss": 4.5754, "mean_token_accuracy": 0.24588843137025834, "num_tokens": 149056992.0, "step": 85930 }, { "entropy": 5.3843772411346436, "epoch": 6.686014394086754, "grad_norm": 1.296875, "learning_rate": 0.0001628810527552805, "loss": 4.6102, "mean_token_accuracy": 0.2502222806215286, "num_tokens": 149065070.0, "step": 85935 }, { "entropy": 5.398129892349243, "epoch": 6.686403423458471, "grad_norm": 1.375, "learning_rate": 0.00016285702416430836, "loss": 4.5734, "mean_token_accuracy": 0.25228031277656554, "num_tokens": 149073290.0, "step": 85940 }, { "entropy": 5.398529815673828, "epoch": 6.686792452830189, "grad_norm": 1.1875, "learning_rate": 0.0001628329972749273, "loss": 4.664, "mean_token_accuracy": 0.23920369744300843, "num_tokens": 149081739.0, "step": 85945 }, { "entropy": 5.37217493057251, "epoch": 6.687181482201906, "grad_norm": 1.2734375, "learning_rate": 0.000162808972087502, "loss": 4.6423, "mean_token_accuracy": 0.24132792204618453, "num_tokens": 149090392.0, "step": 85950 }, { "entropy": 5.308342313766479, "epoch": 6.6875705115736235, "grad_norm": 1.2578125, "learning_rate": 0.00016278494860239696, "loss": 4.5404, "mean_token_accuracy": 0.24768907725811004, "num_tokens": 149098903.0, "step": 85955 }, { "entropy": 5.370001363754272, "epoch": 6.687959540945341, "grad_norm": 1.40625, "learning_rate": 0.00016276092681997666, "loss": 4.7397, "mean_token_accuracy": 0.23736969530582427, "num_tokens": 149107935.0, "step": 85960 }, { "entropy": 5.313495731353759, "epoch": 6.688348570317059, "grad_norm": 1.375, "learning_rate": 0.00016273690674060583, "loss": 4.5459, "mean_token_accuracy": 0.2537378206849098, "num_tokens": 149116384.0, "step": 85965 }, { "entropy": 5.3542193412780765, "epoch": 6.688737599688777, "grad_norm": 1.25, "learning_rate": 0.0001627128883646486, "loss": 4.6013, "mean_token_accuracy": 0.24025869518518447, "num_tokens": 149124316.0, "step": 85970 }, { "entropy": 5.389502477645874, "epoch": 6.689126629060494, "grad_norm": 1.296875, "learning_rate": 0.00016268887169246964, "loss": 4.6304, "mean_token_accuracy": 0.23938551545143127, "num_tokens": 149133555.0, "step": 85975 }, { "entropy": 5.401685571670532, "epoch": 6.689515658432212, "grad_norm": 1.328125, "learning_rate": 0.00016266485672443323, "loss": 4.6523, "mean_token_accuracy": 0.237826144695282, "num_tokens": 149142067.0, "step": 85980 }, { "entropy": 5.445377922058105, "epoch": 6.68990468780393, "grad_norm": 1.390625, "learning_rate": 0.0001626408434609039, "loss": 4.6876, "mean_token_accuracy": 0.2407173901796341, "num_tokens": 149150208.0, "step": 85985 }, { "entropy": 5.379765510559082, "epoch": 6.6902937171756465, "grad_norm": 1.234375, "learning_rate": 0.00016261683190224585, "loss": 4.6337, "mean_token_accuracy": 0.24098272919654845, "num_tokens": 149159221.0, "step": 85990 }, { "entropy": 5.372735071182251, "epoch": 6.690682746547364, "grad_norm": 1.34375, "learning_rate": 0.00016259282204882358, "loss": 4.5571, "mean_token_accuracy": 0.250486795604229, "num_tokens": 149167180.0, "step": 85995 }, { "entropy": 5.4077043533325195, "epoch": 6.691071775919082, "grad_norm": 1.2890625, "learning_rate": 0.00016256881390100123, "loss": 4.6849, "mean_token_accuracy": 0.23053427338600158, "num_tokens": 149175654.0, "step": 86000 }, { "entropy": 5.312512636184692, "epoch": 6.6914608052908, "grad_norm": 1.265625, "learning_rate": 0.00016254480745914326, "loss": 4.6118, "mean_token_accuracy": 0.24819298535585405, "num_tokens": 149184748.0, "step": 86005 }, { "entropy": 5.354326486587524, "epoch": 6.691849834662517, "grad_norm": 1.21875, "learning_rate": 0.00016252080272361385, "loss": 4.5854, "mean_token_accuracy": 0.2381861314177513, "num_tokens": 149193747.0, "step": 86010 }, { "entropy": 5.507125616073608, "epoch": 6.692238864034235, "grad_norm": 1.3125, "learning_rate": 0.00016249679969477715, "loss": 4.7088, "mean_token_accuracy": 0.23161526620388032, "num_tokens": 149202330.0, "step": 86015 }, { "entropy": 5.38338680267334, "epoch": 6.692627893405952, "grad_norm": 1.2421875, "learning_rate": 0.00016247279837299755, "loss": 4.589, "mean_token_accuracy": 0.24806948006153107, "num_tokens": 149210757.0, "step": 86020 }, { "entropy": 5.3589647769927975, "epoch": 6.6930169227776695, "grad_norm": 1.328125, "learning_rate": 0.00016244879875863894, "loss": 4.6163, "mean_token_accuracy": 0.2430060788989067, "num_tokens": 149218784.0, "step": 86025 }, { "entropy": 5.253366565704345, "epoch": 6.693405952149387, "grad_norm": 1.34375, "learning_rate": 0.00016242480085206583, "loss": 4.4951, "mean_token_accuracy": 0.2550062254071236, "num_tokens": 149226954.0, "step": 86030 }, { "entropy": 5.332148170471191, "epoch": 6.693794981521105, "grad_norm": 1.4140625, "learning_rate": 0.0001624008046536422, "loss": 4.5945, "mean_token_accuracy": 0.24648851603269578, "num_tokens": 149235385.0, "step": 86035 }, { "entropy": 5.392679500579834, "epoch": 6.694184010892823, "grad_norm": 1.34375, "learning_rate": 0.00016237681016373205, "loss": 4.6719, "mean_token_accuracy": 0.24645027369260789, "num_tokens": 149244357.0, "step": 86040 }, { "entropy": 5.387827634811401, "epoch": 6.69457304026454, "grad_norm": 1.4140625, "learning_rate": 0.0001623528173826996, "loss": 4.6405, "mean_token_accuracy": 0.24245555698871613, "num_tokens": 149253118.0, "step": 86045 }, { "entropy": 5.320360231399536, "epoch": 6.694962069636258, "grad_norm": 1.203125, "learning_rate": 0.00016232882631090877, "loss": 4.5018, "mean_token_accuracy": 0.2471695899963379, "num_tokens": 149262388.0, "step": 86050 }, { "entropy": 5.3258678913116455, "epoch": 6.695351099007975, "grad_norm": 1.34375, "learning_rate": 0.00016230483694872384, "loss": 4.5682, "mean_token_accuracy": 0.24792979955673217, "num_tokens": 149270264.0, "step": 86055 }, { "entropy": 5.285712671279907, "epoch": 6.6957401283796925, "grad_norm": 1.2734375, "learning_rate": 0.00016228084929650847, "loss": 4.6234, "mean_token_accuracy": 0.24342343658208848, "num_tokens": 149279331.0, "step": 86060 }, { "entropy": 5.402322435379029, "epoch": 6.69612915775141, "grad_norm": 1.328125, "learning_rate": 0.0001622568633546269, "loss": 4.6747, "mean_token_accuracy": 0.23903605043888093, "num_tokens": 149288391.0, "step": 86065 }, { "entropy": 5.39708948135376, "epoch": 6.696518187123128, "grad_norm": 1.375, "learning_rate": 0.0001622328791234429, "loss": 4.6023, "mean_token_accuracy": 0.24187932312488555, "num_tokens": 149297067.0, "step": 86070 }, { "entropy": 5.382947158813477, "epoch": 6.6969072164948455, "grad_norm": 1.2890625, "learning_rate": 0.00016220889660332054, "loss": 4.6348, "mean_token_accuracy": 0.24589806497097016, "num_tokens": 149306223.0, "step": 86075 }, { "entropy": 5.402849960327148, "epoch": 6.697296245866563, "grad_norm": 1.328125, "learning_rate": 0.00016218491579462357, "loss": 4.6841, "mean_token_accuracy": 0.24375319182872773, "num_tokens": 149315283.0, "step": 86080 }, { "entropy": 5.368256282806397, "epoch": 6.69768527523828, "grad_norm": 1.3671875, "learning_rate": 0.00016216093669771603, "loss": 4.5991, "mean_token_accuracy": 0.2439291626214981, "num_tokens": 149323212.0, "step": 86085 }, { "entropy": 5.421236133575439, "epoch": 6.698074304609998, "grad_norm": 1.4375, "learning_rate": 0.00016213695931296157, "loss": 4.7446, "mean_token_accuracy": 0.23276620209217072, "num_tokens": 149331609.0, "step": 86090 }, { "entropy": 5.409360361099243, "epoch": 6.6984633339817155, "grad_norm": 1.4609375, "learning_rate": 0.00016211298364072417, "loss": 4.7125, "mean_token_accuracy": 0.2296522468328476, "num_tokens": 149340182.0, "step": 86095 }, { "entropy": 5.418511486053466, "epoch": 6.698852363353433, "grad_norm": 1.1796875, "learning_rate": 0.00016208900968136758, "loss": 4.7145, "mean_token_accuracy": 0.23892219960689545, "num_tokens": 149349739.0, "step": 86100 }, { "entropy": 5.4192602157592775, "epoch": 6.699241392725151, "grad_norm": 1.2265625, "learning_rate": 0.00016206503743525553, "loss": 4.7012, "mean_token_accuracy": 0.23899112790822982, "num_tokens": 149358706.0, "step": 86105 }, { "entropy": 5.390712738037109, "epoch": 6.6996304220968685, "grad_norm": 1.3359375, "learning_rate": 0.00016204106690275184, "loss": 4.6913, "mean_token_accuracy": 0.2354682594537735, "num_tokens": 149367341.0, "step": 86110 }, { "entropy": 5.29554123878479, "epoch": 6.700019451468586, "grad_norm": 1.34375, "learning_rate": 0.00016201709808422017, "loss": 4.52, "mean_token_accuracy": 0.2510311409831047, "num_tokens": 149375813.0, "step": 86115 }, { "entropy": 5.359553718566895, "epoch": 6.700408480840304, "grad_norm": 1.3203125, "learning_rate": 0.00016199313098002411, "loss": 4.6276, "mean_token_accuracy": 0.2417372062802315, "num_tokens": 149384780.0, "step": 86120 }, { "entropy": 5.3716155052185055, "epoch": 6.700797510212021, "grad_norm": 1.390625, "learning_rate": 0.0001619691655905275, "loss": 4.5831, "mean_token_accuracy": 0.2404239609837532, "num_tokens": 149393519.0, "step": 86125 }, { "entropy": 5.410480260848999, "epoch": 6.701186539583738, "grad_norm": 1.3984375, "learning_rate": 0.0001619452019160938, "loss": 4.6165, "mean_token_accuracy": 0.24483379125595092, "num_tokens": 149401328.0, "step": 86130 }, { "entropy": 5.436933135986328, "epoch": 6.701575568955456, "grad_norm": 1.390625, "learning_rate": 0.00016192123995708684, "loss": 4.6834, "mean_token_accuracy": 0.2423110470175743, "num_tokens": 149409737.0, "step": 86135 }, { "entropy": 5.429930210113525, "epoch": 6.701964598327174, "grad_norm": 1.2578125, "learning_rate": 0.00016189727971386997, "loss": 4.722, "mean_token_accuracy": 0.2287255823612213, "num_tokens": 149418030.0, "step": 86140 }, { "entropy": 5.392004156112671, "epoch": 6.7023536276988915, "grad_norm": 1.3671875, "learning_rate": 0.00016187332118680696, "loss": 4.6323, "mean_token_accuracy": 0.24038649201393128, "num_tokens": 149426387.0, "step": 86145 }, { "entropy": 5.309703254699707, "epoch": 6.702742657070608, "grad_norm": 1.3203125, "learning_rate": 0.00016184936437626114, "loss": 4.5494, "mean_token_accuracy": 0.24159204214811325, "num_tokens": 149434656.0, "step": 86150 }, { "entropy": 5.306029796600342, "epoch": 6.703131686442326, "grad_norm": 1.265625, "learning_rate": 0.00016182540928259609, "loss": 4.5843, "mean_token_accuracy": 0.2345937192440033, "num_tokens": 149443445.0, "step": 86155 }, { "entropy": 5.351042079925537, "epoch": 6.703520715814044, "grad_norm": 1.3203125, "learning_rate": 0.00016180145590617546, "loss": 4.5614, "mean_token_accuracy": 0.24590293169021607, "num_tokens": 149452262.0, "step": 86160 }, { "entropy": 5.368657875061035, "epoch": 6.703909745185761, "grad_norm": 1.375, "learning_rate": 0.00016177750424736242, "loss": 4.6734, "mean_token_accuracy": 0.23903552293777466, "num_tokens": 149460480.0, "step": 86165 }, { "entropy": 5.28786187171936, "epoch": 6.704298774557479, "grad_norm": 1.265625, "learning_rate": 0.00016175355430652065, "loss": 4.5946, "mean_token_accuracy": 0.25015025585889816, "num_tokens": 149469729.0, "step": 86170 }, { "entropy": 5.3523763656616214, "epoch": 6.704687803929197, "grad_norm": 1.2890625, "learning_rate": 0.00016172960608401338, "loss": 4.58, "mean_token_accuracy": 0.2507786974310875, "num_tokens": 149478200.0, "step": 86175 }, { "entropy": 5.389894676208496, "epoch": 6.7050768333009145, "grad_norm": 1.4140625, "learning_rate": 0.00016170565958020412, "loss": 4.6707, "mean_token_accuracy": 0.2401902422308922, "num_tokens": 149486746.0, "step": 86180 }, { "entropy": 5.292961311340332, "epoch": 6.705465862672632, "grad_norm": 1.234375, "learning_rate": 0.00016168171479545606, "loss": 4.5446, "mean_token_accuracy": 0.2491212472319603, "num_tokens": 149495550.0, "step": 86185 }, { "entropy": 5.359263372421265, "epoch": 6.705854892044349, "grad_norm": 1.3828125, "learning_rate": 0.00016165777173013273, "loss": 4.7099, "mean_token_accuracy": 0.23626141846179963, "num_tokens": 149503950.0, "step": 86190 }, { "entropy": 5.292845630645752, "epoch": 6.706243921416067, "grad_norm": 1.203125, "learning_rate": 0.00016163383038459727, "loss": 4.5404, "mean_token_accuracy": 0.2490392580628395, "num_tokens": 149512197.0, "step": 86195 }, { "entropy": 5.331468534469605, "epoch": 6.706632950787784, "grad_norm": 1.3828125, "learning_rate": 0.00016160989075921295, "loss": 4.5823, "mean_token_accuracy": 0.24503006935119628, "num_tokens": 149520663.0, "step": 86200 }, { "entropy": 5.3185656547546385, "epoch": 6.707021980159502, "grad_norm": 1.3046875, "learning_rate": 0.00016158595285434307, "loss": 4.5664, "mean_token_accuracy": 0.24595999121665954, "num_tokens": 149529020.0, "step": 86205 }, { "entropy": 5.325, "epoch": 6.70741100953122, "grad_norm": 1.328125, "learning_rate": 0.00016156201667035083, "loss": 4.5931, "mean_token_accuracy": 0.23842764496803284, "num_tokens": 149537945.0, "step": 86210 }, { "entropy": 5.338918876647949, "epoch": 6.7078000389029375, "grad_norm": 1.28125, "learning_rate": 0.00016153808220759948, "loss": 4.631, "mean_token_accuracy": 0.24312269538640977, "num_tokens": 149546395.0, "step": 86215 }, { "entropy": 5.330662250518799, "epoch": 6.708189068274654, "grad_norm": 1.328125, "learning_rate": 0.00016151414946645205, "loss": 4.6037, "mean_token_accuracy": 0.2547203108668327, "num_tokens": 149555131.0, "step": 86220 }, { "entropy": 5.357038497924805, "epoch": 6.708578097646372, "grad_norm": 1.2734375, "learning_rate": 0.0001614902184472718, "loss": 4.6225, "mean_token_accuracy": 0.24005321711301802, "num_tokens": 149564735.0, "step": 86225 }, { "entropy": 5.446113872528076, "epoch": 6.70896712701809, "grad_norm": 1.3515625, "learning_rate": 0.0001614662891504219, "loss": 4.6374, "mean_token_accuracy": 0.23702000826597214, "num_tokens": 149573210.0, "step": 86230 }, { "entropy": 5.383820390701294, "epoch": 6.709356156389807, "grad_norm": 1.3125, "learning_rate": 0.00016144236157626524, "loss": 4.6581, "mean_token_accuracy": 0.23509249687194825, "num_tokens": 149582385.0, "step": 86235 }, { "entropy": 5.383309412002563, "epoch": 6.709745185761525, "grad_norm": 1.3359375, "learning_rate": 0.00016141843572516507, "loss": 4.6081, "mean_token_accuracy": 0.240153968334198, "num_tokens": 149590967.0, "step": 86240 }, { "entropy": 5.321812725067138, "epoch": 6.710134215133243, "grad_norm": 1.3359375, "learning_rate": 0.0001613945115974843, "loss": 4.5504, "mean_token_accuracy": 0.25157203525304794, "num_tokens": 149599613.0, "step": 86245 }, { "entropy": 5.47669358253479, "epoch": 6.7105232445049605, "grad_norm": 1.3046875, "learning_rate": 0.00016137058919358607, "loss": 4.8016, "mean_token_accuracy": 0.23862560242414474, "num_tokens": 149607900.0, "step": 86250 }, { "entropy": 5.3992087841033936, "epoch": 6.710912273876677, "grad_norm": 1.3125, "learning_rate": 0.00016134666851383322, "loss": 4.6278, "mean_token_accuracy": 0.2462398052215576, "num_tokens": 149616443.0, "step": 86255 }, { "entropy": 5.424568796157837, "epoch": 6.711301303248395, "grad_norm": 1.34375, "learning_rate": 0.00016132274955858882, "loss": 4.6863, "mean_token_accuracy": 0.23676442950963975, "num_tokens": 149624962.0, "step": 86260 }, { "entropy": 5.428032493591308, "epoch": 6.711690332620113, "grad_norm": 1.3359375, "learning_rate": 0.00016129883232821575, "loss": 4.6669, "mean_token_accuracy": 0.23936725854873658, "num_tokens": 149634345.0, "step": 86265 }, { "entropy": 5.38296799659729, "epoch": 6.71207936199183, "grad_norm": 1.3828125, "learning_rate": 0.00016127491682307694, "loss": 4.682, "mean_token_accuracy": 0.24103991985321044, "num_tokens": 149643514.0, "step": 86270 }, { "entropy": 5.505573654174805, "epoch": 6.712468391363548, "grad_norm": 1.2734375, "learning_rate": 0.00016125100304353526, "loss": 4.808, "mean_token_accuracy": 0.2274618476629257, "num_tokens": 149652298.0, "step": 86275 }, { "entropy": 5.346088886260986, "epoch": 6.712857420735266, "grad_norm": 1.40625, "learning_rate": 0.00016122709098995353, "loss": 4.515, "mean_token_accuracy": 0.25398640632629393, "num_tokens": 149660483.0, "step": 86280 }, { "entropy": 5.446690416336059, "epoch": 6.713246450106983, "grad_norm": 1.3984375, "learning_rate": 0.00016120318066269464, "loss": 4.7529, "mean_token_accuracy": 0.2384564146399498, "num_tokens": 149669726.0, "step": 86285 }, { "entropy": 5.401085615158081, "epoch": 6.7136354794787, "grad_norm": 1.3125, "learning_rate": 0.0001611792720621212, "loss": 4.6738, "mean_token_accuracy": 0.2367143377661705, "num_tokens": 149678521.0, "step": 86290 }, { "entropy": 5.361565685272216, "epoch": 6.714024508850418, "grad_norm": 1.2890625, "learning_rate": 0.0001611553651885963, "loss": 4.6054, "mean_token_accuracy": 0.24224963188171386, "num_tokens": 149687217.0, "step": 86295 }, { "entropy": 5.337229824066162, "epoch": 6.714413538222136, "grad_norm": 1.28125, "learning_rate": 0.00016113146004248247, "loss": 4.6251, "mean_token_accuracy": 0.23943732529878617, "num_tokens": 149696274.0, "step": 86300 }, { "entropy": 5.446482086181641, "epoch": 6.714802567593853, "grad_norm": 1.3828125, "learning_rate": 0.00016110755662414257, "loss": 4.7229, "mean_token_accuracy": 0.2374487563967705, "num_tokens": 149704446.0, "step": 86305 }, { "entropy": 5.425869703292847, "epoch": 6.715191596965571, "grad_norm": 1.421875, "learning_rate": 0.00016108365493393924, "loss": 4.6713, "mean_token_accuracy": 0.24062672406435012, "num_tokens": 149712640.0, "step": 86310 }, { "entropy": 5.426177597045898, "epoch": 6.715580626337289, "grad_norm": 1.28125, "learning_rate": 0.000161059754972235, "loss": 4.7074, "mean_token_accuracy": 0.23139062523841858, "num_tokens": 149720937.0, "step": 86315 }, { "entropy": 5.429522752761841, "epoch": 6.7159696557090065, "grad_norm": 1.3359375, "learning_rate": 0.00016103585673939275, "loss": 4.707, "mean_token_accuracy": 0.23763195872306825, "num_tokens": 149729337.0, "step": 86320 }, { "entropy": 5.410010576248169, "epoch": 6.716358685080723, "grad_norm": 1.4296875, "learning_rate": 0.00016101196023577487, "loss": 4.651, "mean_token_accuracy": 0.24321259409189225, "num_tokens": 149737842.0, "step": 86325 }, { "entropy": 5.297318696975708, "epoch": 6.716747714452441, "grad_norm": 1.34375, "learning_rate": 0.00016098806546174416, "loss": 4.549, "mean_token_accuracy": 0.2521692648530006, "num_tokens": 149747319.0, "step": 86330 }, { "entropy": 5.309335565567016, "epoch": 6.717136743824159, "grad_norm": 1.2734375, "learning_rate": 0.00016096417241766298, "loss": 4.5255, "mean_token_accuracy": 0.2524402871727943, "num_tokens": 149755895.0, "step": 86335 }, { "entropy": 5.344257545471192, "epoch": 6.717525773195876, "grad_norm": 1.3046875, "learning_rate": 0.00016094028110389408, "loss": 4.6593, "mean_token_accuracy": 0.2338498279452324, "num_tokens": 149764885.0, "step": 86340 }, { "entropy": 5.285638332366943, "epoch": 6.717914802567594, "grad_norm": 1.359375, "learning_rate": 0.0001609163915207998, "loss": 4.534, "mean_token_accuracy": 0.25285124182701113, "num_tokens": 149773877.0, "step": 86345 }, { "entropy": 5.3193916320800785, "epoch": 6.718303831939312, "grad_norm": 1.296875, "learning_rate": 0.00016089250366874274, "loss": 4.625, "mean_token_accuracy": 0.23865541368722915, "num_tokens": 149782761.0, "step": 86350 }, { "entropy": 5.43023910522461, "epoch": 6.718692861311029, "grad_norm": 1.2890625, "learning_rate": 0.00016086861754808525, "loss": 4.6994, "mean_token_accuracy": 0.23718641996383666, "num_tokens": 149791457.0, "step": 86355 }, { "entropy": 5.353921794891358, "epoch": 6.719081890682746, "grad_norm": 1.2109375, "learning_rate": 0.00016084473315918985, "loss": 4.6278, "mean_token_accuracy": 0.2463632345199585, "num_tokens": 149800308.0, "step": 86360 }, { "entropy": 5.514244604110718, "epoch": 6.719470920054464, "grad_norm": 1.3828125, "learning_rate": 0.00016082085050241898, "loss": 4.8226, "mean_token_accuracy": 0.23010505139827728, "num_tokens": 149808875.0, "step": 86365 }, { "entropy": 5.385243082046509, "epoch": 6.719859949426182, "grad_norm": 1.2734375, "learning_rate": 0.00016079696957813493, "loss": 4.5596, "mean_token_accuracy": 0.2492030069231987, "num_tokens": 149817580.0, "step": 86370 }, { "entropy": 5.382873773574829, "epoch": 6.720248978797899, "grad_norm": 1.1640625, "learning_rate": 0.00016077309038670012, "loss": 4.6563, "mean_token_accuracy": 0.23919832855463027, "num_tokens": 149826188.0, "step": 86375 }, { "entropy": 5.374216318130493, "epoch": 6.720638008169617, "grad_norm": 1.3125, "learning_rate": 0.00016074921292847684, "loss": 4.6322, "mean_token_accuracy": 0.2425265282392502, "num_tokens": 149835306.0, "step": 86380 }, { "entropy": 5.416077947616577, "epoch": 6.721027037541335, "grad_norm": 1.28125, "learning_rate": 0.00016072533720382743, "loss": 4.7322, "mean_token_accuracy": 0.231866317987442, "num_tokens": 149843750.0, "step": 86385 }, { "entropy": 5.344777393341064, "epoch": 6.721416066913052, "grad_norm": 1.3828125, "learning_rate": 0.00016070146321311415, "loss": 4.6471, "mean_token_accuracy": 0.2441350057721138, "num_tokens": 149852277.0, "step": 86390 }, { "entropy": 5.382677030563355, "epoch": 6.721805096284769, "grad_norm": 1.3984375, "learning_rate": 0.00016067759095669918, "loss": 4.6344, "mean_token_accuracy": 0.2446226716041565, "num_tokens": 149860608.0, "step": 86395 }, { "entropy": 5.4161317348480225, "epoch": 6.722194125656487, "grad_norm": 1.2890625, "learning_rate": 0.00016065372043494485, "loss": 4.6617, "mean_token_accuracy": 0.24298195540905, "num_tokens": 149868943.0, "step": 86400 }, { "entropy": 5.392434310913086, "epoch": 6.722583155028205, "grad_norm": 1.3515625, "learning_rate": 0.00016062985164821327, "loss": 4.6821, "mean_token_accuracy": 0.23374230563640594, "num_tokens": 149877907.0, "step": 86405 }, { "entropy": 5.352866983413696, "epoch": 6.722972184399922, "grad_norm": 1.3203125, "learning_rate": 0.0001606059845968667, "loss": 4.5772, "mean_token_accuracy": 0.24947873800992965, "num_tokens": 149886360.0, "step": 86410 }, { "entropy": 5.460223627090454, "epoch": 6.72336121377164, "grad_norm": 1.421875, "learning_rate": 0.0001605821192812672, "loss": 4.7749, "mean_token_accuracy": 0.23298993706703186, "num_tokens": 149894934.0, "step": 86415 }, { "entropy": 5.379236173629761, "epoch": 6.723750243143357, "grad_norm": 1.3515625, "learning_rate": 0.00016055825570177688, "loss": 4.6193, "mean_token_accuracy": 0.24513702988624572, "num_tokens": 149903274.0, "step": 86420 }, { "entropy": 5.326455354690552, "epoch": 6.724139272515075, "grad_norm": 1.296875, "learning_rate": 0.000160534393858758, "loss": 4.6098, "mean_token_accuracy": 0.24296549707651138, "num_tokens": 149911966.0, "step": 86425 }, { "entropy": 5.420417547225952, "epoch": 6.724528301886792, "grad_norm": 1.2578125, "learning_rate": 0.00016051053375257238, "loss": 4.6833, "mean_token_accuracy": 0.2304786503314972, "num_tokens": 149920337.0, "step": 86430 }, { "entropy": 5.329885959625244, "epoch": 6.72491733125851, "grad_norm": 1.4921875, "learning_rate": 0.0001604866753835823, "loss": 4.6031, "mean_token_accuracy": 0.24465828835964204, "num_tokens": 149929280.0, "step": 86435 }, { "entropy": 5.306013727188111, "epoch": 6.725306360630228, "grad_norm": 1.3515625, "learning_rate": 0.00016046281875214952, "loss": 4.5542, "mean_token_accuracy": 0.24593015164136886, "num_tokens": 149937773.0, "step": 86440 }, { "entropy": 5.447704553604126, "epoch": 6.725695390001945, "grad_norm": 1.3125, "learning_rate": 0.0001604389638586363, "loss": 4.7621, "mean_token_accuracy": 0.23206159919500352, "num_tokens": 149946557.0, "step": 86445 }, { "entropy": 5.372105455398559, "epoch": 6.726084419373663, "grad_norm": 1.3125, "learning_rate": 0.00016041511070340433, "loss": 4.5563, "mean_token_accuracy": 0.2557765647768974, "num_tokens": 149955346.0, "step": 86450 }, { "entropy": 5.410490369796753, "epoch": 6.72647344874538, "grad_norm": 1.375, "learning_rate": 0.0001603912592868158, "loss": 4.6701, "mean_token_accuracy": 0.24037319123744966, "num_tokens": 149964097.0, "step": 86455 }, { "entropy": 5.43944411277771, "epoch": 6.726862478117098, "grad_norm": 1.3984375, "learning_rate": 0.00016036740960923237, "loss": 4.7067, "mean_token_accuracy": 0.23584576398134233, "num_tokens": 149973355.0, "step": 86460 }, { "entropy": 5.4766068935394285, "epoch": 6.727251507488815, "grad_norm": 1.4609375, "learning_rate": 0.00016034356167101617, "loss": 4.7104, "mean_token_accuracy": 0.24522684067487716, "num_tokens": 149981280.0, "step": 86465 }, { "entropy": 5.420857572555542, "epoch": 6.727640536860533, "grad_norm": 1.34375, "learning_rate": 0.00016031971547252887, "loss": 4.7237, "mean_token_accuracy": 0.2279752567410469, "num_tokens": 149990261.0, "step": 86470 }, { "entropy": 5.40521092414856, "epoch": 6.728029566232251, "grad_norm": 1.3046875, "learning_rate": 0.00016029587101413232, "loss": 4.6498, "mean_token_accuracy": 0.24155280590057374, "num_tokens": 149999636.0, "step": 86475 }, { "entropy": 5.3785608291625975, "epoch": 6.728418595603968, "grad_norm": 1.28125, "learning_rate": 0.00016027202829618846, "loss": 4.6335, "mean_token_accuracy": 0.24292868375778198, "num_tokens": 150008095.0, "step": 86480 }, { "entropy": 5.432597017288208, "epoch": 6.728807624975685, "grad_norm": 1.34375, "learning_rate": 0.00016024818731905882, "loss": 4.735, "mean_token_accuracy": 0.23055571019649507, "num_tokens": 150017294.0, "step": 86485 }, { "entropy": 5.371450281143188, "epoch": 6.729196654347403, "grad_norm": 1.296875, "learning_rate": 0.00016022434808310532, "loss": 4.6697, "mean_token_accuracy": 0.24857214391231536, "num_tokens": 150026686.0, "step": 86490 }, { "entropy": 5.386080074310303, "epoch": 6.729585683719121, "grad_norm": 1.421875, "learning_rate": 0.00016020051058868973, "loss": 4.6339, "mean_token_accuracy": 0.23878349661827086, "num_tokens": 150034691.0, "step": 86495 }, { "entropy": 5.5105753421783445, "epoch": 6.729974713090838, "grad_norm": 1.421875, "learning_rate": 0.0001601766748361736, "loss": 4.7967, "mean_token_accuracy": 0.22429289817810058, "num_tokens": 150043697.0, "step": 86500 }, { "entropy": 5.3892487525939945, "epoch": 6.730363742462556, "grad_norm": 1.25, "learning_rate": 0.00016015284082591873, "loss": 4.5944, "mean_token_accuracy": 0.2458995684981346, "num_tokens": 150052376.0, "step": 86505 }, { "entropy": 5.357676601409912, "epoch": 6.730752771834274, "grad_norm": 1.3359375, "learning_rate": 0.0001601290085582866, "loss": 4.646, "mean_token_accuracy": 0.2475430577993393, "num_tokens": 150060649.0, "step": 86510 }, { "entropy": 5.356394529342651, "epoch": 6.731141801205991, "grad_norm": 1.421875, "learning_rate": 0.00016010517803363906, "loss": 4.6972, "mean_token_accuracy": 0.2411485195159912, "num_tokens": 150069628.0, "step": 86515 }, { "entropy": 5.384897661209107, "epoch": 6.731530830577709, "grad_norm": 1.359375, "learning_rate": 0.00016008134925233746, "loss": 4.5721, "mean_token_accuracy": 0.24705778807401657, "num_tokens": 150077755.0, "step": 86520 }, { "entropy": 5.3270580768585205, "epoch": 6.731919859949426, "grad_norm": 1.3515625, "learning_rate": 0.00016005752221474358, "loss": 4.6633, "mean_token_accuracy": 0.24160715639591218, "num_tokens": 150086629.0, "step": 86525 }, { "entropy": 5.333341836929321, "epoch": 6.732308889321144, "grad_norm": 1.2734375, "learning_rate": 0.00016003369692121875, "loss": 4.5703, "mean_token_accuracy": 0.24427866339683532, "num_tokens": 150095566.0, "step": 86530 }, { "entropy": 5.350177526473999, "epoch": 6.732697918692861, "grad_norm": 1.3828125, "learning_rate": 0.0001600098733721247, "loss": 4.6146, "mean_token_accuracy": 0.24128673374652862, "num_tokens": 150103655.0, "step": 86535 }, { "entropy": 5.44404411315918, "epoch": 6.733086948064579, "grad_norm": 1.3515625, "learning_rate": 0.00015998605156782264, "loss": 4.7254, "mean_token_accuracy": 0.23471633046865464, "num_tokens": 150112181.0, "step": 86540 }, { "entropy": 5.377424907684326, "epoch": 6.733475977436297, "grad_norm": 1.296875, "learning_rate": 0.00015996223150867428, "loss": 4.5735, "mean_token_accuracy": 0.2504995182156563, "num_tokens": 150120356.0, "step": 86545 }, { "entropy": 5.40149073600769, "epoch": 6.733865006808014, "grad_norm": 1.328125, "learning_rate": 0.00015993841319504102, "loss": 4.6564, "mean_token_accuracy": 0.2435891568660736, "num_tokens": 150129534.0, "step": 86550 }, { "entropy": 5.396664428710937, "epoch": 6.734254036179731, "grad_norm": 1.2421875, "learning_rate": 0.00015991459662728397, "loss": 4.6296, "mean_token_accuracy": 0.24603921920061111, "num_tokens": 150138389.0, "step": 86555 }, { "entropy": 5.34764666557312, "epoch": 6.734643065551449, "grad_norm": 1.375, "learning_rate": 0.00015989078180576495, "loss": 4.6085, "mean_token_accuracy": 0.2427228569984436, "num_tokens": 150147274.0, "step": 86560 }, { "entropy": 5.3338817119598385, "epoch": 6.735032094923167, "grad_norm": 1.296875, "learning_rate": 0.000159866968730845, "loss": 4.5508, "mean_token_accuracy": 0.2453005999326706, "num_tokens": 150156021.0, "step": 86565 }, { "entropy": 5.381415462493896, "epoch": 6.735421124294884, "grad_norm": 1.4453125, "learning_rate": 0.00015984315740288563, "loss": 4.6109, "mean_token_accuracy": 0.23591403067111968, "num_tokens": 150164333.0, "step": 86570 }, { "entropy": 5.326209449768067, "epoch": 6.735810153666602, "grad_norm": 1.2734375, "learning_rate": 0.00015981934782224806, "loss": 4.6322, "mean_token_accuracy": 0.2367313414812088, "num_tokens": 150172443.0, "step": 86575 }, { "entropy": 5.379416131973267, "epoch": 6.73619918303832, "grad_norm": 1.328125, "learning_rate": 0.00015979553998929347, "loss": 4.695, "mean_token_accuracy": 0.2343272313475609, "num_tokens": 150181011.0, "step": 86580 }, { "entropy": 5.427183437347412, "epoch": 6.736588212410037, "grad_norm": 1.3515625, "learning_rate": 0.00015977173390438327, "loss": 4.6929, "mean_token_accuracy": 0.2360092356801033, "num_tokens": 150189818.0, "step": 86585 }, { "entropy": 5.2997931957244875, "epoch": 6.736977241781754, "grad_norm": 1.40625, "learning_rate": 0.00015974792956787852, "loss": 4.5588, "mean_token_accuracy": 0.2540013715624809, "num_tokens": 150198399.0, "step": 86590 }, { "entropy": 5.3360926628112795, "epoch": 6.737366271153472, "grad_norm": 1.2578125, "learning_rate": 0.0001597241269801406, "loss": 4.5864, "mean_token_accuracy": 0.24660884886980056, "num_tokens": 150208095.0, "step": 86595 }, { "entropy": 5.365523481369019, "epoch": 6.73775530052519, "grad_norm": 1.375, "learning_rate": 0.00015970032614153045, "loss": 4.6255, "mean_token_accuracy": 0.24118990898132325, "num_tokens": 150216750.0, "step": 86600 }, { "entropy": 5.33399543762207, "epoch": 6.738144329896907, "grad_norm": 1.2421875, "learning_rate": 0.00015967652705240945, "loss": 4.5985, "mean_token_accuracy": 0.24316480457782746, "num_tokens": 150225446.0, "step": 86605 }, { "entropy": 5.407128238677979, "epoch": 6.738533359268625, "grad_norm": 1.4765625, "learning_rate": 0.0001596527297131385, "loss": 4.6697, "mean_token_accuracy": 0.2347989022731781, "num_tokens": 150232586.0, "step": 86610 }, { "entropy": 5.286025428771973, "epoch": 6.738922388640343, "grad_norm": 1.2734375, "learning_rate": 0.00015962893412407885, "loss": 4.5945, "mean_token_accuracy": 0.23980384618043898, "num_tokens": 150240307.0, "step": 86615 }, { "entropy": 5.361106443405151, "epoch": 6.7393114180120595, "grad_norm": 1.3125, "learning_rate": 0.00015960514028559144, "loss": 4.6031, "mean_token_accuracy": 0.24578217566013336, "num_tokens": 150248973.0, "step": 86620 }, { "entropy": 5.499377965927124, "epoch": 6.739700447383777, "grad_norm": 1.2578125, "learning_rate": 0.00015958134819803735, "loss": 4.8283, "mean_token_accuracy": 0.2253999501466751, "num_tokens": 150258299.0, "step": 86625 }, { "entropy": 5.457450008392334, "epoch": 6.740089476755495, "grad_norm": 1.3671875, "learning_rate": 0.00015955755786177766, "loss": 4.7441, "mean_token_accuracy": 0.23275287002325057, "num_tokens": 150266808.0, "step": 86630 }, { "entropy": 5.385130214691162, "epoch": 6.7404785061272126, "grad_norm": 1.328125, "learning_rate": 0.00015953376927717322, "loss": 4.6069, "mean_token_accuracy": 0.24218972623348237, "num_tokens": 150275705.0, "step": 86635 }, { "entropy": 5.424401521682739, "epoch": 6.74086753549893, "grad_norm": 1.3515625, "learning_rate": 0.00015950998244458514, "loss": 4.6017, "mean_token_accuracy": 0.24546981006860732, "num_tokens": 150283163.0, "step": 86640 }, { "entropy": 5.463386583328247, "epoch": 6.741256564870648, "grad_norm": 1.453125, "learning_rate": 0.00015948619736437414, "loss": 4.6828, "mean_token_accuracy": 0.2397756025195122, "num_tokens": 150291877.0, "step": 86645 }, { "entropy": 5.347423124313354, "epoch": 6.741645594242366, "grad_norm": 1.265625, "learning_rate": 0.00015946241403690136, "loss": 4.5776, "mean_token_accuracy": 0.23953987061977386, "num_tokens": 150300341.0, "step": 86650 }, { "entropy": 5.342374563217163, "epoch": 6.742034623614083, "grad_norm": 1.3125, "learning_rate": 0.0001594386324625275, "loss": 4.6357, "mean_token_accuracy": 0.24903225153684616, "num_tokens": 150308772.0, "step": 86655 }, { "entropy": 5.4074554443359375, "epoch": 6.7424236529858, "grad_norm": 1.296875, "learning_rate": 0.00015941485264161343, "loss": 4.685, "mean_token_accuracy": 0.2322802424430847, "num_tokens": 150318053.0, "step": 86660 }, { "entropy": 5.3586945056915285, "epoch": 6.742812682357518, "grad_norm": 1.3515625, "learning_rate": 0.00015939107457452003, "loss": 4.6366, "mean_token_accuracy": 0.25096495449543, "num_tokens": 150326515.0, "step": 86665 }, { "entropy": 5.396742630004883, "epoch": 6.7432017117292355, "grad_norm": 1.328125, "learning_rate": 0.000159367298261608, "loss": 4.6424, "mean_token_accuracy": 0.23705615550279618, "num_tokens": 150334855.0, "step": 86670 }, { "entropy": 5.462725257873535, "epoch": 6.743590741100953, "grad_norm": 1.375, "learning_rate": 0.00015934352370323827, "loss": 4.6783, "mean_token_accuracy": 0.24461203068494797, "num_tokens": 150343409.0, "step": 86675 }, { "entropy": 5.314132976531982, "epoch": 6.743979770472671, "grad_norm": 1.2890625, "learning_rate": 0.00015931975089977134, "loss": 4.5765, "mean_token_accuracy": 0.2449779525399208, "num_tokens": 150352212.0, "step": 86680 }, { "entropy": 5.398190593719482, "epoch": 6.744368799844388, "grad_norm": 1.2421875, "learning_rate": 0.00015929597985156818, "loss": 4.6323, "mean_token_accuracy": 0.2394014224410057, "num_tokens": 150360872.0, "step": 86685 }, { "entropy": 5.365985012054443, "epoch": 6.7447578292161054, "grad_norm": 1.359375, "learning_rate": 0.00015927221055898934, "loss": 4.6277, "mean_token_accuracy": 0.24483997821807862, "num_tokens": 150369052.0, "step": 86690 }, { "entropy": 5.433430337905884, "epoch": 6.745146858587823, "grad_norm": 1.2734375, "learning_rate": 0.00015924844302239545, "loss": 4.7372, "mean_token_accuracy": 0.23694879710674285, "num_tokens": 150377455.0, "step": 86695 }, { "entropy": 5.405974006652832, "epoch": 6.745535887959541, "grad_norm": 1.3515625, "learning_rate": 0.00015922467724214728, "loss": 4.7331, "mean_token_accuracy": 0.23599400818347932, "num_tokens": 150385623.0, "step": 86700 }, { "entropy": 5.353680992126465, "epoch": 6.7459249173312585, "grad_norm": 1.25, "learning_rate": 0.0001592009132186053, "loss": 4.5929, "mean_token_accuracy": 0.24066076129674913, "num_tokens": 150394326.0, "step": 86705 }, { "entropy": 5.337457466125488, "epoch": 6.746313946702976, "grad_norm": 1.3203125, "learning_rate": 0.0001591771509521302, "loss": 4.5303, "mean_token_accuracy": 0.24528997093439103, "num_tokens": 150403395.0, "step": 86710 }, { "entropy": 5.344397449493409, "epoch": 6.746702976074694, "grad_norm": 1.2578125, "learning_rate": 0.00015915339044308242, "loss": 4.5559, "mean_token_accuracy": 0.24377324432134628, "num_tokens": 150411438.0, "step": 86715 }, { "entropy": 5.327082967758178, "epoch": 6.747092005446412, "grad_norm": 1.3203125, "learning_rate": 0.00015912963169182264, "loss": 4.5887, "mean_token_accuracy": 0.24230331778526307, "num_tokens": 150420952.0, "step": 86720 }, { "entropy": 5.322646522521973, "epoch": 6.747481034818128, "grad_norm": 1.25, "learning_rate": 0.00015910587469871116, "loss": 4.4897, "mean_token_accuracy": 0.2522676721215248, "num_tokens": 150429174.0, "step": 86725 }, { "entropy": 5.366421175003052, "epoch": 6.747870064189846, "grad_norm": 1.34375, "learning_rate": 0.00015908211946410867, "loss": 4.5941, "mean_token_accuracy": 0.24013547599315643, "num_tokens": 150437357.0, "step": 86730 }, { "entropy": 5.437785196304321, "epoch": 6.748259093561564, "grad_norm": 1.4296875, "learning_rate": 0.00015905836598837552, "loss": 4.7218, "mean_token_accuracy": 0.23048072606325148, "num_tokens": 150444964.0, "step": 86735 }, { "entropy": 5.379519653320313, "epoch": 6.7486481229332815, "grad_norm": 1.375, "learning_rate": 0.00015903461427187204, "loss": 4.7267, "mean_token_accuracy": 0.23018602132797242, "num_tokens": 150453889.0, "step": 86740 }, { "entropy": 5.383604240417481, "epoch": 6.749037152304999, "grad_norm": 1.4609375, "learning_rate": 0.00015901086431495878, "loss": 4.6179, "mean_token_accuracy": 0.24353678673505783, "num_tokens": 150461748.0, "step": 86745 }, { "entropy": 5.406363201141358, "epoch": 6.749426181676717, "grad_norm": 1.3046875, "learning_rate": 0.000158987116117996, "loss": 4.6697, "mean_token_accuracy": 0.24028267860412597, "num_tokens": 150471021.0, "step": 86750 }, { "entropy": 5.3884134769439695, "epoch": 6.749815211048434, "grad_norm": 1.1953125, "learning_rate": 0.000158963369681344, "loss": 4.6404, "mean_token_accuracy": 0.2367157071828842, "num_tokens": 150480522.0, "step": 86755 }, { "entropy": 5.431360244750977, "epoch": 6.750204240420151, "grad_norm": 1.3046875, "learning_rate": 0.00015893962500536325, "loss": 4.6701, "mean_token_accuracy": 0.24331804513931274, "num_tokens": 150490005.0, "step": 86760 }, { "entropy": 5.439209222793579, "epoch": 6.750593269791869, "grad_norm": 1.3203125, "learning_rate": 0.00015891588209041398, "loss": 4.6908, "mean_token_accuracy": 0.23498098999261857, "num_tokens": 150498193.0, "step": 86765 }, { "entropy": 5.425718832015991, "epoch": 6.750982299163587, "grad_norm": 1.3671875, "learning_rate": 0.0001588921409368565, "loss": 4.6517, "mean_token_accuracy": 0.24033116549253464, "num_tokens": 150506806.0, "step": 86770 }, { "entropy": 5.308425807952881, "epoch": 6.7513713285353045, "grad_norm": 1.2421875, "learning_rate": 0.00015886840154505084, "loss": 4.5348, "mean_token_accuracy": 0.2479819029569626, "num_tokens": 150515328.0, "step": 86775 }, { "entropy": 5.348219108581543, "epoch": 6.751760357907022, "grad_norm": 1.265625, "learning_rate": 0.00015884466391535745, "loss": 4.5752, "mean_token_accuracy": 0.2473050534725189, "num_tokens": 150523659.0, "step": 86780 }, { "entropy": 5.37948956489563, "epoch": 6.75214938727874, "grad_norm": 1.2734375, "learning_rate": 0.0001588209280481363, "loss": 4.6868, "mean_token_accuracy": 0.23666368573904037, "num_tokens": 150532725.0, "step": 86785 }, { "entropy": 5.4109978675842285, "epoch": 6.752538416650457, "grad_norm": 1.46875, "learning_rate": 0.00015879719394374774, "loss": 4.6702, "mean_token_accuracy": 0.23651717007160186, "num_tokens": 150541099.0, "step": 86790 }, { "entropy": 5.36580457687378, "epoch": 6.752927446022174, "grad_norm": 1.296875, "learning_rate": 0.00015877346160255175, "loss": 4.6298, "mean_token_accuracy": 0.24712107926607133, "num_tokens": 150549467.0, "step": 86795 }, { "entropy": 5.3267735004425045, "epoch": 6.753316475393892, "grad_norm": 1.3046875, "learning_rate": 0.00015874973102490852, "loss": 4.549, "mean_token_accuracy": 0.2571324944496155, "num_tokens": 150558649.0, "step": 86800 }, { "entropy": 5.36736946105957, "epoch": 6.75370550476561, "grad_norm": 1.421875, "learning_rate": 0.00015872600221117808, "loss": 4.5972, "mean_token_accuracy": 0.24349643886089326, "num_tokens": 150566939.0, "step": 86805 }, { "entropy": 5.36602029800415, "epoch": 6.7540945341373275, "grad_norm": 1.421875, "learning_rate": 0.00015870227516172054, "loss": 4.5775, "mean_token_accuracy": 0.24661392122507095, "num_tokens": 150575642.0, "step": 86810 }, { "entropy": 5.368757152557373, "epoch": 6.754483563509045, "grad_norm": 1.3359375, "learning_rate": 0.0001586785498768958, "loss": 4.6988, "mean_token_accuracy": 0.24269146621227264, "num_tokens": 150583726.0, "step": 86815 }, { "entropy": 5.373326778411865, "epoch": 6.754872592880762, "grad_norm": 1.328125, "learning_rate": 0.00015865482635706385, "loss": 4.6284, "mean_token_accuracy": 0.24545236080884933, "num_tokens": 150591976.0, "step": 86820 }, { "entropy": 5.426251602172852, "epoch": 6.75526162225248, "grad_norm": 1.1875, "learning_rate": 0.00015863110460258485, "loss": 4.7135, "mean_token_accuracy": 0.24481361359357834, "num_tokens": 150600835.0, "step": 86825 }, { "entropy": 5.440485048294067, "epoch": 6.755650651624197, "grad_norm": 1.328125, "learning_rate": 0.00015860738461381858, "loss": 4.6637, "mean_token_accuracy": 0.24940052777528762, "num_tokens": 150610386.0, "step": 86830 }, { "entropy": 5.392095232009888, "epoch": 6.756039680995915, "grad_norm": 1.2734375, "learning_rate": 0.00015858366639112502, "loss": 4.5824, "mean_token_accuracy": 0.23998736590147018, "num_tokens": 150618620.0, "step": 86835 }, { "entropy": 5.431262683868408, "epoch": 6.756428710367633, "grad_norm": 1.28125, "learning_rate": 0.00015855994993486394, "loss": 4.7206, "mean_token_accuracy": 0.23937655985355377, "num_tokens": 150627889.0, "step": 86840 }, { "entropy": 5.436983871459961, "epoch": 6.7568177397393505, "grad_norm": 1.3515625, "learning_rate": 0.0001585362352453954, "loss": 4.7, "mean_token_accuracy": 0.24899702221155168, "num_tokens": 150636452.0, "step": 86845 }, { "entropy": 5.4389581203460695, "epoch": 6.757206769111068, "grad_norm": 1.265625, "learning_rate": 0.0001585125223230791, "loss": 4.6863, "mean_token_accuracy": 0.23841559439897536, "num_tokens": 150645389.0, "step": 86850 }, { "entropy": 5.432129049301148, "epoch": 6.757595798482786, "grad_norm": 1.4296875, "learning_rate": 0.00015848881116827478, "loss": 4.6935, "mean_token_accuracy": 0.23879595547914506, "num_tokens": 150654659.0, "step": 86855 }, { "entropy": 5.390882539749145, "epoch": 6.757984827854503, "grad_norm": 1.328125, "learning_rate": 0.0001584651017813424, "loss": 4.6329, "mean_token_accuracy": 0.24197384417057038, "num_tokens": 150663452.0, "step": 86860 }, { "entropy": 5.528287553787232, "epoch": 6.75837385722622, "grad_norm": 1.3984375, "learning_rate": 0.00015844139416264151, "loss": 4.7576, "mean_token_accuracy": 0.2313082590699196, "num_tokens": 150671909.0, "step": 86865 }, { "entropy": 5.3625060558319095, "epoch": 6.758762886597938, "grad_norm": 1.28125, "learning_rate": 0.00015841768831253205, "loss": 4.5916, "mean_token_accuracy": 0.250088657438755, "num_tokens": 150680159.0, "step": 86870 }, { "entropy": 5.378114366531372, "epoch": 6.759151915969656, "grad_norm": 1.296875, "learning_rate": 0.0001583939842313735, "loss": 4.5697, "mean_token_accuracy": 0.25016418397426604, "num_tokens": 150688366.0, "step": 86875 }, { "entropy": 5.36807689666748, "epoch": 6.7595409453413735, "grad_norm": 1.2890625, "learning_rate": 0.0001583702819195258, "loss": 4.6008, "mean_token_accuracy": 0.23929579854011535, "num_tokens": 150697284.0, "step": 86880 }, { "entropy": 5.384963512420654, "epoch": 6.759929974713091, "grad_norm": 1.328125, "learning_rate": 0.00015834658137734827, "loss": 4.6217, "mean_token_accuracy": 0.24373877942562103, "num_tokens": 150705719.0, "step": 86885 }, { "entropy": 5.332027769088745, "epoch": 6.760319004084808, "grad_norm": 1.421875, "learning_rate": 0.00015832288260520072, "loss": 4.5801, "mean_token_accuracy": 0.25135633647441863, "num_tokens": 150713855.0, "step": 86890 }, { "entropy": 5.338594102859497, "epoch": 6.760708033456526, "grad_norm": 1.3359375, "learning_rate": 0.0001582991856034428, "loss": 4.6288, "mean_token_accuracy": 0.2425461396574974, "num_tokens": 150723033.0, "step": 86895 }, { "entropy": 5.325956964492798, "epoch": 6.761097062828243, "grad_norm": 1.390625, "learning_rate": 0.00015827549037243391, "loss": 4.6063, "mean_token_accuracy": 0.24316215068101882, "num_tokens": 150731193.0, "step": 86900 }, { "entropy": 5.413172388076783, "epoch": 6.761486092199961, "grad_norm": 1.1328125, "learning_rate": 0.00015825179691253378, "loss": 4.7017, "mean_token_accuracy": 0.23987009823322297, "num_tokens": 150740735.0, "step": 86905 }, { "entropy": 5.435426092147827, "epoch": 6.761875121571679, "grad_norm": 1.28125, "learning_rate": 0.00015822810522410163, "loss": 4.7474, "mean_token_accuracy": 0.22612712234258653, "num_tokens": 150749872.0, "step": 86910 }, { "entropy": 5.362718391418457, "epoch": 6.7622641509433965, "grad_norm": 1.3046875, "learning_rate": 0.0001582044153074973, "loss": 4.6377, "mean_token_accuracy": 0.2396436020731926, "num_tokens": 150758792.0, "step": 86915 }, { "entropy": 5.386623382568359, "epoch": 6.762653180315114, "grad_norm": 1.328125, "learning_rate": 0.00015818072716307997, "loss": 4.6216, "mean_token_accuracy": 0.24854274541139604, "num_tokens": 150768341.0, "step": 86920 }, { "entropy": 5.405844831466675, "epoch": 6.763042209686831, "grad_norm": 1.4296875, "learning_rate": 0.00015815704079120925, "loss": 4.6983, "mean_token_accuracy": 0.23992435187101363, "num_tokens": 150777307.0, "step": 86925 }, { "entropy": 5.446200513839722, "epoch": 6.763431239058549, "grad_norm": 1.34375, "learning_rate": 0.00015813335619224443, "loss": 4.6536, "mean_token_accuracy": 0.24296968132257463, "num_tokens": 150785993.0, "step": 86930 }, { "entropy": 5.409615707397461, "epoch": 6.763820268430266, "grad_norm": 1.3984375, "learning_rate": 0.00015810967336654487, "loss": 4.6421, "mean_token_accuracy": 0.23975160866975784, "num_tokens": 150795024.0, "step": 86935 }, { "entropy": 5.368968963623047, "epoch": 6.764209297801984, "grad_norm": 1.234375, "learning_rate": 0.00015808599231447002, "loss": 4.6358, "mean_token_accuracy": 0.23717820644378662, "num_tokens": 150803777.0, "step": 86940 }, { "entropy": 5.4032939910888675, "epoch": 6.764598327173702, "grad_norm": 1.328125, "learning_rate": 0.00015806231303637906, "loss": 4.6478, "mean_token_accuracy": 0.24559405595064163, "num_tokens": 150812230.0, "step": 86945 }, { "entropy": 5.3609741687774655, "epoch": 6.7649873565454195, "grad_norm": 1.3046875, "learning_rate": 0.00015803863553263148, "loss": 4.6371, "mean_token_accuracy": 0.2462459146976471, "num_tokens": 150822078.0, "step": 86950 }, { "entropy": 5.464135551452637, "epoch": 6.765376385917136, "grad_norm": 1.328125, "learning_rate": 0.00015801495980358635, "loss": 4.6932, "mean_token_accuracy": 0.24532705098390578, "num_tokens": 150830390.0, "step": 86955 }, { "entropy": 5.353092527389526, "epoch": 6.765765415288854, "grad_norm": 1.375, "learning_rate": 0.000157991285849603, "loss": 4.5999, "mean_token_accuracy": 0.24576823115348817, "num_tokens": 150839094.0, "step": 86960 }, { "entropy": 5.387390661239624, "epoch": 6.766154444660572, "grad_norm": 1.359375, "learning_rate": 0.00015796761367104073, "loss": 4.6674, "mean_token_accuracy": 0.2510802686214447, "num_tokens": 150847440.0, "step": 86965 }, { "entropy": 5.409748268127442, "epoch": 6.766543474032289, "grad_norm": 1.3125, "learning_rate": 0.00015794394326825858, "loss": 4.6432, "mean_token_accuracy": 0.2342056229710579, "num_tokens": 150856079.0, "step": 86970 }, { "entropy": 5.344031715393067, "epoch": 6.766932503404007, "grad_norm": 1.28125, "learning_rate": 0.00015792027464161585, "loss": 4.6037, "mean_token_accuracy": 0.24318287074565886, "num_tokens": 150865016.0, "step": 86975 }, { "entropy": 5.385811471939087, "epoch": 6.767321532775725, "grad_norm": 1.296875, "learning_rate": 0.00015789660779147154, "loss": 4.6939, "mean_token_accuracy": 0.238667768239975, "num_tokens": 150873555.0, "step": 86980 }, { "entropy": 5.441705513000488, "epoch": 6.7677105621474425, "grad_norm": 1.34375, "learning_rate": 0.00015787294271818486, "loss": 4.7456, "mean_token_accuracy": 0.23239727169275284, "num_tokens": 150882348.0, "step": 86985 }, { "entropy": 5.424887561798096, "epoch": 6.76809959151916, "grad_norm": 1.328125, "learning_rate": 0.0001578492794221148, "loss": 4.6714, "mean_token_accuracy": 0.2386402189731598, "num_tokens": 150890396.0, "step": 86990 }, { "entropy": 5.403138160705566, "epoch": 6.768488620890877, "grad_norm": 1.328125, "learning_rate": 0.0001578256179036205, "loss": 4.6063, "mean_token_accuracy": 0.24374020844697952, "num_tokens": 150898691.0, "step": 86995 }, { "entropy": 5.434062147140503, "epoch": 6.768877650262595, "grad_norm": 1.359375, "learning_rate": 0.00015780195816306089, "loss": 4.7231, "mean_token_accuracy": 0.23543199449777602, "num_tokens": 150907071.0, "step": 87000 }, { "epoch": 6.768877650262595, "eval_entropy": 5.1254223468328926, "eval_loss": 4.857350826263428, "eval_mean_token_accuracy": 0.23597580749932337, "eval_num_tokens": 150907071.0, "eval_runtime": 28.7189, "eval_samples_per_second": 1447.059, "eval_steps_per_second": 180.891, "step": 87000 }, { "entropy": 5.374092435836792, "epoch": 6.769266679634312, "grad_norm": 1.2578125, "learning_rate": 0.00015777830020079512, "loss": 4.6945, "mean_token_accuracy": 0.23994003236293793, "num_tokens": 150915716.0, "step": 87005 }, { "entropy": 5.332070922851562, "epoch": 6.76965570900603, "grad_norm": 1.328125, "learning_rate": 0.00015775464401718203, "loss": 4.5155, "mean_token_accuracy": 0.24869565218687056, "num_tokens": 150924695.0, "step": 87010 }, { "entropy": 5.321927833557129, "epoch": 6.770044738377748, "grad_norm": 1.3984375, "learning_rate": 0.00015773098961258057, "loss": 4.5771, "mean_token_accuracy": 0.24655727446079254, "num_tokens": 150933847.0, "step": 87015 }, { "entropy": 5.393592357635498, "epoch": 6.770433767749465, "grad_norm": 1.3359375, "learning_rate": 0.00015770733698734966, "loss": 4.6903, "mean_token_accuracy": 0.23595406413078307, "num_tokens": 150942154.0, "step": 87020 }, { "entropy": 5.3536169052124025, "epoch": 6.770822797121182, "grad_norm": 1.3359375, "learning_rate": 0.00015768368614184824, "loss": 4.5935, "mean_token_accuracy": 0.2424705758690834, "num_tokens": 150950903.0, "step": 87025 }, { "entropy": 5.387820243835449, "epoch": 6.7712118264929, "grad_norm": 1.390625, "learning_rate": 0.00015766003707643522, "loss": 4.6239, "mean_token_accuracy": 0.24669907987117767, "num_tokens": 150959569.0, "step": 87030 }, { "entropy": 5.3175304412841795, "epoch": 6.771600855864618, "grad_norm": 1.296875, "learning_rate": 0.00015763638979146937, "loss": 4.5938, "mean_token_accuracy": 0.24850777685642242, "num_tokens": 150967664.0, "step": 87035 }, { "entropy": 5.362477874755859, "epoch": 6.771989885236335, "grad_norm": 1.328125, "learning_rate": 0.00015761274428730942, "loss": 4.6579, "mean_token_accuracy": 0.2423808306455612, "num_tokens": 150976301.0, "step": 87040 }, { "entropy": 5.406316089630127, "epoch": 6.772378914608053, "grad_norm": 1.4609375, "learning_rate": 0.0001575891005643143, "loss": 4.685, "mean_token_accuracy": 0.2395578920841217, "num_tokens": 150985706.0, "step": 87045 }, { "entropy": 5.350804185867309, "epoch": 6.772767943979771, "grad_norm": 1.4296875, "learning_rate": 0.00015756545862284267, "loss": 4.5945, "mean_token_accuracy": 0.2478423833847046, "num_tokens": 150995126.0, "step": 87050 }, { "entropy": 5.347354364395142, "epoch": 6.7731569733514885, "grad_norm": 1.2890625, "learning_rate": 0.00015754181846325334, "loss": 4.6177, "mean_token_accuracy": 0.24420775026082991, "num_tokens": 151003228.0, "step": 87055 }, { "entropy": 5.2783607006072994, "epoch": 6.773546002723205, "grad_norm": 1.3046875, "learning_rate": 0.00015751818008590484, "loss": 4.4898, "mean_token_accuracy": 0.2527284547686577, "num_tokens": 151012011.0, "step": 87060 }, { "entropy": 5.278483867645264, "epoch": 6.773935032094923, "grad_norm": 1.3515625, "learning_rate": 0.0001574945434911561, "loss": 4.5746, "mean_token_accuracy": 0.244483382999897, "num_tokens": 151021330.0, "step": 87065 }, { "entropy": 5.434381198883057, "epoch": 6.774324061466641, "grad_norm": 1.421875, "learning_rate": 0.00015747090867936555, "loss": 4.6858, "mean_token_accuracy": 0.24133276790380478, "num_tokens": 151030185.0, "step": 87070 }, { "entropy": 5.415054655075073, "epoch": 6.774713090838358, "grad_norm": 1.390625, "learning_rate": 0.00015744727565089196, "loss": 4.655, "mean_token_accuracy": 0.2371824264526367, "num_tokens": 151038487.0, "step": 87075 }, { "entropy": 5.4371226787567135, "epoch": 6.775102120210076, "grad_norm": 1.390625, "learning_rate": 0.0001574236444060938, "loss": 4.6727, "mean_token_accuracy": 0.24668436944484712, "num_tokens": 151046373.0, "step": 87080 }, { "entropy": 5.307097148895264, "epoch": 6.775491149581794, "grad_norm": 1.390625, "learning_rate": 0.00015740001494532962, "loss": 4.5295, "mean_token_accuracy": 0.2507604345679283, "num_tokens": 151055417.0, "step": 87085 }, { "entropy": 5.333750200271607, "epoch": 6.775880178953511, "grad_norm": 1.328125, "learning_rate": 0.0001573763872689582, "loss": 4.6721, "mean_token_accuracy": 0.23562807440757752, "num_tokens": 151064494.0, "step": 87090 }, { "entropy": 5.39428973197937, "epoch": 6.776269208325228, "grad_norm": 1.40625, "learning_rate": 0.00015735276137733776, "loss": 4.6406, "mean_token_accuracy": 0.2350349709391594, "num_tokens": 151073945.0, "step": 87095 }, { "entropy": 5.3464607238769535, "epoch": 6.776658237696946, "grad_norm": 1.3046875, "learning_rate": 0.000157329137270827, "loss": 4.5659, "mean_token_accuracy": 0.24863184988498688, "num_tokens": 151082428.0, "step": 87100 }, { "entropy": 5.385948324203492, "epoch": 6.777047267068664, "grad_norm": 1.3046875, "learning_rate": 0.0001573055149497842, "loss": 4.6314, "mean_token_accuracy": 0.2516795516014099, "num_tokens": 151090729.0, "step": 87105 }, { "entropy": 5.379290676116943, "epoch": 6.777436296440381, "grad_norm": 1.5234375, "learning_rate": 0.000157281894414568, "loss": 4.6123, "mean_token_accuracy": 0.24640195965766906, "num_tokens": 151099188.0, "step": 87110 }, { "entropy": 5.3477363109588625, "epoch": 6.777825325812099, "grad_norm": 1.4921875, "learning_rate": 0.00015725827566553659, "loss": 4.5961, "mean_token_accuracy": 0.24382608979940415, "num_tokens": 151107542.0, "step": 87115 }, { "entropy": 5.427003955841064, "epoch": 6.778214355183817, "grad_norm": 1.4140625, "learning_rate": 0.00015723465870304848, "loss": 4.7215, "mean_token_accuracy": 0.23682317584753038, "num_tokens": 151116018.0, "step": 87120 }, { "entropy": 5.353489637374878, "epoch": 6.778603384555534, "grad_norm": 1.359375, "learning_rate": 0.00015721104352746205, "loss": 4.621, "mean_token_accuracy": 0.24700624495744705, "num_tokens": 151124774.0, "step": 87125 }, { "entropy": 5.419941091537476, "epoch": 6.778992413927251, "grad_norm": 1.3515625, "learning_rate": 0.0001571874301391354, "loss": 4.6738, "mean_token_accuracy": 0.24712209552526473, "num_tokens": 151133717.0, "step": 87130 }, { "entropy": 5.375555324554443, "epoch": 6.779381443298969, "grad_norm": 1.3203125, "learning_rate": 0.0001571638185384271, "loss": 4.6351, "mean_token_accuracy": 0.23717755526304246, "num_tokens": 151141715.0, "step": 87135 }, { "entropy": 5.315714597702026, "epoch": 6.779770472670687, "grad_norm": 1.2421875, "learning_rate": 0.00015714020872569523, "loss": 4.577, "mean_token_accuracy": 0.24228921681642532, "num_tokens": 151150510.0, "step": 87140 }, { "entropy": 5.372259616851807, "epoch": 6.780159502042404, "grad_norm": 1.2890625, "learning_rate": 0.00015711660070129817, "loss": 4.6182, "mean_token_accuracy": 0.25213382244110105, "num_tokens": 151159136.0, "step": 87145 }, { "entropy": 5.371782541275024, "epoch": 6.780548531414122, "grad_norm": 1.265625, "learning_rate": 0.00015709299446559395, "loss": 4.6316, "mean_token_accuracy": 0.2419101968407631, "num_tokens": 151167659.0, "step": 87150 }, { "entropy": 5.321930837631226, "epoch": 6.780937560785839, "grad_norm": 1.2734375, "learning_rate": 0.0001570693900189409, "loss": 4.5753, "mean_token_accuracy": 0.24421830624341964, "num_tokens": 151177279.0, "step": 87155 }, { "entropy": 5.325595045089722, "epoch": 6.781326590157557, "grad_norm": 1.296875, "learning_rate": 0.00015704578736169721, "loss": 4.6039, "mean_token_accuracy": 0.2422620713710785, "num_tokens": 151185836.0, "step": 87160 }, { "entropy": 5.246536111831665, "epoch": 6.781715619529274, "grad_norm": 1.1796875, "learning_rate": 0.0001570221864942209, "loss": 4.4996, "mean_token_accuracy": 0.2546379044651985, "num_tokens": 151195599.0, "step": 87165 }, { "entropy": 5.38866171836853, "epoch": 6.782104648900992, "grad_norm": 1.3046875, "learning_rate": 0.0001569985874168702, "loss": 4.6585, "mean_token_accuracy": 0.23888645470142364, "num_tokens": 151203788.0, "step": 87170 }, { "entropy": 5.352604246139526, "epoch": 6.78249367827271, "grad_norm": 1.375, "learning_rate": 0.00015697499013000304, "loss": 4.6396, "mean_token_accuracy": 0.2408928319811821, "num_tokens": 151211660.0, "step": 87175 }, { "entropy": 5.41456708908081, "epoch": 6.782882707644427, "grad_norm": 1.3984375, "learning_rate": 0.00015695139463397766, "loss": 4.6921, "mean_token_accuracy": 0.23083127439022064, "num_tokens": 151219893.0, "step": 87180 }, { "entropy": 5.383120393753051, "epoch": 6.783271737016145, "grad_norm": 1.265625, "learning_rate": 0.00015692780092915184, "loss": 4.6326, "mean_token_accuracy": 0.23402537554502487, "num_tokens": 151228865.0, "step": 87185 }, { "entropy": 5.3528313636779785, "epoch": 6.783660766387863, "grad_norm": 1.40625, "learning_rate": 0.0001569042090158838, "loss": 4.5913, "mean_token_accuracy": 0.24100971221923828, "num_tokens": 151236953.0, "step": 87190 }, { "entropy": 5.360649585723877, "epoch": 6.78404979575958, "grad_norm": 1.3984375, "learning_rate": 0.00015688061889453136, "loss": 4.6219, "mean_token_accuracy": 0.24741194397211075, "num_tokens": 151245346.0, "step": 87195 }, { "entropy": 5.390010356903076, "epoch": 6.784438825131297, "grad_norm": 1.46875, "learning_rate": 0.0001568570305654526, "loss": 4.6761, "mean_token_accuracy": 0.24124637097120286, "num_tokens": 151254608.0, "step": 87200 }, { "entropy": 5.40191388130188, "epoch": 6.784827854503015, "grad_norm": 1.375, "learning_rate": 0.00015683344402900534, "loss": 4.6859, "mean_token_accuracy": 0.23909489065408707, "num_tokens": 151263687.0, "step": 87205 }, { "entropy": 5.318648481369019, "epoch": 6.785216883874733, "grad_norm": 1.3984375, "learning_rate": 0.0001568098592855474, "loss": 4.5896, "mean_token_accuracy": 0.24328495264053346, "num_tokens": 151271856.0, "step": 87210 }, { "entropy": 5.378814220428467, "epoch": 6.78560591324645, "grad_norm": 1.390625, "learning_rate": 0.00015678627633543683, "loss": 4.6479, "mean_token_accuracy": 0.23840028941631317, "num_tokens": 151280010.0, "step": 87215 }, { "entropy": 5.310987281799316, "epoch": 6.785994942618168, "grad_norm": 1.4296875, "learning_rate": 0.0001567626951790312, "loss": 4.5637, "mean_token_accuracy": 0.24741145372390747, "num_tokens": 151288086.0, "step": 87220 }, { "entropy": 5.440916967391968, "epoch": 6.786383971989885, "grad_norm": 1.3828125, "learning_rate": 0.0001567391158166886, "loss": 4.7855, "mean_token_accuracy": 0.22621618956327438, "num_tokens": 151296866.0, "step": 87225 }, { "entropy": 5.481134080886841, "epoch": 6.7867730013616026, "grad_norm": 1.328125, "learning_rate": 0.00015671553824876672, "loss": 4.7345, "mean_token_accuracy": 0.23406438231468202, "num_tokens": 151305180.0, "step": 87230 }, { "entropy": 5.420098876953125, "epoch": 6.78716203073332, "grad_norm": 1.2109375, "learning_rate": 0.00015669196247562316, "loss": 4.678, "mean_token_accuracy": 0.23364036083221434, "num_tokens": 151315331.0, "step": 87235 }, { "entropy": 5.33068528175354, "epoch": 6.787551060105038, "grad_norm": 1.3046875, "learning_rate": 0.00015666838849761588, "loss": 4.5864, "mean_token_accuracy": 0.24679771661758423, "num_tokens": 151324111.0, "step": 87240 }, { "entropy": 5.404269123077393, "epoch": 6.787940089476756, "grad_norm": 1.3203125, "learning_rate": 0.00015664481631510237, "loss": 4.6856, "mean_token_accuracy": 0.23454857468605042, "num_tokens": 151332744.0, "step": 87245 }, { "entropy": 5.373251247406006, "epoch": 6.788329118848473, "grad_norm": 1.4140625, "learning_rate": 0.00015662124592844047, "loss": 4.6001, "mean_token_accuracy": 0.24750469774007797, "num_tokens": 151341302.0, "step": 87250 }, { "entropy": 5.3508179664611815, "epoch": 6.788718148220191, "grad_norm": 1.3671875, "learning_rate": 0.0001565976773379877, "loss": 4.6341, "mean_token_accuracy": 0.23882309794425965, "num_tokens": 151349282.0, "step": 87255 }, { "entropy": 5.391197204589844, "epoch": 6.789107177591908, "grad_norm": 1.3671875, "learning_rate": 0.00015657411054410177, "loss": 4.7036, "mean_token_accuracy": 0.24144572466611863, "num_tokens": 151359131.0, "step": 87260 }, { "entropy": 5.368033742904663, "epoch": 6.7894962069636255, "grad_norm": 1.3359375, "learning_rate": 0.0001565505455471401, "loss": 4.5764, "mean_token_accuracy": 0.23894985914230346, "num_tokens": 151367724.0, "step": 87265 }, { "entropy": 5.411091566085815, "epoch": 6.789885236335343, "grad_norm": 1.3203125, "learning_rate": 0.0001565269823474605, "loss": 4.6904, "mean_token_accuracy": 0.24330826550722123, "num_tokens": 151376446.0, "step": 87270 }, { "entropy": 5.3271385669708256, "epoch": 6.790274265707061, "grad_norm": 1.3828125, "learning_rate": 0.00015650342094542031, "loss": 4.5684, "mean_token_accuracy": 0.24568378180265427, "num_tokens": 151385093.0, "step": 87275 }, { "entropy": 5.355845880508423, "epoch": 6.790663295078779, "grad_norm": 1.3828125, "learning_rate": 0.0001564798613413771, "loss": 4.6819, "mean_token_accuracy": 0.23936089426279067, "num_tokens": 151393817.0, "step": 87280 }, { "entropy": 5.383494806289673, "epoch": 6.791052324450496, "grad_norm": 1.3046875, "learning_rate": 0.00015645630353568836, "loss": 4.66, "mean_token_accuracy": 0.238224595785141, "num_tokens": 151401928.0, "step": 87285 }, { "entropy": 5.3865128517150875, "epoch": 6.791441353822213, "grad_norm": 1.2734375, "learning_rate": 0.00015643274752871145, "loss": 4.7049, "mean_token_accuracy": 0.2288798362016678, "num_tokens": 151410936.0, "step": 87290 }, { "entropy": 5.3475841045379635, "epoch": 6.791830383193931, "grad_norm": 1.3359375, "learning_rate": 0.000156409193320804, "loss": 4.6257, "mean_token_accuracy": 0.24890607446432114, "num_tokens": 151419973.0, "step": 87295 }, { "entropy": 5.449594640731812, "epoch": 6.7922194125656485, "grad_norm": 1.15625, "learning_rate": 0.0001563856409123232, "loss": 4.6678, "mean_token_accuracy": 0.24042956680059432, "num_tokens": 151429082.0, "step": 87300 }, { "entropy": 5.441337728500367, "epoch": 6.792608441937366, "grad_norm": 1.359375, "learning_rate": 0.0001563620903036266, "loss": 4.6462, "mean_token_accuracy": 0.2414650186896324, "num_tokens": 151437249.0, "step": 87305 }, { "entropy": 5.395728969573975, "epoch": 6.792997471309084, "grad_norm": 1.3671875, "learning_rate": 0.00015633854149507142, "loss": 4.6965, "mean_token_accuracy": 0.2301088333129883, "num_tokens": 151445320.0, "step": 87310 }, { "entropy": 5.3012003898620605, "epoch": 6.793386500680802, "grad_norm": 1.5078125, "learning_rate": 0.00015631499448701494, "loss": 4.586, "mean_token_accuracy": 0.24442399740219117, "num_tokens": 151453195.0, "step": 87315 }, { "entropy": 5.415408563613892, "epoch": 6.793775530052519, "grad_norm": 1.2578125, "learning_rate": 0.0001562914492798146, "loss": 4.7112, "mean_token_accuracy": 0.23275848776102065, "num_tokens": 151461968.0, "step": 87320 }, { "entropy": 5.410301542282104, "epoch": 6.794164559424237, "grad_norm": 1.4296875, "learning_rate": 0.0001562679058738275, "loss": 4.7271, "mean_token_accuracy": 0.23160205483436586, "num_tokens": 151471286.0, "step": 87325 }, { "entropy": 5.427578401565552, "epoch": 6.794553588795954, "grad_norm": 1.3046875, "learning_rate": 0.000156244364269411, "loss": 4.6568, "mean_token_accuracy": 0.24283526241779327, "num_tokens": 151480577.0, "step": 87330 }, { "entropy": 5.4031014919281, "epoch": 6.7949426181676715, "grad_norm": 1.3046875, "learning_rate": 0.00015622082446692216, "loss": 4.6821, "mean_token_accuracy": 0.23542118221521377, "num_tokens": 151489691.0, "step": 87335 }, { "entropy": 5.356697845458984, "epoch": 6.795331647539389, "grad_norm": 1.234375, "learning_rate": 0.00015619728646671838, "loss": 4.5754, "mean_token_accuracy": 0.2472609892487526, "num_tokens": 151498004.0, "step": 87340 }, { "entropy": 5.425762796401978, "epoch": 6.795720676911107, "grad_norm": 1.3125, "learning_rate": 0.0001561737502691566, "loss": 4.6552, "mean_token_accuracy": 0.23818643838167192, "num_tokens": 151506661.0, "step": 87345 }, { "entropy": 5.3787792205810545, "epoch": 6.796109706282825, "grad_norm": 1.4296875, "learning_rate": 0.000156150215874594, "loss": 4.6085, "mean_token_accuracy": 0.24431487470865249, "num_tokens": 151515306.0, "step": 87350 }, { "entropy": 5.393277359008789, "epoch": 6.796498735654541, "grad_norm": 1.25, "learning_rate": 0.00015612668328338774, "loss": 4.6535, "mean_token_accuracy": 0.24524293690919877, "num_tokens": 151524319.0, "step": 87355 }, { "entropy": 5.415173196792603, "epoch": 6.796887765026259, "grad_norm": 1.3125, "learning_rate": 0.00015610315249589484, "loss": 4.673, "mean_token_accuracy": 0.23592498153448105, "num_tokens": 151533500.0, "step": 87360 }, { "entropy": 5.360537958145142, "epoch": 6.797276794397977, "grad_norm": 1.421875, "learning_rate": 0.00015607962351247247, "loss": 4.5714, "mean_token_accuracy": 0.24892601370811462, "num_tokens": 151541942.0, "step": 87365 }, { "entropy": 5.418636798858643, "epoch": 6.7976658237696945, "grad_norm": 1.2421875, "learning_rate": 0.0001560560963334774, "loss": 4.762, "mean_token_accuracy": 0.2313599094748497, "num_tokens": 151551830.0, "step": 87370 }, { "entropy": 5.310070896148682, "epoch": 6.798054853141412, "grad_norm": 1.34375, "learning_rate": 0.00015603257095926683, "loss": 4.5376, "mean_token_accuracy": 0.24293670058250427, "num_tokens": 151560489.0, "step": 87375 }, { "entropy": 5.378417921066284, "epoch": 6.79844388251313, "grad_norm": 1.28125, "learning_rate": 0.00015600904739019756, "loss": 4.7024, "mean_token_accuracy": 0.23748379349708557, "num_tokens": 151569926.0, "step": 87380 }, { "entropy": 5.376136684417725, "epoch": 6.798832911884848, "grad_norm": 1.375, "learning_rate": 0.0001559855256266267, "loss": 4.6371, "mean_token_accuracy": 0.23997478932142258, "num_tokens": 151578482.0, "step": 87385 }, { "entropy": 5.362591886520386, "epoch": 6.799221941256565, "grad_norm": 1.3359375, "learning_rate": 0.00015596200566891103, "loss": 4.6352, "mean_token_accuracy": 0.24652411490678788, "num_tokens": 151587453.0, "step": 87390 }, { "entropy": 5.420590782165528, "epoch": 6.799610970628282, "grad_norm": 1.28125, "learning_rate": 0.00015593848751740738, "loss": 4.7098, "mean_token_accuracy": 0.23495933562517166, "num_tokens": 151596279.0, "step": 87395 }, { "entropy": 5.393957328796387, "epoch": 6.8, "grad_norm": 1.359375, "learning_rate": 0.00015591497117247276, "loss": 4.6423, "mean_token_accuracy": 0.24249375760555267, "num_tokens": 151604871.0, "step": 87400 }, { "entropy": 5.370973300933838, "epoch": 6.8003890293717175, "grad_norm": 1.3203125, "learning_rate": 0.00015589145663446385, "loss": 4.6068, "mean_token_accuracy": 0.23908052891492843, "num_tokens": 151613630.0, "step": 87405 }, { "entropy": 5.438415956497193, "epoch": 6.800778058743435, "grad_norm": 1.359375, "learning_rate": 0.00015586794390373758, "loss": 4.7022, "mean_token_accuracy": 0.23696373552083969, "num_tokens": 151622116.0, "step": 87410 }, { "entropy": 5.373213005065918, "epoch": 6.801167088115153, "grad_norm": 1.375, "learning_rate": 0.00015584443298065055, "loss": 4.6669, "mean_token_accuracy": 0.23048834055662154, "num_tokens": 151630498.0, "step": 87415 }, { "entropy": 5.4005176544189455, "epoch": 6.801556117486871, "grad_norm": 1.390625, "learning_rate": 0.00015582092386555958, "loss": 4.6399, "mean_token_accuracy": 0.24975327104330064, "num_tokens": 151639198.0, "step": 87420 }, { "entropy": 5.4218415260314945, "epoch": 6.801945146858587, "grad_norm": 1.3515625, "learning_rate": 0.0001557974165588215, "loss": 4.7287, "mean_token_accuracy": 0.23959958255290986, "num_tokens": 151647568.0, "step": 87425 }, { "entropy": 5.359622812271118, "epoch": 6.802334176230305, "grad_norm": 1.375, "learning_rate": 0.0001557739110607928, "loss": 4.6003, "mean_token_accuracy": 0.2462053805589676, "num_tokens": 151655878.0, "step": 87430 }, { "entropy": 5.4070234298706055, "epoch": 6.802723205602023, "grad_norm": 1.390625, "learning_rate": 0.00015575040737183032, "loss": 4.6994, "mean_token_accuracy": 0.23679072856903077, "num_tokens": 151664573.0, "step": 87435 }, { "entropy": 5.437038326263428, "epoch": 6.8031122349737405, "grad_norm": 1.265625, "learning_rate": 0.00015572690549229054, "loss": 4.6915, "mean_token_accuracy": 0.230339652299881, "num_tokens": 151673533.0, "step": 87440 }, { "entropy": 5.368251800537109, "epoch": 6.803501264345458, "grad_norm": 1.3515625, "learning_rate": 0.0001557034054225302, "loss": 4.6261, "mean_token_accuracy": 0.2411182701587677, "num_tokens": 151682241.0, "step": 87445 }, { "entropy": 5.445954847335815, "epoch": 6.803890293717176, "grad_norm": 1.5078125, "learning_rate": 0.0001556799071629057, "loss": 4.669, "mean_token_accuracy": 0.2450113132596016, "num_tokens": 151690391.0, "step": 87450 }, { "entropy": 5.36720905303955, "epoch": 6.804279323088894, "grad_norm": 1.3984375, "learning_rate": 0.00015565641071377378, "loss": 4.5679, "mean_token_accuracy": 0.231974233686924, "num_tokens": 151698962.0, "step": 87455 }, { "entropy": 5.379471254348755, "epoch": 6.80466835246061, "grad_norm": 1.265625, "learning_rate": 0.0001556329160754908, "loss": 4.564, "mean_token_accuracy": 0.2477173089981079, "num_tokens": 151707491.0, "step": 87460 }, { "entropy": 5.374447965621949, "epoch": 6.805057381832328, "grad_norm": 1.2734375, "learning_rate": 0.00015560942324841342, "loss": 4.6683, "mean_token_accuracy": 0.24010850340127946, "num_tokens": 151716278.0, "step": 87465 }, { "entropy": 5.367658042907715, "epoch": 6.805446411204046, "grad_norm": 1.46875, "learning_rate": 0.000155585932232898, "loss": 4.7164, "mean_token_accuracy": 0.24166468232870103, "num_tokens": 151724221.0, "step": 87470 }, { "entropy": 5.334524917602539, "epoch": 6.8058354405757635, "grad_norm": 1.2578125, "learning_rate": 0.0001555624430293009, "loss": 4.6031, "mean_token_accuracy": 0.23994891792535783, "num_tokens": 151732845.0, "step": 87475 }, { "entropy": 5.360730218887329, "epoch": 6.806224469947481, "grad_norm": 1.3828125, "learning_rate": 0.0001555389556379787, "loss": 4.6887, "mean_token_accuracy": 0.2351543426513672, "num_tokens": 151741270.0, "step": 87480 }, { "entropy": 5.390143966674804, "epoch": 6.806613499319199, "grad_norm": 1.234375, "learning_rate": 0.00015551547005928756, "loss": 4.6083, "mean_token_accuracy": 0.2514088585972786, "num_tokens": 151749812.0, "step": 87485 }, { "entropy": 5.443428087234497, "epoch": 6.807002528690916, "grad_norm": 1.3359375, "learning_rate": 0.00015549198629358414, "loss": 4.7227, "mean_token_accuracy": 0.2364121377468109, "num_tokens": 151757854.0, "step": 87490 }, { "entropy": 5.423127555847168, "epoch": 6.807391558062633, "grad_norm": 1.3515625, "learning_rate": 0.00015546850434122451, "loss": 4.6589, "mean_token_accuracy": 0.24059994965791703, "num_tokens": 151766283.0, "step": 87495 }, { "entropy": 5.337667417526245, "epoch": 6.807780587434351, "grad_norm": 1.390625, "learning_rate": 0.00015544502420256518, "loss": 4.6129, "mean_token_accuracy": 0.24434071630239487, "num_tokens": 151774716.0, "step": 87500 }, { "entropy": 5.406131315231323, "epoch": 6.808169616806069, "grad_norm": 1.3125, "learning_rate": 0.00015542154587796231, "loss": 4.6317, "mean_token_accuracy": 0.23800744712352753, "num_tokens": 151783250.0, "step": 87505 }, { "entropy": 5.42042646408081, "epoch": 6.8085586461777865, "grad_norm": 1.265625, "learning_rate": 0.00015539806936777206, "loss": 4.7109, "mean_token_accuracy": 0.22924352139234544, "num_tokens": 151791205.0, "step": 87510 }, { "entropy": 5.435712718963623, "epoch": 6.808947675549504, "grad_norm": 1.3515625, "learning_rate": 0.00015537459467235084, "loss": 4.6946, "mean_token_accuracy": 0.23883578777313233, "num_tokens": 151799968.0, "step": 87515 }, { "entropy": 5.394870615005493, "epoch": 6.809336704921222, "grad_norm": 1.375, "learning_rate": 0.00015535112179205466, "loss": 4.6234, "mean_token_accuracy": 0.24344617426395415, "num_tokens": 151808373.0, "step": 87520 }, { "entropy": 5.389349746704101, "epoch": 6.80972573429294, "grad_norm": 1.3125, "learning_rate": 0.00015532765072723986, "loss": 4.6567, "mean_token_accuracy": 0.24376060515642167, "num_tokens": 151817435.0, "step": 87525 }, { "entropy": 5.432136678695679, "epoch": 6.810114763664656, "grad_norm": 1.3359375, "learning_rate": 0.00015530418147826237, "loss": 4.6768, "mean_token_accuracy": 0.2442197397351265, "num_tokens": 151825689.0, "step": 87530 }, { "entropy": 5.356233739852906, "epoch": 6.810503793036374, "grad_norm": 1.3046875, "learning_rate": 0.0001552807140454785, "loss": 4.5859, "mean_token_accuracy": 0.24238881170749665, "num_tokens": 151834264.0, "step": 87535 }, { "entropy": 5.410935688018799, "epoch": 6.810892822408092, "grad_norm": 1.265625, "learning_rate": 0.00015525724842924417, "loss": 4.6499, "mean_token_accuracy": 0.24541440308094026, "num_tokens": 151842886.0, "step": 87540 }, { "entropy": 5.282352924346924, "epoch": 6.8112818517798095, "grad_norm": 1.4375, "learning_rate": 0.00015523378462991557, "loss": 4.578, "mean_token_accuracy": 0.24818440526723862, "num_tokens": 151851799.0, "step": 87545 }, { "entropy": 5.415251302719116, "epoch": 6.811670881151527, "grad_norm": 1.3515625, "learning_rate": 0.00015521032264784857, "loss": 4.6832, "mean_token_accuracy": 0.23281960636377336, "num_tokens": 151860655.0, "step": 87550 }, { "entropy": 5.354683542251587, "epoch": 6.812059910523245, "grad_norm": 1.3125, "learning_rate": 0.00015518686248339932, "loss": 4.721, "mean_token_accuracy": 0.2395566925406456, "num_tokens": 151869660.0, "step": 87555 }, { "entropy": 5.368762063980102, "epoch": 6.812448939894962, "grad_norm": 1.2890625, "learning_rate": 0.00015516340413692376, "loss": 4.5729, "mean_token_accuracy": 0.24459483176469804, "num_tokens": 151878521.0, "step": 87560 }, { "entropy": 5.373947238922119, "epoch": 6.812837969266679, "grad_norm": 1.3828125, "learning_rate": 0.0001551399476087777, "loss": 4.613, "mean_token_accuracy": 0.24638134688138963, "num_tokens": 151887468.0, "step": 87565 }, { "entropy": 5.384499645233154, "epoch": 6.813226998638397, "grad_norm": 1.3125, "learning_rate": 0.0001551164928993173, "loss": 4.5967, "mean_token_accuracy": 0.2513629153370857, "num_tokens": 151895639.0, "step": 87570 }, { "entropy": 5.403262615203857, "epoch": 6.813616028010115, "grad_norm": 1.4296875, "learning_rate": 0.00015509304000889819, "loss": 4.6663, "mean_token_accuracy": 0.2420704334974289, "num_tokens": 151904458.0, "step": 87575 }, { "entropy": 5.359309387207031, "epoch": 6.8140050573818325, "grad_norm": 1.390625, "learning_rate": 0.00015506958893787641, "loss": 4.6304, "mean_token_accuracy": 0.23891924917697907, "num_tokens": 151912256.0, "step": 87580 }, { "entropy": 5.370041704177856, "epoch": 6.81439408675355, "grad_norm": 1.3359375, "learning_rate": 0.00015504613968660779, "loss": 4.6796, "mean_token_accuracy": 0.24173660427331925, "num_tokens": 151921043.0, "step": 87585 }, { "entropy": 5.451279735565185, "epoch": 6.814783116125268, "grad_norm": 1.4296875, "learning_rate": 0.00015502269225544792, "loss": 4.7745, "mean_token_accuracy": 0.23179126381874085, "num_tokens": 151929334.0, "step": 87590 }, { "entropy": 5.361670684814453, "epoch": 6.815172145496985, "grad_norm": 1.28125, "learning_rate": 0.00015499924664475284, "loss": 4.624, "mean_token_accuracy": 0.2528132304549217, "num_tokens": 151937741.0, "step": 87595 }, { "entropy": 5.449291944503784, "epoch": 6.815561174868702, "grad_norm": 1.3828125, "learning_rate": 0.0001549758028548781, "loss": 4.6839, "mean_token_accuracy": 0.24560977667570114, "num_tokens": 151946162.0, "step": 87600 }, { "entropy": 5.424519824981689, "epoch": 6.81595020424042, "grad_norm": 1.2890625, "learning_rate": 0.00015495236088617964, "loss": 4.638, "mean_token_accuracy": 0.2446135014295578, "num_tokens": 151954237.0, "step": 87605 }, { "entropy": 5.423345041275025, "epoch": 6.816339233612138, "grad_norm": 1.453125, "learning_rate": 0.00015492892073901292, "loss": 4.6461, "mean_token_accuracy": 0.23706116527318954, "num_tokens": 151962948.0, "step": 87610 }, { "entropy": 5.327799224853516, "epoch": 6.8167282629838555, "grad_norm": 1.34375, "learning_rate": 0.00015490548241373374, "loss": 4.5969, "mean_token_accuracy": 0.24577128291130065, "num_tokens": 151971812.0, "step": 87615 }, { "entropy": 5.392414855957031, "epoch": 6.817117292355573, "grad_norm": 1.2421875, "learning_rate": 0.0001548820459106977, "loss": 4.6713, "mean_token_accuracy": 0.2391129419207573, "num_tokens": 151980451.0, "step": 87620 }, { "entropy": 5.446305561065674, "epoch": 6.81750632172729, "grad_norm": 1.3984375, "learning_rate": 0.00015485861123026046, "loss": 4.6762, "mean_token_accuracy": 0.23512422740459443, "num_tokens": 151988525.0, "step": 87625 }, { "entropy": 5.435957622528076, "epoch": 6.817895351099008, "grad_norm": 1.3515625, "learning_rate": 0.0001548351783727776, "loss": 4.6471, "mean_token_accuracy": 0.24379929900169373, "num_tokens": 151996395.0, "step": 87630 }, { "entropy": 5.43581109046936, "epoch": 6.818284380470725, "grad_norm": 1.296875, "learning_rate": 0.00015481174733860458, "loss": 4.7606, "mean_token_accuracy": 0.23303811997175217, "num_tokens": 152005366.0, "step": 87635 }, { "entropy": 5.380674886703491, "epoch": 6.818673409842443, "grad_norm": 1.2265625, "learning_rate": 0.00015478831812809708, "loss": 4.6359, "mean_token_accuracy": 0.23668336868286133, "num_tokens": 152014676.0, "step": 87640 }, { "entropy": 5.343096542358398, "epoch": 6.819062439214161, "grad_norm": 1.3515625, "learning_rate": 0.00015476489074161038, "loss": 4.5779, "mean_token_accuracy": 0.24872583597898484, "num_tokens": 152023599.0, "step": 87645 }, { "entropy": 5.44405517578125, "epoch": 6.8194514685858785, "grad_norm": 1.2890625, "learning_rate": 0.0001547414651795002, "loss": 4.7203, "mean_token_accuracy": 0.23321874737739562, "num_tokens": 152031963.0, "step": 87650 }, { "entropy": 5.440528154373169, "epoch": 6.819840497957596, "grad_norm": 1.265625, "learning_rate": 0.00015471804144212182, "loss": 4.6806, "mean_token_accuracy": 0.2387359395623207, "num_tokens": 152040152.0, "step": 87655 }, { "entropy": 5.4771819591522215, "epoch": 6.820229527329313, "grad_norm": 1.3203125, "learning_rate": 0.00015469461952983076, "loss": 4.711, "mean_token_accuracy": 0.22774491161108018, "num_tokens": 152049024.0, "step": 87660 }, { "entropy": 5.388168907165527, "epoch": 6.820618556701031, "grad_norm": 1.3046875, "learning_rate": 0.00015467119944298242, "loss": 4.629, "mean_token_accuracy": 0.2434990733861923, "num_tokens": 152057732.0, "step": 87665 }, { "entropy": 5.42332968711853, "epoch": 6.821007586072748, "grad_norm": 1.3828125, "learning_rate": 0.00015464778118193197, "loss": 4.6726, "mean_token_accuracy": 0.24582043439149856, "num_tokens": 152065657.0, "step": 87670 }, { "entropy": 5.400262451171875, "epoch": 6.821396615444466, "grad_norm": 1.328125, "learning_rate": 0.00015462436474703495, "loss": 4.6709, "mean_token_accuracy": 0.2361228033900261, "num_tokens": 152074460.0, "step": 87675 }, { "entropy": 5.451297473907471, "epoch": 6.821785644816184, "grad_norm": 1.296875, "learning_rate": 0.00015460095013864657, "loss": 4.7723, "mean_token_accuracy": 0.24436041116714477, "num_tokens": 152082983.0, "step": 87680 }, { "entropy": 5.339689445495606, "epoch": 6.8221746741879015, "grad_norm": 1.25, "learning_rate": 0.0001545775373571221, "loss": 4.5643, "mean_token_accuracy": 0.24462947100400925, "num_tokens": 152091685.0, "step": 87685 }, { "entropy": 5.436685371398926, "epoch": 6.822563703559618, "grad_norm": 1.3359375, "learning_rate": 0.0001545541264028169, "loss": 4.5894, "mean_token_accuracy": 0.24472440928220748, "num_tokens": 152100056.0, "step": 87690 }, { "entropy": 5.320098495483398, "epoch": 6.822952732931336, "grad_norm": 1.3125, "learning_rate": 0.00015453071727608607, "loss": 4.5917, "mean_token_accuracy": 0.24762240648269654, "num_tokens": 152108387.0, "step": 87695 }, { "entropy": 5.426633882522583, "epoch": 6.823341762303054, "grad_norm": 1.328125, "learning_rate": 0.00015450730997728496, "loss": 4.6638, "mean_token_accuracy": 0.24069009125232696, "num_tokens": 152116943.0, "step": 87700 }, { "entropy": 5.379858541488647, "epoch": 6.823730791674771, "grad_norm": 1.40625, "learning_rate": 0.00015448390450676852, "loss": 4.6125, "mean_token_accuracy": 0.25082680881023406, "num_tokens": 152125398.0, "step": 87705 }, { "entropy": 5.379056358337403, "epoch": 6.824119821046489, "grad_norm": 1.3359375, "learning_rate": 0.0001544605008648921, "loss": 4.5698, "mean_token_accuracy": 0.2500517204403877, "num_tokens": 152133624.0, "step": 87710 }, { "entropy": 5.425550699234009, "epoch": 6.824508850418207, "grad_norm": 1.375, "learning_rate": 0.00015443709905201065, "loss": 4.679, "mean_token_accuracy": 0.24345652312040328, "num_tokens": 152141997.0, "step": 87715 }, { "entropy": 5.380044555664062, "epoch": 6.8248978797899245, "grad_norm": 1.4296875, "learning_rate": 0.00015441369906847935, "loss": 4.6767, "mean_token_accuracy": 0.24345712065696717, "num_tokens": 152150152.0, "step": 87720 }, { "entropy": 5.396894645690918, "epoch": 6.825286909161642, "grad_norm": 1.3125, "learning_rate": 0.00015439030091465324, "loss": 4.6305, "mean_token_accuracy": 0.24957955926656722, "num_tokens": 152158766.0, "step": 87725 }, { "entropy": 5.347687911987305, "epoch": 6.825675938533359, "grad_norm": 1.375, "learning_rate": 0.00015436690459088738, "loss": 4.6016, "mean_token_accuracy": 0.2390442281961441, "num_tokens": 152167980.0, "step": 87730 }, { "entropy": 5.372927522659301, "epoch": 6.826064967905077, "grad_norm": 1.3828125, "learning_rate": 0.00015434351009753665, "loss": 4.665, "mean_token_accuracy": 0.2387247934937477, "num_tokens": 152176895.0, "step": 87735 }, { "entropy": 5.3585528373718265, "epoch": 6.826453997276794, "grad_norm": 1.34375, "learning_rate": 0.00015432011743495618, "loss": 4.5925, "mean_token_accuracy": 0.24167822450399398, "num_tokens": 152184923.0, "step": 87740 }, { "entropy": 5.361005449295044, "epoch": 6.826843026648512, "grad_norm": 1.2421875, "learning_rate": 0.00015429672660350087, "loss": 4.6257, "mean_token_accuracy": 0.2453148692846298, "num_tokens": 152194261.0, "step": 87745 }, { "entropy": 5.349089813232422, "epoch": 6.82723205602023, "grad_norm": 1.2578125, "learning_rate": 0.00015427333760352542, "loss": 4.5846, "mean_token_accuracy": 0.24649778455495835, "num_tokens": 152203410.0, "step": 87750 }, { "entropy": 5.4112348556518555, "epoch": 6.8276210853919475, "grad_norm": 1.3359375, "learning_rate": 0.0001542499504353851, "loss": 4.7064, "mean_token_accuracy": 0.24222972393035888, "num_tokens": 152212099.0, "step": 87755 }, { "entropy": 5.364427661895752, "epoch": 6.828010114763664, "grad_norm": 1.328125, "learning_rate": 0.00015422656509943454, "loss": 4.6122, "mean_token_accuracy": 0.23617759346961975, "num_tokens": 152220433.0, "step": 87760 }, { "entropy": 5.3664626121521, "epoch": 6.828399144135382, "grad_norm": 1.3046875, "learning_rate": 0.00015420318159602863, "loss": 4.6926, "mean_token_accuracy": 0.241220098733902, "num_tokens": 152229074.0, "step": 87765 }, { "entropy": 5.404411268234253, "epoch": 6.8287881735071, "grad_norm": 1.2265625, "learning_rate": 0.00015417979992552225, "loss": 4.6661, "mean_token_accuracy": 0.23936223089694977, "num_tokens": 152237862.0, "step": 87770 }, { "entropy": 5.30645260810852, "epoch": 6.829177202878817, "grad_norm": 1.34375, "learning_rate": 0.00015415642008826996, "loss": 4.5518, "mean_token_accuracy": 0.24576968550682068, "num_tokens": 152246308.0, "step": 87775 }, { "entropy": 5.366899299621582, "epoch": 6.829566232250535, "grad_norm": 1.3515625, "learning_rate": 0.00015413304208462678, "loss": 4.6859, "mean_token_accuracy": 0.24269679337739944, "num_tokens": 152254333.0, "step": 87780 }, { "entropy": 5.400658178329468, "epoch": 6.829955261622253, "grad_norm": 1.2734375, "learning_rate": 0.0001541096659149472, "loss": 4.6188, "mean_token_accuracy": 0.24316154271364213, "num_tokens": 152262993.0, "step": 87785 }, { "entropy": 5.437512016296386, "epoch": 6.8303442909939704, "grad_norm": 1.2421875, "learning_rate": 0.0001540862915795861, "loss": 4.7198, "mean_token_accuracy": 0.23619361370801925, "num_tokens": 152271918.0, "step": 87790 }, { "entropy": 5.358557081222534, "epoch": 6.830733320365687, "grad_norm": 1.4453125, "learning_rate": 0.00015406291907889803, "loss": 4.5836, "mean_token_accuracy": 0.25185790807008746, "num_tokens": 152280667.0, "step": 87795 }, { "entropy": 5.3118236541748045, "epoch": 6.831122349737405, "grad_norm": 1.3515625, "learning_rate": 0.0001540395484132377, "loss": 4.5605, "mean_token_accuracy": 0.24707349240779877, "num_tokens": 152289453.0, "step": 87800 }, { "entropy": 5.3454389572143555, "epoch": 6.831511379109123, "grad_norm": 1.3125, "learning_rate": 0.00015401617958295962, "loss": 4.6048, "mean_token_accuracy": 0.23756056278944016, "num_tokens": 152297844.0, "step": 87805 }, { "entropy": 5.282944393157959, "epoch": 6.83190040848084, "grad_norm": 1.2890625, "learning_rate": 0.00015399281258841858, "loss": 4.5613, "mean_token_accuracy": 0.2535837545990944, "num_tokens": 152306614.0, "step": 87810 }, { "entropy": 5.384834480285645, "epoch": 6.832289437852558, "grad_norm": 1.328125, "learning_rate": 0.0001539694474299689, "loss": 4.5899, "mean_token_accuracy": 0.24623977094888688, "num_tokens": 152315772.0, "step": 87815 }, { "entropy": 5.425903606414795, "epoch": 6.832678467224276, "grad_norm": 1.3515625, "learning_rate": 0.0001539460841079652, "loss": 4.7126, "mean_token_accuracy": 0.23233553022146225, "num_tokens": 152324219.0, "step": 87820 }, { "entropy": 5.350800275802612, "epoch": 6.8330674965959926, "grad_norm": 1.3125, "learning_rate": 0.00015392272262276208, "loss": 4.6711, "mean_token_accuracy": 0.24152640998363495, "num_tokens": 152333091.0, "step": 87825 }, { "entropy": 5.4330726146698, "epoch": 6.83345652596771, "grad_norm": 1.3984375, "learning_rate": 0.00015389936297471383, "loss": 4.7115, "mean_token_accuracy": 0.23114402443170548, "num_tokens": 152341565.0, "step": 87830 }, { "entropy": 5.412523412704468, "epoch": 6.833845555339428, "grad_norm": 1.484375, "learning_rate": 0.0001538760051641751, "loss": 4.6239, "mean_token_accuracy": 0.24088647216558456, "num_tokens": 152350655.0, "step": 87835 }, { "entropy": 5.422820138931274, "epoch": 6.834234584711146, "grad_norm": 1.34375, "learning_rate": 0.00015385264919150015, "loss": 4.6317, "mean_token_accuracy": 0.2426111027598381, "num_tokens": 152359362.0, "step": 87840 }, { "entropy": 5.461972427368164, "epoch": 6.834623614082863, "grad_norm": 1.265625, "learning_rate": 0.00015382929505704346, "loss": 4.7718, "mean_token_accuracy": 0.22579795271158218, "num_tokens": 152367997.0, "step": 87845 }, { "entropy": 5.400615406036377, "epoch": 6.835012643454581, "grad_norm": 1.3828125, "learning_rate": 0.00015380594276115936, "loss": 4.6272, "mean_token_accuracy": 0.24215300679206847, "num_tokens": 152375845.0, "step": 87850 }, { "entropy": 5.345032358169556, "epoch": 6.835401672826299, "grad_norm": 2.09375, "learning_rate": 0.00015378259230420212, "loss": 4.5816, "mean_token_accuracy": 0.24913360625505448, "num_tokens": 152385054.0, "step": 87855 }, { "entropy": 5.351049518585205, "epoch": 6.835790702198016, "grad_norm": 1.390625, "learning_rate": 0.00015375924368652617, "loss": 4.6294, "mean_token_accuracy": 0.2417811319231987, "num_tokens": 152393798.0, "step": 87860 }, { "entropy": 5.39056806564331, "epoch": 6.836179731569733, "grad_norm": 1.3828125, "learning_rate": 0.00015373589690848566, "loss": 4.609, "mean_token_accuracy": 0.24121406376361848, "num_tokens": 152402193.0, "step": 87865 }, { "entropy": 5.341705799102783, "epoch": 6.836568760941451, "grad_norm": 1.34375, "learning_rate": 0.00015371255197043493, "loss": 4.5517, "mean_token_accuracy": 0.2551496013998985, "num_tokens": 152410752.0, "step": 87870 }, { "entropy": 5.483415222167968, "epoch": 6.836957790313169, "grad_norm": 1.3671875, "learning_rate": 0.00015368920887272813, "loss": 4.7671, "mean_token_accuracy": 0.22640473991632462, "num_tokens": 152419046.0, "step": 87875 }, { "entropy": 5.346845817565918, "epoch": 6.837346819684886, "grad_norm": 1.421875, "learning_rate": 0.0001536658676157196, "loss": 4.6064, "mean_token_accuracy": 0.23895174860954285, "num_tokens": 152428718.0, "step": 87880 }, { "entropy": 5.406897163391113, "epoch": 6.837735849056604, "grad_norm": 1.359375, "learning_rate": 0.0001536425281997633, "loss": 4.6854, "mean_token_accuracy": 0.24648779332637788, "num_tokens": 152437516.0, "step": 87885 }, { "entropy": 5.3680006980896, "epoch": 6.838124878428321, "grad_norm": 1.28125, "learning_rate": 0.00015361919062521344, "loss": 4.6093, "mean_token_accuracy": 0.24638119488954544, "num_tokens": 152445839.0, "step": 87890 }, { "entropy": 5.440985107421875, "epoch": 6.8385139078000385, "grad_norm": 1.34375, "learning_rate": 0.00015359585489242434, "loss": 4.7594, "mean_token_accuracy": 0.23053200095891951, "num_tokens": 152454715.0, "step": 87895 }, { "entropy": 5.482624197006226, "epoch": 6.838902937171756, "grad_norm": 1.515625, "learning_rate": 0.00015357252100174976, "loss": 4.7625, "mean_token_accuracy": 0.23234462291002272, "num_tokens": 152463023.0, "step": 87900 }, { "entropy": 5.466064691543579, "epoch": 6.839291966543474, "grad_norm": 1.2578125, "learning_rate": 0.00015354918895354403, "loss": 4.6938, "mean_token_accuracy": 0.2424849674105644, "num_tokens": 152471296.0, "step": 87905 }, { "entropy": 5.400319576263428, "epoch": 6.839680995915192, "grad_norm": 1.3515625, "learning_rate": 0.00015352585874816088, "loss": 4.6216, "mean_token_accuracy": 0.23863116055727004, "num_tokens": 152478997.0, "step": 87910 }, { "entropy": 5.401607465744019, "epoch": 6.840070025286909, "grad_norm": 1.265625, "learning_rate": 0.00015350253038595463, "loss": 4.681, "mean_token_accuracy": 0.23137616962194443, "num_tokens": 152487789.0, "step": 87915 }, { "entropy": 5.442955732345581, "epoch": 6.840459054658627, "grad_norm": 1.3984375, "learning_rate": 0.00015347920386727897, "loss": 4.7318, "mean_token_accuracy": 0.2306816726922989, "num_tokens": 152496240.0, "step": 87920 }, { "entropy": 5.349298334121704, "epoch": 6.840848084030345, "grad_norm": 1.3125, "learning_rate": 0.0001534558791924881, "loss": 4.5688, "mean_token_accuracy": 0.24867893159389495, "num_tokens": 152504405.0, "step": 87925 }, { "entropy": 5.378642129898071, "epoch": 6.8412371134020615, "grad_norm": 1.2578125, "learning_rate": 0.00015343255636193583, "loss": 4.6453, "mean_token_accuracy": 0.23907426446676255, "num_tokens": 152513108.0, "step": 87930 }, { "entropy": 5.338487720489502, "epoch": 6.841626142773779, "grad_norm": 1.2109375, "learning_rate": 0.00015340923537597587, "loss": 4.6025, "mean_token_accuracy": 0.2424149051308632, "num_tokens": 152522989.0, "step": 87935 }, { "entropy": 5.385646390914917, "epoch": 6.842015172145497, "grad_norm": 1.2890625, "learning_rate": 0.00015338591623496235, "loss": 4.7022, "mean_token_accuracy": 0.23930055052042007, "num_tokens": 152531391.0, "step": 87940 }, { "entropy": 5.3903473854064945, "epoch": 6.842404201517215, "grad_norm": 1.25, "learning_rate": 0.0001533625989392489, "loss": 4.6288, "mean_token_accuracy": 0.23963913917541504, "num_tokens": 152540168.0, "step": 87945 }, { "entropy": 5.364973497390747, "epoch": 6.842793230888932, "grad_norm": 1.2421875, "learning_rate": 0.0001533392834891894, "loss": 4.6663, "mean_token_accuracy": 0.24345590323209762, "num_tokens": 152549660.0, "step": 87950 }, { "entropy": 5.3576576709747314, "epoch": 6.84318226026065, "grad_norm": 1.359375, "learning_rate": 0.00015331596988513762, "loss": 4.6183, "mean_token_accuracy": 0.24452893286943436, "num_tokens": 152558471.0, "step": 87955 }, { "entropy": 5.431260395050049, "epoch": 6.843571289632367, "grad_norm": 1.296875, "learning_rate": 0.00015329265812744742, "loss": 4.7071, "mean_token_accuracy": 0.23741409480571746, "num_tokens": 152567687.0, "step": 87960 }, { "entropy": 5.36627163887024, "epoch": 6.8439603190040845, "grad_norm": 1.359375, "learning_rate": 0.00015326934821647238, "loss": 4.5771, "mean_token_accuracy": 0.23962024301290513, "num_tokens": 152576052.0, "step": 87965 }, { "entropy": 5.396063804626465, "epoch": 6.844349348375802, "grad_norm": 1.25, "learning_rate": 0.00015324604015256617, "loss": 4.6147, "mean_token_accuracy": 0.2478618234395981, "num_tokens": 152584697.0, "step": 87970 }, { "entropy": 5.336439895629883, "epoch": 6.84473837774752, "grad_norm": 1.390625, "learning_rate": 0.0001532227339360826, "loss": 4.5847, "mean_token_accuracy": 0.2527925059199333, "num_tokens": 152592982.0, "step": 87975 }, { "entropy": 5.379661941528321, "epoch": 6.845127407119238, "grad_norm": 1.1953125, "learning_rate": 0.0001531994295673751, "loss": 4.6586, "mean_token_accuracy": 0.24514150768518447, "num_tokens": 152602108.0, "step": 87980 }, { "entropy": 5.443964576721191, "epoch": 6.845516436490955, "grad_norm": 1.390625, "learning_rate": 0.00015317612704679752, "loss": 4.7863, "mean_token_accuracy": 0.2256301000714302, "num_tokens": 152611578.0, "step": 87985 }, { "entropy": 5.451059865951538, "epoch": 6.845905465862673, "grad_norm": 1.453125, "learning_rate": 0.0001531528263747032, "loss": 4.7689, "mean_token_accuracy": 0.229328852891922, "num_tokens": 152621109.0, "step": 87990 }, { "entropy": 5.441101980209351, "epoch": 6.84629449523439, "grad_norm": 1.40625, "learning_rate": 0.0001531295275514459, "loss": 4.6373, "mean_token_accuracy": 0.23944544047117233, "num_tokens": 152628816.0, "step": 87995 }, { "entropy": 5.3797181129455565, "epoch": 6.8466835246061075, "grad_norm": 1.3046875, "learning_rate": 0.0001531062305773789, "loss": 4.611, "mean_token_accuracy": 0.23547526597976684, "num_tokens": 152637393.0, "step": 88000 }, { "entropy": 5.345834445953369, "epoch": 6.847072553977825, "grad_norm": 1.40625, "learning_rate": 0.00015308293545285596, "loss": 4.607, "mean_token_accuracy": 0.23613484799861909, "num_tokens": 152646475.0, "step": 88005 }, { "entropy": 5.478306531906128, "epoch": 6.847461583349543, "grad_norm": 1.4140625, "learning_rate": 0.00015305964217823042, "loss": 4.7256, "mean_token_accuracy": 0.23159758150577545, "num_tokens": 152654453.0, "step": 88010 }, { "entropy": 5.402421140670777, "epoch": 6.847850612721261, "grad_norm": 1.328125, "learning_rate": 0.00015303635075385557, "loss": 4.6966, "mean_token_accuracy": 0.2322397366166115, "num_tokens": 152663696.0, "step": 88015 }, { "entropy": 5.480624723434448, "epoch": 6.848239642092978, "grad_norm": 1.4375, "learning_rate": 0.00015301306118008513, "loss": 4.7053, "mean_token_accuracy": 0.24171013683080672, "num_tokens": 152672991.0, "step": 88020 }, { "entropy": 5.332372379302979, "epoch": 6.848628671464695, "grad_norm": 1.359375, "learning_rate": 0.00015298977345727226, "loss": 4.5768, "mean_token_accuracy": 0.25284951031208036, "num_tokens": 152681582.0, "step": 88025 }, { "entropy": 5.293654584884644, "epoch": 6.849017700836413, "grad_norm": 1.28125, "learning_rate": 0.0001529664875857704, "loss": 4.559, "mean_token_accuracy": 0.24609773904085158, "num_tokens": 152690761.0, "step": 88030 }, { "entropy": 5.401656818389893, "epoch": 6.8494067302081305, "grad_norm": 1.3984375, "learning_rate": 0.00015294320356593283, "loss": 4.7435, "mean_token_accuracy": 0.23611603677272797, "num_tokens": 152699509.0, "step": 88035 }, { "entropy": 5.386667680740357, "epoch": 6.849795759579848, "grad_norm": 1.3671875, "learning_rate": 0.00015291992139811295, "loss": 4.6464, "mean_token_accuracy": 0.24031177312135696, "num_tokens": 152707762.0, "step": 88040 }, { "entropy": 5.300319862365723, "epoch": 6.850184788951566, "grad_norm": 1.34375, "learning_rate": 0.00015289664108266395, "loss": 4.6041, "mean_token_accuracy": 0.24610297083854676, "num_tokens": 152715880.0, "step": 88045 }, { "entropy": 5.37862195968628, "epoch": 6.850573818323284, "grad_norm": 1.2265625, "learning_rate": 0.00015287336261993894, "loss": 4.6694, "mean_token_accuracy": 0.23897553980350494, "num_tokens": 152724725.0, "step": 88050 }, { "entropy": 5.385871076583863, "epoch": 6.850962847695001, "grad_norm": 1.3359375, "learning_rate": 0.00015285008601029142, "loss": 4.6481, "mean_token_accuracy": 0.24208159893751144, "num_tokens": 152733083.0, "step": 88055 }, { "entropy": 5.453640413284302, "epoch": 6.851351877066719, "grad_norm": 1.4296875, "learning_rate": 0.00015282681125407434, "loss": 4.6917, "mean_token_accuracy": 0.24461700022220612, "num_tokens": 152741815.0, "step": 88060 }, { "entropy": 5.330998229980469, "epoch": 6.851740906438436, "grad_norm": 1.3046875, "learning_rate": 0.00015280353835164096, "loss": 4.5894, "mean_token_accuracy": 0.2465410739183426, "num_tokens": 152750382.0, "step": 88065 }, { "entropy": 5.384104204177857, "epoch": 6.8521299358101535, "grad_norm": 1.34375, "learning_rate": 0.00015278026730334437, "loss": 4.7269, "mean_token_accuracy": 0.23490677773952484, "num_tokens": 152758882.0, "step": 88070 }, { "entropy": 5.460395956039429, "epoch": 6.852518965181871, "grad_norm": 1.375, "learning_rate": 0.00015275699810953774, "loss": 4.6967, "mean_token_accuracy": 0.2272198423743248, "num_tokens": 152767202.0, "step": 88075 }, { "entropy": 5.404255199432373, "epoch": 6.852907994553589, "grad_norm": 1.3984375, "learning_rate": 0.00015273373077057402, "loss": 4.6423, "mean_token_accuracy": 0.2363704338669777, "num_tokens": 152775758.0, "step": 88080 }, { "entropy": 5.426046752929688, "epoch": 6.853297023925307, "grad_norm": 1.34375, "learning_rate": 0.0001527104652868063, "loss": 4.6609, "mean_token_accuracy": 0.24440321028232576, "num_tokens": 152783899.0, "step": 88085 }, { "entropy": 5.395127487182617, "epoch": 6.853686053297024, "grad_norm": 1.3203125, "learning_rate": 0.0001526872016585878, "loss": 4.6112, "mean_token_accuracy": 0.24481153041124343, "num_tokens": 152792767.0, "step": 88090 }, { "entropy": 5.4208887100219725, "epoch": 6.854075082668741, "grad_norm": 1.3359375, "learning_rate": 0.00015266393988627115, "loss": 4.6818, "mean_token_accuracy": 0.2405066817998886, "num_tokens": 152802235.0, "step": 88095 }, { "entropy": 5.424117136001587, "epoch": 6.854464112040459, "grad_norm": 1.2890625, "learning_rate": 0.00015264067997020964, "loss": 4.7385, "mean_token_accuracy": 0.23192620873451233, "num_tokens": 152811297.0, "step": 88100 }, { "entropy": 5.42649507522583, "epoch": 6.8548531414121765, "grad_norm": 1.3359375, "learning_rate": 0.00015261742191075594, "loss": 4.723, "mean_token_accuracy": 0.2274567812681198, "num_tokens": 152820816.0, "step": 88105 }, { "entropy": 5.323373556137085, "epoch": 6.855242170783894, "grad_norm": 1.2421875, "learning_rate": 0.00015259416570826315, "loss": 4.5634, "mean_token_accuracy": 0.252081523835659, "num_tokens": 152829336.0, "step": 88110 }, { "entropy": 5.313122940063477, "epoch": 6.855631200155612, "grad_norm": 1.2578125, "learning_rate": 0.000152570911363084, "loss": 4.6175, "mean_token_accuracy": 0.24802208244800567, "num_tokens": 152838776.0, "step": 88115 }, { "entropy": 5.296321249008178, "epoch": 6.85602022952733, "grad_norm": 1.203125, "learning_rate": 0.00015254765887557148, "loss": 4.5006, "mean_token_accuracy": 0.2550403669476509, "num_tokens": 152847863.0, "step": 88120 }, { "entropy": 5.3867145538330075, "epoch": 6.856409258899047, "grad_norm": 1.328125, "learning_rate": 0.00015252440824607832, "loss": 4.7165, "mean_token_accuracy": 0.23734230697154998, "num_tokens": 152855670.0, "step": 88125 }, { "entropy": 5.420558500289917, "epoch": 6.856798288270764, "grad_norm": 1.2265625, "learning_rate": 0.00015250115947495726, "loss": 4.695, "mean_token_accuracy": 0.23518673777580262, "num_tokens": 152864481.0, "step": 88130 }, { "entropy": 5.372547578811646, "epoch": 6.857187317642482, "grad_norm": 1.3125, "learning_rate": 0.00015247791256256123, "loss": 4.5955, "mean_token_accuracy": 0.23710998445749282, "num_tokens": 152873235.0, "step": 88135 }, { "entropy": 5.42131462097168, "epoch": 6.8575763470141995, "grad_norm": 1.328125, "learning_rate": 0.00015245466750924276, "loss": 4.6581, "mean_token_accuracy": 0.23256264328956605, "num_tokens": 152881989.0, "step": 88140 }, { "entropy": 5.340928077697754, "epoch": 6.857965376385917, "grad_norm": 1.375, "learning_rate": 0.00015243142431535473, "loss": 4.5256, "mean_token_accuracy": 0.2487235888838768, "num_tokens": 152890652.0, "step": 88145 }, { "entropy": 5.3610766410827635, "epoch": 6.858354405757635, "grad_norm": 1.34375, "learning_rate": 0.0001524081829812497, "loss": 4.5999, "mean_token_accuracy": 0.24879216849803926, "num_tokens": 152899346.0, "step": 88150 }, { "entropy": 5.43237681388855, "epoch": 6.858743435129353, "grad_norm": 1.390625, "learning_rate": 0.00015238494350728032, "loss": 4.7567, "mean_token_accuracy": 0.23277739584445953, "num_tokens": 152907159.0, "step": 88155 }, { "entropy": 5.407005548477173, "epoch": 6.859132464501069, "grad_norm": 1.3203125, "learning_rate": 0.0001523617058937994, "loss": 4.6771, "mean_token_accuracy": 0.23857893645763398, "num_tokens": 152915774.0, "step": 88160 }, { "entropy": 5.405107593536377, "epoch": 6.859521493872787, "grad_norm": 1.3359375, "learning_rate": 0.00015233847014115926, "loss": 4.6602, "mean_token_accuracy": 0.23660048544406892, "num_tokens": 152925095.0, "step": 88165 }, { "entropy": 5.351880931854248, "epoch": 6.859910523244505, "grad_norm": 1.4140625, "learning_rate": 0.00015231523624971273, "loss": 4.5824, "mean_token_accuracy": 0.24751725047826767, "num_tokens": 152933835.0, "step": 88170 }, { "entropy": 5.386205720901489, "epoch": 6.8602995526162225, "grad_norm": 1.28125, "learning_rate": 0.0001522920042198121, "loss": 4.6983, "mean_token_accuracy": 0.24232011437416076, "num_tokens": 152941785.0, "step": 88175 }, { "entropy": 5.355608940124512, "epoch": 6.86068858198794, "grad_norm": 1.25, "learning_rate": 0.00015226877405181006, "loss": 4.5887, "mean_token_accuracy": 0.2437748834490776, "num_tokens": 152950721.0, "step": 88180 }, { "entropy": 5.388758611679077, "epoch": 6.861077611359658, "grad_norm": 1.375, "learning_rate": 0.00015224554574605898, "loss": 4.753, "mean_token_accuracy": 0.23230988532304764, "num_tokens": 152959570.0, "step": 88185 }, { "entropy": 5.404854249954224, "epoch": 6.861466640731376, "grad_norm": 1.2890625, "learning_rate": 0.00015222231930291143, "loss": 4.648, "mean_token_accuracy": 0.24176997393369676, "num_tokens": 152968187.0, "step": 88190 }, { "entropy": 5.362402105331421, "epoch": 6.861855670103093, "grad_norm": 1.359375, "learning_rate": 0.00015219909472271966, "loss": 4.5705, "mean_token_accuracy": 0.2397889330983162, "num_tokens": 152976993.0, "step": 88195 }, { "entropy": 5.4866022109985355, "epoch": 6.86224469947481, "grad_norm": 1.3671875, "learning_rate": 0.00015217587200583627, "loss": 4.7078, "mean_token_accuracy": 0.23766548782587052, "num_tokens": 152984873.0, "step": 88200 }, { "entropy": 5.411961507797241, "epoch": 6.862633728846528, "grad_norm": 1.34375, "learning_rate": 0.00015215265115261353, "loss": 4.6538, "mean_token_accuracy": 0.23856997936964036, "num_tokens": 152993979.0, "step": 88205 }, { "entropy": 5.373691177368164, "epoch": 6.8630227582182455, "grad_norm": 1.2265625, "learning_rate": 0.00015212943216340373, "loss": 4.6535, "mean_token_accuracy": 0.23926458060741423, "num_tokens": 153002588.0, "step": 88210 }, { "entropy": 5.391956043243408, "epoch": 6.863411787589963, "grad_norm": 1.453125, "learning_rate": 0.00015210621503855917, "loss": 4.6178, "mean_token_accuracy": 0.2507480472326279, "num_tokens": 153010449.0, "step": 88215 }, { "entropy": 5.34791316986084, "epoch": 6.863800816961681, "grad_norm": 1.2890625, "learning_rate": 0.00015208299977843221, "loss": 4.6365, "mean_token_accuracy": 0.23359389305114747, "num_tokens": 153019049.0, "step": 88220 }, { "entropy": 5.508857727050781, "epoch": 6.864189846333398, "grad_norm": 1.3828125, "learning_rate": 0.0001520597863833752, "loss": 4.7719, "mean_token_accuracy": 0.23004242777824402, "num_tokens": 153027019.0, "step": 88225 }, { "entropy": 5.334723949432373, "epoch": 6.864578875705115, "grad_norm": 1.265625, "learning_rate": 0.00015203657485374022, "loss": 4.6154, "mean_token_accuracy": 0.2397428721189499, "num_tokens": 153036164.0, "step": 88230 }, { "entropy": 5.428294515609741, "epoch": 6.864967905076833, "grad_norm": 1.3125, "learning_rate": 0.00015201336518987942, "loss": 4.7008, "mean_token_accuracy": 0.23172731101512908, "num_tokens": 153044426.0, "step": 88235 }, { "entropy": 5.36576247215271, "epoch": 6.865356934448551, "grad_norm": 1.421875, "learning_rate": 0.00015199015739214515, "loss": 4.5719, "mean_token_accuracy": 0.24463237226009368, "num_tokens": 153053083.0, "step": 88240 }, { "entropy": 5.372410869598388, "epoch": 6.8657459638202685, "grad_norm": 1.375, "learning_rate": 0.00015196695146088934, "loss": 4.6483, "mean_token_accuracy": 0.24409525990486144, "num_tokens": 153061952.0, "step": 88245 }, { "entropy": 5.3827064514160154, "epoch": 6.866134993191986, "grad_norm": 1.2421875, "learning_rate": 0.00015194374739646433, "loss": 4.6298, "mean_token_accuracy": 0.24847858697175979, "num_tokens": 153070668.0, "step": 88250 }, { "entropy": 5.337804317474365, "epoch": 6.866524022563704, "grad_norm": 1.3359375, "learning_rate": 0.000151920545199222, "loss": 4.6425, "mean_token_accuracy": 0.24685653895139695, "num_tokens": 153079231.0, "step": 88255 }, { "entropy": 5.410259056091308, "epoch": 6.866913051935422, "grad_norm": 1.46875, "learning_rate": 0.00015189734486951452, "loss": 4.6893, "mean_token_accuracy": 0.23687737584114074, "num_tokens": 153087401.0, "step": 88260 }, { "entropy": 5.4097654819488525, "epoch": 6.867302081307138, "grad_norm": 1.5234375, "learning_rate": 0.00015187414640769386, "loss": 4.6409, "mean_token_accuracy": 0.2379336416721344, "num_tokens": 153096083.0, "step": 88265 }, { "entropy": 5.356826210021973, "epoch": 6.867691110678856, "grad_norm": 1.3359375, "learning_rate": 0.00015185094981411213, "loss": 4.6036, "mean_token_accuracy": 0.24969720989465713, "num_tokens": 153104457.0, "step": 88270 }, { "entropy": 5.406849050521851, "epoch": 6.868080140050574, "grad_norm": 1.265625, "learning_rate": 0.00015182775508912116, "loss": 4.6766, "mean_token_accuracy": 0.2392251268029213, "num_tokens": 153113989.0, "step": 88275 }, { "entropy": 5.35966477394104, "epoch": 6.8684691694222915, "grad_norm": 1.3046875, "learning_rate": 0.00015180456223307296, "loss": 4.6572, "mean_token_accuracy": 0.24257880449295044, "num_tokens": 153122486.0, "step": 88280 }, { "entropy": 5.353142881393433, "epoch": 6.868858198794009, "grad_norm": 1.3046875, "learning_rate": 0.0001517813712463195, "loss": 4.581, "mean_token_accuracy": 0.24803954511880874, "num_tokens": 153131023.0, "step": 88285 }, { "entropy": 5.3285778045654295, "epoch": 6.869247228165727, "grad_norm": 1.3203125, "learning_rate": 0.00015175818212921256, "loss": 4.5875, "mean_token_accuracy": 0.25140090435743334, "num_tokens": 153138931.0, "step": 88290 }, { "entropy": 5.3311262130737305, "epoch": 6.869636257537444, "grad_norm": 1.28125, "learning_rate": 0.00015173499488210408, "loss": 4.5069, "mean_token_accuracy": 0.24684303551912307, "num_tokens": 153147422.0, "step": 88295 }, { "entropy": 5.392298221588135, "epoch": 6.870025286909161, "grad_norm": 1.4375, "learning_rate": 0.0001517118095053458, "loss": 4.6771, "mean_token_accuracy": 0.23906631469726564, "num_tokens": 153155298.0, "step": 88300 }, { "entropy": 5.474166536331177, "epoch": 6.870414316280879, "grad_norm": 1.359375, "learning_rate": 0.00015168862599928965, "loss": 4.6768, "mean_token_accuracy": 0.24186852872371672, "num_tokens": 153163543.0, "step": 88305 }, { "entropy": 5.399763917922973, "epoch": 6.870803345652597, "grad_norm": 1.296875, "learning_rate": 0.00015166544436428733, "loss": 4.6819, "mean_token_accuracy": 0.23748457580804824, "num_tokens": 153173422.0, "step": 88310 }, { "entropy": 5.45841064453125, "epoch": 6.8711923750243145, "grad_norm": 1.296875, "learning_rate": 0.00015164226460069052, "loss": 4.7161, "mean_token_accuracy": 0.2328694835305214, "num_tokens": 153182226.0, "step": 88315 }, { "entropy": 5.440245294570923, "epoch": 6.871581404396032, "grad_norm": 1.34375, "learning_rate": 0.00015161908670885106, "loss": 4.7354, "mean_token_accuracy": 0.23037155121564865, "num_tokens": 153190992.0, "step": 88320 }, { "entropy": 5.33632173538208, "epoch": 6.87197043376775, "grad_norm": 1.265625, "learning_rate": 0.00015159591068912055, "loss": 4.5798, "mean_token_accuracy": 0.2459864780306816, "num_tokens": 153200359.0, "step": 88325 }, { "entropy": 5.435486602783203, "epoch": 6.872359463139467, "grad_norm": 1.375, "learning_rate": 0.0001515727365418507, "loss": 4.64, "mean_token_accuracy": 0.24065154790878296, "num_tokens": 153208890.0, "step": 88330 }, { "entropy": 5.363480758666992, "epoch": 6.872748492511184, "grad_norm": 1.4375, "learning_rate": 0.00015154956426739302, "loss": 4.6872, "mean_token_accuracy": 0.24278179705142974, "num_tokens": 153217083.0, "step": 88335 }, { "entropy": 5.3804277896881105, "epoch": 6.873137521882902, "grad_norm": 1.3125, "learning_rate": 0.00015152639386609935, "loss": 4.6653, "mean_token_accuracy": 0.23850482553243638, "num_tokens": 153226024.0, "step": 88340 }, { "entropy": 5.38779649734497, "epoch": 6.87352655125462, "grad_norm": 1.2578125, "learning_rate": 0.00015150322533832102, "loss": 4.6452, "mean_token_accuracy": 0.24300952553749083, "num_tokens": 153234364.0, "step": 88345 }, { "entropy": 5.379233932495117, "epoch": 6.8739155806263375, "grad_norm": 1.359375, "learning_rate": 0.00015148005868440966, "loss": 4.5847, "mean_token_accuracy": 0.2478453665971756, "num_tokens": 153243065.0, "step": 88350 }, { "entropy": 5.369056177139282, "epoch": 6.874304609998055, "grad_norm": 1.34375, "learning_rate": 0.0001514568939047169, "loss": 4.6209, "mean_token_accuracy": 0.23920433968305588, "num_tokens": 153251838.0, "step": 88355 }, { "entropy": 5.259841394424439, "epoch": 6.874693639369772, "grad_norm": 1.375, "learning_rate": 0.00015143373099959408, "loss": 4.5227, "mean_token_accuracy": 0.2548205733299255, "num_tokens": 153260144.0, "step": 88360 }, { "entropy": 5.362350940704346, "epoch": 6.87508266874149, "grad_norm": 1.3046875, "learning_rate": 0.0001514105699693928, "loss": 4.5921, "mean_token_accuracy": 0.2408697247505188, "num_tokens": 153268403.0, "step": 88365 }, { "entropy": 5.361438941955567, "epoch": 6.875471698113207, "grad_norm": 1.2421875, "learning_rate": 0.00015138741081446427, "loss": 4.6148, "mean_token_accuracy": 0.2431598886847496, "num_tokens": 153277658.0, "step": 88370 }, { "entropy": 5.4265604496002195, "epoch": 6.875860727484925, "grad_norm": 1.28125, "learning_rate": 0.0001513642535351602, "loss": 4.6898, "mean_token_accuracy": 0.22911168932914733, "num_tokens": 153286965.0, "step": 88375 }, { "entropy": 5.373702955245972, "epoch": 6.876249756856643, "grad_norm": 1.2890625, "learning_rate": 0.0001513410981318316, "loss": 4.6111, "mean_token_accuracy": 0.2453094944357872, "num_tokens": 153296225.0, "step": 88380 }, { "entropy": 5.433220052719117, "epoch": 6.8766387862283604, "grad_norm": 1.2890625, "learning_rate": 0.0001513179446048302, "loss": 4.6861, "mean_token_accuracy": 0.24074286818504334, "num_tokens": 153304558.0, "step": 88385 }, { "entropy": 5.422859764099121, "epoch": 6.877027815600078, "grad_norm": 1.328125, "learning_rate": 0.0001512947929545071, "loss": 4.6278, "mean_token_accuracy": 0.24786188900470735, "num_tokens": 153312853.0, "step": 88390 }, { "entropy": 5.354819917678833, "epoch": 6.877416844971796, "grad_norm": 1.3515625, "learning_rate": 0.00015127164318121353, "loss": 4.6232, "mean_token_accuracy": 0.24665165096521377, "num_tokens": 153321351.0, "step": 88395 }, { "entropy": 5.437063264846802, "epoch": 6.877805874343513, "grad_norm": 1.265625, "learning_rate": 0.0001512484952853009, "loss": 4.7449, "mean_token_accuracy": 0.2301986888051033, "num_tokens": 153330543.0, "step": 88400 }, { "entropy": 5.374841022491455, "epoch": 6.87819490371523, "grad_norm": 1.328125, "learning_rate": 0.00015122534926712033, "loss": 4.5833, "mean_token_accuracy": 0.24829187095165253, "num_tokens": 153338280.0, "step": 88405 }, { "entropy": 5.366238832473755, "epoch": 6.878583933086948, "grad_norm": 1.2265625, "learning_rate": 0.00015120220512702316, "loss": 4.6543, "mean_token_accuracy": 0.23877047896385192, "num_tokens": 153347573.0, "step": 88410 }, { "entropy": 5.316925811767578, "epoch": 6.878972962458666, "grad_norm": 1.4296875, "learning_rate": 0.0001511790628653603, "loss": 4.5607, "mean_token_accuracy": 0.24729665368795395, "num_tokens": 153355692.0, "step": 88415 }, { "entropy": 5.284665107727051, "epoch": 6.879361991830383, "grad_norm": 1.359375, "learning_rate": 0.00015115592248248326, "loss": 4.5906, "mean_token_accuracy": 0.23811761289834976, "num_tokens": 153364364.0, "step": 88420 }, { "entropy": 5.33720908164978, "epoch": 6.879751021202101, "grad_norm": 1.4609375, "learning_rate": 0.00015113278397874296, "loss": 4.6235, "mean_token_accuracy": 0.23832522481679916, "num_tokens": 153373703.0, "step": 88425 }, { "entropy": 5.423511409759522, "epoch": 6.880140050573818, "grad_norm": 1.3359375, "learning_rate": 0.00015110964735449045, "loss": 4.6948, "mean_token_accuracy": 0.23677553683519365, "num_tokens": 153382450.0, "step": 88430 }, { "entropy": 5.422382116317749, "epoch": 6.880529079945536, "grad_norm": 1.2890625, "learning_rate": 0.00015108651261007693, "loss": 4.6689, "mean_token_accuracy": 0.23492585122585297, "num_tokens": 153391298.0, "step": 88435 }, { "entropy": 5.438583135604858, "epoch": 6.880918109317253, "grad_norm": 1.3515625, "learning_rate": 0.00015106337974585325, "loss": 4.7183, "mean_token_accuracy": 0.23870889544487, "num_tokens": 153399968.0, "step": 88440 }, { "entropy": 5.338947391510009, "epoch": 6.881307138688971, "grad_norm": 1.375, "learning_rate": 0.0001510402487621706, "loss": 4.6171, "mean_token_accuracy": 0.23897689580917358, "num_tokens": 153408509.0, "step": 88445 }, { "entropy": 5.4103001117706295, "epoch": 6.881696168060689, "grad_norm": 1.3125, "learning_rate": 0.0001510171196593798, "loss": 4.7112, "mean_token_accuracy": 0.2342088595032692, "num_tokens": 153416739.0, "step": 88450 }, { "entropy": 5.399285936355591, "epoch": 6.882085197432406, "grad_norm": 1.28125, "learning_rate": 0.00015099399243783193, "loss": 4.6047, "mean_token_accuracy": 0.24574101716279984, "num_tokens": 153424400.0, "step": 88455 }, { "entropy": 5.348751020431519, "epoch": 6.882474226804124, "grad_norm": 1.2734375, "learning_rate": 0.00015097086709787777, "loss": 4.6183, "mean_token_accuracy": 0.2380060762166977, "num_tokens": 153432816.0, "step": 88460 }, { "entropy": 5.315586376190185, "epoch": 6.882863256175841, "grad_norm": 1.265625, "learning_rate": 0.0001509477436398684, "loss": 4.5249, "mean_token_accuracy": 0.24520407915115355, "num_tokens": 153441306.0, "step": 88465 }, { "entropy": 5.324357748031616, "epoch": 6.883252285547559, "grad_norm": 1.3359375, "learning_rate": 0.0001509246220641546, "loss": 4.5663, "mean_token_accuracy": 0.24802208691835403, "num_tokens": 153449755.0, "step": 88470 }, { "entropy": 5.436161947250366, "epoch": 6.883641314919276, "grad_norm": 1.3671875, "learning_rate": 0.00015090150237108703, "loss": 4.7054, "mean_token_accuracy": 0.239231376349926, "num_tokens": 153458084.0, "step": 88475 }, { "entropy": 5.2197277545928955, "epoch": 6.884030344290994, "grad_norm": 1.34375, "learning_rate": 0.00015087838456101664, "loss": 4.4909, "mean_token_accuracy": 0.25081573724746703, "num_tokens": 153467389.0, "step": 88480 }, { "entropy": 5.405291795730591, "epoch": 6.884419373662712, "grad_norm": 1.4921875, "learning_rate": 0.00015085526863429426, "loss": 4.6619, "mean_token_accuracy": 0.2323514476418495, "num_tokens": 153476991.0, "step": 88485 }, { "entropy": 5.402490663528442, "epoch": 6.884808403034429, "grad_norm": 1.4296875, "learning_rate": 0.0001508321545912706, "loss": 4.675, "mean_token_accuracy": 0.2405345171689987, "num_tokens": 153484907.0, "step": 88490 }, { "entropy": 5.410006809234619, "epoch": 6.885197432406146, "grad_norm": 1.34375, "learning_rate": 0.00015080904243229632, "loss": 4.7367, "mean_token_accuracy": 0.22872378975152968, "num_tokens": 153493758.0, "step": 88495 }, { "entropy": 5.322557020187378, "epoch": 6.885586461777864, "grad_norm": 2.28125, "learning_rate": 0.0001507859321577222, "loss": 4.5055, "mean_token_accuracy": 0.26338198482990266, "num_tokens": 153503236.0, "step": 88500 }, { "entropy": 5.365322875976562, "epoch": 6.885975491149582, "grad_norm": 1.375, "learning_rate": 0.0001507628237678989, "loss": 4.6712, "mean_token_accuracy": 0.23549790680408478, "num_tokens": 153512235.0, "step": 88505 }, { "entropy": 5.358061838150024, "epoch": 6.886364520521299, "grad_norm": 1.3046875, "learning_rate": 0.00015073971726317688, "loss": 4.673, "mean_token_accuracy": 0.23261573761701584, "num_tokens": 153520375.0, "step": 88510 }, { "entropy": 5.314078044891358, "epoch": 6.886753549893017, "grad_norm": 1.390625, "learning_rate": 0.00015071661264390697, "loss": 4.5405, "mean_token_accuracy": 0.24786121547222137, "num_tokens": 153528957.0, "step": 88515 }, { "entropy": 5.35184063911438, "epoch": 6.887142579264735, "grad_norm": 1.421875, "learning_rate": 0.00015069350991043956, "loss": 4.6625, "mean_token_accuracy": 0.24231164455413817, "num_tokens": 153538027.0, "step": 88520 }, { "entropy": 5.33264389038086, "epoch": 6.887531608636452, "grad_norm": 1.4453125, "learning_rate": 0.00015067040906312538, "loss": 4.5537, "mean_token_accuracy": 0.2541811317205429, "num_tokens": 153546800.0, "step": 88525 }, { "entropy": 5.360409688949585, "epoch": 6.88792063800817, "grad_norm": 1.5234375, "learning_rate": 0.00015064731010231474, "loss": 4.6154, "mean_token_accuracy": 0.23733845502138137, "num_tokens": 153554787.0, "step": 88530 }, { "entropy": 5.410138130187988, "epoch": 6.888309667379887, "grad_norm": 1.3828125, "learning_rate": 0.00015062421302835835, "loss": 4.6875, "mean_token_accuracy": 0.24595928490161895, "num_tokens": 153562990.0, "step": 88535 }, { "entropy": 5.366688299179077, "epoch": 6.888698696751605, "grad_norm": 1.2734375, "learning_rate": 0.00015060111784160647, "loss": 4.5895, "mean_token_accuracy": 0.2460399627685547, "num_tokens": 153571480.0, "step": 88540 }, { "entropy": 5.417804002761841, "epoch": 6.889087726123322, "grad_norm": 1.375, "learning_rate": 0.00015057802454240962, "loss": 4.6404, "mean_token_accuracy": 0.24600243270397187, "num_tokens": 153580281.0, "step": 88545 }, { "entropy": 5.3529750347137455, "epoch": 6.88947675549504, "grad_norm": 1.34375, "learning_rate": 0.00015055493313111828, "loss": 4.5554, "mean_token_accuracy": 0.2372136577963829, "num_tokens": 153588535.0, "step": 88550 }, { "entropy": 5.361924076080323, "epoch": 6.889865784866758, "grad_norm": 1.4140625, "learning_rate": 0.0001505318436080827, "loss": 4.6297, "mean_token_accuracy": 0.24531494379043578, "num_tokens": 153597183.0, "step": 88555 }, { "entropy": 5.418739175796508, "epoch": 6.8902548142384745, "grad_norm": 1.3515625, "learning_rate": 0.00015050875597365338, "loss": 4.6873, "mean_token_accuracy": 0.23992316275835038, "num_tokens": 153605279.0, "step": 88560 }, { "entropy": 5.323651075363159, "epoch": 6.890643843610192, "grad_norm": 1.3046875, "learning_rate": 0.00015048567022818042, "loss": 4.6088, "mean_token_accuracy": 0.24772369265556335, "num_tokens": 153613778.0, "step": 88565 }, { "entropy": 5.398797512054443, "epoch": 6.89103287298191, "grad_norm": 1.28125, "learning_rate": 0.0001504625863720143, "loss": 4.6958, "mean_token_accuracy": 0.23658832162618637, "num_tokens": 153623314.0, "step": 88570 }, { "entropy": 5.364537239074707, "epoch": 6.891421902353628, "grad_norm": 1.34375, "learning_rate": 0.00015043950440550514, "loss": 4.6143, "mean_token_accuracy": 0.23889920562505723, "num_tokens": 153631698.0, "step": 88575 }, { "entropy": 5.389769172668457, "epoch": 6.891810931725345, "grad_norm": 1.4296875, "learning_rate": 0.00015041642432900336, "loss": 4.606, "mean_token_accuracy": 0.24734739661216737, "num_tokens": 153639976.0, "step": 88580 }, { "entropy": 5.371002149581909, "epoch": 6.892199961097063, "grad_norm": 1.296875, "learning_rate": 0.000150393346142859, "loss": 4.5954, "mean_token_accuracy": 0.2475140392780304, "num_tokens": 153648509.0, "step": 88585 }, { "entropy": 5.300017929077148, "epoch": 6.892588990468781, "grad_norm": 1.40625, "learning_rate": 0.00015037026984742225, "loss": 4.5867, "mean_token_accuracy": 0.25273074209690094, "num_tokens": 153657183.0, "step": 88590 }, { "entropy": 5.32399435043335, "epoch": 6.892978019840498, "grad_norm": 1.28125, "learning_rate": 0.00015034719544304332, "loss": 4.5093, "mean_token_accuracy": 0.2505064830183983, "num_tokens": 153665211.0, "step": 88595 }, { "entropy": 5.3798675537109375, "epoch": 6.893367049212215, "grad_norm": 1.3125, "learning_rate": 0.00015032412293007223, "loss": 4.7012, "mean_token_accuracy": 0.23629248589277269, "num_tokens": 153674145.0, "step": 88600 }, { "entropy": 5.359813642501831, "epoch": 6.893756078583933, "grad_norm": 1.390625, "learning_rate": 0.0001503010523088592, "loss": 4.5537, "mean_token_accuracy": 0.24048223346471786, "num_tokens": 153682335.0, "step": 88605 }, { "entropy": 5.462742567062378, "epoch": 6.894145107955651, "grad_norm": 1.3359375, "learning_rate": 0.00015027798357975417, "loss": 4.7781, "mean_token_accuracy": 0.2250877559185028, "num_tokens": 153691118.0, "step": 88610 }, { "entropy": 5.392640924453735, "epoch": 6.894534137327368, "grad_norm": 1.328125, "learning_rate": 0.0001502549167431072, "loss": 4.62, "mean_token_accuracy": 0.24503267854452132, "num_tokens": 153699604.0, "step": 88615 }, { "entropy": 5.379016017913818, "epoch": 6.894923166699086, "grad_norm": 1.3359375, "learning_rate": 0.0001502318517992684, "loss": 4.6289, "mean_token_accuracy": 0.24392159730196, "num_tokens": 153708290.0, "step": 88620 }, { "entropy": 5.3818854808807375, "epoch": 6.895312196070804, "grad_norm": 1.4921875, "learning_rate": 0.00015020878874858756, "loss": 4.6647, "mean_token_accuracy": 0.24295762330293655, "num_tokens": 153717815.0, "step": 88625 }, { "entropy": 5.437975072860718, "epoch": 6.8957012254425205, "grad_norm": 1.3515625, "learning_rate": 0.00015018572759141485, "loss": 4.6778, "mean_token_accuracy": 0.24273097217082978, "num_tokens": 153726573.0, "step": 88630 }, { "entropy": 5.361535263061524, "epoch": 6.896090254814238, "grad_norm": 1.3671875, "learning_rate": 0.0001501626683281, "loss": 4.6174, "mean_token_accuracy": 0.23608837574720382, "num_tokens": 153735205.0, "step": 88635 }, { "entropy": 5.351504135131836, "epoch": 6.896479284185956, "grad_norm": 1.4296875, "learning_rate": 0.00015013961095899299, "loss": 4.606, "mean_token_accuracy": 0.24608503729104997, "num_tokens": 153743640.0, "step": 88640 }, { "entropy": 5.453222560882568, "epoch": 6.896868313557674, "grad_norm": 1.3359375, "learning_rate": 0.00015011655548444357, "loss": 4.6885, "mean_token_accuracy": 0.24106051176786422, "num_tokens": 153751937.0, "step": 88645 }, { "entropy": 5.416488885879517, "epoch": 6.897257342929391, "grad_norm": 1.2890625, "learning_rate": 0.00015009350190480172, "loss": 4.6753, "mean_token_accuracy": 0.2332911878824234, "num_tokens": 153760013.0, "step": 88650 }, { "entropy": 5.406840467453003, "epoch": 6.897646372301109, "grad_norm": 1.2265625, "learning_rate": 0.0001500704502204171, "loss": 4.6684, "mean_token_accuracy": 0.23459284156560897, "num_tokens": 153770273.0, "step": 88655 }, { "entropy": 5.388297986984253, "epoch": 6.898035401672827, "grad_norm": 1.3125, "learning_rate": 0.00015004740043163966, "loss": 4.5973, "mean_token_accuracy": 0.23962300419807434, "num_tokens": 153779557.0, "step": 88660 }, { "entropy": 5.403120231628418, "epoch": 6.8984244310445435, "grad_norm": 1.3046875, "learning_rate": 0.00015002435253881903, "loss": 4.631, "mean_token_accuracy": 0.2403094843029976, "num_tokens": 153788417.0, "step": 88665 }, { "entropy": 5.378290271759033, "epoch": 6.898813460416261, "grad_norm": 1.3359375, "learning_rate": 0.0001500013065423048, "loss": 4.6305, "mean_token_accuracy": 0.24351128190755844, "num_tokens": 153797499.0, "step": 88670 }, { "entropy": 5.314743232727051, "epoch": 6.899202489787979, "grad_norm": 1.234375, "learning_rate": 0.0001499782624424469, "loss": 4.5561, "mean_token_accuracy": 0.24375635385513306, "num_tokens": 153805990.0, "step": 88675 }, { "entropy": 5.455041885375977, "epoch": 6.899591519159697, "grad_norm": 1.3125, "learning_rate": 0.00014995522023959475, "loss": 4.7503, "mean_token_accuracy": 0.23148346543312073, "num_tokens": 153814408.0, "step": 88680 }, { "entropy": 5.41623010635376, "epoch": 6.899980548531414, "grad_norm": 1.296875, "learning_rate": 0.0001499321799340982, "loss": 4.698, "mean_token_accuracy": 0.23474262058734893, "num_tokens": 153823551.0, "step": 88685 }, { "entropy": 5.392134141921997, "epoch": 6.900369577903132, "grad_norm": 1.3671875, "learning_rate": 0.0001499091415263068, "loss": 4.6944, "mean_token_accuracy": 0.23647865056991577, "num_tokens": 153832775.0, "step": 88690 }, { "entropy": 5.440068912506104, "epoch": 6.900758607274849, "grad_norm": 1.359375, "learning_rate": 0.00014988610501656997, "loss": 4.7012, "mean_token_accuracy": 0.23734313547611235, "num_tokens": 153841311.0, "step": 88695 }, { "entropy": 5.4537450790405275, "epoch": 6.9011476366465665, "grad_norm": 1.28125, "learning_rate": 0.00014986307040523744, "loss": 4.7385, "mean_token_accuracy": 0.23397668898105622, "num_tokens": 153850542.0, "step": 88700 }, { "entropy": 5.412152576446533, "epoch": 6.901536666018284, "grad_norm": 1.4609375, "learning_rate": 0.00014984003769265858, "loss": 4.6798, "mean_token_accuracy": 0.23768652379512786, "num_tokens": 153858840.0, "step": 88705 }, { "entropy": 5.4229193210601805, "epoch": 6.901925695390002, "grad_norm": 1.2421875, "learning_rate": 0.000149817006879183, "loss": 4.6352, "mean_token_accuracy": 0.240244522690773, "num_tokens": 153868019.0, "step": 88710 }, { "entropy": 5.383130836486816, "epoch": 6.90231472476172, "grad_norm": 1.3046875, "learning_rate": 0.00014979397796516003, "loss": 4.5863, "mean_token_accuracy": 0.2476246774196625, "num_tokens": 153876637.0, "step": 88715 }, { "entropy": 5.264183044433594, "epoch": 6.902703754133437, "grad_norm": 1.28125, "learning_rate": 0.00014977095095093922, "loss": 4.5738, "mean_token_accuracy": 0.24169825315475463, "num_tokens": 153885272.0, "step": 88720 }, { "entropy": 5.344964647293091, "epoch": 6.903092783505155, "grad_norm": 1.3828125, "learning_rate": 0.0001497479258368698, "loss": 4.6695, "mean_token_accuracy": 0.24257688820362092, "num_tokens": 153894645.0, "step": 88725 }, { "entropy": 5.396985769271851, "epoch": 6.903481812876873, "grad_norm": 1.265625, "learning_rate": 0.00014972490262330136, "loss": 4.7219, "mean_token_accuracy": 0.2377770110964775, "num_tokens": 153903319.0, "step": 88730 }, { "entropy": 5.427166509628296, "epoch": 6.9038708422485895, "grad_norm": 1.359375, "learning_rate": 0.00014970188131058305, "loss": 4.6862, "mean_token_accuracy": 0.2332024395465851, "num_tokens": 153912570.0, "step": 88735 }, { "entropy": 5.3763445854187015, "epoch": 6.904259871620307, "grad_norm": 1.2265625, "learning_rate": 0.0001496788618990643, "loss": 4.6162, "mean_token_accuracy": 0.23665273934602737, "num_tokens": 153921525.0, "step": 88740 }, { "entropy": 5.463285827636719, "epoch": 6.904648900992025, "grad_norm": 1.2890625, "learning_rate": 0.00014965584438909435, "loss": 4.7431, "mean_token_accuracy": 0.2298821583390236, "num_tokens": 153929899.0, "step": 88745 }, { "entropy": 5.459270572662353, "epoch": 6.905037930363743, "grad_norm": 1.6171875, "learning_rate": 0.0001496328287810224, "loss": 4.7853, "mean_token_accuracy": 0.22772430032491683, "num_tokens": 153938147.0, "step": 88750 }, { "entropy": 5.377769041061401, "epoch": 6.90542695973546, "grad_norm": 1.2890625, "learning_rate": 0.0001496098150751978, "loss": 4.6621, "mean_token_accuracy": 0.24288063496351242, "num_tokens": 153946540.0, "step": 88755 }, { "entropy": 5.4588418960571286, "epoch": 6.905815989107178, "grad_norm": 1.234375, "learning_rate": 0.00014958680327196964, "loss": 4.7277, "mean_token_accuracy": 0.23587173372507095, "num_tokens": 153955765.0, "step": 88760 }, { "entropy": 5.425323343276977, "epoch": 6.906205018478895, "grad_norm": 1.3046875, "learning_rate": 0.00014956379337168716, "loss": 4.6473, "mean_token_accuracy": 0.24373477846384048, "num_tokens": 153964491.0, "step": 88765 }, { "entropy": 5.483047008514404, "epoch": 6.9065940478506125, "grad_norm": 1.2734375, "learning_rate": 0.0001495407853746995, "loss": 4.7523, "mean_token_accuracy": 0.22818804234266282, "num_tokens": 153973755.0, "step": 88770 }, { "entropy": 5.374415159225464, "epoch": 6.90698307722233, "grad_norm": 1.3671875, "learning_rate": 0.00014951777928135562, "loss": 4.6045, "mean_token_accuracy": 0.25326897352933886, "num_tokens": 153981638.0, "step": 88775 }, { "entropy": 5.362479400634766, "epoch": 6.907372106594048, "grad_norm": 1.3671875, "learning_rate": 0.0001494947750920048, "loss": 4.6247, "mean_token_accuracy": 0.2423771321773529, "num_tokens": 153989990.0, "step": 88780 }, { "entropy": 5.415796852111816, "epoch": 6.907761135965766, "grad_norm": 1.3984375, "learning_rate": 0.00014947177280699597, "loss": 4.6072, "mean_token_accuracy": 0.24769791811704636, "num_tokens": 153998712.0, "step": 88785 }, { "entropy": 5.392825317382813, "epoch": 6.908150165337483, "grad_norm": 1.40625, "learning_rate": 0.00014944877242667823, "loss": 4.6781, "mean_token_accuracy": 0.243703892827034, "num_tokens": 154007872.0, "step": 88790 }, { "entropy": 5.363379859924317, "epoch": 6.908539194709201, "grad_norm": 1.265625, "learning_rate": 0.00014942577395140046, "loss": 4.5588, "mean_token_accuracy": 0.24871378242969513, "num_tokens": 154017131.0, "step": 88795 }, { "entropy": 5.362335824966431, "epoch": 6.908928224080918, "grad_norm": 1.359375, "learning_rate": 0.00014940277738151176, "loss": 4.6069, "mean_token_accuracy": 0.2406286746263504, "num_tokens": 154025236.0, "step": 88800 }, { "entropy": 5.411101818084717, "epoch": 6.9093172534526355, "grad_norm": 1.421875, "learning_rate": 0.00014937978271736092, "loss": 4.7486, "mean_token_accuracy": 0.23224181532859803, "num_tokens": 154033619.0, "step": 88805 }, { "entropy": 5.4426836490631105, "epoch": 6.909706282824353, "grad_norm": 1.3515625, "learning_rate": 0.00014935678995929704, "loss": 4.7387, "mean_token_accuracy": 0.23622021526098252, "num_tokens": 154043214.0, "step": 88810 }, { "entropy": 5.3304368019104, "epoch": 6.910095312196071, "grad_norm": 1.2421875, "learning_rate": 0.00014933379910766882, "loss": 4.5603, "mean_token_accuracy": 0.2521576344966888, "num_tokens": 154051915.0, "step": 88815 }, { "entropy": 5.470569324493408, "epoch": 6.910484341567789, "grad_norm": 1.546875, "learning_rate": 0.00014931081016282516, "loss": 4.7359, "mean_token_accuracy": 0.23914235532283784, "num_tokens": 154060406.0, "step": 88820 }, { "entropy": 5.425373601913452, "epoch": 6.910873370939506, "grad_norm": 1.4453125, "learning_rate": 0.00014928782312511498, "loss": 4.7062, "mean_token_accuracy": 0.23121155947446823, "num_tokens": 154068218.0, "step": 88825 }, { "entropy": 5.330532073974609, "epoch": 6.911262400311223, "grad_norm": 1.390625, "learning_rate": 0.00014926483799488694, "loss": 4.5581, "mean_token_accuracy": 0.24465374648571014, "num_tokens": 154076714.0, "step": 88830 }, { "entropy": 5.349448299407959, "epoch": 6.911651429682941, "grad_norm": 1.3671875, "learning_rate": 0.0001492418547724899, "loss": 4.6414, "mean_token_accuracy": 0.237048676609993, "num_tokens": 154085457.0, "step": 88835 }, { "entropy": 5.308164501190186, "epoch": 6.9120404590546585, "grad_norm": 1.359375, "learning_rate": 0.0001492188734582725, "loss": 4.5091, "mean_token_accuracy": 0.24974465370178223, "num_tokens": 154094473.0, "step": 88840 }, { "entropy": 5.460560274124146, "epoch": 6.912429488426376, "grad_norm": 1.3125, "learning_rate": 0.00014919589405258354, "loss": 4.7241, "mean_token_accuracy": 0.24056214988231658, "num_tokens": 154104027.0, "step": 88845 }, { "entropy": 5.396836137771606, "epoch": 6.912818517798094, "grad_norm": 1.421875, "learning_rate": 0.00014917291655577164, "loss": 4.62, "mean_token_accuracy": 0.24340587705373765, "num_tokens": 154112264.0, "step": 88850 }, { "entropy": 5.378000068664551, "epoch": 6.913207547169812, "grad_norm": 1.359375, "learning_rate": 0.0001491499409681854, "loss": 4.5758, "mean_token_accuracy": 0.2447158008813858, "num_tokens": 154120628.0, "step": 88855 }, { "entropy": 5.436779499053955, "epoch": 6.913596576541529, "grad_norm": 1.3203125, "learning_rate": 0.0001491269672901736, "loss": 4.697, "mean_token_accuracy": 0.2351957693696022, "num_tokens": 154128880.0, "step": 88860 }, { "entropy": 5.406386232376098, "epoch": 6.913985605913246, "grad_norm": 1.3125, "learning_rate": 0.00014910399552208462, "loss": 4.6636, "mean_token_accuracy": 0.2437896892428398, "num_tokens": 154137732.0, "step": 88865 }, { "entropy": 5.392245674133301, "epoch": 6.914374635284964, "grad_norm": 1.359375, "learning_rate": 0.00014908102566426722, "loss": 4.732, "mean_token_accuracy": 0.23933811038732528, "num_tokens": 154146460.0, "step": 88870 }, { "entropy": 5.4168447971344, "epoch": 6.9147636646566815, "grad_norm": 1.3515625, "learning_rate": 0.0001490580577170697, "loss": 4.6285, "mean_token_accuracy": 0.23783452808856964, "num_tokens": 154155673.0, "step": 88875 }, { "entropy": 5.365446329116821, "epoch": 6.915152694028399, "grad_norm": 1.328125, "learning_rate": 0.0001490350916808408, "loss": 4.569, "mean_token_accuracy": 0.2479272663593292, "num_tokens": 154164113.0, "step": 88880 }, { "entropy": 5.377678632736206, "epoch": 6.915541723400117, "grad_norm": 1.5625, "learning_rate": 0.00014901212755592886, "loss": 4.5499, "mean_token_accuracy": 0.24989526271820067, "num_tokens": 154172339.0, "step": 88885 }, { "entropy": 5.415231561660766, "epoch": 6.9159307527718346, "grad_norm": 1.46875, "learning_rate": 0.00014898916534268231, "loss": 4.7237, "mean_token_accuracy": 0.23434912115335466, "num_tokens": 154180950.0, "step": 88890 }, { "entropy": 5.403679418563843, "epoch": 6.916319782143551, "grad_norm": 1.375, "learning_rate": 0.0001489662050414497, "loss": 4.6958, "mean_token_accuracy": 0.2301421731710434, "num_tokens": 154189976.0, "step": 88895 }, { "entropy": 5.339669847488404, "epoch": 6.916708811515269, "grad_norm": 1.3359375, "learning_rate": 0.00014894324665257923, "loss": 4.6941, "mean_token_accuracy": 0.23756337612867356, "num_tokens": 154199141.0, "step": 88900 }, { "entropy": 5.474231481552124, "epoch": 6.917097840886987, "grad_norm": 1.421875, "learning_rate": 0.0001489202901764195, "loss": 4.74, "mean_token_accuracy": 0.2249201714992523, "num_tokens": 154207490.0, "step": 88905 }, { "entropy": 5.354945850372315, "epoch": 6.9174868702587045, "grad_norm": 1.296875, "learning_rate": 0.00014889733561331854, "loss": 4.5651, "mean_token_accuracy": 0.24673629105091094, "num_tokens": 154215466.0, "step": 88910 }, { "entropy": 5.389419221878052, "epoch": 6.917875899630422, "grad_norm": 1.296875, "learning_rate": 0.0001488743829636249, "loss": 4.6201, "mean_token_accuracy": 0.2440054953098297, "num_tokens": 154223755.0, "step": 88915 }, { "entropy": 5.3603808879852295, "epoch": 6.91826492900214, "grad_norm": 1.40625, "learning_rate": 0.00014885143222768667, "loss": 4.633, "mean_token_accuracy": 0.23934358954429627, "num_tokens": 154232145.0, "step": 88920 }, { "entropy": 5.429491329193115, "epoch": 6.9186539583738575, "grad_norm": 1.28125, "learning_rate": 0.00014882848340585226, "loss": 4.6731, "mean_token_accuracy": 0.2424626350402832, "num_tokens": 154240497.0, "step": 88925 }, { "entropy": 5.463003158569336, "epoch": 6.919042987745575, "grad_norm": 1.4453125, "learning_rate": 0.00014880553649846968, "loss": 4.6586, "mean_token_accuracy": 0.24005881249904631, "num_tokens": 154248277.0, "step": 88930 }, { "entropy": 5.438874101638794, "epoch": 6.919432017117292, "grad_norm": 1.34375, "learning_rate": 0.0001487825915058873, "loss": 4.6762, "mean_token_accuracy": 0.23755115270614624, "num_tokens": 154256900.0, "step": 88935 }, { "entropy": 5.45291838645935, "epoch": 6.91982104648901, "grad_norm": 1.2421875, "learning_rate": 0.00014875964842845326, "loss": 4.6464, "mean_token_accuracy": 0.23750597089529038, "num_tokens": 154265696.0, "step": 88940 }, { "entropy": 5.405448961257934, "epoch": 6.9202100758607274, "grad_norm": 1.3671875, "learning_rate": 0.00014873670726651538, "loss": 4.604, "mean_token_accuracy": 0.2416668251156807, "num_tokens": 154273642.0, "step": 88945 }, { "entropy": 5.356413412094116, "epoch": 6.920599105232445, "grad_norm": 1.3359375, "learning_rate": 0.0001487137680204222, "loss": 4.569, "mean_token_accuracy": 0.24781796634197234, "num_tokens": 154282710.0, "step": 88950 }, { "entropy": 5.3680166721344, "epoch": 6.920988134604163, "grad_norm": 1.3203125, "learning_rate": 0.00014869083069052154, "loss": 4.6397, "mean_token_accuracy": 0.2388213947415352, "num_tokens": 154292155.0, "step": 88955 }, { "entropy": 5.375840091705323, "epoch": 6.9213771639758805, "grad_norm": 1.359375, "learning_rate": 0.00014866789527716152, "loss": 4.6814, "mean_token_accuracy": 0.23245272785425186, "num_tokens": 154301384.0, "step": 88960 }, { "entropy": 5.5019118309021, "epoch": 6.921766193347597, "grad_norm": 1.5703125, "learning_rate": 0.00014864496178069008, "loss": 4.8468, "mean_token_accuracy": 0.22896925657987593, "num_tokens": 154310280.0, "step": 88965 }, { "entropy": 5.354854583740234, "epoch": 6.922155222719315, "grad_norm": 1.3671875, "learning_rate": 0.00014862203020145522, "loss": 4.5109, "mean_token_accuracy": 0.2543661996722221, "num_tokens": 154318803.0, "step": 88970 }, { "entropy": 5.372418355941773, "epoch": 6.922544252091033, "grad_norm": 1.375, "learning_rate": 0.00014859910053980496, "loss": 4.6414, "mean_token_accuracy": 0.23671648502349854, "num_tokens": 154328008.0, "step": 88975 }, { "entropy": 5.423726034164429, "epoch": 6.92293328146275, "grad_norm": 1.3515625, "learning_rate": 0.00014857617279608705, "loss": 4.7479, "mean_token_accuracy": 0.23334934413433076, "num_tokens": 154336521.0, "step": 88980 }, { "entropy": 5.464918184280395, "epoch": 6.923322310834468, "grad_norm": 1.1875, "learning_rate": 0.0001485532469706496, "loss": 4.7255, "mean_token_accuracy": 0.23467402756214142, "num_tokens": 154346488.0, "step": 88985 }, { "entropy": 5.411870670318604, "epoch": 6.923711340206186, "grad_norm": 1.4453125, "learning_rate": 0.0001485303230638403, "loss": 4.6032, "mean_token_accuracy": 0.2423005759716034, "num_tokens": 154355114.0, "step": 88990 }, { "entropy": 5.421051740646362, "epoch": 6.9241003695779035, "grad_norm": 1.2578125, "learning_rate": 0.00014850740107600708, "loss": 4.5996, "mean_token_accuracy": 0.2515360161662102, "num_tokens": 154364247.0, "step": 88995 }, { "entropy": 5.367387390136718, "epoch": 6.92448939894962, "grad_norm": 1.34375, "learning_rate": 0.00014848448100749766, "loss": 4.5719, "mean_token_accuracy": 0.24476806521415712, "num_tokens": 154373127.0, "step": 89000 }, { "entropy": 5.367836380004883, "epoch": 6.924878428321338, "grad_norm": 1.34375, "learning_rate": 0.00014846156285865998, "loss": 4.6545, "mean_token_accuracy": 0.23831048756837844, "num_tokens": 154381719.0, "step": 89005 }, { "entropy": 5.362370204925537, "epoch": 6.925267457693056, "grad_norm": 1.4375, "learning_rate": 0.00014843864662984158, "loss": 4.5698, "mean_token_accuracy": 0.248913012444973, "num_tokens": 154389292.0, "step": 89010 }, { "entropy": 5.404021453857422, "epoch": 6.925656487064773, "grad_norm": 1.3515625, "learning_rate": 0.00014841573232139026, "loss": 4.6313, "mean_token_accuracy": 0.24815889447927475, "num_tokens": 154398109.0, "step": 89015 }, { "entropy": 5.400536823272705, "epoch": 6.926045516436491, "grad_norm": 1.4453125, "learning_rate": 0.0001483928199336538, "loss": 4.737, "mean_token_accuracy": 0.23297124207019806, "num_tokens": 154406456.0, "step": 89020 }, { "entropy": 5.34310302734375, "epoch": 6.926434545808209, "grad_norm": 1.2578125, "learning_rate": 0.0001483699094669797, "loss": 4.66, "mean_token_accuracy": 0.23603852093219757, "num_tokens": 154415541.0, "step": 89025 }, { "entropy": 5.37505521774292, "epoch": 6.926823575179926, "grad_norm": 1.3046875, "learning_rate": 0.0001483470009217158, "loss": 4.611, "mean_token_accuracy": 0.24516281336545945, "num_tokens": 154423914.0, "step": 89030 }, { "entropy": 5.309968662261963, "epoch": 6.927212604551643, "grad_norm": 1.2578125, "learning_rate": 0.00014832409429820943, "loss": 4.5432, "mean_token_accuracy": 0.24795085191726685, "num_tokens": 154432422.0, "step": 89035 }, { "entropy": 5.2854986667633055, "epoch": 6.927601633923361, "grad_norm": 1.265625, "learning_rate": 0.0001483011895968084, "loss": 4.5448, "mean_token_accuracy": 0.24606788754463196, "num_tokens": 154441347.0, "step": 89040 }, { "entropy": 5.414838266372681, "epoch": 6.927990663295079, "grad_norm": 1.3203125, "learning_rate": 0.00014827828681786019, "loss": 4.7312, "mean_token_accuracy": 0.23057265281677247, "num_tokens": 154449041.0, "step": 89045 }, { "entropy": 5.471208620071411, "epoch": 6.928379692666796, "grad_norm": 1.34375, "learning_rate": 0.00014825538596171218, "loss": 4.7599, "mean_token_accuracy": 0.24007384330034257, "num_tokens": 154457464.0, "step": 89050 }, { "entropy": 5.34762544631958, "epoch": 6.928768722038514, "grad_norm": 1.421875, "learning_rate": 0.000148232487028712, "loss": 4.6027, "mean_token_accuracy": 0.2399534210562706, "num_tokens": 154467043.0, "step": 89055 }, { "entropy": 5.368239974975586, "epoch": 6.929157751410232, "grad_norm": 1.3046875, "learning_rate": 0.00014820959001920703, "loss": 4.6473, "mean_token_accuracy": 0.23976270258426666, "num_tokens": 154475673.0, "step": 89060 }, { "entropy": 5.405302906036377, "epoch": 6.9295467807819495, "grad_norm": 1.2421875, "learning_rate": 0.00014818669493354476, "loss": 4.7115, "mean_token_accuracy": 0.23475291281938554, "num_tokens": 154485004.0, "step": 89065 }, { "entropy": 5.426081895828247, "epoch": 6.929935810153666, "grad_norm": 1.3515625, "learning_rate": 0.0001481638017720725, "loss": 4.6879, "mean_token_accuracy": 0.2377195507287979, "num_tokens": 154492940.0, "step": 89070 }, { "entropy": 5.415059900283813, "epoch": 6.930324839525384, "grad_norm": 1.3125, "learning_rate": 0.00014814091053513774, "loss": 4.7132, "mean_token_accuracy": 0.23442801982164382, "num_tokens": 154501868.0, "step": 89075 }, { "entropy": 5.449075508117676, "epoch": 6.930713868897102, "grad_norm": 1.2578125, "learning_rate": 0.00014811802122308764, "loss": 4.6945, "mean_token_accuracy": 0.23550050258636473, "num_tokens": 154511157.0, "step": 89080 }, { "entropy": 5.425273084640503, "epoch": 6.931102898268819, "grad_norm": 1.328125, "learning_rate": 0.00014809513383626965, "loss": 4.6539, "mean_token_accuracy": 0.24211314767599107, "num_tokens": 154520040.0, "step": 89085 }, { "entropy": 5.3271942138671875, "epoch": 6.931491927640537, "grad_norm": 1.296875, "learning_rate": 0.0001480722483750311, "loss": 4.5422, "mean_token_accuracy": 0.246901473402977, "num_tokens": 154528437.0, "step": 89090 }, { "entropy": 5.3887749195098875, "epoch": 6.931880957012254, "grad_norm": 1.34375, "learning_rate": 0.00014804936483971904, "loss": 4.6365, "mean_token_accuracy": 0.244598126411438, "num_tokens": 154537237.0, "step": 89095 }, { "entropy": 5.414426851272583, "epoch": 6.932269986383972, "grad_norm": 1.3359375, "learning_rate": 0.00014802648323068092, "loss": 4.7201, "mean_token_accuracy": 0.23871537148952485, "num_tokens": 154546365.0, "step": 89100 }, { "entropy": 5.468905115127564, "epoch": 6.932659015755689, "grad_norm": 1.3203125, "learning_rate": 0.0001480036035482637, "loss": 4.7367, "mean_token_accuracy": 0.23453299552202225, "num_tokens": 154555435.0, "step": 89105 }, { "entropy": 5.376213884353637, "epoch": 6.933048045127407, "grad_norm": 1.2578125, "learning_rate": 0.00014798072579281474, "loss": 4.5957, "mean_token_accuracy": 0.24060264527797698, "num_tokens": 154564433.0, "step": 89110 }, { "entropy": 5.389183568954468, "epoch": 6.933437074499125, "grad_norm": 1.265625, "learning_rate": 0.00014795784996468104, "loss": 4.6555, "mean_token_accuracy": 0.23508816510438918, "num_tokens": 154572774.0, "step": 89115 }, { "entropy": 5.3720166206359865, "epoch": 6.933826103870842, "grad_norm": 1.2890625, "learning_rate": 0.00014793497606420985, "loss": 4.5838, "mean_token_accuracy": 0.24755021631717683, "num_tokens": 154581697.0, "step": 89120 }, { "entropy": 5.342128944396973, "epoch": 6.93421513324256, "grad_norm": 1.296875, "learning_rate": 0.00014791210409174812, "loss": 4.592, "mean_token_accuracy": 0.24848069101572037, "num_tokens": 154590552.0, "step": 89125 }, { "entropy": 5.415431642532349, "epoch": 6.934604162614278, "grad_norm": 1.28125, "learning_rate": 0.00014788923404764287, "loss": 4.6666, "mean_token_accuracy": 0.24274978339672088, "num_tokens": 154599254.0, "step": 89130 }, { "entropy": 5.390441226959228, "epoch": 6.934993191985995, "grad_norm": 1.4453125, "learning_rate": 0.00014786636593224124, "loss": 4.6502, "mean_token_accuracy": 0.23763030767440796, "num_tokens": 154607415.0, "step": 89135 }, { "entropy": 5.307901191711426, "epoch": 6.935382221357712, "grad_norm": 1.3046875, "learning_rate": 0.0001478434997458901, "loss": 4.5256, "mean_token_accuracy": 0.24955178648233414, "num_tokens": 154616241.0, "step": 89140 }, { "entropy": 5.407774877548218, "epoch": 6.93577125072943, "grad_norm": 1.4453125, "learning_rate": 0.00014782063548893643, "loss": 4.714, "mean_token_accuracy": 0.24256534576416017, "num_tokens": 154625360.0, "step": 89145 }, { "entropy": 5.325503540039063, "epoch": 6.936160280101148, "grad_norm": 1.25, "learning_rate": 0.0001477977731617273, "loss": 4.5909, "mean_token_accuracy": 0.24459605515003205, "num_tokens": 154634113.0, "step": 89150 }, { "entropy": 5.408359622955322, "epoch": 6.936549309472865, "grad_norm": 1.3046875, "learning_rate": 0.0001477749127646094, "loss": 4.6004, "mean_token_accuracy": 0.2532923996448517, "num_tokens": 154642465.0, "step": 89155 }, { "entropy": 5.376912546157837, "epoch": 6.936938338844583, "grad_norm": 1.1484375, "learning_rate": 0.00014775205429792978, "loss": 4.6709, "mean_token_accuracy": 0.24223071634769439, "num_tokens": 154652147.0, "step": 89160 }, { "entropy": 5.3498961448669435, "epoch": 6.9373273682163, "grad_norm": 1.2890625, "learning_rate": 0.00014772919776203514, "loss": 4.6597, "mean_token_accuracy": 0.24013046473264693, "num_tokens": 154661032.0, "step": 89165 }, { "entropy": 5.330604982376099, "epoch": 6.937716397588018, "grad_norm": 1.3125, "learning_rate": 0.0001477063431572724, "loss": 4.5731, "mean_token_accuracy": 0.24241770505905152, "num_tokens": 154669619.0, "step": 89170 }, { "entropy": 5.3827215194702145, "epoch": 6.938105426959735, "grad_norm": 1.375, "learning_rate": 0.00014768349048398824, "loss": 4.6507, "mean_token_accuracy": 0.23760260939598082, "num_tokens": 154678371.0, "step": 89175 }, { "entropy": 5.397452306747437, "epoch": 6.938494456331453, "grad_norm": 1.234375, "learning_rate": 0.00014766063974252952, "loss": 4.6349, "mean_token_accuracy": 0.2434176579117775, "num_tokens": 154687436.0, "step": 89180 }, { "entropy": 5.413670301437378, "epoch": 6.938883485703171, "grad_norm": 1.3984375, "learning_rate": 0.00014763779093324283, "loss": 4.7116, "mean_token_accuracy": 0.23392346799373626, "num_tokens": 154696436.0, "step": 89185 }, { "entropy": 5.301106691360474, "epoch": 6.939272515074888, "grad_norm": 1.4765625, "learning_rate": 0.00014761494405647504, "loss": 4.5834, "mean_token_accuracy": 0.24431550949811937, "num_tokens": 154704427.0, "step": 89190 }, { "entropy": 5.436334609985352, "epoch": 6.939661544446606, "grad_norm": 1.4453125, "learning_rate": 0.00014759209911257266, "loss": 4.6351, "mean_token_accuracy": 0.24093306362628936, "num_tokens": 154712908.0, "step": 89195 }, { "entropy": 5.389294767379761, "epoch": 6.940050573818323, "grad_norm": 1.3203125, "learning_rate": 0.00014756925610188244, "loss": 4.5574, "mean_token_accuracy": 0.2498522937297821, "num_tokens": 154720924.0, "step": 89200 }, { "entropy": 5.375076961517334, "epoch": 6.940439603190041, "grad_norm": 1.3671875, "learning_rate": 0.00014754641502475092, "loss": 4.6861, "mean_token_accuracy": 0.2447671741247177, "num_tokens": 154730057.0, "step": 89205 }, { "entropy": 5.354050970077514, "epoch": 6.940828632561758, "grad_norm": 1.3203125, "learning_rate": 0.00014752357588152453, "loss": 4.6448, "mean_token_accuracy": 0.24666367769241332, "num_tokens": 154739487.0, "step": 89210 }, { "entropy": 5.401321744918823, "epoch": 6.941217661933476, "grad_norm": 1.328125, "learning_rate": 0.00014750073867255022, "loss": 4.6176, "mean_token_accuracy": 0.24435776323080063, "num_tokens": 154748296.0, "step": 89215 }, { "entropy": 5.315762090682983, "epoch": 6.941606691305194, "grad_norm": 1.3515625, "learning_rate": 0.00014747790339817408, "loss": 4.5575, "mean_token_accuracy": 0.24421963840723038, "num_tokens": 154756626.0, "step": 89220 }, { "entropy": 5.4273017883300785, "epoch": 6.941995720676911, "grad_norm": 1.328125, "learning_rate": 0.0001474550700587429, "loss": 4.7088, "mean_token_accuracy": 0.24053658694028854, "num_tokens": 154765050.0, "step": 89225 }, { "entropy": 5.385556077957153, "epoch": 6.942384750048628, "grad_norm": 1.4296875, "learning_rate": 0.00014743223865460296, "loss": 4.5947, "mean_token_accuracy": 0.2428887516260147, "num_tokens": 154773096.0, "step": 89230 }, { "entropy": 5.363854932785034, "epoch": 6.942773779420346, "grad_norm": 1.265625, "learning_rate": 0.00014740940918610079, "loss": 4.5852, "mean_token_accuracy": 0.2441806823015213, "num_tokens": 154781484.0, "step": 89235 }, { "entropy": 5.340217876434326, "epoch": 6.943162808792064, "grad_norm": 1.3203125, "learning_rate": 0.0001473865816535828, "loss": 4.5634, "mean_token_accuracy": 0.2563501000404358, "num_tokens": 154790605.0, "step": 89240 }, { "entropy": 5.378575277328491, "epoch": 6.943551838163781, "grad_norm": 1.2578125, "learning_rate": 0.0001473637560573952, "loss": 4.5914, "mean_token_accuracy": 0.24379443973302842, "num_tokens": 154799472.0, "step": 89245 }, { "entropy": 5.454685974121094, "epoch": 6.943940867535499, "grad_norm": 1.3125, "learning_rate": 0.00014734093239788458, "loss": 4.7598, "mean_token_accuracy": 0.2374058872461319, "num_tokens": 154808220.0, "step": 89250 }, { "entropy": 5.425030899047852, "epoch": 6.944329896907217, "grad_norm": 1.3046875, "learning_rate": 0.00014731811067539698, "loss": 4.671, "mean_token_accuracy": 0.23419081717729567, "num_tokens": 154816971.0, "step": 89255 }, { "entropy": 5.335069847106934, "epoch": 6.944718926278934, "grad_norm": 1.3203125, "learning_rate": 0.00014729529089027894, "loss": 4.631, "mean_token_accuracy": 0.24452994465827943, "num_tokens": 154826000.0, "step": 89260 }, { "entropy": 5.45575647354126, "epoch": 6.945107955650652, "grad_norm": 1.40625, "learning_rate": 0.00014727247304287649, "loss": 4.6808, "mean_token_accuracy": 0.2457893654704094, "num_tokens": 154834454.0, "step": 89265 }, { "entropy": 5.414825820922852, "epoch": 6.945496985022369, "grad_norm": 1.2734375, "learning_rate": 0.00014724965713353605, "loss": 4.6164, "mean_token_accuracy": 0.24254976361989974, "num_tokens": 154842844.0, "step": 89270 }, { "entropy": 5.400317096710205, "epoch": 6.945886014394087, "grad_norm": 1.328125, "learning_rate": 0.00014722684316260368, "loss": 4.6202, "mean_token_accuracy": 0.2516010135412216, "num_tokens": 154851318.0, "step": 89275 }, { "entropy": 5.3282225131988525, "epoch": 6.946275043765804, "grad_norm": 1.3046875, "learning_rate": 0.00014720403113042558, "loss": 4.5796, "mean_token_accuracy": 0.24145934879779815, "num_tokens": 154860537.0, "step": 89280 }, { "entropy": 5.405135440826416, "epoch": 6.946664073137522, "grad_norm": 1.3671875, "learning_rate": 0.00014718122103734793, "loss": 4.639, "mean_token_accuracy": 0.24806546717882155, "num_tokens": 154869229.0, "step": 89285 }, { "entropy": 5.419905471801758, "epoch": 6.94705310250924, "grad_norm": 1.359375, "learning_rate": 0.0001471584128837168, "loss": 4.6441, "mean_token_accuracy": 0.23991436660289764, "num_tokens": 154877056.0, "step": 89290 }, { "entropy": 5.354861545562744, "epoch": 6.947442131880957, "grad_norm": 1.2890625, "learning_rate": 0.0001471356066698783, "loss": 4.5234, "mean_token_accuracy": 0.2513883575797081, "num_tokens": 154885970.0, "step": 89295 }, { "entropy": 5.307975625991821, "epoch": 6.947831161252674, "grad_norm": 1.34375, "learning_rate": 0.00014711280239617841, "loss": 4.562, "mean_token_accuracy": 0.24480591714382172, "num_tokens": 154895734.0, "step": 89300 }, { "entropy": 5.404718017578125, "epoch": 6.948220190624392, "grad_norm": 1.3671875, "learning_rate": 0.00014709000006296326, "loss": 4.6196, "mean_token_accuracy": 0.24177662134170533, "num_tokens": 154904214.0, "step": 89305 }, { "entropy": 5.351935338973999, "epoch": 6.94860921999611, "grad_norm": 1.1953125, "learning_rate": 0.00014706719967057862, "loss": 4.6256, "mean_token_accuracy": 0.2409597858786583, "num_tokens": 154913465.0, "step": 89310 }, { "entropy": 5.352665042877197, "epoch": 6.948998249367827, "grad_norm": 1.2890625, "learning_rate": 0.0001470444012193708, "loss": 4.6249, "mean_token_accuracy": 0.24740462601184846, "num_tokens": 154922878.0, "step": 89315 }, { "entropy": 5.310328340530395, "epoch": 6.949387278739545, "grad_norm": 1.28125, "learning_rate": 0.00014702160470968546, "loss": 4.5801, "mean_token_accuracy": 0.24802251160144806, "num_tokens": 154931004.0, "step": 89320 }, { "entropy": 5.372582674026489, "epoch": 6.949776308111263, "grad_norm": 1.3828125, "learning_rate": 0.0001469988101418685, "loss": 4.5978, "mean_token_accuracy": 0.24051104336977006, "num_tokens": 154939119.0, "step": 89325 }, { "entropy": 5.43602614402771, "epoch": 6.95016533748298, "grad_norm": 1.3046875, "learning_rate": 0.00014697601751626591, "loss": 4.6918, "mean_token_accuracy": 0.23199718743562697, "num_tokens": 154947626.0, "step": 89330 }, { "entropy": 5.408651447296142, "epoch": 6.950554366854697, "grad_norm": 1.375, "learning_rate": 0.00014695322683322344, "loss": 4.7332, "mean_token_accuracy": 0.233060260117054, "num_tokens": 154956337.0, "step": 89335 }, { "entropy": 5.391693592071533, "epoch": 6.950943396226415, "grad_norm": 1.3203125, "learning_rate": 0.000146930438093087, "loss": 4.6815, "mean_token_accuracy": 0.23635961711406708, "num_tokens": 154965096.0, "step": 89340 }, { "entropy": 5.3786499977111815, "epoch": 6.951332425598133, "grad_norm": 1.46875, "learning_rate": 0.00014690765129620227, "loss": 4.5756, "mean_token_accuracy": 0.24730477035045623, "num_tokens": 154973652.0, "step": 89345 }, { "entropy": 5.317218017578125, "epoch": 6.95172145496985, "grad_norm": 1.328125, "learning_rate": 0.00014688486644291504, "loss": 4.5086, "mean_token_accuracy": 0.24945195019245148, "num_tokens": 154981956.0, "step": 89350 }, { "entropy": 5.393576526641846, "epoch": 6.952110484341568, "grad_norm": 1.328125, "learning_rate": 0.0001468620835335711, "loss": 4.6486, "mean_token_accuracy": 0.23669015616178513, "num_tokens": 154990331.0, "step": 89355 }, { "entropy": 5.433332681655884, "epoch": 6.952499513713286, "grad_norm": 1.3671875, "learning_rate": 0.00014683930256851604, "loss": 4.7003, "mean_token_accuracy": 0.23601237535476685, "num_tokens": 154998420.0, "step": 89360 }, { "entropy": 5.456935024261474, "epoch": 6.9528885430850025, "grad_norm": 1.2890625, "learning_rate": 0.00014681652354809566, "loss": 4.7158, "mean_token_accuracy": 0.23541837185621262, "num_tokens": 155007158.0, "step": 89365 }, { "entropy": 5.381467533111572, "epoch": 6.95327757245672, "grad_norm": 1.2734375, "learning_rate": 0.00014679374647265543, "loss": 4.6658, "mean_token_accuracy": 0.24312151968479156, "num_tokens": 155015920.0, "step": 89370 }, { "entropy": 5.319481229782104, "epoch": 6.953666601828438, "grad_norm": 1.2265625, "learning_rate": 0.00014677097134254107, "loss": 4.5621, "mean_token_accuracy": 0.24423403590917586, "num_tokens": 155024793.0, "step": 89375 }, { "entropy": 5.432153606414795, "epoch": 6.954055631200156, "grad_norm": 1.3671875, "learning_rate": 0.0001467481981580981, "loss": 4.7542, "mean_token_accuracy": 0.2269004240632057, "num_tokens": 155034090.0, "step": 89380 }, { "entropy": 5.470992565155029, "epoch": 6.954444660571873, "grad_norm": 1.875, "learning_rate": 0.00014672542691967214, "loss": 4.7056, "mean_token_accuracy": 0.235000404715538, "num_tokens": 155042236.0, "step": 89385 }, { "entropy": 5.447150850296021, "epoch": 6.954833689943591, "grad_norm": 1.3515625, "learning_rate": 0.00014670265762760858, "loss": 4.6592, "mean_token_accuracy": 0.23521073609590532, "num_tokens": 155051177.0, "step": 89390 }, { "entropy": 5.404469347000122, "epoch": 6.955222719315309, "grad_norm": 1.40625, "learning_rate": 0.0001466798902822531, "loss": 4.6126, "mean_token_accuracy": 0.23928658664226532, "num_tokens": 155060136.0, "step": 89395 }, { "entropy": 5.353607273101806, "epoch": 6.955611748687026, "grad_norm": 1.296875, "learning_rate": 0.000146657124883951, "loss": 4.6726, "mean_token_accuracy": 0.23722766786813737, "num_tokens": 155068743.0, "step": 89400 }, { "entropy": 5.430614614486695, "epoch": 6.956000778058743, "grad_norm": 1.28125, "learning_rate": 0.00014663436143304764, "loss": 4.594, "mean_token_accuracy": 0.24776683151721954, "num_tokens": 155077034.0, "step": 89405 }, { "entropy": 5.248784971237183, "epoch": 6.956389807430461, "grad_norm": 1.3046875, "learning_rate": 0.0001466115999298886, "loss": 4.4858, "mean_token_accuracy": 0.266329425573349, "num_tokens": 155085134.0, "step": 89410 }, { "entropy": 5.427721738815308, "epoch": 6.956778836802179, "grad_norm": 1.3046875, "learning_rate": 0.00014658884037481912, "loss": 4.6596, "mean_token_accuracy": 0.24158472269773484, "num_tokens": 155093549.0, "step": 89415 }, { "entropy": 5.381779623031616, "epoch": 6.957167866173896, "grad_norm": 1.28125, "learning_rate": 0.00014656608276818474, "loss": 4.6142, "mean_token_accuracy": 0.24471794068813324, "num_tokens": 155102479.0, "step": 89420 }, { "entropy": 5.262354707717895, "epoch": 6.957556895545614, "grad_norm": 1.3203125, "learning_rate": 0.00014654332711033059, "loss": 4.5212, "mean_token_accuracy": 0.25327264815568923, "num_tokens": 155111198.0, "step": 89425 }, { "entropy": 5.40374345779419, "epoch": 6.957945924917331, "grad_norm": 1.2265625, "learning_rate": 0.00014652057340160192, "loss": 4.6885, "mean_token_accuracy": 0.23478147387504578, "num_tokens": 155119545.0, "step": 89430 }, { "entropy": 5.354250049591064, "epoch": 6.9583349542890485, "grad_norm": 1.2421875, "learning_rate": 0.00014649782164234413, "loss": 4.58, "mean_token_accuracy": 0.24436026811599731, "num_tokens": 155127967.0, "step": 89435 }, { "entropy": 5.381389951705932, "epoch": 6.958723983660766, "grad_norm": 1.203125, "learning_rate": 0.00014647507183290228, "loss": 4.6607, "mean_token_accuracy": 0.2303643062710762, "num_tokens": 155136560.0, "step": 89440 }, { "entropy": 5.3719127655029295, "epoch": 6.959113013032484, "grad_norm": 1.34375, "learning_rate": 0.00014645232397362173, "loss": 4.6103, "mean_token_accuracy": 0.23859770596027374, "num_tokens": 155144532.0, "step": 89445 }, { "entropy": 5.399070119857788, "epoch": 6.959502042404202, "grad_norm": 1.328125, "learning_rate": 0.0001464295780648475, "loss": 4.7091, "mean_token_accuracy": 0.24247010201215743, "num_tokens": 155153460.0, "step": 89450 }, { "entropy": 5.373997020721435, "epoch": 6.959891071775919, "grad_norm": 1.328125, "learning_rate": 0.00014640683410692485, "loss": 4.6393, "mean_token_accuracy": 0.24782025814056396, "num_tokens": 155161754.0, "step": 89455 }, { "entropy": 5.351853942871093, "epoch": 6.960280101147637, "grad_norm": 1.3359375, "learning_rate": 0.0001463840921001987, "loss": 4.5533, "mean_token_accuracy": 0.2523351475596428, "num_tokens": 155169947.0, "step": 89460 }, { "entropy": 5.274852275848389, "epoch": 6.960669130519355, "grad_norm": 1.296875, "learning_rate": 0.0001463613520450144, "loss": 4.5731, "mean_token_accuracy": 0.23911781758069992, "num_tokens": 155179942.0, "step": 89465 }, { "entropy": 5.483589744567871, "epoch": 6.9610581598910715, "grad_norm": 1.2578125, "learning_rate": 0.00014633861394171667, "loss": 4.8491, "mean_token_accuracy": 0.2204234182834625, "num_tokens": 155189468.0, "step": 89470 }, { "entropy": 5.406822776794433, "epoch": 6.961447189262789, "grad_norm": 1.3671875, "learning_rate": 0.00014631587779065076, "loss": 4.6696, "mean_token_accuracy": 0.24305710047483445, "num_tokens": 155198617.0, "step": 89475 }, { "entropy": 5.451224088668823, "epoch": 6.961836218634507, "grad_norm": 1.359375, "learning_rate": 0.00014629314359216158, "loss": 4.6524, "mean_token_accuracy": 0.24407994151115417, "num_tokens": 155207022.0, "step": 89480 }, { "entropy": 5.430307149887085, "epoch": 6.9622252480062246, "grad_norm": 1.3984375, "learning_rate": 0.00014627041134659407, "loss": 4.657, "mean_token_accuracy": 0.24445607215166093, "num_tokens": 155215749.0, "step": 89485 }, { "entropy": 5.379525756835937, "epoch": 6.962614277377942, "grad_norm": 1.328125, "learning_rate": 0.00014624768105429324, "loss": 4.6796, "mean_token_accuracy": 0.24149177670478822, "num_tokens": 155224335.0, "step": 89490 }, { "entropy": 5.430639171600342, "epoch": 6.96300330674966, "grad_norm": 1.328125, "learning_rate": 0.0001462249527156038, "loss": 4.7351, "mean_token_accuracy": 0.24728310853242874, "num_tokens": 155234211.0, "step": 89495 }, { "entropy": 5.333150482177734, "epoch": 6.963392336121377, "grad_norm": 1.3359375, "learning_rate": 0.00014620222633087088, "loss": 4.5556, "mean_token_accuracy": 0.2527706608176231, "num_tokens": 155242640.0, "step": 89500 }, { "entropy": 5.381558656692505, "epoch": 6.9637813654930945, "grad_norm": 1.3125, "learning_rate": 0.00014617950190043912, "loss": 4.6332, "mean_token_accuracy": 0.23923116326332092, "num_tokens": 155251147.0, "step": 89505 }, { "entropy": 5.389881944656372, "epoch": 6.964170394864812, "grad_norm": 1.3984375, "learning_rate": 0.00014615677942465333, "loss": 4.6036, "mean_token_accuracy": 0.2450886145234108, "num_tokens": 155259211.0, "step": 89510 }, { "entropy": 5.285770416259766, "epoch": 6.96455942423653, "grad_norm": 1.4140625, "learning_rate": 0.00014613405890385843, "loss": 4.5068, "mean_token_accuracy": 0.24923093765974044, "num_tokens": 155267264.0, "step": 89515 }, { "entropy": 5.3125769138336185, "epoch": 6.9649484536082475, "grad_norm": 1.3046875, "learning_rate": 0.00014611134033839897, "loss": 4.6061, "mean_token_accuracy": 0.24726336896419526, "num_tokens": 155276162.0, "step": 89520 }, { "entropy": 5.448733806610107, "epoch": 6.965337482979965, "grad_norm": 1.5546875, "learning_rate": 0.00014608862372861986, "loss": 4.7062, "mean_token_accuracy": 0.24093364477157592, "num_tokens": 155284572.0, "step": 89525 }, { "entropy": 5.413979196548462, "epoch": 6.965726512351683, "grad_norm": 1.28125, "learning_rate": 0.00014606590907486562, "loss": 4.6346, "mean_token_accuracy": 0.2502425491809845, "num_tokens": 155293299.0, "step": 89530 }, { "entropy": 5.3835667133331295, "epoch": 6.9661155417234, "grad_norm": 1.4140625, "learning_rate": 0.00014604319637748106, "loss": 4.6428, "mean_token_accuracy": 0.24314749240875244, "num_tokens": 155301792.0, "step": 89535 }, { "entropy": 5.4710853099823, "epoch": 6.9665045710951174, "grad_norm": 1.2890625, "learning_rate": 0.00014602048563681067, "loss": 4.7214, "mean_token_accuracy": 0.24739219397306442, "num_tokens": 155310449.0, "step": 89540 }, { "entropy": 5.399386978149414, "epoch": 6.966893600466835, "grad_norm": 1.421875, "learning_rate": 0.00014599777685319912, "loss": 4.6366, "mean_token_accuracy": 0.2482352927327156, "num_tokens": 155318712.0, "step": 89545 }, { "entropy": 5.385106325149536, "epoch": 6.967282629838553, "grad_norm": 1.3984375, "learning_rate": 0.00014597507002699105, "loss": 4.6567, "mean_token_accuracy": 0.23122390657663344, "num_tokens": 155326381.0, "step": 89550 }, { "entropy": 5.295986032485962, "epoch": 6.9676716592102705, "grad_norm": 1.3046875, "learning_rate": 0.00014595236515853083, "loss": 4.6654, "mean_token_accuracy": 0.23752700239419938, "num_tokens": 155335669.0, "step": 89555 }, { "entropy": 5.294505882263183, "epoch": 6.968060688581988, "grad_norm": 1.328125, "learning_rate": 0.00014592966224816317, "loss": 4.5127, "mean_token_accuracy": 0.2599580153822899, "num_tokens": 155343796.0, "step": 89560 }, { "entropy": 5.4055983543396, "epoch": 6.968449717953705, "grad_norm": 1.34375, "learning_rate": 0.0001459069612962324, "loss": 4.5864, "mean_token_accuracy": 0.2497238263487816, "num_tokens": 155352857.0, "step": 89565 }, { "entropy": 5.389829158782959, "epoch": 6.968838747325423, "grad_norm": 1.359375, "learning_rate": 0.00014588426230308308, "loss": 4.631, "mean_token_accuracy": 0.23895051032304765, "num_tokens": 155361174.0, "step": 89570 }, { "entropy": 5.3532086372375485, "epoch": 6.96922777669714, "grad_norm": 1.3046875, "learning_rate": 0.00014586156526905948, "loss": 4.5579, "mean_token_accuracy": 0.2474617764353752, "num_tokens": 155369441.0, "step": 89575 }, { "entropy": 5.384224987030029, "epoch": 6.969616806068858, "grad_norm": 1.25, "learning_rate": 0.00014583887019450616, "loss": 4.7051, "mean_token_accuracy": 0.2365070953965187, "num_tokens": 155377949.0, "step": 89580 }, { "entropy": 5.301453113555908, "epoch": 6.970005835440576, "grad_norm": 1.34375, "learning_rate": 0.0001458161770797674, "loss": 4.4993, "mean_token_accuracy": 0.2507901504635811, "num_tokens": 155386368.0, "step": 89585 }, { "entropy": 5.340715789794922, "epoch": 6.9703948648122935, "grad_norm": 1.2578125, "learning_rate": 0.00014579348592518745, "loss": 4.6149, "mean_token_accuracy": 0.24846286922693253, "num_tokens": 155395662.0, "step": 89590 }, { "entropy": 5.383721923828125, "epoch": 6.970783894184011, "grad_norm": 1.265625, "learning_rate": 0.0001457707967311108, "loss": 4.6848, "mean_token_accuracy": 0.2395549386739731, "num_tokens": 155404805.0, "step": 89595 }, { "entropy": 5.3236593246459964, "epoch": 6.971172923555729, "grad_norm": 1.375, "learning_rate": 0.00014574810949788153, "loss": 4.554, "mean_token_accuracy": 0.2502008557319641, "num_tokens": 155413842.0, "step": 89600 }, { "entropy": 5.478820848464966, "epoch": 6.971561952927446, "grad_norm": 1.3125, "learning_rate": 0.00014572542422584407, "loss": 4.6634, "mean_token_accuracy": 0.232299542427063, "num_tokens": 155422519.0, "step": 89605 }, { "entropy": 5.422950601577758, "epoch": 6.971950982299163, "grad_norm": 1.296875, "learning_rate": 0.00014570274091534234, "loss": 4.6641, "mean_token_accuracy": 0.2359117940068245, "num_tokens": 155430949.0, "step": 89610 }, { "entropy": 5.464028596878052, "epoch": 6.972340011670881, "grad_norm": 1.484375, "learning_rate": 0.00014568005956672086, "loss": 4.736, "mean_token_accuracy": 0.23836009502410888, "num_tokens": 155439681.0, "step": 89615 }, { "entropy": 5.445967531204223, "epoch": 6.972729041042599, "grad_norm": 1.40625, "learning_rate": 0.0001456573801803237, "loss": 4.6821, "mean_token_accuracy": 0.23620209097862244, "num_tokens": 155448224.0, "step": 89620 }, { "entropy": 5.367197179794312, "epoch": 6.9731180704143165, "grad_norm": 1.3125, "learning_rate": 0.00014563470275649482, "loss": 4.6381, "mean_token_accuracy": 0.2410624235868454, "num_tokens": 155457037.0, "step": 89625 }, { "entropy": 5.408782291412353, "epoch": 6.973507099786034, "grad_norm": 1.3671875, "learning_rate": 0.0001456120272955785, "loss": 4.6872, "mean_token_accuracy": 0.23567092567682266, "num_tokens": 155466307.0, "step": 89630 }, { "entropy": 5.435531187057495, "epoch": 6.973896129157751, "grad_norm": 1.5, "learning_rate": 0.00014558935379791865, "loss": 4.7092, "mean_token_accuracy": 0.23930118530988692, "num_tokens": 155474455.0, "step": 89635 }, { "entropy": 5.396607112884522, "epoch": 6.974285158529469, "grad_norm": 1.3046875, "learning_rate": 0.00014556668226385947, "loss": 4.652, "mean_token_accuracy": 0.234801022708416, "num_tokens": 155483324.0, "step": 89640 }, { "entropy": 5.434888458251953, "epoch": 6.974674187901186, "grad_norm": 1.265625, "learning_rate": 0.0001455440126937448, "loss": 4.7074, "mean_token_accuracy": 0.24335208535194397, "num_tokens": 155492875.0, "step": 89645 }, { "entropy": 5.352641963958741, "epoch": 6.975063217272904, "grad_norm": 1.34375, "learning_rate": 0.00014552134508791874, "loss": 4.6194, "mean_token_accuracy": 0.24993834495544434, "num_tokens": 155501988.0, "step": 89650 }, { "entropy": 5.342614364624024, "epoch": 6.975452246644622, "grad_norm": 1.3671875, "learning_rate": 0.0001454986794467251, "loss": 4.5765, "mean_token_accuracy": 0.24740992933511735, "num_tokens": 155509615.0, "step": 89655 }, { "entropy": 5.23600926399231, "epoch": 6.9758412760163395, "grad_norm": 1.40625, "learning_rate": 0.00014547601577050796, "loss": 4.5677, "mean_token_accuracy": 0.25248008519411086, "num_tokens": 155518622.0, "step": 89660 }, { "entropy": 5.384297704696655, "epoch": 6.976230305388057, "grad_norm": 1.2578125, "learning_rate": 0.00014545335405961114, "loss": 4.6236, "mean_token_accuracy": 0.2370568960905075, "num_tokens": 155527430.0, "step": 89665 }, { "entropy": 5.363427972793579, "epoch": 6.976619334759774, "grad_norm": 1.3515625, "learning_rate": 0.00014543069431437837, "loss": 4.5964, "mean_token_accuracy": 0.24896981120109557, "num_tokens": 155536512.0, "step": 89670 }, { "entropy": 5.418689489364624, "epoch": 6.977008364131492, "grad_norm": 1.4609375, "learning_rate": 0.00014540803653515362, "loss": 4.6466, "mean_token_accuracy": 0.2463422417640686, "num_tokens": 155544775.0, "step": 89675 }, { "entropy": 5.4247145652771, "epoch": 6.977397393503209, "grad_norm": 1.2265625, "learning_rate": 0.00014538538072228057, "loss": 4.6902, "mean_token_accuracy": 0.23839217573404312, "num_tokens": 155552782.0, "step": 89680 }, { "entropy": 5.402208757400513, "epoch": 6.977786422874927, "grad_norm": 1.390625, "learning_rate": 0.00014536272687610323, "loss": 4.6312, "mean_token_accuracy": 0.23542531877756118, "num_tokens": 155561448.0, "step": 89685 }, { "entropy": 5.433767318725586, "epoch": 6.978175452246645, "grad_norm": 1.2734375, "learning_rate": 0.00014534007499696506, "loss": 4.7184, "mean_token_accuracy": 0.23418553918600082, "num_tokens": 155571044.0, "step": 89690 }, { "entropy": 5.41443452835083, "epoch": 6.9785644816183625, "grad_norm": 1.2890625, "learning_rate": 0.00014531742508520996, "loss": 4.7012, "mean_token_accuracy": 0.23647561818361282, "num_tokens": 155580197.0, "step": 89695 }, { "entropy": 5.429515743255616, "epoch": 6.978953510990079, "grad_norm": 1.3984375, "learning_rate": 0.0001452947771411815, "loss": 4.7139, "mean_token_accuracy": 0.2300940901041031, "num_tokens": 155588781.0, "step": 89700 }, { "entropy": 5.477977705001831, "epoch": 6.979342540361797, "grad_norm": 1.3125, "learning_rate": 0.0001452721311652233, "loss": 4.7249, "mean_token_accuracy": 0.2375420942902565, "num_tokens": 155597913.0, "step": 89705 }, { "entropy": 5.418781185150147, "epoch": 6.979731569733515, "grad_norm": 1.3125, "learning_rate": 0.0001452494871576791, "loss": 4.6061, "mean_token_accuracy": 0.24896115511655809, "num_tokens": 155606108.0, "step": 89710 }, { "entropy": 5.467988443374634, "epoch": 6.980120599105232, "grad_norm": 1.3671875, "learning_rate": 0.00014522684511889233, "loss": 4.7486, "mean_token_accuracy": 0.2327537104487419, "num_tokens": 155615086.0, "step": 89715 }, { "entropy": 5.4200609683990475, "epoch": 6.98050962847695, "grad_norm": 1.28125, "learning_rate": 0.0001452042050492067, "loss": 4.6913, "mean_token_accuracy": 0.24197487831115722, "num_tokens": 155624006.0, "step": 89720 }, { "entropy": 5.410635995864868, "epoch": 6.980898657848668, "grad_norm": 1.2890625, "learning_rate": 0.00014518156694896562, "loss": 4.623, "mean_token_accuracy": 0.24111818224191667, "num_tokens": 155632909.0, "step": 89725 }, { "entropy": 5.440509605407715, "epoch": 6.9812876872203855, "grad_norm": 1.4453125, "learning_rate": 0.00014515893081851268, "loss": 4.7473, "mean_token_accuracy": 0.23411216139793395, "num_tokens": 155641803.0, "step": 89730 }, { "entropy": 5.38578314781189, "epoch": 6.981676716592102, "grad_norm": 1.328125, "learning_rate": 0.00014513629665819123, "loss": 4.6471, "mean_token_accuracy": 0.2460915759205818, "num_tokens": 155650101.0, "step": 89735 }, { "entropy": 5.458373546600342, "epoch": 6.98206574596382, "grad_norm": 1.2734375, "learning_rate": 0.00014511366446834484, "loss": 4.6558, "mean_token_accuracy": 0.2360107734799385, "num_tokens": 155659854.0, "step": 89740 }, { "entropy": 5.45317063331604, "epoch": 6.982454775335538, "grad_norm": 1.28125, "learning_rate": 0.00014509103424931684, "loss": 4.7231, "mean_token_accuracy": 0.24116703122854233, "num_tokens": 155668894.0, "step": 89745 }, { "entropy": 5.439077949523925, "epoch": 6.982843804707255, "grad_norm": 1.296875, "learning_rate": 0.00014506840600145055, "loss": 4.6678, "mean_token_accuracy": 0.23063323944807052, "num_tokens": 155677308.0, "step": 89750 }, { "entropy": 5.409154891967773, "epoch": 6.983232834078973, "grad_norm": 1.3984375, "learning_rate": 0.0001450457797250895, "loss": 4.6853, "mean_token_accuracy": 0.23423619121313094, "num_tokens": 155685305.0, "step": 89755 }, { "entropy": 5.317077732086181, "epoch": 6.983621863450691, "grad_norm": 1.359375, "learning_rate": 0.0001450231554205768, "loss": 4.5573, "mean_token_accuracy": 0.24795056134462357, "num_tokens": 155694601.0, "step": 89760 }, { "entropy": 5.394887018203735, "epoch": 6.984010892822408, "grad_norm": 1.1796875, "learning_rate": 0.00014500053308825594, "loss": 4.6523, "mean_token_accuracy": 0.23794064670801163, "num_tokens": 155703676.0, "step": 89765 }, { "entropy": 5.390223264694214, "epoch": 6.984399922194125, "grad_norm": 1.4375, "learning_rate": 0.00014497791272847002, "loss": 4.6406, "mean_token_accuracy": 0.23587863594293595, "num_tokens": 155711807.0, "step": 89770 }, { "entropy": 5.318341541290283, "epoch": 6.984788951565843, "grad_norm": 1.4453125, "learning_rate": 0.00014495529434156238, "loss": 4.5792, "mean_token_accuracy": 0.24658452570438386, "num_tokens": 155720158.0, "step": 89775 }, { "entropy": 5.402074909210205, "epoch": 6.985177980937561, "grad_norm": 1.359375, "learning_rate": 0.00014493267792787618, "loss": 4.6715, "mean_token_accuracy": 0.2514621153473854, "num_tokens": 155729012.0, "step": 89780 }, { "entropy": 5.372131061553955, "epoch": 6.985567010309278, "grad_norm": 1.359375, "learning_rate": 0.00014491006348775446, "loss": 4.6221, "mean_token_accuracy": 0.2436370834708214, "num_tokens": 155737257.0, "step": 89785 }, { "entropy": 5.40860333442688, "epoch": 6.985956039680996, "grad_norm": 1.359375, "learning_rate": 0.00014488745102154055, "loss": 4.6785, "mean_token_accuracy": 0.23405275493860245, "num_tokens": 155745243.0, "step": 89790 }, { "entropy": 5.341302013397216, "epoch": 6.986345069052714, "grad_norm": 1.3125, "learning_rate": 0.0001448648405295774, "loss": 4.6189, "mean_token_accuracy": 0.24098528325557708, "num_tokens": 155753546.0, "step": 89795 }, { "entropy": 5.367088985443115, "epoch": 6.9867340984244315, "grad_norm": 1.1796875, "learning_rate": 0.00014484223201220823, "loss": 4.6904, "mean_token_accuracy": 0.23882953226566314, "num_tokens": 155762534.0, "step": 89800 }, { "entropy": 5.388047599792481, "epoch": 6.987123127796148, "grad_norm": 1.2578125, "learning_rate": 0.00014481962546977596, "loss": 4.5921, "mean_token_accuracy": 0.24680139273405075, "num_tokens": 155770861.0, "step": 89805 }, { "entropy": 5.381996297836304, "epoch": 6.987512157167866, "grad_norm": 1.3984375, "learning_rate": 0.00014479702090262368, "loss": 4.6661, "mean_token_accuracy": 0.24236880987882614, "num_tokens": 155779219.0, "step": 89810 }, { "entropy": 5.463217926025391, "epoch": 6.987901186539584, "grad_norm": 1.390625, "learning_rate": 0.00014477441831109444, "loss": 4.7777, "mean_token_accuracy": 0.23083534091711044, "num_tokens": 155787975.0, "step": 89815 }, { "entropy": 5.399364757537842, "epoch": 6.988290215911301, "grad_norm": 1.2890625, "learning_rate": 0.00014475181769553103, "loss": 4.653, "mean_token_accuracy": 0.2414955511689186, "num_tokens": 155797580.0, "step": 89820 }, { "entropy": 5.404401254653931, "epoch": 6.988679245283019, "grad_norm": 1.25, "learning_rate": 0.00014472921905627655, "loss": 4.6636, "mean_token_accuracy": 0.2367745891213417, "num_tokens": 155806193.0, "step": 89825 }, { "entropy": 5.400348949432373, "epoch": 6.989068274654737, "grad_norm": 1.3046875, "learning_rate": 0.00014470662239367377, "loss": 4.682, "mean_token_accuracy": 0.23352742642164231, "num_tokens": 155815227.0, "step": 89830 }, { "entropy": 5.370688819885254, "epoch": 6.989457304026454, "grad_norm": 1.28125, "learning_rate": 0.00014468402770806565, "loss": 4.6212, "mean_token_accuracy": 0.23942710757255553, "num_tokens": 155823708.0, "step": 89835 }, { "entropy": 5.3683442115783695, "epoch": 6.989846333398171, "grad_norm": 1.3671875, "learning_rate": 0.00014466143499979495, "loss": 4.6764, "mean_token_accuracy": 0.2317187488079071, "num_tokens": 155832927.0, "step": 89840 }, { "entropy": 5.314801645278931, "epoch": 6.990235362769889, "grad_norm": 1.2578125, "learning_rate": 0.0001446388442692046, "loss": 4.6103, "mean_token_accuracy": 0.24803401231765748, "num_tokens": 155842026.0, "step": 89845 }, { "entropy": 5.387654161453247, "epoch": 6.990624392141607, "grad_norm": 1.3203125, "learning_rate": 0.0001446162555166372, "loss": 4.6587, "mean_token_accuracy": 0.2420601725578308, "num_tokens": 155850945.0, "step": 89850 }, { "entropy": 5.4465940475463865, "epoch": 6.991013421513324, "grad_norm": 1.4140625, "learning_rate": 0.00014459366874243568, "loss": 4.6667, "mean_token_accuracy": 0.23638916313648223, "num_tokens": 155858930.0, "step": 89855 }, { "entropy": 5.385081434249878, "epoch": 6.991402450885042, "grad_norm": 1.21875, "learning_rate": 0.00014457108394694268, "loss": 4.5969, "mean_token_accuracy": 0.24162072241306304, "num_tokens": 155868045.0, "step": 89860 }, { "entropy": 5.352211284637451, "epoch": 6.99179148025676, "grad_norm": 1.3984375, "learning_rate": 0.0001445485011305008, "loss": 4.5844, "mean_token_accuracy": 0.24290325939655305, "num_tokens": 155877008.0, "step": 89865 }, { "entropy": 5.324769973754883, "epoch": 6.992180509628477, "grad_norm": 1.3125, "learning_rate": 0.00014452592029345286, "loss": 4.5192, "mean_token_accuracy": 0.2571927890181541, "num_tokens": 155885359.0, "step": 89870 }, { "entropy": 5.357456350326538, "epoch": 6.992569539000194, "grad_norm": 1.3046875, "learning_rate": 0.00014450334143614125, "loss": 4.6962, "mean_token_accuracy": 0.23188077807426452, "num_tokens": 155893783.0, "step": 89875 }, { "entropy": 5.3238598823547365, "epoch": 6.992958568371912, "grad_norm": 1.2578125, "learning_rate": 0.00014448076455890886, "loss": 4.5988, "mean_token_accuracy": 0.24600047022104263, "num_tokens": 155903064.0, "step": 89880 }, { "entropy": 5.440296840667725, "epoch": 6.99334759774363, "grad_norm": 1.25, "learning_rate": 0.00014445818966209818, "loss": 4.687, "mean_token_accuracy": 0.24332557618618011, "num_tokens": 155911783.0, "step": 89885 }, { "entropy": 5.4139715194702145, "epoch": 6.993736627115347, "grad_norm": 1.453125, "learning_rate": 0.00014443561674605158, "loss": 4.5698, "mean_token_accuracy": 0.24541166722774505, "num_tokens": 155919327.0, "step": 89890 }, { "entropy": 5.413807153701782, "epoch": 6.994125656487065, "grad_norm": 1.328125, "learning_rate": 0.00014441304581111174, "loss": 4.6813, "mean_token_accuracy": 0.24629881232976913, "num_tokens": 155927273.0, "step": 89895 }, { "entropy": 5.408115243911743, "epoch": 6.994514685858782, "grad_norm": 1.3046875, "learning_rate": 0.00014439047685762104, "loss": 4.733, "mean_token_accuracy": 0.23326534479856492, "num_tokens": 155936211.0, "step": 89900 }, { "entropy": 5.298787784576416, "epoch": 6.9949037152305, "grad_norm": 1.3203125, "learning_rate": 0.00014436790988592201, "loss": 4.505, "mean_token_accuracy": 0.25242430418729783, "num_tokens": 155944875.0, "step": 89905 }, { "entropy": 5.321467542648316, "epoch": 6.995292744602217, "grad_norm": 1.3125, "learning_rate": 0.00014434534489635699, "loss": 4.5801, "mean_token_accuracy": 0.2427438825368881, "num_tokens": 155953159.0, "step": 89910 }, { "entropy": 5.459746313095093, "epoch": 6.995681773973935, "grad_norm": 1.3828125, "learning_rate": 0.00014432278188926845, "loss": 4.7586, "mean_token_accuracy": 0.23448698222637177, "num_tokens": 155962600.0, "step": 89915 }, { "entropy": 5.275337028503418, "epoch": 6.996070803345653, "grad_norm": 1.21875, "learning_rate": 0.0001443002208649986, "loss": 4.5294, "mean_token_accuracy": 0.2494208261370659, "num_tokens": 155971961.0, "step": 89920 }, { "entropy": 5.4143743991851805, "epoch": 6.99645983271737, "grad_norm": 1.3125, "learning_rate": 0.00014427766182389002, "loss": 4.6766, "mean_token_accuracy": 0.23622320741415023, "num_tokens": 155981096.0, "step": 89925 }, { "entropy": 5.388740587234497, "epoch": 6.996848862089088, "grad_norm": 1.3203125, "learning_rate": 0.00014425510476628474, "loss": 4.6812, "mean_token_accuracy": 0.24523308426141738, "num_tokens": 155989355.0, "step": 89930 }, { "entropy": 5.382186555862427, "epoch": 6.997237891460806, "grad_norm": 1.3671875, "learning_rate": 0.0001442325496925252, "loss": 4.5754, "mean_token_accuracy": 0.24558333903551102, "num_tokens": 155997823.0, "step": 89935 }, { "entropy": 5.345379447937011, "epoch": 6.997626920832523, "grad_norm": 1.2734375, "learning_rate": 0.0001442099966029535, "loss": 4.5745, "mean_token_accuracy": 0.23580967634916306, "num_tokens": 156006105.0, "step": 89940 }, { "entropy": 5.386575412750244, "epoch": 6.99801595020424, "grad_norm": 1.3359375, "learning_rate": 0.00014418744549791196, "loss": 4.6762, "mean_token_accuracy": 0.2360135942697525, "num_tokens": 156015759.0, "step": 89945 }, { "entropy": 5.435685920715332, "epoch": 6.998404979575958, "grad_norm": 1.4453125, "learning_rate": 0.00014416489637774277, "loss": 4.675, "mean_token_accuracy": 0.24010681360960007, "num_tokens": 156024298.0, "step": 89950 }, { "entropy": 5.368765068054199, "epoch": 6.998794008947676, "grad_norm": 1.3359375, "learning_rate": 0.000144142349242788, "loss": 4.6558, "mean_token_accuracy": 0.23700524121522903, "num_tokens": 156033264.0, "step": 89955 }, { "entropy": 5.425797796249389, "epoch": 6.999183038319393, "grad_norm": 1.1875, "learning_rate": 0.00014411980409338983, "loss": 4.7319, "mean_token_accuracy": 0.2369768351316452, "num_tokens": 156042911.0, "step": 89960 }, { "entropy": 5.350696086883545, "epoch": 6.999572067691111, "grad_norm": 1.234375, "learning_rate": 0.00014409726092989034, "loss": 4.6225, "mean_token_accuracy": 0.24655075073242189, "num_tokens": 156051484.0, "step": 89965 }, { "entropy": 5.4019959449768065, "epoch": 6.999961097062828, "grad_norm": 1.21875, "learning_rate": 0.00014407471975263147, "loss": 4.6723, "mean_token_accuracy": 0.23713413029909133, "num_tokens": 156060196.0, "step": 89970 }, { "entropy": 5.312538411882189, "epoch": 7.000311223497374, "grad_norm": 1.3046875, "learning_rate": 0.00014405218056195545, "loss": 4.4635, "mean_token_accuracy": 0.25627824664115906, "num_tokens": 156067765.0, "step": 89975 }, { "entropy": 5.303841829299927, "epoch": 7.000700252869092, "grad_norm": 1.421875, "learning_rate": 0.00014402964335820403, "loss": 4.5264, "mean_token_accuracy": 0.2511327400803566, "num_tokens": 156076160.0, "step": 89980 }, { "entropy": 5.283123445510864, "epoch": 7.001089282240809, "grad_norm": 1.4921875, "learning_rate": 0.00014400710814171943, "loss": 4.5048, "mean_token_accuracy": 0.25590251982212064, "num_tokens": 156084670.0, "step": 89985 }, { "entropy": 5.4067121028900145, "epoch": 7.0014783116125265, "grad_norm": 1.34375, "learning_rate": 0.0001439845749128434, "loss": 4.6224, "mean_token_accuracy": 0.2503239020705223, "num_tokens": 156093914.0, "step": 89990 }, { "entropy": 5.447086811065674, "epoch": 7.001867340984244, "grad_norm": 1.328125, "learning_rate": 0.00014396204367191794, "loss": 4.7139, "mean_token_accuracy": 0.23153126090765, "num_tokens": 156102298.0, "step": 89995 }, { "entropy": 5.40761890411377, "epoch": 7.002256370355962, "grad_norm": 1.2890625, "learning_rate": 0.00014393951441928488, "loss": 4.5648, "mean_token_accuracy": 0.25297785848379134, "num_tokens": 156111620.0, "step": 90000 }, { "epoch": 7.002256370355962, "eval_entropy": 5.158628855036129, "eval_loss": 4.8515472412109375, "eval_mean_token_accuracy": 0.23689479727057797, "eval_num_tokens": 156111620.0, "eval_runtime": 28.7284, "eval_samples_per_second": 1446.581, "eval_steps_per_second": 180.831, "step": 90000 }, { "entropy": 5.469105863571167, "epoch": 7.00264539972768, "grad_norm": 1.3515625, "learning_rate": 0.00014391698715528613, "loss": 4.67, "mean_token_accuracy": 0.24697525352239608, "num_tokens": 156119883.0, "step": 90005 }, { "entropy": 5.399833726882934, "epoch": 7.003034429099397, "grad_norm": 1.3203125, "learning_rate": 0.0001438944618802634, "loss": 4.6286, "mean_token_accuracy": 0.24486246705055237, "num_tokens": 156128604.0, "step": 90010 }, { "entropy": 5.39777512550354, "epoch": 7.003423458471114, "grad_norm": 1.3125, "learning_rate": 0.0001438719385945585, "loss": 4.639, "mean_token_accuracy": 0.2391916587948799, "num_tokens": 156136814.0, "step": 90015 }, { "entropy": 5.4153800964355465, "epoch": 7.003812487842832, "grad_norm": 1.3046875, "learning_rate": 0.0001438494172985133, "loss": 4.6471, "mean_token_accuracy": 0.2460146114230156, "num_tokens": 156145889.0, "step": 90020 }, { "entropy": 5.363300848007202, "epoch": 7.0042015172145495, "grad_norm": 1.328125, "learning_rate": 0.0001438268979924694, "loss": 4.6236, "mean_token_accuracy": 0.2503401651978493, "num_tokens": 156154627.0, "step": 90025 }, { "entropy": 5.398645210266113, "epoch": 7.004590546586267, "grad_norm": 1.34375, "learning_rate": 0.0001438043806767686, "loss": 4.6198, "mean_token_accuracy": 0.23911793977022172, "num_tokens": 156163508.0, "step": 90030 }, { "entropy": 5.458889532089233, "epoch": 7.004979575957985, "grad_norm": 1.3125, "learning_rate": 0.00014378186535175247, "loss": 4.6904, "mean_token_accuracy": 0.24258648455142975, "num_tokens": 156172819.0, "step": 90035 }, { "entropy": 5.426060152053833, "epoch": 7.005368605329703, "grad_norm": 1.375, "learning_rate": 0.00014375935201776268, "loss": 4.6244, "mean_token_accuracy": 0.2406049743294716, "num_tokens": 156181492.0, "step": 90040 }, { "entropy": 5.3880290508270265, "epoch": 7.00575763470142, "grad_norm": 1.2890625, "learning_rate": 0.00014373684067514088, "loss": 4.5713, "mean_token_accuracy": 0.25495119839906694, "num_tokens": 156190642.0, "step": 90045 }, { "entropy": 5.314709281921386, "epoch": 7.006146664073137, "grad_norm": 1.2421875, "learning_rate": 0.0001437143313242285, "loss": 4.4978, "mean_token_accuracy": 0.2605133786797523, "num_tokens": 156199751.0, "step": 90050 }, { "entropy": 5.301628255844117, "epoch": 7.006535693444855, "grad_norm": 1.3203125, "learning_rate": 0.00014369182396536728, "loss": 4.5302, "mean_token_accuracy": 0.25309610962867735, "num_tokens": 156208332.0, "step": 90055 }, { "entropy": 5.301197719573975, "epoch": 7.0069247228165725, "grad_norm": 1.375, "learning_rate": 0.00014366931859889853, "loss": 4.5374, "mean_token_accuracy": 0.24901947677135466, "num_tokens": 156216977.0, "step": 90060 }, { "entropy": 5.38556694984436, "epoch": 7.00731375218829, "grad_norm": 1.3125, "learning_rate": 0.00014364681522516392, "loss": 4.6183, "mean_token_accuracy": 0.2463506892323494, "num_tokens": 156225844.0, "step": 90065 }, { "entropy": 5.3629655838012695, "epoch": 7.007702781560008, "grad_norm": 1.4453125, "learning_rate": 0.00014362431384450474, "loss": 4.5333, "mean_token_accuracy": 0.2483459457755089, "num_tokens": 156233208.0, "step": 90070 }, { "entropy": 5.403060817718506, "epoch": 7.008091810931726, "grad_norm": 1.3984375, "learning_rate": 0.0001436018144572625, "loss": 4.6052, "mean_token_accuracy": 0.24076692759990692, "num_tokens": 156241165.0, "step": 90075 }, { "entropy": 5.324351596832275, "epoch": 7.008480840303443, "grad_norm": 1.3046875, "learning_rate": 0.00014357931706377868, "loss": 4.5797, "mean_token_accuracy": 0.24957185983657837, "num_tokens": 156250429.0, "step": 90080 }, { "entropy": 5.426231718063354, "epoch": 7.00886986967516, "grad_norm": 1.2734375, "learning_rate": 0.00014355682166439443, "loss": 4.7091, "mean_token_accuracy": 0.2353959009051323, "num_tokens": 156259250.0, "step": 90085 }, { "entropy": 5.409934234619141, "epoch": 7.009258899046878, "grad_norm": 1.390625, "learning_rate": 0.0001435343282594513, "loss": 4.6139, "mean_token_accuracy": 0.24522257894277572, "num_tokens": 156267580.0, "step": 90090 }, { "entropy": 5.387844181060791, "epoch": 7.0096479284185955, "grad_norm": 1.2421875, "learning_rate": 0.0001435118368492904, "loss": 4.5825, "mean_token_accuracy": 0.2457406684756279, "num_tokens": 156276434.0, "step": 90095 }, { "entropy": 5.376532745361328, "epoch": 7.010036957790313, "grad_norm": 1.4453125, "learning_rate": 0.00014348934743425314, "loss": 4.6124, "mean_token_accuracy": 0.24795571565628052, "num_tokens": 156284984.0, "step": 90100 }, { "entropy": 5.338795328140259, "epoch": 7.010425987162031, "grad_norm": 1.3828125, "learning_rate": 0.00014346686001468067, "loss": 4.6315, "mean_token_accuracy": 0.24564227014780043, "num_tokens": 156293728.0, "step": 90105 }, { "entropy": 5.3393354415893555, "epoch": 7.010815016533749, "grad_norm": 1.296875, "learning_rate": 0.00014344437459091434, "loss": 4.5518, "mean_token_accuracy": 0.25540982484817504, "num_tokens": 156303027.0, "step": 90110 }, { "entropy": 5.484247159957886, "epoch": 7.011204045905465, "grad_norm": 1.3984375, "learning_rate": 0.00014342189116329512, "loss": 4.7259, "mean_token_accuracy": 0.23415337055921553, "num_tokens": 156311890.0, "step": 90115 }, { "entropy": 5.493964338302613, "epoch": 7.011593075277183, "grad_norm": 1.3671875, "learning_rate": 0.00014339940973216438, "loss": 4.6875, "mean_token_accuracy": 0.24070482105016708, "num_tokens": 156320647.0, "step": 90120 }, { "entropy": 5.495654726028443, "epoch": 7.011982104648901, "grad_norm": 1.3203125, "learning_rate": 0.00014337693029786312, "loss": 4.713, "mean_token_accuracy": 0.23850999474525453, "num_tokens": 156329909.0, "step": 90125 }, { "entropy": 5.4419536113739015, "epoch": 7.0123711340206185, "grad_norm": 1.34375, "learning_rate": 0.00014335445286073234, "loss": 4.6397, "mean_token_accuracy": 0.2413053795695305, "num_tokens": 156338372.0, "step": 90130 }, { "entropy": 5.332943725585937, "epoch": 7.012760163392336, "grad_norm": 1.3671875, "learning_rate": 0.00014333197742111333, "loss": 4.4891, "mean_token_accuracy": 0.25009157359600065, "num_tokens": 156347164.0, "step": 90135 }, { "entropy": 5.385561609268189, "epoch": 7.013149192764054, "grad_norm": 1.28125, "learning_rate": 0.00014330950397934677, "loss": 4.659, "mean_token_accuracy": 0.24437061697244644, "num_tokens": 156356101.0, "step": 90140 }, { "entropy": 5.330642795562744, "epoch": 7.013538222135772, "grad_norm": 1.359375, "learning_rate": 0.00014328703253577407, "loss": 4.567, "mean_token_accuracy": 0.2484587013721466, "num_tokens": 156364275.0, "step": 90145 }, { "entropy": 5.338982057571411, "epoch": 7.013927251507488, "grad_norm": 1.3046875, "learning_rate": 0.00014326456309073592, "loss": 4.5498, "mean_token_accuracy": 0.2531727448105812, "num_tokens": 156372995.0, "step": 90150 }, { "entropy": 5.362654018402099, "epoch": 7.014316280879206, "grad_norm": 1.375, "learning_rate": 0.00014324209564457347, "loss": 4.5078, "mean_token_accuracy": 0.25286509096622467, "num_tokens": 156381209.0, "step": 90155 }, { "entropy": 5.2903969287872314, "epoch": 7.014705310250924, "grad_norm": 1.3046875, "learning_rate": 0.00014321963019762747, "loss": 4.5258, "mean_token_accuracy": 0.252904999256134, "num_tokens": 156390096.0, "step": 90160 }, { "entropy": 5.370199966430664, "epoch": 7.0150943396226415, "grad_norm": 1.375, "learning_rate": 0.00014319716675023874, "loss": 4.6204, "mean_token_accuracy": 0.23871349096298217, "num_tokens": 156398907.0, "step": 90165 }, { "entropy": 5.360746049880982, "epoch": 7.015483368994359, "grad_norm": 1.265625, "learning_rate": 0.00014317470530274834, "loss": 4.638, "mean_token_accuracy": 0.2461397171020508, "num_tokens": 156407973.0, "step": 90170 }, { "entropy": 5.390788745880127, "epoch": 7.015872398366077, "grad_norm": 1.296875, "learning_rate": 0.00014315224585549686, "loss": 4.5708, "mean_token_accuracy": 0.252447834610939, "num_tokens": 156417096.0, "step": 90175 }, { "entropy": 5.435865831375122, "epoch": 7.016261427737795, "grad_norm": 1.4765625, "learning_rate": 0.00014312978840882524, "loss": 4.5961, "mean_token_accuracy": 0.24610868841409683, "num_tokens": 156425339.0, "step": 90180 }, { "entropy": 5.368530654907227, "epoch": 7.016650457109511, "grad_norm": 1.34375, "learning_rate": 0.00014310733296307414, "loss": 4.6673, "mean_token_accuracy": 0.23838739097118378, "num_tokens": 156433782.0, "step": 90185 }, { "entropy": 5.377924203872681, "epoch": 7.017039486481229, "grad_norm": 1.3515625, "learning_rate": 0.00014308487951858443, "loss": 4.5998, "mean_token_accuracy": 0.2441546529531479, "num_tokens": 156443034.0, "step": 90190 }, { "entropy": 5.435801458358765, "epoch": 7.017428515852947, "grad_norm": 1.1875, "learning_rate": 0.00014306242807569661, "loss": 4.6892, "mean_token_accuracy": 0.23872665613889693, "num_tokens": 156452628.0, "step": 90195 }, { "entropy": 5.386900472640991, "epoch": 7.0178175452246645, "grad_norm": 1.4140625, "learning_rate": 0.00014303997863475155, "loss": 4.5566, "mean_token_accuracy": 0.2533245176076889, "num_tokens": 156461326.0, "step": 90200 }, { "entropy": 5.406253004074097, "epoch": 7.018206574596382, "grad_norm": 1.3046875, "learning_rate": 0.00014301753119608972, "loss": 4.6166, "mean_token_accuracy": 0.24088977873325348, "num_tokens": 156470658.0, "step": 90205 }, { "entropy": 5.39936842918396, "epoch": 7.0185956039681, "grad_norm": 1.2265625, "learning_rate": 0.00014299508576005166, "loss": 4.6434, "mean_token_accuracy": 0.23767687529325485, "num_tokens": 156479885.0, "step": 90210 }, { "entropy": 5.310983943939209, "epoch": 7.018984633339818, "grad_norm": 1.40625, "learning_rate": 0.00014297264232697823, "loss": 4.5254, "mean_token_accuracy": 0.2549836337566376, "num_tokens": 156487667.0, "step": 90215 }, { "entropy": 5.329548072814942, "epoch": 7.019373662711534, "grad_norm": 1.3203125, "learning_rate": 0.00014295020089720973, "loss": 4.5839, "mean_token_accuracy": 0.242526613175869, "num_tokens": 156495945.0, "step": 90220 }, { "entropy": 5.382296323776245, "epoch": 7.019762692083252, "grad_norm": 1.3046875, "learning_rate": 0.00014292776147108684, "loss": 4.6036, "mean_token_accuracy": 0.24670106768608094, "num_tokens": 156504827.0, "step": 90225 }, { "entropy": 5.38292555809021, "epoch": 7.02015172145497, "grad_norm": 1.3359375, "learning_rate": 0.00014290532404894984, "loss": 4.6069, "mean_token_accuracy": 0.24181021004915237, "num_tokens": 156514073.0, "step": 90230 }, { "entropy": 5.407919549942017, "epoch": 7.0205407508266875, "grad_norm": 1.46875, "learning_rate": 0.00014288288863113937, "loss": 4.5506, "mean_token_accuracy": 0.2500641331076622, "num_tokens": 156521691.0, "step": 90235 }, { "entropy": 5.485527276992798, "epoch": 7.020929780198405, "grad_norm": 1.3203125, "learning_rate": 0.0001428604552179958, "loss": 4.7029, "mean_token_accuracy": 0.23322039544582368, "num_tokens": 156530272.0, "step": 90240 }, { "entropy": 5.373916292190552, "epoch": 7.021318809570123, "grad_norm": 1.359375, "learning_rate": 0.00014283802380985944, "loss": 4.5464, "mean_token_accuracy": 0.2565394461154938, "num_tokens": 156538564.0, "step": 90245 }, { "entropy": 5.395167398452759, "epoch": 7.02170783894184, "grad_norm": 1.359375, "learning_rate": 0.00014281559440707079, "loss": 4.6486, "mean_token_accuracy": 0.24414647817611695, "num_tokens": 156547715.0, "step": 90250 }, { "entropy": 5.359339094161987, "epoch": 7.022096868313557, "grad_norm": 1.3671875, "learning_rate": 0.00014279316700997, "loss": 4.5216, "mean_token_accuracy": 0.24762504696846008, "num_tokens": 156556468.0, "step": 90255 }, { "entropy": 5.399831867218017, "epoch": 7.022485897685275, "grad_norm": 1.3984375, "learning_rate": 0.00014277074161889758, "loss": 4.5662, "mean_token_accuracy": 0.25042266100645066, "num_tokens": 156564905.0, "step": 90260 }, { "entropy": 5.378294992446899, "epoch": 7.022874927056993, "grad_norm": 1.5078125, "learning_rate": 0.0001427483182341936, "loss": 4.6041, "mean_token_accuracy": 0.24915739744901658, "num_tokens": 156573830.0, "step": 90265 }, { "entropy": 5.352334594726562, "epoch": 7.0232639564287105, "grad_norm": 1.4765625, "learning_rate": 0.00014272589685619845, "loss": 4.5737, "mean_token_accuracy": 0.2502042219042778, "num_tokens": 156582451.0, "step": 90270 }, { "entropy": 5.36664228439331, "epoch": 7.023652985800428, "grad_norm": 1.3203125, "learning_rate": 0.0001427034774852522, "loss": 4.6105, "mean_token_accuracy": 0.2399081200361252, "num_tokens": 156590793.0, "step": 90275 }, { "entropy": 5.3968676090240475, "epoch": 7.024042015172146, "grad_norm": 1.34375, "learning_rate": 0.00014268106012169514, "loss": 4.6064, "mean_token_accuracy": 0.23968362659215928, "num_tokens": 156599444.0, "step": 90280 }, { "entropy": 5.36963300704956, "epoch": 7.024431044543863, "grad_norm": 1.3828125, "learning_rate": 0.00014265864476586742, "loss": 4.564, "mean_token_accuracy": 0.24803753644227983, "num_tokens": 156608338.0, "step": 90285 }, { "entropy": 5.3835653305053714, "epoch": 7.02482007391558, "grad_norm": 1.421875, "learning_rate": 0.00014263623141810906, "loss": 4.5618, "mean_token_accuracy": 0.25210612267255783, "num_tokens": 156616632.0, "step": 90290 }, { "entropy": 5.294729137420655, "epoch": 7.025209103287298, "grad_norm": 1.3203125, "learning_rate": 0.00014261382007876028, "loss": 4.5303, "mean_token_accuracy": 0.2517367318272591, "num_tokens": 156624366.0, "step": 90295 }, { "entropy": 5.357906341552734, "epoch": 7.025598132659016, "grad_norm": 1.328125, "learning_rate": 0.000142591410748161, "loss": 4.5884, "mean_token_accuracy": 0.24427227973937987, "num_tokens": 156632536.0, "step": 90300 }, { "entropy": 5.417682552337647, "epoch": 7.0259871620307335, "grad_norm": 1.46875, "learning_rate": 0.0001425690034266514, "loss": 4.6521, "mean_token_accuracy": 0.24228838831186295, "num_tokens": 156641256.0, "step": 90305 }, { "entropy": 5.38389573097229, "epoch": 7.026376191402451, "grad_norm": 1.421875, "learning_rate": 0.0001425465981145713, "loss": 4.6108, "mean_token_accuracy": 0.24664003551006317, "num_tokens": 156650262.0, "step": 90310 }, { "entropy": 5.372488880157471, "epoch": 7.026765220774169, "grad_norm": 1.3828125, "learning_rate": 0.00014252419481226085, "loss": 4.6357, "mean_token_accuracy": 0.23763690888881683, "num_tokens": 156658974.0, "step": 90315 }, { "entropy": 5.394075727462768, "epoch": 7.027154250145886, "grad_norm": 1.328125, "learning_rate": 0.00014250179352005987, "loss": 4.561, "mean_token_accuracy": 0.2505316883325577, "num_tokens": 156667754.0, "step": 90320 }, { "entropy": 5.3771830081939695, "epoch": 7.027543279517603, "grad_norm": 1.5625, "learning_rate": 0.0001424793942383082, "loss": 4.5348, "mean_token_accuracy": 0.23985546082258224, "num_tokens": 156675022.0, "step": 90325 }, { "entropy": 5.383935785293579, "epoch": 7.027932308889321, "grad_norm": 1.375, "learning_rate": 0.00014245699696734587, "loss": 4.6334, "mean_token_accuracy": 0.2465617150068283, "num_tokens": 156683232.0, "step": 90330 }, { "entropy": 5.356411933898926, "epoch": 7.028321338261039, "grad_norm": 1.40625, "learning_rate": 0.0001424346017075126, "loss": 4.5663, "mean_token_accuracy": 0.2501958057284355, "num_tokens": 156691844.0, "step": 90335 }, { "entropy": 5.3018553256988525, "epoch": 7.0287103676327565, "grad_norm": 1.375, "learning_rate": 0.0001424122084591482, "loss": 4.6023, "mean_token_accuracy": 0.2531855657696724, "num_tokens": 156700795.0, "step": 90340 }, { "entropy": 5.359295177459717, "epoch": 7.029099397004474, "grad_norm": 1.2421875, "learning_rate": 0.00014238981722259258, "loss": 4.5279, "mean_token_accuracy": 0.2576060563325882, "num_tokens": 156709880.0, "step": 90345 }, { "entropy": 5.408241033554077, "epoch": 7.029488426376191, "grad_norm": 1.3515625, "learning_rate": 0.00014236742799818536, "loss": 4.5953, "mean_token_accuracy": 0.24689457267522813, "num_tokens": 156718961.0, "step": 90350 }, { "entropy": 5.48872389793396, "epoch": 7.029877455747909, "grad_norm": 1.40625, "learning_rate": 0.00014234504078626642, "loss": 4.7325, "mean_token_accuracy": 0.23687449991703033, "num_tokens": 156727891.0, "step": 90355 }, { "entropy": 5.391637325286865, "epoch": 7.030266485119626, "grad_norm": 1.375, "learning_rate": 0.00014232265558717521, "loss": 4.5918, "mean_token_accuracy": 0.24651237428188325, "num_tokens": 156736765.0, "step": 90360 }, { "entropy": 5.43891167640686, "epoch": 7.030655514491344, "grad_norm": 1.359375, "learning_rate": 0.00014230027240125166, "loss": 4.6652, "mean_token_accuracy": 0.23176310062408448, "num_tokens": 156745266.0, "step": 90365 }, { "entropy": 5.398260879516601, "epoch": 7.031044543863062, "grad_norm": 1.4375, "learning_rate": 0.00014227789122883512, "loss": 4.6028, "mean_token_accuracy": 0.2454163283109665, "num_tokens": 156754215.0, "step": 90370 }, { "entropy": 5.383979082107544, "epoch": 7.0314335732347795, "grad_norm": 1.3984375, "learning_rate": 0.00014225551207026546, "loss": 4.6116, "mean_token_accuracy": 0.25096548050642015, "num_tokens": 156763102.0, "step": 90375 }, { "entropy": 5.333259010314942, "epoch": 7.031822602606497, "grad_norm": 1.296875, "learning_rate": 0.00014223313492588204, "loss": 4.5182, "mean_token_accuracy": 0.2518729344010353, "num_tokens": 156771700.0, "step": 90380 }, { "entropy": 5.384879922866821, "epoch": 7.032211631978214, "grad_norm": 1.40625, "learning_rate": 0.00014221075979602453, "loss": 4.5983, "mean_token_accuracy": 0.2438817501068115, "num_tokens": 156780048.0, "step": 90385 }, { "entropy": 5.352311134338379, "epoch": 7.032600661349932, "grad_norm": 1.2265625, "learning_rate": 0.0001421883866810323, "loss": 4.6766, "mean_token_accuracy": 0.23724692016839982, "num_tokens": 156789017.0, "step": 90390 }, { "entropy": 5.437381601333618, "epoch": 7.032989690721649, "grad_norm": 1.3515625, "learning_rate": 0.000142166015581245, "loss": 4.6934, "mean_token_accuracy": 0.24058008342981338, "num_tokens": 156797109.0, "step": 90395 }, { "entropy": 5.411159896850586, "epoch": 7.033378720093367, "grad_norm": 1.25, "learning_rate": 0.00014214364649700202, "loss": 4.6891, "mean_token_accuracy": 0.24143632054328917, "num_tokens": 156805807.0, "step": 90400 }, { "entropy": 5.448505163192749, "epoch": 7.033767749465085, "grad_norm": 1.421875, "learning_rate": 0.00014212127942864251, "loss": 4.6169, "mean_token_accuracy": 0.23776184022426605, "num_tokens": 156814384.0, "step": 90405 }, { "entropy": 5.500348663330078, "epoch": 7.0341567788368025, "grad_norm": 1.390625, "learning_rate": 0.0001420989143765063, "loss": 4.7492, "mean_token_accuracy": 0.23392697274684907, "num_tokens": 156822059.0, "step": 90410 }, { "entropy": 5.309268760681152, "epoch": 7.03454580820852, "grad_norm": 1.3671875, "learning_rate": 0.00014207655134093245, "loss": 4.5123, "mean_token_accuracy": 0.26104619204998014, "num_tokens": 156830981.0, "step": 90415 }, { "entropy": 5.3668036460876465, "epoch": 7.034934837580237, "grad_norm": 1.3359375, "learning_rate": 0.0001420541903222604, "loss": 4.6414, "mean_token_accuracy": 0.24169587790966035, "num_tokens": 156839396.0, "step": 90420 }, { "entropy": 5.346806430816651, "epoch": 7.035323866951955, "grad_norm": 1.4296875, "learning_rate": 0.00014203183132082949, "loss": 4.5954, "mean_token_accuracy": 0.24926914870738984, "num_tokens": 156847426.0, "step": 90425 }, { "entropy": 5.407706165313721, "epoch": 7.035712896323672, "grad_norm": 1.3359375, "learning_rate": 0.00014200947433697875, "loss": 4.5937, "mean_token_accuracy": 0.2482050657272339, "num_tokens": 156856502.0, "step": 90430 }, { "entropy": 5.359251403808594, "epoch": 7.03610192569539, "grad_norm": 1.25, "learning_rate": 0.00014198711937104765, "loss": 4.5465, "mean_token_accuracy": 0.2513579547405243, "num_tokens": 156865335.0, "step": 90435 }, { "entropy": 5.326341915130615, "epoch": 7.036490955067108, "grad_norm": 1.234375, "learning_rate": 0.00014196476642337524, "loss": 4.5822, "mean_token_accuracy": 0.24208869338035582, "num_tokens": 156874564.0, "step": 90440 }, { "entropy": 5.37560453414917, "epoch": 7.0368799844388255, "grad_norm": 1.4140625, "learning_rate": 0.00014194241549430085, "loss": 4.5999, "mean_token_accuracy": 0.24035593271255493, "num_tokens": 156882480.0, "step": 90445 }, { "entropy": 5.349340915679932, "epoch": 7.037269013810542, "grad_norm": 1.2890625, "learning_rate": 0.0001419200665841634, "loss": 4.5332, "mean_token_accuracy": 0.25092128068208697, "num_tokens": 156891187.0, "step": 90450 }, { "entropy": 5.479745388031006, "epoch": 7.03765804318226, "grad_norm": 1.4375, "learning_rate": 0.0001418977196933022, "loss": 4.6647, "mean_token_accuracy": 0.24079934656620025, "num_tokens": 156899923.0, "step": 90455 }, { "entropy": 5.328784608840943, "epoch": 7.038047072553978, "grad_norm": 1.3671875, "learning_rate": 0.0001418753748220562, "loss": 4.5281, "mean_token_accuracy": 0.24792135059833526, "num_tokens": 156908368.0, "step": 90460 }, { "entropy": 5.337542152404785, "epoch": 7.038436101925695, "grad_norm": 1.3046875, "learning_rate": 0.00014185303197076455, "loss": 4.6179, "mean_token_accuracy": 0.2402854934334755, "num_tokens": 156916847.0, "step": 90465 }, { "entropy": 5.297685241699218, "epoch": 7.038825131297413, "grad_norm": 1.375, "learning_rate": 0.00014183069113976615, "loss": 4.5472, "mean_token_accuracy": 0.2490894764661789, "num_tokens": 156925304.0, "step": 90470 }, { "entropy": 5.417333745956421, "epoch": 7.039214160669131, "grad_norm": 1.3984375, "learning_rate": 0.00014180835232940002, "loss": 4.6254, "mean_token_accuracy": 0.24444849491119386, "num_tokens": 156933687.0, "step": 90475 }, { "entropy": 5.493073749542236, "epoch": 7.0396031900408484, "grad_norm": 1.40625, "learning_rate": 0.0001417860155400053, "loss": 4.6792, "mean_token_accuracy": 0.2351874515414238, "num_tokens": 156941416.0, "step": 90480 }, { "entropy": 5.479555940628051, "epoch": 7.039992219412565, "grad_norm": 1.296875, "learning_rate": 0.00014176368077192065, "loss": 4.6449, "mean_token_accuracy": 0.23728094398975372, "num_tokens": 156950646.0, "step": 90485 }, { "entropy": 5.357027006149292, "epoch": 7.040381248784283, "grad_norm": 1.2578125, "learning_rate": 0.00014174134802548514, "loss": 4.5832, "mean_token_accuracy": 0.24261299520730972, "num_tokens": 156959680.0, "step": 90490 }, { "entropy": 5.37088680267334, "epoch": 7.040770278156001, "grad_norm": 1.375, "learning_rate": 0.00014171901730103748, "loss": 4.6363, "mean_token_accuracy": 0.2495381012558937, "num_tokens": 156968200.0, "step": 90495 }, { "entropy": 5.36671724319458, "epoch": 7.041159307527718, "grad_norm": 1.34375, "learning_rate": 0.0001416966885989167, "loss": 4.5813, "mean_token_accuracy": 0.24611576944589614, "num_tokens": 156977257.0, "step": 90500 }, { "entropy": 5.406401109695435, "epoch": 7.041548336899436, "grad_norm": 1.3515625, "learning_rate": 0.00014167436191946147, "loss": 4.6761, "mean_token_accuracy": 0.2424040123820305, "num_tokens": 156985280.0, "step": 90505 }, { "entropy": 5.427651309967041, "epoch": 7.041937366271154, "grad_norm": 1.390625, "learning_rate": 0.00014165203726301055, "loss": 4.5761, "mean_token_accuracy": 0.25598070323467254, "num_tokens": 156993866.0, "step": 90510 }, { "entropy": 5.473586702346802, "epoch": 7.042326395642871, "grad_norm": 1.3984375, "learning_rate": 0.00014162971462990278, "loss": 4.6898, "mean_token_accuracy": 0.23484684228897096, "num_tokens": 157002441.0, "step": 90515 }, { "entropy": 5.47001838684082, "epoch": 7.042715425014588, "grad_norm": 1.328125, "learning_rate": 0.00014160739402047667, "loss": 4.6523, "mean_token_accuracy": 0.23967466205358506, "num_tokens": 157010548.0, "step": 90520 }, { "entropy": 5.359698390960693, "epoch": 7.043104454386306, "grad_norm": 1.3359375, "learning_rate": 0.0001415850754350712, "loss": 4.5652, "mean_token_accuracy": 0.2526508018374443, "num_tokens": 157019878.0, "step": 90525 }, { "entropy": 5.410479307174683, "epoch": 7.043493483758024, "grad_norm": 1.3046875, "learning_rate": 0.00014156275887402476, "loss": 4.6849, "mean_token_accuracy": 0.24247892200946808, "num_tokens": 157029042.0, "step": 90530 }, { "entropy": 5.42592420578003, "epoch": 7.043882513129741, "grad_norm": 1.28125, "learning_rate": 0.00014154044433767617, "loss": 4.6438, "mean_token_accuracy": 0.2448235958814621, "num_tokens": 157037837.0, "step": 90535 }, { "entropy": 5.370036172866821, "epoch": 7.044271542501459, "grad_norm": 1.25, "learning_rate": 0.00014151813182636375, "loss": 4.5528, "mean_token_accuracy": 0.2584438145160675, "num_tokens": 157046805.0, "step": 90540 }, { "entropy": 5.377266931533813, "epoch": 7.044660571873177, "grad_norm": 1.3046875, "learning_rate": 0.00014149582134042628, "loss": 4.6356, "mean_token_accuracy": 0.2423542246222496, "num_tokens": 157055497.0, "step": 90545 }, { "entropy": 5.396782541275025, "epoch": 7.045049601244894, "grad_norm": 1.3359375, "learning_rate": 0.00014147351288020232, "loss": 4.6224, "mean_token_accuracy": 0.2434399500489235, "num_tokens": 157064534.0, "step": 90550 }, { "entropy": 5.303544330596924, "epoch": 7.045438630616611, "grad_norm": 1.3828125, "learning_rate": 0.00014145120644603015, "loss": 4.5481, "mean_token_accuracy": 0.2460574820637703, "num_tokens": 157073565.0, "step": 90555 }, { "entropy": 5.385702610015869, "epoch": 7.045827659988329, "grad_norm": 1.3515625, "learning_rate": 0.0001414289020382485, "loss": 4.5766, "mean_token_accuracy": 0.24406556338071822, "num_tokens": 157082139.0, "step": 90560 }, { "entropy": 5.45256814956665, "epoch": 7.046216689360047, "grad_norm": 1.3359375, "learning_rate": 0.00014140659965719554, "loss": 4.7028, "mean_token_accuracy": 0.2352342799305916, "num_tokens": 157090646.0, "step": 90565 }, { "entropy": 5.369922828674317, "epoch": 7.046605718731764, "grad_norm": 1.3828125, "learning_rate": 0.0001413842993032099, "loss": 4.5841, "mean_token_accuracy": 0.24832893311977386, "num_tokens": 157098683.0, "step": 90570 }, { "entropy": 5.411153507232666, "epoch": 7.046994748103482, "grad_norm": 1.34375, "learning_rate": 0.0001413620009766297, "loss": 4.6132, "mean_token_accuracy": 0.24043766558170318, "num_tokens": 157107329.0, "step": 90575 }, { "entropy": 5.307624864578247, "epoch": 7.0473837774752, "grad_norm": 1.3671875, "learning_rate": 0.00014133970467779356, "loss": 4.5257, "mean_token_accuracy": 0.24353550225496293, "num_tokens": 157116203.0, "step": 90580 }, { "entropy": 5.327100038528442, "epoch": 7.0477728068469165, "grad_norm": 1.3125, "learning_rate": 0.00014131741040703967, "loss": 4.5753, "mean_token_accuracy": 0.24991081207990645, "num_tokens": 157125797.0, "step": 90585 }, { "entropy": 5.376039743423462, "epoch": 7.048161836218634, "grad_norm": 1.3671875, "learning_rate": 0.0001412951181647062, "loss": 4.5938, "mean_token_accuracy": 0.25237798392772676, "num_tokens": 157133718.0, "step": 90590 }, { "entropy": 5.4069324970245365, "epoch": 7.048550865590352, "grad_norm": 1.3515625, "learning_rate": 0.00014127282795113158, "loss": 4.7458, "mean_token_accuracy": 0.24094966053962708, "num_tokens": 157142812.0, "step": 90595 }, { "entropy": 5.355803775787353, "epoch": 7.04893989496207, "grad_norm": 1.4375, "learning_rate": 0.00014125053976665386, "loss": 4.6003, "mean_token_accuracy": 0.24812051653862, "num_tokens": 157151024.0, "step": 90600 }, { "entropy": 5.354247903823852, "epoch": 7.049328924333787, "grad_norm": 1.34375, "learning_rate": 0.00014122825361161134, "loss": 4.4322, "mean_token_accuracy": 0.2580421715974808, "num_tokens": 157158653.0, "step": 90605 }, { "entropy": 5.4534299850463865, "epoch": 7.049717953705505, "grad_norm": 1.40625, "learning_rate": 0.00014120596948634213, "loss": 4.6445, "mean_token_accuracy": 0.25002614706754683, "num_tokens": 157167930.0, "step": 90610 }, { "entropy": 5.362213230133056, "epoch": 7.050106983077223, "grad_norm": 1.6796875, "learning_rate": 0.0001411836873911844, "loss": 4.5934, "mean_token_accuracy": 0.2510505810379982, "num_tokens": 157176929.0, "step": 90615 }, { "entropy": 5.3800452709197994, "epoch": 7.0504960124489395, "grad_norm": 1.4140625, "learning_rate": 0.0001411614073264763, "loss": 4.6221, "mean_token_accuracy": 0.2464775711297989, "num_tokens": 157185055.0, "step": 90620 }, { "entropy": 5.381664085388183, "epoch": 7.050885041820657, "grad_norm": 1.2265625, "learning_rate": 0.00014113912929255575, "loss": 4.6134, "mean_token_accuracy": 0.24213008880615233, "num_tokens": 157195942.0, "step": 90625 }, { "entropy": 5.38079605102539, "epoch": 7.051274071192375, "grad_norm": 1.4140625, "learning_rate": 0.0001411168532897609, "loss": 4.609, "mean_token_accuracy": 0.24518264085054398, "num_tokens": 157204687.0, "step": 90630 }, { "entropy": 5.413254356384277, "epoch": 7.051663100564093, "grad_norm": 1.3828125, "learning_rate": 0.00014109457931842965, "loss": 4.632, "mean_token_accuracy": 0.23882546424865722, "num_tokens": 157213340.0, "step": 90635 }, { "entropy": 5.327270126342773, "epoch": 7.05205212993581, "grad_norm": 1.3359375, "learning_rate": 0.0001410723073789001, "loss": 4.4735, "mean_token_accuracy": 0.2556880787014961, "num_tokens": 157221418.0, "step": 90640 }, { "entropy": 5.321653413772583, "epoch": 7.052441159307528, "grad_norm": 1.5078125, "learning_rate": 0.00014105003747150998, "loss": 4.5578, "mean_token_accuracy": 0.25513159185647966, "num_tokens": 157229629.0, "step": 90645 }, { "entropy": 5.406086874008179, "epoch": 7.052830188679246, "grad_norm": 1.3359375, "learning_rate": 0.00014102776959659747, "loss": 4.6348, "mean_token_accuracy": 0.24039511233568192, "num_tokens": 157238613.0, "step": 90650 }, { "entropy": 5.413584899902344, "epoch": 7.0532192180509625, "grad_norm": 1.3671875, "learning_rate": 0.00014100550375450025, "loss": 4.6502, "mean_token_accuracy": 0.24504314959049225, "num_tokens": 157247659.0, "step": 90655 }, { "entropy": 5.403626775741577, "epoch": 7.05360824742268, "grad_norm": 1.3828125, "learning_rate": 0.00014098323994555628, "loss": 4.6109, "mean_token_accuracy": 0.24819845706224442, "num_tokens": 157256328.0, "step": 90660 }, { "entropy": 5.456136560440063, "epoch": 7.053997276794398, "grad_norm": 1.40625, "learning_rate": 0.00014096097817010333, "loss": 4.6894, "mean_token_accuracy": 0.23941798657178878, "num_tokens": 157264039.0, "step": 90665 }, { "entropy": 5.384472322463989, "epoch": 7.054386306166116, "grad_norm": 1.4140625, "learning_rate": 0.00014093871842847915, "loss": 4.5875, "mean_token_accuracy": 0.24930048286914824, "num_tokens": 157272633.0, "step": 90670 }, { "entropy": 5.310544776916504, "epoch": 7.054775335537833, "grad_norm": 1.3125, "learning_rate": 0.00014091646072102155, "loss": 4.5141, "mean_token_accuracy": 0.248792465031147, "num_tokens": 157280959.0, "step": 90675 }, { "entropy": 5.437867259979248, "epoch": 7.055164364909551, "grad_norm": 1.4296875, "learning_rate": 0.00014089420504806815, "loss": 4.6471, "mean_token_accuracy": 0.2440081864595413, "num_tokens": 157289388.0, "step": 90680 }, { "entropy": 5.290671253204346, "epoch": 7.055553394281268, "grad_norm": 1.3046875, "learning_rate": 0.0001408719514099569, "loss": 4.4995, "mean_token_accuracy": 0.25810355246067046, "num_tokens": 157298067.0, "step": 90685 }, { "entropy": 5.361550426483154, "epoch": 7.0559424236529855, "grad_norm": 1.3515625, "learning_rate": 0.00014084969980702523, "loss": 4.5693, "mean_token_accuracy": 0.24985786080360411, "num_tokens": 157307238.0, "step": 90690 }, { "entropy": 5.352295684814453, "epoch": 7.056331453024703, "grad_norm": 1.3984375, "learning_rate": 0.0001408274502396109, "loss": 4.5522, "mean_token_accuracy": 0.2535127565264702, "num_tokens": 157316321.0, "step": 90695 }, { "entropy": 5.337662982940674, "epoch": 7.056720482396421, "grad_norm": 1.375, "learning_rate": 0.0001408052027080514, "loss": 4.6016, "mean_token_accuracy": 0.24933214485645294, "num_tokens": 157325004.0, "step": 90700 }, { "entropy": 5.354420566558838, "epoch": 7.057109511768139, "grad_norm": 1.2890625, "learning_rate": 0.00014078295721268433, "loss": 4.5241, "mean_token_accuracy": 0.24725250005722046, "num_tokens": 157333215.0, "step": 90705 }, { "entropy": 5.41779317855835, "epoch": 7.057498541139856, "grad_norm": 1.3359375, "learning_rate": 0.0001407607137538473, "loss": 4.6058, "mean_token_accuracy": 0.24671480655670167, "num_tokens": 157341614.0, "step": 90710 }, { "entropy": 5.341759252548218, "epoch": 7.057887570511574, "grad_norm": 1.359375, "learning_rate": 0.00014073847233187775, "loss": 4.5626, "mean_token_accuracy": 0.24870250672101973, "num_tokens": 157349647.0, "step": 90715 }, { "entropy": 5.347904253005981, "epoch": 7.058276599883291, "grad_norm": 1.375, "learning_rate": 0.00014071623294711322, "loss": 4.6088, "mean_token_accuracy": 0.24590718746185303, "num_tokens": 157358184.0, "step": 90720 }, { "entropy": 5.376938247680664, "epoch": 7.0586656292550085, "grad_norm": 1.3203125, "learning_rate": 0.0001406939955998911, "loss": 4.6149, "mean_token_accuracy": 0.24486315101385117, "num_tokens": 157367492.0, "step": 90725 }, { "entropy": 5.401052188873291, "epoch": 7.059054658626726, "grad_norm": 1.3359375, "learning_rate": 0.00014067176029054884, "loss": 4.5648, "mean_token_accuracy": 0.25245814919471743, "num_tokens": 157375863.0, "step": 90730 }, { "entropy": 5.412055110931396, "epoch": 7.059443687998444, "grad_norm": 1.453125, "learning_rate": 0.00014064952701942375, "loss": 4.6516, "mean_token_accuracy": 0.24815927147865297, "num_tokens": 157384660.0, "step": 90735 }, { "entropy": 5.35265793800354, "epoch": 7.059832717370162, "grad_norm": 1.34375, "learning_rate": 0.00014062729578685326, "loss": 4.6125, "mean_token_accuracy": 0.24236167967319489, "num_tokens": 157392855.0, "step": 90740 }, { "entropy": 5.343120431900024, "epoch": 7.060221746741879, "grad_norm": 1.421875, "learning_rate": 0.00014060506659317474, "loss": 4.5669, "mean_token_accuracy": 0.2514739900827408, "num_tokens": 157401316.0, "step": 90745 }, { "entropy": 5.334744310379028, "epoch": 7.060610776113597, "grad_norm": 1.40625, "learning_rate": 0.00014058283943872536, "loss": 4.6255, "mean_token_accuracy": 0.24187921732664108, "num_tokens": 157410268.0, "step": 90750 }, { "entropy": 5.34069299697876, "epoch": 7.060999805485314, "grad_norm": 1.2578125, "learning_rate": 0.00014056061432384255, "loss": 4.5892, "mean_token_accuracy": 0.24535911977291108, "num_tokens": 157419203.0, "step": 90755 }, { "entropy": 5.448922634124756, "epoch": 7.0613888348570315, "grad_norm": 1.3671875, "learning_rate": 0.0001405383912488633, "loss": 4.6819, "mean_token_accuracy": 0.23608165979385376, "num_tokens": 157427740.0, "step": 90760 }, { "entropy": 5.363872814178467, "epoch": 7.061777864228749, "grad_norm": 1.4296875, "learning_rate": 0.00014051617021412506, "loss": 4.6351, "mean_token_accuracy": 0.24915624558925628, "num_tokens": 157436202.0, "step": 90765 }, { "entropy": 5.369014835357666, "epoch": 7.062166893600467, "grad_norm": 1.3828125, "learning_rate": 0.00014049395121996477, "loss": 4.5296, "mean_token_accuracy": 0.2525538370013237, "num_tokens": 157444549.0, "step": 90770 }, { "entropy": 5.328976058959961, "epoch": 7.062555922972185, "grad_norm": 1.359375, "learning_rate": 0.0001404717342667198, "loss": 4.4992, "mean_token_accuracy": 0.25200038254261015, "num_tokens": 157452713.0, "step": 90775 }, { "entropy": 5.301155281066895, "epoch": 7.062944952343902, "grad_norm": 1.4453125, "learning_rate": 0.00014044951935472712, "loss": 4.5417, "mean_token_accuracy": 0.2477022811770439, "num_tokens": 157461463.0, "step": 90780 }, { "entropy": 5.34549036026001, "epoch": 7.063333981715619, "grad_norm": 1.2578125, "learning_rate": 0.00014042730648432375, "loss": 4.639, "mean_token_accuracy": 0.24238620549440384, "num_tokens": 157470188.0, "step": 90785 }, { "entropy": 5.4013200283050535, "epoch": 7.063723011087337, "grad_norm": 1.2578125, "learning_rate": 0.0001404050956558469, "loss": 4.598, "mean_token_accuracy": 0.23834707885980605, "num_tokens": 157478315.0, "step": 90790 }, { "entropy": 5.31847448348999, "epoch": 7.0641120404590545, "grad_norm": 1.3203125, "learning_rate": 0.0001403828868696334, "loss": 4.6124, "mean_token_accuracy": 0.23967136740684508, "num_tokens": 157486937.0, "step": 90795 }, { "entropy": 5.304755020141601, "epoch": 7.064501069830772, "grad_norm": 1.296875, "learning_rate": 0.0001403606801260204, "loss": 4.5304, "mean_token_accuracy": 0.25286256670951845, "num_tokens": 157495676.0, "step": 90800 }, { "entropy": 5.367902612686157, "epoch": 7.06489009920249, "grad_norm": 1.3203125, "learning_rate": 0.00014033847542534473, "loss": 4.6019, "mean_token_accuracy": 0.24580440372228624, "num_tokens": 157504265.0, "step": 90805 }, { "entropy": 5.359374332427978, "epoch": 7.065279128574208, "grad_norm": 1.421875, "learning_rate": 0.00014031627276794333, "loss": 4.612, "mean_token_accuracy": 0.2446424424648285, "num_tokens": 157513173.0, "step": 90810 }, { "entropy": 5.372652006149292, "epoch": 7.065668157945925, "grad_norm": 1.359375, "learning_rate": 0.00014029407215415319, "loss": 4.5803, "mean_token_accuracy": 0.24895976781845092, "num_tokens": 157521936.0, "step": 90815 }, { "entropy": 5.314547777175903, "epoch": 7.066057187317642, "grad_norm": 1.3984375, "learning_rate": 0.00014027187358431104, "loss": 4.5183, "mean_token_accuracy": 0.24832783937454223, "num_tokens": 157531231.0, "step": 90820 }, { "entropy": 5.411796760559082, "epoch": 7.06644621668936, "grad_norm": 1.28125, "learning_rate": 0.00014024967705875382, "loss": 4.6157, "mean_token_accuracy": 0.24724265038967133, "num_tokens": 157539707.0, "step": 90825 }, { "entropy": 5.472136306762695, "epoch": 7.0668352460610775, "grad_norm": 1.4921875, "learning_rate": 0.00014022748257781824, "loss": 4.6869, "mean_token_accuracy": 0.23652732819318772, "num_tokens": 157547362.0, "step": 90830 }, { "entropy": 5.348248720169067, "epoch": 7.067224275432795, "grad_norm": 1.3125, "learning_rate": 0.00014020529014184115, "loss": 4.5868, "mean_token_accuracy": 0.24435074180364608, "num_tokens": 157556260.0, "step": 90835 }, { "entropy": 5.448028659820556, "epoch": 7.067613304804513, "grad_norm": 1.4296875, "learning_rate": 0.00014018309975115918, "loss": 4.6682, "mean_token_accuracy": 0.23848434835672377, "num_tokens": 157564698.0, "step": 90840 }, { "entropy": 5.351601791381836, "epoch": 7.068002334176231, "grad_norm": 1.2734375, "learning_rate": 0.00014016091140610913, "loss": 4.5883, "mean_token_accuracy": 0.25004030764102936, "num_tokens": 157574544.0, "step": 90845 }, { "entropy": 5.304588747024536, "epoch": 7.068391363547948, "grad_norm": 1.34375, "learning_rate": 0.00014013872510702758, "loss": 4.4942, "mean_token_accuracy": 0.2533778503537178, "num_tokens": 157583362.0, "step": 90850 }, { "entropy": 5.299684524536133, "epoch": 7.068780392919665, "grad_norm": 1.2578125, "learning_rate": 0.0001401165408542513, "loss": 4.4899, "mean_token_accuracy": 0.2556603580713272, "num_tokens": 157592032.0, "step": 90855 }, { "entropy": 5.339626884460449, "epoch": 7.069169422291383, "grad_norm": 1.4140625, "learning_rate": 0.0001400943586481168, "loss": 4.5113, "mean_token_accuracy": 0.25643721520900725, "num_tokens": 157600396.0, "step": 90860 }, { "entropy": 5.399127101898193, "epoch": 7.0695584516631005, "grad_norm": 1.390625, "learning_rate": 0.0001400721784889606, "loss": 4.6481, "mean_token_accuracy": 0.23925201296806337, "num_tokens": 157608919.0, "step": 90865 }, { "entropy": 5.393349361419678, "epoch": 7.069947481034818, "grad_norm": 1.3125, "learning_rate": 0.00014005000037711936, "loss": 4.6664, "mean_token_accuracy": 0.24181021600961686, "num_tokens": 157617702.0, "step": 90870 }, { "entropy": 5.359745597839355, "epoch": 7.070336510406536, "grad_norm": 1.3203125, "learning_rate": 0.00014002782431292955, "loss": 4.5826, "mean_token_accuracy": 0.2516361206769943, "num_tokens": 157625999.0, "step": 90875 }, { "entropy": 5.430653762817383, "epoch": 7.070725539778254, "grad_norm": 1.2890625, "learning_rate": 0.00014000565029672777, "loss": 4.6761, "mean_token_accuracy": 0.23965599685907363, "num_tokens": 157635231.0, "step": 90880 }, { "entropy": 5.39701018333435, "epoch": 7.07111456914997, "grad_norm": 1.359375, "learning_rate": 0.0001399834783288504, "loss": 4.6014, "mean_token_accuracy": 0.2444734051823616, "num_tokens": 157643763.0, "step": 90885 }, { "entropy": 5.382362794876099, "epoch": 7.071503598521688, "grad_norm": 1.4140625, "learning_rate": 0.0001399613084096337, "loss": 4.6297, "mean_token_accuracy": 0.24666413813829421, "num_tokens": 157652464.0, "step": 90890 }, { "entropy": 5.323703956604004, "epoch": 7.071892627893406, "grad_norm": 1.3515625, "learning_rate": 0.00013993914053941434, "loss": 4.4973, "mean_token_accuracy": 0.24931247383356095, "num_tokens": 157661399.0, "step": 90895 }, { "entropy": 5.414973878860474, "epoch": 7.0722816572651235, "grad_norm": 1.2578125, "learning_rate": 0.00013991697471852843, "loss": 4.6307, "mean_token_accuracy": 0.2414214327931404, "num_tokens": 157670423.0, "step": 90900 }, { "entropy": 5.420285224914551, "epoch": 7.072670686636841, "grad_norm": 1.4375, "learning_rate": 0.00013989481094731256, "loss": 4.6199, "mean_token_accuracy": 0.24389638304710387, "num_tokens": 157678518.0, "step": 90905 }, { "entropy": 5.299556016921997, "epoch": 7.073059716008559, "grad_norm": 1.421875, "learning_rate": 0.00013987264922610276, "loss": 4.5043, "mean_token_accuracy": 0.2566379323601723, "num_tokens": 157687288.0, "step": 90910 }, { "entropy": 5.3662279605865475, "epoch": 7.073448745380277, "grad_norm": 1.3671875, "learning_rate": 0.00013985048955523555, "loss": 4.6316, "mean_token_accuracy": 0.2530925542116165, "num_tokens": 157695772.0, "step": 90915 }, { "entropy": 5.382780313491821, "epoch": 7.073837774751993, "grad_norm": 1.296875, "learning_rate": 0.00013982833193504696, "loss": 4.6543, "mean_token_accuracy": 0.24570504277944566, "num_tokens": 157703973.0, "step": 90920 }, { "entropy": 5.351260232925415, "epoch": 7.074226804123711, "grad_norm": 1.3828125, "learning_rate": 0.00013980617636587334, "loss": 4.5744, "mean_token_accuracy": 0.24799355119466782, "num_tokens": 157712846.0, "step": 90925 }, { "entropy": 5.386017370223999, "epoch": 7.074615833495429, "grad_norm": 1.4609375, "learning_rate": 0.00013978402284805076, "loss": 4.5913, "mean_token_accuracy": 0.24599877446889878, "num_tokens": 157721675.0, "step": 90930 }, { "entropy": 5.395230770111084, "epoch": 7.0750048628671465, "grad_norm": 1.4296875, "learning_rate": 0.00013976187138191548, "loss": 4.5443, "mean_token_accuracy": 0.25046300888061523, "num_tokens": 157729544.0, "step": 90935 }, { "entropy": 5.333476448059082, "epoch": 7.075393892238864, "grad_norm": 1.3984375, "learning_rate": 0.00013973972196780346, "loss": 4.5381, "mean_token_accuracy": 0.2538297578692436, "num_tokens": 157738370.0, "step": 90940 }, { "entropy": 5.401645278930664, "epoch": 7.075782921610582, "grad_norm": 1.40625, "learning_rate": 0.0001397175746060509, "loss": 4.5598, "mean_token_accuracy": 0.25369314551353456, "num_tokens": 157746866.0, "step": 90945 }, { "entropy": 5.326844263076782, "epoch": 7.0761719509823, "grad_norm": 1.3203125, "learning_rate": 0.00013969542929699385, "loss": 4.5081, "mean_token_accuracy": 0.2485993728041649, "num_tokens": 157755213.0, "step": 90950 }, { "entropy": 5.293819856643677, "epoch": 7.076560980354016, "grad_norm": 1.3984375, "learning_rate": 0.0001396732860409683, "loss": 4.5572, "mean_token_accuracy": 0.2462384894490242, "num_tokens": 157763740.0, "step": 90955 }, { "entropy": 5.33265962600708, "epoch": 7.076950009725734, "grad_norm": 1.3046875, "learning_rate": 0.00013965114483831026, "loss": 4.5238, "mean_token_accuracy": 0.24613946229219436, "num_tokens": 157772412.0, "step": 90960 }, { "entropy": 5.380666971206665, "epoch": 7.077339039097452, "grad_norm": 1.453125, "learning_rate": 0.00013962900568935567, "loss": 4.6098, "mean_token_accuracy": 0.2461026653647423, "num_tokens": 157780839.0, "step": 90965 }, { "entropy": 5.437144374847412, "epoch": 7.0777280684691695, "grad_norm": 1.3359375, "learning_rate": 0.0001396068685944404, "loss": 4.6763, "mean_token_accuracy": 0.23926704823970796, "num_tokens": 157789779.0, "step": 90970 }, { "entropy": 5.327627801895142, "epoch": 7.078117097840887, "grad_norm": 1.4765625, "learning_rate": 0.00013958473355390045, "loss": 4.4659, "mean_token_accuracy": 0.2506730929017067, "num_tokens": 157797771.0, "step": 90975 }, { "entropy": 5.283209800720215, "epoch": 7.078506127212605, "grad_norm": 1.328125, "learning_rate": 0.00013956260056807157, "loss": 4.4529, "mean_token_accuracy": 0.2536663100123405, "num_tokens": 157806524.0, "step": 90980 }, { "entropy": 5.345575618743896, "epoch": 7.078895156584322, "grad_norm": 1.3203125, "learning_rate": 0.00013954046963728973, "loss": 4.5646, "mean_token_accuracy": 0.24884819388389587, "num_tokens": 157815647.0, "step": 90985 }, { "entropy": 5.376604890823364, "epoch": 7.079284185956039, "grad_norm": 1.4140625, "learning_rate": 0.00013951834076189056, "loss": 4.5858, "mean_token_accuracy": 0.25276903361082076, "num_tokens": 157823711.0, "step": 90990 }, { "entropy": 5.448965311050415, "epoch": 7.079673215327757, "grad_norm": 1.3984375, "learning_rate": 0.00013949621394221002, "loss": 4.7022, "mean_token_accuracy": 0.23551566898822784, "num_tokens": 157831651.0, "step": 90995 }, { "entropy": 5.275083541870117, "epoch": 7.080062244699475, "grad_norm": 1.3046875, "learning_rate": 0.0001394740891785837, "loss": 4.4931, "mean_token_accuracy": 0.2570167914032936, "num_tokens": 157840618.0, "step": 91000 }, { "entropy": 5.373444271087647, "epoch": 7.0804512740711925, "grad_norm": 1.3359375, "learning_rate": 0.00013945196647134733, "loss": 4.6441, "mean_token_accuracy": 0.24536640346050262, "num_tokens": 157849964.0, "step": 91005 }, { "entropy": 5.343231534957885, "epoch": 7.08084030344291, "grad_norm": 1.2265625, "learning_rate": 0.00013942984582083673, "loss": 4.5104, "mean_token_accuracy": 0.24795818328857422, "num_tokens": 157858626.0, "step": 91010 }, { "entropy": 5.362875127792359, "epoch": 7.081229332814628, "grad_norm": 1.421875, "learning_rate": 0.00013940772722738736, "loss": 4.5692, "mean_token_accuracy": 0.24352590441703797, "num_tokens": 157866917.0, "step": 91015 }, { "entropy": 5.361588382720948, "epoch": 7.081618362186345, "grad_norm": 1.296875, "learning_rate": 0.00013938561069133497, "loss": 4.5879, "mean_token_accuracy": 0.2537261828780174, "num_tokens": 157875478.0, "step": 91020 }, { "entropy": 5.3179536819458, "epoch": 7.082007391558062, "grad_norm": 1.4140625, "learning_rate": 0.00013936349621301503, "loss": 4.4982, "mean_token_accuracy": 0.25127245783805846, "num_tokens": 157883343.0, "step": 91025 }, { "entropy": 5.382967805862426, "epoch": 7.08239642092978, "grad_norm": 1.328125, "learning_rate": 0.0001393413837927632, "loss": 4.5887, "mean_token_accuracy": 0.24440044015645981, "num_tokens": 157891396.0, "step": 91030 }, { "entropy": 5.400006914138794, "epoch": 7.082785450301498, "grad_norm": 1.4375, "learning_rate": 0.00013931927343091487, "loss": 4.5948, "mean_token_accuracy": 0.24150725305080414, "num_tokens": 157899806.0, "step": 91035 }, { "entropy": 5.370210886001587, "epoch": 7.0831744796732155, "grad_norm": 1.4453125, "learning_rate": 0.00013929716512780572, "loss": 4.6198, "mean_token_accuracy": 0.2406170889735222, "num_tokens": 157908272.0, "step": 91040 }, { "entropy": 5.320813512802124, "epoch": 7.083563509044933, "grad_norm": 1.4140625, "learning_rate": 0.00013927505888377094, "loss": 4.5304, "mean_token_accuracy": 0.25785660147666933, "num_tokens": 157916875.0, "step": 91045 }, { "entropy": 5.334602308273316, "epoch": 7.083952538416651, "grad_norm": 1.515625, "learning_rate": 0.0001392529546991463, "loss": 4.6002, "mean_token_accuracy": 0.24974137246608735, "num_tokens": 157925544.0, "step": 91050 }, { "entropy": 5.367081546783448, "epoch": 7.084341567788368, "grad_norm": 1.3984375, "learning_rate": 0.00013923085257426694, "loss": 4.6289, "mean_token_accuracy": 0.23865650296211244, "num_tokens": 157934321.0, "step": 91055 }, { "entropy": 5.413476276397705, "epoch": 7.084730597160085, "grad_norm": 1.34375, "learning_rate": 0.00013920875250946822, "loss": 4.6, "mean_token_accuracy": 0.24694847464561462, "num_tokens": 157942853.0, "step": 91060 }, { "entropy": 5.372056674957276, "epoch": 7.085119626531803, "grad_norm": 1.3125, "learning_rate": 0.00013918665450508565, "loss": 4.5866, "mean_token_accuracy": 0.2534540370106697, "num_tokens": 157950790.0, "step": 91065 }, { "entropy": 5.429498624801636, "epoch": 7.085508655903521, "grad_norm": 1.296875, "learning_rate": 0.00013916455856145425, "loss": 4.6538, "mean_token_accuracy": 0.23976635038852692, "num_tokens": 157960077.0, "step": 91070 }, { "entropy": 5.4246203899383545, "epoch": 7.0858976852752384, "grad_norm": 1.3203125, "learning_rate": 0.0001391424646789096, "loss": 4.6497, "mean_token_accuracy": 0.2380112275481224, "num_tokens": 157968723.0, "step": 91075 }, { "entropy": 5.362253570556641, "epoch": 7.086286714646956, "grad_norm": 1.34375, "learning_rate": 0.00013912037285778686, "loss": 4.5361, "mean_token_accuracy": 0.25497488528490064, "num_tokens": 157977284.0, "step": 91080 }, { "entropy": 5.423880481719971, "epoch": 7.086675744018674, "grad_norm": 1.3359375, "learning_rate": 0.0001390982830984211, "loss": 4.5923, "mean_token_accuracy": 0.24881599843502045, "num_tokens": 157985864.0, "step": 91085 }, { "entropy": 5.370779418945313, "epoch": 7.087064773390391, "grad_norm": 1.390625, "learning_rate": 0.00013907619540114762, "loss": 4.5236, "mean_token_accuracy": 0.24591085612773894, "num_tokens": 157994882.0, "step": 91090 }, { "entropy": 5.4062299728393555, "epoch": 7.087453802762108, "grad_norm": 1.3359375, "learning_rate": 0.00013905410976630152, "loss": 4.6481, "mean_token_accuracy": 0.23440274298191072, "num_tokens": 158004121.0, "step": 91095 }, { "entropy": 5.329976749420166, "epoch": 7.087842832133826, "grad_norm": 1.4375, "learning_rate": 0.00013903202619421794, "loss": 4.5364, "mean_token_accuracy": 0.25016292184591293, "num_tokens": 158011932.0, "step": 91100 }, { "entropy": 5.311750173568726, "epoch": 7.088231861505544, "grad_norm": 1.3828125, "learning_rate": 0.00013900994468523192, "loss": 4.5161, "mean_token_accuracy": 0.2546752244234085, "num_tokens": 158020343.0, "step": 91105 }, { "entropy": 5.373808908462524, "epoch": 7.088620890877261, "grad_norm": 1.296875, "learning_rate": 0.00013898786523967857, "loss": 4.5615, "mean_token_accuracy": 0.25393116623163225, "num_tokens": 158029022.0, "step": 91110 }, { "entropy": 5.436993026733399, "epoch": 7.089009920248979, "grad_norm": 1.453125, "learning_rate": 0.0001389657878578928, "loss": 4.6554, "mean_token_accuracy": 0.24412131160497666, "num_tokens": 158037489.0, "step": 91115 }, { "entropy": 5.363737678527832, "epoch": 7.089398949620696, "grad_norm": 1.3984375, "learning_rate": 0.00013894371254020982, "loss": 4.5472, "mean_token_accuracy": 0.2398570418357849, "num_tokens": 158046394.0, "step": 91120 }, { "entropy": 5.353598594665527, "epoch": 7.089787978992414, "grad_norm": 1.328125, "learning_rate": 0.00013892163928696434, "loss": 4.5176, "mean_token_accuracy": 0.2509632080793381, "num_tokens": 158054256.0, "step": 91125 }, { "entropy": 5.365849447250366, "epoch": 7.090177008364131, "grad_norm": 1.359375, "learning_rate": 0.00013889956809849145, "loss": 4.5667, "mean_token_accuracy": 0.2477084994316101, "num_tokens": 158062819.0, "step": 91130 }, { "entropy": 5.402872514724732, "epoch": 7.090566037735849, "grad_norm": 1.4453125, "learning_rate": 0.000138877498975126, "loss": 4.6886, "mean_token_accuracy": 0.23419993221759797, "num_tokens": 158071393.0, "step": 91135 }, { "entropy": 5.4116607189178465, "epoch": 7.090955067107567, "grad_norm": 1.328125, "learning_rate": 0.00013885543191720267, "loss": 4.6066, "mean_token_accuracy": 0.2406143456697464, "num_tokens": 158080194.0, "step": 91140 }, { "entropy": 5.407731533050537, "epoch": 7.091344096479284, "grad_norm": 1.3359375, "learning_rate": 0.00013883336692505663, "loss": 4.6012, "mean_token_accuracy": 0.24365233182907103, "num_tokens": 158088461.0, "step": 91145 }, { "entropy": 5.429109668731689, "epoch": 7.091733125851002, "grad_norm": 1.4296875, "learning_rate": 0.00013881130399902246, "loss": 4.6609, "mean_token_accuracy": 0.23886772841215134, "num_tokens": 158097077.0, "step": 91150 }, { "entropy": 5.264361381530762, "epoch": 7.092122155222719, "grad_norm": 1.2890625, "learning_rate": 0.00013878924313943502, "loss": 4.4757, "mean_token_accuracy": 0.25841326266527176, "num_tokens": 158105875.0, "step": 91155 }, { "entropy": 5.401818084716797, "epoch": 7.092511184594437, "grad_norm": 1.3828125, "learning_rate": 0.00013876718434662906, "loss": 4.5882, "mean_token_accuracy": 0.25150246322155, "num_tokens": 158114187.0, "step": 91160 }, { "entropy": 5.382562255859375, "epoch": 7.092900213966154, "grad_norm": 1.390625, "learning_rate": 0.00013874512762093914, "loss": 4.6235, "mean_token_accuracy": 0.24551106244325638, "num_tokens": 158122827.0, "step": 91165 }, { "entropy": 5.313882112503052, "epoch": 7.093289243337872, "grad_norm": 1.328125, "learning_rate": 0.00013872307296270008, "loss": 4.5931, "mean_token_accuracy": 0.24442370384931564, "num_tokens": 158131210.0, "step": 91170 }, { "entropy": 5.292608165740967, "epoch": 7.09367827270959, "grad_norm": 1.4140625, "learning_rate": 0.00013870102037224645, "loss": 4.5285, "mean_token_accuracy": 0.24674749076366426, "num_tokens": 158140190.0, "step": 91175 }, { "entropy": 5.401205348968506, "epoch": 7.094067302081307, "grad_norm": 1.3359375, "learning_rate": 0.00013867896984991296, "loss": 4.6677, "mean_token_accuracy": 0.23697558045387268, "num_tokens": 158149409.0, "step": 91180 }, { "entropy": 5.377355241775513, "epoch": 7.094456331453025, "grad_norm": 1.40625, "learning_rate": 0.00013865692139603404, "loss": 4.5503, "mean_token_accuracy": 0.24438160061836242, "num_tokens": 158158546.0, "step": 91185 }, { "entropy": 5.431010484695435, "epoch": 7.094845360824742, "grad_norm": 1.3984375, "learning_rate": 0.0001386348750109444, "loss": 4.6935, "mean_token_accuracy": 0.23980841040611267, "num_tokens": 158166872.0, "step": 91190 }, { "entropy": 5.331302070617676, "epoch": 7.09523439019646, "grad_norm": 1.34375, "learning_rate": 0.00013861283069497844, "loss": 4.5399, "mean_token_accuracy": 0.2549004480242729, "num_tokens": 158175723.0, "step": 91195 }, { "entropy": 5.346026134490967, "epoch": 7.095623419568177, "grad_norm": 1.3671875, "learning_rate": 0.00013859078844847072, "loss": 4.5321, "mean_token_accuracy": 0.2528258889913559, "num_tokens": 158184378.0, "step": 91200 }, { "entropy": 5.354621124267578, "epoch": 7.096012448939895, "grad_norm": 1.34375, "learning_rate": 0.00013856874827175564, "loss": 4.6155, "mean_token_accuracy": 0.23974245339632033, "num_tokens": 158193217.0, "step": 91205 }, { "entropy": 5.357074022293091, "epoch": 7.096401478311613, "grad_norm": 1.4296875, "learning_rate": 0.0001385467101651676, "loss": 4.6037, "mean_token_accuracy": 0.2478442519903183, "num_tokens": 158201761.0, "step": 91210 }, { "entropy": 5.378391170501709, "epoch": 7.09679050768333, "grad_norm": 1.3515625, "learning_rate": 0.0001385246741290412, "loss": 4.6317, "mean_token_accuracy": 0.24663520604372025, "num_tokens": 158211560.0, "step": 91215 }, { "entropy": 5.365364265441895, "epoch": 7.097179537055047, "grad_norm": 1.3671875, "learning_rate": 0.0001385026401637105, "loss": 4.613, "mean_token_accuracy": 0.2455908626317978, "num_tokens": 158220322.0, "step": 91220 }, { "entropy": 5.432413530349732, "epoch": 7.097568566426765, "grad_norm": 1.296875, "learning_rate": 0.00013848060826951005, "loss": 4.7277, "mean_token_accuracy": 0.2313808724284172, "num_tokens": 158229311.0, "step": 91225 }, { "entropy": 5.356674242019653, "epoch": 7.097957595798483, "grad_norm": 1.3515625, "learning_rate": 0.00013845857844677404, "loss": 4.489, "mean_token_accuracy": 0.25431526005268096, "num_tokens": 158238221.0, "step": 91230 }, { "entropy": 5.407193040847778, "epoch": 7.0983466251702, "grad_norm": 1.421875, "learning_rate": 0.00013843655069583683, "loss": 4.6397, "mean_token_accuracy": 0.24243959188461303, "num_tokens": 158246802.0, "step": 91235 }, { "entropy": 5.388497257232666, "epoch": 7.098735654541918, "grad_norm": 1.3359375, "learning_rate": 0.00013841452501703262, "loss": 4.5886, "mean_token_accuracy": 0.24270775616168977, "num_tokens": 158255801.0, "step": 91240 }, { "entropy": 5.263103580474853, "epoch": 7.099124683913636, "grad_norm": 1.3125, "learning_rate": 0.00013839250141069547, "loss": 4.4746, "mean_token_accuracy": 0.25278493762016296, "num_tokens": 158263797.0, "step": 91245 }, { "entropy": 5.33375358581543, "epoch": 7.099513713285353, "grad_norm": 1.3359375, "learning_rate": 0.0001383704798771598, "loss": 4.5627, "mean_token_accuracy": 0.24677790105342864, "num_tokens": 158271996.0, "step": 91250 }, { "entropy": 5.275630187988281, "epoch": 7.09990274265707, "grad_norm": 1.4296875, "learning_rate": 0.00013834846041675957, "loss": 4.494, "mean_token_accuracy": 0.25560490489006044, "num_tokens": 158279985.0, "step": 91255 }, { "entropy": 5.346503877639771, "epoch": 7.100291772028788, "grad_norm": 1.40625, "learning_rate": 0.000138326443029829, "loss": 4.549, "mean_token_accuracy": 0.24689377397298812, "num_tokens": 158287976.0, "step": 91260 }, { "entropy": 5.3862621784210205, "epoch": 7.100680801400506, "grad_norm": 1.2890625, "learning_rate": 0.000138304427716702, "loss": 4.6337, "mean_token_accuracy": 0.2475188195705414, "num_tokens": 158297005.0, "step": 91265 }, { "entropy": 5.316065502166748, "epoch": 7.101069830772223, "grad_norm": 1.2578125, "learning_rate": 0.00013828241447771277, "loss": 4.5152, "mean_token_accuracy": 0.24952392280101776, "num_tokens": 158305633.0, "step": 91270 }, { "entropy": 5.373355054855347, "epoch": 7.101458860143941, "grad_norm": 1.40625, "learning_rate": 0.0001382604033131954, "loss": 4.5391, "mean_token_accuracy": 0.24722970873117447, "num_tokens": 158313387.0, "step": 91275 }, { "entropy": 5.219532251358032, "epoch": 7.101847889515659, "grad_norm": 1.3359375, "learning_rate": 0.00013823839422348364, "loss": 4.4213, "mean_token_accuracy": 0.26534271240234375, "num_tokens": 158322074.0, "step": 91280 }, { "entropy": 5.426431512832641, "epoch": 7.102236918887376, "grad_norm": 1.3125, "learning_rate": 0.00013821638720891167, "loss": 4.6743, "mean_token_accuracy": 0.2369215339422226, "num_tokens": 158330878.0, "step": 91285 }, { "entropy": 5.32231125831604, "epoch": 7.102625948259093, "grad_norm": 1.3046875, "learning_rate": 0.00013819438226981323, "loss": 4.5401, "mean_token_accuracy": 0.24657740890979768, "num_tokens": 158339537.0, "step": 91290 }, { "entropy": 5.368477535247803, "epoch": 7.103014977630811, "grad_norm": 1.4140625, "learning_rate": 0.00013817237940652239, "loss": 4.6219, "mean_token_accuracy": 0.24428412169218064, "num_tokens": 158348294.0, "step": 91295 }, { "entropy": 5.292247867584228, "epoch": 7.103404007002529, "grad_norm": 1.3515625, "learning_rate": 0.0001381503786193728, "loss": 4.525, "mean_token_accuracy": 0.24932461529970168, "num_tokens": 158356760.0, "step": 91300 }, { "entropy": 5.3920176982879635, "epoch": 7.103793036374246, "grad_norm": 1.3515625, "learning_rate": 0.00013812837990869847, "loss": 4.6449, "mean_token_accuracy": 0.24199347645044328, "num_tokens": 158365045.0, "step": 91305 }, { "entropy": 5.384446907043457, "epoch": 7.104182065745964, "grad_norm": 1.3203125, "learning_rate": 0.0001381063832748331, "loss": 4.602, "mean_token_accuracy": 0.24329760372638704, "num_tokens": 158373489.0, "step": 91310 }, { "entropy": 5.466401481628418, "epoch": 7.104571095117682, "grad_norm": 1.3515625, "learning_rate": 0.00013808438871811053, "loss": 4.6776, "mean_token_accuracy": 0.24135067015886308, "num_tokens": 158382614.0, "step": 91315 }, { "entropy": 5.39192943572998, "epoch": 7.1049601244893985, "grad_norm": 1.421875, "learning_rate": 0.00013806239623886439, "loss": 4.5621, "mean_token_accuracy": 0.24907763600349425, "num_tokens": 158390673.0, "step": 91320 }, { "entropy": 5.412025833129883, "epoch": 7.105349153861116, "grad_norm": 1.28125, "learning_rate": 0.0001380404058374284, "loss": 4.5675, "mean_token_accuracy": 0.2458203613758087, "num_tokens": 158399179.0, "step": 91325 }, { "entropy": 5.346821880340576, "epoch": 7.105738183232834, "grad_norm": 1.3046875, "learning_rate": 0.0001380184175141363, "loss": 4.5364, "mean_token_accuracy": 0.25395656526088717, "num_tokens": 158407533.0, "step": 91330 }, { "entropy": 5.403315591812134, "epoch": 7.106127212604552, "grad_norm": 1.328125, "learning_rate": 0.00013799643126932154, "loss": 4.6183, "mean_token_accuracy": 0.24637273848056793, "num_tokens": 158416744.0, "step": 91335 }, { "entropy": 5.369313287734985, "epoch": 7.106516241976269, "grad_norm": 1.328125, "learning_rate": 0.00013797444710331804, "loss": 4.5387, "mean_token_accuracy": 0.25140297710895537, "num_tokens": 158425237.0, "step": 91340 }, { "entropy": 5.369378852844238, "epoch": 7.106905271347987, "grad_norm": 1.390625, "learning_rate": 0.0001379524650164591, "loss": 4.6334, "mean_token_accuracy": 0.23980889916419984, "num_tokens": 158434153.0, "step": 91345 }, { "entropy": 5.298630237579346, "epoch": 7.107294300719705, "grad_norm": 1.3046875, "learning_rate": 0.0001379304850090785, "loss": 4.5227, "mean_token_accuracy": 0.24942188560962678, "num_tokens": 158442565.0, "step": 91350 }, { "entropy": 5.405721282958984, "epoch": 7.1076833300914215, "grad_norm": 1.3046875, "learning_rate": 0.0001379085070815096, "loss": 4.6197, "mean_token_accuracy": 0.2447480082511902, "num_tokens": 158451987.0, "step": 91355 }, { "entropy": 5.3451145648956295, "epoch": 7.108072359463139, "grad_norm": 1.453125, "learning_rate": 0.0001378865312340858, "loss": 4.5684, "mean_token_accuracy": 0.25439158231019976, "num_tokens": 158460339.0, "step": 91360 }, { "entropy": 5.398428153991699, "epoch": 7.108461388834857, "grad_norm": 1.4140625, "learning_rate": 0.00013786455746714072, "loss": 4.6179, "mean_token_accuracy": 0.2410676434636116, "num_tokens": 158469276.0, "step": 91365 }, { "entropy": 5.416480302810669, "epoch": 7.108850418206575, "grad_norm": 1.375, "learning_rate": 0.00013784258578100766, "loss": 4.5965, "mean_token_accuracy": 0.24950332194566727, "num_tokens": 158478354.0, "step": 91370 }, { "entropy": 5.413027238845825, "epoch": 7.109239447578292, "grad_norm": 1.3125, "learning_rate": 0.00013782061617602012, "loss": 4.6642, "mean_token_accuracy": 0.24277035146951675, "num_tokens": 158487731.0, "step": 91375 }, { "entropy": 5.391470241546631, "epoch": 7.10962847695001, "grad_norm": 1.390625, "learning_rate": 0.0001377986486525113, "loss": 4.5421, "mean_token_accuracy": 0.24340494871139526, "num_tokens": 158495645.0, "step": 91380 }, { "entropy": 5.33862042427063, "epoch": 7.110017506321728, "grad_norm": 1.40625, "learning_rate": 0.0001377766832108147, "loss": 4.5276, "mean_token_accuracy": 0.25511841773986815, "num_tokens": 158504226.0, "step": 91385 }, { "entropy": 5.465092420578003, "epoch": 7.1104065356934445, "grad_norm": 1.3203125, "learning_rate": 0.00013775471985126342, "loss": 4.7213, "mean_token_accuracy": 0.24592090994119645, "num_tokens": 158513108.0, "step": 91390 }, { "entropy": 5.351700782775879, "epoch": 7.110795565065162, "grad_norm": 1.3515625, "learning_rate": 0.00013773275857419093, "loss": 4.6539, "mean_token_accuracy": 0.23916025161743165, "num_tokens": 158522295.0, "step": 91395 }, { "entropy": 5.357116413116455, "epoch": 7.11118459443688, "grad_norm": 1.3984375, "learning_rate": 0.0001377107993799303, "loss": 4.57, "mean_token_accuracy": 0.2410861685872078, "num_tokens": 158530657.0, "step": 91400 }, { "entropy": 5.348486137390137, "epoch": 7.111573623808598, "grad_norm": 1.4140625, "learning_rate": 0.00013768884226881468, "loss": 4.5198, "mean_token_accuracy": 0.25296615064144135, "num_tokens": 158539775.0, "step": 91405 }, { "entropy": 5.393873453140259, "epoch": 7.111962653180315, "grad_norm": 1.359375, "learning_rate": 0.00013766688724117744, "loss": 4.6084, "mean_token_accuracy": 0.23653607666492463, "num_tokens": 158549151.0, "step": 91410 }, { "entropy": 5.291371583938599, "epoch": 7.112351682552033, "grad_norm": 1.3203125, "learning_rate": 0.00013764493429735153, "loss": 4.5447, "mean_token_accuracy": 0.24893860071897506, "num_tokens": 158558172.0, "step": 91415 }, { "entropy": 5.414524126052856, "epoch": 7.112740711923751, "grad_norm": 1.5625, "learning_rate": 0.00013762298343767023, "loss": 4.5976, "mean_token_accuracy": 0.2455281913280487, "num_tokens": 158566287.0, "step": 91420 }, { "entropy": 5.342790508270264, "epoch": 7.1131297412954675, "grad_norm": 1.390625, "learning_rate": 0.0001376010346624663, "loss": 4.5625, "mean_token_accuracy": 0.24985070377588273, "num_tokens": 158574735.0, "step": 91425 }, { "entropy": 5.438156366348267, "epoch": 7.113518770667185, "grad_norm": 1.390625, "learning_rate": 0.00013757908797207315, "loss": 4.6544, "mean_token_accuracy": 0.23579265773296357, "num_tokens": 158583659.0, "step": 91430 }, { "entropy": 5.377078199386597, "epoch": 7.113907800038903, "grad_norm": 1.4140625, "learning_rate": 0.00013755714336682363, "loss": 4.6159, "mean_token_accuracy": 0.24858437478542328, "num_tokens": 158592449.0, "step": 91435 }, { "entropy": 5.319667863845825, "epoch": 7.114296829410621, "grad_norm": 1.328125, "learning_rate": 0.00013753520084705057, "loss": 4.5548, "mean_token_accuracy": 0.25604947209358214, "num_tokens": 158601153.0, "step": 91440 }, { "entropy": 5.443948078155517, "epoch": 7.114685858782338, "grad_norm": 1.484375, "learning_rate": 0.00013751326041308714, "loss": 4.6312, "mean_token_accuracy": 0.24449303150177001, "num_tokens": 158609137.0, "step": 91445 }, { "entropy": 5.423870086669922, "epoch": 7.115074888154056, "grad_norm": 1.4296875, "learning_rate": 0.00013749132206526606, "loss": 4.6571, "mean_token_accuracy": 0.24130951017141342, "num_tokens": 158618392.0, "step": 91450 }, { "entropy": 5.3648756980896, "epoch": 7.115463917525773, "grad_norm": 1.3671875, "learning_rate": 0.00013746938580392037, "loss": 4.646, "mean_token_accuracy": 0.24565006792545319, "num_tokens": 158626991.0, "step": 91455 }, { "entropy": 5.351207828521728, "epoch": 7.1158529468974905, "grad_norm": 1.3671875, "learning_rate": 0.0001374474516293828, "loss": 4.5491, "mean_token_accuracy": 0.25301655381917953, "num_tokens": 158635557.0, "step": 91460 }, { "entropy": 5.352166175842285, "epoch": 7.116241976269208, "grad_norm": 1.4921875, "learning_rate": 0.00013742551954198628, "loss": 4.5383, "mean_token_accuracy": 0.25258086919784545, "num_tokens": 158643460.0, "step": 91465 }, { "entropy": 5.3396888256073, "epoch": 7.116631005640926, "grad_norm": 1.4140625, "learning_rate": 0.00013740358954206344, "loss": 4.6013, "mean_token_accuracy": 0.24118566513061523, "num_tokens": 158652349.0, "step": 91470 }, { "entropy": 5.38053412437439, "epoch": 7.117020035012644, "grad_norm": 1.359375, "learning_rate": 0.00013738166162994715, "loss": 4.5955, "mean_token_accuracy": 0.25439736992120743, "num_tokens": 158661153.0, "step": 91475 }, { "entropy": 5.4333079814910885, "epoch": 7.117409064384361, "grad_norm": 1.3828125, "learning_rate": 0.00013735973580597017, "loss": 4.6088, "mean_token_accuracy": 0.24635385423898698, "num_tokens": 158669310.0, "step": 91480 }, { "entropy": 5.365189456939698, "epoch": 7.117798093756079, "grad_norm": 1.40625, "learning_rate": 0.000137337812070465, "loss": 4.6233, "mean_token_accuracy": 0.24315168112516403, "num_tokens": 158677541.0, "step": 91485 }, { "entropy": 5.419115257263184, "epoch": 7.118187123127796, "grad_norm": 1.34375, "learning_rate": 0.00013731589042376453, "loss": 4.6476, "mean_token_accuracy": 0.24928930699825286, "num_tokens": 158686505.0, "step": 91490 }, { "entropy": 5.44438943862915, "epoch": 7.1185761524995135, "grad_norm": 1.3828125, "learning_rate": 0.0001372939708662012, "loss": 4.6878, "mean_token_accuracy": 0.23970138728618623, "num_tokens": 158694681.0, "step": 91495 }, { "entropy": 5.279157209396362, "epoch": 7.118965181871231, "grad_norm": 1.3828125, "learning_rate": 0.00013727205339810776, "loss": 4.5316, "mean_token_accuracy": 0.24674390405416488, "num_tokens": 158703112.0, "step": 91500 }, { "entropy": 5.387183809280396, "epoch": 7.119354211242949, "grad_norm": 1.3984375, "learning_rate": 0.0001372501380198166, "loss": 4.6036, "mean_token_accuracy": 0.24845709055662155, "num_tokens": 158712015.0, "step": 91505 }, { "entropy": 5.4620733737945555, "epoch": 7.119743240614667, "grad_norm": 1.3828125, "learning_rate": 0.00013722822473166043, "loss": 4.6754, "mean_token_accuracy": 0.23750420957803725, "num_tokens": 158720211.0, "step": 91510 }, { "entropy": 5.40203628540039, "epoch": 7.120132269986384, "grad_norm": 1.46875, "learning_rate": 0.00013720631353397167, "loss": 4.611, "mean_token_accuracy": 0.2411225214600563, "num_tokens": 158728123.0, "step": 91515 }, { "entropy": 5.353665494918824, "epoch": 7.120521299358102, "grad_norm": 1.453125, "learning_rate": 0.00013718440442708274, "loss": 4.5523, "mean_token_accuracy": 0.25296953320503235, "num_tokens": 158736046.0, "step": 91520 }, { "entropy": 5.392257833480835, "epoch": 7.120910328729819, "grad_norm": 1.265625, "learning_rate": 0.00013716249741132613, "loss": 4.6288, "mean_token_accuracy": 0.24305288642644882, "num_tokens": 158744341.0, "step": 91525 }, { "entropy": 5.368483257293701, "epoch": 7.1212993581015365, "grad_norm": 1.4140625, "learning_rate": 0.00013714059248703418, "loss": 4.5889, "mean_token_accuracy": 0.25273632258176804, "num_tokens": 158751930.0, "step": 91530 }, { "entropy": 5.388767099380493, "epoch": 7.121688387473254, "grad_norm": 1.4375, "learning_rate": 0.00013711868965453933, "loss": 4.6264, "mean_token_accuracy": 0.2471355140209198, "num_tokens": 158761718.0, "step": 91535 }, { "entropy": 5.367141008377075, "epoch": 7.122077416844972, "grad_norm": 1.3828125, "learning_rate": 0.00013709678891417394, "loss": 4.5957, "mean_token_accuracy": 0.24287642538547516, "num_tokens": 158770595.0, "step": 91540 }, { "entropy": 5.358305263519287, "epoch": 7.12246644621669, "grad_norm": 1.2265625, "learning_rate": 0.00013707489026627023, "loss": 4.5563, "mean_token_accuracy": 0.24979768544435502, "num_tokens": 158779489.0, "step": 91545 }, { "entropy": 5.372180604934693, "epoch": 7.122855475588407, "grad_norm": 1.390625, "learning_rate": 0.00013705299371116061, "loss": 4.6096, "mean_token_accuracy": 0.24220267087221145, "num_tokens": 158788610.0, "step": 91550 }, { "entropy": 5.468094205856323, "epoch": 7.123244504960124, "grad_norm": 1.3828125, "learning_rate": 0.00013703109924917718, "loss": 4.6774, "mean_token_accuracy": 0.24878009557723998, "num_tokens": 158796798.0, "step": 91555 }, { "entropy": 5.333374643325806, "epoch": 7.123633534331842, "grad_norm": 1.390625, "learning_rate": 0.00013700920688065226, "loss": 4.6124, "mean_token_accuracy": 0.2475343719124794, "num_tokens": 158805210.0, "step": 91560 }, { "entropy": 5.316061210632324, "epoch": 7.1240225637035595, "grad_norm": 1.328125, "learning_rate": 0.00013698731660591795, "loss": 4.5105, "mean_token_accuracy": 0.2544756501913071, "num_tokens": 158813506.0, "step": 91565 }, { "entropy": 5.341976356506348, "epoch": 7.124411593075277, "grad_norm": 1.390625, "learning_rate": 0.0001369654284253065, "loss": 4.5515, "mean_token_accuracy": 0.24659589678049088, "num_tokens": 158822004.0, "step": 91570 }, { "entropy": 5.296399259567261, "epoch": 7.124800622446995, "grad_norm": 1.328125, "learning_rate": 0.00013694354233914987, "loss": 4.5459, "mean_token_accuracy": 0.25388205200433733, "num_tokens": 158831020.0, "step": 91575 }, { "entropy": 5.361878204345703, "epoch": 7.1251896518187126, "grad_norm": 1.484375, "learning_rate": 0.00013692165834778034, "loss": 4.5698, "mean_token_accuracy": 0.24970492124557495, "num_tokens": 158840246.0, "step": 91580 }, { "entropy": 5.3834075927734375, "epoch": 7.12557868119043, "grad_norm": 1.3984375, "learning_rate": 0.00013689977645152979, "loss": 4.6409, "mean_token_accuracy": 0.2410392165184021, "num_tokens": 158848789.0, "step": 91585 }, { "entropy": 5.385695362091065, "epoch": 7.125967710562147, "grad_norm": 1.3515625, "learning_rate": 0.00013687789665073043, "loss": 4.697, "mean_token_accuracy": 0.23960563093423842, "num_tokens": 158857444.0, "step": 91590 }, { "entropy": 5.395308208465576, "epoch": 7.126356739933865, "grad_norm": 1.578125, "learning_rate": 0.00013685601894571412, "loss": 4.6156, "mean_token_accuracy": 0.2439314290881157, "num_tokens": 158866738.0, "step": 91595 }, { "entropy": 5.352168464660645, "epoch": 7.1267457693055825, "grad_norm": 1.421875, "learning_rate": 0.0001368341433368127, "loss": 4.4701, "mean_token_accuracy": 0.25717429220676424, "num_tokens": 158875004.0, "step": 91600 }, { "entropy": 5.424878168106079, "epoch": 7.1271347986773, "grad_norm": 1.3515625, "learning_rate": 0.0001368122698243584, "loss": 4.6956, "mean_token_accuracy": 0.24251196533441544, "num_tokens": 158884487.0, "step": 91605 }, { "entropy": 5.405588674545288, "epoch": 7.127523828049018, "grad_norm": 1.328125, "learning_rate": 0.00013679039840868286, "loss": 4.6227, "mean_token_accuracy": 0.24260909855365753, "num_tokens": 158892945.0, "step": 91610 }, { "entropy": 5.442149448394775, "epoch": 7.1279128574207355, "grad_norm": 1.3828125, "learning_rate": 0.0001367685290901181, "loss": 4.653, "mean_token_accuracy": 0.2500215947628021, "num_tokens": 158901512.0, "step": 91615 }, { "entropy": 5.3508460998535154, "epoch": 7.128301886792453, "grad_norm": 1.3671875, "learning_rate": 0.00013674666186899593, "loss": 4.5627, "mean_token_accuracy": 0.25110318660736086, "num_tokens": 158910612.0, "step": 91620 }, { "entropy": 5.436287212371826, "epoch": 7.12869091616417, "grad_norm": 1.4609375, "learning_rate": 0.00013672479674564801, "loss": 4.6955, "mean_token_accuracy": 0.22931321412324907, "num_tokens": 158919736.0, "step": 91625 }, { "entropy": 5.433459234237671, "epoch": 7.129079945535888, "grad_norm": 1.40625, "learning_rate": 0.00013670293372040632, "loss": 4.7014, "mean_token_accuracy": 0.24178088456392288, "num_tokens": 158929689.0, "step": 91630 }, { "entropy": 5.3421934127807615, "epoch": 7.1294689749076054, "grad_norm": 1.375, "learning_rate": 0.0001366810727936024, "loss": 4.5319, "mean_token_accuracy": 0.25077295303344727, "num_tokens": 158938506.0, "step": 91635 }, { "entropy": 5.3192039966583256, "epoch": 7.129858004279323, "grad_norm": 1.296875, "learning_rate": 0.00013665921396556813, "loss": 4.5465, "mean_token_accuracy": 0.2537343993782997, "num_tokens": 158947659.0, "step": 91640 }, { "entropy": 5.419354867935181, "epoch": 7.130247033651041, "grad_norm": 1.390625, "learning_rate": 0.000136637357236635, "loss": 4.6419, "mean_token_accuracy": 0.24435766637325287, "num_tokens": 158956253.0, "step": 91645 }, { "entropy": 5.4129722118377686, "epoch": 7.1306360630227585, "grad_norm": 1.3125, "learning_rate": 0.0001366155026071348, "loss": 4.6429, "mean_token_accuracy": 0.24408211410045624, "num_tokens": 158965481.0, "step": 91650 }, { "entropy": 5.324102163314819, "epoch": 7.131025092394475, "grad_norm": 1.3515625, "learning_rate": 0.00013659365007739904, "loss": 4.523, "mean_token_accuracy": 0.2508287787437439, "num_tokens": 158973867.0, "step": 91655 }, { "entropy": 5.359076833724975, "epoch": 7.131414121766193, "grad_norm": 1.4921875, "learning_rate": 0.00013657179964775946, "loss": 4.5593, "mean_token_accuracy": 0.25037179589271547, "num_tokens": 158982034.0, "step": 91660 }, { "entropy": 5.343366098403931, "epoch": 7.131803151137911, "grad_norm": 1.3203125, "learning_rate": 0.00013654995131854737, "loss": 4.5665, "mean_token_accuracy": 0.25332073122262955, "num_tokens": 158991382.0, "step": 91665 }, { "entropy": 5.36948790550232, "epoch": 7.132192180509628, "grad_norm": 1.3984375, "learning_rate": 0.0001365281050900944, "loss": 4.5874, "mean_token_accuracy": 0.24257041662931442, "num_tokens": 158999492.0, "step": 91670 }, { "entropy": 5.413803243637085, "epoch": 7.132581209881346, "grad_norm": 1.3359375, "learning_rate": 0.00013650626096273208, "loss": 4.6626, "mean_token_accuracy": 0.2473751425743103, "num_tokens": 159009117.0, "step": 91675 }, { "entropy": 5.287208509445191, "epoch": 7.132970239253064, "grad_norm": 1.4375, "learning_rate": 0.00013648441893679175, "loss": 4.4786, "mean_token_accuracy": 0.2520866826176643, "num_tokens": 159017560.0, "step": 91680 }, { "entropy": 5.411993408203125, "epoch": 7.1333592686247815, "grad_norm": 1.515625, "learning_rate": 0.00013646257901260504, "loss": 4.5794, "mean_token_accuracy": 0.24998858124017714, "num_tokens": 159025917.0, "step": 91685 }, { "entropy": 5.348544025421143, "epoch": 7.133748297996498, "grad_norm": 1.28125, "learning_rate": 0.00013644074119050303, "loss": 4.6068, "mean_token_accuracy": 0.2583964139223099, "num_tokens": 159035540.0, "step": 91690 }, { "entropy": 5.441460609436035, "epoch": 7.134137327368216, "grad_norm": 1.3984375, "learning_rate": 0.00013641890547081738, "loss": 4.6697, "mean_token_accuracy": 0.23759443014860154, "num_tokens": 159043976.0, "step": 91695 }, { "entropy": 5.393807363510132, "epoch": 7.134526356739934, "grad_norm": 1.4140625, "learning_rate": 0.00013639707185387923, "loss": 4.6118, "mean_token_accuracy": 0.24634259790182114, "num_tokens": 159052369.0, "step": 91700 }, { "entropy": 5.347597980499268, "epoch": 7.134915386111651, "grad_norm": 1.3828125, "learning_rate": 0.0001363752403400198, "loss": 4.523, "mean_token_accuracy": 0.24707057774066926, "num_tokens": 159061962.0, "step": 91705 }, { "entropy": 5.354585647583008, "epoch": 7.135304415483369, "grad_norm": 1.3359375, "learning_rate": 0.00013635341092957054, "loss": 4.565, "mean_token_accuracy": 0.24991392344236374, "num_tokens": 159070922.0, "step": 91710 }, { "entropy": 5.445838260650635, "epoch": 7.135693444855087, "grad_norm": 1.375, "learning_rate": 0.00013633158362286256, "loss": 4.7184, "mean_token_accuracy": 0.23609377294778824, "num_tokens": 159080004.0, "step": 91715 }, { "entropy": 5.3380670070648195, "epoch": 7.1360824742268045, "grad_norm": 1.3046875, "learning_rate": 0.0001363097584202271, "loss": 4.5566, "mean_token_accuracy": 0.2535250782966614, "num_tokens": 159089417.0, "step": 91720 }, { "entropy": 5.403206014633179, "epoch": 7.136471503598521, "grad_norm": 1.421875, "learning_rate": 0.0001362879353219953, "loss": 4.6679, "mean_token_accuracy": 0.23650895357131957, "num_tokens": 159098463.0, "step": 91725 }, { "entropy": 5.2806315422058105, "epoch": 7.136860532970239, "grad_norm": 1.375, "learning_rate": 0.00013626611432849834, "loss": 4.5207, "mean_token_accuracy": 0.253005550801754, "num_tokens": 159107453.0, "step": 91730 }, { "entropy": 5.387668561935425, "epoch": 7.137249562341957, "grad_norm": 1.359375, "learning_rate": 0.00013624429544006718, "loss": 4.6066, "mean_token_accuracy": 0.23736293464899064, "num_tokens": 159116101.0, "step": 91735 }, { "entropy": 5.278861713409424, "epoch": 7.137638591713674, "grad_norm": 1.3125, "learning_rate": 0.00013622247865703303, "loss": 4.5272, "mean_token_accuracy": 0.25451577752828597, "num_tokens": 159125422.0, "step": 91740 }, { "entropy": 5.395887804031372, "epoch": 7.138027621085392, "grad_norm": 1.40625, "learning_rate": 0.00013620066397972692, "loss": 4.5914, "mean_token_accuracy": 0.24109362661838532, "num_tokens": 159133428.0, "step": 91745 }, { "entropy": 5.338425350189209, "epoch": 7.13841665045711, "grad_norm": 1.3828125, "learning_rate": 0.00013617885140847975, "loss": 4.5358, "mean_token_accuracy": 0.2553575739264488, "num_tokens": 159142300.0, "step": 91750 }, { "entropy": 5.386847734451294, "epoch": 7.1388056798288275, "grad_norm": 1.4375, "learning_rate": 0.0001361570409436226, "loss": 4.5519, "mean_token_accuracy": 0.24778425544500352, "num_tokens": 159150732.0, "step": 91755 }, { "entropy": 5.302852010726928, "epoch": 7.139194709200544, "grad_norm": 1.3515625, "learning_rate": 0.00013613523258548634, "loss": 4.487, "mean_token_accuracy": 0.26098258048295975, "num_tokens": 159159291.0, "step": 91760 }, { "entropy": 5.332905244827271, "epoch": 7.139583738572262, "grad_norm": 1.484375, "learning_rate": 0.0001361134263344019, "loss": 4.6084, "mean_token_accuracy": 0.2485702157020569, "num_tokens": 159167858.0, "step": 91765 }, { "entropy": 5.3920135498046875, "epoch": 7.13997276794398, "grad_norm": 1.4375, "learning_rate": 0.00013609162219070016, "loss": 4.6733, "mean_token_accuracy": 0.24138628989458083, "num_tokens": 159175683.0, "step": 91770 }, { "entropy": 5.372470855712891, "epoch": 7.140361797315697, "grad_norm": 1.453125, "learning_rate": 0.00013606982015471197, "loss": 4.5851, "mean_token_accuracy": 0.24423436671495438, "num_tokens": 159184809.0, "step": 91775 }, { "entropy": 5.407551574707031, "epoch": 7.140750826687415, "grad_norm": 1.4453125, "learning_rate": 0.00013604802022676815, "loss": 4.6284, "mean_token_accuracy": 0.24580636918544768, "num_tokens": 159193019.0, "step": 91780 }, { "entropy": 5.4136851787567135, "epoch": 7.141139856059133, "grad_norm": 1.4609375, "learning_rate": 0.00013602622240719943, "loss": 4.6645, "mean_token_accuracy": 0.24887157380580902, "num_tokens": 159201601.0, "step": 91785 }, { "entropy": 5.349868440628052, "epoch": 7.14152888543085, "grad_norm": 1.4296875, "learning_rate": 0.0001360044266963366, "loss": 4.534, "mean_token_accuracy": 0.2553478732705116, "num_tokens": 159209311.0, "step": 91790 }, { "entropy": 5.379832935333252, "epoch": 7.141917914802567, "grad_norm": 1.3359375, "learning_rate": 0.00013598263309451032, "loss": 4.5889, "mean_token_accuracy": 0.24965229332447053, "num_tokens": 159218009.0, "step": 91795 }, { "entropy": 5.29295802116394, "epoch": 7.142306944174285, "grad_norm": 1.40625, "learning_rate": 0.00013596084160205128, "loss": 4.4619, "mean_token_accuracy": 0.25085591822862624, "num_tokens": 159226196.0, "step": 91800 }, { "entropy": 5.360033321380615, "epoch": 7.142695973546003, "grad_norm": 1.3125, "learning_rate": 0.00013593905221929019, "loss": 4.6153, "mean_token_accuracy": 0.24143189936876297, "num_tokens": 159235433.0, "step": 91805 }, { "entropy": 5.418444299697876, "epoch": 7.14308500291772, "grad_norm": 1.515625, "learning_rate": 0.00013591726494655771, "loss": 4.6031, "mean_token_accuracy": 0.2509622544050217, "num_tokens": 159242977.0, "step": 91810 }, { "entropy": 5.374507856369019, "epoch": 7.143474032289438, "grad_norm": 1.375, "learning_rate": 0.00013589547978418439, "loss": 4.6451, "mean_token_accuracy": 0.24340640753507614, "num_tokens": 159251514.0, "step": 91815 }, { "entropy": 5.347555923461914, "epoch": 7.143863061661156, "grad_norm": 1.28125, "learning_rate": 0.0001358736967325006, "loss": 4.5553, "mean_token_accuracy": 0.2536451920866966, "num_tokens": 159261151.0, "step": 91820 }, { "entropy": 5.284817886352539, "epoch": 7.144252091032873, "grad_norm": 1.2421875, "learning_rate": 0.0001358519157918372, "loss": 4.5278, "mean_token_accuracy": 0.2518927201628685, "num_tokens": 159269930.0, "step": 91825 }, { "entropy": 5.3484782695770265, "epoch": 7.14464112040459, "grad_norm": 1.421875, "learning_rate": 0.0001358301369625244, "loss": 4.6188, "mean_token_accuracy": 0.24383719265460968, "num_tokens": 159278801.0, "step": 91830 }, { "entropy": 5.312946224212647, "epoch": 7.145030149776308, "grad_norm": 1.3125, "learning_rate": 0.00013580836024489277, "loss": 4.579, "mean_token_accuracy": 0.24584972113370895, "num_tokens": 159288201.0, "step": 91835 }, { "entropy": 5.33912410736084, "epoch": 7.145419179148026, "grad_norm": 1.40625, "learning_rate": 0.00013578658563927272, "loss": 4.5933, "mean_token_accuracy": 0.24312245845794678, "num_tokens": 159297415.0, "step": 91840 }, { "entropy": 5.328149366378784, "epoch": 7.145808208519743, "grad_norm": 1.3828125, "learning_rate": 0.00013576481314599468, "loss": 4.5151, "mean_token_accuracy": 0.2482807904481888, "num_tokens": 159306286.0, "step": 91845 }, { "entropy": 5.379630899429321, "epoch": 7.146197237891461, "grad_norm": 1.328125, "learning_rate": 0.00013574304276538893, "loss": 4.5873, "mean_token_accuracy": 0.24731138348579407, "num_tokens": 159314869.0, "step": 91850 }, { "entropy": 5.345496797561646, "epoch": 7.146586267263178, "grad_norm": 1.3125, "learning_rate": 0.00013572127449778594, "loss": 4.5351, "mean_token_accuracy": 0.25402589440345763, "num_tokens": 159323322.0, "step": 91855 }, { "entropy": 5.375813007354736, "epoch": 7.146975296634896, "grad_norm": 1.34375, "learning_rate": 0.0001356995083435159, "loss": 4.6858, "mean_token_accuracy": 0.23946799635887145, "num_tokens": 159331477.0, "step": 91860 }, { "entropy": 5.370027112960815, "epoch": 7.147364326006613, "grad_norm": 1.3515625, "learning_rate": 0.00013567774430290906, "loss": 4.6716, "mean_token_accuracy": 0.23948404043912888, "num_tokens": 159341107.0, "step": 91865 }, { "entropy": 5.3276674270629885, "epoch": 7.147753355378331, "grad_norm": 1.3359375, "learning_rate": 0.00013565598237629567, "loss": 4.5711, "mean_token_accuracy": 0.2388285994529724, "num_tokens": 159350308.0, "step": 91870 }, { "entropy": 5.2721117496490475, "epoch": 7.148142384750049, "grad_norm": 1.375, "learning_rate": 0.00013563422256400597, "loss": 4.4401, "mean_token_accuracy": 0.2631159543991089, "num_tokens": 159358890.0, "step": 91875 }, { "entropy": 5.35380072593689, "epoch": 7.148531414121766, "grad_norm": 1.4375, "learning_rate": 0.00013561246486637019, "loss": 4.5375, "mean_token_accuracy": 0.25105722397565844, "num_tokens": 159367990.0, "step": 91880 }, { "entropy": 5.3977538585662845, "epoch": 7.148920443493484, "grad_norm": 1.390625, "learning_rate": 0.00013559070928371834, "loss": 4.6567, "mean_token_accuracy": 0.24644645005464555, "num_tokens": 159376989.0, "step": 91885 }, { "entropy": 5.432134008407592, "epoch": 7.149309472865201, "grad_norm": 1.3984375, "learning_rate": 0.00013556895581638066, "loss": 4.6811, "mean_token_accuracy": 0.2360985904932022, "num_tokens": 159385942.0, "step": 91890 }, { "entropy": 5.419182634353637, "epoch": 7.149698502236919, "grad_norm": 1.3671875, "learning_rate": 0.0001355472044646871, "loss": 4.6954, "mean_token_accuracy": 0.2404509037733078, "num_tokens": 159394889.0, "step": 91895 }, { "entropy": 5.323710489273071, "epoch": 7.150087531608636, "grad_norm": 1.34375, "learning_rate": 0.00013552545522896772, "loss": 4.6236, "mean_token_accuracy": 0.24577766507864, "num_tokens": 159404090.0, "step": 91900 }, { "entropy": 5.419246625900269, "epoch": 7.150476560980354, "grad_norm": 1.2265625, "learning_rate": 0.0001355037081095526, "loss": 4.6927, "mean_token_accuracy": 0.2423545390367508, "num_tokens": 159413326.0, "step": 91905 }, { "entropy": 5.266530466079712, "epoch": 7.150865590352072, "grad_norm": 1.28125, "learning_rate": 0.00013548196310677162, "loss": 4.4994, "mean_token_accuracy": 0.25059216022491454, "num_tokens": 159422576.0, "step": 91910 }, { "entropy": 5.456769800186157, "epoch": 7.151254619723789, "grad_norm": 1.3671875, "learning_rate": 0.0001354602202209549, "loss": 4.659, "mean_token_accuracy": 0.2418781891465187, "num_tokens": 159430914.0, "step": 91915 }, { "entropy": 5.326454496383667, "epoch": 7.151643649095507, "grad_norm": 1.359375, "learning_rate": 0.0001354384794524321, "loss": 4.4827, "mean_token_accuracy": 0.25647252202034, "num_tokens": 159439280.0, "step": 91920 }, { "entropy": 5.397288799285889, "epoch": 7.152032678467224, "grad_norm": 1.3515625, "learning_rate": 0.00013541674080153336, "loss": 4.6033, "mean_token_accuracy": 0.23796941936016083, "num_tokens": 159448101.0, "step": 91925 }, { "entropy": 5.345769643783569, "epoch": 7.152421707838942, "grad_norm": 1.2890625, "learning_rate": 0.00013539500426858832, "loss": 4.5851, "mean_token_accuracy": 0.2511184364557266, "num_tokens": 159456995.0, "step": 91930 }, { "entropy": 5.446032333374023, "epoch": 7.152810737210659, "grad_norm": 1.5546875, "learning_rate": 0.0001353732698539269, "loss": 4.6556, "mean_token_accuracy": 0.23929524272680283, "num_tokens": 159465778.0, "step": 91935 }, { "entropy": 5.339037179946899, "epoch": 7.153199766582377, "grad_norm": 1.4140625, "learning_rate": 0.00013535153755787888, "loss": 4.5352, "mean_token_accuracy": 0.25619996190071104, "num_tokens": 159474277.0, "step": 91940 }, { "entropy": 5.401755237579346, "epoch": 7.153588795954095, "grad_norm": 1.4375, "learning_rate": 0.000135329807380774, "loss": 4.6812, "mean_token_accuracy": 0.24394504278898238, "num_tokens": 159482190.0, "step": 91945 }, { "entropy": 5.3622260093688965, "epoch": 7.153977825325812, "grad_norm": 1.390625, "learning_rate": 0.00013530807932294204, "loss": 4.5521, "mean_token_accuracy": 0.24665105044841767, "num_tokens": 159490547.0, "step": 91950 }, { "entropy": 5.422585201263428, "epoch": 7.15436685469753, "grad_norm": 1.3515625, "learning_rate": 0.00013528635338471256, "loss": 4.6784, "mean_token_accuracy": 0.2374989092350006, "num_tokens": 159499342.0, "step": 91955 }, { "entropy": 5.330280685424805, "epoch": 7.154755884069247, "grad_norm": 1.4453125, "learning_rate": 0.00013526462956641534, "loss": 4.5251, "mean_token_accuracy": 0.24916384369134903, "num_tokens": 159507984.0, "step": 91960 }, { "entropy": 5.448762655258179, "epoch": 7.155144913440965, "grad_norm": 1.4375, "learning_rate": 0.0001352429078683799, "loss": 4.6903, "mean_token_accuracy": 0.2348872035741806, "num_tokens": 159516923.0, "step": 91965 }, { "entropy": 5.388234615325928, "epoch": 7.155533942812682, "grad_norm": 1.46875, "learning_rate": 0.000135221188290936, "loss": 4.6052, "mean_token_accuracy": 0.24421861171722412, "num_tokens": 159525383.0, "step": 91970 }, { "entropy": 5.352590847015381, "epoch": 7.1559229721844, "grad_norm": 1.421875, "learning_rate": 0.00013519947083441303, "loss": 4.5447, "mean_token_accuracy": 0.24830097407102586, "num_tokens": 159533718.0, "step": 91975 }, { "entropy": 5.429497957229614, "epoch": 7.156312001556118, "grad_norm": 1.421875, "learning_rate": 0.0001351777554991405, "loss": 4.7015, "mean_token_accuracy": 0.23887073397636413, "num_tokens": 159541781.0, "step": 91980 }, { "entropy": 5.3368628978729244, "epoch": 7.156701030927835, "grad_norm": 1.2421875, "learning_rate": 0.00013515604228544808, "loss": 4.6258, "mean_token_accuracy": 0.2414705440402031, "num_tokens": 159550784.0, "step": 91985 }, { "entropy": 5.322275686264038, "epoch": 7.157090060299552, "grad_norm": 1.453125, "learning_rate": 0.00013513433119366505, "loss": 4.4944, "mean_token_accuracy": 0.25704392343759536, "num_tokens": 159559445.0, "step": 91990 }, { "entropy": 5.346365022659302, "epoch": 7.15747908967127, "grad_norm": 1.3984375, "learning_rate": 0.00013511262222412103, "loss": 4.5362, "mean_token_accuracy": 0.2544390827417374, "num_tokens": 159568056.0, "step": 91995 }, { "entropy": 5.3697751522064205, "epoch": 7.157868119042988, "grad_norm": 1.375, "learning_rate": 0.00013509091537714519, "loss": 4.6145, "mean_token_accuracy": 0.24309487789869308, "num_tokens": 159576102.0, "step": 92000 }, { "entropy": 5.370607185363769, "epoch": 7.158257148414705, "grad_norm": 1.5078125, "learning_rate": 0.00013506921065306704, "loss": 4.5203, "mean_token_accuracy": 0.2478438451886177, "num_tokens": 159583876.0, "step": 92005 }, { "entropy": 5.367839050292969, "epoch": 7.158646177786423, "grad_norm": 1.3125, "learning_rate": 0.00013504750805221598, "loss": 4.5082, "mean_token_accuracy": 0.25539582073688505, "num_tokens": 159592111.0, "step": 92010 }, { "entropy": 5.290379905700684, "epoch": 7.159035207158141, "grad_norm": 1.4140625, "learning_rate": 0.00013502580757492112, "loss": 4.5605, "mean_token_accuracy": 0.2559082478284836, "num_tokens": 159600639.0, "step": 92015 }, { "entropy": 5.267931938171387, "epoch": 7.159424236529858, "grad_norm": 1.390625, "learning_rate": 0.00013500410922151197, "loss": 4.5649, "mean_token_accuracy": 0.2536333501338959, "num_tokens": 159608327.0, "step": 92020 }, { "entropy": 5.2552543640136715, "epoch": 7.159813265901575, "grad_norm": 1.375, "learning_rate": 0.0001349824129923175, "loss": 4.4561, "mean_token_accuracy": 0.26401792615652087, "num_tokens": 159616918.0, "step": 92025 }, { "entropy": 5.339044904708862, "epoch": 7.160202295273293, "grad_norm": 1.34375, "learning_rate": 0.00013496071888766714, "loss": 4.5958, "mean_token_accuracy": 0.24941682815551758, "num_tokens": 159625815.0, "step": 92030 }, { "entropy": 5.354481410980225, "epoch": 7.160591324645011, "grad_norm": 1.3828125, "learning_rate": 0.00013493902690788994, "loss": 4.5802, "mean_token_accuracy": 0.25219210237264633, "num_tokens": 159634404.0, "step": 92035 }, { "entropy": 5.375811815261841, "epoch": 7.160980354016728, "grad_norm": 1.3359375, "learning_rate": 0.00013491733705331516, "loss": 4.5756, "mean_token_accuracy": 0.24587667137384414, "num_tokens": 159643014.0, "step": 92040 }, { "entropy": 5.388228178024292, "epoch": 7.161369383388446, "grad_norm": 1.5703125, "learning_rate": 0.00013489564932427168, "loss": 4.6414, "mean_token_accuracy": 0.24523551166057586, "num_tokens": 159650891.0, "step": 92045 }, { "entropy": 5.318236207962036, "epoch": 7.161758412760164, "grad_norm": 1.2734375, "learning_rate": 0.00013487396372108883, "loss": 4.5837, "mean_token_accuracy": 0.24198245108127595, "num_tokens": 159660116.0, "step": 92050 }, { "entropy": 5.407441425323486, "epoch": 7.162147442131881, "grad_norm": 1.2890625, "learning_rate": 0.00013485228024409556, "loss": 4.5513, "mean_token_accuracy": 0.2468734234571457, "num_tokens": 159668686.0, "step": 92055 }, { "entropy": 5.297761583328247, "epoch": 7.162536471503598, "grad_norm": 1.4140625, "learning_rate": 0.00013483059889362082, "loss": 4.5002, "mean_token_accuracy": 0.26113088726997374, "num_tokens": 159677742.0, "step": 92060 }, { "entropy": 5.394374179840088, "epoch": 7.162925500875316, "grad_norm": 1.3515625, "learning_rate": 0.0001348089196699936, "loss": 4.6825, "mean_token_accuracy": 0.2414155900478363, "num_tokens": 159686211.0, "step": 92065 }, { "entropy": 5.4024735450744625, "epoch": 7.163314530247034, "grad_norm": 1.4296875, "learning_rate": 0.00013478724257354289, "loss": 4.5943, "mean_token_accuracy": 0.24288256764411925, "num_tokens": 159694687.0, "step": 92070 }, { "entropy": 5.321637105941773, "epoch": 7.163703559618751, "grad_norm": 1.4296875, "learning_rate": 0.00013476556760459767, "loss": 4.5442, "mean_token_accuracy": 0.257716666162014, "num_tokens": 159702460.0, "step": 92075 }, { "entropy": 5.321578693389893, "epoch": 7.164092588990469, "grad_norm": 1.453125, "learning_rate": 0.00013474389476348677, "loss": 4.5668, "mean_token_accuracy": 0.25082063525915144, "num_tokens": 159710291.0, "step": 92080 }, { "entropy": 5.45791335105896, "epoch": 7.164481618362187, "grad_norm": 1.3359375, "learning_rate": 0.00013472222405053896, "loss": 4.673, "mean_token_accuracy": 0.2369900405406952, "num_tokens": 159718682.0, "step": 92085 }, { "entropy": 5.328112840652466, "epoch": 7.164870647733904, "grad_norm": 1.4375, "learning_rate": 0.00013470055546608317, "loss": 4.5262, "mean_token_accuracy": 0.2469850480556488, "num_tokens": 159726928.0, "step": 92090 }, { "entropy": 5.300587606430054, "epoch": 7.165259677105621, "grad_norm": 1.4375, "learning_rate": 0.0001346788890104481, "loss": 4.5209, "mean_token_accuracy": 0.25638154000043867, "num_tokens": 159735369.0, "step": 92095 }, { "entropy": 5.433917999267578, "epoch": 7.165648706477339, "grad_norm": 1.46875, "learning_rate": 0.00013465722468396262, "loss": 4.6284, "mean_token_accuracy": 0.24544442147016526, "num_tokens": 159744263.0, "step": 92100 }, { "entropy": 5.375982332229614, "epoch": 7.166037735849057, "grad_norm": 1.3359375, "learning_rate": 0.00013463556248695526, "loss": 4.6053, "mean_token_accuracy": 0.2510353371500969, "num_tokens": 159753481.0, "step": 92105 }, { "entropy": 5.3766186237335205, "epoch": 7.166426765220774, "grad_norm": 1.4375, "learning_rate": 0.00013461390241975492, "loss": 4.5884, "mean_token_accuracy": 0.24433238804340363, "num_tokens": 159762758.0, "step": 92110 }, { "entropy": 5.341560983657837, "epoch": 7.166815794592492, "grad_norm": 1.3125, "learning_rate": 0.00013459224448269014, "loss": 4.5946, "mean_token_accuracy": 0.24225471615791322, "num_tokens": 159772381.0, "step": 92115 }, { "entropy": 5.411349153518676, "epoch": 7.16720482396421, "grad_norm": 1.3203125, "learning_rate": 0.00013457058867608957, "loss": 4.6758, "mean_token_accuracy": 0.24554115831851958, "num_tokens": 159781901.0, "step": 92120 }, { "entropy": 5.389523983001709, "epoch": 7.1675938533359265, "grad_norm": 1.3671875, "learning_rate": 0.00013454893500028175, "loss": 4.5918, "mean_token_accuracy": 0.24954482764005662, "num_tokens": 159789741.0, "step": 92125 }, { "entropy": 5.4893652439117435, "epoch": 7.167982882707644, "grad_norm": 1.4296875, "learning_rate": 0.0001345272834555954, "loss": 4.7645, "mean_token_accuracy": 0.23119542002677917, "num_tokens": 159798360.0, "step": 92130 }, { "entropy": 5.425929117202759, "epoch": 7.168371912079362, "grad_norm": 1.3984375, "learning_rate": 0.00013450563404235883, "loss": 4.5696, "mean_token_accuracy": 0.24779837280511857, "num_tokens": 159806474.0, "step": 92135 }, { "entropy": 5.354390287399292, "epoch": 7.16876094145108, "grad_norm": 1.359375, "learning_rate": 0.00013448398676090063, "loss": 4.5613, "mean_token_accuracy": 0.25062927752733233, "num_tokens": 159815332.0, "step": 92140 }, { "entropy": 5.342707109451294, "epoch": 7.169149970822797, "grad_norm": 1.2734375, "learning_rate": 0.0001344623416115494, "loss": 4.6024, "mean_token_accuracy": 0.24676621854305267, "num_tokens": 159824452.0, "step": 92145 }, { "entropy": 5.28343243598938, "epoch": 7.169539000194515, "grad_norm": 1.265625, "learning_rate": 0.0001344406985946333, "loss": 4.4655, "mean_token_accuracy": 0.25851436257362365, "num_tokens": 159834107.0, "step": 92150 }, { "entropy": 5.3631617546081545, "epoch": 7.169928029566233, "grad_norm": 1.328125, "learning_rate": 0.00013441905771048102, "loss": 4.6042, "mean_token_accuracy": 0.24699197113513946, "num_tokens": 159843199.0, "step": 92155 }, { "entropy": 5.348460912704468, "epoch": 7.1703170589379495, "grad_norm": 1.40625, "learning_rate": 0.00013439741895942073, "loss": 4.5534, "mean_token_accuracy": 0.2526869237422943, "num_tokens": 159851440.0, "step": 92160 }, { "entropy": 5.366093111038208, "epoch": 7.170706088309667, "grad_norm": 1.3046875, "learning_rate": 0.00013437578234178077, "loss": 4.6101, "mean_token_accuracy": 0.2501327842473984, "num_tokens": 159860308.0, "step": 92165 }, { "entropy": 5.405993270874023, "epoch": 7.171095117681385, "grad_norm": 1.453125, "learning_rate": 0.00013435414785788956, "loss": 4.6275, "mean_token_accuracy": 0.247701296210289, "num_tokens": 159869281.0, "step": 92170 }, { "entropy": 5.349754571914673, "epoch": 7.1714841470531026, "grad_norm": 1.390625, "learning_rate": 0.00013433251550807522, "loss": 4.5448, "mean_token_accuracy": 0.24572580307722092, "num_tokens": 159878522.0, "step": 92175 }, { "entropy": 5.34875521659851, "epoch": 7.17187317642482, "grad_norm": 1.375, "learning_rate": 0.00013431088529266614, "loss": 4.53, "mean_token_accuracy": 0.2569475769996643, "num_tokens": 159886717.0, "step": 92180 }, { "entropy": 5.375426149368286, "epoch": 7.172262205796538, "grad_norm": 1.4296875, "learning_rate": 0.00013428925721199037, "loss": 4.5822, "mean_token_accuracy": 0.25048134475946426, "num_tokens": 159895244.0, "step": 92185 }, { "entropy": 5.3331298828125, "epoch": 7.172651235168255, "grad_norm": 1.4765625, "learning_rate": 0.0001342676312663762, "loss": 4.5599, "mean_token_accuracy": 0.24866369664669036, "num_tokens": 159903650.0, "step": 92190 }, { "entropy": 5.370479726791382, "epoch": 7.1730402645399725, "grad_norm": 1.4921875, "learning_rate": 0.00013424600745615166, "loss": 4.5385, "mean_token_accuracy": 0.2464562475681305, "num_tokens": 159912210.0, "step": 92195 }, { "entropy": 5.371892976760864, "epoch": 7.17342929391169, "grad_norm": 1.4609375, "learning_rate": 0.00013422438578164497, "loss": 4.6599, "mean_token_accuracy": 0.24194591492414474, "num_tokens": 159920731.0, "step": 92200 }, { "entropy": 5.322563123703003, "epoch": 7.173818323283408, "grad_norm": 1.3359375, "learning_rate": 0.0001342027662431842, "loss": 4.5449, "mean_token_accuracy": 0.2501654803752899, "num_tokens": 159929320.0, "step": 92205 }, { "entropy": 5.301455068588257, "epoch": 7.1742073526551255, "grad_norm": 1.359375, "learning_rate": 0.00013418114884109728, "loss": 4.5737, "mean_token_accuracy": 0.24366295486688613, "num_tokens": 159937939.0, "step": 92210 }, { "entropy": 5.3282218933105465, "epoch": 7.174596382026843, "grad_norm": 1.3828125, "learning_rate": 0.00013415953357571236, "loss": 4.5467, "mean_token_accuracy": 0.2466237261891365, "num_tokens": 159946304.0, "step": 92215 }, { "entropy": 5.296998834609985, "epoch": 7.174985411398561, "grad_norm": 1.40625, "learning_rate": 0.0001341379204473573, "loss": 4.5716, "mean_token_accuracy": 0.2444770559668541, "num_tokens": 159955289.0, "step": 92220 }, { "entropy": 5.320829629898071, "epoch": 7.175374440770278, "grad_norm": 1.4609375, "learning_rate": 0.0001341163094563601, "loss": 4.5579, "mean_token_accuracy": 0.24642224311828614, "num_tokens": 159964131.0, "step": 92225 }, { "entropy": 5.352261686325074, "epoch": 7.1757634701419954, "grad_norm": 1.4140625, "learning_rate": 0.0001340947006030487, "loss": 4.5922, "mean_token_accuracy": 0.2512372300028801, "num_tokens": 159973048.0, "step": 92230 }, { "entropy": 5.317491817474365, "epoch": 7.176152499513713, "grad_norm": 1.421875, "learning_rate": 0.00013407309388775092, "loss": 4.5111, "mean_token_accuracy": 0.25626313388347627, "num_tokens": 159981529.0, "step": 92235 }, { "entropy": 5.3932582378387455, "epoch": 7.176541528885431, "grad_norm": 1.3515625, "learning_rate": 0.00013405148931079468, "loss": 4.6515, "mean_token_accuracy": 0.23996201306581497, "num_tokens": 159989764.0, "step": 92240 }, { "entropy": 5.3304518699646, "epoch": 7.1769305582571485, "grad_norm": 1.296875, "learning_rate": 0.00013402988687250767, "loss": 4.557, "mean_token_accuracy": 0.25237902998924255, "num_tokens": 159998322.0, "step": 92245 }, { "entropy": 5.375513219833374, "epoch": 7.177319587628866, "grad_norm": 1.453125, "learning_rate": 0.0001340082865732178, "loss": 4.5863, "mean_token_accuracy": 0.25139415413141253, "num_tokens": 160006750.0, "step": 92250 }, { "entropy": 5.379061126708985, "epoch": 7.177708617000584, "grad_norm": 1.3671875, "learning_rate": 0.00013398668841325267, "loss": 4.5793, "mean_token_accuracy": 0.24378471225500106, "num_tokens": 160015673.0, "step": 92255 }, { "entropy": 5.3945722579956055, "epoch": 7.178097646372301, "grad_norm": 1.328125, "learning_rate": 0.00013396509239294022, "loss": 4.5989, "mean_token_accuracy": 0.24884821474552155, "num_tokens": 160024695.0, "step": 92260 }, { "entropy": 5.419507312774658, "epoch": 7.178486675744018, "grad_norm": 1.3828125, "learning_rate": 0.00013394349851260785, "loss": 4.691, "mean_token_accuracy": 0.24319444000720977, "num_tokens": 160033822.0, "step": 92265 }, { "entropy": 5.302937412261963, "epoch": 7.178875705115736, "grad_norm": 1.3125, "learning_rate": 0.00013392190677258354, "loss": 4.5067, "mean_token_accuracy": 0.25397036373615267, "num_tokens": 160042687.0, "step": 92270 }, { "entropy": 5.312562704086304, "epoch": 7.179264734487454, "grad_norm": 1.421875, "learning_rate": 0.00013390031717319472, "loss": 4.5039, "mean_token_accuracy": 0.2555666819214821, "num_tokens": 160050487.0, "step": 92275 }, { "entropy": 5.4166792869567875, "epoch": 7.1796537638591715, "grad_norm": 1.40625, "learning_rate": 0.00013387872971476895, "loss": 4.6447, "mean_token_accuracy": 0.25058740973472593, "num_tokens": 160058446.0, "step": 92280 }, { "entropy": 5.38418288230896, "epoch": 7.180042793230889, "grad_norm": 1.3984375, "learning_rate": 0.0001338571443976339, "loss": 4.6493, "mean_token_accuracy": 0.24443479031324386, "num_tokens": 160067062.0, "step": 92285 }, { "entropy": 5.309890651702881, "epoch": 7.180431822602607, "grad_norm": 1.3125, "learning_rate": 0.000133835561222117, "loss": 4.5688, "mean_token_accuracy": 0.24733113050460814, "num_tokens": 160075644.0, "step": 92290 }, { "entropy": 5.401846075057984, "epoch": 7.180820851974324, "grad_norm": 1.5078125, "learning_rate": 0.0001338139801885458, "loss": 4.6492, "mean_token_accuracy": 0.24133193194866182, "num_tokens": 160084050.0, "step": 92295 }, { "entropy": 5.317452812194825, "epoch": 7.181209881346041, "grad_norm": 1.2109375, "learning_rate": 0.0001337924012972476, "loss": 4.5575, "mean_token_accuracy": 0.24576072096824647, "num_tokens": 160093325.0, "step": 92300 }, { "entropy": 5.417838382720947, "epoch": 7.181598910717759, "grad_norm": 1.3359375, "learning_rate": 0.00013377082454855017, "loss": 4.6511, "mean_token_accuracy": 0.24910195618867875, "num_tokens": 160101909.0, "step": 92305 }, { "entropy": 5.401565265655518, "epoch": 7.181987940089477, "grad_norm": 1.3203125, "learning_rate": 0.00013374924994278049, "loss": 4.6463, "mean_token_accuracy": 0.23961753398180008, "num_tokens": 160110188.0, "step": 92310 }, { "entropy": 5.318426179885864, "epoch": 7.1823769694611945, "grad_norm": 1.3203125, "learning_rate": 0.00013372767748026627, "loss": 4.5538, "mean_token_accuracy": 0.24642678052186967, "num_tokens": 160119274.0, "step": 92315 }, { "entropy": 5.277544355392456, "epoch": 7.182765998832912, "grad_norm": 1.359375, "learning_rate": 0.00013370610716133464, "loss": 4.4784, "mean_token_accuracy": 0.25864783823490145, "num_tokens": 160127539.0, "step": 92320 }, { "entropy": 5.3370684623718265, "epoch": 7.183155028204629, "grad_norm": 1.3046875, "learning_rate": 0.0001336845389863129, "loss": 4.5288, "mean_token_accuracy": 0.2553452059626579, "num_tokens": 160136614.0, "step": 92325 }, { "entropy": 5.305613470077515, "epoch": 7.183544057576347, "grad_norm": 1.3984375, "learning_rate": 0.0001336629729555284, "loss": 4.5238, "mean_token_accuracy": 0.2538721993565559, "num_tokens": 160145359.0, "step": 92330 }, { "entropy": 5.3404582977294925, "epoch": 7.183933086948064, "grad_norm": 1.5234375, "learning_rate": 0.00013364140906930823, "loss": 4.6267, "mean_token_accuracy": 0.2443299651145935, "num_tokens": 160153157.0, "step": 92335 }, { "entropy": 5.3828661918640135, "epoch": 7.184322116319782, "grad_norm": 1.53125, "learning_rate": 0.00013361984732797978, "loss": 4.6179, "mean_token_accuracy": 0.24346195310354232, "num_tokens": 160161469.0, "step": 92340 }, { "entropy": 5.362735939025879, "epoch": 7.1847111456915, "grad_norm": 1.5, "learning_rate": 0.00013359828773187003, "loss": 4.5985, "mean_token_accuracy": 0.23637529760599135, "num_tokens": 160169377.0, "step": 92345 }, { "entropy": 5.3138617992401125, "epoch": 7.1851001750632175, "grad_norm": 1.375, "learning_rate": 0.0001335767302813063, "loss": 4.5898, "mean_token_accuracy": 0.24501776397228242, "num_tokens": 160178003.0, "step": 92350 }, { "entropy": 5.289225053787232, "epoch": 7.185489204434935, "grad_norm": 1.4375, "learning_rate": 0.00013355517497661557, "loss": 4.523, "mean_token_accuracy": 0.2454012230038643, "num_tokens": 160186141.0, "step": 92355 }, { "entropy": 5.349445819854736, "epoch": 7.185878233806652, "grad_norm": 1.46875, "learning_rate": 0.0001335336218181249, "loss": 4.5291, "mean_token_accuracy": 0.25032408386468885, "num_tokens": 160194183.0, "step": 92360 }, { "entropy": 5.3792760372161865, "epoch": 7.18626726317837, "grad_norm": 1.3828125, "learning_rate": 0.0001335120708061614, "loss": 4.6612, "mean_token_accuracy": 0.24206367880105972, "num_tokens": 160202581.0, "step": 92365 }, { "entropy": 5.434961175918579, "epoch": 7.186656292550087, "grad_norm": 1.421875, "learning_rate": 0.0001334905219410519, "loss": 4.6254, "mean_token_accuracy": 0.23878999650478364, "num_tokens": 160210797.0, "step": 92370 }, { "entropy": 5.306635332107544, "epoch": 7.187045321921805, "grad_norm": 1.3671875, "learning_rate": 0.00013346897522312361, "loss": 4.479, "mean_token_accuracy": 0.25838774889707566, "num_tokens": 160220058.0, "step": 92375 }, { "entropy": 5.354110956192017, "epoch": 7.187434351293523, "grad_norm": 1.375, "learning_rate": 0.00013344743065270333, "loss": 4.6277, "mean_token_accuracy": 0.24415798336267472, "num_tokens": 160228688.0, "step": 92380 }, { "entropy": 5.367720222473144, "epoch": 7.1878233806652405, "grad_norm": 1.53125, "learning_rate": 0.000133425888230118, "loss": 4.5161, "mean_token_accuracy": 0.25048488974571226, "num_tokens": 160236917.0, "step": 92385 }, { "entropy": 5.412647819519043, "epoch": 7.188212410036958, "grad_norm": 1.359375, "learning_rate": 0.0001334043479556944, "loss": 4.6298, "mean_token_accuracy": 0.24219121783971786, "num_tokens": 160245012.0, "step": 92390 }, { "entropy": 5.321695947647095, "epoch": 7.188601439408675, "grad_norm": 1.3515625, "learning_rate": 0.00013338280982975954, "loss": 4.4519, "mean_token_accuracy": 0.25519401133060454, "num_tokens": 160252911.0, "step": 92395 }, { "entropy": 5.386152458190918, "epoch": 7.188990468780393, "grad_norm": 1.3671875, "learning_rate": 0.00013336127385264005, "loss": 4.6124, "mean_token_accuracy": 0.23880428075790405, "num_tokens": 160261073.0, "step": 92400 }, { "entropy": 5.358757734298706, "epoch": 7.18937949815211, "grad_norm": 1.3203125, "learning_rate": 0.00013333974002466278, "loss": 4.5912, "mean_token_accuracy": 0.24331521540880202, "num_tokens": 160269533.0, "step": 92405 }, { "entropy": 5.360108470916748, "epoch": 7.189768527523828, "grad_norm": 1.4140625, "learning_rate": 0.0001333182083461546, "loss": 4.6146, "mean_token_accuracy": 0.24993547946214675, "num_tokens": 160278219.0, "step": 92410 }, { "entropy": 5.344538450241089, "epoch": 7.190157556895546, "grad_norm": 1.28125, "learning_rate": 0.00013329667881744196, "loss": 4.633, "mean_token_accuracy": 0.24352982342243196, "num_tokens": 160286798.0, "step": 92415 }, { "entropy": 5.371330642700196, "epoch": 7.1905465862672635, "grad_norm": 1.390625, "learning_rate": 0.00013327515143885177, "loss": 4.6301, "mean_token_accuracy": 0.23921996504068374, "num_tokens": 160295422.0, "step": 92420 }, { "entropy": 5.298847818374634, "epoch": 7.19093561563898, "grad_norm": 1.328125, "learning_rate": 0.00013325362621071052, "loss": 4.5581, "mean_token_accuracy": 0.25083294212818147, "num_tokens": 160304255.0, "step": 92425 }, { "entropy": 5.404986906051636, "epoch": 7.191324645010698, "grad_norm": 1.3203125, "learning_rate": 0.00013323210313334494, "loss": 4.6462, "mean_token_accuracy": 0.24684948772192, "num_tokens": 160313012.0, "step": 92430 }, { "entropy": 5.428472995758057, "epoch": 7.191713674382416, "grad_norm": 1.3359375, "learning_rate": 0.0001332105822070816, "loss": 4.6941, "mean_token_accuracy": 0.2322460249066353, "num_tokens": 160322576.0, "step": 92435 }, { "entropy": 5.393605422973633, "epoch": 7.192102703754133, "grad_norm": 1.3125, "learning_rate": 0.00013318906343224684, "loss": 4.6179, "mean_token_accuracy": 0.24242098182439803, "num_tokens": 160331612.0, "step": 92440 }, { "entropy": 5.376457405090332, "epoch": 7.192491733125851, "grad_norm": 1.3046875, "learning_rate": 0.00013316754680916745, "loss": 4.6537, "mean_token_accuracy": 0.24048831313848495, "num_tokens": 160340110.0, "step": 92445 }, { "entropy": 5.388484001159668, "epoch": 7.192880762497569, "grad_norm": 1.4140625, "learning_rate": 0.0001331460323381697, "loss": 4.5989, "mean_token_accuracy": 0.24702430963516236, "num_tokens": 160348036.0, "step": 92450 }, { "entropy": 5.363025856018067, "epoch": 7.1932697918692865, "grad_norm": 1.359375, "learning_rate": 0.0001331245200195802, "loss": 4.5248, "mean_token_accuracy": 0.2451356902718544, "num_tokens": 160356456.0, "step": 92455 }, { "entropy": 5.374103116989136, "epoch": 7.193658821241003, "grad_norm": 1.40625, "learning_rate": 0.00013310300985372523, "loss": 4.5508, "mean_token_accuracy": 0.247349314391613, "num_tokens": 160365108.0, "step": 92460 }, { "entropy": 5.392385005950928, "epoch": 7.194047850612721, "grad_norm": 1.3125, "learning_rate": 0.0001330815018409312, "loss": 4.7014, "mean_token_accuracy": 0.23145233541727067, "num_tokens": 160374439.0, "step": 92465 }, { "entropy": 5.359987354278564, "epoch": 7.194436879984439, "grad_norm": 1.34375, "learning_rate": 0.00013305999598152462, "loss": 4.6076, "mean_token_accuracy": 0.2418766126036644, "num_tokens": 160383097.0, "step": 92470 }, { "entropy": 5.405289173126221, "epoch": 7.194825909356156, "grad_norm": 1.3125, "learning_rate": 0.00013303849227583154, "loss": 4.6421, "mean_token_accuracy": 0.23963939845561982, "num_tokens": 160391819.0, "step": 92475 }, { "entropy": 5.400410556793213, "epoch": 7.195214938727874, "grad_norm": 1.3515625, "learning_rate": 0.0001330169907241785, "loss": 4.5768, "mean_token_accuracy": 0.24823762029409407, "num_tokens": 160400248.0, "step": 92480 }, { "entropy": 5.3757466793060305, "epoch": 7.195603968099592, "grad_norm": 1.3125, "learning_rate": 0.00013299549132689154, "loss": 4.5744, "mean_token_accuracy": 0.25009443461894987, "num_tokens": 160408975.0, "step": 92485 }, { "entropy": 5.446235609054566, "epoch": 7.1959929974713095, "grad_norm": 1.453125, "learning_rate": 0.0001329739940842971, "loss": 4.7113, "mean_token_accuracy": 0.23513687700033187, "num_tokens": 160417011.0, "step": 92490 }, { "entropy": 5.379382038116455, "epoch": 7.196382026843026, "grad_norm": 1.3046875, "learning_rate": 0.00013295249899672112, "loss": 4.6215, "mean_token_accuracy": 0.23636218458414077, "num_tokens": 160426365.0, "step": 92495 }, { "entropy": 5.44202446937561, "epoch": 7.196771056214744, "grad_norm": 1.3984375, "learning_rate": 0.00013293100606448993, "loss": 4.7075, "mean_token_accuracy": 0.2350318178534508, "num_tokens": 160434963.0, "step": 92500 }, { "entropy": 5.388013172149658, "epoch": 7.197160085586462, "grad_norm": 1.3046875, "learning_rate": 0.00013290951528792958, "loss": 4.6138, "mean_token_accuracy": 0.24473245888948442, "num_tokens": 160443609.0, "step": 92505 }, { "entropy": 5.42171688079834, "epoch": 7.197549114958179, "grad_norm": 1.3203125, "learning_rate": 0.0001328880266673662, "loss": 4.6717, "mean_token_accuracy": 0.23804708421230317, "num_tokens": 160451939.0, "step": 92510 }, { "entropy": 5.425670337677002, "epoch": 7.197938144329897, "grad_norm": 1.3828125, "learning_rate": 0.0001328665402031259, "loss": 4.682, "mean_token_accuracy": 0.23748090565204621, "num_tokens": 160461124.0, "step": 92515 }, { "entropy": 5.344083499908447, "epoch": 7.198327173701615, "grad_norm": 1.3671875, "learning_rate": 0.00013284505589553446, "loss": 4.6, "mean_token_accuracy": 0.2454697757959366, "num_tokens": 160470152.0, "step": 92520 }, { "entropy": 5.336736392974854, "epoch": 7.198716203073332, "grad_norm": 1.4296875, "learning_rate": 0.00013282357374491815, "loss": 4.5952, "mean_token_accuracy": 0.24086117297410964, "num_tokens": 160477930.0, "step": 92525 }, { "entropy": 5.37874813079834, "epoch": 7.199105232445049, "grad_norm": 1.3515625, "learning_rate": 0.00013280209375160265, "loss": 4.6339, "mean_token_accuracy": 0.25125999450683595, "num_tokens": 160486945.0, "step": 92530 }, { "entropy": 5.3494977951049805, "epoch": 7.199494261816767, "grad_norm": 1.3515625, "learning_rate": 0.0001327806159159142, "loss": 4.6009, "mean_token_accuracy": 0.24929711371660232, "num_tokens": 160496063.0, "step": 92535 }, { "entropy": 5.449994087219238, "epoch": 7.199883291188485, "grad_norm": 1.3671875, "learning_rate": 0.00013275914023817853, "loss": 4.7441, "mean_token_accuracy": 0.24051253050565718, "num_tokens": 160505148.0, "step": 92540 }, { "entropy": 5.4145416736602785, "epoch": 7.200272320560202, "grad_norm": 1.359375, "learning_rate": 0.00013273766671872145, "loss": 4.6459, "mean_token_accuracy": 0.2421468198299408, "num_tokens": 160513575.0, "step": 92545 }, { "entropy": 5.410236644744873, "epoch": 7.20066134993192, "grad_norm": 1.4765625, "learning_rate": 0.00013271619535786891, "loss": 4.606, "mean_token_accuracy": 0.24200905859470367, "num_tokens": 160521228.0, "step": 92550 }, { "entropy": 5.360778045654297, "epoch": 7.201050379303638, "grad_norm": 1.4921875, "learning_rate": 0.00013269472615594659, "loss": 4.5547, "mean_token_accuracy": 0.2508039534091949, "num_tokens": 160529868.0, "step": 92555 }, { "entropy": 5.4860191822052, "epoch": 7.201439408675355, "grad_norm": 1.3359375, "learning_rate": 0.00013267325911328032, "loss": 4.7198, "mean_token_accuracy": 0.23879399299621581, "num_tokens": 160538777.0, "step": 92560 }, { "entropy": 5.399104166030884, "epoch": 7.201828438047072, "grad_norm": 1.3359375, "learning_rate": 0.00013265179423019576, "loss": 4.602, "mean_token_accuracy": 0.24598790109157562, "num_tokens": 160547905.0, "step": 92565 }, { "entropy": 5.376680946350097, "epoch": 7.20221746741879, "grad_norm": 1.359375, "learning_rate": 0.00013263033150701873, "loss": 4.5256, "mean_token_accuracy": 0.25060620009899137, "num_tokens": 160556483.0, "step": 92570 }, { "entropy": 5.4358710765838625, "epoch": 7.202606496790508, "grad_norm": 1.3984375, "learning_rate": 0.00013260887094407471, "loss": 4.7057, "mean_token_accuracy": 0.22855093330144882, "num_tokens": 160564740.0, "step": 92575 }, { "entropy": 5.376035118103028, "epoch": 7.202995526162225, "grad_norm": 1.3359375, "learning_rate": 0.00013258741254168954, "loss": 4.6548, "mean_token_accuracy": 0.23600477278232573, "num_tokens": 160573670.0, "step": 92580 }, { "entropy": 5.403229665756226, "epoch": 7.203384555533943, "grad_norm": 1.4921875, "learning_rate": 0.00013256595630018863, "loss": 4.6776, "mean_token_accuracy": 0.23997832387685775, "num_tokens": 160582622.0, "step": 92585 }, { "entropy": 5.330080270767212, "epoch": 7.203773584905661, "grad_norm": 1.328125, "learning_rate": 0.00013254450221989773, "loss": 4.5162, "mean_token_accuracy": 0.250907164812088, "num_tokens": 160591274.0, "step": 92590 }, { "entropy": 5.316724538803101, "epoch": 7.204162614277378, "grad_norm": 1.328125, "learning_rate": 0.0001325230503011422, "loss": 4.5828, "mean_token_accuracy": 0.2536097079515457, "num_tokens": 160599648.0, "step": 92595 }, { "entropy": 5.32495231628418, "epoch": 7.204551643649095, "grad_norm": 1.4296875, "learning_rate": 0.0001325016005442475, "loss": 4.539, "mean_token_accuracy": 0.2522721663117409, "num_tokens": 160607490.0, "step": 92600 }, { "entropy": 5.39938907623291, "epoch": 7.204940673020813, "grad_norm": 1.421875, "learning_rate": 0.00013248015294953935, "loss": 4.6294, "mean_token_accuracy": 0.24212455451488496, "num_tokens": 160615870.0, "step": 92605 }, { "entropy": 5.36916561126709, "epoch": 7.205329702392531, "grad_norm": 1.328125, "learning_rate": 0.00013245870751734296, "loss": 4.5409, "mean_token_accuracy": 0.24709579944610596, "num_tokens": 160624123.0, "step": 92610 }, { "entropy": 5.340246152877808, "epoch": 7.205718731764248, "grad_norm": 1.3203125, "learning_rate": 0.0001324372642479839, "loss": 4.5857, "mean_token_accuracy": 0.2515995889902115, "num_tokens": 160633322.0, "step": 92615 }, { "entropy": 5.459691572189331, "epoch": 7.206107761135966, "grad_norm": 1.484375, "learning_rate": 0.0001324158231417874, "loss": 4.7535, "mean_token_accuracy": 0.2346562400460243, "num_tokens": 160641865.0, "step": 92620 }, { "entropy": 5.3782069206237795, "epoch": 7.206496790507684, "grad_norm": 1.3046875, "learning_rate": 0.00013239438419907878, "loss": 4.6097, "mean_token_accuracy": 0.25325213372707367, "num_tokens": 160651156.0, "step": 92625 }, { "entropy": 5.326267576217651, "epoch": 7.206885819879401, "grad_norm": 1.34375, "learning_rate": 0.00013237294742018347, "loss": 4.5231, "mean_token_accuracy": 0.2503870651125908, "num_tokens": 160659741.0, "step": 92630 }, { "entropy": 5.43643012046814, "epoch": 7.207274849251118, "grad_norm": 1.5546875, "learning_rate": 0.00013235151280542663, "loss": 4.6451, "mean_token_accuracy": 0.24275488406419754, "num_tokens": 160668974.0, "step": 92635 }, { "entropy": 5.376981258392334, "epoch": 7.207663878622836, "grad_norm": 1.3046875, "learning_rate": 0.00013233008035513355, "loss": 4.6052, "mean_token_accuracy": 0.24843924343585969, "num_tokens": 160677739.0, "step": 92640 }, { "entropy": 5.372924852371216, "epoch": 7.208052907994554, "grad_norm": 1.3515625, "learning_rate": 0.0001323086500696294, "loss": 4.6404, "mean_token_accuracy": 0.24831223338842393, "num_tokens": 160686121.0, "step": 92645 }, { "entropy": 5.463928270339966, "epoch": 7.208441937366271, "grad_norm": 1.3359375, "learning_rate": 0.00013228722194923943, "loss": 4.7402, "mean_token_accuracy": 0.2355212613940239, "num_tokens": 160695868.0, "step": 92650 }, { "entropy": 5.423352909088135, "epoch": 7.208830966737989, "grad_norm": 1.3671875, "learning_rate": 0.0001322657959942886, "loss": 4.6383, "mean_token_accuracy": 0.24114654958248138, "num_tokens": 160704865.0, "step": 92655 }, { "entropy": 5.384922456741333, "epoch": 7.209219996109706, "grad_norm": 1.3125, "learning_rate": 0.00013224437220510227, "loss": 4.5759, "mean_token_accuracy": 0.25256330966949464, "num_tokens": 160713560.0, "step": 92660 }, { "entropy": 5.303297328948974, "epoch": 7.209609025481424, "grad_norm": 1.3359375, "learning_rate": 0.00013222295058200526, "loss": 4.5238, "mean_token_accuracy": 0.26012155413627625, "num_tokens": 160723653.0, "step": 92665 }, { "entropy": 5.3452128887176515, "epoch": 7.209998054853141, "grad_norm": 1.3828125, "learning_rate": 0.00013220153112532268, "loss": 4.5135, "mean_token_accuracy": 0.24808261543512344, "num_tokens": 160731830.0, "step": 92670 }, { "entropy": 5.464673662185669, "epoch": 7.210387084224859, "grad_norm": 1.4296875, "learning_rate": 0.0001321801138353797, "loss": 4.6914, "mean_token_accuracy": 0.24500210136175155, "num_tokens": 160740281.0, "step": 92675 }, { "entropy": 5.325867223739624, "epoch": 7.210776113596577, "grad_norm": 1.296875, "learning_rate": 0.00013215869871250114, "loss": 4.4868, "mean_token_accuracy": 0.25682717710733416, "num_tokens": 160748895.0, "step": 92680 }, { "entropy": 5.223721885681153, "epoch": 7.211165142968294, "grad_norm": 1.421875, "learning_rate": 0.000132137285757012, "loss": 4.3677, "mean_token_accuracy": 0.2657358780503273, "num_tokens": 160757989.0, "step": 92685 }, { "entropy": 5.2762144088745115, "epoch": 7.211554172340012, "grad_norm": 1.21875, "learning_rate": 0.00013211587496923704, "loss": 4.4553, "mean_token_accuracy": 0.2630413696169853, "num_tokens": 160767585.0, "step": 92690 }, { "entropy": 5.34943470954895, "epoch": 7.211943201711729, "grad_norm": 1.359375, "learning_rate": 0.0001320944663495014, "loss": 4.5735, "mean_token_accuracy": 0.2493397504091263, "num_tokens": 160776007.0, "step": 92695 }, { "entropy": 5.3272223472595215, "epoch": 7.212332231083447, "grad_norm": 1.4453125, "learning_rate": 0.00013207305989812974, "loss": 4.5622, "mean_token_accuracy": 0.25202645659446715, "num_tokens": 160784325.0, "step": 92700 }, { "entropy": 5.410389614105225, "epoch": 7.212721260455164, "grad_norm": 1.4453125, "learning_rate": 0.00013205165561544686, "loss": 4.6621, "mean_token_accuracy": 0.24264848977327347, "num_tokens": 160792804.0, "step": 92705 }, { "entropy": 5.315902376174927, "epoch": 7.213110289826882, "grad_norm": 1.34375, "learning_rate": 0.00013203025350177762, "loss": 4.5078, "mean_token_accuracy": 0.24905136972665787, "num_tokens": 160801287.0, "step": 92710 }, { "entropy": 5.40170693397522, "epoch": 7.2134993191986, "grad_norm": 1.46875, "learning_rate": 0.00013200885355744665, "loss": 4.645, "mean_token_accuracy": 0.23643695414066315, "num_tokens": 160809564.0, "step": 92715 }, { "entropy": 5.2941618919372555, "epoch": 7.213888348570317, "grad_norm": 1.4296875, "learning_rate": 0.00013198745578277884, "loss": 4.5287, "mean_token_accuracy": 0.25108041167259215, "num_tokens": 160817779.0, "step": 92720 }, { "entropy": 5.420750904083252, "epoch": 7.214277377942035, "grad_norm": 1.5859375, "learning_rate": 0.0001319660601780987, "loss": 4.6994, "mean_token_accuracy": 0.24000463634729385, "num_tokens": 160825733.0, "step": 92725 }, { "entropy": 5.272272205352783, "epoch": 7.214666407313752, "grad_norm": 1.3828125, "learning_rate": 0.0001319446667437309, "loss": 4.4731, "mean_token_accuracy": 0.25085352808237077, "num_tokens": 160834787.0, "step": 92730 }, { "entropy": 5.284072303771973, "epoch": 7.21505543668547, "grad_norm": 1.3046875, "learning_rate": 0.0001319232754800001, "loss": 4.5315, "mean_token_accuracy": 0.2474823623895645, "num_tokens": 160843499.0, "step": 92735 }, { "entropy": 5.428152656555175, "epoch": 7.215444466057187, "grad_norm": 1.5, "learning_rate": 0.0001319018863872309, "loss": 4.6825, "mean_token_accuracy": 0.24184058904647826, "num_tokens": 160852074.0, "step": 92740 }, { "entropy": 5.383679437637329, "epoch": 7.215833495428905, "grad_norm": 1.4609375, "learning_rate": 0.0001318804994657478, "loss": 4.6061, "mean_token_accuracy": 0.24806584268808365, "num_tokens": 160860608.0, "step": 92745 }, { "entropy": 5.413587379455566, "epoch": 7.216222524800623, "grad_norm": 1.375, "learning_rate": 0.0001318591147158753, "loss": 4.6118, "mean_token_accuracy": 0.24971940964460373, "num_tokens": 160869217.0, "step": 92750 }, { "entropy": 5.4731425762176515, "epoch": 7.21661155417234, "grad_norm": 1.546875, "learning_rate": 0.000131837732137938, "loss": 4.6795, "mean_token_accuracy": 0.244609996676445, "num_tokens": 160877222.0, "step": 92755 }, { "entropy": 5.4110054016113285, "epoch": 7.217000583544057, "grad_norm": 1.4609375, "learning_rate": 0.00013181635173226008, "loss": 4.6053, "mean_token_accuracy": 0.23623024076223373, "num_tokens": 160885876.0, "step": 92760 }, { "entropy": 5.395467805862427, "epoch": 7.217389612915775, "grad_norm": 1.453125, "learning_rate": 0.00013179497349916625, "loss": 4.655, "mean_token_accuracy": 0.23777615576982497, "num_tokens": 160894295.0, "step": 92765 }, { "entropy": 5.3823799133300785, "epoch": 7.2177786422874926, "grad_norm": 1.3984375, "learning_rate": 0.0001317735974389807, "loss": 4.6428, "mean_token_accuracy": 0.23799294233322144, "num_tokens": 160903503.0, "step": 92770 }, { "entropy": 5.372606039047241, "epoch": 7.21816767165921, "grad_norm": 1.3359375, "learning_rate": 0.00013175222355202792, "loss": 4.5702, "mean_token_accuracy": 0.24836839288473128, "num_tokens": 160912060.0, "step": 92775 }, { "entropy": 5.3608283519744875, "epoch": 7.218556701030928, "grad_norm": 1.25, "learning_rate": 0.00013173085183863212, "loss": 4.5851, "mean_token_accuracy": 0.24413824677467347, "num_tokens": 160920777.0, "step": 92780 }, { "entropy": 5.4142923831939695, "epoch": 7.218945730402646, "grad_norm": 1.375, "learning_rate": 0.00013170948229911756, "loss": 4.6413, "mean_token_accuracy": 0.2441364511847496, "num_tokens": 160929377.0, "step": 92785 }, { "entropy": 5.333751392364502, "epoch": 7.219334759774363, "grad_norm": 1.46875, "learning_rate": 0.0001316881149338086, "loss": 4.475, "mean_token_accuracy": 0.2568366974592209, "num_tokens": 160937127.0, "step": 92790 }, { "entropy": 5.359666061401367, "epoch": 7.21972378914608, "grad_norm": 1.2578125, "learning_rate": 0.00013166674974302928, "loss": 4.6167, "mean_token_accuracy": 0.248251248896122, "num_tokens": 160946239.0, "step": 92795 }, { "entropy": 5.2943785190582275, "epoch": 7.220112818517798, "grad_norm": 1.421875, "learning_rate": 0.0001316453867271039, "loss": 4.5511, "mean_token_accuracy": 0.2480513021349907, "num_tokens": 160954518.0, "step": 92800 }, { "entropy": 5.4204699993133545, "epoch": 7.2205018478895155, "grad_norm": 1.3671875, "learning_rate": 0.00013162402588635664, "loss": 4.6742, "mean_token_accuracy": 0.2394874021410942, "num_tokens": 160962653.0, "step": 92805 }, { "entropy": 5.392215585708618, "epoch": 7.220890877261233, "grad_norm": 1.4375, "learning_rate": 0.00013160266722111167, "loss": 4.6087, "mean_token_accuracy": 0.2468222752213478, "num_tokens": 160971130.0, "step": 92810 }, { "entropy": 5.335342741012573, "epoch": 7.221279906632951, "grad_norm": 1.375, "learning_rate": 0.00013158131073169295, "loss": 4.5735, "mean_token_accuracy": 0.24484187960624695, "num_tokens": 160980174.0, "step": 92815 }, { "entropy": 5.368626070022583, "epoch": 7.221668936004669, "grad_norm": 1.3671875, "learning_rate": 0.0001315599564184245, "loss": 4.5578, "mean_token_accuracy": 0.24539077430963516, "num_tokens": 160988937.0, "step": 92820 }, { "entropy": 5.4161317348480225, "epoch": 7.222057965376386, "grad_norm": 1.4765625, "learning_rate": 0.0001315386042816305, "loss": 4.6108, "mean_token_accuracy": 0.24908680319786072, "num_tokens": 160997962.0, "step": 92825 }, { "entropy": 5.455827379226685, "epoch": 7.222446994748103, "grad_norm": 1.3984375, "learning_rate": 0.0001315172543216347, "loss": 4.6649, "mean_token_accuracy": 0.2327004998922348, "num_tokens": 161006876.0, "step": 92830 }, { "entropy": 5.306347751617432, "epoch": 7.222836024119821, "grad_norm": 1.5, "learning_rate": 0.00013149590653876135, "loss": 4.544, "mean_token_accuracy": 0.25749264657497406, "num_tokens": 161014801.0, "step": 92835 }, { "entropy": 5.282178068161011, "epoch": 7.2232250534915385, "grad_norm": 1.265625, "learning_rate": 0.00013147456093333407, "loss": 4.5286, "mean_token_accuracy": 0.24960041642189026, "num_tokens": 161023740.0, "step": 92840 }, { "entropy": 5.344103050231934, "epoch": 7.223614082863256, "grad_norm": 1.4140625, "learning_rate": 0.00013145321750567695, "loss": 4.5602, "mean_token_accuracy": 0.2493737295269966, "num_tokens": 161032457.0, "step": 92845 }, { "entropy": 5.35132737159729, "epoch": 7.224003112234974, "grad_norm": 1.5390625, "learning_rate": 0.00013143187625611375, "loss": 4.6286, "mean_token_accuracy": 0.24160081148147583, "num_tokens": 161041131.0, "step": 92850 }, { "entropy": 5.392951345443725, "epoch": 7.224392141606692, "grad_norm": 1.6171875, "learning_rate": 0.00013141053718496837, "loss": 4.6978, "mean_token_accuracy": 0.23786876499652862, "num_tokens": 161049711.0, "step": 92855 }, { "entropy": 5.431059455871582, "epoch": 7.224781170978408, "grad_norm": 1.3125, "learning_rate": 0.00013138920029256445, "loss": 4.6754, "mean_token_accuracy": 0.2304826036095619, "num_tokens": 161058128.0, "step": 92860 }, { "entropy": 5.298126649856568, "epoch": 7.225170200350126, "grad_norm": 1.265625, "learning_rate": 0.00013136786557922585, "loss": 4.4735, "mean_token_accuracy": 0.2624309331178665, "num_tokens": 161066700.0, "step": 92865 }, { "entropy": 5.280375528335571, "epoch": 7.225559229721844, "grad_norm": 1.3671875, "learning_rate": 0.0001313465330452764, "loss": 4.4998, "mean_token_accuracy": 0.2503114178776741, "num_tokens": 161075020.0, "step": 92870 }, { "entropy": 5.369185066223144, "epoch": 7.2259482590935615, "grad_norm": 1.3984375, "learning_rate": 0.00013132520269103947, "loss": 4.557, "mean_token_accuracy": 0.25066802501678465, "num_tokens": 161084471.0, "step": 92875 }, { "entropy": 5.400961637496948, "epoch": 7.226337288465279, "grad_norm": 1.3125, "learning_rate": 0.00013130387451683908, "loss": 4.6336, "mean_token_accuracy": 0.24023017436265945, "num_tokens": 161094123.0, "step": 92880 }, { "entropy": 5.4293739795684814, "epoch": 7.226726317836997, "grad_norm": 1.3984375, "learning_rate": 0.0001312825485229986, "loss": 4.6018, "mean_token_accuracy": 0.24661445021629333, "num_tokens": 161102501.0, "step": 92885 }, { "entropy": 5.336338233947754, "epoch": 7.227115347208715, "grad_norm": 1.3359375, "learning_rate": 0.00013126122470984172, "loss": 4.6071, "mean_token_accuracy": 0.24096372872591018, "num_tokens": 161110982.0, "step": 92890 }, { "entropy": 5.384690856933593, "epoch": 7.227504376580431, "grad_norm": 1.34375, "learning_rate": 0.000131239903077692, "loss": 4.6165, "mean_token_accuracy": 0.2364717811346054, "num_tokens": 161119333.0, "step": 92895 }, { "entropy": 5.305839872360229, "epoch": 7.227893405952149, "grad_norm": 1.328125, "learning_rate": 0.00013121858362687285, "loss": 4.5347, "mean_token_accuracy": 0.247261443734169, "num_tokens": 161127580.0, "step": 92900 }, { "entropy": 5.2867790222167965, "epoch": 7.228282435323867, "grad_norm": 1.421875, "learning_rate": 0.00013119726635770797, "loss": 4.5011, "mean_token_accuracy": 0.2608225464820862, "num_tokens": 161136114.0, "step": 92905 }, { "entropy": 5.32884955406189, "epoch": 7.2286714646955845, "grad_norm": 1.3828125, "learning_rate": 0.0001311759512705205, "loss": 4.4929, "mean_token_accuracy": 0.2572451338171959, "num_tokens": 161144012.0, "step": 92910 }, { "entropy": 5.396964073181152, "epoch": 7.229060494067302, "grad_norm": 1.3984375, "learning_rate": 0.00013115463836563425, "loss": 4.6859, "mean_token_accuracy": 0.2353859469294548, "num_tokens": 161152656.0, "step": 92915 }, { "entropy": 5.363293218612671, "epoch": 7.22944952343902, "grad_norm": 1.3046875, "learning_rate": 0.00013113332764337225, "loss": 4.6301, "mean_token_accuracy": 0.2407084360718727, "num_tokens": 161161818.0, "step": 92920 }, { "entropy": 5.415321350097656, "epoch": 7.229838552810738, "grad_norm": 1.3671875, "learning_rate": 0.00013111201910405809, "loss": 4.6021, "mean_token_accuracy": 0.24947014600038528, "num_tokens": 161170179.0, "step": 92925 }, { "entropy": 5.400695371627807, "epoch": 7.230227582182454, "grad_norm": 1.296875, "learning_rate": 0.00013109071274801498, "loss": 4.6366, "mean_token_accuracy": 0.24518899172544478, "num_tokens": 161179262.0, "step": 92930 }, { "entropy": 5.384346342086792, "epoch": 7.230616611554172, "grad_norm": 1.234375, "learning_rate": 0.00013106940857556624, "loss": 4.6223, "mean_token_accuracy": 0.24664367884397506, "num_tokens": 161188413.0, "step": 92935 }, { "entropy": 5.397604608535767, "epoch": 7.23100564092589, "grad_norm": 1.421875, "learning_rate": 0.0001310481065870352, "loss": 4.5576, "mean_token_accuracy": 0.25470231771469115, "num_tokens": 161195703.0, "step": 92940 }, { "entropy": 5.431394433975219, "epoch": 7.2313946702976075, "grad_norm": 1.484375, "learning_rate": 0.00013102680678274493, "loss": 4.6618, "mean_token_accuracy": 0.2478412300348282, "num_tokens": 161204055.0, "step": 92945 }, { "entropy": 5.355821800231934, "epoch": 7.231783699669325, "grad_norm": 1.28125, "learning_rate": 0.00013100550916301883, "loss": 4.5704, "mean_token_accuracy": 0.24886807799339294, "num_tokens": 161212081.0, "step": 92950 }, { "entropy": 5.381619882583618, "epoch": 7.232172729041043, "grad_norm": 1.296875, "learning_rate": 0.00013098421372817983, "loss": 4.6271, "mean_token_accuracy": 0.2370375081896782, "num_tokens": 161221282.0, "step": 92955 }, { "entropy": 5.400146245956421, "epoch": 7.232561758412761, "grad_norm": 1.3984375, "learning_rate": 0.00013096292047855127, "loss": 4.6812, "mean_token_accuracy": 0.23739182353019714, "num_tokens": 161230979.0, "step": 92960 }, { "entropy": 5.329092073440552, "epoch": 7.232950787784477, "grad_norm": 1.484375, "learning_rate": 0.00013094162941445603, "loss": 4.53, "mean_token_accuracy": 0.2553288385272026, "num_tokens": 161239148.0, "step": 92965 }, { "entropy": 5.329554891586303, "epoch": 7.233339817156195, "grad_norm": 1.390625, "learning_rate": 0.0001309203405362173, "loss": 4.5338, "mean_token_accuracy": 0.2553807407617569, "num_tokens": 161247808.0, "step": 92970 }, { "entropy": 5.3601250648498535, "epoch": 7.233728846527913, "grad_norm": 1.421875, "learning_rate": 0.00013089905384415818, "loss": 4.5478, "mean_token_accuracy": 0.2537130728363991, "num_tokens": 161256784.0, "step": 92975 }, { "entropy": 5.359031295776367, "epoch": 7.2341178758996305, "grad_norm": 1.53125, "learning_rate": 0.0001308777693386014, "loss": 4.6172, "mean_token_accuracy": 0.24877254217863082, "num_tokens": 161265773.0, "step": 92980 }, { "entropy": 5.402850914001465, "epoch": 7.234506905271348, "grad_norm": 1.296875, "learning_rate": 0.00013085648701987017, "loss": 4.6568, "mean_token_accuracy": 0.2348551020026207, "num_tokens": 161274676.0, "step": 92985 }, { "entropy": 5.424603700637817, "epoch": 7.234895934643066, "grad_norm": 1.421875, "learning_rate": 0.00013083520688828725, "loss": 4.7122, "mean_token_accuracy": 0.23791230618953704, "num_tokens": 161283256.0, "step": 92990 }, { "entropy": 5.427352094650269, "epoch": 7.235284964014783, "grad_norm": 1.4453125, "learning_rate": 0.00013081392894417565, "loss": 4.6658, "mean_token_accuracy": 0.24176755994558335, "num_tokens": 161292240.0, "step": 92995 }, { "entropy": 5.42385048866272, "epoch": 7.2356739933865, "grad_norm": 1.34375, "learning_rate": 0.0001307926531878582, "loss": 4.5891, "mean_token_accuracy": 0.2505391076207161, "num_tokens": 161300817.0, "step": 93000 }, { "epoch": 7.2356739933865, "eval_entropy": 5.117161943455862, "eval_loss": 4.848870277404785, "eval_mean_token_accuracy": 0.23732912991773175, "eval_num_tokens": 161300817.0, "eval_runtime": 28.6143, "eval_samples_per_second": 1452.352, "eval_steps_per_second": 181.553, "step": 93000 }, { "entropy": 5.3514879703521725, "epoch": 7.236063022758218, "grad_norm": 1.3984375, "learning_rate": 0.0001307713796196577, "loss": 4.6209, "mean_token_accuracy": 0.24437925964593887, "num_tokens": 161309032.0, "step": 93005 }, { "entropy": 5.355354833602905, "epoch": 7.236452052129936, "grad_norm": 1.3671875, "learning_rate": 0.00013075010823989695, "loss": 4.6686, "mean_token_accuracy": 0.2417302832007408, "num_tokens": 161317913.0, "step": 93010 }, { "entropy": 5.318651580810547, "epoch": 7.2368410815016535, "grad_norm": 1.25, "learning_rate": 0.00013072883904889865, "loss": 4.5286, "mean_token_accuracy": 0.25664413422346116, "num_tokens": 161326533.0, "step": 93015 }, { "entropy": 5.372893524169922, "epoch": 7.237230110873371, "grad_norm": 1.3828125, "learning_rate": 0.00013070757204698566, "loss": 4.5536, "mean_token_accuracy": 0.2523710384964943, "num_tokens": 161335817.0, "step": 93020 }, { "entropy": 5.325049495697021, "epoch": 7.237619140245089, "grad_norm": 1.453125, "learning_rate": 0.00013068630723448056, "loss": 4.5762, "mean_token_accuracy": 0.24989894926548004, "num_tokens": 161344169.0, "step": 93025 }, { "entropy": 5.361840486526489, "epoch": 7.238008169616806, "grad_norm": 1.3203125, "learning_rate": 0.0001306650446117061, "loss": 4.5403, "mean_token_accuracy": 0.25378065556287766, "num_tokens": 161354791.0, "step": 93030 }, { "entropy": 5.311911153793335, "epoch": 7.238397198988523, "grad_norm": 1.3828125, "learning_rate": 0.00013064378417898477, "loss": 4.5343, "mean_token_accuracy": 0.2469213515520096, "num_tokens": 161363175.0, "step": 93035 }, { "entropy": 5.371565961837769, "epoch": 7.238786228360241, "grad_norm": 1.4140625, "learning_rate": 0.00013062252593663934, "loss": 4.573, "mean_token_accuracy": 0.24588743597269058, "num_tokens": 161371543.0, "step": 93040 }, { "entropy": 5.461717939376831, "epoch": 7.239175257731959, "grad_norm": 1.4296875, "learning_rate": 0.00013060126988499222, "loss": 4.7475, "mean_token_accuracy": 0.23391314297914506, "num_tokens": 161380048.0, "step": 93045 }, { "entropy": 5.383434247970581, "epoch": 7.2395642871036765, "grad_norm": 1.2890625, "learning_rate": 0.000130580016024366, "loss": 4.6698, "mean_token_accuracy": 0.243982295691967, "num_tokens": 161389382.0, "step": 93050 }, { "entropy": 5.3832862854003904, "epoch": 7.239953316475394, "grad_norm": 1.34375, "learning_rate": 0.00013055876435508323, "loss": 4.6168, "mean_token_accuracy": 0.2482757732272148, "num_tokens": 161398294.0, "step": 93055 }, { "entropy": 5.324546813964844, "epoch": 7.240342345847111, "grad_norm": 1.3515625, "learning_rate": 0.00013053751487746622, "loss": 4.528, "mean_token_accuracy": 0.24760883599519729, "num_tokens": 161406433.0, "step": 93060 }, { "entropy": 5.252767419815063, "epoch": 7.240731375218829, "grad_norm": 1.3671875, "learning_rate": 0.00013051626759183748, "loss": 4.4182, "mean_token_accuracy": 0.26350547969341276, "num_tokens": 161414780.0, "step": 93065 }, { "entropy": 5.325701808929443, "epoch": 7.241120404590546, "grad_norm": 1.3984375, "learning_rate": 0.00013049502249851944, "loss": 4.5325, "mean_token_accuracy": 0.2576692759990692, "num_tokens": 161423666.0, "step": 93070 }, { "entropy": 5.395560884475708, "epoch": 7.241509433962264, "grad_norm": 1.4453125, "learning_rate": 0.00013047377959783449, "loss": 4.6398, "mean_token_accuracy": 0.24152043759822844, "num_tokens": 161432062.0, "step": 93075 }, { "entropy": 5.318017816543579, "epoch": 7.241898463333982, "grad_norm": 1.375, "learning_rate": 0.00013045253889010488, "loss": 4.5613, "mean_token_accuracy": 0.24792979210615157, "num_tokens": 161440206.0, "step": 93080 }, { "entropy": 5.324124336242676, "epoch": 7.2422874927056995, "grad_norm": 1.28125, "learning_rate": 0.00013043130037565284, "loss": 4.6001, "mean_token_accuracy": 0.24896049052476882, "num_tokens": 161448993.0, "step": 93085 }, { "entropy": 5.261946725845337, "epoch": 7.242676522077417, "grad_norm": 1.2890625, "learning_rate": 0.00013041006405480082, "loss": 4.4521, "mean_token_accuracy": 0.2586507469415665, "num_tokens": 161457782.0, "step": 93090 }, { "entropy": 5.46934666633606, "epoch": 7.243065551449134, "grad_norm": 1.5390625, "learning_rate": 0.00013038882992787084, "loss": 4.7216, "mean_token_accuracy": 0.23379883468151091, "num_tokens": 161465864.0, "step": 93095 }, { "entropy": 5.385258579254151, "epoch": 7.243454580820852, "grad_norm": 1.4140625, "learning_rate": 0.00013036759799518526, "loss": 4.6274, "mean_token_accuracy": 0.23793036937713624, "num_tokens": 161474023.0, "step": 93100 }, { "entropy": 5.3992713451385494, "epoch": 7.243843610192569, "grad_norm": 1.4609375, "learning_rate": 0.00013034636825706613, "loss": 4.7121, "mean_token_accuracy": 0.23404035717248917, "num_tokens": 161482914.0, "step": 93105 }, { "entropy": 5.391446876525879, "epoch": 7.244232639564287, "grad_norm": 1.3125, "learning_rate": 0.0001303251407138357, "loss": 4.6088, "mean_token_accuracy": 0.24092815220355987, "num_tokens": 161491662.0, "step": 93110 }, { "entropy": 5.441685485839844, "epoch": 7.244621668936005, "grad_norm": 1.328125, "learning_rate": 0.00013030391536581588, "loss": 4.6644, "mean_token_accuracy": 0.23856064975261687, "num_tokens": 161500218.0, "step": 93115 }, { "entropy": 5.336873388290405, "epoch": 7.2450106983077225, "grad_norm": 1.40625, "learning_rate": 0.00013028269221332896, "loss": 4.5461, "mean_token_accuracy": 0.25544821172952653, "num_tokens": 161508847.0, "step": 93120 }, { "entropy": 5.223408842086792, "epoch": 7.24539972767944, "grad_norm": 1.5390625, "learning_rate": 0.00013026147125669668, "loss": 4.4332, "mean_token_accuracy": 0.25919142067432405, "num_tokens": 161516454.0, "step": 93125 }, { "entropy": 5.307506895065307, "epoch": 7.245788757051157, "grad_norm": 1.390625, "learning_rate": 0.00013024025249624128, "loss": 4.5523, "mean_token_accuracy": 0.245629745721817, "num_tokens": 161524174.0, "step": 93130 }, { "entropy": 5.445923328399658, "epoch": 7.246177786422875, "grad_norm": 1.3359375, "learning_rate": 0.00013021903593228468, "loss": 4.7423, "mean_token_accuracy": 0.23531498908996581, "num_tokens": 161533340.0, "step": 93135 }, { "entropy": 5.439331436157227, "epoch": 7.246566815794592, "grad_norm": 1.34375, "learning_rate": 0.0001301978215651487, "loss": 4.7689, "mean_token_accuracy": 0.23754979819059371, "num_tokens": 161542703.0, "step": 93140 }, { "entropy": 5.393563222885132, "epoch": 7.24695584516631, "grad_norm": 1.2890625, "learning_rate": 0.00013017660939515535, "loss": 4.6218, "mean_token_accuracy": 0.24551842510700225, "num_tokens": 161550818.0, "step": 93145 }, { "entropy": 5.367584133148194, "epoch": 7.247344874538028, "grad_norm": 1.40625, "learning_rate": 0.00013015539942262642, "loss": 4.631, "mean_token_accuracy": 0.2403274118900299, "num_tokens": 161559897.0, "step": 93150 }, { "entropy": 5.349287366867065, "epoch": 7.2477339039097455, "grad_norm": 1.359375, "learning_rate": 0.00013013419164788383, "loss": 4.628, "mean_token_accuracy": 0.23320333361625672, "num_tokens": 161568711.0, "step": 93155 }, { "entropy": 5.352972841262817, "epoch": 7.248122933281463, "grad_norm": 1.4140625, "learning_rate": 0.0001301129860712492, "loss": 4.5707, "mean_token_accuracy": 0.24405422508716584, "num_tokens": 161577485.0, "step": 93160 }, { "entropy": 5.368986797332764, "epoch": 7.24851196265318, "grad_norm": 1.4140625, "learning_rate": 0.00013009178269304448, "loss": 4.5951, "mean_token_accuracy": 0.24606360495090485, "num_tokens": 161586349.0, "step": 93165 }, { "entropy": 5.369545936584473, "epoch": 7.248900992024898, "grad_norm": 1.3828125, "learning_rate": 0.0001300705815135913, "loss": 4.5946, "mean_token_accuracy": 0.25031156092882156, "num_tokens": 161595382.0, "step": 93170 }, { "entropy": 5.31597638130188, "epoch": 7.249290021396615, "grad_norm": 1.3828125, "learning_rate": 0.0001300493825332113, "loss": 4.6062, "mean_token_accuracy": 0.24337042719125748, "num_tokens": 161604570.0, "step": 93175 }, { "entropy": 5.378845834732056, "epoch": 7.249679050768333, "grad_norm": 1.3359375, "learning_rate": 0.0001300281857522263, "loss": 4.6176, "mean_token_accuracy": 0.24753223806619645, "num_tokens": 161613301.0, "step": 93180 }, { "entropy": 5.42596664428711, "epoch": 7.250068080140051, "grad_norm": 1.4765625, "learning_rate": 0.0001300069911709577, "loss": 4.6668, "mean_token_accuracy": 0.24765763133764268, "num_tokens": 161621612.0, "step": 93185 }, { "entropy": 5.2650309085845945, "epoch": 7.2504571095117685, "grad_norm": 1.3828125, "learning_rate": 0.0001299857987897274, "loss": 4.5693, "mean_token_accuracy": 0.24019169360399245, "num_tokens": 161630092.0, "step": 93190 }, { "entropy": 5.325260639190674, "epoch": 7.250846138883485, "grad_norm": 1.5390625, "learning_rate": 0.0001299646086088566, "loss": 4.5347, "mean_token_accuracy": 0.2549667716026306, "num_tokens": 161638348.0, "step": 93195 }, { "entropy": 5.4125528812408445, "epoch": 7.251235168255203, "grad_norm": 1.3359375, "learning_rate": 0.0001299434206286671, "loss": 4.6874, "mean_token_accuracy": 0.23951479494571687, "num_tokens": 161647375.0, "step": 93200 }, { "entropy": 5.377710342407227, "epoch": 7.251624197626921, "grad_norm": 1.359375, "learning_rate": 0.00012992223484948036, "loss": 4.5985, "mean_token_accuracy": 0.24648675620555877, "num_tokens": 161656320.0, "step": 93205 }, { "entropy": 5.307938766479492, "epoch": 7.252013226998638, "grad_norm": 1.4921875, "learning_rate": 0.00012990105127161773, "loss": 4.5499, "mean_token_accuracy": 0.24703573137521745, "num_tokens": 161664310.0, "step": 93210 }, { "entropy": 5.4520317077636715, "epoch": 7.252402256370356, "grad_norm": 1.4375, "learning_rate": 0.00012987986989540076, "loss": 4.6943, "mean_token_accuracy": 0.23632523119449617, "num_tokens": 161672297.0, "step": 93215 }, { "entropy": 5.26498646736145, "epoch": 7.252791285742074, "grad_norm": 1.390625, "learning_rate": 0.00012985869072115072, "loss": 4.4512, "mean_token_accuracy": 0.2665297329425812, "num_tokens": 161681088.0, "step": 93220 }, { "entropy": 5.268145418167114, "epoch": 7.2531803151137915, "grad_norm": 1.3203125, "learning_rate": 0.0001298375137491891, "loss": 4.5084, "mean_token_accuracy": 0.25905380100011827, "num_tokens": 161689927.0, "step": 93225 }, { "entropy": 5.2751048564910885, "epoch": 7.253569344485508, "grad_norm": 1.3515625, "learning_rate": 0.00012981633897983708, "loss": 4.501, "mean_token_accuracy": 0.25445732325315473, "num_tokens": 161698665.0, "step": 93230 }, { "entropy": 5.360054016113281, "epoch": 7.253958373857226, "grad_norm": 1.296875, "learning_rate": 0.0001297951664134161, "loss": 4.5967, "mean_token_accuracy": 0.242214173078537, "num_tokens": 161707668.0, "step": 93235 }, { "entropy": 5.408990812301636, "epoch": 7.254347403228944, "grad_norm": 1.4375, "learning_rate": 0.00012977399605024732, "loss": 4.6586, "mean_token_accuracy": 0.2456701695919037, "num_tokens": 161717079.0, "step": 93240 }, { "entropy": 5.374428558349609, "epoch": 7.254736432600661, "grad_norm": 1.59375, "learning_rate": 0.00012975282789065202, "loss": 4.5713, "mean_token_accuracy": 0.25754389762878416, "num_tokens": 161724910.0, "step": 93245 }, { "entropy": 5.368446016311646, "epoch": 7.255125461972379, "grad_norm": 1.359375, "learning_rate": 0.00012973166193495139, "loss": 4.6176, "mean_token_accuracy": 0.23908609449863433, "num_tokens": 161733044.0, "step": 93250 }, { "entropy": 5.30822377204895, "epoch": 7.255514491344097, "grad_norm": 1.4140625, "learning_rate": 0.00012971049818346646, "loss": 4.6154, "mean_token_accuracy": 0.24119185358285905, "num_tokens": 161741793.0, "step": 93255 }, { "entropy": 5.346643543243408, "epoch": 7.2559035207158145, "grad_norm": 1.3046875, "learning_rate": 0.0001296893366365186, "loss": 4.5515, "mean_token_accuracy": 0.25351144969463346, "num_tokens": 161750659.0, "step": 93260 }, { "entropy": 5.305310010910034, "epoch": 7.256292550087531, "grad_norm": 1.4296875, "learning_rate": 0.0001296681772944286, "loss": 4.5477, "mean_token_accuracy": 0.24555520415306092, "num_tokens": 161760217.0, "step": 93265 }, { "entropy": 5.269532346725464, "epoch": 7.256681579459249, "grad_norm": 1.28125, "learning_rate": 0.00012964702015751784, "loss": 4.5702, "mean_token_accuracy": 0.25058519691228864, "num_tokens": 161770484.0, "step": 93270 }, { "entropy": 5.401564502716065, "epoch": 7.257070608830967, "grad_norm": 1.4140625, "learning_rate": 0.0001296258652261072, "loss": 4.6364, "mean_token_accuracy": 0.24727412015199662, "num_tokens": 161778634.0, "step": 93275 }, { "entropy": 5.444714164733886, "epoch": 7.257459638202684, "grad_norm": 1.4296875, "learning_rate": 0.00012960471250051758, "loss": 4.6645, "mean_token_accuracy": 0.24420372396707535, "num_tokens": 161787233.0, "step": 93280 }, { "entropy": 5.430482959747314, "epoch": 7.257848667574402, "grad_norm": 1.453125, "learning_rate": 0.00012958356198107014, "loss": 4.6042, "mean_token_accuracy": 0.24489883035421373, "num_tokens": 161795839.0, "step": 93285 }, { "entropy": 5.316358613967895, "epoch": 7.25823769694612, "grad_norm": 1.421875, "learning_rate": 0.00012956241366808558, "loss": 4.525, "mean_token_accuracy": 0.25635805875062945, "num_tokens": 161805439.0, "step": 93290 }, { "entropy": 5.3432715892791744, "epoch": 7.2586267263178375, "grad_norm": 1.5, "learning_rate": 0.000129541267561885, "loss": 4.5847, "mean_token_accuracy": 0.2515170007944107, "num_tokens": 161813988.0, "step": 93295 }, { "entropy": 5.3332335472106935, "epoch": 7.259015755689554, "grad_norm": 1.4140625, "learning_rate": 0.0001295201236627891, "loss": 4.5933, "mean_token_accuracy": 0.24958566278219224, "num_tokens": 161822614.0, "step": 93300 }, { "entropy": 5.404656600952149, "epoch": 7.259404785061272, "grad_norm": 1.3984375, "learning_rate": 0.0001294989819711188, "loss": 4.6196, "mean_token_accuracy": 0.25517726242542266, "num_tokens": 161830993.0, "step": 93305 }, { "entropy": 5.351178503036499, "epoch": 7.25979381443299, "grad_norm": 1.421875, "learning_rate": 0.0001294778424871948, "loss": 4.5996, "mean_token_accuracy": 0.24369374215602874, "num_tokens": 161839096.0, "step": 93310 }, { "entropy": 5.277793884277344, "epoch": 7.260182843804707, "grad_norm": 1.4140625, "learning_rate": 0.00012945670521133802, "loss": 4.4574, "mean_token_accuracy": 0.2554700434207916, "num_tokens": 161847951.0, "step": 93315 }, { "entropy": 5.367852687835693, "epoch": 7.260571873176425, "grad_norm": 1.4140625, "learning_rate": 0.00012943557014386898, "loss": 4.6289, "mean_token_accuracy": 0.2517382323741913, "num_tokens": 161856228.0, "step": 93320 }, { "entropy": 5.414979028701782, "epoch": 7.260960902548143, "grad_norm": 1.3671875, "learning_rate": 0.00012941443728510855, "loss": 4.682, "mean_token_accuracy": 0.24199674874544144, "num_tokens": 161864890.0, "step": 93325 }, { "entropy": 5.409875535964966, "epoch": 7.26134993191986, "grad_norm": 1.3984375, "learning_rate": 0.00012939330663537725, "loss": 4.6231, "mean_token_accuracy": 0.24039355516433716, "num_tokens": 161872864.0, "step": 93330 }, { "entropy": 5.369995546340943, "epoch": 7.261738961291577, "grad_norm": 1.3828125, "learning_rate": 0.00012937217819499575, "loss": 4.6239, "mean_token_accuracy": 0.24475659281015397, "num_tokens": 161881142.0, "step": 93335 }, { "entropy": 5.394140148162842, "epoch": 7.262127990663295, "grad_norm": 1.3203125, "learning_rate": 0.00012935105196428475, "loss": 4.679, "mean_token_accuracy": 0.24490994364023208, "num_tokens": 161890103.0, "step": 93340 }, { "entropy": 5.344478559494019, "epoch": 7.262517020035013, "grad_norm": 1.4609375, "learning_rate": 0.00012932992794356462, "loss": 4.5089, "mean_token_accuracy": 0.2574861317873001, "num_tokens": 161898495.0, "step": 93345 }, { "entropy": 5.40095362663269, "epoch": 7.26290604940673, "grad_norm": 1.28125, "learning_rate": 0.00012930880613315607, "loss": 4.618, "mean_token_accuracy": 0.24594858288764954, "num_tokens": 161906600.0, "step": 93350 }, { "entropy": 5.400445365905762, "epoch": 7.263295078778448, "grad_norm": 1.328125, "learning_rate": 0.00012928768653337947, "loss": 4.6579, "mean_token_accuracy": 0.2433096319437027, "num_tokens": 161914967.0, "step": 93355 }, { "entropy": 5.447196054458618, "epoch": 7.263684108150166, "grad_norm": 1.453125, "learning_rate": 0.00012926656914455525, "loss": 4.7206, "mean_token_accuracy": 0.2378399446606636, "num_tokens": 161923699.0, "step": 93360 }, { "entropy": 5.4417140007019045, "epoch": 7.2640731375218826, "grad_norm": 1.484375, "learning_rate": 0.00012924545396700394, "loss": 4.6627, "mean_token_accuracy": 0.2346501886844635, "num_tokens": 161931912.0, "step": 93365 }, { "entropy": 5.378168106079102, "epoch": 7.2644621668936, "grad_norm": 1.4296875, "learning_rate": 0.0001292243410010458, "loss": 4.6069, "mean_token_accuracy": 0.24344323128461837, "num_tokens": 161940405.0, "step": 93370 }, { "entropy": 5.3612902641296385, "epoch": 7.264851196265318, "grad_norm": 1.3984375, "learning_rate": 0.00012920323024700133, "loss": 4.5939, "mean_token_accuracy": 0.25001506209373475, "num_tokens": 161948943.0, "step": 93375 }, { "entropy": 5.330392694473266, "epoch": 7.265240225637036, "grad_norm": 1.390625, "learning_rate": 0.00012918212170519072, "loss": 4.5455, "mean_token_accuracy": 0.25500842183828354, "num_tokens": 161956951.0, "step": 93380 }, { "entropy": 5.349444723129272, "epoch": 7.265629255008753, "grad_norm": 1.3359375, "learning_rate": 0.0001291610153759344, "loss": 4.5728, "mean_token_accuracy": 0.24413973689079285, "num_tokens": 161965267.0, "step": 93385 }, { "entropy": 5.342901563644409, "epoch": 7.266018284380471, "grad_norm": 1.3203125, "learning_rate": 0.0001291399112595525, "loss": 4.5404, "mean_token_accuracy": 0.2545383632183075, "num_tokens": 161972788.0, "step": 93390 }, { "entropy": 5.377701616287231, "epoch": 7.266407313752188, "grad_norm": 1.2421875, "learning_rate": 0.00012911880935636522, "loss": 4.6302, "mean_token_accuracy": 0.2427387297153473, "num_tokens": 161982273.0, "step": 93395 }, { "entropy": 5.354363441467285, "epoch": 7.2667963431239055, "grad_norm": 1.4296875, "learning_rate": 0.00012909770966669292, "loss": 4.5795, "mean_token_accuracy": 0.24795849174261092, "num_tokens": 161991222.0, "step": 93400 }, { "entropy": 5.397664976119995, "epoch": 7.267185372495623, "grad_norm": 1.40625, "learning_rate": 0.0001290766121908556, "loss": 4.6531, "mean_token_accuracy": 0.24305486530065537, "num_tokens": 162000329.0, "step": 93405 }, { "entropy": 5.274490547180176, "epoch": 7.267574401867341, "grad_norm": 1.3203125, "learning_rate": 0.00012905551692917345, "loss": 4.4913, "mean_token_accuracy": 0.26493613570928576, "num_tokens": 162009119.0, "step": 93410 }, { "entropy": 5.487717485427856, "epoch": 7.267963431239059, "grad_norm": 1.5078125, "learning_rate": 0.0001290344238819665, "loss": 4.7127, "mean_token_accuracy": 0.24073898494243623, "num_tokens": 162017743.0, "step": 93415 }, { "entropy": 5.394275426864624, "epoch": 7.268352460610776, "grad_norm": 1.3984375, "learning_rate": 0.00012901333304955487, "loss": 4.629, "mean_token_accuracy": 0.2452261745929718, "num_tokens": 162026091.0, "step": 93420 }, { "entropy": 5.308052253723145, "epoch": 7.268741489982494, "grad_norm": 1.3828125, "learning_rate": 0.00012899224443225853, "loss": 4.6075, "mean_token_accuracy": 0.24434154331684113, "num_tokens": 162035366.0, "step": 93425 }, { "entropy": 5.379477071762085, "epoch": 7.269130519354211, "grad_norm": 1.265625, "learning_rate": 0.00012897115803039752, "loss": 4.625, "mean_token_accuracy": 0.2426157847046852, "num_tokens": 162044229.0, "step": 93430 }, { "entropy": 5.313031435012817, "epoch": 7.2695195487259285, "grad_norm": 1.2734375, "learning_rate": 0.00012895007384429178, "loss": 4.5771, "mean_token_accuracy": 0.251587949693203, "num_tokens": 162053650.0, "step": 93435 }, { "entropy": 5.3820047855377195, "epoch": 7.269908578097646, "grad_norm": 1.5859375, "learning_rate": 0.0001289289918742611, "loss": 4.5603, "mean_token_accuracy": 0.2584817498922348, "num_tokens": 162063033.0, "step": 93440 }, { "entropy": 5.300290203094482, "epoch": 7.270297607469364, "grad_norm": 1.3046875, "learning_rate": 0.0001289079121206256, "loss": 4.6089, "mean_token_accuracy": 0.25136625170707705, "num_tokens": 162072650.0, "step": 93445 }, { "entropy": 5.480862855911255, "epoch": 7.270686636841082, "grad_norm": 1.4453125, "learning_rate": 0.00012888683458370492, "loss": 4.7159, "mean_token_accuracy": 0.2363581359386444, "num_tokens": 162081106.0, "step": 93450 }, { "entropy": 5.341135501861572, "epoch": 7.271075666212799, "grad_norm": 1.3203125, "learning_rate": 0.000128865759263819, "loss": 4.5825, "mean_token_accuracy": 0.2511118933558464, "num_tokens": 162089652.0, "step": 93455 }, { "entropy": 5.300408220291137, "epoch": 7.271464695584517, "grad_norm": 1.3828125, "learning_rate": 0.00012884468616128749, "loss": 4.4903, "mean_token_accuracy": 0.25939127802848816, "num_tokens": 162097791.0, "step": 93460 }, { "entropy": 5.4042867660522464, "epoch": 7.271853724956234, "grad_norm": 1.328125, "learning_rate": 0.00012882361527643033, "loss": 4.6572, "mean_token_accuracy": 0.24083279818296432, "num_tokens": 162105997.0, "step": 93465 }, { "entropy": 5.2898821353912355, "epoch": 7.2722427543279515, "grad_norm": 1.453125, "learning_rate": 0.00012880254660956714, "loss": 4.5549, "mean_token_accuracy": 0.25347730964422227, "num_tokens": 162114403.0, "step": 93470 }, { "entropy": 5.361013793945313, "epoch": 7.272631783699669, "grad_norm": 1.4609375, "learning_rate": 0.0001287814801610176, "loss": 4.6227, "mean_token_accuracy": 0.24590259194374084, "num_tokens": 162123511.0, "step": 93475 }, { "entropy": 5.313603353500366, "epoch": 7.273020813071387, "grad_norm": 1.5, "learning_rate": 0.0001287604159311014, "loss": 4.5608, "mean_token_accuracy": 0.2522977113723755, "num_tokens": 162132050.0, "step": 93480 }, { "entropy": 5.377662801742554, "epoch": 7.273409842443105, "grad_norm": 1.453125, "learning_rate": 0.00012873935392013804, "loss": 4.5725, "mean_token_accuracy": 0.2519827738404274, "num_tokens": 162140110.0, "step": 93485 }, { "entropy": 5.3529825687408445, "epoch": 7.273798871814822, "grad_norm": 1.40625, "learning_rate": 0.00012871829412844726, "loss": 4.6137, "mean_token_accuracy": 0.24381026178598403, "num_tokens": 162148759.0, "step": 93490 }, { "entropy": 5.314110565185547, "epoch": 7.27418790118654, "grad_norm": 1.4375, "learning_rate": 0.0001286972365563485, "loss": 4.5418, "mean_token_accuracy": 0.25211970657110216, "num_tokens": 162156913.0, "step": 93495 }, { "entropy": 5.402555131912232, "epoch": 7.274576930558257, "grad_norm": 1.4140625, "learning_rate": 0.00012867618120416136, "loss": 4.6426, "mean_token_accuracy": 0.24447511583566667, "num_tokens": 162166514.0, "step": 93500 }, { "entropy": 5.361934995651245, "epoch": 7.2749659599299745, "grad_norm": 1.25, "learning_rate": 0.0001286551280722052, "loss": 4.5827, "mean_token_accuracy": 0.25179579854011536, "num_tokens": 162175474.0, "step": 93505 }, { "entropy": 5.385845804214478, "epoch": 7.275354989301692, "grad_norm": 1.3203125, "learning_rate": 0.00012863407716079962, "loss": 4.6607, "mean_token_accuracy": 0.24399127960205078, "num_tokens": 162184485.0, "step": 93510 }, { "entropy": 5.426646566390991, "epoch": 7.27574401867341, "grad_norm": 1.2734375, "learning_rate": 0.00012861302847026393, "loss": 4.7119, "mean_token_accuracy": 0.23900941908359527, "num_tokens": 162193251.0, "step": 93515 }, { "entropy": 5.445105791091919, "epoch": 7.276133048045128, "grad_norm": 1.3203125, "learning_rate": 0.0001285919820009175, "loss": 4.6795, "mean_token_accuracy": 0.24055661261081696, "num_tokens": 162201676.0, "step": 93520 }, { "entropy": 5.372499465942383, "epoch": 7.276522077416845, "grad_norm": 1.390625, "learning_rate": 0.00012857093775307975, "loss": 4.6222, "mean_token_accuracy": 0.24343554079532623, "num_tokens": 162210531.0, "step": 93525 }, { "entropy": 5.3678178787231445, "epoch": 7.276911106788562, "grad_norm": 1.375, "learning_rate": 0.00012854989572706982, "loss": 4.5958, "mean_token_accuracy": 0.2453724279999733, "num_tokens": 162219733.0, "step": 93530 }, { "entropy": 5.416921949386596, "epoch": 7.27730013616028, "grad_norm": 1.3671875, "learning_rate": 0.00012852885592320724, "loss": 4.6539, "mean_token_accuracy": 0.247358737885952, "num_tokens": 162228793.0, "step": 93535 }, { "entropy": 5.408203601837158, "epoch": 7.2776891655319975, "grad_norm": 1.3671875, "learning_rate": 0.0001285078183418111, "loss": 4.6426, "mean_token_accuracy": 0.24388593435287476, "num_tokens": 162237927.0, "step": 93540 }, { "entropy": 5.370429944992066, "epoch": 7.278078194903715, "grad_norm": 1.375, "learning_rate": 0.0001284867829832007, "loss": 4.5506, "mean_token_accuracy": 0.2460001990199089, "num_tokens": 162246581.0, "step": 93545 }, { "entropy": 5.329010486602783, "epoch": 7.278467224275433, "grad_norm": 1.390625, "learning_rate": 0.00012846574984769522, "loss": 4.6015, "mean_token_accuracy": 0.2515176981687546, "num_tokens": 162255193.0, "step": 93550 }, { "entropy": 5.365826749801636, "epoch": 7.278856253647151, "grad_norm": 1.375, "learning_rate": 0.0001284447189356136, "loss": 4.5395, "mean_token_accuracy": 0.24620168656110764, "num_tokens": 162263684.0, "step": 93555 }, { "entropy": 5.435653924942017, "epoch": 7.279245283018868, "grad_norm": 1.4765625, "learning_rate": 0.00012842369024727523, "loss": 4.7185, "mean_token_accuracy": 0.2361210137605667, "num_tokens": 162272137.0, "step": 93560 }, { "entropy": 5.3710143089294435, "epoch": 7.279634312390585, "grad_norm": 1.3984375, "learning_rate": 0.00012840266378299898, "loss": 4.6362, "mean_token_accuracy": 0.24721072614192963, "num_tokens": 162280802.0, "step": 93565 }, { "entropy": 5.383084154129028, "epoch": 7.280023341762303, "grad_norm": 1.5390625, "learning_rate": 0.00012838163954310405, "loss": 4.5932, "mean_token_accuracy": 0.2464805468916893, "num_tokens": 162288758.0, "step": 93570 }, { "entropy": 5.454525327682495, "epoch": 7.2804123711340205, "grad_norm": 1.4296875, "learning_rate": 0.00012836061752790929, "loss": 4.6637, "mean_token_accuracy": 0.23232460021972656, "num_tokens": 162297324.0, "step": 93575 }, { "entropy": 5.333440685272217, "epoch": 7.280801400505738, "grad_norm": 1.46875, "learning_rate": 0.00012833959773773384, "loss": 4.5429, "mean_token_accuracy": 0.2443806752562523, "num_tokens": 162305309.0, "step": 93580 }, { "entropy": 5.34431414604187, "epoch": 7.281190429877456, "grad_norm": 1.2734375, "learning_rate": 0.00012831858017289647, "loss": 4.5616, "mean_token_accuracy": 0.2477089822292328, "num_tokens": 162314364.0, "step": 93585 }, { "entropy": 5.323424434661865, "epoch": 7.281579459249174, "grad_norm": 1.3828125, "learning_rate": 0.0001282975648337163, "loss": 4.5361, "mean_token_accuracy": 0.24524455964565278, "num_tokens": 162322821.0, "step": 93590 }, { "entropy": 5.3863636493682865, "epoch": 7.28196848862089, "grad_norm": 1.46875, "learning_rate": 0.00012827655172051194, "loss": 4.6566, "mean_token_accuracy": 0.23839305192232133, "num_tokens": 162331443.0, "step": 93595 }, { "entropy": 5.3014092445373535, "epoch": 7.282357517992608, "grad_norm": 1.390625, "learning_rate": 0.0001282555408336024, "loss": 4.4503, "mean_token_accuracy": 0.25749406069517133, "num_tokens": 162339560.0, "step": 93600 }, { "entropy": 5.3786157131195065, "epoch": 7.282746547364326, "grad_norm": 1.421875, "learning_rate": 0.00012823453217330655, "loss": 4.6588, "mean_token_accuracy": 0.24155599474906922, "num_tokens": 162348207.0, "step": 93605 }, { "entropy": 5.362637281417847, "epoch": 7.2831355767360435, "grad_norm": 1.3984375, "learning_rate": 0.000128213525739943, "loss": 4.533, "mean_token_accuracy": 0.25910462290048597, "num_tokens": 162356336.0, "step": 93610 }, { "entropy": 5.384792995452881, "epoch": 7.283524606107761, "grad_norm": 1.375, "learning_rate": 0.0001281925215338306, "loss": 4.5894, "mean_token_accuracy": 0.24695801138877868, "num_tokens": 162364619.0, "step": 93615 }, { "entropy": 5.3533693790435795, "epoch": 7.283913635479479, "grad_norm": 1.34375, "learning_rate": 0.00012817151955528796, "loss": 4.611, "mean_token_accuracy": 0.24998821914196015, "num_tokens": 162373526.0, "step": 93620 }, { "entropy": 5.266763210296631, "epoch": 7.284302664851197, "grad_norm": 1.4453125, "learning_rate": 0.0001281505198046339, "loss": 4.4793, "mean_token_accuracy": 0.25037487149238585, "num_tokens": 162381981.0, "step": 93625 }, { "entropy": 5.378292608261108, "epoch": 7.284691694222914, "grad_norm": 1.40625, "learning_rate": 0.000128129522282187, "loss": 4.5752, "mean_token_accuracy": 0.24290703386068344, "num_tokens": 162390003.0, "step": 93630 }, { "entropy": 5.343885803222657, "epoch": 7.285080723594631, "grad_norm": 1.4296875, "learning_rate": 0.0001281085269882657, "loss": 4.5152, "mean_token_accuracy": 0.2545665234327316, "num_tokens": 162398699.0, "step": 93635 }, { "entropy": 5.254929733276367, "epoch": 7.285469752966349, "grad_norm": 1.3125, "learning_rate": 0.0001280875339231888, "loss": 4.5085, "mean_token_accuracy": 0.25459733307361604, "num_tokens": 162407268.0, "step": 93640 }, { "entropy": 5.33442907333374, "epoch": 7.2858587823380665, "grad_norm": 1.2265625, "learning_rate": 0.00012806654308727462, "loss": 4.5619, "mean_token_accuracy": 0.25379718840122223, "num_tokens": 162416439.0, "step": 93645 }, { "entropy": 5.334119462966919, "epoch": 7.286247811709784, "grad_norm": 1.40625, "learning_rate": 0.0001280455544808419, "loss": 4.6599, "mean_token_accuracy": 0.23769280463457107, "num_tokens": 162425348.0, "step": 93650 }, { "entropy": 5.231319999694824, "epoch": 7.286636841081502, "grad_norm": 1.3515625, "learning_rate": 0.0001280245681042089, "loss": 4.4369, "mean_token_accuracy": 0.264738492667675, "num_tokens": 162433790.0, "step": 93655 }, { "entropy": 5.3592901706695555, "epoch": 7.28702587045322, "grad_norm": 1.390625, "learning_rate": 0.00012800358395769412, "loss": 4.6262, "mean_token_accuracy": 0.23720459043979644, "num_tokens": 162442843.0, "step": 93660 }, { "entropy": 5.296915817260742, "epoch": 7.287414899824936, "grad_norm": 1.3828125, "learning_rate": 0.0001279826020416161, "loss": 4.5451, "mean_token_accuracy": 0.25168350636959075, "num_tokens": 162451888.0, "step": 93665 }, { "entropy": 5.427657747268677, "epoch": 7.287803929196654, "grad_norm": 1.453125, "learning_rate": 0.000127961622356293, "loss": 4.645, "mean_token_accuracy": 0.24339783042669297, "num_tokens": 162460744.0, "step": 93670 }, { "entropy": 5.3516443252563475, "epoch": 7.288192958568372, "grad_norm": 1.375, "learning_rate": 0.00012794064490204333, "loss": 4.5796, "mean_token_accuracy": 0.24696160554885865, "num_tokens": 162469115.0, "step": 93675 }, { "entropy": 5.3333296298980715, "epoch": 7.2885819879400895, "grad_norm": 1.421875, "learning_rate": 0.00012791966967918523, "loss": 4.5525, "mean_token_accuracy": 0.24592935293912888, "num_tokens": 162477598.0, "step": 93680 }, { "entropy": 5.39199538230896, "epoch": 7.288971017311807, "grad_norm": 1.546875, "learning_rate": 0.0001278986966880371, "loss": 4.603, "mean_token_accuracy": 0.24908401370048522, "num_tokens": 162485880.0, "step": 93685 }, { "entropy": 5.343863248825073, "epoch": 7.289360046683525, "grad_norm": 1.375, "learning_rate": 0.00012787772592891703, "loss": 4.5583, "mean_token_accuracy": 0.24881335496902465, "num_tokens": 162493784.0, "step": 93690 }, { "entropy": 5.274034309387207, "epoch": 7.289749076055243, "grad_norm": 1.234375, "learning_rate": 0.0001278567574021434, "loss": 4.492, "mean_token_accuracy": 0.26425474137067795, "num_tokens": 162502630.0, "step": 93695 }, { "entropy": 5.392499828338623, "epoch": 7.290138105426959, "grad_norm": 1.421875, "learning_rate": 0.00012783579110803417, "loss": 4.6321, "mean_token_accuracy": 0.24215712100267411, "num_tokens": 162511250.0, "step": 93700 }, { "entropy": 5.3459662914276125, "epoch": 7.290527134798677, "grad_norm": 1.3125, "learning_rate": 0.00012781482704690768, "loss": 4.5469, "mean_token_accuracy": 0.24679122865200043, "num_tokens": 162519979.0, "step": 93705 }, { "entropy": 5.380033254623413, "epoch": 7.290916164170395, "grad_norm": 1.3203125, "learning_rate": 0.00012779386521908194, "loss": 4.5684, "mean_token_accuracy": 0.25042191594839097, "num_tokens": 162529128.0, "step": 93710 }, { "entropy": 5.376624202728271, "epoch": 7.2913051935421125, "grad_norm": 1.3671875, "learning_rate": 0.00012777290562487488, "loss": 4.632, "mean_token_accuracy": 0.24071722477674484, "num_tokens": 162537933.0, "step": 93715 }, { "entropy": 5.38666262626648, "epoch": 7.29169422291383, "grad_norm": 1.4140625, "learning_rate": 0.00012775194826460467, "loss": 4.6551, "mean_token_accuracy": 0.2382311850786209, "num_tokens": 162546971.0, "step": 93720 }, { "entropy": 5.3483030796051025, "epoch": 7.292083252285548, "grad_norm": 1.515625, "learning_rate": 0.00012773099313858927, "loss": 4.6207, "mean_token_accuracy": 0.23936288356781005, "num_tokens": 162555811.0, "step": 93725 }, { "entropy": 5.413087606430054, "epoch": 7.292472281657265, "grad_norm": 1.3515625, "learning_rate": 0.0001277100402471466, "loss": 4.6195, "mean_token_accuracy": 0.24625207036733626, "num_tokens": 162564824.0, "step": 93730 }, { "entropy": 5.352571821212768, "epoch": 7.292861311028982, "grad_norm": 1.4375, "learning_rate": 0.00012768908959059477, "loss": 4.4897, "mean_token_accuracy": 0.2502407118678093, "num_tokens": 162572317.0, "step": 93735 }, { "entropy": 5.366762447357178, "epoch": 7.2932503404007, "grad_norm": 1.4140625, "learning_rate": 0.00012766814116925142, "loss": 4.5876, "mean_token_accuracy": 0.24714734852313996, "num_tokens": 162580606.0, "step": 93740 }, { "entropy": 5.291939640045166, "epoch": 7.293639369772418, "grad_norm": 1.4453125, "learning_rate": 0.00012764719498343464, "loss": 4.5375, "mean_token_accuracy": 0.25012839436531065, "num_tokens": 162589694.0, "step": 93745 }, { "entropy": 5.277828884124756, "epoch": 7.2940283991441355, "grad_norm": 1.46875, "learning_rate": 0.000127626251033462, "loss": 4.5048, "mean_token_accuracy": 0.25645933002233506, "num_tokens": 162597867.0, "step": 93750 }, { "entropy": 5.355414819717407, "epoch": 7.294417428515853, "grad_norm": 1.3125, "learning_rate": 0.00012760530931965153, "loss": 4.6515, "mean_token_accuracy": 0.2421593874692917, "num_tokens": 162606685.0, "step": 93755 }, { "entropy": 5.443055438995361, "epoch": 7.294806457887571, "grad_norm": 1.453125, "learning_rate": 0.00012758436984232083, "loss": 4.7573, "mean_token_accuracy": 0.2316468194127083, "num_tokens": 162615565.0, "step": 93760 }, { "entropy": 5.336056756973266, "epoch": 7.295195487259288, "grad_norm": 1.421875, "learning_rate": 0.00012756343260178775, "loss": 4.514, "mean_token_accuracy": 0.2550398349761963, "num_tokens": 162623595.0, "step": 93765 }, { "entropy": 5.394806623458862, "epoch": 7.295584516631005, "grad_norm": 1.3671875, "learning_rate": 0.00012754249759836984, "loss": 4.5785, "mean_token_accuracy": 0.24844130575656892, "num_tokens": 162631797.0, "step": 93770 }, { "entropy": 5.414483547210693, "epoch": 7.295973546002723, "grad_norm": 1.40625, "learning_rate": 0.0001275215648323849, "loss": 4.5759, "mean_token_accuracy": 0.24719517379999162, "num_tokens": 162640333.0, "step": 93775 }, { "entropy": 5.459576940536499, "epoch": 7.296362575374441, "grad_norm": 1.375, "learning_rate": 0.00012750063430415036, "loss": 4.7288, "mean_token_accuracy": 0.2347236081957817, "num_tokens": 162649162.0, "step": 93780 }, { "entropy": 5.338545227050782, "epoch": 7.2967516047461585, "grad_norm": 1.484375, "learning_rate": 0.00012747970601398407, "loss": 4.5808, "mean_token_accuracy": 0.2431936651468277, "num_tokens": 162657782.0, "step": 93785 }, { "entropy": 5.383843183517456, "epoch": 7.297140634117876, "grad_norm": 1.328125, "learning_rate": 0.0001274587799622034, "loss": 4.5841, "mean_token_accuracy": 0.2429990604519844, "num_tokens": 162666252.0, "step": 93790 }, { "entropy": 5.334454774856567, "epoch": 7.297529663489594, "grad_norm": 1.3359375, "learning_rate": 0.00012743785614912576, "loss": 4.5983, "mean_token_accuracy": 0.2513753712177277, "num_tokens": 162675328.0, "step": 93795 }, { "entropy": 5.343678569793701, "epoch": 7.297918692861311, "grad_norm": 1.296875, "learning_rate": 0.00012741693457506893, "loss": 4.5701, "mean_token_accuracy": 0.24483009576797485, "num_tokens": 162683933.0, "step": 93800 }, { "entropy": 5.399790668487549, "epoch": 7.298307722233028, "grad_norm": 1.3046875, "learning_rate": 0.00012739601524035013, "loss": 4.661, "mean_token_accuracy": 0.24368840903043748, "num_tokens": 162692937.0, "step": 93805 }, { "entropy": 5.268685674667358, "epoch": 7.298696751604746, "grad_norm": 1.3828125, "learning_rate": 0.00012737509814528697, "loss": 4.4896, "mean_token_accuracy": 0.25580201148986814, "num_tokens": 162702568.0, "step": 93810 }, { "entropy": 5.427707147598267, "epoch": 7.299085780976464, "grad_norm": 1.3671875, "learning_rate": 0.0001273541832901967, "loss": 4.6869, "mean_token_accuracy": 0.232516285777092, "num_tokens": 162710826.0, "step": 93815 }, { "entropy": 5.417893266677856, "epoch": 7.2994748103481815, "grad_norm": 1.5390625, "learning_rate": 0.00012733327067539663, "loss": 4.6342, "mean_token_accuracy": 0.24155422151088715, "num_tokens": 162720066.0, "step": 93820 }, { "entropy": 5.341436147689819, "epoch": 7.299863839719899, "grad_norm": 1.3984375, "learning_rate": 0.0001273123603012042, "loss": 4.6146, "mean_token_accuracy": 0.24349660128355027, "num_tokens": 162729164.0, "step": 93825 }, { "entropy": 5.359644794464112, "epoch": 7.300252869091617, "grad_norm": 1.3515625, "learning_rate": 0.0001272914521679366, "loss": 4.5884, "mean_token_accuracy": 0.23897091895341874, "num_tokens": 162737897.0, "step": 93830 }, { "entropy": 5.350044679641724, "epoch": 7.300641898463334, "grad_norm": 1.34375, "learning_rate": 0.00012727054627591116, "loss": 4.6103, "mean_token_accuracy": 0.2448935851454735, "num_tokens": 162747153.0, "step": 93835 }, { "entropy": 5.355051422119141, "epoch": 7.301030927835051, "grad_norm": 1.3984375, "learning_rate": 0.000127249642625445, "loss": 4.5954, "mean_token_accuracy": 0.2443198710680008, "num_tokens": 162755658.0, "step": 93840 }, { "entropy": 5.401859712600708, "epoch": 7.301419957206769, "grad_norm": 1.4140625, "learning_rate": 0.00012722874121685534, "loss": 4.5909, "mean_token_accuracy": 0.248111492395401, "num_tokens": 162763254.0, "step": 93845 }, { "entropy": 5.388643264770508, "epoch": 7.301808986578487, "grad_norm": 1.3671875, "learning_rate": 0.00012720784205045934, "loss": 4.5735, "mean_token_accuracy": 0.24981037974357606, "num_tokens": 162771609.0, "step": 93850 }, { "entropy": 5.313520288467407, "epoch": 7.3021980159502045, "grad_norm": 1.453125, "learning_rate": 0.00012718694512657414, "loss": 4.5516, "mean_token_accuracy": 0.2485866814851761, "num_tokens": 162780077.0, "step": 93855 }, { "entropy": 5.348296213150024, "epoch": 7.302587045321922, "grad_norm": 1.4609375, "learning_rate": 0.00012716605044551672, "loss": 4.6002, "mean_token_accuracy": 0.2487013131380081, "num_tokens": 162788393.0, "step": 93860 }, { "entropy": 5.47361650466919, "epoch": 7.302976074693639, "grad_norm": 1.4765625, "learning_rate": 0.00012714515800760416, "loss": 4.6503, "mean_token_accuracy": 0.2346815899014473, "num_tokens": 162796549.0, "step": 93865 }, { "entropy": 5.404931592941284, "epoch": 7.303365104065357, "grad_norm": 1.3828125, "learning_rate": 0.00012712426781315357, "loss": 4.6618, "mean_token_accuracy": 0.2411891594529152, "num_tokens": 162805401.0, "step": 93870 }, { "entropy": 5.405546951293945, "epoch": 7.303754133437074, "grad_norm": 1.359375, "learning_rate": 0.0001271033798624818, "loss": 4.663, "mean_token_accuracy": 0.2372954547405243, "num_tokens": 162814108.0, "step": 93875 }, { "entropy": 5.3753767013549805, "epoch": 7.304143162808792, "grad_norm": 1.4375, "learning_rate": 0.00012708249415590588, "loss": 4.5822, "mean_token_accuracy": 0.24128783941268922, "num_tokens": 162822373.0, "step": 93880 }, { "entropy": 5.428216600418091, "epoch": 7.30453219218051, "grad_norm": 1.359375, "learning_rate": 0.0001270616106937426, "loss": 4.6502, "mean_token_accuracy": 0.2408711791038513, "num_tokens": 162830772.0, "step": 93885 }, { "entropy": 5.318695974349976, "epoch": 7.3049212215522275, "grad_norm": 1.3359375, "learning_rate": 0.000127040729476309, "loss": 4.5697, "mean_token_accuracy": 0.24698079377412796, "num_tokens": 162839992.0, "step": 93890 }, { "entropy": 5.443019151687622, "epoch": 7.305310250923945, "grad_norm": 1.4453125, "learning_rate": 0.00012701985050392185, "loss": 4.6612, "mean_token_accuracy": 0.24559315145015717, "num_tokens": 162848949.0, "step": 93895 }, { "entropy": 5.4101423740386965, "epoch": 7.305699280295662, "grad_norm": 1.46875, "learning_rate": 0.00012699897377689784, "loss": 4.5763, "mean_token_accuracy": 0.2527389720082283, "num_tokens": 162857084.0, "step": 93900 }, { "entropy": 5.419390392303467, "epoch": 7.30608830966738, "grad_norm": 1.4140625, "learning_rate": 0.00012697809929555388, "loss": 4.643, "mean_token_accuracy": 0.2433452323079109, "num_tokens": 162866207.0, "step": 93905 }, { "entropy": 5.350918388366699, "epoch": 7.306477339039097, "grad_norm": 1.359375, "learning_rate": 0.00012695722706020663, "loss": 4.5796, "mean_token_accuracy": 0.2502825438976288, "num_tokens": 162874016.0, "step": 93910 }, { "entropy": 5.303159570693969, "epoch": 7.306866368410815, "grad_norm": 1.3203125, "learning_rate": 0.00012693635707117291, "loss": 4.5474, "mean_token_accuracy": 0.24673781394958497, "num_tokens": 162883143.0, "step": 93915 }, { "entropy": 5.227814435958862, "epoch": 7.307255397782533, "grad_norm": 1.296875, "learning_rate": 0.00012691548932876917, "loss": 4.4446, "mean_token_accuracy": 0.2518265262246132, "num_tokens": 162891548.0, "step": 93920 }, { "entropy": 5.356292247772217, "epoch": 7.30764442715425, "grad_norm": 1.375, "learning_rate": 0.00012689462383331222, "loss": 4.6097, "mean_token_accuracy": 0.24886824786663056, "num_tokens": 162899866.0, "step": 93925 }, { "entropy": 5.289357233047485, "epoch": 7.308033456525967, "grad_norm": 1.2265625, "learning_rate": 0.00012687376058511868, "loss": 4.5236, "mean_token_accuracy": 0.25425864160060885, "num_tokens": 162908887.0, "step": 93930 }, { "entropy": 5.338607740402222, "epoch": 7.308422485897685, "grad_norm": 1.3984375, "learning_rate": 0.000126852899584505, "loss": 4.5665, "mean_token_accuracy": 0.24844253063201904, "num_tokens": 162916806.0, "step": 93935 }, { "entropy": 5.387065696716308, "epoch": 7.308811515269403, "grad_norm": 1.3203125, "learning_rate": 0.00012683204083178786, "loss": 4.6334, "mean_token_accuracy": 0.2447605848312378, "num_tokens": 162925767.0, "step": 93940 }, { "entropy": 5.346244239807129, "epoch": 7.30920054464112, "grad_norm": 1.390625, "learning_rate": 0.00012681118432728353, "loss": 4.5741, "mean_token_accuracy": 0.24965574443340302, "num_tokens": 162934240.0, "step": 93945 }, { "entropy": 5.400351238250733, "epoch": 7.309589574012838, "grad_norm": 1.3359375, "learning_rate": 0.00012679033007130872, "loss": 4.623, "mean_token_accuracy": 0.24179142266511916, "num_tokens": 162943838.0, "step": 93950 }, { "entropy": 5.389816474914551, "epoch": 7.309978603384556, "grad_norm": 1.4765625, "learning_rate": 0.00012676947806417965, "loss": 4.5988, "mean_token_accuracy": 0.247365865111351, "num_tokens": 162952097.0, "step": 93955 }, { "entropy": 5.352571105957031, "epoch": 7.310367632756273, "grad_norm": 1.4296875, "learning_rate": 0.00012674862830621293, "loss": 4.6207, "mean_token_accuracy": 0.23930107802152634, "num_tokens": 162960648.0, "step": 93960 }, { "entropy": 5.415088701248169, "epoch": 7.310756662127991, "grad_norm": 1.3125, "learning_rate": 0.00012672778079772474, "loss": 4.6664, "mean_token_accuracy": 0.23732315599918366, "num_tokens": 162969119.0, "step": 93965 }, { "entropy": 5.400457429885864, "epoch": 7.311145691499708, "grad_norm": 1.3046875, "learning_rate": 0.0001267069355390315, "loss": 4.6006, "mean_token_accuracy": 0.24561842978000642, "num_tokens": 162978287.0, "step": 93970 }, { "entropy": 5.31756739616394, "epoch": 7.311534720871426, "grad_norm": 1.3828125, "learning_rate": 0.00012668609253044952, "loss": 4.5793, "mean_token_accuracy": 0.244005386531353, "num_tokens": 162986720.0, "step": 93975 }, { "entropy": 5.383456897735596, "epoch": 7.311923750243143, "grad_norm": 1.3203125, "learning_rate": 0.00012666525177229494, "loss": 4.5717, "mean_token_accuracy": 0.24326060861349105, "num_tokens": 162994774.0, "step": 93980 }, { "entropy": 5.374219179153442, "epoch": 7.312312779614861, "grad_norm": 1.4375, "learning_rate": 0.00012664441326488412, "loss": 4.6565, "mean_token_accuracy": 0.24258837550878526, "num_tokens": 163003274.0, "step": 93985 }, { "entropy": 5.329337549209595, "epoch": 7.312701808986579, "grad_norm": 1.2578125, "learning_rate": 0.00012662357700853315, "loss": 4.5939, "mean_token_accuracy": 0.24615825563669205, "num_tokens": 163012431.0, "step": 93990 }, { "entropy": 5.364320373535156, "epoch": 7.313090838358296, "grad_norm": 1.3984375, "learning_rate": 0.00012660274300355822, "loss": 4.6734, "mean_token_accuracy": 0.23605892360210418, "num_tokens": 163021394.0, "step": 93995 }, { "entropy": 5.436716938018799, "epoch": 7.313479867730013, "grad_norm": 1.21875, "learning_rate": 0.00012658191125027547, "loss": 4.6766, "mean_token_accuracy": 0.23759645968675613, "num_tokens": 163030512.0, "step": 94000 }, { "entropy": 5.4383526802062985, "epoch": 7.313868897101731, "grad_norm": 1.484375, "learning_rate": 0.00012656108174900104, "loss": 4.6133, "mean_token_accuracy": 0.23983788043260573, "num_tokens": 163038427.0, "step": 94005 }, { "entropy": 5.267654800415039, "epoch": 7.314257926473449, "grad_norm": 1.34375, "learning_rate": 0.00012654025450005096, "loss": 4.4597, "mean_token_accuracy": 0.2626446411013603, "num_tokens": 163046923.0, "step": 94010 }, { "entropy": 5.379391145706177, "epoch": 7.314646955845166, "grad_norm": 1.3359375, "learning_rate": 0.00012651942950374115, "loss": 4.6518, "mean_token_accuracy": 0.2375599578022957, "num_tokens": 163055720.0, "step": 94015 }, { "entropy": 5.347490978240967, "epoch": 7.315035985216884, "grad_norm": 1.3125, "learning_rate": 0.0001264986067603877, "loss": 4.5721, "mean_token_accuracy": 0.24959192276000977, "num_tokens": 163065132.0, "step": 94020 }, { "entropy": 5.328269052505493, "epoch": 7.315425014588602, "grad_norm": 1.265625, "learning_rate": 0.00012647778627030652, "loss": 4.5607, "mean_token_accuracy": 0.24698563814163207, "num_tokens": 163074426.0, "step": 94025 }, { "entropy": 5.330621957778931, "epoch": 7.315814043960319, "grad_norm": 1.4375, "learning_rate": 0.00012645696803381353, "loss": 4.5675, "mean_token_accuracy": 0.24733350723981856, "num_tokens": 163082609.0, "step": 94030 }, { "entropy": 5.339424562454224, "epoch": 7.316203073332036, "grad_norm": 1.453125, "learning_rate": 0.00012643615205122462, "loss": 4.504, "mean_token_accuracy": 0.24648047983646393, "num_tokens": 163090494.0, "step": 94035 }, { "entropy": 5.366439914703369, "epoch": 7.316592102703754, "grad_norm": 1.3515625, "learning_rate": 0.00012641533832285568, "loss": 4.6407, "mean_token_accuracy": 0.24788683503866196, "num_tokens": 163098332.0, "step": 94040 }, { "entropy": 5.321274757385254, "epoch": 7.316981132075472, "grad_norm": 1.28125, "learning_rate": 0.00012639452684902239, "loss": 4.549, "mean_token_accuracy": 0.2535044848918915, "num_tokens": 163107479.0, "step": 94045 }, { "entropy": 5.33533992767334, "epoch": 7.317370161447189, "grad_norm": 1.3515625, "learning_rate": 0.00012637371763004072, "loss": 4.5586, "mean_token_accuracy": 0.24317685663700103, "num_tokens": 163115903.0, "step": 94050 }, { "entropy": 5.361750078201294, "epoch": 7.317759190818907, "grad_norm": 1.3515625, "learning_rate": 0.0001263529106662263, "loss": 4.638, "mean_token_accuracy": 0.24287838339805604, "num_tokens": 163124601.0, "step": 94055 }, { "entropy": 5.410828161239624, "epoch": 7.318148220190625, "grad_norm": 1.28125, "learning_rate": 0.00012633210595789474, "loss": 4.6524, "mean_token_accuracy": 0.23831938505172728, "num_tokens": 163133985.0, "step": 94060 }, { "entropy": 5.398840379714966, "epoch": 7.3185372495623415, "grad_norm": 1.40625, "learning_rate": 0.00012631130350536203, "loss": 4.6584, "mean_token_accuracy": 0.24547156542539597, "num_tokens": 163142452.0, "step": 94065 }, { "entropy": 5.444306564331055, "epoch": 7.318926278934059, "grad_norm": 1.375, "learning_rate": 0.00012629050330894347, "loss": 4.6758, "mean_token_accuracy": 0.24658536463975905, "num_tokens": 163151033.0, "step": 94070 }, { "entropy": 5.360301923751831, "epoch": 7.319315308305777, "grad_norm": 1.328125, "learning_rate": 0.00012626970536895493, "loss": 4.5736, "mean_token_accuracy": 0.2563576400279999, "num_tokens": 163160256.0, "step": 94075 }, { "entropy": 5.463718223571777, "epoch": 7.319704337677495, "grad_norm": 1.375, "learning_rate": 0.00012624890968571185, "loss": 4.7094, "mean_token_accuracy": 0.24417247027158737, "num_tokens": 163168417.0, "step": 94080 }, { "entropy": 5.3682310581207275, "epoch": 7.320093367049212, "grad_norm": 1.3359375, "learning_rate": 0.00012622811625952982, "loss": 4.5311, "mean_token_accuracy": 0.24549825638532638, "num_tokens": 163177160.0, "step": 94085 }, { "entropy": 5.4310572147369385, "epoch": 7.32048239642093, "grad_norm": 1.6796875, "learning_rate": 0.00012620732509072437, "loss": 4.663, "mean_token_accuracy": 0.23133173435926438, "num_tokens": 163186205.0, "step": 94090 }, { "entropy": 5.369527530670166, "epoch": 7.320871425792648, "grad_norm": 1.359375, "learning_rate": 0.00012618653617961086, "loss": 4.618, "mean_token_accuracy": 0.24943159967660905, "num_tokens": 163194726.0, "step": 94095 }, { "entropy": 5.3082798480987545, "epoch": 7.3212604551643645, "grad_norm": 1.515625, "learning_rate": 0.00012616574952650485, "loss": 4.5021, "mean_token_accuracy": 0.2549077033996582, "num_tokens": 163202694.0, "step": 94100 }, { "entropy": 5.318939065933227, "epoch": 7.321649484536082, "grad_norm": 1.4296875, "learning_rate": 0.0001261449651317216, "loss": 4.5992, "mean_token_accuracy": 0.251708360016346, "num_tokens": 163211574.0, "step": 94105 }, { "entropy": 5.341650390625, "epoch": 7.3220385139078, "grad_norm": 1.359375, "learning_rate": 0.0001261241829955767, "loss": 4.5663, "mean_token_accuracy": 0.24781087934970855, "num_tokens": 163220963.0, "step": 94110 }, { "entropy": 5.419349241256714, "epoch": 7.322427543279518, "grad_norm": 1.3828125, "learning_rate": 0.00012610340311838524, "loss": 4.6437, "mean_token_accuracy": 0.24247910231351852, "num_tokens": 163229876.0, "step": 94115 }, { "entropy": 5.412204599380493, "epoch": 7.322816572651235, "grad_norm": 1.3359375, "learning_rate": 0.00012608262550046278, "loss": 4.6784, "mean_token_accuracy": 0.23569331020116807, "num_tokens": 163238613.0, "step": 94120 }, { "entropy": 5.426954746246338, "epoch": 7.323205602022953, "grad_norm": 1.453125, "learning_rate": 0.00012606185014212438, "loss": 4.67, "mean_token_accuracy": 0.23521170020103455, "num_tokens": 163247192.0, "step": 94125 }, { "entropy": 5.361254453659058, "epoch": 7.323594631394671, "grad_norm": 1.4140625, "learning_rate": 0.00012604107704368528, "loss": 4.5071, "mean_token_accuracy": 0.2524102583527565, "num_tokens": 163255363.0, "step": 94130 }, { "entropy": 5.388315629959107, "epoch": 7.3239836607663875, "grad_norm": 1.2734375, "learning_rate": 0.00012602030620546088, "loss": 4.5705, "mean_token_accuracy": 0.25677483081817626, "num_tokens": 163264090.0, "step": 94135 }, { "entropy": 5.39150595664978, "epoch": 7.324372690138105, "grad_norm": 1.3046875, "learning_rate": 0.0001259995376277661, "loss": 4.6589, "mean_token_accuracy": 0.242257459461689, "num_tokens": 163273009.0, "step": 94140 }, { "entropy": 5.325036287307739, "epoch": 7.324761719509823, "grad_norm": 1.5234375, "learning_rate": 0.0001259787713109163, "loss": 4.5296, "mean_token_accuracy": 0.2529591202735901, "num_tokens": 163280876.0, "step": 94145 }, { "entropy": 5.312546157836914, "epoch": 7.325150748881541, "grad_norm": 1.4296875, "learning_rate": 0.0001259580072552263, "loss": 4.5661, "mean_token_accuracy": 0.24881526827812195, "num_tokens": 163290107.0, "step": 94150 }, { "entropy": 5.377563953399658, "epoch": 7.325539778253258, "grad_norm": 1.34375, "learning_rate": 0.00012593724546101142, "loss": 4.5669, "mean_token_accuracy": 0.2510275781154633, "num_tokens": 163298591.0, "step": 94155 }, { "entropy": 5.317975091934204, "epoch": 7.325928807624976, "grad_norm": 1.4375, "learning_rate": 0.00012591648592858652, "loss": 4.4879, "mean_token_accuracy": 0.25029309988021853, "num_tokens": 163308299.0, "step": 94160 }, { "entropy": 5.385346698760986, "epoch": 7.326317836996694, "grad_norm": 1.421875, "learning_rate": 0.0001258957286582667, "loss": 4.6843, "mean_token_accuracy": 0.23791890144348143, "num_tokens": 163317475.0, "step": 94165 }, { "entropy": 5.416301488876343, "epoch": 7.3267068663684105, "grad_norm": 1.4140625, "learning_rate": 0.00012587497365036692, "loss": 4.6091, "mean_token_accuracy": 0.24556662142276764, "num_tokens": 163326089.0, "step": 94170 }, { "entropy": 5.297440528869629, "epoch": 7.327095895740128, "grad_norm": 1.4453125, "learning_rate": 0.00012585422090520193, "loss": 4.5224, "mean_token_accuracy": 0.248697167634964, "num_tokens": 163334153.0, "step": 94175 }, { "entropy": 5.348762893676758, "epoch": 7.327484925111846, "grad_norm": 1.3515625, "learning_rate": 0.0001258334704230869, "loss": 4.6036, "mean_token_accuracy": 0.24213108867406846, "num_tokens": 163343815.0, "step": 94180 }, { "entropy": 5.400892686843872, "epoch": 7.327873954483564, "grad_norm": 1.4765625, "learning_rate": 0.0001258127222043364, "loss": 4.6109, "mean_token_accuracy": 0.2370713546872139, "num_tokens": 163351510.0, "step": 94185 }, { "entropy": 5.372803831100464, "epoch": 7.328262983855281, "grad_norm": 1.4296875, "learning_rate": 0.00012579197624926547, "loss": 4.5917, "mean_token_accuracy": 0.24456847608089446, "num_tokens": 163360503.0, "step": 94190 }, { "entropy": 5.3610621929168705, "epoch": 7.328652013226999, "grad_norm": 1.3203125, "learning_rate": 0.00012577123255818874, "loss": 4.6401, "mean_token_accuracy": 0.2394181415438652, "num_tokens": 163369705.0, "step": 94195 }, { "entropy": 5.362016201019287, "epoch": 7.329041042598716, "grad_norm": 1.3046875, "learning_rate": 0.000125750491131421, "loss": 4.6383, "mean_token_accuracy": 0.2416483938694, "num_tokens": 163379111.0, "step": 94200 }, { "entropy": 5.401790761947632, "epoch": 7.3294300719704335, "grad_norm": 1.2734375, "learning_rate": 0.00012572975196927717, "loss": 4.6487, "mean_token_accuracy": 0.24734949916601182, "num_tokens": 163387901.0, "step": 94205 }, { "entropy": 5.395131587982178, "epoch": 7.329819101342151, "grad_norm": 1.3671875, "learning_rate": 0.0001257090150720716, "loss": 4.5457, "mean_token_accuracy": 0.25504214465618136, "num_tokens": 163397195.0, "step": 94210 }, { "entropy": 5.331527519226074, "epoch": 7.330208130713869, "grad_norm": 1.4609375, "learning_rate": 0.0001256882804401192, "loss": 4.5101, "mean_token_accuracy": 0.25379130244255066, "num_tokens": 163405939.0, "step": 94215 }, { "entropy": 5.282521677017212, "epoch": 7.330597160085587, "grad_norm": 1.25, "learning_rate": 0.00012566754807373442, "loss": 4.5519, "mean_token_accuracy": 0.25476140081882476, "num_tokens": 163415703.0, "step": 94220 }, { "entropy": 5.331199693679809, "epoch": 7.330986189457304, "grad_norm": 1.4609375, "learning_rate": 0.00012564681797323202, "loss": 4.5469, "mean_token_accuracy": 0.24518670439720153, "num_tokens": 163423971.0, "step": 94225 }, { "entropy": 5.408124399185181, "epoch": 7.331375218829022, "grad_norm": 1.3671875, "learning_rate": 0.00012562609013892632, "loss": 4.642, "mean_token_accuracy": 0.23427651971578597, "num_tokens": 163432551.0, "step": 94230 }, { "entropy": 5.351016092300415, "epoch": 7.331764248200739, "grad_norm": 1.203125, "learning_rate": 0.00012560536457113203, "loss": 4.5898, "mean_token_accuracy": 0.24789413064718246, "num_tokens": 163441657.0, "step": 94235 }, { "entropy": 5.358830451965332, "epoch": 7.3321532775724565, "grad_norm": 1.3359375, "learning_rate": 0.0001255846412701635, "loss": 4.6501, "mean_token_accuracy": 0.24453209936618805, "num_tokens": 163450431.0, "step": 94240 }, { "entropy": 5.362634801864624, "epoch": 7.332542306944174, "grad_norm": 1.3359375, "learning_rate": 0.00012556392023633527, "loss": 4.5956, "mean_token_accuracy": 0.24651786237955092, "num_tokens": 163459025.0, "step": 94245 }, { "entropy": 5.350490665435791, "epoch": 7.332931336315892, "grad_norm": 1.3828125, "learning_rate": 0.00012554320146996169, "loss": 4.5985, "mean_token_accuracy": 0.2480500340461731, "num_tokens": 163467267.0, "step": 94250 }, { "entropy": 5.410300445556641, "epoch": 7.33332036568761, "grad_norm": 1.5078125, "learning_rate": 0.0001255224849713571, "loss": 4.6405, "mean_token_accuracy": 0.2414240226149559, "num_tokens": 163475939.0, "step": 94255 }, { "entropy": 5.3582274436950685, "epoch": 7.333709395059327, "grad_norm": 1.390625, "learning_rate": 0.00012550177074083585, "loss": 4.5409, "mean_token_accuracy": 0.2526076093316078, "num_tokens": 163483664.0, "step": 94260 }, { "entropy": 5.418527507781983, "epoch": 7.334098424431044, "grad_norm": 1.2734375, "learning_rate": 0.0001254810587787123, "loss": 4.615, "mean_token_accuracy": 0.24115387052297593, "num_tokens": 163492601.0, "step": 94265 }, { "entropy": 5.370981931686401, "epoch": 7.334487453802762, "grad_norm": 1.5625, "learning_rate": 0.00012546034908530074, "loss": 4.6348, "mean_token_accuracy": 0.23939983248710633, "num_tokens": 163500262.0, "step": 94270 }, { "entropy": 5.352333927154541, "epoch": 7.3348764831744795, "grad_norm": 1.3203125, "learning_rate": 0.0001254396416609154, "loss": 4.5374, "mean_token_accuracy": 0.25349895656108856, "num_tokens": 163508836.0, "step": 94275 }, { "entropy": 5.37919545173645, "epoch": 7.335265512546197, "grad_norm": 1.484375, "learning_rate": 0.00012541893650587035, "loss": 4.573, "mean_token_accuracy": 0.23996481895446778, "num_tokens": 163516800.0, "step": 94280 }, { "entropy": 5.376312017440796, "epoch": 7.335654541917915, "grad_norm": 1.328125, "learning_rate": 0.00012539823362047998, "loss": 4.6171, "mean_token_accuracy": 0.2384917214512825, "num_tokens": 163525217.0, "step": 94285 }, { "entropy": 5.315344142913818, "epoch": 7.336043571289633, "grad_norm": 1.359375, "learning_rate": 0.00012537753300505817, "loss": 4.5251, "mean_token_accuracy": 0.24736091792583464, "num_tokens": 163534847.0, "step": 94290 }, { "entropy": 5.353728485107422, "epoch": 7.33643260066135, "grad_norm": 1.4375, "learning_rate": 0.00012535683465991922, "loss": 4.6002, "mean_token_accuracy": 0.24443187564611435, "num_tokens": 163543391.0, "step": 94295 }, { "entropy": 5.323368263244629, "epoch": 7.336821630033067, "grad_norm": 1.4921875, "learning_rate": 0.0001253361385853771, "loss": 4.5712, "mean_token_accuracy": 0.2500728666782379, "num_tokens": 163551601.0, "step": 94300 }, { "entropy": 5.377783679962159, "epoch": 7.337210659404785, "grad_norm": 1.171875, "learning_rate": 0.0001253154447817459, "loss": 4.6348, "mean_token_accuracy": 0.24851650446653367, "num_tokens": 163560618.0, "step": 94305 }, { "entropy": 5.363304519653321, "epoch": 7.3375996887765025, "grad_norm": 1.359375, "learning_rate": 0.00012529475324933947, "loss": 4.6216, "mean_token_accuracy": 0.24460252076387407, "num_tokens": 163569729.0, "step": 94310 }, { "entropy": 5.381510162353516, "epoch": 7.33798871814822, "grad_norm": 1.3984375, "learning_rate": 0.00012527406398847203, "loss": 4.615, "mean_token_accuracy": 0.24908929765224458, "num_tokens": 163578834.0, "step": 94315 }, { "entropy": 5.314643526077271, "epoch": 7.338377747519938, "grad_norm": 1.390625, "learning_rate": 0.00012525337699945726, "loss": 4.5469, "mean_token_accuracy": 0.25252521187067034, "num_tokens": 163587068.0, "step": 94320 }, { "entropy": 5.380915594100952, "epoch": 7.338766776891656, "grad_norm": 1.375, "learning_rate": 0.00012523269228260908, "loss": 4.528, "mean_token_accuracy": 0.2542674109339714, "num_tokens": 163595453.0, "step": 94325 }, { "entropy": 5.329588508605957, "epoch": 7.339155806263373, "grad_norm": 1.3125, "learning_rate": 0.00012521200983824158, "loss": 4.5293, "mean_token_accuracy": 0.2535392001271248, "num_tokens": 163604124.0, "step": 94330 }, { "entropy": 5.335412073135376, "epoch": 7.33954483563509, "grad_norm": 1.4296875, "learning_rate": 0.0001251913296666683, "loss": 4.5561, "mean_token_accuracy": 0.24718367159366608, "num_tokens": 163612722.0, "step": 94335 }, { "entropy": 5.279577827453613, "epoch": 7.339933865006808, "grad_norm": 1.3515625, "learning_rate": 0.00012517065176820326, "loss": 4.5523, "mean_token_accuracy": 0.25031495094299316, "num_tokens": 163621580.0, "step": 94340 }, { "entropy": 5.440175294876099, "epoch": 7.3403228943785255, "grad_norm": 1.359375, "learning_rate": 0.00012514997614315997, "loss": 4.6736, "mean_token_accuracy": 0.23754564076662063, "num_tokens": 163631118.0, "step": 94345 }, { "entropy": 5.378798961639404, "epoch": 7.340711923750243, "grad_norm": 1.3203125, "learning_rate": 0.00012512930279185236, "loss": 4.6019, "mean_token_accuracy": 0.24993743598461152, "num_tokens": 163639783.0, "step": 94350 }, { "entropy": 5.360303544998169, "epoch": 7.341100953121961, "grad_norm": 1.40625, "learning_rate": 0.00012510863171459407, "loss": 4.6152, "mean_token_accuracy": 0.24297598898410797, "num_tokens": 163648335.0, "step": 94355 }, { "entropy": 5.408425569534302, "epoch": 7.341489982493679, "grad_norm": 1.4921875, "learning_rate": 0.00012508796291169864, "loss": 4.621, "mean_token_accuracy": 0.24012731462717057, "num_tokens": 163656750.0, "step": 94360 }, { "entropy": 5.44068284034729, "epoch": 7.341879011865396, "grad_norm": 1.53125, "learning_rate": 0.0001250672963834798, "loss": 4.6615, "mean_token_accuracy": 0.24300095736980437, "num_tokens": 163664652.0, "step": 94365 }, { "entropy": 5.381797409057617, "epoch": 7.342268041237113, "grad_norm": 1.3359375, "learning_rate": 0.00012504663213025108, "loss": 4.6276, "mean_token_accuracy": 0.24616905450820922, "num_tokens": 163673677.0, "step": 94370 }, { "entropy": 5.447887659072876, "epoch": 7.342657070608831, "grad_norm": 1.359375, "learning_rate": 0.00012502597015232606, "loss": 4.6823, "mean_token_accuracy": 0.2420792907476425, "num_tokens": 163682803.0, "step": 94375 }, { "entropy": 5.361238670349121, "epoch": 7.3430460999805485, "grad_norm": 1.4765625, "learning_rate": 0.00012500531045001818, "loss": 4.6304, "mean_token_accuracy": 0.23542912304401398, "num_tokens": 163691144.0, "step": 94380 }, { "entropy": 5.389438772201538, "epoch": 7.343435129352266, "grad_norm": 1.359375, "learning_rate": 0.00012498465302364104, "loss": 4.615, "mean_token_accuracy": 0.2446685627102852, "num_tokens": 163699634.0, "step": 94385 }, { "entropy": 5.395974445343017, "epoch": 7.343824158723984, "grad_norm": 1.3359375, "learning_rate": 0.00012496399787350796, "loss": 4.5663, "mean_token_accuracy": 0.24455775320529938, "num_tokens": 163707906.0, "step": 94390 }, { "entropy": 5.38205099105835, "epoch": 7.344213188095702, "grad_norm": 1.5078125, "learning_rate": 0.0001249433449999324, "loss": 4.6061, "mean_token_accuracy": 0.2479534462094307, "num_tokens": 163717164.0, "step": 94395 }, { "entropy": 5.381329202651978, "epoch": 7.344602217467418, "grad_norm": 1.375, "learning_rate": 0.00012492269440322784, "loss": 4.6582, "mean_token_accuracy": 0.2376382291316986, "num_tokens": 163726874.0, "step": 94400 }, { "entropy": 5.312429809570313, "epoch": 7.344991246839136, "grad_norm": 1.3671875, "learning_rate": 0.00012490204608370738, "loss": 4.5521, "mean_token_accuracy": 0.24370041042566298, "num_tokens": 163735689.0, "step": 94405 }, { "entropy": 5.372054624557495, "epoch": 7.345380276210854, "grad_norm": 1.5390625, "learning_rate": 0.0001248814000416846, "loss": 4.598, "mean_token_accuracy": 0.24875753968954087, "num_tokens": 163744350.0, "step": 94410 }, { "entropy": 5.342721319198608, "epoch": 7.3457693055825715, "grad_norm": 1.4765625, "learning_rate": 0.00012486075627747255, "loss": 4.5349, "mean_token_accuracy": 0.25628087371587754, "num_tokens": 163752296.0, "step": 94415 }, { "entropy": 5.349948596954346, "epoch": 7.346158334954289, "grad_norm": 1.3984375, "learning_rate": 0.00012484011479138463, "loss": 4.6009, "mean_token_accuracy": 0.24388409405946732, "num_tokens": 163761143.0, "step": 94420 }, { "entropy": 5.31762580871582, "epoch": 7.346547364326007, "grad_norm": 1.296875, "learning_rate": 0.00012481947558373385, "loss": 4.5885, "mean_token_accuracy": 0.24912268966436385, "num_tokens": 163769965.0, "step": 94425 }, { "entropy": 5.326842546463013, "epoch": 7.3469363936977246, "grad_norm": 1.3359375, "learning_rate": 0.00012479883865483362, "loss": 4.5249, "mean_token_accuracy": 0.2545724675059319, "num_tokens": 163777822.0, "step": 94430 }, { "entropy": 5.334474658966064, "epoch": 7.347325423069441, "grad_norm": 1.3046875, "learning_rate": 0.00012477820400499687, "loss": 4.6357, "mean_token_accuracy": 0.23473903387784958, "num_tokens": 163786795.0, "step": 94435 }, { "entropy": 5.316759061813355, "epoch": 7.347714452441159, "grad_norm": 1.3125, "learning_rate": 0.00012475757163453677, "loss": 4.5321, "mean_token_accuracy": 0.246415813267231, "num_tokens": 163795980.0, "step": 94440 }, { "entropy": 5.4038928031921385, "epoch": 7.348103481812877, "grad_norm": 1.3671875, "learning_rate": 0.00012473694154376642, "loss": 4.6589, "mean_token_accuracy": 0.24382228553295135, "num_tokens": 163805160.0, "step": 94445 }, { "entropy": 5.384531831741333, "epoch": 7.3484925111845945, "grad_norm": 1.34375, "learning_rate": 0.00012471631373299876, "loss": 4.6097, "mean_token_accuracy": 0.2441108986735344, "num_tokens": 163814429.0, "step": 94450 }, { "entropy": 5.387227773666382, "epoch": 7.348881540556312, "grad_norm": 1.6015625, "learning_rate": 0.0001246956882025469, "loss": 4.6286, "mean_token_accuracy": 0.24336243271827698, "num_tokens": 163822868.0, "step": 94455 }, { "entropy": 5.4389585018157955, "epoch": 7.34927056992803, "grad_norm": 1.28125, "learning_rate": 0.00012467506495272357, "loss": 4.6981, "mean_token_accuracy": 0.24395828396081926, "num_tokens": 163832244.0, "step": 94460 }, { "entropy": 5.3698138236999515, "epoch": 7.349659599299747, "grad_norm": 1.34375, "learning_rate": 0.00012465444398384204, "loss": 4.6461, "mean_token_accuracy": 0.2423446848988533, "num_tokens": 163841232.0, "step": 94465 }, { "entropy": 5.408413600921631, "epoch": 7.350048628671464, "grad_norm": 1.4140625, "learning_rate": 0.00012463382529621502, "loss": 4.5994, "mean_token_accuracy": 0.2496738150715828, "num_tokens": 163849860.0, "step": 94470 }, { "entropy": 5.363593244552613, "epoch": 7.350437658043182, "grad_norm": 1.4375, "learning_rate": 0.0001246132088901553, "loss": 4.531, "mean_token_accuracy": 0.25939404517412185, "num_tokens": 163858278.0, "step": 94475 }, { "entropy": 5.389538097381592, "epoch": 7.3508266874149, "grad_norm": 1.3671875, "learning_rate": 0.00012459259476597584, "loss": 4.6414, "mean_token_accuracy": 0.24487038999795913, "num_tokens": 163866383.0, "step": 94480 }, { "entropy": 5.3618577003479, "epoch": 7.3512157167866174, "grad_norm": 1.375, "learning_rate": 0.00012457198292398927, "loss": 4.5584, "mean_token_accuracy": 0.2512852609157562, "num_tokens": 163875169.0, "step": 94485 }, { "entropy": 5.4225725650787355, "epoch": 7.351604746158335, "grad_norm": 1.2890625, "learning_rate": 0.0001245513733645085, "loss": 4.6833, "mean_token_accuracy": 0.24572090357542037, "num_tokens": 163884427.0, "step": 94490 }, { "entropy": 5.334325742721558, "epoch": 7.351993775530053, "grad_norm": 1.390625, "learning_rate": 0.00012453076608784613, "loss": 4.5177, "mean_token_accuracy": 0.2518465220928192, "num_tokens": 163892692.0, "step": 94495 }, { "entropy": 5.320864915847778, "epoch": 7.3523828049017705, "grad_norm": 1.3515625, "learning_rate": 0.00012451016109431493, "loss": 4.5717, "mean_token_accuracy": 0.2518074333667755, "num_tokens": 163902057.0, "step": 94500 }, { "entropy": 5.34097695350647, "epoch": 7.352771834273487, "grad_norm": 1.28125, "learning_rate": 0.00012448955838422745, "loss": 4.5687, "mean_token_accuracy": 0.24783486723899842, "num_tokens": 163910649.0, "step": 94505 }, { "entropy": 5.488706588745117, "epoch": 7.353160863645205, "grad_norm": 1.4609375, "learning_rate": 0.0001244689579578964, "loss": 4.7753, "mean_token_accuracy": 0.23000237345695496, "num_tokens": 163919969.0, "step": 94510 }, { "entropy": 5.3812949657440186, "epoch": 7.353549893016923, "grad_norm": 1.3515625, "learning_rate": 0.00012444835981563436, "loss": 4.647, "mean_token_accuracy": 0.24544771760702133, "num_tokens": 163929561.0, "step": 94515 }, { "entropy": 5.411035490036011, "epoch": 7.35393892238864, "grad_norm": 1.3359375, "learning_rate": 0.00012442776395775375, "loss": 4.6238, "mean_token_accuracy": 0.24927684515714646, "num_tokens": 163938595.0, "step": 94520 }, { "entropy": 5.382682132720947, "epoch": 7.354327951760358, "grad_norm": 1.375, "learning_rate": 0.00012440717038456715, "loss": 4.5634, "mean_token_accuracy": 0.25016694217920304, "num_tokens": 163947466.0, "step": 94525 }, { "entropy": 5.367576026916504, "epoch": 7.354716981132076, "grad_norm": 1.4765625, "learning_rate": 0.00012438657909638707, "loss": 4.5599, "mean_token_accuracy": 0.24404421597719192, "num_tokens": 163955632.0, "step": 94530 }, { "entropy": 5.381631326675415, "epoch": 7.355106010503793, "grad_norm": 1.46875, "learning_rate": 0.00012436599009352597, "loss": 4.6116, "mean_token_accuracy": 0.24691084176301956, "num_tokens": 163964566.0, "step": 94535 }, { "entropy": 5.271064329147339, "epoch": 7.35549503987551, "grad_norm": 1.421875, "learning_rate": 0.00012434540337629617, "loss": 4.5131, "mean_token_accuracy": 0.25496512204408645, "num_tokens": 163972665.0, "step": 94540 }, { "entropy": 5.358954191207886, "epoch": 7.355884069247228, "grad_norm": 1.4453125, "learning_rate": 0.00012432481894501012, "loss": 4.5897, "mean_token_accuracy": 0.24608606994152069, "num_tokens": 163980594.0, "step": 94545 }, { "entropy": 5.38698410987854, "epoch": 7.356273098618946, "grad_norm": 1.5, "learning_rate": 0.00012430423679998012, "loss": 4.6691, "mean_token_accuracy": 0.23326386064291, "num_tokens": 163988882.0, "step": 94550 }, { "entropy": 5.338452911376953, "epoch": 7.356662127990663, "grad_norm": 1.3515625, "learning_rate": 0.00012428365694151843, "loss": 4.5067, "mean_token_accuracy": 0.2581985771656036, "num_tokens": 163997204.0, "step": 94555 }, { "entropy": 5.394546461105347, "epoch": 7.357051157362381, "grad_norm": 1.6015625, "learning_rate": 0.0001242630793699374, "loss": 4.6317, "mean_token_accuracy": 0.24523754715919494, "num_tokens": 164005414.0, "step": 94560 }, { "entropy": 5.389801931381226, "epoch": 7.357440186734099, "grad_norm": 1.453125, "learning_rate": 0.00012424250408554918, "loss": 4.5986, "mean_token_accuracy": 0.2513165161013603, "num_tokens": 164013911.0, "step": 94565 }, { "entropy": 5.28177227973938, "epoch": 7.357829216105816, "grad_norm": 1.3671875, "learning_rate": 0.00012422193108866606, "loss": 4.5307, "mean_token_accuracy": 0.25732963234186174, "num_tokens": 164023072.0, "step": 94570 }, { "entropy": 5.368022394180298, "epoch": 7.358218245477533, "grad_norm": 1.40625, "learning_rate": 0.00012420136037960005, "loss": 4.619, "mean_token_accuracy": 0.24548924565315247, "num_tokens": 164031205.0, "step": 94575 }, { "entropy": 5.335402536392212, "epoch": 7.358607274849251, "grad_norm": 1.453125, "learning_rate": 0.00012418079195866346, "loss": 4.5286, "mean_token_accuracy": 0.2510799154639244, "num_tokens": 164040068.0, "step": 94580 }, { "entropy": 5.328437423706054, "epoch": 7.358996304220969, "grad_norm": 1.390625, "learning_rate": 0.0001241602258261682, "loss": 4.6126, "mean_token_accuracy": 0.2355450227856636, "num_tokens": 164049027.0, "step": 94585 }, { "entropy": 5.439224195480347, "epoch": 7.359385333592686, "grad_norm": 1.34375, "learning_rate": 0.0001241396619824265, "loss": 4.7106, "mean_token_accuracy": 0.2392003446817398, "num_tokens": 164058733.0, "step": 94590 }, { "entropy": 5.30728850364685, "epoch": 7.359774362964404, "grad_norm": 1.421875, "learning_rate": 0.00012411910042775033, "loss": 4.5122, "mean_token_accuracy": 0.25841052681207655, "num_tokens": 164066950.0, "step": 94595 }, { "entropy": 5.443985891342163, "epoch": 7.360163392336121, "grad_norm": 1.375, "learning_rate": 0.0001240985411624516, "loss": 4.7146, "mean_token_accuracy": 0.23773619383573533, "num_tokens": 164074983.0, "step": 94600 }, { "entropy": 5.335656929016113, "epoch": 7.360552421707839, "grad_norm": 1.28125, "learning_rate": 0.0001240779841868424, "loss": 4.5575, "mean_token_accuracy": 0.2531688541173935, "num_tokens": 164084156.0, "step": 94605 }, { "entropy": 5.387413263320923, "epoch": 7.360941451079556, "grad_norm": 1.4296875, "learning_rate": 0.00012405742950123447, "loss": 4.6379, "mean_token_accuracy": 0.2388383373618126, "num_tokens": 164092467.0, "step": 94610 }, { "entropy": 5.272861099243164, "epoch": 7.361330480451274, "grad_norm": 1.3125, "learning_rate": 0.00012403687710593994, "loss": 4.4593, "mean_token_accuracy": 0.264107283949852, "num_tokens": 164100956.0, "step": 94615 }, { "entropy": 5.319189643859863, "epoch": 7.361719509822992, "grad_norm": 1.40625, "learning_rate": 0.00012401632700127037, "loss": 4.5363, "mean_token_accuracy": 0.25721351355314254, "num_tokens": 164108908.0, "step": 94620 }, { "entropy": 5.408845138549805, "epoch": 7.362108539194709, "grad_norm": 1.4296875, "learning_rate": 0.00012399577918753785, "loss": 4.567, "mean_token_accuracy": 0.24320504516363145, "num_tokens": 164117013.0, "step": 94625 }, { "entropy": 5.343125343322754, "epoch": 7.362497568566427, "grad_norm": 1.484375, "learning_rate": 0.000123975233665054, "loss": 4.5386, "mean_token_accuracy": 0.24477118402719497, "num_tokens": 164124833.0, "step": 94630 }, { "entropy": 5.3228271484375, "epoch": 7.362886597938144, "grad_norm": 1.3359375, "learning_rate": 0.00012395469043413054, "loss": 4.6495, "mean_token_accuracy": 0.24897656142711638, "num_tokens": 164133890.0, "step": 94635 }, { "entropy": 5.2942994117736815, "epoch": 7.363275627309862, "grad_norm": 1.3984375, "learning_rate": 0.0001239341494950793, "loss": 4.614, "mean_token_accuracy": 0.2438293516635895, "num_tokens": 164142800.0, "step": 94640 }, { "entropy": 5.316054153442383, "epoch": 7.363664656681579, "grad_norm": 1.4921875, "learning_rate": 0.00012391361084821182, "loss": 4.5418, "mean_token_accuracy": 0.2431260421872139, "num_tokens": 164151325.0, "step": 94645 }, { "entropy": 5.309487342834473, "epoch": 7.364053686053297, "grad_norm": 1.40625, "learning_rate": 0.00012389307449383992, "loss": 4.5341, "mean_token_accuracy": 0.2551542088389397, "num_tokens": 164159812.0, "step": 94650 }, { "entropy": 5.390709066390992, "epoch": 7.364442715425015, "grad_norm": 1.4609375, "learning_rate": 0.000123872540432275, "loss": 4.6264, "mean_token_accuracy": 0.2445986896753311, "num_tokens": 164168628.0, "step": 94655 }, { "entropy": 5.322995042800903, "epoch": 7.364831744796732, "grad_norm": 1.34375, "learning_rate": 0.00012385200866382875, "loss": 4.4827, "mean_token_accuracy": 0.25955532789230346, "num_tokens": 164177297.0, "step": 94660 }, { "entropy": 5.361328887939453, "epoch": 7.36522077416845, "grad_norm": 1.4609375, "learning_rate": 0.00012383147918881274, "loss": 4.556, "mean_token_accuracy": 0.24996531158685684, "num_tokens": 164185561.0, "step": 94665 }, { "entropy": 5.343436002731323, "epoch": 7.365609803540167, "grad_norm": 1.484375, "learning_rate": 0.00012381095200753836, "loss": 4.5647, "mean_token_accuracy": 0.24244602769613266, "num_tokens": 164194028.0, "step": 94670 }, { "entropy": 5.404474210739136, "epoch": 7.365998832911885, "grad_norm": 1.2734375, "learning_rate": 0.00012379042712031723, "loss": 4.7273, "mean_token_accuracy": 0.23863156735897065, "num_tokens": 164202475.0, "step": 94675 }, { "entropy": 5.29662446975708, "epoch": 7.366387862283602, "grad_norm": 1.2578125, "learning_rate": 0.00012376990452746064, "loss": 4.5558, "mean_token_accuracy": 0.24755702614784242, "num_tokens": 164210954.0, "step": 94680 }, { "entropy": 5.382462835311889, "epoch": 7.36677689165532, "grad_norm": 1.3125, "learning_rate": 0.00012374938422928005, "loss": 4.6273, "mean_token_accuracy": 0.23223475366830826, "num_tokens": 164220393.0, "step": 94685 }, { "entropy": 5.288799476623535, "epoch": 7.367165921027038, "grad_norm": 1.359375, "learning_rate": 0.0001237288662260868, "loss": 4.5402, "mean_token_accuracy": 0.2502361938357353, "num_tokens": 164229958.0, "step": 94690 }, { "entropy": 5.311399459838867, "epoch": 7.367554950398755, "grad_norm": 1.2890625, "learning_rate": 0.00012370835051819226, "loss": 4.5208, "mean_token_accuracy": 0.25485492050647734, "num_tokens": 164238267.0, "step": 94695 }, { "entropy": 5.364652490615844, "epoch": 7.367943979770473, "grad_norm": 1.3046875, "learning_rate": 0.00012368783710590766, "loss": 4.6192, "mean_token_accuracy": 0.250770303606987, "num_tokens": 164246901.0, "step": 94700 }, { "entropy": 5.2456567764282225, "epoch": 7.36833300914219, "grad_norm": 1.4140625, "learning_rate": 0.00012366732598954435, "loss": 4.4882, "mean_token_accuracy": 0.247441166639328, "num_tokens": 164255351.0, "step": 94705 }, { "entropy": 5.40628490447998, "epoch": 7.368722038513908, "grad_norm": 1.3828125, "learning_rate": 0.0001236468171694135, "loss": 4.6534, "mean_token_accuracy": 0.2465667247772217, "num_tokens": 164263665.0, "step": 94710 }, { "entropy": 5.338277053833008, "epoch": 7.369111067885625, "grad_norm": 1.28125, "learning_rate": 0.00012362631064582623, "loss": 4.6254, "mean_token_accuracy": 0.2427482023835182, "num_tokens": 164273568.0, "step": 94715 }, { "entropy": 5.400489616394043, "epoch": 7.369500097257343, "grad_norm": 1.46875, "learning_rate": 0.00012360580641909382, "loss": 4.5584, "mean_token_accuracy": 0.24988534599542617, "num_tokens": 164281538.0, "step": 94720 }, { "entropy": 5.398919534683228, "epoch": 7.369889126629061, "grad_norm": 1.3125, "learning_rate": 0.0001235853044895272, "loss": 4.6415, "mean_token_accuracy": 0.2396869882941246, "num_tokens": 164290419.0, "step": 94725 }, { "entropy": 5.393545007705688, "epoch": 7.370278156000778, "grad_norm": 1.421875, "learning_rate": 0.00012356480485743772, "loss": 4.6315, "mean_token_accuracy": 0.24184854328632355, "num_tokens": 164299023.0, "step": 94730 }, { "entropy": 5.344344902038574, "epoch": 7.370667185372495, "grad_norm": 1.5703125, "learning_rate": 0.00012354430752313628, "loss": 4.5887, "mean_token_accuracy": 0.24575280994176865, "num_tokens": 164307003.0, "step": 94735 }, { "entropy": 5.348322582244873, "epoch": 7.371056214744213, "grad_norm": 1.34375, "learning_rate": 0.00012352381248693383, "loss": 4.6784, "mean_token_accuracy": 0.2435499832034111, "num_tokens": 164316502.0, "step": 94740 }, { "entropy": 5.32273383140564, "epoch": 7.371445244115931, "grad_norm": 1.4375, "learning_rate": 0.00012350331974914154, "loss": 4.5398, "mean_token_accuracy": 0.24413011372089385, "num_tokens": 164324437.0, "step": 94745 }, { "entropy": 5.347464609146118, "epoch": 7.371834273487648, "grad_norm": 1.4296875, "learning_rate": 0.00012348282931007011, "loss": 4.5217, "mean_token_accuracy": 0.2476254478096962, "num_tokens": 164333012.0, "step": 94750 }, { "entropy": 5.298477745056152, "epoch": 7.372223302859366, "grad_norm": 1.390625, "learning_rate": 0.0001234623411700307, "loss": 4.5663, "mean_token_accuracy": 0.24725541323423386, "num_tokens": 164341491.0, "step": 94755 }, { "entropy": 5.302954769134521, "epoch": 7.372612332231084, "grad_norm": 1.4453125, "learning_rate": 0.000123441855329334, "loss": 4.5484, "mean_token_accuracy": 0.24250570982694625, "num_tokens": 164349813.0, "step": 94760 }, { "entropy": 5.316489028930664, "epoch": 7.373001361602801, "grad_norm": 1.46875, "learning_rate": 0.00012342137178829096, "loss": 4.5569, "mean_token_accuracy": 0.24775611013174056, "num_tokens": 164358364.0, "step": 94765 }, { "entropy": 5.343932628631592, "epoch": 7.373390390974518, "grad_norm": 1.453125, "learning_rate": 0.00012340089054721227, "loss": 4.6078, "mean_token_accuracy": 0.2511534675955772, "num_tokens": 164366174.0, "step": 94770 }, { "entropy": 5.211862945556641, "epoch": 7.373779420346236, "grad_norm": 1.3515625, "learning_rate": 0.00012338041160640884, "loss": 4.3841, "mean_token_accuracy": 0.2656616732478142, "num_tokens": 164375693.0, "step": 94775 }, { "entropy": 5.40116057395935, "epoch": 7.374168449717954, "grad_norm": 1.3515625, "learning_rate": 0.00012335993496619127, "loss": 4.5928, "mean_token_accuracy": 0.24313049614429474, "num_tokens": 164383786.0, "step": 94780 }, { "entropy": 5.223314237594605, "epoch": 7.374557479089671, "grad_norm": 1.375, "learning_rate": 0.00012333946062687042, "loss": 4.4429, "mean_token_accuracy": 0.26262580305337907, "num_tokens": 164392404.0, "step": 94785 }, { "entropy": 5.390042781829834, "epoch": 7.374946508461389, "grad_norm": 1.4140625, "learning_rate": 0.00012331898858875678, "loss": 4.6593, "mean_token_accuracy": 0.24416809380054474, "num_tokens": 164401224.0, "step": 94790 }, { "entropy": 5.41112060546875, "epoch": 7.375335537833107, "grad_norm": 1.421875, "learning_rate": 0.00012329851885216104, "loss": 4.6278, "mean_token_accuracy": 0.24610287845134735, "num_tokens": 164409969.0, "step": 94795 }, { "entropy": 5.342955541610718, "epoch": 7.3757245672048235, "grad_norm": 1.390625, "learning_rate": 0.0001232780514173939, "loss": 4.5713, "mean_token_accuracy": 0.25124277025461195, "num_tokens": 164418777.0, "step": 94800 }, { "entropy": 5.343933820724487, "epoch": 7.376113596576541, "grad_norm": 1.328125, "learning_rate": 0.00012325758628476576, "loss": 4.5342, "mean_token_accuracy": 0.2541049376130104, "num_tokens": 164427225.0, "step": 94805 }, { "entropy": 5.358779430389404, "epoch": 7.376502625948259, "grad_norm": 1.4453125, "learning_rate": 0.00012323712345458735, "loss": 4.6286, "mean_token_accuracy": 0.24401804953813552, "num_tokens": 164435918.0, "step": 94810 }, { "entropy": 5.331714248657226, "epoch": 7.376891655319977, "grad_norm": 1.3984375, "learning_rate": 0.00012321666292716896, "loss": 4.6523, "mean_token_accuracy": 0.2398310974240303, "num_tokens": 164444812.0, "step": 94815 }, { "entropy": 5.412523412704468, "epoch": 7.377280684691694, "grad_norm": 1.4296875, "learning_rate": 0.0001231962047028211, "loss": 4.613, "mean_token_accuracy": 0.24533528089523315, "num_tokens": 164453733.0, "step": 94820 }, { "entropy": 5.3308412551879885, "epoch": 7.377669714063412, "grad_norm": 1.3203125, "learning_rate": 0.00012317574878185426, "loss": 4.5312, "mean_token_accuracy": 0.2561042934656143, "num_tokens": 164462588.0, "step": 94825 }, { "entropy": 5.345142936706543, "epoch": 7.37805874343513, "grad_norm": 1.390625, "learning_rate": 0.00012315529516457874, "loss": 4.5715, "mean_token_accuracy": 0.2516396030783653, "num_tokens": 164470838.0, "step": 94830 }, { "entropy": 5.311398363113403, "epoch": 7.378447772806847, "grad_norm": 1.453125, "learning_rate": 0.000123134843851305, "loss": 4.5616, "mean_token_accuracy": 0.24898409247398376, "num_tokens": 164479797.0, "step": 94835 }, { "entropy": 5.341183614730835, "epoch": 7.378836802178564, "grad_norm": 1.34375, "learning_rate": 0.00012311439484234316, "loss": 4.6093, "mean_token_accuracy": 0.2485154688358307, "num_tokens": 164488471.0, "step": 94840 }, { "entropy": 5.269777870178222, "epoch": 7.379225831550282, "grad_norm": 1.4453125, "learning_rate": 0.00012309394813800375, "loss": 4.4695, "mean_token_accuracy": 0.26335751414299013, "num_tokens": 164497804.0, "step": 94845 }, { "entropy": 5.384412050247192, "epoch": 7.379614860922, "grad_norm": 1.359375, "learning_rate": 0.0001230735037385968, "loss": 4.6608, "mean_token_accuracy": 0.2360770508646965, "num_tokens": 164506053.0, "step": 94850 }, { "entropy": 5.386424160003662, "epoch": 7.380003890293717, "grad_norm": 1.359375, "learning_rate": 0.00012305306164443264, "loss": 4.6285, "mean_token_accuracy": 0.2494660422205925, "num_tokens": 164514210.0, "step": 94855 }, { "entropy": 5.407201766967773, "epoch": 7.380392919665435, "grad_norm": 1.40625, "learning_rate": 0.00012303262185582147, "loss": 4.6585, "mean_token_accuracy": 0.2391506552696228, "num_tokens": 164523331.0, "step": 94860 }, { "entropy": 5.317540788650513, "epoch": 7.380781949037153, "grad_norm": 1.484375, "learning_rate": 0.00012301218437307332, "loss": 4.5875, "mean_token_accuracy": 0.2460081860423088, "num_tokens": 164531414.0, "step": 94865 }, { "entropy": 5.39361572265625, "epoch": 7.3811709784088695, "grad_norm": 1.390625, "learning_rate": 0.0001229917491964984, "loss": 4.6709, "mean_token_accuracy": 0.23448848277330397, "num_tokens": 164540788.0, "step": 94870 }, { "entropy": 5.332365226745606, "epoch": 7.381560007780587, "grad_norm": 1.34375, "learning_rate": 0.0001229713163264067, "loss": 4.617, "mean_token_accuracy": 0.2457575887441635, "num_tokens": 164550432.0, "step": 94875 }, { "entropy": 5.466070652008057, "epoch": 7.381949037152305, "grad_norm": 1.390625, "learning_rate": 0.00012295088576310838, "loss": 4.7199, "mean_token_accuracy": 0.2345777913928032, "num_tokens": 164559009.0, "step": 94880 }, { "entropy": 5.345713138580322, "epoch": 7.382338066524023, "grad_norm": 1.3828125, "learning_rate": 0.00012293045750691323, "loss": 4.5812, "mean_token_accuracy": 0.24821756333112716, "num_tokens": 164567811.0, "step": 94885 }, { "entropy": 5.401643991470337, "epoch": 7.38272709589574, "grad_norm": 1.3671875, "learning_rate": 0.0001229100315581315, "loss": 4.6503, "mean_token_accuracy": 0.23876250982284547, "num_tokens": 164576114.0, "step": 94890 }, { "entropy": 5.42862377166748, "epoch": 7.383116125267458, "grad_norm": 1.40625, "learning_rate": 0.0001228896079170729, "loss": 4.7854, "mean_token_accuracy": 0.23500944077968597, "num_tokens": 164584994.0, "step": 94895 }, { "entropy": 5.4134509563446045, "epoch": 7.383505154639176, "grad_norm": 1.4296875, "learning_rate": 0.00012286918658404734, "loss": 4.6169, "mean_token_accuracy": 0.2459103912115097, "num_tokens": 164594064.0, "step": 94900 }, { "entropy": 5.412442016601562, "epoch": 7.3838941840108925, "grad_norm": 1.484375, "learning_rate": 0.0001228487675593648, "loss": 4.6104, "mean_token_accuracy": 0.24115063846111298, "num_tokens": 164602786.0, "step": 94905 }, { "entropy": 5.341301965713501, "epoch": 7.38428321338261, "grad_norm": 1.5078125, "learning_rate": 0.00012282835084333497, "loss": 4.5499, "mean_token_accuracy": 0.25320925265550615, "num_tokens": 164610748.0, "step": 94910 }, { "entropy": 5.310116720199585, "epoch": 7.384672242754328, "grad_norm": 1.4140625, "learning_rate": 0.00012280793643626775, "loss": 4.595, "mean_token_accuracy": 0.24526146948337554, "num_tokens": 164619657.0, "step": 94915 }, { "entropy": 5.453195238113404, "epoch": 7.385061272126046, "grad_norm": 1.3515625, "learning_rate": 0.00012278752433847283, "loss": 4.7097, "mean_token_accuracy": 0.24205150157213212, "num_tokens": 164627787.0, "step": 94920 }, { "entropy": 5.284538745880127, "epoch": 7.385450301497763, "grad_norm": 1.3359375, "learning_rate": 0.00012276711455025996, "loss": 4.5206, "mean_token_accuracy": 0.2544983208179474, "num_tokens": 164636164.0, "step": 94925 }, { "entropy": 5.395350551605224, "epoch": 7.385839330869481, "grad_norm": 1.40625, "learning_rate": 0.00012274670707193886, "loss": 4.6282, "mean_token_accuracy": 0.24236219972372056, "num_tokens": 164645181.0, "step": 94930 }, { "entropy": 5.31056227684021, "epoch": 7.386228360241198, "grad_norm": 1.4375, "learning_rate": 0.0001227263019038191, "loss": 4.5499, "mean_token_accuracy": 0.2581384971737862, "num_tokens": 164654666.0, "step": 94935 }, { "entropy": 5.422539949417114, "epoch": 7.3866173896129155, "grad_norm": 1.4453125, "learning_rate": 0.0001227058990462104, "loss": 4.7644, "mean_token_accuracy": 0.23850566446781157, "num_tokens": 164663096.0, "step": 94940 }, { "entropy": 5.2748127460479735, "epoch": 7.387006418984633, "grad_norm": 1.4375, "learning_rate": 0.0001226854984994222, "loss": 4.5244, "mean_token_accuracy": 0.2507762089371681, "num_tokens": 164671980.0, "step": 94945 }, { "entropy": 5.270105457305908, "epoch": 7.387395448356351, "grad_norm": 1.3984375, "learning_rate": 0.0001226651002637642, "loss": 4.4041, "mean_token_accuracy": 0.267032690346241, "num_tokens": 164680175.0, "step": 94950 }, { "entropy": 5.367155647277832, "epoch": 7.387784477728069, "grad_norm": 1.4140625, "learning_rate": 0.00012264470433954577, "loss": 4.5825, "mean_token_accuracy": 0.2519281834363937, "num_tokens": 164688565.0, "step": 94955 }, { "entropy": 5.319106340408325, "epoch": 7.388173507099786, "grad_norm": 1.3515625, "learning_rate": 0.00012262431072707653, "loss": 4.5838, "mean_token_accuracy": 0.24923646003007888, "num_tokens": 164696770.0, "step": 94960 }, { "entropy": 5.365648317337036, "epoch": 7.388562536471504, "grad_norm": 1.421875, "learning_rate": 0.0001226039194266658, "loss": 4.5557, "mean_token_accuracy": 0.2549635708332062, "num_tokens": 164705605.0, "step": 94965 }, { "entropy": 5.424297285079956, "epoch": 7.388951565843221, "grad_norm": 1.453125, "learning_rate": 0.00012258353043862304, "loss": 4.6785, "mean_token_accuracy": 0.242553947865963, "num_tokens": 164714055.0, "step": 94970 }, { "entropy": 5.332719373703003, "epoch": 7.3893405952149385, "grad_norm": 1.3359375, "learning_rate": 0.00012256314376325758, "loss": 4.5453, "mean_token_accuracy": 0.2546596437692642, "num_tokens": 164723567.0, "step": 94975 }, { "entropy": 5.4244149684906, "epoch": 7.389729624586656, "grad_norm": 1.3671875, "learning_rate": 0.00012254275940087886, "loss": 4.6452, "mean_token_accuracy": 0.24257283806800842, "num_tokens": 164732720.0, "step": 94980 }, { "entropy": 5.397849035263062, "epoch": 7.390118653958374, "grad_norm": 1.4375, "learning_rate": 0.0001225223773517961, "loss": 4.6205, "mean_token_accuracy": 0.23756182193756104, "num_tokens": 164741161.0, "step": 94985 }, { "entropy": 5.423972511291504, "epoch": 7.390507683330092, "grad_norm": 1.3515625, "learning_rate": 0.0001225019976163184, "loss": 4.6596, "mean_token_accuracy": 0.23251235187053682, "num_tokens": 164749384.0, "step": 94990 }, { "entropy": 5.350456094741821, "epoch": 7.390896712701809, "grad_norm": 1.421875, "learning_rate": 0.00012248162019475533, "loss": 4.5295, "mean_token_accuracy": 0.2533285692334175, "num_tokens": 164757641.0, "step": 94995 }, { "entropy": 5.283652210235596, "epoch": 7.391285742073527, "grad_norm": 1.40625, "learning_rate": 0.00012246124508741584, "loss": 4.495, "mean_token_accuracy": 0.25785348415374754, "num_tokens": 164766106.0, "step": 95000 }, { "entropy": 5.343594884872436, "epoch": 7.391674771445244, "grad_norm": 1.3828125, "learning_rate": 0.0001224408722946092, "loss": 4.6195, "mean_token_accuracy": 0.24606130570173262, "num_tokens": 164775172.0, "step": 95005 }, { "entropy": 5.36291880607605, "epoch": 7.3920638008169615, "grad_norm": 1.3125, "learning_rate": 0.00012242050181664456, "loss": 4.5982, "mean_token_accuracy": 0.24788551032543182, "num_tokens": 164784165.0, "step": 95010 }, { "entropy": 5.427055788040161, "epoch": 7.392452830188679, "grad_norm": 1.46875, "learning_rate": 0.00012240013365383083, "loss": 4.6907, "mean_token_accuracy": 0.24425375759601592, "num_tokens": 164793246.0, "step": 95015 }, { "entropy": 5.302855539321899, "epoch": 7.392841859560397, "grad_norm": 1.5390625, "learning_rate": 0.00012237976780647727, "loss": 4.557, "mean_token_accuracy": 0.24770202934741975, "num_tokens": 164802259.0, "step": 95020 }, { "entropy": 5.373119115829468, "epoch": 7.3932308889321146, "grad_norm": 1.375, "learning_rate": 0.00012235940427489278, "loss": 4.5939, "mean_token_accuracy": 0.24522648602724076, "num_tokens": 164810755.0, "step": 95025 }, { "entropy": 5.3369721412658695, "epoch": 7.393619918303832, "grad_norm": 1.328125, "learning_rate": 0.0001223390430593864, "loss": 4.5961, "mean_token_accuracy": 0.24127318114042282, "num_tokens": 164819231.0, "step": 95030 }, { "entropy": 5.352329397201538, "epoch": 7.39400894767555, "grad_norm": 1.3046875, "learning_rate": 0.00012231868416026702, "loss": 4.5977, "mean_token_accuracy": 0.24860863089561464, "num_tokens": 164828006.0, "step": 95035 }, { "entropy": 5.382353353500366, "epoch": 7.394397977047267, "grad_norm": 1.4296875, "learning_rate": 0.00012229832757784366, "loss": 4.5938, "mean_token_accuracy": 0.25271220207214357, "num_tokens": 164836806.0, "step": 95040 }, { "entropy": 5.285083627700805, "epoch": 7.3947870064189845, "grad_norm": 1.328125, "learning_rate": 0.00012227797331242502, "loss": 4.5277, "mean_token_accuracy": 0.24739310443401336, "num_tokens": 164845258.0, "step": 95045 }, { "entropy": 5.2635438442230225, "epoch": 7.395176035790702, "grad_norm": 1.390625, "learning_rate": 0.00012225762136432015, "loss": 4.5664, "mean_token_accuracy": 0.24888639748096467, "num_tokens": 164854242.0, "step": 95050 }, { "entropy": 5.338901138305664, "epoch": 7.39556506516242, "grad_norm": 1.3515625, "learning_rate": 0.0001222372717338377, "loss": 4.6262, "mean_token_accuracy": 0.243410062789917, "num_tokens": 164863799.0, "step": 95055 }, { "entropy": 5.398573732376098, "epoch": 7.3959540945341375, "grad_norm": 1.46875, "learning_rate": 0.00012221692442128648, "loss": 4.614, "mean_token_accuracy": 0.24854376465082167, "num_tokens": 164872371.0, "step": 95060 }, { "entropy": 5.3273396492004395, "epoch": 7.396343123905855, "grad_norm": 1.359375, "learning_rate": 0.00012219657942697532, "loss": 4.5711, "mean_token_accuracy": 0.24667229652404785, "num_tokens": 164881118.0, "step": 95065 }, { "entropy": 5.30540714263916, "epoch": 7.396732153277572, "grad_norm": 1.515625, "learning_rate": 0.0001221762367512128, "loss": 4.5499, "mean_token_accuracy": 0.25120449215173724, "num_tokens": 164889896.0, "step": 95070 }, { "entropy": 5.387515592575073, "epoch": 7.39712118264929, "grad_norm": 1.34375, "learning_rate": 0.00012215589639430772, "loss": 4.694, "mean_token_accuracy": 0.2404867574572563, "num_tokens": 164898455.0, "step": 95075 }, { "entropy": 5.336265945434571, "epoch": 7.3975102120210074, "grad_norm": 1.34375, "learning_rate": 0.00012213555835656855, "loss": 4.5923, "mean_token_accuracy": 0.24309456944465638, "num_tokens": 164907556.0, "step": 95080 }, { "entropy": 5.227671432495117, "epoch": 7.397899241392725, "grad_norm": 1.5390625, "learning_rate": 0.00012211522263830407, "loss": 4.4235, "mean_token_accuracy": 0.26744659096002577, "num_tokens": 164916312.0, "step": 95085 }, { "entropy": 5.372040033340454, "epoch": 7.398288270764443, "grad_norm": 1.5390625, "learning_rate": 0.00012209488923982275, "loss": 4.5553, "mean_token_accuracy": 0.24639788419008254, "num_tokens": 164924761.0, "step": 95090 }, { "entropy": 5.394526147842408, "epoch": 7.3986773001361605, "grad_norm": 1.421875, "learning_rate": 0.00012207455816143302, "loss": 4.673, "mean_token_accuracy": 0.24732169955968858, "num_tokens": 164933781.0, "step": 95095 }, { "entropy": 5.378658819198608, "epoch": 7.399066329507878, "grad_norm": 1.4296875, "learning_rate": 0.00012205422940344351, "loss": 4.6141, "mean_token_accuracy": 0.24725998491048812, "num_tokens": 164942133.0, "step": 95100 }, { "entropy": 5.392763662338257, "epoch": 7.399455358879595, "grad_norm": 1.359375, "learning_rate": 0.0001220339029661626, "loss": 4.6581, "mean_token_accuracy": 0.24658043533563614, "num_tokens": 164950489.0, "step": 95105 }, { "entropy": 5.380920553207398, "epoch": 7.399844388251313, "grad_norm": 1.328125, "learning_rate": 0.00012201357884989878, "loss": 4.5999, "mean_token_accuracy": 0.25295215249061587, "num_tokens": 164958892.0, "step": 95110 }, { "entropy": 5.381988906860352, "epoch": 7.40023341762303, "grad_norm": 1.328125, "learning_rate": 0.00012199325705496033, "loss": 4.5035, "mean_token_accuracy": 0.2544448062777519, "num_tokens": 164966771.0, "step": 95115 }, { "entropy": 5.397501516342163, "epoch": 7.400622446994748, "grad_norm": 1.3359375, "learning_rate": 0.00012197293758165578, "loss": 4.6395, "mean_token_accuracy": 0.2481552019715309, "num_tokens": 164975315.0, "step": 95120 }, { "entropy": 5.34716911315918, "epoch": 7.401011476366466, "grad_norm": 1.3125, "learning_rate": 0.00012195262043029324, "loss": 4.5855, "mean_token_accuracy": 0.24119466096162795, "num_tokens": 164984519.0, "step": 95125 }, { "entropy": 5.311775207519531, "epoch": 7.4014005057381835, "grad_norm": 1.3515625, "learning_rate": 0.00012193230560118109, "loss": 4.6291, "mean_token_accuracy": 0.23924950361251832, "num_tokens": 164993749.0, "step": 95130 }, { "entropy": 5.3775371551513675, "epoch": 7.4017895351099, "grad_norm": 1.2890625, "learning_rate": 0.00012191199309462763, "loss": 4.6452, "mean_token_accuracy": 0.24290068149566652, "num_tokens": 165002380.0, "step": 95135 }, { "entropy": 5.29567666053772, "epoch": 7.402178564481618, "grad_norm": 1.390625, "learning_rate": 0.00012189168291094092, "loss": 4.4718, "mean_token_accuracy": 0.253648068010807, "num_tokens": 165010613.0, "step": 95140 }, { "entropy": 5.448227977752685, "epoch": 7.402567593853336, "grad_norm": 1.3671875, "learning_rate": 0.00012187137505042934, "loss": 4.6962, "mean_token_accuracy": 0.2373233899474144, "num_tokens": 165018863.0, "step": 95145 }, { "entropy": 5.420655012130737, "epoch": 7.402956623225053, "grad_norm": 1.296875, "learning_rate": 0.00012185106951340081, "loss": 4.6346, "mean_token_accuracy": 0.2388949513435364, "num_tokens": 165027331.0, "step": 95150 }, { "entropy": 5.350565004348755, "epoch": 7.403345652596771, "grad_norm": 1.3671875, "learning_rate": 0.00012183076630016363, "loss": 4.5062, "mean_token_accuracy": 0.2611319452524185, "num_tokens": 165036690.0, "step": 95155 }, { "entropy": 5.334790802001953, "epoch": 7.403734681968489, "grad_norm": 1.4296875, "learning_rate": 0.00012181046541102569, "loss": 4.5606, "mean_token_accuracy": 0.24774931222200394, "num_tokens": 165044909.0, "step": 95160 }, { "entropy": 5.355012989044189, "epoch": 7.4041237113402065, "grad_norm": 1.3515625, "learning_rate": 0.0001217901668462952, "loss": 4.5877, "mean_token_accuracy": 0.24723540097475052, "num_tokens": 165053965.0, "step": 95165 }, { "entropy": 5.349900388717652, "epoch": 7.404512740711923, "grad_norm": 1.359375, "learning_rate": 0.00012176987060628004, "loss": 4.6182, "mean_token_accuracy": 0.24845463931560516, "num_tokens": 165062782.0, "step": 95170 }, { "entropy": 5.434891414642334, "epoch": 7.404901770083641, "grad_norm": 1.34375, "learning_rate": 0.00012174957669128818, "loss": 4.6576, "mean_token_accuracy": 0.23709941357374192, "num_tokens": 165071697.0, "step": 95175 }, { "entropy": 5.4279248237609865, "epoch": 7.405290799455359, "grad_norm": 1.3828125, "learning_rate": 0.00012172928510162761, "loss": 4.7387, "mean_token_accuracy": 0.2408421203494072, "num_tokens": 165081200.0, "step": 95180 }, { "entropy": 5.360916662216186, "epoch": 7.405679828827076, "grad_norm": 1.3984375, "learning_rate": 0.00012170899583760611, "loss": 4.5959, "mean_token_accuracy": 0.24289380013942719, "num_tokens": 165090070.0, "step": 95185 }, { "entropy": 5.384060001373291, "epoch": 7.406068858198794, "grad_norm": 1.5, "learning_rate": 0.0001216887088995316, "loss": 4.6002, "mean_token_accuracy": 0.24444034844636917, "num_tokens": 165098429.0, "step": 95190 }, { "entropy": 5.367804431915284, "epoch": 7.406457887570512, "grad_norm": 1.1796875, "learning_rate": 0.00012166842428771201, "loss": 4.625, "mean_token_accuracy": 0.24509040862321854, "num_tokens": 165108645.0, "step": 95195 }, { "entropy": 5.399759817123413, "epoch": 7.4068469169422295, "grad_norm": 1.4765625, "learning_rate": 0.00012164814200245496, "loss": 4.5879, "mean_token_accuracy": 0.24854462444782258, "num_tokens": 165116807.0, "step": 95200 }, { "entropy": 5.372501039505005, "epoch": 7.407235946313946, "grad_norm": 1.390625, "learning_rate": 0.00012162786204406832, "loss": 4.6393, "mean_token_accuracy": 0.24301631152629852, "num_tokens": 165126080.0, "step": 95205 }, { "entropy": 5.339708852767944, "epoch": 7.407624975685664, "grad_norm": 1.484375, "learning_rate": 0.0001216075844128597, "loss": 4.5758, "mean_token_accuracy": 0.2411342442035675, "num_tokens": 165135177.0, "step": 95210 }, { "entropy": 5.395641803741455, "epoch": 7.408014005057382, "grad_norm": 1.375, "learning_rate": 0.0001215873091091369, "loss": 4.6786, "mean_token_accuracy": 0.23944492638111115, "num_tokens": 165144055.0, "step": 95215 }, { "entropy": 5.304111051559448, "epoch": 7.408403034429099, "grad_norm": 1.3984375, "learning_rate": 0.00012156703613320744, "loss": 4.5157, "mean_token_accuracy": 0.2535321518778801, "num_tokens": 165152604.0, "step": 95220 }, { "entropy": 5.366166877746582, "epoch": 7.408792063800817, "grad_norm": 1.5, "learning_rate": 0.00012154676548537905, "loss": 4.5824, "mean_token_accuracy": 0.24678106158971785, "num_tokens": 165160909.0, "step": 95225 }, { "entropy": 5.306424951553344, "epoch": 7.409181093172535, "grad_norm": 1.2578125, "learning_rate": 0.00012152649716595919, "loss": 4.4929, "mean_token_accuracy": 0.2608799129724503, "num_tokens": 165170243.0, "step": 95230 }, { "entropy": 5.366546106338501, "epoch": 7.4095701225442525, "grad_norm": 1.453125, "learning_rate": 0.00012150623117525553, "loss": 4.5955, "mean_token_accuracy": 0.24251407384872437, "num_tokens": 165178654.0, "step": 95235 }, { "entropy": 5.310669660568237, "epoch": 7.409959151915969, "grad_norm": 1.4140625, "learning_rate": 0.00012148596751357541, "loss": 4.5532, "mean_token_accuracy": 0.2533928230404854, "num_tokens": 165187971.0, "step": 95240 }, { "entropy": 5.3183252811431885, "epoch": 7.410348181287687, "grad_norm": 1.4140625, "learning_rate": 0.00012146570618122648, "loss": 4.5254, "mean_token_accuracy": 0.24964617043733597, "num_tokens": 165196321.0, "step": 95245 }, { "entropy": 5.409750938415527, "epoch": 7.410737210659405, "grad_norm": 1.46875, "learning_rate": 0.00012144544717851607, "loss": 4.6164, "mean_token_accuracy": 0.24363637417554856, "num_tokens": 165205290.0, "step": 95250 }, { "entropy": 5.365794467926025, "epoch": 7.411126240031122, "grad_norm": 1.453125, "learning_rate": 0.00012142519050575147, "loss": 4.6245, "mean_token_accuracy": 0.24321460127830505, "num_tokens": 165214869.0, "step": 95255 }, { "entropy": 5.3992938041687015, "epoch": 7.41151526940284, "grad_norm": 1.5, "learning_rate": 0.00012140493616324029, "loss": 4.6107, "mean_token_accuracy": 0.24865069091320038, "num_tokens": 165222911.0, "step": 95260 }, { "entropy": 5.350206899642944, "epoch": 7.411904298774558, "grad_norm": 1.3046875, "learning_rate": 0.00012138468415128966, "loss": 4.5736, "mean_token_accuracy": 0.24446709752082824, "num_tokens": 165231784.0, "step": 95265 }, { "entropy": 5.337639188766479, "epoch": 7.412293328146275, "grad_norm": 1.359375, "learning_rate": 0.00012136443447020703, "loss": 4.5812, "mean_token_accuracy": 0.2519434094429016, "num_tokens": 165241193.0, "step": 95270 }, { "entropy": 5.335296726226806, "epoch": 7.412682357517992, "grad_norm": 1.421875, "learning_rate": 0.00012134418712029948, "loss": 4.5649, "mean_token_accuracy": 0.2500278651714325, "num_tokens": 165249737.0, "step": 95275 }, { "entropy": 5.305316305160522, "epoch": 7.41307138688971, "grad_norm": 1.3359375, "learning_rate": 0.00012132394210187442, "loss": 4.4905, "mean_token_accuracy": 0.25234214663505555, "num_tokens": 165258935.0, "step": 95280 }, { "entropy": 5.368996429443359, "epoch": 7.413460416261428, "grad_norm": 1.5078125, "learning_rate": 0.00012130369941523893, "loss": 4.6624, "mean_token_accuracy": 0.2401558369398117, "num_tokens": 165268236.0, "step": 95285 }, { "entropy": 5.30174446105957, "epoch": 7.413849445633145, "grad_norm": 1.359375, "learning_rate": 0.00012128345906070007, "loss": 4.587, "mean_token_accuracy": 0.2445603147149086, "num_tokens": 165278014.0, "step": 95290 }, { "entropy": 5.321513032913208, "epoch": 7.414238475004863, "grad_norm": 1.265625, "learning_rate": 0.00012126322103856514, "loss": 4.6269, "mean_token_accuracy": 0.24154505580663682, "num_tokens": 165287210.0, "step": 95295 }, { "entropy": 5.369547414779663, "epoch": 7.414627504376581, "grad_norm": 1.40625, "learning_rate": 0.00012124298534914108, "loss": 4.6022, "mean_token_accuracy": 0.24651080667972564, "num_tokens": 165295811.0, "step": 95300 }, { "entropy": 5.4268190383911135, "epoch": 7.415016533748298, "grad_norm": 1.265625, "learning_rate": 0.00012122275199273505, "loss": 4.6373, "mean_token_accuracy": 0.2454831197857857, "num_tokens": 165305586.0, "step": 95305 }, { "entropy": 5.34252028465271, "epoch": 7.415405563120015, "grad_norm": 1.3671875, "learning_rate": 0.00012120252096965391, "loss": 4.5759, "mean_token_accuracy": 0.24288100600242615, "num_tokens": 165314538.0, "step": 95310 }, { "entropy": 5.449515247344971, "epoch": 7.415794592491733, "grad_norm": 1.390625, "learning_rate": 0.0001211822922802048, "loss": 4.6833, "mean_token_accuracy": 0.23488292694091797, "num_tokens": 165322783.0, "step": 95315 }, { "entropy": 5.4323282718658445, "epoch": 7.416183621863451, "grad_norm": 1.4296875, "learning_rate": 0.0001211620659246945, "loss": 4.7112, "mean_token_accuracy": 0.23923946171998978, "num_tokens": 165331640.0, "step": 95320 }, { "entropy": 5.408011960983276, "epoch": 7.416572651235168, "grad_norm": 1.3671875, "learning_rate": 0.00012114184190343001, "loss": 4.6592, "mean_token_accuracy": 0.2387697383761406, "num_tokens": 165340301.0, "step": 95325 }, { "entropy": 5.347905063629151, "epoch": 7.416961680606886, "grad_norm": 1.3671875, "learning_rate": 0.00012112162021671824, "loss": 4.5926, "mean_token_accuracy": 0.24666311144828795, "num_tokens": 165348336.0, "step": 95330 }, { "entropy": 5.360327100753784, "epoch": 7.417350709978604, "grad_norm": 1.5234375, "learning_rate": 0.0001211014008648659, "loss": 4.6322, "mean_token_accuracy": 0.23925192803144454, "num_tokens": 165357821.0, "step": 95335 }, { "entropy": 5.323946762084961, "epoch": 7.417739739350321, "grad_norm": 1.4609375, "learning_rate": 0.0001210811838481799, "loss": 4.5524, "mean_token_accuracy": 0.24809849709272386, "num_tokens": 165365850.0, "step": 95340 }, { "entropy": 5.321326112747192, "epoch": 7.418128768722038, "grad_norm": 1.3046875, "learning_rate": 0.00012106096916696689, "loss": 4.5835, "mean_token_accuracy": 0.24456214904785156, "num_tokens": 165374734.0, "step": 95345 }, { "entropy": 5.381647253036499, "epoch": 7.418517798093756, "grad_norm": 1.3515625, "learning_rate": 0.00012104075682153371, "loss": 4.6586, "mean_token_accuracy": 0.23327119052410125, "num_tokens": 165383444.0, "step": 95350 }, { "entropy": 5.3334815979003904, "epoch": 7.418906827465474, "grad_norm": 1.3203125, "learning_rate": 0.00012102054681218695, "loss": 4.5656, "mean_token_accuracy": 0.25162993669509887, "num_tokens": 165392856.0, "step": 95355 }, { "entropy": 5.349500322341919, "epoch": 7.419295856837191, "grad_norm": 1.4765625, "learning_rate": 0.00012100033913923337, "loss": 4.571, "mean_token_accuracy": 0.2486968457698822, "num_tokens": 165401340.0, "step": 95360 }, { "entropy": 5.340807390213013, "epoch": 7.419684886208909, "grad_norm": 1.328125, "learning_rate": 0.0001209801338029795, "loss": 4.5077, "mean_token_accuracy": 0.2533141955733299, "num_tokens": 165409553.0, "step": 95365 }, { "entropy": 5.3534300327301025, "epoch": 7.420073915580627, "grad_norm": 1.4375, "learning_rate": 0.00012095993080373191, "loss": 4.6287, "mean_token_accuracy": 0.2430339425802231, "num_tokens": 165418383.0, "step": 95370 }, { "entropy": 5.300458526611328, "epoch": 7.420462944952344, "grad_norm": 1.3984375, "learning_rate": 0.00012093973014179727, "loss": 4.5262, "mean_token_accuracy": 0.2545942232012749, "num_tokens": 165427118.0, "step": 95375 }, { "entropy": 5.401031017303467, "epoch": 7.420851974324061, "grad_norm": 1.3203125, "learning_rate": 0.00012091953181748191, "loss": 4.6781, "mean_token_accuracy": 0.23979877978563308, "num_tokens": 165435447.0, "step": 95380 }, { "entropy": 5.311152601242066, "epoch": 7.421241003695779, "grad_norm": 1.453125, "learning_rate": 0.00012089933583109249, "loss": 4.5366, "mean_token_accuracy": 0.2533645197749138, "num_tokens": 165443744.0, "step": 95385 }, { "entropy": 5.37006311416626, "epoch": 7.421630033067497, "grad_norm": 1.21875, "learning_rate": 0.00012087914218293531, "loss": 4.6071, "mean_token_accuracy": 0.25137185752391816, "num_tokens": 165452855.0, "step": 95390 }, { "entropy": 5.405819129943848, "epoch": 7.422019062439214, "grad_norm": 1.4609375, "learning_rate": 0.00012085895087331684, "loss": 4.5676, "mean_token_accuracy": 0.24899381995201111, "num_tokens": 165461027.0, "step": 95395 }, { "entropy": 5.367409420013428, "epoch": 7.422408091810932, "grad_norm": 1.3828125, "learning_rate": 0.00012083876190254351, "loss": 4.6618, "mean_token_accuracy": 0.24195487350225447, "num_tokens": 165469879.0, "step": 95400 }, { "entropy": 5.349075508117676, "epoch": 7.422797121182649, "grad_norm": 1.3984375, "learning_rate": 0.00012081857527092155, "loss": 4.6179, "mean_token_accuracy": 0.24573010802268982, "num_tokens": 165478793.0, "step": 95405 }, { "entropy": 5.34460220336914, "epoch": 7.423186150554367, "grad_norm": 1.4296875, "learning_rate": 0.00012079839097875734, "loss": 4.5964, "mean_token_accuracy": 0.2502253815531731, "num_tokens": 165486578.0, "step": 95410 }, { "entropy": 5.269533491134643, "epoch": 7.423575179926084, "grad_norm": 1.2890625, "learning_rate": 0.00012077820902635706, "loss": 4.4815, "mean_token_accuracy": 0.25794602930545807, "num_tokens": 165495795.0, "step": 95415 }, { "entropy": 5.285582733154297, "epoch": 7.423964209297802, "grad_norm": 1.484375, "learning_rate": 0.00012075802941402707, "loss": 4.4881, "mean_token_accuracy": 0.2512006416916847, "num_tokens": 165504340.0, "step": 95420 }, { "entropy": 5.373102712631225, "epoch": 7.42435323866952, "grad_norm": 1.4296875, "learning_rate": 0.00012073785214207338, "loss": 4.5765, "mean_token_accuracy": 0.24481986761093139, "num_tokens": 165512923.0, "step": 95425 }, { "entropy": 5.347365856170654, "epoch": 7.424742268041237, "grad_norm": 1.3671875, "learning_rate": 0.00012071767721080234, "loss": 4.5741, "mean_token_accuracy": 0.23958317935466766, "num_tokens": 165521305.0, "step": 95430 }, { "entropy": 5.4263581275939945, "epoch": 7.425131297412955, "grad_norm": 1.375, "learning_rate": 0.0001206975046205199, "loss": 4.6527, "mean_token_accuracy": 0.24770910888910294, "num_tokens": 165529349.0, "step": 95435 }, { "entropy": 5.403101587295533, "epoch": 7.425520326784672, "grad_norm": 1.3671875, "learning_rate": 0.0001206773343715323, "loss": 4.6595, "mean_token_accuracy": 0.23513127267360687, "num_tokens": 165539191.0, "step": 95440 }, { "entropy": 5.386759662628174, "epoch": 7.42590935615639, "grad_norm": 1.40625, "learning_rate": 0.00012065716646414555, "loss": 4.6018, "mean_token_accuracy": 0.2391947865486145, "num_tokens": 165547801.0, "step": 95445 }, { "entropy": 5.344751071929932, "epoch": 7.426298385528107, "grad_norm": 1.4609375, "learning_rate": 0.00012063700089866556, "loss": 4.6005, "mean_token_accuracy": 0.24736715108156204, "num_tokens": 165555889.0, "step": 95450 }, { "entropy": 5.365631437301635, "epoch": 7.426687414899825, "grad_norm": 1.4609375, "learning_rate": 0.00012061683767539836, "loss": 4.5367, "mean_token_accuracy": 0.2534312218427658, "num_tokens": 165563709.0, "step": 95455 }, { "entropy": 5.315147447586059, "epoch": 7.427076444271543, "grad_norm": 1.25, "learning_rate": 0.00012059667679464994, "loss": 4.5598, "mean_token_accuracy": 0.24474878758192062, "num_tokens": 165572843.0, "step": 95460 }, { "entropy": 5.477127027511597, "epoch": 7.42746547364326, "grad_norm": 1.328125, "learning_rate": 0.00012057651825672628, "loss": 4.7301, "mean_token_accuracy": 0.2277245193719864, "num_tokens": 165581993.0, "step": 95465 }, { "entropy": 5.394501829147339, "epoch": 7.427854503014977, "grad_norm": 1.4296875, "learning_rate": 0.00012055636206193314, "loss": 4.5787, "mean_token_accuracy": 0.24280174523591996, "num_tokens": 165590874.0, "step": 95470 }, { "entropy": 5.418191385269165, "epoch": 7.428243532386695, "grad_norm": 1.40625, "learning_rate": 0.0001205362082105763, "loss": 4.6373, "mean_token_accuracy": 0.24172065258026124, "num_tokens": 165599305.0, "step": 95475 }, { "entropy": 5.3658219337463375, "epoch": 7.428632561758413, "grad_norm": 1.3828125, "learning_rate": 0.00012051605670296174, "loss": 4.6121, "mean_token_accuracy": 0.25252673029899597, "num_tokens": 165608101.0, "step": 95480 }, { "entropy": 5.299737596511841, "epoch": 7.42902159113013, "grad_norm": 1.296875, "learning_rate": 0.00012049590753939505, "loss": 4.5499, "mean_token_accuracy": 0.2471553310751915, "num_tokens": 165617306.0, "step": 95485 }, { "entropy": 5.466805267333984, "epoch": 7.429410620501848, "grad_norm": 1.4375, "learning_rate": 0.00012047576072018212, "loss": 4.7095, "mean_token_accuracy": 0.2512857973575592, "num_tokens": 165625343.0, "step": 95490 }, { "entropy": 5.430821895599365, "epoch": 7.429799649873566, "grad_norm": 1.40625, "learning_rate": 0.00012045561624562853, "loss": 4.6443, "mean_token_accuracy": 0.2439176321029663, "num_tokens": 165633597.0, "step": 95495 }, { "entropy": 5.42846999168396, "epoch": 7.430188679245283, "grad_norm": 1.4375, "learning_rate": 0.00012043547411603999, "loss": 4.65, "mean_token_accuracy": 0.24697925746440888, "num_tokens": 165642373.0, "step": 95500 }, { "entropy": 5.281901693344116, "epoch": 7.430577708617, "grad_norm": 1.4453125, "learning_rate": 0.00012041533433172208, "loss": 4.4814, "mean_token_accuracy": 0.2630492985248566, "num_tokens": 165650619.0, "step": 95505 }, { "entropy": 5.334194898605347, "epoch": 7.430966737988718, "grad_norm": 1.390625, "learning_rate": 0.00012039519689298049, "loss": 4.5959, "mean_token_accuracy": 0.2436278060078621, "num_tokens": 165658982.0, "step": 95510 }, { "entropy": 5.343293142318726, "epoch": 7.431355767360436, "grad_norm": 1.2578125, "learning_rate": 0.00012037506180012064, "loss": 4.5994, "mean_token_accuracy": 0.253036929666996, "num_tokens": 165668551.0, "step": 95515 }, { "entropy": 5.383273315429688, "epoch": 7.431744796732153, "grad_norm": 1.3515625, "learning_rate": 0.00012035492905344813, "loss": 4.6171, "mean_token_accuracy": 0.24843266904354094, "num_tokens": 165677926.0, "step": 95520 }, { "entropy": 5.38317985534668, "epoch": 7.432133826103871, "grad_norm": 1.2734375, "learning_rate": 0.0001203347986532685, "loss": 4.6536, "mean_token_accuracy": 0.24124307930469513, "num_tokens": 165687090.0, "step": 95525 }, { "entropy": 5.370198059082031, "epoch": 7.432522855475589, "grad_norm": 1.4296875, "learning_rate": 0.00012031467059988702, "loss": 4.547, "mean_token_accuracy": 0.25004076212644577, "num_tokens": 165695057.0, "step": 95530 }, { "entropy": 5.353267860412598, "epoch": 7.432911884847306, "grad_norm": 1.4296875, "learning_rate": 0.00012029454489360929, "loss": 4.5897, "mean_token_accuracy": 0.24847921282052993, "num_tokens": 165703664.0, "step": 95535 }, { "entropy": 5.397789716720581, "epoch": 7.433300914219023, "grad_norm": 1.4453125, "learning_rate": 0.00012027442153474054, "loss": 4.6919, "mean_token_accuracy": 0.23618103563785553, "num_tokens": 165712221.0, "step": 95540 }, { "entropy": 5.3736083030700685, "epoch": 7.433689943590741, "grad_norm": 1.3515625, "learning_rate": 0.00012025430052358625, "loss": 4.6105, "mean_token_accuracy": 0.2380044773221016, "num_tokens": 165720728.0, "step": 95545 }, { "entropy": 5.30751051902771, "epoch": 7.434078972962459, "grad_norm": 1.3984375, "learning_rate": 0.00012023418186045164, "loss": 4.4851, "mean_token_accuracy": 0.25109519213438036, "num_tokens": 165729361.0, "step": 95550 }, { "entropy": 5.364740705490112, "epoch": 7.434468002334176, "grad_norm": 1.3828125, "learning_rate": 0.00012021406554564194, "loss": 4.6251, "mean_token_accuracy": 0.2447954922914505, "num_tokens": 165737890.0, "step": 95555 }, { "entropy": 5.427466964721679, "epoch": 7.434857031705894, "grad_norm": 1.515625, "learning_rate": 0.00012019395157946245, "loss": 4.6899, "mean_token_accuracy": 0.23436451703310013, "num_tokens": 165746357.0, "step": 95560 }, { "entropy": 5.416901731491089, "epoch": 7.435246061077612, "grad_norm": 1.46875, "learning_rate": 0.0001201738399622183, "loss": 4.5995, "mean_token_accuracy": 0.24728408008813857, "num_tokens": 165754484.0, "step": 95565 }, { "entropy": 5.36837739944458, "epoch": 7.435635090449329, "grad_norm": 1.3125, "learning_rate": 0.00012015373069421474, "loss": 4.6161, "mean_token_accuracy": 0.25039729923009874, "num_tokens": 165763937.0, "step": 95570 }, { "entropy": 5.385457181930542, "epoch": 7.436024119821046, "grad_norm": 1.3828125, "learning_rate": 0.00012013362377575683, "loss": 4.6171, "mean_token_accuracy": 0.24384610801935197, "num_tokens": 165772907.0, "step": 95575 }, { "entropy": 5.3442497730255125, "epoch": 7.436413149192764, "grad_norm": 1.3671875, "learning_rate": 0.00012011351920714972, "loss": 4.5537, "mean_token_accuracy": 0.253333705663681, "num_tokens": 165781675.0, "step": 95580 }, { "entropy": 5.308239364624024, "epoch": 7.436802178564482, "grad_norm": 1.40625, "learning_rate": 0.00012009341698869839, "loss": 4.4638, "mean_token_accuracy": 0.2530152678489685, "num_tokens": 165790245.0, "step": 95585 }, { "entropy": 5.334100818634033, "epoch": 7.437191207936199, "grad_norm": 1.4921875, "learning_rate": 0.00012007331712070787, "loss": 4.5183, "mean_token_accuracy": 0.2582956373691559, "num_tokens": 165798049.0, "step": 95590 }, { "entropy": 5.303201007843017, "epoch": 7.437580237307917, "grad_norm": 1.453125, "learning_rate": 0.00012005321960348325, "loss": 4.5947, "mean_token_accuracy": 0.24198537617921828, "num_tokens": 165806550.0, "step": 95595 }, { "entropy": 5.298541927337647, "epoch": 7.437969266679635, "grad_norm": 1.2890625, "learning_rate": 0.00012003312443732932, "loss": 4.5607, "mean_token_accuracy": 0.24498239606618882, "num_tokens": 165815008.0, "step": 95600 }, { "entropy": 5.375693416595459, "epoch": 7.4383582960513515, "grad_norm": 1.4296875, "learning_rate": 0.00012001303162255114, "loss": 4.6453, "mean_token_accuracy": 0.24309327751398085, "num_tokens": 165823980.0, "step": 95605 }, { "entropy": 5.524424028396607, "epoch": 7.438747325423069, "grad_norm": 1.4296875, "learning_rate": 0.00011999294115945347, "loss": 4.7343, "mean_token_accuracy": 0.24227204769849778, "num_tokens": 165831895.0, "step": 95610 }, { "entropy": 5.458871507644654, "epoch": 7.439136354794787, "grad_norm": 1.3515625, "learning_rate": 0.00011997285304834127, "loss": 4.6755, "mean_token_accuracy": 0.23641749918460847, "num_tokens": 165840810.0, "step": 95615 }, { "entropy": 5.3983148574829105, "epoch": 7.4395253841665046, "grad_norm": 1.328125, "learning_rate": 0.00011995276728951919, "loss": 4.589, "mean_token_accuracy": 0.24555610716342927, "num_tokens": 165849149.0, "step": 95620 }, { "entropy": 5.431836652755737, "epoch": 7.439914413538222, "grad_norm": 1.4453125, "learning_rate": 0.00011993268388329216, "loss": 4.6328, "mean_token_accuracy": 0.2510825663805008, "num_tokens": 165858122.0, "step": 95625 }, { "entropy": 5.404377794265747, "epoch": 7.44030344290994, "grad_norm": 1.3828125, "learning_rate": 0.00011991260282996483, "loss": 4.6624, "mean_token_accuracy": 0.24317525029182435, "num_tokens": 165867296.0, "step": 95630 }, { "entropy": 5.367813396453857, "epoch": 7.440692472281658, "grad_norm": 1.4375, "learning_rate": 0.00011989252412984183, "loss": 4.5842, "mean_token_accuracy": 0.2521876871585846, "num_tokens": 165875660.0, "step": 95635 }, { "entropy": 5.416261148452759, "epoch": 7.4410815016533745, "grad_norm": 1.3671875, "learning_rate": 0.00011987244778322797, "loss": 4.6175, "mean_token_accuracy": 0.23864393532276154, "num_tokens": 165883529.0, "step": 95640 }, { "entropy": 5.396754550933838, "epoch": 7.441470531025092, "grad_norm": 1.375, "learning_rate": 0.00011985237379042775, "loss": 4.7279, "mean_token_accuracy": 0.23898280113935472, "num_tokens": 165892612.0, "step": 95645 }, { "entropy": 5.317754554748535, "epoch": 7.44185956039681, "grad_norm": 1.328125, "learning_rate": 0.00011983230215174586, "loss": 4.5539, "mean_token_accuracy": 0.25641758292913436, "num_tokens": 165901247.0, "step": 95650 }, { "entropy": 5.444772672653198, "epoch": 7.4422485897685275, "grad_norm": 1.3828125, "learning_rate": 0.0001198122328674867, "loss": 4.707, "mean_token_accuracy": 0.24594861418008804, "num_tokens": 165909655.0, "step": 95655 }, { "entropy": 5.3747947216033936, "epoch": 7.442637619140245, "grad_norm": 1.453125, "learning_rate": 0.00011979216593795502, "loss": 4.6219, "mean_token_accuracy": 0.2442621573805809, "num_tokens": 165918374.0, "step": 95660 }, { "entropy": 5.346795272827149, "epoch": 7.443026648511963, "grad_norm": 1.375, "learning_rate": 0.00011977210136345516, "loss": 4.6367, "mean_token_accuracy": 0.24686167389154434, "num_tokens": 165926883.0, "step": 95665 }, { "entropy": 5.362995672225952, "epoch": 7.44341567788368, "grad_norm": 1.375, "learning_rate": 0.00011975203914429157, "loss": 4.5725, "mean_token_accuracy": 0.2416232004761696, "num_tokens": 165936112.0, "step": 95670 }, { "entropy": 5.39398603439331, "epoch": 7.4438047072553974, "grad_norm": 1.359375, "learning_rate": 0.00011973197928076872, "loss": 4.6294, "mean_token_accuracy": 0.23947879523038865, "num_tokens": 165945044.0, "step": 95675 }, { "entropy": 5.351245164871216, "epoch": 7.444193736627115, "grad_norm": 1.4453125, "learning_rate": 0.00011971192177319089, "loss": 4.4969, "mean_token_accuracy": 0.25778488218784334, "num_tokens": 165953513.0, "step": 95680 }, { "entropy": 5.3747358322143555, "epoch": 7.444582765998833, "grad_norm": 1.4921875, "learning_rate": 0.00011969186662186256, "loss": 4.5913, "mean_token_accuracy": 0.2514837920665741, "num_tokens": 165962360.0, "step": 95685 }, { "entropy": 5.343138647079468, "epoch": 7.4449717953705505, "grad_norm": 1.34375, "learning_rate": 0.00011967181382708787, "loss": 4.6475, "mean_token_accuracy": 0.24636254757642745, "num_tokens": 165971512.0, "step": 95690 }, { "entropy": 5.365707015991211, "epoch": 7.445360824742268, "grad_norm": 1.3359375, "learning_rate": 0.00011965176338917125, "loss": 4.6436, "mean_token_accuracy": 0.24505784064531327, "num_tokens": 165980759.0, "step": 95695 }, { "entropy": 5.387465143203736, "epoch": 7.445749854113986, "grad_norm": 1.34375, "learning_rate": 0.0001196317153084168, "loss": 4.5935, "mean_token_accuracy": 0.24762510657310485, "num_tokens": 165988729.0, "step": 95700 }, { "entropy": 5.36963963508606, "epoch": 7.446138883485704, "grad_norm": 1.2734375, "learning_rate": 0.00011961166958512883, "loss": 4.5838, "mean_token_accuracy": 0.2451114609837532, "num_tokens": 165998229.0, "step": 95705 }, { "entropy": 5.3854756355285645, "epoch": 7.44652791285742, "grad_norm": 1.375, "learning_rate": 0.00011959162621961144, "loss": 4.5873, "mean_token_accuracy": 0.2519699841737747, "num_tokens": 166006636.0, "step": 95710 }, { "entropy": 5.405295658111572, "epoch": 7.446916942229138, "grad_norm": 1.359375, "learning_rate": 0.00011957158521216872, "loss": 4.6053, "mean_token_accuracy": 0.24768915474414827, "num_tokens": 166015052.0, "step": 95715 }, { "entropy": 5.241939401626587, "epoch": 7.447305971600856, "grad_norm": 1.328125, "learning_rate": 0.0001195515465631048, "loss": 4.4524, "mean_token_accuracy": 0.2540135011076927, "num_tokens": 166023388.0, "step": 95720 }, { "entropy": 5.315170383453369, "epoch": 7.4476950009725735, "grad_norm": 1.421875, "learning_rate": 0.00011953151027272372, "loss": 4.5529, "mean_token_accuracy": 0.2503159955143929, "num_tokens": 166032038.0, "step": 95725 }, { "entropy": 5.36104736328125, "epoch": 7.448084030344291, "grad_norm": 1.4609375, "learning_rate": 0.00011951147634132961, "loss": 4.6369, "mean_token_accuracy": 0.24176654368638992, "num_tokens": 166040242.0, "step": 95730 }, { "entropy": 5.343714046478271, "epoch": 7.448473059716009, "grad_norm": 1.484375, "learning_rate": 0.00011949144476922628, "loss": 4.6016, "mean_token_accuracy": 0.23465361148118974, "num_tokens": 166048778.0, "step": 95735 }, { "entropy": 5.343772459030151, "epoch": 7.448862089087726, "grad_norm": 1.296875, "learning_rate": 0.00011947141555671783, "loss": 4.5574, "mean_token_accuracy": 0.24613203704357148, "num_tokens": 166058124.0, "step": 95740 }, { "entropy": 5.33361668586731, "epoch": 7.449251118459443, "grad_norm": 1.421875, "learning_rate": 0.00011945138870410809, "loss": 4.5354, "mean_token_accuracy": 0.2586942493915558, "num_tokens": 166065880.0, "step": 95745 }, { "entropy": 5.383159351348877, "epoch": 7.449640147831161, "grad_norm": 1.3046875, "learning_rate": 0.00011943136421170091, "loss": 4.6304, "mean_token_accuracy": 0.2486148178577423, "num_tokens": 166074077.0, "step": 95750 }, { "entropy": 5.322824621200562, "epoch": 7.450029177202879, "grad_norm": 1.3203125, "learning_rate": 0.00011941134207980018, "loss": 4.5373, "mean_token_accuracy": 0.25074647814035417, "num_tokens": 166082161.0, "step": 95755 }, { "entropy": 5.406968402862549, "epoch": 7.4504182065745965, "grad_norm": 1.3984375, "learning_rate": 0.00011939132230870967, "loss": 4.6791, "mean_token_accuracy": 0.243515844643116, "num_tokens": 166091239.0, "step": 95760 }, { "entropy": 5.309253358840943, "epoch": 7.450807235946314, "grad_norm": 1.3203125, "learning_rate": 0.0001193713048987332, "loss": 4.5222, "mean_token_accuracy": 0.2577675715088844, "num_tokens": 166101446.0, "step": 95765 }, { "entropy": 5.372639322280884, "epoch": 7.451196265318032, "grad_norm": 1.453125, "learning_rate": 0.00011935128985017442, "loss": 4.6099, "mean_token_accuracy": 0.2511883169412613, "num_tokens": 166110423.0, "step": 95770 }, { "entropy": 5.386543464660645, "epoch": 7.451585294689749, "grad_norm": 1.4453125, "learning_rate": 0.00011933127716333712, "loss": 4.6641, "mean_token_accuracy": 0.24615657180547715, "num_tokens": 166118841.0, "step": 95775 }, { "entropy": 5.432804441452026, "epoch": 7.451974324061466, "grad_norm": 1.328125, "learning_rate": 0.00011931126683852489, "loss": 4.6706, "mean_token_accuracy": 0.242329640686512, "num_tokens": 166127592.0, "step": 95780 }, { "entropy": 5.3710548877716064, "epoch": 7.452363353433184, "grad_norm": 1.265625, "learning_rate": 0.00011929125887604137, "loss": 4.6138, "mean_token_accuracy": 0.2450222685933113, "num_tokens": 166136718.0, "step": 95785 }, { "entropy": 5.4355552196502686, "epoch": 7.452752382804902, "grad_norm": 1.375, "learning_rate": 0.0001192712532761902, "loss": 4.6659, "mean_token_accuracy": 0.23889132887125014, "num_tokens": 166145592.0, "step": 95790 }, { "entropy": 5.419160509109497, "epoch": 7.4531414121766195, "grad_norm": 1.3125, "learning_rate": 0.00011925125003927485, "loss": 4.6844, "mean_token_accuracy": 0.2371038407087326, "num_tokens": 166154325.0, "step": 95795 }, { "entropy": 5.3729997158050535, "epoch": 7.453530441548337, "grad_norm": 1.515625, "learning_rate": 0.00011923124916559894, "loss": 4.5341, "mean_token_accuracy": 0.2546359434723854, "num_tokens": 166162993.0, "step": 95800 }, { "entropy": 5.357900762557984, "epoch": 7.453919470920054, "grad_norm": 1.40625, "learning_rate": 0.00011921125065546585, "loss": 4.5155, "mean_token_accuracy": 0.24916453361511232, "num_tokens": 166171720.0, "step": 95805 }, { "entropy": 5.39055438041687, "epoch": 7.454308500291772, "grad_norm": 1.4140625, "learning_rate": 0.00011919125450917912, "loss": 4.6472, "mean_token_accuracy": 0.24852005988359452, "num_tokens": 166180161.0, "step": 95810 }, { "entropy": 5.34354453086853, "epoch": 7.454697529663489, "grad_norm": 1.2734375, "learning_rate": 0.000119171260727042, "loss": 4.6439, "mean_token_accuracy": 0.24071654081344604, "num_tokens": 166189237.0, "step": 95815 }, { "entropy": 5.421201992034912, "epoch": 7.455086559035207, "grad_norm": 1.40625, "learning_rate": 0.00011915126930935808, "loss": 4.6576, "mean_token_accuracy": 0.24766531735658645, "num_tokens": 166197772.0, "step": 95820 }, { "entropy": 5.314159202575683, "epoch": 7.455475588406925, "grad_norm": 1.46875, "learning_rate": 0.00011913128025643059, "loss": 4.5439, "mean_token_accuracy": 0.2533565878868103, "num_tokens": 166206170.0, "step": 95825 }, { "entropy": 5.386200428009033, "epoch": 7.4558646177786425, "grad_norm": 1.46875, "learning_rate": 0.00011911129356856276, "loss": 4.6654, "mean_token_accuracy": 0.24182116389274597, "num_tokens": 166214776.0, "step": 95830 }, { "entropy": 5.357251310348511, "epoch": 7.45625364715036, "grad_norm": 1.265625, "learning_rate": 0.00011909130924605799, "loss": 4.5627, "mean_token_accuracy": 0.24915471524000168, "num_tokens": 166224452.0, "step": 95835 }, { "entropy": 5.418583488464355, "epoch": 7.456642676522077, "grad_norm": 1.5, "learning_rate": 0.00011907132728921939, "loss": 4.6164, "mean_token_accuracy": 0.23772496581077576, "num_tokens": 166232553.0, "step": 95840 }, { "entropy": 5.256591653823852, "epoch": 7.457031705893795, "grad_norm": 1.34375, "learning_rate": 0.00011905134769835028, "loss": 4.493, "mean_token_accuracy": 0.25568588376045226, "num_tokens": 166241742.0, "step": 95845 }, { "entropy": 5.4266359329223635, "epoch": 7.457420735265512, "grad_norm": 1.390625, "learning_rate": 0.00011903137047375366, "loss": 4.6194, "mean_token_accuracy": 0.2555432364344597, "num_tokens": 166250563.0, "step": 95850 }, { "entropy": 5.350070953369141, "epoch": 7.45780976463723, "grad_norm": 1.390625, "learning_rate": 0.00011901139561573275, "loss": 4.5356, "mean_token_accuracy": 0.25546029657125474, "num_tokens": 166258775.0, "step": 95855 }, { "entropy": 5.356121587753296, "epoch": 7.458198794008948, "grad_norm": 1.359375, "learning_rate": 0.00011899142312459072, "loss": 4.6393, "mean_token_accuracy": 0.2511505126953125, "num_tokens": 166267197.0, "step": 95860 }, { "entropy": 5.354912519454956, "epoch": 7.4585878233806655, "grad_norm": 1.3828125, "learning_rate": 0.00011897145300063045, "loss": 4.6155, "mean_token_accuracy": 0.2456697478890419, "num_tokens": 166276451.0, "step": 95865 }, { "entropy": 5.406034231185913, "epoch": 7.458976852752383, "grad_norm": 1.3984375, "learning_rate": 0.00011895148524415509, "loss": 4.6829, "mean_token_accuracy": 0.24152234196662903, "num_tokens": 166285197.0, "step": 95870 }, { "entropy": 5.4375701427459715, "epoch": 7.4593658821241, "grad_norm": 1.3046875, "learning_rate": 0.00011893151985546751, "loss": 4.6596, "mean_token_accuracy": 0.23399144113063813, "num_tokens": 166293763.0, "step": 95875 }, { "entropy": 5.389990901947021, "epoch": 7.459754911495818, "grad_norm": 1.3984375, "learning_rate": 0.00011891155683487079, "loss": 4.632, "mean_token_accuracy": 0.24837333112955093, "num_tokens": 166302881.0, "step": 95880 }, { "entropy": 5.390180015563965, "epoch": 7.460143940867535, "grad_norm": 1.3515625, "learning_rate": 0.00011889159618266768, "loss": 4.578, "mean_token_accuracy": 0.251559779047966, "num_tokens": 166311810.0, "step": 95885 }, { "entropy": 5.385951042175293, "epoch": 7.460532970239253, "grad_norm": 1.3046875, "learning_rate": 0.00011887163789916118, "loss": 4.5858, "mean_token_accuracy": 0.24798345118761062, "num_tokens": 166320250.0, "step": 95890 }, { "entropy": 5.355606508255005, "epoch": 7.460921999610971, "grad_norm": 1.546875, "learning_rate": 0.000118851681984654, "loss": 4.5814, "mean_token_accuracy": 0.2486318051815033, "num_tokens": 166328599.0, "step": 95895 }, { "entropy": 5.421585464477539, "epoch": 7.4613110289826885, "grad_norm": 1.3359375, "learning_rate": 0.00011883172843944907, "loss": 4.6885, "mean_token_accuracy": 0.2322828009724617, "num_tokens": 166336878.0, "step": 95900 }, { "entropy": 5.4028849601745605, "epoch": 7.461700058354406, "grad_norm": 1.453125, "learning_rate": 0.00011881177726384912, "loss": 4.6513, "mean_token_accuracy": 0.2369014948606491, "num_tokens": 166345563.0, "step": 95905 }, { "entropy": 5.401794147491455, "epoch": 7.462089087726123, "grad_norm": 1.4609375, "learning_rate": 0.00011879182845815678, "loss": 4.6335, "mean_token_accuracy": 0.24470696747303008, "num_tokens": 166353395.0, "step": 95910 }, { "entropy": 5.29552321434021, "epoch": 7.462478117097841, "grad_norm": 1.3359375, "learning_rate": 0.00011877188202267487, "loss": 4.4087, "mean_token_accuracy": 0.2603929743170738, "num_tokens": 166362245.0, "step": 95915 }, { "entropy": 5.348288106918335, "epoch": 7.462867146469558, "grad_norm": 1.4609375, "learning_rate": 0.00011875193795770585, "loss": 4.5486, "mean_token_accuracy": 0.2499289557337761, "num_tokens": 166370883.0, "step": 95920 }, { "entropy": 5.334297466278076, "epoch": 7.463256175841276, "grad_norm": 1.484375, "learning_rate": 0.00011873199626355265, "loss": 4.5959, "mean_token_accuracy": 0.252534918487072, "num_tokens": 166379245.0, "step": 95925 }, { "entropy": 5.3312122344970705, "epoch": 7.463645205212994, "grad_norm": 1.3984375, "learning_rate": 0.00011871205694051763, "loss": 4.6581, "mean_token_accuracy": 0.2459083989262581, "num_tokens": 166388692.0, "step": 95930 }, { "entropy": 5.395445680618286, "epoch": 7.4640342345847115, "grad_norm": 1.3359375, "learning_rate": 0.00011869211998890334, "loss": 4.6579, "mean_token_accuracy": 0.24433287978172302, "num_tokens": 166397556.0, "step": 95935 }, { "entropy": 5.381791782379151, "epoch": 7.464423263956428, "grad_norm": 1.5625, "learning_rate": 0.00011867218540901242, "loss": 4.534, "mean_token_accuracy": 0.24882991909980773, "num_tokens": 166405683.0, "step": 95940 }, { "entropy": 5.289937114715576, "epoch": 7.464812293328146, "grad_norm": 1.4296875, "learning_rate": 0.00011865225320114717, "loss": 4.4724, "mean_token_accuracy": 0.26282182335853577, "num_tokens": 166414806.0, "step": 95945 }, { "entropy": 5.341854000091553, "epoch": 7.465201322699864, "grad_norm": 1.453125, "learning_rate": 0.0001186323233656102, "loss": 4.5796, "mean_token_accuracy": 0.2488087981939316, "num_tokens": 166423147.0, "step": 95950 }, { "entropy": 5.406926393508911, "epoch": 7.465590352071581, "grad_norm": 1.3515625, "learning_rate": 0.00011861239590270379, "loss": 4.6653, "mean_token_accuracy": 0.24202370047569274, "num_tokens": 166431429.0, "step": 95955 }, { "entropy": 5.334937524795532, "epoch": 7.465979381443299, "grad_norm": 1.4140625, "learning_rate": 0.0001185924708127304, "loss": 4.5903, "mean_token_accuracy": 0.25411690324544906, "num_tokens": 166440900.0, "step": 95960 }, { "entropy": 5.358508014678955, "epoch": 7.466368410815017, "grad_norm": 1.3125, "learning_rate": 0.00011857254809599226, "loss": 4.5808, "mean_token_accuracy": 0.2512654513120651, "num_tokens": 166450483.0, "step": 95965 }, { "entropy": 5.342708778381348, "epoch": 7.4667574401867345, "grad_norm": 1.3984375, "learning_rate": 0.00011855262775279178, "loss": 4.6462, "mean_token_accuracy": 0.24283837676048278, "num_tokens": 166459226.0, "step": 95970 }, { "entropy": 5.382832956314087, "epoch": 7.467146469558451, "grad_norm": 1.3203125, "learning_rate": 0.00011853270978343111, "loss": 4.6037, "mean_token_accuracy": 0.24520778954029082, "num_tokens": 166467951.0, "step": 95975 }, { "entropy": 5.390552806854248, "epoch": 7.467535498930169, "grad_norm": 1.40625, "learning_rate": 0.0001185127941882126, "loss": 4.5447, "mean_token_accuracy": 0.24876424819231033, "num_tokens": 166476182.0, "step": 95980 }, { "entropy": 5.390538263320923, "epoch": 7.467924528301887, "grad_norm": 1.4765625, "learning_rate": 0.00011849288096743827, "loss": 4.5952, "mean_token_accuracy": 0.24609564244747162, "num_tokens": 166485039.0, "step": 95985 }, { "entropy": 5.273808765411377, "epoch": 7.468313557673604, "grad_norm": 1.390625, "learning_rate": 0.0001184729701214104, "loss": 4.5068, "mean_token_accuracy": 0.25508918315172197, "num_tokens": 166493719.0, "step": 95990 }, { "entropy": 5.3568971157073975, "epoch": 7.468702587045322, "grad_norm": 1.4296875, "learning_rate": 0.0001184530616504311, "loss": 4.6041, "mean_token_accuracy": 0.25048181265592573, "num_tokens": 166501696.0, "step": 95995 }, { "entropy": 5.330262279510498, "epoch": 7.46909161641704, "grad_norm": 1.328125, "learning_rate": 0.00011843315555480237, "loss": 4.5932, "mean_token_accuracy": 0.2517843395471573, "num_tokens": 166510551.0, "step": 96000 }, { "epoch": 7.46909161641704, "eval_entropy": 5.083234449208528, "eval_loss": 4.84763765335083, "eval_mean_token_accuracy": 0.23805892816722335, "eval_num_tokens": 166510551.0, "eval_runtime": 28.8759, "eval_samples_per_second": 1439.194, "eval_steps_per_second": 179.908, "step": 96000 } ], "logging_steps": 5, "max_steps": 128520, "num_input_tokens_seen": 0, "num_train_epochs": 10, "save_steps": 3000, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 2.25989335575936e+17, "train_batch_size": 16, "trial_name": null, "trial_params": null }