{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 6.302042404201517, "eval_steps": 3000, "global_step": 81000, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 10.742576789855956, "epoch": 0.00038902937171756465, "grad_norm": 5.21875, "learning_rate": 2e-06, "loss": 10.7444, "mean_token_accuracy": 0.0, "num_tokens": 8755.0, "step": 5 }, { "entropy": 10.742605495452882, "epoch": 0.0007780587434351293, "grad_norm": 5.375, "learning_rate": 4.5e-06, "loss": 10.7346, "mean_token_accuracy": 0.0, "num_tokens": 17641.0, "step": 10 }, { "entropy": 10.742611026763916, "epoch": 0.001167088115152694, "grad_norm": 5.46875, "learning_rate": 7e-06, "loss": 10.6932, "mean_token_accuracy": 0.0, "num_tokens": 26293.0, "step": 15 }, { "entropy": 10.742596912384034, "epoch": 0.0015561174868702586, "grad_norm": 5.03125, "learning_rate": 9.5e-06, "loss": 10.6732, "mean_token_accuracy": 0.0003551477799192071, "num_tokens": 35627.0, "step": 20 }, { "entropy": 10.742521381378173, "epoch": 0.0019451468585878235, "grad_norm": 4.71875, "learning_rate": 1.2e-05, "loss": 10.5441, "mean_token_accuracy": 0.009159033582545818, "num_tokens": 43861.0, "step": 25 }, { "entropy": 10.742165279388427, "epoch": 0.002334176230305388, "grad_norm": 4.1875, "learning_rate": 1.4500000000000002e-05, "loss": 10.4398, "mean_token_accuracy": 0.03247077781707049, "num_tokens": 52816.0, "step": 30 }, { "entropy": 10.740872764587403, "epoch": 0.0027232056020229526, "grad_norm": 3.375, "learning_rate": 1.7000000000000003e-05, "loss": 10.3142, "mean_token_accuracy": 0.03825325649231672, "num_tokens": 61370.0, "step": 35 }, { "entropy": 10.737211132049561, "epoch": 0.0031122349737405172, "grad_norm": 2.765625, "learning_rate": 1.95e-05, "loss": 10.1536, "mean_token_accuracy": 0.044245490059256556, "num_tokens": 69444.0, "step": 40 }, { "entropy": 10.730943870544433, "epoch": 0.003501264345458082, "grad_norm": 2.40625, "learning_rate": 2.2e-05, "loss": 10.0549, "mean_token_accuracy": 0.044146507233381274, "num_tokens": 77892.0, "step": 45 }, { "entropy": 10.725597763061524, "epoch": 0.003890293717175647, "grad_norm": 2.078125, "learning_rate": 2.4500000000000003e-05, "loss": 9.9865, "mean_token_accuracy": 0.04212083183228969, "num_tokens": 86154.0, "step": 50 }, { "entropy": 10.72157793045044, "epoch": 0.004279323088893211, "grad_norm": 2.0625, "learning_rate": 2.7e-05, "loss": 9.9514, "mean_token_accuracy": 0.04536668732762337, "num_tokens": 95589.0, "step": 55 }, { "entropy": 10.716520404815673, "epoch": 0.004668352460610776, "grad_norm": 1.984375, "learning_rate": 2.95e-05, "loss": 9.898, "mean_token_accuracy": 0.04543796852231026, "num_tokens": 105268.0, "step": 60 }, { "entropy": 10.711576366424561, "epoch": 0.0050573818323283405, "grad_norm": 1.890625, "learning_rate": 3.2e-05, "loss": 9.7831, "mean_token_accuracy": 0.04743263386189937, "num_tokens": 113347.0, "step": 65 }, { "entropy": 10.705528163909912, "epoch": 0.005446411204045905, "grad_norm": 1.9609375, "learning_rate": 3.4500000000000005e-05, "loss": 9.7233, "mean_token_accuracy": 0.04614104889333248, "num_tokens": 121235.0, "step": 70 }, { "entropy": 10.699932765960693, "epoch": 0.00583544057576347, "grad_norm": 1.828125, "learning_rate": 3.7e-05, "loss": 9.674, "mean_token_accuracy": 0.045549771189689635, "num_tokens": 129529.0, "step": 75 }, { "entropy": 10.695240116119384, "epoch": 0.0062244699474810344, "grad_norm": 1.84375, "learning_rate": 3.95e-05, "loss": 9.6104, "mean_token_accuracy": 0.046765000373125074, "num_tokens": 137918.0, "step": 80 }, { "entropy": 10.686996364593506, "epoch": 0.006613499319198599, "grad_norm": 1.921875, "learning_rate": 4.2000000000000004e-05, "loss": 9.5017, "mean_token_accuracy": 0.05623045340180397, "num_tokens": 146445.0, "step": 85 }, { "entropy": 10.671263790130615, "epoch": 0.007002528690916164, "grad_norm": 1.84375, "learning_rate": 4.45e-05, "loss": 9.4967, "mean_token_accuracy": 0.057636797428131104, "num_tokens": 155904.0, "step": 90 }, { "entropy": 10.655223369598389, "epoch": 0.007391558062633729, "grad_norm": 1.8125, "learning_rate": 4.7000000000000004e-05, "loss": 9.4006, "mean_token_accuracy": 0.05863568969070911, "num_tokens": 164436.0, "step": 95 }, { "entropy": 10.634439468383789, "epoch": 0.007780587434351294, "grad_norm": 1.7421875, "learning_rate": 4.9500000000000004e-05, "loss": 9.3022, "mean_token_accuracy": 0.06445249132812023, "num_tokens": 172985.0, "step": 100 }, { "entropy": 10.591667461395264, "epoch": 0.008169616806068859, "grad_norm": 1.6953125, "learning_rate": 5.2e-05, "loss": 9.1936, "mean_token_accuracy": 0.06430471092462539, "num_tokens": 182084.0, "step": 105 }, { "entropy": 10.53823823928833, "epoch": 0.008558646177786422, "grad_norm": 1.640625, "learning_rate": 5.45e-05, "loss": 9.0792, "mean_token_accuracy": 0.0625245351344347, "num_tokens": 190742.0, "step": 110 }, { "entropy": 10.481583213806152, "epoch": 0.008947675549503988, "grad_norm": 1.7109375, "learning_rate": 5.7e-05, "loss": 8.9948, "mean_token_accuracy": 0.06432581804692745, "num_tokens": 199600.0, "step": 115 }, { "entropy": 10.431952953338623, "epoch": 0.009336704921221552, "grad_norm": 1.671875, "learning_rate": 5.9499999999999996e-05, "loss": 8.8995, "mean_token_accuracy": 0.06441468745470047, "num_tokens": 207883.0, "step": 120 }, { "entropy": 10.365525436401366, "epoch": 0.009725734292939117, "grad_norm": 1.5, "learning_rate": 6.2e-05, "loss": 8.8018, "mean_token_accuracy": 0.06325564533472061, "num_tokens": 216216.0, "step": 125 }, { "entropy": 10.309541988372803, "epoch": 0.010114763664656681, "grad_norm": 1.46875, "learning_rate": 6.450000000000001e-05, "loss": 8.6768, "mean_token_accuracy": 0.06168311797082424, "num_tokens": 225250.0, "step": 130 }, { "entropy": 10.241107082366943, "epoch": 0.010503793036374246, "grad_norm": 1.3515625, "learning_rate": 6.7e-05, "loss": 8.5623, "mean_token_accuracy": 0.059869692847132686, "num_tokens": 233748.0, "step": 135 }, { "entropy": 10.114632701873779, "epoch": 0.01089282240809181, "grad_norm": 1.2265625, "learning_rate": 6.950000000000001e-05, "loss": 8.4505, "mean_token_accuracy": 0.06234452910721302, "num_tokens": 242629.0, "step": 140 }, { "entropy": 10.001305103302002, "epoch": 0.011281851779809376, "grad_norm": 1.46875, "learning_rate": 7.2e-05, "loss": 8.3258, "mean_token_accuracy": 0.05941925346851349, "num_tokens": 251458.0, "step": 145 }, { "entropy": 9.833595371246338, "epoch": 0.01167088115152694, "grad_norm": 1.203125, "learning_rate": 7.45e-05, "loss": 8.2078, "mean_token_accuracy": 0.06866976507008075, "num_tokens": 260557.0, "step": 150 }, { "entropy": 9.655412101745606, "epoch": 0.012059910523244505, "grad_norm": 1.09375, "learning_rate": 7.7e-05, "loss": 8.1497, "mean_token_accuracy": 0.06398723609745502, "num_tokens": 269262.0, "step": 155 }, { "entropy": 9.519824028015137, "epoch": 0.012448939894962069, "grad_norm": 1.0703125, "learning_rate": 7.950000000000001e-05, "loss": 8.0264, "mean_token_accuracy": 0.06563923060894013, "num_tokens": 277804.0, "step": 160 }, { "entropy": 9.293780612945557, "epoch": 0.012837969266679634, "grad_norm": 1.1015625, "learning_rate": 8.2e-05, "loss": 7.9388, "mean_token_accuracy": 0.0646277904510498, "num_tokens": 287450.0, "step": 165 }, { "entropy": 9.156445980072021, "epoch": 0.013226998638397198, "grad_norm": 0.96875, "learning_rate": 8.450000000000001e-05, "loss": 7.9051, "mean_token_accuracy": 0.06273124553263187, "num_tokens": 296497.0, "step": 170 }, { "entropy": 8.887872219085693, "epoch": 0.013616028010114764, "grad_norm": 0.93359375, "learning_rate": 8.7e-05, "loss": 7.7677, "mean_token_accuracy": 0.06659091413021087, "num_tokens": 305414.0, "step": 175 }, { "entropy": 8.771506786346436, "epoch": 0.014005057381832327, "grad_norm": 0.78125, "learning_rate": 8.95e-05, "loss": 7.7563, "mean_token_accuracy": 0.06347964778542518, "num_tokens": 313639.0, "step": 180 }, { "entropy": 8.585464668273925, "epoch": 0.014394086753549893, "grad_norm": 0.8125, "learning_rate": 9.2e-05, "loss": 7.7352, "mean_token_accuracy": 0.06393053829669952, "num_tokens": 322855.0, "step": 185 }, { "entropy": 8.50670690536499, "epoch": 0.014783116125267459, "grad_norm": 0.85546875, "learning_rate": 9.45e-05, "loss": 7.8169, "mean_token_accuracy": 0.06778145208954811, "num_tokens": 332071.0, "step": 190 }, { "entropy": 8.431924152374268, "epoch": 0.015172145496985022, "grad_norm": 0.8984375, "learning_rate": 9.7e-05, "loss": 7.6122, "mean_token_accuracy": 0.07193873748183251, "num_tokens": 339990.0, "step": 195 }, { "entropy": 8.313230800628663, "epoch": 0.015561174868702588, "grad_norm": 0.8515625, "learning_rate": 9.95e-05, "loss": 7.6533, "mean_token_accuracy": 0.06932461187243462, "num_tokens": 348581.0, "step": 200 }, { "entropy": 8.288263511657714, "epoch": 0.01595020424042015, "grad_norm": 0.91015625, "learning_rate": 0.000102, "loss": 7.6415, "mean_token_accuracy": 0.07069163881242276, "num_tokens": 357032.0, "step": 205 }, { "entropy": 8.254517364501954, "epoch": 0.016339233612137717, "grad_norm": 0.84765625, "learning_rate": 0.00010449999999999999, "loss": 7.607, "mean_token_accuracy": 0.06844000443816185, "num_tokens": 366562.0, "step": 210 }, { "entropy": 8.228306484222411, "epoch": 0.016728262983855283, "grad_norm": 0.98828125, "learning_rate": 0.000107, "loss": 7.5965, "mean_token_accuracy": 0.07050794810056686, "num_tokens": 374555.0, "step": 215 }, { "entropy": 8.206252288818359, "epoch": 0.017117292355572845, "grad_norm": 1.203125, "learning_rate": 0.0001095, "loss": 7.6274, "mean_token_accuracy": 0.06776856631040573, "num_tokens": 383583.0, "step": 220 }, { "entropy": 8.121715068817139, "epoch": 0.01750632172729041, "grad_norm": 0.78125, "learning_rate": 0.000112, "loss": 7.6405, "mean_token_accuracy": 0.06792488619685173, "num_tokens": 392932.0, "step": 225 }, { "entropy": 8.169992160797118, "epoch": 0.017895351099007976, "grad_norm": 0.89453125, "learning_rate": 0.0001145, "loss": 7.4836, "mean_token_accuracy": 0.07281714007258415, "num_tokens": 401653.0, "step": 230 }, { "entropy": 8.105243301391601, "epoch": 0.01828438047072554, "grad_norm": 0.87890625, "learning_rate": 0.00011700000000000001, "loss": 7.5741, "mean_token_accuracy": 0.07232600301504136, "num_tokens": 410432.0, "step": 235 }, { "entropy": 8.124885082244873, "epoch": 0.018673409842443103, "grad_norm": 0.83203125, "learning_rate": 0.00011949999999999999, "loss": 7.5359, "mean_token_accuracy": 0.07120791971683502, "num_tokens": 419380.0, "step": 240 }, { "entropy": 8.092760372161866, "epoch": 0.01906243921416067, "grad_norm": 1.0859375, "learning_rate": 0.000122, "loss": 7.4537, "mean_token_accuracy": 0.07131325155496597, "num_tokens": 427682.0, "step": 245 }, { "entropy": 8.064310121536256, "epoch": 0.019451468585878234, "grad_norm": 0.9140625, "learning_rate": 0.0001245, "loss": 7.5297, "mean_token_accuracy": 0.06986031346023083, "num_tokens": 437708.0, "step": 250 }, { "entropy": 8.066622257232666, "epoch": 0.0198404979575958, "grad_norm": 1.0, "learning_rate": 0.000127, "loss": 7.49, "mean_token_accuracy": 0.07588860243558884, "num_tokens": 446480.0, "step": 255 }, { "entropy": 8.031266736984254, "epoch": 0.020229527329313362, "grad_norm": 0.953125, "learning_rate": 0.0001295, "loss": 7.524, "mean_token_accuracy": 0.06815474294126034, "num_tokens": 455273.0, "step": 260 }, { "entropy": 8.06600604057312, "epoch": 0.020618556701030927, "grad_norm": 1.1953125, "learning_rate": 0.000132, "loss": 7.4511, "mean_token_accuracy": 0.07497221603989601, "num_tokens": 464306.0, "step": 265 }, { "entropy": 7.944579219818115, "epoch": 0.021007586072748493, "grad_norm": 0.984375, "learning_rate": 0.00013450000000000002, "loss": 7.4544, "mean_token_accuracy": 0.07208218537271023, "num_tokens": 472812.0, "step": 270 }, { "entropy": 7.977314424514771, "epoch": 0.02139661544446606, "grad_norm": 1.0390625, "learning_rate": 0.00013700000000000002, "loss": 7.437, "mean_token_accuracy": 0.07208085916936398, "num_tokens": 481326.0, "step": 275 }, { "entropy": 8.039547538757324, "epoch": 0.02178564481618362, "grad_norm": 0.921875, "learning_rate": 0.0001395, "loss": 7.377, "mean_token_accuracy": 0.0771931130439043, "num_tokens": 489147.0, "step": 280 }, { "entropy": 7.921053743362426, "epoch": 0.022174674187901186, "grad_norm": 0.98828125, "learning_rate": 0.00014199999999999998, "loss": 7.3711, "mean_token_accuracy": 0.08139716684818268, "num_tokens": 497455.0, "step": 285 }, { "entropy": 7.94639024734497, "epoch": 0.02256370355961875, "grad_norm": 1.0625, "learning_rate": 0.0001445, "loss": 7.3084, "mean_token_accuracy": 0.08105910569429398, "num_tokens": 506735.0, "step": 290 }, { "entropy": 7.939362382888794, "epoch": 0.022952732931336317, "grad_norm": 0.953125, "learning_rate": 0.000147, "loss": 7.3807, "mean_token_accuracy": 0.07725862711668015, "num_tokens": 515976.0, "step": 295 }, { "entropy": 7.8592973232269285, "epoch": 0.02334176230305388, "grad_norm": 1.2578125, "learning_rate": 0.0001495, "loss": 7.3728, "mean_token_accuracy": 0.0786518905311823, "num_tokens": 524986.0, "step": 300 }, { "entropy": 7.871623373031616, "epoch": 0.023730791674771445, "grad_norm": 1.03125, "learning_rate": 0.000152, "loss": 7.3857, "mean_token_accuracy": 0.08207501620054244, "num_tokens": 533146.0, "step": 305 }, { "entropy": 7.966270780563354, "epoch": 0.02411982104648901, "grad_norm": 1.1171875, "learning_rate": 0.00015450000000000001, "loss": 7.2788, "mean_token_accuracy": 0.08436923623085021, "num_tokens": 541704.0, "step": 310 }, { "entropy": 7.803447914123535, "epoch": 0.024508850418206576, "grad_norm": 1.1953125, "learning_rate": 0.000157, "loss": 7.2596, "mean_token_accuracy": 0.08413073793053627, "num_tokens": 550088.0, "step": 315 }, { "entropy": 7.808595514297485, "epoch": 0.024897879789924138, "grad_norm": 1.15625, "learning_rate": 0.0001595, "loss": 7.2537, "mean_token_accuracy": 0.0833888128399849, "num_tokens": 558763.0, "step": 320 }, { "entropy": 7.894071006774903, "epoch": 0.025286909161641703, "grad_norm": 0.96875, "learning_rate": 0.000162, "loss": 7.3379, "mean_token_accuracy": 0.08004550337791443, "num_tokens": 567538.0, "step": 325 }, { "entropy": 7.824001407623291, "epoch": 0.02567593853335927, "grad_norm": 1.2421875, "learning_rate": 0.00016450000000000001, "loss": 7.3535, "mean_token_accuracy": 0.07598577216267585, "num_tokens": 577626.0, "step": 330 }, { "entropy": 7.784535598754883, "epoch": 0.026064967905076834, "grad_norm": 1.0703125, "learning_rate": 0.00016700000000000002, "loss": 7.299, "mean_token_accuracy": 0.07876510173082352, "num_tokens": 587163.0, "step": 335 }, { "entropy": 7.756780767440796, "epoch": 0.026453997276794396, "grad_norm": 0.94921875, "learning_rate": 0.00016950000000000003, "loss": 7.2511, "mean_token_accuracy": 0.08080902062356472, "num_tokens": 595896.0, "step": 340 }, { "entropy": 7.8993690490722654, "epoch": 0.026843026648511962, "grad_norm": 1.0078125, "learning_rate": 0.00017199999999999998, "loss": 7.2821, "mean_token_accuracy": 0.08391863107681274, "num_tokens": 603815.0, "step": 345 }, { "entropy": 7.769748687744141, "epoch": 0.027232056020229527, "grad_norm": 0.99609375, "learning_rate": 0.00017449999999999999, "loss": 7.3017, "mean_token_accuracy": 0.08513520881533623, "num_tokens": 612208.0, "step": 350 }, { "entropy": 7.818035459518432, "epoch": 0.027621085391947093, "grad_norm": 0.984375, "learning_rate": 0.000177, "loss": 7.2697, "mean_token_accuracy": 0.08533527255058289, "num_tokens": 621840.0, "step": 355 }, { "entropy": 7.816836357116699, "epoch": 0.028010114763664655, "grad_norm": 0.984375, "learning_rate": 0.0001795, "loss": 7.2659, "mean_token_accuracy": 0.08314265757799148, "num_tokens": 630770.0, "step": 360 }, { "entropy": 7.714138650894165, "epoch": 0.02839914413538222, "grad_norm": 1.0390625, "learning_rate": 0.000182, "loss": 7.2661, "mean_token_accuracy": 0.08392885178327561, "num_tokens": 640313.0, "step": 365 }, { "entropy": 7.856315994262696, "epoch": 0.028788173507099786, "grad_norm": 0.99609375, "learning_rate": 0.0001845, "loss": 7.2949, "mean_token_accuracy": 0.08515013977885247, "num_tokens": 648594.0, "step": 370 }, { "entropy": 7.847173547744751, "epoch": 0.02917720287881735, "grad_norm": 1.3125, "learning_rate": 0.000187, "loss": 7.2775, "mean_token_accuracy": 0.08574092835187912, "num_tokens": 656478.0, "step": 375 }, { "entropy": 7.662766361236573, "epoch": 0.029566232250534917, "grad_norm": 1.0546875, "learning_rate": 0.0001895, "loss": 7.2441, "mean_token_accuracy": 0.08885113224387169, "num_tokens": 665405.0, "step": 380 }, { "entropy": 7.820247316360474, "epoch": 0.02995526162225248, "grad_norm": 1.1328125, "learning_rate": 0.000192, "loss": 7.2536, "mean_token_accuracy": 0.08792344853281975, "num_tokens": 674301.0, "step": 385 }, { "entropy": 7.737472772598267, "epoch": 0.030344290993970045, "grad_norm": 1.0546875, "learning_rate": 0.0001945, "loss": 7.2531, "mean_token_accuracy": 0.09053674265742302, "num_tokens": 683159.0, "step": 390 }, { "entropy": 7.638981580734253, "epoch": 0.03073332036568761, "grad_norm": 1.03125, "learning_rate": 0.00019700000000000002, "loss": 7.0875, "mean_token_accuracy": 0.09513727799057961, "num_tokens": 690992.0, "step": 395 }, { "entropy": 7.6433281898498535, "epoch": 0.031122349737405176, "grad_norm": 1.0078125, "learning_rate": 0.00019950000000000002, "loss": 7.1734, "mean_token_accuracy": 0.09246476516127586, "num_tokens": 699934.0, "step": 400 }, { "entropy": 7.765408372879028, "epoch": 0.03151137910912274, "grad_norm": 1.2890625, "learning_rate": 0.000202, "loss": 7.2187, "mean_token_accuracy": 0.08869696706533432, "num_tokens": 708844.0, "step": 405 }, { "entropy": 7.719944286346435, "epoch": 0.0319004084808403, "grad_norm": 1.0390625, "learning_rate": 0.00020449999999999998, "loss": 7.2784, "mean_token_accuracy": 0.08538637533783913, "num_tokens": 718148.0, "step": 410 }, { "entropy": 7.750207042694091, "epoch": 0.03228943785255787, "grad_norm": 1.0546875, "learning_rate": 0.000207, "loss": 7.2089, "mean_token_accuracy": 0.08420872502028942, "num_tokens": 726859.0, "step": 415 }, { "entropy": 7.683270502090454, "epoch": 0.032678467224275434, "grad_norm": 1.34375, "learning_rate": 0.0002095, "loss": 7.2145, "mean_token_accuracy": 0.09039615541696548, "num_tokens": 735045.0, "step": 420 }, { "entropy": 7.59128589630127, "epoch": 0.033067496595993, "grad_norm": 0.8828125, "learning_rate": 0.000212, "loss": 7.0827, "mean_token_accuracy": 0.09434614479541778, "num_tokens": 743538.0, "step": 425 }, { "entropy": 7.6708005428314205, "epoch": 0.033456525967710565, "grad_norm": 1.0625, "learning_rate": 0.0002145, "loss": 7.1281, "mean_token_accuracy": 0.0933873251080513, "num_tokens": 752518.0, "step": 430 }, { "entropy": 7.578746604919433, "epoch": 0.033845555339428124, "grad_norm": 1.09375, "learning_rate": 0.00021700000000000002, "loss": 7.1528, "mean_token_accuracy": 0.08902024403214455, "num_tokens": 760354.0, "step": 435 }, { "entropy": 7.675575685501099, "epoch": 0.03423458471114569, "grad_norm": 1.03125, "learning_rate": 0.0002195, "loss": 7.2022, "mean_token_accuracy": 0.0862238198518753, "num_tokens": 769522.0, "step": 440 }, { "entropy": 7.607626724243164, "epoch": 0.034623614082863255, "grad_norm": 1.1484375, "learning_rate": 0.000222, "loss": 7.1284, "mean_token_accuracy": 0.09797925055027008, "num_tokens": 778548.0, "step": 445 }, { "entropy": 7.591102743148804, "epoch": 0.03501264345458082, "grad_norm": 1.140625, "learning_rate": 0.0002245, "loss": 7.143, "mean_token_accuracy": 0.09332999736070632, "num_tokens": 787666.0, "step": 450 }, { "entropy": 7.638665723800659, "epoch": 0.035401672826298386, "grad_norm": 1.1796875, "learning_rate": 0.00022700000000000002, "loss": 7.0542, "mean_token_accuracy": 0.09499929621815681, "num_tokens": 796550.0, "step": 455 }, { "entropy": 7.587637615203858, "epoch": 0.03579070219801595, "grad_norm": 1.40625, "learning_rate": 0.00022950000000000002, "loss": 7.1221, "mean_token_accuracy": 0.09292486310005188, "num_tokens": 804549.0, "step": 460 }, { "entropy": 7.547951364517212, "epoch": 0.03617973156973352, "grad_norm": 1.0, "learning_rate": 0.00023200000000000003, "loss": 7.0937, "mean_token_accuracy": 0.09402075335383415, "num_tokens": 813328.0, "step": 465 }, { "entropy": 7.606256341934204, "epoch": 0.03656876094145108, "grad_norm": 1.0, "learning_rate": 0.00023449999999999998, "loss": 7.1404, "mean_token_accuracy": 0.0924923688173294, "num_tokens": 821733.0, "step": 470 }, { "entropy": 7.556232976913452, "epoch": 0.03695779031316864, "grad_norm": 1.1875, "learning_rate": 0.000237, "loss": 7.0732, "mean_token_accuracy": 0.09500073790550231, "num_tokens": 830243.0, "step": 475 }, { "entropy": 7.638236665725708, "epoch": 0.03734681968488621, "grad_norm": 1.2890625, "learning_rate": 0.0002395, "loss": 7.0519, "mean_token_accuracy": 0.09168064296245575, "num_tokens": 839059.0, "step": 480 }, { "entropy": 7.385732889175415, "epoch": 0.03773584905660377, "grad_norm": 1.0859375, "learning_rate": 0.000242, "loss": 6.9442, "mean_token_accuracy": 0.09834211766719818, "num_tokens": 846932.0, "step": 485 }, { "entropy": 7.602040719985962, "epoch": 0.03812487842832134, "grad_norm": 1.203125, "learning_rate": 0.0002445, "loss": 7.1423, "mean_token_accuracy": 0.08770201802253723, "num_tokens": 855333.0, "step": 490 }, { "entropy": 7.395545721054077, "epoch": 0.0385139078000389, "grad_norm": 1.3203125, "learning_rate": 0.000247, "loss": 6.9209, "mean_token_accuracy": 0.09375111684203148, "num_tokens": 863571.0, "step": 495 }, { "entropy": 7.454263353347779, "epoch": 0.03890293717175647, "grad_norm": 1.0703125, "learning_rate": 0.0002495, "loss": 6.992, "mean_token_accuracy": 0.10193705037236214, "num_tokens": 872145.0, "step": 500 }, { "entropy": 7.494772291183471, "epoch": 0.039291966543474034, "grad_norm": 1.171875, "learning_rate": 0.000252, "loss": 7.0283, "mean_token_accuracy": 0.09722969233989716, "num_tokens": 880634.0, "step": 505 }, { "entropy": 7.492091417312622, "epoch": 0.0396809959151916, "grad_norm": 1.09375, "learning_rate": 0.0002545, "loss": 6.9729, "mean_token_accuracy": 0.09642753973603249, "num_tokens": 889178.0, "step": 510 }, { "entropy": 7.418828535079956, "epoch": 0.04007002528690916, "grad_norm": 1.09375, "learning_rate": 0.000257, "loss": 6.9655, "mean_token_accuracy": 0.09765015915036201, "num_tokens": 898255.0, "step": 515 }, { "entropy": 7.432187509536743, "epoch": 0.040459054658626724, "grad_norm": 1.203125, "learning_rate": 0.0002595, "loss": 7.0224, "mean_token_accuracy": 0.09072192162275314, "num_tokens": 907369.0, "step": 520 }, { "entropy": 7.4239561557769775, "epoch": 0.04084808403034429, "grad_norm": 1.15625, "learning_rate": 0.000262, "loss": 6.9475, "mean_token_accuracy": 0.0962302841246128, "num_tokens": 915946.0, "step": 525 }, { "entropy": 7.447218513488769, "epoch": 0.041237113402061855, "grad_norm": 1.03125, "learning_rate": 0.00026450000000000003, "loss": 6.9879, "mean_token_accuracy": 0.09441638067364692, "num_tokens": 925579.0, "step": 530 }, { "entropy": 7.409813165664673, "epoch": 0.04162614277377942, "grad_norm": 1.0078125, "learning_rate": 0.00026700000000000004, "loss": 6.977, "mean_token_accuracy": 0.09423855319619179, "num_tokens": 934732.0, "step": 535 }, { "entropy": 7.454560852050781, "epoch": 0.042015172145496986, "grad_norm": 1.0625, "learning_rate": 0.00026950000000000005, "loss": 7.0283, "mean_token_accuracy": 0.09172707796096802, "num_tokens": 943371.0, "step": 540 }, { "entropy": 7.407678842544556, "epoch": 0.04240420151721455, "grad_norm": 1.1875, "learning_rate": 0.00027200000000000005, "loss": 6.8926, "mean_token_accuracy": 0.09576850831508636, "num_tokens": 951977.0, "step": 545 }, { "entropy": 7.412649726867675, "epoch": 0.04279323088893212, "grad_norm": 1.0546875, "learning_rate": 0.0002745, "loss": 6.886, "mean_token_accuracy": 0.10018825083971024, "num_tokens": 960474.0, "step": 550 }, { "entropy": 7.447184467315674, "epoch": 0.04318226026064968, "grad_norm": 0.97265625, "learning_rate": 0.000277, "loss": 6.9998, "mean_token_accuracy": 0.09603087753057479, "num_tokens": 969823.0, "step": 555 }, { "entropy": 7.450275087356568, "epoch": 0.04357128963236724, "grad_norm": 1.1796875, "learning_rate": 0.0002795, "loss": 6.9175, "mean_token_accuracy": 0.10505582615733147, "num_tokens": 977417.0, "step": 560 }, { "entropy": 7.354970455169678, "epoch": 0.04396031900408481, "grad_norm": 1.203125, "learning_rate": 0.00028199999999999997, "loss": 6.9189, "mean_token_accuracy": 0.11012696176767349, "num_tokens": 985519.0, "step": 565 }, { "entropy": 7.33652982711792, "epoch": 0.04434934837580237, "grad_norm": 1.3046875, "learning_rate": 0.0002845, "loss": 6.9209, "mean_token_accuracy": 0.10035700276494026, "num_tokens": 994136.0, "step": 570 }, { "entropy": 7.332489347457885, "epoch": 0.04473837774751994, "grad_norm": 1.2421875, "learning_rate": 0.000287, "loss": 6.8909, "mean_token_accuracy": 0.09913867935538292, "num_tokens": 1002896.0, "step": 575 }, { "entropy": 7.440053081512451, "epoch": 0.0451274071192375, "grad_norm": 1.2109375, "learning_rate": 0.0002895, "loss": 6.968, "mean_token_accuracy": 0.10127009153366089, "num_tokens": 1011032.0, "step": 580 }, { "entropy": 7.2483752250671385, "epoch": 0.04551643649095507, "grad_norm": 1.140625, "learning_rate": 0.000292, "loss": 6.9354, "mean_token_accuracy": 0.09478853791952133, "num_tokens": 1019901.0, "step": 585 }, { "entropy": 7.367902326583862, "epoch": 0.045905465862672634, "grad_norm": 1.109375, "learning_rate": 0.0002945, "loss": 6.9199, "mean_token_accuracy": 0.09609107375144958, "num_tokens": 1029049.0, "step": 590 }, { "entropy": 7.297397232055664, "epoch": 0.0462944952343902, "grad_norm": 1.03125, "learning_rate": 0.000297, "loss": 6.88, "mean_token_accuracy": 0.11009425967931748, "num_tokens": 1037580.0, "step": 595 }, { "entropy": 7.358423042297363, "epoch": 0.04668352460610776, "grad_norm": 1.1484375, "learning_rate": 0.0002995, "loss": 6.9401, "mean_token_accuracy": 0.10255178958177566, "num_tokens": 1045804.0, "step": 600 }, { "entropy": 7.327436733245849, "epoch": 0.047072553977825324, "grad_norm": 1.15625, "learning_rate": 0.000302, "loss": 6.8943, "mean_token_accuracy": 0.0945185400545597, "num_tokens": 1054719.0, "step": 605 }, { "entropy": 7.400276851654053, "epoch": 0.04746158334954289, "grad_norm": 1.1796875, "learning_rate": 0.0003045, "loss": 6.8877, "mean_token_accuracy": 0.10351422131061554, "num_tokens": 1063373.0, "step": 610 }, { "entropy": 7.205434131622314, "epoch": 0.047850612721260455, "grad_norm": 1.078125, "learning_rate": 0.000307, "loss": 6.8601, "mean_token_accuracy": 0.1029354140162468, "num_tokens": 1073021.0, "step": 615 }, { "entropy": 7.366950464248657, "epoch": 0.04823964209297802, "grad_norm": 1.34375, "learning_rate": 0.0003095, "loss": 6.9232, "mean_token_accuracy": 0.09619447886943817, "num_tokens": 1081547.0, "step": 620 }, { "entropy": 7.274023580551147, "epoch": 0.048628671464695586, "grad_norm": 1.0625, "learning_rate": 0.000312, "loss": 6.8907, "mean_token_accuracy": 0.09834453091025352, "num_tokens": 1090695.0, "step": 625 }, { "entropy": 7.250863170623779, "epoch": 0.04901770083641315, "grad_norm": 1.0546875, "learning_rate": 0.0003145, "loss": 6.7816, "mean_token_accuracy": 0.10651093125343322, "num_tokens": 1099563.0, "step": 630 }, { "entropy": 7.316005992889404, "epoch": 0.04940673020813072, "grad_norm": 1.09375, "learning_rate": 0.000317, "loss": 6.8534, "mean_token_accuracy": 0.1008830115199089, "num_tokens": 1109021.0, "step": 635 }, { "entropy": 7.2779614448547365, "epoch": 0.049795759579848276, "grad_norm": 1.21875, "learning_rate": 0.0003195, "loss": 6.8518, "mean_token_accuracy": 0.10254788249731064, "num_tokens": 1118281.0, "step": 640 }, { "entropy": 7.271533203125, "epoch": 0.05018478895156584, "grad_norm": 1.1015625, "learning_rate": 0.000322, "loss": 6.8932, "mean_token_accuracy": 0.09681643918156624, "num_tokens": 1127513.0, "step": 645 }, { "entropy": 7.177491044998169, "epoch": 0.05057381832328341, "grad_norm": 1.1484375, "learning_rate": 0.00032450000000000003, "loss": 6.766, "mean_token_accuracy": 0.10509725958108902, "num_tokens": 1136140.0, "step": 650 }, { "entropy": 7.26359543800354, "epoch": 0.05096284769500097, "grad_norm": 1.1484375, "learning_rate": 0.00032700000000000003, "loss": 6.7939, "mean_token_accuracy": 0.10301651507616043, "num_tokens": 1144297.0, "step": 655 }, { "entropy": 7.281031465530395, "epoch": 0.05135187706671854, "grad_norm": 1.2578125, "learning_rate": 0.00032950000000000004, "loss": 6.8864, "mean_token_accuracy": 0.09698515310883522, "num_tokens": 1153639.0, "step": 660 }, { "entropy": 7.245992708206177, "epoch": 0.0517409064384361, "grad_norm": 1.1015625, "learning_rate": 0.00033200000000000005, "loss": 6.8538, "mean_token_accuracy": 0.09941518083214759, "num_tokens": 1162825.0, "step": 665 }, { "entropy": 7.20550389289856, "epoch": 0.05212993581015367, "grad_norm": 1.1796875, "learning_rate": 0.00033450000000000005, "loss": 6.8767, "mean_token_accuracy": 0.10294063836336136, "num_tokens": 1171887.0, "step": 670 }, { "entropy": 7.228694581985474, "epoch": 0.052518965181871234, "grad_norm": 1.171875, "learning_rate": 0.000337, "loss": 6.7878, "mean_token_accuracy": 0.10553507208824157, "num_tokens": 1179963.0, "step": 675 }, { "entropy": 7.170407724380493, "epoch": 0.05290799455358879, "grad_norm": 1.1796875, "learning_rate": 0.0003395, "loss": 6.7633, "mean_token_accuracy": 0.10891782119870186, "num_tokens": 1188408.0, "step": 680 }, { "entropy": 7.168772220611572, "epoch": 0.05329702392530636, "grad_norm": 1.1640625, "learning_rate": 0.000342, "loss": 6.7986, "mean_token_accuracy": 0.09899375736713409, "num_tokens": 1197751.0, "step": 685 }, { "entropy": 7.197608995437622, "epoch": 0.053686053297023924, "grad_norm": 1.171875, "learning_rate": 0.00034449999999999997, "loss": 6.8312, "mean_token_accuracy": 0.1030447706580162, "num_tokens": 1207101.0, "step": 690 }, { "entropy": 7.218799304962158, "epoch": 0.05407508266874149, "grad_norm": 1.0625, "learning_rate": 0.000347, "loss": 6.829, "mean_token_accuracy": 0.10361301824450493, "num_tokens": 1216395.0, "step": 695 }, { "entropy": 7.224749946594239, "epoch": 0.054464112040459055, "grad_norm": 1.2265625, "learning_rate": 0.0003495, "loss": 6.8108, "mean_token_accuracy": 0.10502151176333427, "num_tokens": 1225496.0, "step": 700 }, { "entropy": 7.232848119735718, "epoch": 0.05485314141217662, "grad_norm": 1.0625, "learning_rate": 0.000352, "loss": 6.8746, "mean_token_accuracy": 0.10201601535081864, "num_tokens": 1233934.0, "step": 705 }, { "entropy": 7.18028507232666, "epoch": 0.055242170783894186, "grad_norm": 1.2578125, "learning_rate": 0.0003545, "loss": 6.7279, "mean_token_accuracy": 0.1090910330414772, "num_tokens": 1242165.0, "step": 710 }, { "entropy": 7.153624200820923, "epoch": 0.05563120015561175, "grad_norm": 1.296875, "learning_rate": 0.000357, "loss": 6.7967, "mean_token_accuracy": 0.1042649894952774, "num_tokens": 1250021.0, "step": 715 }, { "entropy": 7.190495872497559, "epoch": 0.05602022952732931, "grad_norm": 1.140625, "learning_rate": 0.0003595, "loss": 6.8155, "mean_token_accuracy": 0.10334040820598603, "num_tokens": 1258397.0, "step": 720 }, { "entropy": 7.170076513290406, "epoch": 0.056409258899046875, "grad_norm": 1.3046875, "learning_rate": 0.000362, "loss": 6.8121, "mean_token_accuracy": 0.10407566651701927, "num_tokens": 1266764.0, "step": 725 }, { "entropy": 7.1744321346282955, "epoch": 0.05679828827076444, "grad_norm": 1.2265625, "learning_rate": 0.0003645, "loss": 6.8094, "mean_token_accuracy": 0.09987704753875733, "num_tokens": 1275643.0, "step": 730 }, { "entropy": 7.19658842086792, "epoch": 0.057187317642482006, "grad_norm": 1.0703125, "learning_rate": 0.000367, "loss": 6.7852, "mean_token_accuracy": 0.10181980207562447, "num_tokens": 1284379.0, "step": 735 }, { "entropy": 7.100433397293091, "epoch": 0.05757634701419957, "grad_norm": 1.1640625, "learning_rate": 0.0003695, "loss": 6.6451, "mean_token_accuracy": 0.11134169921278954, "num_tokens": 1293115.0, "step": 740 }, { "entropy": 7.243102264404297, "epoch": 0.05796537638591714, "grad_norm": 1.1953125, "learning_rate": 0.000372, "loss": 6.8351, "mean_token_accuracy": 0.09663488790392875, "num_tokens": 1301583.0, "step": 745 }, { "entropy": 7.155255460739136, "epoch": 0.0583544057576347, "grad_norm": 1.046875, "learning_rate": 0.0003745, "loss": 6.7361, "mean_token_accuracy": 0.10636070072650909, "num_tokens": 1310721.0, "step": 750 }, { "entropy": 7.158748054504395, "epoch": 0.05874343512935227, "grad_norm": 1.234375, "learning_rate": 0.000377, "loss": 6.8794, "mean_token_accuracy": 0.09966575875878333, "num_tokens": 1319056.0, "step": 755 }, { "entropy": 7.131784152984619, "epoch": 0.059132464501069834, "grad_norm": 1.078125, "learning_rate": 0.0003795, "loss": 6.7662, "mean_token_accuracy": 0.1062756285071373, "num_tokens": 1327259.0, "step": 760 }, { "entropy": 7.098258781433105, "epoch": 0.05952149387278739, "grad_norm": 1.1484375, "learning_rate": 0.000382, "loss": 6.6695, "mean_token_accuracy": 0.10549260452389717, "num_tokens": 1335906.0, "step": 765 }, { "entropy": 7.124299383163452, "epoch": 0.05991052324450496, "grad_norm": 1.1171875, "learning_rate": 0.0003845, "loss": 6.7193, "mean_token_accuracy": 0.10388574972748757, "num_tokens": 1344743.0, "step": 770 }, { "entropy": 7.124751281738281, "epoch": 0.060299552616222524, "grad_norm": 1.28125, "learning_rate": 0.00038700000000000003, "loss": 6.732, "mean_token_accuracy": 0.10936428904533387, "num_tokens": 1353211.0, "step": 775 }, { "entropy": 7.119222116470337, "epoch": 0.06068858198794009, "grad_norm": 1.15625, "learning_rate": 0.00038950000000000003, "loss": 6.8463, "mean_token_accuracy": 0.09924818351864814, "num_tokens": 1361849.0, "step": 780 }, { "entropy": 7.19121618270874, "epoch": 0.061077611359657655, "grad_norm": 1.1953125, "learning_rate": 0.00039200000000000004, "loss": 6.8264, "mean_token_accuracy": 0.10749334692955018, "num_tokens": 1369804.0, "step": 785 }, { "entropy": 7.045189571380615, "epoch": 0.06146664073137522, "grad_norm": 1.078125, "learning_rate": 0.00039450000000000005, "loss": 6.6156, "mean_token_accuracy": 0.10870056599378586, "num_tokens": 1378478.0, "step": 790 }, { "entropy": 7.11121244430542, "epoch": 0.061855670103092786, "grad_norm": 1.109375, "learning_rate": 0.00039700000000000005, "loss": 6.7107, "mean_token_accuracy": 0.10817317888140679, "num_tokens": 1387225.0, "step": 795 }, { "entropy": 7.035085678100586, "epoch": 0.06224469947481035, "grad_norm": 1.25, "learning_rate": 0.0003995, "loss": 6.6882, "mean_token_accuracy": 0.10929678976535798, "num_tokens": 1395338.0, "step": 800 }, { "entropy": 7.0744215965271, "epoch": 0.06263372884652792, "grad_norm": 1.0703125, "learning_rate": 0.000402, "loss": 6.6625, "mean_token_accuracy": 0.10991387590765953, "num_tokens": 1403794.0, "step": 805 }, { "entropy": 6.982004165649414, "epoch": 0.06302275821824548, "grad_norm": 1.03125, "learning_rate": 0.0004045, "loss": 6.738, "mean_token_accuracy": 0.10092620700597763, "num_tokens": 1412522.0, "step": 810 }, { "entropy": 7.081152534484863, "epoch": 0.06341178758996305, "grad_norm": 1.1171875, "learning_rate": 0.00040699999999999997, "loss": 6.7227, "mean_token_accuracy": 0.10850374028086662, "num_tokens": 1421347.0, "step": 815 }, { "entropy": 7.046439456939697, "epoch": 0.0638008169616806, "grad_norm": 1.1953125, "learning_rate": 0.0004095, "loss": 6.7041, "mean_token_accuracy": 0.11018050685524941, "num_tokens": 1429788.0, "step": 820 }, { "entropy": 7.077642393112183, "epoch": 0.06418984633339817, "grad_norm": 1.2265625, "learning_rate": 0.000412, "loss": 6.6955, "mean_token_accuracy": 0.1097219817340374, "num_tokens": 1437442.0, "step": 825 }, { "entropy": 6.984000587463379, "epoch": 0.06457887570511574, "grad_norm": 1.125, "learning_rate": 0.0004145, "loss": 6.6325, "mean_token_accuracy": 0.10700507164001465, "num_tokens": 1445604.0, "step": 830 }, { "entropy": 7.009225702285766, "epoch": 0.0649679050768333, "grad_norm": 1.140625, "learning_rate": 0.000417, "loss": 6.6963, "mean_token_accuracy": 0.10920493751764297, "num_tokens": 1454342.0, "step": 835 }, { "entropy": 7.046473693847656, "epoch": 0.06535693444855087, "grad_norm": 1.0546875, "learning_rate": 0.0004195, "loss": 6.6777, "mean_token_accuracy": 0.11271065473556519, "num_tokens": 1463189.0, "step": 840 }, { "entropy": 7.0349955558776855, "epoch": 0.06574596382026843, "grad_norm": 1.1875, "learning_rate": 0.000422, "loss": 6.751, "mean_token_accuracy": 0.1046958401799202, "num_tokens": 1471608.0, "step": 845 }, { "entropy": 7.108201360702514, "epoch": 0.066134993191986, "grad_norm": 1.1953125, "learning_rate": 0.0004245, "loss": 6.7468, "mean_token_accuracy": 0.10504127219319344, "num_tokens": 1480452.0, "step": 850 }, { "entropy": 7.051074695587158, "epoch": 0.06652402256370356, "grad_norm": 1.2734375, "learning_rate": 0.000427, "loss": 6.6688, "mean_token_accuracy": 0.10868829116225243, "num_tokens": 1489118.0, "step": 855 }, { "entropy": 6.962509250640869, "epoch": 0.06691305193542113, "grad_norm": 1.171875, "learning_rate": 0.0004295, "loss": 6.6703, "mean_token_accuracy": 0.10638387426733971, "num_tokens": 1498961.0, "step": 860 }, { "entropy": 7.081515598297119, "epoch": 0.06730208130713869, "grad_norm": 1.1328125, "learning_rate": 0.000432, "loss": 6.6661, "mean_token_accuracy": 0.10934964269399643, "num_tokens": 1506772.0, "step": 865 }, { "entropy": 6.947929859161377, "epoch": 0.06769111067885625, "grad_norm": 1.1796875, "learning_rate": 0.0004345, "loss": 6.5534, "mean_token_accuracy": 0.11734423041343689, "num_tokens": 1515095.0, "step": 870 }, { "entropy": 6.930423736572266, "epoch": 0.06808014005057382, "grad_norm": 1.078125, "learning_rate": 0.000437, "loss": 6.593, "mean_token_accuracy": 0.11688333824276924, "num_tokens": 1523477.0, "step": 875 }, { "entropy": 7.0028105735778805, "epoch": 0.06846916942229138, "grad_norm": 1.171875, "learning_rate": 0.0004395, "loss": 6.6287, "mean_token_accuracy": 0.10662296116352081, "num_tokens": 1531786.0, "step": 880 }, { "entropy": 6.932631206512451, "epoch": 0.06885819879400895, "grad_norm": 1.1328125, "learning_rate": 0.000442, "loss": 6.7189, "mean_token_accuracy": 0.10187280923128128, "num_tokens": 1540737.0, "step": 885 }, { "entropy": 6.950942516326904, "epoch": 0.06924722816572651, "grad_norm": 1.09375, "learning_rate": 0.0004445, "loss": 6.5705, "mean_token_accuracy": 0.11004639267921448, "num_tokens": 1548923.0, "step": 890 }, { "entropy": 6.921659803390503, "epoch": 0.06963625753744408, "grad_norm": 1.2578125, "learning_rate": 0.000447, "loss": 6.5273, "mean_token_accuracy": 0.11898597478866577, "num_tokens": 1557043.0, "step": 895 }, { "entropy": 6.893300342559814, "epoch": 0.07002528690916164, "grad_norm": 1.171875, "learning_rate": 0.00044950000000000003, "loss": 6.5837, "mean_token_accuracy": 0.11473687514662742, "num_tokens": 1564994.0, "step": 900 }, { "entropy": 6.921711587905884, "epoch": 0.0704143162808792, "grad_norm": 1.1171875, "learning_rate": 0.00045200000000000004, "loss": 6.5688, "mean_token_accuracy": 0.11160103157162667, "num_tokens": 1573859.0, "step": 905 }, { "entropy": 6.986482381820679, "epoch": 0.07080334565259677, "grad_norm": 1.0703125, "learning_rate": 0.00045450000000000004, "loss": 6.5448, "mean_token_accuracy": 0.1087655171751976, "num_tokens": 1581947.0, "step": 910 }, { "entropy": 6.883696842193603, "epoch": 0.07119237502431433, "grad_norm": 1.1015625, "learning_rate": 0.00045700000000000005, "loss": 6.5205, "mean_token_accuracy": 0.11201854199171066, "num_tokens": 1589971.0, "step": 915 }, { "entropy": 6.8449201583862305, "epoch": 0.0715814043960319, "grad_norm": 1.171875, "learning_rate": 0.00045950000000000006, "loss": 6.4817, "mean_token_accuracy": 0.11529209017753601, "num_tokens": 1598612.0, "step": 920 }, { "entropy": 6.935947418212891, "epoch": 0.07197043376774946, "grad_norm": 1.0859375, "learning_rate": 0.000462, "loss": 6.621, "mean_token_accuracy": 0.10783407837152481, "num_tokens": 1607378.0, "step": 925 }, { "entropy": 6.844717597961425, "epoch": 0.07235946313946703, "grad_norm": 1.0390625, "learning_rate": 0.0004645, "loss": 6.617, "mean_token_accuracy": 0.1145533099770546, "num_tokens": 1615987.0, "step": 930 }, { "entropy": 6.833771276473999, "epoch": 0.07274849251118459, "grad_norm": 1.078125, "learning_rate": 0.000467, "loss": 6.4242, "mean_token_accuracy": 0.11947599574923515, "num_tokens": 1625366.0, "step": 935 }, { "entropy": 6.898650407791138, "epoch": 0.07313752188290217, "grad_norm": 1.09375, "learning_rate": 0.0004695, "loss": 6.6015, "mean_token_accuracy": 0.11430608332157136, "num_tokens": 1633020.0, "step": 940 }, { "entropy": 6.870701551437378, "epoch": 0.07352655125461972, "grad_norm": 1.1015625, "learning_rate": 0.000472, "loss": 6.5056, "mean_token_accuracy": 0.11246326416730881, "num_tokens": 1641518.0, "step": 945 }, { "entropy": 6.800650787353516, "epoch": 0.07391558062633728, "grad_norm": 1.0625, "learning_rate": 0.0004745, "loss": 6.5851, "mean_token_accuracy": 0.10907077416777611, "num_tokens": 1650472.0, "step": 950 }, { "entropy": 6.919282150268555, "epoch": 0.07430460999805485, "grad_norm": 1.1796875, "learning_rate": 0.000477, "loss": 6.6162, "mean_token_accuracy": 0.10955818668007851, "num_tokens": 1659037.0, "step": 955 }, { "entropy": 6.930318880081177, "epoch": 0.07469363936977241, "grad_norm": 1.15625, "learning_rate": 0.0004795, "loss": 6.6848, "mean_token_accuracy": 0.1120296597480774, "num_tokens": 1667897.0, "step": 960 }, { "entropy": 6.849212980270385, "epoch": 0.07508266874148999, "grad_norm": 1.1171875, "learning_rate": 0.000482, "loss": 6.5291, "mean_token_accuracy": 0.1111655130982399, "num_tokens": 1676535.0, "step": 965 }, { "entropy": 6.944094228744507, "epoch": 0.07547169811320754, "grad_norm": 1.2109375, "learning_rate": 0.0004845, "loss": 6.5692, "mean_token_accuracy": 0.11485065668821334, "num_tokens": 1684415.0, "step": 970 }, { "entropy": 6.882363891601562, "epoch": 0.07586072748492512, "grad_norm": 1.1171875, "learning_rate": 0.000487, "loss": 6.5195, "mean_token_accuracy": 0.1194272443652153, "num_tokens": 1692443.0, "step": 975 }, { "entropy": 6.744445562362671, "epoch": 0.07624975685664268, "grad_norm": 1.03125, "learning_rate": 0.0004895, "loss": 6.5166, "mean_token_accuracy": 0.11746397837996483, "num_tokens": 1700814.0, "step": 980 }, { "entropy": 6.767728662490844, "epoch": 0.07663878622836025, "grad_norm": 1.09375, "learning_rate": 0.000492, "loss": 6.3699, "mean_token_accuracy": 0.11762674301862716, "num_tokens": 1709591.0, "step": 985 }, { "entropy": 6.861118412017822, "epoch": 0.0770278156000778, "grad_norm": 1.0078125, "learning_rate": 0.0004945, "loss": 6.6015, "mean_token_accuracy": 0.10945382416248321, "num_tokens": 1718951.0, "step": 990 }, { "entropy": 6.884693145751953, "epoch": 0.07741684497179536, "grad_norm": 1.265625, "learning_rate": 0.000497, "loss": 6.566, "mean_token_accuracy": 0.11041911020874977, "num_tokens": 1727481.0, "step": 995 }, { "entropy": 6.846743249893189, "epoch": 0.07780587434351294, "grad_norm": 1.125, "learning_rate": 0.0004995, "loss": 6.5609, "mean_token_accuracy": 0.11417475417256355, "num_tokens": 1736985.0, "step": 1000 }, { "entropy": 6.892654371261597, "epoch": 0.0781949037152305, "grad_norm": 1.09375, "learning_rate": 0.0004999999989075146, "loss": 6.6256, "mean_token_accuracy": 0.11123185381293296, "num_tokens": 1745470.0, "step": 1005 }, { "entropy": 6.851777601242065, "epoch": 0.07858393308694807, "grad_norm": 1.2109375, "learning_rate": 0.0004999999944692927, "loss": 6.5357, "mean_token_accuracy": 0.10865053832530976, "num_tokens": 1754185.0, "step": 1010 }, { "entropy": 6.776595211029052, "epoch": 0.07897296245866563, "grad_norm": 1.171875, "learning_rate": 0.000499999986617054, "loss": 6.546, "mean_token_accuracy": 0.11072391048073768, "num_tokens": 1762100.0, "step": 1015 }, { "entropy": 6.961122608184814, "epoch": 0.0793619918303832, "grad_norm": 1.125, "learning_rate": 0.0004999999753507986, "loss": 6.5689, "mean_token_accuracy": 0.10964735001325607, "num_tokens": 1771070.0, "step": 1020 }, { "entropy": 6.746126365661621, "epoch": 0.07975102120210076, "grad_norm": 1.078125, "learning_rate": 0.0004999999606705267, "loss": 6.5597, "mean_token_accuracy": 0.1127906545996666, "num_tokens": 1780085.0, "step": 1025 }, { "entropy": 6.842060327529907, "epoch": 0.08014005057381832, "grad_norm": 1.0234375, "learning_rate": 0.0004999999425762385, "loss": 6.5404, "mean_token_accuracy": 0.11701353117823601, "num_tokens": 1789316.0, "step": 1030 }, { "entropy": 6.778835821151733, "epoch": 0.08052907994553589, "grad_norm": 1.0859375, "learning_rate": 0.0004999999210679344, "loss": 6.475, "mean_token_accuracy": 0.11409812644124032, "num_tokens": 1797975.0, "step": 1035 }, { "entropy": 6.787038946151734, "epoch": 0.08091810931725345, "grad_norm": 1.15625, "learning_rate": 0.0004999998961456145, "loss": 6.5602, "mean_token_accuracy": 0.11720341742038727, "num_tokens": 1806129.0, "step": 1040 }, { "entropy": 6.956608533859253, "epoch": 0.08130713868897102, "grad_norm": 1.140625, "learning_rate": 0.0004999998678092794, "loss": 6.5564, "mean_token_accuracy": 0.1117042988538742, "num_tokens": 1813956.0, "step": 1045 }, { "entropy": 6.857865571975708, "epoch": 0.08169616806068858, "grad_norm": 1.09375, "learning_rate": 0.0004999998360589293, "loss": 6.5845, "mean_token_accuracy": 0.11212223619222642, "num_tokens": 1822572.0, "step": 1050 }, { "entropy": 6.7688240051269535, "epoch": 0.08208519743240615, "grad_norm": 1.0703125, "learning_rate": 0.000499999800894565, "loss": 6.4791, "mean_token_accuracy": 0.11256719455122947, "num_tokens": 1831870.0, "step": 1055 }, { "entropy": 6.68245153427124, "epoch": 0.08247422680412371, "grad_norm": 1.1171875, "learning_rate": 0.0004999997623161866, "loss": 6.5135, "mean_token_accuracy": 0.1109384387731552, "num_tokens": 1840414.0, "step": 1060 }, { "entropy": 6.897469997406006, "epoch": 0.08286325617584128, "grad_norm": 0.984375, "learning_rate": 0.0004999997203237951, "loss": 6.5357, "mean_token_accuracy": 0.1112027607858181, "num_tokens": 1850385.0, "step": 1065 }, { "entropy": 6.6467287063598635, "epoch": 0.08325228554755884, "grad_norm": 1.09375, "learning_rate": 0.000499999674917391, "loss": 6.4407, "mean_token_accuracy": 0.12009736895561218, "num_tokens": 1858479.0, "step": 1070 }, { "entropy": 6.7970844268798825, "epoch": 0.0836413149192764, "grad_norm": 1.046875, "learning_rate": 0.0004999996260969748, "loss": 6.5109, "mean_token_accuracy": 0.11019074022769929, "num_tokens": 1867357.0, "step": 1075 }, { "entropy": 6.754551267623901, "epoch": 0.08403034429099397, "grad_norm": 1.171875, "learning_rate": 0.0004999995738625475, "loss": 6.4736, "mean_token_accuracy": 0.11016227900981904, "num_tokens": 1876211.0, "step": 1080 }, { "entropy": 6.769411373138428, "epoch": 0.08441937366271153, "grad_norm": 1.046875, "learning_rate": 0.0004999995182141099, "loss": 6.3942, "mean_token_accuracy": 0.11268195807933808, "num_tokens": 1884301.0, "step": 1085 }, { "entropy": 6.7784522533416744, "epoch": 0.0848084030344291, "grad_norm": 1.1796875, "learning_rate": 0.0004999994591516626, "loss": 6.5555, "mean_token_accuracy": 0.11373023912310601, "num_tokens": 1893191.0, "step": 1090 }, { "entropy": 6.673826599121094, "epoch": 0.08519743240614666, "grad_norm": 1.125, "learning_rate": 0.0004999993966752066, "loss": 6.4283, "mean_token_accuracy": 0.11703478917479515, "num_tokens": 1901434.0, "step": 1095 }, { "entropy": 6.760957384109497, "epoch": 0.08558646177786423, "grad_norm": 1.1328125, "learning_rate": 0.000499999330784743, "loss": 6.4054, "mean_token_accuracy": 0.12261063754558563, "num_tokens": 1910054.0, "step": 1100 }, { "entropy": 6.764858293533325, "epoch": 0.08597549114958179, "grad_norm": 1.125, "learning_rate": 0.0004999992614802725, "loss": 6.5472, "mean_token_accuracy": 0.11576480343937874, "num_tokens": 1918607.0, "step": 1105 }, { "entropy": 6.76983675956726, "epoch": 0.08636452052129936, "grad_norm": 1.078125, "learning_rate": 0.0004999991887617966, "loss": 6.4969, "mean_token_accuracy": 0.11678617969155311, "num_tokens": 1927610.0, "step": 1110 }, { "entropy": 6.654897880554199, "epoch": 0.08675354989301692, "grad_norm": 1.1953125, "learning_rate": 0.0004999991126293158, "loss": 6.4455, "mean_token_accuracy": 0.11631680354475975, "num_tokens": 1936174.0, "step": 1115 }, { "entropy": 6.732142686843872, "epoch": 0.08714257926473448, "grad_norm": 1.0625, "learning_rate": 0.0004999990330828318, "loss": 6.3693, "mean_token_accuracy": 0.12286917939782142, "num_tokens": 1944228.0, "step": 1120 }, { "entropy": 6.709880685806274, "epoch": 0.08753160863645205, "grad_norm": 1.078125, "learning_rate": 0.0004999989501223456, "loss": 6.4821, "mean_token_accuracy": 0.11934061720967293, "num_tokens": 1953144.0, "step": 1125 }, { "entropy": 6.783202028274536, "epoch": 0.08792063800816961, "grad_norm": 1.1953125, "learning_rate": 0.0004999988637478584, "loss": 6.5277, "mean_token_accuracy": 0.11476651057600976, "num_tokens": 1961947.0, "step": 1130 }, { "entropy": 6.779601001739502, "epoch": 0.08830966737988719, "grad_norm": 1.1171875, "learning_rate": 0.0004999987739593716, "loss": 6.5028, "mean_token_accuracy": 0.1122349627315998, "num_tokens": 1970674.0, "step": 1135 }, { "entropy": 6.816339492797852, "epoch": 0.08869869675160474, "grad_norm": 1.1328125, "learning_rate": 0.0004999986807568865, "loss": 6.4793, "mean_token_accuracy": 0.11963360384106636, "num_tokens": 1979173.0, "step": 1140 }, { "entropy": 6.641682291030884, "epoch": 0.08908772612332232, "grad_norm": 1.203125, "learning_rate": 0.0004999985841404045, "loss": 6.4536, "mean_token_accuracy": 0.11661232337355613, "num_tokens": 1988134.0, "step": 1145 }, { "entropy": 6.796137905120849, "epoch": 0.08947675549503988, "grad_norm": 1.0859375, "learning_rate": 0.0004999984841099271, "loss": 6.4027, "mean_token_accuracy": 0.11723847314715385, "num_tokens": 1996977.0, "step": 1150 }, { "entropy": 6.740950250625611, "epoch": 0.08986578486675743, "grad_norm": 1.046875, "learning_rate": 0.000499998380665456, "loss": 6.4805, "mean_token_accuracy": 0.11753954589366913, "num_tokens": 2005946.0, "step": 1155 }, { "entropy": 6.676974439620972, "epoch": 0.090254814238475, "grad_norm": 1.234375, "learning_rate": 0.0004999982738069924, "loss": 6.2987, "mean_token_accuracy": 0.12011792436242104, "num_tokens": 2014882.0, "step": 1160 }, { "entropy": 6.609836864471435, "epoch": 0.09064384361019256, "grad_norm": 1.1953125, "learning_rate": 0.0004999981635345382, "loss": 6.4888, "mean_token_accuracy": 0.11186635941267013, "num_tokens": 2024858.0, "step": 1165 }, { "entropy": 6.676596641540527, "epoch": 0.09103287298191014, "grad_norm": 1.203125, "learning_rate": 0.0004999980498480949, "loss": 6.4003, "mean_token_accuracy": 0.11673102378845215, "num_tokens": 2034072.0, "step": 1170 }, { "entropy": 6.680279922485352, "epoch": 0.0914219023536277, "grad_norm": 1.1015625, "learning_rate": 0.0004999979327476644, "loss": 6.4054, "mean_token_accuracy": 0.11940634250640869, "num_tokens": 2042649.0, "step": 1175 }, { "entropy": 6.699150514602661, "epoch": 0.09181093172534527, "grad_norm": 1.1171875, "learning_rate": 0.0004999978122332485, "loss": 6.4254, "mean_token_accuracy": 0.12093920707702636, "num_tokens": 2050866.0, "step": 1180 }, { "entropy": 6.7128864288330075, "epoch": 0.09219996109706283, "grad_norm": 1.1796875, "learning_rate": 0.0004999976883048487, "loss": 6.4421, "mean_token_accuracy": 0.11782675310969352, "num_tokens": 2058914.0, "step": 1185 }, { "entropy": 6.6109076023101805, "epoch": 0.0925889904687804, "grad_norm": 1.1015625, "learning_rate": 0.0004999975609624673, "loss": 6.3777, "mean_token_accuracy": 0.11382007896900177, "num_tokens": 2068098.0, "step": 1190 }, { "entropy": 6.656971406936646, "epoch": 0.09297801984049796, "grad_norm": 1.0703125, "learning_rate": 0.0004999974302061059, "loss": 6.3773, "mean_token_accuracy": 0.11357153728604316, "num_tokens": 2077299.0, "step": 1195 }, { "entropy": 6.678202056884766, "epoch": 0.09336704921221552, "grad_norm": 1.21875, "learning_rate": 0.0004999972960357666, "loss": 6.4757, "mean_token_accuracy": 0.11248122900724411, "num_tokens": 2087868.0, "step": 1200 }, { "entropy": 6.6500016212463375, "epoch": 0.09375607858393309, "grad_norm": 1.078125, "learning_rate": 0.0004999971584514516, "loss": 6.3967, "mean_token_accuracy": 0.12456627488136292, "num_tokens": 2096553.0, "step": 1205 }, { "entropy": 6.7588951110839846, "epoch": 0.09414510795565065, "grad_norm": 1.125, "learning_rate": 0.0004999970174531627, "loss": 6.3727, "mean_token_accuracy": 0.11930682808160782, "num_tokens": 2104809.0, "step": 1210 }, { "entropy": 6.5227766036987305, "epoch": 0.09453413732736822, "grad_norm": 1.0859375, "learning_rate": 0.0004999968730409022, "loss": 6.3513, "mean_token_accuracy": 0.11753158569335938, "num_tokens": 2113869.0, "step": 1215 }, { "entropy": 6.59004921913147, "epoch": 0.09492316669908578, "grad_norm": 1.140625, "learning_rate": 0.0004999967252146723, "loss": 6.1845, "mean_token_accuracy": 0.11563206911087036, "num_tokens": 2121749.0, "step": 1220 }, { "entropy": 6.602604007720947, "epoch": 0.09531219607080335, "grad_norm": 1.078125, "learning_rate": 0.0004999965739744752, "loss": 6.3919, "mean_token_accuracy": 0.11459906175732612, "num_tokens": 2130828.0, "step": 1225 }, { "entropy": 6.719199275970459, "epoch": 0.09570122544252091, "grad_norm": 1.1640625, "learning_rate": 0.0004999964193203132, "loss": 6.3664, "mean_token_accuracy": 0.12008291706442834, "num_tokens": 2138928.0, "step": 1230 }, { "entropy": 6.622300052642823, "epoch": 0.09609025481423847, "grad_norm": 1.0546875, "learning_rate": 0.0004999962612521888, "loss": 6.4103, "mean_token_accuracy": 0.11864980831742286, "num_tokens": 2147643.0, "step": 1235 }, { "entropy": 6.690579223632812, "epoch": 0.09647928418595604, "grad_norm": 0.98046875, "learning_rate": 0.0004999960997701041, "loss": 6.3286, "mean_token_accuracy": 0.12595243826508523, "num_tokens": 2156766.0, "step": 1240 }, { "entropy": 6.594869613647461, "epoch": 0.0968683135576736, "grad_norm": 1.046875, "learning_rate": 0.0004999959348740618, "loss": 6.3937, "mean_token_accuracy": 0.11976057812571525, "num_tokens": 2165517.0, "step": 1245 }, { "entropy": 6.534668731689453, "epoch": 0.09725734292939117, "grad_norm": 1.1015625, "learning_rate": 0.0004999957665640641, "loss": 6.2614, "mean_token_accuracy": 0.12245074957609177, "num_tokens": 2174812.0, "step": 1250 }, { "entropy": 6.62302975654602, "epoch": 0.09764637230110873, "grad_norm": 1.03125, "learning_rate": 0.000499995594840114, "loss": 6.3965, "mean_token_accuracy": 0.11696946769952773, "num_tokens": 2183968.0, "step": 1255 }, { "entropy": 6.6896251201629635, "epoch": 0.0980354016728263, "grad_norm": 1.171875, "learning_rate": 0.0004999954197022138, "loss": 6.4257, "mean_token_accuracy": 0.12401301488280296, "num_tokens": 2191947.0, "step": 1260 }, { "entropy": 6.606826972961426, "epoch": 0.09842443104454386, "grad_norm": 1.1171875, "learning_rate": 0.0004999952411503661, "loss": 6.271, "mean_token_accuracy": 0.12751914858818053, "num_tokens": 2199951.0, "step": 1265 }, { "entropy": 6.564306163787842, "epoch": 0.09881346041626143, "grad_norm": 1.1953125, "learning_rate": 0.0004999950591845738, "loss": 6.4197, "mean_token_accuracy": 0.12145831063389778, "num_tokens": 2208714.0, "step": 1270 }, { "entropy": 6.571636629104614, "epoch": 0.09920248978797899, "grad_norm": 1.03125, "learning_rate": 0.0004999948738048397, "loss": 6.2797, "mean_token_accuracy": 0.12155360877513885, "num_tokens": 2217250.0, "step": 1275 }, { "entropy": 6.634035968780518, "epoch": 0.09959151915969655, "grad_norm": 1.2265625, "learning_rate": 0.0004999946850111663, "loss": 6.3297, "mean_token_accuracy": 0.12339223623275757, "num_tokens": 2225468.0, "step": 1280 }, { "entropy": 6.528422164916992, "epoch": 0.09998054853141412, "grad_norm": 1.125, "learning_rate": 0.0004999944928035569, "loss": 6.2904, "mean_token_accuracy": 0.12815140709280967, "num_tokens": 2233893.0, "step": 1285 }, { "entropy": 6.6666259765625, "epoch": 0.10036957790313168, "grad_norm": 1.1484375, "learning_rate": 0.000499994297182014, "loss": 6.3539, "mean_token_accuracy": 0.12206242978572845, "num_tokens": 2242487.0, "step": 1290 }, { "entropy": 6.534954357147217, "epoch": 0.10075860727484925, "grad_norm": 1.1328125, "learning_rate": 0.0004999940981465408, "loss": 6.1874, "mean_token_accuracy": 0.12534248530864717, "num_tokens": 2250518.0, "step": 1295 }, { "entropy": 6.555987071990967, "epoch": 0.10114763664656681, "grad_norm": 1.2109375, "learning_rate": 0.0004999938956971404, "loss": 6.3579, "mean_token_accuracy": 0.11568900793790818, "num_tokens": 2259024.0, "step": 1300 }, { "entropy": 6.613235092163086, "epoch": 0.10153666601828439, "grad_norm": 1.046875, "learning_rate": 0.0004999936898338156, "loss": 6.4011, "mean_token_accuracy": 0.11064468100666999, "num_tokens": 2267832.0, "step": 1305 }, { "entropy": 6.580302953720093, "epoch": 0.10192569539000194, "grad_norm": 1.09375, "learning_rate": 0.0004999934805565698, "loss": 6.4644, "mean_token_accuracy": 0.11155277863144875, "num_tokens": 2276834.0, "step": 1310 }, { "entropy": 6.698448944091797, "epoch": 0.10231472476171952, "grad_norm": 1.0078125, "learning_rate": 0.000499993267865406, "loss": 6.3886, "mean_token_accuracy": 0.11738630458712578, "num_tokens": 2285736.0, "step": 1315 }, { "entropy": 6.663760614395142, "epoch": 0.10270375413343708, "grad_norm": 1.0234375, "learning_rate": 0.0004999930517603275, "loss": 6.3469, "mean_token_accuracy": 0.12696315422654153, "num_tokens": 2294177.0, "step": 1320 }, { "entropy": 6.5038152694702145, "epoch": 0.10309278350515463, "grad_norm": 1.203125, "learning_rate": 0.0004999928322413374, "loss": 6.1338, "mean_token_accuracy": 0.13216883465647697, "num_tokens": 2302784.0, "step": 1325 }, { "entropy": 6.468310213088989, "epoch": 0.1034818128768722, "grad_norm": 1.078125, "learning_rate": 0.0004999926093084394, "loss": 6.2448, "mean_token_accuracy": 0.12271884679794312, "num_tokens": 2311650.0, "step": 1330 }, { "entropy": 6.5902739524841305, "epoch": 0.10387084224858976, "grad_norm": 1.1171875, "learning_rate": 0.0004999923829616365, "loss": 6.3573, "mean_token_accuracy": 0.12029535993933678, "num_tokens": 2319828.0, "step": 1335 }, { "entropy": 6.606714200973511, "epoch": 0.10425987162030734, "grad_norm": 1.109375, "learning_rate": 0.0004999921532009323, "loss": 6.3635, "mean_token_accuracy": 0.1170631617307663, "num_tokens": 2328636.0, "step": 1340 }, { "entropy": 6.487597703933716, "epoch": 0.1046489009920249, "grad_norm": 1.1484375, "learning_rate": 0.0004999919200263304, "loss": 6.2424, "mean_token_accuracy": 0.12811223715543746, "num_tokens": 2336771.0, "step": 1345 }, { "entropy": 6.611960554122925, "epoch": 0.10503793036374247, "grad_norm": 1.015625, "learning_rate": 0.0004999916834378342, "loss": 6.388, "mean_token_accuracy": 0.11745835095643997, "num_tokens": 2346106.0, "step": 1350 }, { "entropy": 6.6681524276733395, "epoch": 0.10542695973546003, "grad_norm": 1.15625, "learning_rate": 0.0004999914434354472, "loss": 6.3915, "mean_token_accuracy": 0.11755762621760368, "num_tokens": 2354943.0, "step": 1355 }, { "entropy": 6.3937695026397705, "epoch": 0.10581598910717759, "grad_norm": 1.09375, "learning_rate": 0.0004999912000191733, "loss": 6.2812, "mean_token_accuracy": 0.12295414507389069, "num_tokens": 2363699.0, "step": 1360 }, { "entropy": 6.576402616500855, "epoch": 0.10620501847889516, "grad_norm": 1.03125, "learning_rate": 0.000499990953189016, "loss": 6.4118, "mean_token_accuracy": 0.11689253002405167, "num_tokens": 2373316.0, "step": 1365 }, { "entropy": 6.740978050231933, "epoch": 0.10659404785061272, "grad_norm": 1.09375, "learning_rate": 0.0004999907029449791, "loss": 6.4907, "mean_token_accuracy": 0.11326492577791214, "num_tokens": 2381550.0, "step": 1370 }, { "entropy": 6.545381116867065, "epoch": 0.10698307722233029, "grad_norm": 1.046875, "learning_rate": 0.0004999904492870663, "loss": 6.3081, "mean_token_accuracy": 0.12226687595248223, "num_tokens": 2389546.0, "step": 1375 }, { "entropy": 6.559665966033935, "epoch": 0.10737210659404785, "grad_norm": 1.125, "learning_rate": 0.0004999901922152816, "loss": 6.2522, "mean_token_accuracy": 0.13022437021136285, "num_tokens": 2398852.0, "step": 1380 }, { "entropy": 6.537785530090332, "epoch": 0.10776113596576542, "grad_norm": 1.09375, "learning_rate": 0.0004999899317296288, "loss": 6.341, "mean_token_accuracy": 0.11776238903403283, "num_tokens": 2407815.0, "step": 1385 }, { "entropy": 6.536812734603882, "epoch": 0.10815016533748298, "grad_norm": 1.046875, "learning_rate": 0.0004999896678301121, "loss": 6.2117, "mean_token_accuracy": 0.12601763755083084, "num_tokens": 2417300.0, "step": 1390 }, { "entropy": 6.544566440582275, "epoch": 0.10853919470920055, "grad_norm": 1.078125, "learning_rate": 0.0004999894005167352, "loss": 6.3687, "mean_token_accuracy": 0.12166865617036819, "num_tokens": 2426257.0, "step": 1395 }, { "entropy": 6.673711729049683, "epoch": 0.10892822408091811, "grad_norm": 1.0078125, "learning_rate": 0.000499989129789502, "loss": 6.3822, "mean_token_accuracy": 0.12371926084160804, "num_tokens": 2434595.0, "step": 1400 }, { "entropy": 6.637689447402954, "epoch": 0.10931725345263567, "grad_norm": 0.99609375, "learning_rate": 0.0004999888556484172, "loss": 6.3857, "mean_token_accuracy": 0.12067539989948273, "num_tokens": 2443945.0, "step": 1405 }, { "entropy": 6.449913835525512, "epoch": 0.10970628282435324, "grad_norm": 1.1484375, "learning_rate": 0.0004999885780934845, "loss": 6.2578, "mean_token_accuracy": 0.12468339428305626, "num_tokens": 2453141.0, "step": 1410 }, { "entropy": 6.639901494979858, "epoch": 0.1100953121960708, "grad_norm": 1.109375, "learning_rate": 0.0004999882971247081, "loss": 6.3439, "mean_token_accuracy": 0.11852156817913055, "num_tokens": 2461873.0, "step": 1415 }, { "entropy": 6.518063354492187, "epoch": 0.11048434156778837, "grad_norm": 1.140625, "learning_rate": 0.0004999880127420926, "loss": 6.361, "mean_token_accuracy": 0.1180450290441513, "num_tokens": 2471238.0, "step": 1420 }, { "entropy": 6.570301914215088, "epoch": 0.11087337093950593, "grad_norm": 1.140625, "learning_rate": 0.0004999877249456421, "loss": 6.2637, "mean_token_accuracy": 0.12611638382077217, "num_tokens": 2479412.0, "step": 1425 }, { "entropy": 6.350358390808106, "epoch": 0.1112624003112235, "grad_norm": 1.171875, "learning_rate": 0.0004999874337353609, "loss": 6.1379, "mean_token_accuracy": 0.1284614808857441, "num_tokens": 2488150.0, "step": 1430 }, { "entropy": 6.525825834274292, "epoch": 0.11165142968294106, "grad_norm": 1.015625, "learning_rate": 0.0004999871391112535, "loss": 6.3105, "mean_token_accuracy": 0.12847553417086602, "num_tokens": 2498103.0, "step": 1435 }, { "entropy": 6.43725700378418, "epoch": 0.11204045905465862, "grad_norm": 1.09375, "learning_rate": 0.0004999868410733244, "loss": 6.1815, "mean_token_accuracy": 0.12891680896282195, "num_tokens": 2506211.0, "step": 1440 }, { "entropy": 6.403781414031982, "epoch": 0.11242948842637619, "grad_norm": 1.0546875, "learning_rate": 0.000499986539621578, "loss": 6.2016, "mean_token_accuracy": 0.12844212278723716, "num_tokens": 2514743.0, "step": 1445 }, { "entropy": 6.451426029205322, "epoch": 0.11281851779809375, "grad_norm": 0.98046875, "learning_rate": 0.0004999862347560191, "loss": 6.2131, "mean_token_accuracy": 0.11876050010323524, "num_tokens": 2523824.0, "step": 1450 }, { "entropy": 6.63544545173645, "epoch": 0.11320754716981132, "grad_norm": 1.0, "learning_rate": 0.0004999859264766521, "loss": 6.2911, "mean_token_accuracy": 0.11931056976318359, "num_tokens": 2532360.0, "step": 1455 }, { "entropy": 6.430943727493286, "epoch": 0.11359657654152888, "grad_norm": 1.0625, "learning_rate": 0.0004999856147834817, "loss": 6.2346, "mean_token_accuracy": 0.12711054608225822, "num_tokens": 2540547.0, "step": 1460 }, { "entropy": 6.486865091323852, "epoch": 0.11398560591324645, "grad_norm": 1.1328125, "learning_rate": 0.0004999852996765129, "loss": 6.2473, "mean_token_accuracy": 0.12674545124173164, "num_tokens": 2549193.0, "step": 1465 }, { "entropy": 6.464196062088012, "epoch": 0.11437463528496401, "grad_norm": 1.0625, "learning_rate": 0.0004999849811557502, "loss": 6.2622, "mean_token_accuracy": 0.12100255340337754, "num_tokens": 2557553.0, "step": 1470 }, { "entropy": 6.629219913482666, "epoch": 0.11476366465668159, "grad_norm": 1.109375, "learning_rate": 0.0004999846592211984, "loss": 6.3607, "mean_token_accuracy": 0.12177548781037331, "num_tokens": 2565945.0, "step": 1475 }, { "entropy": 6.536821985244751, "epoch": 0.11515269402839914, "grad_norm": 1.1953125, "learning_rate": 0.0004999843338728626, "loss": 6.2246, "mean_token_accuracy": 0.12030538022518159, "num_tokens": 2574364.0, "step": 1480 }, { "entropy": 6.438568162918091, "epoch": 0.1155417234001167, "grad_norm": 0.984375, "learning_rate": 0.0004999840051107476, "loss": 6.1639, "mean_token_accuracy": 0.12257452458143234, "num_tokens": 2582825.0, "step": 1485 }, { "entropy": 6.53958911895752, "epoch": 0.11593075277183428, "grad_norm": 1.0703125, "learning_rate": 0.0004999836729348584, "loss": 6.2992, "mean_token_accuracy": 0.12617669850587845, "num_tokens": 2591628.0, "step": 1490 }, { "entropy": 6.568798446655274, "epoch": 0.11631978214355183, "grad_norm": 1.09375, "learning_rate": 0.0004999833373452, "loss": 6.3072, "mean_token_accuracy": 0.11595111265778542, "num_tokens": 2600436.0, "step": 1495 }, { "entropy": 6.432466316223144, "epoch": 0.1167088115152694, "grad_norm": 1.15625, "learning_rate": 0.0004999829983417778, "loss": 6.2444, "mean_token_accuracy": 0.1281425453722477, "num_tokens": 2609709.0, "step": 1500 }, { "entropy": 6.624283027648926, "epoch": 0.11709784088698696, "grad_norm": 1.1015625, "learning_rate": 0.0004999826559245965, "loss": 6.2546, "mean_token_accuracy": 0.12523326128721238, "num_tokens": 2617992.0, "step": 1505 }, { "entropy": 6.3710126876831055, "epoch": 0.11748687025870454, "grad_norm": 1.046875, "learning_rate": 0.0004999823100936615, "loss": 6.1762, "mean_token_accuracy": 0.12328904047608376, "num_tokens": 2626706.0, "step": 1510 }, { "entropy": 6.600048542022705, "epoch": 0.1178758996304221, "grad_norm": 1.1640625, "learning_rate": 0.0004999819608489781, "loss": 6.2453, "mean_token_accuracy": 0.12911369353532792, "num_tokens": 2634642.0, "step": 1515 }, { "entropy": 6.53199143409729, "epoch": 0.11826492900213967, "grad_norm": 0.98828125, "learning_rate": 0.0004999816081905515, "loss": 6.2789, "mean_token_accuracy": 0.11790527626872063, "num_tokens": 2644160.0, "step": 1520 }, { "entropy": 6.3495841979980465, "epoch": 0.11865395837385723, "grad_norm": 1.0390625, "learning_rate": 0.0004999812521183872, "loss": 6.2528, "mean_token_accuracy": 0.11885925233364106, "num_tokens": 2653390.0, "step": 1525 }, { "entropy": 6.5672304153442385, "epoch": 0.11904298774557479, "grad_norm": 1.09375, "learning_rate": 0.0004999808926324903, "loss": 6.2957, "mean_token_accuracy": 0.12170536145567894, "num_tokens": 2662561.0, "step": 1530 }, { "entropy": 6.494124794006348, "epoch": 0.11943201711729236, "grad_norm": 1.1953125, "learning_rate": 0.0004999805297328665, "loss": 6.2467, "mean_token_accuracy": 0.12452413216233253, "num_tokens": 2670694.0, "step": 1535 }, { "entropy": 6.401147556304932, "epoch": 0.11982104648900992, "grad_norm": 1.1171875, "learning_rate": 0.0004999801634195214, "loss": 6.1463, "mean_token_accuracy": 0.12829762995243071, "num_tokens": 2679583.0, "step": 1540 }, { "entropy": 6.418363094329834, "epoch": 0.12021007586072749, "grad_norm": 1.0546875, "learning_rate": 0.0004999797936924603, "loss": 6.1377, "mean_token_accuracy": 0.13158272877335547, "num_tokens": 2688429.0, "step": 1545 }, { "entropy": 6.529831981658935, "epoch": 0.12059910523244505, "grad_norm": 1.0859375, "learning_rate": 0.000499979420551689, "loss": 6.2132, "mean_token_accuracy": 0.12612780630588533, "num_tokens": 2697134.0, "step": 1550 }, { "entropy": 6.446161222457886, "epoch": 0.12098813460416262, "grad_norm": 1.0546875, "learning_rate": 0.000499979043997213, "loss": 6.3499, "mean_token_accuracy": 0.12430260628461838, "num_tokens": 2705641.0, "step": 1555 }, { "entropy": 6.519960689544678, "epoch": 0.12137716397588018, "grad_norm": 1.0390625, "learning_rate": 0.0004999786640290381, "loss": 6.2822, "mean_token_accuracy": 0.13202693238854407, "num_tokens": 2714977.0, "step": 1560 }, { "entropy": 6.495924043655395, "epoch": 0.12176619334759774, "grad_norm": 1.109375, "learning_rate": 0.0004999782806471701, "loss": 6.1374, "mean_token_accuracy": 0.13872739523649216, "num_tokens": 2723120.0, "step": 1565 }, { "entropy": 6.295685195922852, "epoch": 0.12215522271931531, "grad_norm": 1.109375, "learning_rate": 0.0004999778938516147, "loss": 6.1402, "mean_token_accuracy": 0.13263760954141618, "num_tokens": 2731964.0, "step": 1570 }, { "entropy": 6.6035463333129885, "epoch": 0.12254425209103287, "grad_norm": 1.0625, "learning_rate": 0.000499977503642378, "loss": 6.1997, "mean_token_accuracy": 0.12307174578309059, "num_tokens": 2741537.0, "step": 1575 }, { "entropy": 6.387080717086792, "epoch": 0.12293328146275044, "grad_norm": 0.99609375, "learning_rate": 0.0004999771100194656, "loss": 6.313, "mean_token_accuracy": 0.12455416470766068, "num_tokens": 2751522.0, "step": 1580 }, { "entropy": 6.577677011489868, "epoch": 0.123322310834468, "grad_norm": 1.0234375, "learning_rate": 0.0004999767129828837, "loss": 6.3166, "mean_token_accuracy": 0.11798776909708977, "num_tokens": 2761100.0, "step": 1585 }, { "entropy": 6.441084480285644, "epoch": 0.12371134020618557, "grad_norm": 1.1015625, "learning_rate": 0.0004999763125326383, "loss": 6.2427, "mean_token_accuracy": 0.12579894289374352, "num_tokens": 2769171.0, "step": 1590 }, { "entropy": 6.440652084350586, "epoch": 0.12410036957790313, "grad_norm": 1.09375, "learning_rate": 0.0004999759086687355, "loss": 6.1895, "mean_token_accuracy": 0.12780183404684067, "num_tokens": 2778021.0, "step": 1595 }, { "entropy": 6.3568809032440186, "epoch": 0.1244893989496207, "grad_norm": 1.0390625, "learning_rate": 0.0004999755013911813, "loss": 6.1279, "mean_token_accuracy": 0.12737615406513214, "num_tokens": 2787206.0, "step": 1600 }, { "entropy": 6.398793506622314, "epoch": 0.12487842832133826, "grad_norm": 1.09375, "learning_rate": 0.000499975090699982, "loss": 6.1907, "mean_token_accuracy": 0.12401381433010102, "num_tokens": 2796051.0, "step": 1605 }, { "entropy": 6.447634220123291, "epoch": 0.12526745769305583, "grad_norm": 1.015625, "learning_rate": 0.0004999746765951438, "loss": 6.1438, "mean_token_accuracy": 0.12876681834459305, "num_tokens": 2804961.0, "step": 1610 }, { "entropy": 6.419821071624756, "epoch": 0.1256564870647734, "grad_norm": 1.1640625, "learning_rate": 0.0004999742590766729, "loss": 6.1004, "mean_token_accuracy": 0.1357290342450142, "num_tokens": 2813691.0, "step": 1615 }, { "entropy": 6.391876268386841, "epoch": 0.12604551643649095, "grad_norm": 1.0859375, "learning_rate": 0.0004999738381445757, "loss": 6.2317, "mean_token_accuracy": 0.12731038108468057, "num_tokens": 2822248.0, "step": 1620 }, { "entropy": 6.477704286575317, "epoch": 0.1264345458082085, "grad_norm": 1.015625, "learning_rate": 0.0004999734137988586, "loss": 6.1942, "mean_token_accuracy": 0.12995147630572318, "num_tokens": 2830826.0, "step": 1625 }, { "entropy": 6.421813488006592, "epoch": 0.1268235751799261, "grad_norm": 1.125, "learning_rate": 0.000499972986039528, "loss": 6.1865, "mean_token_accuracy": 0.12956878170371056, "num_tokens": 2839766.0, "step": 1630 }, { "entropy": 6.311213779449463, "epoch": 0.12721260455164365, "grad_norm": 0.9765625, "learning_rate": 0.0004999725548665904, "loss": 6.1189, "mean_token_accuracy": 0.1319350078701973, "num_tokens": 2848728.0, "step": 1635 }, { "entropy": 6.348865556716919, "epoch": 0.1276016339233612, "grad_norm": 1.1640625, "learning_rate": 0.0004999721202800524, "loss": 6.1481, "mean_token_accuracy": 0.12775396332144737, "num_tokens": 2857221.0, "step": 1640 }, { "entropy": 6.470174407958984, "epoch": 0.12799066329507877, "grad_norm": 1.09375, "learning_rate": 0.0004999716822799206, "loss": 6.2085, "mean_token_accuracy": 0.13055417835712432, "num_tokens": 2865314.0, "step": 1645 }, { "entropy": 6.300682735443115, "epoch": 0.12837969266679633, "grad_norm": 1.1484375, "learning_rate": 0.0004999712408662016, "loss": 6.0805, "mean_token_accuracy": 0.13145830407738684, "num_tokens": 2873654.0, "step": 1650 }, { "entropy": 6.335351085662841, "epoch": 0.12876872203851392, "grad_norm": 1.1171875, "learning_rate": 0.0004999707960389021, "loss": 5.9957, "mean_token_accuracy": 0.13766974061727524, "num_tokens": 2881604.0, "step": 1655 }, { "entropy": 6.3854491233825685, "epoch": 0.12915775141023147, "grad_norm": 1.09375, "learning_rate": 0.0004999703477980288, "loss": 6.1897, "mean_token_accuracy": 0.12948238775134085, "num_tokens": 2890427.0, "step": 1660 }, { "entropy": 6.4016913890838625, "epoch": 0.12954678078194903, "grad_norm": 1.109375, "learning_rate": 0.0004999698961435885, "loss": 6.1487, "mean_token_accuracy": 0.12871672213077545, "num_tokens": 2899206.0, "step": 1665 }, { "entropy": 6.379415559768677, "epoch": 0.1299358101536666, "grad_norm": 1.046875, "learning_rate": 0.0004999694410755882, "loss": 6.0845, "mean_token_accuracy": 0.13119084686040877, "num_tokens": 2907738.0, "step": 1670 }, { "entropy": 6.384844398498535, "epoch": 0.13032483952538418, "grad_norm": 1.03125, "learning_rate": 0.0004999689825940347, "loss": 6.2902, "mean_token_accuracy": 0.12188465967774391, "num_tokens": 2916881.0, "step": 1675 }, { "entropy": 6.461624526977539, "epoch": 0.13071386889710174, "grad_norm": 0.9765625, "learning_rate": 0.0004999685206989349, "loss": 6.2395, "mean_token_accuracy": 0.1223972775042057, "num_tokens": 2926467.0, "step": 1680 }, { "entropy": 6.4319689750671385, "epoch": 0.1311028982688193, "grad_norm": 1.0546875, "learning_rate": 0.0004999680553902959, "loss": 6.1786, "mean_token_accuracy": 0.12664306312799453, "num_tokens": 2934671.0, "step": 1685 }, { "entropy": 6.371197986602783, "epoch": 0.13149192764053685, "grad_norm": 1.0, "learning_rate": 0.0004999675866681247, "loss": 6.2, "mean_token_accuracy": 0.12353175431489945, "num_tokens": 2943925.0, "step": 1690 }, { "entropy": 6.441555547714233, "epoch": 0.1318809570122544, "grad_norm": 1.1875, "learning_rate": 0.0004999671145324286, "loss": 6.2338, "mean_token_accuracy": 0.12637216970324516, "num_tokens": 2952118.0, "step": 1695 }, { "entropy": 6.3267382144927975, "epoch": 0.132269986383972, "grad_norm": 1.0234375, "learning_rate": 0.0004999666389832144, "loss": 6.2113, "mean_token_accuracy": 0.12672000229358674, "num_tokens": 2961110.0, "step": 1700 }, { "entropy": 6.460357189178467, "epoch": 0.13265901575568956, "grad_norm": 1.0859375, "learning_rate": 0.0004999661600204897, "loss": 6.1454, "mean_token_accuracy": 0.13502151966094972, "num_tokens": 2968877.0, "step": 1705 }, { "entropy": 6.44069094657898, "epoch": 0.13304804512740712, "grad_norm": 1.0390625, "learning_rate": 0.0004999656776442615, "loss": 6.1976, "mean_token_accuracy": 0.13004121631383897, "num_tokens": 2977346.0, "step": 1710 }, { "entropy": 6.449344873428345, "epoch": 0.13343707449912467, "grad_norm": 1.0625, "learning_rate": 0.0004999651918545372, "loss": 6.2464, "mean_token_accuracy": 0.12166893184185028, "num_tokens": 2987494.0, "step": 1715 }, { "entropy": 6.389680957794189, "epoch": 0.13382610387084226, "grad_norm": 1.0546875, "learning_rate": 0.0004999647026513243, "loss": 6.1548, "mean_token_accuracy": 0.12699257507920264, "num_tokens": 2996728.0, "step": 1720 }, { "entropy": 6.319113826751709, "epoch": 0.13421513324255982, "grad_norm": 1.0703125, "learning_rate": 0.00049996421003463, "loss": 6.1861, "mean_token_accuracy": 0.12468351423740387, "num_tokens": 3005810.0, "step": 1725 }, { "entropy": 6.385270690917968, "epoch": 0.13460416261427738, "grad_norm": 1.15625, "learning_rate": 0.0004999637140044619, "loss": 6.2053, "mean_token_accuracy": 0.12655822560191154, "num_tokens": 3014603.0, "step": 1730 }, { "entropy": 6.544794750213623, "epoch": 0.13499319198599494, "grad_norm": 1.0546875, "learning_rate": 0.0004999632145608275, "loss": 6.1965, "mean_token_accuracy": 0.13691407367587088, "num_tokens": 3023170.0, "step": 1735 }, { "entropy": 6.259229373931885, "epoch": 0.1353822213577125, "grad_norm": 1.140625, "learning_rate": 0.0004999627117037343, "loss": 5.9459, "mean_token_accuracy": 0.13729629442095756, "num_tokens": 3030565.0, "step": 1740 }, { "entropy": 6.357711887359619, "epoch": 0.13577125072943008, "grad_norm": 1.0, "learning_rate": 0.00049996220543319, "loss": 6.2181, "mean_token_accuracy": 0.1307998225092888, "num_tokens": 3040124.0, "step": 1745 }, { "entropy": 6.373897314071655, "epoch": 0.13616028010114764, "grad_norm": 1.0234375, "learning_rate": 0.0004999616957492025, "loss": 6.0817, "mean_token_accuracy": 0.13463346734642984, "num_tokens": 3048458.0, "step": 1750 }, { "entropy": 6.304511833190918, "epoch": 0.1365493094728652, "grad_norm": 1.0625, "learning_rate": 0.0004999611826517793, "loss": 6.0558, "mean_token_accuracy": 0.12701260522007943, "num_tokens": 3057926.0, "step": 1755 }, { "entropy": 6.371023035049438, "epoch": 0.13693833884458276, "grad_norm": 1.0234375, "learning_rate": 0.0004999606661409281, "loss": 6.0875, "mean_token_accuracy": 0.12731098383665085, "num_tokens": 3066683.0, "step": 1760 }, { "entropy": 6.228750848770142, "epoch": 0.13732736821630034, "grad_norm": 1.0859375, "learning_rate": 0.0004999601462166569, "loss": 6.1605, "mean_token_accuracy": 0.12849701195955276, "num_tokens": 3075117.0, "step": 1765 }, { "entropy": 6.453361701965332, "epoch": 0.1377163975880179, "grad_norm": 0.9921875, "learning_rate": 0.0004999596228789736, "loss": 6.2112, "mean_token_accuracy": 0.12286571562290191, "num_tokens": 3084399.0, "step": 1770 }, { "entropy": 6.295282793045044, "epoch": 0.13810542695973546, "grad_norm": 1.0, "learning_rate": 0.0004999590961278859, "loss": 6.0036, "mean_token_accuracy": 0.13310012146830558, "num_tokens": 3093030.0, "step": 1775 }, { "entropy": 6.348547077178955, "epoch": 0.13849445633145302, "grad_norm": 1.046875, "learning_rate": 0.0004999585659634021, "loss": 6.052, "mean_token_accuracy": 0.13083661049604417, "num_tokens": 3101670.0, "step": 1780 }, { "entropy": 6.234915637969971, "epoch": 0.13888348570317058, "grad_norm": 1.0078125, "learning_rate": 0.0004999580323855301, "loss": 6.0479, "mean_token_accuracy": 0.13650041073560715, "num_tokens": 3109703.0, "step": 1785 }, { "entropy": 6.281410074234008, "epoch": 0.13927251507488816, "grad_norm": 1.0703125, "learning_rate": 0.0004999574953942781, "loss": 6.0274, "mean_token_accuracy": 0.13567775562405587, "num_tokens": 3118388.0, "step": 1790 }, { "entropy": 6.353200960159302, "epoch": 0.13966154444660572, "grad_norm": 1.0703125, "learning_rate": 0.0004999569549896541, "loss": 6.0302, "mean_token_accuracy": 0.13202294185757638, "num_tokens": 3126466.0, "step": 1795 }, { "entropy": 6.298340797424316, "epoch": 0.14005057381832328, "grad_norm": 1.0546875, "learning_rate": 0.0004999564111716665, "loss": 6.0839, "mean_token_accuracy": 0.1356653556227684, "num_tokens": 3135322.0, "step": 1800 }, { "entropy": 6.337237930297851, "epoch": 0.14043960319004084, "grad_norm": 1.0, "learning_rate": 0.0004999558639403232, "loss": 6.0588, "mean_token_accuracy": 0.1421361118555069, "num_tokens": 3144498.0, "step": 1805 }, { "entropy": 6.217201280593872, "epoch": 0.1408286325617584, "grad_norm": 0.97265625, "learning_rate": 0.0004999553132956328, "loss": 6.0453, "mean_token_accuracy": 0.1293400026857853, "num_tokens": 3153573.0, "step": 1810 }, { "entropy": 6.2849945545196535, "epoch": 0.14121766193347599, "grad_norm": 1.0546875, "learning_rate": 0.0004999547592376035, "loss": 5.9778, "mean_token_accuracy": 0.1387234814465046, "num_tokens": 3161705.0, "step": 1815 }, { "entropy": 6.3220963954925535, "epoch": 0.14160669130519354, "grad_norm": 1.15625, "learning_rate": 0.0004999542017662438, "loss": 6.1431, "mean_token_accuracy": 0.1342538885772228, "num_tokens": 3170068.0, "step": 1820 }, { "entropy": 6.324667310714721, "epoch": 0.1419957206769111, "grad_norm": 1.046875, "learning_rate": 0.0004999536408815623, "loss": 6.1425, "mean_token_accuracy": 0.12565823644399643, "num_tokens": 3178140.0, "step": 1825 }, { "entropy": 6.320392513275147, "epoch": 0.14238475004862866, "grad_norm": 1.15625, "learning_rate": 0.0004999530765835672, "loss": 6.1249, "mean_token_accuracy": 0.13419567197561263, "num_tokens": 3186518.0, "step": 1830 }, { "entropy": 6.2921764850616455, "epoch": 0.14277377942034625, "grad_norm": 1.078125, "learning_rate": 0.0004999525088722673, "loss": 6.1074, "mean_token_accuracy": 0.13023580014705657, "num_tokens": 3195246.0, "step": 1835 }, { "entropy": 6.419817972183227, "epoch": 0.1431628087920638, "grad_norm": 1.0625, "learning_rate": 0.0004999519377476711, "loss": 6.1211, "mean_token_accuracy": 0.12776365801692008, "num_tokens": 3203946.0, "step": 1840 }, { "entropy": 6.292534494400025, "epoch": 0.14355183816378136, "grad_norm": 1.1328125, "learning_rate": 0.0004999513632097872, "loss": 6.1428, "mean_token_accuracy": 0.13157911524176596, "num_tokens": 3212208.0, "step": 1845 }, { "entropy": 6.2916301727294925, "epoch": 0.14394086753549892, "grad_norm": 1.03125, "learning_rate": 0.0004999507852586245, "loss": 6.0611, "mean_token_accuracy": 0.1329232007265091, "num_tokens": 3221572.0, "step": 1850 }, { "entropy": 6.4152443408966064, "epoch": 0.14432989690721648, "grad_norm": 1.0546875, "learning_rate": 0.0004999502038941917, "loss": 6.1794, "mean_token_accuracy": 0.12200985550880432, "num_tokens": 3230898.0, "step": 1855 }, { "entropy": 6.27156891822815, "epoch": 0.14471892627893407, "grad_norm": 0.9765625, "learning_rate": 0.0004999496191164975, "loss": 6.1572, "mean_token_accuracy": 0.12799620404839515, "num_tokens": 3240524.0, "step": 1860 }, { "entropy": 6.280993509292602, "epoch": 0.14510795565065163, "grad_norm": 1.0390625, "learning_rate": 0.000499949030925551, "loss": 5.926, "mean_token_accuracy": 0.13632097840309143, "num_tokens": 3248864.0, "step": 1865 }, { "entropy": 6.335269403457642, "epoch": 0.14549698502236919, "grad_norm": 1.109375, "learning_rate": 0.0004999484393213609, "loss": 6.1133, "mean_token_accuracy": 0.1336534596979618, "num_tokens": 3256823.0, "step": 1870 }, { "entropy": 6.222145652770996, "epoch": 0.14588601439408674, "grad_norm": 1.03125, "learning_rate": 0.0004999478443039363, "loss": 6.0304, "mean_token_accuracy": 0.1363625131547451, "num_tokens": 3265621.0, "step": 1875 }, { "entropy": 6.254001569747925, "epoch": 0.14627504376580433, "grad_norm": 1.109375, "learning_rate": 0.0004999472458732862, "loss": 6.0469, "mean_token_accuracy": 0.13533957973122596, "num_tokens": 3273515.0, "step": 1880 }, { "entropy": 6.403596448898315, "epoch": 0.1466640731375219, "grad_norm": 1.1171875, "learning_rate": 0.0004999466440294198, "loss": 6.127, "mean_token_accuracy": 0.13045344352722169, "num_tokens": 3282283.0, "step": 1885 }, { "entropy": 6.232098484039307, "epoch": 0.14705310250923945, "grad_norm": 1.046875, "learning_rate": 0.000499946038772346, "loss": 6.1111, "mean_token_accuracy": 0.1315282925963402, "num_tokens": 3290792.0, "step": 1890 }, { "entropy": 6.209755945205688, "epoch": 0.147442131880957, "grad_norm": 1.109375, "learning_rate": 0.0004999454301020741, "loss": 5.9861, "mean_token_accuracy": 0.13717192485928537, "num_tokens": 3299430.0, "step": 1895 }, { "entropy": 6.237886095046997, "epoch": 0.14783116125267456, "grad_norm": 1.0546875, "learning_rate": 0.0004999448180186133, "loss": 6.0308, "mean_token_accuracy": 0.13776149302721025, "num_tokens": 3307949.0, "step": 1900 }, { "entropy": 6.336954259872437, "epoch": 0.14822019062439215, "grad_norm": 1.0703125, "learning_rate": 0.000499944202521973, "loss": 6.0864, "mean_token_accuracy": 0.13430200293660163, "num_tokens": 3316900.0, "step": 1905 }, { "entropy": 6.256044054031372, "epoch": 0.1486092199961097, "grad_norm": 1.046875, "learning_rate": 0.0004999435836121624, "loss": 6.011, "mean_token_accuracy": 0.14276451393961906, "num_tokens": 3325656.0, "step": 1910 }, { "entropy": 6.280759811401367, "epoch": 0.14899824936782727, "grad_norm": 1.0703125, "learning_rate": 0.000499942961289191, "loss": 6.2337, "mean_token_accuracy": 0.12067875787615776, "num_tokens": 3334219.0, "step": 1915 }, { "entropy": 6.266615104675293, "epoch": 0.14938727873954483, "grad_norm": 0.96484375, "learning_rate": 0.0004999423355530683, "loss": 5.9838, "mean_token_accuracy": 0.13729652389883995, "num_tokens": 3343637.0, "step": 1920 }, { "entropy": 6.2604649543762205, "epoch": 0.1497763081112624, "grad_norm": 1.03125, "learning_rate": 0.0004999417064038035, "loss": 6.1361, "mean_token_accuracy": 0.13217737153172493, "num_tokens": 3352624.0, "step": 1925 }, { "entropy": 6.27165207862854, "epoch": 0.15016533748297997, "grad_norm": 1.0234375, "learning_rate": 0.0004999410738414065, "loss": 6.0498, "mean_token_accuracy": 0.13848454281687736, "num_tokens": 3361394.0, "step": 1930 }, { "entropy": 6.322489500045776, "epoch": 0.15055436685469753, "grad_norm": 1.0078125, "learning_rate": 0.0004999404378658866, "loss": 6.0933, "mean_token_accuracy": 0.13730501234531403, "num_tokens": 3369406.0, "step": 1935 }, { "entropy": 6.297638177871704, "epoch": 0.1509433962264151, "grad_norm": 1.0234375, "learning_rate": 0.0004999397984772536, "loss": 6.0326, "mean_token_accuracy": 0.1359100379049778, "num_tokens": 3377737.0, "step": 1940 }, { "entropy": 6.2445666790008545, "epoch": 0.15133242559813265, "grad_norm": 1.03125, "learning_rate": 0.0004999391556755172, "loss": 6.0976, "mean_token_accuracy": 0.1317235164344311, "num_tokens": 3385514.0, "step": 1945 }, { "entropy": 6.3746106147766115, "epoch": 0.15172145496985023, "grad_norm": 1.0234375, "learning_rate": 0.0004999385094606872, "loss": 6.0018, "mean_token_accuracy": 0.13859265744686128, "num_tokens": 3394500.0, "step": 1950 }, { "entropy": 6.192457056045532, "epoch": 0.1521104843415678, "grad_norm": 1.0625, "learning_rate": 0.0004999378598327733, "loss": 5.9877, "mean_token_accuracy": 0.13467359468340873, "num_tokens": 3403289.0, "step": 1955 }, { "entropy": 6.171674203872681, "epoch": 0.15249951371328535, "grad_norm": 1.0390625, "learning_rate": 0.0004999372067917854, "loss": 5.9218, "mean_token_accuracy": 0.1461538165807724, "num_tokens": 3410892.0, "step": 1960 }, { "entropy": 6.118824768066406, "epoch": 0.1528885430850029, "grad_norm": 1.03125, "learning_rate": 0.0004999365503377335, "loss": 6.0113, "mean_token_accuracy": 0.1375325731933117, "num_tokens": 3420329.0, "step": 1965 }, { "entropy": 6.259453964233399, "epoch": 0.1532775724567205, "grad_norm": 1.078125, "learning_rate": 0.0004999358904706273, "loss": 6.0045, "mean_token_accuracy": 0.13776946887373925, "num_tokens": 3429429.0, "step": 1970 }, { "entropy": 6.2952652931213375, "epoch": 0.15366660182843805, "grad_norm": 1.0625, "learning_rate": 0.0004999352271904771, "loss": 6.1282, "mean_token_accuracy": 0.1321935884654522, "num_tokens": 3438198.0, "step": 1975 }, { "entropy": 6.369889831542968, "epoch": 0.1540556312001556, "grad_norm": 1.078125, "learning_rate": 0.0004999345604972928, "loss": 6.262, "mean_token_accuracy": 0.13315195590257645, "num_tokens": 3447732.0, "step": 1980 }, { "entropy": 6.301447629928589, "epoch": 0.15444466057187317, "grad_norm": 1.1328125, "learning_rate": 0.0004999338903910846, "loss": 6.027, "mean_token_accuracy": 0.13421724662184714, "num_tokens": 3456392.0, "step": 1985 }, { "entropy": 6.218537998199463, "epoch": 0.15483368994359073, "grad_norm": 1.0859375, "learning_rate": 0.0004999332168718626, "loss": 6.0684, "mean_token_accuracy": 0.13393645808100701, "num_tokens": 3464473.0, "step": 1990 }, { "entropy": 6.275947332382202, "epoch": 0.15522271931530832, "grad_norm": 1.0, "learning_rate": 0.0004999325399396371, "loss": 6.0328, "mean_token_accuracy": 0.13263694792985917, "num_tokens": 3473740.0, "step": 1995 }, { "entropy": 6.1024096488952635, "epoch": 0.15561174868702587, "grad_norm": 1.0859375, "learning_rate": 0.0004999318595944183, "loss": 5.9452, "mean_token_accuracy": 0.13779015839099884, "num_tokens": 3482249.0, "step": 2000 }, { "entropy": 6.3668300151824955, "epoch": 0.15600077805874343, "grad_norm": 1.1015625, "learning_rate": 0.0004999311758362166, "loss": 6.1654, "mean_token_accuracy": 0.13282385990023612, "num_tokens": 3490753.0, "step": 2005 }, { "entropy": 6.333145952224731, "epoch": 0.156389807430461, "grad_norm": 1.015625, "learning_rate": 0.0004999304886650422, "loss": 6.1167, "mean_token_accuracy": 0.13160909786820413, "num_tokens": 3499373.0, "step": 2010 }, { "entropy": 6.249400472640991, "epoch": 0.15677883680217858, "grad_norm": 1.0859375, "learning_rate": 0.0004999297980809058, "loss": 6.0791, "mean_token_accuracy": 0.12948477640748024, "num_tokens": 3508344.0, "step": 2015 }, { "entropy": 6.3681032180786135, "epoch": 0.15716786617389614, "grad_norm": 0.9921875, "learning_rate": 0.0004999291040838176, "loss": 6.0576, "mean_token_accuracy": 0.13269878849387168, "num_tokens": 3517009.0, "step": 2020 }, { "entropy": 6.21099362373352, "epoch": 0.1575568955456137, "grad_norm": 1.0859375, "learning_rate": 0.0004999284066737884, "loss": 6.0727, "mean_token_accuracy": 0.1345763050019741, "num_tokens": 3525989.0, "step": 2025 }, { "entropy": 6.309366989135742, "epoch": 0.15794592491733125, "grad_norm": 1.15625, "learning_rate": 0.0004999277058508285, "loss": 5.96, "mean_token_accuracy": 0.1353427805006504, "num_tokens": 3533947.0, "step": 2030 }, { "entropy": 6.186928176879883, "epoch": 0.1583349542890488, "grad_norm": 1.125, "learning_rate": 0.0004999270016149486, "loss": 6.0351, "mean_token_accuracy": 0.1369633160531521, "num_tokens": 3541974.0, "step": 2035 }, { "entropy": 6.187212657928467, "epoch": 0.1587239836607664, "grad_norm": 1.203125, "learning_rate": 0.0004999262939661596, "loss": 5.9727, "mean_token_accuracy": 0.14454701095819472, "num_tokens": 3550436.0, "step": 2040 }, { "entropy": 6.289414739608764, "epoch": 0.15911301303248396, "grad_norm": 1.109375, "learning_rate": 0.0004999255829044721, "loss": 5.9739, "mean_token_accuracy": 0.13857920691370965, "num_tokens": 3558283.0, "step": 2045 }, { "entropy": 6.116622686386108, "epoch": 0.15950204240420152, "grad_norm": 1.0, "learning_rate": 0.0004999248684298968, "loss": 5.8858, "mean_token_accuracy": 0.144998886436224, "num_tokens": 3566968.0, "step": 2050 }, { "entropy": 6.24771900177002, "epoch": 0.15989107177591907, "grad_norm": 1.0390625, "learning_rate": 0.0004999241505424447, "loss": 6.0221, "mean_token_accuracy": 0.13150276690721513, "num_tokens": 3575580.0, "step": 2055 }, { "entropy": 6.248853874206543, "epoch": 0.16028010114763663, "grad_norm": 1.03125, "learning_rate": 0.0004999234292421265, "loss": 6.101, "mean_token_accuracy": 0.1321192666888237, "num_tokens": 3584389.0, "step": 2060 }, { "entropy": 6.242433500289917, "epoch": 0.16066913051935422, "grad_norm": 1.046875, "learning_rate": 0.0004999227045289535, "loss": 5.9212, "mean_token_accuracy": 0.13805124387145043, "num_tokens": 3593009.0, "step": 2065 }, { "entropy": 6.113874626159668, "epoch": 0.16105815989107178, "grad_norm": 1.109375, "learning_rate": 0.0004999219764029363, "loss": 5.9619, "mean_token_accuracy": 0.14041583985090256, "num_tokens": 3601914.0, "step": 2070 }, { "entropy": 6.152489185333252, "epoch": 0.16144718926278934, "grad_norm": 1.125, "learning_rate": 0.0004999212448640861, "loss": 5.9363, "mean_token_accuracy": 0.13822590857744216, "num_tokens": 3609883.0, "step": 2075 }, { "entropy": 6.18636155128479, "epoch": 0.1618362186345069, "grad_norm": 1.1328125, "learning_rate": 0.0004999205099124141, "loss": 5.8719, "mean_token_accuracy": 0.14322010651230813, "num_tokens": 3618103.0, "step": 2080 }, { "entropy": 6.312455940246582, "epoch": 0.16222524800622448, "grad_norm": 1.1171875, "learning_rate": 0.0004999197715479313, "loss": 6.144, "mean_token_accuracy": 0.13272519782185555, "num_tokens": 3625861.0, "step": 2085 }, { "entropy": 6.127534246444702, "epoch": 0.16261427737794204, "grad_norm": 1.0859375, "learning_rate": 0.0004999190297706489, "loss": 5.9282, "mean_token_accuracy": 0.13653620779514314, "num_tokens": 3634498.0, "step": 2090 }, { "entropy": 6.104422616958618, "epoch": 0.1630033067496596, "grad_norm": 1.0234375, "learning_rate": 0.0004999182845805783, "loss": 5.8667, "mean_token_accuracy": 0.136298568546772, "num_tokens": 3644186.0, "step": 2095 }, { "entropy": 6.148884201049805, "epoch": 0.16339233612137716, "grad_norm": 1.0703125, "learning_rate": 0.0004999175359777306, "loss": 6.0077, "mean_token_accuracy": 0.13732302114367484, "num_tokens": 3652831.0, "step": 2100 }, { "entropy": 6.29127516746521, "epoch": 0.16378136549309472, "grad_norm": 1.1328125, "learning_rate": 0.0004999167839621174, "loss": 5.8715, "mean_token_accuracy": 0.14166171625256538, "num_tokens": 3661230.0, "step": 2105 }, { "entropy": 6.123455286026001, "epoch": 0.1641703948648123, "grad_norm": 1.0546875, "learning_rate": 0.0004999160285337501, "loss": 6.0161, "mean_token_accuracy": 0.13657576814293862, "num_tokens": 3669250.0, "step": 2110 }, { "entropy": 6.189156150817871, "epoch": 0.16455942423652986, "grad_norm": 1.1171875, "learning_rate": 0.0004999152696926399, "loss": 5.9946, "mean_token_accuracy": 0.13579504638910295, "num_tokens": 3677568.0, "step": 2115 }, { "entropy": 6.241203927993775, "epoch": 0.16494845360824742, "grad_norm": 1.046875, "learning_rate": 0.0004999145074387985, "loss": 5.9924, "mean_token_accuracy": 0.1418316200375557, "num_tokens": 3685488.0, "step": 2120 }, { "entropy": 6.1650886058807375, "epoch": 0.16533748297996498, "grad_norm": 1.046875, "learning_rate": 0.0004999137417722374, "loss": 5.9612, "mean_token_accuracy": 0.13932890743017196, "num_tokens": 3694357.0, "step": 2125 }, { "entropy": 6.243571758270264, "epoch": 0.16572651235168256, "grad_norm": 1.078125, "learning_rate": 0.0004999129726929684, "loss": 6.025, "mean_token_accuracy": 0.13471606448292733, "num_tokens": 3703173.0, "step": 2130 }, { "entropy": 6.174264240264892, "epoch": 0.16611554172340012, "grad_norm": 1.0703125, "learning_rate": 0.0004999122002010029, "loss": 6.0072, "mean_token_accuracy": 0.13919395282864572, "num_tokens": 3712070.0, "step": 2135 }, { "entropy": 6.181047868728638, "epoch": 0.16650457109511768, "grad_norm": 1.1328125, "learning_rate": 0.0004999114242963527, "loss": 5.9059, "mean_token_accuracy": 0.14334050118923186, "num_tokens": 3720245.0, "step": 2140 }, { "entropy": 6.130413055419922, "epoch": 0.16689360046683524, "grad_norm": 1.015625, "learning_rate": 0.0004999106449790298, "loss": 5.9891, "mean_token_accuracy": 0.13500823676586152, "num_tokens": 3730064.0, "step": 2145 }, { "entropy": 6.13914041519165, "epoch": 0.1672826298385528, "grad_norm": 1.109375, "learning_rate": 0.0004999098622490458, "loss": 5.9473, "mean_token_accuracy": 0.1373259760439396, "num_tokens": 3738741.0, "step": 2150 }, { "entropy": 6.230259609222412, "epoch": 0.16767165921027039, "grad_norm": 1.046875, "learning_rate": 0.0004999090761064125, "loss": 6.0108, "mean_token_accuracy": 0.13627254143357276, "num_tokens": 3747472.0, "step": 2155 }, { "entropy": 6.231689691543579, "epoch": 0.16806068858198794, "grad_norm": 1.0703125, "learning_rate": 0.000499908286551142, "loss": 6.0384, "mean_token_accuracy": 0.1343052066862583, "num_tokens": 3756643.0, "step": 2160 }, { "entropy": 6.230075120925903, "epoch": 0.1684497179537055, "grad_norm": 1.1171875, "learning_rate": 0.0004999074935832463, "loss": 6.1358, "mean_token_accuracy": 0.12708577439188956, "num_tokens": 3765490.0, "step": 2165 }, { "entropy": 6.219008159637451, "epoch": 0.16883874732542306, "grad_norm": 1.1171875, "learning_rate": 0.0004999066972027373, "loss": 5.8962, "mean_token_accuracy": 0.13918948471546172, "num_tokens": 3773063.0, "step": 2170 }, { "entropy": 6.2020885944366455, "epoch": 0.16922777669714065, "grad_norm": 1.0390625, "learning_rate": 0.0004999058974096271, "loss": 6.0591, "mean_token_accuracy": 0.13676124885678292, "num_tokens": 3781763.0, "step": 2175 }, { "entropy": 6.239950656890869, "epoch": 0.1696168060688582, "grad_norm": 1.0234375, "learning_rate": 0.000499905094203928, "loss": 6.0534, "mean_token_accuracy": 0.13679237961769103, "num_tokens": 3790582.0, "step": 2180 }, { "entropy": 6.150587844848633, "epoch": 0.17000583544057576, "grad_norm": 1.0625, "learning_rate": 0.000499904287585652, "loss": 5.867, "mean_token_accuracy": 0.1422402709722519, "num_tokens": 3798745.0, "step": 2185 }, { "entropy": 6.110662794113159, "epoch": 0.17039486481229332, "grad_norm": 1.0546875, "learning_rate": 0.0004999034775548113, "loss": 5.9639, "mean_token_accuracy": 0.1360377162694931, "num_tokens": 3806901.0, "step": 2190 }, { "entropy": 6.1845409870147705, "epoch": 0.17078389418401088, "grad_norm": 1.3359375, "learning_rate": 0.0004999026641114185, "loss": 5.9155, "mean_token_accuracy": 0.14578790441155434, "num_tokens": 3815742.0, "step": 2195 }, { "entropy": 6.143110513687134, "epoch": 0.17117292355572847, "grad_norm": 1.046875, "learning_rate": 0.0004999018472554857, "loss": 5.9944, "mean_token_accuracy": 0.13587727323174476, "num_tokens": 3824468.0, "step": 2200 }, { "entropy": 6.135712718963623, "epoch": 0.17156195292744603, "grad_norm": 1.09375, "learning_rate": 0.0004999010269870253, "loss": 5.9584, "mean_token_accuracy": 0.143868188560009, "num_tokens": 3832834.0, "step": 2205 }, { "entropy": 6.166628980636597, "epoch": 0.17195098229916359, "grad_norm": 1.0234375, "learning_rate": 0.0004999002033060498, "loss": 5.9977, "mean_token_accuracy": 0.14069228172302245, "num_tokens": 3841780.0, "step": 2210 }, { "entropy": 6.188239908218383, "epoch": 0.17234001167088114, "grad_norm": 1.0546875, "learning_rate": 0.0004998993762125716, "loss": 6.1029, "mean_token_accuracy": 0.13046709224581718, "num_tokens": 3849840.0, "step": 2215 }, { "entropy": 6.256720972061157, "epoch": 0.17272904104259873, "grad_norm": 1.0625, "learning_rate": 0.0004998985457066034, "loss": 6.0247, "mean_token_accuracy": 0.13210274502635003, "num_tokens": 3858204.0, "step": 2220 }, { "entropy": 6.179963779449463, "epoch": 0.1731180704143163, "grad_norm": 0.9375, "learning_rate": 0.0004998977117881576, "loss": 5.9783, "mean_token_accuracy": 0.1354764722287655, "num_tokens": 3866615.0, "step": 2225 }, { "entropy": 6.147153520584107, "epoch": 0.17350709978603385, "grad_norm": 0.921875, "learning_rate": 0.0004998968744572472, "loss": 6.0107, "mean_token_accuracy": 0.14103505611419678, "num_tokens": 3876003.0, "step": 2230 }, { "entropy": 6.217945766448975, "epoch": 0.1738961291577514, "grad_norm": 1.0078125, "learning_rate": 0.0004998960337138845, "loss": 5.9371, "mean_token_accuracy": 0.14079653322696686, "num_tokens": 3884362.0, "step": 2235 }, { "entropy": 6.073576307296753, "epoch": 0.17428515852946896, "grad_norm": 0.9609375, "learning_rate": 0.0004998951895580826, "loss": 5.897, "mean_token_accuracy": 0.14070344492793083, "num_tokens": 3893177.0, "step": 2240 }, { "entropy": 6.157261037826538, "epoch": 0.17467418790118655, "grad_norm": 1.109375, "learning_rate": 0.0004998943419898542, "loss": 5.9474, "mean_token_accuracy": 0.1386074975132942, "num_tokens": 3903006.0, "step": 2245 }, { "entropy": 6.155741262435913, "epoch": 0.1750632172729041, "grad_norm": 1.0078125, "learning_rate": 0.0004998934910092119, "loss": 5.8105, "mean_token_accuracy": 0.14036383107304573, "num_tokens": 3912256.0, "step": 2250 }, { "entropy": 6.107159423828125, "epoch": 0.17545224664462167, "grad_norm": 1.09375, "learning_rate": 0.0004998926366161689, "loss": 5.9881, "mean_token_accuracy": 0.13784814327955247, "num_tokens": 3921121.0, "step": 2255 }, { "entropy": 6.162649297714234, "epoch": 0.17584127601633923, "grad_norm": 1.03125, "learning_rate": 0.0004998917788107383, "loss": 5.936, "mean_token_accuracy": 0.14180586934089662, "num_tokens": 3929348.0, "step": 2260 }, { "entropy": 6.186119127273559, "epoch": 0.17623030538805678, "grad_norm": 1.0546875, "learning_rate": 0.0004998909175929326, "loss": 6.1057, "mean_token_accuracy": 0.13549725115299224, "num_tokens": 3938073.0, "step": 2265 }, { "entropy": 6.232157850265503, "epoch": 0.17661933475977437, "grad_norm": 1.0390625, "learning_rate": 0.0004998900529627653, "loss": 6.0756, "mean_token_accuracy": 0.13264880701899529, "num_tokens": 3946641.0, "step": 2270 }, { "entropy": 6.23204550743103, "epoch": 0.17700836413149193, "grad_norm": 1.078125, "learning_rate": 0.0004998891849202495, "loss": 5.9243, "mean_token_accuracy": 0.14050190299749374, "num_tokens": 3954586.0, "step": 2275 }, { "entropy": 6.094369125366211, "epoch": 0.1773973935032095, "grad_norm": 1.109375, "learning_rate": 0.000499888313465398, "loss": 5.9946, "mean_token_accuracy": 0.13950968906283379, "num_tokens": 3963745.0, "step": 2280 }, { "entropy": 6.103000974655151, "epoch": 0.17778642287492705, "grad_norm": 1.078125, "learning_rate": 0.0004998874385982247, "loss": 5.8128, "mean_token_accuracy": 0.14982413798570632, "num_tokens": 3972452.0, "step": 2285 }, { "entropy": 6.083374404907227, "epoch": 0.17817545224664463, "grad_norm": 1.0078125, "learning_rate": 0.0004998865603187421, "loss": 5.9248, "mean_token_accuracy": 0.14283788874745368, "num_tokens": 3980770.0, "step": 2290 }, { "entropy": 6.199732637405395, "epoch": 0.1785644816183622, "grad_norm": 1.015625, "learning_rate": 0.000499885678626964, "loss": 5.9604, "mean_token_accuracy": 0.13827717006206514, "num_tokens": 3989545.0, "step": 2295 }, { "entropy": 6.1625518798828125, "epoch": 0.17895351099007975, "grad_norm": 0.98046875, "learning_rate": 0.0004998847935229038, "loss": 5.9269, "mean_token_accuracy": 0.13749036863446235, "num_tokens": 3998034.0, "step": 2300 }, { "entropy": 6.0795563697814945, "epoch": 0.1793425403617973, "grad_norm": 1.03125, "learning_rate": 0.0004998839050065746, "loss": 5.9428, "mean_token_accuracy": 0.1421938106417656, "num_tokens": 4007110.0, "step": 2305 }, { "entropy": 6.205491638183593, "epoch": 0.17973156973351487, "grad_norm": 1.078125, "learning_rate": 0.0004998830130779902, "loss": 6.0211, "mean_token_accuracy": 0.1329338550567627, "num_tokens": 4015930.0, "step": 2310 }, { "entropy": 6.017514371871949, "epoch": 0.18012059910523245, "grad_norm": 0.99609375, "learning_rate": 0.000499882117737164, "loss": 5.8263, "mean_token_accuracy": 0.1466153845191002, "num_tokens": 4024510.0, "step": 2315 }, { "entropy": 6.066116762161255, "epoch": 0.18050962847695, "grad_norm": 0.98046875, "learning_rate": 0.0004998812189841096, "loss": 5.9342, "mean_token_accuracy": 0.13980292826890944, "num_tokens": 4033714.0, "step": 2320 }, { "entropy": 6.282118463516236, "epoch": 0.18089865784866757, "grad_norm": 1.1171875, "learning_rate": 0.0004998803168188407, "loss": 6.1212, "mean_token_accuracy": 0.1319077990949154, "num_tokens": 4042376.0, "step": 2325 }, { "entropy": 6.0946657180786135, "epoch": 0.18128768722038513, "grad_norm": 1.078125, "learning_rate": 0.0004998794112413708, "loss": 5.8755, "mean_token_accuracy": 0.1430434338748455, "num_tokens": 4050521.0, "step": 2330 }, { "entropy": 6.216298198699951, "epoch": 0.18167671659210272, "grad_norm": 1.0546875, "learning_rate": 0.0004998785022517137, "loss": 6.0448, "mean_token_accuracy": 0.13777603581547737, "num_tokens": 4059384.0, "step": 2335 }, { "entropy": 6.148222923278809, "epoch": 0.18206574596382027, "grad_norm": 1.1171875, "learning_rate": 0.0004998775898498835, "loss": 5.9296, "mean_token_accuracy": 0.13958509340882302, "num_tokens": 4067655.0, "step": 2340 }, { "entropy": 6.157079124450684, "epoch": 0.18245477533553783, "grad_norm": 1.0625, "learning_rate": 0.0004998766740358936, "loss": 5.9141, "mean_token_accuracy": 0.1455913409590721, "num_tokens": 4075828.0, "step": 2345 }, { "entropy": 6.141853141784668, "epoch": 0.1828438047072554, "grad_norm": 1.0703125, "learning_rate": 0.0004998757548097582, "loss": 5.8682, "mean_token_accuracy": 0.1426569327712059, "num_tokens": 4083796.0, "step": 2350 }, { "entropy": 6.067271041870117, "epoch": 0.18323283407897295, "grad_norm": 0.98046875, "learning_rate": 0.0004998748321714911, "loss": 6.0011, "mean_token_accuracy": 0.14092514365911485, "num_tokens": 4092981.0, "step": 2355 }, { "entropy": 6.112659883499146, "epoch": 0.18362186345069054, "grad_norm": 1.0859375, "learning_rate": 0.0004998739061211065, "loss": 5.827, "mean_token_accuracy": 0.14185563325881959, "num_tokens": 4101363.0, "step": 2360 }, { "entropy": 6.115339231491089, "epoch": 0.1840108928224081, "grad_norm": 1.0, "learning_rate": 0.0004998729766586181, "loss": 5.9131, "mean_token_accuracy": 0.14075915217399598, "num_tokens": 4110164.0, "step": 2365 }, { "entropy": 6.212285280227661, "epoch": 0.18439992219412565, "grad_norm": 1.078125, "learning_rate": 0.0004998720437840403, "loss": 6.0276, "mean_token_accuracy": 0.13580502569675446, "num_tokens": 4119098.0, "step": 2370 }, { "entropy": 6.153889179229736, "epoch": 0.1847889515658432, "grad_norm": 1.0703125, "learning_rate": 0.0004998711074973871, "loss": 5.9253, "mean_token_accuracy": 0.14312097132205964, "num_tokens": 4127522.0, "step": 2375 }, { "entropy": 6.095731449127197, "epoch": 0.1851779809375608, "grad_norm": 1.0625, "learning_rate": 0.0004998701677986728, "loss": 5.9557, "mean_token_accuracy": 0.1446719117462635, "num_tokens": 4136311.0, "step": 2380 }, { "entropy": 6.094022607803344, "epoch": 0.18556701030927836, "grad_norm": 0.9765625, "learning_rate": 0.0004998692246879116, "loss": 5.8754, "mean_token_accuracy": 0.14761602729558945, "num_tokens": 4145160.0, "step": 2385 }, { "entropy": 6.067728042602539, "epoch": 0.18595603968099592, "grad_norm": 1.1015625, "learning_rate": 0.0004998682781651178, "loss": 5.8564, "mean_token_accuracy": 0.14451601579785348, "num_tokens": 4153921.0, "step": 2390 }, { "entropy": 6.078082847595215, "epoch": 0.18634506905271347, "grad_norm": 1.0390625, "learning_rate": 0.0004998673282303059, "loss": 5.9202, "mean_token_accuracy": 0.13949069231748581, "num_tokens": 4162580.0, "step": 2395 }, { "entropy": 6.101584386825562, "epoch": 0.18673409842443103, "grad_norm": 1.03125, "learning_rate": 0.0004998663748834901, "loss": 5.9162, "mean_token_accuracy": 0.1455289751291275, "num_tokens": 4170623.0, "step": 2400 }, { "entropy": 6.083553886413574, "epoch": 0.18712312779614862, "grad_norm": 1.0546875, "learning_rate": 0.0004998654181246851, "loss": 5.9049, "mean_token_accuracy": 0.1480133354663849, "num_tokens": 4178724.0, "step": 2405 }, { "entropy": 6.097364902496338, "epoch": 0.18751215716786618, "grad_norm": 1.0546875, "learning_rate": 0.0004998644579539052, "loss": 5.9147, "mean_token_accuracy": 0.1468910664319992, "num_tokens": 4187773.0, "step": 2410 }, { "entropy": 6.116354370117188, "epoch": 0.18790118653958374, "grad_norm": 0.9921875, "learning_rate": 0.000499863494371165, "loss": 5.9139, "mean_token_accuracy": 0.13767781779170035, "num_tokens": 4196628.0, "step": 2415 }, { "entropy": 6.088314533233643, "epoch": 0.1882902159113013, "grad_norm": 1.0859375, "learning_rate": 0.0004998625273764793, "loss": 5.9477, "mean_token_accuracy": 0.13856262788176538, "num_tokens": 4205090.0, "step": 2420 }, { "entropy": 6.103470802307129, "epoch": 0.18867924528301888, "grad_norm": 1.0390625, "learning_rate": 0.0004998615569698626, "loss": 5.8589, "mean_token_accuracy": 0.143842813372612, "num_tokens": 4212757.0, "step": 2425 }, { "entropy": 6.075373220443725, "epoch": 0.18906827465473644, "grad_norm": 1.078125, "learning_rate": 0.0004998605831513296, "loss": 5.9298, "mean_token_accuracy": 0.14338203594088555, "num_tokens": 4221556.0, "step": 2430 }, { "entropy": 6.053972434997559, "epoch": 0.189457304026454, "grad_norm": 1.046875, "learning_rate": 0.0004998596059208953, "loss": 5.9098, "mean_token_accuracy": 0.14371097087860107, "num_tokens": 4231524.0, "step": 2435 }, { "entropy": 6.094544792175293, "epoch": 0.18984633339817156, "grad_norm": 1.109375, "learning_rate": 0.0004998586252785743, "loss": 5.9522, "mean_token_accuracy": 0.14406583532691003, "num_tokens": 4240229.0, "step": 2440 }, { "entropy": 6.133808565139771, "epoch": 0.19023536276988912, "grad_norm": 1.046875, "learning_rate": 0.0004998576412243816, "loss": 5.8211, "mean_token_accuracy": 0.14667747020721436, "num_tokens": 4248053.0, "step": 2445 }, { "entropy": 6.111063623428345, "epoch": 0.1906243921416067, "grad_norm": 1.046875, "learning_rate": 0.0004998566537583321, "loss": 5.8754, "mean_token_accuracy": 0.14372672364115716, "num_tokens": 4256019.0, "step": 2450 }, { "entropy": 6.058719348907471, "epoch": 0.19101342151332426, "grad_norm": 1.1015625, "learning_rate": 0.0004998556628804408, "loss": 5.8515, "mean_token_accuracy": 0.14850348010659217, "num_tokens": 4263805.0, "step": 2455 }, { "entropy": 6.0601448059082035, "epoch": 0.19140245088504182, "grad_norm": 1.0546875, "learning_rate": 0.0004998546685907225, "loss": 5.9217, "mean_token_accuracy": 0.14053093194961547, "num_tokens": 4272712.0, "step": 2460 }, { "entropy": 6.184451723098755, "epoch": 0.19179148025675938, "grad_norm": 1.046875, "learning_rate": 0.0004998536708891927, "loss": 5.8494, "mean_token_accuracy": 0.14523410499095918, "num_tokens": 4281222.0, "step": 2465 }, { "entropy": 6.039083003997803, "epoch": 0.19218050962847694, "grad_norm": 1.0859375, "learning_rate": 0.0004998526697758663, "loss": 5.9574, "mean_token_accuracy": 0.1356569655239582, "num_tokens": 4290558.0, "step": 2470 }, { "entropy": 6.214207363128662, "epoch": 0.19256953900019452, "grad_norm": 1.0390625, "learning_rate": 0.0004998516652507585, "loss": 5.992, "mean_token_accuracy": 0.1386689119040966, "num_tokens": 4299684.0, "step": 2475 }, { "entropy": 6.056800842285156, "epoch": 0.19295856837191208, "grad_norm": 1.0859375, "learning_rate": 0.0004998506573138846, "loss": 5.9337, "mean_token_accuracy": 0.14160904437303543, "num_tokens": 4308938.0, "step": 2480 }, { "entropy": 6.002795457839966, "epoch": 0.19334759774362964, "grad_norm": 1.0, "learning_rate": 0.0004998496459652598, "loss": 5.7948, "mean_token_accuracy": 0.1451106436550617, "num_tokens": 4317646.0, "step": 2485 }, { "entropy": 6.065030527114868, "epoch": 0.1937366271153472, "grad_norm": 0.99609375, "learning_rate": 0.0004998486312048995, "loss": 5.9336, "mean_token_accuracy": 0.13834921047091484, "num_tokens": 4326876.0, "step": 2490 }, { "entropy": 6.060744047164917, "epoch": 0.19412565648706478, "grad_norm": 0.96484375, "learning_rate": 0.0004998476130328193, "loss": 5.8946, "mean_token_accuracy": 0.1431366868317127, "num_tokens": 4335391.0, "step": 2495 }, { "entropy": 6.179794597625732, "epoch": 0.19451468585878234, "grad_norm": 1.015625, "learning_rate": 0.0004998465914490343, "loss": 5.876, "mean_token_accuracy": 0.1446529857814312, "num_tokens": 4343253.0, "step": 2500 }, { "entropy": 5.931164121627807, "epoch": 0.1949037152304999, "grad_norm": 0.97265625, "learning_rate": 0.00049984556645356, "loss": 5.8497, "mean_token_accuracy": 0.14115574061870576, "num_tokens": 4352161.0, "step": 2505 }, { "entropy": 6.055073976516724, "epoch": 0.19529274460221746, "grad_norm": 1.046875, "learning_rate": 0.0004998445380464124, "loss": 5.8066, "mean_token_accuracy": 0.15022924542427063, "num_tokens": 4360414.0, "step": 2510 }, { "entropy": 6.062896585464477, "epoch": 0.19568177397393502, "grad_norm": 1.0546875, "learning_rate": 0.0004998435062276066, "loss": 5.7918, "mean_token_accuracy": 0.1486874118447304, "num_tokens": 4369375.0, "step": 2515 }, { "entropy": 5.977962446212769, "epoch": 0.1960708033456526, "grad_norm": 1.1015625, "learning_rate": 0.0004998424709971586, "loss": 5.8276, "mean_token_accuracy": 0.14558200165629387, "num_tokens": 4378638.0, "step": 2520 }, { "entropy": 6.117749452590942, "epoch": 0.19645983271737016, "grad_norm": 1.03125, "learning_rate": 0.0004998414323550839, "loss": 5.8265, "mean_token_accuracy": 0.1476297803223133, "num_tokens": 4388262.0, "step": 2525 }, { "entropy": 6.057101821899414, "epoch": 0.19684886208908772, "grad_norm": 0.98828125, "learning_rate": 0.0004998403903013984, "loss": 5.8196, "mean_token_accuracy": 0.14260421246290206, "num_tokens": 4396894.0, "step": 2530 }, { "entropy": 6.098726224899292, "epoch": 0.19723789146080528, "grad_norm": 0.9375, "learning_rate": 0.0004998393448361179, "loss": 5.9515, "mean_token_accuracy": 0.14099942818284034, "num_tokens": 4405455.0, "step": 2535 }, { "entropy": 6.090051698684692, "epoch": 0.19762692083252287, "grad_norm": 1.1484375, "learning_rate": 0.000499838295959258, "loss": 5.8408, "mean_token_accuracy": 0.14691002145409585, "num_tokens": 4414355.0, "step": 2540 }, { "entropy": 5.944388818740845, "epoch": 0.19801595020424043, "grad_norm": 1.0859375, "learning_rate": 0.000499837243670835, "loss": 5.7418, "mean_token_accuracy": 0.15249036699533464, "num_tokens": 4422305.0, "step": 2545 }, { "entropy": 6.083198404312133, "epoch": 0.19840497957595798, "grad_norm": 1.0078125, "learning_rate": 0.0004998361879708646, "loss": 5.8824, "mean_token_accuracy": 0.14111227691173553, "num_tokens": 4430813.0, "step": 2550 }, { "entropy": 6.062122344970703, "epoch": 0.19879400894767554, "grad_norm": 0.9765625, "learning_rate": 0.000499835128859363, "loss": 5.845, "mean_token_accuracy": 0.1449693761765957, "num_tokens": 4440229.0, "step": 2555 }, { "entropy": 5.969413232803345, "epoch": 0.1991830383193931, "grad_norm": 1.0, "learning_rate": 0.0004998340663363461, "loss": 5.8636, "mean_token_accuracy": 0.14286035373806955, "num_tokens": 4449417.0, "step": 2560 }, { "entropy": 6.115420150756836, "epoch": 0.1995720676911107, "grad_norm": 1.0390625, "learning_rate": 0.0004998330004018301, "loss": 5.9049, "mean_token_accuracy": 0.14032256752252578, "num_tokens": 4457377.0, "step": 2565 }, { "entropy": 6.076362800598145, "epoch": 0.19996109706282825, "grad_norm": 1.03125, "learning_rate": 0.0004998319310558312, "loss": 5.8205, "mean_token_accuracy": 0.14231560602784157, "num_tokens": 4466839.0, "step": 2570 }, { "entropy": 6.02218279838562, "epoch": 0.2003501264345458, "grad_norm": 1.125, "learning_rate": 0.0004998308582983657, "loss": 5.8572, "mean_token_accuracy": 0.14494595527648926, "num_tokens": 4476369.0, "step": 2575 }, { "entropy": 6.032584857940674, "epoch": 0.20073915580626336, "grad_norm": 1.0, "learning_rate": 0.0004998297821294497, "loss": 5.921, "mean_token_accuracy": 0.14298095181584358, "num_tokens": 4485609.0, "step": 2580 }, { "entropy": 6.070321846008301, "epoch": 0.20112818517798095, "grad_norm": 1.0859375, "learning_rate": 0.0004998287025490995, "loss": 5.873, "mean_token_accuracy": 0.14022249430418016, "num_tokens": 4494535.0, "step": 2585 }, { "entropy": 6.069472455978394, "epoch": 0.2015172145496985, "grad_norm": 0.95703125, "learning_rate": 0.0004998276195573317, "loss": 5.8392, "mean_token_accuracy": 0.1400721177458763, "num_tokens": 4503133.0, "step": 2590 }, { "entropy": 5.981370306015014, "epoch": 0.20190624392141607, "grad_norm": 0.94140625, "learning_rate": 0.0004998265331541627, "loss": 5.7476, "mean_token_accuracy": 0.15337812453508376, "num_tokens": 4511465.0, "step": 2595 }, { "entropy": 6.02926983833313, "epoch": 0.20229527329313363, "grad_norm": 1.09375, "learning_rate": 0.0004998254433396088, "loss": 5.8029, "mean_token_accuracy": 0.14853528290987014, "num_tokens": 4520177.0, "step": 2600 }, { "entropy": 6.066452360153198, "epoch": 0.20268430266485118, "grad_norm": 1.0390625, "learning_rate": 0.0004998243501136867, "loss": 5.9622, "mean_token_accuracy": 0.14383991807699203, "num_tokens": 4528370.0, "step": 2605 }, { "entropy": 6.163117504119873, "epoch": 0.20307333203656877, "grad_norm": 1.0390625, "learning_rate": 0.0004998232534764129, "loss": 5.99, "mean_token_accuracy": 0.13582537844777107, "num_tokens": 4538258.0, "step": 2610 }, { "entropy": 6.0580810546875, "epoch": 0.20346236140828633, "grad_norm": 1.03125, "learning_rate": 0.0004998221534278041, "loss": 5.8843, "mean_token_accuracy": 0.14223846048116684, "num_tokens": 4547300.0, "step": 2615 }, { "entropy": 6.087620735168457, "epoch": 0.2038513907800039, "grad_norm": 0.9453125, "learning_rate": 0.0004998210499678769, "loss": 5.9576, "mean_token_accuracy": 0.13359709531068803, "num_tokens": 4556877.0, "step": 2620 }, { "entropy": 6.031925868988037, "epoch": 0.20424042015172145, "grad_norm": 1.0625, "learning_rate": 0.0004998199430966481, "loss": 5.8074, "mean_token_accuracy": 0.1435726575553417, "num_tokens": 4565999.0, "step": 2625 }, { "entropy": 6.016840887069702, "epoch": 0.20462944952343903, "grad_norm": 1.1015625, "learning_rate": 0.0004998188328141346, "loss": 5.8493, "mean_token_accuracy": 0.13968632593750954, "num_tokens": 4574027.0, "step": 2630 }, { "entropy": 5.995946645736694, "epoch": 0.2050184788951566, "grad_norm": 1.0390625, "learning_rate": 0.0004998177191203531, "loss": 5.8536, "mean_token_accuracy": 0.13539135009050368, "num_tokens": 4582402.0, "step": 2635 }, { "entropy": 6.051613092422485, "epoch": 0.20540750826687415, "grad_norm": 1.109375, "learning_rate": 0.0004998166020153204, "loss": 5.8055, "mean_token_accuracy": 0.14385574758052827, "num_tokens": 4590381.0, "step": 2640 }, { "entropy": 6.0391960620880125, "epoch": 0.2057965376385917, "grad_norm": 1.1171875, "learning_rate": 0.0004998154814990538, "loss": 5.8637, "mean_token_accuracy": 0.14247775822877884, "num_tokens": 4598910.0, "step": 2645 }, { "entropy": 6.170034503936767, "epoch": 0.20618556701030927, "grad_norm": 1.015625, "learning_rate": 0.00049981435757157, "loss": 5.9733, "mean_token_accuracy": 0.13756560906767845, "num_tokens": 4607400.0, "step": 2650 }, { "entropy": 6.0044433116912845, "epoch": 0.20657459638202685, "grad_norm": 0.88671875, "learning_rate": 0.0004998132302328862, "loss": 5.9158, "mean_token_accuracy": 0.14620504081249236, "num_tokens": 4616510.0, "step": 2655 }, { "entropy": 6.089318561553955, "epoch": 0.2069636257537444, "grad_norm": 1.0, "learning_rate": 0.0004998120994830195, "loss": 5.8585, "mean_token_accuracy": 0.15085278004407882, "num_tokens": 4624529.0, "step": 2660 }, { "entropy": 6.052582168579102, "epoch": 0.20735265512546197, "grad_norm": 1.0234375, "learning_rate": 0.000499810965321987, "loss": 5.7948, "mean_token_accuracy": 0.1443331226706505, "num_tokens": 4632141.0, "step": 2665 }, { "entropy": 6.077098178863525, "epoch": 0.20774168449717953, "grad_norm": 1.0703125, "learning_rate": 0.0004998098277498059, "loss": 6.0011, "mean_token_accuracy": 0.14341832026839257, "num_tokens": 4640378.0, "step": 2670 }, { "entropy": 6.038132619857788, "epoch": 0.2081307138688971, "grad_norm": 0.94140625, "learning_rate": 0.0004998086867664934, "loss": 5.7666, "mean_token_accuracy": 0.14619476199150086, "num_tokens": 4649313.0, "step": 2675 }, { "entropy": 6.0627112865448, "epoch": 0.20851974324061467, "grad_norm": 1.0546875, "learning_rate": 0.000499807542372067, "loss": 5.8704, "mean_token_accuracy": 0.14677273184061052, "num_tokens": 4658272.0, "step": 2680 }, { "entropy": 5.999119997024536, "epoch": 0.20890877261233223, "grad_norm": 1.03125, "learning_rate": 0.0004998063945665439, "loss": 5.7272, "mean_token_accuracy": 0.1503640040755272, "num_tokens": 4665970.0, "step": 2685 }, { "entropy": 6.0891471862792965, "epoch": 0.2092978019840498, "grad_norm": 0.953125, "learning_rate": 0.0004998052433499416, "loss": 5.9918, "mean_token_accuracy": 0.1369311533868313, "num_tokens": 4675308.0, "step": 2690 }, { "entropy": 6.027482986450195, "epoch": 0.20968683135576735, "grad_norm": 1.03125, "learning_rate": 0.0004998040887222776, "loss": 5.8264, "mean_token_accuracy": 0.14104743599891661, "num_tokens": 4684316.0, "step": 2695 }, { "entropy": 6.0261436939239506, "epoch": 0.21007586072748494, "grad_norm": 1.0859375, "learning_rate": 0.0004998029306835693, "loss": 5.7484, "mean_token_accuracy": 0.1449325144290924, "num_tokens": 4693029.0, "step": 2700 }, { "entropy": 6.008954334259033, "epoch": 0.2104648900992025, "grad_norm": 1.03125, "learning_rate": 0.0004998017692338344, "loss": 5.9501, "mean_token_accuracy": 0.1345457024872303, "num_tokens": 4702404.0, "step": 2705 }, { "entropy": 6.1038126945495605, "epoch": 0.21085391947092005, "grad_norm": 0.95703125, "learning_rate": 0.0004998006043730905, "loss": 5.9081, "mean_token_accuracy": 0.1360231891274452, "num_tokens": 4711126.0, "step": 2710 }, { "entropy": 6.061972713470459, "epoch": 0.2112429488426376, "grad_norm": 0.96484375, "learning_rate": 0.0004997994361013551, "loss": 5.9103, "mean_token_accuracy": 0.1473036840558052, "num_tokens": 4719816.0, "step": 2715 }, { "entropy": 6.112641429901123, "epoch": 0.21163197821435517, "grad_norm": 1.0078125, "learning_rate": 0.0004997982644186461, "loss": 5.8544, "mean_token_accuracy": 0.14111861065030099, "num_tokens": 4728294.0, "step": 2720 }, { "entropy": 6.039841270446777, "epoch": 0.21202100758607276, "grad_norm": 0.9609375, "learning_rate": 0.0004997970893249813, "loss": 5.781, "mean_token_accuracy": 0.14560880810022353, "num_tokens": 4736708.0, "step": 2725 }, { "entropy": 6.011950349807739, "epoch": 0.21241003695779032, "grad_norm": 1.015625, "learning_rate": 0.0004997959108203785, "loss": 5.9664, "mean_token_accuracy": 0.13347356244921685, "num_tokens": 4744893.0, "step": 2730 }, { "entropy": 6.164001941680908, "epoch": 0.21279906632950787, "grad_norm": 1.0625, "learning_rate": 0.0004997947289048554, "loss": 5.909, "mean_token_accuracy": 0.14289160668849946, "num_tokens": 4753246.0, "step": 2735 }, { "entropy": 6.004565238952637, "epoch": 0.21318809570122543, "grad_norm": 0.99609375, "learning_rate": 0.0004997935435784302, "loss": 5.8313, "mean_token_accuracy": 0.13941832184791564, "num_tokens": 4762229.0, "step": 2740 }, { "entropy": 5.904656267166137, "epoch": 0.21357712507294302, "grad_norm": 1.03125, "learning_rate": 0.0004997923548411208, "loss": 5.788, "mean_token_accuracy": 0.1491306185722351, "num_tokens": 4771315.0, "step": 2745 }, { "entropy": 5.89280514717102, "epoch": 0.21396615444466058, "grad_norm": 1.046875, "learning_rate": 0.000499791162692945, "loss": 5.7262, "mean_token_accuracy": 0.15562662929296495, "num_tokens": 4779848.0, "step": 2750 }, { "entropy": 6.105467939376831, "epoch": 0.21435518381637814, "grad_norm": 1.015625, "learning_rate": 0.0004997899671339214, "loss": 5.953, "mean_token_accuracy": 0.13940655589103698, "num_tokens": 4788939.0, "step": 2755 }, { "entropy": 6.0590917587280275, "epoch": 0.2147442131880957, "grad_norm": 1.015625, "learning_rate": 0.0004997887681640675, "loss": 5.8526, "mean_token_accuracy": 0.14215253964066504, "num_tokens": 4797719.0, "step": 2760 }, { "entropy": 6.048555850982666, "epoch": 0.21513324255981325, "grad_norm": 1.0546875, "learning_rate": 0.0004997875657834021, "loss": 5.9096, "mean_token_accuracy": 0.14236008748412132, "num_tokens": 4805601.0, "step": 2765 }, { "entropy": 6.133038139343261, "epoch": 0.21552227193153084, "grad_norm": 1.0078125, "learning_rate": 0.0004997863599919432, "loss": 5.8669, "mean_token_accuracy": 0.14362844973802566, "num_tokens": 4814993.0, "step": 2770 }, { "entropy": 6.037166595458984, "epoch": 0.2159113013032484, "grad_norm": 1.03125, "learning_rate": 0.0004997851507897089, "loss": 5.8201, "mean_token_accuracy": 0.1418660469353199, "num_tokens": 4824156.0, "step": 2775 }, { "entropy": 5.9804931640625, "epoch": 0.21630033067496596, "grad_norm": 0.96484375, "learning_rate": 0.0004997839381767178, "loss": 5.914, "mean_token_accuracy": 0.13883057311177255, "num_tokens": 4833827.0, "step": 2780 }, { "entropy": 6.000218725204467, "epoch": 0.21668936004668352, "grad_norm": 1.0234375, "learning_rate": 0.0004997827221529882, "loss": 5.8457, "mean_token_accuracy": 0.14448366090655326, "num_tokens": 4842801.0, "step": 2785 }, { "entropy": 5.977024841308594, "epoch": 0.2170783894184011, "grad_norm": 1.09375, "learning_rate": 0.0004997815027185386, "loss": 5.7228, "mean_token_accuracy": 0.1479553274810314, "num_tokens": 4850928.0, "step": 2790 }, { "entropy": 6.019153690338134, "epoch": 0.21746741879011866, "grad_norm": 1.015625, "learning_rate": 0.0004997802798733874, "loss": 5.8354, "mean_token_accuracy": 0.14865680709481238, "num_tokens": 4859510.0, "step": 2795 }, { "entropy": 6.055089998245239, "epoch": 0.21785644816183622, "grad_norm": 0.921875, "learning_rate": 0.0004997790536175534, "loss": 5.8612, "mean_token_accuracy": 0.14595925584435462, "num_tokens": 4868201.0, "step": 2800 }, { "entropy": 5.951241731643677, "epoch": 0.21824547753355378, "grad_norm": 1.0234375, "learning_rate": 0.0004997778239510548, "loss": 5.7896, "mean_token_accuracy": 0.1492677852511406, "num_tokens": 4876896.0, "step": 2805 }, { "entropy": 5.933494901657104, "epoch": 0.21863450690527134, "grad_norm": 1.0390625, "learning_rate": 0.0004997765908739106, "loss": 5.7462, "mean_token_accuracy": 0.1509405829012394, "num_tokens": 4885136.0, "step": 2810 }, { "entropy": 5.998682165145874, "epoch": 0.21902353627698892, "grad_norm": 1.078125, "learning_rate": 0.0004997753543861395, "loss": 5.7656, "mean_token_accuracy": 0.14779986441135406, "num_tokens": 4893277.0, "step": 2815 }, { "entropy": 5.959256601333618, "epoch": 0.21941256564870648, "grad_norm": 1.046875, "learning_rate": 0.00049977411448776, "loss": 5.9097, "mean_token_accuracy": 0.14146498516201972, "num_tokens": 4901977.0, "step": 2820 }, { "entropy": 6.075650453567505, "epoch": 0.21980159502042404, "grad_norm": 1.0234375, "learning_rate": 0.0004997728711787912, "loss": 5.9125, "mean_token_accuracy": 0.13340190574526786, "num_tokens": 4910888.0, "step": 2825 }, { "entropy": 6.026413440704346, "epoch": 0.2201906243921416, "grad_norm": 1.0078125, "learning_rate": 0.0004997716244592518, "loss": 5.9052, "mean_token_accuracy": 0.13878937885165216, "num_tokens": 4920369.0, "step": 2830 }, { "entropy": 6.093588161468506, "epoch": 0.22057965376385918, "grad_norm": 1.125, "learning_rate": 0.0004997703743291607, "loss": 5.8955, "mean_token_accuracy": 0.14121510535478593, "num_tokens": 4928799.0, "step": 2835 }, { "entropy": 6.091677141189575, "epoch": 0.22096868313557674, "grad_norm": 1.03125, "learning_rate": 0.000499769120788537, "loss": 5.7852, "mean_token_accuracy": 0.15266166031360626, "num_tokens": 4937194.0, "step": 2840 }, { "entropy": 5.987790822982788, "epoch": 0.2213577125072943, "grad_norm": 0.99609375, "learning_rate": 0.0004997678638373995, "loss": 5.8642, "mean_token_accuracy": 0.14156924486160277, "num_tokens": 4946174.0, "step": 2845 }, { "entropy": 6.006899881362915, "epoch": 0.22174674187901186, "grad_norm": 0.94921875, "learning_rate": 0.0004997666034757676, "loss": 5.8244, "mean_token_accuracy": 0.13754797130823135, "num_tokens": 4955376.0, "step": 2850 }, { "entropy": 5.980024337768555, "epoch": 0.22213577125072942, "grad_norm": 0.9140625, "learning_rate": 0.0004997653397036603, "loss": 5.8092, "mean_token_accuracy": 0.15121594890952111, "num_tokens": 4964138.0, "step": 2855 }, { "entropy": 6.042385482788086, "epoch": 0.222524800622447, "grad_norm": 0.953125, "learning_rate": 0.0004997640725210965, "loss": 5.9065, "mean_token_accuracy": 0.14113098457455636, "num_tokens": 4973868.0, "step": 2860 }, { "entropy": 6.009365510940552, "epoch": 0.22291382999416456, "grad_norm": 1.0078125, "learning_rate": 0.0004997628019280958, "loss": 5.7881, "mean_token_accuracy": 0.1450905978679657, "num_tokens": 4982687.0, "step": 2865 }, { "entropy": 6.019914531707764, "epoch": 0.22330285936588212, "grad_norm": 1.03125, "learning_rate": 0.0004997615279246773, "loss": 5.8441, "mean_token_accuracy": 0.14207333847880363, "num_tokens": 4992072.0, "step": 2870 }, { "entropy": 5.99617919921875, "epoch": 0.22369188873759968, "grad_norm": 0.99609375, "learning_rate": 0.0004997602505108603, "loss": 5.7744, "mean_token_accuracy": 0.14771850109100343, "num_tokens": 5000551.0, "step": 2875 }, { "entropy": 6.006196022033691, "epoch": 0.22408091810931724, "grad_norm": 1.015625, "learning_rate": 0.0004997589696866644, "loss": 5.9401, "mean_token_accuracy": 0.14075398147106172, "num_tokens": 5009292.0, "step": 2880 }, { "entropy": 6.030385875701905, "epoch": 0.22446994748103483, "grad_norm": 0.984375, "learning_rate": 0.0004997576854521088, "loss": 5.7943, "mean_token_accuracy": 0.14536833316087722, "num_tokens": 5018407.0, "step": 2885 }, { "entropy": 5.986768054962158, "epoch": 0.22485897685275238, "grad_norm": 0.984375, "learning_rate": 0.000499756397807213, "loss": 5.8587, "mean_token_accuracy": 0.14210979640483856, "num_tokens": 5027353.0, "step": 2890 }, { "entropy": 6.054828786849976, "epoch": 0.22524800622446994, "grad_norm": 0.98828125, "learning_rate": 0.0004997551067519966, "loss": 5.8523, "mean_token_accuracy": 0.14193106740713118, "num_tokens": 5036476.0, "step": 2895 }, { "entropy": 6.0023867130279545, "epoch": 0.2256370355961875, "grad_norm": 0.98046875, "learning_rate": 0.0004997538122864792, "loss": 5.808, "mean_token_accuracy": 0.14258752316236495, "num_tokens": 5045132.0, "step": 2900 }, { "entropy": 6.03665246963501, "epoch": 0.2260260649679051, "grad_norm": 0.99609375, "learning_rate": 0.0004997525144106804, "loss": 5.8281, "mean_token_accuracy": 0.14626746699213983, "num_tokens": 5053665.0, "step": 2905 }, { "entropy": 6.007569980621338, "epoch": 0.22641509433962265, "grad_norm": 0.9609375, "learning_rate": 0.00049975121312462, "loss": 5.7764, "mean_token_accuracy": 0.15300558432936667, "num_tokens": 5062516.0, "step": 2910 }, { "entropy": 5.989815378189087, "epoch": 0.2268041237113402, "grad_norm": 1.0703125, "learning_rate": 0.0004997499084283177, "loss": 5.8238, "mean_token_accuracy": 0.14331282824277877, "num_tokens": 5071260.0, "step": 2915 }, { "entropy": 5.912539625167847, "epoch": 0.22719315308305776, "grad_norm": 1.0234375, "learning_rate": 0.0004997486003217932, "loss": 5.7846, "mean_token_accuracy": 0.15056708306074143, "num_tokens": 5079215.0, "step": 2920 }, { "entropy": 5.9982171058654785, "epoch": 0.22758218245477532, "grad_norm": 1.0, "learning_rate": 0.0004997472888050664, "loss": 5.8364, "mean_token_accuracy": 0.14199614971876146, "num_tokens": 5088404.0, "step": 2925 }, { "entropy": 5.948773670196533, "epoch": 0.2279712118264929, "grad_norm": 1.09375, "learning_rate": 0.0004997459738781573, "loss": 5.7779, "mean_token_accuracy": 0.14737778007984162, "num_tokens": 5096756.0, "step": 2930 }, { "entropy": 6.046881580352784, "epoch": 0.22836024119821047, "grad_norm": 0.921875, "learning_rate": 0.0004997446555410857, "loss": 5.9382, "mean_token_accuracy": 0.14340072497725487, "num_tokens": 5106160.0, "step": 2935 }, { "entropy": 5.882016944885254, "epoch": 0.22874927056992803, "grad_norm": 0.96875, "learning_rate": 0.0004997433337938716, "loss": 5.8607, "mean_token_accuracy": 0.14600483030080796, "num_tokens": 5114915.0, "step": 2940 }, { "entropy": 6.0260986328125, "epoch": 0.22913829994164558, "grad_norm": 0.984375, "learning_rate": 0.0004997420086365351, "loss": 5.7735, "mean_token_accuracy": 0.1435887724161148, "num_tokens": 5123249.0, "step": 2945 }, { "entropy": 5.994471597671509, "epoch": 0.22952732931336317, "grad_norm": 0.953125, "learning_rate": 0.0004997406800690966, "loss": 5.7702, "mean_token_accuracy": 0.14430145174264908, "num_tokens": 5131906.0, "step": 2950 }, { "entropy": 5.992271280288696, "epoch": 0.22991635868508073, "grad_norm": 1.0078125, "learning_rate": 0.0004997393480915758, "loss": 5.7451, "mean_token_accuracy": 0.15099966078996657, "num_tokens": 5140740.0, "step": 2955 }, { "entropy": 6.006669330596924, "epoch": 0.2303053880567983, "grad_norm": 1.0078125, "learning_rate": 0.0004997380127039931, "loss": 5.9405, "mean_token_accuracy": 0.14362909346818925, "num_tokens": 5149748.0, "step": 2960 }, { "entropy": 5.904706525802612, "epoch": 0.23069441742851585, "grad_norm": 0.97265625, "learning_rate": 0.0004997366739063688, "loss": 5.6624, "mean_token_accuracy": 0.15620378851890565, "num_tokens": 5158475.0, "step": 2965 }, { "entropy": 5.965284395217895, "epoch": 0.2310834468002334, "grad_norm": 1.0546875, "learning_rate": 0.0004997353316987231, "loss": 5.8742, "mean_token_accuracy": 0.13686980605125426, "num_tokens": 5166593.0, "step": 2970 }, { "entropy": 6.072088766098022, "epoch": 0.231472476171951, "grad_norm": 1.0234375, "learning_rate": 0.0004997339860810765, "loss": 5.8417, "mean_token_accuracy": 0.14505124390125274, "num_tokens": 5175557.0, "step": 2975 }, { "entropy": 5.97886700630188, "epoch": 0.23186150554366855, "grad_norm": 1.015625, "learning_rate": 0.0004997326370534495, "loss": 5.7418, "mean_token_accuracy": 0.14757711663842202, "num_tokens": 5184140.0, "step": 2980 }, { "entropy": 5.984816789627075, "epoch": 0.2322505349153861, "grad_norm": 1.03125, "learning_rate": 0.0004997312846158622, "loss": 5.8323, "mean_token_accuracy": 0.14205295890569686, "num_tokens": 5192347.0, "step": 2985 }, { "entropy": 6.038908290863037, "epoch": 0.23263956428710367, "grad_norm": 0.9921875, "learning_rate": 0.0004997299287683355, "loss": 5.7938, "mean_token_accuracy": 0.15015682727098464, "num_tokens": 5201327.0, "step": 2990 }, { "entropy": 5.9845648288726805, "epoch": 0.23302859365882125, "grad_norm": 1.0390625, "learning_rate": 0.0004997285695108898, "loss": 5.8845, "mean_token_accuracy": 0.1420726865530014, "num_tokens": 5209873.0, "step": 2995 }, { "entropy": 6.02182092666626, "epoch": 0.2334176230305388, "grad_norm": 1.0390625, "learning_rate": 0.0004997272068435458, "loss": 5.7891, "mean_token_accuracy": 0.14845749586820603, "num_tokens": 5219176.0, "step": 3000 }, { "epoch": 0.2334176230305388, "eval_entropy": 5.766755393746957, "eval_loss": 5.836002349853516, "eval_mean_token_accuracy": 0.15392624230282712, "eval_num_tokens": 5219176.0, "eval_runtime": 21.8281, "eval_samples_per_second": 1903.876, "eval_steps_per_second": 237.996, "step": 3000 }, { "entropy": 5.914532804489136, "epoch": 0.23380665240225637, "grad_norm": 1.0625, "learning_rate": 0.000499725840766324, "loss": 5.7209, "mean_token_accuracy": 0.15771688520908356, "num_tokens": 5227310.0, "step": 3005 }, { "entropy": 6.004350805282593, "epoch": 0.23419568177397393, "grad_norm": 1.109375, "learning_rate": 0.0004997244712792453, "loss": 5.8185, "mean_token_accuracy": 0.1469304844737053, "num_tokens": 5235882.0, "step": 3010 }, { "entropy": 5.97558012008667, "epoch": 0.2345847111456915, "grad_norm": 1.0390625, "learning_rate": 0.0004997230983823305, "loss": 5.733, "mean_token_accuracy": 0.1464428722858429, "num_tokens": 5244149.0, "step": 3015 }, { "entropy": 5.811860370635986, "epoch": 0.23497374051740907, "grad_norm": 0.9921875, "learning_rate": 0.0004997217220756003, "loss": 5.5949, "mean_token_accuracy": 0.1532672643661499, "num_tokens": 5252473.0, "step": 3020 }, { "entropy": 5.928388214111328, "epoch": 0.23536276988912663, "grad_norm": 0.96484375, "learning_rate": 0.0004997203423590757, "loss": 5.7517, "mean_token_accuracy": 0.15568342953920364, "num_tokens": 5260972.0, "step": 3025 }, { "entropy": 5.972634315490723, "epoch": 0.2357517992608442, "grad_norm": 1.015625, "learning_rate": 0.0004997189592327775, "loss": 5.7873, "mean_token_accuracy": 0.13899434357881546, "num_tokens": 5270513.0, "step": 3030 }, { "entropy": 5.970373249053955, "epoch": 0.23614082863256175, "grad_norm": 1.0546875, "learning_rate": 0.0004997175726967268, "loss": 5.7495, "mean_token_accuracy": 0.1445789471268654, "num_tokens": 5278433.0, "step": 3035 }, { "entropy": 5.905675411224365, "epoch": 0.23652985800427934, "grad_norm": 1.0625, "learning_rate": 0.0004997161827509447, "loss": 5.7585, "mean_token_accuracy": 0.14649613872170447, "num_tokens": 5287389.0, "step": 3040 }, { "entropy": 5.956258916854859, "epoch": 0.2369188873759969, "grad_norm": 0.953125, "learning_rate": 0.0004997147893954521, "loss": 5.8565, "mean_token_accuracy": 0.14266041815280914, "num_tokens": 5296220.0, "step": 3045 }, { "entropy": 5.96304931640625, "epoch": 0.23730791674771445, "grad_norm": 1.0390625, "learning_rate": 0.0004997133926302702, "loss": 5.7852, "mean_token_accuracy": 0.14856525361537934, "num_tokens": 5304152.0, "step": 3050 }, { "entropy": 6.020824432373047, "epoch": 0.237696946119432, "grad_norm": 1.0078125, "learning_rate": 0.0004997119924554204, "loss": 5.8112, "mean_token_accuracy": 0.14321792423725127, "num_tokens": 5312374.0, "step": 3055 }, { "entropy": 5.898687171936035, "epoch": 0.23808597549114957, "grad_norm": 0.92578125, "learning_rate": 0.0004997105888709236, "loss": 5.7338, "mean_token_accuracy": 0.1488700330257416, "num_tokens": 5320696.0, "step": 3060 }, { "entropy": 5.996364736557007, "epoch": 0.23847500486286716, "grad_norm": 1.1015625, "learning_rate": 0.0004997091818768015, "loss": 5.8581, "mean_token_accuracy": 0.14631845131516458, "num_tokens": 5328754.0, "step": 3065 }, { "entropy": 6.014861583709717, "epoch": 0.23886403423458472, "grad_norm": 0.984375, "learning_rate": 0.000499707771473075, "loss": 5.8258, "mean_token_accuracy": 0.14964541494846345, "num_tokens": 5337553.0, "step": 3070 }, { "entropy": 5.994286060333252, "epoch": 0.23925306360630227, "grad_norm": 1.0625, "learning_rate": 0.0004997063576597659, "loss": 5.7521, "mean_token_accuracy": 0.15279997289180755, "num_tokens": 5346063.0, "step": 3075 }, { "entropy": 5.946002388000489, "epoch": 0.23964209297801983, "grad_norm": 1.1015625, "learning_rate": 0.0004997049404368954, "loss": 5.8209, "mean_token_accuracy": 0.14650205597281457, "num_tokens": 5354187.0, "step": 3080 }, { "entropy": 5.965845775604248, "epoch": 0.2400311223497374, "grad_norm": 1.140625, "learning_rate": 0.000499703519804485, "loss": 5.8657, "mean_token_accuracy": 0.1399562805891037, "num_tokens": 5362819.0, "step": 3085 }, { "entropy": 5.967871189117432, "epoch": 0.24042015172145498, "grad_norm": 1.03125, "learning_rate": 0.0004997020957625564, "loss": 5.7274, "mean_token_accuracy": 0.15995107144117354, "num_tokens": 5371249.0, "step": 3090 }, { "entropy": 5.9214027404785154, "epoch": 0.24080918109317254, "grad_norm": 1.015625, "learning_rate": 0.0004997006683111312, "loss": 5.7441, "mean_token_accuracy": 0.14917703121900558, "num_tokens": 5379284.0, "step": 3095 }, { "entropy": 5.997532606124878, "epoch": 0.2411982104648901, "grad_norm": 0.921875, "learning_rate": 0.000499699237450231, "loss": 5.8315, "mean_token_accuracy": 0.1462565302848816, "num_tokens": 5388541.0, "step": 3100 }, { "entropy": 6.00367169380188, "epoch": 0.24158723983660765, "grad_norm": 0.95703125, "learning_rate": 0.0004996978031798774, "loss": 5.9068, "mean_token_accuracy": 0.14637081027030946, "num_tokens": 5397226.0, "step": 3105 }, { "entropy": 5.973370695114136, "epoch": 0.24197626920832524, "grad_norm": 0.99609375, "learning_rate": 0.0004996963655000924, "loss": 5.8089, "mean_token_accuracy": 0.14054676070809363, "num_tokens": 5405579.0, "step": 3110 }, { "entropy": 6.009214591979981, "epoch": 0.2423652985800428, "grad_norm": 0.97265625, "learning_rate": 0.0004996949244108977, "loss": 5.9245, "mean_token_accuracy": 0.13549011573195457, "num_tokens": 5414529.0, "step": 3115 }, { "entropy": 6.035836887359619, "epoch": 0.24275432795176036, "grad_norm": 1.0703125, "learning_rate": 0.000499693479912315, "loss": 5.8796, "mean_token_accuracy": 0.14944745674729348, "num_tokens": 5423641.0, "step": 3120 }, { "entropy": 5.9449841499328615, "epoch": 0.24314335732347792, "grad_norm": 1.0, "learning_rate": 0.0004996920320043666, "loss": 5.7772, "mean_token_accuracy": 0.14886331856250762, "num_tokens": 5432558.0, "step": 3125 }, { "entropy": 5.950368738174438, "epoch": 0.24353238669519547, "grad_norm": 1.03125, "learning_rate": 0.0004996905806870742, "loss": 5.7315, "mean_token_accuracy": 0.14748364686965942, "num_tokens": 5441449.0, "step": 3130 }, { "entropy": 5.87958459854126, "epoch": 0.24392141606691306, "grad_norm": 0.87890625, "learning_rate": 0.0004996891259604598, "loss": 5.7568, "mean_token_accuracy": 0.1489865630865097, "num_tokens": 5451142.0, "step": 3135 }, { "entropy": 5.970316457748413, "epoch": 0.24431044543863062, "grad_norm": 0.9375, "learning_rate": 0.0004996876678245455, "loss": 5.6999, "mean_token_accuracy": 0.14703621417284013, "num_tokens": 5459290.0, "step": 3140 }, { "entropy": 5.939565229415893, "epoch": 0.24469947481034818, "grad_norm": 1.0859375, "learning_rate": 0.0004996862062793536, "loss": 5.7295, "mean_token_accuracy": 0.1500839561223984, "num_tokens": 5467776.0, "step": 3145 }, { "entropy": 5.856816625595092, "epoch": 0.24508850418206574, "grad_norm": 0.9609375, "learning_rate": 0.0004996847413249061, "loss": 5.6092, "mean_token_accuracy": 0.15638387948274612, "num_tokens": 5476005.0, "step": 3150 }, { "entropy": 5.990639543533325, "epoch": 0.24547753355378332, "grad_norm": 0.99609375, "learning_rate": 0.0004996832729612252, "loss": 5.7943, "mean_token_accuracy": 0.1473146602511406, "num_tokens": 5484225.0, "step": 3155 }, { "entropy": 5.839318799972534, "epoch": 0.24586656292550088, "grad_norm": 0.94921875, "learning_rate": 0.0004996818011883333, "loss": 5.7023, "mean_token_accuracy": 0.15613459944725036, "num_tokens": 5493111.0, "step": 3160 }, { "entropy": 5.878914022445679, "epoch": 0.24625559229721844, "grad_norm": 1.0390625, "learning_rate": 0.0004996803260062527, "loss": 5.7295, "mean_token_accuracy": 0.15031494274735452, "num_tokens": 5501574.0, "step": 3165 }, { "entropy": 5.983736276626587, "epoch": 0.246644621668936, "grad_norm": 1.0078125, "learning_rate": 0.0004996788474150057, "loss": 5.7602, "mean_token_accuracy": 0.14838263839483262, "num_tokens": 5511136.0, "step": 3170 }, { "entropy": 5.882587671279907, "epoch": 0.24703365104065356, "grad_norm": 0.984375, "learning_rate": 0.0004996773654146149, "loss": 5.7409, "mean_token_accuracy": 0.15212823152542115, "num_tokens": 5520324.0, "step": 3175 }, { "entropy": 5.967652320861816, "epoch": 0.24742268041237114, "grad_norm": 1.0, "learning_rate": 0.0004996758800051026, "loss": 5.7024, "mean_token_accuracy": 0.15401688665151597, "num_tokens": 5528960.0, "step": 3180 }, { "entropy": 5.9393322467803955, "epoch": 0.2478117097840887, "grad_norm": 1.25, "learning_rate": 0.0004996743911864916, "loss": 5.8557, "mean_token_accuracy": 0.1460486263036728, "num_tokens": 5537391.0, "step": 3185 }, { "entropy": 5.9707262992858885, "epoch": 0.24820073915580626, "grad_norm": 1.0, "learning_rate": 0.0004996728989588041, "loss": 5.7953, "mean_token_accuracy": 0.14829789772629737, "num_tokens": 5546577.0, "step": 3190 }, { "entropy": 6.049851703643799, "epoch": 0.24858976852752382, "grad_norm": 0.9921875, "learning_rate": 0.0004996714033220632, "loss": 5.742, "mean_token_accuracy": 0.14722291827201844, "num_tokens": 5555247.0, "step": 3195 }, { "entropy": 5.890546751022339, "epoch": 0.2489787978992414, "grad_norm": 1.0546875, "learning_rate": 0.0004996699042762911, "loss": 5.6942, "mean_token_accuracy": 0.15134429037570954, "num_tokens": 5563598.0, "step": 3200 }, { "entropy": 5.940383005142212, "epoch": 0.24936782727095896, "grad_norm": 1.078125, "learning_rate": 0.0004996684018215111, "loss": 5.725, "mean_token_accuracy": 0.14869000166654586, "num_tokens": 5572734.0, "step": 3205 }, { "entropy": 5.9394947528839115, "epoch": 0.24975685664267652, "grad_norm": 1.0078125, "learning_rate": 0.0004996668959577453, "loss": 5.8488, "mean_token_accuracy": 0.1437419608235359, "num_tokens": 5581224.0, "step": 3210 }, { "entropy": 6.008606481552124, "epoch": 0.2501458860143941, "grad_norm": 1.0, "learning_rate": 0.0004996653866850173, "loss": 5.8409, "mean_token_accuracy": 0.14231252372264863, "num_tokens": 5590138.0, "step": 3215 }, { "entropy": 5.949661636352539, "epoch": 0.25053491538611167, "grad_norm": 1.1484375, "learning_rate": 0.0004996638740033495, "loss": 5.7713, "mean_token_accuracy": 0.15526752471923827, "num_tokens": 5598654.0, "step": 3220 }, { "entropy": 5.846512508392334, "epoch": 0.2509239447578292, "grad_norm": 1.0625, "learning_rate": 0.0004996623579127651, "loss": 5.7136, "mean_token_accuracy": 0.1543463483452797, "num_tokens": 5607404.0, "step": 3225 }, { "entropy": 5.943040132522583, "epoch": 0.2513129741295468, "grad_norm": 1.0703125, "learning_rate": 0.0004996608384132868, "loss": 5.7429, "mean_token_accuracy": 0.14950166493654252, "num_tokens": 5617133.0, "step": 3230 }, { "entropy": 5.90880651473999, "epoch": 0.25170200350126437, "grad_norm": 1.0546875, "learning_rate": 0.000499659315504938, "loss": 5.7707, "mean_token_accuracy": 0.1484447628259659, "num_tokens": 5625389.0, "step": 3235 }, { "entropy": 5.857119131088257, "epoch": 0.2520910328729819, "grad_norm": 1.0078125, "learning_rate": 0.0004996577891877417, "loss": 5.6411, "mean_token_accuracy": 0.16271414309740068, "num_tokens": 5633985.0, "step": 3240 }, { "entropy": 5.973174619674682, "epoch": 0.2524800622446995, "grad_norm": 1.09375, "learning_rate": 0.0004996562594617209, "loss": 5.7649, "mean_token_accuracy": 0.14711527973413469, "num_tokens": 5642524.0, "step": 3245 }, { "entropy": 5.936709356307984, "epoch": 0.252869091616417, "grad_norm": 1.0859375, "learning_rate": 0.0004996547263268991, "loss": 5.7178, "mean_token_accuracy": 0.14921012967824937, "num_tokens": 5651788.0, "step": 3250 }, { "entropy": 5.888123035430908, "epoch": 0.2532581209881346, "grad_norm": 1.03125, "learning_rate": 0.0004996531897832993, "loss": 5.7602, "mean_token_accuracy": 0.14676389396190642, "num_tokens": 5660757.0, "step": 3255 }, { "entropy": 6.043964958190918, "epoch": 0.2536471503598522, "grad_norm": 1.0078125, "learning_rate": 0.000499651649830945, "loss": 5.8528, "mean_token_accuracy": 0.1506285548210144, "num_tokens": 5669760.0, "step": 3260 }, { "entropy": 5.922834873199463, "epoch": 0.2540361797315697, "grad_norm": 0.98828125, "learning_rate": 0.0004996501064698593, "loss": 5.7811, "mean_token_accuracy": 0.15074339210987092, "num_tokens": 5678313.0, "step": 3265 }, { "entropy": 5.939870929718017, "epoch": 0.2544252091032873, "grad_norm": 1.0390625, "learning_rate": 0.000499648559700066, "loss": 5.6956, "mean_token_accuracy": 0.15352511703968047, "num_tokens": 5686942.0, "step": 3270 }, { "entropy": 5.876242780685425, "epoch": 0.25481423847500484, "grad_norm": 0.9921875, "learning_rate": 0.0004996470095215884, "loss": 5.6997, "mean_token_accuracy": 0.15511421784758567, "num_tokens": 5695612.0, "step": 3275 }, { "entropy": 5.961434316635132, "epoch": 0.2552032678467224, "grad_norm": 0.98046875, "learning_rate": 0.0004996454559344498, "loss": 5.8798, "mean_token_accuracy": 0.1368470698595047, "num_tokens": 5705067.0, "step": 3280 }, { "entropy": 5.967849016189575, "epoch": 0.25559229721844, "grad_norm": 0.96484375, "learning_rate": 0.0004996438989386741, "loss": 5.7754, "mean_token_accuracy": 0.15305520966649055, "num_tokens": 5714092.0, "step": 3285 }, { "entropy": 5.969217824935913, "epoch": 0.25598132659015754, "grad_norm": 1.0, "learning_rate": 0.0004996423385342847, "loss": 5.7351, "mean_token_accuracy": 0.15343412458896638, "num_tokens": 5722638.0, "step": 3290 }, { "entropy": 5.878257513046265, "epoch": 0.25637035596187513, "grad_norm": 0.953125, "learning_rate": 0.0004996407747213055, "loss": 5.7449, "mean_token_accuracy": 0.14493217319250107, "num_tokens": 5731511.0, "step": 3295 }, { "entropy": 5.914233160018921, "epoch": 0.25675938533359266, "grad_norm": 0.91796875, "learning_rate": 0.00049963920749976, "loss": 5.7517, "mean_token_accuracy": 0.15331401228904723, "num_tokens": 5740950.0, "step": 3300 }, { "entropy": 5.908319330215454, "epoch": 0.25714841470531025, "grad_norm": 1.0234375, "learning_rate": 0.0004996376368696721, "loss": 5.705, "mean_token_accuracy": 0.14798064678907394, "num_tokens": 5749163.0, "step": 3305 }, { "entropy": 5.932552862167358, "epoch": 0.25753744407702783, "grad_norm": 0.96484375, "learning_rate": 0.0004996360628310656, "loss": 5.7536, "mean_token_accuracy": 0.14659023731946946, "num_tokens": 5758321.0, "step": 3310 }, { "entropy": 5.938609218597412, "epoch": 0.25792647344874536, "grad_norm": 1.046875, "learning_rate": 0.0004996344853839644, "loss": 5.8042, "mean_token_accuracy": 0.14989116787910461, "num_tokens": 5767277.0, "step": 3315 }, { "entropy": 5.8936632633209225, "epoch": 0.25831550282046295, "grad_norm": 0.96484375, "learning_rate": 0.0004996329045283924, "loss": 5.7001, "mean_token_accuracy": 0.15724189579486847, "num_tokens": 5775694.0, "step": 3320 }, { "entropy": 5.810319709777832, "epoch": 0.25870453219218054, "grad_norm": 0.921875, "learning_rate": 0.0004996313202643737, "loss": 5.6225, "mean_token_accuracy": 0.15532325357198715, "num_tokens": 5783932.0, "step": 3325 }, { "entropy": 5.897975730895996, "epoch": 0.25909356156389807, "grad_norm": 1.078125, "learning_rate": 0.0004996297325919321, "loss": 5.7529, "mean_token_accuracy": 0.15493739545345306, "num_tokens": 5792100.0, "step": 3330 }, { "entropy": 5.90851583480835, "epoch": 0.25948259093561565, "grad_norm": 0.953125, "learning_rate": 0.0004996281415110919, "loss": 5.7307, "mean_token_accuracy": 0.14977378994226456, "num_tokens": 5801481.0, "step": 3335 }, { "entropy": 5.9347193241119385, "epoch": 0.2598716203073332, "grad_norm": 0.97265625, "learning_rate": 0.0004996265470218773, "loss": 5.8223, "mean_token_accuracy": 0.14538975059986115, "num_tokens": 5810053.0, "step": 3340 }, { "entropy": 5.880348157882691, "epoch": 0.26026064967905077, "grad_norm": 0.984375, "learning_rate": 0.0004996249491243122, "loss": 5.6137, "mean_token_accuracy": 0.16179749518632888, "num_tokens": 5818454.0, "step": 3345 }, { "entropy": 5.8937677383422855, "epoch": 0.26064967905076836, "grad_norm": 0.953125, "learning_rate": 0.0004996233478184211, "loss": 5.7778, "mean_token_accuracy": 0.14190399944782256, "num_tokens": 5827013.0, "step": 3350 }, { "entropy": 5.825893449783325, "epoch": 0.2610387084224859, "grad_norm": 1.03125, "learning_rate": 0.0004996217431042282, "loss": 5.7808, "mean_token_accuracy": 0.1439354784786701, "num_tokens": 5835862.0, "step": 3355 }, { "entropy": 5.8302641868591305, "epoch": 0.2614277377942035, "grad_norm": 0.9453125, "learning_rate": 0.000499620134981758, "loss": 5.5539, "mean_token_accuracy": 0.15147414058446884, "num_tokens": 5843827.0, "step": 3360 }, { "entropy": 5.872374200820923, "epoch": 0.261816767165921, "grad_norm": 0.9609375, "learning_rate": 0.0004996185234510346, "loss": 5.7502, "mean_token_accuracy": 0.14820392578840255, "num_tokens": 5852677.0, "step": 3365 }, { "entropy": 5.92858190536499, "epoch": 0.2622057965376386, "grad_norm": 1.046875, "learning_rate": 0.0004996169085120828, "loss": 5.7093, "mean_token_accuracy": 0.15133587270975113, "num_tokens": 5861686.0, "step": 3370 }, { "entropy": 5.819103622436524, "epoch": 0.2625948259093562, "grad_norm": 0.94140625, "learning_rate": 0.0004996152901649268, "loss": 5.669, "mean_token_accuracy": 0.14954098016023637, "num_tokens": 5870690.0, "step": 3375 }, { "entropy": 5.902088308334351, "epoch": 0.2629838552810737, "grad_norm": 0.96875, "learning_rate": 0.0004996136684095913, "loss": 5.7409, "mean_token_accuracy": 0.14959589689970015, "num_tokens": 5879804.0, "step": 3380 }, { "entropy": 5.966397905349732, "epoch": 0.2633728846527913, "grad_norm": 1.109375, "learning_rate": 0.0004996120432461009, "loss": 5.8384, "mean_token_accuracy": 0.14443578869104384, "num_tokens": 5888781.0, "step": 3385 }, { "entropy": 5.987284231185913, "epoch": 0.2637619140245088, "grad_norm": 0.97265625, "learning_rate": 0.0004996104146744804, "loss": 5.7414, "mean_token_accuracy": 0.14745590537786485, "num_tokens": 5897439.0, "step": 3390 }, { "entropy": 5.88730821609497, "epoch": 0.2641509433962264, "grad_norm": 1.0625, "learning_rate": 0.0004996087826947541, "loss": 5.7026, "mean_token_accuracy": 0.161055551469326, "num_tokens": 5905471.0, "step": 3395 }, { "entropy": 5.804925203323364, "epoch": 0.264539972767944, "grad_norm": 1.0390625, "learning_rate": 0.0004996071473069471, "loss": 5.7367, "mean_token_accuracy": 0.15316548198461533, "num_tokens": 5913795.0, "step": 3400 }, { "entropy": 6.04078631401062, "epoch": 0.26492900213966153, "grad_norm": 1.078125, "learning_rate": 0.0004996055085110842, "loss": 5.7997, "mean_token_accuracy": 0.15046787038445472, "num_tokens": 5922119.0, "step": 3405 }, { "entropy": 5.822887897491455, "epoch": 0.2653180315113791, "grad_norm": 1.0625, "learning_rate": 0.0004996038663071902, "loss": 5.6847, "mean_token_accuracy": 0.1509345754981041, "num_tokens": 5930759.0, "step": 3410 }, { "entropy": 5.903107595443726, "epoch": 0.26570706088309665, "grad_norm": 1.0234375, "learning_rate": 0.0004996022206952901, "loss": 5.7198, "mean_token_accuracy": 0.15288078486919404, "num_tokens": 5939830.0, "step": 3415 }, { "entropy": 5.929271078109741, "epoch": 0.26609609025481423, "grad_norm": 1.0234375, "learning_rate": 0.0004996005716754086, "loss": 5.7181, "mean_token_accuracy": 0.15389925241470337, "num_tokens": 5947737.0, "step": 3420 }, { "entropy": 5.778887224197388, "epoch": 0.2664851196265318, "grad_norm": 1.046875, "learning_rate": 0.000499598919247571, "loss": 5.6762, "mean_token_accuracy": 0.15809207260608674, "num_tokens": 5955905.0, "step": 3425 }, { "entropy": 5.849305629730225, "epoch": 0.26687414899824935, "grad_norm": 1.015625, "learning_rate": 0.0004995972634118023, "loss": 5.7386, "mean_token_accuracy": 0.15352326929569243, "num_tokens": 5965223.0, "step": 3430 }, { "entropy": 5.93175745010376, "epoch": 0.26726317836996694, "grad_norm": 1.03125, "learning_rate": 0.0004995956041681277, "loss": 5.7526, "mean_token_accuracy": 0.15678024291992188, "num_tokens": 5973615.0, "step": 3435 }, { "entropy": 5.861295080184936, "epoch": 0.2676522077416845, "grad_norm": 1.0, "learning_rate": 0.0004995939415165722, "loss": 5.669, "mean_token_accuracy": 0.15896339267492293, "num_tokens": 5981600.0, "step": 3440 }, { "entropy": 5.877530956268311, "epoch": 0.26804123711340205, "grad_norm": 1.03125, "learning_rate": 0.0004995922754571611, "loss": 5.683, "mean_token_accuracy": 0.15407007783651352, "num_tokens": 5989928.0, "step": 3445 }, { "entropy": 5.829905796051025, "epoch": 0.26843026648511964, "grad_norm": 1.0078125, "learning_rate": 0.0004995906059899197, "loss": 5.7397, "mean_token_accuracy": 0.15136908739805222, "num_tokens": 5998704.0, "step": 3450 }, { "entropy": 5.886248350143433, "epoch": 0.26881929585683717, "grad_norm": 0.95703125, "learning_rate": 0.0004995889331148733, "loss": 5.7208, "mean_token_accuracy": 0.1513502597808838, "num_tokens": 6007476.0, "step": 3455 }, { "entropy": 5.973094367980957, "epoch": 0.26920832522855476, "grad_norm": 0.9609375, "learning_rate": 0.0004995872568320474, "loss": 5.7813, "mean_token_accuracy": 0.14543018639087676, "num_tokens": 6016324.0, "step": 3460 }, { "entropy": 5.911590433120727, "epoch": 0.26959735460027234, "grad_norm": 1.0859375, "learning_rate": 0.0004995855771414673, "loss": 5.7337, "mean_token_accuracy": 0.15289803743362426, "num_tokens": 6024709.0, "step": 3465 }, { "entropy": 5.858439874649048, "epoch": 0.2699863839719899, "grad_norm": 1.046875, "learning_rate": 0.0004995838940431585, "loss": 5.5745, "mean_token_accuracy": 0.15924426466226577, "num_tokens": 6033131.0, "step": 3470 }, { "entropy": 5.817553472518921, "epoch": 0.27037541334370746, "grad_norm": 0.984375, "learning_rate": 0.0004995822075371466, "loss": 5.7783, "mean_token_accuracy": 0.14763862043619155, "num_tokens": 6042310.0, "step": 3475 }, { "entropy": 5.891201305389404, "epoch": 0.270764442715425, "grad_norm": 0.96484375, "learning_rate": 0.0004995805176234571, "loss": 5.5947, "mean_token_accuracy": 0.15696365535259246, "num_tokens": 6050617.0, "step": 3480 }, { "entropy": 5.897118473052979, "epoch": 0.2711534720871426, "grad_norm": 0.91796875, "learning_rate": 0.0004995788243021158, "loss": 5.7699, "mean_token_accuracy": 0.14828943312168122, "num_tokens": 6060090.0, "step": 3485 }, { "entropy": 5.909312772750854, "epoch": 0.27154250145886016, "grad_norm": 0.953125, "learning_rate": 0.0004995771275731483, "loss": 5.7084, "mean_token_accuracy": 0.15499398112297058, "num_tokens": 6068646.0, "step": 3490 }, { "entropy": 5.904059219360351, "epoch": 0.2719315308305777, "grad_norm": 1.0703125, "learning_rate": 0.0004995754274365802, "loss": 5.769, "mean_token_accuracy": 0.15764224529266357, "num_tokens": 6077896.0, "step": 3495 }, { "entropy": 5.8887194156646725, "epoch": 0.2723205602022953, "grad_norm": 0.953125, "learning_rate": 0.0004995737238924376, "loss": 5.691, "mean_token_accuracy": 0.15045809149742126, "num_tokens": 6087189.0, "step": 3500 }, { "entropy": 5.8543816089630125, "epoch": 0.2727095895740128, "grad_norm": 1.0234375, "learning_rate": 0.0004995720169407461, "loss": 5.6928, "mean_token_accuracy": 0.15313887149095534, "num_tokens": 6095394.0, "step": 3505 }, { "entropy": 5.90059175491333, "epoch": 0.2730986189457304, "grad_norm": 1.0625, "learning_rate": 0.0004995703065815317, "loss": 5.6558, "mean_token_accuracy": 0.15778090357780455, "num_tokens": 6104135.0, "step": 3510 }, { "entropy": 5.874152612686157, "epoch": 0.273487648317448, "grad_norm": 1.046875, "learning_rate": 0.0004995685928148203, "loss": 5.774, "mean_token_accuracy": 0.14561692923307418, "num_tokens": 6112160.0, "step": 3515 }, { "entropy": 5.9434703350067135, "epoch": 0.2738766776891655, "grad_norm": 0.96875, "learning_rate": 0.000499566875640638, "loss": 5.775, "mean_token_accuracy": 0.15645800679922103, "num_tokens": 6120575.0, "step": 3520 }, { "entropy": 5.929290294647217, "epoch": 0.2742657070608831, "grad_norm": 0.96875, "learning_rate": 0.0004995651550590108, "loss": 5.7745, "mean_token_accuracy": 0.15056986957788468, "num_tokens": 6129367.0, "step": 3525 }, { "entropy": 5.876437711715698, "epoch": 0.2746547364326007, "grad_norm": 1.0390625, "learning_rate": 0.0004995634310699647, "loss": 5.744, "mean_token_accuracy": 0.15265202671289443, "num_tokens": 6137440.0, "step": 3530 }, { "entropy": 5.872723627090454, "epoch": 0.2750437658043182, "grad_norm": 0.94921875, "learning_rate": 0.0004995617036735261, "loss": 5.673, "mean_token_accuracy": 0.154018035531044, "num_tokens": 6146770.0, "step": 3535 }, { "entropy": 6.0044420719146725, "epoch": 0.2754327951760358, "grad_norm": 0.93359375, "learning_rate": 0.0004995599728697211, "loss": 5.7703, "mean_token_accuracy": 0.1499793127179146, "num_tokens": 6155994.0, "step": 3540 }, { "entropy": 5.789418649673462, "epoch": 0.27582182454775334, "grad_norm": 1.0078125, "learning_rate": 0.0004995582386585759, "loss": 5.6619, "mean_token_accuracy": 0.14758216962218285, "num_tokens": 6163941.0, "step": 3545 }, { "entropy": 5.8281224250793455, "epoch": 0.2762108539194709, "grad_norm": 0.984375, "learning_rate": 0.0004995565010401167, "loss": 5.7346, "mean_token_accuracy": 0.14870691299438477, "num_tokens": 6172681.0, "step": 3550 }, { "entropy": 5.9554907321929935, "epoch": 0.2765998832911885, "grad_norm": 0.98828125, "learning_rate": 0.0004995547600143702, "loss": 5.7072, "mean_token_accuracy": 0.14850514829158784, "num_tokens": 6181449.0, "step": 3555 }, { "entropy": 5.873755407333374, "epoch": 0.27698891266290604, "grad_norm": 0.95703125, "learning_rate": 0.0004995530155813625, "loss": 5.6887, "mean_token_accuracy": 0.15598696768283843, "num_tokens": 6190275.0, "step": 3560 }, { "entropy": 5.884641075134278, "epoch": 0.2773779420346236, "grad_norm": 0.9765625, "learning_rate": 0.0004995512677411203, "loss": 5.7351, "mean_token_accuracy": 0.1550119176506996, "num_tokens": 6198521.0, "step": 3565 }, { "entropy": 5.901494312286377, "epoch": 0.27776697140634116, "grad_norm": 0.9375, "learning_rate": 0.0004995495164936698, "loss": 5.7628, "mean_token_accuracy": 0.1469577133655548, "num_tokens": 6207318.0, "step": 3570 }, { "entropy": 5.902689838409424, "epoch": 0.27815600077805874, "grad_norm": 0.96484375, "learning_rate": 0.0004995477618390381, "loss": 5.651, "mean_token_accuracy": 0.15427243560552598, "num_tokens": 6216693.0, "step": 3575 }, { "entropy": 5.85602765083313, "epoch": 0.27854503014977633, "grad_norm": 1.0703125, "learning_rate": 0.0004995460037772513, "loss": 5.7077, "mean_token_accuracy": 0.14970823526382446, "num_tokens": 6225207.0, "step": 3580 }, { "entropy": 5.885422992706299, "epoch": 0.27893405952149386, "grad_norm": 1.0859375, "learning_rate": 0.0004995442423083365, "loss": 5.6551, "mean_token_accuracy": 0.16121675074100494, "num_tokens": 6232653.0, "step": 3585 }, { "entropy": 5.828827238082885, "epoch": 0.27932308889321145, "grad_norm": 0.9921875, "learning_rate": 0.0004995424774323201, "loss": 5.6419, "mean_token_accuracy": 0.15972325801849366, "num_tokens": 6241093.0, "step": 3590 }, { "entropy": 5.789525175094605, "epoch": 0.279712118264929, "grad_norm": 1.015625, "learning_rate": 0.000499540709149229, "loss": 5.564, "mean_token_accuracy": 0.16275173425674438, "num_tokens": 6249144.0, "step": 3595 }, { "entropy": 5.865627717971802, "epoch": 0.28010114763664656, "grad_norm": 0.94921875, "learning_rate": 0.0004995389374590901, "loss": 5.6389, "mean_token_accuracy": 0.15749034732580186, "num_tokens": 6257622.0, "step": 3600 }, { "entropy": 5.882948589324951, "epoch": 0.28049017700836415, "grad_norm": 1.015625, "learning_rate": 0.0004995371623619301, "loss": 5.6636, "mean_token_accuracy": 0.15338655188679695, "num_tokens": 6266435.0, "step": 3605 }, { "entropy": 5.8372331142425535, "epoch": 0.2808792063800817, "grad_norm": 1.015625, "learning_rate": 0.000499535383857776, "loss": 5.7877, "mean_token_accuracy": 0.149023699760437, "num_tokens": 6275053.0, "step": 3610 }, { "entropy": 5.8476598262786865, "epoch": 0.28126823575179927, "grad_norm": 0.95703125, "learning_rate": 0.000499533601946655, "loss": 5.6726, "mean_token_accuracy": 0.1459781378507614, "num_tokens": 6283240.0, "step": 3615 }, { "entropy": 5.800600624084472, "epoch": 0.2816572651235168, "grad_norm": 1.0234375, "learning_rate": 0.0004995318166285938, "loss": 5.6236, "mean_token_accuracy": 0.1582282230257988, "num_tokens": 6292133.0, "step": 3620 }, { "entropy": 5.931145143508911, "epoch": 0.2820462944952344, "grad_norm": 0.98828125, "learning_rate": 0.0004995300279036199, "loss": 5.7512, "mean_token_accuracy": 0.15329633504152299, "num_tokens": 6300954.0, "step": 3625 }, { "entropy": 5.803219652175903, "epoch": 0.28243532386695197, "grad_norm": 1.03125, "learning_rate": 0.00049952823577176, "loss": 5.623, "mean_token_accuracy": 0.16018344163894654, "num_tokens": 6309637.0, "step": 3630 }, { "entropy": 5.870447778701783, "epoch": 0.2828243532386695, "grad_norm": 0.98828125, "learning_rate": 0.0004995264402330416, "loss": 5.6889, "mean_token_accuracy": 0.153514064848423, "num_tokens": 6318539.0, "step": 3635 }, { "entropy": 5.877357006072998, "epoch": 0.2832133826103871, "grad_norm": 0.96484375, "learning_rate": 0.0004995246412874919, "loss": 5.6063, "mean_token_accuracy": 0.15626251548528672, "num_tokens": 6327109.0, "step": 3640 }, { "entropy": 5.796565914154053, "epoch": 0.2836024119821047, "grad_norm": 1.0, "learning_rate": 0.000499522838935138, "loss": 5.6188, "mean_token_accuracy": 0.1544191963970661, "num_tokens": 6335555.0, "step": 3645 }, { "entropy": 5.89104151725769, "epoch": 0.2839914413538222, "grad_norm": 0.94140625, "learning_rate": 0.0004995210331760074, "loss": 5.7761, "mean_token_accuracy": 0.15136173665523528, "num_tokens": 6344716.0, "step": 3650 }, { "entropy": 5.848493671417236, "epoch": 0.2843804707255398, "grad_norm": 1.0546875, "learning_rate": 0.0004995192240101275, "loss": 5.6321, "mean_token_accuracy": 0.16200316846370696, "num_tokens": 6353618.0, "step": 3655 }, { "entropy": 5.9154908657073975, "epoch": 0.2847695000972573, "grad_norm": 1.0078125, "learning_rate": 0.0004995174114375258, "loss": 5.7482, "mean_token_accuracy": 0.14789825528860093, "num_tokens": 6362039.0, "step": 3660 }, { "entropy": 5.913218307495117, "epoch": 0.2851585294689749, "grad_norm": 1.0078125, "learning_rate": 0.0004995155954582297, "loss": 5.6811, "mean_token_accuracy": 0.15068026036024093, "num_tokens": 6370331.0, "step": 3665 }, { "entropy": 5.845167112350464, "epoch": 0.2855475588406925, "grad_norm": 1.0390625, "learning_rate": 0.0004995137760722668, "loss": 5.6551, "mean_token_accuracy": 0.15810975283384324, "num_tokens": 6378943.0, "step": 3670 }, { "entropy": 5.879886245727539, "epoch": 0.28593658821241, "grad_norm": 0.984375, "learning_rate": 0.0004995119532796646, "loss": 5.7192, "mean_token_accuracy": 0.1432995818555355, "num_tokens": 6387745.0, "step": 3675 }, { "entropy": 5.7256762981414795, "epoch": 0.2863256175841276, "grad_norm": 1.0078125, "learning_rate": 0.000499510127080451, "loss": 5.5589, "mean_token_accuracy": 0.1562187597155571, "num_tokens": 6396915.0, "step": 3680 }, { "entropy": 5.798629856109619, "epoch": 0.28671464695584514, "grad_norm": 0.9765625, "learning_rate": 0.0004995082974746535, "loss": 5.6084, "mean_token_accuracy": 0.15959389954805375, "num_tokens": 6405453.0, "step": 3685 }, { "entropy": 5.9083412170410154, "epoch": 0.28710367632756273, "grad_norm": 0.9765625, "learning_rate": 0.0004995064644622999, "loss": 5.6961, "mean_token_accuracy": 0.15132231414318084, "num_tokens": 6413693.0, "step": 3690 }, { "entropy": 5.764428520202637, "epoch": 0.2874927056992803, "grad_norm": 1.015625, "learning_rate": 0.0004995046280434181, "loss": 5.682, "mean_token_accuracy": 0.14993201121687888, "num_tokens": 6422738.0, "step": 3695 }, { "entropy": 5.837015295028687, "epoch": 0.28788173507099785, "grad_norm": 1.0546875, "learning_rate": 0.0004995027882180358, "loss": 5.6273, "mean_token_accuracy": 0.15370226055383682, "num_tokens": 6431743.0, "step": 3700 }, { "entropy": 5.881600713729858, "epoch": 0.28827076444271543, "grad_norm": 0.98046875, "learning_rate": 0.0004995009449861812, "loss": 5.6616, "mean_token_accuracy": 0.15563700199127198, "num_tokens": 6440586.0, "step": 3705 }, { "entropy": 5.804992055892944, "epoch": 0.28865979381443296, "grad_norm": 0.9609375, "learning_rate": 0.000499499098347882, "loss": 5.7168, "mean_token_accuracy": 0.1542726181447506, "num_tokens": 6449644.0, "step": 3710 }, { "entropy": 5.833136034011841, "epoch": 0.28904882318615055, "grad_norm": 0.91015625, "learning_rate": 0.0004994972483031662, "loss": 5.6053, "mean_token_accuracy": 0.16261792182922363, "num_tokens": 6458752.0, "step": 3715 }, { "entropy": 5.797244644165039, "epoch": 0.28943785255786814, "grad_norm": 0.90625, "learning_rate": 0.000499495394852062, "loss": 5.6716, "mean_token_accuracy": 0.15677656084299088, "num_tokens": 6468333.0, "step": 3720 }, { "entropy": 5.707669687271118, "epoch": 0.28982688192958567, "grad_norm": 1.0390625, "learning_rate": 0.0004994935379945977, "loss": 5.5339, "mean_token_accuracy": 0.15437540858983995, "num_tokens": 6477406.0, "step": 3725 }, { "entropy": 5.859027671813965, "epoch": 0.29021591130130325, "grad_norm": 1.03125, "learning_rate": 0.0004994916777308012, "loss": 5.6851, "mean_token_accuracy": 0.1511788085103035, "num_tokens": 6486399.0, "step": 3730 }, { "entropy": 5.791624116897583, "epoch": 0.29060494067302084, "grad_norm": 1.0078125, "learning_rate": 0.0004994898140607007, "loss": 5.5922, "mean_token_accuracy": 0.15610771924257277, "num_tokens": 6494853.0, "step": 3735 }, { "entropy": 5.872024250030518, "epoch": 0.29099397004473837, "grad_norm": 1.0390625, "learning_rate": 0.0004994879469843247, "loss": 5.7565, "mean_token_accuracy": 0.1508682370185852, "num_tokens": 6503301.0, "step": 3740 }, { "entropy": 5.838651132583618, "epoch": 0.29138299941645596, "grad_norm": 0.93359375, "learning_rate": 0.0004994860765017013, "loss": 5.6465, "mean_token_accuracy": 0.15341054350137712, "num_tokens": 6512685.0, "step": 3745 }, { "entropy": 5.834665298461914, "epoch": 0.2917720287881735, "grad_norm": 1.03125, "learning_rate": 0.000499484202612859, "loss": 5.7428, "mean_token_accuracy": 0.1516564279794693, "num_tokens": 6520673.0, "step": 3750 }, { "entropy": 5.879530334472657, "epoch": 0.2921610581598911, "grad_norm": 0.9296875, "learning_rate": 0.0004994823253178264, "loss": 5.657, "mean_token_accuracy": 0.15068983137607575, "num_tokens": 6529039.0, "step": 3755 }, { "entropy": 5.832844400405884, "epoch": 0.29255008753160866, "grad_norm": 0.9921875, "learning_rate": 0.0004994804446166317, "loss": 5.7447, "mean_token_accuracy": 0.1464340180158615, "num_tokens": 6537932.0, "step": 3760 }, { "entropy": 5.897266864776611, "epoch": 0.2929391169033262, "grad_norm": 0.96875, "learning_rate": 0.0004994785605093035, "loss": 5.6243, "mean_token_accuracy": 0.15435930714011192, "num_tokens": 6546278.0, "step": 3765 }, { "entropy": 5.840794086456299, "epoch": 0.2933281462750438, "grad_norm": 0.984375, "learning_rate": 0.0004994766729958705, "loss": 5.6752, "mean_token_accuracy": 0.16036221235990525, "num_tokens": 6554449.0, "step": 3770 }, { "entropy": 5.830932760238648, "epoch": 0.2937171756467613, "grad_norm": 0.953125, "learning_rate": 0.0004994747820763612, "loss": 5.6631, "mean_token_accuracy": 0.15727959871292113, "num_tokens": 6563272.0, "step": 3775 }, { "entropy": 5.917678117752075, "epoch": 0.2941062050184789, "grad_norm": 0.953125, "learning_rate": 0.0004994728877508046, "loss": 5.6737, "mean_token_accuracy": 0.15500990450382232, "num_tokens": 6571864.0, "step": 3780 }, { "entropy": 5.834184646606445, "epoch": 0.2944952343901965, "grad_norm": 0.96875, "learning_rate": 0.0004994709900192289, "loss": 5.6644, "mean_token_accuracy": 0.15712282955646514, "num_tokens": 6580435.0, "step": 3785 }, { "entropy": 5.909469509124756, "epoch": 0.294884263761914, "grad_norm": 1.046875, "learning_rate": 0.0004994690888816635, "loss": 5.6642, "mean_token_accuracy": 0.15690299719572068, "num_tokens": 6589261.0, "step": 3790 }, { "entropy": 5.864827394485474, "epoch": 0.2952732931336316, "grad_norm": 0.9609375, "learning_rate": 0.0004994671843381367, "loss": 5.7462, "mean_token_accuracy": 0.15970321893692016, "num_tokens": 6598057.0, "step": 3795 }, { "entropy": 5.95170750617981, "epoch": 0.29566232250534913, "grad_norm": 0.98046875, "learning_rate": 0.0004994652763886778, "loss": 5.7119, "mean_token_accuracy": 0.14755399972200395, "num_tokens": 6606439.0, "step": 3800 }, { "entropy": 5.879061555862426, "epoch": 0.2960513518770667, "grad_norm": 1.0625, "learning_rate": 0.0004994633650333155, "loss": 5.714, "mean_token_accuracy": 0.15110620558261872, "num_tokens": 6615350.0, "step": 3805 }, { "entropy": 5.87994384765625, "epoch": 0.2964403812487843, "grad_norm": 0.9921875, "learning_rate": 0.0004994614502720792, "loss": 5.769, "mean_token_accuracy": 0.15212479382753372, "num_tokens": 6624258.0, "step": 3810 }, { "entropy": 5.970225715637207, "epoch": 0.29682941062050183, "grad_norm": 1.078125, "learning_rate": 0.0004994595321049974, "loss": 5.748, "mean_token_accuracy": 0.1487318679690361, "num_tokens": 6632382.0, "step": 3815 }, { "entropy": 5.829820251464843, "epoch": 0.2972184399922194, "grad_norm": 0.984375, "learning_rate": 0.0004994576105320994, "loss": 5.6629, "mean_token_accuracy": 0.15289796888828278, "num_tokens": 6640482.0, "step": 3820 }, { "entropy": 5.817120790481567, "epoch": 0.29760746936393695, "grad_norm": 1.0390625, "learning_rate": 0.0004994556855534146, "loss": 5.6476, "mean_token_accuracy": 0.15640270859003066, "num_tokens": 6648912.0, "step": 3825 }, { "entropy": 5.801205730438232, "epoch": 0.29799649873565454, "grad_norm": 1.0546875, "learning_rate": 0.0004994537571689719, "loss": 5.6288, "mean_token_accuracy": 0.15806550532579422, "num_tokens": 6656912.0, "step": 3830 }, { "entropy": 5.728374814987182, "epoch": 0.2983855281073721, "grad_norm": 0.95703125, "learning_rate": 0.0004994518253788007, "loss": 5.6519, "mean_token_accuracy": 0.15597154051065446, "num_tokens": 6665900.0, "step": 3835 }, { "entropy": 5.88460373878479, "epoch": 0.29877455747908965, "grad_norm": 0.9765625, "learning_rate": 0.0004994498901829304, "loss": 5.6988, "mean_token_accuracy": 0.15435834527015685, "num_tokens": 6674426.0, "step": 3840 }, { "entropy": 5.884772253036499, "epoch": 0.29916358685080724, "grad_norm": 0.98046875, "learning_rate": 0.0004994479515813903, "loss": 5.6541, "mean_token_accuracy": 0.15605763345956802, "num_tokens": 6683566.0, "step": 3845 }, { "entropy": 5.798302364349365, "epoch": 0.2995526162225248, "grad_norm": 0.984375, "learning_rate": 0.0004994460095742096, "loss": 5.6867, "mean_token_accuracy": 0.1584527686238289, "num_tokens": 6693341.0, "step": 3850 }, { "entropy": 5.827801609039307, "epoch": 0.29994164559424236, "grad_norm": 1.0, "learning_rate": 0.000499444064161418, "loss": 5.5855, "mean_token_accuracy": 0.15363955348730088, "num_tokens": 6701734.0, "step": 3855 }, { "entropy": 5.810207843780518, "epoch": 0.30033067496595994, "grad_norm": 0.96875, "learning_rate": 0.000499442115343045, "loss": 5.6245, "mean_token_accuracy": 0.1571832537651062, "num_tokens": 6710572.0, "step": 3860 }, { "entropy": 5.891124248504639, "epoch": 0.3007197043376775, "grad_norm": 1.0078125, "learning_rate": 0.0004994401631191202, "loss": 5.7396, "mean_token_accuracy": 0.14851216599345207, "num_tokens": 6719355.0, "step": 3865 }, { "entropy": 5.982782506942749, "epoch": 0.30110873370939506, "grad_norm": 0.96875, "learning_rate": 0.0004994382074896731, "loss": 5.7702, "mean_token_accuracy": 0.14574634730815889, "num_tokens": 6729279.0, "step": 3870 }, { "entropy": 5.794736433029175, "epoch": 0.30149776308111265, "grad_norm": 1.1015625, "learning_rate": 0.0004994362484547335, "loss": 5.5907, "mean_token_accuracy": 0.15171013325452803, "num_tokens": 6737318.0, "step": 3875 }, { "entropy": 5.8127483367919925, "epoch": 0.3018867924528302, "grad_norm": 0.98046875, "learning_rate": 0.0004994342860143309, "loss": 5.6749, "mean_token_accuracy": 0.1597735196352005, "num_tokens": 6746520.0, "step": 3880 }, { "entropy": 5.835038423538208, "epoch": 0.30227582182454776, "grad_norm": 0.98046875, "learning_rate": 0.0004994323201684953, "loss": 5.5972, "mean_token_accuracy": 0.1554494395852089, "num_tokens": 6755685.0, "step": 3885 }, { "entropy": 5.8171398639678955, "epoch": 0.3026648511962653, "grad_norm": 1.0859375, "learning_rate": 0.0004994303509172566, "loss": 5.7417, "mean_token_accuracy": 0.15470685362815856, "num_tokens": 6764347.0, "step": 3890 }, { "entropy": 5.926692819595337, "epoch": 0.3030538805679829, "grad_norm": 1.0390625, "learning_rate": 0.0004994283782606444, "loss": 5.7076, "mean_token_accuracy": 0.15835860669612883, "num_tokens": 6772887.0, "step": 3895 }, { "entropy": 5.7954470157623295, "epoch": 0.30344290993970047, "grad_norm": 1.078125, "learning_rate": 0.0004994264021986888, "loss": 5.6726, "mean_token_accuracy": 0.14857605174183847, "num_tokens": 6780860.0, "step": 3900 }, { "entropy": 5.790612697601318, "epoch": 0.303831939311418, "grad_norm": 1.03125, "learning_rate": 0.0004994244227314197, "loss": 5.6931, "mean_token_accuracy": 0.15410419106483458, "num_tokens": 6789491.0, "step": 3905 }, { "entropy": 5.917981243133545, "epoch": 0.3042209686831356, "grad_norm": 1.03125, "learning_rate": 0.0004994224398588672, "loss": 5.6175, "mean_token_accuracy": 0.15719443410634995, "num_tokens": 6797128.0, "step": 3910 }, { "entropy": 5.842257022857666, "epoch": 0.3046099980548531, "grad_norm": 1.0859375, "learning_rate": 0.0004994204535810615, "loss": 5.6526, "mean_token_accuracy": 0.15690061897039415, "num_tokens": 6805235.0, "step": 3915 }, { "entropy": 5.784561395645142, "epoch": 0.3049990274265707, "grad_norm": 0.98046875, "learning_rate": 0.0004994184638980326, "loss": 5.577, "mean_token_accuracy": 0.1572084903717041, "num_tokens": 6813863.0, "step": 3920 }, { "entropy": 5.830573415756225, "epoch": 0.3053880567982883, "grad_norm": 0.98828125, "learning_rate": 0.0004994164708098107, "loss": 5.6372, "mean_token_accuracy": 0.15513723939657212, "num_tokens": 6822015.0, "step": 3925 }, { "entropy": 5.889108514785766, "epoch": 0.3057770861700058, "grad_norm": 1.0, "learning_rate": 0.000499414474316426, "loss": 5.6945, "mean_token_accuracy": 0.15233523547649383, "num_tokens": 6830598.0, "step": 3930 }, { "entropy": 5.857270097732544, "epoch": 0.3061661155417234, "grad_norm": 0.94921875, "learning_rate": 0.0004994124744179088, "loss": 5.6859, "mean_token_accuracy": 0.16359390765428544, "num_tokens": 6839129.0, "step": 3935 }, { "entropy": 5.8585127830505375, "epoch": 0.306555144913441, "grad_norm": 0.96484375, "learning_rate": 0.0004994104711142896, "loss": 5.6445, "mean_token_accuracy": 0.15050655901432036, "num_tokens": 6848199.0, "step": 3940 }, { "entropy": 5.837422466278076, "epoch": 0.3069441742851585, "grad_norm": 0.984375, "learning_rate": 0.0004994084644055986, "loss": 5.6615, "mean_token_accuracy": 0.15743141025304794, "num_tokens": 6857340.0, "step": 3945 }, { "entropy": 5.805282306671143, "epoch": 0.3073332036568761, "grad_norm": 1.0078125, "learning_rate": 0.0004994064542918664, "loss": 5.6911, "mean_token_accuracy": 0.1498067356646061, "num_tokens": 6865830.0, "step": 3950 }, { "entropy": 5.843528699874878, "epoch": 0.30772223302859364, "grad_norm": 0.9609375, "learning_rate": 0.0004994044407731235, "loss": 5.7512, "mean_token_accuracy": 0.1488284096121788, "num_tokens": 6874318.0, "step": 3955 }, { "entropy": 6.015487432479858, "epoch": 0.3081112624003112, "grad_norm": 1.09375, "learning_rate": 0.0004994024238494002, "loss": 5.7414, "mean_token_accuracy": 0.15100244730710982, "num_tokens": 6882008.0, "step": 3960 }, { "entropy": 5.84633150100708, "epoch": 0.3085002917720288, "grad_norm": 0.9765625, "learning_rate": 0.0004994004035207274, "loss": 5.595, "mean_token_accuracy": 0.1584687501192093, "num_tokens": 6890411.0, "step": 3965 }, { "entropy": 5.800809621810913, "epoch": 0.30888932114374634, "grad_norm": 0.9296875, "learning_rate": 0.0004993983797871356, "loss": 5.6356, "mean_token_accuracy": 0.152000392973423, "num_tokens": 6899201.0, "step": 3970 }, { "entropy": 5.80447564125061, "epoch": 0.30927835051546393, "grad_norm": 1.0625, "learning_rate": 0.0004993963526486555, "loss": 5.6534, "mean_token_accuracy": 0.15221117436885834, "num_tokens": 6907470.0, "step": 3975 }, { "entropy": 5.788397216796875, "epoch": 0.30966737988718146, "grad_norm": 1.0234375, "learning_rate": 0.000499394322105318, "loss": 5.6828, "mean_token_accuracy": 0.15586572289466857, "num_tokens": 6916542.0, "step": 3980 }, { "entropy": 5.851479148864746, "epoch": 0.31005640925889905, "grad_norm": 0.92578125, "learning_rate": 0.0004993922881571538, "loss": 5.6814, "mean_token_accuracy": 0.15342268645763396, "num_tokens": 6925974.0, "step": 3985 }, { "entropy": 5.911538314819336, "epoch": 0.31044543863061663, "grad_norm": 0.9765625, "learning_rate": 0.0004993902508041939, "loss": 5.703, "mean_token_accuracy": 0.14747922271490096, "num_tokens": 6934987.0, "step": 3990 }, { "entropy": 5.766879081726074, "epoch": 0.31083446800233416, "grad_norm": 0.9375, "learning_rate": 0.000499388210046469, "loss": 5.5871, "mean_token_accuracy": 0.15272050797939302, "num_tokens": 6944497.0, "step": 3995 }, { "entropy": 5.847130870819091, "epoch": 0.31122349737405175, "grad_norm": 0.95703125, "learning_rate": 0.0004993861658840102, "loss": 5.7243, "mean_token_accuracy": 0.14793727397918702, "num_tokens": 6953394.0, "step": 4000 }, { "entropy": 5.84558367729187, "epoch": 0.3116125267457693, "grad_norm": 1.046875, "learning_rate": 0.0004993841183168484, "loss": 5.6365, "mean_token_accuracy": 0.15578553080558777, "num_tokens": 6961715.0, "step": 4005 }, { "entropy": 5.784832239151001, "epoch": 0.31200155611748687, "grad_norm": 1.0078125, "learning_rate": 0.0004993820673450148, "loss": 5.6423, "mean_token_accuracy": 0.15401849076151847, "num_tokens": 6970041.0, "step": 4010 }, { "entropy": 5.887779331207275, "epoch": 0.31239058548920445, "grad_norm": 1.0, "learning_rate": 0.0004993800129685404, "loss": 5.7804, "mean_token_accuracy": 0.14733504951000215, "num_tokens": 6979522.0, "step": 4015 }, { "entropy": 5.884895706176758, "epoch": 0.312779614860922, "grad_norm": 0.98828125, "learning_rate": 0.0004993779551874565, "loss": 5.7401, "mean_token_accuracy": 0.14512501955032348, "num_tokens": 6988470.0, "step": 4020 }, { "entropy": 5.913160419464111, "epoch": 0.31316864423263957, "grad_norm": 1.0546875, "learning_rate": 0.0004993758940017943, "loss": 5.745, "mean_token_accuracy": 0.15878498256206514, "num_tokens": 6996696.0, "step": 4025 }, { "entropy": 5.890307474136352, "epoch": 0.31355767360435716, "grad_norm": 1.0078125, "learning_rate": 0.000499373829411585, "loss": 5.6215, "mean_token_accuracy": 0.15232147574424743, "num_tokens": 7005297.0, "step": 4030 }, { "entropy": 5.814219665527344, "epoch": 0.3139467029760747, "grad_norm": 1.03125, "learning_rate": 0.00049937176141686, "loss": 5.6209, "mean_token_accuracy": 0.15302640944719315, "num_tokens": 7013569.0, "step": 4035 }, { "entropy": 5.770711660385132, "epoch": 0.3143357323477923, "grad_norm": 1.015625, "learning_rate": 0.0004993696900176506, "loss": 5.5739, "mean_token_accuracy": 0.15835325047373772, "num_tokens": 7021449.0, "step": 4040 }, { "entropy": 5.825836849212647, "epoch": 0.3147247617195098, "grad_norm": 1.09375, "learning_rate": 0.0004993676152139883, "loss": 5.6855, "mean_token_accuracy": 0.1571549579501152, "num_tokens": 7029663.0, "step": 4045 }, { "entropy": 5.803576135635376, "epoch": 0.3151137910912274, "grad_norm": 0.94921875, "learning_rate": 0.0004993655370059046, "loss": 5.6877, "mean_token_accuracy": 0.154311640560627, "num_tokens": 7039038.0, "step": 4050 }, { "entropy": 5.823104667663574, "epoch": 0.315502820462945, "grad_norm": 0.94140625, "learning_rate": 0.0004993634553934309, "loss": 5.645, "mean_token_accuracy": 0.15580660626292228, "num_tokens": 7047595.0, "step": 4055 }, { "entropy": 5.835638093948364, "epoch": 0.3158918498346625, "grad_norm": 1.0390625, "learning_rate": 0.0004993613703765989, "loss": 5.6582, "mean_token_accuracy": 0.15214158296585084, "num_tokens": 7055711.0, "step": 4060 }, { "entropy": 5.870501375198364, "epoch": 0.3162808792063801, "grad_norm": 0.97265625, "learning_rate": 0.0004993592819554402, "loss": 5.6272, "mean_token_accuracy": 0.15837595313787461, "num_tokens": 7064100.0, "step": 4065 }, { "entropy": 5.80830135345459, "epoch": 0.3166699085780976, "grad_norm": 0.9921875, "learning_rate": 0.0004993571901299866, "loss": 5.5916, "mean_token_accuracy": 0.15826652497053145, "num_tokens": 7073040.0, "step": 4070 }, { "entropy": 5.811197662353516, "epoch": 0.3170589379498152, "grad_norm": 1.0703125, "learning_rate": 0.0004993550949002697, "loss": 5.6968, "mean_token_accuracy": 0.1517757922410965, "num_tokens": 7081513.0, "step": 4075 }, { "entropy": 5.772473526000977, "epoch": 0.3174479673215328, "grad_norm": 0.98828125, "learning_rate": 0.0004993529962663213, "loss": 5.595, "mean_token_accuracy": 0.1613408699631691, "num_tokens": 7090704.0, "step": 4080 }, { "entropy": 5.818785381317139, "epoch": 0.31783699669325033, "grad_norm": 0.87890625, "learning_rate": 0.0004993508942281732, "loss": 5.7533, "mean_token_accuracy": 0.14853261411190033, "num_tokens": 7099692.0, "step": 4085 }, { "entropy": 5.7818577766418455, "epoch": 0.3182260260649679, "grad_norm": 0.9921875, "learning_rate": 0.0004993487887858575, "loss": 5.5793, "mean_token_accuracy": 0.15307215079665185, "num_tokens": 7108021.0, "step": 4090 }, { "entropy": 5.80325174331665, "epoch": 0.31861505543668545, "grad_norm": 1.015625, "learning_rate": 0.000499346679939406, "loss": 5.6545, "mean_token_accuracy": 0.1577788397669792, "num_tokens": 7116689.0, "step": 4095 }, { "entropy": 5.832878112792969, "epoch": 0.31900408480840303, "grad_norm": 1.1015625, "learning_rate": 0.0004993445676888507, "loss": 5.7519, "mean_token_accuracy": 0.1521778553724289, "num_tokens": 7125453.0, "step": 4100 }, { "entropy": 5.942759323120117, "epoch": 0.3193931141801206, "grad_norm": 1.0234375, "learning_rate": 0.0004993424520342236, "loss": 5.7843, "mean_token_accuracy": 0.15119208842515947, "num_tokens": 7133692.0, "step": 4105 }, { "entropy": 5.860222673416137, "epoch": 0.31978214355183815, "grad_norm": 0.94140625, "learning_rate": 0.0004993403329755569, "loss": 5.5968, "mean_token_accuracy": 0.15934908539056777, "num_tokens": 7142362.0, "step": 4110 }, { "entropy": 5.746327972412109, "epoch": 0.32017117292355574, "grad_norm": 1.015625, "learning_rate": 0.0004993382105128828, "loss": 5.6226, "mean_token_accuracy": 0.15567729622125626, "num_tokens": 7151020.0, "step": 4115 }, { "entropy": 5.768520021438599, "epoch": 0.32056020229527327, "grad_norm": 1.078125, "learning_rate": 0.0004993360846462333, "loss": 5.5285, "mean_token_accuracy": 0.16255829334259034, "num_tokens": 7159453.0, "step": 4120 }, { "entropy": 5.889703607559204, "epoch": 0.32094923166699085, "grad_norm": 0.9609375, "learning_rate": 0.0004993339553756408, "loss": 5.7937, "mean_token_accuracy": 0.1460296593606472, "num_tokens": 7168758.0, "step": 4125 }, { "entropy": 5.824968242645264, "epoch": 0.32133826103870844, "grad_norm": 0.96875, "learning_rate": 0.0004993318227011378, "loss": 5.6026, "mean_token_accuracy": 0.15972633063793182, "num_tokens": 7177835.0, "step": 4130 }, { "entropy": 5.817380714416504, "epoch": 0.32172729041042597, "grad_norm": 0.94921875, "learning_rate": 0.0004993296866227562, "loss": 5.6396, "mean_token_accuracy": 0.16363780200481415, "num_tokens": 7186424.0, "step": 4135 }, { "entropy": 5.817440557479858, "epoch": 0.32211631978214356, "grad_norm": 1.0078125, "learning_rate": 0.0004993275471405288, "loss": 5.6284, "mean_token_accuracy": 0.16064855307340623, "num_tokens": 7194800.0, "step": 4140 }, { "entropy": 5.759157609939575, "epoch": 0.32250534915386114, "grad_norm": 0.984375, "learning_rate": 0.0004993254042544879, "loss": 5.5543, "mean_token_accuracy": 0.16035097762942313, "num_tokens": 7203820.0, "step": 4145 }, { "entropy": 5.781700611114502, "epoch": 0.3228943785255787, "grad_norm": 1.0390625, "learning_rate": 0.000499323257964666, "loss": 5.5454, "mean_token_accuracy": 0.1592766359448433, "num_tokens": 7211793.0, "step": 4150 }, { "entropy": 5.802039670944214, "epoch": 0.32328340789729626, "grad_norm": 0.953125, "learning_rate": 0.0004993211082710957, "loss": 5.6027, "mean_token_accuracy": 0.1580141991376877, "num_tokens": 7220471.0, "step": 4155 }, { "entropy": 5.803948020935058, "epoch": 0.3236724372690138, "grad_norm": 0.9921875, "learning_rate": 0.0004993189551738097, "loss": 5.6609, "mean_token_accuracy": 0.1602739378809929, "num_tokens": 7228788.0, "step": 4160 }, { "entropy": 5.875597524642944, "epoch": 0.3240614666407314, "grad_norm": 1.03125, "learning_rate": 0.0004993167986728405, "loss": 5.8232, "mean_token_accuracy": 0.15174989998340607, "num_tokens": 7237707.0, "step": 4165 }, { "entropy": 5.858319091796875, "epoch": 0.32445049601244896, "grad_norm": 1.0, "learning_rate": 0.000499314638768221, "loss": 5.5789, "mean_token_accuracy": 0.1572333574295044, "num_tokens": 7246296.0, "step": 4170 }, { "entropy": 5.758087635040283, "epoch": 0.3248395253841665, "grad_norm": 1.0078125, "learning_rate": 0.0004993124754599839, "loss": 5.5103, "mean_token_accuracy": 0.16214703321456908, "num_tokens": 7255076.0, "step": 4175 }, { "entropy": 5.6478697776794435, "epoch": 0.3252285547558841, "grad_norm": 1.078125, "learning_rate": 0.0004993103087481619, "loss": 5.599, "mean_token_accuracy": 0.15897218883037567, "num_tokens": 7263169.0, "step": 4180 }, { "entropy": 5.875939607620239, "epoch": 0.3256175841276016, "grad_norm": 0.9375, "learning_rate": 0.0004993081386327881, "loss": 5.6549, "mean_token_accuracy": 0.1627318650484085, "num_tokens": 7271748.0, "step": 4185 }, { "entropy": 5.7767092227935795, "epoch": 0.3260066134993192, "grad_norm": 0.96875, "learning_rate": 0.0004993059651138953, "loss": 5.4638, "mean_token_accuracy": 0.1650639668107033, "num_tokens": 7280291.0, "step": 4190 }, { "entropy": 5.714006567001343, "epoch": 0.3263956428710368, "grad_norm": 1.015625, "learning_rate": 0.0004993037881915165, "loss": 5.6706, "mean_token_accuracy": 0.15370635092258453, "num_tokens": 7290307.0, "step": 4195 }, { "entropy": 5.853940105438232, "epoch": 0.3267846722427543, "grad_norm": 1.0, "learning_rate": 0.0004993016078656847, "loss": 5.754, "mean_token_accuracy": 0.1487473540008068, "num_tokens": 7297942.0, "step": 4200 }, { "entropy": 5.7838770866394045, "epoch": 0.3271737016144719, "grad_norm": 1.0, "learning_rate": 0.000499299424136433, "loss": 5.6306, "mean_token_accuracy": 0.15384245216846465, "num_tokens": 7307378.0, "step": 4205 }, { "entropy": 5.778017473220825, "epoch": 0.32756273098618943, "grad_norm": 1.0234375, "learning_rate": 0.0004992972370037946, "loss": 5.5811, "mean_token_accuracy": 0.1592706561088562, "num_tokens": 7315985.0, "step": 4210 }, { "entropy": 5.843814849853516, "epoch": 0.327951760357907, "grad_norm": 1.078125, "learning_rate": 0.0004992950464678026, "loss": 5.691, "mean_token_accuracy": 0.1587142139673233, "num_tokens": 7324142.0, "step": 4215 }, { "entropy": 5.740630483627319, "epoch": 0.3283407897296246, "grad_norm": 1.0625, "learning_rate": 0.0004992928525284903, "loss": 5.5362, "mean_token_accuracy": 0.16127856969833373, "num_tokens": 7333012.0, "step": 4220 }, { "entropy": 5.765237712860108, "epoch": 0.32872981910134214, "grad_norm": 1.0078125, "learning_rate": 0.000499290655185891, "loss": 5.5906, "mean_token_accuracy": 0.160532608628273, "num_tokens": 7341838.0, "step": 4225 }, { "entropy": 5.7777024269104, "epoch": 0.3291188484730597, "grad_norm": 1.0390625, "learning_rate": 0.000499288454440038, "loss": 5.5255, "mean_token_accuracy": 0.17211012840270995, "num_tokens": 7349986.0, "step": 4230 }, { "entropy": 5.856859874725342, "epoch": 0.3295078778447773, "grad_norm": 1.0625, "learning_rate": 0.0004992862502909645, "loss": 5.7791, "mean_token_accuracy": 0.14971803575754167, "num_tokens": 7359428.0, "step": 4235 }, { "entropy": 5.868747282028198, "epoch": 0.32989690721649484, "grad_norm": 0.98828125, "learning_rate": 0.0004992840427387043, "loss": 5.6902, "mean_token_accuracy": 0.15117943584918975, "num_tokens": 7368524.0, "step": 4240 }, { "entropy": 5.838213348388672, "epoch": 0.3302859365882124, "grad_norm": 0.875, "learning_rate": 0.0004992818317832908, "loss": 5.5728, "mean_token_accuracy": 0.1599339485168457, "num_tokens": 7377979.0, "step": 4245 }, { "entropy": 5.684649276733398, "epoch": 0.33067496595992996, "grad_norm": 1.0546875, "learning_rate": 0.0004992796174247574, "loss": 5.4922, "mean_token_accuracy": 0.15754138231277465, "num_tokens": 7386283.0, "step": 4250 }, { "entropy": 5.7293774604797365, "epoch": 0.33106399533164754, "grad_norm": 0.9609375, "learning_rate": 0.0004992773996631378, "loss": 5.6276, "mean_token_accuracy": 0.15059794411063193, "num_tokens": 7395409.0, "step": 4255 }, { "entropy": 5.841209554672242, "epoch": 0.33145302470336513, "grad_norm": 1.0703125, "learning_rate": 0.0004992751784984656, "loss": 5.705, "mean_token_accuracy": 0.1574711725115776, "num_tokens": 7403389.0, "step": 4260 }, { "entropy": 5.814565706253052, "epoch": 0.33184205407508266, "grad_norm": 0.98828125, "learning_rate": 0.0004992729539307745, "loss": 5.6165, "mean_token_accuracy": 0.15815107226371766, "num_tokens": 7411506.0, "step": 4265 }, { "entropy": 5.849872016906739, "epoch": 0.33223108344680025, "grad_norm": 1.0859375, "learning_rate": 0.0004992707259600984, "loss": 5.7025, "mean_token_accuracy": 0.15787684619426728, "num_tokens": 7420219.0, "step": 4270 }, { "entropy": 5.829010963439941, "epoch": 0.3326201128185178, "grad_norm": 0.98828125, "learning_rate": 0.0004992684945864709, "loss": 5.6124, "mean_token_accuracy": 0.16116924285888673, "num_tokens": 7428442.0, "step": 4275 }, { "entropy": 5.769632053375244, "epoch": 0.33300914219023536, "grad_norm": 0.94921875, "learning_rate": 0.0004992662598099261, "loss": 5.5713, "mean_token_accuracy": 0.1633827120065689, "num_tokens": 7436364.0, "step": 4280 }, { "entropy": 5.811918067932129, "epoch": 0.33339817156195295, "grad_norm": 1.046875, "learning_rate": 0.0004992640216304975, "loss": 5.6446, "mean_token_accuracy": 0.14872778430581093, "num_tokens": 7444122.0, "step": 4285 }, { "entropy": 5.867029237747192, "epoch": 0.3337872009336705, "grad_norm": 1.0078125, "learning_rate": 0.0004992617800482196, "loss": 5.6601, "mean_token_accuracy": 0.15238194465637206, "num_tokens": 7454122.0, "step": 4290 }, { "entropy": 5.827371215820312, "epoch": 0.33417623030538807, "grad_norm": 1.0703125, "learning_rate": 0.000499259535063126, "loss": 5.6652, "mean_token_accuracy": 0.16036169081926346, "num_tokens": 7463057.0, "step": 4295 }, { "entropy": 5.80002613067627, "epoch": 0.3345652596771056, "grad_norm": 0.98046875, "learning_rate": 0.000499257286675251, "loss": 5.6295, "mean_token_accuracy": 0.1520880788564682, "num_tokens": 7471675.0, "step": 4300 }, { "entropy": 5.708404207229615, "epoch": 0.3349542890488232, "grad_norm": 0.99609375, "learning_rate": 0.0004992550348846285, "loss": 5.5731, "mean_token_accuracy": 0.15868975967168808, "num_tokens": 7479870.0, "step": 4305 }, { "entropy": 5.807326030731201, "epoch": 0.33534331842054077, "grad_norm": 0.98828125, "learning_rate": 0.0004992527796912928, "loss": 5.6442, "mean_token_accuracy": 0.1565382771193981, "num_tokens": 7489830.0, "step": 4310 }, { "entropy": 5.791453504562378, "epoch": 0.3357323477922583, "grad_norm": 1.03125, "learning_rate": 0.0004992505210952782, "loss": 5.5757, "mean_token_accuracy": 0.1656323567032814, "num_tokens": 7497852.0, "step": 4315 }, { "entropy": 5.785038661956787, "epoch": 0.3361213771639759, "grad_norm": 1.0234375, "learning_rate": 0.0004992482590966188, "loss": 5.7069, "mean_token_accuracy": 0.1559569127857685, "num_tokens": 7506419.0, "step": 4320 }, { "entropy": 5.837784051895142, "epoch": 0.3365104065356934, "grad_norm": 0.9765625, "learning_rate": 0.0004992459936953489, "loss": 5.5972, "mean_token_accuracy": 0.16566000878810883, "num_tokens": 7514757.0, "step": 4325 }, { "entropy": 5.790379810333252, "epoch": 0.336899435907411, "grad_norm": 1.0390625, "learning_rate": 0.0004992437248915032, "loss": 5.664, "mean_token_accuracy": 0.15615198463201524, "num_tokens": 7523912.0, "step": 4330 }, { "entropy": 5.751581430435181, "epoch": 0.3372884652791286, "grad_norm": 0.984375, "learning_rate": 0.0004992414526851157, "loss": 5.5474, "mean_token_accuracy": 0.16585139334201812, "num_tokens": 7532401.0, "step": 4335 }, { "entropy": 5.669851446151734, "epoch": 0.3376774946508461, "grad_norm": 1.046875, "learning_rate": 0.0004992391770762212, "loss": 5.5144, "mean_token_accuracy": 0.16344813257455826, "num_tokens": 7541257.0, "step": 4340 }, { "entropy": 5.706036615371704, "epoch": 0.3380665240225637, "grad_norm": 0.95703125, "learning_rate": 0.000499236898064854, "loss": 5.4562, "mean_token_accuracy": 0.15973441749811174, "num_tokens": 7549812.0, "step": 4345 }, { "entropy": 5.743966579437256, "epoch": 0.3384555533942813, "grad_norm": 0.95703125, "learning_rate": 0.0004992346156510488, "loss": 5.5513, "mean_token_accuracy": 0.15965283364057542, "num_tokens": 7559319.0, "step": 4350 }, { "entropy": 5.813631963729859, "epoch": 0.3388445827659988, "grad_norm": 0.96875, "learning_rate": 0.0004992323298348403, "loss": 5.6947, "mean_token_accuracy": 0.1522468313574791, "num_tokens": 7567900.0, "step": 4355 }, { "entropy": 5.833976316452026, "epoch": 0.3392336121377164, "grad_norm": 1.0, "learning_rate": 0.000499230040616263, "loss": 5.6194, "mean_token_accuracy": 0.1545071080327034, "num_tokens": 7576163.0, "step": 4360 }, { "entropy": 5.769789743423462, "epoch": 0.33962264150943394, "grad_norm": 1.0078125, "learning_rate": 0.0004992277479953518, "loss": 5.5671, "mean_token_accuracy": 0.15694677829742432, "num_tokens": 7584221.0, "step": 4365 }, { "entropy": 5.700899267196656, "epoch": 0.34001167088115153, "grad_norm": 0.9921875, "learning_rate": 0.0004992254519721414, "loss": 5.5473, "mean_token_accuracy": 0.15996042490005494, "num_tokens": 7593569.0, "step": 4370 }, { "entropy": 5.7665114402771, "epoch": 0.3404007002528691, "grad_norm": 0.9296875, "learning_rate": 0.0004992231525466666, "loss": 5.6089, "mean_token_accuracy": 0.16032602339982988, "num_tokens": 7602666.0, "step": 4375 }, { "entropy": 5.74814510345459, "epoch": 0.34078972962458665, "grad_norm": 1.0078125, "learning_rate": 0.0004992208497189624, "loss": 5.6791, "mean_token_accuracy": 0.15110585689544678, "num_tokens": 7611874.0, "step": 4380 }, { "entropy": 5.841089820861816, "epoch": 0.34117875899630423, "grad_norm": 1.046875, "learning_rate": 0.0004992185434890637, "loss": 5.6336, "mean_token_accuracy": 0.15836991518735885, "num_tokens": 7620385.0, "step": 4385 }, { "entropy": 5.894673633575439, "epoch": 0.34156778836802176, "grad_norm": 1.0234375, "learning_rate": 0.0004992162338570055, "loss": 5.6854, "mean_token_accuracy": 0.148434978723526, "num_tokens": 7628786.0, "step": 4390 }, { "entropy": 5.769052648544312, "epoch": 0.34195681773973935, "grad_norm": 0.98046875, "learning_rate": 0.0004992139208228227, "loss": 5.5032, "mean_token_accuracy": 0.16336381584405898, "num_tokens": 7637389.0, "step": 4395 }, { "entropy": 5.750074100494385, "epoch": 0.34234584711145694, "grad_norm": 1.0703125, "learning_rate": 0.0004992116043865506, "loss": 5.6689, "mean_token_accuracy": 0.15916045010089874, "num_tokens": 7645793.0, "step": 4400 }, { "entropy": 5.878291654586792, "epoch": 0.34273487648317447, "grad_norm": 1.03125, "learning_rate": 0.0004992092845482244, "loss": 5.6357, "mean_token_accuracy": 0.16118928492069245, "num_tokens": 7653951.0, "step": 4405 }, { "entropy": 5.724064445495605, "epoch": 0.34312390585489205, "grad_norm": 0.93359375, "learning_rate": 0.0004992069613078791, "loss": 5.4944, "mean_token_accuracy": 0.16808485239744186, "num_tokens": 7662753.0, "step": 4410 }, { "entropy": 5.686445617675782, "epoch": 0.3435129352266096, "grad_norm": 0.9375, "learning_rate": 0.0004992046346655499, "loss": 5.4727, "mean_token_accuracy": 0.16301707774400712, "num_tokens": 7671832.0, "step": 4415 }, { "entropy": 5.801256561279297, "epoch": 0.34390196459832717, "grad_norm": 1.015625, "learning_rate": 0.0004992023046212723, "loss": 5.6282, "mean_token_accuracy": 0.1588641732931137, "num_tokens": 7680969.0, "step": 4420 }, { "entropy": 5.8781603336334225, "epoch": 0.34429099397004476, "grad_norm": 0.9921875, "learning_rate": 0.0004991999711750816, "loss": 5.6316, "mean_token_accuracy": 0.15277016907930374, "num_tokens": 7689277.0, "step": 4425 }, { "entropy": 5.728748893737793, "epoch": 0.3446800233417623, "grad_norm": 1.0390625, "learning_rate": 0.0004991976343270133, "loss": 5.5592, "mean_token_accuracy": 0.1625969737768173, "num_tokens": 7697373.0, "step": 4430 }, { "entropy": 5.857252168655395, "epoch": 0.3450690527134799, "grad_norm": 1.03125, "learning_rate": 0.0004991952940771026, "loss": 5.6249, "mean_token_accuracy": 0.15589040964841844, "num_tokens": 7705767.0, "step": 4435 }, { "entropy": 5.715005779266358, "epoch": 0.34545808208519746, "grad_norm": 1.1015625, "learning_rate": 0.0004991929504253852, "loss": 5.5207, "mean_token_accuracy": 0.1657451167702675, "num_tokens": 7713746.0, "step": 4440 }, { "entropy": 5.747983598709107, "epoch": 0.345847111456915, "grad_norm": 1.078125, "learning_rate": 0.0004991906033718966, "loss": 5.66, "mean_token_accuracy": 0.15185474902391433, "num_tokens": 7721829.0, "step": 4445 }, { "entropy": 5.7072593688964846, "epoch": 0.3462361408286326, "grad_norm": 0.90625, "learning_rate": 0.0004991882529166724, "loss": 5.5254, "mean_token_accuracy": 0.1630813479423523, "num_tokens": 7730479.0, "step": 4450 }, { "entropy": 5.768003606796265, "epoch": 0.3466251702003501, "grad_norm": 1.015625, "learning_rate": 0.0004991858990597483, "loss": 5.4953, "mean_token_accuracy": 0.16315876841545104, "num_tokens": 7738659.0, "step": 4455 }, { "entropy": 5.835393476486206, "epoch": 0.3470141995720677, "grad_norm": 1.0234375, "learning_rate": 0.0004991835418011601, "loss": 5.7726, "mean_token_accuracy": 0.15530015379190446, "num_tokens": 7747597.0, "step": 4460 }, { "entropy": 5.778534841537476, "epoch": 0.3474032289437853, "grad_norm": 0.9296875, "learning_rate": 0.0004991811811409434, "loss": 5.6145, "mean_token_accuracy": 0.1572774849832058, "num_tokens": 7756666.0, "step": 4465 }, { "entropy": 5.8093178272247314, "epoch": 0.3477922583155028, "grad_norm": 1.0, "learning_rate": 0.0004991788170791341, "loss": 5.6412, "mean_token_accuracy": 0.15569517463445665, "num_tokens": 7765621.0, "step": 4470 }, { "entropy": 5.762197351455688, "epoch": 0.3481812876872204, "grad_norm": 1.0, "learning_rate": 0.0004991764496157682, "loss": 5.5449, "mean_token_accuracy": 0.15648710131645202, "num_tokens": 7774137.0, "step": 4475 }, { "entropy": 5.828894186019897, "epoch": 0.34857031705893793, "grad_norm": 0.9375, "learning_rate": 0.0004991740787508814, "loss": 5.6492, "mean_token_accuracy": 0.15211960375308992, "num_tokens": 7783144.0, "step": 4480 }, { "entropy": 5.78465690612793, "epoch": 0.3489593464306555, "grad_norm": 1.015625, "learning_rate": 0.0004991717044845097, "loss": 5.6866, "mean_token_accuracy": 0.14937788471579552, "num_tokens": 7791530.0, "step": 4485 }, { "entropy": 5.761826896667481, "epoch": 0.3493483758023731, "grad_norm": 0.94921875, "learning_rate": 0.0004991693268166892, "loss": 5.5461, "mean_token_accuracy": 0.1595842033624649, "num_tokens": 7800869.0, "step": 4490 }, { "entropy": 5.781609058380127, "epoch": 0.34973740517409063, "grad_norm": 1.0390625, "learning_rate": 0.0004991669457474559, "loss": 5.6224, "mean_token_accuracy": 0.15640588253736495, "num_tokens": 7810201.0, "step": 4495 }, { "entropy": 5.749261569976807, "epoch": 0.3501264345458082, "grad_norm": 0.953125, "learning_rate": 0.0004991645612768461, "loss": 5.5152, "mean_token_accuracy": 0.1649569660425186, "num_tokens": 7818529.0, "step": 4500 }, { "entropy": 5.7531813621521, "epoch": 0.35051546391752575, "grad_norm": 0.98828125, "learning_rate": 0.0004991621734048958, "loss": 5.5601, "mean_token_accuracy": 0.16200138330459596, "num_tokens": 7827254.0, "step": 4505 }, { "entropy": 5.77031102180481, "epoch": 0.35090449328924334, "grad_norm": 0.97265625, "learning_rate": 0.0004991597821316415, "loss": 5.5726, "mean_token_accuracy": 0.16260626912117004, "num_tokens": 7836437.0, "step": 4510 }, { "entropy": 5.717511510848999, "epoch": 0.3512935226609609, "grad_norm": 0.96875, "learning_rate": 0.0004991573874571192, "loss": 5.5881, "mean_token_accuracy": 0.16121748238801956, "num_tokens": 7844939.0, "step": 4515 }, { "entropy": 5.755042934417725, "epoch": 0.35168255203267845, "grad_norm": 0.99609375, "learning_rate": 0.0004991549893813653, "loss": 5.5594, "mean_token_accuracy": 0.1579587161540985, "num_tokens": 7852889.0, "step": 4520 }, { "entropy": 5.809964561462403, "epoch": 0.35207158140439604, "grad_norm": 0.99609375, "learning_rate": 0.0004991525879044162, "loss": 5.7009, "mean_token_accuracy": 0.1521313928067684, "num_tokens": 7861867.0, "step": 4525 }, { "entropy": 5.759050130844116, "epoch": 0.35246061077611357, "grad_norm": 1.0234375, "learning_rate": 0.0004991501830263084, "loss": 5.4925, "mean_token_accuracy": 0.16492490023374556, "num_tokens": 7869343.0, "step": 4530 }, { "entropy": 5.743049049377442, "epoch": 0.35284964014783116, "grad_norm": 1.078125, "learning_rate": 0.0004991477747470783, "loss": 5.5496, "mean_token_accuracy": 0.16336526572704316, "num_tokens": 7877142.0, "step": 4535 }, { "entropy": 5.715654516220093, "epoch": 0.35323866951954874, "grad_norm": 1.0546875, "learning_rate": 0.0004991453630667625, "loss": 5.5718, "mean_token_accuracy": 0.1644924059510231, "num_tokens": 7885183.0, "step": 4540 }, { "entropy": 5.660160732269287, "epoch": 0.3536276988912663, "grad_norm": 1.03125, "learning_rate": 0.0004991429479853976, "loss": 5.4073, "mean_token_accuracy": 0.17003071159124375, "num_tokens": 7893848.0, "step": 4545 }, { "entropy": 5.752790403366089, "epoch": 0.35401672826298386, "grad_norm": 0.96484375, "learning_rate": 0.0004991405295030202, "loss": 5.5774, "mean_token_accuracy": 0.15930684059858322, "num_tokens": 7902438.0, "step": 4550 }, { "entropy": 5.7751688957214355, "epoch": 0.35440575763470145, "grad_norm": 0.953125, "learning_rate": 0.0004991381076196671, "loss": 5.543, "mean_token_accuracy": 0.15595637112855912, "num_tokens": 7910951.0, "step": 4555 }, { "entropy": 5.748727226257325, "epoch": 0.354794787006419, "grad_norm": 1.09375, "learning_rate": 0.0004991356823353748, "loss": 5.6526, "mean_token_accuracy": 0.1568855568766594, "num_tokens": 7920375.0, "step": 4560 }, { "entropy": 5.702395009994507, "epoch": 0.35518381637813656, "grad_norm": 0.9765625, "learning_rate": 0.0004991332536501804, "loss": 5.5248, "mean_token_accuracy": 0.1637159138917923, "num_tokens": 7928656.0, "step": 4565 }, { "entropy": 5.88414044380188, "epoch": 0.3555728457498541, "grad_norm": 0.9765625, "learning_rate": 0.0004991308215641205, "loss": 5.7693, "mean_token_accuracy": 0.15237502455711366, "num_tokens": 7936929.0, "step": 4570 }, { "entropy": 5.835222911834717, "epoch": 0.3559618751215717, "grad_norm": 1.0234375, "learning_rate": 0.0004991283860772323, "loss": 5.5781, "mean_token_accuracy": 0.16577111184597015, "num_tokens": 7945592.0, "step": 4575 }, { "entropy": 5.725835466384888, "epoch": 0.35635090449328927, "grad_norm": 1.0, "learning_rate": 0.0004991259471895525, "loss": 5.5138, "mean_token_accuracy": 0.16628557145595552, "num_tokens": 7953656.0, "step": 4580 }, { "entropy": 5.777119445800781, "epoch": 0.3567399338650068, "grad_norm": 1.0, "learning_rate": 0.0004991235049011182, "loss": 5.5921, "mean_token_accuracy": 0.16313516050577165, "num_tokens": 7962038.0, "step": 4585 }, { "entropy": 5.779297161102295, "epoch": 0.3571289632367244, "grad_norm": 1.0, "learning_rate": 0.0004991210592119663, "loss": 5.673, "mean_token_accuracy": 0.1561742752790451, "num_tokens": 7970338.0, "step": 4590 }, { "entropy": 5.824539995193481, "epoch": 0.3575179926084419, "grad_norm": 1.015625, "learning_rate": 0.0004991186101221342, "loss": 5.5993, "mean_token_accuracy": 0.16285818666219712, "num_tokens": 7979173.0, "step": 4595 }, { "entropy": 5.753220415115356, "epoch": 0.3579070219801595, "grad_norm": 1.0625, "learning_rate": 0.000499116157631659, "loss": 5.4754, "mean_token_accuracy": 0.16968862116336822, "num_tokens": 7987245.0, "step": 4600 }, { "entropy": 5.782096433639526, "epoch": 0.3582960513518771, "grad_norm": 1.0, "learning_rate": 0.0004991137017405777, "loss": 5.6827, "mean_token_accuracy": 0.15123804807662963, "num_tokens": 7995551.0, "step": 4605 }, { "entropy": 5.699934291839599, "epoch": 0.3586850807235946, "grad_norm": 0.9921875, "learning_rate": 0.0004991112424489277, "loss": 5.4975, "mean_token_accuracy": 0.16038129031658171, "num_tokens": 8004069.0, "step": 4610 }, { "entropy": 5.725274276733399, "epoch": 0.3590741100953122, "grad_norm": 0.98046875, "learning_rate": 0.0004991087797567462, "loss": 5.5675, "mean_token_accuracy": 0.16466078162193298, "num_tokens": 8012537.0, "step": 4615 }, { "entropy": 5.838127136230469, "epoch": 0.35946313946702974, "grad_norm": 0.96484375, "learning_rate": 0.0004991063136640709, "loss": 5.5434, "mean_token_accuracy": 0.15995005071163176, "num_tokens": 8021387.0, "step": 4620 }, { "entropy": 5.732734203338623, "epoch": 0.3598521688387473, "grad_norm": 1.0, "learning_rate": 0.0004991038441709388, "loss": 5.499, "mean_token_accuracy": 0.1588419958949089, "num_tokens": 8030261.0, "step": 4625 }, { "entropy": 5.771962738037109, "epoch": 0.3602411982104649, "grad_norm": 1.0234375, "learning_rate": 0.0004991013712773877, "loss": 5.581, "mean_token_accuracy": 0.15491561591625214, "num_tokens": 8038161.0, "step": 4630 }, { "entropy": 5.7120036602020265, "epoch": 0.36063022758218244, "grad_norm": 1.046875, "learning_rate": 0.0004990988949834549, "loss": 5.6502, "mean_token_accuracy": 0.16104790568351746, "num_tokens": 8046340.0, "step": 4635 }, { "entropy": 5.80100302696228, "epoch": 0.3610192569539, "grad_norm": 1.046875, "learning_rate": 0.000499096415289178, "loss": 5.5868, "mean_token_accuracy": 0.1563143476843834, "num_tokens": 8054997.0, "step": 4640 }, { "entropy": 5.75185375213623, "epoch": 0.3614082863256176, "grad_norm": 0.9140625, "learning_rate": 0.0004990939321945948, "loss": 5.5207, "mean_token_accuracy": 0.16830721646547317, "num_tokens": 8063686.0, "step": 4645 }, { "entropy": 5.738094854354858, "epoch": 0.36179731569733514, "grad_norm": 0.97265625, "learning_rate": 0.0004990914456997427, "loss": 5.6455, "mean_token_accuracy": 0.15778837502002716, "num_tokens": 8072999.0, "step": 4650 }, { "entropy": 5.734006452560425, "epoch": 0.36218634506905273, "grad_norm": 1.0078125, "learning_rate": 0.0004990889558046598, "loss": 5.4954, "mean_token_accuracy": 0.1635401204228401, "num_tokens": 8081596.0, "step": 4655 }, { "entropy": 5.792643308639526, "epoch": 0.36257537444077026, "grad_norm": 1.03125, "learning_rate": 0.0004990864625093836, "loss": 5.7211, "mean_token_accuracy": 0.1504440724849701, "num_tokens": 8090948.0, "step": 4660 }, { "entropy": 5.738381576538086, "epoch": 0.36296440381248785, "grad_norm": 1.03125, "learning_rate": 0.0004990839658139519, "loss": 5.7118, "mean_token_accuracy": 0.15039844661951066, "num_tokens": 8099445.0, "step": 4665 }, { "entropy": 5.817491865158081, "epoch": 0.36335343318420543, "grad_norm": 0.98046875, "learning_rate": 0.0004990814657184028, "loss": 5.5696, "mean_token_accuracy": 0.15574323982000352, "num_tokens": 8108119.0, "step": 4670 }, { "entropy": 5.782070636749268, "epoch": 0.36374246255592296, "grad_norm": 0.9609375, "learning_rate": 0.0004990789622227741, "loss": 5.5735, "mean_token_accuracy": 0.15753818452358245, "num_tokens": 8117060.0, "step": 4675 }, { "entropy": 5.714137172698974, "epoch": 0.36413149192764055, "grad_norm": 1.015625, "learning_rate": 0.0004990764553271038, "loss": 5.5652, "mean_token_accuracy": 0.15798794180154802, "num_tokens": 8126229.0, "step": 4680 }, { "entropy": 5.788286256790161, "epoch": 0.3645205212993581, "grad_norm": 1.015625, "learning_rate": 0.0004990739450314299, "loss": 5.5223, "mean_token_accuracy": 0.16824372112751007, "num_tokens": 8134694.0, "step": 4685 }, { "entropy": 5.772018814086914, "epoch": 0.36490955067107567, "grad_norm": 0.94140625, "learning_rate": 0.0004990714313357906, "loss": 5.5969, "mean_token_accuracy": 0.1634421780705452, "num_tokens": 8143329.0, "step": 4690 }, { "entropy": 5.750579977035523, "epoch": 0.36529858004279325, "grad_norm": 1.03125, "learning_rate": 0.000499068914240224, "loss": 5.5701, "mean_token_accuracy": 0.16435180157423018, "num_tokens": 8151432.0, "step": 4695 }, { "entropy": 5.76611328125, "epoch": 0.3656876094145108, "grad_norm": 0.96875, "learning_rate": 0.0004990663937447682, "loss": 5.5442, "mean_token_accuracy": 0.16045622676610946, "num_tokens": 8159677.0, "step": 4700 }, { "entropy": 5.727065992355347, "epoch": 0.36607663878622837, "grad_norm": 1.015625, "learning_rate": 0.0004990638698494615, "loss": 5.6065, "mean_token_accuracy": 0.15686380863189697, "num_tokens": 8168710.0, "step": 4705 }, { "entropy": 5.742712450027466, "epoch": 0.3664656681579459, "grad_norm": 0.98828125, "learning_rate": 0.0004990613425543423, "loss": 5.5955, "mean_token_accuracy": 0.1621291607618332, "num_tokens": 8177501.0, "step": 4710 }, { "entropy": 5.843996238708496, "epoch": 0.3668546975296635, "grad_norm": 1.0546875, "learning_rate": 0.0004990588118594487, "loss": 5.6682, "mean_token_accuracy": 0.15319716781377793, "num_tokens": 8185791.0, "step": 4715 }, { "entropy": 5.831458473205567, "epoch": 0.3672437269013811, "grad_norm": 1.03125, "learning_rate": 0.0004990562777648194, "loss": 5.6938, "mean_token_accuracy": 0.15462879985570907, "num_tokens": 8195020.0, "step": 4720 }, { "entropy": 5.756261014938355, "epoch": 0.3676327562730986, "grad_norm": 0.9765625, "learning_rate": 0.0004990537402704928, "loss": 5.5623, "mean_token_accuracy": 0.15908532589673996, "num_tokens": 8203540.0, "step": 4725 }, { "entropy": 5.799097156524658, "epoch": 0.3680217856448162, "grad_norm": 0.953125, "learning_rate": 0.0004990511993765071, "loss": 5.5506, "mean_token_accuracy": 0.15895125716924668, "num_tokens": 8211985.0, "step": 4730 }, { "entropy": 5.733615446090698, "epoch": 0.3684108150165337, "grad_norm": 0.95703125, "learning_rate": 0.0004990486550829011, "loss": 5.6262, "mean_token_accuracy": 0.1645650178194046, "num_tokens": 8220289.0, "step": 4735 }, { "entropy": 5.8451371669769285, "epoch": 0.3687998443882513, "grad_norm": 0.92578125, "learning_rate": 0.0004990461073897134, "loss": 5.6569, "mean_token_accuracy": 0.14948247075080873, "num_tokens": 8229652.0, "step": 4740 }, { "entropy": 5.806291913986206, "epoch": 0.3691888737599689, "grad_norm": 1.015625, "learning_rate": 0.0004990435562969827, "loss": 5.6478, "mean_token_accuracy": 0.15665459036827087, "num_tokens": 8237728.0, "step": 4745 }, { "entropy": 5.7270866394042965, "epoch": 0.3695779031316864, "grad_norm": 1.0078125, "learning_rate": 0.0004990410018047475, "loss": 5.5425, "mean_token_accuracy": 0.16309150755405427, "num_tokens": 8246393.0, "step": 4750 }, { "entropy": 5.695544958114624, "epoch": 0.369966932503404, "grad_norm": 0.94921875, "learning_rate": 0.0004990384439130467, "loss": 5.4984, "mean_token_accuracy": 0.16200296729803085, "num_tokens": 8256736.0, "step": 4755 }, { "entropy": 5.77980260848999, "epoch": 0.3703559618751216, "grad_norm": 0.9375, "learning_rate": 0.0004990358826219192, "loss": 5.5975, "mean_token_accuracy": 0.16518477648496627, "num_tokens": 8265126.0, "step": 4760 }, { "entropy": 5.778947877883911, "epoch": 0.37074499124683913, "grad_norm": 1.03125, "learning_rate": 0.0004990333179314038, "loss": 5.4984, "mean_token_accuracy": 0.16346690207719802, "num_tokens": 8273136.0, "step": 4765 }, { "entropy": 5.620182704925537, "epoch": 0.3711340206185567, "grad_norm": 1.0078125, "learning_rate": 0.0004990307498415393, "loss": 5.4276, "mean_token_accuracy": 0.16780980080366134, "num_tokens": 8281697.0, "step": 4770 }, { "entropy": 5.665127325057983, "epoch": 0.37152304999027425, "grad_norm": 1.015625, "learning_rate": 0.0004990281783523648, "loss": 5.5628, "mean_token_accuracy": 0.16574217826128007, "num_tokens": 8290765.0, "step": 4775 }, { "entropy": 5.823178434371949, "epoch": 0.37191207936199183, "grad_norm": 1.0, "learning_rate": 0.0004990256034639192, "loss": 5.6786, "mean_token_accuracy": 0.15433327853679657, "num_tokens": 8299875.0, "step": 4780 }, { "entropy": 5.750207090377808, "epoch": 0.3723011087337094, "grad_norm": 1.0859375, "learning_rate": 0.0004990230251762418, "loss": 5.5241, "mean_token_accuracy": 0.16539545208215714, "num_tokens": 8308515.0, "step": 4785 }, { "entropy": 5.682763338088989, "epoch": 0.37269013810542695, "grad_norm": 0.92578125, "learning_rate": 0.0004990204434893713, "loss": 5.4468, "mean_token_accuracy": 0.16895510554313659, "num_tokens": 8317260.0, "step": 4790 }, { "entropy": 5.7800510883331295, "epoch": 0.37307916747714454, "grad_norm": 0.96875, "learning_rate": 0.0004990178584033474, "loss": 5.6156, "mean_token_accuracy": 0.1566510796546936, "num_tokens": 8325887.0, "step": 4795 }, { "entropy": 5.842481851577759, "epoch": 0.37346819684886207, "grad_norm": 1.0, "learning_rate": 0.0004990152699182089, "loss": 5.6152, "mean_token_accuracy": 0.15425875931978225, "num_tokens": 8333974.0, "step": 4800 }, { "entropy": 5.722154998779297, "epoch": 0.37385722622057965, "grad_norm": 0.94140625, "learning_rate": 0.0004990126780339953, "loss": 5.5918, "mean_token_accuracy": 0.15548155158758165, "num_tokens": 8343199.0, "step": 4805 }, { "entropy": 5.685928583145142, "epoch": 0.37424625559229724, "grad_norm": 0.98828125, "learning_rate": 0.0004990100827507459, "loss": 5.3899, "mean_token_accuracy": 0.16845352202653885, "num_tokens": 8351202.0, "step": 4810 }, { "entropy": 5.811168527603149, "epoch": 0.37463528496401477, "grad_norm": 0.98828125, "learning_rate": 0.0004990074840684999, "loss": 5.7413, "mean_token_accuracy": 0.14929891377687454, "num_tokens": 8360011.0, "step": 4815 }, { "entropy": 5.75562105178833, "epoch": 0.37502431433573236, "grad_norm": 1.03125, "learning_rate": 0.0004990048819872969, "loss": 5.6051, "mean_token_accuracy": 0.16131770461797715, "num_tokens": 8367874.0, "step": 4820 }, { "entropy": 5.723214483261108, "epoch": 0.3754133437074499, "grad_norm": 1.03125, "learning_rate": 0.0004990022765071765, "loss": 5.57, "mean_token_accuracy": 0.15871281325817108, "num_tokens": 8376708.0, "step": 4825 }, { "entropy": 5.7772377014160154, "epoch": 0.3758023730791675, "grad_norm": 0.9453125, "learning_rate": 0.000498999667628178, "loss": 5.5918, "mean_token_accuracy": 0.16533441841602325, "num_tokens": 8385467.0, "step": 4830 }, { "entropy": 5.749735116958618, "epoch": 0.37619140245088506, "grad_norm": 0.9921875, "learning_rate": 0.0004989970553503411, "loss": 5.5598, "mean_token_accuracy": 0.15902363508939743, "num_tokens": 8393574.0, "step": 4835 }, { "entropy": 5.69984188079834, "epoch": 0.3765804318226026, "grad_norm": 0.87890625, "learning_rate": 0.0004989944396737054, "loss": 5.6006, "mean_token_accuracy": 0.16227839142084122, "num_tokens": 8402857.0, "step": 4840 }, { "entropy": 5.737270069122315, "epoch": 0.3769694611943202, "grad_norm": 0.94921875, "learning_rate": 0.0004989918205983106, "loss": 5.599, "mean_token_accuracy": 0.16925140619277954, "num_tokens": 8411728.0, "step": 4845 }, { "entropy": 5.779333019256592, "epoch": 0.37735849056603776, "grad_norm": 0.921875, "learning_rate": 0.0004989891981241964, "loss": 5.5787, "mean_token_accuracy": 0.1665400505065918, "num_tokens": 8420307.0, "step": 4850 }, { "entropy": 5.787651681900025, "epoch": 0.3777475199377553, "grad_norm": 0.8984375, "learning_rate": 0.0004989865722514027, "loss": 5.5925, "mean_token_accuracy": 0.15569850653409958, "num_tokens": 8429442.0, "step": 4855 }, { "entropy": 5.721146774291992, "epoch": 0.3781365493094729, "grad_norm": 0.9296875, "learning_rate": 0.0004989839429799692, "loss": 5.4756, "mean_token_accuracy": 0.17139440774917603, "num_tokens": 8437945.0, "step": 4860 }, { "entropy": 5.701009464263916, "epoch": 0.3785255786811904, "grad_norm": 1.0703125, "learning_rate": 0.000498981310309936, "loss": 5.468, "mean_token_accuracy": 0.1617519348859787, "num_tokens": 8445743.0, "step": 4865 }, { "entropy": 5.6702821254730225, "epoch": 0.378914608052908, "grad_norm": 1.078125, "learning_rate": 0.0004989786742413428, "loss": 5.5636, "mean_token_accuracy": 0.15807968527078628, "num_tokens": 8454091.0, "step": 4870 }, { "entropy": 5.8274698734283445, "epoch": 0.3793036374246256, "grad_norm": 1.0234375, "learning_rate": 0.0004989760347742298, "loss": 5.5638, "mean_token_accuracy": 0.1589045539498329, "num_tokens": 8461992.0, "step": 4875 }, { "entropy": 5.684429550170899, "epoch": 0.3796926667963431, "grad_norm": 0.921875, "learning_rate": 0.0004989733919086369, "loss": 5.5048, "mean_token_accuracy": 0.16163448840379716, "num_tokens": 8470730.0, "step": 4880 }, { "entropy": 5.702088356018066, "epoch": 0.3800816961680607, "grad_norm": 0.96484375, "learning_rate": 0.0004989707456446043, "loss": 5.5565, "mean_token_accuracy": 0.16036150306463243, "num_tokens": 8479947.0, "step": 4885 }, { "entropy": 5.825870656967163, "epoch": 0.38047072553977823, "grad_norm": 0.99609375, "learning_rate": 0.0004989680959821721, "loss": 5.6376, "mean_token_accuracy": 0.15936389118432998, "num_tokens": 8488237.0, "step": 4890 }, { "entropy": 5.738702583312988, "epoch": 0.3808597549114958, "grad_norm": 0.9453125, "learning_rate": 0.0004989654429213805, "loss": 5.5045, "mean_token_accuracy": 0.1659325733780861, "num_tokens": 8497146.0, "step": 4895 }, { "entropy": 5.747964525222779, "epoch": 0.3812487842832134, "grad_norm": 0.94140625, "learning_rate": 0.0004989627864622699, "loss": 5.5789, "mean_token_accuracy": 0.16467523127794265, "num_tokens": 8505736.0, "step": 4900 }, { "entropy": 5.765132761001587, "epoch": 0.38163781365493094, "grad_norm": 0.8984375, "learning_rate": 0.0004989601266048804, "loss": 5.5924, "mean_token_accuracy": 0.1583853229880333, "num_tokens": 8515368.0, "step": 4905 }, { "entropy": 5.72173228263855, "epoch": 0.3820268430266485, "grad_norm": 0.9609375, "learning_rate": 0.0004989574633492525, "loss": 5.5642, "mean_token_accuracy": 0.1621312364935875, "num_tokens": 8524141.0, "step": 4910 }, { "entropy": 5.718557834625244, "epoch": 0.38241587239836605, "grad_norm": 0.92578125, "learning_rate": 0.0004989547966954266, "loss": 5.4734, "mean_token_accuracy": 0.16636828035116197, "num_tokens": 8533116.0, "step": 4915 }, { "entropy": 5.712999486923218, "epoch": 0.38280490177008364, "grad_norm": 0.9609375, "learning_rate": 0.000498952126643443, "loss": 5.6072, "mean_token_accuracy": 0.16635651737451554, "num_tokens": 8541919.0, "step": 4920 }, { "entropy": 5.7109620571136475, "epoch": 0.3831939311418012, "grad_norm": 1.0390625, "learning_rate": 0.0004989494531933424, "loss": 5.4876, "mean_token_accuracy": 0.17107266783714295, "num_tokens": 8550372.0, "step": 4925 }, { "entropy": 5.757292413711548, "epoch": 0.38358296051351876, "grad_norm": 0.95703125, "learning_rate": 0.0004989467763451652, "loss": 5.5827, "mean_token_accuracy": 0.15917742997407913, "num_tokens": 8559246.0, "step": 4930 }, { "entropy": 5.6922876834869385, "epoch": 0.38397198988523634, "grad_norm": 1.0390625, "learning_rate": 0.0004989440960989523, "loss": 5.3482, "mean_token_accuracy": 0.16702754199504852, "num_tokens": 8567005.0, "step": 4935 }, { "entropy": 5.64597373008728, "epoch": 0.3843610192569539, "grad_norm": 0.94921875, "learning_rate": 0.000498941412454744, "loss": 5.5681, "mean_token_accuracy": 0.1547877758741379, "num_tokens": 8575399.0, "step": 4940 }, { "entropy": 5.817316627502441, "epoch": 0.38475004862867146, "grad_norm": 0.94921875, "learning_rate": 0.0004989387254125813, "loss": 5.6216, "mean_token_accuracy": 0.15826431214809417, "num_tokens": 8583994.0, "step": 4945 }, { "entropy": 5.731871128082275, "epoch": 0.38513907800038905, "grad_norm": 0.9609375, "learning_rate": 0.0004989360349725049, "loss": 5.5533, "mean_token_accuracy": 0.16471867114305497, "num_tokens": 8593446.0, "step": 4950 }, { "entropy": 5.743245267868042, "epoch": 0.3855281073721066, "grad_norm": 1.0625, "learning_rate": 0.0004989333411345555, "loss": 5.5482, "mean_token_accuracy": 0.16647694557905196, "num_tokens": 8602821.0, "step": 4955 }, { "entropy": 5.751190042495727, "epoch": 0.38591713674382416, "grad_norm": 0.95703125, "learning_rate": 0.0004989306438987742, "loss": 5.6471, "mean_token_accuracy": 0.15571539402008056, "num_tokens": 8611831.0, "step": 4960 }, { "entropy": 5.795993375778198, "epoch": 0.38630616611554175, "grad_norm": 0.98046875, "learning_rate": 0.0004989279432652018, "loss": 5.5403, "mean_token_accuracy": 0.16009591668844222, "num_tokens": 8620986.0, "step": 4965 }, { "entropy": 5.733548927307129, "epoch": 0.3866951954872593, "grad_norm": 1.0546875, "learning_rate": 0.0004989252392338791, "loss": 5.4854, "mean_token_accuracy": 0.1636480860412121, "num_tokens": 8629822.0, "step": 4970 }, { "entropy": 5.724105978012085, "epoch": 0.38708422485897687, "grad_norm": 1.0, "learning_rate": 0.0004989225318048475, "loss": 5.6001, "mean_token_accuracy": 0.15980519205331803, "num_tokens": 8637679.0, "step": 4975 }, { "entropy": 5.76774034500122, "epoch": 0.3874732542306944, "grad_norm": 0.99609375, "learning_rate": 0.0004989198209781478, "loss": 5.6142, "mean_token_accuracy": 0.1648936003446579, "num_tokens": 8646705.0, "step": 4980 }, { "entropy": 5.794110631942749, "epoch": 0.387862283602412, "grad_norm": 0.94140625, "learning_rate": 0.0004989171067538211, "loss": 5.5435, "mean_token_accuracy": 0.16352889388799668, "num_tokens": 8655599.0, "step": 4985 }, { "entropy": 5.69699764251709, "epoch": 0.38825131297412957, "grad_norm": 0.9140625, "learning_rate": 0.000498914389131909, "loss": 5.5651, "mean_token_accuracy": 0.15984487384557725, "num_tokens": 8665025.0, "step": 4990 }, { "entropy": 5.715613317489624, "epoch": 0.3886403423458471, "grad_norm": 1.0390625, "learning_rate": 0.0004989116681124523, "loss": 5.4493, "mean_token_accuracy": 0.1684253543615341, "num_tokens": 8672994.0, "step": 4995 }, { "entropy": 5.686432600021362, "epoch": 0.3890293717175647, "grad_norm": 0.93359375, "learning_rate": 0.0004989089436954924, "loss": 5.5803, "mean_token_accuracy": 0.15855107009410857, "num_tokens": 8682457.0, "step": 5000 }, { "entropy": 5.764044570922851, "epoch": 0.3894184010892822, "grad_norm": 1.046875, "learning_rate": 0.0004989062158810706, "loss": 5.5553, "mean_token_accuracy": 0.16128483563661575, "num_tokens": 8690888.0, "step": 5005 }, { "entropy": 5.811047554016113, "epoch": 0.3898074304609998, "grad_norm": 1.0234375, "learning_rate": 0.0004989034846692284, "loss": 5.656, "mean_token_accuracy": 0.15784021466970444, "num_tokens": 8699632.0, "step": 5010 }, { "entropy": 5.699138116836548, "epoch": 0.3901964598327174, "grad_norm": 1.046875, "learning_rate": 0.0004989007500600073, "loss": 5.4907, "mean_token_accuracy": 0.16482501178979875, "num_tokens": 8707955.0, "step": 5015 }, { "entropy": 5.753307962417603, "epoch": 0.3905854892044349, "grad_norm": 1.1328125, "learning_rate": 0.0004988980120534486, "loss": 5.6395, "mean_token_accuracy": 0.16032529175281524, "num_tokens": 8716103.0, "step": 5020 }, { "entropy": 5.694552755355835, "epoch": 0.3909745185761525, "grad_norm": 1.0, "learning_rate": 0.000498895270649594, "loss": 5.495, "mean_token_accuracy": 0.1711027666926384, "num_tokens": 8724499.0, "step": 5025 }, { "entropy": 5.667240476608276, "epoch": 0.39136354794787004, "grad_norm": 0.98046875, "learning_rate": 0.000498892525848485, "loss": 5.515, "mean_token_accuracy": 0.1710180327296257, "num_tokens": 8732829.0, "step": 5030 }, { "entropy": 5.62990984916687, "epoch": 0.3917525773195876, "grad_norm": 1.0, "learning_rate": 0.0004988897776501633, "loss": 5.3801, "mean_token_accuracy": 0.17283668592572213, "num_tokens": 8741617.0, "step": 5035 }, { "entropy": 5.655297517776489, "epoch": 0.3921416066913052, "grad_norm": 0.97265625, "learning_rate": 0.0004988870260546705, "loss": 5.369, "mean_token_accuracy": 0.17152581065893174, "num_tokens": 8750146.0, "step": 5040 }, { "entropy": 5.684403562545777, "epoch": 0.39253063606302274, "grad_norm": 1.0546875, "learning_rate": 0.0004988842710620486, "loss": 5.5443, "mean_token_accuracy": 0.16621591448783873, "num_tokens": 8758744.0, "step": 5045 }, { "entropy": 5.667189884185791, "epoch": 0.39291966543474033, "grad_norm": 0.921875, "learning_rate": 0.0004988815126723391, "loss": 5.5707, "mean_token_accuracy": 0.1603170469403267, "num_tokens": 8768219.0, "step": 5050 }, { "entropy": 5.7467005252838135, "epoch": 0.3933086948064579, "grad_norm": 1.0078125, "learning_rate": 0.0004988787508855841, "loss": 5.5639, "mean_token_accuracy": 0.15709830820560455, "num_tokens": 8777047.0, "step": 5055 }, { "entropy": 5.678100967407227, "epoch": 0.39369772417817545, "grad_norm": 1.0390625, "learning_rate": 0.0004988759857018253, "loss": 5.4517, "mean_token_accuracy": 0.16117836385965348, "num_tokens": 8785918.0, "step": 5060 }, { "entropy": 5.648393821716309, "epoch": 0.39408675354989303, "grad_norm": 1.0, "learning_rate": 0.0004988732171211048, "loss": 5.5265, "mean_token_accuracy": 0.15852733552455903, "num_tokens": 8794253.0, "step": 5065 }, { "entropy": 5.688629388809204, "epoch": 0.39447578292161056, "grad_norm": 1.0234375, "learning_rate": 0.0004988704451434644, "loss": 5.5785, "mean_token_accuracy": 0.16885487884283065, "num_tokens": 8802352.0, "step": 5070 }, { "entropy": 5.782166004180908, "epoch": 0.39486481229332815, "grad_norm": 0.99609375, "learning_rate": 0.0004988676697689465, "loss": 5.5381, "mean_token_accuracy": 0.15879994332790376, "num_tokens": 8810956.0, "step": 5075 }, { "entropy": 5.6235700130462645, "epoch": 0.39525384166504574, "grad_norm": 1.03125, "learning_rate": 0.000498864890997593, "loss": 5.4612, "mean_token_accuracy": 0.16021384447813034, "num_tokens": 8819062.0, "step": 5080 }, { "entropy": 5.668540382385254, "epoch": 0.39564287103676327, "grad_norm": 1.078125, "learning_rate": 0.0004988621088294461, "loss": 5.5664, "mean_token_accuracy": 0.1544269561767578, "num_tokens": 8827470.0, "step": 5085 }, { "entropy": 5.756826543807984, "epoch": 0.39603190040848085, "grad_norm": 0.96875, "learning_rate": 0.000498859323264548, "loss": 5.5979, "mean_token_accuracy": 0.1592550739645958, "num_tokens": 8837003.0, "step": 5090 }, { "entropy": 5.724267387390137, "epoch": 0.3964209297801984, "grad_norm": 0.921875, "learning_rate": 0.000498856534302941, "loss": 5.5996, "mean_token_accuracy": 0.15522586405277253, "num_tokens": 8846605.0, "step": 5095 }, { "entropy": 5.802182674407959, "epoch": 0.39680995915191597, "grad_norm": 1.015625, "learning_rate": 0.0004988537419446673, "loss": 5.6184, "mean_token_accuracy": 0.15980854481458664, "num_tokens": 8855232.0, "step": 5100 }, { "entropy": 5.745633840560913, "epoch": 0.39719898852363356, "grad_norm": 0.9765625, "learning_rate": 0.0004988509461897694, "loss": 5.5063, "mean_token_accuracy": 0.1694345474243164, "num_tokens": 8864176.0, "step": 5105 }, { "entropy": 5.700151252746582, "epoch": 0.3975880178953511, "grad_norm": 0.84765625, "learning_rate": 0.0004988481470382897, "loss": 5.581, "mean_token_accuracy": 0.16570933312177658, "num_tokens": 8872671.0, "step": 5110 }, { "entropy": 5.633589887619019, "epoch": 0.3979770472670687, "grad_norm": 0.96875, "learning_rate": 0.0004988453444902708, "loss": 5.4773, "mean_token_accuracy": 0.1687018722295761, "num_tokens": 8881316.0, "step": 5115 }, { "entropy": 5.768270206451416, "epoch": 0.3983660766387862, "grad_norm": 1.0234375, "learning_rate": 0.0004988425385457549, "loss": 5.6128, "mean_token_accuracy": 0.16246161833405495, "num_tokens": 8890114.0, "step": 5120 }, { "entropy": 5.7693624019622805, "epoch": 0.3987551060105038, "grad_norm": 1.2109375, "learning_rate": 0.0004988397292047848, "loss": 5.5367, "mean_token_accuracy": 0.16662347167730332, "num_tokens": 8899598.0, "step": 5125 }, { "entropy": 5.5953779220581055, "epoch": 0.3991441353822214, "grad_norm": 1.0078125, "learning_rate": 0.0004988369164674032, "loss": 5.3957, "mean_token_accuracy": 0.16895558983087539, "num_tokens": 8908244.0, "step": 5130 }, { "entropy": 5.67269926071167, "epoch": 0.3995331647539389, "grad_norm": 0.9921875, "learning_rate": 0.0004988341003336526, "loss": 5.4557, "mean_token_accuracy": 0.16561708748340606, "num_tokens": 8916280.0, "step": 5135 }, { "entropy": 5.776008939743042, "epoch": 0.3999221941256565, "grad_norm": 1.0390625, "learning_rate": 0.0004988312808035757, "loss": 5.5072, "mean_token_accuracy": 0.1566791757941246, "num_tokens": 8923947.0, "step": 5140 }, { "entropy": 5.646599531173706, "epoch": 0.400311223497374, "grad_norm": 0.9140625, "learning_rate": 0.0004988284578772155, "loss": 5.5424, "mean_token_accuracy": 0.15635721981525422, "num_tokens": 8933374.0, "step": 5145 }, { "entropy": 5.6722198009490965, "epoch": 0.4007002528690916, "grad_norm": 0.95703125, "learning_rate": 0.0004988256315546146, "loss": 5.4755, "mean_token_accuracy": 0.1645133301615715, "num_tokens": 8941757.0, "step": 5150 }, { "entropy": 5.66157374382019, "epoch": 0.4010892822408092, "grad_norm": 1.0, "learning_rate": 0.0004988228018358161, "loss": 5.3833, "mean_token_accuracy": 0.16919830590486526, "num_tokens": 8950128.0, "step": 5155 }, { "entropy": 5.734227657318115, "epoch": 0.40147831161252673, "grad_norm": 1.0390625, "learning_rate": 0.0004988199687208628, "loss": 5.5318, "mean_token_accuracy": 0.15678182244300842, "num_tokens": 8958939.0, "step": 5160 }, { "entropy": 5.7235174655914305, "epoch": 0.4018673409842443, "grad_norm": 1.015625, "learning_rate": 0.0004988171322097977, "loss": 5.4884, "mean_token_accuracy": 0.166029854118824, "num_tokens": 8967519.0, "step": 5165 }, { "entropy": 5.623489952087402, "epoch": 0.4022563703559619, "grad_norm": 0.984375, "learning_rate": 0.0004988142923026638, "loss": 5.3649, "mean_token_accuracy": 0.17290344089269638, "num_tokens": 8976215.0, "step": 5170 }, { "entropy": 5.739109516143799, "epoch": 0.40264539972767943, "grad_norm": 1.078125, "learning_rate": 0.0004988114489995044, "loss": 5.5925, "mean_token_accuracy": 0.15214981213212014, "num_tokens": 8984060.0, "step": 5175 }, { "entropy": 5.726056623458862, "epoch": 0.403034429099397, "grad_norm": 1.0, "learning_rate": 0.0004988086023003624, "loss": 5.5359, "mean_token_accuracy": 0.15775070786476136, "num_tokens": 8992301.0, "step": 5180 }, { "entropy": 5.763833379745483, "epoch": 0.40342345847111455, "grad_norm": 1.0703125, "learning_rate": 0.0004988057522052811, "loss": 5.5542, "mean_token_accuracy": 0.16253505051136016, "num_tokens": 9000517.0, "step": 5185 }, { "entropy": 5.663650035858154, "epoch": 0.40381248784283214, "grad_norm": 1.0703125, "learning_rate": 0.0004988028987143037, "loss": 5.5185, "mean_token_accuracy": 0.15818402916193008, "num_tokens": 9008826.0, "step": 5190 }, { "entropy": 5.710343217849731, "epoch": 0.4042015172145497, "grad_norm": 0.98046875, "learning_rate": 0.0004988000418274736, "loss": 5.5037, "mean_token_accuracy": 0.15956878066062927, "num_tokens": 9017952.0, "step": 5195 }, { "entropy": 5.698844003677368, "epoch": 0.40459054658626725, "grad_norm": 0.93359375, "learning_rate": 0.0004987971815448341, "loss": 5.5108, "mean_token_accuracy": 0.16802990138530732, "num_tokens": 9026688.0, "step": 5200 }, { "entropy": 5.6753887176513675, "epoch": 0.40497957595798484, "grad_norm": 0.98046875, "learning_rate": 0.0004987943178664285, "loss": 5.4604, "mean_token_accuracy": 0.16948893219232558, "num_tokens": 9035761.0, "step": 5205 }, { "entropy": 5.711546516418457, "epoch": 0.40536860532970237, "grad_norm": 0.921875, "learning_rate": 0.0004987914507923004, "loss": 5.6052, "mean_token_accuracy": 0.15351177304983138, "num_tokens": 9044510.0, "step": 5210 }, { "entropy": 5.688313055038452, "epoch": 0.40575763470141996, "grad_norm": 1.0, "learning_rate": 0.0004987885803224931, "loss": 5.4623, "mean_token_accuracy": 0.16280150562524795, "num_tokens": 9053031.0, "step": 5215 }, { "entropy": 5.616592454910278, "epoch": 0.40614666407313754, "grad_norm": 0.9921875, "learning_rate": 0.0004987857064570505, "loss": 5.4429, "mean_token_accuracy": 0.1689184382557869, "num_tokens": 9061580.0, "step": 5220 }, { "entropy": 5.711910200119019, "epoch": 0.4065356934448551, "grad_norm": 0.98046875, "learning_rate": 0.0004987828291960158, "loss": 5.5666, "mean_token_accuracy": 0.16402611136436462, "num_tokens": 9069741.0, "step": 5225 }, { "entropy": 5.8263026714324955, "epoch": 0.40692472281657266, "grad_norm": 0.94921875, "learning_rate": 0.000498779948539433, "loss": 5.5922, "mean_token_accuracy": 0.15314422994852067, "num_tokens": 9079214.0, "step": 5230 }, { "entropy": 5.779076194763183, "epoch": 0.4073137521882902, "grad_norm": 0.89453125, "learning_rate": 0.0004987770644873455, "loss": 5.5444, "mean_token_accuracy": 0.16699129492044448, "num_tokens": 9088201.0, "step": 5235 }, { "entropy": 5.714314365386963, "epoch": 0.4077027815600078, "grad_norm": 0.9765625, "learning_rate": 0.0004987741770397974, "loss": 5.5828, "mean_token_accuracy": 0.15950050503015517, "num_tokens": 9096829.0, "step": 5240 }, { "entropy": 5.693706512451172, "epoch": 0.40809181093172536, "grad_norm": 1.0234375, "learning_rate": 0.0004987712861968323, "loss": 5.5217, "mean_token_accuracy": 0.16581078618764877, "num_tokens": 9105515.0, "step": 5245 }, { "entropy": 5.708260154724121, "epoch": 0.4084808403034429, "grad_norm": 1.03125, "learning_rate": 0.000498768391958494, "loss": 5.4997, "mean_token_accuracy": 0.16316778659820558, "num_tokens": 9113614.0, "step": 5250 }, { "entropy": 5.705586671829224, "epoch": 0.4088698696751605, "grad_norm": 0.97265625, "learning_rate": 0.0004987654943248266, "loss": 5.5814, "mean_token_accuracy": 0.15525239408016206, "num_tokens": 9122337.0, "step": 5255 }, { "entropy": 5.752633762359619, "epoch": 0.40925889904687807, "grad_norm": 1.0234375, "learning_rate": 0.0004987625932958739, "loss": 5.4856, "mean_token_accuracy": 0.16904787570238114, "num_tokens": 9130417.0, "step": 5260 }, { "entropy": 5.7156274795532225, "epoch": 0.4096479284185956, "grad_norm": 0.953125, "learning_rate": 0.0004987596888716801, "loss": 5.5429, "mean_token_accuracy": 0.15976496934890747, "num_tokens": 9139317.0, "step": 5265 }, { "entropy": 5.701608371734619, "epoch": 0.4100369577903132, "grad_norm": 1.0078125, "learning_rate": 0.0004987567810522892, "loss": 5.5256, "mean_token_accuracy": 0.16300612986087798, "num_tokens": 9147808.0, "step": 5270 }, { "entropy": 5.785950708389282, "epoch": 0.4104259871620307, "grad_norm": 0.91015625, "learning_rate": 0.0004987538698377451, "loss": 5.6164, "mean_token_accuracy": 0.1566879279911518, "num_tokens": 9157117.0, "step": 5275 }, { "entropy": 5.738699245452881, "epoch": 0.4108150165337483, "grad_norm": 1.015625, "learning_rate": 0.0004987509552280924, "loss": 5.4742, "mean_token_accuracy": 0.15899330377578735, "num_tokens": 9165297.0, "step": 5280 }, { "entropy": 5.749457693099975, "epoch": 0.4112040459054659, "grad_norm": 1.0625, "learning_rate": 0.000498748037223375, "loss": 5.605, "mean_token_accuracy": 0.16066010892391205, "num_tokens": 9172945.0, "step": 5285 }, { "entropy": 5.722745656967163, "epoch": 0.4115930752771834, "grad_norm": 1.0, "learning_rate": 0.0004987451158236372, "loss": 5.5321, "mean_token_accuracy": 0.16613929271697997, "num_tokens": 9181445.0, "step": 5290 }, { "entropy": 5.635143423080445, "epoch": 0.411982104648901, "grad_norm": 1.0625, "learning_rate": 0.0004987421910289234, "loss": 5.3782, "mean_token_accuracy": 0.17040496617555617, "num_tokens": 9189535.0, "step": 5295 }, { "entropy": 5.684240674972534, "epoch": 0.41237113402061853, "grad_norm": 0.9921875, "learning_rate": 0.0004987392628392781, "loss": 5.6002, "mean_token_accuracy": 0.14962754249572754, "num_tokens": 9198328.0, "step": 5300 }, { "entropy": 5.749529075622559, "epoch": 0.4127601633923361, "grad_norm": 0.97265625, "learning_rate": 0.0004987363312547456, "loss": 5.486, "mean_token_accuracy": 0.16676264256238937, "num_tokens": 9206840.0, "step": 5305 }, { "entropy": 5.644282436370849, "epoch": 0.4131491927640537, "grad_norm": 1.0, "learning_rate": 0.0004987333962753703, "loss": 5.3891, "mean_token_accuracy": 0.1677182286977768, "num_tokens": 9215155.0, "step": 5310 }, { "entropy": 5.636444759368897, "epoch": 0.41353822213577124, "grad_norm": 1.0, "learning_rate": 0.0004987304579011967, "loss": 5.5709, "mean_token_accuracy": 0.16278092861175536, "num_tokens": 9224426.0, "step": 5315 }, { "entropy": 5.75674786567688, "epoch": 0.4139272515074888, "grad_norm": 0.9375, "learning_rate": 0.0004987275161322697, "loss": 5.5879, "mean_token_accuracy": 0.16320908665657044, "num_tokens": 9233785.0, "step": 5320 }, { "entropy": 5.726920557022095, "epoch": 0.41431628087920636, "grad_norm": 1.046875, "learning_rate": 0.0004987245709686337, "loss": 5.5433, "mean_token_accuracy": 0.1654205784201622, "num_tokens": 9242168.0, "step": 5325 }, { "entropy": 5.675925016403198, "epoch": 0.41470531025092394, "grad_norm": 1.0390625, "learning_rate": 0.0004987216224103334, "loss": 5.5575, "mean_token_accuracy": 0.165568046271801, "num_tokens": 9250862.0, "step": 5330 }, { "entropy": 5.745130348205566, "epoch": 0.41509433962264153, "grad_norm": 0.97265625, "learning_rate": 0.0004987186704574136, "loss": 5.5718, "mean_token_accuracy": 0.1554880768060684, "num_tokens": 9259957.0, "step": 5335 }, { "entropy": 5.6644360542297365, "epoch": 0.41548336899435906, "grad_norm": 1.09375, "learning_rate": 0.0004987157151099189, "loss": 5.4438, "mean_token_accuracy": 0.1625848740339279, "num_tokens": 9268590.0, "step": 5340 }, { "entropy": 5.731019973754883, "epoch": 0.41587239836607665, "grad_norm": 0.9765625, "learning_rate": 0.0004987127563678945, "loss": 5.5041, "mean_token_accuracy": 0.16602175831794738, "num_tokens": 9276872.0, "step": 5345 }, { "entropy": 5.660704183578491, "epoch": 0.4162614277377942, "grad_norm": 0.9765625, "learning_rate": 0.0004987097942313852, "loss": 5.3897, "mean_token_accuracy": 0.16859978586435317, "num_tokens": 9284556.0, "step": 5350 }, { "entropy": 5.658067750930786, "epoch": 0.41665045710951176, "grad_norm": 1.0625, "learning_rate": 0.0004987068287004355, "loss": 5.5496, "mean_token_accuracy": 0.16045835316181184, "num_tokens": 9293315.0, "step": 5355 }, { "entropy": 5.743117427825927, "epoch": 0.41703948648122935, "grad_norm": 0.99609375, "learning_rate": 0.0004987038597750909, "loss": 5.5163, "mean_token_accuracy": 0.16282073706388472, "num_tokens": 9302923.0, "step": 5360 }, { "entropy": 5.745809125900268, "epoch": 0.4174285158529469, "grad_norm": 1.046875, "learning_rate": 0.0004987008874553964, "loss": 5.4611, "mean_token_accuracy": 0.16524637937545777, "num_tokens": 9311388.0, "step": 5365 }, { "entropy": 5.652669095993042, "epoch": 0.41781754522466447, "grad_norm": 0.9140625, "learning_rate": 0.0004986979117413969, "loss": 5.4161, "mean_token_accuracy": 0.16866108775138855, "num_tokens": 9319880.0, "step": 5370 }, { "entropy": 5.64964451789856, "epoch": 0.41820657459638205, "grad_norm": 1.0390625, "learning_rate": 0.0004986949326331376, "loss": 5.5533, "mean_token_accuracy": 0.16394897997379304, "num_tokens": 9328374.0, "step": 5375 }, { "entropy": 5.802340698242188, "epoch": 0.4185956039680996, "grad_norm": 1.078125, "learning_rate": 0.0004986919501306638, "loss": 5.5123, "mean_token_accuracy": 0.1731323316693306, "num_tokens": 9336428.0, "step": 5380 }, { "entropy": 5.649902200698852, "epoch": 0.41898463333981717, "grad_norm": 0.890625, "learning_rate": 0.0004986889642340207, "loss": 5.5978, "mean_token_accuracy": 0.16033813655376433, "num_tokens": 9345794.0, "step": 5385 }, { "entropy": 5.750280857086182, "epoch": 0.4193736627115347, "grad_norm": 0.93359375, "learning_rate": 0.0004986859749432536, "loss": 5.5594, "mean_token_accuracy": 0.16315516829490662, "num_tokens": 9354724.0, "step": 5390 }, { "entropy": 5.756238889694214, "epoch": 0.4197626920832523, "grad_norm": 1.0078125, "learning_rate": 0.0004986829822584078, "loss": 5.5656, "mean_token_accuracy": 0.15743476301431655, "num_tokens": 9364008.0, "step": 5395 }, { "entropy": 5.707322835922241, "epoch": 0.4201517214549699, "grad_norm": 1.0234375, "learning_rate": 0.0004986799861795289, "loss": 5.5339, "mean_token_accuracy": 0.1696193978190422, "num_tokens": 9372409.0, "step": 5400 }, { "entropy": 5.7119945049285885, "epoch": 0.4205407508266874, "grad_norm": 0.98828125, "learning_rate": 0.0004986769867066622, "loss": 5.4935, "mean_token_accuracy": 0.15928569734096526, "num_tokens": 9381172.0, "step": 5405 }, { "entropy": 5.687317514419556, "epoch": 0.420929780198405, "grad_norm": 0.984375, "learning_rate": 0.0004986739838398532, "loss": 5.498, "mean_token_accuracy": 0.16979421973228453, "num_tokens": 9389245.0, "step": 5410 }, { "entropy": 5.674244928359985, "epoch": 0.4213188095701225, "grad_norm": 0.97265625, "learning_rate": 0.0004986709775791475, "loss": 5.5252, "mean_token_accuracy": 0.1654878482222557, "num_tokens": 9397954.0, "step": 5415 }, { "entropy": 5.690672397613525, "epoch": 0.4217078389418401, "grad_norm": 0.96875, "learning_rate": 0.0004986679679245907, "loss": 5.6287, "mean_token_accuracy": 0.16026378571987152, "num_tokens": 9406986.0, "step": 5420 }, { "entropy": 5.717019557952881, "epoch": 0.4220968683135577, "grad_norm": 1.0234375, "learning_rate": 0.0004986649548762286, "loss": 5.5742, "mean_token_accuracy": 0.1631506010890007, "num_tokens": 9415163.0, "step": 5425 }, { "entropy": 5.661070251464844, "epoch": 0.4224858976852752, "grad_norm": 0.9375, "learning_rate": 0.0004986619384341066, "loss": 5.4088, "mean_token_accuracy": 0.1779765322804451, "num_tokens": 9423422.0, "step": 5430 }, { "entropy": 5.645610094070435, "epoch": 0.4228749270569928, "grad_norm": 0.984375, "learning_rate": 0.0004986589185982708, "loss": 5.4398, "mean_token_accuracy": 0.1771764948964119, "num_tokens": 9431349.0, "step": 5435 }, { "entropy": 5.688213777542114, "epoch": 0.42326395642871034, "grad_norm": 0.99609375, "learning_rate": 0.0004986558953687671, "loss": 5.5416, "mean_token_accuracy": 0.1582077220082283, "num_tokens": 9439715.0, "step": 5440 }, { "entropy": 5.704529523849487, "epoch": 0.42365298580042793, "grad_norm": 0.99609375, "learning_rate": 0.0004986528687456409, "loss": 5.5438, "mean_token_accuracy": 0.16103184521198272, "num_tokens": 9448216.0, "step": 5445 }, { "entropy": 5.721759462356568, "epoch": 0.4240420151721455, "grad_norm": 1.046875, "learning_rate": 0.0004986498387289384, "loss": 5.4833, "mean_token_accuracy": 0.16496723741292954, "num_tokens": 9456346.0, "step": 5450 }, { "entropy": 5.695312547683716, "epoch": 0.42443104454386305, "grad_norm": 1.0078125, "learning_rate": 0.0004986468053187058, "loss": 5.5504, "mean_token_accuracy": 0.16503108739852906, "num_tokens": 9465476.0, "step": 5455 }, { "entropy": 5.706718254089355, "epoch": 0.42482007391558063, "grad_norm": 0.93359375, "learning_rate": 0.0004986437685149887, "loss": 5.612, "mean_token_accuracy": 0.15952038690447806, "num_tokens": 9474582.0, "step": 5460 }, { "entropy": 5.746453380584716, "epoch": 0.4252091032872982, "grad_norm": 1.0, "learning_rate": 0.0004986407283178334, "loss": 5.4859, "mean_token_accuracy": 0.1622675821185112, "num_tokens": 9482801.0, "step": 5465 }, { "entropy": 5.641479969024658, "epoch": 0.42559813265901575, "grad_norm": 1.078125, "learning_rate": 0.0004986376847272861, "loss": 5.5206, "mean_token_accuracy": 0.16077911108732224, "num_tokens": 9490894.0, "step": 5470 }, { "entropy": 5.651269340515137, "epoch": 0.42598716203073334, "grad_norm": 0.953125, "learning_rate": 0.0004986346377433929, "loss": 5.4734, "mean_token_accuracy": 0.16265116333961488, "num_tokens": 9499414.0, "step": 5475 }, { "entropy": 5.661998271942139, "epoch": 0.42637619140245087, "grad_norm": 0.94921875, "learning_rate": 0.0004986315873661999, "loss": 5.442, "mean_token_accuracy": 0.16423789411783218, "num_tokens": 9508945.0, "step": 5480 }, { "entropy": 5.670542764663696, "epoch": 0.42676522077416845, "grad_norm": 0.97265625, "learning_rate": 0.0004986285335957536, "loss": 5.5177, "mean_token_accuracy": 0.16872450709342957, "num_tokens": 9517833.0, "step": 5485 }, { "entropy": 5.726272010803223, "epoch": 0.42715425014588604, "grad_norm": 1.015625, "learning_rate": 0.0004986254764321002, "loss": 5.6532, "mean_token_accuracy": 0.15438937693834304, "num_tokens": 9526551.0, "step": 5490 }, { "entropy": 5.655402517318725, "epoch": 0.42754327951760357, "grad_norm": 0.97265625, "learning_rate": 0.0004986224158752861, "loss": 5.4257, "mean_token_accuracy": 0.16619780510663987, "num_tokens": 9535224.0, "step": 5495 }, { "entropy": 5.705122661590576, "epoch": 0.42793230888932116, "grad_norm": 0.9453125, "learning_rate": 0.0004986193519253578, "loss": 5.5366, "mean_token_accuracy": 0.154195199906826, "num_tokens": 9544466.0, "step": 5500 }, { "entropy": 5.6616448879241945, "epoch": 0.4283213382610387, "grad_norm": 0.95703125, "learning_rate": 0.0004986162845823618, "loss": 5.5371, "mean_token_accuracy": 0.16176573187112808, "num_tokens": 9553520.0, "step": 5505 }, { "entropy": 5.68340654373169, "epoch": 0.4287103676327563, "grad_norm": 1.03125, "learning_rate": 0.0004986132138463446, "loss": 5.4413, "mean_token_accuracy": 0.17152554541826248, "num_tokens": 9562053.0, "step": 5510 }, { "entropy": 5.66190538406372, "epoch": 0.42909939700447386, "grad_norm": 0.97265625, "learning_rate": 0.0004986101397173528, "loss": 5.4353, "mean_token_accuracy": 0.16798286885023117, "num_tokens": 9570632.0, "step": 5515 }, { "entropy": 5.724105596542358, "epoch": 0.4294884263761914, "grad_norm": 1.015625, "learning_rate": 0.000498607062195433, "loss": 5.4348, "mean_token_accuracy": 0.17020454853773118, "num_tokens": 9578739.0, "step": 5520 }, { "entropy": 5.612820720672607, "epoch": 0.429877455747909, "grad_norm": 0.93359375, "learning_rate": 0.000498603981280632, "loss": 5.4649, "mean_token_accuracy": 0.16295552998781204, "num_tokens": 9587314.0, "step": 5525 }, { "entropy": 5.702166795730591, "epoch": 0.4302664851196265, "grad_norm": 0.98046875, "learning_rate": 0.0004986008969729964, "loss": 5.5272, "mean_token_accuracy": 0.16558773517608644, "num_tokens": 9595954.0, "step": 5530 }, { "entropy": 5.751034450531006, "epoch": 0.4306555144913441, "grad_norm": 1.015625, "learning_rate": 0.0004985978092725731, "loss": 5.5447, "mean_token_accuracy": 0.15605991929769517, "num_tokens": 9604767.0, "step": 5535 }, { "entropy": 5.632840204238891, "epoch": 0.4310445438630617, "grad_norm": 0.98828125, "learning_rate": 0.000498594718179409, "loss": 5.4079, "mean_token_accuracy": 0.16811801493167877, "num_tokens": 9613173.0, "step": 5540 }, { "entropy": 5.7372047901153564, "epoch": 0.4314335732347792, "grad_norm": 0.953125, "learning_rate": 0.0004985916236935508, "loss": 5.5031, "mean_token_accuracy": 0.16015706434845925, "num_tokens": 9622777.0, "step": 5545 }, { "entropy": 5.673089981079102, "epoch": 0.4318226026064968, "grad_norm": 1.0546875, "learning_rate": 0.0004985885258150458, "loss": 5.4563, "mean_token_accuracy": 0.16085392683744432, "num_tokens": 9631019.0, "step": 5550 }, { "entropy": 5.653888320922851, "epoch": 0.43221163197821433, "grad_norm": 0.9296875, "learning_rate": 0.0004985854245439408, "loss": 5.5169, "mean_token_accuracy": 0.15890958905220032, "num_tokens": 9639797.0, "step": 5555 }, { "entropy": 5.694570541381836, "epoch": 0.4326006613499319, "grad_norm": 1.0625, "learning_rate": 0.0004985823198802827, "loss": 5.4995, "mean_token_accuracy": 0.16874769777059556, "num_tokens": 9648393.0, "step": 5560 }, { "entropy": 5.712398386001587, "epoch": 0.4329896907216495, "grad_norm": 0.96875, "learning_rate": 0.0004985792118241188, "loss": 5.4821, "mean_token_accuracy": 0.1667462021112442, "num_tokens": 9657260.0, "step": 5565 }, { "entropy": 5.654960584640503, "epoch": 0.43337872009336703, "grad_norm": 0.98046875, "learning_rate": 0.0004985761003754961, "loss": 5.5491, "mean_token_accuracy": 0.16649328768253327, "num_tokens": 9665883.0, "step": 5570 }, { "entropy": 5.7316896438598635, "epoch": 0.4337677494650846, "grad_norm": 1.03125, "learning_rate": 0.0004985729855344622, "loss": 5.5645, "mean_token_accuracy": 0.1632181152701378, "num_tokens": 9674100.0, "step": 5575 }, { "entropy": 5.70767560005188, "epoch": 0.4341567788368022, "grad_norm": 0.9453125, "learning_rate": 0.000498569867301064, "loss": 5.5275, "mean_token_accuracy": 0.1664811134338379, "num_tokens": 9683236.0, "step": 5580 }, { "entropy": 5.661159086227417, "epoch": 0.43454580820851973, "grad_norm": 0.93359375, "learning_rate": 0.0004985667456753489, "loss": 5.4882, "mean_token_accuracy": 0.1633784294128418, "num_tokens": 9692076.0, "step": 5585 }, { "entropy": 5.708376789093018, "epoch": 0.4349348375802373, "grad_norm": 1.0078125, "learning_rate": 0.0004985636206573642, "loss": 5.5367, "mean_token_accuracy": 0.16655746847391129, "num_tokens": 9700266.0, "step": 5590 }, { "entropy": 5.7091821193695065, "epoch": 0.43532386695195485, "grad_norm": 0.9921875, "learning_rate": 0.0004985604922471575, "loss": 5.4921, "mean_token_accuracy": 0.16823821514844894, "num_tokens": 9708643.0, "step": 5595 }, { "entropy": 5.710525894165039, "epoch": 0.43571289632367244, "grad_norm": 0.95703125, "learning_rate": 0.0004985573604447761, "loss": 5.5321, "mean_token_accuracy": 0.16186349242925643, "num_tokens": 9717459.0, "step": 5600 }, { "entropy": 5.641446352005005, "epoch": 0.43610192569539, "grad_norm": 0.99609375, "learning_rate": 0.0004985542252502676, "loss": 5.4471, "mean_token_accuracy": 0.16886800825595855, "num_tokens": 9726251.0, "step": 5605 }, { "entropy": 5.5887237071990965, "epoch": 0.43649095506710756, "grad_norm": 0.98828125, "learning_rate": 0.0004985510866636796, "loss": 5.4351, "mean_token_accuracy": 0.16684530675411224, "num_tokens": 9735327.0, "step": 5610 }, { "entropy": 5.692466068267822, "epoch": 0.43687998443882514, "grad_norm": 0.98046875, "learning_rate": 0.0004985479446850596, "loss": 5.5955, "mean_token_accuracy": 0.1570721372961998, "num_tokens": 9743642.0, "step": 5615 }, { "entropy": 5.708640003204346, "epoch": 0.4372690138105427, "grad_norm": 0.96875, "learning_rate": 0.0004985447993144554, "loss": 5.4528, "mean_token_accuracy": 0.16921658664941788, "num_tokens": 9752235.0, "step": 5620 }, { "entropy": 5.721048498153687, "epoch": 0.43765804318226026, "grad_norm": 0.9296875, "learning_rate": 0.0004985416505519147, "loss": 5.5436, "mean_token_accuracy": 0.15602369606494904, "num_tokens": 9761012.0, "step": 5625 }, { "entropy": 5.660058546066284, "epoch": 0.43804707255397785, "grad_norm": 0.99609375, "learning_rate": 0.0004985384983974853, "loss": 5.4967, "mean_token_accuracy": 0.16976085305213928, "num_tokens": 9769810.0, "step": 5630 }, { "entropy": 5.696043157577515, "epoch": 0.4384361019256954, "grad_norm": 0.9765625, "learning_rate": 0.0004985353428512148, "loss": 5.4427, "mean_token_accuracy": 0.16465951800346373, "num_tokens": 9778186.0, "step": 5635 }, { "entropy": 5.6428123950958256, "epoch": 0.43882513129741296, "grad_norm": 1.0078125, "learning_rate": 0.0004985321839131514, "loss": 5.5107, "mean_token_accuracy": 0.1715571776032448, "num_tokens": 9786456.0, "step": 5640 }, { "entropy": 5.6313409328460695, "epoch": 0.4392141606691305, "grad_norm": 0.99609375, "learning_rate": 0.0004985290215833428, "loss": 5.5105, "mean_token_accuracy": 0.16007644087076187, "num_tokens": 9794613.0, "step": 5645 }, { "entropy": 5.772847032546997, "epoch": 0.4396031900408481, "grad_norm": 1.0, "learning_rate": 0.0004985258558618372, "loss": 5.4253, "mean_token_accuracy": 0.16906558126211166, "num_tokens": 9803388.0, "step": 5650 }, { "entropy": 5.686429882049561, "epoch": 0.43999221941256567, "grad_norm": 1.1015625, "learning_rate": 0.0004985226867486825, "loss": 5.4927, "mean_token_accuracy": 0.16778526455163956, "num_tokens": 9812450.0, "step": 5655 }, { "entropy": 5.697888708114624, "epoch": 0.4403812487842832, "grad_norm": 1.0078125, "learning_rate": 0.0004985195142439267, "loss": 5.5822, "mean_token_accuracy": 0.15718315094709395, "num_tokens": 9821377.0, "step": 5660 }, { "entropy": 5.705540800094605, "epoch": 0.4407702781560008, "grad_norm": 1.0234375, "learning_rate": 0.0004985163383476181, "loss": 5.4875, "mean_token_accuracy": 0.1577681854367256, "num_tokens": 9829761.0, "step": 5665 }, { "entropy": 5.733972978591919, "epoch": 0.44115930752771837, "grad_norm": 0.9609375, "learning_rate": 0.0004985131590598048, "loss": 5.5511, "mean_token_accuracy": 0.1609368309378624, "num_tokens": 9838921.0, "step": 5670 }, { "entropy": 5.6359227180480955, "epoch": 0.4415483368994359, "grad_norm": 1.015625, "learning_rate": 0.0004985099763805352, "loss": 5.3777, "mean_token_accuracy": 0.17368233948946, "num_tokens": 9846822.0, "step": 5675 }, { "entropy": 5.72635440826416, "epoch": 0.4419373662711535, "grad_norm": 1.015625, "learning_rate": 0.0004985067903098574, "loss": 5.5993, "mean_token_accuracy": 0.16365385204553604, "num_tokens": 9855951.0, "step": 5680 }, { "entropy": 5.744476556777954, "epoch": 0.442326395642871, "grad_norm": 1.0, "learning_rate": 0.0004985036008478197, "loss": 5.5551, "mean_token_accuracy": 0.1636480838060379, "num_tokens": 9864875.0, "step": 5685 }, { "entropy": 5.712133169174194, "epoch": 0.4427154250145886, "grad_norm": 1.125, "learning_rate": 0.0004985004079944707, "loss": 5.5163, "mean_token_accuracy": 0.16914052963256837, "num_tokens": 9873785.0, "step": 5690 }, { "entropy": 5.688980293273926, "epoch": 0.4431044543863062, "grad_norm": 1.0390625, "learning_rate": 0.0004984972117498587, "loss": 5.5177, "mean_token_accuracy": 0.16533356308937072, "num_tokens": 9883214.0, "step": 5695 }, { "entropy": 5.645994234085083, "epoch": 0.4434934837580237, "grad_norm": 1.046875, "learning_rate": 0.0004984940121140323, "loss": 5.479, "mean_token_accuracy": 0.16787913143634797, "num_tokens": 9891346.0, "step": 5700 }, { "entropy": 5.633553791046142, "epoch": 0.4438825131297413, "grad_norm": 1.0546875, "learning_rate": 0.00049849080908704, "loss": 5.4031, "mean_token_accuracy": 0.16850567013025283, "num_tokens": 9900646.0, "step": 5705 }, { "entropy": 5.717324352264404, "epoch": 0.44427154250145884, "grad_norm": 0.9921875, "learning_rate": 0.0004984876026689302, "loss": 5.5555, "mean_token_accuracy": 0.16231814920902252, "num_tokens": 9910851.0, "step": 5710 }, { "entropy": 5.761937665939331, "epoch": 0.4446605718731764, "grad_norm": 1.03125, "learning_rate": 0.000498484392859752, "loss": 5.5562, "mean_token_accuracy": 0.16021174788475037, "num_tokens": 9919919.0, "step": 5715 }, { "entropy": 5.69112377166748, "epoch": 0.445049601244894, "grad_norm": 1.0859375, "learning_rate": 0.0004984811796595538, "loss": 5.4923, "mean_token_accuracy": 0.16262091994285582, "num_tokens": 9928831.0, "step": 5720 }, { "entropy": 5.654398727416992, "epoch": 0.44543863061661154, "grad_norm": 1.0078125, "learning_rate": 0.0004984779630683843, "loss": 5.4547, "mean_token_accuracy": 0.1687433198094368, "num_tokens": 9936840.0, "step": 5725 }, { "entropy": 5.6957135677337645, "epoch": 0.44582765998832913, "grad_norm": 0.9140625, "learning_rate": 0.0004984747430862924, "loss": 5.5298, "mean_token_accuracy": 0.16438896656036378, "num_tokens": 9945845.0, "step": 5730 }, { "entropy": 5.732899951934814, "epoch": 0.44621668936004666, "grad_norm": 0.953125, "learning_rate": 0.0004984715197133271, "loss": 5.5126, "mean_token_accuracy": 0.16476755142211913, "num_tokens": 9955176.0, "step": 5735 }, { "entropy": 5.601716375350952, "epoch": 0.44660571873176425, "grad_norm": 1.0234375, "learning_rate": 0.0004984682929495371, "loss": 5.4027, "mean_token_accuracy": 0.16928163319826126, "num_tokens": 9963182.0, "step": 5740 }, { "entropy": 5.685400867462159, "epoch": 0.44699474810348183, "grad_norm": 0.94921875, "learning_rate": 0.0004984650627949715, "loss": 5.5542, "mean_token_accuracy": 0.16373046189546586, "num_tokens": 9971239.0, "step": 5745 }, { "entropy": 5.712329864501953, "epoch": 0.44738377747519936, "grad_norm": 0.95703125, "learning_rate": 0.0004984618292496792, "loss": 5.5029, "mean_token_accuracy": 0.16495627909898758, "num_tokens": 9980285.0, "step": 5750 }, { "entropy": 5.7070457458496096, "epoch": 0.44777280684691695, "grad_norm": 0.94921875, "learning_rate": 0.0004984585923137093, "loss": 5.516, "mean_token_accuracy": 0.16542391180992128, "num_tokens": 9988922.0, "step": 5755 }, { "entropy": 5.711098575592041, "epoch": 0.4481618362186345, "grad_norm": 0.9765625, "learning_rate": 0.000498455351987111, "loss": 5.5938, "mean_token_accuracy": 0.1608327105641365, "num_tokens": 9998538.0, "step": 5760 }, { "entropy": 5.81380786895752, "epoch": 0.44855086559035207, "grad_norm": 0.94140625, "learning_rate": 0.0004984521082699333, "loss": 5.4965, "mean_token_accuracy": 0.16169293075799943, "num_tokens": 10006646.0, "step": 5765 }, { "entropy": 5.657651472091675, "epoch": 0.44893989496206965, "grad_norm": 0.9765625, "learning_rate": 0.0004984488611622256, "loss": 5.4764, "mean_token_accuracy": 0.1706524446606636, "num_tokens": 10016511.0, "step": 5770 }, { "entropy": 5.626505661010742, "epoch": 0.4493289243337872, "grad_norm": 0.96875, "learning_rate": 0.000498445610664037, "loss": 5.3888, "mean_token_accuracy": 0.16900736689567566, "num_tokens": 10025223.0, "step": 5775 }, { "entropy": 5.618741846084594, "epoch": 0.44971795370550477, "grad_norm": 0.98828125, "learning_rate": 0.000498442356775417, "loss": 5.4751, "mean_token_accuracy": 0.16690605729818345, "num_tokens": 10033678.0, "step": 5780 }, { "entropy": 5.664579105377197, "epoch": 0.45010698307722236, "grad_norm": 0.9921875, "learning_rate": 0.0004984390994964148, "loss": 5.3964, "mean_token_accuracy": 0.16832560449838638, "num_tokens": 10042028.0, "step": 5785 }, { "entropy": 5.711661767959595, "epoch": 0.4504960124489399, "grad_norm": 0.9765625, "learning_rate": 0.00049843583882708, "loss": 5.5481, "mean_token_accuracy": 0.16350454241037368, "num_tokens": 10050758.0, "step": 5790 }, { "entropy": 5.591366386413574, "epoch": 0.4508850418206575, "grad_norm": 1.046875, "learning_rate": 0.000498432574767462, "loss": 5.3269, "mean_token_accuracy": 0.17831166684627534, "num_tokens": 10058688.0, "step": 5795 }, { "entropy": 5.621751403808593, "epoch": 0.451274071192375, "grad_norm": 0.984375, "learning_rate": 0.0004984293073176103, "loss": 5.4197, "mean_token_accuracy": 0.17680519819259644, "num_tokens": 10067302.0, "step": 5800 }, { "entropy": 5.620537376403808, "epoch": 0.4516631005640926, "grad_norm": 0.9453125, "learning_rate": 0.0004984260364775744, "loss": 5.4157, "mean_token_accuracy": 0.1698002278804779, "num_tokens": 10076424.0, "step": 5805 }, { "entropy": 5.689474725723267, "epoch": 0.4520521299358102, "grad_norm": 0.8671875, "learning_rate": 0.000498422762247404, "loss": 5.5609, "mean_token_accuracy": 0.16164169758558272, "num_tokens": 10086307.0, "step": 5810 }, { "entropy": 5.6550195693969725, "epoch": 0.4524411593075277, "grad_norm": 0.99609375, "learning_rate": 0.0004984194846271489, "loss": 5.4124, "mean_token_accuracy": 0.16617335975170136, "num_tokens": 10094954.0, "step": 5815 }, { "entropy": 5.625373649597168, "epoch": 0.4528301886792453, "grad_norm": 0.97265625, "learning_rate": 0.0004984162036168586, "loss": 5.5063, "mean_token_accuracy": 0.1653664916753769, "num_tokens": 10104401.0, "step": 5820 }, { "entropy": 5.585896444320679, "epoch": 0.4532192180509628, "grad_norm": 0.9921875, "learning_rate": 0.0004984129192165831, "loss": 5.5119, "mean_token_accuracy": 0.16613335609436036, "num_tokens": 10112596.0, "step": 5825 }, { "entropy": 5.704642724990845, "epoch": 0.4536082474226804, "grad_norm": 0.97265625, "learning_rate": 0.0004984096314263722, "loss": 5.5643, "mean_token_accuracy": 0.16454292684793473, "num_tokens": 10121311.0, "step": 5830 }, { "entropy": 5.630156230926514, "epoch": 0.453997276794398, "grad_norm": 0.9765625, "learning_rate": 0.0004984063402462757, "loss": 5.3555, "mean_token_accuracy": 0.17521204501390458, "num_tokens": 10130010.0, "step": 5835 }, { "entropy": 5.6026153564453125, "epoch": 0.45438630616611553, "grad_norm": 0.96875, "learning_rate": 0.0004984030456763435, "loss": 5.4706, "mean_token_accuracy": 0.1734953925013542, "num_tokens": 10138473.0, "step": 5840 }, { "entropy": 5.762540626525879, "epoch": 0.4547753355378331, "grad_norm": 1.046875, "learning_rate": 0.0004983997477166257, "loss": 5.54, "mean_token_accuracy": 0.16557761579751967, "num_tokens": 10146843.0, "step": 5845 }, { "entropy": 5.585455226898193, "epoch": 0.45516436490955064, "grad_norm": 0.9765625, "learning_rate": 0.0004983964463671723, "loss": 5.4082, "mean_token_accuracy": 0.17130711823701858, "num_tokens": 10155319.0, "step": 5850 }, { "entropy": 5.660451078414917, "epoch": 0.45555339428126823, "grad_norm": 0.9453125, "learning_rate": 0.0004983931416280334, "loss": 5.5784, "mean_token_accuracy": 0.15584017261862754, "num_tokens": 10164308.0, "step": 5855 }, { "entropy": 5.755096054077148, "epoch": 0.4559424236529858, "grad_norm": 0.98046875, "learning_rate": 0.0004983898334992591, "loss": 5.5853, "mean_token_accuracy": 0.16000744700431824, "num_tokens": 10173173.0, "step": 5860 }, { "entropy": 5.678262710571289, "epoch": 0.45633145302470335, "grad_norm": 0.98828125, "learning_rate": 0.0004983865219808998, "loss": 5.489, "mean_token_accuracy": 0.16422337144613267, "num_tokens": 10181376.0, "step": 5865 }, { "entropy": 5.746049976348877, "epoch": 0.45672048239642093, "grad_norm": 1.0390625, "learning_rate": 0.0004983832070730055, "loss": 5.5995, "mean_token_accuracy": 0.16115534156560898, "num_tokens": 10189701.0, "step": 5870 }, { "entropy": 5.6774920463562015, "epoch": 0.4571095117681385, "grad_norm": 0.97265625, "learning_rate": 0.0004983798887756265, "loss": 5.4579, "mean_token_accuracy": 0.1671434983611107, "num_tokens": 10198721.0, "step": 5875 }, { "entropy": 5.598591899871826, "epoch": 0.45749854113985605, "grad_norm": 1.0703125, "learning_rate": 0.0004983765670888133, "loss": 5.3462, "mean_token_accuracy": 0.17291613519191742, "num_tokens": 10206428.0, "step": 5880 }, { "entropy": 5.562051773071289, "epoch": 0.45788757051157364, "grad_norm": 0.98828125, "learning_rate": 0.0004983732420126163, "loss": 5.4937, "mean_token_accuracy": 0.16735068559646607, "num_tokens": 10214941.0, "step": 5885 }, { "entropy": 5.686462688446045, "epoch": 0.45827659988329117, "grad_norm": 0.98828125, "learning_rate": 0.0004983699135470858, "loss": 5.4916, "mean_token_accuracy": 0.16933013796806334, "num_tokens": 10223491.0, "step": 5890 }, { "entropy": 5.685241460800171, "epoch": 0.45866562925500876, "grad_norm": 1.0234375, "learning_rate": 0.0004983665816922723, "loss": 5.4304, "mean_token_accuracy": 0.16738610714673996, "num_tokens": 10231820.0, "step": 5895 }, { "entropy": 5.642031812667847, "epoch": 0.45905465862672634, "grad_norm": 0.9921875, "learning_rate": 0.0004983632464482267, "loss": 5.4196, "mean_token_accuracy": 0.17414960265159607, "num_tokens": 10239781.0, "step": 5900 }, { "entropy": 5.657448434829712, "epoch": 0.4594436879984439, "grad_norm": 1.046875, "learning_rate": 0.0004983599078149991, "loss": 5.4475, "mean_token_accuracy": 0.1785872086882591, "num_tokens": 10248093.0, "step": 5905 }, { "entropy": 5.702689075469971, "epoch": 0.45983271737016146, "grad_norm": 1.03125, "learning_rate": 0.0004983565657926405, "loss": 5.4636, "mean_token_accuracy": 0.16945738792419435, "num_tokens": 10256370.0, "step": 5910 }, { "entropy": 5.615186977386474, "epoch": 0.460221746741879, "grad_norm": 1.015625, "learning_rate": 0.0004983532203812017, "loss": 5.4399, "mean_token_accuracy": 0.16275497525930405, "num_tokens": 10264924.0, "step": 5915 }, { "entropy": 5.643068838119507, "epoch": 0.4606107761135966, "grad_norm": 1.03125, "learning_rate": 0.0004983498715807331, "loss": 5.3804, "mean_token_accuracy": 0.1671242117881775, "num_tokens": 10273488.0, "step": 5920 }, { "entropy": 5.668789386749268, "epoch": 0.46099980548531416, "grad_norm": 0.98828125, "learning_rate": 0.0004983465193912857, "loss": 5.4632, "mean_token_accuracy": 0.16634155362844466, "num_tokens": 10281534.0, "step": 5925 }, { "entropy": 5.668724584579468, "epoch": 0.4613888348570317, "grad_norm": 1.0234375, "learning_rate": 0.0004983431638129104, "loss": 5.5026, "mean_token_accuracy": 0.16119295507669448, "num_tokens": 10289613.0, "step": 5930 }, { "entropy": 5.717075490951538, "epoch": 0.4617778642287493, "grad_norm": 1.0078125, "learning_rate": 0.0004983398048456581, "loss": 5.5491, "mean_token_accuracy": 0.1646980419754982, "num_tokens": 10299027.0, "step": 5935 }, { "entropy": 5.717835378646851, "epoch": 0.4621668936004668, "grad_norm": 0.99609375, "learning_rate": 0.0004983364424895796, "loss": 5.5061, "mean_token_accuracy": 0.16248458176851271, "num_tokens": 10308727.0, "step": 5940 }, { "entropy": 5.725033092498779, "epoch": 0.4625559229721844, "grad_norm": 0.97265625, "learning_rate": 0.0004983330767447262, "loss": 5.5373, "mean_token_accuracy": 0.16755590587854385, "num_tokens": 10318129.0, "step": 5945 }, { "entropy": 5.624452114105225, "epoch": 0.462944952343902, "grad_norm": 1.0546875, "learning_rate": 0.0004983297076111489, "loss": 5.3765, "mean_token_accuracy": 0.17445236146450044, "num_tokens": 10326504.0, "step": 5950 }, { "entropy": 5.594799041748047, "epoch": 0.4633339817156195, "grad_norm": 1.0546875, "learning_rate": 0.0004983263350888987, "loss": 5.4356, "mean_token_accuracy": 0.17249158918857574, "num_tokens": 10334585.0, "step": 5955 }, { "entropy": 5.618805265426635, "epoch": 0.4637230110873371, "grad_norm": 1.03125, "learning_rate": 0.0004983229591780268, "loss": 5.4586, "mean_token_accuracy": 0.1713235542178154, "num_tokens": 10343328.0, "step": 5960 }, { "entropy": 5.618730592727661, "epoch": 0.46411204045905463, "grad_norm": 0.98046875, "learning_rate": 0.0004983195798785844, "loss": 5.4736, "mean_token_accuracy": 0.1642005518078804, "num_tokens": 10352289.0, "step": 5965 }, { "entropy": 5.745180225372314, "epoch": 0.4645010698307722, "grad_norm": 0.9921875, "learning_rate": 0.0004983161971906228, "loss": 5.5841, "mean_token_accuracy": 0.15788466483354568, "num_tokens": 10360847.0, "step": 5970 }, { "entropy": 5.670765161514282, "epoch": 0.4648900992024898, "grad_norm": 0.9921875, "learning_rate": 0.0004983128111141935, "loss": 5.4975, "mean_token_accuracy": 0.16726861894130707, "num_tokens": 10368911.0, "step": 5975 }, { "entropy": 5.621411466598511, "epoch": 0.46527912857420733, "grad_norm": 1.046875, "learning_rate": 0.0004983094216493475, "loss": 5.4432, "mean_token_accuracy": 0.17352777272462844, "num_tokens": 10377257.0, "step": 5980 }, { "entropy": 5.66666350364685, "epoch": 0.4656681579459249, "grad_norm": 0.87890625, "learning_rate": 0.0004983060287961367, "loss": 5.4989, "mean_token_accuracy": 0.1640869066119194, "num_tokens": 10386167.0, "step": 5985 }, { "entropy": 5.660472679138183, "epoch": 0.4660571873176425, "grad_norm": 0.921875, "learning_rate": 0.0004983026325546123, "loss": 5.3912, "mean_token_accuracy": 0.164736832678318, "num_tokens": 10395802.0, "step": 5990 }, { "entropy": 5.6535501956939695, "epoch": 0.46644621668936004, "grad_norm": 0.9609375, "learning_rate": 0.0004982992329248257, "loss": 5.5194, "mean_token_accuracy": 0.16232506781816483, "num_tokens": 10404836.0, "step": 5995 }, { "entropy": 5.737968635559082, "epoch": 0.4668352460610776, "grad_norm": 0.953125, "learning_rate": 0.0004982958299068289, "loss": 5.493, "mean_token_accuracy": 0.16429309397935868, "num_tokens": 10413394.0, "step": 6000 }, { "epoch": 0.4668352460610776, "eval_entropy": 5.495044304110662, "eval_loss": 5.507410049438477, "eval_mean_token_accuracy": 0.17327504654821005, "eval_num_tokens": 10413394.0, "eval_runtime": 21.5979, "eval_samples_per_second": 1924.173, "eval_steps_per_second": 240.533, "step": 6000 }, { "entropy": 5.611471319198609, "epoch": 0.46722427543279516, "grad_norm": 0.98828125, "learning_rate": 0.000498292423500673, "loss": 5.3977, "mean_token_accuracy": 0.17447368502616883, "num_tokens": 10421916.0, "step": 6005 }, { "entropy": 5.626347494125366, "epoch": 0.46761330480451274, "grad_norm": 0.95703125, "learning_rate": 0.0004982890137064102, "loss": 5.4753, "mean_token_accuracy": 0.16418679058551788, "num_tokens": 10430703.0, "step": 6010 }, { "entropy": 5.704648208618164, "epoch": 0.46800233417623033, "grad_norm": 0.99609375, "learning_rate": 0.000498285600524092, "loss": 5.5136, "mean_token_accuracy": 0.16784841120243071, "num_tokens": 10439523.0, "step": 6015 }, { "entropy": 5.648009967803955, "epoch": 0.46839136354794786, "grad_norm": 1.0078125, "learning_rate": 0.0004982821839537701, "loss": 5.4241, "mean_token_accuracy": 0.17214948534965516, "num_tokens": 10447777.0, "step": 6020 }, { "entropy": 5.638533878326416, "epoch": 0.46878039291966545, "grad_norm": 0.96875, "learning_rate": 0.0004982787639954966, "loss": 5.3972, "mean_token_accuracy": 0.1707349255681038, "num_tokens": 10456105.0, "step": 6025 }, { "entropy": 5.68563323020935, "epoch": 0.469169422291383, "grad_norm": 1.078125, "learning_rate": 0.0004982753406493232, "loss": 5.4491, "mean_token_accuracy": 0.1683100551366806, "num_tokens": 10464590.0, "step": 6030 }, { "entropy": 5.686050891876221, "epoch": 0.46955845166310056, "grad_norm": 1.109375, "learning_rate": 0.0004982719139153018, "loss": 5.4714, "mean_token_accuracy": 0.1673478290438652, "num_tokens": 10472702.0, "step": 6035 }, { "entropy": 5.570622825622559, "epoch": 0.46994748103481815, "grad_norm": 0.99609375, "learning_rate": 0.0004982684837934845, "loss": 5.4005, "mean_token_accuracy": 0.1666673019528389, "num_tokens": 10480682.0, "step": 6040 }, { "entropy": 5.721953248977661, "epoch": 0.4703365104065357, "grad_norm": 1.109375, "learning_rate": 0.0004982650502839234, "loss": 5.4953, "mean_token_accuracy": 0.1655719682574272, "num_tokens": 10488873.0, "step": 6045 }, { "entropy": 5.685389995574951, "epoch": 0.47072553977825327, "grad_norm": 1.0078125, "learning_rate": 0.0004982616133866705, "loss": 5.4602, "mean_token_accuracy": 0.1705882355570793, "num_tokens": 10497077.0, "step": 6050 }, { "entropy": 5.664164638519287, "epoch": 0.4711145691499708, "grad_norm": 0.96875, "learning_rate": 0.0004982581731017779, "loss": 5.4511, "mean_token_accuracy": 0.16683453023433686, "num_tokens": 10506072.0, "step": 6055 }, { "entropy": 5.685359239578247, "epoch": 0.4715035985216884, "grad_norm": 0.9609375, "learning_rate": 0.0004982547294292979, "loss": 5.5081, "mean_token_accuracy": 0.16408928632736205, "num_tokens": 10515175.0, "step": 6060 }, { "entropy": 5.6141149520874025, "epoch": 0.47189262789340597, "grad_norm": 1.078125, "learning_rate": 0.0004982512823692828, "loss": 5.4006, "mean_token_accuracy": 0.16687188446521758, "num_tokens": 10524800.0, "step": 6065 }, { "entropy": 5.649979209899902, "epoch": 0.4722816572651235, "grad_norm": 1.1015625, "learning_rate": 0.0004982478319217848, "loss": 5.5852, "mean_token_accuracy": 0.15808211714029313, "num_tokens": 10534608.0, "step": 6070 }, { "entropy": 5.745941495895385, "epoch": 0.4726706866368411, "grad_norm": 0.9609375, "learning_rate": 0.0004982443780868562, "loss": 5.4897, "mean_token_accuracy": 0.16620081812143325, "num_tokens": 10542992.0, "step": 6075 }, { "entropy": 5.67744812965393, "epoch": 0.4730597160085587, "grad_norm": 1.0625, "learning_rate": 0.0004982409208645496, "loss": 5.4874, "mean_token_accuracy": 0.16672162860631942, "num_tokens": 10551682.0, "step": 6080 }, { "entropy": 5.611584854125977, "epoch": 0.4734487453802762, "grad_norm": 0.953125, "learning_rate": 0.0004982374602549173, "loss": 5.4447, "mean_token_accuracy": 0.16964718252420424, "num_tokens": 10560556.0, "step": 6085 }, { "entropy": 5.694293689727783, "epoch": 0.4738377747519938, "grad_norm": 1.0234375, "learning_rate": 0.0004982339962580119, "loss": 5.6142, "mean_token_accuracy": 0.15800638645887374, "num_tokens": 10569361.0, "step": 6090 }, { "entropy": 5.607173299789428, "epoch": 0.4742268041237113, "grad_norm": 0.9921875, "learning_rate": 0.0004982305288738859, "loss": 5.4209, "mean_token_accuracy": 0.17520027309656144, "num_tokens": 10577997.0, "step": 6095 }, { "entropy": 5.687979412078858, "epoch": 0.4746158334954289, "grad_norm": 0.98828125, "learning_rate": 0.0004982270581025919, "loss": 5.5251, "mean_token_accuracy": 0.17112909853458405, "num_tokens": 10587005.0, "step": 6100 }, { "entropy": 5.672091341018676, "epoch": 0.4750048628671465, "grad_norm": 1.140625, "learning_rate": 0.0004982235839441826, "loss": 5.3696, "mean_token_accuracy": 0.17774538993835448, "num_tokens": 10595196.0, "step": 6105 }, { "entropy": 5.69416036605835, "epoch": 0.475393892238864, "grad_norm": 0.9921875, "learning_rate": 0.0004982201063987108, "loss": 5.5435, "mean_token_accuracy": 0.1597681984305382, "num_tokens": 10603796.0, "step": 6110 }, { "entropy": 5.689189910888672, "epoch": 0.4757829216105816, "grad_norm": 1.0, "learning_rate": 0.0004982166254662292, "loss": 5.5103, "mean_token_accuracy": 0.1657646656036377, "num_tokens": 10612895.0, "step": 6115 }, { "entropy": 5.6923877716064455, "epoch": 0.47617195098229914, "grad_norm": 1.0078125, "learning_rate": 0.0004982131411467904, "loss": 5.5651, "mean_token_accuracy": 0.16675678938627242, "num_tokens": 10621310.0, "step": 6120 }, { "entropy": 5.605409955978393, "epoch": 0.4765609803540167, "grad_norm": 1.0390625, "learning_rate": 0.0004982096534404476, "loss": 5.3864, "mean_token_accuracy": 0.16726448982954026, "num_tokens": 10629598.0, "step": 6125 }, { "entropy": 5.692520093917847, "epoch": 0.4769500097257343, "grad_norm": 1.0546875, "learning_rate": 0.0004982061623472535, "loss": 5.4087, "mean_token_accuracy": 0.17069395780563354, "num_tokens": 10638218.0, "step": 6130 }, { "entropy": 5.691115808486939, "epoch": 0.47733903909745184, "grad_norm": 1.0390625, "learning_rate": 0.0004982026678672612, "loss": 5.516, "mean_token_accuracy": 0.16282628774642943, "num_tokens": 10647215.0, "step": 6135 }, { "entropy": 5.677426338195801, "epoch": 0.47772806846916943, "grad_norm": 0.96484375, "learning_rate": 0.0004981991700005238, "loss": 5.6324, "mean_token_accuracy": 0.15961235165596008, "num_tokens": 10655755.0, "step": 6140 }, { "entropy": 5.759636735916137, "epoch": 0.47811709784088696, "grad_norm": 1.015625, "learning_rate": 0.000498195668747094, "loss": 5.5084, "mean_token_accuracy": 0.16573580950498581, "num_tokens": 10663969.0, "step": 6145 }, { "entropy": 5.6918775081634525, "epoch": 0.47850612721260455, "grad_norm": 0.96875, "learning_rate": 0.0004981921641070254, "loss": 5.3825, "mean_token_accuracy": 0.16804722398519517, "num_tokens": 10672048.0, "step": 6150 }, { "entropy": 5.608302307128906, "epoch": 0.47889515658432213, "grad_norm": 0.9296875, "learning_rate": 0.0004981886560803708, "loss": 5.4828, "mean_token_accuracy": 0.16609022319316863, "num_tokens": 10681802.0, "step": 6155 }, { "entropy": 5.6948483943939205, "epoch": 0.47928418595603967, "grad_norm": 0.96875, "learning_rate": 0.0004981851446671838, "loss": 5.545, "mean_token_accuracy": 0.15990679562091828, "num_tokens": 10690618.0, "step": 6160 }, { "entropy": 5.67942967414856, "epoch": 0.47967321532775725, "grad_norm": 0.9921875, "learning_rate": 0.0004981816298675173, "loss": 5.4514, "mean_token_accuracy": 0.17377543151378633, "num_tokens": 10699080.0, "step": 6165 }, { "entropy": 5.647350740432739, "epoch": 0.4800622446994748, "grad_norm": 0.90234375, "learning_rate": 0.0004981781116814248, "loss": 5.4539, "mean_token_accuracy": 0.16524712294340133, "num_tokens": 10708939.0, "step": 6170 }, { "entropy": 5.69949164390564, "epoch": 0.48045127407119237, "grad_norm": 1.0078125, "learning_rate": 0.0004981745901089596, "loss": 5.3711, "mean_token_accuracy": 0.1681235522031784, "num_tokens": 10717356.0, "step": 6175 }, { "entropy": 5.69394736289978, "epoch": 0.48084030344290996, "grad_norm": 1.0703125, "learning_rate": 0.0004981710651501753, "loss": 5.4605, "mean_token_accuracy": 0.16272638440132142, "num_tokens": 10725616.0, "step": 6180 }, { "entropy": 5.620643281936646, "epoch": 0.4812293328146275, "grad_norm": 0.9921875, "learning_rate": 0.0004981675368051254, "loss": 5.4527, "mean_token_accuracy": 0.16980734765529631, "num_tokens": 10734337.0, "step": 6185 }, { "entropy": 5.645343685150147, "epoch": 0.4816183621863451, "grad_norm": 0.953125, "learning_rate": 0.0004981640050738633, "loss": 5.4907, "mean_token_accuracy": 0.16745964735746383, "num_tokens": 10742720.0, "step": 6190 }, { "entropy": 5.713866233825684, "epoch": 0.48200739155806266, "grad_norm": 1.0078125, "learning_rate": 0.0004981604699564426, "loss": 5.5143, "mean_token_accuracy": 0.16125882863998414, "num_tokens": 10751809.0, "step": 6195 }, { "entropy": 5.643674039840699, "epoch": 0.4823964209297802, "grad_norm": 0.97265625, "learning_rate": 0.0004981569314529169, "loss": 5.3826, "mean_token_accuracy": 0.17199781239032746, "num_tokens": 10759879.0, "step": 6200 }, { "entropy": 5.555496120452881, "epoch": 0.4827854503014978, "grad_norm": 1.0, "learning_rate": 0.00049815338956334, "loss": 5.4444, "mean_token_accuracy": 0.16761718839406967, "num_tokens": 10769309.0, "step": 6205 }, { "entropy": 5.637994718551636, "epoch": 0.4831744796732153, "grad_norm": 1.0703125, "learning_rate": 0.0004981498442877656, "loss": 5.3933, "mean_token_accuracy": 0.17291852235794067, "num_tokens": 10777676.0, "step": 6210 }, { "entropy": 5.648993921279907, "epoch": 0.4835635090449329, "grad_norm": 1.0390625, "learning_rate": 0.0004981462956262474, "loss": 5.5845, "mean_token_accuracy": 0.16300415694713594, "num_tokens": 10786278.0, "step": 6215 }, { "entropy": 5.711193609237671, "epoch": 0.4839525384166505, "grad_norm": 0.94921875, "learning_rate": 0.0004981427435788396, "loss": 5.5147, "mean_token_accuracy": 0.1662832885980606, "num_tokens": 10795323.0, "step": 6220 }, { "entropy": 5.695321989059448, "epoch": 0.484341567788368, "grad_norm": 1.03125, "learning_rate": 0.0004981391881455957, "loss": 5.3936, "mean_token_accuracy": 0.1736224412918091, "num_tokens": 10803978.0, "step": 6225 }, { "entropy": 5.671928787231446, "epoch": 0.4847305971600856, "grad_norm": 0.9921875, "learning_rate": 0.0004981356293265696, "loss": 5.4905, "mean_token_accuracy": 0.16860363334417344, "num_tokens": 10812488.0, "step": 6230 }, { "entropy": 5.690825319290161, "epoch": 0.4851196265318031, "grad_norm": 0.94140625, "learning_rate": 0.0004981320671218157, "loss": 5.4825, "mean_token_accuracy": 0.16431137025356293, "num_tokens": 10821076.0, "step": 6235 }, { "entropy": 5.602234601974487, "epoch": 0.4855086559035207, "grad_norm": 1.0703125, "learning_rate": 0.0004981285015313877, "loss": 5.31, "mean_token_accuracy": 0.18187370002269745, "num_tokens": 10828634.0, "step": 6240 }, { "entropy": 5.634187126159668, "epoch": 0.4858976852752383, "grad_norm": 0.96484375, "learning_rate": 0.0004981249325553399, "loss": 5.4464, "mean_token_accuracy": 0.17350577116012572, "num_tokens": 10837481.0, "step": 6245 }, { "entropy": 5.625172281265259, "epoch": 0.48628671464695583, "grad_norm": 0.98046875, "learning_rate": 0.0004981213601937264, "loss": 5.5051, "mean_token_accuracy": 0.15857475399971008, "num_tokens": 10846729.0, "step": 6250 }, { "entropy": 5.709941816329956, "epoch": 0.4866757440186734, "grad_norm": 1.0625, "learning_rate": 0.0004981177844466013, "loss": 5.4911, "mean_token_accuracy": 0.16200155019760132, "num_tokens": 10855344.0, "step": 6255 }, { "entropy": 5.695097494125366, "epoch": 0.48706477339039095, "grad_norm": 0.98828125, "learning_rate": 0.0004981142053140192, "loss": 5.5255, "mean_token_accuracy": 0.1674111381173134, "num_tokens": 10863934.0, "step": 6260 }, { "entropy": 5.626110935211182, "epoch": 0.48745380276210853, "grad_norm": 0.98828125, "learning_rate": 0.0004981106227960339, "loss": 5.5045, "mean_token_accuracy": 0.16477670669555664, "num_tokens": 10872031.0, "step": 6265 }, { "entropy": 5.718598461151123, "epoch": 0.4878428321338261, "grad_norm": 0.98828125, "learning_rate": 0.0004981070368927001, "loss": 5.5731, "mean_token_accuracy": 0.16409001350402833, "num_tokens": 10881385.0, "step": 6270 }, { "entropy": 5.678594493865967, "epoch": 0.48823186150554365, "grad_norm": 0.95703125, "learning_rate": 0.000498103447604072, "loss": 5.4697, "mean_token_accuracy": 0.1685481011867523, "num_tokens": 10890483.0, "step": 6275 }, { "entropy": 5.630790519714355, "epoch": 0.48862089087726124, "grad_norm": 1.0546875, "learning_rate": 0.0004980998549302044, "loss": 5.5031, "mean_token_accuracy": 0.17031818777322769, "num_tokens": 10898338.0, "step": 6280 }, { "entropy": 5.6111741065979, "epoch": 0.4890099202489788, "grad_norm": 0.95703125, "learning_rate": 0.0004980962588711516, "loss": 5.4897, "mean_token_accuracy": 0.1661595106124878, "num_tokens": 10908087.0, "step": 6285 }, { "entropy": 5.747820568084717, "epoch": 0.48939894962069636, "grad_norm": 1.0703125, "learning_rate": 0.000498092659426968, "loss": 5.4743, "mean_token_accuracy": 0.16227587312459946, "num_tokens": 10916704.0, "step": 6290 }, { "entropy": 5.674692535400391, "epoch": 0.48978797899241394, "grad_norm": 1.015625, "learning_rate": 0.0004980890565977085, "loss": 5.439, "mean_token_accuracy": 0.1698486715555191, "num_tokens": 10925186.0, "step": 6295 }, { "entropy": 5.616642427444458, "epoch": 0.4901770083641315, "grad_norm": 1.0078125, "learning_rate": 0.0004980854503834276, "loss": 5.4967, "mean_token_accuracy": 0.16892740577459336, "num_tokens": 10934247.0, "step": 6300 }, { "entropy": 5.74802975654602, "epoch": 0.49056603773584906, "grad_norm": 1.03125, "learning_rate": 0.0004980818407841802, "loss": 5.5229, "mean_token_accuracy": 0.16045583933591842, "num_tokens": 10944260.0, "step": 6305 }, { "entropy": 5.697029542922974, "epoch": 0.49095506710756665, "grad_norm": 0.9453125, "learning_rate": 0.0004980782278000207, "loss": 5.4731, "mean_token_accuracy": 0.16220095604658127, "num_tokens": 10954065.0, "step": 6310 }, { "entropy": 5.6517290592193605, "epoch": 0.4913440964792842, "grad_norm": 0.96875, "learning_rate": 0.0004980746114310043, "loss": 5.5439, "mean_token_accuracy": 0.1659497171640396, "num_tokens": 10962918.0, "step": 6315 }, { "entropy": 5.617909145355225, "epoch": 0.49173312585100176, "grad_norm": 0.88671875, "learning_rate": 0.0004980709916771858, "loss": 5.4076, "mean_token_accuracy": 0.1703692078590393, "num_tokens": 10972356.0, "step": 6320 }, { "entropy": 5.616169452667236, "epoch": 0.4921221552227193, "grad_norm": 1.1015625, "learning_rate": 0.0004980673685386198, "loss": 5.4644, "mean_token_accuracy": 0.1629459321498871, "num_tokens": 10980984.0, "step": 6325 }, { "entropy": 5.617296028137207, "epoch": 0.4925111845944369, "grad_norm": 0.984375, "learning_rate": 0.0004980637420153618, "loss": 5.4052, "mean_token_accuracy": 0.1666889727115631, "num_tokens": 10989809.0, "step": 6330 }, { "entropy": 5.63802056312561, "epoch": 0.49290021396615447, "grad_norm": 0.9609375, "learning_rate": 0.0004980601121074664, "loss": 5.453, "mean_token_accuracy": 0.1644183024764061, "num_tokens": 10998824.0, "step": 6335 }, { "entropy": 5.722669553756714, "epoch": 0.493289243337872, "grad_norm": 1.0546875, "learning_rate": 0.0004980564788149889, "loss": 5.5222, "mean_token_accuracy": 0.16973644942045213, "num_tokens": 11006755.0, "step": 6340 }, { "entropy": 5.619312381744384, "epoch": 0.4936782727095896, "grad_norm": 1.0234375, "learning_rate": 0.0004980528421379844, "loss": 5.4179, "mean_token_accuracy": 0.17462491989135742, "num_tokens": 11015337.0, "step": 6345 }, { "entropy": 5.562566661834717, "epoch": 0.4940673020813071, "grad_norm": 0.96875, "learning_rate": 0.000498049202076508, "loss": 5.3348, "mean_token_accuracy": 0.17756202816963196, "num_tokens": 11024186.0, "step": 6350 }, { "entropy": 5.6552270412445065, "epoch": 0.4944563314530247, "grad_norm": 0.96875, "learning_rate": 0.0004980455586306149, "loss": 5.4615, "mean_token_accuracy": 0.1687190517783165, "num_tokens": 11032504.0, "step": 6355 }, { "entropy": 5.723153495788575, "epoch": 0.4948453608247423, "grad_norm": 1.046875, "learning_rate": 0.0004980419118003605, "loss": 5.3969, "mean_token_accuracy": 0.16880524754524232, "num_tokens": 11042252.0, "step": 6360 }, { "entropy": 5.703668785095215, "epoch": 0.4952343901964598, "grad_norm": 0.92578125, "learning_rate": 0.0004980382615858001, "loss": 5.4826, "mean_token_accuracy": 0.16379437744617462, "num_tokens": 11051361.0, "step": 6365 }, { "entropy": 5.6041374683380125, "epoch": 0.4956234195681774, "grad_norm": 0.97265625, "learning_rate": 0.0004980346079869892, "loss": 5.4484, "mean_token_accuracy": 0.16445529013872145, "num_tokens": 11060822.0, "step": 6370 }, { "entropy": 5.6370484828948975, "epoch": 0.49601244893989493, "grad_norm": 0.97265625, "learning_rate": 0.000498030951003983, "loss": 5.5271, "mean_token_accuracy": 0.16127680093050004, "num_tokens": 11069528.0, "step": 6375 }, { "entropy": 5.634170007705689, "epoch": 0.4964014783116125, "grad_norm": 0.94140625, "learning_rate": 0.0004980272906368371, "loss": 5.361, "mean_token_accuracy": 0.174397711455822, "num_tokens": 11077917.0, "step": 6380 }, { "entropy": 5.5964888572692875, "epoch": 0.4967905076833301, "grad_norm": 0.97265625, "learning_rate": 0.0004980236268856071, "loss": 5.4408, "mean_token_accuracy": 0.16141705960035324, "num_tokens": 11085938.0, "step": 6385 }, { "entropy": 5.60595817565918, "epoch": 0.49717953705504764, "grad_norm": 0.94140625, "learning_rate": 0.0004980199597503487, "loss": 5.5015, "mean_token_accuracy": 0.16092778593301774, "num_tokens": 11094898.0, "step": 6390 }, { "entropy": 5.640070581436158, "epoch": 0.4975685664267652, "grad_norm": 1.0390625, "learning_rate": 0.0004980162892311171, "loss": 5.3664, "mean_token_accuracy": 0.1711999848484993, "num_tokens": 11103038.0, "step": 6395 }, { "entropy": 5.675674295425415, "epoch": 0.4979575957984828, "grad_norm": 1.0546875, "learning_rate": 0.0004980126153279684, "loss": 5.4478, "mean_token_accuracy": 0.16367504447698594, "num_tokens": 11111965.0, "step": 6400 }, { "entropy": 5.636992788314819, "epoch": 0.49834662517020034, "grad_norm": 0.96484375, "learning_rate": 0.0004980089380409583, "loss": 5.4701, "mean_token_accuracy": 0.16154250949621202, "num_tokens": 11121482.0, "step": 6405 }, { "entropy": 5.66742844581604, "epoch": 0.4987356545419179, "grad_norm": 0.99609375, "learning_rate": 0.0004980052573701424, "loss": 5.4534, "mean_token_accuracy": 0.1701739862561226, "num_tokens": 11129742.0, "step": 6410 }, { "entropy": 5.656267976760864, "epoch": 0.49912468391363546, "grad_norm": 0.93359375, "learning_rate": 0.0004980015733155767, "loss": 5.4676, "mean_token_accuracy": 0.16760584563016892, "num_tokens": 11138388.0, "step": 6415 }, { "entropy": 5.474362707138061, "epoch": 0.49951371328535304, "grad_norm": 0.96484375, "learning_rate": 0.0004979978858773171, "loss": 5.2006, "mean_token_accuracy": 0.18340540081262588, "num_tokens": 11146967.0, "step": 6420 }, { "entropy": 5.641241121292114, "epoch": 0.49990274265707063, "grad_norm": 1.0390625, "learning_rate": 0.0004979941950554195, "loss": 5.5672, "mean_token_accuracy": 0.16281252056360246, "num_tokens": 11155888.0, "step": 6425 }, { "entropy": 5.7240630149841305, "epoch": 0.5002917720287882, "grad_norm": 0.9921875, "learning_rate": 0.0004979905008499399, "loss": 5.4083, "mean_token_accuracy": 0.17032212167978286, "num_tokens": 11164358.0, "step": 6430 }, { "entropy": 5.611014366149902, "epoch": 0.5006808014005057, "grad_norm": 1.0078125, "learning_rate": 0.0004979868032609344, "loss": 5.2753, "mean_token_accuracy": 0.18071538507938384, "num_tokens": 11172416.0, "step": 6435 }, { "entropy": 5.640211296081543, "epoch": 0.5010698307722233, "grad_norm": 0.9296875, "learning_rate": 0.0004979831022884591, "loss": 5.4608, "mean_token_accuracy": 0.16421267986297608, "num_tokens": 11181159.0, "step": 6440 }, { "entropy": 5.663838481903076, "epoch": 0.5014588601439409, "grad_norm": 0.984375, "learning_rate": 0.0004979793979325701, "loss": 5.4998, "mean_token_accuracy": 0.16421327739953995, "num_tokens": 11189725.0, "step": 6445 }, { "entropy": 5.672861528396607, "epoch": 0.5018478895156584, "grad_norm": 1.0625, "learning_rate": 0.0004979756901933236, "loss": 5.4741, "mean_token_accuracy": 0.16618643403053285, "num_tokens": 11197795.0, "step": 6450 }, { "entropy": 5.684984397888184, "epoch": 0.502236918887376, "grad_norm": 0.98046875, "learning_rate": 0.000497971979070776, "loss": 5.439, "mean_token_accuracy": 0.17090869694948196, "num_tokens": 11205352.0, "step": 6455 }, { "entropy": 5.633697748184204, "epoch": 0.5026259482590936, "grad_norm": 1.015625, "learning_rate": 0.0004979682645649834, "loss": 5.4625, "mean_token_accuracy": 0.16927655562758445, "num_tokens": 11214142.0, "step": 6460 }, { "entropy": 5.6249748229980465, "epoch": 0.5030149776308112, "grad_norm": 0.98046875, "learning_rate": 0.0004979645466760025, "loss": 5.3582, "mean_token_accuracy": 0.17228575199842452, "num_tokens": 11222565.0, "step": 6465 }, { "entropy": 5.6179883003234865, "epoch": 0.5034040070025287, "grad_norm": 0.921875, "learning_rate": 0.0004979608254038892, "loss": 5.4671, "mean_token_accuracy": 0.1600498229265213, "num_tokens": 11231829.0, "step": 6470 }, { "entropy": 5.623617362976074, "epoch": 0.5037930363742462, "grad_norm": 0.94921875, "learning_rate": 0.0004979571007487003, "loss": 5.4731, "mean_token_accuracy": 0.1706765592098236, "num_tokens": 11240302.0, "step": 6475 }, { "entropy": 5.727696180343628, "epoch": 0.5041820657459638, "grad_norm": 1.015625, "learning_rate": 0.0004979533727104924, "loss": 5.5714, "mean_token_accuracy": 0.15697085857391357, "num_tokens": 11248610.0, "step": 6480 }, { "entropy": 5.652313756942749, "epoch": 0.5045710951176814, "grad_norm": 0.98046875, "learning_rate": 0.000497949641289322, "loss": 5.4685, "mean_token_accuracy": 0.17022727876901628, "num_tokens": 11257441.0, "step": 6485 }, { "entropy": 5.590007686614991, "epoch": 0.504960124489399, "grad_norm": 0.94921875, "learning_rate": 0.0004979459064852456, "loss": 5.3465, "mean_token_accuracy": 0.16538669615983964, "num_tokens": 11265915.0, "step": 6490 }, { "entropy": 5.670529985427857, "epoch": 0.5053491538611166, "grad_norm": 1.0078125, "learning_rate": 0.0004979421682983197, "loss": 5.4751, "mean_token_accuracy": 0.16173707395792009, "num_tokens": 11274165.0, "step": 6495 }, { "entropy": 5.689936256408691, "epoch": 0.505738183232834, "grad_norm": 0.99609375, "learning_rate": 0.0004979384267286015, "loss": 5.4048, "mean_token_accuracy": 0.17155286222696303, "num_tokens": 11283316.0, "step": 6500 }, { "entropy": 5.648772954940796, "epoch": 0.5061272126045516, "grad_norm": 0.9375, "learning_rate": 0.0004979346817761475, "loss": 5.5451, "mean_token_accuracy": 0.16382537186145782, "num_tokens": 11292289.0, "step": 6505 }, { "entropy": 5.662769746780396, "epoch": 0.5065162419762692, "grad_norm": 0.953125, "learning_rate": 0.0004979309334410144, "loss": 5.4601, "mean_token_accuracy": 0.16324011385440826, "num_tokens": 11301192.0, "step": 6510 }, { "entropy": 5.7098266124725345, "epoch": 0.5069052713479868, "grad_norm": 0.93359375, "learning_rate": 0.0004979271817232594, "loss": 5.4808, "mean_token_accuracy": 0.17188810110092162, "num_tokens": 11309906.0, "step": 6515 }, { "entropy": 5.6908995628356935, "epoch": 0.5072943007197044, "grad_norm": 1.015625, "learning_rate": 0.0004979234266229391, "loss": 5.4609, "mean_token_accuracy": 0.16591265350580214, "num_tokens": 11318227.0, "step": 6520 }, { "entropy": 5.543266248703003, "epoch": 0.5076833300914219, "grad_norm": 0.90625, "learning_rate": 0.0004979196681401106, "loss": 5.4885, "mean_token_accuracy": 0.16181913167238235, "num_tokens": 11327524.0, "step": 6525 }, { "entropy": 5.656088352203369, "epoch": 0.5080723594631394, "grad_norm": 0.96484375, "learning_rate": 0.000497915906274831, "loss": 5.4004, "mean_token_accuracy": 0.17116282731294633, "num_tokens": 11336214.0, "step": 6530 }, { "entropy": 5.681649684906006, "epoch": 0.508461388834857, "grad_norm": 0.9609375, "learning_rate": 0.0004979121410271574, "loss": 5.2699, "mean_token_accuracy": 0.18444954007863998, "num_tokens": 11344551.0, "step": 6535 }, { "entropy": 5.509459018707275, "epoch": 0.5088504182065746, "grad_norm": 0.953125, "learning_rate": 0.0004979083723971468, "loss": 5.3258, "mean_token_accuracy": 0.1782999262213707, "num_tokens": 11353180.0, "step": 6540 }, { "entropy": 5.462130117416382, "epoch": 0.5092394475782922, "grad_norm": 0.96875, "learning_rate": 0.0004979046003848564, "loss": 5.3146, "mean_token_accuracy": 0.17773108780384064, "num_tokens": 11361343.0, "step": 6545 }, { "entropy": 5.581699991226197, "epoch": 0.5096284769500097, "grad_norm": 1.0546875, "learning_rate": 0.0004979008249903435, "loss": 5.4102, "mean_token_accuracy": 0.17800912261009216, "num_tokens": 11369915.0, "step": 6550 }, { "entropy": 5.63182520866394, "epoch": 0.5100175063217273, "grad_norm": 0.93359375, "learning_rate": 0.0004978970462136655, "loss": 5.4432, "mean_token_accuracy": 0.16393458247184753, "num_tokens": 11379813.0, "step": 6555 }, { "entropy": 5.6643470287322994, "epoch": 0.5104065356934449, "grad_norm": 1.0078125, "learning_rate": 0.0004978932640548794, "loss": 5.3959, "mean_token_accuracy": 0.1692471981048584, "num_tokens": 11388029.0, "step": 6560 }, { "entropy": 5.615650320053101, "epoch": 0.5107955650651624, "grad_norm": 1.0078125, "learning_rate": 0.0004978894785140429, "loss": 5.3138, "mean_token_accuracy": 0.17617870420217513, "num_tokens": 11395852.0, "step": 6565 }, { "entropy": 5.594472980499267, "epoch": 0.51118459443688, "grad_norm": 0.9296875, "learning_rate": 0.0004978856895912132, "loss": 5.424, "mean_token_accuracy": 0.1696908950805664, "num_tokens": 11404756.0, "step": 6570 }, { "entropy": 5.736187171936035, "epoch": 0.5115736238085975, "grad_norm": 1.078125, "learning_rate": 0.0004978818972864481, "loss": 5.5854, "mean_token_accuracy": 0.16184193193912505, "num_tokens": 11413301.0, "step": 6575 }, { "entropy": 5.711348819732666, "epoch": 0.5119626531803151, "grad_norm": 0.93359375, "learning_rate": 0.0004978781015998048, "loss": 5.3515, "mean_token_accuracy": 0.1738321989774704, "num_tokens": 11421034.0, "step": 6580 }, { "entropy": 5.609139537811279, "epoch": 0.5123516825520327, "grad_norm": 1.0, "learning_rate": 0.0004978743025313413, "loss": 5.3942, "mean_token_accuracy": 0.17445635795593262, "num_tokens": 11429066.0, "step": 6585 }, { "entropy": 5.498823261260986, "epoch": 0.5127407119237503, "grad_norm": 1.0390625, "learning_rate": 0.0004978705000811148, "loss": 5.4094, "mean_token_accuracy": 0.16928456127643585, "num_tokens": 11438109.0, "step": 6590 }, { "entropy": 5.658320903778076, "epoch": 0.5131297412954678, "grad_norm": 1.0390625, "learning_rate": 0.0004978666942491832, "loss": 5.4287, "mean_token_accuracy": 0.1691526874899864, "num_tokens": 11446787.0, "step": 6595 }, { "entropy": 5.59825587272644, "epoch": 0.5135187706671853, "grad_norm": 0.984375, "learning_rate": 0.0004978628850356043, "loss": 5.3867, "mean_token_accuracy": 0.16849370002746583, "num_tokens": 11456262.0, "step": 6600 }, { "entropy": 5.638675928115845, "epoch": 0.5139078000389029, "grad_norm": 1.046875, "learning_rate": 0.0004978590724404358, "loss": 5.3882, "mean_token_accuracy": 0.17555086463689804, "num_tokens": 11464297.0, "step": 6605 }, { "entropy": 5.6504510879516605, "epoch": 0.5142968294106205, "grad_norm": 0.984375, "learning_rate": 0.0004978552564637356, "loss": 5.4598, "mean_token_accuracy": 0.16988648921251298, "num_tokens": 11473519.0, "step": 6610 }, { "entropy": 5.662782049179077, "epoch": 0.5146858587823381, "grad_norm": 1.0234375, "learning_rate": 0.0004978514371055616, "loss": 5.4553, "mean_token_accuracy": 0.16260288804769515, "num_tokens": 11482249.0, "step": 6615 }, { "entropy": 5.5754162788391115, "epoch": 0.5150748881540557, "grad_norm": 1.0390625, "learning_rate": 0.0004978476143659718, "loss": 5.4179, "mean_token_accuracy": 0.1698406532406807, "num_tokens": 11490687.0, "step": 6620 }, { "entropy": 5.561270093917846, "epoch": 0.5154639175257731, "grad_norm": 0.96875, "learning_rate": 0.0004978437882450241, "loss": 5.4276, "mean_token_accuracy": 0.1648566707968712, "num_tokens": 11500225.0, "step": 6625 }, { "entropy": 5.6289667129516605, "epoch": 0.5158529468974907, "grad_norm": 1.015625, "learning_rate": 0.0004978399587427766, "loss": 5.3552, "mean_token_accuracy": 0.1658610612154007, "num_tokens": 11508116.0, "step": 6630 }, { "entropy": 5.542283058166504, "epoch": 0.5162419762692083, "grad_norm": 0.94140625, "learning_rate": 0.0004978361258592874, "loss": 5.4362, "mean_token_accuracy": 0.16429463773965836, "num_tokens": 11516525.0, "step": 6635 }, { "entropy": 5.606814956665039, "epoch": 0.5166310056409259, "grad_norm": 0.9921875, "learning_rate": 0.0004978322895946147, "loss": 5.4068, "mean_token_accuracy": 0.17431761771440507, "num_tokens": 11525434.0, "step": 6640 }, { "entropy": 5.676286029815674, "epoch": 0.5170200350126435, "grad_norm": 0.9296875, "learning_rate": 0.0004978284499488167, "loss": 5.4635, "mean_token_accuracy": 0.16793732196092606, "num_tokens": 11534318.0, "step": 6645 }, { "entropy": 5.6349205493927, "epoch": 0.5174090643843611, "grad_norm": 1.0234375, "learning_rate": 0.0004978246069219516, "loss": 5.3908, "mean_token_accuracy": 0.1799973353743553, "num_tokens": 11542777.0, "step": 6650 }, { "entropy": 5.625831985473633, "epoch": 0.5177980937560785, "grad_norm": 1.0703125, "learning_rate": 0.0004978207605140777, "loss": 5.3896, "mean_token_accuracy": 0.17461561858654023, "num_tokens": 11550888.0, "step": 6655 }, { "entropy": 5.626785707473755, "epoch": 0.5181871231277961, "grad_norm": 1.078125, "learning_rate": 0.0004978169107252534, "loss": 5.4318, "mean_token_accuracy": 0.1628247007727623, "num_tokens": 11560047.0, "step": 6660 }, { "entropy": 5.671987104415893, "epoch": 0.5185761524995137, "grad_norm": 1.0078125, "learning_rate": 0.0004978130575555373, "loss": 5.4189, "mean_token_accuracy": 0.1725052371621132, "num_tokens": 11568862.0, "step": 6665 }, { "entropy": 5.550399494171143, "epoch": 0.5189651818712313, "grad_norm": 0.9453125, "learning_rate": 0.0004978092010049877, "loss": 5.3735, "mean_token_accuracy": 0.1731133446097374, "num_tokens": 11577509.0, "step": 6670 }, { "entropy": 5.743370056152344, "epoch": 0.5193542112429489, "grad_norm": 1.0234375, "learning_rate": 0.000497805341073663, "loss": 5.4857, "mean_token_accuracy": 0.17034248411655425, "num_tokens": 11585902.0, "step": 6675 }, { "entropy": 5.667796611785889, "epoch": 0.5197432406146664, "grad_norm": 0.9375, "learning_rate": 0.0004978014777616219, "loss": 5.4979, "mean_token_accuracy": 0.17023638486862183, "num_tokens": 11594895.0, "step": 6680 }, { "entropy": 5.5753960609436035, "epoch": 0.520132269986384, "grad_norm": 0.921875, "learning_rate": 0.0004977976110689229, "loss": 5.3123, "mean_token_accuracy": 0.1708584502339363, "num_tokens": 11604080.0, "step": 6685 }, { "entropy": 5.665987968444824, "epoch": 0.5205212993581015, "grad_norm": 0.87890625, "learning_rate": 0.000497793740995625, "loss": 5.4386, "mean_token_accuracy": 0.16633949279785157, "num_tokens": 11613370.0, "step": 6690 }, { "entropy": 5.585418844223023, "epoch": 0.5209103287298191, "grad_norm": 1.015625, "learning_rate": 0.0004977898675417866, "loss": 5.4211, "mean_token_accuracy": 0.16649907678365708, "num_tokens": 11621913.0, "step": 6695 }, { "entropy": 5.642942237854004, "epoch": 0.5212993581015367, "grad_norm": 1.0546875, "learning_rate": 0.0004977859907074664, "loss": 5.5436, "mean_token_accuracy": 0.16430994272232055, "num_tokens": 11630393.0, "step": 6700 }, { "entropy": 5.720639753341675, "epoch": 0.5216883874732542, "grad_norm": 1.0390625, "learning_rate": 0.0004977821104927236, "loss": 5.4928, "mean_token_accuracy": 0.1631960764527321, "num_tokens": 11639038.0, "step": 6705 }, { "entropy": 5.618670892715454, "epoch": 0.5220774168449718, "grad_norm": 0.99609375, "learning_rate": 0.0004977782268976167, "loss": 5.406, "mean_token_accuracy": 0.16851633042097092, "num_tokens": 11647355.0, "step": 6710 }, { "entropy": 5.596138334274292, "epoch": 0.5224664462166894, "grad_norm": 1.1328125, "learning_rate": 0.0004977743399222048, "loss": 5.3802, "mean_token_accuracy": 0.1682727590203285, "num_tokens": 11655899.0, "step": 6715 }, { "entropy": 5.725822591781617, "epoch": 0.522855475588407, "grad_norm": 0.9765625, "learning_rate": 0.0004977704495665471, "loss": 5.5674, "mean_token_accuracy": 0.15976732969284058, "num_tokens": 11664602.0, "step": 6720 }, { "entropy": 5.6776047706604, "epoch": 0.5232445049601245, "grad_norm": 0.93359375, "learning_rate": 0.0004977665558307023, "loss": 5.3917, "mean_token_accuracy": 0.17342305481433867, "num_tokens": 11673011.0, "step": 6725 }, { "entropy": 5.750084304809571, "epoch": 0.523633534331842, "grad_norm": 0.9765625, "learning_rate": 0.0004977626587147295, "loss": 5.5673, "mean_token_accuracy": 0.1633073076605797, "num_tokens": 11681989.0, "step": 6730 }, { "entropy": 5.703148746490479, "epoch": 0.5240225637035596, "grad_norm": 1.0, "learning_rate": 0.000497758758218688, "loss": 5.4916, "mean_token_accuracy": 0.16183123290538787, "num_tokens": 11690502.0, "step": 6735 }, { "entropy": 5.641050243377686, "epoch": 0.5244115930752772, "grad_norm": 1.0, "learning_rate": 0.0004977548543426368, "loss": 5.4935, "mean_token_accuracy": 0.166514340788126, "num_tokens": 11699594.0, "step": 6740 }, { "entropy": 5.584754896163941, "epoch": 0.5248006224469948, "grad_norm": 1.09375, "learning_rate": 0.0004977509470866353, "loss": 5.3668, "mean_token_accuracy": 0.16964129209518433, "num_tokens": 11708009.0, "step": 6745 }, { "entropy": 5.702879905700684, "epoch": 0.5251896518187124, "grad_norm": 0.94140625, "learning_rate": 0.0004977470364507427, "loss": 5.5323, "mean_token_accuracy": 0.16005744338035582, "num_tokens": 11716592.0, "step": 6750 }, { "entropy": 5.688350057601928, "epoch": 0.5255786811904298, "grad_norm": 0.8984375, "learning_rate": 0.0004977431224350184, "loss": 5.559, "mean_token_accuracy": 0.15319210886955262, "num_tokens": 11725894.0, "step": 6755 }, { "entropy": 5.726099252700806, "epoch": 0.5259677105621474, "grad_norm": 1.0625, "learning_rate": 0.0004977392050395217, "loss": 5.4079, "mean_token_accuracy": 0.16904182434082032, "num_tokens": 11734141.0, "step": 6760 }, { "entropy": 5.658994817733765, "epoch": 0.526356739933865, "grad_norm": 1.0078125, "learning_rate": 0.0004977352842643121, "loss": 5.5067, "mean_token_accuracy": 0.164360873401165, "num_tokens": 11742539.0, "step": 6765 }, { "entropy": 5.661802816390991, "epoch": 0.5267457693055826, "grad_norm": 1.03125, "learning_rate": 0.000497731360109449, "loss": 5.4757, "mean_token_accuracy": 0.16561661511659623, "num_tokens": 11751649.0, "step": 6770 }, { "entropy": 5.689319801330567, "epoch": 0.5271347986773002, "grad_norm": 0.9296875, "learning_rate": 0.0004977274325749922, "loss": 5.4887, "mean_token_accuracy": 0.16493163704872132, "num_tokens": 11760376.0, "step": 6775 }, { "entropy": 5.683128690719604, "epoch": 0.5275238280490177, "grad_norm": 0.96875, "learning_rate": 0.0004977235016610011, "loss": 5.4508, "mean_token_accuracy": 0.16838639378547668, "num_tokens": 11768644.0, "step": 6780 }, { "entropy": 5.702654647827148, "epoch": 0.5279128574207352, "grad_norm": 0.9609375, "learning_rate": 0.0004977195673675353, "loss": 5.521, "mean_token_accuracy": 0.16457068622112275, "num_tokens": 11777282.0, "step": 6785 }, { "entropy": 5.630511379241943, "epoch": 0.5283018867924528, "grad_norm": 0.984375, "learning_rate": 0.0004977156296946545, "loss": 5.4285, "mean_token_accuracy": 0.16902912259101868, "num_tokens": 11786108.0, "step": 6790 }, { "entropy": 5.619226408004761, "epoch": 0.5286909161641704, "grad_norm": 0.96875, "learning_rate": 0.0004977116886424187, "loss": 5.4717, "mean_token_accuracy": 0.1616060495376587, "num_tokens": 11795151.0, "step": 6795 }, { "entropy": 5.745349264144897, "epoch": 0.529079945535888, "grad_norm": 0.9921875, "learning_rate": 0.0004977077442108873, "loss": 5.4159, "mean_token_accuracy": 0.17375196963548661, "num_tokens": 11803971.0, "step": 6800 }, { "entropy": 5.609159469604492, "epoch": 0.5294689749076055, "grad_norm": 0.98046875, "learning_rate": 0.0004977037964001204, "loss": 5.4662, "mean_token_accuracy": 0.17144315242767333, "num_tokens": 11812483.0, "step": 6805 }, { "entropy": 5.580070114135742, "epoch": 0.5298580042793231, "grad_norm": 0.99609375, "learning_rate": 0.000497699845210178, "loss": 5.3558, "mean_token_accuracy": 0.17689975798130037, "num_tokens": 11821144.0, "step": 6810 }, { "entropy": 5.630408430099488, "epoch": 0.5302470336510406, "grad_norm": 0.97265625, "learning_rate": 0.0004976958906411197, "loss": 5.3189, "mean_token_accuracy": 0.17868188321590422, "num_tokens": 11829298.0, "step": 6815 }, { "entropy": 5.668645286560059, "epoch": 0.5306360630227582, "grad_norm": 1.0390625, "learning_rate": 0.0004976919326930059, "loss": 5.4219, "mean_token_accuracy": 0.17015438079833983, "num_tokens": 11837558.0, "step": 6820 }, { "entropy": 5.546228361129761, "epoch": 0.5310250923944758, "grad_norm": 1.03125, "learning_rate": 0.0004976879713658964, "loss": 5.3114, "mean_token_accuracy": 0.17407533675432205, "num_tokens": 11845770.0, "step": 6825 }, { "entropy": 5.677445554733277, "epoch": 0.5314141217661933, "grad_norm": 0.9921875, "learning_rate": 0.0004976840066598514, "loss": 5.4971, "mean_token_accuracy": 0.15888483226299285, "num_tokens": 11854351.0, "step": 6830 }, { "entropy": 5.77203950881958, "epoch": 0.5318031511379109, "grad_norm": 1.0234375, "learning_rate": 0.0004976800385749309, "loss": 5.4912, "mean_token_accuracy": 0.17434257715940477, "num_tokens": 11862610.0, "step": 6835 }, { "entropy": 5.652606201171875, "epoch": 0.5321921805096285, "grad_norm": 1.1015625, "learning_rate": 0.0004976760671111954, "loss": 5.4788, "mean_token_accuracy": 0.17035529613494874, "num_tokens": 11871078.0, "step": 6840 }, { "entropy": 5.609366941452026, "epoch": 0.532581209881346, "grad_norm": 1.0078125, "learning_rate": 0.000497672092268705, "loss": 5.3485, "mean_token_accuracy": 0.17742927223443986, "num_tokens": 11879303.0, "step": 6845 }, { "entropy": 5.624922180175782, "epoch": 0.5329702392530636, "grad_norm": 1.0546875, "learning_rate": 0.00049766811404752, "loss": 5.3957, "mean_token_accuracy": 0.17183460891246796, "num_tokens": 11887855.0, "step": 6850 }, { "entropy": 5.701442718505859, "epoch": 0.5333592686247812, "grad_norm": 1.03125, "learning_rate": 0.0004976641324477008, "loss": 5.3599, "mean_token_accuracy": 0.17164410650730133, "num_tokens": 11896262.0, "step": 6855 }, { "entropy": 5.511118984222412, "epoch": 0.5337482979964987, "grad_norm": 1.0390625, "learning_rate": 0.0004976601474693077, "loss": 5.2781, "mean_token_accuracy": 0.1787315785884857, "num_tokens": 11905140.0, "step": 6860 }, { "entropy": 5.542644214630127, "epoch": 0.5341373273682163, "grad_norm": 1.03125, "learning_rate": 0.0004976561591124014, "loss": 5.3198, "mean_token_accuracy": 0.17594115883111955, "num_tokens": 11913177.0, "step": 6865 }, { "entropy": 5.453828239440918, "epoch": 0.5345263567399339, "grad_norm": 1.0390625, "learning_rate": 0.0004976521673770421, "loss": 5.3571, "mean_token_accuracy": 0.17943618297576905, "num_tokens": 11921955.0, "step": 6870 }, { "entropy": 5.603758478164673, "epoch": 0.5349153861116515, "grad_norm": 1.03125, "learning_rate": 0.0004976481722632907, "loss": 5.3558, "mean_token_accuracy": 0.1703154921531677, "num_tokens": 11930976.0, "step": 6875 }, { "entropy": 5.619595861434936, "epoch": 0.535304415483369, "grad_norm": 1.0, "learning_rate": 0.0004976441737712076, "loss": 5.2819, "mean_token_accuracy": 0.17539516985416412, "num_tokens": 11939708.0, "step": 6880 }, { "entropy": 5.6227837085723875, "epoch": 0.5356934448550865, "grad_norm": 0.90625, "learning_rate": 0.0004976401719008536, "loss": 5.4718, "mean_token_accuracy": 0.16340460404753684, "num_tokens": 11949176.0, "step": 6885 }, { "entropy": 5.623278713226318, "epoch": 0.5360824742268041, "grad_norm": 0.98828125, "learning_rate": 0.0004976361666522893, "loss": 5.3277, "mean_token_accuracy": 0.17831586450338363, "num_tokens": 11958089.0, "step": 6890 }, { "entropy": 5.647400808334351, "epoch": 0.5364715035985217, "grad_norm": 1.109375, "learning_rate": 0.0004976321580255755, "loss": 5.4209, "mean_token_accuracy": 0.17419404089450835, "num_tokens": 11966719.0, "step": 6895 }, { "entropy": 5.651475811004639, "epoch": 0.5368605329702393, "grad_norm": 0.92578125, "learning_rate": 0.0004976281460207731, "loss": 5.4901, "mean_token_accuracy": 0.1658528283238411, "num_tokens": 11975959.0, "step": 6900 }, { "entropy": 5.63256721496582, "epoch": 0.5372495623419569, "grad_norm": 0.94921875, "learning_rate": 0.000497624130637943, "loss": 5.4354, "mean_token_accuracy": 0.1661873921751976, "num_tokens": 11984282.0, "step": 6905 }, { "entropy": 5.659536361694336, "epoch": 0.5376385917136743, "grad_norm": 1.03125, "learning_rate": 0.000497620111877146, "loss": 5.4367, "mean_token_accuracy": 0.1674356371164322, "num_tokens": 11993289.0, "step": 6910 }, { "entropy": 5.584860134124756, "epoch": 0.5380276210853919, "grad_norm": 1.015625, "learning_rate": 0.0004976160897384431, "loss": 5.3668, "mean_token_accuracy": 0.17173303812742233, "num_tokens": 12002425.0, "step": 6915 }, { "entropy": 5.628754281997681, "epoch": 0.5384166504571095, "grad_norm": 0.97265625, "learning_rate": 0.0004976120642218955, "loss": 5.3784, "mean_token_accuracy": 0.17149677276611328, "num_tokens": 12010435.0, "step": 6920 }, { "entropy": 5.562549209594726, "epoch": 0.5388056798288271, "grad_norm": 0.9921875, "learning_rate": 0.000497608035327564, "loss": 5.4306, "mean_token_accuracy": 0.1634228304028511, "num_tokens": 12018768.0, "step": 6925 }, { "entropy": 5.64377384185791, "epoch": 0.5391947092005447, "grad_norm": 0.984375, "learning_rate": 0.00049760400305551, "loss": 5.4494, "mean_token_accuracy": 0.17214796990156173, "num_tokens": 12027617.0, "step": 6930 }, { "entropy": 5.663191556930542, "epoch": 0.5395837385722622, "grad_norm": 1.046875, "learning_rate": 0.0004975999674057944, "loss": 5.4171, "mean_token_accuracy": 0.16715274453163148, "num_tokens": 12036024.0, "step": 6935 }, { "entropy": 5.671573257446289, "epoch": 0.5399727679439797, "grad_norm": 1.015625, "learning_rate": 0.0004975959283784787, "loss": 5.4519, "mean_token_accuracy": 0.16841286569833755, "num_tokens": 12044206.0, "step": 6940 }, { "entropy": 5.598822069168091, "epoch": 0.5403617973156973, "grad_norm": 0.92578125, "learning_rate": 0.0004975918859736241, "loss": 5.3335, "mean_token_accuracy": 0.17251801639795303, "num_tokens": 12052294.0, "step": 6945 }, { "entropy": 5.585722303390503, "epoch": 0.5407508266874149, "grad_norm": 0.97265625, "learning_rate": 0.0004975878401912919, "loss": 5.453, "mean_token_accuracy": 0.16552573442459106, "num_tokens": 12060446.0, "step": 6950 }, { "entropy": 5.657906723022461, "epoch": 0.5411398560591325, "grad_norm": 0.9609375, "learning_rate": 0.0004975837910315436, "loss": 5.5333, "mean_token_accuracy": 0.1649618551135063, "num_tokens": 12069267.0, "step": 6955 }, { "entropy": 5.696007919311524, "epoch": 0.54152888543085, "grad_norm": 0.96484375, "learning_rate": 0.0004975797384944405, "loss": 5.4524, "mean_token_accuracy": 0.1656179204583168, "num_tokens": 12077808.0, "step": 6960 }, { "entropy": 5.620603752136231, "epoch": 0.5419179148025676, "grad_norm": 1.0078125, "learning_rate": 0.000497575682580044, "loss": 5.4231, "mean_token_accuracy": 0.16909924298524856, "num_tokens": 12086893.0, "step": 6965 }, { "entropy": 5.599455213546753, "epoch": 0.5423069441742852, "grad_norm": 0.98046875, "learning_rate": 0.000497571623288416, "loss": 5.3045, "mean_token_accuracy": 0.1750321552157402, "num_tokens": 12095462.0, "step": 6970 }, { "entropy": 5.646379852294922, "epoch": 0.5426959735460027, "grad_norm": 1.09375, "learning_rate": 0.0004975675606196177, "loss": 5.4068, "mean_token_accuracy": 0.1716737598180771, "num_tokens": 12103477.0, "step": 6975 }, { "entropy": 5.693296003341675, "epoch": 0.5430850029177203, "grad_norm": 1.0234375, "learning_rate": 0.000497563494573711, "loss": 5.5203, "mean_token_accuracy": 0.1662907287478447, "num_tokens": 12112752.0, "step": 6980 }, { "entropy": 5.695676946640015, "epoch": 0.5434740322894378, "grad_norm": 0.9921875, "learning_rate": 0.0004975594251507575, "loss": 5.4567, "mean_token_accuracy": 0.1623358443379402, "num_tokens": 12121883.0, "step": 6985 }, { "entropy": 5.662042140960693, "epoch": 0.5438630616611554, "grad_norm": 0.94921875, "learning_rate": 0.000497555352350819, "loss": 5.3843, "mean_token_accuracy": 0.1695976585149765, "num_tokens": 12130316.0, "step": 6990 }, { "entropy": 5.607014846801758, "epoch": 0.544252091032873, "grad_norm": 1.0234375, "learning_rate": 0.0004975512761739572, "loss": 5.3817, "mean_token_accuracy": 0.1685868486762047, "num_tokens": 12138856.0, "step": 6995 }, { "entropy": 5.5710813999176025, "epoch": 0.5446411204045906, "grad_norm": 1.0625, "learning_rate": 0.000497547196620234, "loss": 5.449, "mean_token_accuracy": 0.1645628333091736, "num_tokens": 12147933.0, "step": 7000 }, { "entropy": 5.600865125656128, "epoch": 0.5450301497763081, "grad_norm": 1.015625, "learning_rate": 0.0004975431136897114, "loss": 5.3418, "mean_token_accuracy": 0.17403218895196915, "num_tokens": 12156529.0, "step": 7005 }, { "entropy": 5.6149626731872555, "epoch": 0.5454191791480256, "grad_norm": 1.0078125, "learning_rate": 0.0004975390273824512, "loss": 5.2957, "mean_token_accuracy": 0.17711113393306732, "num_tokens": 12165233.0, "step": 7010 }, { "entropy": 5.656652784347534, "epoch": 0.5458082085197432, "grad_norm": 1.046875, "learning_rate": 0.0004975349376985155, "loss": 5.4905, "mean_token_accuracy": 0.16208152174949647, "num_tokens": 12173260.0, "step": 7015 }, { "entropy": 5.633213138580322, "epoch": 0.5461972378914608, "grad_norm": 1.0, "learning_rate": 0.0004975308446379663, "loss": 5.4872, "mean_token_accuracy": 0.1661377176642418, "num_tokens": 12181676.0, "step": 7020 }, { "entropy": 5.663449764251709, "epoch": 0.5465862672631784, "grad_norm": 1.046875, "learning_rate": 0.0004975267482008657, "loss": 5.3998, "mean_token_accuracy": 0.16634807139635086, "num_tokens": 12189485.0, "step": 7025 }, { "entropy": 5.61206283569336, "epoch": 0.546975296634896, "grad_norm": 0.90625, "learning_rate": 0.000497522648387276, "loss": 5.318, "mean_token_accuracy": 0.17358834743499757, "num_tokens": 12198429.0, "step": 7030 }, { "entropy": 5.6052594661712645, "epoch": 0.5473643260066134, "grad_norm": 1.09375, "learning_rate": 0.0004975185451972592, "loss": 5.4449, "mean_token_accuracy": 0.17202031910419463, "num_tokens": 12207404.0, "step": 7035 }, { "entropy": 5.670430994033813, "epoch": 0.547753355378331, "grad_norm": 0.9609375, "learning_rate": 0.0004975144386308776, "loss": 5.4222, "mean_token_accuracy": 0.1661749705672264, "num_tokens": 12216301.0, "step": 7040 }, { "entropy": 5.589423131942749, "epoch": 0.5481423847500486, "grad_norm": 1.03125, "learning_rate": 0.0004975103286881936, "loss": 5.4065, "mean_token_accuracy": 0.17458733767271042, "num_tokens": 12224873.0, "step": 7045 }, { "entropy": 5.603284597396851, "epoch": 0.5485314141217662, "grad_norm": 0.99609375, "learning_rate": 0.0004975062153692696, "loss": 5.3784, "mean_token_accuracy": 0.17105503529310226, "num_tokens": 12233439.0, "step": 7050 }, { "entropy": 5.656129550933838, "epoch": 0.5489204434934838, "grad_norm": 1.0234375, "learning_rate": 0.0004975020986741678, "loss": 5.4493, "mean_token_accuracy": 0.16752919703722, "num_tokens": 12242235.0, "step": 7055 }, { "entropy": 5.597258377075195, "epoch": 0.5493094728652014, "grad_norm": 0.953125, "learning_rate": 0.0004974979786029509, "loss": 5.388, "mean_token_accuracy": 0.17538175135850906, "num_tokens": 12251295.0, "step": 7060 }, { "entropy": 5.629272842407227, "epoch": 0.5496985022369189, "grad_norm": 0.95703125, "learning_rate": 0.0004974938551556814, "loss": 5.3133, "mean_token_accuracy": 0.17724365890026092, "num_tokens": 12260130.0, "step": 7065 }, { "entropy": 5.5907104969024655, "epoch": 0.5500875316086364, "grad_norm": 0.95703125, "learning_rate": 0.0004974897283324217, "loss": 5.393, "mean_token_accuracy": 0.16955282539129257, "num_tokens": 12269542.0, "step": 7070 }, { "entropy": 5.630454397201538, "epoch": 0.550476560980354, "grad_norm": 1.015625, "learning_rate": 0.0004974855981332343, "loss": 5.4673, "mean_token_accuracy": 0.17138559967279435, "num_tokens": 12278174.0, "step": 7075 }, { "entropy": 5.663634777069092, "epoch": 0.5508655903520716, "grad_norm": 1.015625, "learning_rate": 0.0004974814645581823, "loss": 5.5483, "mean_token_accuracy": 0.16026232093572618, "num_tokens": 12287651.0, "step": 7080 }, { "entropy": 5.76173586845398, "epoch": 0.5512546197237892, "grad_norm": 1.0703125, "learning_rate": 0.0004974773276073282, "loss": 5.5228, "mean_token_accuracy": 0.1664297416806221, "num_tokens": 12296009.0, "step": 7085 }, { "entropy": 5.6218091487884525, "epoch": 0.5516436490955067, "grad_norm": 1.0, "learning_rate": 0.0004974731872807347, "loss": 5.3927, "mean_token_accuracy": 0.16824719458818435, "num_tokens": 12305406.0, "step": 7090 }, { "entropy": 5.65089635848999, "epoch": 0.5520326784672243, "grad_norm": 0.93359375, "learning_rate": 0.0004974690435784647, "loss": 5.45, "mean_token_accuracy": 0.1661311000585556, "num_tokens": 12314169.0, "step": 7095 }, { "entropy": 5.569345140457154, "epoch": 0.5524217078389418, "grad_norm": 0.96484375, "learning_rate": 0.0004974648965005811, "loss": 5.331, "mean_token_accuracy": 0.17652279734611512, "num_tokens": 12323019.0, "step": 7100 }, { "entropy": 5.595728015899658, "epoch": 0.5528107372106594, "grad_norm": 1.0078125, "learning_rate": 0.0004974607460471466, "loss": 5.435, "mean_token_accuracy": 0.16858349591493607, "num_tokens": 12331491.0, "step": 7105 }, { "entropy": 5.6596444606781, "epoch": 0.553199766582377, "grad_norm": 1.046875, "learning_rate": 0.0004974565922182246, "loss": 5.398, "mean_token_accuracy": 0.1735352173447609, "num_tokens": 12339647.0, "step": 7110 }, { "entropy": 5.648700618743897, "epoch": 0.5535887959540945, "grad_norm": 0.984375, "learning_rate": 0.0004974524350138777, "loss": 5.4002, "mean_token_accuracy": 0.1696406900882721, "num_tokens": 12348469.0, "step": 7115 }, { "entropy": 5.645704698562622, "epoch": 0.5539778253258121, "grad_norm": 1.0546875, "learning_rate": 0.0004974482744341693, "loss": 5.3714, "mean_token_accuracy": 0.17332192361354828, "num_tokens": 12357168.0, "step": 7120 }, { "entropy": 5.5719810962677006, "epoch": 0.5543668546975297, "grad_norm": 1.015625, "learning_rate": 0.0004974441104791624, "loss": 5.3745, "mean_token_accuracy": 0.17122909426689148, "num_tokens": 12365750.0, "step": 7125 }, { "entropy": 5.639922761917115, "epoch": 0.5547558840692473, "grad_norm": 0.98046875, "learning_rate": 0.0004974399431489201, "loss": 5.4018, "mean_token_accuracy": 0.17219276428222657, "num_tokens": 12374086.0, "step": 7130 }, { "entropy": 5.663942813873291, "epoch": 0.5551449134409648, "grad_norm": 1.03125, "learning_rate": 0.0004974357724435057, "loss": 5.3642, "mean_token_accuracy": 0.1792665883898735, "num_tokens": 12381997.0, "step": 7135 }, { "entropy": 5.646653938293457, "epoch": 0.5555339428126823, "grad_norm": 0.9453125, "learning_rate": 0.0004974315983629825, "loss": 5.4462, "mean_token_accuracy": 0.17241283059120177, "num_tokens": 12391083.0, "step": 7140 }, { "entropy": 5.634599733352661, "epoch": 0.5559229721843999, "grad_norm": 0.92578125, "learning_rate": 0.0004974274209074139, "loss": 5.371, "mean_token_accuracy": 0.17252092063426971, "num_tokens": 12400016.0, "step": 7145 }, { "entropy": 5.685489320755005, "epoch": 0.5563120015561175, "grad_norm": 1.015625, "learning_rate": 0.0004974232400768632, "loss": 5.4818, "mean_token_accuracy": 0.16982473880052568, "num_tokens": 12409255.0, "step": 7150 }, { "entropy": 5.641375494003296, "epoch": 0.5567010309278351, "grad_norm": 0.953125, "learning_rate": 0.0004974190558713939, "loss": 5.3884, "mean_token_accuracy": 0.17358123064041137, "num_tokens": 12417765.0, "step": 7155 }, { "entropy": 5.669316005706787, "epoch": 0.5570900602995527, "grad_norm": 1.0, "learning_rate": 0.0004974148682910694, "loss": 5.6177, "mean_token_accuracy": 0.15360698252916336, "num_tokens": 12427588.0, "step": 7160 }, { "entropy": 5.59427547454834, "epoch": 0.5574790896712701, "grad_norm": 1.0625, "learning_rate": 0.0004974106773359533, "loss": 5.289, "mean_token_accuracy": 0.17874647974967955, "num_tokens": 12435773.0, "step": 7165 }, { "entropy": 5.605812740325928, "epoch": 0.5578681190429877, "grad_norm": 1.0625, "learning_rate": 0.0004974064830061091, "loss": 5.4123, "mean_token_accuracy": 0.17299440503120422, "num_tokens": 12443837.0, "step": 7170 }, { "entropy": 5.572979688644409, "epoch": 0.5582571484147053, "grad_norm": 0.984375, "learning_rate": 0.0004974022853016006, "loss": 5.4106, "mean_token_accuracy": 0.17499408423900603, "num_tokens": 12452945.0, "step": 7175 }, { "entropy": 5.595126533508301, "epoch": 0.5586461777864229, "grad_norm": 1.1015625, "learning_rate": 0.0004973980842224913, "loss": 5.3213, "mean_token_accuracy": 0.18019433468580245, "num_tokens": 12461008.0, "step": 7180 }, { "entropy": 5.541195869445801, "epoch": 0.5590352071581405, "grad_norm": 1.0703125, "learning_rate": 0.0004973938797688452, "loss": 5.3315, "mean_token_accuracy": 0.16913951933383942, "num_tokens": 12469314.0, "step": 7185 }, { "entropy": 5.607437181472778, "epoch": 0.559424236529858, "grad_norm": 1.0703125, "learning_rate": 0.0004973896719407259, "loss": 5.3747, "mean_token_accuracy": 0.16569244116544724, "num_tokens": 12477540.0, "step": 7190 }, { "entropy": 5.611822509765625, "epoch": 0.5598132659015755, "grad_norm": 0.95703125, "learning_rate": 0.0004973854607381972, "loss": 5.4272, "mean_token_accuracy": 0.17706743329763414, "num_tokens": 12486894.0, "step": 7195 }, { "entropy": 5.660370969772339, "epoch": 0.5602022952732931, "grad_norm": 0.90234375, "learning_rate": 0.0004973812461613232, "loss": 5.4215, "mean_token_accuracy": 0.16543299257755278, "num_tokens": 12496213.0, "step": 7200 }, { "entropy": 5.621604681015015, "epoch": 0.5605913246450107, "grad_norm": 1.0078125, "learning_rate": 0.0004973770282101677, "loss": 5.3941, "mean_token_accuracy": 0.17001705318689347, "num_tokens": 12504160.0, "step": 7205 }, { "entropy": 5.5064887523651125, "epoch": 0.5609803540167283, "grad_norm": 0.9921875, "learning_rate": 0.0004973728068847947, "loss": 5.3406, "mean_token_accuracy": 0.17627592831850053, "num_tokens": 12511915.0, "step": 7210 }, { "entropy": 5.633753728866577, "epoch": 0.5613693833884458, "grad_norm": 1.0390625, "learning_rate": 0.0004973685821852684, "loss": 5.3721, "mean_token_accuracy": 0.17439102977514268, "num_tokens": 12520400.0, "step": 7215 }, { "entropy": 5.592429780960083, "epoch": 0.5617584127601634, "grad_norm": 0.9453125, "learning_rate": 0.0004973643541116528, "loss": 5.295, "mean_token_accuracy": 0.1770132914185524, "num_tokens": 12528724.0, "step": 7220 }, { "entropy": 5.6063238143920895, "epoch": 0.562147442131881, "grad_norm": 0.96484375, "learning_rate": 0.000497360122664012, "loss": 5.4863, "mean_token_accuracy": 0.17149095386266708, "num_tokens": 12537378.0, "step": 7225 }, { "entropy": 5.597244024276733, "epoch": 0.5625364715035985, "grad_norm": 0.95703125, "learning_rate": 0.0004973558878424104, "loss": 5.3994, "mean_token_accuracy": 0.17489453703165053, "num_tokens": 12546080.0, "step": 7230 }, { "entropy": 5.684036159515381, "epoch": 0.5629255008753161, "grad_norm": 0.97265625, "learning_rate": 0.0004973516496469119, "loss": 5.4159, "mean_token_accuracy": 0.1706525832414627, "num_tokens": 12554526.0, "step": 7235 }, { "entropy": 5.616761255264282, "epoch": 0.5633145302470336, "grad_norm": 1.09375, "learning_rate": 0.0004973474080775811, "loss": 5.3895, "mean_token_accuracy": 0.17201378792524338, "num_tokens": 12563018.0, "step": 7240 }, { "entropy": 5.597792434692383, "epoch": 0.5637035596187512, "grad_norm": 0.984375, "learning_rate": 0.0004973431631344824, "loss": 5.4425, "mean_token_accuracy": 0.1725260868668556, "num_tokens": 12571611.0, "step": 7245 }, { "entropy": 5.68755464553833, "epoch": 0.5640925889904688, "grad_norm": 0.9609375, "learning_rate": 0.00049733891481768, "loss": 5.5059, "mean_token_accuracy": 0.1666056454181671, "num_tokens": 12580168.0, "step": 7250 }, { "entropy": 5.59826512336731, "epoch": 0.5644816183621864, "grad_norm": 0.9609375, "learning_rate": 0.0004973346631272384, "loss": 5.4141, "mean_token_accuracy": 0.17382865399122238, "num_tokens": 12589843.0, "step": 7255 }, { "entropy": 5.685404348373413, "epoch": 0.5648706477339039, "grad_norm": 1.046875, "learning_rate": 0.0004973304080632222, "loss": 5.4488, "mean_token_accuracy": 0.16553327292203904, "num_tokens": 12598219.0, "step": 7260 }, { "entropy": 5.603097867965698, "epoch": 0.5652596771056215, "grad_norm": 0.9765625, "learning_rate": 0.000497326149625696, "loss": 5.4304, "mean_token_accuracy": 0.16851159632205964, "num_tokens": 12606665.0, "step": 7265 }, { "entropy": 5.603170919418335, "epoch": 0.565648706477339, "grad_norm": 0.9921875, "learning_rate": 0.0004973218878147244, "loss": 5.3684, "mean_token_accuracy": 0.17258040308952333, "num_tokens": 12615062.0, "step": 7270 }, { "entropy": 5.682673454284668, "epoch": 0.5660377358490566, "grad_norm": 0.96875, "learning_rate": 0.0004973176226303719, "loss": 5.4455, "mean_token_accuracy": 0.1684245362877846, "num_tokens": 12623923.0, "step": 7275 }, { "entropy": 5.619794845581055, "epoch": 0.5664267652207742, "grad_norm": 1.015625, "learning_rate": 0.0004973133540727033, "loss": 5.3834, "mean_token_accuracy": 0.16963649094104766, "num_tokens": 12632579.0, "step": 7280 }, { "entropy": 5.571510648727417, "epoch": 0.5668157945924918, "grad_norm": 1.0859375, "learning_rate": 0.0004973090821417835, "loss": 5.3358, "mean_token_accuracy": 0.17332665473222733, "num_tokens": 12640847.0, "step": 7285 }, { "entropy": 5.655331659317016, "epoch": 0.5672048239642093, "grad_norm": 1.0703125, "learning_rate": 0.0004973048068376772, "loss": 5.3288, "mean_token_accuracy": 0.17651396989822388, "num_tokens": 12649020.0, "step": 7290 }, { "entropy": 5.5143170833587645, "epoch": 0.5675938533359268, "grad_norm": 0.98046875, "learning_rate": 0.0004973005281604492, "loss": 5.2662, "mean_token_accuracy": 0.17431186586618425, "num_tokens": 12657569.0, "step": 7295 }, { "entropy": 5.692615413665772, "epoch": 0.5679828827076444, "grad_norm": 1.0078125, "learning_rate": 0.0004972962461101646, "loss": 5.5137, "mean_token_accuracy": 0.16529098376631737, "num_tokens": 12666681.0, "step": 7300 }, { "entropy": 5.616756820678711, "epoch": 0.568371912079362, "grad_norm": 0.94140625, "learning_rate": 0.0004972919606868883, "loss": 5.3323, "mean_token_accuracy": 0.17070917636156083, "num_tokens": 12675210.0, "step": 7305 }, { "entropy": 5.661812496185303, "epoch": 0.5687609414510796, "grad_norm": 0.984375, "learning_rate": 0.0004972876718906852, "loss": 5.3856, "mean_token_accuracy": 0.17086227983236313, "num_tokens": 12684019.0, "step": 7310 }, { "entropy": 5.607829952239991, "epoch": 0.5691499708227972, "grad_norm": 0.953125, "learning_rate": 0.0004972833797216206, "loss": 5.4218, "mean_token_accuracy": 0.1609044313430786, "num_tokens": 12692891.0, "step": 7315 }, { "entropy": 5.591648054122925, "epoch": 0.5695390001945146, "grad_norm": 1.1015625, "learning_rate": 0.0004972790841797595, "loss": 5.3389, "mean_token_accuracy": 0.1735210597515106, "num_tokens": 12700606.0, "step": 7320 }, { "entropy": 5.58307032585144, "epoch": 0.5699280295662322, "grad_norm": 1.0625, "learning_rate": 0.000497274785265167, "loss": 5.4367, "mean_token_accuracy": 0.16894268244504929, "num_tokens": 12709116.0, "step": 7325 }, { "entropy": 5.636340570449829, "epoch": 0.5703170589379498, "grad_norm": 1.0625, "learning_rate": 0.0004972704829779086, "loss": 5.3984, "mean_token_accuracy": 0.170769339799881, "num_tokens": 12717484.0, "step": 7330 }, { "entropy": 5.540655183792114, "epoch": 0.5707060883096674, "grad_norm": 1.0078125, "learning_rate": 0.0004972661773180492, "loss": 5.3223, "mean_token_accuracy": 0.17410922795534134, "num_tokens": 12726216.0, "step": 7335 }, { "entropy": 5.556302165985107, "epoch": 0.571095117681385, "grad_norm": 1.0390625, "learning_rate": 0.0004972618682856545, "loss": 5.3093, "mean_token_accuracy": 0.17505342066287993, "num_tokens": 12735312.0, "step": 7340 }, { "entropy": 5.59719409942627, "epoch": 0.5714841470531025, "grad_norm": 0.97265625, "learning_rate": 0.0004972575558807896, "loss": 5.4374, "mean_token_accuracy": 0.16841867715120315, "num_tokens": 12744641.0, "step": 7345 }, { "entropy": 5.6559624671936035, "epoch": 0.57187317642482, "grad_norm": 0.99609375, "learning_rate": 0.0004972532401035201, "loss": 5.4043, "mean_token_accuracy": 0.1704619497060776, "num_tokens": 12753951.0, "step": 7350 }, { "entropy": 5.688356494903564, "epoch": 0.5722622057965376, "grad_norm": 1.0625, "learning_rate": 0.0004972489209539114, "loss": 5.418, "mean_token_accuracy": 0.16977932006120683, "num_tokens": 12762571.0, "step": 7355 }, { "entropy": 5.673377943038941, "epoch": 0.5726512351682552, "grad_norm": 0.91796875, "learning_rate": 0.0004972445984320292, "loss": 5.484, "mean_token_accuracy": 0.16849375218153, "num_tokens": 12771275.0, "step": 7360 }, { "entropy": 5.620267629623413, "epoch": 0.5730402645399728, "grad_norm": 1.0625, "learning_rate": 0.0004972402725379388, "loss": 5.3931, "mean_token_accuracy": 0.17000342756509781, "num_tokens": 12780488.0, "step": 7365 }, { "entropy": 5.646515369415283, "epoch": 0.5734292939116903, "grad_norm": 1.09375, "learning_rate": 0.000497235943271706, "loss": 5.408, "mean_token_accuracy": 0.17405337244272232, "num_tokens": 12788588.0, "step": 7370 }, { "entropy": 5.5791943073272705, "epoch": 0.5738183232834079, "grad_norm": 1.0078125, "learning_rate": 0.0004972316106333966, "loss": 5.3517, "mean_token_accuracy": 0.16888998448848724, "num_tokens": 12797010.0, "step": 7375 }, { "entropy": 5.655337905883789, "epoch": 0.5742073526551255, "grad_norm": 0.96875, "learning_rate": 0.0004972272746230761, "loss": 5.442, "mean_token_accuracy": 0.17081831395626068, "num_tokens": 12805430.0, "step": 7380 }, { "entropy": 5.704648160934449, "epoch": 0.574596382026843, "grad_norm": 1.03125, "learning_rate": 0.0004972229352408104, "loss": 5.4147, "mean_token_accuracy": 0.17035266011953354, "num_tokens": 12813912.0, "step": 7385 }, { "entropy": 5.688452529907226, "epoch": 0.5749854113985606, "grad_norm": 0.9609375, "learning_rate": 0.0004972185924866655, "loss": 5.4272, "mean_token_accuracy": 0.1671118125319481, "num_tokens": 12822421.0, "step": 7390 }, { "entropy": 5.53705153465271, "epoch": 0.5753744407702781, "grad_norm": 1.03125, "learning_rate": 0.0004972142463607071, "loss": 5.3079, "mean_token_accuracy": 0.1757025510072708, "num_tokens": 12830670.0, "step": 7395 }, { "entropy": 5.633034515380859, "epoch": 0.5757634701419957, "grad_norm": 0.96484375, "learning_rate": 0.0004972098968630012, "loss": 5.431, "mean_token_accuracy": 0.16999536752700806, "num_tokens": 12839887.0, "step": 7400 }, { "entropy": 5.541968441009521, "epoch": 0.5761524995137133, "grad_norm": 0.99609375, "learning_rate": 0.0004972055439936137, "loss": 5.3334, "mean_token_accuracy": 0.1776442050933838, "num_tokens": 12848028.0, "step": 7405 }, { "entropy": 5.519324254989624, "epoch": 0.5765415288854309, "grad_norm": 0.93359375, "learning_rate": 0.0004972011877526109, "loss": 5.3389, "mean_token_accuracy": 0.17134140133857728, "num_tokens": 12857248.0, "step": 7410 }, { "entropy": 5.639415216445923, "epoch": 0.5769305582571485, "grad_norm": 0.984375, "learning_rate": 0.0004971968281400587, "loss": 5.3294, "mean_token_accuracy": 0.17492977529764175, "num_tokens": 12866352.0, "step": 7415 }, { "entropy": 5.6588198184967045, "epoch": 0.5773195876288659, "grad_norm": 1.0625, "learning_rate": 0.0004971924651560233, "loss": 5.4357, "mean_token_accuracy": 0.16394705325365067, "num_tokens": 12874548.0, "step": 7420 }, { "entropy": 5.5939655780792235, "epoch": 0.5777086170005835, "grad_norm": 1.1171875, "learning_rate": 0.0004971880988005709, "loss": 5.2928, "mean_token_accuracy": 0.17573003321886063, "num_tokens": 12883172.0, "step": 7425 }, { "entropy": 5.526439380645752, "epoch": 0.5780976463723011, "grad_norm": 1.0078125, "learning_rate": 0.0004971837290737677, "loss": 5.3223, "mean_token_accuracy": 0.1796867400407791, "num_tokens": 12891776.0, "step": 7430 }, { "entropy": 5.583204650878907, "epoch": 0.5784866757440187, "grad_norm": 0.93359375, "learning_rate": 0.0004971793559756801, "loss": 5.2974, "mean_token_accuracy": 0.17945968955755234, "num_tokens": 12900530.0, "step": 7435 }, { "entropy": 5.538809108734131, "epoch": 0.5788757051157363, "grad_norm": 0.984375, "learning_rate": 0.0004971749795063744, "loss": 5.3276, "mean_token_accuracy": 0.17095972299575807, "num_tokens": 12909260.0, "step": 7440 }, { "entropy": 5.569579696655273, "epoch": 0.5792647344874537, "grad_norm": 0.9296875, "learning_rate": 0.000497170599665917, "loss": 5.3305, "mean_token_accuracy": 0.16970742046833037, "num_tokens": 12918143.0, "step": 7445 }, { "entropy": 5.609571313858032, "epoch": 0.5796537638591713, "grad_norm": 1.0625, "learning_rate": 0.0004971662164543743, "loss": 5.3917, "mean_token_accuracy": 0.1706962466239929, "num_tokens": 12926361.0, "step": 7450 }, { "entropy": 5.564591646194458, "epoch": 0.5800427932308889, "grad_norm": 1.0546875, "learning_rate": 0.0004971618298718131, "loss": 5.3313, "mean_token_accuracy": 0.17570846676826476, "num_tokens": 12935080.0, "step": 7455 }, { "entropy": 5.648508977890015, "epoch": 0.5804318226026065, "grad_norm": 1.0078125, "learning_rate": 0.0004971574399182995, "loss": 5.4895, "mean_token_accuracy": 0.16634377092123032, "num_tokens": 12944078.0, "step": 7460 }, { "entropy": 5.659052038192749, "epoch": 0.5808208519743241, "grad_norm": 1.0234375, "learning_rate": 0.0004971530465939005, "loss": 5.3972, "mean_token_accuracy": 0.16960996389389038, "num_tokens": 12952800.0, "step": 7465 }, { "entropy": 5.715012264251709, "epoch": 0.5812098813460417, "grad_norm": 1.015625, "learning_rate": 0.0004971486498986825, "loss": 5.4961, "mean_token_accuracy": 0.16457866877317429, "num_tokens": 12962402.0, "step": 7470 }, { "entropy": 5.568425273895263, "epoch": 0.5815989107177592, "grad_norm": 0.96875, "learning_rate": 0.0004971442498327124, "loss": 5.2584, "mean_token_accuracy": 0.17899834513664245, "num_tokens": 12971116.0, "step": 7475 }, { "entropy": 5.5052838802337645, "epoch": 0.5819879400894767, "grad_norm": 0.9921875, "learning_rate": 0.0004971398463960568, "loss": 5.3686, "mean_token_accuracy": 0.1670986607670784, "num_tokens": 12979570.0, "step": 7480 }, { "entropy": 5.640371656417846, "epoch": 0.5823769694611943, "grad_norm": 1.03125, "learning_rate": 0.0004971354395887827, "loss": 5.3951, "mean_token_accuracy": 0.17526982724666595, "num_tokens": 12987942.0, "step": 7485 }, { "entropy": 5.622890377044678, "epoch": 0.5827659988329119, "grad_norm": 0.98828125, "learning_rate": 0.0004971310294109569, "loss": 5.4293, "mean_token_accuracy": 0.17028453648090364, "num_tokens": 12996499.0, "step": 7490 }, { "entropy": 5.529724359512329, "epoch": 0.5831550282046295, "grad_norm": 0.91015625, "learning_rate": 0.0004971266158626461, "loss": 5.3675, "mean_token_accuracy": 0.17635761350393295, "num_tokens": 13005622.0, "step": 7495 }, { "entropy": 5.594239330291748, "epoch": 0.583544057576347, "grad_norm": 0.96484375, "learning_rate": 0.0004971221989439177, "loss": 5.4032, "mean_token_accuracy": 0.16471988409757615, "num_tokens": 13014417.0, "step": 7500 }, { "entropy": 5.586181688308716, "epoch": 0.5839330869480646, "grad_norm": 0.98828125, "learning_rate": 0.0004971177786548384, "loss": 5.3209, "mean_token_accuracy": 0.17067594975233077, "num_tokens": 13022887.0, "step": 7505 }, { "entropy": 5.564024019241333, "epoch": 0.5843221163197821, "grad_norm": 1.0078125, "learning_rate": 0.0004971133549954753, "loss": 5.4208, "mean_token_accuracy": 0.1676742047071457, "num_tokens": 13031676.0, "step": 7510 }, { "entropy": 5.591061210632324, "epoch": 0.5847111456914997, "grad_norm": 0.97265625, "learning_rate": 0.0004971089279658954, "loss": 5.3809, "mean_token_accuracy": 0.17073456943035126, "num_tokens": 13040489.0, "step": 7515 }, { "entropy": 5.645109987258911, "epoch": 0.5851001750632173, "grad_norm": 0.97265625, "learning_rate": 0.0004971044975661663, "loss": 5.298, "mean_token_accuracy": 0.17565406411886214, "num_tokens": 13048280.0, "step": 7520 }, { "entropy": 5.553524398803711, "epoch": 0.5854892044349348, "grad_norm": 1.03125, "learning_rate": 0.0004971000637963549, "loss": 5.2769, "mean_token_accuracy": 0.18950254768133162, "num_tokens": 13056471.0, "step": 7525 }, { "entropy": 5.616096782684326, "epoch": 0.5858782338066524, "grad_norm": 0.98828125, "learning_rate": 0.0004970956266565285, "loss": 5.4636, "mean_token_accuracy": 0.168794621527195, "num_tokens": 13065289.0, "step": 7530 }, { "entropy": 5.677121305465699, "epoch": 0.58626726317837, "grad_norm": 1.1328125, "learning_rate": 0.0004970911861467544, "loss": 5.4795, "mean_token_accuracy": 0.17004801630973815, "num_tokens": 13073648.0, "step": 7535 }, { "entropy": 5.6547130107879635, "epoch": 0.5866562925500876, "grad_norm": 0.953125, "learning_rate": 0.0004970867422671002, "loss": 5.4862, "mean_token_accuracy": 0.17260521799325942, "num_tokens": 13082205.0, "step": 7540 }, { "entropy": 5.654366731643677, "epoch": 0.5870453219218051, "grad_norm": 0.98828125, "learning_rate": 0.000497082295017633, "loss": 5.3632, "mean_token_accuracy": 0.169638891518116, "num_tokens": 13090970.0, "step": 7545 }, { "entropy": 5.633034324645996, "epoch": 0.5874343512935226, "grad_norm": 1.1015625, "learning_rate": 0.0004970778443984206, "loss": 5.2772, "mean_token_accuracy": 0.18007944971323014, "num_tokens": 13098290.0, "step": 7550 }, { "entropy": 5.531872987747192, "epoch": 0.5878233806652402, "grad_norm": 0.9765625, "learning_rate": 0.0004970733904095303, "loss": 5.2325, "mean_token_accuracy": 0.18482622057199477, "num_tokens": 13106971.0, "step": 7555 }, { "entropy": 5.663135814666748, "epoch": 0.5882124100369578, "grad_norm": 0.984375, "learning_rate": 0.0004970689330510298, "loss": 5.5028, "mean_token_accuracy": 0.16574273109436036, "num_tokens": 13115742.0, "step": 7560 }, { "entropy": 5.635857486724854, "epoch": 0.5886014394086754, "grad_norm": 1.109375, "learning_rate": 0.0004970644723229868, "loss": 5.4773, "mean_token_accuracy": 0.1727609857916832, "num_tokens": 13124192.0, "step": 7565 }, { "entropy": 5.580559301376343, "epoch": 0.588990468780393, "grad_norm": 0.9609375, "learning_rate": 0.0004970600082254687, "loss": 5.3013, "mean_token_accuracy": 0.17216529250144957, "num_tokens": 13133510.0, "step": 7570 }, { "entropy": 5.604172897338867, "epoch": 0.5893794981521104, "grad_norm": 1.0078125, "learning_rate": 0.0004970555407585436, "loss": 5.4111, "mean_token_accuracy": 0.17594430446624756, "num_tokens": 13141704.0, "step": 7575 }, { "entropy": 5.523994970321655, "epoch": 0.589768527523828, "grad_norm": 1.03125, "learning_rate": 0.000497051069922279, "loss": 5.2853, "mean_token_accuracy": 0.16935604214668273, "num_tokens": 13150559.0, "step": 7580 }, { "entropy": 5.558675527572632, "epoch": 0.5901575568955456, "grad_norm": 1.0703125, "learning_rate": 0.0004970465957167429, "loss": 5.3639, "mean_token_accuracy": 0.17506027966737747, "num_tokens": 13159428.0, "step": 7585 }, { "entropy": 5.58739275932312, "epoch": 0.5905465862672632, "grad_norm": 1.0078125, "learning_rate": 0.000497042118142003, "loss": 5.5061, "mean_token_accuracy": 0.16214175373315812, "num_tokens": 13168299.0, "step": 7590 }, { "entropy": 5.6119704246521, "epoch": 0.5909356156389808, "grad_norm": 0.9453125, "learning_rate": 0.0004970376371981275, "loss": 5.3608, "mean_token_accuracy": 0.17236538380384445, "num_tokens": 13176906.0, "step": 7595 }, { "entropy": 5.6741773128509525, "epoch": 0.5913246450106983, "grad_norm": 0.9296875, "learning_rate": 0.0004970331528851842, "loss": 5.4567, "mean_token_accuracy": 0.16617743521928788, "num_tokens": 13186180.0, "step": 7600 }, { "entropy": 5.561134624481201, "epoch": 0.5917136743824158, "grad_norm": 0.9140625, "learning_rate": 0.0004970286652032412, "loss": 5.2933, "mean_token_accuracy": 0.1796172395348549, "num_tokens": 13195111.0, "step": 7605 }, { "entropy": 5.601275491714477, "epoch": 0.5921027037541334, "grad_norm": 1.015625, "learning_rate": 0.0004970241741523667, "loss": 5.3604, "mean_token_accuracy": 0.17476796954870225, "num_tokens": 13204170.0, "step": 7610 }, { "entropy": 5.5979756832122805, "epoch": 0.592491733125851, "grad_norm": 0.984375, "learning_rate": 0.0004970196797326286, "loss": 5.364, "mean_token_accuracy": 0.17164454609155655, "num_tokens": 13213479.0, "step": 7615 }, { "entropy": 5.593438625335693, "epoch": 0.5928807624975686, "grad_norm": 0.97265625, "learning_rate": 0.0004970151819440955, "loss": 5.3883, "mean_token_accuracy": 0.17189265340566634, "num_tokens": 13222182.0, "step": 7620 }, { "entropy": 5.526077461242676, "epoch": 0.5932697918692861, "grad_norm": 0.984375, "learning_rate": 0.0004970106807868351, "loss": 5.2641, "mean_token_accuracy": 0.17490562349557875, "num_tokens": 13230681.0, "step": 7625 }, { "entropy": 5.697098302841186, "epoch": 0.5936588212410037, "grad_norm": 0.9296875, "learning_rate": 0.000497006176260916, "loss": 5.446, "mean_token_accuracy": 0.1732114225625992, "num_tokens": 13239254.0, "step": 7630 }, { "entropy": 5.534705781936646, "epoch": 0.5940478506127213, "grad_norm": 1.0390625, "learning_rate": 0.0004970016683664068, "loss": 5.3178, "mean_token_accuracy": 0.1772586613893509, "num_tokens": 13248317.0, "step": 7635 }, { "entropy": 5.653423500061035, "epoch": 0.5944368799844388, "grad_norm": 1.265625, "learning_rate": 0.0004969971571033754, "loss": 5.3687, "mean_token_accuracy": 0.17507459074258805, "num_tokens": 13256977.0, "step": 7640 }, { "entropy": 5.635997629165649, "epoch": 0.5948259093561564, "grad_norm": 1.1015625, "learning_rate": 0.0004969926424718906, "loss": 5.4371, "mean_token_accuracy": 0.17063387334346772, "num_tokens": 13266012.0, "step": 7645 }, { "entropy": 5.618613338470459, "epoch": 0.5952149387278739, "grad_norm": 0.96875, "learning_rate": 0.0004969881244720207, "loss": 5.4522, "mean_token_accuracy": 0.17322476655244828, "num_tokens": 13275248.0, "step": 7650 }, { "entropy": 5.6184052467346195, "epoch": 0.5956039680995915, "grad_norm": 0.9296875, "learning_rate": 0.0004969836031038343, "loss": 5.3183, "mean_token_accuracy": 0.16789155900478364, "num_tokens": 13284235.0, "step": 7655 }, { "entropy": 5.635403156280518, "epoch": 0.5959929974713091, "grad_norm": 0.984375, "learning_rate": 0.0004969790783674002, "loss": 5.4, "mean_token_accuracy": 0.1698325291275978, "num_tokens": 13292423.0, "step": 7660 }, { "entropy": 5.590408039093018, "epoch": 0.5963820268430267, "grad_norm": 0.91796875, "learning_rate": 0.0004969745502627868, "loss": 5.4235, "mean_token_accuracy": 0.167571958899498, "num_tokens": 13300936.0, "step": 7665 }, { "entropy": 5.5580121040344235, "epoch": 0.5967710562147442, "grad_norm": 0.98828125, "learning_rate": 0.0004969700187900629, "loss": 5.2224, "mean_token_accuracy": 0.18108144104480745, "num_tokens": 13308881.0, "step": 7670 }, { "entropy": 5.607459640502929, "epoch": 0.5971600855864618, "grad_norm": 1.0078125, "learning_rate": 0.0004969654839492973, "loss": 5.4123, "mean_token_accuracy": 0.17161239981651305, "num_tokens": 13317864.0, "step": 7675 }, { "entropy": 5.620231771469117, "epoch": 0.5975491149581793, "grad_norm": 1.0390625, "learning_rate": 0.0004969609457405588, "loss": 5.3725, "mean_token_accuracy": 0.1709914728999138, "num_tokens": 13326990.0, "step": 7680 }, { "entropy": 5.692099857330322, "epoch": 0.5979381443298969, "grad_norm": 1.0, "learning_rate": 0.0004969564041639163, "loss": 5.5486, "mean_token_accuracy": 0.16365605890750884, "num_tokens": 13336437.0, "step": 7685 }, { "entropy": 5.628011226654053, "epoch": 0.5983271737016145, "grad_norm": 0.98828125, "learning_rate": 0.0004969518592194386, "loss": 5.383, "mean_token_accuracy": 0.16583366096019744, "num_tokens": 13345368.0, "step": 7690 }, { "entropy": 5.559656143188477, "epoch": 0.5987162030733321, "grad_norm": 0.9296875, "learning_rate": 0.0004969473109071946, "loss": 5.4253, "mean_token_accuracy": 0.1732177883386612, "num_tokens": 13354171.0, "step": 7695 }, { "entropy": 5.661171102523804, "epoch": 0.5991052324450497, "grad_norm": 1.0078125, "learning_rate": 0.0004969427592272535, "loss": 5.4133, "mean_token_accuracy": 0.16940583735704423, "num_tokens": 13362912.0, "step": 7700 }, { "entropy": 5.636720609664917, "epoch": 0.5994942618167671, "grad_norm": 1.0546875, "learning_rate": 0.0004969382041796843, "loss": 5.3092, "mean_token_accuracy": 0.17516656816005707, "num_tokens": 13370913.0, "step": 7705 }, { "entropy": 5.62378077507019, "epoch": 0.5998832911884847, "grad_norm": 0.99609375, "learning_rate": 0.000496933645764556, "loss": 5.4739, "mean_token_accuracy": 0.16723166555166244, "num_tokens": 13379557.0, "step": 7710 }, { "entropy": 5.5516557693481445, "epoch": 0.6002723205602023, "grad_norm": 1.0, "learning_rate": 0.0004969290839819381, "loss": 5.3666, "mean_token_accuracy": 0.1747287005186081, "num_tokens": 13388129.0, "step": 7715 }, { "entropy": 5.645891332626343, "epoch": 0.6006613499319199, "grad_norm": 1.0078125, "learning_rate": 0.0004969245188318994, "loss": 5.4869, "mean_token_accuracy": 0.17049409300088883, "num_tokens": 13396713.0, "step": 7720 }, { "entropy": 5.645609188079834, "epoch": 0.6010503793036375, "grad_norm": 0.8828125, "learning_rate": 0.0004969199503145093, "loss": 5.4195, "mean_token_accuracy": 0.17086775004863738, "num_tokens": 13406171.0, "step": 7725 }, { "entropy": 5.566971063613892, "epoch": 0.601439408675355, "grad_norm": 1.046875, "learning_rate": 0.0004969153784298374, "loss": 5.3476, "mean_token_accuracy": 0.17182642966508865, "num_tokens": 13415107.0, "step": 7730 }, { "entropy": 5.60140700340271, "epoch": 0.6018284380470725, "grad_norm": 1.078125, "learning_rate": 0.0004969108031779527, "loss": 5.4544, "mean_token_accuracy": 0.1706515446305275, "num_tokens": 13423533.0, "step": 7735 }, { "entropy": 5.673208951950073, "epoch": 0.6022174674187901, "grad_norm": 1.0078125, "learning_rate": 0.0004969062245589247, "loss": 5.4364, "mean_token_accuracy": 0.16617097109556198, "num_tokens": 13432798.0, "step": 7740 }, { "entropy": 5.657231378555298, "epoch": 0.6026064967905077, "grad_norm": 1.0859375, "learning_rate": 0.0004969016425728231, "loss": 5.3837, "mean_token_accuracy": 0.17782800644636154, "num_tokens": 13441123.0, "step": 7745 }, { "entropy": 5.566253709793091, "epoch": 0.6029955261622253, "grad_norm": 1.0078125, "learning_rate": 0.0004968970572197172, "loss": 5.304, "mean_token_accuracy": 0.17716853320598602, "num_tokens": 13449548.0, "step": 7750 }, { "entropy": 5.599495124816895, "epoch": 0.6033845555339428, "grad_norm": 0.96875, "learning_rate": 0.0004968924684996765, "loss": 5.3814, "mean_token_accuracy": 0.1734702154994011, "num_tokens": 13458022.0, "step": 7755 }, { "entropy": 5.591137886047363, "epoch": 0.6037735849056604, "grad_norm": 0.93359375, "learning_rate": 0.000496887876412771, "loss": 5.352, "mean_token_accuracy": 0.1717812716960907, "num_tokens": 13466871.0, "step": 7760 }, { "entropy": 5.614107513427735, "epoch": 0.6041626142773779, "grad_norm": 0.88671875, "learning_rate": 0.0004968832809590701, "loss": 5.3703, "mean_token_accuracy": 0.17414651662111283, "num_tokens": 13475659.0, "step": 7765 }, { "entropy": 5.625330400466919, "epoch": 0.6045516436490955, "grad_norm": 1.046875, "learning_rate": 0.0004968786821386435, "loss": 5.3962, "mean_token_accuracy": 0.16906533837318422, "num_tokens": 13484146.0, "step": 7770 }, { "entropy": 5.612520551681518, "epoch": 0.6049406730208131, "grad_norm": 0.921875, "learning_rate": 0.0004968740799515611, "loss": 5.3949, "mean_token_accuracy": 0.17522106766700746, "num_tokens": 13492831.0, "step": 7775 }, { "entropy": 5.607007646560669, "epoch": 0.6053297023925306, "grad_norm": 0.9765625, "learning_rate": 0.0004968694743978926, "loss": 5.3678, "mean_token_accuracy": 0.17839196920394898, "num_tokens": 13501640.0, "step": 7780 }, { "entropy": 5.655982160568238, "epoch": 0.6057187317642482, "grad_norm": 1.046875, "learning_rate": 0.0004968648654777081, "loss": 5.3845, "mean_token_accuracy": 0.1761223405599594, "num_tokens": 13509816.0, "step": 7785 }, { "entropy": 5.650158643722534, "epoch": 0.6061077611359658, "grad_norm": 1.078125, "learning_rate": 0.0004968602531910773, "loss": 5.4491, "mean_token_accuracy": 0.17165745943784713, "num_tokens": 13518384.0, "step": 7790 }, { "entropy": 5.587653398513794, "epoch": 0.6064967905076833, "grad_norm": 1.0, "learning_rate": 0.0004968556375380704, "loss": 5.3126, "mean_token_accuracy": 0.17027076035737992, "num_tokens": 13527115.0, "step": 7795 }, { "entropy": 5.6321692943573, "epoch": 0.6068858198794009, "grad_norm": 0.97265625, "learning_rate": 0.0004968510185187571, "loss": 5.5346, "mean_token_accuracy": 0.16949589401483536, "num_tokens": 13535743.0, "step": 7800 }, { "entropy": 5.591909599304199, "epoch": 0.6072748492511184, "grad_norm": 0.98046875, "learning_rate": 0.000496846396133208, "loss": 5.3394, "mean_token_accuracy": 0.1780050903558731, "num_tokens": 13544167.0, "step": 7805 }, { "entropy": 5.585002040863037, "epoch": 0.607663878622836, "grad_norm": 1.0390625, "learning_rate": 0.0004968417703814928, "loss": 5.4004, "mean_token_accuracy": 0.1679321452975273, "num_tokens": 13552291.0, "step": 7810 }, { "entropy": 5.6585938930511475, "epoch": 0.6080529079945536, "grad_norm": 1.03125, "learning_rate": 0.0004968371412636818, "loss": 5.4355, "mean_token_accuracy": 0.17032116800546646, "num_tokens": 13561185.0, "step": 7815 }, { "entropy": 5.682382202148437, "epoch": 0.6084419373662712, "grad_norm": 1.1015625, "learning_rate": 0.0004968325087798453, "loss": 5.3238, "mean_token_accuracy": 0.18022632747888565, "num_tokens": 13569815.0, "step": 7820 }, { "entropy": 5.588699150085449, "epoch": 0.6088309667379888, "grad_norm": 0.94921875, "learning_rate": 0.0004968278729300536, "loss": 5.4331, "mean_token_accuracy": 0.16961714923381804, "num_tokens": 13578882.0, "step": 7825 }, { "entropy": 5.57780966758728, "epoch": 0.6092199961097062, "grad_norm": 0.9921875, "learning_rate": 0.0004968232337143769, "loss": 5.3144, "mean_token_accuracy": 0.17948854118585586, "num_tokens": 13587479.0, "step": 7830 }, { "entropy": 5.515082788467407, "epoch": 0.6096090254814238, "grad_norm": 0.98046875, "learning_rate": 0.0004968185911328858, "loss": 5.2152, "mean_token_accuracy": 0.17272976338863372, "num_tokens": 13596049.0, "step": 7835 }, { "entropy": 5.643992233276367, "epoch": 0.6099980548531414, "grad_norm": 0.89453125, "learning_rate": 0.0004968139451856506, "loss": 5.4925, "mean_token_accuracy": 0.1680475354194641, "num_tokens": 13604766.0, "step": 7840 }, { "entropy": 5.6659993648529055, "epoch": 0.610387084224859, "grad_norm": 0.90234375, "learning_rate": 0.0004968092958727419, "loss": 5.4614, "mean_token_accuracy": 0.1690959021449089, "num_tokens": 13614051.0, "step": 7845 }, { "entropy": 5.634029293060303, "epoch": 0.6107761135965766, "grad_norm": 0.9921875, "learning_rate": 0.00049680464319423, "loss": 5.4037, "mean_token_accuracy": 0.17126537561416627, "num_tokens": 13623100.0, "step": 7850 }, { "entropy": 5.656065464019775, "epoch": 0.6111651429682942, "grad_norm": 1.0078125, "learning_rate": 0.0004967999871501858, "loss": 5.4086, "mean_token_accuracy": 0.17563506215810776, "num_tokens": 13631732.0, "step": 7855 }, { "entropy": 5.617393684387207, "epoch": 0.6115541723400116, "grad_norm": 1.0234375, "learning_rate": 0.0004967953277406798, "loss": 5.3901, "mean_token_accuracy": 0.1730097770690918, "num_tokens": 13640355.0, "step": 7860 }, { "entropy": 5.635977268218994, "epoch": 0.6119432017117292, "grad_norm": 1.0234375, "learning_rate": 0.0004967906649657828, "loss": 5.4603, "mean_token_accuracy": 0.1736888751387596, "num_tokens": 13649108.0, "step": 7865 }, { "entropy": 5.610578441619873, "epoch": 0.6123322310834468, "grad_norm": 1.09375, "learning_rate": 0.0004967859988255655, "loss": 5.3027, "mean_token_accuracy": 0.1875598818063736, "num_tokens": 13656765.0, "step": 7870 }, { "entropy": 5.5898693084716795, "epoch": 0.6127212604551644, "grad_norm": 1.09375, "learning_rate": 0.0004967813293200985, "loss": 5.3808, "mean_token_accuracy": 0.17080039381980897, "num_tokens": 13664692.0, "step": 7875 }, { "entropy": 5.491356992721558, "epoch": 0.613110289826882, "grad_norm": 0.93359375, "learning_rate": 0.0004967766564494529, "loss": 5.2597, "mean_token_accuracy": 0.17703975439071656, "num_tokens": 13672913.0, "step": 7880 }, { "entropy": 5.547981834411621, "epoch": 0.6134993191985995, "grad_norm": 1.0703125, "learning_rate": 0.0004967719802136996, "loss": 5.2479, "mean_token_accuracy": 0.1814624547958374, "num_tokens": 13682427.0, "step": 7885 }, { "entropy": 5.589805030822754, "epoch": 0.613888348570317, "grad_norm": 1.0078125, "learning_rate": 0.0004967673006129094, "loss": 5.352, "mean_token_accuracy": 0.17558028995990754, "num_tokens": 13690815.0, "step": 7890 }, { "entropy": 5.6545045375823975, "epoch": 0.6142773779420346, "grad_norm": 1.046875, "learning_rate": 0.0004967626176471536, "loss": 5.4793, "mean_token_accuracy": 0.16500618010759355, "num_tokens": 13699522.0, "step": 7895 }, { "entropy": 5.731170749664306, "epoch": 0.6146664073137522, "grad_norm": 0.9609375, "learning_rate": 0.0004967579313165028, "loss": 5.4809, "mean_token_accuracy": 0.16668136566877365, "num_tokens": 13708075.0, "step": 7900 }, { "entropy": 5.629131746292114, "epoch": 0.6150554366854698, "grad_norm": 0.984375, "learning_rate": 0.0004967532416210284, "loss": 5.3669, "mean_token_accuracy": 0.17131840139627458, "num_tokens": 13716397.0, "step": 7905 }, { "entropy": 5.569436693191529, "epoch": 0.6154444660571873, "grad_norm": 0.921875, "learning_rate": 0.0004967485485608016, "loss": 5.3618, "mean_token_accuracy": 0.17754382640123367, "num_tokens": 13724724.0, "step": 7910 }, { "entropy": 5.581193113327027, "epoch": 0.6158334954289049, "grad_norm": 0.96875, "learning_rate": 0.0004967438521358934, "loss": 5.3233, "mean_token_accuracy": 0.183150814473629, "num_tokens": 13733389.0, "step": 7915 }, { "entropy": 5.581504392623901, "epoch": 0.6162225248006225, "grad_norm": 1.0078125, "learning_rate": 0.0004967391523463754, "loss": 5.2795, "mean_token_accuracy": 0.17858623266220092, "num_tokens": 13742569.0, "step": 7920 }, { "entropy": 5.526614665985107, "epoch": 0.61661155417234, "grad_norm": 1.0234375, "learning_rate": 0.0004967344491923185, "loss": 5.272, "mean_token_accuracy": 0.17839372754096985, "num_tokens": 13750975.0, "step": 7925 }, { "entropy": 5.558490228652954, "epoch": 0.6170005835440576, "grad_norm": 1.109375, "learning_rate": 0.0004967297426737943, "loss": 5.3336, "mean_token_accuracy": 0.18053995072841644, "num_tokens": 13758782.0, "step": 7930 }, { "entropy": 5.655747127532959, "epoch": 0.6173896129157751, "grad_norm": 0.9609375, "learning_rate": 0.0004967250327908742, "loss": 5.4636, "mean_token_accuracy": 0.16564081460237504, "num_tokens": 13767321.0, "step": 7935 }, { "entropy": 5.6967109680175785, "epoch": 0.6177786422874927, "grad_norm": 1.1171875, "learning_rate": 0.0004967203195436297, "loss": 5.4465, "mean_token_accuracy": 0.1746225267648697, "num_tokens": 13775992.0, "step": 7940 }, { "entropy": 5.58898811340332, "epoch": 0.6181676716592103, "grad_norm": 0.96484375, "learning_rate": 0.0004967156029321322, "loss": 5.2813, "mean_token_accuracy": 0.18081785142421722, "num_tokens": 13784358.0, "step": 7945 }, { "entropy": 5.495432949066162, "epoch": 0.6185567010309279, "grad_norm": 0.98046875, "learning_rate": 0.0004967108829564532, "loss": 5.2837, "mean_token_accuracy": 0.18145979791879654, "num_tokens": 13792834.0, "step": 7950 }, { "entropy": 5.627613973617554, "epoch": 0.6189457304026454, "grad_norm": 0.98046875, "learning_rate": 0.0004967061596166646, "loss": 5.3854, "mean_token_accuracy": 0.17125617116689681, "num_tokens": 13801414.0, "step": 7955 }, { "entropy": 5.628814077377319, "epoch": 0.6193347597743629, "grad_norm": 1.078125, "learning_rate": 0.0004967014329128378, "loss": 5.4099, "mean_token_accuracy": 0.17231540232896805, "num_tokens": 13810459.0, "step": 7960 }, { "entropy": 5.581355810165405, "epoch": 0.6197237891460805, "grad_norm": 0.95703125, "learning_rate": 0.0004966967028450448, "loss": 5.2502, "mean_token_accuracy": 0.17979186326265334, "num_tokens": 13818460.0, "step": 7965 }, { "entropy": 5.602181911468506, "epoch": 0.6201128185177981, "grad_norm": 1.0, "learning_rate": 0.000496691969413357, "loss": 5.3718, "mean_token_accuracy": 0.17108058035373688, "num_tokens": 13827693.0, "step": 7970 }, { "entropy": 5.610408926010132, "epoch": 0.6205018478895157, "grad_norm": 1.015625, "learning_rate": 0.0004966872326178466, "loss": 5.3649, "mean_token_accuracy": 0.1674000144004822, "num_tokens": 13836506.0, "step": 7975 }, { "entropy": 5.558001708984375, "epoch": 0.6208908772612333, "grad_norm": 0.94140625, "learning_rate": 0.0004966824924585851, "loss": 5.4006, "mean_token_accuracy": 0.17037640810012816, "num_tokens": 13844977.0, "step": 7980 }, { "entropy": 5.588616037368775, "epoch": 0.6212799066329507, "grad_norm": 0.9609375, "learning_rate": 0.0004966777489356448, "loss": 5.3664, "mean_token_accuracy": 0.17286057770252228, "num_tokens": 13854514.0, "step": 7985 }, { "entropy": 5.607264375686645, "epoch": 0.6216689360046683, "grad_norm": 0.95703125, "learning_rate": 0.0004966730020490975, "loss": 5.3567, "mean_token_accuracy": 0.17180452793836593, "num_tokens": 13863037.0, "step": 7990 }, { "entropy": 5.52875657081604, "epoch": 0.6220579653763859, "grad_norm": 1.015625, "learning_rate": 0.000496668251799015, "loss": 5.3316, "mean_token_accuracy": 0.18510827124118806, "num_tokens": 13871720.0, "step": 7995 }, { "entropy": 5.5923436164855955, "epoch": 0.6224469947481035, "grad_norm": 1.0234375, "learning_rate": 0.0004966634981854699, "loss": 5.3831, "mean_token_accuracy": 0.1798848181962967, "num_tokens": 13880214.0, "step": 8000 }, { "entropy": 5.608328056335449, "epoch": 0.6228360241198211, "grad_norm": 0.97265625, "learning_rate": 0.0004966587412085339, "loss": 5.4798, "mean_token_accuracy": 0.16268185526132584, "num_tokens": 13888784.0, "step": 8005 }, { "entropy": 5.62626895904541, "epoch": 0.6232250534915386, "grad_norm": 1.1484375, "learning_rate": 0.0004966539808682793, "loss": 5.3488, "mean_token_accuracy": 0.17655370533466339, "num_tokens": 13897466.0, "step": 8010 }, { "entropy": 5.555896949768067, "epoch": 0.6236140828632561, "grad_norm": 1.03125, "learning_rate": 0.0004966492171647783, "loss": 5.3722, "mean_token_accuracy": 0.1709124967455864, "num_tokens": 13906556.0, "step": 8015 }, { "entropy": 5.5468177318573, "epoch": 0.6240031122349737, "grad_norm": 0.9453125, "learning_rate": 0.0004966444500981032, "loss": 5.316, "mean_token_accuracy": 0.17478737235069275, "num_tokens": 13915473.0, "step": 8020 }, { "entropy": 5.603696870803833, "epoch": 0.6243921416066913, "grad_norm": 0.98828125, "learning_rate": 0.0004966396796683265, "loss": 5.4901, "mean_token_accuracy": 0.16448316276073455, "num_tokens": 13924775.0, "step": 8025 }, { "entropy": 5.635816383361816, "epoch": 0.6247811709784089, "grad_norm": 0.98828125, "learning_rate": 0.0004966349058755204, "loss": 5.3678, "mean_token_accuracy": 0.16653134822845458, "num_tokens": 13933992.0, "step": 8030 }, { "entropy": 5.6757204055786135, "epoch": 0.6251702003501264, "grad_norm": 1.0390625, "learning_rate": 0.0004966301287197573, "loss": 5.4984, "mean_token_accuracy": 0.17714831978082657, "num_tokens": 13942877.0, "step": 8035 }, { "entropy": 5.570053243637085, "epoch": 0.625559229721844, "grad_norm": 0.9375, "learning_rate": 0.0004966253482011098, "loss": 5.3822, "mean_token_accuracy": 0.17082124948501587, "num_tokens": 13952003.0, "step": 8040 }, { "entropy": 5.638340044021606, "epoch": 0.6259482590935616, "grad_norm": 1.0078125, "learning_rate": 0.0004966205643196503, "loss": 5.3317, "mean_token_accuracy": 0.1808565765619278, "num_tokens": 13959801.0, "step": 8045 }, { "entropy": 5.574903726577759, "epoch": 0.6263372884652791, "grad_norm": 1.03125, "learning_rate": 0.0004966157770754516, "loss": 5.3307, "mean_token_accuracy": 0.16821729838848115, "num_tokens": 13968535.0, "step": 8050 }, { "entropy": 5.579510879516602, "epoch": 0.6267263178369967, "grad_norm": 1.0390625, "learning_rate": 0.000496610986468586, "loss": 5.3052, "mean_token_accuracy": 0.1752540349960327, "num_tokens": 13977079.0, "step": 8055 }, { "entropy": 5.544235515594482, "epoch": 0.6271153472087143, "grad_norm": 1.0390625, "learning_rate": 0.0004966061924991267, "loss": 5.313, "mean_token_accuracy": 0.1814327582716942, "num_tokens": 13985118.0, "step": 8060 }, { "entropy": 5.574939870834351, "epoch": 0.6275043765804318, "grad_norm": 0.96484375, "learning_rate": 0.000496601395167146, "loss": 5.2674, "mean_token_accuracy": 0.175836481153965, "num_tokens": 13994061.0, "step": 8065 }, { "entropy": 5.588698101043701, "epoch": 0.6278934059521494, "grad_norm": 0.96484375, "learning_rate": 0.0004965965944727168, "loss": 5.4225, "mean_token_accuracy": 0.16943728923797607, "num_tokens": 14002879.0, "step": 8070 }, { "entropy": 5.6054764747619625, "epoch": 0.628282435323867, "grad_norm": 1.046875, "learning_rate": 0.0004965917904159121, "loss": 5.3928, "mean_token_accuracy": 0.17182569801807404, "num_tokens": 14011570.0, "step": 8075 }, { "entropy": 5.540693473815918, "epoch": 0.6286714646955845, "grad_norm": 1.0390625, "learning_rate": 0.0004965869829968046, "loss": 5.2401, "mean_token_accuracy": 0.17718469053506852, "num_tokens": 14019282.0, "step": 8080 }, { "entropy": 5.535258197784424, "epoch": 0.6290604940673021, "grad_norm": 1.0703125, "learning_rate": 0.0004965821722154674, "loss": 5.2634, "mean_token_accuracy": 0.18298577517271042, "num_tokens": 14027774.0, "step": 8085 }, { "entropy": 5.539744234085083, "epoch": 0.6294495234390196, "grad_norm": 0.94921875, "learning_rate": 0.0004965773580719734, "loss": 5.2434, "mean_token_accuracy": 0.17935188710689545, "num_tokens": 14036754.0, "step": 8090 }, { "entropy": 5.625921058654785, "epoch": 0.6298385528107372, "grad_norm": 1.0, "learning_rate": 0.0004965725405663957, "loss": 5.4197, "mean_token_accuracy": 0.17523077130317688, "num_tokens": 14045714.0, "step": 8095 }, { "entropy": 5.662188243865967, "epoch": 0.6302275821824548, "grad_norm": 0.984375, "learning_rate": 0.0004965677196988073, "loss": 5.4539, "mean_token_accuracy": 0.16636739373207093, "num_tokens": 14054973.0, "step": 8100 }, { "entropy": 5.639545726776123, "epoch": 0.6306166115541724, "grad_norm": 0.91015625, "learning_rate": 0.0004965628954692815, "loss": 5.3587, "mean_token_accuracy": 0.1728656142950058, "num_tokens": 14064037.0, "step": 8105 }, { "entropy": 5.64419846534729, "epoch": 0.63100564092589, "grad_norm": 1.0390625, "learning_rate": 0.0004965580678778913, "loss": 5.3895, "mean_token_accuracy": 0.17385393232107163, "num_tokens": 14072269.0, "step": 8110 }, { "entropy": 5.581698369979859, "epoch": 0.6313946702976074, "grad_norm": 1.0, "learning_rate": 0.0004965532369247102, "loss": 5.34, "mean_token_accuracy": 0.17125858664512633, "num_tokens": 14080595.0, "step": 8115 }, { "entropy": 5.579161024093628, "epoch": 0.631783699669325, "grad_norm": 1.0546875, "learning_rate": 0.0004965484026098111, "loss": 5.3099, "mean_token_accuracy": 0.17416503578424453, "num_tokens": 14089159.0, "step": 8120 }, { "entropy": 5.63450517654419, "epoch": 0.6321727290410426, "grad_norm": 0.96875, "learning_rate": 0.0004965435649332679, "loss": 5.4103, "mean_token_accuracy": 0.17195792496204376, "num_tokens": 14098192.0, "step": 8125 }, { "entropy": 5.590230131149292, "epoch": 0.6325617584127602, "grad_norm": 0.984375, "learning_rate": 0.0004965387238951536, "loss": 5.2306, "mean_token_accuracy": 0.1833092600107193, "num_tokens": 14106552.0, "step": 8130 }, { "entropy": 5.554232931137085, "epoch": 0.6329507877844778, "grad_norm": 1.078125, "learning_rate": 0.0004965338794955418, "loss": 5.2961, "mean_token_accuracy": 0.17610278874635696, "num_tokens": 14114783.0, "step": 8135 }, { "entropy": 5.547451019287109, "epoch": 0.6333398171561953, "grad_norm": 1.0078125, "learning_rate": 0.0004965290317345061, "loss": 5.3602, "mean_token_accuracy": 0.16638550609350206, "num_tokens": 14124182.0, "step": 8140 }, { "entropy": 5.656743097305298, "epoch": 0.6337288465279128, "grad_norm": 0.94140625, "learning_rate": 0.0004965241806121198, "loss": 5.3824, "mean_token_accuracy": 0.16936965882778168, "num_tokens": 14133037.0, "step": 8145 }, { "entropy": 5.612976551055908, "epoch": 0.6341178758996304, "grad_norm": 0.98828125, "learning_rate": 0.0004965193261284567, "loss": 5.364, "mean_token_accuracy": 0.17326362580060958, "num_tokens": 14141677.0, "step": 8150 }, { "entropy": 5.518466806411743, "epoch": 0.634506905271348, "grad_norm": 1.015625, "learning_rate": 0.0004965144682835904, "loss": 5.3133, "mean_token_accuracy": 0.17942651063203813, "num_tokens": 14149980.0, "step": 8155 }, { "entropy": 5.577079343795776, "epoch": 0.6348959346430656, "grad_norm": 1.03125, "learning_rate": 0.0004965096070775946, "loss": 5.3674, "mean_token_accuracy": 0.18032984137535096, "num_tokens": 14158298.0, "step": 8160 }, { "entropy": 5.589863634109497, "epoch": 0.6352849640147831, "grad_norm": 1.015625, "learning_rate": 0.0004965047425105431, "loss": 5.3223, "mean_token_accuracy": 0.18497874438762665, "num_tokens": 14166321.0, "step": 8165 }, { "entropy": 5.48642930984497, "epoch": 0.6356739933865007, "grad_norm": 1.1015625, "learning_rate": 0.0004964998745825097, "loss": 5.3027, "mean_token_accuracy": 0.18269782811403273, "num_tokens": 14174619.0, "step": 8170 }, { "entropy": 5.537335062026978, "epoch": 0.6360630227582182, "grad_norm": 0.96484375, "learning_rate": 0.0004964950032935682, "loss": 5.2955, "mean_token_accuracy": 0.17796382308006287, "num_tokens": 14183548.0, "step": 8175 }, { "entropy": 5.7116475105285645, "epoch": 0.6364520521299358, "grad_norm": 1.046875, "learning_rate": 0.0004964901286437927, "loss": 5.494, "mean_token_accuracy": 0.17413605600595475, "num_tokens": 14192306.0, "step": 8180 }, { "entropy": 5.5339843273162845, "epoch": 0.6368410815016534, "grad_norm": 1.0234375, "learning_rate": 0.0004964852506332568, "loss": 5.1908, "mean_token_accuracy": 0.18867799490690232, "num_tokens": 14200280.0, "step": 8185 }, { "entropy": 5.540139293670654, "epoch": 0.6372301108733709, "grad_norm": 1.046875, "learning_rate": 0.000496480369262035, "loss": 5.4294, "mean_token_accuracy": 0.1720765322446823, "num_tokens": 14208484.0, "step": 8190 }, { "entropy": 5.579662942886353, "epoch": 0.6376191402450885, "grad_norm": 0.94921875, "learning_rate": 0.000496475484530201, "loss": 5.4106, "mean_token_accuracy": 0.17133046686649323, "num_tokens": 14217368.0, "step": 8195 }, { "entropy": 5.689886903762817, "epoch": 0.6380081696168061, "grad_norm": 0.95703125, "learning_rate": 0.0004964705964378292, "loss": 5.438, "mean_token_accuracy": 0.166541887819767, "num_tokens": 14226663.0, "step": 8200 }, { "entropy": 5.6033202648162845, "epoch": 0.6383971989885237, "grad_norm": 1.0078125, "learning_rate": 0.0004964657049849934, "loss": 5.2964, "mean_token_accuracy": 0.17614648044109343, "num_tokens": 14235153.0, "step": 8205 }, { "entropy": 5.556395196914673, "epoch": 0.6387862283602412, "grad_norm": 0.9609375, "learning_rate": 0.0004964608101717681, "loss": 5.4151, "mean_token_accuracy": 0.1731547698378563, "num_tokens": 14244245.0, "step": 8210 }, { "entropy": 5.605984258651733, "epoch": 0.6391752577319587, "grad_norm": 1.0234375, "learning_rate": 0.0004964559119982275, "loss": 5.3254, "mean_token_accuracy": 0.17295570224523543, "num_tokens": 14252666.0, "step": 8215 }, { "entropy": 5.631249046325683, "epoch": 0.6395642871036763, "grad_norm": 1.0078125, "learning_rate": 0.000496451010464446, "loss": 5.4016, "mean_token_accuracy": 0.17393245548009872, "num_tokens": 14262232.0, "step": 8220 }, { "entropy": 5.62627592086792, "epoch": 0.6399533164753939, "grad_norm": 1.1640625, "learning_rate": 0.0004964461055704978, "loss": 5.3398, "mean_token_accuracy": 0.17456934452056885, "num_tokens": 14270496.0, "step": 8225 }, { "entropy": 5.5464574813842775, "epoch": 0.6403423458471115, "grad_norm": 1.0, "learning_rate": 0.0004964411973164574, "loss": 5.2623, "mean_token_accuracy": 0.18351061046123504, "num_tokens": 14278597.0, "step": 8230 }, { "entropy": 5.544543647766114, "epoch": 0.6407313752188291, "grad_norm": 1.046875, "learning_rate": 0.0004964362857023993, "loss": 5.3248, "mean_token_accuracy": 0.17445123195648193, "num_tokens": 14287444.0, "step": 8235 }, { "entropy": 5.535120153427124, "epoch": 0.6411204045905465, "grad_norm": 1.015625, "learning_rate": 0.000496431370728398, "loss": 5.2631, "mean_token_accuracy": 0.17866938263177873, "num_tokens": 14296041.0, "step": 8240 }, { "entropy": 5.575885438919068, "epoch": 0.6415094339622641, "grad_norm": 0.97265625, "learning_rate": 0.0004964264523945281, "loss": 5.2654, "mean_token_accuracy": 0.17801269739866257, "num_tokens": 14304700.0, "step": 8245 }, { "entropy": 5.615669870376587, "epoch": 0.6418984633339817, "grad_norm": 0.9609375, "learning_rate": 0.0004964215307008643, "loss": 5.3976, "mean_token_accuracy": 0.17064619660377503, "num_tokens": 14312873.0, "step": 8250 }, { "entropy": 5.623337507247925, "epoch": 0.6422874927056993, "grad_norm": 0.984375, "learning_rate": 0.0004964166056474811, "loss": 5.3849, "mean_token_accuracy": 0.1692052811384201, "num_tokens": 14321697.0, "step": 8255 }, { "entropy": 5.58499116897583, "epoch": 0.6426765220774169, "grad_norm": 1.03125, "learning_rate": 0.0004964116772344534, "loss": 5.3774, "mean_token_accuracy": 0.16862674802541733, "num_tokens": 14330074.0, "step": 8260 }, { "entropy": 5.659800958633423, "epoch": 0.6430655514491345, "grad_norm": 0.98828125, "learning_rate": 0.0004964067454618559, "loss": 5.4435, "mean_token_accuracy": 0.16576170325279235, "num_tokens": 14339485.0, "step": 8265 }, { "entropy": 5.680325651168824, "epoch": 0.6434545808208519, "grad_norm": 1.0078125, "learning_rate": 0.0004964018103297634, "loss": 5.4143, "mean_token_accuracy": 0.1698738992214203, "num_tokens": 14348182.0, "step": 8270 }, { "entropy": 5.692117309570312, "epoch": 0.6438436101925695, "grad_norm": 0.9296875, "learning_rate": 0.0004963968718382509, "loss": 5.4582, "mean_token_accuracy": 0.1681407019495964, "num_tokens": 14357202.0, "step": 8275 }, { "entropy": 5.604986333847046, "epoch": 0.6442326395642871, "grad_norm": 0.9453125, "learning_rate": 0.0004963919299873931, "loss": 5.3812, "mean_token_accuracy": 0.1657526060938835, "num_tokens": 14366001.0, "step": 8280 }, { "entropy": 5.664509963989258, "epoch": 0.6446216689360047, "grad_norm": 1.0625, "learning_rate": 0.0004963869847772653, "loss": 5.4065, "mean_token_accuracy": 0.16915652602910997, "num_tokens": 14374894.0, "step": 8285 }, { "entropy": 5.562790155410767, "epoch": 0.6450106983077223, "grad_norm": 1.1171875, "learning_rate": 0.0004963820362079423, "loss": 5.3809, "mean_token_accuracy": 0.17515988796949386, "num_tokens": 14383396.0, "step": 8290 }, { "entropy": 5.58872127532959, "epoch": 0.6453997276794398, "grad_norm": 1.015625, "learning_rate": 0.0004963770842794994, "loss": 5.2961, "mean_token_accuracy": 0.18302446156740187, "num_tokens": 14392514.0, "step": 8295 }, { "entropy": 5.607506370544433, "epoch": 0.6457887570511573, "grad_norm": 1.0703125, "learning_rate": 0.0004963721289920115, "loss": 5.3395, "mean_token_accuracy": 0.1733679324388504, "num_tokens": 14401916.0, "step": 8300 }, { "entropy": 5.592385196685791, "epoch": 0.6461777864228749, "grad_norm": 0.9609375, "learning_rate": 0.0004963671703455538, "loss": 5.406, "mean_token_accuracy": 0.17042556703090667, "num_tokens": 14410476.0, "step": 8305 }, { "entropy": 5.610119152069092, "epoch": 0.6465668157945925, "grad_norm": 1.0703125, "learning_rate": 0.0004963622083402018, "loss": 5.3981, "mean_token_accuracy": 0.17096285223960878, "num_tokens": 14418437.0, "step": 8310 }, { "entropy": 5.557107162475586, "epoch": 0.6469558451663101, "grad_norm": 1.1015625, "learning_rate": 0.0004963572429760305, "loss": 5.3384, "mean_token_accuracy": 0.17626968324184417, "num_tokens": 14426978.0, "step": 8315 }, { "entropy": 5.637966680526733, "epoch": 0.6473448745380276, "grad_norm": 1.0546875, "learning_rate": 0.0004963522742531155, "loss": 5.3646, "mean_token_accuracy": 0.17541678845882416, "num_tokens": 14435043.0, "step": 8320 }, { "entropy": 5.583234119415283, "epoch": 0.6477339039097452, "grad_norm": 0.9765625, "learning_rate": 0.000496347302171532, "loss": 5.2759, "mean_token_accuracy": 0.18421368151903153, "num_tokens": 14443397.0, "step": 8325 }, { "entropy": 5.574254941940308, "epoch": 0.6481229332814628, "grad_norm": 0.96875, "learning_rate": 0.0004963423267313554, "loss": 5.3712, "mean_token_accuracy": 0.17410993427038193, "num_tokens": 14452536.0, "step": 8330 }, { "entropy": 5.595439624786377, "epoch": 0.6485119626531803, "grad_norm": 1.09375, "learning_rate": 0.0004963373479326614, "loss": 5.4407, "mean_token_accuracy": 0.16464628130197526, "num_tokens": 14461901.0, "step": 8335 }, { "entropy": 5.591050386428833, "epoch": 0.6489009920248979, "grad_norm": 0.94140625, "learning_rate": 0.0004963323657755255, "loss": 5.3376, "mean_token_accuracy": 0.17729219943284988, "num_tokens": 14470547.0, "step": 8340 }, { "entropy": 5.528455781936645, "epoch": 0.6492900213966154, "grad_norm": 1.0234375, "learning_rate": 0.0004963273802600231, "loss": 5.2297, "mean_token_accuracy": 0.17649297267198563, "num_tokens": 14478439.0, "step": 8345 }, { "entropy": 5.617388200759888, "epoch": 0.649679050768333, "grad_norm": 1.015625, "learning_rate": 0.00049632239138623, "loss": 5.2801, "mean_token_accuracy": 0.18349619209766388, "num_tokens": 14486621.0, "step": 8350 }, { "entropy": 5.562037467956543, "epoch": 0.6500680801400506, "grad_norm": 0.97265625, "learning_rate": 0.0004963173991542219, "loss": 5.2874, "mean_token_accuracy": 0.17734003514051438, "num_tokens": 14495313.0, "step": 8355 }, { "entropy": 5.617541790008545, "epoch": 0.6504571095117682, "grad_norm": 1.0, "learning_rate": 0.0004963124035640746, "loss": 5.3475, "mean_token_accuracy": 0.1766296923160553, "num_tokens": 14503647.0, "step": 8360 }, { "entropy": 5.613102531433105, "epoch": 0.6508461388834857, "grad_norm": 0.9375, "learning_rate": 0.0004963074046158637, "loss": 5.2805, "mean_token_accuracy": 0.1789421707391739, "num_tokens": 14512350.0, "step": 8365 }, { "entropy": 5.6533385753631595, "epoch": 0.6512351682552032, "grad_norm": 1.046875, "learning_rate": 0.0004963024023096652, "loss": 5.4291, "mean_token_accuracy": 0.1655445083975792, "num_tokens": 14521801.0, "step": 8370 }, { "entropy": 5.554292678833008, "epoch": 0.6516241976269208, "grad_norm": 1.0, "learning_rate": 0.0004962973966455551, "loss": 5.259, "mean_token_accuracy": 0.1753644213080406, "num_tokens": 14530045.0, "step": 8375 }, { "entropy": 5.60089373588562, "epoch": 0.6520132269986384, "grad_norm": 1.0234375, "learning_rate": 0.0004962923876236092, "loss": 5.3808, "mean_token_accuracy": 0.1721917897462845, "num_tokens": 14538944.0, "step": 8380 }, { "entropy": 5.680092430114746, "epoch": 0.652402256370356, "grad_norm": 1.015625, "learning_rate": 0.0004962873752439035, "loss": 5.3918, "mean_token_accuracy": 0.17222664952278138, "num_tokens": 14548180.0, "step": 8385 }, { "entropy": 5.645467519760132, "epoch": 0.6527912857420736, "grad_norm": 1.046875, "learning_rate": 0.0004962823595065141, "loss": 5.4098, "mean_token_accuracy": 0.17034562826156616, "num_tokens": 14556907.0, "step": 8390 }, { "entropy": 5.578256464004516, "epoch": 0.653180315113791, "grad_norm": 0.98046875, "learning_rate": 0.0004962773404115172, "loss": 5.3816, "mean_token_accuracy": 0.17010515034198762, "num_tokens": 14565317.0, "step": 8395 }, { "entropy": 5.6273193359375, "epoch": 0.6535693444855086, "grad_norm": 0.921875, "learning_rate": 0.0004962723179589886, "loss": 5.4375, "mean_token_accuracy": 0.17320182919502258, "num_tokens": 14574485.0, "step": 8400 }, { "entropy": 5.6831926822662355, "epoch": 0.6539583738572262, "grad_norm": 1.0390625, "learning_rate": 0.000496267292149005, "loss": 5.3366, "mean_token_accuracy": 0.17173146307468415, "num_tokens": 14584002.0, "step": 8405 }, { "entropy": 5.620897436141968, "epoch": 0.6543474032289438, "grad_norm": 1.0625, "learning_rate": 0.0004962622629816423, "loss": 5.2866, "mean_token_accuracy": 0.17372749596834183, "num_tokens": 14592033.0, "step": 8410 }, { "entropy": 5.575413608551026, "epoch": 0.6547364326006614, "grad_norm": 0.98828125, "learning_rate": 0.000496257230456977, "loss": 5.4229, "mean_token_accuracy": 0.16647793501615524, "num_tokens": 14600084.0, "step": 8415 }, { "entropy": 5.549050331115723, "epoch": 0.6551254619723789, "grad_norm": 1.0546875, "learning_rate": 0.0004962521945750855, "loss": 5.3345, "mean_token_accuracy": 0.18473218381404877, "num_tokens": 14608380.0, "step": 8420 }, { "entropy": 5.601489877700805, "epoch": 0.6555144913440965, "grad_norm": 1.0078125, "learning_rate": 0.000496247155336044, "loss": 5.3939, "mean_token_accuracy": 0.17354901134967804, "num_tokens": 14616864.0, "step": 8425 }, { "entropy": 5.623040390014649, "epoch": 0.655903520715814, "grad_norm": 1.03125, "learning_rate": 0.0004962421127399291, "loss": 5.4296, "mean_token_accuracy": 0.1710478574037552, "num_tokens": 14627054.0, "step": 8430 }, { "entropy": 5.670633983612061, "epoch": 0.6562925500875316, "grad_norm": 1.015625, "learning_rate": 0.0004962370667868172, "loss": 5.3229, "mean_token_accuracy": 0.17703424990177155, "num_tokens": 14634985.0, "step": 8435 }, { "entropy": 5.643927383422851, "epoch": 0.6566815794592492, "grad_norm": 1.03125, "learning_rate": 0.0004962320174767851, "loss": 5.3916, "mean_token_accuracy": 0.18009753823280333, "num_tokens": 14644135.0, "step": 8440 }, { "entropy": 5.552023220062256, "epoch": 0.6570706088309667, "grad_norm": 0.97265625, "learning_rate": 0.000496226964809909, "loss": 5.3505, "mean_token_accuracy": 0.17871672064065933, "num_tokens": 14652997.0, "step": 8445 }, { "entropy": 5.575016212463379, "epoch": 0.6574596382026843, "grad_norm": 0.99609375, "learning_rate": 0.000496221908786266, "loss": 5.4318, "mean_token_accuracy": 0.1723785251379013, "num_tokens": 14661961.0, "step": 8450 }, { "entropy": 5.677073335647583, "epoch": 0.6578486675744019, "grad_norm": 0.96484375, "learning_rate": 0.0004962168494059327, "loss": 5.5334, "mean_token_accuracy": 0.1619396537542343, "num_tokens": 14671407.0, "step": 8455 }, { "entropy": 5.653186559677124, "epoch": 0.6582376969461194, "grad_norm": 1.140625, "learning_rate": 0.0004962117866689857, "loss": 5.3801, "mean_token_accuracy": 0.17210789620876313, "num_tokens": 14680015.0, "step": 8460 }, { "entropy": 5.530022239685058, "epoch": 0.658626726317837, "grad_norm": 1.078125, "learning_rate": 0.000496206720575502, "loss": 5.2363, "mean_token_accuracy": 0.17737187445163727, "num_tokens": 14688444.0, "step": 8465 }, { "entropy": 5.562881183624268, "epoch": 0.6590157556895546, "grad_norm": 1.0078125, "learning_rate": 0.0004962016511255584, "loss": 5.3704, "mean_token_accuracy": 0.1729799672961235, "num_tokens": 14697246.0, "step": 8470 }, { "entropy": 5.561779022216797, "epoch": 0.6594047850612721, "grad_norm": 1.015625, "learning_rate": 0.0004961965783192318, "loss": 5.2517, "mean_token_accuracy": 0.18331620693206788, "num_tokens": 14706066.0, "step": 8475 }, { "entropy": 5.601294326782226, "epoch": 0.6597938144329897, "grad_norm": 0.98046875, "learning_rate": 0.0004961915021565992, "loss": 5.3758, "mean_token_accuracy": 0.16975661367177963, "num_tokens": 14714327.0, "step": 8480 }, { "entropy": 5.552827501296997, "epoch": 0.6601828438047073, "grad_norm": 1.0390625, "learning_rate": 0.0004961864226377377, "loss": 5.2382, "mean_token_accuracy": 0.17383477240800857, "num_tokens": 14723053.0, "step": 8485 }, { "entropy": 5.542729759216309, "epoch": 0.6605718731764249, "grad_norm": 0.984375, "learning_rate": 0.0004961813397627241, "loss": 5.2263, "mean_token_accuracy": 0.1823290318250656, "num_tokens": 14731825.0, "step": 8490 }, { "entropy": 5.584241247177124, "epoch": 0.6609609025481424, "grad_norm": 1.03125, "learning_rate": 0.0004961762535316358, "loss": 5.4327, "mean_token_accuracy": 0.16857006251811982, "num_tokens": 14740751.0, "step": 8495 }, { "entropy": 5.608772897720337, "epoch": 0.6613499319198599, "grad_norm": 1.0390625, "learning_rate": 0.0004961711639445499, "loss": 5.3014, "mean_token_accuracy": 0.1776784747838974, "num_tokens": 14748994.0, "step": 8500 }, { "entropy": 5.606518363952636, "epoch": 0.6617389612915775, "grad_norm": 1.03125, "learning_rate": 0.0004961660710015435, "loss": 5.2935, "mean_token_accuracy": 0.17489899098873138, "num_tokens": 14757388.0, "step": 8505 }, { "entropy": 5.676743650436402, "epoch": 0.6621279906632951, "grad_norm": 0.99609375, "learning_rate": 0.0004961609747026943, "loss": 5.4395, "mean_token_accuracy": 0.16976004093885422, "num_tokens": 14766654.0, "step": 8510 }, { "entropy": 5.580006885528564, "epoch": 0.6625170200350127, "grad_norm": 0.953125, "learning_rate": 0.0004961558750480791, "loss": 5.3578, "mean_token_accuracy": 0.17017442137002944, "num_tokens": 14775561.0, "step": 8515 }, { "entropy": 5.593653726577759, "epoch": 0.6629060494067303, "grad_norm": 1.015625, "learning_rate": 0.0004961507720377756, "loss": 5.4202, "mean_token_accuracy": 0.16423940807580947, "num_tokens": 14783596.0, "step": 8520 }, { "entropy": 5.634108591079712, "epoch": 0.6632950787784477, "grad_norm": 0.98046875, "learning_rate": 0.0004961456656718611, "loss": 5.4294, "mean_token_accuracy": 0.16964395791292192, "num_tokens": 14791932.0, "step": 8525 }, { "entropy": 5.652415704727173, "epoch": 0.6636841081501653, "grad_norm": 0.98046875, "learning_rate": 0.000496140555950413, "loss": 5.4536, "mean_token_accuracy": 0.16912026405334474, "num_tokens": 14801261.0, "step": 8530 }, { "entropy": 5.6047392845153805, "epoch": 0.6640731375218829, "grad_norm": 0.96875, "learning_rate": 0.0004961354428735091, "loss": 5.3357, "mean_token_accuracy": 0.17305805534124374, "num_tokens": 14809788.0, "step": 8535 }, { "entropy": 5.545555257797242, "epoch": 0.6644621668936005, "grad_norm": 0.9453125, "learning_rate": 0.0004961303264412267, "loss": 5.3274, "mean_token_accuracy": 0.17021722495555877, "num_tokens": 14818324.0, "step": 8540 }, { "entropy": 5.526040124893188, "epoch": 0.6648511962653181, "grad_norm": 0.91796875, "learning_rate": 0.0004961252066536437, "loss": 5.2805, "mean_token_accuracy": 0.17774665653705596, "num_tokens": 14827020.0, "step": 8545 }, { "entropy": 5.564234209060669, "epoch": 0.6652402256370356, "grad_norm": 1.0078125, "learning_rate": 0.0004961200835108375, "loss": 5.3871, "mean_token_accuracy": 0.1685611218214035, "num_tokens": 14835522.0, "step": 8550 }, { "entropy": 5.63460865020752, "epoch": 0.6656292550087531, "grad_norm": 1.0078125, "learning_rate": 0.000496114957012886, "loss": 5.3465, "mean_token_accuracy": 0.17625492215156555, "num_tokens": 14844676.0, "step": 8555 }, { "entropy": 5.653724718093872, "epoch": 0.6660182843804707, "grad_norm": 1.0078125, "learning_rate": 0.0004961098271598671, "loss": 5.3852, "mean_token_accuracy": 0.17274842262268067, "num_tokens": 14853996.0, "step": 8560 }, { "entropy": 5.612109565734864, "epoch": 0.6664073137521883, "grad_norm": 1.0078125, "learning_rate": 0.0004961046939518585, "loss": 5.3729, "mean_token_accuracy": 0.17253222763538362, "num_tokens": 14862981.0, "step": 8565 }, { "entropy": 5.613665246963501, "epoch": 0.6667963431239059, "grad_norm": 0.93359375, "learning_rate": 0.0004960995573889379, "loss": 5.4015, "mean_token_accuracy": 0.16996358931064606, "num_tokens": 14872378.0, "step": 8570 }, { "entropy": 5.558696269989014, "epoch": 0.6671853724956234, "grad_norm": 0.9609375, "learning_rate": 0.0004960944174711836, "loss": 5.3487, "mean_token_accuracy": 0.1734008237719536, "num_tokens": 14881662.0, "step": 8575 }, { "entropy": 5.628997802734375, "epoch": 0.667574401867341, "grad_norm": 1.046875, "learning_rate": 0.0004960892741986734, "loss": 5.2375, "mean_token_accuracy": 0.17901071906089783, "num_tokens": 14890211.0, "step": 8580 }, { "entropy": 5.663716506958008, "epoch": 0.6679634312390585, "grad_norm": 0.98046875, "learning_rate": 0.0004960841275714853, "loss": 5.4768, "mean_token_accuracy": 0.165939624607563, "num_tokens": 14899865.0, "step": 8585 }, { "entropy": 5.59187388420105, "epoch": 0.6683524606107761, "grad_norm": 1.1015625, "learning_rate": 0.0004960789775896975, "loss": 5.375, "mean_token_accuracy": 0.1709680363535881, "num_tokens": 14908334.0, "step": 8590 }, { "entropy": 5.546440458297729, "epoch": 0.6687414899824937, "grad_norm": 0.98828125, "learning_rate": 0.0004960738242533881, "loss": 5.3263, "mean_token_accuracy": 0.17018923163414001, "num_tokens": 14916477.0, "step": 8595 }, { "entropy": 5.534609317779541, "epoch": 0.6691305193542112, "grad_norm": 1.0546875, "learning_rate": 0.0004960686675626353, "loss": 5.2612, "mean_token_accuracy": 0.18023026138544082, "num_tokens": 14925223.0, "step": 8600 }, { "entropy": 5.615374946594239, "epoch": 0.6695195487259288, "grad_norm": 0.984375, "learning_rate": 0.0004960635075175173, "loss": 5.4224, "mean_token_accuracy": 0.1766976684331894, "num_tokens": 14934427.0, "step": 8605 }, { "entropy": 5.660296106338501, "epoch": 0.6699085780976464, "grad_norm": 0.9765625, "learning_rate": 0.0004960583441181124, "loss": 5.3294, "mean_token_accuracy": 0.17061750888824462, "num_tokens": 14943175.0, "step": 8610 }, { "entropy": 5.641629028320312, "epoch": 0.670297607469364, "grad_norm": 1.0390625, "learning_rate": 0.0004960531773644992, "loss": 5.3658, "mean_token_accuracy": 0.17371981889009475, "num_tokens": 14951933.0, "step": 8615 }, { "entropy": 5.539992618560791, "epoch": 0.6706866368410815, "grad_norm": 1.0, "learning_rate": 0.0004960480072567557, "loss": 5.3346, "mean_token_accuracy": 0.17478349655866623, "num_tokens": 14960735.0, "step": 8620 }, { "entropy": 5.596373748779297, "epoch": 0.671075666212799, "grad_norm": 0.93359375, "learning_rate": 0.0004960428337949604, "loss": 5.4398, "mean_token_accuracy": 0.16128688901662827, "num_tokens": 14970326.0, "step": 8625 }, { "entropy": 5.629201078414917, "epoch": 0.6714646955845166, "grad_norm": 1.03125, "learning_rate": 0.0004960376569791921, "loss": 5.2938, "mean_token_accuracy": 0.17815542072057725, "num_tokens": 14979822.0, "step": 8630 }, { "entropy": 5.6754405975341795, "epoch": 0.6718537249562342, "grad_norm": 1.0, "learning_rate": 0.0004960324768095291, "loss": 5.4085, "mean_token_accuracy": 0.1730176329612732, "num_tokens": 14989350.0, "step": 8635 }, { "entropy": 5.6606629371643065, "epoch": 0.6722427543279518, "grad_norm": 0.96484375, "learning_rate": 0.0004960272932860502, "loss": 5.4147, "mean_token_accuracy": 0.16840969920158386, "num_tokens": 14998763.0, "step": 8640 }, { "entropy": 5.59739351272583, "epoch": 0.6726317836996694, "grad_norm": 0.9609375, "learning_rate": 0.0004960221064088338, "loss": 5.2809, "mean_token_accuracy": 0.17504533380270004, "num_tokens": 15006497.0, "step": 8645 }, { "entropy": 5.513886976242065, "epoch": 0.6730208130713868, "grad_norm": 0.96875, "learning_rate": 0.0004960169161779588, "loss": 5.2495, "mean_token_accuracy": 0.17931035459041594, "num_tokens": 15014397.0, "step": 8650 }, { "entropy": 5.548941230773925, "epoch": 0.6734098424431044, "grad_norm": 1.03125, "learning_rate": 0.0004960117225935038, "loss": 5.2764, "mean_token_accuracy": 0.18180057406425476, "num_tokens": 15022726.0, "step": 8655 }, { "entropy": 5.680811405181885, "epoch": 0.673798871814822, "grad_norm": 1.0078125, "learning_rate": 0.0004960065256555477, "loss": 5.4944, "mean_token_accuracy": 0.1663055121898651, "num_tokens": 15032317.0, "step": 8660 }, { "entropy": 5.596422576904297, "epoch": 0.6741879011865396, "grad_norm": 0.96875, "learning_rate": 0.0004960013253641695, "loss": 5.3526, "mean_token_accuracy": 0.17427897900342942, "num_tokens": 15041091.0, "step": 8665 }, { "entropy": 5.630930995941162, "epoch": 0.6745769305582572, "grad_norm": 0.94921875, "learning_rate": 0.0004959961217194477, "loss": 5.495, "mean_token_accuracy": 0.16269925981760025, "num_tokens": 15049797.0, "step": 8670 }, { "entropy": 5.549777984619141, "epoch": 0.6749659599299748, "grad_norm": 1.078125, "learning_rate": 0.0004959909147214615, "loss": 5.1909, "mean_token_accuracy": 0.18470783829689025, "num_tokens": 15057736.0, "step": 8675 }, { "entropy": 5.5708211898803714, "epoch": 0.6753549893016922, "grad_norm": 1.046875, "learning_rate": 0.0004959857043702902, "loss": 5.362, "mean_token_accuracy": 0.1793429061770439, "num_tokens": 15066072.0, "step": 8680 }, { "entropy": 5.529650020599365, "epoch": 0.6757440186734098, "grad_norm": 1.078125, "learning_rate": 0.0004959804906660124, "loss": 5.2662, "mean_token_accuracy": 0.1785495787858963, "num_tokens": 15073918.0, "step": 8685 }, { "entropy": 5.613301610946655, "epoch": 0.6761330480451274, "grad_norm": 0.921875, "learning_rate": 0.0004959752736087073, "loss": 5.3614, "mean_token_accuracy": 0.1788905903697014, "num_tokens": 15082937.0, "step": 8690 }, { "entropy": 5.559736108779907, "epoch": 0.676522077416845, "grad_norm": 1.1015625, "learning_rate": 0.0004959700531984543, "loss": 5.3177, "mean_token_accuracy": 0.18061764240264894, "num_tokens": 15091218.0, "step": 8695 }, { "entropy": 5.553287220001221, "epoch": 0.6769111067885626, "grad_norm": 1.0625, "learning_rate": 0.0004959648294353324, "loss": 5.2474, "mean_token_accuracy": 0.18204528391361235, "num_tokens": 15099640.0, "step": 8700 }, { "entropy": 5.599412107467652, "epoch": 0.6773001361602801, "grad_norm": 0.95703125, "learning_rate": 0.0004959596023194208, "loss": 5.3279, "mean_token_accuracy": 0.17507115006446838, "num_tokens": 15108710.0, "step": 8705 }, { "entropy": 5.5698775291442875, "epoch": 0.6776891655319977, "grad_norm": 1.015625, "learning_rate": 0.000495954371850799, "loss": 5.2904, "mean_token_accuracy": 0.17398254275321962, "num_tokens": 15117074.0, "step": 8710 }, { "entropy": 5.6180814743042, "epoch": 0.6780781949037152, "grad_norm": 1.0625, "learning_rate": 0.0004959491380295463, "loss": 5.2742, "mean_token_accuracy": 0.17939819693565368, "num_tokens": 15124714.0, "step": 8715 }, { "entropy": 5.544650268554688, "epoch": 0.6784672242754328, "grad_norm": 0.99609375, "learning_rate": 0.0004959439008557422, "loss": 5.3062, "mean_token_accuracy": 0.1737214908003807, "num_tokens": 15134177.0, "step": 8720 }, { "entropy": 5.614916658401489, "epoch": 0.6788562536471504, "grad_norm": 1.046875, "learning_rate": 0.000495938660329466, "loss": 5.3171, "mean_token_accuracy": 0.17673608660697937, "num_tokens": 15142659.0, "step": 8725 }, { "entropy": 5.581689453125, "epoch": 0.6792452830188679, "grad_norm": 0.98046875, "learning_rate": 0.0004959334164507973, "loss": 5.4753, "mean_token_accuracy": 0.1690713033080101, "num_tokens": 15151423.0, "step": 8730 }, { "entropy": 5.582829475402832, "epoch": 0.6796343123905855, "grad_norm": 0.91796875, "learning_rate": 0.0004959281692198155, "loss": 5.2525, "mean_token_accuracy": 0.17850179523229598, "num_tokens": 15159986.0, "step": 8735 }, { "entropy": 5.616036605834961, "epoch": 0.6800233417623031, "grad_norm": 1.0625, "learning_rate": 0.0004959229186366007, "loss": 5.3328, "mean_token_accuracy": 0.17353588789701463, "num_tokens": 15168183.0, "step": 8740 }, { "entropy": 5.525445938110352, "epoch": 0.6804123711340206, "grad_norm": 1.0234375, "learning_rate": 0.000495917664701232, "loss": 5.243, "mean_token_accuracy": 0.18078750669956206, "num_tokens": 15176476.0, "step": 8745 }, { "entropy": 5.673672342300415, "epoch": 0.6808014005057382, "grad_norm": 0.9296875, "learning_rate": 0.0004959124074137894, "loss": 5.5157, "mean_token_accuracy": 0.16620651483535767, "num_tokens": 15186873.0, "step": 8750 }, { "entropy": 5.639481735229492, "epoch": 0.6811904298774557, "grad_norm": 0.99609375, "learning_rate": 0.0004959071467743526, "loss": 5.309, "mean_token_accuracy": 0.16986880004405974, "num_tokens": 15194965.0, "step": 8755 }, { "entropy": 5.551694726943969, "epoch": 0.6815794592491733, "grad_norm": 1.0234375, "learning_rate": 0.0004959018827830016, "loss": 5.1768, "mean_token_accuracy": 0.18066548109054564, "num_tokens": 15204028.0, "step": 8760 }, { "entropy": 5.494821929931641, "epoch": 0.6819684886208909, "grad_norm": 1.0625, "learning_rate": 0.000495896615439816, "loss": 5.2047, "mean_token_accuracy": 0.1873243436217308, "num_tokens": 15212011.0, "step": 8765 }, { "entropy": 5.519406366348266, "epoch": 0.6823575179926085, "grad_norm": 1.0234375, "learning_rate": 0.0004958913447448759, "loss": 5.288, "mean_token_accuracy": 0.17712078392505645, "num_tokens": 15220088.0, "step": 8770 }, { "entropy": 5.612569952011109, "epoch": 0.682746547364326, "grad_norm": 1.0390625, "learning_rate": 0.0004958860706982613, "loss": 5.2461, "mean_token_accuracy": 0.1817832812666893, "num_tokens": 15228676.0, "step": 8775 }, { "entropy": 5.540105104446411, "epoch": 0.6831355767360435, "grad_norm": 0.95703125, "learning_rate": 0.000495880793300052, "loss": 5.2864, "mean_token_accuracy": 0.1815814346075058, "num_tokens": 15237392.0, "step": 8780 }, { "entropy": 5.54796781539917, "epoch": 0.6835246061077611, "grad_norm": 1.0078125, "learning_rate": 0.0004958755125503284, "loss": 5.4185, "mean_token_accuracy": 0.1767105430364609, "num_tokens": 15246738.0, "step": 8785 }, { "entropy": 5.647914218902588, "epoch": 0.6839136354794787, "grad_norm": 1.015625, "learning_rate": 0.0004958702284491703, "loss": 5.3897, "mean_token_accuracy": 0.1756160721182823, "num_tokens": 15255154.0, "step": 8790 }, { "entropy": 5.57085337638855, "epoch": 0.6843026648511963, "grad_norm": 0.91015625, "learning_rate": 0.0004958649409966581, "loss": 5.2768, "mean_token_accuracy": 0.18078256845474244, "num_tokens": 15264178.0, "step": 8795 }, { "entropy": 5.605639028549194, "epoch": 0.6846916942229139, "grad_norm": 1.046875, "learning_rate": 0.000495859650192872, "loss": 5.3878, "mean_token_accuracy": 0.17433761656284333, "num_tokens": 15272591.0, "step": 8800 }, { "entropy": 5.59878191947937, "epoch": 0.6850807235946313, "grad_norm": 0.984375, "learning_rate": 0.0004958543560378922, "loss": 5.2939, "mean_token_accuracy": 0.16908714026212693, "num_tokens": 15281280.0, "step": 8805 }, { "entropy": 5.593587160110474, "epoch": 0.6854697529663489, "grad_norm": 0.99609375, "learning_rate": 0.0004958490585317991, "loss": 5.2382, "mean_token_accuracy": 0.1843152090907097, "num_tokens": 15290639.0, "step": 8810 }, { "entropy": 5.52235860824585, "epoch": 0.6858587823380665, "grad_norm": 1.0625, "learning_rate": 0.000495843757674673, "loss": 5.2296, "mean_token_accuracy": 0.1753144696354866, "num_tokens": 15298877.0, "step": 8815 }, { "entropy": 5.596991682052613, "epoch": 0.6862478117097841, "grad_norm": 0.9375, "learning_rate": 0.0004958384534665945, "loss": 5.3783, "mean_token_accuracy": 0.17458462715148926, "num_tokens": 15307710.0, "step": 8820 }, { "entropy": 5.633730268478393, "epoch": 0.6866368410815017, "grad_norm": 1.09375, "learning_rate": 0.0004958331459076438, "loss": 5.3891, "mean_token_accuracy": 0.17663782089948654, "num_tokens": 15315749.0, "step": 8825 }, { "entropy": 5.661491775512696, "epoch": 0.6870258704532192, "grad_norm": 0.97265625, "learning_rate": 0.0004958278349979018, "loss": 5.3432, "mean_token_accuracy": 0.16726212650537492, "num_tokens": 15324161.0, "step": 8830 }, { "entropy": 5.476969242095947, "epoch": 0.6874148998249368, "grad_norm": 1.0390625, "learning_rate": 0.0004958225207374488, "loss": 5.2393, "mean_token_accuracy": 0.17856181263923646, "num_tokens": 15333414.0, "step": 8835 }, { "entropy": 5.547606134414673, "epoch": 0.6878039291966543, "grad_norm": 1.0546875, "learning_rate": 0.0004958172031263655, "loss": 5.3028, "mean_token_accuracy": 0.17507703602313995, "num_tokens": 15342369.0, "step": 8840 }, { "entropy": 5.619305086135864, "epoch": 0.6881929585683719, "grad_norm": 1.046875, "learning_rate": 0.0004958118821647326, "loss": 5.3836, "mean_token_accuracy": 0.17099674493074418, "num_tokens": 15351109.0, "step": 8845 }, { "entropy": 5.574743413925171, "epoch": 0.6885819879400895, "grad_norm": 0.9921875, "learning_rate": 0.0004958065578526308, "loss": 5.2711, "mean_token_accuracy": 0.1795060008764267, "num_tokens": 15359837.0, "step": 8850 }, { "entropy": 5.53717565536499, "epoch": 0.688971017311807, "grad_norm": 0.9375, "learning_rate": 0.000495801230190141, "loss": 5.3116, "mean_token_accuracy": 0.18208779990673066, "num_tokens": 15368776.0, "step": 8855 }, { "entropy": 5.568300533294678, "epoch": 0.6893600466835246, "grad_norm": 0.9375, "learning_rate": 0.0004957958991773441, "loss": 5.3055, "mean_token_accuracy": 0.17928243428468704, "num_tokens": 15378127.0, "step": 8860 }, { "entropy": 5.579755067825317, "epoch": 0.6897490760552422, "grad_norm": 1.015625, "learning_rate": 0.0004957905648143206, "loss": 5.2787, "mean_token_accuracy": 0.17940096259117128, "num_tokens": 15386580.0, "step": 8865 }, { "entropy": 5.584767055511475, "epoch": 0.6901381054269597, "grad_norm": 0.91015625, "learning_rate": 0.0004957852271011519, "loss": 5.405, "mean_token_accuracy": 0.17330296337604523, "num_tokens": 15395973.0, "step": 8870 }, { "entropy": 5.606221294403076, "epoch": 0.6905271347986773, "grad_norm": 0.9609375, "learning_rate": 0.0004957798860379187, "loss": 5.3118, "mean_token_accuracy": 0.1782598003745079, "num_tokens": 15404738.0, "step": 8875 }, { "entropy": 5.622283554077148, "epoch": 0.6909161641703949, "grad_norm": 1.0078125, "learning_rate": 0.0004957745416247022, "loss": 5.4441, "mean_token_accuracy": 0.1751920148730278, "num_tokens": 15413530.0, "step": 8880 }, { "entropy": 5.633462619781494, "epoch": 0.6913051935421124, "grad_norm": 0.87109375, "learning_rate": 0.0004957691938615833, "loss": 5.4183, "mean_token_accuracy": 0.1715339332818985, "num_tokens": 15423268.0, "step": 8885 }, { "entropy": 5.574162769317627, "epoch": 0.69169422291383, "grad_norm": 1.0234375, "learning_rate": 0.0004957638427486434, "loss": 5.2495, "mean_token_accuracy": 0.18264658004045486, "num_tokens": 15431690.0, "step": 8890 }, { "entropy": 5.598479509353638, "epoch": 0.6920832522855476, "grad_norm": 0.98046875, "learning_rate": 0.0004957584882859636, "loss": 5.3982, "mean_token_accuracy": 0.16933944076299667, "num_tokens": 15440110.0, "step": 8895 }, { "entropy": 5.663942480087281, "epoch": 0.6924722816572652, "grad_norm": 1.03125, "learning_rate": 0.0004957531304736251, "loss": 5.4078, "mean_token_accuracy": 0.17168613970279695, "num_tokens": 15449022.0, "step": 8900 }, { "entropy": 5.677679395675659, "epoch": 0.6928613110289827, "grad_norm": 0.96484375, "learning_rate": 0.0004957477693117091, "loss": 5.4359, "mean_token_accuracy": 0.16897011548280716, "num_tokens": 15457826.0, "step": 8905 }, { "entropy": 5.600473356246948, "epoch": 0.6932503404007002, "grad_norm": 0.98828125, "learning_rate": 0.0004957424048002971, "loss": 5.3552, "mean_token_accuracy": 0.17295342981815337, "num_tokens": 15466631.0, "step": 8910 }, { "entropy": 5.5296543598175045, "epoch": 0.6936393697724178, "grad_norm": 1.046875, "learning_rate": 0.0004957370369394706, "loss": 5.2514, "mean_token_accuracy": 0.17798096388578416, "num_tokens": 15474666.0, "step": 8915 }, { "entropy": 5.53621883392334, "epoch": 0.6940283991441354, "grad_norm": 1.0078125, "learning_rate": 0.0004957316657293107, "loss": 5.2409, "mean_token_accuracy": 0.1825147047638893, "num_tokens": 15483576.0, "step": 8920 }, { "entropy": 5.751343250274658, "epoch": 0.694417428515853, "grad_norm": 0.98046875, "learning_rate": 0.0004957262911698992, "loss": 5.3941, "mean_token_accuracy": 0.17334622144699097, "num_tokens": 15491313.0, "step": 8925 }, { "entropy": 5.640914344787598, "epoch": 0.6948064578875706, "grad_norm": 0.9765625, "learning_rate": 0.0004957209132613175, "loss": 5.3363, "mean_token_accuracy": 0.17856969833374023, "num_tokens": 15500638.0, "step": 8930 }, { "entropy": 5.565763854980469, "epoch": 0.695195487259288, "grad_norm": 1.015625, "learning_rate": 0.0004957155320036473, "loss": 5.3285, "mean_token_accuracy": 0.17599815875291824, "num_tokens": 15509170.0, "step": 8935 }, { "entropy": 5.678889417648316, "epoch": 0.6955845166310056, "grad_norm": 1.0, "learning_rate": 0.0004957101473969702, "loss": 5.4244, "mean_token_accuracy": 0.16916741132736207, "num_tokens": 15518108.0, "step": 8940 }, { "entropy": 5.578175735473633, "epoch": 0.6959735460027232, "grad_norm": 1.0, "learning_rate": 0.000495704759441368, "loss": 5.29, "mean_token_accuracy": 0.1825377270579338, "num_tokens": 15526558.0, "step": 8945 }, { "entropy": 5.577849960327148, "epoch": 0.6963625753744408, "grad_norm": 0.94921875, "learning_rate": 0.0004956993681369221, "loss": 5.2647, "mean_token_accuracy": 0.17751545161008836, "num_tokens": 15535685.0, "step": 8950 }, { "entropy": 5.555082225799561, "epoch": 0.6967516047461584, "grad_norm": 1.0390625, "learning_rate": 0.0004956939734837148, "loss": 5.3069, "mean_token_accuracy": 0.18180457949638368, "num_tokens": 15544072.0, "step": 8955 }, { "entropy": 5.575622272491455, "epoch": 0.6971406341178759, "grad_norm": 1.046875, "learning_rate": 0.0004956885754818277, "loss": 5.4028, "mean_token_accuracy": 0.1679277539253235, "num_tokens": 15553303.0, "step": 8960 }, { "entropy": 5.61887001991272, "epoch": 0.6975296634895934, "grad_norm": 0.94921875, "learning_rate": 0.0004956831741313427, "loss": 5.3316, "mean_token_accuracy": 0.17559644281864167, "num_tokens": 15561942.0, "step": 8965 }, { "entropy": 5.5660655975341795, "epoch": 0.697918692861311, "grad_norm": 1.0234375, "learning_rate": 0.0004956777694323418, "loss": 5.1906, "mean_token_accuracy": 0.18667613863945007, "num_tokens": 15569988.0, "step": 8970 }, { "entropy": 5.58125638961792, "epoch": 0.6983077222330286, "grad_norm": 1.015625, "learning_rate": 0.000495672361384907, "loss": 5.3878, "mean_token_accuracy": 0.1742572844028473, "num_tokens": 15579816.0, "step": 8975 }, { "entropy": 5.611002349853516, "epoch": 0.6986967516047462, "grad_norm": 1.0078125, "learning_rate": 0.0004956669499891202, "loss": 5.2717, "mean_token_accuracy": 0.17696754336357118, "num_tokens": 15587843.0, "step": 8980 }, { "entropy": 5.579117298126221, "epoch": 0.6990857809764637, "grad_norm": 0.9296875, "learning_rate": 0.0004956615352450639, "loss": 5.3207, "mean_token_accuracy": 0.17747793793678285, "num_tokens": 15596798.0, "step": 8985 }, { "entropy": 5.588120603561402, "epoch": 0.6994748103481813, "grad_norm": 0.97265625, "learning_rate": 0.0004956561171528198, "loss": 5.4235, "mean_token_accuracy": 0.1786605969071388, "num_tokens": 15605360.0, "step": 8990 }, { "entropy": 5.573551416397095, "epoch": 0.6998638397198989, "grad_norm": 0.96484375, "learning_rate": 0.0004956506957124704, "loss": 5.2779, "mean_token_accuracy": 0.18233997970819474, "num_tokens": 15613557.0, "step": 8995 }, { "entropy": 5.566599798202515, "epoch": 0.7002528690916164, "grad_norm": 0.98046875, "learning_rate": 0.000495645270924098, "loss": 5.3547, "mean_token_accuracy": 0.17617263793945312, "num_tokens": 15622144.0, "step": 9000 }, { "epoch": 0.7002528690916164, "eval_entropy": 5.384195727218907, "eval_loss": 5.35413932800293, "eval_mean_token_accuracy": 0.18322673444568938, "eval_num_tokens": 15622144.0, "eval_runtime": 21.6228, "eval_samples_per_second": 1921.957, "eval_steps_per_second": 240.256, "step": 9000 }, { "entropy": 5.5418754577636715, "epoch": 0.700641898463334, "grad_norm": 0.97265625, "learning_rate": 0.0004956398427877847, "loss": 5.2871, "mean_token_accuracy": 0.17854682952165604, "num_tokens": 15631119.0, "step": 9005 }, { "entropy": 5.5199097156524655, "epoch": 0.7010309278350515, "grad_norm": 0.9921875, "learning_rate": 0.000495634411303613, "loss": 5.204, "mean_token_accuracy": 0.18505824506282806, "num_tokens": 15639969.0, "step": 9010 }, { "entropy": 5.551648426055908, "epoch": 0.7014199572067691, "grad_norm": 1.0859375, "learning_rate": 0.0004956289764716654, "loss": 5.3377, "mean_token_accuracy": 0.17793741226196289, "num_tokens": 15648522.0, "step": 9015 }, { "entropy": 5.524827766418457, "epoch": 0.7018089865784867, "grad_norm": 1.0703125, "learning_rate": 0.0004956235382920241, "loss": 5.2618, "mean_token_accuracy": 0.17254749685525894, "num_tokens": 15656834.0, "step": 9020 }, { "entropy": 5.66479754447937, "epoch": 0.7021980159502043, "grad_norm": 1.0078125, "learning_rate": 0.0004956180967647717, "loss": 5.4573, "mean_token_accuracy": 0.1677004277706146, "num_tokens": 15665066.0, "step": 9025 }, { "entropy": 5.605295324325562, "epoch": 0.7025870453219218, "grad_norm": 1.046875, "learning_rate": 0.0004956126518899911, "loss": 5.3422, "mean_token_accuracy": 0.17819261848926543, "num_tokens": 15673733.0, "step": 9030 }, { "entropy": 5.6864011764526365, "epoch": 0.7029760746936393, "grad_norm": 1.0078125, "learning_rate": 0.0004956072036677644, "loss": 5.3775, "mean_token_accuracy": 0.1767784833908081, "num_tokens": 15682212.0, "step": 9035 }, { "entropy": 5.5967779636383055, "epoch": 0.7033651040653569, "grad_norm": 1.0546875, "learning_rate": 0.0004956017520981746, "loss": 5.3616, "mean_token_accuracy": 0.1693396046757698, "num_tokens": 15690518.0, "step": 9040 }, { "entropy": 5.656971168518067, "epoch": 0.7037541334370745, "grad_norm": 0.9765625, "learning_rate": 0.0004955962971813044, "loss": 5.41, "mean_token_accuracy": 0.1654631972312927, "num_tokens": 15699474.0, "step": 9045 }, { "entropy": 5.683543634414673, "epoch": 0.7041431628087921, "grad_norm": 0.97265625, "learning_rate": 0.0004955908389172364, "loss": 5.4212, "mean_token_accuracy": 0.17195746153593064, "num_tokens": 15708571.0, "step": 9050 }, { "entropy": 5.708956527709961, "epoch": 0.7045321921805097, "grad_norm": 0.96484375, "learning_rate": 0.0004955853773060536, "loss": 5.4089, "mean_token_accuracy": 0.1737460657954216, "num_tokens": 15717307.0, "step": 9055 }, { "entropy": 5.600407600402832, "epoch": 0.7049212215522271, "grad_norm": 1.0625, "learning_rate": 0.0004955799123478388, "loss": 5.1901, "mean_token_accuracy": 0.18662470281124116, "num_tokens": 15725502.0, "step": 9060 }, { "entropy": 5.536356353759766, "epoch": 0.7053102509239447, "grad_norm": 0.93359375, "learning_rate": 0.0004955744440426748, "loss": 5.4074, "mean_token_accuracy": 0.1703765869140625, "num_tokens": 15734805.0, "step": 9065 }, { "entropy": 5.601238012313843, "epoch": 0.7056992802956623, "grad_norm": 0.92578125, "learning_rate": 0.0004955689723906448, "loss": 5.258, "mean_token_accuracy": 0.1776318818330765, "num_tokens": 15743313.0, "step": 9070 }, { "entropy": 5.553364896774292, "epoch": 0.7060883096673799, "grad_norm": 1.0234375, "learning_rate": 0.0004955634973918318, "loss": 5.2177, "mean_token_accuracy": 0.18231946974992752, "num_tokens": 15752552.0, "step": 9075 }, { "entropy": 5.623722982406616, "epoch": 0.7064773390390975, "grad_norm": 1.0546875, "learning_rate": 0.0004955580190463186, "loss": 5.3135, "mean_token_accuracy": 0.1862163260579109, "num_tokens": 15761404.0, "step": 9080 }, { "entropy": 5.648780250549317, "epoch": 0.7068663684108151, "grad_norm": 0.94140625, "learning_rate": 0.0004955525373541886, "loss": 5.3778, "mean_token_accuracy": 0.17349406629800795, "num_tokens": 15770605.0, "step": 9085 }, { "entropy": 5.516891813278198, "epoch": 0.7072553977825325, "grad_norm": 1.1171875, "learning_rate": 0.0004955470523155249, "loss": 5.268, "mean_token_accuracy": 0.17934121787548066, "num_tokens": 15778047.0, "step": 9090 }, { "entropy": 5.537967300415039, "epoch": 0.7076444271542501, "grad_norm": 0.96484375, "learning_rate": 0.0004955415639304107, "loss": 5.3323, "mean_token_accuracy": 0.17830815613269807, "num_tokens": 15788304.0, "step": 9095 }, { "entropy": 5.617676544189453, "epoch": 0.7080334565259677, "grad_norm": 1.015625, "learning_rate": 0.0004955360721989292, "loss": 5.3359, "mean_token_accuracy": 0.17249158769845963, "num_tokens": 15796448.0, "step": 9100 }, { "entropy": 5.555719661712646, "epoch": 0.7084224858976853, "grad_norm": 0.99609375, "learning_rate": 0.0004955305771211641, "loss": 5.2904, "mean_token_accuracy": 0.17670710235834122, "num_tokens": 15805072.0, "step": 9105 }, { "entropy": 5.572696495056152, "epoch": 0.7088115152694029, "grad_norm": 0.9921875, "learning_rate": 0.0004955250786971982, "loss": 5.3442, "mean_token_accuracy": 0.1760936662554741, "num_tokens": 15813918.0, "step": 9110 }, { "entropy": 5.7184289455413815, "epoch": 0.7092005446411204, "grad_norm": 1.0078125, "learning_rate": 0.0004955195769271154, "loss": 5.4707, "mean_token_accuracy": 0.17003964632749557, "num_tokens": 15822675.0, "step": 9115 }, { "entropy": 5.6127406597137455, "epoch": 0.709589574012838, "grad_norm": 1.078125, "learning_rate": 0.0004955140718109991, "loss": 5.356, "mean_token_accuracy": 0.17116720974445343, "num_tokens": 15831056.0, "step": 9120 }, { "entropy": 5.630828237533569, "epoch": 0.7099786033845555, "grad_norm": 0.92578125, "learning_rate": 0.0004955085633489326, "loss": 5.4178, "mean_token_accuracy": 0.16970840990543365, "num_tokens": 15839948.0, "step": 9125 }, { "entropy": 5.632455205917358, "epoch": 0.7103676327562731, "grad_norm": 1.09375, "learning_rate": 0.0004955030515409997, "loss": 5.316, "mean_token_accuracy": 0.1776179775595665, "num_tokens": 15848738.0, "step": 9130 }, { "entropy": 5.609870433807373, "epoch": 0.7107566621279907, "grad_norm": 0.90234375, "learning_rate": 0.0004954975363872838, "loss": 5.3776, "mean_token_accuracy": 0.1716231659054756, "num_tokens": 15859073.0, "step": 9135 }, { "entropy": 5.601574182510376, "epoch": 0.7111456914997082, "grad_norm": 0.91796875, "learning_rate": 0.0004954920178878689, "loss": 5.2674, "mean_token_accuracy": 0.18010449558496475, "num_tokens": 15868146.0, "step": 9140 }, { "entropy": 5.528825283050537, "epoch": 0.7115347208714258, "grad_norm": 0.9765625, "learning_rate": 0.0004954864960428385, "loss": 5.2252, "mean_token_accuracy": 0.1761257156729698, "num_tokens": 15876915.0, "step": 9145 }, { "entropy": 5.556982183456421, "epoch": 0.7119237502431434, "grad_norm": 1.078125, "learning_rate": 0.0004954809708522765, "loss": 5.309, "mean_token_accuracy": 0.17798453122377395, "num_tokens": 15884947.0, "step": 9150 }, { "entropy": 5.611155080795288, "epoch": 0.712312779614861, "grad_norm": 0.9140625, "learning_rate": 0.0004954754423162667, "loss": 5.3015, "mean_token_accuracy": 0.1726186603307724, "num_tokens": 15894595.0, "step": 9155 }, { "entropy": 5.616395807266235, "epoch": 0.7127018089865785, "grad_norm": 1.0078125, "learning_rate": 0.000495469910434893, "loss": 5.2993, "mean_token_accuracy": 0.18139362037181855, "num_tokens": 15902920.0, "step": 9160 }, { "entropy": 5.5656671047210695, "epoch": 0.713090838358296, "grad_norm": 1.078125, "learning_rate": 0.0004954643752082392, "loss": 5.2935, "mean_token_accuracy": 0.1780125841498375, "num_tokens": 15911414.0, "step": 9165 }, { "entropy": 5.6202209949493405, "epoch": 0.7134798677300136, "grad_norm": 1.1015625, "learning_rate": 0.0004954588366363896, "loss": 5.3907, "mean_token_accuracy": 0.1711605429649353, "num_tokens": 15919855.0, "step": 9170 }, { "entropy": 5.557894134521485, "epoch": 0.7138688971017312, "grad_norm": 0.90625, "learning_rate": 0.0004954532947194279, "loss": 5.3023, "mean_token_accuracy": 0.17727120369672775, "num_tokens": 15928932.0, "step": 9175 }, { "entropy": 5.638629388809204, "epoch": 0.7142579264734488, "grad_norm": 0.94140625, "learning_rate": 0.0004954477494574384, "loss": 5.3705, "mean_token_accuracy": 0.17425462752580642, "num_tokens": 15938266.0, "step": 9180 }, { "entropy": 5.692516899108886, "epoch": 0.7146469558451664, "grad_norm": 0.93359375, "learning_rate": 0.0004954422008505052, "loss": 5.3944, "mean_token_accuracy": 0.16764615774154662, "num_tokens": 15947100.0, "step": 9185 }, { "entropy": 5.611473178863525, "epoch": 0.7150359852168838, "grad_norm": 1.1328125, "learning_rate": 0.0004954366488987125, "loss": 5.3783, "mean_token_accuracy": 0.1700735718011856, "num_tokens": 15955544.0, "step": 9190 }, { "entropy": 5.652182483673096, "epoch": 0.7154250145886014, "grad_norm": 1.0390625, "learning_rate": 0.0004954310936021444, "loss": 5.4001, "mean_token_accuracy": 0.17192965745925903, "num_tokens": 15963372.0, "step": 9195 }, { "entropy": 5.644375038146973, "epoch": 0.715814043960319, "grad_norm": 0.9921875, "learning_rate": 0.0004954255349608853, "loss": 5.3771, "mean_token_accuracy": 0.16869236081838607, "num_tokens": 15972940.0, "step": 9200 }, { "entropy": 5.633125686645508, "epoch": 0.7162030733320366, "grad_norm": 1.03125, "learning_rate": 0.0004954199729750198, "loss": 5.3375, "mean_token_accuracy": 0.16978246420621873, "num_tokens": 15982238.0, "step": 9205 }, { "entropy": 5.624726867675781, "epoch": 0.7165921027037542, "grad_norm": 0.9921875, "learning_rate": 0.0004954144076446318, "loss": 5.3454, "mean_token_accuracy": 0.17483690232038498, "num_tokens": 15990835.0, "step": 9210 }, { "entropy": 5.633648681640625, "epoch": 0.7169811320754716, "grad_norm": 1.0625, "learning_rate": 0.0004954088389698061, "loss": 5.4455, "mean_token_accuracy": 0.17005229145288467, "num_tokens": 16000649.0, "step": 9215 }, { "entropy": 5.612905120849609, "epoch": 0.7173701614471892, "grad_norm": 1.0625, "learning_rate": 0.000495403266950627, "loss": 5.3601, "mean_token_accuracy": 0.17579613029956817, "num_tokens": 16009214.0, "step": 9220 }, { "entropy": 5.648853302001953, "epoch": 0.7177591908189068, "grad_norm": 0.96875, "learning_rate": 0.0004953976915871792, "loss": 5.3409, "mean_token_accuracy": 0.1749788999557495, "num_tokens": 16018173.0, "step": 9225 }, { "entropy": 5.549958801269531, "epoch": 0.7181482201906244, "grad_norm": 0.99609375, "learning_rate": 0.0004953921128795472, "loss": 5.2362, "mean_token_accuracy": 0.18928415328264236, "num_tokens": 16026857.0, "step": 9230 }, { "entropy": 5.589247131347657, "epoch": 0.718537249562342, "grad_norm": 0.953125, "learning_rate": 0.0004953865308278156, "loss": 5.4026, "mean_token_accuracy": 0.16704169660806656, "num_tokens": 16035792.0, "step": 9235 }, { "entropy": 5.623420095443725, "epoch": 0.7189262789340595, "grad_norm": 0.96484375, "learning_rate": 0.0004953809454320693, "loss": 5.3325, "mean_token_accuracy": 0.1779796898365021, "num_tokens": 16044874.0, "step": 9240 }, { "entropy": 5.614606761932373, "epoch": 0.7193153083057771, "grad_norm": 0.9375, "learning_rate": 0.0004953753566923929, "loss": 5.3004, "mean_token_accuracy": 0.17517977058887482, "num_tokens": 16053705.0, "step": 9245 }, { "entropy": 5.5654683113098145, "epoch": 0.7197043376774946, "grad_norm": 1.0234375, "learning_rate": 0.0004953697646088712, "loss": 5.3101, "mean_token_accuracy": 0.1744338884949684, "num_tokens": 16062987.0, "step": 9250 }, { "entropy": 5.558124971389771, "epoch": 0.7200933670492122, "grad_norm": 1.0234375, "learning_rate": 0.0004953641691815891, "loss": 5.2853, "mean_token_accuracy": 0.1788240686058998, "num_tokens": 16071247.0, "step": 9255 }, { "entropy": 5.530323934555054, "epoch": 0.7204823964209298, "grad_norm": 1.0234375, "learning_rate": 0.0004953585704106315, "loss": 5.2264, "mean_token_accuracy": 0.1773939922451973, "num_tokens": 16080190.0, "step": 9260 }, { "entropy": 5.575647354125977, "epoch": 0.7208714257926473, "grad_norm": 0.96484375, "learning_rate": 0.0004953529682960832, "loss": 5.3155, "mean_token_accuracy": 0.17726240903139115, "num_tokens": 16088885.0, "step": 9265 }, { "entropy": 5.561666536331177, "epoch": 0.7212604551643649, "grad_norm": 1.015625, "learning_rate": 0.0004953473628380295, "loss": 5.2756, "mean_token_accuracy": 0.17821484357118605, "num_tokens": 16097202.0, "step": 9270 }, { "entropy": 5.588506174087525, "epoch": 0.7216494845360825, "grad_norm": 0.99609375, "learning_rate": 0.0004953417540365553, "loss": 5.2431, "mean_token_accuracy": 0.18142793625593184, "num_tokens": 16105468.0, "step": 9275 }, { "entropy": 5.64068570137024, "epoch": 0.7220385139078, "grad_norm": 0.97265625, "learning_rate": 0.0004953361418917455, "loss": 5.3979, "mean_token_accuracy": 0.1801755577325821, "num_tokens": 16114624.0, "step": 9280 }, { "entropy": 5.530179595947265, "epoch": 0.7224275432795176, "grad_norm": 1.0390625, "learning_rate": 0.0004953305264036856, "loss": 5.2353, "mean_token_accuracy": 0.17767134457826614, "num_tokens": 16123983.0, "step": 9285 }, { "entropy": 5.638651132583618, "epoch": 0.7228165726512352, "grad_norm": 1.0546875, "learning_rate": 0.0004953249075724607, "loss": 5.3471, "mean_token_accuracy": 0.17877227663993836, "num_tokens": 16132886.0, "step": 9290 }, { "entropy": 5.554377841949463, "epoch": 0.7232056020229527, "grad_norm": 1.03125, "learning_rate": 0.0004953192853981559, "loss": 5.1984, "mean_token_accuracy": 0.1873273730278015, "num_tokens": 16141526.0, "step": 9295 }, { "entropy": 5.576457214355469, "epoch": 0.7235946313946703, "grad_norm": 1.0234375, "learning_rate": 0.0004953136598808566, "loss": 5.3813, "mean_token_accuracy": 0.18493103832006455, "num_tokens": 16149949.0, "step": 9300 }, { "entropy": 5.608815240859985, "epoch": 0.7239836607663879, "grad_norm": 1.03125, "learning_rate": 0.0004953080310206481, "loss": 5.3449, "mean_token_accuracy": 0.17716638147830963, "num_tokens": 16158131.0, "step": 9305 }, { "entropy": 5.501528787612915, "epoch": 0.7243726901381055, "grad_norm": 0.99609375, "learning_rate": 0.0004953023988176162, "loss": 5.2499, "mean_token_accuracy": 0.17929585576057433, "num_tokens": 16167131.0, "step": 9310 }, { "entropy": 5.6442553997039795, "epoch": 0.724761719509823, "grad_norm": 1.046875, "learning_rate": 0.0004952967632718458, "loss": 5.4633, "mean_token_accuracy": 0.1731911689043045, "num_tokens": 16176198.0, "step": 9315 }, { "entropy": 5.592202043533325, "epoch": 0.7251507488815405, "grad_norm": 1.1015625, "learning_rate": 0.0004952911243834227, "loss": 5.3427, "mean_token_accuracy": 0.17611104547977446, "num_tokens": 16184860.0, "step": 9320 }, { "entropy": 5.593503427505493, "epoch": 0.7255397782532581, "grad_norm": 1.0859375, "learning_rate": 0.0004952854821524324, "loss": 5.328, "mean_token_accuracy": 0.17426833510398865, "num_tokens": 16193126.0, "step": 9325 }, { "entropy": 5.5762348651885985, "epoch": 0.7259288076249757, "grad_norm": 1.03125, "learning_rate": 0.0004952798365789606, "loss": 5.3067, "mean_token_accuracy": 0.17548383623361588, "num_tokens": 16201763.0, "step": 9330 }, { "entropy": 5.575831174850464, "epoch": 0.7263178369966933, "grad_norm": 0.93359375, "learning_rate": 0.0004952741876630928, "loss": 5.2582, "mean_token_accuracy": 0.18297910690307617, "num_tokens": 16210947.0, "step": 9335 }, { "entropy": 5.614086771011353, "epoch": 0.7267068663684109, "grad_norm": 0.96484375, "learning_rate": 0.0004952685354049148, "loss": 5.3308, "mean_token_accuracy": 0.17360346168279647, "num_tokens": 16219772.0, "step": 9340 }, { "entropy": 5.637112236022949, "epoch": 0.7270958957401283, "grad_norm": 0.99609375, "learning_rate": 0.0004952628798045124, "loss": 5.3211, "mean_token_accuracy": 0.18236895203590392, "num_tokens": 16227759.0, "step": 9345 }, { "entropy": 5.549534940719605, "epoch": 0.7274849251118459, "grad_norm": 0.93359375, "learning_rate": 0.0004952572208619714, "loss": 5.2177, "mean_token_accuracy": 0.17939460426568984, "num_tokens": 16236913.0, "step": 9350 }, { "entropy": 5.581374168395996, "epoch": 0.7278739544835635, "grad_norm": 1.015625, "learning_rate": 0.0004952515585773778, "loss": 5.3427, "mean_token_accuracy": 0.17206512838602067, "num_tokens": 16246190.0, "step": 9355 }, { "entropy": 5.5773841381073, "epoch": 0.7282629838552811, "grad_norm": 0.94921875, "learning_rate": 0.0004952458929508171, "loss": 5.3031, "mean_token_accuracy": 0.1751967504620552, "num_tokens": 16255476.0, "step": 9360 }, { "entropy": 5.584682369232178, "epoch": 0.7286520132269987, "grad_norm": 1.0, "learning_rate": 0.0004952402239823757, "loss": 5.331, "mean_token_accuracy": 0.1706559732556343, "num_tokens": 16264701.0, "step": 9365 }, { "entropy": 5.441281652450561, "epoch": 0.7290410425987162, "grad_norm": 0.9609375, "learning_rate": 0.0004952345516721393, "loss": 5.1648, "mean_token_accuracy": 0.18849799335002898, "num_tokens": 16272999.0, "step": 9370 }, { "entropy": 5.66496958732605, "epoch": 0.7294300719704337, "grad_norm": 1.0, "learning_rate": 0.0004952288760201942, "loss": 5.4418, "mean_token_accuracy": 0.17025233134627343, "num_tokens": 16282537.0, "step": 9375 }, { "entropy": 5.633242988586426, "epoch": 0.7298191013421513, "grad_norm": 0.97265625, "learning_rate": 0.0004952231970266265, "loss": 5.3001, "mean_token_accuracy": 0.17955290973186494, "num_tokens": 16291155.0, "step": 9380 }, { "entropy": 5.643191957473755, "epoch": 0.7302081307138689, "grad_norm": 1.0078125, "learning_rate": 0.0004952175146915223, "loss": 5.3829, "mean_token_accuracy": 0.1692135140299797, "num_tokens": 16300466.0, "step": 9385 }, { "entropy": 5.596168661117554, "epoch": 0.7305971600855865, "grad_norm": 1.0859375, "learning_rate": 0.0004952118290149679, "loss": 5.2849, "mean_token_accuracy": 0.1738765999674797, "num_tokens": 16309250.0, "step": 9390 }, { "entropy": 5.647305631637574, "epoch": 0.730986189457304, "grad_norm": 0.9765625, "learning_rate": 0.0004952061399970492, "loss": 5.3829, "mean_token_accuracy": 0.17449599206447602, "num_tokens": 16318056.0, "step": 9395 }, { "entropy": 5.538020944595337, "epoch": 0.7313752188290216, "grad_norm": 1.0703125, "learning_rate": 0.000495200447637853, "loss": 5.2386, "mean_token_accuracy": 0.17811905592679977, "num_tokens": 16326455.0, "step": 9400 }, { "entropy": 5.510137224197388, "epoch": 0.7317642482007392, "grad_norm": 1.0625, "learning_rate": 0.0004951947519374655, "loss": 5.227, "mean_token_accuracy": 0.18160680383443834, "num_tokens": 16334584.0, "step": 9405 }, { "entropy": 5.5503466606140135, "epoch": 0.7321532775724567, "grad_norm": 1.0703125, "learning_rate": 0.0004951890528959731, "loss": 5.2573, "mean_token_accuracy": 0.18433501571416855, "num_tokens": 16342361.0, "step": 9410 }, { "entropy": 5.635887479782104, "epoch": 0.7325423069441743, "grad_norm": 1.0859375, "learning_rate": 0.0004951833505134623, "loss": 5.3919, "mean_token_accuracy": 0.17290140837430953, "num_tokens": 16350414.0, "step": 9415 }, { "entropy": 5.500445413589477, "epoch": 0.7329313363158918, "grad_norm": 1.015625, "learning_rate": 0.0004951776447900196, "loss": 5.2269, "mean_token_accuracy": 0.18617474734783174, "num_tokens": 16359266.0, "step": 9420 }, { "entropy": 5.4902732372283936, "epoch": 0.7333203656876094, "grad_norm": 1.03125, "learning_rate": 0.0004951719357257317, "loss": 5.2058, "mean_token_accuracy": 0.1826066866517067, "num_tokens": 16367558.0, "step": 9425 }, { "entropy": 5.451519298553467, "epoch": 0.733709395059327, "grad_norm": 1.015625, "learning_rate": 0.000495166223320685, "loss": 5.1901, "mean_token_accuracy": 0.184382164478302, "num_tokens": 16375690.0, "step": 9430 }, { "entropy": 5.5959672927856445, "epoch": 0.7340984244310446, "grad_norm": 1.0625, "learning_rate": 0.0004951605075749662, "loss": 5.3103, "mean_token_accuracy": 0.17972762435674666, "num_tokens": 16384157.0, "step": 9435 }, { "entropy": 5.613910102844239, "epoch": 0.7344874538027621, "grad_norm": 1.1015625, "learning_rate": 0.0004951547884886623, "loss": 5.3572, "mean_token_accuracy": 0.18060232400894166, "num_tokens": 16392153.0, "step": 9440 }, { "entropy": 5.457367038726806, "epoch": 0.7348764831744796, "grad_norm": 1.03125, "learning_rate": 0.0004951490660618598, "loss": 5.1221, "mean_token_accuracy": 0.1908814549446106, "num_tokens": 16400132.0, "step": 9445 }, { "entropy": 5.553274536132813, "epoch": 0.7352655125461972, "grad_norm": 1.0703125, "learning_rate": 0.0004951433402946457, "loss": 5.2937, "mean_token_accuracy": 0.18400580137968064, "num_tokens": 16408297.0, "step": 9450 }, { "entropy": 5.5737401962280275, "epoch": 0.7356545419179148, "grad_norm": 0.96875, "learning_rate": 0.0004951376111871068, "loss": 5.3443, "mean_token_accuracy": 0.17686122059822082, "num_tokens": 16417977.0, "step": 9455 }, { "entropy": 5.58512773513794, "epoch": 0.7360435712896324, "grad_norm": 0.96875, "learning_rate": 0.0004951318787393299, "loss": 5.2265, "mean_token_accuracy": 0.18320877254009246, "num_tokens": 16427156.0, "step": 9460 }, { "entropy": 5.64531135559082, "epoch": 0.73643260066135, "grad_norm": 0.9921875, "learning_rate": 0.0004951261429514023, "loss": 5.4389, "mean_token_accuracy": 0.16900589615106582, "num_tokens": 16435845.0, "step": 9465 }, { "entropy": 5.6111023902893065, "epoch": 0.7368216300330674, "grad_norm": 0.96484375, "learning_rate": 0.0004951204038234106, "loss": 5.3945, "mean_token_accuracy": 0.17545305341482162, "num_tokens": 16445876.0, "step": 9470 }, { "entropy": 5.601052713394165, "epoch": 0.737210659404785, "grad_norm": 1.078125, "learning_rate": 0.0004951146613554424, "loss": 5.3357, "mean_token_accuracy": 0.18090222775936127, "num_tokens": 16454688.0, "step": 9475 }, { "entropy": 5.642931413650513, "epoch": 0.7375996887765026, "grad_norm": 1.0859375, "learning_rate": 0.0004951089155475843, "loss": 5.4152, "mean_token_accuracy": 0.16919267326593398, "num_tokens": 16463932.0, "step": 9480 }, { "entropy": 5.616369152069092, "epoch": 0.7379887181482202, "grad_norm": 0.984375, "learning_rate": 0.000495103166399924, "loss": 5.3242, "mean_token_accuracy": 0.17350419461727143, "num_tokens": 16472627.0, "step": 9485 }, { "entropy": 5.644665336608886, "epoch": 0.7383777475199378, "grad_norm": 1.1015625, "learning_rate": 0.0004950974139125484, "loss": 5.3634, "mean_token_accuracy": 0.17660223096609115, "num_tokens": 16480819.0, "step": 9490 }, { "entropy": 5.600194644927979, "epoch": 0.7387667768916554, "grad_norm": 0.9765625, "learning_rate": 0.0004950916580855448, "loss": 5.3286, "mean_token_accuracy": 0.17571170181035994, "num_tokens": 16489055.0, "step": 9495 }, { "entropy": 5.548560953140258, "epoch": 0.7391558062633728, "grad_norm": 1.0390625, "learning_rate": 0.0004950858989190007, "loss": 5.3297, "mean_token_accuracy": 0.1835804373025894, "num_tokens": 16497375.0, "step": 9500 }, { "entropy": 5.493134450912476, "epoch": 0.7395448356350904, "grad_norm": 1.0546875, "learning_rate": 0.0004950801364130032, "loss": 5.1607, "mean_token_accuracy": 0.18572535663843154, "num_tokens": 16505183.0, "step": 9505 }, { "entropy": 5.597559452056885, "epoch": 0.739933865006808, "grad_norm": 1.03125, "learning_rate": 0.0004950743705676401, "loss": 5.4381, "mean_token_accuracy": 0.16902757957577705, "num_tokens": 16514018.0, "step": 9510 }, { "entropy": 5.615971994400025, "epoch": 0.7403228943785256, "grad_norm": 0.9140625, "learning_rate": 0.0004950686013829987, "loss": 5.3076, "mean_token_accuracy": 0.18013171702623368, "num_tokens": 16522954.0, "step": 9515 }, { "entropy": 5.71082763671875, "epoch": 0.7407119237502432, "grad_norm": 1.046875, "learning_rate": 0.0004950628288591665, "loss": 5.3547, "mean_token_accuracy": 0.17512065768241883, "num_tokens": 16530845.0, "step": 9520 }, { "entropy": 5.565211915969849, "epoch": 0.7411009531219607, "grad_norm": 1.046875, "learning_rate": 0.0004950570529962311, "loss": 5.3313, "mean_token_accuracy": 0.1752915546298027, "num_tokens": 16540464.0, "step": 9525 }, { "entropy": 5.473846054077148, "epoch": 0.7414899824936783, "grad_norm": 0.953125, "learning_rate": 0.0004950512737942803, "loss": 5.2103, "mean_token_accuracy": 0.18890926241874695, "num_tokens": 16549485.0, "step": 9530 }, { "entropy": 5.6329456806182865, "epoch": 0.7418790118653958, "grad_norm": 1.0546875, "learning_rate": 0.0004950454912534015, "loss": 5.3656, "mean_token_accuracy": 0.17809097170829774, "num_tokens": 16557854.0, "step": 9535 }, { "entropy": 5.635037088394165, "epoch": 0.7422680412371134, "grad_norm": 1.0546875, "learning_rate": 0.0004950397053736827, "loss": 5.3982, "mean_token_accuracy": 0.17356866598129272, "num_tokens": 16565975.0, "step": 9540 }, { "entropy": 5.603233718872071, "epoch": 0.742657070608831, "grad_norm": 0.9453125, "learning_rate": 0.0004950339161552117, "loss": 5.366, "mean_token_accuracy": 0.17709572613239288, "num_tokens": 16575038.0, "step": 9545 }, { "entropy": 5.536765909194946, "epoch": 0.7430460999805485, "grad_norm": 0.9609375, "learning_rate": 0.0004950281235980761, "loss": 5.2234, "mean_token_accuracy": 0.18227089196443558, "num_tokens": 16584292.0, "step": 9550 }, { "entropy": 5.583617877960205, "epoch": 0.7434351293522661, "grad_norm": 0.9453125, "learning_rate": 0.000495022327702364, "loss": 5.3176, "mean_token_accuracy": 0.1783987820148468, "num_tokens": 16592331.0, "step": 9555 }, { "entropy": 5.557074785232544, "epoch": 0.7438241587239837, "grad_norm": 1.0625, "learning_rate": 0.0004950165284681631, "loss": 5.2694, "mean_token_accuracy": 0.17992899864912032, "num_tokens": 16601845.0, "step": 9560 }, { "entropy": 5.584936475753784, "epoch": 0.7442131880957013, "grad_norm": 0.9375, "learning_rate": 0.0004950107258955618, "loss": 5.3511, "mean_token_accuracy": 0.17872835099697112, "num_tokens": 16610438.0, "step": 9565 }, { "entropy": 5.540927791595459, "epoch": 0.7446022174674188, "grad_norm": 0.94140625, "learning_rate": 0.0004950049199846479, "loss": 5.2705, "mean_token_accuracy": 0.18069363981485367, "num_tokens": 16618892.0, "step": 9570 }, { "entropy": 5.639248418807983, "epoch": 0.7449912468391363, "grad_norm": 0.93359375, "learning_rate": 0.0004949991107355095, "loss": 5.3096, "mean_token_accuracy": 0.17804142832756042, "num_tokens": 16627702.0, "step": 9575 }, { "entropy": 5.51157283782959, "epoch": 0.7453802762108539, "grad_norm": 1.0859375, "learning_rate": 0.0004949932981482347, "loss": 5.2218, "mean_token_accuracy": 0.18788692057132722, "num_tokens": 16635653.0, "step": 9580 }, { "entropy": 5.5664544105529785, "epoch": 0.7457693055825715, "grad_norm": 0.99609375, "learning_rate": 0.0004949874822229118, "loss": 5.3531, "mean_token_accuracy": 0.18009264767169952, "num_tokens": 16643898.0, "step": 9585 }, { "entropy": 5.596207046508789, "epoch": 0.7461583349542891, "grad_norm": 0.97265625, "learning_rate": 0.0004949816629596288, "loss": 5.2252, "mean_token_accuracy": 0.18270762860774994, "num_tokens": 16653126.0, "step": 9590 }, { "entropy": 5.656696367263794, "epoch": 0.7465473643260067, "grad_norm": 1.015625, "learning_rate": 0.0004949758403584746, "loss": 5.3469, "mean_token_accuracy": 0.1753896027803421, "num_tokens": 16661561.0, "step": 9595 }, { "entropy": 5.544621753692627, "epoch": 0.7469363936977241, "grad_norm": 1.0078125, "learning_rate": 0.0004949700144195368, "loss": 5.3028, "mean_token_accuracy": 0.17755116224288942, "num_tokens": 16669657.0, "step": 9600 }, { "entropy": 5.519941425323486, "epoch": 0.7473254230694417, "grad_norm": 0.9609375, "learning_rate": 0.0004949641851429043, "loss": 5.3038, "mean_token_accuracy": 0.1791791334748268, "num_tokens": 16678486.0, "step": 9605 }, { "entropy": 5.595032501220703, "epoch": 0.7477144524411593, "grad_norm": 1.0, "learning_rate": 0.0004949583525286654, "loss": 5.2735, "mean_token_accuracy": 0.177974633872509, "num_tokens": 16686638.0, "step": 9610 }, { "entropy": 5.594528484344482, "epoch": 0.7481034818128769, "grad_norm": 1.0234375, "learning_rate": 0.0004949525165769085, "loss": 5.2215, "mean_token_accuracy": 0.17921450287103652, "num_tokens": 16694393.0, "step": 9615 }, { "entropy": 5.568652772903443, "epoch": 0.7484925111845945, "grad_norm": 1.03125, "learning_rate": 0.0004949466772877224, "loss": 5.2646, "mean_token_accuracy": 0.18511301875114441, "num_tokens": 16702613.0, "step": 9620 }, { "entropy": 5.561077070236206, "epoch": 0.748881540556312, "grad_norm": 0.984375, "learning_rate": 0.0004949408346611955, "loss": 5.2364, "mean_token_accuracy": 0.18199257850646972, "num_tokens": 16711210.0, "step": 9625 }, { "entropy": 5.564145612716675, "epoch": 0.7492705699280295, "grad_norm": 1.015625, "learning_rate": 0.0004949349886974165, "loss": 5.2972, "mean_token_accuracy": 0.1834089621901512, "num_tokens": 16719124.0, "step": 9630 }, { "entropy": 5.600499248504638, "epoch": 0.7496595992997471, "grad_norm": 1.0546875, "learning_rate": 0.0004949291393964741, "loss": 5.2676, "mean_token_accuracy": 0.17806679606437684, "num_tokens": 16727240.0, "step": 9635 }, { "entropy": 5.576705551147461, "epoch": 0.7500486286714647, "grad_norm": 1.03125, "learning_rate": 0.000494923286758457, "loss": 5.38, "mean_token_accuracy": 0.17818381488323212, "num_tokens": 16736524.0, "step": 9640 }, { "entropy": 5.704974842071533, "epoch": 0.7504376580431823, "grad_norm": 1.015625, "learning_rate": 0.0004949174307834541, "loss": 5.4922, "mean_token_accuracy": 0.16476022750139235, "num_tokens": 16745798.0, "step": 9645 }, { "entropy": 5.589550638198853, "epoch": 0.7508266874148998, "grad_norm": 1.0546875, "learning_rate": 0.0004949115714715543, "loss": 5.2774, "mean_token_accuracy": 0.18031025826931, "num_tokens": 16754263.0, "step": 9650 }, { "entropy": 5.509631538391114, "epoch": 0.7512157167866174, "grad_norm": 1.0390625, "learning_rate": 0.0004949057088228465, "loss": 5.1671, "mean_token_accuracy": 0.18788377642631532, "num_tokens": 16762610.0, "step": 9655 }, { "entropy": 5.587539911270142, "epoch": 0.751604746158335, "grad_norm": 0.9921875, "learning_rate": 0.0004948998428374194, "loss": 5.3813, "mean_token_accuracy": 0.17164374738931656, "num_tokens": 16771436.0, "step": 9660 }, { "entropy": 5.6791328430175785, "epoch": 0.7519937755300525, "grad_norm": 1.0078125, "learning_rate": 0.0004948939735153622, "loss": 5.3954, "mean_token_accuracy": 0.17684406042099, "num_tokens": 16779647.0, "step": 9665 }, { "entropy": 5.666022825241089, "epoch": 0.7523828049017701, "grad_norm": 1.0859375, "learning_rate": 0.0004948881008567641, "loss": 5.352, "mean_token_accuracy": 0.1790418267250061, "num_tokens": 16788116.0, "step": 9670 }, { "entropy": 5.549437808990478, "epoch": 0.7527718342734876, "grad_norm": 1.078125, "learning_rate": 0.0004948822248617139, "loss": 5.2878, "mean_token_accuracy": 0.18091578632593155, "num_tokens": 16796518.0, "step": 9675 }, { "entropy": 5.55680022239685, "epoch": 0.7531608636452052, "grad_norm": 1.0234375, "learning_rate": 0.000494876345530301, "loss": 5.2654, "mean_token_accuracy": 0.1813149034976959, "num_tokens": 16805511.0, "step": 9680 }, { "entropy": 5.583335542678833, "epoch": 0.7535498930169228, "grad_norm": 1.1328125, "learning_rate": 0.0004948704628626145, "loss": 5.282, "mean_token_accuracy": 0.17796677052974702, "num_tokens": 16813173.0, "step": 9685 }, { "entropy": 5.627739143371582, "epoch": 0.7539389223886404, "grad_norm": 0.984375, "learning_rate": 0.0004948645768587437, "loss": 5.3799, "mean_token_accuracy": 0.17010469883680343, "num_tokens": 16822193.0, "step": 9690 }, { "entropy": 5.518557786941528, "epoch": 0.7543279517603579, "grad_norm": 1.0078125, "learning_rate": 0.0004948586875187778, "loss": 5.1055, "mean_token_accuracy": 0.1896416053175926, "num_tokens": 16830421.0, "step": 9695 }, { "entropy": 5.56982102394104, "epoch": 0.7547169811320755, "grad_norm": 1.0078125, "learning_rate": 0.0004948527948428064, "loss": 5.2132, "mean_token_accuracy": 0.18295853286981584, "num_tokens": 16838988.0, "step": 9700 }, { "entropy": 5.534185743331909, "epoch": 0.755106010503793, "grad_norm": 1.046875, "learning_rate": 0.0004948468988309187, "loss": 5.35, "mean_token_accuracy": 0.17599449008703233, "num_tokens": 16847980.0, "step": 9705 }, { "entropy": 5.496274757385254, "epoch": 0.7554950398755106, "grad_norm": 0.9609375, "learning_rate": 0.0004948409994832043, "loss": 5.2328, "mean_token_accuracy": 0.18318645805120468, "num_tokens": 16857263.0, "step": 9710 }, { "entropy": 5.592087888717652, "epoch": 0.7558840692472282, "grad_norm": 1.046875, "learning_rate": 0.0004948350967997526, "loss": 5.2375, "mean_token_accuracy": 0.1804831087589264, "num_tokens": 16865314.0, "step": 9715 }, { "entropy": 5.618679857254028, "epoch": 0.7562730986189458, "grad_norm": 1.0078125, "learning_rate": 0.0004948291907806532, "loss": 5.3287, "mean_token_accuracy": 0.18105187863111497, "num_tokens": 16875359.0, "step": 9720 }, { "entropy": 5.626615762710571, "epoch": 0.7566621279906633, "grad_norm": 0.97265625, "learning_rate": 0.0004948232814259957, "loss": 5.4465, "mean_token_accuracy": 0.16737451404333115, "num_tokens": 16885279.0, "step": 9725 }, { "entropy": 5.67550139427185, "epoch": 0.7570511573623808, "grad_norm": 0.9609375, "learning_rate": 0.0004948173687358699, "loss": 5.3648, "mean_token_accuracy": 0.17636879682540893, "num_tokens": 16894463.0, "step": 9730 }, { "entropy": 5.615520334243774, "epoch": 0.7574401867340984, "grad_norm": 0.9765625, "learning_rate": 0.0004948114527103652, "loss": 5.3019, "mean_token_accuracy": 0.16981316953897477, "num_tokens": 16903378.0, "step": 9735 }, { "entropy": 5.568920230865478, "epoch": 0.757829216105816, "grad_norm": 1.03125, "learning_rate": 0.0004948055333495717, "loss": 5.3493, "mean_token_accuracy": 0.17093088179826738, "num_tokens": 16912039.0, "step": 9740 }, { "entropy": 5.553165483474731, "epoch": 0.7582182454775336, "grad_norm": 1.0390625, "learning_rate": 0.0004947996106535791, "loss": 5.2949, "mean_token_accuracy": 0.17178265303373336, "num_tokens": 16920516.0, "step": 9745 }, { "entropy": 5.661890935897827, "epoch": 0.7586072748492512, "grad_norm": 0.9921875, "learning_rate": 0.0004947936846224773, "loss": 5.3096, "mean_token_accuracy": 0.17241132408380508, "num_tokens": 16929131.0, "step": 9750 }, { "entropy": 5.539224529266358, "epoch": 0.7589963042209686, "grad_norm": 1.0546875, "learning_rate": 0.0004947877552563562, "loss": 5.3331, "mean_token_accuracy": 0.18203827887773513, "num_tokens": 16937352.0, "step": 9755 }, { "entropy": 5.593630933761597, "epoch": 0.7593853335926862, "grad_norm": 0.9921875, "learning_rate": 0.0004947818225553056, "loss": 5.4071, "mean_token_accuracy": 0.17220403701066972, "num_tokens": 16946439.0, "step": 9760 }, { "entropy": 5.6424661636352536, "epoch": 0.7597743629644038, "grad_norm": 0.95703125, "learning_rate": 0.0004947758865194156, "loss": 5.2918, "mean_token_accuracy": 0.17695994526147843, "num_tokens": 16955402.0, "step": 9765 }, { "entropy": 5.495573997497559, "epoch": 0.7601633923361214, "grad_norm": 1.0, "learning_rate": 0.0004947699471487766, "loss": 5.2244, "mean_token_accuracy": 0.18328388929367065, "num_tokens": 16964299.0, "step": 9770 }, { "entropy": 5.50468430519104, "epoch": 0.760552421707839, "grad_norm": 0.890625, "learning_rate": 0.0004947640044434782, "loss": 5.2758, "mean_token_accuracy": 0.17400199323892593, "num_tokens": 16973483.0, "step": 9775 }, { "entropy": 5.590785169601441, "epoch": 0.7609414510795565, "grad_norm": 1.0, "learning_rate": 0.0004947580584036109, "loss": 5.3239, "mean_token_accuracy": 0.18279939740896226, "num_tokens": 16982234.0, "step": 9780 }, { "entropy": 5.581445789337158, "epoch": 0.761330480451274, "grad_norm": 1.0078125, "learning_rate": 0.0004947521090292649, "loss": 5.2892, "mean_token_accuracy": 0.1782561406493187, "num_tokens": 16990669.0, "step": 9785 }, { "entropy": 5.648339176177979, "epoch": 0.7617195098229916, "grad_norm": 1.0, "learning_rate": 0.0004947461563205304, "loss": 5.3507, "mean_token_accuracy": 0.17734525352716446, "num_tokens": 16999998.0, "step": 9790 }, { "entropy": 5.661034297943115, "epoch": 0.7621085391947092, "grad_norm": 1.0546875, "learning_rate": 0.0004947402002774977, "loss": 5.3529, "mean_token_accuracy": 0.1741270527243614, "num_tokens": 17008518.0, "step": 9795 }, { "entropy": 5.543142318725586, "epoch": 0.7624975685664268, "grad_norm": 1.0390625, "learning_rate": 0.0004947342409002572, "loss": 5.2809, "mean_token_accuracy": 0.17424834668636321, "num_tokens": 17017182.0, "step": 9800 }, { "entropy": 5.565796613693237, "epoch": 0.7628865979381443, "grad_norm": 1.015625, "learning_rate": 0.0004947282781888994, "loss": 5.2961, "mean_token_accuracy": 0.17821226865053177, "num_tokens": 17026186.0, "step": 9805 }, { "entropy": 5.473713350296021, "epoch": 0.7632756273098619, "grad_norm": 1.0625, "learning_rate": 0.0004947223121435147, "loss": 5.175, "mean_token_accuracy": 0.19047538787126542, "num_tokens": 17034295.0, "step": 9810 }, { "entropy": 5.44863224029541, "epoch": 0.7636646566815795, "grad_norm": 0.98828125, "learning_rate": 0.0004947163427641936, "loss": 5.252, "mean_token_accuracy": 0.17861233055591583, "num_tokens": 17043195.0, "step": 9815 }, { "entropy": 5.518514013290405, "epoch": 0.764053686053297, "grad_norm": 0.96484375, "learning_rate": 0.0004947103700510268, "loss": 5.1959, "mean_token_accuracy": 0.17903678566217424, "num_tokens": 17051903.0, "step": 9820 }, { "entropy": 5.539800930023193, "epoch": 0.7644427154250146, "grad_norm": 1.015625, "learning_rate": 0.0004947043940041047, "loss": 5.2636, "mean_token_accuracy": 0.1832680806517601, "num_tokens": 17060495.0, "step": 9825 }, { "entropy": 5.601056957244873, "epoch": 0.7648317447967321, "grad_norm": 0.9375, "learning_rate": 0.0004946984146235183, "loss": 5.3227, "mean_token_accuracy": 0.17461752742528916, "num_tokens": 17069254.0, "step": 9830 }, { "entropy": 5.6530539989471436, "epoch": 0.7652207741684497, "grad_norm": 1.078125, "learning_rate": 0.0004946924319093579, "loss": 5.2799, "mean_token_accuracy": 0.17788524329662322, "num_tokens": 17077323.0, "step": 9835 }, { "entropy": 5.529206657409668, "epoch": 0.7656098035401673, "grad_norm": 1.03125, "learning_rate": 0.0004946864458617148, "loss": 5.169, "mean_token_accuracy": 0.18858975172042847, "num_tokens": 17085377.0, "step": 9840 }, { "entropy": 5.500270652770996, "epoch": 0.7659988329118849, "grad_norm": 0.9296875, "learning_rate": 0.0004946804564806793, "loss": 5.242, "mean_token_accuracy": 0.17937949299812317, "num_tokens": 17094288.0, "step": 9845 }, { "entropy": 5.571313285827637, "epoch": 0.7663878622836025, "grad_norm": 1.078125, "learning_rate": 0.0004946744637663427, "loss": 5.1776, "mean_token_accuracy": 0.18991186916828157, "num_tokens": 17101572.0, "step": 9850 }, { "entropy": 5.549397754669189, "epoch": 0.7667768916553199, "grad_norm": 1.078125, "learning_rate": 0.0004946684677187956, "loss": 5.315, "mean_token_accuracy": 0.1745953306555748, "num_tokens": 17110151.0, "step": 9855 }, { "entropy": 5.60110821723938, "epoch": 0.7671659210270375, "grad_norm": 1.1328125, "learning_rate": 0.0004946624683381292, "loss": 5.3045, "mean_token_accuracy": 0.17201686799526214, "num_tokens": 17118172.0, "step": 9860 }, { "entropy": 5.522176218032837, "epoch": 0.7675549503987551, "grad_norm": 0.98828125, "learning_rate": 0.0004946564656244345, "loss": 5.1812, "mean_token_accuracy": 0.18621729910373688, "num_tokens": 17126855.0, "step": 9865 }, { "entropy": 5.602323389053344, "epoch": 0.7679439797704727, "grad_norm": 1.015625, "learning_rate": 0.0004946504595778026, "loss": 5.3748, "mean_token_accuracy": 0.17457078397274017, "num_tokens": 17135737.0, "step": 9870 }, { "entropy": 5.64451322555542, "epoch": 0.7683330091421903, "grad_norm": 1.046875, "learning_rate": 0.0004946444501983246, "loss": 5.3098, "mean_token_accuracy": 0.17592848539352418, "num_tokens": 17144521.0, "step": 9875 }, { "entropy": 5.6431746006011965, "epoch": 0.7687220385139077, "grad_norm": 1.0390625, "learning_rate": 0.0004946384374860916, "loss": 5.3946, "mean_token_accuracy": 0.1757023736834526, "num_tokens": 17153534.0, "step": 9880 }, { "entropy": 5.52467942237854, "epoch": 0.7691110678856253, "grad_norm": 0.9453125, "learning_rate": 0.0004946324214411949, "loss": 5.2258, "mean_token_accuracy": 0.1848434701561928, "num_tokens": 17162600.0, "step": 9885 }, { "entropy": 5.569587516784668, "epoch": 0.7695000972573429, "grad_norm": 0.9921875, "learning_rate": 0.0004946264020637259, "loss": 5.3193, "mean_token_accuracy": 0.17557533234357833, "num_tokens": 17171373.0, "step": 9890 }, { "entropy": 5.632002305984497, "epoch": 0.7698891266290605, "grad_norm": 1.0546875, "learning_rate": 0.0004946203793537757, "loss": 5.3351, "mean_token_accuracy": 0.17728708386421205, "num_tokens": 17180090.0, "step": 9895 }, { "entropy": 5.60519757270813, "epoch": 0.7702781560007781, "grad_norm": 0.9765625, "learning_rate": 0.0004946143533114358, "loss": 5.2577, "mean_token_accuracy": 0.1822723478078842, "num_tokens": 17189592.0, "step": 9900 }, { "entropy": 5.519287204742431, "epoch": 0.7706671853724957, "grad_norm": 0.92578125, "learning_rate": 0.0004946083239367976, "loss": 5.1972, "mean_token_accuracy": 0.18773100078105925, "num_tokens": 17198287.0, "step": 9905 }, { "entropy": 5.593173360824585, "epoch": 0.7710562147442132, "grad_norm": 1.0625, "learning_rate": 0.0004946022912299527, "loss": 5.3013, "mean_token_accuracy": 0.17522221207618713, "num_tokens": 17206349.0, "step": 9910 }, { "entropy": 5.614915943145752, "epoch": 0.7714452441159307, "grad_norm": 0.98828125, "learning_rate": 0.0004945962551909926, "loss": 5.4031, "mean_token_accuracy": 0.1742765948176384, "num_tokens": 17215408.0, "step": 9915 }, { "entropy": 5.684574699401855, "epoch": 0.7718342734876483, "grad_norm": 1.0, "learning_rate": 0.0004945902158200089, "loss": 5.3549, "mean_token_accuracy": 0.17250179797410964, "num_tokens": 17224342.0, "step": 9920 }, { "entropy": 5.59126558303833, "epoch": 0.7722233028593659, "grad_norm": 1.0078125, "learning_rate": 0.0004945841731170931, "loss": 5.2355, "mean_token_accuracy": 0.1765318751335144, "num_tokens": 17232532.0, "step": 9925 }, { "entropy": 5.51690354347229, "epoch": 0.7726123322310835, "grad_norm": 0.99609375, "learning_rate": 0.0004945781270823369, "loss": 5.2437, "mean_token_accuracy": 0.18184578269720078, "num_tokens": 17240786.0, "step": 9930 }, { "entropy": 5.513026142120362, "epoch": 0.773001361602801, "grad_norm": 1.109375, "learning_rate": 0.0004945720777158323, "loss": 5.2295, "mean_token_accuracy": 0.18555503934621811, "num_tokens": 17248515.0, "step": 9935 }, { "entropy": 5.591573333740234, "epoch": 0.7733903909745186, "grad_norm": 1.0, "learning_rate": 0.0004945660250176708, "loss": 5.276, "mean_token_accuracy": 0.18310922980308533, "num_tokens": 17257098.0, "step": 9940 }, { "entropy": 5.561489295959473, "epoch": 0.7737794203462361, "grad_norm": 1.046875, "learning_rate": 0.0004945599689879443, "loss": 5.2754, "mean_token_accuracy": 0.17605521529912949, "num_tokens": 17266851.0, "step": 9945 }, { "entropy": 5.5478973388671875, "epoch": 0.7741684497179537, "grad_norm": 1.0546875, "learning_rate": 0.0004945539096267448, "loss": 5.2233, "mean_token_accuracy": 0.17532940953969955, "num_tokens": 17275568.0, "step": 9950 }, { "entropy": 5.525739049911499, "epoch": 0.7745574790896713, "grad_norm": 1.03125, "learning_rate": 0.0004945478469341642, "loss": 5.1988, "mean_token_accuracy": 0.18495745062828065, "num_tokens": 17284528.0, "step": 9955 }, { "entropy": 5.606883478164673, "epoch": 0.7749465084613888, "grad_norm": 0.9609375, "learning_rate": 0.0004945417809102944, "loss": 5.3396, "mean_token_accuracy": 0.1755354180932045, "num_tokens": 17293973.0, "step": 9960 }, { "entropy": 5.524585103988647, "epoch": 0.7753355378331064, "grad_norm": 1.0546875, "learning_rate": 0.0004945357115552275, "loss": 5.2319, "mean_token_accuracy": 0.17984241396188735, "num_tokens": 17302321.0, "step": 9965 }, { "entropy": 5.580976581573486, "epoch": 0.775724567204824, "grad_norm": 1.0234375, "learning_rate": 0.0004945296388690557, "loss": 5.3504, "mean_token_accuracy": 0.17670010775327682, "num_tokens": 17311226.0, "step": 9970 }, { "entropy": 5.609677982330322, "epoch": 0.7761135965765416, "grad_norm": 1.0234375, "learning_rate": 0.000494523562851871, "loss": 5.3277, "mean_token_accuracy": 0.17759332209825515, "num_tokens": 17319818.0, "step": 9975 }, { "entropy": 5.6251226425170895, "epoch": 0.7765026259482591, "grad_norm": 1.015625, "learning_rate": 0.0004945174835037655, "loss": 5.3474, "mean_token_accuracy": 0.17106997072696686, "num_tokens": 17329195.0, "step": 9980 }, { "entropy": 5.650672054290771, "epoch": 0.7768916553199766, "grad_norm": 0.9375, "learning_rate": 0.0004945114008248319, "loss": 5.4327, "mean_token_accuracy": 0.17871665358543395, "num_tokens": 17337689.0, "step": 9985 }, { "entropy": 5.582010173797608, "epoch": 0.7772806846916942, "grad_norm": 1.0546875, "learning_rate": 0.0004945053148151619, "loss": 5.1884, "mean_token_accuracy": 0.18419857025146485, "num_tokens": 17345467.0, "step": 9990 }, { "entropy": 5.548644399642944, "epoch": 0.7776697140634118, "grad_norm": 1.0546875, "learning_rate": 0.0004944992254748482, "loss": 5.3342, "mean_token_accuracy": 0.1798410654067993, "num_tokens": 17353651.0, "step": 9995 }, { "entropy": 5.608665990829468, "epoch": 0.7780587434351294, "grad_norm": 0.9453125, "learning_rate": 0.0004944931328039832, "loss": 5.3904, "mean_token_accuracy": 0.17302385866641998, "num_tokens": 17362777.0, "step": 10000 }, { "entropy": 5.664591360092163, "epoch": 0.778447772806847, "grad_norm": 0.99609375, "learning_rate": 0.0004944870368026592, "loss": 5.3237, "mean_token_accuracy": 0.17910516113042832, "num_tokens": 17371562.0, "step": 10005 }, { "entropy": 5.633160924911499, "epoch": 0.7788368021785644, "grad_norm": 0.99609375, "learning_rate": 0.0004944809374709689, "loss": 5.3136, "mean_token_accuracy": 0.17074411660432814, "num_tokens": 17381185.0, "step": 10010 }, { "entropy": 5.597475528717041, "epoch": 0.779225831550282, "grad_norm": 1.015625, "learning_rate": 0.0004944748348090045, "loss": 5.279, "mean_token_accuracy": 0.18732508569955825, "num_tokens": 17390658.0, "step": 10015 }, { "entropy": 5.5473918437957765, "epoch": 0.7796148609219996, "grad_norm": 0.9140625, "learning_rate": 0.0004944687288168589, "loss": 5.2168, "mean_token_accuracy": 0.17947004586458207, "num_tokens": 17399968.0, "step": 10020 }, { "entropy": 5.587859106063843, "epoch": 0.7800038902937172, "grad_norm": 1.0078125, "learning_rate": 0.0004944626194946246, "loss": 5.3441, "mean_token_accuracy": 0.1738036096096039, "num_tokens": 17408727.0, "step": 10025 }, { "entropy": 5.583702516555786, "epoch": 0.7803929196654348, "grad_norm": 1.0390625, "learning_rate": 0.0004944565068423945, "loss": 5.3554, "mean_token_accuracy": 0.17960301786661148, "num_tokens": 17417517.0, "step": 10030 }, { "entropy": 5.6376337051391605, "epoch": 0.7807819490371523, "grad_norm": 0.9765625, "learning_rate": 0.0004944503908602612, "loss": 5.3434, "mean_token_accuracy": 0.17666764408349991, "num_tokens": 17427035.0, "step": 10035 }, { "entropy": 5.641467332839966, "epoch": 0.7811709784088698, "grad_norm": 1.0078125, "learning_rate": 0.0004944442715483174, "loss": 5.248, "mean_token_accuracy": 0.1828450620174408, "num_tokens": 17435585.0, "step": 10040 }, { "entropy": 5.551241016387939, "epoch": 0.7815600077805874, "grad_norm": 1.0234375, "learning_rate": 0.0004944381489066561, "loss": 5.2636, "mean_token_accuracy": 0.18091956228017808, "num_tokens": 17444317.0, "step": 10045 }, { "entropy": 5.620751953125, "epoch": 0.781949037152305, "grad_norm": 0.96875, "learning_rate": 0.0004944320229353702, "loss": 5.4727, "mean_token_accuracy": 0.17515989094972612, "num_tokens": 17453585.0, "step": 10050 }, { "entropy": 5.586199188232422, "epoch": 0.7823380665240226, "grad_norm": 1.0078125, "learning_rate": 0.0004944258936345526, "loss": 5.2588, "mean_token_accuracy": 0.18479428440332413, "num_tokens": 17462233.0, "step": 10055 }, { "entropy": 5.549157810211182, "epoch": 0.7827270958957401, "grad_norm": 0.95703125, "learning_rate": 0.0004944197610042963, "loss": 5.1583, "mean_token_accuracy": 0.1919889599084854, "num_tokens": 17470566.0, "step": 10060 }, { "entropy": 5.556268930435181, "epoch": 0.7831161252674577, "grad_norm": 1.0546875, "learning_rate": 0.0004944136250446944, "loss": 5.2804, "mean_token_accuracy": 0.1742836907505989, "num_tokens": 17479267.0, "step": 10065 }, { "entropy": 5.4754805088043215, "epoch": 0.7835051546391752, "grad_norm": 1.046875, "learning_rate": 0.0004944074857558399, "loss": 5.1722, "mean_token_accuracy": 0.18835856914520263, "num_tokens": 17488060.0, "step": 10070 }, { "entropy": 5.676930952072143, "epoch": 0.7838941840108928, "grad_norm": 1.0078125, "learning_rate": 0.0004944013431378261, "loss": 5.4177, "mean_token_accuracy": 0.17947075963020326, "num_tokens": 17497240.0, "step": 10075 }, { "entropy": 5.641529941558838, "epoch": 0.7842832133826104, "grad_norm": 1.0859375, "learning_rate": 0.0004943951971907461, "loss": 5.3746, "mean_token_accuracy": 0.17811400294303895, "num_tokens": 17506017.0, "step": 10080 }, { "entropy": 5.625462532043457, "epoch": 0.7846722427543279, "grad_norm": 0.98046875, "learning_rate": 0.0004943890479146933, "loss": 5.3175, "mean_token_accuracy": 0.178188057243824, "num_tokens": 17514764.0, "step": 10085 }, { "entropy": 5.547196388244629, "epoch": 0.7850612721260455, "grad_norm": 0.98046875, "learning_rate": 0.0004943828953097607, "loss": 5.2942, "mean_token_accuracy": 0.1766573965549469, "num_tokens": 17524183.0, "step": 10090 }, { "entropy": 5.552852392196655, "epoch": 0.7854503014977631, "grad_norm": 0.921875, "learning_rate": 0.000494376739376042, "loss": 5.241, "mean_token_accuracy": 0.18242752254009248, "num_tokens": 17533426.0, "step": 10095 }, { "entropy": 5.61579270362854, "epoch": 0.7858393308694807, "grad_norm": 0.9375, "learning_rate": 0.0004943705801136304, "loss": 5.1873, "mean_token_accuracy": 0.1837708830833435, "num_tokens": 17541966.0, "step": 10100 }, { "entropy": 5.587601232528686, "epoch": 0.7862283602411982, "grad_norm": 1.046875, "learning_rate": 0.0004943644175226193, "loss": 5.2882, "mean_token_accuracy": 0.1829829156398773, "num_tokens": 17551157.0, "step": 10105 }, { "entropy": 5.52039270401001, "epoch": 0.7866173896129158, "grad_norm": 1.046875, "learning_rate": 0.0004943582516031025, "loss": 5.2057, "mean_token_accuracy": 0.1859710082411766, "num_tokens": 17559999.0, "step": 10110 }, { "entropy": 5.581799268722534, "epoch": 0.7870064189846333, "grad_norm": 1.0390625, "learning_rate": 0.0004943520823551732, "loss": 5.2531, "mean_token_accuracy": 0.18347948640584946, "num_tokens": 17568873.0, "step": 10115 }, { "entropy": 5.5961323261260985, "epoch": 0.7873954483563509, "grad_norm": 0.9765625, "learning_rate": 0.0004943459097789252, "loss": 5.328, "mean_token_accuracy": 0.1859396740794182, "num_tokens": 17577807.0, "step": 10120 }, { "entropy": 5.599230861663818, "epoch": 0.7877844777280685, "grad_norm": 0.921875, "learning_rate": 0.0004943397338744523, "loss": 5.3442, "mean_token_accuracy": 0.17688045501708985, "num_tokens": 17586646.0, "step": 10125 }, { "entropy": 5.650975227355957, "epoch": 0.7881735070997861, "grad_norm": 1.0078125, "learning_rate": 0.000494333554641848, "loss": 5.406, "mean_token_accuracy": 0.17036691009998323, "num_tokens": 17595458.0, "step": 10130 }, { "entropy": 5.611591577529907, "epoch": 0.7885625364715037, "grad_norm": 0.98828125, "learning_rate": 0.000494327372081206, "loss": 5.3205, "mean_token_accuracy": 0.178653784096241, "num_tokens": 17603997.0, "step": 10135 }, { "entropy": 5.636513948440552, "epoch": 0.7889515658432211, "grad_norm": 0.95703125, "learning_rate": 0.0004943211861926204, "loss": 5.3409, "mean_token_accuracy": 0.17546274811029433, "num_tokens": 17612347.0, "step": 10140 }, { "entropy": 5.563936233520508, "epoch": 0.7893405952149387, "grad_norm": 0.953125, "learning_rate": 0.0004943149969761848, "loss": 5.1964, "mean_token_accuracy": 0.1862559735774994, "num_tokens": 17620618.0, "step": 10145 }, { "entropy": 5.495310258865357, "epoch": 0.7897296245866563, "grad_norm": 0.984375, "learning_rate": 0.0004943088044319932, "loss": 5.2127, "mean_token_accuracy": 0.18083256781101226, "num_tokens": 17629164.0, "step": 10150 }, { "entropy": 5.642545223236084, "epoch": 0.7901186539583739, "grad_norm": 0.91015625, "learning_rate": 0.0004943026085601395, "loss": 5.388, "mean_token_accuracy": 0.17380305081605912, "num_tokens": 17638454.0, "step": 10155 }, { "entropy": 5.58918867111206, "epoch": 0.7905076833300915, "grad_norm": 0.98046875, "learning_rate": 0.0004942964093607178, "loss": 5.3049, "mean_token_accuracy": 0.17752310484647751, "num_tokens": 17647099.0, "step": 10160 }, { "entropy": 5.594116115570069, "epoch": 0.790896712701809, "grad_norm": 1.046875, "learning_rate": 0.0004942902068338222, "loss": 5.2704, "mean_token_accuracy": 0.18279317766427994, "num_tokens": 17655214.0, "step": 10165 }, { "entropy": 5.562254953384399, "epoch": 0.7912857420735265, "grad_norm": 0.96875, "learning_rate": 0.0004942840009795466, "loss": 5.236, "mean_token_accuracy": 0.1806568518280983, "num_tokens": 17663342.0, "step": 10170 }, { "entropy": 5.704637908935547, "epoch": 0.7916747714452441, "grad_norm": 1.0078125, "learning_rate": 0.0004942777917979855, "loss": 5.4433, "mean_token_accuracy": 0.16575012654066085, "num_tokens": 17671725.0, "step": 10175 }, { "entropy": 5.567132616043091, "epoch": 0.7920638008169617, "grad_norm": 0.984375, "learning_rate": 0.0004942715792892328, "loss": 5.3392, "mean_token_accuracy": 0.1732524037361145, "num_tokens": 17680627.0, "step": 10180 }, { "entropy": 5.618295097351075, "epoch": 0.7924528301886793, "grad_norm": 1.0234375, "learning_rate": 0.000494265363453383, "loss": 5.2998, "mean_token_accuracy": 0.18326802551746368, "num_tokens": 17688392.0, "step": 10185 }, { "entropy": 5.50335283279419, "epoch": 0.7928418595603968, "grad_norm": 1.0078125, "learning_rate": 0.0004942591442905302, "loss": 5.2558, "mean_token_accuracy": 0.18379608690738677, "num_tokens": 17697546.0, "step": 10190 }, { "entropy": 5.508504199981689, "epoch": 0.7932308889321144, "grad_norm": 1.0390625, "learning_rate": 0.0004942529218007689, "loss": 5.2165, "mean_token_accuracy": 0.18102292269468306, "num_tokens": 17705555.0, "step": 10195 }, { "entropy": 5.581924962997436, "epoch": 0.7936199183038319, "grad_norm": 1.0078125, "learning_rate": 0.0004942466959841936, "loss": 5.3836, "mean_token_accuracy": 0.16984927654266357, "num_tokens": 17715652.0, "step": 10200 }, { "entropy": 5.512160062789917, "epoch": 0.7940089476755495, "grad_norm": 0.98828125, "learning_rate": 0.0004942404668408985, "loss": 5.124, "mean_token_accuracy": 0.18311595916748047, "num_tokens": 17724111.0, "step": 10205 }, { "entropy": 5.461303615570069, "epoch": 0.7943979770472671, "grad_norm": 1.0546875, "learning_rate": 0.0004942342343709783, "loss": 5.1396, "mean_token_accuracy": 0.18451044708490372, "num_tokens": 17732732.0, "step": 10210 }, { "entropy": 5.558248853683471, "epoch": 0.7947870064189846, "grad_norm": 1.03125, "learning_rate": 0.0004942279985745275, "loss": 5.2399, "mean_token_accuracy": 0.18044923096895218, "num_tokens": 17741338.0, "step": 10215 }, { "entropy": 5.6359869003295895, "epoch": 0.7951760357907022, "grad_norm": 1.0078125, "learning_rate": 0.0004942217594516409, "loss": 5.4489, "mean_token_accuracy": 0.1734004020690918, "num_tokens": 17750651.0, "step": 10220 }, { "entropy": 5.604165887832641, "epoch": 0.7955650651624198, "grad_norm": 0.96484375, "learning_rate": 0.000494215517002413, "loss": 5.2573, "mean_token_accuracy": 0.18303716629743577, "num_tokens": 17759052.0, "step": 10225 }, { "entropy": 5.621202278137207, "epoch": 0.7959540945341373, "grad_norm": 1.125, "learning_rate": 0.0004942092712269384, "loss": 5.3162, "mean_token_accuracy": 0.1753840208053589, "num_tokens": 17767246.0, "step": 10230 }, { "entropy": 5.646518230438232, "epoch": 0.7963431239058549, "grad_norm": 1.0, "learning_rate": 0.0004942030221253122, "loss": 5.3416, "mean_token_accuracy": 0.17957145124673843, "num_tokens": 17777022.0, "step": 10235 }, { "entropy": 5.57313551902771, "epoch": 0.7967321532775724, "grad_norm": 1.0234375, "learning_rate": 0.0004941967696976289, "loss": 5.3091, "mean_token_accuracy": 0.17263340651988984, "num_tokens": 17785586.0, "step": 10240 }, { "entropy": 5.538752698898316, "epoch": 0.79712118264929, "grad_norm": 1.0625, "learning_rate": 0.0004941905139439835, "loss": 5.3038, "mean_token_accuracy": 0.17859912812709808, "num_tokens": 17794320.0, "step": 10245 }, { "entropy": 5.632735300064087, "epoch": 0.7975102120210076, "grad_norm": 0.9765625, "learning_rate": 0.0004941842548644712, "loss": 5.3097, "mean_token_accuracy": 0.18384564220905303, "num_tokens": 17803384.0, "step": 10250 }, { "entropy": 5.605423831939698, "epoch": 0.7978992413927252, "grad_norm": 0.9921875, "learning_rate": 0.0004941779924591864, "loss": 5.2807, "mean_token_accuracy": 0.17626046687364577, "num_tokens": 17811955.0, "step": 10255 }, { "entropy": 5.567848348617554, "epoch": 0.7982882707644428, "grad_norm": 1.046875, "learning_rate": 0.0004941717267282244, "loss": 5.3242, "mean_token_accuracy": 0.17602663338184357, "num_tokens": 17820582.0, "step": 10260 }, { "entropy": 5.643657493591308, "epoch": 0.7986773001361602, "grad_norm": 1.03125, "learning_rate": 0.0004941654576716806, "loss": 5.245, "mean_token_accuracy": 0.18023714274168015, "num_tokens": 17828465.0, "step": 10265 }, { "entropy": 5.5508965969085695, "epoch": 0.7990663295078778, "grad_norm": 1.0859375, "learning_rate": 0.0004941591852896495, "loss": 5.2445, "mean_token_accuracy": 0.18421650677919388, "num_tokens": 17836931.0, "step": 10270 }, { "entropy": 5.572287082672119, "epoch": 0.7994553588795954, "grad_norm": 1.0078125, "learning_rate": 0.0004941529095822268, "loss": 5.3278, "mean_token_accuracy": 0.17869895994663237, "num_tokens": 17845192.0, "step": 10275 }, { "entropy": 5.554533910751343, "epoch": 0.799844388251313, "grad_norm": 1.078125, "learning_rate": 0.0004941466305495074, "loss": 5.3059, "mean_token_accuracy": 0.17677113115787507, "num_tokens": 17854121.0, "step": 10280 }, { "entropy": 5.603392553329468, "epoch": 0.8002334176230306, "grad_norm": 1.0078125, "learning_rate": 0.0004941403481915867, "loss": 5.2917, "mean_token_accuracy": 0.17675098776817322, "num_tokens": 17862931.0, "step": 10285 }, { "entropy": 5.649144268035888, "epoch": 0.800622446994748, "grad_norm": 0.9609375, "learning_rate": 0.0004941340625085601, "loss": 5.3176, "mean_token_accuracy": 0.17665561735630037, "num_tokens": 17871909.0, "step": 10290 }, { "entropy": 5.547114706039428, "epoch": 0.8010114763664656, "grad_norm": 0.9921875, "learning_rate": 0.0004941277735005228, "loss": 5.231, "mean_token_accuracy": 0.18726652562618257, "num_tokens": 17880487.0, "step": 10295 }, { "entropy": 5.544336891174316, "epoch": 0.8014005057381832, "grad_norm": 1.0703125, "learning_rate": 0.0004941214811675702, "loss": 5.301, "mean_token_accuracy": 0.17943531274795532, "num_tokens": 17888712.0, "step": 10300 }, { "entropy": 5.628103160858155, "epoch": 0.8017895351099008, "grad_norm": 1.0078125, "learning_rate": 0.0004941151855097982, "loss": 5.3364, "mean_token_accuracy": 0.16981505006551742, "num_tokens": 17898163.0, "step": 10305 }, { "entropy": 5.551942348480225, "epoch": 0.8021785644816184, "grad_norm": 1.015625, "learning_rate": 0.0004941088865273018, "loss": 5.227, "mean_token_accuracy": 0.18352603912353516, "num_tokens": 17906849.0, "step": 10310 }, { "entropy": 5.574260997772217, "epoch": 0.802567593853336, "grad_norm": 0.96484375, "learning_rate": 0.0004941025842201769, "loss": 5.2549, "mean_token_accuracy": 0.1780119240283966, "num_tokens": 17915695.0, "step": 10315 }, { "entropy": 5.64654860496521, "epoch": 0.8029566232250535, "grad_norm": 0.9765625, "learning_rate": 0.0004940962785885189, "loss": 5.3543, "mean_token_accuracy": 0.17598017901182175, "num_tokens": 17924706.0, "step": 10320 }, { "entropy": 5.561926555633545, "epoch": 0.803345652596771, "grad_norm": 1.0390625, "learning_rate": 0.0004940899696324237, "loss": 5.3287, "mean_token_accuracy": 0.18102977126836778, "num_tokens": 17934061.0, "step": 10325 }, { "entropy": 5.536122751235962, "epoch": 0.8037346819684886, "grad_norm": 1.03125, "learning_rate": 0.0004940836573519868, "loss": 5.2054, "mean_token_accuracy": 0.17839139550924302, "num_tokens": 17942580.0, "step": 10330 }, { "entropy": 5.525859594345093, "epoch": 0.8041237113402062, "grad_norm": 1.0546875, "learning_rate": 0.0004940773417473043, "loss": 5.1004, "mean_token_accuracy": 0.18802183270454406, "num_tokens": 17951171.0, "step": 10335 }, { "entropy": 5.512113428115844, "epoch": 0.8045127407119238, "grad_norm": 0.94921875, "learning_rate": 0.0004940710228184717, "loss": 5.1789, "mean_token_accuracy": 0.19142742902040483, "num_tokens": 17959674.0, "step": 10340 }, { "entropy": 5.538492822647095, "epoch": 0.8049017700836413, "grad_norm": 0.98046875, "learning_rate": 0.000494064700565585, "loss": 5.2434, "mean_token_accuracy": 0.18216741681098939, "num_tokens": 17969036.0, "step": 10345 }, { "entropy": 5.547858619689942, "epoch": 0.8052907994553589, "grad_norm": 1.15625, "learning_rate": 0.0004940583749887403, "loss": 5.2602, "mean_token_accuracy": 0.18307285904884338, "num_tokens": 17977406.0, "step": 10350 }, { "entropy": 5.557126045227051, "epoch": 0.8056798288270764, "grad_norm": 0.99609375, "learning_rate": 0.0004940520460880333, "loss": 5.2322, "mean_token_accuracy": 0.18356891870498657, "num_tokens": 17985981.0, "step": 10355 }, { "entropy": 5.637621688842773, "epoch": 0.806068858198794, "grad_norm": 1.0078125, "learning_rate": 0.0004940457138635601, "loss": 5.4217, "mean_token_accuracy": 0.17267650961875916, "num_tokens": 17994246.0, "step": 10360 }, { "entropy": 5.581584882736206, "epoch": 0.8064578875705116, "grad_norm": 1.0703125, "learning_rate": 0.0004940393783154169, "loss": 5.2593, "mean_token_accuracy": 0.17970990985631943, "num_tokens": 18002444.0, "step": 10365 }, { "entropy": 5.532887077331543, "epoch": 0.8068469169422291, "grad_norm": 1.0625, "learning_rate": 0.0004940330394436999, "loss": 5.1834, "mean_token_accuracy": 0.18363454490900039, "num_tokens": 18011076.0, "step": 10370 }, { "entropy": 5.64114203453064, "epoch": 0.8072359463139467, "grad_norm": 0.96875, "learning_rate": 0.000494026697248505, "loss": 5.4665, "mean_token_accuracy": 0.1663346603512764, "num_tokens": 18020232.0, "step": 10375 }, { "entropy": 5.636241626739502, "epoch": 0.8076249756856643, "grad_norm": 0.9765625, "learning_rate": 0.0004940203517299287, "loss": 5.2743, "mean_token_accuracy": 0.1763804465532303, "num_tokens": 18029055.0, "step": 10380 }, { "entropy": 5.642540788650512, "epoch": 0.8080140050573819, "grad_norm": 1.1953125, "learning_rate": 0.000494014002888067, "loss": 5.4172, "mean_token_accuracy": 0.1637917563319206, "num_tokens": 18037827.0, "step": 10385 }, { "entropy": 5.536993980407715, "epoch": 0.8084030344290994, "grad_norm": 1.015625, "learning_rate": 0.0004940076507230166, "loss": 5.2474, "mean_token_accuracy": 0.17653342634439467, "num_tokens": 18047017.0, "step": 10390 }, { "entropy": 5.619476079940796, "epoch": 0.8087920638008169, "grad_norm": 1.0625, "learning_rate": 0.0004940012952348735, "loss": 5.354, "mean_token_accuracy": 0.17621037364006042, "num_tokens": 18056256.0, "step": 10395 }, { "entropy": 5.568868350982666, "epoch": 0.8091810931725345, "grad_norm": 0.9765625, "learning_rate": 0.0004939949364237345, "loss": 5.1129, "mean_token_accuracy": 0.19875151962041854, "num_tokens": 18064127.0, "step": 10400 }, { "entropy": 5.507281875610351, "epoch": 0.8095701225442521, "grad_norm": 1.0390625, "learning_rate": 0.0004939885742896958, "loss": 5.2757, "mean_token_accuracy": 0.1827508956193924, "num_tokens": 18072766.0, "step": 10405 }, { "entropy": 5.5320202827453615, "epoch": 0.8099591519159697, "grad_norm": 1.046875, "learning_rate": 0.000493982208832854, "loss": 5.2401, "mean_token_accuracy": 0.17939431816339493, "num_tokens": 18080685.0, "step": 10410 }, { "entropy": 5.613889408111572, "epoch": 0.8103481812876873, "grad_norm": 1.0078125, "learning_rate": 0.0004939758400533058, "loss": 5.3109, "mean_token_accuracy": 0.1760113373398781, "num_tokens": 18090026.0, "step": 10415 }, { "entropy": 5.591238641738892, "epoch": 0.8107372106594047, "grad_norm": 1.0234375, "learning_rate": 0.0004939694679511478, "loss": 5.2274, "mean_token_accuracy": 0.18148638010025026, "num_tokens": 18098638.0, "step": 10420 }, { "entropy": 5.526708889007568, "epoch": 0.8111262400311223, "grad_norm": 1.046875, "learning_rate": 0.0004939630925264765, "loss": 5.2639, "mean_token_accuracy": 0.18288784623146057, "num_tokens": 18106844.0, "step": 10425 }, { "entropy": 5.581420755386352, "epoch": 0.8115152694028399, "grad_norm": 1.0078125, "learning_rate": 0.000493956713779389, "loss": 5.2536, "mean_token_accuracy": 0.17701498419046402, "num_tokens": 18114758.0, "step": 10430 }, { "entropy": 5.5890758514404295, "epoch": 0.8119042987745575, "grad_norm": 1.0703125, "learning_rate": 0.0004939503317099817, "loss": 5.2254, "mean_token_accuracy": 0.18185850977897644, "num_tokens": 18122839.0, "step": 10435 }, { "entropy": 5.5715070247650145, "epoch": 0.8122933281462751, "grad_norm": 1.484375, "learning_rate": 0.0004939439463183517, "loss": 5.3198, "mean_token_accuracy": 0.18264523893594742, "num_tokens": 18131709.0, "step": 10440 }, { "entropy": 5.580619525909424, "epoch": 0.8126823575179926, "grad_norm": 0.97265625, "learning_rate": 0.0004939375576045958, "loss": 5.2965, "mean_token_accuracy": 0.17366210371255875, "num_tokens": 18140334.0, "step": 10445 }, { "entropy": 5.531055545806884, "epoch": 0.8130713868897101, "grad_norm": 1.0390625, "learning_rate": 0.0004939311655688109, "loss": 5.293, "mean_token_accuracy": 0.1767920583486557, "num_tokens": 18148648.0, "step": 10450 }, { "entropy": 5.560915088653564, "epoch": 0.8134604162614277, "grad_norm": 1.0546875, "learning_rate": 0.0004939247702110941, "loss": 5.296, "mean_token_accuracy": 0.18004312962293625, "num_tokens": 18156891.0, "step": 10455 }, { "entropy": 5.569944620132446, "epoch": 0.8138494456331453, "grad_norm": 0.93359375, "learning_rate": 0.0004939183715315423, "loss": 5.2408, "mean_token_accuracy": 0.18391807228326798, "num_tokens": 18166512.0, "step": 10460 }, { "entropy": 5.591281080245972, "epoch": 0.8142384750048629, "grad_norm": 0.98046875, "learning_rate": 0.0004939119695302526, "loss": 5.1994, "mean_token_accuracy": 0.18591028600931167, "num_tokens": 18175064.0, "step": 10465 }, { "entropy": 5.552697563171387, "epoch": 0.8146275043765804, "grad_norm": 0.9921875, "learning_rate": 0.0004939055642073224, "loss": 5.3331, "mean_token_accuracy": 0.17966595739126207, "num_tokens": 18184251.0, "step": 10470 }, { "entropy": 5.516888427734375, "epoch": 0.815016533748298, "grad_norm": 1.078125, "learning_rate": 0.0004938991555628484, "loss": 5.167, "mean_token_accuracy": 0.18957981765270232, "num_tokens": 18193274.0, "step": 10475 }, { "entropy": 5.532575511932373, "epoch": 0.8154055631200156, "grad_norm": 1.0, "learning_rate": 0.0004938927435969283, "loss": 5.2303, "mean_token_accuracy": 0.18930566757917405, "num_tokens": 18201878.0, "step": 10480 }, { "entropy": 5.51650972366333, "epoch": 0.8157945924917331, "grad_norm": 0.984375, "learning_rate": 0.0004938863283096592, "loss": 5.1984, "mean_token_accuracy": 0.18496177345514297, "num_tokens": 18210343.0, "step": 10485 }, { "entropy": 5.641515016555786, "epoch": 0.8161836218634507, "grad_norm": 1.0234375, "learning_rate": 0.0004938799097011384, "loss": 5.3281, "mean_token_accuracy": 0.18384619504213334, "num_tokens": 18218599.0, "step": 10490 }, { "entropy": 5.550069665908813, "epoch": 0.8165726512351682, "grad_norm": 1.0078125, "learning_rate": 0.0004938734877714634, "loss": 5.2091, "mean_token_accuracy": 0.18761346638202667, "num_tokens": 18226384.0, "step": 10495 }, { "entropy": 5.519427156448364, "epoch": 0.8169616806068858, "grad_norm": 0.99609375, "learning_rate": 0.0004938670625207317, "loss": 5.2014, "mean_token_accuracy": 0.1802952140569687, "num_tokens": 18234894.0, "step": 10500 }, { "entropy": 5.565952444076538, "epoch": 0.8173507099786034, "grad_norm": 0.9765625, "learning_rate": 0.0004938606339490406, "loss": 5.2414, "mean_token_accuracy": 0.18535373508930206, "num_tokens": 18243768.0, "step": 10505 }, { "entropy": 5.584456729888916, "epoch": 0.817739739350321, "grad_norm": 1.0625, "learning_rate": 0.0004938542020564877, "loss": 5.2782, "mean_token_accuracy": 0.18248629719018936, "num_tokens": 18252364.0, "step": 10510 }, { "entropy": 5.53111891746521, "epoch": 0.8181287687220385, "grad_norm": 0.96875, "learning_rate": 0.0004938477668431706, "loss": 5.2278, "mean_token_accuracy": 0.18297127038240432, "num_tokens": 18260997.0, "step": 10515 }, { "entropy": 5.672461938858032, "epoch": 0.8185177980937561, "grad_norm": 1.0859375, "learning_rate": 0.0004938413283091871, "loss": 5.413, "mean_token_accuracy": 0.17652716487646103, "num_tokens": 18270171.0, "step": 10520 }, { "entropy": 5.643474149703979, "epoch": 0.8189068274654736, "grad_norm": 0.984375, "learning_rate": 0.0004938348864546347, "loss": 5.2559, "mean_token_accuracy": 0.18688322007656097, "num_tokens": 18278772.0, "step": 10525 }, { "entropy": 5.486976099014282, "epoch": 0.8192958568371912, "grad_norm": 1.0078125, "learning_rate": 0.0004938284412796111, "loss": 5.0895, "mean_token_accuracy": 0.18835799694061278, "num_tokens": 18287305.0, "step": 10530 }, { "entropy": 5.470224809646607, "epoch": 0.8196848862089088, "grad_norm": 1.0078125, "learning_rate": 0.0004938219927842144, "loss": 5.3277, "mean_token_accuracy": 0.1742580935359001, "num_tokens": 18296532.0, "step": 10535 }, { "entropy": 5.55927472114563, "epoch": 0.8200739155806264, "grad_norm": 0.98046875, "learning_rate": 0.0004938155409685422, "loss": 5.1859, "mean_token_accuracy": 0.18895601928234101, "num_tokens": 18304612.0, "step": 10540 }, { "entropy": 5.555217218399048, "epoch": 0.820462944952344, "grad_norm": 1.0234375, "learning_rate": 0.0004938090858326923, "loss": 5.2545, "mean_token_accuracy": 0.18999724090099335, "num_tokens": 18312970.0, "step": 10545 }, { "entropy": 5.578555965423584, "epoch": 0.8208519743240614, "grad_norm": 1.078125, "learning_rate": 0.000493802627376763, "loss": 5.2793, "mean_token_accuracy": 0.181522336602211, "num_tokens": 18321073.0, "step": 10550 }, { "entropy": 5.5834558486938475, "epoch": 0.821241003695779, "grad_norm": 1.0078125, "learning_rate": 0.0004937961656008518, "loss": 5.2667, "mean_token_accuracy": 0.18040078282356262, "num_tokens": 18329960.0, "step": 10555 }, { "entropy": 5.514997577667236, "epoch": 0.8216300330674966, "grad_norm": 1.03125, "learning_rate": 0.0004937897005050573, "loss": 5.2308, "mean_token_accuracy": 0.18348744064569472, "num_tokens": 18337935.0, "step": 10560 }, { "entropy": 5.541813945770263, "epoch": 0.8220190624392142, "grad_norm": 0.98828125, "learning_rate": 0.0004937832320894772, "loss": 5.2233, "mean_token_accuracy": 0.18325609117746353, "num_tokens": 18347445.0, "step": 10565 }, { "entropy": 5.586518907546997, "epoch": 0.8224080918109318, "grad_norm": 1.015625, "learning_rate": 0.0004937767603542098, "loss": 5.2327, "mean_token_accuracy": 0.18263234943151474, "num_tokens": 18355817.0, "step": 10570 }, { "entropy": 5.571928024291992, "epoch": 0.8227971211826492, "grad_norm": 1.046875, "learning_rate": 0.0004937702852993534, "loss": 5.2282, "mean_token_accuracy": 0.18538487404584886, "num_tokens": 18363478.0, "step": 10575 }, { "entropy": 5.531855154037475, "epoch": 0.8231861505543668, "grad_norm": 1.0546875, "learning_rate": 0.000493763806925006, "loss": 5.2108, "mean_token_accuracy": 0.18181927502155304, "num_tokens": 18371788.0, "step": 10580 }, { "entropy": 5.53119592666626, "epoch": 0.8235751799260844, "grad_norm": 1.0234375, "learning_rate": 0.0004937573252312661, "loss": 5.2477, "mean_token_accuracy": 0.18195367455482483, "num_tokens": 18380361.0, "step": 10585 }, { "entropy": 5.575139045715332, "epoch": 0.823964209297802, "grad_norm": 1.015625, "learning_rate": 0.000493750840218232, "loss": 5.3032, "mean_token_accuracy": 0.18456340879201888, "num_tokens": 18389396.0, "step": 10590 }, { "entropy": 5.549172067642212, "epoch": 0.8243532386695196, "grad_norm": 1.0, "learning_rate": 0.0004937443518860021, "loss": 5.3634, "mean_token_accuracy": 0.16981100738048555, "num_tokens": 18398517.0, "step": 10595 }, { "entropy": 5.645396184921265, "epoch": 0.8247422680412371, "grad_norm": 1.078125, "learning_rate": 0.0004937378602346747, "loss": 5.2937, "mean_token_accuracy": 0.18099551200866698, "num_tokens": 18406620.0, "step": 10600 }, { "entropy": 5.5864983081817625, "epoch": 0.8251312974129547, "grad_norm": 1.0390625, "learning_rate": 0.0004937313652643485, "loss": 5.3128, "mean_token_accuracy": 0.17442767173051835, "num_tokens": 18414849.0, "step": 10605 }, { "entropy": 5.521216821670532, "epoch": 0.8255203267846722, "grad_norm": 0.95703125, "learning_rate": 0.000493724866975122, "loss": 5.2769, "mean_token_accuracy": 0.18221895694732665, "num_tokens": 18423675.0, "step": 10610 }, { "entropy": 5.66914439201355, "epoch": 0.8259093561563898, "grad_norm": 1.015625, "learning_rate": 0.0004937183653670937, "loss": 5.3275, "mean_token_accuracy": 0.17973185926675797, "num_tokens": 18432848.0, "step": 10615 }, { "entropy": 5.662630844116211, "epoch": 0.8262983855281074, "grad_norm": 1.0546875, "learning_rate": 0.0004937118604403623, "loss": 5.3713, "mean_token_accuracy": 0.17663578391075135, "num_tokens": 18441210.0, "step": 10620 }, { "entropy": 5.59189510345459, "epoch": 0.8266874148998249, "grad_norm": 1.0390625, "learning_rate": 0.0004937053521950266, "loss": 5.2786, "mean_token_accuracy": 0.17604520916938782, "num_tokens": 18450084.0, "step": 10625 }, { "entropy": 5.486194515228272, "epoch": 0.8270764442715425, "grad_norm": 1.0703125, "learning_rate": 0.0004936988406311854, "loss": 5.1548, "mean_token_accuracy": 0.18131692260503768, "num_tokens": 18458329.0, "step": 10630 }, { "entropy": 5.525796365737915, "epoch": 0.8274654736432601, "grad_norm": 0.9765625, "learning_rate": 0.0004936923257489373, "loss": 5.2683, "mean_token_accuracy": 0.17761918902397156, "num_tokens": 18467518.0, "step": 10635 }, { "entropy": 5.520053434371948, "epoch": 0.8278545030149776, "grad_norm": 1.0625, "learning_rate": 0.0004936858075483811, "loss": 5.1578, "mean_token_accuracy": 0.1974279910326004, "num_tokens": 18476051.0, "step": 10640 }, { "entropy": 5.584073686599732, "epoch": 0.8282435323866952, "grad_norm": 0.96875, "learning_rate": 0.000493679286029616, "loss": 5.2558, "mean_token_accuracy": 0.18164041340351106, "num_tokens": 18484492.0, "step": 10645 }, { "entropy": 5.581503963470459, "epoch": 0.8286325617584127, "grad_norm": 1.1328125, "learning_rate": 0.0004936727611927407, "loss": 5.3281, "mean_token_accuracy": 0.1709176108241081, "num_tokens": 18493759.0, "step": 10650 }, { "entropy": 5.606781721115112, "epoch": 0.8290215911301303, "grad_norm": 1.0234375, "learning_rate": 0.0004936662330378546, "loss": 5.1846, "mean_token_accuracy": 0.18201837837696075, "num_tokens": 18501750.0, "step": 10655 }, { "entropy": 5.490160417556763, "epoch": 0.8294106205018479, "grad_norm": 1.046875, "learning_rate": 0.0004936597015650561, "loss": 5.1917, "mean_token_accuracy": 0.18296556621789933, "num_tokens": 18511003.0, "step": 10660 }, { "entropy": 5.513647127151489, "epoch": 0.8297996498735655, "grad_norm": 0.98046875, "learning_rate": 0.0004936531667744448, "loss": 5.2433, "mean_token_accuracy": 0.18767827302217482, "num_tokens": 18519544.0, "step": 10665 }, { "entropy": 5.686276054382324, "epoch": 0.8301886792452831, "grad_norm": 1.015625, "learning_rate": 0.0004936466286661197, "loss": 5.3324, "mean_token_accuracy": 0.17959838956594468, "num_tokens": 18528766.0, "step": 10670 }, { "entropy": 5.601961088180542, "epoch": 0.8305777086170005, "grad_norm": 0.96875, "learning_rate": 0.00049364008724018, "loss": 5.3349, "mean_token_accuracy": 0.1756493031978607, "num_tokens": 18538243.0, "step": 10675 }, { "entropy": 5.592152118682861, "epoch": 0.8309667379887181, "grad_norm": 1.015625, "learning_rate": 0.000493633542496725, "loss": 5.3425, "mean_token_accuracy": 0.1781254753470421, "num_tokens": 18547028.0, "step": 10680 }, { "entropy": 5.618417549133301, "epoch": 0.8313557673604357, "grad_norm": 0.98046875, "learning_rate": 0.0004936269944358539, "loss": 5.3546, "mean_token_accuracy": 0.17658570408821106, "num_tokens": 18555821.0, "step": 10685 }, { "entropy": 5.542150449752808, "epoch": 0.8317447967321533, "grad_norm": 1.0234375, "learning_rate": 0.0004936204430576664, "loss": 5.322, "mean_token_accuracy": 0.17941897213459015, "num_tokens": 18564213.0, "step": 10690 }, { "entropy": 5.60770435333252, "epoch": 0.8321338261038709, "grad_norm": 1.0078125, "learning_rate": 0.0004936138883622614, "loss": 5.2899, "mean_token_accuracy": 0.17497958540916442, "num_tokens": 18573132.0, "step": 10695 }, { "entropy": 5.606252002716064, "epoch": 0.8325228554755884, "grad_norm": 0.9921875, "learning_rate": 0.0004936073303497387, "loss": 5.1981, "mean_token_accuracy": 0.18049157559871673, "num_tokens": 18581131.0, "step": 10700 }, { "entropy": 5.564637136459351, "epoch": 0.8329118848473059, "grad_norm": 1.0390625, "learning_rate": 0.0004936007690201976, "loss": 5.2805, "mean_token_accuracy": 0.1784028634428978, "num_tokens": 18589602.0, "step": 10705 }, { "entropy": 5.548305988311768, "epoch": 0.8333009142190235, "grad_norm": 0.9921875, "learning_rate": 0.000493594204373738, "loss": 5.2647, "mean_token_accuracy": 0.1764623209834099, "num_tokens": 18598263.0, "step": 10710 }, { "entropy": 5.606611728668213, "epoch": 0.8336899435907411, "grad_norm": 1.109375, "learning_rate": 0.0004935876364104591, "loss": 5.1725, "mean_token_accuracy": 0.189447121322155, "num_tokens": 18606432.0, "step": 10715 }, { "entropy": 5.573548603057861, "epoch": 0.8340789729624587, "grad_norm": 1.03125, "learning_rate": 0.0004935810651304608, "loss": 5.3071, "mean_token_accuracy": 0.17638261318206788, "num_tokens": 18614769.0, "step": 10720 }, { "entropy": 5.607085561752319, "epoch": 0.8344680023341763, "grad_norm": 1.0546875, "learning_rate": 0.0004935744905338427, "loss": 5.271, "mean_token_accuracy": 0.17813154458999633, "num_tokens": 18623505.0, "step": 10725 }, { "entropy": 5.621091651916504, "epoch": 0.8348570317058938, "grad_norm": 0.9921875, "learning_rate": 0.0004935679126207046, "loss": 5.2392, "mean_token_accuracy": 0.19103155732154847, "num_tokens": 18632072.0, "step": 10730 }, { "entropy": 5.650973272323609, "epoch": 0.8352460610776113, "grad_norm": 1.0390625, "learning_rate": 0.0004935613313911463, "loss": 5.3168, "mean_token_accuracy": 0.17635270208120346, "num_tokens": 18640439.0, "step": 10735 }, { "entropy": 5.56662220954895, "epoch": 0.8356350904493289, "grad_norm": 0.9375, "learning_rate": 0.0004935547468452678, "loss": 5.3091, "mean_token_accuracy": 0.16891513168811798, "num_tokens": 18649554.0, "step": 10740 }, { "entropy": 5.607131433486939, "epoch": 0.8360241198210465, "grad_norm": 0.96484375, "learning_rate": 0.0004935481589831688, "loss": 5.1742, "mean_token_accuracy": 0.1841895952820778, "num_tokens": 18657918.0, "step": 10745 }, { "entropy": 5.629995822906494, "epoch": 0.8364131491927641, "grad_norm": 1.0078125, "learning_rate": 0.0004935415678049492, "loss": 5.288, "mean_token_accuracy": 0.17434722632169725, "num_tokens": 18666735.0, "step": 10750 }, { "entropy": 5.569375228881836, "epoch": 0.8368021785644816, "grad_norm": 1.1171875, "learning_rate": 0.0004935349733107094, "loss": 5.1825, "mean_token_accuracy": 0.1853045254945755, "num_tokens": 18674977.0, "step": 10755 }, { "entropy": 5.5684432029724125, "epoch": 0.8371912079361992, "grad_norm": 1.03125, "learning_rate": 0.000493528375500549, "loss": 5.3288, "mean_token_accuracy": 0.17748333066701888, "num_tokens": 18683624.0, "step": 10760 }, { "entropy": 5.524935007095337, "epoch": 0.8375802373079168, "grad_norm": 1.0625, "learning_rate": 0.0004935217743745685, "loss": 5.2199, "mean_token_accuracy": 0.18397823274135588, "num_tokens": 18692183.0, "step": 10765 }, { "entropy": 5.604568290710449, "epoch": 0.8379692666796343, "grad_norm": 1.109375, "learning_rate": 0.0004935151699328677, "loss": 5.3085, "mean_token_accuracy": 0.17603420168161393, "num_tokens": 18700989.0, "step": 10770 }, { "entropy": 5.545925712585449, "epoch": 0.8383582960513519, "grad_norm": 1.1015625, "learning_rate": 0.0004935085621755471, "loss": 5.1773, "mean_token_accuracy": 0.18596030175685882, "num_tokens": 18709126.0, "step": 10775 }, { "entropy": 5.587519264221191, "epoch": 0.8387473254230694, "grad_norm": 1.03125, "learning_rate": 0.000493501951102707, "loss": 5.2801, "mean_token_accuracy": 0.17877295315265657, "num_tokens": 18717378.0, "step": 10780 }, { "entropy": 5.650118827819824, "epoch": 0.839136354794787, "grad_norm": 1.0234375, "learning_rate": 0.0004934953367144474, "loss": 5.3387, "mean_token_accuracy": 0.17719743847846986, "num_tokens": 18725694.0, "step": 10785 }, { "entropy": 5.557237815856934, "epoch": 0.8395253841665046, "grad_norm": 0.9765625, "learning_rate": 0.0004934887190108688, "loss": 5.2483, "mean_token_accuracy": 0.1862121567130089, "num_tokens": 18734737.0, "step": 10790 }, { "entropy": 5.691574382781982, "epoch": 0.8399144135382222, "grad_norm": 1.0390625, "learning_rate": 0.0004934820979920719, "loss": 5.4604, "mean_token_accuracy": 0.1678543671965599, "num_tokens": 18743895.0, "step": 10795 }, { "entropy": 5.637724208831787, "epoch": 0.8403034429099397, "grad_norm": 1.0078125, "learning_rate": 0.0004934754736581567, "loss": 5.3261, "mean_token_accuracy": 0.17763975709676744, "num_tokens": 18753105.0, "step": 10800 }, { "entropy": 5.481872081756592, "epoch": 0.8406924722816572, "grad_norm": 1.015625, "learning_rate": 0.000493468846009224, "loss": 5.186, "mean_token_accuracy": 0.18352127373218535, "num_tokens": 18761593.0, "step": 10805 }, { "entropy": 5.628566932678223, "epoch": 0.8410815016533748, "grad_norm": 0.95703125, "learning_rate": 0.0004934622150453742, "loss": 5.2388, "mean_token_accuracy": 0.18627728074789046, "num_tokens": 18770105.0, "step": 10810 }, { "entropy": 5.605173635482788, "epoch": 0.8414705310250924, "grad_norm": 0.953125, "learning_rate": 0.000493455580766708, "loss": 5.2866, "mean_token_accuracy": 0.17801288664340972, "num_tokens": 18778429.0, "step": 10815 }, { "entropy": 5.651268720626831, "epoch": 0.84185956039681, "grad_norm": 1.1328125, "learning_rate": 0.0004934489431733262, "loss": 5.327, "mean_token_accuracy": 0.17554858028888704, "num_tokens": 18787072.0, "step": 10820 }, { "entropy": 5.529681539535522, "epoch": 0.8422485897685276, "grad_norm": 1.0078125, "learning_rate": 0.0004934423022653293, "loss": 5.1998, "mean_token_accuracy": 0.18770936578512193, "num_tokens": 18795628.0, "step": 10825 }, { "entropy": 5.560863208770752, "epoch": 0.842637619140245, "grad_norm": 0.984375, "learning_rate": 0.0004934356580428182, "loss": 5.2882, "mean_token_accuracy": 0.17767442017793655, "num_tokens": 18804313.0, "step": 10830 }, { "entropy": 5.613304376602173, "epoch": 0.8430266485119626, "grad_norm": 0.97265625, "learning_rate": 0.0004934290105058937, "loss": 5.3149, "mean_token_accuracy": 0.1774200201034546, "num_tokens": 18813170.0, "step": 10835 }, { "entropy": 5.5797830581665036, "epoch": 0.8434156778836802, "grad_norm": 1.015625, "learning_rate": 0.0004934223596546565, "loss": 5.2632, "mean_token_accuracy": 0.1828976258635521, "num_tokens": 18823009.0, "step": 10840 }, { "entropy": 5.589580345153808, "epoch": 0.8438047072553978, "grad_norm": 1.0390625, "learning_rate": 0.0004934157054892077, "loss": 5.3109, "mean_token_accuracy": 0.17641228437423706, "num_tokens": 18831272.0, "step": 10845 }, { "entropy": 5.562094211578369, "epoch": 0.8441937366271154, "grad_norm": 1.046875, "learning_rate": 0.0004934090480096482, "loss": 5.299, "mean_token_accuracy": 0.17283533960580827, "num_tokens": 18839481.0, "step": 10850 }, { "entropy": 5.531780529022217, "epoch": 0.8445827659988329, "grad_norm": 1.0234375, "learning_rate": 0.0004934023872160791, "loss": 5.26, "mean_token_accuracy": 0.18713913410902022, "num_tokens": 18848586.0, "step": 10855 }, { "entropy": 5.568729019165039, "epoch": 0.8449717953705504, "grad_norm": 1.0625, "learning_rate": 0.0004933957231086014, "loss": 5.1588, "mean_token_accuracy": 0.18601678311824799, "num_tokens": 18856948.0, "step": 10860 }, { "entropy": 5.581716871261596, "epoch": 0.845360824742268, "grad_norm": 0.98046875, "learning_rate": 0.0004933890556873161, "loss": 5.2363, "mean_token_accuracy": 0.1828387498855591, "num_tokens": 18864741.0, "step": 10865 }, { "entropy": 5.566734266281128, "epoch": 0.8457498541139856, "grad_norm": 0.9921875, "learning_rate": 0.0004933823849523246, "loss": 5.2831, "mean_token_accuracy": 0.17859045118093492, "num_tokens": 18873373.0, "step": 10870 }, { "entropy": 5.621180152893066, "epoch": 0.8461388834857032, "grad_norm": 1.0703125, "learning_rate": 0.0004933757109037279, "loss": 5.1734, "mean_token_accuracy": 0.18435244262218475, "num_tokens": 18881590.0, "step": 10875 }, { "entropy": 5.598472595214844, "epoch": 0.8465279128574207, "grad_norm": 1.015625, "learning_rate": 0.0004933690335416274, "loss": 5.2838, "mean_token_accuracy": 0.1795947551727295, "num_tokens": 18889838.0, "step": 10880 }, { "entropy": 5.509574937820434, "epoch": 0.8469169422291383, "grad_norm": 1.0625, "learning_rate": 0.0004933623528661245, "loss": 5.1859, "mean_token_accuracy": 0.18743556141853332, "num_tokens": 18898577.0, "step": 10885 }, { "entropy": 5.6272741794586185, "epoch": 0.8473059716008559, "grad_norm": 1.09375, "learning_rate": 0.0004933556688773203, "loss": 5.3269, "mean_token_accuracy": 0.1822746753692627, "num_tokens": 18907309.0, "step": 10890 }, { "entropy": 5.579664325714111, "epoch": 0.8476950009725734, "grad_norm": 0.97265625, "learning_rate": 0.0004933489815753165, "loss": 5.259, "mean_token_accuracy": 0.1802939161658287, "num_tokens": 18915956.0, "step": 10895 }, { "entropy": 5.562767219543457, "epoch": 0.848084030344291, "grad_norm": 1.0078125, "learning_rate": 0.0004933422909602143, "loss": 5.3698, "mean_token_accuracy": 0.17607285976409912, "num_tokens": 18924603.0, "step": 10900 }, { "entropy": 5.6034938335418705, "epoch": 0.8484730597160085, "grad_norm": 0.97265625, "learning_rate": 0.0004933355970321155, "loss": 5.2233, "mean_token_accuracy": 0.19376989603042602, "num_tokens": 18933231.0, "step": 10905 }, { "entropy": 5.643422651290893, "epoch": 0.8488620890877261, "grad_norm": 1.140625, "learning_rate": 0.0004933288997911215, "loss": 5.3461, "mean_token_accuracy": 0.17191843837499618, "num_tokens": 18942172.0, "step": 10910 }, { "entropy": 5.601671886444092, "epoch": 0.8492511184594437, "grad_norm": 0.984375, "learning_rate": 0.0004933221992373338, "loss": 5.3014, "mean_token_accuracy": 0.18420382738113403, "num_tokens": 18951440.0, "step": 10915 }, { "entropy": 5.595506048202514, "epoch": 0.8496401478311613, "grad_norm": 1.0234375, "learning_rate": 0.0004933154953708544, "loss": 5.2545, "mean_token_accuracy": 0.17833930402994155, "num_tokens": 18959797.0, "step": 10920 }, { "entropy": 5.569685554504394, "epoch": 0.8500291772028788, "grad_norm": 1.0, "learning_rate": 0.0004933087881917848, "loss": 5.2557, "mean_token_accuracy": 0.18182741552591325, "num_tokens": 18968811.0, "step": 10925 }, { "entropy": 5.647049331665039, "epoch": 0.8504182065745964, "grad_norm": 1.09375, "learning_rate": 0.0004933020777002268, "loss": 5.3944, "mean_token_accuracy": 0.1689011871814728, "num_tokens": 18977467.0, "step": 10930 }, { "entropy": 5.63600492477417, "epoch": 0.8508072359463139, "grad_norm": 1.015625, "learning_rate": 0.0004932953638962823, "loss": 5.2903, "mean_token_accuracy": 0.17715788632631302, "num_tokens": 18985760.0, "step": 10935 }, { "entropy": 5.675756120681763, "epoch": 0.8511962653180315, "grad_norm": 1.0625, "learning_rate": 0.000493288646780053, "loss": 5.3285, "mean_token_accuracy": 0.17073256522417068, "num_tokens": 18993812.0, "step": 10940 }, { "entropy": 5.579043006896972, "epoch": 0.8515852946897491, "grad_norm": 1.046875, "learning_rate": 0.0004932819263516409, "loss": 5.3169, "mean_token_accuracy": 0.17365503907203675, "num_tokens": 19003056.0, "step": 10945 }, { "entropy": 5.640437602996826, "epoch": 0.8519743240614667, "grad_norm": 0.9921875, "learning_rate": 0.0004932752026111481, "loss": 5.326, "mean_token_accuracy": 0.18457741886377335, "num_tokens": 19011533.0, "step": 10950 }, { "entropy": 5.589516830444336, "epoch": 0.8523633534331843, "grad_norm": 0.95703125, "learning_rate": 0.0004932684755586765, "loss": 5.2553, "mean_token_accuracy": 0.18523511439561843, "num_tokens": 19020773.0, "step": 10955 }, { "entropy": 5.556193828582764, "epoch": 0.8527523828049017, "grad_norm": 0.93359375, "learning_rate": 0.0004932617451943282, "loss": 5.2692, "mean_token_accuracy": 0.1786767065525055, "num_tokens": 19029809.0, "step": 10960 }, { "entropy": 5.588405799865723, "epoch": 0.8531414121766193, "grad_norm": 0.99609375, "learning_rate": 0.0004932550115182053, "loss": 5.1919, "mean_token_accuracy": 0.18426750153303145, "num_tokens": 19038875.0, "step": 10965 }, { "entropy": 5.668352508544922, "epoch": 0.8535304415483369, "grad_norm": 1.0625, "learning_rate": 0.00049324827453041, "loss": 5.2954, "mean_token_accuracy": 0.1859284058213234, "num_tokens": 19047273.0, "step": 10970 }, { "entropy": 5.5029138088226315, "epoch": 0.8539194709200545, "grad_norm": 1.046875, "learning_rate": 0.0004932415342310446, "loss": 5.226, "mean_token_accuracy": 0.18578009456396102, "num_tokens": 19056309.0, "step": 10975 }, { "entropy": 5.576099920272827, "epoch": 0.8543085002917721, "grad_norm": 1.0, "learning_rate": 0.0004932347906202111, "loss": 5.1929, "mean_token_accuracy": 0.18371533304452897, "num_tokens": 19064487.0, "step": 10980 }, { "entropy": 5.629020071029663, "epoch": 0.8546975296634896, "grad_norm": 1.03125, "learning_rate": 0.000493228043698012, "loss": 5.4229, "mean_token_accuracy": 0.1786932975053787, "num_tokens": 19073431.0, "step": 10985 }, { "entropy": 5.579223012924194, "epoch": 0.8550865590352071, "grad_norm": 0.97265625, "learning_rate": 0.0004932212934645498, "loss": 5.2955, "mean_token_accuracy": 0.1799983873963356, "num_tokens": 19081648.0, "step": 10990 }, { "entropy": 5.494553661346435, "epoch": 0.8554755884069247, "grad_norm": 0.97265625, "learning_rate": 0.0004932145399199268, "loss": 5.2156, "mean_token_accuracy": 0.18520181775093078, "num_tokens": 19090581.0, "step": 10995 }, { "entropy": 5.652668523788452, "epoch": 0.8558646177786423, "grad_norm": 1.0390625, "learning_rate": 0.0004932077830642455, "loss": 5.291, "mean_token_accuracy": 0.17706617563962937, "num_tokens": 19098924.0, "step": 11000 }, { "entropy": 5.634372806549072, "epoch": 0.8562536471503599, "grad_norm": 0.9921875, "learning_rate": 0.0004932010228976084, "loss": 5.2951, "mean_token_accuracy": 0.18166774958372117, "num_tokens": 19108267.0, "step": 11005 }, { "entropy": 5.644163608551025, "epoch": 0.8566426765220774, "grad_norm": 0.9765625, "learning_rate": 0.000493194259420118, "loss": 5.3173, "mean_token_accuracy": 0.1759129285812378, "num_tokens": 19117158.0, "step": 11010 }, { "entropy": 5.562337493896484, "epoch": 0.857031705893795, "grad_norm": 0.9375, "learning_rate": 0.000493187492631877, "loss": 5.2836, "mean_token_accuracy": 0.18314954042434692, "num_tokens": 19126013.0, "step": 11015 }, { "entropy": 5.554191589355469, "epoch": 0.8574207352655125, "grad_norm": 1.0390625, "learning_rate": 0.0004931807225329882, "loss": 5.2311, "mean_token_accuracy": 0.18219724297523499, "num_tokens": 19134655.0, "step": 11020 }, { "entropy": 5.543011665344238, "epoch": 0.8578097646372301, "grad_norm": 0.96875, "learning_rate": 0.0004931739491235541, "loss": 5.1314, "mean_token_accuracy": 0.18265994936227797, "num_tokens": 19143311.0, "step": 11025 }, { "entropy": 5.607172536849975, "epoch": 0.8581987940089477, "grad_norm": 1.046875, "learning_rate": 0.0004931671724036777, "loss": 5.2656, "mean_token_accuracy": 0.18656713962554933, "num_tokens": 19152422.0, "step": 11030 }, { "entropy": 5.608309650421143, "epoch": 0.8585878233806652, "grad_norm": 1.0, "learning_rate": 0.0004931603923734616, "loss": 5.3731, "mean_token_accuracy": 0.17477262318134307, "num_tokens": 19161510.0, "step": 11035 }, { "entropy": 5.52988109588623, "epoch": 0.8589768527523828, "grad_norm": 1.0546875, "learning_rate": 0.0004931536090330088, "loss": 5.1933, "mean_token_accuracy": 0.18769892752170564, "num_tokens": 19170097.0, "step": 11040 }, { "entropy": 5.5798032760620115, "epoch": 0.8593658821241004, "grad_norm": 0.98046875, "learning_rate": 0.0004931468223824222, "loss": 5.2359, "mean_token_accuracy": 0.18533996045589446, "num_tokens": 19179131.0, "step": 11045 }, { "entropy": 5.510780191421508, "epoch": 0.859754911495818, "grad_norm": 1.0625, "learning_rate": 0.0004931400324218048, "loss": 5.1521, "mean_token_accuracy": 0.18891196697950363, "num_tokens": 19187289.0, "step": 11050 }, { "entropy": 5.5318817615509035, "epoch": 0.8601439408675355, "grad_norm": 1.046875, "learning_rate": 0.0004931332391512597, "loss": 5.2588, "mean_token_accuracy": 0.18268831372261046, "num_tokens": 19195746.0, "step": 11055 }, { "entropy": 5.657726907730103, "epoch": 0.860532970239253, "grad_norm": 0.953125, "learning_rate": 0.0004931264425708897, "loss": 5.2772, "mean_token_accuracy": 0.17957644909620285, "num_tokens": 19204683.0, "step": 11060 }, { "entropy": 5.565079832077027, "epoch": 0.8609219996109706, "grad_norm": 1.046875, "learning_rate": 0.0004931196426807983, "loss": 5.1942, "mean_token_accuracy": 0.1739495277404785, "num_tokens": 19213405.0, "step": 11065 }, { "entropy": 5.558668422698974, "epoch": 0.8613110289826882, "grad_norm": 0.9375, "learning_rate": 0.0004931128394810884, "loss": 5.2932, "mean_token_accuracy": 0.1813378795981407, "num_tokens": 19222717.0, "step": 11070 }, { "entropy": 5.656969976425171, "epoch": 0.8617000583544058, "grad_norm": 1.0859375, "learning_rate": 0.0004931060329718634, "loss": 5.2941, "mean_token_accuracy": 0.17425547689199447, "num_tokens": 19230688.0, "step": 11075 }, { "entropy": 5.613022518157959, "epoch": 0.8620890877261234, "grad_norm": 0.9921875, "learning_rate": 0.0004930992231532265, "loss": 5.3514, "mean_token_accuracy": 0.1688617140054703, "num_tokens": 19239192.0, "step": 11080 }, { "entropy": 5.621093082427978, "epoch": 0.8624781170978408, "grad_norm": 1.03125, "learning_rate": 0.000493092410025281, "loss": 5.3322, "mean_token_accuracy": 0.17372597455978395, "num_tokens": 19247903.0, "step": 11085 }, { "entropy": 5.603265428543091, "epoch": 0.8628671464695584, "grad_norm": 1.078125, "learning_rate": 0.0004930855935881302, "loss": 5.2803, "mean_token_accuracy": 0.17990875244140625, "num_tokens": 19256127.0, "step": 11090 }, { "entropy": 5.596434783935547, "epoch": 0.863256175841276, "grad_norm": 0.97265625, "learning_rate": 0.0004930787738418777, "loss": 5.2475, "mean_token_accuracy": 0.18377451449632645, "num_tokens": 19264742.0, "step": 11095 }, { "entropy": 5.573207521438599, "epoch": 0.8636452052129936, "grad_norm": 1.0234375, "learning_rate": 0.0004930719507866269, "loss": 5.213, "mean_token_accuracy": 0.18178284168243408, "num_tokens": 19273618.0, "step": 11100 }, { "entropy": 5.607818603515625, "epoch": 0.8640342345847112, "grad_norm": 1.0390625, "learning_rate": 0.0004930651244224814, "loss": 5.2712, "mean_token_accuracy": 0.18519938588142396, "num_tokens": 19281792.0, "step": 11105 }, { "entropy": 5.511165904998779, "epoch": 0.8644232639564287, "grad_norm": 1.0234375, "learning_rate": 0.0004930582947495448, "loss": 5.2364, "mean_token_accuracy": 0.17781448662281035, "num_tokens": 19289738.0, "step": 11110 }, { "entropy": 5.619218063354492, "epoch": 0.8648122933281462, "grad_norm": 1.0546875, "learning_rate": 0.0004930514617679206, "loss": 5.225, "mean_token_accuracy": 0.18328847289085387, "num_tokens": 19298711.0, "step": 11115 }, { "entropy": 5.670982360839844, "epoch": 0.8652013226998638, "grad_norm": 1.078125, "learning_rate": 0.0004930446254777125, "loss": 5.3287, "mean_token_accuracy": 0.18125866651535033, "num_tokens": 19307435.0, "step": 11120 }, { "entropy": 5.551834154129028, "epoch": 0.8655903520715814, "grad_norm": 1.078125, "learning_rate": 0.0004930377858790242, "loss": 5.2042, "mean_token_accuracy": 0.18154563158750534, "num_tokens": 19315327.0, "step": 11125 }, { "entropy": 5.545620679855347, "epoch": 0.865979381443299, "grad_norm": 1.03125, "learning_rate": 0.0004930309429719595, "loss": 5.1551, "mean_token_accuracy": 0.1891895890235901, "num_tokens": 19323261.0, "step": 11130 }, { "entropy": 5.4682965755462645, "epoch": 0.8663684108150166, "grad_norm": 0.99609375, "learning_rate": 0.0004930240967566224, "loss": 5.1283, "mean_token_accuracy": 0.18640220314264297, "num_tokens": 19332297.0, "step": 11135 }, { "entropy": 5.541049814224243, "epoch": 0.8667574401867341, "grad_norm": 1.09375, "learning_rate": 0.0004930172472331167, "loss": 5.1663, "mean_token_accuracy": 0.18291076570749282, "num_tokens": 19340848.0, "step": 11140 }, { "entropy": 5.5286298274993895, "epoch": 0.8671464695584516, "grad_norm": 1.0859375, "learning_rate": 0.0004930103944015463, "loss": 5.2089, "mean_token_accuracy": 0.18289046585559846, "num_tokens": 19349072.0, "step": 11145 }, { "entropy": 5.621784114837647, "epoch": 0.8675354989301692, "grad_norm": 1.1328125, "learning_rate": 0.0004930035382620149, "loss": 5.2659, "mean_token_accuracy": 0.18448480367660522, "num_tokens": 19357723.0, "step": 11150 }, { "entropy": 5.515363550186157, "epoch": 0.8679245283018868, "grad_norm": 1.0390625, "learning_rate": 0.000492996678814627, "loss": 5.2027, "mean_token_accuracy": 0.1899164915084839, "num_tokens": 19365925.0, "step": 11155 }, { "entropy": 5.50625205039978, "epoch": 0.8683135576736044, "grad_norm": 0.96875, "learning_rate": 0.0004929898160594865, "loss": 5.2557, "mean_token_accuracy": 0.1823277398943901, "num_tokens": 19374190.0, "step": 11160 }, { "entropy": 5.544011402130127, "epoch": 0.8687025870453219, "grad_norm": 0.9921875, "learning_rate": 0.0004929829499966974, "loss": 5.244, "mean_token_accuracy": 0.18081277012825012, "num_tokens": 19382375.0, "step": 11165 }, { "entropy": 5.645644044876098, "epoch": 0.8690916164170395, "grad_norm": 1.15625, "learning_rate": 0.0004929760806263641, "loss": 5.2952, "mean_token_accuracy": 0.18304144740104675, "num_tokens": 19390191.0, "step": 11170 }, { "entropy": 5.537923336029053, "epoch": 0.8694806457887571, "grad_norm": 1.0234375, "learning_rate": 0.0004929692079485906, "loss": 5.0954, "mean_token_accuracy": 0.19233231097459794, "num_tokens": 19399401.0, "step": 11175 }, { "entropy": 5.514873600006103, "epoch": 0.8698696751604746, "grad_norm": 0.953125, "learning_rate": 0.0004929623319634814, "loss": 5.1988, "mean_token_accuracy": 0.1855992019176483, "num_tokens": 19407956.0, "step": 11180 }, { "entropy": 5.560956764221191, "epoch": 0.8702587045321922, "grad_norm": 1.0703125, "learning_rate": 0.0004929554526711407, "loss": 5.3478, "mean_token_accuracy": 0.180048431456089, "num_tokens": 19416432.0, "step": 11185 }, { "entropy": 5.546083641052246, "epoch": 0.8706477339039097, "grad_norm": 0.97265625, "learning_rate": 0.0004929485700716729, "loss": 5.2248, "mean_token_accuracy": 0.18299429714679719, "num_tokens": 19425208.0, "step": 11190 }, { "entropy": 5.644758796691894, "epoch": 0.8710367632756273, "grad_norm": 1.015625, "learning_rate": 0.0004929416841651824, "loss": 5.3298, "mean_token_accuracy": 0.18089791685342788, "num_tokens": 19434169.0, "step": 11195 }, { "entropy": 5.550636720657349, "epoch": 0.8714257926473449, "grad_norm": 1.03125, "learning_rate": 0.0004929347949517739, "loss": 5.1011, "mean_token_accuracy": 0.19305706769227982, "num_tokens": 19443484.0, "step": 11200 }, { "entropy": 5.513714361190796, "epoch": 0.8718148220190625, "grad_norm": 1.015625, "learning_rate": 0.0004929279024315516, "loss": 5.2667, "mean_token_accuracy": 0.18305621594190596, "num_tokens": 19452193.0, "step": 11205 }, { "entropy": 5.679654121398926, "epoch": 0.87220385139078, "grad_norm": 0.97265625, "learning_rate": 0.0004929210066046204, "loss": 5.3846, "mean_token_accuracy": 0.17571600824594497, "num_tokens": 19460684.0, "step": 11210 }, { "entropy": 5.62515287399292, "epoch": 0.8725928807624975, "grad_norm": 1.0546875, "learning_rate": 0.0004929141074710847, "loss": 5.2333, "mean_token_accuracy": 0.18159908354282378, "num_tokens": 19469206.0, "step": 11215 }, { "entropy": 5.55255913734436, "epoch": 0.8729819101342151, "grad_norm": 1.0625, "learning_rate": 0.0004929072050310491, "loss": 5.2785, "mean_token_accuracy": 0.17789066433906556, "num_tokens": 19477514.0, "step": 11220 }, { "entropy": 5.546413421630859, "epoch": 0.8733709395059327, "grad_norm": 1.125, "learning_rate": 0.0004929002992846188, "loss": 5.3287, "mean_token_accuracy": 0.17711522430181503, "num_tokens": 19486792.0, "step": 11225 }, { "entropy": 5.614936256408692, "epoch": 0.8737599688776503, "grad_norm": 1.046875, "learning_rate": 0.0004928933902318981, "loss": 5.2662, "mean_token_accuracy": 0.1872934803366661, "num_tokens": 19495708.0, "step": 11230 }, { "entropy": 5.656894969940185, "epoch": 0.8741489982493679, "grad_norm": 1.015625, "learning_rate": 0.000492886477872992, "loss": 5.4256, "mean_token_accuracy": 0.1650377556681633, "num_tokens": 19505063.0, "step": 11235 }, { "entropy": 5.657841396331787, "epoch": 0.8745380276210853, "grad_norm": 0.97265625, "learning_rate": 0.0004928795622080054, "loss": 5.3524, "mean_token_accuracy": 0.17346434891223908, "num_tokens": 19514641.0, "step": 11240 }, { "entropy": 5.57841305732727, "epoch": 0.8749270569928029, "grad_norm": 1.03125, "learning_rate": 0.0004928726432370434, "loss": 5.2196, "mean_token_accuracy": 0.18648359775543213, "num_tokens": 19523136.0, "step": 11245 }, { "entropy": 5.529555797576904, "epoch": 0.8753160863645205, "grad_norm": 0.98828125, "learning_rate": 0.0004928657209602107, "loss": 5.1199, "mean_token_accuracy": 0.1928300753235817, "num_tokens": 19532258.0, "step": 11250 }, { "entropy": 5.586338853836059, "epoch": 0.8757051157362381, "grad_norm": 0.984375, "learning_rate": 0.0004928587953776125, "loss": 5.3626, "mean_token_accuracy": 0.17475418597459794, "num_tokens": 19541235.0, "step": 11255 }, { "entropy": 5.591464805603027, "epoch": 0.8760941451079557, "grad_norm": 0.96484375, "learning_rate": 0.0004928518664893538, "loss": 5.2969, "mean_token_accuracy": 0.17780354842543603, "num_tokens": 19550259.0, "step": 11260 }, { "entropy": 5.645087766647339, "epoch": 0.8764831744796732, "grad_norm": 0.984375, "learning_rate": 0.0004928449342955397, "loss": 5.2585, "mean_token_accuracy": 0.18799372911453247, "num_tokens": 19558500.0, "step": 11265 }, { "entropy": 5.588253593444824, "epoch": 0.8768722038513908, "grad_norm": 0.99609375, "learning_rate": 0.0004928379987962756, "loss": 5.2056, "mean_token_accuracy": 0.18315169215202332, "num_tokens": 19566562.0, "step": 11270 }, { "entropy": 5.54454984664917, "epoch": 0.8772612332231083, "grad_norm": 1.0078125, "learning_rate": 0.0004928310599916666, "loss": 5.23, "mean_token_accuracy": 0.1823637768626213, "num_tokens": 19575219.0, "step": 11275 }, { "entropy": 5.516556358337402, "epoch": 0.8776502625948259, "grad_norm": 0.97265625, "learning_rate": 0.0004928241178818178, "loss": 5.1663, "mean_token_accuracy": 0.18708829283714296, "num_tokens": 19584311.0, "step": 11280 }, { "entropy": 5.5517336368560795, "epoch": 0.8780392919665435, "grad_norm": 1.015625, "learning_rate": 0.0004928171724668349, "loss": 5.3106, "mean_token_accuracy": 0.1739381805062294, "num_tokens": 19593802.0, "step": 11285 }, { "entropy": 5.596087551116943, "epoch": 0.878428321338261, "grad_norm": 1.1015625, "learning_rate": 0.0004928102237468229, "loss": 5.2712, "mean_token_accuracy": 0.18105054050683975, "num_tokens": 19603046.0, "step": 11290 }, { "entropy": 5.492772626876831, "epoch": 0.8788173507099786, "grad_norm": 1.0390625, "learning_rate": 0.0004928032717218876, "loss": 5.154, "mean_token_accuracy": 0.1845415100455284, "num_tokens": 19611609.0, "step": 11295 }, { "entropy": 5.5506798267364506, "epoch": 0.8792063800816962, "grad_norm": 1.0703125, "learning_rate": 0.0004927963163921343, "loss": 5.183, "mean_token_accuracy": 0.18141555041074753, "num_tokens": 19619380.0, "step": 11300 }, { "entropy": 5.6594970703125, "epoch": 0.8795954094534137, "grad_norm": 1.0390625, "learning_rate": 0.0004927893577576685, "loss": 5.3483, "mean_token_accuracy": 0.17350445538759232, "num_tokens": 19628336.0, "step": 11305 }, { "entropy": 5.58415036201477, "epoch": 0.8799844388251313, "grad_norm": 0.97265625, "learning_rate": 0.0004927823958185959, "loss": 5.3135, "mean_token_accuracy": 0.18502842932939528, "num_tokens": 19637888.0, "step": 11310 }, { "entropy": 5.542030572891235, "epoch": 0.8803734681968488, "grad_norm": 1.015625, "learning_rate": 0.000492775430575022, "loss": 5.2315, "mean_token_accuracy": 0.17773975431919098, "num_tokens": 19646123.0, "step": 11315 }, { "entropy": 5.550410032272339, "epoch": 0.8807624975685664, "grad_norm": 1.015625, "learning_rate": 0.0004927684620270527, "loss": 5.1987, "mean_token_accuracy": 0.18863066732883454, "num_tokens": 19655264.0, "step": 11320 }, { "entropy": 5.672732877731323, "epoch": 0.881151526940284, "grad_norm": 1.078125, "learning_rate": 0.0004927614901747935, "loss": 5.3354, "mean_token_accuracy": 0.17010691314935683, "num_tokens": 19663594.0, "step": 11325 }, { "entropy": 5.629295063018799, "epoch": 0.8815405563120016, "grad_norm": 1.1015625, "learning_rate": 0.0004927545150183503, "loss": 5.2882, "mean_token_accuracy": 0.17685989290475845, "num_tokens": 19671515.0, "step": 11330 }, { "entropy": 5.561790657043457, "epoch": 0.8819295856837192, "grad_norm": 0.9609375, "learning_rate": 0.000492747536557829, "loss": 5.1631, "mean_token_accuracy": 0.18699969053268434, "num_tokens": 19680288.0, "step": 11335 }, { "entropy": 5.577661752700806, "epoch": 0.8823186150554367, "grad_norm": 1.0078125, "learning_rate": 0.0004927405547933353, "loss": 5.1824, "mean_token_accuracy": 0.18766162991523744, "num_tokens": 19688717.0, "step": 11340 }, { "entropy": 5.499565696716308, "epoch": 0.8827076444271542, "grad_norm": 0.984375, "learning_rate": 0.0004927335697249753, "loss": 5.1276, "mean_token_accuracy": 0.19210835099220275, "num_tokens": 19697412.0, "step": 11345 }, { "entropy": 5.540387344360352, "epoch": 0.8830966737988718, "grad_norm": 1.046875, "learning_rate": 0.0004927265813528549, "loss": 5.2759, "mean_token_accuracy": 0.17797500044107437, "num_tokens": 19706127.0, "step": 11350 }, { "entropy": 5.658319091796875, "epoch": 0.8834857031705894, "grad_norm": 1.0078125, "learning_rate": 0.0004927195896770804, "loss": 5.3498, "mean_token_accuracy": 0.17664047032594682, "num_tokens": 19715178.0, "step": 11355 }, { "entropy": 5.6233717918396, "epoch": 0.883874732542307, "grad_norm": 1.0234375, "learning_rate": 0.0004927125946977574, "loss": 5.2247, "mean_token_accuracy": 0.18304519653320311, "num_tokens": 19723814.0, "step": 11360 }, { "entropy": 5.64864411354065, "epoch": 0.8842637619140246, "grad_norm": 1.0546875, "learning_rate": 0.0004927055964149923, "loss": 5.3606, "mean_token_accuracy": 0.17506654262542726, "num_tokens": 19732153.0, "step": 11365 }, { "entropy": 5.611151599884034, "epoch": 0.884652791285742, "grad_norm": 1.0625, "learning_rate": 0.0004926985948288914, "loss": 5.2671, "mean_token_accuracy": 0.18468063473701476, "num_tokens": 19740251.0, "step": 11370 }, { "entropy": 5.501591968536377, "epoch": 0.8850418206574596, "grad_norm": 0.95703125, "learning_rate": 0.0004926915899395608, "loss": 5.1897, "mean_token_accuracy": 0.19013190865516663, "num_tokens": 19748695.0, "step": 11375 }, { "entropy": 5.552240657806396, "epoch": 0.8854308500291772, "grad_norm": 1.0234375, "learning_rate": 0.0004926845817471068, "loss": 5.2068, "mean_token_accuracy": 0.17810254842042922, "num_tokens": 19757674.0, "step": 11380 }, { "entropy": 5.509834671020508, "epoch": 0.8858198794008948, "grad_norm": 1.15625, "learning_rate": 0.0004926775702516358, "loss": 5.0912, "mean_token_accuracy": 0.18988971710205077, "num_tokens": 19765555.0, "step": 11385 }, { "entropy": 5.489891624450683, "epoch": 0.8862089087726124, "grad_norm": 1.015625, "learning_rate": 0.0004926705554532541, "loss": 5.2398, "mean_token_accuracy": 0.18355209976434708, "num_tokens": 19773986.0, "step": 11390 }, { "entropy": 5.598408555984497, "epoch": 0.8865979381443299, "grad_norm": 1.125, "learning_rate": 0.0004926635373520682, "loss": 5.2618, "mean_token_accuracy": 0.185488785803318, "num_tokens": 19782308.0, "step": 11395 }, { "entropy": 5.5852643013000485, "epoch": 0.8869869675160474, "grad_norm": 1.0546875, "learning_rate": 0.0004926565159481845, "loss": 5.2103, "mean_token_accuracy": 0.17813374549150468, "num_tokens": 19790447.0, "step": 11400 }, { "entropy": 5.586507368087768, "epoch": 0.887375996887765, "grad_norm": 1.0234375, "learning_rate": 0.0004926494912417097, "loss": 5.3312, "mean_token_accuracy": 0.1808769389986992, "num_tokens": 19798889.0, "step": 11405 }, { "entropy": 5.540809535980225, "epoch": 0.8877650262594826, "grad_norm": 0.984375, "learning_rate": 0.0004926424632327503, "loss": 5.1603, "mean_token_accuracy": 0.18644642382860183, "num_tokens": 19807192.0, "step": 11410 }, { "entropy": 5.607935762405395, "epoch": 0.8881540556312002, "grad_norm": 0.94921875, "learning_rate": 0.0004926354319214129, "loss": 5.2886, "mean_token_accuracy": 0.18072779178619386, "num_tokens": 19815864.0, "step": 11415 }, { "entropy": 5.609080839157104, "epoch": 0.8885430850029177, "grad_norm": 1.0625, "learning_rate": 0.0004926283973078041, "loss": 5.2193, "mean_token_accuracy": 0.17907162606716157, "num_tokens": 19823218.0, "step": 11420 }, { "entropy": 5.563449764251709, "epoch": 0.8889321143746353, "grad_norm": 0.99609375, "learning_rate": 0.0004926213593920309, "loss": 5.2678, "mean_token_accuracy": 0.18048640489578247, "num_tokens": 19832098.0, "step": 11425 }, { "entropy": 5.553020858764649, "epoch": 0.8893211437463528, "grad_norm": 1.0234375, "learning_rate": 0.0004926143181742, "loss": 5.1955, "mean_token_accuracy": 0.18601744025945663, "num_tokens": 19840180.0, "step": 11430 }, { "entropy": 5.574113178253174, "epoch": 0.8897101731180704, "grad_norm": 0.9921875, "learning_rate": 0.0004926072736544181, "loss": 5.2475, "mean_token_accuracy": 0.17808691263198853, "num_tokens": 19849016.0, "step": 11435 }, { "entropy": 5.4969141483306885, "epoch": 0.890099202489788, "grad_norm": 0.96484375, "learning_rate": 0.0004926002258327922, "loss": 5.1901, "mean_token_accuracy": 0.18305204212665557, "num_tokens": 19858044.0, "step": 11440 }, { "entropy": 5.507494163513184, "epoch": 0.8904882318615055, "grad_norm": 1.0390625, "learning_rate": 0.0004925931747094292, "loss": 5.1242, "mean_token_accuracy": 0.1915612429380417, "num_tokens": 19867557.0, "step": 11445 }, { "entropy": 5.559364366531372, "epoch": 0.8908772612332231, "grad_norm": 1.015625, "learning_rate": 0.0004925861202844361, "loss": 5.2385, "mean_token_accuracy": 0.18321475982666016, "num_tokens": 19876009.0, "step": 11450 }, { "entropy": 5.592780590057373, "epoch": 0.8912662906049407, "grad_norm": 1.1171875, "learning_rate": 0.00049257906255792, "loss": 5.3242, "mean_token_accuracy": 0.177417029440403, "num_tokens": 19885085.0, "step": 11455 }, { "entropy": 5.660267639160156, "epoch": 0.8916553199766583, "grad_norm": 1.0859375, "learning_rate": 0.000492572001529988, "loss": 5.2678, "mean_token_accuracy": 0.1806852012872696, "num_tokens": 19893877.0, "step": 11460 }, { "entropy": 5.664147233963012, "epoch": 0.8920443493483758, "grad_norm": 1.03125, "learning_rate": 0.0004925649372007469, "loss": 5.3886, "mean_token_accuracy": 0.17875148504972457, "num_tokens": 19902480.0, "step": 11465 }, { "entropy": 5.562815952301025, "epoch": 0.8924333787200933, "grad_norm": 1.015625, "learning_rate": 0.0004925578695703045, "loss": 5.1605, "mean_token_accuracy": 0.1883439913392067, "num_tokens": 19910981.0, "step": 11470 }, { "entropy": 5.591741371154785, "epoch": 0.8928224080918109, "grad_norm": 0.99609375, "learning_rate": 0.0004925507986387676, "loss": 5.2847, "mean_token_accuracy": 0.1760623872280121, "num_tokens": 19920055.0, "step": 11475 }, { "entropy": 5.62313141822815, "epoch": 0.8932114374635285, "grad_norm": 0.9765625, "learning_rate": 0.0004925437244062436, "loss": 5.3377, "mean_token_accuracy": 0.18255451917648316, "num_tokens": 19928010.0, "step": 11480 }, { "entropy": 5.62455415725708, "epoch": 0.8936004668352461, "grad_norm": 1.1015625, "learning_rate": 0.0004925366468728397, "loss": 5.2213, "mean_token_accuracy": 0.1811926007270813, "num_tokens": 19935992.0, "step": 11485 }, { "entropy": 5.6355571269989015, "epoch": 0.8939894962069637, "grad_norm": 1.0859375, "learning_rate": 0.0004925295660386635, "loss": 5.3433, "mean_token_accuracy": 0.17380679547786712, "num_tokens": 19944522.0, "step": 11490 }, { "entropy": 5.688939332962036, "epoch": 0.8943785255786811, "grad_norm": 1.046875, "learning_rate": 0.0004925224819038224, "loss": 5.2745, "mean_token_accuracy": 0.18633388429880143, "num_tokens": 19952991.0, "step": 11495 }, { "entropy": 5.544963312149048, "epoch": 0.8947675549503987, "grad_norm": 0.9453125, "learning_rate": 0.0004925153944684239, "loss": 5.2916, "mean_token_accuracy": 0.1772780016064644, "num_tokens": 19962301.0, "step": 11500 }, { "entropy": 5.602243041992187, "epoch": 0.8951565843221163, "grad_norm": 1.03125, "learning_rate": 0.0004925083037325754, "loss": 5.3624, "mean_token_accuracy": 0.1738313317298889, "num_tokens": 19971159.0, "step": 11505 }, { "entropy": 5.633229351043701, "epoch": 0.8955456136938339, "grad_norm": 1.1015625, "learning_rate": 0.0004925012096963847, "loss": 5.2399, "mean_token_accuracy": 0.17955626994371415, "num_tokens": 19979608.0, "step": 11510 }, { "entropy": 5.585269641876221, "epoch": 0.8959346430655515, "grad_norm": 1.1171875, "learning_rate": 0.0004924941123599593, "loss": 5.2266, "mean_token_accuracy": 0.18074027001857756, "num_tokens": 19988348.0, "step": 11515 }, { "entropy": 5.546251201629639, "epoch": 0.896323672437269, "grad_norm": 1.015625, "learning_rate": 0.0004924870117234069, "loss": 5.2439, "mean_token_accuracy": 0.17923223376274108, "num_tokens": 19996970.0, "step": 11520 }, { "entropy": 5.660845375061035, "epoch": 0.8967127018089865, "grad_norm": 1.0703125, "learning_rate": 0.0004924799077868353, "loss": 5.3695, "mean_token_accuracy": 0.18099111020565034, "num_tokens": 20005297.0, "step": 11525 }, { "entropy": 5.6322602272033695, "epoch": 0.8971017311807041, "grad_norm": 1.015625, "learning_rate": 0.0004924728005503522, "loss": 5.2969, "mean_token_accuracy": 0.1728695034980774, "num_tokens": 20013971.0, "step": 11530 }, { "entropy": 5.596248197555542, "epoch": 0.8974907605524217, "grad_norm": 1.046875, "learning_rate": 0.0004924656900140655, "loss": 5.2611, "mean_token_accuracy": 0.17985946238040923, "num_tokens": 20022536.0, "step": 11535 }, { "entropy": 5.545647048950196, "epoch": 0.8978797899241393, "grad_norm": 1.015625, "learning_rate": 0.0004924585761780831, "loss": 5.184, "mean_token_accuracy": 0.1842767894268036, "num_tokens": 20031676.0, "step": 11540 }, { "entropy": 5.617026472091675, "epoch": 0.8982688192958569, "grad_norm": 1.0390625, "learning_rate": 0.000492451459042513, "loss": 5.2615, "mean_token_accuracy": 0.17981941103935242, "num_tokens": 20039783.0, "step": 11545 }, { "entropy": 5.565978336334228, "epoch": 0.8986578486675744, "grad_norm": 1.0546875, "learning_rate": 0.000492444338607463, "loss": 5.3078, "mean_token_accuracy": 0.17649320214986802, "num_tokens": 20047859.0, "step": 11550 }, { "entropy": 5.628445768356324, "epoch": 0.899046878039292, "grad_norm": 1.0078125, "learning_rate": 0.0004924372148730413, "loss": 5.3464, "mean_token_accuracy": 0.17112823724746704, "num_tokens": 20056711.0, "step": 11555 }, { "entropy": 5.5603772640228275, "epoch": 0.8994359074110095, "grad_norm": 0.95703125, "learning_rate": 0.000492430087839356, "loss": 5.1817, "mean_token_accuracy": 0.18270686715841294, "num_tokens": 20065715.0, "step": 11560 }, { "entropy": 5.559036779403686, "epoch": 0.8998249367827271, "grad_norm": 0.97265625, "learning_rate": 0.0004924229575065152, "loss": 5.2834, "mean_token_accuracy": 0.18429706245660782, "num_tokens": 20073815.0, "step": 11565 }, { "entropy": 5.615834140777588, "epoch": 0.9002139661544447, "grad_norm": 1.0390625, "learning_rate": 0.000492415823874627, "loss": 5.2647, "mean_token_accuracy": 0.18063076734542846, "num_tokens": 20082331.0, "step": 11570 }, { "entropy": 5.588377904891968, "epoch": 0.9006029955261622, "grad_norm": 0.9453125, "learning_rate": 0.0004924086869437998, "loss": 5.336, "mean_token_accuracy": 0.180070897936821, "num_tokens": 20091095.0, "step": 11575 }, { "entropy": 5.589910840988159, "epoch": 0.9009920248978798, "grad_norm": 0.98828125, "learning_rate": 0.0004924015467141417, "loss": 5.2478, "mean_token_accuracy": 0.18325827717781068, "num_tokens": 20100111.0, "step": 11580 }, { "entropy": 5.6593669891357425, "epoch": 0.9013810542695974, "grad_norm": 1.046875, "learning_rate": 0.0004923944031857613, "loss": 5.3149, "mean_token_accuracy": 0.183930803835392, "num_tokens": 20108542.0, "step": 11585 }, { "entropy": 5.56063814163208, "epoch": 0.901770083641315, "grad_norm": 1.046875, "learning_rate": 0.0004923872563587668, "loss": 5.2359, "mean_token_accuracy": 0.18408215492963792, "num_tokens": 20117831.0, "step": 11590 }, { "entropy": 5.555573034286499, "epoch": 0.9021591130130325, "grad_norm": 0.90234375, "learning_rate": 0.0004923801062332666, "loss": 5.1851, "mean_token_accuracy": 0.18191388994455338, "num_tokens": 20127322.0, "step": 11595 }, { "entropy": 5.639308929443359, "epoch": 0.90254814238475, "grad_norm": 1.03125, "learning_rate": 0.0004923729528093694, "loss": 5.2383, "mean_token_accuracy": 0.18221660554409028, "num_tokens": 20135772.0, "step": 11600 }, { "entropy": 5.572954702377319, "epoch": 0.9029371717564676, "grad_norm": 1.078125, "learning_rate": 0.0004923657960871836, "loss": 5.2528, "mean_token_accuracy": 0.18276721090078354, "num_tokens": 20144110.0, "step": 11605 }, { "entropy": 5.613551473617553, "epoch": 0.9033262011281852, "grad_norm": 1.046875, "learning_rate": 0.0004923586360668178, "loss": 5.3595, "mean_token_accuracy": 0.17548990547657012, "num_tokens": 20153391.0, "step": 11610 }, { "entropy": 5.531225395202637, "epoch": 0.9037152304999028, "grad_norm": 1.0703125, "learning_rate": 0.0004923514727483807, "loss": 5.1895, "mean_token_accuracy": 0.1855894073843956, "num_tokens": 20161877.0, "step": 11615 }, { "entropy": 5.497713804244995, "epoch": 0.9041042598716204, "grad_norm": 1.0625, "learning_rate": 0.000492344306131981, "loss": 5.1516, "mean_token_accuracy": 0.18799446523189545, "num_tokens": 20169922.0, "step": 11620 }, { "entropy": 5.488319158554077, "epoch": 0.9044932892433378, "grad_norm": 1.0546875, "learning_rate": 0.0004923371362177272, "loss": 5.2081, "mean_token_accuracy": 0.18522389382123947, "num_tokens": 20177780.0, "step": 11625 }, { "entropy": 5.560370588302613, "epoch": 0.9048823186150554, "grad_norm": 1.0, "learning_rate": 0.0004923299630057284, "loss": 5.1973, "mean_token_accuracy": 0.18629174381494523, "num_tokens": 20186303.0, "step": 11630 }, { "entropy": 5.5183638572692875, "epoch": 0.905271347986773, "grad_norm": 1.0390625, "learning_rate": 0.0004923227864960934, "loss": 5.1837, "mean_token_accuracy": 0.18678800463676454, "num_tokens": 20194042.0, "step": 11635 }, { "entropy": 5.456225490570068, "epoch": 0.9056603773584906, "grad_norm": 1.015625, "learning_rate": 0.000492315606688931, "loss": 5.1875, "mean_token_accuracy": 0.1878139778971672, "num_tokens": 20202929.0, "step": 11640 }, { "entropy": 5.558633136749267, "epoch": 0.9060494067302082, "grad_norm": 1.046875, "learning_rate": 0.0004923084235843501, "loss": 5.2404, "mean_token_accuracy": 0.17828413993120193, "num_tokens": 20210864.0, "step": 11645 }, { "entropy": 5.628408622741699, "epoch": 0.9064384361019256, "grad_norm": 1.0234375, "learning_rate": 0.0004923012371824598, "loss": 5.2621, "mean_token_accuracy": 0.18141427040100097, "num_tokens": 20219390.0, "step": 11650 }, { "entropy": 5.574519968032837, "epoch": 0.9068274654736432, "grad_norm": 1.078125, "learning_rate": 0.000492294047483369, "loss": 5.2039, "mean_token_accuracy": 0.19042831808328628, "num_tokens": 20227241.0, "step": 11655 }, { "entropy": 5.537701225280761, "epoch": 0.9072164948453608, "grad_norm": 1.078125, "learning_rate": 0.0004922868544871869, "loss": 5.357, "mean_token_accuracy": 0.176102514564991, "num_tokens": 20236001.0, "step": 11660 }, { "entropy": 5.62885308265686, "epoch": 0.9076055242170784, "grad_norm": 1.0, "learning_rate": 0.0004922796581940227, "loss": 5.2372, "mean_token_accuracy": 0.18050403892993927, "num_tokens": 20244316.0, "step": 11665 }, { "entropy": 5.531038522720337, "epoch": 0.907994553588796, "grad_norm": 1.0078125, "learning_rate": 0.0004922724586039855, "loss": 5.2143, "mean_token_accuracy": 0.1854308769106865, "num_tokens": 20252693.0, "step": 11670 }, { "entropy": 5.507435750961304, "epoch": 0.9083835829605135, "grad_norm": 0.98046875, "learning_rate": 0.0004922652557171846, "loss": 5.2566, "mean_token_accuracy": 0.1850678652524948, "num_tokens": 20262252.0, "step": 11675 }, { "entropy": 5.552498912811279, "epoch": 0.9087726123322311, "grad_norm": 0.96875, "learning_rate": 0.0004922580495337292, "loss": 5.0966, "mean_token_accuracy": 0.1937366932630539, "num_tokens": 20270755.0, "step": 11680 }, { "entropy": 5.562260913848877, "epoch": 0.9091616417039486, "grad_norm": 1.0703125, "learning_rate": 0.0004922508400537288, "loss": 5.1804, "mean_token_accuracy": 0.18096505105495453, "num_tokens": 20278739.0, "step": 11685 }, { "entropy": 5.556400442123413, "epoch": 0.9095506710756662, "grad_norm": 0.96484375, "learning_rate": 0.0004922436272772926, "loss": 5.3292, "mean_token_accuracy": 0.1719320610165596, "num_tokens": 20288160.0, "step": 11690 }, { "entropy": 5.566889762878418, "epoch": 0.9099397004473838, "grad_norm": 1.1015625, "learning_rate": 0.0004922364112045301, "loss": 5.2625, "mean_token_accuracy": 0.18204254359006883, "num_tokens": 20296730.0, "step": 11695 }, { "entropy": 5.574968862533569, "epoch": 0.9103287298191013, "grad_norm": 1.0, "learning_rate": 0.000492229191835551, "loss": 5.2072, "mean_token_accuracy": 0.18102122992277145, "num_tokens": 20305941.0, "step": 11700 }, { "entropy": 5.555197858810425, "epoch": 0.9107177591908189, "grad_norm": 1.0546875, "learning_rate": 0.0004922219691704645, "loss": 5.2278, "mean_token_accuracy": 0.18434746861457824, "num_tokens": 20314081.0, "step": 11705 }, { "entropy": 5.618513488769532, "epoch": 0.9111067885625365, "grad_norm": 1.015625, "learning_rate": 0.0004922147432093805, "loss": 5.2905, "mean_token_accuracy": 0.17522201985120772, "num_tokens": 20323004.0, "step": 11710 }, { "entropy": 5.584374189376831, "epoch": 0.911495817934254, "grad_norm": 1.1015625, "learning_rate": 0.0004922075139524083, "loss": 5.1905, "mean_token_accuracy": 0.18178245425224304, "num_tokens": 20331122.0, "step": 11715 }, { "entropy": 5.551940536499023, "epoch": 0.9118848473059716, "grad_norm": 1.0859375, "learning_rate": 0.000492200281399658, "loss": 5.2733, "mean_token_accuracy": 0.17392054200172424, "num_tokens": 20339602.0, "step": 11720 }, { "entropy": 5.56371488571167, "epoch": 0.9122738766776891, "grad_norm": 1.0390625, "learning_rate": 0.000492193045551239, "loss": 5.1372, "mean_token_accuracy": 0.1840537041425705, "num_tokens": 20348431.0, "step": 11725 }, { "entropy": 5.523512554168701, "epoch": 0.9126629060494067, "grad_norm": 1.0234375, "learning_rate": 0.0004921858064072612, "loss": 5.1864, "mean_token_accuracy": 0.1874503806233406, "num_tokens": 20357235.0, "step": 11730 }, { "entropy": 5.556927728652954, "epoch": 0.9130519354211243, "grad_norm": 1.0859375, "learning_rate": 0.0004921785639678347, "loss": 5.1602, "mean_token_accuracy": 0.1839824616909027, "num_tokens": 20366169.0, "step": 11735 }, { "entropy": 5.5867105484008786, "epoch": 0.9134409647928419, "grad_norm": 1.0234375, "learning_rate": 0.000492171318233069, "loss": 5.2393, "mean_token_accuracy": 0.18073418438434602, "num_tokens": 20375213.0, "step": 11740 }, { "entropy": 5.527808046340942, "epoch": 0.9138299941645595, "grad_norm": 1.0078125, "learning_rate": 0.0004921640692030742, "loss": 5.2407, "mean_token_accuracy": 0.17796168327331544, "num_tokens": 20383992.0, "step": 11745 }, { "entropy": 5.578649473190308, "epoch": 0.914219023536277, "grad_norm": 1.0078125, "learning_rate": 0.0004921568168779603, "loss": 5.2133, "mean_token_accuracy": 0.1853245973587036, "num_tokens": 20392318.0, "step": 11750 }, { "entropy": 5.641834449768067, "epoch": 0.9146080529079945, "grad_norm": 1.0390625, "learning_rate": 0.0004921495612578374, "loss": 5.3316, "mean_token_accuracy": 0.1788714274764061, "num_tokens": 20401556.0, "step": 11755 }, { "entropy": 5.55460295677185, "epoch": 0.9149970822797121, "grad_norm": 1.0078125, "learning_rate": 0.0004921423023428156, "loss": 5.2237, "mean_token_accuracy": 0.18192702680826187, "num_tokens": 20410480.0, "step": 11760 }, { "entropy": 5.535108041763306, "epoch": 0.9153861116514297, "grad_norm": 0.9375, "learning_rate": 0.0004921350401330049, "loss": 5.175, "mean_token_accuracy": 0.18815360516309737, "num_tokens": 20419748.0, "step": 11765 }, { "entropy": 5.574000644683838, "epoch": 0.9157751410231473, "grad_norm": 0.9765625, "learning_rate": 0.0004921277746285155, "loss": 5.2429, "mean_token_accuracy": 0.18199095427989959, "num_tokens": 20429552.0, "step": 11770 }, { "entropy": 5.713226652145385, "epoch": 0.9161641703948649, "grad_norm": 1.015625, "learning_rate": 0.0004921205058294579, "loss": 5.3085, "mean_token_accuracy": 0.1789688929915428, "num_tokens": 20438476.0, "step": 11775 }, { "entropy": 5.5220348834991455, "epoch": 0.9165531997665823, "grad_norm": 1.0546875, "learning_rate": 0.000492113233735942, "loss": 5.1148, "mean_token_accuracy": 0.18550708293914794, "num_tokens": 20447035.0, "step": 11780 }, { "entropy": 5.5483856201171875, "epoch": 0.9169422291382999, "grad_norm": 1.0546875, "learning_rate": 0.0004921059583480785, "loss": 5.2711, "mean_token_accuracy": 0.18236800283193588, "num_tokens": 20456200.0, "step": 11785 }, { "entropy": 5.585720109939575, "epoch": 0.9173312585100175, "grad_norm": 0.96875, "learning_rate": 0.0004920986796659775, "loss": 5.26, "mean_token_accuracy": 0.1862987145781517, "num_tokens": 20465444.0, "step": 11790 }, { "entropy": 5.536608648300171, "epoch": 0.9177202878817351, "grad_norm": 0.98828125, "learning_rate": 0.0004920913976897498, "loss": 5.1567, "mean_token_accuracy": 0.1878991261124611, "num_tokens": 20473851.0, "step": 11795 }, { "entropy": 5.518877983093262, "epoch": 0.9181093172534527, "grad_norm": 0.953125, "learning_rate": 0.0004920841124195055, "loss": 5.2428, "mean_token_accuracy": 0.18687252402305604, "num_tokens": 20482232.0, "step": 11800 }, { "entropy": 5.495103645324707, "epoch": 0.9184983466251702, "grad_norm": 1.03125, "learning_rate": 0.0004920768238553554, "loss": 5.1363, "mean_token_accuracy": 0.19422158151865004, "num_tokens": 20490498.0, "step": 11805 }, { "entropy": 5.533331823348999, "epoch": 0.9188873759968877, "grad_norm": 0.98828125, "learning_rate": 0.0004920695319974099, "loss": 5.2071, "mean_token_accuracy": 0.18390069752931595, "num_tokens": 20499125.0, "step": 11810 }, { "entropy": 5.585284805297851, "epoch": 0.9192764053686053, "grad_norm": 1.046875, "learning_rate": 0.0004920622368457798, "loss": 5.3503, "mean_token_accuracy": 0.18015943318605424, "num_tokens": 20507665.0, "step": 11815 }, { "entropy": 5.595728492736816, "epoch": 0.9196654347403229, "grad_norm": 1.0625, "learning_rate": 0.0004920549384005759, "loss": 5.2787, "mean_token_accuracy": 0.18034791201353073, "num_tokens": 20516509.0, "step": 11820 }, { "entropy": 5.597612285614014, "epoch": 0.9200544641120405, "grad_norm": 1.171875, "learning_rate": 0.0004920476366619086, "loss": 5.3042, "mean_token_accuracy": 0.1835848107933998, "num_tokens": 20524830.0, "step": 11825 }, { "entropy": 5.581564140319824, "epoch": 0.920443493483758, "grad_norm": 1.046875, "learning_rate": 0.000492040331629889, "loss": 5.2012, "mean_token_accuracy": 0.17886543720960618, "num_tokens": 20533746.0, "step": 11830 }, { "entropy": 5.539874839782715, "epoch": 0.9208325228554756, "grad_norm": 1.0390625, "learning_rate": 0.0004920330233046277, "loss": 5.1779, "mean_token_accuracy": 0.1898143023252487, "num_tokens": 20542350.0, "step": 11835 }, { "entropy": 5.5576598167419435, "epoch": 0.9212215522271932, "grad_norm": 1.0625, "learning_rate": 0.0004920257116862359, "loss": 5.3021, "mean_token_accuracy": 0.18487888127565383, "num_tokens": 20551670.0, "step": 11840 }, { "entropy": 5.608811140060425, "epoch": 0.9216105815989107, "grad_norm": 0.96484375, "learning_rate": 0.0004920183967748241, "loss": 5.2466, "mean_token_accuracy": 0.17925604432821274, "num_tokens": 20560692.0, "step": 11845 }, { "entropy": 5.589293432235718, "epoch": 0.9219996109706283, "grad_norm": 1.078125, "learning_rate": 0.0004920110785705037, "loss": 5.1998, "mean_token_accuracy": 0.18300125300884246, "num_tokens": 20569262.0, "step": 11850 }, { "entropy": 5.537121105194092, "epoch": 0.9223886403423458, "grad_norm": 1.0546875, "learning_rate": 0.0004920037570733857, "loss": 5.1988, "mean_token_accuracy": 0.1828903526067734, "num_tokens": 20577850.0, "step": 11855 }, { "entropy": 5.579100322723389, "epoch": 0.9227776697140634, "grad_norm": 0.98828125, "learning_rate": 0.0004919964322835809, "loss": 5.2813, "mean_token_accuracy": 0.17564146369695663, "num_tokens": 20587021.0, "step": 11860 }, { "entropy": 5.5887792110443115, "epoch": 0.923166699085781, "grad_norm": 1.1015625, "learning_rate": 0.0004919891042012006, "loss": 5.2035, "mean_token_accuracy": 0.1853077918291092, "num_tokens": 20594631.0, "step": 11865 }, { "entropy": 5.519110488891601, "epoch": 0.9235557284574986, "grad_norm": 1.046875, "learning_rate": 0.0004919817728263562, "loss": 5.1377, "mean_token_accuracy": 0.18740917146205902, "num_tokens": 20602765.0, "step": 11870 }, { "entropy": 5.637236833572388, "epoch": 0.9239447578292161, "grad_norm": 1.078125, "learning_rate": 0.0004919744381591586, "loss": 5.2648, "mean_token_accuracy": 0.19036677181720735, "num_tokens": 20611350.0, "step": 11875 }, { "entropy": 5.563019943237305, "epoch": 0.9243337872009336, "grad_norm": 0.9765625, "learning_rate": 0.0004919671001997193, "loss": 5.192, "mean_token_accuracy": 0.18654754161834716, "num_tokens": 20620201.0, "step": 11880 }, { "entropy": 5.603507232666016, "epoch": 0.9247228165726512, "grad_norm": 1.015625, "learning_rate": 0.0004919597589481497, "loss": 5.2478, "mean_token_accuracy": 0.1864937126636505, "num_tokens": 20627870.0, "step": 11885 }, { "entropy": 5.5766901016235355, "epoch": 0.9251118459443688, "grad_norm": 1.0390625, "learning_rate": 0.000491952414404561, "loss": 5.2431, "mean_token_accuracy": 0.18415390998125075, "num_tokens": 20635894.0, "step": 11890 }, { "entropy": 5.59851861000061, "epoch": 0.9255008753160864, "grad_norm": 1.0078125, "learning_rate": 0.0004919450665690646, "loss": 5.2941, "mean_token_accuracy": 0.18335267305374145, "num_tokens": 20644091.0, "step": 11895 }, { "entropy": 5.58082594871521, "epoch": 0.925889904687804, "grad_norm": 1.0859375, "learning_rate": 0.0004919377154417724, "loss": 5.1567, "mean_token_accuracy": 0.18717770129442216, "num_tokens": 20651994.0, "step": 11900 }, { "entropy": 5.537593746185303, "epoch": 0.9262789340595214, "grad_norm": 1.03125, "learning_rate": 0.0004919303610227954, "loss": 5.1806, "mean_token_accuracy": 0.18851915895938873, "num_tokens": 20660192.0, "step": 11905 }, { "entropy": 5.65830979347229, "epoch": 0.926667963431239, "grad_norm": 1.109375, "learning_rate": 0.0004919230033122457, "loss": 5.2585, "mean_token_accuracy": 0.1791141539812088, "num_tokens": 20668275.0, "step": 11910 }, { "entropy": 5.521208429336548, "epoch": 0.9270569928029566, "grad_norm": 0.99609375, "learning_rate": 0.0004919156423102345, "loss": 5.2391, "mean_token_accuracy": 0.18416546583175658, "num_tokens": 20676936.0, "step": 11915 }, { "entropy": 5.591800546646118, "epoch": 0.9274460221746742, "grad_norm": 0.98828125, "learning_rate": 0.0004919082780168736, "loss": 5.3476, "mean_token_accuracy": 0.17247433364391326, "num_tokens": 20685600.0, "step": 11920 }, { "entropy": 5.603094625473022, "epoch": 0.9278350515463918, "grad_norm": 1.078125, "learning_rate": 0.0004919009104322751, "loss": 5.2913, "mean_token_accuracy": 0.18120404779911042, "num_tokens": 20693714.0, "step": 11925 }, { "entropy": 5.575480985641479, "epoch": 0.9282240809181093, "grad_norm": 1.0234375, "learning_rate": 0.0004918935395565503, "loss": 5.2368, "mean_token_accuracy": 0.1812037318944931, "num_tokens": 20702529.0, "step": 11930 }, { "entropy": 5.541878509521484, "epoch": 0.9286131102898268, "grad_norm": 0.94140625, "learning_rate": 0.0004918861653898113, "loss": 5.1647, "mean_token_accuracy": 0.1846123978495598, "num_tokens": 20711775.0, "step": 11935 }, { "entropy": 5.582861375808716, "epoch": 0.9290021396615444, "grad_norm": 1.0078125, "learning_rate": 0.0004918787879321701, "loss": 5.2248, "mean_token_accuracy": 0.18018672317266465, "num_tokens": 20720653.0, "step": 11940 }, { "entropy": 5.6048431396484375, "epoch": 0.929391169033262, "grad_norm": 0.9453125, "learning_rate": 0.0004918714071837384, "loss": 5.2494, "mean_token_accuracy": 0.18456124812364577, "num_tokens": 20729208.0, "step": 11945 }, { "entropy": 5.589124155044556, "epoch": 0.9297801984049796, "grad_norm": 1.015625, "learning_rate": 0.0004918640231446282, "loss": 5.3006, "mean_token_accuracy": 0.1827417090535164, "num_tokens": 20738670.0, "step": 11950 }, { "entropy": 5.562734603881836, "epoch": 0.9301692277766972, "grad_norm": 0.9765625, "learning_rate": 0.0004918566358149517, "loss": 5.3508, "mean_token_accuracy": 0.17917992323637008, "num_tokens": 20748315.0, "step": 11955 }, { "entropy": 5.656414747238159, "epoch": 0.9305582571484147, "grad_norm": 1.0390625, "learning_rate": 0.000491849245194821, "loss": 5.3902, "mean_token_accuracy": 0.17061794102191924, "num_tokens": 20757623.0, "step": 11960 }, { "entropy": 5.608323287963867, "epoch": 0.9309472865201323, "grad_norm": 0.9609375, "learning_rate": 0.0004918418512843479, "loss": 5.2138, "mean_token_accuracy": 0.18692825585603715, "num_tokens": 20765817.0, "step": 11965 }, { "entropy": 5.521482181549072, "epoch": 0.9313363158918498, "grad_norm": 0.98046875, "learning_rate": 0.0004918344540836451, "loss": 5.1088, "mean_token_accuracy": 0.19574368596076966, "num_tokens": 20773931.0, "step": 11970 }, { "entropy": 5.625129652023316, "epoch": 0.9317253452635674, "grad_norm": 1.0390625, "learning_rate": 0.0004918270535928244, "loss": 5.2492, "mean_token_accuracy": 0.17974198013544082, "num_tokens": 20782652.0, "step": 11975 }, { "entropy": 5.567449998855591, "epoch": 0.932114374635285, "grad_norm": 0.94921875, "learning_rate": 0.0004918196498119984, "loss": 5.146, "mean_token_accuracy": 0.19232137799263, "num_tokens": 20791293.0, "step": 11980 }, { "entropy": 5.533898782730103, "epoch": 0.9325034040070025, "grad_norm": 1.0546875, "learning_rate": 0.0004918122427412793, "loss": 5.2505, "mean_token_accuracy": 0.17886458784341813, "num_tokens": 20800317.0, "step": 11985 }, { "entropy": 5.54930272102356, "epoch": 0.9328924333787201, "grad_norm": 0.9609375, "learning_rate": 0.0004918048323807795, "loss": 5.2269, "mean_token_accuracy": 0.19041681736707688, "num_tokens": 20809231.0, "step": 11990 }, { "entropy": 5.571619272232056, "epoch": 0.9332814627504377, "grad_norm": 1.0, "learning_rate": 0.0004917974187306114, "loss": 5.1505, "mean_token_accuracy": 0.1843850404024124, "num_tokens": 20818327.0, "step": 11995 }, { "entropy": 5.614779090881347, "epoch": 0.9336704921221552, "grad_norm": 1.0546875, "learning_rate": 0.0004917900017908875, "loss": 5.3149, "mean_token_accuracy": 0.17424997091293334, "num_tokens": 20826995.0, "step": 12000 }, { "epoch": 0.9336704921221552, "eval_entropy": 5.3652247088361635, "eval_loss": 5.260458469390869, "eval_mean_token_accuracy": 0.19026692330234893, "eval_num_tokens": 20826995.0, "eval_runtime": 21.5957, "eval_samples_per_second": 1924.368, "eval_steps_per_second": 240.558, "step": 12000 }, { "entropy": 5.476382541656494, "epoch": 0.9340595214938728, "grad_norm": 1.0703125, "learning_rate": 0.0004917825815617205, "loss": 5.0362, "mean_token_accuracy": 0.1938027784228325, "num_tokens": 20835641.0, "step": 12005 }, { "entropy": 5.586126899719238, "epoch": 0.9344485508655903, "grad_norm": 1.03125, "learning_rate": 0.0004917751580432229, "loss": 5.1696, "mean_token_accuracy": 0.18758552074432372, "num_tokens": 20844728.0, "step": 12010 }, { "entropy": 5.511921501159668, "epoch": 0.9348375802373079, "grad_norm": 1.015625, "learning_rate": 0.0004917677312355072, "loss": 5.1688, "mean_token_accuracy": 0.18927164226770402, "num_tokens": 20853013.0, "step": 12015 }, { "entropy": 5.629630088806152, "epoch": 0.9352266096090255, "grad_norm": 1.0625, "learning_rate": 0.0004917603011386863, "loss": 5.24, "mean_token_accuracy": 0.18145138621330262, "num_tokens": 20861592.0, "step": 12020 }, { "entropy": 5.552721214294434, "epoch": 0.9356156389807431, "grad_norm": 1.0625, "learning_rate": 0.0004917528677528727, "loss": 5.2046, "mean_token_accuracy": 0.18107561618089676, "num_tokens": 20869645.0, "step": 12025 }, { "entropy": 5.590920114517212, "epoch": 0.9360046683524607, "grad_norm": 1.0390625, "learning_rate": 0.0004917454310781795, "loss": 5.2526, "mean_token_accuracy": 0.18239778727293016, "num_tokens": 20878154.0, "step": 12030 }, { "entropy": 5.593302011489868, "epoch": 0.9363936977241781, "grad_norm": 1.0234375, "learning_rate": 0.0004917379911147193, "loss": 5.1964, "mean_token_accuracy": 0.19307635277509688, "num_tokens": 20886260.0, "step": 12035 }, { "entropy": 5.5298034191131595, "epoch": 0.9367827270958957, "grad_norm": 1.0, "learning_rate": 0.0004917305478626049, "loss": 5.1609, "mean_token_accuracy": 0.1862980455160141, "num_tokens": 20895688.0, "step": 12040 }, { "entropy": 5.5384777069091795, "epoch": 0.9371717564676133, "grad_norm": 1.03125, "learning_rate": 0.0004917231013219495, "loss": 5.2756, "mean_token_accuracy": 0.1831613928079605, "num_tokens": 20903904.0, "step": 12045 }, { "entropy": 5.602621603012085, "epoch": 0.9375607858393309, "grad_norm": 0.9921875, "learning_rate": 0.000491715651492866, "loss": 5.2673, "mean_token_accuracy": 0.18519030660390853, "num_tokens": 20913411.0, "step": 12050 }, { "entropy": 5.581089019775391, "epoch": 0.9379498152110485, "grad_norm": 1.03125, "learning_rate": 0.0004917081983754675, "loss": 5.2303, "mean_token_accuracy": 0.18019794374704362, "num_tokens": 20922088.0, "step": 12055 }, { "entropy": 5.4662697315216064, "epoch": 0.938338844582766, "grad_norm": 1.015625, "learning_rate": 0.0004917007419698669, "loss": 5.2267, "mean_token_accuracy": 0.18475015014410018, "num_tokens": 20930879.0, "step": 12060 }, { "entropy": 5.519509220123291, "epoch": 0.9387278739544835, "grad_norm": 1.0234375, "learning_rate": 0.0004916932822761776, "loss": 5.192, "mean_token_accuracy": 0.18773053586483002, "num_tokens": 20939092.0, "step": 12065 }, { "entropy": 5.567389726638794, "epoch": 0.9391169033262011, "grad_norm": 1.015625, "learning_rate": 0.0004916858192945126, "loss": 5.2424, "mean_token_accuracy": 0.1826593279838562, "num_tokens": 20947599.0, "step": 12070 }, { "entropy": 5.617564725875854, "epoch": 0.9395059326979187, "grad_norm": 1.0390625, "learning_rate": 0.0004916783530249852, "loss": 5.297, "mean_token_accuracy": 0.17814621776342393, "num_tokens": 20955725.0, "step": 12075 }, { "entropy": 5.498813343048096, "epoch": 0.9398949620696363, "grad_norm": 1.078125, "learning_rate": 0.0004916708834677086, "loss": 5.105, "mean_token_accuracy": 0.19145222306251525, "num_tokens": 20965040.0, "step": 12080 }, { "entropy": 5.581015491485596, "epoch": 0.9402839914413538, "grad_norm": 1.03125, "learning_rate": 0.0004916634106227962, "loss": 5.2505, "mean_token_accuracy": 0.1820598751306534, "num_tokens": 20974204.0, "step": 12085 }, { "entropy": 5.6329758644104, "epoch": 0.9406730208130714, "grad_norm": 1.046875, "learning_rate": 0.0004916559344903614, "loss": 5.2536, "mean_token_accuracy": 0.18456069827079774, "num_tokens": 20982109.0, "step": 12090 }, { "entropy": 5.579155397415161, "epoch": 0.941062050184789, "grad_norm": 1.078125, "learning_rate": 0.0004916484550705176, "loss": 5.2732, "mean_token_accuracy": 0.1756502389907837, "num_tokens": 20990375.0, "step": 12095 }, { "entropy": 5.571983337402344, "epoch": 0.9414510795565065, "grad_norm": 1.015625, "learning_rate": 0.0004916409723633785, "loss": 5.2959, "mean_token_accuracy": 0.18447652012109755, "num_tokens": 20998535.0, "step": 12100 }, { "entropy": 5.517458200454712, "epoch": 0.9418401089282241, "grad_norm": 0.9921875, "learning_rate": 0.0004916334863690573, "loss": 5.1476, "mean_token_accuracy": 0.18308708369731902, "num_tokens": 21006597.0, "step": 12105 }, { "entropy": 5.572100687026977, "epoch": 0.9422291382999416, "grad_norm": 1.046875, "learning_rate": 0.0004916259970876678, "loss": 5.2134, "mean_token_accuracy": 0.18781745731830596, "num_tokens": 21015498.0, "step": 12110 }, { "entropy": 5.6254716396331785, "epoch": 0.9426181676716592, "grad_norm": 1.0234375, "learning_rate": 0.0004916185045193237, "loss": 5.2534, "mean_token_accuracy": 0.17619127333164214, "num_tokens": 21024090.0, "step": 12115 }, { "entropy": 5.594352388381958, "epoch": 0.9430071970433768, "grad_norm": 1.0390625, "learning_rate": 0.0004916110086641384, "loss": 5.2696, "mean_token_accuracy": 0.17645178884267806, "num_tokens": 21032928.0, "step": 12120 }, { "entropy": 5.620367193222046, "epoch": 0.9433962264150944, "grad_norm": 1.03125, "learning_rate": 0.0004916035095222259, "loss": 5.3366, "mean_token_accuracy": 0.17488097101449968, "num_tokens": 21041467.0, "step": 12125 }, { "entropy": 5.601778411865235, "epoch": 0.9437852557868119, "grad_norm": 1.09375, "learning_rate": 0.0004915960070936999, "loss": 5.2584, "mean_token_accuracy": 0.1897648349404335, "num_tokens": 21049325.0, "step": 12130 }, { "entropy": 5.568003797531128, "epoch": 0.9441742851585294, "grad_norm": 1.015625, "learning_rate": 0.0004915885013786742, "loss": 5.3149, "mean_token_accuracy": 0.17808953821659088, "num_tokens": 21057911.0, "step": 12135 }, { "entropy": 5.611033773422241, "epoch": 0.944563314530247, "grad_norm": 0.9765625, "learning_rate": 0.0004915809923772628, "loss": 5.298, "mean_token_accuracy": 0.17284227013587952, "num_tokens": 21066974.0, "step": 12140 }, { "entropy": 5.602640533447266, "epoch": 0.9449523439019646, "grad_norm": 0.97265625, "learning_rate": 0.0004915734800895796, "loss": 5.2294, "mean_token_accuracy": 0.1814958468079567, "num_tokens": 21075591.0, "step": 12145 }, { "entropy": 5.572117328643799, "epoch": 0.9453413732736822, "grad_norm": 1.03125, "learning_rate": 0.0004915659645157383, "loss": 5.2703, "mean_token_accuracy": 0.18109863251447678, "num_tokens": 21084496.0, "step": 12150 }, { "entropy": 5.6210774898529055, "epoch": 0.9457304026453998, "grad_norm": 1.03125, "learning_rate": 0.0004915584456558535, "loss": 5.1573, "mean_token_accuracy": 0.18336624652147293, "num_tokens": 21092811.0, "step": 12155 }, { "entropy": 5.612228155136108, "epoch": 0.9461194320171173, "grad_norm": 1.0703125, "learning_rate": 0.0004915509235100388, "loss": 5.2221, "mean_token_accuracy": 0.18512363731861115, "num_tokens": 21101449.0, "step": 12160 }, { "entropy": 5.67351598739624, "epoch": 0.9465084613888348, "grad_norm": 1.015625, "learning_rate": 0.0004915433980784086, "loss": 5.3351, "mean_token_accuracy": 0.17369821220636367, "num_tokens": 21109476.0, "step": 12165 }, { "entropy": 5.556552505493164, "epoch": 0.9468974907605524, "grad_norm": 1.03125, "learning_rate": 0.0004915358693610769, "loss": 5.2253, "mean_token_accuracy": 0.18115261644124986, "num_tokens": 21118431.0, "step": 12170 }, { "entropy": 5.540670347213745, "epoch": 0.94728652013227, "grad_norm": 0.96875, "learning_rate": 0.0004915283373581581, "loss": 5.2133, "mean_token_accuracy": 0.18355928510427474, "num_tokens": 21127390.0, "step": 12175 }, { "entropy": 5.659769105911255, "epoch": 0.9476755495039876, "grad_norm": 1.0703125, "learning_rate": 0.0004915208020697664, "loss": 5.3076, "mean_token_accuracy": 0.17318570911884307, "num_tokens": 21136323.0, "step": 12180 }, { "entropy": 5.5947404384613035, "epoch": 0.9480645788757052, "grad_norm": 1.0234375, "learning_rate": 0.0004915132634960162, "loss": 5.2529, "mean_token_accuracy": 0.1843479171395302, "num_tokens": 21145228.0, "step": 12185 }, { "entropy": 5.575587368011474, "epoch": 0.9484536082474226, "grad_norm": 1.0390625, "learning_rate": 0.0004915057216370218, "loss": 5.1696, "mean_token_accuracy": 0.18563294559717178, "num_tokens": 21153288.0, "step": 12190 }, { "entropy": 5.552964353561402, "epoch": 0.9488426376191402, "grad_norm": 1.0546875, "learning_rate": 0.0004914981764928977, "loss": 5.215, "mean_token_accuracy": 0.1865030899643898, "num_tokens": 21161802.0, "step": 12195 }, { "entropy": 5.504632616043091, "epoch": 0.9492316669908578, "grad_norm": 1.0625, "learning_rate": 0.0004914906280637584, "loss": 5.1629, "mean_token_accuracy": 0.18965061008930206, "num_tokens": 21170018.0, "step": 12200 }, { "entropy": 5.659635448455811, "epoch": 0.9496206963625754, "grad_norm": 1.03125, "learning_rate": 0.0004914830763497183, "loss": 5.3583, "mean_token_accuracy": 0.16727759540081025, "num_tokens": 21179128.0, "step": 12205 }, { "entropy": 5.635401105880737, "epoch": 0.950009725734293, "grad_norm": 0.9765625, "learning_rate": 0.0004914755213508922, "loss": 5.2064, "mean_token_accuracy": 0.18544783741235732, "num_tokens": 21188138.0, "step": 12210 }, { "entropy": 5.600381088256836, "epoch": 0.9503987551060105, "grad_norm": 1.125, "learning_rate": 0.0004914679630673945, "loss": 5.2836, "mean_token_accuracy": 0.18301821649074554, "num_tokens": 21196465.0, "step": 12215 }, { "entropy": 5.557601499557495, "epoch": 0.950787784477728, "grad_norm": 0.98828125, "learning_rate": 0.0004914604014993401, "loss": 5.1828, "mean_token_accuracy": 0.1813039004802704, "num_tokens": 21205309.0, "step": 12220 }, { "entropy": 5.536256980895996, "epoch": 0.9511768138494456, "grad_norm": 1.0390625, "learning_rate": 0.0004914528366468436, "loss": 5.148, "mean_token_accuracy": 0.19110174030065535, "num_tokens": 21214216.0, "step": 12225 }, { "entropy": 5.52139630317688, "epoch": 0.9515658432211632, "grad_norm": 1.1015625, "learning_rate": 0.0004914452685100199, "loss": 5.1673, "mean_token_accuracy": 0.18793029487133026, "num_tokens": 21222246.0, "step": 12230 }, { "entropy": 5.547867727279663, "epoch": 0.9519548725928808, "grad_norm": 1.0078125, "learning_rate": 0.0004914376970889836, "loss": 5.2197, "mean_token_accuracy": 0.18555752485990523, "num_tokens": 21230696.0, "step": 12235 }, { "entropy": 5.6180586338043215, "epoch": 0.9523439019645983, "grad_norm": 1.0078125, "learning_rate": 0.0004914301223838497, "loss": 5.3321, "mean_token_accuracy": 0.18029067367315293, "num_tokens": 21239909.0, "step": 12240 }, { "entropy": 5.555740070343018, "epoch": 0.9527329313363159, "grad_norm": 1.109375, "learning_rate": 0.0004914225443947334, "loss": 5.1897, "mean_token_accuracy": 0.1832535222172737, "num_tokens": 21248124.0, "step": 12245 }, { "entropy": 5.688931512832641, "epoch": 0.9531219607080335, "grad_norm": 1.015625, "learning_rate": 0.0004914149631217494, "loss": 5.3857, "mean_token_accuracy": 0.1684218630194664, "num_tokens": 21257042.0, "step": 12250 }, { "entropy": 5.659134578704834, "epoch": 0.953510990079751, "grad_norm": 0.9765625, "learning_rate": 0.0004914073785650127, "loss": 5.319, "mean_token_accuracy": 0.17946300953626632, "num_tokens": 21265627.0, "step": 12255 }, { "entropy": 5.622348594665527, "epoch": 0.9539000194514686, "grad_norm": 1.046875, "learning_rate": 0.0004913997907246385, "loss": 5.2302, "mean_token_accuracy": 0.1794123485684395, "num_tokens": 21273688.0, "step": 12260 }, { "entropy": 5.573261499404907, "epoch": 0.9542890488231861, "grad_norm": 0.94140625, "learning_rate": 0.000491392199600742, "loss": 5.2167, "mean_token_accuracy": 0.1829856112599373, "num_tokens": 21283432.0, "step": 12265 }, { "entropy": 5.601358890533447, "epoch": 0.9546780781949037, "grad_norm": 1.0859375, "learning_rate": 0.0004913846051934382, "loss": 5.257, "mean_token_accuracy": 0.1796272873878479, "num_tokens": 21292003.0, "step": 12270 }, { "entropy": 5.541041088104248, "epoch": 0.9550671075666213, "grad_norm": 1.046875, "learning_rate": 0.0004913770075028425, "loss": 5.1712, "mean_token_accuracy": 0.18643339425325395, "num_tokens": 21299914.0, "step": 12275 }, { "entropy": 5.59332242012024, "epoch": 0.9554561369383389, "grad_norm": 1.046875, "learning_rate": 0.0004913694065290701, "loss": 5.3817, "mean_token_accuracy": 0.16797806769609452, "num_tokens": 21309398.0, "step": 12280 }, { "entropy": 5.588516473770142, "epoch": 0.9558451663100564, "grad_norm": 1.0234375, "learning_rate": 0.0004913618022722363, "loss": 5.2111, "mean_token_accuracy": 0.18153220415115356, "num_tokens": 21317828.0, "step": 12285 }, { "entropy": 5.65195107460022, "epoch": 0.9562341956817739, "grad_norm": 1.046875, "learning_rate": 0.0004913541947324566, "loss": 5.3281, "mean_token_accuracy": 0.1786283001303673, "num_tokens": 21326266.0, "step": 12290 }, { "entropy": 5.663617181777954, "epoch": 0.9566232250534915, "grad_norm": 1.140625, "learning_rate": 0.0004913465839098463, "loss": 5.2539, "mean_token_accuracy": 0.17708837538957595, "num_tokens": 21335476.0, "step": 12295 }, { "entropy": 5.6138804912567135, "epoch": 0.9570122544252091, "grad_norm": 1.0234375, "learning_rate": 0.0004913389698045209, "loss": 5.187, "mean_token_accuracy": 0.18348243534564973, "num_tokens": 21344045.0, "step": 12300 }, { "entropy": 5.578237009048462, "epoch": 0.9574012837969267, "grad_norm": 1.078125, "learning_rate": 0.000491331352416596, "loss": 5.2092, "mean_token_accuracy": 0.1864698812365532, "num_tokens": 21352309.0, "step": 12305 }, { "entropy": 5.512121343612671, "epoch": 0.9577903131686443, "grad_norm": 0.99609375, "learning_rate": 0.0004913237317461872, "loss": 5.2582, "mean_token_accuracy": 0.18393941223621368, "num_tokens": 21362164.0, "step": 12310 }, { "entropy": 5.687423753738403, "epoch": 0.9581793425403617, "grad_norm": 1.0390625, "learning_rate": 0.00049131610779341, "loss": 5.218, "mean_token_accuracy": 0.18826501369476317, "num_tokens": 21372817.0, "step": 12315 }, { "entropy": 5.599769735336304, "epoch": 0.9585683719120793, "grad_norm": 1.125, "learning_rate": 0.0004913084805583803, "loss": 5.2089, "mean_token_accuracy": 0.18398718237876893, "num_tokens": 21381035.0, "step": 12320 }, { "entropy": 5.522907781600952, "epoch": 0.9589574012837969, "grad_norm": 0.98828125, "learning_rate": 0.0004913008500412136, "loss": 5.1759, "mean_token_accuracy": 0.19183382838964463, "num_tokens": 21390074.0, "step": 12325 }, { "entropy": 5.576920461654663, "epoch": 0.9593464306555145, "grad_norm": 1.109375, "learning_rate": 0.0004912932162420259, "loss": 5.2284, "mean_token_accuracy": 0.17680705487728118, "num_tokens": 21398726.0, "step": 12330 }, { "entropy": 5.612211561203003, "epoch": 0.9597354600272321, "grad_norm": 1.1171875, "learning_rate": 0.0004912855791609327, "loss": 5.2216, "mean_token_accuracy": 0.17984077483415603, "num_tokens": 21407225.0, "step": 12335 }, { "entropy": 5.5571564674377445, "epoch": 0.9601244893989496, "grad_norm": 0.9765625, "learning_rate": 0.0004912779387980502, "loss": 5.2014, "mean_token_accuracy": 0.18145482540130614, "num_tokens": 21416746.0, "step": 12340 }, { "entropy": 5.579716920852661, "epoch": 0.9605135187706672, "grad_norm": 0.96484375, "learning_rate": 0.0004912702951534942, "loss": 5.2703, "mean_token_accuracy": 0.17398476898670195, "num_tokens": 21425621.0, "step": 12345 }, { "entropy": 5.5823915004730225, "epoch": 0.9609025481423847, "grad_norm": 1.0546875, "learning_rate": 0.0004912626482273809, "loss": 5.1622, "mean_token_accuracy": 0.19778977781534196, "num_tokens": 21433674.0, "step": 12350 }, { "entropy": 5.59567699432373, "epoch": 0.9612915775141023, "grad_norm": 0.98046875, "learning_rate": 0.0004912549980198258, "loss": 5.263, "mean_token_accuracy": 0.18211924731731416, "num_tokens": 21442285.0, "step": 12355 }, { "entropy": 5.591646671295166, "epoch": 0.9616806068858199, "grad_norm": 1.0625, "learning_rate": 0.0004912473445309455, "loss": 5.2198, "mean_token_accuracy": 0.1867017537355423, "num_tokens": 21450345.0, "step": 12360 }, { "entropy": 5.490157270431519, "epoch": 0.9620696362575375, "grad_norm": 1.09375, "learning_rate": 0.000491239687760856, "loss": 5.1355, "mean_token_accuracy": 0.19054339826107025, "num_tokens": 21458618.0, "step": 12365 }, { "entropy": 5.485005903244018, "epoch": 0.962458665629255, "grad_norm": 0.9609375, "learning_rate": 0.0004912320277096732, "loss": 5.1701, "mean_token_accuracy": 0.18405425697565078, "num_tokens": 21467410.0, "step": 12370 }, { "entropy": 5.5545494556427, "epoch": 0.9628476950009726, "grad_norm": 1.0078125, "learning_rate": 0.0004912243643775137, "loss": 5.2239, "mean_token_accuracy": 0.17915583848953248, "num_tokens": 21475454.0, "step": 12375 }, { "entropy": 5.539155912399292, "epoch": 0.9632367243726901, "grad_norm": 1.1171875, "learning_rate": 0.0004912166977644936, "loss": 5.1399, "mean_token_accuracy": 0.18764171302318572, "num_tokens": 21483431.0, "step": 12380 }, { "entropy": 5.560909032821655, "epoch": 0.9636257537444077, "grad_norm": 1.140625, "learning_rate": 0.0004912090278707293, "loss": 5.2157, "mean_token_accuracy": 0.18055916875600814, "num_tokens": 21491199.0, "step": 12385 }, { "entropy": 5.563940858840942, "epoch": 0.9640147831161253, "grad_norm": 1.0078125, "learning_rate": 0.000491201354696337, "loss": 5.3014, "mean_token_accuracy": 0.17994246184825896, "num_tokens": 21500339.0, "step": 12390 }, { "entropy": 5.576026535034179, "epoch": 0.9644038124878428, "grad_norm": 1.046875, "learning_rate": 0.0004911936782414334, "loss": 5.2521, "mean_token_accuracy": 0.18026733994483948, "num_tokens": 21508945.0, "step": 12395 }, { "entropy": 5.604353952407837, "epoch": 0.9647928418595604, "grad_norm": 1.0234375, "learning_rate": 0.0004911859985061348, "loss": 5.214, "mean_token_accuracy": 0.1814992293715477, "num_tokens": 21517649.0, "step": 12400 }, { "entropy": 5.590505218505859, "epoch": 0.965181871231278, "grad_norm": 1.0078125, "learning_rate": 0.0004911783154905577, "loss": 5.2124, "mean_token_accuracy": 0.1816068634390831, "num_tokens": 21526650.0, "step": 12405 }, { "entropy": 5.612040615081787, "epoch": 0.9655709006029956, "grad_norm": 1.0234375, "learning_rate": 0.0004911706291948188, "loss": 5.2318, "mean_token_accuracy": 0.18331041932106018, "num_tokens": 21535401.0, "step": 12410 }, { "entropy": 5.647918748855591, "epoch": 0.9659599299747131, "grad_norm": 1.1171875, "learning_rate": 0.0004911629396190348, "loss": 5.2607, "mean_token_accuracy": 0.17844109684228898, "num_tokens": 21543973.0, "step": 12415 }, { "entropy": 5.522848224639892, "epoch": 0.9663489593464306, "grad_norm": 1.03125, "learning_rate": 0.0004911552467633221, "loss": 5.2032, "mean_token_accuracy": 0.18064285814762115, "num_tokens": 21552875.0, "step": 12420 }, { "entropy": 5.484639310836792, "epoch": 0.9667379887181482, "grad_norm": 0.9921875, "learning_rate": 0.0004911475506277976, "loss": 5.1251, "mean_token_accuracy": 0.1943623512983322, "num_tokens": 21561469.0, "step": 12425 }, { "entropy": 5.5896384716033936, "epoch": 0.9671270180898658, "grad_norm": 1.0859375, "learning_rate": 0.000491139851212578, "loss": 5.1998, "mean_token_accuracy": 0.19158778935670853, "num_tokens": 21569523.0, "step": 12430 }, { "entropy": 5.535619258880615, "epoch": 0.9675160474615834, "grad_norm": 1.1328125, "learning_rate": 0.0004911321485177802, "loss": 5.1592, "mean_token_accuracy": 0.18858758807182313, "num_tokens": 21577700.0, "step": 12435 }, { "entropy": 5.593519830703736, "epoch": 0.967905076833301, "grad_norm": 1.0546875, "learning_rate": 0.0004911244425435212, "loss": 5.2029, "mean_token_accuracy": 0.18343724608421325, "num_tokens": 21586233.0, "step": 12440 }, { "entropy": 5.572824001312256, "epoch": 0.9682941062050184, "grad_norm": 1.046875, "learning_rate": 0.0004911167332899176, "loss": 5.2521, "mean_token_accuracy": 0.18704710602760316, "num_tokens": 21595330.0, "step": 12445 }, { "entropy": 5.528388977050781, "epoch": 0.968683135576736, "grad_norm": 0.97265625, "learning_rate": 0.0004911090207570867, "loss": 5.1758, "mean_token_accuracy": 0.19266084283590318, "num_tokens": 21604522.0, "step": 12450 }, { "entropy": 5.607219982147217, "epoch": 0.9690721649484536, "grad_norm": 1.0546875, "learning_rate": 0.0004911013049451453, "loss": 5.1593, "mean_token_accuracy": 0.18465932756662368, "num_tokens": 21613599.0, "step": 12455 }, { "entropy": 5.546594190597534, "epoch": 0.9694611943201712, "grad_norm": 1.0, "learning_rate": 0.0004910935858542106, "loss": 5.2375, "mean_token_accuracy": 0.17949807196855544, "num_tokens": 21622587.0, "step": 12460 }, { "entropy": 5.554617023468017, "epoch": 0.9698502236918888, "grad_norm": 1.046875, "learning_rate": 0.0004910858634843997, "loss": 5.2538, "mean_token_accuracy": 0.17767165154218673, "num_tokens": 21630782.0, "step": 12465 }, { "entropy": 5.584745407104492, "epoch": 0.9702392530636063, "grad_norm": 1.0546875, "learning_rate": 0.0004910781378358297, "loss": 5.1233, "mean_token_accuracy": 0.191708105802536, "num_tokens": 21639354.0, "step": 12470 }, { "entropy": 5.5527793884277346, "epoch": 0.9706282824353238, "grad_norm": 1.03125, "learning_rate": 0.0004910704089086178, "loss": 5.2856, "mean_token_accuracy": 0.18243273645639418, "num_tokens": 21648292.0, "step": 12475 }, { "entropy": 5.603460311889648, "epoch": 0.9710173118070414, "grad_norm": 1.015625, "learning_rate": 0.0004910626767028815, "loss": 5.2205, "mean_token_accuracy": 0.19073559641838073, "num_tokens": 21657382.0, "step": 12480 }, { "entropy": 5.598748397827149, "epoch": 0.971406341178759, "grad_norm": 1.078125, "learning_rate": 0.0004910549412187379, "loss": 5.2136, "mean_token_accuracy": 0.17809648513793946, "num_tokens": 21666327.0, "step": 12485 }, { "entropy": 5.567792081832886, "epoch": 0.9717953705504766, "grad_norm": 1.0859375, "learning_rate": 0.0004910472024563045, "loss": 5.2357, "mean_token_accuracy": 0.18883391767740249, "num_tokens": 21674882.0, "step": 12490 }, { "entropy": 5.679027414321899, "epoch": 0.9721843999221941, "grad_norm": 1.09375, "learning_rate": 0.0004910394604156987, "loss": 5.3274, "mean_token_accuracy": 0.1758040115237236, "num_tokens": 21683255.0, "step": 12495 }, { "entropy": 5.648699760437012, "epoch": 0.9725734292939117, "grad_norm": 1.1171875, "learning_rate": 0.0004910317150970379, "loss": 5.1908, "mean_token_accuracy": 0.1852326661348343, "num_tokens": 21692274.0, "step": 12500 }, { "entropy": 5.4729467868804935, "epoch": 0.9729624586656292, "grad_norm": 1.078125, "learning_rate": 0.0004910239665004397, "loss": 5.1105, "mean_token_accuracy": 0.19836493879556655, "num_tokens": 21700767.0, "step": 12505 }, { "entropy": 5.53968825340271, "epoch": 0.9733514880373468, "grad_norm": 1.09375, "learning_rate": 0.0004910162146260216, "loss": 5.2643, "mean_token_accuracy": 0.18542049676179886, "num_tokens": 21709430.0, "step": 12510 }, { "entropy": 5.546899795532227, "epoch": 0.9737405174090644, "grad_norm": 1.0234375, "learning_rate": 0.0004910084594739013, "loss": 5.1657, "mean_token_accuracy": 0.1877752274274826, "num_tokens": 21717978.0, "step": 12515 }, { "entropy": 5.43008942604065, "epoch": 0.9741295467807819, "grad_norm": 0.99609375, "learning_rate": 0.0004910007010441964, "loss": 5.0367, "mean_token_accuracy": 0.19908907860517502, "num_tokens": 21726608.0, "step": 12520 }, { "entropy": 5.491342258453369, "epoch": 0.9745185761524995, "grad_norm": 1.0234375, "learning_rate": 0.0004909929393370248, "loss": 5.1987, "mean_token_accuracy": 0.18284936547279357, "num_tokens": 21735402.0, "step": 12525 }, { "entropy": 5.523431444168091, "epoch": 0.9749076055242171, "grad_norm": 0.98046875, "learning_rate": 0.0004909851743525041, "loss": 5.1633, "mean_token_accuracy": 0.18822280317544937, "num_tokens": 21744620.0, "step": 12530 }, { "entropy": 5.5951985836029055, "epoch": 0.9752966348959347, "grad_norm": 1.09375, "learning_rate": 0.000490977406090752, "loss": 5.2426, "mean_token_accuracy": 0.1834847956895828, "num_tokens": 21753270.0, "step": 12535 }, { "entropy": 5.623544311523437, "epoch": 0.9756856642676522, "grad_norm": 1.0390625, "learning_rate": 0.0004909696345518867, "loss": 5.2587, "mean_token_accuracy": 0.1800254002213478, "num_tokens": 21761477.0, "step": 12540 }, { "entropy": 5.48270354270935, "epoch": 0.9760746936393697, "grad_norm": 1.0390625, "learning_rate": 0.0004909618597360258, "loss": 5.1723, "mean_token_accuracy": 0.1867610439658165, "num_tokens": 21769925.0, "step": 12545 }, { "entropy": 5.573631429672242, "epoch": 0.9764637230110873, "grad_norm": 1.0, "learning_rate": 0.0004909540816432876, "loss": 5.2373, "mean_token_accuracy": 0.1894602969288826, "num_tokens": 21778850.0, "step": 12550 }, { "entropy": 5.593955755233765, "epoch": 0.9768527523828049, "grad_norm": 1.015625, "learning_rate": 0.0004909463002737897, "loss": 5.2941, "mean_token_accuracy": 0.17965374290943145, "num_tokens": 21787408.0, "step": 12555 }, { "entropy": 5.635477209091187, "epoch": 0.9772417817545225, "grad_norm": 1.1015625, "learning_rate": 0.0004909385156276506, "loss": 5.2508, "mean_token_accuracy": 0.1876464918255806, "num_tokens": 21795967.0, "step": 12560 }, { "entropy": 5.592546081542968, "epoch": 0.9776308111262401, "grad_norm": 1.0, "learning_rate": 0.0004909307277049881, "loss": 5.2039, "mean_token_accuracy": 0.1853122130036354, "num_tokens": 21804472.0, "step": 12565 }, { "entropy": 5.489376401901245, "epoch": 0.9780198404979576, "grad_norm": 0.98046875, "learning_rate": 0.0004909229365059205, "loss": 5.2057, "mean_token_accuracy": 0.18564027696847915, "num_tokens": 21813233.0, "step": 12570 }, { "entropy": 5.490174007415772, "epoch": 0.9784088698696751, "grad_norm": 1.09375, "learning_rate": 0.0004909151420305661, "loss": 5.0931, "mean_token_accuracy": 0.19649251252412797, "num_tokens": 21821413.0, "step": 12575 }, { "entropy": 5.563841390609741, "epoch": 0.9787978992413927, "grad_norm": 1.125, "learning_rate": 0.000490907344279043, "loss": 5.1751, "mean_token_accuracy": 0.1877642899751663, "num_tokens": 21829222.0, "step": 12580 }, { "entropy": 5.5319915294647215, "epoch": 0.9791869286131103, "grad_norm": 1.0078125, "learning_rate": 0.0004908995432514698, "loss": 5.194, "mean_token_accuracy": 0.1828892335295677, "num_tokens": 21837033.0, "step": 12585 }, { "entropy": 5.637091732025146, "epoch": 0.9795759579848279, "grad_norm": 1.0390625, "learning_rate": 0.0004908917389479645, "loss": 5.2439, "mean_token_accuracy": 0.18043948113918304, "num_tokens": 21845464.0, "step": 12590 }, { "entropy": 5.51136360168457, "epoch": 0.9799649873565455, "grad_norm": 1.0625, "learning_rate": 0.0004908839313686456, "loss": 5.1854, "mean_token_accuracy": 0.18375110179185866, "num_tokens": 21853497.0, "step": 12595 }, { "entropy": 5.593607711791992, "epoch": 0.980354016728263, "grad_norm": 1.03125, "learning_rate": 0.0004908761205136319, "loss": 5.2689, "mean_token_accuracy": 0.18147289454936982, "num_tokens": 21861710.0, "step": 12600 }, { "entropy": 5.645310544967652, "epoch": 0.9807430460999805, "grad_norm": 1.0390625, "learning_rate": 0.0004908683063830414, "loss": 5.1995, "mean_token_accuracy": 0.17797971218824388, "num_tokens": 21870472.0, "step": 12605 }, { "entropy": 5.6198813915252686, "epoch": 0.9811320754716981, "grad_norm": 1.03125, "learning_rate": 0.0004908604889769932, "loss": 5.2964, "mean_token_accuracy": 0.17758426517248155, "num_tokens": 21878287.0, "step": 12610 }, { "entropy": 5.634679317474365, "epoch": 0.9815211048434157, "grad_norm": 1.046875, "learning_rate": 0.0004908526682956054, "loss": 5.3133, "mean_token_accuracy": 0.17233989685773848, "num_tokens": 21887587.0, "step": 12615 }, { "entropy": 5.562415647506714, "epoch": 0.9819101342151333, "grad_norm": 1.1953125, "learning_rate": 0.0004908448443389972, "loss": 5.1428, "mean_token_accuracy": 0.19184593260288238, "num_tokens": 21895923.0, "step": 12620 }, { "entropy": 5.562763929367065, "epoch": 0.9822991635868508, "grad_norm": 1.046875, "learning_rate": 0.0004908370171072869, "loss": 5.18, "mean_token_accuracy": 0.19212259501218795, "num_tokens": 21904439.0, "step": 12625 }, { "entropy": 5.540858364105224, "epoch": 0.9826881929585684, "grad_norm": 1.078125, "learning_rate": 0.0004908291866005933, "loss": 5.1488, "mean_token_accuracy": 0.18386462330818176, "num_tokens": 21912473.0, "step": 12630 }, { "entropy": 5.486727380752564, "epoch": 0.9830772223302859, "grad_norm": 1.0625, "learning_rate": 0.0004908213528190355, "loss": 5.2317, "mean_token_accuracy": 0.17889027893543244, "num_tokens": 21921631.0, "step": 12635 }, { "entropy": 5.492412996292114, "epoch": 0.9834662517020035, "grad_norm": 1.0625, "learning_rate": 0.0004908135157627321, "loss": 5.1311, "mean_token_accuracy": 0.19090985506772995, "num_tokens": 21929984.0, "step": 12640 }, { "entropy": 5.536947298049927, "epoch": 0.9838552810737211, "grad_norm": 1.0703125, "learning_rate": 0.0004908056754318022, "loss": 5.0891, "mean_token_accuracy": 0.19027605503797532, "num_tokens": 21937349.0, "step": 12645 }, { "entropy": 5.503980445861816, "epoch": 0.9842443104454386, "grad_norm": 0.99609375, "learning_rate": 0.0004907978318263646, "loss": 5.2024, "mean_token_accuracy": 0.1863625630736351, "num_tokens": 21946176.0, "step": 12650 }, { "entropy": 5.584465789794922, "epoch": 0.9846333398171562, "grad_norm": 1.125, "learning_rate": 0.0004907899849465383, "loss": 5.1879, "mean_token_accuracy": 0.18762608766555786, "num_tokens": 21954645.0, "step": 12655 }, { "entropy": 5.578148937225341, "epoch": 0.9850223691888738, "grad_norm": 1.0546875, "learning_rate": 0.0004907821347924424, "loss": 5.2262, "mean_token_accuracy": 0.17646457105875016, "num_tokens": 21963290.0, "step": 12660 }, { "entropy": 5.574510526657105, "epoch": 0.9854113985605913, "grad_norm": 1.0546875, "learning_rate": 0.0004907742813641963, "loss": 5.242, "mean_token_accuracy": 0.18453686386346818, "num_tokens": 21971005.0, "step": 12665 }, { "entropy": 5.538446092605591, "epoch": 0.9858004279323089, "grad_norm": 0.98828125, "learning_rate": 0.0004907664246619187, "loss": 5.1549, "mean_token_accuracy": 0.1910643011331558, "num_tokens": 21980067.0, "step": 12670 }, { "entropy": 5.566548156738281, "epoch": 0.9861894573040264, "grad_norm": 1.03125, "learning_rate": 0.0004907585646857293, "loss": 5.1899, "mean_token_accuracy": 0.18357451856136323, "num_tokens": 21988511.0, "step": 12675 }, { "entropy": 5.535651922225952, "epoch": 0.986578486675744, "grad_norm": 1.0, "learning_rate": 0.0004907507014357467, "loss": 5.1687, "mean_token_accuracy": 0.18767756074666977, "num_tokens": 21997074.0, "step": 12680 }, { "entropy": 5.59835262298584, "epoch": 0.9869675160474616, "grad_norm": 1.0625, "learning_rate": 0.0004907428349120909, "loss": 5.2995, "mean_token_accuracy": 0.1809012398123741, "num_tokens": 22005412.0, "step": 12685 }, { "entropy": 5.521641683578491, "epoch": 0.9873565454191792, "grad_norm": 1.0, "learning_rate": 0.0004907349651148809, "loss": 5.1009, "mean_token_accuracy": 0.19311340302228927, "num_tokens": 22013588.0, "step": 12690 }, { "entropy": 5.560098314285279, "epoch": 0.9877455747908968, "grad_norm": 1.015625, "learning_rate": 0.0004907270920442361, "loss": 5.2467, "mean_token_accuracy": 0.18230018764734268, "num_tokens": 22021669.0, "step": 12695 }, { "entropy": 5.50910496711731, "epoch": 0.9881346041626142, "grad_norm": 1.046875, "learning_rate": 0.0004907192157002762, "loss": 5.1106, "mean_token_accuracy": 0.19061779975891113, "num_tokens": 22030295.0, "step": 12700 }, { "entropy": 5.589793014526367, "epoch": 0.9885236335343318, "grad_norm": 1.0703125, "learning_rate": 0.0004907113360831204, "loss": 5.2625, "mean_token_accuracy": 0.18287634551525117, "num_tokens": 22038924.0, "step": 12705 }, { "entropy": 5.5686742782592775, "epoch": 0.9889126629060494, "grad_norm": 1.09375, "learning_rate": 0.0004907034531928886, "loss": 5.1742, "mean_token_accuracy": 0.19149626344442366, "num_tokens": 22047586.0, "step": 12710 }, { "entropy": 5.523001956939697, "epoch": 0.989301692277767, "grad_norm": 1.046875, "learning_rate": 0.0004906955670297001, "loss": 5.1547, "mean_token_accuracy": 0.1865146890282631, "num_tokens": 22055695.0, "step": 12715 }, { "entropy": 5.614638900756836, "epoch": 0.9896907216494846, "grad_norm": 1.0546875, "learning_rate": 0.0004906876775936746, "loss": 5.3082, "mean_token_accuracy": 0.17966843992471696, "num_tokens": 22064472.0, "step": 12720 }, { "entropy": 5.631753921508789, "epoch": 0.990079751021202, "grad_norm": 0.98046875, "learning_rate": 0.0004906797848849321, "loss": 5.2373, "mean_token_accuracy": 0.1752263605594635, "num_tokens": 22072726.0, "step": 12725 }, { "entropy": 5.581534147262573, "epoch": 0.9904687803929196, "grad_norm": 1.0078125, "learning_rate": 0.000490671888903592, "loss": 5.1329, "mean_token_accuracy": 0.18759203255176543, "num_tokens": 22081074.0, "step": 12730 }, { "entropy": 5.500444126129151, "epoch": 0.9908578097646372, "grad_norm": 0.98828125, "learning_rate": 0.0004906639896497744, "loss": 5.1214, "mean_token_accuracy": 0.19771044552326203, "num_tokens": 22089924.0, "step": 12735 }, { "entropy": 5.588295030593872, "epoch": 0.9912468391363548, "grad_norm": 1.0546875, "learning_rate": 0.0004906560871235988, "loss": 5.1378, "mean_token_accuracy": 0.18912340700626373, "num_tokens": 22099088.0, "step": 12740 }, { "entropy": 5.651731348037719, "epoch": 0.9916358685080724, "grad_norm": 1.046875, "learning_rate": 0.0004906481813251854, "loss": 5.2843, "mean_token_accuracy": 0.1810019001364708, "num_tokens": 22108344.0, "step": 12745 }, { "entropy": 5.563349723815918, "epoch": 0.9920248978797899, "grad_norm": 1.1328125, "learning_rate": 0.0004906402722546542, "loss": 5.197, "mean_token_accuracy": 0.18123072236776352, "num_tokens": 22116476.0, "step": 12750 }, { "entropy": 5.621095132827759, "epoch": 0.9924139272515075, "grad_norm": 0.97265625, "learning_rate": 0.000490632359912125, "loss": 5.2968, "mean_token_accuracy": 0.1742379203438759, "num_tokens": 22125445.0, "step": 12755 }, { "entropy": 5.602992916107178, "epoch": 0.992802956623225, "grad_norm": 0.98828125, "learning_rate": 0.000490624444297718, "loss": 5.3181, "mean_token_accuracy": 0.18033766895532607, "num_tokens": 22134886.0, "step": 12760 }, { "entropy": 5.525603151321411, "epoch": 0.9931919859949426, "grad_norm": 0.9296875, "learning_rate": 0.0004906165254115533, "loss": 5.1782, "mean_token_accuracy": 0.18814245462417603, "num_tokens": 22144521.0, "step": 12765 }, { "entropy": 5.496958541870117, "epoch": 0.9935810153666602, "grad_norm": 1.0703125, "learning_rate": 0.000490608603253751, "loss": 5.1939, "mean_token_accuracy": 0.1895970657467842, "num_tokens": 22152754.0, "step": 12770 }, { "entropy": 5.548004865646362, "epoch": 0.9939700447383778, "grad_norm": 0.98828125, "learning_rate": 0.0004906006778244312, "loss": 5.1773, "mean_token_accuracy": 0.1882224589586258, "num_tokens": 22161711.0, "step": 12775 }, { "entropy": 5.605820941925049, "epoch": 0.9943590741100953, "grad_norm": 1.0703125, "learning_rate": 0.0004905927491237145, "loss": 5.3014, "mean_token_accuracy": 0.18251292556524276, "num_tokens": 22169762.0, "step": 12780 }, { "entropy": 5.568092966079712, "epoch": 0.9947481034818129, "grad_norm": 0.9453125, "learning_rate": 0.0004905848171517208, "loss": 5.1474, "mean_token_accuracy": 0.18988931626081468, "num_tokens": 22178415.0, "step": 12785 }, { "entropy": 5.499771595001221, "epoch": 0.9951371328535304, "grad_norm": 0.984375, "learning_rate": 0.0004905768819085706, "loss": 5.0934, "mean_token_accuracy": 0.19471519887447358, "num_tokens": 22187643.0, "step": 12790 }, { "entropy": 5.4495015144348145, "epoch": 0.995526162225248, "grad_norm": 1.0546875, "learning_rate": 0.0004905689433943846, "loss": 5.1344, "mean_token_accuracy": 0.189376999437809, "num_tokens": 22196355.0, "step": 12795 }, { "entropy": 5.576473808288574, "epoch": 0.9959151915969656, "grad_norm": 1.09375, "learning_rate": 0.0004905610016092828, "loss": 5.2524, "mean_token_accuracy": 0.18064917623996735, "num_tokens": 22204648.0, "step": 12800 }, { "entropy": 5.555432415008545, "epoch": 0.9963042209686831, "grad_norm": 1.0625, "learning_rate": 0.0004905530565533859, "loss": 5.2268, "mean_token_accuracy": 0.18231253921985627, "num_tokens": 22212811.0, "step": 12805 }, { "entropy": 5.482769107818603, "epoch": 0.9966932503404007, "grad_norm": 1.0625, "learning_rate": 0.0004905451082268146, "loss": 5.1944, "mean_token_accuracy": 0.18336111754179002, "num_tokens": 22220611.0, "step": 12810 }, { "entropy": 5.578828048706055, "epoch": 0.9970822797121183, "grad_norm": 1.046875, "learning_rate": 0.0004905371566296891, "loss": 5.2084, "mean_token_accuracy": 0.18011167496442795, "num_tokens": 22229606.0, "step": 12815 }, { "entropy": 5.642096424102784, "epoch": 0.9974713090838359, "grad_norm": 1.0234375, "learning_rate": 0.0004905292017621305, "loss": 5.1853, "mean_token_accuracy": 0.18634316176176072, "num_tokens": 22238157.0, "step": 12820 }, { "entropy": 5.547455549240112, "epoch": 0.9978603384555534, "grad_norm": 1.1015625, "learning_rate": 0.0004905212436242593, "loss": 5.2221, "mean_token_accuracy": 0.18357642143964767, "num_tokens": 22246696.0, "step": 12825 }, { "entropy": 5.544768905639648, "epoch": 0.9982493678272709, "grad_norm": 1.03125, "learning_rate": 0.0004905132822161962, "loss": 5.2526, "mean_token_accuracy": 0.18186190873384475, "num_tokens": 22255028.0, "step": 12830 }, { "entropy": 5.6687843799591064, "epoch": 0.9986383971989885, "grad_norm": 1.0703125, "learning_rate": 0.0004905053175380621, "loss": 5.3011, "mean_token_accuracy": 0.18592547625303268, "num_tokens": 22263198.0, "step": 12835 }, { "entropy": 5.623014688491821, "epoch": 0.9990274265707061, "grad_norm": 0.96875, "learning_rate": 0.0004904973495899778, "loss": 5.2992, "mean_token_accuracy": 0.18507118821144103, "num_tokens": 22273780.0, "step": 12840 }, { "entropy": 5.659826850891113, "epoch": 0.9994164559424237, "grad_norm": 1.0390625, "learning_rate": 0.0004904893783720642, "loss": 5.3248, "mean_token_accuracy": 0.17507429122924806, "num_tokens": 22281545.0, "step": 12845 }, { "entropy": 5.550436544418335, "epoch": 0.9998054853141413, "grad_norm": 1.046875, "learning_rate": 0.0004904814038844424, "loss": 5.2104, "mean_token_accuracy": 0.17978432923555374, "num_tokens": 22290426.0, "step": 12850 }, { "entropy": 5.602494610680474, "epoch": 1.000155611748687, "grad_norm": 1.0625, "learning_rate": 0.0004904734261272332, "loss": 5.2511, "mean_token_accuracy": 0.1884353756904602, "num_tokens": 22297475.0, "step": 12855 }, { "entropy": 5.497782230377197, "epoch": 1.0005446411204046, "grad_norm": 0.98828125, "learning_rate": 0.0004904654451005576, "loss": 4.9866, "mean_token_accuracy": 0.1947847932577133, "num_tokens": 22305784.0, "step": 12860 }, { "entropy": 5.526057243347168, "epoch": 1.0009336704921221, "grad_norm": 1.1171875, "learning_rate": 0.0004904574608045369, "loss": 5.0917, "mean_token_accuracy": 0.18853476494550706, "num_tokens": 22313951.0, "step": 12865 }, { "entropy": 5.63850769996643, "epoch": 1.0013226998638398, "grad_norm": 1.125, "learning_rate": 0.0004904494732392923, "loss": 5.1972, "mean_token_accuracy": 0.18424230217933654, "num_tokens": 22322509.0, "step": 12870 }, { "entropy": 5.545155191421509, "epoch": 1.0017117292355573, "grad_norm": 1.0390625, "learning_rate": 0.0004904414824049448, "loss": 5.1513, "mean_token_accuracy": 0.18539026528596877, "num_tokens": 22331475.0, "step": 12875 }, { "entropy": 5.533708000183106, "epoch": 1.0021007586072748, "grad_norm": 1.015625, "learning_rate": 0.0004904334883016156, "loss": 5.0775, "mean_token_accuracy": 0.19584077447652817, "num_tokens": 22341114.0, "step": 12880 }, { "entropy": 5.581373596191407, "epoch": 1.0024897879789925, "grad_norm": 0.9765625, "learning_rate": 0.0004904254909294261, "loss": 5.1495, "mean_token_accuracy": 0.190461228787899, "num_tokens": 22349199.0, "step": 12885 }, { "entropy": 5.566561937332153, "epoch": 1.00287881735071, "grad_norm": 0.9140625, "learning_rate": 0.0004904174902884978, "loss": 5.121, "mean_token_accuracy": 0.18924966603517532, "num_tokens": 22358485.0, "step": 12890 }, { "entropy": 5.634268808364868, "epoch": 1.0032678467224276, "grad_norm": 0.9765625, "learning_rate": 0.0004904094863789519, "loss": 5.1754, "mean_token_accuracy": 0.1821126490831375, "num_tokens": 22366936.0, "step": 12895 }, { "entropy": 5.652461814880371, "epoch": 1.0036568760941451, "grad_norm": 1.0078125, "learning_rate": 0.00049040147920091, "loss": 5.1534, "mean_token_accuracy": 0.18067814260721207, "num_tokens": 22376007.0, "step": 12900 }, { "entropy": 5.512387371063232, "epoch": 1.0040459054658626, "grad_norm": 1.046875, "learning_rate": 0.0004903934687544933, "loss": 5.0686, "mean_token_accuracy": 0.2005569815635681, "num_tokens": 22384747.0, "step": 12905 }, { "entropy": 5.56094217300415, "epoch": 1.0044349348375803, "grad_norm": 1.0078125, "learning_rate": 0.0004903854550398237, "loss": 5.0965, "mean_token_accuracy": 0.19653735160827637, "num_tokens": 22393730.0, "step": 12910 }, { "entropy": 5.604393053054809, "epoch": 1.0048239642092978, "grad_norm": 0.984375, "learning_rate": 0.0004903774380570226, "loss": 5.1229, "mean_token_accuracy": 0.18444818258285522, "num_tokens": 22402121.0, "step": 12915 }, { "entropy": 5.559228849411011, "epoch": 1.0052129935810155, "grad_norm": 0.96875, "learning_rate": 0.0004903694178062117, "loss": 5.1351, "mean_token_accuracy": 0.18738230615854262, "num_tokens": 22410943.0, "step": 12920 }, { "entropy": 5.606460475921631, "epoch": 1.005602022952733, "grad_norm": 1.0390625, "learning_rate": 0.0004903613942875126, "loss": 5.2004, "mean_token_accuracy": 0.18455881029367446, "num_tokens": 22420137.0, "step": 12925 }, { "entropy": 5.575601530075073, "epoch": 1.0059910523244504, "grad_norm": 1.0546875, "learning_rate": 0.0004903533675010472, "loss": 5.1336, "mean_token_accuracy": 0.18333719819784164, "num_tokens": 22429031.0, "step": 12930 }, { "entropy": 5.526545190811158, "epoch": 1.006380081696168, "grad_norm": 1.0078125, "learning_rate": 0.0004903453374469373, "loss": 5.1805, "mean_token_accuracy": 0.18613078743219375, "num_tokens": 22438735.0, "step": 12935 }, { "entropy": 5.603658199310303, "epoch": 1.0067691110678856, "grad_norm": 0.97265625, "learning_rate": 0.0004903373041253045, "loss": 5.172, "mean_token_accuracy": 0.18485343158245088, "num_tokens": 22447374.0, "step": 12940 }, { "entropy": 5.6252185821533205, "epoch": 1.0071581404396033, "grad_norm": 1.0, "learning_rate": 0.0004903292675362709, "loss": 5.108, "mean_token_accuracy": 0.18936037570238112, "num_tokens": 22455542.0, "step": 12945 }, { "entropy": 5.505251741409301, "epoch": 1.0075471698113208, "grad_norm": 1.0859375, "learning_rate": 0.0004903212276799584, "loss": 5.1622, "mean_token_accuracy": 0.18490004986524583, "num_tokens": 22464591.0, "step": 12950 }, { "entropy": 5.559835195541382, "epoch": 1.0079361991830382, "grad_norm": 1.0703125, "learning_rate": 0.0004903131845564889, "loss": 5.0936, "mean_token_accuracy": 0.19423397928476333, "num_tokens": 22472315.0, "step": 12955 }, { "entropy": 5.580622291564941, "epoch": 1.008325228554756, "grad_norm": 1.0625, "learning_rate": 0.0004903051381659847, "loss": 5.2402, "mean_token_accuracy": 0.17842978835105897, "num_tokens": 22480662.0, "step": 12960 }, { "entropy": 5.4951142311096195, "epoch": 1.0087142579264734, "grad_norm": 0.97265625, "learning_rate": 0.0004902970885085677, "loss": 5.1334, "mean_token_accuracy": 0.18665957897901536, "num_tokens": 22489600.0, "step": 12965 }, { "entropy": 5.615678405761718, "epoch": 1.009103287298191, "grad_norm": 1.046875, "learning_rate": 0.00049028903558436, "loss": 5.1742, "mean_token_accuracy": 0.1867367744445801, "num_tokens": 22498114.0, "step": 12970 }, { "entropy": 5.534137105941772, "epoch": 1.0094923166699086, "grad_norm": 1.015625, "learning_rate": 0.0004902809793934838, "loss": 5.009, "mean_token_accuracy": 0.20099946856498718, "num_tokens": 22506349.0, "step": 12975 }, { "entropy": 5.538618516921997, "epoch": 1.009881346041626, "grad_norm": 1.0234375, "learning_rate": 0.0004902729199360615, "loss": 5.0936, "mean_token_accuracy": 0.1934603363275528, "num_tokens": 22514878.0, "step": 12980 }, { "entropy": 5.550827550888061, "epoch": 1.0102703754133437, "grad_norm": 1.0625, "learning_rate": 0.0004902648572122153, "loss": 5.1364, "mean_token_accuracy": 0.17829016596078873, "num_tokens": 22522992.0, "step": 12985 }, { "entropy": 5.64747986793518, "epoch": 1.0106594047850612, "grad_norm": 1.046875, "learning_rate": 0.0004902567912220674, "loss": 5.1871, "mean_token_accuracy": 0.18084194958209993, "num_tokens": 22531407.0, "step": 12990 }, { "entropy": 5.508750486373901, "epoch": 1.011048434156779, "grad_norm": 1.0078125, "learning_rate": 0.0004902487219657404, "loss": 5.0794, "mean_token_accuracy": 0.18966627568006517, "num_tokens": 22540255.0, "step": 12995 }, { "entropy": 5.533417701721191, "epoch": 1.0114374635284964, "grad_norm": 1.015625, "learning_rate": 0.0004902406494433566, "loss": 5.1183, "mean_token_accuracy": 0.18966990560293198, "num_tokens": 22549139.0, "step": 13000 }, { "entropy": 5.5960956573486325, "epoch": 1.0118264929002139, "grad_norm": 1.0234375, "learning_rate": 0.0004902325736550386, "loss": 5.1184, "mean_token_accuracy": 0.1921576127409935, "num_tokens": 22557746.0, "step": 13005 }, { "entropy": 5.578761196136474, "epoch": 1.0122155222719316, "grad_norm": 1.0859375, "learning_rate": 0.0004902244946009088, "loss": 5.1094, "mean_token_accuracy": 0.18693674057722093, "num_tokens": 22566695.0, "step": 13010 }, { "entropy": 5.564864826202393, "epoch": 1.012604551643649, "grad_norm": 1.0546875, "learning_rate": 0.0004902164122810899, "loss": 5.1119, "mean_token_accuracy": 0.1888263612985611, "num_tokens": 22575196.0, "step": 13015 }, { "entropy": 5.566193246841431, "epoch": 1.0129935810153667, "grad_norm": 1.0390625, "learning_rate": 0.0004902083266957045, "loss": 5.1133, "mean_token_accuracy": 0.1898096725344658, "num_tokens": 22583520.0, "step": 13020 }, { "entropy": 5.558519744873047, "epoch": 1.0133826103870842, "grad_norm": 0.98828125, "learning_rate": 0.0004902002378448753, "loss": 5.1734, "mean_token_accuracy": 0.18409187942743302, "num_tokens": 22591896.0, "step": 13025 }, { "entropy": 5.55157585144043, "epoch": 1.0137716397588017, "grad_norm": 1.1171875, "learning_rate": 0.000490192145728725, "loss": 5.0948, "mean_token_accuracy": 0.19964988231658937, "num_tokens": 22600097.0, "step": 13030 }, { "entropy": 5.540172433853149, "epoch": 1.0141606691305194, "grad_norm": 1.0703125, "learning_rate": 0.0004901840503473764, "loss": 5.0375, "mean_token_accuracy": 0.18559068590402603, "num_tokens": 22607956.0, "step": 13035 }, { "entropy": 5.540137910842896, "epoch": 1.0145496985022369, "grad_norm": 0.953125, "learning_rate": 0.0004901759517009522, "loss": 5.1338, "mean_token_accuracy": 0.17898587733507157, "num_tokens": 22616549.0, "step": 13040 }, { "entropy": 5.55298810005188, "epoch": 1.0149387278739546, "grad_norm": 1.1015625, "learning_rate": 0.0004901678497895755, "loss": 5.0563, "mean_token_accuracy": 0.1862951323390007, "num_tokens": 22625138.0, "step": 13045 }, { "entropy": 5.566691541671753, "epoch": 1.015327757245672, "grad_norm": 1.0625, "learning_rate": 0.0004901597446133692, "loss": 5.1496, "mean_token_accuracy": 0.18422176837921142, "num_tokens": 22633808.0, "step": 13050 }, { "entropy": 5.528288269042969, "epoch": 1.0157167866173895, "grad_norm": 0.96875, "learning_rate": 0.0004901516361724564, "loss": 5.0905, "mean_token_accuracy": 0.19693392962217332, "num_tokens": 22642517.0, "step": 13055 }, { "entropy": 5.581601953506469, "epoch": 1.0161058159891072, "grad_norm": 0.98828125, "learning_rate": 0.0004901435244669597, "loss": 5.1511, "mean_token_accuracy": 0.1824340358376503, "num_tokens": 22651822.0, "step": 13060 }, { "entropy": 5.583770418167115, "epoch": 1.0164948453608247, "grad_norm": 1.0, "learning_rate": 0.0004901354094970025, "loss": 5.1236, "mean_token_accuracy": 0.19076863974332808, "num_tokens": 22660763.0, "step": 13065 }, { "entropy": 5.521487760543823, "epoch": 1.0168838747325424, "grad_norm": 0.98046875, "learning_rate": 0.0004901272912627081, "loss": 5.1253, "mean_token_accuracy": 0.18654322177171706, "num_tokens": 22669449.0, "step": 13070 }, { "entropy": 5.5992106914520265, "epoch": 1.0172729041042599, "grad_norm": 1.1484375, "learning_rate": 0.0004901191697641992, "loss": 5.1501, "mean_token_accuracy": 0.18977264761924745, "num_tokens": 22678212.0, "step": 13075 }, { "entropy": 5.553779935836792, "epoch": 1.0176619334759773, "grad_norm": 1.015625, "learning_rate": 0.0004901110450015994, "loss": 5.0905, "mean_token_accuracy": 0.19180919378995895, "num_tokens": 22686509.0, "step": 13080 }, { "entropy": 5.5005475044250485, "epoch": 1.018050962847695, "grad_norm": 1.078125, "learning_rate": 0.0004901029169750319, "loss": 5.1146, "mean_token_accuracy": 0.18717952966690063, "num_tokens": 22695473.0, "step": 13085 }, { "entropy": 5.57834529876709, "epoch": 1.0184399922194125, "grad_norm": 1.015625, "learning_rate": 0.0004900947856846201, "loss": 5.1808, "mean_token_accuracy": 0.18466604948043824, "num_tokens": 22704567.0, "step": 13090 }, { "entropy": 5.540963172912598, "epoch": 1.0188290215911302, "grad_norm": 0.98046875, "learning_rate": 0.000490086651130487, "loss": 5.0544, "mean_token_accuracy": 0.19342739433050155, "num_tokens": 22713981.0, "step": 13095 }, { "entropy": 5.477065086364746, "epoch": 1.0192180509628477, "grad_norm": 1.046875, "learning_rate": 0.0004900785133127566, "loss": 4.9968, "mean_token_accuracy": 0.20526853054761887, "num_tokens": 22722855.0, "step": 13100 }, { "entropy": 5.523031425476074, "epoch": 1.0196070803345652, "grad_norm": 0.93359375, "learning_rate": 0.000490070372231552, "loss": 5.1184, "mean_token_accuracy": 0.18693454563617706, "num_tokens": 22732454.0, "step": 13105 }, { "entropy": 5.524135732650757, "epoch": 1.0199961097062828, "grad_norm": 1.046875, "learning_rate": 0.0004900622278869968, "loss": 4.9761, "mean_token_accuracy": 0.20482657998800277, "num_tokens": 22741331.0, "step": 13110 }, { "entropy": 5.584689283370972, "epoch": 1.0203851390780003, "grad_norm": 1.0234375, "learning_rate": 0.0004900540802792146, "loss": 5.1816, "mean_token_accuracy": 0.1842080235481262, "num_tokens": 22749983.0, "step": 13115 }, { "entropy": 5.501961898803711, "epoch": 1.020774168449718, "grad_norm": 1.0703125, "learning_rate": 0.000490045929408329, "loss": 5.1246, "mean_token_accuracy": 0.19006228744983672, "num_tokens": 22759112.0, "step": 13120 }, { "entropy": 5.560851001739502, "epoch": 1.0211631978214355, "grad_norm": 1.0390625, "learning_rate": 0.0004900377752744637, "loss": 5.1706, "mean_token_accuracy": 0.18927655816078187, "num_tokens": 22768456.0, "step": 13125 }, { "entropy": 5.56893401145935, "epoch": 1.021552227193153, "grad_norm": 1.0390625, "learning_rate": 0.0004900296178777426, "loss": 5.0771, "mean_token_accuracy": 0.19508728981018067, "num_tokens": 22777450.0, "step": 13130 }, { "entropy": 5.584453201293945, "epoch": 1.0219412565648707, "grad_norm": 1.09375, "learning_rate": 0.000490021457218289, "loss": 5.1347, "mean_token_accuracy": 0.19422568678855895, "num_tokens": 22785704.0, "step": 13135 }, { "entropy": 5.484196329116822, "epoch": 1.0223302859365881, "grad_norm": 1.0390625, "learning_rate": 0.0004900132932962272, "loss": 5.1152, "mean_token_accuracy": 0.18883706331253053, "num_tokens": 22794649.0, "step": 13140 }, { "entropy": 5.600627803802491, "epoch": 1.0227193153083058, "grad_norm": 1.046875, "learning_rate": 0.000490005126111681, "loss": 5.2152, "mean_token_accuracy": 0.1855715736746788, "num_tokens": 22803501.0, "step": 13145 }, { "entropy": 5.671587705612183, "epoch": 1.0231083446800233, "grad_norm": 0.984375, "learning_rate": 0.000489996955664774, "loss": 5.1421, "mean_token_accuracy": 0.18789013475179672, "num_tokens": 22811779.0, "step": 13150 }, { "entropy": 5.528184700012207, "epoch": 1.023497374051741, "grad_norm": 1.0078125, "learning_rate": 0.0004899887819556306, "loss": 5.1439, "mean_token_accuracy": 0.18700369745492934, "num_tokens": 22821108.0, "step": 13155 }, { "entropy": 5.5858643531799315, "epoch": 1.0238864034234585, "grad_norm": 1.125, "learning_rate": 0.0004899806049843745, "loss": 5.1645, "mean_token_accuracy": 0.1873817428946495, "num_tokens": 22829369.0, "step": 13160 }, { "entropy": 5.567682218551636, "epoch": 1.024275432795176, "grad_norm": 0.96484375, "learning_rate": 0.0004899724247511299, "loss": 5.1211, "mean_token_accuracy": 0.1896756872534752, "num_tokens": 22838441.0, "step": 13165 }, { "entropy": 5.580206680297851, "epoch": 1.0246644621668937, "grad_norm": 0.97265625, "learning_rate": 0.000489964241256021, "loss": 5.0986, "mean_token_accuracy": 0.18903386741876602, "num_tokens": 22847587.0, "step": 13170 }, { "entropy": 5.494615125656128, "epoch": 1.0250534915386111, "grad_norm": 0.98828125, "learning_rate": 0.0004899560544991718, "loss": 5.0652, "mean_token_accuracy": 0.19684161096811295, "num_tokens": 22856051.0, "step": 13175 }, { "entropy": 5.556175231933594, "epoch": 1.0254425209103288, "grad_norm": 1.0703125, "learning_rate": 0.0004899478644807068, "loss": 5.1392, "mean_token_accuracy": 0.18752205967903138, "num_tokens": 22864822.0, "step": 13180 }, { "entropy": 5.568244171142578, "epoch": 1.0258315502820463, "grad_norm": 1.1015625, "learning_rate": 0.0004899396712007498, "loss": 5.111, "mean_token_accuracy": 0.18785069435834884, "num_tokens": 22873199.0, "step": 13185 }, { "entropy": 5.540246438980103, "epoch": 1.0262205796537638, "grad_norm": 1.125, "learning_rate": 0.0004899314746594256, "loss": 5.1798, "mean_token_accuracy": 0.18196630626916885, "num_tokens": 22881184.0, "step": 13190 }, { "entropy": 5.590057373046875, "epoch": 1.0266096090254815, "grad_norm": 1.0234375, "learning_rate": 0.0004899232748568584, "loss": 5.0867, "mean_token_accuracy": 0.19181957691907883, "num_tokens": 22890087.0, "step": 13195 }, { "entropy": 5.570810317993164, "epoch": 1.026998638397199, "grad_norm": 1.1796875, "learning_rate": 0.0004899150717931724, "loss": 5.1042, "mean_token_accuracy": 0.19140806347131728, "num_tokens": 22899013.0, "step": 13200 }, { "entropy": 5.522170639038086, "epoch": 1.0273876677689167, "grad_norm": 1.0078125, "learning_rate": 0.0004899068654684924, "loss": 5.2531, "mean_token_accuracy": 0.18083969503641129, "num_tokens": 22908740.0, "step": 13205 }, { "entropy": 5.623792028427124, "epoch": 1.0277766971406341, "grad_norm": 1.0703125, "learning_rate": 0.0004898986558829428, "loss": 5.1725, "mean_token_accuracy": 0.18605524599552153, "num_tokens": 22917502.0, "step": 13210 }, { "entropy": 5.571014165878296, "epoch": 1.0281657265123516, "grad_norm": 1.03125, "learning_rate": 0.0004898904430366479, "loss": 5.0847, "mean_token_accuracy": 0.18972016572952272, "num_tokens": 22927076.0, "step": 13215 }, { "entropy": 5.582257509231567, "epoch": 1.0285547558840693, "grad_norm": 1.09375, "learning_rate": 0.0004898822269297328, "loss": 5.1514, "mean_token_accuracy": 0.1842966914176941, "num_tokens": 22936111.0, "step": 13220 }, { "entropy": 5.503234243392944, "epoch": 1.0289437852557868, "grad_norm": 1.0390625, "learning_rate": 0.0004898740075623218, "loss": 5.0257, "mean_token_accuracy": 0.1970045030117035, "num_tokens": 22944752.0, "step": 13225 }, { "entropy": 5.614857482910156, "epoch": 1.0293328146275045, "grad_norm": 1.046875, "learning_rate": 0.0004898657849345399, "loss": 5.2587, "mean_token_accuracy": 0.18242369294166566, "num_tokens": 22952971.0, "step": 13230 }, { "entropy": 5.598722982406616, "epoch": 1.029721843999222, "grad_norm": 1.1015625, "learning_rate": 0.0004898575590465116, "loss": 5.1625, "mean_token_accuracy": 0.19350814819335938, "num_tokens": 22961257.0, "step": 13235 }, { "entropy": 5.54152193069458, "epoch": 1.0301108733709394, "grad_norm": 1.0078125, "learning_rate": 0.0004898493298983619, "loss": 5.2078, "mean_token_accuracy": 0.1872486114501953, "num_tokens": 22970659.0, "step": 13240 }, { "entropy": 5.5529930114746096, "epoch": 1.0304999027426571, "grad_norm": 1.109375, "learning_rate": 0.0004898410974902155, "loss": 5.1463, "mean_token_accuracy": 0.19037771075963975, "num_tokens": 22978830.0, "step": 13245 }, { "entropy": 5.623561668395996, "epoch": 1.0308889321143746, "grad_norm": 1.0625, "learning_rate": 0.0004898328618221974, "loss": 5.116, "mean_token_accuracy": 0.19342898428440095, "num_tokens": 22987100.0, "step": 13250 }, { "entropy": 5.573216152191162, "epoch": 1.0312779614860923, "grad_norm": 1.078125, "learning_rate": 0.0004898246228944327, "loss": 5.1436, "mean_token_accuracy": 0.187310791015625, "num_tokens": 22995749.0, "step": 13255 }, { "entropy": 5.646274137496948, "epoch": 1.0316669908578098, "grad_norm": 1.140625, "learning_rate": 0.0004898163807070461, "loss": 5.1989, "mean_token_accuracy": 0.19106748849153518, "num_tokens": 23004410.0, "step": 13260 }, { "entropy": 5.5814062595367435, "epoch": 1.0320560202295272, "grad_norm": 1.015625, "learning_rate": 0.0004898081352601629, "loss": 5.0764, "mean_token_accuracy": 0.18742465525865554, "num_tokens": 23012935.0, "step": 13265 }, { "entropy": 5.515347146987915, "epoch": 1.032445049601245, "grad_norm": 1.015625, "learning_rate": 0.0004897998865539082, "loss": 5.0627, "mean_token_accuracy": 0.19089292585849763, "num_tokens": 23021769.0, "step": 13270 }, { "entropy": 5.5167755603790285, "epoch": 1.0328340789729624, "grad_norm": 0.9296875, "learning_rate": 0.0004897916345884069, "loss": 5.0689, "mean_token_accuracy": 0.18745699375867844, "num_tokens": 23030915.0, "step": 13275 }, { "entropy": 5.565987968444825, "epoch": 1.0332231083446801, "grad_norm": 1.015625, "learning_rate": 0.0004897833793637847, "loss": 5.184, "mean_token_accuracy": 0.18107736855745316, "num_tokens": 23039422.0, "step": 13280 }, { "entropy": 5.5884381294250485, "epoch": 1.0336121377163976, "grad_norm": 0.94921875, "learning_rate": 0.0004897751208801665, "loss": 5.2361, "mean_token_accuracy": 0.17725082188844682, "num_tokens": 23048485.0, "step": 13285 }, { "entropy": 5.524944734573364, "epoch": 1.034001167088115, "grad_norm": 1.0546875, "learning_rate": 0.0004897668591376777, "loss": 5.1014, "mean_token_accuracy": 0.19463111460208893, "num_tokens": 23057506.0, "step": 13290 }, { "entropy": 5.522286653518677, "epoch": 1.0343901964598328, "grad_norm": 1.1015625, "learning_rate": 0.0004897585941364436, "loss": 4.9591, "mean_token_accuracy": 0.20029387921094893, "num_tokens": 23065430.0, "step": 13295 }, { "entropy": 5.489220762252808, "epoch": 1.0347792258315502, "grad_norm": 1.046875, "learning_rate": 0.0004897503258765896, "loss": 5.0845, "mean_token_accuracy": 0.18796505630016327, "num_tokens": 23074533.0, "step": 13300 }, { "entropy": 5.55793137550354, "epoch": 1.035168255203268, "grad_norm": 1.0625, "learning_rate": 0.0004897420543582413, "loss": 5.0892, "mean_token_accuracy": 0.19122830927371978, "num_tokens": 23083020.0, "step": 13305 }, { "entropy": 5.533450269699097, "epoch": 1.0355572845749854, "grad_norm": 1.0390625, "learning_rate": 0.000489733779581524, "loss": 5.1358, "mean_token_accuracy": 0.1904940977692604, "num_tokens": 23091992.0, "step": 13310 }, { "entropy": 5.49093861579895, "epoch": 1.035946313946703, "grad_norm": 1.140625, "learning_rate": 0.0004897255015465635, "loss": 5.1079, "mean_token_accuracy": 0.18566958904266356, "num_tokens": 23100411.0, "step": 13315 }, { "entropy": 5.536679458618164, "epoch": 1.0363353433184206, "grad_norm": 1.0234375, "learning_rate": 0.0004897172202534853, "loss": 5.2, "mean_token_accuracy": 0.19183483123779296, "num_tokens": 23108867.0, "step": 13320 }, { "entropy": 5.553509473800659, "epoch": 1.036724372690138, "grad_norm": 1.0859375, "learning_rate": 0.000489708935702415, "loss": 5.0427, "mean_token_accuracy": 0.19434165507555007, "num_tokens": 23116692.0, "step": 13325 }, { "entropy": 5.567583990097046, "epoch": 1.0371134020618558, "grad_norm": 0.95703125, "learning_rate": 0.0004897006478934784, "loss": 5.1178, "mean_token_accuracy": 0.19184658229351043, "num_tokens": 23125138.0, "step": 13330 }, { "entropy": 5.523353481292725, "epoch": 1.0375024314335732, "grad_norm": 1.0390625, "learning_rate": 0.0004896923568268011, "loss": 5.1292, "mean_token_accuracy": 0.1848578304052353, "num_tokens": 23133263.0, "step": 13335 }, { "entropy": 5.570543670654297, "epoch": 1.0378914608052907, "grad_norm": 1.109375, "learning_rate": 0.000489684062502509, "loss": 5.1076, "mean_token_accuracy": 0.18882636576890946, "num_tokens": 23141984.0, "step": 13340 }, { "entropy": 5.54804482460022, "epoch": 1.0382804901770084, "grad_norm": 0.97265625, "learning_rate": 0.0004896757649207281, "loss": 5.0817, "mean_token_accuracy": 0.19435103237628937, "num_tokens": 23151598.0, "step": 13345 }, { "entropy": 5.589086961746216, "epoch": 1.0386695195487259, "grad_norm": 1.0703125, "learning_rate": 0.000489667464081584, "loss": 5.2228, "mean_token_accuracy": 0.18364229947328567, "num_tokens": 23159737.0, "step": 13350 }, { "entropy": 5.554082155227661, "epoch": 1.0390585489204436, "grad_norm": 1.0, "learning_rate": 0.0004896591599852029, "loss": 5.0743, "mean_token_accuracy": 0.19256037026643752, "num_tokens": 23168852.0, "step": 13355 }, { "entropy": 5.624046325683594, "epoch": 1.039447578292161, "grad_norm": 1.0078125, "learning_rate": 0.0004896508526317107, "loss": 5.1585, "mean_token_accuracy": 0.18748216480016708, "num_tokens": 23178227.0, "step": 13360 }, { "entropy": 5.567367076873779, "epoch": 1.0398366076638785, "grad_norm": 1.0859375, "learning_rate": 0.0004896425420212334, "loss": 5.0713, "mean_token_accuracy": 0.19270658642053604, "num_tokens": 23187286.0, "step": 13365 }, { "entropy": 5.575743103027344, "epoch": 1.0402256370355962, "grad_norm": 1.0625, "learning_rate": 0.0004896342281538973, "loss": 5.1224, "mean_token_accuracy": 0.19453513473272324, "num_tokens": 23196163.0, "step": 13370 }, { "entropy": 5.56591157913208, "epoch": 1.0406146664073137, "grad_norm": 1.1484375, "learning_rate": 0.0004896259110298283, "loss": 5.0689, "mean_token_accuracy": 0.19389081746339798, "num_tokens": 23203742.0, "step": 13375 }, { "entropy": 5.644067621231079, "epoch": 1.0410036957790314, "grad_norm": 1.109375, "learning_rate": 0.0004896175906491528, "loss": 5.2359, "mean_token_accuracy": 0.18386470526456833, "num_tokens": 23212860.0, "step": 13380 }, { "entropy": 5.61379861831665, "epoch": 1.0413927251507489, "grad_norm": 1.046875, "learning_rate": 0.0004896092670119968, "loss": 5.1104, "mean_token_accuracy": 0.1852978527545929, "num_tokens": 23222558.0, "step": 13385 }, { "entropy": 5.571009683609009, "epoch": 1.0417817545224664, "grad_norm": 1.1640625, "learning_rate": 0.0004896009401184869, "loss": 5.1585, "mean_token_accuracy": 0.18610741943120956, "num_tokens": 23231413.0, "step": 13390 }, { "entropy": 5.546082162857056, "epoch": 1.042170783894184, "grad_norm": 0.9921875, "learning_rate": 0.0004895926099687493, "loss": 5.1014, "mean_token_accuracy": 0.19446830302476883, "num_tokens": 23240783.0, "step": 13395 }, { "entropy": 5.5714925765991214, "epoch": 1.0425598132659015, "grad_norm": 1.0390625, "learning_rate": 0.0004895842765629104, "loss": 5.2161, "mean_token_accuracy": 0.1871562495827675, "num_tokens": 23249125.0, "step": 13400 }, { "entropy": 5.57609338760376, "epoch": 1.0429488426376192, "grad_norm": 1.0859375, "learning_rate": 0.0004895759399010966, "loss": 5.0759, "mean_token_accuracy": 0.18885018080472946, "num_tokens": 23257793.0, "step": 13405 }, { "entropy": 5.483095693588257, "epoch": 1.0433378720093367, "grad_norm": 1.0625, "learning_rate": 0.0004895675999834345, "loss": 5.046, "mean_token_accuracy": 0.19669701755046845, "num_tokens": 23266361.0, "step": 13410 }, { "entropy": 5.5332506656646725, "epoch": 1.0437269013810542, "grad_norm": 0.99609375, "learning_rate": 0.0004895592568100505, "loss": 5.0144, "mean_token_accuracy": 0.19876361936330794, "num_tokens": 23274914.0, "step": 13415 }, { "entropy": 5.540232467651367, "epoch": 1.0441159307527719, "grad_norm": 1.125, "learning_rate": 0.0004895509103810714, "loss": 5.1125, "mean_token_accuracy": 0.1861565440893173, "num_tokens": 23283067.0, "step": 13420 }, { "entropy": 5.55697603225708, "epoch": 1.0445049601244893, "grad_norm": 1.015625, "learning_rate": 0.0004895425606966237, "loss": 5.1262, "mean_token_accuracy": 0.18422970175743103, "num_tokens": 23291114.0, "step": 13425 }, { "entropy": 5.493901014328003, "epoch": 1.044893989496207, "grad_norm": 1.0, "learning_rate": 0.000489534207756834, "loss": 4.9969, "mean_token_accuracy": 0.19421214163303374, "num_tokens": 23300525.0, "step": 13430 }, { "entropy": 5.550111293792725, "epoch": 1.0452830188679245, "grad_norm": 1.0625, "learning_rate": 0.0004895258515618293, "loss": 5.092, "mean_token_accuracy": 0.19004881232976914, "num_tokens": 23308984.0, "step": 13435 }, { "entropy": 5.575098037719727, "epoch": 1.045672048239642, "grad_norm": 1.015625, "learning_rate": 0.0004895174921117362, "loss": 5.1936, "mean_token_accuracy": 0.17996650338172912, "num_tokens": 23318137.0, "step": 13440 }, { "entropy": 5.6501775741577145, "epoch": 1.0460610776113597, "grad_norm": 1.109375, "learning_rate": 0.0004895091294066816, "loss": 5.2549, "mean_token_accuracy": 0.17623160183429717, "num_tokens": 23326276.0, "step": 13445 }, { "entropy": 5.569949579238892, "epoch": 1.0464501069830772, "grad_norm": 1.078125, "learning_rate": 0.0004895007634467924, "loss": 5.1273, "mean_token_accuracy": 0.18646959215402603, "num_tokens": 23334578.0, "step": 13450 }, { "entropy": 5.541098260879517, "epoch": 1.0468391363547949, "grad_norm": 1.0078125, "learning_rate": 0.0004894923942321955, "loss": 5.1495, "mean_token_accuracy": 0.1853663593530655, "num_tokens": 23344173.0, "step": 13455 }, { "entropy": 5.519333457946777, "epoch": 1.0472281657265123, "grad_norm": 1.0703125, "learning_rate": 0.0004894840217630179, "loss": 5.0135, "mean_token_accuracy": 0.1950036659836769, "num_tokens": 23353098.0, "step": 13460 }, { "entropy": 5.616471624374389, "epoch": 1.0476171950982298, "grad_norm": 0.97265625, "learning_rate": 0.0004894756460393868, "loss": 5.1416, "mean_token_accuracy": 0.18826956450939178, "num_tokens": 23362364.0, "step": 13465 }, { "entropy": 5.59700984954834, "epoch": 1.0480062244699475, "grad_norm": 1.015625, "learning_rate": 0.000489467267061429, "loss": 5.1801, "mean_token_accuracy": 0.180839404463768, "num_tokens": 23371903.0, "step": 13470 }, { "entropy": 5.537702465057373, "epoch": 1.048395253841665, "grad_norm": 0.93359375, "learning_rate": 0.0004894588848292718, "loss": 5.0958, "mean_token_accuracy": 0.19802405536174775, "num_tokens": 23381711.0, "step": 13475 }, { "entropy": 5.548175239562989, "epoch": 1.0487842832133827, "grad_norm": 0.9765625, "learning_rate": 0.0004894504993430425, "loss": 5.0529, "mean_token_accuracy": 0.18945176750421525, "num_tokens": 23389812.0, "step": 13480 }, { "entropy": 5.565440273284912, "epoch": 1.0491733125851002, "grad_norm": 1.078125, "learning_rate": 0.000489442110602868, "loss": 5.0834, "mean_token_accuracy": 0.20017406791448594, "num_tokens": 23399231.0, "step": 13485 }, { "entropy": 5.53766565322876, "epoch": 1.0495623419568176, "grad_norm": 1.0625, "learning_rate": 0.0004894337186088759, "loss": 5.0657, "mean_token_accuracy": 0.18777775764465332, "num_tokens": 23407764.0, "step": 13490 }, { "entropy": 5.541928052902222, "epoch": 1.0499513713285353, "grad_norm": 1.078125, "learning_rate": 0.0004894253233611934, "loss": 5.024, "mean_token_accuracy": 0.19526999145746232, "num_tokens": 23416368.0, "step": 13495 }, { "entropy": 5.633498764038086, "epoch": 1.0503404007002528, "grad_norm": 1.0234375, "learning_rate": 0.000489416924859948, "loss": 5.2654, "mean_token_accuracy": 0.18364062011241913, "num_tokens": 23425415.0, "step": 13500 }, { "entropy": 5.5485481262207035, "epoch": 1.0507294300719705, "grad_norm": 1.03125, "learning_rate": 0.000489408523105267, "loss": 5.0778, "mean_token_accuracy": 0.18930239826440812, "num_tokens": 23433435.0, "step": 13505 }, { "entropy": 5.591840982437134, "epoch": 1.051118459443688, "grad_norm": 1.0859375, "learning_rate": 0.0004894001180972779, "loss": 5.1359, "mean_token_accuracy": 0.18588989675045015, "num_tokens": 23442002.0, "step": 13510 }, { "entropy": 5.486305904388428, "epoch": 1.0515074888154055, "grad_norm": 1.046875, "learning_rate": 0.0004893917098361082, "loss": 4.929, "mean_token_accuracy": 0.19889771640300752, "num_tokens": 23450437.0, "step": 13515 }, { "entropy": 5.476190757751465, "epoch": 1.0518965181871232, "grad_norm": 1.1171875, "learning_rate": 0.0004893832983218856, "loss": 5.0278, "mean_token_accuracy": 0.19660004675388337, "num_tokens": 23458755.0, "step": 13520 }, { "entropy": 5.580454349517822, "epoch": 1.0522855475588406, "grad_norm": 1.0078125, "learning_rate": 0.0004893748835547377, "loss": 5.1623, "mean_token_accuracy": 0.18904335498809816, "num_tokens": 23467138.0, "step": 13525 }, { "entropy": 5.533040857315063, "epoch": 1.0526745769305583, "grad_norm": 1.0390625, "learning_rate": 0.0004893664655347921, "loss": 5.0258, "mean_token_accuracy": 0.19522487968206406, "num_tokens": 23475494.0, "step": 13530 }, { "entropy": 5.481938695907592, "epoch": 1.0530636063022758, "grad_norm": 1.0703125, "learning_rate": 0.0004893580442621767, "loss": 4.9874, "mean_token_accuracy": 0.19702944606542588, "num_tokens": 23484215.0, "step": 13535 }, { "entropy": 5.486063432693482, "epoch": 1.0534526356739935, "grad_norm": 1.015625, "learning_rate": 0.000489349619737019, "loss": 5.0709, "mean_token_accuracy": 0.1844639077782631, "num_tokens": 23492604.0, "step": 13540 }, { "entropy": 5.644566297531128, "epoch": 1.053841665045711, "grad_norm": 1.09375, "learning_rate": 0.000489341191959447, "loss": 5.2725, "mean_token_accuracy": 0.18335204273462297, "num_tokens": 23501817.0, "step": 13545 }, { "entropy": 5.647152423858643, "epoch": 1.0542306944174284, "grad_norm": 1.09375, "learning_rate": 0.0004893327609295887, "loss": 5.1743, "mean_token_accuracy": 0.1869557186961174, "num_tokens": 23509996.0, "step": 13550 }, { "entropy": 5.493410587310791, "epoch": 1.0546197237891461, "grad_norm": 1.0859375, "learning_rate": 0.0004893243266475719, "loss": 4.9317, "mean_token_accuracy": 0.20967918485403061, "num_tokens": 23518316.0, "step": 13555 }, { "entropy": 5.500581550598144, "epoch": 1.0550087531608636, "grad_norm": 1.015625, "learning_rate": 0.0004893158891135245, "loss": 5.1489, "mean_token_accuracy": 0.18843015730381013, "num_tokens": 23526851.0, "step": 13560 }, { "entropy": 5.575391435623169, "epoch": 1.055397782532581, "grad_norm": 1.03125, "learning_rate": 0.0004893074483275746, "loss": 5.0565, "mean_token_accuracy": 0.19761413782835008, "num_tokens": 23534757.0, "step": 13565 }, { "entropy": 5.55781044960022, "epoch": 1.0557868119042988, "grad_norm": 1.0078125, "learning_rate": 0.0004892990042898503, "loss": 5.1213, "mean_token_accuracy": 0.1814389169216156, "num_tokens": 23544102.0, "step": 13570 }, { "entropy": 5.526807880401611, "epoch": 1.0561758412760163, "grad_norm": 1.0234375, "learning_rate": 0.0004892905570004798, "loss": 5.1574, "mean_token_accuracy": 0.17815360724925994, "num_tokens": 23552663.0, "step": 13575 }, { "entropy": 5.540577507019043, "epoch": 1.056564870647734, "grad_norm": 1.046875, "learning_rate": 0.000489282106459591, "loss": 5.0421, "mean_token_accuracy": 0.19477053433656694, "num_tokens": 23561144.0, "step": 13580 }, { "entropy": 5.485770654678345, "epoch": 1.0569539000194514, "grad_norm": 1.1328125, "learning_rate": 0.0004892736526673124, "loss": 5.0383, "mean_token_accuracy": 0.19195435792207718, "num_tokens": 23569833.0, "step": 13585 }, { "entropy": 5.5496666431427, "epoch": 1.0573429293911691, "grad_norm": 1.0234375, "learning_rate": 0.0004892651956237721, "loss": 5.1038, "mean_token_accuracy": 0.1859749212861061, "num_tokens": 23578643.0, "step": 13590 }, { "entropy": 5.611403131484986, "epoch": 1.0577319587628866, "grad_norm": 1.0390625, "learning_rate": 0.0004892567353290986, "loss": 5.171, "mean_token_accuracy": 0.18489499092102052, "num_tokens": 23587324.0, "step": 13595 }, { "entropy": 5.515933990478516, "epoch": 1.058120988134604, "grad_norm": 1.0703125, "learning_rate": 0.0004892482717834201, "loss": 5.1094, "mean_token_accuracy": 0.18617239743471145, "num_tokens": 23595670.0, "step": 13600 }, { "entropy": 5.52309217453003, "epoch": 1.0585100175063218, "grad_norm": 1.1328125, "learning_rate": 0.0004892398049868651, "loss": 5.0229, "mean_token_accuracy": 0.2074963331222534, "num_tokens": 23603833.0, "step": 13605 }, { "entropy": 5.542495965957642, "epoch": 1.0588990468780393, "grad_norm": 1.0234375, "learning_rate": 0.000489231334939562, "loss": 5.1126, "mean_token_accuracy": 0.18682459890842437, "num_tokens": 23612815.0, "step": 13610 }, { "entropy": 5.570399570465088, "epoch": 1.059288076249757, "grad_norm": 0.97265625, "learning_rate": 0.0004892228616416395, "loss": 5.1166, "mean_token_accuracy": 0.18690780103206633, "num_tokens": 23621178.0, "step": 13615 }, { "entropy": 5.559569931030273, "epoch": 1.0596771056214744, "grad_norm": 1.0546875, "learning_rate": 0.0004892143850932259, "loss": 5.3037, "mean_token_accuracy": 0.18021937012672423, "num_tokens": 23630681.0, "step": 13620 }, { "entropy": 5.570667314529419, "epoch": 1.060066134993192, "grad_norm": 1.015625, "learning_rate": 0.00048920590529445, "loss": 5.0976, "mean_token_accuracy": 0.19716931283473968, "num_tokens": 23639374.0, "step": 13625 }, { "entropy": 5.550150299072266, "epoch": 1.0604551643649096, "grad_norm": 1.0234375, "learning_rate": 0.0004891974222454406, "loss": 5.1074, "mean_token_accuracy": 0.19388217777013778, "num_tokens": 23648217.0, "step": 13630 }, { "entropy": 5.576891994476318, "epoch": 1.060844193736627, "grad_norm": 1.0703125, "learning_rate": 0.0004891889359463261, "loss": 5.0819, "mean_token_accuracy": 0.1954309433698654, "num_tokens": 23656688.0, "step": 13635 }, { "entropy": 5.533861351013184, "epoch": 1.0612332231083448, "grad_norm": 1.0, "learning_rate": 0.0004891804463972354, "loss": 5.152, "mean_token_accuracy": 0.191353702545166, "num_tokens": 23666646.0, "step": 13640 }, { "entropy": 5.5231880187988285, "epoch": 1.0616222524800623, "grad_norm": 1.03125, "learning_rate": 0.0004891719535982974, "loss": 5.0516, "mean_token_accuracy": 0.19825712740421295, "num_tokens": 23675278.0, "step": 13645 }, { "entropy": 5.559094047546386, "epoch": 1.0620112818517797, "grad_norm": 1.0546875, "learning_rate": 0.0004891634575496408, "loss": 5.169, "mean_token_accuracy": 0.1882852330803871, "num_tokens": 23684263.0, "step": 13650 }, { "entropy": 5.542915916442871, "epoch": 1.0624003112234974, "grad_norm": 1.0703125, "learning_rate": 0.0004891549582513946, "loss": 4.9945, "mean_token_accuracy": 0.19987936913967133, "num_tokens": 23692249.0, "step": 13655 }, { "entropy": 5.5894450664520265, "epoch": 1.062789340595215, "grad_norm": 1.0546875, "learning_rate": 0.000489146455703688, "loss": 5.2109, "mean_token_accuracy": 0.18558669835329056, "num_tokens": 23701082.0, "step": 13660 }, { "entropy": 5.557166004180909, "epoch": 1.0631783699669326, "grad_norm": 1.0625, "learning_rate": 0.0004891379499066495, "loss": 5.1697, "mean_token_accuracy": 0.17952576279640198, "num_tokens": 23710277.0, "step": 13665 }, { "entropy": 5.542935180664062, "epoch": 1.06356739933865, "grad_norm": 1.0625, "learning_rate": 0.0004891294408604087, "loss": 5.1395, "mean_token_accuracy": 0.18682847768068314, "num_tokens": 23719131.0, "step": 13670 }, { "entropy": 5.5245277881622314, "epoch": 1.0639564287103676, "grad_norm": 1.1328125, "learning_rate": 0.0004891209285650942, "loss": 5.0844, "mean_token_accuracy": 0.18916123509407043, "num_tokens": 23727674.0, "step": 13675 }, { "entropy": 5.5888899803161625, "epoch": 1.0643454580820852, "grad_norm": 1.0703125, "learning_rate": 0.0004891124130208355, "loss": 5.2052, "mean_token_accuracy": 0.18104732632637024, "num_tokens": 23736181.0, "step": 13680 }, { "entropy": 5.561683225631714, "epoch": 1.0647344874538027, "grad_norm": 1.0625, "learning_rate": 0.0004891038942277618, "loss": 5.0908, "mean_token_accuracy": 0.19476557672023773, "num_tokens": 23744552.0, "step": 13685 }, { "entropy": 5.640599250793457, "epoch": 1.0651235168255204, "grad_norm": 1.1015625, "learning_rate": 0.0004890953721860022, "loss": 5.2097, "mean_token_accuracy": 0.18445058166980743, "num_tokens": 23753755.0, "step": 13690 }, { "entropy": 5.5744880676269535, "epoch": 1.065512546197238, "grad_norm": 1.015625, "learning_rate": 0.0004890868468956862, "loss": 5.1122, "mean_token_accuracy": 0.19210155457258224, "num_tokens": 23761759.0, "step": 13695 }, { "entropy": 5.5430450439453125, "epoch": 1.0659015755689554, "grad_norm": 1.0390625, "learning_rate": 0.000489078318356943, "loss": 5.096, "mean_token_accuracy": 0.19025285840034484, "num_tokens": 23769952.0, "step": 13700 }, { "entropy": 5.516364002227784, "epoch": 1.066290604940673, "grad_norm": 1.09375, "learning_rate": 0.0004890697865699021, "loss": 5.1414, "mean_token_accuracy": 0.18873618841171264, "num_tokens": 23778045.0, "step": 13705 }, { "entropy": 5.560581254959106, "epoch": 1.0666796343123905, "grad_norm": 1.109375, "learning_rate": 0.0004890612515346929, "loss": 5.0779, "mean_token_accuracy": 0.18887751549482346, "num_tokens": 23787477.0, "step": 13710 }, { "entropy": 5.555035829544067, "epoch": 1.0670686636841082, "grad_norm": 1.125, "learning_rate": 0.0004890527132514448, "loss": 5.0814, "mean_token_accuracy": 0.20074543058872224, "num_tokens": 23795905.0, "step": 13715 }, { "entropy": 5.627185678482055, "epoch": 1.0674576930558257, "grad_norm": 1.078125, "learning_rate": 0.0004890441717202876, "loss": 5.1546, "mean_token_accuracy": 0.1903741791844368, "num_tokens": 23804339.0, "step": 13720 }, { "entropy": 5.582160139083863, "epoch": 1.0678467224275432, "grad_norm": 1.046875, "learning_rate": 0.0004890356269413507, "loss": 5.1562, "mean_token_accuracy": 0.185725799202919, "num_tokens": 23813032.0, "step": 13725 }, { "entropy": 5.56419734954834, "epoch": 1.068235751799261, "grad_norm": 1.078125, "learning_rate": 0.000489027078914764, "loss": 5.0371, "mean_token_accuracy": 0.2049105256795883, "num_tokens": 23822047.0, "step": 13730 }, { "entropy": 5.462968206405639, "epoch": 1.0686247811709784, "grad_norm": 1.0703125, "learning_rate": 0.0004890185276406569, "loss": 5.011, "mean_token_accuracy": 0.1926239013671875, "num_tokens": 23831220.0, "step": 13735 }, { "entropy": 5.540319967269897, "epoch": 1.069013810542696, "grad_norm": 1.0859375, "learning_rate": 0.0004890099731191592, "loss": 5.17, "mean_token_accuracy": 0.18684637397527695, "num_tokens": 23840118.0, "step": 13740 }, { "entropy": 5.587307167053223, "epoch": 1.0694028399144135, "grad_norm": 1.0, "learning_rate": 0.000489001415350401, "loss": 5.1306, "mean_token_accuracy": 0.19016505479812623, "num_tokens": 23848826.0, "step": 13745 }, { "entropy": 5.62038516998291, "epoch": 1.069791869286131, "grad_norm": 1.0859375, "learning_rate": 0.0004889928543345118, "loss": 5.2569, "mean_token_accuracy": 0.184573432803154, "num_tokens": 23857462.0, "step": 13750 }, { "entropy": 5.540248727798462, "epoch": 1.0701808986578487, "grad_norm": 1.0859375, "learning_rate": 0.0004889842900716217, "loss": 5.1117, "mean_token_accuracy": 0.19019486606121064, "num_tokens": 23866842.0, "step": 13755 }, { "entropy": 5.574837350845337, "epoch": 1.0705699280295662, "grad_norm": 1.109375, "learning_rate": 0.0004889757225618606, "loss": 5.1394, "mean_token_accuracy": 0.18294884860515595, "num_tokens": 23875079.0, "step": 13760 }, { "entropy": 5.615604066848755, "epoch": 1.0709589574012839, "grad_norm": 1.1015625, "learning_rate": 0.0004889671518053584, "loss": 5.1147, "mean_token_accuracy": 0.1861308217048645, "num_tokens": 23883963.0, "step": 13765 }, { "entropy": 5.589229679107666, "epoch": 1.0713479867730014, "grad_norm": 1.0625, "learning_rate": 0.0004889585778022453, "loss": 5.0853, "mean_token_accuracy": 0.20030197203159333, "num_tokens": 23892709.0, "step": 13770 }, { "entropy": 5.57830696105957, "epoch": 1.0717370161447188, "grad_norm": 1.125, "learning_rate": 0.0004889500005526514, "loss": 5.2215, "mean_token_accuracy": 0.1834134966135025, "num_tokens": 23901124.0, "step": 13775 }, { "entropy": 5.6007640838623045, "epoch": 1.0721260455164365, "grad_norm": 1.09375, "learning_rate": 0.0004889414200567067, "loss": 5.1574, "mean_token_accuracy": 0.1839173659682274, "num_tokens": 23909442.0, "step": 13780 }, { "entropy": 5.5681853771209715, "epoch": 1.072515074888154, "grad_norm": 0.99609375, "learning_rate": 0.0004889328363145415, "loss": 5.1293, "mean_token_accuracy": 0.19386406540870665, "num_tokens": 23918143.0, "step": 13785 }, { "entropy": 5.580930900573731, "epoch": 1.0729041042598717, "grad_norm": 1.046875, "learning_rate": 0.0004889242493262859, "loss": 5.0733, "mean_token_accuracy": 0.1941058561205864, "num_tokens": 23926432.0, "step": 13790 }, { "entropy": 5.6241645336151125, "epoch": 1.0732931336315892, "grad_norm": 1.0703125, "learning_rate": 0.0004889156590920704, "loss": 5.2217, "mean_token_accuracy": 0.17931180894374849, "num_tokens": 23935362.0, "step": 13795 }, { "entropy": 5.488368797302246, "epoch": 1.0736821630033067, "grad_norm": 1.0546875, "learning_rate": 0.0004889070656120253, "loss": 4.9684, "mean_token_accuracy": 0.198727485537529, "num_tokens": 23943926.0, "step": 13800 }, { "entropy": 5.5760266304016115, "epoch": 1.0740711923750244, "grad_norm": 1.0390625, "learning_rate": 0.0004888984688862809, "loss": 5.135, "mean_token_accuracy": 0.1842544123530388, "num_tokens": 23952513.0, "step": 13805 }, { "entropy": 5.537561082839966, "epoch": 1.0744602217467418, "grad_norm": 1.1015625, "learning_rate": 0.0004888898689149677, "loss": 5.1714, "mean_token_accuracy": 0.18406044393777848, "num_tokens": 23961529.0, "step": 13810 }, { "entropy": 5.676672124862671, "epoch": 1.0748492511184595, "grad_norm": 1.046875, "learning_rate": 0.0004888812656982162, "loss": 5.19, "mean_token_accuracy": 0.18808944076299666, "num_tokens": 23971156.0, "step": 13815 }, { "entropy": 5.6050958156585695, "epoch": 1.075238280490177, "grad_norm": 0.99609375, "learning_rate": 0.0004888726592361569, "loss": 5.1075, "mean_token_accuracy": 0.18496610671281816, "num_tokens": 23979676.0, "step": 13820 }, { "entropy": 5.5462747573852536, "epoch": 1.0756273098618945, "grad_norm": 1.1015625, "learning_rate": 0.0004888640495289204, "loss": 5.0621, "mean_token_accuracy": 0.19622142910957335, "num_tokens": 23987764.0, "step": 13825 }, { "entropy": 5.562421226501465, "epoch": 1.0760163392336122, "grad_norm": 1.015625, "learning_rate": 0.0004888554365766374, "loss": 5.108, "mean_token_accuracy": 0.18574558049440384, "num_tokens": 23995844.0, "step": 13830 }, { "entropy": 5.608630514144897, "epoch": 1.0764053686053296, "grad_norm": 1.09375, "learning_rate": 0.0004888468203794385, "loss": 5.1845, "mean_token_accuracy": 0.18551842570304872, "num_tokens": 24003824.0, "step": 13835 }, { "entropy": 5.561627149581909, "epoch": 1.0767943979770473, "grad_norm": 1.0703125, "learning_rate": 0.0004888382009374545, "loss": 5.1338, "mean_token_accuracy": 0.1885688602924347, "num_tokens": 24012471.0, "step": 13840 }, { "entropy": 5.571304273605347, "epoch": 1.0771834273487648, "grad_norm": 1.0390625, "learning_rate": 0.0004888295782508161, "loss": 5.0982, "mean_token_accuracy": 0.1925314575433731, "num_tokens": 24021344.0, "step": 13845 }, { "entropy": 5.529728031158447, "epoch": 1.0775724567204823, "grad_norm": 1.15625, "learning_rate": 0.0004888209523196542, "loss": 5.0805, "mean_token_accuracy": 0.19462160766124725, "num_tokens": 24029598.0, "step": 13850 }, { "entropy": 5.506401872634887, "epoch": 1.0779614860922, "grad_norm": 0.99609375, "learning_rate": 0.0004888123231440997, "loss": 5.1042, "mean_token_accuracy": 0.19367956668138503, "num_tokens": 24038097.0, "step": 13855 }, { "entropy": 5.55786166191101, "epoch": 1.0783505154639175, "grad_norm": 1.0546875, "learning_rate": 0.0004888036907242834, "loss": 5.1556, "mean_token_accuracy": 0.19234763830900192, "num_tokens": 24046812.0, "step": 13860 }, { "entropy": 5.597179555892945, "epoch": 1.0787395448356352, "grad_norm": 1.109375, "learning_rate": 0.0004887950550603366, "loss": 5.1237, "mean_token_accuracy": 0.18817501217126847, "num_tokens": 24054908.0, "step": 13865 }, { "entropy": 5.503034448623657, "epoch": 1.0791285742073526, "grad_norm": 1.0, "learning_rate": 0.0004887864161523901, "loss": 5.1082, "mean_token_accuracy": 0.19433763027191162, "num_tokens": 24063695.0, "step": 13870 }, { "entropy": 5.530128383636475, "epoch": 1.0795176035790701, "grad_norm": 1.09375, "learning_rate": 0.0004887777740005749, "loss": 5.1087, "mean_token_accuracy": 0.19398031383752823, "num_tokens": 24072481.0, "step": 13875 }, { "entropy": 5.5003636360168455, "epoch": 1.0799066329507878, "grad_norm": 1.0546875, "learning_rate": 0.0004887691286050224, "loss": 5.1208, "mean_token_accuracy": 0.194350366294384, "num_tokens": 24080751.0, "step": 13880 }, { "entropy": 5.544689130783081, "epoch": 1.0802956623225053, "grad_norm": 1.109375, "learning_rate": 0.0004887604799658635, "loss": 5.0922, "mean_token_accuracy": 0.19087753295898438, "num_tokens": 24088618.0, "step": 13885 }, { "entropy": 5.578266620635986, "epoch": 1.080684691694223, "grad_norm": 1.03125, "learning_rate": 0.0004887518280832295, "loss": 5.1842, "mean_token_accuracy": 0.1857525885105133, "num_tokens": 24096754.0, "step": 13890 }, { "entropy": 5.551661491394043, "epoch": 1.0810737210659405, "grad_norm": 1.09375, "learning_rate": 0.0004887431729572519, "loss": 5.1186, "mean_token_accuracy": 0.1966030180454254, "num_tokens": 24104793.0, "step": 13895 }, { "entropy": 5.707340955734253, "epoch": 1.081462750437658, "grad_norm": 1.0234375, "learning_rate": 0.0004887345145880617, "loss": 5.2533, "mean_token_accuracy": 0.17408431321382523, "num_tokens": 24113816.0, "step": 13900 }, { "entropy": 5.557224750518799, "epoch": 1.0818517798093756, "grad_norm": 0.92578125, "learning_rate": 0.0004887258529757904, "loss": 5.0394, "mean_token_accuracy": 0.19136426597833633, "num_tokens": 24123002.0, "step": 13905 }, { "entropy": 5.581175184249878, "epoch": 1.082240809181093, "grad_norm": 1.109375, "learning_rate": 0.0004887171881205696, "loss": 5.0965, "mean_token_accuracy": 0.1916172832250595, "num_tokens": 24130841.0, "step": 13910 }, { "entropy": 5.579694938659668, "epoch": 1.0826298385528108, "grad_norm": 1.046875, "learning_rate": 0.0004887085200225306, "loss": 5.1689, "mean_token_accuracy": 0.1794822633266449, "num_tokens": 24139236.0, "step": 13915 }, { "entropy": 5.5275708675384525, "epoch": 1.0830188679245283, "grad_norm": 1.0625, "learning_rate": 0.0004886998486818049, "loss": 5.027, "mean_token_accuracy": 0.19782494753599167, "num_tokens": 24147824.0, "step": 13920 }, { "entropy": 5.553222513198852, "epoch": 1.083407897296246, "grad_norm": 1.03125, "learning_rate": 0.0004886911740985242, "loss": 5.1548, "mean_token_accuracy": 0.1861773267388344, "num_tokens": 24156555.0, "step": 13925 }, { "entropy": 5.620675897598266, "epoch": 1.0837969266679635, "grad_norm": 1.1171875, "learning_rate": 0.00048868249627282, "loss": 5.0816, "mean_token_accuracy": 0.19274846464395523, "num_tokens": 24164424.0, "step": 13930 }, { "entropy": 5.591138029098511, "epoch": 1.084185956039681, "grad_norm": 0.96484375, "learning_rate": 0.000488673815204824, "loss": 5.1033, "mean_token_accuracy": 0.19383617043495177, "num_tokens": 24173325.0, "step": 13935 }, { "entropy": 5.611918878555298, "epoch": 1.0845749854113986, "grad_norm": 1.09375, "learning_rate": 0.0004886651308946681, "loss": 5.2591, "mean_token_accuracy": 0.18532256484031678, "num_tokens": 24181781.0, "step": 13940 }, { "entropy": 5.58632264137268, "epoch": 1.084964014783116, "grad_norm": 0.99609375, "learning_rate": 0.0004886564433424839, "loss": 5.0742, "mean_token_accuracy": 0.18997456282377242, "num_tokens": 24190065.0, "step": 13945 }, { "entropy": 5.585769128799439, "epoch": 1.0853530441548336, "grad_norm": 1.046875, "learning_rate": 0.0004886477525484032, "loss": 5.212, "mean_token_accuracy": 0.17957908660173416, "num_tokens": 24198814.0, "step": 13950 }, { "entropy": 5.560888624191284, "epoch": 1.0857420735265513, "grad_norm": 1.0546875, "learning_rate": 0.0004886390585125579, "loss": 5.0894, "mean_token_accuracy": 0.18675375282764434, "num_tokens": 24208008.0, "step": 13955 }, { "entropy": 5.625029468536377, "epoch": 1.0861311028982688, "grad_norm": 1.0546875, "learning_rate": 0.0004886303612350799, "loss": 5.0937, "mean_token_accuracy": 0.1943022146821022, "num_tokens": 24216098.0, "step": 13960 }, { "entropy": 5.485174608230591, "epoch": 1.0865201322699864, "grad_norm": 1.0703125, "learning_rate": 0.0004886216607161013, "loss": 5.0299, "mean_token_accuracy": 0.19588403701782225, "num_tokens": 24224943.0, "step": 13965 }, { "entropy": 5.528639411926269, "epoch": 1.086909161641704, "grad_norm": 1.0703125, "learning_rate": 0.0004886129569557538, "loss": 5.0989, "mean_token_accuracy": 0.18515908420085908, "num_tokens": 24232950.0, "step": 13970 }, { "entropy": 5.625828123092651, "epoch": 1.0872981910134216, "grad_norm": 1.078125, "learning_rate": 0.0004886042499541699, "loss": 5.2439, "mean_token_accuracy": 0.1840382382273674, "num_tokens": 24242355.0, "step": 13975 }, { "entropy": 5.56804723739624, "epoch": 1.087687220385139, "grad_norm": 1.03125, "learning_rate": 0.0004885955397114813, "loss": 5.0947, "mean_token_accuracy": 0.1971299722790718, "num_tokens": 24251247.0, "step": 13980 }, { "entropy": 5.551373243331909, "epoch": 1.0880762497568566, "grad_norm": 1.03125, "learning_rate": 0.0004885868262278205, "loss": 5.1746, "mean_token_accuracy": 0.18218241333961488, "num_tokens": 24260281.0, "step": 13985 }, { "entropy": 5.621750020980835, "epoch": 1.0884652791285743, "grad_norm": 1.09375, "learning_rate": 0.0004885781095033195, "loss": 5.1733, "mean_token_accuracy": 0.18397517502307892, "num_tokens": 24268474.0, "step": 13990 }, { "entropy": 5.635916090011596, "epoch": 1.0888543085002917, "grad_norm": 1.0703125, "learning_rate": 0.0004885693895381108, "loss": 5.1351, "mean_token_accuracy": 0.19216557443141938, "num_tokens": 24276897.0, "step": 13995 }, { "entropy": 5.551297521591186, "epoch": 1.0892433378720092, "grad_norm": 1.1015625, "learning_rate": 0.0004885606663323263, "loss": 5.122, "mean_token_accuracy": 0.1863850697875023, "num_tokens": 24285892.0, "step": 14000 }, { "entropy": 5.537345504760742, "epoch": 1.089632367243727, "grad_norm": 1.1015625, "learning_rate": 0.0004885519398860987, "loss": 5.1681, "mean_token_accuracy": 0.18805530667304993, "num_tokens": 24294141.0, "step": 14005 }, { "entropy": 5.517060804367065, "epoch": 1.0900213966154444, "grad_norm": 1.0546875, "learning_rate": 0.0004885432101995604, "loss": 5.062, "mean_token_accuracy": 0.19237542003393174, "num_tokens": 24302803.0, "step": 14010 }, { "entropy": 5.67067322731018, "epoch": 1.090410425987162, "grad_norm": 1.09375, "learning_rate": 0.0004885344772728436, "loss": 5.2398, "mean_token_accuracy": 0.18113906681537628, "num_tokens": 24311755.0, "step": 14015 }, { "entropy": 5.579156446456909, "epoch": 1.0907994553588796, "grad_norm": 1.1171875, "learning_rate": 0.0004885257411060812, "loss": 5.0567, "mean_token_accuracy": 0.1981242999434471, "num_tokens": 24320913.0, "step": 14020 }, { "entropy": 5.614050960540771, "epoch": 1.0911884847305973, "grad_norm": 1.03125, "learning_rate": 0.0004885170016994053, "loss": 5.2668, "mean_token_accuracy": 0.17813585549592972, "num_tokens": 24331112.0, "step": 14025 }, { "entropy": 5.5172981262207035, "epoch": 1.0915775141023147, "grad_norm": 1.1015625, "learning_rate": 0.0004885082590529489, "loss": 5.0573, "mean_token_accuracy": 0.19136620163917542, "num_tokens": 24339286.0, "step": 14030 }, { "entropy": 5.529982995986939, "epoch": 1.0919665434740322, "grad_norm": 1.09375, "learning_rate": 0.0004884995131668445, "loss": 5.074, "mean_token_accuracy": 0.18799741417169571, "num_tokens": 24347787.0, "step": 14035 }, { "entropy": 5.553857660293579, "epoch": 1.09235557284575, "grad_norm": 1.125, "learning_rate": 0.0004884907640412248, "loss": 5.0428, "mean_token_accuracy": 0.195489402115345, "num_tokens": 24356340.0, "step": 14040 }, { "entropy": 5.5461619853973385, "epoch": 1.0927446022174674, "grad_norm": 1.046875, "learning_rate": 0.0004884820116762225, "loss": 5.1257, "mean_token_accuracy": 0.18353502899408342, "num_tokens": 24365182.0, "step": 14045 }, { "entropy": 5.62374062538147, "epoch": 1.093133631589185, "grad_norm": 1.1171875, "learning_rate": 0.0004884732560719706, "loss": 5.1581, "mean_token_accuracy": 0.1798996075987816, "num_tokens": 24373455.0, "step": 14050 }, { "entropy": 5.601822280883789, "epoch": 1.0935226609609026, "grad_norm": 1.0078125, "learning_rate": 0.0004884644972286017, "loss": 5.2276, "mean_token_accuracy": 0.18316431790590287, "num_tokens": 24382433.0, "step": 14055 }, { "entropy": 5.547022914886474, "epoch": 1.09391169033262, "grad_norm": 1.0859375, "learning_rate": 0.0004884557351462488, "loss": 5.0565, "mean_token_accuracy": 0.19143435209989548, "num_tokens": 24390971.0, "step": 14060 }, { "entropy": 5.612474679946899, "epoch": 1.0943007197043377, "grad_norm": 1.0703125, "learning_rate": 0.0004884469698250449, "loss": 5.1079, "mean_token_accuracy": 0.18284114748239516, "num_tokens": 24399508.0, "step": 14065 }, { "entropy": 5.532827472686767, "epoch": 1.0946897490760552, "grad_norm": 1.0078125, "learning_rate": 0.000488438201265123, "loss": 5.051, "mean_token_accuracy": 0.19327640384435654, "num_tokens": 24408424.0, "step": 14070 }, { "entropy": 5.491205787658691, "epoch": 1.095078778447773, "grad_norm": 1.0234375, "learning_rate": 0.0004884294294666161, "loss": 5.1679, "mean_token_accuracy": 0.18431971073150635, "num_tokens": 24416918.0, "step": 14075 }, { "entropy": 5.537044429779053, "epoch": 1.0954678078194904, "grad_norm": 1.0703125, "learning_rate": 0.0004884206544296573, "loss": 5.0223, "mean_token_accuracy": 0.19488463699817657, "num_tokens": 24425779.0, "step": 14080 }, { "entropy": 5.506648254394531, "epoch": 1.0958568371912079, "grad_norm": 1.03125, "learning_rate": 0.0004884118761543797, "loss": 5.0387, "mean_token_accuracy": 0.18994079381227494, "num_tokens": 24434567.0, "step": 14085 }, { "entropy": 5.549871635437012, "epoch": 1.0962458665629256, "grad_norm": 1.046875, "learning_rate": 0.0004884030946409167, "loss": 5.1301, "mean_token_accuracy": 0.18966175019741058, "num_tokens": 24442980.0, "step": 14090 }, { "entropy": 5.537383699417115, "epoch": 1.096634895934643, "grad_norm": 1.0390625, "learning_rate": 0.0004883943098894013, "loss": 5.059, "mean_token_accuracy": 0.18882790356874465, "num_tokens": 24452273.0, "step": 14095 }, { "entropy": 5.616352272033692, "epoch": 1.0970239253063607, "grad_norm": 1.0703125, "learning_rate": 0.000488385521899967, "loss": 5.1594, "mean_token_accuracy": 0.19060663729906083, "num_tokens": 24461854.0, "step": 14100 }, { "entropy": 5.616894388198853, "epoch": 1.0974129546780782, "grad_norm": 1.0625, "learning_rate": 0.000488376730672747, "loss": 5.2052, "mean_token_accuracy": 0.1858152389526367, "num_tokens": 24470468.0, "step": 14105 }, { "entropy": 5.534484910964966, "epoch": 1.0978019840497957, "grad_norm": 1.109375, "learning_rate": 0.0004883679362078746, "loss": 5.0745, "mean_token_accuracy": 0.19345633685588837, "num_tokens": 24479282.0, "step": 14110 }, { "entropy": 5.629233884811401, "epoch": 1.0981910134215134, "grad_norm": 1.140625, "learning_rate": 0.0004883591385054836, "loss": 5.1488, "mean_token_accuracy": 0.19297229498624802, "num_tokens": 24487331.0, "step": 14115 }, { "entropy": 5.605197095870972, "epoch": 1.0985800427932308, "grad_norm": 1.03125, "learning_rate": 0.0004883503375657072, "loss": 5.0553, "mean_token_accuracy": 0.19714493453502654, "num_tokens": 24496101.0, "step": 14120 }, { "entropy": 5.623606109619141, "epoch": 1.0989690721649485, "grad_norm": 1.0234375, "learning_rate": 0.0004883415333886789, "loss": 5.154, "mean_token_accuracy": 0.1851455107331276, "num_tokens": 24504321.0, "step": 14125 }, { "entropy": 5.566852378845215, "epoch": 1.099358101536666, "grad_norm": 1.0390625, "learning_rate": 0.0004883327259745325, "loss": 5.054, "mean_token_accuracy": 0.19597918838262557, "num_tokens": 24511887.0, "step": 14130 }, { "entropy": 5.549468278884888, "epoch": 1.0997471309083835, "grad_norm": 1.0859375, "learning_rate": 0.0004883239153234015, "loss": 5.0602, "mean_token_accuracy": 0.1902603030204773, "num_tokens": 24521188.0, "step": 14135 }, { "entropy": 5.576074504852295, "epoch": 1.1001361602801012, "grad_norm": 1.0390625, "learning_rate": 0.0004883151014354197, "loss": 5.0593, "mean_token_accuracy": 0.19443640857934952, "num_tokens": 24530656.0, "step": 14140 }, { "entropy": 5.494708251953125, "epoch": 1.1005251896518187, "grad_norm": 1.0390625, "learning_rate": 0.0004883062843107207, "loss": 5.0538, "mean_token_accuracy": 0.18540543913841248, "num_tokens": 24539438.0, "step": 14145 }, { "entropy": 5.562297916412353, "epoch": 1.1009142190235364, "grad_norm": 1.1171875, "learning_rate": 0.0004882974639494383, "loss": 5.1366, "mean_token_accuracy": 0.1859801784157753, "num_tokens": 24548005.0, "step": 14150 }, { "entropy": 5.628852224349975, "epoch": 1.1013032483952538, "grad_norm": 1.1484375, "learning_rate": 0.0004882886403517065, "loss": 5.1877, "mean_token_accuracy": 0.18561447858810426, "num_tokens": 24556507.0, "step": 14155 }, { "entropy": 5.534324502944946, "epoch": 1.1016922777669713, "grad_norm": 1.03125, "learning_rate": 0.0004882798135176589, "loss": 5.1231, "mean_token_accuracy": 0.19144049137830735, "num_tokens": 24565228.0, "step": 14160 }, { "entropy": 5.533432674407959, "epoch": 1.102081307138689, "grad_norm": 1.015625, "learning_rate": 0.00048827098344742973, "loss": 5.0794, "mean_token_accuracy": 0.1909134492278099, "num_tokens": 24573977.0, "step": 14165 }, { "entropy": 5.512648105621338, "epoch": 1.1024703365104065, "grad_norm": 1.078125, "learning_rate": 0.0004882621501411528, "loss": 5.02, "mean_token_accuracy": 0.1979286938905716, "num_tokens": 24582897.0, "step": 14170 }, { "entropy": 5.532407331466675, "epoch": 1.1028593658821242, "grad_norm": 1.0234375, "learning_rate": 0.0004882533135989622, "loss": 5.031, "mean_token_accuracy": 0.19007385969161988, "num_tokens": 24591132.0, "step": 14175 }, { "entropy": 5.494268703460693, "epoch": 1.1032483952538417, "grad_norm": 1.09375, "learning_rate": 0.000488244473820992, "loss": 5.0741, "mean_token_accuracy": 0.19256412535905837, "num_tokens": 24600111.0, "step": 14180 }, { "entropy": 5.511301851272583, "epoch": 1.1036374246255591, "grad_norm": 1.03125, "learning_rate": 0.00048823563080737634, "loss": 5.1113, "mean_token_accuracy": 0.19070682376623155, "num_tokens": 24609229.0, "step": 14185 }, { "entropy": 5.547101640701294, "epoch": 1.1040264539972768, "grad_norm": 1.0546875, "learning_rate": 0.0004882267845582493, "loss": 5.0289, "mean_token_accuracy": 0.19263579696416855, "num_tokens": 24618012.0, "step": 14190 }, { "entropy": 5.555389785766602, "epoch": 1.1044154833689943, "grad_norm": 1.0546875, "learning_rate": 0.00048821793507374526, "loss": 5.0968, "mean_token_accuracy": 0.1878509536385536, "num_tokens": 24626801.0, "step": 14195 }, { "entropy": 5.610468816757202, "epoch": 1.104804512740712, "grad_norm": 1.1015625, "learning_rate": 0.0004882090823539984, "loss": 5.1662, "mean_token_accuracy": 0.1899107202887535, "num_tokens": 24635365.0, "step": 14200 }, { "entropy": 5.546853160858154, "epoch": 1.1051935421124295, "grad_norm": 1.09375, "learning_rate": 0.0004882002263991431, "loss": 5.0937, "mean_token_accuracy": 0.1900238573551178, "num_tokens": 24643745.0, "step": 14205 }, { "entropy": 5.497986125946045, "epoch": 1.105582571484147, "grad_norm": 1.0078125, "learning_rate": 0.00048819136720931364, "loss": 5.0049, "mean_token_accuracy": 0.18967562168836594, "num_tokens": 24652760.0, "step": 14210 }, { "entropy": 5.535041666030883, "epoch": 1.1059716008558647, "grad_norm": 1.1015625, "learning_rate": 0.00048818250478464457, "loss": 5.1166, "mean_token_accuracy": 0.19113752394914627, "num_tokens": 24661326.0, "step": 14215 }, { "entropy": 5.569070148468017, "epoch": 1.1063606302275821, "grad_norm": 1.0703125, "learning_rate": 0.0004881736391252703, "loss": 5.0152, "mean_token_accuracy": 0.2029775857925415, "num_tokens": 24669611.0, "step": 14220 }, { "entropy": 5.584267473220825, "epoch": 1.1067496595992998, "grad_norm": 1.0546875, "learning_rate": 0.0004881647702313253, "loss": 5.1536, "mean_token_accuracy": 0.1834797292947769, "num_tokens": 24677780.0, "step": 14225 }, { "entropy": 5.50883297920227, "epoch": 1.1071386889710173, "grad_norm": 1.0078125, "learning_rate": 0.00048815589810294427, "loss": 5.0188, "mean_token_accuracy": 0.1955699771642685, "num_tokens": 24685807.0, "step": 14230 }, { "entropy": 5.543837785720825, "epoch": 1.1075277183427348, "grad_norm": 1.0, "learning_rate": 0.00048814702274026174, "loss": 5.0901, "mean_token_accuracy": 0.1868273437023163, "num_tokens": 24694383.0, "step": 14235 }, { "entropy": 5.51952052116394, "epoch": 1.1079167477144525, "grad_norm": 1.1015625, "learning_rate": 0.0004881381441434124, "loss": 5.0359, "mean_token_accuracy": 0.19846682846546174, "num_tokens": 24702325.0, "step": 14240 }, { "entropy": 5.617363166809082, "epoch": 1.10830577708617, "grad_norm": 1.0390625, "learning_rate": 0.000488129262312531, "loss": 5.0643, "mean_token_accuracy": 0.19092031121253966, "num_tokens": 24710725.0, "step": 14245 }, { "entropy": 5.570712566375732, "epoch": 1.1086948064578876, "grad_norm": 1.1875, "learning_rate": 0.00048812037724775217, "loss": 5.1146, "mean_token_accuracy": 0.19066088199615477, "num_tokens": 24720230.0, "step": 14250 }, { "entropy": 5.540719270706177, "epoch": 1.1090838358296051, "grad_norm": 1.078125, "learning_rate": 0.0004881114889492109, "loss": 5.0723, "mean_token_accuracy": 0.19068222045898436, "num_tokens": 24728896.0, "step": 14255 }, { "entropy": 5.617240476608276, "epoch": 1.1094728652013226, "grad_norm": 1.0234375, "learning_rate": 0.00048810259741704197, "loss": 5.1538, "mean_token_accuracy": 0.1849449783563614, "num_tokens": 24737731.0, "step": 14260 }, { "entropy": 5.559365606307983, "epoch": 1.1098618945730403, "grad_norm": 1.0, "learning_rate": 0.0004880937026513803, "loss": 5.0182, "mean_token_accuracy": 0.2024766504764557, "num_tokens": 24746335.0, "step": 14265 }, { "entropy": 5.525782108306885, "epoch": 1.1102509239447578, "grad_norm": 1.03125, "learning_rate": 0.0004880848046523609, "loss": 5.0314, "mean_token_accuracy": 0.19644611775875093, "num_tokens": 24755917.0, "step": 14270 }, { "entropy": 5.5859959602355955, "epoch": 1.1106399533164755, "grad_norm": 1.0625, "learning_rate": 0.00048807590342011875, "loss": 5.1782, "mean_token_accuracy": 0.18299742490053178, "num_tokens": 24764713.0, "step": 14275 }, { "entropy": 5.661219358444214, "epoch": 1.111028982688193, "grad_norm": 1.0859375, "learning_rate": 0.00048806699895478895, "loss": 5.2017, "mean_token_accuracy": 0.18422999680042268, "num_tokens": 24773464.0, "step": 14280 }, { "entropy": 5.59569935798645, "epoch": 1.1114180120599104, "grad_norm": 1.0625, "learning_rate": 0.0004880580912565065, "loss": 5.1056, "mean_token_accuracy": 0.19189320802688598, "num_tokens": 24781437.0, "step": 14285 }, { "entropy": 5.471013593673706, "epoch": 1.1118070414316281, "grad_norm": 1.1484375, "learning_rate": 0.0004880491803254067, "loss": 4.9623, "mean_token_accuracy": 0.20401892960071563, "num_tokens": 24789505.0, "step": 14290 }, { "entropy": 5.582314920425415, "epoch": 1.1121960708033456, "grad_norm": 1.0546875, "learning_rate": 0.0004880402661616246, "loss": 5.1777, "mean_token_accuracy": 0.18516246229410172, "num_tokens": 24798492.0, "step": 14295 }, { "entropy": 5.582237386703492, "epoch": 1.1125851001750633, "grad_norm": 1.0390625, "learning_rate": 0.0004880313487652956, "loss": 5.1427, "mean_token_accuracy": 0.18301793336868286, "num_tokens": 24807472.0, "step": 14300 }, { "entropy": 5.621257877349853, "epoch": 1.1129741295467808, "grad_norm": 1.0625, "learning_rate": 0.00048802242813655503, "loss": 5.1447, "mean_token_accuracy": 0.1889468625187874, "num_tokens": 24815838.0, "step": 14305 }, { "entropy": 5.535931158065796, "epoch": 1.1133631589184985, "grad_norm": 1.1328125, "learning_rate": 0.000488013504275538, "loss": 5.0308, "mean_token_accuracy": 0.20103780925273895, "num_tokens": 24823953.0, "step": 14310 }, { "entropy": 5.493774938583374, "epoch": 1.113752188290216, "grad_norm": 1.0546875, "learning_rate": 0.0004880045771823802, "loss": 4.9757, "mean_token_accuracy": 0.20277907103300094, "num_tokens": 24832414.0, "step": 14315 }, { "entropy": 5.5106306076049805, "epoch": 1.1141412176619334, "grad_norm": 1.09375, "learning_rate": 0.00048799564685721695, "loss": 5.105, "mean_token_accuracy": 0.19672067314386368, "num_tokens": 24840503.0, "step": 14320 }, { "entropy": 5.58501615524292, "epoch": 1.1145302470336511, "grad_norm": 1.1171875, "learning_rate": 0.0004879867133001837, "loss": 5.2269, "mean_token_accuracy": 0.1800301879644394, "num_tokens": 24849272.0, "step": 14325 }, { "entropy": 5.645293569564819, "epoch": 1.1149192764053686, "grad_norm": 1.203125, "learning_rate": 0.0004879777765114162, "loss": 5.1811, "mean_token_accuracy": 0.18523346483707429, "num_tokens": 24858565.0, "step": 14330 }, { "entropy": 5.595496988296508, "epoch": 1.115308305777086, "grad_norm": 1.0546875, "learning_rate": 0.00048796883649104996, "loss": 5.1225, "mean_token_accuracy": 0.19080182015895844, "num_tokens": 24867811.0, "step": 14335 }, { "entropy": 5.551525211334228, "epoch": 1.1156973351488038, "grad_norm": 1.015625, "learning_rate": 0.0004879598932392206, "loss": 5.1684, "mean_token_accuracy": 0.18083980083465576, "num_tokens": 24876776.0, "step": 14340 }, { "entropy": 5.563112735748291, "epoch": 1.1160863645205212, "grad_norm": 1.0, "learning_rate": 0.00048795094675606364, "loss": 5.0618, "mean_token_accuracy": 0.19113542437553405, "num_tokens": 24885030.0, "step": 14345 }, { "entropy": 5.628605318069458, "epoch": 1.116475393892239, "grad_norm": 1.03125, "learning_rate": 0.0004879419970417152, "loss": 5.2177, "mean_token_accuracy": 0.18255677670240403, "num_tokens": 24894336.0, "step": 14350 }, { "entropy": 5.632161855697632, "epoch": 1.1168644232639564, "grad_norm": 0.984375, "learning_rate": 0.00048793304409631077, "loss": 5.1768, "mean_token_accuracy": 0.1853221356868744, "num_tokens": 24903107.0, "step": 14355 }, { "entropy": 5.688526201248169, "epoch": 1.117253452635674, "grad_norm": 1.0, "learning_rate": 0.0004879240879199863, "loss": 5.2455, "mean_token_accuracy": 0.18908555656671525, "num_tokens": 24912727.0, "step": 14360 }, { "entropy": 5.521405267715454, "epoch": 1.1176424820073916, "grad_norm": 1.046875, "learning_rate": 0.00048791512851287786, "loss": 5.0194, "mean_token_accuracy": 0.192735193669796, "num_tokens": 24921534.0, "step": 14365 }, { "entropy": 5.5539459705352785, "epoch": 1.118031511379109, "grad_norm": 1.0703125, "learning_rate": 0.00048790616587512107, "loss": 5.1014, "mean_token_accuracy": 0.18986730128526688, "num_tokens": 24930093.0, "step": 14370 }, { "entropy": 5.610888242721558, "epoch": 1.1184205407508268, "grad_norm": 1.1171875, "learning_rate": 0.0004878972000068521, "loss": 5.1886, "mean_token_accuracy": 0.19122879803180695, "num_tokens": 24939230.0, "step": 14375 }, { "entropy": 5.621839952468872, "epoch": 1.1188095701225442, "grad_norm": 0.9921875, "learning_rate": 0.00048788823090820707, "loss": 5.2321, "mean_token_accuracy": 0.19314769208431243, "num_tokens": 24947595.0, "step": 14380 }, { "entropy": 5.619896697998047, "epoch": 1.1191985994942617, "grad_norm": 1.0546875, "learning_rate": 0.00048787925857932194, "loss": 5.1861, "mean_token_accuracy": 0.18565509021282195, "num_tokens": 24957099.0, "step": 14385 }, { "entropy": 5.55630464553833, "epoch": 1.1195876288659794, "grad_norm": 1.078125, "learning_rate": 0.00048787028302033287, "loss": 5.0709, "mean_token_accuracy": 0.18945772796869279, "num_tokens": 24965701.0, "step": 14390 }, { "entropy": 5.638362216949463, "epoch": 1.1199766582376969, "grad_norm": 1.140625, "learning_rate": 0.00048786130423137606, "loss": 5.1916, "mean_token_accuracy": 0.1828547954559326, "num_tokens": 24974025.0, "step": 14395 }, { "entropy": 5.664219856262207, "epoch": 1.1203656876094146, "grad_norm": 0.98046875, "learning_rate": 0.0004878523222125879, "loss": 5.2263, "mean_token_accuracy": 0.18391305655241014, "num_tokens": 24982930.0, "step": 14400 }, { "entropy": 5.615021991729736, "epoch": 1.120754716981132, "grad_norm": 1.0234375, "learning_rate": 0.0004878433369641044, "loss": 5.0937, "mean_token_accuracy": 0.1945231392979622, "num_tokens": 24991332.0, "step": 14405 }, { "entropy": 5.56526026725769, "epoch": 1.1211437463528497, "grad_norm": 1.0234375, "learning_rate": 0.0004878343484860621, "loss": 5.0918, "mean_token_accuracy": 0.19387697875499726, "num_tokens": 25000130.0, "step": 14410 }, { "entropy": 5.546545886993409, "epoch": 1.1215327757245672, "grad_norm": 1.0078125, "learning_rate": 0.0004878253567785972, "loss": 5.108, "mean_token_accuracy": 0.19131711423397063, "num_tokens": 25008423.0, "step": 14415 }, { "entropy": 5.634926509857178, "epoch": 1.1219218050962847, "grad_norm": 1.109375, "learning_rate": 0.00048781636184184644, "loss": 5.1681, "mean_token_accuracy": 0.18848209381103515, "num_tokens": 25017399.0, "step": 14420 }, { "entropy": 5.649090909957886, "epoch": 1.1223108344680024, "grad_norm": 1.03125, "learning_rate": 0.000487807363675946, "loss": 5.1544, "mean_token_accuracy": 0.1925899416208267, "num_tokens": 25025957.0, "step": 14425 }, { "entropy": 5.600171184539795, "epoch": 1.1226998638397199, "grad_norm": 1.0625, "learning_rate": 0.0004877983622810326, "loss": 5.0783, "mean_token_accuracy": 0.19370086640119552, "num_tokens": 25034246.0, "step": 14430 }, { "entropy": 5.523709964752197, "epoch": 1.1230888932114376, "grad_norm": 1.0859375, "learning_rate": 0.0004877893576572427, "loss": 5.083, "mean_token_accuracy": 0.19385031163692473, "num_tokens": 25042461.0, "step": 14435 }, { "entropy": 5.569584846496582, "epoch": 1.123477922583155, "grad_norm": 1.03125, "learning_rate": 0.000487780349804713, "loss": 5.0519, "mean_token_accuracy": 0.19904048144817352, "num_tokens": 25051291.0, "step": 14440 }, { "entropy": 5.587459659576416, "epoch": 1.1238669519548725, "grad_norm": 1.09375, "learning_rate": 0.0004877713387235802, "loss": 5.1772, "mean_token_accuracy": 0.18640127629041672, "num_tokens": 25060538.0, "step": 14445 }, { "entropy": 5.608622407913208, "epoch": 1.1242559813265902, "grad_norm": 1.1796875, "learning_rate": 0.000487762324413981, "loss": 5.1562, "mean_token_accuracy": 0.18106972724199294, "num_tokens": 25068965.0, "step": 14450 }, { "entropy": 5.610302543640136, "epoch": 1.1246450106983077, "grad_norm": 1.0546875, "learning_rate": 0.00048775330687605213, "loss": 5.1423, "mean_token_accuracy": 0.18641403913497925, "num_tokens": 25077021.0, "step": 14455 }, { "entropy": 5.569644498825073, "epoch": 1.1250340400700254, "grad_norm": 1.0703125, "learning_rate": 0.0004877442861099305, "loss": 5.1383, "mean_token_accuracy": 0.19138455837965013, "num_tokens": 25086009.0, "step": 14460 }, { "entropy": 5.501922464370727, "epoch": 1.1254230694417429, "grad_norm": 1.03125, "learning_rate": 0.0004877352621157529, "loss": 5.06, "mean_token_accuracy": 0.1943339228630066, "num_tokens": 25094745.0, "step": 14465 }, { "entropy": 5.564437532424927, "epoch": 1.1258120988134603, "grad_norm": 1.0859375, "learning_rate": 0.00048772623489365635, "loss": 5.0715, "mean_token_accuracy": 0.18664079457521437, "num_tokens": 25103087.0, "step": 14470 }, { "entropy": 5.6123435497283936, "epoch": 1.126201128185178, "grad_norm": 1.046875, "learning_rate": 0.0004877172044437777, "loss": 5.1098, "mean_token_accuracy": 0.18710518032312393, "num_tokens": 25111822.0, "step": 14475 }, { "entropy": 5.572814893722534, "epoch": 1.1265901575568955, "grad_norm": 1.078125, "learning_rate": 0.00048770817076625416, "loss": 5.0947, "mean_token_accuracy": 0.19054839611053467, "num_tokens": 25119975.0, "step": 14480 }, { "entropy": 5.5661180973052975, "epoch": 1.126979186928613, "grad_norm": 1.1171875, "learning_rate": 0.00048769913386122253, "loss": 5.1575, "mean_token_accuracy": 0.18483465164899826, "num_tokens": 25129031.0, "step": 14485 }, { "entropy": 5.5998358726501465, "epoch": 1.1273682163003307, "grad_norm": 0.984375, "learning_rate": 0.0004876900937288202, "loss": 5.0812, "mean_token_accuracy": 0.1930053025484085, "num_tokens": 25138230.0, "step": 14490 }, { "entropy": 5.630468511581421, "epoch": 1.1277572456720482, "grad_norm": 1.015625, "learning_rate": 0.00048768105036918426, "loss": 5.1217, "mean_token_accuracy": 0.18948798328638078, "num_tokens": 25147120.0, "step": 14495 }, { "entropy": 5.574945020675659, "epoch": 1.1281462750437659, "grad_norm": 1.046875, "learning_rate": 0.00048767200378245187, "loss": 5.1208, "mean_token_accuracy": 0.1898228719830513, "num_tokens": 25155623.0, "step": 14500 }, { "entropy": 5.4905647277832035, "epoch": 1.1285353044154833, "grad_norm": 1.0234375, "learning_rate": 0.00048766295396876025, "loss": 5.0076, "mean_token_accuracy": 0.19737488478422166, "num_tokens": 25163867.0, "step": 14505 }, { "entropy": 5.560219097137451, "epoch": 1.128924333787201, "grad_norm": 1.09375, "learning_rate": 0.00048765390092824683, "loss": 5.1268, "mean_token_accuracy": 0.19247578084468842, "num_tokens": 25172838.0, "step": 14510 }, { "entropy": 5.551562786102295, "epoch": 1.1293133631589185, "grad_norm": 1.0546875, "learning_rate": 0.000487644844661049, "loss": 5.0555, "mean_token_accuracy": 0.19907177835702897, "num_tokens": 25181168.0, "step": 14515 }, { "entropy": 5.569566059112549, "epoch": 1.129702392530636, "grad_norm": 1.1015625, "learning_rate": 0.000487635785167304, "loss": 5.1521, "mean_token_accuracy": 0.1940109983086586, "num_tokens": 25190115.0, "step": 14520 }, { "entropy": 5.578721714019776, "epoch": 1.1300914219023537, "grad_norm": 1.0859375, "learning_rate": 0.00048762672244714953, "loss": 5.1406, "mean_token_accuracy": 0.19143279492855073, "num_tokens": 25199594.0, "step": 14525 }, { "entropy": 5.60958251953125, "epoch": 1.1304804512740712, "grad_norm": 1.046875, "learning_rate": 0.0004876176565007229, "loss": 5.1136, "mean_token_accuracy": 0.1821112722158432, "num_tokens": 25208060.0, "step": 14530 }, { "entropy": 5.574132633209229, "epoch": 1.1308694806457888, "grad_norm": 1.0, "learning_rate": 0.00048760858732816174, "loss": 5.0652, "mean_token_accuracy": 0.18881643563508987, "num_tokens": 25216257.0, "step": 14535 }, { "entropy": 5.541465616226196, "epoch": 1.1312585100175063, "grad_norm": 1.171875, "learning_rate": 0.0004875995149296037, "loss": 5.087, "mean_token_accuracy": 0.18855876475572586, "num_tokens": 25225032.0, "step": 14540 }, { "entropy": 5.584880208969116, "epoch": 1.1316475393892238, "grad_norm": 1.078125, "learning_rate": 0.0004875904393051864, "loss": 5.1337, "mean_token_accuracy": 0.19188373386859894, "num_tokens": 25233624.0, "step": 14545 }, { "entropy": 5.533587455749512, "epoch": 1.1320365687609415, "grad_norm": 1.0546875, "learning_rate": 0.0004875813604550476, "loss": 5.1012, "mean_token_accuracy": 0.18869900852441787, "num_tokens": 25242132.0, "step": 14550 }, { "entropy": 5.584107303619385, "epoch": 1.132425598132659, "grad_norm": 1.109375, "learning_rate": 0.00048757227837932494, "loss": 5.0851, "mean_token_accuracy": 0.19440909922122956, "num_tokens": 25250923.0, "step": 14555 }, { "entropy": 5.575410795211792, "epoch": 1.1328146275043767, "grad_norm": 1.0234375, "learning_rate": 0.0004875631930781563, "loss": 5.098, "mean_token_accuracy": 0.18965144455432892, "num_tokens": 25259783.0, "step": 14560 }, { "entropy": 5.655840301513672, "epoch": 1.1332036568760941, "grad_norm": 1.0, "learning_rate": 0.00048755410455167967, "loss": 5.286, "mean_token_accuracy": 0.1829624816775322, "num_tokens": 25268801.0, "step": 14565 }, { "entropy": 5.567112684249878, "epoch": 1.1335926862478116, "grad_norm": 1.0, "learning_rate": 0.0004875450128000326, "loss": 5.0975, "mean_token_accuracy": 0.20123474895954133, "num_tokens": 25277226.0, "step": 14570 }, { "entropy": 5.580487775802612, "epoch": 1.1339817156195293, "grad_norm": 0.9765625, "learning_rate": 0.0004875359178233534, "loss": 5.1523, "mean_token_accuracy": 0.182919679582119, "num_tokens": 25285887.0, "step": 14575 }, { "entropy": 5.517343759536743, "epoch": 1.1343707449912468, "grad_norm": 1.1015625, "learning_rate": 0.00048752681962177985, "loss": 5.0093, "mean_token_accuracy": 0.19050014466047288, "num_tokens": 25294025.0, "step": 14580 }, { "entropy": 5.6035301208496096, "epoch": 1.1347597743629645, "grad_norm": 1.0859375, "learning_rate": 0.00048751771819545013, "loss": 5.2135, "mean_token_accuracy": 0.18079658150672911, "num_tokens": 25303016.0, "step": 14585 }, { "entropy": 5.54065465927124, "epoch": 1.135148803734682, "grad_norm": 1.0390625, "learning_rate": 0.00048750861354450236, "loss": 5.0172, "mean_token_accuracy": 0.19706076085567475, "num_tokens": 25311193.0, "step": 14590 }, { "entropy": 5.550218296051026, "epoch": 1.1355378331063994, "grad_norm": 1.1015625, "learning_rate": 0.0004874995056690746, "loss": 5.0666, "mean_token_accuracy": 0.19193121343851088, "num_tokens": 25319380.0, "step": 14595 }, { "entropy": 5.535642480850219, "epoch": 1.1359268624781171, "grad_norm": 1.09375, "learning_rate": 0.000487490394569305, "loss": 5.08, "mean_token_accuracy": 0.19244492948055267, "num_tokens": 25327854.0, "step": 14600 }, { "entropy": 5.582655620574951, "epoch": 1.1363158918498346, "grad_norm": 1.109375, "learning_rate": 0.0004874812802453319, "loss": 5.1514, "mean_token_accuracy": 0.18457458466291427, "num_tokens": 25335912.0, "step": 14605 }, { "entropy": 5.563676929473877, "epoch": 1.1367049212215523, "grad_norm": 1.09375, "learning_rate": 0.0004874721626972936, "loss": 5.1668, "mean_token_accuracy": 0.19149231761693955, "num_tokens": 25344104.0, "step": 14610 }, { "entropy": 5.452754831314087, "epoch": 1.1370939505932698, "grad_norm": 1.0234375, "learning_rate": 0.0004874630419253284, "loss": 4.9252, "mean_token_accuracy": 0.20484225004911422, "num_tokens": 25352583.0, "step": 14615 }, { "entropy": 5.541375732421875, "epoch": 1.1374829799649873, "grad_norm": 0.9765625, "learning_rate": 0.00048745391792957474, "loss": 5.0434, "mean_token_accuracy": 0.19370035380125045, "num_tokens": 25361035.0, "step": 14620 }, { "entropy": 5.563179588317871, "epoch": 1.137872009336705, "grad_norm": 1.046875, "learning_rate": 0.00048744479071017097, "loss": 5.0871, "mean_token_accuracy": 0.18786347210407256, "num_tokens": 25369511.0, "step": 14625 }, { "entropy": 5.586024761199951, "epoch": 1.1382610387084224, "grad_norm": 1.0234375, "learning_rate": 0.0004874356602672556, "loss": 5.0854, "mean_token_accuracy": 0.1938834547996521, "num_tokens": 25378023.0, "step": 14630 }, { "entropy": 5.580712842941284, "epoch": 1.1386500680801401, "grad_norm": 0.96875, "learning_rate": 0.0004874265266009673, "loss": 5.117, "mean_token_accuracy": 0.19111802577972412, "num_tokens": 25386791.0, "step": 14635 }, { "entropy": 5.606944227218628, "epoch": 1.1390390974518576, "grad_norm": 1.0859375, "learning_rate": 0.0004874173897114445, "loss": 5.1464, "mean_token_accuracy": 0.18752903640270233, "num_tokens": 25395401.0, "step": 14640 }, { "entropy": 5.575720643997192, "epoch": 1.1394281268235753, "grad_norm": 1.015625, "learning_rate": 0.00048740824959882603, "loss": 5.1135, "mean_token_accuracy": 0.18792559206485748, "num_tokens": 25404193.0, "step": 14645 }, { "entropy": 5.639514636993408, "epoch": 1.1398171561952928, "grad_norm": 1.09375, "learning_rate": 0.0004873991062632504, "loss": 5.1714, "mean_token_accuracy": 0.18551381379365922, "num_tokens": 25413073.0, "step": 14650 }, { "entropy": 5.546651935577392, "epoch": 1.1402061855670103, "grad_norm": 1.09375, "learning_rate": 0.00048738995970485635, "loss": 5.0803, "mean_token_accuracy": 0.19260105192661287, "num_tokens": 25422064.0, "step": 14655 }, { "entropy": 5.52317624092102, "epoch": 1.140595214938728, "grad_norm": 1.21875, "learning_rate": 0.0004873808099237827, "loss": 5.0614, "mean_token_accuracy": 0.19399910420179367, "num_tokens": 25430711.0, "step": 14660 }, { "entropy": 5.608675146102906, "epoch": 1.1409842443104454, "grad_norm": 1.1640625, "learning_rate": 0.0004873716569201684, "loss": 5.1719, "mean_token_accuracy": 0.1873139202594757, "num_tokens": 25439527.0, "step": 14665 }, { "entropy": 5.634265327453614, "epoch": 1.141373273682163, "grad_norm": 1.1328125, "learning_rate": 0.00048736250069415213, "loss": 5.1565, "mean_token_accuracy": 0.18710326701402663, "num_tokens": 25448633.0, "step": 14670 }, { "entropy": 5.564380216598511, "epoch": 1.1417623030538806, "grad_norm": 1.0390625, "learning_rate": 0.0004873533412458729, "loss": 5.1007, "mean_token_accuracy": 0.19030878245830535, "num_tokens": 25457657.0, "step": 14675 }, { "entropy": 5.5843555450439455, "epoch": 1.142151332425598, "grad_norm": 1.0390625, "learning_rate": 0.00048734417857546986, "loss": 5.1574, "mean_token_accuracy": 0.18433075696229934, "num_tokens": 25466698.0, "step": 14680 }, { "entropy": 5.59642915725708, "epoch": 1.1425403617973158, "grad_norm": 1.109375, "learning_rate": 0.0004873350126830818, "loss": 5.1226, "mean_token_accuracy": 0.18787850588560104, "num_tokens": 25474921.0, "step": 14685 }, { "entropy": 5.551491212844849, "epoch": 1.1429293911690332, "grad_norm": 1.078125, "learning_rate": 0.0004873258435688479, "loss": 5.02, "mean_token_accuracy": 0.19826652556657792, "num_tokens": 25483553.0, "step": 14690 }, { "entropy": 5.591440629959107, "epoch": 1.143318420540751, "grad_norm": 1.0078125, "learning_rate": 0.0004873166712329073, "loss": 5.0939, "mean_token_accuracy": 0.19593354761600495, "num_tokens": 25492408.0, "step": 14695 }, { "entropy": 5.541330003738404, "epoch": 1.1437074499124684, "grad_norm": 1.078125, "learning_rate": 0.00048730749567539914, "loss": 5.1244, "mean_token_accuracy": 0.18857344835996628, "num_tokens": 25501404.0, "step": 14700 }, { "entropy": 5.667981386184692, "epoch": 1.144096479284186, "grad_norm": 1.09375, "learning_rate": 0.00048729831689646257, "loss": 5.1248, "mean_token_accuracy": 0.18747548907995223, "num_tokens": 25510176.0, "step": 14705 }, { "entropy": 5.521900749206543, "epoch": 1.1444855086559036, "grad_norm": 1.03125, "learning_rate": 0.00048728913489623705, "loss": 5.041, "mean_token_accuracy": 0.19366063326597213, "num_tokens": 25518809.0, "step": 14710 }, { "entropy": 5.551668262481689, "epoch": 1.144874538027621, "grad_norm": 1.0625, "learning_rate": 0.0004872799496748618, "loss": 5.1532, "mean_token_accuracy": 0.19095004498958587, "num_tokens": 25527415.0, "step": 14715 }, { "entropy": 5.5533545970916744, "epoch": 1.1452635673993385, "grad_norm": 1.15625, "learning_rate": 0.0004872707612324761, "loss": 5.1018, "mean_token_accuracy": 0.18428247421979904, "num_tokens": 25535618.0, "step": 14720 }, { "entropy": 5.580552387237549, "epoch": 1.1456525967710562, "grad_norm": 1.1171875, "learning_rate": 0.0004872615695692196, "loss": 5.0831, "mean_token_accuracy": 0.19384828060865403, "num_tokens": 25544228.0, "step": 14725 }, { "entropy": 5.616612195968628, "epoch": 1.1460416261427737, "grad_norm": 1.140625, "learning_rate": 0.0004872523746852315, "loss": 5.1458, "mean_token_accuracy": 0.1881529062986374, "num_tokens": 25553557.0, "step": 14730 }, { "entropy": 5.554841327667236, "epoch": 1.1464306555144914, "grad_norm": 1.0, "learning_rate": 0.00048724317658065146, "loss": 5.0768, "mean_token_accuracy": 0.1937004417181015, "num_tokens": 25562018.0, "step": 14735 }, { "entropy": 5.597393321990967, "epoch": 1.146819684886209, "grad_norm": 1.1640625, "learning_rate": 0.00048723397525561916, "loss": 5.1132, "mean_token_accuracy": 0.19164858311414718, "num_tokens": 25569382.0, "step": 14740 }, { "entropy": 5.48429045677185, "epoch": 1.1472087142579266, "grad_norm": 1.09375, "learning_rate": 0.00048722477071027394, "loss": 5.0543, "mean_token_accuracy": 0.1927467867732048, "num_tokens": 25578172.0, "step": 14745 }, { "entropy": 5.522347116470337, "epoch": 1.147597743629644, "grad_norm": 1.0703125, "learning_rate": 0.00048721556294475574, "loss": 5.0996, "mean_token_accuracy": 0.18739671856164933, "num_tokens": 25587572.0, "step": 14750 }, { "entropy": 5.575719165802002, "epoch": 1.1479867730013615, "grad_norm": 1.09375, "learning_rate": 0.00048720635195920403, "loss": 5.1471, "mean_token_accuracy": 0.19230797588825227, "num_tokens": 25596609.0, "step": 14755 }, { "entropy": 5.567278146743774, "epoch": 1.1483758023730792, "grad_norm": 1.1484375, "learning_rate": 0.0004871971377537588, "loss": 5.1423, "mean_token_accuracy": 0.18543420732021332, "num_tokens": 25605707.0, "step": 14760 }, { "entropy": 5.57260684967041, "epoch": 1.1487648317447967, "grad_norm": 1.1171875, "learning_rate": 0.0004871879203285597, "loss": 5.1156, "mean_token_accuracy": 0.19459976702928544, "num_tokens": 25614218.0, "step": 14765 }, { "entropy": 5.5321691036224365, "epoch": 1.1491538611165142, "grad_norm": 1.0390625, "learning_rate": 0.00048717869968374655, "loss": 5.0297, "mean_token_accuracy": 0.1946216568350792, "num_tokens": 25622613.0, "step": 14770 }, { "entropy": 5.664019012451172, "epoch": 1.1495428904882319, "grad_norm": 1.09375, "learning_rate": 0.00048716947581945954, "loss": 5.1729, "mean_token_accuracy": 0.19284721463918686, "num_tokens": 25631396.0, "step": 14775 }, { "entropy": 5.569239282608033, "epoch": 1.1499319198599494, "grad_norm": 0.9453125, "learning_rate": 0.0004871602487358383, "loss": 5.0749, "mean_token_accuracy": 0.1919866144657135, "num_tokens": 25640870.0, "step": 14780 }, { "entropy": 5.560152864456176, "epoch": 1.150320949231667, "grad_norm": 1.0703125, "learning_rate": 0.000487151018433023, "loss": 5.1432, "mean_token_accuracy": 0.18698510825634002, "num_tokens": 25649395.0, "step": 14785 }, { "entropy": 5.61124620437622, "epoch": 1.1507099786033845, "grad_norm": 1.078125, "learning_rate": 0.00048714178491115367, "loss": 5.2358, "mean_token_accuracy": 0.1810119032859802, "num_tokens": 25659087.0, "step": 14790 }, { "entropy": 5.641227674484253, "epoch": 1.1510990079751022, "grad_norm": 1.0859375, "learning_rate": 0.00048713254817037046, "loss": 5.1564, "mean_token_accuracy": 0.1962727501988411, "num_tokens": 25667847.0, "step": 14795 }, { "entropy": 5.6062705516815186, "epoch": 1.1514880373468197, "grad_norm": 1.0625, "learning_rate": 0.0004871233082108135, "loss": 5.106, "mean_token_accuracy": 0.19782232046127318, "num_tokens": 25676786.0, "step": 14800 }, { "entropy": 5.605106401443481, "epoch": 1.1518770667185372, "grad_norm": 1.2734375, "learning_rate": 0.0004871140650326228, "loss": 5.1476, "mean_token_accuracy": 0.1856660410761833, "num_tokens": 25685223.0, "step": 14805 }, { "entropy": 5.559368562698364, "epoch": 1.1522660960902549, "grad_norm": 1.078125, "learning_rate": 0.0004871048186359389, "loss": 5.1032, "mean_token_accuracy": 0.18552485704421998, "num_tokens": 25694243.0, "step": 14810 }, { "entropy": 5.5484109878540036, "epoch": 1.1526551254619724, "grad_norm": 1.0625, "learning_rate": 0.000487095569020902, "loss": 4.9898, "mean_token_accuracy": 0.19948240220546723, "num_tokens": 25702735.0, "step": 14815 }, { "entropy": 5.526841926574707, "epoch": 1.1530441548336898, "grad_norm": 1.109375, "learning_rate": 0.0004870863161876524, "loss": 5.0639, "mean_token_accuracy": 0.19685641378164292, "num_tokens": 25711577.0, "step": 14820 }, { "entropy": 5.489689493179322, "epoch": 1.1534331842054075, "grad_norm": 1.09375, "learning_rate": 0.0004870770601363305, "loss": 4.9949, "mean_token_accuracy": 0.20101726055145264, "num_tokens": 25719927.0, "step": 14825 }, { "entropy": 5.541572952270508, "epoch": 1.153822213577125, "grad_norm": 1.1484375, "learning_rate": 0.00048706780086707675, "loss": 5.0797, "mean_token_accuracy": 0.19204696416854858, "num_tokens": 25728144.0, "step": 14830 }, { "entropy": 5.552884578704834, "epoch": 1.1542112429488427, "grad_norm": 1.125, "learning_rate": 0.0004870585383800317, "loss": 5.0184, "mean_token_accuracy": 0.19972701370716095, "num_tokens": 25736736.0, "step": 14835 }, { "entropy": 5.6133159637451175, "epoch": 1.1546002723205602, "grad_norm": 1.1015625, "learning_rate": 0.00048704927267533585, "loss": 5.1934, "mean_token_accuracy": 0.19172807186841964, "num_tokens": 25745031.0, "step": 14840 }, { "entropy": 5.633868312835693, "epoch": 1.1549893016922779, "grad_norm": 1.0234375, "learning_rate": 0.00048704000375312975, "loss": 5.1924, "mean_token_accuracy": 0.19258706420660018, "num_tokens": 25754265.0, "step": 14845 }, { "entropy": 5.642695093154908, "epoch": 1.1553783310639953, "grad_norm": 1.1328125, "learning_rate": 0.00048703073161355414, "loss": 5.177, "mean_token_accuracy": 0.17840857654809952, "num_tokens": 25763084.0, "step": 14850 }, { "entropy": 5.656079578399658, "epoch": 1.1557673604357128, "grad_norm": 1.109375, "learning_rate": 0.0004870214562567497, "loss": 5.1534, "mean_token_accuracy": 0.18367359340190886, "num_tokens": 25771626.0, "step": 14855 }, { "entropy": 5.564869213104248, "epoch": 1.1561563898074305, "grad_norm": 1.125, "learning_rate": 0.000487012177682857, "loss": 5.1143, "mean_token_accuracy": 0.18735800236463546, "num_tokens": 25780326.0, "step": 14860 }, { "entropy": 5.624983549118042, "epoch": 1.156545419179148, "grad_norm": 1.09375, "learning_rate": 0.0004870028958920171, "loss": 5.2342, "mean_token_accuracy": 0.1776147499680519, "num_tokens": 25789318.0, "step": 14865 }, { "entropy": 5.592816352844238, "epoch": 1.1569344485508655, "grad_norm": 1.0078125, "learning_rate": 0.0004869936108843706, "loss": 5.1929, "mean_token_accuracy": 0.18489024490118028, "num_tokens": 25798025.0, "step": 14870 }, { "entropy": 5.615821504592896, "epoch": 1.1573234779225832, "grad_norm": 1.0703125, "learning_rate": 0.00048698432266005854, "loss": 5.1002, "mean_token_accuracy": 0.19362777918577195, "num_tokens": 25806669.0, "step": 14875 }, { "entropy": 5.618700551986694, "epoch": 1.1577125072943006, "grad_norm": 1.0703125, "learning_rate": 0.0004869750312192217, "loss": 5.0887, "mean_token_accuracy": 0.19141381680965425, "num_tokens": 25815938.0, "step": 14880 }, { "entropy": 5.552509355545044, "epoch": 1.1581015366660183, "grad_norm": 1.0, "learning_rate": 0.00048696573656200123, "loss": 5.0467, "mean_token_accuracy": 0.19463123083114625, "num_tokens": 25824293.0, "step": 14885 }, { "entropy": 5.640071105957031, "epoch": 1.1584905660377358, "grad_norm": 1.1640625, "learning_rate": 0.00048695643868853806, "loss": 5.1488, "mean_token_accuracy": 0.18800119161605836, "num_tokens": 25833081.0, "step": 14890 }, { "entropy": 5.630659198760986, "epoch": 1.1588795954094535, "grad_norm": 1.0703125, "learning_rate": 0.0004869471375989733, "loss": 5.1858, "mean_token_accuracy": 0.18351871520280838, "num_tokens": 25841344.0, "step": 14895 }, { "entropy": 5.59793872833252, "epoch": 1.159268624781171, "grad_norm": 1.09375, "learning_rate": 0.0004869378332934481, "loss": 5.1557, "mean_token_accuracy": 0.18592580854892732, "num_tokens": 25850617.0, "step": 14900 }, { "entropy": 5.564720201492309, "epoch": 1.1596576541528885, "grad_norm": 1.078125, "learning_rate": 0.00048692852577210356, "loss": 5.1403, "mean_token_accuracy": 0.1918509930372238, "num_tokens": 25858569.0, "step": 14905 }, { "entropy": 5.53714919090271, "epoch": 1.1600466835246062, "grad_norm": 1.046875, "learning_rate": 0.000486919215035081, "loss": 5.1155, "mean_token_accuracy": 0.19092709422111512, "num_tokens": 25866892.0, "step": 14910 }, { "entropy": 5.631830263137817, "epoch": 1.1604357128963236, "grad_norm": 1.0546875, "learning_rate": 0.0004869099010825217, "loss": 5.1942, "mean_token_accuracy": 0.18311539739370347, "num_tokens": 25875661.0, "step": 14915 }, { "entropy": 5.524275255203247, "epoch": 1.1608247422680413, "grad_norm": 1.03125, "learning_rate": 0.00048690058391456684, "loss": 5.0049, "mean_token_accuracy": 0.20060795843601226, "num_tokens": 25884951.0, "step": 14920 }, { "entropy": 5.635675573348999, "epoch": 1.1612137716397588, "grad_norm": 1.078125, "learning_rate": 0.0004868912635313579, "loss": 5.2372, "mean_token_accuracy": 0.18609603941440583, "num_tokens": 25893652.0, "step": 14925 }, { "entropy": 5.639912080764771, "epoch": 1.1616028010114763, "grad_norm": 1.09375, "learning_rate": 0.0004868819399330364, "loss": 5.0547, "mean_token_accuracy": 0.19008962363004683, "num_tokens": 25902375.0, "step": 14930 }, { "entropy": 5.61219596862793, "epoch": 1.161991830383194, "grad_norm": 1.0, "learning_rate": 0.0004868726131197436, "loss": 5.0558, "mean_token_accuracy": 0.1957837834954262, "num_tokens": 25911322.0, "step": 14935 }, { "entropy": 5.620619106292724, "epoch": 1.1623808597549115, "grad_norm": 1.0390625, "learning_rate": 0.0004868632830916212, "loss": 5.1609, "mean_token_accuracy": 0.19244829267263414, "num_tokens": 25920444.0, "step": 14940 }, { "entropy": 5.567115926742554, "epoch": 1.1627698891266292, "grad_norm": 1.0390625, "learning_rate": 0.0004868539498488106, "loss": 5.1674, "mean_token_accuracy": 0.18978559076786042, "num_tokens": 25928986.0, "step": 14945 }, { "entropy": 5.591844654083252, "epoch": 1.1631589184983466, "grad_norm": 1.1484375, "learning_rate": 0.0004868446133914536, "loss": 5.1573, "mean_token_accuracy": 0.18468926697969437, "num_tokens": 25938209.0, "step": 14950 }, { "entropy": 5.637552547454834, "epoch": 1.163547947870064, "grad_norm": 1.0078125, "learning_rate": 0.00048683527371969185, "loss": 5.1772, "mean_token_accuracy": 0.1779983326792717, "num_tokens": 25946909.0, "step": 14955 }, { "entropy": 5.591159296035767, "epoch": 1.1639369772417818, "grad_norm": 1.03125, "learning_rate": 0.00048682593083366685, "loss": 5.2094, "mean_token_accuracy": 0.1895134285092354, "num_tokens": 25956154.0, "step": 14960 }, { "entropy": 5.592004442214966, "epoch": 1.1643260066134993, "grad_norm": 1.09375, "learning_rate": 0.00048681658473352055, "loss": 5.1077, "mean_token_accuracy": 0.19457264244556427, "num_tokens": 25964478.0, "step": 14965 }, { "entropy": 5.553935861587524, "epoch": 1.164715035985217, "grad_norm": 1.046875, "learning_rate": 0.0004868072354193947, "loss": 5.1047, "mean_token_accuracy": 0.18316972255706787, "num_tokens": 25973162.0, "step": 14970 }, { "entropy": 5.5709902286529545, "epoch": 1.1651040653569344, "grad_norm": 1.0625, "learning_rate": 0.0004867978828914312, "loss": 5.0624, "mean_token_accuracy": 0.1913768991827965, "num_tokens": 25982790.0, "step": 14975 }, { "entropy": 5.5766767978668215, "epoch": 1.165493094728652, "grad_norm": 1.078125, "learning_rate": 0.0004867885271497719, "loss": 5.0162, "mean_token_accuracy": 0.1961001604795456, "num_tokens": 25992111.0, "step": 14980 }, { "entropy": 5.630577659606933, "epoch": 1.1658821241003696, "grad_norm": 1.0234375, "learning_rate": 0.0004867791681945588, "loss": 5.1463, "mean_token_accuracy": 0.18628059178590775, "num_tokens": 26000803.0, "step": 14985 }, { "entropy": 5.654449033737182, "epoch": 1.166271153472087, "grad_norm": 1.0859375, "learning_rate": 0.00048676980602593395, "loss": 5.2573, "mean_token_accuracy": 0.18055839836597443, "num_tokens": 26010152.0, "step": 14990 }, { "entropy": 5.589032411575317, "epoch": 1.1666601828438048, "grad_norm": 1.1171875, "learning_rate": 0.00048676044064403936, "loss": 5.1552, "mean_token_accuracy": 0.18115283101797103, "num_tokens": 26019183.0, "step": 14995 }, { "entropy": 5.618133401870727, "epoch": 1.1670492122155223, "grad_norm": 1.125, "learning_rate": 0.0004867510720490171, "loss": 5.084, "mean_token_accuracy": 0.19277227520942689, "num_tokens": 26027459.0, "step": 15000 }, { "epoch": 1.1670492122155223, "eval_entropy": 5.38063917646509, "eval_loss": 5.199825763702393, "eval_mean_token_accuracy": 0.19610792320146367, "eval_num_tokens": 26027459.0, "eval_runtime": 21.6837, "eval_samples_per_second": 1916.558, "eval_steps_per_second": 239.581, "step": 15000 }, { "entropy": 5.6070170402526855, "epoch": 1.1674382415872397, "grad_norm": 1.109375, "learning_rate": 0.0004867417002410094, "loss": 5.153, "mean_token_accuracy": 0.18308807909488678, "num_tokens": 26036421.0, "step": 15005 }, { "entropy": 5.571762180328369, "epoch": 1.1678272709589574, "grad_norm": 1.0234375, "learning_rate": 0.00048673232522015845, "loss": 5.1572, "mean_token_accuracy": 0.1901620551943779, "num_tokens": 26044971.0, "step": 15010 }, { "entropy": 5.558289480209351, "epoch": 1.168216300330675, "grad_norm": 1.0625, "learning_rate": 0.0004867229469866064, "loss": 5.1052, "mean_token_accuracy": 0.18862562179565429, "num_tokens": 26053597.0, "step": 15015 }, { "entropy": 5.6364421367645265, "epoch": 1.1686053297023926, "grad_norm": 1.015625, "learning_rate": 0.0004867135655404956, "loss": 5.1571, "mean_token_accuracy": 0.1851444274187088, "num_tokens": 26061928.0, "step": 15020 }, { "entropy": 5.576354598999023, "epoch": 1.16899435907411, "grad_norm": 1.078125, "learning_rate": 0.00048670418088196844, "loss": 5.1127, "mean_token_accuracy": 0.19274311810731887, "num_tokens": 26070917.0, "step": 15025 }, { "entropy": 5.500616121292114, "epoch": 1.1693833884458276, "grad_norm": 1.0625, "learning_rate": 0.0004866947930111674, "loss": 5.0449, "mean_token_accuracy": 0.19592256247997283, "num_tokens": 26079556.0, "step": 15030 }, { "entropy": 5.5612077713012695, "epoch": 1.1697724178175453, "grad_norm": 1.1171875, "learning_rate": 0.00048668540192823467, "loss": 5.1433, "mean_token_accuracy": 0.1903790056705475, "num_tokens": 26087963.0, "step": 15035 }, { "entropy": 5.6055991649627686, "epoch": 1.1701614471892627, "grad_norm": 1.0625, "learning_rate": 0.000486676007633313, "loss": 5.084, "mean_token_accuracy": 0.19391100704669953, "num_tokens": 26096208.0, "step": 15040 }, { "entropy": 5.6063727855682375, "epoch": 1.1705504765609804, "grad_norm": 1.0234375, "learning_rate": 0.0004866666101265448, "loss": 5.1093, "mean_token_accuracy": 0.18813618272542953, "num_tokens": 26104961.0, "step": 15045 }, { "entropy": 5.5672554016113285, "epoch": 1.170939505932698, "grad_norm": 1.0078125, "learning_rate": 0.00048665720940807274, "loss": 5.1264, "mean_token_accuracy": 0.18212450444698333, "num_tokens": 26113889.0, "step": 15050 }, { "entropy": 5.521347856521606, "epoch": 1.1713285353044154, "grad_norm": 1.21875, "learning_rate": 0.00048664780547803935, "loss": 5.0879, "mean_token_accuracy": 0.19350726306438445, "num_tokens": 26122139.0, "step": 15055 }, { "entropy": 5.633164596557617, "epoch": 1.171717564676133, "grad_norm": 1.046875, "learning_rate": 0.0004866383983365873, "loss": 5.1458, "mean_token_accuracy": 0.19945055693387986, "num_tokens": 26130817.0, "step": 15060 }, { "entropy": 5.600032997131348, "epoch": 1.1721065940478506, "grad_norm": 0.9765625, "learning_rate": 0.00048662898798385956, "loss": 5.1501, "mean_token_accuracy": 0.19003477841615676, "num_tokens": 26140035.0, "step": 15065 }, { "entropy": 5.669366121292114, "epoch": 1.1724956234195683, "grad_norm": 1.0703125, "learning_rate": 0.00048661957441999875, "loss": 5.2063, "mean_token_accuracy": 0.18841926008462906, "num_tokens": 26149575.0, "step": 15070 }, { "entropy": 5.637383031845093, "epoch": 1.1728846527912857, "grad_norm": 1.0703125, "learning_rate": 0.00048661015764514765, "loss": 5.1419, "mean_token_accuracy": 0.19596780240535736, "num_tokens": 26158743.0, "step": 15075 }, { "entropy": 5.611569261550903, "epoch": 1.1732736821630034, "grad_norm": 1.09375, "learning_rate": 0.00048660073765944927, "loss": 5.1557, "mean_token_accuracy": 0.18850169628858565, "num_tokens": 26167380.0, "step": 15080 }, { "entropy": 5.4767015933990475, "epoch": 1.173662711534721, "grad_norm": 1.15625, "learning_rate": 0.0004865913144630465, "loss": 5.071, "mean_token_accuracy": 0.19493190497159957, "num_tokens": 26175613.0, "step": 15085 }, { "entropy": 5.618897724151611, "epoch": 1.1740517409064384, "grad_norm": 1.0859375, "learning_rate": 0.00048658188805608227, "loss": 5.1873, "mean_token_accuracy": 0.18750355243682862, "num_tokens": 26184347.0, "step": 15090 }, { "entropy": 5.597576522827149, "epoch": 1.174440770278156, "grad_norm": 0.9921875, "learning_rate": 0.0004865724584386998, "loss": 5.1111, "mean_token_accuracy": 0.19106998145580292, "num_tokens": 26193513.0, "step": 15095 }, { "entropy": 5.611871528625488, "epoch": 1.1748297996498736, "grad_norm": 1.109375, "learning_rate": 0.0004865630256110418, "loss": 5.1127, "mean_token_accuracy": 0.18844806253910065, "num_tokens": 26202790.0, "step": 15100 }, { "entropy": 5.544135904312133, "epoch": 1.175218829021591, "grad_norm": 1.0078125, "learning_rate": 0.00048655358957325174, "loss": 5.0763, "mean_token_accuracy": 0.19279582798480988, "num_tokens": 26211032.0, "step": 15105 }, { "entropy": 5.50651330947876, "epoch": 1.1756078583933087, "grad_norm": 1.0546875, "learning_rate": 0.00048654415032547277, "loss": 5.0169, "mean_token_accuracy": 0.19430835843086242, "num_tokens": 26219963.0, "step": 15110 }, { "entropy": 5.617864322662354, "epoch": 1.1759968877650262, "grad_norm": 1.0546875, "learning_rate": 0.00048653470786784794, "loss": 5.0614, "mean_token_accuracy": 0.1897891029715538, "num_tokens": 26228164.0, "step": 15115 }, { "entropy": 5.569379043579102, "epoch": 1.176385917136744, "grad_norm": 1.03125, "learning_rate": 0.0004865252622005206, "loss": 5.0896, "mean_token_accuracy": 0.19182399213314055, "num_tokens": 26236294.0, "step": 15120 }, { "entropy": 5.516499376296997, "epoch": 1.1767749465084614, "grad_norm": 1.078125, "learning_rate": 0.00048651581332363405, "loss": 5.0441, "mean_token_accuracy": 0.19946387708187102, "num_tokens": 26244955.0, "step": 15125 }, { "entropy": 5.5880265712738035, "epoch": 1.177163975880179, "grad_norm": 1.0234375, "learning_rate": 0.00048650636123733176, "loss": 5.1306, "mean_token_accuracy": 0.18992896676063536, "num_tokens": 26253221.0, "step": 15130 }, { "entropy": 5.627907800674438, "epoch": 1.1775530052518965, "grad_norm": 1.046875, "learning_rate": 0.0004864969059417571, "loss": 5.2193, "mean_token_accuracy": 0.17644216865301132, "num_tokens": 26262544.0, "step": 15135 }, { "entropy": 5.611646747589111, "epoch": 1.177942034623614, "grad_norm": 1.0390625, "learning_rate": 0.0004864874474370534, "loss": 5.1093, "mean_token_accuracy": 0.19003526717424393, "num_tokens": 26271864.0, "step": 15140 }, { "entropy": 5.655444192886352, "epoch": 1.1783310639953317, "grad_norm": 1.0625, "learning_rate": 0.00048647798572336445, "loss": 5.1658, "mean_token_accuracy": 0.18868221789598466, "num_tokens": 26279713.0, "step": 15145 }, { "entropy": 5.545048809051513, "epoch": 1.1787200933670492, "grad_norm": 1.0625, "learning_rate": 0.00048646852080083355, "loss": 4.9951, "mean_token_accuracy": 0.20163817703723907, "num_tokens": 26288654.0, "step": 15150 }, { "entropy": 5.581171369552612, "epoch": 1.1791091227387667, "grad_norm": 1.109375, "learning_rate": 0.0004864590526696045, "loss": 5.1769, "mean_token_accuracy": 0.18162493258714676, "num_tokens": 26297007.0, "step": 15155 }, { "entropy": 5.5863746166229244, "epoch": 1.1794981521104844, "grad_norm": 1.1015625, "learning_rate": 0.00048644958132982094, "loss": 5.1028, "mean_token_accuracy": 0.19216720908880233, "num_tokens": 26305601.0, "step": 15160 }, { "entropy": 5.618317174911499, "epoch": 1.1798871814822018, "grad_norm": 1.1640625, "learning_rate": 0.00048644010678162644, "loss": 5.1424, "mean_token_accuracy": 0.1963210791349411, "num_tokens": 26313455.0, "step": 15165 }, { "entropy": 5.6111854076385494, "epoch": 1.1802762108539195, "grad_norm": 1.078125, "learning_rate": 0.0004864306290251649, "loss": 5.1522, "mean_token_accuracy": 0.188117116689682, "num_tokens": 26322450.0, "step": 15170 }, { "entropy": 5.63731575012207, "epoch": 1.180665240225637, "grad_norm": 1.03125, "learning_rate": 0.00048642114806058014, "loss": 5.1653, "mean_token_accuracy": 0.1797630086541176, "num_tokens": 26331301.0, "step": 15175 }, { "entropy": 5.722377347946167, "epoch": 1.1810542695973547, "grad_norm": 1.0703125, "learning_rate": 0.0004864116638880159, "loss": 5.248, "mean_token_accuracy": 0.18856421262025833, "num_tokens": 26339937.0, "step": 15180 }, { "entropy": 5.626636075973511, "epoch": 1.1814432989690722, "grad_norm": 1.03125, "learning_rate": 0.0004864021765076162, "loss": 5.1145, "mean_token_accuracy": 0.19093227237462998, "num_tokens": 26348541.0, "step": 15185 }, { "entropy": 5.558046579360962, "epoch": 1.1818323283407897, "grad_norm": 1.1015625, "learning_rate": 0.00048639268591952494, "loss": 5.0793, "mean_token_accuracy": 0.19542826861143112, "num_tokens": 26356621.0, "step": 15190 }, { "entropy": 5.613065147399903, "epoch": 1.1822213577125074, "grad_norm": 0.96875, "learning_rate": 0.00048638319212388614, "loss": 5.1801, "mean_token_accuracy": 0.18269234746694565, "num_tokens": 26366112.0, "step": 15195 }, { "entropy": 5.665078783035279, "epoch": 1.1826103870842248, "grad_norm": 1.0625, "learning_rate": 0.0004863736951208438, "loss": 5.1534, "mean_token_accuracy": 0.18836449235677719, "num_tokens": 26374768.0, "step": 15200 }, { "entropy": 5.597625112533569, "epoch": 1.1829994164559423, "grad_norm": 1.109375, "learning_rate": 0.00048636419491054217, "loss": 5.1359, "mean_token_accuracy": 0.1941370978951454, "num_tokens": 26383097.0, "step": 15205 }, { "entropy": 5.6053431034088135, "epoch": 1.18338844582766, "grad_norm": 1.0625, "learning_rate": 0.0004863546914931252, "loss": 5.1141, "mean_token_accuracy": 0.1876509353518486, "num_tokens": 26391361.0, "step": 15210 }, { "entropy": 5.5784852504730225, "epoch": 1.1837774751993775, "grad_norm": 1.0078125, "learning_rate": 0.0004863451848687373, "loss": 5.0642, "mean_token_accuracy": 0.1935330033302307, "num_tokens": 26400818.0, "step": 15215 }, { "entropy": 5.60666708946228, "epoch": 1.1841665045710952, "grad_norm": 1.1015625, "learning_rate": 0.00048633567503752253, "loss": 5.1392, "mean_token_accuracy": 0.1896408572793007, "num_tokens": 26409650.0, "step": 15220 }, { "entropy": 5.5267926216125485, "epoch": 1.1845555339428127, "grad_norm": 1.078125, "learning_rate": 0.0004863261619996253, "loss": 5.0136, "mean_token_accuracy": 0.19559521079063416, "num_tokens": 26418237.0, "step": 15225 }, { "entropy": 5.470397090911865, "epoch": 1.1849445633145304, "grad_norm": 1.046875, "learning_rate": 0.0004863166457551899, "loss": 4.9812, "mean_token_accuracy": 0.20518125891685485, "num_tokens": 26426366.0, "step": 15230 }, { "entropy": 5.4904931545257565, "epoch": 1.1853335926862478, "grad_norm": 1.0390625, "learning_rate": 0.0004863071263043608, "loss": 5.0764, "mean_token_accuracy": 0.18565648496150972, "num_tokens": 26435603.0, "step": 15235 }, { "entropy": 5.609816455841065, "epoch": 1.1857226220579653, "grad_norm": 1.0703125, "learning_rate": 0.0004862976036472823, "loss": 5.1902, "mean_token_accuracy": 0.18635938614606856, "num_tokens": 26444230.0, "step": 15240 }, { "entropy": 5.592506742477417, "epoch": 1.186111651429683, "grad_norm": 1.0859375, "learning_rate": 0.00048628807778409907, "loss": 5.0532, "mean_token_accuracy": 0.18922004848718643, "num_tokens": 26452779.0, "step": 15245 }, { "entropy": 5.605657768249512, "epoch": 1.1865006808014005, "grad_norm": 1.1015625, "learning_rate": 0.0004862785487149555, "loss": 5.2057, "mean_token_accuracy": 0.18610675036907195, "num_tokens": 26461977.0, "step": 15250 }, { "entropy": 5.576980113983154, "epoch": 1.186889710173118, "grad_norm": 1.0859375, "learning_rate": 0.0004862690164399963, "loss": 5.0114, "mean_token_accuracy": 0.19747587144374848, "num_tokens": 26470182.0, "step": 15255 }, { "entropy": 5.629970455169678, "epoch": 1.1872787395448356, "grad_norm": 1.0703125, "learning_rate": 0.00048625948095936593, "loss": 5.2197, "mean_token_accuracy": 0.18533240109682084, "num_tokens": 26479445.0, "step": 15260 }, { "entropy": 5.594922065734863, "epoch": 1.1876677689165531, "grad_norm": 0.99609375, "learning_rate": 0.00048624994227320923, "loss": 5.0857, "mean_token_accuracy": 0.19384056627750396, "num_tokens": 26488085.0, "step": 15265 }, { "entropy": 5.6941886901855465, "epoch": 1.1880567982882708, "grad_norm": 1.078125, "learning_rate": 0.00048624040038167094, "loss": 5.2301, "mean_token_accuracy": 0.18443275094032288, "num_tokens": 26496849.0, "step": 15270 }, { "entropy": 5.56822657585144, "epoch": 1.1884458276599883, "grad_norm": 1.046875, "learning_rate": 0.00048623085528489584, "loss": 5.0957, "mean_token_accuracy": 0.19489249885082244, "num_tokens": 26505412.0, "step": 15275 }, { "entropy": 5.5129741668701175, "epoch": 1.188834857031706, "grad_norm": 1.109375, "learning_rate": 0.00048622130698302863, "loss": 5.0667, "mean_token_accuracy": 0.1912377417087555, "num_tokens": 26513564.0, "step": 15280 }, { "entropy": 5.533912181854248, "epoch": 1.1892238864034235, "grad_norm": 1.0390625, "learning_rate": 0.00048621175547621426, "loss": 5.0909, "mean_token_accuracy": 0.18857007175683976, "num_tokens": 26522230.0, "step": 15285 }, { "entropy": 5.56089072227478, "epoch": 1.189612915775141, "grad_norm": 1.015625, "learning_rate": 0.0004862022007645978, "loss": 5.0803, "mean_token_accuracy": 0.19006049931049346, "num_tokens": 26531719.0, "step": 15290 }, { "entropy": 5.511069583892822, "epoch": 1.1900019451468586, "grad_norm": 1.0078125, "learning_rate": 0.00048619264284832403, "loss": 5.0378, "mean_token_accuracy": 0.20560531914234162, "num_tokens": 26540352.0, "step": 15295 }, { "entropy": 5.583624649047851, "epoch": 1.1903909745185761, "grad_norm": 1.1796875, "learning_rate": 0.00048618308172753804, "loss": 5.0254, "mean_token_accuracy": 0.1968090355396271, "num_tokens": 26548252.0, "step": 15300 }, { "entropy": 5.596045255661011, "epoch": 1.1907800038902936, "grad_norm": 1.09375, "learning_rate": 0.0004861735174023849, "loss": 5.0925, "mean_token_accuracy": 0.1928489938378334, "num_tokens": 26557267.0, "step": 15305 }, { "entropy": 5.607676887512207, "epoch": 1.1911690332620113, "grad_norm": 1.0703125, "learning_rate": 0.00048616394987300985, "loss": 5.2073, "mean_token_accuracy": 0.18672688454389572, "num_tokens": 26566221.0, "step": 15310 }, { "entropy": 5.597143888473511, "epoch": 1.1915580626337288, "grad_norm": 1.015625, "learning_rate": 0.0004861543791395579, "loss": 5.2152, "mean_token_accuracy": 0.18726943284273148, "num_tokens": 26574826.0, "step": 15315 }, { "entropy": 5.59898796081543, "epoch": 1.1919470920054465, "grad_norm": 1.015625, "learning_rate": 0.0004861448052021743, "loss": 5.1869, "mean_token_accuracy": 0.179260778427124, "num_tokens": 26583442.0, "step": 15320 }, { "entropy": 5.639116430282593, "epoch": 1.192336121377164, "grad_norm": 1.1640625, "learning_rate": 0.0004861352280610044, "loss": 5.127, "mean_token_accuracy": 0.19415039718151092, "num_tokens": 26592106.0, "step": 15325 }, { "entropy": 5.587483024597168, "epoch": 1.1927251507488816, "grad_norm": 1.0625, "learning_rate": 0.00048612564771619346, "loss": 5.0137, "mean_token_accuracy": 0.19882869422435762, "num_tokens": 26601275.0, "step": 15330 }, { "entropy": 5.475168609619141, "epoch": 1.193114180120599, "grad_norm": 1.078125, "learning_rate": 0.00048611606416788686, "loss": 4.9694, "mean_token_accuracy": 0.19517303258180618, "num_tokens": 26610179.0, "step": 15335 }, { "entropy": 5.545497083663941, "epoch": 1.1935032094923166, "grad_norm": 1.03125, "learning_rate": 0.00048610647741622996, "loss": 5.1411, "mean_token_accuracy": 0.18698107302188874, "num_tokens": 26619463.0, "step": 15340 }, { "entropy": 5.551906251907349, "epoch": 1.1938922388640343, "grad_norm": 1.0546875, "learning_rate": 0.0004860968874613683, "loss": 4.985, "mean_token_accuracy": 0.20008267164230348, "num_tokens": 26627597.0, "step": 15345 }, { "entropy": 5.566534519195557, "epoch": 1.1942812682357518, "grad_norm": 1.1640625, "learning_rate": 0.0004860872943034474, "loss": 5.0884, "mean_token_accuracy": 0.19655673056840897, "num_tokens": 26636180.0, "step": 15350 }, { "entropy": 5.571224308013916, "epoch": 1.1946702976074695, "grad_norm": 1.09375, "learning_rate": 0.0004860776979426128, "loss": 5.0286, "mean_token_accuracy": 0.19708898961544036, "num_tokens": 26644803.0, "step": 15355 }, { "entropy": 5.5151488304138185, "epoch": 1.195059326979187, "grad_norm": 1.0390625, "learning_rate": 0.0004860680983790101, "loss": 5.0747, "mean_token_accuracy": 0.18061135560274125, "num_tokens": 26653619.0, "step": 15360 }, { "entropy": 5.598951387405395, "epoch": 1.1954483563509044, "grad_norm": 1.09375, "learning_rate": 0.0004860584956127849, "loss": 5.0944, "mean_token_accuracy": 0.1840843752026558, "num_tokens": 26662291.0, "step": 15365 }, { "entropy": 5.610071134567261, "epoch": 1.195837385722622, "grad_norm": 1.015625, "learning_rate": 0.00048604888964408306, "loss": 5.0501, "mean_token_accuracy": 0.20193059146404266, "num_tokens": 26670592.0, "step": 15370 }, { "entropy": 5.564420509338379, "epoch": 1.1962264150943396, "grad_norm": 1.0859375, "learning_rate": 0.0004860392804730502, "loss": 5.1194, "mean_token_accuracy": 0.19373519122600555, "num_tokens": 26679816.0, "step": 15375 }, { "entropy": 5.608189535140991, "epoch": 1.1966154444660573, "grad_norm": 1.140625, "learning_rate": 0.00048602966809983204, "loss": 5.0841, "mean_token_accuracy": 0.1990629717707634, "num_tokens": 26688185.0, "step": 15380 }, { "entropy": 5.628693962097168, "epoch": 1.1970044738377748, "grad_norm": 1.046875, "learning_rate": 0.0004860200525245746, "loss": 5.1441, "mean_token_accuracy": 0.19673731327056884, "num_tokens": 26697157.0, "step": 15385 }, { "entropy": 5.575571823120117, "epoch": 1.1973935032094922, "grad_norm": 1.046875, "learning_rate": 0.0004860104337474239, "loss": 5.09, "mean_token_accuracy": 0.18258867263793946, "num_tokens": 26705868.0, "step": 15390 }, { "entropy": 5.5600487232208256, "epoch": 1.19778253258121, "grad_norm": 1.0859375, "learning_rate": 0.00048600081176852555, "loss": 5.1417, "mean_token_accuracy": 0.18435254096984863, "num_tokens": 26714364.0, "step": 15395 }, { "entropy": 5.573964262008667, "epoch": 1.1981715619529274, "grad_norm": 1.078125, "learning_rate": 0.00048599118658802575, "loss": 5.1365, "mean_token_accuracy": 0.18718570321798325, "num_tokens": 26722866.0, "step": 15400 }, { "entropy": 5.631946086883545, "epoch": 1.198560591324645, "grad_norm": 1.125, "learning_rate": 0.0004859815582060706, "loss": 5.0898, "mean_token_accuracy": 0.1913563922047615, "num_tokens": 26731305.0, "step": 15405 }, { "entropy": 5.62173490524292, "epoch": 1.1989496206963626, "grad_norm": 1.1015625, "learning_rate": 0.0004859719266228061, "loss": 5.0882, "mean_token_accuracy": 0.19028402119874954, "num_tokens": 26740807.0, "step": 15410 }, { "entropy": 5.558030414581299, "epoch": 1.19933865006808, "grad_norm": 1.0703125, "learning_rate": 0.0004859622918383784, "loss": 5.0828, "mean_token_accuracy": 0.19723034054040908, "num_tokens": 26749748.0, "step": 15415 }, { "entropy": 5.599880599975586, "epoch": 1.1997276794397977, "grad_norm": 1.0859375, "learning_rate": 0.0004859526538529337, "loss": 5.1279, "mean_token_accuracy": 0.19151920974254608, "num_tokens": 26758597.0, "step": 15420 }, { "entropy": 5.590807342529297, "epoch": 1.2001167088115152, "grad_norm": 1.0703125, "learning_rate": 0.0004859430126666182, "loss": 5.1801, "mean_token_accuracy": 0.1843524843454361, "num_tokens": 26766772.0, "step": 15425 }, { "entropy": 5.476952457427979, "epoch": 1.200505738183233, "grad_norm": 1.0234375, "learning_rate": 0.00048593336827957824, "loss": 4.9198, "mean_token_accuracy": 0.2183031901717186, "num_tokens": 26775229.0, "step": 15430 }, { "entropy": 5.520895195007324, "epoch": 1.2008947675549504, "grad_norm": 1.0078125, "learning_rate": 0.00048592372069196024, "loss": 5.0846, "mean_token_accuracy": 0.18325729370117189, "num_tokens": 26784188.0, "step": 15435 }, { "entropy": 5.460034704208374, "epoch": 1.2012837969266679, "grad_norm": 1.140625, "learning_rate": 0.0004859140699039104, "loss": 5.0273, "mean_token_accuracy": 0.19336565285921098, "num_tokens": 26792687.0, "step": 15440 }, { "entropy": 5.5107306957244875, "epoch": 1.2016728262983856, "grad_norm": 0.9375, "learning_rate": 0.00048590441591557526, "loss": 5.0786, "mean_token_accuracy": 0.19534944593906403, "num_tokens": 26801931.0, "step": 15445 }, { "entropy": 5.600342416763306, "epoch": 1.202061855670103, "grad_norm": 1.296875, "learning_rate": 0.00048589475872710134, "loss": 5.2971, "mean_token_accuracy": 0.182644072920084, "num_tokens": 26810689.0, "step": 15450 }, { "entropy": 5.60272331237793, "epoch": 1.2024508850418207, "grad_norm": 1.140625, "learning_rate": 0.0004858850983386351, "loss": 5.111, "mean_token_accuracy": 0.18917934447526932, "num_tokens": 26819038.0, "step": 15455 }, { "entropy": 5.579953956604004, "epoch": 1.2028399144135382, "grad_norm": 1.09375, "learning_rate": 0.0004858754347503231, "loss": 5.0171, "mean_token_accuracy": 0.20105472803115845, "num_tokens": 26827443.0, "step": 15460 }, { "entropy": 5.565564441680908, "epoch": 1.203228943785256, "grad_norm": 1.1171875, "learning_rate": 0.00048586576796231216, "loss": 5.0161, "mean_token_accuracy": 0.19953968226909638, "num_tokens": 26836306.0, "step": 15465 }, { "entropy": 5.584036779403687, "epoch": 1.2036179731569734, "grad_norm": 1.078125, "learning_rate": 0.0004858560979747487, "loss": 5.1187, "mean_token_accuracy": 0.19076377153396606, "num_tokens": 26845043.0, "step": 15470 }, { "entropy": 5.587303256988525, "epoch": 1.2040070025286909, "grad_norm": 1.0234375, "learning_rate": 0.00048584642478777967, "loss": 5.0504, "mean_token_accuracy": 0.19465643614530564, "num_tokens": 26853978.0, "step": 15475 }, { "entropy": 5.553425025939942, "epoch": 1.2043960319004086, "grad_norm": 1.0390625, "learning_rate": 0.0004858367484015517, "loss": 4.9753, "mean_token_accuracy": 0.1934100016951561, "num_tokens": 26862487.0, "step": 15480 }, { "entropy": 5.534739875793457, "epoch": 1.204785061272126, "grad_norm": 1.1015625, "learning_rate": 0.00048582706881621166, "loss": 5.1476, "mean_token_accuracy": 0.190867018699646, "num_tokens": 26871137.0, "step": 15485 }, { "entropy": 5.539325904846192, "epoch": 1.2051740906438435, "grad_norm": 1.0390625, "learning_rate": 0.0004858173860319063, "loss": 5.0504, "mean_token_accuracy": 0.19186416566371917, "num_tokens": 26880091.0, "step": 15490 }, { "entropy": 5.566355228424072, "epoch": 1.2055631200155612, "grad_norm": 1.125, "learning_rate": 0.00048580770004878277, "loss": 5.0923, "mean_token_accuracy": 0.19103320837020873, "num_tokens": 26888777.0, "step": 15495 }, { "entropy": 5.552337503433227, "epoch": 1.2059521493872787, "grad_norm": 1.0703125, "learning_rate": 0.0004857980108669879, "loss": 5.049, "mean_token_accuracy": 0.19066378921270372, "num_tokens": 26897689.0, "step": 15500 }, { "entropy": 5.637480401992798, "epoch": 1.2063411787589964, "grad_norm": 1.1328125, "learning_rate": 0.00048578831848666875, "loss": 5.0968, "mean_token_accuracy": 0.18980053514242173, "num_tokens": 26906209.0, "step": 15505 }, { "entropy": 5.627501392364502, "epoch": 1.2067302081307139, "grad_norm": 1.0390625, "learning_rate": 0.00048577862290797235, "loss": 5.242, "mean_token_accuracy": 0.18738613426685333, "num_tokens": 26916340.0, "step": 15510 }, { "entropy": 5.617512178421021, "epoch": 1.2071192375024316, "grad_norm": 1.109375, "learning_rate": 0.00048576892413104586, "loss": 5.1177, "mean_token_accuracy": 0.19289989918470382, "num_tokens": 26924482.0, "step": 15515 }, { "entropy": 5.549185800552368, "epoch": 1.207508266874149, "grad_norm": 1.078125, "learning_rate": 0.0004857592221560364, "loss": 5.0774, "mean_token_accuracy": 0.18911547362804412, "num_tokens": 26932844.0, "step": 15520 }, { "entropy": 5.451512193679809, "epoch": 1.2078972962458665, "grad_norm": 1.1171875, "learning_rate": 0.0004857495169830912, "loss": 4.9645, "mean_token_accuracy": 0.1984395354986191, "num_tokens": 26940916.0, "step": 15525 }, { "entropy": 5.590522146224975, "epoch": 1.2082863256175842, "grad_norm": 1.0546875, "learning_rate": 0.0004857398086123575, "loss": 5.1085, "mean_token_accuracy": 0.19080109745264054, "num_tokens": 26949182.0, "step": 15530 }, { "entropy": 5.591371726989746, "epoch": 1.2086753549893017, "grad_norm": 1.09375, "learning_rate": 0.0004857300970439827, "loss": 5.0546, "mean_token_accuracy": 0.19957173317670823, "num_tokens": 26957531.0, "step": 15535 }, { "entropy": 5.589437866210938, "epoch": 1.2090643843610192, "grad_norm": 1.140625, "learning_rate": 0.00048572038227811404, "loss": 5.1522, "mean_token_accuracy": 0.19046340137720108, "num_tokens": 26965430.0, "step": 15540 }, { "entropy": 5.615444135665894, "epoch": 1.2094534137327368, "grad_norm": 1.0703125, "learning_rate": 0.000485710664314899, "loss": 5.1805, "mean_token_accuracy": 0.1888631597161293, "num_tokens": 26974132.0, "step": 15545 }, { "entropy": 5.57098274230957, "epoch": 1.2098424431044543, "grad_norm": 1.1796875, "learning_rate": 0.000485700943154485, "loss": 5.0712, "mean_token_accuracy": 0.1968693792819977, "num_tokens": 26982277.0, "step": 15550 }, { "entropy": 5.4820122718811035, "epoch": 1.210231472476172, "grad_norm": 1.0546875, "learning_rate": 0.0004856912187970195, "loss": 5.0301, "mean_token_accuracy": 0.1910757064819336, "num_tokens": 26991827.0, "step": 15555 }, { "entropy": 5.625962591171264, "epoch": 1.2106205018478895, "grad_norm": 1.0859375, "learning_rate": 0.0004856814912426502, "loss": 5.1834, "mean_token_accuracy": 0.18780433088541032, "num_tokens": 27000697.0, "step": 15560 }, { "entropy": 5.576309251785278, "epoch": 1.2110095312196072, "grad_norm": 1.0546875, "learning_rate": 0.0004856717604915245, "loss": 5.1232, "mean_token_accuracy": 0.19405819326639176, "num_tokens": 27009461.0, "step": 15565 }, { "entropy": 5.516828155517578, "epoch": 1.2113985605913247, "grad_norm": 1.1171875, "learning_rate": 0.0004856620265437902, "loss": 5.0538, "mean_token_accuracy": 0.19772937297821044, "num_tokens": 27017970.0, "step": 15570 }, { "entropy": 5.588766288757324, "epoch": 1.2117875899630421, "grad_norm": 1.0625, "learning_rate": 0.000485652289399595, "loss": 5.1133, "mean_token_accuracy": 0.19586780816316604, "num_tokens": 27026439.0, "step": 15575 }, { "entropy": 5.580862903594971, "epoch": 1.2121766193347598, "grad_norm": 1.0703125, "learning_rate": 0.00048564254905908655, "loss": 5.0592, "mean_token_accuracy": 0.19007128924131395, "num_tokens": 27034985.0, "step": 15580 }, { "entropy": 5.638749790191651, "epoch": 1.2125656487064773, "grad_norm": 1.1171875, "learning_rate": 0.00048563280552241266, "loss": 5.2045, "mean_token_accuracy": 0.18281891345977783, "num_tokens": 27044171.0, "step": 15585 }, { "entropy": 5.635423803329468, "epoch": 1.2129546780781948, "grad_norm": 1.0234375, "learning_rate": 0.0004856230587897212, "loss": 5.1648, "mean_token_accuracy": 0.18812349885702134, "num_tokens": 27053219.0, "step": 15590 }, { "entropy": 5.518210744857788, "epoch": 1.2133437074499125, "grad_norm": 1.0859375, "learning_rate": 0.0004856133088611602, "loss": 5.0267, "mean_token_accuracy": 0.20125340521335602, "num_tokens": 27062012.0, "step": 15595 }, { "entropy": 5.556315279006958, "epoch": 1.21373273682163, "grad_norm": 1.09375, "learning_rate": 0.0004856035557368773, "loss": 5.1216, "mean_token_accuracy": 0.18618103116750717, "num_tokens": 27070854.0, "step": 15600 }, { "entropy": 5.640985441207886, "epoch": 1.2141217661933477, "grad_norm": 0.99609375, "learning_rate": 0.00048559379941702074, "loss": 5.1629, "mean_token_accuracy": 0.19010813981294633, "num_tokens": 27079295.0, "step": 15605 }, { "entropy": 5.572699546813965, "epoch": 1.2145107955650651, "grad_norm": 1.0546875, "learning_rate": 0.00048558403990173844, "loss": 5.0501, "mean_token_accuracy": 0.19180653244256973, "num_tokens": 27087909.0, "step": 15610 }, { "entropy": 5.512327384948731, "epoch": 1.2148998249367828, "grad_norm": 1.0546875, "learning_rate": 0.00048557427719117855, "loss": 5.0837, "mean_token_accuracy": 0.1947572946548462, "num_tokens": 27096461.0, "step": 15615 }, { "entropy": 5.608134174346924, "epoch": 1.2152888543085003, "grad_norm": 1.1640625, "learning_rate": 0.0004855645112854891, "loss": 5.214, "mean_token_accuracy": 0.18693210631608964, "num_tokens": 27104846.0, "step": 15620 }, { "entropy": 5.619349527359009, "epoch": 1.2156778836802178, "grad_norm": 1.0859375, "learning_rate": 0.0004855547421848184, "loss": 5.0074, "mean_token_accuracy": 0.20129285305738448, "num_tokens": 27112623.0, "step": 15625 }, { "entropy": 5.5897434711456295, "epoch": 1.2160669130519355, "grad_norm": 1.046875, "learning_rate": 0.00048554496988931456, "loss": 5.0528, "mean_token_accuracy": 0.1938340410590172, "num_tokens": 27120752.0, "step": 15630 }, { "entropy": 5.640067768096924, "epoch": 1.216455942423653, "grad_norm": 1.125, "learning_rate": 0.00048553519439912597, "loss": 5.2194, "mean_token_accuracy": 0.1824770301580429, "num_tokens": 27129583.0, "step": 15635 }, { "entropy": 5.614911413192749, "epoch": 1.2168449717953704, "grad_norm": 1.0390625, "learning_rate": 0.0004855254157144009, "loss": 5.1265, "mean_token_accuracy": 0.19445567578077316, "num_tokens": 27137807.0, "step": 15640 }, { "entropy": 5.541811513900757, "epoch": 1.2172340011670881, "grad_norm": 1.1171875, "learning_rate": 0.0004855156338352877, "loss": 4.9878, "mean_token_accuracy": 0.19631571918725968, "num_tokens": 27146246.0, "step": 15645 }, { "entropy": 5.572632741928101, "epoch": 1.2176230305388056, "grad_norm": 1.0703125, "learning_rate": 0.00048550584876193493, "loss": 5.0661, "mean_token_accuracy": 0.19595494270324706, "num_tokens": 27154811.0, "step": 15650 }, { "entropy": 5.608317852020264, "epoch": 1.2180120599105233, "grad_norm": 1.0703125, "learning_rate": 0.00048549606049449085, "loss": 5.0746, "mean_token_accuracy": 0.20396005660295485, "num_tokens": 27162849.0, "step": 15655 }, { "entropy": 5.552761554718018, "epoch": 1.2184010892822408, "grad_norm": 1.0546875, "learning_rate": 0.0004854862690331041, "loss": 5.1461, "mean_token_accuracy": 0.18890870958566666, "num_tokens": 27171268.0, "step": 15660 }, { "entropy": 5.582083988189697, "epoch": 1.2187901186539585, "grad_norm": 1.109375, "learning_rate": 0.00048547647437792327, "loss": 5.0932, "mean_token_accuracy": 0.19241475462913513, "num_tokens": 27179571.0, "step": 15665 }, { "entropy": 5.561008262634277, "epoch": 1.219179148025676, "grad_norm": 1.109375, "learning_rate": 0.000485466676529097, "loss": 5.0763, "mean_token_accuracy": 0.1964916095137596, "num_tokens": 27188441.0, "step": 15670 }, { "entropy": 5.629905891418457, "epoch": 1.2195681773973934, "grad_norm": 1.0859375, "learning_rate": 0.00048545687548677373, "loss": 5.0965, "mean_token_accuracy": 0.18833362311124802, "num_tokens": 27196960.0, "step": 15675 }, { "entropy": 5.569472551345825, "epoch": 1.2199572067691111, "grad_norm": 1.1328125, "learning_rate": 0.0004854470712511025, "loss": 5.0958, "mean_token_accuracy": 0.194248528778553, "num_tokens": 27205129.0, "step": 15680 }, { "entropy": 5.5625584602355955, "epoch": 1.2203462361408286, "grad_norm": 1.0, "learning_rate": 0.00048543726382223193, "loss": 5.0546, "mean_token_accuracy": 0.19435477405786514, "num_tokens": 27214213.0, "step": 15685 }, { "entropy": 5.556509065628052, "epoch": 1.220735265512546, "grad_norm": 1.109375, "learning_rate": 0.00048542745320031075, "loss": 5.1004, "mean_token_accuracy": 0.18486985117197036, "num_tokens": 27222447.0, "step": 15690 }, { "entropy": 5.584448385238647, "epoch": 1.2211242948842638, "grad_norm": 1.0078125, "learning_rate": 0.00048541763938548795, "loss": 5.0802, "mean_token_accuracy": 0.19131069481372834, "num_tokens": 27230872.0, "step": 15695 }, { "entropy": 5.589754295349121, "epoch": 1.2215133242559812, "grad_norm": 1.0703125, "learning_rate": 0.00048540782237791244, "loss": 5.1528, "mean_token_accuracy": 0.18907450288534164, "num_tokens": 27239171.0, "step": 15700 }, { "entropy": 5.532102870941162, "epoch": 1.221902353627699, "grad_norm": 1.109375, "learning_rate": 0.00048539800217773293, "loss": 5.0568, "mean_token_accuracy": 0.18893016129732132, "num_tokens": 27247530.0, "step": 15705 }, { "entropy": 5.595793914794922, "epoch": 1.2222913829994164, "grad_norm": 1.046875, "learning_rate": 0.0004853881787850988, "loss": 5.1411, "mean_token_accuracy": 0.18888894766569136, "num_tokens": 27255579.0, "step": 15710 }, { "entropy": 5.534402656555176, "epoch": 1.2226804123711341, "grad_norm": 1.0546875, "learning_rate": 0.00048537835220015886, "loss": 5.0785, "mean_token_accuracy": 0.19326250106096268, "num_tokens": 27264209.0, "step": 15715 }, { "entropy": 5.625450134277344, "epoch": 1.2230694417428516, "grad_norm": 1.140625, "learning_rate": 0.0004853685224230623, "loss": 5.1456, "mean_token_accuracy": 0.18266841471195222, "num_tokens": 27272424.0, "step": 15720 }, { "entropy": 5.530358362197876, "epoch": 1.223458471114569, "grad_norm": 1.1015625, "learning_rate": 0.00048535868945395825, "loss": 4.9674, "mean_token_accuracy": 0.201402847468853, "num_tokens": 27281265.0, "step": 15725 }, { "entropy": 5.625441598892212, "epoch": 1.2238475004862868, "grad_norm": 1.1015625, "learning_rate": 0.00048534885329299586, "loss": 5.2232, "mean_token_accuracy": 0.19027862846851348, "num_tokens": 27290026.0, "step": 15730 }, { "entropy": 5.608558654785156, "epoch": 1.2242365298580042, "grad_norm": 1.078125, "learning_rate": 0.0004853390139403245, "loss": 5.1688, "mean_token_accuracy": 0.18795347958803177, "num_tokens": 27298597.0, "step": 15735 }, { "entropy": 5.633943796157837, "epoch": 1.224625559229722, "grad_norm": 1.2109375, "learning_rate": 0.00048532917139609334, "loss": 5.1335, "mean_token_accuracy": 0.18765166252851487, "num_tokens": 27306763.0, "step": 15740 }, { "entropy": 5.580550622940064, "epoch": 1.2250145886014394, "grad_norm": 1.1328125, "learning_rate": 0.0004853193256604518, "loss": 5.1385, "mean_token_accuracy": 0.18764326423406602, "num_tokens": 27315782.0, "step": 15745 }, { "entropy": 5.681466007232666, "epoch": 1.2254036179731569, "grad_norm": 1.0390625, "learning_rate": 0.00048530947673354924, "loss": 5.1861, "mean_token_accuracy": 0.18378168642520903, "num_tokens": 27324487.0, "step": 15750 }, { "entropy": 5.61579475402832, "epoch": 1.2257926473448746, "grad_norm": 1.109375, "learning_rate": 0.0004852996246155351, "loss": 5.1106, "mean_token_accuracy": 0.18874807208776473, "num_tokens": 27333099.0, "step": 15755 }, { "entropy": 5.582251024246216, "epoch": 1.226181676716592, "grad_norm": 1.0234375, "learning_rate": 0.00048528976930655896, "loss": 5.1176, "mean_token_accuracy": 0.18901627659797668, "num_tokens": 27341697.0, "step": 15760 }, { "entropy": 5.618842029571534, "epoch": 1.2265707060883098, "grad_norm": 1.015625, "learning_rate": 0.00048527991080677015, "loss": 5.0962, "mean_token_accuracy": 0.1931592270731926, "num_tokens": 27349811.0, "step": 15765 }, { "entropy": 5.562830066680908, "epoch": 1.2269597354600272, "grad_norm": 1.09375, "learning_rate": 0.00048527004911631843, "loss": 5.1045, "mean_token_accuracy": 0.19176326990127562, "num_tokens": 27358257.0, "step": 15770 }, { "entropy": 5.616780614852905, "epoch": 1.2273487648317447, "grad_norm": 1.0859375, "learning_rate": 0.0004852601842353534, "loss": 5.07, "mean_token_accuracy": 0.19709960520267486, "num_tokens": 27366993.0, "step": 15775 }, { "entropy": 5.610050439834595, "epoch": 1.2277377942034624, "grad_norm": 1.046875, "learning_rate": 0.00048525031616402476, "loss": 5.1003, "mean_token_accuracy": 0.1969912141561508, "num_tokens": 27375780.0, "step": 15780 }, { "entropy": 5.576451301574707, "epoch": 1.2281268235751799, "grad_norm": 1.0625, "learning_rate": 0.00048524044490248227, "loss": 5.1585, "mean_token_accuracy": 0.18969890773296355, "num_tokens": 27384641.0, "step": 15785 }, { "entropy": 5.638945150375366, "epoch": 1.2285158529468976, "grad_norm": 1.15625, "learning_rate": 0.00048523057045087557, "loss": 5.1405, "mean_token_accuracy": 0.19688313007354735, "num_tokens": 27392990.0, "step": 15790 }, { "entropy": 5.650594854354859, "epoch": 1.228904882318615, "grad_norm": 1.078125, "learning_rate": 0.00048522069280935466, "loss": 5.285, "mean_token_accuracy": 0.18183117657899855, "num_tokens": 27401012.0, "step": 15795 }, { "entropy": 5.54598650932312, "epoch": 1.2292939116903325, "grad_norm": 1.0078125, "learning_rate": 0.0004852108119780693, "loss": 5.0812, "mean_token_accuracy": 0.19106172472238542, "num_tokens": 27409758.0, "step": 15800 }, { "entropy": 5.614936780929566, "epoch": 1.2296829410620502, "grad_norm": 1.046875, "learning_rate": 0.0004852009279571694, "loss": 5.0934, "mean_token_accuracy": 0.19357936829328537, "num_tokens": 27417592.0, "step": 15805 }, { "entropy": 5.570390510559082, "epoch": 1.2300719704337677, "grad_norm": 1.0625, "learning_rate": 0.000485191040746805, "loss": 5.058, "mean_token_accuracy": 0.19234727174043656, "num_tokens": 27426822.0, "step": 15810 }, { "entropy": 5.536443281173706, "epoch": 1.2304609998054854, "grad_norm": 1.0625, "learning_rate": 0.0004851811503471262, "loss": 5.0443, "mean_token_accuracy": 0.20273693054914474, "num_tokens": 27435446.0, "step": 15815 }, { "entropy": 5.585339832305908, "epoch": 1.2308500291772029, "grad_norm": 1.1171875, "learning_rate": 0.00048517125675828294, "loss": 5.0434, "mean_token_accuracy": 0.19286508113145828, "num_tokens": 27443156.0, "step": 15820 }, { "entropy": 5.659043884277343, "epoch": 1.2312390585489204, "grad_norm": 1.09375, "learning_rate": 0.00048516135998042536, "loss": 5.1712, "mean_token_accuracy": 0.19028818011283874, "num_tokens": 27451500.0, "step": 15825 }, { "entropy": 5.6254126071929935, "epoch": 1.231628087920638, "grad_norm": 1.09375, "learning_rate": 0.0004851514600137037, "loss": 5.1307, "mean_token_accuracy": 0.19801352322101592, "num_tokens": 27460237.0, "step": 15830 }, { "entropy": 5.588210487365723, "epoch": 1.2320171172923555, "grad_norm": 1.09375, "learning_rate": 0.00048514155685826807, "loss": 5.0884, "mean_token_accuracy": 0.19894171953201295, "num_tokens": 27468434.0, "step": 15835 }, { "entropy": 5.6366798877716064, "epoch": 1.2324061466640732, "grad_norm": 1.140625, "learning_rate": 0.0004851316505142688, "loss": 5.1157, "mean_token_accuracy": 0.19308706521987914, "num_tokens": 27477667.0, "step": 15840 }, { "entropy": 5.618930673599243, "epoch": 1.2327951760357907, "grad_norm": 1.0546875, "learning_rate": 0.00048512174098185615, "loss": 5.0811, "mean_token_accuracy": 0.18397969752550125, "num_tokens": 27486365.0, "step": 15845 }, { "entropy": 5.530434226989746, "epoch": 1.2331842054075082, "grad_norm": 1.0625, "learning_rate": 0.00048511182826118055, "loss": 5.0673, "mean_token_accuracy": 0.19726494401693345, "num_tokens": 27495310.0, "step": 15850 }, { "entropy": 5.4918054103851315, "epoch": 1.2335732347792259, "grad_norm": 1.09375, "learning_rate": 0.00048510191235239246, "loss": 5.0325, "mean_token_accuracy": 0.19891120940446855, "num_tokens": 27504175.0, "step": 15855 }, { "entropy": 5.657974195480347, "epoch": 1.2339622641509433, "grad_norm": 1.125, "learning_rate": 0.00048509199325564217, "loss": 5.0955, "mean_token_accuracy": 0.18868385255336761, "num_tokens": 27512042.0, "step": 15860 }, { "entropy": 5.62535662651062, "epoch": 1.234351293522661, "grad_norm": 1.09375, "learning_rate": 0.0004850820709710803, "loss": 5.1832, "mean_token_accuracy": 0.19400513917207718, "num_tokens": 27520721.0, "step": 15865 }, { "entropy": 5.512140846252441, "epoch": 1.2347403228943785, "grad_norm": 1.0234375, "learning_rate": 0.0004850721454988574, "loss": 5.0726, "mean_token_accuracy": 0.18600696921348572, "num_tokens": 27529431.0, "step": 15870 }, { "entropy": 5.520215559005737, "epoch": 1.235129352266096, "grad_norm": 1.0859375, "learning_rate": 0.00048506221683912405, "loss": 4.9983, "mean_token_accuracy": 0.20258515030145646, "num_tokens": 27537380.0, "step": 15875 }, { "entropy": 5.509256362915039, "epoch": 1.2355183816378137, "grad_norm": 0.875, "learning_rate": 0.0004850522849920309, "loss": 5.0145, "mean_token_accuracy": 0.1896832525730133, "num_tokens": 27547487.0, "step": 15880 }, { "entropy": 5.645970439910888, "epoch": 1.2359074110095312, "grad_norm": 1.0390625, "learning_rate": 0.00048504234995772863, "loss": 5.0863, "mean_token_accuracy": 0.19388291388750076, "num_tokens": 27556813.0, "step": 15885 }, { "entropy": 5.626342058181763, "epoch": 1.2362964403812489, "grad_norm": 0.96484375, "learning_rate": 0.0004850324117363681, "loss": 5.2079, "mean_token_accuracy": 0.18508358299732208, "num_tokens": 27566602.0, "step": 15890 }, { "entropy": 5.575374269485474, "epoch": 1.2366854697529663, "grad_norm": 1.1328125, "learning_rate": 0.00048502247032809997, "loss": 5.1123, "mean_token_accuracy": 0.19680604785680772, "num_tokens": 27574577.0, "step": 15895 }, { "entropy": 5.685038471221924, "epoch": 1.237074499124684, "grad_norm": 1.0546875, "learning_rate": 0.0004850125257330751, "loss": 5.2692, "mean_token_accuracy": 0.17783930599689485, "num_tokens": 27582702.0, "step": 15900 }, { "entropy": 5.592756843566894, "epoch": 1.2374635284964015, "grad_norm": 1.0234375, "learning_rate": 0.00048500257795144446, "loss": 5.1617, "mean_token_accuracy": 0.18681564629077912, "num_tokens": 27591457.0, "step": 15905 }, { "entropy": 5.553035497665405, "epoch": 1.237852557868119, "grad_norm": 1.03125, "learning_rate": 0.000484992626983359, "loss": 5.0212, "mean_token_accuracy": 0.19970177859067917, "num_tokens": 27600643.0, "step": 15910 }, { "entropy": 5.587669134140015, "epoch": 1.2382415872398367, "grad_norm": 1.1875, "learning_rate": 0.0004849826728289696, "loss": 5.0241, "mean_token_accuracy": 0.19343722462654114, "num_tokens": 27608438.0, "step": 15915 }, { "entropy": 5.614461994171142, "epoch": 1.2386306166115542, "grad_norm": 1.0546875, "learning_rate": 0.00048497271548842737, "loss": 5.1477, "mean_token_accuracy": 0.19096991866827012, "num_tokens": 27617149.0, "step": 15920 }, { "entropy": 5.523227977752685, "epoch": 1.2390196459832716, "grad_norm": 1.0703125, "learning_rate": 0.0004849627549618834, "loss": 5.0878, "mean_token_accuracy": 0.1934687003493309, "num_tokens": 27625188.0, "step": 15925 }, { "entropy": 5.523476934432983, "epoch": 1.2394086753549893, "grad_norm": 1.109375, "learning_rate": 0.00048495279124948886, "loss": 5.1571, "mean_token_accuracy": 0.19009485989809036, "num_tokens": 27633865.0, "step": 15930 }, { "entropy": 5.57327356338501, "epoch": 1.2397977047267068, "grad_norm": 1.078125, "learning_rate": 0.0004849428243513948, "loss": 5.1101, "mean_token_accuracy": 0.19219367057085038, "num_tokens": 27642528.0, "step": 15935 }, { "entropy": 5.608651161193848, "epoch": 1.2401867340984245, "grad_norm": 1.0703125, "learning_rate": 0.00048493285426775255, "loss": 5.1983, "mean_token_accuracy": 0.17797445505857468, "num_tokens": 27651291.0, "step": 15940 }, { "entropy": 5.641522073745728, "epoch": 1.240575763470142, "grad_norm": 0.9609375, "learning_rate": 0.0004849228809987135, "loss": 5.194, "mean_token_accuracy": 0.1832926467061043, "num_tokens": 27660725.0, "step": 15945 }, { "entropy": 5.6311310768127445, "epoch": 1.2409647928418597, "grad_norm": 1.109375, "learning_rate": 0.0004849129045444288, "loss": 5.0392, "mean_token_accuracy": 0.19656172543764114, "num_tokens": 27669282.0, "step": 15950 }, { "entropy": 5.563568258285523, "epoch": 1.2413538222135772, "grad_norm": 1.09375, "learning_rate": 0.0004849029249050498, "loss": 5.0433, "mean_token_accuracy": 0.2009149357676506, "num_tokens": 27677987.0, "step": 15955 }, { "entropy": 5.500935697555542, "epoch": 1.2417428515852946, "grad_norm": 1.0703125, "learning_rate": 0.00048489294208072805, "loss": 5.0502, "mean_token_accuracy": 0.19451956152915956, "num_tokens": 27686409.0, "step": 15960 }, { "entropy": 5.554556941986084, "epoch": 1.2421318809570123, "grad_norm": 0.99609375, "learning_rate": 0.00048488295607161495, "loss": 5.0513, "mean_token_accuracy": 0.19104095846414565, "num_tokens": 27695485.0, "step": 15965 }, { "entropy": 5.547342348098755, "epoch": 1.2425209103287298, "grad_norm": 1.1484375, "learning_rate": 0.0004848729668778621, "loss": 4.9517, "mean_token_accuracy": 0.19947921484708786, "num_tokens": 27703962.0, "step": 15970 }, { "entropy": 5.5795379161834715, "epoch": 1.2429099397004473, "grad_norm": 1.21875, "learning_rate": 0.0004848629744996211, "loss": 5.0794, "mean_token_accuracy": 0.1934753343462944, "num_tokens": 27713632.0, "step": 15975 }, { "entropy": 5.557565307617187, "epoch": 1.243298969072165, "grad_norm": 1.0234375, "learning_rate": 0.0004848529789370434, "loss": 5.1575, "mean_token_accuracy": 0.19070208668708802, "num_tokens": 27722890.0, "step": 15980 }, { "entropy": 5.58310489654541, "epoch": 1.2436879984438824, "grad_norm": 1.1328125, "learning_rate": 0.0004848429801902808, "loss": 5.0829, "mean_token_accuracy": 0.19657804667949677, "num_tokens": 27731325.0, "step": 15985 }, { "entropy": 5.600124549865723, "epoch": 1.2440770278156001, "grad_norm": 1.1328125, "learning_rate": 0.00048483297825948485, "loss": 5.163, "mean_token_accuracy": 0.18975530713796615, "num_tokens": 27739600.0, "step": 15990 }, { "entropy": 5.583254814147949, "epoch": 1.2444660571873176, "grad_norm": 1.0703125, "learning_rate": 0.00048482297314480756, "loss": 5.145, "mean_token_accuracy": 0.1875674992799759, "num_tokens": 27747860.0, "step": 15995 }, { "entropy": 5.552810192108154, "epoch": 1.2448550865590353, "grad_norm": 1.0546875, "learning_rate": 0.0004848129648464006, "loss": 5.0608, "mean_token_accuracy": 0.1939297452569008, "num_tokens": 27757141.0, "step": 16000 }, { "entropy": 5.619099903106689, "epoch": 1.2452441159307528, "grad_norm": 1.03125, "learning_rate": 0.0004848029533644159, "loss": 5.2286, "mean_token_accuracy": 0.1821589231491089, "num_tokens": 27766832.0, "step": 16005 }, { "entropy": 5.600907993316651, "epoch": 1.2456331453024703, "grad_norm": 1.109375, "learning_rate": 0.0004847929386990052, "loss": 5.0999, "mean_token_accuracy": 0.18735098242759704, "num_tokens": 27775487.0, "step": 16010 }, { "entropy": 5.578440952301025, "epoch": 1.246022174674188, "grad_norm": 1.1171875, "learning_rate": 0.00048478292085032065, "loss": 5.0388, "mean_token_accuracy": 0.19397705793380737, "num_tokens": 27783601.0, "step": 16015 }, { "entropy": 5.626968955993652, "epoch": 1.2464112040459054, "grad_norm": 1.09375, "learning_rate": 0.0004847728998185142, "loss": 5.1514, "mean_token_accuracy": 0.18919097930192946, "num_tokens": 27792931.0, "step": 16020 }, { "entropy": 5.642937469482422, "epoch": 1.246800233417623, "grad_norm": 1.0390625, "learning_rate": 0.00048476287560373786, "loss": 5.1112, "mean_token_accuracy": 0.1907007873058319, "num_tokens": 27801388.0, "step": 16025 }, { "entropy": 5.5731464385986325, "epoch": 1.2471892627893406, "grad_norm": 1.265625, "learning_rate": 0.00048475284820614375, "loss": 5.0878, "mean_token_accuracy": 0.1909249857068062, "num_tokens": 27810047.0, "step": 16030 }, { "entropy": 5.588643646240234, "epoch": 1.247578292161058, "grad_norm": 1.0703125, "learning_rate": 0.00048474281762588407, "loss": 5.0863, "mean_token_accuracy": 0.1944271668791771, "num_tokens": 27818800.0, "step": 16035 }, { "entropy": 5.53579363822937, "epoch": 1.2479673215327758, "grad_norm": 1.0703125, "learning_rate": 0.0004847327838631109, "loss": 5.0497, "mean_token_accuracy": 0.19037897288799285, "num_tokens": 27827623.0, "step": 16040 }, { "entropy": 5.5154825210571286, "epoch": 1.2483563509044933, "grad_norm": 1.0859375, "learning_rate": 0.0004847227469179766, "loss": 5.0194, "mean_token_accuracy": 0.20358068197965623, "num_tokens": 27836491.0, "step": 16045 }, { "entropy": 5.57544322013855, "epoch": 1.248745380276211, "grad_norm": 1.15625, "learning_rate": 0.0004847127067906334, "loss": 5.0835, "mean_token_accuracy": 0.19623470604419707, "num_tokens": 27845563.0, "step": 16050 }, { "entropy": 5.570050191879273, "epoch": 1.2491344096479284, "grad_norm": 1.1015625, "learning_rate": 0.00048470266348123365, "loss": 5.0424, "mean_token_accuracy": 0.19259732961654663, "num_tokens": 27854263.0, "step": 16055 }, { "entropy": 5.595818948745728, "epoch": 1.249523439019646, "grad_norm": 0.984375, "learning_rate": 0.0004846926169899298, "loss": 5.0712, "mean_token_accuracy": 0.19274725317955016, "num_tokens": 27862868.0, "step": 16060 }, { "entropy": 5.605850887298584, "epoch": 1.2499124683913636, "grad_norm": 1.0625, "learning_rate": 0.00048468256731687426, "loss": 5.1862, "mean_token_accuracy": 0.18923528492450714, "num_tokens": 27872053.0, "step": 16065 }, { "entropy": 5.554771852493286, "epoch": 1.250301497763081, "grad_norm": 1.0625, "learning_rate": 0.0004846725144622194, "loss": 4.9908, "mean_token_accuracy": 0.20081694722175597, "num_tokens": 27880953.0, "step": 16070 }, { "entropy": 5.5996613025665285, "epoch": 1.2506905271347986, "grad_norm": 1.078125, "learning_rate": 0.000484662458426118, "loss": 5.0799, "mean_token_accuracy": 0.19625876247882842, "num_tokens": 27890102.0, "step": 16075 }, { "entropy": 5.630896520614624, "epoch": 1.2510795565065163, "grad_norm": 1.046875, "learning_rate": 0.00048465239920872247, "loss": 5.17, "mean_token_accuracy": 0.1895263284444809, "num_tokens": 27899305.0, "step": 16080 }, { "entropy": 5.643464756011963, "epoch": 1.2514685858782337, "grad_norm": 1.125, "learning_rate": 0.00048464233681018545, "loss": 5.1111, "mean_token_accuracy": 0.19226248264312745, "num_tokens": 27907476.0, "step": 16085 }, { "entropy": 5.620686769485474, "epoch": 1.2518576152499514, "grad_norm": 1.1171875, "learning_rate": 0.0004846322712306596, "loss": 5.1852, "mean_token_accuracy": 0.1901336207985878, "num_tokens": 27915353.0, "step": 16090 }, { "entropy": 5.546068525314331, "epoch": 1.252246644621669, "grad_norm": 1.0546875, "learning_rate": 0.00048462220247029783, "loss": 5.1022, "mean_token_accuracy": 0.1912755399942398, "num_tokens": 27923980.0, "step": 16095 }, { "entropy": 5.583468008041382, "epoch": 1.2526356739933866, "grad_norm": 1.1328125, "learning_rate": 0.00048461213052925265, "loss": 5.1839, "mean_token_accuracy": 0.18978094011545182, "num_tokens": 27932760.0, "step": 16100 }, { "entropy": 5.566206312179565, "epoch": 1.253024703365104, "grad_norm": 1.046875, "learning_rate": 0.0004846020554076771, "loss": 5.0548, "mean_token_accuracy": 0.1946013256907463, "num_tokens": 27941328.0, "step": 16105 }, { "entropy": 5.618392658233643, "epoch": 1.2534137327368216, "grad_norm": 1.1015625, "learning_rate": 0.0004845919771057239, "loss": 5.2321, "mean_token_accuracy": 0.18288879096508026, "num_tokens": 27949597.0, "step": 16110 }, { "entropy": 5.626197052001953, "epoch": 1.2538027621085392, "grad_norm": 0.97265625, "learning_rate": 0.0004845818956235462, "loss": 5.1073, "mean_token_accuracy": 0.19146668463945388, "num_tokens": 27958798.0, "step": 16115 }, { "entropy": 5.615036678314209, "epoch": 1.2541917914802567, "grad_norm": 1.1015625, "learning_rate": 0.00048457181096129664, "loss": 5.0582, "mean_token_accuracy": 0.19657903015613556, "num_tokens": 27967582.0, "step": 16120 }, { "entropy": 5.565688276290894, "epoch": 1.2545808208519742, "grad_norm": 1.09375, "learning_rate": 0.0004845617231191285, "loss": 5.0449, "mean_token_accuracy": 0.18856090158224106, "num_tokens": 27975959.0, "step": 16125 }, { "entropy": 5.560848379135132, "epoch": 1.254969850223692, "grad_norm": 1.140625, "learning_rate": 0.0004845516320971948, "loss": 5.0679, "mean_token_accuracy": 0.1995279684662819, "num_tokens": 27983980.0, "step": 16130 }, { "entropy": 5.565843915939331, "epoch": 1.2553588795954094, "grad_norm": 1.1015625, "learning_rate": 0.0004845415378956486, "loss": 4.9683, "mean_token_accuracy": 0.1910046696662903, "num_tokens": 27992563.0, "step": 16135 }, { "entropy": 5.548493051528931, "epoch": 1.255747908967127, "grad_norm": 1.015625, "learning_rate": 0.000484531440514643, "loss": 4.97, "mean_token_accuracy": 0.20675093978643416, "num_tokens": 28001457.0, "step": 16140 }, { "entropy": 5.664248275756836, "epoch": 1.2561369383388445, "grad_norm": 1.0859375, "learning_rate": 0.00048452133995433136, "loss": 5.1392, "mean_token_accuracy": 0.18932852298021316, "num_tokens": 28009507.0, "step": 16145 }, { "entropy": 5.508557224273682, "epoch": 1.2565259677105622, "grad_norm": 1.0078125, "learning_rate": 0.0004845112362148668, "loss": 5.0821, "mean_token_accuracy": 0.18782061338424683, "num_tokens": 28017858.0, "step": 16150 }, { "entropy": 5.619452667236328, "epoch": 1.2569149970822797, "grad_norm": 1.078125, "learning_rate": 0.0004845011292964028, "loss": 5.147, "mean_token_accuracy": 0.19194145649671554, "num_tokens": 28026832.0, "step": 16155 }, { "entropy": 5.63121919631958, "epoch": 1.2573040264539972, "grad_norm": 1.15625, "learning_rate": 0.00048449101919909265, "loss": 5.0282, "mean_token_accuracy": 0.19895150065422057, "num_tokens": 28034546.0, "step": 16160 }, { "entropy": 5.547819375991821, "epoch": 1.257693055825715, "grad_norm": 1.078125, "learning_rate": 0.00048448090592308955, "loss": 5.102, "mean_token_accuracy": 0.18822899013757705, "num_tokens": 28043400.0, "step": 16165 }, { "entropy": 5.516633176803589, "epoch": 1.2580820851974324, "grad_norm": 1.125, "learning_rate": 0.0004844707894685473, "loss": 5.0692, "mean_token_accuracy": 0.19954805225133895, "num_tokens": 28052764.0, "step": 16170 }, { "entropy": 5.6272422790527346, "epoch": 1.2584711145691498, "grad_norm": 0.98828125, "learning_rate": 0.0004844606698356192, "loss": 5.148, "mean_token_accuracy": 0.1852506160736084, "num_tokens": 28061859.0, "step": 16175 }, { "entropy": 5.596032905578613, "epoch": 1.2588601439408675, "grad_norm": 0.9921875, "learning_rate": 0.0004844505470244588, "loss": 5.0273, "mean_token_accuracy": 0.1958564728498459, "num_tokens": 28070935.0, "step": 16180 }, { "entropy": 5.6125835418701175, "epoch": 1.2592491733125852, "grad_norm": 1.0859375, "learning_rate": 0.0004844404210352197, "loss": 5.0962, "mean_token_accuracy": 0.18744837492704391, "num_tokens": 28079864.0, "step": 16185 }, { "entropy": 5.515648889541626, "epoch": 1.2596382026843027, "grad_norm": 1.0078125, "learning_rate": 0.00048443029186805554, "loss": 4.9706, "mean_token_accuracy": 0.1960033118724823, "num_tokens": 28088938.0, "step": 16190 }, { "entropy": 5.558675241470337, "epoch": 1.2600272320560202, "grad_norm": 1.0546875, "learning_rate": 0.0004844201595231201, "loss": 5.0844, "mean_token_accuracy": 0.19341787099838256, "num_tokens": 28097213.0, "step": 16195 }, { "entropy": 5.5612386703491214, "epoch": 1.2604162614277379, "grad_norm": 1.078125, "learning_rate": 0.00048441002400056706, "loss": 5.1093, "mean_token_accuracy": 0.19028161615133285, "num_tokens": 28105187.0, "step": 16200 }, { "entropy": 5.584390592575073, "epoch": 1.2608052907994554, "grad_norm": 1.1328125, "learning_rate": 0.0004843998853005502, "loss": 5.0666, "mean_token_accuracy": 0.19468899965286254, "num_tokens": 28113238.0, "step": 16205 }, { "entropy": 5.540847206115723, "epoch": 1.2611943201711728, "grad_norm": 1.0546875, "learning_rate": 0.0004843897434232233, "loss": 5.0032, "mean_token_accuracy": 0.19913533926010132, "num_tokens": 28121502.0, "step": 16210 }, { "entropy": 5.5665552616119385, "epoch": 1.2615833495428905, "grad_norm": 1.109375, "learning_rate": 0.00048437959836874047, "loss": 5.088, "mean_token_accuracy": 0.19445707499980927, "num_tokens": 28130269.0, "step": 16215 }, { "entropy": 5.601376152038574, "epoch": 1.261972378914608, "grad_norm": 1.0234375, "learning_rate": 0.00048436945013725544, "loss": 5.2229, "mean_token_accuracy": 0.18307623118162156, "num_tokens": 28139482.0, "step": 16220 }, { "entropy": 5.602341842651367, "epoch": 1.2623614082863255, "grad_norm": 1.171875, "learning_rate": 0.00048435929872892226, "loss": 5.175, "mean_token_accuracy": 0.19212170094251632, "num_tokens": 28148443.0, "step": 16225 }, { "entropy": 5.628897380828858, "epoch": 1.2627504376580432, "grad_norm": 1.0859375, "learning_rate": 0.0004843491441438949, "loss": 5.031, "mean_token_accuracy": 0.19913185238838196, "num_tokens": 28156807.0, "step": 16230 }, { "entropy": 5.567248439788818, "epoch": 1.2631394670297609, "grad_norm": 1.140625, "learning_rate": 0.00048433898638232755, "loss": 5.0874, "mean_token_accuracy": 0.19673034697771072, "num_tokens": 28165019.0, "step": 16235 }, { "entropy": 5.561327791213989, "epoch": 1.2635284964014784, "grad_norm": 1.140625, "learning_rate": 0.0004843288254443742, "loss": 5.1295, "mean_token_accuracy": 0.1899797186255455, "num_tokens": 28173505.0, "step": 16240 }, { "entropy": 5.6576591491699215, "epoch": 1.2639175257731958, "grad_norm": 1.0546875, "learning_rate": 0.0004843186613301892, "loss": 5.1607, "mean_token_accuracy": 0.18639736324548722, "num_tokens": 28182524.0, "step": 16245 }, { "entropy": 5.662319087982178, "epoch": 1.2643065551449135, "grad_norm": 1.15625, "learning_rate": 0.0004843084940399266, "loss": 5.207, "mean_token_accuracy": 0.18318491876125337, "num_tokens": 28191093.0, "step": 16250 }, { "entropy": 5.591050243377685, "epoch": 1.264695584516631, "grad_norm": 1.1328125, "learning_rate": 0.0004842983235737408, "loss": 5.0964, "mean_token_accuracy": 0.18838854879140854, "num_tokens": 28199092.0, "step": 16255 }, { "entropy": 5.657285737991333, "epoch": 1.2650846138883485, "grad_norm": 1.09375, "learning_rate": 0.0004842881499317861, "loss": 5.1784, "mean_token_accuracy": 0.1909079894423485, "num_tokens": 28207341.0, "step": 16260 }, { "entropy": 5.6056070804595945, "epoch": 1.2654736432600662, "grad_norm": 1.09375, "learning_rate": 0.0004842779731142168, "loss": 5.0872, "mean_token_accuracy": 0.1917978510260582, "num_tokens": 28216370.0, "step": 16265 }, { "entropy": 5.605053567886353, "epoch": 1.2658626726317836, "grad_norm": 1.1171875, "learning_rate": 0.00048426779312118735, "loss": 5.1234, "mean_token_accuracy": 0.19039810448884964, "num_tokens": 28224554.0, "step": 16270 }, { "entropy": 5.663516330718994, "epoch": 1.2662517020035013, "grad_norm": 1.0234375, "learning_rate": 0.0004842576099528522, "loss": 5.1525, "mean_token_accuracy": 0.18665037900209427, "num_tokens": 28232672.0, "step": 16275 }, { "entropy": 5.551630687713623, "epoch": 1.2666407313752188, "grad_norm": 1.0625, "learning_rate": 0.0004842474236093659, "loss": 4.9758, "mean_token_accuracy": 0.19758483916521072, "num_tokens": 28240730.0, "step": 16280 }, { "entropy": 5.5807586193084715, "epoch": 1.2670297607469365, "grad_norm": 1.109375, "learning_rate": 0.00048423723409088306, "loss": 5.0974, "mean_token_accuracy": 0.1906809017062187, "num_tokens": 28248989.0, "step": 16285 }, { "entropy": 5.6339654445648195, "epoch": 1.267418790118654, "grad_norm": 1.234375, "learning_rate": 0.0004842270413975582, "loss": 5.177, "mean_token_accuracy": 0.1912175014615059, "num_tokens": 28256900.0, "step": 16290 }, { "entropy": 5.648556184768677, "epoch": 1.2678078194903715, "grad_norm": 1.0703125, "learning_rate": 0.000484216845529546, "loss": 5.1246, "mean_token_accuracy": 0.18360855877399446, "num_tokens": 28265832.0, "step": 16295 }, { "entropy": 5.56776704788208, "epoch": 1.2681968488620892, "grad_norm": 1.078125, "learning_rate": 0.00048420664648700113, "loss": 5.0134, "mean_token_accuracy": 0.19365309178829193, "num_tokens": 28274661.0, "step": 16300 }, { "entropy": 5.614473009109497, "epoch": 1.2685858782338066, "grad_norm": 1.1328125, "learning_rate": 0.0004841964442700784, "loss": 5.0773, "mean_token_accuracy": 0.19184325635433197, "num_tokens": 28283303.0, "step": 16305 }, { "entropy": 5.57660059928894, "epoch": 1.2689749076055241, "grad_norm": 1.1171875, "learning_rate": 0.00048418623887893264, "loss": 4.9794, "mean_token_accuracy": 0.19630232751369475, "num_tokens": 28291660.0, "step": 16310 }, { "entropy": 5.5983765602111815, "epoch": 1.2693639369772418, "grad_norm": 1.2109375, "learning_rate": 0.00048417603031371867, "loss": 5.1414, "mean_token_accuracy": 0.18618385791778563, "num_tokens": 28301314.0, "step": 16315 }, { "entropy": 5.598386764526367, "epoch": 1.2697529663489593, "grad_norm": 1.03125, "learning_rate": 0.0004841658185745913, "loss": 5.0897, "mean_token_accuracy": 0.19332052618265153, "num_tokens": 28310044.0, "step": 16320 }, { "entropy": 5.720161008834839, "epoch": 1.270141995720677, "grad_norm": 1.1796875, "learning_rate": 0.00048415560366170564, "loss": 5.1888, "mean_token_accuracy": 0.19506587237119674, "num_tokens": 28319773.0, "step": 16325 }, { "entropy": 5.586122369766235, "epoch": 1.2705310250923945, "grad_norm": 1.0390625, "learning_rate": 0.0004841453855752165, "loss": 4.9882, "mean_token_accuracy": 0.19530003964900972, "num_tokens": 28328070.0, "step": 16330 }, { "entropy": 5.587516784667969, "epoch": 1.2709200544641122, "grad_norm": 1.078125, "learning_rate": 0.0004841351643152791, "loss": 5.0815, "mean_token_accuracy": 0.1963294342160225, "num_tokens": 28337636.0, "step": 16335 }, { "entropy": 5.4862799644470215, "epoch": 1.2713090838358296, "grad_norm": 1.1015625, "learning_rate": 0.0004841249398820485, "loss": 5.0875, "mean_token_accuracy": 0.19166263937950134, "num_tokens": 28346609.0, "step": 16340 }, { "entropy": 5.587266969680786, "epoch": 1.271698113207547, "grad_norm": 1.0078125, "learning_rate": 0.0004841147122756797, "loss": 5.1128, "mean_token_accuracy": 0.19189873486757278, "num_tokens": 28355395.0, "step": 16345 }, { "entropy": 5.569062089920044, "epoch": 1.2720871425792648, "grad_norm": 1.09375, "learning_rate": 0.000484104481496328, "loss": 5.1861, "mean_token_accuracy": 0.1872741088271141, "num_tokens": 28364447.0, "step": 16350 }, { "entropy": 5.62692928314209, "epoch": 1.2724761719509823, "grad_norm": 1.0234375, "learning_rate": 0.0004840942475441486, "loss": 5.1193, "mean_token_accuracy": 0.19126724004745482, "num_tokens": 28372872.0, "step": 16355 }, { "entropy": 5.608555316925049, "epoch": 1.2728652013226998, "grad_norm": 1.140625, "learning_rate": 0.0004840840104192969, "loss": 4.9748, "mean_token_accuracy": 0.19754622876644135, "num_tokens": 28380840.0, "step": 16360 }, { "entropy": 5.5594652652740475, "epoch": 1.2732542306944175, "grad_norm": 0.93359375, "learning_rate": 0.000484073770121928, "loss": 5.0421, "mean_token_accuracy": 0.19092322736978531, "num_tokens": 28390417.0, "step": 16365 }, { "entropy": 5.574447917938232, "epoch": 1.273643260066135, "grad_norm": 1.046875, "learning_rate": 0.0004840635266521975, "loss": 5.0974, "mean_token_accuracy": 0.18769218474626542, "num_tokens": 28400101.0, "step": 16370 }, { "entropy": 5.525232982635498, "epoch": 1.2740322894378526, "grad_norm": 1.03125, "learning_rate": 0.0004840532800102607, "loss": 5.0204, "mean_token_accuracy": 0.19470336884260178, "num_tokens": 28408336.0, "step": 16375 }, { "entropy": 5.551790523529053, "epoch": 1.27442131880957, "grad_norm": 1.1328125, "learning_rate": 0.00048404303019627314, "loss": 5.044, "mean_token_accuracy": 0.19560120701789857, "num_tokens": 28416985.0, "step": 16380 }, { "entropy": 5.593158912658692, "epoch": 1.2748103481812878, "grad_norm": 1.125, "learning_rate": 0.00048403277721039036, "loss": 5.2012, "mean_token_accuracy": 0.18230695575475692, "num_tokens": 28425543.0, "step": 16385 }, { "entropy": 5.609423542022705, "epoch": 1.2751993775530053, "grad_norm": 1.15625, "learning_rate": 0.0004840225210527679, "loss": 5.135, "mean_token_accuracy": 0.187672358751297, "num_tokens": 28435151.0, "step": 16390 }, { "entropy": 5.618977832794189, "epoch": 1.2755884069247228, "grad_norm": 1.078125, "learning_rate": 0.0004840122617235613, "loss": 5.1311, "mean_token_accuracy": 0.18690426051616668, "num_tokens": 28444535.0, "step": 16395 }, { "entropy": 5.647767162322998, "epoch": 1.2759774362964404, "grad_norm": 1.1640625, "learning_rate": 0.0004840019992229263, "loss": 5.0739, "mean_token_accuracy": 0.19250009953975677, "num_tokens": 28452852.0, "step": 16400 }, { "entropy": 5.61885347366333, "epoch": 1.276366465668158, "grad_norm": 1.1171875, "learning_rate": 0.00048399173355101867, "loss": 5.1149, "mean_token_accuracy": 0.18428053855895996, "num_tokens": 28462573.0, "step": 16405 }, { "entropy": 5.649799156188965, "epoch": 1.2767554950398754, "grad_norm": 1.078125, "learning_rate": 0.00048398146470799417, "loss": 5.1763, "mean_token_accuracy": 0.18333609849214555, "num_tokens": 28471714.0, "step": 16410 }, { "entropy": 5.566230726242066, "epoch": 1.277144524411593, "grad_norm": 1.1015625, "learning_rate": 0.00048397119269400846, "loss": 5.0476, "mean_token_accuracy": 0.20105839818716048, "num_tokens": 28479989.0, "step": 16415 }, { "entropy": 5.571966981887817, "epoch": 1.2775335537833106, "grad_norm": 1.1640625, "learning_rate": 0.00048396091750921766, "loss": 5.0956, "mean_token_accuracy": 0.1905428558588028, "num_tokens": 28488707.0, "step": 16420 }, { "entropy": 5.672205829620362, "epoch": 1.2779225831550283, "grad_norm": 1.1640625, "learning_rate": 0.0004839506391537774, "loss": 5.2359, "mean_token_accuracy": 0.18538480401039123, "num_tokens": 28497228.0, "step": 16425 }, { "entropy": 5.660464096069336, "epoch": 1.2783116125267457, "grad_norm": 1.125, "learning_rate": 0.0004839403576278438, "loss": 5.0881, "mean_token_accuracy": 0.1925577163696289, "num_tokens": 28505604.0, "step": 16430 }, { "entropy": 5.5633667469024655, "epoch": 1.2787006418984634, "grad_norm": 1.2265625, "learning_rate": 0.0004839300729315729, "loss": 5.1376, "mean_token_accuracy": 0.18924558013677598, "num_tokens": 28514798.0, "step": 16435 }, { "entropy": 5.6681187629699705, "epoch": 1.279089671270181, "grad_norm": 1.1484375, "learning_rate": 0.0004839197850651206, "loss": 5.1366, "mean_token_accuracy": 0.1956767573952675, "num_tokens": 28523883.0, "step": 16440 }, { "entropy": 5.626384449005127, "epoch": 1.2794787006418984, "grad_norm": 1.1484375, "learning_rate": 0.00048390949402864317, "loss": 5.1232, "mean_token_accuracy": 0.18650213479995728, "num_tokens": 28532290.0, "step": 16445 }, { "entropy": 5.53694715499878, "epoch": 1.279867730013616, "grad_norm": 1.15625, "learning_rate": 0.00048389919982229666, "loss": 5.0439, "mean_token_accuracy": 0.19717105180025102, "num_tokens": 28540775.0, "step": 16450 }, { "entropy": 5.570633745193481, "epoch": 1.2802567593853336, "grad_norm": 1.125, "learning_rate": 0.00048388890244623723, "loss": 5.1526, "mean_token_accuracy": 0.187069371342659, "num_tokens": 28549517.0, "step": 16455 }, { "entropy": 5.612607765197754, "epoch": 1.280645788757051, "grad_norm": 1.109375, "learning_rate": 0.0004838786019006213, "loss": 5.1072, "mean_token_accuracy": 0.19305062144994736, "num_tokens": 28557708.0, "step": 16460 }, { "entropy": 5.638970041275025, "epoch": 1.2810348181287687, "grad_norm": 1.03125, "learning_rate": 0.00048386829818560493, "loss": 5.118, "mean_token_accuracy": 0.18778360188007354, "num_tokens": 28566912.0, "step": 16465 }, { "entropy": 5.556902313232422, "epoch": 1.2814238475004862, "grad_norm": 0.9921875, "learning_rate": 0.00048385799130134464, "loss": 5.1253, "mean_token_accuracy": 0.18722086399793625, "num_tokens": 28577104.0, "step": 16470 }, { "entropy": 5.558637285232544, "epoch": 1.281812876872204, "grad_norm": 1.0625, "learning_rate": 0.0004838476812479968, "loss": 5.1151, "mean_token_accuracy": 0.18765891641378402, "num_tokens": 28585984.0, "step": 16475 }, { "entropy": 5.636599922180176, "epoch": 1.2822019062439214, "grad_norm": 1.0390625, "learning_rate": 0.00048383736802571774, "loss": 5.1455, "mean_token_accuracy": 0.18856384754180908, "num_tokens": 28594945.0, "step": 16480 }, { "entropy": 5.701941633224488, "epoch": 1.282590935615639, "grad_norm": 1.0859375, "learning_rate": 0.000483827051634664, "loss": 5.1687, "mean_token_accuracy": 0.186891108751297, "num_tokens": 28603546.0, "step": 16485 }, { "entropy": 5.6071686267852785, "epoch": 1.2829799649873566, "grad_norm": 1.0703125, "learning_rate": 0.00048381673207499224, "loss": 5.1071, "mean_token_accuracy": 0.19561906456947326, "num_tokens": 28612057.0, "step": 16490 }, { "entropy": 5.540022325515747, "epoch": 1.283368994359074, "grad_norm": 1.125, "learning_rate": 0.0004838064093468588, "loss": 5.063, "mean_token_accuracy": 0.18930589854717256, "num_tokens": 28620945.0, "step": 16495 }, { "entropy": 5.525605964660644, "epoch": 1.2837580237307917, "grad_norm": 1.078125, "learning_rate": 0.0004837960834504206, "loss": 4.9635, "mean_token_accuracy": 0.2052335560321808, "num_tokens": 28629028.0, "step": 16500 }, { "entropy": 5.527144479751587, "epoch": 1.2841470531025092, "grad_norm": 0.96875, "learning_rate": 0.0004837857543858341, "loss": 5.0221, "mean_token_accuracy": 0.19998676031827928, "num_tokens": 28637533.0, "step": 16505 }, { "entropy": 5.626755571365356, "epoch": 1.2845360824742267, "grad_norm": 1.078125, "learning_rate": 0.0004837754221532561, "loss": 5.1699, "mean_token_accuracy": 0.18968948125839233, "num_tokens": 28646906.0, "step": 16510 }, { "entropy": 5.558996725082397, "epoch": 1.2849251118459444, "grad_norm": 1.140625, "learning_rate": 0.00048376508675284334, "loss": 5.0473, "mean_token_accuracy": 0.199790096282959, "num_tokens": 28655597.0, "step": 16515 }, { "entropy": 5.644053602218628, "epoch": 1.2853141412176619, "grad_norm": 1.1484375, "learning_rate": 0.00048375474818475274, "loss": 5.1807, "mean_token_accuracy": 0.18855624198913573, "num_tokens": 28664806.0, "step": 16520 }, { "entropy": 5.5634369373321535, "epoch": 1.2857031705893796, "grad_norm": 1.0546875, "learning_rate": 0.00048374440644914104, "loss": 5.0241, "mean_token_accuracy": 0.20249858498573303, "num_tokens": 28673610.0, "step": 16525 }, { "entropy": 5.611365222930909, "epoch": 1.286092199961097, "grad_norm": 1.0859375, "learning_rate": 0.00048373406154616523, "loss": 5.0798, "mean_token_accuracy": 0.19193932712078093, "num_tokens": 28681726.0, "step": 16530 }, { "entropy": 5.653905534744263, "epoch": 1.2864812293328147, "grad_norm": 1.046875, "learning_rate": 0.00048372371347598226, "loss": 5.2393, "mean_token_accuracy": 0.17713529914617537, "num_tokens": 28691014.0, "step": 16535 }, { "entropy": 5.632786226272583, "epoch": 1.2868702587045322, "grad_norm": 1.0546875, "learning_rate": 0.00048371336223874923, "loss": 5.1223, "mean_token_accuracy": 0.18437448889017105, "num_tokens": 28699304.0, "step": 16540 }, { "entropy": 5.633014917373657, "epoch": 1.2872592880762497, "grad_norm": 1.109375, "learning_rate": 0.000483703007834623, "loss": 5.0416, "mean_token_accuracy": 0.19493970274925232, "num_tokens": 28707950.0, "step": 16545 }, { "entropy": 5.540950584411621, "epoch": 1.2876483174479674, "grad_norm": 1.0859375, "learning_rate": 0.0004836926502637609, "loss": 5.0564, "mean_token_accuracy": 0.19928259402513504, "num_tokens": 28716678.0, "step": 16550 }, { "entropy": 5.5410106658935545, "epoch": 1.2880373468196848, "grad_norm": 1.0234375, "learning_rate": 0.00048368228952632005, "loss": 5.0783, "mean_token_accuracy": 0.20132799297571183, "num_tokens": 28725658.0, "step": 16555 }, { "entropy": 5.645573425292969, "epoch": 1.2884263761914023, "grad_norm": 1.125, "learning_rate": 0.00048367192562245756, "loss": 5.1198, "mean_token_accuracy": 0.19349722415208817, "num_tokens": 28733859.0, "step": 16560 }, { "entropy": 5.52505316734314, "epoch": 1.28881540556312, "grad_norm": 1.0390625, "learning_rate": 0.00048366155855233067, "loss": 5.0158, "mean_token_accuracy": 0.19758519530296326, "num_tokens": 28741941.0, "step": 16565 }, { "entropy": 5.5179039478302006, "epoch": 1.2892044349348377, "grad_norm": 1.1015625, "learning_rate": 0.0004836511883160968, "loss": 4.9459, "mean_token_accuracy": 0.20259023755788802, "num_tokens": 28750296.0, "step": 16570 }, { "entropy": 5.4994813919067385, "epoch": 1.2895934643065552, "grad_norm": 1.203125, "learning_rate": 0.0004836408149139133, "loss": 4.9406, "mean_token_accuracy": 0.2073293909430504, "num_tokens": 28758359.0, "step": 16575 }, { "entropy": 5.61463098526001, "epoch": 1.2899824936782727, "grad_norm": 1.03125, "learning_rate": 0.00048363043834593743, "loss": 5.14, "mean_token_accuracy": 0.1906037822365761, "num_tokens": 28766944.0, "step": 16580 }, { "entropy": 5.593300628662109, "epoch": 1.2903715230499904, "grad_norm": 1.0625, "learning_rate": 0.0004836200586123268, "loss": 5.1483, "mean_token_accuracy": 0.1891775071620941, "num_tokens": 28775897.0, "step": 16585 }, { "entropy": 5.550483894348145, "epoch": 1.2907605524217078, "grad_norm": 1.046875, "learning_rate": 0.00048360967571323875, "loss": 5.0644, "mean_token_accuracy": 0.19618291705846785, "num_tokens": 28784509.0, "step": 16590 }, { "entropy": 5.515319347381592, "epoch": 1.2911495817934253, "grad_norm": 1.09375, "learning_rate": 0.00048359928964883094, "loss": 4.9466, "mean_token_accuracy": 0.20244549214839935, "num_tokens": 28793347.0, "step": 16595 }, { "entropy": 5.5574531078338625, "epoch": 1.291538611165143, "grad_norm": 1.1328125, "learning_rate": 0.000483588900419261, "loss": 5.0429, "mean_token_accuracy": 0.19651865363121032, "num_tokens": 28801100.0, "step": 16600 }, { "entropy": 5.504043054580689, "epoch": 1.2919276405368605, "grad_norm": 1.109375, "learning_rate": 0.0004835785080246864, "loss": 5.0202, "mean_token_accuracy": 0.19907681792974471, "num_tokens": 28809508.0, "step": 16605 }, { "entropy": 5.556125164031982, "epoch": 1.292316669908578, "grad_norm": 1.1171875, "learning_rate": 0.000483568112465265, "loss": 5.1015, "mean_token_accuracy": 0.1911289930343628, "num_tokens": 28819263.0, "step": 16610 }, { "entropy": 5.6806353569030765, "epoch": 1.2927056992802957, "grad_norm": 1.15625, "learning_rate": 0.00048355771374115436, "loss": 5.188, "mean_token_accuracy": 0.1793963521718979, "num_tokens": 28827316.0, "step": 16615 }, { "entropy": 5.634837627410889, "epoch": 1.2930947286520134, "grad_norm": 1.1015625, "learning_rate": 0.0004835473118525125, "loss": 5.1937, "mean_token_accuracy": 0.18826982378959656, "num_tokens": 28836272.0, "step": 16620 }, { "entropy": 5.567659711837768, "epoch": 1.2934837580237308, "grad_norm": 1.09375, "learning_rate": 0.0004835369067994971, "loss": 5.0773, "mean_token_accuracy": 0.19229266941547393, "num_tokens": 28845180.0, "step": 16625 }, { "entropy": 5.560893630981445, "epoch": 1.2938727873954483, "grad_norm": 1.1484375, "learning_rate": 0.000483526498582266, "loss": 5.0406, "mean_token_accuracy": 0.1899822846055031, "num_tokens": 28853903.0, "step": 16630 }, { "entropy": 5.557149267196655, "epoch": 1.294261816767166, "grad_norm": 1.03125, "learning_rate": 0.00048351608720097715, "loss": 5.0591, "mean_token_accuracy": 0.1918584644794464, "num_tokens": 28863071.0, "step": 16635 }, { "entropy": 5.6259753704071045, "epoch": 1.2946508461388835, "grad_norm": 1.09375, "learning_rate": 0.00048350567265578867, "loss": 5.1436, "mean_token_accuracy": 0.18397480845451356, "num_tokens": 28871620.0, "step": 16640 }, { "entropy": 5.669278907775879, "epoch": 1.295039875510601, "grad_norm": 1.0078125, "learning_rate": 0.0004834952549468584, "loss": 5.1861, "mean_token_accuracy": 0.18329119980335234, "num_tokens": 28879940.0, "step": 16645 }, { "entropy": 5.663364696502685, "epoch": 1.2954289048823187, "grad_norm": 1.015625, "learning_rate": 0.0004834848340743446, "loss": 5.188, "mean_token_accuracy": 0.18708661198616028, "num_tokens": 28889012.0, "step": 16650 }, { "entropy": 5.593817567825317, "epoch": 1.2958179342540361, "grad_norm": 1.078125, "learning_rate": 0.0004834744100384052, "loss": 5.0649, "mean_token_accuracy": 0.19851250797510148, "num_tokens": 28897312.0, "step": 16655 }, { "entropy": 5.596896457672119, "epoch": 1.2962069636257538, "grad_norm": 1.09375, "learning_rate": 0.0004834639828391984, "loss": 5.0228, "mean_token_accuracy": 0.20130644738674164, "num_tokens": 28905977.0, "step": 16660 }, { "entropy": 5.5150003910064695, "epoch": 1.2965959929974713, "grad_norm": 1.078125, "learning_rate": 0.00048345355247688256, "loss": 5.0315, "mean_token_accuracy": 0.19771711081266402, "num_tokens": 28913979.0, "step": 16665 }, { "entropy": 5.565609741210937, "epoch": 1.296985022369189, "grad_norm": 1.140625, "learning_rate": 0.0004834431189516158, "loss": 5.0589, "mean_token_accuracy": 0.19748270362615586, "num_tokens": 28922090.0, "step": 16670 }, { "entropy": 5.644658708572388, "epoch": 1.2973740517409065, "grad_norm": 1.203125, "learning_rate": 0.0004834326822635565, "loss": 5.196, "mean_token_accuracy": 0.1837651640176773, "num_tokens": 28930816.0, "step": 16675 }, { "entropy": 5.634592819213867, "epoch": 1.297763081112624, "grad_norm": 1.1015625, "learning_rate": 0.00048342224241286296, "loss": 5.1681, "mean_token_accuracy": 0.18510053902864457, "num_tokens": 28939125.0, "step": 16680 }, { "entropy": 5.5525157928466795, "epoch": 1.2981521104843416, "grad_norm": 1.0625, "learning_rate": 0.0004834117993996937, "loss": 5.0497, "mean_token_accuracy": 0.19919029921293258, "num_tokens": 28947783.0, "step": 16685 }, { "entropy": 5.677631807327271, "epoch": 1.2985411398560591, "grad_norm": 1.1015625, "learning_rate": 0.0004834013532242071, "loss": 5.1768, "mean_token_accuracy": 0.19040046632289886, "num_tokens": 28957305.0, "step": 16690 }, { "entropy": 5.6526202201843265, "epoch": 1.2989301692277766, "grad_norm": 1.1015625, "learning_rate": 0.0004833909038865616, "loss": 5.1309, "mean_token_accuracy": 0.18405349999666215, "num_tokens": 28965757.0, "step": 16695 }, { "entropy": 5.632620620727539, "epoch": 1.2993191985994943, "grad_norm": 1.0859375, "learning_rate": 0.0004833804513869159, "loss": 5.1242, "mean_token_accuracy": 0.19095647931098939, "num_tokens": 28974846.0, "step": 16700 }, { "entropy": 5.501182699203492, "epoch": 1.2997082279712118, "grad_norm": 1.0546875, "learning_rate": 0.0004833699957254284, "loss": 4.9758, "mean_token_accuracy": 0.19298425763845445, "num_tokens": 28984060.0, "step": 16705 }, { "entropy": 5.580200910568237, "epoch": 1.3000972573429295, "grad_norm": 1.0625, "learning_rate": 0.000483359536902258, "loss": 5.0239, "mean_token_accuracy": 0.19201190173625945, "num_tokens": 28992705.0, "step": 16710 }, { "entropy": 5.635155057907104, "epoch": 1.300486286714647, "grad_norm": 1.078125, "learning_rate": 0.0004833490749175632, "loss": 5.1393, "mean_token_accuracy": 0.19078140705823898, "num_tokens": 29001306.0, "step": 16715 }, { "entropy": 5.588790416717529, "epoch": 1.3008753160863646, "grad_norm": 1.15625, "learning_rate": 0.00048333860977150286, "loss": 5.143, "mean_token_accuracy": 0.19001102298498154, "num_tokens": 29010371.0, "step": 16720 }, { "entropy": 5.6419358253479, "epoch": 1.3012643454580821, "grad_norm": 1.0234375, "learning_rate": 0.00048332814146423566, "loss": 5.1004, "mean_token_accuracy": 0.19558511972427367, "num_tokens": 29019940.0, "step": 16725 }, { "entropy": 5.660441589355469, "epoch": 1.3016533748297996, "grad_norm": 1.125, "learning_rate": 0.0004833176699959206, "loss": 5.1284, "mean_token_accuracy": 0.19217051714658737, "num_tokens": 29027644.0, "step": 16730 }, { "entropy": 5.57693076133728, "epoch": 1.3020424042015173, "grad_norm": 1.140625, "learning_rate": 0.00048330719536671633, "loss": 5.0715, "mean_token_accuracy": 0.19291132539510727, "num_tokens": 29035166.0, "step": 16735 }, { "entropy": 5.517680549621582, "epoch": 1.3024314335732348, "grad_norm": 1.0, "learning_rate": 0.000483296717576782, "loss": 5.0236, "mean_token_accuracy": 0.19569295942783355, "num_tokens": 29044539.0, "step": 16740 }, { "entropy": 5.588887453079224, "epoch": 1.3028204629449522, "grad_norm": 1.0390625, "learning_rate": 0.0004832862366262765, "loss": 5.0743, "mean_token_accuracy": 0.2067807838320732, "num_tokens": 29052849.0, "step": 16745 }, { "entropy": 5.552817726135254, "epoch": 1.30320949231667, "grad_norm": 1.046875, "learning_rate": 0.00048327575251535886, "loss": 5.0801, "mean_token_accuracy": 0.18806463479995728, "num_tokens": 29061881.0, "step": 16750 }, { "entropy": 5.706825923919678, "epoch": 1.3035985216883874, "grad_norm": 1.0078125, "learning_rate": 0.0004832652652441883, "loss": 5.1506, "mean_token_accuracy": 0.1846309334039688, "num_tokens": 29070460.0, "step": 16755 }, { "entropy": 5.688552808761597, "epoch": 1.303987551060105, "grad_norm": 1.078125, "learning_rate": 0.00048325477481292375, "loss": 5.1726, "mean_token_accuracy": 0.1844995841383934, "num_tokens": 29079061.0, "step": 16760 }, { "entropy": 5.5268206119537355, "epoch": 1.3043765804318226, "grad_norm": 1.0703125, "learning_rate": 0.0004832442812217244, "loss": 5.0562, "mean_token_accuracy": 0.19239771664142608, "num_tokens": 29087525.0, "step": 16765 }, { "entropy": 5.56028995513916, "epoch": 1.3047656098035403, "grad_norm": 1.0234375, "learning_rate": 0.0004832337844707496, "loss": 5.0332, "mean_token_accuracy": 0.19624444991350173, "num_tokens": 29096206.0, "step": 16770 }, { "entropy": 5.653877019882202, "epoch": 1.3051546391752578, "grad_norm": 1.1328125, "learning_rate": 0.00048322328456015855, "loss": 5.2253, "mean_token_accuracy": 0.19010618031024934, "num_tokens": 29105025.0, "step": 16775 }, { "entropy": 5.6057463645935055, "epoch": 1.3055436685469752, "grad_norm": 1.1484375, "learning_rate": 0.00048321278149011053, "loss": 5.1835, "mean_token_accuracy": 0.18936053216457366, "num_tokens": 29113468.0, "step": 16780 }, { "entropy": 5.5992865562438965, "epoch": 1.305932697918693, "grad_norm": 1.0703125, "learning_rate": 0.00048320227526076504, "loss": 5.0798, "mean_token_accuracy": 0.19523320645093917, "num_tokens": 29122904.0, "step": 16785 }, { "entropy": 5.607943916320801, "epoch": 1.3063217272904104, "grad_norm": 1.0234375, "learning_rate": 0.0004831917658722814, "loss": 5.0633, "mean_token_accuracy": 0.20157826095819473, "num_tokens": 29132408.0, "step": 16790 }, { "entropy": 5.648335695266724, "epoch": 1.3067107566621279, "grad_norm": 1.046875, "learning_rate": 0.00048318125332481903, "loss": 5.2157, "mean_token_accuracy": 0.18695988208055497, "num_tokens": 29141840.0, "step": 16795 }, { "entropy": 5.718431091308593, "epoch": 1.3070997860338456, "grad_norm": 1.1015625, "learning_rate": 0.00048317073761853764, "loss": 5.1752, "mean_token_accuracy": 0.18881198167800903, "num_tokens": 29150759.0, "step": 16800 }, { "entropy": 5.544278478622436, "epoch": 1.307488815405563, "grad_norm": 1.1015625, "learning_rate": 0.0004831602187535965, "loss": 4.9853, "mean_token_accuracy": 0.2031836599111557, "num_tokens": 29159489.0, "step": 16805 }, { "entropy": 5.56814866065979, "epoch": 1.3078778447772808, "grad_norm": 1.03125, "learning_rate": 0.0004831496967301554, "loss": 5.0213, "mean_token_accuracy": 0.1931745857000351, "num_tokens": 29168160.0, "step": 16810 }, { "entropy": 5.628138732910156, "epoch": 1.3082668741489982, "grad_norm": 1.1640625, "learning_rate": 0.00048313917154837386, "loss": 5.1058, "mean_token_accuracy": 0.19329580068588256, "num_tokens": 29176534.0, "step": 16815 }, { "entropy": 5.542742204666138, "epoch": 1.308655903520716, "grad_norm": 1.03125, "learning_rate": 0.0004831286432084118, "loss": 5.0077, "mean_token_accuracy": 0.203941248357296, "num_tokens": 29185461.0, "step": 16820 }, { "entropy": 5.604961585998535, "epoch": 1.3090449328924334, "grad_norm": 1.046875, "learning_rate": 0.0004831181117104289, "loss": 5.144, "mean_token_accuracy": 0.18596413284540175, "num_tokens": 29194218.0, "step": 16825 }, { "entropy": 5.577546691894531, "epoch": 1.3094339622641509, "grad_norm": 1.109375, "learning_rate": 0.00048310757705458476, "loss": 5.1079, "mean_token_accuracy": 0.19188106060028076, "num_tokens": 29203720.0, "step": 16830 }, { "entropy": 5.613342523574829, "epoch": 1.3098229916358686, "grad_norm": 1.015625, "learning_rate": 0.00048309703924103944, "loss": 5.1674, "mean_token_accuracy": 0.1892984539270401, "num_tokens": 29212588.0, "step": 16835 }, { "entropy": 5.6453112125396725, "epoch": 1.310212021007586, "grad_norm": 1.1953125, "learning_rate": 0.00048308649826995283, "loss": 5.169, "mean_token_accuracy": 0.1883926883339882, "num_tokens": 29220718.0, "step": 16840 }, { "entropy": 5.6234375, "epoch": 1.3106010503793035, "grad_norm": 1.1484375, "learning_rate": 0.00048307595414148475, "loss": 5.0402, "mean_token_accuracy": 0.19771301746368408, "num_tokens": 29229386.0, "step": 16845 }, { "entropy": 5.604703712463379, "epoch": 1.3109900797510212, "grad_norm": 1.0390625, "learning_rate": 0.0004830654068557952, "loss": 5.0924, "mean_token_accuracy": 0.19491372704505922, "num_tokens": 29238390.0, "step": 16850 }, { "entropy": 5.643201112747192, "epoch": 1.3113791091227387, "grad_norm": 1.203125, "learning_rate": 0.0004830548564130444, "loss": 5.183, "mean_token_accuracy": 0.18927546441555024, "num_tokens": 29246502.0, "step": 16855 }, { "entropy": 5.582104253768921, "epoch": 1.3117681384944564, "grad_norm": 1.109375, "learning_rate": 0.00048304430281339216, "loss": 5.1069, "mean_token_accuracy": 0.1855737254023552, "num_tokens": 29254954.0, "step": 16860 }, { "entropy": 5.606703567504883, "epoch": 1.3121571678661739, "grad_norm": 1.1171875, "learning_rate": 0.0004830337460569989, "loss": 5.0788, "mean_token_accuracy": 0.2005214884877205, "num_tokens": 29263294.0, "step": 16865 }, { "entropy": 5.584879732131958, "epoch": 1.3125461972378916, "grad_norm": 1.1640625, "learning_rate": 0.0004830231861440246, "loss": 5.0548, "mean_token_accuracy": 0.19693197309970856, "num_tokens": 29271737.0, "step": 16870 }, { "entropy": 5.69629430770874, "epoch": 1.312935226609609, "grad_norm": 1.109375, "learning_rate": 0.0004830126230746295, "loss": 5.1933, "mean_token_accuracy": 0.18574800491333007, "num_tokens": 29279473.0, "step": 16875 }, { "entropy": 5.60352578163147, "epoch": 1.3133242559813265, "grad_norm": 1.1015625, "learning_rate": 0.00048300205684897405, "loss": 5.1038, "mean_token_accuracy": 0.20338490307331086, "num_tokens": 29287650.0, "step": 16880 }, { "entropy": 5.600238370895386, "epoch": 1.3137132853530442, "grad_norm": 0.93359375, "learning_rate": 0.0004829914874672184, "loss": 5.1287, "mean_token_accuracy": 0.18724319487810134, "num_tokens": 29296914.0, "step": 16885 }, { "entropy": 5.666216325759888, "epoch": 1.3141023147247617, "grad_norm": 1.0859375, "learning_rate": 0.00048298091492952297, "loss": 5.1136, "mean_token_accuracy": 0.18820077627897264, "num_tokens": 29305409.0, "step": 16890 }, { "entropy": 5.69935245513916, "epoch": 1.3144913440964792, "grad_norm": 1.0, "learning_rate": 0.0004829703392360482, "loss": 5.135, "mean_token_accuracy": 0.18850217014551163, "num_tokens": 29314333.0, "step": 16895 }, { "entropy": 5.510940837860107, "epoch": 1.3148803734681969, "grad_norm": 1.1015625, "learning_rate": 0.00048295976038695455, "loss": 4.9864, "mean_token_accuracy": 0.19643135219812394, "num_tokens": 29323764.0, "step": 16900 }, { "entropy": 5.571589994430542, "epoch": 1.3152694028399143, "grad_norm": 1.1640625, "learning_rate": 0.0004829491783824025, "loss": 5.0723, "mean_token_accuracy": 0.19625774621963502, "num_tokens": 29331734.0, "step": 16905 }, { "entropy": 5.523209047317505, "epoch": 1.315658432211632, "grad_norm": 1.1171875, "learning_rate": 0.00048293859322255276, "loss": 4.9797, "mean_token_accuracy": 0.20637786090373994, "num_tokens": 29339791.0, "step": 16910 }, { "entropy": 5.538656234741211, "epoch": 1.3160474615833495, "grad_norm": 1.0, "learning_rate": 0.0004829280049075657, "loss": 5.1159, "mean_token_accuracy": 0.1856507495045662, "num_tokens": 29348548.0, "step": 16915 }, { "entropy": 5.570025873184204, "epoch": 1.3164364909550672, "grad_norm": 1.1171875, "learning_rate": 0.00048291741343760216, "loss": 5.0421, "mean_token_accuracy": 0.19357602000236512, "num_tokens": 29357151.0, "step": 16920 }, { "entropy": 5.672178745269775, "epoch": 1.3168255203267847, "grad_norm": 1.125, "learning_rate": 0.0004829068188128229, "loss": 5.0379, "mean_token_accuracy": 0.20119286328554153, "num_tokens": 29365643.0, "step": 16925 }, { "entropy": 5.581224250793457, "epoch": 1.3172145496985022, "grad_norm": 1.09375, "learning_rate": 0.0004828962210333885, "loss": 5.1326, "mean_token_accuracy": 0.18838583528995514, "num_tokens": 29374215.0, "step": 16930 }, { "entropy": 5.569288730621338, "epoch": 1.3176035790702199, "grad_norm": 1.078125, "learning_rate": 0.0004828856200994598, "loss": 5.0447, "mean_token_accuracy": 0.19315528720617295, "num_tokens": 29382586.0, "step": 16935 }, { "entropy": 5.535900545120239, "epoch": 1.3179926084419373, "grad_norm": 1.0703125, "learning_rate": 0.0004828750160111978, "loss": 5.1007, "mean_token_accuracy": 0.18802523463964463, "num_tokens": 29391922.0, "step": 16940 }, { "entropy": 5.609203863143921, "epoch": 1.3183816378136548, "grad_norm": 1.0625, "learning_rate": 0.00048286440876876325, "loss": 5.0571, "mean_token_accuracy": 0.19533028900623323, "num_tokens": 29400408.0, "step": 16945 }, { "entropy": 5.56855616569519, "epoch": 1.3187706671853725, "grad_norm": 1.125, "learning_rate": 0.00048285379837231714, "loss": 4.9909, "mean_token_accuracy": 0.20062803030014037, "num_tokens": 29408130.0, "step": 16950 }, { "entropy": 5.617013835906983, "epoch": 1.31915969655709, "grad_norm": 1.09375, "learning_rate": 0.0004828431848220205, "loss": 5.0769, "mean_token_accuracy": 0.19123691767454148, "num_tokens": 29417446.0, "step": 16955 }, { "entropy": 5.649213027954102, "epoch": 1.3195487259288077, "grad_norm": 1.171875, "learning_rate": 0.0004828325681180343, "loss": 5.1492, "mean_token_accuracy": 0.19348373264074326, "num_tokens": 29426023.0, "step": 16960 }, { "entropy": 5.621719026565552, "epoch": 1.3199377553005252, "grad_norm": 1.0546875, "learning_rate": 0.0004828219482605197, "loss": 5.0658, "mean_token_accuracy": 0.194810451567173, "num_tokens": 29434737.0, "step": 16965 }, { "entropy": 5.554741144180298, "epoch": 1.3203267846722428, "grad_norm": 1.1796875, "learning_rate": 0.00048281132524963786, "loss": 5.0852, "mean_token_accuracy": 0.18866194933652877, "num_tokens": 29443926.0, "step": 16970 }, { "entropy": 5.5818909168243405, "epoch": 1.3207158140439603, "grad_norm": 1.0546875, "learning_rate": 0.0004828006990855499, "loss": 5.082, "mean_token_accuracy": 0.19597212225198746, "num_tokens": 29452495.0, "step": 16975 }, { "entropy": 5.557660484313965, "epoch": 1.3211048434156778, "grad_norm": 1.0390625, "learning_rate": 0.00048279006976841704, "loss": 5.0463, "mean_token_accuracy": 0.19332642257213592, "num_tokens": 29460661.0, "step": 16980 }, { "entropy": 5.584459733963013, "epoch": 1.3214938727873955, "grad_norm": 1.0546875, "learning_rate": 0.0004827794372984007, "loss": 5.0413, "mean_token_accuracy": 0.19895520955324172, "num_tokens": 29469155.0, "step": 16985 }, { "entropy": 5.636346054077149, "epoch": 1.321882902159113, "grad_norm": 0.97265625, "learning_rate": 0.000482768801675662, "loss": 5.1516, "mean_token_accuracy": 0.19496320486068724, "num_tokens": 29478220.0, "step": 16990 }, { "entropy": 5.606045913696289, "epoch": 1.3222719315308304, "grad_norm": 1.1171875, "learning_rate": 0.0004827581629003625, "loss": 5.1037, "mean_token_accuracy": 0.19156274050474167, "num_tokens": 29486336.0, "step": 16995 }, { "entropy": 5.654403591156006, "epoch": 1.3226609609025481, "grad_norm": 1.09375, "learning_rate": 0.00048274752097266356, "loss": 5.2119, "mean_token_accuracy": 0.18937937766313553, "num_tokens": 29495150.0, "step": 17000 }, { "entropy": 5.626471328735351, "epoch": 1.3230499902742658, "grad_norm": 1.140625, "learning_rate": 0.0004827368758927266, "loss": 5.0915, "mean_token_accuracy": 0.1930074691772461, "num_tokens": 29503508.0, "step": 17005 }, { "entropy": 5.571884632110596, "epoch": 1.3234390196459833, "grad_norm": 1.0546875, "learning_rate": 0.0004827262276607132, "loss": 5.0703, "mean_token_accuracy": 0.19201896339654922, "num_tokens": 29513038.0, "step": 17010 }, { "entropy": 5.560047960281372, "epoch": 1.3238280490177008, "grad_norm": 1.0546875, "learning_rate": 0.000482715576276785, "loss": 5.0374, "mean_token_accuracy": 0.19725186377763748, "num_tokens": 29521344.0, "step": 17015 }, { "entropy": 5.5897095680236815, "epoch": 1.3242170783894185, "grad_norm": 1.0546875, "learning_rate": 0.0004827049217411035, "loss": 5.1529, "mean_token_accuracy": 0.18654258400201798, "num_tokens": 29530109.0, "step": 17020 }, { "entropy": 5.615104150772095, "epoch": 1.324606107761136, "grad_norm": 1.0390625, "learning_rate": 0.00048269426405383043, "loss": 5.0741, "mean_token_accuracy": 0.18548837006092073, "num_tokens": 29539114.0, "step": 17025 }, { "entropy": 5.609760284423828, "epoch": 1.3249951371328534, "grad_norm": 1.0546875, "learning_rate": 0.00048268360321512745, "loss": 5.1188, "mean_token_accuracy": 0.19076967090368271, "num_tokens": 29548746.0, "step": 17030 }, { "entropy": 5.63235182762146, "epoch": 1.3253841665045711, "grad_norm": 1.0859375, "learning_rate": 0.0004826729392251564, "loss": 5.1562, "mean_token_accuracy": 0.18577359467744828, "num_tokens": 29557681.0, "step": 17035 }, { "entropy": 5.6283042430877686, "epoch": 1.3257731958762886, "grad_norm": 1.2421875, "learning_rate": 0.000482662272084079, "loss": 5.1407, "mean_token_accuracy": 0.19394930452108383, "num_tokens": 29566151.0, "step": 17040 }, { "entropy": 5.558325672149659, "epoch": 1.326162225248006, "grad_norm": 0.99609375, "learning_rate": 0.0004826516017920571, "loss": 4.9518, "mean_token_accuracy": 0.20908219814300538, "num_tokens": 29574853.0, "step": 17045 }, { "entropy": 5.56689190864563, "epoch": 1.3265512546197238, "grad_norm": 1.1015625, "learning_rate": 0.0004826409283492528, "loss": 5.0598, "mean_token_accuracy": 0.19533458203077317, "num_tokens": 29583319.0, "step": 17050 }, { "entropy": 5.5869800567626955, "epoch": 1.3269402839914415, "grad_norm": 1.109375, "learning_rate": 0.00048263025175582783, "loss": 5.1499, "mean_token_accuracy": 0.1880865439772606, "num_tokens": 29591949.0, "step": 17055 }, { "entropy": 5.6449895858764645, "epoch": 1.327329313363159, "grad_norm": 1.1875, "learning_rate": 0.0004826195720119442, "loss": 5.1545, "mean_token_accuracy": 0.18147476613521576, "num_tokens": 29600293.0, "step": 17060 }, { "entropy": 5.657760190963745, "epoch": 1.3277183427348764, "grad_norm": 1.2109375, "learning_rate": 0.0004826088891177641, "loss": 5.1738, "mean_token_accuracy": 0.1958606019616127, "num_tokens": 29608602.0, "step": 17065 }, { "entropy": 5.581202125549316, "epoch": 1.3281073721065941, "grad_norm": 1.1015625, "learning_rate": 0.00048259820307344954, "loss": 5.134, "mean_token_accuracy": 0.19184042662382125, "num_tokens": 29617464.0, "step": 17070 }, { "entropy": 5.619830656051636, "epoch": 1.3284964014783116, "grad_norm": 1.0859375, "learning_rate": 0.00048258751387916267, "loss": 5.0386, "mean_token_accuracy": 0.20158812552690505, "num_tokens": 29626297.0, "step": 17075 }, { "entropy": 5.554988861083984, "epoch": 1.328885430850029, "grad_norm": 1.1484375, "learning_rate": 0.00048257682153506564, "loss": 5.0658, "mean_token_accuracy": 0.19179969131946564, "num_tokens": 29635085.0, "step": 17080 }, { "entropy": 5.552317905426025, "epoch": 1.3292744602217468, "grad_norm": 1.1328125, "learning_rate": 0.0004825661260413208, "loss": 5.051, "mean_token_accuracy": 0.1966339558362961, "num_tokens": 29643528.0, "step": 17085 }, { "entropy": 5.560385084152221, "epoch": 1.3296634895934643, "grad_norm": 1.1953125, "learning_rate": 0.00048255542739809035, "loss": 5.1091, "mean_token_accuracy": 0.1915844276547432, "num_tokens": 29651883.0, "step": 17090 }, { "entropy": 5.554691791534424, "epoch": 1.330052518965182, "grad_norm": 1.1171875, "learning_rate": 0.00048254472560553665, "loss": 5.0973, "mean_token_accuracy": 0.18957026898860932, "num_tokens": 29661092.0, "step": 17095 }, { "entropy": 5.601039552688599, "epoch": 1.3304415483368994, "grad_norm": 1.0078125, "learning_rate": 0.00048253402066382207, "loss": 5.1307, "mean_token_accuracy": 0.1981351912021637, "num_tokens": 29670285.0, "step": 17100 }, { "entropy": 5.637584638595581, "epoch": 1.3308305777086171, "grad_norm": 1.140625, "learning_rate": 0.0004825233125731091, "loss": 5.1747, "mean_token_accuracy": 0.18887474089860917, "num_tokens": 29679249.0, "step": 17105 }, { "entropy": 5.6272870063781735, "epoch": 1.3312196070803346, "grad_norm": 1.0859375, "learning_rate": 0.00048251260133356014, "loss": 5.1446, "mean_token_accuracy": 0.1861952617764473, "num_tokens": 29687978.0, "step": 17110 }, { "entropy": 5.59926118850708, "epoch": 1.331608636452052, "grad_norm": 1.1171875, "learning_rate": 0.00048250188694533774, "loss": 5.162, "mean_token_accuracy": 0.18740419149398804, "num_tokens": 29695972.0, "step": 17115 }, { "entropy": 5.626380062103271, "epoch": 1.3319976658237698, "grad_norm": 1.0, "learning_rate": 0.0004824911694086044, "loss": 4.9934, "mean_token_accuracy": 0.1966044545173645, "num_tokens": 29704997.0, "step": 17120 }, { "entropy": 5.707925271987915, "epoch": 1.3323866951954872, "grad_norm": 1.0859375, "learning_rate": 0.000482480448723523, "loss": 5.2219, "mean_token_accuracy": 0.19110133349895478, "num_tokens": 29713957.0, "step": 17125 }, { "entropy": 5.640682506561279, "epoch": 1.3327757245672047, "grad_norm": 1.09375, "learning_rate": 0.00048246972489025586, "loss": 5.115, "mean_token_accuracy": 0.19240255206823348, "num_tokens": 29721989.0, "step": 17130 }, { "entropy": 5.591029119491577, "epoch": 1.3331647539389224, "grad_norm": 1.1328125, "learning_rate": 0.00048245899790896597, "loss": 5.0425, "mean_token_accuracy": 0.19880155175924302, "num_tokens": 29730032.0, "step": 17135 }, { "entropy": 5.581392478942871, "epoch": 1.33355378331064, "grad_norm": 1.0625, "learning_rate": 0.0004824482677798159, "loss": 5.0597, "mean_token_accuracy": 0.19574938714504242, "num_tokens": 29738545.0, "step": 17140 }, { "entropy": 5.626249551773071, "epoch": 1.3339428126823576, "grad_norm": 1.0546875, "learning_rate": 0.00048243753450296863, "loss": 5.0789, "mean_token_accuracy": 0.1984911873936653, "num_tokens": 29747371.0, "step": 17145 }, { "entropy": 5.592475748062133, "epoch": 1.334331842054075, "grad_norm": 1.0859375, "learning_rate": 0.00048242679807858693, "loss": 5.0233, "mean_token_accuracy": 0.19690910279750823, "num_tokens": 29756565.0, "step": 17150 }, { "entropy": 5.540616273880005, "epoch": 1.3347208714257928, "grad_norm": 1.0390625, "learning_rate": 0.00048241605850683365, "loss": 5.0405, "mean_token_accuracy": 0.1935047596693039, "num_tokens": 29765846.0, "step": 17155 }, { "entropy": 5.601731586456299, "epoch": 1.3351099007975102, "grad_norm": 1.0546875, "learning_rate": 0.00048240531578787197, "loss": 5.0869, "mean_token_accuracy": 0.19569143950939177, "num_tokens": 29774222.0, "step": 17160 }, { "entropy": 5.565546274185181, "epoch": 1.3354989301692277, "grad_norm": 1.0625, "learning_rate": 0.0004823945699218647, "loss": 4.9861, "mean_token_accuracy": 0.20037296116352082, "num_tokens": 29782366.0, "step": 17165 }, { "entropy": 5.6020973205566404, "epoch": 1.3358879595409454, "grad_norm": 1.0625, "learning_rate": 0.0004823838209089749, "loss": 5.1308, "mean_token_accuracy": 0.18899450004100798, "num_tokens": 29792147.0, "step": 17170 }, { "entropy": 5.615554237365723, "epoch": 1.3362769889126629, "grad_norm": 1.09375, "learning_rate": 0.00048237306874936565, "loss": 5.0882, "mean_token_accuracy": 0.19848169833421708, "num_tokens": 29801325.0, "step": 17175 }, { "entropy": 5.579449605941773, "epoch": 1.3366660182843804, "grad_norm": 1.1796875, "learning_rate": 0.0004823623134432001, "loss": 5.0531, "mean_token_accuracy": 0.19223212003707885, "num_tokens": 29809353.0, "step": 17180 }, { "entropy": 5.566813325881958, "epoch": 1.337055047656098, "grad_norm": 1.109375, "learning_rate": 0.00048235155499064166, "loss": 5.0997, "mean_token_accuracy": 0.19648808240890503, "num_tokens": 29817746.0, "step": 17185 }, { "entropy": 5.562612056732178, "epoch": 1.3374440770278155, "grad_norm": 1.109375, "learning_rate": 0.00048234079339185335, "loss": 5.118, "mean_token_accuracy": 0.19193292707204818, "num_tokens": 29826468.0, "step": 17190 }, { "entropy": 5.651003646850586, "epoch": 1.3378331063995332, "grad_norm": 1.0390625, "learning_rate": 0.00048233002864699856, "loss": 5.1846, "mean_token_accuracy": 0.18184355199337005, "num_tokens": 29835051.0, "step": 17195 }, { "entropy": 5.632854032516479, "epoch": 1.3382221357712507, "grad_norm": 1.0546875, "learning_rate": 0.0004823192607562405, "loss": 5.081, "mean_token_accuracy": 0.19087070524692534, "num_tokens": 29843514.0, "step": 17200 }, { "entropy": 5.591190910339355, "epoch": 1.3386111651429684, "grad_norm": 1.0390625, "learning_rate": 0.00048230848971974265, "loss": 5.01, "mean_token_accuracy": 0.19248565584421157, "num_tokens": 29851861.0, "step": 17205 }, { "entropy": 5.5409363269805905, "epoch": 1.3390001945146859, "grad_norm": 1.0859375, "learning_rate": 0.0004822977155376684, "loss": 5.0213, "mean_token_accuracy": 0.19842875599861146, "num_tokens": 29860639.0, "step": 17210 }, { "entropy": 5.550060033798218, "epoch": 1.3393892238864034, "grad_norm": 1.125, "learning_rate": 0.0004822869382101814, "loss": 5.1883, "mean_token_accuracy": 0.18755810260772704, "num_tokens": 29869931.0, "step": 17215 }, { "entropy": 5.63261775970459, "epoch": 1.339778253258121, "grad_norm": 1.140625, "learning_rate": 0.0004822761577374449, "loss": 5.1042, "mean_token_accuracy": 0.19078442007303237, "num_tokens": 29878933.0, "step": 17220 }, { "entropy": 5.607994461059571, "epoch": 1.3401672826298385, "grad_norm": 0.98828125, "learning_rate": 0.0004822653741196227, "loss": 5.0956, "mean_token_accuracy": 0.1942954868078232, "num_tokens": 29888031.0, "step": 17225 }, { "entropy": 5.574734401702881, "epoch": 1.340556312001556, "grad_norm": 1.03125, "learning_rate": 0.0004822545873568783, "loss": 5.0562, "mean_token_accuracy": 0.19396908581256866, "num_tokens": 29896792.0, "step": 17230 }, { "entropy": 5.551525640487671, "epoch": 1.3409453413732737, "grad_norm": 1.1640625, "learning_rate": 0.00048224379744937545, "loss": 5.0441, "mean_token_accuracy": 0.19622675478458404, "num_tokens": 29905185.0, "step": 17235 }, { "entropy": 5.652295637130737, "epoch": 1.3413343707449912, "grad_norm": 1.109375, "learning_rate": 0.00048223300439727783, "loss": 5.1544, "mean_token_accuracy": 0.18267314434051513, "num_tokens": 29913289.0, "step": 17240 }, { "entropy": 5.583216190338135, "epoch": 1.3417234001167089, "grad_norm": 1.0703125, "learning_rate": 0.00048222220820074926, "loss": 5.1015, "mean_token_accuracy": 0.1957106590270996, "num_tokens": 29922112.0, "step": 17245 }, { "entropy": 5.626125860214233, "epoch": 1.3421124294884264, "grad_norm": 1.046875, "learning_rate": 0.00048221140885995346, "loss": 5.0849, "mean_token_accuracy": 0.1889687806367874, "num_tokens": 29930944.0, "step": 17250 }, { "entropy": 5.665236186981201, "epoch": 1.342501458860144, "grad_norm": 1.171875, "learning_rate": 0.0004822006063750543, "loss": 5.1933, "mean_token_accuracy": 0.18412038832902908, "num_tokens": 29938576.0, "step": 17255 }, { "entropy": 5.588354682922363, "epoch": 1.3428904882318615, "grad_norm": 1.1328125, "learning_rate": 0.00048218980074621575, "loss": 5.0862, "mean_token_accuracy": 0.19173820912837983, "num_tokens": 29946771.0, "step": 17260 }, { "entropy": 5.6391833305358885, "epoch": 1.343279517603579, "grad_norm": 1.125, "learning_rate": 0.00048217899197360183, "loss": 5.1065, "mean_token_accuracy": 0.19124213308095933, "num_tokens": 29955098.0, "step": 17265 }, { "entropy": 5.576250219345093, "epoch": 1.3436685469752967, "grad_norm": 1.015625, "learning_rate": 0.0004821681800573764, "loss": 5.1183, "mean_token_accuracy": 0.18985211104154587, "num_tokens": 29964538.0, "step": 17270 }, { "entropy": 5.586406278610229, "epoch": 1.3440575763470142, "grad_norm": 1.1875, "learning_rate": 0.0004821573649977036, "loss": 5.0529, "mean_token_accuracy": 0.19566859155893326, "num_tokens": 29973965.0, "step": 17275 }, { "entropy": 5.5091344833374025, "epoch": 1.3444466057187316, "grad_norm": 1.1171875, "learning_rate": 0.00048214654679474753, "loss": 4.9762, "mean_token_accuracy": 0.19796336591243743, "num_tokens": 29982742.0, "step": 17280 }, { "entropy": 5.527531623840332, "epoch": 1.3448356350904493, "grad_norm": 1.1015625, "learning_rate": 0.00048213572544867224, "loss": 5.0483, "mean_token_accuracy": 0.19206763654947281, "num_tokens": 29991846.0, "step": 17285 }, { "entropy": 5.631241130828857, "epoch": 1.3452246644621668, "grad_norm": 1.328125, "learning_rate": 0.00048212490095964213, "loss": 5.0025, "mean_token_accuracy": 0.20127080231904984, "num_tokens": 29999784.0, "step": 17290 }, { "entropy": 5.573941898345947, "epoch": 1.3456136938338845, "grad_norm": 1.1015625, "learning_rate": 0.0004821140733278212, "loss": 5.1206, "mean_token_accuracy": 0.192512209713459, "num_tokens": 30008139.0, "step": 17295 }, { "entropy": 5.596026515960693, "epoch": 1.346002723205602, "grad_norm": 1.2109375, "learning_rate": 0.0004821032425533739, "loss": 5.1149, "mean_token_accuracy": 0.1973307266831398, "num_tokens": 30016891.0, "step": 17300 }, { "entropy": 5.5896257877349855, "epoch": 1.3463917525773197, "grad_norm": 1.125, "learning_rate": 0.0004820924086364646, "loss": 5.0976, "mean_token_accuracy": 0.1946762517094612, "num_tokens": 30025472.0, "step": 17305 }, { "entropy": 5.624167728424072, "epoch": 1.3467807819490372, "grad_norm": 1.09375, "learning_rate": 0.00048208157157725756, "loss": 5.0983, "mean_token_accuracy": 0.19798196107149124, "num_tokens": 30034088.0, "step": 17310 }, { "entropy": 5.5352325439453125, "epoch": 1.3471698113207546, "grad_norm": 1.0078125, "learning_rate": 0.00048207073137591726, "loss": 5.0417, "mean_token_accuracy": 0.192068450152874, "num_tokens": 30042651.0, "step": 17315 }, { "entropy": 5.580952596664429, "epoch": 1.3475588406924723, "grad_norm": 1.1328125, "learning_rate": 0.00048205988803260824, "loss": 5.0011, "mean_token_accuracy": 0.2002151608467102, "num_tokens": 30050898.0, "step": 17320 }, { "entropy": 5.677296829223633, "epoch": 1.3479478700641898, "grad_norm": 1.140625, "learning_rate": 0.00048204904154749496, "loss": 5.1725, "mean_token_accuracy": 0.1894117623567581, "num_tokens": 30059357.0, "step": 17325 }, { "entropy": 5.60735297203064, "epoch": 1.3483368994359073, "grad_norm": 1.1640625, "learning_rate": 0.00048203819192074206, "loss": 5.0754, "mean_token_accuracy": 0.1892850935459137, "num_tokens": 30068137.0, "step": 17330 }, { "entropy": 5.600775814056396, "epoch": 1.348725928807625, "grad_norm": 1.0703125, "learning_rate": 0.00048202733915251407, "loss": 5.1299, "mean_token_accuracy": 0.195503132045269, "num_tokens": 30077139.0, "step": 17335 }, { "entropy": 5.633728885650635, "epoch": 1.3491149581793425, "grad_norm": 1.09375, "learning_rate": 0.00048201648324297573, "loss": 5.1307, "mean_token_accuracy": 0.20009224861860275, "num_tokens": 30085267.0, "step": 17340 }, { "entropy": 5.570550918579102, "epoch": 1.3495039875510602, "grad_norm": 1.0703125, "learning_rate": 0.00048200562419229185, "loss": 5.0517, "mean_token_accuracy": 0.20046866983175277, "num_tokens": 30093804.0, "step": 17345 }, { "entropy": 5.5981920719146725, "epoch": 1.3498930169227776, "grad_norm": 1.046875, "learning_rate": 0.000481994762000627, "loss": 5.0327, "mean_token_accuracy": 0.20512161552906036, "num_tokens": 30102653.0, "step": 17350 }, { "entropy": 5.534904336929321, "epoch": 1.3502820462944953, "grad_norm": 1.125, "learning_rate": 0.00048198389666814616, "loss": 5.0145, "mean_token_accuracy": 0.19998365193605422, "num_tokens": 30111978.0, "step": 17355 }, { "entropy": 5.623388576507568, "epoch": 1.3506710756662128, "grad_norm": 1.140625, "learning_rate": 0.00048197302819501416, "loss": 5.2542, "mean_token_accuracy": 0.18305663168430328, "num_tokens": 30120387.0, "step": 17360 }, { "entropy": 5.601443147659301, "epoch": 1.3510601050379303, "grad_norm": 1.1328125, "learning_rate": 0.00048196215658139586, "loss": 5.0984, "mean_token_accuracy": 0.19018661379814147, "num_tokens": 30129069.0, "step": 17365 }, { "entropy": 5.5916832447052, "epoch": 1.351449134409648, "grad_norm": 1.0859375, "learning_rate": 0.0004819512818274562, "loss": 5.0703, "mean_token_accuracy": 0.19169774949550628, "num_tokens": 30138077.0, "step": 17370 }, { "entropy": 5.554825639724731, "epoch": 1.3518381637813655, "grad_norm": 1.1015625, "learning_rate": 0.0004819404039333603, "loss": 5.0164, "mean_token_accuracy": 0.19625434875488282, "num_tokens": 30146189.0, "step": 17375 }, { "entropy": 5.596820497512818, "epoch": 1.352227193153083, "grad_norm": 1.2109375, "learning_rate": 0.0004819295228992731, "loss": 5.1441, "mean_token_accuracy": 0.18551240712404252, "num_tokens": 30155664.0, "step": 17380 }, { "entropy": 5.621693563461304, "epoch": 1.3526162225248006, "grad_norm": 1.046875, "learning_rate": 0.00048191863872535984, "loss": 5.0982, "mean_token_accuracy": 0.19399722069501876, "num_tokens": 30164701.0, "step": 17385 }, { "entropy": 5.6402098655700685, "epoch": 1.3530052518965183, "grad_norm": 1.1796875, "learning_rate": 0.0004819077514117855, "loss": 5.1395, "mean_token_accuracy": 0.19072800129652023, "num_tokens": 30173916.0, "step": 17390 }, { "entropy": 5.588237047195435, "epoch": 1.3533942812682358, "grad_norm": 1.1015625, "learning_rate": 0.00048189686095871545, "loss": 5.0708, "mean_token_accuracy": 0.19412756562232972, "num_tokens": 30182803.0, "step": 17395 }, { "entropy": 5.5683369636535645, "epoch": 1.3537833106399533, "grad_norm": 1.15625, "learning_rate": 0.00048188596736631475, "loss": 5.0786, "mean_token_accuracy": 0.20161097794771193, "num_tokens": 30191589.0, "step": 17400 }, { "entropy": 5.605751371383667, "epoch": 1.354172340011671, "grad_norm": 1.140625, "learning_rate": 0.00048187507063474885, "loss": 5.1785, "mean_token_accuracy": 0.1880600258708, "num_tokens": 30200170.0, "step": 17405 }, { "entropy": 5.626162481307984, "epoch": 1.3545613693833884, "grad_norm": 1.1015625, "learning_rate": 0.00048186417076418294, "loss": 5.0419, "mean_token_accuracy": 0.19382455348968505, "num_tokens": 30208683.0, "step": 17410 }, { "entropy": 5.589068412780762, "epoch": 1.354950398755106, "grad_norm": 1.0390625, "learning_rate": 0.00048185326775478256, "loss": 5.0985, "mean_token_accuracy": 0.1832721158862114, "num_tokens": 30217141.0, "step": 17415 }, { "entropy": 5.582963228225708, "epoch": 1.3553394281268236, "grad_norm": 1.0703125, "learning_rate": 0.00048184236160671306, "loss": 5.0901, "mean_token_accuracy": 0.18514712750911713, "num_tokens": 30226759.0, "step": 17420 }, { "entropy": 5.616628122329712, "epoch": 1.355728457498541, "grad_norm": 1.0625, "learning_rate": 0.00048183145232013995, "loss": 5.1576, "mean_token_accuracy": 0.19223590493202208, "num_tokens": 30235945.0, "step": 17425 }, { "entropy": 5.620598363876343, "epoch": 1.3561174868702586, "grad_norm": 1.078125, "learning_rate": 0.00048182053989522883, "loss": 5.1247, "mean_token_accuracy": 0.18232114762067794, "num_tokens": 30244912.0, "step": 17430 }, { "entropy": 5.6058262348175045, "epoch": 1.3565065162419763, "grad_norm": 1.1015625, "learning_rate": 0.00048180962433214515, "loss": 5.0715, "mean_token_accuracy": 0.19382267892360688, "num_tokens": 30253807.0, "step": 17435 }, { "entropy": 5.615492296218872, "epoch": 1.356895545613694, "grad_norm": 1.09375, "learning_rate": 0.00048179870563105453, "loss": 5.172, "mean_token_accuracy": 0.1914404660463333, "num_tokens": 30262380.0, "step": 17440 }, { "entropy": 5.655902481079101, "epoch": 1.3572845749854114, "grad_norm": 1.1015625, "learning_rate": 0.0004817877837921228, "loss": 5.1003, "mean_token_accuracy": 0.19246790558099747, "num_tokens": 30271374.0, "step": 17445 }, { "entropy": 5.601302671432495, "epoch": 1.357673604357129, "grad_norm": 1.0390625, "learning_rate": 0.0004817768588155155, "loss": 5.1328, "mean_token_accuracy": 0.19475583285093306, "num_tokens": 30280037.0, "step": 17450 }, { "entropy": 5.531799364089966, "epoch": 1.3580626337288466, "grad_norm": 1.1953125, "learning_rate": 0.00048176593070139865, "loss": 4.9348, "mean_token_accuracy": 0.21244002878665924, "num_tokens": 30288335.0, "step": 17455 }, { "entropy": 5.519866943359375, "epoch": 1.358451663100564, "grad_norm": 1.09375, "learning_rate": 0.00048175499944993767, "loss": 5.0368, "mean_token_accuracy": 0.19410879909992218, "num_tokens": 30297109.0, "step": 17460 }, { "entropy": 5.580335521697998, "epoch": 1.3588406924722816, "grad_norm": 1.1328125, "learning_rate": 0.00048174406506129884, "loss": 5.0509, "mean_token_accuracy": 0.19508031755685806, "num_tokens": 30305594.0, "step": 17465 }, { "entropy": 5.542119836807251, "epoch": 1.3592297218439993, "grad_norm": 1.1015625, "learning_rate": 0.00048173312753564787, "loss": 4.9816, "mean_token_accuracy": 0.20457783639431, "num_tokens": 30313106.0, "step": 17470 }, { "entropy": 5.576837539672852, "epoch": 1.3596187512157167, "grad_norm": 1.046875, "learning_rate": 0.0004817221868731506, "loss": 5.17, "mean_token_accuracy": 0.1869833990931511, "num_tokens": 30322194.0, "step": 17475 }, { "entropy": 5.53590497970581, "epoch": 1.3600077805874344, "grad_norm": 0.9921875, "learning_rate": 0.00048171124307397334, "loss": 5.0174, "mean_token_accuracy": 0.19708539694547653, "num_tokens": 30330247.0, "step": 17480 }, { "entropy": 5.619177913665771, "epoch": 1.360396809959152, "grad_norm": 1.1171875, "learning_rate": 0.0004817002961382819, "loss": 5.1134, "mean_token_accuracy": 0.19212924540042878, "num_tokens": 30338738.0, "step": 17485 }, { "entropy": 5.576988649368286, "epoch": 1.3607858393308696, "grad_norm": 1.125, "learning_rate": 0.00048168934606624255, "loss": 5.0908, "mean_token_accuracy": 0.19094870686531068, "num_tokens": 30347729.0, "step": 17490 }, { "entropy": 5.62130708694458, "epoch": 1.361174868702587, "grad_norm": 1.25, "learning_rate": 0.00048167839285802116, "loss": 5.1002, "mean_token_accuracy": 0.1885942116379738, "num_tokens": 30356408.0, "step": 17495 }, { "entropy": 5.5848783493042, "epoch": 1.3615638980743046, "grad_norm": 1.046875, "learning_rate": 0.0004816674365137843, "loss": 5.0646, "mean_token_accuracy": 0.19244394302368165, "num_tokens": 30364910.0, "step": 17500 }, { "entropy": 5.557191944122314, "epoch": 1.3619529274460223, "grad_norm": 1.1484375, "learning_rate": 0.000481656477033698, "loss": 5.0823, "mean_token_accuracy": 0.1955784320831299, "num_tokens": 30373882.0, "step": 17505 }, { "entropy": 5.643977117538452, "epoch": 1.3623419568177397, "grad_norm": 1.03125, "learning_rate": 0.0004816455144179286, "loss": 5.1402, "mean_token_accuracy": 0.1846423327922821, "num_tokens": 30382884.0, "step": 17510 }, { "entropy": 5.592962169647217, "epoch": 1.3627309861894572, "grad_norm": 1.1171875, "learning_rate": 0.0004816345486666424, "loss": 5.0437, "mean_token_accuracy": 0.1940524697303772, "num_tokens": 30391798.0, "step": 17515 }, { "entropy": 5.583971691131592, "epoch": 1.363120015561175, "grad_norm": 1.1171875, "learning_rate": 0.0004816235797800058, "loss": 5.0603, "mean_token_accuracy": 0.19570833891630174, "num_tokens": 30400194.0, "step": 17520 }, { "entropy": 5.569255828857422, "epoch": 1.3635090449328924, "grad_norm": 1.1015625, "learning_rate": 0.0004816126077581852, "loss": 4.9913, "mean_token_accuracy": 0.19892526268959046, "num_tokens": 30408653.0, "step": 17525 }, { "entropy": 5.550200891494751, "epoch": 1.36389807430461, "grad_norm": 1.109375, "learning_rate": 0.00048160163260134724, "loss": 5.1267, "mean_token_accuracy": 0.19007736295461655, "num_tokens": 30417467.0, "step": 17530 }, { "entropy": 5.5903106212615965, "epoch": 1.3642871036763276, "grad_norm": 1.109375, "learning_rate": 0.0004815906543096583, "loss": 5.0976, "mean_token_accuracy": 0.18592511117458344, "num_tokens": 30425993.0, "step": 17535 }, { "entropy": 5.634143924713134, "epoch": 1.3646761330480452, "grad_norm": 1.0703125, "learning_rate": 0.000481579672883285, "loss": 5.0976, "mean_token_accuracy": 0.19496258944272996, "num_tokens": 30434809.0, "step": 17540 }, { "entropy": 5.601830720901489, "epoch": 1.3650651624197627, "grad_norm": 1.09375, "learning_rate": 0.00048156868832239396, "loss": 5.0998, "mean_token_accuracy": 0.1941066637635231, "num_tokens": 30443536.0, "step": 17545 }, { "entropy": 5.518461418151856, "epoch": 1.3654541917914802, "grad_norm": 1.0859375, "learning_rate": 0.0004815577006271519, "loss": 5.0835, "mean_token_accuracy": 0.19164232313632965, "num_tokens": 30452163.0, "step": 17550 }, { "entropy": 5.563957834243775, "epoch": 1.365843221163198, "grad_norm": 1.0859375, "learning_rate": 0.00048154670979772555, "loss": 5.0576, "mean_token_accuracy": 0.19976511895656585, "num_tokens": 30461234.0, "step": 17555 }, { "entropy": 5.725088453292846, "epoch": 1.3662322505349154, "grad_norm": 1.046875, "learning_rate": 0.0004815357158342815, "loss": 5.2178, "mean_token_accuracy": 0.17882028073072434, "num_tokens": 30470438.0, "step": 17560 }, { "entropy": 5.639098882675171, "epoch": 1.3666212799066328, "grad_norm": 1.0234375, "learning_rate": 0.0004815247187369868, "loss": 5.0081, "mean_token_accuracy": 0.19483415633440018, "num_tokens": 30479454.0, "step": 17565 }, { "entropy": 5.632966947555542, "epoch": 1.3670103092783505, "grad_norm": 1.1328125, "learning_rate": 0.00048151371850600814, "loss": 5.1187, "mean_token_accuracy": 0.189105848968029, "num_tokens": 30487968.0, "step": 17570 }, { "entropy": 5.595620012283325, "epoch": 1.367399338650068, "grad_norm": 1.109375, "learning_rate": 0.00048150271514151255, "loss": 5.0474, "mean_token_accuracy": 0.1967533975839615, "num_tokens": 30495712.0, "step": 17575 }, { "entropy": 5.605516576766968, "epoch": 1.3677883680217857, "grad_norm": 1.046875, "learning_rate": 0.00048149170864366693, "loss": 5.1447, "mean_token_accuracy": 0.18511847406625748, "num_tokens": 30505008.0, "step": 17580 }, { "entropy": 5.612831735610962, "epoch": 1.3681773973935032, "grad_norm": 1.1171875, "learning_rate": 0.00048148069901263836, "loss": 5.0421, "mean_token_accuracy": 0.19839342981576918, "num_tokens": 30514496.0, "step": 17585 }, { "entropy": 5.590772294998169, "epoch": 1.368566426765221, "grad_norm": 1.1171875, "learning_rate": 0.00048146968624859375, "loss": 5.0267, "mean_token_accuracy": 0.19972210973501206, "num_tokens": 30522942.0, "step": 17590 }, { "entropy": 5.658151483535766, "epoch": 1.3689554561369384, "grad_norm": 1.046875, "learning_rate": 0.0004814586703517003, "loss": 5.1894, "mean_token_accuracy": 0.18800529688596726, "num_tokens": 30532124.0, "step": 17595 }, { "entropy": 5.671984100341797, "epoch": 1.3693444855086558, "grad_norm": 1.125, "learning_rate": 0.0004814476513221251, "loss": 5.2975, "mean_token_accuracy": 0.17737707495689392, "num_tokens": 30541063.0, "step": 17600 }, { "entropy": 5.664184284210205, "epoch": 1.3697335148803735, "grad_norm": 1.1171875, "learning_rate": 0.00048143662916003545, "loss": 5.0155, "mean_token_accuracy": 0.19651644676923752, "num_tokens": 30549062.0, "step": 17605 }, { "entropy": 5.65010347366333, "epoch": 1.370122544252091, "grad_norm": 1.1015625, "learning_rate": 0.0004814256038655985, "loss": 5.1154, "mean_token_accuracy": 0.18934282064437866, "num_tokens": 30557211.0, "step": 17610 }, { "entropy": 5.613674211502075, "epoch": 1.3705115736238085, "grad_norm": 1.03125, "learning_rate": 0.0004814145754389816, "loss": 5.1701, "mean_token_accuracy": 0.18557561188936234, "num_tokens": 30566603.0, "step": 17615 }, { "entropy": 5.574848222732544, "epoch": 1.3709006029955262, "grad_norm": 1.046875, "learning_rate": 0.00048140354388035204, "loss": 5.0494, "mean_token_accuracy": 0.1934528112411499, "num_tokens": 30574903.0, "step": 17620 }, { "entropy": 5.661852407455444, "epoch": 1.3712896323672437, "grad_norm": 1.140625, "learning_rate": 0.0004813925091898772, "loss": 5.1385, "mean_token_accuracy": 0.18710356801748276, "num_tokens": 30584925.0, "step": 17625 }, { "entropy": 5.688584709167481, "epoch": 1.3716786617389614, "grad_norm": 1.15625, "learning_rate": 0.0004813814713677246, "loss": 5.1887, "mean_token_accuracy": 0.1886507675051689, "num_tokens": 30593376.0, "step": 17630 }, { "entropy": 5.611472225189209, "epoch": 1.3720676911106788, "grad_norm": 1.078125, "learning_rate": 0.0004813704304140616, "loss": 5.1142, "mean_token_accuracy": 0.19458251148462297, "num_tokens": 30602306.0, "step": 17635 }, { "entropy": 5.556731748580932, "epoch": 1.3724567204823965, "grad_norm": 1.078125, "learning_rate": 0.0004813593863290559, "loss": 5.0566, "mean_token_accuracy": 0.1932797759771347, "num_tokens": 30611340.0, "step": 17640 }, { "entropy": 5.617712688446045, "epoch": 1.372845749854114, "grad_norm": 1.0859375, "learning_rate": 0.0004813483391128748, "loss": 5.1591, "mean_token_accuracy": 0.19261574894189834, "num_tokens": 30619507.0, "step": 17645 }, { "entropy": 5.639880228042602, "epoch": 1.3732347792258315, "grad_norm": 1.0, "learning_rate": 0.0004813372887656862, "loss": 5.1521, "mean_token_accuracy": 0.1923792615532875, "num_tokens": 30629897.0, "step": 17650 }, { "entropy": 5.6188194274902346, "epoch": 1.3736238085975492, "grad_norm": 1.078125, "learning_rate": 0.0004813262352876576, "loss": 5.0936, "mean_token_accuracy": 0.19418303966522216, "num_tokens": 30638517.0, "step": 17655 }, { "entropy": 5.646220588684082, "epoch": 1.3740128379692667, "grad_norm": 1.09375, "learning_rate": 0.00048131517867895684, "loss": 5.1397, "mean_token_accuracy": 0.19555290937423705, "num_tokens": 30646816.0, "step": 17660 }, { "entropy": 5.628312063217163, "epoch": 1.3744018673409841, "grad_norm": 1.15625, "learning_rate": 0.00048130411893975155, "loss": 5.0978, "mean_token_accuracy": 0.19647861868143082, "num_tokens": 30655199.0, "step": 17665 }, { "entropy": 5.557996082305908, "epoch": 1.3747908967127018, "grad_norm": 1.0625, "learning_rate": 0.0004812930560702097, "loss": 4.9805, "mean_token_accuracy": 0.19906099885702133, "num_tokens": 30663562.0, "step": 17670 }, { "entropy": 5.60725769996643, "epoch": 1.3751799260844193, "grad_norm": 1.1328125, "learning_rate": 0.00048128199007049907, "loss": 5.1464, "mean_token_accuracy": 0.18604770302772522, "num_tokens": 30672611.0, "step": 17675 }, { "entropy": 5.591836309432983, "epoch": 1.375568955456137, "grad_norm": 1.0703125, "learning_rate": 0.00048127092094078756, "loss": 5.0758, "mean_token_accuracy": 0.19608640819787979, "num_tokens": 30680766.0, "step": 17680 }, { "entropy": 5.544107103347779, "epoch": 1.3759579848278545, "grad_norm": 1.078125, "learning_rate": 0.00048125984868124317, "loss": 4.9433, "mean_token_accuracy": 0.19995449334383011, "num_tokens": 30689192.0, "step": 17685 }, { "entropy": 5.576938152313232, "epoch": 1.3763470141995722, "grad_norm": 1.0859375, "learning_rate": 0.0004812487732920338, "loss": 5.0601, "mean_token_accuracy": 0.1913628935813904, "num_tokens": 30697889.0, "step": 17690 }, { "entropy": 5.656646203994751, "epoch": 1.3767360435712896, "grad_norm": 1.125, "learning_rate": 0.0004812376947733277, "loss": 5.1042, "mean_token_accuracy": 0.19301426857709886, "num_tokens": 30706285.0, "step": 17695 }, { "entropy": 5.59697995185852, "epoch": 1.3771250729430071, "grad_norm": 1.03125, "learning_rate": 0.00048122661312529263, "loss": 5.0701, "mean_token_accuracy": 0.1972261354327202, "num_tokens": 30715159.0, "step": 17700 }, { "entropy": 5.544631671905518, "epoch": 1.3775141023147248, "grad_norm": 1.1328125, "learning_rate": 0.0004812155283480971, "loss": 4.9839, "mean_token_accuracy": 0.19768782705068588, "num_tokens": 30723133.0, "step": 17705 }, { "entropy": 5.658510971069336, "epoch": 1.3779031316864423, "grad_norm": 1.140625, "learning_rate": 0.0004812044404419091, "loss": 5.1674, "mean_token_accuracy": 0.19228937476873398, "num_tokens": 30732272.0, "step": 17710 }, { "entropy": 5.620146799087524, "epoch": 1.3782921610581598, "grad_norm": 1.0859375, "learning_rate": 0.000481193349406897, "loss": 5.0317, "mean_token_accuracy": 0.19477264136075972, "num_tokens": 30740439.0, "step": 17715 }, { "entropy": 5.56381368637085, "epoch": 1.3786811904298775, "grad_norm": 1.0625, "learning_rate": 0.000481182255243229, "loss": 5.0931, "mean_token_accuracy": 0.19626167863607408, "num_tokens": 30749722.0, "step": 17720 }, { "entropy": 5.718609285354614, "epoch": 1.379070219801595, "grad_norm": 1.0703125, "learning_rate": 0.00048117115795107335, "loss": 5.292, "mean_token_accuracy": 0.18305347114801407, "num_tokens": 30759261.0, "step": 17725 }, { "entropy": 5.693091630935669, "epoch": 1.3794592491733126, "grad_norm": 1.046875, "learning_rate": 0.0004811600575305987, "loss": 5.1203, "mean_token_accuracy": 0.1956807032227516, "num_tokens": 30769133.0, "step": 17730 }, { "entropy": 5.615317535400391, "epoch": 1.3798482785450301, "grad_norm": 1.1875, "learning_rate": 0.0004811489539819731, "loss": 5.0459, "mean_token_accuracy": 0.19954855144023895, "num_tokens": 30777879.0, "step": 17735 }, { "entropy": 5.6220598220825195, "epoch": 1.3802373079167478, "grad_norm": 1.1171875, "learning_rate": 0.00048113784730536544, "loss": 5.1674, "mean_token_accuracy": 0.19754636138677598, "num_tokens": 30786307.0, "step": 17740 }, { "entropy": 5.6582808017730715, "epoch": 1.3806263372884653, "grad_norm": 1.078125, "learning_rate": 0.00048112673750094396, "loss": 5.1837, "mean_token_accuracy": 0.18878302574157715, "num_tokens": 30796153.0, "step": 17745 }, { "entropy": 5.608172369003296, "epoch": 1.3810153666601828, "grad_norm": 1.1015625, "learning_rate": 0.0004811156245688773, "loss": 4.9604, "mean_token_accuracy": 0.19866713136434555, "num_tokens": 30805441.0, "step": 17750 }, { "entropy": 5.56573076248169, "epoch": 1.3814043960319005, "grad_norm": 0.953125, "learning_rate": 0.0004811045085093342, "loss": 5.1187, "mean_token_accuracy": 0.18319412022829057, "num_tokens": 30814898.0, "step": 17755 }, { "entropy": 5.681590938568116, "epoch": 1.381793425403618, "grad_norm": 1.046875, "learning_rate": 0.0004810933893224831, "loss": 5.2924, "mean_token_accuracy": 0.18218099623918532, "num_tokens": 30823995.0, "step": 17760 }, { "entropy": 5.655806541442871, "epoch": 1.3821824547753354, "grad_norm": 1.0234375, "learning_rate": 0.00048108226700849287, "loss": 5.1243, "mean_token_accuracy": 0.19118371307849885, "num_tokens": 30832963.0, "step": 17765 }, { "entropy": 5.640542078018188, "epoch": 1.382571484147053, "grad_norm": 1.1171875, "learning_rate": 0.0004810711415675323, "loss": 5.1283, "mean_token_accuracy": 0.18644823580980302, "num_tokens": 30841559.0, "step": 17770 }, { "entropy": 5.6816521167755125, "epoch": 1.3829605135187706, "grad_norm": 1.03125, "learning_rate": 0.0004810600129997702, "loss": 5.1765, "mean_token_accuracy": 0.18798786252737046, "num_tokens": 30850481.0, "step": 17775 }, { "entropy": 5.63182635307312, "epoch": 1.3833495428904883, "grad_norm": 1.1015625, "learning_rate": 0.00048104888130537534, "loss": 5.0154, "mean_token_accuracy": 0.19417383372783661, "num_tokens": 30859632.0, "step": 17780 }, { "entropy": 5.654698419570923, "epoch": 1.3837385722622058, "grad_norm": 1.171875, "learning_rate": 0.00048103774648451664, "loss": 5.0895, "mean_token_accuracy": 0.19187875539064408, "num_tokens": 30867909.0, "step": 17785 }, { "entropy": 5.6158520698547365, "epoch": 1.3841276016339235, "grad_norm": 1.1640625, "learning_rate": 0.00048102660853736314, "loss": 5.1031, "mean_token_accuracy": 0.19536942839622498, "num_tokens": 30876339.0, "step": 17790 }, { "entropy": 5.624637222290039, "epoch": 1.384516631005641, "grad_norm": 1.09375, "learning_rate": 0.0004810154674640837, "loss": 5.0804, "mean_token_accuracy": 0.19113468378782272, "num_tokens": 30884998.0, "step": 17795 }, { "entropy": 5.649057626724243, "epoch": 1.3849056603773584, "grad_norm": 1.046875, "learning_rate": 0.00048100432326484744, "loss": 5.1144, "mean_token_accuracy": 0.18475880324840546, "num_tokens": 30893554.0, "step": 17800 }, { "entropy": 5.5887950420379635, "epoch": 1.385294689749076, "grad_norm": 1.1640625, "learning_rate": 0.0004809931759398235, "loss": 5.1169, "mean_token_accuracy": 0.19248030930757523, "num_tokens": 30901954.0, "step": 17805 }, { "entropy": 5.607624244689942, "epoch": 1.3856837191207936, "grad_norm": 1.046875, "learning_rate": 0.00048098202548918094, "loss": 5.0737, "mean_token_accuracy": 0.19664642661809922, "num_tokens": 30911145.0, "step": 17810 }, { "entropy": 5.5625138759613035, "epoch": 1.386072748492511, "grad_norm": 1.21875, "learning_rate": 0.00048097087191308914, "loss": 4.9676, "mean_token_accuracy": 0.2015418902039528, "num_tokens": 30918924.0, "step": 17815 }, { "entropy": 5.591161823272705, "epoch": 1.3864617778642288, "grad_norm": 0.98828125, "learning_rate": 0.0004809597152117171, "loss": 5.1286, "mean_token_accuracy": 0.19008181989192963, "num_tokens": 30927620.0, "step": 17820 }, { "entropy": 5.593923854827881, "epoch": 1.3868508072359464, "grad_norm": 1.125, "learning_rate": 0.0004809485553852342, "loss": 5.0181, "mean_token_accuracy": 0.19180162400007247, "num_tokens": 30936140.0, "step": 17825 }, { "entropy": 5.700794744491577, "epoch": 1.387239836607664, "grad_norm": 1.328125, "learning_rate": 0.0004809373924338098, "loss": 5.2234, "mean_token_accuracy": 0.18718539029359818, "num_tokens": 30944450.0, "step": 17830 }, { "entropy": 5.572172403335571, "epoch": 1.3876288659793814, "grad_norm": 1.03125, "learning_rate": 0.00048092622635761316, "loss": 5.0533, "mean_token_accuracy": 0.1959550365805626, "num_tokens": 30953536.0, "step": 17835 }, { "entropy": 5.6090741634368895, "epoch": 1.388017895351099, "grad_norm": 1.078125, "learning_rate": 0.00048091505715681395, "loss": 5.071, "mean_token_accuracy": 0.19303107261657715, "num_tokens": 30962556.0, "step": 17840 }, { "entropy": 5.589877653121948, "epoch": 1.3884069247228166, "grad_norm": 1.1953125, "learning_rate": 0.0004809038848315814, "loss": 5.0184, "mean_token_accuracy": 0.20263680517673494, "num_tokens": 30970476.0, "step": 17845 }, { "entropy": 5.664753007888794, "epoch": 1.388795954094534, "grad_norm": 1.078125, "learning_rate": 0.0004808927093820851, "loss": 5.0633, "mean_token_accuracy": 0.18840179443359376, "num_tokens": 30978945.0, "step": 17850 }, { "entropy": 5.552944183349609, "epoch": 1.3891849834662517, "grad_norm": 1.078125, "learning_rate": 0.0004808815308084947, "loss": 5.0265, "mean_token_accuracy": 0.19097656458616258, "num_tokens": 30988135.0, "step": 17855 }, { "entropy": 5.656019258499145, "epoch": 1.3895740128379692, "grad_norm": 1.15625, "learning_rate": 0.0004808703491109798, "loss": 5.11, "mean_token_accuracy": 0.1987979531288147, "num_tokens": 30996408.0, "step": 17860 }, { "entropy": 5.594230604171753, "epoch": 1.3899630422096867, "grad_norm": 1.1171875, "learning_rate": 0.0004808591642897099, "loss": 5.1335, "mean_token_accuracy": 0.19308444410562514, "num_tokens": 31004156.0, "step": 17865 }, { "entropy": 5.575358629226685, "epoch": 1.3903520715814044, "grad_norm": 1.09375, "learning_rate": 0.000480847976344855, "loss": 5.0647, "mean_token_accuracy": 0.19762326776981354, "num_tokens": 31013518.0, "step": 17870 }, { "entropy": 5.555838012695313, "epoch": 1.390741100953122, "grad_norm": 1.09375, "learning_rate": 0.00048083678527658465, "loss": 4.9586, "mean_token_accuracy": 0.20326709598302842, "num_tokens": 31022116.0, "step": 17875 }, { "entropy": 5.635913276672364, "epoch": 1.3911301303248396, "grad_norm": 1.21875, "learning_rate": 0.0004808255910850687, "loss": 5.1227, "mean_token_accuracy": 0.19242368191480635, "num_tokens": 31030320.0, "step": 17880 }, { "entropy": 5.63309416770935, "epoch": 1.391519159696557, "grad_norm": 1.1875, "learning_rate": 0.0004808143937704769, "loss": 5.0846, "mean_token_accuracy": 0.1992114245891571, "num_tokens": 31038410.0, "step": 17885 }, { "entropy": 5.582927322387695, "epoch": 1.3919081890682747, "grad_norm": 1.1328125, "learning_rate": 0.00048080319333297937, "loss": 5.0019, "mean_token_accuracy": 0.19571396857500076, "num_tokens": 31047719.0, "step": 17890 }, { "entropy": 5.588042974472046, "epoch": 1.3922972184399922, "grad_norm": 1.1015625, "learning_rate": 0.00048079198977274597, "loss": 5.138, "mean_token_accuracy": 0.19519376158714294, "num_tokens": 31057536.0, "step": 17895 }, { "entropy": 5.6246764183044435, "epoch": 1.3926862478117097, "grad_norm": 1.1015625, "learning_rate": 0.00048078078308994666, "loss": 5.0877, "mean_token_accuracy": 0.19471651166677476, "num_tokens": 31066975.0, "step": 17900 }, { "entropy": 5.617932558059692, "epoch": 1.3930752771834274, "grad_norm": 1.09375, "learning_rate": 0.0004807695732847515, "loss": 5.0789, "mean_token_accuracy": 0.20295270383358002, "num_tokens": 31075573.0, "step": 17905 }, { "entropy": 5.56302843093872, "epoch": 1.3934643065551449, "grad_norm": 0.9921875, "learning_rate": 0.00048075836035733053, "loss": 5.0057, "mean_token_accuracy": 0.20600516051054002, "num_tokens": 31084486.0, "step": 17910 }, { "entropy": 5.588654088973999, "epoch": 1.3938533359268626, "grad_norm": 1.109375, "learning_rate": 0.000480747144307854, "loss": 5.0568, "mean_token_accuracy": 0.1980026915669441, "num_tokens": 31093045.0, "step": 17915 }, { "entropy": 5.6169164180755615, "epoch": 1.39424236529858, "grad_norm": 1.0859375, "learning_rate": 0.00048073592513649203, "loss": 5.0863, "mean_token_accuracy": 0.20203913152217864, "num_tokens": 31102024.0, "step": 17920 }, { "entropy": 5.603633403778076, "epoch": 1.3946313946702977, "grad_norm": 1.046875, "learning_rate": 0.0004807247028434148, "loss": 5.1737, "mean_token_accuracy": 0.18329787105321885, "num_tokens": 31110656.0, "step": 17925 }, { "entropy": 5.626287126541138, "epoch": 1.3950204240420152, "grad_norm": 1.109375, "learning_rate": 0.0004807134774287927, "loss": 5.0325, "mean_token_accuracy": 0.20022621005773544, "num_tokens": 31119199.0, "step": 17930 }, { "entropy": 5.59880633354187, "epoch": 1.3954094534137327, "grad_norm": 1.15625, "learning_rate": 0.00048070224889279603, "loss": 5.0341, "mean_token_accuracy": 0.20225781351327896, "num_tokens": 31127301.0, "step": 17935 }, { "entropy": 5.591383457183838, "epoch": 1.3957984827854504, "grad_norm": 1.1328125, "learning_rate": 0.00048069101723559505, "loss": 5.1173, "mean_token_accuracy": 0.19614229649305343, "num_tokens": 31136714.0, "step": 17940 }, { "entropy": 5.635069084167481, "epoch": 1.3961875121571679, "grad_norm": 1.0859375, "learning_rate": 0.0004806797824573603, "loss": 5.1176, "mean_token_accuracy": 0.18883515149354935, "num_tokens": 31145663.0, "step": 17945 }, { "entropy": 5.516148710250855, "epoch": 1.3965765415288853, "grad_norm": 1.0234375, "learning_rate": 0.0004806685445582624, "loss": 4.8749, "mean_token_accuracy": 0.20871867388486862, "num_tokens": 31154335.0, "step": 17950 }, { "entropy": 5.572521686553955, "epoch": 1.396965570900603, "grad_norm": 1.1328125, "learning_rate": 0.00048065730353847143, "loss": 5.0792, "mean_token_accuracy": 0.19308810383081437, "num_tokens": 31163683.0, "step": 17955 }, { "entropy": 5.6317041397094725, "epoch": 1.3973546002723205, "grad_norm": 1.2109375, "learning_rate": 0.00048064605939815837, "loss": 5.1616, "mean_token_accuracy": 0.19347446858882905, "num_tokens": 31172361.0, "step": 17960 }, { "entropy": 5.602168416976928, "epoch": 1.3977436296440382, "grad_norm": 1.109375, "learning_rate": 0.0004806348121374936, "loss": 5.0034, "mean_token_accuracy": 0.20054301917552947, "num_tokens": 31180572.0, "step": 17965 }, { "entropy": 5.522147560119629, "epoch": 1.3981326590157557, "grad_norm": 1.1015625, "learning_rate": 0.0004806235617566479, "loss": 5.0134, "mean_token_accuracy": 0.19778368771076202, "num_tokens": 31188751.0, "step": 17970 }, { "entropy": 5.653079319000244, "epoch": 1.3985216883874734, "grad_norm": 1.1640625, "learning_rate": 0.000480612308255792, "loss": 5.2122, "mean_token_accuracy": 0.18623577207326888, "num_tokens": 31197762.0, "step": 17975 }, { "entropy": 5.67055115699768, "epoch": 1.3989107177591908, "grad_norm": 1.109375, "learning_rate": 0.00048060105163509647, "loss": 5.1405, "mean_token_accuracy": 0.19143532663583757, "num_tokens": 31207203.0, "step": 17980 }, { "entropy": 5.684044122695923, "epoch": 1.3992997471309083, "grad_norm": 1.09375, "learning_rate": 0.0004805897918947323, "loss": 5.1061, "mean_token_accuracy": 0.1947082608938217, "num_tokens": 31215711.0, "step": 17985 }, { "entropy": 5.602418899536133, "epoch": 1.399688776502626, "grad_norm": 1.0859375, "learning_rate": 0.0004805785290348702, "loss": 5.0652, "mean_token_accuracy": 0.19409611374139785, "num_tokens": 31224564.0, "step": 17990 }, { "entropy": 5.5717569351196286, "epoch": 1.4000778058743435, "grad_norm": 1.0703125, "learning_rate": 0.00048056726305568124, "loss": 5.043, "mean_token_accuracy": 0.1928005561232567, "num_tokens": 31233252.0, "step": 17995 }, { "entropy": 5.622393369674683, "epoch": 1.400466835246061, "grad_norm": 1.078125, "learning_rate": 0.00048055599395733617, "loss": 5.1404, "mean_token_accuracy": 0.1910122126340866, "num_tokens": 31242539.0, "step": 18000 }, { "epoch": 1.400466835246061, "eval_entropy": 5.429286362553469, "eval_loss": 5.153907775878906, "eval_mean_token_accuracy": 0.19979570700900845, "eval_num_tokens": 31242539.0, "eval_runtime": 21.6061, "eval_samples_per_second": 1923.435, "eval_steps_per_second": 240.441, "step": 18000 }, { "entropy": 5.65056209564209, "epoch": 1.4008558646177787, "grad_norm": 1.0703125, "learning_rate": 0.00048054472174000615, "loss": 5.1001, "mean_token_accuracy": 0.1949731782078743, "num_tokens": 31250770.0, "step": 18005 }, { "entropy": 5.578313302993775, "epoch": 1.4012448939894961, "grad_norm": 1.0859375, "learning_rate": 0.00048053344640386207, "loss": 5.0429, "mean_token_accuracy": 0.20055692493915558, "num_tokens": 31259507.0, "step": 18010 }, { "entropy": 5.611670923233032, "epoch": 1.4016339233612138, "grad_norm": 1.0390625, "learning_rate": 0.00048052216794907505, "loss": 5.144, "mean_token_accuracy": 0.19261469095945358, "num_tokens": 31268106.0, "step": 18015 }, { "entropy": 5.507248783111573, "epoch": 1.4020229527329313, "grad_norm": 1.09375, "learning_rate": 0.00048051088637581624, "loss": 5.0425, "mean_token_accuracy": 0.19696250557899475, "num_tokens": 31276495.0, "step": 18020 }, { "entropy": 5.639213037490845, "epoch": 1.402411982104649, "grad_norm": 1.109375, "learning_rate": 0.000480499601684257, "loss": 5.1316, "mean_token_accuracy": 0.18737502992153168, "num_tokens": 31284962.0, "step": 18025 }, { "entropy": 5.6458573818206785, "epoch": 1.4028010114763665, "grad_norm": 1.1640625, "learning_rate": 0.0004804883138745682, "loss": 5.1704, "mean_token_accuracy": 0.18758513033390045, "num_tokens": 31294497.0, "step": 18030 }, { "entropy": 5.593687057495117, "epoch": 1.403190040848084, "grad_norm": 1.1796875, "learning_rate": 0.0004804770229469214, "loss": 5.0873, "mean_token_accuracy": 0.1968716114759445, "num_tokens": 31302607.0, "step": 18035 }, { "entropy": 5.661804866790772, "epoch": 1.4035790702198017, "grad_norm": 1.0546875, "learning_rate": 0.0004804657289014878, "loss": 5.1457, "mean_token_accuracy": 0.19137624949216842, "num_tokens": 31311989.0, "step": 18040 }, { "entropy": 5.676852560043335, "epoch": 1.4039680995915191, "grad_norm": 1.015625, "learning_rate": 0.00048045443173843884, "loss": 5.0587, "mean_token_accuracy": 0.19819005131721495, "num_tokens": 31320681.0, "step": 18045 }, { "entropy": 5.6062075138092045, "epoch": 1.4043571289632366, "grad_norm": 1.171875, "learning_rate": 0.00048044313145794587, "loss": 5.0871, "mean_token_accuracy": 0.19399428516626357, "num_tokens": 31328985.0, "step": 18050 }, { "entropy": 5.583251905441284, "epoch": 1.4047461583349543, "grad_norm": 1.0546875, "learning_rate": 0.00048043182806018034, "loss": 5.0359, "mean_token_accuracy": 0.19411151856184006, "num_tokens": 31337486.0, "step": 18055 }, { "entropy": 5.608684492111206, "epoch": 1.4051351877066718, "grad_norm": 1.0859375, "learning_rate": 0.00048042052154531384, "loss": 5.1453, "mean_token_accuracy": 0.1958534985780716, "num_tokens": 31345831.0, "step": 18060 }, { "entropy": 5.571682929992676, "epoch": 1.4055242170783895, "grad_norm": 1.078125, "learning_rate": 0.0004804092119135179, "loss": 5.0368, "mean_token_accuracy": 0.20379883348941802, "num_tokens": 31354791.0, "step": 18065 }, { "entropy": 5.566554880142212, "epoch": 1.405913246450107, "grad_norm": 1.15625, "learning_rate": 0.0004803978991649641, "loss": 4.9957, "mean_token_accuracy": 0.20051505863666536, "num_tokens": 31362652.0, "step": 18070 }, { "entropy": 5.559219646453857, "epoch": 1.4063022758218247, "grad_norm": 1.0390625, "learning_rate": 0.00048038658329982404, "loss": 5.0968, "mean_token_accuracy": 0.19080246835947037, "num_tokens": 31371439.0, "step": 18075 }, { "entropy": 5.701272916793823, "epoch": 1.4066913051935421, "grad_norm": 1.0546875, "learning_rate": 0.0004803752643182695, "loss": 5.106, "mean_token_accuracy": 0.1903628170490265, "num_tokens": 31380039.0, "step": 18080 }, { "entropy": 5.662473726272583, "epoch": 1.4070803345652596, "grad_norm": 1.0390625, "learning_rate": 0.0004803639422204723, "loss": 5.2068, "mean_token_accuracy": 0.18122496753931044, "num_tokens": 31389318.0, "step": 18085 }, { "entropy": 5.623923587799072, "epoch": 1.4074693639369773, "grad_norm": 1.0859375, "learning_rate": 0.0004803526170066041, "loss": 5.0892, "mean_token_accuracy": 0.19313371181488037, "num_tokens": 31398442.0, "step": 18090 }, { "entropy": 5.623306941986084, "epoch": 1.4078583933086948, "grad_norm": 1.09375, "learning_rate": 0.00048034128867683674, "loss": 5.0897, "mean_token_accuracy": 0.19325269460678102, "num_tokens": 31406566.0, "step": 18095 }, { "entropy": 5.607749891281128, "epoch": 1.4082474226804123, "grad_norm": 1.15625, "learning_rate": 0.0004803299572313422, "loss": 5.1523, "mean_token_accuracy": 0.18824519217014313, "num_tokens": 31415207.0, "step": 18100 }, { "entropy": 5.692129611968994, "epoch": 1.40863645205213, "grad_norm": 1.1171875, "learning_rate": 0.0004803186226702924, "loss": 5.1372, "mean_token_accuracy": 0.18130026161670684, "num_tokens": 31424175.0, "step": 18105 }, { "entropy": 5.656840801239014, "epoch": 1.4090254814238474, "grad_norm": 1.078125, "learning_rate": 0.0004803072849938592, "loss": 5.1649, "mean_token_accuracy": 0.18290869295597076, "num_tokens": 31434022.0, "step": 18110 }, { "entropy": 5.665083551406861, "epoch": 1.4094145107955651, "grad_norm": 1.046875, "learning_rate": 0.0004802959442022149, "loss": 5.0415, "mean_token_accuracy": 0.19713061600923537, "num_tokens": 31442838.0, "step": 18115 }, { "entropy": 5.638256502151489, "epoch": 1.4098035401672826, "grad_norm": 1.078125, "learning_rate": 0.00048028460029553126, "loss": 5.0545, "mean_token_accuracy": 0.1910913735628128, "num_tokens": 31451482.0, "step": 18120 }, { "entropy": 5.612159204483032, "epoch": 1.4101925695390003, "grad_norm": 1.1328125, "learning_rate": 0.00048027325327398065, "loss": 5.0966, "mean_token_accuracy": 0.19379920065402984, "num_tokens": 31460234.0, "step": 18125 }, { "entropy": 5.603456258773804, "epoch": 1.4105815989107178, "grad_norm": 1.0859375, "learning_rate": 0.0004802619031377351, "loss": 5.046, "mean_token_accuracy": 0.20101485550403594, "num_tokens": 31470466.0, "step": 18130 }, { "entropy": 5.54808406829834, "epoch": 1.4109706282824352, "grad_norm": 1.0546875, "learning_rate": 0.00048025054988696684, "loss": 5.1508, "mean_token_accuracy": 0.19007025063037872, "num_tokens": 31480901.0, "step": 18135 }, { "entropy": 5.616864156723023, "epoch": 1.411359657654153, "grad_norm": 1.0390625, "learning_rate": 0.00048023919352184827, "loss": 5.0591, "mean_token_accuracy": 0.18969772458076478, "num_tokens": 31490329.0, "step": 18140 }, { "entropy": 5.579936361312866, "epoch": 1.4117486870258704, "grad_norm": 1.0, "learning_rate": 0.00048022783404255156, "loss": 5.1002, "mean_token_accuracy": 0.1935671091079712, "num_tokens": 31499519.0, "step": 18145 }, { "entropy": 5.624794054031372, "epoch": 1.412137716397588, "grad_norm": 1.1171875, "learning_rate": 0.0004802164714492491, "loss": 5.1373, "mean_token_accuracy": 0.19408158510923385, "num_tokens": 31507899.0, "step": 18150 }, { "entropy": 5.700310182571411, "epoch": 1.4125267457693056, "grad_norm": 1.109375, "learning_rate": 0.00048020510574211335, "loss": 5.2804, "mean_token_accuracy": 0.179886831343174, "num_tokens": 31517861.0, "step": 18155 }, { "entropy": 5.656043863296508, "epoch": 1.412915775141023, "grad_norm": 1.046875, "learning_rate": 0.00048019373692131674, "loss": 5.1562, "mean_token_accuracy": 0.18432103246450424, "num_tokens": 31527273.0, "step": 18160 }, { "entropy": 5.660457563400269, "epoch": 1.4133048045127408, "grad_norm": 1.4140625, "learning_rate": 0.00048018236498703176, "loss": 5.0776, "mean_token_accuracy": 0.19688465148210527, "num_tokens": 31536221.0, "step": 18165 }, { "entropy": 5.589381694793701, "epoch": 1.4136938338844582, "grad_norm": 1.078125, "learning_rate": 0.00048017098993943097, "loss": 5.0384, "mean_token_accuracy": 0.19620970338582994, "num_tokens": 31544329.0, "step": 18170 }, { "entropy": 5.6423393249511715, "epoch": 1.414082863256176, "grad_norm": 1.125, "learning_rate": 0.000480159611778687, "loss": 5.1152, "mean_token_accuracy": 0.19195820093154908, "num_tokens": 31552323.0, "step": 18175 }, { "entropy": 5.620124769210816, "epoch": 1.4144718926278934, "grad_norm": 1.1640625, "learning_rate": 0.00048014823050497243, "loss": 5.0736, "mean_token_accuracy": 0.19446938186883928, "num_tokens": 31560432.0, "step": 18180 }, { "entropy": 5.5212007522583, "epoch": 1.4148609219996109, "grad_norm": 1.125, "learning_rate": 0.00048013684611846, "loss": 5.0513, "mean_token_accuracy": 0.19666382521390915, "num_tokens": 31569294.0, "step": 18185 }, { "entropy": 5.59936637878418, "epoch": 1.4152499513713286, "grad_norm": 1.1953125, "learning_rate": 0.00048012545861932245, "loss": 5.0672, "mean_token_accuracy": 0.19645187854766846, "num_tokens": 31577860.0, "step": 18190 }, { "entropy": 5.582728719711303, "epoch": 1.415638980743046, "grad_norm": 1.1796875, "learning_rate": 0.0004801140680077325, "loss": 5.0185, "mean_token_accuracy": 0.19730323255062104, "num_tokens": 31586034.0, "step": 18195 }, { "entropy": 5.606848239898682, "epoch": 1.4160280101147635, "grad_norm": 1.0625, "learning_rate": 0.0004801026742838631, "loss": 5.0575, "mean_token_accuracy": 0.19499358236789704, "num_tokens": 31594911.0, "step": 18200 }, { "entropy": 5.622370338439941, "epoch": 1.4164170394864812, "grad_norm": 1.1328125, "learning_rate": 0.0004800912774478871, "loss": 5.1377, "mean_token_accuracy": 0.18979110568761826, "num_tokens": 31603477.0, "step": 18205 }, { "entropy": 5.669853544235229, "epoch": 1.416806068858199, "grad_norm": 1.1328125, "learning_rate": 0.0004800798774999773, "loss": 5.1092, "mean_token_accuracy": 0.1946551099419594, "num_tokens": 31612288.0, "step": 18210 }, { "entropy": 5.617135381698608, "epoch": 1.4171950982299164, "grad_norm": 1.0703125, "learning_rate": 0.00048006847444030686, "loss": 5.0374, "mean_token_accuracy": 0.20270806401968003, "num_tokens": 31621580.0, "step": 18215 }, { "entropy": 5.555125713348389, "epoch": 1.4175841276016339, "grad_norm": 1.0859375, "learning_rate": 0.0004800570682690487, "loss": 5.0428, "mean_token_accuracy": 0.18795739561319352, "num_tokens": 31629860.0, "step": 18220 }, { "entropy": 5.686068058013916, "epoch": 1.4179731569733516, "grad_norm": 1.1796875, "learning_rate": 0.0004800456589863759, "loss": 5.1157, "mean_token_accuracy": 0.1867443472146988, "num_tokens": 31639012.0, "step": 18225 }, { "entropy": 5.632424545288086, "epoch": 1.418362186345069, "grad_norm": 1.0234375, "learning_rate": 0.0004800342465924616, "loss": 5.1263, "mean_token_accuracy": 0.19317781180143356, "num_tokens": 31648675.0, "step": 18230 }, { "entropy": 5.636453104019165, "epoch": 1.4187512157167865, "grad_norm": 1.15625, "learning_rate": 0.000480022831087479, "loss": 5.0783, "mean_token_accuracy": 0.204926760494709, "num_tokens": 31656570.0, "step": 18235 }, { "entropy": 5.5677026271820065, "epoch": 1.4191402450885042, "grad_norm": 1.078125, "learning_rate": 0.0004800114124716012, "loss": 5.021, "mean_token_accuracy": 0.1986503854393959, "num_tokens": 31665636.0, "step": 18240 }, { "entropy": 5.652220916748047, "epoch": 1.4195292744602217, "grad_norm": 1.1171875, "learning_rate": 0.0004799999907450015, "loss": 5.1445, "mean_token_accuracy": 0.18698307126760483, "num_tokens": 31673638.0, "step": 18245 }, { "entropy": 5.647220087051392, "epoch": 1.4199183038319392, "grad_norm": 1.21875, "learning_rate": 0.0004799885659078533, "loss": 5.1086, "mean_token_accuracy": 0.19938829094171523, "num_tokens": 31681886.0, "step": 18250 }, { "entropy": 5.696392822265625, "epoch": 1.4203073332036569, "grad_norm": 1.125, "learning_rate": 0.0004799771379603299, "loss": 5.2431, "mean_token_accuracy": 0.18172856718301772, "num_tokens": 31690349.0, "step": 18255 }, { "entropy": 5.596795272827149, "epoch": 1.4206963625753746, "grad_norm": 1.0625, "learning_rate": 0.0004799657069026046, "loss": 5.0932, "mean_token_accuracy": 0.18580224364995956, "num_tokens": 31699183.0, "step": 18260 }, { "entropy": 5.589864921569824, "epoch": 1.421085391947092, "grad_norm": 1.140625, "learning_rate": 0.00047995427273485097, "loss": 5.0729, "mean_token_accuracy": 0.19426646828651428, "num_tokens": 31707759.0, "step": 18265 }, { "entropy": 5.68631796836853, "epoch": 1.4214744213188095, "grad_norm": 1.1328125, "learning_rate": 0.00047994283545724247, "loss": 5.1959, "mean_token_accuracy": 0.1878586396574974, "num_tokens": 31716383.0, "step": 18270 }, { "entropy": 5.6335736274719235, "epoch": 1.4218634506905272, "grad_norm": 1.1171875, "learning_rate": 0.00047993139506995273, "loss": 5.1149, "mean_token_accuracy": 0.18795016705989837, "num_tokens": 31724617.0, "step": 18275 }, { "entropy": 5.6211004734039305, "epoch": 1.4222524800622447, "grad_norm": 1.203125, "learning_rate": 0.0004799199515731551, "loss": 5.0447, "mean_token_accuracy": 0.19736108928918839, "num_tokens": 31732027.0, "step": 18280 }, { "entropy": 5.556650590896607, "epoch": 1.4226415094339622, "grad_norm": 1.125, "learning_rate": 0.00047990850496702346, "loss": 5.0165, "mean_token_accuracy": 0.19981116205453872, "num_tokens": 31740707.0, "step": 18285 }, { "entropy": 5.614840316772461, "epoch": 1.4230305388056799, "grad_norm": 1.0703125, "learning_rate": 0.0004798970552517314, "loss": 5.0466, "mean_token_accuracy": 0.19524014443159105, "num_tokens": 31748864.0, "step": 18290 }, { "entropy": 5.67936749458313, "epoch": 1.4234195681773973, "grad_norm": 1.046875, "learning_rate": 0.00047988560242745264, "loss": 5.2248, "mean_token_accuracy": 0.18662955462932587, "num_tokens": 31758356.0, "step": 18295 }, { "entropy": 5.652460098266602, "epoch": 1.423808597549115, "grad_norm": 1.2265625, "learning_rate": 0.000479874146494361, "loss": 5.0928, "mean_token_accuracy": 0.20081959068775176, "num_tokens": 31766911.0, "step": 18300 }, { "entropy": 5.628424596786499, "epoch": 1.4241976269208325, "grad_norm": 1.1484375, "learning_rate": 0.0004798626874526302, "loss": 5.1094, "mean_token_accuracy": 0.1921548694372177, "num_tokens": 31775551.0, "step": 18305 }, { "entropy": 5.655199813842773, "epoch": 1.4245866562925502, "grad_norm": 1.0546875, "learning_rate": 0.00047985122530243426, "loss": 5.2528, "mean_token_accuracy": 0.18085827976465224, "num_tokens": 31784064.0, "step": 18310 }, { "entropy": 5.674431228637696, "epoch": 1.4249756856642677, "grad_norm": 1.078125, "learning_rate": 0.000479839760043947, "loss": 5.1177, "mean_token_accuracy": 0.19235825836658477, "num_tokens": 31792574.0, "step": 18315 }, { "entropy": 5.617513179779053, "epoch": 1.4253647150359852, "grad_norm": 1.109375, "learning_rate": 0.00047982829167734245, "loss": 4.9516, "mean_token_accuracy": 0.20302326679229737, "num_tokens": 31800331.0, "step": 18320 }, { "entropy": 5.56688084602356, "epoch": 1.4257537444077029, "grad_norm": 1.171875, "learning_rate": 0.00047981682020279456, "loss": 5.0276, "mean_token_accuracy": 0.19550492763519287, "num_tokens": 31808474.0, "step": 18325 }, { "entropy": 5.634739637374878, "epoch": 1.4261427737794203, "grad_norm": 1.15625, "learning_rate": 0.0004798053456204775, "loss": 5.1295, "mean_token_accuracy": 0.18659272640943528, "num_tokens": 31817026.0, "step": 18330 }, { "entropy": 5.552191543579101, "epoch": 1.4265318031511378, "grad_norm": 1.0703125, "learning_rate": 0.0004797938679305651, "loss": 4.9773, "mean_token_accuracy": 0.1975885584950447, "num_tokens": 31825096.0, "step": 18335 }, { "entropy": 5.586865663528442, "epoch": 1.4269208325228555, "grad_norm": 1.0234375, "learning_rate": 0.00047978238713323193, "loss": 5.1363, "mean_token_accuracy": 0.19227559268474578, "num_tokens": 31833650.0, "step": 18340 }, { "entropy": 5.621965312957764, "epoch": 1.427309861894573, "grad_norm": 1.1796875, "learning_rate": 0.00047977090322865183, "loss": 5.0668, "mean_token_accuracy": 0.19526671022176742, "num_tokens": 31841803.0, "step": 18345 }, { "entropy": 5.662142753601074, "epoch": 1.4276988912662907, "grad_norm": 1.015625, "learning_rate": 0.0004797594162169993, "loss": 5.1272, "mean_token_accuracy": 0.19729547053575516, "num_tokens": 31850121.0, "step": 18350 }, { "entropy": 5.619376516342163, "epoch": 1.4280879206380082, "grad_norm": 1.1796875, "learning_rate": 0.0004797479260984485, "loss": 5.0872, "mean_token_accuracy": 0.192670339345932, "num_tokens": 31858585.0, "step": 18355 }, { "entropy": 5.587238359451294, "epoch": 1.4284769500097259, "grad_norm": 1.2109375, "learning_rate": 0.00047973643287317386, "loss": 5.0725, "mean_token_accuracy": 0.19097839891910554, "num_tokens": 31866199.0, "step": 18360 }, { "entropy": 5.58135027885437, "epoch": 1.4288659793814433, "grad_norm": 1.0390625, "learning_rate": 0.00047972493654134963, "loss": 5.0787, "mean_token_accuracy": 0.1959703803062439, "num_tokens": 31875423.0, "step": 18365 }, { "entropy": 5.576603269577026, "epoch": 1.4292550087531608, "grad_norm": 1.2265625, "learning_rate": 0.00047971343710315043, "loss": 4.9822, "mean_token_accuracy": 0.19986646622419357, "num_tokens": 31883110.0, "step": 18370 }, { "entropy": 5.550352907180786, "epoch": 1.4296440381248785, "grad_norm": 1.0625, "learning_rate": 0.0004797019345587506, "loss": 5.1004, "mean_token_accuracy": 0.19365949779748917, "num_tokens": 31891588.0, "step": 18375 }, { "entropy": 5.580299806594849, "epoch": 1.430033067496596, "grad_norm": 1.046875, "learning_rate": 0.0004796904289083248, "loss": 5.0493, "mean_token_accuracy": 0.19603380858898162, "num_tokens": 31900671.0, "step": 18380 }, { "entropy": 5.645295524597168, "epoch": 1.4304220968683135, "grad_norm": 1.1171875, "learning_rate": 0.0004796789201520474, "loss": 5.1061, "mean_token_accuracy": 0.1948881193995476, "num_tokens": 31909188.0, "step": 18385 }, { "entropy": 5.615600442886352, "epoch": 1.4308111262400312, "grad_norm": 1.140625, "learning_rate": 0.00047966740829009333, "loss": 5.0601, "mean_token_accuracy": 0.20297318696975708, "num_tokens": 31917607.0, "step": 18390 }, { "entropy": 5.626970720291138, "epoch": 1.4312001556117486, "grad_norm": 1.09375, "learning_rate": 0.000479655893322637, "loss": 5.1179, "mean_token_accuracy": 0.18798398226499557, "num_tokens": 31926510.0, "step": 18395 }, { "entropy": 5.62557282447815, "epoch": 1.4315891849834663, "grad_norm": 1.0625, "learning_rate": 0.0004796443752498532, "loss": 5.1973, "mean_token_accuracy": 0.18588899672031403, "num_tokens": 31935550.0, "step": 18400 }, { "entropy": 5.697294759750366, "epoch": 1.4319782143551838, "grad_norm": 1.0390625, "learning_rate": 0.0004796328540719169, "loss": 5.245, "mean_token_accuracy": 0.1828196555376053, "num_tokens": 31944499.0, "step": 18405 }, { "entropy": 5.682896375656128, "epoch": 1.4323672437269015, "grad_norm": 1.1484375, "learning_rate": 0.0004796213297890026, "loss": 4.9934, "mean_token_accuracy": 0.20257802605628966, "num_tokens": 31952622.0, "step": 18410 }, { "entropy": 5.576907920837402, "epoch": 1.432756273098619, "grad_norm": 1.125, "learning_rate": 0.0004796098024012853, "loss": 5.0463, "mean_token_accuracy": 0.19152364432811736, "num_tokens": 31961606.0, "step": 18415 }, { "entropy": 5.591465282440185, "epoch": 1.4331453024703364, "grad_norm": 1.109375, "learning_rate": 0.00047959827190894, "loss": 5.1588, "mean_token_accuracy": 0.1911668822169304, "num_tokens": 31970312.0, "step": 18420 }, { "entropy": 5.638664960861206, "epoch": 1.4335343318420541, "grad_norm": 1.1796875, "learning_rate": 0.00047958673831214157, "loss": 5.1088, "mean_token_accuracy": 0.1924675703048706, "num_tokens": 31978718.0, "step": 18425 }, { "entropy": 5.6605628490447994, "epoch": 1.4339233612137716, "grad_norm": 1.15625, "learning_rate": 0.00047957520161106496, "loss": 5.129, "mean_token_accuracy": 0.19112288504838942, "num_tokens": 31987451.0, "step": 18430 }, { "entropy": 5.630765008926391, "epoch": 1.434312390585489, "grad_norm": 1.09375, "learning_rate": 0.0004795636618058853, "loss": 4.9444, "mean_token_accuracy": 0.20537668615579605, "num_tokens": 31994977.0, "step": 18435 }, { "entropy": 5.562106609344482, "epoch": 1.4347014199572068, "grad_norm": 1.171875, "learning_rate": 0.0004795521188967777, "loss": 5.0107, "mean_token_accuracy": 0.205131596326828, "num_tokens": 32003804.0, "step": 18440 }, { "entropy": 5.65944094657898, "epoch": 1.4350904493289243, "grad_norm": 1.1171875, "learning_rate": 0.0004795405728839172, "loss": 5.157, "mean_token_accuracy": 0.186469466984272, "num_tokens": 32012090.0, "step": 18445 }, { "entropy": 5.625867509841919, "epoch": 1.435479478700642, "grad_norm": 1.2421875, "learning_rate": 0.0004795290237674792, "loss": 5.1, "mean_token_accuracy": 0.19061363786458968, "num_tokens": 32019664.0, "step": 18450 }, { "entropy": 5.639222145080566, "epoch": 1.4358685080723594, "grad_norm": 1.1015625, "learning_rate": 0.00047951747154763866, "loss": 5.1472, "mean_token_accuracy": 0.1914323627948761, "num_tokens": 32028457.0, "step": 18455 }, { "entropy": 5.5980840682983395, "epoch": 1.4362575374440771, "grad_norm": 1.1640625, "learning_rate": 0.00047950591622457106, "loss": 4.9769, "mean_token_accuracy": 0.19838547110557556, "num_tokens": 32036730.0, "step": 18460 }, { "entropy": 5.667256832122803, "epoch": 1.4366465668157946, "grad_norm": 1.1328125, "learning_rate": 0.00047949435779845174, "loss": 5.157, "mean_token_accuracy": 0.19142668843269348, "num_tokens": 32045657.0, "step": 18465 }, { "entropy": 5.598685789108276, "epoch": 1.437035596187512, "grad_norm": 1.0390625, "learning_rate": 0.00047948279626945596, "loss": 5.0746, "mean_token_accuracy": 0.19695494174957276, "num_tokens": 32053973.0, "step": 18470 }, { "entropy": 5.700230741500855, "epoch": 1.4374246255592298, "grad_norm": 1.1328125, "learning_rate": 0.00047947123163775924, "loss": 5.1867, "mean_token_accuracy": 0.18649926781654358, "num_tokens": 32062833.0, "step": 18475 }, { "entropy": 5.58428692817688, "epoch": 1.4378136549309473, "grad_norm": 1.0625, "learning_rate": 0.000479459663903537, "loss": 5.0426, "mean_token_accuracy": 0.20397589355707169, "num_tokens": 32071578.0, "step": 18480 }, { "entropy": 5.573904037475586, "epoch": 1.4382026843026647, "grad_norm": 1.078125, "learning_rate": 0.0004794480930669649, "loss": 4.9845, "mean_token_accuracy": 0.19611933082342148, "num_tokens": 32079847.0, "step": 18485 }, { "entropy": 5.596569156646728, "epoch": 1.4385917136743824, "grad_norm": 1.125, "learning_rate": 0.0004794365191282183, "loss": 5.0594, "mean_token_accuracy": 0.1885624721646309, "num_tokens": 32089751.0, "step": 18490 }, { "entropy": 5.676380157470703, "epoch": 1.4389807430461, "grad_norm": 1.171875, "learning_rate": 0.00047942494208747297, "loss": 5.2091, "mean_token_accuracy": 0.18499039858579636, "num_tokens": 32097791.0, "step": 18495 }, { "entropy": 5.6378261089324955, "epoch": 1.4393697724178176, "grad_norm": 1.1171875, "learning_rate": 0.0004794133619449045, "loss": 5.0123, "mean_token_accuracy": 0.20201625674962997, "num_tokens": 32106417.0, "step": 18500 }, { "entropy": 5.586153173446656, "epoch": 1.439758801789535, "grad_norm": 1.1171875, "learning_rate": 0.0004794017787006886, "loss": 5.1074, "mean_token_accuracy": 0.18926345109939574, "num_tokens": 32115035.0, "step": 18505 }, { "entropy": 5.579412221908569, "epoch": 1.4401478311612528, "grad_norm": 1.125, "learning_rate": 0.000479390192355001, "loss": 5.0476, "mean_token_accuracy": 0.19102127999067306, "num_tokens": 32123704.0, "step": 18510 }, { "entropy": 5.6527947902679445, "epoch": 1.4405368605329703, "grad_norm": 1.140625, "learning_rate": 0.0004793786029080176, "loss": 5.1396, "mean_token_accuracy": 0.1928951308131218, "num_tokens": 32132672.0, "step": 18515 }, { "entropy": 5.603618097305298, "epoch": 1.4409258899046877, "grad_norm": 1.046875, "learning_rate": 0.0004793670103599143, "loss": 5.0526, "mean_token_accuracy": 0.196324722468853, "num_tokens": 32142135.0, "step": 18520 }, { "entropy": 5.656747150421142, "epoch": 1.4413149192764054, "grad_norm": 1.1015625, "learning_rate": 0.00047935541471086677, "loss": 5.1518, "mean_token_accuracy": 0.17748203575611116, "num_tokens": 32151261.0, "step": 18525 }, { "entropy": 5.587941455841064, "epoch": 1.441703948648123, "grad_norm": 1.0625, "learning_rate": 0.0004793438159610511, "loss": 5.0467, "mean_token_accuracy": 0.1954227790236473, "num_tokens": 32159454.0, "step": 18530 }, { "entropy": 5.678868389129638, "epoch": 1.4420929780198404, "grad_norm": 1.1484375, "learning_rate": 0.00047933221411064334, "loss": 5.1374, "mean_token_accuracy": 0.18622193336486817, "num_tokens": 32168706.0, "step": 18535 }, { "entropy": 5.732566022872925, "epoch": 1.442482007391558, "grad_norm": 1.21875, "learning_rate": 0.0004793206091598194, "loss": 5.1976, "mean_token_accuracy": 0.1847882091999054, "num_tokens": 32177892.0, "step": 18540 }, { "entropy": 5.631687307357788, "epoch": 1.4428710367632755, "grad_norm": 1.140625, "learning_rate": 0.0004793090011087554, "loss": 5.0835, "mean_token_accuracy": 0.19265912622213363, "num_tokens": 32186081.0, "step": 18545 }, { "entropy": 5.631122875213623, "epoch": 1.4432600661349932, "grad_norm": 1.0625, "learning_rate": 0.00047929738995762755, "loss": 5.0564, "mean_token_accuracy": 0.1973811626434326, "num_tokens": 32193778.0, "step": 18550 }, { "entropy": 5.5404986381530765, "epoch": 1.4436490955067107, "grad_norm": 1.1484375, "learning_rate": 0.000479285775706612, "loss": 5.0342, "mean_token_accuracy": 0.20107520520687103, "num_tokens": 32202773.0, "step": 18555 }, { "entropy": 5.617558765411377, "epoch": 1.4440381248784284, "grad_norm": 1.03125, "learning_rate": 0.00047927415835588496, "loss": 5.0676, "mean_token_accuracy": 0.19942388385534288, "num_tokens": 32212105.0, "step": 18560 }, { "entropy": 5.570112943649292, "epoch": 1.444427154250146, "grad_norm": 1.140625, "learning_rate": 0.00047926253790562265, "loss": 4.9492, "mean_token_accuracy": 0.20351517498493193, "num_tokens": 32220550.0, "step": 18565 }, { "entropy": 5.567720031738281, "epoch": 1.4448161836218634, "grad_norm": 1.1640625, "learning_rate": 0.00047925091435600147, "loss": 4.9395, "mean_token_accuracy": 0.19839542508125305, "num_tokens": 32228562.0, "step": 18570 }, { "entropy": 5.606336688995361, "epoch": 1.445205212993581, "grad_norm": 1.046875, "learning_rate": 0.00047923928770719776, "loss": 5.1077, "mean_token_accuracy": 0.19797687083482743, "num_tokens": 32237172.0, "step": 18575 }, { "entropy": 5.594252729415894, "epoch": 1.4455942423652985, "grad_norm": 1.03125, "learning_rate": 0.00047922765795938797, "loss": 5.0936, "mean_token_accuracy": 0.19104631394147872, "num_tokens": 32246211.0, "step": 18580 }, { "entropy": 5.534573268890381, "epoch": 1.445983271737016, "grad_norm": 1.1484375, "learning_rate": 0.0004792160251127485, "loss": 5.0193, "mean_token_accuracy": 0.20064648985862732, "num_tokens": 32255366.0, "step": 18585 }, { "entropy": 5.708288764953613, "epoch": 1.4463723011087337, "grad_norm": 1.0390625, "learning_rate": 0.00047920438916745586, "loss": 5.1926, "mean_token_accuracy": 0.18635097593069078, "num_tokens": 32264342.0, "step": 18590 }, { "entropy": 5.649402761459351, "epoch": 1.4467613304804512, "grad_norm": 1.1328125, "learning_rate": 0.0004791927501236866, "loss": 5.1161, "mean_token_accuracy": 0.19162465631961823, "num_tokens": 32273184.0, "step": 18595 }, { "entropy": 5.640807628631592, "epoch": 1.4471503598521689, "grad_norm": 1.078125, "learning_rate": 0.00047918110798161754, "loss": 5.1552, "mean_token_accuracy": 0.1887485519051552, "num_tokens": 32282303.0, "step": 18600 }, { "entropy": 5.624294090270996, "epoch": 1.4475393892238864, "grad_norm": 1.1640625, "learning_rate": 0.00047916946274142503, "loss": 5.0258, "mean_token_accuracy": 0.20135403722524642, "num_tokens": 32291118.0, "step": 18605 }, { "entropy": 5.660922336578369, "epoch": 1.447928418595604, "grad_norm": 1.1875, "learning_rate": 0.00047915781440328593, "loss": 5.0852, "mean_token_accuracy": 0.18727379739284516, "num_tokens": 32299746.0, "step": 18610 }, { "entropy": 5.605949115753174, "epoch": 1.4483174479673215, "grad_norm": 1.0390625, "learning_rate": 0.0004791461629673769, "loss": 5.0953, "mean_token_accuracy": 0.19682133048772812, "num_tokens": 32308515.0, "step": 18615 }, { "entropy": 5.65838851928711, "epoch": 1.448706477339039, "grad_norm": 1.1328125, "learning_rate": 0.0004791345084338748, "loss": 5.199, "mean_token_accuracy": 0.1900344505906105, "num_tokens": 32317607.0, "step": 18620 }, { "entropy": 5.669473266601562, "epoch": 1.4490955067107567, "grad_norm": 1.0859375, "learning_rate": 0.0004791228508029565, "loss": 5.1046, "mean_token_accuracy": 0.19572567492723464, "num_tokens": 32325822.0, "step": 18625 }, { "entropy": 5.672076082229614, "epoch": 1.4494845360824742, "grad_norm": 0.9921875, "learning_rate": 0.00047911119007479873, "loss": 5.1921, "mean_token_accuracy": 0.1872390791773796, "num_tokens": 32336297.0, "step": 18630 }, { "entropy": 5.614063358306884, "epoch": 1.4498735654541917, "grad_norm": 1.09375, "learning_rate": 0.00047909952624957866, "loss": 5.0673, "mean_token_accuracy": 0.19189515411853791, "num_tokens": 32344306.0, "step": 18635 }, { "entropy": 5.6910542964935305, "epoch": 1.4502625948259094, "grad_norm": 1.0, "learning_rate": 0.000479087859327473, "loss": 5.182, "mean_token_accuracy": 0.1891653671860695, "num_tokens": 32353668.0, "step": 18640 }, { "entropy": 5.66265377998352, "epoch": 1.450651624197627, "grad_norm": 1.1875, "learning_rate": 0.000479076189308659, "loss": 5.0744, "mean_token_accuracy": 0.19263841062784196, "num_tokens": 32361563.0, "step": 18645 }, { "entropy": 5.682370519638061, "epoch": 1.4510406535693445, "grad_norm": 1.125, "learning_rate": 0.00047906451619331364, "loss": 5.1791, "mean_token_accuracy": 0.18816327899694443, "num_tokens": 32369612.0, "step": 18650 }, { "entropy": 5.604054594039917, "epoch": 1.451429682941062, "grad_norm": 1.0625, "learning_rate": 0.00047905283998161404, "loss": 4.9846, "mean_token_accuracy": 0.2052964448928833, "num_tokens": 32379013.0, "step": 18655 }, { "entropy": 5.587451457977295, "epoch": 1.4518187123127797, "grad_norm": 1.0703125, "learning_rate": 0.00047904116067373743, "loss": 5.0885, "mean_token_accuracy": 0.19270721971988677, "num_tokens": 32387933.0, "step": 18660 }, { "entropy": 5.644082641601562, "epoch": 1.4522077416844972, "grad_norm": 1.1953125, "learning_rate": 0.0004790294782698609, "loss": 5.1323, "mean_token_accuracy": 0.19549304395914077, "num_tokens": 32395669.0, "step": 18665 }, { "entropy": 5.5467259883880615, "epoch": 1.4525967710562147, "grad_norm": 1.1953125, "learning_rate": 0.0004790177927701618, "loss": 4.9841, "mean_token_accuracy": 0.20273464620113374, "num_tokens": 32403676.0, "step": 18670 }, { "entropy": 5.637514305114746, "epoch": 1.4529858004279324, "grad_norm": 1.015625, "learning_rate": 0.0004790061041748174, "loss": 5.064, "mean_token_accuracy": 0.19444344639778138, "num_tokens": 32412089.0, "step": 18675 }, { "entropy": 5.637416219711303, "epoch": 1.4533748297996498, "grad_norm": 1.109375, "learning_rate": 0.0004789944124840051, "loss": 5.0345, "mean_token_accuracy": 0.20215693414211272, "num_tokens": 32420357.0, "step": 18680 }, { "entropy": 5.641674947738648, "epoch": 1.4537638591713673, "grad_norm": 1.015625, "learning_rate": 0.0004789827176979022, "loss": 5.124, "mean_token_accuracy": 0.1940718859434128, "num_tokens": 32429118.0, "step": 18685 }, { "entropy": 5.666227865219116, "epoch": 1.454152888543085, "grad_norm": 1.109375, "learning_rate": 0.0004789710198166864, "loss": 5.0413, "mean_token_accuracy": 0.19791026115417482, "num_tokens": 32437266.0, "step": 18690 }, { "entropy": 5.650438737869263, "epoch": 1.4545419179148027, "grad_norm": 1.0546875, "learning_rate": 0.00047895931884053497, "loss": 5.1451, "mean_token_accuracy": 0.18620180040597917, "num_tokens": 32446014.0, "step": 18695 }, { "entropy": 5.608058643341065, "epoch": 1.4549309472865202, "grad_norm": 1.2109375, "learning_rate": 0.00047894761476962547, "loss": 5.1222, "mean_token_accuracy": 0.19133968651294708, "num_tokens": 32454591.0, "step": 18700 }, { "entropy": 5.6327752590179445, "epoch": 1.4553199766582376, "grad_norm": 1.1328125, "learning_rate": 0.00047893590760413545, "loss": 5.0818, "mean_token_accuracy": 0.19855124056339263, "num_tokens": 32462748.0, "step": 18705 }, { "entropy": 5.619998121261597, "epoch": 1.4557090060299553, "grad_norm": 1.015625, "learning_rate": 0.00047892419734424276, "loss": 5.0514, "mean_token_accuracy": 0.19774118363857268, "num_tokens": 32471792.0, "step": 18710 }, { "entropy": 5.629866409301758, "epoch": 1.4560980354016728, "grad_norm": 1.0234375, "learning_rate": 0.00047891248399012495, "loss": 5.1246, "mean_token_accuracy": 0.19463704377412797, "num_tokens": 32480804.0, "step": 18715 }, { "entropy": 5.662797212600708, "epoch": 1.4564870647733903, "grad_norm": 1.046875, "learning_rate": 0.0004789007675419597, "loss": 5.0797, "mean_token_accuracy": 0.190041483938694, "num_tokens": 32489591.0, "step": 18720 }, { "entropy": 5.6002167701721195, "epoch": 1.456876094145108, "grad_norm": 1.1640625, "learning_rate": 0.00047888904799992486, "loss": 5.0887, "mean_token_accuracy": 0.19588097780942917, "num_tokens": 32498164.0, "step": 18725 }, { "entropy": 5.572938251495361, "epoch": 1.4572651235168255, "grad_norm": 1.1796875, "learning_rate": 0.00047887732536419826, "loss": 4.9163, "mean_token_accuracy": 0.20508276373147966, "num_tokens": 32505909.0, "step": 18730 }, { "entropy": 5.56914005279541, "epoch": 1.4576541528885432, "grad_norm": 1.1015625, "learning_rate": 0.0004788655996349577, "loss": 5.0507, "mean_token_accuracy": 0.19836744666099548, "num_tokens": 32513990.0, "step": 18735 }, { "entropy": 5.54734354019165, "epoch": 1.4580431822602606, "grad_norm": 1.0078125, "learning_rate": 0.00047885387081238125, "loss": 5.0935, "mean_token_accuracy": 0.1966705337166786, "num_tokens": 32522932.0, "step": 18740 }, { "entropy": 5.586341333389282, "epoch": 1.4584322116319783, "grad_norm": 1.203125, "learning_rate": 0.0004788421388966467, "loss": 5.1631, "mean_token_accuracy": 0.18542364984750748, "num_tokens": 32530953.0, "step": 18745 }, { "entropy": 5.598444080352783, "epoch": 1.4588212410036958, "grad_norm": 1.0859375, "learning_rate": 0.00047883040388793207, "loss": 5.0249, "mean_token_accuracy": 0.1909759059548378, "num_tokens": 32539812.0, "step": 18750 }, { "entropy": 5.590904426574707, "epoch": 1.4592102703754133, "grad_norm": 1.09375, "learning_rate": 0.00047881866578641563, "loss": 5.004, "mean_token_accuracy": 0.19597628116607665, "num_tokens": 32548425.0, "step": 18755 }, { "entropy": 5.572804641723633, "epoch": 1.459599299747131, "grad_norm": 1.1171875, "learning_rate": 0.0004788069245922753, "loss": 5.0602, "mean_token_accuracy": 0.196938718855381, "num_tokens": 32557619.0, "step": 18760 }, { "entropy": 5.631060171127319, "epoch": 1.4599883291188485, "grad_norm": 1.09375, "learning_rate": 0.0004787951803056893, "loss": 5.0974, "mean_token_accuracy": 0.1899582639336586, "num_tokens": 32565602.0, "step": 18765 }, { "entropy": 5.640539216995239, "epoch": 1.460377358490566, "grad_norm": 1.1875, "learning_rate": 0.0004787834329268358, "loss": 5.0929, "mean_token_accuracy": 0.190221931040287, "num_tokens": 32573691.0, "step": 18770 }, { "entropy": 5.6178418636322025, "epoch": 1.4607663878622836, "grad_norm": 1.03125, "learning_rate": 0.000478771682455893, "loss": 5.1855, "mean_token_accuracy": 0.18590253591537476, "num_tokens": 32582642.0, "step": 18775 }, { "entropy": 5.6502768993377686, "epoch": 1.461155417234001, "grad_norm": 1.078125, "learning_rate": 0.0004787599288930393, "loss": 5.0887, "mean_token_accuracy": 0.193520687520504, "num_tokens": 32591328.0, "step": 18780 }, { "entropy": 5.607243824005127, "epoch": 1.4615444466057188, "grad_norm": 1.1171875, "learning_rate": 0.000478748172238453, "loss": 5.0334, "mean_token_accuracy": 0.1931418925523758, "num_tokens": 32599286.0, "step": 18785 }, { "entropy": 5.660870933532715, "epoch": 1.4619334759774363, "grad_norm": 1.125, "learning_rate": 0.0004787364124923125, "loss": 5.2085, "mean_token_accuracy": 0.18378716260194777, "num_tokens": 32608156.0, "step": 18790 }, { "entropy": 5.627944231033325, "epoch": 1.462322505349154, "grad_norm": 1.1484375, "learning_rate": 0.00047872464965479625, "loss": 5.0326, "mean_token_accuracy": 0.1981569692492485, "num_tokens": 32616134.0, "step": 18795 }, { "entropy": 5.623494815826416, "epoch": 1.4627115347208715, "grad_norm": 1.1640625, "learning_rate": 0.0004787128837260826, "loss": 5.0649, "mean_token_accuracy": 0.19462388902902603, "num_tokens": 32624711.0, "step": 18800 }, { "entropy": 5.609109354019165, "epoch": 1.463100564092589, "grad_norm": 1.09375, "learning_rate": 0.0004787011147063503, "loss": 5.0845, "mean_token_accuracy": 0.1947449803352356, "num_tokens": 32633049.0, "step": 18805 }, { "entropy": 5.604067325592041, "epoch": 1.4634895934643066, "grad_norm": 1.1953125, "learning_rate": 0.0004786893425957777, "loss": 5.0366, "mean_token_accuracy": 0.19538322240114211, "num_tokens": 32641173.0, "step": 18810 }, { "entropy": 5.611535978317261, "epoch": 1.463878622836024, "grad_norm": 1.1484375, "learning_rate": 0.0004786775673945436, "loss": 5.0265, "mean_token_accuracy": 0.19927253425121308, "num_tokens": 32650275.0, "step": 18815 }, { "entropy": 5.623269271850586, "epoch": 1.4642676522077416, "grad_norm": 1.0859375, "learning_rate": 0.00047866578910282656, "loss": 5.0394, "mean_token_accuracy": 0.20161254853010177, "num_tokens": 32658675.0, "step": 18820 }, { "entropy": 5.5783905506134035, "epoch": 1.4646566815794593, "grad_norm": 1.1328125, "learning_rate": 0.00047865400772080535, "loss": 5.0478, "mean_token_accuracy": 0.1950514480471611, "num_tokens": 32666643.0, "step": 18825 }, { "entropy": 5.569488525390625, "epoch": 1.4650457109511767, "grad_norm": 1.1015625, "learning_rate": 0.00047864222324865875, "loss": 4.964, "mean_token_accuracy": 0.1971247375011444, "num_tokens": 32674791.0, "step": 18830 }, { "entropy": 5.621426916122436, "epoch": 1.4654347403228944, "grad_norm": 1.1015625, "learning_rate": 0.0004786304356865655, "loss": 5.0667, "mean_token_accuracy": 0.20350729823112487, "num_tokens": 32682790.0, "step": 18835 }, { "entropy": 5.63403549194336, "epoch": 1.465823769694612, "grad_norm": 1.171875, "learning_rate": 0.00047861864503470457, "loss": 5.1752, "mean_token_accuracy": 0.18855532109737397, "num_tokens": 32692701.0, "step": 18840 }, { "entropy": 5.666257238388061, "epoch": 1.4662127990663296, "grad_norm": 1.0546875, "learning_rate": 0.0004786068512932547, "loss": 5.1192, "mean_token_accuracy": 0.1941573441028595, "num_tokens": 32701297.0, "step": 18845 }, { "entropy": 5.622356748580932, "epoch": 1.466601828438047, "grad_norm": 1.046875, "learning_rate": 0.000478595054462395, "loss": 5.0296, "mean_token_accuracy": 0.19540116786956788, "num_tokens": 32710188.0, "step": 18850 }, { "entropy": 5.568635272979736, "epoch": 1.4669908578097646, "grad_norm": 1.0859375, "learning_rate": 0.00047858325454230437, "loss": 5.0799, "mean_token_accuracy": 0.19875933676958085, "num_tokens": 32719255.0, "step": 18855 }, { "entropy": 5.635839128494263, "epoch": 1.4673798871814823, "grad_norm": 1.125, "learning_rate": 0.0004785714515331619, "loss": 5.1147, "mean_token_accuracy": 0.19851367622613908, "num_tokens": 32728133.0, "step": 18860 }, { "entropy": 5.679207706451416, "epoch": 1.4677689165531997, "grad_norm": 1.1875, "learning_rate": 0.00047855964543514666, "loss": 5.1398, "mean_token_accuracy": 0.19351682662963868, "num_tokens": 32736333.0, "step": 18865 }, { "entropy": 5.54669885635376, "epoch": 1.4681579459249172, "grad_norm": 1.1171875, "learning_rate": 0.00047854783624843786, "loss": 5.0482, "mean_token_accuracy": 0.20009141862392427, "num_tokens": 32744954.0, "step": 18870 }, { "entropy": 5.565046787261963, "epoch": 1.468546975296635, "grad_norm": 1.09375, "learning_rate": 0.00047853602397321453, "loss": 5.1133, "mean_token_accuracy": 0.18978338241577147, "num_tokens": 32753720.0, "step": 18875 }, { "entropy": 5.6289421081542965, "epoch": 1.4689360046683524, "grad_norm": 1.0625, "learning_rate": 0.00047852420860965605, "loss": 5.0025, "mean_token_accuracy": 0.20046208798885345, "num_tokens": 32762903.0, "step": 18880 }, { "entropy": 5.704815912246704, "epoch": 1.46932503404007, "grad_norm": 1.125, "learning_rate": 0.00047851239015794166, "loss": 5.1908, "mean_token_accuracy": 0.19168568253517151, "num_tokens": 32771367.0, "step": 18885 }, { "entropy": 5.6372082233428955, "epoch": 1.4697140634117876, "grad_norm": 1.1875, "learning_rate": 0.00047850056861825066, "loss": 5.1001, "mean_token_accuracy": 0.19459104984998704, "num_tokens": 32779782.0, "step": 18890 }, { "entropy": 5.512723922729492, "epoch": 1.4701030927835053, "grad_norm": 1.0546875, "learning_rate": 0.00047848874399076245, "loss": 5.0027, "mean_token_accuracy": 0.19342736452817916, "num_tokens": 32788157.0, "step": 18895 }, { "entropy": 5.506467819213867, "epoch": 1.4704921221552227, "grad_norm": 1.140625, "learning_rate": 0.0004784769162756563, "loss": 4.9677, "mean_token_accuracy": 0.20290024280548097, "num_tokens": 32796590.0, "step": 18900 }, { "entropy": 5.705487871170044, "epoch": 1.4708811515269402, "grad_norm": 1.1640625, "learning_rate": 0.000478465085473112, "loss": 5.1989, "mean_token_accuracy": 0.1869395539164543, "num_tokens": 32806297.0, "step": 18905 }, { "entropy": 5.66557354927063, "epoch": 1.471270180898658, "grad_norm": 1.15625, "learning_rate": 0.0004784532515833088, "loss": 5.0504, "mean_token_accuracy": 0.2005374625325203, "num_tokens": 32815370.0, "step": 18910 }, { "entropy": 5.544957304000855, "epoch": 1.4716592102703754, "grad_norm": 1.0546875, "learning_rate": 0.00047844141460642636, "loss": 5.0886, "mean_token_accuracy": 0.1905941218137741, "num_tokens": 32824678.0, "step": 18915 }, { "entropy": 5.671629762649536, "epoch": 1.4720482396420929, "grad_norm": 1.0078125, "learning_rate": 0.00047842957454264425, "loss": 5.1525, "mean_token_accuracy": 0.18905438631772994, "num_tokens": 32834759.0, "step": 18920 }, { "entropy": 5.7063267707824705, "epoch": 1.4724372690138106, "grad_norm": 1.0625, "learning_rate": 0.00047841773139214213, "loss": 5.1098, "mean_token_accuracy": 0.19695671796798705, "num_tokens": 32843152.0, "step": 18925 }, { "entropy": 5.69730920791626, "epoch": 1.472826298385528, "grad_norm": 1.0859375, "learning_rate": 0.0004784058851550997, "loss": 5.2789, "mean_token_accuracy": 0.17807060182094575, "num_tokens": 32852702.0, "step": 18930 }, { "entropy": 5.602971839904785, "epoch": 1.4732153277572457, "grad_norm": 1.1875, "learning_rate": 0.0004783940358316967, "loss": 4.9783, "mean_token_accuracy": 0.20461677014827728, "num_tokens": 32860201.0, "step": 18935 }, { "entropy": 5.533371257781982, "epoch": 1.4736043571289632, "grad_norm": 1.0625, "learning_rate": 0.00047838218342211296, "loss": 4.9526, "mean_token_accuracy": 0.20545047670602798, "num_tokens": 32868731.0, "step": 18940 }, { "entropy": 5.633207559585571, "epoch": 1.473993386500681, "grad_norm": 1.0390625, "learning_rate": 0.00047837032792652837, "loss": 5.1665, "mean_token_accuracy": 0.19108043164014815, "num_tokens": 32876960.0, "step": 18945 }, { "entropy": 5.64943528175354, "epoch": 1.4743824158723984, "grad_norm": 1.046875, "learning_rate": 0.0004783584693451226, "loss": 5.1162, "mean_token_accuracy": 0.19863019585609437, "num_tokens": 32886446.0, "step": 18950 }, { "entropy": 5.683539390563965, "epoch": 1.4747714452441159, "grad_norm": 1.1328125, "learning_rate": 0.0004783466076780759, "loss": 5.1883, "mean_token_accuracy": 0.18699711412191392, "num_tokens": 32895141.0, "step": 18955 }, { "entropy": 5.632814931869507, "epoch": 1.4751604746158336, "grad_norm": 1.0859375, "learning_rate": 0.0004783347429255679, "loss": 5.0937, "mean_token_accuracy": 0.18989978581666947, "num_tokens": 32904191.0, "step": 18960 }, { "entropy": 5.643506288528442, "epoch": 1.475549503987551, "grad_norm": 1.1328125, "learning_rate": 0.000478322875087779, "loss": 5.0869, "mean_token_accuracy": 0.19535375386476517, "num_tokens": 32912805.0, "step": 18965 }, { "entropy": 5.596161842346191, "epoch": 1.4759385333592685, "grad_norm": 1.1328125, "learning_rate": 0.00047831100416488906, "loss": 5.0408, "mean_token_accuracy": 0.19759644120931624, "num_tokens": 32921275.0, "step": 18970 }, { "entropy": 5.654126787185669, "epoch": 1.4763275627309862, "grad_norm": 1.1015625, "learning_rate": 0.00047829913015707816, "loss": 5.1255, "mean_token_accuracy": 0.19490253031253815, "num_tokens": 32929472.0, "step": 18975 }, { "entropy": 5.602848482131958, "epoch": 1.4767165921027037, "grad_norm": 1.1796875, "learning_rate": 0.00047828725306452657, "loss": 5.1017, "mean_token_accuracy": 0.1915998175740242, "num_tokens": 32937697.0, "step": 18980 }, { "entropy": 5.6230028629302975, "epoch": 1.4771056214744214, "grad_norm": 1.109375, "learning_rate": 0.00047827537288741453, "loss": 5.0871, "mean_token_accuracy": 0.19737082123756408, "num_tokens": 32946516.0, "step": 18985 }, { "entropy": 5.602562999725341, "epoch": 1.4774946508461388, "grad_norm": 1.0625, "learning_rate": 0.0004782634896259222, "loss": 4.9725, "mean_token_accuracy": 0.20284359455108641, "num_tokens": 32954841.0, "step": 18990 }, { "entropy": 5.624081468582153, "epoch": 1.4778836802178565, "grad_norm": 1.0390625, "learning_rate": 0.00047825160328023, "loss": 5.1223, "mean_token_accuracy": 0.19007060378789903, "num_tokens": 32963678.0, "step": 18995 }, { "entropy": 5.547390031814575, "epoch": 1.478272709589574, "grad_norm": 1.046875, "learning_rate": 0.0004782397138505181, "loss": 4.9276, "mean_token_accuracy": 0.20106931030750275, "num_tokens": 32973163.0, "step": 19000 }, { "entropy": 5.6826231479644775, "epoch": 1.4786617389612915, "grad_norm": 1.0859375, "learning_rate": 0.00047822782133696715, "loss": 5.1306, "mean_token_accuracy": 0.19287146031856536, "num_tokens": 32982473.0, "step": 19005 }, { "entropy": 5.630597114562988, "epoch": 1.4790507683330092, "grad_norm": 1.0703125, "learning_rate": 0.0004782159257397574, "loss": 4.9863, "mean_token_accuracy": 0.21068858057260514, "num_tokens": 32990328.0, "step": 19010 }, { "entropy": 5.523217296600341, "epoch": 1.4794397977047267, "grad_norm": 1.09375, "learning_rate": 0.00047820402705906953, "loss": 5.0562, "mean_token_accuracy": 0.19401719570159912, "num_tokens": 32998432.0, "step": 19015 }, { "entropy": 5.607138776779175, "epoch": 1.4798288270764441, "grad_norm": 1.0625, "learning_rate": 0.00047819212529508394, "loss": 5.1349, "mean_token_accuracy": 0.19625232517719268, "num_tokens": 33007017.0, "step": 19020 }, { "entropy": 5.678186655044556, "epoch": 1.4802178564481618, "grad_norm": 1.1171875, "learning_rate": 0.0004781802204479812, "loss": 5.0574, "mean_token_accuracy": 0.2002095714211464, "num_tokens": 33015212.0, "step": 19025 }, { "entropy": 5.641040325164795, "epoch": 1.4806068858198795, "grad_norm": 1.1484375, "learning_rate": 0.0004781683125179421, "loss": 5.0957, "mean_token_accuracy": 0.19393496215343475, "num_tokens": 33023555.0, "step": 19030 }, { "entropy": 5.5690813064575195, "epoch": 1.480995915191597, "grad_norm": 1.046875, "learning_rate": 0.0004781564015051472, "loss": 5.0908, "mean_token_accuracy": 0.1918323427438736, "num_tokens": 33033048.0, "step": 19035 }, { "entropy": 5.520502042770386, "epoch": 1.4813849445633145, "grad_norm": 1.078125, "learning_rate": 0.0004781444874097772, "loss": 4.9688, "mean_token_accuracy": 0.19712026715278624, "num_tokens": 33041553.0, "step": 19040 }, { "entropy": 5.557957410812378, "epoch": 1.4817739739350322, "grad_norm": 1.0625, "learning_rate": 0.00047813257023201307, "loss": 5.077, "mean_token_accuracy": 0.1975543677806854, "num_tokens": 33050864.0, "step": 19045 }, { "entropy": 5.562325382232666, "epoch": 1.4821630033067497, "grad_norm": 1.09375, "learning_rate": 0.0004781206499720354, "loss": 4.9698, "mean_token_accuracy": 0.20305258631706238, "num_tokens": 33059700.0, "step": 19050 }, { "entropy": 5.51577582359314, "epoch": 1.4825520326784671, "grad_norm": 1.046875, "learning_rate": 0.00047810872663002523, "loss": 4.9413, "mean_token_accuracy": 0.2056463822722435, "num_tokens": 33067784.0, "step": 19055 }, { "entropy": 5.6162621021270756, "epoch": 1.4829410620501848, "grad_norm": 1.0546875, "learning_rate": 0.00047809680020616333, "loss": 5.0959, "mean_token_accuracy": 0.18692475110292434, "num_tokens": 33077174.0, "step": 19060 }, { "entropy": 5.665803718566894, "epoch": 1.4833300914219023, "grad_norm": 1.046875, "learning_rate": 0.00047808487070063083, "loss": 5.1253, "mean_token_accuracy": 0.19567935317754745, "num_tokens": 33085492.0, "step": 19065 }, { "entropy": 5.622681045532227, "epoch": 1.4837191207936198, "grad_norm": 1.125, "learning_rate": 0.0004780729381136086, "loss": 5.0582, "mean_token_accuracy": 0.19979335218667985, "num_tokens": 33094388.0, "step": 19070 }, { "entropy": 5.511441659927368, "epoch": 1.4841081501653375, "grad_norm": 1.1640625, "learning_rate": 0.0004780610024452778, "loss": 4.907, "mean_token_accuracy": 0.20075707733631135, "num_tokens": 33101996.0, "step": 19075 }, { "entropy": 5.577497148513794, "epoch": 1.4844971795370552, "grad_norm": 1.1171875, "learning_rate": 0.00047804906369581954, "loss": 5.1478, "mean_token_accuracy": 0.19141252636909484, "num_tokens": 33111139.0, "step": 19080 }, { "entropy": 5.589953374862671, "epoch": 1.4848862089087727, "grad_norm": 1.1328125, "learning_rate": 0.0004780371218654148, "loss": 4.9715, "mean_token_accuracy": 0.198114213347435, "num_tokens": 33119159.0, "step": 19085 }, { "entropy": 5.6928643703460695, "epoch": 1.4852752382804901, "grad_norm": 1.09375, "learning_rate": 0.00047802517695424496, "loss": 5.1371, "mean_token_accuracy": 0.1929064154624939, "num_tokens": 33128317.0, "step": 19090 }, { "entropy": 5.583741903305054, "epoch": 1.4856642676522078, "grad_norm": 1.109375, "learning_rate": 0.0004780132289624913, "loss": 5.0555, "mean_token_accuracy": 0.20420397222042083, "num_tokens": 33136936.0, "step": 19095 }, { "entropy": 5.670713901519775, "epoch": 1.4860532970239253, "grad_norm": 1.15625, "learning_rate": 0.0004780012778903349, "loss": 5.1239, "mean_token_accuracy": 0.19669472724199294, "num_tokens": 33145059.0, "step": 19100 }, { "entropy": 5.5884113788604735, "epoch": 1.4864423263956428, "grad_norm": 1.1171875, "learning_rate": 0.00047798932373795724, "loss": 5.0171, "mean_token_accuracy": 0.18887748420238495, "num_tokens": 33153683.0, "step": 19105 }, { "entropy": 5.699123859405518, "epoch": 1.4868313557673605, "grad_norm": 1.109375, "learning_rate": 0.00047797736650553977, "loss": 5.129, "mean_token_accuracy": 0.1959105670452118, "num_tokens": 33163179.0, "step": 19110 }, { "entropy": 5.607194423675537, "epoch": 1.487220385139078, "grad_norm": 1.1171875, "learning_rate": 0.00047796540619326366, "loss": 4.954, "mean_token_accuracy": 0.20326871126890184, "num_tokens": 33172029.0, "step": 19115 }, { "entropy": 5.655848169326783, "epoch": 1.4876094145107956, "grad_norm": 1.1640625, "learning_rate": 0.0004779534428013107, "loss": 5.1421, "mean_token_accuracy": 0.19332901984453202, "num_tokens": 33181168.0, "step": 19120 }, { "entropy": 5.642968559265137, "epoch": 1.4879984438825131, "grad_norm": 1.078125, "learning_rate": 0.00047794147632986223, "loss": 5.1437, "mean_token_accuracy": 0.18727092891931535, "num_tokens": 33191320.0, "step": 19125 }, { "entropy": 5.556647300720215, "epoch": 1.4883874732542308, "grad_norm": 1.125, "learning_rate": 0.0004779295067790999, "loss": 5.0604, "mean_token_accuracy": 0.1952892005443573, "num_tokens": 33199625.0, "step": 19130 }, { "entropy": 5.62584342956543, "epoch": 1.4887765026259483, "grad_norm": 1.0703125, "learning_rate": 0.0004779175341492053, "loss": 5.0401, "mean_token_accuracy": 0.19846860468387603, "num_tokens": 33208145.0, "step": 19135 }, { "entropy": 5.664146137237549, "epoch": 1.4891655319976658, "grad_norm": 1.171875, "learning_rate": 0.0004779055584403601, "loss": 5.0557, "mean_token_accuracy": 0.19516253471374512, "num_tokens": 33216441.0, "step": 19140 }, { "entropy": 5.667415475845337, "epoch": 1.4895545613693835, "grad_norm": 1.0859375, "learning_rate": 0.000477893579652746, "loss": 5.0574, "mean_token_accuracy": 0.18994946032762527, "num_tokens": 33225612.0, "step": 19145 }, { "entropy": 5.591235065460205, "epoch": 1.489943590741101, "grad_norm": 1.0625, "learning_rate": 0.00047788159778654475, "loss": 5.0459, "mean_token_accuracy": 0.19451239705085754, "num_tokens": 33234410.0, "step": 19150 }, { "entropy": 5.633623933792114, "epoch": 1.4903326201128184, "grad_norm": 1.0859375, "learning_rate": 0.00047786961284193813, "loss": 4.9892, "mean_token_accuracy": 0.2010344535112381, "num_tokens": 33242838.0, "step": 19155 }, { "entropy": 5.616855478286743, "epoch": 1.4907216494845361, "grad_norm": 1.2578125, "learning_rate": 0.0004778576248191081, "loss": 5.1354, "mean_token_accuracy": 0.1909354954957962, "num_tokens": 33251266.0, "step": 19160 }, { "entropy": 5.6047464370727536, "epoch": 1.4911106788562536, "grad_norm": 1.15625, "learning_rate": 0.0004778456337182365, "loss": 5.0411, "mean_token_accuracy": 0.19840567260980607, "num_tokens": 33259644.0, "step": 19165 }, { "entropy": 5.662776708602905, "epoch": 1.4914997082279713, "grad_norm": 1.1484375, "learning_rate": 0.0004778336395395052, "loss": 5.0414, "mean_token_accuracy": 0.1946261316537857, "num_tokens": 33267547.0, "step": 19170 }, { "entropy": 5.63383264541626, "epoch": 1.4918887375996888, "grad_norm": 1.046875, "learning_rate": 0.00047782164228309636, "loss": 5.0746, "mean_token_accuracy": 0.19716629683971404, "num_tokens": 33276808.0, "step": 19175 }, { "entropy": 5.614906454086304, "epoch": 1.4922777669714065, "grad_norm": 1.15625, "learning_rate": 0.00047780964194919193, "loss": 5.1141, "mean_token_accuracy": 0.19483509808778762, "num_tokens": 33285569.0, "step": 19180 }, { "entropy": 5.6178529262542725, "epoch": 1.492666796343124, "grad_norm": 1.1015625, "learning_rate": 0.00047779763853797387, "loss": 5.0976, "mean_token_accuracy": 0.1935784101486206, "num_tokens": 33295214.0, "step": 19185 }, { "entropy": 5.658003234863282, "epoch": 1.4930558257148414, "grad_norm": 1.0625, "learning_rate": 0.0004777856320496245, "loss": 5.0181, "mean_token_accuracy": 0.20267871022224426, "num_tokens": 33304140.0, "step": 19190 }, { "entropy": 5.6380421161651615, "epoch": 1.493444855086559, "grad_norm": 1.125, "learning_rate": 0.000477773622484326, "loss": 5.1314, "mean_token_accuracy": 0.19123824387788774, "num_tokens": 33312879.0, "step": 19195 }, { "entropy": 5.594028568267822, "epoch": 1.4938338844582766, "grad_norm": 1.21875, "learning_rate": 0.0004777616098422604, "loss": 5.0691, "mean_token_accuracy": 0.19961473047733308, "num_tokens": 33320769.0, "step": 19200 }, { "entropy": 5.551181507110596, "epoch": 1.494222913829994, "grad_norm": 1.203125, "learning_rate": 0.00047774959412361014, "loss": 4.9382, "mean_token_accuracy": 0.2064416453242302, "num_tokens": 33328911.0, "step": 19205 }, { "entropy": 5.606557941436767, "epoch": 1.4946119432017118, "grad_norm": 1.1171875, "learning_rate": 0.0004777375753285575, "loss": 5.0251, "mean_token_accuracy": 0.20039540082216262, "num_tokens": 33337607.0, "step": 19210 }, { "entropy": 5.620619678497315, "epoch": 1.4950009725734292, "grad_norm": 1.078125, "learning_rate": 0.00047772555345728486, "loss": 5.0865, "mean_token_accuracy": 0.19120642244815828, "num_tokens": 33346663.0, "step": 19215 }, { "entropy": 5.726786136627197, "epoch": 1.495390001945147, "grad_norm": 1.078125, "learning_rate": 0.0004777135285099746, "loss": 5.137, "mean_token_accuracy": 0.18543317168951035, "num_tokens": 33355501.0, "step": 19220 }, { "entropy": 5.636517143249511, "epoch": 1.4957790313168644, "grad_norm": 1.1015625, "learning_rate": 0.0004777015004868092, "loss": 5.0061, "mean_token_accuracy": 0.19206279516220093, "num_tokens": 33363497.0, "step": 19225 }, { "entropy": 5.575192832946778, "epoch": 1.496168060688582, "grad_norm": 1.1484375, "learning_rate": 0.0004776894693879712, "loss": 4.9634, "mean_token_accuracy": 0.20535971820354462, "num_tokens": 33371349.0, "step": 19230 }, { "entropy": 5.583275985717774, "epoch": 1.4965570900602996, "grad_norm": 1.078125, "learning_rate": 0.0004776774352136431, "loss": 4.9334, "mean_token_accuracy": 0.2051143616437912, "num_tokens": 33379889.0, "step": 19235 }, { "entropy": 5.647780275344848, "epoch": 1.496946119432017, "grad_norm": 1.046875, "learning_rate": 0.00047766539796400756, "loss": 5.091, "mean_token_accuracy": 0.19515041410923004, "num_tokens": 33388452.0, "step": 19240 }, { "entropy": 5.561920404434204, "epoch": 1.4973351488037348, "grad_norm": 1.078125, "learning_rate": 0.0004776533576392471, "loss": 5.0111, "mean_token_accuracy": 0.19974779337644577, "num_tokens": 33397598.0, "step": 19245 }, { "entropy": 5.650741195678711, "epoch": 1.4977241781754522, "grad_norm": 1.09375, "learning_rate": 0.0004776413142395445, "loss": 5.077, "mean_token_accuracy": 0.19172862768173218, "num_tokens": 33406509.0, "step": 19250 }, { "entropy": 5.622381639480591, "epoch": 1.4981132075471697, "grad_norm": 1.109375, "learning_rate": 0.00047762926776508244, "loss": 5.0578, "mean_token_accuracy": 0.19003280997276306, "num_tokens": 33415129.0, "step": 19255 }, { "entropy": 5.52165002822876, "epoch": 1.4985022369188874, "grad_norm": 1.125, "learning_rate": 0.00047761721821604387, "loss": 4.9222, "mean_token_accuracy": 0.1996190145611763, "num_tokens": 33423588.0, "step": 19260 }, { "entropy": 5.638728618621826, "epoch": 1.4988912662906049, "grad_norm": 1.1875, "learning_rate": 0.0004776051655926115, "loss": 5.1293, "mean_token_accuracy": 0.19162203520536422, "num_tokens": 33431598.0, "step": 19265 }, { "entropy": 5.71886305809021, "epoch": 1.4992802956623226, "grad_norm": 1.0625, "learning_rate": 0.00047759310989496813, "loss": 5.1785, "mean_token_accuracy": 0.1957082450389862, "num_tokens": 33441139.0, "step": 19270 }, { "entropy": 5.673923015594482, "epoch": 1.49966932503404, "grad_norm": 1.1875, "learning_rate": 0.0004775810511232969, "loss": 5.035, "mean_token_accuracy": 0.19134389609098434, "num_tokens": 33449558.0, "step": 19275 }, { "entropy": 5.641165494918823, "epoch": 1.5000583544057577, "grad_norm": 1.2265625, "learning_rate": 0.00047756898927778056, "loss": 5.1119, "mean_token_accuracy": 0.1928480863571167, "num_tokens": 33457429.0, "step": 19280 }, { "entropy": 5.558756589889526, "epoch": 1.5004473837774752, "grad_norm": 1.1015625, "learning_rate": 0.00047755692435860227, "loss": 4.9724, "mean_token_accuracy": 0.20363960266113282, "num_tokens": 33465781.0, "step": 19285 }, { "entropy": 5.66274676322937, "epoch": 1.5008364131491927, "grad_norm": 1.125, "learning_rate": 0.000477544856365945, "loss": 5.0351, "mean_token_accuracy": 0.19682733565568925, "num_tokens": 33473865.0, "step": 19290 }, { "entropy": 5.622910451889038, "epoch": 1.5012254425209104, "grad_norm": 1.1796875, "learning_rate": 0.00047753278529999205, "loss": 5.0924, "mean_token_accuracy": 0.1950071409344673, "num_tokens": 33482497.0, "step": 19295 }, { "entropy": 5.607402276992798, "epoch": 1.5016144718926279, "grad_norm": 1.1015625, "learning_rate": 0.00047752071116092637, "loss": 5.0988, "mean_token_accuracy": 0.19350376576185227, "num_tokens": 33490933.0, "step": 19300 }, { "entropy": 5.6274772644042965, "epoch": 1.5020035012643453, "grad_norm": 1.1875, "learning_rate": 0.0004775086339489312, "loss": 5.1078, "mean_token_accuracy": 0.19557205885648726, "num_tokens": 33500192.0, "step": 19305 }, { "entropy": 5.633109998703003, "epoch": 1.502392530636063, "grad_norm": 1.0859375, "learning_rate": 0.0004774965536641899, "loss": 5.0701, "mean_token_accuracy": 0.19493254274129868, "num_tokens": 33508543.0, "step": 19310 }, { "entropy": 5.5880790710449215, "epoch": 1.5027815600077807, "grad_norm": 0.99609375, "learning_rate": 0.00047748447030688575, "loss": 5.0978, "mean_token_accuracy": 0.19160389602184297, "num_tokens": 33517310.0, "step": 19315 }, { "entropy": 5.650627994537354, "epoch": 1.503170589379498, "grad_norm": 1.171875, "learning_rate": 0.00047747238387720194, "loss": 5.1335, "mean_token_accuracy": 0.18930622488260268, "num_tokens": 33526274.0, "step": 19320 }, { "entropy": 5.7084485530853275, "epoch": 1.5035596187512157, "grad_norm": 1.1171875, "learning_rate": 0.000477460294375322, "loss": 5.1364, "mean_token_accuracy": 0.19404075145721436, "num_tokens": 33534438.0, "step": 19325 }, { "entropy": 5.611669588088989, "epoch": 1.5039486481229334, "grad_norm": 1.1640625, "learning_rate": 0.00047744820180142935, "loss": 5.0547, "mean_token_accuracy": 0.19025860577821732, "num_tokens": 33542943.0, "step": 19330 }, { "entropy": 5.599581575393676, "epoch": 1.5043376774946509, "grad_norm": 1.2890625, "learning_rate": 0.00047743610615570746, "loss": 5.0614, "mean_token_accuracy": 0.19358940422534943, "num_tokens": 33550567.0, "step": 19335 }, { "entropy": 5.6271261215209964, "epoch": 1.5047267068663683, "grad_norm": 1.0234375, "learning_rate": 0.00047742400743833993, "loss": 5.1604, "mean_token_accuracy": 0.19190303087234498, "num_tokens": 33559851.0, "step": 19340 }, { "entropy": 5.669795417785645, "epoch": 1.505115736238086, "grad_norm": 1.1953125, "learning_rate": 0.0004774119056495102, "loss": 5.0715, "mean_token_accuracy": 0.1915639564394951, "num_tokens": 33568645.0, "step": 19345 }, { "entropy": 5.628902387619019, "epoch": 1.5055047656098035, "grad_norm": 1.15625, "learning_rate": 0.00047739980078940206, "loss": 5.0424, "mean_token_accuracy": 0.2036150723695755, "num_tokens": 33577331.0, "step": 19350 }, { "entropy": 5.540964078903198, "epoch": 1.505893794981521, "grad_norm": 1.0859375, "learning_rate": 0.00047738769285819894, "loss": 4.9036, "mean_token_accuracy": 0.20337747782468796, "num_tokens": 33586196.0, "step": 19355 }, { "entropy": 5.588247871398925, "epoch": 1.5062828243532387, "grad_norm": 1.0625, "learning_rate": 0.0004773755818560849, "loss": 5.1326, "mean_token_accuracy": 0.19261325299739837, "num_tokens": 33595200.0, "step": 19360 }, { "entropy": 5.60738172531128, "epoch": 1.5066718537249564, "grad_norm": 1.1484375, "learning_rate": 0.0004773634677832434, "loss": 5.013, "mean_token_accuracy": 0.20040953606367112, "num_tokens": 33604130.0, "step": 19365 }, { "entropy": 5.648499774932861, "epoch": 1.5070608830966739, "grad_norm": 1.125, "learning_rate": 0.0004773513506398584, "loss": 5.1968, "mean_token_accuracy": 0.18189657330513, "num_tokens": 33613254.0, "step": 19370 }, { "entropy": 5.6190064430236815, "epoch": 1.5074499124683913, "grad_norm": 1.1875, "learning_rate": 0.0004773392304261137, "loss": 5.0537, "mean_token_accuracy": 0.20282718390226365, "num_tokens": 33621395.0, "step": 19375 }, { "entropy": 5.616506671905517, "epoch": 1.507838941840109, "grad_norm": 1.09375, "learning_rate": 0.0004773271071421933, "loss": 5.0036, "mean_token_accuracy": 0.196007376909256, "num_tokens": 33630293.0, "step": 19380 }, { "entropy": 5.66860065460205, "epoch": 1.5082279712118265, "grad_norm": 1.203125, "learning_rate": 0.00047731498078828105, "loss": 5.1109, "mean_token_accuracy": 0.19406146705150604, "num_tokens": 33638224.0, "step": 19385 }, { "entropy": 5.68125729560852, "epoch": 1.508617000583544, "grad_norm": 1.09375, "learning_rate": 0.000477302851364561, "loss": 5.1554, "mean_token_accuracy": 0.18304163515567778, "num_tokens": 33646974.0, "step": 19390 }, { "entropy": 5.640812683105469, "epoch": 1.5090060299552617, "grad_norm": 1.1328125, "learning_rate": 0.00047729071887121717, "loss": 5.1323, "mean_token_accuracy": 0.18878572136163713, "num_tokens": 33656171.0, "step": 19395 }, { "entropy": 5.622091245651245, "epoch": 1.5093950593269791, "grad_norm": 1.125, "learning_rate": 0.0004772785833084337, "loss": 5.1228, "mean_token_accuracy": 0.18826854079961777, "num_tokens": 33664605.0, "step": 19400 }, { "entropy": 5.652630090713501, "epoch": 1.5097840886986966, "grad_norm": 1.03125, "learning_rate": 0.0004772664446763946, "loss": 5.1083, "mean_token_accuracy": 0.19310170710086821, "num_tokens": 33673128.0, "step": 19405 }, { "entropy": 5.594411039352417, "epoch": 1.5101731180704143, "grad_norm": 1.1015625, "learning_rate": 0.0004772543029752842, "loss": 5.0499, "mean_token_accuracy": 0.19972462952136993, "num_tokens": 33681358.0, "step": 19410 }, { "entropy": 5.556503772735596, "epoch": 1.510562147442132, "grad_norm": 1.171875, "learning_rate": 0.00047724215820528666, "loss": 4.939, "mean_token_accuracy": 0.2080944821238518, "num_tokens": 33690282.0, "step": 19415 }, { "entropy": 5.549698352813721, "epoch": 1.5109511768138495, "grad_norm": 1.1875, "learning_rate": 0.0004772300103665863, "loss": 5.0076, "mean_token_accuracy": 0.1941213235259056, "num_tokens": 33698294.0, "step": 19420 }, { "entropy": 5.5501477241516115, "epoch": 1.511340206185567, "grad_norm": 1.1328125, "learning_rate": 0.00047721785945936733, "loss": 4.9793, "mean_token_accuracy": 0.20674926787614822, "num_tokens": 33706552.0, "step": 19425 }, { "entropy": 5.619852876663208, "epoch": 1.5117292355572847, "grad_norm": 1.1328125, "learning_rate": 0.0004772057054838143, "loss": 5.0335, "mean_token_accuracy": 0.19712848514318465, "num_tokens": 33714704.0, "step": 19430 }, { "entropy": 5.642540121078492, "epoch": 1.5121182649290021, "grad_norm": 1.0703125, "learning_rate": 0.00047719354844011146, "loss": 5.094, "mean_token_accuracy": 0.19931830912828447, "num_tokens": 33723823.0, "step": 19435 }, { "entropy": 5.718218851089477, "epoch": 1.5125072943007196, "grad_norm": 1.203125, "learning_rate": 0.0004771813883284434, "loss": 5.1549, "mean_token_accuracy": 0.19305465519428253, "num_tokens": 33732616.0, "step": 19440 }, { "entropy": 5.577765274047851, "epoch": 1.5128963236724373, "grad_norm": 1.1171875, "learning_rate": 0.00047716922514899455, "loss": 5.0202, "mean_token_accuracy": 0.20044719725847243, "num_tokens": 33741542.0, "step": 19445 }, { "entropy": 5.593866348266602, "epoch": 1.5132853530441548, "grad_norm": 1.15625, "learning_rate": 0.00047715705890194953, "loss": 5.0813, "mean_token_accuracy": 0.1991390824317932, "num_tokens": 33750651.0, "step": 19450 }, { "entropy": 5.537260627746582, "epoch": 1.5136743824158723, "grad_norm": 1.03125, "learning_rate": 0.00047714488958749285, "loss": 5.1175, "mean_token_accuracy": 0.19317656010389328, "num_tokens": 33760741.0, "step": 19455 }, { "entropy": 5.701646995544434, "epoch": 1.51406341178759, "grad_norm": 1.125, "learning_rate": 0.00047713271720580924, "loss": 5.1173, "mean_token_accuracy": 0.19490543603897095, "num_tokens": 33769541.0, "step": 19460 }, { "entropy": 5.644590234756469, "epoch": 1.5144524411593077, "grad_norm": 1.1015625, "learning_rate": 0.0004771205417570834, "loss": 5.1174, "mean_token_accuracy": 0.19758770763874053, "num_tokens": 33778684.0, "step": 19465 }, { "entropy": 5.656781387329102, "epoch": 1.5148414705310251, "grad_norm": 1.125, "learning_rate": 0.00047710836324150004, "loss": 5.0996, "mean_token_accuracy": 0.1960084393620491, "num_tokens": 33787782.0, "step": 19470 }, { "entropy": 5.638566589355468, "epoch": 1.5152304999027426, "grad_norm": 1.046875, "learning_rate": 0.000477096181659244, "loss": 5.054, "mean_token_accuracy": 0.19813997447490692, "num_tokens": 33796194.0, "step": 19475 }, { "entropy": 5.652682542800903, "epoch": 1.5156195292744603, "grad_norm": 1.09375, "learning_rate": 0.0004770839970105, "loss": 5.0524, "mean_token_accuracy": 0.1946710765361786, "num_tokens": 33804615.0, "step": 19480 }, { "entropy": 5.653340196609497, "epoch": 1.5160085586461778, "grad_norm": 1.0390625, "learning_rate": 0.00047707180929545295, "loss": 5.1486, "mean_token_accuracy": 0.1954011395573616, "num_tokens": 33812937.0, "step": 19485 }, { "entropy": 5.601870775222778, "epoch": 1.5163975880178953, "grad_norm": 1.0625, "learning_rate": 0.00047705961851428786, "loss": 5.0152, "mean_token_accuracy": 0.19929749220609666, "num_tokens": 33821454.0, "step": 19490 }, { "entropy": 5.665795755386353, "epoch": 1.516786617389613, "grad_norm": 1.0390625, "learning_rate": 0.00047704742466718973, "loss": 5.1156, "mean_token_accuracy": 0.19531653821468353, "num_tokens": 33829736.0, "step": 19495 }, { "entropy": 5.660660028457642, "epoch": 1.5171756467613304, "grad_norm": 1.1640625, "learning_rate": 0.00047703522775434354, "loss": 5.1024, "mean_token_accuracy": 0.19056737571954727, "num_tokens": 33838403.0, "step": 19500 }, { "entropy": 5.609117317199707, "epoch": 1.517564676133048, "grad_norm": 1.1171875, "learning_rate": 0.00047702302777593425, "loss": 5.0817, "mean_token_accuracy": 0.19499066323041916, "num_tokens": 33847149.0, "step": 19505 }, { "entropy": 5.630152463912964, "epoch": 1.5179537055047656, "grad_norm": 1.078125, "learning_rate": 0.00047701082473214715, "loss": 5.0539, "mean_token_accuracy": 0.19630080610513687, "num_tokens": 33855924.0, "step": 19510 }, { "entropy": 5.605315256118774, "epoch": 1.5183427348764833, "grad_norm": 1.0859375, "learning_rate": 0.00047699861862316725, "loss": 5.0619, "mean_token_accuracy": 0.1962066501379013, "num_tokens": 33864314.0, "step": 19515 }, { "entropy": 5.6441854476928714, "epoch": 1.5187317642482008, "grad_norm": 1.1015625, "learning_rate": 0.0004769864094491798, "loss": 5.0128, "mean_token_accuracy": 0.20023605078458787, "num_tokens": 33873468.0, "step": 19520 }, { "entropy": 5.620679759979248, "epoch": 1.5191207936199183, "grad_norm": 1.0625, "learning_rate": 0.0004769741972103702, "loss": 5.0722, "mean_token_accuracy": 0.19524154663085938, "num_tokens": 33881627.0, "step": 19525 }, { "entropy": 5.5914106369018555, "epoch": 1.519509822991636, "grad_norm": 1.0546875, "learning_rate": 0.00047696198190692353, "loss": 5.0683, "mean_token_accuracy": 0.1924902081489563, "num_tokens": 33889839.0, "step": 19530 }, { "entropy": 5.603225946426392, "epoch": 1.5198988523633534, "grad_norm": 1.15625, "learning_rate": 0.0004769497635390253, "loss": 5.0035, "mean_token_accuracy": 0.1945620968937874, "num_tokens": 33898370.0, "step": 19535 }, { "entropy": 5.651098203659058, "epoch": 1.520287881735071, "grad_norm": 1.1015625, "learning_rate": 0.0004769375421068608, "loss": 5.1051, "mean_token_accuracy": 0.19593175649642944, "num_tokens": 33907419.0, "step": 19540 }, { "entropy": 5.646708917617798, "epoch": 1.5206769111067886, "grad_norm": 1.2109375, "learning_rate": 0.00047692531761061555, "loss": 5.0836, "mean_token_accuracy": 0.190091510117054, "num_tokens": 33915957.0, "step": 19545 }, { "entropy": 5.650356245040894, "epoch": 1.521065940478506, "grad_norm": 1.0859375, "learning_rate": 0.000476913090050475, "loss": 5.0468, "mean_token_accuracy": 0.19721494615077972, "num_tokens": 33924012.0, "step": 19550 }, { "entropy": 5.590018177032471, "epoch": 1.5214549698502235, "grad_norm": 1.375, "learning_rate": 0.00047690085942662464, "loss": 5.1079, "mean_token_accuracy": 0.18801727145910263, "num_tokens": 33932652.0, "step": 19555 }, { "entropy": 5.611227369308471, "epoch": 1.5218439992219412, "grad_norm": 1.1015625, "learning_rate": 0.00047688862573925015, "loss": 5.0231, "mean_token_accuracy": 0.1991322085261345, "num_tokens": 33941208.0, "step": 19560 }, { "entropy": 5.608739757537842, "epoch": 1.522233028593659, "grad_norm": 1.046875, "learning_rate": 0.00047687638898853707, "loss": 5.0247, "mean_token_accuracy": 0.19637274295091628, "num_tokens": 33950435.0, "step": 19565 }, { "entropy": 5.60824146270752, "epoch": 1.5226220579653764, "grad_norm": 1.1953125, "learning_rate": 0.0004768641491746711, "loss": 5.03, "mean_token_accuracy": 0.2013051465153694, "num_tokens": 33959659.0, "step": 19570 }, { "entropy": 5.624347448348999, "epoch": 1.523011087337094, "grad_norm": 1.015625, "learning_rate": 0.000476851906297838, "loss": 5.0471, "mean_token_accuracy": 0.191919207572937, "num_tokens": 33969105.0, "step": 19575 }, { "entropy": 5.621804475784302, "epoch": 1.5234001167088116, "grad_norm": 1.125, "learning_rate": 0.00047683966035822346, "loss": 5.1487, "mean_token_accuracy": 0.1893953189253807, "num_tokens": 33977314.0, "step": 19580 }, { "entropy": 5.603160047531128, "epoch": 1.523789146080529, "grad_norm": 1.1484375, "learning_rate": 0.00047682741135601336, "loss": 5.0751, "mean_token_accuracy": 0.1930656224489212, "num_tokens": 33985696.0, "step": 19585 }, { "entropy": 5.506903409957886, "epoch": 1.5241781754522465, "grad_norm": 1.109375, "learning_rate": 0.00047681515929139356, "loss": 4.847, "mean_token_accuracy": 0.21282618194818498, "num_tokens": 33994539.0, "step": 19590 }, { "entropy": 5.578264808654785, "epoch": 1.5245672048239642, "grad_norm": 1.171875, "learning_rate": 0.00047680290416454995, "loss": 5.1177, "mean_token_accuracy": 0.18260177969932556, "num_tokens": 34003101.0, "step": 19595 }, { "entropy": 5.65296368598938, "epoch": 1.524956234195682, "grad_norm": 1.125, "learning_rate": 0.0004767906459756684, "loss": 5.0614, "mean_token_accuracy": 0.19860363900661468, "num_tokens": 34011344.0, "step": 19600 }, { "entropy": 5.6451750755310055, "epoch": 1.5253452635673992, "grad_norm": 1.1015625, "learning_rate": 0.00047677838472493504, "loss": 5.0775, "mean_token_accuracy": 0.19790596812963485, "num_tokens": 34019628.0, "step": 19605 }, { "entropy": 5.634744930267334, "epoch": 1.5257342929391169, "grad_norm": 1.09375, "learning_rate": 0.0004767661204125358, "loss": 5.0498, "mean_token_accuracy": 0.19294812083244323, "num_tokens": 34027709.0, "step": 19610 }, { "entropy": 5.5801502704620365, "epoch": 1.5261233223108346, "grad_norm": 1.4921875, "learning_rate": 0.0004767538530386569, "loss": 5.1021, "mean_token_accuracy": 0.19398279637098312, "num_tokens": 34036412.0, "step": 19615 }, { "entropy": 5.618213891983032, "epoch": 1.526512351682552, "grad_norm": 1.0859375, "learning_rate": 0.00047674158260348437, "loss": 5.0417, "mean_token_accuracy": 0.20025135278701783, "num_tokens": 34044842.0, "step": 19620 }, { "entropy": 5.548794889450074, "epoch": 1.5269013810542695, "grad_norm": 1.1875, "learning_rate": 0.00047672930910720436, "loss": 5.0051, "mean_token_accuracy": 0.19667597711086274, "num_tokens": 34053286.0, "step": 19625 }, { "entropy": 5.565608263015747, "epoch": 1.5272904104259872, "grad_norm": 1.0546875, "learning_rate": 0.00047671703255000326, "loss": 5.0255, "mean_token_accuracy": 0.2006692573428154, "num_tokens": 34062059.0, "step": 19630 }, { "entropy": 5.634258222579956, "epoch": 1.5276794397977047, "grad_norm": 1.0625, "learning_rate": 0.0004767047529320673, "loss": 5.1078, "mean_token_accuracy": 0.1846057280898094, "num_tokens": 34070800.0, "step": 19635 }, { "entropy": 5.644186735153198, "epoch": 1.5280684691694222, "grad_norm": 1.0703125, "learning_rate": 0.00047669247025358257, "loss": 5.1418, "mean_token_accuracy": 0.19050773978233337, "num_tokens": 34079935.0, "step": 19640 }, { "entropy": 5.595399713516235, "epoch": 1.5284574985411399, "grad_norm": 1.046875, "learning_rate": 0.00047668018451473584, "loss": 5.0139, "mean_token_accuracy": 0.19541258960962296, "num_tokens": 34088614.0, "step": 19645 }, { "entropy": 5.651969385147095, "epoch": 1.5288465279128576, "grad_norm": 1.0703125, "learning_rate": 0.0004766678957157132, "loss": 5.0385, "mean_token_accuracy": 0.20503697097301482, "num_tokens": 34096899.0, "step": 19650 }, { "entropy": 5.656499862670898, "epoch": 1.5292355572845748, "grad_norm": 1.1796875, "learning_rate": 0.0004766556038567013, "loss": 5.1438, "mean_token_accuracy": 0.18763657212257384, "num_tokens": 34105936.0, "step": 19655 }, { "entropy": 5.592771768569946, "epoch": 1.5296245866562925, "grad_norm": 1.15625, "learning_rate": 0.0004766433089378865, "loss": 5.0109, "mean_token_accuracy": 0.19464890658855438, "num_tokens": 34113675.0, "step": 19660 }, { "entropy": 5.600823307037354, "epoch": 1.5300136160280102, "grad_norm": 1.1484375, "learning_rate": 0.00047663101095945544, "loss": 4.9224, "mean_token_accuracy": 0.20701434314250947, "num_tokens": 34121944.0, "step": 19665 }, { "entropy": 5.530815601348877, "epoch": 1.5304026453997277, "grad_norm": 1.1875, "learning_rate": 0.00047661870992159476, "loss": 5.0292, "mean_token_accuracy": 0.20334934294223786, "num_tokens": 34130403.0, "step": 19670 }, { "entropy": 5.6039036273956295, "epoch": 1.5307916747714452, "grad_norm": 1.1875, "learning_rate": 0.00047660640582449106, "loss": 5.1219, "mean_token_accuracy": 0.20233838856220246, "num_tokens": 34139853.0, "step": 19675 }, { "entropy": 5.705723476409912, "epoch": 1.5311807041431629, "grad_norm": 1.1484375, "learning_rate": 0.00047659409866833104, "loss": 5.1529, "mean_token_accuracy": 0.20370273292064667, "num_tokens": 34147833.0, "step": 19680 }, { "entropy": 5.65820894241333, "epoch": 1.5315697335148803, "grad_norm": 1.1484375, "learning_rate": 0.0004765817884533014, "loss": 5.0617, "mean_token_accuracy": 0.2025201916694641, "num_tokens": 34156248.0, "step": 19685 }, { "entropy": 5.482030534744263, "epoch": 1.5319587628865978, "grad_norm": 1.140625, "learning_rate": 0.000476569475179589, "loss": 4.9385, "mean_token_accuracy": 0.20380509942770003, "num_tokens": 34164523.0, "step": 19690 }, { "entropy": 5.626768398284912, "epoch": 1.5323477922583155, "grad_norm": 1.0625, "learning_rate": 0.00047655715884738074, "loss": 5.1945, "mean_token_accuracy": 0.19471436738967896, "num_tokens": 34174084.0, "step": 19695 }, { "entropy": 5.690047740936279, "epoch": 1.5327368216300332, "grad_norm": 1.0703125, "learning_rate": 0.0004765448394568632, "loss": 5.0932, "mean_token_accuracy": 0.19534295201301574, "num_tokens": 34182551.0, "step": 19700 }, { "entropy": 5.582829809188842, "epoch": 1.5331258510017505, "grad_norm": 1.09375, "learning_rate": 0.0004765325170082237, "loss": 4.9426, "mean_token_accuracy": 0.20883558243513106, "num_tokens": 34190899.0, "step": 19705 }, { "entropy": 5.602930355072021, "epoch": 1.5335148803734682, "grad_norm": 1.0703125, "learning_rate": 0.000476520191501649, "loss": 5.1503, "mean_token_accuracy": 0.1931648448109627, "num_tokens": 34200394.0, "step": 19710 }, { "entropy": 5.669780588150024, "epoch": 1.5339039097451859, "grad_norm": 1.15625, "learning_rate": 0.00047650786293732607, "loss": 5.1346, "mean_token_accuracy": 0.1856587454676628, "num_tokens": 34209773.0, "step": 19715 }, { "entropy": 5.660230350494385, "epoch": 1.5342929391169033, "grad_norm": 1.1875, "learning_rate": 0.0004764955313154421, "loss": 5.0693, "mean_token_accuracy": 0.1954827845096588, "num_tokens": 34218487.0, "step": 19720 }, { "entropy": 5.644893312454224, "epoch": 1.5346819684886208, "grad_norm": 1.109375, "learning_rate": 0.00047648319663618415, "loss": 5.1257, "mean_token_accuracy": 0.20266671031713485, "num_tokens": 34227309.0, "step": 19725 }, { "entropy": 5.6277666091918945, "epoch": 1.5350709978603385, "grad_norm": 1.0703125, "learning_rate": 0.00047647085889973936, "loss": 5.0757, "mean_token_accuracy": 0.1967098072171211, "num_tokens": 34235877.0, "step": 19730 }, { "entropy": 5.627515888214111, "epoch": 1.535460027232056, "grad_norm": 1.21875, "learning_rate": 0.00047645851810629503, "loss": 5.0395, "mean_token_accuracy": 0.19868775606155395, "num_tokens": 34244073.0, "step": 19735 }, { "entropy": 5.6074498176574705, "epoch": 1.5358490566037735, "grad_norm": 1.046875, "learning_rate": 0.00047644617425603825, "loss": 5.0788, "mean_token_accuracy": 0.19275624603033065, "num_tokens": 34252255.0, "step": 19740 }, { "entropy": 5.6151293277740475, "epoch": 1.5362380859754912, "grad_norm": 1.1171875, "learning_rate": 0.0004764338273491565, "loss": 5.0686, "mean_token_accuracy": 0.1988752841949463, "num_tokens": 34261063.0, "step": 19745 }, { "entropy": 5.6376872062683105, "epoch": 1.5366271153472089, "grad_norm": 1.171875, "learning_rate": 0.00047642147738583695, "loss": 5.1095, "mean_token_accuracy": 0.1929849550127983, "num_tokens": 34269072.0, "step": 19750 }, { "entropy": 5.6929536819458, "epoch": 1.5370161447189261, "grad_norm": 1.1015625, "learning_rate": 0.0004764091243662671, "loss": 5.0951, "mean_token_accuracy": 0.1925562933087349, "num_tokens": 34277845.0, "step": 19755 }, { "entropy": 5.50715217590332, "epoch": 1.5374051740906438, "grad_norm": 1.1796875, "learning_rate": 0.00047639676829063437, "loss": 4.9282, "mean_token_accuracy": 0.20247926861047744, "num_tokens": 34285831.0, "step": 19760 }, { "entropy": 5.65914740562439, "epoch": 1.5377942034623615, "grad_norm": 1.1484375, "learning_rate": 0.00047638440915912623, "loss": 5.1262, "mean_token_accuracy": 0.1922749936580658, "num_tokens": 34294095.0, "step": 19765 }, { "entropy": 5.686305522918701, "epoch": 1.538183232834079, "grad_norm": 1.09375, "learning_rate": 0.0004763720469719303, "loss": 5.0746, "mean_token_accuracy": 0.19617477506399156, "num_tokens": 34301570.0, "step": 19770 }, { "entropy": 5.622435522079468, "epoch": 1.5385722622057965, "grad_norm": 1.0859375, "learning_rate": 0.000476359681729234, "loss": 5.1067, "mean_token_accuracy": 0.19251677691936492, "num_tokens": 34310119.0, "step": 19775 }, { "entropy": 5.62856912612915, "epoch": 1.5389612915775142, "grad_norm": 1.15625, "learning_rate": 0.000476347313431225, "loss": 5.0238, "mean_token_accuracy": 0.2005590945482254, "num_tokens": 34319622.0, "step": 19780 }, { "entropy": 5.586194849014282, "epoch": 1.5393503209492316, "grad_norm": 1.0, "learning_rate": 0.00047633494207809096, "loss": 5.0356, "mean_token_accuracy": 0.19964371919631957, "num_tokens": 34328376.0, "step": 19785 }, { "entropy": 5.5850992679595945, "epoch": 1.539739350320949, "grad_norm": 1.0859375, "learning_rate": 0.00047632256767001977, "loss": 5.0821, "mean_token_accuracy": 0.19479367434978484, "num_tokens": 34337430.0, "step": 19790 }, { "entropy": 5.660489177703857, "epoch": 1.5401283796926668, "grad_norm": 1.09375, "learning_rate": 0.000476310190207199, "loss": 5.0811, "mean_token_accuracy": 0.19488630294799805, "num_tokens": 34345639.0, "step": 19795 }, { "entropy": 5.6912225723266605, "epoch": 1.5405174090643845, "grad_norm": 1.046875, "learning_rate": 0.00047629780968981653, "loss": 5.0813, "mean_token_accuracy": 0.19781474620103837, "num_tokens": 34354083.0, "step": 19800 }, { "entropy": 5.585956335067749, "epoch": 1.540906438436102, "grad_norm": 1.109375, "learning_rate": 0.00047628542611806007, "loss": 5.0535, "mean_token_accuracy": 0.19291966706514357, "num_tokens": 34363882.0, "step": 19805 }, { "entropy": 5.554418420791626, "epoch": 1.5412954678078195, "grad_norm": 1.109375, "learning_rate": 0.00047627303949211773, "loss": 5.0023, "mean_token_accuracy": 0.19834552109241485, "num_tokens": 34372487.0, "step": 19810 }, { "entropy": 5.59479603767395, "epoch": 1.5416844971795371, "grad_norm": 1.0390625, "learning_rate": 0.0004762606498121774, "loss": 5.0322, "mean_token_accuracy": 0.19938748180866242, "num_tokens": 34380729.0, "step": 19815 }, { "entropy": 5.6450221061706545, "epoch": 1.5420735265512546, "grad_norm": 1.15625, "learning_rate": 0.000476248257078427, "loss": 5.0817, "mean_token_accuracy": 0.19415965676307678, "num_tokens": 34390121.0, "step": 19820 }, { "entropy": 5.60985803604126, "epoch": 1.542462555922972, "grad_norm": 1.09375, "learning_rate": 0.0004762358612910547, "loss": 5.041, "mean_token_accuracy": 0.1984054520726204, "num_tokens": 34398460.0, "step": 19825 }, { "entropy": 5.607812738418579, "epoch": 1.5428515852946898, "grad_norm": 1.0078125, "learning_rate": 0.0004762234624502484, "loss": 5.0415, "mean_token_accuracy": 0.19524168968200684, "num_tokens": 34407406.0, "step": 19830 }, { "entropy": 5.6053698539733885, "epoch": 1.5432406146664073, "grad_norm": 1.078125, "learning_rate": 0.00047621106055619644, "loss": 5.0016, "mean_token_accuracy": 0.20045041888952256, "num_tokens": 34416588.0, "step": 19835 }, { "entropy": 5.624873542785645, "epoch": 1.5436296440381247, "grad_norm": 1.1796875, "learning_rate": 0.00047619865560908687, "loss": 5.0621, "mean_token_accuracy": 0.1941896751523018, "num_tokens": 34425266.0, "step": 19840 }, { "entropy": 5.627095174789429, "epoch": 1.5440186734098424, "grad_norm": 1.0390625, "learning_rate": 0.0004761862476091079, "loss": 5.031, "mean_token_accuracy": 0.1932322636246681, "num_tokens": 34433790.0, "step": 19845 }, { "entropy": 5.685766983032226, "epoch": 1.5444077027815601, "grad_norm": 1.1640625, "learning_rate": 0.00047617383655644785, "loss": 5.1525, "mean_token_accuracy": 0.18489960730075836, "num_tokens": 34442733.0, "step": 19850 }, { "entropy": 5.693801641464233, "epoch": 1.5447967321532776, "grad_norm": 1.109375, "learning_rate": 0.0004761614224512951, "loss": 5.0434, "mean_token_accuracy": 0.19998459666967391, "num_tokens": 34451756.0, "step": 19855 }, { "entropy": 5.616048765182495, "epoch": 1.545185761524995, "grad_norm": 1.140625, "learning_rate": 0.0004761490052938379, "loss": 5.0738, "mean_token_accuracy": 0.19717212170362472, "num_tokens": 34460003.0, "step": 19860 }, { "entropy": 5.606335687637329, "epoch": 1.5455747908967128, "grad_norm": 1.1796875, "learning_rate": 0.0004761365850842646, "loss": 5.0699, "mean_token_accuracy": 0.19799195677042009, "num_tokens": 34468485.0, "step": 19865 }, { "entropy": 5.6451362609863285, "epoch": 1.5459638202684303, "grad_norm": 1.1640625, "learning_rate": 0.0004761241618227639, "loss": 5.0012, "mean_token_accuracy": 0.19553233534097672, "num_tokens": 34477221.0, "step": 19870 }, { "entropy": 5.65382604598999, "epoch": 1.5463528496401477, "grad_norm": 1.171875, "learning_rate": 0.00047611173550952414, "loss": 5.1529, "mean_token_accuracy": 0.19217605739831925, "num_tokens": 34486339.0, "step": 19875 }, { "entropy": 5.635845947265625, "epoch": 1.5467418790118654, "grad_norm": 1.15625, "learning_rate": 0.00047609930614473387, "loss": 5.0197, "mean_token_accuracy": 0.19935112446546555, "num_tokens": 34494595.0, "step": 19880 }, { "entropy": 5.58845887184143, "epoch": 1.547130908383583, "grad_norm": 1.1796875, "learning_rate": 0.00047608687372858175, "loss": 4.9813, "mean_token_accuracy": 0.19906204342842101, "num_tokens": 34502702.0, "step": 19885 }, { "entropy": 5.647160196304322, "epoch": 1.5475199377553004, "grad_norm": 1.1875, "learning_rate": 0.00047607443826125633, "loss": 5.1251, "mean_token_accuracy": 0.19534933269023896, "num_tokens": 34510828.0, "step": 19890 }, { "entropy": 5.709363412857056, "epoch": 1.547908967127018, "grad_norm": 1.1484375, "learning_rate": 0.00047606199974294637, "loss": 5.1891, "mean_token_accuracy": 0.19509582072496415, "num_tokens": 34520288.0, "step": 19895 }, { "entropy": 5.6825488090515135, "epoch": 1.5482979964987358, "grad_norm": 1.1640625, "learning_rate": 0.0004760495581738406, "loss": 5.0566, "mean_token_accuracy": 0.20270530879497528, "num_tokens": 34528178.0, "step": 19900 }, { "entropy": 5.636096239089966, "epoch": 1.5486870258704533, "grad_norm": 1.0703125, "learning_rate": 0.0004760371135541278, "loss": 5.1029, "mean_token_accuracy": 0.18809671252965926, "num_tokens": 34536915.0, "step": 19905 }, { "entropy": 5.66641206741333, "epoch": 1.5490760552421707, "grad_norm": 1.109375, "learning_rate": 0.0004760246658839967, "loss": 5.0548, "mean_token_accuracy": 0.19265463203191757, "num_tokens": 34545009.0, "step": 19910 }, { "entropy": 5.669793939590454, "epoch": 1.5494650846138884, "grad_norm": 1.03125, "learning_rate": 0.0004760122151636364, "loss": 5.1462, "mean_token_accuracy": 0.1940530702471733, "num_tokens": 34553936.0, "step": 19915 }, { "entropy": 5.661856174468994, "epoch": 1.549854113985606, "grad_norm": 1.1171875, "learning_rate": 0.0004759997613932356, "loss": 5.0243, "mean_token_accuracy": 0.2001774340867996, "num_tokens": 34563068.0, "step": 19920 }, { "entropy": 5.665142250061035, "epoch": 1.5502431433573234, "grad_norm": 1.03125, "learning_rate": 0.00047598730457298335, "loss": 5.1666, "mean_token_accuracy": 0.18391934782266617, "num_tokens": 34571787.0, "step": 19925 }, { "entropy": 5.695776271820068, "epoch": 1.550632172729041, "grad_norm": 1.0234375, "learning_rate": 0.00047597484470306866, "loss": 5.0654, "mean_token_accuracy": 0.19397427886724472, "num_tokens": 34580375.0, "step": 19930 }, { "entropy": 5.688618230819702, "epoch": 1.5510212021007586, "grad_norm": 1.15625, "learning_rate": 0.0004759623817836806, "loss": 5.1049, "mean_token_accuracy": 0.19783754348754884, "num_tokens": 34588762.0, "step": 19935 }, { "entropy": 5.59483494758606, "epoch": 1.551410231472476, "grad_norm": 1.140625, "learning_rate": 0.0004759499158150082, "loss": 4.9973, "mean_token_accuracy": 0.2052197962999344, "num_tokens": 34596986.0, "step": 19940 }, { "entropy": 5.709632158279419, "epoch": 1.5517992608441937, "grad_norm": 1.15625, "learning_rate": 0.00047593744679724076, "loss": 5.1209, "mean_token_accuracy": 0.19396817684173584, "num_tokens": 34605445.0, "step": 19945 }, { "entropy": 5.618798112869262, "epoch": 1.5521882902159114, "grad_norm": 1.1171875, "learning_rate": 0.00047592497473056733, "loss": 5.1045, "mean_token_accuracy": 0.1942835971713066, "num_tokens": 34614793.0, "step": 19950 }, { "entropy": 5.7228367805480955, "epoch": 1.552577319587629, "grad_norm": 1.171875, "learning_rate": 0.00047591249961517724, "loss": 5.2085, "mean_token_accuracy": 0.1784688040614128, "num_tokens": 34623790.0, "step": 19955 }, { "entropy": 5.611024665832519, "epoch": 1.5529663489593464, "grad_norm": 1.0546875, "learning_rate": 0.0004759000214512598, "loss": 5.0571, "mean_token_accuracy": 0.196479195356369, "num_tokens": 34632387.0, "step": 19960 }, { "entropy": 5.569279050827026, "epoch": 1.553355378331064, "grad_norm": 1.140625, "learning_rate": 0.0004758875402390042, "loss": 5.0507, "mean_token_accuracy": 0.20331077873706818, "num_tokens": 34640097.0, "step": 19965 }, { "entropy": 5.607867193222046, "epoch": 1.5537444077027815, "grad_norm": 1.09375, "learning_rate": 0.00047587505597859996, "loss": 5.0559, "mean_token_accuracy": 0.19027096182107925, "num_tokens": 34649525.0, "step": 19970 }, { "entropy": 5.591685009002686, "epoch": 1.554133437074499, "grad_norm": 1.03125, "learning_rate": 0.00047586256867023646, "loss": 5.0012, "mean_token_accuracy": 0.2034752756357193, "num_tokens": 34658467.0, "step": 19975 }, { "entropy": 5.694282150268554, "epoch": 1.5545224664462167, "grad_norm": 1.0703125, "learning_rate": 0.0004758500783141032, "loss": 5.1483, "mean_token_accuracy": 0.1910340443253517, "num_tokens": 34666926.0, "step": 19980 }, { "entropy": 5.679008960723877, "epoch": 1.5549114958179344, "grad_norm": 1.109375, "learning_rate": 0.0004758375849103897, "loss": 5.0726, "mean_token_accuracy": 0.19341611564159394, "num_tokens": 34675023.0, "step": 19985 }, { "entropy": 5.6026839256286625, "epoch": 1.5553005251896517, "grad_norm": 1.0859375, "learning_rate": 0.0004758250884592855, "loss": 5.0181, "mean_token_accuracy": 0.20133753567934037, "num_tokens": 34683191.0, "step": 19990 }, { "entropy": 5.616697645187378, "epoch": 1.5556895545613694, "grad_norm": 1.109375, "learning_rate": 0.00047581258896098024, "loss": 5.0416, "mean_token_accuracy": 0.20284320861101152, "num_tokens": 34691899.0, "step": 19995 }, { "entropy": 5.645014047622681, "epoch": 1.556078583933087, "grad_norm": 1.0625, "learning_rate": 0.0004758000864156636, "loss": 5.1262, "mean_token_accuracy": 0.19397966414690018, "num_tokens": 34700942.0, "step": 20000 }, { "entropy": 5.665093231201172, "epoch": 1.5564676133048045, "grad_norm": 1.0625, "learning_rate": 0.00047578758082352527, "loss": 5.1599, "mean_token_accuracy": 0.19051943570375443, "num_tokens": 34710780.0, "step": 20005 }, { "entropy": 5.657600784301758, "epoch": 1.556856642676522, "grad_norm": 1.1171875, "learning_rate": 0.00047577507218475487, "loss": 5.0605, "mean_token_accuracy": 0.1937171623110771, "num_tokens": 34719332.0, "step": 20010 }, { "entropy": 5.676499223709106, "epoch": 1.5572456720482397, "grad_norm": 1.21875, "learning_rate": 0.00047576256049954236, "loss": 5.1172, "mean_token_accuracy": 0.18435289561748505, "num_tokens": 34727890.0, "step": 20015 }, { "entropy": 5.643419790267944, "epoch": 1.5576347014199572, "grad_norm": 1.09375, "learning_rate": 0.0004757500457680776, "loss": 5.099, "mean_token_accuracy": 0.19545732885599137, "num_tokens": 34736942.0, "step": 20020 }, { "entropy": 5.610087060928345, "epoch": 1.5580237307916747, "grad_norm": 1.09375, "learning_rate": 0.0004757375279905504, "loss": 4.9548, "mean_token_accuracy": 0.20365367084741592, "num_tokens": 34745612.0, "step": 20025 }, { "entropy": 5.634346199035645, "epoch": 1.5584127601633924, "grad_norm": 1.1875, "learning_rate": 0.00047572500716715075, "loss": 5.0568, "mean_token_accuracy": 0.19421056658029556, "num_tokens": 34754276.0, "step": 20030 }, { "entropy": 5.603091382980347, "epoch": 1.55880178953511, "grad_norm": 1.171875, "learning_rate": 0.00047571248329806855, "loss": 4.9568, "mean_token_accuracy": 0.2041890576481819, "num_tokens": 34762042.0, "step": 20035 }, { "entropy": 5.564679431915283, "epoch": 1.5591908189068273, "grad_norm": 1.1171875, "learning_rate": 0.00047569995638349383, "loss": 4.9987, "mean_token_accuracy": 0.19739745259284974, "num_tokens": 34770172.0, "step": 20040 }, { "entropy": 5.593704557418823, "epoch": 1.559579848278545, "grad_norm": 1.140625, "learning_rate": 0.0004756874264236168, "loss": 5.0106, "mean_token_accuracy": 0.20030488669872284, "num_tokens": 34778647.0, "step": 20045 }, { "entropy": 5.610961294174194, "epoch": 1.5599688776502627, "grad_norm": 1.1953125, "learning_rate": 0.00047567489341862753, "loss": 5.0453, "mean_token_accuracy": 0.1973257318139076, "num_tokens": 34787409.0, "step": 20050 }, { "entropy": 5.6935631275177006, "epoch": 1.5603579070219802, "grad_norm": 1.09375, "learning_rate": 0.00047566235736871607, "loss": 5.1361, "mean_token_accuracy": 0.19000124782323838, "num_tokens": 34795634.0, "step": 20055 }, { "entropy": 5.627721214294434, "epoch": 1.5607469363936977, "grad_norm": 1.1484375, "learning_rate": 0.00047564981827407277, "loss": 4.9943, "mean_token_accuracy": 0.2055493637919426, "num_tokens": 34803803.0, "step": 20060 }, { "entropy": 5.611069202423096, "epoch": 1.5611359657654154, "grad_norm": 1.1015625, "learning_rate": 0.00047563727613488785, "loss": 5.0003, "mean_token_accuracy": 0.19775864779949187, "num_tokens": 34813202.0, "step": 20065 }, { "entropy": 5.627691268920898, "epoch": 1.5615249951371328, "grad_norm": 1.1171875, "learning_rate": 0.00047562473095135154, "loss": 5.107, "mean_token_accuracy": 0.19250735640525818, "num_tokens": 34821717.0, "step": 20070 }, { "entropy": 5.628086185455322, "epoch": 1.5619140245088503, "grad_norm": 1.1328125, "learning_rate": 0.0004756121827236544, "loss": 5.0173, "mean_token_accuracy": 0.19739003777503966, "num_tokens": 34830366.0, "step": 20075 }, { "entropy": 5.632188558578491, "epoch": 1.562303053880568, "grad_norm": 1.0625, "learning_rate": 0.0004755996314519866, "loss": 5.0864, "mean_token_accuracy": 0.1988873600959778, "num_tokens": 34838734.0, "step": 20080 }, { "entropy": 5.562366199493408, "epoch": 1.5626920832522857, "grad_norm": 1.1171875, "learning_rate": 0.0004755870771365387, "loss": 5.001, "mean_token_accuracy": 0.20255364328622819, "num_tokens": 34846873.0, "step": 20085 }, { "entropy": 5.661673831939697, "epoch": 1.563081112624003, "grad_norm": 1.1484375, "learning_rate": 0.00047557451977750113, "loss": 5.0522, "mean_token_accuracy": 0.1934480294585228, "num_tokens": 34855542.0, "step": 20090 }, { "entropy": 5.614608907699585, "epoch": 1.5634701419957207, "grad_norm": 1.0859375, "learning_rate": 0.0004755619593750645, "loss": 4.9968, "mean_token_accuracy": 0.20677870661020278, "num_tokens": 34864656.0, "step": 20095 }, { "entropy": 5.64049072265625, "epoch": 1.5638591713674383, "grad_norm": 1.09375, "learning_rate": 0.0004755493959294194, "loss": 5.0992, "mean_token_accuracy": 0.19462711811065675, "num_tokens": 34873891.0, "step": 20100 }, { "entropy": 5.636171960830689, "epoch": 1.5642482007391558, "grad_norm": 1.125, "learning_rate": 0.0004755368294407564, "loss": 5.0955, "mean_token_accuracy": 0.19437652975320815, "num_tokens": 34883278.0, "step": 20105 }, { "entropy": 5.567042493820191, "epoch": 1.5646372301108733, "grad_norm": 1.0625, "learning_rate": 0.0004755242599092662, "loss": 5.0096, "mean_token_accuracy": 0.20047936588525772, "num_tokens": 34892323.0, "step": 20110 }, { "entropy": 5.661008501052857, "epoch": 1.565026259482591, "grad_norm": 1.109375, "learning_rate": 0.00047551168733513956, "loss": 5.0619, "mean_token_accuracy": 0.19229132384061814, "num_tokens": 34901774.0, "step": 20115 }, { "entropy": 5.717881345748902, "epoch": 1.5654152888543085, "grad_norm": 1.1015625, "learning_rate": 0.00047549911171856717, "loss": 5.0733, "mean_token_accuracy": 0.19608502089977264, "num_tokens": 34911082.0, "step": 20120 }, { "entropy": 5.655798101425171, "epoch": 1.565804318226026, "grad_norm": 1.1328125, "learning_rate": 0.0004754865330597398, "loss": 5.0725, "mean_token_accuracy": 0.1976458489894867, "num_tokens": 34919631.0, "step": 20125 }, { "entropy": 5.6539222240448, "epoch": 1.5661933475977436, "grad_norm": 1.1875, "learning_rate": 0.00047547395135884854, "loss": 5.075, "mean_token_accuracy": 0.19253887832164765, "num_tokens": 34928258.0, "step": 20130 }, { "entropy": 5.629160833358765, "epoch": 1.5665823769694613, "grad_norm": 1.109375, "learning_rate": 0.0004754613666160841, "loss": 5.0655, "mean_token_accuracy": 0.19675603806972503, "num_tokens": 34936590.0, "step": 20135 }, { "entropy": 5.582829284667969, "epoch": 1.5669714063411786, "grad_norm": 1.09375, "learning_rate": 0.00047544877883163753, "loss": 5.0901, "mean_token_accuracy": 0.18784206956624985, "num_tokens": 34945468.0, "step": 20140 }, { "entropy": 5.588636589050293, "epoch": 1.5673604357128963, "grad_norm": 1.09375, "learning_rate": 0.00047543618800569975, "loss": 5.0063, "mean_token_accuracy": 0.20052008628845214, "num_tokens": 34954005.0, "step": 20145 }, { "entropy": 5.568189287185669, "epoch": 1.567749465084614, "grad_norm": 1.109375, "learning_rate": 0.00047542359413846184, "loss": 5.0066, "mean_token_accuracy": 0.19526299387216567, "num_tokens": 34962852.0, "step": 20150 }, { "entropy": 5.640872955322266, "epoch": 1.5681384944563315, "grad_norm": 1.1015625, "learning_rate": 0.0004754109972301149, "loss": 5.0869, "mean_token_accuracy": 0.18892480283975602, "num_tokens": 34971718.0, "step": 20155 }, { "entropy": 5.669030952453613, "epoch": 1.568527523828049, "grad_norm": 1.140625, "learning_rate": 0.00047539839728085007, "loss": 5.017, "mean_token_accuracy": 0.2027488976716995, "num_tokens": 34980155.0, "step": 20160 }, { "entropy": 5.698576593399048, "epoch": 1.5689165531997666, "grad_norm": 1.171875, "learning_rate": 0.0004753857942908585, "loss": 5.2282, "mean_token_accuracy": 0.18437210470438004, "num_tokens": 34989971.0, "step": 20165 }, { "entropy": 5.598672199249267, "epoch": 1.5693055825714841, "grad_norm": 1.1640625, "learning_rate": 0.0004753731882603315, "loss": 5.0293, "mean_token_accuracy": 0.1893721714615822, "num_tokens": 34998760.0, "step": 20170 }, { "entropy": 5.630321455001831, "epoch": 1.5696946119432016, "grad_norm": 1.1328125, "learning_rate": 0.00047536057918946026, "loss": 5.0792, "mean_token_accuracy": 0.19391676783561707, "num_tokens": 35008020.0, "step": 20175 }, { "entropy": 5.556445217132568, "epoch": 1.5700836413149193, "grad_norm": 1.8046875, "learning_rate": 0.0004753479670784361, "loss": 4.9488, "mean_token_accuracy": 0.20516219288110732, "num_tokens": 35016357.0, "step": 20180 }, { "entropy": 5.586726331710816, "epoch": 1.570472670686637, "grad_norm": 1.203125, "learning_rate": 0.0004753353519274505, "loss": 5.0611, "mean_token_accuracy": 0.19814965426921843, "num_tokens": 35025312.0, "step": 20185 }, { "entropy": 5.635017347335816, "epoch": 1.5708617000583545, "grad_norm": 1.078125, "learning_rate": 0.0004753227337366948, "loss": 5.1322, "mean_token_accuracy": 0.1941147953271866, "num_tokens": 35033781.0, "step": 20190 }, { "entropy": 5.697467374801636, "epoch": 1.571250729430072, "grad_norm": 1.125, "learning_rate": 0.00047531011250636046, "loss": 5.1446, "mean_token_accuracy": 0.19301952570676803, "num_tokens": 35042884.0, "step": 20195 }, { "entropy": 5.628695440292359, "epoch": 1.5716397588017896, "grad_norm": 1.109375, "learning_rate": 0.00047529748823663896, "loss": 4.9863, "mean_token_accuracy": 0.20543665885925294, "num_tokens": 35051789.0, "step": 20200 }, { "entropy": 5.6485589981079105, "epoch": 1.572028788173507, "grad_norm": 1.125, "learning_rate": 0.0004752848609277219, "loss": 5.0795, "mean_token_accuracy": 0.1973910391330719, "num_tokens": 35059958.0, "step": 20205 }, { "entropy": 5.632623386383057, "epoch": 1.5724178175452246, "grad_norm": 1.1328125, "learning_rate": 0.00047527223057980086, "loss": 5.0444, "mean_token_accuracy": 0.20189540088176727, "num_tokens": 35068384.0, "step": 20210 }, { "entropy": 5.685867166519165, "epoch": 1.5728068469169423, "grad_norm": 1.1171875, "learning_rate": 0.00047525959719306736, "loss": 5.114, "mean_token_accuracy": 0.18957228511571883, "num_tokens": 35076660.0, "step": 20215 }, { "entropy": 5.657887744903564, "epoch": 1.5731958762886598, "grad_norm": 1.1171875, "learning_rate": 0.0004752469607677134, "loss": 5.0324, "mean_token_accuracy": 0.20160100013017654, "num_tokens": 35085527.0, "step": 20220 }, { "entropy": 5.615867233276367, "epoch": 1.5735849056603772, "grad_norm": 1.1015625, "learning_rate": 0.0004752343213039305, "loss": 5.0224, "mean_token_accuracy": 0.1970536783337593, "num_tokens": 35094066.0, "step": 20225 }, { "entropy": 5.670680189132691, "epoch": 1.573973935032095, "grad_norm": 1.046875, "learning_rate": 0.0004752216788019104, "loss": 5.1801, "mean_token_accuracy": 0.18883613646030425, "num_tokens": 35103219.0, "step": 20230 }, { "entropy": 5.684045076370239, "epoch": 1.5743629644038126, "grad_norm": 1.1484375, "learning_rate": 0.0004752090332618451, "loss": 5.0873, "mean_token_accuracy": 0.19407470673322677, "num_tokens": 35111336.0, "step": 20235 }, { "entropy": 5.662780809402466, "epoch": 1.57475199377553, "grad_norm": 1.1171875, "learning_rate": 0.0004751963846839263, "loss": 5.0485, "mean_token_accuracy": 0.20413943082094194, "num_tokens": 35119758.0, "step": 20240 }, { "entropy": 5.560201740264892, "epoch": 1.5751410231472476, "grad_norm": 1.1015625, "learning_rate": 0.00047518373306834605, "loss": 4.983, "mean_token_accuracy": 0.20027344226837157, "num_tokens": 35128535.0, "step": 20245 }, { "entropy": 5.625986528396607, "epoch": 1.5755300525189653, "grad_norm": 1.0390625, "learning_rate": 0.00047517107841529626, "loss": 5.134, "mean_token_accuracy": 0.189190836250782, "num_tokens": 35137443.0, "step": 20250 }, { "entropy": 5.561290884017945, "epoch": 1.5759190818906827, "grad_norm": 1.0546875, "learning_rate": 0.000475158420724969, "loss": 4.9266, "mean_token_accuracy": 0.20940395146608354, "num_tokens": 35145801.0, "step": 20255 }, { "entropy": 5.694694566726684, "epoch": 1.5763081112624002, "grad_norm": 1.0703125, "learning_rate": 0.00047514575999755627, "loss": 5.1562, "mean_token_accuracy": 0.18767069578170775, "num_tokens": 35154661.0, "step": 20260 }, { "entropy": 5.66506061553955, "epoch": 1.576697140634118, "grad_norm": 1.15625, "learning_rate": 0.00047513309623325024, "loss": 5.1608, "mean_token_accuracy": 0.18657090067863463, "num_tokens": 35163762.0, "step": 20265 }, { "entropy": 5.64682354927063, "epoch": 1.5770861700058354, "grad_norm": 1.0859375, "learning_rate": 0.0004751204294322429, "loss": 5.0665, "mean_token_accuracy": 0.19244659096002578, "num_tokens": 35172059.0, "step": 20270 }, { "entropy": 5.642732095718384, "epoch": 1.5774751993775529, "grad_norm": 1.1875, "learning_rate": 0.00047510775959472675, "loss": 5.1283, "mean_token_accuracy": 0.1892454966902733, "num_tokens": 35179805.0, "step": 20275 }, { "entropy": 5.585176944732666, "epoch": 1.5778642287492706, "grad_norm": 1.1328125, "learning_rate": 0.0004750950867208937, "loss": 5.0817, "mean_token_accuracy": 0.19841177761554718, "num_tokens": 35188136.0, "step": 20280 }, { "entropy": 5.736662435531616, "epoch": 1.5782532581209883, "grad_norm": 1.1875, "learning_rate": 0.0004750824108109362, "loss": 5.1645, "mean_token_accuracy": 0.1901683747768402, "num_tokens": 35196577.0, "step": 20285 }, { "entropy": 5.61679253578186, "epoch": 1.5786422874927057, "grad_norm": 1.109375, "learning_rate": 0.0004750697318650466, "loss": 5.0736, "mean_token_accuracy": 0.19375281482934953, "num_tokens": 35205223.0, "step": 20290 }, { "entropy": 5.69085545539856, "epoch": 1.5790313168644232, "grad_norm": 1.0625, "learning_rate": 0.0004750570498834173, "loss": 5.1416, "mean_token_accuracy": 0.187985922396183, "num_tokens": 35213776.0, "step": 20295 }, { "entropy": 5.618429803848267, "epoch": 1.579420346236141, "grad_norm": 1.125, "learning_rate": 0.0004750443648662407, "loss": 5.0696, "mean_token_accuracy": 0.19948683083057403, "num_tokens": 35222596.0, "step": 20300 }, { "entropy": 5.7082775115966795, "epoch": 1.5798093756078584, "grad_norm": 1.109375, "learning_rate": 0.00047503167681370924, "loss": 5.2039, "mean_token_accuracy": 0.18726951330900193, "num_tokens": 35232402.0, "step": 20305 }, { "entropy": 5.639067220687866, "epoch": 1.5801984049795759, "grad_norm": 1.15625, "learning_rate": 0.0004750189857260154, "loss": 4.9905, "mean_token_accuracy": 0.20895290076732637, "num_tokens": 35240651.0, "step": 20310 }, { "entropy": 5.581398582458496, "epoch": 1.5805874343512936, "grad_norm": 1.203125, "learning_rate": 0.0004750062916033519, "loss": 5.027, "mean_token_accuracy": 0.19455200731754302, "num_tokens": 35249101.0, "step": 20315 }, { "entropy": 5.647253561019897, "epoch": 1.580976463723011, "grad_norm": 1.0703125, "learning_rate": 0.0004749935944459113, "loss": 5.1305, "mean_token_accuracy": 0.18680695444345474, "num_tokens": 35257909.0, "step": 20320 }, { "entropy": 5.706323909759521, "epoch": 1.5813654930947285, "grad_norm": 1.0703125, "learning_rate": 0.0004749808942538862, "loss": 5.1865, "mean_token_accuracy": 0.18164627701044084, "num_tokens": 35267128.0, "step": 20325 }, { "entropy": 5.670701122283935, "epoch": 1.5817545224664462, "grad_norm": 1.03125, "learning_rate": 0.0004749681910274693, "loss": 5.0713, "mean_token_accuracy": 0.19438831955194474, "num_tokens": 35275751.0, "step": 20330 }, { "entropy": 5.604038524627685, "epoch": 1.582143551838164, "grad_norm": 1.0625, "learning_rate": 0.00047495548476685334, "loss": 4.9836, "mean_token_accuracy": 0.20060366541147232, "num_tokens": 35285359.0, "step": 20335 }, { "entropy": 5.577478981018066, "epoch": 1.5825325812098814, "grad_norm": 1.21875, "learning_rate": 0.00047494277547223125, "loss": 4.9781, "mean_token_accuracy": 0.19926492124795914, "num_tokens": 35293691.0, "step": 20340 }, { "entropy": 5.582086610794067, "epoch": 1.5829216105815989, "grad_norm": 1.109375, "learning_rate": 0.00047493006314379573, "loss": 5.0148, "mean_token_accuracy": 0.2020304471254349, "num_tokens": 35302751.0, "step": 20345 }, { "entropy": 5.70212755203247, "epoch": 1.5833106399533166, "grad_norm": 1.125, "learning_rate": 0.00047491734778173976, "loss": 5.093, "mean_token_accuracy": 0.19042124450206757, "num_tokens": 35311849.0, "step": 20350 }, { "entropy": 5.606876611709595, "epoch": 1.583699669325034, "grad_norm": 1.1171875, "learning_rate": 0.00047490462938625617, "loss": 5.0321, "mean_token_accuracy": 0.198320609331131, "num_tokens": 35320248.0, "step": 20355 }, { "entropy": 5.651252222061157, "epoch": 1.5840886986967515, "grad_norm": 1.125, "learning_rate": 0.00047489190795753806, "loss": 5.0366, "mean_token_accuracy": 0.20442617684602737, "num_tokens": 35328565.0, "step": 20360 }, { "entropy": 5.604735374450684, "epoch": 1.5844777280684692, "grad_norm": 1.171875, "learning_rate": 0.0004748791834957784, "loss": 5.0352, "mean_token_accuracy": 0.20153813660144806, "num_tokens": 35337828.0, "step": 20365 }, { "entropy": 5.640591764450074, "epoch": 1.5848667574401867, "grad_norm": 1.0625, "learning_rate": 0.00047486645600117037, "loss": 5.1281, "mean_token_accuracy": 0.18953794836997986, "num_tokens": 35347107.0, "step": 20370 }, { "entropy": 5.6811388492584225, "epoch": 1.5852557868119042, "grad_norm": 1.0546875, "learning_rate": 0.0004748537254739068, "loss": 5.0515, "mean_token_accuracy": 0.1988525688648224, "num_tokens": 35355925.0, "step": 20375 }, { "entropy": 5.623303079605103, "epoch": 1.5856448161836219, "grad_norm": 1.125, "learning_rate": 0.0004748409919141812, "loss": 5.0239, "mean_token_accuracy": 0.19985021501779557, "num_tokens": 35364319.0, "step": 20380 }, { "entropy": 5.546020793914795, "epoch": 1.5860338455553395, "grad_norm": 1.234375, "learning_rate": 0.0004748282553221865, "loss": 4.9642, "mean_token_accuracy": 0.20473470389842988, "num_tokens": 35372358.0, "step": 20385 }, { "entropy": 5.639964818954468, "epoch": 1.586422874927057, "grad_norm": 1.140625, "learning_rate": 0.0004748155156981162, "loss": 5.2054, "mean_token_accuracy": 0.18248383104801177, "num_tokens": 35381301.0, "step": 20390 }, { "entropy": 5.651611757278443, "epoch": 1.5868119042987745, "grad_norm": 1.2109375, "learning_rate": 0.00047480277304216346, "loss": 5.0181, "mean_token_accuracy": 0.19694725126028062, "num_tokens": 35389778.0, "step": 20395 }, { "entropy": 5.6118851661682125, "epoch": 1.5872009336704922, "grad_norm": 1.15625, "learning_rate": 0.00047479002735452164, "loss": 4.9859, "mean_token_accuracy": 0.19889788329601288, "num_tokens": 35397926.0, "step": 20400 }, { "entropy": 5.5962324142456055, "epoch": 1.5875899630422097, "grad_norm": 1.109375, "learning_rate": 0.00047477727863538415, "loss": 5.0185, "mean_token_accuracy": 0.20125045776367187, "num_tokens": 35406462.0, "step": 20405 }, { "entropy": 5.679141616821289, "epoch": 1.5879789924139271, "grad_norm": 1.1640625, "learning_rate": 0.00047476452688494444, "loss": 5.0256, "mean_token_accuracy": 0.19560559540987016, "num_tokens": 35414989.0, "step": 20410 }, { "entropy": 5.667212677001953, "epoch": 1.5883680217856448, "grad_norm": 1.15625, "learning_rate": 0.000474751772103396, "loss": 5.0136, "mean_token_accuracy": 0.20355913341045379, "num_tokens": 35423738.0, "step": 20415 }, { "entropy": 5.67338376045227, "epoch": 1.5887570511573625, "grad_norm": 1.2265625, "learning_rate": 0.0004747390142909323, "loss": 5.0561, "mean_token_accuracy": 0.19209839254617692, "num_tokens": 35432377.0, "step": 20420 }, { "entropy": 5.589076089859009, "epoch": 1.5891460805290798, "grad_norm": 1.09375, "learning_rate": 0.00047472625344774713, "loss": 5.0438, "mean_token_accuracy": 0.20113733559846877, "num_tokens": 35441188.0, "step": 20425 }, { "entropy": 5.6141499996185305, "epoch": 1.5895351099007975, "grad_norm": 1.125, "learning_rate": 0.00047471348957403374, "loss": 5.1025, "mean_token_accuracy": 0.1982101321220398, "num_tokens": 35449715.0, "step": 20430 }, { "entropy": 5.627524709701538, "epoch": 1.5899241392725152, "grad_norm": 1.171875, "learning_rate": 0.0004747007226699862, "loss": 5.0656, "mean_token_accuracy": 0.1978027567267418, "num_tokens": 35458420.0, "step": 20435 }, { "entropy": 5.6718086242675785, "epoch": 1.5903131686442327, "grad_norm": 1.03125, "learning_rate": 0.00047468795273579803, "loss": 4.9883, "mean_token_accuracy": 0.19835505038499832, "num_tokens": 35467072.0, "step": 20440 }, { "entropy": 5.638486337661743, "epoch": 1.5907021980159501, "grad_norm": 1.1171875, "learning_rate": 0.0004746751797716629, "loss": 5.0537, "mean_token_accuracy": 0.19619325697422027, "num_tokens": 35475539.0, "step": 20445 }, { "entropy": 5.636385822296143, "epoch": 1.5910912273876678, "grad_norm": 1.1015625, "learning_rate": 0.0004746624037777748, "loss": 5.0582, "mean_token_accuracy": 0.20286996513605118, "num_tokens": 35484260.0, "step": 20450 }, { "entropy": 5.665251350402832, "epoch": 1.5914802567593853, "grad_norm": 1.1796875, "learning_rate": 0.00047464962475432754, "loss": 4.9885, "mean_token_accuracy": 0.20174664109945298, "num_tokens": 35492539.0, "step": 20455 }, { "entropy": 5.718202590942383, "epoch": 1.5918692861311028, "grad_norm": 1.1015625, "learning_rate": 0.000474636842701515, "loss": 5.1516, "mean_token_accuracy": 0.19236619174480438, "num_tokens": 35502008.0, "step": 20460 }, { "entropy": 5.6056407451629635, "epoch": 1.5922583155028205, "grad_norm": 1.0859375, "learning_rate": 0.0004746240576195311, "loss": 5.0198, "mean_token_accuracy": 0.19924120903015136, "num_tokens": 35510677.0, "step": 20465 }, { "entropy": 5.60391092300415, "epoch": 1.5926473448745382, "grad_norm": 1.125, "learning_rate": 0.00047461126950856987, "loss": 5.0622, "mean_token_accuracy": 0.19693288952112198, "num_tokens": 35519368.0, "step": 20470 }, { "entropy": 5.701827716827393, "epoch": 1.5930363742462554, "grad_norm": 1.15625, "learning_rate": 0.0004745984783688253, "loss": 5.1815, "mean_token_accuracy": 0.1867993012070656, "num_tokens": 35527952.0, "step": 20475 }, { "entropy": 5.706687116622925, "epoch": 1.5934254036179731, "grad_norm": 1.1796875, "learning_rate": 0.00047458568420049153, "loss": 5.1105, "mean_token_accuracy": 0.1935567080974579, "num_tokens": 35537806.0, "step": 20480 }, { "entropy": 5.578287982940674, "epoch": 1.5938144329896908, "grad_norm": 1.0859375, "learning_rate": 0.00047457288700376274, "loss": 4.9572, "mean_token_accuracy": 0.1940494492650032, "num_tokens": 35546135.0, "step": 20485 }, { "entropy": 5.551790428161621, "epoch": 1.5942034623614083, "grad_norm": 1.125, "learning_rate": 0.00047456008677883304, "loss": 5.0313, "mean_token_accuracy": 0.19893161803483964, "num_tokens": 35555065.0, "step": 20490 }, { "entropy": 5.657136487960815, "epoch": 1.5945924917331258, "grad_norm": 1.21875, "learning_rate": 0.0004745472835258966, "loss": 5.1352, "mean_token_accuracy": 0.19141838401556016, "num_tokens": 35564222.0, "step": 20495 }, { "entropy": 5.6803154945373535, "epoch": 1.5949815211048435, "grad_norm": 1.078125, "learning_rate": 0.00047453447724514773, "loss": 5.099, "mean_token_accuracy": 0.1897246018052101, "num_tokens": 35573021.0, "step": 20500 }, { "entropy": 5.676893854141236, "epoch": 1.595370550476561, "grad_norm": 1.203125, "learning_rate": 0.0004745216679367808, "loss": 5.1332, "mean_token_accuracy": 0.1959197148680687, "num_tokens": 35581105.0, "step": 20505 }, { "entropy": 5.692387914657592, "epoch": 1.5957595798482784, "grad_norm": 1.109375, "learning_rate": 0.0004745088556009901, "loss": 5.1767, "mean_token_accuracy": 0.18537239879369735, "num_tokens": 35590169.0, "step": 20510 }, { "entropy": 5.643527221679688, "epoch": 1.5961486092199961, "grad_norm": 1.1484375, "learning_rate": 0.0004744960402379701, "loss": 5.0617, "mean_token_accuracy": 0.20321208089590073, "num_tokens": 35598760.0, "step": 20515 }, { "entropy": 5.690423107147216, "epoch": 1.5965376385917138, "grad_norm": 1.21875, "learning_rate": 0.00047448322184791525, "loss": 5.1003, "mean_token_accuracy": 0.19415076971054077, "num_tokens": 35607014.0, "step": 20520 }, { "entropy": 5.689444875717163, "epoch": 1.596926667963431, "grad_norm": 1.109375, "learning_rate": 0.00047447040043101994, "loss": 5.0687, "mean_token_accuracy": 0.19446302056312562, "num_tokens": 35615319.0, "step": 20525 }, { "entropy": 5.621392011642456, "epoch": 1.5973156973351488, "grad_norm": 1.1484375, "learning_rate": 0.00047445757598747886, "loss": 5.0904, "mean_token_accuracy": 0.1962117910385132, "num_tokens": 35623836.0, "step": 20530 }, { "entropy": 5.585716772079468, "epoch": 1.5977047267068665, "grad_norm": 1.03125, "learning_rate": 0.0004744447485174864, "loss": 4.981, "mean_token_accuracy": 0.1976259395480156, "num_tokens": 35632601.0, "step": 20535 }, { "entropy": 5.734390735626221, "epoch": 1.598093756078584, "grad_norm": 1.15625, "learning_rate": 0.00047443191802123746, "loss": 5.1334, "mean_token_accuracy": 0.19487304538488387, "num_tokens": 35642035.0, "step": 20540 }, { "entropy": 5.639154052734375, "epoch": 1.5984827854503014, "grad_norm": 1.0859375, "learning_rate": 0.00047441908449892664, "loss": 5.0538, "mean_token_accuracy": 0.20130744874477385, "num_tokens": 35650454.0, "step": 20545 }, { "entropy": 5.6871569633483885, "epoch": 1.5988718148220191, "grad_norm": 1.0859375, "learning_rate": 0.00047440624795074855, "loss": 5.0974, "mean_token_accuracy": 0.1976846382021904, "num_tokens": 35658945.0, "step": 20550 }, { "entropy": 5.674994468688965, "epoch": 1.5992608441937366, "grad_norm": 1.1015625, "learning_rate": 0.00047439340837689804, "loss": 5.0921, "mean_token_accuracy": 0.19574213027954102, "num_tokens": 35667193.0, "step": 20555 }, { "entropy": 5.605404663085937, "epoch": 1.599649873565454, "grad_norm": 1.0859375, "learning_rate": 0.00047438056577756986, "loss": 4.943, "mean_token_accuracy": 0.2057245135307312, "num_tokens": 35676100.0, "step": 20560 }, { "entropy": 5.647966051101685, "epoch": 1.6000389029371718, "grad_norm": 1.1796875, "learning_rate": 0.00047436772015295903, "loss": 5.0667, "mean_token_accuracy": 0.19314984381198883, "num_tokens": 35684352.0, "step": 20565 }, { "entropy": 5.673441696166992, "epoch": 1.6004279323088895, "grad_norm": 0.98828125, "learning_rate": 0.00047435487150326036, "loss": 5.0147, "mean_token_accuracy": 0.20399393886327744, "num_tokens": 35693044.0, "step": 20570 }, { "entropy": 5.591395711898803, "epoch": 1.6008169616806067, "grad_norm": 1.15625, "learning_rate": 0.0004743420198286688, "loss": 5.0088, "mean_token_accuracy": 0.20347841084003448, "num_tokens": 35701172.0, "step": 20575 }, { "entropy": 5.62863564491272, "epoch": 1.6012059910523244, "grad_norm": 1.1171875, "learning_rate": 0.00047432916512937936, "loss": 5.1096, "mean_token_accuracy": 0.1904487982392311, "num_tokens": 35709905.0, "step": 20580 }, { "entropy": 5.622174978256226, "epoch": 1.6015950204240421, "grad_norm": 1.171875, "learning_rate": 0.0004743163074055871, "loss": 5.0712, "mean_token_accuracy": 0.19702855348587037, "num_tokens": 35718404.0, "step": 20585 }, { "entropy": 5.677816534042359, "epoch": 1.6019840497957596, "grad_norm": 1.2890625, "learning_rate": 0.0004743034466574871, "loss": 5.0889, "mean_token_accuracy": 0.19194709211587907, "num_tokens": 35726475.0, "step": 20590 }, { "entropy": 5.654997396469116, "epoch": 1.602373079167477, "grad_norm": 1.140625, "learning_rate": 0.0004742905828852746, "loss": 5.1117, "mean_token_accuracy": 0.1939750149846077, "num_tokens": 35734819.0, "step": 20595 }, { "entropy": 5.58772087097168, "epoch": 1.6027621085391948, "grad_norm": 1.0703125, "learning_rate": 0.0004742777160891447, "loss": 4.9955, "mean_token_accuracy": 0.200380939245224, "num_tokens": 35743098.0, "step": 20600 }, { "entropy": 5.66486496925354, "epoch": 1.6031511379109122, "grad_norm": 1.125, "learning_rate": 0.0004742648462692926, "loss": 5.1079, "mean_token_accuracy": 0.19390379041433334, "num_tokens": 35752502.0, "step": 20605 }, { "entropy": 5.675458478927612, "epoch": 1.6035401672826297, "grad_norm": 1.0859375, "learning_rate": 0.00047425197342591363, "loss": 5.0381, "mean_token_accuracy": 0.20833075493574144, "num_tokens": 35761293.0, "step": 20610 }, { "entropy": 5.647287654876709, "epoch": 1.6039291966543474, "grad_norm": 1.078125, "learning_rate": 0.0004742390975592031, "loss": 5.1622, "mean_token_accuracy": 0.1827400729060173, "num_tokens": 35771031.0, "step": 20615 }, { "entropy": 5.675501918792724, "epoch": 1.604318226026065, "grad_norm": 1.140625, "learning_rate": 0.00047422621866935645, "loss": 5.0616, "mean_token_accuracy": 0.19546449929475784, "num_tokens": 35778894.0, "step": 20620 }, { "entropy": 5.735651063919067, "epoch": 1.6047072553977826, "grad_norm": 1.140625, "learning_rate": 0.000474213336756569, "loss": 5.1229, "mean_token_accuracy": 0.19083805829286576, "num_tokens": 35787159.0, "step": 20625 }, { "entropy": 5.60609540939331, "epoch": 1.6050962847695, "grad_norm": 1.140625, "learning_rate": 0.0004742004518210362, "loss": 5.04, "mean_token_accuracy": 0.2049606204032898, "num_tokens": 35795858.0, "step": 20630 }, { "entropy": 5.604734611511231, "epoch": 1.6054853141412178, "grad_norm": 1.1953125, "learning_rate": 0.0004741875638629536, "loss": 5.0508, "mean_token_accuracy": 0.2021583303809166, "num_tokens": 35804754.0, "step": 20635 }, { "entropy": 5.707863759994507, "epoch": 1.6058743435129352, "grad_norm": 1.09375, "learning_rate": 0.0004741746728825168, "loss": 5.1498, "mean_token_accuracy": 0.1861529216170311, "num_tokens": 35813622.0, "step": 20640 }, { "entropy": 5.638468790054321, "epoch": 1.6062633728846527, "grad_norm": 1.234375, "learning_rate": 0.0004741617788799213, "loss": 5.0428, "mean_token_accuracy": 0.19861431419849396, "num_tokens": 35821345.0, "step": 20645 }, { "entropy": 5.608671092987061, "epoch": 1.6066524022563704, "grad_norm": 1.0859375, "learning_rate": 0.00047414888185536285, "loss": 5.0527, "mean_token_accuracy": 0.20123450756072997, "num_tokens": 35830058.0, "step": 20650 }, { "entropy": 5.674367952346802, "epoch": 1.6070414316280879, "grad_norm": 1.09375, "learning_rate": 0.0004741359818090371, "loss": 5.0754, "mean_token_accuracy": 0.19666314125061035, "num_tokens": 35838951.0, "step": 20655 }, { "entropy": 5.6696014404296875, "epoch": 1.6074304609998054, "grad_norm": 1.1484375, "learning_rate": 0.00047412307874113976, "loss": 5.039, "mean_token_accuracy": 0.2006827637553215, "num_tokens": 35847245.0, "step": 20660 }, { "entropy": 5.678802108764648, "epoch": 1.607819490371523, "grad_norm": 1.0703125, "learning_rate": 0.0004741101726518667, "loss": 5.1442, "mean_token_accuracy": 0.1897593155503273, "num_tokens": 35856037.0, "step": 20665 }, { "entropy": 5.600672960281372, "epoch": 1.6082085197432407, "grad_norm": 1.0703125, "learning_rate": 0.0004740972635414136, "loss": 4.9946, "mean_token_accuracy": 0.20069389194250106, "num_tokens": 35864881.0, "step": 20670 }, { "entropy": 5.734729290008545, "epoch": 1.6085975491149582, "grad_norm": 1.2734375, "learning_rate": 0.0004740843514099765, "loss": 5.1038, "mean_token_accuracy": 0.19034747034311295, "num_tokens": 35872941.0, "step": 20675 }, { "entropy": 5.600311899185181, "epoch": 1.6089865784866757, "grad_norm": 1.078125, "learning_rate": 0.0004740714362577512, "loss": 5.0818, "mean_token_accuracy": 0.19161975085735322, "num_tokens": 35882068.0, "step": 20680 }, { "entropy": 5.595686388015747, "epoch": 1.6093756078583934, "grad_norm": 1.1484375, "learning_rate": 0.00047405851808493364, "loss": 5.0161, "mean_token_accuracy": 0.19953440874814987, "num_tokens": 35890306.0, "step": 20685 }, { "entropy": 5.6738725185394285, "epoch": 1.6097646372301109, "grad_norm": 1.1171875, "learning_rate": 0.00047404559689172006, "loss": 5.0854, "mean_token_accuracy": 0.20426378399133682, "num_tokens": 35899311.0, "step": 20690 }, { "entropy": 5.660208320617675, "epoch": 1.6101536666018283, "grad_norm": 1.03125, "learning_rate": 0.00047403267267830617, "loss": 5.139, "mean_token_accuracy": 0.1853990823030472, "num_tokens": 35908599.0, "step": 20695 }, { "entropy": 5.656005811691284, "epoch": 1.610542695973546, "grad_norm": 1.1015625, "learning_rate": 0.00047401974544488844, "loss": 5.0885, "mean_token_accuracy": 0.194300676882267, "num_tokens": 35917318.0, "step": 20700 }, { "entropy": 5.686577224731446, "epoch": 1.6109317253452635, "grad_norm": 1.171875, "learning_rate": 0.0004740068151916628, "loss": 5.0472, "mean_token_accuracy": 0.20165519118309022, "num_tokens": 35926179.0, "step": 20705 }, { "entropy": 5.579198503494263, "epoch": 1.611320754716981, "grad_norm": 1.1328125, "learning_rate": 0.0004739938819188255, "loss": 4.9406, "mean_token_accuracy": 0.21100088357925414, "num_tokens": 35934155.0, "step": 20710 }, { "entropy": 5.5677179336547855, "epoch": 1.6117097840886987, "grad_norm": 1.125, "learning_rate": 0.0004739809456265727, "loss": 5.0009, "mean_token_accuracy": 0.20057405531406403, "num_tokens": 35942301.0, "step": 20715 }, { "entropy": 5.572567415237427, "epoch": 1.6120988134604164, "grad_norm": 1.1875, "learning_rate": 0.0004739680063151008, "loss": 4.9897, "mean_token_accuracy": 0.20024237930774688, "num_tokens": 35951005.0, "step": 20720 }, { "entropy": 5.603487777709961, "epoch": 1.6124878428321339, "grad_norm": 1.1015625, "learning_rate": 0.0004739550639846061, "loss": 5.1029, "mean_token_accuracy": 0.19691314101219176, "num_tokens": 35959425.0, "step": 20725 }, { "entropy": 5.644115734100342, "epoch": 1.6128768722038513, "grad_norm": 1.171875, "learning_rate": 0.00047394211863528496, "loss": 5.0507, "mean_token_accuracy": 0.20300205945968627, "num_tokens": 35967803.0, "step": 20730 }, { "entropy": 5.65472149848938, "epoch": 1.613265901575569, "grad_norm": 1.1171875, "learning_rate": 0.0004739291702673338, "loss": 5.1508, "mean_token_accuracy": 0.19188271313905716, "num_tokens": 35977313.0, "step": 20735 }, { "entropy": 5.754576921463013, "epoch": 1.6136549309472865, "grad_norm": 1.0625, "learning_rate": 0.0004739162188809492, "loss": 5.1301, "mean_token_accuracy": 0.19150076657533646, "num_tokens": 35986404.0, "step": 20740 }, { "entropy": 5.693943977355957, "epoch": 1.614043960319004, "grad_norm": 1.109375, "learning_rate": 0.00047390326447632747, "loss": 5.1136, "mean_token_accuracy": 0.1960122987627983, "num_tokens": 35995865.0, "step": 20745 }, { "entropy": 5.606211805343628, "epoch": 1.6144329896907217, "grad_norm": 1.0625, "learning_rate": 0.0004738903070536654, "loss": 5.0028, "mean_token_accuracy": 0.2009105697274208, "num_tokens": 36005098.0, "step": 20750 }, { "entropy": 5.585506772994995, "epoch": 1.6148220190624392, "grad_norm": 1.1015625, "learning_rate": 0.0004738773466131594, "loss": 5.0468, "mean_token_accuracy": 0.19974856525659562, "num_tokens": 36013642.0, "step": 20755 }, { "entropy": 5.663722085952759, "epoch": 1.6152110484341566, "grad_norm": 1.1015625, "learning_rate": 0.0004738643831550063, "loss": 5.1496, "mean_token_accuracy": 0.19051231145858766, "num_tokens": 36022565.0, "step": 20760 }, { "entropy": 5.688801622390747, "epoch": 1.6156000778058743, "grad_norm": 1.125, "learning_rate": 0.0004738514166794026, "loss": 5.105, "mean_token_accuracy": 0.19139495342969895, "num_tokens": 36031406.0, "step": 20765 }, { "entropy": 5.672761058807373, "epoch": 1.615989107177592, "grad_norm": 1.1015625, "learning_rate": 0.00047383844718654525, "loss": 5.1122, "mean_token_accuracy": 0.19586308896541596, "num_tokens": 36040282.0, "step": 20770 }, { "entropy": 5.731324529647827, "epoch": 1.6163781365493095, "grad_norm": 1.0546875, "learning_rate": 0.0004738254746766309, "loss": 5.1755, "mean_token_accuracy": 0.19230180233716965, "num_tokens": 36049647.0, "step": 20775 }, { "entropy": 5.612593412399292, "epoch": 1.616767165921027, "grad_norm": 1.1875, "learning_rate": 0.0004738124991498565, "loss": 4.997, "mean_token_accuracy": 0.20100639760494232, "num_tokens": 36057992.0, "step": 20780 }, { "entropy": 5.637743711471558, "epoch": 1.6171561952927447, "grad_norm": 1.171875, "learning_rate": 0.00047379952060641866, "loss": 5.0465, "mean_token_accuracy": 0.19832704663276673, "num_tokens": 36066145.0, "step": 20785 }, { "entropy": 5.610766649246216, "epoch": 1.6175452246644622, "grad_norm": 1.1171875, "learning_rate": 0.00047378653904651475, "loss": 5.0538, "mean_token_accuracy": 0.1973472848534584, "num_tokens": 36074596.0, "step": 20790 }, { "entropy": 5.680673980712891, "epoch": 1.6179342540361796, "grad_norm": 1.171875, "learning_rate": 0.00047377355447034136, "loss": 4.9744, "mean_token_accuracy": 0.20498497039079666, "num_tokens": 36083499.0, "step": 20795 }, { "entropy": 5.675352239608765, "epoch": 1.6183232834078973, "grad_norm": 1.1484375, "learning_rate": 0.0004737605668780958, "loss": 5.0828, "mean_token_accuracy": 0.19587368816137313, "num_tokens": 36092293.0, "step": 20800 }, { "entropy": 5.603817415237427, "epoch": 1.618712312779615, "grad_norm": 1.1171875, "learning_rate": 0.00047374757626997494, "loss": 5.0672, "mean_token_accuracy": 0.19137837141752242, "num_tokens": 36100926.0, "step": 20805 }, { "entropy": 5.71808557510376, "epoch": 1.6191013421513323, "grad_norm": 1.09375, "learning_rate": 0.0004737345826461759, "loss": 5.117, "mean_token_accuracy": 0.1947830930352211, "num_tokens": 36109831.0, "step": 20810 }, { "entropy": 5.720207166671753, "epoch": 1.61949037152305, "grad_norm": 1.015625, "learning_rate": 0.0004737215860068959, "loss": 5.1604, "mean_token_accuracy": 0.19615888744592666, "num_tokens": 36118759.0, "step": 20815 }, { "entropy": 5.680451774597168, "epoch": 1.6198794008947677, "grad_norm": 1.1171875, "learning_rate": 0.00047370858635233223, "loss": 5.1996, "mean_token_accuracy": 0.18841734826564788, "num_tokens": 36127854.0, "step": 20820 }, { "entropy": 5.649180889129639, "epoch": 1.6202684302664851, "grad_norm": 1.078125, "learning_rate": 0.00047369558368268194, "loss": 5.1098, "mean_token_accuracy": 0.19646184742450715, "num_tokens": 36137686.0, "step": 20825 }, { "entropy": 5.7078650951385494, "epoch": 1.6206574596382026, "grad_norm": 1.1484375, "learning_rate": 0.0004736825779981424, "loss": 5.0943, "mean_token_accuracy": 0.19082683622837066, "num_tokens": 36146352.0, "step": 20830 }, { "entropy": 5.636092805862427, "epoch": 1.6210464890099203, "grad_norm": 1.046875, "learning_rate": 0.0004736695692989111, "loss": 5.0235, "mean_token_accuracy": 0.19839919209480286, "num_tokens": 36156106.0, "step": 20835 }, { "entropy": 5.604526233673096, "epoch": 1.6214355183816378, "grad_norm": 1.1484375, "learning_rate": 0.0004736565575851852, "loss": 4.9353, "mean_token_accuracy": 0.20191120654344558, "num_tokens": 36164169.0, "step": 20840 }, { "entropy": 5.657121229171753, "epoch": 1.6218245477533553, "grad_norm": 1.1875, "learning_rate": 0.0004736435428571622, "loss": 5.0836, "mean_token_accuracy": 0.19656098037958145, "num_tokens": 36173368.0, "step": 20845 }, { "entropy": 5.669279909133911, "epoch": 1.622213577125073, "grad_norm": 1.125, "learning_rate": 0.0004736305251150397, "loss": 5.0564, "mean_token_accuracy": 0.19547295570373535, "num_tokens": 36182405.0, "step": 20850 }, { "entropy": 5.653002834320068, "epoch": 1.6226026064967907, "grad_norm": 1.09375, "learning_rate": 0.0004736175043590151, "loss": 5.1261, "mean_token_accuracy": 0.19115351438522338, "num_tokens": 36191683.0, "step": 20855 }, { "entropy": 5.658615255355835, "epoch": 1.622991635868508, "grad_norm": 1.1484375, "learning_rate": 0.000473604480589286, "loss": 5.0142, "mean_token_accuracy": 0.1963836133480072, "num_tokens": 36200173.0, "step": 20860 }, { "entropy": 5.559234714508056, "epoch": 1.6233806652402256, "grad_norm": 1.203125, "learning_rate": 0.00047359145380605007, "loss": 5.0341, "mean_token_accuracy": 0.1956578016281128, "num_tokens": 36209057.0, "step": 20865 }, { "entropy": 5.611531209945679, "epoch": 1.6237696946119433, "grad_norm": 1.1015625, "learning_rate": 0.0004735784240095049, "loss": 5.0414, "mean_token_accuracy": 0.1999165654182434, "num_tokens": 36217645.0, "step": 20870 }, { "entropy": 5.714205408096314, "epoch": 1.6241587239836608, "grad_norm": 1.140625, "learning_rate": 0.00047356539119984813, "loss": 5.1148, "mean_token_accuracy": 0.19280873239040375, "num_tokens": 36226282.0, "step": 20875 }, { "entropy": 5.635988759994507, "epoch": 1.6245477533553783, "grad_norm": 1.265625, "learning_rate": 0.0004735523553772777, "loss": 5.1034, "mean_token_accuracy": 0.19602324962615966, "num_tokens": 36235322.0, "step": 20880 }, { "entropy": 5.6181481838226315, "epoch": 1.624936782727096, "grad_norm": 1.1640625, "learning_rate": 0.0004735393165419912, "loss": 5.0222, "mean_token_accuracy": 0.20810025185346603, "num_tokens": 36244212.0, "step": 20885 }, { "entropy": 5.6242388725280765, "epoch": 1.6253258120988134, "grad_norm": 1.140625, "learning_rate": 0.00047352627469418666, "loss": 5.0505, "mean_token_accuracy": 0.19684476107358934, "num_tokens": 36252837.0, "step": 20890 }, { "entropy": 5.70183482170105, "epoch": 1.625714841470531, "grad_norm": 1.1796875, "learning_rate": 0.0004735132298340619, "loss": 5.0918, "mean_token_accuracy": 0.188697150349617, "num_tokens": 36261492.0, "step": 20895 }, { "entropy": 5.670249605178833, "epoch": 1.6261038708422486, "grad_norm": 1.1640625, "learning_rate": 0.0004735001819618148, "loss": 5.0639, "mean_token_accuracy": 0.1967158392071724, "num_tokens": 36270195.0, "step": 20900 }, { "entropy": 5.6828728199005125, "epoch": 1.6264929002139663, "grad_norm": 1.140625, "learning_rate": 0.0004734871310776434, "loss": 5.0073, "mean_token_accuracy": 0.21293383240699768, "num_tokens": 36278546.0, "step": 20905 }, { "entropy": 5.668334245681763, "epoch": 1.6268819295856836, "grad_norm": 1.1171875, "learning_rate": 0.0004734740771817457, "loss": 5.1361, "mean_token_accuracy": 0.18799256533384323, "num_tokens": 36287433.0, "step": 20910 }, { "entropy": 5.582912302017212, "epoch": 1.6272709589574013, "grad_norm": 1.1015625, "learning_rate": 0.0004734610202743198, "loss": 4.9889, "mean_token_accuracy": 0.18900973051786424, "num_tokens": 36296213.0, "step": 20915 }, { "entropy": 5.5907923698425295, "epoch": 1.627659988329119, "grad_norm": 1.203125, "learning_rate": 0.0004734479603555638, "loss": 4.9535, "mean_token_accuracy": 0.2138149544596672, "num_tokens": 36303989.0, "step": 20920 }, { "entropy": 5.713953113555908, "epoch": 1.6280490177008364, "grad_norm": 1.140625, "learning_rate": 0.00047343489742567593, "loss": 5.2562, "mean_token_accuracy": 0.18459749966859818, "num_tokens": 36312939.0, "step": 20925 }, { "entropy": 5.702159643173218, "epoch": 1.628438047072554, "grad_norm": 1.171875, "learning_rate": 0.00047342183148485424, "loss": 5.0351, "mean_token_accuracy": 0.20019447952508926, "num_tokens": 36322130.0, "step": 20930 }, { "entropy": 5.649999284744263, "epoch": 1.6288270764442716, "grad_norm": 1.1328125, "learning_rate": 0.00047340876253329706, "loss": 4.9951, "mean_token_accuracy": 0.19987224489450456, "num_tokens": 36330376.0, "step": 20935 }, { "entropy": 5.579406833648681, "epoch": 1.629216105815989, "grad_norm": 1.078125, "learning_rate": 0.00047339569057120275, "loss": 5.004, "mean_token_accuracy": 0.20319799184799195, "num_tokens": 36339614.0, "step": 20940 }, { "entropy": 5.659418344497681, "epoch": 1.6296051351877066, "grad_norm": 1.046875, "learning_rate": 0.00047338261559876966, "loss": 5.1035, "mean_token_accuracy": 0.19244890213012694, "num_tokens": 36349561.0, "step": 20945 }, { "entropy": 5.707289171218872, "epoch": 1.6299941645594243, "grad_norm": 1.078125, "learning_rate": 0.00047336953761619604, "loss": 5.1455, "mean_token_accuracy": 0.189005284011364, "num_tokens": 36358277.0, "step": 20950 }, { "entropy": 5.719502544403076, "epoch": 1.630383193931142, "grad_norm": 1.09375, "learning_rate": 0.00047335645662368046, "loss": 5.1167, "mean_token_accuracy": 0.19907114356756211, "num_tokens": 36366736.0, "step": 20955 }, { "entropy": 5.663247871398926, "epoch": 1.6307722233028592, "grad_norm": 1.1796875, "learning_rate": 0.0004733433726214214, "loss": 5.0661, "mean_token_accuracy": 0.20213507413864135, "num_tokens": 36374802.0, "step": 20960 }, { "entropy": 5.646998643875122, "epoch": 1.631161252674577, "grad_norm": 1.15625, "learning_rate": 0.00047333028560961733, "loss": 5.0854, "mean_token_accuracy": 0.19363243728876114, "num_tokens": 36384195.0, "step": 20965 }, { "entropy": 5.631627368927002, "epoch": 1.6315502820462946, "grad_norm": 1.1484375, "learning_rate": 0.00047331719558846687, "loss": 5.0988, "mean_token_accuracy": 0.19158527851104737, "num_tokens": 36393001.0, "step": 20970 }, { "entropy": 5.679379653930664, "epoch": 1.631939311418012, "grad_norm": 1.0859375, "learning_rate": 0.00047330410255816863, "loss": 5.0502, "mean_token_accuracy": 0.18936222791671753, "num_tokens": 36401674.0, "step": 20975 }, { "entropy": 5.610768032073975, "epoch": 1.6323283407897295, "grad_norm": 1.2421875, "learning_rate": 0.00047329100651892123, "loss": 5.0255, "mean_token_accuracy": 0.20752585530281067, "num_tokens": 36409817.0, "step": 20980 }, { "entropy": 5.630240964889526, "epoch": 1.6327173701614472, "grad_norm": 1.1875, "learning_rate": 0.0004732779074709234, "loss": 4.9905, "mean_token_accuracy": 0.20000280290842057, "num_tokens": 36417541.0, "step": 20985 }, { "entropy": 5.6237305164337155, "epoch": 1.6331063995331647, "grad_norm": 1.1796875, "learning_rate": 0.000473264805414374, "loss": 5.1055, "mean_token_accuracy": 0.18834645599126815, "num_tokens": 36426613.0, "step": 20990 }, { "entropy": 5.651272487640381, "epoch": 1.6334954289048822, "grad_norm": 1.0546875, "learning_rate": 0.00047325170034947167, "loss": 5.0966, "mean_token_accuracy": 0.19901169538497926, "num_tokens": 36436052.0, "step": 20995 }, { "entropy": 5.612300539016724, "epoch": 1.6338844582766, "grad_norm": 1.1953125, "learning_rate": 0.00047323859227641537, "loss": 5.0048, "mean_token_accuracy": 0.20065058767795563, "num_tokens": 36444386.0, "step": 21000 }, { "epoch": 1.6338844582766, "eval_entropy": 5.425801253846566, "eval_loss": 5.124657154083252, "eval_mean_token_accuracy": 0.20376745658757253, "eval_num_tokens": 36444386.0, "eval_runtime": 21.8112, "eval_samples_per_second": 1905.353, "eval_steps_per_second": 238.181, "step": 21000 }, { "entropy": 5.685236263275146, "epoch": 1.6342734876483176, "grad_norm": 1.1640625, "learning_rate": 0.00047322548119540397, "loss": 5.0627, "mean_token_accuracy": 0.1946759581565857, "num_tokens": 36452759.0, "step": 21005 }, { "entropy": 5.650661134719849, "epoch": 1.634662517020035, "grad_norm": 1.2109375, "learning_rate": 0.00047321236710663636, "loss": 5.024, "mean_token_accuracy": 0.20091758370399476, "num_tokens": 36460581.0, "step": 21010 }, { "entropy": 5.629543972015381, "epoch": 1.6350515463917525, "grad_norm": 1.140625, "learning_rate": 0.00047319925001031165, "loss": 5.0451, "mean_token_accuracy": 0.20526855140924455, "num_tokens": 36468995.0, "step": 21015 }, { "entropy": 5.718970918655396, "epoch": 1.6354405757634702, "grad_norm": 1.21875, "learning_rate": 0.0004731861299066287, "loss": 5.1196, "mean_token_accuracy": 0.19818554818630219, "num_tokens": 36477901.0, "step": 21020 }, { "entropy": 5.68755407333374, "epoch": 1.6358296051351877, "grad_norm": 1.1875, "learning_rate": 0.0004731730067957867, "loss": 5.1119, "mean_token_accuracy": 0.19964181035757064, "num_tokens": 36486500.0, "step": 21025 }, { "entropy": 5.626431035995483, "epoch": 1.6362186345069052, "grad_norm": 1.2109375, "learning_rate": 0.00047315988067798476, "loss": 5.053, "mean_token_accuracy": 0.19768139570951462, "num_tokens": 36495247.0, "step": 21030 }, { "entropy": 5.626111078262329, "epoch": 1.6366076638786229, "grad_norm": 1.21875, "learning_rate": 0.000473146751553422, "loss": 5.0111, "mean_token_accuracy": 0.206063412129879, "num_tokens": 36503633.0, "step": 21035 }, { "entropy": 5.65632381439209, "epoch": 1.6369966932503404, "grad_norm": 1.2109375, "learning_rate": 0.0004731336194222978, "loss": 5.0788, "mean_token_accuracy": 0.1980946645140648, "num_tokens": 36512138.0, "step": 21040 }, { "entropy": 5.6815392017364506, "epoch": 1.6373857226220578, "grad_norm": 1.125, "learning_rate": 0.00047312048428481114, "loss": 5.061, "mean_token_accuracy": 0.20013161301612853, "num_tokens": 36521029.0, "step": 21045 }, { "entropy": 5.608483123779297, "epoch": 1.6377747519937755, "grad_norm": 1.125, "learning_rate": 0.00047310734614116153, "loss": 4.9886, "mean_token_accuracy": 0.20001065731048584, "num_tokens": 36530658.0, "step": 21050 }, { "entropy": 5.618550252914429, "epoch": 1.6381637813654932, "grad_norm": 1.1953125, "learning_rate": 0.0004730942049915483, "loss": 4.9898, "mean_token_accuracy": 0.1970773383975029, "num_tokens": 36539037.0, "step": 21055 }, { "entropy": 5.646327257156372, "epoch": 1.6385528107372107, "grad_norm": 1.15625, "learning_rate": 0.0004730810608361707, "loss": 5.0826, "mean_token_accuracy": 0.1998617023229599, "num_tokens": 36547863.0, "step": 21060 }, { "entropy": 5.684886646270752, "epoch": 1.6389418401089282, "grad_norm": 1.1953125, "learning_rate": 0.00047306791367522833, "loss": 5.1045, "mean_token_accuracy": 0.19899885803461076, "num_tokens": 36555896.0, "step": 21065 }, { "entropy": 5.595557403564453, "epoch": 1.6393308694806459, "grad_norm": 1.171875, "learning_rate": 0.0004730547635089206, "loss": 5.0367, "mean_token_accuracy": 0.20867674499750138, "num_tokens": 36564088.0, "step": 21070 }, { "entropy": 5.656909227371216, "epoch": 1.6397198988523634, "grad_norm": 1.1796875, "learning_rate": 0.00047304161033744714, "loss": 4.9992, "mean_token_accuracy": 0.2010756775736809, "num_tokens": 36572490.0, "step": 21075 }, { "entropy": 5.686183261871338, "epoch": 1.6401089282240808, "grad_norm": 1.0546875, "learning_rate": 0.0004730284541610075, "loss": 5.0703, "mean_token_accuracy": 0.1874392732977867, "num_tokens": 36580834.0, "step": 21080 }, { "entropy": 5.637238359451294, "epoch": 1.6404979575957985, "grad_norm": 1.1484375, "learning_rate": 0.0004730152949798012, "loss": 5.0346, "mean_token_accuracy": 0.20410232841968537, "num_tokens": 36589420.0, "step": 21085 }, { "entropy": 5.579383277893067, "epoch": 1.640886986967516, "grad_norm": 1.1953125, "learning_rate": 0.00047300213279402787, "loss": 5.0534, "mean_token_accuracy": 0.19768901467323302, "num_tokens": 36598419.0, "step": 21090 }, { "entropy": 5.614743328094482, "epoch": 1.6412760163392335, "grad_norm": 1.1796875, "learning_rate": 0.00047298896760388745, "loss": 5.0776, "mean_token_accuracy": 0.19908344149589538, "num_tokens": 36607367.0, "step": 21095 }, { "entropy": 5.709177398681641, "epoch": 1.6416650457109512, "grad_norm": 1.046875, "learning_rate": 0.0004729757994095796, "loss": 5.1625, "mean_token_accuracy": 0.19179748445749284, "num_tokens": 36616197.0, "step": 21100 }, { "entropy": 5.733490371704102, "epoch": 1.6420540750826689, "grad_norm": 1.1875, "learning_rate": 0.00047296262821130405, "loss": 5.1889, "mean_token_accuracy": 0.1905401736497879, "num_tokens": 36625452.0, "step": 21105 }, { "entropy": 5.6510701179504395, "epoch": 1.6424431044543863, "grad_norm": 1.0546875, "learning_rate": 0.00047294945400926065, "loss": 5.1163, "mean_token_accuracy": 0.19272997081279755, "num_tokens": 36634356.0, "step": 21110 }, { "entropy": 5.66380820274353, "epoch": 1.6428321338261038, "grad_norm": 1.09375, "learning_rate": 0.0004729362768036494, "loss": 5.0771, "mean_token_accuracy": 0.19462316185235978, "num_tokens": 36642548.0, "step": 21115 }, { "entropy": 5.640546560287476, "epoch": 1.6432211631978215, "grad_norm": 1.109375, "learning_rate": 0.00047292309659467024, "loss": 4.9804, "mean_token_accuracy": 0.20825111716985703, "num_tokens": 36650548.0, "step": 21120 }, { "entropy": 5.604476976394653, "epoch": 1.643610192569539, "grad_norm": 1.046875, "learning_rate": 0.0004729099133825231, "loss": 5.0202, "mean_token_accuracy": 0.19761257469654084, "num_tokens": 36659322.0, "step": 21125 }, { "entropy": 5.616048955917359, "epoch": 1.6439992219412565, "grad_norm": 1.109375, "learning_rate": 0.000472896727167408, "loss": 5.0039, "mean_token_accuracy": 0.20036645233631134, "num_tokens": 36667699.0, "step": 21130 }, { "entropy": 5.715201282501221, "epoch": 1.6443882513129742, "grad_norm": 1.015625, "learning_rate": 0.00047288353794952505, "loss": 5.13, "mean_token_accuracy": 0.1948148638010025, "num_tokens": 36677842.0, "step": 21135 }, { "entropy": 5.608692312240601, "epoch": 1.6447772806846916, "grad_norm": 1.125, "learning_rate": 0.0004728703457290744, "loss": 4.9294, "mean_token_accuracy": 0.21180818676948548, "num_tokens": 36686488.0, "step": 21140 }, { "entropy": 5.652051067352295, "epoch": 1.6451663100564091, "grad_norm": 1.15625, "learning_rate": 0.0004728571505062562, "loss": 5.1088, "mean_token_accuracy": 0.19624157398939132, "num_tokens": 36694955.0, "step": 21145 }, { "entropy": 5.557367324829102, "epoch": 1.6455553394281268, "grad_norm": 1.125, "learning_rate": 0.0004728439522812707, "loss": 4.9874, "mean_token_accuracy": 0.2034481644630432, "num_tokens": 36703481.0, "step": 21150 }, { "entropy": 5.686665010452271, "epoch": 1.6459443687998445, "grad_norm": 1.1796875, "learning_rate": 0.00047283075105431806, "loss": 5.1937, "mean_token_accuracy": 0.19371117651462555, "num_tokens": 36711812.0, "step": 21155 }, { "entropy": 5.668038415908813, "epoch": 1.646333398171562, "grad_norm": 1.140625, "learning_rate": 0.0004728175468255987, "loss": 5.0522, "mean_token_accuracy": 0.20208872854709625, "num_tokens": 36720496.0, "step": 21160 }, { "entropy": 5.6225639343261715, "epoch": 1.6467224275432795, "grad_norm": 1.171875, "learning_rate": 0.00047280433959531287, "loss": 4.9297, "mean_token_accuracy": 0.20318156331777573, "num_tokens": 36728959.0, "step": 21165 }, { "entropy": 5.585181140899659, "epoch": 1.6471114569149972, "grad_norm": 1.1328125, "learning_rate": 0.000472791129363661, "loss": 5.0361, "mean_token_accuracy": 0.19560608118772507, "num_tokens": 36737492.0, "step": 21170 }, { "entropy": 5.640459728240967, "epoch": 1.6475004862867146, "grad_norm": 1.140625, "learning_rate": 0.0004727779161308436, "loss": 4.9933, "mean_token_accuracy": 0.2004745975136757, "num_tokens": 36745852.0, "step": 21175 }, { "entropy": 5.680353593826294, "epoch": 1.6478895156584321, "grad_norm": 1.140625, "learning_rate": 0.0004727646998970612, "loss": 5.0735, "mean_token_accuracy": 0.19790082424879074, "num_tokens": 36753897.0, "step": 21180 }, { "entropy": 5.634651851654053, "epoch": 1.6482785450301498, "grad_norm": 1.125, "learning_rate": 0.00047275148066251417, "loss": 5.0246, "mean_token_accuracy": 0.19867342561483384, "num_tokens": 36762737.0, "step": 21185 }, { "entropy": 5.704489469528198, "epoch": 1.6486675744018673, "grad_norm": 1.234375, "learning_rate": 0.0004727382584274032, "loss": 5.1112, "mean_token_accuracy": 0.19380357414484023, "num_tokens": 36770742.0, "step": 21190 }, { "entropy": 5.739238977432251, "epoch": 1.6490566037735848, "grad_norm": 1.171875, "learning_rate": 0.00047272503319192887, "loss": 5.1698, "mean_token_accuracy": 0.1844904363155365, "num_tokens": 36779420.0, "step": 21195 }, { "entropy": 5.5963489532470705, "epoch": 1.6494456331453025, "grad_norm": 1.140625, "learning_rate": 0.0004727118049562919, "loss": 5.0016, "mean_token_accuracy": 0.19979230910539628, "num_tokens": 36787888.0, "step": 21200 }, { "entropy": 5.57241997718811, "epoch": 1.6498346625170202, "grad_norm": 0.99609375, "learning_rate": 0.000472698573720693, "loss": 4.9328, "mean_token_accuracy": 0.2079233855009079, "num_tokens": 36797131.0, "step": 21205 }, { "entropy": 5.616825723648072, "epoch": 1.6502236918887376, "grad_norm": 1.1484375, "learning_rate": 0.0004726853394853329, "loss": 5.1078, "mean_token_accuracy": 0.19077519625425338, "num_tokens": 36805429.0, "step": 21210 }, { "entropy": 5.645532846450806, "epoch": 1.650612721260455, "grad_norm": 1.0625, "learning_rate": 0.00047267210225041234, "loss": 5.1497, "mean_token_accuracy": 0.18943463861942292, "num_tokens": 36814204.0, "step": 21215 }, { "entropy": 5.757275390625, "epoch": 1.6510017506321728, "grad_norm": 1.1640625, "learning_rate": 0.00047265886201613234, "loss": 5.1125, "mean_token_accuracy": 0.19360610097646713, "num_tokens": 36823229.0, "step": 21220 }, { "entropy": 5.729987573623657, "epoch": 1.6513907800038903, "grad_norm": 1.109375, "learning_rate": 0.00047264561878269365, "loss": 5.18, "mean_token_accuracy": 0.18842648416757585, "num_tokens": 36832252.0, "step": 21225 }, { "entropy": 5.614921617507934, "epoch": 1.6517798093756078, "grad_norm": 1.140625, "learning_rate": 0.0004726323725502973, "loss": 5.0472, "mean_token_accuracy": 0.19894642531871795, "num_tokens": 36841456.0, "step": 21230 }, { "entropy": 5.6571146011352536, "epoch": 1.6521688387473255, "grad_norm": 1.140625, "learning_rate": 0.0004726191233191443, "loss": 5.0228, "mean_token_accuracy": 0.2042941778898239, "num_tokens": 36849717.0, "step": 21235 }, { "entropy": 5.650038576126098, "epoch": 1.6525578681190431, "grad_norm": 1.0625, "learning_rate": 0.0004726058710894357, "loss": 5.1076, "mean_token_accuracy": 0.1954307049512863, "num_tokens": 36858222.0, "step": 21240 }, { "entropy": 5.592621326446533, "epoch": 1.6529468974907604, "grad_norm": 1.1640625, "learning_rate": 0.0004725926158613724, "loss": 5.0881, "mean_token_accuracy": 0.1922290101647377, "num_tokens": 36866899.0, "step": 21245 }, { "entropy": 5.658283805847168, "epoch": 1.653335926862478, "grad_norm": 1.1015625, "learning_rate": 0.0004725793576351557, "loss": 5.0491, "mean_token_accuracy": 0.20789932161569596, "num_tokens": 36876124.0, "step": 21250 }, { "entropy": 5.691045713424683, "epoch": 1.6537249562341958, "grad_norm": 1.1171875, "learning_rate": 0.0004725660964109867, "loss": 5.1068, "mean_token_accuracy": 0.19472858160734177, "num_tokens": 36884689.0, "step": 21255 }, { "entropy": 5.6766516208648685, "epoch": 1.6541139856059133, "grad_norm": 1.1796875, "learning_rate": 0.00047255283218906673, "loss": 5.0806, "mean_token_accuracy": 0.1931871712207794, "num_tokens": 36893073.0, "step": 21260 }, { "entropy": 5.670859432220459, "epoch": 1.6545030149776307, "grad_norm": 1.0703125, "learning_rate": 0.000472539564969597, "loss": 5.0887, "mean_token_accuracy": 0.19451346546411513, "num_tokens": 36902428.0, "step": 21265 }, { "entropy": 5.69565224647522, "epoch": 1.6548920443493484, "grad_norm": 1.1328125, "learning_rate": 0.00047252629475277863, "loss": 5.1098, "mean_token_accuracy": 0.19970912784337996, "num_tokens": 36910297.0, "step": 21270 }, { "entropy": 5.641442012786865, "epoch": 1.655281073721066, "grad_norm": 1.0625, "learning_rate": 0.0004725130215388132, "loss": 5.0534, "mean_token_accuracy": 0.19424191415309905, "num_tokens": 36919115.0, "step": 21275 }, { "entropy": 5.6860127449035645, "epoch": 1.6556701030927834, "grad_norm": 1.1015625, "learning_rate": 0.0004724997453279021, "loss": 5.0811, "mean_token_accuracy": 0.19655924141407013, "num_tokens": 36928419.0, "step": 21280 }, { "entropy": 5.6646819591522215, "epoch": 1.656059132464501, "grad_norm": 1.1953125, "learning_rate": 0.0004724864661202467, "loss": 5.0378, "mean_token_accuracy": 0.20006120949983597, "num_tokens": 36936511.0, "step": 21285 }, { "entropy": 5.672817659378052, "epoch": 1.6564481618362188, "grad_norm": 1.1640625, "learning_rate": 0.00047247318391604846, "loss": 5.1035, "mean_token_accuracy": 0.1965818926692009, "num_tokens": 36945316.0, "step": 21290 }, { "entropy": 5.634977912902832, "epoch": 1.656837191207936, "grad_norm": 1.1328125, "learning_rate": 0.00047245989871550897, "loss": 5.1275, "mean_token_accuracy": 0.18893318325281144, "num_tokens": 36954140.0, "step": 21295 }, { "entropy": 5.628003311157227, "epoch": 1.6572262205796537, "grad_norm": 1.15625, "learning_rate": 0.0004724466105188299, "loss": 5.0776, "mean_token_accuracy": 0.1945530191063881, "num_tokens": 36962852.0, "step": 21300 }, { "entropy": 5.7002171039581295, "epoch": 1.6576152499513714, "grad_norm": 1.15625, "learning_rate": 0.00047243331932621263, "loss": 5.0906, "mean_token_accuracy": 0.19977089613676072, "num_tokens": 36971617.0, "step": 21305 }, { "entropy": 5.641374588012695, "epoch": 1.658004279323089, "grad_norm": 1.15625, "learning_rate": 0.0004724200251378591, "loss": 5.1099, "mean_token_accuracy": 0.19899785071611403, "num_tokens": 36981078.0, "step": 21310 }, { "entropy": 5.644744968414306, "epoch": 1.6583933086948064, "grad_norm": 1.171875, "learning_rate": 0.0004724067279539709, "loss": 5.0131, "mean_token_accuracy": 0.19661311954259872, "num_tokens": 36989860.0, "step": 21315 }, { "entropy": 5.652134370803833, "epoch": 1.658782338066524, "grad_norm": 1.0703125, "learning_rate": 0.00047239342777474975, "loss": 5.0463, "mean_token_accuracy": 0.2002684146165848, "num_tokens": 36998037.0, "step": 21320 }, { "entropy": 5.707924842834473, "epoch": 1.6591713674382416, "grad_norm": 1.09375, "learning_rate": 0.00047238012460039765, "loss": 5.0732, "mean_token_accuracy": 0.19763096421957016, "num_tokens": 37006375.0, "step": 21325 }, { "entropy": 5.6436220645904545, "epoch": 1.659560396809959, "grad_norm": 1.203125, "learning_rate": 0.0004723668184311162, "loss": 5.141, "mean_token_accuracy": 0.18975942879915236, "num_tokens": 37014650.0, "step": 21330 }, { "entropy": 5.637217855453491, "epoch": 1.6599494261816767, "grad_norm": 1.1484375, "learning_rate": 0.0004723535092671074, "loss": 5.1053, "mean_token_accuracy": 0.18916617184877396, "num_tokens": 37023147.0, "step": 21335 }, { "entropy": 5.749104070663452, "epoch": 1.6603384555533944, "grad_norm": 1.1875, "learning_rate": 0.00047234019710857335, "loss": 5.1037, "mean_token_accuracy": 0.1955679774284363, "num_tokens": 37031461.0, "step": 21340 }, { "entropy": 5.726814270019531, "epoch": 1.6607274849251117, "grad_norm": 1.0859375, "learning_rate": 0.0004723268819557158, "loss": 5.1414, "mean_token_accuracy": 0.19410899430513381, "num_tokens": 37039924.0, "step": 21345 }, { "entropy": 5.630940341949463, "epoch": 1.6611165142968294, "grad_norm": 1.1640625, "learning_rate": 0.00047231356380873687, "loss": 5.038, "mean_token_accuracy": 0.20254645347595215, "num_tokens": 37048631.0, "step": 21350 }, { "entropy": 5.637073755264282, "epoch": 1.661505543668547, "grad_norm": 1.1875, "learning_rate": 0.0004723002426678388, "loss": 5.0486, "mean_token_accuracy": 0.2034415289759636, "num_tokens": 37057018.0, "step": 21355 }, { "entropy": 5.666430187225342, "epoch": 1.6618945730402646, "grad_norm": 1.25, "learning_rate": 0.0004722869185332235, "loss": 5.083, "mean_token_accuracy": 0.19698277115821838, "num_tokens": 37065762.0, "step": 21360 }, { "entropy": 5.638964700698852, "epoch": 1.662283602411982, "grad_norm": 1.125, "learning_rate": 0.00047227359140509324, "loss": 5.0778, "mean_token_accuracy": 0.19166834354400636, "num_tokens": 37073836.0, "step": 21365 }, { "entropy": 5.654311800003052, "epoch": 1.6626726317836997, "grad_norm": 1.15625, "learning_rate": 0.0004722602612836501, "loss": 5.127, "mean_token_accuracy": 0.19017945677042009, "num_tokens": 37082788.0, "step": 21370 }, { "entropy": 5.716874313354492, "epoch": 1.6630616611554172, "grad_norm": 1.0703125, "learning_rate": 0.00047224692816909665, "loss": 5.1524, "mean_token_accuracy": 0.18403398394584655, "num_tokens": 37091228.0, "step": 21375 }, { "entropy": 5.668335390090943, "epoch": 1.6634506905271347, "grad_norm": 1.140625, "learning_rate": 0.0004722335920616349, "loss": 5.0562, "mean_token_accuracy": 0.19864943325519563, "num_tokens": 37099819.0, "step": 21380 }, { "entropy": 5.638710927963257, "epoch": 1.6638397198988524, "grad_norm": 1.09375, "learning_rate": 0.00047222025296146745, "loss": 5.0927, "mean_token_accuracy": 0.1881011739373207, "num_tokens": 37108129.0, "step": 21385 }, { "entropy": 5.591794013977051, "epoch": 1.66422874927057, "grad_norm": 1.1015625, "learning_rate": 0.00047220691086879643, "loss": 4.994, "mean_token_accuracy": 0.2084198921918869, "num_tokens": 37116093.0, "step": 21390 }, { "entropy": 5.622945880889892, "epoch": 1.6646177786422873, "grad_norm": 1.1484375, "learning_rate": 0.0004721935657838245, "loss": 5.0458, "mean_token_accuracy": 0.1923132747411728, "num_tokens": 37124098.0, "step": 21395 }, { "entropy": 5.719037961959839, "epoch": 1.665006808014005, "grad_norm": 1.0546875, "learning_rate": 0.000472180217706754, "loss": 5.1232, "mean_token_accuracy": 0.18765225410461425, "num_tokens": 37132608.0, "step": 21400 }, { "entropy": 5.701768589019776, "epoch": 1.6653958373857227, "grad_norm": 1.0234375, "learning_rate": 0.0004721668666377876, "loss": 5.127, "mean_token_accuracy": 0.19519110321998595, "num_tokens": 37141365.0, "step": 21405 }, { "entropy": 5.592532682418823, "epoch": 1.6657848667574402, "grad_norm": 1.0546875, "learning_rate": 0.00047215351257712783, "loss": 5.0091, "mean_token_accuracy": 0.20509780645370485, "num_tokens": 37150146.0, "step": 21410 }, { "entropy": 5.720004463195801, "epoch": 1.6661738961291577, "grad_norm": 1.15625, "learning_rate": 0.00047214015552497735, "loss": 5.1887, "mean_token_accuracy": 0.1878465473651886, "num_tokens": 37158887.0, "step": 21415 }, { "entropy": 5.709566068649292, "epoch": 1.6665629255008754, "grad_norm": 1.0625, "learning_rate": 0.00047212679548153867, "loss": 5.0286, "mean_token_accuracy": 0.1976467952132225, "num_tokens": 37167902.0, "step": 21420 }, { "entropy": 5.7032022953033445, "epoch": 1.6669519548725928, "grad_norm": 1.171875, "learning_rate": 0.00047211343244701475, "loss": 5.1605, "mean_token_accuracy": 0.19156619608402253, "num_tokens": 37175853.0, "step": 21425 }, { "entropy": 5.619184303283691, "epoch": 1.6673409842443103, "grad_norm": 1.2421875, "learning_rate": 0.0004721000664216081, "loss": 5.0397, "mean_token_accuracy": 0.19947168380022048, "num_tokens": 37184036.0, "step": 21430 }, { "entropy": 5.685922431945801, "epoch": 1.667730013616028, "grad_norm": 1.171875, "learning_rate": 0.0004720866974055219, "loss": 5.1022, "mean_token_accuracy": 0.19761382937431335, "num_tokens": 37193277.0, "step": 21435 }, { "entropy": 5.701192426681518, "epoch": 1.6681190429877457, "grad_norm": 1.1640625, "learning_rate": 0.0004720733253989585, "loss": 5.0644, "mean_token_accuracy": 0.2003820925951004, "num_tokens": 37201925.0, "step": 21440 }, { "entropy": 5.6847645282745365, "epoch": 1.6685080723594632, "grad_norm": 1.1640625, "learning_rate": 0.00047205995040212114, "loss": 5.1555, "mean_token_accuracy": 0.1892498627305031, "num_tokens": 37210552.0, "step": 21445 }, { "entropy": 5.6613525390625, "epoch": 1.6688971017311807, "grad_norm": 1.140625, "learning_rate": 0.0004720465724152127, "loss": 5.0784, "mean_token_accuracy": 0.1969710037112236, "num_tokens": 37219001.0, "step": 21450 }, { "entropy": 5.64767861366272, "epoch": 1.6692861311028984, "grad_norm": 1.1484375, "learning_rate": 0.00047203319143843613, "loss": 5.0381, "mean_token_accuracy": 0.20369212180376053, "num_tokens": 37227635.0, "step": 21455 }, { "entropy": 5.615681934356689, "epoch": 1.6696751604746158, "grad_norm": 1.0859375, "learning_rate": 0.0004720198074719946, "loss": 5.0596, "mean_token_accuracy": 0.19911978095769883, "num_tokens": 37236872.0, "step": 21460 }, { "entropy": 5.706751585006714, "epoch": 1.6700641898463333, "grad_norm": 1.234375, "learning_rate": 0.00047200642051609094, "loss": 5.1304, "mean_token_accuracy": 0.1907180964946747, "num_tokens": 37245026.0, "step": 21465 }, { "entropy": 5.680355262756348, "epoch": 1.670453219218051, "grad_norm": 1.1015625, "learning_rate": 0.0004719930305709285, "loss": 5.0714, "mean_token_accuracy": 0.19570827186107637, "num_tokens": 37253295.0, "step": 21470 }, { "entropy": 5.651104497909546, "epoch": 1.6708422485897685, "grad_norm": 1.1640625, "learning_rate": 0.00047197963763671033, "loss": 5.0467, "mean_token_accuracy": 0.2063677117228508, "num_tokens": 37262785.0, "step": 21475 }, { "entropy": 5.642996978759766, "epoch": 1.671231277961486, "grad_norm": 1.15625, "learning_rate": 0.0004719662417136397, "loss": 5.1256, "mean_token_accuracy": 0.2006133183836937, "num_tokens": 37271937.0, "step": 21480 }, { "entropy": 5.6505739212036135, "epoch": 1.6716203073332037, "grad_norm": 1.0703125, "learning_rate": 0.00047195284280191987, "loss": 5.0212, "mean_token_accuracy": 0.20324522256851196, "num_tokens": 37280861.0, "step": 21485 }, { "entropy": 5.671285104751587, "epoch": 1.6720093367049214, "grad_norm": 1.1640625, "learning_rate": 0.0004719394409017541, "loss": 5.0643, "mean_token_accuracy": 0.19922929108142853, "num_tokens": 37289235.0, "step": 21490 }, { "entropy": 5.64128360748291, "epoch": 1.6723983660766388, "grad_norm": 1.0703125, "learning_rate": 0.00047192603601334585, "loss": 5.0703, "mean_token_accuracy": 0.19294965714216233, "num_tokens": 37297778.0, "step": 21495 }, { "entropy": 5.645361471176147, "epoch": 1.6727873954483563, "grad_norm": 1.0546875, "learning_rate": 0.00047191262813689835, "loss": 5.0826, "mean_token_accuracy": 0.19001952558755875, "num_tokens": 37306960.0, "step": 21500 }, { "entropy": 5.659552669525146, "epoch": 1.673176424820074, "grad_norm": 1.1484375, "learning_rate": 0.0004718992172726152, "loss": 5.1064, "mean_token_accuracy": 0.19469638764858246, "num_tokens": 37316050.0, "step": 21505 }, { "entropy": 5.586802673339844, "epoch": 1.6735654541917915, "grad_norm": 1.0859375, "learning_rate": 0.00047188580342069983, "loss": 5.0591, "mean_token_accuracy": 0.19923404604196548, "num_tokens": 37325058.0, "step": 21510 }, { "entropy": 5.712506818771362, "epoch": 1.673954483563509, "grad_norm": 1.171875, "learning_rate": 0.0004718723865813557, "loss": 5.1592, "mean_token_accuracy": 0.18860733211040498, "num_tokens": 37333512.0, "step": 21515 }, { "entropy": 5.677211666107178, "epoch": 1.6743435129352267, "grad_norm": 1.21875, "learning_rate": 0.0004718589667547865, "loss": 5.0552, "mean_token_accuracy": 0.20085858553647995, "num_tokens": 37341695.0, "step": 21520 }, { "entropy": 5.693460464477539, "epoch": 1.6747325423069441, "grad_norm": 1.140625, "learning_rate": 0.0004718455439411958, "loss": 5.2198, "mean_token_accuracy": 0.18530402928590775, "num_tokens": 37350917.0, "step": 21525 }, { "entropy": 5.735363435745239, "epoch": 1.6751215716786616, "grad_norm": 1.109375, "learning_rate": 0.0004718321181407873, "loss": 5.1697, "mean_token_accuracy": 0.1849642351269722, "num_tokens": 37360206.0, "step": 21530 }, { "entropy": 5.744312524795532, "epoch": 1.6755106010503793, "grad_norm": 1.0859375, "learning_rate": 0.0004718186893537647, "loss": 5.1339, "mean_token_accuracy": 0.19340480268001556, "num_tokens": 37369378.0, "step": 21535 }, { "entropy": 5.660828876495361, "epoch": 1.675899630422097, "grad_norm": 1.234375, "learning_rate": 0.0004718052575803318, "loss": 5.0524, "mean_token_accuracy": 0.20309800207614898, "num_tokens": 37377744.0, "step": 21540 }, { "entropy": 5.667059135437012, "epoch": 1.6762886597938145, "grad_norm": 1.1953125, "learning_rate": 0.0004717918228206923, "loss": 5.0565, "mean_token_accuracy": 0.19197254925966262, "num_tokens": 37387097.0, "step": 21545 }, { "entropy": 5.713493490219117, "epoch": 1.676677689165532, "grad_norm": 1.1328125, "learning_rate": 0.0004717783850750501, "loss": 5.1459, "mean_token_accuracy": 0.1895543411374092, "num_tokens": 37395551.0, "step": 21550 }, { "entropy": 5.630736780166626, "epoch": 1.6770667185372496, "grad_norm": 1.125, "learning_rate": 0.0004717649443436091, "loss": 4.9281, "mean_token_accuracy": 0.20800315886735915, "num_tokens": 37403876.0, "step": 21555 }, { "entropy": 5.658391809463501, "epoch": 1.6774557479089671, "grad_norm": 1.1171875, "learning_rate": 0.00047175150062657336, "loss": 5.0505, "mean_token_accuracy": 0.1969800129532814, "num_tokens": 37412658.0, "step": 21560 }, { "entropy": 5.656177282333374, "epoch": 1.6778447772806846, "grad_norm": 1.1171875, "learning_rate": 0.00047173805392414664, "loss": 5.0293, "mean_token_accuracy": 0.19987383335828782, "num_tokens": 37420790.0, "step": 21565 }, { "entropy": 5.639275074005127, "epoch": 1.6782338066524023, "grad_norm": 1.0859375, "learning_rate": 0.0004717246042365332, "loss": 5.098, "mean_token_accuracy": 0.19355754554271698, "num_tokens": 37428866.0, "step": 21570 }, { "entropy": 5.6372967720031735, "epoch": 1.6786228360241198, "grad_norm": 1.171875, "learning_rate": 0.00047171115156393695, "loss": 5.032, "mean_token_accuracy": 0.2024747237563133, "num_tokens": 37437636.0, "step": 21575 }, { "entropy": 5.6486818313598635, "epoch": 1.6790118653958372, "grad_norm": 1.09375, "learning_rate": 0.00047169769590656207, "loss": 5.0879, "mean_token_accuracy": 0.19749243259429933, "num_tokens": 37446455.0, "step": 21580 }, { "entropy": 5.641884803771973, "epoch": 1.679400894767555, "grad_norm": 1.234375, "learning_rate": 0.00047168423726461273, "loss": 5.1577, "mean_token_accuracy": 0.1887023076415062, "num_tokens": 37454997.0, "step": 21585 }, { "entropy": 5.637234306335449, "epoch": 1.6797899241392726, "grad_norm": 1.140625, "learning_rate": 0.0004716707756382931, "loss": 4.9943, "mean_token_accuracy": 0.20316977947950363, "num_tokens": 37463701.0, "step": 21590 }, { "entropy": 5.703650093078613, "epoch": 1.6801789535109901, "grad_norm": 1.0625, "learning_rate": 0.00047165731102780757, "loss": 5.1235, "mean_token_accuracy": 0.18962299823760986, "num_tokens": 37472460.0, "step": 21595 }, { "entropy": 5.677802467346192, "epoch": 1.6805679828827076, "grad_norm": 1.1953125, "learning_rate": 0.00047164384343336037, "loss": 5.0337, "mean_token_accuracy": 0.19802031815052032, "num_tokens": 37481114.0, "step": 21600 }, { "entropy": 5.6594819068908695, "epoch": 1.6809570122544253, "grad_norm": 1.203125, "learning_rate": 0.00047163037285515583, "loss": 5.1129, "mean_token_accuracy": 0.19172435253858566, "num_tokens": 37489593.0, "step": 21605 }, { "entropy": 5.726067781448364, "epoch": 1.6813460416261428, "grad_norm": 1.28125, "learning_rate": 0.0004716168992933982, "loss": 5.1599, "mean_token_accuracy": 0.19118998050689698, "num_tokens": 37498044.0, "step": 21610 }, { "entropy": 5.741387605667114, "epoch": 1.6817350709978602, "grad_norm": 1.2890625, "learning_rate": 0.00047160342274829234, "loss": 5.0648, "mean_token_accuracy": 0.19408333748579026, "num_tokens": 37507339.0, "step": 21615 }, { "entropy": 5.608314943313599, "epoch": 1.682124100369578, "grad_norm": 1.15625, "learning_rate": 0.00047158994322004223, "loss": 4.9657, "mean_token_accuracy": 0.20372917652130126, "num_tokens": 37515919.0, "step": 21620 }, { "entropy": 5.628144121170044, "epoch": 1.6825131297412956, "grad_norm": 0.99609375, "learning_rate": 0.0004715764607088527, "loss": 4.9686, "mean_token_accuracy": 0.20786874294281005, "num_tokens": 37524990.0, "step": 21625 }, { "entropy": 5.628019189834594, "epoch": 1.6829021591130129, "grad_norm": 1.1171875, "learning_rate": 0.0004715629752149283, "loss": 5.1045, "mean_token_accuracy": 0.19200923144817353, "num_tokens": 37534125.0, "step": 21630 }, { "entropy": 5.648524332046509, "epoch": 1.6832911884847306, "grad_norm": 1.15625, "learning_rate": 0.00047154948673847356, "loss": 5.0221, "mean_token_accuracy": 0.1976946175098419, "num_tokens": 37541715.0, "step": 21635 }, { "entropy": 5.7356569290161135, "epoch": 1.6836802178564483, "grad_norm": 1.1328125, "learning_rate": 0.0004715359952796933, "loss": 5.156, "mean_token_accuracy": 0.20350012481212615, "num_tokens": 37550097.0, "step": 21640 }, { "entropy": 5.585136222839355, "epoch": 1.6840692472281658, "grad_norm": 0.9921875, "learning_rate": 0.00047152250083879203, "loss": 5.0188, "mean_token_accuracy": 0.19679685980081557, "num_tokens": 37558950.0, "step": 21645 }, { "entropy": 5.675404357910156, "epoch": 1.6844582765998832, "grad_norm": 1.1328125, "learning_rate": 0.00047150900341597464, "loss": 5.034, "mean_token_accuracy": 0.20156317204236984, "num_tokens": 37567737.0, "step": 21650 }, { "entropy": 5.700136137008667, "epoch": 1.684847305971601, "grad_norm": 1.0859375, "learning_rate": 0.0004714955030114459, "loss": 5.0773, "mean_token_accuracy": 0.19584817737340926, "num_tokens": 37576649.0, "step": 21655 }, { "entropy": 5.655124568939209, "epoch": 1.6852363353433184, "grad_norm": 1.1875, "learning_rate": 0.00047148199962541065, "loss": 5.0558, "mean_token_accuracy": 0.20388414412736894, "num_tokens": 37584455.0, "step": 21660 }, { "entropy": 5.659012794494629, "epoch": 1.6856253647150359, "grad_norm": 1.046875, "learning_rate": 0.0004714684932580738, "loss": 5.1272, "mean_token_accuracy": 0.18838134557008743, "num_tokens": 37593653.0, "step": 21665 }, { "entropy": 5.693011713027954, "epoch": 1.6860143940867536, "grad_norm": 1.0078125, "learning_rate": 0.0004714549839096403, "loss": 5.1093, "mean_token_accuracy": 0.1929284319281578, "num_tokens": 37603212.0, "step": 21670 }, { "entropy": 5.686216735839844, "epoch": 1.6864034234584713, "grad_norm": 1.1328125, "learning_rate": 0.00047144147158031507, "loss": 5.0331, "mean_token_accuracy": 0.19574832767248154, "num_tokens": 37611871.0, "step": 21675 }, { "entropy": 5.7182615280151365, "epoch": 1.6867924528301885, "grad_norm": 1.15625, "learning_rate": 0.0004714279562703032, "loss": 5.2188, "mean_token_accuracy": 0.18723901510238647, "num_tokens": 37621410.0, "step": 21680 }, { "entropy": 5.664160490036011, "epoch": 1.6871814822019062, "grad_norm": 1.234375, "learning_rate": 0.0004714144379798098, "loss": 5.0297, "mean_token_accuracy": 0.19567696303129195, "num_tokens": 37629525.0, "step": 21685 }, { "entropy": 5.723068618774414, "epoch": 1.687570511573624, "grad_norm": 1.125, "learning_rate": 0.00047140091670903986, "loss": 5.0854, "mean_token_accuracy": 0.19774255752563477, "num_tokens": 37638183.0, "step": 21690 }, { "entropy": 5.686976766586303, "epoch": 1.6879595409453414, "grad_norm": 1.125, "learning_rate": 0.00047138739245819857, "loss": 5.0693, "mean_token_accuracy": 0.19803808480501175, "num_tokens": 37646884.0, "step": 21695 }, { "entropy": 5.738629531860352, "epoch": 1.6883485703170589, "grad_norm": 1.1796875, "learning_rate": 0.00047137386522749124, "loss": 5.1196, "mean_token_accuracy": 0.18730611950159073, "num_tokens": 37655482.0, "step": 21700 }, { "entropy": 5.612303066253662, "epoch": 1.6887375996887766, "grad_norm": 1.1015625, "learning_rate": 0.0004713603350171231, "loss": 4.9336, "mean_token_accuracy": 0.2021462708711624, "num_tokens": 37664056.0, "step": 21705 }, { "entropy": 5.669025564193726, "epoch": 1.689126629060494, "grad_norm": 1.1953125, "learning_rate": 0.00047134680182729926, "loss": 5.2382, "mean_token_accuracy": 0.19384651780128478, "num_tokens": 37673198.0, "step": 21710 }, { "entropy": 5.664942216873169, "epoch": 1.6895156584322115, "grad_norm": 1.046875, "learning_rate": 0.0004713332656582254, "loss": 5.0697, "mean_token_accuracy": 0.19532050788402558, "num_tokens": 37682660.0, "step": 21715 }, { "entropy": 5.633370590209961, "epoch": 1.6899046878039292, "grad_norm": 1.1171875, "learning_rate": 0.0004713197265101066, "loss": 5.0389, "mean_token_accuracy": 0.202335362136364, "num_tokens": 37691232.0, "step": 21720 }, { "entropy": 5.61824893951416, "epoch": 1.690293717175647, "grad_norm": 1.0546875, "learning_rate": 0.00047130618438314856, "loss": 5.0005, "mean_token_accuracy": 0.20015470683574677, "num_tokens": 37699734.0, "step": 21725 }, { "entropy": 5.700785541534424, "epoch": 1.6906827465473642, "grad_norm": 1.1328125, "learning_rate": 0.0004712926392775565, "loss": 5.0839, "mean_token_accuracy": 0.1999967008829117, "num_tokens": 37708529.0, "step": 21730 }, { "entropy": 5.63576717376709, "epoch": 1.6910717759190819, "grad_norm": 1.109375, "learning_rate": 0.0004712790911935362, "loss": 4.9562, "mean_token_accuracy": 0.2098645582795143, "num_tokens": 37717197.0, "step": 21735 }, { "entropy": 5.618352890014648, "epoch": 1.6914608052907996, "grad_norm": 1.1328125, "learning_rate": 0.000471265540131293, "loss": 5.0982, "mean_token_accuracy": 0.19188545197248458, "num_tokens": 37726276.0, "step": 21740 }, { "entropy": 5.72824912071228, "epoch": 1.691849834662517, "grad_norm": 1.078125, "learning_rate": 0.00047125198609103267, "loss": 5.137, "mean_token_accuracy": 0.19199802875518798, "num_tokens": 37735016.0, "step": 21745 }, { "entropy": 5.729806423187256, "epoch": 1.6922388640342345, "grad_norm": 1.0703125, "learning_rate": 0.0004712384290729607, "loss": 5.104, "mean_token_accuracy": 0.20036841332912445, "num_tokens": 37744332.0, "step": 21750 }, { "entropy": 5.7336780548095705, "epoch": 1.6926278934059522, "grad_norm": 1.171875, "learning_rate": 0.000471224869077283, "loss": 5.164, "mean_token_accuracy": 0.1810240551829338, "num_tokens": 37752805.0, "step": 21755 }, { "entropy": 5.708140134811401, "epoch": 1.6930169227776697, "grad_norm": 1.1171875, "learning_rate": 0.00047121130610420527, "loss": 5.0816, "mean_token_accuracy": 0.19440166354179383, "num_tokens": 37760979.0, "step": 21760 }, { "entropy": 5.588563919067383, "epoch": 1.6934059521493872, "grad_norm": 1.203125, "learning_rate": 0.00047119774015393323, "loss": 5.0224, "mean_token_accuracy": 0.19733347296714782, "num_tokens": 37769096.0, "step": 21765 }, { "entropy": 5.656375885009766, "epoch": 1.6937949815211049, "grad_norm": 1.2109375, "learning_rate": 0.00047118417122667285, "loss": 5.0283, "mean_token_accuracy": 0.19535085558891296, "num_tokens": 37776998.0, "step": 21770 }, { "entropy": 5.7147716045379635, "epoch": 1.6941840108928226, "grad_norm": 1.1015625, "learning_rate": 0.0004711705993226298, "loss": 5.1449, "mean_token_accuracy": 0.19495135098695754, "num_tokens": 37785547.0, "step": 21775 }, { "entropy": 5.667989873886109, "epoch": 1.6945730402645398, "grad_norm": 1.15625, "learning_rate": 0.0004711570244420102, "loss": 5.0958, "mean_token_accuracy": 0.1913059949874878, "num_tokens": 37793659.0, "step": 21780 }, { "entropy": 5.6489544868469235, "epoch": 1.6949620696362575, "grad_norm": 1.1796875, "learning_rate": 0.0004711434465850199, "loss": 5.0083, "mean_token_accuracy": 0.19947948008775712, "num_tokens": 37802282.0, "step": 21785 }, { "entropy": 5.69829363822937, "epoch": 1.6953510990079752, "grad_norm": 1.21875, "learning_rate": 0.0004711298657518651, "loss": 5.0728, "mean_token_accuracy": 0.19906374365091323, "num_tokens": 37810692.0, "step": 21790 }, { "entropy": 5.606528997421265, "epoch": 1.6957401283796927, "grad_norm": 1.1328125, "learning_rate": 0.0004711162819427518, "loss": 5.0343, "mean_token_accuracy": 0.20089835524559022, "num_tokens": 37819264.0, "step": 21795 }, { "entropy": 5.662407445907593, "epoch": 1.6961291577514102, "grad_norm": 1.1328125, "learning_rate": 0.000471102695157886, "loss": 5.0801, "mean_token_accuracy": 0.20163782984018325, "num_tokens": 37827650.0, "step": 21800 }, { "entropy": 5.565398263931274, "epoch": 1.6965181871231279, "grad_norm": 1.109375, "learning_rate": 0.0004710891053974739, "loss": 5.0159, "mean_token_accuracy": 0.2013427272439003, "num_tokens": 37835683.0, "step": 21805 }, { "entropy": 5.652868175506592, "epoch": 1.6969072164948453, "grad_norm": 1.109375, "learning_rate": 0.0004710755126617217, "loss": 5.0309, "mean_token_accuracy": 0.1954900309443474, "num_tokens": 37844334.0, "step": 21810 }, { "entropy": 5.617059993743896, "epoch": 1.6972962458665628, "grad_norm": 1.03125, "learning_rate": 0.0004710619169508358, "loss": 5.0088, "mean_token_accuracy": 0.19692396521568298, "num_tokens": 37853609.0, "step": 21815 }, { "entropy": 5.665457820892334, "epoch": 1.6976852752382805, "grad_norm": 1.125, "learning_rate": 0.0004710483182650223, "loss": 5.0612, "mean_token_accuracy": 0.19669616967439651, "num_tokens": 37862817.0, "step": 21820 }, { "entropy": 5.589251852035522, "epoch": 1.6980743046099982, "grad_norm": 1.140625, "learning_rate": 0.00047103471660448767, "loss": 5.0005, "mean_token_accuracy": 0.2045843094587326, "num_tokens": 37871630.0, "step": 21825 }, { "entropy": 5.552453231811524, "epoch": 1.6984633339817157, "grad_norm": 1.0859375, "learning_rate": 0.00047102111196943813, "loss": 5.0202, "mean_token_accuracy": 0.20275750160217285, "num_tokens": 37881098.0, "step": 21830 }, { "entropy": 5.659877634048462, "epoch": 1.6988523633534331, "grad_norm": 1.1484375, "learning_rate": 0.00047100750436008035, "loss": 5.024, "mean_token_accuracy": 0.2032433718442917, "num_tokens": 37889760.0, "step": 21835 }, { "entropy": 5.740854406356812, "epoch": 1.6992413927251508, "grad_norm": 1.1328125, "learning_rate": 0.00047099389377662054, "loss": 5.132, "mean_token_accuracy": 0.19285643249750137, "num_tokens": 37898417.0, "step": 21840 }, { "entropy": 5.639759302139282, "epoch": 1.6996304220968683, "grad_norm": 1.15625, "learning_rate": 0.0004709802802192654, "loss": 5.0801, "mean_token_accuracy": 0.2006111890077591, "num_tokens": 37907117.0, "step": 21845 }, { "entropy": 5.614550828933716, "epoch": 1.7000194514685858, "grad_norm": 1.1015625, "learning_rate": 0.00047096666368822153, "loss": 5.0148, "mean_token_accuracy": 0.1985253646969795, "num_tokens": 37915781.0, "step": 21850 }, { "entropy": 5.650159883499145, "epoch": 1.7004084808403035, "grad_norm": 1.0703125, "learning_rate": 0.00047095304418369536, "loss": 5.1034, "mean_token_accuracy": 0.19175428450107573, "num_tokens": 37924770.0, "step": 21855 }, { "entropy": 5.657611083984375, "epoch": 1.700797510212021, "grad_norm": 1.1484375, "learning_rate": 0.0004709394217058936, "loss": 5.1124, "mean_token_accuracy": 0.19348921179771422, "num_tokens": 37933512.0, "step": 21860 }, { "entropy": 5.612676429748535, "epoch": 1.7011865395837384, "grad_norm": 1.078125, "learning_rate": 0.0004709257962550231, "loss": 4.935, "mean_token_accuracy": 0.20104921907186507, "num_tokens": 37942439.0, "step": 21865 }, { "entropy": 5.672794818878174, "epoch": 1.7015755689554561, "grad_norm": 1.1953125, "learning_rate": 0.00047091216783129035, "loss": 5.1241, "mean_token_accuracy": 0.19222945719957352, "num_tokens": 37951388.0, "step": 21870 }, { "entropy": 5.689729785919189, "epoch": 1.7019645983271738, "grad_norm": 1.140625, "learning_rate": 0.0004708985364349024, "loss": 5.116, "mean_token_accuracy": 0.19365573674440384, "num_tokens": 37960372.0, "step": 21875 }, { "entropy": 5.71558632850647, "epoch": 1.7023536276988913, "grad_norm": 1.140625, "learning_rate": 0.00047088490206606586, "loss": 5.2004, "mean_token_accuracy": 0.17831635028123854, "num_tokens": 37969472.0, "step": 21880 }, { "entropy": 5.616215753555298, "epoch": 1.7027426570706088, "grad_norm": 1.2265625, "learning_rate": 0.00047087126472498785, "loss": 4.9312, "mean_token_accuracy": 0.2066580057144165, "num_tokens": 37977422.0, "step": 21885 }, { "entropy": 5.596018838882446, "epoch": 1.7031316864423265, "grad_norm": 1.2890625, "learning_rate": 0.000470857624411875, "loss": 4.9122, "mean_token_accuracy": 0.20602083951234818, "num_tokens": 37985861.0, "step": 21890 }, { "entropy": 5.690075063705445, "epoch": 1.703520715814044, "grad_norm": 1.25, "learning_rate": 0.00047084398112693456, "loss": 5.0423, "mean_token_accuracy": 0.20235230773687363, "num_tokens": 37994535.0, "step": 21895 }, { "entropy": 5.6552125930786135, "epoch": 1.7039097451857614, "grad_norm": 1.1015625, "learning_rate": 0.0004708303348703734, "loss": 5.0822, "mean_token_accuracy": 0.19286412000656128, "num_tokens": 38003351.0, "step": 21900 }, { "entropy": 5.678764867782593, "epoch": 1.7042987745574791, "grad_norm": 1.125, "learning_rate": 0.0004708166856423986, "loss": 5.0784, "mean_token_accuracy": 0.19291504323482514, "num_tokens": 38012210.0, "step": 21905 }, { "entropy": 5.696633291244507, "epoch": 1.7046878039291966, "grad_norm": 1.1875, "learning_rate": 0.00047080303344321727, "loss": 5.0751, "mean_token_accuracy": 0.19998956620693206, "num_tokens": 38020548.0, "step": 21910 }, { "entropy": 5.687703037261963, "epoch": 1.705076833300914, "grad_norm": 1.140625, "learning_rate": 0.00047078937827303653, "loss": 5.0388, "mean_token_accuracy": 0.19409146904945374, "num_tokens": 38029451.0, "step": 21915 }, { "entropy": 5.656308364868164, "epoch": 1.7054658626726318, "grad_norm": 1.140625, "learning_rate": 0.0004707757201320636, "loss": 5.0799, "mean_token_accuracy": 0.1945350632071495, "num_tokens": 38037821.0, "step": 21920 }, { "entropy": 5.615873718261719, "epoch": 1.7058548920443495, "grad_norm": 1.140625, "learning_rate": 0.00047076205902050577, "loss": 5.1307, "mean_token_accuracy": 0.19154444336891174, "num_tokens": 38046188.0, "step": 21925 }, { "entropy": 5.679753208160401, "epoch": 1.706243921416067, "grad_norm": 1.1171875, "learning_rate": 0.00047074839493857024, "loss": 5.1302, "mean_token_accuracy": 0.1952909231185913, "num_tokens": 38054821.0, "step": 21930 }, { "entropy": 5.672739744186401, "epoch": 1.7066329507877844, "grad_norm": 1.0625, "learning_rate": 0.0004707347278864644, "loss": 5.0532, "mean_token_accuracy": 0.19533757120370865, "num_tokens": 38063057.0, "step": 21935 }, { "entropy": 5.706013154983521, "epoch": 1.7070219801595021, "grad_norm": 1.0625, "learning_rate": 0.00047072105786439563, "loss": 5.2027, "mean_token_accuracy": 0.1914782240986824, "num_tokens": 38071694.0, "step": 21940 }, { "entropy": 5.691050481796265, "epoch": 1.7074110095312196, "grad_norm": 1.0703125, "learning_rate": 0.00047070738487257137, "loss": 5.0219, "mean_token_accuracy": 0.1982439175248146, "num_tokens": 38080965.0, "step": 21945 }, { "entropy": 5.667789697647095, "epoch": 1.707800038902937, "grad_norm": 1.078125, "learning_rate": 0.00047069370891119895, "loss": 5.0521, "mean_token_accuracy": 0.19038837552070617, "num_tokens": 38089786.0, "step": 21950 }, { "entropy": 5.6412077903747555, "epoch": 1.7081890682746548, "grad_norm": 1.1953125, "learning_rate": 0.000470680029980486, "loss": 5.0622, "mean_token_accuracy": 0.19882871955633163, "num_tokens": 38097994.0, "step": 21955 }, { "entropy": 5.690302467346191, "epoch": 1.7085780976463723, "grad_norm": 1.1015625, "learning_rate": 0.00047066634808064006, "loss": 5.1178, "mean_token_accuracy": 0.19154055416584015, "num_tokens": 38106910.0, "step": 21960 }, { "entropy": 5.646644115447998, "epoch": 1.7089671270180897, "grad_norm": 1.3203125, "learning_rate": 0.00047065266321186873, "loss": 5.0332, "mean_token_accuracy": 0.2043434962630272, "num_tokens": 38115162.0, "step": 21965 }, { "entropy": 5.705600547790527, "epoch": 1.7093561563898074, "grad_norm": 1.1171875, "learning_rate": 0.0004706389753743797, "loss": 5.083, "mean_token_accuracy": 0.20416899919509887, "num_tokens": 38123776.0, "step": 21970 }, { "entropy": 5.705074787139893, "epoch": 1.7097451857615251, "grad_norm": 1.1171875, "learning_rate": 0.0004706252845683805, "loss": 5.1659, "mean_token_accuracy": 0.19011609256267548, "num_tokens": 38132591.0, "step": 21975 }, { "entropy": 5.6537495136260985, "epoch": 1.7101342151332426, "grad_norm": 1.359375, "learning_rate": 0.00047061159079407903, "loss": 5.027, "mean_token_accuracy": 0.2028370201587677, "num_tokens": 38141092.0, "step": 21980 }, { "entropy": 5.633610391616822, "epoch": 1.71052324450496, "grad_norm": 1.1953125, "learning_rate": 0.000470597894051683, "loss": 5.0078, "mean_token_accuracy": 0.1986740291118622, "num_tokens": 38149315.0, "step": 21985 }, { "entropy": 5.604947948455811, "epoch": 1.7109122738766778, "grad_norm": 1.109375, "learning_rate": 0.0004705841943414003, "loss": 4.9733, "mean_token_accuracy": 0.19915590435266495, "num_tokens": 38158208.0, "step": 21990 }, { "entropy": 5.74879937171936, "epoch": 1.7113013032483952, "grad_norm": 1.2109375, "learning_rate": 0.00047057049166343876, "loss": 5.126, "mean_token_accuracy": 0.19257869869470595, "num_tokens": 38166339.0, "step": 21995 }, { "entropy": 5.717361402511597, "epoch": 1.7116903326201127, "grad_norm": 1.1640625, "learning_rate": 0.00047055678601800623, "loss": 5.084, "mean_token_accuracy": 0.19625718891620636, "num_tokens": 38174813.0, "step": 22000 }, { "entropy": 5.656217098236084, "epoch": 1.7120793619918304, "grad_norm": 1.078125, "learning_rate": 0.00047054307740531076, "loss": 4.9596, "mean_token_accuracy": 0.20155562162399293, "num_tokens": 38183440.0, "step": 22005 }, { "entropy": 5.596694850921631, "epoch": 1.712468391363548, "grad_norm": 1.265625, "learning_rate": 0.00047052936582556035, "loss": 5.0202, "mean_token_accuracy": 0.19960058182477952, "num_tokens": 38192510.0, "step": 22010 }, { "entropy": 5.650761985778809, "epoch": 1.7128574207352654, "grad_norm": 1.0703125, "learning_rate": 0.00047051565127896307, "loss": 5.0144, "mean_token_accuracy": 0.20671189874410628, "num_tokens": 38200854.0, "step": 22015 }, { "entropy": 5.6916844844818115, "epoch": 1.713246450106983, "grad_norm": 1.1796875, "learning_rate": 0.00047050193376572686, "loss": 5.0717, "mean_token_accuracy": 0.1918088510632515, "num_tokens": 38209632.0, "step": 22020 }, { "entropy": 5.615683746337891, "epoch": 1.7136354794787008, "grad_norm": 1.078125, "learning_rate": 0.00047048821328606, "loss": 4.9976, "mean_token_accuracy": 0.20116380751132965, "num_tokens": 38218657.0, "step": 22025 }, { "entropy": 5.7197511196136475, "epoch": 1.7140245088504182, "grad_norm": 1.171875, "learning_rate": 0.0004704744898401708, "loss": 5.0643, "mean_token_accuracy": 0.19772231131792067, "num_tokens": 38227507.0, "step": 22030 }, { "entropy": 5.6676534652709964, "epoch": 1.7144135382221357, "grad_norm": 1.0625, "learning_rate": 0.0004704607634282672, "loss": 5.0377, "mean_token_accuracy": 0.1997448906302452, "num_tokens": 38236822.0, "step": 22035 }, { "entropy": 5.563470411300659, "epoch": 1.7148025675938534, "grad_norm": 1.09375, "learning_rate": 0.00047044703405055765, "loss": 4.9497, "mean_token_accuracy": 0.2040942892432213, "num_tokens": 38245144.0, "step": 22040 }, { "entropy": 5.621599626541138, "epoch": 1.7151915969655709, "grad_norm": 1.109375, "learning_rate": 0.00047043330170725046, "loss": 5.0516, "mean_token_accuracy": 0.1953385666012764, "num_tokens": 38254363.0, "step": 22045 }, { "entropy": 5.634972953796387, "epoch": 1.7155806263372884, "grad_norm": 1.109375, "learning_rate": 0.00047041956639855406, "loss": 5.051, "mean_token_accuracy": 0.19931643605232238, "num_tokens": 38263117.0, "step": 22050 }, { "entropy": 5.632564926147461, "epoch": 1.715969655709006, "grad_norm": 1.171875, "learning_rate": 0.0004704058281246766, "loss": 5.0341, "mean_token_accuracy": 0.1971964493393898, "num_tokens": 38271217.0, "step": 22055 }, { "entropy": 5.716578531265259, "epoch": 1.7163586850807238, "grad_norm": 1.1796875, "learning_rate": 0.0004703920868858268, "loss": 5.1623, "mean_token_accuracy": 0.19212710112333298, "num_tokens": 38279789.0, "step": 22060 }, { "entropy": 5.626923418045044, "epoch": 1.716747714452441, "grad_norm": 1.1953125, "learning_rate": 0.00047037834268221315, "loss": 4.9823, "mean_token_accuracy": 0.20163310319185257, "num_tokens": 38288845.0, "step": 22065 }, { "entropy": 5.656175184249878, "epoch": 1.7171367438241587, "grad_norm": 1.09375, "learning_rate": 0.0004703645955140441, "loss": 5.0493, "mean_token_accuracy": 0.1967256933450699, "num_tokens": 38297237.0, "step": 22070 }, { "entropy": 5.745203351974487, "epoch": 1.7175257731958764, "grad_norm": 1.15625, "learning_rate": 0.00047035084538152815, "loss": 5.1585, "mean_token_accuracy": 0.18956682980060577, "num_tokens": 38306582.0, "step": 22075 }, { "entropy": 5.658037710189819, "epoch": 1.7179148025675939, "grad_norm": 1.109375, "learning_rate": 0.0004703370922848742, "loss": 4.9744, "mean_token_accuracy": 0.21153550297021867, "num_tokens": 38315406.0, "step": 22080 }, { "entropy": 5.62490701675415, "epoch": 1.7183038319393114, "grad_norm": 1.09375, "learning_rate": 0.00047032333622429074, "loss": 4.9744, "mean_token_accuracy": 0.20097845196723937, "num_tokens": 38324271.0, "step": 22085 }, { "entropy": 5.664039182662964, "epoch": 1.718692861311029, "grad_norm": 1.171875, "learning_rate": 0.00047030957719998656, "loss": 5.0756, "mean_token_accuracy": 0.19401168525218965, "num_tokens": 38332831.0, "step": 22090 }, { "entropy": 5.632407712936401, "epoch": 1.7190818906827465, "grad_norm": 1.15625, "learning_rate": 0.0004702958152121704, "loss": 4.9909, "mean_token_accuracy": 0.20227778404951097, "num_tokens": 38341263.0, "step": 22095 }, { "entropy": 5.648492622375488, "epoch": 1.719470920054464, "grad_norm": 1.109375, "learning_rate": 0.0004702820502610511, "loss": 5.1847, "mean_token_accuracy": 0.18876439929008484, "num_tokens": 38349890.0, "step": 22100 }, { "entropy": 5.610504007339477, "epoch": 1.7198599494261817, "grad_norm": 1.140625, "learning_rate": 0.0004702682823468375, "loss": 4.9655, "mean_token_accuracy": 0.20201875567436217, "num_tokens": 38358071.0, "step": 22105 }, { "entropy": 5.711025524139404, "epoch": 1.7202489787978994, "grad_norm": 1.1015625, "learning_rate": 0.00047025451146973844, "loss": 5.1283, "mean_token_accuracy": 0.19127406924962997, "num_tokens": 38366859.0, "step": 22110 }, { "entropy": 5.770093822479248, "epoch": 1.7206380081696167, "grad_norm": 1.1953125, "learning_rate": 0.00047024073762996305, "loss": 5.2786, "mean_token_accuracy": 0.180878247320652, "num_tokens": 38375897.0, "step": 22115 }, { "entropy": 5.6647388458251955, "epoch": 1.7210270375413343, "grad_norm": 1.078125, "learning_rate": 0.0004702269608277202, "loss": 5.0572, "mean_token_accuracy": 0.20210765302181244, "num_tokens": 38384700.0, "step": 22120 }, { "entropy": 5.698626279830933, "epoch": 1.721416066913052, "grad_norm": 1.0859375, "learning_rate": 0.0004702131810632189, "loss": 5.1123, "mean_token_accuracy": 0.19869651645421982, "num_tokens": 38393212.0, "step": 22125 }, { "entropy": 5.620493793487549, "epoch": 1.7218050962847695, "grad_norm": 1.1015625, "learning_rate": 0.00047019939833666837, "loss": 5.0233, "mean_token_accuracy": 0.20437860637903213, "num_tokens": 38401572.0, "step": 22130 }, { "entropy": 5.618623733520508, "epoch": 1.722194125656487, "grad_norm": 1.1875, "learning_rate": 0.0004701856126482776, "loss": 5.0555, "mean_token_accuracy": 0.19549354761838914, "num_tokens": 38410669.0, "step": 22135 }, { "entropy": 5.661244440078735, "epoch": 1.7225831550282047, "grad_norm": 1.203125, "learning_rate": 0.0004701718239982559, "loss": 5.0658, "mean_token_accuracy": 0.1931559458374977, "num_tokens": 38419038.0, "step": 22140 }, { "entropy": 5.6170848369598385, "epoch": 1.7229721843999222, "grad_norm": 1.140625, "learning_rate": 0.00047015803238681234, "loss": 5.0027, "mean_token_accuracy": 0.2055936947464943, "num_tokens": 38427314.0, "step": 22145 }, { "entropy": 5.608303117752075, "epoch": 1.7233612137716396, "grad_norm": 1.140625, "learning_rate": 0.0004701442378141563, "loss": 4.9995, "mean_token_accuracy": 0.19678326845169067, "num_tokens": 38435373.0, "step": 22150 }, { "entropy": 5.613267707824707, "epoch": 1.7237502431433573, "grad_norm": 1.1015625, "learning_rate": 0.000470130440280497, "loss": 5.0228, "mean_token_accuracy": 0.20060820132493973, "num_tokens": 38444448.0, "step": 22155 }, { "entropy": 5.6791112422943115, "epoch": 1.724139272515075, "grad_norm": 1.125, "learning_rate": 0.0004701166397860439, "loss": 4.9721, "mean_token_accuracy": 0.20241123139858247, "num_tokens": 38453576.0, "step": 22160 }, { "entropy": 5.686106252670288, "epoch": 1.7245283018867923, "grad_norm": 1.1328125, "learning_rate": 0.0004701028363310064, "loss": 5.0127, "mean_token_accuracy": 0.20553840398788453, "num_tokens": 38462848.0, "step": 22165 }, { "entropy": 5.6319732666015625, "epoch": 1.72491733125851, "grad_norm": 1.1171875, "learning_rate": 0.00047008902991559385, "loss": 5.0021, "mean_token_accuracy": 0.20384716987609863, "num_tokens": 38470953.0, "step": 22170 }, { "entropy": 5.687946414947509, "epoch": 1.7253063606302277, "grad_norm": 1.0703125, "learning_rate": 0.0004700752205400158, "loss": 5.1323, "mean_token_accuracy": 0.19119604974985122, "num_tokens": 38479835.0, "step": 22175 }, { "entropy": 5.679265928268433, "epoch": 1.7256953900019452, "grad_norm": 1.21875, "learning_rate": 0.00047006140820448174, "loss": 5.0515, "mean_token_accuracy": 0.19489602446556092, "num_tokens": 38488342.0, "step": 22180 }, { "entropy": 5.664249897003174, "epoch": 1.7260844193736626, "grad_norm": 1.109375, "learning_rate": 0.00047004759290920136, "loss": 5.0676, "mean_token_accuracy": 0.1976734146475792, "num_tokens": 38496716.0, "step": 22185 }, { "entropy": 5.658633279800415, "epoch": 1.7264734487453803, "grad_norm": 1.125, "learning_rate": 0.0004700337746543841, "loss": 5.0953, "mean_token_accuracy": 0.19553611129522325, "num_tokens": 38506615.0, "step": 22190 }, { "entropy": 5.609146404266357, "epoch": 1.7268624781170978, "grad_norm": 1.1171875, "learning_rate": 0.0004700199534402398, "loss": 4.9031, "mean_token_accuracy": 0.20573283582925797, "num_tokens": 38515936.0, "step": 22195 }, { "entropy": 5.622857475280762, "epoch": 1.7272515074888153, "grad_norm": 1.1953125, "learning_rate": 0.0004700061292669781, "loss": 5.0328, "mean_token_accuracy": 0.19693392515182495, "num_tokens": 38524829.0, "step": 22200 }, { "entropy": 5.681061124801635, "epoch": 1.727640536860533, "grad_norm": 1.078125, "learning_rate": 0.0004699923021348088, "loss": 5.1863, "mean_token_accuracy": 0.18945951163768768, "num_tokens": 38533686.0, "step": 22205 }, { "entropy": 5.704560089111328, "epoch": 1.7280295662322507, "grad_norm": 1.1640625, "learning_rate": 0.00046997847204394166, "loss": 5.0564, "mean_token_accuracy": 0.19742194563150406, "num_tokens": 38542449.0, "step": 22210 }, { "entropy": 5.679417324066162, "epoch": 1.728418595603968, "grad_norm": 1.203125, "learning_rate": 0.00046996463899458653, "loss": 5.0275, "mean_token_accuracy": 0.20108308494091034, "num_tokens": 38550888.0, "step": 22215 }, { "entropy": 5.5916379451751705, "epoch": 1.7288076249756856, "grad_norm": 1.15625, "learning_rate": 0.0004699508029869533, "loss": 5.0696, "mean_token_accuracy": 0.19759927093982696, "num_tokens": 38559366.0, "step": 22220 }, { "entropy": 5.692618656158447, "epoch": 1.7291966543474033, "grad_norm": 1.203125, "learning_rate": 0.00046993696402125205, "loss": 5.0914, "mean_token_accuracy": 0.20067006051540376, "num_tokens": 38567080.0, "step": 22225 }, { "entropy": 5.657074213027954, "epoch": 1.7295856837191208, "grad_norm": 1.0703125, "learning_rate": 0.0004699231220976925, "loss": 5.0689, "mean_token_accuracy": 0.2045196369290352, "num_tokens": 38575520.0, "step": 22230 }, { "entropy": 5.7178449630737305, "epoch": 1.7299747130908383, "grad_norm": 1.109375, "learning_rate": 0.0004699092772164849, "loss": 5.1606, "mean_token_accuracy": 0.1892016500234604, "num_tokens": 38583974.0, "step": 22235 }, { "entropy": 5.6052460193634035, "epoch": 1.730363742462556, "grad_norm": 1.078125, "learning_rate": 0.0004698954293778392, "loss": 5.0696, "mean_token_accuracy": 0.19698223024606704, "num_tokens": 38592677.0, "step": 22240 }, { "entropy": 5.621514415740966, "epoch": 1.7307527718342735, "grad_norm": 1.15625, "learning_rate": 0.00046988157858196555, "loss": 4.9104, "mean_token_accuracy": 0.201981620490551, "num_tokens": 38601342.0, "step": 22245 }, { "entropy": 5.712474775314331, "epoch": 1.731141801205991, "grad_norm": 1.1484375, "learning_rate": 0.00046986772482907426, "loss": 5.1634, "mean_token_accuracy": 0.18830789625644684, "num_tokens": 38610895.0, "step": 22250 }, { "entropy": 5.668631267547608, "epoch": 1.7315308305777086, "grad_norm": 1.203125, "learning_rate": 0.0004698538681193754, "loss": 5.1195, "mean_token_accuracy": 0.1954927295446396, "num_tokens": 38619059.0, "step": 22255 }, { "entropy": 5.679808139801025, "epoch": 1.7319198599494263, "grad_norm": 1.140625, "learning_rate": 0.00046984000845307907, "loss": 5.0718, "mean_token_accuracy": 0.1958228886127472, "num_tokens": 38628084.0, "step": 22260 }, { "entropy": 5.6559711456298825, "epoch": 1.7323088893211438, "grad_norm": 1.2265625, "learning_rate": 0.00046982614583039584, "loss": 5.0758, "mean_token_accuracy": 0.19177769422531127, "num_tokens": 38636205.0, "step": 22265 }, { "entropy": 5.6353994846344, "epoch": 1.7326979186928613, "grad_norm": 1.1640625, "learning_rate": 0.0004698122802515359, "loss": 5.0316, "mean_token_accuracy": 0.19626931250095367, "num_tokens": 38644583.0, "step": 22270 }, { "entropy": 5.642191600799561, "epoch": 1.733086948064579, "grad_norm": 0.984375, "learning_rate": 0.0004697984117167097, "loss": 5.0163, "mean_token_accuracy": 0.20118715465068818, "num_tokens": 38653517.0, "step": 22275 }, { "entropy": 5.6460182666778564, "epoch": 1.7334759774362964, "grad_norm": 1.2109375, "learning_rate": 0.00046978454022612767, "loss": 5.0765, "mean_token_accuracy": 0.1928579553961754, "num_tokens": 38661926.0, "step": 22280 }, { "entropy": 5.753850650787354, "epoch": 1.733865006808014, "grad_norm": 1.09375, "learning_rate": 0.00046977066578000025, "loss": 5.1241, "mean_token_accuracy": 0.19831566363573075, "num_tokens": 38671567.0, "step": 22285 }, { "entropy": 5.679229211807251, "epoch": 1.7342540361797316, "grad_norm": 1.1328125, "learning_rate": 0.00046975678837853806, "loss": 5.0494, "mean_token_accuracy": 0.20398346036672593, "num_tokens": 38680439.0, "step": 22290 }, { "entropy": 5.642826557159424, "epoch": 1.734643065551449, "grad_norm": 1.1796875, "learning_rate": 0.00046974290802195156, "loss": 5.0976, "mean_token_accuracy": 0.19669349044561385, "num_tokens": 38689168.0, "step": 22295 }, { "entropy": 5.689180564880371, "epoch": 1.7350320949231666, "grad_norm": 1.2109375, "learning_rate": 0.0004697290247104513, "loss": 5.0323, "mean_token_accuracy": 0.19757416248321533, "num_tokens": 38697592.0, "step": 22300 }, { "entropy": 5.649882888793945, "epoch": 1.7354211242948843, "grad_norm": 1.109375, "learning_rate": 0.00046971513844424814, "loss": 5.0798, "mean_token_accuracy": 0.19310355484485625, "num_tokens": 38705561.0, "step": 22305 }, { "entropy": 5.614341115951538, "epoch": 1.735810153666602, "grad_norm": 1.0703125, "learning_rate": 0.00046970124922355265, "loss": 5.0392, "mean_token_accuracy": 0.2010719284415245, "num_tokens": 38714694.0, "step": 22310 }, { "entropy": 5.679735565185547, "epoch": 1.7361991830383194, "grad_norm": 1.0859375, "learning_rate": 0.0004696873570485756, "loss": 5.0254, "mean_token_accuracy": 0.20323633998632432, "num_tokens": 38722797.0, "step": 22315 }, { "entropy": 5.682542705535889, "epoch": 1.736588212410037, "grad_norm": 1.1328125, "learning_rate": 0.0004696734619195278, "loss": 5.0992, "mean_token_accuracy": 0.1997784748673439, "num_tokens": 38732076.0, "step": 22320 }, { "entropy": 5.699263191223144, "epoch": 1.7369772417817546, "grad_norm": 1.1796875, "learning_rate": 0.00046965956383662, "loss": 5.1075, "mean_token_accuracy": 0.20008494555950165, "num_tokens": 38740992.0, "step": 22325 }, { "entropy": 5.6915748596191404, "epoch": 1.737366271153472, "grad_norm": 1.2578125, "learning_rate": 0.0004696456628000632, "loss": 5.0761, "mean_token_accuracy": 0.19764744490385056, "num_tokens": 38749266.0, "step": 22330 }, { "entropy": 5.677693510055542, "epoch": 1.7377553005251896, "grad_norm": 1.1484375, "learning_rate": 0.00046963175881006825, "loss": 5.1521, "mean_token_accuracy": 0.19179669469594957, "num_tokens": 38757983.0, "step": 22335 }, { "entropy": 5.6361168384552, "epoch": 1.7381443298969073, "grad_norm": 1.1171875, "learning_rate": 0.0004696178518668462, "loss": 4.9896, "mean_token_accuracy": 0.20907741338014602, "num_tokens": 38766258.0, "step": 22340 }, { "entropy": 5.68007230758667, "epoch": 1.7385333592686247, "grad_norm": 1.203125, "learning_rate": 0.00046960394197060804, "loss": 5.1095, "mean_token_accuracy": 0.19478160440921782, "num_tokens": 38775105.0, "step": 22345 }, { "entropy": 5.695080280303955, "epoch": 1.7389223886403422, "grad_norm": 1.1015625, "learning_rate": 0.00046959002912156473, "loss": 5.1197, "mean_token_accuracy": 0.1957464560866356, "num_tokens": 38783415.0, "step": 22350 }, { "entropy": 5.6615049839019775, "epoch": 1.73931141801206, "grad_norm": 1.3359375, "learning_rate": 0.0004695761133199275, "loss": 5.1281, "mean_token_accuracy": 0.1939013972878456, "num_tokens": 38791703.0, "step": 22355 }, { "entropy": 5.666936206817627, "epoch": 1.7397004473837776, "grad_norm": 1.0625, "learning_rate": 0.0004695621945659074, "loss": 5.1025, "mean_token_accuracy": 0.19301100075244904, "num_tokens": 38800823.0, "step": 22360 }, { "entropy": 5.674952459335327, "epoch": 1.740089476755495, "grad_norm": 1.0, "learning_rate": 0.0004695482728597157, "loss": 5.0987, "mean_token_accuracy": 0.18985410928726196, "num_tokens": 38810607.0, "step": 22365 }, { "entropy": 5.652855157852173, "epoch": 1.7404785061272126, "grad_norm": 1.0859375, "learning_rate": 0.00046953434820156363, "loss": 5.0429, "mean_token_accuracy": 0.19221502989530564, "num_tokens": 38819288.0, "step": 22370 }, { "entropy": 5.639925289154053, "epoch": 1.7408675354989303, "grad_norm": 1.09375, "learning_rate": 0.0004695204205916624, "loss": 4.9931, "mean_token_accuracy": 0.2042757272720337, "num_tokens": 38827791.0, "step": 22375 }, { "entropy": 5.689849328994751, "epoch": 1.7412565648706477, "grad_norm": 1.2734375, "learning_rate": 0.0004695064900302235, "loss": 5.0529, "mean_token_accuracy": 0.19893163293600083, "num_tokens": 38836338.0, "step": 22380 }, { "entropy": 5.7244312286376955, "epoch": 1.7416455942423652, "grad_norm": 1.140625, "learning_rate": 0.0004694925565174581, "loss": 5.0148, "mean_token_accuracy": 0.1985758975148201, "num_tokens": 38844768.0, "step": 22385 }, { "entropy": 5.75396466255188, "epoch": 1.742034623614083, "grad_norm": 1.1171875, "learning_rate": 0.00046947862005357777, "loss": 5.1498, "mean_token_accuracy": 0.19053892642259598, "num_tokens": 38854022.0, "step": 22390 }, { "entropy": 5.655837488174439, "epoch": 1.7424236529858004, "grad_norm": 1.1171875, "learning_rate": 0.0004694646806387939, "loss": 5.0215, "mean_token_accuracy": 0.2034000650048256, "num_tokens": 38862035.0, "step": 22395 }, { "entropy": 5.659757041931153, "epoch": 1.7428126823575179, "grad_norm": 1.0703125, "learning_rate": 0.0004694507382733181, "loss": 5.0617, "mean_token_accuracy": 0.2006596252322197, "num_tokens": 38870762.0, "step": 22400 }, { "entropy": 5.655742597579956, "epoch": 1.7432017117292355, "grad_norm": 1.2265625, "learning_rate": 0.0004694367929573618, "loss": 5.0009, "mean_token_accuracy": 0.2085031747817993, "num_tokens": 38879791.0, "step": 22405 }, { "entropy": 5.789531087875366, "epoch": 1.7435907411009532, "grad_norm": 1.109375, "learning_rate": 0.0004694228446911367, "loss": 5.1339, "mean_token_accuracy": 0.19194365888834, "num_tokens": 38889926.0, "step": 22410 }, { "entropy": 5.698483085632324, "epoch": 1.7439797704726707, "grad_norm": 1.234375, "learning_rate": 0.0004694088934748542, "loss": 5.0695, "mean_token_accuracy": 0.19272553473711013, "num_tokens": 38898428.0, "step": 22415 }, { "entropy": 5.623120498657227, "epoch": 1.7443687998443882, "grad_norm": 1.171875, "learning_rate": 0.0004693949393087263, "loss": 5.1, "mean_token_accuracy": 0.19020944982767105, "num_tokens": 38906800.0, "step": 22420 }, { "entropy": 5.66190276145935, "epoch": 1.744757829216106, "grad_norm": 1.0390625, "learning_rate": 0.0004693809821929647, "loss": 5.0619, "mean_token_accuracy": 0.18886170089244841, "num_tokens": 38915947.0, "step": 22425 }, { "entropy": 5.74968729019165, "epoch": 1.7451468585878234, "grad_norm": 1.078125, "learning_rate": 0.000469367022127781, "loss": 5.1052, "mean_token_accuracy": 0.1926722154021263, "num_tokens": 38924895.0, "step": 22430 }, { "entropy": 5.715599250793457, "epoch": 1.7455358879595408, "grad_norm": 1.1328125, "learning_rate": 0.00046935305911338703, "loss": 5.086, "mean_token_accuracy": 0.18825379759073257, "num_tokens": 38933393.0, "step": 22435 }, { "entropy": 5.702757740020752, "epoch": 1.7459249173312585, "grad_norm": 1.21875, "learning_rate": 0.0004693390931499948, "loss": 5.0827, "mean_token_accuracy": 0.2023254230618477, "num_tokens": 38942219.0, "step": 22440 }, { "entropy": 5.676919794082641, "epoch": 1.7463139467029762, "grad_norm": 1.2578125, "learning_rate": 0.0004693251242378162, "loss": 5.0381, "mean_token_accuracy": 0.1928280547261238, "num_tokens": 38950938.0, "step": 22445 }, { "entropy": 5.643939352035522, "epoch": 1.7467029760746935, "grad_norm": 1.0859375, "learning_rate": 0.00046931115237706304, "loss": 5.0497, "mean_token_accuracy": 0.197927089035511, "num_tokens": 38959805.0, "step": 22450 }, { "entropy": 5.6327300548553465, "epoch": 1.7470920054464112, "grad_norm": 1.0625, "learning_rate": 0.0004692971775679475, "loss": 4.9843, "mean_token_accuracy": 0.2004704847931862, "num_tokens": 38968308.0, "step": 22455 }, { "entropy": 5.784936761856079, "epoch": 1.7474810348181289, "grad_norm": 1.1796875, "learning_rate": 0.00046928319981068154, "loss": 5.1239, "mean_token_accuracy": 0.19116262793540956, "num_tokens": 38976409.0, "step": 22460 }, { "entropy": 5.636967039108276, "epoch": 1.7478700641898464, "grad_norm": 1.1640625, "learning_rate": 0.0004692692191054773, "loss": 5.0552, "mean_token_accuracy": 0.19898292571306228, "num_tokens": 38985193.0, "step": 22465 }, { "entropy": 5.633849000930786, "epoch": 1.7482590935615638, "grad_norm": 1.0859375, "learning_rate": 0.0004692552354525468, "loss": 5.0477, "mean_token_accuracy": 0.20176565051078796, "num_tokens": 38994141.0, "step": 22470 }, { "entropy": 5.696846437454224, "epoch": 1.7486481229332815, "grad_norm": 1.1015625, "learning_rate": 0.0004692412488521023, "loss": 5.1808, "mean_token_accuracy": 0.19120857119560242, "num_tokens": 39002953.0, "step": 22475 }, { "entropy": 5.722127914428711, "epoch": 1.749037152304999, "grad_norm": 1.296875, "learning_rate": 0.000469227259304356, "loss": 5.0954, "mean_token_accuracy": 0.20289715826511384, "num_tokens": 39010672.0, "step": 22480 }, { "entropy": 5.66537618637085, "epoch": 1.7494261816767165, "grad_norm": 1.1484375, "learning_rate": 0.00046921326680952023, "loss": 5.1277, "mean_token_accuracy": 0.1905087947845459, "num_tokens": 39019677.0, "step": 22485 }, { "entropy": 5.680766582489014, "epoch": 1.7498152110484342, "grad_norm": 1.15625, "learning_rate": 0.0004691992713678072, "loss": 5.0727, "mean_token_accuracy": 0.1929251730442047, "num_tokens": 39028165.0, "step": 22490 }, { "entropy": 5.621655464172363, "epoch": 1.7502042404201519, "grad_norm": 1.1015625, "learning_rate": 0.0004691852729794293, "loss": 5.0054, "mean_token_accuracy": 0.19845127910375596, "num_tokens": 39037537.0, "step": 22495 }, { "entropy": 5.6673445224761965, "epoch": 1.7505932697918691, "grad_norm": 1.1015625, "learning_rate": 0.0004691712716445991, "loss": 5.035, "mean_token_accuracy": 0.19844138622283936, "num_tokens": 39045861.0, "step": 22500 }, { "entropy": 5.709296083450317, "epoch": 1.7509822991635868, "grad_norm": 1.03125, "learning_rate": 0.0004691572673635288, "loss": 5.0493, "mean_token_accuracy": 0.19929910451173782, "num_tokens": 39054526.0, "step": 22505 }, { "entropy": 5.66934986114502, "epoch": 1.7513713285353045, "grad_norm": 1.09375, "learning_rate": 0.000469143260136431, "loss": 5.063, "mean_token_accuracy": 0.19108586758375168, "num_tokens": 39063296.0, "step": 22510 }, { "entropy": 5.674559259414673, "epoch": 1.751760357907022, "grad_norm": 1.1796875, "learning_rate": 0.0004691292499635183, "loss": 4.9905, "mean_token_accuracy": 0.19899203181266784, "num_tokens": 39071570.0, "step": 22515 }, { "entropy": 5.643053960800171, "epoch": 1.7521493872787395, "grad_norm": 1.078125, "learning_rate": 0.0004691152368450032, "loss": 5.0791, "mean_token_accuracy": 0.19975041300058366, "num_tokens": 39080798.0, "step": 22520 }, { "entropy": 5.658553981781006, "epoch": 1.7525384166504572, "grad_norm": 1.21875, "learning_rate": 0.00046910122078109835, "loss": 5.0581, "mean_token_accuracy": 0.19790079891681672, "num_tokens": 39089572.0, "step": 22525 }, { "entropy": 5.7552674293518065, "epoch": 1.7529274460221747, "grad_norm": 1.171875, "learning_rate": 0.0004690872017720163, "loss": 5.1612, "mean_token_accuracy": 0.19588136970996856, "num_tokens": 39098391.0, "step": 22530 }, { "entropy": 5.6929107189178465, "epoch": 1.7533164753938921, "grad_norm": 1.1484375, "learning_rate": 0.00046907317981797006, "loss": 5.1215, "mean_token_accuracy": 0.1927901938557625, "num_tokens": 39106892.0, "step": 22535 }, { "entropy": 5.680017471313477, "epoch": 1.7537055047656098, "grad_norm": 1.171875, "learning_rate": 0.00046905915491917213, "loss": 5.0546, "mean_token_accuracy": 0.19367746710777284, "num_tokens": 39115635.0, "step": 22540 }, { "entropy": 5.704803323745727, "epoch": 1.7540945341373275, "grad_norm": 1.125, "learning_rate": 0.0004690451270758354, "loss": 5.0492, "mean_token_accuracy": 0.19545793235301973, "num_tokens": 39123665.0, "step": 22545 }, { "entropy": 5.704788017272949, "epoch": 1.7544835635090448, "grad_norm": 1.1015625, "learning_rate": 0.00046903109628817276, "loss": 5.1127, "mean_token_accuracy": 0.19106509834527968, "num_tokens": 39132727.0, "step": 22550 }, { "entropy": 5.669383955001831, "epoch": 1.7548725928807625, "grad_norm": 1.1796875, "learning_rate": 0.00046901706255639703, "loss": 5.0842, "mean_token_accuracy": 0.1927453249692917, "num_tokens": 39140814.0, "step": 22555 }, { "entropy": 5.762030696868896, "epoch": 1.7552616222524802, "grad_norm": 1.1328125, "learning_rate": 0.0004690030258807212, "loss": 5.1575, "mean_token_accuracy": 0.18692436665296555, "num_tokens": 39149877.0, "step": 22560 }, { "entropy": 5.675040626525879, "epoch": 1.7556506516241976, "grad_norm": 1.109375, "learning_rate": 0.00046898898626135827, "loss": 5.0909, "mean_token_accuracy": 0.19413626044988633, "num_tokens": 39158698.0, "step": 22565 }, { "entropy": 5.603366994857788, "epoch": 1.7560396809959151, "grad_norm": 1.1328125, "learning_rate": 0.0004689749436985211, "loss": 5.003, "mean_token_accuracy": 0.20513325482606887, "num_tokens": 39167546.0, "step": 22570 }, { "entropy": 5.669141006469727, "epoch": 1.7564287103676328, "grad_norm": 1.1953125, "learning_rate": 0.00046896089819242304, "loss": 5.0588, "mean_token_accuracy": 0.1938392236828804, "num_tokens": 39176547.0, "step": 22575 }, { "entropy": 5.745855236053467, "epoch": 1.7568177397393503, "grad_norm": 1.1640625, "learning_rate": 0.0004689468497432771, "loss": 5.0725, "mean_token_accuracy": 0.198039710521698, "num_tokens": 39185273.0, "step": 22580 }, { "entropy": 5.703879451751709, "epoch": 1.7572067691110678, "grad_norm": 1.1171875, "learning_rate": 0.0004689327983512963, "loss": 5.0321, "mean_token_accuracy": 0.20252016484737395, "num_tokens": 39194204.0, "step": 22585 }, { "entropy": 5.667798328399658, "epoch": 1.7575957984827855, "grad_norm": 1.1796875, "learning_rate": 0.00046891874401669404, "loss": 4.9768, "mean_token_accuracy": 0.20301975756883622, "num_tokens": 39202951.0, "step": 22590 }, { "entropy": 5.588111639022827, "epoch": 1.7579848278545032, "grad_norm": 1.171875, "learning_rate": 0.0004689046867396834, "loss": 5.0512, "mean_token_accuracy": 0.19673458784818648, "num_tokens": 39211508.0, "step": 22595 }, { "entropy": 5.7373357772827145, "epoch": 1.7583738572262204, "grad_norm": 1.109375, "learning_rate": 0.0004688906265204779, "loss": 5.113, "mean_token_accuracy": 0.19004614800214767, "num_tokens": 39219804.0, "step": 22600 }, { "entropy": 5.753034400939941, "epoch": 1.7587628865979381, "grad_norm": 1.1328125, "learning_rate": 0.0004688765633592907, "loss": 5.142, "mean_token_accuracy": 0.1904366448521614, "num_tokens": 39228204.0, "step": 22605 }, { "entropy": 5.6577208042144775, "epoch": 1.7591519159696558, "grad_norm": 1.203125, "learning_rate": 0.0004688624972563352, "loss": 5.0685, "mean_token_accuracy": 0.19090791046619415, "num_tokens": 39237003.0, "step": 22610 }, { "entropy": 5.621747016906738, "epoch": 1.7595409453413733, "grad_norm": 1.1796875, "learning_rate": 0.0004688484282118249, "loss": 5.0332, "mean_token_accuracy": 0.19215899407863618, "num_tokens": 39245636.0, "step": 22615 }, { "entropy": 5.5834471702575685, "epoch": 1.7599299747130908, "grad_norm": 1.1171875, "learning_rate": 0.0004688343562259732, "loss": 4.9189, "mean_token_accuracy": 0.2004231721162796, "num_tokens": 39254288.0, "step": 22620 }, { "entropy": 5.679382562637329, "epoch": 1.7603190040848085, "grad_norm": 1.125, "learning_rate": 0.0004688202812989937, "loss": 5.1094, "mean_token_accuracy": 0.1992802456021309, "num_tokens": 39263217.0, "step": 22625 }, { "entropy": 5.604801511764526, "epoch": 1.760708033456526, "grad_norm": 1.1796875, "learning_rate": 0.0004688062034311, "loss": 5.0664, "mean_token_accuracy": 0.19958146810531616, "num_tokens": 39271240.0, "step": 22630 }, { "entropy": 5.609039688110352, "epoch": 1.7610970628282434, "grad_norm": 1.1796875, "learning_rate": 0.00046879212262250546, "loss": 4.9922, "mean_token_accuracy": 0.20655782222747804, "num_tokens": 39279665.0, "step": 22635 }, { "entropy": 5.699652242660522, "epoch": 1.761486092199961, "grad_norm": 1.0625, "learning_rate": 0.00046877803887342406, "loss": 5.175, "mean_token_accuracy": 0.192455293238163, "num_tokens": 39287975.0, "step": 22640 }, { "entropy": 5.716793346405029, "epoch": 1.7618751215716788, "grad_norm": 1.234375, "learning_rate": 0.0004687639521840693, "loss": 5.1186, "mean_token_accuracy": 0.19389519840478897, "num_tokens": 39296541.0, "step": 22645 }, { "entropy": 5.695902109146118, "epoch": 1.7622641509433963, "grad_norm": 1.140625, "learning_rate": 0.00046874986255465495, "loss": 5.0083, "mean_token_accuracy": 0.20217987298965454, "num_tokens": 39304710.0, "step": 22650 }, { "entropy": 5.657218360900879, "epoch": 1.7626531803151138, "grad_norm": 1.1796875, "learning_rate": 0.00046873576998539485, "loss": 4.9624, "mean_token_accuracy": 0.20321538746356965, "num_tokens": 39313236.0, "step": 22655 }, { "entropy": 5.607696008682251, "epoch": 1.7630422096868315, "grad_norm": 1.125, "learning_rate": 0.0004687216744765028, "loss": 4.9099, "mean_token_accuracy": 0.20135416239500045, "num_tokens": 39322656.0, "step": 22660 }, { "entropy": 5.656253337860107, "epoch": 1.763431239058549, "grad_norm": 1.1328125, "learning_rate": 0.0004687075760281927, "loss": 4.9794, "mean_token_accuracy": 0.2120069906115532, "num_tokens": 39331074.0, "step": 22665 }, { "entropy": 5.643962144851685, "epoch": 1.7638202684302664, "grad_norm": 1.2421875, "learning_rate": 0.0004686934746406784, "loss": 5.0419, "mean_token_accuracy": 0.1975744664669037, "num_tokens": 39339450.0, "step": 22670 }, { "entropy": 5.678130435943603, "epoch": 1.764209297801984, "grad_norm": 1.2109375, "learning_rate": 0.00046867937031417397, "loss": 5.1565, "mean_token_accuracy": 0.19002707600593566, "num_tokens": 39347270.0, "step": 22675 }, { "entropy": 5.656103849411011, "epoch": 1.7645983271737016, "grad_norm": 1.171875, "learning_rate": 0.0004686652630488933, "loss": 5.0679, "mean_token_accuracy": 0.1878320664167404, "num_tokens": 39355853.0, "step": 22680 }, { "entropy": 5.580417728424072, "epoch": 1.764987356545419, "grad_norm": 1.1015625, "learning_rate": 0.00046865115284505063, "loss": 4.9699, "mean_token_accuracy": 0.20845221728086472, "num_tokens": 39364160.0, "step": 22685 }, { "entropy": 5.622933101654053, "epoch": 1.7653763859171367, "grad_norm": 1.1328125, "learning_rate": 0.00046863703970285986, "loss": 5.0646, "mean_token_accuracy": 0.19981067329645158, "num_tokens": 39372504.0, "step": 22690 }, { "entropy": 5.663434171676636, "epoch": 1.7657654152888544, "grad_norm": 1.125, "learning_rate": 0.0004686229236225352, "loss": 5.056, "mean_token_accuracy": 0.2035764843225479, "num_tokens": 39380883.0, "step": 22695 }, { "entropy": 5.7430390357971195, "epoch": 1.766154444660572, "grad_norm": 1.2109375, "learning_rate": 0.0004686088046042909, "loss": 5.1099, "mean_token_accuracy": 0.1917836457490921, "num_tokens": 39389943.0, "step": 22700 }, { "entropy": 5.596102619171143, "epoch": 1.7665434740322894, "grad_norm": 1.0859375, "learning_rate": 0.00046859468264834114, "loss": 5.0603, "mean_token_accuracy": 0.20420622676610947, "num_tokens": 39398919.0, "step": 22705 }, { "entropy": 5.67539701461792, "epoch": 1.766932503404007, "grad_norm": 1.203125, "learning_rate": 0.00046858055775490017, "loss": 5.1429, "mean_token_accuracy": 0.1941673770546913, "num_tokens": 39407547.0, "step": 22710 }, { "entropy": 5.648145771026611, "epoch": 1.7673215327757246, "grad_norm": 1.109375, "learning_rate": 0.0004685664299241825, "loss": 4.9771, "mean_token_accuracy": 0.20077628642320633, "num_tokens": 39416264.0, "step": 22715 }, { "entropy": 5.62908411026001, "epoch": 1.767710562147442, "grad_norm": 1.1796875, "learning_rate": 0.0004685522991564022, "loss": 5.0399, "mean_token_accuracy": 0.19342577159404756, "num_tokens": 39424104.0, "step": 22720 }, { "entropy": 5.693596601486206, "epoch": 1.7680995915191597, "grad_norm": 1.109375, "learning_rate": 0.0004685381654517738, "loss": 5.0853, "mean_token_accuracy": 0.19596892595291138, "num_tokens": 39432443.0, "step": 22725 }, { "entropy": 5.620149850845337, "epoch": 1.7684886208908772, "grad_norm": 1.0546875, "learning_rate": 0.0004685240288105119, "loss": 5.0557, "mean_token_accuracy": 0.19603675305843354, "num_tokens": 39441620.0, "step": 22730 }, { "entropy": 5.628264617919922, "epoch": 1.7688776502625947, "grad_norm": 1.2109375, "learning_rate": 0.00046850988923283085, "loss": 5.0249, "mean_token_accuracy": 0.2046712026000023, "num_tokens": 39449854.0, "step": 22735 }, { "entropy": 5.644801044464112, "epoch": 1.7692666796343124, "grad_norm": 1.1484375, "learning_rate": 0.00046849574671894523, "loss": 5.0969, "mean_token_accuracy": 0.19389274567365647, "num_tokens": 39458496.0, "step": 22740 }, { "entropy": 5.695472192764282, "epoch": 1.76965570900603, "grad_norm": 1.1640625, "learning_rate": 0.00046848160126906956, "loss": 5.1113, "mean_token_accuracy": 0.19473907947540284, "num_tokens": 39466545.0, "step": 22745 }, { "entropy": 5.68575439453125, "epoch": 1.7700447383777476, "grad_norm": 1.15625, "learning_rate": 0.0004684674528834186, "loss": 5.0967, "mean_token_accuracy": 0.19515854269266128, "num_tokens": 39475771.0, "step": 22750 }, { "entropy": 5.6835036277771, "epoch": 1.770433767749465, "grad_norm": 1.21875, "learning_rate": 0.00046845330156220703, "loss": 5.1075, "mean_token_accuracy": 0.19743928909301758, "num_tokens": 39484244.0, "step": 22755 }, { "entropy": 5.718806219100952, "epoch": 1.7708227971211827, "grad_norm": 1.140625, "learning_rate": 0.0004684391473056495, "loss": 5.1383, "mean_token_accuracy": 0.19019536375999452, "num_tokens": 39493138.0, "step": 22760 }, { "entropy": 5.737482309341431, "epoch": 1.7712118264929002, "grad_norm": 1.1328125, "learning_rate": 0.00046842499011396076, "loss": 5.0948, "mean_token_accuracy": 0.1941129133105278, "num_tokens": 39502065.0, "step": 22765 }, { "entropy": 5.697163152694702, "epoch": 1.7716008558646177, "grad_norm": 1.1953125, "learning_rate": 0.00046841082998735575, "loss": 5.0726, "mean_token_accuracy": 0.20459358245134354, "num_tokens": 39510095.0, "step": 22770 }, { "entropy": 5.635035753250122, "epoch": 1.7719898852363354, "grad_norm": 1.2265625, "learning_rate": 0.00046839666692604916, "loss": 5.1274, "mean_token_accuracy": 0.19442155808210373, "num_tokens": 39518104.0, "step": 22775 }, { "entropy": 5.716279029846191, "epoch": 1.7723789146080529, "grad_norm": 1.5, "learning_rate": 0.000468382500930256, "loss": 5.086, "mean_token_accuracy": 0.1993977263569832, "num_tokens": 39526768.0, "step": 22780 }, { "entropy": 5.673862409591675, "epoch": 1.7727679439797703, "grad_norm": 1.1328125, "learning_rate": 0.00046836833200019116, "loss": 5.0487, "mean_token_accuracy": 0.19186717867851258, "num_tokens": 39535847.0, "step": 22785 }, { "entropy": 5.734010219573975, "epoch": 1.773156973351488, "grad_norm": 1.09375, "learning_rate": 0.0004683541601360697, "loss": 5.1132, "mean_token_accuracy": 0.20216183960437775, "num_tokens": 39544364.0, "step": 22790 }, { "entropy": 5.702363157272339, "epoch": 1.7735460027232057, "grad_norm": 1.0859375, "learning_rate": 0.00046833998533810653, "loss": 5.1274, "mean_token_accuracy": 0.18689947426319123, "num_tokens": 39552733.0, "step": 22795 }, { "entropy": 5.695834112167359, "epoch": 1.7739350320949232, "grad_norm": 1.1484375, "learning_rate": 0.0004683258076065169, "loss": 5.0619, "mean_token_accuracy": 0.19932250082492828, "num_tokens": 39561580.0, "step": 22800 }, { "entropy": 5.625617504119873, "epoch": 1.7743240614666407, "grad_norm": 1.078125, "learning_rate": 0.00046831162694151586, "loss": 5.0517, "mean_token_accuracy": 0.19228088706731797, "num_tokens": 39570283.0, "step": 22805 }, { "entropy": 5.668644189834595, "epoch": 1.7747130908383584, "grad_norm": 1.203125, "learning_rate": 0.00046829744334331855, "loss": 5.0251, "mean_token_accuracy": 0.19798846840858458, "num_tokens": 39578835.0, "step": 22810 }, { "entropy": 5.684339761734009, "epoch": 1.7751021202100759, "grad_norm": 1.1484375, "learning_rate": 0.00046828325681214013, "loss": 5.0779, "mean_token_accuracy": 0.20166678726673126, "num_tokens": 39587053.0, "step": 22815 }, { "entropy": 5.676909780502319, "epoch": 1.7754911495817933, "grad_norm": 1.2421875, "learning_rate": 0.000468269067348196, "loss": 5.1579, "mean_token_accuracy": 0.18229772597551347, "num_tokens": 39595799.0, "step": 22820 }, { "entropy": 5.707350969314575, "epoch": 1.775880178953511, "grad_norm": 1.0859375, "learning_rate": 0.0004682548749517014, "loss": 5.0331, "mean_token_accuracy": 0.1991925686597824, "num_tokens": 39604248.0, "step": 22825 }, { "entropy": 5.624576568603516, "epoch": 1.7762692083252287, "grad_norm": 1.078125, "learning_rate": 0.00046824067962287163, "loss": 5.0319, "mean_token_accuracy": 0.19990004897117614, "num_tokens": 39612690.0, "step": 22830 }, { "entropy": 5.666665887832641, "epoch": 1.776658237696946, "grad_norm": 1.0234375, "learning_rate": 0.0004682264813619221, "loss": 5.0725, "mean_token_accuracy": 0.19386529922485352, "num_tokens": 39621784.0, "step": 22835 }, { "entropy": 5.658817148208618, "epoch": 1.7770472670686637, "grad_norm": 1.296875, "learning_rate": 0.00046821228016906836, "loss": 5.0013, "mean_token_accuracy": 0.2040756016969681, "num_tokens": 39630455.0, "step": 22840 }, { "entropy": 5.635995864868164, "epoch": 1.7774362964403814, "grad_norm": 1.21875, "learning_rate": 0.0004681980760445257, "loss": 5.0147, "mean_token_accuracy": 0.19693631827831268, "num_tokens": 39639017.0, "step": 22845 }, { "entropy": 5.642162275314331, "epoch": 1.7778253258120988, "grad_norm": 1.1875, "learning_rate": 0.0004681838689885098, "loss": 4.9665, "mean_token_accuracy": 0.2065414234995842, "num_tokens": 39648083.0, "step": 22850 }, { "entropy": 5.661451816558838, "epoch": 1.7782143551838163, "grad_norm": 1.15625, "learning_rate": 0.0004681696590012362, "loss": 5.0582, "mean_token_accuracy": 0.20174534022808074, "num_tokens": 39656887.0, "step": 22855 }, { "entropy": 5.6726624965667725, "epoch": 1.778603384555534, "grad_norm": 1.2578125, "learning_rate": 0.00046815544608292043, "loss": 5.089, "mean_token_accuracy": 0.1949265718460083, "num_tokens": 39665658.0, "step": 22860 }, { "entropy": 5.6686193466186525, "epoch": 1.7789924139272515, "grad_norm": 1.2109375, "learning_rate": 0.0004681412302337782, "loss": 5.0508, "mean_token_accuracy": 0.19710324704647064, "num_tokens": 39673423.0, "step": 22865 }, { "entropy": 5.691291570663452, "epoch": 1.779381443298969, "grad_norm": 1.265625, "learning_rate": 0.0004681270114540252, "loss": 5.0719, "mean_token_accuracy": 0.20220151543617249, "num_tokens": 39682382.0, "step": 22870 }, { "entropy": 5.700251150131225, "epoch": 1.7797704726706867, "grad_norm": 1.1796875, "learning_rate": 0.0004681127897438772, "loss": 5.1107, "mean_token_accuracy": 0.19690333157777787, "num_tokens": 39691089.0, "step": 22875 }, { "entropy": 5.729765319824219, "epoch": 1.7801595020424044, "grad_norm": 1.03125, "learning_rate": 0.00046809856510355007, "loss": 5.1577, "mean_token_accuracy": 0.19188273549079896, "num_tokens": 39700888.0, "step": 22880 }, { "entropy": 5.723038196563721, "epoch": 1.7805485314141216, "grad_norm": 1.1953125, "learning_rate": 0.0004680843375332595, "loss": 5.1142, "mean_token_accuracy": 0.20196729749441147, "num_tokens": 39708515.0, "step": 22885 }, { "entropy": 5.619906806945801, "epoch": 1.7809375607858393, "grad_norm": 1.140625, "learning_rate": 0.00046807010703322143, "loss": 4.9656, "mean_token_accuracy": 0.2009779006242752, "num_tokens": 39716790.0, "step": 22890 }, { "entropy": 5.72461314201355, "epoch": 1.781326590157557, "grad_norm": 1.046875, "learning_rate": 0.0004680558736036518, "loss": 5.0329, "mean_token_accuracy": 0.19692874401807786, "num_tokens": 39726292.0, "step": 22895 }, { "entropy": 5.641946840286255, "epoch": 1.7817156195292745, "grad_norm": 1.203125, "learning_rate": 0.0004680416372447666, "loss": 5.0403, "mean_token_accuracy": 0.20342497080564498, "num_tokens": 39735222.0, "step": 22900 }, { "entropy": 5.627364683151245, "epoch": 1.782104648900992, "grad_norm": 1.1640625, "learning_rate": 0.00046802739795678177, "loss": 5.0891, "mean_token_accuracy": 0.1946094438433647, "num_tokens": 39744619.0, "step": 22905 }, { "entropy": 5.673235034942627, "epoch": 1.7824936782727097, "grad_norm": 1.21875, "learning_rate": 0.00046801315573991346, "loss": 5.0901, "mean_token_accuracy": 0.19993328750133516, "num_tokens": 39752394.0, "step": 22910 }, { "entropy": 5.633034992218017, "epoch": 1.7828827076444271, "grad_norm": 1.1015625, "learning_rate": 0.00046799891059437764, "loss": 4.991, "mean_token_accuracy": 0.20043096244335173, "num_tokens": 39760529.0, "step": 22915 }, { "entropy": 5.720476579666138, "epoch": 1.7832717370161446, "grad_norm": 1.2265625, "learning_rate": 0.00046798466252039056, "loss": 5.1383, "mean_token_accuracy": 0.19344329684972764, "num_tokens": 39768231.0, "step": 22920 }, { "entropy": 5.75451340675354, "epoch": 1.7836607663878623, "grad_norm": 1.09375, "learning_rate": 0.00046797041151816845, "loss": 5.1984, "mean_token_accuracy": 0.19174774885177612, "num_tokens": 39776773.0, "step": 22925 }, { "entropy": 5.7062615871429445, "epoch": 1.78404979575958, "grad_norm": 1.28125, "learning_rate": 0.00046795615758792747, "loss": 5.0567, "mean_token_accuracy": 0.1905716598033905, "num_tokens": 39785248.0, "step": 22930 }, { "entropy": 5.632964611053467, "epoch": 1.7844388251312973, "grad_norm": 1.0625, "learning_rate": 0.0004679419007298839, "loss": 5.0575, "mean_token_accuracy": 0.19742142856121064, "num_tokens": 39794794.0, "step": 22935 }, { "entropy": 5.6968883037567135, "epoch": 1.784827854503015, "grad_norm": 1.046875, "learning_rate": 0.0004679276409442541, "loss": 5.0396, "mean_token_accuracy": 0.1929635375738144, "num_tokens": 39803662.0, "step": 22940 }, { "entropy": 5.7244353771209715, "epoch": 1.7852168838747327, "grad_norm": 1.1640625, "learning_rate": 0.0004679133782312544, "loss": 5.0432, "mean_token_accuracy": 0.19755503684282302, "num_tokens": 39812189.0, "step": 22945 }, { "entropy": 5.679898691177368, "epoch": 1.7856059132464501, "grad_norm": 1.1328125, "learning_rate": 0.0004678991125911013, "loss": 5.0813, "mean_token_accuracy": 0.19720999300479888, "num_tokens": 39820831.0, "step": 22950 }, { "entropy": 5.571303224563598, "epoch": 1.7859949426181676, "grad_norm": 1.1171875, "learning_rate": 0.0004678848440240111, "loss": 4.9429, "mean_token_accuracy": 0.2035401001572609, "num_tokens": 39829380.0, "step": 22955 }, { "entropy": 5.631348943710327, "epoch": 1.7863839719898853, "grad_norm": 1.1953125, "learning_rate": 0.0004678705725302005, "loss": 5.0633, "mean_token_accuracy": 0.20108917355537415, "num_tokens": 39838243.0, "step": 22960 }, { "entropy": 5.689360809326172, "epoch": 1.7867730013616028, "grad_norm": 1.1484375, "learning_rate": 0.0004678562981098859, "loss": 5.0397, "mean_token_accuracy": 0.20027730166912078, "num_tokens": 39846885.0, "step": 22965 }, { "entropy": 5.665248441696167, "epoch": 1.7871620307333203, "grad_norm": 1.21875, "learning_rate": 0.00046784202076328394, "loss": 5.0054, "mean_token_accuracy": 0.20157646387815475, "num_tokens": 39855337.0, "step": 22970 }, { "entropy": 5.590274238586426, "epoch": 1.787551060105038, "grad_norm": 1.1328125, "learning_rate": 0.00046782774049061124, "loss": 5.0752, "mean_token_accuracy": 0.20414217114448546, "num_tokens": 39864606.0, "step": 22975 }, { "entropy": 5.74508376121521, "epoch": 1.7879400894767556, "grad_norm": 1.109375, "learning_rate": 0.0004678134572920845, "loss": 5.0775, "mean_token_accuracy": 0.19494454711675643, "num_tokens": 39872621.0, "step": 22980 }, { "entropy": 5.710721445083618, "epoch": 1.788329118848473, "grad_norm": 1.1640625, "learning_rate": 0.0004677991711679204, "loss": 5.0525, "mean_token_accuracy": 0.20031729489564895, "num_tokens": 39880525.0, "step": 22985 }, { "entropy": 5.645658349990844, "epoch": 1.7887181482201906, "grad_norm": 1.1484375, "learning_rate": 0.00046778488211833585, "loss": 4.9711, "mean_token_accuracy": 0.20704260915517808, "num_tokens": 39889541.0, "step": 22990 }, { "entropy": 5.672270727157593, "epoch": 1.7891071775919083, "grad_norm": 1.15625, "learning_rate": 0.0004677705901435475, "loss": 5.0438, "mean_token_accuracy": 0.1979015737771988, "num_tokens": 39897682.0, "step": 22995 }, { "entropy": 5.703026056289673, "epoch": 1.7894962069636258, "grad_norm": 1.1015625, "learning_rate": 0.0004677562952437723, "loss": 5.0597, "mean_token_accuracy": 0.19432690292596816, "num_tokens": 39906656.0, "step": 23000 }, { "entropy": 5.723121500015258, "epoch": 1.7898852363353432, "grad_norm": 1.140625, "learning_rate": 0.00046774199741922705, "loss": 5.1327, "mean_token_accuracy": 0.19010985791683196, "num_tokens": 39915202.0, "step": 23005 }, { "entropy": 5.621491575241089, "epoch": 1.790274265707061, "grad_norm": 1.0625, "learning_rate": 0.00046772769667012884, "loss": 4.978, "mean_token_accuracy": 0.20201105028390884, "num_tokens": 39923510.0, "step": 23010 }, { "entropy": 5.5676689624786375, "epoch": 1.7906632950787784, "grad_norm": 1.1328125, "learning_rate": 0.0004677133929966946, "loss": 5.0231, "mean_token_accuracy": 0.2080300882458687, "num_tokens": 39932468.0, "step": 23015 }, { "entropy": 5.71773247718811, "epoch": 1.791052324450496, "grad_norm": 1.109375, "learning_rate": 0.00046769908639914134, "loss": 5.1256, "mean_token_accuracy": 0.19488838613033294, "num_tokens": 39942758.0, "step": 23020 }, { "entropy": 5.7325835704803465, "epoch": 1.7914413538222136, "grad_norm": 1.125, "learning_rate": 0.0004676847768776861, "loss": 5.1069, "mean_token_accuracy": 0.19283661395311355, "num_tokens": 39950829.0, "step": 23025 }, { "entropy": 5.620270252227783, "epoch": 1.7918303831939313, "grad_norm": 1.1015625, "learning_rate": 0.0004676704644325462, "loss": 5.0978, "mean_token_accuracy": 0.19478842318058015, "num_tokens": 39960204.0, "step": 23030 }, { "entropy": 5.662912130355835, "epoch": 1.7922194125656488, "grad_norm": 1.15625, "learning_rate": 0.0004676561490639385, "loss": 5.0521, "mean_token_accuracy": 0.19848431050777435, "num_tokens": 39968513.0, "step": 23035 }, { "entropy": 5.654798793792724, "epoch": 1.7926084419373662, "grad_norm": 1.15625, "learning_rate": 0.0004676418307720805, "loss": 5.0886, "mean_token_accuracy": 0.19719878286123277, "num_tokens": 39977181.0, "step": 23040 }, { "entropy": 5.558326864242554, "epoch": 1.792997471309084, "grad_norm": 1.1484375, "learning_rate": 0.0004676275095571892, "loss": 4.9012, "mean_token_accuracy": 0.2106527015566826, "num_tokens": 39986760.0, "step": 23045 }, { "entropy": 5.6533793926239015, "epoch": 1.7933865006808014, "grad_norm": 1.1328125, "learning_rate": 0.00046761318541948215, "loss": 5.1154, "mean_token_accuracy": 0.18526081889867782, "num_tokens": 39995203.0, "step": 23050 }, { "entropy": 5.643955230712891, "epoch": 1.7937755300525189, "grad_norm": 1.1640625, "learning_rate": 0.0004675988583591766, "loss": 4.9996, "mean_token_accuracy": 0.20396423041820527, "num_tokens": 40003526.0, "step": 23055 }, { "entropy": 5.681190490722656, "epoch": 1.7941645594242366, "grad_norm": 1.0625, "learning_rate": 0.00046758452837648997, "loss": 5.0547, "mean_token_accuracy": 0.19564736485481263, "num_tokens": 40012036.0, "step": 23060 }, { "entropy": 5.635527181625366, "epoch": 1.794553588795954, "grad_norm": 1.1953125, "learning_rate": 0.0004675701954716395, "loss": 5.0653, "mean_token_accuracy": 0.19711072444915773, "num_tokens": 40020237.0, "step": 23065 }, { "entropy": 5.611155700683594, "epoch": 1.7949426181676715, "grad_norm": 1.1171875, "learning_rate": 0.00046755585964484286, "loss": 4.9757, "mean_token_accuracy": 0.20652034133672714, "num_tokens": 40028749.0, "step": 23070 }, { "entropy": 5.6394758224487305, "epoch": 1.7953316475393892, "grad_norm": 1.1640625, "learning_rate": 0.0004675415208963177, "loss": 4.9477, "mean_token_accuracy": 0.20087110251188278, "num_tokens": 40036799.0, "step": 23075 }, { "entropy": 5.629435968399048, "epoch": 1.795720676911107, "grad_norm": 1.109375, "learning_rate": 0.00046752717922628125, "loss": 5.0887, "mean_token_accuracy": 0.19493671059608458, "num_tokens": 40045416.0, "step": 23080 }, { "entropy": 5.7006933212280275, "epoch": 1.7961097062828244, "grad_norm": 1.2109375, "learning_rate": 0.0004675128346349514, "loss": 5.1208, "mean_token_accuracy": 0.1985117867588997, "num_tokens": 40054128.0, "step": 23085 }, { "entropy": 5.775534915924072, "epoch": 1.7964987356545419, "grad_norm": 1.1640625, "learning_rate": 0.00046749848712254554, "loss": 5.1354, "mean_token_accuracy": 0.19225320518016814, "num_tokens": 40062765.0, "step": 23090 }, { "entropy": 5.642290782928467, "epoch": 1.7968877650262596, "grad_norm": 1.140625, "learning_rate": 0.00046748413668928164, "loss": 5.0555, "mean_token_accuracy": 0.20141281187534332, "num_tokens": 40071190.0, "step": 23095 }, { "entropy": 5.654160833358764, "epoch": 1.797276794397977, "grad_norm": 1.0390625, "learning_rate": 0.0004674697833353774, "loss": 5.0654, "mean_token_accuracy": 0.1998469427227974, "num_tokens": 40080552.0, "step": 23100 }, { "entropy": 5.67447862625122, "epoch": 1.7976658237696945, "grad_norm": 1.1015625, "learning_rate": 0.00046745542706105045, "loss": 5.0817, "mean_token_accuracy": 0.20118483752012253, "num_tokens": 40089407.0, "step": 23105 }, { "entropy": 5.794737243652344, "epoch": 1.7980548531414122, "grad_norm": 1.28125, "learning_rate": 0.00046744106786651875, "loss": 5.2701, "mean_token_accuracy": 0.18606453239917756, "num_tokens": 40097946.0, "step": 23110 }, { "entropy": 5.655776882171631, "epoch": 1.7984438825131297, "grad_norm": 1.171875, "learning_rate": 0.0004674267057520001, "loss": 5.0128, "mean_token_accuracy": 0.20463781356811522, "num_tokens": 40105901.0, "step": 23115 }, { "entropy": 5.61436710357666, "epoch": 1.7988329118848472, "grad_norm": 1.203125, "learning_rate": 0.0004674123407177125, "loss": 4.9325, "mean_token_accuracy": 0.2023484319448471, "num_tokens": 40114481.0, "step": 23120 }, { "entropy": 5.646229028701782, "epoch": 1.7992219412565649, "grad_norm": 1.09375, "learning_rate": 0.00046739797276387394, "loss": 5.0051, "mean_token_accuracy": 0.20337729305028915, "num_tokens": 40123086.0, "step": 23125 }, { "entropy": 5.654345750808716, "epoch": 1.7996109706282826, "grad_norm": 1.125, "learning_rate": 0.00046738360189070235, "loss": 5.0062, "mean_token_accuracy": 0.20031450390815736, "num_tokens": 40131497.0, "step": 23130 }, { "entropy": 5.619352340698242, "epoch": 1.8, "grad_norm": 1.1875, "learning_rate": 0.0004673692280984157, "loss": 5.0442, "mean_token_accuracy": 0.19908270388841628, "num_tokens": 40139632.0, "step": 23135 }, { "entropy": 5.62560658454895, "epoch": 1.8003890293717175, "grad_norm": 1.078125, "learning_rate": 0.0004673548513872324, "loss": 5.0156, "mean_token_accuracy": 0.2011853873729706, "num_tokens": 40148312.0, "step": 23140 }, { "entropy": 5.677383899688721, "epoch": 1.8007780587434352, "grad_norm": 1.1484375, "learning_rate": 0.00046734047175737026, "loss": 5.089, "mean_token_accuracy": 0.1920654758810997, "num_tokens": 40156750.0, "step": 23145 }, { "entropy": 5.630202770233154, "epoch": 1.8011670881151527, "grad_norm": 1.15625, "learning_rate": 0.00046732608920904754, "loss": 5.0582, "mean_token_accuracy": 0.19776277244091034, "num_tokens": 40165334.0, "step": 23150 }, { "entropy": 5.642322587966919, "epoch": 1.8015561174868702, "grad_norm": 1.1171875, "learning_rate": 0.0004673117037424827, "loss": 5.0427, "mean_token_accuracy": 0.20004768669605255, "num_tokens": 40174217.0, "step": 23155 }, { "entropy": 5.602140998840332, "epoch": 1.8019451468585879, "grad_norm": 1.234375, "learning_rate": 0.00046729731535789375, "loss": 5.012, "mean_token_accuracy": 0.20319269448518754, "num_tokens": 40182889.0, "step": 23160 }, { "entropy": 5.66202449798584, "epoch": 1.8023341762303053, "grad_norm": 1.15625, "learning_rate": 0.00046728292405549913, "loss": 5.069, "mean_token_accuracy": 0.19812913239002228, "num_tokens": 40191428.0, "step": 23165 }, { "entropy": 5.659556674957275, "epoch": 1.8027232056020228, "grad_norm": 1.1640625, "learning_rate": 0.0004672685298355172, "loss": 5.0341, "mean_token_accuracy": 0.20688219219446183, "num_tokens": 40200204.0, "step": 23170 }, { "entropy": 5.641662454605102, "epoch": 1.8031122349737405, "grad_norm": 1.1640625, "learning_rate": 0.0004672541326981664, "loss": 4.9308, "mean_token_accuracy": 0.21110827773809432, "num_tokens": 40208326.0, "step": 23175 }, { "entropy": 5.569920396804809, "epoch": 1.8035012643454582, "grad_norm": 1.0703125, "learning_rate": 0.000467239732643665, "loss": 5.0495, "mean_token_accuracy": 0.20019952654838563, "num_tokens": 40217300.0, "step": 23180 }, { "entropy": 5.642634057998658, "epoch": 1.8038902937171757, "grad_norm": 1.15625, "learning_rate": 0.00046722532967223183, "loss": 5.1421, "mean_token_accuracy": 0.19416471868753432, "num_tokens": 40226695.0, "step": 23185 }, { "entropy": 5.692462491989136, "epoch": 1.8042793230888932, "grad_norm": 1.125, "learning_rate": 0.0004672109237840851, "loss": 5.0292, "mean_token_accuracy": 0.19761148393154143, "num_tokens": 40235286.0, "step": 23190 }, { "entropy": 5.609381532669067, "epoch": 1.8046683524606109, "grad_norm": 1.1171875, "learning_rate": 0.00046719651497944355, "loss": 4.9935, "mean_token_accuracy": 0.20100178122520446, "num_tokens": 40244065.0, "step": 23195 }, { "entropy": 5.70858244895935, "epoch": 1.8050573818323283, "grad_norm": 1.1640625, "learning_rate": 0.0004671821032585259, "loss": 5.1978, "mean_token_accuracy": 0.18573150485754014, "num_tokens": 40253058.0, "step": 23200 }, { "entropy": 5.712513828277588, "epoch": 1.8054464112040458, "grad_norm": 1.265625, "learning_rate": 0.0004671676886215506, "loss": 5.0845, "mean_token_accuracy": 0.19421554058790208, "num_tokens": 40261797.0, "step": 23205 }, { "entropy": 5.646021223068237, "epoch": 1.8058354405757635, "grad_norm": 1.171875, "learning_rate": 0.0004671532710687365, "loss": 5.0395, "mean_token_accuracy": 0.20096675753593446, "num_tokens": 40270003.0, "step": 23210 }, { "entropy": 5.638779211044311, "epoch": 1.806224469947481, "grad_norm": 1.1875, "learning_rate": 0.0004671388506003024, "loss": 5.0679, "mean_token_accuracy": 0.19866203665733337, "num_tokens": 40278241.0, "step": 23215 }, { "entropy": 5.677653694152832, "epoch": 1.8066134993191985, "grad_norm": 1.25, "learning_rate": 0.0004671244272164671, "loss": 5.1198, "mean_token_accuracy": 0.19523296654224395, "num_tokens": 40286316.0, "step": 23220 }, { "entropy": 5.667910099029541, "epoch": 1.8070025286909162, "grad_norm": 1.078125, "learning_rate": 0.00046711000091744935, "loss": 5.0748, "mean_token_accuracy": 0.19464613497257233, "num_tokens": 40295378.0, "step": 23225 }, { "entropy": 5.717720699310303, "epoch": 1.8073915580626339, "grad_norm": 1.078125, "learning_rate": 0.0004670955717034681, "loss": 5.0814, "mean_token_accuracy": 0.19408326596021652, "num_tokens": 40305379.0, "step": 23230 }, { "entropy": 5.710579967498779, "epoch": 1.8077805874343513, "grad_norm": 1.1796875, "learning_rate": 0.00046708113957474233, "loss": 5.1186, "mean_token_accuracy": 0.1927325263619423, "num_tokens": 40314174.0, "step": 23235 }, { "entropy": 5.71313853263855, "epoch": 1.8081696168060688, "grad_norm": 1.1328125, "learning_rate": 0.000467066704531491, "loss": 5.1042, "mean_token_accuracy": 0.20000478625297546, "num_tokens": 40323708.0, "step": 23240 }, { "entropy": 5.647215175628662, "epoch": 1.8085586461777865, "grad_norm": 1.125, "learning_rate": 0.0004670522665739332, "loss": 5.0004, "mean_token_accuracy": 0.20029812306165695, "num_tokens": 40333664.0, "step": 23245 }, { "entropy": 5.663864660263061, "epoch": 1.808947675549504, "grad_norm": 1.1328125, "learning_rate": 0.0004670378257022878, "loss": 5.0542, "mean_token_accuracy": 0.20027079284191132, "num_tokens": 40342037.0, "step": 23250 }, { "entropy": 5.657285118103028, "epoch": 1.8093367049212215, "grad_norm": 1.078125, "learning_rate": 0.00046702338191677414, "loss": 4.9995, "mean_token_accuracy": 0.20434896498918534, "num_tokens": 40350472.0, "step": 23255 }, { "entropy": 5.667795658111572, "epoch": 1.8097257342929391, "grad_norm": 1.1796875, "learning_rate": 0.0004670089352176113, "loss": 5.0727, "mean_token_accuracy": 0.19985506683588028, "num_tokens": 40358829.0, "step": 23260 }, { "entropy": 5.629911088943482, "epoch": 1.8101147636646568, "grad_norm": 1.1328125, "learning_rate": 0.00046699448560501847, "loss": 5.0737, "mean_token_accuracy": 0.19637651294469832, "num_tokens": 40367414.0, "step": 23265 }, { "entropy": 5.667527914047241, "epoch": 1.810503793036374, "grad_norm": 1.203125, "learning_rate": 0.0004669800330792149, "loss": 5.1191, "mean_token_accuracy": 0.1909766376018524, "num_tokens": 40375969.0, "step": 23270 }, { "entropy": 5.722210788726807, "epoch": 1.8108928224080918, "grad_norm": 1.125, "learning_rate": 0.00046696557764041994, "loss": 5.0594, "mean_token_accuracy": 0.19282193928956987, "num_tokens": 40384200.0, "step": 23275 }, { "entropy": 5.741775274276733, "epoch": 1.8112818517798095, "grad_norm": 1.078125, "learning_rate": 0.0004669511192888528, "loss": 5.1682, "mean_token_accuracy": 0.19382085800170898, "num_tokens": 40392891.0, "step": 23280 }, { "entropy": 5.717968320846557, "epoch": 1.811670881151527, "grad_norm": 1.09375, "learning_rate": 0.00046693665802473294, "loss": 5.1208, "mean_token_accuracy": 0.19663182497024537, "num_tokens": 40402009.0, "step": 23285 }, { "entropy": 5.72480263710022, "epoch": 1.8120599105232444, "grad_norm": 1.1875, "learning_rate": 0.00046692219384827986, "loss": 5.1051, "mean_token_accuracy": 0.1851302906870842, "num_tokens": 40410756.0, "step": 23290 }, { "entropy": 5.706399059295654, "epoch": 1.8124489398949621, "grad_norm": 1.0546875, "learning_rate": 0.0004669077267597129, "loss": 5.1325, "mean_token_accuracy": 0.19384849965572357, "num_tokens": 40420087.0, "step": 23295 }, { "entropy": 5.619845056533814, "epoch": 1.8128379692666796, "grad_norm": 1.2734375, "learning_rate": 0.00046689325675925174, "loss": 4.9897, "mean_token_accuracy": 0.20281611680984496, "num_tokens": 40428741.0, "step": 23300 }, { "entropy": 5.759622097015381, "epoch": 1.813226998638397, "grad_norm": 1.09375, "learning_rate": 0.00046687878384711574, "loss": 5.198, "mean_token_accuracy": 0.18550204932689668, "num_tokens": 40438128.0, "step": 23305 }, { "entropy": 5.712845325469971, "epoch": 1.8136160280101148, "grad_norm": 1.1015625, "learning_rate": 0.00046686430802352476, "loss": 5.1376, "mean_token_accuracy": 0.19512750059366227, "num_tokens": 40446990.0, "step": 23310 }, { "entropy": 5.647995328903198, "epoch": 1.8140050573818325, "grad_norm": 1.1953125, "learning_rate": 0.0004668498292886982, "loss": 5.0422, "mean_token_accuracy": 0.19947749823331834, "num_tokens": 40454627.0, "step": 23315 }, { "entropy": 5.634478950500489, "epoch": 1.8143940867535497, "grad_norm": 1.140625, "learning_rate": 0.00046683534764285577, "loss": 5.0716, "mean_token_accuracy": 0.2054267942905426, "num_tokens": 40463321.0, "step": 23320 }, { "entropy": 5.609573316574097, "epoch": 1.8147831161252674, "grad_norm": 1.140625, "learning_rate": 0.00046682086308621725, "loss": 4.9214, "mean_token_accuracy": 0.2108432486653328, "num_tokens": 40472156.0, "step": 23325 }, { "entropy": 5.643345928192138, "epoch": 1.8151721454969851, "grad_norm": 1.1015625, "learning_rate": 0.0004668063756190026, "loss": 5.0675, "mean_token_accuracy": 0.1969673976302147, "num_tokens": 40480938.0, "step": 23330 }, { "entropy": 5.632159280776977, "epoch": 1.8155611748687026, "grad_norm": 1.0859375, "learning_rate": 0.00046679188524143136, "loss": 5.0114, "mean_token_accuracy": 0.20527398139238356, "num_tokens": 40489740.0, "step": 23335 }, { "entropy": 5.705085706710816, "epoch": 1.81595020424042, "grad_norm": 1.0703125, "learning_rate": 0.0004667773919537235, "loss": 5.0025, "mean_token_accuracy": 0.2028025820851326, "num_tokens": 40498420.0, "step": 23340 }, { "entropy": 5.634736204147339, "epoch": 1.8163392336121378, "grad_norm": 1.1328125, "learning_rate": 0.00046676289575609914, "loss": 4.9234, "mean_token_accuracy": 0.20825934708118438, "num_tokens": 40506634.0, "step": 23345 }, { "entropy": 5.678823232650757, "epoch": 1.8167282629838553, "grad_norm": 1.15625, "learning_rate": 0.00046674839664877796, "loss": 5.1488, "mean_token_accuracy": 0.19508560448884965, "num_tokens": 40515310.0, "step": 23350 }, { "entropy": 5.676866865158081, "epoch": 1.8171172923555727, "grad_norm": 1.1796875, "learning_rate": 0.0004667338946319801, "loss": 5.0091, "mean_token_accuracy": 0.20593808293342591, "num_tokens": 40523739.0, "step": 23355 }, { "entropy": 5.721298503875732, "epoch": 1.8175063217272904, "grad_norm": 1.0859375, "learning_rate": 0.0004667193897059255, "loss": 5.1639, "mean_token_accuracy": 0.19017911404371263, "num_tokens": 40533070.0, "step": 23360 }, { "entropy": 5.731092691421509, "epoch": 1.8178953510990081, "grad_norm": 1.15625, "learning_rate": 0.00046670488187083436, "loss": 5.0058, "mean_token_accuracy": 0.20166377425193788, "num_tokens": 40541975.0, "step": 23365 }, { "entropy": 5.725260829925537, "epoch": 1.8182843804707254, "grad_norm": 1.0546875, "learning_rate": 0.0004666903711269267, "loss": 5.141, "mean_token_accuracy": 0.19650277644395828, "num_tokens": 40550896.0, "step": 23370 }, { "entropy": 5.635598659515381, "epoch": 1.818673409842443, "grad_norm": 1.09375, "learning_rate": 0.0004666758574744228, "loss": 5.1201, "mean_token_accuracy": 0.19900337010622024, "num_tokens": 40559719.0, "step": 23375 }, { "entropy": 5.709807014465332, "epoch": 1.8190624392141608, "grad_norm": 1.1875, "learning_rate": 0.0004666613409135429, "loss": 5.1162, "mean_token_accuracy": 0.19977762550115585, "num_tokens": 40568448.0, "step": 23380 }, { "entropy": 5.785470867156983, "epoch": 1.8194514685858783, "grad_norm": 1.2109375, "learning_rate": 0.0004666468214445072, "loss": 5.1308, "mean_token_accuracy": 0.19481135606765748, "num_tokens": 40576443.0, "step": 23385 }, { "entropy": 5.645090579986572, "epoch": 1.8198404979575957, "grad_norm": 1.109375, "learning_rate": 0.00046663229906753595, "loss": 4.9142, "mean_token_accuracy": 0.21064617484807968, "num_tokens": 40584440.0, "step": 23390 }, { "entropy": 5.655154848098755, "epoch": 1.8202295273293134, "grad_norm": 1.1328125, "learning_rate": 0.00046661777378284965, "loss": 5.172, "mean_token_accuracy": 0.19538187235593796, "num_tokens": 40593696.0, "step": 23395 }, { "entropy": 5.65268874168396, "epoch": 1.820618556701031, "grad_norm": 1.203125, "learning_rate": 0.0004666032455906685, "loss": 5.0023, "mean_token_accuracy": 0.2076433554291725, "num_tokens": 40601368.0, "step": 23400 }, { "entropy": 5.7503540992736815, "epoch": 1.8210075860727484, "grad_norm": 1.2265625, "learning_rate": 0.00046658871449121325, "loss": 5.086, "mean_token_accuracy": 0.2028270110487938, "num_tokens": 40609143.0, "step": 23405 }, { "entropy": 5.696317195892334, "epoch": 1.821396615444466, "grad_norm": 1.125, "learning_rate": 0.0004665741804847041, "loss": 5.0632, "mean_token_accuracy": 0.2003426656126976, "num_tokens": 40617602.0, "step": 23410 }, { "entropy": 5.612908935546875, "epoch": 1.8217856448161838, "grad_norm": 1.2109375, "learning_rate": 0.00046655964357136164, "loss": 4.9612, "mean_token_accuracy": 0.20739205926656723, "num_tokens": 40626412.0, "step": 23415 }, { "entropy": 5.652625846862793, "epoch": 1.822174674187901, "grad_norm": 1.1328125, "learning_rate": 0.00046654510375140657, "loss": 5.0202, "mean_token_accuracy": 0.206109456717968, "num_tokens": 40635095.0, "step": 23420 }, { "entropy": 5.678670167922974, "epoch": 1.8225637035596187, "grad_norm": 1.2265625, "learning_rate": 0.0004665305610250594, "loss": 5.0384, "mean_token_accuracy": 0.20043517649173737, "num_tokens": 40643421.0, "step": 23425 }, { "entropy": 5.647865676879883, "epoch": 1.8229527329313364, "grad_norm": 1.0390625, "learning_rate": 0.0004665160153925408, "loss": 5.0729, "mean_token_accuracy": 0.20355336666107177, "num_tokens": 40652180.0, "step": 23430 }, { "entropy": 5.735098266601563, "epoch": 1.823341762303054, "grad_norm": 1.1484375, "learning_rate": 0.00046650146685407154, "loss": 5.1481, "mean_token_accuracy": 0.18693066388368607, "num_tokens": 40660398.0, "step": 23435 }, { "entropy": 5.714107656478882, "epoch": 1.8237307916747714, "grad_norm": 1.125, "learning_rate": 0.00046648691540987226, "loss": 5.1676, "mean_token_accuracy": 0.1879961296916008, "num_tokens": 40668827.0, "step": 23440 }, { "entropy": 5.688480520248413, "epoch": 1.824119821046489, "grad_norm": 1.234375, "learning_rate": 0.00046647236106016387, "loss": 5.0699, "mean_token_accuracy": 0.1986662283539772, "num_tokens": 40676920.0, "step": 23445 }, { "entropy": 5.670010995864868, "epoch": 1.8245088504182065, "grad_norm": 1.25, "learning_rate": 0.0004664578038051672, "loss": 5.0114, "mean_token_accuracy": 0.20432327389717103, "num_tokens": 40685115.0, "step": 23450 }, { "entropy": 5.676260232925415, "epoch": 1.824897879789924, "grad_norm": 1.2421875, "learning_rate": 0.000466443243645103, "loss": 5.039, "mean_token_accuracy": 0.1987512916326523, "num_tokens": 40693870.0, "step": 23455 }, { "entropy": 5.718591928482056, "epoch": 1.8252869091616417, "grad_norm": 1.0859375, "learning_rate": 0.0004664286805801923, "loss": 5.022, "mean_token_accuracy": 0.194333516061306, "num_tokens": 40703031.0, "step": 23460 }, { "entropy": 5.622937917709351, "epoch": 1.8256759385333594, "grad_norm": 1.15625, "learning_rate": 0.0004664141146106562, "loss": 4.985, "mean_token_accuracy": 0.20394688844680786, "num_tokens": 40711690.0, "step": 23465 }, { "entropy": 5.668556261062622, "epoch": 1.8260649679050769, "grad_norm": 1.171875, "learning_rate": 0.00046639954573671547, "loss": 5.0804, "mean_token_accuracy": 0.1969800263643265, "num_tokens": 40720086.0, "step": 23470 }, { "entropy": 5.764101028442383, "epoch": 1.8264539972767944, "grad_norm": 1.2421875, "learning_rate": 0.00046638497395859127, "loss": 5.1254, "mean_token_accuracy": 0.1944834589958191, "num_tokens": 40728117.0, "step": 23475 }, { "entropy": 5.727489233016968, "epoch": 1.826843026648512, "grad_norm": 1.125, "learning_rate": 0.0004663703992765047, "loss": 5.1156, "mean_token_accuracy": 0.1994257539510727, "num_tokens": 40736761.0, "step": 23480 }, { "entropy": 5.659313726425171, "epoch": 1.8272320560202295, "grad_norm": 1.15625, "learning_rate": 0.00046635582169067693, "loss": 5.0645, "mean_token_accuracy": 0.19522079676389695, "num_tokens": 40745291.0, "step": 23485 }, { "entropy": 5.743591356277466, "epoch": 1.827621085391947, "grad_norm": 1.0625, "learning_rate": 0.00046634124120132915, "loss": 5.0786, "mean_token_accuracy": 0.20272588282823562, "num_tokens": 40754308.0, "step": 23490 }, { "entropy": 5.633688020706177, "epoch": 1.8280101147636647, "grad_norm": 1.1796875, "learning_rate": 0.0004663266578086826, "loss": 4.9807, "mean_token_accuracy": 0.19849610179662705, "num_tokens": 40763046.0, "step": 23495 }, { "entropy": 5.5965883255004885, "epoch": 1.8283991441353822, "grad_norm": 1.2109375, "learning_rate": 0.0004663120715129585, "loss": 5.0297, "mean_token_accuracy": 0.19359540343284606, "num_tokens": 40770912.0, "step": 23500 }, { "entropy": 5.704968357086182, "epoch": 1.8287881735070997, "grad_norm": 1.140625, "learning_rate": 0.0004662974823143783, "loss": 5.1235, "mean_token_accuracy": 0.1852446749806404, "num_tokens": 40779748.0, "step": 23505 }, { "entropy": 5.742366933822632, "epoch": 1.8291772028788174, "grad_norm": 1.1640625, "learning_rate": 0.0004662828902131632, "loss": 5.1075, "mean_token_accuracy": 0.195328725874424, "num_tokens": 40787732.0, "step": 23510 }, { "entropy": 5.6843358993530275, "epoch": 1.829566232250535, "grad_norm": 1.109375, "learning_rate": 0.0004662682952095348, "loss": 5.0101, "mean_token_accuracy": 0.20013401806354522, "num_tokens": 40796521.0, "step": 23515 }, { "entropy": 5.713075876235962, "epoch": 1.8299552616222525, "grad_norm": 1.078125, "learning_rate": 0.00046625369730371436, "loss": 5.1469, "mean_token_accuracy": 0.19386830925941467, "num_tokens": 40805479.0, "step": 23520 }, { "entropy": 5.654767990112305, "epoch": 1.83034429099397, "grad_norm": 1.1953125, "learning_rate": 0.0004662390964959235, "loss": 4.9644, "mean_token_accuracy": 0.20261916816234588, "num_tokens": 40813647.0, "step": 23525 }, { "entropy": 5.60133318901062, "epoch": 1.8307333203656877, "grad_norm": 1.140625, "learning_rate": 0.00046622449278638375, "loss": 4.9544, "mean_token_accuracy": 0.20324818044900894, "num_tokens": 40821753.0, "step": 23530 }, { "entropy": 5.660799503326416, "epoch": 1.8311223497374052, "grad_norm": 1.1640625, "learning_rate": 0.0004662098861753167, "loss": 5.1023, "mean_token_accuracy": 0.20108500570058824, "num_tokens": 40830391.0, "step": 23535 }, { "entropy": 5.656362628936767, "epoch": 1.8315113791091227, "grad_norm": 1.09375, "learning_rate": 0.00046619527666294394, "loss": 5.0444, "mean_token_accuracy": 0.20144785940647125, "num_tokens": 40839372.0, "step": 23540 }, { "entropy": 5.70982518196106, "epoch": 1.8319004084808403, "grad_norm": 1.296875, "learning_rate": 0.0004661806642494872, "loss": 5.1384, "mean_token_accuracy": 0.1974942773580551, "num_tokens": 40847945.0, "step": 23545 }, { "entropy": 5.786671686172485, "epoch": 1.8322894378525578, "grad_norm": 1.0703125, "learning_rate": 0.0004661660489351681, "loss": 5.1726, "mean_token_accuracy": 0.19213981181383133, "num_tokens": 40857600.0, "step": 23550 }, { "entropy": 5.670353746414184, "epoch": 1.8326784672242753, "grad_norm": 1.09375, "learning_rate": 0.0004661514307202086, "loss": 5.0074, "mean_token_accuracy": 0.2023478180170059, "num_tokens": 40866672.0, "step": 23555 }, { "entropy": 5.6903105735778805, "epoch": 1.833067496595993, "grad_norm": 1.2109375, "learning_rate": 0.00046613680960483036, "loss": 5.0503, "mean_token_accuracy": 0.1918072909116745, "num_tokens": 40875240.0, "step": 23560 }, { "entropy": 5.62783727645874, "epoch": 1.8334565259677107, "grad_norm": 1.1484375, "learning_rate": 0.0004661221855892552, "loss": 5.0031, "mean_token_accuracy": 0.19587404429912567, "num_tokens": 40883731.0, "step": 23565 }, { "entropy": 5.625275087356568, "epoch": 1.8338455553394282, "grad_norm": 1.0859375, "learning_rate": 0.00046610755867370506, "loss": 4.9792, "mean_token_accuracy": 0.202235047519207, "num_tokens": 40892572.0, "step": 23570 }, { "entropy": 5.6437853336334225, "epoch": 1.8342345847111456, "grad_norm": 1.15625, "learning_rate": 0.000466092928858402, "loss": 5.0611, "mean_token_accuracy": 0.20040431171655654, "num_tokens": 40901603.0, "step": 23575 }, { "entropy": 5.6633320331573485, "epoch": 1.8346236140828633, "grad_norm": 1.1484375, "learning_rate": 0.00046607829614356787, "loss": 5.0458, "mean_token_accuracy": 0.20046085715293885, "num_tokens": 40910502.0, "step": 23580 }, { "entropy": 5.680140495300293, "epoch": 1.8350126434545808, "grad_norm": 1.0, "learning_rate": 0.0004660636605294247, "loss": 5.0009, "mean_token_accuracy": 0.2056643158197403, "num_tokens": 40919858.0, "step": 23585 }, { "entropy": 5.726168966293335, "epoch": 1.8354016728262983, "grad_norm": 1.1953125, "learning_rate": 0.0004660490220161946, "loss": 5.0369, "mean_token_accuracy": 0.201455157995224, "num_tokens": 40928795.0, "step": 23590 }, { "entropy": 5.6757513046264645, "epoch": 1.835790702198016, "grad_norm": 1.125, "learning_rate": 0.00046603438060409966, "loss": 5.0282, "mean_token_accuracy": 0.20020510405302047, "num_tokens": 40937240.0, "step": 23595 }, { "entropy": 5.668379831314087, "epoch": 1.8361797315697335, "grad_norm": 1.1171875, "learning_rate": 0.000466019736293362, "loss": 5.0757, "mean_token_accuracy": 0.1974781259894371, "num_tokens": 40945974.0, "step": 23600 }, { "entropy": 5.644535923004151, "epoch": 1.836568760941451, "grad_norm": 1.1875, "learning_rate": 0.00046600508908420396, "loss": 4.9809, "mean_token_accuracy": 0.21096906661987305, "num_tokens": 40953553.0, "step": 23605 }, { "entropy": 5.6556085586547855, "epoch": 1.8369577903131686, "grad_norm": 1.2421875, "learning_rate": 0.00046599043897684766, "loss": 5.0216, "mean_token_accuracy": 0.20918246656656264, "num_tokens": 40961287.0, "step": 23610 }, { "entropy": 5.617972469329834, "epoch": 1.8373468196848863, "grad_norm": 1.265625, "learning_rate": 0.0004659757859715155, "loss": 4.9763, "mean_token_accuracy": 0.20169522911310195, "num_tokens": 40970266.0, "step": 23615 }, { "entropy": 5.691685390472412, "epoch": 1.8377358490566038, "grad_norm": 1.1640625, "learning_rate": 0.00046596113006842975, "loss": 5.0141, "mean_token_accuracy": 0.20533781200647355, "num_tokens": 40978303.0, "step": 23620 }, { "entropy": 5.759164428710937, "epoch": 1.8381248784283213, "grad_norm": 1.2265625, "learning_rate": 0.0004659464712678128, "loss": 5.0657, "mean_token_accuracy": 0.1988115653395653, "num_tokens": 40986360.0, "step": 23625 }, { "entropy": 5.641524171829223, "epoch": 1.838513907800039, "grad_norm": 1.15625, "learning_rate": 0.0004659318095698871, "loss": 5.1188, "mean_token_accuracy": 0.19440290480852127, "num_tokens": 40995323.0, "step": 23630 }, { "entropy": 5.668115949630737, "epoch": 1.8389029371717565, "grad_norm": 1.2109375, "learning_rate": 0.000465917144974875, "loss": 5.0173, "mean_token_accuracy": 0.20526110827922822, "num_tokens": 41004032.0, "step": 23635 }, { "entropy": 5.694147968292237, "epoch": 1.839291966543474, "grad_norm": 1.234375, "learning_rate": 0.0004659024774829992, "loss": 5.049, "mean_token_accuracy": 0.19918417781591416, "num_tokens": 41011992.0, "step": 23640 }, { "entropy": 5.699076128005982, "epoch": 1.8396809959151916, "grad_norm": 1.203125, "learning_rate": 0.000465887807094482, "loss": 5.0863, "mean_token_accuracy": 0.1953320950269699, "num_tokens": 41020252.0, "step": 23645 }, { "entropy": 5.683829641342163, "epoch": 1.8400700252869093, "grad_norm": 1.21875, "learning_rate": 0.00046587313380954635, "loss": 4.9953, "mean_token_accuracy": 0.19899878799915313, "num_tokens": 41028858.0, "step": 23650 }, { "entropy": 5.691145896911621, "epoch": 1.8404590546586266, "grad_norm": 1.234375, "learning_rate": 0.00046585845762841453, "loss": 4.973, "mean_token_accuracy": 0.20388407856225968, "num_tokens": 41037539.0, "step": 23655 }, { "entropy": 5.663805770874023, "epoch": 1.8408480840303443, "grad_norm": 1.1484375, "learning_rate": 0.0004658437785513095, "loss": 5.081, "mean_token_accuracy": 0.19854643791913987, "num_tokens": 41045809.0, "step": 23660 }, { "entropy": 5.607454776763916, "epoch": 1.841237113402062, "grad_norm": 1.078125, "learning_rate": 0.0004658290965784539, "loss": 4.9958, "mean_token_accuracy": 0.2029963865876198, "num_tokens": 41054675.0, "step": 23665 }, { "entropy": 5.711282205581665, "epoch": 1.8416261427737795, "grad_norm": 1.1328125, "learning_rate": 0.0004658144117100704, "loss": 5.1612, "mean_token_accuracy": 0.19147171080112457, "num_tokens": 41063493.0, "step": 23670 }, { "entropy": 5.699791812896729, "epoch": 1.842015172145497, "grad_norm": 1.0390625, "learning_rate": 0.00046579972394638204, "loss": 5.0894, "mean_token_accuracy": 0.1946207493543625, "num_tokens": 41072985.0, "step": 23675 }, { "entropy": 5.691910934448242, "epoch": 1.8424042015172146, "grad_norm": 1.1796875, "learning_rate": 0.00046578503328761146, "loss": 5.0647, "mean_token_accuracy": 0.20021508634090424, "num_tokens": 41080926.0, "step": 23680 }, { "entropy": 5.601751804351807, "epoch": 1.842793230888932, "grad_norm": 1.140625, "learning_rate": 0.00046577033973398173, "loss": 5.0031, "mean_token_accuracy": 0.20392018258571626, "num_tokens": 41090251.0, "step": 23685 }, { "entropy": 5.62412109375, "epoch": 1.8431822602606496, "grad_norm": 1.171875, "learning_rate": 0.0004657556432857157, "loss": 4.9653, "mean_token_accuracy": 0.20614240914583207, "num_tokens": 41098681.0, "step": 23690 }, { "entropy": 5.670771551132202, "epoch": 1.8435712896323673, "grad_norm": 1.1328125, "learning_rate": 0.0004657409439430364, "loss": 5.0977, "mean_token_accuracy": 0.2012905165553093, "num_tokens": 41107399.0, "step": 23695 }, { "entropy": 5.712767457962036, "epoch": 1.843960319004085, "grad_norm": 1.15625, "learning_rate": 0.0004657262417061669, "loss": 5.048, "mean_token_accuracy": 0.19650247246026992, "num_tokens": 41116476.0, "step": 23700 }, { "entropy": 5.627057886123657, "epoch": 1.8443493483758022, "grad_norm": 1.078125, "learning_rate": 0.0004657115365753302, "loss": 4.9791, "mean_token_accuracy": 0.19985273480415344, "num_tokens": 41125191.0, "step": 23705 }, { "entropy": 5.624863481521606, "epoch": 1.84473837774752, "grad_norm": 1.2421875, "learning_rate": 0.00046569682855074953, "loss": 4.9925, "mean_token_accuracy": 0.2109066978096962, "num_tokens": 41133811.0, "step": 23710 }, { "entropy": 5.6927660465240475, "epoch": 1.8451274071192376, "grad_norm": 1.15625, "learning_rate": 0.00046568211763264796, "loss": 5.1323, "mean_token_accuracy": 0.19276395440101624, "num_tokens": 41143093.0, "step": 23715 }, { "entropy": 5.762273597717285, "epoch": 1.845516436490955, "grad_norm": 1.1875, "learning_rate": 0.0004656674038212488, "loss": 5.1412, "mean_token_accuracy": 0.19303966015577317, "num_tokens": 41152106.0, "step": 23720 }, { "entropy": 5.684381103515625, "epoch": 1.8459054658626726, "grad_norm": 1.171875, "learning_rate": 0.00046565268711677525, "loss": 5.0205, "mean_token_accuracy": 0.19906811267137528, "num_tokens": 41161100.0, "step": 23725 }, { "entropy": 5.6614970684051515, "epoch": 1.8462944952343903, "grad_norm": 1.1484375, "learning_rate": 0.00046563796751945065, "loss": 5.057, "mean_token_accuracy": 0.19930259585380555, "num_tokens": 41170339.0, "step": 23730 }, { "entropy": 5.714292240142822, "epoch": 1.8466835246061077, "grad_norm": 1.2265625, "learning_rate": 0.00046562324502949834, "loss": 5.0549, "mean_token_accuracy": 0.19824913889169693, "num_tokens": 41178821.0, "step": 23735 }, { "entropy": 5.719708728790283, "epoch": 1.8470725539778252, "grad_norm": 1.1328125, "learning_rate": 0.0004656085196471416, "loss": 5.0648, "mean_token_accuracy": 0.19827462434768678, "num_tokens": 41187578.0, "step": 23740 }, { "entropy": 5.545157957077026, "epoch": 1.847461583349543, "grad_norm": 1.1640625, "learning_rate": 0.00046559379137260404, "loss": 4.9357, "mean_token_accuracy": 0.20713798701763153, "num_tokens": 41196799.0, "step": 23745 }, { "entropy": 5.650405645370483, "epoch": 1.8478506127212606, "grad_norm": 1.0390625, "learning_rate": 0.000465579060206109, "loss": 5.1154, "mean_token_accuracy": 0.19511368423700332, "num_tokens": 41206300.0, "step": 23750 }, { "entropy": 5.766040182113647, "epoch": 1.8482396420929779, "grad_norm": 1.203125, "learning_rate": 0.00046556432614788015, "loss": 5.1069, "mean_token_accuracy": 0.19853024184703827, "num_tokens": 41214377.0, "step": 23755 }, { "entropy": 5.676653671264648, "epoch": 1.8486286714646956, "grad_norm": 1.078125, "learning_rate": 0.0004655495891981409, "loss": 5.0063, "mean_token_accuracy": 0.19895326644182204, "num_tokens": 41223303.0, "step": 23760 }, { "entropy": 5.687079858779907, "epoch": 1.8490177008364133, "grad_norm": 1.09375, "learning_rate": 0.000465534849357115, "loss": 5.1443, "mean_token_accuracy": 0.19204787611961366, "num_tokens": 41232323.0, "step": 23765 }, { "entropy": 5.726064872741699, "epoch": 1.8494067302081307, "grad_norm": 1.0703125, "learning_rate": 0.00046552010662502595, "loss": 5.1038, "mean_token_accuracy": 0.1950084537267685, "num_tokens": 41241605.0, "step": 23770 }, { "entropy": 5.756454133987427, "epoch": 1.8497957595798482, "grad_norm": 1.1015625, "learning_rate": 0.0004655053610020976, "loss": 5.174, "mean_token_accuracy": 0.18778659105300904, "num_tokens": 41250604.0, "step": 23775 }, { "entropy": 5.65646448135376, "epoch": 1.850184788951566, "grad_norm": 1.203125, "learning_rate": 0.0004654906124885535, "loss": 4.9695, "mean_token_accuracy": 0.20573434829711915, "num_tokens": 41258640.0, "step": 23780 }, { "entropy": 5.657597780227661, "epoch": 1.8505738183232834, "grad_norm": 1.1328125, "learning_rate": 0.0004654758610846176, "loss": 5.1129, "mean_token_accuracy": 0.20204756408929825, "num_tokens": 41268104.0, "step": 23785 }, { "entropy": 5.690503025054932, "epoch": 1.8509628476950009, "grad_norm": 1.2421875, "learning_rate": 0.0004654611067905137, "loss": 5.1337, "mean_token_accuracy": 0.1977001339197159, "num_tokens": 41276276.0, "step": 23790 }, { "entropy": 5.688591146469117, "epoch": 1.8513518770667186, "grad_norm": 1.1640625, "learning_rate": 0.00046544634960646563, "loss": 4.9828, "mean_token_accuracy": 0.2058488130569458, "num_tokens": 41284464.0, "step": 23795 }, { "entropy": 5.679538917541504, "epoch": 1.8517409064384363, "grad_norm": 1.078125, "learning_rate": 0.0004654315895326974, "loss": 4.9948, "mean_token_accuracy": 0.1992371916770935, "num_tokens": 41293108.0, "step": 23800 }, { "entropy": 5.658460426330566, "epoch": 1.8521299358101535, "grad_norm": 1.1328125, "learning_rate": 0.0004654168265694328, "loss": 5.0377, "mean_token_accuracy": 0.19509689807891845, "num_tokens": 41301830.0, "step": 23805 }, { "entropy": 5.7098856449127195, "epoch": 1.8525189651818712, "grad_norm": 1.203125, "learning_rate": 0.000465402060716896, "loss": 5.0706, "mean_token_accuracy": 0.19837660789489747, "num_tokens": 41310487.0, "step": 23810 }, { "entropy": 5.735160303115845, "epoch": 1.852907994553589, "grad_norm": 1.140625, "learning_rate": 0.000465387291975311, "loss": 5.1457, "mean_token_accuracy": 0.19527142941951753, "num_tokens": 41319730.0, "step": 23815 }, { "entropy": 5.6724484920501705, "epoch": 1.8532970239253064, "grad_norm": 1.2890625, "learning_rate": 0.00046537252034490185, "loss": 5.0451, "mean_token_accuracy": 0.20284042954444886, "num_tokens": 41328914.0, "step": 23820 }, { "entropy": 5.647346448898316, "epoch": 1.8536860532970239, "grad_norm": 1.1171875, "learning_rate": 0.00046535774582589275, "loss": 5.0819, "mean_token_accuracy": 0.19659153819084169, "num_tokens": 41337060.0, "step": 23825 }, { "entropy": 5.684302282333374, "epoch": 1.8540750826687415, "grad_norm": 1.1875, "learning_rate": 0.00046534296841850776, "loss": 5.0051, "mean_token_accuracy": 0.20757822394371034, "num_tokens": 41344966.0, "step": 23830 }, { "entropy": 5.608697366714478, "epoch": 1.854464112040459, "grad_norm": 1.109375, "learning_rate": 0.00046532818812297124, "loss": 4.926, "mean_token_accuracy": 0.20916413962841035, "num_tokens": 41353678.0, "step": 23835 }, { "entropy": 5.745792627334595, "epoch": 1.8548531414121765, "grad_norm": 1.1796875, "learning_rate": 0.0004653134049395074, "loss": 5.1785, "mean_token_accuracy": 0.20162003636360168, "num_tokens": 41362782.0, "step": 23840 }, { "entropy": 5.646778774261475, "epoch": 1.8552421707838942, "grad_norm": 1.1640625, "learning_rate": 0.0004652986188683406, "loss": 5.0171, "mean_token_accuracy": 0.20401924699544907, "num_tokens": 41370668.0, "step": 23845 }, { "entropy": 5.611280870437622, "epoch": 1.855631200155612, "grad_norm": 1.171875, "learning_rate": 0.00046528382990969504, "loss": 4.9994, "mean_token_accuracy": 0.2035282790660858, "num_tokens": 41378945.0, "step": 23850 }, { "entropy": 5.7154212474823, "epoch": 1.8560202295273294, "grad_norm": 1.125, "learning_rate": 0.0004652690380637953, "loss": 5.0693, "mean_token_accuracy": 0.1947337046265602, "num_tokens": 41387579.0, "step": 23855 }, { "entropy": 5.696177768707275, "epoch": 1.8564092588990468, "grad_norm": 1.09375, "learning_rate": 0.0004652542433308657, "loss": 5.0718, "mean_token_accuracy": 0.2017604887485504, "num_tokens": 41396472.0, "step": 23860 }, { "entropy": 5.7154511451721195, "epoch": 1.8567982882707645, "grad_norm": 1.2578125, "learning_rate": 0.0004652394457111309, "loss": 5.1161, "mean_token_accuracy": 0.19253923296928405, "num_tokens": 41404599.0, "step": 23865 }, { "entropy": 5.739647674560547, "epoch": 1.857187317642482, "grad_norm": 1.2109375, "learning_rate": 0.00046522464520481517, "loss": 5.1399, "mean_token_accuracy": 0.18762982040643691, "num_tokens": 41412799.0, "step": 23870 }, { "entropy": 5.64436707496643, "epoch": 1.8575763470141995, "grad_norm": 1.2734375, "learning_rate": 0.00046520984181214333, "loss": 4.9524, "mean_token_accuracy": 0.20920240730047227, "num_tokens": 41421193.0, "step": 23875 }, { "entropy": 5.665311288833618, "epoch": 1.8579653763859172, "grad_norm": 1.078125, "learning_rate": 0.0004651950355333398, "loss": 5.0175, "mean_token_accuracy": 0.19525519758462906, "num_tokens": 41430201.0, "step": 23880 }, { "entropy": 5.605517768859864, "epoch": 1.8583544057576347, "grad_norm": 1.15625, "learning_rate": 0.0004651802263686294, "loss": 4.9876, "mean_token_accuracy": 0.19989306330680848, "num_tokens": 41439122.0, "step": 23885 }, { "entropy": 5.671520757675171, "epoch": 1.8587434351293521, "grad_norm": 1.140625, "learning_rate": 0.0004651654143182367, "loss": 5.05, "mean_token_accuracy": 0.19741638153791427, "num_tokens": 41448553.0, "step": 23890 }, { "entropy": 5.651991558074951, "epoch": 1.8591324645010698, "grad_norm": 1.0859375, "learning_rate": 0.0004651505993823866, "loss": 5.0183, "mean_token_accuracy": 0.2022734746336937, "num_tokens": 41457098.0, "step": 23895 }, { "entropy": 5.669555187225342, "epoch": 1.8595214938727875, "grad_norm": 1.1953125, "learning_rate": 0.00046513578156130383, "loss": 5.075, "mean_token_accuracy": 0.19775795042514802, "num_tokens": 41465714.0, "step": 23900 }, { "entropy": 5.747840929031372, "epoch": 1.859910523244505, "grad_norm": 1.0859375, "learning_rate": 0.0004651209608552131, "loss": 5.0953, "mean_token_accuracy": 0.1980939269065857, "num_tokens": 41474418.0, "step": 23905 }, { "entropy": 5.645845603942871, "epoch": 1.8602995526162225, "grad_norm": 1.109375, "learning_rate": 0.00046510613726433945, "loss": 4.9773, "mean_token_accuracy": 0.2044762283563614, "num_tokens": 41482430.0, "step": 23910 }, { "entropy": 5.711126470565796, "epoch": 1.8606885819879402, "grad_norm": 1.140625, "learning_rate": 0.0004650913107889078, "loss": 5.1362, "mean_token_accuracy": 0.19826145470142365, "num_tokens": 41490759.0, "step": 23915 }, { "entropy": 5.594354343414307, "epoch": 1.8610776113596577, "grad_norm": 1.1171875, "learning_rate": 0.000465076481429143, "loss": 4.9887, "mean_token_accuracy": 0.20265743881464005, "num_tokens": 41499660.0, "step": 23920 }, { "entropy": 5.68090500831604, "epoch": 1.8614666407313751, "grad_norm": 1.09375, "learning_rate": 0.0004650616491852701, "loss": 5.0168, "mean_token_accuracy": 0.20643742382526398, "num_tokens": 41507515.0, "step": 23925 }, { "entropy": 5.722912311553955, "epoch": 1.8618556701030928, "grad_norm": 1.1875, "learning_rate": 0.00046504681405751426, "loss": 5.08, "mean_token_accuracy": 0.19374623000621796, "num_tokens": 41515859.0, "step": 23930 }, { "entropy": 5.685977268218994, "epoch": 1.8622446994748103, "grad_norm": 1.234375, "learning_rate": 0.00046503197604610047, "loss": 5.1096, "mean_token_accuracy": 0.20370736271142958, "num_tokens": 41524776.0, "step": 23935 }, { "entropy": 5.701795148849487, "epoch": 1.8626337288465278, "grad_norm": 1.1484375, "learning_rate": 0.00046501713515125393, "loss": 5.0243, "mean_token_accuracy": 0.20092787891626357, "num_tokens": 41532854.0, "step": 23940 }, { "entropy": 5.72903528213501, "epoch": 1.8630227582182455, "grad_norm": 1.15625, "learning_rate": 0.0004650022913731998, "loss": 5.0099, "mean_token_accuracy": 0.21019555926322936, "num_tokens": 41542038.0, "step": 23945 }, { "entropy": 5.686867141723633, "epoch": 1.8634117875899632, "grad_norm": 1.0546875, "learning_rate": 0.00046498744471216335, "loss": 5.022, "mean_token_accuracy": 0.20487914979457855, "num_tokens": 41550428.0, "step": 23950 }, { "entropy": 5.635628890991211, "epoch": 1.8638008169616807, "grad_norm": 1.1875, "learning_rate": 0.00046497259516836974, "loss": 4.9958, "mean_token_accuracy": 0.20121567100286483, "num_tokens": 41559289.0, "step": 23955 }, { "entropy": 5.691625165939331, "epoch": 1.8641898463333981, "grad_norm": 1.1640625, "learning_rate": 0.00046495774274204446, "loss": 5.0109, "mean_token_accuracy": 0.20548161417245864, "num_tokens": 41567901.0, "step": 23960 }, { "entropy": 5.760720205307007, "epoch": 1.8645788757051158, "grad_norm": 1.1640625, "learning_rate": 0.0004649428874334127, "loss": 5.1296, "mean_token_accuracy": 0.1914092168211937, "num_tokens": 41577589.0, "step": 23965 }, { "entropy": 5.736770391464233, "epoch": 1.8649679050768333, "grad_norm": 1.1796875, "learning_rate": 0.0004649280292427, "loss": 5.1248, "mean_token_accuracy": 0.19287013858556748, "num_tokens": 41586319.0, "step": 23970 }, { "entropy": 5.736889457702636, "epoch": 1.8653569344485508, "grad_norm": 1.203125, "learning_rate": 0.0004649131681701318, "loss": 5.1106, "mean_token_accuracy": 0.19541349709033967, "num_tokens": 41594316.0, "step": 23975 }, { "entropy": 5.660229873657227, "epoch": 1.8657459638202685, "grad_norm": 1.203125, "learning_rate": 0.00046489830421593347, "loss": 5.0369, "mean_token_accuracy": 0.19791144132614136, "num_tokens": 41603221.0, "step": 23980 }, { "entropy": 5.64997034072876, "epoch": 1.866134993191986, "grad_norm": 1.0703125, "learning_rate": 0.0004648834373803307, "loss": 5.0503, "mean_token_accuracy": 0.19683537185192107, "num_tokens": 41612082.0, "step": 23985 }, { "entropy": 5.710425853729248, "epoch": 1.8665240225637034, "grad_norm": 1.1953125, "learning_rate": 0.00046486856766354893, "loss": 5.0065, "mean_token_accuracy": 0.2030527263879776, "num_tokens": 41619762.0, "step": 23990 }, { "entropy": 5.636745882034302, "epoch": 1.8669130519354211, "grad_norm": 1.1875, "learning_rate": 0.00046485369506581387, "loss": 5.0095, "mean_token_accuracy": 0.19832469820976256, "num_tokens": 41627968.0, "step": 23995 }, { "entropy": 5.69230694770813, "epoch": 1.8673020813071388, "grad_norm": 1.140625, "learning_rate": 0.00046483881958735124, "loss": 5.0917, "mean_token_accuracy": 0.19699103087186814, "num_tokens": 41636841.0, "step": 24000 }, { "epoch": 1.8673020813071388, "eval_entropy": 5.483582375758651, "eval_loss": 5.10653018951416, "eval_mean_token_accuracy": 0.20658851980273832, "eval_num_tokens": 41636841.0, "eval_runtime": 21.8321, "eval_samples_per_second": 1903.529, "eval_steps_per_second": 237.953, "step": 24000 }, { "entropy": 5.741102457046509, "epoch": 1.8676911106788563, "grad_norm": 1.1640625, "learning_rate": 0.00046482394122838663, "loss": 5.0506, "mean_token_accuracy": 0.2047205686569214, "num_tokens": 41645352.0, "step": 24005 }, { "entropy": 5.660536670684815, "epoch": 1.8680801400505738, "grad_norm": 1.1484375, "learning_rate": 0.00046480905998914587, "loss": 4.9577, "mean_token_accuracy": 0.20603823363780976, "num_tokens": 41654296.0, "step": 24010 }, { "entropy": 5.590140914916992, "epoch": 1.8684691694222915, "grad_norm": 1.1953125, "learning_rate": 0.0004647941758698547, "loss": 5.0156, "mean_token_accuracy": 0.1979769691824913, "num_tokens": 41662008.0, "step": 24015 }, { "entropy": 5.7127727508544925, "epoch": 1.868858198794009, "grad_norm": 1.2421875, "learning_rate": 0.000464779288870739, "loss": 5.1653, "mean_token_accuracy": 0.1959889277815819, "num_tokens": 41671765.0, "step": 24020 }, { "entropy": 5.760813999176025, "epoch": 1.8692472281657264, "grad_norm": 1.3046875, "learning_rate": 0.00046476439899202464, "loss": 5.1483, "mean_token_accuracy": 0.1913057327270508, "num_tokens": 41681035.0, "step": 24025 }, { "entropy": 5.700266933441162, "epoch": 1.8696362575374441, "grad_norm": 1.140625, "learning_rate": 0.00046474950623393756, "loss": 5.0134, "mean_token_accuracy": 0.20269862115383147, "num_tokens": 41689974.0, "step": 24030 }, { "entropy": 5.692906045913697, "epoch": 1.8700252869091616, "grad_norm": 1.140625, "learning_rate": 0.0004647346105967038, "loss": 5.0764, "mean_token_accuracy": 0.19065997898578643, "num_tokens": 41698560.0, "step": 24035 }, { "entropy": 5.697722101211548, "epoch": 1.870414316280879, "grad_norm": 1.1484375, "learning_rate": 0.0004647197120805493, "loss": 5.0303, "mean_token_accuracy": 0.20352455228567123, "num_tokens": 41706741.0, "step": 24040 }, { "entropy": 5.6599808692932125, "epoch": 1.8708033456525968, "grad_norm": 1.1953125, "learning_rate": 0.00046470481068570013, "loss": 5.0118, "mean_token_accuracy": 0.19611548781394958, "num_tokens": 41715685.0, "step": 24045 }, { "entropy": 5.648841094970703, "epoch": 1.8711923750243145, "grad_norm": 1.1796875, "learning_rate": 0.0004646899064123824, "loss": 5.0843, "mean_token_accuracy": 0.2012360453605652, "num_tokens": 41724123.0, "step": 24050 }, { "entropy": 5.7200220108032225, "epoch": 1.871581404396032, "grad_norm": 1.234375, "learning_rate": 0.0004646749992608223, "loss": 5.0574, "mean_token_accuracy": 0.20124853700399398, "num_tokens": 41732604.0, "step": 24055 }, { "entropy": 5.630925798416138, "epoch": 1.8719704337677494, "grad_norm": 1.1484375, "learning_rate": 0.0004646600892312459, "loss": 5.016, "mean_token_accuracy": 0.2035152032971382, "num_tokens": 41740444.0, "step": 24060 }, { "entropy": 5.654859256744385, "epoch": 1.872359463139467, "grad_norm": 1.203125, "learning_rate": 0.0004646451763238796, "loss": 5.0105, "mean_token_accuracy": 0.19737775027751922, "num_tokens": 41748800.0, "step": 24065 }, { "entropy": 5.648532152175903, "epoch": 1.8727484925111846, "grad_norm": 1.078125, "learning_rate": 0.0004646302605389496, "loss": 5.0589, "mean_token_accuracy": 0.19410253912210465, "num_tokens": 41757402.0, "step": 24070 }, { "entropy": 5.699870777130127, "epoch": 1.873137521882902, "grad_norm": 1.109375, "learning_rate": 0.0004646153418766822, "loss": 5.0262, "mean_token_accuracy": 0.20737480372190475, "num_tokens": 41766604.0, "step": 24075 }, { "entropy": 5.756013679504394, "epoch": 1.8735265512546198, "grad_norm": 1.1484375, "learning_rate": 0.00046460042033730377, "loss": 5.2053, "mean_token_accuracy": 0.19025604277849198, "num_tokens": 41775450.0, "step": 24080 }, { "entropy": 5.7421306610107425, "epoch": 1.8739155806263375, "grad_norm": 1.1484375, "learning_rate": 0.0004645854959210408, "loss": 5.1726, "mean_token_accuracy": 0.19606088250875472, "num_tokens": 41784355.0, "step": 24085 }, { "entropy": 5.655627822875976, "epoch": 1.8743046099980547, "grad_norm": 1.09375, "learning_rate": 0.00046457056862811956, "loss": 4.999, "mean_token_accuracy": 0.19285477101802825, "num_tokens": 41793441.0, "step": 24090 }, { "entropy": 5.672564315795898, "epoch": 1.8746936393697724, "grad_norm": 1.2109375, "learning_rate": 0.0004645556384587668, "loss": 4.9977, "mean_token_accuracy": 0.19842258393764495, "num_tokens": 41802407.0, "step": 24095 }, { "entropy": 5.700974321365356, "epoch": 1.87508266874149, "grad_norm": 1.265625, "learning_rate": 0.0004645407054132089, "loss": 5.0544, "mean_token_accuracy": 0.1979052484035492, "num_tokens": 41810362.0, "step": 24100 }, { "entropy": 5.676897716522217, "epoch": 1.8754716981132076, "grad_norm": 1.15625, "learning_rate": 0.0004645257694916725, "loss": 5.1575, "mean_token_accuracy": 0.19177428483963013, "num_tokens": 41819332.0, "step": 24105 }, { "entropy": 5.698676872253418, "epoch": 1.875860727484925, "grad_norm": 1.1484375, "learning_rate": 0.0004645108306943842, "loss": 5.0183, "mean_token_accuracy": 0.20641182065010072, "num_tokens": 41828048.0, "step": 24110 }, { "entropy": 5.636488342285157, "epoch": 1.8762497568566427, "grad_norm": 1.1484375, "learning_rate": 0.0004644958890215707, "loss": 4.9914, "mean_token_accuracy": 0.20486603081226348, "num_tokens": 41836583.0, "step": 24115 }, { "entropy": 5.660585546493531, "epoch": 1.8766387862283602, "grad_norm": 1.25, "learning_rate": 0.0004644809444734586, "loss": 5.0557, "mean_token_accuracy": 0.19707500636577607, "num_tokens": 41845454.0, "step": 24120 }, { "entropy": 5.700658845901489, "epoch": 1.8770278156000777, "grad_norm": 1.1953125, "learning_rate": 0.00046446599705027487, "loss": 5.0334, "mean_token_accuracy": 0.19468516558408738, "num_tokens": 41854481.0, "step": 24125 }, { "entropy": 5.730928039550781, "epoch": 1.8774168449717954, "grad_norm": 1.1484375, "learning_rate": 0.00046445104675224607, "loss": 5.0904, "mean_token_accuracy": 0.2011136829853058, "num_tokens": 41863015.0, "step": 24130 }, { "entropy": 5.723241806030273, "epoch": 1.877805874343513, "grad_norm": 1.2578125, "learning_rate": 0.0004644360935795993, "loss": 5.0601, "mean_token_accuracy": 0.19522613734006883, "num_tokens": 41871703.0, "step": 24135 }, { "entropy": 5.7228978157043455, "epoch": 1.8781949037152303, "grad_norm": 1.140625, "learning_rate": 0.00046442113753256126, "loss": 5.0013, "mean_token_accuracy": 0.19627539813518524, "num_tokens": 41880136.0, "step": 24140 }, { "entropy": 5.722740173339844, "epoch": 1.878583933086948, "grad_norm": 1.203125, "learning_rate": 0.00046440617861135905, "loss": 5.1315, "mean_token_accuracy": 0.19552311301231384, "num_tokens": 41889065.0, "step": 24145 }, { "entropy": 5.618831777572632, "epoch": 1.8789729624586657, "grad_norm": 1.03125, "learning_rate": 0.0004643912168162194, "loss": 4.9717, "mean_token_accuracy": 0.20740085244178771, "num_tokens": 41898160.0, "step": 24150 }, { "entropy": 5.725120782852173, "epoch": 1.8793619918303832, "grad_norm": 1.1953125, "learning_rate": 0.0004643762521473696, "loss": 5.0554, "mean_token_accuracy": 0.2016186848282814, "num_tokens": 41907037.0, "step": 24155 }, { "entropy": 5.724745416641236, "epoch": 1.8797510212021007, "grad_norm": 1.171875, "learning_rate": 0.0004643612846050366, "loss": 5.1157, "mean_token_accuracy": 0.1896385058760643, "num_tokens": 41915176.0, "step": 24160 }, { "entropy": 5.728715610504151, "epoch": 1.8801400505738184, "grad_norm": 1.2734375, "learning_rate": 0.00046434631418944744, "loss": 5.1057, "mean_token_accuracy": 0.19158462584018707, "num_tokens": 41923586.0, "step": 24165 }, { "entropy": 5.703259468078613, "epoch": 1.8805290799455359, "grad_norm": 1.2421875, "learning_rate": 0.0004643313409008294, "loss": 5.1898, "mean_token_accuracy": 0.18386437743902206, "num_tokens": 41932803.0, "step": 24170 }, { "entropy": 5.718877363204956, "epoch": 1.8809181093172533, "grad_norm": 1.1328125, "learning_rate": 0.00046431636473940956, "loss": 5.0844, "mean_token_accuracy": 0.19435103833675385, "num_tokens": 41941737.0, "step": 24175 }, { "entropy": 5.6895629405975345, "epoch": 1.881307138688971, "grad_norm": 1.265625, "learning_rate": 0.0004643013857054152, "loss": 4.999, "mean_token_accuracy": 0.2022035926580429, "num_tokens": 41950099.0, "step": 24180 }, { "entropy": 5.658486413955688, "epoch": 1.8816961680606887, "grad_norm": 1.1875, "learning_rate": 0.00046428640379907367, "loss": 5.0662, "mean_token_accuracy": 0.19750165045261384, "num_tokens": 41959091.0, "step": 24185 }, { "entropy": 5.728923988342285, "epoch": 1.882085197432406, "grad_norm": 1.2265625, "learning_rate": 0.00046427141902061225, "loss": 4.9813, "mean_token_accuracy": 0.20358682423830032, "num_tokens": 41968462.0, "step": 24190 }, { "entropy": 5.680650281906128, "epoch": 1.8824742268041237, "grad_norm": 1.234375, "learning_rate": 0.0004642564313702582, "loss": 5.0571, "mean_token_accuracy": 0.19784417897462844, "num_tokens": 41976514.0, "step": 24195 }, { "entropy": 5.626406717300415, "epoch": 1.8828632561758414, "grad_norm": 1.15625, "learning_rate": 0.00046424144084823916, "loss": 4.9735, "mean_token_accuracy": 0.2012020990252495, "num_tokens": 41985583.0, "step": 24200 }, { "entropy": 5.643293714523315, "epoch": 1.8832522855475589, "grad_norm": 1.1328125, "learning_rate": 0.0004642264474547824, "loss": 4.9842, "mean_token_accuracy": 0.20644300431013107, "num_tokens": 41993684.0, "step": 24205 }, { "entropy": 5.641506958007812, "epoch": 1.8836413149192763, "grad_norm": 1.125, "learning_rate": 0.00046421145119011556, "loss": 4.9498, "mean_token_accuracy": 0.20412273854017257, "num_tokens": 42002239.0, "step": 24210 }, { "entropy": 5.5814532279968265, "epoch": 1.884030344290994, "grad_norm": 1.1796875, "learning_rate": 0.000464196452054466, "loss": 4.9239, "mean_token_accuracy": 0.20882173329591752, "num_tokens": 42010886.0, "step": 24215 }, { "entropy": 5.678795433044433, "epoch": 1.8844193736627115, "grad_norm": 1.2578125, "learning_rate": 0.0004641814500480615, "loss": 5.1051, "mean_token_accuracy": 0.1926621153950691, "num_tokens": 42019703.0, "step": 24220 }, { "entropy": 5.7432952404022215, "epoch": 1.884808403034429, "grad_norm": 1.265625, "learning_rate": 0.0004641664451711296, "loss": 5.158, "mean_token_accuracy": 0.19239576607942582, "num_tokens": 42028467.0, "step": 24225 }, { "entropy": 5.684470176696777, "epoch": 1.8851974324061467, "grad_norm": 1.109375, "learning_rate": 0.00046415143742389793, "loss": 5.0396, "mean_token_accuracy": 0.1998426377773285, "num_tokens": 42037220.0, "step": 24230 }, { "entropy": 5.706933927536011, "epoch": 1.8855864617778644, "grad_norm": 1.1015625, "learning_rate": 0.0004641364268065943, "loss": 5.0975, "mean_token_accuracy": 0.1953598141670227, "num_tokens": 42046034.0, "step": 24235 }, { "entropy": 5.654673051834107, "epoch": 1.8859754911495816, "grad_norm": 1.1796875, "learning_rate": 0.00046412141331944644, "loss": 5.0442, "mean_token_accuracy": 0.1991073340177536, "num_tokens": 42054659.0, "step": 24240 }, { "entropy": 5.709597110748291, "epoch": 1.8863645205212993, "grad_norm": 1.171875, "learning_rate": 0.00046410639696268206, "loss": 5.0999, "mean_token_accuracy": 0.1921329081058502, "num_tokens": 42063130.0, "step": 24245 }, { "entropy": 5.702262830734253, "epoch": 1.886753549893017, "grad_norm": 1.3125, "learning_rate": 0.0004640913777365292, "loss": 5.1088, "mean_token_accuracy": 0.19227679818868637, "num_tokens": 42071162.0, "step": 24250 }, { "entropy": 5.678764772415161, "epoch": 1.8871425792647345, "grad_norm": 1.15625, "learning_rate": 0.00046407635564121565, "loss": 5.1064, "mean_token_accuracy": 0.19842315167188646, "num_tokens": 42079948.0, "step": 24255 }, { "entropy": 5.7053149223327635, "epoch": 1.887531608636452, "grad_norm": 1.21875, "learning_rate": 0.00046406133067696936, "loss": 5.0567, "mean_token_accuracy": 0.19605812579393386, "num_tokens": 42089010.0, "step": 24260 }, { "entropy": 5.759976196289062, "epoch": 1.8879206380081697, "grad_norm": 1.3046875, "learning_rate": 0.0004640463028440182, "loss": 5.0605, "mean_token_accuracy": 0.19377840757369996, "num_tokens": 42097096.0, "step": 24265 }, { "entropy": 5.616702318191528, "epoch": 1.8883096673798871, "grad_norm": 1.140625, "learning_rate": 0.0004640312721425904, "loss": 4.9776, "mean_token_accuracy": 0.19980015903711318, "num_tokens": 42105870.0, "step": 24270 }, { "entropy": 5.638563919067383, "epoch": 1.8886986967516046, "grad_norm": 1.171875, "learning_rate": 0.0004640162385729139, "loss": 4.9755, "mean_token_accuracy": 0.21114583760499955, "num_tokens": 42114246.0, "step": 24275 }, { "entropy": 5.624612712860108, "epoch": 1.8890877261233223, "grad_norm": 1.2109375, "learning_rate": 0.0004640012021352168, "loss": 4.9844, "mean_token_accuracy": 0.19922612458467484, "num_tokens": 42122163.0, "step": 24280 }, { "entropy": 5.659454774856568, "epoch": 1.88947675549504, "grad_norm": 1.1640625, "learning_rate": 0.0004639861628297273, "loss": 5.0182, "mean_token_accuracy": 0.2026349723339081, "num_tokens": 42130255.0, "step": 24285 }, { "entropy": 5.734159326553344, "epoch": 1.8898657848667575, "grad_norm": 1.1328125, "learning_rate": 0.00046397112065667354, "loss": 5.0919, "mean_token_accuracy": 0.19065866768360137, "num_tokens": 42138615.0, "step": 24290 }, { "entropy": 5.68282380104065, "epoch": 1.890254814238475, "grad_norm": 1.265625, "learning_rate": 0.00046395607561628387, "loss": 4.9794, "mean_token_accuracy": 0.20117951631546022, "num_tokens": 42146502.0, "step": 24295 }, { "entropy": 5.668199634552002, "epoch": 1.8906438436101927, "grad_norm": 1.09375, "learning_rate": 0.00046394102770878643, "loss": 5.0517, "mean_token_accuracy": 0.2024393394589424, "num_tokens": 42155548.0, "step": 24300 }, { "entropy": 5.560957574844361, "epoch": 1.8910328729819101, "grad_norm": 1.1953125, "learning_rate": 0.00046392597693440974, "loss": 4.8722, "mean_token_accuracy": 0.20830923765897752, "num_tokens": 42163813.0, "step": 24305 }, { "entropy": 5.743336915969849, "epoch": 1.8914219023536276, "grad_norm": 1.21875, "learning_rate": 0.0004639109232933819, "loss": 5.0829, "mean_token_accuracy": 0.1985733166337013, "num_tokens": 42172702.0, "step": 24310 }, { "entropy": 5.735151672363282, "epoch": 1.8918109317253453, "grad_norm": 1.2265625, "learning_rate": 0.0004638958667859316, "loss": 5.1321, "mean_token_accuracy": 0.20116187632083893, "num_tokens": 42180776.0, "step": 24315 }, { "entropy": 5.71647367477417, "epoch": 1.8921999610970628, "grad_norm": 1.203125, "learning_rate": 0.0004638808074122872, "loss": 5.0649, "mean_token_accuracy": 0.19686400294303893, "num_tokens": 42189695.0, "step": 24320 }, { "entropy": 5.66493821144104, "epoch": 1.8925889904687803, "grad_norm": 1.15625, "learning_rate": 0.0004638657451726771, "loss": 5.0428, "mean_token_accuracy": 0.19719133228063584, "num_tokens": 42197884.0, "step": 24325 }, { "entropy": 5.744034194946289, "epoch": 1.892978019840498, "grad_norm": 1.1328125, "learning_rate": 0.00046385068006732995, "loss": 5.1461, "mean_token_accuracy": 0.1902386024594307, "num_tokens": 42206800.0, "step": 24330 }, { "entropy": 5.702206563949585, "epoch": 1.8933670492122157, "grad_norm": 1.171875, "learning_rate": 0.00046383561209647437, "loss": 5.0202, "mean_token_accuracy": 0.21366167962551116, "num_tokens": 42216091.0, "step": 24335 }, { "entropy": 5.629003572463989, "epoch": 1.8937560785839331, "grad_norm": 1.1484375, "learning_rate": 0.00046382054126033884, "loss": 5.0525, "mean_token_accuracy": 0.19962407499551774, "num_tokens": 42224675.0, "step": 24340 }, { "entropy": 5.709082508087159, "epoch": 1.8941451079556506, "grad_norm": 1.1796875, "learning_rate": 0.0004638054675591523, "loss": 5.079, "mean_token_accuracy": 0.19774367809295654, "num_tokens": 42232964.0, "step": 24345 }, { "entropy": 5.733403730392456, "epoch": 1.8945341373273683, "grad_norm": 1.1015625, "learning_rate": 0.0004637903909931432, "loss": 5.0788, "mean_token_accuracy": 0.19271970093250274, "num_tokens": 42241932.0, "step": 24350 }, { "entropy": 5.645138120651245, "epoch": 1.8949231666990858, "grad_norm": 1.2265625, "learning_rate": 0.0004637753115625404, "loss": 4.8912, "mean_token_accuracy": 0.20349908322095872, "num_tokens": 42250146.0, "step": 24355 }, { "entropy": 5.656929779052734, "epoch": 1.8953121960708033, "grad_norm": 1.1171875, "learning_rate": 0.0004637602292675726, "loss": 5.1267, "mean_token_accuracy": 0.19452781826257706, "num_tokens": 42259183.0, "step": 24360 }, { "entropy": 5.732398843765258, "epoch": 1.895701225442521, "grad_norm": 1.1015625, "learning_rate": 0.0004637451441084689, "loss": 5.1551, "mean_token_accuracy": 0.189733025431633, "num_tokens": 42268436.0, "step": 24365 }, { "entropy": 5.777950572967529, "epoch": 1.8960902548142384, "grad_norm": 1.1796875, "learning_rate": 0.0004637300560854581, "loss": 5.1021, "mean_token_accuracy": 0.19860146641731263, "num_tokens": 42277146.0, "step": 24370 }, { "entropy": 5.742022466659546, "epoch": 1.896479284185956, "grad_norm": 1.1484375, "learning_rate": 0.000463714965198769, "loss": 5.0604, "mean_token_accuracy": 0.1950198993086815, "num_tokens": 42286571.0, "step": 24375 }, { "entropy": 5.6356847286224365, "epoch": 1.8968683135576736, "grad_norm": 1.171875, "learning_rate": 0.0004636998714486307, "loss": 5.0013, "mean_token_accuracy": 0.20521741807460786, "num_tokens": 42295415.0, "step": 24380 }, { "entropy": 5.676912832260132, "epoch": 1.8972573429293913, "grad_norm": 1.1484375, "learning_rate": 0.00046368477483527224, "loss": 5.0648, "mean_token_accuracy": 0.19570236802101135, "num_tokens": 42305105.0, "step": 24385 }, { "entropy": 5.688040494918823, "epoch": 1.8976463723011088, "grad_norm": 1.1953125, "learning_rate": 0.0004636696753589226, "loss": 4.981, "mean_token_accuracy": 0.20344528555870056, "num_tokens": 42313034.0, "step": 24390 }, { "entropy": 5.638887643814087, "epoch": 1.8980354016728263, "grad_norm": 1.203125, "learning_rate": 0.0004636545730198109, "loss": 5.0353, "mean_token_accuracy": 0.19749893993139267, "num_tokens": 42321249.0, "step": 24395 }, { "entropy": 5.641788816452026, "epoch": 1.898424431044544, "grad_norm": 1.2265625, "learning_rate": 0.00046363946781816643, "loss": 5.0568, "mean_token_accuracy": 0.19804082810878754, "num_tokens": 42329519.0, "step": 24400 }, { "entropy": 5.742695283889771, "epoch": 1.8988134604162614, "grad_norm": 1.078125, "learning_rate": 0.00046362435975421816, "loss": 5.1187, "mean_token_accuracy": 0.19449923038482667, "num_tokens": 42338318.0, "step": 24405 }, { "entropy": 5.689006710052491, "epoch": 1.899202489787979, "grad_norm": 1.1328125, "learning_rate": 0.00046360924882819554, "loss": 5.0372, "mean_token_accuracy": 0.19813034534454346, "num_tokens": 42346038.0, "step": 24410 }, { "entropy": 5.672586250305176, "epoch": 1.8995915191596966, "grad_norm": 1.15625, "learning_rate": 0.0004635941350403277, "loss": 5.0187, "mean_token_accuracy": 0.20174821764230727, "num_tokens": 42356280.0, "step": 24415 }, { "entropy": 5.644523429870605, "epoch": 1.899980548531414, "grad_norm": 1.25, "learning_rate": 0.0004635790183908442, "loss": 4.9686, "mean_token_accuracy": 0.21053633987903594, "num_tokens": 42364716.0, "step": 24420 }, { "entropy": 5.6797035217285154, "epoch": 1.9003695779031315, "grad_norm": 1.1640625, "learning_rate": 0.00046356389887997415, "loss": 5.1051, "mean_token_accuracy": 0.19301884472370148, "num_tokens": 42373137.0, "step": 24425 }, { "entropy": 5.683261728286743, "epoch": 1.9007586072748492, "grad_norm": 1.1796875, "learning_rate": 0.00046354877650794707, "loss": 5.0089, "mean_token_accuracy": 0.19646963328123093, "num_tokens": 42382054.0, "step": 24430 }, { "entropy": 5.6304632186889645, "epoch": 1.901147636646567, "grad_norm": 1.1953125, "learning_rate": 0.00046353365127499235, "loss": 5.0157, "mean_token_accuracy": 0.1978391870856285, "num_tokens": 42391228.0, "step": 24435 }, { "entropy": 5.706356716156006, "epoch": 1.9015366660182844, "grad_norm": 1.15625, "learning_rate": 0.0004635185231813396, "loss": 4.9921, "mean_token_accuracy": 0.20484830290079117, "num_tokens": 42400178.0, "step": 24440 }, { "entropy": 5.693290185928345, "epoch": 1.901925695390002, "grad_norm": 1.1640625, "learning_rate": 0.0004635033922272183, "loss": 5.0457, "mean_token_accuracy": 0.20605269819498062, "num_tokens": 42408515.0, "step": 24445 }, { "entropy": 5.738110303878784, "epoch": 1.9023147247617196, "grad_norm": 1.21875, "learning_rate": 0.00046348825841285813, "loss": 5.0815, "mean_token_accuracy": 0.19458684772253038, "num_tokens": 42417291.0, "step": 24450 }, { "entropy": 5.811046600341797, "epoch": 1.902703754133437, "grad_norm": 1.1484375, "learning_rate": 0.0004634731217384886, "loss": 5.2364, "mean_token_accuracy": 0.1796120062470436, "num_tokens": 42426371.0, "step": 24455 }, { "entropy": 5.768460845947265, "epoch": 1.9030927835051545, "grad_norm": 1.1484375, "learning_rate": 0.0004634579822043394, "loss": 5.1909, "mean_token_accuracy": 0.19514919221401214, "num_tokens": 42434767.0, "step": 24460 }, { "entropy": 5.685267496109009, "epoch": 1.9034818128768722, "grad_norm": 1.1328125, "learning_rate": 0.00046344283981064035, "loss": 5.0596, "mean_token_accuracy": 0.2002108722925186, "num_tokens": 42443618.0, "step": 24465 }, { "entropy": 5.6775439262390135, "epoch": 1.90387084224859, "grad_norm": 1.1640625, "learning_rate": 0.00046342769455762114, "loss": 5.0287, "mean_token_accuracy": 0.1962940812110901, "num_tokens": 42453134.0, "step": 24470 }, { "entropy": 5.713677597045899, "epoch": 1.9042598716203072, "grad_norm": 1.3203125, "learning_rate": 0.0004634125464455116, "loss": 5.0482, "mean_token_accuracy": 0.19347914606332778, "num_tokens": 42462037.0, "step": 24475 }, { "entropy": 5.6461576461792, "epoch": 1.9046489009920249, "grad_norm": 1.15625, "learning_rate": 0.00046339739547454146, "loss": 4.9839, "mean_token_accuracy": 0.20335804373025895, "num_tokens": 42471318.0, "step": 24480 }, { "entropy": 5.675210475921631, "epoch": 1.9050379303637426, "grad_norm": 1.203125, "learning_rate": 0.00046338224164494074, "loss": 5.0822, "mean_token_accuracy": 0.19868521839380265, "num_tokens": 42478851.0, "step": 24485 }, { "entropy": 5.618244314193726, "epoch": 1.90542695973546, "grad_norm": 1.125, "learning_rate": 0.00046336708495693933, "loss": 4.998, "mean_token_accuracy": 0.20081014335155487, "num_tokens": 42488406.0, "step": 24490 }, { "entropy": 5.691645097732544, "epoch": 1.9058159891071775, "grad_norm": 1.28125, "learning_rate": 0.00046335192541076725, "loss": 4.9317, "mean_token_accuracy": 0.20910554379224777, "num_tokens": 42496001.0, "step": 24495 }, { "entropy": 5.675712966918946, "epoch": 1.9062050184788952, "grad_norm": 1.09375, "learning_rate": 0.0004633367630066545, "loss": 5.093, "mean_token_accuracy": 0.192819344997406, "num_tokens": 42504808.0, "step": 24500 }, { "entropy": 5.6577520847320555, "epoch": 1.9065940478506127, "grad_norm": 1.2265625, "learning_rate": 0.00046332159774483116, "loss": 5.0329, "mean_token_accuracy": 0.201383475959301, "num_tokens": 42512885.0, "step": 24505 }, { "entropy": 5.660343360900879, "epoch": 1.9069830772223302, "grad_norm": 1.125, "learning_rate": 0.0004633064296255273, "loss": 5.0083, "mean_token_accuracy": 0.19845706075429917, "num_tokens": 42521481.0, "step": 24510 }, { "entropy": 5.714602041244507, "epoch": 1.9073721065940479, "grad_norm": 1.1640625, "learning_rate": 0.00046329125864897307, "loss": 5.0662, "mean_token_accuracy": 0.19484372437000275, "num_tokens": 42529784.0, "step": 24515 }, { "entropy": 5.656867122650146, "epoch": 1.9077611359657656, "grad_norm": 1.09375, "learning_rate": 0.0004632760848153987, "loss": 4.9426, "mean_token_accuracy": 0.2061595305800438, "num_tokens": 42538802.0, "step": 24520 }, { "entropy": 5.672155904769897, "epoch": 1.9081501653374828, "grad_norm": 1.2890625, "learning_rate": 0.0004632609081250345, "loss": 4.985, "mean_token_accuracy": 0.19744465947151185, "num_tokens": 42547699.0, "step": 24525 }, { "entropy": 5.688351774215699, "epoch": 1.9085391947092005, "grad_norm": 1.2421875, "learning_rate": 0.00046324572857811054, "loss": 5.0452, "mean_token_accuracy": 0.19838589280843735, "num_tokens": 42556583.0, "step": 24530 }, { "entropy": 5.611498403549194, "epoch": 1.9089282240809182, "grad_norm": 1.109375, "learning_rate": 0.0004632305461748573, "loss": 4.9469, "mean_token_accuracy": 0.21325928270816802, "num_tokens": 42565025.0, "step": 24535 }, { "entropy": 5.6442724704742435, "epoch": 1.9093172534526357, "grad_norm": 1.2421875, "learning_rate": 0.00046321536091550517, "loss": 5.0483, "mean_token_accuracy": 0.1989640474319458, "num_tokens": 42573798.0, "step": 24540 }, { "entropy": 5.718202304840088, "epoch": 1.9097062828243532, "grad_norm": 1.1796875, "learning_rate": 0.0004632001728002845, "loss": 5.0257, "mean_token_accuracy": 0.20260567516088485, "num_tokens": 42582002.0, "step": 24545 }, { "entropy": 5.777220106124878, "epoch": 1.9100953121960709, "grad_norm": 1.203125, "learning_rate": 0.0004631849818294257, "loss": 5.0461, "mean_token_accuracy": 0.1970430076122284, "num_tokens": 42591387.0, "step": 24550 }, { "entropy": 5.741730785369873, "epoch": 1.9104843415677883, "grad_norm": 1.3203125, "learning_rate": 0.00046316978800315934, "loss": 5.1143, "mean_token_accuracy": 0.20090012401342391, "num_tokens": 42599769.0, "step": 24555 }, { "entropy": 5.60371618270874, "epoch": 1.9108733709395058, "grad_norm": 1.171875, "learning_rate": 0.000463154591321716, "loss": 4.9644, "mean_token_accuracy": 0.2052150085568428, "num_tokens": 42608279.0, "step": 24560 }, { "entropy": 5.641292524337769, "epoch": 1.9112624003112235, "grad_norm": 1.1015625, "learning_rate": 0.00046313939178532624, "loss": 5.0369, "mean_token_accuracy": 0.19688843190670013, "num_tokens": 42616652.0, "step": 24565 }, { "entropy": 5.638890123367309, "epoch": 1.9116514296829412, "grad_norm": 1.0703125, "learning_rate": 0.0004631241893942206, "loss": 5.0016, "mean_token_accuracy": 0.19857836067676543, "num_tokens": 42625629.0, "step": 24570 }, { "entropy": 5.677545595169067, "epoch": 1.9120404590546585, "grad_norm": 1.203125, "learning_rate": 0.00046310898414862983, "loss": 5.0823, "mean_token_accuracy": 0.20221803337335587, "num_tokens": 42634159.0, "step": 24575 }, { "entropy": 5.743991088867188, "epoch": 1.9124294884263762, "grad_norm": 1.109375, "learning_rate": 0.0004630937760487847, "loss": 5.1482, "mean_token_accuracy": 0.1890771880745888, "num_tokens": 42642880.0, "step": 24580 }, { "entropy": 5.697179937362671, "epoch": 1.9128185177980939, "grad_norm": 1.1796875, "learning_rate": 0.0004630785650949158, "loss": 5.0869, "mean_token_accuracy": 0.1961984694004059, "num_tokens": 42651481.0, "step": 24585 }, { "entropy": 5.7100200176239015, "epoch": 1.9132075471698113, "grad_norm": 1.0703125, "learning_rate": 0.0004630633512872541, "loss": 5.0566, "mean_token_accuracy": 0.20454505532979966, "num_tokens": 42660131.0, "step": 24590 }, { "entropy": 5.664259052276611, "epoch": 1.9135965765415288, "grad_norm": 1.1875, "learning_rate": 0.00046304813462603035, "loss": 5.0797, "mean_token_accuracy": 0.20387784540653228, "num_tokens": 42669094.0, "step": 24595 }, { "entropy": 5.676291418075562, "epoch": 1.9139856059132465, "grad_norm": 1.125, "learning_rate": 0.0004630329151114754, "loss": 5.0123, "mean_token_accuracy": 0.20979381799697877, "num_tokens": 42677792.0, "step": 24600 }, { "entropy": 5.725220823287964, "epoch": 1.914374635284964, "grad_norm": 1.1328125, "learning_rate": 0.00046301769274382034, "loss": 5.0953, "mean_token_accuracy": 0.19348185509443283, "num_tokens": 42686397.0, "step": 24605 }, { "entropy": 5.697055244445801, "epoch": 1.9147636646566815, "grad_norm": 1.1328125, "learning_rate": 0.0004630024675232961, "loss": 5.0259, "mean_token_accuracy": 0.20506162643432618, "num_tokens": 42695832.0, "step": 24610 }, { "entropy": 5.674222087860107, "epoch": 1.9151526940283992, "grad_norm": 1.1171875, "learning_rate": 0.00046298723945013354, "loss": 5.0458, "mean_token_accuracy": 0.19670222103595733, "num_tokens": 42704378.0, "step": 24615 }, { "entropy": 5.6558003425598145, "epoch": 1.9155417234001169, "grad_norm": 1.0390625, "learning_rate": 0.0004629720085245639, "loss": 5.0032, "mean_token_accuracy": 0.19691879600286483, "num_tokens": 42713926.0, "step": 24620 }, { "entropy": 5.726751518249512, "epoch": 1.9159307527718341, "grad_norm": 1.1875, "learning_rate": 0.0004629567747468182, "loss": 4.9749, "mean_token_accuracy": 0.20231074392795562, "num_tokens": 42722779.0, "step": 24625 }, { "entropy": 5.689429044723511, "epoch": 1.9163197821435518, "grad_norm": 1.140625, "learning_rate": 0.0004629415381171276, "loss": 4.9647, "mean_token_accuracy": 0.2019610345363617, "num_tokens": 42731460.0, "step": 24630 }, { "entropy": 5.6924498081207275, "epoch": 1.9167088115152695, "grad_norm": 1.1796875, "learning_rate": 0.00046292629863572325, "loss": 5.0535, "mean_token_accuracy": 0.19991564005613327, "num_tokens": 42739733.0, "step": 24635 }, { "entropy": 5.753908491134643, "epoch": 1.917097840886987, "grad_norm": 1.2578125, "learning_rate": 0.0004629110563028365, "loss": 5.0719, "mean_token_accuracy": 0.19914218932390212, "num_tokens": 42748330.0, "step": 24640 }, { "entropy": 5.695810317993164, "epoch": 1.9174868702587045, "grad_norm": 1.078125, "learning_rate": 0.0004628958111186985, "loss": 5.0751, "mean_token_accuracy": 0.19527909755706788, "num_tokens": 42757423.0, "step": 24645 }, { "entropy": 5.668301963806153, "epoch": 1.9178758996304222, "grad_norm": 1.21875, "learning_rate": 0.0004628805630835407, "loss": 5.0847, "mean_token_accuracy": 0.192294117808342, "num_tokens": 42766213.0, "step": 24650 }, { "entropy": 5.748909664154053, "epoch": 1.9182649290021396, "grad_norm": 1.2421875, "learning_rate": 0.0004628653121975944, "loss": 5.0907, "mean_token_accuracy": 0.20167043358087539, "num_tokens": 42774037.0, "step": 24655 }, { "entropy": 5.688054895401001, "epoch": 1.918653958373857, "grad_norm": 1.2265625, "learning_rate": 0.000462850058461091, "loss": 5.1383, "mean_token_accuracy": 0.1927604928612709, "num_tokens": 42782806.0, "step": 24660 }, { "entropy": 5.599278163909912, "epoch": 1.9190429877455748, "grad_norm": 1.2421875, "learning_rate": 0.0004628348018742619, "loss": 4.9692, "mean_token_accuracy": 0.19859009683132173, "num_tokens": 42791790.0, "step": 24665 }, { "entropy": 5.725513744354248, "epoch": 1.9194320171172925, "grad_norm": 1.1796875, "learning_rate": 0.0004628195424373387, "loss": 5.1401, "mean_token_accuracy": 0.18950953036546708, "num_tokens": 42799966.0, "step": 24670 }, { "entropy": 5.696822452545166, "epoch": 1.91982104648901, "grad_norm": 1.140625, "learning_rate": 0.00046280428015055286, "loss": 5.0379, "mean_token_accuracy": 0.20477413833141328, "num_tokens": 42808022.0, "step": 24675 }, { "entropy": 5.681642007827759, "epoch": 1.9202100758607274, "grad_norm": 1.3046875, "learning_rate": 0.00046278901501413606, "loss": 4.957, "mean_token_accuracy": 0.21134666502475738, "num_tokens": 42816191.0, "step": 24680 }, { "entropy": 5.693042469024658, "epoch": 1.9205991052324451, "grad_norm": 1.1484375, "learning_rate": 0.00046277374702831983, "loss": 5.0534, "mean_token_accuracy": 0.19525159299373626, "num_tokens": 42824840.0, "step": 24685 }, { "entropy": 5.672334671020508, "epoch": 1.9209881346041626, "grad_norm": 1.125, "learning_rate": 0.00046275847619333576, "loss": 5.0396, "mean_token_accuracy": 0.1973715215921402, "num_tokens": 42833788.0, "step": 24690 }, { "entropy": 5.734400939941406, "epoch": 1.92137716397588, "grad_norm": 1.0859375, "learning_rate": 0.00046274320250941576, "loss": 5.0836, "mean_token_accuracy": 0.19542493373155595, "num_tokens": 42842666.0, "step": 24695 }, { "entropy": 5.775894498825073, "epoch": 1.9217661933475978, "grad_norm": 1.171875, "learning_rate": 0.00046272792597679146, "loss": 5.1169, "mean_token_accuracy": 0.1904724881052971, "num_tokens": 42850725.0, "step": 24700 }, { "entropy": 5.680692195892334, "epoch": 1.9221552227193153, "grad_norm": 1.1484375, "learning_rate": 0.00046271264659569474, "loss": 5.0681, "mean_token_accuracy": 0.19184989780187606, "num_tokens": 42859732.0, "step": 24705 }, { "entropy": 5.715995359420776, "epoch": 1.9225442520910327, "grad_norm": 1.21875, "learning_rate": 0.0004626973643663573, "loss": 5.0564, "mean_token_accuracy": 0.19708100259304046, "num_tokens": 42868858.0, "step": 24710 }, { "entropy": 5.722647571563721, "epoch": 1.9229332814627504, "grad_norm": 1.1328125, "learning_rate": 0.0004626820792890112, "loss": 5.0865, "mean_token_accuracy": 0.19535237103700637, "num_tokens": 42877483.0, "step": 24715 }, { "entropy": 5.680809354782104, "epoch": 1.9233223108344681, "grad_norm": 1.2265625, "learning_rate": 0.0004626667913638882, "loss": 4.9326, "mean_token_accuracy": 0.21316238939762117, "num_tokens": 42885156.0, "step": 24720 }, { "entropy": 5.730360412597657, "epoch": 1.9237113402061856, "grad_norm": 1.15625, "learning_rate": 0.0004626515005912203, "loss": 5.1225, "mean_token_accuracy": 0.19758251160383225, "num_tokens": 42893599.0, "step": 24725 }, { "entropy": 5.679024171829224, "epoch": 1.924100369577903, "grad_norm": 1.1171875, "learning_rate": 0.0004626362069712397, "loss": 4.9986, "mean_token_accuracy": 0.2093589186668396, "num_tokens": 42902861.0, "step": 24730 }, { "entropy": 5.689429044723511, "epoch": 1.9244893989496208, "grad_norm": 1.1640625, "learning_rate": 0.0004626209105041782, "loss": 5.0547, "mean_token_accuracy": 0.19889709502458572, "num_tokens": 42911246.0, "step": 24735 }, { "entropy": 5.670091724395752, "epoch": 1.9248784283213383, "grad_norm": 1.21875, "learning_rate": 0.000462605611190268, "loss": 5.1332, "mean_token_accuracy": 0.194108085334301, "num_tokens": 42919526.0, "step": 24740 }, { "entropy": 5.666739797592163, "epoch": 1.9252674576930557, "grad_norm": 1.171875, "learning_rate": 0.00046259030902974133, "loss": 4.952, "mean_token_accuracy": 0.20560158789157867, "num_tokens": 42927473.0, "step": 24745 }, { "entropy": 5.644410848617554, "epoch": 1.9256564870647734, "grad_norm": 1.109375, "learning_rate": 0.0004625750040228302, "loss": 5.0159, "mean_token_accuracy": 0.20053688436746597, "num_tokens": 42936108.0, "step": 24750 }, { "entropy": 5.629378366470337, "epoch": 1.926045516436491, "grad_norm": 1.2890625, "learning_rate": 0.00046255969616976704, "loss": 4.9465, "mean_token_accuracy": 0.20834380388259888, "num_tokens": 42944147.0, "step": 24755 }, { "entropy": 5.665427732467651, "epoch": 1.9264345458082084, "grad_norm": 1.0625, "learning_rate": 0.000462544385470784, "loss": 5.1342, "mean_token_accuracy": 0.1902235969901085, "num_tokens": 42952674.0, "step": 24760 }, { "entropy": 5.665197038650513, "epoch": 1.926823575179926, "grad_norm": 1.140625, "learning_rate": 0.0004625290719261134, "loss": 5.0126, "mean_token_accuracy": 0.20286975353956221, "num_tokens": 42960907.0, "step": 24765 }, { "entropy": 5.685473823547364, "epoch": 1.9272126045516438, "grad_norm": 1.2109375, "learning_rate": 0.0004625137555359876, "loss": 5.0076, "mean_token_accuracy": 0.194828163087368, "num_tokens": 42968875.0, "step": 24770 }, { "entropy": 5.692585468292236, "epoch": 1.9276016339233613, "grad_norm": 1.1796875, "learning_rate": 0.00046249843630063905, "loss": 5.0266, "mean_token_accuracy": 0.20408463180065156, "num_tokens": 42977062.0, "step": 24775 }, { "entropy": 5.668549203872681, "epoch": 1.9279906632950787, "grad_norm": 1.1640625, "learning_rate": 0.0004624831142203001, "loss": 5.0032, "mean_token_accuracy": 0.20419415533542634, "num_tokens": 42985346.0, "step": 24780 }, { "entropy": 5.656054210662842, "epoch": 1.9283796926667964, "grad_norm": 1.1796875, "learning_rate": 0.00046246778929520346, "loss": 5.0654, "mean_token_accuracy": 0.18509457260370255, "num_tokens": 42993529.0, "step": 24785 }, { "entropy": 5.7392017364501955, "epoch": 1.928768722038514, "grad_norm": 1.1484375, "learning_rate": 0.0004624524615255814, "loss": 5.068, "mean_token_accuracy": 0.1970072254538536, "num_tokens": 43002254.0, "step": 24790 }, { "entropy": 5.679862833023071, "epoch": 1.9291577514102314, "grad_norm": 1.1875, "learning_rate": 0.00046243713091166655, "loss": 5.0453, "mean_token_accuracy": 0.20193109959363936, "num_tokens": 43011130.0, "step": 24795 }, { "entropy": 5.642696666717529, "epoch": 1.929546780781949, "grad_norm": 1.203125, "learning_rate": 0.0004624217974536916, "loss": 4.9932, "mean_token_accuracy": 0.20740202218294143, "num_tokens": 43019185.0, "step": 24800 }, { "entropy": 5.737049150466919, "epoch": 1.9299358101536666, "grad_norm": 1.2734375, "learning_rate": 0.00046240646115188925, "loss": 5.1968, "mean_token_accuracy": 0.18931230902671814, "num_tokens": 43028817.0, "step": 24805 }, { "entropy": 5.688579940795899, "epoch": 1.930324839525384, "grad_norm": 1.203125, "learning_rate": 0.0004623911220064921, "loss": 5.0191, "mean_token_accuracy": 0.20310221016407012, "num_tokens": 43038205.0, "step": 24810 }, { "entropy": 5.654299974441528, "epoch": 1.9307138688971017, "grad_norm": 1.1640625, "learning_rate": 0.00046237578001773297, "loss": 5.0434, "mean_token_accuracy": 0.19733235687017442, "num_tokens": 43046844.0, "step": 24815 }, { "entropy": 5.680369710922241, "epoch": 1.9311028982688194, "grad_norm": 1.140625, "learning_rate": 0.00046236043518584454, "loss": 5.1311, "mean_token_accuracy": 0.193811796605587, "num_tokens": 43055928.0, "step": 24820 }, { "entropy": 5.735134601593018, "epoch": 1.931491927640537, "grad_norm": 1.1875, "learning_rate": 0.0004623450875110597, "loss": 5.0654, "mean_token_accuracy": 0.1998404085636139, "num_tokens": 43065371.0, "step": 24825 }, { "entropy": 5.732225799560547, "epoch": 1.9318809570122544, "grad_norm": 1.2109375, "learning_rate": 0.00046232973699361147, "loss": 5.0069, "mean_token_accuracy": 0.19985468536615372, "num_tokens": 43073486.0, "step": 24830 }, { "entropy": 5.636778211593628, "epoch": 1.932269986383972, "grad_norm": 1.1328125, "learning_rate": 0.0004623143836337326, "loss": 5.0505, "mean_token_accuracy": 0.20184364765882493, "num_tokens": 43083028.0, "step": 24835 }, { "entropy": 5.636121416091919, "epoch": 1.9326590157556895, "grad_norm": 1.2109375, "learning_rate": 0.00046229902743165607, "loss": 5.0425, "mean_token_accuracy": 0.19869482964277269, "num_tokens": 43091134.0, "step": 24840 }, { "entropy": 5.708029317855835, "epoch": 1.933048045127407, "grad_norm": 1.1796875, "learning_rate": 0.0004622836683876149, "loss": 5.0848, "mean_token_accuracy": 0.19872661232948302, "num_tokens": 43099849.0, "step": 24845 }, { "entropy": 5.71333065032959, "epoch": 1.9334370744991247, "grad_norm": 1.1328125, "learning_rate": 0.0004622683065018422, "loss": 5.0355, "mean_token_accuracy": 0.1981332778930664, "num_tokens": 43108311.0, "step": 24850 }, { "entropy": 5.674883460998535, "epoch": 1.9338261038708422, "grad_norm": 1.1171875, "learning_rate": 0.00046225294177457105, "loss": 4.9317, "mean_token_accuracy": 0.20503869354724885, "num_tokens": 43116179.0, "step": 24855 }, { "entropy": 5.600819826126099, "epoch": 1.9342151332425597, "grad_norm": 1.0703125, "learning_rate": 0.00046223757420603445, "loss": 4.9646, "mean_token_accuracy": 0.20399170368909836, "num_tokens": 43125728.0, "step": 24860 }, { "entropy": 5.598449850082398, "epoch": 1.9346041626142774, "grad_norm": 1.140625, "learning_rate": 0.0004622222037964658, "loss": 4.9376, "mean_token_accuracy": 0.20348993241786956, "num_tokens": 43134512.0, "step": 24865 }, { "entropy": 5.622919511795044, "epoch": 1.934993191985995, "grad_norm": 1.1953125, "learning_rate": 0.00046220683054609815, "loss": 4.9999, "mean_token_accuracy": 0.20116004347801208, "num_tokens": 43144831.0, "step": 24870 }, { "entropy": 5.68464150428772, "epoch": 1.9353822213577125, "grad_norm": 1.140625, "learning_rate": 0.00046219145445516483, "loss": 5.0808, "mean_token_accuracy": 0.1960323229432106, "num_tokens": 43153614.0, "step": 24875 }, { "entropy": 5.69285020828247, "epoch": 1.93577125072943, "grad_norm": 1.09375, "learning_rate": 0.00046217607552389905, "loss": 5.0655, "mean_token_accuracy": 0.19818117022514342, "num_tokens": 43162004.0, "step": 24880 }, { "entropy": 5.670533895492554, "epoch": 1.9361602801011477, "grad_norm": 1.2421875, "learning_rate": 0.00046216069375253435, "loss": 4.9883, "mean_token_accuracy": 0.20691214203834535, "num_tokens": 43170255.0, "step": 24885 }, { "entropy": 5.633712339401245, "epoch": 1.9365493094728652, "grad_norm": 1.125, "learning_rate": 0.000462145309141304, "loss": 5.0684, "mean_token_accuracy": 0.1982306033372879, "num_tokens": 43179036.0, "step": 24890 }, { "entropy": 5.723203325271607, "epoch": 1.9369383388445827, "grad_norm": 1.171875, "learning_rate": 0.0004621299216904414, "loss": 5.0823, "mean_token_accuracy": 0.1950405389070511, "num_tokens": 43187207.0, "step": 24895 }, { "entropy": 5.6816870212554935, "epoch": 1.9373273682163004, "grad_norm": 1.171875, "learning_rate": 0.00046211453140018006, "loss": 5.0717, "mean_token_accuracy": 0.19018362015485762, "num_tokens": 43195600.0, "step": 24900 }, { "entropy": 5.709857368469239, "epoch": 1.937716397588018, "grad_norm": 1.1796875, "learning_rate": 0.0004620991382707537, "loss": 5.0779, "mean_token_accuracy": 0.2035515621304512, "num_tokens": 43204069.0, "step": 24905 }, { "entropy": 5.692591142654419, "epoch": 1.9381054269597353, "grad_norm": 1.0859375, "learning_rate": 0.00046208374230239556, "loss": 5.1354, "mean_token_accuracy": 0.19016434848308564, "num_tokens": 43212998.0, "step": 24910 }, { "entropy": 5.737407112121582, "epoch": 1.938494456331453, "grad_norm": 1.0859375, "learning_rate": 0.0004620683434953394, "loss": 5.086, "mean_token_accuracy": 0.1937735676765442, "num_tokens": 43222411.0, "step": 24915 }, { "entropy": 5.699862766265869, "epoch": 1.9388834857031707, "grad_norm": 1.2578125, "learning_rate": 0.00046205294184981896, "loss": 5.0396, "mean_token_accuracy": 0.19747995287179948, "num_tokens": 43231265.0, "step": 24920 }, { "entropy": 5.7016222953796385, "epoch": 1.9392725150748882, "grad_norm": 1.1484375, "learning_rate": 0.00046203753736606787, "loss": 5.0394, "mean_token_accuracy": 0.19650323390960694, "num_tokens": 43240609.0, "step": 24925 }, { "entropy": 5.713491201400757, "epoch": 1.9396615444466057, "grad_norm": 1.15625, "learning_rate": 0.0004620221300443197, "loss": 5.0544, "mean_token_accuracy": 0.20287737548351287, "num_tokens": 43249381.0, "step": 24930 }, { "entropy": 5.702598142623901, "epoch": 1.9400505738183234, "grad_norm": 1.1328125, "learning_rate": 0.0004620067198848086, "loss": 5.0275, "mean_token_accuracy": 0.1996012806892395, "num_tokens": 43257653.0, "step": 24935 }, { "entropy": 5.71220326423645, "epoch": 1.9404396031900408, "grad_norm": 1.1953125, "learning_rate": 0.00046199130688776805, "loss": 5.1243, "mean_token_accuracy": 0.19815213978290558, "num_tokens": 43267111.0, "step": 24940 }, { "entropy": 5.661815547943116, "epoch": 1.9408286325617583, "grad_norm": 1.1875, "learning_rate": 0.00046197589105343204, "loss": 4.9933, "mean_token_accuracy": 0.20314147025346757, "num_tokens": 43276207.0, "step": 24945 }, { "entropy": 5.737192058563233, "epoch": 1.941217661933476, "grad_norm": 1.1015625, "learning_rate": 0.0004619604723820345, "loss": 5.0419, "mean_token_accuracy": 0.20260156095027923, "num_tokens": 43285031.0, "step": 24950 }, { "entropy": 5.72438268661499, "epoch": 1.9416066913051937, "grad_norm": 1.1796875, "learning_rate": 0.0004619450508738094, "loss": 5.0738, "mean_token_accuracy": 0.19643659442663192, "num_tokens": 43292802.0, "step": 24955 }, { "entropy": 5.721855974197387, "epoch": 1.941995720676911, "grad_norm": 1.1171875, "learning_rate": 0.00046192962652899056, "loss": 5.0207, "mean_token_accuracy": 0.20338866114616394, "num_tokens": 43302349.0, "step": 24960 }, { "entropy": 5.661811447143554, "epoch": 1.9423847500486286, "grad_norm": 1.109375, "learning_rate": 0.00046191419934781236, "loss": 4.9956, "mean_token_accuracy": 0.20217992961406708, "num_tokens": 43311455.0, "step": 24965 }, { "entropy": 5.671417093276977, "epoch": 1.9427737794203463, "grad_norm": 1.3203125, "learning_rate": 0.0004618987693305086, "loss": 5.0214, "mean_token_accuracy": 0.20294463485479355, "num_tokens": 43319924.0, "step": 24970 }, { "entropy": 5.708370018005371, "epoch": 1.9431628087920638, "grad_norm": 1.1015625, "learning_rate": 0.0004618833364773135, "loss": 5.1489, "mean_token_accuracy": 0.19678598195314406, "num_tokens": 43328772.0, "step": 24975 }, { "entropy": 5.66936502456665, "epoch": 1.9435518381637813, "grad_norm": 1.0703125, "learning_rate": 0.00046186790078846127, "loss": 5.0229, "mean_token_accuracy": 0.20237229019403458, "num_tokens": 43338862.0, "step": 24980 }, { "entropy": 5.696899843215943, "epoch": 1.943940867535499, "grad_norm": 1.109375, "learning_rate": 0.00046185246226418603, "loss": 5.0565, "mean_token_accuracy": 0.19844810962677, "num_tokens": 43347292.0, "step": 24985 }, { "entropy": 5.616959047317505, "epoch": 1.9443298969072165, "grad_norm": 1.1484375, "learning_rate": 0.00046183702090472206, "loss": 4.9908, "mean_token_accuracy": 0.2068087115883827, "num_tokens": 43356676.0, "step": 24990 }, { "entropy": 5.723744297027588, "epoch": 1.944718926278934, "grad_norm": 1.21875, "learning_rate": 0.0004618215767103037, "loss": 5.1452, "mean_token_accuracy": 0.19212857335805894, "num_tokens": 43364746.0, "step": 24995 }, { "entropy": 5.699723911285401, "epoch": 1.9451079556506516, "grad_norm": 1.21875, "learning_rate": 0.0004618061296811653, "loss": 4.9689, "mean_token_accuracy": 0.20378757268190384, "num_tokens": 43373541.0, "step": 25000 }, { "entropy": 5.688391780853271, "epoch": 1.9454969850223693, "grad_norm": 1.3046875, "learning_rate": 0.00046179067981754124, "loss": 4.9814, "mean_token_accuracy": 0.19692103266716005, "num_tokens": 43382524.0, "step": 25005 }, { "entropy": 5.605011510848999, "epoch": 1.9458860143940866, "grad_norm": 1.140625, "learning_rate": 0.00046177522711966584, "loss": 5.0189, "mean_token_accuracy": 0.20577212423086166, "num_tokens": 43391875.0, "step": 25010 }, { "entropy": 5.709514570236206, "epoch": 1.9462750437658043, "grad_norm": 1.140625, "learning_rate": 0.00046175977158777377, "loss": 5.1163, "mean_token_accuracy": 0.193670791387558, "num_tokens": 43399942.0, "step": 25015 }, { "entropy": 5.727441740036011, "epoch": 1.946664073137522, "grad_norm": 1.171875, "learning_rate": 0.0004617443132220993, "loss": 5.0863, "mean_token_accuracy": 0.19419944584369658, "num_tokens": 43409371.0, "step": 25020 }, { "entropy": 5.68810133934021, "epoch": 1.9470531025092395, "grad_norm": 1.1171875, "learning_rate": 0.00046172885202287717, "loss": 5.068, "mean_token_accuracy": 0.2046906530857086, "num_tokens": 43418181.0, "step": 25025 }, { "entropy": 5.623637390136719, "epoch": 1.947442131880957, "grad_norm": 1.2109375, "learning_rate": 0.00046171338799034194, "loss": 5.0198, "mean_token_accuracy": 0.20464629977941512, "num_tokens": 43426004.0, "step": 25030 }, { "entropy": 5.652096462249756, "epoch": 1.9478311612526746, "grad_norm": 1.1640625, "learning_rate": 0.0004616979211247282, "loss": 4.9283, "mean_token_accuracy": 0.20263815373182298, "num_tokens": 43433732.0, "step": 25035 }, { "entropy": 5.694263124465943, "epoch": 1.9482201906243921, "grad_norm": 1.1015625, "learning_rate": 0.00046168245142627065, "loss": 5.0665, "mean_token_accuracy": 0.2010141909122467, "num_tokens": 43442374.0, "step": 25040 }, { "entropy": 5.723499917984009, "epoch": 1.9486092199961096, "grad_norm": 1.2421875, "learning_rate": 0.0004616669788952041, "loss": 5.1035, "mean_token_accuracy": 0.19832152575254441, "num_tokens": 43451335.0, "step": 25045 }, { "entropy": 5.728225612640381, "epoch": 1.9489982493678273, "grad_norm": 1.0390625, "learning_rate": 0.00046165150353176315, "loss": 5.1091, "mean_token_accuracy": 0.1952285036444664, "num_tokens": 43459520.0, "step": 25050 }, { "entropy": 5.669061183929443, "epoch": 1.949387278739545, "grad_norm": 1.1796875, "learning_rate": 0.0004616360253361828, "loss": 5.0269, "mean_token_accuracy": 0.19924459159374236, "num_tokens": 43467695.0, "step": 25055 }, { "entropy": 5.6503904342651365, "epoch": 1.9497763081112622, "grad_norm": 1.1328125, "learning_rate": 0.00046162054430869777, "loss": 5.0821, "mean_token_accuracy": 0.19960678070783616, "num_tokens": 43476161.0, "step": 25060 }, { "entropy": 5.6617834091186525, "epoch": 1.95016533748298, "grad_norm": 1.125, "learning_rate": 0.000461605060449543, "loss": 4.9942, "mean_token_accuracy": 0.19702244251966478, "num_tokens": 43485106.0, "step": 25065 }, { "entropy": 5.719282722473144, "epoch": 1.9505543668546976, "grad_norm": 1.09375, "learning_rate": 0.00046158957375895353, "loss": 5.0888, "mean_token_accuracy": 0.1899719089269638, "num_tokens": 43494232.0, "step": 25070 }, { "entropy": 5.7387049198150635, "epoch": 1.950943396226415, "grad_norm": 1.1953125, "learning_rate": 0.0004615740842371643, "loss": 4.9995, "mean_token_accuracy": 0.2024102047085762, "num_tokens": 43502556.0, "step": 25075 }, { "entropy": 5.633154964447021, "epoch": 1.9513324255981326, "grad_norm": 1.1640625, "learning_rate": 0.00046155859188441023, "loss": 4.9591, "mean_token_accuracy": 0.2012600228190422, "num_tokens": 43511594.0, "step": 25080 }, { "entropy": 5.637977743148804, "epoch": 1.9517214549698503, "grad_norm": 1.09375, "learning_rate": 0.0004615430967009265, "loss": 5.093, "mean_token_accuracy": 0.19673862755298616, "num_tokens": 43520532.0, "step": 25085 }, { "entropy": 5.700028991699218, "epoch": 1.9521104843415678, "grad_norm": 1.1171875, "learning_rate": 0.00046152759868694815, "loss": 5.1048, "mean_token_accuracy": 0.19827057868242265, "num_tokens": 43529286.0, "step": 25090 }, { "entropy": 5.72367844581604, "epoch": 1.9524995137132852, "grad_norm": 1.140625, "learning_rate": 0.0004615120978427104, "loss": 5.0569, "mean_token_accuracy": 0.19502451717853547, "num_tokens": 43537983.0, "step": 25095 }, { "entropy": 5.682291316986084, "epoch": 1.952888543085003, "grad_norm": 1.109375, "learning_rate": 0.0004614965941684485, "loss": 5.007, "mean_token_accuracy": 0.20533406883478164, "num_tokens": 43546550.0, "step": 25100 }, { "entropy": 5.7151782512664795, "epoch": 1.9532775724567206, "grad_norm": 1.1953125, "learning_rate": 0.0004614810876643975, "loss": 5.0969, "mean_token_accuracy": 0.2019813746213913, "num_tokens": 43555006.0, "step": 25105 }, { "entropy": 5.7196849346160885, "epoch": 1.953666601828438, "grad_norm": 1.1875, "learning_rate": 0.00046146557833079286, "loss": 5.1581, "mean_token_accuracy": 0.19339825510978698, "num_tokens": 43563925.0, "step": 25110 }, { "entropy": 5.740710496902466, "epoch": 1.9540556312001556, "grad_norm": 1.1171875, "learning_rate": 0.0004614500661678698, "loss": 5.0532, "mean_token_accuracy": 0.19742967337369918, "num_tokens": 43572269.0, "step": 25115 }, { "entropy": 5.706193733215332, "epoch": 1.9544446605718733, "grad_norm": 1.1953125, "learning_rate": 0.0004614345511758639, "loss": 5.0691, "mean_token_accuracy": 0.19874023497104645, "num_tokens": 43579908.0, "step": 25120 }, { "entropy": 5.659958171844482, "epoch": 1.9548336899435907, "grad_norm": 1.1328125, "learning_rate": 0.00046141903335501034, "loss": 5.015, "mean_token_accuracy": 0.19763632863759995, "num_tokens": 43589328.0, "step": 25125 }, { "entropy": 5.683829927444458, "epoch": 1.9552227193153082, "grad_norm": 1.21875, "learning_rate": 0.0004614035127055447, "loss": 5.0596, "mean_token_accuracy": 0.20008797943592072, "num_tokens": 43597840.0, "step": 25130 }, { "entropy": 5.664583683013916, "epoch": 1.955611748687026, "grad_norm": 1.1796875, "learning_rate": 0.0004613879892277024, "loss": 5.0113, "mean_token_accuracy": 0.20468807816505433, "num_tokens": 43606496.0, "step": 25135 }, { "entropy": 5.727624893188477, "epoch": 1.9560007780587434, "grad_norm": 1.109375, "learning_rate": 0.000461372462921719, "loss": 5.0211, "mean_token_accuracy": 0.20284863114356994, "num_tokens": 43614411.0, "step": 25140 }, { "entropy": 5.612778854370117, "epoch": 1.9563898074304609, "grad_norm": 1.1953125, "learning_rate": 0.0004613569337878302, "loss": 4.9732, "mean_token_accuracy": 0.2039729431271553, "num_tokens": 43622842.0, "step": 25145 }, { "entropy": 5.680815315246582, "epoch": 1.9567788368021786, "grad_norm": 1.09375, "learning_rate": 0.0004613414018262715, "loss": 5.081, "mean_token_accuracy": 0.19264834970235825, "num_tokens": 43631535.0, "step": 25150 }, { "entropy": 5.724313402175904, "epoch": 1.9571678661738963, "grad_norm": 1.1171875, "learning_rate": 0.0004613258670372786, "loss": 5.075, "mean_token_accuracy": 0.19988464266061784, "num_tokens": 43640197.0, "step": 25155 }, { "entropy": 5.632492113113403, "epoch": 1.9575568955456137, "grad_norm": 1.0859375, "learning_rate": 0.0004613103294210873, "loss": 5.0124, "mean_token_accuracy": 0.2055905982851982, "num_tokens": 43648685.0, "step": 25160 }, { "entropy": 5.63893690109253, "epoch": 1.9579459249173312, "grad_norm": 1.2265625, "learning_rate": 0.00046129478897793323, "loss": 5.0327, "mean_token_accuracy": 0.19616321921348573, "num_tokens": 43657526.0, "step": 25165 }, { "entropy": 5.733870220184326, "epoch": 1.958334954289049, "grad_norm": 1.125, "learning_rate": 0.00046127924570805236, "loss": 5.0521, "mean_token_accuracy": 0.20517999231815337, "num_tokens": 43666119.0, "step": 25170 }, { "entropy": 5.7572027206420895, "epoch": 1.9587239836607664, "grad_norm": 1.125, "learning_rate": 0.0004612636996116803, "loss": 5.0335, "mean_token_accuracy": 0.19316034466028215, "num_tokens": 43674634.0, "step": 25175 }, { "entropy": 5.587348175048828, "epoch": 1.9591130130324839, "grad_norm": 1.0625, "learning_rate": 0.0004612481506890532, "loss": 4.9749, "mean_token_accuracy": 0.2059198796749115, "num_tokens": 43683329.0, "step": 25180 }, { "entropy": 5.652428865432739, "epoch": 1.9595020424042016, "grad_norm": 1.171875, "learning_rate": 0.00046123259894040677, "loss": 4.997, "mean_token_accuracy": 0.20335134565830232, "num_tokens": 43692598.0, "step": 25185 }, { "entropy": 5.6406090259552, "epoch": 1.959891071775919, "grad_norm": 1.25, "learning_rate": 0.000461217044365977, "loss": 4.9794, "mean_token_accuracy": 0.19794338643550874, "num_tokens": 43702260.0, "step": 25190 }, { "entropy": 5.741105222702027, "epoch": 1.9602801011476365, "grad_norm": 1.1796875, "learning_rate": 0.0004612014869660002, "loss": 5.0847, "mean_token_accuracy": 0.19749262034893036, "num_tokens": 43710003.0, "step": 25195 }, { "entropy": 5.699049425125122, "epoch": 1.9606691305193542, "grad_norm": 1.140625, "learning_rate": 0.00046118592674071197, "loss": 4.9994, "mean_token_accuracy": 0.2033785253763199, "num_tokens": 43718687.0, "step": 25200 }, { "entropy": 5.628763008117676, "epoch": 1.961058159891072, "grad_norm": 1.2890625, "learning_rate": 0.0004611703636903488, "loss": 4.9408, "mean_token_accuracy": 0.21014311909675598, "num_tokens": 43727051.0, "step": 25205 }, { "entropy": 5.652144813537598, "epoch": 1.9614471892627894, "grad_norm": 1.171875, "learning_rate": 0.0004611547978151466, "loss": 4.9824, "mean_token_accuracy": 0.20597678273916245, "num_tokens": 43735572.0, "step": 25210 }, { "entropy": 5.69415807723999, "epoch": 1.9618362186345069, "grad_norm": 1.171875, "learning_rate": 0.00046113922911534167, "loss": 5.0378, "mean_token_accuracy": 0.20135923326015473, "num_tokens": 43744286.0, "step": 25215 }, { "entropy": 5.683207893371582, "epoch": 1.9622252480062246, "grad_norm": 1.109375, "learning_rate": 0.0004611236575911702, "loss": 5.1179, "mean_token_accuracy": 0.19950320273637773, "num_tokens": 43754042.0, "step": 25220 }, { "entropy": 5.661234331130982, "epoch": 1.962614277377942, "grad_norm": 1.171875, "learning_rate": 0.00046110808324286844, "loss": 4.918, "mean_token_accuracy": 0.20831528156995774, "num_tokens": 43762031.0, "step": 25225 }, { "entropy": 5.694571018218994, "epoch": 1.9630033067496595, "grad_norm": 1.203125, "learning_rate": 0.00046109250607067275, "loss": 5.0853, "mean_token_accuracy": 0.20041561126708984, "num_tokens": 43770546.0, "step": 25230 }, { "entropy": 5.674601268768311, "epoch": 1.9633923361213772, "grad_norm": 1.1796875, "learning_rate": 0.0004610769260748196, "loss": 5.0659, "mean_token_accuracy": 0.2015522912144661, "num_tokens": 43779918.0, "step": 25235 }, { "entropy": 5.712134981155396, "epoch": 1.9637813654930947, "grad_norm": 1.1171875, "learning_rate": 0.0004610613432555451, "loss": 5.0424, "mean_token_accuracy": 0.19891495406627654, "num_tokens": 43788425.0, "step": 25240 }, { "entropy": 5.687092208862305, "epoch": 1.9641703948648122, "grad_norm": 1.21875, "learning_rate": 0.00046104575761308597, "loss": 5.081, "mean_token_accuracy": 0.1917901709675789, "num_tokens": 43797080.0, "step": 25245 }, { "entropy": 5.659074115753174, "epoch": 1.9645594242365298, "grad_norm": 1.1640625, "learning_rate": 0.0004610301691476786, "loss": 5.0305, "mean_token_accuracy": 0.20866090804338455, "num_tokens": 43806026.0, "step": 25250 }, { "entropy": 5.742336416244507, "epoch": 1.9649484536082475, "grad_norm": 1.1484375, "learning_rate": 0.0004610145778595594, "loss": 5.0714, "mean_token_accuracy": 0.20536938160657883, "num_tokens": 43814333.0, "step": 25255 }, { "entropy": 5.67303056716919, "epoch": 1.965337482979965, "grad_norm": 1.1484375, "learning_rate": 0.0004609989837489651, "loss": 4.9999, "mean_token_accuracy": 0.20021286457777024, "num_tokens": 43823235.0, "step": 25260 }, { "entropy": 5.7027748107910154, "epoch": 1.9657265123516825, "grad_norm": 1.1171875, "learning_rate": 0.00046098338681613234, "loss": 5.0472, "mean_token_accuracy": 0.2012014254927635, "num_tokens": 43832257.0, "step": 25265 }, { "entropy": 5.693505144119262, "epoch": 1.9661155417234002, "grad_norm": 1.328125, "learning_rate": 0.0004609677870612976, "loss": 4.9915, "mean_token_accuracy": 0.20833290070295335, "num_tokens": 43840359.0, "step": 25270 }, { "entropy": 5.621105766296386, "epoch": 1.9665045710951177, "grad_norm": 1.15625, "learning_rate": 0.0004609521844846978, "loss": 5.0995, "mean_token_accuracy": 0.19711009413003922, "num_tokens": 43849374.0, "step": 25275 }, { "entropy": 5.679486989974976, "epoch": 1.9668936004668351, "grad_norm": 1.2109375, "learning_rate": 0.0004609365790865695, "loss": 5.0904, "mean_token_accuracy": 0.19939954429864884, "num_tokens": 43857861.0, "step": 25280 }, { "entropy": 5.728759860992431, "epoch": 1.9672826298385528, "grad_norm": 1.1171875, "learning_rate": 0.00046092097086714956, "loss": 5.0783, "mean_token_accuracy": 0.19538939893245696, "num_tokens": 43865964.0, "step": 25285 }, { "entropy": 5.6879819393157955, "epoch": 1.9676716592102705, "grad_norm": 1.1640625, "learning_rate": 0.00046090535982667486, "loss": 4.9977, "mean_token_accuracy": 0.21127932667732238, "num_tokens": 43874434.0, "step": 25290 }, { "entropy": 5.68955807685852, "epoch": 1.9680606885819878, "grad_norm": 1.1328125, "learning_rate": 0.00046088974596538216, "loss": 5.0581, "mean_token_accuracy": 0.2008354365825653, "num_tokens": 43882691.0, "step": 25295 }, { "entropy": 5.7535323143005375, "epoch": 1.9684497179537055, "grad_norm": 1.203125, "learning_rate": 0.0004608741292835085, "loss": 5.0778, "mean_token_accuracy": 0.19867088049650192, "num_tokens": 43890589.0, "step": 25300 }, { "entropy": 5.736508893966675, "epoch": 1.9688387473254232, "grad_norm": 1.171875, "learning_rate": 0.0004608585097812907, "loss": 5.0641, "mean_token_accuracy": 0.2058962658047676, "num_tokens": 43898908.0, "step": 25305 }, { "entropy": 5.715743064880371, "epoch": 1.9692277766971407, "grad_norm": 1.140625, "learning_rate": 0.0004608428874589659, "loss": 5.1035, "mean_token_accuracy": 0.20044049620628357, "num_tokens": 43907640.0, "step": 25310 }, { "entropy": 5.66007809638977, "epoch": 1.9696168060688581, "grad_norm": 1.2109375, "learning_rate": 0.0004608272623167711, "loss": 4.9666, "mean_token_accuracy": 0.20785339325666427, "num_tokens": 43915757.0, "step": 25315 }, { "entropy": 5.745566463470459, "epoch": 1.9700058354405758, "grad_norm": 1.34375, "learning_rate": 0.00046081163435494335, "loss": 5.1183, "mean_token_accuracy": 0.19631423503160478, "num_tokens": 43924910.0, "step": 25320 }, { "entropy": 5.70884256362915, "epoch": 1.9703948648122933, "grad_norm": 1.2890625, "learning_rate": 0.0004607960035737198, "loss": 5.068, "mean_token_accuracy": 0.20402657389640808, "num_tokens": 43933122.0, "step": 25325 }, { "entropy": 5.6227329730987545, "epoch": 1.9707838941840108, "grad_norm": 1.171875, "learning_rate": 0.0004607803699733376, "loss": 5.03, "mean_token_accuracy": 0.20439278334379196, "num_tokens": 43941996.0, "step": 25330 }, { "entropy": 5.66074948310852, "epoch": 1.9711729235557285, "grad_norm": 1.1953125, "learning_rate": 0.000460764733554034, "loss": 4.9705, "mean_token_accuracy": 0.21043404787778855, "num_tokens": 43950637.0, "step": 25335 }, { "entropy": 5.715720176696777, "epoch": 1.9715619529274462, "grad_norm": 1.234375, "learning_rate": 0.00046074909431604623, "loss": 5.0595, "mean_token_accuracy": 0.1962682917714119, "num_tokens": 43959252.0, "step": 25340 }, { "entropy": 5.685758447647094, "epoch": 1.9719509822991634, "grad_norm": 1.1015625, "learning_rate": 0.0004607334522596116, "loss": 5.0253, "mean_token_accuracy": 0.1940817043185234, "num_tokens": 43968391.0, "step": 25345 }, { "entropy": 5.683940839767456, "epoch": 1.9723400116708811, "grad_norm": 1.0859375, "learning_rate": 0.0004607178073849675, "loss": 4.9678, "mean_token_accuracy": 0.20793296098709108, "num_tokens": 43977066.0, "step": 25350 }, { "entropy": 5.701573896408081, "epoch": 1.9727290410425988, "grad_norm": 1.125, "learning_rate": 0.0004607021596923512, "loss": 5.0307, "mean_token_accuracy": 0.2119439348578453, "num_tokens": 43985072.0, "step": 25355 }, { "entropy": 5.7974132061004635, "epoch": 1.9731180704143163, "grad_norm": 1.1796875, "learning_rate": 0.0004606865091820003, "loss": 5.2184, "mean_token_accuracy": 0.18994032144546508, "num_tokens": 43993321.0, "step": 25360 }, { "entropy": 5.607664346694946, "epoch": 1.9735070997860338, "grad_norm": 1.0703125, "learning_rate": 0.0004606708558541521, "loss": 4.9082, "mean_token_accuracy": 0.21403990387916566, "num_tokens": 44002476.0, "step": 25365 }, { "entropy": 5.690027379989624, "epoch": 1.9738961291577515, "grad_norm": 1.2109375, "learning_rate": 0.0004606551997090442, "loss": 5.1128, "mean_token_accuracy": 0.19725189507007598, "num_tokens": 44011790.0, "step": 25370 }, { "entropy": 5.662188100814819, "epoch": 1.974285158529469, "grad_norm": 1.140625, "learning_rate": 0.0004606395407469141, "loss": 5.0115, "mean_token_accuracy": 0.1975963830947876, "num_tokens": 44021086.0, "step": 25375 }, { "entropy": 5.64773006439209, "epoch": 1.9746741879011864, "grad_norm": 1.234375, "learning_rate": 0.0004606238789679995, "loss": 4.9785, "mean_token_accuracy": 0.20605355650186538, "num_tokens": 44029789.0, "step": 25380 }, { "entropy": 5.6224274158477785, "epoch": 1.9750632172729041, "grad_norm": 1.0390625, "learning_rate": 0.0004606082143725381, "loss": 5.0156, "mean_token_accuracy": 0.19660866856575013, "num_tokens": 44039508.0, "step": 25385 }, { "entropy": 5.671589279174805, "epoch": 1.9754522466446218, "grad_norm": 1.171875, "learning_rate": 0.0004605925469607673, "loss": 5.0206, "mean_token_accuracy": 0.2061230480670929, "num_tokens": 44048464.0, "step": 25390 }, { "entropy": 5.790804386138916, "epoch": 1.975841276016339, "grad_norm": 1.171875, "learning_rate": 0.00046057687673292506, "loss": 5.1257, "mean_token_accuracy": 0.19666651785373687, "num_tokens": 44057613.0, "step": 25395 }, { "entropy": 5.652014827728271, "epoch": 1.9762303053880568, "grad_norm": 1.21875, "learning_rate": 0.00046056120368924907, "loss": 4.9155, "mean_token_accuracy": 0.2143044278025627, "num_tokens": 44066334.0, "step": 25400 }, { "entropy": 5.678717136383057, "epoch": 1.9766193347597745, "grad_norm": 1.0859375, "learning_rate": 0.0004605455278299772, "loss": 5.1578, "mean_token_accuracy": 0.19586342126131057, "num_tokens": 44076355.0, "step": 25405 }, { "entropy": 5.734120035171509, "epoch": 1.977008364131492, "grad_norm": 1.1171875, "learning_rate": 0.0004605298491553472, "loss": 5.0873, "mean_token_accuracy": 0.19350172579288483, "num_tokens": 44084445.0, "step": 25410 }, { "entropy": 5.709806442260742, "epoch": 1.9773973935032094, "grad_norm": 1.1171875, "learning_rate": 0.0004605141676655971, "loss": 5.0202, "mean_token_accuracy": 0.2078096255660057, "num_tokens": 44093711.0, "step": 25415 }, { "entropy": 5.675356197357178, "epoch": 1.9777864228749271, "grad_norm": 1.1171875, "learning_rate": 0.00046049848336096485, "loss": 5.0339, "mean_token_accuracy": 0.1947970747947693, "num_tokens": 44102647.0, "step": 25420 }, { "entropy": 5.694596862792968, "epoch": 1.9781754522466446, "grad_norm": 1.1640625, "learning_rate": 0.0004604827962416883, "loss": 4.9447, "mean_token_accuracy": 0.20636706054210663, "num_tokens": 44110661.0, "step": 25425 }, { "entropy": 5.759284353256225, "epoch": 1.978564481618362, "grad_norm": 1.1640625, "learning_rate": 0.0004604671063080055, "loss": 5.1851, "mean_token_accuracy": 0.18675361275672914, "num_tokens": 44119441.0, "step": 25430 }, { "entropy": 5.672123956680298, "epoch": 1.9789535109900798, "grad_norm": 1.1484375, "learning_rate": 0.0004604514135601546, "loss": 4.9747, "mean_token_accuracy": 0.20359019935131073, "num_tokens": 44127774.0, "step": 25435 }, { "entropy": 5.746460390090943, "epoch": 1.9793425403617975, "grad_norm": 1.1640625, "learning_rate": 0.0004604357179983736, "loss": 5.2082, "mean_token_accuracy": 0.1801075428724289, "num_tokens": 44137075.0, "step": 25440 }, { "entropy": 5.638615465164184, "epoch": 1.9797315697335147, "grad_norm": 1.09375, "learning_rate": 0.0004604200196229009, "loss": 4.9598, "mean_token_accuracy": 0.20288174152374266, "num_tokens": 44145647.0, "step": 25445 }, { "entropy": 5.658754348754883, "epoch": 1.9801205991052324, "grad_norm": 1.1796875, "learning_rate": 0.0004604043184339744, "loss": 4.9156, "mean_token_accuracy": 0.20674976706504822, "num_tokens": 44154267.0, "step": 25450 }, { "entropy": 5.6858209609985355, "epoch": 1.9805096284769501, "grad_norm": 1.171875, "learning_rate": 0.0004603886144318325, "loss": 5.0673, "mean_token_accuracy": 0.1997123286128044, "num_tokens": 44162532.0, "step": 25455 }, { "entropy": 5.721542549133301, "epoch": 1.9808986578486676, "grad_norm": 1.2421875, "learning_rate": 0.00046037290761671346, "loss": 5.0591, "mean_token_accuracy": 0.20254214704036713, "num_tokens": 44171218.0, "step": 25460 }, { "entropy": 5.6671037673950195, "epoch": 1.981287687220385, "grad_norm": 1.1875, "learning_rate": 0.0004603571979888556, "loss": 5.1139, "mean_token_accuracy": 0.1940985918045044, "num_tokens": 44180189.0, "step": 25465 }, { "entropy": 5.688149785995483, "epoch": 1.9816767165921028, "grad_norm": 1.1484375, "learning_rate": 0.0004603414855484973, "loss": 4.9742, "mean_token_accuracy": 0.20860636681318284, "num_tokens": 44189048.0, "step": 25470 }, { "entropy": 5.699688911437988, "epoch": 1.9820657459638202, "grad_norm": 1.2109375, "learning_rate": 0.000460325770295877, "loss": 5.0603, "mean_token_accuracy": 0.19870493412017823, "num_tokens": 44197995.0, "step": 25475 }, { "entropy": 5.722847890853882, "epoch": 1.9824547753355377, "grad_norm": 1.15625, "learning_rate": 0.00046031005223123297, "loss": 5.166, "mean_token_accuracy": 0.18669108152389527, "num_tokens": 44207042.0, "step": 25480 }, { "entropy": 5.6642577171325685, "epoch": 1.9828438047072554, "grad_norm": 1.1796875, "learning_rate": 0.000460294331354804, "loss": 4.9599, "mean_token_accuracy": 0.21300921142101287, "num_tokens": 44214678.0, "step": 25485 }, { "entropy": 5.617475605010986, "epoch": 1.983232834078973, "grad_norm": 1.1484375, "learning_rate": 0.0004602786076668283, "loss": 4.9891, "mean_token_accuracy": 0.20738008320331575, "num_tokens": 44223752.0, "step": 25490 }, { "entropy": 5.706676864624024, "epoch": 1.9836218634506906, "grad_norm": 1.234375, "learning_rate": 0.00046026288116754477, "loss": 5.0557, "mean_token_accuracy": 0.19884685426950455, "num_tokens": 44232109.0, "step": 25495 }, { "entropy": 5.778555107116699, "epoch": 1.984010892822408, "grad_norm": 1.234375, "learning_rate": 0.0004602471518571919, "loss": 5.1791, "mean_token_accuracy": 0.187676078081131, "num_tokens": 44239957.0, "step": 25500 }, { "entropy": 5.767152786254883, "epoch": 1.9843999221941258, "grad_norm": 1.171875, "learning_rate": 0.0004602314197360083, "loss": 5.0474, "mean_token_accuracy": 0.20314751118421553, "num_tokens": 44248582.0, "step": 25505 }, { "entropy": 5.757918500900269, "epoch": 1.9847889515658432, "grad_norm": 1.2109375, "learning_rate": 0.0004602156848042328, "loss": 5.0455, "mean_token_accuracy": 0.19783039391040802, "num_tokens": 44256711.0, "step": 25510 }, { "entropy": 5.6873878002166744, "epoch": 1.9851779809375607, "grad_norm": 1.1875, "learning_rate": 0.000460199947062104, "loss": 5.0179, "mean_token_accuracy": 0.20318072140216828, "num_tokens": 44265140.0, "step": 25515 }, { "entropy": 5.737044477462769, "epoch": 1.9855670103092784, "grad_norm": 1.1875, "learning_rate": 0.00046018420650986074, "loss": 5.0187, "mean_token_accuracy": 0.19934685230255128, "num_tokens": 44273560.0, "step": 25520 }, { "entropy": 5.635279893875122, "epoch": 1.9859560396809959, "grad_norm": 1.1171875, "learning_rate": 0.000460168463147742, "loss": 4.9339, "mean_token_accuracy": 0.20691336840391159, "num_tokens": 44282155.0, "step": 25525 }, { "entropy": 5.690180063247681, "epoch": 1.9863450690527134, "grad_norm": 1.1484375, "learning_rate": 0.0004601527169759865, "loss": 4.9728, "mean_token_accuracy": 0.20464201271533966, "num_tokens": 44291237.0, "step": 25530 }, { "entropy": 5.681266117095947, "epoch": 1.986734098424431, "grad_norm": 1.1328125, "learning_rate": 0.0004601369679948333, "loss": 5.0057, "mean_token_accuracy": 0.19905872792005538, "num_tokens": 44299886.0, "step": 25535 }, { "entropy": 5.692330741882325, "epoch": 1.9871231277961487, "grad_norm": 1.1484375, "learning_rate": 0.00046012121620452127, "loss": 5.1277, "mean_token_accuracy": 0.20163533538579942, "num_tokens": 44308247.0, "step": 25540 }, { "entropy": 5.717720460891724, "epoch": 1.9875121571678662, "grad_norm": 1.1953125, "learning_rate": 0.0004601054616052893, "loss": 5.0096, "mean_token_accuracy": 0.2031998246908188, "num_tokens": 44316301.0, "step": 25545 }, { "entropy": 5.810669040679931, "epoch": 1.9879011865395837, "grad_norm": 1.15625, "learning_rate": 0.00046008970419737674, "loss": 5.1456, "mean_token_accuracy": 0.18856994509696962, "num_tokens": 44324758.0, "step": 25550 }, { "entropy": 5.75964126586914, "epoch": 1.9882902159113014, "grad_norm": 1.21875, "learning_rate": 0.0004600739439810225, "loss": 5.1349, "mean_token_accuracy": 0.1874127745628357, "num_tokens": 44333139.0, "step": 25555 }, { "entropy": 5.744812822341919, "epoch": 1.9886792452830189, "grad_norm": 1.2421875, "learning_rate": 0.00046005818095646564, "loss": 5.0819, "mean_token_accuracy": 0.2012840449810028, "num_tokens": 44341992.0, "step": 25560 }, { "entropy": 5.684985208511352, "epoch": 1.9890682746547363, "grad_norm": 1.2421875, "learning_rate": 0.00046004241512394544, "loss": 5.051, "mean_token_accuracy": 0.19588932543992996, "num_tokens": 44350947.0, "step": 25565 }, { "entropy": 5.678867483139038, "epoch": 1.989457304026454, "grad_norm": 1.2109375, "learning_rate": 0.0004600266464837012, "loss": 5.0154, "mean_token_accuracy": 0.2034503012895584, "num_tokens": 44358934.0, "step": 25570 }, { "entropy": 5.663506078720093, "epoch": 1.9898463333981715, "grad_norm": 1.171875, "learning_rate": 0.0004600108750359721, "loss": 4.9743, "mean_token_accuracy": 0.20285267978906632, "num_tokens": 44367117.0, "step": 25575 }, { "entropy": 5.7010821342468265, "epoch": 1.990235362769889, "grad_norm": 1.1015625, "learning_rate": 0.00045999510078099736, "loss": 5.0393, "mean_token_accuracy": 0.19596458971500397, "num_tokens": 44375591.0, "step": 25580 }, { "entropy": 5.6329389095306395, "epoch": 1.9906243921416067, "grad_norm": 1.09375, "learning_rate": 0.00045997932371901645, "loss": 4.9312, "mean_token_accuracy": 0.21049901992082595, "num_tokens": 44384602.0, "step": 25585 }, { "entropy": 5.609166431427002, "epoch": 1.9910134215133244, "grad_norm": 1.1484375, "learning_rate": 0.0004599635438502687, "loss": 4.9271, "mean_token_accuracy": 0.21531407684087753, "num_tokens": 44393451.0, "step": 25590 }, { "entropy": 5.630014276504516, "epoch": 1.9914024508850419, "grad_norm": 1.125, "learning_rate": 0.00045994776117499363, "loss": 4.9728, "mean_token_accuracy": 0.2018023505806923, "num_tokens": 44401638.0, "step": 25595 }, { "entropy": 5.661988639831543, "epoch": 1.9917914802567593, "grad_norm": 1.1796875, "learning_rate": 0.00045993197569343063, "loss": 5.001, "mean_token_accuracy": 0.20364686995744705, "num_tokens": 44410337.0, "step": 25600 }, { "entropy": 5.681255960464478, "epoch": 1.992180509628477, "grad_norm": 1.1953125, "learning_rate": 0.00045991618740581926, "loss": 5.0636, "mean_token_accuracy": 0.2019265279173851, "num_tokens": 44418178.0, "step": 25605 }, { "entropy": 5.740093803405761, "epoch": 1.9925695390001945, "grad_norm": 1.234375, "learning_rate": 0.0004599003963123991, "loss": 5.0764, "mean_token_accuracy": 0.19247499257326126, "num_tokens": 44427056.0, "step": 25610 }, { "entropy": 5.769051361083984, "epoch": 1.992958568371912, "grad_norm": 1.2265625, "learning_rate": 0.00045988460241340966, "loss": 5.0381, "mean_token_accuracy": 0.20148291140794755, "num_tokens": 44434687.0, "step": 25615 }, { "entropy": 5.699707174301148, "epoch": 1.9933475977436297, "grad_norm": 1.2734375, "learning_rate": 0.00045986880570909075, "loss": 5.0328, "mean_token_accuracy": 0.20362118631601334, "num_tokens": 44442763.0, "step": 25620 }, { "entropy": 5.558286046981811, "epoch": 1.9937366271153472, "grad_norm": 1.125, "learning_rate": 0.00045985300619968186, "loss": 4.9175, "mean_token_accuracy": 0.2075865775346756, "num_tokens": 44451850.0, "step": 25625 }, { "entropy": 5.602642250061035, "epoch": 1.9941256564870646, "grad_norm": 1.09375, "learning_rate": 0.00045983720388542286, "loss": 4.9737, "mean_token_accuracy": 0.21108553558588028, "num_tokens": 44459915.0, "step": 25630 }, { "entropy": 5.606112337112426, "epoch": 1.9945146858587823, "grad_norm": 1.0625, "learning_rate": 0.0004598213987665535, "loss": 5.036, "mean_token_accuracy": 0.20402218252420426, "num_tokens": 44469252.0, "step": 25635 }, { "entropy": 5.778771114349365, "epoch": 1.9949037152305, "grad_norm": 1.125, "learning_rate": 0.00045980559084331354, "loss": 5.1011, "mean_token_accuracy": 0.19799538552761078, "num_tokens": 44477748.0, "step": 25640 }, { "entropy": 5.662566614151001, "epoch": 1.9952927446022175, "grad_norm": 1.078125, "learning_rate": 0.000459789780115943, "loss": 5.0422, "mean_token_accuracy": 0.19278250634670258, "num_tokens": 44485796.0, "step": 25645 }, { "entropy": 5.611935758590699, "epoch": 1.995681773973935, "grad_norm": 1.0859375, "learning_rate": 0.00045977396658468156, "loss": 5.0482, "mean_token_accuracy": 0.19376108795404434, "num_tokens": 44494604.0, "step": 25650 }, { "entropy": 5.655222320556641, "epoch": 1.9960708033456527, "grad_norm": 1.125, "learning_rate": 0.0004597581502497693, "loss": 5.0303, "mean_token_accuracy": 0.19579687863588333, "num_tokens": 44503728.0, "step": 25655 }, { "entropy": 5.707696533203125, "epoch": 1.9964598327173702, "grad_norm": 1.171875, "learning_rate": 0.0004597423311114462, "loss": 5.0072, "mean_token_accuracy": 0.20464685261249543, "num_tokens": 44512201.0, "step": 25660 }, { "entropy": 5.715597152709961, "epoch": 1.9968488620890876, "grad_norm": 1.25, "learning_rate": 0.0004597265091699522, "loss": 5.036, "mean_token_accuracy": 0.19904591143131256, "num_tokens": 44520122.0, "step": 25665 }, { "entropy": 5.605073499679565, "epoch": 1.9972378914608053, "grad_norm": 1.1328125, "learning_rate": 0.0004597106844255276, "loss": 5.038, "mean_token_accuracy": 0.19938948899507522, "num_tokens": 44528928.0, "step": 25670 }, { "entropy": 5.731636619567871, "epoch": 1.9976269208325228, "grad_norm": 1.1796875, "learning_rate": 0.00045969485687841227, "loss": 5.1668, "mean_token_accuracy": 0.19572292417287826, "num_tokens": 44537330.0, "step": 25675 }, { "entropy": 5.720711374282837, "epoch": 1.9980159502042403, "grad_norm": 1.1953125, "learning_rate": 0.00045967902652884645, "loss": 5.0309, "mean_token_accuracy": 0.20138122886419296, "num_tokens": 44545748.0, "step": 25680 }, { "entropy": 5.6698570728302, "epoch": 1.998404979575958, "grad_norm": 1.265625, "learning_rate": 0.0004596631933770704, "loss": 5.1346, "mean_token_accuracy": 0.19554666429758072, "num_tokens": 44554562.0, "step": 25685 }, { "entropy": 5.651662397384643, "epoch": 1.9987940089476757, "grad_norm": 1.125, "learning_rate": 0.00045964735742332427, "loss": 4.9729, "mean_token_accuracy": 0.20400928407907487, "num_tokens": 44563544.0, "step": 25690 }, { "entropy": 5.717379760742188, "epoch": 1.9991830383193931, "grad_norm": 1.2109375, "learning_rate": 0.0004596315186678484, "loss": 5.0522, "mean_token_accuracy": 0.1999122068285942, "num_tokens": 44571179.0, "step": 25695 }, { "entropy": 5.720243692398071, "epoch": 1.9995720676911106, "grad_norm": 1.1640625, "learning_rate": 0.00045961567711088307, "loss": 5.0894, "mean_token_accuracy": 0.20062737315893173, "num_tokens": 44580237.0, "step": 25700 }, { "entropy": 5.675827741622925, "epoch": 1.9999610970628283, "grad_norm": 1.140625, "learning_rate": 0.00045959983275266873, "loss": 5.0272, "mean_token_accuracy": 0.20159684717655182, "num_tokens": 44588362.0, "step": 25705 }, { "entropy": 5.671978367699517, "epoch": 2.000311223497374, "grad_norm": 1.09375, "learning_rate": 0.00045958398559344573, "loss": 4.9589, "mean_token_accuracy": 0.20681650274329716, "num_tokens": 44596037.0, "step": 25710 }, { "entropy": 5.734713172912597, "epoch": 2.0007002528690916, "grad_norm": 1.1953125, "learning_rate": 0.00045956813563345454, "loss": 5.0188, "mean_token_accuracy": 0.20624375194311143, "num_tokens": 44604913.0, "step": 25715 }, { "entropy": 5.71753339767456, "epoch": 2.0010892822408093, "grad_norm": 1.1484375, "learning_rate": 0.0004595522828729357, "loss": 5.0555, "mean_token_accuracy": 0.20264316648244857, "num_tokens": 44613523.0, "step": 25720 }, { "entropy": 5.654740905761718, "epoch": 2.0014783116125265, "grad_norm": 1.1171875, "learning_rate": 0.0004595364273121296, "loss": 4.8569, "mean_token_accuracy": 0.21545921862125397, "num_tokens": 44622259.0, "step": 25725 }, { "entropy": 5.616589832305908, "epoch": 2.0018673409842442, "grad_norm": 1.234375, "learning_rate": 0.0004595205689512771, "loss": 4.9408, "mean_token_accuracy": 0.2076679602265358, "num_tokens": 44630793.0, "step": 25730 }, { "entropy": 5.678444528579712, "epoch": 2.002256370355962, "grad_norm": 1.2421875, "learning_rate": 0.00045950470779061855, "loss": 4.9575, "mean_token_accuracy": 0.20859505981206894, "num_tokens": 44638986.0, "step": 25735 }, { "entropy": 5.705001640319824, "epoch": 2.0026453997276796, "grad_norm": 1.2421875, "learning_rate": 0.00045948884383039475, "loss": 5.0253, "mean_token_accuracy": 0.19875845611095427, "num_tokens": 44647491.0, "step": 25740 }, { "entropy": 5.613849735260009, "epoch": 2.003034429099397, "grad_norm": 1.1640625, "learning_rate": 0.00045947297707084637, "loss": 4.9496, "mean_token_accuracy": 0.2067682147026062, "num_tokens": 44655431.0, "step": 25745 }, { "entropy": 5.634070634841919, "epoch": 2.0034234584711146, "grad_norm": 1.1015625, "learning_rate": 0.0004594571075122142, "loss": 4.9621, "mean_token_accuracy": 0.20248010754585266, "num_tokens": 44664398.0, "step": 25750 }, { "entropy": 5.693981504440307, "epoch": 2.0038124878428323, "grad_norm": 1.140625, "learning_rate": 0.00045944123515473905, "loss": 4.9518, "mean_token_accuracy": 0.2038433238863945, "num_tokens": 44673372.0, "step": 25755 }, { "entropy": 5.611620903015137, "epoch": 2.0042015172145495, "grad_norm": 1.15625, "learning_rate": 0.00045942535999866175, "loss": 4.8688, "mean_token_accuracy": 0.21319093853235244, "num_tokens": 44681736.0, "step": 25760 }, { "entropy": 5.6853429794311525, "epoch": 2.0045905465862672, "grad_norm": 1.28125, "learning_rate": 0.0004594094820442231, "loss": 5.0136, "mean_token_accuracy": 0.20086731463670732, "num_tokens": 44691858.0, "step": 25765 }, { "entropy": 5.746147680282593, "epoch": 2.004979575957985, "grad_norm": 1.4921875, "learning_rate": 0.000459393601291664, "loss": 5.0466, "mean_token_accuracy": 0.19366568475961685, "num_tokens": 44701002.0, "step": 25770 }, { "entropy": 5.686776065826416, "epoch": 2.005368605329702, "grad_norm": 1.1328125, "learning_rate": 0.00045937771774122563, "loss": 4.9282, "mean_token_accuracy": 0.21595702320337296, "num_tokens": 44709158.0, "step": 25775 }, { "entropy": 5.638172149658203, "epoch": 2.00575763470142, "grad_norm": 1.2265625, "learning_rate": 0.0004593618313931488, "loss": 4.9622, "mean_token_accuracy": 0.20781536400318146, "num_tokens": 44717495.0, "step": 25780 }, { "entropy": 5.687889480590821, "epoch": 2.0061466640731376, "grad_norm": 1.171875, "learning_rate": 0.00045934594224767463, "loss": 4.9503, "mean_token_accuracy": 0.20594877898693084, "num_tokens": 44726040.0, "step": 25785 }, { "entropy": 5.675553703308106, "epoch": 2.0065356934448553, "grad_norm": 1.15625, "learning_rate": 0.00045933005030504424, "loss": 4.9884, "mean_token_accuracy": 0.1997014030814171, "num_tokens": 44735098.0, "step": 25790 }, { "entropy": 5.649155521392823, "epoch": 2.0069247228165725, "grad_norm": 1.1796875, "learning_rate": 0.00045931415556549863, "loss": 4.9724, "mean_token_accuracy": 0.20108432918787003, "num_tokens": 44743764.0, "step": 25795 }, { "entropy": 5.643327617645264, "epoch": 2.0073137521882902, "grad_norm": 1.171875, "learning_rate": 0.0004592982580292792, "loss": 4.8748, "mean_token_accuracy": 0.20692960619926454, "num_tokens": 44751554.0, "step": 25800 }, { "entropy": 5.734205865859986, "epoch": 2.007702781560008, "grad_norm": 1.171875, "learning_rate": 0.00045928235769662697, "loss": 5.0574, "mean_token_accuracy": 0.19601832032203675, "num_tokens": 44760158.0, "step": 25805 }, { "entropy": 5.66917781829834, "epoch": 2.008091810931725, "grad_norm": 1.1328125, "learning_rate": 0.00045926645456778327, "loss": 4.9414, "mean_token_accuracy": 0.20913155674934386, "num_tokens": 44769209.0, "step": 25810 }, { "entropy": 5.6618571281433105, "epoch": 2.008480840303443, "grad_norm": 1.2265625, "learning_rate": 0.00045925054864298946, "loss": 4.9889, "mean_token_accuracy": 0.20589143335819243, "num_tokens": 44777991.0, "step": 25815 }, { "entropy": 5.707407665252686, "epoch": 2.0088698696751606, "grad_norm": 1.109375, "learning_rate": 0.00045923463992248684, "loss": 5.0302, "mean_token_accuracy": 0.19930059015750884, "num_tokens": 44786492.0, "step": 25820 }, { "entropy": 5.710167074203492, "epoch": 2.009258899046878, "grad_norm": 1.125, "learning_rate": 0.00045921872840651675, "loss": 5.0604, "mean_token_accuracy": 0.20184142887592316, "num_tokens": 44795021.0, "step": 25825 }, { "entropy": 5.6584185600280765, "epoch": 2.0096479284185955, "grad_norm": 1.2421875, "learning_rate": 0.00045920281409532064, "loss": 4.9671, "mean_token_accuracy": 0.20276207625865936, "num_tokens": 44803267.0, "step": 25830 }, { "entropy": 5.714813375473023, "epoch": 2.010036957790313, "grad_norm": 1.21875, "learning_rate": 0.0004591868969891401, "loss": 5.0269, "mean_token_accuracy": 0.20033709108829498, "num_tokens": 44811954.0, "step": 25835 }, { "entropy": 5.643784618377685, "epoch": 2.010425987162031, "grad_norm": 1.140625, "learning_rate": 0.0004591709770882165, "loss": 4.8838, "mean_token_accuracy": 0.2096843644976616, "num_tokens": 44820748.0, "step": 25840 }, { "entropy": 5.6935258388519285, "epoch": 2.010815016533748, "grad_norm": 1.34375, "learning_rate": 0.0004591550543927915, "loss": 5.0806, "mean_token_accuracy": 0.19925837367773055, "num_tokens": 44829400.0, "step": 25845 }, { "entropy": 5.733881187438965, "epoch": 2.011204045905466, "grad_norm": 1.1640625, "learning_rate": 0.0004591391289031067, "loss": 4.997, "mean_token_accuracy": 0.2024434193968773, "num_tokens": 44838663.0, "step": 25850 }, { "entropy": 5.700822496414185, "epoch": 2.0115930752771836, "grad_norm": 1.203125, "learning_rate": 0.0004591232006194036, "loss": 4.9219, "mean_token_accuracy": 0.21281079053878785, "num_tokens": 44847365.0, "step": 25855 }, { "entropy": 5.696553325653076, "epoch": 2.011982104648901, "grad_norm": 1.203125, "learning_rate": 0.00045910726954192404, "loss": 4.9795, "mean_token_accuracy": 0.20659883618354796, "num_tokens": 44856093.0, "step": 25860 }, { "entropy": 5.61371603012085, "epoch": 2.0123711340206185, "grad_norm": 1.1328125, "learning_rate": 0.0004590913356709097, "loss": 4.9443, "mean_token_accuracy": 0.20985369086265565, "num_tokens": 44865116.0, "step": 25865 }, { "entropy": 5.654669570922851, "epoch": 2.012760163392336, "grad_norm": 1.21875, "learning_rate": 0.00045907539900660237, "loss": 5.0218, "mean_token_accuracy": 0.20194179862737655, "num_tokens": 44874037.0, "step": 25870 }, { "entropy": 5.649487161636353, "epoch": 2.013149192764054, "grad_norm": 1.25, "learning_rate": 0.0004590594595492438, "loss": 4.8503, "mean_token_accuracy": 0.21097995042800904, "num_tokens": 44882603.0, "step": 25875 }, { "entropy": 5.667109632492066, "epoch": 2.013538222135771, "grad_norm": 1.1171875, "learning_rate": 0.00045904351729907593, "loss": 4.8998, "mean_token_accuracy": 0.21082854717969896, "num_tokens": 44890645.0, "step": 25880 }, { "entropy": 5.732386732101441, "epoch": 2.013927251507489, "grad_norm": 1.1953125, "learning_rate": 0.00045902757225634066, "loss": 5.0209, "mean_token_accuracy": 0.20473106652498246, "num_tokens": 44898972.0, "step": 25885 }, { "entropy": 5.632081985473633, "epoch": 2.0143162808792066, "grad_norm": 1.1796875, "learning_rate": 0.0004590116244212799, "loss": 5.0007, "mean_token_accuracy": 0.21055980771780014, "num_tokens": 44907427.0, "step": 25890 }, { "entropy": 5.697575187683105, "epoch": 2.014705310250924, "grad_norm": 1.25, "learning_rate": 0.0004589956737941355, "loss": 5.0422, "mean_token_accuracy": 0.19956227391958237, "num_tokens": 44916465.0, "step": 25895 }, { "entropy": 5.7018509864807125, "epoch": 2.0150943396226415, "grad_norm": 1.1640625, "learning_rate": 0.0004589797203751497, "loss": 4.959, "mean_token_accuracy": 0.21271492838859557, "num_tokens": 44925102.0, "step": 25900 }, { "entropy": 5.651805591583252, "epoch": 2.015483368994359, "grad_norm": 1.2578125, "learning_rate": 0.0004589637641645645, "loss": 4.9309, "mean_token_accuracy": 0.21065156310796737, "num_tokens": 44933061.0, "step": 25905 }, { "entropy": 5.5902876377105715, "epoch": 2.0158723983660765, "grad_norm": 1.203125, "learning_rate": 0.00045894780516262193, "loss": 4.9805, "mean_token_accuracy": 0.20562071949243546, "num_tokens": 44942342.0, "step": 25910 }, { "entropy": 5.677871322631836, "epoch": 2.016261427737794, "grad_norm": 1.2109375, "learning_rate": 0.0004589318433695642, "loss": 4.9725, "mean_token_accuracy": 0.2132783353328705, "num_tokens": 44951163.0, "step": 25915 }, { "entropy": 5.632634162902832, "epoch": 2.016650457109512, "grad_norm": 1.203125, "learning_rate": 0.0004589158787856336, "loss": 4.9429, "mean_token_accuracy": 0.20722294002771377, "num_tokens": 44960208.0, "step": 25920 }, { "entropy": 5.613522672653199, "epoch": 2.0170394864812295, "grad_norm": 1.2265625, "learning_rate": 0.0004588999114110721, "loss": 4.8495, "mean_token_accuracy": 0.21180173009634018, "num_tokens": 44969051.0, "step": 25925 }, { "entropy": 5.619331979751587, "epoch": 2.017428515852947, "grad_norm": 1.21875, "learning_rate": 0.0004588839412461223, "loss": 4.895, "mean_token_accuracy": 0.21775769293308259, "num_tokens": 44977980.0, "step": 25930 }, { "entropy": 5.628773593902588, "epoch": 2.0178175452246645, "grad_norm": 1.2109375, "learning_rate": 0.0004588679682910264, "loss": 4.9702, "mean_token_accuracy": 0.20029470175504685, "num_tokens": 44986520.0, "step": 25935 }, { "entropy": 5.675970983505249, "epoch": 2.018206574596382, "grad_norm": 1.359375, "learning_rate": 0.0004588519925460266, "loss": 4.9658, "mean_token_accuracy": 0.20854251384735106, "num_tokens": 44995011.0, "step": 25940 }, { "entropy": 5.600999116897583, "epoch": 2.0185956039680995, "grad_norm": 1.125, "learning_rate": 0.0004588360140113655, "loss": 4.9519, "mean_token_accuracy": 0.21334500908851622, "num_tokens": 45004611.0, "step": 25945 }, { "entropy": 5.694470453262329, "epoch": 2.018984633339817, "grad_norm": 1.1875, "learning_rate": 0.0004588200326872855, "loss": 4.9996, "mean_token_accuracy": 0.19941993951797485, "num_tokens": 45013832.0, "step": 25950 }, { "entropy": 5.692751932144165, "epoch": 2.019373662711535, "grad_norm": 1.1015625, "learning_rate": 0.0004588040485740291, "loss": 4.938, "mean_token_accuracy": 0.20973325073719024, "num_tokens": 45022751.0, "step": 25955 }, { "entropy": 5.710015678405762, "epoch": 2.019762692083252, "grad_norm": 1.21875, "learning_rate": 0.0004587880616718387, "loss": 5.0067, "mean_token_accuracy": 0.20685900747776031, "num_tokens": 45030826.0, "step": 25960 }, { "entropy": 5.694577550888061, "epoch": 2.02015172145497, "grad_norm": 1.234375, "learning_rate": 0.0004587720719809572, "loss": 4.9807, "mean_token_accuracy": 0.20188210159540176, "num_tokens": 45039625.0, "step": 25965 }, { "entropy": 5.645271158218383, "epoch": 2.0205407508266875, "grad_norm": 1.2109375, "learning_rate": 0.0004587560795016269, "loss": 4.9577, "mean_token_accuracy": 0.21033827662467958, "num_tokens": 45048229.0, "step": 25970 }, { "entropy": 5.710571336746216, "epoch": 2.020929780198405, "grad_norm": 1.2109375, "learning_rate": 0.0004587400842340905, "loss": 5.0424, "mean_token_accuracy": 0.19907742440700532, "num_tokens": 45057414.0, "step": 25975 }, { "entropy": 5.616314888000488, "epoch": 2.0213188095701224, "grad_norm": 1.21875, "learning_rate": 0.00045872408617859083, "loss": 4.8948, "mean_token_accuracy": 0.206028513610363, "num_tokens": 45065785.0, "step": 25980 }, { "entropy": 5.604463863372803, "epoch": 2.02170783894184, "grad_norm": 1.140625, "learning_rate": 0.00045870808533537066, "loss": 4.9172, "mean_token_accuracy": 0.20810531228780746, "num_tokens": 45074896.0, "step": 25985 }, { "entropy": 5.593366909027099, "epoch": 2.022096868313558, "grad_norm": 1.1796875, "learning_rate": 0.00045869208170467256, "loss": 4.9534, "mean_token_accuracy": 0.20079635828733444, "num_tokens": 45083554.0, "step": 25990 }, { "entropy": 5.705989122390747, "epoch": 2.022485897685275, "grad_norm": 1.15625, "learning_rate": 0.0004586760752867396, "loss": 4.9613, "mean_token_accuracy": 0.2041795775294304, "num_tokens": 45092204.0, "step": 25995 }, { "entropy": 5.691451597213745, "epoch": 2.022874927056993, "grad_norm": 1.2109375, "learning_rate": 0.00045866006608181456, "loss": 4.9848, "mean_token_accuracy": 0.19816917479038237, "num_tokens": 45101665.0, "step": 26000 }, { "entropy": 5.663026142120361, "epoch": 2.0232639564287105, "grad_norm": 1.1328125, "learning_rate": 0.0004586440540901403, "loss": 5.0325, "mean_token_accuracy": 0.19990342557430268, "num_tokens": 45111093.0, "step": 26005 }, { "entropy": 5.673209238052368, "epoch": 2.0236529858004277, "grad_norm": 1.2421875, "learning_rate": 0.00045862803931195976, "loss": 4.9594, "mean_token_accuracy": 0.20590735971927643, "num_tokens": 45118826.0, "step": 26010 }, { "entropy": 5.697975730895996, "epoch": 2.0240420151721454, "grad_norm": 1.1328125, "learning_rate": 0.0004586120217475161, "loss": 4.9947, "mean_token_accuracy": 0.20848352313041688, "num_tokens": 45128265.0, "step": 26015 }, { "entropy": 5.714987516403198, "epoch": 2.024431044543863, "grad_norm": 1.03125, "learning_rate": 0.0004585960013970522, "loss": 5.0309, "mean_token_accuracy": 0.19488996118307114, "num_tokens": 45137922.0, "step": 26020 }, { "entropy": 5.611620473861694, "epoch": 2.024820073915581, "grad_norm": 1.15625, "learning_rate": 0.0004585799782608112, "loss": 4.8571, "mean_token_accuracy": 0.21922712475061418, "num_tokens": 45146242.0, "step": 26025 }, { "entropy": 5.692760896682739, "epoch": 2.025209103287298, "grad_norm": 1.1953125, "learning_rate": 0.00045856395233903624, "loss": 5.0341, "mean_token_accuracy": 0.19816716462373735, "num_tokens": 45154897.0, "step": 26030 }, { "entropy": 5.678602266311645, "epoch": 2.025598132659016, "grad_norm": 1.1796875, "learning_rate": 0.0004585479236319705, "loss": 4.9918, "mean_token_accuracy": 0.2063049018383026, "num_tokens": 45164786.0, "step": 26035 }, { "entropy": 5.702360534667969, "epoch": 2.0259871620307335, "grad_norm": 1.171875, "learning_rate": 0.00045853189213985714, "loss": 5.0272, "mean_token_accuracy": 0.19565706849098205, "num_tokens": 45173652.0, "step": 26040 }, { "entropy": 5.672584581375122, "epoch": 2.0263761914024507, "grad_norm": 1.140625, "learning_rate": 0.00045851585786293943, "loss": 4.902, "mean_token_accuracy": 0.21253832131624223, "num_tokens": 45182399.0, "step": 26045 }, { "entropy": 5.6637773513793945, "epoch": 2.0267652207741684, "grad_norm": 1.1015625, "learning_rate": 0.00045849982080146067, "loss": 4.9684, "mean_token_accuracy": 0.20364944636821747, "num_tokens": 45191587.0, "step": 26050 }, { "entropy": 5.638995122909546, "epoch": 2.027154250145886, "grad_norm": 1.1875, "learning_rate": 0.0004584837809556642, "loss": 4.944, "mean_token_accuracy": 0.20783798694610595, "num_tokens": 45200032.0, "step": 26055 }, { "entropy": 5.634393167495728, "epoch": 2.0275432795176034, "grad_norm": 1.046875, "learning_rate": 0.00045846773832579346, "loss": 4.9616, "mean_token_accuracy": 0.2055723026394844, "num_tokens": 45209205.0, "step": 26060 }, { "entropy": 5.721559238433838, "epoch": 2.027932308889321, "grad_norm": 1.2578125, "learning_rate": 0.00045845169291209176, "loss": 4.9728, "mean_token_accuracy": 0.20819129943847656, "num_tokens": 45217603.0, "step": 26065 }, { "entropy": 5.669111919403076, "epoch": 2.0283213382610388, "grad_norm": 1.1640625, "learning_rate": 0.00045843564471480263, "loss": 4.9232, "mean_token_accuracy": 0.2025085687637329, "num_tokens": 45225971.0, "step": 26070 }, { "entropy": 5.698772192001343, "epoch": 2.0287103676327565, "grad_norm": 1.1875, "learning_rate": 0.0004584195937341695, "loss": 4.9969, "mean_token_accuracy": 0.20161072462797164, "num_tokens": 45234494.0, "step": 26075 }, { "entropy": 5.617690944671631, "epoch": 2.0290993970044737, "grad_norm": 1.296875, "learning_rate": 0.00045840353997043606, "loss": 4.8215, "mean_token_accuracy": 0.2159263789653778, "num_tokens": 45242685.0, "step": 26080 }, { "entropy": 5.650600004196167, "epoch": 2.0294884263761914, "grad_norm": 1.2109375, "learning_rate": 0.0004583874834238458, "loss": 4.9071, "mean_token_accuracy": 0.2079970806837082, "num_tokens": 45252282.0, "step": 26085 }, { "entropy": 5.685449504852295, "epoch": 2.029877455747909, "grad_norm": 1.2109375, "learning_rate": 0.0004583714240946423, "loss": 5.0674, "mean_token_accuracy": 0.19315167367458344, "num_tokens": 45261390.0, "step": 26090 }, { "entropy": 5.718031501770019, "epoch": 2.0302664851196264, "grad_norm": 1.171875, "learning_rate": 0.00045835536198306936, "loss": 5.078, "mean_token_accuracy": 0.19824135452508926, "num_tokens": 45270244.0, "step": 26095 }, { "entropy": 5.705060958862305, "epoch": 2.030655514491344, "grad_norm": 1.078125, "learning_rate": 0.00045833929708937067, "loss": 4.99, "mean_token_accuracy": 0.1969300001859665, "num_tokens": 45279404.0, "step": 26100 }, { "entropy": 5.692380475997925, "epoch": 2.0310445438630618, "grad_norm": 1.2734375, "learning_rate": 0.0004583232294137899, "loss": 4.957, "mean_token_accuracy": 0.21014004945755005, "num_tokens": 45288064.0, "step": 26105 }, { "entropy": 5.68449559211731, "epoch": 2.031433573234779, "grad_norm": 1.109375, "learning_rate": 0.0004583071589565709, "loss": 4.9963, "mean_token_accuracy": 0.20225270539522172, "num_tokens": 45296528.0, "step": 26110 }, { "entropy": 5.6436333656311035, "epoch": 2.0318226026064967, "grad_norm": 1.171875, "learning_rate": 0.0004582910857179576, "loss": 4.9103, "mean_token_accuracy": 0.20844800472259523, "num_tokens": 45305524.0, "step": 26115 }, { "entropy": 5.7331455707550045, "epoch": 2.0322116319782144, "grad_norm": 1.1171875, "learning_rate": 0.0004582750096981938, "loss": 5.0968, "mean_token_accuracy": 0.19437944144010544, "num_tokens": 45314386.0, "step": 26120 }, { "entropy": 5.68181471824646, "epoch": 2.032600661349932, "grad_norm": 1.1015625, "learning_rate": 0.0004582589308975234, "loss": 4.9866, "mean_token_accuracy": 0.20569924265146255, "num_tokens": 45322901.0, "step": 26125 }, { "entropy": 5.6107419490814205, "epoch": 2.0329896907216494, "grad_norm": 1.21875, "learning_rate": 0.00045824284931619044, "loss": 4.92, "mean_token_accuracy": 0.20761809945106507, "num_tokens": 45331509.0, "step": 26130 }, { "entropy": 5.6627459049224855, "epoch": 2.033378720093367, "grad_norm": 1.171875, "learning_rate": 0.00045822676495443893, "loss": 4.9699, "mean_token_accuracy": 0.2066069394350052, "num_tokens": 45340356.0, "step": 26135 }, { "entropy": 5.753885221481323, "epoch": 2.0337677494650848, "grad_norm": 1.1328125, "learning_rate": 0.00045821067781251284, "loss": 5.0075, "mean_token_accuracy": 0.20187541842460632, "num_tokens": 45349890.0, "step": 26140 }, { "entropy": 5.671606969833374, "epoch": 2.034156778836802, "grad_norm": 1.140625, "learning_rate": 0.00045819458789065633, "loss": 4.9676, "mean_token_accuracy": 0.20906978994607925, "num_tokens": 45359249.0, "step": 26145 }, { "entropy": 5.65541410446167, "epoch": 2.0345458082085197, "grad_norm": 1.203125, "learning_rate": 0.0004581784951891135, "loss": 4.9479, "mean_token_accuracy": 0.21289274096488953, "num_tokens": 45367832.0, "step": 26150 }, { "entropy": 5.662096929550171, "epoch": 2.0349348375802374, "grad_norm": 1.0703125, "learning_rate": 0.0004581623997081286, "loss": 4.9549, "mean_token_accuracy": 0.20920063853263854, "num_tokens": 45376316.0, "step": 26155 }, { "entropy": 5.710555791854858, "epoch": 2.0353238669519547, "grad_norm": 1.125, "learning_rate": 0.0004581463014479459, "loss": 5.0221, "mean_token_accuracy": 0.19455120116472244, "num_tokens": 45385801.0, "step": 26160 }, { "entropy": 5.6823070526123045, "epoch": 2.0357128963236724, "grad_norm": 1.28125, "learning_rate": 0.0004581302004088095, "loss": 4.984, "mean_token_accuracy": 0.20982643812894822, "num_tokens": 45394669.0, "step": 26165 }, { "entropy": 5.644961738586426, "epoch": 2.03610192569539, "grad_norm": 1.1640625, "learning_rate": 0.0004581140965909638, "loss": 4.945, "mean_token_accuracy": 0.2074610635638237, "num_tokens": 45402896.0, "step": 26170 }, { "entropy": 5.637491273880005, "epoch": 2.0364909550671078, "grad_norm": 1.203125, "learning_rate": 0.0004580979899946531, "loss": 4.9811, "mean_token_accuracy": 0.20109013319015503, "num_tokens": 45411047.0, "step": 26175 }, { "entropy": 5.71692385673523, "epoch": 2.036879984438825, "grad_norm": 1.1484375, "learning_rate": 0.0004580818806201219, "loss": 5.0923, "mean_token_accuracy": 0.19554199278354645, "num_tokens": 45420661.0, "step": 26180 }, { "entropy": 5.729820346832275, "epoch": 2.0372690138105427, "grad_norm": 1.2109375, "learning_rate": 0.00045806576846761453, "loss": 4.9335, "mean_token_accuracy": 0.21313071995973587, "num_tokens": 45429199.0, "step": 26185 }, { "entropy": 5.69167308807373, "epoch": 2.0376580431822604, "grad_norm": 1.21875, "learning_rate": 0.00045804965353737556, "loss": 4.9362, "mean_token_accuracy": 0.20775840878486634, "num_tokens": 45437504.0, "step": 26190 }, { "entropy": 5.589030981063843, "epoch": 2.0380470725539777, "grad_norm": 1.109375, "learning_rate": 0.0004580335358296494, "loss": 4.8991, "mean_token_accuracy": 0.20800567418336868, "num_tokens": 45445696.0, "step": 26195 }, { "entropy": 5.662701892852783, "epoch": 2.0384361019256954, "grad_norm": 1.1015625, "learning_rate": 0.00045801741534468065, "loss": 5.0082, "mean_token_accuracy": 0.20205149352550505, "num_tokens": 45455058.0, "step": 26200 }, { "entropy": 5.829818964004517, "epoch": 2.038825131297413, "grad_norm": 1.2578125, "learning_rate": 0.0004580012920827139, "loss": 5.072, "mean_token_accuracy": 0.20382075756788254, "num_tokens": 45464193.0, "step": 26205 }, { "entropy": 5.601741695404053, "epoch": 2.0392141606691303, "grad_norm": 1.28125, "learning_rate": 0.0004579851660439939, "loss": 4.8451, "mean_token_accuracy": 0.2141188085079193, "num_tokens": 45471922.0, "step": 26210 }, { "entropy": 5.674674701690674, "epoch": 2.039603190040848, "grad_norm": 1.2421875, "learning_rate": 0.00045796903722876523, "loss": 5.0304, "mean_token_accuracy": 0.19680144488811493, "num_tokens": 45480181.0, "step": 26215 }, { "entropy": 5.8024567604064945, "epoch": 2.0399922194125657, "grad_norm": 1.1875, "learning_rate": 0.0004579529056372726, "loss": 5.0355, "mean_token_accuracy": 0.20499414950609207, "num_tokens": 45488970.0, "step": 26220 }, { "entropy": 5.793949937820434, "epoch": 2.0403812487842834, "grad_norm": 1.3125, "learning_rate": 0.0004579367712697609, "loss": 4.9593, "mean_token_accuracy": 0.20311334282159804, "num_tokens": 45497066.0, "step": 26225 }, { "entropy": 5.6367613792419435, "epoch": 2.0407702781560006, "grad_norm": 1.1796875, "learning_rate": 0.00045792063412647475, "loss": 4.9373, "mean_token_accuracy": 0.2043283000588417, "num_tokens": 45506399.0, "step": 26230 }, { "entropy": 5.648182439804077, "epoch": 2.0411593075277183, "grad_norm": 1.203125, "learning_rate": 0.00045790449420765925, "loss": 4.9665, "mean_token_accuracy": 0.20089273899793625, "num_tokens": 45516625.0, "step": 26235 }, { "entropy": 5.75351128578186, "epoch": 2.041548336899436, "grad_norm": 1.15625, "learning_rate": 0.00045788835151355914, "loss": 5.0613, "mean_token_accuracy": 0.19787285923957826, "num_tokens": 45525539.0, "step": 26240 }, { "entropy": 5.7503454208374025, "epoch": 2.0419373662711533, "grad_norm": 1.125, "learning_rate": 0.00045787220604441933, "loss": 4.9804, "mean_token_accuracy": 0.2094811752438545, "num_tokens": 45535388.0, "step": 26245 }, { "entropy": 5.701186466217041, "epoch": 2.042326395642871, "grad_norm": 1.234375, "learning_rate": 0.00045785605780048497, "loss": 5.0224, "mean_token_accuracy": 0.2008216053247452, "num_tokens": 45543729.0, "step": 26250 }, { "entropy": 5.702984809875488, "epoch": 2.0427154250145887, "grad_norm": 1.2578125, "learning_rate": 0.00045783990678200086, "loss": 5.0288, "mean_token_accuracy": 0.2026811271905899, "num_tokens": 45551887.0, "step": 26255 }, { "entropy": 5.783022403717041, "epoch": 2.043104454386306, "grad_norm": 1.234375, "learning_rate": 0.00045782375298921227, "loss": 5.0823, "mean_token_accuracy": 0.19830229729413987, "num_tokens": 45560267.0, "step": 26260 }, { "entropy": 5.711447811126709, "epoch": 2.0434934837580236, "grad_norm": 1.1484375, "learning_rate": 0.0004578075964223642, "loss": 4.9902, "mean_token_accuracy": 0.1970672056078911, "num_tokens": 45569459.0, "step": 26265 }, { "entropy": 5.770064115524292, "epoch": 2.0438825131297413, "grad_norm": 1.1171875, "learning_rate": 0.0004577914370817018, "loss": 4.9751, "mean_token_accuracy": 0.1991291642189026, "num_tokens": 45577713.0, "step": 26270 }, { "entropy": 5.645679521560669, "epoch": 2.044271542501459, "grad_norm": 1.2734375, "learning_rate": 0.00045777527496747034, "loss": 4.9147, "mean_token_accuracy": 0.2066315308213234, "num_tokens": 45586521.0, "step": 26275 }, { "entropy": 5.677498483657837, "epoch": 2.0446605718731763, "grad_norm": 1.25, "learning_rate": 0.00045775911007991493, "loss": 4.9637, "mean_token_accuracy": 0.20217486321926117, "num_tokens": 45595210.0, "step": 26280 }, { "entropy": 5.689458227157592, "epoch": 2.045049601244894, "grad_norm": 1.1875, "learning_rate": 0.00045774294241928093, "loss": 5.0127, "mean_token_accuracy": 0.2055308476090431, "num_tokens": 45603472.0, "step": 26285 }, { "entropy": 5.681685447692871, "epoch": 2.0454386306166117, "grad_norm": 1.203125, "learning_rate": 0.0004577267719858137, "loss": 5.0598, "mean_token_accuracy": 0.19471936970949172, "num_tokens": 45612149.0, "step": 26290 }, { "entropy": 5.779747676849365, "epoch": 2.045827659988329, "grad_norm": 1.2109375, "learning_rate": 0.00045771059877975853, "loss": 5.0731, "mean_token_accuracy": 0.19781418293714523, "num_tokens": 45619903.0, "step": 26295 }, { "entropy": 5.692175817489624, "epoch": 2.0462166893600466, "grad_norm": 1.1875, "learning_rate": 0.0004576944228013608, "loss": 4.9637, "mean_token_accuracy": 0.21066200584173203, "num_tokens": 45628012.0, "step": 26300 }, { "entropy": 5.642592239379883, "epoch": 2.0466057187317643, "grad_norm": 1.2421875, "learning_rate": 0.000457678244050866, "loss": 4.9939, "mean_token_accuracy": 0.20328520089387894, "num_tokens": 45636587.0, "step": 26305 }, { "entropy": 5.67674036026001, "epoch": 2.046994748103482, "grad_norm": 1.3046875, "learning_rate": 0.0004576620625285196, "loss": 4.9494, "mean_token_accuracy": 0.20184803009033203, "num_tokens": 45645189.0, "step": 26310 }, { "entropy": 5.750026893615723, "epoch": 2.0473837774751993, "grad_norm": 1.1484375, "learning_rate": 0.00045764587823456717, "loss": 5.0311, "mean_token_accuracy": 0.2033383622765541, "num_tokens": 45654059.0, "step": 26315 }, { "entropy": 5.695265674591065, "epoch": 2.047772806846917, "grad_norm": 1.203125, "learning_rate": 0.00045762969116925424, "loss": 4.9006, "mean_token_accuracy": 0.21536493450403213, "num_tokens": 45662125.0, "step": 26320 }, { "entropy": 5.7020679950714115, "epoch": 2.0481618362186347, "grad_norm": 1.2109375, "learning_rate": 0.00045761350133282643, "loss": 4.9797, "mean_token_accuracy": 0.20785591900348663, "num_tokens": 45670068.0, "step": 26325 }, { "entropy": 5.656160736083985, "epoch": 2.048550865590352, "grad_norm": 1.21875, "learning_rate": 0.00045759730872552937, "loss": 4.8675, "mean_token_accuracy": 0.21632105708122254, "num_tokens": 45678717.0, "step": 26330 }, { "entropy": 5.645941638946534, "epoch": 2.0489398949620696, "grad_norm": 1.1640625, "learning_rate": 0.0004575811133476088, "loss": 4.9587, "mean_token_accuracy": 0.20723410546779633, "num_tokens": 45686882.0, "step": 26335 }, { "entropy": 5.601016664505005, "epoch": 2.0493289243337873, "grad_norm": 1.15625, "learning_rate": 0.00045756491519931047, "loss": 4.8898, "mean_token_accuracy": 0.20890021324157715, "num_tokens": 45695460.0, "step": 26340 }, { "entropy": 5.756913805007935, "epoch": 2.0497179537055046, "grad_norm": 1.390625, "learning_rate": 0.0004575487142808801, "loss": 5.0525, "mean_token_accuracy": 0.19704596996307372, "num_tokens": 45703287.0, "step": 26345 }, { "entropy": 5.727641439437866, "epoch": 2.0501069830772223, "grad_norm": 1.1328125, "learning_rate": 0.0004575325105925636, "loss": 5.0713, "mean_token_accuracy": 0.19566494226455688, "num_tokens": 45712830.0, "step": 26350 }, { "entropy": 5.6460315704345705, "epoch": 2.05049601244894, "grad_norm": 1.2421875, "learning_rate": 0.00045751630413460665, "loss": 5.0651, "mean_token_accuracy": 0.19860530644655228, "num_tokens": 45720701.0, "step": 26355 }, { "entropy": 5.6865331649780275, "epoch": 2.0508850418206577, "grad_norm": 1.1796875, "learning_rate": 0.0004575000949072554, "loss": 4.9264, "mean_token_accuracy": 0.2069900169968605, "num_tokens": 45728663.0, "step": 26360 }, { "entropy": 5.6829897403717045, "epoch": 2.051274071192375, "grad_norm": 1.1953125, "learning_rate": 0.0004574838829107557, "loss": 4.9779, "mean_token_accuracy": 0.2015938863158226, "num_tokens": 45737661.0, "step": 26365 }, { "entropy": 5.599342250823975, "epoch": 2.0516631005640926, "grad_norm": 1.2265625, "learning_rate": 0.0004574676681453535, "loss": 4.9297, "mean_token_accuracy": 0.2127887412905693, "num_tokens": 45746343.0, "step": 26370 }, { "entropy": 5.622148895263672, "epoch": 2.0520521299358103, "grad_norm": 1.2421875, "learning_rate": 0.00045745145061129485, "loss": 4.9654, "mean_token_accuracy": 0.2032032698392868, "num_tokens": 45755025.0, "step": 26375 }, { "entropy": 5.705486536026001, "epoch": 2.0524411593075276, "grad_norm": 1.1640625, "learning_rate": 0.00045743523030882584, "loss": 5.0355, "mean_token_accuracy": 0.20282019525766373, "num_tokens": 45763107.0, "step": 26380 }, { "entropy": 5.6822922706604, "epoch": 2.0528301886792453, "grad_norm": 1.1640625, "learning_rate": 0.0004574190072381926, "loss": 4.9203, "mean_token_accuracy": 0.21141140460968016, "num_tokens": 45771754.0, "step": 26385 }, { "entropy": 5.688706350326538, "epoch": 2.053219218050963, "grad_norm": 1.2109375, "learning_rate": 0.0004574027813996413, "loss": 5.0893, "mean_token_accuracy": 0.20015982836484908, "num_tokens": 45779282.0, "step": 26390 }, { "entropy": 5.707024145126343, "epoch": 2.05360824742268, "grad_norm": 1.234375, "learning_rate": 0.0004573865527934181, "loss": 5.0427, "mean_token_accuracy": 0.19662826657295226, "num_tokens": 45788002.0, "step": 26395 }, { "entropy": 5.763675212860107, "epoch": 2.053997276794398, "grad_norm": 1.2265625, "learning_rate": 0.0004573703214197692, "loss": 5.0319, "mean_token_accuracy": 0.1990533947944641, "num_tokens": 45796563.0, "step": 26400 }, { "entropy": 5.687012004852295, "epoch": 2.0543863061661156, "grad_norm": 1.1484375, "learning_rate": 0.00045735408727894095, "loss": 4.9572, "mean_token_accuracy": 0.20754703283309936, "num_tokens": 45806311.0, "step": 26405 }, { "entropy": 5.682385015487671, "epoch": 2.0547753355378333, "grad_norm": 1.328125, "learning_rate": 0.00045733785037117977, "loss": 4.9483, "mean_token_accuracy": 0.20658033937215806, "num_tokens": 45814007.0, "step": 26410 }, { "entropy": 5.670385646820068, "epoch": 2.0551643649095506, "grad_norm": 1.1796875, "learning_rate": 0.0004573216106967319, "loss": 4.9801, "mean_token_accuracy": 0.19763838350772858, "num_tokens": 45822492.0, "step": 26415 }, { "entropy": 5.641687440872192, "epoch": 2.0555533942812683, "grad_norm": 1.1953125, "learning_rate": 0.00045730536825584365, "loss": 4.918, "mean_token_accuracy": 0.20933483242988588, "num_tokens": 45830853.0, "step": 26420 }, { "entropy": 5.739394187927246, "epoch": 2.055942423652986, "grad_norm": 1.2734375, "learning_rate": 0.00045728912304876176, "loss": 5.0138, "mean_token_accuracy": 0.20124027729034424, "num_tokens": 45839948.0, "step": 26425 }, { "entropy": 5.793256711959839, "epoch": 2.056331453024703, "grad_norm": 1.2421875, "learning_rate": 0.0004572728750757326, "loss": 5.1247, "mean_token_accuracy": 0.1831857144832611, "num_tokens": 45848264.0, "step": 26430 }, { "entropy": 5.611777877807617, "epoch": 2.056720482396421, "grad_norm": 1.234375, "learning_rate": 0.0004572566243370025, "loss": 4.892, "mean_token_accuracy": 0.21454827040433883, "num_tokens": 45856523.0, "step": 26435 }, { "entropy": 5.642489337921143, "epoch": 2.0571095117681386, "grad_norm": 1.2890625, "learning_rate": 0.0004572403708328183, "loss": 5.0056, "mean_token_accuracy": 0.20898969769477843, "num_tokens": 45864736.0, "step": 26440 }, { "entropy": 5.671368217468261, "epoch": 2.057498541139856, "grad_norm": 1.2109375, "learning_rate": 0.0004572241145634266, "loss": 5.0037, "mean_token_accuracy": 0.2016543686389923, "num_tokens": 45873979.0, "step": 26445 }, { "entropy": 5.643639373779297, "epoch": 2.0578875705115736, "grad_norm": 1.1484375, "learning_rate": 0.000457207855529074, "loss": 4.959, "mean_token_accuracy": 0.20861584991216658, "num_tokens": 45882545.0, "step": 26450 }, { "entropy": 5.669561815261841, "epoch": 2.0582765998832913, "grad_norm": 1.1953125, "learning_rate": 0.00045719159373000713, "loss": 5.0473, "mean_token_accuracy": 0.19620343595743178, "num_tokens": 45890830.0, "step": 26455 }, { "entropy": 5.773867225646972, "epoch": 2.058665629255009, "grad_norm": 1.2421875, "learning_rate": 0.0004571753291664729, "loss": 4.9935, "mean_token_accuracy": 0.20281164348125458, "num_tokens": 45899457.0, "step": 26460 }, { "entropy": 5.685356998443604, "epoch": 2.059054658626726, "grad_norm": 1.296875, "learning_rate": 0.0004571590618387179, "loss": 4.9994, "mean_token_accuracy": 0.20380024760961532, "num_tokens": 45907998.0, "step": 26465 }, { "entropy": 5.645242547988891, "epoch": 2.059443687998444, "grad_norm": 1.265625, "learning_rate": 0.0004571427917469892, "loss": 4.928, "mean_token_accuracy": 0.2026064619421959, "num_tokens": 45916102.0, "step": 26470 }, { "entropy": 5.657299900054932, "epoch": 2.0598327173701616, "grad_norm": 1.203125, "learning_rate": 0.00045712651889153345, "loss": 4.9613, "mean_token_accuracy": 0.20668953508138657, "num_tokens": 45924347.0, "step": 26475 }, { "entropy": 5.7314183712005615, "epoch": 2.060221746741879, "grad_norm": 1.15625, "learning_rate": 0.00045711024327259764, "loss": 4.9837, "mean_token_accuracy": 0.2074410766363144, "num_tokens": 45932702.0, "step": 26480 }, { "entropy": 5.61371865272522, "epoch": 2.0606107761135966, "grad_norm": 1.1875, "learning_rate": 0.00045709396489042884, "loss": 4.9459, "mean_token_accuracy": 0.20138026028871536, "num_tokens": 45941235.0, "step": 26485 }, { "entropy": 5.681282043457031, "epoch": 2.0609998054853143, "grad_norm": 1.2109375, "learning_rate": 0.00045707768374527385, "loss": 4.94, "mean_token_accuracy": 0.21190550923347473, "num_tokens": 45949582.0, "step": 26490 }, { "entropy": 5.695214796066284, "epoch": 2.0613888348570315, "grad_norm": 1.3671875, "learning_rate": 0.0004570613998373799, "loss": 5.0095, "mean_token_accuracy": 0.20235701650381088, "num_tokens": 45957920.0, "step": 26495 }, { "entropy": 5.6700811862945555, "epoch": 2.061777864228749, "grad_norm": 1.21875, "learning_rate": 0.00045704511316699395, "loss": 5.0506, "mean_token_accuracy": 0.20360081791877746, "num_tokens": 45966302.0, "step": 26500 }, { "entropy": 5.733704376220703, "epoch": 2.062166893600467, "grad_norm": 1.1796875, "learning_rate": 0.00045702882373436317, "loss": 5.0719, "mean_token_accuracy": 0.19766143411397935, "num_tokens": 45975481.0, "step": 26505 }, { "entropy": 5.816517686843872, "epoch": 2.0625559229721846, "grad_norm": 1.046875, "learning_rate": 0.0004570125315397347, "loss": 5.062, "mean_token_accuracy": 0.20263160914182662, "num_tokens": 45984466.0, "step": 26510 }, { "entropy": 5.662425756454468, "epoch": 2.062944952343902, "grad_norm": 1.1796875, "learning_rate": 0.0004569962365833558, "loss": 4.8943, "mean_token_accuracy": 0.20768968611955643, "num_tokens": 45992862.0, "step": 26515 }, { "entropy": 5.63205771446228, "epoch": 2.0633339817156195, "grad_norm": 1.28125, "learning_rate": 0.00045697993886547374, "loss": 4.9946, "mean_token_accuracy": 0.19968704879283905, "num_tokens": 46001211.0, "step": 26520 }, { "entropy": 5.721051979064941, "epoch": 2.0637230110873372, "grad_norm": 1.234375, "learning_rate": 0.00045696363838633566, "loss": 5.0073, "mean_token_accuracy": 0.19828609973192216, "num_tokens": 46009574.0, "step": 26525 }, { "entropy": 5.71382737159729, "epoch": 2.0641120404590545, "grad_norm": 1.1640625, "learning_rate": 0.00045694733514618904, "loss": 4.9422, "mean_token_accuracy": 0.20257085859775542, "num_tokens": 46017686.0, "step": 26530 }, { "entropy": 5.688066673278809, "epoch": 2.064501069830772, "grad_norm": 1.109375, "learning_rate": 0.0004569310291452812, "loss": 4.9663, "mean_token_accuracy": 0.2029442995786667, "num_tokens": 46026842.0, "step": 26535 }, { "entropy": 5.644578695297241, "epoch": 2.06489009920249, "grad_norm": 1.1328125, "learning_rate": 0.0004569147203838595, "loss": 4.9604, "mean_token_accuracy": 0.20868255496025084, "num_tokens": 46036308.0, "step": 26540 }, { "entropy": 5.702411651611328, "epoch": 2.065279128574207, "grad_norm": 1.15625, "learning_rate": 0.00045689840886217157, "loss": 4.9733, "mean_token_accuracy": 0.20491039454936982, "num_tokens": 46045424.0, "step": 26545 }, { "entropy": 5.667631721496582, "epoch": 2.065668157945925, "grad_norm": 1.1875, "learning_rate": 0.00045688209458046475, "loss": 4.9508, "mean_token_accuracy": 0.20506266504526138, "num_tokens": 46054386.0, "step": 26550 }, { "entropy": 5.633437442779541, "epoch": 2.0660571873176425, "grad_norm": 1.125, "learning_rate": 0.00045686577753898663, "loss": 4.8846, "mean_token_accuracy": 0.214173524081707, "num_tokens": 46063617.0, "step": 26555 }, { "entropy": 5.702445220947266, "epoch": 2.0664462166893602, "grad_norm": 1.1640625, "learning_rate": 0.00045684945773798483, "loss": 5.0766, "mean_token_accuracy": 0.20049827843904494, "num_tokens": 46072915.0, "step": 26560 }, { "entropy": 5.725633859634399, "epoch": 2.0668352460610775, "grad_norm": 1.21875, "learning_rate": 0.000456833135177707, "loss": 5.101, "mean_token_accuracy": 0.19491964280605317, "num_tokens": 46081890.0, "step": 26565 }, { "entropy": 5.770382881164551, "epoch": 2.067224275432795, "grad_norm": 1.2734375, "learning_rate": 0.0004568168098584007, "loss": 5.0652, "mean_token_accuracy": 0.19314909130334854, "num_tokens": 46090445.0, "step": 26570 }, { "entropy": 5.76362042427063, "epoch": 2.067613304804513, "grad_norm": 1.1640625, "learning_rate": 0.0004568004817803137, "loss": 5.0252, "mean_token_accuracy": 0.20208129584789275, "num_tokens": 46099866.0, "step": 26575 }, { "entropy": 5.674625205993652, "epoch": 2.06800233417623, "grad_norm": 1.234375, "learning_rate": 0.0004567841509436937, "loss": 4.9287, "mean_token_accuracy": 0.20954311192035674, "num_tokens": 46108036.0, "step": 26580 }, { "entropy": 5.678498792648315, "epoch": 2.068391363547948, "grad_norm": 1.1484375, "learning_rate": 0.0004567678173487887, "loss": 4.8992, "mean_token_accuracy": 0.21291859298944474, "num_tokens": 46116087.0, "step": 26585 }, { "entropy": 5.643871879577636, "epoch": 2.0687803929196655, "grad_norm": 1.109375, "learning_rate": 0.0004567514809958462, "loss": 4.9825, "mean_token_accuracy": 0.21221491247415541, "num_tokens": 46124934.0, "step": 26590 }, { "entropy": 5.700538682937622, "epoch": 2.069169422291383, "grad_norm": 1.265625, "learning_rate": 0.0004567351418851144, "loss": 4.9921, "mean_token_accuracy": 0.2074885591864586, "num_tokens": 46133691.0, "step": 26595 }, { "entropy": 5.729164123535156, "epoch": 2.0695584516631005, "grad_norm": 1.21875, "learning_rate": 0.00045671880001684113, "loss": 5.0537, "mean_token_accuracy": 0.19493894577026366, "num_tokens": 46141933.0, "step": 26600 }, { "entropy": 5.672248888015747, "epoch": 2.069947481034818, "grad_norm": 1.140625, "learning_rate": 0.00045670245539127413, "loss": 4.9336, "mean_token_accuracy": 0.20921938270330429, "num_tokens": 46150656.0, "step": 26605 }, { "entropy": 5.620133686065674, "epoch": 2.070336510406536, "grad_norm": 1.109375, "learning_rate": 0.00045668610800866173, "loss": 4.9543, "mean_token_accuracy": 0.2051005929708481, "num_tokens": 46160353.0, "step": 26610 }, { "entropy": 5.684297752380371, "epoch": 2.070725539778253, "grad_norm": 1.1953125, "learning_rate": 0.00045666975786925177, "loss": 4.9904, "mean_token_accuracy": 0.2084883764386177, "num_tokens": 46168810.0, "step": 26615 }, { "entropy": 5.699772834777832, "epoch": 2.071114569149971, "grad_norm": 1.2109375, "learning_rate": 0.0004566534049732923, "loss": 4.9695, "mean_token_accuracy": 0.20911960750818254, "num_tokens": 46177593.0, "step": 26620 }, { "entropy": 5.688872289657593, "epoch": 2.0715035985216885, "grad_norm": 1.25, "learning_rate": 0.00045663704932103166, "loss": 4.9698, "mean_token_accuracy": 0.21247036904096603, "num_tokens": 46186027.0, "step": 26625 }, { "entropy": 5.7123737812042235, "epoch": 2.071892627893406, "grad_norm": 1.265625, "learning_rate": 0.00045662069091271785, "loss": 5.0808, "mean_token_accuracy": 0.19122884124517442, "num_tokens": 46194705.0, "step": 26630 }, { "entropy": 5.698910570144653, "epoch": 2.0722816572651235, "grad_norm": 1.15625, "learning_rate": 0.00045660432974859924, "loss": 4.9227, "mean_token_accuracy": 0.20927760750055313, "num_tokens": 46203498.0, "step": 26635 }, { "entropy": 5.721298789978027, "epoch": 2.072670686636841, "grad_norm": 1.265625, "learning_rate": 0.00045658796582892383, "loss": 4.9745, "mean_token_accuracy": 0.21304211765527725, "num_tokens": 46211918.0, "step": 26640 }, { "entropy": 5.742507600784302, "epoch": 2.073059716008559, "grad_norm": 1.125, "learning_rate": 0.00045657159915394013, "loss": 5.0695, "mean_token_accuracy": 0.20158637464046478, "num_tokens": 46220689.0, "step": 26645 }, { "entropy": 5.711783456802368, "epoch": 2.073448745380276, "grad_norm": 1.125, "learning_rate": 0.0004565552297238964, "loss": 5.0406, "mean_token_accuracy": 0.1979992210865021, "num_tokens": 46229645.0, "step": 26650 }, { "entropy": 5.754027795791626, "epoch": 2.073837774751994, "grad_norm": 1.3125, "learning_rate": 0.000456538857539041, "loss": 5.0118, "mean_token_accuracy": 0.1969640538096428, "num_tokens": 46237691.0, "step": 26655 }, { "entropy": 5.702052974700928, "epoch": 2.0742268041237115, "grad_norm": 1.28125, "learning_rate": 0.00045652248259962254, "loss": 4.9701, "mean_token_accuracy": 0.20612976849079132, "num_tokens": 46245756.0, "step": 26660 }, { "entropy": 5.753409910202026, "epoch": 2.0746158334954288, "grad_norm": 1.1640625, "learning_rate": 0.0004565061049058892, "loss": 5.0689, "mean_token_accuracy": 0.19615186154842376, "num_tokens": 46255233.0, "step": 26665 }, { "entropy": 5.705156421661377, "epoch": 2.0750048628671465, "grad_norm": 1.359375, "learning_rate": 0.00045648972445808963, "loss": 5.0111, "mean_token_accuracy": 0.19983147978782653, "num_tokens": 46263569.0, "step": 26670 }, { "entropy": 5.616665649414062, "epoch": 2.075393892238864, "grad_norm": 1.140625, "learning_rate": 0.00045647334125647235, "loss": 4.8987, "mean_token_accuracy": 0.20818208903074265, "num_tokens": 46273010.0, "step": 26675 }, { "entropy": 5.754445362091064, "epoch": 2.0757829216105814, "grad_norm": 1.109375, "learning_rate": 0.000456456955301286, "loss": 4.9747, "mean_token_accuracy": 0.21063933074474334, "num_tokens": 46281566.0, "step": 26680 }, { "entropy": 5.602251291275024, "epoch": 2.076171950982299, "grad_norm": 1.15625, "learning_rate": 0.0004564405665927791, "loss": 4.8693, "mean_token_accuracy": 0.21099644154310226, "num_tokens": 46290267.0, "step": 26685 }, { "entropy": 5.634386110305786, "epoch": 2.076560980354017, "grad_norm": 1.28125, "learning_rate": 0.00045642417513120043, "loss": 4.8995, "mean_token_accuracy": 0.21202029436826705, "num_tokens": 46298694.0, "step": 26690 }, { "entropy": 5.680882310867309, "epoch": 2.076950009725734, "grad_norm": 1.234375, "learning_rate": 0.00045640778091679876, "loss": 4.8625, "mean_token_accuracy": 0.21378698199987411, "num_tokens": 46307358.0, "step": 26695 }, { "entropy": 5.6812952041625975, "epoch": 2.0773390390974518, "grad_norm": 1.203125, "learning_rate": 0.0004563913839498226, "loss": 4.9164, "mean_token_accuracy": 0.2135591298341751, "num_tokens": 46316351.0, "step": 26700 }, { "entropy": 5.6801787376403805, "epoch": 2.0777280684691695, "grad_norm": 1.171875, "learning_rate": 0.000456374984230521, "loss": 4.9746, "mean_token_accuracy": 0.20548408180475236, "num_tokens": 46325591.0, "step": 26705 }, { "entropy": 5.690999555587768, "epoch": 2.078117097840887, "grad_norm": 1.234375, "learning_rate": 0.0004563585817591427, "loss": 4.9555, "mean_token_accuracy": 0.20443084537982942, "num_tokens": 46334595.0, "step": 26710 }, { "entropy": 5.771510267257691, "epoch": 2.0785061272126044, "grad_norm": 1.171875, "learning_rate": 0.0004563421765359365, "loss": 5.0369, "mean_token_accuracy": 0.19937919825315475, "num_tokens": 46343587.0, "step": 26715 }, { "entropy": 5.8022724151611325, "epoch": 2.078895156584322, "grad_norm": 1.234375, "learning_rate": 0.00045632576856115156, "loss": 5.0261, "mean_token_accuracy": 0.20182194858789443, "num_tokens": 46351900.0, "step": 26720 }, { "entropy": 5.722235107421875, "epoch": 2.07928418595604, "grad_norm": 1.1640625, "learning_rate": 0.00045630935783503657, "loss": 5.0231, "mean_token_accuracy": 0.2011237323284149, "num_tokens": 46359854.0, "step": 26725 }, { "entropy": 5.712496328353882, "epoch": 2.079673215327757, "grad_norm": 1.1875, "learning_rate": 0.0004562929443578407, "loss": 5.1116, "mean_token_accuracy": 0.19846736788749694, "num_tokens": 46368930.0, "step": 26730 }, { "entropy": 5.6774827003479, "epoch": 2.0800622446994748, "grad_norm": 1.1875, "learning_rate": 0.0004562765281298129, "loss": 4.8986, "mean_token_accuracy": 0.20788912922143937, "num_tokens": 46377522.0, "step": 26735 }, { "entropy": 5.669716310501099, "epoch": 2.0804512740711925, "grad_norm": 1.25, "learning_rate": 0.0004562601091512024, "loss": 4.9971, "mean_token_accuracy": 0.19960644990205764, "num_tokens": 46386368.0, "step": 26740 }, { "entropy": 5.695429706573487, "epoch": 2.08084030344291, "grad_norm": 1.25, "learning_rate": 0.0004562436874222582, "loss": 4.9553, "mean_token_accuracy": 0.2035237267613411, "num_tokens": 46395363.0, "step": 26745 }, { "entropy": 5.748808670043945, "epoch": 2.0812293328146274, "grad_norm": 1.234375, "learning_rate": 0.00045622726294322955, "loss": 5.0225, "mean_token_accuracy": 0.19950494766235352, "num_tokens": 46403998.0, "step": 26750 }, { "entropy": 5.576841592788696, "epoch": 2.081618362186345, "grad_norm": 1.09375, "learning_rate": 0.00045621083571436563, "loss": 4.8201, "mean_token_accuracy": 0.222538498044014, "num_tokens": 46412138.0, "step": 26755 }, { "entropy": 5.631717395782471, "epoch": 2.082007391558063, "grad_norm": 1.28125, "learning_rate": 0.0004561944057359157, "loss": 4.9819, "mean_token_accuracy": 0.20640279799699784, "num_tokens": 46420761.0, "step": 26760 }, { "entropy": 5.601476192474365, "epoch": 2.08239642092978, "grad_norm": 1.28125, "learning_rate": 0.0004561779730081291, "loss": 4.9488, "mean_token_accuracy": 0.21046752184629441, "num_tokens": 46428938.0, "step": 26765 }, { "entropy": 5.7185474872589115, "epoch": 2.0827854503014978, "grad_norm": 1.1953125, "learning_rate": 0.0004561615375312551, "loss": 4.9554, "mean_token_accuracy": 0.21121462434530258, "num_tokens": 46436552.0, "step": 26770 }, { "entropy": 5.633351278305054, "epoch": 2.0831744796732155, "grad_norm": 1.140625, "learning_rate": 0.00045614509930554304, "loss": 4.9118, "mean_token_accuracy": 0.2094930127263069, "num_tokens": 46445223.0, "step": 26775 }, { "entropy": 5.680253314971924, "epoch": 2.0835635090449327, "grad_norm": 1.25, "learning_rate": 0.00045612865833124253, "loss": 5.0323, "mean_token_accuracy": 0.20136726796627044, "num_tokens": 46453232.0, "step": 26780 }, { "entropy": 5.559950256347657, "epoch": 2.0839525384166504, "grad_norm": 1.09375, "learning_rate": 0.0004561122146086029, "loss": 4.8388, "mean_token_accuracy": 0.21345621794462205, "num_tokens": 46462562.0, "step": 26785 }, { "entropy": 5.675860929489136, "epoch": 2.084341567788368, "grad_norm": 1.1953125, "learning_rate": 0.0004560957681378737, "loss": 5.0317, "mean_token_accuracy": 0.1949341729283333, "num_tokens": 46470599.0, "step": 26790 }, { "entropy": 5.745585489273071, "epoch": 2.084730597160086, "grad_norm": 1.2421875, "learning_rate": 0.00045607931891930445, "loss": 4.9897, "mean_token_accuracy": 0.2033182993531227, "num_tokens": 46478707.0, "step": 26795 }, { "entropy": 5.657948923110962, "epoch": 2.085119626531803, "grad_norm": 1.1953125, "learning_rate": 0.0004560628669531447, "loss": 4.9773, "mean_token_accuracy": 0.2046966314315796, "num_tokens": 46487044.0, "step": 26800 }, { "entropy": 5.686334657669067, "epoch": 2.0855086559035207, "grad_norm": 1.171875, "learning_rate": 0.00045604641223964416, "loss": 4.985, "mean_token_accuracy": 0.19873972088098527, "num_tokens": 46495278.0, "step": 26805 }, { "entropy": 5.644309186935425, "epoch": 2.0858976852752384, "grad_norm": 1.1484375, "learning_rate": 0.00045602995477905247, "loss": 4.9989, "mean_token_accuracy": 0.2050021097064018, "num_tokens": 46503545.0, "step": 26810 }, { "entropy": 5.654935693740844, "epoch": 2.0862867146469557, "grad_norm": 1.1328125, "learning_rate": 0.0004560134945716194, "loss": 5.0312, "mean_token_accuracy": 0.21401808112859727, "num_tokens": 46513058.0, "step": 26815 }, { "entropy": 5.708903217315674, "epoch": 2.0866757440186734, "grad_norm": 1.4296875, "learning_rate": 0.00045599703161759464, "loss": 4.9381, "mean_token_accuracy": 0.20220120400190353, "num_tokens": 46520651.0, "step": 26820 }, { "entropy": 5.651180028915405, "epoch": 2.087064773390391, "grad_norm": 1.2421875, "learning_rate": 0.00045598056591722805, "loss": 4.92, "mean_token_accuracy": 0.20638586580753326, "num_tokens": 46528899.0, "step": 26825 }, { "entropy": 5.731946802139282, "epoch": 2.0874538027621083, "grad_norm": 1.234375, "learning_rate": 0.00045596409747076936, "loss": 5.1213, "mean_token_accuracy": 0.18965098559856414, "num_tokens": 46537921.0, "step": 26830 }, { "entropy": 5.713159465789795, "epoch": 2.087842832133826, "grad_norm": 1.1484375, "learning_rate": 0.0004559476262784686, "loss": 4.9551, "mean_token_accuracy": 0.20966471135616302, "num_tokens": 46547432.0, "step": 26835 }, { "entropy": 5.694389772415161, "epoch": 2.0882318615055437, "grad_norm": 1.28125, "learning_rate": 0.0004559311523405755, "loss": 5.0058, "mean_token_accuracy": 0.20187440067529677, "num_tokens": 46555406.0, "step": 26840 }, { "entropy": 5.727861070632935, "epoch": 2.0886208908772614, "grad_norm": 1.1796875, "learning_rate": 0.0004559146756573402, "loss": 5.0013, "mean_token_accuracy": 0.2088017523288727, "num_tokens": 46564428.0, "step": 26845 }, { "entropy": 5.704367351531983, "epoch": 2.0890099202489787, "grad_norm": 1.234375, "learning_rate": 0.00045589819622901274, "loss": 4.9285, "mean_token_accuracy": 0.2126939758658409, "num_tokens": 46573222.0, "step": 26850 }, { "entropy": 5.666756296157837, "epoch": 2.0893989496206964, "grad_norm": 1.234375, "learning_rate": 0.000455881714055843, "loss": 4.9345, "mean_token_accuracy": 0.2110202580690384, "num_tokens": 46581951.0, "step": 26855 }, { "entropy": 5.728613185882568, "epoch": 2.089787978992414, "grad_norm": 1.1484375, "learning_rate": 0.00045586522913808114, "loss": 5.0557, "mean_token_accuracy": 0.21197190880775452, "num_tokens": 46590658.0, "step": 26860 }, { "entropy": 5.694840002059936, "epoch": 2.0901770083641313, "grad_norm": 1.2109375, "learning_rate": 0.0004558487414759773, "loss": 4.9027, "mean_token_accuracy": 0.21503257155418395, "num_tokens": 46599068.0, "step": 26865 }, { "entropy": 5.655412244796753, "epoch": 2.090566037735849, "grad_norm": 1.1953125, "learning_rate": 0.00045583225106978175, "loss": 4.9914, "mean_token_accuracy": 0.20396257936954498, "num_tokens": 46608024.0, "step": 26870 }, { "entropy": 5.643037366867065, "epoch": 2.0909550671075667, "grad_norm": 1.1796875, "learning_rate": 0.0004558157579197446, "loss": 4.9302, "mean_token_accuracy": 0.20895154327154158, "num_tokens": 46616558.0, "step": 26875 }, { "entropy": 5.7506249904632565, "epoch": 2.091344096479284, "grad_norm": 1.171875, "learning_rate": 0.00045579926202611603, "loss": 5.1379, "mean_token_accuracy": 0.19193762093782424, "num_tokens": 46624943.0, "step": 26880 }, { "entropy": 5.673505687713623, "epoch": 2.0917331258510017, "grad_norm": 1.1640625, "learning_rate": 0.0004557827633891465, "loss": 4.9833, "mean_token_accuracy": 0.19999424517154693, "num_tokens": 46633753.0, "step": 26885 }, { "entropy": 5.711205911636353, "epoch": 2.0921221552227194, "grad_norm": 1.1171875, "learning_rate": 0.0004557662620090863, "loss": 4.9935, "mean_token_accuracy": 0.20564150661230088, "num_tokens": 46642210.0, "step": 26890 }, { "entropy": 5.691160678863525, "epoch": 2.092511184594437, "grad_norm": 1.265625, "learning_rate": 0.00045574975788618564, "loss": 4.9513, "mean_token_accuracy": 0.20996245741844177, "num_tokens": 46650327.0, "step": 26895 }, { "entropy": 5.6484599113464355, "epoch": 2.0929002139661543, "grad_norm": 1.1796875, "learning_rate": 0.0004557332510206953, "loss": 4.8833, "mean_token_accuracy": 0.21219709515571594, "num_tokens": 46659453.0, "step": 26900 }, { "entropy": 5.736992979049683, "epoch": 2.093289243337872, "grad_norm": 1.1953125, "learning_rate": 0.0004557167414128654, "loss": 4.9679, "mean_token_accuracy": 0.20799987614154816, "num_tokens": 46667378.0, "step": 26905 }, { "entropy": 5.725967359542847, "epoch": 2.0936782727095897, "grad_norm": 1.296875, "learning_rate": 0.0004557002290629467, "loss": 5.1324, "mean_token_accuracy": 0.1900894433259964, "num_tokens": 46675949.0, "step": 26910 }, { "entropy": 5.770013904571533, "epoch": 2.094067302081307, "grad_norm": 1.1328125, "learning_rate": 0.00045568371397118954, "loss": 5.1541, "mean_token_accuracy": 0.19959221333265303, "num_tokens": 46684808.0, "step": 26915 }, { "entropy": 5.716790723800659, "epoch": 2.0944563314530247, "grad_norm": 1.2109375, "learning_rate": 0.0004556671961378446, "loss": 4.9666, "mean_token_accuracy": 0.2076625183224678, "num_tokens": 46693209.0, "step": 26920 }, { "entropy": 5.633689975738525, "epoch": 2.0948453608247424, "grad_norm": 1.1171875, "learning_rate": 0.00045565067556316264, "loss": 4.943, "mean_token_accuracy": 0.2135712593793869, "num_tokens": 46702405.0, "step": 26925 }, { "entropy": 5.5798985958099365, "epoch": 2.0952343901964596, "grad_norm": 1.1484375, "learning_rate": 0.0004556341522473941, "loss": 4.9592, "mean_token_accuracy": 0.2059960275888443, "num_tokens": 46711568.0, "step": 26930 }, { "entropy": 5.655941534042358, "epoch": 2.0956234195681773, "grad_norm": 1.203125, "learning_rate": 0.0004556176261907899, "loss": 4.98, "mean_token_accuracy": 0.20742260813713073, "num_tokens": 46719886.0, "step": 26935 }, { "entropy": 5.6564287662506105, "epoch": 2.096012448939895, "grad_norm": 1.1640625, "learning_rate": 0.0004556010973936006, "loss": 4.8356, "mean_token_accuracy": 0.21430304795503616, "num_tokens": 46728293.0, "step": 26940 }, { "entropy": 5.683703279495239, "epoch": 2.0964014783116127, "grad_norm": 1.171875, "learning_rate": 0.0004555845658560772, "loss": 4.9879, "mean_token_accuracy": 0.2014298677444458, "num_tokens": 46736730.0, "step": 26945 }, { "entropy": 5.687503290176392, "epoch": 2.09679050768333, "grad_norm": 1.1328125, "learning_rate": 0.00045556803157847036, "loss": 5.0408, "mean_token_accuracy": 0.1930103436112404, "num_tokens": 46745563.0, "step": 26950 }, { "entropy": 5.722416162490845, "epoch": 2.0971795370550477, "grad_norm": 1.1953125, "learning_rate": 0.00045555149456103113, "loss": 4.988, "mean_token_accuracy": 0.20209750384092331, "num_tokens": 46754285.0, "step": 26955 }, { "entropy": 5.706587600708008, "epoch": 2.0975685664267654, "grad_norm": 1.171875, "learning_rate": 0.0004555349548040102, "loss": 4.9867, "mean_token_accuracy": 0.21139516979455947, "num_tokens": 46763114.0, "step": 26960 }, { "entropy": 5.704325723648071, "epoch": 2.0979575957984826, "grad_norm": 1.265625, "learning_rate": 0.0004555184123076589, "loss": 4.9986, "mean_token_accuracy": 0.2040882334113121, "num_tokens": 46771150.0, "step": 26965 }, { "entropy": 5.6477532386779785, "epoch": 2.0983466251702003, "grad_norm": 1.1328125, "learning_rate": 0.00045550186707222785, "loss": 4.8857, "mean_token_accuracy": 0.21533036679029466, "num_tokens": 46779955.0, "step": 26970 }, { "entropy": 5.678753089904785, "epoch": 2.098735654541918, "grad_norm": 1.203125, "learning_rate": 0.0004554853190979683, "loss": 5.0204, "mean_token_accuracy": 0.19841573685407637, "num_tokens": 46788769.0, "step": 26975 }, { "entropy": 5.72996416091919, "epoch": 2.0991246839136353, "grad_norm": 1.4921875, "learning_rate": 0.00045546876838513134, "loss": 5.0257, "mean_token_accuracy": 0.20052011162042618, "num_tokens": 46797649.0, "step": 26980 }, { "entropy": 5.693415212631225, "epoch": 2.099513713285353, "grad_norm": 1.1640625, "learning_rate": 0.00045545221493396805, "loss": 4.9371, "mean_token_accuracy": 0.20562161654233932, "num_tokens": 46806140.0, "step": 26985 }, { "entropy": 5.697494268417358, "epoch": 2.0999027426570707, "grad_norm": 1.1171875, "learning_rate": 0.00045543565874472963, "loss": 4.8799, "mean_token_accuracy": 0.2161271169781685, "num_tokens": 46815476.0, "step": 26990 }, { "entropy": 5.6711503028869625, "epoch": 2.1002917720287884, "grad_norm": 1.2109375, "learning_rate": 0.00045541909981766725, "loss": 5.0351, "mean_token_accuracy": 0.20086161494255067, "num_tokens": 46824171.0, "step": 26995 }, { "entropy": 5.609083890914917, "epoch": 2.1006808014005056, "grad_norm": 1.25, "learning_rate": 0.0004554025381530322, "loss": 4.8806, "mean_token_accuracy": 0.2124312177300453, "num_tokens": 46832474.0, "step": 27000 }, { "epoch": 2.1006808014005056, "eval_entropy": 5.377945898861927, "eval_loss": 5.092503070831299, "eval_mean_token_accuracy": 0.209100198200738, "eval_num_tokens": 46832474.0, "eval_runtime": 21.5964, "eval_samples_per_second": 1924.304, "eval_steps_per_second": 240.55, "step": 27000 }, { "entropy": 5.627761554718018, "epoch": 2.1010698307722233, "grad_norm": 1.21875, "learning_rate": 0.0004553859737510758, "loss": 4.8619, "mean_token_accuracy": 0.2110622063279152, "num_tokens": 46840626.0, "step": 27005 }, { "entropy": 5.606659460067749, "epoch": 2.101458860143941, "grad_norm": 1.296875, "learning_rate": 0.0004553694066120493, "loss": 4.8525, "mean_token_accuracy": 0.21379860639572143, "num_tokens": 46849626.0, "step": 27010 }, { "entropy": 5.741579961776734, "epoch": 2.1018478895156583, "grad_norm": 1.1171875, "learning_rate": 0.00045535283673620426, "loss": 5.0076, "mean_token_accuracy": 0.20166471153497695, "num_tokens": 46858520.0, "step": 27015 }, { "entropy": 5.684970951080322, "epoch": 2.102236918887376, "grad_norm": 1.15625, "learning_rate": 0.00045533626412379194, "loss": 4.9927, "mean_token_accuracy": 0.202072574198246, "num_tokens": 46866532.0, "step": 27020 }, { "entropy": 5.711877155303955, "epoch": 2.1026259482590937, "grad_norm": 1.1796875, "learning_rate": 0.0004553196887750638, "loss": 5.0273, "mean_token_accuracy": 0.2013051524758339, "num_tokens": 46875815.0, "step": 27025 }, { "entropy": 5.689473009109497, "epoch": 2.103014977630811, "grad_norm": 1.140625, "learning_rate": 0.0004553031106902714, "loss": 4.9548, "mean_token_accuracy": 0.20021456778049468, "num_tokens": 46884708.0, "step": 27030 }, { "entropy": 5.697423124313355, "epoch": 2.1034040070025286, "grad_norm": 1.1171875, "learning_rate": 0.00045528652986966627, "loss": 4.8838, "mean_token_accuracy": 0.2125650018453598, "num_tokens": 46894089.0, "step": 27035 }, { "entropy": 5.7602277278900145, "epoch": 2.1037930363742463, "grad_norm": 1.171875, "learning_rate": 0.00045526994631350006, "loss": 5.0568, "mean_token_accuracy": 0.20414750128984452, "num_tokens": 46903318.0, "step": 27040 }, { "entropy": 5.648242330551147, "epoch": 2.104182065745964, "grad_norm": 1.171875, "learning_rate": 0.0004552533600220243, "loss": 4.8922, "mean_token_accuracy": 0.21144102960824968, "num_tokens": 46912138.0, "step": 27045 }, { "entropy": 5.717019987106323, "epoch": 2.1045710951176813, "grad_norm": 1.4453125, "learning_rate": 0.00045523677099549073, "loss": 4.9611, "mean_token_accuracy": 0.19795125871896743, "num_tokens": 46919544.0, "step": 27050 }, { "entropy": 5.699784469604492, "epoch": 2.104960124489399, "grad_norm": 1.21875, "learning_rate": 0.000455220179234151, "loss": 5.0549, "mean_token_accuracy": 0.2009477749466896, "num_tokens": 46928760.0, "step": 27055 }, { "entropy": 5.677061080932617, "epoch": 2.1053491538611167, "grad_norm": 1.40625, "learning_rate": 0.0004552035847382569, "loss": 5.0, "mean_token_accuracy": 0.20254934579133987, "num_tokens": 46936860.0, "step": 27060 }, { "entropy": 5.673934412002564, "epoch": 2.105738183232834, "grad_norm": 1.1875, "learning_rate": 0.00045518698750806024, "loss": 4.9893, "mean_token_accuracy": 0.19814175367355347, "num_tokens": 46945157.0, "step": 27065 }, { "entropy": 5.76425461769104, "epoch": 2.1061272126045516, "grad_norm": 1.203125, "learning_rate": 0.00045517038754381287, "loss": 4.9977, "mean_token_accuracy": 0.19859624207019805, "num_tokens": 46954006.0, "step": 27070 }, { "entropy": 5.653291893005371, "epoch": 2.1065162419762693, "grad_norm": 1.203125, "learning_rate": 0.0004551537848457666, "loss": 4.9437, "mean_token_accuracy": 0.2098340079188347, "num_tokens": 46962437.0, "step": 27075 }, { "entropy": 5.690201282501221, "epoch": 2.106905271347987, "grad_norm": 1.1953125, "learning_rate": 0.0004551371794141734, "loss": 5.0561, "mean_token_accuracy": 0.2047122150659561, "num_tokens": 46972379.0, "step": 27080 }, { "entropy": 5.740162515640259, "epoch": 2.1072943007197042, "grad_norm": 1.1484375, "learning_rate": 0.0004551205712492852, "loss": 5.0277, "mean_token_accuracy": 0.19806330054998397, "num_tokens": 46981410.0, "step": 27085 }, { "entropy": 5.691622066497803, "epoch": 2.107683330091422, "grad_norm": 1.1953125, "learning_rate": 0.0004551039603513541, "loss": 4.8922, "mean_token_accuracy": 0.20493658185005187, "num_tokens": 46989662.0, "step": 27090 }, { "entropy": 5.731349229812622, "epoch": 2.1080723594631396, "grad_norm": 1.1875, "learning_rate": 0.00045508734672063204, "loss": 5.0324, "mean_token_accuracy": 0.20330643504858018, "num_tokens": 46998726.0, "step": 27095 }, { "entropy": 5.74033932685852, "epoch": 2.108461388834857, "grad_norm": 1.28125, "learning_rate": 0.0004550707303573711, "loss": 5.0494, "mean_token_accuracy": 0.20305478423833848, "num_tokens": 47006980.0, "step": 27100 }, { "entropy": 5.663844919204712, "epoch": 2.1088504182065746, "grad_norm": 1.25, "learning_rate": 0.00045505411126182347, "loss": 5.0353, "mean_token_accuracy": 0.19266543984413148, "num_tokens": 47015693.0, "step": 27105 }, { "entropy": 5.655839347839356, "epoch": 2.1092394475782923, "grad_norm": 1.1640625, "learning_rate": 0.0004550374894342412, "loss": 4.9483, "mean_token_accuracy": 0.2141800418496132, "num_tokens": 47024256.0, "step": 27110 }, { "entropy": 5.73844633102417, "epoch": 2.1096284769500095, "grad_norm": 1.15625, "learning_rate": 0.0004550208648748767, "loss": 5.0481, "mean_token_accuracy": 0.1997669205069542, "num_tokens": 47032962.0, "step": 27115 }, { "entropy": 5.712097549438477, "epoch": 2.1100175063217272, "grad_norm": 1.2109375, "learning_rate": 0.000455004237583982, "loss": 5.0107, "mean_token_accuracy": 0.19942270666360856, "num_tokens": 47041507.0, "step": 27120 }, { "entropy": 5.620849466323852, "epoch": 2.110406535693445, "grad_norm": 1.1796875, "learning_rate": 0.0004549876075618096, "loss": 4.9283, "mean_token_accuracy": 0.20913327485322952, "num_tokens": 47050088.0, "step": 27125 }, { "entropy": 5.760932493209839, "epoch": 2.110795565065162, "grad_norm": 1.2109375, "learning_rate": 0.0004549709748086117, "loss": 5.0662, "mean_token_accuracy": 0.20364027917385102, "num_tokens": 47058900.0, "step": 27130 }, { "entropy": 5.735073375701904, "epoch": 2.11118459443688, "grad_norm": 1.171875, "learning_rate": 0.00045495433932464063, "loss": 4.9608, "mean_token_accuracy": 0.2026571273803711, "num_tokens": 47067689.0, "step": 27135 }, { "entropy": 5.677677965164184, "epoch": 2.1115736238085976, "grad_norm": 1.09375, "learning_rate": 0.000454937701110149, "loss": 4.9365, "mean_token_accuracy": 0.20697788000106812, "num_tokens": 47076309.0, "step": 27140 }, { "entropy": 5.675854015350342, "epoch": 2.1119626531803153, "grad_norm": 1.28125, "learning_rate": 0.00045492106016538917, "loss": 4.9154, "mean_token_accuracy": 0.21431101262569427, "num_tokens": 47084462.0, "step": 27145 }, { "entropy": 5.684068822860718, "epoch": 2.1123516825520325, "grad_norm": 1.1953125, "learning_rate": 0.00045490441649061354, "loss": 5.0495, "mean_token_accuracy": 0.2020340234041214, "num_tokens": 47093586.0, "step": 27150 }, { "entropy": 5.674016904830933, "epoch": 2.1127407119237502, "grad_norm": 1.25, "learning_rate": 0.0004548877700860747, "loss": 4.9372, "mean_token_accuracy": 0.20793830901384353, "num_tokens": 47101296.0, "step": 27155 }, { "entropy": 5.7256042003631595, "epoch": 2.113129741295468, "grad_norm": 1.1796875, "learning_rate": 0.00045487112095202544, "loss": 5.0217, "mean_token_accuracy": 0.20082684308290483, "num_tokens": 47110033.0, "step": 27160 }, { "entropy": 5.678921222686768, "epoch": 2.113518770667185, "grad_norm": 1.15625, "learning_rate": 0.0004548544690887181, "loss": 5.0512, "mean_token_accuracy": 0.19783466011285783, "num_tokens": 47119292.0, "step": 27165 }, { "entropy": 5.724234628677368, "epoch": 2.113907800038903, "grad_norm": 1.1953125, "learning_rate": 0.0004548378144964054, "loss": 5.0362, "mean_token_accuracy": 0.20080995559692383, "num_tokens": 47128081.0, "step": 27170 }, { "entropy": 5.776790380477905, "epoch": 2.1142968294106206, "grad_norm": 1.2265625, "learning_rate": 0.00045482115717534024, "loss": 5.0421, "mean_token_accuracy": 0.20386772006750106, "num_tokens": 47136639.0, "step": 27175 }, { "entropy": 5.725074768066406, "epoch": 2.1146858587823383, "grad_norm": 1.2265625, "learning_rate": 0.0004548044971257752, "loss": 5.0844, "mean_token_accuracy": 0.19528531581163405, "num_tokens": 47145830.0, "step": 27180 }, { "entropy": 5.668376016616821, "epoch": 2.1150748881540555, "grad_norm": 1.171875, "learning_rate": 0.00045478783434796307, "loss": 5.0241, "mean_token_accuracy": 0.19877138286828994, "num_tokens": 47154695.0, "step": 27185 }, { "entropy": 5.711630487442017, "epoch": 2.1154639175257732, "grad_norm": 1.1875, "learning_rate": 0.00045477116884215675, "loss": 5.028, "mean_token_accuracy": 0.20138407051563262, "num_tokens": 47163818.0, "step": 27190 }, { "entropy": 5.675554370880127, "epoch": 2.115852946897491, "grad_norm": 1.1328125, "learning_rate": 0.000454754500608609, "loss": 4.9212, "mean_token_accuracy": 0.21019237637519836, "num_tokens": 47172426.0, "step": 27195 }, { "entropy": 5.7159984588623045, "epoch": 2.116241976269208, "grad_norm": 1.125, "learning_rate": 0.0004547378296475729, "loss": 5.1174, "mean_token_accuracy": 0.19318286031484605, "num_tokens": 47182034.0, "step": 27200 }, { "entropy": 5.687224578857422, "epoch": 2.116631005640926, "grad_norm": 1.0859375, "learning_rate": 0.00045472115595930124, "loss": 4.999, "mean_token_accuracy": 0.20143968760967254, "num_tokens": 47190968.0, "step": 27205 }, { "entropy": 5.609368085861206, "epoch": 2.1170200350126436, "grad_norm": 1.15625, "learning_rate": 0.00045470447954404716, "loss": 4.9021, "mean_token_accuracy": 0.2096202254295349, "num_tokens": 47199917.0, "step": 27210 }, { "entropy": 5.672963333129883, "epoch": 2.117409064384361, "grad_norm": 1.2734375, "learning_rate": 0.00045468780040206364, "loss": 4.994, "mean_token_accuracy": 0.2040281981229782, "num_tokens": 47208467.0, "step": 27215 }, { "entropy": 5.6280388832092285, "epoch": 2.1177980937560785, "grad_norm": 1.15625, "learning_rate": 0.0004546711185336037, "loss": 4.9761, "mean_token_accuracy": 0.2038068652153015, "num_tokens": 47216784.0, "step": 27220 }, { "entropy": 5.736069822311402, "epoch": 2.1181871231277962, "grad_norm": 1.203125, "learning_rate": 0.00045465443393892047, "loss": 5.0335, "mean_token_accuracy": 0.2083165466785431, "num_tokens": 47226215.0, "step": 27225 }, { "entropy": 5.714542198181152, "epoch": 2.118576152499514, "grad_norm": 1.2109375, "learning_rate": 0.0004546377466182673, "loss": 4.962, "mean_token_accuracy": 0.21154684871435164, "num_tokens": 47234952.0, "step": 27230 }, { "entropy": 5.724227952957153, "epoch": 2.118965181871231, "grad_norm": 1.1875, "learning_rate": 0.0004546210565718972, "loss": 5.0439, "mean_token_accuracy": 0.19571791738271713, "num_tokens": 47243897.0, "step": 27235 }, { "entropy": 5.6996622562408445, "epoch": 2.119354211242949, "grad_norm": 1.21875, "learning_rate": 0.00045460436380006337, "loss": 4.9687, "mean_token_accuracy": 0.2075258880853653, "num_tokens": 47252171.0, "step": 27240 }, { "entropy": 5.700238132476807, "epoch": 2.1197432406146666, "grad_norm": 1.2421875, "learning_rate": 0.0004545876683030192, "loss": 4.957, "mean_token_accuracy": 0.2079739138484001, "num_tokens": 47260494.0, "step": 27245 }, { "entropy": 5.757265949249268, "epoch": 2.120132269986384, "grad_norm": 1.1640625, "learning_rate": 0.0004545709700810181, "loss": 5.1334, "mean_token_accuracy": 0.19683487862348556, "num_tokens": 47269485.0, "step": 27250 }, { "entropy": 5.57166428565979, "epoch": 2.1205212993581015, "grad_norm": 1.15625, "learning_rate": 0.0004545542691343133, "loss": 4.8213, "mean_token_accuracy": 0.2149672254920006, "num_tokens": 47278275.0, "step": 27255 }, { "entropy": 5.666736650466919, "epoch": 2.120910328729819, "grad_norm": 1.1953125, "learning_rate": 0.0004545375654631582, "loss": 4.9443, "mean_token_accuracy": 0.20634870380163192, "num_tokens": 47287267.0, "step": 27260 }, { "entropy": 5.7010571479797365, "epoch": 2.1212993581015365, "grad_norm": 1.2578125, "learning_rate": 0.00045452085906780645, "loss": 5.0707, "mean_token_accuracy": 0.20313130617141723, "num_tokens": 47295785.0, "step": 27265 }, { "entropy": 5.734347724914551, "epoch": 2.121688387473254, "grad_norm": 1.1953125, "learning_rate": 0.00045450414994851123, "loss": 5.0025, "mean_token_accuracy": 0.20578503757715225, "num_tokens": 47303951.0, "step": 27270 }, { "entropy": 5.683846855163575, "epoch": 2.122077416844972, "grad_norm": 1.25, "learning_rate": 0.00045448743810552636, "loss": 4.9791, "mean_token_accuracy": 0.2063542753458023, "num_tokens": 47312226.0, "step": 27275 }, { "entropy": 5.673722267150879, "epoch": 2.1224664462166896, "grad_norm": 1.21875, "learning_rate": 0.00045447072353910537, "loss": 5.0588, "mean_token_accuracy": 0.203763385117054, "num_tokens": 47320657.0, "step": 27280 }, { "entropy": 5.654352235794067, "epoch": 2.122855475588407, "grad_norm": 1.203125, "learning_rate": 0.0004544540062495016, "loss": 4.9663, "mean_token_accuracy": 0.21708998680114747, "num_tokens": 47329063.0, "step": 27285 }, { "entropy": 5.681779861450195, "epoch": 2.1232445049601245, "grad_norm": 1.171875, "learning_rate": 0.00045443728623696905, "loss": 4.9354, "mean_token_accuracy": 0.20447685569524765, "num_tokens": 47338304.0, "step": 27290 }, { "entropy": 5.691348648071289, "epoch": 2.123633534331842, "grad_norm": 1.234375, "learning_rate": 0.00045442056350176123, "loss": 5.0573, "mean_token_accuracy": 0.19748046845197678, "num_tokens": 47347248.0, "step": 27295 }, { "entropy": 5.686807632446289, "epoch": 2.1240225637035595, "grad_norm": 1.2109375, "learning_rate": 0.000454403838044132, "loss": 5.0524, "mean_token_accuracy": 0.2009979620575905, "num_tokens": 47356586.0, "step": 27300 }, { "entropy": 5.723837995529175, "epoch": 2.124411593075277, "grad_norm": 1.1953125, "learning_rate": 0.000454387109864335, "loss": 4.9227, "mean_token_accuracy": 0.2070169672369957, "num_tokens": 47365195.0, "step": 27305 }, { "entropy": 5.722400712966919, "epoch": 2.124800622446995, "grad_norm": 1.0859375, "learning_rate": 0.00045437037896262425, "loss": 5.1387, "mean_token_accuracy": 0.18968493044376372, "num_tokens": 47374154.0, "step": 27310 }, { "entropy": 5.743993425369263, "epoch": 2.125189651818712, "grad_norm": 1.1171875, "learning_rate": 0.0004543536453392534, "loss": 4.9295, "mean_token_accuracy": 0.2105773866176605, "num_tokens": 47383253.0, "step": 27315 }, { "entropy": 5.7482421875, "epoch": 2.12557868119043, "grad_norm": 1.1875, "learning_rate": 0.00045433690899447643, "loss": 5.003, "mean_token_accuracy": 0.2056488424539566, "num_tokens": 47391387.0, "step": 27320 }, { "entropy": 5.732699203491211, "epoch": 2.1259677105621475, "grad_norm": 1.125, "learning_rate": 0.00045432016992854734, "loss": 5.0384, "mean_token_accuracy": 0.20466195046901703, "num_tokens": 47400294.0, "step": 27325 }, { "entropy": 5.707462644577026, "epoch": 2.126356739933865, "grad_norm": 1.1171875, "learning_rate": 0.0004543034281417201, "loss": 4.9573, "mean_token_accuracy": 0.20490468442440032, "num_tokens": 47409024.0, "step": 27330 }, { "entropy": 5.716181087493896, "epoch": 2.1267457693055825, "grad_norm": 1.3515625, "learning_rate": 0.0004542866836342488, "loss": 4.9422, "mean_token_accuracy": 0.20737902522087098, "num_tokens": 47416974.0, "step": 27335 }, { "entropy": 5.703472566604614, "epoch": 2.1271347986773, "grad_norm": 1.1875, "learning_rate": 0.0004542699364063873, "loss": 5.0463, "mean_token_accuracy": 0.20386471152305602, "num_tokens": 47425934.0, "step": 27340 }, { "entropy": 5.62651104927063, "epoch": 2.127523828049018, "grad_norm": 1.1640625, "learning_rate": 0.0004542531864583899, "loss": 5.0414, "mean_token_accuracy": 0.2014046400785446, "num_tokens": 47434764.0, "step": 27345 }, { "entropy": 5.783756351470947, "epoch": 2.127912857420735, "grad_norm": 1.1171875, "learning_rate": 0.0004542364337905108, "loss": 5.0694, "mean_token_accuracy": 0.19161145836114885, "num_tokens": 47443435.0, "step": 27350 }, { "entropy": 5.751344442367554, "epoch": 2.128301886792453, "grad_norm": 1.2109375, "learning_rate": 0.00045421967840300403, "loss": 5.1019, "mean_token_accuracy": 0.1964049145579338, "num_tokens": 47452109.0, "step": 27355 }, { "entropy": 5.7265543937683105, "epoch": 2.1286909161641705, "grad_norm": 1.2421875, "learning_rate": 0.0004542029202961239, "loss": 4.9467, "mean_token_accuracy": 0.2081325888633728, "num_tokens": 47460319.0, "step": 27360 }, { "entropy": 5.762038469314575, "epoch": 2.1290799455358878, "grad_norm": 1.2578125, "learning_rate": 0.00045418615947012464, "loss": 5.1033, "mean_token_accuracy": 0.19344992637634278, "num_tokens": 47468806.0, "step": 27365 }, { "entropy": 5.718782520294189, "epoch": 2.1294689749076054, "grad_norm": 1.34375, "learning_rate": 0.0004541693959252607, "loss": 5.0311, "mean_token_accuracy": 0.20244591385126115, "num_tokens": 47477121.0, "step": 27370 }, { "entropy": 5.561141729354858, "epoch": 2.129858004279323, "grad_norm": 1.171875, "learning_rate": 0.00045415262966178635, "loss": 4.8542, "mean_token_accuracy": 0.21646149456501007, "num_tokens": 47485379.0, "step": 27375 }, { "entropy": 5.686192512512207, "epoch": 2.130247033651041, "grad_norm": 1.1484375, "learning_rate": 0.0004541358606799559, "loss": 5.0313, "mean_token_accuracy": 0.20052382349967957, "num_tokens": 47493402.0, "step": 27380 }, { "entropy": 5.764338111877441, "epoch": 2.130636063022758, "grad_norm": 1.40625, "learning_rate": 0.000454119088980024, "loss": 5.0062, "mean_token_accuracy": 0.20788115859031678, "num_tokens": 47503148.0, "step": 27385 }, { "entropy": 5.715002536773682, "epoch": 2.131025092394476, "grad_norm": 1.1796875, "learning_rate": 0.0004541023145622449, "loss": 4.957, "mean_token_accuracy": 0.20351082533597947, "num_tokens": 47511681.0, "step": 27390 }, { "entropy": 5.646071338653565, "epoch": 2.1314141217661935, "grad_norm": 1.2890625, "learning_rate": 0.00045408553742687336, "loss": 4.9329, "mean_token_accuracy": 0.2098097398877144, "num_tokens": 47520240.0, "step": 27395 }, { "entropy": 5.704679489135742, "epoch": 2.1318031511379107, "grad_norm": 1.1953125, "learning_rate": 0.0004540687575741638, "loss": 4.9945, "mean_token_accuracy": 0.20268191695213317, "num_tokens": 47528553.0, "step": 27400 }, { "entropy": 5.721995401382446, "epoch": 2.1321921805096284, "grad_norm": 1.1875, "learning_rate": 0.00045405197500437077, "loss": 5.0235, "mean_token_accuracy": 0.20466084331274031, "num_tokens": 47537735.0, "step": 27405 }, { "entropy": 5.656980514526367, "epoch": 2.132581209881346, "grad_norm": 1.234375, "learning_rate": 0.00045403518971774915, "loss": 4.9134, "mean_token_accuracy": 0.2093452602624893, "num_tokens": 47545251.0, "step": 27410 }, { "entropy": 5.713734912872314, "epoch": 2.132970239253064, "grad_norm": 1.2734375, "learning_rate": 0.00045401840171455343, "loss": 5.0079, "mean_token_accuracy": 0.19672364443540574, "num_tokens": 47553962.0, "step": 27415 }, { "entropy": 5.700325155258179, "epoch": 2.133359268624781, "grad_norm": 1.1875, "learning_rate": 0.0004540016109950384, "loss": 5.0413, "mean_token_accuracy": 0.20518169105052947, "num_tokens": 47562401.0, "step": 27420 }, { "entropy": 5.719853401184082, "epoch": 2.133748297996499, "grad_norm": 1.25, "learning_rate": 0.0004539848175594589, "loss": 4.9886, "mean_token_accuracy": 0.2078239843249321, "num_tokens": 47570097.0, "step": 27425 }, { "entropy": 5.722873258590698, "epoch": 2.1341373273682165, "grad_norm": 1.1953125, "learning_rate": 0.0004539680214080695, "loss": 5.0305, "mean_token_accuracy": 0.19602590352296828, "num_tokens": 47578705.0, "step": 27430 }, { "entropy": 5.6723301887512205, "epoch": 2.1345263567399337, "grad_norm": 1.1171875, "learning_rate": 0.00045395122254112536, "loss": 5.0235, "mean_token_accuracy": 0.19966764599084855, "num_tokens": 47588075.0, "step": 27435 }, { "entropy": 5.649790525436401, "epoch": 2.1349153861116514, "grad_norm": 1.1640625, "learning_rate": 0.0004539344209588812, "loss": 4.9441, "mean_token_accuracy": 0.2063824102282524, "num_tokens": 47596906.0, "step": 27440 }, { "entropy": 5.678345775604248, "epoch": 2.135304415483369, "grad_norm": 1.09375, "learning_rate": 0.00045391761666159204, "loss": 4.9776, "mean_token_accuracy": 0.21034736186265945, "num_tokens": 47605427.0, "step": 27445 }, { "entropy": 5.781550598144531, "epoch": 2.1356934448550864, "grad_norm": 1.2734375, "learning_rate": 0.00045390080964951294, "loss": 5.1121, "mean_token_accuracy": 0.19671715497970582, "num_tokens": 47614249.0, "step": 27450 }, { "entropy": 5.672934436798096, "epoch": 2.136082474226804, "grad_norm": 1.1328125, "learning_rate": 0.00045388399992289864, "loss": 4.9333, "mean_token_accuracy": 0.20291397124528884, "num_tokens": 47623200.0, "step": 27455 }, { "entropy": 5.725113725662231, "epoch": 2.136471503598522, "grad_norm": 1.1328125, "learning_rate": 0.00045386718748200436, "loss": 5.0333, "mean_token_accuracy": 0.2016819268465042, "num_tokens": 47632392.0, "step": 27460 }, { "entropy": 5.8106883525848385, "epoch": 2.136860532970239, "grad_norm": 1.1796875, "learning_rate": 0.00045385037232708534, "loss": 5.1098, "mean_token_accuracy": 0.20248483419418334, "num_tokens": 47641648.0, "step": 27465 }, { "entropy": 5.7682336330413815, "epoch": 2.1372495623419567, "grad_norm": 1.2109375, "learning_rate": 0.0004538335544583964, "loss": 4.9852, "mean_token_accuracy": 0.20656303614377974, "num_tokens": 47651113.0, "step": 27470 }, { "entropy": 5.757300996780396, "epoch": 2.1376385917136744, "grad_norm": 1.25, "learning_rate": 0.00045381673387619306, "loss": 5.1525, "mean_token_accuracy": 0.195793953537941, "num_tokens": 47659959.0, "step": 27475 }, { "entropy": 5.681690835952759, "epoch": 2.138027621085392, "grad_norm": 1.078125, "learning_rate": 0.00045379991058073035, "loss": 5.0732, "mean_token_accuracy": 0.19897158443927765, "num_tokens": 47668738.0, "step": 27480 }, { "entropy": 5.606641960144043, "epoch": 2.1384166504571094, "grad_norm": 1.203125, "learning_rate": 0.0004537830845722636, "loss": 4.9181, "mean_token_accuracy": 0.211308616399765, "num_tokens": 47677268.0, "step": 27485 }, { "entropy": 5.673650026321411, "epoch": 2.138805679828827, "grad_norm": 1.328125, "learning_rate": 0.0004537662558510481, "loss": 4.912, "mean_token_accuracy": 0.20991974771022798, "num_tokens": 47685339.0, "step": 27490 }, { "entropy": 5.721701431274414, "epoch": 2.1391947092005448, "grad_norm": 1.1015625, "learning_rate": 0.00045374942441733925, "loss": 5.0032, "mean_token_accuracy": 0.2025295227766037, "num_tokens": 47694729.0, "step": 27495 }, { "entropy": 5.672301292419434, "epoch": 2.139583738572262, "grad_norm": 1.2421875, "learning_rate": 0.0004537325902713923, "loss": 4.9777, "mean_token_accuracy": 0.20211876183748245, "num_tokens": 47703555.0, "step": 27500 }, { "entropy": 5.716456317901612, "epoch": 2.1399727679439797, "grad_norm": 1.140625, "learning_rate": 0.0004537157534134629, "loss": 5.0313, "mean_token_accuracy": 0.1967541590332985, "num_tokens": 47713115.0, "step": 27505 }, { "entropy": 5.7185218334198, "epoch": 2.1403617973156974, "grad_norm": 1.140625, "learning_rate": 0.00045369891384380623, "loss": 5.0326, "mean_token_accuracy": 0.2072561040520668, "num_tokens": 47722263.0, "step": 27510 }, { "entropy": 5.718893814086914, "epoch": 2.140750826687415, "grad_norm": 1.2734375, "learning_rate": 0.0004536820715626781, "loss": 5.0217, "mean_token_accuracy": 0.20263720899820328, "num_tokens": 47730037.0, "step": 27515 }, { "entropy": 5.65296688079834, "epoch": 2.1411398560591324, "grad_norm": 1.203125, "learning_rate": 0.00045366522657033385, "loss": 4.9154, "mean_token_accuracy": 0.2206691473722458, "num_tokens": 47738968.0, "step": 27520 }, { "entropy": 5.698263883590698, "epoch": 2.14152888543085, "grad_norm": 1.3046875, "learning_rate": 0.00045364837886702924, "loss": 4.9855, "mean_token_accuracy": 0.2060439646244049, "num_tokens": 47747515.0, "step": 27525 }, { "entropy": 5.667622709274292, "epoch": 2.1419179148025678, "grad_norm": 1.234375, "learning_rate": 0.0004536315284530198, "loss": 4.963, "mean_token_accuracy": 0.2136923313140869, "num_tokens": 47756440.0, "step": 27530 }, { "entropy": 5.6969531059265135, "epoch": 2.142306944174285, "grad_norm": 1.0703125, "learning_rate": 0.0004536146753285612, "loss": 5.0288, "mean_token_accuracy": 0.1925949364900589, "num_tokens": 47765823.0, "step": 27535 }, { "entropy": 5.716357088088989, "epoch": 2.1426959735460027, "grad_norm": 1.15625, "learning_rate": 0.0004535978194939093, "loss": 4.9839, "mean_token_accuracy": 0.20726005584001542, "num_tokens": 47775423.0, "step": 27540 }, { "entropy": 5.710713577270508, "epoch": 2.1430850029177204, "grad_norm": 1.171875, "learning_rate": 0.00045358096094931966, "loss": 5.0465, "mean_token_accuracy": 0.19402572363615037, "num_tokens": 47784276.0, "step": 27545 }, { "entropy": 5.679698657989502, "epoch": 2.1434740322894377, "grad_norm": 1.1484375, "learning_rate": 0.0004535640996950482, "loss": 4.9451, "mean_token_accuracy": 0.21284402310848236, "num_tokens": 47792608.0, "step": 27550 }, { "entropy": 5.659192371368408, "epoch": 2.1438630616611554, "grad_norm": 1.140625, "learning_rate": 0.0004535472357313507, "loss": 5.0316, "mean_token_accuracy": 0.20178054124116898, "num_tokens": 47802356.0, "step": 27555 }, { "entropy": 5.701833009719849, "epoch": 2.144252091032873, "grad_norm": 1.15625, "learning_rate": 0.00045353036905848316, "loss": 5.0062, "mean_token_accuracy": 0.20415971726179122, "num_tokens": 47811307.0, "step": 27560 }, { "entropy": 5.791537523269653, "epoch": 2.1446411204045903, "grad_norm": 1.125, "learning_rate": 0.0004535134996767014, "loss": 5.1092, "mean_token_accuracy": 0.195357084274292, "num_tokens": 47820572.0, "step": 27565 }, { "entropy": 5.742964267730713, "epoch": 2.145030149776308, "grad_norm": 1.2734375, "learning_rate": 0.0004534966275862614, "loss": 5.0789, "mean_token_accuracy": 0.20082349479198455, "num_tokens": 47829053.0, "step": 27570 }, { "entropy": 5.766876602172852, "epoch": 2.1454191791480257, "grad_norm": 1.3046875, "learning_rate": 0.0004534797527874192, "loss": 4.9838, "mean_token_accuracy": 0.20230368822813033, "num_tokens": 47838244.0, "step": 27575 }, { "entropy": 5.692704486846924, "epoch": 2.1458082085197434, "grad_norm": 1.328125, "learning_rate": 0.00045346287528043083, "loss": 4.9235, "mean_token_accuracy": 0.2118486151099205, "num_tokens": 47846908.0, "step": 27580 }, { "entropy": 5.706371879577636, "epoch": 2.1461972378914607, "grad_norm": 1.234375, "learning_rate": 0.00045344599506555244, "loss": 5.0736, "mean_token_accuracy": 0.20030611902475357, "num_tokens": 47855824.0, "step": 27585 }, { "entropy": 5.67712435722351, "epoch": 2.1465862672631784, "grad_norm": 1.1640625, "learning_rate": 0.00045342911214304, "loss": 4.9183, "mean_token_accuracy": 0.20333437174558638, "num_tokens": 47864641.0, "step": 27590 }, { "entropy": 5.742670106887817, "epoch": 2.146975296634896, "grad_norm": 1.25, "learning_rate": 0.0004534122265131498, "loss": 5.0939, "mean_token_accuracy": 0.19816931188106537, "num_tokens": 47873721.0, "step": 27595 }, { "entropy": 5.701150512695312, "epoch": 2.1473643260066133, "grad_norm": 1.1796875, "learning_rate": 0.00045339533817613807, "loss": 4.9352, "mean_token_accuracy": 0.21271092295646668, "num_tokens": 47882485.0, "step": 27600 }, { "entropy": 5.655875396728516, "epoch": 2.147753355378331, "grad_norm": 1.15625, "learning_rate": 0.00045337844713226106, "loss": 4.8788, "mean_token_accuracy": 0.20662842839956283, "num_tokens": 47891574.0, "step": 27605 }, { "entropy": 5.635758781433106, "epoch": 2.1481423847500487, "grad_norm": 1.2265625, "learning_rate": 0.00045336155338177497, "loss": 4.8731, "mean_token_accuracy": 0.21360377222299576, "num_tokens": 47900123.0, "step": 27610 }, { "entropy": 5.6526069164276125, "epoch": 2.1485314141217664, "grad_norm": 1.1640625, "learning_rate": 0.0004533446569249362, "loss": 4.9978, "mean_token_accuracy": 0.20859355628490447, "num_tokens": 47908342.0, "step": 27615 }, { "entropy": 5.666867113113403, "epoch": 2.1489204434934837, "grad_norm": 1.2265625, "learning_rate": 0.00045332775776200116, "loss": 4.9525, "mean_token_accuracy": 0.21033590883016587, "num_tokens": 47917365.0, "step": 27620 }, { "entropy": 5.664396047592163, "epoch": 2.1493094728652014, "grad_norm": 1.2109375, "learning_rate": 0.00045331085589322626, "loss": 4.9375, "mean_token_accuracy": 0.20193236023187638, "num_tokens": 47925839.0, "step": 27625 }, { "entropy": 5.649382591247559, "epoch": 2.149698502236919, "grad_norm": 1.171875, "learning_rate": 0.0004532939513188679, "loss": 4.8774, "mean_token_accuracy": 0.2188877433538437, "num_tokens": 47934408.0, "step": 27630 }, { "entropy": 5.695407199859619, "epoch": 2.1500875316086363, "grad_norm": 1.328125, "learning_rate": 0.0004532770440391826, "loss": 5.0192, "mean_token_accuracy": 0.197219780087471, "num_tokens": 47943486.0, "step": 27635 }, { "entropy": 5.742846393585205, "epoch": 2.150476560980354, "grad_norm": 1.1796875, "learning_rate": 0.0004532601340544269, "loss": 5.0478, "mean_token_accuracy": 0.2034695565700531, "num_tokens": 47952809.0, "step": 27640 }, { "entropy": 5.729238986968994, "epoch": 2.1508655903520717, "grad_norm": 1.28125, "learning_rate": 0.0004532432213648574, "loss": 4.9385, "mean_token_accuracy": 0.2084517851471901, "num_tokens": 47961104.0, "step": 27645 }, { "entropy": 5.677875089645386, "epoch": 2.151254619723789, "grad_norm": 1.25, "learning_rate": 0.00045322630597073067, "loss": 4.9793, "mean_token_accuracy": 0.19941056966781617, "num_tokens": 47969442.0, "step": 27650 }, { "entropy": 5.597454595565796, "epoch": 2.1516436490955066, "grad_norm": 1.171875, "learning_rate": 0.00045320938787230355, "loss": 4.8951, "mean_token_accuracy": 0.2114834189414978, "num_tokens": 47978703.0, "step": 27655 }, { "entropy": 5.736273527145386, "epoch": 2.1520326784672243, "grad_norm": 1.2421875, "learning_rate": 0.00045319246706983257, "loss": 5.0271, "mean_token_accuracy": 0.20214398950338364, "num_tokens": 47986886.0, "step": 27660 }, { "entropy": 5.7328636169433596, "epoch": 2.152421707838942, "grad_norm": 1.2421875, "learning_rate": 0.00045317554356357446, "loss": 4.9328, "mean_token_accuracy": 0.21054258942604065, "num_tokens": 47995278.0, "step": 27665 }, { "entropy": 5.681626224517823, "epoch": 2.1528107372106593, "grad_norm": 1.1796875, "learning_rate": 0.00045315861735378615, "loss": 4.9773, "mean_token_accuracy": 0.2038572072982788, "num_tokens": 48004351.0, "step": 27670 }, { "entropy": 5.722432374954224, "epoch": 2.153199766582377, "grad_norm": 1.140625, "learning_rate": 0.00045314168844072435, "loss": 4.9813, "mean_token_accuracy": 0.20663430243730546, "num_tokens": 48013346.0, "step": 27675 }, { "entropy": 5.693291234970093, "epoch": 2.1535887959540947, "grad_norm": 1.2265625, "learning_rate": 0.00045312475682464604, "loss": 5.0587, "mean_token_accuracy": 0.2035825252532959, "num_tokens": 48023371.0, "step": 27680 }, { "entropy": 5.642207241058349, "epoch": 2.153977825325812, "grad_norm": 1.1875, "learning_rate": 0.00045310782250580794, "loss": 4.9496, "mean_token_accuracy": 0.2094508081674576, "num_tokens": 48032095.0, "step": 27685 }, { "entropy": 5.684958410263062, "epoch": 2.1543668546975296, "grad_norm": 1.234375, "learning_rate": 0.0004530908854844672, "loss": 4.9224, "mean_token_accuracy": 0.20611189305782318, "num_tokens": 48040818.0, "step": 27690 }, { "entropy": 5.664567470550537, "epoch": 2.1547558840692473, "grad_norm": 1.234375, "learning_rate": 0.00045307394576088076, "loss": 4.9085, "mean_token_accuracy": 0.21852250546216964, "num_tokens": 48049737.0, "step": 27695 }, { "entropy": 5.595551872253418, "epoch": 2.1551449134409646, "grad_norm": 1.125, "learning_rate": 0.0004530570033353056, "loss": 4.8788, "mean_token_accuracy": 0.2068950951099396, "num_tokens": 48057659.0, "step": 27700 }, { "entropy": 5.655428886413574, "epoch": 2.1555339428126823, "grad_norm": 1.15625, "learning_rate": 0.00045304005820799874, "loss": 4.8456, "mean_token_accuracy": 0.2075860545039177, "num_tokens": 48066578.0, "step": 27705 }, { "entropy": 5.688319873809815, "epoch": 2.1559229721844, "grad_norm": 1.1484375, "learning_rate": 0.0004530231103792175, "loss": 5.0395, "mean_token_accuracy": 0.20110439360141755, "num_tokens": 48076051.0, "step": 27710 }, { "entropy": 5.7266932964324955, "epoch": 2.1563120015561177, "grad_norm": 1.203125, "learning_rate": 0.0004530061598492188, "loss": 5.054, "mean_token_accuracy": 0.20010719150304795, "num_tokens": 48084722.0, "step": 27715 }, { "entropy": 5.647017955780029, "epoch": 2.156701030927835, "grad_norm": 1.2421875, "learning_rate": 0.00045298920661826004, "loss": 4.8658, "mean_token_accuracy": 0.21423972845077516, "num_tokens": 48092890.0, "step": 27720 }, { "entropy": 5.720371866226197, "epoch": 2.1570900602995526, "grad_norm": 1.21875, "learning_rate": 0.0004529722506865984, "loss": 4.998, "mean_token_accuracy": 0.20528857707977294, "num_tokens": 48101146.0, "step": 27725 }, { "entropy": 5.70270299911499, "epoch": 2.1574790896712703, "grad_norm": 1.2109375, "learning_rate": 0.000452955292054491, "loss": 5.0043, "mean_token_accuracy": 0.20414438396692275, "num_tokens": 48109974.0, "step": 27730 }, { "entropy": 5.728003740310669, "epoch": 2.1578681190429876, "grad_norm": 1.28125, "learning_rate": 0.00045293833072219535, "loss": 5.061, "mean_token_accuracy": 0.2004196286201477, "num_tokens": 48118325.0, "step": 27735 }, { "entropy": 5.746850919723511, "epoch": 2.1582571484147053, "grad_norm": 1.1484375, "learning_rate": 0.00045292136668996876, "loss": 5.0917, "mean_token_accuracy": 0.19573197066783904, "num_tokens": 48128255.0, "step": 27740 }, { "entropy": 5.699099397659301, "epoch": 2.158646177786423, "grad_norm": 1.1796875, "learning_rate": 0.0004529043999580686, "loss": 4.9114, "mean_token_accuracy": 0.2118326410651207, "num_tokens": 48136763.0, "step": 27745 }, { "entropy": 5.652976036071777, "epoch": 2.1590352071581402, "grad_norm": 1.140625, "learning_rate": 0.00045288743052675234, "loss": 4.9159, "mean_token_accuracy": 0.21486248522996904, "num_tokens": 48146371.0, "step": 27750 }, { "entropy": 5.694534492492676, "epoch": 2.159424236529858, "grad_norm": 1.34375, "learning_rate": 0.00045287045839627744, "loss": 4.9901, "mean_token_accuracy": 0.21100818663835524, "num_tokens": 48155180.0, "step": 27755 }, { "entropy": 5.617306852340699, "epoch": 2.1598132659015756, "grad_norm": 1.1875, "learning_rate": 0.00045285348356690155, "loss": 4.9559, "mean_token_accuracy": 0.20671525001525878, "num_tokens": 48163728.0, "step": 27760 }, { "entropy": 5.658135080337525, "epoch": 2.1602022952732933, "grad_norm": 1.1953125, "learning_rate": 0.000452836506038882, "loss": 4.9737, "mean_token_accuracy": 0.2010297641158104, "num_tokens": 48171844.0, "step": 27765 }, { "entropy": 5.759475517272949, "epoch": 2.1605913246450106, "grad_norm": 1.2421875, "learning_rate": 0.00045281952581247654, "loss": 5.0525, "mean_token_accuracy": 0.2034651219844818, "num_tokens": 48180617.0, "step": 27770 }, { "entropy": 5.69092288017273, "epoch": 2.1609803540167283, "grad_norm": 1.265625, "learning_rate": 0.00045280254288794286, "loss": 4.9342, "mean_token_accuracy": 0.20536487996578218, "num_tokens": 48188875.0, "step": 27775 }, { "entropy": 5.591668033599854, "epoch": 2.161369383388446, "grad_norm": 1.1875, "learning_rate": 0.00045278555726553855, "loss": 4.88, "mean_token_accuracy": 0.20635617673397064, "num_tokens": 48197280.0, "step": 27780 }, { "entropy": 5.701783990859985, "epoch": 2.1617584127601632, "grad_norm": 1.0390625, "learning_rate": 0.00045276856894552143, "loss": 5.0697, "mean_token_accuracy": 0.20198207944631577, "num_tokens": 48206907.0, "step": 27785 }, { "entropy": 5.661320352554322, "epoch": 2.162147442131881, "grad_norm": 1.296875, "learning_rate": 0.0004527515779281492, "loss": 4.8941, "mean_token_accuracy": 0.21254518181085585, "num_tokens": 48215334.0, "step": 27790 }, { "entropy": 5.675133943557739, "epoch": 2.1625364715035986, "grad_norm": 1.140625, "learning_rate": 0.00045273458421367976, "loss": 5.0164, "mean_token_accuracy": 0.20372989028692245, "num_tokens": 48224667.0, "step": 27795 }, { "entropy": 5.694805145263672, "epoch": 2.162925500875316, "grad_norm": 1.0703125, "learning_rate": 0.0004527175878023708, "loss": 5.0729, "mean_token_accuracy": 0.20298838019371032, "num_tokens": 48233237.0, "step": 27800 }, { "entropy": 5.701748943328857, "epoch": 2.1633145302470336, "grad_norm": 1.234375, "learning_rate": 0.0004527005886944803, "loss": 4.9758, "mean_token_accuracy": 0.20144418478012086, "num_tokens": 48241048.0, "step": 27805 }, { "entropy": 5.781676864624023, "epoch": 2.1637035596187513, "grad_norm": 1.125, "learning_rate": 0.00045268358689026626, "loss": 5.0762, "mean_token_accuracy": 0.20464471280574797, "num_tokens": 48250013.0, "step": 27810 }, { "entropy": 5.775678730010986, "epoch": 2.164092588990469, "grad_norm": 1.2109375, "learning_rate": 0.0004526665823899866, "loss": 5.0554, "mean_token_accuracy": 0.20379042327404023, "num_tokens": 48258566.0, "step": 27815 }, { "entropy": 5.6985467910766605, "epoch": 2.164481618362186, "grad_norm": 1.265625, "learning_rate": 0.00045264957519389936, "loss": 4.9191, "mean_token_accuracy": 0.20683735311031343, "num_tokens": 48266843.0, "step": 27820 }, { "entropy": 5.644751358032226, "epoch": 2.164870647733904, "grad_norm": 1.1484375, "learning_rate": 0.00045263256530226253, "loss": 4.8997, "mean_token_accuracy": 0.2079235076904297, "num_tokens": 48276138.0, "step": 27825 }, { "entropy": 5.627683544158936, "epoch": 2.1652596771056216, "grad_norm": 1.265625, "learning_rate": 0.0004526155527153343, "loss": 4.8477, "mean_token_accuracy": 0.21218783408403397, "num_tokens": 48284452.0, "step": 27830 }, { "entropy": 5.741854667663574, "epoch": 2.165648706477339, "grad_norm": 1.171875, "learning_rate": 0.0004525985374333727, "loss": 5.0011, "mean_token_accuracy": 0.20259683579206467, "num_tokens": 48292871.0, "step": 27835 }, { "entropy": 5.670397710800171, "epoch": 2.1660377358490566, "grad_norm": 1.2109375, "learning_rate": 0.000452581519456636, "loss": 4.9904, "mean_token_accuracy": 0.20041822046041488, "num_tokens": 48300642.0, "step": 27840 }, { "entropy": 5.712048673629761, "epoch": 2.1664267652207743, "grad_norm": 1.140625, "learning_rate": 0.00045256449878538243, "loss": 5.0652, "mean_token_accuracy": 0.19402231723070146, "num_tokens": 48309229.0, "step": 27845 }, { "entropy": 5.771245098114013, "epoch": 2.166815794592492, "grad_norm": 1.234375, "learning_rate": 0.00045254747541987017, "loss": 4.9991, "mean_token_accuracy": 0.1950952872633934, "num_tokens": 48317474.0, "step": 27850 }, { "entropy": 5.757614374160767, "epoch": 2.167204823964209, "grad_norm": 1.2109375, "learning_rate": 0.0004525304493603576, "loss": 5.0661, "mean_token_accuracy": 0.203395713865757, "num_tokens": 48325810.0, "step": 27855 }, { "entropy": 5.708132982254028, "epoch": 2.167593853335927, "grad_norm": 1.1640625, "learning_rate": 0.00045251342060710295, "loss": 4.9907, "mean_token_accuracy": 0.20279304534196854, "num_tokens": 48334348.0, "step": 27860 }, { "entropy": 5.607769870758057, "epoch": 2.1679828827076446, "grad_norm": 1.1796875, "learning_rate": 0.0004524963891603647, "loss": 4.8415, "mean_token_accuracy": 0.20977737605571747, "num_tokens": 48342565.0, "step": 27865 }, { "entropy": 5.6819226264953615, "epoch": 2.168371912079362, "grad_norm": 1.1796875, "learning_rate": 0.00045247935502040136, "loss": 5.087, "mean_token_accuracy": 0.1961832895874977, "num_tokens": 48351398.0, "step": 27870 }, { "entropy": 5.667052841186523, "epoch": 2.1687609414510796, "grad_norm": 1.296875, "learning_rate": 0.0004524623181874712, "loss": 4.9843, "mean_token_accuracy": 0.20053137689828873, "num_tokens": 48360275.0, "step": 27875 }, { "entropy": 5.687873888015747, "epoch": 2.1691499708227973, "grad_norm": 1.2109375, "learning_rate": 0.0004524452786618329, "loss": 4.9426, "mean_token_accuracy": 0.20312148332595825, "num_tokens": 48369516.0, "step": 27880 }, { "entropy": 5.661909532546997, "epoch": 2.1695390001945145, "grad_norm": 1.1953125, "learning_rate": 0.00045242823644374484, "loss": 4.951, "mean_token_accuracy": 0.2072077289223671, "num_tokens": 48378412.0, "step": 27885 }, { "entropy": 5.714970302581787, "epoch": 2.169928029566232, "grad_norm": 1.28125, "learning_rate": 0.0004524111915334658, "loss": 5.022, "mean_token_accuracy": 0.20247285813093185, "num_tokens": 48386566.0, "step": 27890 }, { "entropy": 5.757609033584595, "epoch": 2.17031705893795, "grad_norm": 1.140625, "learning_rate": 0.00045239414393125424, "loss": 5.0151, "mean_token_accuracy": 0.19871056973934173, "num_tokens": 48394727.0, "step": 27895 }, { "entropy": 5.767094707489013, "epoch": 2.170706088309667, "grad_norm": 1.234375, "learning_rate": 0.0004523770936373689, "loss": 5.0734, "mean_token_accuracy": 0.1999158039689064, "num_tokens": 48404440.0, "step": 27900 }, { "entropy": 5.691420316696167, "epoch": 2.171095117681385, "grad_norm": 1.15625, "learning_rate": 0.0004523600406520685, "loss": 4.9397, "mean_token_accuracy": 0.20646082609891891, "num_tokens": 48413441.0, "step": 27905 }, { "entropy": 5.741039657592774, "epoch": 2.1714841470531026, "grad_norm": 1.21875, "learning_rate": 0.0004523429849756118, "loss": 5.0655, "mean_token_accuracy": 0.19967739433050155, "num_tokens": 48422393.0, "step": 27910 }, { "entropy": 5.712139701843261, "epoch": 2.1718731764248203, "grad_norm": 1.25, "learning_rate": 0.0004523259266082576, "loss": 5.0062, "mean_token_accuracy": 0.21397970914840697, "num_tokens": 48431151.0, "step": 27915 }, { "entropy": 5.684113931655884, "epoch": 2.1722622057965375, "grad_norm": 1.234375, "learning_rate": 0.00045230886555026455, "loss": 4.9466, "mean_token_accuracy": 0.21216524839401246, "num_tokens": 48439453.0, "step": 27920 }, { "entropy": 5.748486948013306, "epoch": 2.172651235168255, "grad_norm": 1.1015625, "learning_rate": 0.00045229180180189176, "loss": 5.027, "mean_token_accuracy": 0.20650583505630493, "num_tokens": 48448055.0, "step": 27925 }, { "entropy": 5.710920524597168, "epoch": 2.173040264539973, "grad_norm": 1.1875, "learning_rate": 0.00045227473536339817, "loss": 4.9027, "mean_token_accuracy": 0.21643728613853455, "num_tokens": 48456015.0, "step": 27930 }, { "entropy": 5.666434478759766, "epoch": 2.17342929391169, "grad_norm": 1.1796875, "learning_rate": 0.0004522576662350425, "loss": 5.001, "mean_token_accuracy": 0.20859433114528655, "num_tokens": 48464389.0, "step": 27935 }, { "entropy": 5.707480382919312, "epoch": 2.173818323283408, "grad_norm": 1.2421875, "learning_rate": 0.000452240594417084, "loss": 4.945, "mean_token_accuracy": 0.20088809728622437, "num_tokens": 48472403.0, "step": 27940 }, { "entropy": 5.644100189208984, "epoch": 2.1742073526551255, "grad_norm": 1.203125, "learning_rate": 0.0004522235199097815, "loss": 4.9903, "mean_token_accuracy": 0.19898601323366166, "num_tokens": 48480879.0, "step": 27945 }, { "entropy": 5.644384384155273, "epoch": 2.1745963820268432, "grad_norm": 1.1953125, "learning_rate": 0.0004522064427133942, "loss": 4.9621, "mean_token_accuracy": 0.20367229878902435, "num_tokens": 48489722.0, "step": 27950 }, { "entropy": 5.6606639385223385, "epoch": 2.1749854113985605, "grad_norm": 1.078125, "learning_rate": 0.00045218936282818116, "loss": 4.9732, "mean_token_accuracy": 0.2055150479078293, "num_tokens": 48499023.0, "step": 27955 }, { "entropy": 5.743335723876953, "epoch": 2.175374440770278, "grad_norm": 1.234375, "learning_rate": 0.0004521722802544016, "loss": 5.0285, "mean_token_accuracy": 0.21172675639390945, "num_tokens": 48508352.0, "step": 27960 }, { "entropy": 5.6740015029907225, "epoch": 2.175763470141996, "grad_norm": 1.109375, "learning_rate": 0.00045215519499231465, "loss": 4.883, "mean_token_accuracy": 0.2197446718811989, "num_tokens": 48517481.0, "step": 27965 }, { "entropy": 5.672723960876465, "epoch": 2.176152499513713, "grad_norm": 1.28125, "learning_rate": 0.00045213810704217963, "loss": 4.9661, "mean_token_accuracy": 0.20563762485980988, "num_tokens": 48525777.0, "step": 27970 }, { "entropy": 5.629616355895996, "epoch": 2.176541528885431, "grad_norm": 1.2109375, "learning_rate": 0.0004521210164042557, "loss": 4.8746, "mean_token_accuracy": 0.2062548115849495, "num_tokens": 48534297.0, "step": 27975 }, { "entropy": 5.708858251571655, "epoch": 2.1769305582571485, "grad_norm": 1.1953125, "learning_rate": 0.0004521039230788024, "loss": 4.9882, "mean_token_accuracy": 0.21162746995687484, "num_tokens": 48543425.0, "step": 27980 }, { "entropy": 5.664286327362061, "epoch": 2.177319587628866, "grad_norm": 1.203125, "learning_rate": 0.0004520868270660789, "loss": 4.9389, "mean_token_accuracy": 0.2029540240764618, "num_tokens": 48553114.0, "step": 27985 }, { "entropy": 5.813627672195435, "epoch": 2.1777086170005835, "grad_norm": 1.171875, "learning_rate": 0.0004520697283663446, "loss": 5.0163, "mean_token_accuracy": 0.20899298042058945, "num_tokens": 48561409.0, "step": 27990 }, { "entropy": 5.7239377975463865, "epoch": 2.178097646372301, "grad_norm": 1.1640625, "learning_rate": 0.00045205262697985897, "loss": 5.0141, "mean_token_accuracy": 0.19575997292995453, "num_tokens": 48569782.0, "step": 27995 }, { "entropy": 5.716666793823242, "epoch": 2.1784866757440184, "grad_norm": 1.1640625, "learning_rate": 0.0004520355229068816, "loss": 5.0797, "mean_token_accuracy": 0.19586392641067504, "num_tokens": 48579283.0, "step": 28000 }, { "entropy": 5.744035005569458, "epoch": 2.178875705115736, "grad_norm": 1.1875, "learning_rate": 0.00045201841614767203, "loss": 5.0012, "mean_token_accuracy": 0.20357227474451065, "num_tokens": 48587649.0, "step": 28005 }, { "entropy": 5.74961748123169, "epoch": 2.179264734487454, "grad_norm": 1.2421875, "learning_rate": 0.00045200130670248974, "loss": 4.9978, "mean_token_accuracy": 0.20005417764186859, "num_tokens": 48596227.0, "step": 28010 }, { "entropy": 5.654628849029541, "epoch": 2.1796537638591715, "grad_norm": 1.296875, "learning_rate": 0.00045198419457159424, "loss": 4.947, "mean_token_accuracy": 0.19708692133426667, "num_tokens": 48605364.0, "step": 28015 }, { "entropy": 5.685307884216309, "epoch": 2.180042793230889, "grad_norm": 1.1796875, "learning_rate": 0.0004519670797552453, "loss": 5.0421, "mean_token_accuracy": 0.2038318023085594, "num_tokens": 48613794.0, "step": 28020 }, { "entropy": 5.741675233840942, "epoch": 2.1804318226026065, "grad_norm": 1.375, "learning_rate": 0.00045194996225370266, "loss": 5.012, "mean_token_accuracy": 0.19756045788526536, "num_tokens": 48622381.0, "step": 28025 }, { "entropy": 5.808018445968628, "epoch": 2.180820851974324, "grad_norm": 1.2265625, "learning_rate": 0.00045193284206722595, "loss": 5.1455, "mean_token_accuracy": 0.19119613915681838, "num_tokens": 48631484.0, "step": 28030 }, { "entropy": 5.693644571304321, "epoch": 2.1812098813460414, "grad_norm": 1.234375, "learning_rate": 0.0004519157191960749, "loss": 5.0294, "mean_token_accuracy": 0.20057007670402527, "num_tokens": 48641082.0, "step": 28035 }, { "entropy": 5.722043466567993, "epoch": 2.181598910717759, "grad_norm": 1.2265625, "learning_rate": 0.0004518985936405096, "loss": 4.9872, "mean_token_accuracy": 0.20346074402332306, "num_tokens": 48649974.0, "step": 28040 }, { "entropy": 5.755811309814453, "epoch": 2.181987940089477, "grad_norm": 1.34375, "learning_rate": 0.0004518814654007896, "loss": 5.0201, "mean_token_accuracy": 0.20758064687252045, "num_tokens": 48658633.0, "step": 28045 }, { "entropy": 5.664405822753906, "epoch": 2.1823769694611945, "grad_norm": 1.140625, "learning_rate": 0.00045186433447717486, "loss": 4.9898, "mean_token_accuracy": 0.2016853481531143, "num_tokens": 48667313.0, "step": 28050 }, { "entropy": 5.7164473056793215, "epoch": 2.182765998832912, "grad_norm": 1.1796875, "learning_rate": 0.00045184720086992536, "loss": 5.0518, "mean_token_accuracy": 0.19998390972614288, "num_tokens": 48676664.0, "step": 28055 }, { "entropy": 5.70733413696289, "epoch": 2.1831550282046295, "grad_norm": 1.1953125, "learning_rate": 0.00045183006457930107, "loss": 4.9377, "mean_token_accuracy": 0.21213295608758925, "num_tokens": 48684770.0, "step": 28060 }, { "entropy": 5.659025430679321, "epoch": 2.183544057576347, "grad_norm": 1.28125, "learning_rate": 0.0004518129256055621, "loss": 4.9347, "mean_token_accuracy": 0.20799660086631774, "num_tokens": 48692965.0, "step": 28065 }, { "entropy": 5.774905443191528, "epoch": 2.1839330869480644, "grad_norm": 1.21875, "learning_rate": 0.0004517957839489683, "loss": 5.0308, "mean_token_accuracy": 0.20385248214006424, "num_tokens": 48702273.0, "step": 28070 }, { "entropy": 5.674905395507812, "epoch": 2.184322116319782, "grad_norm": 1.2109375, "learning_rate": 0.00045177863960977986, "loss": 4.991, "mean_token_accuracy": 0.1967081233859062, "num_tokens": 48710884.0, "step": 28075 }, { "entropy": 5.810346031188965, "epoch": 2.1847111456915, "grad_norm": 1.28125, "learning_rate": 0.000451761492588257, "loss": 5.1314, "mean_token_accuracy": 0.18994418680667877, "num_tokens": 48719673.0, "step": 28080 }, { "entropy": 5.689353704452515, "epoch": 2.185100175063217, "grad_norm": 1.2890625, "learning_rate": 0.00045174434288465986, "loss": 4.9893, "mean_token_accuracy": 0.21025285720825196, "num_tokens": 48728084.0, "step": 28085 }, { "entropy": 5.74102201461792, "epoch": 2.1854892044349348, "grad_norm": 1.328125, "learning_rate": 0.0004517271904992486, "loss": 5.0776, "mean_token_accuracy": 0.20154687464237214, "num_tokens": 48736621.0, "step": 28090 }, { "entropy": 5.753596067428589, "epoch": 2.1858782338066525, "grad_norm": 1.1953125, "learning_rate": 0.0004517100354322835, "loss": 5.0088, "mean_token_accuracy": 0.20686496943235397, "num_tokens": 48744990.0, "step": 28095 }, { "entropy": 5.707619857788086, "epoch": 2.18626726317837, "grad_norm": 1.2109375, "learning_rate": 0.00045169287768402497, "loss": 5.0353, "mean_token_accuracy": 0.19160938858985901, "num_tokens": 48753640.0, "step": 28100 }, { "entropy": 5.63163046836853, "epoch": 2.1866562925500874, "grad_norm": 1.171875, "learning_rate": 0.0004516757172547331, "loss": 4.9263, "mean_token_accuracy": 0.2099306106567383, "num_tokens": 48762836.0, "step": 28105 }, { "entropy": 5.714001417160034, "epoch": 2.187045321921805, "grad_norm": 1.2578125, "learning_rate": 0.0004516585541446685, "loss": 5.0141, "mean_token_accuracy": 0.20325562208890915, "num_tokens": 48771158.0, "step": 28110 }, { "entropy": 5.703816699981689, "epoch": 2.187434351293523, "grad_norm": 1.171875, "learning_rate": 0.00045164138835409153, "loss": 5.0733, "mean_token_accuracy": 0.1949499160051346, "num_tokens": 48779631.0, "step": 28115 }, { "entropy": 5.707851552963257, "epoch": 2.18782338066524, "grad_norm": 1.34375, "learning_rate": 0.00045162421988326266, "loss": 5.0607, "mean_token_accuracy": 0.19756405502557756, "num_tokens": 48788584.0, "step": 28120 }, { "entropy": 5.695174694061279, "epoch": 2.1882124100369578, "grad_norm": 1.1484375, "learning_rate": 0.0004516070487324424, "loss": 4.9391, "mean_token_accuracy": 0.20184656381607055, "num_tokens": 48797403.0, "step": 28125 }, { "entropy": 5.671128988265991, "epoch": 2.1886014394086755, "grad_norm": 1.1953125, "learning_rate": 0.00045158987490189124, "loss": 5.0085, "mean_token_accuracy": 0.21112131625413894, "num_tokens": 48805448.0, "step": 28130 }, { "entropy": 5.72662091255188, "epoch": 2.1889904687803927, "grad_norm": 1.1640625, "learning_rate": 0.0004515726983918697, "loss": 5.0436, "mean_token_accuracy": 0.20126300156116486, "num_tokens": 48814983.0, "step": 28135 }, { "entropy": 5.7558988571167, "epoch": 2.1893794981521104, "grad_norm": 1.1875, "learning_rate": 0.00045155551920263864, "loss": 4.994, "mean_token_accuracy": 0.2037679061293602, "num_tokens": 48823955.0, "step": 28140 }, { "entropy": 5.750918388366699, "epoch": 2.189768527523828, "grad_norm": 1.3359375, "learning_rate": 0.00045153833733445857, "loss": 5.0369, "mean_token_accuracy": 0.20174161344766617, "num_tokens": 48832078.0, "step": 28145 }, { "entropy": 5.750604772567749, "epoch": 2.190157556895546, "grad_norm": 1.234375, "learning_rate": 0.0004515211527875903, "loss": 4.9704, "mean_token_accuracy": 0.20717132836580276, "num_tokens": 48840351.0, "step": 28150 }, { "entropy": 5.687026166915894, "epoch": 2.190546586267263, "grad_norm": 1.171875, "learning_rate": 0.0004515039655622943, "loss": 4.9345, "mean_token_accuracy": 0.21429229229688646, "num_tokens": 48848333.0, "step": 28155 }, { "entropy": 5.663086938858032, "epoch": 2.1909356156389808, "grad_norm": 1.21875, "learning_rate": 0.00045148677565883167, "loss": 4.9948, "mean_token_accuracy": 0.19683879017829894, "num_tokens": 48856806.0, "step": 28160 }, { "entropy": 5.741447591781617, "epoch": 2.1913246450106985, "grad_norm": 1.265625, "learning_rate": 0.0004514695830774631, "loss": 5.0501, "mean_token_accuracy": 0.20508329272270204, "num_tokens": 48865848.0, "step": 28165 }, { "entropy": 5.7666182041168215, "epoch": 2.1917136743824157, "grad_norm": 1.265625, "learning_rate": 0.00045145238781844953, "loss": 5.0658, "mean_token_accuracy": 0.19703116565942763, "num_tokens": 48875899.0, "step": 28170 }, { "entropy": 5.718249273300171, "epoch": 2.1921027037541334, "grad_norm": 1.1171875, "learning_rate": 0.00045143518988205184, "loss": 4.9535, "mean_token_accuracy": 0.20782748609781265, "num_tokens": 48884026.0, "step": 28175 }, { "entropy": 5.720352125167847, "epoch": 2.192491733125851, "grad_norm": 1.2109375, "learning_rate": 0.00045141798926853094, "loss": 4.9976, "mean_token_accuracy": 0.19865641593933106, "num_tokens": 48892640.0, "step": 28180 }, { "entropy": 5.786416959762573, "epoch": 2.1928807624975684, "grad_norm": 1.2109375, "learning_rate": 0.0004514007859781478, "loss": 5.0596, "mean_token_accuracy": 0.19939381927251815, "num_tokens": 48901071.0, "step": 28185 }, { "entropy": 5.745792627334595, "epoch": 2.193269791869286, "grad_norm": 1.1953125, "learning_rate": 0.0004513835800111635, "loss": 4.91, "mean_token_accuracy": 0.2157277673482895, "num_tokens": 48909034.0, "step": 28190 }, { "entropy": 5.753616666793823, "epoch": 2.1936588212410038, "grad_norm": 1.2734375, "learning_rate": 0.0004513663713678392, "loss": 5.1, "mean_token_accuracy": 0.19856774657964707, "num_tokens": 48918399.0, "step": 28195 }, { "entropy": 5.7065513134002686, "epoch": 2.1940478506127215, "grad_norm": 1.1328125, "learning_rate": 0.00045134916004843596, "loss": 5.0057, "mean_token_accuracy": 0.20225861966609954, "num_tokens": 48926767.0, "step": 28200 }, { "entropy": 5.722287178039551, "epoch": 2.1944368799844387, "grad_norm": 1.1953125, "learning_rate": 0.0004513319460532148, "loss": 4.9429, "mean_token_accuracy": 0.2059488609433174, "num_tokens": 48935666.0, "step": 28205 }, { "entropy": 5.70296893119812, "epoch": 2.1948259093561564, "grad_norm": 1.1484375, "learning_rate": 0.00045131472938243707, "loss": 5.0093, "mean_token_accuracy": 0.20246360450983047, "num_tokens": 48944461.0, "step": 28210 }, { "entropy": 5.6407942295074465, "epoch": 2.195214938727874, "grad_norm": 1.2265625, "learning_rate": 0.0004512975100363639, "loss": 4.9325, "mean_token_accuracy": 0.20925680547952652, "num_tokens": 48952368.0, "step": 28215 }, { "entropy": 5.574014472961426, "epoch": 2.1956039680995914, "grad_norm": 1.078125, "learning_rate": 0.00045128028801525675, "loss": 4.8126, "mean_token_accuracy": 0.2130169078707695, "num_tokens": 48961866.0, "step": 28220 }, { "entropy": 5.7087925434112545, "epoch": 2.195992997471309, "grad_norm": 1.2109375, "learning_rate": 0.00045126306331937674, "loss": 4.9766, "mean_token_accuracy": 0.20847883224487304, "num_tokens": 48970401.0, "step": 28225 }, { "entropy": 5.733750867843628, "epoch": 2.1963820268430267, "grad_norm": 1.203125, "learning_rate": 0.0004512458359489853, "loss": 5.0313, "mean_token_accuracy": 0.19230654537677766, "num_tokens": 48979165.0, "step": 28230 }, { "entropy": 5.69598126411438, "epoch": 2.196771056214744, "grad_norm": 1.234375, "learning_rate": 0.0004512286059043437, "loss": 4.912, "mean_token_accuracy": 0.21594143509864808, "num_tokens": 48987700.0, "step": 28235 }, { "entropy": 5.699603271484375, "epoch": 2.1971600855864617, "grad_norm": 1.125, "learning_rate": 0.00045121137318571364, "loss": 4.9985, "mean_token_accuracy": 0.20668129920959472, "num_tokens": 48996901.0, "step": 28240 }, { "entropy": 5.73549108505249, "epoch": 2.1975491149581794, "grad_norm": 1.2734375, "learning_rate": 0.00045119413779335645, "loss": 5.0988, "mean_token_accuracy": 0.19888806641101836, "num_tokens": 49006049.0, "step": 28245 }, { "entropy": 5.784724473953247, "epoch": 2.197938144329897, "grad_norm": 1.15625, "learning_rate": 0.0004511768997275336, "loss": 5.0219, "mean_token_accuracy": 0.20857109725475312, "num_tokens": 49015092.0, "step": 28250 }, { "entropy": 5.706155490875244, "epoch": 2.1983271737016143, "grad_norm": 1.3046875, "learning_rate": 0.0004511596589885068, "loss": 5.0057, "mean_token_accuracy": 0.19969862848520278, "num_tokens": 49023388.0, "step": 28255 }, { "entropy": 5.6270498752594, "epoch": 2.198716203073332, "grad_norm": 1.203125, "learning_rate": 0.0004511424155765375, "loss": 4.9385, "mean_token_accuracy": 0.21338020116090775, "num_tokens": 49031931.0, "step": 28260 }, { "entropy": 5.706189966201782, "epoch": 2.1991052324450497, "grad_norm": 1.1953125, "learning_rate": 0.00045112516949188735, "loss": 5.0789, "mean_token_accuracy": 0.2013660192489624, "num_tokens": 49040584.0, "step": 28265 }, { "entropy": 5.7466577053070065, "epoch": 2.199494261816767, "grad_norm": 1.125, "learning_rate": 0.0004511079207348182, "loss": 4.9979, "mean_token_accuracy": 0.20657130032777787, "num_tokens": 49049107.0, "step": 28270 }, { "entropy": 5.70091495513916, "epoch": 2.1998832911884847, "grad_norm": 1.2421875, "learning_rate": 0.0004510906693055916, "loss": 4.9596, "mean_token_accuracy": 0.20573167651891708, "num_tokens": 49058038.0, "step": 28275 }, { "entropy": 5.683161497116089, "epoch": 2.2002723205602024, "grad_norm": 1.2109375, "learning_rate": 0.0004510734152044694, "loss": 4.9544, "mean_token_accuracy": 0.2072075441479683, "num_tokens": 49066875.0, "step": 28280 }, { "entropy": 5.707600831985474, "epoch": 2.20066134993192, "grad_norm": 1.1171875, "learning_rate": 0.00045105615843171336, "loss": 5.0312, "mean_token_accuracy": 0.19821940511465072, "num_tokens": 49076374.0, "step": 28285 }, { "entropy": 5.710311985015869, "epoch": 2.2010503793036373, "grad_norm": 1.1953125, "learning_rate": 0.00045103889898758534, "loss": 4.9815, "mean_token_accuracy": 0.20235689878463745, "num_tokens": 49085729.0, "step": 28290 }, { "entropy": 5.665670394897461, "epoch": 2.201439408675355, "grad_norm": 1.1484375, "learning_rate": 0.0004510216368723472, "loss": 4.911, "mean_token_accuracy": 0.20671570748090745, "num_tokens": 49093959.0, "step": 28295 }, { "entropy": 5.669644165039062, "epoch": 2.2018284380470727, "grad_norm": 1.2421875, "learning_rate": 0.00045100437208626086, "loss": 4.9941, "mean_token_accuracy": 0.2049276500940323, "num_tokens": 49102412.0, "step": 28300 }, { "entropy": 5.637655258178711, "epoch": 2.20221746741879, "grad_norm": 1.1796875, "learning_rate": 0.00045098710462958844, "loss": 4.9802, "mean_token_accuracy": 0.20358238220214844, "num_tokens": 49110655.0, "step": 28305 }, { "entropy": 5.730246829986572, "epoch": 2.2026064967905077, "grad_norm": 1.1875, "learning_rate": 0.00045096983450259166, "loss": 4.9931, "mean_token_accuracy": 0.20257960855960847, "num_tokens": 49119117.0, "step": 28310 }, { "entropy": 5.679993104934693, "epoch": 2.2029955261622254, "grad_norm": 1.1953125, "learning_rate": 0.00045095256170553285, "loss": 4.923, "mean_token_accuracy": 0.20516852736473085, "num_tokens": 49127513.0, "step": 28315 }, { "entropy": 5.684822845458984, "epoch": 2.2033845555339426, "grad_norm": 1.2265625, "learning_rate": 0.00045093528623867384, "loss": 4.9368, "mean_token_accuracy": 0.20608424246311188, "num_tokens": 49135851.0, "step": 28320 }, { "entropy": 5.7045563697814945, "epoch": 2.2037735849056603, "grad_norm": 1.1171875, "learning_rate": 0.00045091800810227706, "loss": 5.0663, "mean_token_accuracy": 0.19839129745960235, "num_tokens": 49144775.0, "step": 28325 }, { "entropy": 5.7332395076751705, "epoch": 2.204162614277378, "grad_norm": 1.28125, "learning_rate": 0.0004509007272966044, "loss": 4.9907, "mean_token_accuracy": 0.2042761594057083, "num_tokens": 49152861.0, "step": 28330 }, { "entropy": 5.719871139526367, "epoch": 2.2045516436490953, "grad_norm": 1.28125, "learning_rate": 0.0004508834438219182, "loss": 5.0742, "mean_token_accuracy": 0.19557158499956132, "num_tokens": 49161875.0, "step": 28335 }, { "entropy": 5.76036262512207, "epoch": 2.204940673020813, "grad_norm": 1.1640625, "learning_rate": 0.0004508661576784807, "loss": 5.101, "mean_token_accuracy": 0.20120255202054976, "num_tokens": 49170277.0, "step": 28340 }, { "entropy": 5.69703049659729, "epoch": 2.2053297023925307, "grad_norm": 1.140625, "learning_rate": 0.0004508488688665541, "loss": 4.8846, "mean_token_accuracy": 0.2119675487279892, "num_tokens": 49179078.0, "step": 28345 }, { "entropy": 5.692879104614258, "epoch": 2.2057187317642484, "grad_norm": 1.1796875, "learning_rate": 0.0004508315773864009, "loss": 4.9859, "mean_token_accuracy": 0.19961091876029968, "num_tokens": 49187649.0, "step": 28350 }, { "entropy": 5.666404390335083, "epoch": 2.2061077611359656, "grad_norm": 1.2890625, "learning_rate": 0.00045081428323828337, "loss": 4.9206, "mean_token_accuracy": 0.21948359906673431, "num_tokens": 49195369.0, "step": 28355 }, { "entropy": 5.769012784957885, "epoch": 2.2064967905076833, "grad_norm": 1.2734375, "learning_rate": 0.0004507969864224639, "loss": 5.0442, "mean_token_accuracy": 0.20128490924835205, "num_tokens": 49203623.0, "step": 28360 }, { "entropy": 5.723573970794678, "epoch": 2.206885819879401, "grad_norm": 1.3203125, "learning_rate": 0.000450779686939205, "loss": 4.9977, "mean_token_accuracy": 0.2062707021832466, "num_tokens": 49212251.0, "step": 28365 }, { "entropy": 5.721948146820068, "epoch": 2.2072748492511183, "grad_norm": 1.1953125, "learning_rate": 0.00045076238478876916, "loss": 4.9697, "mean_token_accuracy": 0.2032117709517479, "num_tokens": 49220580.0, "step": 28370 }, { "entropy": 5.759302806854248, "epoch": 2.207663878622836, "grad_norm": 1.15625, "learning_rate": 0.0004507450799714188, "loss": 5.008, "mean_token_accuracy": 0.20607277601957322, "num_tokens": 49229011.0, "step": 28375 }, { "entropy": 5.692243194580078, "epoch": 2.2080529079945537, "grad_norm": 1.2109375, "learning_rate": 0.00045072777248741664, "loss": 4.9883, "mean_token_accuracy": 0.20925655514001845, "num_tokens": 49237082.0, "step": 28380 }, { "entropy": 5.7546450138092045, "epoch": 2.2084419373662714, "grad_norm": 1.1640625, "learning_rate": 0.0004507104623370252, "loss": 5.0915, "mean_token_accuracy": 0.19839746206998826, "num_tokens": 49245768.0, "step": 28385 }, { "entropy": 5.699833631515503, "epoch": 2.2088309667379886, "grad_norm": 1.1640625, "learning_rate": 0.0004506931495205072, "loss": 5.011, "mean_token_accuracy": 0.20534223765134813, "num_tokens": 49254932.0, "step": 28390 }, { "entropy": 5.6779553413391115, "epoch": 2.2092199961097063, "grad_norm": 1.140625, "learning_rate": 0.0004506758340381253, "loss": 4.9982, "mean_token_accuracy": 0.19613065272569657, "num_tokens": 49263798.0, "step": 28395 }, { "entropy": 5.690609502792358, "epoch": 2.209609025481424, "grad_norm": 1.25, "learning_rate": 0.0004506585158901422, "loss": 4.9167, "mean_token_accuracy": 0.20441493839025499, "num_tokens": 49272045.0, "step": 28400 }, { "entropy": 5.76332836151123, "epoch": 2.2099980548531413, "grad_norm": 1.21875, "learning_rate": 0.0004506411950768207, "loss": 5.1068, "mean_token_accuracy": 0.19730678349733352, "num_tokens": 49281562.0, "step": 28405 }, { "entropy": 5.666595077514648, "epoch": 2.210387084224859, "grad_norm": 1.34375, "learning_rate": 0.00045062387159842363, "loss": 4.8893, "mean_token_accuracy": 0.214822655916214, "num_tokens": 49290113.0, "step": 28410 }, { "entropy": 5.686538171768189, "epoch": 2.2107761135965767, "grad_norm": 1.2578125, "learning_rate": 0.00045060654545521386, "loss": 4.9995, "mean_token_accuracy": 0.20580074638128282, "num_tokens": 49298210.0, "step": 28415 }, { "entropy": 5.730928516387939, "epoch": 2.211165142968294, "grad_norm": 1.171875, "learning_rate": 0.00045058921664745436, "loss": 5.0214, "mean_token_accuracy": 0.19478271007537842, "num_tokens": 49306533.0, "step": 28420 }, { "entropy": 5.723982095718384, "epoch": 2.2115541723400116, "grad_norm": 1.15625, "learning_rate": 0.00045057188517540783, "loss": 5.0632, "mean_token_accuracy": 0.20542512238025665, "num_tokens": 49315617.0, "step": 28425 }, { "entropy": 5.762454557418823, "epoch": 2.2119432017117293, "grad_norm": 1.203125, "learning_rate": 0.0004505545510393374, "loss": 4.9617, "mean_token_accuracy": 0.20437406599521638, "num_tokens": 49324351.0, "step": 28430 }, { "entropy": 5.6805655002594, "epoch": 2.2123322310834466, "grad_norm": 1.1953125, "learning_rate": 0.00045053721423950617, "loss": 4.9707, "mean_token_accuracy": 0.20792602747678757, "num_tokens": 49333036.0, "step": 28435 }, { "entropy": 5.689638996124268, "epoch": 2.2127212604551643, "grad_norm": 1.1953125, "learning_rate": 0.0004505198747761771, "loss": 4.9624, "mean_token_accuracy": 0.20511289238929747, "num_tokens": 49341715.0, "step": 28440 }, { "entropy": 5.7387665748596195, "epoch": 2.213110289826882, "grad_norm": 1.2109375, "learning_rate": 0.0004505025326496132, "loss": 5.0206, "mean_token_accuracy": 0.20127775222063066, "num_tokens": 49350505.0, "step": 28445 }, { "entropy": 5.726810359954834, "epoch": 2.2134993191985997, "grad_norm": 1.2578125, "learning_rate": 0.00045048518786007784, "loss": 5.0182, "mean_token_accuracy": 0.20388639867305755, "num_tokens": 49358902.0, "step": 28450 }, { "entropy": 5.752914619445801, "epoch": 2.213888348570317, "grad_norm": 1.203125, "learning_rate": 0.00045046784040783395, "loss": 5.0635, "mean_token_accuracy": 0.19582430720329286, "num_tokens": 49366932.0, "step": 28455 }, { "entropy": 5.797455358505249, "epoch": 2.2142773779420346, "grad_norm": 1.1328125, "learning_rate": 0.000450450490293145, "loss": 5.148, "mean_token_accuracy": 0.1883062332868576, "num_tokens": 49375907.0, "step": 28460 }, { "entropy": 5.788388204574585, "epoch": 2.2146664073137523, "grad_norm": 1.234375, "learning_rate": 0.000450433137516274, "loss": 5.0095, "mean_token_accuracy": 0.20223766267299653, "num_tokens": 49383871.0, "step": 28465 }, { "entropy": 5.705138731002807, "epoch": 2.2150554366854696, "grad_norm": 1.2890625, "learning_rate": 0.0004504157820774844, "loss": 5.0125, "mean_token_accuracy": 0.20448571890592576, "num_tokens": 49392452.0, "step": 28470 }, { "entropy": 5.637589311599731, "epoch": 2.2154444660571873, "grad_norm": 1.2109375, "learning_rate": 0.0004503984239770396, "loss": 4.8766, "mean_token_accuracy": 0.2112268775701523, "num_tokens": 49401698.0, "step": 28475 }, { "entropy": 5.753566837310791, "epoch": 2.215833495428905, "grad_norm": 1.1875, "learning_rate": 0.0004503810632152028, "loss": 5.0406, "mean_token_accuracy": 0.19906357675790787, "num_tokens": 49409505.0, "step": 28480 }, { "entropy": 5.7391256332397464, "epoch": 2.2162225248006227, "grad_norm": 1.2265625, "learning_rate": 0.0004503636997922375, "loss": 5.0167, "mean_token_accuracy": 0.205886110663414, "num_tokens": 49418489.0, "step": 28485 }, { "entropy": 5.729737234115601, "epoch": 2.21661155417234, "grad_norm": 1.328125, "learning_rate": 0.0004503463337084072, "loss": 4.9622, "mean_token_accuracy": 0.21037158817052842, "num_tokens": 49426989.0, "step": 28490 }, { "entropy": 5.719191646575927, "epoch": 2.2170005835440576, "grad_norm": 1.1015625, "learning_rate": 0.0004503289649639754, "loss": 5.0271, "mean_token_accuracy": 0.20467952638864517, "num_tokens": 49436199.0, "step": 28495 }, { "entropy": 5.6993835926055905, "epoch": 2.2173896129157753, "grad_norm": 1.21875, "learning_rate": 0.0004503115935592056, "loss": 4.9364, "mean_token_accuracy": 0.21046911627054216, "num_tokens": 49444092.0, "step": 28500 }, { "entropy": 5.7002115726470945, "epoch": 2.2177786422874926, "grad_norm": 1.3828125, "learning_rate": 0.0004502942194943614, "loss": 5.0302, "mean_token_accuracy": 0.19915594756603242, "num_tokens": 49452461.0, "step": 28505 }, { "entropy": 5.763059139251709, "epoch": 2.2181676716592102, "grad_norm": 1.1875, "learning_rate": 0.00045027684276970645, "loss": 4.9697, "mean_token_accuracy": 0.20664460062980652, "num_tokens": 49461972.0, "step": 28510 }, { "entropy": 5.7821187496185305, "epoch": 2.218556701030928, "grad_norm": 1.203125, "learning_rate": 0.00045025946338550434, "loss": 4.9718, "mean_token_accuracy": 0.2104617714881897, "num_tokens": 49470656.0, "step": 28515 }, { "entropy": 5.686243963241577, "epoch": 2.218945730402645, "grad_norm": 1.2265625, "learning_rate": 0.0004502420813420189, "loss": 5.0059, "mean_token_accuracy": 0.2045851856470108, "num_tokens": 49479018.0, "step": 28520 }, { "entropy": 5.708141899108886, "epoch": 2.219334759774363, "grad_norm": 1.2421875, "learning_rate": 0.0004502246966395137, "loss": 5.0004, "mean_token_accuracy": 0.20668516755104066, "num_tokens": 49487521.0, "step": 28525 }, { "entropy": 5.752575063705445, "epoch": 2.2197237891460806, "grad_norm": 1.3203125, "learning_rate": 0.00045020730927825274, "loss": 5.0786, "mean_token_accuracy": 0.1960342913866043, "num_tokens": 49495382.0, "step": 28530 }, { "entropy": 5.693490219116211, "epoch": 2.2201128185177983, "grad_norm": 1.203125, "learning_rate": 0.0004501899192584997, "loss": 4.9569, "mean_token_accuracy": 0.20873293429613113, "num_tokens": 49503819.0, "step": 28535 }, { "entropy": 5.711993551254272, "epoch": 2.2205018478895155, "grad_norm": 1.109375, "learning_rate": 0.0004501725265805185, "loss": 4.9968, "mean_token_accuracy": 0.20590731650590896, "num_tokens": 49512908.0, "step": 28540 }, { "entropy": 5.711372327804566, "epoch": 2.2208908772612332, "grad_norm": 1.1328125, "learning_rate": 0.00045015513124457303, "loss": 5.0308, "mean_token_accuracy": 0.2065579041838646, "num_tokens": 49522462.0, "step": 28545 }, { "entropy": 5.742654514312744, "epoch": 2.221279906632951, "grad_norm": 1.1875, "learning_rate": 0.0004501377332509272, "loss": 5.0322, "mean_token_accuracy": 0.19891941249370576, "num_tokens": 49531089.0, "step": 28550 }, { "entropy": 5.740454626083374, "epoch": 2.221668936004668, "grad_norm": 1.2578125, "learning_rate": 0.00045012033259984494, "loss": 4.9535, "mean_token_accuracy": 0.20609834492206575, "num_tokens": 49539074.0, "step": 28555 }, { "entropy": 5.703121995925903, "epoch": 2.222057965376386, "grad_norm": 1.2109375, "learning_rate": 0.0004501029292915905, "loss": 5.0244, "mean_token_accuracy": 0.20597645938396453, "num_tokens": 49547879.0, "step": 28560 }, { "entropy": 5.810239505767822, "epoch": 2.2224469947481036, "grad_norm": 1.1953125, "learning_rate": 0.00045008552332642774, "loss": 5.0712, "mean_token_accuracy": 0.20533390939235688, "num_tokens": 49556220.0, "step": 28565 }, { "entropy": 5.759454965591431, "epoch": 2.222836024119821, "grad_norm": 1.234375, "learning_rate": 0.00045006811470462083, "loss": 5.0022, "mean_token_accuracy": 0.2028620034456253, "num_tokens": 49564710.0, "step": 28570 }, { "entropy": 5.683412075042725, "epoch": 2.2232250534915385, "grad_norm": 1.28125, "learning_rate": 0.000450050703426434, "loss": 4.9053, "mean_token_accuracy": 0.21151494532823562, "num_tokens": 49572829.0, "step": 28575 }, { "entropy": 5.703780269622802, "epoch": 2.2236140828632562, "grad_norm": 1.3359375, "learning_rate": 0.0004500332894921313, "loss": 5.0632, "mean_token_accuracy": 0.20818754583597182, "num_tokens": 49580355.0, "step": 28580 }, { "entropy": 5.733652544021607, "epoch": 2.224003112234974, "grad_norm": 1.1875, "learning_rate": 0.0004500158729019771, "loss": 4.992, "mean_token_accuracy": 0.20801398754119874, "num_tokens": 49589086.0, "step": 28585 }, { "entropy": 5.679855918884277, "epoch": 2.224392141606691, "grad_norm": 1.1953125, "learning_rate": 0.0004499984536562355, "loss": 4.9219, "mean_token_accuracy": 0.21132203042507172, "num_tokens": 49597434.0, "step": 28590 }, { "entropy": 5.752693748474121, "epoch": 2.224781170978409, "grad_norm": 1.296875, "learning_rate": 0.000449981031755171, "loss": 5.0123, "mean_token_accuracy": 0.20213069021701813, "num_tokens": 49604981.0, "step": 28595 }, { "entropy": 5.7699274063110355, "epoch": 2.2251702003501266, "grad_norm": 1.15625, "learning_rate": 0.00044996360719904777, "loss": 5.0197, "mean_token_accuracy": 0.20493629723787307, "num_tokens": 49614119.0, "step": 28600 }, { "entropy": 5.811347579956054, "epoch": 2.225559229721844, "grad_norm": 1.2578125, "learning_rate": 0.0004499461799881303, "loss": 5.0629, "mean_token_accuracy": 0.19947040528059007, "num_tokens": 49622705.0, "step": 28605 }, { "entropy": 5.765024900436401, "epoch": 2.2259482590935615, "grad_norm": 1.21875, "learning_rate": 0.0004499287501226831, "loss": 5.0481, "mean_token_accuracy": 0.1937385618686676, "num_tokens": 49632086.0, "step": 28610 }, { "entropy": 5.7021410942077635, "epoch": 2.2263372884652792, "grad_norm": 1.2578125, "learning_rate": 0.00044991131760297045, "loss": 5.0169, "mean_token_accuracy": 0.20657098591327666, "num_tokens": 49640733.0, "step": 28615 }, { "entropy": 5.662859153747559, "epoch": 2.226726317836997, "grad_norm": 1.2109375, "learning_rate": 0.00044989388242925693, "loss": 4.9835, "mean_token_accuracy": 0.2068522498011589, "num_tokens": 49649694.0, "step": 28620 }, { "entropy": 5.759501314163208, "epoch": 2.227115347208714, "grad_norm": 1.3203125, "learning_rate": 0.0004498764446018073, "loss": 5.0928, "mean_token_accuracy": 0.1993888333439827, "num_tokens": 49657536.0, "step": 28625 }, { "entropy": 5.721528434753418, "epoch": 2.227504376580432, "grad_norm": 1.1953125, "learning_rate": 0.0004498590041208857, "loss": 4.9448, "mean_token_accuracy": 0.21212560981512069, "num_tokens": 49666332.0, "step": 28630 }, { "entropy": 5.6651215076446535, "epoch": 2.2278934059521496, "grad_norm": 1.203125, "learning_rate": 0.0004498415609867572, "loss": 4.9187, "mean_token_accuracy": 0.21172105073928832, "num_tokens": 49675364.0, "step": 28635 }, { "entropy": 5.74646954536438, "epoch": 2.228282435323867, "grad_norm": 1.1171875, "learning_rate": 0.00044982411519968625, "loss": 5.1076, "mean_token_accuracy": 0.19643208682537078, "num_tokens": 49684178.0, "step": 28640 }, { "entropy": 5.738535356521607, "epoch": 2.2286714646955845, "grad_norm": 1.265625, "learning_rate": 0.0004498066667599377, "loss": 5.0375, "mean_token_accuracy": 0.20278588235378264, "num_tokens": 49692747.0, "step": 28645 }, { "entropy": 5.70613055229187, "epoch": 2.2290604940673022, "grad_norm": 1.2265625, "learning_rate": 0.00044978921566777604, "loss": 5.012, "mean_token_accuracy": 0.20278516560792922, "num_tokens": 49701534.0, "step": 28650 }, { "entropy": 5.766454887390137, "epoch": 2.2294495234390195, "grad_norm": 1.1953125, "learning_rate": 0.0004497717619234664, "loss": 5.0322, "mean_token_accuracy": 0.20247657895088195, "num_tokens": 49710021.0, "step": 28655 }, { "entropy": 5.715042400360107, "epoch": 2.229838552810737, "grad_norm": 1.1640625, "learning_rate": 0.00044975430552727337, "loss": 4.9374, "mean_token_accuracy": 0.2064614027738571, "num_tokens": 49718786.0, "step": 28660 }, { "entropy": 5.722701358795166, "epoch": 2.230227582182455, "grad_norm": 1.25, "learning_rate": 0.0004497368464794619, "loss": 4.9885, "mean_token_accuracy": 0.20379282683134078, "num_tokens": 49726840.0, "step": 28665 }, { "entropy": 5.764046335220337, "epoch": 2.230616611554172, "grad_norm": 1.171875, "learning_rate": 0.00044971938478029693, "loss": 5.0809, "mean_token_accuracy": 0.19563679099082948, "num_tokens": 49736130.0, "step": 28670 }, { "entropy": 5.7257531642913815, "epoch": 2.23100564092589, "grad_norm": 1.125, "learning_rate": 0.00044970192043004343, "loss": 4.9814, "mean_token_accuracy": 0.2002241626381874, "num_tokens": 49744810.0, "step": 28675 }, { "entropy": 5.703462314605713, "epoch": 2.2313946702976075, "grad_norm": 1.140625, "learning_rate": 0.0004496844534289663, "loss": 5.0036, "mean_token_accuracy": 0.20451734960079193, "num_tokens": 49754053.0, "step": 28680 }, { "entropy": 5.729618787765503, "epoch": 2.231783699669325, "grad_norm": 1.15625, "learning_rate": 0.00044966698377733064, "loss": 5.0082, "mean_token_accuracy": 0.20244460552930832, "num_tokens": 49763735.0, "step": 28685 }, { "entropy": 5.752537679672241, "epoch": 2.2321727290410425, "grad_norm": 1.1875, "learning_rate": 0.0004496495114754015, "loss": 5.0605, "mean_token_accuracy": 0.1975702166557312, "num_tokens": 49772867.0, "step": 28690 }, { "entropy": 5.664232444763184, "epoch": 2.23256175841276, "grad_norm": 1.1640625, "learning_rate": 0.00044963203652344404, "loss": 4.8923, "mean_token_accuracy": 0.2080998107790947, "num_tokens": 49781460.0, "step": 28695 }, { "entropy": 5.690932321548462, "epoch": 2.232950787784478, "grad_norm": 1.359375, "learning_rate": 0.0004496145589217234, "loss": 4.9251, "mean_token_accuracy": 0.2038187339901924, "num_tokens": 49790249.0, "step": 28700 }, { "entropy": 5.754150819778443, "epoch": 2.233339817156195, "grad_norm": 1.1953125, "learning_rate": 0.00044959707867050467, "loss": 4.9633, "mean_token_accuracy": 0.2096121594309807, "num_tokens": 49797959.0, "step": 28705 }, { "entropy": 5.665742111206055, "epoch": 2.233728846527913, "grad_norm": 1.28125, "learning_rate": 0.0004495795957700532, "loss": 4.9149, "mean_token_accuracy": 0.21175573170185089, "num_tokens": 49806669.0, "step": 28710 }, { "entropy": 5.700140428543091, "epoch": 2.2341178758996305, "grad_norm": 1.171875, "learning_rate": 0.00044956211022063424, "loss": 5.1118, "mean_token_accuracy": 0.19611927717924119, "num_tokens": 49816821.0, "step": 28715 }, { "entropy": 5.793018198013305, "epoch": 2.234506905271348, "grad_norm": 1.1484375, "learning_rate": 0.00044954462202251316, "loss": 5.0268, "mean_token_accuracy": 0.20222463011741637, "num_tokens": 49825411.0, "step": 28720 }, { "entropy": 5.777142667770386, "epoch": 2.2348959346430655, "grad_norm": 1.2265625, "learning_rate": 0.00044952713117595516, "loss": 5.067, "mean_token_accuracy": 0.1973838210105896, "num_tokens": 49833496.0, "step": 28725 }, { "entropy": 5.677167558670044, "epoch": 2.235284964014783, "grad_norm": 1.171875, "learning_rate": 0.00044950963768122576, "loss": 4.9816, "mean_token_accuracy": 0.1960351884365082, "num_tokens": 49842935.0, "step": 28730 }, { "entropy": 5.7087047576904295, "epoch": 2.235673993386501, "grad_norm": 1.2890625, "learning_rate": 0.0004494921415385905, "loss": 5.0648, "mean_token_accuracy": 0.19957512021064758, "num_tokens": 49851197.0, "step": 28735 }, { "entropy": 5.728284597396851, "epoch": 2.236063022758218, "grad_norm": 1.21875, "learning_rate": 0.00044947464274831464, "loss": 4.9295, "mean_token_accuracy": 0.2125383883714676, "num_tokens": 49859778.0, "step": 28740 }, { "entropy": 5.746982288360596, "epoch": 2.236452052129936, "grad_norm": 1.1328125, "learning_rate": 0.0004494571413106637, "loss": 5.011, "mean_token_accuracy": 0.19913018345832825, "num_tokens": 49868548.0, "step": 28745 }, { "entropy": 5.686481094360351, "epoch": 2.2368410815016535, "grad_norm": 1.140625, "learning_rate": 0.00044943963722590344, "loss": 4.9866, "mean_token_accuracy": 0.20673135221004485, "num_tokens": 49877070.0, "step": 28750 }, { "entropy": 5.729356861114502, "epoch": 2.2372301108733708, "grad_norm": 1.171875, "learning_rate": 0.00044942213049429917, "loss": 5.0348, "mean_token_accuracy": 0.2036292001605034, "num_tokens": 49885225.0, "step": 28755 }, { "entropy": 5.716859245300293, "epoch": 2.2376191402450885, "grad_norm": 1.1328125, "learning_rate": 0.00044940462111611685, "loss": 5.1345, "mean_token_accuracy": 0.195256832242012, "num_tokens": 49894305.0, "step": 28760 }, { "entropy": 5.699057769775391, "epoch": 2.238008169616806, "grad_norm": 1.1953125, "learning_rate": 0.00044938710909162195, "loss": 4.9476, "mean_token_accuracy": 0.20902130603790284, "num_tokens": 49902587.0, "step": 28765 }, { "entropy": 5.736685562133789, "epoch": 2.2383971989885234, "grad_norm": 1.3046875, "learning_rate": 0.0004493695944210802, "loss": 4.9132, "mean_token_accuracy": 0.20681415498256683, "num_tokens": 49911037.0, "step": 28770 }, { "entropy": 5.706594657897949, "epoch": 2.238786228360241, "grad_norm": 1.0625, "learning_rate": 0.0004493520771047574, "loss": 5.0336, "mean_token_accuracy": 0.20331882685422897, "num_tokens": 49920724.0, "step": 28775 }, { "entropy": 5.674307584762573, "epoch": 2.239175257731959, "grad_norm": 1.28125, "learning_rate": 0.00044933455714291944, "loss": 5.0107, "mean_token_accuracy": 0.20807262808084487, "num_tokens": 49929173.0, "step": 28780 }, { "entropy": 5.7317914962768555, "epoch": 2.2395642871036765, "grad_norm": 1.203125, "learning_rate": 0.00044931703453583195, "loss": 4.989, "mean_token_accuracy": 0.20164856910705567, "num_tokens": 49938213.0, "step": 28785 }, { "entropy": 5.684723901748657, "epoch": 2.2399533164753938, "grad_norm": 1.2109375, "learning_rate": 0.00044929950928376095, "loss": 4.8903, "mean_token_accuracy": 0.20966372787952423, "num_tokens": 49946493.0, "step": 28790 }, { "entropy": 5.659772300720215, "epoch": 2.2403423458471114, "grad_norm": 1.234375, "learning_rate": 0.0004492819813869723, "loss": 4.9704, "mean_token_accuracy": 0.2069219946861267, "num_tokens": 49954730.0, "step": 28795 }, { "entropy": 5.654062509536743, "epoch": 2.240731375218829, "grad_norm": 1.140625, "learning_rate": 0.00044926445084573206, "loss": 4.9227, "mean_token_accuracy": 0.21151854395866393, "num_tokens": 49962651.0, "step": 28800 }, { "entropy": 5.694990158081055, "epoch": 2.2411204045905464, "grad_norm": 1.1171875, "learning_rate": 0.000449246917660306, "loss": 4.9979, "mean_token_accuracy": 0.19839437454938888, "num_tokens": 49972560.0, "step": 28805 }, { "entropy": 5.7244185447692875, "epoch": 2.241509433962264, "grad_norm": 1.1953125, "learning_rate": 0.0004492293818309604, "loss": 5.0354, "mean_token_accuracy": 0.20150577127933503, "num_tokens": 49982292.0, "step": 28810 }, { "entropy": 5.734969711303711, "epoch": 2.241898463333982, "grad_norm": 1.2578125, "learning_rate": 0.0004492118433579613, "loss": 5.0976, "mean_token_accuracy": 0.19014789760112763, "num_tokens": 49990395.0, "step": 28815 }, { "entropy": 5.743406915664673, "epoch": 2.2422874927056995, "grad_norm": 1.328125, "learning_rate": 0.00044919430224157463, "loss": 5.0429, "mean_token_accuracy": 0.20124853402376175, "num_tokens": 49998944.0, "step": 28820 }, { "entropy": 5.710884761810303, "epoch": 2.2426765220774167, "grad_norm": 1.1796875, "learning_rate": 0.00044917675848206684, "loss": 4.9355, "mean_token_accuracy": 0.2041032686829567, "num_tokens": 50007583.0, "step": 28825 }, { "entropy": 5.623904132843018, "epoch": 2.2430655514491344, "grad_norm": 1.2578125, "learning_rate": 0.00044915921207970387, "loss": 4.8607, "mean_token_accuracy": 0.215935055911541, "num_tokens": 50015854.0, "step": 28830 }, { "entropy": 5.624081134796143, "epoch": 2.243454580820852, "grad_norm": 1.109375, "learning_rate": 0.00044914166303475206, "loss": 4.8808, "mean_token_accuracy": 0.22171128988265992, "num_tokens": 50024757.0, "step": 28835 }, { "entropy": 5.716112041473389, "epoch": 2.2438436101925694, "grad_norm": 1.09375, "learning_rate": 0.00044912411134747764, "loss": 4.9676, "mean_token_accuracy": 0.20674169957637786, "num_tokens": 50034592.0, "step": 28840 }, { "entropy": 5.677056169509887, "epoch": 2.244232639564287, "grad_norm": 1.2421875, "learning_rate": 0.00044910655701814705, "loss": 4.976, "mean_token_accuracy": 0.2038874328136444, "num_tokens": 50043034.0, "step": 28845 }, { "entropy": 5.656762266159058, "epoch": 2.244621668936005, "grad_norm": 1.171875, "learning_rate": 0.0004490890000470266, "loss": 4.9822, "mean_token_accuracy": 0.20454513728618623, "num_tokens": 50051683.0, "step": 28850 }, { "entropy": 5.692839813232422, "epoch": 2.245010698307722, "grad_norm": 1.15625, "learning_rate": 0.00044907144043438265, "loss": 4.997, "mean_token_accuracy": 0.19817980825901033, "num_tokens": 50060257.0, "step": 28855 }, { "entropy": 5.6413181781768795, "epoch": 2.2453997276794397, "grad_norm": 1.328125, "learning_rate": 0.0004490538781804816, "loss": 4.9086, "mean_token_accuracy": 0.21037443578243256, "num_tokens": 50068188.0, "step": 28860 }, { "entropy": 5.750301170349121, "epoch": 2.2457887570511574, "grad_norm": 1.2890625, "learning_rate": 0.00044903631328559, "loss": 4.9734, "mean_token_accuracy": 0.1981503650546074, "num_tokens": 50076188.0, "step": 28865 }, { "entropy": 5.736948871612549, "epoch": 2.246177786422875, "grad_norm": 1.1875, "learning_rate": 0.00044901874574997444, "loss": 4.9957, "mean_token_accuracy": 0.21094398498535155, "num_tokens": 50085139.0, "step": 28870 }, { "entropy": 5.777136611938476, "epoch": 2.2465668157945924, "grad_norm": 1.1875, "learning_rate": 0.00044900117557390137, "loss": 5.0655, "mean_token_accuracy": 0.19944897145032883, "num_tokens": 50093050.0, "step": 28875 }, { "entropy": 5.697117137908935, "epoch": 2.24695584516631, "grad_norm": 1.171875, "learning_rate": 0.00044898360275763733, "loss": 5.0247, "mean_token_accuracy": 0.2058744251728058, "num_tokens": 50101854.0, "step": 28880 }, { "entropy": 5.731565999984741, "epoch": 2.247344874538028, "grad_norm": 1.265625, "learning_rate": 0.00044896602730144905, "loss": 5.0567, "mean_token_accuracy": 0.19855786710977555, "num_tokens": 50110430.0, "step": 28885 }, { "entropy": 5.7700201034545895, "epoch": 2.247733903909745, "grad_norm": 1.21875, "learning_rate": 0.00044894844920560323, "loss": 4.9866, "mean_token_accuracy": 0.2036704733967781, "num_tokens": 50118633.0, "step": 28890 }, { "entropy": 5.7869304656982425, "epoch": 2.2481229332814627, "grad_norm": 1.1328125, "learning_rate": 0.0004489308684703666, "loss": 5.0461, "mean_token_accuracy": 0.19673241227865218, "num_tokens": 50129120.0, "step": 28895 }, { "entropy": 5.794103670120239, "epoch": 2.2485119626531804, "grad_norm": 1.1875, "learning_rate": 0.0004489132850960059, "loss": 5.059, "mean_token_accuracy": 0.1987464502453804, "num_tokens": 50138404.0, "step": 28900 }, { "entropy": 5.70320692062378, "epoch": 2.2489009920248977, "grad_norm": 1.1640625, "learning_rate": 0.0004488956990827878, "loss": 4.9843, "mean_token_accuracy": 0.19734846651554108, "num_tokens": 50146908.0, "step": 28905 }, { "entropy": 5.654918479919433, "epoch": 2.2492900213966154, "grad_norm": 1.109375, "learning_rate": 0.0004488781104309793, "loss": 4.9197, "mean_token_accuracy": 0.20398542881011963, "num_tokens": 50155922.0, "step": 28910 }, { "entropy": 5.695118093490601, "epoch": 2.249679050768333, "grad_norm": 1.2578125, "learning_rate": 0.00044886051914084726, "loss": 5.0247, "mean_token_accuracy": 0.20175406187772751, "num_tokens": 50164023.0, "step": 28915 }, { "entropy": 5.685731744766235, "epoch": 2.2500680801400508, "grad_norm": 1.1953125, "learning_rate": 0.00044884292521265846, "loss": 4.9534, "mean_token_accuracy": 0.2051523059606552, "num_tokens": 50172147.0, "step": 28920 }, { "entropy": 5.724393224716186, "epoch": 2.250457109511768, "grad_norm": 1.296875, "learning_rate": 0.0004488253286466801, "loss": 5.0773, "mean_token_accuracy": 0.1939166396856308, "num_tokens": 50180484.0, "step": 28925 }, { "entropy": 5.6866292476654055, "epoch": 2.2508461388834857, "grad_norm": 1.171875, "learning_rate": 0.00044880772944317905, "loss": 4.9135, "mean_token_accuracy": 0.20873091518878936, "num_tokens": 50189176.0, "step": 28930 }, { "entropy": 5.7000938892364506, "epoch": 2.2512351682552034, "grad_norm": 1.1640625, "learning_rate": 0.00044879012760242224, "loss": 4.9686, "mean_token_accuracy": 0.2151930496096611, "num_tokens": 50197674.0, "step": 28935 }, { "entropy": 5.733453559875488, "epoch": 2.2516241976269207, "grad_norm": 1.203125, "learning_rate": 0.00044877252312467694, "loss": 5.0394, "mean_token_accuracy": 0.19731226116418837, "num_tokens": 50206681.0, "step": 28940 }, { "entropy": 5.79929404258728, "epoch": 2.2520132269986384, "grad_norm": 1.125, "learning_rate": 0.0004487549160102101, "loss": 5.0872, "mean_token_accuracy": 0.19281459152698516, "num_tokens": 50215457.0, "step": 28945 }, { "entropy": 5.739561223983765, "epoch": 2.252402256370356, "grad_norm": 1.21875, "learning_rate": 0.00044873730625928914, "loss": 4.9618, "mean_token_accuracy": 0.20617651641368867, "num_tokens": 50224757.0, "step": 28950 }, { "entropy": 5.742098951339722, "epoch": 2.2527912857420738, "grad_norm": 1.125, "learning_rate": 0.00044871969387218094, "loss": 5.0264, "mean_token_accuracy": 0.1989448457956314, "num_tokens": 50233570.0, "step": 28955 }, { "entropy": 5.762804079055786, "epoch": 2.253180315113791, "grad_norm": 1.28125, "learning_rate": 0.000448702078849153, "loss": 4.9902, "mean_token_accuracy": 0.208285653591156, "num_tokens": 50241767.0, "step": 28960 }, { "entropy": 5.6715192794799805, "epoch": 2.2535693444855087, "grad_norm": 1.2109375, "learning_rate": 0.00044868446119047234, "loss": 4.9356, "mean_token_accuracy": 0.21125833839178085, "num_tokens": 50250121.0, "step": 28965 }, { "entropy": 5.789412879943848, "epoch": 2.253958373857226, "grad_norm": 1.125, "learning_rate": 0.0004486668408964065, "loss": 5.0867, "mean_token_accuracy": 0.20002398937940596, "num_tokens": 50258717.0, "step": 28970 }, { "entropy": 5.73927149772644, "epoch": 2.2543474032289437, "grad_norm": 1.1953125, "learning_rate": 0.0004486492179672228, "loss": 5.028, "mean_token_accuracy": 0.20437908470630645, "num_tokens": 50267528.0, "step": 28975 }, { "entropy": 5.7655116558074955, "epoch": 2.2547364326006614, "grad_norm": 1.140625, "learning_rate": 0.00044863159240318863, "loss": 5.0201, "mean_token_accuracy": 0.20582814067602156, "num_tokens": 50276197.0, "step": 28980 }, { "entropy": 5.646577930450439, "epoch": 2.255125461972379, "grad_norm": 1.2109375, "learning_rate": 0.0004486139642045714, "loss": 4.9154, "mean_token_accuracy": 0.21113918125629424, "num_tokens": 50284222.0, "step": 28985 }, { "entropy": 5.6721209526062015, "epoch": 2.2555144913440963, "grad_norm": 1.171875, "learning_rate": 0.0004485963333716385, "loss": 4.9417, "mean_token_accuracy": 0.20272922068834304, "num_tokens": 50293061.0, "step": 28990 }, { "entropy": 5.722727870941162, "epoch": 2.255903520715814, "grad_norm": 1.265625, "learning_rate": 0.0004485786999046576, "loss": 4.9773, "mean_token_accuracy": 0.21097562462091446, "num_tokens": 50301601.0, "step": 28995 }, { "entropy": 5.71388521194458, "epoch": 2.2562925500875317, "grad_norm": 1.171875, "learning_rate": 0.00044856106380389624, "loss": 5.02, "mean_token_accuracy": 0.20650473535060881, "num_tokens": 50311595.0, "step": 29000 }, { "entropy": 5.672596120834351, "epoch": 2.256681579459249, "grad_norm": 1.15625, "learning_rate": 0.000448543425069622, "loss": 4.9655, "mean_token_accuracy": 0.2122400313615799, "num_tokens": 50320205.0, "step": 29005 }, { "entropy": 5.711330938339233, "epoch": 2.2570706088309667, "grad_norm": 1.1640625, "learning_rate": 0.0004485257837021025, "loss": 4.9736, "mean_token_accuracy": 0.20538078099489213, "num_tokens": 50328414.0, "step": 29010 }, { "entropy": 5.698928356170654, "epoch": 2.2574596382026844, "grad_norm": 1.1484375, "learning_rate": 0.00044850813970160534, "loss": 4.9802, "mean_token_accuracy": 0.2082694411277771, "num_tokens": 50337206.0, "step": 29015 }, { "entropy": 5.74770040512085, "epoch": 2.257848667574402, "grad_norm": 1.1328125, "learning_rate": 0.0004484904930683984, "loss": 5.0223, "mean_token_accuracy": 0.2034577801823616, "num_tokens": 50346320.0, "step": 29020 }, { "entropy": 5.725022172927856, "epoch": 2.2582376969461193, "grad_norm": 1.203125, "learning_rate": 0.0004484728438027494, "loss": 5.0068, "mean_token_accuracy": 0.20166103094816207, "num_tokens": 50354199.0, "step": 29025 }, { "entropy": 5.7522049903869625, "epoch": 2.258626726317837, "grad_norm": 1.25, "learning_rate": 0.0004484551919049261, "loss": 5.0081, "mean_token_accuracy": 0.20749075412750245, "num_tokens": 50363085.0, "step": 29030 }, { "entropy": 5.709029006958008, "epoch": 2.2590157556895547, "grad_norm": 1.1875, "learning_rate": 0.00044843753737519625, "loss": 4.9745, "mean_token_accuracy": 0.20265224426984788, "num_tokens": 50371211.0, "step": 29035 }, { "entropy": 5.758967494964599, "epoch": 2.259404785061272, "grad_norm": 1.4296875, "learning_rate": 0.0004484198802138279, "loss": 4.9647, "mean_token_accuracy": 0.21568350046873092, "num_tokens": 50379426.0, "step": 29040 }, { "entropy": 5.730614089965821, "epoch": 2.2597938144329897, "grad_norm": 1.2890625, "learning_rate": 0.0004484022204210889, "loss": 5.05, "mean_token_accuracy": 0.20107064843177797, "num_tokens": 50388073.0, "step": 29045 }, { "entropy": 5.6381267547607425, "epoch": 2.2601828438047074, "grad_norm": 1.234375, "learning_rate": 0.00044838455799724717, "loss": 4.9449, "mean_token_accuracy": 0.20804987400770186, "num_tokens": 50395943.0, "step": 29050 }, { "entropy": 5.697162771224976, "epoch": 2.260571873176425, "grad_norm": 1.1484375, "learning_rate": 0.00044836689294257075, "loss": 4.9746, "mean_token_accuracy": 0.20222398042678832, "num_tokens": 50405218.0, "step": 29055 }, { "entropy": 5.690928840637207, "epoch": 2.2609609025481423, "grad_norm": 1.109375, "learning_rate": 0.0004483492252573276, "loss": 4.959, "mean_token_accuracy": 0.20453712046146394, "num_tokens": 50414169.0, "step": 29060 }, { "entropy": 5.705320739746094, "epoch": 2.26134993191986, "grad_norm": 1.34375, "learning_rate": 0.000448331554941786, "loss": 5.0489, "mean_token_accuracy": 0.20291474759578704, "num_tokens": 50422541.0, "step": 29065 }, { "entropy": 5.6856060981750485, "epoch": 2.2617389612915777, "grad_norm": 1.2578125, "learning_rate": 0.00044831388199621385, "loss": 4.9293, "mean_token_accuracy": 0.20846335738897323, "num_tokens": 50431081.0, "step": 29070 }, { "entropy": 5.749835681915283, "epoch": 2.262127990663295, "grad_norm": 1.2109375, "learning_rate": 0.00044829620642087946, "loss": 5.0113, "mean_token_accuracy": 0.20569914877414702, "num_tokens": 50439279.0, "step": 29075 }, { "entropy": 5.710979175567627, "epoch": 2.2625170200350126, "grad_norm": 1.234375, "learning_rate": 0.0004482785282160509, "loss": 5.0075, "mean_token_accuracy": 0.20251786410808564, "num_tokens": 50447628.0, "step": 29080 }, { "entropy": 5.758240270614624, "epoch": 2.2629060494067303, "grad_norm": 1.2109375, "learning_rate": 0.00044826084738199657, "loss": 5.0312, "mean_token_accuracy": 0.20596242249011992, "num_tokens": 50457109.0, "step": 29085 }, { "entropy": 5.747400236129761, "epoch": 2.2632950787784476, "grad_norm": 1.09375, "learning_rate": 0.00044824316391898464, "loss": 4.9288, "mean_token_accuracy": 0.20979313552379608, "num_tokens": 50466222.0, "step": 29090 }, { "entropy": 5.699603080749512, "epoch": 2.2636841081501653, "grad_norm": 1.1953125, "learning_rate": 0.00044822547782728334, "loss": 4.9709, "mean_token_accuracy": 0.20732593685388565, "num_tokens": 50475382.0, "step": 29095 }, { "entropy": 5.738552188873291, "epoch": 2.264073137521883, "grad_norm": 1.2421875, "learning_rate": 0.0004482077891071612, "loss": 5.0106, "mean_token_accuracy": 0.2064552828669548, "num_tokens": 50483501.0, "step": 29100 }, { "entropy": 5.724460458755493, "epoch": 2.2644621668936002, "grad_norm": 1.2421875, "learning_rate": 0.00044819009775888655, "loss": 4.9765, "mean_token_accuracy": 0.2058560535311699, "num_tokens": 50492005.0, "step": 29105 }, { "entropy": 5.671643400192261, "epoch": 2.264851196265318, "grad_norm": 1.234375, "learning_rate": 0.00044817240378272784, "loss": 4.8923, "mean_token_accuracy": 0.2137363910675049, "num_tokens": 50500578.0, "step": 29110 }, { "entropy": 5.656417560577393, "epoch": 2.2652402256370356, "grad_norm": 1.296875, "learning_rate": 0.00044815470717895345, "loss": 4.9223, "mean_token_accuracy": 0.2054235652089119, "num_tokens": 50509285.0, "step": 29115 }, { "entropy": 5.627827262878418, "epoch": 2.2656292550087533, "grad_norm": 1.234375, "learning_rate": 0.0004481370079478321, "loss": 4.9581, "mean_token_accuracy": 0.20197763293981552, "num_tokens": 50517519.0, "step": 29120 }, { "entropy": 5.690816831588745, "epoch": 2.2660182843804706, "grad_norm": 1.3203125, "learning_rate": 0.0004481193060896322, "loss": 4.9736, "mean_token_accuracy": 0.20609022229909896, "num_tokens": 50525843.0, "step": 29125 }, { "entropy": 5.729027223587036, "epoch": 2.2664073137521883, "grad_norm": 1.1953125, "learning_rate": 0.0004481016016046223, "loss": 5.0126, "mean_token_accuracy": 0.20402844548225402, "num_tokens": 50535638.0, "step": 29130 }, { "entropy": 5.757827663421631, "epoch": 2.266796343123906, "grad_norm": 1.296875, "learning_rate": 0.0004480838944930712, "loss": 5.052, "mean_token_accuracy": 0.19842476397752762, "num_tokens": 50544327.0, "step": 29135 }, { "entropy": 5.729465484619141, "epoch": 2.2671853724956232, "grad_norm": 1.171875, "learning_rate": 0.0004480661847552474, "loss": 4.9881, "mean_token_accuracy": 0.20816373229026794, "num_tokens": 50552276.0, "step": 29140 }, { "entropy": 5.687768363952637, "epoch": 2.267574401867341, "grad_norm": 1.171875, "learning_rate": 0.0004480484723914198, "loss": 4.9229, "mean_token_accuracy": 0.21032319217920303, "num_tokens": 50561247.0, "step": 29145 }, { "entropy": 5.768047332763672, "epoch": 2.2679634312390586, "grad_norm": 1.203125, "learning_rate": 0.0004480307574018571, "loss": 4.9809, "mean_token_accuracy": 0.20695863366127015, "num_tokens": 50569401.0, "step": 29150 }, { "entropy": 5.74258828163147, "epoch": 2.2683524606107763, "grad_norm": 1.2890625, "learning_rate": 0.000448013039786828, "loss": 4.9518, "mean_token_accuracy": 0.20893010795116423, "num_tokens": 50577346.0, "step": 29155 }, { "entropy": 5.666473817825318, "epoch": 2.2687414899824936, "grad_norm": 1.25, "learning_rate": 0.00044799531954660133, "loss": 4.9857, "mean_token_accuracy": 0.20209113508462906, "num_tokens": 50586370.0, "step": 29160 }, { "entropy": 5.696482849121094, "epoch": 2.2691305193542113, "grad_norm": 1.3515625, "learning_rate": 0.0004479775966814461, "loss": 4.9023, "mean_token_accuracy": 0.20927826762199403, "num_tokens": 50595326.0, "step": 29165 }, { "entropy": 5.789342641830444, "epoch": 2.269519548725929, "grad_norm": 1.2890625, "learning_rate": 0.00044795987119163115, "loss": 5.0082, "mean_token_accuracy": 0.20709120631217956, "num_tokens": 50603513.0, "step": 29170 }, { "entropy": 5.691622352600097, "epoch": 2.2699085780976462, "grad_norm": 1.21875, "learning_rate": 0.0004479421430774255, "loss": 4.9629, "mean_token_accuracy": 0.20148243606090546, "num_tokens": 50612416.0, "step": 29175 }, { "entropy": 5.700114631652832, "epoch": 2.270297607469364, "grad_norm": 1.2578125, "learning_rate": 0.0004479244123390981, "loss": 4.9796, "mean_token_accuracy": 0.21193940341472625, "num_tokens": 50620480.0, "step": 29180 }, { "entropy": 5.6114232540130615, "epoch": 2.2706866368410816, "grad_norm": 1.21875, "learning_rate": 0.00044790667897691796, "loss": 4.8798, "mean_token_accuracy": 0.21626315414905548, "num_tokens": 50629044.0, "step": 29185 }, { "entropy": 5.7674500942230225, "epoch": 2.271075666212799, "grad_norm": 1.234375, "learning_rate": 0.00044788894299115415, "loss": 5.0905, "mean_token_accuracy": 0.1974001407623291, "num_tokens": 50638610.0, "step": 29190 }, { "entropy": 5.6896758556365965, "epoch": 2.2714646955845166, "grad_norm": 1.125, "learning_rate": 0.0004478712043820758, "loss": 4.9791, "mean_token_accuracy": 0.20331458747386932, "num_tokens": 50647337.0, "step": 29195 }, { "entropy": 5.715017509460449, "epoch": 2.2718537249562343, "grad_norm": 1.2421875, "learning_rate": 0.0004478534631499521, "loss": 4.9901, "mean_token_accuracy": 0.2104761630296707, "num_tokens": 50654641.0, "step": 29200 }, { "entropy": 5.693295240402222, "epoch": 2.2722427543279515, "grad_norm": 1.125, "learning_rate": 0.00044783571929505223, "loss": 5.0299, "mean_token_accuracy": 0.19273147732019424, "num_tokens": 50663726.0, "step": 29205 }, { "entropy": 5.7791399478912355, "epoch": 2.2726317836996692, "grad_norm": 1.078125, "learning_rate": 0.0004478179728176454, "loss": 5.0626, "mean_token_accuracy": 0.20494945645332335, "num_tokens": 50672376.0, "step": 29210 }, { "entropy": 5.755568408966065, "epoch": 2.273020813071387, "grad_norm": 1.171875, "learning_rate": 0.0004478002237180009, "loss": 5.0366, "mean_token_accuracy": 0.20128738582134248, "num_tokens": 50680990.0, "step": 29215 }, { "entropy": 5.7578778743743895, "epoch": 2.2734098424431046, "grad_norm": 1.1328125, "learning_rate": 0.000447782471996388, "loss": 5.0916, "mean_token_accuracy": 0.19580189883708954, "num_tokens": 50690180.0, "step": 29220 }, { "entropy": 5.746267080307007, "epoch": 2.273798871814822, "grad_norm": 1.2578125, "learning_rate": 0.0004477647176530762, "loss": 4.9737, "mean_token_accuracy": 0.2056620389223099, "num_tokens": 50699094.0, "step": 29225 }, { "entropy": 5.749994802474975, "epoch": 2.2741879011865396, "grad_norm": 1.2578125, "learning_rate": 0.0004477469606883347, "loss": 4.9964, "mean_token_accuracy": 0.20125244557857513, "num_tokens": 50708312.0, "step": 29230 }, { "entropy": 5.652478361129761, "epoch": 2.2745769305582573, "grad_norm": 1.1015625, "learning_rate": 0.0004477292011024331, "loss": 4.9742, "mean_token_accuracy": 0.20667684972286224, "num_tokens": 50717092.0, "step": 29235 }, { "entropy": 5.643951654434204, "epoch": 2.2749659599299745, "grad_norm": 1.203125, "learning_rate": 0.00044771143889564075, "loss": 4.9548, "mean_token_accuracy": 0.2088184505701065, "num_tokens": 50725641.0, "step": 29240 }, { "entropy": 5.667259597778321, "epoch": 2.275354989301692, "grad_norm": 1.2109375, "learning_rate": 0.00044769367406822727, "loss": 4.9773, "mean_token_accuracy": 0.2048446223139763, "num_tokens": 50734082.0, "step": 29245 }, { "entropy": 5.738952589035034, "epoch": 2.27574401867341, "grad_norm": 1.2265625, "learning_rate": 0.0004476759066204621, "loss": 5.0687, "mean_token_accuracy": 0.19482304155826569, "num_tokens": 50743242.0, "step": 29250 }, { "entropy": 5.707887601852417, "epoch": 2.2761330480451276, "grad_norm": 1.203125, "learning_rate": 0.0004476581365526149, "loss": 4.94, "mean_token_accuracy": 0.20732298046350478, "num_tokens": 50751693.0, "step": 29255 }, { "entropy": 5.712618207931518, "epoch": 2.276522077416845, "grad_norm": 1.3046875, "learning_rate": 0.0004476403638649553, "loss": 5.0045, "mean_token_accuracy": 0.1977794125676155, "num_tokens": 50760031.0, "step": 29260 }, { "entropy": 5.691950702667237, "epoch": 2.2769111067885626, "grad_norm": 1.296875, "learning_rate": 0.00044762258855775294, "loss": 5.0149, "mean_token_accuracy": 0.20737670809030534, "num_tokens": 50768236.0, "step": 29265 }, { "entropy": 5.716222953796387, "epoch": 2.2773001361602803, "grad_norm": 1.1484375, "learning_rate": 0.00044760481063127754, "loss": 4.977, "mean_token_accuracy": 0.20951962918043138, "num_tokens": 50777055.0, "step": 29270 }, { "entropy": 5.738576745986938, "epoch": 2.2776891655319975, "grad_norm": 1.2109375, "learning_rate": 0.000447587030085799, "loss": 5.0198, "mean_token_accuracy": 0.202374866604805, "num_tokens": 50785574.0, "step": 29275 }, { "entropy": 5.674203252792358, "epoch": 2.278078194903715, "grad_norm": 1.1953125, "learning_rate": 0.00044756924692158684, "loss": 5.0211, "mean_token_accuracy": 0.20544813424348832, "num_tokens": 50794889.0, "step": 29280 }, { "entropy": 5.6562903881072994, "epoch": 2.278467224275433, "grad_norm": 1.25, "learning_rate": 0.0004475514611389111, "loss": 5.0356, "mean_token_accuracy": 0.20114805102348327, "num_tokens": 50804823.0, "step": 29285 }, { "entropy": 5.746180677413941, "epoch": 2.2788562536471506, "grad_norm": 1.1171875, "learning_rate": 0.0004475336727380415, "loss": 4.9092, "mean_token_accuracy": 0.21025109589099883, "num_tokens": 50813233.0, "step": 29290 }, { "entropy": 5.707292222976685, "epoch": 2.279245283018868, "grad_norm": 1.234375, "learning_rate": 0.0004475158817192481, "loss": 4.9559, "mean_token_accuracy": 0.20495827347040177, "num_tokens": 50821925.0, "step": 29295 }, { "entropy": 5.714855813980103, "epoch": 2.2796343123905856, "grad_norm": 1.234375, "learning_rate": 0.00044749808808280077, "loss": 5.0058, "mean_token_accuracy": 0.20511671155691147, "num_tokens": 50831337.0, "step": 29300 }, { "entropy": 5.716977310180664, "epoch": 2.280023341762303, "grad_norm": 1.203125, "learning_rate": 0.00044748029182896956, "loss": 4.9751, "mean_token_accuracy": 0.20896781831979752, "num_tokens": 50840493.0, "step": 29305 }, { "entropy": 5.790254545211792, "epoch": 2.2804123711340205, "grad_norm": 1.359375, "learning_rate": 0.0004474624929580243, "loss": 5.0739, "mean_token_accuracy": 0.2021462142467499, "num_tokens": 50848843.0, "step": 29310 }, { "entropy": 5.74621353149414, "epoch": 2.280801400505738, "grad_norm": 1.1171875, "learning_rate": 0.0004474446914702354, "loss": 4.9961, "mean_token_accuracy": 0.20213095992803573, "num_tokens": 50857882.0, "step": 29315 }, { "entropy": 5.764393854141235, "epoch": 2.281190429877456, "grad_norm": 1.296875, "learning_rate": 0.0004474268873658727, "loss": 5.1285, "mean_token_accuracy": 0.19607437998056412, "num_tokens": 50866058.0, "step": 29320 }, { "entropy": 5.726093912124634, "epoch": 2.281579459249173, "grad_norm": 1.234375, "learning_rate": 0.0004474090806452064, "loss": 5.0071, "mean_token_accuracy": 0.20631835460662842, "num_tokens": 50874175.0, "step": 29325 }, { "entropy": 5.6904966831207275, "epoch": 2.281968488620891, "grad_norm": 1.078125, "learning_rate": 0.00044739127130850675, "loss": 4.9722, "mean_token_accuracy": 0.20511212348937988, "num_tokens": 50883753.0, "step": 29330 }, { "entropy": 5.736419534683227, "epoch": 2.2823575179926086, "grad_norm": 1.140625, "learning_rate": 0.00044737345935604397, "loss": 5.0493, "mean_token_accuracy": 0.20174746066331864, "num_tokens": 50891962.0, "step": 29335 }, { "entropy": 5.7512908458709715, "epoch": 2.282746547364326, "grad_norm": 1.1640625, "learning_rate": 0.0004473556447880883, "loss": 4.9539, "mean_token_accuracy": 0.2080543413758278, "num_tokens": 50900405.0, "step": 29340 }, { "entropy": 5.734158134460449, "epoch": 2.2831355767360435, "grad_norm": 1.265625, "learning_rate": 0.00044733782760490997, "loss": 5.0294, "mean_token_accuracy": 0.20564614236354828, "num_tokens": 50908850.0, "step": 29345 }, { "entropy": 5.7007527351379395, "epoch": 2.283524606107761, "grad_norm": 1.0859375, "learning_rate": 0.0004473200078067795, "loss": 5.0793, "mean_token_accuracy": 0.1987391158938408, "num_tokens": 50918545.0, "step": 29350 }, { "entropy": 5.69084529876709, "epoch": 2.283913635479479, "grad_norm": 1.234375, "learning_rate": 0.00044730218539396717, "loss": 4.9923, "mean_token_accuracy": 0.20665283203125, "num_tokens": 50926664.0, "step": 29355 }, { "entropy": 5.733583688735962, "epoch": 2.284302664851196, "grad_norm": 1.3359375, "learning_rate": 0.0004472843603667434, "loss": 5.0702, "mean_token_accuracy": 0.19152991324663163, "num_tokens": 50935846.0, "step": 29360 }, { "entropy": 5.710142326354981, "epoch": 2.284691694222914, "grad_norm": 1.1484375, "learning_rate": 0.00044726653272537866, "loss": 4.9944, "mean_token_accuracy": 0.20574162304401397, "num_tokens": 50944289.0, "step": 29365 }, { "entropy": 5.723946666717529, "epoch": 2.2850807235946315, "grad_norm": 1.1953125, "learning_rate": 0.0004472487024701435, "loss": 4.9985, "mean_token_accuracy": 0.20516370832920075, "num_tokens": 50952949.0, "step": 29370 }, { "entropy": 5.789242267608643, "epoch": 2.285469752966349, "grad_norm": 1.265625, "learning_rate": 0.0004472308696013085, "loss": 5.0842, "mean_token_accuracy": 0.1952628791332245, "num_tokens": 50961957.0, "step": 29375 }, { "entropy": 5.758067226409912, "epoch": 2.2858587823380665, "grad_norm": 1.25, "learning_rate": 0.0004472130341191441, "loss": 5.0002, "mean_token_accuracy": 0.20671627819538116, "num_tokens": 50970463.0, "step": 29380 }, { "entropy": 5.763094472885132, "epoch": 2.286247811709784, "grad_norm": 1.265625, "learning_rate": 0.0004471951960239211, "loss": 5.0331, "mean_token_accuracy": 0.19847462326288223, "num_tokens": 50979350.0, "step": 29385 }, { "entropy": 5.75760850906372, "epoch": 2.286636841081502, "grad_norm": 1.1953125, "learning_rate": 0.00044717735531591, "loss": 5.0557, "mean_token_accuracy": 0.20189856141805648, "num_tokens": 50988048.0, "step": 29390 }, { "entropy": 5.735132884979248, "epoch": 2.287025870453219, "grad_norm": 1.3125, "learning_rate": 0.00044715951199538156, "loss": 5.018, "mean_token_accuracy": 0.20573174804449082, "num_tokens": 50996714.0, "step": 29395 }, { "entropy": 5.7759825706481935, "epoch": 2.287414899824937, "grad_norm": 1.2890625, "learning_rate": 0.00044714166606260657, "loss": 4.9967, "mean_token_accuracy": 0.20537349432706833, "num_tokens": 51005557.0, "step": 29400 }, { "entropy": 5.794282674789429, "epoch": 2.2878039291966545, "grad_norm": 1.171875, "learning_rate": 0.0004471238175178559, "loss": 4.9453, "mean_token_accuracy": 0.20468135178089142, "num_tokens": 51014024.0, "step": 29405 }, { "entropy": 5.6963907241821286, "epoch": 2.288192958568372, "grad_norm": 1.28125, "learning_rate": 0.0004471059663614002, "loss": 4.916, "mean_token_accuracy": 0.200111585855484, "num_tokens": 51022211.0, "step": 29410 }, { "entropy": 5.724894428253174, "epoch": 2.2885819879400895, "grad_norm": 1.2265625, "learning_rate": 0.0004470881125935103, "loss": 5.0737, "mean_token_accuracy": 0.20791001617908478, "num_tokens": 51030459.0, "step": 29415 }, { "entropy": 5.766465663909912, "epoch": 2.288971017311807, "grad_norm": 1.28125, "learning_rate": 0.00044707025621445735, "loss": 5.0548, "mean_token_accuracy": 0.20130422413349153, "num_tokens": 51038439.0, "step": 29420 }, { "entropy": 5.723401594161987, "epoch": 2.2893600466835244, "grad_norm": 1.25, "learning_rate": 0.00044705239722451194, "loss": 4.9479, "mean_token_accuracy": 0.20673240274190902, "num_tokens": 51047698.0, "step": 29425 }, { "entropy": 5.738009643554688, "epoch": 2.289749076055242, "grad_norm": 1.3125, "learning_rate": 0.00044703453562394544, "loss": 4.972, "mean_token_accuracy": 0.20906113535165788, "num_tokens": 51056211.0, "step": 29430 }, { "entropy": 5.753858947753907, "epoch": 2.29013810542696, "grad_norm": 1.2578125, "learning_rate": 0.0004470166714130286, "loss": 4.9946, "mean_token_accuracy": 0.2026839718222618, "num_tokens": 51064321.0, "step": 29435 }, { "entropy": 5.757525491714477, "epoch": 2.290527134798677, "grad_norm": 1.3046875, "learning_rate": 0.00044699880459203264, "loss": 4.9711, "mean_token_accuracy": 0.20630315840244293, "num_tokens": 51072537.0, "step": 29440 }, { "entropy": 5.704566812515258, "epoch": 2.290916164170395, "grad_norm": 1.1953125, "learning_rate": 0.00044698093516122844, "loss": 4.9679, "mean_token_accuracy": 0.2087300643324852, "num_tokens": 51080873.0, "step": 29445 }, { "entropy": 5.706537199020386, "epoch": 2.2913051935421125, "grad_norm": 1.1796875, "learning_rate": 0.0004469630631208874, "loss": 5.0504, "mean_token_accuracy": 0.20100590884685515, "num_tokens": 51089462.0, "step": 29450 }, { "entropy": 5.712296056747436, "epoch": 2.29169422291383, "grad_norm": 1.1328125, "learning_rate": 0.0004469451884712805, "loss": 4.9977, "mean_token_accuracy": 0.20375248193740844, "num_tokens": 51098918.0, "step": 29455 }, { "entropy": 5.76979284286499, "epoch": 2.2920832522855474, "grad_norm": 1.2109375, "learning_rate": 0.0004469273112126791, "loss": 5.0828, "mean_token_accuracy": 0.20307301580905915, "num_tokens": 51107483.0, "step": 29460 }, { "entropy": 5.774715995788574, "epoch": 2.292472281657265, "grad_norm": 1.234375, "learning_rate": 0.00044690943134535445, "loss": 5.0629, "mean_token_accuracy": 0.19831831604242325, "num_tokens": 51116590.0, "step": 29465 }, { "entropy": 5.657496929168701, "epoch": 2.292861311028983, "grad_norm": 1.21875, "learning_rate": 0.0004468915488695777, "loss": 4.8832, "mean_token_accuracy": 0.20863723158836364, "num_tokens": 51125296.0, "step": 29470 }, { "entropy": 5.682510423660278, "epoch": 2.2932503404007, "grad_norm": 1.2578125, "learning_rate": 0.00044687366378562036, "loss": 4.9793, "mean_token_accuracy": 0.20140694677829743, "num_tokens": 51133369.0, "step": 29475 }, { "entropy": 5.796029996871948, "epoch": 2.293639369772418, "grad_norm": 1.1171875, "learning_rate": 0.00044685577609375373, "loss": 5.1368, "mean_token_accuracy": 0.20644612163305281, "num_tokens": 51142789.0, "step": 29480 }, { "entropy": 5.781443548202515, "epoch": 2.2940283991441355, "grad_norm": 1.2890625, "learning_rate": 0.0004468378857942492, "loss": 4.99, "mean_token_accuracy": 0.1978029727935791, "num_tokens": 51151706.0, "step": 29485 }, { "entropy": 5.7891288757324215, "epoch": 2.294417428515853, "grad_norm": 1.21875, "learning_rate": 0.00044681999288737826, "loss": 5.0232, "mean_token_accuracy": 0.2058563157916069, "num_tokens": 51160924.0, "step": 29490 }, { "entropy": 5.719172668457031, "epoch": 2.2948064578875704, "grad_norm": 1.3515625, "learning_rate": 0.00044680209737341244, "loss": 5.0363, "mean_token_accuracy": 0.19839604198932648, "num_tokens": 51168871.0, "step": 29495 }, { "entropy": 5.715654468536377, "epoch": 2.295195487259288, "grad_norm": 1.140625, "learning_rate": 0.0004467841992526233, "loss": 4.9532, "mean_token_accuracy": 0.2061698168516159, "num_tokens": 51177621.0, "step": 29500 }, { "entropy": 5.746858406066894, "epoch": 2.295584516631006, "grad_norm": 1.203125, "learning_rate": 0.00044676629852528226, "loss": 4.9223, "mean_token_accuracy": 0.21218833029270173, "num_tokens": 51186004.0, "step": 29505 }, { "entropy": 5.710502052307129, "epoch": 2.295973546002723, "grad_norm": 1.234375, "learning_rate": 0.00044674839519166104, "loss": 4.9372, "mean_token_accuracy": 0.20821304768323898, "num_tokens": 51194609.0, "step": 29510 }, { "entropy": 5.724316596984863, "epoch": 2.2963625753744408, "grad_norm": 1.2109375, "learning_rate": 0.00044673048925203136, "loss": 5.0593, "mean_token_accuracy": 0.2141966089606285, "num_tokens": 51203928.0, "step": 29515 }, { "entropy": 5.714412975311279, "epoch": 2.2967516047461585, "grad_norm": 1.1875, "learning_rate": 0.00044671258070666476, "loss": 4.9826, "mean_token_accuracy": 0.20867157578468323, "num_tokens": 51212762.0, "step": 29520 }, { "entropy": 5.761064720153809, "epoch": 2.2971406341178757, "grad_norm": 1.1640625, "learning_rate": 0.0004466946695558331, "loss": 5.1065, "mean_token_accuracy": 0.1934242218732834, "num_tokens": 51221064.0, "step": 29525 }, { "entropy": 5.714259958267212, "epoch": 2.2975296634895934, "grad_norm": 1.2421875, "learning_rate": 0.00044667675579980817, "loss": 4.9821, "mean_token_accuracy": 0.20306518971920012, "num_tokens": 51229633.0, "step": 29530 }, { "entropy": 5.759859609603882, "epoch": 2.297918692861311, "grad_norm": 1.2578125, "learning_rate": 0.0004466588394388616, "loss": 5.0328, "mean_token_accuracy": 0.20471571981906891, "num_tokens": 51239051.0, "step": 29535 }, { "entropy": 5.753395986557007, "epoch": 2.2983077222330284, "grad_norm": 1.1796875, "learning_rate": 0.0004466409204732654, "loss": 4.9743, "mean_token_accuracy": 0.20595187246799468, "num_tokens": 51247703.0, "step": 29540 }, { "entropy": 5.714046430587769, "epoch": 2.298696751604746, "grad_norm": 1.1171875, "learning_rate": 0.00044662299890329144, "loss": 4.9263, "mean_token_accuracy": 0.21250727623701096, "num_tokens": 51256394.0, "step": 29545 }, { "entropy": 5.7732462882995605, "epoch": 2.2990857809764638, "grad_norm": 1.2265625, "learning_rate": 0.0004466050747292116, "loss": 5.0106, "mean_token_accuracy": 0.20575936436653136, "num_tokens": 51264181.0, "step": 29550 }, { "entropy": 5.6658360958099365, "epoch": 2.2994748103481815, "grad_norm": 1.3046875, "learning_rate": 0.000446587147951298, "loss": 4.9091, "mean_token_accuracy": 0.2106197327375412, "num_tokens": 51272758.0, "step": 29555 }, { "entropy": 5.739393997192383, "epoch": 2.2998638397198987, "grad_norm": 1.2890625, "learning_rate": 0.0004465692185698224, "loss": 5.0291, "mean_token_accuracy": 0.2024053528904915, "num_tokens": 51281681.0, "step": 29560 }, { "entropy": 5.710256624221802, "epoch": 2.3002528690916164, "grad_norm": 1.234375, "learning_rate": 0.00044655128658505717, "loss": 5.0158, "mean_token_accuracy": 0.2016099736094475, "num_tokens": 51290060.0, "step": 29565 }, { "entropy": 5.759611320495606, "epoch": 2.300641898463334, "grad_norm": 1.2734375, "learning_rate": 0.0004465333519972741, "loss": 4.9513, "mean_token_accuracy": 0.20766474753618241, "num_tokens": 51298262.0, "step": 29570 }, { "entropy": 5.658017778396607, "epoch": 2.3010309278350514, "grad_norm": 1.265625, "learning_rate": 0.0004465154148067454, "loss": 4.8698, "mean_token_accuracy": 0.20922183692455293, "num_tokens": 51306436.0, "step": 29575 }, { "entropy": 5.686435699462891, "epoch": 2.301419957206769, "grad_norm": 1.375, "learning_rate": 0.00044649747501374336, "loss": 4.9623, "mean_token_accuracy": 0.20191514045000075, "num_tokens": 51315132.0, "step": 29580 }, { "entropy": 5.668139028549194, "epoch": 2.3018089865784868, "grad_norm": 1.1484375, "learning_rate": 0.0004464795326185401, "loss": 4.9199, "mean_token_accuracy": 0.21099537760019302, "num_tokens": 51324189.0, "step": 29585 }, { "entropy": 5.6724100589752195, "epoch": 2.3021980159502045, "grad_norm": 1.1640625, "learning_rate": 0.0004464615876214078, "loss": 4.9718, "mean_token_accuracy": 0.2052620381116867, "num_tokens": 51332680.0, "step": 29590 }, { "entropy": 5.746179246902466, "epoch": 2.3025870453219217, "grad_norm": 1.1484375, "learning_rate": 0.0004464436400226188, "loss": 5.0253, "mean_token_accuracy": 0.2039091095328331, "num_tokens": 51342036.0, "step": 29595 }, { "entropy": 5.731257915496826, "epoch": 2.3029760746936394, "grad_norm": 1.1484375, "learning_rate": 0.0004464256898224455, "loss": 4.9661, "mean_token_accuracy": 0.19533417373895645, "num_tokens": 51350987.0, "step": 29600 }, { "entropy": 5.720395755767822, "epoch": 2.303365104065357, "grad_norm": 1.234375, "learning_rate": 0.0004464077370211602, "loss": 4.9621, "mean_token_accuracy": 0.2061502829194069, "num_tokens": 51359787.0, "step": 29605 }, { "entropy": 5.728523445129395, "epoch": 2.3037541334370744, "grad_norm": 1.2578125, "learning_rate": 0.00044638978161903533, "loss": 5.0561, "mean_token_accuracy": 0.20532746165990828, "num_tokens": 51368329.0, "step": 29610 }, { "entropy": 5.719857168197632, "epoch": 2.304143162808792, "grad_norm": 1.2109375, "learning_rate": 0.0004463718236163433, "loss": 5.0346, "mean_token_accuracy": 0.2014698639512062, "num_tokens": 51377104.0, "step": 29615 }, { "entropy": 5.751528024673462, "epoch": 2.3045321921805098, "grad_norm": 1.2265625, "learning_rate": 0.00044635386301335666, "loss": 5.069, "mean_token_accuracy": 0.19991710931062698, "num_tokens": 51385210.0, "step": 29620 }, { "entropy": 5.761771154403687, "epoch": 2.304921221552227, "grad_norm": 1.2421875, "learning_rate": 0.0004463358998103478, "loss": 5.0129, "mean_token_accuracy": 0.19605372846126556, "num_tokens": 51393492.0, "step": 29625 }, { "entropy": 5.663180255889893, "epoch": 2.3053102509239447, "grad_norm": 1.1953125, "learning_rate": 0.0004463179340075894, "loss": 4.8613, "mean_token_accuracy": 0.2150268316268921, "num_tokens": 51401953.0, "step": 29630 }, { "entropy": 5.704414415359497, "epoch": 2.3056992802956624, "grad_norm": 1.203125, "learning_rate": 0.0004462999656053541, "loss": 5.0549, "mean_token_accuracy": 0.19720006138086318, "num_tokens": 51410874.0, "step": 29635 }, { "entropy": 5.695713138580322, "epoch": 2.3060883096673797, "grad_norm": 1.2578125, "learning_rate": 0.00044628199460391445, "loss": 4.9221, "mean_token_accuracy": 0.21578446477651597, "num_tokens": 51419189.0, "step": 29640 }, { "entropy": 5.766446352005005, "epoch": 2.3064773390390974, "grad_norm": 1.1015625, "learning_rate": 0.00044626402100354307, "loss": 4.9982, "mean_token_accuracy": 0.20555685162544252, "num_tokens": 51427970.0, "step": 29645 }, { "entropy": 5.790774965286255, "epoch": 2.306866368410815, "grad_norm": 1.234375, "learning_rate": 0.0004462460448045129, "loss": 5.0076, "mean_token_accuracy": 0.20453614741563797, "num_tokens": 51436069.0, "step": 29650 }, { "entropy": 5.679125356674194, "epoch": 2.3072553977825327, "grad_norm": 1.25, "learning_rate": 0.00044622806600709645, "loss": 5.0259, "mean_token_accuracy": 0.2024261549115181, "num_tokens": 51444424.0, "step": 29655 }, { "entropy": 5.703893947601318, "epoch": 2.30764442715425, "grad_norm": 1.328125, "learning_rate": 0.0004462100846115667, "loss": 4.9952, "mean_token_accuracy": 0.2071802109479904, "num_tokens": 51453095.0, "step": 29660 }, { "entropy": 5.773790693283081, "epoch": 2.3080334565259677, "grad_norm": 1.1953125, "learning_rate": 0.0004461921006181964, "loss": 4.9336, "mean_token_accuracy": 0.21115196496248245, "num_tokens": 51461525.0, "step": 29665 }, { "entropy": 5.7106016159057615, "epoch": 2.3084224858976854, "grad_norm": 1.2421875, "learning_rate": 0.0004461741140272584, "loss": 4.9558, "mean_token_accuracy": 0.20782775431871414, "num_tokens": 51469918.0, "step": 29670 }, { "entropy": 5.728863000869751, "epoch": 2.3088115152694026, "grad_norm": 1.1796875, "learning_rate": 0.0004461561248390257, "loss": 5.0548, "mean_token_accuracy": 0.20880459249019623, "num_tokens": 51478747.0, "step": 29675 }, { "entropy": 5.713484382629394, "epoch": 2.3092005446411203, "grad_norm": 1.1484375, "learning_rate": 0.0004461381330537713, "loss": 4.9987, "mean_token_accuracy": 0.19966049641370773, "num_tokens": 51487730.0, "step": 29680 }, { "entropy": 5.789279365539551, "epoch": 2.309589574012838, "grad_norm": 1.25, "learning_rate": 0.000446120138671768, "loss": 5.0028, "mean_token_accuracy": 0.20064719319343566, "num_tokens": 51495672.0, "step": 29685 }, { "entropy": 5.774441957473755, "epoch": 2.3099786033845557, "grad_norm": 1.3828125, "learning_rate": 0.00044610214169328913, "loss": 4.9599, "mean_token_accuracy": 0.2028159260749817, "num_tokens": 51503377.0, "step": 29690 }, { "entropy": 5.639253854751587, "epoch": 2.310367632756273, "grad_norm": 1.1953125, "learning_rate": 0.0004460841421186075, "loss": 4.9143, "mean_token_accuracy": 0.21235134452581406, "num_tokens": 51511932.0, "step": 29695 }, { "entropy": 5.745395231246948, "epoch": 2.3107566621279907, "grad_norm": 1.2265625, "learning_rate": 0.0004460661399479963, "loss": 4.9948, "mean_token_accuracy": 0.19869115501642226, "num_tokens": 51520565.0, "step": 29700 }, { "entropy": 5.683946990966797, "epoch": 2.3111456914997084, "grad_norm": 1.2109375, "learning_rate": 0.00044604813518172876, "loss": 4.8983, "mean_token_accuracy": 0.2108920156955719, "num_tokens": 51529778.0, "step": 29705 }, { "entropy": 5.750917053222656, "epoch": 2.3115347208714256, "grad_norm": 1.21875, "learning_rate": 0.00044603012782007796, "loss": 5.0363, "mean_token_accuracy": 0.20505820959806442, "num_tokens": 51539394.0, "step": 29710 }, { "entropy": 5.77166051864624, "epoch": 2.3119237502431433, "grad_norm": 1.2734375, "learning_rate": 0.0004460121178633172, "loss": 4.9563, "mean_token_accuracy": 0.2054141029715538, "num_tokens": 51548314.0, "step": 29715 }, { "entropy": 5.654262113571167, "epoch": 2.312312779614861, "grad_norm": 1.25, "learning_rate": 0.00044599410531171986, "loss": 4.8967, "mean_token_accuracy": 0.21590431034564972, "num_tokens": 51556828.0, "step": 29720 }, { "entropy": 5.687180852890014, "epoch": 2.3127018089865787, "grad_norm": 1.203125, "learning_rate": 0.000445976090165559, "loss": 5.014, "mean_token_accuracy": 0.19985330998897552, "num_tokens": 51565031.0, "step": 29725 }, { "entropy": 5.798959827423095, "epoch": 2.313090838358296, "grad_norm": 1.234375, "learning_rate": 0.0004459580724251082, "loss": 5.0909, "mean_token_accuracy": 0.19339765310287477, "num_tokens": 51574218.0, "step": 29730 }, { "entropy": 5.683251619338989, "epoch": 2.3134798677300137, "grad_norm": 1.1875, "learning_rate": 0.00044594005209064064, "loss": 4.9725, "mean_token_accuracy": 0.21131201684474946, "num_tokens": 51583229.0, "step": 29735 }, { "entropy": 5.681477355957031, "epoch": 2.313868897101731, "grad_norm": 1.2265625, "learning_rate": 0.00044592202916243003, "loss": 4.9586, "mean_token_accuracy": 0.2036895826458931, "num_tokens": 51591969.0, "step": 29740 }, { "entropy": 5.758718776702881, "epoch": 2.3142579264734486, "grad_norm": 1.234375, "learning_rate": 0.0004459040036407495, "loss": 4.9736, "mean_token_accuracy": 0.2052181839942932, "num_tokens": 51600840.0, "step": 29745 }, { "entropy": 5.653624629974365, "epoch": 2.3146469558451663, "grad_norm": 1.3828125, "learning_rate": 0.0004458859755258729, "loss": 4.8336, "mean_token_accuracy": 0.2199634999036789, "num_tokens": 51608750.0, "step": 29750 }, { "entropy": 5.722110891342163, "epoch": 2.315035985216884, "grad_norm": 1.390625, "learning_rate": 0.00044586794481807357, "loss": 5.0017, "mean_token_accuracy": 0.20519475340843202, "num_tokens": 51617079.0, "step": 29755 }, { "entropy": 5.661220693588257, "epoch": 2.3154250145886013, "grad_norm": 1.109375, "learning_rate": 0.00044584991151762506, "loss": 5.0089, "mean_token_accuracy": 0.2047076478600502, "num_tokens": 51625310.0, "step": 29760 }, { "entropy": 5.729980897903443, "epoch": 2.315814043960319, "grad_norm": 1.234375, "learning_rate": 0.0004458318756248011, "loss": 4.9822, "mean_token_accuracy": 0.20155461728572846, "num_tokens": 51634071.0, "step": 29765 }, { "entropy": 5.718720388412476, "epoch": 2.3162030733320367, "grad_norm": 1.1484375, "learning_rate": 0.00044581383713987547, "loss": 4.968, "mean_token_accuracy": 0.20319255888462068, "num_tokens": 51642761.0, "step": 29770 }, { "entropy": 5.716540384292602, "epoch": 2.316592102703754, "grad_norm": 1.1171875, "learning_rate": 0.0004457957960631216, "loss": 4.9713, "mean_token_accuracy": 0.20801773071289062, "num_tokens": 51652160.0, "step": 29775 }, { "entropy": 5.643708753585815, "epoch": 2.3169811320754716, "grad_norm": 1.1171875, "learning_rate": 0.0004457777523948134, "loss": 4.9263, "mean_token_accuracy": 0.20331234484910965, "num_tokens": 51661345.0, "step": 29780 }, { "entropy": 5.728304195404053, "epoch": 2.3173701614471893, "grad_norm": 1.203125, "learning_rate": 0.0004457597061352247, "loss": 4.9956, "mean_token_accuracy": 0.20740967392921447, "num_tokens": 51669855.0, "step": 29785 }, { "entropy": 5.782248210906983, "epoch": 2.317759190818907, "grad_norm": 1.234375, "learning_rate": 0.0004457416572846291, "loss": 5.0805, "mean_token_accuracy": 0.20205772519111634, "num_tokens": 51679272.0, "step": 29790 }, { "entropy": 5.712372303009033, "epoch": 2.3181482201906243, "grad_norm": 1.2421875, "learning_rate": 0.0004457236058433008, "loss": 4.9708, "mean_token_accuracy": 0.19845490753650666, "num_tokens": 51688383.0, "step": 29795 }, { "entropy": 5.75201096534729, "epoch": 2.318537249562342, "grad_norm": 1.1328125, "learning_rate": 0.00044570555181151333, "loss": 5.0212, "mean_token_accuracy": 0.19853007644414902, "num_tokens": 51696996.0, "step": 29800 }, { "entropy": 5.694565296173096, "epoch": 2.3189262789340597, "grad_norm": 1.2734375, "learning_rate": 0.000445687495189541, "loss": 5.0474, "mean_token_accuracy": 0.19959439486265182, "num_tokens": 51705830.0, "step": 29805 }, { "entropy": 5.697658824920654, "epoch": 2.319315308305777, "grad_norm": 1.234375, "learning_rate": 0.00044566943597765745, "loss": 4.9703, "mean_token_accuracy": 0.20759567767381668, "num_tokens": 51715357.0, "step": 29810 }, { "entropy": 5.758824968338013, "epoch": 2.3197043376774946, "grad_norm": 1.046875, "learning_rate": 0.00044565137417613694, "loss": 5.0424, "mean_token_accuracy": 0.20284349471330643, "num_tokens": 51725342.0, "step": 29815 }, { "entropy": 5.808252143859863, "epoch": 2.3200933670492123, "grad_norm": 1.2890625, "learning_rate": 0.0004456333097852534, "loss": 5.0013, "mean_token_accuracy": 0.20676441192626954, "num_tokens": 51733788.0, "step": 29820 }, { "entropy": 5.752743291854858, "epoch": 2.32048239642093, "grad_norm": 1.1875, "learning_rate": 0.00044561524280528104, "loss": 5.023, "mean_token_accuracy": 0.20815668255090714, "num_tokens": 51742713.0, "step": 29825 }, { "entropy": 5.795190382003784, "epoch": 2.3208714257926473, "grad_norm": 1.3046875, "learning_rate": 0.00044559717323649383, "loss": 5.1125, "mean_token_accuracy": 0.19606551826000213, "num_tokens": 51751482.0, "step": 29830 }, { "entropy": 5.67575306892395, "epoch": 2.321260455164365, "grad_norm": 1.2578125, "learning_rate": 0.0004455791010791662, "loss": 4.8639, "mean_token_accuracy": 0.21459861993789672, "num_tokens": 51760217.0, "step": 29835 }, { "entropy": 5.744908666610717, "epoch": 2.3216494845360827, "grad_norm": 1.25, "learning_rate": 0.0004455610263335721, "loss": 5.0148, "mean_token_accuracy": 0.20066949129104614, "num_tokens": 51767945.0, "step": 29840 }, { "entropy": 5.7202118873596195, "epoch": 2.3220385139078, "grad_norm": 1.203125, "learning_rate": 0.0004455429489999859, "loss": 5.0376, "mean_token_accuracy": 0.19415888488292693, "num_tokens": 51777318.0, "step": 29845 }, { "entropy": 5.720464563369751, "epoch": 2.3224275432795176, "grad_norm": 1.2734375, "learning_rate": 0.00044552486907868194, "loss": 4.9895, "mean_token_accuracy": 0.1989004895091057, "num_tokens": 51786571.0, "step": 29850 }, { "entropy": 5.81879563331604, "epoch": 2.3228165726512353, "grad_norm": 1.2265625, "learning_rate": 0.00044550678656993454, "loss": 5.0793, "mean_token_accuracy": 0.1992500200867653, "num_tokens": 51794872.0, "step": 29855 }, { "entropy": 5.801921749114991, "epoch": 2.3232056020229526, "grad_norm": 1.2734375, "learning_rate": 0.000445488701474018, "loss": 5.0064, "mean_token_accuracy": 0.20138911306858062, "num_tokens": 51803111.0, "step": 29860 }, { "entropy": 5.709191560745239, "epoch": 2.3235946313946703, "grad_norm": 1.3515625, "learning_rate": 0.0004454706137912067, "loss": 4.9104, "mean_token_accuracy": 0.20999972075223922, "num_tokens": 51811574.0, "step": 29865 }, { "entropy": 5.692693710327148, "epoch": 2.323983660766388, "grad_norm": 1.2109375, "learning_rate": 0.0004454525235217753, "loss": 4.917, "mean_token_accuracy": 0.20232735127210616, "num_tokens": 51820120.0, "step": 29870 }, { "entropy": 5.753451633453369, "epoch": 2.324372690138105, "grad_norm": 1.2265625, "learning_rate": 0.00044543443066599807, "loss": 5.0701, "mean_token_accuracy": 0.20338790565729142, "num_tokens": 51828293.0, "step": 29875 }, { "entropy": 5.780474519729614, "epoch": 2.324761719509823, "grad_norm": 1.2890625, "learning_rate": 0.0004454163352241498, "loss": 4.9598, "mean_token_accuracy": 0.2057456523180008, "num_tokens": 51836595.0, "step": 29880 }, { "entropy": 5.782578039169311, "epoch": 2.3251507488815406, "grad_norm": 1.203125, "learning_rate": 0.00044539823719650463, "loss": 5.024, "mean_token_accuracy": 0.19959788620471955, "num_tokens": 51845415.0, "step": 29885 }, { "entropy": 5.74521689414978, "epoch": 2.3255397782532583, "grad_norm": 1.171875, "learning_rate": 0.0004453801365833376, "loss": 4.9883, "mean_token_accuracy": 0.206538125872612, "num_tokens": 51854091.0, "step": 29890 }, { "entropy": 5.698307847976684, "epoch": 2.3259288076249756, "grad_norm": 1.2421875, "learning_rate": 0.00044536203338492317, "loss": 4.9581, "mean_token_accuracy": 0.20884074717760087, "num_tokens": 51862767.0, "step": 29895 }, { "entropy": 5.678468990325928, "epoch": 2.3263178369966933, "grad_norm": 1.2734375, "learning_rate": 0.00044534392760153596, "loss": 4.8944, "mean_token_accuracy": 0.21100373417139054, "num_tokens": 51871593.0, "step": 29900 }, { "entropy": 5.770551633834839, "epoch": 2.326706866368411, "grad_norm": 1.1640625, "learning_rate": 0.0004453258192334508, "loss": 4.9891, "mean_token_accuracy": 0.20914898365736007, "num_tokens": 51880775.0, "step": 29905 }, { "entropy": 5.70711236000061, "epoch": 2.327095895740128, "grad_norm": 1.2109375, "learning_rate": 0.0004453077082809425, "loss": 4.997, "mean_token_accuracy": 0.20321535021066667, "num_tokens": 51889663.0, "step": 29910 }, { "entropy": 5.745099020004273, "epoch": 2.327484925111846, "grad_norm": 1.2109375, "learning_rate": 0.00044528959474428575, "loss": 5.0082, "mean_token_accuracy": 0.20376275330781937, "num_tokens": 51898565.0, "step": 29915 }, { "entropy": 5.707531881332398, "epoch": 2.3278739544835636, "grad_norm": 1.1796875, "learning_rate": 0.0004452714786237555, "loss": 4.9847, "mean_token_accuracy": 0.20590702146291734, "num_tokens": 51906828.0, "step": 29920 }, { "entropy": 5.7044360637664795, "epoch": 2.3282629838552813, "grad_norm": 1.296875, "learning_rate": 0.0004452533599196265, "loss": 4.943, "mean_token_accuracy": 0.20438348799943923, "num_tokens": 51914305.0, "step": 29925 }, { "entropy": 5.762250661849976, "epoch": 2.3286520132269986, "grad_norm": 1.15625, "learning_rate": 0.00044523523863217374, "loss": 5.0274, "mean_token_accuracy": 0.20471137166023254, "num_tokens": 51923544.0, "step": 29930 }, { "entropy": 5.7381110191345215, "epoch": 2.3290410425987162, "grad_norm": 1.1328125, "learning_rate": 0.0004452171147616723, "loss": 4.9658, "mean_token_accuracy": 0.20559497326612472, "num_tokens": 51932198.0, "step": 29935 }, { "entropy": 5.6668556213378904, "epoch": 2.329430071970434, "grad_norm": 1.2578125, "learning_rate": 0.000445198988308397, "loss": 4.9394, "mean_token_accuracy": 0.21267364919185638, "num_tokens": 51940291.0, "step": 29940 }, { "entropy": 5.664438152313233, "epoch": 2.329819101342151, "grad_norm": 1.21875, "learning_rate": 0.00044518085927262293, "loss": 4.9057, "mean_token_accuracy": 0.2096809044480324, "num_tokens": 51948899.0, "step": 29945 }, { "entropy": 5.714698743820191, "epoch": 2.330208130713869, "grad_norm": 1.1875, "learning_rate": 0.0004451627276546252, "loss": 4.9387, "mean_token_accuracy": 0.20590226948261262, "num_tokens": 51957726.0, "step": 29950 }, { "entropy": 5.767014837265014, "epoch": 2.3305971600855866, "grad_norm": 1.28125, "learning_rate": 0.000445144593454679, "loss": 4.9825, "mean_token_accuracy": 0.20608766078948976, "num_tokens": 51965922.0, "step": 29955 }, { "entropy": 5.720744800567627, "epoch": 2.330986189457304, "grad_norm": 1.296875, "learning_rate": 0.0004451264566730593, "loss": 4.919, "mean_token_accuracy": 0.20810355246067047, "num_tokens": 51974096.0, "step": 29960 }, { "entropy": 5.7252710342407225, "epoch": 2.3313752188290215, "grad_norm": 1.28125, "learning_rate": 0.00044510831731004146, "loss": 4.9941, "mean_token_accuracy": 0.19764285981655122, "num_tokens": 51982954.0, "step": 29965 }, { "entropy": 5.684654808044433, "epoch": 2.3317642482007392, "grad_norm": 1.1953125, "learning_rate": 0.0004450901753659007, "loss": 4.948, "mean_token_accuracy": 0.21018617004156112, "num_tokens": 51991738.0, "step": 29970 }, { "entropy": 5.741859579086304, "epoch": 2.3321532775724565, "grad_norm": 1.296875, "learning_rate": 0.00044507203084091215, "loss": 4.9554, "mean_token_accuracy": 0.20965650528669358, "num_tokens": 52000227.0, "step": 29975 }, { "entropy": 5.8212151527404785, "epoch": 2.332542306944174, "grad_norm": 1.171875, "learning_rate": 0.0004450538837353513, "loss": 5.0956, "mean_token_accuracy": 0.19478950798511505, "num_tokens": 52009336.0, "step": 29980 }, { "entropy": 5.724214744567871, "epoch": 2.332931336315892, "grad_norm": 1.171875, "learning_rate": 0.00044503573404949343, "loss": 5.0147, "mean_token_accuracy": 0.2076914578676224, "num_tokens": 52017850.0, "step": 29985 }, { "entropy": 5.754072856903076, "epoch": 2.3333203656876096, "grad_norm": 1.1953125, "learning_rate": 0.0004450175817836139, "loss": 5.0008, "mean_token_accuracy": 0.2020827680826187, "num_tokens": 52027672.0, "step": 29990 }, { "entropy": 5.74042387008667, "epoch": 2.333709395059327, "grad_norm": 1.203125, "learning_rate": 0.00044499942693798823, "loss": 5.0081, "mean_token_accuracy": 0.19772714972496033, "num_tokens": 52036134.0, "step": 29995 }, { "entropy": 5.726049900054932, "epoch": 2.3340984244310445, "grad_norm": 1.265625, "learning_rate": 0.0004449812695128918, "loss": 4.9945, "mean_token_accuracy": 0.20394964069128035, "num_tokens": 52044719.0, "step": 30000 }, { "epoch": 2.3340984244310445, "eval_entropy": 5.485113825444652, "eval_loss": 5.081615447998047, "eval_mean_token_accuracy": 0.21106990087020844, "eval_num_tokens": 52044719.0, "eval_runtime": 21.6427, "eval_samples_per_second": 1920.185, "eval_steps_per_second": 240.035, "step": 30000 }, { "entropy": 5.730231857299804, "epoch": 2.3344874538027622, "grad_norm": 1.203125, "learning_rate": 0.00044496310950860015, "loss": 5.0483, "mean_token_accuracy": 0.20220550894737244, "num_tokens": 52053238.0, "step": 30005 }, { "entropy": 5.755889797210694, "epoch": 2.3348764831744795, "grad_norm": 1.140625, "learning_rate": 0.00044494494692538886, "loss": 5.0434, "mean_token_accuracy": 0.20430008471012115, "num_tokens": 52062258.0, "step": 30010 }, { "entropy": 5.764511919021606, "epoch": 2.335265512546197, "grad_norm": 1.3203125, "learning_rate": 0.00044492678176353347, "loss": 5.0289, "mean_token_accuracy": 0.20457670837640762, "num_tokens": 52070527.0, "step": 30015 }, { "entropy": 5.70976676940918, "epoch": 2.335654541917915, "grad_norm": 1.1484375, "learning_rate": 0.00044490861402330967, "loss": 5.0517, "mean_token_accuracy": 0.20189506113529204, "num_tokens": 52079827.0, "step": 30020 }, { "entropy": 5.7340700149536135, "epoch": 2.3360435712896326, "grad_norm": 1.2265625, "learning_rate": 0.0004448904437049931, "loss": 5.0021, "mean_token_accuracy": 0.20535786151885987, "num_tokens": 52088963.0, "step": 30025 }, { "entropy": 5.741357040405274, "epoch": 2.33643260066135, "grad_norm": 1.2421875, "learning_rate": 0.0004448722708088594, "loss": 4.9832, "mean_token_accuracy": 0.20150717347860336, "num_tokens": 52096885.0, "step": 30030 }, { "entropy": 5.805893468856811, "epoch": 2.3368216300330675, "grad_norm": 1.1015625, "learning_rate": 0.0004448540953351844, "loss": 4.9904, "mean_token_accuracy": 0.20869221687316894, "num_tokens": 52105530.0, "step": 30035 }, { "entropy": 5.693532180786133, "epoch": 2.3372106594047852, "grad_norm": 1.0859375, "learning_rate": 0.0004448359172842439, "loss": 4.9286, "mean_token_accuracy": 0.2123520165681839, "num_tokens": 52114233.0, "step": 30040 }, { "entropy": 5.7057770729064945, "epoch": 2.3375996887765025, "grad_norm": 1.2109375, "learning_rate": 0.00044481773665631355, "loss": 5.0108, "mean_token_accuracy": 0.20500598400831221, "num_tokens": 52123561.0, "step": 30045 }, { "entropy": 5.681247329711914, "epoch": 2.33798871814822, "grad_norm": 1.328125, "learning_rate": 0.0004447995534516695, "loss": 4.9355, "mean_token_accuracy": 0.2107487216591835, "num_tokens": 52132329.0, "step": 30050 }, { "entropy": 5.747380113601684, "epoch": 2.338377747519938, "grad_norm": 1.1484375, "learning_rate": 0.00044478136767058733, "loss": 4.9879, "mean_token_accuracy": 0.2071058362722397, "num_tokens": 52141019.0, "step": 30055 }, { "entropy": 5.704432106018066, "epoch": 2.338766776891655, "grad_norm": 1.2265625, "learning_rate": 0.0004447631793133432, "loss": 5.0404, "mean_token_accuracy": 0.20373893678188323, "num_tokens": 52149865.0, "step": 30060 }, { "entropy": 5.744853925704956, "epoch": 2.339155806263373, "grad_norm": 1.1875, "learning_rate": 0.0004447449883802131, "loss": 5.04, "mean_token_accuracy": 0.19684580117464065, "num_tokens": 52158991.0, "step": 30065 }, { "entropy": 5.671135187149048, "epoch": 2.3395448356350905, "grad_norm": 1.1875, "learning_rate": 0.00044472679487147295, "loss": 4.9365, "mean_token_accuracy": 0.2057758867740631, "num_tokens": 52167141.0, "step": 30070 }, { "entropy": 5.724252605438233, "epoch": 2.339933865006808, "grad_norm": 1.3828125, "learning_rate": 0.00044470859878739877, "loss": 4.9659, "mean_token_accuracy": 0.20847930908203124, "num_tokens": 52175483.0, "step": 30075 }, { "entropy": 5.707490301132202, "epoch": 2.3403228943785255, "grad_norm": 1.2890625, "learning_rate": 0.00044469040012826676, "loss": 4.9409, "mean_token_accuracy": 0.20540456622838973, "num_tokens": 52184290.0, "step": 30080 }, { "entropy": 5.689335870742798, "epoch": 2.340711923750243, "grad_norm": 1.15625, "learning_rate": 0.00044467219889435304, "loss": 4.9341, "mean_token_accuracy": 0.2038714110851288, "num_tokens": 52193747.0, "step": 30085 }, { "entropy": 5.703516912460327, "epoch": 2.341100953121961, "grad_norm": 1.1953125, "learning_rate": 0.0004446539950859337, "loss": 5.0163, "mean_token_accuracy": 0.20252951830625535, "num_tokens": 52202744.0, "step": 30090 }, { "entropy": 5.707350063323974, "epoch": 2.341489982493678, "grad_norm": 1.25, "learning_rate": 0.00044463578870328506, "loss": 4.9669, "mean_token_accuracy": 0.20770437866449357, "num_tokens": 52211257.0, "step": 30095 }, { "entropy": 5.782588291168213, "epoch": 2.341879011865396, "grad_norm": 1.2265625, "learning_rate": 0.0004446175797466834, "loss": 4.9919, "mean_token_accuracy": 0.2027645528316498, "num_tokens": 52219797.0, "step": 30100 }, { "entropy": 5.767563152313232, "epoch": 2.3422680412371135, "grad_norm": 1.171875, "learning_rate": 0.00044459936821640485, "loss": 5.0886, "mean_token_accuracy": 0.19037699252367019, "num_tokens": 52228157.0, "step": 30105 }, { "entropy": 5.7159055233001705, "epoch": 2.3426570706088308, "grad_norm": 1.328125, "learning_rate": 0.0004445811541127258, "loss": 5.0369, "mean_token_accuracy": 0.20837035179138183, "num_tokens": 52237136.0, "step": 30110 }, { "entropy": 5.740798759460449, "epoch": 2.3430460999805485, "grad_norm": 1.1796875, "learning_rate": 0.00044456293743592274, "loss": 5.0059, "mean_token_accuracy": 0.20688659846782684, "num_tokens": 52245966.0, "step": 30115 }, { "entropy": 5.770652437210083, "epoch": 2.343435129352266, "grad_norm": 1.1953125, "learning_rate": 0.00044454471818627196, "loss": 5.0116, "mean_token_accuracy": 0.19893572628498077, "num_tokens": 52254782.0, "step": 30120 }, { "entropy": 5.763385438919068, "epoch": 2.343824158723984, "grad_norm": 1.28125, "learning_rate": 0.00044452649636404995, "loss": 5.07, "mean_token_accuracy": 0.19890822172164918, "num_tokens": 52264132.0, "step": 30125 }, { "entropy": 5.683999347686767, "epoch": 2.344213188095701, "grad_norm": 1.203125, "learning_rate": 0.0004445082719695332, "loss": 4.8966, "mean_token_accuracy": 0.20838618725538255, "num_tokens": 52272763.0, "step": 30130 }, { "entropy": 5.741971492767334, "epoch": 2.344602217467419, "grad_norm": 1.25, "learning_rate": 0.00044449004500299815, "loss": 5.0382, "mean_token_accuracy": 0.20356519222259523, "num_tokens": 52281505.0, "step": 30135 }, { "entropy": 5.719330930709839, "epoch": 2.3449912468391365, "grad_norm": 1.109375, "learning_rate": 0.00044447181546472146, "loss": 4.8855, "mean_token_accuracy": 0.20684665590524673, "num_tokens": 52289559.0, "step": 30140 }, { "entropy": 5.685330152511597, "epoch": 2.3453802762108538, "grad_norm": 1.15625, "learning_rate": 0.00044445358335497975, "loss": 4.9759, "mean_token_accuracy": 0.20889951139688492, "num_tokens": 52298318.0, "step": 30145 }, { "entropy": 5.6751243591308596, "epoch": 2.3457693055825715, "grad_norm": 1.1640625, "learning_rate": 0.0004444353486740496, "loss": 4.9676, "mean_token_accuracy": 0.20808221846818925, "num_tokens": 52307908.0, "step": 30150 }, { "entropy": 5.774218940734864, "epoch": 2.346158334954289, "grad_norm": 1.2109375, "learning_rate": 0.0004444171114222078, "loss": 4.9951, "mean_token_accuracy": 0.20700594633817673, "num_tokens": 52315879.0, "step": 30155 }, { "entropy": 5.724532747268677, "epoch": 2.346547364326007, "grad_norm": 1.3125, "learning_rate": 0.00044439887159973096, "loss": 5.0082, "mean_token_accuracy": 0.1991189658641815, "num_tokens": 52324747.0, "step": 30160 }, { "entropy": 5.733247995376587, "epoch": 2.346936393697724, "grad_norm": 1.203125, "learning_rate": 0.0004443806292068958, "loss": 5.0066, "mean_token_accuracy": 0.20071657747030258, "num_tokens": 52333655.0, "step": 30165 }, { "entropy": 5.686466407775879, "epoch": 2.347325423069442, "grad_norm": 1.296875, "learning_rate": 0.0004443623842439792, "loss": 5.0348, "mean_token_accuracy": 0.198613478243351, "num_tokens": 52342111.0, "step": 30170 }, { "entropy": 5.711019039154053, "epoch": 2.347714452441159, "grad_norm": 1.21875, "learning_rate": 0.000444344136711258, "loss": 4.9721, "mean_token_accuracy": 0.20846291333436967, "num_tokens": 52351390.0, "step": 30175 }, { "entropy": 5.742067861557007, "epoch": 2.3481034818128768, "grad_norm": 1.28125, "learning_rate": 0.00044432588660900905, "loss": 5.0123, "mean_token_accuracy": 0.20401663482189178, "num_tokens": 52361602.0, "step": 30180 }, { "entropy": 5.761131620407104, "epoch": 2.3484925111845945, "grad_norm": 1.2109375, "learning_rate": 0.0004443076339375093, "loss": 5.0093, "mean_token_accuracy": 0.21114796847105027, "num_tokens": 52370304.0, "step": 30185 }, { "entropy": 5.688096714019776, "epoch": 2.348881540556312, "grad_norm": 1.328125, "learning_rate": 0.00044428937869703575, "loss": 4.8696, "mean_token_accuracy": 0.2130025252699852, "num_tokens": 52378437.0, "step": 30190 }, { "entropy": 5.752493619918823, "epoch": 2.3492705699280294, "grad_norm": 1.1953125, "learning_rate": 0.00044427112088786525, "loss": 4.9833, "mean_token_accuracy": 0.20742824971675872, "num_tokens": 52388413.0, "step": 30195 }, { "entropy": 5.690942811965942, "epoch": 2.349659599299747, "grad_norm": 1.3046875, "learning_rate": 0.0004442528605102749, "loss": 4.9544, "mean_token_accuracy": 0.21171332895755768, "num_tokens": 52396296.0, "step": 30200 }, { "entropy": 5.686701345443725, "epoch": 2.350048628671465, "grad_norm": 1.2265625, "learning_rate": 0.0004442345975645418, "loss": 4.9396, "mean_token_accuracy": 0.20832957476377487, "num_tokens": 52403967.0, "step": 30205 }, { "entropy": 5.685170221328735, "epoch": 2.350437658043182, "grad_norm": 1.203125, "learning_rate": 0.0004442163320509431, "loss": 4.9943, "mean_token_accuracy": 0.21321189999580384, "num_tokens": 52413107.0, "step": 30210 }, { "entropy": 5.7878213882446286, "epoch": 2.3508266874148998, "grad_norm": 1.25, "learning_rate": 0.0004441980639697558, "loss": 4.9667, "mean_token_accuracy": 0.20879411101341247, "num_tokens": 52421029.0, "step": 30215 }, { "entropy": 5.765743064880371, "epoch": 2.3512157167866174, "grad_norm": 1.109375, "learning_rate": 0.0004441797933212573, "loss": 5.0083, "mean_token_accuracy": 0.20232466757297515, "num_tokens": 52430538.0, "step": 30220 }, { "entropy": 5.776279592514038, "epoch": 2.351604746158335, "grad_norm": 1.2265625, "learning_rate": 0.0004441615201057247, "loss": 5.0413, "mean_token_accuracy": 0.19553168267011642, "num_tokens": 52440013.0, "step": 30225 }, { "entropy": 5.788431072235108, "epoch": 2.3519937755300524, "grad_norm": 1.3125, "learning_rate": 0.0004441432443234352, "loss": 5.1365, "mean_token_accuracy": 0.1974329873919487, "num_tokens": 52449034.0, "step": 30230 }, { "entropy": 5.771905851364136, "epoch": 2.35238280490177, "grad_norm": 1.3359375, "learning_rate": 0.00044412496597466626, "loss": 5.0526, "mean_token_accuracy": 0.20038086026906968, "num_tokens": 52457649.0, "step": 30235 }, { "entropy": 5.7094920635223385, "epoch": 2.352771834273488, "grad_norm": 1.1953125, "learning_rate": 0.0004441066850596951, "loss": 4.9171, "mean_token_accuracy": 0.20861826986074447, "num_tokens": 52465861.0, "step": 30240 }, { "entropy": 5.795872783660888, "epoch": 2.353160863645205, "grad_norm": 1.171875, "learning_rate": 0.0004440884015787992, "loss": 5.0447, "mean_token_accuracy": 0.2072172924876213, "num_tokens": 52474630.0, "step": 30245 }, { "entropy": 5.772836112976075, "epoch": 2.3535498930169227, "grad_norm": 1.328125, "learning_rate": 0.0004440701155322558, "loss": 5.084, "mean_token_accuracy": 0.20028264224529266, "num_tokens": 52482759.0, "step": 30250 }, { "entropy": 5.779893827438355, "epoch": 2.3539389223886404, "grad_norm": 1.2890625, "learning_rate": 0.0004440518269203427, "loss": 5.0992, "mean_token_accuracy": 0.19213925004005433, "num_tokens": 52491839.0, "step": 30255 }, { "entropy": 5.741687774658203, "epoch": 2.354327951760358, "grad_norm": 1.2265625, "learning_rate": 0.00044403353574333715, "loss": 4.9324, "mean_token_accuracy": 0.20814654529094695, "num_tokens": 52500688.0, "step": 30260 }, { "entropy": 5.732140731811524, "epoch": 2.3547169811320754, "grad_norm": 1.1484375, "learning_rate": 0.00044401524200151667, "loss": 5.0315, "mean_token_accuracy": 0.20167298913002013, "num_tokens": 52509031.0, "step": 30265 }, { "entropy": 5.716607999801636, "epoch": 2.355106010503793, "grad_norm": 1.1640625, "learning_rate": 0.00044399694569515895, "loss": 4.9718, "mean_token_accuracy": 0.19978254586458205, "num_tokens": 52518337.0, "step": 30270 }, { "entropy": 5.755332660675049, "epoch": 2.355495039875511, "grad_norm": 1.1328125, "learning_rate": 0.00044397864682454156, "loss": 4.9904, "mean_token_accuracy": 0.20657032877206802, "num_tokens": 52527257.0, "step": 30275 }, { "entropy": 5.763963270187378, "epoch": 2.355884069247228, "grad_norm": 1.1953125, "learning_rate": 0.0004439603453899421, "loss": 5.0615, "mean_token_accuracy": 0.20134871900081636, "num_tokens": 52536999.0, "step": 30280 }, { "entropy": 5.774192905426025, "epoch": 2.3562730986189457, "grad_norm": 1.203125, "learning_rate": 0.0004439420413916384, "loss": 5.0662, "mean_token_accuracy": 0.19252280294895172, "num_tokens": 52545975.0, "step": 30285 }, { "entropy": 5.805777502059937, "epoch": 2.3566621279906634, "grad_norm": 1.21875, "learning_rate": 0.00044392373482990817, "loss": 5.0306, "mean_token_accuracy": 0.20294691175222396, "num_tokens": 52554667.0, "step": 30290 }, { "entropy": 5.755733966827393, "epoch": 2.3570511573623807, "grad_norm": 1.140625, "learning_rate": 0.0004439054257050291, "loss": 4.9999, "mean_token_accuracy": 0.2121336743235588, "num_tokens": 52563469.0, "step": 30295 }, { "entropy": 5.664082145690918, "epoch": 2.3574401867340984, "grad_norm": 1.2109375, "learning_rate": 0.0004438871140172789, "loss": 4.9468, "mean_token_accuracy": 0.21007690578699112, "num_tokens": 52572038.0, "step": 30300 }, { "entropy": 5.7204447269439695, "epoch": 2.357829216105816, "grad_norm": 1.375, "learning_rate": 0.0004438687997669357, "loss": 5.014, "mean_token_accuracy": 0.20014785677194596, "num_tokens": 52579642.0, "step": 30305 }, { "entropy": 5.7093226432800295, "epoch": 2.3582182454775333, "grad_norm": 1.2265625, "learning_rate": 0.00044385048295427724, "loss": 4.9329, "mean_token_accuracy": 0.20871184766292572, "num_tokens": 52587425.0, "step": 30310 }, { "entropy": 5.707075023651123, "epoch": 2.358607274849251, "grad_norm": 1.171875, "learning_rate": 0.0004438321635795814, "loss": 4.951, "mean_token_accuracy": 0.2113201156258583, "num_tokens": 52596560.0, "step": 30315 }, { "entropy": 5.799524021148682, "epoch": 2.3589963042209687, "grad_norm": 1.2421875, "learning_rate": 0.0004438138416431262, "loss": 5.0872, "mean_token_accuracy": 0.20104867070913315, "num_tokens": 52604977.0, "step": 30320 }, { "entropy": 5.776003074645996, "epoch": 2.3593853335926864, "grad_norm": 1.1875, "learning_rate": 0.00044379551714518966, "loss": 5.019, "mean_token_accuracy": 0.20619112849235535, "num_tokens": 52614069.0, "step": 30325 }, { "entropy": 5.750258731842041, "epoch": 2.3597743629644037, "grad_norm": 1.2578125, "learning_rate": 0.00044377719008604984, "loss": 5.0262, "mean_token_accuracy": 0.2068758338689804, "num_tokens": 52623065.0, "step": 30330 }, { "entropy": 5.769026756286621, "epoch": 2.3601633923361214, "grad_norm": 1.203125, "learning_rate": 0.0004437588604659848, "loss": 5.0381, "mean_token_accuracy": 0.20404935777187347, "num_tokens": 52632422.0, "step": 30335 }, { "entropy": 5.777815341949463, "epoch": 2.360552421707839, "grad_norm": 1.171875, "learning_rate": 0.0004437405282852726, "loss": 5.0954, "mean_token_accuracy": 0.19611981213092805, "num_tokens": 52641358.0, "step": 30340 }, { "entropy": 5.752602815628052, "epoch": 2.3609414510795563, "grad_norm": 1.2734375, "learning_rate": 0.00044372219354419154, "loss": 4.9703, "mean_token_accuracy": 0.20513907372951506, "num_tokens": 52650011.0, "step": 30345 }, { "entropy": 5.804011869430542, "epoch": 2.361330480451274, "grad_norm": 1.2578125, "learning_rate": 0.0004437038562430197, "loss": 5.0525, "mean_token_accuracy": 0.19754240959882735, "num_tokens": 52658111.0, "step": 30350 }, { "entropy": 5.746442890167236, "epoch": 2.3617195098229917, "grad_norm": 1.2578125, "learning_rate": 0.00044368551638203536, "loss": 4.907, "mean_token_accuracy": 0.21603894531726836, "num_tokens": 52666181.0, "step": 30355 }, { "entropy": 5.70458459854126, "epoch": 2.3621085391947094, "grad_norm": 1.1171875, "learning_rate": 0.0004436671739615168, "loss": 5.0278, "mean_token_accuracy": 0.20600993633270265, "num_tokens": 52675218.0, "step": 30360 }, { "entropy": 5.722906923294067, "epoch": 2.3624975685664267, "grad_norm": 1.0703125, "learning_rate": 0.00044364882898174235, "loss": 5.0673, "mean_token_accuracy": 0.2028121054172516, "num_tokens": 52684254.0, "step": 30365 }, { "entropy": 5.76861801147461, "epoch": 2.3628865979381444, "grad_norm": 1.3046875, "learning_rate": 0.0004436304814429903, "loss": 5.0208, "mean_token_accuracy": 0.19871625304222107, "num_tokens": 52693106.0, "step": 30370 }, { "entropy": 5.794282293319702, "epoch": 2.363275627309862, "grad_norm": 1.171875, "learning_rate": 0.0004436121313455391, "loss": 5.0428, "mean_token_accuracy": 0.19950013011693954, "num_tokens": 52702260.0, "step": 30375 }, { "entropy": 5.759212684631348, "epoch": 2.3636646566815793, "grad_norm": 1.359375, "learning_rate": 0.0004435937786896673, "loss": 5.0115, "mean_token_accuracy": 0.20813346803188323, "num_tokens": 52710546.0, "step": 30380 }, { "entropy": 5.664081382751465, "epoch": 2.364053686053297, "grad_norm": 1.1953125, "learning_rate": 0.00044357542347565323, "loss": 5.0164, "mean_token_accuracy": 0.20363387316465378, "num_tokens": 52719197.0, "step": 30385 }, { "entropy": 5.837940692901611, "epoch": 2.3644427154250147, "grad_norm": 1.25, "learning_rate": 0.0004435570657037753, "loss": 5.1217, "mean_token_accuracy": 0.1986718848347664, "num_tokens": 52728242.0, "step": 30390 }, { "entropy": 5.725397253036499, "epoch": 2.364831744796732, "grad_norm": 1.203125, "learning_rate": 0.0004435387053743123, "loss": 4.9105, "mean_token_accuracy": 0.2097751960158348, "num_tokens": 52736943.0, "step": 30395 }, { "entropy": 5.669610118865966, "epoch": 2.3652207741684497, "grad_norm": 1.3046875, "learning_rate": 0.00044352034248754265, "loss": 4.956, "mean_token_accuracy": 0.21170894652605057, "num_tokens": 52744893.0, "step": 30400 }, { "entropy": 5.635525035858154, "epoch": 2.3656098035401674, "grad_norm": 1.171875, "learning_rate": 0.000443501977043745, "loss": 4.8753, "mean_token_accuracy": 0.21222026497125626, "num_tokens": 52753492.0, "step": 30405 }, { "entropy": 5.760714197158814, "epoch": 2.3659988329118846, "grad_norm": 1.265625, "learning_rate": 0.0004434836090431981, "loss": 5.0052, "mean_token_accuracy": 0.2014874905347824, "num_tokens": 52762598.0, "step": 30410 }, { "entropy": 5.70653600692749, "epoch": 2.3663878622836023, "grad_norm": 1.25, "learning_rate": 0.0004434652384861806, "loss": 5.0386, "mean_token_accuracy": 0.20415837168693543, "num_tokens": 52770942.0, "step": 30415 }, { "entropy": 5.747300529479981, "epoch": 2.36677689165532, "grad_norm": 1.1796875, "learning_rate": 0.0004434468653729712, "loss": 4.9821, "mean_token_accuracy": 0.2032642111182213, "num_tokens": 52779237.0, "step": 30420 }, { "entropy": 5.774164152145386, "epoch": 2.3671659210270377, "grad_norm": 1.1875, "learning_rate": 0.00044342848970384876, "loss": 5.0511, "mean_token_accuracy": 0.19744522571563722, "num_tokens": 52787721.0, "step": 30425 }, { "entropy": 5.781344842910767, "epoch": 2.367554950398755, "grad_norm": 1.3203125, "learning_rate": 0.00044341011147909206, "loss": 5.007, "mean_token_accuracy": 0.20270038545131683, "num_tokens": 52795765.0, "step": 30430 }, { "entropy": 5.683582496643067, "epoch": 2.3679439797704727, "grad_norm": 1.203125, "learning_rate": 0.00044339173069897996, "loss": 4.9193, "mean_token_accuracy": 0.2117093250155449, "num_tokens": 52804104.0, "step": 30435 }, { "entropy": 5.68350772857666, "epoch": 2.3683330091421904, "grad_norm": 1.234375, "learning_rate": 0.00044337334736379143, "loss": 4.9472, "mean_token_accuracy": 0.20307990908622742, "num_tokens": 52812817.0, "step": 30440 }, { "entropy": 5.68878402709961, "epoch": 2.3687220385139076, "grad_norm": 1.3515625, "learning_rate": 0.0004433549614738053, "loss": 4.9583, "mean_token_accuracy": 0.20704864859580993, "num_tokens": 52821924.0, "step": 30445 }, { "entropy": 5.7439206600189205, "epoch": 2.3691110678856253, "grad_norm": 1.109375, "learning_rate": 0.00044333657302930056, "loss": 4.9407, "mean_token_accuracy": 0.21496936231851577, "num_tokens": 52830943.0, "step": 30450 }, { "entropy": 5.7390539169311525, "epoch": 2.369500097257343, "grad_norm": 1.15625, "learning_rate": 0.0004433181820305564, "loss": 5.063, "mean_token_accuracy": 0.2065854251384735, "num_tokens": 52839697.0, "step": 30455 }, { "entropy": 5.73288049697876, "epoch": 2.3698891266290607, "grad_norm": 1.1171875, "learning_rate": 0.00044329978847785156, "loss": 5.0313, "mean_token_accuracy": 0.19832108914852142, "num_tokens": 52848713.0, "step": 30460 }, { "entropy": 5.844886350631714, "epoch": 2.370278156000778, "grad_norm": 1.25, "learning_rate": 0.0004432813923714654, "loss": 5.0961, "mean_token_accuracy": 0.1919212132692337, "num_tokens": 52856852.0, "step": 30465 }, { "entropy": 5.715063190460205, "epoch": 2.3706671853724957, "grad_norm": 1.2421875, "learning_rate": 0.00044326299371167695, "loss": 4.9321, "mean_token_accuracy": 0.2084295392036438, "num_tokens": 52865235.0, "step": 30470 }, { "entropy": 5.748228549957275, "epoch": 2.3710562147442134, "grad_norm": 1.2265625, "learning_rate": 0.00044324459249876536, "loss": 4.9341, "mean_token_accuracy": 0.20734256356954575, "num_tokens": 52873454.0, "step": 30475 }, { "entropy": 5.716871500015259, "epoch": 2.3714452441159306, "grad_norm": 1.3203125, "learning_rate": 0.0004432261887330099, "loss": 4.9796, "mean_token_accuracy": 0.210710708796978, "num_tokens": 52882551.0, "step": 30480 }, { "entropy": 5.7935709953308105, "epoch": 2.3718342734876483, "grad_norm": 1.2265625, "learning_rate": 0.0004432077824146898, "loss": 5.045, "mean_token_accuracy": 0.19619593322277068, "num_tokens": 52891145.0, "step": 30485 }, { "entropy": 5.770518255233765, "epoch": 2.372223302859366, "grad_norm": 1.203125, "learning_rate": 0.0004431893735440843, "loss": 5.0, "mean_token_accuracy": 0.196412356197834, "num_tokens": 52899486.0, "step": 30490 }, { "entropy": 5.695523595809936, "epoch": 2.3726123322310833, "grad_norm": 1.1796875, "learning_rate": 0.0004431709621214727, "loss": 4.986, "mean_token_accuracy": 0.20175232738256454, "num_tokens": 52907896.0, "step": 30495 }, { "entropy": 5.704916524887085, "epoch": 2.373001361602801, "grad_norm": 1.1953125, "learning_rate": 0.00044315254814713455, "loss": 4.9916, "mean_token_accuracy": 0.20173268169164657, "num_tokens": 52916489.0, "step": 30500 }, { "entropy": 5.742334461212158, "epoch": 2.3733903909745186, "grad_norm": 1.1796875, "learning_rate": 0.00044313413162134894, "loss": 5.0152, "mean_token_accuracy": 0.2031744346022606, "num_tokens": 52924559.0, "step": 30505 }, { "entropy": 5.740375137329101, "epoch": 2.373779420346236, "grad_norm": 1.2109375, "learning_rate": 0.0004431157125443958, "loss": 5.0519, "mean_token_accuracy": 0.20284222513437272, "num_tokens": 52934064.0, "step": 30510 }, { "entropy": 5.757227277755737, "epoch": 2.3741684497179536, "grad_norm": 1.25, "learning_rate": 0.000443097290916554, "loss": 5.0104, "mean_token_accuracy": 0.20499978959560394, "num_tokens": 52943283.0, "step": 30515 }, { "entropy": 5.709242486953736, "epoch": 2.3745574790896713, "grad_norm": 1.21875, "learning_rate": 0.0004430788667381035, "loss": 4.9045, "mean_token_accuracy": 0.21229366213083267, "num_tokens": 52951694.0, "step": 30520 }, { "entropy": 5.739170932769776, "epoch": 2.374946508461389, "grad_norm": 1.2421875, "learning_rate": 0.00044306044000932374, "loss": 5.0198, "mean_token_accuracy": 0.19908483624458312, "num_tokens": 52959850.0, "step": 30525 }, { "entropy": 5.803647422790528, "epoch": 2.3753355378331062, "grad_norm": 1.234375, "learning_rate": 0.0004430420107304943, "loss": 5.1635, "mean_token_accuracy": 0.19567000716924668, "num_tokens": 52969378.0, "step": 30530 }, { "entropy": 5.772091484069824, "epoch": 2.375724567204824, "grad_norm": 1.3671875, "learning_rate": 0.00044302357890189475, "loss": 5.0154, "mean_token_accuracy": 0.21185450851917267, "num_tokens": 52977178.0, "step": 30535 }, { "entropy": 5.813728094100952, "epoch": 2.3761135965765416, "grad_norm": 1.6640625, "learning_rate": 0.0004430051445238049, "loss": 5.0389, "mean_token_accuracy": 0.20136389434337615, "num_tokens": 52986035.0, "step": 30540 }, { "entropy": 5.709472703933716, "epoch": 2.376502625948259, "grad_norm": 1.2578125, "learning_rate": 0.00044298670759650426, "loss": 5.0506, "mean_token_accuracy": 0.20140443742275238, "num_tokens": 52995399.0, "step": 30545 }, { "entropy": 5.755706453323365, "epoch": 2.3768916553199766, "grad_norm": 1.1796875, "learning_rate": 0.0004429682681202728, "loss": 4.9912, "mean_token_accuracy": 0.20847638547420502, "num_tokens": 53004500.0, "step": 30550 }, { "entropy": 5.822487306594849, "epoch": 2.3772806846916943, "grad_norm": 1.1875, "learning_rate": 0.00044294982609539027, "loss": 5.1016, "mean_token_accuracy": 0.20143768489360808, "num_tokens": 53014161.0, "step": 30555 }, { "entropy": 5.693950366973877, "epoch": 2.377669714063412, "grad_norm": 1.296875, "learning_rate": 0.0004429313815221363, "loss": 4.8739, "mean_token_accuracy": 0.21416620016098023, "num_tokens": 53022560.0, "step": 30560 }, { "entropy": 5.737769937515258, "epoch": 2.3780587434351292, "grad_norm": 1.171875, "learning_rate": 0.00044291293440079107, "loss": 5.0289, "mean_token_accuracy": 0.20435957461595536, "num_tokens": 53031194.0, "step": 30565 }, { "entropy": 5.735292530059814, "epoch": 2.378447772806847, "grad_norm": 1.2578125, "learning_rate": 0.0004428944847316342, "loss": 5.0421, "mean_token_accuracy": 0.20446851551532746, "num_tokens": 53039512.0, "step": 30570 }, { "entropy": 5.790896081924439, "epoch": 2.3788368021785646, "grad_norm": 1.1875, "learning_rate": 0.0004428760325149458, "loss": 5.0248, "mean_token_accuracy": 0.2068217396736145, "num_tokens": 53048579.0, "step": 30575 }, { "entropy": 5.820733880996704, "epoch": 2.379225831550282, "grad_norm": 1.2421875, "learning_rate": 0.00044285757775100584, "loss": 5.14, "mean_token_accuracy": 0.1972361534833908, "num_tokens": 53057770.0, "step": 30580 }, { "entropy": 5.7189453601837155, "epoch": 2.3796148609219996, "grad_norm": 1.109375, "learning_rate": 0.00044283912044009436, "loss": 5.0124, "mean_token_accuracy": 0.2032826766371727, "num_tokens": 53067127.0, "step": 30585 }, { "entropy": 5.792666721343994, "epoch": 2.3800038902937173, "grad_norm": 1.15625, "learning_rate": 0.00044282066058249123, "loss": 4.9823, "mean_token_accuracy": 0.20830806344747543, "num_tokens": 53076351.0, "step": 30590 }, { "entropy": 5.776123332977295, "epoch": 2.380392919665435, "grad_norm": 1.1484375, "learning_rate": 0.0004428021981784768, "loss": 5.034, "mean_token_accuracy": 0.20373939722776413, "num_tokens": 53085472.0, "step": 30595 }, { "entropy": 5.73580641746521, "epoch": 2.3807819490371522, "grad_norm": 1.265625, "learning_rate": 0.00044278373322833106, "loss": 4.959, "mean_token_accuracy": 0.2072167068719864, "num_tokens": 53094181.0, "step": 30600 }, { "entropy": 5.705240201950073, "epoch": 2.38117097840887, "grad_norm": 1.1796875, "learning_rate": 0.00044276526573233416, "loss": 5.0479, "mean_token_accuracy": 0.19591701924800872, "num_tokens": 53103421.0, "step": 30605 }, { "entropy": 5.766218090057373, "epoch": 2.381560007780587, "grad_norm": 1.1953125, "learning_rate": 0.0004427467956907664, "loss": 4.9732, "mean_token_accuracy": 0.20815358310937881, "num_tokens": 53112058.0, "step": 30610 }, { "entropy": 5.792999029159546, "epoch": 2.381949037152305, "grad_norm": 1.3984375, "learning_rate": 0.00044272832310390814, "loss": 5.0503, "mean_token_accuracy": 0.20328713655471803, "num_tokens": 53119755.0, "step": 30615 }, { "entropy": 5.642931079864502, "epoch": 2.3823380665240226, "grad_norm": 1.25, "learning_rate": 0.0004427098479720394, "loss": 4.9444, "mean_token_accuracy": 0.21384665220975876, "num_tokens": 53128529.0, "step": 30620 }, { "entropy": 5.7326866626739506, "epoch": 2.3827270958957403, "grad_norm": 1.203125, "learning_rate": 0.00044269137029544073, "loss": 4.9411, "mean_token_accuracy": 0.21244428008794786, "num_tokens": 53137594.0, "step": 30625 }, { "entropy": 5.82869176864624, "epoch": 2.3831161252674575, "grad_norm": 1.2265625, "learning_rate": 0.0004426728900743924, "loss": 5.0179, "mean_token_accuracy": 0.19769106209278106, "num_tokens": 53146521.0, "step": 30630 }, { "entropy": 5.752753734588623, "epoch": 2.3835051546391752, "grad_norm": 1.234375, "learning_rate": 0.00044265440730917484, "loss": 4.9845, "mean_token_accuracy": 0.21093598306179046, "num_tokens": 53154832.0, "step": 30635 }, { "entropy": 5.728213930130005, "epoch": 2.383894184010893, "grad_norm": 1.1484375, "learning_rate": 0.00044263592200006845, "loss": 5.0589, "mean_token_accuracy": 0.2018907830119133, "num_tokens": 53163889.0, "step": 30640 }, { "entropy": 5.729156875610352, "epoch": 2.38428321338261, "grad_norm": 1.265625, "learning_rate": 0.00044261743414735383, "loss": 5.0119, "mean_token_accuracy": 0.2039561614394188, "num_tokens": 53172688.0, "step": 30645 }, { "entropy": 5.796695184707642, "epoch": 2.384672242754328, "grad_norm": 1.25, "learning_rate": 0.0004425989437513114, "loss": 4.9963, "mean_token_accuracy": 0.19968696385622026, "num_tokens": 53180742.0, "step": 30650 }, { "entropy": 5.702871942520142, "epoch": 2.3850612721260456, "grad_norm": 1.25, "learning_rate": 0.0004425804508122218, "loss": 4.9739, "mean_token_accuracy": 0.21033537536859512, "num_tokens": 53188716.0, "step": 30655 }, { "entropy": 5.811306953430176, "epoch": 2.3854503014977633, "grad_norm": 1.140625, "learning_rate": 0.00044256195533036566, "loss": 5.1091, "mean_token_accuracy": 0.19327108711004257, "num_tokens": 53197420.0, "step": 30660 }, { "entropy": 5.762665414810181, "epoch": 2.3858393308694805, "grad_norm": 1.1640625, "learning_rate": 0.00044254345730602345, "loss": 5.021, "mean_token_accuracy": 0.2021334320306778, "num_tokens": 53205927.0, "step": 30665 }, { "entropy": 5.772464609146118, "epoch": 2.386228360241198, "grad_norm": 1.2890625, "learning_rate": 0.0004425249567394759, "loss": 4.9792, "mean_token_accuracy": 0.20600952059030533, "num_tokens": 53214793.0, "step": 30670 }, { "entropy": 5.752489042282105, "epoch": 2.386617389612916, "grad_norm": 1.21875, "learning_rate": 0.00044250645363100386, "loss": 4.9737, "mean_token_accuracy": 0.20647225081920623, "num_tokens": 53223429.0, "step": 30675 }, { "entropy": 5.741060638427735, "epoch": 2.387006418984633, "grad_norm": 1.2578125, "learning_rate": 0.00044248794798088805, "loss": 4.8766, "mean_token_accuracy": 0.21601116806268691, "num_tokens": 53231697.0, "step": 30680 }, { "entropy": 5.787207794189453, "epoch": 2.387395448356351, "grad_norm": 1.2734375, "learning_rate": 0.0004424694397894091, "loss": 5.0133, "mean_token_accuracy": 0.2037672594189644, "num_tokens": 53239318.0, "step": 30685 }, { "entropy": 5.757215976715088, "epoch": 2.3877844777280686, "grad_norm": 1.1875, "learning_rate": 0.00044245092905684794, "loss": 5.0923, "mean_token_accuracy": 0.19857320189476013, "num_tokens": 53248079.0, "step": 30690 }, { "entropy": 5.762946271896363, "epoch": 2.3881735070997863, "grad_norm": 1.1484375, "learning_rate": 0.00044243241578348553, "loss": 5.0488, "mean_token_accuracy": 0.1989555060863495, "num_tokens": 53256856.0, "step": 30695 }, { "entropy": 5.792494916915894, "epoch": 2.3885625364715035, "grad_norm": 1.171875, "learning_rate": 0.0004424138999696027, "loss": 5.0671, "mean_token_accuracy": 0.19989698827266694, "num_tokens": 53265810.0, "step": 30700 }, { "entropy": 5.827932357788086, "epoch": 2.388951565843221, "grad_norm": 1.28125, "learning_rate": 0.0004423953816154804, "loss": 5.0587, "mean_token_accuracy": 0.20383265018463134, "num_tokens": 53274485.0, "step": 30705 }, { "entropy": 5.771138143539429, "epoch": 2.389340595214939, "grad_norm": 1.3828125, "learning_rate": 0.00044237686072139967, "loss": 4.9374, "mean_token_accuracy": 0.20443988889455794, "num_tokens": 53282322.0, "step": 30710 }, { "entropy": 5.79857816696167, "epoch": 2.389729624586656, "grad_norm": 1.1796875, "learning_rate": 0.0004423583372876414, "loss": 5.0335, "mean_token_accuracy": 0.2043583109974861, "num_tokens": 53291868.0, "step": 30715 }, { "entropy": 5.733408451080322, "epoch": 2.390118653958374, "grad_norm": 1.3359375, "learning_rate": 0.00044233981131448677, "loss": 4.9341, "mean_token_accuracy": 0.21419957280158997, "num_tokens": 53300654.0, "step": 30720 }, { "entropy": 5.70671124458313, "epoch": 2.3905076833300916, "grad_norm": 1.2578125, "learning_rate": 0.00044232128280221683, "loss": 4.8393, "mean_token_accuracy": 0.21562927663326265, "num_tokens": 53309178.0, "step": 30725 }, { "entropy": 5.737383270263672, "epoch": 2.390896712701809, "grad_norm": 1.21875, "learning_rate": 0.0004423027517511128, "loss": 5.0262, "mean_token_accuracy": 0.1998502254486084, "num_tokens": 53317536.0, "step": 30730 }, { "entropy": 5.730509662628174, "epoch": 2.3912857420735265, "grad_norm": 1.3046875, "learning_rate": 0.00044228421816145573, "loss": 5.0006, "mean_token_accuracy": 0.2007122352719307, "num_tokens": 53325942.0, "step": 30735 }, { "entropy": 5.732168245315552, "epoch": 2.391674771445244, "grad_norm": 1.171875, "learning_rate": 0.00044226568203352694, "loss": 4.9936, "mean_token_accuracy": 0.205831778049469, "num_tokens": 53335124.0, "step": 30740 }, { "entropy": 5.749680995941162, "epoch": 2.3920638008169615, "grad_norm": 1.15625, "learning_rate": 0.00044224714336760766, "loss": 5.0793, "mean_token_accuracy": 0.20469998717308044, "num_tokens": 53344222.0, "step": 30745 }, { "entropy": 5.737440967559815, "epoch": 2.392452830188679, "grad_norm": 1.2578125, "learning_rate": 0.0004422286021639792, "loss": 4.9954, "mean_token_accuracy": 0.20277657210826874, "num_tokens": 53352639.0, "step": 30750 }, { "entropy": 5.756830215454102, "epoch": 2.392841859560397, "grad_norm": 1.2578125, "learning_rate": 0.0004422100584229228, "loss": 4.9983, "mean_token_accuracy": 0.20646135061979293, "num_tokens": 53361357.0, "step": 30755 }, { "entropy": 5.794086933135986, "epoch": 2.3932308889321146, "grad_norm": 1.3515625, "learning_rate": 0.00044219151214472, "loss": 5.0185, "mean_token_accuracy": 0.2117227792739868, "num_tokens": 53369680.0, "step": 30760 }, { "entropy": 5.74252347946167, "epoch": 2.393619918303832, "grad_norm": 1.3203125, "learning_rate": 0.0004421729633296521, "loss": 4.9986, "mean_token_accuracy": 0.2038286119699478, "num_tokens": 53378619.0, "step": 30765 }, { "entropy": 5.723381185531617, "epoch": 2.3940089476755495, "grad_norm": 1.1875, "learning_rate": 0.00044215441197800054, "loss": 4.9878, "mean_token_accuracy": 0.2036074861884117, "num_tokens": 53387630.0, "step": 30770 }, { "entropy": 5.762703514099121, "epoch": 2.394397977047267, "grad_norm": 1.171875, "learning_rate": 0.00044213585809004685, "loss": 4.9987, "mean_token_accuracy": 0.19673932939767838, "num_tokens": 53396696.0, "step": 30775 }, { "entropy": 5.799515295028686, "epoch": 2.3947870064189845, "grad_norm": 1.3046875, "learning_rate": 0.0004421173016660725, "loss": 5.0138, "mean_token_accuracy": 0.20214379578828812, "num_tokens": 53405097.0, "step": 30780 }, { "entropy": 5.6947455406188965, "epoch": 2.395176035790702, "grad_norm": 1.140625, "learning_rate": 0.0004420987427063592, "loss": 4.9708, "mean_token_accuracy": 0.2013086885213852, "num_tokens": 53413670.0, "step": 30785 }, { "entropy": 5.7160943984985355, "epoch": 2.39556506516242, "grad_norm": 1.265625, "learning_rate": 0.00044208018121118833, "loss": 5.0827, "mean_token_accuracy": 0.19391552805900575, "num_tokens": 53422370.0, "step": 30790 }, { "entropy": 5.792573642730713, "epoch": 2.3959540945341375, "grad_norm": 1.234375, "learning_rate": 0.00044206161718084164, "loss": 5.086, "mean_token_accuracy": 0.1956275537610054, "num_tokens": 53431607.0, "step": 30795 }, { "entropy": 5.752659749984741, "epoch": 2.396343123905855, "grad_norm": 1.359375, "learning_rate": 0.0004420430506156009, "loss": 4.8988, "mean_token_accuracy": 0.21708032637834548, "num_tokens": 53440042.0, "step": 30800 }, { "entropy": 5.694740295410156, "epoch": 2.3967321532775725, "grad_norm": 1.359375, "learning_rate": 0.00044202448151574764, "loss": 4.9978, "mean_token_accuracy": 0.20830352753400802, "num_tokens": 53448780.0, "step": 30805 }, { "entropy": 5.774925899505615, "epoch": 2.39712118264929, "grad_norm": 1.1796875, "learning_rate": 0.0004420059098815638, "loss": 5.099, "mean_token_accuracy": 0.19672624468803407, "num_tokens": 53457598.0, "step": 30810 }, { "entropy": 5.804679822921753, "epoch": 2.3975102120210074, "grad_norm": 1.21875, "learning_rate": 0.0004419873357133311, "loss": 5.0927, "mean_token_accuracy": 0.2033015638589859, "num_tokens": 53466387.0, "step": 30815 }, { "entropy": 5.769283628463745, "epoch": 2.397899241392725, "grad_norm": 1.203125, "learning_rate": 0.0004419687590113313, "loss": 5.0465, "mean_token_accuracy": 0.20034196376800537, "num_tokens": 53475032.0, "step": 30820 }, { "entropy": 5.775168466567993, "epoch": 2.398288270764443, "grad_norm": 1.25, "learning_rate": 0.00044195017977584637, "loss": 5.0477, "mean_token_accuracy": 0.20598347634077072, "num_tokens": 53483142.0, "step": 30825 }, { "entropy": 5.803859758377075, "epoch": 2.39867730013616, "grad_norm": 1.234375, "learning_rate": 0.00044193159800715823, "loss": 5.1145, "mean_token_accuracy": 0.20330944061279296, "num_tokens": 53492820.0, "step": 30830 }, { "entropy": 5.777610111236572, "epoch": 2.399066329507878, "grad_norm": 1.1640625, "learning_rate": 0.00044191301370554874, "loss": 5.0296, "mean_token_accuracy": 0.20308308452367782, "num_tokens": 53502018.0, "step": 30835 }, { "entropy": 5.759009170532226, "epoch": 2.3994553588795955, "grad_norm": 1.265625, "learning_rate": 0.00044189442687129994, "loss": 4.9658, "mean_token_accuracy": 0.20476564019918442, "num_tokens": 53510287.0, "step": 30840 }, { "entropy": 5.732327318191528, "epoch": 2.3998443882513127, "grad_norm": 1.2890625, "learning_rate": 0.0004418758375046939, "loss": 4.9997, "mean_token_accuracy": 0.19870276004076004, "num_tokens": 53519042.0, "step": 30845 }, { "entropy": 5.818260145187378, "epoch": 2.4002334176230304, "grad_norm": 1.265625, "learning_rate": 0.00044185724560601267, "loss": 5.0009, "mean_token_accuracy": 0.20580644756555558, "num_tokens": 53527678.0, "step": 30850 }, { "entropy": 5.813451051712036, "epoch": 2.400622446994748, "grad_norm": 1.171875, "learning_rate": 0.0004418386511755382, "loss": 5.0498, "mean_token_accuracy": 0.19405657649040223, "num_tokens": 53536371.0, "step": 30855 }, { "entropy": 5.733941507339478, "epoch": 2.401011476366466, "grad_norm": 1.1640625, "learning_rate": 0.0004418200542135528, "loss": 5.0607, "mean_token_accuracy": 0.20138001292943955, "num_tokens": 53545534.0, "step": 30860 }, { "entropy": 5.735194826126099, "epoch": 2.401400505738183, "grad_norm": 1.265625, "learning_rate": 0.0004418014547203386, "loss": 4.9678, "mean_token_accuracy": 0.20785641372203828, "num_tokens": 53554904.0, "step": 30865 }, { "entropy": 5.807973337173462, "epoch": 2.401789535109901, "grad_norm": 1.21875, "learning_rate": 0.0004417828526961778, "loss": 5.008, "mean_token_accuracy": 0.2054468497633934, "num_tokens": 53563359.0, "step": 30870 }, { "entropy": 5.743387937545776, "epoch": 2.4021785644816185, "grad_norm": 1.5, "learning_rate": 0.00044176424814135266, "loss": 5.0915, "mean_token_accuracy": 0.20372617542743682, "num_tokens": 53573428.0, "step": 30875 }, { "entropy": 5.784433507919312, "epoch": 2.4025675938533357, "grad_norm": 1.1953125, "learning_rate": 0.0004417456410561455, "loss": 5.0854, "mean_token_accuracy": 0.1971151813864708, "num_tokens": 53581719.0, "step": 30880 }, { "entropy": 5.809368228912353, "epoch": 2.4029566232250534, "grad_norm": 1.15625, "learning_rate": 0.0004417270314408387, "loss": 5.129, "mean_token_accuracy": 0.19603049904108047, "num_tokens": 53589715.0, "step": 30885 }, { "entropy": 5.7506828784942625, "epoch": 2.403345652596771, "grad_norm": 1.1953125, "learning_rate": 0.00044170841929571454, "loss": 5.0026, "mean_token_accuracy": 0.20411199778318406, "num_tokens": 53598273.0, "step": 30890 }, { "entropy": 5.766194534301758, "epoch": 2.403734681968489, "grad_norm": 1.203125, "learning_rate": 0.00044168980462105543, "loss": 5.0286, "mean_token_accuracy": 0.20072245746850967, "num_tokens": 53607824.0, "step": 30895 }, { "entropy": 5.767139101028443, "epoch": 2.404123711340206, "grad_norm": 1.1328125, "learning_rate": 0.0004416711874171439, "loss": 4.9619, "mean_token_accuracy": 0.2064263105392456, "num_tokens": 53616734.0, "step": 30900 }, { "entropy": 5.741784954071045, "epoch": 2.404512740711924, "grad_norm": 1.2578125, "learning_rate": 0.0004416525676842624, "loss": 4.9908, "mean_token_accuracy": 0.20714612156152726, "num_tokens": 53625877.0, "step": 30905 }, { "entropy": 5.770332956314087, "epoch": 2.4049017700836415, "grad_norm": 1.203125, "learning_rate": 0.0004416339454226933, "loss": 5.054, "mean_token_accuracy": 0.20587658435106276, "num_tokens": 53634872.0, "step": 30910 }, { "entropy": 5.725870943069458, "epoch": 2.4052907994553587, "grad_norm": 1.28125, "learning_rate": 0.0004416153206327194, "loss": 4.9877, "mean_token_accuracy": 0.20971613377332687, "num_tokens": 53643916.0, "step": 30915 }, { "entropy": 5.722827577590943, "epoch": 2.4056798288270764, "grad_norm": 1.203125, "learning_rate": 0.00044159669331462326, "loss": 5.0212, "mean_token_accuracy": 0.2008420631289482, "num_tokens": 53652496.0, "step": 30920 }, { "entropy": 5.71380033493042, "epoch": 2.406068858198794, "grad_norm": 1.265625, "learning_rate": 0.00044157806346868737, "loss": 4.9827, "mean_token_accuracy": 0.20694566667079925, "num_tokens": 53661191.0, "step": 30925 }, { "entropy": 5.754685735702514, "epoch": 2.406457887570512, "grad_norm": 1.2734375, "learning_rate": 0.00044155943109519454, "loss": 5.0168, "mean_token_accuracy": 0.20084999948740007, "num_tokens": 53669520.0, "step": 30930 }, { "entropy": 5.764369535446167, "epoch": 2.406846916942229, "grad_norm": 1.1484375, "learning_rate": 0.0004415407961944274, "loss": 5.0288, "mean_token_accuracy": 0.20243485122919083, "num_tokens": 53678398.0, "step": 30935 }, { "entropy": 5.753860664367676, "epoch": 2.4072359463139468, "grad_norm": 1.1875, "learning_rate": 0.00044152215876666883, "loss": 5.0459, "mean_token_accuracy": 0.2029173880815506, "num_tokens": 53687870.0, "step": 30940 }, { "entropy": 5.827104091644287, "epoch": 2.407624975685664, "grad_norm": 1.1796875, "learning_rate": 0.0004415035188122016, "loss": 5.0085, "mean_token_accuracy": 0.20591508001089096, "num_tokens": 53697335.0, "step": 30945 }, { "entropy": 5.684218549728394, "epoch": 2.4080140050573817, "grad_norm": 1.265625, "learning_rate": 0.00044148487633130837, "loss": 4.9132, "mean_token_accuracy": 0.20648579597473143, "num_tokens": 53705457.0, "step": 30950 }, { "entropy": 5.68250527381897, "epoch": 2.4084030344290994, "grad_norm": 1.1875, "learning_rate": 0.00044146623132427213, "loss": 4.8394, "mean_token_accuracy": 0.2154872477054596, "num_tokens": 53714092.0, "step": 30955 }, { "entropy": 5.748840093612671, "epoch": 2.408792063800817, "grad_norm": 1.0625, "learning_rate": 0.00044144758379137584, "loss": 5.0216, "mean_token_accuracy": 0.20288541316986083, "num_tokens": 53722972.0, "step": 30960 }, { "entropy": 5.762690925598145, "epoch": 2.4091810931725344, "grad_norm": 1.2109375, "learning_rate": 0.00044142893373290236, "loss": 4.9568, "mean_token_accuracy": 0.20952513664960862, "num_tokens": 53730842.0, "step": 30965 }, { "entropy": 5.778192853927612, "epoch": 2.409570122544252, "grad_norm": 1.2109375, "learning_rate": 0.0004414102811491348, "loss": 5.0351, "mean_token_accuracy": 0.20045557171106337, "num_tokens": 53740241.0, "step": 30970 }, { "entropy": 5.693689203262329, "epoch": 2.4099591519159698, "grad_norm": 1.1171875, "learning_rate": 0.00044139162604035597, "loss": 4.9602, "mean_token_accuracy": 0.20526500344276427, "num_tokens": 53749653.0, "step": 30975 }, { "entropy": 5.749517774581909, "epoch": 2.410348181287687, "grad_norm": 1.203125, "learning_rate": 0.00044137296840684917, "loss": 4.9706, "mean_token_accuracy": 0.2130556657910347, "num_tokens": 53758161.0, "step": 30980 }, { "entropy": 5.740653800964355, "epoch": 2.4107372106594047, "grad_norm": 1.203125, "learning_rate": 0.0004413543082488973, "loss": 4.8745, "mean_token_accuracy": 0.2261263757944107, "num_tokens": 53766345.0, "step": 30985 }, { "entropy": 5.707566356658935, "epoch": 2.4111262400311224, "grad_norm": 1.2421875, "learning_rate": 0.0004413356455667836, "loss": 4.9267, "mean_token_accuracy": 0.21193260997533797, "num_tokens": 53774725.0, "step": 30990 }, { "entropy": 5.6797408103942875, "epoch": 2.41151526940284, "grad_norm": 1.1484375, "learning_rate": 0.0004413169803607913, "loss": 4.9629, "mean_token_accuracy": 0.20364972203969955, "num_tokens": 53783386.0, "step": 30995 }, { "entropy": 5.7507082462310795, "epoch": 2.4119042987745574, "grad_norm": 1.2734375, "learning_rate": 0.00044129831263120344, "loss": 4.9594, "mean_token_accuracy": 0.20621503591537477, "num_tokens": 53791167.0, "step": 31000 }, { "entropy": 5.761775636672974, "epoch": 2.412293328146275, "grad_norm": 1.1953125, "learning_rate": 0.0004412796423783034, "loss": 5.0043, "mean_token_accuracy": 0.1969989135861397, "num_tokens": 53800227.0, "step": 31005 }, { "entropy": 5.720632743835449, "epoch": 2.4126823575179928, "grad_norm": 1.2578125, "learning_rate": 0.0004412609696023745, "loss": 5.0076, "mean_token_accuracy": 0.205685855448246, "num_tokens": 53808591.0, "step": 31010 }, { "entropy": 5.796106052398682, "epoch": 2.41307138688971, "grad_norm": 1.1484375, "learning_rate": 0.0004412422943037, "loss": 5.1009, "mean_token_accuracy": 0.1994265303015709, "num_tokens": 53817738.0, "step": 31015 }, { "entropy": 5.794653224945068, "epoch": 2.4134604162614277, "grad_norm": 1.125, "learning_rate": 0.00044122361648256327, "loss": 5.0238, "mean_token_accuracy": 0.20598164796829224, "num_tokens": 53826919.0, "step": 31020 }, { "entropy": 5.758966541290283, "epoch": 2.4138494456331454, "grad_norm": 1.171875, "learning_rate": 0.00044120493613924766, "loss": 4.948, "mean_token_accuracy": 0.20949797630310057, "num_tokens": 53835415.0, "step": 31025 }, { "entropy": 5.7432861328125, "epoch": 2.414238475004863, "grad_norm": 1.1484375, "learning_rate": 0.00044118625327403677, "loss": 5.044, "mean_token_accuracy": 0.20488122552633287, "num_tokens": 53844992.0, "step": 31030 }, { "entropy": 5.751257276535034, "epoch": 2.4146275043765804, "grad_norm": 1.3046875, "learning_rate": 0.000441167567887214, "loss": 5.0056, "mean_token_accuracy": 0.2039441704750061, "num_tokens": 53853864.0, "step": 31035 }, { "entropy": 5.773746061325073, "epoch": 2.415016533748298, "grad_norm": 1.203125, "learning_rate": 0.0004411488799790629, "loss": 4.9927, "mean_token_accuracy": 0.20326935350894929, "num_tokens": 53863021.0, "step": 31040 }, { "entropy": 5.780874156951905, "epoch": 2.4154055631200158, "grad_norm": 1.1171875, "learning_rate": 0.00044113018954986693, "loss": 5.0471, "mean_token_accuracy": 0.19775691926479338, "num_tokens": 53873259.0, "step": 31045 }, { "entropy": 5.69344129562378, "epoch": 2.415794592491733, "grad_norm": 1.1171875, "learning_rate": 0.0004411114965999098, "loss": 4.9648, "mean_token_accuracy": 0.2138729512691498, "num_tokens": 53881861.0, "step": 31050 }, { "entropy": 5.742616128921509, "epoch": 2.4161836218634507, "grad_norm": 1.3203125, "learning_rate": 0.000441092801129475, "loss": 5.0412, "mean_token_accuracy": 0.20045126080513, "num_tokens": 53890852.0, "step": 31055 }, { "entropy": 5.7446253299713135, "epoch": 2.4165726512351684, "grad_norm": 1.2421875, "learning_rate": 0.00044107410313884643, "loss": 4.9213, "mean_token_accuracy": 0.20891886502504348, "num_tokens": 53899452.0, "step": 31060 }, { "entropy": 5.778521108627319, "epoch": 2.4169616806068857, "grad_norm": 1.21875, "learning_rate": 0.00044105540262830763, "loss": 5.1194, "mean_token_accuracy": 0.19871475398540497, "num_tokens": 53908458.0, "step": 31065 }, { "entropy": 5.750793981552124, "epoch": 2.4173507099786034, "grad_norm": 1.15625, "learning_rate": 0.0004410366995981424, "loss": 5.0326, "mean_token_accuracy": 0.1982795551419258, "num_tokens": 53917998.0, "step": 31070 }, { "entropy": 5.804146003723145, "epoch": 2.417739739350321, "grad_norm": 1.203125, "learning_rate": 0.00044101799404863457, "loss": 5.116, "mean_token_accuracy": 0.19242469370365142, "num_tokens": 53926320.0, "step": 31075 }, { "entropy": 5.756047534942627, "epoch": 2.4181287687220383, "grad_norm": 1.1953125, "learning_rate": 0.0004409992859800679, "loss": 5.0208, "mean_token_accuracy": 0.2014957696199417, "num_tokens": 53934723.0, "step": 31080 }, { "entropy": 5.825441360473633, "epoch": 2.418517798093756, "grad_norm": 1.1796875, "learning_rate": 0.0004409805753927263, "loss": 5.0987, "mean_token_accuracy": 0.19815285503864288, "num_tokens": 53943125.0, "step": 31085 }, { "entropy": 5.77634825706482, "epoch": 2.4189068274654737, "grad_norm": 1.2734375, "learning_rate": 0.0004409618622868936, "loss": 5.0286, "mean_token_accuracy": 0.19822373241186142, "num_tokens": 53951781.0, "step": 31090 }, { "entropy": 5.7268750190734865, "epoch": 2.4192958568371914, "grad_norm": 1.34375, "learning_rate": 0.00044094314666285385, "loss": 5.0073, "mean_token_accuracy": 0.19966767877340316, "num_tokens": 53960556.0, "step": 31095 }, { "entropy": 5.710502624511719, "epoch": 2.4196848862089086, "grad_norm": 1.171875, "learning_rate": 0.00044092442852089095, "loss": 4.9146, "mean_token_accuracy": 0.21497627794742585, "num_tokens": 53969075.0, "step": 31100 }, { "entropy": 5.847242403030395, "epoch": 2.4200739155806263, "grad_norm": 1.234375, "learning_rate": 0.0004409057078612889, "loss": 5.1673, "mean_token_accuracy": 0.1934692770242691, "num_tokens": 53978203.0, "step": 31105 }, { "entropy": 5.764504766464233, "epoch": 2.420462944952344, "grad_norm": 1.2578125, "learning_rate": 0.00044088698468433194, "loss": 4.9957, "mean_token_accuracy": 0.2009505346417427, "num_tokens": 53986935.0, "step": 31110 }, { "entropy": 5.7430871486663815, "epoch": 2.4208519743240613, "grad_norm": 1.15625, "learning_rate": 0.00044086825899030383, "loss": 5.0115, "mean_token_accuracy": 0.19897337406873702, "num_tokens": 53996167.0, "step": 31115 }, { "entropy": 5.733886003494263, "epoch": 2.421241003695779, "grad_norm": 1.1875, "learning_rate": 0.000440849530779489, "loss": 5.0268, "mean_token_accuracy": 0.20216165482997894, "num_tokens": 54004722.0, "step": 31120 }, { "entropy": 5.722410106658936, "epoch": 2.4216300330674967, "grad_norm": 1.1953125, "learning_rate": 0.0004408308000521715, "loss": 4.9736, "mean_token_accuracy": 0.21243120580911637, "num_tokens": 54012660.0, "step": 31125 }, { "entropy": 5.777955722808838, "epoch": 2.4220190624392144, "grad_norm": 1.2890625, "learning_rate": 0.00044081206680863556, "loss": 5.0389, "mean_token_accuracy": 0.2026614874601364, "num_tokens": 54021517.0, "step": 31130 }, { "entropy": 5.784278154373169, "epoch": 2.4224080918109316, "grad_norm": 1.3046875, "learning_rate": 0.00044079333104916554, "loss": 5.0208, "mean_token_accuracy": 0.20796803534030914, "num_tokens": 54030081.0, "step": 31135 }, { "entropy": 5.7475159645080565, "epoch": 2.4227971211826493, "grad_norm": 1.2734375, "learning_rate": 0.0004407745927740454, "loss": 4.9613, "mean_token_accuracy": 0.20729743093252181, "num_tokens": 54038214.0, "step": 31140 }, { "entropy": 5.664539432525634, "epoch": 2.423186150554367, "grad_norm": 1.234375, "learning_rate": 0.0004407558519835598, "loss": 4.9098, "mean_token_accuracy": 0.20092959851026534, "num_tokens": 54046813.0, "step": 31145 }, { "entropy": 5.710810232162475, "epoch": 2.4235751799260843, "grad_norm": 1.2421875, "learning_rate": 0.00044073710867799295, "loss": 5.0038, "mean_token_accuracy": 0.20505196750164031, "num_tokens": 54056095.0, "step": 31150 }, { "entropy": 5.719667387008667, "epoch": 2.423964209297802, "grad_norm": 1.2421875, "learning_rate": 0.0004407183628576293, "loss": 4.9183, "mean_token_accuracy": 0.21075420677661896, "num_tokens": 54065173.0, "step": 31155 }, { "entropy": 5.811587333679199, "epoch": 2.4243532386695197, "grad_norm": 1.140625, "learning_rate": 0.0004406996145227532, "loss": 5.1532, "mean_token_accuracy": 0.19166182577610016, "num_tokens": 54073858.0, "step": 31160 }, { "entropy": 5.815307760238648, "epoch": 2.424742268041237, "grad_norm": 1.203125, "learning_rate": 0.0004406808636736492, "loss": 5.0374, "mean_token_accuracy": 0.20236337631940843, "num_tokens": 54082129.0, "step": 31165 }, { "entropy": 5.761281251907349, "epoch": 2.4251312974129546, "grad_norm": 1.234375, "learning_rate": 0.00044066211031060183, "loss": 4.976, "mean_token_accuracy": 0.20168417692184448, "num_tokens": 54090360.0, "step": 31170 }, { "entropy": 5.763425207138061, "epoch": 2.4255203267846723, "grad_norm": 1.2734375, "learning_rate": 0.0004406433544338956, "loss": 5.026, "mean_token_accuracy": 0.20317935943603516, "num_tokens": 54098309.0, "step": 31175 }, { "entropy": 5.802192735671997, "epoch": 2.4259093561563896, "grad_norm": 1.1953125, "learning_rate": 0.0004406245960438151, "loss": 5.0041, "mean_token_accuracy": 0.2124850258231163, "num_tokens": 54106505.0, "step": 31180 }, { "entropy": 5.830397033691407, "epoch": 2.4262983855281073, "grad_norm": 1.21875, "learning_rate": 0.000440605835140645, "loss": 5.1705, "mean_token_accuracy": 0.1923434004187584, "num_tokens": 54115791.0, "step": 31185 }, { "entropy": 5.745622873306274, "epoch": 2.426687414899825, "grad_norm": 1.2109375, "learning_rate": 0.0004405870717246699, "loss": 4.9376, "mean_token_accuracy": 0.207210411131382, "num_tokens": 54124187.0, "step": 31190 }, { "entropy": 5.776695775985718, "epoch": 2.4270764442715427, "grad_norm": 1.1328125, "learning_rate": 0.00044056830579617464, "loss": 5.0581, "mean_token_accuracy": 0.19857363998889924, "num_tokens": 54133566.0, "step": 31195 }, { "entropy": 5.767778778076172, "epoch": 2.42746547364326, "grad_norm": 1.296875, "learning_rate": 0.00044054953735544376, "loss": 4.9528, "mean_token_accuracy": 0.20657921433448792, "num_tokens": 54141698.0, "step": 31200 }, { "entropy": 5.763343000411988, "epoch": 2.4278545030149776, "grad_norm": 1.28125, "learning_rate": 0.0004405307664027622, "loss": 5.0863, "mean_token_accuracy": 0.19878880977630614, "num_tokens": 54150094.0, "step": 31205 }, { "entropy": 5.715404081344604, "epoch": 2.4282435323866953, "grad_norm": 1.21875, "learning_rate": 0.0004405119929384147, "loss": 4.9571, "mean_token_accuracy": 0.21758323162794113, "num_tokens": 54158770.0, "step": 31210 }, { "entropy": 5.7260936260223385, "epoch": 2.4286325617584126, "grad_norm": 1.2265625, "learning_rate": 0.0004404932169626862, "loss": 4.948, "mean_token_accuracy": 0.20435978472232819, "num_tokens": 54166912.0, "step": 31215 }, { "entropy": 5.73943977355957, "epoch": 2.4290215911301303, "grad_norm": 1.1796875, "learning_rate": 0.0004404744384758615, "loss": 4.9968, "mean_token_accuracy": 0.20478032082319259, "num_tokens": 54176027.0, "step": 31220 }, { "entropy": 5.736687421798706, "epoch": 2.429410620501848, "grad_norm": 1.25, "learning_rate": 0.0004404556574782256, "loss": 4.9712, "mean_token_accuracy": 0.20925674438476563, "num_tokens": 54184116.0, "step": 31225 }, { "entropy": 5.69991250038147, "epoch": 2.4297996498735657, "grad_norm": 1.28125, "learning_rate": 0.00044043687397006336, "loss": 4.9527, "mean_token_accuracy": 0.21037691831588745, "num_tokens": 54193043.0, "step": 31230 }, { "entropy": 5.765369939804077, "epoch": 2.430188679245283, "grad_norm": 1.1328125, "learning_rate": 0.00044041808795166, "loss": 5.039, "mean_token_accuracy": 0.19867083430290222, "num_tokens": 54201953.0, "step": 31235 }, { "entropy": 5.759497499465942, "epoch": 2.4305777086170006, "grad_norm": 1.2265625, "learning_rate": 0.0004403992994233004, "loss": 5.0197, "mean_token_accuracy": 0.20836419314146043, "num_tokens": 54210316.0, "step": 31240 }, { "entropy": 5.783961439132691, "epoch": 2.4309667379887183, "grad_norm": 1.3203125, "learning_rate": 0.00044038050838526974, "loss": 4.9457, "mean_token_accuracy": 0.21202143728733064, "num_tokens": 54218795.0, "step": 31245 }, { "entropy": 5.740437269210815, "epoch": 2.4313557673604356, "grad_norm": 1.265625, "learning_rate": 0.000440361714837853, "loss": 4.994, "mean_token_accuracy": 0.19851709604263307, "num_tokens": 54227455.0, "step": 31250 }, { "entropy": 5.700189018249512, "epoch": 2.4317447967321533, "grad_norm": 1.15625, "learning_rate": 0.0004403429187813355, "loss": 4.9959, "mean_token_accuracy": 0.20650274753570558, "num_tokens": 54236124.0, "step": 31255 }, { "entropy": 5.716236925125122, "epoch": 2.432133826103871, "grad_norm": 1.2734375, "learning_rate": 0.0004403241202160024, "loss": 4.9581, "mean_token_accuracy": 0.20620622783899306, "num_tokens": 54244638.0, "step": 31260 }, { "entropy": 5.745661401748658, "epoch": 2.432522855475588, "grad_norm": 1.1796875, "learning_rate": 0.0004403053191421388, "loss": 4.9906, "mean_token_accuracy": 0.20385528057813646, "num_tokens": 54253678.0, "step": 31265 }, { "entropy": 5.827294254302979, "epoch": 2.432911884847306, "grad_norm": 1.2578125, "learning_rate": 0.0004402865155600302, "loss": 5.1361, "mean_token_accuracy": 0.19948826283216475, "num_tokens": 54262414.0, "step": 31270 }, { "entropy": 5.657776594161987, "epoch": 2.4333009142190236, "grad_norm": 1.1640625, "learning_rate": 0.00044026770946996183, "loss": 4.9066, "mean_token_accuracy": 0.21363504678010942, "num_tokens": 54270597.0, "step": 31275 }, { "entropy": 5.71487398147583, "epoch": 2.433689943590741, "grad_norm": 1.3203125, "learning_rate": 0.00044024890087221896, "loss": 4.9917, "mean_token_accuracy": 0.209790201485157, "num_tokens": 54279432.0, "step": 31280 }, { "entropy": 5.732794570922851, "epoch": 2.4340789729624586, "grad_norm": 1.2734375, "learning_rate": 0.00044023008976708705, "loss": 4.9351, "mean_token_accuracy": 0.2075113534927368, "num_tokens": 54287578.0, "step": 31285 }, { "entropy": 5.787867498397827, "epoch": 2.4344680023341763, "grad_norm": 1.21875, "learning_rate": 0.0004402112761548515, "loss": 5.103, "mean_token_accuracy": 0.1984708860516548, "num_tokens": 54296119.0, "step": 31290 }, { "entropy": 5.698449754714966, "epoch": 2.434857031705894, "grad_norm": 1.203125, "learning_rate": 0.00044019246003579776, "loss": 4.9191, "mean_token_accuracy": 0.20722371190786362, "num_tokens": 54304363.0, "step": 31295 }, { "entropy": 5.807777452468872, "epoch": 2.435246061077611, "grad_norm": 1.2421875, "learning_rate": 0.0004401736414102115, "loss": 5.0327, "mean_token_accuracy": 0.20351162552833557, "num_tokens": 54313672.0, "step": 31300 }, { "entropy": 5.7652710437774655, "epoch": 2.435635090449329, "grad_norm": 1.3125, "learning_rate": 0.000440154820278378, "loss": 5.0086, "mean_token_accuracy": 0.21334877461194993, "num_tokens": 54322163.0, "step": 31305 }, { "entropy": 5.746228218078613, "epoch": 2.4360241198210466, "grad_norm": 1.1875, "learning_rate": 0.0004401359966405831, "loss": 4.9766, "mean_token_accuracy": 0.2121948480606079, "num_tokens": 54331176.0, "step": 31310 }, { "entropy": 5.748073244094849, "epoch": 2.436413149192764, "grad_norm": 1.1796875, "learning_rate": 0.00044011717049711216, "loss": 5.0174, "mean_token_accuracy": 0.20464986860752105, "num_tokens": 54340404.0, "step": 31315 }, { "entropy": 5.774827384948731, "epoch": 2.4368021785644816, "grad_norm": 1.1796875, "learning_rate": 0.00044009834184825103, "loss": 4.9563, "mean_token_accuracy": 0.20782427191734315, "num_tokens": 54349704.0, "step": 31320 }, { "entropy": 5.788943433761597, "epoch": 2.4371912079361993, "grad_norm": 1.1796875, "learning_rate": 0.0004400795106942853, "loss": 5.0364, "mean_token_accuracy": 0.20307955741882325, "num_tokens": 54358869.0, "step": 31325 }, { "entropy": 5.714692640304565, "epoch": 2.437580237307917, "grad_norm": 1.1796875, "learning_rate": 0.00044006067703550083, "loss": 4.9285, "mean_token_accuracy": 0.21125146746635437, "num_tokens": 54367918.0, "step": 31330 }, { "entropy": 5.7495436668396, "epoch": 2.437969266679634, "grad_norm": 1.2734375, "learning_rate": 0.0004400418408721833, "loss": 5.0077, "mean_token_accuracy": 0.1992639869451523, "num_tokens": 54375798.0, "step": 31335 }, { "entropy": 5.79714298248291, "epoch": 2.438358296051352, "grad_norm": 1.1328125, "learning_rate": 0.00044002300220461843, "loss": 4.9637, "mean_token_accuracy": 0.20415841341018676, "num_tokens": 54384230.0, "step": 31340 }, { "entropy": 5.728126430511475, "epoch": 2.4387473254230696, "grad_norm": 1.2421875, "learning_rate": 0.0004400041610330922, "loss": 4.9974, "mean_token_accuracy": 0.20550402104854584, "num_tokens": 54392444.0, "step": 31345 }, { "entropy": 5.741849517822265, "epoch": 2.439136354794787, "grad_norm": 1.2109375, "learning_rate": 0.0004399853173578905, "loss": 5.0064, "mean_token_accuracy": 0.20437606126070024, "num_tokens": 54400788.0, "step": 31350 }, { "entropy": 5.734001970291137, "epoch": 2.4395253841665046, "grad_norm": 1.171875, "learning_rate": 0.00043996647117929916, "loss": 5.0268, "mean_token_accuracy": 0.20591295659542083, "num_tokens": 54409749.0, "step": 31355 }, { "entropy": 5.87733736038208, "epoch": 2.4399144135382222, "grad_norm": 1.125, "learning_rate": 0.0004399476224976043, "loss": 5.1653, "mean_token_accuracy": 0.19837927669286728, "num_tokens": 54419677.0, "step": 31360 }, { "entropy": 5.86934084892273, "epoch": 2.44030344290994, "grad_norm": 1.265625, "learning_rate": 0.00043992877131309165, "loss": 5.1215, "mean_token_accuracy": 0.2048010468482971, "num_tokens": 54428821.0, "step": 31365 }, { "entropy": 5.795098209381104, "epoch": 2.440692472281657, "grad_norm": 1.3359375, "learning_rate": 0.0004399099176260475, "loss": 5.0641, "mean_token_accuracy": 0.20285094231367112, "num_tokens": 54437549.0, "step": 31370 }, { "entropy": 5.723764514923095, "epoch": 2.441081501653375, "grad_norm": 1.2578125, "learning_rate": 0.0004398910614367579, "loss": 4.9006, "mean_token_accuracy": 0.21222235709428788, "num_tokens": 54446247.0, "step": 31375 }, { "entropy": 5.813949203491211, "epoch": 2.441470531025092, "grad_norm": 1.2421875, "learning_rate": 0.00043987220274550876, "loss": 5.0433, "mean_token_accuracy": 0.19619151651859285, "num_tokens": 54455191.0, "step": 31380 }, { "entropy": 5.7631762504577635, "epoch": 2.44185956039681, "grad_norm": 1.2578125, "learning_rate": 0.00043985334155258643, "loss": 5.0256, "mean_token_accuracy": 0.2027174562215805, "num_tokens": 54463094.0, "step": 31385 }, { "entropy": 5.746235322952271, "epoch": 2.4422485897685275, "grad_norm": 1.2578125, "learning_rate": 0.000439834477858277, "loss": 4.9753, "mean_token_accuracy": 0.19904089272022246, "num_tokens": 54471314.0, "step": 31390 }, { "entropy": 5.783353662490844, "epoch": 2.4426376191402452, "grad_norm": 1.2578125, "learning_rate": 0.00043981561166286676, "loss": 5.1012, "mean_token_accuracy": 0.19774192422628403, "num_tokens": 54480283.0, "step": 31395 }, { "entropy": 5.751322793960571, "epoch": 2.4430266485119625, "grad_norm": 1.265625, "learning_rate": 0.000439796742966642, "loss": 4.9819, "mean_token_accuracy": 0.20422791540622712, "num_tokens": 54488588.0, "step": 31400 }, { "entropy": 5.767865562438965, "epoch": 2.44341567788368, "grad_norm": 1.265625, "learning_rate": 0.00043977787176988884, "loss": 4.9502, "mean_token_accuracy": 0.20709134340286256, "num_tokens": 54497532.0, "step": 31405 }, { "entropy": 5.8346107006073, "epoch": 2.443804707255398, "grad_norm": 1.3515625, "learning_rate": 0.0004397589980728938, "loss": 5.0686, "mean_token_accuracy": 0.20094753354787825, "num_tokens": 54506152.0, "step": 31410 }, { "entropy": 5.767714548110962, "epoch": 2.444193736627115, "grad_norm": 1.21875, "learning_rate": 0.00043974012187594324, "loss": 5.02, "mean_token_accuracy": 0.19887570142745972, "num_tokens": 54515674.0, "step": 31415 }, { "entropy": 5.679424238204956, "epoch": 2.444582765998833, "grad_norm": 1.265625, "learning_rate": 0.0004397212431793235, "loss": 4.8437, "mean_token_accuracy": 0.21661657243967056, "num_tokens": 54523399.0, "step": 31420 }, { "entropy": 5.644727611541748, "epoch": 2.4449717953705505, "grad_norm": 1.2734375, "learning_rate": 0.00043970236198332107, "loss": 4.9732, "mean_token_accuracy": 0.20299065560102464, "num_tokens": 54532128.0, "step": 31425 }, { "entropy": 5.766310691833496, "epoch": 2.4453608247422682, "grad_norm": 1.15625, "learning_rate": 0.00043968347828822246, "loss": 4.9621, "mean_token_accuracy": 0.20218459665775299, "num_tokens": 54540474.0, "step": 31430 }, { "entropy": 5.748452758789062, "epoch": 2.4457498541139855, "grad_norm": 1.1484375, "learning_rate": 0.0004396645920943142, "loss": 4.9502, "mean_token_accuracy": 0.20714785307645797, "num_tokens": 54549534.0, "step": 31435 }, { "entropy": 5.770737171173096, "epoch": 2.446138883485703, "grad_norm": 1.203125, "learning_rate": 0.0004396457034018828, "loss": 4.9903, "mean_token_accuracy": 0.20018388330936432, "num_tokens": 54558071.0, "step": 31440 }, { "entropy": 5.807193231582642, "epoch": 2.446527912857421, "grad_norm": 1.171875, "learning_rate": 0.000439626812211215, "loss": 5.0679, "mean_token_accuracy": 0.19669016301631928, "num_tokens": 54565814.0, "step": 31445 }, { "entropy": 5.743308448791504, "epoch": 2.446916942229138, "grad_norm": 1.1484375, "learning_rate": 0.00043960791852259735, "loss": 5.0117, "mean_token_accuracy": 0.1916562482714653, "num_tokens": 54574911.0, "step": 31450 }, { "entropy": 5.745396375656128, "epoch": 2.447305971600856, "grad_norm": 1.265625, "learning_rate": 0.0004395890223363165, "loss": 4.9883, "mean_token_accuracy": 0.20544773042201997, "num_tokens": 54584129.0, "step": 31455 }, { "entropy": 5.730145740509033, "epoch": 2.4476950009725735, "grad_norm": 1.2421875, "learning_rate": 0.00043957012365265915, "loss": 4.9484, "mean_token_accuracy": 0.20830039083957672, "num_tokens": 54593203.0, "step": 31460 }, { "entropy": 5.738918590545654, "epoch": 2.4480840303442912, "grad_norm": 1.2734375, "learning_rate": 0.00043955122247191214, "loss": 5.0781, "mean_token_accuracy": 0.2047096699476242, "num_tokens": 54601436.0, "step": 31465 }, { "entropy": 5.696729850769043, "epoch": 2.4484730597160085, "grad_norm": 1.140625, "learning_rate": 0.0004395323187943623, "loss": 5.0405, "mean_token_accuracy": 0.19940754771232605, "num_tokens": 54610550.0, "step": 31470 }, { "entropy": 5.716815090179443, "epoch": 2.448862089087726, "grad_norm": 1.2265625, "learning_rate": 0.0004395134126202964, "loss": 4.9526, "mean_token_accuracy": 0.20434477180242538, "num_tokens": 54619176.0, "step": 31475 }, { "entropy": 5.764438629150391, "epoch": 2.449251118459444, "grad_norm": 1.15625, "learning_rate": 0.0004394945039500012, "loss": 5.0045, "mean_token_accuracy": 0.2024429038167, "num_tokens": 54627259.0, "step": 31480 }, { "entropy": 5.714690780639648, "epoch": 2.449640147831161, "grad_norm": 1.234375, "learning_rate": 0.00043947559278376385, "loss": 4.9963, "mean_token_accuracy": 0.1958848774433136, "num_tokens": 54635892.0, "step": 31485 }, { "entropy": 5.812391662597657, "epoch": 2.450029177202879, "grad_norm": 1.0703125, "learning_rate": 0.00043945667912187117, "loss": 5.0658, "mean_token_accuracy": 0.19724818766117097, "num_tokens": 54645360.0, "step": 31490 }, { "entropy": 5.762310361862182, "epoch": 2.4504182065745965, "grad_norm": 1.15625, "learning_rate": 0.0004394377629646101, "loss": 4.9851, "mean_token_accuracy": 0.2070889264345169, "num_tokens": 54654968.0, "step": 31495 }, { "entropy": 5.73056263923645, "epoch": 2.4508072359463138, "grad_norm": 1.21875, "learning_rate": 0.00043941884431226763, "loss": 4.9269, "mean_token_accuracy": 0.21319037228822707, "num_tokens": 54663347.0, "step": 31500 }, { "entropy": 5.784131193161011, "epoch": 2.4511962653180315, "grad_norm": 1.2265625, "learning_rate": 0.000439399923165131, "loss": 5.0546, "mean_token_accuracy": 0.19909590035676955, "num_tokens": 54671744.0, "step": 31505 }, { "entropy": 5.764223575592041, "epoch": 2.451585294689749, "grad_norm": 1.3359375, "learning_rate": 0.0004393809995234872, "loss": 4.9851, "mean_token_accuracy": 0.19961896985769273, "num_tokens": 54680098.0, "step": 31510 }, { "entropy": 5.762333345413208, "epoch": 2.4519743240614664, "grad_norm": 1.109375, "learning_rate": 0.0004393620733876233, "loss": 5.065, "mean_token_accuracy": 0.2048175096511841, "num_tokens": 54689513.0, "step": 31515 }, { "entropy": 5.775946044921875, "epoch": 2.452363353433184, "grad_norm": 1.1796875, "learning_rate": 0.0004393431447578267, "loss": 5.0044, "mean_token_accuracy": 0.20746286809444428, "num_tokens": 54698079.0, "step": 31520 }, { "entropy": 5.756911849975586, "epoch": 2.452752382804902, "grad_norm": 1.1640625, "learning_rate": 0.00043932421363438427, "loss": 4.9519, "mean_token_accuracy": 0.21012334376573563, "num_tokens": 54706956.0, "step": 31525 }, { "entropy": 5.687871599197388, "epoch": 2.4531414121766195, "grad_norm": 1.1953125, "learning_rate": 0.0004393052800175835, "loss": 5.0253, "mean_token_accuracy": 0.2010633334517479, "num_tokens": 54716131.0, "step": 31530 }, { "entropy": 5.75602240562439, "epoch": 2.4535304415483368, "grad_norm": 1.203125, "learning_rate": 0.00043928634390771166, "loss": 4.9597, "mean_token_accuracy": 0.20553407669067383, "num_tokens": 54725080.0, "step": 31535 }, { "entropy": 5.748590517044067, "epoch": 2.4539194709200545, "grad_norm": 1.3203125, "learning_rate": 0.00043926740530505603, "loss": 4.9916, "mean_token_accuracy": 0.20106348991394044, "num_tokens": 54733273.0, "step": 31540 }, { "entropy": 5.76924991607666, "epoch": 2.454308500291772, "grad_norm": 1.25, "learning_rate": 0.000439248464209904, "loss": 5.0344, "mean_token_accuracy": 0.2017551690340042, "num_tokens": 54742359.0, "step": 31545 }, { "entropy": 5.755935382843018, "epoch": 2.4546975296634894, "grad_norm": 1.2421875, "learning_rate": 0.000439229520622543, "loss": 5.0151, "mean_token_accuracy": 0.2005144849419594, "num_tokens": 54750360.0, "step": 31550 }, { "entropy": 5.728951787948608, "epoch": 2.455086559035207, "grad_norm": 1.2578125, "learning_rate": 0.0004392105745432603, "loss": 5.0001, "mean_token_accuracy": 0.2034292086958885, "num_tokens": 54758663.0, "step": 31555 }, { "entropy": 5.783328580856323, "epoch": 2.455475588406925, "grad_norm": 1.1015625, "learning_rate": 0.0004391916259723436, "loss": 4.9575, "mean_token_accuracy": 0.21689614951610564, "num_tokens": 54767578.0, "step": 31560 }, { "entropy": 5.8123914241790775, "epoch": 2.4558646177786425, "grad_norm": 1.3203125, "learning_rate": 0.00043917267491008023, "loss": 5.1216, "mean_token_accuracy": 0.19739974439144134, "num_tokens": 54776651.0, "step": 31565 }, { "entropy": 5.801870441436767, "epoch": 2.4562536471503598, "grad_norm": 1.421875, "learning_rate": 0.0004391537213567579, "loss": 5.0087, "mean_token_accuracy": 0.19909669011831282, "num_tokens": 54784865.0, "step": 31570 }, { "entropy": 5.725860691070556, "epoch": 2.4566426765220775, "grad_norm": 1.171875, "learning_rate": 0.0004391347653126641, "loss": 4.8611, "mean_token_accuracy": 0.21357672959566115, "num_tokens": 54794367.0, "step": 31575 }, { "entropy": 5.673507976531982, "epoch": 2.457031705893795, "grad_norm": 1.3828125, "learning_rate": 0.00043911580677808646, "loss": 4.9085, "mean_token_accuracy": 0.2100159779191017, "num_tokens": 54802606.0, "step": 31580 }, { "entropy": 5.680382013320923, "epoch": 2.4574207352655124, "grad_norm": 1.15625, "learning_rate": 0.00043909684575331264, "loss": 4.933, "mean_token_accuracy": 0.22076333612203597, "num_tokens": 54812207.0, "step": 31585 }, { "entropy": 5.794582748413086, "epoch": 2.45780976463723, "grad_norm": 1.21875, "learning_rate": 0.0004390778822386304, "loss": 4.9831, "mean_token_accuracy": 0.20951906144618987, "num_tokens": 54821047.0, "step": 31590 }, { "entropy": 5.895704650878907, "epoch": 2.458198794008948, "grad_norm": 1.1953125, "learning_rate": 0.00043905891623432754, "loss": 5.133, "mean_token_accuracy": 0.20003800988197326, "num_tokens": 54829849.0, "step": 31595 }, { "entropy": 5.7574687004089355, "epoch": 2.458587823380665, "grad_norm": 1.296875, "learning_rate": 0.00043903994774069165, "loss": 5.0873, "mean_token_accuracy": 0.19183467775583268, "num_tokens": 54838690.0, "step": 31600 }, { "entropy": 5.741592216491699, "epoch": 2.4589768527523828, "grad_norm": 1.265625, "learning_rate": 0.0004390209767580107, "loss": 5.0214, "mean_token_accuracy": 0.20689265578985214, "num_tokens": 54847795.0, "step": 31605 }, { "entropy": 5.7613077640533445, "epoch": 2.4593658821241005, "grad_norm": 1.1640625, "learning_rate": 0.0004390020032865725, "loss": 4.9369, "mean_token_accuracy": 0.21359774172306062, "num_tokens": 54856676.0, "step": 31610 }, { "entropy": 5.739563512802124, "epoch": 2.4597549114958177, "grad_norm": 1.3203125, "learning_rate": 0.0004389830273266649, "loss": 4.9847, "mean_token_accuracy": 0.2077259197831154, "num_tokens": 54865177.0, "step": 31615 }, { "entropy": 5.723583555221557, "epoch": 2.4601439408675354, "grad_norm": 1.1953125, "learning_rate": 0.00043896404887857596, "loss": 4.957, "mean_token_accuracy": 0.20325980335474014, "num_tokens": 54872921.0, "step": 31620 }, { "entropy": 5.7308413028717045, "epoch": 2.460532970239253, "grad_norm": 1.21875, "learning_rate": 0.0004389450679425935, "loss": 5.0765, "mean_token_accuracy": 0.19511204063892365, "num_tokens": 54882045.0, "step": 31625 }, { "entropy": 5.869683408737183, "epoch": 2.460921999610971, "grad_norm": 1.2578125, "learning_rate": 0.0004389260845190055, "loss": 5.0139, "mean_token_accuracy": 0.2037695601582527, "num_tokens": 54890647.0, "step": 31630 }, { "entropy": 5.771480894088745, "epoch": 2.461311028982688, "grad_norm": 1.2578125, "learning_rate": 0.00043890709860810014, "loss": 5.0387, "mean_token_accuracy": 0.20240434557199477, "num_tokens": 54898958.0, "step": 31635 }, { "entropy": 5.749298143386841, "epoch": 2.4617000583544058, "grad_norm": 1.1953125, "learning_rate": 0.00043888811021016545, "loss": 5.058, "mean_token_accuracy": 0.19514483362436294, "num_tokens": 54907329.0, "step": 31640 }, { "entropy": 5.7637872219085695, "epoch": 2.4620890877261234, "grad_norm": 1.1484375, "learning_rate": 0.00043886911932548953, "loss": 5.0158, "mean_token_accuracy": 0.20775482654571534, "num_tokens": 54916093.0, "step": 31645 }, { "entropy": 5.7986475944519045, "epoch": 2.4624781170978407, "grad_norm": 1.15625, "learning_rate": 0.0004388501259543605, "loss": 5.0398, "mean_token_accuracy": 0.19661003053188325, "num_tokens": 54925030.0, "step": 31650 }, { "entropy": 5.770588684082031, "epoch": 2.4628671464695584, "grad_norm": 1.2265625, "learning_rate": 0.0004388311300970667, "loss": 4.9874, "mean_token_accuracy": 0.20603961050510405, "num_tokens": 54933719.0, "step": 31655 }, { "entropy": 5.780603313446045, "epoch": 2.463256175841276, "grad_norm": 1.40625, "learning_rate": 0.0004388121317538962, "loss": 5.1059, "mean_token_accuracy": 0.1977620929479599, "num_tokens": 54941533.0, "step": 31660 }, { "entropy": 5.705181074142456, "epoch": 2.463645205212994, "grad_norm": 1.2890625, "learning_rate": 0.0004387931309251374, "loss": 4.945, "mean_token_accuracy": 0.21359920203685762, "num_tokens": 54949819.0, "step": 31665 }, { "entropy": 5.793100643157959, "epoch": 2.464034234584711, "grad_norm": 1.21875, "learning_rate": 0.0004387741276110785, "loss": 5.0675, "mean_token_accuracy": 0.19822730422019957, "num_tokens": 54959199.0, "step": 31670 }, { "entropy": 5.780916166305542, "epoch": 2.4644232639564287, "grad_norm": 1.265625, "learning_rate": 0.00043875512181200784, "loss": 5.05, "mean_token_accuracy": 0.20439544171094895, "num_tokens": 54967742.0, "step": 31675 }, { "entropy": 5.820680427551269, "epoch": 2.4648122933281464, "grad_norm": 1.25, "learning_rate": 0.0004387361135282139, "loss": 5.1369, "mean_token_accuracy": 0.1970336452126503, "num_tokens": 54976419.0, "step": 31680 }, { "entropy": 5.7901537895202635, "epoch": 2.4652013226998637, "grad_norm": 1.1640625, "learning_rate": 0.00043871710275998507, "loss": 4.9824, "mean_token_accuracy": 0.20564540028572081, "num_tokens": 54984975.0, "step": 31685 }, { "entropy": 5.766719961166382, "epoch": 2.4655903520715814, "grad_norm": 1.203125, "learning_rate": 0.0004386980895076097, "loss": 5.0166, "mean_token_accuracy": 0.20487027019262313, "num_tokens": 54993746.0, "step": 31690 }, { "entropy": 5.74505934715271, "epoch": 2.465979381443299, "grad_norm": 1.25, "learning_rate": 0.00043867907377137646, "loss": 4.9347, "mean_token_accuracy": 0.20835868120193482, "num_tokens": 55002130.0, "step": 31695 }, { "entropy": 5.756981325149536, "epoch": 2.4663684108150163, "grad_norm": 1.25, "learning_rate": 0.00043866005555157376, "loss": 5.0658, "mean_token_accuracy": 0.19973008334636688, "num_tokens": 55010790.0, "step": 31700 }, { "entropy": 5.754735660552979, "epoch": 2.466757440186734, "grad_norm": 1.2578125, "learning_rate": 0.0004386410348484903, "loss": 5.0144, "mean_token_accuracy": 0.20036692768335343, "num_tokens": 55019542.0, "step": 31705 }, { "entropy": 5.7102643013000485, "epoch": 2.4671464695584517, "grad_norm": 1.1640625, "learning_rate": 0.0004386220116624145, "loss": 4.8777, "mean_token_accuracy": 0.21158256530761718, "num_tokens": 55029230.0, "step": 31710 }, { "entropy": 5.766079998016357, "epoch": 2.467535498930169, "grad_norm": 1.15625, "learning_rate": 0.00043860298599363506, "loss": 4.9856, "mean_token_accuracy": 0.2016436815261841, "num_tokens": 55037371.0, "step": 31715 }, { "entropy": 5.720347738265991, "epoch": 2.4679245283018867, "grad_norm": 1.1328125, "learning_rate": 0.0004385839578424408, "loss": 4.9826, "mean_token_accuracy": 0.2094579502940178, "num_tokens": 55046022.0, "step": 31720 }, { "entropy": 5.79997296333313, "epoch": 2.4683135576736044, "grad_norm": 1.4375, "learning_rate": 0.00043856492720912037, "loss": 4.9472, "mean_token_accuracy": 0.216387040913105, "num_tokens": 55054713.0, "step": 31725 }, { "entropy": 5.644680595397949, "epoch": 2.468702587045322, "grad_norm": 1.1796875, "learning_rate": 0.0004385458940939624, "loss": 4.9344, "mean_token_accuracy": 0.21954280883073807, "num_tokens": 55064317.0, "step": 31730 }, { "entropy": 5.7111180305480955, "epoch": 2.4690916164170393, "grad_norm": 1.2578125, "learning_rate": 0.0004385268584972559, "loss": 4.9972, "mean_token_accuracy": 0.21303058862686158, "num_tokens": 55072700.0, "step": 31735 }, { "entropy": 5.793711519241333, "epoch": 2.469480645788757, "grad_norm": 1.2421875, "learning_rate": 0.0004385078204192896, "loss": 5.104, "mean_token_accuracy": 0.19352618753910064, "num_tokens": 55081794.0, "step": 31740 }, { "entropy": 5.826669645309448, "epoch": 2.4698696751604747, "grad_norm": 1.171875, "learning_rate": 0.0004384887798603523, "loss": 5.0928, "mean_token_accuracy": 0.20183662474155425, "num_tokens": 55090665.0, "step": 31745 }, { "entropy": 5.787430763244629, "epoch": 2.470258704532192, "grad_norm": 1.234375, "learning_rate": 0.000438469736820733, "loss": 4.9988, "mean_token_accuracy": 0.20787119418382644, "num_tokens": 55099306.0, "step": 31750 }, { "entropy": 5.761940956115723, "epoch": 2.4706477339039097, "grad_norm": 1.234375, "learning_rate": 0.00043845069130072067, "loss": 5.0642, "mean_token_accuracy": 0.20064076781272888, "num_tokens": 55108420.0, "step": 31755 }, { "entropy": 5.822754383087158, "epoch": 2.4710367632756274, "grad_norm": 1.28125, "learning_rate": 0.0004384316433006043, "loss": 4.992, "mean_token_accuracy": 0.2033417195081711, "num_tokens": 55116629.0, "step": 31760 }, { "entropy": 5.791800785064697, "epoch": 2.471425792647345, "grad_norm": 1.2265625, "learning_rate": 0.00043841259282067276, "loss": 5.0402, "mean_token_accuracy": 0.1981917977333069, "num_tokens": 55125469.0, "step": 31765 }, { "entropy": 5.746028041839599, "epoch": 2.4718148220190623, "grad_norm": 1.265625, "learning_rate": 0.00043839353986121533, "loss": 5.0205, "mean_token_accuracy": 0.2037227600812912, "num_tokens": 55134194.0, "step": 31770 }, { "entropy": 5.796371269226074, "epoch": 2.47220385139078, "grad_norm": 1.234375, "learning_rate": 0.0004383744844225209, "loss": 5.0446, "mean_token_accuracy": 0.20169512778520585, "num_tokens": 55142931.0, "step": 31775 }, { "entropy": 5.800432300567627, "epoch": 2.4725928807624977, "grad_norm": 1.2734375, "learning_rate": 0.00043835542650487875, "loss": 5.0394, "mean_token_accuracy": 0.20607608705759048, "num_tokens": 55152331.0, "step": 31780 }, { "entropy": 5.762153816223145, "epoch": 2.472981910134215, "grad_norm": 1.390625, "learning_rate": 0.0004383363661085781, "loss": 5.0031, "mean_token_accuracy": 0.20307793468236923, "num_tokens": 55160860.0, "step": 31785 }, { "entropy": 5.79943962097168, "epoch": 2.4733709395059327, "grad_norm": 1.2109375, "learning_rate": 0.0004383173032339079, "loss": 5.0976, "mean_token_accuracy": 0.19712002128362655, "num_tokens": 55169891.0, "step": 31790 }, { "entropy": 5.7095544815063475, "epoch": 2.4737599688776504, "grad_norm": 1.1875, "learning_rate": 0.0004382982378811577, "loss": 4.9902, "mean_token_accuracy": 0.20529333502054214, "num_tokens": 55178283.0, "step": 31795 }, { "entropy": 5.78421311378479, "epoch": 2.474148998249368, "grad_norm": 1.328125, "learning_rate": 0.0004382791700506166, "loss": 5.0528, "mean_token_accuracy": 0.20129430741071702, "num_tokens": 55186683.0, "step": 31800 }, { "entropy": 5.721342658996582, "epoch": 2.4745380276210853, "grad_norm": 1.1796875, "learning_rate": 0.000438260099742574, "loss": 4.9198, "mean_token_accuracy": 0.21597544401884078, "num_tokens": 55194758.0, "step": 31805 }, { "entropy": 5.739154481887818, "epoch": 2.474927056992803, "grad_norm": 1.234375, "learning_rate": 0.0004382410269573192, "loss": 4.9769, "mean_token_accuracy": 0.20473675578832626, "num_tokens": 55203171.0, "step": 31810 }, { "entropy": 5.750705623626709, "epoch": 2.4753160863645203, "grad_norm": 1.28125, "learning_rate": 0.00043822195169514167, "loss": 5.0074, "mean_token_accuracy": 0.20244007855653762, "num_tokens": 55210942.0, "step": 31815 }, { "entropy": 5.767849683761597, "epoch": 2.475705115736238, "grad_norm": 1.1953125, "learning_rate": 0.00043820287395633086, "loss": 5.0962, "mean_token_accuracy": 0.198972587287426, "num_tokens": 55219937.0, "step": 31820 }, { "entropy": 5.774168491363525, "epoch": 2.4760941451079557, "grad_norm": 1.1484375, "learning_rate": 0.0004381837937411761, "loss": 5.047, "mean_token_accuracy": 0.20371242463588715, "num_tokens": 55229461.0, "step": 31825 }, { "entropy": 5.700222206115723, "epoch": 2.4764831744796734, "grad_norm": 1.3359375, "learning_rate": 0.00043816471104996706, "loss": 4.9346, "mean_token_accuracy": 0.20494415163993834, "num_tokens": 55237910.0, "step": 31830 }, { "entropy": 5.740320014953613, "epoch": 2.4768722038513906, "grad_norm": 1.1953125, "learning_rate": 0.0004381456258829933, "loss": 5.0065, "mean_token_accuracy": 0.19810711294412614, "num_tokens": 55246131.0, "step": 31835 }, { "entropy": 5.739391565322876, "epoch": 2.4772612332231083, "grad_norm": 1.2578125, "learning_rate": 0.00043812653824054426, "loss": 4.9897, "mean_token_accuracy": 0.2071801021695137, "num_tokens": 55254677.0, "step": 31840 }, { "entropy": 5.794559383392334, "epoch": 2.477650262594826, "grad_norm": 1.328125, "learning_rate": 0.0004381074481229097, "loss": 4.9836, "mean_token_accuracy": 0.2015093371272087, "num_tokens": 55263496.0, "step": 31845 }, { "entropy": 5.723418283462524, "epoch": 2.4780392919665433, "grad_norm": 1.21875, "learning_rate": 0.0004380883555303791, "loss": 4.9411, "mean_token_accuracy": 0.20745514035224916, "num_tokens": 55272614.0, "step": 31850 }, { "entropy": 5.747090530395508, "epoch": 2.478428321338261, "grad_norm": 1.1796875, "learning_rate": 0.0004380692604632424, "loss": 4.9844, "mean_token_accuracy": 0.2028457134962082, "num_tokens": 55281595.0, "step": 31855 }, { "entropy": 5.810975694656372, "epoch": 2.4788173507099787, "grad_norm": 1.1875, "learning_rate": 0.00043805016292178923, "loss": 5.089, "mean_token_accuracy": 0.20829716324806213, "num_tokens": 55291089.0, "step": 31860 }, { "entropy": 5.725016260147095, "epoch": 2.4792063800816964, "grad_norm": 1.25, "learning_rate": 0.0004380310629063094, "loss": 4.8796, "mean_token_accuracy": 0.2153559848666191, "num_tokens": 55299505.0, "step": 31865 }, { "entropy": 5.76038088798523, "epoch": 2.4795954094534136, "grad_norm": 1.296875, "learning_rate": 0.0004380119604170925, "loss": 5.0598, "mean_token_accuracy": 0.19794440418481826, "num_tokens": 55307383.0, "step": 31870 }, { "entropy": 5.777197980880738, "epoch": 2.4799844388251313, "grad_norm": 1.2890625, "learning_rate": 0.00043799285545442876, "loss": 5.0706, "mean_token_accuracy": 0.19132609963417052, "num_tokens": 55316312.0, "step": 31875 }, { "entropy": 5.807772874832153, "epoch": 2.480373468196849, "grad_norm": 1.09375, "learning_rate": 0.0004379737480186078, "loss": 5.0994, "mean_token_accuracy": 0.19863110035657883, "num_tokens": 55325818.0, "step": 31880 }, { "entropy": 5.745872354507446, "epoch": 2.4807624975685663, "grad_norm": 1.1171875, "learning_rate": 0.00043795463810991956, "loss": 5.0455, "mean_token_accuracy": 0.19534438997507095, "num_tokens": 55334641.0, "step": 31885 }, { "entropy": 5.812019014358521, "epoch": 2.481151526940284, "grad_norm": 1.2734375, "learning_rate": 0.0004379355257286541, "loss": 5.0246, "mean_token_accuracy": 0.20190017074346542, "num_tokens": 55343109.0, "step": 31890 }, { "entropy": 5.754524040222168, "epoch": 2.4815405563120017, "grad_norm": 1.234375, "learning_rate": 0.00043791641087510136, "loss": 4.9794, "mean_token_accuracy": 0.21192089468240738, "num_tokens": 55351832.0, "step": 31895 }, { "entropy": 5.780402278900146, "epoch": 2.4819295856837194, "grad_norm": 1.2421875, "learning_rate": 0.0004378972935495514, "loss": 5.0364, "mean_token_accuracy": 0.20486932545900344, "num_tokens": 55361688.0, "step": 31900 }, { "entropy": 5.808208751678467, "epoch": 2.4823186150554366, "grad_norm": 1.265625, "learning_rate": 0.0004378781737522943, "loss": 5.009, "mean_token_accuracy": 0.19845264852046968, "num_tokens": 55370572.0, "step": 31905 }, { "entropy": 5.7486252784729, "epoch": 2.4827076444271543, "grad_norm": 1.296875, "learning_rate": 0.00043785905148362007, "loss": 4.9951, "mean_token_accuracy": 0.21258895695209504, "num_tokens": 55379134.0, "step": 31910 }, { "entropy": 5.722753095626831, "epoch": 2.483096673798872, "grad_norm": 1.265625, "learning_rate": 0.00043783992674381903, "loss": 4.9737, "mean_token_accuracy": 0.20613017827272415, "num_tokens": 55387312.0, "step": 31915 }, { "entropy": 5.674282550811768, "epoch": 2.4834857031705893, "grad_norm": 1.125, "learning_rate": 0.00043782079953318126, "loss": 4.8764, "mean_token_accuracy": 0.211236609518528, "num_tokens": 55396208.0, "step": 31920 }, { "entropy": 5.766021251678467, "epoch": 2.483874732542307, "grad_norm": 1.21875, "learning_rate": 0.0004378016698519971, "loss": 5.0383, "mean_token_accuracy": 0.20523053258657456, "num_tokens": 55404142.0, "step": 31925 }, { "entropy": 5.724481678009033, "epoch": 2.4842637619140246, "grad_norm": 1.3125, "learning_rate": 0.00043778253770055666, "loss": 4.94, "mean_token_accuracy": 0.2143607333302498, "num_tokens": 55412227.0, "step": 31930 }, { "entropy": 5.6903464794158936, "epoch": 2.484652791285742, "grad_norm": 1.1953125, "learning_rate": 0.00043776340307915033, "loss": 4.9472, "mean_token_accuracy": 0.20541326254606246, "num_tokens": 55420566.0, "step": 31935 }, { "entropy": 5.742184591293335, "epoch": 2.4850418206574596, "grad_norm": 1.3046875, "learning_rate": 0.0004377442659880684, "loss": 4.9342, "mean_token_accuracy": 0.2088986814022064, "num_tokens": 55429456.0, "step": 31940 }, { "entropy": 5.7033790111541744, "epoch": 2.4854308500291773, "grad_norm": 1.3125, "learning_rate": 0.0004377251264276013, "loss": 4.9276, "mean_token_accuracy": 0.20734609961509703, "num_tokens": 55437607.0, "step": 31945 }, { "entropy": 5.659671401977539, "epoch": 2.4858198794008945, "grad_norm": 1.1875, "learning_rate": 0.00043770598439803936, "loss": 4.9472, "mean_token_accuracy": 0.21211216896772384, "num_tokens": 55446654.0, "step": 31950 }, { "entropy": 5.717013835906982, "epoch": 2.4862089087726122, "grad_norm": 1.2734375, "learning_rate": 0.00043768683989967304, "loss": 5.0241, "mean_token_accuracy": 0.20815762728452683, "num_tokens": 55454963.0, "step": 31955 }, { "entropy": 5.751030969619751, "epoch": 2.48659793814433, "grad_norm": 1.296875, "learning_rate": 0.00043766769293279294, "loss": 4.972, "mean_token_accuracy": 0.200008387863636, "num_tokens": 55463259.0, "step": 31960 }, { "entropy": 5.679394721984863, "epoch": 2.4869869675160476, "grad_norm": 1.171875, "learning_rate": 0.00043764854349768957, "loss": 4.9675, "mean_token_accuracy": 0.20318163335323333, "num_tokens": 55472390.0, "step": 31965 }, { "entropy": 5.774547958374024, "epoch": 2.487375996887765, "grad_norm": 1.3828125, "learning_rate": 0.00043762939159465333, "loss": 5.0457, "mean_token_accuracy": 0.20378268659114837, "num_tokens": 55480821.0, "step": 31970 }, { "entropy": 5.823787021636963, "epoch": 2.4877650262594826, "grad_norm": 1.2265625, "learning_rate": 0.00043761023722397495, "loss": 5.0471, "mean_token_accuracy": 0.20083165615797044, "num_tokens": 55489270.0, "step": 31975 }, { "entropy": 5.7002945899963375, "epoch": 2.4881540556312003, "grad_norm": 1.203125, "learning_rate": 0.000437591080385945, "loss": 4.9592, "mean_token_accuracy": 0.2086532697081566, "num_tokens": 55497811.0, "step": 31980 }, { "entropy": 5.730239295959473, "epoch": 2.4885430850029175, "grad_norm": 1.265625, "learning_rate": 0.0004375719210808543, "loss": 4.934, "mean_token_accuracy": 0.2009611189365387, "num_tokens": 55507068.0, "step": 31985 }, { "entropy": 5.71619668006897, "epoch": 2.4889321143746352, "grad_norm": 1.3203125, "learning_rate": 0.0004375527593089934, "loss": 4.9091, "mean_token_accuracy": 0.20773205161094666, "num_tokens": 55515922.0, "step": 31990 }, { "entropy": 5.735994291305542, "epoch": 2.489321143746353, "grad_norm": 1.125, "learning_rate": 0.0004375335950706531, "loss": 4.9887, "mean_token_accuracy": 0.20560373812913896, "num_tokens": 55524839.0, "step": 31995 }, { "entropy": 5.589614200592041, "epoch": 2.4897101731180706, "grad_norm": 1.1640625, "learning_rate": 0.0004375144283661242, "loss": 4.8748, "mean_token_accuracy": 0.2079756587743759, "num_tokens": 55534426.0, "step": 32000 }, { "entropy": 5.744394731521607, "epoch": 2.490099202489788, "grad_norm": 1.2109375, "learning_rate": 0.0004374952591956975, "loss": 5.0093, "mean_token_accuracy": 0.20008148550987243, "num_tokens": 55542773.0, "step": 32005 }, { "entropy": 5.797062540054322, "epoch": 2.4904882318615056, "grad_norm": 1.2421875, "learning_rate": 0.00043747608755966396, "loss": 4.9824, "mean_token_accuracy": 0.208916737139225, "num_tokens": 55551582.0, "step": 32010 }, { "entropy": 5.819371604919434, "epoch": 2.4908772612332233, "grad_norm": 1.21875, "learning_rate": 0.0004374569134583143, "loss": 5.1113, "mean_token_accuracy": 0.20079169869422914, "num_tokens": 55561067.0, "step": 32015 }, { "entropy": 5.711532926559448, "epoch": 2.4912662906049405, "grad_norm": 1.3203125, "learning_rate": 0.0004374377368919396, "loss": 4.9649, "mean_token_accuracy": 0.20974690169095994, "num_tokens": 55569677.0, "step": 32020 }, { "entropy": 5.821907472610474, "epoch": 2.4916553199766582, "grad_norm": 1.1796875, "learning_rate": 0.00043741855786083085, "loss": 5.1517, "mean_token_accuracy": 0.19647407680749893, "num_tokens": 55578391.0, "step": 32025 }, { "entropy": 5.825729560852051, "epoch": 2.492044349348376, "grad_norm": 1.1640625, "learning_rate": 0.00043739937636527894, "loss": 5.0448, "mean_token_accuracy": 0.2019263833761215, "num_tokens": 55587074.0, "step": 32030 }, { "entropy": 5.772421598434448, "epoch": 2.492433378720093, "grad_norm": 1.2421875, "learning_rate": 0.00043738019240557494, "loss": 4.9672, "mean_token_accuracy": 0.2033824309706688, "num_tokens": 55596944.0, "step": 32035 }, { "entropy": 5.782548332214356, "epoch": 2.492822408091811, "grad_norm": 1.1796875, "learning_rate": 0.00043736100598201, "loss": 4.9707, "mean_token_accuracy": 0.2072565123438835, "num_tokens": 55605763.0, "step": 32040 }, { "entropy": 5.699039554595947, "epoch": 2.4932114374635286, "grad_norm": 1.171875, "learning_rate": 0.0004373418170948752, "loss": 5.0059, "mean_token_accuracy": 0.2040828734636307, "num_tokens": 55614693.0, "step": 32045 }, { "entropy": 5.818109512329102, "epoch": 2.493600466835246, "grad_norm": 1.1953125, "learning_rate": 0.0004373226257444617, "loss": 5.159, "mean_token_accuracy": 0.1983616456389427, "num_tokens": 55623520.0, "step": 32050 }, { "entropy": 5.775056648254394, "epoch": 2.4939894962069635, "grad_norm": 1.3125, "learning_rate": 0.0004373034319310608, "loss": 4.9591, "mean_token_accuracy": 0.21263279616832734, "num_tokens": 55631818.0, "step": 32055 }, { "entropy": 5.829336404800415, "epoch": 2.4943785255786812, "grad_norm": 1.234375, "learning_rate": 0.00043728423565496367, "loss": 5.1061, "mean_token_accuracy": 0.19901492893695832, "num_tokens": 55641388.0, "step": 32060 }, { "entropy": 5.705246019363403, "epoch": 2.494767554950399, "grad_norm": 1.1015625, "learning_rate": 0.0004372650369164615, "loss": 4.9924, "mean_token_accuracy": 0.20553259402513505, "num_tokens": 55650374.0, "step": 32065 }, { "entropy": 5.75170407295227, "epoch": 2.495156584322116, "grad_norm": 1.28125, "learning_rate": 0.00043724583571584565, "loss": 5.0193, "mean_token_accuracy": 0.20523622632026672, "num_tokens": 55658598.0, "step": 32070 }, { "entropy": 5.756912517547607, "epoch": 2.495545613693834, "grad_norm": 1.25, "learning_rate": 0.00043722663205340753, "loss": 5.0558, "mean_token_accuracy": 0.19172070175409317, "num_tokens": 55666954.0, "step": 32075 }, { "entropy": 5.786532831192017, "epoch": 2.4959346430655516, "grad_norm": 1.2265625, "learning_rate": 0.0004372074259294384, "loss": 5.0028, "mean_token_accuracy": 0.20152796655893326, "num_tokens": 55675451.0, "step": 32080 }, { "entropy": 5.778197383880615, "epoch": 2.496323672437269, "grad_norm": 1.234375, "learning_rate": 0.0004371882173442299, "loss": 5.1166, "mean_token_accuracy": 0.19818124622106553, "num_tokens": 55683778.0, "step": 32085 }, { "entropy": 5.6984151840209964, "epoch": 2.4967127018089865, "grad_norm": 1.1953125, "learning_rate": 0.00043716900629807323, "loss": 4.9556, "mean_token_accuracy": 0.20971695482730865, "num_tokens": 55692440.0, "step": 32090 }, { "entropy": 5.730139636993409, "epoch": 2.497101731180704, "grad_norm": 1.2265625, "learning_rate": 0.00043714979279126006, "loss": 4.9795, "mean_token_accuracy": 0.20638670772314072, "num_tokens": 55700648.0, "step": 32095 }, { "entropy": 5.737063407897949, "epoch": 2.497490760552422, "grad_norm": 1.2734375, "learning_rate": 0.0004371305768240818, "loss": 4.97, "mean_token_accuracy": 0.2069748967885971, "num_tokens": 55709515.0, "step": 32100 }, { "entropy": 5.768846130371093, "epoch": 2.497879789924139, "grad_norm": 1.25, "learning_rate": 0.0004371113583968302, "loss": 5.0599, "mean_token_accuracy": 0.20146727412939072, "num_tokens": 55717876.0, "step": 32105 }, { "entropy": 5.735267639160156, "epoch": 2.498268819295857, "grad_norm": 1.2265625, "learning_rate": 0.0004370921375097967, "loss": 4.9965, "mean_token_accuracy": 0.20283293575048447, "num_tokens": 55726330.0, "step": 32110 }, { "entropy": 5.762791013717651, "epoch": 2.4986578486675746, "grad_norm": 1.125, "learning_rate": 0.00043707291416327307, "loss": 5.0682, "mean_token_accuracy": 0.20141904056072235, "num_tokens": 55736102.0, "step": 32115 }, { "entropy": 5.802491569519043, "epoch": 2.499046878039292, "grad_norm": 1.40625, "learning_rate": 0.0004370536883575509, "loss": 5.0872, "mean_token_accuracy": 0.20419587641954423, "num_tokens": 55744022.0, "step": 32120 }, { "entropy": 5.764334774017334, "epoch": 2.4994359074110095, "grad_norm": 1.2578125, "learning_rate": 0.0004370344600929219, "loss": 5.0217, "mean_token_accuracy": 0.1992722675204277, "num_tokens": 55752613.0, "step": 32125 }, { "entropy": 5.752253675460816, "epoch": 2.499824936782727, "grad_norm": 1.125, "learning_rate": 0.0004370152293696779, "loss": 4.9729, "mean_token_accuracy": 0.21064266562461853, "num_tokens": 55761402.0, "step": 32130 }, { "entropy": 5.732954216003418, "epoch": 2.500213966154445, "grad_norm": 1.1875, "learning_rate": 0.0004369959961881107, "loss": 4.9117, "mean_token_accuracy": 0.20638342201709747, "num_tokens": 55769630.0, "step": 32135 }, { "entropy": 5.704201078414917, "epoch": 2.500602995526162, "grad_norm": 1.3125, "learning_rate": 0.000436976760548512, "loss": 5.0143, "mean_token_accuracy": 0.21001150012016295, "num_tokens": 55777928.0, "step": 32140 }, { "entropy": 5.718116235733032, "epoch": 2.50099202489788, "grad_norm": 1.2265625, "learning_rate": 0.00043695752245117393, "loss": 5.0205, "mean_token_accuracy": 0.2009720668196678, "num_tokens": 55786585.0, "step": 32145 }, { "entropy": 5.735006332397461, "epoch": 2.501381054269597, "grad_norm": 1.1953125, "learning_rate": 0.0004369382818963882, "loss": 4.9024, "mean_token_accuracy": 0.21772377341985702, "num_tokens": 55795565.0, "step": 32150 }, { "entropy": 5.7350903987884525, "epoch": 2.501770083641315, "grad_norm": 1.2265625, "learning_rate": 0.0004369190388844467, "loss": 5.002, "mean_token_accuracy": 0.20105064213275908, "num_tokens": 55804211.0, "step": 32155 }, { "entropy": 5.7108855724334715, "epoch": 2.5021591130130325, "grad_norm": 1.234375, "learning_rate": 0.00043689979341564154, "loss": 5.0133, "mean_token_accuracy": 0.2048020452260971, "num_tokens": 55812604.0, "step": 32160 }, { "entropy": 5.752273368835449, "epoch": 2.50254814238475, "grad_norm": 1.2890625, "learning_rate": 0.0004368805454902648, "loss": 4.9705, "mean_token_accuracy": 0.20754743218421937, "num_tokens": 55821293.0, "step": 32165 }, { "entropy": 5.717906951904297, "epoch": 2.5029371717564675, "grad_norm": 1.2109375, "learning_rate": 0.00043686129510860826, "loss": 4.9297, "mean_token_accuracy": 0.2031100198626518, "num_tokens": 55830423.0, "step": 32170 }, { "entropy": 5.792725658416748, "epoch": 2.503326201128185, "grad_norm": 1.265625, "learning_rate": 0.00043684204227096435, "loss": 5.0088, "mean_token_accuracy": 0.20371535867452623, "num_tokens": 55838889.0, "step": 32175 }, { "entropy": 5.776485109329224, "epoch": 2.503715230499903, "grad_norm": 1.2890625, "learning_rate": 0.000436822786977625, "loss": 5.0367, "mean_token_accuracy": 0.20217114090919494, "num_tokens": 55846670.0, "step": 32180 }, { "entropy": 5.7591992855072025, "epoch": 2.50410425987162, "grad_norm": 1.25, "learning_rate": 0.00043680352922888244, "loss": 5.04, "mean_token_accuracy": 0.20684549808502198, "num_tokens": 55855341.0, "step": 32185 }, { "entropy": 5.779816293716431, "epoch": 2.504493289243338, "grad_norm": 1.3359375, "learning_rate": 0.0004367842690250288, "loss": 4.9991, "mean_token_accuracy": 0.20337263196706773, "num_tokens": 55863491.0, "step": 32190 }, { "entropy": 5.692119836807251, "epoch": 2.5048823186150555, "grad_norm": 1.328125, "learning_rate": 0.0004367650063663565, "loss": 4.9117, "mean_token_accuracy": 0.21335217505693435, "num_tokens": 55872346.0, "step": 32195 }, { "entropy": 5.689235258102417, "epoch": 2.505271347986773, "grad_norm": 1.1953125, "learning_rate": 0.0004367457412531576, "loss": 4.9379, "mean_token_accuracy": 0.21118418127298355, "num_tokens": 55880672.0, "step": 32200 }, { "entropy": 5.808881855010986, "epoch": 2.5056603773584905, "grad_norm": 1.296875, "learning_rate": 0.0004367264736857245, "loss": 5.0577, "mean_token_accuracy": 0.20485388189554216, "num_tokens": 55888938.0, "step": 32205 }, { "entropy": 5.770830678939819, "epoch": 2.506049406730208, "grad_norm": 1.15625, "learning_rate": 0.0004367072036643497, "loss": 4.9413, "mean_token_accuracy": 0.2053830936551094, "num_tokens": 55897522.0, "step": 32210 }, { "entropy": 5.779721784591675, "epoch": 2.506438436101926, "grad_norm": 1.3125, "learning_rate": 0.00043668793118932536, "loss": 4.9787, "mean_token_accuracy": 0.2041122019290924, "num_tokens": 55905425.0, "step": 32215 }, { "entropy": 5.70716962814331, "epoch": 2.506827465473643, "grad_norm": 1.2265625, "learning_rate": 0.00043666865626094405, "loss": 4.9948, "mean_token_accuracy": 0.20949369221925734, "num_tokens": 55913990.0, "step": 32220 }, { "entropy": 5.833953523635865, "epoch": 2.507216494845361, "grad_norm": 1.2578125, "learning_rate": 0.00043664937887949825, "loss": 5.1435, "mean_token_accuracy": 0.19138181060552598, "num_tokens": 55922899.0, "step": 32225 }, { "entropy": 5.7639604091644285, "epoch": 2.5076055242170785, "grad_norm": 1.234375, "learning_rate": 0.0004366300990452803, "loss": 5.0029, "mean_token_accuracy": 0.20684336125850677, "num_tokens": 55930935.0, "step": 32230 }, { "entropy": 5.814674329757691, "epoch": 2.507994553588796, "grad_norm": 1.34375, "learning_rate": 0.00043661081675858295, "loss": 5.0191, "mean_token_accuracy": 0.20735725164413452, "num_tokens": 55939258.0, "step": 32235 }, { "entropy": 5.729979562759399, "epoch": 2.5083835829605134, "grad_norm": 1.203125, "learning_rate": 0.00043659153201969865, "loss": 5.0309, "mean_token_accuracy": 0.20199084877967835, "num_tokens": 55947672.0, "step": 32240 }, { "entropy": 5.736585330963135, "epoch": 2.508772612332231, "grad_norm": 1.2578125, "learning_rate": 0.0004365722448289201, "loss": 5.0356, "mean_token_accuracy": 0.2096530392765999, "num_tokens": 55956251.0, "step": 32245 }, { "entropy": 5.702652072906494, "epoch": 2.5091616417039484, "grad_norm": 1.2109375, "learning_rate": 0.0004365529551865399, "loss": 4.8701, "mean_token_accuracy": 0.2121596157550812, "num_tokens": 55965038.0, "step": 32250 }, { "entropy": 5.822845697402954, "epoch": 2.509550671075666, "grad_norm": 1.2265625, "learning_rate": 0.00043653366309285066, "loss": 5.0801, "mean_token_accuracy": 0.19495744109153748, "num_tokens": 55973140.0, "step": 32255 }, { "entropy": 5.743675374984742, "epoch": 2.509939700447384, "grad_norm": 1.28125, "learning_rate": 0.0004365143685481452, "loss": 5.0338, "mean_token_accuracy": 0.19905417859554292, "num_tokens": 55981097.0, "step": 32260 }, { "entropy": 5.702450895309449, "epoch": 2.5103287298191015, "grad_norm": 1.1796875, "learning_rate": 0.0004364950715527164, "loss": 4.8863, "mean_token_accuracy": 0.2115337923169136, "num_tokens": 55990077.0, "step": 32265 }, { "entropy": 5.765177869796753, "epoch": 2.5107177591908187, "grad_norm": 1.1796875, "learning_rate": 0.0004364757721068568, "loss": 5.0217, "mean_token_accuracy": 0.20931134521961212, "num_tokens": 55999289.0, "step": 32270 }, { "entropy": 5.740087366104126, "epoch": 2.5111067885625364, "grad_norm": 1.234375, "learning_rate": 0.00043645647021085945, "loss": 4.9436, "mean_token_accuracy": 0.21452676355838776, "num_tokens": 56007736.0, "step": 32275 }, { "entropy": 5.734495210647583, "epoch": 2.511495817934254, "grad_norm": 1.25, "learning_rate": 0.00043643716586501706, "loss": 4.9392, "mean_token_accuracy": 0.20805250108242035, "num_tokens": 56016623.0, "step": 32280 }, { "entropy": 5.753150081634521, "epoch": 2.5118848473059714, "grad_norm": 1.3046875, "learning_rate": 0.00043641785906962276, "loss": 5.0104, "mean_token_accuracy": 0.20457341521978378, "num_tokens": 56024536.0, "step": 32285 }, { "entropy": 5.740625381469727, "epoch": 2.512273876677689, "grad_norm": 1.234375, "learning_rate": 0.0004363985498249693, "loss": 5.0371, "mean_token_accuracy": 0.2015567034482956, "num_tokens": 56033618.0, "step": 32290 }, { "entropy": 5.788509368896484, "epoch": 2.512662906049407, "grad_norm": 1.2890625, "learning_rate": 0.00043637923813134974, "loss": 5.0615, "mean_token_accuracy": 0.2025325432419777, "num_tokens": 56042836.0, "step": 32295 }, { "entropy": 5.768290042877197, "epoch": 2.5130519354211245, "grad_norm": 1.1796875, "learning_rate": 0.00043635992398905713, "loss": 4.9952, "mean_token_accuracy": 0.19941093474626542, "num_tokens": 56051296.0, "step": 32300 }, { "entropy": 5.744476270675659, "epoch": 2.5134409647928417, "grad_norm": 1.2578125, "learning_rate": 0.0004363406073983844, "loss": 4.972, "mean_token_accuracy": 0.21004229933023452, "num_tokens": 56060093.0, "step": 32305 }, { "entropy": 5.781641483306885, "epoch": 2.5138299941645594, "grad_norm": 1.265625, "learning_rate": 0.00043632128835962485, "loss": 4.9675, "mean_token_accuracy": 0.20435622781515123, "num_tokens": 56068441.0, "step": 32310 }, { "entropy": 5.719205331802368, "epoch": 2.514219023536277, "grad_norm": 1.1015625, "learning_rate": 0.00043630196687307156, "loss": 4.9269, "mean_token_accuracy": 0.2032313972711563, "num_tokens": 56076592.0, "step": 32315 }, { "entropy": 5.69644079208374, "epoch": 2.5146080529079944, "grad_norm": 1.3203125, "learning_rate": 0.0004362826429390176, "loss": 4.9218, "mean_token_accuracy": 0.21266957521438598, "num_tokens": 56085299.0, "step": 32320 }, { "entropy": 5.724690389633179, "epoch": 2.514997082279712, "grad_norm": 1.203125, "learning_rate": 0.00043626331655775624, "loss": 4.9456, "mean_token_accuracy": 0.21317402571439742, "num_tokens": 56093891.0, "step": 32325 }, { "entropy": 5.745850419998169, "epoch": 2.51538611165143, "grad_norm": 1.28125, "learning_rate": 0.00043624398772958075, "loss": 5.073, "mean_token_accuracy": 0.19919949173927307, "num_tokens": 56102767.0, "step": 32330 }, { "entropy": 5.725226211547851, "epoch": 2.5157751410231475, "grad_norm": 1.2578125, "learning_rate": 0.0004362246564547844, "loss": 4.977, "mean_token_accuracy": 0.20842111557722093, "num_tokens": 56110861.0, "step": 32335 }, { "entropy": 5.79917802810669, "epoch": 2.5161641703948647, "grad_norm": 1.25, "learning_rate": 0.00043620532273366044, "loss": 5.0871, "mean_token_accuracy": 0.196714124083519, "num_tokens": 56119842.0, "step": 32340 }, { "entropy": 5.803333473205567, "epoch": 2.5165531997665824, "grad_norm": 1.265625, "learning_rate": 0.0004361859865665024, "loss": 5.0577, "mean_token_accuracy": 0.20200078040361405, "num_tokens": 56128246.0, "step": 32345 }, { "entropy": 5.775778198242188, "epoch": 2.5169422291382997, "grad_norm": 1.15625, "learning_rate": 0.00043616664795360346, "loss": 5.0466, "mean_token_accuracy": 0.2056443825364113, "num_tokens": 56137320.0, "step": 32350 }, { "entropy": 5.740857982635498, "epoch": 2.5173312585100174, "grad_norm": 1.21875, "learning_rate": 0.00043614730689525716, "loss": 4.9751, "mean_token_accuracy": 0.20886615216732024, "num_tokens": 56145739.0, "step": 32355 }, { "entropy": 5.741092014312744, "epoch": 2.517720287881735, "grad_norm": 1.3125, "learning_rate": 0.00043612796339175707, "loss": 4.9752, "mean_token_accuracy": 0.21255193799734115, "num_tokens": 56154526.0, "step": 32360 }, { "entropy": 5.824405384063721, "epoch": 2.5181093172534528, "grad_norm": 1.21875, "learning_rate": 0.00043610861744339653, "loss": 5.1498, "mean_token_accuracy": 0.19722249656915664, "num_tokens": 56163209.0, "step": 32365 }, { "entropy": 5.754294395446777, "epoch": 2.5184983466251705, "grad_norm": 1.1328125, "learning_rate": 0.0004360892690504692, "loss": 4.981, "mean_token_accuracy": 0.2129140540957451, "num_tokens": 56171541.0, "step": 32370 }, { "entropy": 5.7471682071685795, "epoch": 2.5188873759968877, "grad_norm": 1.265625, "learning_rate": 0.0004360699182132685, "loss": 4.9901, "mean_token_accuracy": 0.204765222966671, "num_tokens": 56180309.0, "step": 32375 }, { "entropy": 5.789842319488526, "epoch": 2.5192764053686054, "grad_norm": 1.234375, "learning_rate": 0.00043605056493208825, "loss": 5.0628, "mean_token_accuracy": 0.20925644934177398, "num_tokens": 56188916.0, "step": 32380 }, { "entropy": 5.678201484680176, "epoch": 2.5196654347403227, "grad_norm": 1.15625, "learning_rate": 0.000436031209207222, "loss": 4.8876, "mean_token_accuracy": 0.2129327893257141, "num_tokens": 56197358.0, "step": 32385 }, { "entropy": 5.694745874404907, "epoch": 2.5200544641120404, "grad_norm": 1.265625, "learning_rate": 0.00043601185103896346, "loss": 5.0198, "mean_token_accuracy": 0.19967437982559205, "num_tokens": 56206060.0, "step": 32390 }, { "entropy": 5.704558324813843, "epoch": 2.520443493483758, "grad_norm": 1.3828125, "learning_rate": 0.00043599249042760636, "loss": 4.9574, "mean_token_accuracy": 0.19709437638521193, "num_tokens": 56214539.0, "step": 32395 }, { "entropy": 5.66460018157959, "epoch": 2.5208325228554758, "grad_norm": 1.3125, "learning_rate": 0.00043597312737344446, "loss": 4.8599, "mean_token_accuracy": 0.21213049292564393, "num_tokens": 56222386.0, "step": 32400 }, { "entropy": 5.6303221702575685, "epoch": 2.521221552227193, "grad_norm": 1.1796875, "learning_rate": 0.00043595376187677157, "loss": 4.9558, "mean_token_accuracy": 0.20472346395254135, "num_tokens": 56231036.0, "step": 32405 }, { "entropy": 5.746415758132935, "epoch": 2.5216105815989107, "grad_norm": 1.2578125, "learning_rate": 0.00043593439393788147, "loss": 5.024, "mean_token_accuracy": 0.2045419156551361, "num_tokens": 56239494.0, "step": 32410 }, { "entropy": 5.777943563461304, "epoch": 2.5219996109706284, "grad_norm": 1.3125, "learning_rate": 0.0004359150235570682, "loss": 5.0377, "mean_token_accuracy": 0.20532775819301605, "num_tokens": 56248075.0, "step": 32415 }, { "entropy": 5.72051477432251, "epoch": 2.5223886403423457, "grad_norm": 1.2265625, "learning_rate": 0.0004358956507346255, "loss": 5.0495, "mean_token_accuracy": 0.2032727673649788, "num_tokens": 56256630.0, "step": 32420 }, { "entropy": 5.687564659118652, "epoch": 2.5227776697140634, "grad_norm": 1.3046875, "learning_rate": 0.0004358762754708474, "loss": 4.8752, "mean_token_accuracy": 0.21148403882980346, "num_tokens": 56264922.0, "step": 32425 }, { "entropy": 5.78585000038147, "epoch": 2.523166699085781, "grad_norm": 1.28125, "learning_rate": 0.00043585689776602795, "loss": 5.1095, "mean_token_accuracy": 0.20018740445375444, "num_tokens": 56273996.0, "step": 32430 }, { "entropy": 5.8147501945495605, "epoch": 2.5235557284574988, "grad_norm": 1.203125, "learning_rate": 0.00043583751762046104, "loss": 5.0484, "mean_token_accuracy": 0.2066384106874466, "num_tokens": 56283583.0, "step": 32435 }, { "entropy": 5.780672693252564, "epoch": 2.523944757829216, "grad_norm": 1.2421875, "learning_rate": 0.0004358181350344408, "loss": 4.9893, "mean_token_accuracy": 0.2115368887782097, "num_tokens": 56292197.0, "step": 32440 }, { "entropy": 5.783722066879273, "epoch": 2.5243337872009337, "grad_norm": 1.1640625, "learning_rate": 0.0004357987500082613, "loss": 5.0566, "mean_token_accuracy": 0.201078599691391, "num_tokens": 56301177.0, "step": 32445 }, { "entropy": 5.789465093612671, "epoch": 2.524722816572651, "grad_norm": 1.171875, "learning_rate": 0.00043577936254221675, "loss": 5.0121, "mean_token_accuracy": 0.20161508470773698, "num_tokens": 56310024.0, "step": 32450 }, { "entropy": 5.804666376113891, "epoch": 2.5251118459443687, "grad_norm": 1.1875, "learning_rate": 0.0004357599726366013, "loss": 5.0182, "mean_token_accuracy": 0.19669306874275208, "num_tokens": 56318190.0, "step": 32455 }, { "entropy": 5.690086841583252, "epoch": 2.5255008753160864, "grad_norm": 1.1640625, "learning_rate": 0.0004357405802917091, "loss": 4.8663, "mean_token_accuracy": 0.2109483078122139, "num_tokens": 56326443.0, "step": 32460 }, { "entropy": 5.699089574813843, "epoch": 2.525889904687804, "grad_norm": 1.203125, "learning_rate": 0.0004357211855078345, "loss": 4.9762, "mean_token_accuracy": 0.20818455517292023, "num_tokens": 56335263.0, "step": 32465 }, { "entropy": 5.78942346572876, "epoch": 2.5262789340595218, "grad_norm": 1.34375, "learning_rate": 0.00043570178828527157, "loss": 5.0373, "mean_token_accuracy": 0.20858552008867265, "num_tokens": 56343202.0, "step": 32470 }, { "entropy": 5.716124057769775, "epoch": 2.526667963431239, "grad_norm": 1.3046875, "learning_rate": 0.0004356823886243149, "loss": 4.9253, "mean_token_accuracy": 0.20922564268112182, "num_tokens": 56352150.0, "step": 32475 }, { "entropy": 5.656986904144287, "epoch": 2.5270569928029567, "grad_norm": 1.265625, "learning_rate": 0.00043566298652525875, "loss": 4.8984, "mean_token_accuracy": 0.21658487915992736, "num_tokens": 56360460.0, "step": 32480 }, { "entropy": 5.666233682632447, "epoch": 2.527446022174674, "grad_norm": 1.203125, "learning_rate": 0.00043564358198839746, "loss": 5.0599, "mean_token_accuracy": 0.20606822222471238, "num_tokens": 56369889.0, "step": 32485 }, { "entropy": 5.755233907699585, "epoch": 2.5278350515463917, "grad_norm": 1.2890625, "learning_rate": 0.0004356241750140256, "loss": 4.9122, "mean_token_accuracy": 0.21050177216529847, "num_tokens": 56378500.0, "step": 32490 }, { "entropy": 5.82009220123291, "epoch": 2.5282240809181094, "grad_norm": 1.2421875, "learning_rate": 0.00043560476560243743, "loss": 5.0644, "mean_token_accuracy": 0.20119451135396957, "num_tokens": 56387390.0, "step": 32495 }, { "entropy": 5.811213064193725, "epoch": 2.528613110289827, "grad_norm": 1.2421875, "learning_rate": 0.0004355853537539276, "loss": 5.0546, "mean_token_accuracy": 0.2040078490972519, "num_tokens": 56395782.0, "step": 32500 }, { "entropy": 5.777859687805176, "epoch": 2.5290021396615443, "grad_norm": 1.2734375, "learning_rate": 0.0004355659394687906, "loss": 4.944, "mean_token_accuracy": 0.2110195592045784, "num_tokens": 56405023.0, "step": 32505 }, { "entropy": 5.835201454162598, "epoch": 2.529391169033262, "grad_norm": 1.171875, "learning_rate": 0.0004355465227473211, "loss": 5.0801, "mean_token_accuracy": 0.2027295023202896, "num_tokens": 56413669.0, "step": 32510 }, { "entropy": 5.749133348464966, "epoch": 2.5297801984049797, "grad_norm": 1.2578125, "learning_rate": 0.0004355271035898136, "loss": 5.0256, "mean_token_accuracy": 0.20584987848997116, "num_tokens": 56422286.0, "step": 32515 }, { "entropy": 5.777972936630249, "epoch": 2.530169227776697, "grad_norm": 1.328125, "learning_rate": 0.0004355076819965628, "loss": 5.0365, "mean_token_accuracy": 0.20526931285858155, "num_tokens": 56430891.0, "step": 32520 }, { "entropy": 5.777743864059448, "epoch": 2.5305582571484146, "grad_norm": 1.3046875, "learning_rate": 0.00043548825796786353, "loss": 5.0328, "mean_token_accuracy": 0.20165961235761642, "num_tokens": 56439231.0, "step": 32525 }, { "entropy": 5.643569898605347, "epoch": 2.5309472865201323, "grad_norm": 1.3046875, "learning_rate": 0.00043546883150401023, "loss": 4.7817, "mean_token_accuracy": 0.22766311466693878, "num_tokens": 56447508.0, "step": 32530 }, { "entropy": 5.6794380187988285, "epoch": 2.53133631589185, "grad_norm": 1.171875, "learning_rate": 0.00043544940260529787, "loss": 4.9725, "mean_token_accuracy": 0.2097108319401741, "num_tokens": 56456049.0, "step": 32535 }, { "entropy": 5.731295585632324, "epoch": 2.5317253452635673, "grad_norm": 1.3125, "learning_rate": 0.0004354299712720213, "loss": 5.0276, "mean_token_accuracy": 0.20618246048688887, "num_tokens": 56464775.0, "step": 32540 }, { "entropy": 5.743636226654052, "epoch": 2.532114374635285, "grad_norm": 1.21875, "learning_rate": 0.0004354105375044752, "loss": 4.9759, "mean_token_accuracy": 0.209343783557415, "num_tokens": 56473835.0, "step": 32545 }, { "entropy": 5.781631135940552, "epoch": 2.5325034040070027, "grad_norm": 1.234375, "learning_rate": 0.00043539110130295445, "loss": 4.9995, "mean_token_accuracy": 0.20376506745815276, "num_tokens": 56482488.0, "step": 32550 }, { "entropy": 5.726345109939575, "epoch": 2.53289243337872, "grad_norm": 1.0859375, "learning_rate": 0.00043537166266775405, "loss": 4.9386, "mean_token_accuracy": 0.20942093580961227, "num_tokens": 56491928.0, "step": 32555 }, { "entropy": 5.677356815338134, "epoch": 2.5332814627504376, "grad_norm": 1.390625, "learning_rate": 0.000435352221599169, "loss": 4.9136, "mean_token_accuracy": 0.2085426241159439, "num_tokens": 56500247.0, "step": 32560 }, { "entropy": 5.741963148117065, "epoch": 2.5336704921221553, "grad_norm": 1.25, "learning_rate": 0.0004353327780974941, "loss": 5.0199, "mean_token_accuracy": 0.2032533809542656, "num_tokens": 56509507.0, "step": 32565 }, { "entropy": 5.816419887542724, "epoch": 2.534059521493873, "grad_norm": 1.1640625, "learning_rate": 0.0004353133321630246, "loss": 5.0568, "mean_token_accuracy": 0.203626349568367, "num_tokens": 56517895.0, "step": 32570 }, { "entropy": 5.713904953002929, "epoch": 2.5344485508655903, "grad_norm": 1.203125, "learning_rate": 0.0004352938837960554, "loss": 4.9345, "mean_token_accuracy": 0.21091684699058533, "num_tokens": 56526894.0, "step": 32575 }, { "entropy": 5.752105474472046, "epoch": 2.534837580237308, "grad_norm": 1.2421875, "learning_rate": 0.00043527443299688166, "loss": 5.0125, "mean_token_accuracy": 0.20263675153255462, "num_tokens": 56535970.0, "step": 32580 }, { "entropy": 5.819946002960205, "epoch": 2.5352266096090252, "grad_norm": 1.2421875, "learning_rate": 0.00043525497976579843, "loss": 4.9976, "mean_token_accuracy": 0.20278133749961852, "num_tokens": 56544385.0, "step": 32585 }, { "entropy": 5.701795530319214, "epoch": 2.535615638980743, "grad_norm": 1.328125, "learning_rate": 0.000435235524103101, "loss": 4.9881, "mean_token_accuracy": 0.2026505947113037, "num_tokens": 56552645.0, "step": 32590 }, { "entropy": 5.847436046600341, "epoch": 2.5360046683524606, "grad_norm": 1.2421875, "learning_rate": 0.0004352160660090846, "loss": 5.0903, "mean_token_accuracy": 0.19805312305688857, "num_tokens": 56562223.0, "step": 32595 }, { "entropy": 5.798403882980347, "epoch": 2.5363936977241783, "grad_norm": 1.1953125, "learning_rate": 0.0004351966054840443, "loss": 4.9769, "mean_token_accuracy": 0.20716869831085205, "num_tokens": 56571015.0, "step": 32600 }, { "entropy": 5.695578670501709, "epoch": 2.5367827270958956, "grad_norm": 1.2578125, "learning_rate": 0.00043517714252827556, "loss": 4.9317, "mean_token_accuracy": 0.21334373205900192, "num_tokens": 56579566.0, "step": 32605 }, { "entropy": 5.798113250732422, "epoch": 2.5371717564676133, "grad_norm": 1.2421875, "learning_rate": 0.0004351576771420737, "loss": 5.0241, "mean_token_accuracy": 0.20136623382568358, "num_tokens": 56588231.0, "step": 32610 }, { "entropy": 5.776970291137696, "epoch": 2.537560785839331, "grad_norm": 1.234375, "learning_rate": 0.0004351382093257339, "loss": 4.9992, "mean_token_accuracy": 0.2088244378566742, "num_tokens": 56596581.0, "step": 32615 }, { "entropy": 5.687603521347046, "epoch": 2.5379498152110482, "grad_norm": 1.140625, "learning_rate": 0.0004351187390795517, "loss": 4.9235, "mean_token_accuracy": 0.21420602798461913, "num_tokens": 56605440.0, "step": 32620 }, { "entropy": 5.748534917831421, "epoch": 2.538338844582766, "grad_norm": 1.2890625, "learning_rate": 0.00043509926640382244, "loss": 5.0903, "mean_token_accuracy": 0.2027679890394211, "num_tokens": 56614819.0, "step": 32625 }, { "entropy": 5.728839635848999, "epoch": 2.5387278739544836, "grad_norm": 1.2578125, "learning_rate": 0.0004350797912988417, "loss": 5.0456, "mean_token_accuracy": 0.2071196585893631, "num_tokens": 56623372.0, "step": 32630 }, { "entropy": 5.7032088279724125, "epoch": 2.5391169033262013, "grad_norm": 1.2109375, "learning_rate": 0.0004350603137649049, "loss": 4.9484, "mean_token_accuracy": 0.2035582482814789, "num_tokens": 56631768.0, "step": 32635 }, { "entropy": 5.728284502029419, "epoch": 2.5395059326979186, "grad_norm": 1.3125, "learning_rate": 0.0004350408338023075, "loss": 4.9772, "mean_token_accuracy": 0.20788359194993972, "num_tokens": 56640135.0, "step": 32640 }, { "entropy": 5.694622659683228, "epoch": 2.5398949620696363, "grad_norm": 1.328125, "learning_rate": 0.0004350213514113453, "loss": 4.8769, "mean_token_accuracy": 0.21244669556617737, "num_tokens": 56648007.0, "step": 32645 }, { "entropy": 5.786375665664673, "epoch": 2.540283991441354, "grad_norm": 1.2734375, "learning_rate": 0.00043500186659231377, "loss": 5.0727, "mean_token_accuracy": 0.20343949049711227, "num_tokens": 56656926.0, "step": 32650 }, { "entropy": 5.821308326721192, "epoch": 2.5406730208130712, "grad_norm": 1.2421875, "learning_rate": 0.0004349823793455086, "loss": 5.0943, "mean_token_accuracy": 0.2006352052092552, "num_tokens": 56665404.0, "step": 32655 }, { "entropy": 5.756999921798706, "epoch": 2.541062050184789, "grad_norm": 1.28125, "learning_rate": 0.00043496288967122547, "loss": 5.0063, "mean_token_accuracy": 0.20426109582185745, "num_tokens": 56673922.0, "step": 32660 }, { "entropy": 5.746078014373779, "epoch": 2.5414510795565066, "grad_norm": 1.28125, "learning_rate": 0.00043494339756976007, "loss": 4.9741, "mean_token_accuracy": 0.2039829134941101, "num_tokens": 56682062.0, "step": 32665 }, { "entropy": 5.791140174865722, "epoch": 2.5418401089282243, "grad_norm": 1.171875, "learning_rate": 0.0004349239030414082, "loss": 5.0921, "mean_token_accuracy": 0.19989509582519532, "num_tokens": 56690571.0, "step": 32670 }, { "entropy": 5.778707885742188, "epoch": 2.5422291382999416, "grad_norm": 1.2265625, "learning_rate": 0.00043490440608646557, "loss": 5.0208, "mean_token_accuracy": 0.2057028204202652, "num_tokens": 56699599.0, "step": 32675 }, { "entropy": 5.756120729446411, "epoch": 2.5426181676716593, "grad_norm": 1.171875, "learning_rate": 0.00043488490670522817, "loss": 4.9498, "mean_token_accuracy": 0.2124951884150505, "num_tokens": 56708120.0, "step": 32680 }, { "entropy": 5.698273086547852, "epoch": 2.5430071970433765, "grad_norm": 1.21875, "learning_rate": 0.0004348654048979918, "loss": 4.97, "mean_token_accuracy": 0.20708248168230056, "num_tokens": 56716339.0, "step": 32685 }, { "entropy": 5.7037496089935305, "epoch": 2.543396226415094, "grad_norm": 1.296875, "learning_rate": 0.0004348459006650523, "loss": 4.8779, "mean_token_accuracy": 0.2205042839050293, "num_tokens": 56724157.0, "step": 32690 }, { "entropy": 5.756705331802368, "epoch": 2.543785255786812, "grad_norm": 1.2890625, "learning_rate": 0.00043482639400670576, "loss": 5.0321, "mean_token_accuracy": 0.19947439581155776, "num_tokens": 56733075.0, "step": 32695 }, { "entropy": 5.671201944351196, "epoch": 2.5441742851585296, "grad_norm": 1.1875, "learning_rate": 0.000434806884923248, "loss": 4.92, "mean_token_accuracy": 0.2153444766998291, "num_tokens": 56742184.0, "step": 32700 }, { "entropy": 5.7458521842956545, "epoch": 2.5445633145302473, "grad_norm": 1.3046875, "learning_rate": 0.0004347873734149752, "loss": 4.9093, "mean_token_accuracy": 0.20738874226808549, "num_tokens": 56750559.0, "step": 32705 }, { "entropy": 5.769989919662476, "epoch": 2.5449523439019646, "grad_norm": 1.234375, "learning_rate": 0.00043476785948218325, "loss": 5.0645, "mean_token_accuracy": 0.19844296723604202, "num_tokens": 56760031.0, "step": 32710 }, { "entropy": 5.7385557174682615, "epoch": 2.5453413732736823, "grad_norm": 1.171875, "learning_rate": 0.00043474834312516835, "loss": 5.0385, "mean_token_accuracy": 0.20062004625797272, "num_tokens": 56768496.0, "step": 32715 }, { "entropy": 5.751664781570435, "epoch": 2.5457304026453995, "grad_norm": 1.34375, "learning_rate": 0.0004347288243442266, "loss": 5.0049, "mean_token_accuracy": 0.2069281443953514, "num_tokens": 56776876.0, "step": 32720 }, { "entropy": 5.764461994171143, "epoch": 2.546119432017117, "grad_norm": 1.25, "learning_rate": 0.0004347093031396543, "loss": 4.9753, "mean_token_accuracy": 0.2123896673321724, "num_tokens": 56785661.0, "step": 32725 }, { "entropy": 5.71371374130249, "epoch": 2.546508461388835, "grad_norm": 1.1484375, "learning_rate": 0.0004346897795117474, "loss": 4.9641, "mean_token_accuracy": 0.20882887095212938, "num_tokens": 56794818.0, "step": 32730 }, { "entropy": 5.712417078018189, "epoch": 2.5468974907605526, "grad_norm": 1.1328125, "learning_rate": 0.0004346702534608023, "loss": 5.013, "mean_token_accuracy": 0.19923704415559768, "num_tokens": 56804528.0, "step": 32735 }, { "entropy": 5.795131254196167, "epoch": 2.54728652013227, "grad_norm": 1.359375, "learning_rate": 0.0004346507249871153, "loss": 4.9839, "mean_token_accuracy": 0.2123407244682312, "num_tokens": 56812766.0, "step": 32740 }, { "entropy": 5.75357027053833, "epoch": 2.5476755495039876, "grad_norm": 1.140625, "learning_rate": 0.0004346311940909826, "loss": 4.9496, "mean_token_accuracy": 0.2088528424501419, "num_tokens": 56821108.0, "step": 32745 }, { "entropy": 5.772972297668457, "epoch": 2.5480645788757053, "grad_norm": 1.21875, "learning_rate": 0.00043461166077270056, "loss": 5.0729, "mean_token_accuracy": 0.19937997162342072, "num_tokens": 56829060.0, "step": 32750 }, { "entropy": 5.791413116455078, "epoch": 2.5484536082474225, "grad_norm": 1.1796875, "learning_rate": 0.00043459212503256566, "loss": 5.0342, "mean_token_accuracy": 0.20933077186346055, "num_tokens": 56837440.0, "step": 32755 }, { "entropy": 5.790433263778686, "epoch": 2.54884263761914, "grad_norm": 1.2421875, "learning_rate": 0.0004345725868708743, "loss": 5.0006, "mean_token_accuracy": 0.2121829867362976, "num_tokens": 56845485.0, "step": 32760 }, { "entropy": 5.775847339630127, "epoch": 2.549231666990858, "grad_norm": 1.328125, "learning_rate": 0.00043455304628792294, "loss": 4.977, "mean_token_accuracy": 0.20994850844144822, "num_tokens": 56854498.0, "step": 32765 }, { "entropy": 5.705957412719727, "epoch": 2.5496206963625756, "grad_norm": 1.203125, "learning_rate": 0.000434533503284008, "loss": 4.9742, "mean_token_accuracy": 0.2112821877002716, "num_tokens": 56862910.0, "step": 32770 }, { "entropy": 5.729395723342895, "epoch": 2.550009725734293, "grad_norm": 1.2421875, "learning_rate": 0.0004345139578594261, "loss": 4.9683, "mean_token_accuracy": 0.20883767008781434, "num_tokens": 56872235.0, "step": 32775 }, { "entropy": 5.7738926887512205, "epoch": 2.5503987551060106, "grad_norm": 1.171875, "learning_rate": 0.0004344944100144738, "loss": 4.9968, "mean_token_accuracy": 0.20581137388944626, "num_tokens": 56881506.0, "step": 32780 }, { "entropy": 5.76079535484314, "epoch": 2.550787784477728, "grad_norm": 1.171875, "learning_rate": 0.00043447485974944765, "loss": 4.9686, "mean_token_accuracy": 0.21169120222330093, "num_tokens": 56890218.0, "step": 32785 }, { "entropy": 5.748682451248169, "epoch": 2.5511768138494455, "grad_norm": 1.2734375, "learning_rate": 0.00043445530706464437, "loss": 4.9951, "mean_token_accuracy": 0.20601194947957993, "num_tokens": 56898037.0, "step": 32790 }, { "entropy": 5.664990377426148, "epoch": 2.551565843221163, "grad_norm": 1.1484375, "learning_rate": 0.0004344357519603606, "loss": 4.9091, "mean_token_accuracy": 0.206167571246624, "num_tokens": 56906892.0, "step": 32795 }, { "entropy": 5.701299953460693, "epoch": 2.551954872592881, "grad_norm": 1.15625, "learning_rate": 0.0004344161944368931, "loss": 4.8287, "mean_token_accuracy": 0.21554235219955445, "num_tokens": 56915286.0, "step": 32800 }, { "entropy": 5.705565643310547, "epoch": 2.5523439019645986, "grad_norm": 1.328125, "learning_rate": 0.0004343966344945385, "loss": 4.9436, "mean_token_accuracy": 0.20639772862195968, "num_tokens": 56923670.0, "step": 32805 }, { "entropy": 5.819622659683228, "epoch": 2.552732931336316, "grad_norm": 1.234375, "learning_rate": 0.00043437707213359375, "loss": 5.0852, "mean_token_accuracy": 0.19876272827386857, "num_tokens": 56932092.0, "step": 32810 }, { "entropy": 5.75649061203003, "epoch": 2.5531219607080335, "grad_norm": 1.28125, "learning_rate": 0.00043435750735435554, "loss": 5.0451, "mean_token_accuracy": 0.2101953238248825, "num_tokens": 56940938.0, "step": 32815 }, { "entropy": 5.786232614517212, "epoch": 2.553510990079751, "grad_norm": 1.234375, "learning_rate": 0.00043433794015712085, "loss": 5.0153, "mean_token_accuracy": 0.20385306626558303, "num_tokens": 56950001.0, "step": 32820 }, { "entropy": 5.7990052700042725, "epoch": 2.5539000194514685, "grad_norm": 1.2421875, "learning_rate": 0.0004343183705421865, "loss": 5.0562, "mean_token_accuracy": 0.2047049656510353, "num_tokens": 56958898.0, "step": 32825 }, { "entropy": 5.772749280929565, "epoch": 2.554289048823186, "grad_norm": 1.265625, "learning_rate": 0.0004342987985098495, "loss": 4.9686, "mean_token_accuracy": 0.2073871001601219, "num_tokens": 56967586.0, "step": 32830 }, { "entropy": 5.666131210327149, "epoch": 2.554678078194904, "grad_norm": 1.1484375, "learning_rate": 0.00043427922406040676, "loss": 4.903, "mean_token_accuracy": 0.20844308882951737, "num_tokens": 56975781.0, "step": 32835 }, { "entropy": 5.811225652694702, "epoch": 2.555067107566621, "grad_norm": 1.3203125, "learning_rate": 0.00043425964719415525, "loss": 5.0413, "mean_token_accuracy": 0.20668812543153764, "num_tokens": 56984230.0, "step": 32840 }, { "entropy": 5.762484979629517, "epoch": 2.555456136938339, "grad_norm": 1.2265625, "learning_rate": 0.00043424006791139213, "loss": 4.9702, "mean_token_accuracy": 0.20323142409324646, "num_tokens": 56992100.0, "step": 32845 }, { "entropy": 5.771996021270752, "epoch": 2.5558451663100565, "grad_norm": 1.1875, "learning_rate": 0.00043422048621241443, "loss": 5.0785, "mean_token_accuracy": 0.20102738440036774, "num_tokens": 57000407.0, "step": 32850 }, { "entropy": 5.815082550048828, "epoch": 2.556234195681774, "grad_norm": 1.203125, "learning_rate": 0.00043420090209751933, "loss": 5.0509, "mean_token_accuracy": 0.20778660476207733, "num_tokens": 57008781.0, "step": 32855 }, { "entropy": 5.752675580978393, "epoch": 2.5566232250534915, "grad_norm": 1.296875, "learning_rate": 0.0004341813155670039, "loss": 4.9474, "mean_token_accuracy": 0.21140379458665848, "num_tokens": 57017568.0, "step": 32860 }, { "entropy": 5.752951955795288, "epoch": 2.557012254425209, "grad_norm": 1.328125, "learning_rate": 0.0004341617266211654, "loss": 4.8913, "mean_token_accuracy": 0.21710657179355622, "num_tokens": 57025674.0, "step": 32865 }, { "entropy": 5.732583332061767, "epoch": 2.557401283796927, "grad_norm": 1.2421875, "learning_rate": 0.000434142135260301, "loss": 4.977, "mean_token_accuracy": 0.2106477662920952, "num_tokens": 57033657.0, "step": 32870 }, { "entropy": 5.729851198196411, "epoch": 2.557790313168644, "grad_norm": 1.2734375, "learning_rate": 0.000434122541484708, "loss": 5.0705, "mean_token_accuracy": 0.20223496705293656, "num_tokens": 57043057.0, "step": 32875 }, { "entropy": 5.7974385738372805, "epoch": 2.558179342540362, "grad_norm": 1.234375, "learning_rate": 0.0004341029452946837, "loss": 5.0181, "mean_token_accuracy": 0.20021673142910004, "num_tokens": 57051721.0, "step": 32880 }, { "entropy": 5.822482109069824, "epoch": 2.558568371912079, "grad_norm": 1.2734375, "learning_rate": 0.0004340833466905254, "loss": 5.0184, "mean_token_accuracy": 0.20185206532478334, "num_tokens": 57060223.0, "step": 32885 }, { "entropy": 5.797485303878784, "epoch": 2.558957401283797, "grad_norm": 1.3671875, "learning_rate": 0.00043406374567253055, "loss": 5.0068, "mean_token_accuracy": 0.20618628412485124, "num_tokens": 57068408.0, "step": 32890 }, { "entropy": 5.776030588150024, "epoch": 2.5593464306555145, "grad_norm": 1.234375, "learning_rate": 0.0004340441422409965, "loss": 5.0757, "mean_token_accuracy": 0.1946803167462349, "num_tokens": 57076784.0, "step": 32895 }, { "entropy": 5.79780912399292, "epoch": 2.559735460027232, "grad_norm": 1.203125, "learning_rate": 0.0004340245363962209, "loss": 5.0363, "mean_token_accuracy": 0.20086259245872498, "num_tokens": 57084745.0, "step": 32900 }, { "entropy": 5.709837102890015, "epoch": 2.56012448939895, "grad_norm": 1.265625, "learning_rate": 0.00043400492813850083, "loss": 4.9623, "mean_token_accuracy": 0.21104331612586974, "num_tokens": 57093395.0, "step": 32905 }, { "entropy": 5.681382465362549, "epoch": 2.560513518770667, "grad_norm": 1.2109375, "learning_rate": 0.00043398531746813426, "loss": 4.9316, "mean_token_accuracy": 0.20191646963357926, "num_tokens": 57101665.0, "step": 32910 }, { "entropy": 5.6577447891235355, "epoch": 2.560902548142385, "grad_norm": 1.2109375, "learning_rate": 0.00043396570438541845, "loss": 4.9092, "mean_token_accuracy": 0.20565275102853775, "num_tokens": 57110328.0, "step": 32915 }, { "entropy": 5.756406545639038, "epoch": 2.561291577514102, "grad_norm": 1.1796875, "learning_rate": 0.0004339460888906512, "loss": 5.03, "mean_token_accuracy": 0.19820039123296737, "num_tokens": 57118834.0, "step": 32920 }, { "entropy": 5.852702999114991, "epoch": 2.5616806068858198, "grad_norm": 1.2109375, "learning_rate": 0.0004339264709841299, "loss": 5.1006, "mean_token_accuracy": 0.19865436851978302, "num_tokens": 57127672.0, "step": 32925 }, { "entropy": 5.716109085083008, "epoch": 2.5620696362575375, "grad_norm": 1.2890625, "learning_rate": 0.00043390685066615244, "loss": 4.9501, "mean_token_accuracy": 0.21160395443439484, "num_tokens": 57136209.0, "step": 32930 }, { "entropy": 5.754217147827148, "epoch": 2.562458665629255, "grad_norm": 1.4296875, "learning_rate": 0.0004338872279370164, "loss": 4.9955, "mean_token_accuracy": 0.20592164546251296, "num_tokens": 57144427.0, "step": 32935 }, { "entropy": 5.793454504013061, "epoch": 2.5628476950009724, "grad_norm": 1.265625, "learning_rate": 0.0004338676027970196, "loss": 5.119, "mean_token_accuracy": 0.19316186904907226, "num_tokens": 57152860.0, "step": 32940 }, { "entropy": 5.82431321144104, "epoch": 2.56323672437269, "grad_norm": 1.1953125, "learning_rate": 0.00043384797524645977, "loss": 4.9901, "mean_token_accuracy": 0.20951569825410843, "num_tokens": 57162397.0, "step": 32945 }, { "entropy": 5.759331130981446, "epoch": 2.563625753744408, "grad_norm": 1.21875, "learning_rate": 0.0004338283452856348, "loss": 4.968, "mean_token_accuracy": 0.21310473680496217, "num_tokens": 57171178.0, "step": 32950 }, { "entropy": 5.784869050979614, "epoch": 2.564014783116125, "grad_norm": 1.2890625, "learning_rate": 0.0004338087129148425, "loss": 4.9861, "mean_token_accuracy": 0.2079272076487541, "num_tokens": 57178715.0, "step": 32955 }, { "entropy": 5.828079080581665, "epoch": 2.5644038124878428, "grad_norm": 1.3203125, "learning_rate": 0.00043378907813438066, "loss": 5.0604, "mean_token_accuracy": 0.19179490357637405, "num_tokens": 57187239.0, "step": 32960 }, { "entropy": 5.775489044189453, "epoch": 2.5647928418595605, "grad_norm": 1.25, "learning_rate": 0.00043376944094454734, "loss": 4.9999, "mean_token_accuracy": 0.19840618520975112, "num_tokens": 57195655.0, "step": 32965 }, { "entropy": 5.7567229747772215, "epoch": 2.565181871231278, "grad_norm": 1.3125, "learning_rate": 0.00043374980134564044, "loss": 5.0157, "mean_token_accuracy": 0.19842608273029327, "num_tokens": 57205026.0, "step": 32970 }, { "entropy": 5.743293380737304, "epoch": 2.5655709006029954, "grad_norm": 1.28125, "learning_rate": 0.00043373015933795804, "loss": 4.9893, "mean_token_accuracy": 0.20903294980525972, "num_tokens": 57213344.0, "step": 32975 }, { "entropy": 5.796473693847656, "epoch": 2.565959929974713, "grad_norm": 1.2734375, "learning_rate": 0.0004337105149217981, "loss": 4.9733, "mean_token_accuracy": 0.2071865677833557, "num_tokens": 57222174.0, "step": 32980 }, { "entropy": 5.713343334197998, "epoch": 2.566348959346431, "grad_norm": 1.2890625, "learning_rate": 0.00043369086809745875, "loss": 4.9915, "mean_token_accuracy": 0.20441901236772536, "num_tokens": 57231099.0, "step": 32985 }, { "entropy": 5.7745014190673825, "epoch": 2.566737988718148, "grad_norm": 1.3203125, "learning_rate": 0.00043367121886523795, "loss": 5.0214, "mean_token_accuracy": 0.1989772692322731, "num_tokens": 57239143.0, "step": 32990 }, { "entropy": 5.727962303161621, "epoch": 2.5671270180898658, "grad_norm": 1.171875, "learning_rate": 0.000433651567225434, "loss": 5.003, "mean_token_accuracy": 0.205684033036232, "num_tokens": 57247971.0, "step": 32995 }, { "entropy": 5.769332408905029, "epoch": 2.5675160474615835, "grad_norm": 1.1796875, "learning_rate": 0.0004336319131783451, "loss": 4.9918, "mean_token_accuracy": 0.2089997798204422, "num_tokens": 57256257.0, "step": 33000 }, { "epoch": 2.5675160474615835, "eval_entropy": 5.521635795993456, "eval_loss": 5.075793266296387, "eval_mean_token_accuracy": 0.21213480656369588, "eval_num_tokens": 57256257.0, "eval_runtime": 21.6325, "eval_samples_per_second": 1921.088, "eval_steps_per_second": 240.148, "step": 33000 }, { "entropy": 5.786584091186524, "epoch": 2.567905076833301, "grad_norm": 1.2265625, "learning_rate": 0.00043361225672426933, "loss": 5.0105, "mean_token_accuracy": 0.20311107337474824, "num_tokens": 57264729.0, "step": 33005 }, { "entropy": 5.787122440338135, "epoch": 2.5682941062050184, "grad_norm": 1.2734375, "learning_rate": 0.0004335925978635051, "loss": 5.0551, "mean_token_accuracy": 0.20045190155506135, "num_tokens": 57273370.0, "step": 33010 }, { "entropy": 5.767630481719971, "epoch": 2.568683135576736, "grad_norm": 1.3046875, "learning_rate": 0.00043357293659635057, "loss": 5.0319, "mean_token_accuracy": 0.205415678024292, "num_tokens": 57282466.0, "step": 33015 }, { "entropy": 5.735296058654785, "epoch": 2.5690721649484534, "grad_norm": 1.1015625, "learning_rate": 0.0004335532729231041, "loss": 4.975, "mean_token_accuracy": 0.20214279890060424, "num_tokens": 57291015.0, "step": 33020 }, { "entropy": 5.806283187866211, "epoch": 2.569461194320171, "grad_norm": 1.1640625, "learning_rate": 0.00043353360684406415, "loss": 5.0644, "mean_token_accuracy": 0.2003934934735298, "num_tokens": 57300941.0, "step": 33025 }, { "entropy": 5.8102943897247314, "epoch": 2.5698502236918888, "grad_norm": 1.359375, "learning_rate": 0.000433513938359529, "loss": 5.0518, "mean_token_accuracy": 0.19729073196649552, "num_tokens": 57310412.0, "step": 33030 }, { "entropy": 5.8451512336730955, "epoch": 2.5702392530636065, "grad_norm": 1.296875, "learning_rate": 0.0004334942674697971, "loss": 5.0955, "mean_token_accuracy": 0.204061596095562, "num_tokens": 57319262.0, "step": 33035 }, { "entropy": 5.769824361801147, "epoch": 2.5706282824353237, "grad_norm": 1.234375, "learning_rate": 0.00043347459417516696, "loss": 5.0367, "mean_token_accuracy": 0.20008276253938675, "num_tokens": 57327279.0, "step": 33040 }, { "entropy": 5.7166553974151615, "epoch": 2.5710173118070414, "grad_norm": 1.25, "learning_rate": 0.0004334549184759371, "loss": 4.9083, "mean_token_accuracy": 0.21907222419977188, "num_tokens": 57335498.0, "step": 33045 }, { "entropy": 5.712505149841308, "epoch": 2.571406341178759, "grad_norm": 1.1484375, "learning_rate": 0.0004334352403724062, "loss": 5.0651, "mean_token_accuracy": 0.20013367086648942, "num_tokens": 57345134.0, "step": 33050 }, { "entropy": 5.771085977554321, "epoch": 2.5717953705504764, "grad_norm": 1.25, "learning_rate": 0.00043341555986487254, "loss": 5.0833, "mean_token_accuracy": 0.2036922663450241, "num_tokens": 57353451.0, "step": 33055 }, { "entropy": 5.791321229934693, "epoch": 2.572184399922194, "grad_norm": 1.15625, "learning_rate": 0.0004333958769536349, "loss": 5.0212, "mean_token_accuracy": 0.20156901478767394, "num_tokens": 57362990.0, "step": 33060 }, { "entropy": 5.78676176071167, "epoch": 2.5725734292939118, "grad_norm": 1.234375, "learning_rate": 0.0004333761916389921, "loss": 4.9869, "mean_token_accuracy": 0.20758597254753114, "num_tokens": 57371572.0, "step": 33065 }, { "entropy": 5.656745052337646, "epoch": 2.5729624586656294, "grad_norm": 1.2734375, "learning_rate": 0.0004333565039212425, "loss": 4.9496, "mean_token_accuracy": 0.2067430466413498, "num_tokens": 57380558.0, "step": 33070 }, { "entropy": 5.691905212402344, "epoch": 2.5733514880373467, "grad_norm": 1.21875, "learning_rate": 0.0004333368138006851, "loss": 4.8769, "mean_token_accuracy": 0.21097035855054855, "num_tokens": 57389636.0, "step": 33075 }, { "entropy": 5.73447847366333, "epoch": 2.5737405174090644, "grad_norm": 1.21875, "learning_rate": 0.0004333171212776185, "loss": 4.9368, "mean_token_accuracy": 0.21167907118797302, "num_tokens": 57397546.0, "step": 33080 }, { "entropy": 5.793683099746704, "epoch": 2.574129546780782, "grad_norm": 1.265625, "learning_rate": 0.0004332974263523416, "loss": 5.0973, "mean_token_accuracy": 0.20549457222223283, "num_tokens": 57406981.0, "step": 33085 }, { "entropy": 5.799549293518067, "epoch": 2.5745185761524993, "grad_norm": 1.3203125, "learning_rate": 0.00043327772902515327, "loss": 5.0448, "mean_token_accuracy": 0.2054416060447693, "num_tokens": 57416016.0, "step": 33090 }, { "entropy": 5.796039152145386, "epoch": 2.574907605524217, "grad_norm": 1.1875, "learning_rate": 0.0004332580292963523, "loss": 5.0461, "mean_token_accuracy": 0.19865683764219283, "num_tokens": 57425086.0, "step": 33095 }, { "entropy": 5.806149291992187, "epoch": 2.5752966348959347, "grad_norm": 1.21875, "learning_rate": 0.0004332383271662376, "loss": 5.0395, "mean_token_accuracy": 0.2071179047226906, "num_tokens": 57433982.0, "step": 33100 }, { "entropy": 5.7628051280975345, "epoch": 2.5756856642676524, "grad_norm": 1.21875, "learning_rate": 0.00043321862263510816, "loss": 4.8917, "mean_token_accuracy": 0.2116219624876976, "num_tokens": 57442922.0, "step": 33105 }, { "entropy": 5.774821043014526, "epoch": 2.5760746936393697, "grad_norm": 1.2109375, "learning_rate": 0.0004331989157032629, "loss": 5.0577, "mean_token_accuracy": 0.20238651484251022, "num_tokens": 57452373.0, "step": 33110 }, { "entropy": 5.761926794052124, "epoch": 2.5764637230110874, "grad_norm": 1.2109375, "learning_rate": 0.00043317920637100097, "loss": 4.9753, "mean_token_accuracy": 0.20934057533740996, "num_tokens": 57460741.0, "step": 33115 }, { "entropy": 5.717100667953491, "epoch": 2.5768527523828046, "grad_norm": 1.21875, "learning_rate": 0.0004331594946386213, "loss": 4.9677, "mean_token_accuracy": 0.20892391949892045, "num_tokens": 57469488.0, "step": 33120 }, { "entropy": 5.7583746910095215, "epoch": 2.5772417817545223, "grad_norm": 1.1875, "learning_rate": 0.00043313978050642303, "loss": 5.0213, "mean_token_accuracy": 0.19943802803754807, "num_tokens": 57478560.0, "step": 33125 }, { "entropy": 5.744273948669433, "epoch": 2.57763081112624, "grad_norm": 1.25, "learning_rate": 0.0004331200639747053, "loss": 4.9279, "mean_token_accuracy": 0.2104368641972542, "num_tokens": 57486670.0, "step": 33130 }, { "entropy": 5.7799601554870605, "epoch": 2.5780198404979577, "grad_norm": 1.2890625, "learning_rate": 0.0004331003450437674, "loss": 5.0255, "mean_token_accuracy": 0.20352811366319656, "num_tokens": 57495676.0, "step": 33135 }, { "entropy": 5.702581977844238, "epoch": 2.5784088698696754, "grad_norm": 1.2890625, "learning_rate": 0.0004330806237139083, "loss": 4.9184, "mean_token_accuracy": 0.21573910862207413, "num_tokens": 57504422.0, "step": 33140 }, { "entropy": 5.748302602767945, "epoch": 2.5787978992413927, "grad_norm": 1.2265625, "learning_rate": 0.0004330608999854273, "loss": 4.9225, "mean_token_accuracy": 0.20659206956624984, "num_tokens": 57514555.0, "step": 33145 }, { "entropy": 5.725775241851807, "epoch": 2.5791869286131104, "grad_norm": 1.25, "learning_rate": 0.0004330411738586238, "loss": 4.8486, "mean_token_accuracy": 0.21359531581401825, "num_tokens": 57523088.0, "step": 33150 }, { "entropy": 5.678217506408691, "epoch": 2.5795759579848276, "grad_norm": 1.3125, "learning_rate": 0.000433021445333797, "loss": 4.9741, "mean_token_accuracy": 0.20969132483005523, "num_tokens": 57530890.0, "step": 33155 }, { "entropy": 5.769487190246582, "epoch": 2.5799649873565453, "grad_norm": 1.1875, "learning_rate": 0.00043300171441124633, "loss": 5.0251, "mean_token_accuracy": 0.20796672999858856, "num_tokens": 57539834.0, "step": 33160 }, { "entropy": 5.7724262237548825, "epoch": 2.580354016728263, "grad_norm": 1.2578125, "learning_rate": 0.0004329819810912711, "loss": 4.994, "mean_token_accuracy": 0.20428797751665115, "num_tokens": 57548962.0, "step": 33165 }, { "entropy": 5.69587664604187, "epoch": 2.5807430460999807, "grad_norm": 1.2734375, "learning_rate": 0.00043296224537417075, "loss": 4.8795, "mean_token_accuracy": 0.2207977995276451, "num_tokens": 57557460.0, "step": 33170 }, { "entropy": 5.707780504226685, "epoch": 2.581132075471698, "grad_norm": 1.2265625, "learning_rate": 0.00043294250726024473, "loss": 4.8577, "mean_token_accuracy": 0.2213783472776413, "num_tokens": 57566053.0, "step": 33175 }, { "entropy": 5.731279039382935, "epoch": 2.5815211048434157, "grad_norm": 1.1796875, "learning_rate": 0.0004329227667497926, "loss": 4.9496, "mean_token_accuracy": 0.20581699162721634, "num_tokens": 57575268.0, "step": 33180 }, { "entropy": 5.7321959972381595, "epoch": 2.5819101342151334, "grad_norm": 1.265625, "learning_rate": 0.00043290302384311373, "loss": 4.9311, "mean_token_accuracy": 0.20782824158668517, "num_tokens": 57583518.0, "step": 33185 }, { "entropy": 5.690702342987061, "epoch": 2.5822991635868506, "grad_norm": 1.15625, "learning_rate": 0.00043288327854050794, "loss": 4.913, "mean_token_accuracy": 0.2113048955798149, "num_tokens": 57592300.0, "step": 33190 }, { "entropy": 5.741007900238037, "epoch": 2.5826881929585683, "grad_norm": 1.3203125, "learning_rate": 0.00043286353084227467, "loss": 5.0721, "mean_token_accuracy": 0.20033103376626968, "num_tokens": 57600694.0, "step": 33195 }, { "entropy": 5.842280292510987, "epoch": 2.583077222330286, "grad_norm": 1.265625, "learning_rate": 0.00043284378074871354, "loss": 5.0731, "mean_token_accuracy": 0.20883223414421082, "num_tokens": 57609213.0, "step": 33200 }, { "entropy": 5.753599309921265, "epoch": 2.5834662517020037, "grad_norm": 1.1953125, "learning_rate": 0.0004328240282601243, "loss": 4.989, "mean_token_accuracy": 0.20347818583250046, "num_tokens": 57617466.0, "step": 33205 }, { "entropy": 5.704377317428589, "epoch": 2.583855281073721, "grad_norm": 1.1328125, "learning_rate": 0.0004328042733768066, "loss": 5.0037, "mean_token_accuracy": 0.2028016373515129, "num_tokens": 57626620.0, "step": 33210 }, { "entropy": 5.860623788833618, "epoch": 2.5842443104454387, "grad_norm": 1.2890625, "learning_rate": 0.00043278451609906027, "loss": 5.0371, "mean_token_accuracy": 0.20837210565805436, "num_tokens": 57635230.0, "step": 33215 }, { "entropy": 5.810592746734619, "epoch": 2.584633339817156, "grad_norm": 1.1640625, "learning_rate": 0.00043276475642718503, "loss": 5.0409, "mean_token_accuracy": 0.2046953797340393, "num_tokens": 57644444.0, "step": 33220 }, { "entropy": 5.7788252353668215, "epoch": 2.5850223691888736, "grad_norm": 1.2265625, "learning_rate": 0.0004327449943614808, "loss": 5.0389, "mean_token_accuracy": 0.2011866971850395, "num_tokens": 57653282.0, "step": 33225 }, { "entropy": 5.718972110748291, "epoch": 2.5854113985605913, "grad_norm": 1.2265625, "learning_rate": 0.00043272522990224727, "loss": 5.0094, "mean_token_accuracy": 0.20761703103780746, "num_tokens": 57661153.0, "step": 33230 }, { "entropy": 5.775798988342285, "epoch": 2.585800427932309, "grad_norm": 1.296875, "learning_rate": 0.0004327054630497844, "loss": 5.0705, "mean_token_accuracy": 0.19694240838289262, "num_tokens": 57669613.0, "step": 33235 }, { "entropy": 5.790027236938476, "epoch": 2.5861894573040267, "grad_norm": 1.25, "learning_rate": 0.00043268569380439223, "loss": 5.0282, "mean_token_accuracy": 0.20255554467439651, "num_tokens": 57678174.0, "step": 33240 }, { "entropy": 5.754463052749633, "epoch": 2.586578486675744, "grad_norm": 1.3671875, "learning_rate": 0.0004326659221663705, "loss": 5.0079, "mean_token_accuracy": 0.2098563000559807, "num_tokens": 57687117.0, "step": 33245 }, { "entropy": 5.804340887069702, "epoch": 2.5869675160474617, "grad_norm": 1.21875, "learning_rate": 0.0004326461481360194, "loss": 5.0748, "mean_token_accuracy": 0.2016873374581337, "num_tokens": 57695073.0, "step": 33250 }, { "entropy": 5.711058855056763, "epoch": 2.587356545419179, "grad_norm": 1.203125, "learning_rate": 0.00043262637171363906, "loss": 4.8802, "mean_token_accuracy": 0.21483015567064284, "num_tokens": 57703856.0, "step": 33255 }, { "entropy": 5.799820613861084, "epoch": 2.5877455747908966, "grad_norm": 1.2734375, "learning_rate": 0.00043260659289952926, "loss": 4.8863, "mean_token_accuracy": 0.21601614505052566, "num_tokens": 57712072.0, "step": 33260 }, { "entropy": 5.721677827835083, "epoch": 2.5881346041626143, "grad_norm": 1.15625, "learning_rate": 0.00043258681169399034, "loss": 5.0077, "mean_token_accuracy": 0.20544838309288024, "num_tokens": 57721203.0, "step": 33265 }, { "entropy": 5.810277843475342, "epoch": 2.588523633534332, "grad_norm": 1.234375, "learning_rate": 0.00043256702809732234, "loss": 5.0993, "mean_token_accuracy": 0.19455747902393342, "num_tokens": 57730591.0, "step": 33270 }, { "entropy": 5.801410913467407, "epoch": 2.5889126629060493, "grad_norm": 1.2265625, "learning_rate": 0.0004325472421098255, "loss": 4.9941, "mean_token_accuracy": 0.20934539288282394, "num_tokens": 57739390.0, "step": 33275 }, { "entropy": 5.740540313720703, "epoch": 2.589301692277767, "grad_norm": 1.078125, "learning_rate": 0.00043252745373180006, "loss": 4.9476, "mean_token_accuracy": 0.20520153790712356, "num_tokens": 57748008.0, "step": 33280 }, { "entropy": 5.8652002811431885, "epoch": 2.5896907216494847, "grad_norm": 1.2578125, "learning_rate": 0.0004325076629635462, "loss": 5.2114, "mean_token_accuracy": 0.18855730444192886, "num_tokens": 57757471.0, "step": 33285 }, { "entropy": 5.80700159072876, "epoch": 2.590079751021202, "grad_norm": 1.1875, "learning_rate": 0.00043248786980536424, "loss": 4.9889, "mean_token_accuracy": 0.20105296075344087, "num_tokens": 57766534.0, "step": 33290 }, { "entropy": 5.705951166152954, "epoch": 2.5904687803929196, "grad_norm": 1.265625, "learning_rate": 0.0004324680742575545, "loss": 4.8913, "mean_token_accuracy": 0.2158153012394905, "num_tokens": 57775011.0, "step": 33295 }, { "entropy": 5.746581029891968, "epoch": 2.5908578097646373, "grad_norm": 1.3046875, "learning_rate": 0.00043244827632041744, "loss": 5.0421, "mean_token_accuracy": 0.20172712206840515, "num_tokens": 57783606.0, "step": 33300 }, { "entropy": 5.762721872329712, "epoch": 2.591246839136355, "grad_norm": 1.2578125, "learning_rate": 0.0004324284759942534, "loss": 4.9576, "mean_token_accuracy": 0.2127518355846405, "num_tokens": 57792170.0, "step": 33305 }, { "entropy": 5.685492706298828, "epoch": 2.5916358685080723, "grad_norm": 1.171875, "learning_rate": 0.0004324086732793627, "loss": 4.9068, "mean_token_accuracy": 0.20639525800943376, "num_tokens": 57801379.0, "step": 33310 }, { "entropy": 5.7005432605743405, "epoch": 2.59202489787979, "grad_norm": 1.25, "learning_rate": 0.00043238886817604605, "loss": 4.9954, "mean_token_accuracy": 0.20646542310714722, "num_tokens": 57810135.0, "step": 33315 }, { "entropy": 5.708997964859009, "epoch": 2.5924139272515077, "grad_norm": 1.2578125, "learning_rate": 0.0004323690606846039, "loss": 4.9409, "mean_token_accuracy": 0.20837097316980363, "num_tokens": 57818314.0, "step": 33320 }, { "entropy": 5.752008104324341, "epoch": 2.592802956623225, "grad_norm": 1.2109375, "learning_rate": 0.00043234925080533657, "loss": 4.9981, "mean_token_accuracy": 0.2048935040831566, "num_tokens": 57826883.0, "step": 33325 }, { "entropy": 5.728763103485107, "epoch": 2.5931919859949426, "grad_norm": 1.2578125, "learning_rate": 0.0004323294385385448, "loss": 4.9125, "mean_token_accuracy": 0.2116884931921959, "num_tokens": 57835215.0, "step": 33330 }, { "entropy": 5.692485666275024, "epoch": 2.5935810153666603, "grad_norm": 1.34375, "learning_rate": 0.0004323096238845293, "loss": 4.9865, "mean_token_accuracy": 0.21171266585588455, "num_tokens": 57844002.0, "step": 33335 }, { "entropy": 5.79583773612976, "epoch": 2.593970044738378, "grad_norm": 1.2265625, "learning_rate": 0.0004322898068435906, "loss": 5.0458, "mean_token_accuracy": 0.1998705506324768, "num_tokens": 57852453.0, "step": 33340 }, { "entropy": 5.757982778549194, "epoch": 2.5943590741100953, "grad_norm": 1.25, "learning_rate": 0.0004322699874160294, "loss": 4.9272, "mean_token_accuracy": 0.20676076859235765, "num_tokens": 57860807.0, "step": 33345 }, { "entropy": 5.772418975830078, "epoch": 2.594748103481813, "grad_norm": 1.265625, "learning_rate": 0.00043225016560214654, "loss": 4.9478, "mean_token_accuracy": 0.20712264776229858, "num_tokens": 57869768.0, "step": 33350 }, { "entropy": 5.809991312026978, "epoch": 2.59513713285353, "grad_norm": 1.2421875, "learning_rate": 0.00043223034140224266, "loss": 5.0156, "mean_token_accuracy": 0.20447915196418762, "num_tokens": 57878089.0, "step": 33355 }, { "entropy": 5.754279041290284, "epoch": 2.595526162225248, "grad_norm": 1.1796875, "learning_rate": 0.0004322105148166187, "loss": 5.0198, "mean_token_accuracy": 0.20274076014757156, "num_tokens": 57886468.0, "step": 33360 }, { "entropy": 5.7886889457702635, "epoch": 2.5959151915969656, "grad_norm": 1.2265625, "learning_rate": 0.00043219068584557526, "loss": 5.0758, "mean_token_accuracy": 0.19407573491334915, "num_tokens": 57895993.0, "step": 33365 }, { "entropy": 5.747131490707398, "epoch": 2.5963042209686833, "grad_norm": 1.21875, "learning_rate": 0.0004321708544894134, "loss": 4.9244, "mean_token_accuracy": 0.2132062003016472, "num_tokens": 57904464.0, "step": 33370 }, { "entropy": 5.720435762405396, "epoch": 2.5966932503404005, "grad_norm": 1.2890625, "learning_rate": 0.00043215102074843403, "loss": 5.0508, "mean_token_accuracy": 0.2010599195957184, "num_tokens": 57912711.0, "step": 33375 }, { "entropy": 5.719974136352539, "epoch": 2.5970822797121182, "grad_norm": 1.2578125, "learning_rate": 0.00043213118462293796, "loss": 4.988, "mean_token_accuracy": 0.20771399587392808, "num_tokens": 57920926.0, "step": 33380 }, { "entropy": 5.760038995742798, "epoch": 2.597471309083836, "grad_norm": 1.25, "learning_rate": 0.0004321113461132264, "loss": 4.9448, "mean_token_accuracy": 0.21141133904457093, "num_tokens": 57930346.0, "step": 33385 }, { "entropy": 5.78417558670044, "epoch": 2.597860338455553, "grad_norm": 1.203125, "learning_rate": 0.00043209150521960016, "loss": 5.0282, "mean_token_accuracy": 0.21219132244586944, "num_tokens": 57938578.0, "step": 33390 }, { "entropy": 5.7820686340332035, "epoch": 2.598249367827271, "grad_norm": 1.265625, "learning_rate": 0.00043207166194236037, "loss": 5.1018, "mean_token_accuracy": 0.19686743766069412, "num_tokens": 57947505.0, "step": 33395 }, { "entropy": 5.795369291305542, "epoch": 2.5986383971989886, "grad_norm": 1.3046875, "learning_rate": 0.0004320518162818082, "loss": 4.9529, "mean_token_accuracy": 0.20554561614990235, "num_tokens": 57955806.0, "step": 33400 }, { "entropy": 5.803036880493164, "epoch": 2.5990274265707063, "grad_norm": 1.3359375, "learning_rate": 0.0004320319682382445, "loss": 5.1363, "mean_token_accuracy": 0.1929910734295845, "num_tokens": 57964275.0, "step": 33405 }, { "entropy": 5.758026742935181, "epoch": 2.5994164559424235, "grad_norm": 1.1796875, "learning_rate": 0.00043201211781197075, "loss": 5.034, "mean_token_accuracy": 0.21025671511888505, "num_tokens": 57973616.0, "step": 33410 }, { "entropy": 5.804161071777344, "epoch": 2.5998054853141412, "grad_norm": 1.234375, "learning_rate": 0.00043199226500328805, "loss": 5.102, "mean_token_accuracy": 0.20368774682283403, "num_tokens": 57982809.0, "step": 33415 }, { "entropy": 5.789568996429443, "epoch": 2.600194514685859, "grad_norm": 1.1953125, "learning_rate": 0.0004319724098124975, "loss": 4.9285, "mean_token_accuracy": 0.21287197172641753, "num_tokens": 57991239.0, "step": 33420 }, { "entropy": 5.779268646240235, "epoch": 2.600583544057576, "grad_norm": 1.3203125, "learning_rate": 0.00043195255223990055, "loss": 4.9898, "mean_token_accuracy": 0.21082137972116471, "num_tokens": 57999213.0, "step": 33425 }, { "entropy": 5.761600017547607, "epoch": 2.600972573429294, "grad_norm": 1.296875, "learning_rate": 0.0004319326922857984, "loss": 4.9968, "mean_token_accuracy": 0.20612243711948394, "num_tokens": 58008289.0, "step": 33430 }, { "entropy": 5.716359663009643, "epoch": 2.6013616028010116, "grad_norm": 1.265625, "learning_rate": 0.0004319128299504925, "loss": 4.9623, "mean_token_accuracy": 0.2100016176700592, "num_tokens": 58017495.0, "step": 33435 }, { "entropy": 5.756489610671997, "epoch": 2.6017506321727293, "grad_norm": 1.21875, "learning_rate": 0.00043189296523428407, "loss": 5.0276, "mean_token_accuracy": 0.20782245695590973, "num_tokens": 58026368.0, "step": 33440 }, { "entropy": 5.794899606704712, "epoch": 2.6021396615444465, "grad_norm": 1.2734375, "learning_rate": 0.00043187309813747464, "loss": 5.0744, "mean_token_accuracy": 0.19933004081249237, "num_tokens": 58035086.0, "step": 33445 }, { "entropy": 5.708502388000488, "epoch": 2.6025286909161642, "grad_norm": 1.2421875, "learning_rate": 0.00043185322866036565, "loss": 4.9838, "mean_token_accuracy": 0.20658310502767563, "num_tokens": 58044050.0, "step": 33450 }, { "entropy": 5.742864894866943, "epoch": 2.6029177202878815, "grad_norm": 1.296875, "learning_rate": 0.00043183335680325866, "loss": 4.9529, "mean_token_accuracy": 0.2101571872830391, "num_tokens": 58052257.0, "step": 33455 }, { "entropy": 5.849968194961548, "epoch": 2.603306749659599, "grad_norm": 1.25, "learning_rate": 0.00043181348256645497, "loss": 5.1124, "mean_token_accuracy": 0.2022900626063347, "num_tokens": 58060742.0, "step": 33460 }, { "entropy": 5.741953182220459, "epoch": 2.603695779031317, "grad_norm": 1.2109375, "learning_rate": 0.00043179360595025637, "loss": 4.9918, "mean_token_accuracy": 0.19760675281286239, "num_tokens": 58069697.0, "step": 33465 }, { "entropy": 5.751530027389526, "epoch": 2.6040848084030346, "grad_norm": 1.1953125, "learning_rate": 0.0004317737269549643, "loss": 4.9409, "mean_token_accuracy": 0.21261819154024125, "num_tokens": 58077875.0, "step": 33470 }, { "entropy": 5.821722984313965, "epoch": 2.604473837774752, "grad_norm": 1.34375, "learning_rate": 0.0004317538455808805, "loss": 5.0737, "mean_token_accuracy": 0.20578673630952835, "num_tokens": 58086500.0, "step": 33475 }, { "entropy": 5.732499790191651, "epoch": 2.6048628671464695, "grad_norm": 1.1875, "learning_rate": 0.0004317339618283065, "loss": 4.9823, "mean_token_accuracy": 0.21007787585258483, "num_tokens": 58095851.0, "step": 33480 }, { "entropy": 5.8182457447052, "epoch": 2.6052518965181872, "grad_norm": 1.234375, "learning_rate": 0.0004317140756975442, "loss": 5.009, "mean_token_accuracy": 0.20688370615243912, "num_tokens": 58104462.0, "step": 33485 }, { "entropy": 5.828068256378174, "epoch": 2.6056409258899045, "grad_norm": 1.28125, "learning_rate": 0.0004316941871888951, "loss": 5.0676, "mean_token_accuracy": 0.19650615155696868, "num_tokens": 58112698.0, "step": 33490 }, { "entropy": 5.8249047756195065, "epoch": 2.606029955261622, "grad_norm": 1.3203125, "learning_rate": 0.00043167429630266134, "loss": 5.0302, "mean_token_accuracy": 0.20694387704133987, "num_tokens": 58121807.0, "step": 33495 }, { "entropy": 5.727827405929565, "epoch": 2.60641898463334, "grad_norm": 1.3046875, "learning_rate": 0.0004316544030391444, "loss": 4.9765, "mean_token_accuracy": 0.21072512716054917, "num_tokens": 58129824.0, "step": 33500 }, { "entropy": 5.806965303421021, "epoch": 2.6068080140050576, "grad_norm": 1.296875, "learning_rate": 0.0004316345073986461, "loss": 5.0071, "mean_token_accuracy": 0.21447204947471618, "num_tokens": 58138083.0, "step": 33505 }, { "entropy": 5.77633376121521, "epoch": 2.607197043376775, "grad_norm": 1.2578125, "learning_rate": 0.0004316146093814686, "loss": 4.961, "mean_token_accuracy": 0.21852541267871856, "num_tokens": 58146631.0, "step": 33510 }, { "entropy": 5.782254409790039, "epoch": 2.6075860727484925, "grad_norm": 1.28125, "learning_rate": 0.0004315947089879137, "loss": 4.9903, "mean_token_accuracy": 0.21014781892299653, "num_tokens": 58154867.0, "step": 33515 }, { "entropy": 5.724263906478882, "epoch": 2.60797510212021, "grad_norm": 1.34375, "learning_rate": 0.00043157480621828327, "loss": 5.026, "mean_token_accuracy": 0.2025931030511856, "num_tokens": 58163887.0, "step": 33520 }, { "entropy": 5.698496723175049, "epoch": 2.6083641314919275, "grad_norm": 1.2109375, "learning_rate": 0.00043155490107287935, "loss": 4.8827, "mean_token_accuracy": 0.21423107534646987, "num_tokens": 58172731.0, "step": 33525 }, { "entropy": 5.684683895111084, "epoch": 2.608753160863645, "grad_norm": 1.234375, "learning_rate": 0.0004315349935520041, "loss": 4.936, "mean_token_accuracy": 0.2159273609519005, "num_tokens": 58181619.0, "step": 33530 }, { "entropy": 5.727381706237793, "epoch": 2.609142190235363, "grad_norm": 1.296875, "learning_rate": 0.0004315150836559594, "loss": 5.0223, "mean_token_accuracy": 0.20945177525281905, "num_tokens": 58190560.0, "step": 33535 }, { "entropy": 5.81807279586792, "epoch": 2.6095312196070806, "grad_norm": 1.4453125, "learning_rate": 0.0004314951713850474, "loss": 5.0222, "mean_token_accuracy": 0.20207540094852447, "num_tokens": 58199212.0, "step": 33540 }, { "entropy": 5.849285125732422, "epoch": 2.609920248978798, "grad_norm": 1.234375, "learning_rate": 0.00043147525673957026, "loss": 5.005, "mean_token_accuracy": 0.20072565823793412, "num_tokens": 58207704.0, "step": 33545 }, { "entropy": 5.783019113540649, "epoch": 2.6103092783505155, "grad_norm": 1.1328125, "learning_rate": 0.00043145533971983025, "loss": 5.0711, "mean_token_accuracy": 0.19894753098487855, "num_tokens": 58217238.0, "step": 33550 }, { "entropy": 5.760096406936645, "epoch": 2.6106983077222328, "grad_norm": 1.2734375, "learning_rate": 0.00043143542032612935, "loss": 5.0327, "mean_token_accuracy": 0.20654432475566864, "num_tokens": 58226732.0, "step": 33555 }, { "entropy": 5.726895999908447, "epoch": 2.6110873370939505, "grad_norm": 1.28125, "learning_rate": 0.0004314154985587701, "loss": 5.0085, "mean_token_accuracy": 0.21440177261829377, "num_tokens": 58234602.0, "step": 33560 }, { "entropy": 5.740339565277099, "epoch": 2.611476366465668, "grad_norm": 1.1875, "learning_rate": 0.00043139557441805457, "loss": 5.0488, "mean_token_accuracy": 0.19463347792625427, "num_tokens": 58242557.0, "step": 33565 }, { "entropy": 5.750267601013183, "epoch": 2.611865395837386, "grad_norm": 1.40625, "learning_rate": 0.00043137564790428503, "loss": 5.0443, "mean_token_accuracy": 0.2065536007285118, "num_tokens": 58251805.0, "step": 33570 }, { "entropy": 5.748099613189697, "epoch": 2.6122544252091036, "grad_norm": 1.046875, "learning_rate": 0.00043135571901776397, "loss": 4.9806, "mean_token_accuracy": 0.20032902657985688, "num_tokens": 58261241.0, "step": 33575 }, { "entropy": 5.797948265075684, "epoch": 2.612643454580821, "grad_norm": 1.3046875, "learning_rate": 0.0004313357877587937, "loss": 4.9848, "mean_token_accuracy": 0.2141013652086258, "num_tokens": 58269965.0, "step": 33580 }, { "entropy": 5.7683295726776125, "epoch": 2.6130324839525385, "grad_norm": 1.2578125, "learning_rate": 0.0004313158541276768, "loss": 4.9832, "mean_token_accuracy": 0.20454055219888687, "num_tokens": 58278420.0, "step": 33585 }, { "entropy": 5.730152702331543, "epoch": 2.6134215133242558, "grad_norm": 1.125, "learning_rate": 0.0004312959181247156, "loss": 4.9337, "mean_token_accuracy": 0.20773289501667022, "num_tokens": 58287384.0, "step": 33590 }, { "entropy": 5.727198600769043, "epoch": 2.6138105426959735, "grad_norm": 1.2421875, "learning_rate": 0.0004312759797502126, "loss": 4.9498, "mean_token_accuracy": 0.20301904231309892, "num_tokens": 58295312.0, "step": 33595 }, { "entropy": 5.740700149536133, "epoch": 2.614199572067691, "grad_norm": 1.2578125, "learning_rate": 0.00043125603900447026, "loss": 4.9895, "mean_token_accuracy": 0.20670076608657836, "num_tokens": 58303387.0, "step": 33600 }, { "entropy": 5.766790866851807, "epoch": 2.614588601439409, "grad_norm": 1.2578125, "learning_rate": 0.0004312360958877913, "loss": 4.9498, "mean_token_accuracy": 0.21195856481790543, "num_tokens": 58312368.0, "step": 33605 }, { "entropy": 5.6911005020141605, "epoch": 2.614977630811126, "grad_norm": 1.296875, "learning_rate": 0.0004312161504004782, "loss": 4.9799, "mean_token_accuracy": 0.20431155264377593, "num_tokens": 58320639.0, "step": 33610 }, { "entropy": 5.658743762969971, "epoch": 2.615366660182844, "grad_norm": 1.28125, "learning_rate": 0.00043119620254283375, "loss": 4.8951, "mean_token_accuracy": 0.2098271831870079, "num_tokens": 58329180.0, "step": 33615 }, { "entropy": 5.7568535804748535, "epoch": 2.6157556895545615, "grad_norm": 1.1953125, "learning_rate": 0.00043117625231516054, "loss": 4.9385, "mean_token_accuracy": 0.21423605978488922, "num_tokens": 58337837.0, "step": 33620 }, { "entropy": 5.778844118118286, "epoch": 2.6161447189262788, "grad_norm": 1.2109375, "learning_rate": 0.0004311562997177612, "loss": 4.91, "mean_token_accuracy": 0.21796731352806092, "num_tokens": 58347000.0, "step": 33625 }, { "entropy": 5.607855653762817, "epoch": 2.6165337482979965, "grad_norm": 1.2265625, "learning_rate": 0.0004311363447509386, "loss": 4.9472, "mean_token_accuracy": 0.2084742933511734, "num_tokens": 58355895.0, "step": 33630 }, { "entropy": 5.671793413162232, "epoch": 2.616922777669714, "grad_norm": 1.2265625, "learning_rate": 0.0004311163874149955, "loss": 5.0169, "mean_token_accuracy": 0.20318219810724258, "num_tokens": 58364653.0, "step": 33635 }, { "entropy": 5.728887367248535, "epoch": 2.617311807041432, "grad_norm": 1.1484375, "learning_rate": 0.00043109642771023464, "loss": 4.8833, "mean_token_accuracy": 0.2168629512190819, "num_tokens": 58374157.0, "step": 33640 }, { "entropy": 5.823047828674317, "epoch": 2.617700836413149, "grad_norm": 1.296875, "learning_rate": 0.0004310764656369591, "loss": 5.0232, "mean_token_accuracy": 0.20537955015897752, "num_tokens": 58382870.0, "step": 33645 }, { "entropy": 5.730980014801025, "epoch": 2.618089865784867, "grad_norm": 1.28125, "learning_rate": 0.0004310565011954715, "loss": 4.9346, "mean_token_accuracy": 0.21156704276800156, "num_tokens": 58391016.0, "step": 33650 }, { "entropy": 5.758261489868164, "epoch": 2.618478895156584, "grad_norm": 1.2421875, "learning_rate": 0.0004310365343860748, "loss": 5.0338, "mean_token_accuracy": 0.2100912645459175, "num_tokens": 58399595.0, "step": 33655 }, { "entropy": 5.860752725601197, "epoch": 2.6188679245283017, "grad_norm": 1.2578125, "learning_rate": 0.00043101656520907225, "loss": 5.1263, "mean_token_accuracy": 0.1984937980771065, "num_tokens": 58409071.0, "step": 33660 }, { "entropy": 5.775374031066894, "epoch": 2.6192569539000194, "grad_norm": 1.25, "learning_rate": 0.0004309965936647665, "loss": 5.0443, "mean_token_accuracy": 0.20149798393249513, "num_tokens": 58418313.0, "step": 33665 }, { "entropy": 5.7613341331481935, "epoch": 2.619645983271737, "grad_norm": 1.3125, "learning_rate": 0.0004309766197534608, "loss": 5.0169, "mean_token_accuracy": 0.19764334112405776, "num_tokens": 58426263.0, "step": 33670 }, { "entropy": 5.769893074035645, "epoch": 2.620035012643455, "grad_norm": 1.2734375, "learning_rate": 0.00043095664347545816, "loss": 5.026, "mean_token_accuracy": 0.19989794492721558, "num_tokens": 58435449.0, "step": 33675 }, { "entropy": 5.79514799118042, "epoch": 2.620424042015172, "grad_norm": 1.25, "learning_rate": 0.0004309366648310616, "loss": 5.0463, "mean_token_accuracy": 0.20278458595275878, "num_tokens": 58444015.0, "step": 33680 }, { "entropy": 5.7270814895629885, "epoch": 2.62081307138689, "grad_norm": 1.2578125, "learning_rate": 0.00043091668382057443, "loss": 4.9684, "mean_token_accuracy": 0.20447409749031067, "num_tokens": 58452826.0, "step": 33685 }, { "entropy": 5.797095727920532, "epoch": 2.621202100758607, "grad_norm": 1.2109375, "learning_rate": 0.00043089670044429973, "loss": 5.0789, "mean_token_accuracy": 0.20720056742429732, "num_tokens": 58462175.0, "step": 33690 }, { "entropy": 5.68622612953186, "epoch": 2.6215911301303247, "grad_norm": 1.2109375, "learning_rate": 0.00043087671470254076, "loss": 4.8876, "mean_token_accuracy": 0.21023828983306886, "num_tokens": 58470714.0, "step": 33695 }, { "entropy": 5.694883155822754, "epoch": 2.6219801595020424, "grad_norm": 1.3046875, "learning_rate": 0.00043085672659560077, "loss": 4.9102, "mean_token_accuracy": 0.20954437851905822, "num_tokens": 58478839.0, "step": 33700 }, { "entropy": 5.786400365829468, "epoch": 2.62236918887376, "grad_norm": 1.3515625, "learning_rate": 0.00043083673612378295, "loss": 5.0622, "mean_token_accuracy": 0.20183077603578567, "num_tokens": 58488184.0, "step": 33705 }, { "entropy": 5.797252035140991, "epoch": 2.6227582182454774, "grad_norm": 1.328125, "learning_rate": 0.00043081674328739066, "loss": 5.0509, "mean_token_accuracy": 0.20082711130380632, "num_tokens": 58497202.0, "step": 33710 }, { "entropy": 5.737247562408447, "epoch": 2.623147247617195, "grad_norm": 1.28125, "learning_rate": 0.00043079674808672744, "loss": 4.9042, "mean_token_accuracy": 0.20578330308198928, "num_tokens": 58505885.0, "step": 33715 }, { "entropy": 5.740895366668701, "epoch": 2.623536276988913, "grad_norm": 1.2734375, "learning_rate": 0.0004307767505220964, "loss": 4.9165, "mean_token_accuracy": 0.21376111656427382, "num_tokens": 58513807.0, "step": 33720 }, { "entropy": 5.681150579452515, "epoch": 2.62392530636063, "grad_norm": 1.265625, "learning_rate": 0.0004307567505938012, "loss": 4.9061, "mean_token_accuracy": 0.2109743759036064, "num_tokens": 58522426.0, "step": 33725 }, { "entropy": 5.714715576171875, "epoch": 2.6243143357323477, "grad_norm": 1.296875, "learning_rate": 0.0004307367483021452, "loss": 4.978, "mean_token_accuracy": 0.20549404621124268, "num_tokens": 58531038.0, "step": 33730 }, { "entropy": 5.762574338912964, "epoch": 2.6247033651040654, "grad_norm": 1.2421875, "learning_rate": 0.000430716743647432, "loss": 4.9733, "mean_token_accuracy": 0.21315242648124694, "num_tokens": 58539373.0, "step": 33735 }, { "entropy": 5.697098016738892, "epoch": 2.625092394475783, "grad_norm": 1.3515625, "learning_rate": 0.000430696736629965, "loss": 4.8452, "mean_token_accuracy": 0.2152157172560692, "num_tokens": 58547295.0, "step": 33740 }, { "entropy": 5.741835498809815, "epoch": 2.6254814238475004, "grad_norm": 1.171875, "learning_rate": 0.0004306767272500478, "loss": 5.0712, "mean_token_accuracy": 0.20154183655977248, "num_tokens": 58555614.0, "step": 33745 }, { "entropy": 5.724033975601197, "epoch": 2.625870453219218, "grad_norm": 1.2265625, "learning_rate": 0.00043065671550798415, "loss": 4.9642, "mean_token_accuracy": 0.20256564468145372, "num_tokens": 58564444.0, "step": 33750 }, { "entropy": 5.708144569396973, "epoch": 2.626259482590936, "grad_norm": 1.203125, "learning_rate": 0.00043063670140407753, "loss": 4.9325, "mean_token_accuracy": 0.20851137191057206, "num_tokens": 58573446.0, "step": 33755 }, { "entropy": 5.81295075416565, "epoch": 2.626648511962653, "grad_norm": 1.21875, "learning_rate": 0.0004306166849386317, "loss": 4.9822, "mean_token_accuracy": 0.20683825463056565, "num_tokens": 58582065.0, "step": 33760 }, { "entropy": 5.648973894119263, "epoch": 2.6270375413343707, "grad_norm": 1.2890625, "learning_rate": 0.00043059666611195037, "loss": 4.8756, "mean_token_accuracy": 0.21208566278219224, "num_tokens": 58590222.0, "step": 33765 }, { "entropy": 5.739373970031738, "epoch": 2.6274265707060884, "grad_norm": 1.2109375, "learning_rate": 0.0004305766449243372, "loss": 4.9919, "mean_token_accuracy": 0.20121004581451415, "num_tokens": 58598745.0, "step": 33770 }, { "entropy": 5.81614351272583, "epoch": 2.627815600077806, "grad_norm": 1.2734375, "learning_rate": 0.0004305566213760962, "loss": 4.975, "mean_token_accuracy": 0.2091350093483925, "num_tokens": 58607199.0, "step": 33775 }, { "entropy": 5.799896717071533, "epoch": 2.6282046294495234, "grad_norm": 1.1484375, "learning_rate": 0.00043053659546753094, "loss": 5.0887, "mean_token_accuracy": 0.19685013294219972, "num_tokens": 58616593.0, "step": 33780 }, { "entropy": 5.724701166152954, "epoch": 2.628593658821241, "grad_norm": 1.2421875, "learning_rate": 0.0004305165671989455, "loss": 4.9859, "mean_token_accuracy": 0.20650027245283126, "num_tokens": 58626165.0, "step": 33785 }, { "entropy": 5.757542562484741, "epoch": 2.6289826881929583, "grad_norm": 1.2578125, "learning_rate": 0.0004304965365706437, "loss": 4.9637, "mean_token_accuracy": 0.21062172949314117, "num_tokens": 58634392.0, "step": 33790 }, { "entropy": 5.7461389064788815, "epoch": 2.629371717564676, "grad_norm": 1.34375, "learning_rate": 0.0004304765035829294, "loss": 5.0616, "mean_token_accuracy": 0.20463840514421464, "num_tokens": 58644584.0, "step": 33795 }, { "entropy": 5.7736328601837155, "epoch": 2.6297607469363937, "grad_norm": 1.2890625, "learning_rate": 0.00043045646823610664, "loss": 5.0706, "mean_token_accuracy": 0.20260827988386154, "num_tokens": 58653601.0, "step": 33800 }, { "entropy": 5.770496225357055, "epoch": 2.6301497763081114, "grad_norm": 1.296875, "learning_rate": 0.00043043643053047935, "loss": 4.9892, "mean_token_accuracy": 0.21079366356134416, "num_tokens": 58661947.0, "step": 33805 }, { "entropy": 5.808750200271606, "epoch": 2.6305388056798287, "grad_norm": 1.25, "learning_rate": 0.0004304163904663517, "loss": 5.1001, "mean_token_accuracy": 0.19874742180109023, "num_tokens": 58670537.0, "step": 33810 }, { "entropy": 5.778955030441284, "epoch": 2.6309278350515464, "grad_norm": 1.296875, "learning_rate": 0.00043039634804402767, "loss": 4.9327, "mean_token_accuracy": 0.20697752386331558, "num_tokens": 58679491.0, "step": 33815 }, { "entropy": 5.738336420059204, "epoch": 2.631316864423264, "grad_norm": 1.25, "learning_rate": 0.0004303763032638114, "loss": 4.967, "mean_token_accuracy": 0.20661523342132568, "num_tokens": 58689078.0, "step": 33820 }, { "entropy": 5.733738708496094, "epoch": 2.6317058937949813, "grad_norm": 1.3125, "learning_rate": 0.0004303562561260071, "loss": 4.9392, "mean_token_accuracy": 0.20538584142923355, "num_tokens": 58697113.0, "step": 33825 }, { "entropy": 5.781717824935913, "epoch": 2.632094923166699, "grad_norm": 1.2109375, "learning_rate": 0.00043033620663091883, "loss": 5.0297, "mean_token_accuracy": 0.2081252321600914, "num_tokens": 58705368.0, "step": 33830 }, { "entropy": 5.768449163436889, "epoch": 2.6324839525384167, "grad_norm": 1.3515625, "learning_rate": 0.0004303161547788509, "loss": 4.9888, "mean_token_accuracy": 0.20570405274629594, "num_tokens": 58713828.0, "step": 33835 }, { "entropy": 5.714462089538574, "epoch": 2.6328729819101344, "grad_norm": 1.2890625, "learning_rate": 0.0004302961005701074, "loss": 4.9522, "mean_token_accuracy": 0.2038877710700035, "num_tokens": 58721896.0, "step": 33840 }, { "entropy": 5.830992364883423, "epoch": 2.6332620112818517, "grad_norm": 1.2421875, "learning_rate": 0.00043027604400499295, "loss": 5.0257, "mean_token_accuracy": 0.20067147314548492, "num_tokens": 58729861.0, "step": 33845 }, { "entropy": 5.7352429866790775, "epoch": 2.6336510406535694, "grad_norm": 1.3046875, "learning_rate": 0.00043025598508381155, "loss": 4.916, "mean_token_accuracy": 0.2150746241211891, "num_tokens": 58738023.0, "step": 33850 }, { "entropy": 5.719020891189575, "epoch": 2.634040070025287, "grad_norm": 1.2734375, "learning_rate": 0.0004302359238068677, "loss": 4.9929, "mean_token_accuracy": 0.20194027572870255, "num_tokens": 58746678.0, "step": 33855 }, { "entropy": 5.6561439514160154, "epoch": 2.6344290993970043, "grad_norm": 1.296875, "learning_rate": 0.00043021586017446585, "loss": 4.9014, "mean_token_accuracy": 0.2147592782974243, "num_tokens": 58754746.0, "step": 33860 }, { "entropy": 5.7043579578399655, "epoch": 2.634818128768722, "grad_norm": 1.3046875, "learning_rate": 0.00043019579418691027, "loss": 4.9865, "mean_token_accuracy": 0.20470765382051467, "num_tokens": 58762972.0, "step": 33865 }, { "entropy": 5.830435085296631, "epoch": 2.6352071581404397, "grad_norm": 1.1171875, "learning_rate": 0.0004301757258445056, "loss": 5.043, "mean_token_accuracy": 0.20073170065879822, "num_tokens": 58772529.0, "step": 33870 }, { "entropy": 5.693178462982178, "epoch": 2.6355961875121574, "grad_norm": 1.1640625, "learning_rate": 0.0004301556551475563, "loss": 4.9073, "mean_token_accuracy": 0.2114935740828514, "num_tokens": 58781239.0, "step": 33875 }, { "entropy": 5.7335515975952145, "epoch": 2.6359852168838747, "grad_norm": 1.265625, "learning_rate": 0.0004301355820963669, "loss": 4.9737, "mean_token_accuracy": 0.2073205143213272, "num_tokens": 58789876.0, "step": 33880 }, { "entropy": 5.736359310150147, "epoch": 2.6363742462555924, "grad_norm": 1.2734375, "learning_rate": 0.0004301155066912419, "loss": 5.0156, "mean_token_accuracy": 0.20825667083263397, "num_tokens": 58798383.0, "step": 33885 }, { "entropy": 5.790340280532837, "epoch": 2.6367632756273096, "grad_norm": 1.296875, "learning_rate": 0.000430095428932486, "loss": 5.0253, "mean_token_accuracy": 0.20657783299684523, "num_tokens": 58806804.0, "step": 33890 }, { "entropy": 5.760024166107177, "epoch": 2.6371523049990273, "grad_norm": 1.3359375, "learning_rate": 0.00043007534882040385, "loss": 5.0046, "mean_token_accuracy": 0.2038985714316368, "num_tokens": 58815755.0, "step": 33895 }, { "entropy": 5.782485866546631, "epoch": 2.637541334370745, "grad_norm": 1.2734375, "learning_rate": 0.0004300552663553001, "loss": 4.9876, "mean_token_accuracy": 0.20811828523874282, "num_tokens": 58824547.0, "step": 33900 }, { "entropy": 5.7784322738647464, "epoch": 2.6379303637424627, "grad_norm": 1.40625, "learning_rate": 0.0004300351815374795, "loss": 5.0193, "mean_token_accuracy": 0.20673235654830932, "num_tokens": 58832471.0, "step": 33905 }, { "entropy": 5.765452575683594, "epoch": 2.63831939311418, "grad_norm": 1.40625, "learning_rate": 0.0004300150943672467, "loss": 5.0755, "mean_token_accuracy": 0.20904047340154647, "num_tokens": 58841367.0, "step": 33910 }, { "entropy": 5.7486978530883786, "epoch": 2.6387084224858977, "grad_norm": 1.1953125, "learning_rate": 0.0004299950048449067, "loss": 4.9915, "mean_token_accuracy": 0.2039876252412796, "num_tokens": 58849946.0, "step": 33915 }, { "entropy": 5.828851985931396, "epoch": 2.6390974518576154, "grad_norm": 1.25, "learning_rate": 0.0004299749129707641, "loss": 5.0742, "mean_token_accuracy": 0.20084165036678314, "num_tokens": 58858288.0, "step": 33920 }, { "entropy": 5.855333375930786, "epoch": 2.6394864812293326, "grad_norm": 1.3046875, "learning_rate": 0.0004299548187451239, "loss": 5.0483, "mean_token_accuracy": 0.20018096268177032, "num_tokens": 58866968.0, "step": 33925 }, { "entropy": 5.785285711288452, "epoch": 2.6398755106010503, "grad_norm": 1.2421875, "learning_rate": 0.00042993472216829097, "loss": 4.9492, "mean_token_accuracy": 0.2095009833574295, "num_tokens": 58875635.0, "step": 33930 }, { "entropy": 5.788784980773926, "epoch": 2.640264539972768, "grad_norm": 1.1875, "learning_rate": 0.00042991462324057025, "loss": 4.9789, "mean_token_accuracy": 0.21303447782993318, "num_tokens": 58884080.0, "step": 33935 }, { "entropy": 5.700630617141724, "epoch": 2.6406535693444857, "grad_norm": 1.3125, "learning_rate": 0.0004298945219622667, "loss": 4.8982, "mean_token_accuracy": 0.2099815234541893, "num_tokens": 58891770.0, "step": 33940 }, { "entropy": 5.727335453033447, "epoch": 2.641042598716203, "grad_norm": 1.2265625, "learning_rate": 0.00042987441833368525, "loss": 5.0229, "mean_token_accuracy": 0.20298945009708405, "num_tokens": 58900446.0, "step": 33945 }, { "entropy": 5.788039875030518, "epoch": 2.6414316280879206, "grad_norm": 1.2265625, "learning_rate": 0.00042985431235513104, "loss": 5.0038, "mean_token_accuracy": 0.2093222126364708, "num_tokens": 58909423.0, "step": 33950 }, { "entropy": 5.8286150932312015, "epoch": 2.6418206574596383, "grad_norm": 1.25, "learning_rate": 0.00042983420402690917, "loss": 5.0596, "mean_token_accuracy": 0.19979308247566224, "num_tokens": 58918175.0, "step": 33955 }, { "entropy": 5.7000058650970455, "epoch": 2.6422096868313556, "grad_norm": 1.1328125, "learning_rate": 0.00042981409334932457, "loss": 4.981, "mean_token_accuracy": 0.2027666911482811, "num_tokens": 58926837.0, "step": 33960 }, { "entropy": 5.77056188583374, "epoch": 2.6425987162030733, "grad_norm": 1.25, "learning_rate": 0.0004297939803226826, "loss": 5.0374, "mean_token_accuracy": 0.2035613551735878, "num_tokens": 58934994.0, "step": 33965 }, { "entropy": 5.716078615188598, "epoch": 2.642987745574791, "grad_norm": 1.265625, "learning_rate": 0.0004297738649472884, "loss": 4.9848, "mean_token_accuracy": 0.20521089434623718, "num_tokens": 58943937.0, "step": 33970 }, { "entropy": 5.785591173171997, "epoch": 2.6433767749465087, "grad_norm": 1.2421875, "learning_rate": 0.00042975374722344713, "loss": 5.0158, "mean_token_accuracy": 0.1968502178788185, "num_tokens": 58952360.0, "step": 33975 }, { "entropy": 5.7958756446838375, "epoch": 2.643765804318226, "grad_norm": 1.3125, "learning_rate": 0.00042973362715146397, "loss": 4.9613, "mean_token_accuracy": 0.21146545112133025, "num_tokens": 58961846.0, "step": 33980 }, { "entropy": 5.798363828659058, "epoch": 2.6441548336899436, "grad_norm": 1.21875, "learning_rate": 0.0004297135047316444, "loss": 5.0238, "mean_token_accuracy": 0.20462702959775925, "num_tokens": 58970215.0, "step": 33985 }, { "entropy": 5.719180059432984, "epoch": 2.644543863061661, "grad_norm": 1.15625, "learning_rate": 0.0004296933799642936, "loss": 4.9234, "mean_token_accuracy": 0.20716263502836227, "num_tokens": 58978623.0, "step": 33990 }, { "entropy": 5.7968532085418705, "epoch": 2.6449328924333786, "grad_norm": 1.1640625, "learning_rate": 0.000429673252849717, "loss": 4.9762, "mean_token_accuracy": 0.21215085834264755, "num_tokens": 58986616.0, "step": 33995 }, { "entropy": 5.782397222518921, "epoch": 2.6453219218050963, "grad_norm": 1.140625, "learning_rate": 0.00042965312338822005, "loss": 5.04, "mean_token_accuracy": 0.201270455121994, "num_tokens": 58996121.0, "step": 34000 }, { "entropy": 5.746051931381226, "epoch": 2.645710951176814, "grad_norm": 1.3828125, "learning_rate": 0.000429632991580108, "loss": 4.9425, "mean_token_accuracy": 0.2059352442622185, "num_tokens": 59004272.0, "step": 34005 }, { "entropy": 5.7122009754180905, "epoch": 2.6460999805485317, "grad_norm": 1.3203125, "learning_rate": 0.0004296128574256864, "loss": 4.9925, "mean_token_accuracy": 0.2080587089061737, "num_tokens": 59012513.0, "step": 34010 }, { "entropy": 5.752615070343017, "epoch": 2.646489009920249, "grad_norm": 1.2109375, "learning_rate": 0.00042959272092526086, "loss": 4.9787, "mean_token_accuracy": 0.20590208023786544, "num_tokens": 59021071.0, "step": 34015 }, { "entropy": 5.834737730026245, "epoch": 2.6468780392919666, "grad_norm": 1.34375, "learning_rate": 0.00042957258207913687, "loss": 5.0161, "mean_token_accuracy": 0.20381605625152588, "num_tokens": 59030154.0, "step": 34020 }, { "entropy": 5.817493343353272, "epoch": 2.647267068663684, "grad_norm": 1.3046875, "learning_rate": 0.00042955244088761985, "loss": 5.0606, "mean_token_accuracy": 0.2063338950276375, "num_tokens": 59038962.0, "step": 34025 }, { "entropy": 5.737457227706909, "epoch": 2.6476560980354016, "grad_norm": 1.21875, "learning_rate": 0.0004295322973510156, "loss": 4.9898, "mean_token_accuracy": 0.20038558840751647, "num_tokens": 59046856.0, "step": 34030 }, { "entropy": 5.781431579589844, "epoch": 2.6480451274071193, "grad_norm": 1.2890625, "learning_rate": 0.0004295121514696297, "loss": 5.0165, "mean_token_accuracy": 0.20398189574480058, "num_tokens": 59055124.0, "step": 34035 }, { "entropy": 5.807726955413818, "epoch": 2.648434156778837, "grad_norm": 1.265625, "learning_rate": 0.00042949200324376784, "loss": 5.0456, "mean_token_accuracy": 0.20543297976255417, "num_tokens": 59064104.0, "step": 34040 }, { "entropy": 5.726795291900634, "epoch": 2.6488231861505542, "grad_norm": 1.234375, "learning_rate": 0.0004294718526737357, "loss": 4.9524, "mean_token_accuracy": 0.20853398591279984, "num_tokens": 59071991.0, "step": 34045 }, { "entropy": 5.70872049331665, "epoch": 2.649212215522272, "grad_norm": 1.28125, "learning_rate": 0.0004294516997598391, "loss": 4.9693, "mean_token_accuracy": 0.21636675596237182, "num_tokens": 59080519.0, "step": 34050 }, { "entropy": 5.737383842468262, "epoch": 2.6496012448939896, "grad_norm": 1.265625, "learning_rate": 0.0004294315445023838, "loss": 4.9846, "mean_token_accuracy": 0.20309363156557084, "num_tokens": 59089555.0, "step": 34055 }, { "entropy": 5.781348943710327, "epoch": 2.649990274265707, "grad_norm": 1.171875, "learning_rate": 0.00042941138690167556, "loss": 4.9735, "mean_token_accuracy": 0.21209764927625657, "num_tokens": 59098287.0, "step": 34060 }, { "entropy": 5.673504114151001, "epoch": 2.6503793036374246, "grad_norm": 1.21875, "learning_rate": 0.0004293912269580204, "loss": 4.9775, "mean_token_accuracy": 0.21377580761909484, "num_tokens": 59106463.0, "step": 34065 }, { "entropy": 5.817241907119751, "epoch": 2.6507683330091423, "grad_norm": 1.203125, "learning_rate": 0.000429371064671724, "loss": 5.0344, "mean_token_accuracy": 0.20153960585594177, "num_tokens": 59115324.0, "step": 34070 }, { "entropy": 5.7594386577606205, "epoch": 2.65115736238086, "grad_norm": 1.25, "learning_rate": 0.00042935090004309247, "loss": 4.9412, "mean_token_accuracy": 0.20840903073549272, "num_tokens": 59123438.0, "step": 34075 }, { "entropy": 5.802229022979736, "epoch": 2.6515463917525772, "grad_norm": 1.28125, "learning_rate": 0.00042933073307243165, "loss": 4.9749, "mean_token_accuracy": 0.20748104751110077, "num_tokens": 59131436.0, "step": 34080 }, { "entropy": 5.714805603027344, "epoch": 2.651935421124295, "grad_norm": 1.2109375, "learning_rate": 0.00042931056376004767, "loss": 5.0567, "mean_token_accuracy": 0.21004955023527144, "num_tokens": 59139981.0, "step": 34085 }, { "entropy": 5.721381664276123, "epoch": 2.652324450496012, "grad_norm": 1.2421875, "learning_rate": 0.0004292903921062465, "loss": 4.9589, "mean_token_accuracy": 0.21093981117010116, "num_tokens": 59148833.0, "step": 34090 }, { "entropy": 5.776584148406982, "epoch": 2.65271347986773, "grad_norm": 1.2109375, "learning_rate": 0.00042927021811133416, "loss": 5.0368, "mean_token_accuracy": 0.1987171545624733, "num_tokens": 59157597.0, "step": 34095 }, { "entropy": 5.782119941711426, "epoch": 2.6531025092394476, "grad_norm": 1.3828125, "learning_rate": 0.0004292500417756167, "loss": 4.969, "mean_token_accuracy": 0.2091366469860077, "num_tokens": 59166286.0, "step": 34100 }, { "entropy": 5.7783575534820555, "epoch": 2.6534915386111653, "grad_norm": 1.2265625, "learning_rate": 0.00042922986309940054, "loss": 5.0221, "mean_token_accuracy": 0.2092737764120102, "num_tokens": 59174019.0, "step": 34105 }, { "entropy": 5.757407236099243, "epoch": 2.653880567982883, "grad_norm": 1.1796875, "learning_rate": 0.00042920968208299165, "loss": 4.9923, "mean_token_accuracy": 0.20546508729457855, "num_tokens": 59183885.0, "step": 34110 }, { "entropy": 5.78719129562378, "epoch": 2.6542695973546, "grad_norm": 1.234375, "learning_rate": 0.0004291894987266963, "loss": 4.9174, "mean_token_accuracy": 0.20796530246734618, "num_tokens": 59192196.0, "step": 34115 }, { "entropy": 5.769192695617676, "epoch": 2.654658626726318, "grad_norm": 1.3359375, "learning_rate": 0.00042916931303082064, "loss": 4.9882, "mean_token_accuracy": 0.20765392780303954, "num_tokens": 59200269.0, "step": 34120 }, { "entropy": 5.788691234588623, "epoch": 2.655047656098035, "grad_norm": 1.25, "learning_rate": 0.00042914912499567113, "loss": 5.0551, "mean_token_accuracy": 0.1997659608721733, "num_tokens": 59208690.0, "step": 34125 }, { "entropy": 5.807337713241577, "epoch": 2.655436685469753, "grad_norm": 1.2734375, "learning_rate": 0.00042912893462155395, "loss": 5.0103, "mean_token_accuracy": 0.20489755272865295, "num_tokens": 59217222.0, "step": 34130 }, { "entropy": 5.803229856491089, "epoch": 2.6558257148414706, "grad_norm": 1.2265625, "learning_rate": 0.00042910874190877545, "loss": 5.0237, "mean_token_accuracy": 0.20683650225400924, "num_tokens": 59226161.0, "step": 34135 }, { "entropy": 5.810457229614258, "epoch": 2.6562147442131883, "grad_norm": 1.21875, "learning_rate": 0.0004290885468576422, "loss": 4.9886, "mean_token_accuracy": 0.20274344682693482, "num_tokens": 59234239.0, "step": 34140 }, { "entropy": 5.742700910568237, "epoch": 2.6566037735849055, "grad_norm": 1.2109375, "learning_rate": 0.0004290683494684604, "loss": 4.9245, "mean_token_accuracy": 0.21063126623630524, "num_tokens": 59243390.0, "step": 34145 }, { "entropy": 5.728374290466308, "epoch": 2.656992802956623, "grad_norm": 1.171875, "learning_rate": 0.0004290481497415367, "loss": 5.0125, "mean_token_accuracy": 0.21027939021587372, "num_tokens": 59252854.0, "step": 34150 }, { "entropy": 5.730996322631836, "epoch": 2.657381832328341, "grad_norm": 1.171875, "learning_rate": 0.0004290279476771775, "loss": 4.9585, "mean_token_accuracy": 0.2089229166507721, "num_tokens": 59261505.0, "step": 34155 }, { "entropy": 5.781494092941284, "epoch": 2.657770861700058, "grad_norm": 1.4140625, "learning_rate": 0.0004290077432756894, "loss": 4.9811, "mean_token_accuracy": 0.20536563247442247, "num_tokens": 59269209.0, "step": 34160 }, { "entropy": 5.774490642547607, "epoch": 2.658159891071776, "grad_norm": 1.1953125, "learning_rate": 0.0004289875365373788, "loss": 5.0026, "mean_token_accuracy": 0.1972527414560318, "num_tokens": 59277951.0, "step": 34165 }, { "entropy": 5.670295381546021, "epoch": 2.6585489204434936, "grad_norm": 1.21875, "learning_rate": 0.00042896732746255256, "loss": 4.8796, "mean_token_accuracy": 0.21668145507574083, "num_tokens": 59286266.0, "step": 34170 }, { "entropy": 5.761726760864258, "epoch": 2.6589379498152113, "grad_norm": 1.2578125, "learning_rate": 0.00042894711605151714, "loss": 5.0284, "mean_token_accuracy": 0.20081547200679778, "num_tokens": 59294633.0, "step": 34175 }, { "entropy": 5.783517694473266, "epoch": 2.6593269791869285, "grad_norm": 1.28125, "learning_rate": 0.00042892690230457924, "loss": 4.9585, "mean_token_accuracy": 0.21711023449897765, "num_tokens": 59303526.0, "step": 34180 }, { "entropy": 5.799003934860229, "epoch": 2.659716008558646, "grad_norm": 1.2578125, "learning_rate": 0.00042890668622204566, "loss": 4.9503, "mean_token_accuracy": 0.2143409878015518, "num_tokens": 59311921.0, "step": 34185 }, { "entropy": 5.819645595550537, "epoch": 2.660105037930364, "grad_norm": 1.265625, "learning_rate": 0.000428886467804223, "loss": 5.119, "mean_token_accuracy": 0.20340732634067535, "num_tokens": 59320750.0, "step": 34190 }, { "entropy": 5.710008668899536, "epoch": 2.660494067302081, "grad_norm": 1.125, "learning_rate": 0.00042886624705141825, "loss": 4.918, "mean_token_accuracy": 0.20686909556388855, "num_tokens": 59330036.0, "step": 34195 }, { "entropy": 5.777923727035523, "epoch": 2.660883096673799, "grad_norm": 1.2421875, "learning_rate": 0.00042884602396393796, "loss": 5.0774, "mean_token_accuracy": 0.19690336883068085, "num_tokens": 59339022.0, "step": 34200 }, { "entropy": 5.767139577865601, "epoch": 2.6612721260455166, "grad_norm": 1.1875, "learning_rate": 0.0004288257985420892, "loss": 4.9312, "mean_token_accuracy": 0.20684129297733306, "num_tokens": 59347599.0, "step": 34205 }, { "entropy": 5.864638757705689, "epoch": 2.6616611554172342, "grad_norm": 1.3046875, "learning_rate": 0.0004288055707861788, "loss": 5.0431, "mean_token_accuracy": 0.20078569501638413, "num_tokens": 59356453.0, "step": 34210 }, { "entropy": 5.733516263961792, "epoch": 2.6620501847889515, "grad_norm": 1.2109375, "learning_rate": 0.00042878534069651364, "loss": 4.9921, "mean_token_accuracy": 0.21365273594856263, "num_tokens": 59364617.0, "step": 34215 }, { "entropy": 5.767459869384766, "epoch": 2.662439214160669, "grad_norm": 1.203125, "learning_rate": 0.0004287651082734007, "loss": 5.0145, "mean_token_accuracy": 0.20334753543138503, "num_tokens": 59374144.0, "step": 34220 }, { "entropy": 5.7932545185089115, "epoch": 2.6628282435323865, "grad_norm": 1.1953125, "learning_rate": 0.000428744873517147, "loss": 5.0876, "mean_token_accuracy": 0.19351752549409867, "num_tokens": 59382572.0, "step": 34225 }, { "entropy": 5.7979217052459715, "epoch": 2.663217272904104, "grad_norm": 1.15625, "learning_rate": 0.0004287246364280596, "loss": 5.0858, "mean_token_accuracy": 0.1991134151816368, "num_tokens": 59391582.0, "step": 34230 }, { "entropy": 5.740156793594361, "epoch": 2.663606302275822, "grad_norm": 1.1171875, "learning_rate": 0.0004287043970064455, "loss": 4.9852, "mean_token_accuracy": 0.2120040699839592, "num_tokens": 59400760.0, "step": 34235 }, { "entropy": 5.85084080696106, "epoch": 2.6639953316475395, "grad_norm": 1.234375, "learning_rate": 0.0004286841552526118, "loss": 5.1228, "mean_token_accuracy": 0.2027067020535469, "num_tokens": 59409427.0, "step": 34240 }, { "entropy": 5.756965494155883, "epoch": 2.664384361019257, "grad_norm": 1.1796875, "learning_rate": 0.00042866391116686567, "loss": 5.0072, "mean_token_accuracy": 0.20642681866884233, "num_tokens": 59417538.0, "step": 34245 }, { "entropy": 5.803336811065674, "epoch": 2.6647733903909745, "grad_norm": 1.1796875, "learning_rate": 0.0004286436647495142, "loss": 4.9753, "mean_token_accuracy": 0.20432389080524443, "num_tokens": 59426499.0, "step": 34250 }, { "entropy": 5.853385734558105, "epoch": 2.665162419762692, "grad_norm": 1.34375, "learning_rate": 0.00042862341600086477, "loss": 5.0675, "mean_token_accuracy": 0.19707028716802596, "num_tokens": 59434921.0, "step": 34255 }, { "entropy": 5.722882604598999, "epoch": 2.6655514491344094, "grad_norm": 1.2734375, "learning_rate": 0.00042860316492122447, "loss": 4.8551, "mean_token_accuracy": 0.2123110696673393, "num_tokens": 59443930.0, "step": 34260 }, { "entropy": 5.750018978118897, "epoch": 2.665940478506127, "grad_norm": 1.2421875, "learning_rate": 0.0004285829115109006, "loss": 4.9449, "mean_token_accuracy": 0.21142388433218, "num_tokens": 59453335.0, "step": 34265 }, { "entropy": 5.768413019180298, "epoch": 2.666329507877845, "grad_norm": 1.203125, "learning_rate": 0.0004285626557702005, "loss": 5.0263, "mean_token_accuracy": 0.20362842231988906, "num_tokens": 59461937.0, "step": 34270 }, { "entropy": 5.823128795623779, "epoch": 2.6667185372495625, "grad_norm": 1.1484375, "learning_rate": 0.0004285423976994316, "loss": 4.9652, "mean_token_accuracy": 0.2073827564716339, "num_tokens": 59470858.0, "step": 34275 }, { "entropy": 5.7865955352783205, "epoch": 2.66710756662128, "grad_norm": 1.2578125, "learning_rate": 0.00042852213729890117, "loss": 5.0226, "mean_token_accuracy": 0.2045006662607193, "num_tokens": 59478902.0, "step": 34280 }, { "entropy": 5.702309513092041, "epoch": 2.6674965959929975, "grad_norm": 1.296875, "learning_rate": 0.0004285018745689166, "loss": 4.934, "mean_token_accuracy": 0.21013825982809067, "num_tokens": 59487281.0, "step": 34285 }, { "entropy": 5.75648946762085, "epoch": 2.667885625364715, "grad_norm": 1.21875, "learning_rate": 0.0004284816095097855, "loss": 4.9724, "mean_token_accuracy": 0.20621083974838256, "num_tokens": 59496304.0, "step": 34290 }, { "entropy": 5.6896919250488285, "epoch": 2.6682746547364324, "grad_norm": 1.3125, "learning_rate": 0.0004284613421218152, "loss": 4.9135, "mean_token_accuracy": 0.21539425253868102, "num_tokens": 59504577.0, "step": 34295 }, { "entropy": 5.692991590499878, "epoch": 2.66866368410815, "grad_norm": 1.1796875, "learning_rate": 0.00042844107240531324, "loss": 4.9724, "mean_token_accuracy": 0.20654021501541137, "num_tokens": 59513468.0, "step": 34300 }, { "entropy": 5.79981369972229, "epoch": 2.669052713479868, "grad_norm": 1.1875, "learning_rate": 0.0004284208003605873, "loss": 5.0113, "mean_token_accuracy": 0.200614857673645, "num_tokens": 59522516.0, "step": 34305 }, { "entropy": 5.797414398193359, "epoch": 2.6694417428515855, "grad_norm": 1.2890625, "learning_rate": 0.000428400525987945, "loss": 4.9576, "mean_token_accuracy": 0.20651436150074004, "num_tokens": 59531434.0, "step": 34310 }, { "entropy": 5.816468048095703, "epoch": 2.669830772223303, "grad_norm": 1.2265625, "learning_rate": 0.00042838024928769375, "loss": 4.9992, "mean_token_accuracy": 0.2122481048107147, "num_tokens": 59539967.0, "step": 34315 }, { "entropy": 5.815037727355957, "epoch": 2.6702198015950205, "grad_norm": 1.1875, "learning_rate": 0.00042835997026014145, "loss": 5.115, "mean_token_accuracy": 0.19873297810554505, "num_tokens": 59549558.0, "step": 34320 }, { "entropy": 5.726599311828613, "epoch": 2.6706088309667377, "grad_norm": 1.3125, "learning_rate": 0.0004283396889055957, "loss": 4.9481, "mean_token_accuracy": 0.2147311896085739, "num_tokens": 59557520.0, "step": 34325 }, { "entropy": 5.851682806015015, "epoch": 2.6709978603384554, "grad_norm": 1.328125, "learning_rate": 0.0004283194052243641, "loss": 5.0727, "mean_token_accuracy": 0.20618268400430678, "num_tokens": 59565753.0, "step": 34330 }, { "entropy": 5.834269285202026, "epoch": 2.671386889710173, "grad_norm": 1.2109375, "learning_rate": 0.00042829911921675456, "loss": 5.0742, "mean_token_accuracy": 0.2059593141078949, "num_tokens": 59574522.0, "step": 34335 }, { "entropy": 5.731231784820556, "epoch": 2.671775919081891, "grad_norm": 1.203125, "learning_rate": 0.000428278830883075, "loss": 4.9562, "mean_token_accuracy": 0.2056015819311142, "num_tokens": 59583733.0, "step": 34340 }, { "entropy": 5.791233682632447, "epoch": 2.6721649484536085, "grad_norm": 1.1640625, "learning_rate": 0.00042825854022363307, "loss": 5.0905, "mean_token_accuracy": 0.20382305830717087, "num_tokens": 59593009.0, "step": 34345 }, { "entropy": 5.780006074905396, "epoch": 2.6725539778253258, "grad_norm": 1.3984375, "learning_rate": 0.00042823824723873676, "loss": 4.9974, "mean_token_accuracy": 0.2115011304616928, "num_tokens": 59601770.0, "step": 34350 }, { "entropy": 5.759178161621094, "epoch": 2.6729430071970435, "grad_norm": 1.25, "learning_rate": 0.00042821795192869407, "loss": 4.9421, "mean_token_accuracy": 0.21230160146951677, "num_tokens": 59610397.0, "step": 34355 }, { "entropy": 5.785210514068604, "epoch": 2.6733320365687607, "grad_norm": 1.2421875, "learning_rate": 0.0004281976542938127, "loss": 4.9987, "mean_token_accuracy": 0.2062266156077385, "num_tokens": 59618864.0, "step": 34360 }, { "entropy": 5.728514957427978, "epoch": 2.6737210659404784, "grad_norm": 1.265625, "learning_rate": 0.00042817735433440076, "loss": 4.98, "mean_token_accuracy": 0.20489100515842437, "num_tokens": 59627469.0, "step": 34365 }, { "entropy": 5.714287614822387, "epoch": 2.674110095312196, "grad_norm": 1.140625, "learning_rate": 0.0004281570520507663, "loss": 4.9758, "mean_token_accuracy": 0.20644194334745408, "num_tokens": 59636125.0, "step": 34370 }, { "entropy": 5.744770622253418, "epoch": 2.674499124683914, "grad_norm": 1.203125, "learning_rate": 0.00042813674744321737, "loss": 4.9475, "mean_token_accuracy": 0.2105255275964737, "num_tokens": 59644586.0, "step": 34375 }, { "entropy": 5.8100052833557125, "epoch": 2.674888154055631, "grad_norm": 1.2109375, "learning_rate": 0.000428116440512062, "loss": 4.9836, "mean_token_accuracy": 0.20611904114484786, "num_tokens": 59653644.0, "step": 34380 }, { "entropy": 5.729713821411133, "epoch": 2.6752771834273488, "grad_norm": 1.25, "learning_rate": 0.0004280961312576084, "loss": 5.0297, "mean_token_accuracy": 0.19709552824497223, "num_tokens": 59662270.0, "step": 34385 }, { "entropy": 5.7554456233978275, "epoch": 2.6756662127990665, "grad_norm": 1.1875, "learning_rate": 0.0004280758196801646, "loss": 4.9606, "mean_token_accuracy": 0.20997452437877656, "num_tokens": 59670544.0, "step": 34390 }, { "entropy": 5.80449652671814, "epoch": 2.6760552421707837, "grad_norm": 1.1875, "learning_rate": 0.00042805550578003894, "loss": 5.0725, "mean_token_accuracy": 0.20609840154647827, "num_tokens": 59679985.0, "step": 34395 }, { "entropy": 5.775054883956909, "epoch": 2.6764442715425014, "grad_norm": 1.1953125, "learning_rate": 0.0004280351895575396, "loss": 5.048, "mean_token_accuracy": 0.204373799264431, "num_tokens": 59689831.0, "step": 34400 }, { "entropy": 5.79603943824768, "epoch": 2.676833300914219, "grad_norm": 1.28125, "learning_rate": 0.0004280148710129748, "loss": 5.046, "mean_token_accuracy": 0.20629473626613617, "num_tokens": 59697400.0, "step": 34405 }, { "entropy": 5.754294967651367, "epoch": 2.677222330285937, "grad_norm": 1.25, "learning_rate": 0.00042799455014665296, "loss": 4.98, "mean_token_accuracy": 0.20895417928695678, "num_tokens": 59706137.0, "step": 34410 }, { "entropy": 5.814772653579712, "epoch": 2.677611359657654, "grad_norm": 1.265625, "learning_rate": 0.00042797422695888226, "loss": 5.0591, "mean_token_accuracy": 0.19948384761810303, "num_tokens": 59715454.0, "step": 34415 }, { "entropy": 5.801063108444214, "epoch": 2.6780003890293718, "grad_norm": 1.2734375, "learning_rate": 0.0004279539014499712, "loss": 4.9488, "mean_token_accuracy": 0.21211555749177932, "num_tokens": 59723801.0, "step": 34420 }, { "entropy": 5.786560726165772, "epoch": 2.678389418401089, "grad_norm": 1.1640625, "learning_rate": 0.0004279335736202281, "loss": 5.0142, "mean_token_accuracy": 0.2042987510561943, "num_tokens": 59732899.0, "step": 34425 }, { "entropy": 5.744022989273072, "epoch": 2.6787784477728067, "grad_norm": 1.21875, "learning_rate": 0.0004279132434699615, "loss": 5.0584, "mean_token_accuracy": 0.20824712216854097, "num_tokens": 59741693.0, "step": 34430 }, { "entropy": 5.748468971252441, "epoch": 2.6791674771445244, "grad_norm": 1.2421875, "learning_rate": 0.0004278929109994798, "loss": 4.9097, "mean_token_accuracy": 0.2120950147509575, "num_tokens": 59749583.0, "step": 34435 }, { "entropy": 5.807040071487426, "epoch": 2.679556506516242, "grad_norm": 1.25, "learning_rate": 0.00042787257620909144, "loss": 5.0845, "mean_token_accuracy": 0.19569815397262574, "num_tokens": 59758638.0, "step": 34440 }, { "entropy": 5.727781581878662, "epoch": 2.67994553588796, "grad_norm": 1.1953125, "learning_rate": 0.00042785223909910515, "loss": 4.9296, "mean_token_accuracy": 0.212016062438488, "num_tokens": 59767746.0, "step": 34445 }, { "entropy": 5.777770614624023, "epoch": 2.680334565259677, "grad_norm": 1.15625, "learning_rate": 0.0004278318996698294, "loss": 5.0014, "mean_token_accuracy": 0.20249080657958984, "num_tokens": 59776426.0, "step": 34450 }, { "entropy": 5.780412244796753, "epoch": 2.6807235946313948, "grad_norm": 1.2890625, "learning_rate": 0.0004278115579215728, "loss": 5.0137, "mean_token_accuracy": 0.20517564862966536, "num_tokens": 59785032.0, "step": 34455 }, { "entropy": 5.775725317001343, "epoch": 2.681112624003112, "grad_norm": 1.171875, "learning_rate": 0.0004277912138546441, "loss": 5.0328, "mean_token_accuracy": 0.20419394969940186, "num_tokens": 59794510.0, "step": 34460 }, { "entropy": 5.729579210281372, "epoch": 2.6815016533748297, "grad_norm": 1.28125, "learning_rate": 0.0004277708674693519, "loss": 4.9635, "mean_token_accuracy": 0.2043824464082718, "num_tokens": 59802889.0, "step": 34465 }, { "entropy": 5.7661572933197025, "epoch": 2.6818906827465474, "grad_norm": 1.328125, "learning_rate": 0.00042775051876600483, "loss": 4.9655, "mean_token_accuracy": 0.2051308274269104, "num_tokens": 59811940.0, "step": 34470 }, { "entropy": 5.766362524032592, "epoch": 2.682279712118265, "grad_norm": 1.2421875, "learning_rate": 0.0004277301677449119, "loss": 4.9839, "mean_token_accuracy": 0.2079742893576622, "num_tokens": 59820465.0, "step": 34475 }, { "entropy": 5.814667701721191, "epoch": 2.6826687414899824, "grad_norm": 1.296875, "learning_rate": 0.0004277098144063818, "loss": 5.0867, "mean_token_accuracy": 0.20039381384849547, "num_tokens": 59829611.0, "step": 34480 }, { "entropy": 5.829601716995239, "epoch": 2.6830577708617, "grad_norm": 1.2890625, "learning_rate": 0.00042768945875072326, "loss": 5.0192, "mean_token_accuracy": 0.20279199182987212, "num_tokens": 59839073.0, "step": 34485 }, { "entropy": 5.826048278808594, "epoch": 2.6834468002334178, "grad_norm": 1.3203125, "learning_rate": 0.0004276691007782451, "loss": 5.0809, "mean_token_accuracy": 0.19903241842985153, "num_tokens": 59847653.0, "step": 34490 }, { "entropy": 5.790249252319336, "epoch": 2.683835829605135, "grad_norm": 1.3203125, "learning_rate": 0.0004276487404892565, "loss": 5.0394, "mean_token_accuracy": 0.196772937476635, "num_tokens": 59855534.0, "step": 34495 }, { "entropy": 5.767035293579101, "epoch": 2.6842248589768527, "grad_norm": 1.375, "learning_rate": 0.00042762837788406615, "loss": 4.9765, "mean_token_accuracy": 0.20635103732347487, "num_tokens": 59864862.0, "step": 34500 }, { "entropy": 5.76398344039917, "epoch": 2.6846138883485704, "grad_norm": 1.2265625, "learning_rate": 0.0004276080129629831, "loss": 5.0088, "mean_token_accuracy": 0.2057476446032524, "num_tokens": 59873100.0, "step": 34505 }, { "entropy": 5.783201885223389, "epoch": 2.685002917720288, "grad_norm": 1.2890625, "learning_rate": 0.00042758764572631644, "loss": 4.9594, "mean_token_accuracy": 0.21393164694309236, "num_tokens": 59881500.0, "step": 34510 }, { "entropy": 5.746620225906372, "epoch": 2.6853919470920053, "grad_norm": 1.203125, "learning_rate": 0.00042756727617437504, "loss": 4.9726, "mean_token_accuracy": 0.2087078019976616, "num_tokens": 59890168.0, "step": 34515 }, { "entropy": 5.787930107116699, "epoch": 2.685780976463723, "grad_norm": 1.234375, "learning_rate": 0.00042754690430746805, "loss": 5.0211, "mean_token_accuracy": 0.20230022370815276, "num_tokens": 59898805.0, "step": 34520 }, { "entropy": 5.81476845741272, "epoch": 2.6861700058354403, "grad_norm": 1.171875, "learning_rate": 0.0004275265301259046, "loss": 5.0387, "mean_token_accuracy": 0.19938917458057404, "num_tokens": 59907012.0, "step": 34525 }, { "entropy": 5.819837427139282, "epoch": 2.686559035207158, "grad_norm": 1.296875, "learning_rate": 0.00042750615362999395, "loss": 4.9879, "mean_token_accuracy": 0.21245453655719757, "num_tokens": 59915117.0, "step": 34530 }, { "entropy": 5.780423641204834, "epoch": 2.6869480645788757, "grad_norm": 1.171875, "learning_rate": 0.00042748577482004495, "loss": 5.0241, "mean_token_accuracy": 0.20278410911560057, "num_tokens": 59923625.0, "step": 34535 }, { "entropy": 5.810448837280274, "epoch": 2.6873370939505934, "grad_norm": 1.1171875, "learning_rate": 0.00042746539369636715, "loss": 5.0208, "mean_token_accuracy": 0.20138627141714097, "num_tokens": 59932456.0, "step": 34540 }, { "entropy": 5.754693937301636, "epoch": 2.687726123322311, "grad_norm": 1.1875, "learning_rate": 0.00042744501025926966, "loss": 4.9668, "mean_token_accuracy": 0.20627070516347884, "num_tokens": 59941210.0, "step": 34545 }, { "entropy": 5.798054981231689, "epoch": 2.6881151526940283, "grad_norm": 1.34375, "learning_rate": 0.0004274246245090618, "loss": 5.0793, "mean_token_accuracy": 0.1944602519273758, "num_tokens": 59949646.0, "step": 34550 }, { "entropy": 5.717916488647461, "epoch": 2.688504182065746, "grad_norm": 1.2265625, "learning_rate": 0.0004274042364460529, "loss": 4.8759, "mean_token_accuracy": 0.21776845753192903, "num_tokens": 59958263.0, "step": 34555 }, { "entropy": 5.812463426589966, "epoch": 2.6888932114374633, "grad_norm": 1.3359375, "learning_rate": 0.00042738384607055214, "loss": 5.0798, "mean_token_accuracy": 0.20343097746372224, "num_tokens": 59967222.0, "step": 34560 }, { "entropy": 5.782292699813842, "epoch": 2.689282240809181, "grad_norm": 1.2734375, "learning_rate": 0.00042736345338286917, "loss": 4.9496, "mean_token_accuracy": 0.20751760005950928, "num_tokens": 59974898.0, "step": 34565 }, { "entropy": 5.746344089508057, "epoch": 2.6896712701808987, "grad_norm": 1.203125, "learning_rate": 0.0004273430583833133, "loss": 4.9283, "mean_token_accuracy": 0.2110963985323906, "num_tokens": 59983593.0, "step": 34570 }, { "entropy": 5.735291194915772, "epoch": 2.6900602995526164, "grad_norm": 1.3828125, "learning_rate": 0.000427322661072194, "loss": 4.9483, "mean_token_accuracy": 0.21232431679964064, "num_tokens": 59991360.0, "step": 34575 }, { "entropy": 5.782443809509277, "epoch": 2.6904493289243336, "grad_norm": 1.2734375, "learning_rate": 0.0004273022614498208, "loss": 5.0037, "mean_token_accuracy": 0.2048299267888069, "num_tokens": 59999123.0, "step": 34580 }, { "entropy": 5.717710494995117, "epoch": 2.6908383582960513, "grad_norm": 1.25, "learning_rate": 0.0004272818595165031, "loss": 4.9002, "mean_token_accuracy": 0.2105396270751953, "num_tokens": 60007666.0, "step": 34585 }, { "entropy": 5.772450971603393, "epoch": 2.691227387667769, "grad_norm": 1.296875, "learning_rate": 0.0004272614552725506, "loss": 5.0891, "mean_token_accuracy": 0.19817533940076829, "num_tokens": 60016813.0, "step": 34590 }, { "entropy": 5.804533863067627, "epoch": 2.6916164170394863, "grad_norm": 1.1875, "learning_rate": 0.00042724104871827293, "loss": 4.9974, "mean_token_accuracy": 0.2032974898815155, "num_tokens": 60025243.0, "step": 34595 }, { "entropy": 5.807737541198731, "epoch": 2.692005446411204, "grad_norm": 1.265625, "learning_rate": 0.0004272206398539795, "loss": 5.0985, "mean_token_accuracy": 0.20094842165708543, "num_tokens": 60033705.0, "step": 34600 }, { "entropy": 5.794867038726807, "epoch": 2.6923944757829217, "grad_norm": 1.2578125, "learning_rate": 0.00042720022867998026, "loss": 4.9864, "mean_token_accuracy": 0.2139917179942131, "num_tokens": 60042073.0, "step": 34605 }, { "entropy": 5.8213622093200685, "epoch": 2.6927835051546394, "grad_norm": 1.3125, "learning_rate": 0.0004271798151965848, "loss": 5.0659, "mean_token_accuracy": 0.19883980751037597, "num_tokens": 60050286.0, "step": 34610 }, { "entropy": 5.721873807907104, "epoch": 2.6931725345263566, "grad_norm": 1.390625, "learning_rate": 0.0004271593994041029, "loss": 4.8599, "mean_token_accuracy": 0.20827201306819915, "num_tokens": 60057812.0, "step": 34615 }, { "entropy": 5.6534449577331545, "epoch": 2.6935615638980743, "grad_norm": 1.21875, "learning_rate": 0.0004271389813028443, "loss": 4.8976, "mean_token_accuracy": 0.21934927850961686, "num_tokens": 60066636.0, "step": 34620 }, { "entropy": 5.671154546737671, "epoch": 2.693950593269792, "grad_norm": 1.2421875, "learning_rate": 0.0004271185608931187, "loss": 4.9954, "mean_token_accuracy": 0.204618401825428, "num_tokens": 60075605.0, "step": 34625 }, { "entropy": 5.7769664287567135, "epoch": 2.6943396226415093, "grad_norm": 1.2421875, "learning_rate": 0.00042709813817523617, "loss": 4.8862, "mean_token_accuracy": 0.21259747445583344, "num_tokens": 60083947.0, "step": 34630 }, { "entropy": 5.723951578140259, "epoch": 2.694728652013227, "grad_norm": 1.28125, "learning_rate": 0.00042707771314950645, "loss": 4.9239, "mean_token_accuracy": 0.21884589344263078, "num_tokens": 60092518.0, "step": 34635 }, { "entropy": 5.719964408874512, "epoch": 2.6951176813849447, "grad_norm": 1.328125, "learning_rate": 0.00042705728581623944, "loss": 4.9642, "mean_token_accuracy": 0.20667190849781036, "num_tokens": 60100829.0, "step": 34640 }, { "entropy": 5.795005655288696, "epoch": 2.6955067107566624, "grad_norm": 1.2578125, "learning_rate": 0.0004270368561757452, "loss": 5.0127, "mean_token_accuracy": 0.20318998247385026, "num_tokens": 60109423.0, "step": 34645 }, { "entropy": 5.706937837600708, "epoch": 2.6958957401283796, "grad_norm": 1.2734375, "learning_rate": 0.0004270164242283336, "loss": 4.8986, "mean_token_accuracy": 0.211423921585083, "num_tokens": 60117938.0, "step": 34650 }, { "entropy": 5.779661560058594, "epoch": 2.6962847695000973, "grad_norm": 1.1484375, "learning_rate": 0.0004269959899743148, "loss": 4.9971, "mean_token_accuracy": 0.20823391526937485, "num_tokens": 60126411.0, "step": 34655 }, { "entropy": 5.813962030410766, "epoch": 2.6966737988718146, "grad_norm": 1.1953125, "learning_rate": 0.0004269755534139987, "loss": 5.0555, "mean_token_accuracy": 0.19742758125066756, "num_tokens": 60134811.0, "step": 34660 }, { "entropy": 5.777877521514893, "epoch": 2.6970628282435323, "grad_norm": 1.203125, "learning_rate": 0.00042695511454769557, "loss": 4.9773, "mean_token_accuracy": 0.20441885590553283, "num_tokens": 60143387.0, "step": 34665 }, { "entropy": 5.801006746292114, "epoch": 2.69745185761525, "grad_norm": 1.109375, "learning_rate": 0.00042693467337571534, "loss": 5.0135, "mean_token_accuracy": 0.2021132379770279, "num_tokens": 60152729.0, "step": 34670 }, { "entropy": 5.725065088272094, "epoch": 2.6978408869869677, "grad_norm": 1.2421875, "learning_rate": 0.0004269142298983684, "loss": 4.9588, "mean_token_accuracy": 0.20173279941082, "num_tokens": 60160927.0, "step": 34675 }, { "entropy": 5.750795650482178, "epoch": 2.698229916358685, "grad_norm": 1.2890625, "learning_rate": 0.00042689378411596467, "loss": 4.9333, "mean_token_accuracy": 0.21146584749221803, "num_tokens": 60169252.0, "step": 34680 }, { "entropy": 5.746347856521607, "epoch": 2.6986189457304026, "grad_norm": 1.1796875, "learning_rate": 0.0004268733360288146, "loss": 4.9763, "mean_token_accuracy": 0.20956062525510788, "num_tokens": 60178511.0, "step": 34685 }, { "entropy": 5.735502862930298, "epoch": 2.6990079751021203, "grad_norm": 1.2421875, "learning_rate": 0.00042685288563722835, "loss": 4.9779, "mean_token_accuracy": 0.20367707014083863, "num_tokens": 60187619.0, "step": 34690 }, { "entropy": 5.846250009536743, "epoch": 2.6993970044738376, "grad_norm": 1.2109375, "learning_rate": 0.0004268324329415163, "loss": 5.109, "mean_token_accuracy": 0.2001197963953018, "num_tokens": 60196176.0, "step": 34695 }, { "entropy": 5.783370590209961, "epoch": 2.6997860338455553, "grad_norm": 1.28125, "learning_rate": 0.0004268119779419887, "loss": 5.0095, "mean_token_accuracy": 0.20562014132738113, "num_tokens": 60204960.0, "step": 34700 }, { "entropy": 5.7230946063995365, "epoch": 2.700175063217273, "grad_norm": 1.2890625, "learning_rate": 0.00042679152063895603, "loss": 4.9422, "mean_token_accuracy": 0.2094443067908287, "num_tokens": 60212974.0, "step": 34705 }, { "entropy": 5.75137939453125, "epoch": 2.7005640925889907, "grad_norm": 1.25, "learning_rate": 0.00042677106103272867, "loss": 4.9824, "mean_token_accuracy": 0.20360343009233475, "num_tokens": 60221789.0, "step": 34710 }, { "entropy": 5.7842326164245605, "epoch": 2.700953121960708, "grad_norm": 1.3203125, "learning_rate": 0.000426750599123617, "loss": 5.0194, "mean_token_accuracy": 0.20283101499080658, "num_tokens": 60230349.0, "step": 34715 }, { "entropy": 5.799442768096924, "epoch": 2.7013421513324256, "grad_norm": 1.2421875, "learning_rate": 0.00042673013491193145, "loss": 4.9621, "mean_token_accuracy": 0.20963309854269027, "num_tokens": 60238711.0, "step": 34720 }, { "entropy": 5.768613004684449, "epoch": 2.7017311807041433, "grad_norm": 1.2734375, "learning_rate": 0.00042670966839798263, "loss": 4.9871, "mean_token_accuracy": 0.20390649735927582, "num_tokens": 60247210.0, "step": 34725 }, { "entropy": 5.798851346969604, "epoch": 2.7021202100758606, "grad_norm": 1.171875, "learning_rate": 0.0004266891995820811, "loss": 5.0066, "mean_token_accuracy": 0.20574664324522018, "num_tokens": 60255916.0, "step": 34730 }, { "entropy": 5.774350833892822, "epoch": 2.7025092394475783, "grad_norm": 1.3203125, "learning_rate": 0.00042666872846453734, "loss": 4.9944, "mean_token_accuracy": 0.2069736123085022, "num_tokens": 60264138.0, "step": 34735 }, { "entropy": 5.800201177597046, "epoch": 2.702898268819296, "grad_norm": 1.2109375, "learning_rate": 0.00042664825504566206, "loss": 5.0325, "mean_token_accuracy": 0.19991787970066072, "num_tokens": 60272918.0, "step": 34740 }, { "entropy": 5.705561637878418, "epoch": 2.7032872981910137, "grad_norm": 1.3203125, "learning_rate": 0.000426627779325766, "loss": 4.7845, "mean_token_accuracy": 0.2252723827958107, "num_tokens": 60281328.0, "step": 34745 }, { "entropy": 5.7498589038848875, "epoch": 2.703676327562731, "grad_norm": 1.234375, "learning_rate": 0.0004266073013051595, "loss": 5.031, "mean_token_accuracy": 0.20136120468378066, "num_tokens": 60290005.0, "step": 34750 }, { "entropy": 5.728151607513428, "epoch": 2.7040653569344486, "grad_norm": 1.1875, "learning_rate": 0.0004265868209841537, "loss": 4.9215, "mean_token_accuracy": 0.20578172504901887, "num_tokens": 60298225.0, "step": 34755 }, { "entropy": 5.757472276687622, "epoch": 2.704454386306166, "grad_norm": 1.1875, "learning_rate": 0.0004265663383630591, "loss": 5.006, "mean_token_accuracy": 0.20349553674459459, "num_tokens": 60306700.0, "step": 34760 }, { "entropy": 5.779485893249512, "epoch": 2.7048434156778836, "grad_norm": 1.375, "learning_rate": 0.00042654585344218657, "loss": 4.9952, "mean_token_accuracy": 0.20820042937994004, "num_tokens": 60314405.0, "step": 34765 }, { "entropy": 5.788700532913208, "epoch": 2.7052324450496013, "grad_norm": 1.296875, "learning_rate": 0.0004265253662218469, "loss": 4.9293, "mean_token_accuracy": 0.21110981404781343, "num_tokens": 60323159.0, "step": 34770 }, { "entropy": 5.837171936035157, "epoch": 2.705621474421319, "grad_norm": 1.2265625, "learning_rate": 0.00042650487670235093, "loss": 5.0471, "mean_token_accuracy": 0.20528038442134858, "num_tokens": 60331669.0, "step": 34775 }, { "entropy": 5.777014255523682, "epoch": 2.7060105037930366, "grad_norm": 1.171875, "learning_rate": 0.0004264843848840097, "loss": 4.997, "mean_token_accuracy": 0.20669656693935395, "num_tokens": 60340841.0, "step": 34780 }, { "entropy": 5.688830375671387, "epoch": 2.706399533164754, "grad_norm": 1.1875, "learning_rate": 0.000426463890767134, "loss": 4.8858, "mean_token_accuracy": 0.21295156925916672, "num_tokens": 60349263.0, "step": 34785 }, { "entropy": 5.777228212356567, "epoch": 2.7067885625364716, "grad_norm": 1.2578125, "learning_rate": 0.0004264433943520349, "loss": 5.0506, "mean_token_accuracy": 0.2017501875758171, "num_tokens": 60358214.0, "step": 34790 }, { "entropy": 5.795553159713745, "epoch": 2.707177591908189, "grad_norm": 1.234375, "learning_rate": 0.00042642289563902326, "loss": 4.9879, "mean_token_accuracy": 0.207388336956501, "num_tokens": 60367392.0, "step": 34795 }, { "entropy": 5.760332536697388, "epoch": 2.7075666212799065, "grad_norm": 1.2265625, "learning_rate": 0.00042640239462841023, "loss": 4.9916, "mean_token_accuracy": 0.2058045208454132, "num_tokens": 60376223.0, "step": 34800 }, { "entropy": 5.839930486679077, "epoch": 2.7079556506516242, "grad_norm": 1.25, "learning_rate": 0.00042638189132050675, "loss": 5.1189, "mean_token_accuracy": 0.19161401689052582, "num_tokens": 60385102.0, "step": 34805 }, { "entropy": 5.7897789478302, "epoch": 2.708344680023342, "grad_norm": 1.25, "learning_rate": 0.00042636138571562415, "loss": 4.9788, "mean_token_accuracy": 0.20586809664964675, "num_tokens": 60393115.0, "step": 34810 }, { "entropy": 5.760279178619385, "epoch": 2.708733709395059, "grad_norm": 1.203125, "learning_rate": 0.00042634087781407337, "loss": 5.0977, "mean_token_accuracy": 0.20114169269800186, "num_tokens": 60402185.0, "step": 34815 }, { "entropy": 5.883836030960083, "epoch": 2.709122738766777, "grad_norm": 1.1640625, "learning_rate": 0.00042632036761616564, "loss": 5.0122, "mean_token_accuracy": 0.20251393169164658, "num_tokens": 60410420.0, "step": 34820 }, { "entropy": 5.8173009872436525, "epoch": 2.7095117681384946, "grad_norm": 1.2265625, "learning_rate": 0.00042629985512221224, "loss": 4.9659, "mean_token_accuracy": 0.21368215084075928, "num_tokens": 60419300.0, "step": 34825 }, { "entropy": 5.802827548980713, "epoch": 2.709900797510212, "grad_norm": 2.140625, "learning_rate": 0.0004262793403325243, "loss": 4.9886, "mean_token_accuracy": 0.21659869700670242, "num_tokens": 60428108.0, "step": 34830 }, { "entropy": 5.738508605957032, "epoch": 2.7102898268819295, "grad_norm": 1.3125, "learning_rate": 0.00042625882324741316, "loss": 4.9852, "mean_token_accuracy": 0.20390155613422395, "num_tokens": 60436829.0, "step": 34835 }, { "entropy": 5.800957536697387, "epoch": 2.7106788562536472, "grad_norm": 1.25, "learning_rate": 0.0004262383038671902, "loss": 4.9822, "mean_token_accuracy": 0.20480151176452638, "num_tokens": 60445681.0, "step": 34840 }, { "entropy": 5.8467278480529785, "epoch": 2.711067885625365, "grad_norm": 1.2265625, "learning_rate": 0.0004262177821921666, "loss": 5.0348, "mean_token_accuracy": 0.20910994708538055, "num_tokens": 60454263.0, "step": 34845 }, { "entropy": 5.818915224075317, "epoch": 2.711456914997082, "grad_norm": 1.171875, "learning_rate": 0.00042619725822265394, "loss": 5.1074, "mean_token_accuracy": 0.19942054897546768, "num_tokens": 60463569.0, "step": 34850 }, { "entropy": 5.727205085754394, "epoch": 2.7118459443688, "grad_norm": 1.2421875, "learning_rate": 0.00042617673195896345, "loss": 4.9369, "mean_token_accuracy": 0.2060912162065506, "num_tokens": 60471458.0, "step": 34855 }, { "entropy": 5.823347806930542, "epoch": 2.712234973740517, "grad_norm": 1.2421875, "learning_rate": 0.00042615620340140674, "loss": 5.061, "mean_token_accuracy": 0.20362839996814727, "num_tokens": 60480581.0, "step": 34860 }, { "entropy": 5.81991868019104, "epoch": 2.712624003112235, "grad_norm": 1.234375, "learning_rate": 0.00042613567255029525, "loss": 5.0461, "mean_token_accuracy": 0.200668540596962, "num_tokens": 60488879.0, "step": 34865 }, { "entropy": 5.773199605941772, "epoch": 2.7130130324839525, "grad_norm": 1.1796875, "learning_rate": 0.00042611513940594037, "loss": 5.0006, "mean_token_accuracy": 0.20738014578819275, "num_tokens": 60497294.0, "step": 34870 }, { "entropy": 5.754495763778687, "epoch": 2.7134020618556702, "grad_norm": 1.2109375, "learning_rate": 0.0004260946039686539, "loss": 4.9375, "mean_token_accuracy": 0.21688595712184905, "num_tokens": 60506449.0, "step": 34875 }, { "entropy": 5.83273229598999, "epoch": 2.713791091227388, "grad_norm": 1.234375, "learning_rate": 0.00042607406623874726, "loss": 5.0147, "mean_token_accuracy": 0.2067901834845543, "num_tokens": 60515318.0, "step": 34880 }, { "entropy": 5.756293916702271, "epoch": 2.714180120599105, "grad_norm": 1.265625, "learning_rate": 0.0004260535262165322, "loss": 5.0739, "mean_token_accuracy": 0.20100174099206924, "num_tokens": 60525425.0, "step": 34885 }, { "entropy": 5.761459255218506, "epoch": 2.714569149970823, "grad_norm": 1.203125, "learning_rate": 0.00042603298390232015, "loss": 5.012, "mean_token_accuracy": 0.2013502299785614, "num_tokens": 60535028.0, "step": 34890 }, { "entropy": 5.7942695140838625, "epoch": 2.71495817934254, "grad_norm": 1.3125, "learning_rate": 0.00042601243929642305, "loss": 4.9545, "mean_token_accuracy": 0.21280696243047714, "num_tokens": 60543076.0, "step": 34895 }, { "entropy": 5.779795455932617, "epoch": 2.715347208714258, "grad_norm": 1.2890625, "learning_rate": 0.00042599189239915253, "loss": 4.9972, "mean_token_accuracy": 0.20492010414600373, "num_tokens": 60551697.0, "step": 34900 }, { "entropy": 5.731320190429687, "epoch": 2.7157362380859755, "grad_norm": 1.2421875, "learning_rate": 0.0004259713432108204, "loss": 4.9448, "mean_token_accuracy": 0.20635045319795609, "num_tokens": 60559910.0, "step": 34905 }, { "entropy": 5.861095714569092, "epoch": 2.7161252674576932, "grad_norm": 1.1953125, "learning_rate": 0.0004259507917317384, "loss": 5.0901, "mean_token_accuracy": 0.1997839853167534, "num_tokens": 60568717.0, "step": 34910 }, { "entropy": 5.845838832855224, "epoch": 2.7165142968294105, "grad_norm": 1.3046875, "learning_rate": 0.00042593023796221843, "loss": 5.0112, "mean_token_accuracy": 0.20307700484991073, "num_tokens": 60576707.0, "step": 34915 }, { "entropy": 5.7930680274963375, "epoch": 2.716903326201128, "grad_norm": 1.3671875, "learning_rate": 0.0004259096819025723, "loss": 4.9692, "mean_token_accuracy": 0.20571343153715133, "num_tokens": 60585097.0, "step": 34920 }, { "entropy": 5.75047459602356, "epoch": 2.717292355572846, "grad_norm": 1.234375, "learning_rate": 0.00042588912355311196, "loss": 4.9904, "mean_token_accuracy": 0.20903354734182358, "num_tokens": 60594026.0, "step": 34925 }, { "entropy": 5.768545484542846, "epoch": 2.717681384944563, "grad_norm": 1.3046875, "learning_rate": 0.00042586856291414925, "loss": 4.9827, "mean_token_accuracy": 0.20313398987054826, "num_tokens": 60602281.0, "step": 34930 }, { "entropy": 5.74733600616455, "epoch": 2.718070414316281, "grad_norm": 1.2734375, "learning_rate": 0.00042584799998599633, "loss": 4.9657, "mean_token_accuracy": 0.2090936481952667, "num_tokens": 60610329.0, "step": 34935 }, { "entropy": 5.756964492797851, "epoch": 2.7184594436879985, "grad_norm": 1.234375, "learning_rate": 0.0004258274347689651, "loss": 5.0493, "mean_token_accuracy": 0.20791924744844437, "num_tokens": 60618251.0, "step": 34940 }, { "entropy": 5.859614419937134, "epoch": 2.718848473059716, "grad_norm": 1.2109375, "learning_rate": 0.00042580686726336766, "loss": 5.0256, "mean_token_accuracy": 0.19635428339242936, "num_tokens": 60626479.0, "step": 34945 }, { "entropy": 5.810048246383667, "epoch": 2.7192375024314335, "grad_norm": 1.2734375, "learning_rate": 0.00042578629746951597, "loss": 4.9714, "mean_token_accuracy": 0.2110928937792778, "num_tokens": 60635375.0, "step": 34950 }, { "entropy": 5.781143760681152, "epoch": 2.719626531803151, "grad_norm": 1.234375, "learning_rate": 0.0004257657253877222, "loss": 5.0088, "mean_token_accuracy": 0.20841973572969436, "num_tokens": 60644136.0, "step": 34955 }, { "entropy": 5.831383848190308, "epoch": 2.720015561174869, "grad_norm": 1.3046875, "learning_rate": 0.00042574515101829856, "loss": 5.0839, "mean_token_accuracy": 0.21121550351381302, "num_tokens": 60653258.0, "step": 34960 }, { "entropy": 5.809576988220215, "epoch": 2.720404590546586, "grad_norm": 1.1484375, "learning_rate": 0.00042572457436155717, "loss": 4.9904, "mean_token_accuracy": 0.20745818465948104, "num_tokens": 60662320.0, "step": 34965 }, { "entropy": 5.753822088241577, "epoch": 2.720793619918304, "grad_norm": 1.265625, "learning_rate": 0.00042570399541781023, "loss": 4.9732, "mean_token_accuracy": 0.2098812848329544, "num_tokens": 60671669.0, "step": 34970 }, { "entropy": 5.790738153457641, "epoch": 2.7211826492900215, "grad_norm": 1.265625, "learning_rate": 0.00042568341418737016, "loss": 5.1303, "mean_token_accuracy": 0.19656278043985367, "num_tokens": 60680391.0, "step": 34975 }, { "entropy": 5.804852104187011, "epoch": 2.721571678661739, "grad_norm": 1.15625, "learning_rate": 0.000425662830670549, "loss": 5.0362, "mean_token_accuracy": 0.2017245277762413, "num_tokens": 60690150.0, "step": 34980 }, { "entropy": 5.8036939144134525, "epoch": 2.7219607080334565, "grad_norm": 1.3359375, "learning_rate": 0.00042564224486765925, "loss": 4.9039, "mean_token_accuracy": 0.21682696044445038, "num_tokens": 60698950.0, "step": 34985 }, { "entropy": 5.878361988067627, "epoch": 2.722349737405174, "grad_norm": 1.2890625, "learning_rate": 0.0004256216567790131, "loss": 5.0397, "mean_token_accuracy": 0.19976284801959993, "num_tokens": 60707859.0, "step": 34990 }, { "entropy": 5.817148876190186, "epoch": 2.7227387667768914, "grad_norm": 1.2890625, "learning_rate": 0.0004256010664049232, "loss": 5.0141, "mean_token_accuracy": 0.20796209275722505, "num_tokens": 60716621.0, "step": 34995 }, { "entropy": 5.8363272190094, "epoch": 2.723127796148609, "grad_norm": 1.34375, "learning_rate": 0.0004255804737457017, "loss": 5.132, "mean_token_accuracy": 0.19978080242872237, "num_tokens": 60725695.0, "step": 35000 }, { "entropy": 5.785414171218872, "epoch": 2.723516825520327, "grad_norm": 1.265625, "learning_rate": 0.00042555987880166127, "loss": 4.9752, "mean_token_accuracy": 0.2088310167193413, "num_tokens": 60733978.0, "step": 35005 }, { "entropy": 5.773030090332031, "epoch": 2.7239058548920445, "grad_norm": 1.2265625, "learning_rate": 0.0004255392815731142, "loss": 4.9912, "mean_token_accuracy": 0.2068332239985466, "num_tokens": 60742391.0, "step": 35010 }, { "entropy": 5.781872892379761, "epoch": 2.7242948842637618, "grad_norm": 1.359375, "learning_rate": 0.00042551868206037324, "loss": 4.9639, "mean_token_accuracy": 0.21750523149967194, "num_tokens": 60749808.0, "step": 35015 }, { "entropy": 5.748452615737915, "epoch": 2.7246839136354795, "grad_norm": 1.2734375, "learning_rate": 0.00042549808026375084, "loss": 5.0929, "mean_token_accuracy": 0.20555961281061172, "num_tokens": 60759902.0, "step": 35020 }, { "entropy": 5.7715624332427975, "epoch": 2.725072943007197, "grad_norm": 1.234375, "learning_rate": 0.00042547747618355966, "loss": 5.0351, "mean_token_accuracy": 0.19903212636709214, "num_tokens": 60768542.0, "step": 35025 }, { "entropy": 5.7900224208831785, "epoch": 2.7254619723789144, "grad_norm": 1.1640625, "learning_rate": 0.0004254568698201122, "loss": 4.9658, "mean_token_accuracy": 0.2161123663187027, "num_tokens": 60777077.0, "step": 35030 }, { "entropy": 5.772587871551513, "epoch": 2.725851001750632, "grad_norm": 1.2578125, "learning_rate": 0.00042543626117372133, "loss": 4.936, "mean_token_accuracy": 0.20868244022130966, "num_tokens": 60786520.0, "step": 35035 }, { "entropy": 5.830029153823853, "epoch": 2.72624003112235, "grad_norm": 1.328125, "learning_rate": 0.00042541565024469945, "loss": 5.0382, "mean_token_accuracy": 0.20879154205322265, "num_tokens": 60795270.0, "step": 35040 }, { "entropy": 5.816509771347046, "epoch": 2.7266290604940675, "grad_norm": 1.0546875, "learning_rate": 0.00042539503703335963, "loss": 5.018, "mean_token_accuracy": 0.19818613380193711, "num_tokens": 60804047.0, "step": 35045 }, { "entropy": 5.769230937957763, "epoch": 2.7270180898657848, "grad_norm": 1.2421875, "learning_rate": 0.00042537442154001455, "loss": 4.9689, "mean_token_accuracy": 0.20399209409952163, "num_tokens": 60812376.0, "step": 35050 }, { "entropy": 5.851846361160279, "epoch": 2.7274071192375025, "grad_norm": 1.296875, "learning_rate": 0.00042535380376497684, "loss": 5.1318, "mean_token_accuracy": 0.1975157544016838, "num_tokens": 60822075.0, "step": 35055 }, { "entropy": 5.817855167388916, "epoch": 2.72779614860922, "grad_norm": 1.1875, "learning_rate": 0.0004253331837085595, "loss": 5.0359, "mean_token_accuracy": 0.20430450588464738, "num_tokens": 60830729.0, "step": 35060 }, { "entropy": 5.71275520324707, "epoch": 2.7281851779809374, "grad_norm": 1.1640625, "learning_rate": 0.00042531256137107545, "loss": 4.8958, "mean_token_accuracy": 0.21357685476541519, "num_tokens": 60840429.0, "step": 35065 }, { "entropy": 5.790626096725464, "epoch": 2.728574207352655, "grad_norm": 1.3125, "learning_rate": 0.0004252919367528375, "loss": 4.889, "mean_token_accuracy": 0.21457489132881163, "num_tokens": 60848967.0, "step": 35070 }, { "entropy": 5.771803474426269, "epoch": 2.728963236724373, "grad_norm": 1.3515625, "learning_rate": 0.00042527130985415857, "loss": 4.9688, "mean_token_accuracy": 0.2074423089623451, "num_tokens": 60856718.0, "step": 35075 }, { "entropy": 5.739031839370727, "epoch": 2.7293522660960905, "grad_norm": 1.296875, "learning_rate": 0.0004252506806753517, "loss": 4.89, "mean_token_accuracy": 0.21835147142410277, "num_tokens": 60865338.0, "step": 35080 }, { "entropy": 5.733790302276612, "epoch": 2.7297412954678077, "grad_norm": 1.3125, "learning_rate": 0.00042523004921673, "loss": 5.0098, "mean_token_accuracy": 0.20610920041799546, "num_tokens": 60873887.0, "step": 35085 }, { "entropy": 5.804330587387085, "epoch": 2.7301303248395254, "grad_norm": 1.25, "learning_rate": 0.0004252094154786063, "loss": 5.0576, "mean_token_accuracy": 0.2022850975394249, "num_tokens": 60882755.0, "step": 35090 }, { "entropy": 5.766473197937012, "epoch": 2.7305193542112427, "grad_norm": 1.421875, "learning_rate": 0.0004251887794612939, "loss": 4.9001, "mean_token_accuracy": 0.21452568620443344, "num_tokens": 60891191.0, "step": 35095 }, { "entropy": 5.830274868011474, "epoch": 2.7309083835829604, "grad_norm": 1.296875, "learning_rate": 0.0004251681411651057, "loss": 5.088, "mean_token_accuracy": 0.2016287237405777, "num_tokens": 60899634.0, "step": 35100 }, { "entropy": 5.801162576675415, "epoch": 2.731297412954678, "grad_norm": 1.2265625, "learning_rate": 0.00042514750059035504, "loss": 5.0663, "mean_token_accuracy": 0.2055305927991867, "num_tokens": 60908468.0, "step": 35105 }, { "entropy": 5.7757611751556395, "epoch": 2.731686442326396, "grad_norm": 1.34375, "learning_rate": 0.0004251268577373551, "loss": 5.0202, "mean_token_accuracy": 0.20415472835302353, "num_tokens": 60917102.0, "step": 35110 }, { "entropy": 5.875105857849121, "epoch": 2.732075471698113, "grad_norm": 1.28125, "learning_rate": 0.000425106212606419, "loss": 5.0908, "mean_token_accuracy": 0.20788992643356324, "num_tokens": 60926410.0, "step": 35115 }, { "entropy": 5.805799198150635, "epoch": 2.7324645010698307, "grad_norm": 1.2734375, "learning_rate": 0.00042508556519786004, "loss": 4.9539, "mean_token_accuracy": 0.20563670992851257, "num_tokens": 60935068.0, "step": 35120 }, { "entropy": 5.822583198547363, "epoch": 2.7328535304415484, "grad_norm": 1.1796875, "learning_rate": 0.0004250649155119915, "loss": 4.9886, "mean_token_accuracy": 0.20363896042108537, "num_tokens": 60943507.0, "step": 35125 }, { "entropy": 5.791417837142944, "epoch": 2.7332425598132657, "grad_norm": 1.2578125, "learning_rate": 0.00042504426354912666, "loss": 4.9729, "mean_token_accuracy": 0.20575102269649506, "num_tokens": 60952175.0, "step": 35130 }, { "entropy": 5.705262041091919, "epoch": 2.7336315891849834, "grad_norm": 1.265625, "learning_rate": 0.00042502360930957904, "loss": 4.9635, "mean_token_accuracy": 0.21023884862661363, "num_tokens": 60962087.0, "step": 35135 }, { "entropy": 5.7573048114776615, "epoch": 2.734020618556701, "grad_norm": 1.2421875, "learning_rate": 0.00042500295279366196, "loss": 4.979, "mean_token_accuracy": 0.20761753767728805, "num_tokens": 60970142.0, "step": 35140 }, { "entropy": 5.792966270446778, "epoch": 2.734409647928419, "grad_norm": 1.1796875, "learning_rate": 0.00042498229400168874, "loss": 5.0447, "mean_token_accuracy": 0.2029822751879692, "num_tokens": 60979498.0, "step": 35145 }, { "entropy": 5.79144983291626, "epoch": 2.734798677300136, "grad_norm": 1.2109375, "learning_rate": 0.000424961632933973, "loss": 5.0088, "mean_token_accuracy": 0.2044406861066818, "num_tokens": 60988382.0, "step": 35150 }, { "entropy": 5.801993799209595, "epoch": 2.7351877066718537, "grad_norm": 1.3046875, "learning_rate": 0.0004249409695908281, "loss": 5.0918, "mean_token_accuracy": 0.19698527455329895, "num_tokens": 60998191.0, "step": 35155 }, { "entropy": 5.779683685302734, "epoch": 2.7355767360435714, "grad_norm": 1.2109375, "learning_rate": 0.0004249203039725677, "loss": 5.0318, "mean_token_accuracy": 0.2073124974966049, "num_tokens": 61006417.0, "step": 35160 }, { "entropy": 5.741063261032105, "epoch": 2.7359657654152887, "grad_norm": 1.2265625, "learning_rate": 0.00042489963607950527, "loss": 4.8911, "mean_token_accuracy": 0.21582740247249604, "num_tokens": 61014562.0, "step": 35165 }, { "entropy": 5.759390830993652, "epoch": 2.7363547947870064, "grad_norm": 1.4296875, "learning_rate": 0.00042487896591195454, "loss": 4.9607, "mean_token_accuracy": 0.20245912075042724, "num_tokens": 61022139.0, "step": 35170 }, { "entropy": 5.765931129455566, "epoch": 2.736743824158724, "grad_norm": 1.1640625, "learning_rate": 0.00042485829347022893, "loss": 5.1222, "mean_token_accuracy": 0.1992650255560875, "num_tokens": 61031099.0, "step": 35175 }, { "entropy": 5.842671155929565, "epoch": 2.737132853530442, "grad_norm": 1.28125, "learning_rate": 0.00042483761875464226, "loss": 5.0638, "mean_token_accuracy": 0.20458708852529525, "num_tokens": 61039136.0, "step": 35180 }, { "entropy": 5.763128709793091, "epoch": 2.737521882902159, "grad_norm": 1.28125, "learning_rate": 0.00042481694176550825, "loss": 4.9701, "mean_token_accuracy": 0.2096380412578583, "num_tokens": 61047177.0, "step": 35185 }, { "entropy": 5.760892152786255, "epoch": 2.7379109122738767, "grad_norm": 1.2265625, "learning_rate": 0.00042479626250314066, "loss": 4.9651, "mean_token_accuracy": 0.20235661566257476, "num_tokens": 61055383.0, "step": 35190 }, { "entropy": 5.768124771118164, "epoch": 2.738299941645594, "grad_norm": 1.1953125, "learning_rate": 0.00042477558096785316, "loss": 4.9604, "mean_token_accuracy": 0.21137823313474655, "num_tokens": 61063831.0, "step": 35195 }, { "entropy": 5.862046527862549, "epoch": 2.7386889710173117, "grad_norm": 1.3203125, "learning_rate": 0.00042475489715995956, "loss": 5.0815, "mean_token_accuracy": 0.1968831464648247, "num_tokens": 61072328.0, "step": 35200 }, { "entropy": 5.762005376815796, "epoch": 2.7390780003890294, "grad_norm": 1.2109375, "learning_rate": 0.00042473421107977385, "loss": 4.908, "mean_token_accuracy": 0.2119050681591034, "num_tokens": 61081191.0, "step": 35205 }, { "entropy": 5.7792126655578615, "epoch": 2.739467029760747, "grad_norm": 1.328125, "learning_rate": 0.00042471352272760974, "loss": 4.9979, "mean_token_accuracy": 0.21172756105661392, "num_tokens": 61089314.0, "step": 35210 }, { "entropy": 5.6863486766815186, "epoch": 2.7398560591324648, "grad_norm": 1.3984375, "learning_rate": 0.0004246928321037813, "loss": 4.9383, "mean_token_accuracy": 0.21088102012872695, "num_tokens": 61098322.0, "step": 35215 }, { "entropy": 5.901244640350342, "epoch": 2.740245088504182, "grad_norm": 1.2578125, "learning_rate": 0.0004246721392086023, "loss": 5.1303, "mean_token_accuracy": 0.19525084048509597, "num_tokens": 61106682.0, "step": 35220 }, { "entropy": 5.829957962036133, "epoch": 2.7406341178758997, "grad_norm": 1.2734375, "learning_rate": 0.00042465144404238686, "loss": 4.9998, "mean_token_accuracy": 0.20137352198362352, "num_tokens": 61115765.0, "step": 35225 }, { "entropy": 5.701172304153443, "epoch": 2.741023147247617, "grad_norm": 1.203125, "learning_rate": 0.00042463074660544897, "loss": 4.8874, "mean_token_accuracy": 0.21093329936265945, "num_tokens": 61124464.0, "step": 35230 }, { "entropy": 5.805878162384033, "epoch": 2.7414121766193347, "grad_norm": 1.2109375, "learning_rate": 0.0004246100468981026, "loss": 5.0907, "mean_token_accuracy": 0.19932863861322403, "num_tokens": 61133386.0, "step": 35235 }, { "entropy": 5.906299495697022, "epoch": 2.7418012059910524, "grad_norm": 1.265625, "learning_rate": 0.000424589344920662, "loss": 5.0982, "mean_token_accuracy": 0.1961233749985695, "num_tokens": 61141873.0, "step": 35240 }, { "entropy": 5.810507965087891, "epoch": 2.74219023536277, "grad_norm": 1.3359375, "learning_rate": 0.0004245686406734411, "loss": 4.995, "mean_token_accuracy": 0.20480487048625945, "num_tokens": 61150113.0, "step": 35245 }, { "entropy": 5.711752700805664, "epoch": 2.7425792647344873, "grad_norm": 1.3125, "learning_rate": 0.0004245479341567541, "loss": 4.9068, "mean_token_accuracy": 0.20872446447610854, "num_tokens": 61158941.0, "step": 35250 }, { "entropy": 5.7568871021270756, "epoch": 2.742968294106205, "grad_norm": 1.3359375, "learning_rate": 0.0004245272253709154, "loss": 4.992, "mean_token_accuracy": 0.21075983792543412, "num_tokens": 61167978.0, "step": 35255 }, { "entropy": 5.782249498367309, "epoch": 2.7433573234779227, "grad_norm": 1.28125, "learning_rate": 0.0004245065143162389, "loss": 5.0867, "mean_token_accuracy": 0.20218978375196456, "num_tokens": 61176581.0, "step": 35260 }, { "entropy": 5.879281663894654, "epoch": 2.74374635284964, "grad_norm": 1.25, "learning_rate": 0.00042448580099303904, "loss": 5.1327, "mean_token_accuracy": 0.1960772380232811, "num_tokens": 61186072.0, "step": 35265 }, { "entropy": 5.910063219070435, "epoch": 2.7441353822213577, "grad_norm": 1.3046875, "learning_rate": 0.00042446508540163017, "loss": 5.0299, "mean_token_accuracy": 0.19997680485248565, "num_tokens": 61194632.0, "step": 35270 }, { "entropy": 5.729909801483155, "epoch": 2.7445244115930754, "grad_norm": 1.265625, "learning_rate": 0.0004244443675423264, "loss": 4.9452, "mean_token_accuracy": 0.21285128295421601, "num_tokens": 61203705.0, "step": 35275 }, { "entropy": 5.739958620071411, "epoch": 2.744913440964793, "grad_norm": 1.2890625, "learning_rate": 0.00042442364741544227, "loss": 4.9608, "mean_token_accuracy": 0.20530932396650314, "num_tokens": 61212565.0, "step": 35280 }, { "entropy": 5.782778739929199, "epoch": 2.7453024703365103, "grad_norm": 1.234375, "learning_rate": 0.00042440292502129214, "loss": 4.9945, "mean_token_accuracy": 0.20230991244316102, "num_tokens": 61221092.0, "step": 35285 }, { "entropy": 5.806141376495361, "epoch": 2.745691499708228, "grad_norm": 1.2578125, "learning_rate": 0.0004243822003601904, "loss": 5.0004, "mean_token_accuracy": 0.2026850923895836, "num_tokens": 61229880.0, "step": 35290 }, { "entropy": 5.779419946670532, "epoch": 2.7460805290799453, "grad_norm": 1.28125, "learning_rate": 0.0004243614734324515, "loss": 4.9941, "mean_token_accuracy": 0.20756012052297593, "num_tokens": 61238890.0, "step": 35295 }, { "entropy": 5.777364110946655, "epoch": 2.746469558451663, "grad_norm": 1.1796875, "learning_rate": 0.0004243407442383901, "loss": 4.9878, "mean_token_accuracy": 0.20178650170564652, "num_tokens": 61248260.0, "step": 35300 }, { "entropy": 5.810210275650024, "epoch": 2.7468585878233807, "grad_norm": 1.21875, "learning_rate": 0.00042432001277832045, "loss": 4.9683, "mean_token_accuracy": 0.206354358792305, "num_tokens": 61256345.0, "step": 35305 }, { "entropy": 5.801637649536133, "epoch": 2.7472476171950984, "grad_norm": 1.3671875, "learning_rate": 0.0004242992790525573, "loss": 4.996, "mean_token_accuracy": 0.20489351004362105, "num_tokens": 61264952.0, "step": 35310 }, { "entropy": 5.830531167984009, "epoch": 2.747636646566816, "grad_norm": 1.1796875, "learning_rate": 0.0004242785430614154, "loss": 5.0312, "mean_token_accuracy": 0.2030854269862175, "num_tokens": 61273596.0, "step": 35315 }, { "entropy": 5.782908201217651, "epoch": 2.7480256759385333, "grad_norm": 1.2734375, "learning_rate": 0.00042425780480520906, "loss": 4.9489, "mean_token_accuracy": 0.2097545251250267, "num_tokens": 61281799.0, "step": 35320 }, { "entropy": 5.7766059875488285, "epoch": 2.748414705310251, "grad_norm": 1.3046875, "learning_rate": 0.00042423706428425305, "loss": 4.9312, "mean_token_accuracy": 0.20895693451166153, "num_tokens": 61290295.0, "step": 35325 }, { "entropy": 5.748567199707031, "epoch": 2.7488037346819683, "grad_norm": 1.1796875, "learning_rate": 0.0004242163214988622, "loss": 5.0066, "mean_token_accuracy": 0.21176577657461165, "num_tokens": 61298745.0, "step": 35330 }, { "entropy": 5.868057441711426, "epoch": 2.749192764053686, "grad_norm": 1.328125, "learning_rate": 0.0004241955764493512, "loss": 5.0947, "mean_token_accuracy": 0.1945350006222725, "num_tokens": 61307472.0, "step": 35335 }, { "entropy": 5.843629598617554, "epoch": 2.7495817934254037, "grad_norm": 1.1015625, "learning_rate": 0.00042417482913603477, "loss": 5.0935, "mean_token_accuracy": 0.19627974778413773, "num_tokens": 61317633.0, "step": 35340 }, { "entropy": 5.793390464782715, "epoch": 2.7499708227971214, "grad_norm": 1.1484375, "learning_rate": 0.00042415407955922774, "loss": 5.0336, "mean_token_accuracy": 0.20190190970897676, "num_tokens": 61326836.0, "step": 35345 }, { "entropy": 5.829093265533447, "epoch": 2.7503598521688386, "grad_norm": 1.234375, "learning_rate": 0.00042413332771924496, "loss": 5.0374, "mean_token_accuracy": 0.20668653696775435, "num_tokens": 61335817.0, "step": 35350 }, { "entropy": 5.850252914428711, "epoch": 2.7507488815405563, "grad_norm": 1.2109375, "learning_rate": 0.0004241125736164013, "loss": 5.1689, "mean_token_accuracy": 0.1976330801844597, "num_tokens": 61345030.0, "step": 35355 }, { "entropy": 5.795464324951172, "epoch": 2.751137910912274, "grad_norm": 1.3125, "learning_rate": 0.0004240918172510117, "loss": 5.0243, "mean_token_accuracy": 0.20263781100511552, "num_tokens": 61353061.0, "step": 35360 }, { "entropy": 5.884984970092773, "epoch": 2.7515269402839913, "grad_norm": 1.3359375, "learning_rate": 0.000424071058623391, "loss": 5.1214, "mean_token_accuracy": 0.20143271535634993, "num_tokens": 61361357.0, "step": 35365 }, { "entropy": 5.8445971488952635, "epoch": 2.751915969655709, "grad_norm": 1.296875, "learning_rate": 0.0004240502977338543, "loss": 5.0956, "mean_token_accuracy": 0.19450919330120087, "num_tokens": 61369731.0, "step": 35370 }, { "entropy": 5.789604568481446, "epoch": 2.7523049990274266, "grad_norm": 1.234375, "learning_rate": 0.0004240295345827166, "loss": 4.9983, "mean_token_accuracy": 0.20761335790157318, "num_tokens": 61378212.0, "step": 35375 }, { "entropy": 5.780000925064087, "epoch": 2.7526940283991443, "grad_norm": 1.234375, "learning_rate": 0.0004240087691702929, "loss": 4.9608, "mean_token_accuracy": 0.20778839886188508, "num_tokens": 61386743.0, "step": 35380 }, { "entropy": 5.808331632614136, "epoch": 2.7530830577708616, "grad_norm": 1.234375, "learning_rate": 0.0004239880014968983, "loss": 5.0115, "mean_token_accuracy": 0.2014694780111313, "num_tokens": 61394513.0, "step": 35385 }, { "entropy": 5.7995765686035154, "epoch": 2.7534720871425793, "grad_norm": 1.2109375, "learning_rate": 0.00042396723156284786, "loss": 4.9961, "mean_token_accuracy": 0.2066247880458832, "num_tokens": 61403999.0, "step": 35390 }, { "entropy": 5.808501148223877, "epoch": 2.753861116514297, "grad_norm": 1.1953125, "learning_rate": 0.0004239464593684568, "loss": 4.9411, "mean_token_accuracy": 0.21023458540439605, "num_tokens": 61413363.0, "step": 35395 }, { "entropy": 5.733277463912964, "epoch": 2.7542501458860142, "grad_norm": 1.203125, "learning_rate": 0.00042392568491404043, "loss": 4.9259, "mean_token_accuracy": 0.21105723232030868, "num_tokens": 61421749.0, "step": 35400 }, { "entropy": 5.783891868591309, "epoch": 2.754639175257732, "grad_norm": 1.21875, "learning_rate": 0.00042390490819991367, "loss": 5.0743, "mean_token_accuracy": 0.20296269059181213, "num_tokens": 61430422.0, "step": 35405 }, { "entropy": 5.841206121444702, "epoch": 2.7550282046294496, "grad_norm": 1.1875, "learning_rate": 0.000423884129226392, "loss": 5.0069, "mean_token_accuracy": 0.20465365648269654, "num_tokens": 61439402.0, "step": 35410 }, { "entropy": 5.833832788467407, "epoch": 2.7554172340011673, "grad_norm": 1.171875, "learning_rate": 0.0004238633479937906, "loss": 5.0802, "mean_token_accuracy": 0.2014279246330261, "num_tokens": 61448791.0, "step": 35415 }, { "entropy": 5.728889036178589, "epoch": 2.7558062633728846, "grad_norm": 1.2734375, "learning_rate": 0.0004238425645024249, "loss": 4.9178, "mean_token_accuracy": 0.20450449436903, "num_tokens": 61457181.0, "step": 35420 }, { "entropy": 5.8445783138275145, "epoch": 2.7561952927446023, "grad_norm": 1.25, "learning_rate": 0.0004238217787526102, "loss": 5.0487, "mean_token_accuracy": 0.20281512588262557, "num_tokens": 61465525.0, "step": 35425 }, { "entropy": 5.813938617706299, "epoch": 2.7565843221163195, "grad_norm": 1.2109375, "learning_rate": 0.0004238009907446618, "loss": 5.083, "mean_token_accuracy": 0.1973132610321045, "num_tokens": 61474805.0, "step": 35430 }, { "entropy": 5.722457504272461, "epoch": 2.7569733514880372, "grad_norm": 1.2109375, "learning_rate": 0.00042378020047889527, "loss": 4.9039, "mean_token_accuracy": 0.20890847593545914, "num_tokens": 61484147.0, "step": 35435 }, { "entropy": 5.7638537883758545, "epoch": 2.757362380859755, "grad_norm": 1.203125, "learning_rate": 0.00042375940795562594, "loss": 4.8945, "mean_token_accuracy": 0.21161660254001619, "num_tokens": 61492396.0, "step": 35440 }, { "entropy": 5.738065910339356, "epoch": 2.7577514102314726, "grad_norm": 1.2109375, "learning_rate": 0.00042373861317516944, "loss": 4.9684, "mean_token_accuracy": 0.20043593347072602, "num_tokens": 61500941.0, "step": 35445 }, { "entropy": 5.787286758422852, "epoch": 2.75814043960319, "grad_norm": 1.234375, "learning_rate": 0.0004237178161378412, "loss": 5.0016, "mean_token_accuracy": 0.20926357358694075, "num_tokens": 61510245.0, "step": 35450 }, { "entropy": 5.777422714233398, "epoch": 2.7585294689749076, "grad_norm": 1.296875, "learning_rate": 0.0004236970168439568, "loss": 4.9443, "mean_token_accuracy": 0.21251198053359985, "num_tokens": 61519070.0, "step": 35455 }, { "entropy": 5.721857357025146, "epoch": 2.7589184983466253, "grad_norm": 1.1953125, "learning_rate": 0.00042367621529383186, "loss": 4.8948, "mean_token_accuracy": 0.2135111078619957, "num_tokens": 61526931.0, "step": 35460 }, { "entropy": 5.854739618301392, "epoch": 2.7593075277183425, "grad_norm": 1.2578125, "learning_rate": 0.00042365541148778205, "loss": 5.1036, "mean_token_accuracy": 0.20403952598571778, "num_tokens": 61534645.0, "step": 35465 }, { "entropy": 5.752589130401612, "epoch": 2.7596965570900602, "grad_norm": 1.4140625, "learning_rate": 0.00042363460542612285, "loss": 4.9454, "mean_token_accuracy": 0.20633412152528763, "num_tokens": 61542770.0, "step": 35470 }, { "entropy": 5.776446342468262, "epoch": 2.760085586461778, "grad_norm": 1.3359375, "learning_rate": 0.0004236137971091702, "loss": 4.9997, "mean_token_accuracy": 0.20987797379493714, "num_tokens": 61551059.0, "step": 35475 }, { "entropy": 5.755829668045044, "epoch": 2.7604746158334956, "grad_norm": 1.2890625, "learning_rate": 0.00042359298653723963, "loss": 4.8881, "mean_token_accuracy": 0.21037476360797883, "num_tokens": 61559384.0, "step": 35480 }, { "entropy": 5.712637424468994, "epoch": 2.760863645205213, "grad_norm": 1.25, "learning_rate": 0.0004235721737106471, "loss": 4.9305, "mean_token_accuracy": 0.2139532223343849, "num_tokens": 61568335.0, "step": 35485 }, { "entropy": 5.752257633209228, "epoch": 2.7612526745769306, "grad_norm": 1.296875, "learning_rate": 0.0004235513586297082, "loss": 4.9655, "mean_token_accuracy": 0.20424951314926149, "num_tokens": 61577481.0, "step": 35490 }, { "entropy": 5.758753919601441, "epoch": 2.7616417039486483, "grad_norm": 1.1953125, "learning_rate": 0.00042353054129473894, "loss": 5.0128, "mean_token_accuracy": 0.2024803176522255, "num_tokens": 61585921.0, "step": 35495 }, { "entropy": 5.747140312194825, "epoch": 2.7620307333203655, "grad_norm": 1.21875, "learning_rate": 0.0004235097217060552, "loss": 4.9653, "mean_token_accuracy": 0.20831135660409927, "num_tokens": 61594548.0, "step": 35500 }, { "entropy": 5.7798402309417725, "epoch": 2.7624197626920832, "grad_norm": 1.3515625, "learning_rate": 0.0004234888998639727, "loss": 5.0067, "mean_token_accuracy": 0.21114012002944946, "num_tokens": 61603165.0, "step": 35505 }, { "entropy": 5.772410249710083, "epoch": 2.762808792063801, "grad_norm": 1.2578125, "learning_rate": 0.0004234680757688076, "loss": 4.9199, "mean_token_accuracy": 0.21001650691032409, "num_tokens": 61611920.0, "step": 35510 }, { "entropy": 5.802515697479248, "epoch": 2.7631978214355186, "grad_norm": 1.3203125, "learning_rate": 0.00042344724942087564, "loss": 4.9841, "mean_token_accuracy": 0.20442851781845092, "num_tokens": 61620553.0, "step": 35515 }, { "entropy": 5.779647731781006, "epoch": 2.763586850807236, "grad_norm": 1.28125, "learning_rate": 0.000423426420820493, "loss": 4.9937, "mean_token_accuracy": 0.20715341418981553, "num_tokens": 61629319.0, "step": 35520 }, { "entropy": 5.7224067687988285, "epoch": 2.7639758801789536, "grad_norm": 1.25, "learning_rate": 0.00042340558996797564, "loss": 4.915, "mean_token_accuracy": 0.213382525742054, "num_tokens": 61638475.0, "step": 35525 }, { "entropy": 5.779732036590576, "epoch": 2.764364909550671, "grad_norm": 1.21875, "learning_rate": 0.00042338475686363964, "loss": 4.9999, "mean_token_accuracy": 0.20895246267318726, "num_tokens": 61647345.0, "step": 35530 }, { "entropy": 5.854640007019043, "epoch": 2.7647539389223885, "grad_norm": 1.2109375, "learning_rate": 0.0004233639215078012, "loss": 5.0239, "mean_token_accuracy": 0.20542342513799666, "num_tokens": 61655871.0, "step": 35535 }, { "entropy": 5.832192707061767, "epoch": 2.765142968294106, "grad_norm": 1.234375, "learning_rate": 0.00042334308390077637, "loss": 5.0241, "mean_token_accuracy": 0.2040394812822342, "num_tokens": 61664429.0, "step": 35540 }, { "entropy": 5.704099369049072, "epoch": 2.765531997665824, "grad_norm": 1.234375, "learning_rate": 0.0004233222440428814, "loss": 4.9558, "mean_token_accuracy": 0.21007076352834703, "num_tokens": 61671980.0, "step": 35545 }, { "entropy": 5.753475093841553, "epoch": 2.765921027037541, "grad_norm": 1.28125, "learning_rate": 0.0004233014019344324, "loss": 4.9124, "mean_token_accuracy": 0.2124169021844864, "num_tokens": 61680140.0, "step": 35550 }, { "entropy": 5.770744895935058, "epoch": 2.766310056409259, "grad_norm": 1.265625, "learning_rate": 0.0004232805575757457, "loss": 4.9431, "mean_token_accuracy": 0.20882345587015153, "num_tokens": 61688863.0, "step": 35555 }, { "entropy": 5.830897474288941, "epoch": 2.7666990857809766, "grad_norm": 1.2734375, "learning_rate": 0.0004232597109671375, "loss": 5.0065, "mean_token_accuracy": 0.20445864349603654, "num_tokens": 61697494.0, "step": 35560 }, { "entropy": 5.767996549606323, "epoch": 2.767088115152694, "grad_norm": 1.2890625, "learning_rate": 0.0004232388621089242, "loss": 5.0059, "mean_token_accuracy": 0.20509446859359742, "num_tokens": 61706456.0, "step": 35565 }, { "entropy": 5.793598318099976, "epoch": 2.7674771445244115, "grad_norm": 1.2109375, "learning_rate": 0.00042321801100142216, "loss": 5.0725, "mean_token_accuracy": 0.20837675631046296, "num_tokens": 61715123.0, "step": 35570 }, { "entropy": 5.8132486820220945, "epoch": 2.767866173896129, "grad_norm": 1.2734375, "learning_rate": 0.00042319715764494765, "loss": 4.9327, "mean_token_accuracy": 0.20981833189725876, "num_tokens": 61724129.0, "step": 35575 }, { "entropy": 5.8294614315032955, "epoch": 2.768255203267847, "grad_norm": 1.28125, "learning_rate": 0.00042317630203981714, "loss": 5.0725, "mean_token_accuracy": 0.20007632225751876, "num_tokens": 61732646.0, "step": 35580 }, { "entropy": 5.824590635299683, "epoch": 2.768644232639564, "grad_norm": 1.2265625, "learning_rate": 0.00042315544418634714, "loss": 4.9903, "mean_token_accuracy": 0.20786398500204087, "num_tokens": 61741511.0, "step": 35585 }, { "entropy": 5.813971948623657, "epoch": 2.769033262011282, "grad_norm": 1.2734375, "learning_rate": 0.00042313458408485414, "loss": 5.0191, "mean_token_accuracy": 0.20370755046606065, "num_tokens": 61749703.0, "step": 35590 }, { "entropy": 5.77941575050354, "epoch": 2.7694222913829996, "grad_norm": 1.234375, "learning_rate": 0.00042311372173565456, "loss": 4.9451, "mean_token_accuracy": 0.20955634713172913, "num_tokens": 61758943.0, "step": 35595 }, { "entropy": 5.794227981567383, "epoch": 2.769811320754717, "grad_norm": 1.328125, "learning_rate": 0.000423092857139065, "loss": 4.9748, "mean_token_accuracy": 0.2085822716355324, "num_tokens": 61767120.0, "step": 35600 }, { "entropy": 5.782001256942749, "epoch": 2.7702003501264345, "grad_norm": 1.3515625, "learning_rate": 0.000423071990295402, "loss": 4.9642, "mean_token_accuracy": 0.20487237423658372, "num_tokens": 61774760.0, "step": 35605 }, { "entropy": 5.727087450027466, "epoch": 2.770589379498152, "grad_norm": 1.203125, "learning_rate": 0.0004230511212049822, "loss": 4.9517, "mean_token_accuracy": 0.21297386288642883, "num_tokens": 61783792.0, "step": 35610 }, { "entropy": 5.817515087127686, "epoch": 2.77097840886987, "grad_norm": 1.265625, "learning_rate": 0.0004230302498681224, "loss": 5.0754, "mean_token_accuracy": 0.2020127981901169, "num_tokens": 61791991.0, "step": 35615 }, { "entropy": 5.795999002456665, "epoch": 2.771367438241587, "grad_norm": 1.171875, "learning_rate": 0.0004230093762851392, "loss": 4.9809, "mean_token_accuracy": 0.20746717005968093, "num_tokens": 61801813.0, "step": 35620 }, { "entropy": 5.782782173156738, "epoch": 2.771756467613305, "grad_norm": 1.2421875, "learning_rate": 0.0004229885004563491, "loss": 4.894, "mean_token_accuracy": 0.21372242122888566, "num_tokens": 61810140.0, "step": 35625 }, { "entropy": 5.738880968093872, "epoch": 2.772145496985022, "grad_norm": 1.3984375, "learning_rate": 0.0004229676223820692, "loss": 4.8402, "mean_token_accuracy": 0.21061637848615647, "num_tokens": 61818168.0, "step": 35630 }, { "entropy": 5.7481942653656, "epoch": 2.77253452635674, "grad_norm": 1.21875, "learning_rate": 0.00042294674206261616, "loss": 4.9455, "mean_token_accuracy": 0.20810801684856414, "num_tokens": 61826640.0, "step": 35635 }, { "entropy": 5.744426298141479, "epoch": 2.7729235557284575, "grad_norm": 1.3046875, "learning_rate": 0.0004229258594983067, "loss": 5.0307, "mean_token_accuracy": 0.20852140486240386, "num_tokens": 61834787.0, "step": 35640 }, { "entropy": 5.83230242729187, "epoch": 2.773312585100175, "grad_norm": 1.265625, "learning_rate": 0.0004229049746894578, "loss": 5.0235, "mean_token_accuracy": 0.20915850549936293, "num_tokens": 61842847.0, "step": 35645 }, { "entropy": 5.9205484867095945, "epoch": 2.773701614471893, "grad_norm": 1.2578125, "learning_rate": 0.0004228840876363864, "loss": 5.1547, "mean_token_accuracy": 0.20510663092136383, "num_tokens": 61851786.0, "step": 35650 }, { "entropy": 5.782312488555908, "epoch": 2.77409064384361, "grad_norm": 1.28125, "learning_rate": 0.0004228631983394093, "loss": 4.9669, "mean_token_accuracy": 0.2137373849749565, "num_tokens": 61859917.0, "step": 35655 }, { "entropy": 5.780764818191528, "epoch": 2.774479673215328, "grad_norm": 1.2265625, "learning_rate": 0.0004228423067988434, "loss": 4.9897, "mean_token_accuracy": 0.20813019424676896, "num_tokens": 61868489.0, "step": 35660 }, { "entropy": 5.788909482955932, "epoch": 2.774868702587045, "grad_norm": 1.34375, "learning_rate": 0.00042282141301500597, "loss": 5.0649, "mean_token_accuracy": 0.20003543943166732, "num_tokens": 61876896.0, "step": 35665 }, { "entropy": 5.833459901809692, "epoch": 2.775257731958763, "grad_norm": 1.234375, "learning_rate": 0.0004228005169882138, "loss": 5.021, "mean_token_accuracy": 0.20489841550588608, "num_tokens": 61886110.0, "step": 35670 }, { "entropy": 5.792447233200074, "epoch": 2.7756467613304805, "grad_norm": 1.359375, "learning_rate": 0.00042277961871878413, "loss": 5.0186, "mean_token_accuracy": 0.2032855823636055, "num_tokens": 61894121.0, "step": 35675 }, { "entropy": 5.799462032318115, "epoch": 2.776035790702198, "grad_norm": 1.2421875, "learning_rate": 0.0004227587182070338, "loss": 4.988, "mean_token_accuracy": 0.20917194634675979, "num_tokens": 61903125.0, "step": 35680 }, { "entropy": 5.842939472198486, "epoch": 2.7764248200739154, "grad_norm": 1.1484375, "learning_rate": 0.0004227378154532802, "loss": 5.0808, "mean_token_accuracy": 0.19859634786844255, "num_tokens": 61912368.0, "step": 35685 }, { "entropy": 5.7847424983978275, "epoch": 2.776813849445633, "grad_norm": 1.1875, "learning_rate": 0.0004227169104578404, "loss": 4.9939, "mean_token_accuracy": 0.20663607269525527, "num_tokens": 61921044.0, "step": 35690 }, { "entropy": 5.743499374389648, "epoch": 2.777202878817351, "grad_norm": 1.2734375, "learning_rate": 0.00042269600322103164, "loss": 4.9953, "mean_token_accuracy": 0.20332723408937453, "num_tokens": 61928706.0, "step": 35695 }, { "entropy": 5.770125150680542, "epoch": 2.777591908189068, "grad_norm": 1.28125, "learning_rate": 0.000422675093743171, "loss": 4.994, "mean_token_accuracy": 0.19831535816192628, "num_tokens": 61936403.0, "step": 35700 }, { "entropy": 5.779916906356812, "epoch": 2.777980937560786, "grad_norm": 1.171875, "learning_rate": 0.00042265418202457603, "loss": 4.9177, "mean_token_accuracy": 0.2170262172818184, "num_tokens": 61944970.0, "step": 35705 }, { "entropy": 5.7699440002441404, "epoch": 2.7783699669325035, "grad_norm": 1.21875, "learning_rate": 0.0004226332680655637, "loss": 4.9721, "mean_token_accuracy": 0.2072661817073822, "num_tokens": 61953305.0, "step": 35710 }, { "entropy": 5.748608207702636, "epoch": 2.778758996304221, "grad_norm": 1.25, "learning_rate": 0.0004226123518664516, "loss": 4.9689, "mean_token_accuracy": 0.20977416783571243, "num_tokens": 61961098.0, "step": 35715 }, { "entropy": 5.793012571334839, "epoch": 2.7791480256759384, "grad_norm": 1.1796875, "learning_rate": 0.0004225914334275569, "loss": 4.9719, "mean_token_accuracy": 0.20499999523162843, "num_tokens": 61970862.0, "step": 35720 }, { "entropy": 5.7535638332366945, "epoch": 2.779537055047656, "grad_norm": 1.3046875, "learning_rate": 0.0004225705127491972, "loss": 4.8889, "mean_token_accuracy": 0.21185240000486374, "num_tokens": 61978967.0, "step": 35725 }, { "entropy": 5.7620415687561035, "epoch": 2.7799260844193734, "grad_norm": 1.2890625, "learning_rate": 0.0004225495898316899, "loss": 4.9923, "mean_token_accuracy": 0.20651823431253433, "num_tokens": 61987251.0, "step": 35730 }, { "entropy": 5.790960597991943, "epoch": 2.780315113791091, "grad_norm": 1.25, "learning_rate": 0.00042252866467535233, "loss": 5.0089, "mean_token_accuracy": 0.20955318808555604, "num_tokens": 61995203.0, "step": 35735 }, { "entropy": 5.78781943321228, "epoch": 2.780704143162809, "grad_norm": 1.2421875, "learning_rate": 0.00042250773728050214, "loss": 5.087, "mean_token_accuracy": 0.19624236971139908, "num_tokens": 62004156.0, "step": 35740 }, { "entropy": 5.777319622039795, "epoch": 2.7810931725345265, "grad_norm": 1.3125, "learning_rate": 0.0004224868076474568, "loss": 4.9086, "mean_token_accuracy": 0.20853970646858216, "num_tokens": 62012919.0, "step": 35745 }, { "entropy": 5.772463846206665, "epoch": 2.781482201906244, "grad_norm": 1.203125, "learning_rate": 0.00042246587577653394, "loss": 5.0087, "mean_token_accuracy": 0.20359875559806823, "num_tokens": 62022622.0, "step": 35750 }, { "entropy": 5.808602237701416, "epoch": 2.7818712312779614, "grad_norm": 1.2890625, "learning_rate": 0.0004224449416680511, "loss": 5.0633, "mean_token_accuracy": 0.20240371972322463, "num_tokens": 62030747.0, "step": 35755 }, { "entropy": 5.803055763244629, "epoch": 2.782260260649679, "grad_norm": 1.265625, "learning_rate": 0.00042242400532232593, "loss": 5.0128, "mean_token_accuracy": 0.20710589438676835, "num_tokens": 62039722.0, "step": 35760 }, { "entropy": 5.7718939781188965, "epoch": 2.7826492900213964, "grad_norm": 1.2890625, "learning_rate": 0.00042240306673967614, "loss": 4.9712, "mean_token_accuracy": 0.2050610974431038, "num_tokens": 62047907.0, "step": 35765 }, { "entropy": 5.771156930923462, "epoch": 2.783038319393114, "grad_norm": 1.25, "learning_rate": 0.00042238212592041945, "loss": 5.0385, "mean_token_accuracy": 0.20211889296770097, "num_tokens": 62056917.0, "step": 35770 }, { "entropy": 5.752791070938111, "epoch": 2.7834273487648318, "grad_norm": 1.3984375, "learning_rate": 0.00042236118286487364, "loss": 4.9336, "mean_token_accuracy": 0.2109630212187767, "num_tokens": 62065396.0, "step": 35775 }, { "entropy": 5.730744743347168, "epoch": 2.7838163781365495, "grad_norm": 1.234375, "learning_rate": 0.00042234023757335633, "loss": 5.0136, "mean_token_accuracy": 0.20145327001810073, "num_tokens": 62074202.0, "step": 35780 }, { "entropy": 5.7240242004394535, "epoch": 2.7842054075082667, "grad_norm": 1.2109375, "learning_rate": 0.00042231929004618547, "loss": 4.8524, "mean_token_accuracy": 0.22004143446683883, "num_tokens": 62082444.0, "step": 35785 }, { "entropy": 5.698032379150391, "epoch": 2.7845944368799844, "grad_norm": 1.1953125, "learning_rate": 0.0004222983402836789, "loss": 4.8754, "mean_token_accuracy": 0.21690282225608826, "num_tokens": 62090959.0, "step": 35790 }, { "entropy": 5.7842741966247555, "epoch": 2.784983466251702, "grad_norm": 1.296875, "learning_rate": 0.00042227738828615435, "loss": 5.0521, "mean_token_accuracy": 0.20951877385377884, "num_tokens": 62099007.0, "step": 35795 }, { "entropy": 5.808579587936402, "epoch": 2.7853724956234194, "grad_norm": 1.1875, "learning_rate": 0.00042225643405392993, "loss": 5.0163, "mean_token_accuracy": 0.20638728886842728, "num_tokens": 62107754.0, "step": 35800 }, { "entropy": 5.891208267211914, "epoch": 2.785761524995137, "grad_norm": 1.3984375, "learning_rate": 0.00042223547758732356, "loss": 5.0965, "mean_token_accuracy": 0.20191871672868728, "num_tokens": 62117183.0, "step": 35805 }, { "entropy": 5.83622727394104, "epoch": 2.7861505543668548, "grad_norm": 1.3828125, "learning_rate": 0.00042221451888665307, "loss": 5.0024, "mean_token_accuracy": 0.2032902091741562, "num_tokens": 62125713.0, "step": 35810 }, { "entropy": 5.791455078125, "epoch": 2.7865395837385725, "grad_norm": 1.203125, "learning_rate": 0.00042219355795223657, "loss": 5.0058, "mean_token_accuracy": 0.20954337269067763, "num_tokens": 62134361.0, "step": 35815 }, { "entropy": 5.789490365982056, "epoch": 2.7869286131102897, "grad_norm": 1.2890625, "learning_rate": 0.00042217259478439216, "loss": 4.9961, "mean_token_accuracy": 0.21363739520311356, "num_tokens": 62142912.0, "step": 35820 }, { "entropy": 5.800534009933472, "epoch": 2.7873176424820074, "grad_norm": 1.296875, "learning_rate": 0.0004221516293834379, "loss": 4.998, "mean_token_accuracy": 0.21311627477407455, "num_tokens": 62150873.0, "step": 35825 }, { "entropy": 5.8178246974945065, "epoch": 2.787706671853725, "grad_norm": 1.390625, "learning_rate": 0.00042213066174969177, "loss": 5.0746, "mean_token_accuracy": 0.19922704100608826, "num_tokens": 62159734.0, "step": 35830 }, { "entropy": 5.804581546783448, "epoch": 2.7880957012254424, "grad_norm": 1.3046875, "learning_rate": 0.00042210969188347217, "loss": 4.964, "mean_token_accuracy": 0.21121985018253325, "num_tokens": 62168319.0, "step": 35835 }, { "entropy": 5.81942458152771, "epoch": 2.78848473059716, "grad_norm": 1.25, "learning_rate": 0.0004220887197850971, "loss": 5.0209, "mean_token_accuracy": 0.19972504079341888, "num_tokens": 62177176.0, "step": 35840 }, { "entropy": 5.821565055847168, "epoch": 2.7888737599688778, "grad_norm": 1.2578125, "learning_rate": 0.00042206774545488476, "loss": 5.0392, "mean_token_accuracy": 0.1988060787320137, "num_tokens": 62185488.0, "step": 35845 }, { "entropy": 5.868545913696289, "epoch": 2.7892627893405955, "grad_norm": 1.3515625, "learning_rate": 0.0004220467688931535, "loss": 5.0584, "mean_token_accuracy": 0.2102896824479103, "num_tokens": 62193707.0, "step": 35850 }, { "entropy": 5.8591094493865965, "epoch": 2.7896518187123127, "grad_norm": 1.1484375, "learning_rate": 0.0004220257901002216, "loss": 4.9839, "mean_token_accuracy": 0.20450886934995652, "num_tokens": 62201820.0, "step": 35855 }, { "entropy": 5.90029296875, "epoch": 2.7900408480840304, "grad_norm": 1.328125, "learning_rate": 0.0004220048090764073, "loss": 5.131, "mean_token_accuracy": 0.20247508585453033, "num_tokens": 62210239.0, "step": 35860 }, { "entropy": 5.852000617980957, "epoch": 2.7904298774557477, "grad_norm": 1.21875, "learning_rate": 0.00042198382582202905, "loss": 5.0505, "mean_token_accuracy": 0.21087409257888795, "num_tokens": 62218818.0, "step": 35865 }, { "entropy": 5.820072603225708, "epoch": 2.7908189068274654, "grad_norm": 1.1875, "learning_rate": 0.0004219628403374052, "loss": 5.0766, "mean_token_accuracy": 0.20060217529535293, "num_tokens": 62227091.0, "step": 35870 }, { "entropy": 5.7604471206665036, "epoch": 2.791207936199183, "grad_norm": 1.1953125, "learning_rate": 0.0004219418526228541, "loss": 5.0031, "mean_token_accuracy": 0.20945625603199006, "num_tokens": 62235838.0, "step": 35875 }, { "entropy": 5.817627000808716, "epoch": 2.7915969655709008, "grad_norm": 1.3203125, "learning_rate": 0.0004219208626786943, "loss": 4.9925, "mean_token_accuracy": 0.20540888458490372, "num_tokens": 62244081.0, "step": 35880 }, { "entropy": 5.785270881652832, "epoch": 2.791985994942618, "grad_norm": 1.265625, "learning_rate": 0.0004218998705052443, "loss": 5.0812, "mean_token_accuracy": 0.19652227461338043, "num_tokens": 62253187.0, "step": 35885 }, { "entropy": 5.7822729587554935, "epoch": 2.7923750243143357, "grad_norm": 1.2421875, "learning_rate": 0.00042187887610282255, "loss": 5.0301, "mean_token_accuracy": 0.21476561725139617, "num_tokens": 62261004.0, "step": 35890 }, { "entropy": 5.809177541732788, "epoch": 2.7927640536860534, "grad_norm": 1.265625, "learning_rate": 0.0004218578794717476, "loss": 5.0258, "mean_token_accuracy": 0.2068438097834587, "num_tokens": 62270196.0, "step": 35895 }, { "entropy": 5.75802264213562, "epoch": 2.7931530830577707, "grad_norm": 1.28125, "learning_rate": 0.00042183688061233813, "loss": 4.9917, "mean_token_accuracy": 0.20206031650304795, "num_tokens": 62278637.0, "step": 35900 }, { "entropy": 5.742706775665283, "epoch": 2.7935421124294884, "grad_norm": 1.25, "learning_rate": 0.00042181587952491267, "loss": 4.949, "mean_token_accuracy": 0.21075053960084916, "num_tokens": 62287678.0, "step": 35905 }, { "entropy": 5.8102398872375485, "epoch": 2.793931141801206, "grad_norm": 1.1953125, "learning_rate": 0.00042179487620978997, "loss": 5.0048, "mean_token_accuracy": 0.21160924285650254, "num_tokens": 62296123.0, "step": 35910 }, { "entropy": 5.792109107971191, "epoch": 2.7943201711729238, "grad_norm": 1.421875, "learning_rate": 0.0004217738706672886, "loss": 4.9906, "mean_token_accuracy": 0.20502732396125795, "num_tokens": 62304677.0, "step": 35915 }, { "entropy": 5.822752380371094, "epoch": 2.794709200544641, "grad_norm": 1.25, "learning_rate": 0.00042175286289772746, "loss": 4.9965, "mean_token_accuracy": 0.2074603408575058, "num_tokens": 62313944.0, "step": 35920 }, { "entropy": 5.795668458938598, "epoch": 2.7950982299163587, "grad_norm": 1.21875, "learning_rate": 0.0004217318529014251, "loss": 4.9789, "mean_token_accuracy": 0.20077481418848037, "num_tokens": 62323053.0, "step": 35925 }, { "entropy": 5.807820081710815, "epoch": 2.7954872592880764, "grad_norm": 1.2109375, "learning_rate": 0.0004217108406787005, "loss": 5.0563, "mean_token_accuracy": 0.20044478327035903, "num_tokens": 62332642.0, "step": 35930 }, { "entropy": 5.840886020660401, "epoch": 2.7958762886597937, "grad_norm": 1.1875, "learning_rate": 0.0004216898262298724, "loss": 5.0443, "mean_token_accuracy": 0.20167292803525924, "num_tokens": 62341700.0, "step": 35935 }, { "entropy": 5.844509744644165, "epoch": 2.7962653180315113, "grad_norm": 1.2578125, "learning_rate": 0.0004216688095552596, "loss": 5.0129, "mean_token_accuracy": 0.20108199268579482, "num_tokens": 62350828.0, "step": 35940 }, { "entropy": 5.70234055519104, "epoch": 2.796654347403229, "grad_norm": 1.2265625, "learning_rate": 0.0004216477906551811, "loss": 4.909, "mean_token_accuracy": 0.21718523502349854, "num_tokens": 62359494.0, "step": 35945 }, { "entropy": 5.761034297943115, "epoch": 2.7970433767749467, "grad_norm": 1.2109375, "learning_rate": 0.00042162676952995585, "loss": 4.9592, "mean_token_accuracy": 0.21320106834173203, "num_tokens": 62368272.0, "step": 35950 }, { "entropy": 5.749753427505493, "epoch": 2.797432406146664, "grad_norm": 1.140625, "learning_rate": 0.00042160574617990267, "loss": 4.9862, "mean_token_accuracy": 0.2064133271574974, "num_tokens": 62376937.0, "step": 35955 }, { "entropy": 5.834462022781372, "epoch": 2.7978214355183817, "grad_norm": 1.2265625, "learning_rate": 0.00042158472060534066, "loss": 5.057, "mean_token_accuracy": 0.20001390874385833, "num_tokens": 62385765.0, "step": 35960 }, { "entropy": 5.7818211078643795, "epoch": 2.798210464890099, "grad_norm": 1.265625, "learning_rate": 0.00042156369280658886, "loss": 4.9267, "mean_token_accuracy": 0.2095125988125801, "num_tokens": 62393640.0, "step": 35965 }, { "entropy": 5.805858993530274, "epoch": 2.7985994942618166, "grad_norm": 1.3359375, "learning_rate": 0.0004215426627839662, "loss": 4.9461, "mean_token_accuracy": 0.21102497428655625, "num_tokens": 62402138.0, "step": 35970 }, { "entropy": 5.786659240722656, "epoch": 2.7989885236335343, "grad_norm": 1.34375, "learning_rate": 0.00042152163053779196, "loss": 5.0346, "mean_token_accuracy": 0.20162624418735503, "num_tokens": 62410257.0, "step": 35975 }, { "entropy": 5.808211755752564, "epoch": 2.799377553005252, "grad_norm": 1.28125, "learning_rate": 0.0004215005960683852, "loss": 5.0453, "mean_token_accuracy": 0.20985135138034822, "num_tokens": 62418409.0, "step": 35980 }, { "entropy": 5.763594245910644, "epoch": 2.7997665823769697, "grad_norm": 1.203125, "learning_rate": 0.0004214795593760651, "loss": 4.9966, "mean_token_accuracy": 0.20591468513011932, "num_tokens": 62426921.0, "step": 35985 }, { "entropy": 5.820926189422607, "epoch": 2.800155611748687, "grad_norm": 1.21875, "learning_rate": 0.0004214585204611508, "loss": 5.0791, "mean_token_accuracy": 0.2025665357708931, "num_tokens": 62435293.0, "step": 35990 }, { "entropy": 5.8100358009338375, "epoch": 2.8005446411204047, "grad_norm": 1.28125, "learning_rate": 0.00042143747932396153, "loss": 5.045, "mean_token_accuracy": 0.20157251060009002, "num_tokens": 62443678.0, "step": 35995 }, { "entropy": 5.828720188140869, "epoch": 2.800933670492122, "grad_norm": 1.265625, "learning_rate": 0.0004214164359648166, "loss": 5.0415, "mean_token_accuracy": 0.2002898246049881, "num_tokens": 62452092.0, "step": 36000 }, { "epoch": 2.800933670492122, "eval_entropy": 5.586891979019268, "eval_loss": 5.073980331420898, "eval_mean_token_accuracy": 0.21203724074897223, "eval_num_tokens": 62452092.0, "eval_runtime": 21.6259, "eval_samples_per_second": 1921.676, "eval_steps_per_second": 240.221, "step": 36000 }, { "entropy": 5.889638185501099, "epoch": 2.8013226998638396, "grad_norm": 1.265625, "learning_rate": 0.00042139539038403535, "loss": 5.0593, "mean_token_accuracy": 0.20704751908779145, "num_tokens": 62460584.0, "step": 36005 }, { "entropy": 5.797648859024048, "epoch": 2.8017117292355573, "grad_norm": 1.3203125, "learning_rate": 0.000421374342581937, "loss": 5.0833, "mean_token_accuracy": 0.19140104949474335, "num_tokens": 62468615.0, "step": 36010 }, { "entropy": 5.825901699066162, "epoch": 2.802100758607275, "grad_norm": 1.1796875, "learning_rate": 0.00042135329255884105, "loss": 5.1373, "mean_token_accuracy": 0.19498066008090972, "num_tokens": 62477630.0, "step": 36015 }, { "entropy": 5.798676252365112, "epoch": 2.8024897879789923, "grad_norm": 1.234375, "learning_rate": 0.0004213322403150668, "loss": 4.9401, "mean_token_accuracy": 0.21292182356119155, "num_tokens": 62486385.0, "step": 36020 }, { "entropy": 5.7717653751373295, "epoch": 2.80287881735071, "grad_norm": 1.2734375, "learning_rate": 0.0004213111858509337, "loss": 4.901, "mean_token_accuracy": 0.21483900845050813, "num_tokens": 62494502.0, "step": 36025 }, { "entropy": 5.705852699279785, "epoch": 2.8032678467224277, "grad_norm": 1.25, "learning_rate": 0.0004212901291667612, "loss": 4.9207, "mean_token_accuracy": 0.2152720108628273, "num_tokens": 62503365.0, "step": 36030 }, { "entropy": 5.75157675743103, "epoch": 2.803656876094145, "grad_norm": 1.1953125, "learning_rate": 0.00042126907026286887, "loss": 5.0116, "mean_token_accuracy": 0.20198571532964707, "num_tokens": 62511932.0, "step": 36035 }, { "entropy": 5.796093416213989, "epoch": 2.8040459054658626, "grad_norm": 1.2265625, "learning_rate": 0.00042124800913957624, "loss": 4.9481, "mean_token_accuracy": 0.2136947512626648, "num_tokens": 62520478.0, "step": 36040 }, { "entropy": 5.731170320510865, "epoch": 2.8044349348375803, "grad_norm": 1.1640625, "learning_rate": 0.0004212269457972028, "loss": 4.8603, "mean_token_accuracy": 0.21292612105607986, "num_tokens": 62529514.0, "step": 36045 }, { "entropy": 5.810685729980468, "epoch": 2.804823964209298, "grad_norm": 1.2890625, "learning_rate": 0.0004212058802360682, "loss": 5.0771, "mean_token_accuracy": 0.20833201110363006, "num_tokens": 62538735.0, "step": 36050 }, { "entropy": 5.786462640762329, "epoch": 2.8052129935810153, "grad_norm": 1.1953125, "learning_rate": 0.0004211848124564922, "loss": 4.9923, "mean_token_accuracy": 0.2047697976231575, "num_tokens": 62548440.0, "step": 36055 }, { "entropy": 5.85390453338623, "epoch": 2.805602022952733, "grad_norm": 1.3828125, "learning_rate": 0.0004211637424587942, "loss": 5.1019, "mean_token_accuracy": 0.19686453640460969, "num_tokens": 62556611.0, "step": 36060 }, { "entropy": 5.751316070556641, "epoch": 2.8059910523244502, "grad_norm": 1.9140625, "learning_rate": 0.0004211426702432941, "loss": 4.8757, "mean_token_accuracy": 0.22591349184513093, "num_tokens": 62565672.0, "step": 36065 }, { "entropy": 5.723591327667236, "epoch": 2.806380081696168, "grad_norm": 1.25, "learning_rate": 0.0004211215958103116, "loss": 4.9007, "mean_token_accuracy": 0.21199931800365449, "num_tokens": 62574037.0, "step": 36070 }, { "entropy": 5.725055932998657, "epoch": 2.8067691110678856, "grad_norm": 1.296875, "learning_rate": 0.00042110051916016645, "loss": 5.0267, "mean_token_accuracy": 0.2047896757721901, "num_tokens": 62582210.0, "step": 36075 }, { "entropy": 5.746925401687622, "epoch": 2.8071581404396033, "grad_norm": 1.3046875, "learning_rate": 0.0004210794402931785, "loss": 4.9542, "mean_token_accuracy": 0.2102360889315605, "num_tokens": 62591442.0, "step": 36080 }, { "entropy": 5.822292137145996, "epoch": 2.807547169811321, "grad_norm": 1.2421875, "learning_rate": 0.0004210583592096675, "loss": 5.0672, "mean_token_accuracy": 0.20025772601366043, "num_tokens": 62599520.0, "step": 36085 }, { "entropy": 5.812478828430176, "epoch": 2.8079361991830383, "grad_norm": 1.296875, "learning_rate": 0.0004210372759099534, "loss": 5.016, "mean_token_accuracy": 0.20694944113492966, "num_tokens": 62606663.0, "step": 36090 }, { "entropy": 5.777843856811524, "epoch": 2.808325228554756, "grad_norm": 1.171875, "learning_rate": 0.000421016190394356, "loss": 4.9972, "mean_token_accuracy": 0.20489445924758912, "num_tokens": 62615056.0, "step": 36095 }, { "entropy": 5.802595424652099, "epoch": 2.8087142579264732, "grad_norm": 1.1796875, "learning_rate": 0.00042099510266319545, "loss": 5.0636, "mean_token_accuracy": 0.20504354685544968, "num_tokens": 62623627.0, "step": 36100 }, { "entropy": 5.818694353103638, "epoch": 2.809103287298191, "grad_norm": 1.2578125, "learning_rate": 0.0004209740127167915, "loss": 5.0806, "mean_token_accuracy": 0.20687176585197448, "num_tokens": 62632980.0, "step": 36105 }, { "entropy": 5.792288446426392, "epoch": 2.8094923166699086, "grad_norm": 1.2109375, "learning_rate": 0.0004209529205554643, "loss": 4.8998, "mean_token_accuracy": 0.21436135470867157, "num_tokens": 62641259.0, "step": 36110 }, { "entropy": 5.801562738418579, "epoch": 2.8098813460416263, "grad_norm": 1.3125, "learning_rate": 0.0004209318261795339, "loss": 5.0748, "mean_token_accuracy": 0.20395449548959732, "num_tokens": 62649540.0, "step": 36115 }, { "entropy": 5.7858411312103275, "epoch": 2.8102703754133436, "grad_norm": 1.28125, "learning_rate": 0.0004209107295893202, "loss": 4.9966, "mean_token_accuracy": 0.21107018142938613, "num_tokens": 62657496.0, "step": 36120 }, { "entropy": 5.741422891616821, "epoch": 2.8106594047850613, "grad_norm": 1.265625, "learning_rate": 0.00042088963078514344, "loss": 4.9012, "mean_token_accuracy": 0.21873079240322113, "num_tokens": 62665800.0, "step": 36125 }, { "entropy": 5.846872329711914, "epoch": 2.811048434156779, "grad_norm": 1.1171875, "learning_rate": 0.0004208685297673238, "loss": 5.1001, "mean_token_accuracy": 0.20105350762605667, "num_tokens": 62675061.0, "step": 36130 }, { "entropy": 5.717379808425903, "epoch": 2.811437463528496, "grad_norm": 1.234375, "learning_rate": 0.0004208474265361813, "loss": 4.8435, "mean_token_accuracy": 0.2168696254491806, "num_tokens": 62683889.0, "step": 36135 }, { "entropy": 5.697771644592285, "epoch": 2.811826492900214, "grad_norm": 1.234375, "learning_rate": 0.00042082632109203627, "loss": 4.9415, "mean_token_accuracy": 0.20878593772649764, "num_tokens": 62692711.0, "step": 36140 }, { "entropy": 5.787750768661499, "epoch": 2.8122155222719316, "grad_norm": 1.328125, "learning_rate": 0.000420805213435209, "loss": 4.9751, "mean_token_accuracy": 0.21258010119199752, "num_tokens": 62701048.0, "step": 36145 }, { "entropy": 5.833490324020386, "epoch": 2.8126045516436493, "grad_norm": 1.171875, "learning_rate": 0.0004207841035660196, "loss": 5.0833, "mean_token_accuracy": 0.19493373930454255, "num_tokens": 62710440.0, "step": 36150 }, { "entropy": 5.842769718170166, "epoch": 2.8129935810153666, "grad_norm": 1.15625, "learning_rate": 0.0004207629914847885, "loss": 5.0669, "mean_token_accuracy": 0.19919547736644744, "num_tokens": 62719853.0, "step": 36155 }, { "entropy": 5.771313810348511, "epoch": 2.8133826103870843, "grad_norm": 1.2265625, "learning_rate": 0.000420741877191836, "loss": 5.0375, "mean_token_accuracy": 0.198835651576519, "num_tokens": 62729784.0, "step": 36160 }, { "entropy": 5.780418634414673, "epoch": 2.8137716397588015, "grad_norm": 1.3125, "learning_rate": 0.0004207207606874825, "loss": 4.9589, "mean_token_accuracy": 0.21452402770519258, "num_tokens": 62738414.0, "step": 36165 }, { "entropy": 5.7513936996459964, "epoch": 2.814160669130519, "grad_norm": 1.3046875, "learning_rate": 0.0004206996419720484, "loss": 4.9374, "mean_token_accuracy": 0.21025937497615815, "num_tokens": 62746878.0, "step": 36170 }, { "entropy": 5.815637302398682, "epoch": 2.814549698502237, "grad_norm": 1.2265625, "learning_rate": 0.0004206785210458541, "loss": 5.0621, "mean_token_accuracy": 0.20343313962221146, "num_tokens": 62756060.0, "step": 36175 }, { "entropy": 5.787099838256836, "epoch": 2.8149387278739546, "grad_norm": 1.265625, "learning_rate": 0.0004206573979092202, "loss": 4.9494, "mean_token_accuracy": 0.21304106563329697, "num_tokens": 62764864.0, "step": 36180 }, { "entropy": 5.757422924041748, "epoch": 2.8153277572456723, "grad_norm": 1.296875, "learning_rate": 0.00042063627256246706, "loss": 4.9426, "mean_token_accuracy": 0.20788237899541856, "num_tokens": 62772920.0, "step": 36185 }, { "entropy": 5.6963413715362545, "epoch": 2.8157167866173896, "grad_norm": 1.34375, "learning_rate": 0.0004206151450059153, "loss": 4.8964, "mean_token_accuracy": 0.2125793918967247, "num_tokens": 62781099.0, "step": 36190 }, { "entropy": 5.862668704986572, "epoch": 2.8161058159891073, "grad_norm": 1.2734375, "learning_rate": 0.00042059401523988546, "loss": 5.0938, "mean_token_accuracy": 0.1970043733716011, "num_tokens": 62789656.0, "step": 36195 }, { "entropy": 5.819086408615112, "epoch": 2.8164948453608245, "grad_norm": 1.2734375, "learning_rate": 0.0004205728832646982, "loss": 5.0593, "mean_token_accuracy": 0.20396489053964614, "num_tokens": 62798402.0, "step": 36200 }, { "entropy": 5.771092748641967, "epoch": 2.816883874732542, "grad_norm": 1.15625, "learning_rate": 0.00042055174908067414, "loss": 5.0481, "mean_token_accuracy": 0.20190461426973344, "num_tokens": 62807260.0, "step": 36205 }, { "entropy": 5.740847206115722, "epoch": 2.81727290410426, "grad_norm": 1.2265625, "learning_rate": 0.00042053061268813397, "loss": 4.8891, "mean_token_accuracy": 0.2122210755944252, "num_tokens": 62816240.0, "step": 36210 }, { "entropy": 5.830113744735717, "epoch": 2.8176619334759776, "grad_norm": 1.234375, "learning_rate": 0.00042050947408739836, "loss": 4.9638, "mean_token_accuracy": 0.2082709863781929, "num_tokens": 62824630.0, "step": 36215 }, { "entropy": 5.770707702636718, "epoch": 2.818050962847695, "grad_norm": 1.4453125, "learning_rate": 0.0004204883332787881, "loss": 5.0864, "mean_token_accuracy": 0.2077701508998871, "num_tokens": 62833193.0, "step": 36220 }, { "entropy": 5.728986835479736, "epoch": 2.8184399922194125, "grad_norm": 1.2734375, "learning_rate": 0.00042046719026262396, "loss": 4.9282, "mean_token_accuracy": 0.2152310013771057, "num_tokens": 62841424.0, "step": 36225 }, { "entropy": 5.7881958961486815, "epoch": 2.8188290215911302, "grad_norm": 1.296875, "learning_rate": 0.00042044604503922674, "loss": 4.9968, "mean_token_accuracy": 0.20436773151159288, "num_tokens": 62849388.0, "step": 36230 }, { "entropy": 5.762889862060547, "epoch": 2.8192180509628475, "grad_norm": 1.28125, "learning_rate": 0.0004204248976089173, "loss": 4.9157, "mean_token_accuracy": 0.2110852673649788, "num_tokens": 62857859.0, "step": 36235 }, { "entropy": 5.759855127334594, "epoch": 2.819607080334565, "grad_norm": 1.28125, "learning_rate": 0.0004204037479720165, "loss": 4.9616, "mean_token_accuracy": 0.20698399394750594, "num_tokens": 62866558.0, "step": 36240 }, { "entropy": 5.679414176940918, "epoch": 2.819996109706283, "grad_norm": 1.296875, "learning_rate": 0.00042038259612884514, "loss": 4.8816, "mean_token_accuracy": 0.21217338740825653, "num_tokens": 62875663.0, "step": 36245 }, { "entropy": 5.7437938213348385, "epoch": 2.8203851390780006, "grad_norm": 1.2890625, "learning_rate": 0.00042036144207972445, "loss": 4.945, "mean_token_accuracy": 0.21236516237258912, "num_tokens": 62884581.0, "step": 36250 }, { "entropy": 5.754427146911621, "epoch": 2.820774168449718, "grad_norm": 1.3359375, "learning_rate": 0.0004203402858249752, "loss": 4.9864, "mean_token_accuracy": 0.20685985833406448, "num_tokens": 62892710.0, "step": 36255 }, { "entropy": 5.759410762786866, "epoch": 2.8211631978214355, "grad_norm": 1.1640625, "learning_rate": 0.0004203191273649184, "loss": 4.9398, "mean_token_accuracy": 0.2139760971069336, "num_tokens": 62901933.0, "step": 36260 }, { "entropy": 5.7797528266906735, "epoch": 2.8215522271931532, "grad_norm": 1.234375, "learning_rate": 0.00042029796669987513, "loss": 4.9589, "mean_token_accuracy": 0.2020659029483795, "num_tokens": 62910155.0, "step": 36265 }, { "entropy": 5.781597709655761, "epoch": 2.8219412565648705, "grad_norm": 1.1171875, "learning_rate": 0.0004202768038301665, "loss": 5.0184, "mean_token_accuracy": 0.2031245857477188, "num_tokens": 62919645.0, "step": 36270 }, { "entropy": 5.88561749458313, "epoch": 2.822330285936588, "grad_norm": 1.1015625, "learning_rate": 0.00042025563875611367, "loss": 5.0828, "mean_token_accuracy": 0.1937992811203003, "num_tokens": 62928824.0, "step": 36275 }, { "entropy": 5.778196001052857, "epoch": 2.822719315308306, "grad_norm": 1.2265625, "learning_rate": 0.0004202344714780376, "loss": 4.935, "mean_token_accuracy": 0.2106197729706764, "num_tokens": 62936497.0, "step": 36280 }, { "entropy": 5.751037120819092, "epoch": 2.8231083446800236, "grad_norm": 1.28125, "learning_rate": 0.00042021330199625966, "loss": 5.0013, "mean_token_accuracy": 0.20692837834358216, "num_tokens": 62944245.0, "step": 36285 }, { "entropy": 5.749965715408325, "epoch": 2.823497374051741, "grad_norm": 1.21875, "learning_rate": 0.00042019213031110105, "loss": 5.0132, "mean_token_accuracy": 0.20873634219169618, "num_tokens": 62952980.0, "step": 36290 }, { "entropy": 5.828504610061645, "epoch": 2.8238864034234585, "grad_norm": 1.234375, "learning_rate": 0.0004201709564228829, "loss": 5.0513, "mean_token_accuracy": 0.20598533749580383, "num_tokens": 62962082.0, "step": 36295 }, { "entropy": 5.8700204372406, "epoch": 2.824275432795176, "grad_norm": 1.34375, "learning_rate": 0.00042014978033192655, "loss": 5.1104, "mean_token_accuracy": 0.20220391303300858, "num_tokens": 62971033.0, "step": 36300 }, { "entropy": 5.864890623092651, "epoch": 2.8246644621668935, "grad_norm": 1.3359375, "learning_rate": 0.00042012860203855337, "loss": 5.0083, "mean_token_accuracy": 0.2045157626271248, "num_tokens": 62979646.0, "step": 36305 }, { "entropy": 5.755398559570312, "epoch": 2.825053491538611, "grad_norm": 1.21875, "learning_rate": 0.00042010742154308453, "loss": 5.0079, "mean_token_accuracy": 0.2024176761507988, "num_tokens": 62988690.0, "step": 36310 }, { "entropy": 5.8255726337432865, "epoch": 2.825442520910329, "grad_norm": 1.25, "learning_rate": 0.00042008623884584167, "loss": 5.0412, "mean_token_accuracy": 0.20381843596696853, "num_tokens": 62997186.0, "step": 36315 }, { "entropy": 5.777501344680786, "epoch": 2.825831550282046, "grad_norm": 1.1640625, "learning_rate": 0.00042006505394714597, "loss": 4.9167, "mean_token_accuracy": 0.2133474349975586, "num_tokens": 63006449.0, "step": 36320 }, { "entropy": 5.807368659973145, "epoch": 2.826220579653764, "grad_norm": 1.2578125, "learning_rate": 0.00042004386684731896, "loss": 4.9571, "mean_token_accuracy": 0.2064094439148903, "num_tokens": 63015862.0, "step": 36325 }, { "entropy": 5.787207078933716, "epoch": 2.8266096090254815, "grad_norm": 1.140625, "learning_rate": 0.00042002267754668216, "loss": 5.0309, "mean_token_accuracy": 0.20088393837213517, "num_tokens": 63024919.0, "step": 36330 }, { "entropy": 5.792542028427124, "epoch": 2.826998638397199, "grad_norm": 1.4453125, "learning_rate": 0.000420001486045557, "loss": 4.9734, "mean_token_accuracy": 0.211808542907238, "num_tokens": 63033513.0, "step": 36335 }, { "entropy": 5.804136610031128, "epoch": 2.8273876677689165, "grad_norm": 1.2109375, "learning_rate": 0.0004199802923442652, "loss": 5.1718, "mean_token_accuracy": 0.20556291341781616, "num_tokens": 63043094.0, "step": 36340 }, { "entropy": 5.731440019607544, "epoch": 2.827776697140634, "grad_norm": 1.34375, "learning_rate": 0.0004199590964431282, "loss": 4.8686, "mean_token_accuracy": 0.22186427265405656, "num_tokens": 63050714.0, "step": 36345 }, { "entropy": 5.789445257186889, "epoch": 2.828165726512352, "grad_norm": 1.359375, "learning_rate": 0.0004199378983424676, "loss": 4.9684, "mean_token_accuracy": 0.20612358748912812, "num_tokens": 63059381.0, "step": 36350 }, { "entropy": 5.788238763809204, "epoch": 2.828554755884069, "grad_norm": 1.2265625, "learning_rate": 0.00041991669804260505, "loss": 5.0193, "mean_token_accuracy": 0.20729867219924927, "num_tokens": 63067597.0, "step": 36355 }, { "entropy": 5.731617641448975, "epoch": 2.828943785255787, "grad_norm": 1.1796875, "learning_rate": 0.0004198954955438623, "loss": 4.8687, "mean_token_accuracy": 0.21195537745952606, "num_tokens": 63075680.0, "step": 36360 }, { "entropy": 5.74955267906189, "epoch": 2.8293328146275045, "grad_norm": 1.34375, "learning_rate": 0.000419874290846561, "loss": 5.0554, "mean_token_accuracy": 0.2060772567987442, "num_tokens": 63084067.0, "step": 36365 }, { "entropy": 5.826923036575318, "epoch": 2.8297218439992218, "grad_norm": 1.234375, "learning_rate": 0.00041985308395102303, "loss": 5.0075, "mean_token_accuracy": 0.2042214021086693, "num_tokens": 63093694.0, "step": 36370 }, { "entropy": 5.784402370452881, "epoch": 2.8301108733709395, "grad_norm": 1.2109375, "learning_rate": 0.00041983187485756997, "loss": 4.9044, "mean_token_accuracy": 0.21533576399087906, "num_tokens": 63102496.0, "step": 36375 }, { "entropy": 5.8296544551849365, "epoch": 2.830499902742657, "grad_norm": 1.2265625, "learning_rate": 0.00041981066356652373, "loss": 5.0414, "mean_token_accuracy": 0.20290652215480803, "num_tokens": 63111246.0, "step": 36380 }, { "entropy": 5.82724175453186, "epoch": 2.830888932114375, "grad_norm": 1.2734375, "learning_rate": 0.00041978945007820626, "loss": 5.0098, "mean_token_accuracy": 0.20927574932575227, "num_tokens": 63119953.0, "step": 36385 }, { "entropy": 5.860178470611572, "epoch": 2.831277961486092, "grad_norm": 1.3359375, "learning_rate": 0.00041976823439293925, "loss": 5.1035, "mean_token_accuracy": 0.20531425923109053, "num_tokens": 63128904.0, "step": 36390 }, { "entropy": 5.826114749908447, "epoch": 2.83166699085781, "grad_norm": 1.2734375, "learning_rate": 0.0004197470165110447, "loss": 5.0235, "mean_token_accuracy": 0.2056563064455986, "num_tokens": 63137049.0, "step": 36395 }, { "entropy": 5.728459644317627, "epoch": 2.832056020229527, "grad_norm": 1.3203125, "learning_rate": 0.0004197257964328446, "loss": 4.9902, "mean_token_accuracy": 0.20579117983579637, "num_tokens": 63145772.0, "step": 36400 }, { "entropy": 5.752023077011108, "epoch": 2.8324450496012448, "grad_norm": 1.265625, "learning_rate": 0.0004197045741586609, "loss": 5.012, "mean_token_accuracy": 0.20646674185991287, "num_tokens": 63154913.0, "step": 36405 }, { "entropy": 5.754434394836426, "epoch": 2.8328340789729625, "grad_norm": 1.3359375, "learning_rate": 0.0004196833496888156, "loss": 4.9958, "mean_token_accuracy": 0.20476053953170775, "num_tokens": 63163671.0, "step": 36410 }, { "entropy": 5.781648731231689, "epoch": 2.83322310834468, "grad_norm": 1.2578125, "learning_rate": 0.0004196621230236308, "loss": 5.0614, "mean_token_accuracy": 0.20343200862407684, "num_tokens": 63172276.0, "step": 36415 }, { "entropy": 5.893756675720215, "epoch": 2.833612137716398, "grad_norm": 1.296875, "learning_rate": 0.00041964089416342845, "loss": 5.0855, "mean_token_accuracy": 0.20354282706975937, "num_tokens": 63180987.0, "step": 36420 }, { "entropy": 5.86677885055542, "epoch": 2.834001167088115, "grad_norm": 1.28125, "learning_rate": 0.0004196196631085308, "loss": 5.0155, "mean_token_accuracy": 0.20671121329069136, "num_tokens": 63189668.0, "step": 36425 }, { "entropy": 5.776651382446289, "epoch": 2.834390196459833, "grad_norm": 1.1015625, "learning_rate": 0.00041959842985925987, "loss": 4.9408, "mean_token_accuracy": 0.20556287616491317, "num_tokens": 63198757.0, "step": 36430 }, { "entropy": 5.811961126327515, "epoch": 2.83477922583155, "grad_norm": 1.2890625, "learning_rate": 0.000419577194415938, "loss": 5.0555, "mean_token_accuracy": 0.20030248165130615, "num_tokens": 63207695.0, "step": 36435 }, { "entropy": 5.869120073318482, "epoch": 2.8351682552032678, "grad_norm": 1.234375, "learning_rate": 0.00041955595677888735, "loss": 5.0855, "mean_token_accuracy": 0.2056986004114151, "num_tokens": 63216789.0, "step": 36440 }, { "entropy": 5.73993878364563, "epoch": 2.8355572845749855, "grad_norm": 1.3125, "learning_rate": 0.0004195347169484301, "loss": 4.9708, "mean_token_accuracy": 0.20637117475271224, "num_tokens": 63225359.0, "step": 36445 }, { "entropy": 5.846277189254761, "epoch": 2.835946313946703, "grad_norm": 1.8828125, "learning_rate": 0.0004195134749248886, "loss": 5.121, "mean_token_accuracy": 0.1918686717748642, "num_tokens": 63234405.0, "step": 36450 }, { "entropy": 5.778949975967407, "epoch": 2.8363353433184204, "grad_norm": 1.2734375, "learning_rate": 0.0004194922307085851, "loss": 4.9653, "mean_token_accuracy": 0.21328257769346237, "num_tokens": 63243558.0, "step": 36455 }, { "entropy": 5.800359439849854, "epoch": 2.836724372690138, "grad_norm": 1.2265625, "learning_rate": 0.0004194709842998419, "loss": 4.9864, "mean_token_accuracy": 0.20830978751182555, "num_tokens": 63251997.0, "step": 36460 }, { "entropy": 5.772463655471801, "epoch": 2.837113402061856, "grad_norm": 1.328125, "learning_rate": 0.00041944973569898157, "loss": 4.9428, "mean_token_accuracy": 0.21174442619085312, "num_tokens": 63260439.0, "step": 36465 }, { "entropy": 5.801935243606567, "epoch": 2.837502431433573, "grad_norm": 1.2890625, "learning_rate": 0.0004194284849063265, "loss": 4.9589, "mean_token_accuracy": 0.21026259362697602, "num_tokens": 63268613.0, "step": 36470 }, { "entropy": 5.798560094833374, "epoch": 2.8378914608052908, "grad_norm": 1.203125, "learning_rate": 0.0004194072319221989, "loss": 5.0349, "mean_token_accuracy": 0.20393248200416564, "num_tokens": 63277255.0, "step": 36475 }, { "entropy": 5.763137102127075, "epoch": 2.8382804901770085, "grad_norm": 1.2109375, "learning_rate": 0.0004193859767469214, "loss": 5.0103, "mean_token_accuracy": 0.21093186736106873, "num_tokens": 63285596.0, "step": 36480 }, { "entropy": 5.778661775588989, "epoch": 2.838669519548726, "grad_norm": 1.2109375, "learning_rate": 0.00041936471938081667, "loss": 4.939, "mean_token_accuracy": 0.20971887707710266, "num_tokens": 63293752.0, "step": 36485 }, { "entropy": 5.783925771713257, "epoch": 2.8390585489204434, "grad_norm": 1.1796875, "learning_rate": 0.00041934345982420695, "loss": 4.9975, "mean_token_accuracy": 0.20397304445505143, "num_tokens": 63302766.0, "step": 36490 }, { "entropy": 5.816025733947754, "epoch": 2.839447578292161, "grad_norm": 1.2109375, "learning_rate": 0.000419322198077415, "loss": 5.025, "mean_token_accuracy": 0.2054214060306549, "num_tokens": 63311166.0, "step": 36495 }, { "entropy": 5.809567403793335, "epoch": 2.8398366076638784, "grad_norm": 1.203125, "learning_rate": 0.00041930093414076344, "loss": 4.9865, "mean_token_accuracy": 0.20785675346851348, "num_tokens": 63319355.0, "step": 36500 }, { "entropy": 5.782669305801392, "epoch": 2.840225637035596, "grad_norm": 1.4296875, "learning_rate": 0.00041927966801457486, "loss": 5.0676, "mean_token_accuracy": 0.19753622710704805, "num_tokens": 63328548.0, "step": 36505 }, { "entropy": 5.817567920684814, "epoch": 2.8406146664073137, "grad_norm": 1.2578125, "learning_rate": 0.000419258399699172, "loss": 5.0799, "mean_token_accuracy": 0.1966158613562584, "num_tokens": 63337743.0, "step": 36510 }, { "entropy": 5.852380895614624, "epoch": 2.8410036957790314, "grad_norm": 1.2890625, "learning_rate": 0.0004192371291948775, "loss": 4.9632, "mean_token_accuracy": 0.2090526506304741, "num_tokens": 63346064.0, "step": 36515 }, { "entropy": 5.794937992095948, "epoch": 2.841392725150749, "grad_norm": 1.203125, "learning_rate": 0.00041921585650201413, "loss": 4.9678, "mean_token_accuracy": 0.20618218630552293, "num_tokens": 63354957.0, "step": 36520 }, { "entropy": 5.762783336639404, "epoch": 2.8417817545224664, "grad_norm": 1.25, "learning_rate": 0.0004191945816209047, "loss": 4.9826, "mean_token_accuracy": 0.20589951276779175, "num_tokens": 63363918.0, "step": 36525 }, { "entropy": 5.808455562591552, "epoch": 2.842170783894184, "grad_norm": 1.3046875, "learning_rate": 0.00041917330455187195, "loss": 5.0306, "mean_token_accuracy": 0.20440523326396942, "num_tokens": 63372540.0, "step": 36530 }, { "entropy": 5.895424175262451, "epoch": 2.8425598132659013, "grad_norm": 1.3125, "learning_rate": 0.00041915202529523894, "loss": 5.0976, "mean_token_accuracy": 0.19563667923212053, "num_tokens": 63381215.0, "step": 36535 }, { "entropy": 5.789294910430908, "epoch": 2.842948842637619, "grad_norm": 1.234375, "learning_rate": 0.0004191307438513283, "loss": 4.9782, "mean_token_accuracy": 0.21502976566553117, "num_tokens": 63390738.0, "step": 36540 }, { "entropy": 5.791314888000488, "epoch": 2.8433378720093367, "grad_norm": 1.328125, "learning_rate": 0.000419109460220463, "loss": 5.0934, "mean_token_accuracy": 0.19584109783172607, "num_tokens": 63398836.0, "step": 36545 }, { "entropy": 5.77953143119812, "epoch": 2.8437269013810544, "grad_norm": 1.2890625, "learning_rate": 0.00041908817440296605, "loss": 4.947, "mean_token_accuracy": 0.1985804632306099, "num_tokens": 63407211.0, "step": 36550 }, { "entropy": 5.828835773468017, "epoch": 2.8441159307527717, "grad_norm": 1.2890625, "learning_rate": 0.00041906688639916035, "loss": 5.0414, "mean_token_accuracy": 0.20090197026729584, "num_tokens": 63415415.0, "step": 36555 }, { "entropy": 5.662143802642822, "epoch": 2.8445049601244894, "grad_norm": 1.2890625, "learning_rate": 0.0004190455962093689, "loss": 4.841, "mean_token_accuracy": 0.21736225336790085, "num_tokens": 63422907.0, "step": 36560 }, { "entropy": 5.709348869323731, "epoch": 2.844893989496207, "grad_norm": 1.2109375, "learning_rate": 0.00041902430383391494, "loss": 4.914, "mean_token_accuracy": 0.20893315821886063, "num_tokens": 63431348.0, "step": 36565 }, { "entropy": 5.830709075927734, "epoch": 2.8452830188679243, "grad_norm": 1.2109375, "learning_rate": 0.0004190030092731214, "loss": 4.9892, "mean_token_accuracy": 0.21213430017232895, "num_tokens": 63440189.0, "step": 36570 }, { "entropy": 5.824370336532593, "epoch": 2.845672048239642, "grad_norm": 1.203125, "learning_rate": 0.0004189817125273113, "loss": 5.0479, "mean_token_accuracy": 0.20580596327781678, "num_tokens": 63449082.0, "step": 36575 }, { "entropy": 5.814467573165894, "epoch": 2.8460610776113597, "grad_norm": 1.28125, "learning_rate": 0.00041896041359680797, "loss": 5.0218, "mean_token_accuracy": 0.20590615570545195, "num_tokens": 63458204.0, "step": 36580 }, { "entropy": 5.784512758255005, "epoch": 2.8464501069830774, "grad_norm": 1.3046875, "learning_rate": 0.00041893911248193437, "loss": 4.9328, "mean_token_accuracy": 0.20886454731225967, "num_tokens": 63466623.0, "step": 36585 }, { "entropy": 5.790114164352417, "epoch": 2.8468391363547947, "grad_norm": 1.1796875, "learning_rate": 0.000418917809183014, "loss": 5.0175, "mean_token_accuracy": 0.20256955325603485, "num_tokens": 63475903.0, "step": 36590 }, { "entropy": 5.869958114624024, "epoch": 2.8472281657265124, "grad_norm": 1.3046875, "learning_rate": 0.00041889650370036986, "loss": 5.0467, "mean_token_accuracy": 0.19589791744947432, "num_tokens": 63484413.0, "step": 36595 }, { "entropy": 5.792706537246704, "epoch": 2.84761719509823, "grad_norm": 1.234375, "learning_rate": 0.0004188751960343253, "loss": 5.0218, "mean_token_accuracy": 0.2041142240166664, "num_tokens": 63494059.0, "step": 36600 }, { "entropy": 5.795566892623901, "epoch": 2.8480062244699473, "grad_norm": 1.3046875, "learning_rate": 0.0004188538861852037, "loss": 4.9068, "mean_token_accuracy": 0.20851334035396576, "num_tokens": 63502673.0, "step": 36605 }, { "entropy": 5.809505605697632, "epoch": 2.848395253841665, "grad_norm": 1.3203125, "learning_rate": 0.0004188325741533283, "loss": 5.0152, "mean_token_accuracy": 0.20344417095184325, "num_tokens": 63511006.0, "step": 36610 }, { "entropy": 5.765609455108643, "epoch": 2.8487842832133827, "grad_norm": 1.2109375, "learning_rate": 0.0004188112599390225, "loss": 5.015, "mean_token_accuracy": 0.21326516568660736, "num_tokens": 63519381.0, "step": 36615 }, { "entropy": 5.735032558441162, "epoch": 2.8491733125851004, "grad_norm": 1.203125, "learning_rate": 0.0004187899435426098, "loss": 5.0059, "mean_token_accuracy": 0.2089775547385216, "num_tokens": 63528111.0, "step": 36620 }, { "entropy": 5.798235607147217, "epoch": 2.8495623419568177, "grad_norm": 1.1953125, "learning_rate": 0.00041876862496441347, "loss": 4.9652, "mean_token_accuracy": 0.2107584595680237, "num_tokens": 63537028.0, "step": 36625 }, { "entropy": 5.772319078445435, "epoch": 2.8499513713285354, "grad_norm": 1.3046875, "learning_rate": 0.00041874730420475716, "loss": 4.9544, "mean_token_accuracy": 0.2070559337735176, "num_tokens": 63545666.0, "step": 36630 }, { "entropy": 5.737691831588745, "epoch": 2.8503404007002526, "grad_norm": 1.2890625, "learning_rate": 0.00041872598126396434, "loss": 4.9884, "mean_token_accuracy": 0.20281550288200378, "num_tokens": 63554122.0, "step": 36635 }, { "entropy": 5.834388780593872, "epoch": 2.8507294300719703, "grad_norm": 1.28125, "learning_rate": 0.00041870465614235843, "loss": 5.0095, "mean_token_accuracy": 0.20606082081794738, "num_tokens": 63563108.0, "step": 36640 }, { "entropy": 5.81687560081482, "epoch": 2.851118459443688, "grad_norm": 1.1015625, "learning_rate": 0.00041868332884026317, "loss": 5.0133, "mean_token_accuracy": 0.20348789691925048, "num_tokens": 63572854.0, "step": 36645 }, { "entropy": 5.843459749221802, "epoch": 2.8515074888154057, "grad_norm": 1.3984375, "learning_rate": 0.0004186619993580021, "loss": 5.0144, "mean_token_accuracy": 0.20828895568847655, "num_tokens": 63580900.0, "step": 36650 }, { "entropy": 5.7443499088287355, "epoch": 2.851896518187123, "grad_norm": 1.265625, "learning_rate": 0.00041864066769589875, "loss": 4.9049, "mean_token_accuracy": 0.21285949796438217, "num_tokens": 63590093.0, "step": 36655 }, { "entropy": 5.759358310699463, "epoch": 2.8522855475588407, "grad_norm": 1.2109375, "learning_rate": 0.00041861933385427697, "loss": 5.0722, "mean_token_accuracy": 0.20687043368816377, "num_tokens": 63599519.0, "step": 36660 }, { "entropy": 5.782386207580567, "epoch": 2.8526745769305584, "grad_norm": 1.4140625, "learning_rate": 0.0004185979978334604, "loss": 5.0698, "mean_token_accuracy": 0.20296140462160112, "num_tokens": 63608088.0, "step": 36665 }, { "entropy": 5.8715204238891605, "epoch": 2.8530636063022756, "grad_norm": 1.2578125, "learning_rate": 0.0004185766596337727, "loss": 5.023, "mean_token_accuracy": 0.20663402676582338, "num_tokens": 63617247.0, "step": 36670 }, { "entropy": 5.769886779785156, "epoch": 2.8534526356739933, "grad_norm": 1.1875, "learning_rate": 0.00041855531925553773, "loss": 5.0284, "mean_token_accuracy": 0.2032049313187599, "num_tokens": 63626218.0, "step": 36675 }, { "entropy": 5.800747632980347, "epoch": 2.853841665045711, "grad_norm": 1.2578125, "learning_rate": 0.0004185339766990794, "loss": 4.9765, "mean_token_accuracy": 0.2098732516169548, "num_tokens": 63634667.0, "step": 36680 }, { "entropy": 5.7765305519104, "epoch": 2.8542306944174287, "grad_norm": 1.2578125, "learning_rate": 0.0004185126319647213, "loss": 4.9457, "mean_token_accuracy": 0.2114175021648407, "num_tokens": 63643506.0, "step": 36685 }, { "entropy": 5.724131011962891, "epoch": 2.854619723789146, "grad_norm": 1.3359375, "learning_rate": 0.0004184912850527875, "loss": 4.9036, "mean_token_accuracy": 0.21366899758577346, "num_tokens": 63651883.0, "step": 36690 }, { "entropy": 5.817035675048828, "epoch": 2.8550087531608637, "grad_norm": 1.203125, "learning_rate": 0.0004184699359636018, "loss": 5.0435, "mean_token_accuracy": 0.19753620028495789, "num_tokens": 63660829.0, "step": 36695 }, { "entropy": 5.853626108169555, "epoch": 2.8553977825325814, "grad_norm": 1.2265625, "learning_rate": 0.0004184485846974882, "loss": 4.9895, "mean_token_accuracy": 0.20952989906072617, "num_tokens": 63669730.0, "step": 36700 }, { "entropy": 5.810510921478271, "epoch": 2.8557868119042986, "grad_norm": 1.21875, "learning_rate": 0.0004184272312547706, "loss": 4.9918, "mean_token_accuracy": 0.2018452525138855, "num_tokens": 63678921.0, "step": 36705 }, { "entropy": 5.810440969467163, "epoch": 2.8561758412760163, "grad_norm": 1.2890625, "learning_rate": 0.00041840587563577315, "loss": 5.0976, "mean_token_accuracy": 0.19599928259849547, "num_tokens": 63687636.0, "step": 36710 }, { "entropy": 5.821452999114991, "epoch": 2.856564870647734, "grad_norm": 1.3828125, "learning_rate": 0.0004183845178408197, "loss": 5.038, "mean_token_accuracy": 0.20465950518846512, "num_tokens": 63695701.0, "step": 36715 }, { "entropy": 5.801389217376709, "epoch": 2.8569539000194517, "grad_norm": 1.25, "learning_rate": 0.00041836315787023456, "loss": 5.0253, "mean_token_accuracy": 0.1996399164199829, "num_tokens": 63704904.0, "step": 36720 }, { "entropy": 5.747359657287598, "epoch": 2.857342929391169, "grad_norm": 1.171875, "learning_rate": 0.00041834179572434153, "loss": 4.9822, "mean_token_accuracy": 0.20873996317386628, "num_tokens": 63714250.0, "step": 36725 }, { "entropy": 5.800381326675415, "epoch": 2.8577319587628867, "grad_norm": 1.203125, "learning_rate": 0.00041832043140346495, "loss": 5.039, "mean_token_accuracy": 0.20130584985017777, "num_tokens": 63723472.0, "step": 36730 }, { "entropy": 5.745037317276001, "epoch": 2.858120988134604, "grad_norm": 1.296875, "learning_rate": 0.0004182990649079289, "loss": 4.8238, "mean_token_accuracy": 0.213958440721035, "num_tokens": 63731510.0, "step": 36735 }, { "entropy": 5.856986427307129, "epoch": 2.8585100175063216, "grad_norm": 1.2734375, "learning_rate": 0.0004182776962380577, "loss": 5.1404, "mean_token_accuracy": 0.1988018959760666, "num_tokens": 63739809.0, "step": 36740 }, { "entropy": 5.7785923957824705, "epoch": 2.8588990468780393, "grad_norm": 1.21875, "learning_rate": 0.00041825632539417546, "loss": 4.9526, "mean_token_accuracy": 0.21079703867435456, "num_tokens": 63748387.0, "step": 36745 }, { "entropy": 5.863193607330322, "epoch": 2.859288076249757, "grad_norm": 1.4140625, "learning_rate": 0.0004182349523766065, "loss": 5.0668, "mean_token_accuracy": 0.20468565374612807, "num_tokens": 63756119.0, "step": 36750 }, { "entropy": 5.748387432098388, "epoch": 2.8596771056214743, "grad_norm": 1.28125, "learning_rate": 0.00041821357718567514, "loss": 5.0168, "mean_token_accuracy": 0.2093930199742317, "num_tokens": 63764797.0, "step": 36755 }, { "entropy": 5.739344739913941, "epoch": 2.860066134993192, "grad_norm": 1.3359375, "learning_rate": 0.0004181921998217057, "loss": 4.9111, "mean_token_accuracy": 0.208493734896183, "num_tokens": 63773114.0, "step": 36760 }, { "entropy": 5.862214088439941, "epoch": 2.8604551643649097, "grad_norm": 1.2890625, "learning_rate": 0.0004181708202850225, "loss": 5.0881, "mean_token_accuracy": 0.19925374537706375, "num_tokens": 63781345.0, "step": 36765 }, { "entropy": 5.819920825958252, "epoch": 2.860844193736627, "grad_norm": 1.234375, "learning_rate": 0.00041814943857595, "loss": 5.007, "mean_token_accuracy": 0.2051706627011299, "num_tokens": 63789666.0, "step": 36770 }, { "entropy": 5.7988800525665285, "epoch": 2.8612332231083446, "grad_norm": 1.2578125, "learning_rate": 0.0004181280546948127, "loss": 5.0868, "mean_token_accuracy": 0.1943100646138191, "num_tokens": 63798121.0, "step": 36775 }, { "entropy": 5.768915128707886, "epoch": 2.8616222524800623, "grad_norm": 1.28125, "learning_rate": 0.0004181066686419349, "loss": 4.8755, "mean_token_accuracy": 0.2162947401404381, "num_tokens": 63806443.0, "step": 36780 }, { "entropy": 5.761303806304932, "epoch": 2.86201128185178, "grad_norm": 1.1875, "learning_rate": 0.00041808528041764115, "loss": 4.997, "mean_token_accuracy": 0.20732723474502562, "num_tokens": 63815068.0, "step": 36785 }, { "entropy": 5.803327131271362, "epoch": 2.8624003112234973, "grad_norm": 1.2734375, "learning_rate": 0.0004180638900222561, "loss": 5.0084, "mean_token_accuracy": 0.20811428129673004, "num_tokens": 63823518.0, "step": 36790 }, { "entropy": 5.841814279556274, "epoch": 2.862789340595215, "grad_norm": 1.265625, "learning_rate": 0.0004180424974561042, "loss": 5.1211, "mean_token_accuracy": 0.1980796664953232, "num_tokens": 63832435.0, "step": 36795 }, { "entropy": 5.835335206985474, "epoch": 2.8631783699669326, "grad_norm": 1.25, "learning_rate": 0.00041802110271951, "loss": 5.0653, "mean_token_accuracy": 0.19666991084814073, "num_tokens": 63841384.0, "step": 36800 }, { "entropy": 5.858704471588135, "epoch": 2.86356739933865, "grad_norm": 1.3515625, "learning_rate": 0.0004179997058127983, "loss": 4.9506, "mean_token_accuracy": 0.20997270494699477, "num_tokens": 63850563.0, "step": 36805 }, { "entropy": 5.791460227966309, "epoch": 2.8639564287103676, "grad_norm": 1.2109375, "learning_rate": 0.0004179783067362936, "loss": 5.0129, "mean_token_accuracy": 0.20092549920082092, "num_tokens": 63858657.0, "step": 36810 }, { "entropy": 5.821629381179809, "epoch": 2.8643454580820853, "grad_norm": 1.1796875, "learning_rate": 0.0004179569054903207, "loss": 5.0771, "mean_token_accuracy": 0.2062112495303154, "num_tokens": 63866970.0, "step": 36815 }, { "entropy": 5.727802848815918, "epoch": 2.864734487453803, "grad_norm": 1.359375, "learning_rate": 0.00041793550207520436, "loss": 4.9393, "mean_token_accuracy": 0.21322398483753205, "num_tokens": 63874875.0, "step": 36820 }, { "entropy": 5.737900876998902, "epoch": 2.8651235168255202, "grad_norm": 1.25, "learning_rate": 0.0004179140964912692, "loss": 5.0235, "mean_token_accuracy": 0.203223118185997, "num_tokens": 63883479.0, "step": 36825 }, { "entropy": 5.797003746032715, "epoch": 2.865512546197238, "grad_norm": 1.265625, "learning_rate": 0.0004178926887388401, "loss": 4.9847, "mean_token_accuracy": 0.20345984697341918, "num_tokens": 63891700.0, "step": 36830 }, { "entropy": 5.834503030776977, "epoch": 2.865901575568955, "grad_norm": 1.171875, "learning_rate": 0.00041787127881824193, "loss": 5.0266, "mean_token_accuracy": 0.20017229169607162, "num_tokens": 63900516.0, "step": 36835 }, { "entropy": 5.794922351837158, "epoch": 2.866290604940673, "grad_norm": 1.2890625, "learning_rate": 0.00041784986672979945, "loss": 4.9373, "mean_token_accuracy": 0.22074492275714874, "num_tokens": 63908290.0, "step": 36840 }, { "entropy": 5.8042747497558596, "epoch": 2.8666796343123906, "grad_norm": 1.3125, "learning_rate": 0.00041782845247383767, "loss": 5.0564, "mean_token_accuracy": 0.20089934915304183, "num_tokens": 63917019.0, "step": 36845 }, { "entropy": 5.753231382369995, "epoch": 2.8670686636841083, "grad_norm": 1.1640625, "learning_rate": 0.00041780703605068145, "loss": 4.9243, "mean_token_accuracy": 0.21182291507720946, "num_tokens": 63925155.0, "step": 36850 }, { "entropy": 5.835081291198731, "epoch": 2.867457693055826, "grad_norm": 1.3125, "learning_rate": 0.0004177856174606558, "loss": 5.0312, "mean_token_accuracy": 0.1982508972287178, "num_tokens": 63932931.0, "step": 36855 }, { "entropy": 5.789063215255737, "epoch": 2.8678467224275432, "grad_norm": 1.1640625, "learning_rate": 0.0004177641967040856, "loss": 5.0329, "mean_token_accuracy": 0.20462592840194702, "num_tokens": 63942368.0, "step": 36860 }, { "entropy": 5.814330387115478, "epoch": 2.868235751799261, "grad_norm": 1.296875, "learning_rate": 0.00041774277378129595, "loss": 4.986, "mean_token_accuracy": 0.21063803732395173, "num_tokens": 63950739.0, "step": 36865 }, { "entropy": 5.748255205154419, "epoch": 2.868624781170978, "grad_norm": 1.2265625, "learning_rate": 0.00041772134869261186, "loss": 4.9545, "mean_token_accuracy": 0.21328649073839187, "num_tokens": 63959735.0, "step": 36870 }, { "entropy": 5.790006971359253, "epoch": 2.869013810542696, "grad_norm": 1.28125, "learning_rate": 0.0004176999214383585, "loss": 4.9793, "mean_token_accuracy": 0.2072807177901268, "num_tokens": 63968771.0, "step": 36875 }, { "entropy": 5.747616147994995, "epoch": 2.8694028399144136, "grad_norm": 1.2265625, "learning_rate": 0.00041767849201886103, "loss": 4.935, "mean_token_accuracy": 0.2161041244864464, "num_tokens": 63977595.0, "step": 36880 }, { "entropy": 5.772293424606323, "epoch": 2.8697918692861313, "grad_norm": 1.46875, "learning_rate": 0.0004176570604344445, "loss": 4.9678, "mean_token_accuracy": 0.20684693604707718, "num_tokens": 63985676.0, "step": 36885 }, { "entropy": 5.817913770675659, "epoch": 2.8701808986578485, "grad_norm": 1.25, "learning_rate": 0.00041763562668543415, "loss": 5.0938, "mean_token_accuracy": 0.20178003013134002, "num_tokens": 63994134.0, "step": 36890 }, { "entropy": 5.855589962005615, "epoch": 2.8705699280295662, "grad_norm": 1.2890625, "learning_rate": 0.0004176141907721552, "loss": 5.1181, "mean_token_accuracy": 0.2042589321732521, "num_tokens": 64002605.0, "step": 36895 }, { "entropy": 5.756672477722168, "epoch": 2.870958957401284, "grad_norm": 1.21875, "learning_rate": 0.0004175927526949329, "loss": 5.0205, "mean_token_accuracy": 0.20548584014177323, "num_tokens": 64011232.0, "step": 36900 }, { "entropy": 5.7165374755859375, "epoch": 2.871347986773001, "grad_norm": 1.265625, "learning_rate": 0.0004175713124540925, "loss": 4.927, "mean_token_accuracy": 0.2085779845714569, "num_tokens": 64019696.0, "step": 36905 }, { "entropy": 5.859394836425781, "epoch": 2.871737016144719, "grad_norm": 1.2734375, "learning_rate": 0.00041754987004995935, "loss": 5.0114, "mean_token_accuracy": 0.20564687103033066, "num_tokens": 64028716.0, "step": 36910 }, { "entropy": 5.805535984039307, "epoch": 2.8721260455164366, "grad_norm": 1.28125, "learning_rate": 0.00041752842548285887, "loss": 4.9759, "mean_token_accuracy": 0.2111139938235283, "num_tokens": 64036915.0, "step": 36915 }, { "entropy": 5.731641340255737, "epoch": 2.8725150748881543, "grad_norm": 1.234375, "learning_rate": 0.0004175069787531163, "loss": 4.9968, "mean_token_accuracy": 0.20971932709217073, "num_tokens": 64045857.0, "step": 36920 }, { "entropy": 5.813305854797363, "epoch": 2.8729041042598715, "grad_norm": 1.2890625, "learning_rate": 0.00041748552986105726, "loss": 5.044, "mean_token_accuracy": 0.20651862621307374, "num_tokens": 64054958.0, "step": 36925 }, { "entropy": 5.790309238433838, "epoch": 2.8732931336315892, "grad_norm": 1.2109375, "learning_rate": 0.000417464078807007, "loss": 5.0183, "mean_token_accuracy": 0.203393816947937, "num_tokens": 64063745.0, "step": 36930 }, { "entropy": 5.8528989315032955, "epoch": 2.8736821630033065, "grad_norm": 1.2734375, "learning_rate": 0.0004174426255912912, "loss": 5.0007, "mean_token_accuracy": 0.2031003177165985, "num_tokens": 64072496.0, "step": 36935 }, { "entropy": 5.825888061523438, "epoch": 2.874071192375024, "grad_norm": 1.28125, "learning_rate": 0.0004174211702142352, "loss": 4.9791, "mean_token_accuracy": 0.21759361028671265, "num_tokens": 64081112.0, "step": 36940 }, { "entropy": 5.744197368621826, "epoch": 2.874460221746742, "grad_norm": 1.28125, "learning_rate": 0.00041739971267616466, "loss": 4.8835, "mean_token_accuracy": 0.21157485544681548, "num_tokens": 64089346.0, "step": 36945 }, { "entropy": 5.818365859985351, "epoch": 2.8748492511184596, "grad_norm": 1.2421875, "learning_rate": 0.0004173782529774051, "loss": 5.0363, "mean_token_accuracy": 0.204910446703434, "num_tokens": 64097590.0, "step": 36950 }, { "entropy": 5.813367080688477, "epoch": 2.8752382804901773, "grad_norm": 1.2734375, "learning_rate": 0.00041735679111828223, "loss": 4.9835, "mean_token_accuracy": 0.20443275570869446, "num_tokens": 64105870.0, "step": 36955 }, { "entropy": 5.839142942428589, "epoch": 2.8756273098618945, "grad_norm": 1.1953125, "learning_rate": 0.00041733532709912157, "loss": 5.0369, "mean_token_accuracy": 0.20096689760684966, "num_tokens": 64114963.0, "step": 36960 }, { "entropy": 5.859133529663086, "epoch": 2.876016339233612, "grad_norm": 1.359375, "learning_rate": 0.00041731386092024893, "loss": 5.1246, "mean_token_accuracy": 0.19250556230545043, "num_tokens": 64123543.0, "step": 36965 }, { "entropy": 5.808759880065918, "epoch": 2.8764053686053295, "grad_norm": 1.3046875, "learning_rate": 0.00041729239258198996, "loss": 5.0478, "mean_token_accuracy": 0.20474354773759842, "num_tokens": 64131962.0, "step": 36970 }, { "entropy": 5.788818073272705, "epoch": 2.876794397977047, "grad_norm": 1.3125, "learning_rate": 0.00041727092208467036, "loss": 5.0098, "mean_token_accuracy": 0.21519155353307723, "num_tokens": 64140292.0, "step": 36975 }, { "entropy": 5.804125690460205, "epoch": 2.877183427348765, "grad_norm": 1.21875, "learning_rate": 0.00041724944942861603, "loss": 4.9626, "mean_token_accuracy": 0.20909482836723328, "num_tokens": 64148936.0, "step": 36980 }, { "entropy": 5.8505859375, "epoch": 2.8775724567204826, "grad_norm": 1.3203125, "learning_rate": 0.00041722797461415267, "loss": 5.0339, "mean_token_accuracy": 0.2014971613883972, "num_tokens": 64157801.0, "step": 36985 }, { "entropy": 5.844186687469483, "epoch": 2.8779614860922, "grad_norm": 1.296875, "learning_rate": 0.0004172064976416062, "loss": 5.0655, "mean_token_accuracy": 0.20048424899578093, "num_tokens": 64166049.0, "step": 36990 }, { "entropy": 5.82602596282959, "epoch": 2.8783505154639175, "grad_norm": 1.296875, "learning_rate": 0.0004171850185113024, "loss": 5.0802, "mean_token_accuracy": 0.20038343220949173, "num_tokens": 64174663.0, "step": 36995 }, { "entropy": 5.86979866027832, "epoch": 2.878739544835635, "grad_norm": 1.2109375, "learning_rate": 0.00041716353722356735, "loss": 5.0908, "mean_token_accuracy": 0.2006244108080864, "num_tokens": 64183683.0, "step": 37000 }, { "entropy": 5.869486141204834, "epoch": 2.8791285742073525, "grad_norm": 1.3515625, "learning_rate": 0.0004171420537787269, "loss": 5.0571, "mean_token_accuracy": 0.20415510684251786, "num_tokens": 64192808.0, "step": 37005 }, { "entropy": 5.817481565475464, "epoch": 2.87951760357907, "grad_norm": 1.265625, "learning_rate": 0.00041712056817710697, "loss": 4.9612, "mean_token_accuracy": 0.2056852951645851, "num_tokens": 64201703.0, "step": 37010 }, { "entropy": 5.80070481300354, "epoch": 2.879906632950788, "grad_norm": 1.2734375, "learning_rate": 0.0004170990804190337, "loss": 5.0453, "mean_token_accuracy": 0.19815419912338256, "num_tokens": 64210343.0, "step": 37015 }, { "entropy": 5.8725025177001955, "epoch": 2.8802956623225056, "grad_norm": 1.21875, "learning_rate": 0.00041707759050483304, "loss": 5.063, "mean_token_accuracy": 0.20444852113723755, "num_tokens": 64218871.0, "step": 37020 }, { "entropy": 5.824731969833374, "epoch": 2.880684691694223, "grad_norm": 1.25, "learning_rate": 0.000417056098434831, "loss": 4.9096, "mean_token_accuracy": 0.21652227342128755, "num_tokens": 64226300.0, "step": 37025 }, { "entropy": 5.76281852722168, "epoch": 2.8810737210659405, "grad_norm": 1.2890625, "learning_rate": 0.0004170346042093538, "loss": 4.9767, "mean_token_accuracy": 0.2041445329785347, "num_tokens": 64235042.0, "step": 37030 }, { "entropy": 5.766773986816406, "epoch": 2.881462750437658, "grad_norm": 1.2890625, "learning_rate": 0.0004170131078287276, "loss": 4.9341, "mean_token_accuracy": 0.21288384199142457, "num_tokens": 64242942.0, "step": 37035 }, { "entropy": 5.859264612197876, "epoch": 2.8818517798093755, "grad_norm": 1.2890625, "learning_rate": 0.0004169916092932785, "loss": 5.0616, "mean_token_accuracy": 0.19874853938817977, "num_tokens": 64251187.0, "step": 37040 }, { "entropy": 5.863649320602417, "epoch": 2.882240809181093, "grad_norm": 1.2734375, "learning_rate": 0.0004169701086033327, "loss": 5.0846, "mean_token_accuracy": 0.20325787216424943, "num_tokens": 64260025.0, "step": 37045 }, { "entropy": 5.79508228302002, "epoch": 2.882629838552811, "grad_norm": 1.375, "learning_rate": 0.00041694860575921654, "loss": 5.0803, "mean_token_accuracy": 0.20503873378038406, "num_tokens": 64269940.0, "step": 37050 }, { "entropy": 5.847331237792969, "epoch": 2.8830188679245285, "grad_norm": 1.2578125, "learning_rate": 0.00041692710076125615, "loss": 5.0463, "mean_token_accuracy": 0.19746011197566987, "num_tokens": 64279054.0, "step": 37055 }, { "entropy": 5.819596529006958, "epoch": 2.883407897296246, "grad_norm": 1.3203125, "learning_rate": 0.000416905593609778, "loss": 5.0488, "mean_token_accuracy": 0.2018558457493782, "num_tokens": 64287332.0, "step": 37060 }, { "entropy": 5.807564544677734, "epoch": 2.8837969266679635, "grad_norm": 1.25, "learning_rate": 0.00041688408430510827, "loss": 4.9848, "mean_token_accuracy": 0.20878450572490692, "num_tokens": 64295889.0, "step": 37065 }, { "entropy": 5.819533395767212, "epoch": 2.8841859560396808, "grad_norm": 1.1328125, "learning_rate": 0.0004168625728475734, "loss": 4.9999, "mean_token_accuracy": 0.20370020866394042, "num_tokens": 64305138.0, "step": 37070 }, { "entropy": 5.7920952320098875, "epoch": 2.8845749854113985, "grad_norm": 1.328125, "learning_rate": 0.00041684105923749977, "loss": 5.0431, "mean_token_accuracy": 0.20553875863552093, "num_tokens": 64314041.0, "step": 37075 }, { "entropy": 5.921089506149292, "epoch": 2.884964014783116, "grad_norm": 1.265625, "learning_rate": 0.0004168195434752139, "loss": 5.0831, "mean_token_accuracy": 0.19332961440086366, "num_tokens": 64323686.0, "step": 37080 }, { "entropy": 5.812370300292969, "epoch": 2.885353044154834, "grad_norm": 1.2265625, "learning_rate": 0.00041679802556104207, "loss": 5.0174, "mean_token_accuracy": 0.20155178755521774, "num_tokens": 64332395.0, "step": 37085 }, { "entropy": 5.7963550090789795, "epoch": 2.885742073526551, "grad_norm": 1.3046875, "learning_rate": 0.00041677650549531097, "loss": 4.9902, "mean_token_accuracy": 0.21578869968652725, "num_tokens": 64340577.0, "step": 37090 }, { "entropy": 5.767085695266724, "epoch": 2.886131102898269, "grad_norm": 1.2421875, "learning_rate": 0.00041675498327834706, "loss": 5.0122, "mean_token_accuracy": 0.2005954697728157, "num_tokens": 64348903.0, "step": 37095 }, { "entropy": 5.881518745422364, "epoch": 2.8865201322699865, "grad_norm": 1.171875, "learning_rate": 0.00041673345891047686, "loss": 5.1201, "mean_token_accuracy": 0.19618806391954421, "num_tokens": 64357725.0, "step": 37100 }, { "entropy": 5.845756101608276, "epoch": 2.8869091616417037, "grad_norm": 1.1875, "learning_rate": 0.0004167119323920271, "loss": 5.0808, "mean_token_accuracy": 0.20114561915397644, "num_tokens": 64366871.0, "step": 37105 }, { "entropy": 5.782095241546631, "epoch": 2.8872981910134214, "grad_norm": 1.296875, "learning_rate": 0.0004166904037233243, "loss": 5.0166, "mean_token_accuracy": 0.19824107140302658, "num_tokens": 64375155.0, "step": 37110 }, { "entropy": 5.7788074016571045, "epoch": 2.887687220385139, "grad_norm": 1.234375, "learning_rate": 0.00041666887290469506, "loss": 4.9589, "mean_token_accuracy": 0.21133533120155334, "num_tokens": 64383956.0, "step": 37115 }, { "entropy": 5.843722534179688, "epoch": 2.888076249756857, "grad_norm": 1.34375, "learning_rate": 0.0004166473399364663, "loss": 5.0573, "mean_token_accuracy": 0.20161016285419464, "num_tokens": 64392816.0, "step": 37120 }, { "entropy": 5.802755641937256, "epoch": 2.888465279128574, "grad_norm": 1.25, "learning_rate": 0.00041662580481896446, "loss": 5.0177, "mean_token_accuracy": 0.20772883296012878, "num_tokens": 64401676.0, "step": 37125 }, { "entropy": 5.870348262786865, "epoch": 2.888854308500292, "grad_norm": 1.265625, "learning_rate": 0.0004166042675525165, "loss": 5.1637, "mean_token_accuracy": 0.199164018034935, "num_tokens": 64410248.0, "step": 37130 }, { "entropy": 5.814644813537598, "epoch": 2.8892433378720095, "grad_norm": 1.171875, "learning_rate": 0.00041658272813744924, "loss": 5.0076, "mean_token_accuracy": 0.20659082531929016, "num_tokens": 64419023.0, "step": 37135 }, { "entropy": 5.804802083969117, "epoch": 2.8896323672437267, "grad_norm": 1.265625, "learning_rate": 0.0004165611865740894, "loss": 4.9078, "mean_token_accuracy": 0.20471362322568892, "num_tokens": 64427775.0, "step": 37140 }, { "entropy": 5.768785429000855, "epoch": 2.8900213966154444, "grad_norm": 1.40625, "learning_rate": 0.0004165396428627638, "loss": 4.9849, "mean_token_accuracy": 0.20719853341579436, "num_tokens": 64436113.0, "step": 37145 }, { "entropy": 5.78173599243164, "epoch": 2.890410425987162, "grad_norm": 1.34375, "learning_rate": 0.00041651809700379947, "loss": 5.0207, "mean_token_accuracy": 0.21192073673009873, "num_tokens": 64444325.0, "step": 37150 }, { "entropy": 5.7634283065795895, "epoch": 2.89079945535888, "grad_norm": 1.2109375, "learning_rate": 0.00041649654899752326, "loss": 4.9626, "mean_token_accuracy": 0.2086004674434662, "num_tokens": 64452560.0, "step": 37155 }, { "entropy": 5.806577491760254, "epoch": 2.891188484730597, "grad_norm": 1.21875, "learning_rate": 0.0004164749988442621, "loss": 4.9677, "mean_token_accuracy": 0.20923152714967727, "num_tokens": 64460983.0, "step": 37160 }, { "entropy": 5.798651266098022, "epoch": 2.891577514102315, "grad_norm": 1.15625, "learning_rate": 0.000416453446544343, "loss": 5.0664, "mean_token_accuracy": 0.19992144256830216, "num_tokens": 64470103.0, "step": 37165 }, { "entropy": 5.8343236446380615, "epoch": 2.891966543474032, "grad_norm": 1.28125, "learning_rate": 0.0004164318920980931, "loss": 4.9575, "mean_token_accuracy": 0.21058415174484252, "num_tokens": 64478642.0, "step": 37170 }, { "entropy": 5.775297355651856, "epoch": 2.8923555728457497, "grad_norm": 1.1796875, "learning_rate": 0.0004164103355058393, "loss": 4.9875, "mean_token_accuracy": 0.2042151838541031, "num_tokens": 64487625.0, "step": 37175 }, { "entropy": 5.78716630935669, "epoch": 2.8927446022174674, "grad_norm": 1.2890625, "learning_rate": 0.0004163887767679087, "loss": 4.9821, "mean_token_accuracy": 0.21438337862491608, "num_tokens": 64497400.0, "step": 37180 }, { "entropy": 5.877262926101684, "epoch": 2.893133631589185, "grad_norm": 1.2734375, "learning_rate": 0.0004163672158846285, "loss": 5.0445, "mean_token_accuracy": 0.2042357236146927, "num_tokens": 64506119.0, "step": 37185 }, { "entropy": 5.796861696243286, "epoch": 2.8935226609609024, "grad_norm": 1.2734375, "learning_rate": 0.00041634565285632573, "loss": 4.9144, "mean_token_accuracy": 0.20339482575654982, "num_tokens": 64514372.0, "step": 37190 }, { "entropy": 5.770101833343506, "epoch": 2.89391169033262, "grad_norm": 1.2578125, "learning_rate": 0.00041632408768332776, "loss": 4.9769, "mean_token_accuracy": 0.20458300411701202, "num_tokens": 64522877.0, "step": 37195 }, { "entropy": 5.715446043014526, "epoch": 2.8943007197043378, "grad_norm": 1.234375, "learning_rate": 0.00041630252036596165, "loss": 4.8292, "mean_token_accuracy": 0.22165483832359315, "num_tokens": 64531647.0, "step": 37200 }, { "entropy": 5.750990295410157, "epoch": 2.894689749076055, "grad_norm": 1.203125, "learning_rate": 0.0004162809509045547, "loss": 4.9641, "mean_token_accuracy": 0.20730386823415756, "num_tokens": 64540323.0, "step": 37205 }, { "entropy": 5.824655055999756, "epoch": 2.8950787784477727, "grad_norm": 1.421875, "learning_rate": 0.00041625937929943424, "loss": 5.0507, "mean_token_accuracy": 0.20332174748182297, "num_tokens": 64548955.0, "step": 37210 }, { "entropy": 5.816799879074097, "epoch": 2.8954678078194904, "grad_norm": 1.328125, "learning_rate": 0.00041623780555092747, "loss": 5.0411, "mean_token_accuracy": 0.20245813131332396, "num_tokens": 64557744.0, "step": 37215 }, { "entropy": 5.758823537826538, "epoch": 2.895856837191208, "grad_norm": 1.328125, "learning_rate": 0.0004162162296593618, "loss": 4.8842, "mean_token_accuracy": 0.2136201187968254, "num_tokens": 64566119.0, "step": 37220 }, { "entropy": 5.778063344955444, "epoch": 2.8962458665629254, "grad_norm": 1.203125, "learning_rate": 0.00041619465162506466, "loss": 5.0089, "mean_token_accuracy": 0.21109870374202727, "num_tokens": 64574995.0, "step": 37225 }, { "entropy": 5.817973041534424, "epoch": 2.896634895934643, "grad_norm": 1.2890625, "learning_rate": 0.0004161730714483633, "loss": 5.1011, "mean_token_accuracy": 0.20219702273607254, "num_tokens": 64583667.0, "step": 37230 }, { "entropy": 5.820700025558471, "epoch": 2.8970239253063608, "grad_norm": 1.3203125, "learning_rate": 0.0004161514891295854, "loss": 4.9611, "mean_token_accuracy": 0.21453402936458588, "num_tokens": 64591857.0, "step": 37235 }, { "entropy": 5.786137104034424, "epoch": 2.897412954678078, "grad_norm": 1.2890625, "learning_rate": 0.00041612990466905825, "loss": 5.0461, "mean_token_accuracy": 0.20348697602748872, "num_tokens": 64600635.0, "step": 37240 }, { "entropy": 5.798447990417481, "epoch": 2.8978019840497957, "grad_norm": 1.4296875, "learning_rate": 0.00041610831806710954, "loss": 4.9856, "mean_token_accuracy": 0.20221203863620757, "num_tokens": 64609141.0, "step": 37245 }, { "entropy": 5.837018632888794, "epoch": 2.8981910134215134, "grad_norm": 1.2578125, "learning_rate": 0.00041608672932406666, "loss": 5.0166, "mean_token_accuracy": 0.20852839350700378, "num_tokens": 64617804.0, "step": 37250 }, { "entropy": 5.817765140533448, "epoch": 2.898580042793231, "grad_norm": 1.2421875, "learning_rate": 0.00041606513844025716, "loss": 4.878, "mean_token_accuracy": 0.21432213634252548, "num_tokens": 64626119.0, "step": 37255 }, { "entropy": 5.806481742858887, "epoch": 2.8989690721649484, "grad_norm": 1.375, "learning_rate": 0.0004160435454160087, "loss": 4.9769, "mean_token_accuracy": 0.20382003635168075, "num_tokens": 64634483.0, "step": 37260 }, { "entropy": 5.750558662414551, "epoch": 2.899358101536666, "grad_norm": 1.2734375, "learning_rate": 0.000416021950251649, "loss": 5.031, "mean_token_accuracy": 0.2036902442574501, "num_tokens": 64642500.0, "step": 37265 }, { "entropy": 5.765313243865966, "epoch": 2.8997471309083833, "grad_norm": 1.2421875, "learning_rate": 0.0004160003529475057, "loss": 5.0177, "mean_token_accuracy": 0.20162294656038285, "num_tokens": 64651808.0, "step": 37270 }, { "entropy": 5.816401195526123, "epoch": 2.900136160280101, "grad_norm": 1.3984375, "learning_rate": 0.0004159787535039064, "loss": 5.0256, "mean_token_accuracy": 0.20391747504472732, "num_tokens": 64660502.0, "step": 37275 }, { "entropy": 5.839527750015259, "epoch": 2.9005251896518187, "grad_norm": 1.28125, "learning_rate": 0.0004159571519211789, "loss": 5.0827, "mean_token_accuracy": 0.20521850436925887, "num_tokens": 64669156.0, "step": 37280 }, { "entropy": 5.854022884368897, "epoch": 2.9009142190235364, "grad_norm": 1.2109375, "learning_rate": 0.000415935548199651, "loss": 5.0621, "mean_token_accuracy": 0.20263974070549012, "num_tokens": 64678321.0, "step": 37285 }, { "entropy": 5.861771726608277, "epoch": 2.901303248395254, "grad_norm": 1.328125, "learning_rate": 0.0004159139423396504, "loss": 5.0249, "mean_token_accuracy": 0.19914842247962952, "num_tokens": 64686768.0, "step": 37290 }, { "entropy": 5.897479724884033, "epoch": 2.9016922777669714, "grad_norm": 1.25, "learning_rate": 0.0004158923343415051, "loss": 5.0965, "mean_token_accuracy": 0.20513201355934144, "num_tokens": 64695357.0, "step": 37295 }, { "entropy": 5.7430730819702145, "epoch": 2.902081307138689, "grad_norm": 1.2734375, "learning_rate": 0.0004158707242055429, "loss": 5.0279, "mean_token_accuracy": 0.19847038388252258, "num_tokens": 64703912.0, "step": 37300 }, { "entropy": 5.733249807357788, "epoch": 2.9024703365104063, "grad_norm": 1.21875, "learning_rate": 0.00041584911193209167, "loss": 4.9441, "mean_token_accuracy": 0.21311118751764296, "num_tokens": 64713088.0, "step": 37305 }, { "entropy": 5.830707693099976, "epoch": 2.902859365882124, "grad_norm": 1.3125, "learning_rate": 0.0004158274975214794, "loss": 5.0241, "mean_token_accuracy": 0.19602841287851333, "num_tokens": 64721950.0, "step": 37310 }, { "entropy": 5.849611902236939, "epoch": 2.9032483952538417, "grad_norm": 1.2421875, "learning_rate": 0.00041580588097403384, "loss": 5.0018, "mean_token_accuracy": 0.19721185714006423, "num_tokens": 64731032.0, "step": 37315 }, { "entropy": 5.765616989135742, "epoch": 2.9036374246255594, "grad_norm": 1.28125, "learning_rate": 0.00041578426229008325, "loss": 5.0352, "mean_token_accuracy": 0.20342419892549515, "num_tokens": 64739676.0, "step": 37320 }, { "entropy": 5.788762474060059, "epoch": 2.9040264539972767, "grad_norm": 1.3203125, "learning_rate": 0.00041576264146995557, "loss": 4.9854, "mean_token_accuracy": 0.21113596856594086, "num_tokens": 64748827.0, "step": 37325 }, { "entropy": 5.784723711013794, "epoch": 2.9044154833689944, "grad_norm": 1.21875, "learning_rate": 0.00041574101851397883, "loss": 4.9035, "mean_token_accuracy": 0.21476234048604964, "num_tokens": 64757990.0, "step": 37330 }, { "entropy": 5.7669695854187015, "epoch": 2.904804512740712, "grad_norm": 1.203125, "learning_rate": 0.0004157193934224811, "loss": 5.087, "mean_token_accuracy": 0.20181526690721513, "num_tokens": 64767351.0, "step": 37335 }, { "entropy": 5.812999057769775, "epoch": 2.9051935421124293, "grad_norm": 1.1796875, "learning_rate": 0.0004156977661957906, "loss": 5.0582, "mean_token_accuracy": 0.2091486155986786, "num_tokens": 64775294.0, "step": 37340 }, { "entropy": 5.810967636108399, "epoch": 2.905582571484147, "grad_norm": 1.2890625, "learning_rate": 0.0004156761368342355, "loss": 5.0381, "mean_token_accuracy": 0.21480512470006943, "num_tokens": 64784933.0, "step": 37345 }, { "entropy": 5.837831830978393, "epoch": 2.9059716008558647, "grad_norm": 1.21875, "learning_rate": 0.00041565450533814384, "loss": 4.9796, "mean_token_accuracy": 0.21399618983268737, "num_tokens": 64794137.0, "step": 37350 }, { "entropy": 5.820476341247558, "epoch": 2.9063606302275824, "grad_norm": 1.328125, "learning_rate": 0.00041563287170784396, "loss": 5.0055, "mean_token_accuracy": 0.20169112086296082, "num_tokens": 64803100.0, "step": 37355 }, { "entropy": 5.710199785232544, "epoch": 2.9067496595992997, "grad_norm": 1.2265625, "learning_rate": 0.0004156112359436641, "loss": 4.9246, "mean_token_accuracy": 0.2127266749739647, "num_tokens": 64811980.0, "step": 37360 }, { "entropy": 5.781800079345703, "epoch": 2.9071386889710173, "grad_norm": 1.2734375, "learning_rate": 0.00041558959804593255, "loss": 5.002, "mean_token_accuracy": 0.20657373666763307, "num_tokens": 64820201.0, "step": 37365 }, { "entropy": 5.798106336593628, "epoch": 2.9075277183427346, "grad_norm": 1.28125, "learning_rate": 0.00041556795801497766, "loss": 4.9686, "mean_token_accuracy": 0.21226968467235566, "num_tokens": 64829054.0, "step": 37370 }, { "entropy": 5.861152935028076, "epoch": 2.9079167477144523, "grad_norm": 1.2578125, "learning_rate": 0.0004155463158511277, "loss": 5.1296, "mean_token_accuracy": 0.19851900041103362, "num_tokens": 64838704.0, "step": 37375 }, { "entropy": 5.769803524017334, "epoch": 2.90830577708617, "grad_norm": 1.1875, "learning_rate": 0.00041552467155471105, "loss": 4.8314, "mean_token_accuracy": 0.21827107965946196, "num_tokens": 64847508.0, "step": 37380 }, { "entropy": 5.806541872024536, "epoch": 2.9086948064578877, "grad_norm": 1.3125, "learning_rate": 0.0004155030251260563, "loss": 4.9388, "mean_token_accuracy": 0.21588921099901198, "num_tokens": 64856112.0, "step": 37385 }, { "entropy": 5.748947048187256, "epoch": 2.9090838358296054, "grad_norm": 1.21875, "learning_rate": 0.00041548137656549167, "loss": 4.9113, "mean_token_accuracy": 0.21236215382814408, "num_tokens": 64864807.0, "step": 37390 }, { "entropy": 5.798714923858642, "epoch": 2.9094728652013226, "grad_norm": 1.2890625, "learning_rate": 0.0004154597258733457, "loss": 4.9886, "mean_token_accuracy": 0.20708333551883698, "num_tokens": 64872744.0, "step": 37395 }, { "entropy": 5.799120569229126, "epoch": 2.9098618945730403, "grad_norm": 1.3359375, "learning_rate": 0.0004154380730499472, "loss": 4.9604, "mean_token_accuracy": 0.21208524852991104, "num_tokens": 64882581.0, "step": 37400 }, { "entropy": 5.75370078086853, "epoch": 2.9102509239447576, "grad_norm": 1.28125, "learning_rate": 0.00041541641809562425, "loss": 4.9084, "mean_token_accuracy": 0.20981716215610505, "num_tokens": 64890935.0, "step": 37405 }, { "entropy": 5.826978302001953, "epoch": 2.9106399533164753, "grad_norm": 1.2734375, "learning_rate": 0.0004153947610107057, "loss": 5.0923, "mean_token_accuracy": 0.20015419274568558, "num_tokens": 64900132.0, "step": 37410 }, { "entropy": 5.818065214157104, "epoch": 2.911028982688193, "grad_norm": 1.2421875, "learning_rate": 0.00041537310179552017, "loss": 5.0191, "mean_token_accuracy": 0.2030436083674431, "num_tokens": 64908733.0, "step": 37415 }, { "entropy": 5.816516876220703, "epoch": 2.9114180120599107, "grad_norm": 1.34375, "learning_rate": 0.0004153514404503962, "loss": 5.0125, "mean_token_accuracy": 0.2034083917737007, "num_tokens": 64916824.0, "step": 37420 }, { "entropy": 5.823220491409302, "epoch": 2.911807041431628, "grad_norm": 1.2890625, "learning_rate": 0.0004153297769756625, "loss": 5.008, "mean_token_accuracy": 0.20174604803323745, "num_tokens": 64926342.0, "step": 37425 }, { "entropy": 5.84201831817627, "epoch": 2.9121960708033456, "grad_norm": 1.25, "learning_rate": 0.0004153081113716478, "loss": 5.0174, "mean_token_accuracy": 0.20892584174871445, "num_tokens": 64935123.0, "step": 37430 }, { "entropy": 5.807203865051269, "epoch": 2.9125851001750633, "grad_norm": 1.265625, "learning_rate": 0.00041528644363868087, "loss": 5.0422, "mean_token_accuracy": 0.20226745158433915, "num_tokens": 64944046.0, "step": 37435 }, { "entropy": 5.9178893089294435, "epoch": 2.9129741295467806, "grad_norm": 1.2421875, "learning_rate": 0.0004152647737770904, "loss": 5.1, "mean_token_accuracy": 0.19120790362358092, "num_tokens": 64952897.0, "step": 37440 }, { "entropy": 5.896544933319092, "epoch": 2.9133631589184983, "grad_norm": 1.2578125, "learning_rate": 0.0004152431017872053, "loss": 5.062, "mean_token_accuracy": 0.20506420731544495, "num_tokens": 64961432.0, "step": 37445 }, { "entropy": 5.837743043899536, "epoch": 2.913752188290216, "grad_norm": 1.2265625, "learning_rate": 0.00041522142766935426, "loss": 5.0937, "mean_token_accuracy": 0.19887920171022416, "num_tokens": 64970298.0, "step": 37450 }, { "entropy": 5.839676761627198, "epoch": 2.9141412176619337, "grad_norm": 1.2578125, "learning_rate": 0.00041519975142386627, "loss": 5.0761, "mean_token_accuracy": 0.20092874467372895, "num_tokens": 64978735.0, "step": 37455 }, { "entropy": 5.833218717575074, "epoch": 2.914530247033651, "grad_norm": 1.359375, "learning_rate": 0.0004151780730510702, "loss": 5.0293, "mean_token_accuracy": 0.2011540338397026, "num_tokens": 64987222.0, "step": 37460 }, { "entropy": 5.737643241882324, "epoch": 2.9149192764053686, "grad_norm": 1.25, "learning_rate": 0.00041515639255129504, "loss": 4.9108, "mean_token_accuracy": 0.21553818732500077, "num_tokens": 64995857.0, "step": 37465 }, { "entropy": 5.762152814865113, "epoch": 2.9153083057770863, "grad_norm": 1.2265625, "learning_rate": 0.0004151347099248697, "loss": 4.938, "mean_token_accuracy": 0.2085283324122429, "num_tokens": 65005583.0, "step": 37470 }, { "entropy": 5.818338251113891, "epoch": 2.9156973351488036, "grad_norm": 1.25, "learning_rate": 0.0004151130251721231, "loss": 4.9885, "mean_token_accuracy": 0.20802012830972672, "num_tokens": 65013533.0, "step": 37475 }, { "entropy": 5.796665334701538, "epoch": 2.9160863645205213, "grad_norm": 1.2578125, "learning_rate": 0.00041509133829338454, "loss": 4.9889, "mean_token_accuracy": 0.2163096308708191, "num_tokens": 65022674.0, "step": 37480 }, { "entropy": 5.763079833984375, "epoch": 2.916475393892239, "grad_norm": 1.3125, "learning_rate": 0.0004150696492889827, "loss": 4.9211, "mean_token_accuracy": 0.21469176113605498, "num_tokens": 65030914.0, "step": 37485 }, { "entropy": 5.7955999851226805, "epoch": 2.9168644232639567, "grad_norm": 1.34375, "learning_rate": 0.00041504795815924697, "loss": 5.0199, "mean_token_accuracy": 0.2059937059879303, "num_tokens": 65040036.0, "step": 37490 }, { "entropy": 5.826927661895752, "epoch": 2.917253452635674, "grad_norm": 1.2578125, "learning_rate": 0.00041502626490450635, "loss": 4.9681, "mean_token_accuracy": 0.21491282433271408, "num_tokens": 65048558.0, "step": 37495 }, { "entropy": 5.771075916290283, "epoch": 2.9176424820073916, "grad_norm": 1.265625, "learning_rate": 0.0004150045695250901, "loss": 4.9752, "mean_token_accuracy": 0.2153475970029831, "num_tokens": 65057158.0, "step": 37500 }, { "entropy": 5.843840265274048, "epoch": 2.918031511379109, "grad_norm": 1.25, "learning_rate": 0.0004149828720213272, "loss": 5.0613, "mean_token_accuracy": 0.2095615014433861, "num_tokens": 65065845.0, "step": 37505 }, { "entropy": 5.8007568359375, "epoch": 2.9184205407508266, "grad_norm": 1.3203125, "learning_rate": 0.0004149611723935472, "loss": 5.0039, "mean_token_accuracy": 0.20663176029920577, "num_tokens": 65075182.0, "step": 37510 }, { "entropy": 5.8136069774627686, "epoch": 2.9188095701225443, "grad_norm": 1.2109375, "learning_rate": 0.0004149394706420791, "loss": 4.9973, "mean_token_accuracy": 0.2092272460460663, "num_tokens": 65084616.0, "step": 37515 }, { "entropy": 5.694690132141114, "epoch": 2.919198599494262, "grad_norm": 1.3046875, "learning_rate": 0.00041491776676725223, "loss": 4.8818, "mean_token_accuracy": 0.2258787289261818, "num_tokens": 65092683.0, "step": 37520 }, { "entropy": 5.755844926834106, "epoch": 2.9195876288659792, "grad_norm": 1.2890625, "learning_rate": 0.0004148960607693961, "loss": 4.9535, "mean_token_accuracy": 0.20546974539756774, "num_tokens": 65100445.0, "step": 37525 }, { "entropy": 5.805068922042847, "epoch": 2.919976658237697, "grad_norm": 1.2734375, "learning_rate": 0.00041487435264883974, "loss": 5.0094, "mean_token_accuracy": 0.20912558138370513, "num_tokens": 65109512.0, "step": 37530 }, { "entropy": 5.7811380386352536, "epoch": 2.9203656876094146, "grad_norm": 1.203125, "learning_rate": 0.0004148526424059128, "loss": 4.9893, "mean_token_accuracy": 0.20580063611268998, "num_tokens": 65117889.0, "step": 37535 }, { "entropy": 5.812647533416748, "epoch": 2.920754716981132, "grad_norm": 1.2421875, "learning_rate": 0.0004148309300409446, "loss": 5.0366, "mean_token_accuracy": 0.20423102378845215, "num_tokens": 65126226.0, "step": 37540 }, { "entropy": 5.78339033126831, "epoch": 2.9211437463528496, "grad_norm": 1.265625, "learning_rate": 0.0004148092155542646, "loss": 4.9798, "mean_token_accuracy": 0.20625606179237366, "num_tokens": 65134474.0, "step": 37545 }, { "entropy": 5.830212211608886, "epoch": 2.9215327757245673, "grad_norm": 1.3125, "learning_rate": 0.0004147874989462023, "loss": 5.077, "mean_token_accuracy": 0.2002380073070526, "num_tokens": 65143068.0, "step": 37550 }, { "entropy": 5.769702625274658, "epoch": 2.921921805096285, "grad_norm": 1.3203125, "learning_rate": 0.0004147657802170871, "loss": 4.985, "mean_token_accuracy": 0.2112153336405754, "num_tokens": 65151865.0, "step": 37555 }, { "entropy": 5.769666242599487, "epoch": 2.922310834468002, "grad_norm": 1.2421875, "learning_rate": 0.00041474405936724873, "loss": 4.9679, "mean_token_accuracy": 0.20770518481731415, "num_tokens": 65160684.0, "step": 37560 }, { "entropy": 5.836337327957153, "epoch": 2.92269986383972, "grad_norm": 1.2890625, "learning_rate": 0.0004147223363970166, "loss": 5.0184, "mean_token_accuracy": 0.20567017942667007, "num_tokens": 65169084.0, "step": 37565 }, { "entropy": 5.723083019256592, "epoch": 2.9230888932114376, "grad_norm": 1.203125, "learning_rate": 0.0004147006113067205, "loss": 4.8744, "mean_token_accuracy": 0.2138003408908844, "num_tokens": 65178428.0, "step": 37570 }, { "entropy": 5.787231206893921, "epoch": 2.923477922583155, "grad_norm": 1.2578125, "learning_rate": 0.0004146788840966901, "loss": 4.9637, "mean_token_accuracy": 0.20303383618593215, "num_tokens": 65187490.0, "step": 37575 }, { "entropy": 5.814029550552368, "epoch": 2.9238669519548726, "grad_norm": 1.1640625, "learning_rate": 0.0004146571547672548, "loss": 5.0143, "mean_token_accuracy": 0.20838441401720048, "num_tokens": 65195987.0, "step": 37580 }, { "entropy": 5.750436878204345, "epoch": 2.9242559813265903, "grad_norm": 1.1328125, "learning_rate": 0.00041463542331874443, "loss": 4.9658, "mean_token_accuracy": 0.2072920098900795, "num_tokens": 65204466.0, "step": 37585 }, { "entropy": 5.782142639160156, "epoch": 2.924645010698308, "grad_norm": 1.34375, "learning_rate": 0.00041461368975148876, "loss": 4.949, "mean_token_accuracy": 0.21029426753520966, "num_tokens": 65213023.0, "step": 37590 }, { "entropy": 5.860556888580322, "epoch": 2.925034040070025, "grad_norm": 1.34375, "learning_rate": 0.00041459195406581763, "loss": 5.1259, "mean_token_accuracy": 0.2008754074573517, "num_tokens": 65221580.0, "step": 37595 }, { "entropy": 5.707093572616577, "epoch": 2.925423069441743, "grad_norm": 1.234375, "learning_rate": 0.0004145702162620608, "loss": 4.984, "mean_token_accuracy": 0.20664133429527282, "num_tokens": 65230529.0, "step": 37600 }, { "entropy": 5.764512395858764, "epoch": 2.92581209881346, "grad_norm": 1.2734375, "learning_rate": 0.00041454847634054805, "loss": 4.99, "mean_token_accuracy": 0.20777445733547212, "num_tokens": 65239338.0, "step": 37605 }, { "entropy": 5.770494747161865, "epoch": 2.926201128185178, "grad_norm": 1.2421875, "learning_rate": 0.00041452673430160923, "loss": 4.9564, "mean_token_accuracy": 0.2069793552160263, "num_tokens": 65248523.0, "step": 37610 }, { "entropy": 5.8277137756347654, "epoch": 2.9265901575568956, "grad_norm": 1.2109375, "learning_rate": 0.0004145049901455744, "loss": 5.041, "mean_token_accuracy": 0.20219890028238297, "num_tokens": 65257740.0, "step": 37615 }, { "entropy": 5.827582931518554, "epoch": 2.9269791869286133, "grad_norm": 1.1953125, "learning_rate": 0.00041448324387277337, "loss": 4.9334, "mean_token_accuracy": 0.20945317447185516, "num_tokens": 65266728.0, "step": 37620 }, { "entropy": 5.844689178466797, "epoch": 2.927368216300331, "grad_norm": 1.3203125, "learning_rate": 0.00041446149548353606, "loss": 5.0922, "mean_token_accuracy": 0.1988937109708786, "num_tokens": 65275264.0, "step": 37625 }, { "entropy": 5.814268350601196, "epoch": 2.927757245672048, "grad_norm": 1.171875, "learning_rate": 0.0004144397449781926, "loss": 5.0735, "mean_token_accuracy": 0.19979774057865143, "num_tokens": 65284247.0, "step": 37630 }, { "entropy": 5.812187004089355, "epoch": 2.928146275043766, "grad_norm": 1.2890625, "learning_rate": 0.0004144179923570729, "loss": 4.9641, "mean_token_accuracy": 0.20907962769269944, "num_tokens": 65293255.0, "step": 37635 }, { "entropy": 5.82471809387207, "epoch": 2.928535304415483, "grad_norm": 1.2578125, "learning_rate": 0.0004143962376205071, "loss": 5.0248, "mean_token_accuracy": 0.20541165471076966, "num_tokens": 65301945.0, "step": 37640 }, { "entropy": 5.80695652961731, "epoch": 2.928924333787201, "grad_norm": 1.3671875, "learning_rate": 0.00041437448076882526, "loss": 4.9578, "mean_token_accuracy": 0.21480377316474913, "num_tokens": 65310521.0, "step": 37645 }, { "entropy": 5.772918939590454, "epoch": 2.9293133631589185, "grad_norm": 1.328125, "learning_rate": 0.00041435272180235757, "loss": 4.9975, "mean_token_accuracy": 0.20142122507095336, "num_tokens": 65318626.0, "step": 37650 }, { "entropy": 5.846328544616699, "epoch": 2.9297023925306362, "grad_norm": 1.296875, "learning_rate": 0.000414330960721434, "loss": 5.0184, "mean_token_accuracy": 0.202310049533844, "num_tokens": 65326098.0, "step": 37655 }, { "entropy": 5.842078161239624, "epoch": 2.9300914219023535, "grad_norm": 1.3125, "learning_rate": 0.00041430919752638497, "loss": 5.0754, "mean_token_accuracy": 0.20232130140066146, "num_tokens": 65334705.0, "step": 37660 }, { "entropy": 5.829688215255738, "epoch": 2.930480451274071, "grad_norm": 1.1796875, "learning_rate": 0.0004142874322175406, "loss": 4.9592, "mean_token_accuracy": 0.20765394121408462, "num_tokens": 65343965.0, "step": 37665 }, { "entropy": 5.817558526992798, "epoch": 2.930869480645789, "grad_norm": 1.3046875, "learning_rate": 0.00041426566479523116, "loss": 4.9823, "mean_token_accuracy": 0.20613330900669097, "num_tokens": 65351467.0, "step": 37670 }, { "entropy": 5.774628305435181, "epoch": 2.931258510017506, "grad_norm": 1.3515625, "learning_rate": 0.00041424389525978683, "loss": 4.9688, "mean_token_accuracy": 0.20439230650663376, "num_tokens": 65359820.0, "step": 37675 }, { "entropy": 5.781310415267944, "epoch": 2.931647539389224, "grad_norm": 1.25, "learning_rate": 0.0004142221236115381, "loss": 4.9049, "mean_token_accuracy": 0.21761462688446045, "num_tokens": 65368363.0, "step": 37680 }, { "entropy": 5.812486457824707, "epoch": 2.9320365687609415, "grad_norm": 1.21875, "learning_rate": 0.0004142003498508152, "loss": 5.035, "mean_token_accuracy": 0.2088380828499794, "num_tokens": 65376771.0, "step": 37685 }, { "entropy": 5.8232825756072994, "epoch": 2.9324255981326592, "grad_norm": 1.296875, "learning_rate": 0.0004141785739779486, "loss": 5.0774, "mean_token_accuracy": 0.2038669005036354, "num_tokens": 65385254.0, "step": 37690 }, { "entropy": 5.903758001327515, "epoch": 2.9328146275043765, "grad_norm": 1.234375, "learning_rate": 0.00041415679599326853, "loss": 5.0211, "mean_token_accuracy": 0.19519663900136947, "num_tokens": 65393276.0, "step": 37695 }, { "entropy": 5.778813076019287, "epoch": 2.933203656876094, "grad_norm": 1.40625, "learning_rate": 0.00041413501589710567, "loss": 4.8909, "mean_token_accuracy": 0.21075383573770523, "num_tokens": 65401745.0, "step": 37700 }, { "entropy": 5.844391298294068, "epoch": 2.9335926862478114, "grad_norm": 1.28125, "learning_rate": 0.0004141132336897904, "loss": 5.1283, "mean_token_accuracy": 0.2011095628142357, "num_tokens": 65409982.0, "step": 37705 }, { "entropy": 5.784383726119995, "epoch": 2.933981715619529, "grad_norm": 1.265625, "learning_rate": 0.0004140914493716533, "loss": 4.9794, "mean_token_accuracy": 0.21068640798330307, "num_tokens": 65419617.0, "step": 37710 }, { "entropy": 5.845173311233521, "epoch": 2.934370744991247, "grad_norm": 1.25, "learning_rate": 0.0004140696629430248, "loss": 5.0097, "mean_token_accuracy": 0.20728454738855362, "num_tokens": 65428230.0, "step": 37715 }, { "entropy": 5.8911927223205565, "epoch": 2.9347597743629645, "grad_norm": 1.3125, "learning_rate": 0.00041404787440423534, "loss": 5.0417, "mean_token_accuracy": 0.2064600795507431, "num_tokens": 65437126.0, "step": 37720 }, { "entropy": 5.846333408355713, "epoch": 2.9351488037346822, "grad_norm": 1.203125, "learning_rate": 0.00041402608375561595, "loss": 5.06, "mean_token_accuracy": 0.19700243771076204, "num_tokens": 65445910.0, "step": 37725 }, { "entropy": 5.792303800582886, "epoch": 2.9355378331063995, "grad_norm": 1.2890625, "learning_rate": 0.00041400429099749687, "loss": 5.0778, "mean_token_accuracy": 0.19839354157447814, "num_tokens": 65454371.0, "step": 37730 }, { "entropy": 5.828773021697998, "epoch": 2.935926862478117, "grad_norm": 1.3203125, "learning_rate": 0.000413982496130209, "loss": 5.0318, "mean_token_accuracy": 0.20371669083833693, "num_tokens": 65463207.0, "step": 37735 }, { "entropy": 5.764865112304688, "epoch": 2.9363158918498344, "grad_norm": 1.28125, "learning_rate": 0.00041396069915408294, "loss": 4.9905, "mean_token_accuracy": 0.20691478997468948, "num_tokens": 65471703.0, "step": 37740 }, { "entropy": 5.757013559341431, "epoch": 2.936704921221552, "grad_norm": 1.265625, "learning_rate": 0.00041393890006944945, "loss": 4.9279, "mean_token_accuracy": 0.2161546006798744, "num_tokens": 65480516.0, "step": 37745 }, { "entropy": 5.787012004852295, "epoch": 2.93709395059327, "grad_norm": 1.25, "learning_rate": 0.0004139170988766393, "loss": 4.9835, "mean_token_accuracy": 0.20467787981033325, "num_tokens": 65489233.0, "step": 37750 }, { "entropy": 5.799408674240112, "epoch": 2.9374829799649875, "grad_norm": 1.3515625, "learning_rate": 0.0004138952955759833, "loss": 4.9224, "mean_token_accuracy": 0.2064541757106781, "num_tokens": 65497827.0, "step": 37755 }, { "entropy": 5.7972640037536625, "epoch": 2.937872009336705, "grad_norm": 1.3515625, "learning_rate": 0.00041387349016781225, "loss": 5.0435, "mean_token_accuracy": 0.20737591087818147, "num_tokens": 65505629.0, "step": 37760 }, { "entropy": 5.8264671802520756, "epoch": 2.9382610387084225, "grad_norm": 1.2265625, "learning_rate": 0.000413851682652457, "loss": 5.0997, "mean_token_accuracy": 0.19839289635419846, "num_tokens": 65514097.0, "step": 37765 }, { "entropy": 5.841024494171142, "epoch": 2.93865006808014, "grad_norm": 1.3125, "learning_rate": 0.0004138298730302485, "loss": 5.0812, "mean_token_accuracy": 0.20563873797655105, "num_tokens": 65522868.0, "step": 37770 }, { "entropy": 5.831250333786011, "epoch": 2.9390390974518574, "grad_norm": 1.3671875, "learning_rate": 0.0004138080613015176, "loss": 4.972, "mean_token_accuracy": 0.20920588523149491, "num_tokens": 65531433.0, "step": 37775 }, { "entropy": 5.808960342407227, "epoch": 2.939428126823575, "grad_norm": 1.1484375, "learning_rate": 0.00041378624746659536, "loss": 5.0113, "mean_token_accuracy": 0.2100109726190567, "num_tokens": 65541113.0, "step": 37780 }, { "entropy": 5.811487007141113, "epoch": 2.939817156195293, "grad_norm": 1.3046875, "learning_rate": 0.00041376443152581265, "loss": 4.9986, "mean_token_accuracy": 0.2041308179497719, "num_tokens": 65550103.0, "step": 37785 }, { "entropy": 5.799273443222046, "epoch": 2.9402061855670105, "grad_norm": 1.3515625, "learning_rate": 0.00041374261347950064, "loss": 5.0105, "mean_token_accuracy": 0.2080279991030693, "num_tokens": 65558618.0, "step": 37790 }, { "entropy": 5.833667993545532, "epoch": 2.9405952149387278, "grad_norm": 1.2265625, "learning_rate": 0.0004137207933279903, "loss": 4.9733, "mean_token_accuracy": 0.20529801696538924, "num_tokens": 65568025.0, "step": 37795 }, { "entropy": 5.7984785556793215, "epoch": 2.9409842443104455, "grad_norm": 1.3203125, "learning_rate": 0.00041369897107161266, "loss": 5.0229, "mean_token_accuracy": 0.20504961758852006, "num_tokens": 65576360.0, "step": 37800 }, { "entropy": 5.826273822784424, "epoch": 2.941373273682163, "grad_norm": 1.21875, "learning_rate": 0.00041367714671069897, "loss": 5.0204, "mean_token_accuracy": 0.20957797765731812, "num_tokens": 65585764.0, "step": 37805 }, { "entropy": 5.791890621185303, "epoch": 2.9417623030538804, "grad_norm": 1.2421875, "learning_rate": 0.00041365532024558024, "loss": 5.032, "mean_token_accuracy": 0.20887646079063416, "num_tokens": 65594093.0, "step": 37810 }, { "entropy": 5.848724699020385, "epoch": 2.942151332425598, "grad_norm": 1.2421875, "learning_rate": 0.0004136334916765877, "loss": 4.976, "mean_token_accuracy": 0.20505814552307128, "num_tokens": 65602503.0, "step": 37815 }, { "entropy": 5.806312847137451, "epoch": 2.942540361797316, "grad_norm": 1.2421875, "learning_rate": 0.00041361166100405264, "loss": 4.9574, "mean_token_accuracy": 0.2143403947353363, "num_tokens": 65611107.0, "step": 37820 }, { "entropy": 5.777169895172119, "epoch": 2.9429293911690335, "grad_norm": 1.3125, "learning_rate": 0.0004135898282283062, "loss": 5.0651, "mean_token_accuracy": 0.20864454209804534, "num_tokens": 65620008.0, "step": 37825 }, { "entropy": 5.7557793140411375, "epoch": 2.9433184205407508, "grad_norm": 1.28125, "learning_rate": 0.0004135679933496797, "loss": 4.984, "mean_token_accuracy": 0.20655581653118132, "num_tokens": 65629206.0, "step": 37830 }, { "entropy": 5.792070960998535, "epoch": 2.9437074499124685, "grad_norm": 1.2734375, "learning_rate": 0.0004135461563685045, "loss": 5.0346, "mean_token_accuracy": 0.21161134093999862, "num_tokens": 65637403.0, "step": 37835 }, { "entropy": 5.8176158428192135, "epoch": 2.9440964792841857, "grad_norm": 1.1953125, "learning_rate": 0.00041352431728511194, "loss": 4.8752, "mean_token_accuracy": 0.22102844715118408, "num_tokens": 65646123.0, "step": 37840 }, { "entropy": 5.83639931678772, "epoch": 2.9444855086559034, "grad_norm": 1.21875, "learning_rate": 0.0004135024760998333, "loss": 5.0364, "mean_token_accuracy": 0.19793090969324112, "num_tokens": 65655019.0, "step": 37845 }, { "entropy": 5.813972520828247, "epoch": 2.944874538027621, "grad_norm": 1.171875, "learning_rate": 0.00041348063281299995, "loss": 5.0831, "mean_token_accuracy": 0.20372422337532042, "num_tokens": 65663721.0, "step": 37850 }, { "entropy": 5.78133487701416, "epoch": 2.945263567399339, "grad_norm": 1.3359375, "learning_rate": 0.00041345878742494346, "loss": 4.8785, "mean_token_accuracy": 0.2149618610739708, "num_tokens": 65671546.0, "step": 37855 }, { "entropy": 5.835765361785889, "epoch": 2.945652596771056, "grad_norm": 1.2578125, "learning_rate": 0.00041343693993599535, "loss": 5.0466, "mean_token_accuracy": 0.19850541204214095, "num_tokens": 65680630.0, "step": 37860 }, { "entropy": 5.817136478424072, "epoch": 2.9460416261427738, "grad_norm": 1.484375, "learning_rate": 0.0004134150903464869, "loss": 5.0554, "mean_token_accuracy": 0.19645422995090484, "num_tokens": 65688579.0, "step": 37865 }, { "entropy": 5.759113836288452, "epoch": 2.9464306555144915, "grad_norm": 1.3203125, "learning_rate": 0.0004133932386567498, "loss": 4.953, "mean_token_accuracy": 0.19637044817209243, "num_tokens": 65696531.0, "step": 37870 }, { "entropy": 5.7489142417907715, "epoch": 2.9468196848862087, "grad_norm": 1.3515625, "learning_rate": 0.0004133713848671156, "loss": 4.9063, "mean_token_accuracy": 0.2204396516084671, "num_tokens": 65705271.0, "step": 37875 }, { "entropy": 5.762833118438721, "epoch": 2.9472087142579264, "grad_norm": 1.265625, "learning_rate": 0.0004133495289779159, "loss": 5.0087, "mean_token_accuracy": 0.2050588145852089, "num_tokens": 65713638.0, "step": 37880 }, { "entropy": 5.864718198776245, "epoch": 2.947597743629644, "grad_norm": 1.234375, "learning_rate": 0.0004133276709894823, "loss": 5.0792, "mean_token_accuracy": 0.20197757184505463, "num_tokens": 65722339.0, "step": 37885 }, { "entropy": 5.895796012878418, "epoch": 2.947986773001362, "grad_norm": 1.34375, "learning_rate": 0.0004133058109021464, "loss": 5.142, "mean_token_accuracy": 0.20273630917072297, "num_tokens": 65730969.0, "step": 37890 }, { "entropy": 5.942363166809082, "epoch": 2.948375802373079, "grad_norm": 1.3359375, "learning_rate": 0.00041328394871624003, "loss": 5.0539, "mean_token_accuracy": 0.20344147682189942, "num_tokens": 65739196.0, "step": 37895 }, { "entropy": 5.9060554027557375, "epoch": 2.9487648317447968, "grad_norm": 1.3359375, "learning_rate": 0.0004132620844320948, "loss": 5.1157, "mean_token_accuracy": 0.19772998243570328, "num_tokens": 65748032.0, "step": 37900 }, { "entropy": 5.867882299423218, "epoch": 2.9491538611165145, "grad_norm": 1.2734375, "learning_rate": 0.0004132402180500425, "loss": 5.0247, "mean_token_accuracy": 0.19747343063354492, "num_tokens": 65756149.0, "step": 37905 }, { "entropy": 5.7582435131073, "epoch": 2.9495428904882317, "grad_norm": 1.234375, "learning_rate": 0.0004132183495704149, "loss": 4.9328, "mean_token_accuracy": 0.2111212953925133, "num_tokens": 65765275.0, "step": 37910 }, { "entropy": 5.781107091903687, "epoch": 2.9499319198599494, "grad_norm": 1.25, "learning_rate": 0.0004131964789935439, "loss": 4.985, "mean_token_accuracy": 0.20437317490577697, "num_tokens": 65773517.0, "step": 37915 }, { "entropy": 5.803519010543823, "epoch": 2.950320949231667, "grad_norm": 1.2265625, "learning_rate": 0.0004131746063197612, "loss": 5.0588, "mean_token_accuracy": 0.20204575806856157, "num_tokens": 65782728.0, "step": 37920 }, { "entropy": 5.8230376720428465, "epoch": 2.950709978603385, "grad_norm": 1.25, "learning_rate": 0.0004131527315493989, "loss": 5.0154, "mean_token_accuracy": 0.20229255855083467, "num_tokens": 65791460.0, "step": 37925 }, { "entropy": 5.867028141021729, "epoch": 2.951099007975102, "grad_norm": 1.3359375, "learning_rate": 0.00041313085468278873, "loss": 5.0374, "mean_token_accuracy": 0.20351543724536897, "num_tokens": 65799760.0, "step": 37930 }, { "entropy": 5.879566383361817, "epoch": 2.9514880373468197, "grad_norm": 1.25, "learning_rate": 0.0004131089757202627, "loss": 5.0958, "mean_token_accuracy": 0.19996506422758104, "num_tokens": 65808675.0, "step": 37935 }, { "entropy": 5.881805896759033, "epoch": 2.951877066718537, "grad_norm": 1.234375, "learning_rate": 0.00041308709466215276, "loss": 5.063, "mean_token_accuracy": 0.20561113506555556, "num_tokens": 65817372.0, "step": 37940 }, { "entropy": 5.771470546722412, "epoch": 2.9522660960902547, "grad_norm": 1.3125, "learning_rate": 0.000413065211508791, "loss": 5.0103, "mean_token_accuracy": 0.20785278379917144, "num_tokens": 65825899.0, "step": 37945 }, { "entropy": 5.750229597091675, "epoch": 2.9526551254619724, "grad_norm": 1.375, "learning_rate": 0.00041304332626050937, "loss": 4.9616, "mean_token_accuracy": 0.21219722628593446, "num_tokens": 65834357.0, "step": 37950 }, { "entropy": 5.766220951080323, "epoch": 2.95304415483369, "grad_norm": 1.2734375, "learning_rate": 0.00041302143891764, "loss": 4.9268, "mean_token_accuracy": 0.21969254016876222, "num_tokens": 65842869.0, "step": 37955 }, { "entropy": 5.749959802627563, "epoch": 2.9534331842054073, "grad_norm": 1.265625, "learning_rate": 0.000412999549480515, "loss": 4.8606, "mean_token_accuracy": 0.21479169130325318, "num_tokens": 65851378.0, "step": 37960 }, { "entropy": 5.812968921661377, "epoch": 2.953822213577125, "grad_norm": 1.2265625, "learning_rate": 0.0004129776579494665, "loss": 4.9445, "mean_token_accuracy": 0.20802685469388962, "num_tokens": 65860209.0, "step": 37965 }, { "entropy": 5.805966234207153, "epoch": 2.9542112429488427, "grad_norm": 1.359375, "learning_rate": 0.0004129557643248265, "loss": 5.0459, "mean_token_accuracy": 0.2047601193189621, "num_tokens": 65868313.0, "step": 37970 }, { "entropy": 5.762943601608276, "epoch": 2.95460027232056, "grad_norm": 1.515625, "learning_rate": 0.0004129338686069276, "loss": 4.942, "mean_token_accuracy": 0.21552699357271193, "num_tokens": 65876049.0, "step": 37975 }, { "entropy": 5.848810338973999, "epoch": 2.9549893016922777, "grad_norm": 1.375, "learning_rate": 0.0004129119707961016, "loss": 5.0595, "mean_token_accuracy": 0.20347446501255034, "num_tokens": 65884042.0, "step": 37980 }, { "entropy": 5.823304271697998, "epoch": 2.9553783310639954, "grad_norm": 1.296875, "learning_rate": 0.000412890070892681, "loss": 5.0243, "mean_token_accuracy": 0.20991072207689285, "num_tokens": 65892303.0, "step": 37985 }, { "entropy": 5.78401141166687, "epoch": 2.955767360435713, "grad_norm": 1.34375, "learning_rate": 0.000412868168896998, "loss": 5.0475, "mean_token_accuracy": 0.193398879468441, "num_tokens": 65900515.0, "step": 37990 }, { "entropy": 5.772557735443115, "epoch": 2.9561563898074303, "grad_norm": 1.296875, "learning_rate": 0.0004128462648093851, "loss": 4.9913, "mean_token_accuracy": 0.20448630154132844, "num_tokens": 65908609.0, "step": 37995 }, { "entropy": 5.845780372619629, "epoch": 2.956545419179148, "grad_norm": 1.359375, "learning_rate": 0.0004128243586301745, "loss": 4.9449, "mean_token_accuracy": 0.21213323026895523, "num_tokens": 65917803.0, "step": 38000 }, { "entropy": 5.786803960800171, "epoch": 2.9569344485508657, "grad_norm": 1.25, "learning_rate": 0.0004128024503596986, "loss": 4.955, "mean_token_accuracy": 0.20539263188838958, "num_tokens": 65926269.0, "step": 38005 }, { "entropy": 5.756941890716552, "epoch": 2.957323477922583, "grad_norm": 1.265625, "learning_rate": 0.00041278053999828986, "loss": 4.9418, "mean_token_accuracy": 0.2079220175743103, "num_tokens": 65934826.0, "step": 38010 }, { "entropy": 5.82415452003479, "epoch": 2.9577125072943007, "grad_norm": 1.25, "learning_rate": 0.0004127586275462806, "loss": 5.0052, "mean_token_accuracy": 0.20489151179790496, "num_tokens": 65943609.0, "step": 38015 }, { "entropy": 5.710185813903808, "epoch": 2.9581015366660184, "grad_norm": 1.1875, "learning_rate": 0.00041273671300400363, "loss": 4.9111, "mean_token_accuracy": 0.21219113618135452, "num_tokens": 65952244.0, "step": 38020 }, { "entropy": 5.750405883789062, "epoch": 2.958490566037736, "grad_norm": 1.1953125, "learning_rate": 0.00041271479637179116, "loss": 4.9395, "mean_token_accuracy": 0.2090214341878891, "num_tokens": 65960915.0, "step": 38025 }, { "entropy": 5.757425165176391, "epoch": 2.9588795954094533, "grad_norm": 1.2421875, "learning_rate": 0.0004126928776499759, "loss": 4.9372, "mean_token_accuracy": 0.21206235885620117, "num_tokens": 65969375.0, "step": 38030 }, { "entropy": 5.813358449935913, "epoch": 2.959268624781171, "grad_norm": 1.234375, "learning_rate": 0.0004126709568388903, "loss": 4.995, "mean_token_accuracy": 0.21130070835351944, "num_tokens": 65978724.0, "step": 38035 }, { "entropy": 5.851937484741211, "epoch": 2.9596576541528883, "grad_norm": 1.2890625, "learning_rate": 0.0004126490339388672, "loss": 5.0389, "mean_token_accuracy": 0.20050172358751298, "num_tokens": 65987255.0, "step": 38040 }, { "entropy": 5.840566682815552, "epoch": 2.960046683524606, "grad_norm": 1.3359375, "learning_rate": 0.000412627108950239, "loss": 5.1062, "mean_token_accuracy": 0.20407545566558838, "num_tokens": 65996193.0, "step": 38045 }, { "entropy": 5.858949279785156, "epoch": 2.9604357128963237, "grad_norm": 1.15625, "learning_rate": 0.0004126051818733385, "loss": 5.0857, "mean_token_accuracy": 0.20551228821277617, "num_tokens": 66005081.0, "step": 38050 }, { "entropy": 5.811345338821411, "epoch": 2.9608247422680414, "grad_norm": 1.1953125, "learning_rate": 0.0004125832527084984, "loss": 5.0599, "mean_token_accuracy": 0.20373188108205795, "num_tokens": 66014389.0, "step": 38055 }, { "entropy": 5.8832982063293455, "epoch": 2.961213771639759, "grad_norm": 1.3359375, "learning_rate": 0.00041256132145605143, "loss": 5.1016, "mean_token_accuracy": 0.20053936839103698, "num_tokens": 66022486.0, "step": 38060 }, { "entropy": 5.805521774291992, "epoch": 2.9616028010114763, "grad_norm": 1.234375, "learning_rate": 0.0004125393881163304, "loss": 4.9648, "mean_token_accuracy": 0.2047223448753357, "num_tokens": 66031058.0, "step": 38065 }, { "entropy": 5.756514596939087, "epoch": 2.961991830383194, "grad_norm": 1.3359375, "learning_rate": 0.00041251745268966797, "loss": 4.9243, "mean_token_accuracy": 0.20539276748895646, "num_tokens": 66038705.0, "step": 38070 }, { "entropy": 5.844672298431396, "epoch": 2.9623808597549113, "grad_norm": 1.34375, "learning_rate": 0.0004124955151763971, "loss": 4.9969, "mean_token_accuracy": 0.20948389023542405, "num_tokens": 66047231.0, "step": 38075 }, { "entropy": 5.81997504234314, "epoch": 2.962769889126629, "grad_norm": 1.234375, "learning_rate": 0.0004124735755768506, "loss": 5.0342, "mean_token_accuracy": 0.20159341990947724, "num_tokens": 66055536.0, "step": 38080 }, { "entropy": 5.8472301959991455, "epoch": 2.9631589184983467, "grad_norm": 1.2734375, "learning_rate": 0.0004124516338913615, "loss": 5.0622, "mean_token_accuracy": 0.19506220668554305, "num_tokens": 66065215.0, "step": 38085 }, { "entropy": 5.860423803329468, "epoch": 2.9635479478700644, "grad_norm": 1.296875, "learning_rate": 0.0004124296901202626, "loss": 5.0586, "mean_token_accuracy": 0.2044026583433151, "num_tokens": 66074455.0, "step": 38090 }, { "entropy": 5.875318908691407, "epoch": 2.9639369772417816, "grad_norm": 1.359375, "learning_rate": 0.00041240774426388685, "loss": 5.0208, "mean_token_accuracy": 0.19916004538536072, "num_tokens": 66082793.0, "step": 38095 }, { "entropy": 5.78303713798523, "epoch": 2.9643260066134993, "grad_norm": 1.328125, "learning_rate": 0.0004123857963225673, "loss": 4.9712, "mean_token_accuracy": 0.21020321547985077, "num_tokens": 66091503.0, "step": 38100 }, { "entropy": 5.815596055984497, "epoch": 2.964715035985217, "grad_norm": 1.296875, "learning_rate": 0.000412363846296637, "loss": 5.0272, "mean_token_accuracy": 0.20916155576705933, "num_tokens": 66099210.0, "step": 38105 }, { "entropy": 5.754657030105591, "epoch": 2.9651040653569343, "grad_norm": 1.2890625, "learning_rate": 0.000412341894186429, "loss": 4.9989, "mean_token_accuracy": 0.20170512795448303, "num_tokens": 66107338.0, "step": 38110 }, { "entropy": 5.784589672088623, "epoch": 2.965493094728652, "grad_norm": 1.28125, "learning_rate": 0.0004123199399922763, "loss": 5.0409, "mean_token_accuracy": 0.20100805014371873, "num_tokens": 66115962.0, "step": 38115 }, { "entropy": 5.765013694763184, "epoch": 2.9658821241003697, "grad_norm": 1.34375, "learning_rate": 0.00041229798371451203, "loss": 4.9931, "mean_token_accuracy": 0.2025275394320488, "num_tokens": 66123849.0, "step": 38120 }, { "entropy": 5.855650949478149, "epoch": 2.9662711534720874, "grad_norm": 1.265625, "learning_rate": 0.0004122760253534695, "loss": 5.0304, "mean_token_accuracy": 0.2008976772427559, "num_tokens": 66132791.0, "step": 38125 }, { "entropy": 5.887872648239136, "epoch": 2.9666601828438046, "grad_norm": 1.265625, "learning_rate": 0.0004122540649094817, "loss": 5.1165, "mean_token_accuracy": 0.20156443268060684, "num_tokens": 66141434.0, "step": 38130 }, { "entropy": 5.8039475440979, "epoch": 2.9670492122155223, "grad_norm": 1.234375, "learning_rate": 0.00041223210238288196, "loss": 5.0245, "mean_token_accuracy": 0.2071179449558258, "num_tokens": 66149941.0, "step": 38135 }, { "entropy": 5.8704945087432865, "epoch": 2.9674382415872396, "grad_norm": 1.21875, "learning_rate": 0.0004122101377740035, "loss": 5.0328, "mean_token_accuracy": 0.20251037925481796, "num_tokens": 66159411.0, "step": 38140 }, { "entropy": 5.815524482727051, "epoch": 2.9678272709589573, "grad_norm": 1.3125, "learning_rate": 0.0004121881710831796, "loss": 4.974, "mean_token_accuracy": 0.21091575622558595, "num_tokens": 66168504.0, "step": 38145 }, { "entropy": 5.851507043838501, "epoch": 2.968216300330675, "grad_norm": 1.296875, "learning_rate": 0.0004121662023107435, "loss": 5.0424, "mean_token_accuracy": 0.20674943625926973, "num_tokens": 66176777.0, "step": 38150 }, { "entropy": 5.806068563461304, "epoch": 2.9686053297023927, "grad_norm": 1.3203125, "learning_rate": 0.0004121442314570286, "loss": 4.9709, "mean_token_accuracy": 0.2041332095861435, "num_tokens": 66185028.0, "step": 38155 }, { "entropy": 5.830725765228271, "epoch": 2.9689943590741104, "grad_norm": 1.359375, "learning_rate": 0.00041212225852236834, "loss": 4.974, "mean_token_accuracy": 0.21149863451719284, "num_tokens": 66193139.0, "step": 38160 }, { "entropy": 5.835852527618409, "epoch": 2.9693833884458276, "grad_norm": 1.2890625, "learning_rate": 0.0004121002835070961, "loss": 5.067, "mean_token_accuracy": 0.2000282034277916, "num_tokens": 66202196.0, "step": 38165 }, { "entropy": 5.808925914764404, "epoch": 2.9697724178175453, "grad_norm": 1.25, "learning_rate": 0.0004120783064115452, "loss": 5.0252, "mean_token_accuracy": 0.20315721035003662, "num_tokens": 66209889.0, "step": 38170 }, { "entropy": 5.7886124610900875, "epoch": 2.9701614471892626, "grad_norm": 1.234375, "learning_rate": 0.0004120563272360492, "loss": 4.9887, "mean_token_accuracy": 0.2004638135433197, "num_tokens": 66218889.0, "step": 38175 }, { "entropy": 5.870897579193115, "epoch": 2.9705504765609803, "grad_norm": 1.3203125, "learning_rate": 0.0004120343459809416, "loss": 5.0797, "mean_token_accuracy": 0.20324015319347383, "num_tokens": 66227293.0, "step": 38180 }, { "entropy": 5.876148748397827, "epoch": 2.970939505932698, "grad_norm": 1.4296875, "learning_rate": 0.0004120123626465559, "loss": 5.0273, "mean_token_accuracy": 0.2086865335702896, "num_tokens": 66235322.0, "step": 38185 }, { "entropy": 5.8473135471344, "epoch": 2.9713285353044157, "grad_norm": 1.2265625, "learning_rate": 0.00041199037723322566, "loss": 5.0474, "mean_token_accuracy": 0.1990977257490158, "num_tokens": 66244776.0, "step": 38190 }, { "entropy": 5.7889721393585205, "epoch": 2.971717564676133, "grad_norm": 1.2421875, "learning_rate": 0.00041196838974128446, "loss": 4.9932, "mean_token_accuracy": 0.2035525068640709, "num_tokens": 66254058.0, "step": 38195 }, { "entropy": 5.8379798412323, "epoch": 2.9721065940478506, "grad_norm": 1.2578125, "learning_rate": 0.000411946400171066, "loss": 5.0969, "mean_token_accuracy": 0.20382908582687378, "num_tokens": 66262816.0, "step": 38200 }, { "entropy": 5.9071673393249515, "epoch": 2.9724956234195683, "grad_norm": 1.171875, "learning_rate": 0.00041192440852290385, "loss": 5.0859, "mean_token_accuracy": 0.19741087257862092, "num_tokens": 66271808.0, "step": 38205 }, { "entropy": 5.859216165542603, "epoch": 2.9728846527912856, "grad_norm": 1.25, "learning_rate": 0.0004119024147971318, "loss": 5.0014, "mean_token_accuracy": 0.20637826323509217, "num_tokens": 66280737.0, "step": 38210 }, { "entropy": 5.801422786712647, "epoch": 2.9732736821630033, "grad_norm": 1.15625, "learning_rate": 0.00041188041899408345, "loss": 4.9939, "mean_token_accuracy": 0.2070898547768593, "num_tokens": 66289970.0, "step": 38215 }, { "entropy": 5.857291555404663, "epoch": 2.973662711534721, "grad_norm": 1.3828125, "learning_rate": 0.0004118584211140926, "loss": 5.061, "mean_token_accuracy": 0.20229993909597396, "num_tokens": 66297917.0, "step": 38220 }, { "entropy": 5.77235517501831, "epoch": 2.9740517409064386, "grad_norm": 1.3203125, "learning_rate": 0.00041183642115749316, "loss": 4.9906, "mean_token_accuracy": 0.20838579088449477, "num_tokens": 66306094.0, "step": 38225 }, { "entropy": 5.79345474243164, "epoch": 2.974440770278156, "grad_norm": 1.1484375, "learning_rate": 0.00041181441912461873, "loss": 4.9606, "mean_token_accuracy": 0.21303750574588776, "num_tokens": 66315002.0, "step": 38230 }, { "entropy": 5.851683044433594, "epoch": 2.9748297996498736, "grad_norm": 1.265625, "learning_rate": 0.0004117924150158032, "loss": 4.976, "mean_token_accuracy": 0.20883897542953492, "num_tokens": 66322720.0, "step": 38235 }, { "entropy": 5.76937952041626, "epoch": 2.9752188290215913, "grad_norm": 1.203125, "learning_rate": 0.00041177040883138064, "loss": 4.9396, "mean_token_accuracy": 0.21242665499448776, "num_tokens": 66331478.0, "step": 38240 }, { "entropy": 5.882160758972168, "epoch": 2.9756078583933085, "grad_norm": 1.359375, "learning_rate": 0.00041174840057168474, "loss": 5.0637, "mean_token_accuracy": 0.20337686091661453, "num_tokens": 66339683.0, "step": 38245 }, { "entropy": 5.844421768188477, "epoch": 2.9759968877650262, "grad_norm": 1.3984375, "learning_rate": 0.0004117263902370495, "loss": 5.0241, "mean_token_accuracy": 0.20622842162847518, "num_tokens": 66347944.0, "step": 38250 }, { "entropy": 5.829503774642944, "epoch": 2.976385917136744, "grad_norm": 1.2578125, "learning_rate": 0.00041170437782780896, "loss": 5.1066, "mean_token_accuracy": 0.20311209857463836, "num_tokens": 66356947.0, "step": 38255 }, { "entropy": 5.752525711059571, "epoch": 2.9767749465084616, "grad_norm": 1.1484375, "learning_rate": 0.000411682363344297, "loss": 4.8722, "mean_token_accuracy": 0.20997137427330018, "num_tokens": 66365843.0, "step": 38260 }, { "entropy": 5.829859209060669, "epoch": 2.977163975880179, "grad_norm": 1.2890625, "learning_rate": 0.00041166034678684777, "loss": 5.116, "mean_token_accuracy": 0.19459507316350938, "num_tokens": 66375305.0, "step": 38265 }, { "entropy": 5.799845266342163, "epoch": 2.9775530052518966, "grad_norm": 1.359375, "learning_rate": 0.0004116383281557953, "loss": 5.0013, "mean_token_accuracy": 0.20652880370616913, "num_tokens": 66383758.0, "step": 38270 }, { "entropy": 5.772051429748535, "epoch": 2.977942034623614, "grad_norm": 1.140625, "learning_rate": 0.00041161630745147374, "loss": 4.9885, "mean_token_accuracy": 0.2079613447189331, "num_tokens": 66393538.0, "step": 38275 }, { "entropy": 5.8443769931793215, "epoch": 2.9783310639953315, "grad_norm": 1.296875, "learning_rate": 0.0004115942846742171, "loss": 5.0321, "mean_token_accuracy": 0.20438508242368697, "num_tokens": 66402395.0, "step": 38280 }, { "entropy": 5.82994589805603, "epoch": 2.9787200933670492, "grad_norm": 1.3203125, "learning_rate": 0.0004115722598243596, "loss": 4.9693, "mean_token_accuracy": 0.2011784255504608, "num_tokens": 66410671.0, "step": 38285 }, { "entropy": 5.852193307876587, "epoch": 2.979109122738767, "grad_norm": 1.3203125, "learning_rate": 0.00041155023290223537, "loss": 5.0507, "mean_token_accuracy": 0.20262469053268434, "num_tokens": 66419370.0, "step": 38290 }, { "entropy": 5.764391994476318, "epoch": 2.979498152110484, "grad_norm": 1.34375, "learning_rate": 0.0004115282039081788, "loss": 4.9688, "mean_token_accuracy": 0.21316221058368684, "num_tokens": 66427816.0, "step": 38295 }, { "entropy": 5.791408252716065, "epoch": 2.979887181482202, "grad_norm": 1.3203125, "learning_rate": 0.00041150617284252405, "loss": 4.9952, "mean_token_accuracy": 0.20855241864919663, "num_tokens": 66436371.0, "step": 38300 }, { "entropy": 5.86045355796814, "epoch": 2.9802762108539196, "grad_norm": 1.140625, "learning_rate": 0.0004114841397056053, "loss": 5.0571, "mean_token_accuracy": 0.20817727893590926, "num_tokens": 66445158.0, "step": 38305 }, { "entropy": 5.860354995727539, "epoch": 2.980665240225637, "grad_norm": 1.421875, "learning_rate": 0.00041146210449775704, "loss": 5.0234, "mean_token_accuracy": 0.20724112838506697, "num_tokens": 66454133.0, "step": 38310 }, { "entropy": 5.745707035064697, "epoch": 2.9810542695973545, "grad_norm": 1.3046875, "learning_rate": 0.0004114400672193136, "loss": 5.0296, "mean_token_accuracy": 0.20704961866140364, "num_tokens": 66462698.0, "step": 38315 }, { "entropy": 5.807286214828491, "epoch": 2.9814432989690722, "grad_norm": 1.2890625, "learning_rate": 0.00041141802787060923, "loss": 5.0322, "mean_token_accuracy": 0.205136039853096, "num_tokens": 66473145.0, "step": 38320 }, { "entropy": 5.860437679290771, "epoch": 2.98183232834079, "grad_norm": 1.234375, "learning_rate": 0.0004113959864519784, "loss": 5.0105, "mean_token_accuracy": 0.2037022516131401, "num_tokens": 66482481.0, "step": 38325 }, { "entropy": 5.871683597564697, "epoch": 2.982221357712507, "grad_norm": 1.203125, "learning_rate": 0.0004113739429637556, "loss": 4.9961, "mean_token_accuracy": 0.2225971907377243, "num_tokens": 66491338.0, "step": 38330 }, { "entropy": 5.804482269287109, "epoch": 2.982610387084225, "grad_norm": 1.2578125, "learning_rate": 0.0004113518974062753, "loss": 5.0772, "mean_token_accuracy": 0.21179619133472444, "num_tokens": 66500517.0, "step": 38335 }, { "entropy": 5.838915872573852, "epoch": 2.9829994164559426, "grad_norm": 1.1953125, "learning_rate": 0.000411329849779872, "loss": 4.9862, "mean_token_accuracy": 0.20882016867399217, "num_tokens": 66509431.0, "step": 38340 }, { "entropy": 5.803640604019165, "epoch": 2.98338844582766, "grad_norm": 1.359375, "learning_rate": 0.00041130780008488015, "loss": 5.0064, "mean_token_accuracy": 0.21008384376764297, "num_tokens": 66518111.0, "step": 38345 }, { "entropy": 5.773294830322266, "epoch": 2.9837774751993775, "grad_norm": 1.3359375, "learning_rate": 0.0004112857483216344, "loss": 4.9579, "mean_token_accuracy": 0.20589220374822617, "num_tokens": 66527325.0, "step": 38350 }, { "entropy": 5.807560014724731, "epoch": 2.9841665045710952, "grad_norm": 1.25, "learning_rate": 0.00041126369449046935, "loss": 4.9727, "mean_token_accuracy": 0.20548409968614578, "num_tokens": 66536542.0, "step": 38355 }, { "entropy": 5.851216459274292, "epoch": 2.984555533942813, "grad_norm": 1.34375, "learning_rate": 0.00041124163859171967, "loss": 5.0064, "mean_token_accuracy": 0.20158574283123015, "num_tokens": 66544724.0, "step": 38360 }, { "entropy": 5.853804016113282, "epoch": 2.98494456331453, "grad_norm": 1.3359375, "learning_rate": 0.0004112195806257199, "loss": 5.0812, "mean_token_accuracy": 0.20403656959533692, "num_tokens": 66553679.0, "step": 38365 }, { "entropy": 5.772175598144531, "epoch": 2.985333592686248, "grad_norm": 1.34375, "learning_rate": 0.0004111975205928049, "loss": 4.9382, "mean_token_accuracy": 0.20662160515785216, "num_tokens": 66562593.0, "step": 38370 }, { "entropy": 5.835263872146607, "epoch": 2.985722622057965, "grad_norm": 1.3359375, "learning_rate": 0.00041117545849330924, "loss": 4.9775, "mean_token_accuracy": 0.20973959416151047, "num_tokens": 66570947.0, "step": 38375 }, { "entropy": 5.802307748794556, "epoch": 2.986111651429683, "grad_norm": 1.2109375, "learning_rate": 0.00041115339432756776, "loss": 4.8916, "mean_token_accuracy": 0.2136720061302185, "num_tokens": 66579733.0, "step": 38380 }, { "entropy": 5.819054460525512, "epoch": 2.9865006808014005, "grad_norm": 1.1796875, "learning_rate": 0.0004111313280959152, "loss": 4.994, "mean_token_accuracy": 0.20773123502731322, "num_tokens": 66589252.0, "step": 38385 }, { "entropy": 5.759513807296753, "epoch": 2.986889710173118, "grad_norm": 1.2734375, "learning_rate": 0.00041110925979868647, "loss": 4.9687, "mean_token_accuracy": 0.21514253169298173, "num_tokens": 66597817.0, "step": 38390 }, { "entropy": 5.766794300079345, "epoch": 2.9872787395448355, "grad_norm": 1.265625, "learning_rate": 0.0004110871894362163, "loss": 4.9623, "mean_token_accuracy": 0.2122700557112694, "num_tokens": 66606154.0, "step": 38395 }, { "entropy": 5.837796926498413, "epoch": 2.987667768916553, "grad_norm": 1.2109375, "learning_rate": 0.00041106511700883975, "loss": 4.9885, "mean_token_accuracy": 0.21077273190021514, "num_tokens": 66614799.0, "step": 38400 }, { "entropy": 5.815525674819947, "epoch": 2.988056798288271, "grad_norm": 1.3671875, "learning_rate": 0.00041104304251689147, "loss": 4.9572, "mean_token_accuracy": 0.2093173399567604, "num_tokens": 66623250.0, "step": 38405 }, { "entropy": 5.722867202758789, "epoch": 2.988445827659988, "grad_norm": 1.296875, "learning_rate": 0.00041102096596070666, "loss": 4.8922, "mean_token_accuracy": 0.21746176928281785, "num_tokens": 66631948.0, "step": 38410 }, { "entropy": 5.762844038009644, "epoch": 2.988834857031706, "grad_norm": 1.1875, "learning_rate": 0.00041099888734062013, "loss": 4.9443, "mean_token_accuracy": 0.20811472982168197, "num_tokens": 66639864.0, "step": 38415 }, { "entropy": 5.8093348979949955, "epoch": 2.9892238864034235, "grad_norm": 1.34375, "learning_rate": 0.000410976806656967, "loss": 4.9569, "mean_token_accuracy": 0.208726267516613, "num_tokens": 66647758.0, "step": 38420 }, { "entropy": 5.847859668731689, "epoch": 2.989612915775141, "grad_norm": 1.4140625, "learning_rate": 0.0004109547239100822, "loss": 4.9671, "mean_token_accuracy": 0.21477610021829605, "num_tokens": 66655490.0, "step": 38425 }, { "entropy": 5.723924016952514, "epoch": 2.9900019451468585, "grad_norm": 1.3046875, "learning_rate": 0.0004109326391003009, "loss": 4.949, "mean_token_accuracy": 0.21224759817123412, "num_tokens": 66664264.0, "step": 38430 }, { "entropy": 5.792990446090698, "epoch": 2.990390974518576, "grad_norm": 1.328125, "learning_rate": 0.00041091055222795814, "loss": 4.9338, "mean_token_accuracy": 0.20295320600271224, "num_tokens": 66672595.0, "step": 38435 }, { "entropy": 5.829610538482666, "epoch": 2.990780003890294, "grad_norm": 1.2890625, "learning_rate": 0.0004108884632933891, "loss": 5.0146, "mean_token_accuracy": 0.20680088847875594, "num_tokens": 66680494.0, "step": 38440 }, { "entropy": 5.886165189743042, "epoch": 2.991169033262011, "grad_norm": 1.2265625, "learning_rate": 0.00041086637229692893, "loss": 5.0846, "mean_token_accuracy": 0.19897050708532332, "num_tokens": 66689462.0, "step": 38445 }, { "entropy": 5.858578491210937, "epoch": 2.991558062633729, "grad_norm": 1.2578125, "learning_rate": 0.00041084427923891275, "loss": 5.0002, "mean_token_accuracy": 0.20660516619682312, "num_tokens": 66697123.0, "step": 38450 }, { "entropy": 5.845050096511841, "epoch": 2.9919470920054465, "grad_norm": 1.2578125, "learning_rate": 0.00041082218411967586, "loss": 5.1091, "mean_token_accuracy": 0.19351996183395387, "num_tokens": 66705889.0, "step": 38455 }, { "entropy": 5.81690411567688, "epoch": 2.992336121377164, "grad_norm": 1.265625, "learning_rate": 0.00041080008693955355, "loss": 5.0132, "mean_token_accuracy": 0.2114890143275261, "num_tokens": 66713832.0, "step": 38460 }, { "entropy": 5.769218635559082, "epoch": 2.9927251507488815, "grad_norm": 1.296875, "learning_rate": 0.0004107779876988811, "loss": 4.9725, "mean_token_accuracy": 0.21637472361326218, "num_tokens": 66722594.0, "step": 38465 }, { "entropy": 5.83896837234497, "epoch": 2.993114180120599, "grad_norm": 1.3203125, "learning_rate": 0.00041075588639799375, "loss": 4.9235, "mean_token_accuracy": 0.21047940105199814, "num_tokens": 66731125.0, "step": 38470 }, { "entropy": 5.803531837463379, "epoch": 2.9935032094923164, "grad_norm": 1.2578125, "learning_rate": 0.0004107337830372269, "loss": 5.1221, "mean_token_accuracy": 0.20163467675447463, "num_tokens": 66739234.0, "step": 38475 }, { "entropy": 5.790473461151123, "epoch": 2.993892238864034, "grad_norm": 1.2890625, "learning_rate": 0.000410711677616916, "loss": 5.0056, "mean_token_accuracy": 0.2034662425518036, "num_tokens": 66747630.0, "step": 38480 }, { "entropy": 5.867070484161377, "epoch": 2.994281268235752, "grad_norm": 1.453125, "learning_rate": 0.0004106895701373963, "loss": 5.0363, "mean_token_accuracy": 0.20204291194677354, "num_tokens": 66755545.0, "step": 38485 }, { "entropy": 5.844150257110596, "epoch": 2.9946702976074695, "grad_norm": 1.3359375, "learning_rate": 0.00041066746059900336, "loss": 5.021, "mean_token_accuracy": 0.2079653948545456, "num_tokens": 66764336.0, "step": 38490 }, { "entropy": 5.823588895797729, "epoch": 2.995059326979187, "grad_norm": 1.359375, "learning_rate": 0.0004106453490020727, "loss": 5.0367, "mean_token_accuracy": 0.20857934802770614, "num_tokens": 66773045.0, "step": 38495 }, { "entropy": 5.807673120498658, "epoch": 2.9954483563509045, "grad_norm": 1.3984375, "learning_rate": 0.00041062323534693973, "loss": 4.9703, "mean_token_accuracy": 0.21049587279558182, "num_tokens": 66781228.0, "step": 38500 }, { "entropy": 5.892860460281372, "epoch": 2.995837385722622, "grad_norm": 1.296875, "learning_rate": 0.00041060111963394004, "loss": 5.0969, "mean_token_accuracy": 0.20815753936767578, "num_tokens": 66789829.0, "step": 38505 }, { "entropy": 5.860504007339477, "epoch": 2.9962264150943394, "grad_norm": 1.234375, "learning_rate": 0.00041057900186340917, "loss": 4.9574, "mean_token_accuracy": 0.21139210611581802, "num_tokens": 66798023.0, "step": 38510 }, { "entropy": 5.831308031082154, "epoch": 2.996615444466057, "grad_norm": 1.2578125, "learning_rate": 0.00041055688203568274, "loss": 4.9775, "mean_token_accuracy": 0.21080498695373534, "num_tokens": 66806536.0, "step": 38515 }, { "entropy": 5.813809633255005, "epoch": 2.997004473837775, "grad_norm": 1.421875, "learning_rate": 0.0004105347601510964, "loss": 4.9397, "mean_token_accuracy": 0.20484142303466796, "num_tokens": 66815698.0, "step": 38520 }, { "entropy": 5.794840478897095, "epoch": 2.9973935032094925, "grad_norm": 1.1953125, "learning_rate": 0.0004105126362099859, "loss": 4.9797, "mean_token_accuracy": 0.2038421154022217, "num_tokens": 66824358.0, "step": 38525 }, { "entropy": 5.813934755325318, "epoch": 2.9977825325812097, "grad_norm": 1.25, "learning_rate": 0.0004104905102126867, "loss": 4.9827, "mean_token_accuracy": 0.2109039232134819, "num_tokens": 66832895.0, "step": 38530 }, { "entropy": 5.79021725654602, "epoch": 2.9981715619529274, "grad_norm": 1.171875, "learning_rate": 0.0004104683821595347, "loss": 4.9361, "mean_token_accuracy": 0.20526452958583832, "num_tokens": 66842289.0, "step": 38535 }, { "entropy": 5.790495872497559, "epoch": 2.998560591324645, "grad_norm": 1.296875, "learning_rate": 0.00041044625205086566, "loss": 4.9731, "mean_token_accuracy": 0.20876385271549225, "num_tokens": 66850656.0, "step": 38540 }, { "entropy": 5.77311897277832, "epoch": 2.9989496206963624, "grad_norm": 1.2578125, "learning_rate": 0.00041042411988701535, "loss": 4.9073, "mean_token_accuracy": 0.21063147634267806, "num_tokens": 66859518.0, "step": 38545 }, { "entropy": 5.742673683166504, "epoch": 2.99933865006808, "grad_norm": 1.25, "learning_rate": 0.00041040198566831944, "loss": 5.0009, "mean_token_accuracy": 0.20628873705863954, "num_tokens": 66868431.0, "step": 38550 }, { "entropy": 5.813263177871704, "epoch": 2.999727679439798, "grad_norm": 1.2578125, "learning_rate": 0.0004103798493951141, "loss": 5.0071, "mean_token_accuracy": 0.2079155772924423, "num_tokens": 66877255.0, "step": 38555 }, { "entropy": 5.8732954661051435, "epoch": 3.0000778058743434, "grad_norm": 1.2890625, "learning_rate": 0.00041035771106773483, "loss": 4.9564, "mean_token_accuracy": 0.20959726803832585, "num_tokens": 66884881.0, "step": 38560 }, { "entropy": 5.820796775817871, "epoch": 3.000466835246061, "grad_norm": 1.2421875, "learning_rate": 0.0004103355706865179, "loss": 4.9698, "mean_token_accuracy": 0.21446372717618942, "num_tokens": 66893369.0, "step": 38565 }, { "entropy": 5.806730651855469, "epoch": 3.0008558646177788, "grad_norm": 1.296875, "learning_rate": 0.000410313428251799, "loss": 4.937, "mean_token_accuracy": 0.21228551864624023, "num_tokens": 66900994.0, "step": 38570 }, { "entropy": 5.770044374465942, "epoch": 3.001244893989496, "grad_norm": 1.2265625, "learning_rate": 0.00041029128376391424, "loss": 4.9606, "mean_token_accuracy": 0.20944125652313234, "num_tokens": 66909906.0, "step": 38575 }, { "entropy": 5.80250768661499, "epoch": 3.0016339233612137, "grad_norm": 1.3046875, "learning_rate": 0.00041026913722319954, "loss": 4.9296, "mean_token_accuracy": 0.21875356882810593, "num_tokens": 66918712.0, "step": 38580 }, { "entropy": 5.846242761611938, "epoch": 3.0020229527329314, "grad_norm": 1.265625, "learning_rate": 0.000410246988629991, "loss": 4.9543, "mean_token_accuracy": 0.20791738629341125, "num_tokens": 66927462.0, "step": 38585 }, { "entropy": 5.7267364978790285, "epoch": 3.002411982104649, "grad_norm": 1.1953125, "learning_rate": 0.00041022483798462466, "loss": 4.8682, "mean_token_accuracy": 0.21656473278999328, "num_tokens": 66935920.0, "step": 38590 }, { "entropy": 5.762704515457154, "epoch": 3.0028010114763664, "grad_norm": 1.234375, "learning_rate": 0.0004102026852874367, "loss": 4.9329, "mean_token_accuracy": 0.21821916550397874, "num_tokens": 66944595.0, "step": 38595 }, { "entropy": 5.861315679550171, "epoch": 3.003190040848084, "grad_norm": 1.1875, "learning_rate": 0.00041018053053876316, "loss": 5.12, "mean_token_accuracy": 0.2037678211927414, "num_tokens": 66954025.0, "step": 38600 }, { "entropy": 5.82306694984436, "epoch": 3.0035790702198017, "grad_norm": 1.1953125, "learning_rate": 0.0004101583737389402, "loss": 4.9131, "mean_token_accuracy": 0.21962472349405288, "num_tokens": 66963143.0, "step": 38605 }, { "entropy": 5.8677215576171875, "epoch": 3.003968099591519, "grad_norm": 1.28125, "learning_rate": 0.00041013621488830406, "loss": 5.028, "mean_token_accuracy": 0.20667544305324553, "num_tokens": 66972619.0, "step": 38610 }, { "entropy": 5.78109827041626, "epoch": 3.0043571289632367, "grad_norm": 1.2890625, "learning_rate": 0.00041011405398719096, "loss": 4.8982, "mean_token_accuracy": 0.21780141741037368, "num_tokens": 66980749.0, "step": 38615 }, { "entropy": 5.8513952732086185, "epoch": 3.0047461583349544, "grad_norm": 1.2734375, "learning_rate": 0.00041009189103593716, "loss": 4.9593, "mean_token_accuracy": 0.2091781660914421, "num_tokens": 66989656.0, "step": 38620 }, { "entropy": 5.806668281555176, "epoch": 3.0051351877066717, "grad_norm": 1.21875, "learning_rate": 0.0004100697260348789, "loss": 4.9394, "mean_token_accuracy": 0.21583760380744935, "num_tokens": 66998308.0, "step": 38625 }, { "entropy": 5.870392227172852, "epoch": 3.0055242170783893, "grad_norm": 1.1484375, "learning_rate": 0.00041004755898435254, "loss": 4.9918, "mean_token_accuracy": 0.2033906638622284, "num_tokens": 67007596.0, "step": 38630 }, { "entropy": 5.718611574172973, "epoch": 3.005913246450107, "grad_norm": 1.25, "learning_rate": 0.0004100253898846945, "loss": 4.8844, "mean_token_accuracy": 0.2201899468898773, "num_tokens": 67016137.0, "step": 38635 }, { "entropy": 5.835782814025879, "epoch": 3.0063022758218247, "grad_norm": 1.2578125, "learning_rate": 0.000410003218736241, "loss": 5.0721, "mean_token_accuracy": 0.20686845481395721, "num_tokens": 67024839.0, "step": 38640 }, { "entropy": 5.848434114456177, "epoch": 3.006691305193542, "grad_norm": 1.34375, "learning_rate": 0.00040998104553932856, "loss": 4.9515, "mean_token_accuracy": 0.2058714136481285, "num_tokens": 67033572.0, "step": 38645 }, { "entropy": 5.857256603240967, "epoch": 3.0070803345652597, "grad_norm": 1.359375, "learning_rate": 0.0004099588702942936, "loss": 4.9472, "mean_token_accuracy": 0.2129300743341446, "num_tokens": 67042355.0, "step": 38650 }, { "entropy": 5.781149244308471, "epoch": 3.0074693639369774, "grad_norm": 1.28125, "learning_rate": 0.00040993669300147257, "loss": 4.8967, "mean_token_accuracy": 0.209248349070549, "num_tokens": 67050418.0, "step": 38655 }, { "entropy": 5.81992998123169, "epoch": 3.0078583933086946, "grad_norm": 1.234375, "learning_rate": 0.00040991451366120205, "loss": 5.0476, "mean_token_accuracy": 0.19984836876392365, "num_tokens": 67059846.0, "step": 38660 }, { "entropy": 5.867749738693237, "epoch": 3.0082474226804123, "grad_norm": 1.2421875, "learning_rate": 0.0004098923322738185, "loss": 4.9948, "mean_token_accuracy": 0.2110414147377014, "num_tokens": 67068680.0, "step": 38665 }, { "entropy": 5.776160335540771, "epoch": 3.00863645205213, "grad_norm": 1.171875, "learning_rate": 0.00040987014883965843, "loss": 4.9027, "mean_token_accuracy": 0.21377013027668, "num_tokens": 67077607.0, "step": 38670 }, { "entropy": 5.809245538711548, "epoch": 3.0090254814238473, "grad_norm": 1.25, "learning_rate": 0.00040984796335905867, "loss": 4.9879, "mean_token_accuracy": 0.20853404253721236, "num_tokens": 67086553.0, "step": 38675 }, { "entropy": 5.895388746261597, "epoch": 3.009414510795565, "grad_norm": 1.3359375, "learning_rate": 0.0004098257758323556, "loss": 4.985, "mean_token_accuracy": 0.2156752660870552, "num_tokens": 67095543.0, "step": 38680 }, { "entropy": 5.808364582061768, "epoch": 3.0098035401672827, "grad_norm": 1.3125, "learning_rate": 0.0004098035862598859, "loss": 5.0516, "mean_token_accuracy": 0.20129741430282594, "num_tokens": 67103831.0, "step": 38685 }, { "entropy": 5.799151420593262, "epoch": 3.0101925695390004, "grad_norm": 1.1953125, "learning_rate": 0.0004097813946419865, "loss": 4.9459, "mean_token_accuracy": 0.20996808111667634, "num_tokens": 67112289.0, "step": 38690 }, { "entropy": 5.801869583129883, "epoch": 3.0105815989107176, "grad_norm": 1.2421875, "learning_rate": 0.0004097592009789939, "loss": 5.0146, "mean_token_accuracy": 0.20646202564239502, "num_tokens": 67120376.0, "step": 38695 }, { "entropy": 5.863368654251099, "epoch": 3.0109706282824353, "grad_norm": 1.3125, "learning_rate": 0.00040973700527124494, "loss": 5.0481, "mean_token_accuracy": 0.20137663036584855, "num_tokens": 67128412.0, "step": 38700 }, { "entropy": 5.775389862060547, "epoch": 3.011359657654153, "grad_norm": 1.3671875, "learning_rate": 0.00040971480751907633, "loss": 4.8353, "mean_token_accuracy": 0.21419100761413573, "num_tokens": 67136212.0, "step": 38705 }, { "entropy": 5.793587398529053, "epoch": 3.0117486870258703, "grad_norm": 1.3125, "learning_rate": 0.00040969260772282494, "loss": 5.0356, "mean_token_accuracy": 0.2053624778985977, "num_tokens": 67145206.0, "step": 38710 }, { "entropy": 5.80336365699768, "epoch": 3.012137716397588, "grad_norm": 1.2421875, "learning_rate": 0.0004096704058828277, "loss": 4.935, "mean_token_accuracy": 0.20755007565021516, "num_tokens": 67153760.0, "step": 38715 }, { "entropy": 5.912252902984619, "epoch": 3.0125267457693057, "grad_norm": 1.375, "learning_rate": 0.00040964820199942135, "loss": 5.0087, "mean_token_accuracy": 0.20961494743824005, "num_tokens": 67162574.0, "step": 38720 }, { "entropy": 5.854893636703491, "epoch": 3.012915775141023, "grad_norm": 1.2109375, "learning_rate": 0.0004096259960729428, "loss": 4.9802, "mean_token_accuracy": 0.20706947147846222, "num_tokens": 67171329.0, "step": 38725 }, { "entropy": 5.824176216125489, "epoch": 3.0133048045127406, "grad_norm": 1.25, "learning_rate": 0.00040960378810372906, "loss": 4.9576, "mean_token_accuracy": 0.20258052200078963, "num_tokens": 67180243.0, "step": 38730 }, { "entropy": 5.729430198669434, "epoch": 3.0136938338844583, "grad_norm": 1.296875, "learning_rate": 0.0004095815780921171, "loss": 4.8215, "mean_token_accuracy": 0.22056725472211838, "num_tokens": 67189610.0, "step": 38735 }, { "entropy": 5.8282819271087645, "epoch": 3.014082863256176, "grad_norm": 1.2734375, "learning_rate": 0.0004095593660384439, "loss": 5.0346, "mean_token_accuracy": 0.20375740826129912, "num_tokens": 67199084.0, "step": 38740 }, { "entropy": 5.807944965362549, "epoch": 3.0144718926278933, "grad_norm": 1.2421875, "learning_rate": 0.0004095371519430465, "loss": 4.9573, "mean_token_accuracy": 0.20990421921014785, "num_tokens": 67207705.0, "step": 38745 }, { "entropy": 5.857130813598633, "epoch": 3.014860921999611, "grad_norm": 1.234375, "learning_rate": 0.00040951493580626195, "loss": 4.9601, "mean_token_accuracy": 0.2063715785741806, "num_tokens": 67215576.0, "step": 38750 }, { "entropy": 5.76645073890686, "epoch": 3.0152499513713287, "grad_norm": 1.3984375, "learning_rate": 0.0004094927176284273, "loss": 4.8771, "mean_token_accuracy": 0.20913272947072983, "num_tokens": 67223700.0, "step": 38755 }, { "entropy": 5.825154876708984, "epoch": 3.015638980743046, "grad_norm": 1.34375, "learning_rate": 0.00040947049740987977, "loss": 4.9835, "mean_token_accuracy": 0.21304094791412354, "num_tokens": 67231878.0, "step": 38760 }, { "entropy": 5.82283763885498, "epoch": 3.0160280101147636, "grad_norm": 1.3125, "learning_rate": 0.0004094482751509565, "loss": 4.919, "mean_token_accuracy": 0.20861431509256362, "num_tokens": 67240174.0, "step": 38765 }, { "entropy": 5.859723234176636, "epoch": 3.0164170394864813, "grad_norm": 1.3828125, "learning_rate": 0.0004094260508519947, "loss": 5.0328, "mean_token_accuracy": 0.21041592061519623, "num_tokens": 67248617.0, "step": 38770 }, { "entropy": 5.878376626968384, "epoch": 3.0168060688581986, "grad_norm": 1.3359375, "learning_rate": 0.00040940382451333144, "loss": 5.0794, "mean_token_accuracy": 0.2061728999018669, "num_tokens": 67258581.0, "step": 38775 }, { "entropy": 5.9155456066131595, "epoch": 3.0171950982299163, "grad_norm": 1.2734375, "learning_rate": 0.00040938159613530405, "loss": 5.0413, "mean_token_accuracy": 0.2138422966003418, "num_tokens": 67267854.0, "step": 38780 }, { "entropy": 5.848206996917725, "epoch": 3.017584127601634, "grad_norm": 1.2890625, "learning_rate": 0.0004093593657182499, "loss": 4.9413, "mean_token_accuracy": 0.21178372204303741, "num_tokens": 67277391.0, "step": 38785 }, { "entropy": 5.791252756118775, "epoch": 3.0179731569733517, "grad_norm": 1.28125, "learning_rate": 0.0004093371332625062, "loss": 4.9707, "mean_token_accuracy": 0.20981811732053757, "num_tokens": 67285460.0, "step": 38790 }, { "entropy": 5.831331729888916, "epoch": 3.018362186345069, "grad_norm": 1.3046875, "learning_rate": 0.0004093148987684103, "loss": 4.9704, "mean_token_accuracy": 0.20694383680820466, "num_tokens": 67294023.0, "step": 38795 }, { "entropy": 5.8077614307403564, "epoch": 3.0187512157167866, "grad_norm": 1.3046875, "learning_rate": 0.00040929266223629966, "loss": 4.8776, "mean_token_accuracy": 0.20911927223205568, "num_tokens": 67302053.0, "step": 38800 }, { "entropy": 5.826122188568116, "epoch": 3.0191402450885043, "grad_norm": 1.296875, "learning_rate": 0.00040927042366651164, "loss": 5.0653, "mean_token_accuracy": 0.2019258052110672, "num_tokens": 67310478.0, "step": 38805 }, { "entropy": 5.80563702583313, "epoch": 3.0195292744602216, "grad_norm": 1.3359375, "learning_rate": 0.00040924818305938354, "loss": 4.93, "mean_token_accuracy": 0.21595605164766313, "num_tokens": 67318096.0, "step": 38810 }, { "entropy": 5.810717153549194, "epoch": 3.0199183038319393, "grad_norm": 1.3828125, "learning_rate": 0.00040922594041525303, "loss": 4.9994, "mean_token_accuracy": 0.2034677043557167, "num_tokens": 67326760.0, "step": 38815 }, { "entropy": 5.7640584945678714, "epoch": 3.020307333203657, "grad_norm": 1.2421875, "learning_rate": 0.0004092036957344574, "loss": 4.9069, "mean_token_accuracy": 0.21186792999505996, "num_tokens": 67335982.0, "step": 38820 }, { "entropy": 5.772571420669555, "epoch": 3.0206963625753747, "grad_norm": 1.3515625, "learning_rate": 0.00040918144901733443, "loss": 4.9515, "mean_token_accuracy": 0.2084176316857338, "num_tokens": 67344666.0, "step": 38825 }, { "entropy": 5.855813503265381, "epoch": 3.021085391947092, "grad_norm": 1.3359375, "learning_rate": 0.0004091592002642215, "loss": 5.0254, "mean_token_accuracy": 0.20823420733213424, "num_tokens": 67352607.0, "step": 38830 }, { "entropy": 5.881129264831543, "epoch": 3.0214744213188096, "grad_norm": 1.296875, "learning_rate": 0.0004091369494754562, "loss": 5.0041, "mean_token_accuracy": 0.20866356641054154, "num_tokens": 67361097.0, "step": 38835 }, { "entropy": 5.7675717830657955, "epoch": 3.0218634506905273, "grad_norm": 1.21875, "learning_rate": 0.0004091146966513763, "loss": 4.9558, "mean_token_accuracy": 0.20188004672527313, "num_tokens": 67370229.0, "step": 38840 }, { "entropy": 5.766801023483277, "epoch": 3.0222524800622446, "grad_norm": 1.21875, "learning_rate": 0.00040909244179231926, "loss": 4.9636, "mean_token_accuracy": 0.21366574466228486, "num_tokens": 67379226.0, "step": 38845 }, { "entropy": 5.777174854278565, "epoch": 3.0226415094339623, "grad_norm": 1.265625, "learning_rate": 0.0004090701848986229, "loss": 4.8809, "mean_token_accuracy": 0.21997925788164138, "num_tokens": 67388048.0, "step": 38850 }, { "entropy": 5.814140033721924, "epoch": 3.02303053880568, "grad_norm": 1.2109375, "learning_rate": 0.0004090479259706247, "loss": 4.829, "mean_token_accuracy": 0.21382132321596145, "num_tokens": 67396545.0, "step": 38855 }, { "entropy": 5.769040489196778, "epoch": 3.023419568177397, "grad_norm": 1.2890625, "learning_rate": 0.0004090256650086628, "loss": 4.901, "mean_token_accuracy": 0.21297713369131088, "num_tokens": 67405128.0, "step": 38860 }, { "entropy": 5.804767513275147, "epoch": 3.023808597549115, "grad_norm": 1.2734375, "learning_rate": 0.00040900340201307475, "loss": 5.0214, "mean_token_accuracy": 0.2125364676117897, "num_tokens": 67414231.0, "step": 38865 }, { "entropy": 5.795116281509399, "epoch": 3.0241976269208326, "grad_norm": 1.2578125, "learning_rate": 0.00040898113698419823, "loss": 4.9846, "mean_token_accuracy": 0.20727591663599015, "num_tokens": 67423023.0, "step": 38870 }, { "entropy": 5.847828340530396, "epoch": 3.0245866562925503, "grad_norm": 1.4765625, "learning_rate": 0.0004089588699223713, "loss": 5.0139, "mean_token_accuracy": 0.2003832772374153, "num_tokens": 67431377.0, "step": 38875 }, { "entropy": 5.8501341342926025, "epoch": 3.0249756856642676, "grad_norm": 1.2734375, "learning_rate": 0.00040893660082793167, "loss": 5.039, "mean_token_accuracy": 0.20102416723966599, "num_tokens": 67439888.0, "step": 38880 }, { "entropy": 5.89390230178833, "epoch": 3.0253647150359853, "grad_norm": 1.265625, "learning_rate": 0.00040891432970121736, "loss": 4.9913, "mean_token_accuracy": 0.20649498850107192, "num_tokens": 67448174.0, "step": 38885 }, { "entropy": 5.843033504486084, "epoch": 3.025753744407703, "grad_norm": 1.328125, "learning_rate": 0.00040889205654256615, "loss": 4.9893, "mean_token_accuracy": 0.20673566609621047, "num_tokens": 67456562.0, "step": 38890 }, { "entropy": 5.873806571960449, "epoch": 3.02614277377942, "grad_norm": 1.3125, "learning_rate": 0.00040886978135231625, "loss": 5.0211, "mean_token_accuracy": 0.20730582773685455, "num_tokens": 67465518.0, "step": 38895 }, { "entropy": 5.864649820327759, "epoch": 3.026531803151138, "grad_norm": 1.2421875, "learning_rate": 0.00040884750413080535, "loss": 4.9836, "mean_token_accuracy": 0.20669220238924027, "num_tokens": 67474988.0, "step": 38900 }, { "entropy": 5.739325523376465, "epoch": 3.0269208325228556, "grad_norm": 1.3359375, "learning_rate": 0.00040882522487837176, "loss": 4.8562, "mean_token_accuracy": 0.21792981624603272, "num_tokens": 67484097.0, "step": 38905 }, { "entropy": 5.8093891620635985, "epoch": 3.027309861894573, "grad_norm": 1.28125, "learning_rate": 0.00040880294359535327, "loss": 4.9257, "mean_token_accuracy": 0.20927488058805466, "num_tokens": 67493348.0, "step": 38910 }, { "entropy": 5.834283447265625, "epoch": 3.0276988912662905, "grad_norm": 1.34375, "learning_rate": 0.00040878066028208804, "loss": 4.9079, "mean_token_accuracy": 0.21435246765613555, "num_tokens": 67501586.0, "step": 38915 }, { "entropy": 5.881344032287598, "epoch": 3.0280879206380082, "grad_norm": 1.296875, "learning_rate": 0.00040875837493891434, "loss": 5.0769, "mean_token_accuracy": 0.2027055189013481, "num_tokens": 67510416.0, "step": 38920 }, { "entropy": 5.757195520401001, "epoch": 3.028476950009726, "grad_norm": 1.296875, "learning_rate": 0.0004087360875661701, "loss": 4.856, "mean_token_accuracy": 0.21772555112838746, "num_tokens": 67518974.0, "step": 38925 }, { "entropy": 5.734735012054443, "epoch": 3.028865979381443, "grad_norm": 1.3203125, "learning_rate": 0.00040871379816419376, "loss": 4.9527, "mean_token_accuracy": 0.2007041797041893, "num_tokens": 67528194.0, "step": 38930 }, { "entropy": 5.837574100494384, "epoch": 3.029255008753161, "grad_norm": 1.3125, "learning_rate": 0.0004086915067333232, "loss": 4.996, "mean_token_accuracy": 0.21031927466392517, "num_tokens": 67536884.0, "step": 38935 }, { "entropy": 5.8759246349334715, "epoch": 3.0296440381248786, "grad_norm": 1.3515625, "learning_rate": 0.0004086692132738968, "loss": 4.9735, "mean_token_accuracy": 0.207813760638237, "num_tokens": 67544969.0, "step": 38940 }, { "entropy": 5.930097341537476, "epoch": 3.030033067496596, "grad_norm": 1.2109375, "learning_rate": 0.000408646917786253, "loss": 5.1723, "mean_token_accuracy": 0.19234495759010314, "num_tokens": 67555681.0, "step": 38945 }, { "entropy": 5.860834121704102, "epoch": 3.0304220968683135, "grad_norm": 1.25, "learning_rate": 0.0004086246202707298, "loss": 4.9084, "mean_token_accuracy": 0.21847247779369355, "num_tokens": 67564346.0, "step": 38950 }, { "entropy": 5.832881593704224, "epoch": 3.0308111262400312, "grad_norm": 1.53125, "learning_rate": 0.00040860232072766577, "loss": 5.0275, "mean_token_accuracy": 0.20158557295799256, "num_tokens": 67573497.0, "step": 38955 }, { "entropy": 5.828227472305298, "epoch": 3.0312001556117485, "grad_norm": 1.3046875, "learning_rate": 0.0004085800191573991, "loss": 4.9283, "mean_token_accuracy": 0.21165926605463029, "num_tokens": 67581842.0, "step": 38960 }, { "entropy": 5.835940742492676, "epoch": 3.031589184983466, "grad_norm": 1.4453125, "learning_rate": 0.0004085577155602683, "loss": 5.0135, "mean_token_accuracy": 0.20788875073194504, "num_tokens": 67590763.0, "step": 38965 }, { "entropy": 5.82449779510498, "epoch": 3.031978214355184, "grad_norm": 1.328125, "learning_rate": 0.00040853540993661175, "loss": 5.05, "mean_token_accuracy": 0.1979548454284668, "num_tokens": 67599232.0, "step": 38970 }, { "entropy": 5.827770519256592, "epoch": 3.0323672437269016, "grad_norm": 1.1484375, "learning_rate": 0.00040851310228676787, "loss": 4.9788, "mean_token_accuracy": 0.21156167536973952, "num_tokens": 67608314.0, "step": 38975 }, { "entropy": 5.839980268478394, "epoch": 3.032756273098619, "grad_norm": 1.265625, "learning_rate": 0.0004084907926110752, "loss": 4.9091, "mean_token_accuracy": 0.2161184161901474, "num_tokens": 67616902.0, "step": 38980 }, { "entropy": 5.789211940765381, "epoch": 3.0331453024703365, "grad_norm": 1.3515625, "learning_rate": 0.0004084684809098722, "loss": 4.9825, "mean_token_accuracy": 0.21209703236818314, "num_tokens": 67625163.0, "step": 38985 }, { "entropy": 5.738745260238647, "epoch": 3.0335343318420542, "grad_norm": 1.3203125, "learning_rate": 0.00040844616718349743, "loss": 4.9047, "mean_token_accuracy": 0.21769861727952958, "num_tokens": 67632997.0, "step": 38990 }, { "entropy": 5.817039823532104, "epoch": 3.0339233612137715, "grad_norm": 1.3046875, "learning_rate": 0.00040842385143228946, "loss": 4.9109, "mean_token_accuracy": 0.21328484863042832, "num_tokens": 67640813.0, "step": 38995 }, { "entropy": 5.784450721740723, "epoch": 3.034312390585489, "grad_norm": 1.234375, "learning_rate": 0.00040840153365658693, "loss": 4.9078, "mean_token_accuracy": 0.2148588240146637, "num_tokens": 67649701.0, "step": 39000 }, { "epoch": 3.034312390585489, "eval_entropy": 5.529974334393704, "eval_loss": 5.0711822509765625, "eval_mean_token_accuracy": 0.21438223907905088, "eval_num_tokens": 67649701.0, "eval_runtime": 21.6194, "eval_samples_per_second": 1922.255, "eval_steps_per_second": 240.294, "step": 39000 }, { "entropy": 5.7857208251953125, "epoch": 3.034701419957207, "grad_norm": 1.2578125, "learning_rate": 0.00040837921385672855, "loss": 4.994, "mean_token_accuracy": 0.21321100741624832, "num_tokens": 67658663.0, "step": 39005 }, { "entropy": 5.84175214767456, "epoch": 3.035090449328924, "grad_norm": 1.25, "learning_rate": 0.00040835689203305275, "loss": 4.9695, "mean_token_accuracy": 0.2097387731075287, "num_tokens": 67667091.0, "step": 39010 }, { "entropy": 5.822213888168335, "epoch": 3.035479478700642, "grad_norm": 1.34375, "learning_rate": 0.00040833456818589845, "loss": 4.9191, "mean_token_accuracy": 0.20974235534667968, "num_tokens": 67675413.0, "step": 39015 }, { "entropy": 5.809333658218383, "epoch": 3.0358685080723595, "grad_norm": 1.25, "learning_rate": 0.00040831224231560424, "loss": 4.973, "mean_token_accuracy": 0.21274153590202333, "num_tokens": 67684215.0, "step": 39020 }, { "entropy": 5.808569431304932, "epoch": 3.0362575374440772, "grad_norm": 1.609375, "learning_rate": 0.000408289914422509, "loss": 5.0449, "mean_token_accuracy": 0.20571707487106322, "num_tokens": 67692901.0, "step": 39025 }, { "entropy": 5.850010776519776, "epoch": 3.0366465668157945, "grad_norm": 1.375, "learning_rate": 0.0004082675845069515, "loss": 4.9296, "mean_token_accuracy": 0.21396350115537643, "num_tokens": 67701248.0, "step": 39030 }, { "entropy": 5.895647764205933, "epoch": 3.037035596187512, "grad_norm": 1.359375, "learning_rate": 0.0004082452525692704, "loss": 4.9961, "mean_token_accuracy": 0.20708965510129929, "num_tokens": 67709893.0, "step": 39035 }, { "entropy": 5.828452157974243, "epoch": 3.03742462555923, "grad_norm": 1.296875, "learning_rate": 0.00040822291860980484, "loss": 4.9661, "mean_token_accuracy": 0.21064845472574234, "num_tokens": 67718139.0, "step": 39040 }, { "entropy": 5.817484283447266, "epoch": 3.037813654930947, "grad_norm": 1.265625, "learning_rate": 0.00040820058262889343, "loss": 4.9742, "mean_token_accuracy": 0.20650716125965118, "num_tokens": 67726433.0, "step": 39045 }, { "entropy": 5.79857611656189, "epoch": 3.038202684302665, "grad_norm": 1.1875, "learning_rate": 0.00040817824462687516, "loss": 4.9507, "mean_token_accuracy": 0.20646706968545914, "num_tokens": 67735473.0, "step": 39050 }, { "entropy": 5.808203029632568, "epoch": 3.0385917136743825, "grad_norm": 1.234375, "learning_rate": 0.00040815590460408906, "loss": 4.818, "mean_token_accuracy": 0.2121747151017189, "num_tokens": 67743627.0, "step": 39055 }, { "entropy": 5.79123821258545, "epoch": 3.0389807430460998, "grad_norm": 1.328125, "learning_rate": 0.00040813356256087395, "loss": 4.9003, "mean_token_accuracy": 0.21501027345657348, "num_tokens": 67752160.0, "step": 39060 }, { "entropy": 5.740716743469238, "epoch": 3.0393697724178175, "grad_norm": 1.2890625, "learning_rate": 0.0004081112184975691, "loss": 4.9001, "mean_token_accuracy": 0.2133759453892708, "num_tokens": 67760598.0, "step": 39065 }, { "entropy": 5.8257927894592285, "epoch": 3.039758801789535, "grad_norm": 1.2421875, "learning_rate": 0.0004080888724145132, "loss": 4.9731, "mean_token_accuracy": 0.20731221735477448, "num_tokens": 67769081.0, "step": 39070 }, { "entropy": 5.842122793197632, "epoch": 3.040147831161253, "grad_norm": 1.234375, "learning_rate": 0.0004080665243120456, "loss": 4.9701, "mean_token_accuracy": 0.20987311601638795, "num_tokens": 67778268.0, "step": 39075 }, { "entropy": 5.843275880813598, "epoch": 3.04053686053297, "grad_norm": 1.3046875, "learning_rate": 0.0004080441741905053, "loss": 4.9744, "mean_token_accuracy": 0.2088385060429573, "num_tokens": 67787744.0, "step": 39080 }, { "entropy": 5.803491878509521, "epoch": 3.040925889904688, "grad_norm": 1.3046875, "learning_rate": 0.0004080218220502314, "loss": 4.9156, "mean_token_accuracy": 0.21412625759840012, "num_tokens": 67796324.0, "step": 39085 }, { "entropy": 5.801105213165283, "epoch": 3.0413149192764055, "grad_norm": 1.3046875, "learning_rate": 0.00040799946789156304, "loss": 4.9067, "mean_token_accuracy": 0.21767957657575607, "num_tokens": 67805303.0, "step": 39090 }, { "entropy": 5.861781930923462, "epoch": 3.0417039486481228, "grad_norm": 1.34375, "learning_rate": 0.00040797711171483954, "loss": 5.0783, "mean_token_accuracy": 0.19940189868211747, "num_tokens": 67814300.0, "step": 39095 }, { "entropy": 5.755396366119385, "epoch": 3.0420929780198405, "grad_norm": 1.2890625, "learning_rate": 0.0004079547535203999, "loss": 4.9204, "mean_token_accuracy": 0.21215637624263764, "num_tokens": 67822512.0, "step": 39100 }, { "entropy": 5.818038272857666, "epoch": 3.042482007391558, "grad_norm": 1.28125, "learning_rate": 0.0004079323933085836, "loss": 5.0151, "mean_token_accuracy": 0.20936035811901094, "num_tokens": 67830618.0, "step": 39105 }, { "entropy": 5.8200901508331295, "epoch": 3.0428710367632754, "grad_norm": 1.3828125, "learning_rate": 0.00040791003107972976, "loss": 4.9212, "mean_token_accuracy": 0.21017327308654785, "num_tokens": 67838623.0, "step": 39110 }, { "entropy": 5.708788537979126, "epoch": 3.043260066134993, "grad_norm": 1.234375, "learning_rate": 0.0004078876668341778, "loss": 4.8182, "mean_token_accuracy": 0.2211902692914009, "num_tokens": 67847676.0, "step": 39115 }, { "entropy": 5.78536434173584, "epoch": 3.043649095506711, "grad_norm": 1.328125, "learning_rate": 0.0004078653005722669, "loss": 4.9364, "mean_token_accuracy": 0.2063515529036522, "num_tokens": 67855896.0, "step": 39120 }, { "entropy": 5.839370203018189, "epoch": 3.0440381248784285, "grad_norm": 1.328125, "learning_rate": 0.0004078429322943366, "loss": 4.9808, "mean_token_accuracy": 0.20460814535617827, "num_tokens": 67864028.0, "step": 39125 }, { "entropy": 5.772445011138916, "epoch": 3.0444271542501458, "grad_norm": 1.21875, "learning_rate": 0.00040782056200072627, "loss": 4.93, "mean_token_accuracy": 0.2093192458152771, "num_tokens": 67873518.0, "step": 39130 }, { "entropy": 5.898752880096436, "epoch": 3.0448161836218635, "grad_norm": 1.359375, "learning_rate": 0.00040779818969177527, "loss": 5.0437, "mean_token_accuracy": 0.20342600643634795, "num_tokens": 67882432.0, "step": 39135 }, { "entropy": 5.857030153274536, "epoch": 3.045205212993581, "grad_norm": 1.2890625, "learning_rate": 0.00040777581536782315, "loss": 4.9724, "mean_token_accuracy": 0.20856084674596786, "num_tokens": 67891448.0, "step": 39140 }, { "entropy": 5.919822311401367, "epoch": 3.0455942423652984, "grad_norm": 1.265625, "learning_rate": 0.0004077534390292093, "loss": 5.0942, "mean_token_accuracy": 0.2053716629743576, "num_tokens": 67900460.0, "step": 39145 }, { "entropy": 5.861373472213745, "epoch": 3.045983271737016, "grad_norm": 1.375, "learning_rate": 0.00040773106067627335, "loss": 4.9693, "mean_token_accuracy": 0.2069399982690811, "num_tokens": 67908515.0, "step": 39150 }, { "entropy": 5.775004100799561, "epoch": 3.046372301108734, "grad_norm": 1.3203125, "learning_rate": 0.00040770868030935486, "loss": 4.8771, "mean_token_accuracy": 0.21028319299221038, "num_tokens": 67917467.0, "step": 39155 }, { "entropy": 5.791110229492188, "epoch": 3.046761330480451, "grad_norm": 1.3671875, "learning_rate": 0.00040768629792879344, "loss": 4.9967, "mean_token_accuracy": 0.20362433791160583, "num_tokens": 67926322.0, "step": 39160 }, { "entropy": 5.805644559860229, "epoch": 3.0471503598521688, "grad_norm": 1.265625, "learning_rate": 0.0004076639135349284, "loss": 5.0069, "mean_token_accuracy": 0.2024402290582657, "num_tokens": 67935022.0, "step": 39165 }, { "entropy": 5.863823270797729, "epoch": 3.0475393892238865, "grad_norm": 1.234375, "learning_rate": 0.00040764152712809983, "loss": 4.9765, "mean_token_accuracy": 0.21176383942365645, "num_tokens": 67943536.0, "step": 39170 }, { "entropy": 5.787704181671143, "epoch": 3.047928418595604, "grad_norm": 1.2109375, "learning_rate": 0.0004076191387086472, "loss": 4.9577, "mean_token_accuracy": 0.21085478216409684, "num_tokens": 67952412.0, "step": 39175 }, { "entropy": 5.801259088516235, "epoch": 3.0483174479673214, "grad_norm": 1.3828125, "learning_rate": 0.00040759674827691014, "loss": 5.0264, "mean_token_accuracy": 0.20871176719665527, "num_tokens": 67961318.0, "step": 39180 }, { "entropy": 5.887573909759522, "epoch": 3.048706477339039, "grad_norm": 1.421875, "learning_rate": 0.0004075743558332285, "loss": 4.9735, "mean_token_accuracy": 0.20969752669334413, "num_tokens": 67969190.0, "step": 39185 }, { "entropy": 5.820132875442505, "epoch": 3.049095506710757, "grad_norm": 1.328125, "learning_rate": 0.000407551961377942, "loss": 4.8747, "mean_token_accuracy": 0.2154114231467247, "num_tokens": 67978339.0, "step": 39190 }, { "entropy": 5.694484519958496, "epoch": 3.049484536082474, "grad_norm": 1.3359375, "learning_rate": 0.0004075295649113905, "loss": 4.8598, "mean_token_accuracy": 0.2103315308690071, "num_tokens": 67987806.0, "step": 39195 }, { "entropy": 5.852518558502197, "epoch": 3.0498735654541917, "grad_norm": 1.2421875, "learning_rate": 0.00040750716643391384, "loss": 5.0145, "mean_token_accuracy": 0.2103867158293724, "num_tokens": 67997017.0, "step": 39200 }, { "entropy": 5.843323183059693, "epoch": 3.0502625948259094, "grad_norm": 1.265625, "learning_rate": 0.0004074847659458518, "loss": 5.0001, "mean_token_accuracy": 0.20470632165670394, "num_tokens": 68006032.0, "step": 39205 }, { "entropy": 5.8357017040252686, "epoch": 3.050651624197627, "grad_norm": 1.390625, "learning_rate": 0.00040746236344754423, "loss": 4.9811, "mean_token_accuracy": 0.20628325194120406, "num_tokens": 68014644.0, "step": 39210 }, { "entropy": 5.840534639358521, "epoch": 3.0510406535693444, "grad_norm": 1.3203125, "learning_rate": 0.0004074399589393312, "loss": 4.9821, "mean_token_accuracy": 0.2004847928881645, "num_tokens": 68023302.0, "step": 39215 }, { "entropy": 5.785561466217041, "epoch": 3.051429682941062, "grad_norm": 1.3984375, "learning_rate": 0.0004074175524215526, "loss": 4.9052, "mean_token_accuracy": 0.21334371715784073, "num_tokens": 68031644.0, "step": 39220 }, { "entropy": 5.791380882263184, "epoch": 3.05181871231278, "grad_norm": 1.25, "learning_rate": 0.0004073951438945484, "loss": 4.935, "mean_token_accuracy": 0.20596230328083037, "num_tokens": 68039789.0, "step": 39225 }, { "entropy": 5.828952980041504, "epoch": 3.052207741684497, "grad_norm": 1.328125, "learning_rate": 0.00040737273335865866, "loss": 5.0099, "mean_token_accuracy": 0.208457051217556, "num_tokens": 68048131.0, "step": 39230 }, { "entropy": 5.841406154632568, "epoch": 3.0525967710562147, "grad_norm": 1.2890625, "learning_rate": 0.00040735032081422334, "loss": 5.062, "mean_token_accuracy": 0.2044255644083023, "num_tokens": 68057009.0, "step": 39235 }, { "entropy": 5.848847770690918, "epoch": 3.0529858004279324, "grad_norm": 1.296875, "learning_rate": 0.00040732790626158257, "loss": 4.9306, "mean_token_accuracy": 0.21125787049531936, "num_tokens": 68065611.0, "step": 39240 }, { "entropy": 5.837436008453369, "epoch": 3.0533748297996497, "grad_norm": 1.4296875, "learning_rate": 0.00040730548970107646, "loss": 5.0033, "mean_token_accuracy": 0.20553603172302246, "num_tokens": 68073892.0, "step": 39245 }, { "entropy": 5.809541940689087, "epoch": 3.0537638591713674, "grad_norm": 1.3984375, "learning_rate": 0.0004072830711330451, "loss": 4.9729, "mean_token_accuracy": 0.2095554992556572, "num_tokens": 68081406.0, "step": 39250 }, { "entropy": 5.737035655975342, "epoch": 3.054152888543085, "grad_norm": 1.28125, "learning_rate": 0.0004072606505578287, "loss": 4.8333, "mean_token_accuracy": 0.22030352652072907, "num_tokens": 68089883.0, "step": 39255 }, { "entropy": 5.763055610656738, "epoch": 3.054541917914803, "grad_norm": 1.2890625, "learning_rate": 0.00040723822797576737, "loss": 4.929, "mean_token_accuracy": 0.2127308130264282, "num_tokens": 68098587.0, "step": 39260 }, { "entropy": 5.871400165557861, "epoch": 3.05493094728652, "grad_norm": 1.3203125, "learning_rate": 0.0004072158033872015, "loss": 5.0534, "mean_token_accuracy": 0.20424974262714385, "num_tokens": 68107802.0, "step": 39265 }, { "entropy": 5.887045001983642, "epoch": 3.0553199766582377, "grad_norm": 1.2109375, "learning_rate": 0.0004071933767924713, "loss": 5.0835, "mean_token_accuracy": 0.199178446829319, "num_tokens": 68117777.0, "step": 39270 }, { "entropy": 5.841463804244995, "epoch": 3.0557090060299554, "grad_norm": 1.25, "learning_rate": 0.00040717094819191685, "loss": 4.9131, "mean_token_accuracy": 0.2105742335319519, "num_tokens": 68126964.0, "step": 39275 }, { "entropy": 5.791716003417969, "epoch": 3.0560980354016727, "grad_norm": 1.3359375, "learning_rate": 0.00040714851758587875, "loss": 4.9599, "mean_token_accuracy": 0.20925536304712294, "num_tokens": 68135801.0, "step": 39280 }, { "entropy": 5.802290678024292, "epoch": 3.0564870647733904, "grad_norm": 1.3515625, "learning_rate": 0.00040712608497469715, "loss": 5.0026, "mean_token_accuracy": 0.20765635073184968, "num_tokens": 68144930.0, "step": 39285 }, { "entropy": 5.760097980499268, "epoch": 3.056876094145108, "grad_norm": 1.2421875, "learning_rate": 0.0004071036503587126, "loss": 4.884, "mean_token_accuracy": 0.22195216566324233, "num_tokens": 68153000.0, "step": 39290 }, { "entropy": 5.838367652893067, "epoch": 3.0572651235168253, "grad_norm": 1.28125, "learning_rate": 0.0004070812137382654, "loss": 5.0467, "mean_token_accuracy": 0.19612378478050232, "num_tokens": 68161510.0, "step": 39295 }, { "entropy": 5.900693130493164, "epoch": 3.057654152888543, "grad_norm": 1.3125, "learning_rate": 0.000407058775113696, "loss": 4.9795, "mean_token_accuracy": 0.21024883091449736, "num_tokens": 68170355.0, "step": 39300 }, { "entropy": 5.79980502128601, "epoch": 3.0580431822602607, "grad_norm": 1.4375, "learning_rate": 0.0004070363344853449, "loss": 4.938, "mean_token_accuracy": 0.20916044116020202, "num_tokens": 68178611.0, "step": 39305 }, { "entropy": 5.803950262069702, "epoch": 3.0584322116319784, "grad_norm": 1.296875, "learning_rate": 0.00040701389185355256, "loss": 4.9049, "mean_token_accuracy": 0.2097593605518341, "num_tokens": 68186799.0, "step": 39310 }, { "entropy": 5.825037574768066, "epoch": 3.0588212410036957, "grad_norm": 1.3515625, "learning_rate": 0.0004069914472186595, "loss": 4.9623, "mean_token_accuracy": 0.2136516496539116, "num_tokens": 68196261.0, "step": 39315 }, { "entropy": 5.831733369827271, "epoch": 3.0592102703754134, "grad_norm": 1.3671875, "learning_rate": 0.0004069690005810063, "loss": 4.9701, "mean_token_accuracy": 0.21453803032636642, "num_tokens": 68204373.0, "step": 39320 }, { "entropy": 5.799441862106323, "epoch": 3.059599299747131, "grad_norm": 1.3671875, "learning_rate": 0.00040694655194093365, "loss": 4.9447, "mean_token_accuracy": 0.2057499721646309, "num_tokens": 68212972.0, "step": 39325 }, { "entropy": 5.84109902381897, "epoch": 3.0599883291188483, "grad_norm": 1.25, "learning_rate": 0.00040692410129878205, "loss": 5.0498, "mean_token_accuracy": 0.20423805415630342, "num_tokens": 68221317.0, "step": 39330 }, { "entropy": 5.851670742034912, "epoch": 3.060377358490566, "grad_norm": 1.34375, "learning_rate": 0.0004069016486548922, "loss": 4.9854, "mean_token_accuracy": 0.2063519462943077, "num_tokens": 68229961.0, "step": 39335 }, { "entropy": 5.8360865116119385, "epoch": 3.0607663878622837, "grad_norm": 1.3671875, "learning_rate": 0.0004068791940096048, "loss": 4.9116, "mean_token_accuracy": 0.21365064829587938, "num_tokens": 68238527.0, "step": 39340 }, { "entropy": 5.80261263847351, "epoch": 3.061155417234001, "grad_norm": 1.2890625, "learning_rate": 0.00040685673736326044, "loss": 4.9629, "mean_token_accuracy": 0.2109831839799881, "num_tokens": 68246935.0, "step": 39345 }, { "entropy": 5.862231969833374, "epoch": 3.0615444466057187, "grad_norm": 1.3671875, "learning_rate": 0.0004068342787162001, "loss": 4.9432, "mean_token_accuracy": 0.21289208084344863, "num_tokens": 68255370.0, "step": 39350 }, { "entropy": 5.8587945938110355, "epoch": 3.0619334759774364, "grad_norm": 1.2421875, "learning_rate": 0.00040681181806876435, "loss": 4.9652, "mean_token_accuracy": 0.20835043042898177, "num_tokens": 68264970.0, "step": 39355 }, { "entropy": 5.835612344741821, "epoch": 3.062322505349154, "grad_norm": 1.2578125, "learning_rate": 0.000406789355421294, "loss": 5.0285, "mean_token_accuracy": 0.2052568942308426, "num_tokens": 68274158.0, "step": 39360 }, { "entropy": 5.840562868118286, "epoch": 3.0627115347208713, "grad_norm": 1.3125, "learning_rate": 0.0004067668907741301, "loss": 5.0445, "mean_token_accuracy": 0.20047302842140197, "num_tokens": 68282939.0, "step": 39365 }, { "entropy": 5.865649700164795, "epoch": 3.063100564092589, "grad_norm": 1.3515625, "learning_rate": 0.0004067444241276132, "loss": 4.9643, "mean_token_accuracy": 0.21067041903734207, "num_tokens": 68291235.0, "step": 39370 }, { "entropy": 5.848631763458252, "epoch": 3.0634895934643067, "grad_norm": 1.328125, "learning_rate": 0.00040672195548208443, "loss": 4.9624, "mean_token_accuracy": 0.21415946930646895, "num_tokens": 68300498.0, "step": 39375 }, { "entropy": 5.887886953353882, "epoch": 3.063878622836024, "grad_norm": 1.2890625, "learning_rate": 0.0004066994848378846, "loss": 5.0683, "mean_token_accuracy": 0.20751016438007355, "num_tokens": 68309320.0, "step": 39380 }, { "entropy": 5.804331207275391, "epoch": 3.0642676522077417, "grad_norm": 1.25, "learning_rate": 0.00040667701219535473, "loss": 4.9386, "mean_token_accuracy": 0.20843724757432938, "num_tokens": 68318462.0, "step": 39385 }, { "entropy": 5.78813362121582, "epoch": 3.0646566815794594, "grad_norm": 1.359375, "learning_rate": 0.0004066545375548358, "loss": 4.9814, "mean_token_accuracy": 0.20863882452249527, "num_tokens": 68327559.0, "step": 39390 }, { "entropy": 5.82707257270813, "epoch": 3.0650457109511766, "grad_norm": 1.2734375, "learning_rate": 0.0004066320609166689, "loss": 4.9805, "mean_token_accuracy": 0.20834171921014785, "num_tokens": 68336371.0, "step": 39395 }, { "entropy": 5.826039409637451, "epoch": 3.0654347403228943, "grad_norm": 1.2421875, "learning_rate": 0.0004066095822811949, "loss": 4.9667, "mean_token_accuracy": 0.2084718704223633, "num_tokens": 68345439.0, "step": 39400 }, { "entropy": 5.87598876953125, "epoch": 3.065823769694612, "grad_norm": 1.3984375, "learning_rate": 0.000406587101648755, "loss": 5.0576, "mean_token_accuracy": 0.2105918288230896, "num_tokens": 68354228.0, "step": 39405 }, { "entropy": 5.803850746154785, "epoch": 3.0662127990663297, "grad_norm": 1.3203125, "learning_rate": 0.0004065646190196902, "loss": 4.9108, "mean_token_accuracy": 0.2077522471547127, "num_tokens": 68362264.0, "step": 39410 }, { "entropy": 5.794232797622681, "epoch": 3.066601828438047, "grad_norm": 1.3125, "learning_rate": 0.0004065421343943417, "loss": 4.9122, "mean_token_accuracy": 0.20513679087162018, "num_tokens": 68370158.0, "step": 39415 }, { "entropy": 5.870185327529907, "epoch": 3.0669908578097647, "grad_norm": 1.40625, "learning_rate": 0.00040651964777305074, "loss": 4.9839, "mean_token_accuracy": 0.2094171941280365, "num_tokens": 68378193.0, "step": 39420 }, { "entropy": 5.787476634979248, "epoch": 3.0673798871814824, "grad_norm": 1.171875, "learning_rate": 0.0004064971591561585, "loss": 4.9403, "mean_token_accuracy": 0.20669917464256288, "num_tokens": 68386840.0, "step": 39425 }, { "entropy": 5.733916616439819, "epoch": 3.0677689165531996, "grad_norm": 1.3046875, "learning_rate": 0.00040647466854400606, "loss": 4.9605, "mean_token_accuracy": 0.21660890132188798, "num_tokens": 68395587.0, "step": 39430 }, { "entropy": 5.724660348892212, "epoch": 3.0681579459249173, "grad_norm": 1.2109375, "learning_rate": 0.0004064521759369349, "loss": 4.8297, "mean_token_accuracy": 0.2217332437634468, "num_tokens": 68403921.0, "step": 39435 }, { "entropy": 5.820328950881958, "epoch": 3.068546975296635, "grad_norm": 1.1796875, "learning_rate": 0.00040642968133528613, "loss": 4.9732, "mean_token_accuracy": 0.2090347394347191, "num_tokens": 68412130.0, "step": 39440 }, { "entropy": 5.769091510772705, "epoch": 3.0689360046683523, "grad_norm": 1.296875, "learning_rate": 0.0004064071847394012, "loss": 4.9087, "mean_token_accuracy": 0.21442843228578568, "num_tokens": 68420113.0, "step": 39445 }, { "entropy": 5.803831911087036, "epoch": 3.06932503404007, "grad_norm": 1.359375, "learning_rate": 0.0004063846861496213, "loss": 4.9962, "mean_token_accuracy": 0.20604742616415023, "num_tokens": 68428397.0, "step": 39450 }, { "entropy": 5.8736429691314695, "epoch": 3.0697140634117877, "grad_norm": 1.4140625, "learning_rate": 0.000406362185566288, "loss": 5.0762, "mean_token_accuracy": 0.1993295818567276, "num_tokens": 68436607.0, "step": 39455 }, { "entropy": 5.870149374008179, "epoch": 3.0701030927835053, "grad_norm": 1.3359375, "learning_rate": 0.0004063396829897426, "loss": 4.999, "mean_token_accuracy": 0.21155939102172852, "num_tokens": 68445167.0, "step": 39460 }, { "entropy": 5.8394163131713865, "epoch": 3.0704921221552226, "grad_norm": 1.375, "learning_rate": 0.0004063171784203265, "loss": 5.0191, "mean_token_accuracy": 0.20901959240436555, "num_tokens": 68453758.0, "step": 39465 }, { "entropy": 5.922358703613281, "epoch": 3.0708811515269403, "grad_norm": 1.203125, "learning_rate": 0.0004062946718583813, "loss": 5.1149, "mean_token_accuracy": 0.20606088638305664, "num_tokens": 68462536.0, "step": 39470 }, { "entropy": 5.850831794738769, "epoch": 3.071270180898658, "grad_norm": 1.3828125, "learning_rate": 0.00040627216330424844, "loss": 5.0085, "mean_token_accuracy": 0.20335010141134263, "num_tokens": 68470862.0, "step": 39475 }, { "entropy": 5.8243536949157715, "epoch": 3.0716592102703753, "grad_norm": 1.1796875, "learning_rate": 0.0004062496527582694, "loss": 5.055, "mean_token_accuracy": 0.201138673722744, "num_tokens": 68480212.0, "step": 39480 }, { "entropy": 5.699077987670899, "epoch": 3.072048239642093, "grad_norm": 1.28125, "learning_rate": 0.0004062271402207858, "loss": 4.7985, "mean_token_accuracy": 0.23066861927509308, "num_tokens": 68489883.0, "step": 39485 }, { "entropy": 5.839458227157593, "epoch": 3.0724372690138106, "grad_norm": 1.2734375, "learning_rate": 0.0004062046256921391, "loss": 5.0256, "mean_token_accuracy": 0.20650219321250915, "num_tokens": 68498875.0, "step": 39490 }, { "entropy": 5.839842033386231, "epoch": 3.072826298385528, "grad_norm": 1.28125, "learning_rate": 0.00040618210917267117, "loss": 4.9508, "mean_token_accuracy": 0.21424026638269425, "num_tokens": 68508212.0, "step": 39495 }, { "entropy": 5.802602863311767, "epoch": 3.0732153277572456, "grad_norm": 1.25, "learning_rate": 0.00040615959066272355, "loss": 4.9759, "mean_token_accuracy": 0.21247861087322234, "num_tokens": 68516990.0, "step": 39500 }, { "entropy": 5.866367626190185, "epoch": 3.0736043571289633, "grad_norm": 1.3359375, "learning_rate": 0.0004061370701626379, "loss": 5.0877, "mean_token_accuracy": 0.2035200998187065, "num_tokens": 68526807.0, "step": 39505 }, { "entropy": 5.8027928352355955, "epoch": 3.073993386500681, "grad_norm": 1.3515625, "learning_rate": 0.0004061145476727559, "loss": 5.0126, "mean_token_accuracy": 0.20905337035655974, "num_tokens": 68535327.0, "step": 39510 }, { "entropy": 5.914617300033569, "epoch": 3.0743824158723982, "grad_norm": 1.3515625, "learning_rate": 0.0004060920231934193, "loss": 5.0557, "mean_token_accuracy": 0.2015492394566536, "num_tokens": 68543389.0, "step": 39515 }, { "entropy": 5.8522467613220215, "epoch": 3.074771445244116, "grad_norm": 1.21875, "learning_rate": 0.0004060694967249699, "loss": 4.9381, "mean_token_accuracy": 0.2134429022669792, "num_tokens": 68552271.0, "step": 39520 }, { "entropy": 5.833958005905151, "epoch": 3.0751604746158336, "grad_norm": 1.234375, "learning_rate": 0.0004060469682677496, "loss": 4.9962, "mean_token_accuracy": 0.2096745640039444, "num_tokens": 68560931.0, "step": 39525 }, { "entropy": 5.79143443107605, "epoch": 3.075549503987551, "grad_norm": 1.21875, "learning_rate": 0.00040602443782210003, "loss": 4.9347, "mean_token_accuracy": 0.21465360522270202, "num_tokens": 68569871.0, "step": 39530 }, { "entropy": 5.818266773223877, "epoch": 3.0759385333592686, "grad_norm": 1.375, "learning_rate": 0.0004060019053883632, "loss": 4.9225, "mean_token_accuracy": 0.2129931703209877, "num_tokens": 68578167.0, "step": 39535 }, { "entropy": 5.822011947631836, "epoch": 3.0763275627309863, "grad_norm": 1.25, "learning_rate": 0.000405979370966881, "loss": 4.956, "mean_token_accuracy": 0.20952725708484649, "num_tokens": 68587254.0, "step": 39540 }, { "entropy": 5.816270017623902, "epoch": 3.0767165921027035, "grad_norm": 1.3671875, "learning_rate": 0.0004059568345579953, "loss": 5.0162, "mean_token_accuracy": 0.2016645833849907, "num_tokens": 68595405.0, "step": 39545 }, { "entropy": 5.775061321258545, "epoch": 3.0771056214744212, "grad_norm": 1.265625, "learning_rate": 0.00040593429616204806, "loss": 4.8878, "mean_token_accuracy": 0.21784939169883727, "num_tokens": 68604092.0, "step": 39550 }, { "entropy": 5.861136865615845, "epoch": 3.077494650846139, "grad_norm": 1.3046875, "learning_rate": 0.00040591175577938125, "loss": 4.914, "mean_token_accuracy": 0.22066772878170013, "num_tokens": 68612697.0, "step": 39555 }, { "entropy": 5.872352075576782, "epoch": 3.0778836802178566, "grad_norm": 1.3671875, "learning_rate": 0.00040588921341033697, "loss": 5.0595, "mean_token_accuracy": 0.2054194226861, "num_tokens": 68621770.0, "step": 39560 }, { "entropy": 5.805569410324097, "epoch": 3.078272709589574, "grad_norm": 1.1953125, "learning_rate": 0.0004058666690552572, "loss": 4.9623, "mean_token_accuracy": 0.20760195404291154, "num_tokens": 68631789.0, "step": 39565 }, { "entropy": 5.8545427322387695, "epoch": 3.0786617389612916, "grad_norm": 1.3828125, "learning_rate": 0.00040584412271448407, "loss": 4.9195, "mean_token_accuracy": 0.21655955910682678, "num_tokens": 68640033.0, "step": 39570 }, { "entropy": 5.813673210144043, "epoch": 3.0790507683330093, "grad_norm": 1.4296875, "learning_rate": 0.0004058215743883595, "loss": 5.0112, "mean_token_accuracy": 0.20706821978092194, "num_tokens": 68649082.0, "step": 39575 }, { "entropy": 5.817861080169678, "epoch": 3.0794397977047265, "grad_norm": 1.21875, "learning_rate": 0.0004057990240772259, "loss": 4.9893, "mean_token_accuracy": 0.21172555088996886, "num_tokens": 68657965.0, "step": 39580 }, { "entropy": 5.852955675125122, "epoch": 3.0798288270764442, "grad_norm": 1.4140625, "learning_rate": 0.00040577647178142523, "loss": 4.9404, "mean_token_accuracy": 0.21825944036245346, "num_tokens": 68666002.0, "step": 39585 }, { "entropy": 5.847254800796509, "epoch": 3.080217856448162, "grad_norm": 1.2890625, "learning_rate": 0.0004057539175012998, "loss": 4.9874, "mean_token_accuracy": 0.2024742394685745, "num_tokens": 68675517.0, "step": 39590 }, { "entropy": 5.769647789001465, "epoch": 3.080606885819879, "grad_norm": 1.34375, "learning_rate": 0.00040573136123719174, "loss": 4.9251, "mean_token_accuracy": 0.2065741539001465, "num_tokens": 68683943.0, "step": 39595 }, { "entropy": 5.751211881637573, "epoch": 3.080995915191597, "grad_norm": 1.28125, "learning_rate": 0.00040570880298944334, "loss": 4.8944, "mean_token_accuracy": 0.20927375555038452, "num_tokens": 68692761.0, "step": 39600 }, { "entropy": 5.817933750152588, "epoch": 3.0813849445633146, "grad_norm": 1.3359375, "learning_rate": 0.0004056862427583969, "loss": 4.9649, "mean_token_accuracy": 0.2141027793288231, "num_tokens": 68701255.0, "step": 39605 }, { "entropy": 5.681625843048096, "epoch": 3.0817739739350323, "grad_norm": 1.3671875, "learning_rate": 0.0004056636805443948, "loss": 4.8295, "mean_token_accuracy": 0.22289353609085083, "num_tokens": 68709654.0, "step": 39610 }, { "entropy": 5.764019298553467, "epoch": 3.0821630033067495, "grad_norm": 1.3359375, "learning_rate": 0.00040564111634777927, "loss": 4.9693, "mean_token_accuracy": 0.20871956497430802, "num_tokens": 68719355.0, "step": 39615 }, { "entropy": 5.88094162940979, "epoch": 3.0825520326784672, "grad_norm": 1.2890625, "learning_rate": 0.00040561855016889276, "loss": 5.0156, "mean_token_accuracy": 0.20753912776708602, "num_tokens": 68728495.0, "step": 39620 }, { "entropy": 5.892963504791259, "epoch": 3.082941062050185, "grad_norm": 1.3046875, "learning_rate": 0.00040559598200807763, "loss": 4.9776, "mean_token_accuracy": 0.20800368189811708, "num_tokens": 68737098.0, "step": 39625 }, { "entropy": 5.8221831798553465, "epoch": 3.083330091421902, "grad_norm": 1.484375, "learning_rate": 0.0004055734118656764, "loss": 4.9605, "mean_token_accuracy": 0.21473665833473204, "num_tokens": 68745563.0, "step": 39630 }, { "entropy": 5.754200744628906, "epoch": 3.08371912079362, "grad_norm": 1.234375, "learning_rate": 0.0004055508397420314, "loss": 4.9054, "mean_token_accuracy": 0.21765429377555848, "num_tokens": 68753861.0, "step": 39635 }, { "entropy": 5.7909736156463625, "epoch": 3.0841081501653376, "grad_norm": 1.1796875, "learning_rate": 0.00040552826563748526, "loss": 4.9532, "mean_token_accuracy": 0.21376789063215257, "num_tokens": 68762623.0, "step": 39640 }, { "entropy": 5.801203298568725, "epoch": 3.0844971795370553, "grad_norm": 1.4140625, "learning_rate": 0.0004055056895523804, "loss": 4.9053, "mean_token_accuracy": 0.2101140484213829, "num_tokens": 68771235.0, "step": 39645 }, { "entropy": 5.814163589477539, "epoch": 3.0848862089087725, "grad_norm": 1.2578125, "learning_rate": 0.00040548311148705943, "loss": 5.0015, "mean_token_accuracy": 0.20949250012636184, "num_tokens": 68780264.0, "step": 39650 }, { "entropy": 5.7955036640167235, "epoch": 3.08527523828049, "grad_norm": 1.2890625, "learning_rate": 0.0004054605314418649, "loss": 4.97, "mean_token_accuracy": 0.21308656632900239, "num_tokens": 68789242.0, "step": 39655 }, { "entropy": 5.774907112121582, "epoch": 3.085664267652208, "grad_norm": 1.3671875, "learning_rate": 0.00040543794941713944, "loss": 4.9455, "mean_token_accuracy": 0.20601903945207595, "num_tokens": 68797441.0, "step": 39660 }, { "entropy": 5.8184737205505375, "epoch": 3.086053297023925, "grad_norm": 1.4140625, "learning_rate": 0.0004054153654132258, "loss": 5.0252, "mean_token_accuracy": 0.21047117859125136, "num_tokens": 68805884.0, "step": 39665 }, { "entropy": 5.790157508850098, "epoch": 3.086442326395643, "grad_norm": 1.3046875, "learning_rate": 0.0004053927794304665, "loss": 4.9219, "mean_token_accuracy": 0.21730638593435286, "num_tokens": 68813338.0, "step": 39670 }, { "entropy": 5.7888861179351805, "epoch": 3.0868313557673606, "grad_norm": 1.2421875, "learning_rate": 0.0004053701914692043, "loss": 4.9191, "mean_token_accuracy": 0.2131543204188347, "num_tokens": 68822646.0, "step": 39675 }, { "entropy": 5.888801383972168, "epoch": 3.087220385139078, "grad_norm": 1.3046875, "learning_rate": 0.000405347601529782, "loss": 5.1217, "mean_token_accuracy": 0.20044277906417846, "num_tokens": 68832089.0, "step": 39680 }, { "entropy": 5.7748359680175785, "epoch": 3.0876094145107955, "grad_norm": 1.390625, "learning_rate": 0.0004053250096125423, "loss": 4.9706, "mean_token_accuracy": 0.20926367193460466, "num_tokens": 68839694.0, "step": 39685 }, { "entropy": 5.802931451797486, "epoch": 3.087998443882513, "grad_norm": 1.3359375, "learning_rate": 0.0004053024157178281, "loss": 4.9641, "mean_token_accuracy": 0.20656691938638688, "num_tokens": 68848554.0, "step": 39690 }, { "entropy": 5.8489851474761965, "epoch": 3.088387473254231, "grad_norm": 1.3984375, "learning_rate": 0.000405279819845982, "loss": 5.0755, "mean_token_accuracy": 0.20811651796102523, "num_tokens": 68857148.0, "step": 39695 }, { "entropy": 5.813358449935913, "epoch": 3.088776502625948, "grad_norm": 1.2734375, "learning_rate": 0.00040525722199734706, "loss": 4.9575, "mean_token_accuracy": 0.209647336602211, "num_tokens": 68865576.0, "step": 39700 }, { "entropy": 5.902824020385742, "epoch": 3.089165531997666, "grad_norm": 1.4140625, "learning_rate": 0.0004052346221722661, "loss": 5.1067, "mean_token_accuracy": 0.20678790807723998, "num_tokens": 68873228.0, "step": 39705 }, { "entropy": 5.911577463150024, "epoch": 3.0895545613693836, "grad_norm": 1.328125, "learning_rate": 0.00040521202037108205, "loss": 5.0286, "mean_token_accuracy": 0.2123262971639633, "num_tokens": 68881480.0, "step": 39710 }, { "entropy": 5.854762697219849, "epoch": 3.089943590741101, "grad_norm": 1.296875, "learning_rate": 0.0004051894165941378, "loss": 4.9928, "mean_token_accuracy": 0.2029785007238388, "num_tokens": 68890347.0, "step": 39715 }, { "entropy": 5.870352077484131, "epoch": 3.0903326201128185, "grad_norm": 1.3125, "learning_rate": 0.00040516681084177636, "loss": 5.0246, "mean_token_accuracy": 0.20288817584514618, "num_tokens": 68898792.0, "step": 39720 }, { "entropy": 5.832594633102417, "epoch": 3.090721649484536, "grad_norm": 1.203125, "learning_rate": 0.00040514420311434085, "loss": 5.0027, "mean_token_accuracy": 0.20829457938671112, "num_tokens": 68906947.0, "step": 39725 }, { "entropy": 5.762972974777222, "epoch": 3.0911106788562535, "grad_norm": 1.2578125, "learning_rate": 0.00040512159341217415, "loss": 4.8748, "mean_token_accuracy": 0.21641161441802978, "num_tokens": 68915357.0, "step": 39730 }, { "entropy": 5.834885120391846, "epoch": 3.091499708227971, "grad_norm": 1.265625, "learning_rate": 0.00040509898173561934, "loss": 4.9985, "mean_token_accuracy": 0.20679308474063873, "num_tokens": 68923734.0, "step": 39735 }, { "entropy": 5.858195781707764, "epoch": 3.091888737599689, "grad_norm": 1.390625, "learning_rate": 0.0004050763680850196, "loss": 5.0197, "mean_token_accuracy": 0.20343829989433287, "num_tokens": 68932225.0, "step": 39740 }, { "entropy": 5.884276580810547, "epoch": 3.0922777669714065, "grad_norm": 1.328125, "learning_rate": 0.0004050537524607179, "loss": 5.0069, "mean_token_accuracy": 0.21300562620162963, "num_tokens": 68939886.0, "step": 39745 }, { "entropy": 5.770421743392944, "epoch": 3.092666796343124, "grad_norm": 1.265625, "learning_rate": 0.00040503113486305766, "loss": 4.9754, "mean_token_accuracy": 0.21022918373346328, "num_tokens": 68949188.0, "step": 39750 }, { "entropy": 5.823473691940308, "epoch": 3.0930558257148415, "grad_norm": 1.359375, "learning_rate": 0.00040500851529238184, "loss": 4.9974, "mean_token_accuracy": 0.2110453024506569, "num_tokens": 68957480.0, "step": 39755 }, { "entropy": 5.8669188022613525, "epoch": 3.093444855086559, "grad_norm": 1.3125, "learning_rate": 0.0004049858937490337, "loss": 5.0127, "mean_token_accuracy": 0.20377072989940642, "num_tokens": 68967319.0, "step": 39760 }, { "entropy": 5.902419090270996, "epoch": 3.0938338844582765, "grad_norm": 1.328125, "learning_rate": 0.0004049632702333566, "loss": 5.0781, "mean_token_accuracy": 0.20742001086473466, "num_tokens": 68975659.0, "step": 39765 }, { "entropy": 5.810904884338379, "epoch": 3.094222913829994, "grad_norm": 1.375, "learning_rate": 0.00040494064474569375, "loss": 4.9096, "mean_token_accuracy": 0.21777776926755904, "num_tokens": 68984292.0, "step": 39770 }, { "entropy": 5.818319034576416, "epoch": 3.094611943201712, "grad_norm": 1.3203125, "learning_rate": 0.00040491801728638835, "loss": 4.9155, "mean_token_accuracy": 0.21426538825035096, "num_tokens": 68993527.0, "step": 39775 }, { "entropy": 5.844941139221191, "epoch": 3.095000972573429, "grad_norm": 1.2734375, "learning_rate": 0.00040489538785578385, "loss": 4.9806, "mean_token_accuracy": 0.20998334288597106, "num_tokens": 69001382.0, "step": 39780 }, { "entropy": 5.812329626083374, "epoch": 3.095390001945147, "grad_norm": 1.28125, "learning_rate": 0.00040487275645422356, "loss": 4.9629, "mean_token_accuracy": 0.19717445075511933, "num_tokens": 69010930.0, "step": 39785 }, { "entropy": 5.807558536529541, "epoch": 3.0957790313168645, "grad_norm": 1.21875, "learning_rate": 0.000404850123082051, "loss": 4.8867, "mean_token_accuracy": 0.21644314378499985, "num_tokens": 69020107.0, "step": 39790 }, { "entropy": 5.8125909805297855, "epoch": 3.096168060688582, "grad_norm": 1.3125, "learning_rate": 0.0004048274877396094, "loss": 4.9268, "mean_token_accuracy": 0.21209898740053176, "num_tokens": 69028895.0, "step": 39795 }, { "entropy": 5.8018796920776365, "epoch": 3.0965570900602994, "grad_norm": 1.359375, "learning_rate": 0.0004048048504272424, "loss": 4.9891, "mean_token_accuracy": 0.21167099922895433, "num_tokens": 69037660.0, "step": 39800 }, { "entropy": 5.819730234146118, "epoch": 3.096946119432017, "grad_norm": 1.3203125, "learning_rate": 0.0004047822111452933, "loss": 4.9818, "mean_token_accuracy": 0.214534755051136, "num_tokens": 69045681.0, "step": 39805 }, { "entropy": 5.815293979644776, "epoch": 3.097335148803735, "grad_norm": 1.28125, "learning_rate": 0.00040475956989410584, "loss": 4.8743, "mean_token_accuracy": 0.2164829909801483, "num_tokens": 69054577.0, "step": 39810 }, { "entropy": 5.81224422454834, "epoch": 3.097724178175452, "grad_norm": 1.3125, "learning_rate": 0.0004047369266740233, "loss": 4.9433, "mean_token_accuracy": 0.21623441874980925, "num_tokens": 69062887.0, "step": 39815 }, { "entropy": 5.847972774505616, "epoch": 3.09811320754717, "grad_norm": 1.328125, "learning_rate": 0.00040471428148538944, "loss": 5.0658, "mean_token_accuracy": 0.20613196790218352, "num_tokens": 69071209.0, "step": 39820 }, { "entropy": 5.7591043472290036, "epoch": 3.0985022369188875, "grad_norm": 1.25, "learning_rate": 0.0004046916343285479, "loss": 4.8931, "mean_token_accuracy": 0.21789177507162094, "num_tokens": 69080026.0, "step": 39825 }, { "entropy": 5.864245939254761, "epoch": 3.0988912662906047, "grad_norm": 1.34375, "learning_rate": 0.00040466898520384213, "loss": 5.0379, "mean_token_accuracy": 0.19988496154546737, "num_tokens": 69088283.0, "step": 39830 }, { "entropy": 5.7730776309967045, "epoch": 3.0992802956623224, "grad_norm": 1.34375, "learning_rate": 0.000404646334111616, "loss": 4.8324, "mean_token_accuracy": 0.21712164878845214, "num_tokens": 69097204.0, "step": 39835 }, { "entropy": 5.798954772949219, "epoch": 3.09966932503404, "grad_norm": 1.3125, "learning_rate": 0.0004046236810522131, "loss": 5.0342, "mean_token_accuracy": 0.20535361915826797, "num_tokens": 69105586.0, "step": 39840 }, { "entropy": 5.744022560119629, "epoch": 3.100058354405758, "grad_norm": 1.234375, "learning_rate": 0.0004046010260259771, "loss": 4.8966, "mean_token_accuracy": 0.21066858172416686, "num_tokens": 69115321.0, "step": 39845 }, { "entropy": 5.828773498535156, "epoch": 3.100447383777475, "grad_norm": 1.3984375, "learning_rate": 0.00040457836903325177, "loss": 4.947, "mean_token_accuracy": 0.210826176404953, "num_tokens": 69124472.0, "step": 39850 }, { "entropy": 5.818153953552246, "epoch": 3.100836413149193, "grad_norm": 1.2890625, "learning_rate": 0.00040455571007438104, "loss": 4.9516, "mean_token_accuracy": 0.21467797160148622, "num_tokens": 69132961.0, "step": 39855 }, { "entropy": 5.672987461090088, "epoch": 3.1012254425209105, "grad_norm": 1.328125, "learning_rate": 0.0004045330491497085, "loss": 4.8365, "mean_token_accuracy": 0.21256709098815918, "num_tokens": 69142097.0, "step": 39860 }, { "entropy": 5.768345832824707, "epoch": 3.1016144718926277, "grad_norm": 1.4296875, "learning_rate": 0.00040451038625957827, "loss": 4.944, "mean_token_accuracy": 0.21497393250465394, "num_tokens": 69150399.0, "step": 39865 }, { "entropy": 5.8519762516021725, "epoch": 3.1020035012643454, "grad_norm": 1.28125, "learning_rate": 0.0004044877214043339, "loss": 4.9967, "mean_token_accuracy": 0.20259847790002822, "num_tokens": 69158872.0, "step": 39870 }, { "entropy": 5.853964710235596, "epoch": 3.102392530636063, "grad_norm": 1.1875, "learning_rate": 0.0004044650545843196, "loss": 5.0315, "mean_token_accuracy": 0.2086167514324188, "num_tokens": 69167852.0, "step": 39875 }, { "entropy": 5.76732177734375, "epoch": 3.1027815600077804, "grad_norm": 1.3359375, "learning_rate": 0.000404442385799879, "loss": 4.9218, "mean_token_accuracy": 0.21634586453437804, "num_tokens": 69176586.0, "step": 39880 }, { "entropy": 5.823845863342285, "epoch": 3.103170589379498, "grad_norm": 1.203125, "learning_rate": 0.0004044197150513564, "loss": 5.0831, "mean_token_accuracy": 0.2007353574037552, "num_tokens": 69185512.0, "step": 39885 }, { "entropy": 5.876128768920898, "epoch": 3.1035596187512158, "grad_norm": 1.21875, "learning_rate": 0.0004043970423390955, "loss": 5.0625, "mean_token_accuracy": 0.20131637901067734, "num_tokens": 69194696.0, "step": 39890 }, { "entropy": 5.86784029006958, "epoch": 3.1039486481229335, "grad_norm": 1.234375, "learning_rate": 0.0004043743676634405, "loss": 4.9706, "mean_token_accuracy": 0.21102476865053177, "num_tokens": 69203533.0, "step": 39895 }, { "entropy": 5.865966558456421, "epoch": 3.1043376774946507, "grad_norm": 1.359375, "learning_rate": 0.0004043516910247353, "loss": 5.0596, "mean_token_accuracy": 0.2029344156384468, "num_tokens": 69212864.0, "step": 39900 }, { "entropy": 5.800632333755493, "epoch": 3.1047267068663684, "grad_norm": 1.3984375, "learning_rate": 0.0004043290124233242, "loss": 4.9125, "mean_token_accuracy": 0.21313959807157518, "num_tokens": 69220598.0, "step": 39905 }, { "entropy": 5.795917654037476, "epoch": 3.105115736238086, "grad_norm": 1.1640625, "learning_rate": 0.0004043063318595511, "loss": 5.0053, "mean_token_accuracy": 0.20564965009689332, "num_tokens": 69230683.0, "step": 39910 }, { "entropy": 5.839149522781372, "epoch": 3.1055047656098034, "grad_norm": 1.25, "learning_rate": 0.0004042836493337603, "loss": 4.985, "mean_token_accuracy": 0.2078793004155159, "num_tokens": 69239274.0, "step": 39915 }, { "entropy": 5.8357256889343265, "epoch": 3.105893794981521, "grad_norm": 1.1796875, "learning_rate": 0.0004042609648462959, "loss": 4.9443, "mean_token_accuracy": 0.21009508669376373, "num_tokens": 69248155.0, "step": 39920 }, { "entropy": 5.763851451873779, "epoch": 3.1062828243532388, "grad_norm": 1.4140625, "learning_rate": 0.000404238278397502, "loss": 4.8461, "mean_token_accuracy": 0.2183850958943367, "num_tokens": 69256648.0, "step": 39925 }, { "entropy": 5.883499622344971, "epoch": 3.106671853724956, "grad_norm": 1.3125, "learning_rate": 0.00040421558998772293, "loss": 4.9779, "mean_token_accuracy": 0.21470011472702027, "num_tokens": 69265560.0, "step": 39930 }, { "entropy": 5.799188899993896, "epoch": 3.1070608830966737, "grad_norm": 1.328125, "learning_rate": 0.000404192899617303, "loss": 4.9479, "mean_token_accuracy": 0.21160530745983125, "num_tokens": 69273826.0, "step": 39935 }, { "entropy": 5.900342273712158, "epoch": 3.1074499124683914, "grad_norm": 1.203125, "learning_rate": 0.0004041702072865864, "loss": 5.1223, "mean_token_accuracy": 0.20296073257923125, "num_tokens": 69282734.0, "step": 39940 }, { "entropy": 5.851091098785401, "epoch": 3.107838941840109, "grad_norm": 1.234375, "learning_rate": 0.0004041475129959176, "loss": 4.9858, "mean_token_accuracy": 0.20718630850315095, "num_tokens": 69291719.0, "step": 39945 }, { "entropy": 5.931534194946289, "epoch": 3.1082279712118264, "grad_norm": 1.4296875, "learning_rate": 0.0004041248167456408, "loss": 5.0741, "mean_token_accuracy": 0.19957407861948012, "num_tokens": 69300485.0, "step": 39950 }, { "entropy": 5.800767040252685, "epoch": 3.108617000583544, "grad_norm": 1.21875, "learning_rate": 0.0004041021185361004, "loss": 5.0163, "mean_token_accuracy": 0.21054073423147202, "num_tokens": 69309565.0, "step": 39955 }, { "entropy": 5.889333868026734, "epoch": 3.1090060299552618, "grad_norm": 1.4296875, "learning_rate": 0.0004040794183676409, "loss": 4.9864, "mean_token_accuracy": 0.20637501478195192, "num_tokens": 69317476.0, "step": 39960 }, { "entropy": 5.835377597808838, "epoch": 3.109395059326979, "grad_norm": 1.359375, "learning_rate": 0.0004040567162406066, "loss": 4.9795, "mean_token_accuracy": 0.2079806849360466, "num_tokens": 69325639.0, "step": 39965 }, { "entropy": 5.877812242507934, "epoch": 3.1097840886986967, "grad_norm": 1.3203125, "learning_rate": 0.0004040340121553421, "loss": 4.9968, "mean_token_accuracy": 0.20692819952964783, "num_tokens": 69334171.0, "step": 39970 }, { "entropy": 5.893484783172608, "epoch": 3.1101731180704144, "grad_norm": 1.3203125, "learning_rate": 0.0004040113061121918, "loss": 5.011, "mean_token_accuracy": 0.20641206949949265, "num_tokens": 69342246.0, "step": 39975 }, { "entropy": 5.883691263198853, "epoch": 3.110562147442132, "grad_norm": 1.453125, "learning_rate": 0.00040398859811150036, "loss": 5.0773, "mean_token_accuracy": 0.20161260664463043, "num_tokens": 69351153.0, "step": 39980 }, { "entropy": 5.915554857254028, "epoch": 3.1109511768138494, "grad_norm": 1.390625, "learning_rate": 0.0004039658881536122, "loss": 4.9723, "mean_token_accuracy": 0.20937211364507674, "num_tokens": 69359367.0, "step": 39985 }, { "entropy": 5.889568519592285, "epoch": 3.111340206185567, "grad_norm": 1.4765625, "learning_rate": 0.0004039431762388719, "loss": 5.0734, "mean_token_accuracy": 0.2073922112584114, "num_tokens": 69367815.0, "step": 39990 }, { "entropy": 5.805947780609131, "epoch": 3.1117292355572848, "grad_norm": 1.296875, "learning_rate": 0.0004039204623676242, "loss": 4.9173, "mean_token_accuracy": 0.21688165217638017, "num_tokens": 69376287.0, "step": 39995 }, { "entropy": 5.803370189666748, "epoch": 3.112118264929002, "grad_norm": 1.28125, "learning_rate": 0.00040389774654021367, "loss": 4.9663, "mean_token_accuracy": 0.20872773975133896, "num_tokens": 69385153.0, "step": 40000 }, { "entropy": 5.806214761734009, "epoch": 3.1125072943007197, "grad_norm": 1.421875, "learning_rate": 0.000403875028756985, "loss": 4.8979, "mean_token_accuracy": 0.2201690822839737, "num_tokens": 69393499.0, "step": 40005 }, { "entropy": 5.779525232315064, "epoch": 3.1128963236724374, "grad_norm": 1.328125, "learning_rate": 0.0004038523090182829, "loss": 4.8692, "mean_token_accuracy": 0.21890356093645097, "num_tokens": 69401646.0, "step": 40010 }, { "entropy": 5.782726097106933, "epoch": 3.1132853530441547, "grad_norm": 1.3515625, "learning_rate": 0.000403829587324452, "loss": 4.9218, "mean_token_accuracy": 0.20808209776878356, "num_tokens": 69410375.0, "step": 40015 }, { "entropy": 5.770151042938233, "epoch": 3.1136743824158724, "grad_norm": 1.421875, "learning_rate": 0.0004038068636758373, "loss": 4.9366, "mean_token_accuracy": 0.21252161711454393, "num_tokens": 69419092.0, "step": 40020 }, { "entropy": 5.863152980804443, "epoch": 3.11406341178759, "grad_norm": 1.2578125, "learning_rate": 0.0004037841380727834, "loss": 4.9914, "mean_token_accuracy": 0.2098824143409729, "num_tokens": 69427995.0, "step": 40025 }, { "entropy": 5.8368566036224365, "epoch": 3.1144524411593073, "grad_norm": 1.2109375, "learning_rate": 0.0004037614105156352, "loss": 4.9619, "mean_token_accuracy": 0.2097489833831787, "num_tokens": 69437598.0, "step": 40030 }, { "entropy": 5.790478181838989, "epoch": 3.114841470531025, "grad_norm": 1.390625, "learning_rate": 0.0004037386810047376, "loss": 4.8481, "mean_token_accuracy": 0.21976030766963958, "num_tokens": 69445940.0, "step": 40035 }, { "entropy": 5.843204593658447, "epoch": 3.1152304999027427, "grad_norm": 1.328125, "learning_rate": 0.0004037159495404354, "loss": 4.9866, "mean_token_accuracy": 0.2094413787126541, "num_tokens": 69454818.0, "step": 40040 }, { "entropy": 5.820031833648682, "epoch": 3.1156195292744604, "grad_norm": 1.3203125, "learning_rate": 0.00040369321612307343, "loss": 4.8711, "mean_token_accuracy": 0.2219756841659546, "num_tokens": 69463576.0, "step": 40045 }, { "entropy": 5.8234210968017575, "epoch": 3.1160085586461777, "grad_norm": 1.1953125, "learning_rate": 0.00040367048075299684, "loss": 4.9098, "mean_token_accuracy": 0.21445341259241105, "num_tokens": 69472178.0, "step": 40050 }, { "entropy": 5.801731729507447, "epoch": 3.1163975880178953, "grad_norm": 1.3359375, "learning_rate": 0.0004036477434305505, "loss": 4.929, "mean_token_accuracy": 0.21776547729969026, "num_tokens": 69480833.0, "step": 40055 }, { "entropy": 5.854745388031006, "epoch": 3.116786617389613, "grad_norm": 1.3515625, "learning_rate": 0.0004036250041560794, "loss": 5.0651, "mean_token_accuracy": 0.20434667617082597, "num_tokens": 69489803.0, "step": 40060 }, { "entropy": 5.836640357971191, "epoch": 3.1171756467613303, "grad_norm": 1.2890625, "learning_rate": 0.0004036022629299286, "loss": 4.9963, "mean_token_accuracy": 0.2055136740207672, "num_tokens": 69498718.0, "step": 40065 }, { "entropy": 5.787019157409668, "epoch": 3.117564676133048, "grad_norm": 1.1796875, "learning_rate": 0.0004035795197524431, "loss": 4.9762, "mean_token_accuracy": 0.20869474560022355, "num_tokens": 69507817.0, "step": 40070 }, { "entropy": 5.761875486373901, "epoch": 3.1179537055047657, "grad_norm": 1.25, "learning_rate": 0.0004035567746239681, "loss": 4.9256, "mean_token_accuracy": 0.2142111226916313, "num_tokens": 69516972.0, "step": 40075 }, { "entropy": 5.7798707485198975, "epoch": 3.1183427348764834, "grad_norm": 1.25, "learning_rate": 0.00040353402754484866, "loss": 4.9471, "mean_token_accuracy": 0.20742768347263335, "num_tokens": 69525454.0, "step": 40080 }, { "entropy": 5.812829923629761, "epoch": 3.1187317642482006, "grad_norm": 1.359375, "learning_rate": 0.0004035112785154299, "loss": 4.9334, "mean_token_accuracy": 0.2090970605611801, "num_tokens": 69534135.0, "step": 40085 }, { "entropy": 5.8310764789581295, "epoch": 3.1191207936199183, "grad_norm": 1.4609375, "learning_rate": 0.00040348852753605707, "loss": 4.9976, "mean_token_accuracy": 0.20613928735256196, "num_tokens": 69542223.0, "step": 40090 }, { "entropy": 5.9026566505432125, "epoch": 3.119509822991636, "grad_norm": 1.3125, "learning_rate": 0.00040346577460707535, "loss": 5.026, "mean_token_accuracy": 0.2035836935043335, "num_tokens": 69550708.0, "step": 40095 }, { "entropy": 5.8297196388244625, "epoch": 3.1198988523633533, "grad_norm": 1.296875, "learning_rate": 0.00040344301972882997, "loss": 4.8858, "mean_token_accuracy": 0.22045668661594392, "num_tokens": 69559121.0, "step": 40100 }, { "entropy": 5.790639400482178, "epoch": 3.120287881735071, "grad_norm": 1.3046875, "learning_rate": 0.0004034202629016662, "loss": 4.8863, "mean_token_accuracy": 0.2166861206293106, "num_tokens": 69567848.0, "step": 40105 }, { "entropy": 5.819609451293945, "epoch": 3.1206769111067887, "grad_norm": 1.34375, "learning_rate": 0.00040339750412592937, "loss": 4.9774, "mean_token_accuracy": 0.21455069929361342, "num_tokens": 69577203.0, "step": 40110 }, { "entropy": 5.8763209819793705, "epoch": 3.121065940478506, "grad_norm": 1.3203125, "learning_rate": 0.0004033747434019647, "loss": 4.9737, "mean_token_accuracy": 0.20454567521810532, "num_tokens": 69585906.0, "step": 40115 }, { "entropy": 5.805637407302856, "epoch": 3.1214549698502236, "grad_norm": 1.2734375, "learning_rate": 0.00040335198073011765, "loss": 4.9604, "mean_token_accuracy": 0.2043014094233513, "num_tokens": 69594089.0, "step": 40120 }, { "entropy": 5.814443159103393, "epoch": 3.1218439992219413, "grad_norm": 1.3125, "learning_rate": 0.0004033292161107336, "loss": 5.0102, "mean_token_accuracy": 0.2048396185040474, "num_tokens": 69603592.0, "step": 40125 }, { "entropy": 5.778817844390869, "epoch": 3.122233028593659, "grad_norm": 1.4140625, "learning_rate": 0.00040330644954415795, "loss": 4.8827, "mean_token_accuracy": 0.21359294205904006, "num_tokens": 69612159.0, "step": 40130 }, { "entropy": 5.824108552932739, "epoch": 3.1226220579653763, "grad_norm": 1.2578125, "learning_rate": 0.0004032836810307362, "loss": 4.9357, "mean_token_accuracy": 0.21542113572359084, "num_tokens": 69620459.0, "step": 40135 }, { "entropy": 5.881754207611084, "epoch": 3.123011087337094, "grad_norm": 1.453125, "learning_rate": 0.0004032609105708137, "loss": 5.128, "mean_token_accuracy": 0.20173619091510772, "num_tokens": 69628629.0, "step": 40140 }, { "entropy": 5.776310014724731, "epoch": 3.1234001167088117, "grad_norm": 1.265625, "learning_rate": 0.00040323813816473604, "loss": 4.9642, "mean_token_accuracy": 0.21074060052633287, "num_tokens": 69637932.0, "step": 40145 }, { "entropy": 5.821606397628784, "epoch": 3.123789146080529, "grad_norm": 1.390625, "learning_rate": 0.0004032153638128488, "loss": 4.9006, "mean_token_accuracy": 0.21056067198514938, "num_tokens": 69646683.0, "step": 40150 }, { "entropy": 5.824298858642578, "epoch": 3.1241781754522466, "grad_norm": 1.3359375, "learning_rate": 0.00040319258751549743, "loss": 4.956, "mean_token_accuracy": 0.20730064958333969, "num_tokens": 69656030.0, "step": 40155 }, { "entropy": 5.818621730804443, "epoch": 3.1245672048239643, "grad_norm": 1.3359375, "learning_rate": 0.00040316980927302765, "loss": 4.9467, "mean_token_accuracy": 0.21067807525396348, "num_tokens": 69664862.0, "step": 40160 }, { "entropy": 5.858176279067993, "epoch": 3.1249562341956816, "grad_norm": 1.4296875, "learning_rate": 0.00040314702908578496, "loss": 5.0264, "mean_token_accuracy": 0.20013206154108049, "num_tokens": 69673149.0, "step": 40165 }, { "entropy": 5.822961235046387, "epoch": 3.1253452635673993, "grad_norm": 1.40625, "learning_rate": 0.0004031242469541151, "loss": 4.9587, "mean_token_accuracy": 0.21044673323631286, "num_tokens": 69681734.0, "step": 40170 }, { "entropy": 5.779229354858399, "epoch": 3.125734292939117, "grad_norm": 1.4140625, "learning_rate": 0.00040310146287836373, "loss": 4.939, "mean_token_accuracy": 0.2185847356915474, "num_tokens": 69690061.0, "step": 40175 }, { "entropy": 5.807046270370483, "epoch": 3.1261233223108347, "grad_norm": 1.3984375, "learning_rate": 0.00040307867685887653, "loss": 4.9297, "mean_token_accuracy": 0.2115536719560623, "num_tokens": 69697489.0, "step": 40180 }, { "entropy": 5.818188714981079, "epoch": 3.126512351682552, "grad_norm": 1.3671875, "learning_rate": 0.00040305588889599927, "loss": 4.917, "mean_token_accuracy": 0.21121968030929567, "num_tokens": 69705927.0, "step": 40185 }, { "entropy": 5.839116525650025, "epoch": 3.1269013810542696, "grad_norm": 1.34375, "learning_rate": 0.0004030330989900777, "loss": 5.0659, "mean_token_accuracy": 0.2058378130197525, "num_tokens": 69714266.0, "step": 40190 }, { "entropy": 5.800013732910156, "epoch": 3.1272904104259873, "grad_norm": 1.375, "learning_rate": 0.00040301030714145764, "loss": 4.9727, "mean_token_accuracy": 0.2117864727973938, "num_tokens": 69723058.0, "step": 40195 }, { "entropy": 5.917342805862427, "epoch": 3.1276794397977046, "grad_norm": 1.453125, "learning_rate": 0.000402987513350485, "loss": 5.0766, "mean_token_accuracy": 0.20152245908975602, "num_tokens": 69732177.0, "step": 40200 }, { "entropy": 5.8905336380004885, "epoch": 3.1280684691694223, "grad_norm": 1.3125, "learning_rate": 0.0004029647176175055, "loss": 5.005, "mean_token_accuracy": 0.20389846116304397, "num_tokens": 69740989.0, "step": 40205 }, { "entropy": 5.841110897064209, "epoch": 3.12845749854114, "grad_norm": 1.328125, "learning_rate": 0.00040294191994286513, "loss": 4.9296, "mean_token_accuracy": 0.20669352263212204, "num_tokens": 69750167.0, "step": 40210 }, { "entropy": 5.8172996044158936, "epoch": 3.1288465279128572, "grad_norm": 1.3515625, "learning_rate": 0.00040291912032690963, "loss": 4.9215, "mean_token_accuracy": 0.2121083542704582, "num_tokens": 69758893.0, "step": 40215 }, { "entropy": 5.822016763687134, "epoch": 3.129235557284575, "grad_norm": 1.8828125, "learning_rate": 0.0004028963187699852, "loss": 5.0064, "mean_token_accuracy": 0.20734311789274215, "num_tokens": 69767260.0, "step": 40220 }, { "entropy": 5.819591236114502, "epoch": 3.1296245866562926, "grad_norm": 1.4765625, "learning_rate": 0.0004028735152724377, "loss": 4.898, "mean_token_accuracy": 0.21299513578414916, "num_tokens": 69775445.0, "step": 40225 }, { "entropy": 5.810562658309936, "epoch": 3.1300136160280103, "grad_norm": 1.3046875, "learning_rate": 0.00040285070983461313, "loss": 4.9008, "mean_token_accuracy": 0.21200814545154573, "num_tokens": 69783349.0, "step": 40230 }, { "entropy": 5.850481605529785, "epoch": 3.1304026453997276, "grad_norm": 1.2109375, "learning_rate": 0.00040282790245685753, "loss": 5.0278, "mean_token_accuracy": 0.2077539950609207, "num_tokens": 69792133.0, "step": 40235 }, { "entropy": 5.8847472190856935, "epoch": 3.1307916747714453, "grad_norm": 1.3671875, "learning_rate": 0.000402805093139517, "loss": 5.0607, "mean_token_accuracy": 0.20345744043588637, "num_tokens": 69800631.0, "step": 40240 }, { "entropy": 5.901767730712891, "epoch": 3.131180704143163, "grad_norm": 1.3671875, "learning_rate": 0.0004027822818829375, "loss": 5.0116, "mean_token_accuracy": 0.2094697266817093, "num_tokens": 69808587.0, "step": 40245 }, { "entropy": 5.8752203464508055, "epoch": 3.13156973351488, "grad_norm": 1.3125, "learning_rate": 0.0004027594686874653, "loss": 4.9948, "mean_token_accuracy": 0.21248363703489304, "num_tokens": 69817623.0, "step": 40250 }, { "entropy": 5.795353698730469, "epoch": 3.131958762886598, "grad_norm": 1.21875, "learning_rate": 0.00040273665355344655, "loss": 4.9312, "mean_token_accuracy": 0.2137333258986473, "num_tokens": 69826917.0, "step": 40255 }, { "entropy": 5.803816270828247, "epoch": 3.1323477922583156, "grad_norm": 1.21875, "learning_rate": 0.0004027138364812274, "loss": 4.9014, "mean_token_accuracy": 0.21781387478113173, "num_tokens": 69836117.0, "step": 40260 }, { "entropy": 5.785936975479126, "epoch": 3.132736821630033, "grad_norm": 1.3046875, "learning_rate": 0.0004026910174711541, "loss": 4.8887, "mean_token_accuracy": 0.21654711216688155, "num_tokens": 69843939.0, "step": 40265 }, { "entropy": 5.832336664199829, "epoch": 3.1331258510017506, "grad_norm": 1.359375, "learning_rate": 0.00040266819652357266, "loss": 5.0284, "mean_token_accuracy": 0.20243005603551864, "num_tokens": 69852295.0, "step": 40270 }, { "entropy": 5.82201042175293, "epoch": 3.1335148803734683, "grad_norm": 1.3359375, "learning_rate": 0.00040264537363882976, "loss": 5.051, "mean_token_accuracy": 0.20367805361747743, "num_tokens": 69860953.0, "step": 40275 }, { "entropy": 5.816664695739746, "epoch": 3.133903909745186, "grad_norm": 1.2890625, "learning_rate": 0.00040262254881727135, "loss": 4.9798, "mean_token_accuracy": 0.20768935829401017, "num_tokens": 69869894.0, "step": 40280 }, { "entropy": 5.774884748458862, "epoch": 3.134292939116903, "grad_norm": 1.3828125, "learning_rate": 0.00040259972205924395, "loss": 4.8761, "mean_token_accuracy": 0.21823182553052903, "num_tokens": 69878041.0, "step": 40285 }, { "entropy": 5.8078546047210695, "epoch": 3.134681968488621, "grad_norm": 1.328125, "learning_rate": 0.00040257689336509385, "loss": 4.8628, "mean_token_accuracy": 0.2134632796049118, "num_tokens": 69886362.0, "step": 40290 }, { "entropy": 5.784028053283691, "epoch": 3.1350709978603386, "grad_norm": 1.296875, "learning_rate": 0.0004025540627351675, "loss": 4.9311, "mean_token_accuracy": 0.21380906254053117, "num_tokens": 69895268.0, "step": 40295 }, { "entropy": 5.833011102676392, "epoch": 3.135460027232056, "grad_norm": 1.625, "learning_rate": 0.0004025312301698112, "loss": 4.9822, "mean_token_accuracy": 0.21301034986972808, "num_tokens": 69903947.0, "step": 40300 }, { "entropy": 5.791469669342041, "epoch": 3.1358490566037736, "grad_norm": 1.234375, "learning_rate": 0.0004025083956693715, "loss": 4.9736, "mean_token_accuracy": 0.21207018941640854, "num_tokens": 69912979.0, "step": 40305 }, { "entropy": 5.8085626602172855, "epoch": 3.1362380859754913, "grad_norm": 1.2890625, "learning_rate": 0.0004024855592341948, "loss": 4.997, "mean_token_accuracy": 0.20559774935245514, "num_tokens": 69921586.0, "step": 40310 }, { "entropy": 5.853162431716919, "epoch": 3.136627115347209, "grad_norm": 1.2734375, "learning_rate": 0.0004024627208646277, "loss": 4.9913, "mean_token_accuracy": 0.21060082465410232, "num_tokens": 69930398.0, "step": 40315 }, { "entropy": 5.8178972721099855, "epoch": 3.137016144718926, "grad_norm": 1.3046875, "learning_rate": 0.00040243988056101667, "loss": 4.984, "mean_token_accuracy": 0.21199561059474945, "num_tokens": 69937910.0, "step": 40320 }, { "entropy": 5.787692546844482, "epoch": 3.137405174090644, "grad_norm": 1.3515625, "learning_rate": 0.0004024170383237083, "loss": 4.9155, "mean_token_accuracy": 0.21200582534074783, "num_tokens": 69946740.0, "step": 40325 }, { "entropy": 5.775153589248657, "epoch": 3.1377942034623616, "grad_norm": 1.3515625, "learning_rate": 0.0004023941941530492, "loss": 4.9801, "mean_token_accuracy": 0.20861496925354003, "num_tokens": 69955998.0, "step": 40330 }, { "entropy": 5.837852954864502, "epoch": 3.138183232834079, "grad_norm": 1.2421875, "learning_rate": 0.000402371348049386, "loss": 4.9974, "mean_token_accuracy": 0.20877424925565718, "num_tokens": 69964503.0, "step": 40335 }, { "entropy": 5.835185432434082, "epoch": 3.1385722622057965, "grad_norm": 1.296875, "learning_rate": 0.0004023485000130653, "loss": 4.9246, "mean_token_accuracy": 0.21645782440900802, "num_tokens": 69972814.0, "step": 40340 }, { "entropy": 5.765787124633789, "epoch": 3.1389612915775142, "grad_norm": 1.359375, "learning_rate": 0.00040232565004443373, "loss": 4.8849, "mean_token_accuracy": 0.21246777474880219, "num_tokens": 69981891.0, "step": 40345 }, { "entropy": 5.821150875091552, "epoch": 3.1393503209492315, "grad_norm": 1.3671875, "learning_rate": 0.0004023027981438382, "loss": 5.0083, "mean_token_accuracy": 0.2026303917169571, "num_tokens": 69990596.0, "step": 40350 }, { "entropy": 5.804481840133667, "epoch": 3.139739350320949, "grad_norm": 1.3359375, "learning_rate": 0.00040227994431162517, "loss": 4.9416, "mean_token_accuracy": 0.2177239954471588, "num_tokens": 69999369.0, "step": 40355 }, { "entropy": 5.761489820480347, "epoch": 3.140128379692667, "grad_norm": 1.203125, "learning_rate": 0.00040225708854814174, "loss": 4.9412, "mean_token_accuracy": 0.20815413892269136, "num_tokens": 70008290.0, "step": 40360 }, { "entropy": 5.869994497299194, "epoch": 3.140517409064384, "grad_norm": 1.3359375, "learning_rate": 0.0004022342308537345, "loss": 5.0514, "mean_token_accuracy": 0.2080064058303833, "num_tokens": 70016730.0, "step": 40365 }, { "entropy": 5.740296411514282, "epoch": 3.140906438436102, "grad_norm": 1.375, "learning_rate": 0.0004022113712287503, "loss": 4.9678, "mean_token_accuracy": 0.2100544676184654, "num_tokens": 70025115.0, "step": 40370 }, { "entropy": 5.821581125259399, "epoch": 3.1412954678078195, "grad_norm": 1.25, "learning_rate": 0.000402188509673536, "loss": 4.9499, "mean_token_accuracy": 0.21034393906593324, "num_tokens": 70033399.0, "step": 40375 }, { "entropy": 5.856101703643799, "epoch": 3.1416844971795372, "grad_norm": 1.375, "learning_rate": 0.00040216564618843854, "loss": 4.9734, "mean_token_accuracy": 0.21026332974433898, "num_tokens": 70041756.0, "step": 40380 }, { "entropy": 5.816487884521484, "epoch": 3.1420735265512545, "grad_norm": 1.359375, "learning_rate": 0.0004021427807738048, "loss": 4.8792, "mean_token_accuracy": 0.2189151644706726, "num_tokens": 70050457.0, "step": 40385 }, { "entropy": 5.844017362594604, "epoch": 3.142462555922972, "grad_norm": 1.21875, "learning_rate": 0.0004021199134299817, "loss": 4.9962, "mean_token_accuracy": 0.20541880279779434, "num_tokens": 70059176.0, "step": 40390 }, { "entropy": 5.793991994857788, "epoch": 3.14285158529469, "grad_norm": 1.265625, "learning_rate": 0.00040209704415731623, "loss": 4.9443, "mean_token_accuracy": 0.21523598730564117, "num_tokens": 70067882.0, "step": 40395 }, { "entropy": 5.785449600219726, "epoch": 3.143240614666407, "grad_norm": 1.375, "learning_rate": 0.00040207417295615546, "loss": 4.8998, "mean_token_accuracy": 0.21717049032449723, "num_tokens": 70076295.0, "step": 40400 }, { "entropy": 5.815502738952636, "epoch": 3.143629644038125, "grad_norm": 1.2421875, "learning_rate": 0.00040205129982684635, "loss": 4.9361, "mean_token_accuracy": 0.21539311856031418, "num_tokens": 70085911.0, "step": 40405 }, { "entropy": 5.822138881683349, "epoch": 3.1440186734098425, "grad_norm": 1.453125, "learning_rate": 0.00040202842476973606, "loss": 5.0026, "mean_token_accuracy": 0.20450359135866164, "num_tokens": 70094518.0, "step": 40410 }, { "entropy": 5.847254705429077, "epoch": 3.1444077027815602, "grad_norm": 1.2109375, "learning_rate": 0.00040200554778517154, "loss": 5.0472, "mean_token_accuracy": 0.20179277658462524, "num_tokens": 70103628.0, "step": 40415 }, { "entropy": 5.875411939620972, "epoch": 3.1447967321532775, "grad_norm": 1.3515625, "learning_rate": 0.00040198266887349994, "loss": 4.9786, "mean_token_accuracy": 0.20918790698051454, "num_tokens": 70111974.0, "step": 40420 }, { "entropy": 5.865532970428466, "epoch": 3.145185761524995, "grad_norm": 1.296875, "learning_rate": 0.00040195978803506853, "loss": 5.0119, "mean_token_accuracy": 0.20579386204481126, "num_tokens": 70121077.0, "step": 40425 }, { "entropy": 5.776202249526977, "epoch": 3.145574790896713, "grad_norm": 1.328125, "learning_rate": 0.00040193690527022443, "loss": 4.9065, "mean_token_accuracy": 0.2185719221830368, "num_tokens": 70129852.0, "step": 40430 }, { "entropy": 5.827106761932373, "epoch": 3.14596382026843, "grad_norm": 1.2265625, "learning_rate": 0.00040191402057931474, "loss": 4.99, "mean_token_accuracy": 0.20987142473459244, "num_tokens": 70138285.0, "step": 40435 }, { "entropy": 5.925323390960694, "epoch": 3.146352849640148, "grad_norm": 1.390625, "learning_rate": 0.0004018911339626869, "loss": 5.0166, "mean_token_accuracy": 0.2007739469408989, "num_tokens": 70147092.0, "step": 40440 }, { "entropy": 5.810503101348877, "epoch": 3.1467418790118655, "grad_norm": 1.3203125, "learning_rate": 0.000401868245420688, "loss": 4.917, "mean_token_accuracy": 0.21432065963745117, "num_tokens": 70155663.0, "step": 40445 }, { "entropy": 5.770821142196655, "epoch": 3.147130908383583, "grad_norm": 1.3046875, "learning_rate": 0.00040184535495366543, "loss": 4.9216, "mean_token_accuracy": 0.21857451796531677, "num_tokens": 70163954.0, "step": 40450 }, { "entropy": 5.846753311157227, "epoch": 3.1475199377553005, "grad_norm": 1.296875, "learning_rate": 0.0004018224625619664, "loss": 5.0275, "mean_token_accuracy": 0.20230946093797683, "num_tokens": 70173103.0, "step": 40455 }, { "entropy": 5.827665042877197, "epoch": 3.147908967127018, "grad_norm": 1.2109375, "learning_rate": 0.00040179956824593847, "loss": 5.0165, "mean_token_accuracy": 0.2041011556982994, "num_tokens": 70181821.0, "step": 40460 }, { "entropy": 5.8914872169494625, "epoch": 3.1482979964987354, "grad_norm": 1.3828125, "learning_rate": 0.00040177667200592894, "loss": 5.0156, "mean_token_accuracy": 0.2071906343102455, "num_tokens": 70190257.0, "step": 40465 }, { "entropy": 5.890468740463257, "epoch": 3.148687025870453, "grad_norm": 1.3671875, "learning_rate": 0.0004017537738422852, "loss": 5.0295, "mean_token_accuracy": 0.2050318956375122, "num_tokens": 70199487.0, "step": 40470 }, { "entropy": 5.741133689880371, "epoch": 3.149076055242171, "grad_norm": 1.328125, "learning_rate": 0.00040173087375535457, "loss": 4.8825, "mean_token_accuracy": 0.21920528262853622, "num_tokens": 70207629.0, "step": 40475 }, { "entropy": 5.837794971466065, "epoch": 3.1494650846138885, "grad_norm": 1.421875, "learning_rate": 0.00040170797174548476, "loss": 4.9881, "mean_token_accuracy": 0.21289512366056443, "num_tokens": 70215768.0, "step": 40480 }, { "entropy": 5.8833390235900875, "epoch": 3.1498541139856058, "grad_norm": 1.4765625, "learning_rate": 0.00040168506781302303, "loss": 4.9975, "mean_token_accuracy": 0.20677034705877304, "num_tokens": 70223570.0, "step": 40485 }, { "entropy": 5.7176148891448975, "epoch": 3.1502431433573235, "grad_norm": 1.3203125, "learning_rate": 0.0004016621619583171, "loss": 4.8545, "mean_token_accuracy": 0.21594338566064836, "num_tokens": 70233032.0, "step": 40490 }, { "entropy": 5.792489099502563, "epoch": 3.150632172729041, "grad_norm": 1.3671875, "learning_rate": 0.00040163925418171454, "loss": 4.8917, "mean_token_accuracy": 0.21792149245738984, "num_tokens": 70241091.0, "step": 40495 }, { "entropy": 5.8299891471862795, "epoch": 3.1510212021007584, "grad_norm": 1.3046875, "learning_rate": 0.0004016163444835628, "loss": 5.0735, "mean_token_accuracy": 0.19838575273752213, "num_tokens": 70249595.0, "step": 40500 }, { "entropy": 5.87692403793335, "epoch": 3.151410231472476, "grad_norm": 1.3359375, "learning_rate": 0.0004015934328642096, "loss": 5.0013, "mean_token_accuracy": 0.2075623616576195, "num_tokens": 70258376.0, "step": 40505 }, { "entropy": 5.849141407012939, "epoch": 3.151799260844194, "grad_norm": 1.3515625, "learning_rate": 0.00040157051932400244, "loss": 4.8751, "mean_token_accuracy": 0.2094455197453499, "num_tokens": 70266501.0, "step": 40510 }, { "entropy": 5.834272050857544, "epoch": 3.1521882902159115, "grad_norm": 1.4453125, "learning_rate": 0.0004015476038632892, "loss": 5.0229, "mean_token_accuracy": 0.20340104252099991, "num_tokens": 70274029.0, "step": 40515 }, { "entropy": 5.789268112182617, "epoch": 3.1525773195876288, "grad_norm": 1.171875, "learning_rate": 0.0004015246864824175, "loss": 4.9678, "mean_token_accuracy": 0.20911374241113662, "num_tokens": 70282608.0, "step": 40520 }, { "entropy": 5.770678329467773, "epoch": 3.1529663489593465, "grad_norm": 1.3359375, "learning_rate": 0.00040150176718173504, "loss": 4.9678, "mean_token_accuracy": 0.20731696039438247, "num_tokens": 70291350.0, "step": 40525 }, { "entropy": 5.854278182983398, "epoch": 3.153355378331064, "grad_norm": 1.390625, "learning_rate": 0.0004014788459615896, "loss": 4.9384, "mean_token_accuracy": 0.21519835740327836, "num_tokens": 70299883.0, "step": 40530 }, { "entropy": 5.845732688903809, "epoch": 3.1537444077027814, "grad_norm": 1.3515625, "learning_rate": 0.0004014559228223291, "loss": 4.9471, "mean_token_accuracy": 0.20714075416326522, "num_tokens": 70308803.0, "step": 40535 }, { "entropy": 5.876364803314209, "epoch": 3.154133437074499, "grad_norm": 1.375, "learning_rate": 0.00040143299776430115, "loss": 4.9832, "mean_token_accuracy": 0.21998822391033174, "num_tokens": 70317349.0, "step": 40540 }, { "entropy": 5.8057541847229, "epoch": 3.154522466446217, "grad_norm": 1.28125, "learning_rate": 0.0004014100707878536, "loss": 4.9088, "mean_token_accuracy": 0.2139161556959152, "num_tokens": 70326199.0, "step": 40545 }, { "entropy": 5.813912200927734, "epoch": 3.154911495817934, "grad_norm": 1.3203125, "learning_rate": 0.00040138714189333455, "loss": 4.9899, "mean_token_accuracy": 0.20420707762241364, "num_tokens": 70335155.0, "step": 40550 }, { "entropy": 5.845198154449463, "epoch": 3.1553005251896518, "grad_norm": 1.359375, "learning_rate": 0.00040136421108109176, "loss": 4.9496, "mean_token_accuracy": 0.2106250450015068, "num_tokens": 70343127.0, "step": 40555 }, { "entropy": 5.856299638748169, "epoch": 3.1556895545613695, "grad_norm": 1.328125, "learning_rate": 0.0004013412783514732, "loss": 5.0155, "mean_token_accuracy": 0.2048309862613678, "num_tokens": 70352684.0, "step": 40560 }, { "entropy": 5.824615001678467, "epoch": 3.156078583933087, "grad_norm": 1.296875, "learning_rate": 0.0004013183437048268, "loss": 4.9102, "mean_token_accuracy": 0.21197241842746734, "num_tokens": 70361050.0, "step": 40565 }, { "entropy": 5.932951498031616, "epoch": 3.1564676133048044, "grad_norm": 1.3046875, "learning_rate": 0.00040129540714150066, "loss": 5.1325, "mean_token_accuracy": 0.19702691733837127, "num_tokens": 70371350.0, "step": 40570 }, { "entropy": 5.941982126235962, "epoch": 3.156856642676522, "grad_norm": 1.1171875, "learning_rate": 0.0004012724686618427, "loss": 5.0916, "mean_token_accuracy": 0.20024094432592393, "num_tokens": 70380806.0, "step": 40575 }, { "entropy": 5.874399948120117, "epoch": 3.15724567204824, "grad_norm": 1.3203125, "learning_rate": 0.000401249528266201, "loss": 4.9969, "mean_token_accuracy": 0.20955812335014343, "num_tokens": 70390142.0, "step": 40580 }, { "entropy": 5.88062891960144, "epoch": 3.157634701419957, "grad_norm": 1.34375, "learning_rate": 0.00040122658595492366, "loss": 5.0076, "mean_token_accuracy": 0.2118940085172653, "num_tokens": 70398345.0, "step": 40585 }, { "entropy": 5.81641206741333, "epoch": 3.1580237307916748, "grad_norm": 1.3671875, "learning_rate": 0.0004012036417283588, "loss": 4.9934, "mean_token_accuracy": 0.2095988377928734, "num_tokens": 70407107.0, "step": 40590 }, { "entropy": 5.806016540527343, "epoch": 3.1584127601633925, "grad_norm": 1.3515625, "learning_rate": 0.00040118069558685456, "loss": 4.9411, "mean_token_accuracy": 0.20756861567497253, "num_tokens": 70415053.0, "step": 40595 }, { "entropy": 5.798699235916137, "epoch": 3.1588017895351097, "grad_norm": 1.3125, "learning_rate": 0.00040115774753075905, "loss": 4.9326, "mean_token_accuracy": 0.21764702945947648, "num_tokens": 70423605.0, "step": 40600 }, { "entropy": 5.854818630218506, "epoch": 3.1591908189068274, "grad_norm": 1.34375, "learning_rate": 0.0004011347975604206, "loss": 4.9954, "mean_token_accuracy": 0.20296927988529206, "num_tokens": 70432155.0, "step": 40605 }, { "entropy": 5.915959024429322, "epoch": 3.159579848278545, "grad_norm": 1.3046875, "learning_rate": 0.0004011118456761873, "loss": 5.0323, "mean_token_accuracy": 0.20209593772888185, "num_tokens": 70441349.0, "step": 40610 }, { "entropy": 5.794466209411621, "epoch": 3.159968877650263, "grad_norm": 1.3125, "learning_rate": 0.0004010888918784075, "loss": 4.9881, "mean_token_accuracy": 0.20838527679443358, "num_tokens": 70449792.0, "step": 40615 }, { "entropy": 5.784317588806152, "epoch": 3.16035790702198, "grad_norm": 1.2734375, "learning_rate": 0.0004010659361674294, "loss": 4.9333, "mean_token_accuracy": 0.21568038016557695, "num_tokens": 70457699.0, "step": 40620 }, { "entropy": 5.762719821929932, "epoch": 3.1607469363936977, "grad_norm": 1.3984375, "learning_rate": 0.00040104297854360145, "loss": 4.9167, "mean_token_accuracy": 0.2138345345854759, "num_tokens": 70465704.0, "step": 40625 }, { "entropy": 5.763383913040161, "epoch": 3.1611359657654154, "grad_norm": 1.3515625, "learning_rate": 0.0004010200190072719, "loss": 4.9513, "mean_token_accuracy": 0.20991896688938141, "num_tokens": 70474462.0, "step": 40630 }, { "entropy": 5.861641931533813, "epoch": 3.1615249951371327, "grad_norm": 1.34375, "learning_rate": 0.0004009970575587891, "loss": 4.9417, "mean_token_accuracy": 0.2092234268784523, "num_tokens": 70482957.0, "step": 40635 }, { "entropy": 5.947053527832031, "epoch": 3.1619140245088504, "grad_norm": 1.203125, "learning_rate": 0.0004009740941985016, "loss": 5.085, "mean_token_accuracy": 0.20078970938920976, "num_tokens": 70492236.0, "step": 40640 }, { "entropy": 5.782573652267456, "epoch": 3.162303053880568, "grad_norm": 1.296875, "learning_rate": 0.0004009511289267576, "loss": 4.9455, "mean_token_accuracy": 0.20875199586153032, "num_tokens": 70501457.0, "step": 40645 }, { "entropy": 5.808731985092163, "epoch": 3.1626920832522853, "grad_norm": 1.3125, "learning_rate": 0.0004009281617439058, "loss": 4.9476, "mean_token_accuracy": 0.21594176441431046, "num_tokens": 70510444.0, "step": 40650 }, { "entropy": 5.817128658294678, "epoch": 3.163081112624003, "grad_norm": 1.328125, "learning_rate": 0.0004009051926502945, "loss": 4.9522, "mean_token_accuracy": 0.20876814275979996, "num_tokens": 70518823.0, "step": 40655 }, { "entropy": 5.8698302745819095, "epoch": 3.1634701419957207, "grad_norm": 1.2734375, "learning_rate": 0.00040088222164627233, "loss": 4.9121, "mean_token_accuracy": 0.2229241505265236, "num_tokens": 70527177.0, "step": 40660 }, { "entropy": 5.897339487075806, "epoch": 3.1638591713674384, "grad_norm": 1.328125, "learning_rate": 0.00040085924873218783, "loss": 5.0623, "mean_token_accuracy": 0.20917700082063675, "num_tokens": 70535749.0, "step": 40665 }, { "entropy": 5.7932007789611815, "epoch": 3.1642482007391557, "grad_norm": 1.2265625, "learning_rate": 0.0004008362739083895, "loss": 4.9458, "mean_token_accuracy": 0.21103404015302657, "num_tokens": 70544612.0, "step": 40670 }, { "entropy": 5.834151792526245, "epoch": 3.1646372301108734, "grad_norm": 1.359375, "learning_rate": 0.000400813297175226, "loss": 4.9225, "mean_token_accuracy": 0.21026256680488586, "num_tokens": 70553079.0, "step": 40675 }, { "entropy": 5.842628526687622, "epoch": 3.165026259482591, "grad_norm": 1.2890625, "learning_rate": 0.000400790318533046, "loss": 4.9781, "mean_token_accuracy": 0.21061391830444337, "num_tokens": 70561798.0, "step": 40680 }, { "entropy": 5.789656782150269, "epoch": 3.1654152888543083, "grad_norm": 1.328125, "learning_rate": 0.00040076733798219817, "loss": 4.9892, "mean_token_accuracy": 0.20368519127368928, "num_tokens": 70570738.0, "step": 40685 }, { "entropy": 5.816572761535644, "epoch": 3.165804318226026, "grad_norm": 1.2890625, "learning_rate": 0.0004007443555230312, "loss": 4.9495, "mean_token_accuracy": 0.20662213414907454, "num_tokens": 70579324.0, "step": 40690 }, { "entropy": 5.871837711334228, "epoch": 3.1661933475977437, "grad_norm": 1.2265625, "learning_rate": 0.00040072137115589366, "loss": 4.9813, "mean_token_accuracy": 0.2075667753815651, "num_tokens": 70588462.0, "step": 40695 }, { "entropy": 5.786119651794434, "epoch": 3.166582376969461, "grad_norm": 1.28125, "learning_rate": 0.0004006983848811345, "loss": 4.9124, "mean_token_accuracy": 0.21691821813583373, "num_tokens": 70596579.0, "step": 40700 }, { "entropy": 5.8506272315979, "epoch": 3.1669714063411787, "grad_norm": 1.40625, "learning_rate": 0.00040067539669910235, "loss": 4.9798, "mean_token_accuracy": 0.2085099160671234, "num_tokens": 70604516.0, "step": 40705 }, { "entropy": 5.847724342346192, "epoch": 3.1673604357128964, "grad_norm": 1.390625, "learning_rate": 0.0004006524066101461, "loss": 5.0225, "mean_token_accuracy": 0.20602555423974991, "num_tokens": 70612263.0, "step": 40710 }, { "entropy": 5.714101982116699, "epoch": 3.167749465084614, "grad_norm": 1.2578125, "learning_rate": 0.0004006294146146146, "loss": 4.8776, "mean_token_accuracy": 0.22389937490224837, "num_tokens": 70621246.0, "step": 40715 }, { "entropy": 5.80243992805481, "epoch": 3.1681384944563313, "grad_norm": 1.2421875, "learning_rate": 0.0004006064207128567, "loss": 4.9765, "mean_token_accuracy": 0.20752858072519303, "num_tokens": 70629935.0, "step": 40720 }, { "entropy": 5.907432126998901, "epoch": 3.168527523828049, "grad_norm": 1.2421875, "learning_rate": 0.00040058342490522134, "loss": 5.0339, "mean_token_accuracy": 0.19860286265611649, "num_tokens": 70638722.0, "step": 40725 }, { "entropy": 5.841650342941284, "epoch": 3.1689165531997667, "grad_norm": 1.234375, "learning_rate": 0.0004005604271920573, "loss": 4.9229, "mean_token_accuracy": 0.20609549880027772, "num_tokens": 70647835.0, "step": 40730 }, { "entropy": 5.8506042003631595, "epoch": 3.169305582571484, "grad_norm": 1.25, "learning_rate": 0.00040053742757371365, "loss": 4.9718, "mean_token_accuracy": 0.21097930371761323, "num_tokens": 70656668.0, "step": 40735 }, { "entropy": 5.888624382019043, "epoch": 3.1696946119432017, "grad_norm": 1.4140625, "learning_rate": 0.0004005144260505394, "loss": 4.9935, "mean_token_accuracy": 0.2065402314066887, "num_tokens": 70664921.0, "step": 40740 }, { "entropy": 5.86773829460144, "epoch": 3.1700836413149194, "grad_norm": 1.2890625, "learning_rate": 0.0004004914226228834, "loss": 4.9787, "mean_token_accuracy": 0.21195277571678162, "num_tokens": 70673435.0, "step": 40745 }, { "entropy": 5.766985750198364, "epoch": 3.170472670686637, "grad_norm": 1.34375, "learning_rate": 0.0004004684172910949, "loss": 4.93, "mean_token_accuracy": 0.21306199580430984, "num_tokens": 70682102.0, "step": 40750 }, { "entropy": 5.7209718227386475, "epoch": 3.1708617000583543, "grad_norm": 1.3046875, "learning_rate": 0.0004004454100555229, "loss": 4.8836, "mean_token_accuracy": 0.21658333241939545, "num_tokens": 70690356.0, "step": 40755 }, { "entropy": 5.814652156829834, "epoch": 3.171250729430072, "grad_norm": 1.3203125, "learning_rate": 0.00040042240091651645, "loss": 4.9187, "mean_token_accuracy": 0.21472711265087127, "num_tokens": 70698966.0, "step": 40760 }, { "entropy": 5.77323727607727, "epoch": 3.1716397588017897, "grad_norm": 1.421875, "learning_rate": 0.00040039938987442464, "loss": 4.9173, "mean_token_accuracy": 0.21694935411214827, "num_tokens": 70707144.0, "step": 40765 }, { "entropy": 5.801467037200927, "epoch": 3.172028788173507, "grad_norm": 1.25, "learning_rate": 0.00040037637692959667, "loss": 4.9629, "mean_token_accuracy": 0.21146585792303085, "num_tokens": 70716474.0, "step": 40770 }, { "entropy": 5.773419046401978, "epoch": 3.1724178175452247, "grad_norm": 1.2890625, "learning_rate": 0.00040035336208238176, "loss": 4.9499, "mean_token_accuracy": 0.21132237315177918, "num_tokens": 70725458.0, "step": 40775 }, { "entropy": 5.861338186264038, "epoch": 3.1728068469169424, "grad_norm": 1.234375, "learning_rate": 0.00040033034533312913, "loss": 5.0277, "mean_token_accuracy": 0.20323751866817474, "num_tokens": 70734828.0, "step": 40780 }, { "entropy": 5.907739305496216, "epoch": 3.1731958762886596, "grad_norm": 1.296875, "learning_rate": 0.000400307326682188, "loss": 5.0783, "mean_token_accuracy": 0.20688480585813523, "num_tokens": 70743229.0, "step": 40785 }, { "entropy": 5.871409273147583, "epoch": 3.1735849056603773, "grad_norm": 1.5625, "learning_rate": 0.00040028430612990755, "loss": 5.0286, "mean_token_accuracy": 0.2136978968977928, "num_tokens": 70751873.0, "step": 40790 }, { "entropy": 5.847549486160278, "epoch": 3.173973935032095, "grad_norm": 1.3671875, "learning_rate": 0.00040026128367663726, "loss": 5.0068, "mean_token_accuracy": 0.2006261706352234, "num_tokens": 70760617.0, "step": 40795 }, { "entropy": 5.847450304031372, "epoch": 3.1743629644038123, "grad_norm": 1.296875, "learning_rate": 0.00040023825932272635, "loss": 4.9902, "mean_token_accuracy": 0.20568694919347763, "num_tokens": 70769167.0, "step": 40800 }, { "entropy": 5.756580495834351, "epoch": 3.17475199377553, "grad_norm": 1.2421875, "learning_rate": 0.00040021523306852416, "loss": 4.956, "mean_token_accuracy": 0.21337173730134965, "num_tokens": 70778890.0, "step": 40805 }, { "entropy": 5.856593799591065, "epoch": 3.1751410231472477, "grad_norm": 1.3359375, "learning_rate": 0.00040019220491438007, "loss": 4.9781, "mean_token_accuracy": 0.20926121324300767, "num_tokens": 70787557.0, "step": 40810 }, { "entropy": 5.79703311920166, "epoch": 3.1755300525189654, "grad_norm": 1.2734375, "learning_rate": 0.0004001691748606436, "loss": 4.8802, "mean_token_accuracy": 0.2142474889755249, "num_tokens": 70795751.0, "step": 40815 }, { "entropy": 5.830465412139892, "epoch": 3.1759190818906826, "grad_norm": 1.34375, "learning_rate": 0.0004001461429076641, "loss": 4.9453, "mean_token_accuracy": 0.21754734516143798, "num_tokens": 70803938.0, "step": 40820 }, { "entropy": 5.845277404785156, "epoch": 3.1763081112624003, "grad_norm": 1.2421875, "learning_rate": 0.0004001231090557912, "loss": 4.9702, "mean_token_accuracy": 0.21298433542251588, "num_tokens": 70812196.0, "step": 40825 }, { "entropy": 5.832943248748779, "epoch": 3.176697140634118, "grad_norm": 1.28125, "learning_rate": 0.00040010007330537405, "loss": 5.0108, "mean_token_accuracy": 0.20421263724565505, "num_tokens": 70821118.0, "step": 40830 }, { "entropy": 5.757676124572754, "epoch": 3.1770861700058353, "grad_norm": 1.3046875, "learning_rate": 0.00040007703565676263, "loss": 4.9051, "mean_token_accuracy": 0.20895315408706666, "num_tokens": 70829785.0, "step": 40835 }, { "entropy": 5.833765459060669, "epoch": 3.177475199377553, "grad_norm": 1.2734375, "learning_rate": 0.00040005399611030615, "loss": 4.93, "mean_token_accuracy": 0.21874927580356598, "num_tokens": 70838054.0, "step": 40840 }, { "entropy": 5.881453371047973, "epoch": 3.1778642287492707, "grad_norm": 1.265625, "learning_rate": 0.0004000309546663543, "loss": 5.0425, "mean_token_accuracy": 0.2061159536242485, "num_tokens": 70846867.0, "step": 40845 }, { "entropy": 5.839722394943237, "epoch": 3.1782532581209884, "grad_norm": 1.328125, "learning_rate": 0.00040000791132525676, "loss": 5.0042, "mean_token_accuracy": 0.2171002969145775, "num_tokens": 70855369.0, "step": 40850 }, { "entropy": 5.878963756561279, "epoch": 3.1786422874927056, "grad_norm": 1.3046875, "learning_rate": 0.00039998486608736305, "loss": 4.9794, "mean_token_accuracy": 0.20918461233377456, "num_tokens": 70863888.0, "step": 40855 }, { "entropy": 5.776246452331543, "epoch": 3.1790313168644233, "grad_norm": 1.28125, "learning_rate": 0.0003999618189530231, "loss": 4.9788, "mean_token_accuracy": 0.2117355763912201, "num_tokens": 70872133.0, "step": 40860 }, { "entropy": 5.731360387802124, "epoch": 3.179420346236141, "grad_norm": 1.2890625, "learning_rate": 0.0003999387699225863, "loss": 4.8985, "mean_token_accuracy": 0.2181678369641304, "num_tokens": 70880691.0, "step": 40865 }, { "entropy": 5.893551158905029, "epoch": 3.1798093756078583, "grad_norm": 1.4453125, "learning_rate": 0.0003999157189964026, "loss": 5.0156, "mean_token_accuracy": 0.2124675914645195, "num_tokens": 70888552.0, "step": 40870 }, { "entropy": 5.855310392379761, "epoch": 3.180198404979576, "grad_norm": 1.2734375, "learning_rate": 0.0003998926661748217, "loss": 4.9501, "mean_token_accuracy": 0.21418712735176088, "num_tokens": 70897054.0, "step": 40875 }, { "entropy": 5.890038299560547, "epoch": 3.1805874343512937, "grad_norm": 1.4296875, "learning_rate": 0.0003998696114581933, "loss": 5.0965, "mean_token_accuracy": 0.20737634897232055, "num_tokens": 70905783.0, "step": 40880 }, { "entropy": 5.866379880905152, "epoch": 3.180976463723011, "grad_norm": 1.25, "learning_rate": 0.0003998465548468674, "loss": 5.0224, "mean_token_accuracy": 0.20334049463272094, "num_tokens": 70914424.0, "step": 40885 }, { "entropy": 5.852714729309082, "epoch": 3.1813654930947286, "grad_norm": 1.265625, "learning_rate": 0.0003998234963411936, "loss": 4.9668, "mean_token_accuracy": 0.21362429857254028, "num_tokens": 70923571.0, "step": 40890 }, { "entropy": 5.807128667831421, "epoch": 3.1817545224664463, "grad_norm": 1.3515625, "learning_rate": 0.0003998004359415221, "loss": 4.9262, "mean_token_accuracy": 0.21299878805875777, "num_tokens": 70931969.0, "step": 40895 }, { "entropy": 5.7305878639221195, "epoch": 3.1821435518381636, "grad_norm": 1.390625, "learning_rate": 0.00039977737364820247, "loss": 4.8066, "mean_token_accuracy": 0.21640298664569854, "num_tokens": 70940064.0, "step": 40900 }, { "entropy": 5.7752539157867435, "epoch": 3.1825325812098813, "grad_norm": 1.1953125, "learning_rate": 0.00039975430946158493, "loss": 4.9979, "mean_token_accuracy": 0.20028969198465346, "num_tokens": 70950429.0, "step": 40905 }, { "entropy": 5.797454166412353, "epoch": 3.182921610581599, "grad_norm": 1.2421875, "learning_rate": 0.0003997312433820192, "loss": 4.9403, "mean_token_accuracy": 0.21516282260417938, "num_tokens": 70959441.0, "step": 40910 }, { "entropy": 5.832349348068237, "epoch": 3.1833106399533166, "grad_norm": 1.3203125, "learning_rate": 0.00039970817540985545, "loss": 4.9487, "mean_token_accuracy": 0.21309252977371215, "num_tokens": 70967790.0, "step": 40915 }, { "entropy": 5.847241067886353, "epoch": 3.183699669325034, "grad_norm": 1.3671875, "learning_rate": 0.0003996851055454436, "loss": 4.9866, "mean_token_accuracy": 0.21228308826684952, "num_tokens": 70976851.0, "step": 40920 }, { "entropy": 5.920950412750244, "epoch": 3.1840886986967516, "grad_norm": 1.3046875, "learning_rate": 0.0003996620337891337, "loss": 5.1305, "mean_token_accuracy": 0.19785796403884887, "num_tokens": 70985452.0, "step": 40925 }, { "entropy": 5.881191682815552, "epoch": 3.1844777280684693, "grad_norm": 1.1875, "learning_rate": 0.000399638960141276, "loss": 4.9542, "mean_token_accuracy": 0.20491700917482375, "num_tokens": 70994597.0, "step": 40930 }, { "entropy": 5.867742109298706, "epoch": 3.1848667574401865, "grad_norm": 1.2578125, "learning_rate": 0.00039961588460222033, "loss": 5.0019, "mean_token_accuracy": 0.20652139633893968, "num_tokens": 71003642.0, "step": 40935 }, { "entropy": 5.796478652954102, "epoch": 3.1852557868119042, "grad_norm": 1.1796875, "learning_rate": 0.000399592807172317, "loss": 4.9486, "mean_token_accuracy": 0.21536874175071716, "num_tokens": 71012618.0, "step": 40940 }, { "entropy": 5.809241056442261, "epoch": 3.185644816183622, "grad_norm": 1.453125, "learning_rate": 0.00039956972785191606, "loss": 4.9622, "mean_token_accuracy": 0.20682704746723174, "num_tokens": 71021075.0, "step": 40945 }, { "entropy": 5.886703062057495, "epoch": 3.1860338455553396, "grad_norm": 1.2578125, "learning_rate": 0.00039954664664136787, "loss": 5.0117, "mean_token_accuracy": 0.20710003674030303, "num_tokens": 71029373.0, "step": 40950 }, { "entropy": 5.732402992248535, "epoch": 3.186422874927057, "grad_norm": 1.328125, "learning_rate": 0.0003995235635410225, "loss": 4.9445, "mean_token_accuracy": 0.21133046597242355, "num_tokens": 71037827.0, "step": 40955 }, { "entropy": 5.888251876831054, "epoch": 3.1868119042987746, "grad_norm": 1.3828125, "learning_rate": 0.0003995004785512302, "loss": 5.0272, "mean_token_accuracy": 0.20337484627962113, "num_tokens": 71046097.0, "step": 40960 }, { "entropy": 5.877272319793701, "epoch": 3.1872009336704923, "grad_norm": 1.296875, "learning_rate": 0.0003994773916723414, "loss": 4.9877, "mean_token_accuracy": 0.2125300496816635, "num_tokens": 71055340.0, "step": 40965 }, { "entropy": 5.823552846908569, "epoch": 3.1875899630422095, "grad_norm": 1.2890625, "learning_rate": 0.0003994543029047063, "loss": 4.9345, "mean_token_accuracy": 0.2175980404019356, "num_tokens": 71063967.0, "step": 40970 }, { "entropy": 5.802626037597657, "epoch": 3.1879789924139272, "grad_norm": 1.296875, "learning_rate": 0.0003994312122486752, "loss": 4.9748, "mean_token_accuracy": 0.21141192466020584, "num_tokens": 71072813.0, "step": 40975 }, { "entropy": 5.744529438018799, "epoch": 3.188368021785645, "grad_norm": 1.2578125, "learning_rate": 0.0003994081197045985, "loss": 4.8858, "mean_token_accuracy": 0.220436954498291, "num_tokens": 71081801.0, "step": 40980 }, { "entropy": 5.817735242843628, "epoch": 3.188757051157362, "grad_norm": 1.296875, "learning_rate": 0.0003993850252728267, "loss": 4.8747, "mean_token_accuracy": 0.21554209142923356, "num_tokens": 71089784.0, "step": 40985 }, { "entropy": 5.828818607330322, "epoch": 3.18914608052908, "grad_norm": 1.2890625, "learning_rate": 0.00039936192895371006, "loss": 5.0351, "mean_token_accuracy": 0.20684264749288558, "num_tokens": 71099415.0, "step": 40990 }, { "entropy": 5.8362205028533936, "epoch": 3.1895351099007976, "grad_norm": 1.2578125, "learning_rate": 0.000399338830747599, "loss": 5.022, "mean_token_accuracy": 0.2033639669418335, "num_tokens": 71108073.0, "step": 40995 }, { "entropy": 5.93585433959961, "epoch": 3.1899241392725153, "grad_norm": 1.34375, "learning_rate": 0.0003993157306548442, "loss": 5.0899, "mean_token_accuracy": 0.20103107988834382, "num_tokens": 71116755.0, "step": 41000 }, { "entropy": 5.852106046676636, "epoch": 3.1903131686442325, "grad_norm": 1.328125, "learning_rate": 0.00039929262867579603, "loss": 5.0268, "mean_token_accuracy": 0.21021128594875335, "num_tokens": 71125278.0, "step": 41005 }, { "entropy": 5.85308952331543, "epoch": 3.1907021980159502, "grad_norm": 1.3828125, "learning_rate": 0.00039926952481080495, "loss": 4.9489, "mean_token_accuracy": 0.20986337959766388, "num_tokens": 71134111.0, "step": 41010 }, { "entropy": 5.870548057556152, "epoch": 3.191091227387668, "grad_norm": 1.3359375, "learning_rate": 0.00039924641906022176, "loss": 5.027, "mean_token_accuracy": 0.20331714749336244, "num_tokens": 71142966.0, "step": 41015 }, { "entropy": 5.830940914154053, "epoch": 3.191480256759385, "grad_norm": 1.3046875, "learning_rate": 0.0003992233114243969, "loss": 5.0133, "mean_token_accuracy": 0.20037883073091506, "num_tokens": 71151461.0, "step": 41020 }, { "entropy": 5.877682304382324, "epoch": 3.191869286131103, "grad_norm": 1.4296875, "learning_rate": 0.000399200201903681, "loss": 5.055, "mean_token_accuracy": 0.2087266519665718, "num_tokens": 71160133.0, "step": 41025 }, { "entropy": 5.892140531539917, "epoch": 3.1922583155028206, "grad_norm": 1.2265625, "learning_rate": 0.0003991770904984247, "loss": 5.1099, "mean_token_accuracy": 0.2000988468527794, "num_tokens": 71168795.0, "step": 41030 }, { "entropy": 5.7832756519317625, "epoch": 3.192647344874538, "grad_norm": 1.328125, "learning_rate": 0.0003991539772089787, "loss": 4.8988, "mean_token_accuracy": 0.21551756262779237, "num_tokens": 71177625.0, "step": 41035 }, { "entropy": 5.880005264282227, "epoch": 3.1930363742462555, "grad_norm": 1.3359375, "learning_rate": 0.00039913086203569373, "loss": 4.9784, "mean_token_accuracy": 0.20919807851314545, "num_tokens": 71186635.0, "step": 41040 }, { "entropy": 5.86978964805603, "epoch": 3.1934254036179732, "grad_norm": 1.296875, "learning_rate": 0.00039910774497892046, "loss": 5.0538, "mean_token_accuracy": 0.20387642085552216, "num_tokens": 71195407.0, "step": 41045 }, { "entropy": 5.837751340866089, "epoch": 3.193814432989691, "grad_norm": 1.390625, "learning_rate": 0.00039908462603900977, "loss": 4.9651, "mean_token_accuracy": 0.20461779683828354, "num_tokens": 71203756.0, "step": 41050 }, { "entropy": 5.761446094512939, "epoch": 3.194203462361408, "grad_norm": 1.296875, "learning_rate": 0.0003990615052163123, "loss": 4.9151, "mean_token_accuracy": 0.21475869566202163, "num_tokens": 71212077.0, "step": 41055 }, { "entropy": 5.828308343887329, "epoch": 3.194592491733126, "grad_norm": 1.328125, "learning_rate": 0.000399038382511179, "loss": 4.9273, "mean_token_accuracy": 0.21077749878168106, "num_tokens": 71220279.0, "step": 41060 }, { "entropy": 5.7490967273712155, "epoch": 3.1949815211048436, "grad_norm": 1.2890625, "learning_rate": 0.0003990152579239607, "loss": 4.8762, "mean_token_accuracy": 0.2155602306127548, "num_tokens": 71228731.0, "step": 41065 }, { "entropy": 5.8000188827514645, "epoch": 3.195370550476561, "grad_norm": 1.328125, "learning_rate": 0.00039899213145500815, "loss": 4.983, "mean_token_accuracy": 0.20990292280912398, "num_tokens": 71237520.0, "step": 41070 }, { "entropy": 5.706753158569336, "epoch": 3.1957595798482785, "grad_norm": 1.328125, "learning_rate": 0.00039896900310467244, "loss": 4.8838, "mean_token_accuracy": 0.22143174856901168, "num_tokens": 71245912.0, "step": 41075 }, { "entropy": 5.799352788925171, "epoch": 3.196148609219996, "grad_norm": 1.2734375, "learning_rate": 0.00039894587287330434, "loss": 4.9511, "mean_token_accuracy": 0.21596096456050873, "num_tokens": 71254815.0, "step": 41080 }, { "entropy": 5.874398899078369, "epoch": 3.1965376385917135, "grad_norm": 1.4296875, "learning_rate": 0.00039892274076125503, "loss": 5.012, "mean_token_accuracy": 0.20449885725975037, "num_tokens": 71262983.0, "step": 41085 }, { "entropy": 5.806707811355591, "epoch": 3.196926667963431, "grad_norm": 1.4140625, "learning_rate": 0.0003988996067688753, "loss": 4.9318, "mean_token_accuracy": 0.2171550363302231, "num_tokens": 71270555.0, "step": 41090 }, { "entropy": 5.790062141418457, "epoch": 3.197315697335149, "grad_norm": 1.296875, "learning_rate": 0.0003988764708965163, "loss": 4.9292, "mean_token_accuracy": 0.2130316197872162, "num_tokens": 71278593.0, "step": 41095 }, { "entropy": 5.816224861145019, "epoch": 3.1977047267068666, "grad_norm": 1.34375, "learning_rate": 0.000398853333144529, "loss": 4.8942, "mean_token_accuracy": 0.21932464987039565, "num_tokens": 71287048.0, "step": 41100 }, { "entropy": 5.851548862457276, "epoch": 3.198093756078584, "grad_norm": 1.2734375, "learning_rate": 0.00039883019351326447, "loss": 5.0718, "mean_token_accuracy": 0.19560532867908478, "num_tokens": 71295965.0, "step": 41105 }, { "entropy": 5.809825611114502, "epoch": 3.1984827854503015, "grad_norm": 1.3046875, "learning_rate": 0.00039880705200307377, "loss": 4.9607, "mean_token_accuracy": 0.20645642876625062, "num_tokens": 71305094.0, "step": 41110 }, { "entropy": 5.839958810806275, "epoch": 3.198871814822019, "grad_norm": 1.3515625, "learning_rate": 0.0003987839086143083, "loss": 4.9115, "mean_token_accuracy": 0.21504350155591964, "num_tokens": 71313466.0, "step": 41115 }, { "entropy": 5.842421531677246, "epoch": 3.1992608441937365, "grad_norm": 1.2734375, "learning_rate": 0.00039876076334731885, "loss": 5.018, "mean_token_accuracy": 0.2086254447698593, "num_tokens": 71322799.0, "step": 41120 }, { "entropy": 5.817697906494141, "epoch": 3.199649873565454, "grad_norm": 1.2890625, "learning_rate": 0.000398737616202457, "loss": 4.973, "mean_token_accuracy": 0.21059157252311705, "num_tokens": 71331618.0, "step": 41125 }, { "entropy": 5.787054395675659, "epoch": 3.200038902937172, "grad_norm": 1.3359375, "learning_rate": 0.00039871446718007364, "loss": 4.9469, "mean_token_accuracy": 0.20836376547813415, "num_tokens": 71339784.0, "step": 41130 }, { "entropy": 5.859975814819336, "epoch": 3.200427932308889, "grad_norm": 1.3125, "learning_rate": 0.0003986913162805201, "loss": 5.0778, "mean_token_accuracy": 0.19823651909828185, "num_tokens": 71347896.0, "step": 41135 }, { "entropy": 5.868724060058594, "epoch": 3.200816961680607, "grad_norm": 1.28125, "learning_rate": 0.00039866816350414786, "loss": 5.0269, "mean_token_accuracy": 0.20309681296348572, "num_tokens": 71356888.0, "step": 41140 }, { "entropy": 5.807567834854126, "epoch": 3.2012059910523245, "grad_norm": 1.3203125, "learning_rate": 0.000398645008851308, "loss": 4.9364, "mean_token_accuracy": 0.21380703747272492, "num_tokens": 71365217.0, "step": 41145 }, { "entropy": 5.823787784576416, "epoch": 3.201595020424042, "grad_norm": 1.3046875, "learning_rate": 0.00039862185232235196, "loss": 4.9566, "mean_token_accuracy": 0.2020031541585922, "num_tokens": 71373975.0, "step": 41150 }, { "entropy": 5.741670989990235, "epoch": 3.2019840497957595, "grad_norm": 1.375, "learning_rate": 0.0003985986939176311, "loss": 4.9151, "mean_token_accuracy": 0.21347890496253968, "num_tokens": 71382733.0, "step": 41155 }, { "entropy": 5.809070730209351, "epoch": 3.202373079167477, "grad_norm": 1.265625, "learning_rate": 0.00039857553363749674, "loss": 4.9556, "mean_token_accuracy": 0.2131333604454994, "num_tokens": 71392514.0, "step": 41160 }, { "entropy": 5.846995735168457, "epoch": 3.202762108539195, "grad_norm": 1.3125, "learning_rate": 0.00039855237148230026, "loss": 4.9691, "mean_token_accuracy": 0.205020909011364, "num_tokens": 71401305.0, "step": 41165 }, { "entropy": 5.892605638504028, "epoch": 3.203151137910912, "grad_norm": 1.3125, "learning_rate": 0.00039852920745239343, "loss": 4.9757, "mean_token_accuracy": 0.2060181751847267, "num_tokens": 71410449.0, "step": 41170 }, { "entropy": 5.8253387928009035, "epoch": 3.20354016728263, "grad_norm": 1.25, "learning_rate": 0.00039850604154812727, "loss": 4.9567, "mean_token_accuracy": 0.2064486026763916, "num_tokens": 71420284.0, "step": 41175 }, { "entropy": 5.791077518463135, "epoch": 3.2039291966543475, "grad_norm": 1.3359375, "learning_rate": 0.0003984828737698536, "loss": 5.0353, "mean_token_accuracy": 0.20231992602348328, "num_tokens": 71428890.0, "step": 41180 }, { "entropy": 5.861621952056884, "epoch": 3.204318226026065, "grad_norm": 1.3203125, "learning_rate": 0.00039845970411792384, "loss": 4.9834, "mean_token_accuracy": 0.20630451589822768, "num_tokens": 71437569.0, "step": 41185 }, { "entropy": 5.872475242614746, "epoch": 3.2047072553977825, "grad_norm": 1.3125, "learning_rate": 0.0003984365325926896, "loss": 5.0948, "mean_token_accuracy": 0.20322130173444747, "num_tokens": 71446453.0, "step": 41190 }, { "entropy": 5.8338159084320065, "epoch": 3.2050962847695, "grad_norm": 1.28125, "learning_rate": 0.00039841335919450245, "loss": 5.0347, "mean_token_accuracy": 0.20543756932020188, "num_tokens": 71455727.0, "step": 41195 }, { "entropy": 5.872816848754883, "epoch": 3.205485314141218, "grad_norm": 1.2421875, "learning_rate": 0.00039839018392371397, "loss": 5.0033, "mean_token_accuracy": 0.21344245821237565, "num_tokens": 71464528.0, "step": 41200 }, { "entropy": 5.849108171463013, "epoch": 3.205874343512935, "grad_norm": 1.40625, "learning_rate": 0.0003983670067806759, "loss": 4.8674, "mean_token_accuracy": 0.21460047960281373, "num_tokens": 71472386.0, "step": 41205 }, { "entropy": 5.9271749496459964, "epoch": 3.206263372884653, "grad_norm": 1.359375, "learning_rate": 0.0003983438277657398, "loss": 4.9481, "mean_token_accuracy": 0.21934157609939575, "num_tokens": 71480616.0, "step": 41210 }, { "entropy": 5.817424726486206, "epoch": 3.2066524022563705, "grad_norm": 1.34375, "learning_rate": 0.0003983206468792575, "loss": 5.0187, "mean_token_accuracy": 0.20366560518741608, "num_tokens": 71490064.0, "step": 41215 }, { "entropy": 5.821478652954101, "epoch": 3.2070414316280877, "grad_norm": 1.3046875, "learning_rate": 0.0003982974641215806, "loss": 5.0146, "mean_token_accuracy": 0.2062872052192688, "num_tokens": 71499046.0, "step": 41220 }, { "entropy": 5.910622310638428, "epoch": 3.2074304609998054, "grad_norm": 1.2265625, "learning_rate": 0.000398274279493061, "loss": 5.0499, "mean_token_accuracy": 0.21046550571918488, "num_tokens": 71507775.0, "step": 41225 }, { "entropy": 5.824555540084839, "epoch": 3.207819490371523, "grad_norm": 1.2265625, "learning_rate": 0.00039825109299405036, "loss": 4.9389, "mean_token_accuracy": 0.22115633487701417, "num_tokens": 71517225.0, "step": 41230 }, { "entropy": 5.8287928104400635, "epoch": 3.2082085197432404, "grad_norm": 1.359375, "learning_rate": 0.0003982279046249006, "loss": 4.9967, "mean_token_accuracy": 0.20850649178028108, "num_tokens": 71526171.0, "step": 41235 }, { "entropy": 5.875583982467651, "epoch": 3.208597549114958, "grad_norm": 1.2890625, "learning_rate": 0.00039820471438596346, "loss": 5.006, "mean_token_accuracy": 0.20864122062921525, "num_tokens": 71534573.0, "step": 41240 }, { "entropy": 5.958389711380005, "epoch": 3.208986578486676, "grad_norm": 1.28125, "learning_rate": 0.00039818152227759097, "loss": 5.0966, "mean_token_accuracy": 0.2026665210723877, "num_tokens": 71543993.0, "step": 41245 }, { "entropy": 5.868214511871338, "epoch": 3.2093756078583935, "grad_norm": 1.2890625, "learning_rate": 0.0003981583283001349, "loss": 5.0331, "mean_token_accuracy": 0.2008140578866005, "num_tokens": 71552547.0, "step": 41250 }, { "entropy": 5.792708063125611, "epoch": 3.2097646372301107, "grad_norm": 1.2265625, "learning_rate": 0.0003981351324539472, "loss": 4.8774, "mean_token_accuracy": 0.2201257437467575, "num_tokens": 71561523.0, "step": 41255 }, { "entropy": 5.845886182785034, "epoch": 3.2101536666018284, "grad_norm": 1.3125, "learning_rate": 0.0003981119347393799, "loss": 4.9755, "mean_token_accuracy": 0.21426019072532654, "num_tokens": 71569505.0, "step": 41260 }, { "entropy": 5.881434154510498, "epoch": 3.210542695973546, "grad_norm": 1.296875, "learning_rate": 0.00039808873515678495, "loss": 5.0609, "mean_token_accuracy": 0.2033266082406044, "num_tokens": 71577895.0, "step": 41265 }, { "entropy": 5.83377480506897, "epoch": 3.2109317253452634, "grad_norm": 1.359375, "learning_rate": 0.0003980655337065144, "loss": 4.9613, "mean_token_accuracy": 0.2082776039838791, "num_tokens": 71586454.0, "step": 41270 }, { "entropy": 5.826668310165405, "epoch": 3.211320754716981, "grad_norm": 1.2421875, "learning_rate": 0.0003980423303889201, "loss": 5.0214, "mean_token_accuracy": 0.20655311942100524, "num_tokens": 71595529.0, "step": 41275 }, { "entropy": 5.905229663848877, "epoch": 3.211709784088699, "grad_norm": 1.328125, "learning_rate": 0.00039801912520435437, "loss": 5.08, "mean_token_accuracy": 0.2000127539038658, "num_tokens": 71604345.0, "step": 41280 }, { "entropy": 5.8134174823760985, "epoch": 3.2120988134604165, "grad_norm": 1.296875, "learning_rate": 0.0003979959181531692, "loss": 4.9258, "mean_token_accuracy": 0.21516081541776658, "num_tokens": 71613060.0, "step": 41285 }, { "entropy": 5.821517038345337, "epoch": 3.2124878428321337, "grad_norm": 1.3359375, "learning_rate": 0.00039797270923571683, "loss": 4.9541, "mean_token_accuracy": 0.2189641460776329, "num_tokens": 71622122.0, "step": 41290 }, { "entropy": 5.782667732238769, "epoch": 3.2128768722038514, "grad_norm": 1.3671875, "learning_rate": 0.00039794949845234925, "loss": 4.9288, "mean_token_accuracy": 0.2190478801727295, "num_tokens": 71630812.0, "step": 41295 }, { "entropy": 5.8173774719238285, "epoch": 3.213265901575569, "grad_norm": 1.2265625, "learning_rate": 0.00039792628580341874, "loss": 5.0167, "mean_token_accuracy": 0.20952873080968856, "num_tokens": 71640341.0, "step": 41300 }, { "entropy": 5.816604232788086, "epoch": 3.2136549309472864, "grad_norm": 1.296875, "learning_rate": 0.00039790307128927745, "loss": 4.8456, "mean_token_accuracy": 0.21552089005708694, "num_tokens": 71649383.0, "step": 41305 }, { "entropy": 5.842979478836059, "epoch": 3.214043960319004, "grad_norm": 1.25, "learning_rate": 0.00039787985491027773, "loss": 4.9388, "mean_token_accuracy": 0.21119867861270905, "num_tokens": 71657989.0, "step": 41310 }, { "entropy": 5.743782043457031, "epoch": 3.2144329896907218, "grad_norm": 1.4921875, "learning_rate": 0.00039785663666677175, "loss": 4.8997, "mean_token_accuracy": 0.21266344487667083, "num_tokens": 71666569.0, "step": 41315 }, { "entropy": 5.791001796722412, "epoch": 3.214822019062439, "grad_norm": 1.4453125, "learning_rate": 0.00039783341655911185, "loss": 4.9248, "mean_token_accuracy": 0.2088156446814537, "num_tokens": 71675256.0, "step": 41320 }, { "entropy": 5.775504302978516, "epoch": 3.2152110484341567, "grad_norm": 1.234375, "learning_rate": 0.0003978101945876504, "loss": 4.9039, "mean_token_accuracy": 0.20965370833873748, "num_tokens": 71684195.0, "step": 41325 }, { "entropy": 5.854995489120483, "epoch": 3.2156000778058744, "grad_norm": 1.265625, "learning_rate": 0.00039778697075273977, "loss": 4.9029, "mean_token_accuracy": 0.21143727451562883, "num_tokens": 71692869.0, "step": 41330 }, { "entropy": 5.77829647064209, "epoch": 3.2159891071775917, "grad_norm": 1.203125, "learning_rate": 0.00039776374505473224, "loss": 4.947, "mean_token_accuracy": 0.20896151661872864, "num_tokens": 71701560.0, "step": 41335 }, { "entropy": 5.885304355621338, "epoch": 3.2163781365493094, "grad_norm": 1.3359375, "learning_rate": 0.0003977405174939803, "loss": 5.0431, "mean_token_accuracy": 0.20134537816047668, "num_tokens": 71710282.0, "step": 41340 }, { "entropy": 5.8914295673370365, "epoch": 3.216767165921027, "grad_norm": 1.265625, "learning_rate": 0.00039771728807083635, "loss": 4.9441, "mean_token_accuracy": 0.2089582145214081, "num_tokens": 71718364.0, "step": 41345 }, { "entropy": 5.8717145919799805, "epoch": 3.2171561952927448, "grad_norm": 1.3203125, "learning_rate": 0.00039769405678565287, "loss": 5.0116, "mean_token_accuracy": 0.2029728874564171, "num_tokens": 71726712.0, "step": 41350 }, { "entropy": 5.822555446624756, "epoch": 3.217545224664462, "grad_norm": 1.3125, "learning_rate": 0.00039767082363878237, "loss": 5.0155, "mean_token_accuracy": 0.20062066167593, "num_tokens": 71735954.0, "step": 41355 }, { "entropy": 5.903098917007446, "epoch": 3.2179342540361797, "grad_norm": 1.359375, "learning_rate": 0.0003976475886305774, "loss": 5.1367, "mean_token_accuracy": 0.20088881701231004, "num_tokens": 71745025.0, "step": 41360 }, { "entropy": 5.931817245483399, "epoch": 3.2183232834078974, "grad_norm": 1.359375, "learning_rate": 0.0003976243517613904, "loss": 5.0301, "mean_token_accuracy": 0.20712753683328627, "num_tokens": 71754722.0, "step": 41365 }, { "entropy": 6.012892198562622, "epoch": 3.2187123127796147, "grad_norm": 1.3984375, "learning_rate": 0.00039760111303157415, "loss": 5.1183, "mean_token_accuracy": 0.1994749441742897, "num_tokens": 71763957.0, "step": 41370 }, { "entropy": 5.850116729736328, "epoch": 3.2191013421513324, "grad_norm": 1.3828125, "learning_rate": 0.000397577872441481, "loss": 5.0083, "mean_token_accuracy": 0.20801551938056945, "num_tokens": 71772890.0, "step": 41375 }, { "entropy": 5.859717607498169, "epoch": 3.21949037152305, "grad_norm": 1.34375, "learning_rate": 0.0003975546299914639, "loss": 5.018, "mean_token_accuracy": 0.20867818146944045, "num_tokens": 71781081.0, "step": 41380 }, { "entropy": 5.867979717254639, "epoch": 3.2198794008947678, "grad_norm": 1.3515625, "learning_rate": 0.0003975313856818753, "loss": 4.9718, "mean_token_accuracy": 0.20904824137687683, "num_tokens": 71788972.0, "step": 41385 }, { "entropy": 5.876728820800781, "epoch": 3.220268430266485, "grad_norm": 1.2421875, "learning_rate": 0.0003975081395130679, "loss": 5.0669, "mean_token_accuracy": 0.20640120208263396, "num_tokens": 71797120.0, "step": 41390 }, { "entropy": 5.80188512802124, "epoch": 3.2206574596382027, "grad_norm": 1.296875, "learning_rate": 0.0003974848914853946, "loss": 4.9394, "mean_token_accuracy": 0.21137304306030275, "num_tokens": 71805558.0, "step": 41395 }, { "entropy": 5.866464567184448, "epoch": 3.2210464890099204, "grad_norm": 1.5625, "learning_rate": 0.00039746164159920795, "loss": 4.9756, "mean_token_accuracy": 0.2108137860894203, "num_tokens": 71814228.0, "step": 41400 }, { "entropy": 5.806661939620971, "epoch": 3.2214355183816377, "grad_norm": 1.2265625, "learning_rate": 0.00039743838985486075, "loss": 4.9443, "mean_token_accuracy": 0.21098487824201584, "num_tokens": 71823436.0, "step": 41405 }, { "entropy": 5.910964393615723, "epoch": 3.2218245477533554, "grad_norm": 1.2578125, "learning_rate": 0.0003974151362527059, "loss": 5.0165, "mean_token_accuracy": 0.2088575229048729, "num_tokens": 71832135.0, "step": 41410 }, { "entropy": 5.8319660186767575, "epoch": 3.222213577125073, "grad_norm": 1.2734375, "learning_rate": 0.00039739188079309626, "loss": 4.9552, "mean_token_accuracy": 0.21015356481075287, "num_tokens": 71840780.0, "step": 41415 }, { "entropy": 5.816829347610474, "epoch": 3.2226026064967903, "grad_norm": 1.421875, "learning_rate": 0.0003973686234763846, "loss": 5.0259, "mean_token_accuracy": 0.20309171825647354, "num_tokens": 71849135.0, "step": 41420 }, { "entropy": 5.90092716217041, "epoch": 3.222991635868508, "grad_norm": 1.2421875, "learning_rate": 0.0003973453643029239, "loss": 4.9841, "mean_token_accuracy": 0.21176661550998688, "num_tokens": 71858967.0, "step": 41425 }, { "entropy": 5.811150693893433, "epoch": 3.2233806652402257, "grad_norm": 1.328125, "learning_rate": 0.0003973221032730669, "loss": 4.9109, "mean_token_accuracy": 0.2126663938164711, "num_tokens": 71867355.0, "step": 41430 }, { "entropy": 5.858457899093628, "epoch": 3.2237696946119434, "grad_norm": 1.203125, "learning_rate": 0.0003972988403871668, "loss": 4.9175, "mean_token_accuracy": 0.20983185172080993, "num_tokens": 71875723.0, "step": 41435 }, { "entropy": 5.846921586990357, "epoch": 3.2241587239836607, "grad_norm": 1.3984375, "learning_rate": 0.0003972755756455764, "loss": 4.9564, "mean_token_accuracy": 0.21846983283758165, "num_tokens": 71884291.0, "step": 41440 }, { "entropy": 5.768748617172241, "epoch": 3.2245477533553784, "grad_norm": 1.4140625, "learning_rate": 0.0003972523090486487, "loss": 4.9537, "mean_token_accuracy": 0.21587966978549958, "num_tokens": 71893672.0, "step": 41445 }, { "entropy": 5.846840476989746, "epoch": 3.224936782727096, "grad_norm": 1.3828125, "learning_rate": 0.0003972290405967369, "loss": 5.0019, "mean_token_accuracy": 0.2067606896162033, "num_tokens": 71901964.0, "step": 41450 }, { "entropy": 5.852076578140259, "epoch": 3.2253258120988133, "grad_norm": 1.15625, "learning_rate": 0.0003972057702901939, "loss": 5.0052, "mean_token_accuracy": 0.21014974713325502, "num_tokens": 71910801.0, "step": 41455 }, { "entropy": 5.882115650177002, "epoch": 3.225714841470531, "grad_norm": 1.3359375, "learning_rate": 0.0003971824981293729, "loss": 5.0133, "mean_token_accuracy": 0.20798835903406143, "num_tokens": 71919833.0, "step": 41460 }, { "entropy": 5.838105964660644, "epoch": 3.2261038708422487, "grad_norm": 1.3046875, "learning_rate": 0.0003971592241146269, "loss": 4.996, "mean_token_accuracy": 0.2031509056687355, "num_tokens": 71928117.0, "step": 41465 }, { "entropy": 5.732760810852051, "epoch": 3.226492900213966, "grad_norm": 1.21875, "learning_rate": 0.0003971359482463092, "loss": 4.8157, "mean_token_accuracy": 0.22403545379638673, "num_tokens": 71937331.0, "step": 41470 }, { "entropy": 5.865112686157227, "epoch": 3.2268819295856837, "grad_norm": 1.3828125, "learning_rate": 0.0003971126705247727, "loss": 5.0283, "mean_token_accuracy": 0.2026947557926178, "num_tokens": 71945656.0, "step": 41475 }, { "entropy": 5.871706867218018, "epoch": 3.2272709589574013, "grad_norm": 1.2890625, "learning_rate": 0.0003970893909503709, "loss": 4.9637, "mean_token_accuracy": 0.2071118786931038, "num_tokens": 71954833.0, "step": 41480 }, { "entropy": 5.845706987380981, "epoch": 3.227659988329119, "grad_norm": 1.3125, "learning_rate": 0.000397066109523457, "loss": 4.8873, "mean_token_accuracy": 0.21931109577417374, "num_tokens": 71962798.0, "step": 41485 }, { "entropy": 5.869112873077393, "epoch": 3.2280490177008363, "grad_norm": 1.21875, "learning_rate": 0.0003970428262443842, "loss": 5.0605, "mean_token_accuracy": 0.1988818407058716, "num_tokens": 71972000.0, "step": 41490 }, { "entropy": 5.8797636985778805, "epoch": 3.228438047072554, "grad_norm": 1.3984375, "learning_rate": 0.00039701954111350565, "loss": 5.0329, "mean_token_accuracy": 0.20906647741794587, "num_tokens": 71981950.0, "step": 41495 }, { "entropy": 5.839580965042114, "epoch": 3.2288270764442717, "grad_norm": 1.34375, "learning_rate": 0.0003969962541311748, "loss": 4.9063, "mean_token_accuracy": 0.21319869458675383, "num_tokens": 71989662.0, "step": 41500 }, { "entropy": 5.754192924499511, "epoch": 3.229216105815989, "grad_norm": 1.3046875, "learning_rate": 0.00039697296529774494, "loss": 4.9036, "mean_token_accuracy": 0.21008898168802262, "num_tokens": 71998140.0, "step": 41505 }, { "entropy": 5.793681621551514, "epoch": 3.2296051351877066, "grad_norm": 1.3046875, "learning_rate": 0.00039694967461356944, "loss": 4.9677, "mean_token_accuracy": 0.21143849492073058, "num_tokens": 72007365.0, "step": 41510 }, { "entropy": 5.834577751159668, "epoch": 3.2299941645594243, "grad_norm": 1.3046875, "learning_rate": 0.00039692638207900177, "loss": 4.9823, "mean_token_accuracy": 0.2113758370280266, "num_tokens": 72015380.0, "step": 41515 }, { "entropy": 5.845998334884643, "epoch": 3.2303831939311416, "grad_norm": 1.28125, "learning_rate": 0.0003969030876943954, "loss": 4.9623, "mean_token_accuracy": 0.21121104955673217, "num_tokens": 72024322.0, "step": 41520 }, { "entropy": 5.947836542129517, "epoch": 3.2307722233028593, "grad_norm": 1.4296875, "learning_rate": 0.00039687979146010367, "loss": 5.0697, "mean_token_accuracy": 0.20080548524856567, "num_tokens": 72032905.0, "step": 41525 }, { "entropy": 5.848176717758179, "epoch": 3.231161252674577, "grad_norm": 1.296875, "learning_rate": 0.00039685649337648, "loss": 4.9242, "mean_token_accuracy": 0.21673622131347656, "num_tokens": 72041738.0, "step": 41530 }, { "entropy": 5.793944263458252, "epoch": 3.2315502820462947, "grad_norm": 1.3828125, "learning_rate": 0.00039683319344387813, "loss": 4.902, "mean_token_accuracy": 0.21445939242839812, "num_tokens": 72050111.0, "step": 41535 }, { "entropy": 5.729693508148193, "epoch": 3.231939311418012, "grad_norm": 1.3828125, "learning_rate": 0.00039680989166265135, "loss": 4.843, "mean_token_accuracy": 0.21119237393140794, "num_tokens": 72058526.0, "step": 41540 }, { "entropy": 5.785159921646118, "epoch": 3.2323283407897296, "grad_norm": 1.2890625, "learning_rate": 0.00039678658803315336, "loss": 5.0359, "mean_token_accuracy": 0.21021993458271027, "num_tokens": 72067464.0, "step": 41545 }, { "entropy": 5.802345514297485, "epoch": 3.2327173701614473, "grad_norm": 1.28125, "learning_rate": 0.00039676328255573777, "loss": 4.895, "mean_token_accuracy": 0.21891624480485916, "num_tokens": 72076857.0, "step": 41550 }, { "entropy": 5.82989010810852, "epoch": 3.2331063995331646, "grad_norm": 1.375, "learning_rate": 0.00039673997523075825, "loss": 4.9246, "mean_token_accuracy": 0.20682331919670105, "num_tokens": 72085327.0, "step": 41555 }, { "entropy": 5.81734414100647, "epoch": 3.2334954289048823, "grad_norm": 1.2734375, "learning_rate": 0.00039671666605856825, "loss": 4.8786, "mean_token_accuracy": 0.21542142033576966, "num_tokens": 72093336.0, "step": 41560 }, { "entropy": 5.856696367263794, "epoch": 3.2338844582766, "grad_norm": 1.3125, "learning_rate": 0.00039669335503952165, "loss": 5.0043, "mean_token_accuracy": 0.20418593734502793, "num_tokens": 72102266.0, "step": 41565 }, { "entropy": 5.815034580230713, "epoch": 3.2342734876483172, "grad_norm": 1.265625, "learning_rate": 0.00039667004217397206, "loss": 4.9663, "mean_token_accuracy": 0.2159833312034607, "num_tokens": 72111364.0, "step": 41570 }, { "entropy": 5.823343420028687, "epoch": 3.234662517020035, "grad_norm": 1.265625, "learning_rate": 0.00039664672746227326, "loss": 4.9151, "mean_token_accuracy": 0.2111508145928383, "num_tokens": 72120038.0, "step": 41575 }, { "entropy": 5.785775184631348, "epoch": 3.2350515463917526, "grad_norm": 1.2578125, "learning_rate": 0.0003966234109047789, "loss": 4.9823, "mean_token_accuracy": 0.21344225108623505, "num_tokens": 72129033.0, "step": 41580 }, { "entropy": 5.935666465759278, "epoch": 3.2354405757634703, "grad_norm": 1.5, "learning_rate": 0.000396600092501843, "loss": 5.1283, "mean_token_accuracy": 0.19842617064714432, "num_tokens": 72138806.0, "step": 41585 }, { "entropy": 5.927566623687744, "epoch": 3.2358296051351876, "grad_norm": 1.3828125, "learning_rate": 0.00039657677225381915, "loss": 5.0136, "mean_token_accuracy": 0.21346484422683715, "num_tokens": 72147723.0, "step": 41590 }, { "entropy": 5.89341368675232, "epoch": 3.2362186345069053, "grad_norm": 1.2734375, "learning_rate": 0.0003965534501610613, "loss": 5.0758, "mean_token_accuracy": 0.19774211198091507, "num_tokens": 72156724.0, "step": 41595 }, { "entropy": 5.8553609371185305, "epoch": 3.236607663878623, "grad_norm": 1.3125, "learning_rate": 0.0003965301262239234, "loss": 4.9526, "mean_token_accuracy": 0.21073439866304397, "num_tokens": 72164803.0, "step": 41600 }, { "entropy": 5.823162412643432, "epoch": 3.2369966932503402, "grad_norm": 1.2734375, "learning_rate": 0.0003965068004427591, "loss": 5.0013, "mean_token_accuracy": 0.20301738530397415, "num_tokens": 72173770.0, "step": 41605 }, { "entropy": 5.874419641494751, "epoch": 3.237385722622058, "grad_norm": 1.1953125, "learning_rate": 0.0003964834728179226, "loss": 5.0039, "mean_token_accuracy": 0.2070169508457184, "num_tokens": 72183072.0, "step": 41610 }, { "entropy": 5.776216316223144, "epoch": 3.2377747519937756, "grad_norm": 1.390625, "learning_rate": 0.00039646014334976783, "loss": 4.8671, "mean_token_accuracy": 0.21907583475112916, "num_tokens": 72190494.0, "step": 41615 }, { "entropy": 5.813143634796143, "epoch": 3.2381637813654933, "grad_norm": 1.3828125, "learning_rate": 0.00039643681203864863, "loss": 5.0128, "mean_token_accuracy": 0.2085426226258278, "num_tokens": 72198775.0, "step": 41620 }, { "entropy": 5.932885456085205, "epoch": 3.2385528107372106, "grad_norm": 1.4375, "learning_rate": 0.00039641347888491905, "loss": 5.0918, "mean_token_accuracy": 0.2021746188402176, "num_tokens": 72207137.0, "step": 41625 }, { "entropy": 5.8863872528076175, "epoch": 3.2389418401089283, "grad_norm": 1.4140625, "learning_rate": 0.00039639014388893337, "loss": 5.0308, "mean_token_accuracy": 0.2055279016494751, "num_tokens": 72215645.0, "step": 41630 }, { "entropy": 5.853871154785156, "epoch": 3.239330869480646, "grad_norm": 1.1796875, "learning_rate": 0.0003963668070510453, "loss": 4.9483, "mean_token_accuracy": 0.2093917265534401, "num_tokens": 72224723.0, "step": 41635 }, { "entropy": 5.8575742721557615, "epoch": 3.2397198988523632, "grad_norm": 1.296875, "learning_rate": 0.0003963434683716091, "loss": 4.9632, "mean_token_accuracy": 0.21289380192756652, "num_tokens": 72233195.0, "step": 41640 }, { "entropy": 5.904401016235352, "epoch": 3.240108928224081, "grad_norm": 1.421875, "learning_rate": 0.0003963201278509789, "loss": 4.9839, "mean_token_accuracy": 0.20977976620197297, "num_tokens": 72241850.0, "step": 41645 }, { "entropy": 5.8810028553009035, "epoch": 3.2404979575957986, "grad_norm": 1.25, "learning_rate": 0.0003962967854895089, "loss": 4.9841, "mean_token_accuracy": 0.20454856455326081, "num_tokens": 72250624.0, "step": 41650 }, { "entropy": 5.855868148803711, "epoch": 3.240886986967516, "grad_norm": 1.34375, "learning_rate": 0.0003962734412875533, "loss": 4.991, "mean_token_accuracy": 0.1996140405535698, "num_tokens": 72258669.0, "step": 41655 }, { "entropy": 5.845728158950806, "epoch": 3.2412760163392336, "grad_norm": 1.2578125, "learning_rate": 0.0003962500952454662, "loss": 4.959, "mean_token_accuracy": 0.2090431272983551, "num_tokens": 72267577.0, "step": 41660 }, { "entropy": 5.878549480438233, "epoch": 3.2416650457109513, "grad_norm": 1.2421875, "learning_rate": 0.00039622674736360195, "loss": 5.1083, "mean_token_accuracy": 0.20154589861631395, "num_tokens": 72276008.0, "step": 41665 }, { "entropy": 5.894612264633179, "epoch": 3.2420540750826685, "grad_norm": 1.34375, "learning_rate": 0.00039620339764231467, "loss": 5.0316, "mean_token_accuracy": 0.20562729835510254, "num_tokens": 72284807.0, "step": 41670 }, { "entropy": 5.837061595916748, "epoch": 3.242443104454386, "grad_norm": 1.296875, "learning_rate": 0.00039618004608195877, "loss": 5.0105, "mean_token_accuracy": 0.20710051953792571, "num_tokens": 72294364.0, "step": 41675 }, { "entropy": 5.8676715850830075, "epoch": 3.242832133826104, "grad_norm": 1.3203125, "learning_rate": 0.00039615669268288863, "loss": 4.9724, "mean_token_accuracy": 0.20890984535217286, "num_tokens": 72302931.0, "step": 41680 }, { "entropy": 5.870527601242065, "epoch": 3.2432211631978216, "grad_norm": 1.359375, "learning_rate": 0.00039613333744545836, "loss": 4.9786, "mean_token_accuracy": 0.2102140411734581, "num_tokens": 72311911.0, "step": 41685 }, { "entropy": 5.799951696395874, "epoch": 3.243610192569539, "grad_norm": 1.34375, "learning_rate": 0.0003961099803700226, "loss": 4.8935, "mean_token_accuracy": 0.2241044744849205, "num_tokens": 72320435.0, "step": 41690 }, { "entropy": 5.8635382652282715, "epoch": 3.2439992219412566, "grad_norm": 1.3046875, "learning_rate": 0.0003960866214569357, "loss": 4.987, "mean_token_accuracy": 0.20266940593719482, "num_tokens": 72329098.0, "step": 41695 }, { "entropy": 5.80028510093689, "epoch": 3.2443882513129743, "grad_norm": 1.2734375, "learning_rate": 0.00039606326070655204, "loss": 4.9314, "mean_token_accuracy": 0.20103475749492644, "num_tokens": 72337650.0, "step": 41700 }, { "entropy": 5.815481042861938, "epoch": 3.2447772806846915, "grad_norm": 1.265625, "learning_rate": 0.00039603989811922596, "loss": 4.915, "mean_token_accuracy": 0.21421968340873718, "num_tokens": 72346627.0, "step": 41705 }, { "entropy": 5.841947555541992, "epoch": 3.245166310056409, "grad_norm": 1.3359375, "learning_rate": 0.0003960165336953122, "loss": 4.9323, "mean_token_accuracy": 0.21651702076196672, "num_tokens": 72355695.0, "step": 41710 }, { "entropy": 5.81978964805603, "epoch": 3.245555339428127, "grad_norm": 1.359375, "learning_rate": 0.0003959931674351651, "loss": 4.9634, "mean_token_accuracy": 0.20882151126861573, "num_tokens": 72364078.0, "step": 41715 }, { "entropy": 5.828111410140991, "epoch": 3.2459443687998446, "grad_norm": 1.265625, "learning_rate": 0.0003959697993391393, "loss": 5.0091, "mean_token_accuracy": 0.2093831866979599, "num_tokens": 72373021.0, "step": 41720 }, { "entropy": 5.869501399993896, "epoch": 3.246333398171562, "grad_norm": 1.34375, "learning_rate": 0.00039594642940758934, "loss": 5.0373, "mean_token_accuracy": 0.20530015379190444, "num_tokens": 72381688.0, "step": 41725 }, { "entropy": 5.900115013122559, "epoch": 3.2467224275432796, "grad_norm": 1.3828125, "learning_rate": 0.00039592305764086984, "loss": 5.0487, "mean_token_accuracy": 0.2116955116391182, "num_tokens": 72389560.0, "step": 41730 }, { "entropy": 5.837467765808105, "epoch": 3.2471114569149973, "grad_norm": 1.28125, "learning_rate": 0.00039589968403933533, "loss": 4.9323, "mean_token_accuracy": 0.21286197155714034, "num_tokens": 72398206.0, "step": 41735 }, { "entropy": 5.807404661178589, "epoch": 3.2475004862867145, "grad_norm": 1.1640625, "learning_rate": 0.0003958763086033406, "loss": 5.0395, "mean_token_accuracy": 0.20220747739076614, "num_tokens": 72407658.0, "step": 41740 }, { "entropy": 5.91076078414917, "epoch": 3.247889515658432, "grad_norm": 1.265625, "learning_rate": 0.0003958529313332403, "loss": 5.0502, "mean_token_accuracy": 0.20345233678817748, "num_tokens": 72415982.0, "step": 41745 }, { "entropy": 5.907308769226074, "epoch": 3.24827854503015, "grad_norm": 1.28125, "learning_rate": 0.0003958295522293891, "loss": 5.0451, "mean_token_accuracy": 0.2003877729177475, "num_tokens": 72424992.0, "step": 41750 }, { "entropy": 5.824803447723388, "epoch": 3.248667574401867, "grad_norm": 1.2265625, "learning_rate": 0.0003958061712921417, "loss": 4.8829, "mean_token_accuracy": 0.21685806512832642, "num_tokens": 72432925.0, "step": 41755 }, { "entropy": 5.887304878234863, "epoch": 3.249056603773585, "grad_norm": 1.390625, "learning_rate": 0.000395782788521853, "loss": 5.0526, "mean_token_accuracy": 0.20483575761318207, "num_tokens": 72441880.0, "step": 41760 }, { "entropy": 5.864757776260376, "epoch": 3.2494456331453025, "grad_norm": 1.4296875, "learning_rate": 0.0003957594039188778, "loss": 4.9652, "mean_token_accuracy": 0.21303342431783676, "num_tokens": 72449259.0, "step": 41765 }, { "entropy": 5.829287910461426, "epoch": 3.24983466251702, "grad_norm": 1.40625, "learning_rate": 0.0003957360174835708, "loss": 4.9323, "mean_token_accuracy": 0.2128154918551445, "num_tokens": 72457881.0, "step": 41770 }, { "entropy": 5.7773590087890625, "epoch": 3.2502236918887375, "grad_norm": 1.3671875, "learning_rate": 0.0003957126292162868, "loss": 4.9005, "mean_token_accuracy": 0.21630093306303025, "num_tokens": 72466513.0, "step": 41775 }, { "entropy": 5.826560735702515, "epoch": 3.250612721260455, "grad_norm": 1.34375, "learning_rate": 0.0003956892391173809, "loss": 4.9129, "mean_token_accuracy": 0.220101997256279, "num_tokens": 72474888.0, "step": 41780 }, { "entropy": 5.8689844608306885, "epoch": 3.251001750632173, "grad_norm": 1.4375, "learning_rate": 0.00039566584718720793, "loss": 5.0216, "mean_token_accuracy": 0.21203243732452393, "num_tokens": 72484071.0, "step": 41785 }, { "entropy": 5.819292402267456, "epoch": 3.25139078000389, "grad_norm": 1.3125, "learning_rate": 0.0003956424534261227, "loss": 5.0007, "mean_token_accuracy": 0.21201223582029344, "num_tokens": 72492962.0, "step": 41790 }, { "entropy": 5.8278398513793945, "epoch": 3.251779809375608, "grad_norm": 1.203125, "learning_rate": 0.00039561905783448025, "loss": 4.9973, "mean_token_accuracy": 0.20687753856182098, "num_tokens": 72502247.0, "step": 41795 }, { "entropy": 5.893687391281128, "epoch": 3.2521688387473255, "grad_norm": 1.3515625, "learning_rate": 0.00039559566041263565, "loss": 4.9904, "mean_token_accuracy": 0.21269286721944808, "num_tokens": 72510611.0, "step": 41800 }, { "entropy": 5.947108030319214, "epoch": 3.252557868119043, "grad_norm": 1.3828125, "learning_rate": 0.0003955722611609438, "loss": 5.0184, "mean_token_accuracy": 0.20822292417287827, "num_tokens": 72518901.0, "step": 41805 }, { "entropy": 5.90369930267334, "epoch": 3.2529468974907605, "grad_norm": 1.3828125, "learning_rate": 0.00039554886007975976, "loss": 5.0206, "mean_token_accuracy": 0.20320906341075898, "num_tokens": 72527422.0, "step": 41810 }, { "entropy": 5.827991628646851, "epoch": 3.253335926862478, "grad_norm": 1.296875, "learning_rate": 0.00039552545716943873, "loss": 4.9727, "mean_token_accuracy": 0.21307283341884614, "num_tokens": 72536388.0, "step": 41815 }, { "entropy": 5.887800312042236, "epoch": 3.253724956234196, "grad_norm": 1.25, "learning_rate": 0.0003955020524303358, "loss": 5.025, "mean_token_accuracy": 0.20682238638401032, "num_tokens": 72545236.0, "step": 41820 }, { "entropy": 5.839358329772949, "epoch": 3.254113985605913, "grad_norm": 1.296875, "learning_rate": 0.00039547864586280583, "loss": 4.9589, "mean_token_accuracy": 0.20209725052118302, "num_tokens": 72553966.0, "step": 41825 }, { "entropy": 5.845506858825684, "epoch": 3.254503014977631, "grad_norm": 1.2578125, "learning_rate": 0.0003954552374672042, "loss": 5.009, "mean_token_accuracy": 0.19830774515867233, "num_tokens": 72563050.0, "step": 41830 }, { "entropy": 5.842481327056885, "epoch": 3.2548920443493485, "grad_norm": 1.234375, "learning_rate": 0.0003954318272438862, "loss": 4.9499, "mean_token_accuracy": 0.20917630344629287, "num_tokens": 72571535.0, "step": 41835 }, { "entropy": 5.892104434967041, "epoch": 3.255281073721066, "grad_norm": 1.2421875, "learning_rate": 0.0003954084151932067, "loss": 5.0658, "mean_token_accuracy": 0.20261505246162415, "num_tokens": 72580217.0, "step": 41840 }, { "entropy": 5.834992218017578, "epoch": 3.2556701030927835, "grad_norm": 1.2890625, "learning_rate": 0.0003953850013155214, "loss": 4.9423, "mean_token_accuracy": 0.20555755048990249, "num_tokens": 72588173.0, "step": 41845 }, { "entropy": 5.811919689178467, "epoch": 3.256059132464501, "grad_norm": 1.3125, "learning_rate": 0.0003953615856111852, "loss": 4.9188, "mean_token_accuracy": 0.21008205711841582, "num_tokens": 72596637.0, "step": 41850 }, { "entropy": 5.851525592803955, "epoch": 3.256448161836219, "grad_norm": 1.2421875, "learning_rate": 0.00039533816808055345, "loss": 4.8993, "mean_token_accuracy": 0.21256849616765977, "num_tokens": 72605240.0, "step": 41855 }, { "entropy": 5.805837488174438, "epoch": 3.256837191207936, "grad_norm": 1.40625, "learning_rate": 0.00039531474872398165, "loss": 4.9204, "mean_token_accuracy": 0.2113334909081459, "num_tokens": 72613566.0, "step": 41860 }, { "entropy": 5.837501525878906, "epoch": 3.257226220579654, "grad_norm": 1.2578125, "learning_rate": 0.000395291327541825, "loss": 4.9438, "mean_token_accuracy": 0.21383706480264664, "num_tokens": 72622343.0, "step": 41865 }, { "entropy": 5.890217208862305, "epoch": 3.257615249951371, "grad_norm": 1.34375, "learning_rate": 0.00039526790453443887, "loss": 5.0488, "mean_token_accuracy": 0.2085500255227089, "num_tokens": 72630864.0, "step": 41870 }, { "entropy": 5.9177717685699465, "epoch": 3.258004279323089, "grad_norm": 1.2734375, "learning_rate": 0.00039524447970217875, "loss": 5.0961, "mean_token_accuracy": 0.20058230459690093, "num_tokens": 72639990.0, "step": 41875 }, { "entropy": 5.86585750579834, "epoch": 3.2583933086948065, "grad_norm": 1.28125, "learning_rate": 0.00039522105304540007, "loss": 4.9389, "mean_token_accuracy": 0.21100347340106965, "num_tokens": 72648739.0, "step": 41880 }, { "entropy": 5.850292825698853, "epoch": 3.258782338066524, "grad_norm": 1.3359375, "learning_rate": 0.0003951976245644582, "loss": 4.99, "mean_token_accuracy": 0.21081506311893464, "num_tokens": 72657981.0, "step": 41885 }, { "entropy": 5.811745119094849, "epoch": 3.2591713674382414, "grad_norm": 1.3984375, "learning_rate": 0.0003951741942597087, "loss": 4.9131, "mean_token_accuracy": 0.21941595226526261, "num_tokens": 72666568.0, "step": 41890 }, { "entropy": 5.839476442337036, "epoch": 3.259560396809959, "grad_norm": 1.328125, "learning_rate": 0.00039515076213150714, "loss": 4.9296, "mean_token_accuracy": 0.21191552132368088, "num_tokens": 72674752.0, "step": 41895 }, { "entropy": 5.840234899520874, "epoch": 3.259949426181677, "grad_norm": 1.2890625, "learning_rate": 0.00039512732818020903, "loss": 5.0252, "mean_token_accuracy": 0.20724097043275833, "num_tokens": 72683498.0, "step": 41900 }, { "entropy": 5.835481309890747, "epoch": 3.260338455553394, "grad_norm": 1.2578125, "learning_rate": 0.0003951038924061698, "loss": 4.9349, "mean_token_accuracy": 0.21460264623165132, "num_tokens": 72693152.0, "step": 41905 }, { "entropy": 5.8911693572998045, "epoch": 3.2607274849251118, "grad_norm": 1.1875, "learning_rate": 0.00039508045480974517, "loss": 4.9391, "mean_token_accuracy": 0.20620122998952867, "num_tokens": 72701860.0, "step": 41910 }, { "entropy": 5.8231535911560055, "epoch": 3.2611165142968295, "grad_norm": 1.40625, "learning_rate": 0.00039505701539129087, "loss": 4.9305, "mean_token_accuracy": 0.2125685393810272, "num_tokens": 72709534.0, "step": 41915 }, { "entropy": 5.7989319324493405, "epoch": 3.261505543668547, "grad_norm": 1.2265625, "learning_rate": 0.00039503357415116236, "loss": 4.9688, "mean_token_accuracy": 0.20856141448020935, "num_tokens": 72718275.0, "step": 41920 }, { "entropy": 5.89702091217041, "epoch": 3.2618945730402644, "grad_norm": 1.3984375, "learning_rate": 0.00039501013108971547, "loss": 5.0247, "mean_token_accuracy": 0.2130662113428116, "num_tokens": 72727208.0, "step": 41925 }, { "entropy": 5.83869686126709, "epoch": 3.262283602411982, "grad_norm": 1.375, "learning_rate": 0.0003949866862073059, "loss": 4.9114, "mean_token_accuracy": 0.2141250416636467, "num_tokens": 72735346.0, "step": 41930 }, { "entropy": 5.843750619888306, "epoch": 3.2626726317837, "grad_norm": 1.3125, "learning_rate": 0.00039496323950428925, "loss": 4.9929, "mean_token_accuracy": 0.21010990291833878, "num_tokens": 72745424.0, "step": 41935 }, { "entropy": 5.859559059143066, "epoch": 3.263061661155417, "grad_norm": 1.3203125, "learning_rate": 0.0003949397909810213, "loss": 4.9772, "mean_token_accuracy": 0.2041515365242958, "num_tokens": 72754773.0, "step": 41940 }, { "entropy": 5.835443687438965, "epoch": 3.2634506905271348, "grad_norm": 1.40625, "learning_rate": 0.00039491634063785813, "loss": 4.8451, "mean_token_accuracy": 0.214905746281147, "num_tokens": 72762761.0, "step": 41945 }, { "entropy": 5.8295269966125485, "epoch": 3.2638397198988525, "grad_norm": 1.1875, "learning_rate": 0.00039489288847515525, "loss": 4.9731, "mean_token_accuracy": 0.20945342183113097, "num_tokens": 72771578.0, "step": 41950 }, { "entropy": 5.8990583419799805, "epoch": 3.26422874927057, "grad_norm": 1.28125, "learning_rate": 0.0003948694344932687, "loss": 5.0319, "mean_token_accuracy": 0.20886601954698564, "num_tokens": 72780671.0, "step": 41955 }, { "entropy": 5.908766222000122, "epoch": 3.2646177786422874, "grad_norm": 1.359375, "learning_rate": 0.0003948459786925542, "loss": 4.9756, "mean_token_accuracy": 0.2106522426009178, "num_tokens": 72789452.0, "step": 41960 }, { "entropy": 5.8628747940063475, "epoch": 3.265006808014005, "grad_norm": 1.28125, "learning_rate": 0.0003948225210733677, "loss": 4.9256, "mean_token_accuracy": 0.2127100110054016, "num_tokens": 72797327.0, "step": 41965 }, { "entropy": 5.820798063278199, "epoch": 3.265395837385723, "grad_norm": 1.5234375, "learning_rate": 0.0003947990616360652, "loss": 4.9742, "mean_token_accuracy": 0.21106703132390975, "num_tokens": 72806344.0, "step": 41970 }, { "entropy": 5.8147258281707765, "epoch": 3.26578486675744, "grad_norm": 1.3125, "learning_rate": 0.0003947756003810026, "loss": 4.9547, "mean_token_accuracy": 0.21391002535820008, "num_tokens": 72815144.0, "step": 41975 }, { "entropy": 5.873108053207398, "epoch": 3.2661738961291578, "grad_norm": 1.3125, "learning_rate": 0.0003947521373085359, "loss": 5.0245, "mean_token_accuracy": 0.20321057140827178, "num_tokens": 72824160.0, "step": 41980 }, { "entropy": 5.915070581436157, "epoch": 3.2665629255008755, "grad_norm": 1.296875, "learning_rate": 0.0003947286724190212, "loss": 5.0948, "mean_token_accuracy": 0.20254190415143966, "num_tokens": 72833155.0, "step": 41985 }, { "entropy": 5.7415882587432865, "epoch": 3.2669519548725927, "grad_norm": 1.3046875, "learning_rate": 0.00039470520571281443, "loss": 4.8283, "mean_token_accuracy": 0.22486157864332199, "num_tokens": 72842260.0, "step": 41990 }, { "entropy": 5.836046981811523, "epoch": 3.2673409842443104, "grad_norm": 1.203125, "learning_rate": 0.00039468173719027163, "loss": 4.9193, "mean_token_accuracy": 0.21455041021108628, "num_tokens": 72851434.0, "step": 41995 }, { "entropy": 5.821157550811767, "epoch": 3.267730013616028, "grad_norm": 1.6015625, "learning_rate": 0.0003946582668517491, "loss": 4.964, "mean_token_accuracy": 0.20854993760585785, "num_tokens": 72859521.0, "step": 42000 }, { "epoch": 3.267730013616028, "eval_entropy": 5.556047858035369, "eval_loss": 5.070876121520996, "eval_mean_token_accuracy": 0.21527995658649401, "eval_num_tokens": 72859521.0, "eval_runtime": 21.6295, "eval_samples_per_second": 1921.36, "eval_steps_per_second": 240.182, "step": 42000 }, { "entropy": 5.758299922943115, "epoch": 3.2681190429877454, "grad_norm": 1.3203125, "learning_rate": 0.0003946347946976026, "loss": 4.9248, "mean_token_accuracy": 0.20697599202394484, "num_tokens": 72868554.0, "step": 42005 }, { "entropy": 5.891294288635254, "epoch": 3.268508072359463, "grad_norm": 1.296875, "learning_rate": 0.0003946113207281887, "loss": 5.0367, "mean_token_accuracy": 0.2071451172232628, "num_tokens": 72877360.0, "step": 42010 }, { "entropy": 5.8557299137115475, "epoch": 3.2688971017311808, "grad_norm": 1.2734375, "learning_rate": 0.00039458784494386337, "loss": 5.0243, "mean_token_accuracy": 0.200650355219841, "num_tokens": 72885962.0, "step": 42015 }, { "entropy": 5.912816572189331, "epoch": 3.2692861311028985, "grad_norm": 1.2890625, "learning_rate": 0.00039456436734498275, "loss": 5.0043, "mean_token_accuracy": 0.20639751702547074, "num_tokens": 72894976.0, "step": 42020 }, { "entropy": 5.794985103607178, "epoch": 3.2696751604746157, "grad_norm": 1.296875, "learning_rate": 0.00039454088793190316, "loss": 4.9762, "mean_token_accuracy": 0.20383837223052978, "num_tokens": 72903775.0, "step": 42025 }, { "entropy": 5.818513631820679, "epoch": 3.2700641898463334, "grad_norm": 1.40625, "learning_rate": 0.00039451740670498094, "loss": 4.9464, "mean_token_accuracy": 0.2107660785317421, "num_tokens": 72912013.0, "step": 42030 }, { "entropy": 5.841211366653442, "epoch": 3.270453219218051, "grad_norm": 1.328125, "learning_rate": 0.0003944939236645723, "loss": 4.9582, "mean_token_accuracy": 0.21072672307491302, "num_tokens": 72920204.0, "step": 42035 }, { "entropy": 5.843954801559448, "epoch": 3.2708422485897684, "grad_norm": 1.1953125, "learning_rate": 0.0003944704388110335, "loss": 4.9556, "mean_token_accuracy": 0.20791803002357484, "num_tokens": 72930125.0, "step": 42040 }, { "entropy": 5.79491696357727, "epoch": 3.271231277961486, "grad_norm": 1.4765625, "learning_rate": 0.000394446952144721, "loss": 4.8988, "mean_token_accuracy": 0.2118603602051735, "num_tokens": 72938884.0, "step": 42045 }, { "entropy": 5.797326469421387, "epoch": 3.2716203073332037, "grad_norm": 1.2734375, "learning_rate": 0.0003944234636659911, "loss": 4.9994, "mean_token_accuracy": 0.2066956341266632, "num_tokens": 72947303.0, "step": 42050 }, { "entropy": 5.853543996810913, "epoch": 3.2720093367049214, "grad_norm": 1.265625, "learning_rate": 0.0003943999733752003, "loss": 5.009, "mean_token_accuracy": 0.20157743841409684, "num_tokens": 72955789.0, "step": 42055 }, { "entropy": 5.763695478439331, "epoch": 3.2723983660766387, "grad_norm": 1.2734375, "learning_rate": 0.0003943764812727048, "loss": 4.9076, "mean_token_accuracy": 0.221087484061718, "num_tokens": 72963931.0, "step": 42060 }, { "entropy": 5.764915323257446, "epoch": 3.2727873954483564, "grad_norm": 1.3515625, "learning_rate": 0.00039435298735886133, "loss": 4.9274, "mean_token_accuracy": 0.20477720946073533, "num_tokens": 72973094.0, "step": 42065 }, { "entropy": 5.8211160659790036, "epoch": 3.273176424820074, "grad_norm": 1.28125, "learning_rate": 0.0003943294916340261, "loss": 4.9125, "mean_token_accuracy": 0.2124040901660919, "num_tokens": 72981461.0, "step": 42070 }, { "entropy": 5.880550670623779, "epoch": 3.2735654541917913, "grad_norm": 1.34375, "learning_rate": 0.0003943059940985559, "loss": 4.9494, "mean_token_accuracy": 0.21562696397304534, "num_tokens": 72989986.0, "step": 42075 }, { "entropy": 5.931149244308472, "epoch": 3.273954483563509, "grad_norm": 1.4140625, "learning_rate": 0.00039428249475280706, "loss": 4.9499, "mean_token_accuracy": 0.21342407613992692, "num_tokens": 72998020.0, "step": 42080 }, { "entropy": 5.848946237564087, "epoch": 3.2743435129352267, "grad_norm": 1.3671875, "learning_rate": 0.0003942589935971363, "loss": 5.0347, "mean_token_accuracy": 0.2022048845887184, "num_tokens": 73006103.0, "step": 42085 }, { "entropy": 5.735710334777832, "epoch": 3.274732542306944, "grad_norm": 1.3203125, "learning_rate": 0.0003942354906319001, "loss": 4.8831, "mean_token_accuracy": 0.21790630221366883, "num_tokens": 73014396.0, "step": 42090 }, { "entropy": 5.8317530155181885, "epoch": 3.2751215716786617, "grad_norm": 1.3203125, "learning_rate": 0.0003942119858574551, "loss": 4.9972, "mean_token_accuracy": 0.2070605367422104, "num_tokens": 73022714.0, "step": 42095 }, { "entropy": 5.856555604934693, "epoch": 3.2755106010503794, "grad_norm": 1.359375, "learning_rate": 0.000394188479274158, "loss": 5.0073, "mean_token_accuracy": 0.20847219228744507, "num_tokens": 73031295.0, "step": 42100 }, { "entropy": 5.928793907165527, "epoch": 3.2758996304220966, "grad_norm": 1.328125, "learning_rate": 0.00039416497088236535, "loss": 5.0317, "mean_token_accuracy": 0.21158937066793443, "num_tokens": 73039728.0, "step": 42105 }, { "entropy": 5.860816717147827, "epoch": 3.2762886597938143, "grad_norm": 1.21875, "learning_rate": 0.000394141460682434, "loss": 4.9816, "mean_token_accuracy": 0.20716286897659303, "num_tokens": 73049125.0, "step": 42110 }, { "entropy": 5.820709323883056, "epoch": 3.276677689165532, "grad_norm": 1.2890625, "learning_rate": 0.0003941179486747206, "loss": 5.0058, "mean_token_accuracy": 0.2053380087018013, "num_tokens": 73056992.0, "step": 42115 }, { "entropy": 5.782445192337036, "epoch": 3.2770667185372497, "grad_norm": 1.203125, "learning_rate": 0.0003940944348595819, "loss": 4.9182, "mean_token_accuracy": 0.2146309033036232, "num_tokens": 73066866.0, "step": 42120 }, { "entropy": 5.85546727180481, "epoch": 3.277455747908967, "grad_norm": 1.3125, "learning_rate": 0.00039407091923737475, "loss": 4.959, "mean_token_accuracy": 0.2142377495765686, "num_tokens": 73075961.0, "step": 42125 }, { "entropy": 5.894864177703857, "epoch": 3.2778447772806847, "grad_norm": 1.25, "learning_rate": 0.00039404740180845594, "loss": 5.0792, "mean_token_accuracy": 0.20389993935823442, "num_tokens": 73085711.0, "step": 42130 }, { "entropy": 5.827836275100708, "epoch": 3.2782338066524024, "grad_norm": 1.3125, "learning_rate": 0.00039402388257318236, "loss": 4.8353, "mean_token_accuracy": 0.21816546320915223, "num_tokens": 73094303.0, "step": 42135 }, { "entropy": 5.855353927612304, "epoch": 3.2786228360241196, "grad_norm": 1.3125, "learning_rate": 0.0003940003615319106, "loss": 4.9331, "mean_token_accuracy": 0.2054259806871414, "num_tokens": 73102703.0, "step": 42140 }, { "entropy": 5.827605533599853, "epoch": 3.2790118653958373, "grad_norm": 1.296875, "learning_rate": 0.00039397683868499784, "loss": 4.9152, "mean_token_accuracy": 0.20903125554323196, "num_tokens": 73111823.0, "step": 42145 }, { "entropy": 5.799358367919922, "epoch": 3.279400894767555, "grad_norm": 1.2890625, "learning_rate": 0.000393953314032801, "loss": 4.9806, "mean_token_accuracy": 0.20332070887088777, "num_tokens": 73121135.0, "step": 42150 }, { "entropy": 5.872877025604248, "epoch": 3.2797899241392727, "grad_norm": 1.453125, "learning_rate": 0.0003939297875756769, "loss": 4.9686, "mean_token_accuracy": 0.20659374296665192, "num_tokens": 73129317.0, "step": 42155 }, { "entropy": 5.879653978347778, "epoch": 3.28017895351099, "grad_norm": 1.296875, "learning_rate": 0.0003939062593139825, "loss": 4.9476, "mean_token_accuracy": 0.2098517194390297, "num_tokens": 73138395.0, "step": 42160 }, { "entropy": 5.781131315231323, "epoch": 3.2805679828827077, "grad_norm": 1.3828125, "learning_rate": 0.000393882729248075, "loss": 4.9162, "mean_token_accuracy": 0.21325925439596177, "num_tokens": 73146272.0, "step": 42165 }, { "entropy": 5.798563241958618, "epoch": 3.2809570122544254, "grad_norm": 1.3515625, "learning_rate": 0.00039385919737831127, "loss": 4.9883, "mean_token_accuracy": 0.2085891678929329, "num_tokens": 73154630.0, "step": 42170 }, { "entropy": 5.885260057449341, "epoch": 3.2813460416261426, "grad_norm": 1.296875, "learning_rate": 0.00039383566370504837, "loss": 4.9125, "mean_token_accuracy": 0.21565323323011398, "num_tokens": 73162857.0, "step": 42175 }, { "entropy": 5.874507713317871, "epoch": 3.2817350709978603, "grad_norm": 1.3671875, "learning_rate": 0.0003938121282286434, "loss": 5.0211, "mean_token_accuracy": 0.20456851422786712, "num_tokens": 73171197.0, "step": 42180 }, { "entropy": 5.801846742630005, "epoch": 3.282124100369578, "grad_norm": 1.328125, "learning_rate": 0.00039378859094945366, "loss": 4.8511, "mean_token_accuracy": 0.21923355311155318, "num_tokens": 73179863.0, "step": 42185 }, { "entropy": 5.806522083282471, "epoch": 3.2825131297412953, "grad_norm": 1.28125, "learning_rate": 0.0003937650518678359, "loss": 4.9325, "mean_token_accuracy": 0.20902454257011413, "num_tokens": 73189129.0, "step": 42190 }, { "entropy": 5.836764907836914, "epoch": 3.282902159113013, "grad_norm": 1.28125, "learning_rate": 0.0003937415109841476, "loss": 4.9903, "mean_token_accuracy": 0.1997587114572525, "num_tokens": 73198361.0, "step": 42195 }, { "entropy": 5.863855361938477, "epoch": 3.2832911884847307, "grad_norm": 1.2890625, "learning_rate": 0.0003937179682987459, "loss": 5.0249, "mean_token_accuracy": 0.20621461868286134, "num_tokens": 73206662.0, "step": 42200 }, { "entropy": 5.850204849243164, "epoch": 3.283680217856448, "grad_norm": 1.4140625, "learning_rate": 0.00039369442381198793, "loss": 5.0262, "mean_token_accuracy": 0.20960848778486252, "num_tokens": 73214836.0, "step": 42205 }, { "entropy": 5.794151735305786, "epoch": 3.2840692472281656, "grad_norm": 1.359375, "learning_rate": 0.000393670877524231, "loss": 4.8634, "mean_token_accuracy": 0.22028219252824782, "num_tokens": 73222920.0, "step": 42210 }, { "entropy": 5.83977575302124, "epoch": 3.2844582765998833, "grad_norm": 1.359375, "learning_rate": 0.0003936473294358325, "loss": 4.9501, "mean_token_accuracy": 0.2130502939224243, "num_tokens": 73232298.0, "step": 42215 }, { "entropy": 5.8012042999267575, "epoch": 3.284847305971601, "grad_norm": 1.3125, "learning_rate": 0.0003936237795471495, "loss": 4.881, "mean_token_accuracy": 0.2207501322031021, "num_tokens": 73240972.0, "step": 42220 }, { "entropy": 5.799656915664673, "epoch": 3.2852363353433183, "grad_norm": 1.28125, "learning_rate": 0.00039360022785853957, "loss": 4.9396, "mean_token_accuracy": 0.2151234045624733, "num_tokens": 73249140.0, "step": 42225 }, { "entropy": 5.875300502777099, "epoch": 3.285625364715036, "grad_norm": 1.3828125, "learning_rate": 0.0003935766743703599, "loss": 4.9697, "mean_token_accuracy": 0.20288372039794922, "num_tokens": 73258434.0, "step": 42230 }, { "entropy": 5.86159496307373, "epoch": 3.2860143940867537, "grad_norm": 1.2578125, "learning_rate": 0.00039355311908296787, "loss": 4.9826, "mean_token_accuracy": 0.2001311868429184, "num_tokens": 73266745.0, "step": 42235 }, { "entropy": 5.899941349029541, "epoch": 3.286403423458471, "grad_norm": 1.296875, "learning_rate": 0.000393529561996721, "loss": 5.0298, "mean_token_accuracy": 0.2089293897151947, "num_tokens": 73275072.0, "step": 42240 }, { "entropy": 5.8372656345367435, "epoch": 3.2867924528301886, "grad_norm": 1.28125, "learning_rate": 0.00039350600311197667, "loss": 4.9245, "mean_token_accuracy": 0.21633943319320678, "num_tokens": 73284402.0, "step": 42245 }, { "entropy": 5.879165506362915, "epoch": 3.2871814822019063, "grad_norm": 1.2734375, "learning_rate": 0.00039348244242909234, "loss": 5.0121, "mean_token_accuracy": 0.2120365619659424, "num_tokens": 73293870.0, "step": 42250 }, { "entropy": 5.887145948410034, "epoch": 3.287570511573624, "grad_norm": 1.40625, "learning_rate": 0.00039345887994842566, "loss": 5.0188, "mean_token_accuracy": 0.20394021421670913, "num_tokens": 73303196.0, "step": 42255 }, { "entropy": 5.854613351821899, "epoch": 3.2879595409453413, "grad_norm": 1.2890625, "learning_rate": 0.0003934353156703339, "loss": 4.9185, "mean_token_accuracy": 0.20981398969888687, "num_tokens": 73311549.0, "step": 42260 }, { "entropy": 5.807502412796021, "epoch": 3.288348570317059, "grad_norm": 1.3125, "learning_rate": 0.0003934117495951748, "loss": 4.9344, "mean_token_accuracy": 0.2147183522582054, "num_tokens": 73321126.0, "step": 42265 }, { "entropy": 5.787750625610352, "epoch": 3.2887375996887767, "grad_norm": 1.3203125, "learning_rate": 0.0003933881817233058, "loss": 4.8459, "mean_token_accuracy": 0.22305065840482713, "num_tokens": 73330207.0, "step": 42270 }, { "entropy": 5.898659706115723, "epoch": 3.289126629060494, "grad_norm": 1.375, "learning_rate": 0.00039336461205508456, "loss": 5.0216, "mean_token_accuracy": 0.21271206736564635, "num_tokens": 73339099.0, "step": 42275 }, { "entropy": 5.7973545551300045, "epoch": 3.2895156584322116, "grad_norm": 1.34375, "learning_rate": 0.0003933410405908689, "loss": 4.8763, "mean_token_accuracy": 0.21505739390850068, "num_tokens": 73347566.0, "step": 42280 }, { "entropy": 5.874573469161987, "epoch": 3.2899046878039293, "grad_norm": 1.296875, "learning_rate": 0.00039331746733101613, "loss": 5.0001, "mean_token_accuracy": 0.2091255322098732, "num_tokens": 73355909.0, "step": 42285 }, { "entropy": 5.805905771255493, "epoch": 3.290293717175647, "grad_norm": 1.421875, "learning_rate": 0.00039329389227588416, "loss": 4.9147, "mean_token_accuracy": 0.21106512993574142, "num_tokens": 73365233.0, "step": 42290 }, { "entropy": 5.875520658493042, "epoch": 3.2906827465473643, "grad_norm": 1.34375, "learning_rate": 0.00039327031542583067, "loss": 5.0217, "mean_token_accuracy": 0.21213218122720717, "num_tokens": 73373623.0, "step": 42295 }, { "entropy": 5.827519130706787, "epoch": 3.291071775919082, "grad_norm": 1.3984375, "learning_rate": 0.00039324673678121344, "loss": 4.9402, "mean_token_accuracy": 0.2082584023475647, "num_tokens": 73381668.0, "step": 42300 }, { "entropy": 5.832705974578857, "epoch": 3.291460805290799, "grad_norm": 1.296875, "learning_rate": 0.0003932231563423901, "loss": 5.0243, "mean_token_accuracy": 0.20912815779447555, "num_tokens": 73390284.0, "step": 42305 }, { "entropy": 5.846575975418091, "epoch": 3.291849834662517, "grad_norm": 1.359375, "learning_rate": 0.0003931995741097186, "loss": 4.9427, "mean_token_accuracy": 0.2177132323384285, "num_tokens": 73398704.0, "step": 42310 }, { "entropy": 5.863977479934692, "epoch": 3.2922388640342346, "grad_norm": 1.359375, "learning_rate": 0.00039317599008355665, "loss": 5.0114, "mean_token_accuracy": 0.20509020686149598, "num_tokens": 73407270.0, "step": 42315 }, { "entropy": 5.885476016998291, "epoch": 3.2926278934059523, "grad_norm": 1.328125, "learning_rate": 0.0003931524042642622, "loss": 5.0074, "mean_token_accuracy": 0.21272029280662536, "num_tokens": 73416158.0, "step": 42320 }, { "entropy": 5.883214378356934, "epoch": 3.2930169227776696, "grad_norm": 1.28125, "learning_rate": 0.0003931288166521931, "loss": 5.0736, "mean_token_accuracy": 0.20418912321329116, "num_tokens": 73424823.0, "step": 42325 }, { "entropy": 5.90181074142456, "epoch": 3.2934059521493873, "grad_norm": 1.421875, "learning_rate": 0.00039310522724770713, "loss": 4.9783, "mean_token_accuracy": 0.21451079994440078, "num_tokens": 73432699.0, "step": 42330 }, { "entropy": 5.78568320274353, "epoch": 3.293794981521105, "grad_norm": 1.3203125, "learning_rate": 0.00039308163605116235, "loss": 4.972, "mean_token_accuracy": 0.20922284573316574, "num_tokens": 73441154.0, "step": 42335 }, { "entropy": 5.8774559020996096, "epoch": 3.294184010892822, "grad_norm": 1.3125, "learning_rate": 0.0003930580430629167, "loss": 5.0968, "mean_token_accuracy": 0.20230432003736495, "num_tokens": 73449804.0, "step": 42340 }, { "entropy": 5.880717039108276, "epoch": 3.29457304026454, "grad_norm": 1.3046875, "learning_rate": 0.0003930344482833281, "loss": 4.9617, "mean_token_accuracy": 0.2074015974998474, "num_tokens": 73458546.0, "step": 42345 }, { "entropy": 5.899647378921509, "epoch": 3.2949620696362576, "grad_norm": 1.2734375, "learning_rate": 0.00039301085171275475, "loss": 4.9753, "mean_token_accuracy": 0.20935631692409515, "num_tokens": 73467404.0, "step": 42350 }, { "entropy": 5.814826726913452, "epoch": 3.2953510990079753, "grad_norm": 1.359375, "learning_rate": 0.0003929872533515545, "loss": 4.9885, "mean_token_accuracy": 0.21057751327753066, "num_tokens": 73476520.0, "step": 42355 }, { "entropy": 5.806273746490478, "epoch": 3.2957401283796925, "grad_norm": 1.21875, "learning_rate": 0.00039296365320008546, "loss": 5.0172, "mean_token_accuracy": 0.20643816143274307, "num_tokens": 73485927.0, "step": 42360 }, { "entropy": 5.890439701080322, "epoch": 3.2961291577514102, "grad_norm": 1.5, "learning_rate": 0.00039294005125870576, "loss": 4.9892, "mean_token_accuracy": 0.20817520320415497, "num_tokens": 73493971.0, "step": 42365 }, { "entropy": 5.789645957946777, "epoch": 3.296518187123128, "grad_norm": 1.3203125, "learning_rate": 0.00039291644752777346, "loss": 4.9021, "mean_token_accuracy": 0.20926578044891359, "num_tokens": 73502565.0, "step": 42370 }, { "entropy": 5.821596908569336, "epoch": 3.296907216494845, "grad_norm": 1.2890625, "learning_rate": 0.00039289284200764676, "loss": 4.9834, "mean_token_accuracy": 0.21939948052167893, "num_tokens": 73511306.0, "step": 42375 }, { "entropy": 5.886881351470947, "epoch": 3.297296245866563, "grad_norm": 1.40625, "learning_rate": 0.0003928692346986839, "loss": 4.9511, "mean_token_accuracy": 0.20738032460212708, "num_tokens": 73520054.0, "step": 42380 }, { "entropy": 5.782700109481811, "epoch": 3.2976852752382806, "grad_norm": 1.453125, "learning_rate": 0.00039284562560124297, "loss": 4.8406, "mean_token_accuracy": 0.21730977892875672, "num_tokens": 73528108.0, "step": 42385 }, { "entropy": 5.829644584655762, "epoch": 3.2980743046099983, "grad_norm": 1.375, "learning_rate": 0.0003928220147156822, "loss": 5.013, "mean_token_accuracy": 0.2090679094195366, "num_tokens": 73536478.0, "step": 42390 }, { "entropy": 5.799276876449585, "epoch": 3.2984633339817155, "grad_norm": 1.40625, "learning_rate": 0.00039279840204235994, "loss": 4.913, "mean_token_accuracy": 0.21344873309135437, "num_tokens": 73544550.0, "step": 42395 }, { "entropy": 5.8829535961151125, "epoch": 3.2988523633534332, "grad_norm": 1.34375, "learning_rate": 0.00039277478758163443, "loss": 4.9782, "mean_token_accuracy": 0.2101181596517563, "num_tokens": 73552982.0, "step": 42400 }, { "entropy": 5.827280569076538, "epoch": 3.299241392725151, "grad_norm": 1.2734375, "learning_rate": 0.000392751171333864, "loss": 4.9473, "mean_token_accuracy": 0.2102155014872551, "num_tokens": 73562177.0, "step": 42405 }, { "entropy": 5.900981187820435, "epoch": 3.299630422096868, "grad_norm": 1.34375, "learning_rate": 0.00039272755329940683, "loss": 5.052, "mean_token_accuracy": 0.20447300970554352, "num_tokens": 73570552.0, "step": 42410 }, { "entropy": 5.8899781703948975, "epoch": 3.300019451468586, "grad_norm": 1.3515625, "learning_rate": 0.00039270393347862155, "loss": 5.07, "mean_token_accuracy": 0.20506585538387298, "num_tokens": 73580017.0, "step": 42415 }, { "entropy": 5.868103790283203, "epoch": 3.3004084808403036, "grad_norm": 1.2265625, "learning_rate": 0.00039268031187186635, "loss": 4.9698, "mean_token_accuracy": 0.21190062910318375, "num_tokens": 73588956.0, "step": 42420 }, { "entropy": 5.903385829925537, "epoch": 3.300797510212021, "grad_norm": 1.265625, "learning_rate": 0.00039265668847949977, "loss": 5.0465, "mean_token_accuracy": 0.21161836981773377, "num_tokens": 73598440.0, "step": 42425 }, { "entropy": 5.825795030593872, "epoch": 3.3011865395837385, "grad_norm": 1.3125, "learning_rate": 0.0003926330633018802, "loss": 5.0022, "mean_token_accuracy": 0.20690242499113082, "num_tokens": 73607780.0, "step": 42430 }, { "entropy": 5.844006967544556, "epoch": 3.3015755689554562, "grad_norm": 1.28125, "learning_rate": 0.00039260943633936615, "loss": 5.0097, "mean_token_accuracy": 0.20750716626644133, "num_tokens": 73616816.0, "step": 42435 }, { "entropy": 5.814282512664795, "epoch": 3.3019645983271735, "grad_norm": 1.296875, "learning_rate": 0.00039258580759231603, "loss": 4.9166, "mean_token_accuracy": 0.21747713088989257, "num_tokens": 73624546.0, "step": 42440 }, { "entropy": 5.78208818435669, "epoch": 3.302353627698891, "grad_norm": 1.328125, "learning_rate": 0.0003925621770610885, "loss": 4.8454, "mean_token_accuracy": 0.22139570415019988, "num_tokens": 73632917.0, "step": 42445 }, { "entropy": 5.729669618606567, "epoch": 3.302742657070609, "grad_norm": 1.3203125, "learning_rate": 0.000392538544746042, "loss": 4.8157, "mean_token_accuracy": 0.21723325550556183, "num_tokens": 73641262.0, "step": 42450 }, { "entropy": 5.7563389301300045, "epoch": 3.3031316864423266, "grad_norm": 1.3828125, "learning_rate": 0.00039251491064753525, "loss": 4.9182, "mean_token_accuracy": 0.20476796478033066, "num_tokens": 73649751.0, "step": 42455 }, { "entropy": 5.82024917602539, "epoch": 3.303520715814044, "grad_norm": 1.2734375, "learning_rate": 0.0003924912747659267, "loss": 5.0101, "mean_token_accuracy": 0.1986706718802452, "num_tokens": 73658697.0, "step": 42460 }, { "entropy": 5.820790815353393, "epoch": 3.3039097451857615, "grad_norm": 1.25, "learning_rate": 0.00039246763710157513, "loss": 4.9353, "mean_token_accuracy": 0.21357878893613816, "num_tokens": 73667232.0, "step": 42465 }, { "entropy": 5.828835678100586, "epoch": 3.3042987745574792, "grad_norm": 1.3359375, "learning_rate": 0.0003924439976548391, "loss": 4.9486, "mean_token_accuracy": 0.2115991234779358, "num_tokens": 73675531.0, "step": 42470 }, { "entropy": 5.837472343444825, "epoch": 3.3046878039291965, "grad_norm": 1.28125, "learning_rate": 0.00039242035642607733, "loss": 4.9712, "mean_token_accuracy": 0.2053645834326744, "num_tokens": 73683312.0, "step": 42475 }, { "entropy": 5.880854797363281, "epoch": 3.305076833300914, "grad_norm": 1.2578125, "learning_rate": 0.0003923967134156486, "loss": 5.0949, "mean_token_accuracy": 0.20000273883342742, "num_tokens": 73691929.0, "step": 42480 }, { "entropy": 5.805250883102417, "epoch": 3.305465862672632, "grad_norm": 1.2109375, "learning_rate": 0.0003923730686239115, "loss": 4.9719, "mean_token_accuracy": 0.21509898751974105, "num_tokens": 73700643.0, "step": 42485 }, { "entropy": 5.858594608306885, "epoch": 3.3058548920443496, "grad_norm": 1.328125, "learning_rate": 0.0003923494220512249, "loss": 4.9422, "mean_token_accuracy": 0.2096325933933258, "num_tokens": 73709027.0, "step": 42490 }, { "entropy": 5.889338445663452, "epoch": 3.306243921416067, "grad_norm": 1.3203125, "learning_rate": 0.0003923257736979476, "loss": 4.9195, "mean_token_accuracy": 0.21169265359640121, "num_tokens": 73717305.0, "step": 42495 }, { "entropy": 5.86341118812561, "epoch": 3.3066329507877845, "grad_norm": 1.2890625, "learning_rate": 0.00039230212356443855, "loss": 5.0687, "mean_token_accuracy": 0.20710794925689696, "num_tokens": 73725900.0, "step": 42500 }, { "entropy": 5.826107454299927, "epoch": 3.307021980159502, "grad_norm": 1.2265625, "learning_rate": 0.00039227847165105635, "loss": 4.9411, "mean_token_accuracy": 0.21795350015163423, "num_tokens": 73734954.0, "step": 42505 }, { "entropy": 5.8410398960113525, "epoch": 3.3074110095312195, "grad_norm": 1.4140625, "learning_rate": 0.00039225481795816016, "loss": 4.9491, "mean_token_accuracy": 0.21102227568626403, "num_tokens": 73743206.0, "step": 42510 }, { "entropy": 5.811402893066406, "epoch": 3.307800038902937, "grad_norm": 1.2421875, "learning_rate": 0.0003922311624861086, "loss": 4.9566, "mean_token_accuracy": 0.2177676022052765, "num_tokens": 73752094.0, "step": 42515 }, { "entropy": 5.826411390304566, "epoch": 3.308189068274655, "grad_norm": 1.1953125, "learning_rate": 0.0003922075052352608, "loss": 4.9566, "mean_token_accuracy": 0.2172113314270973, "num_tokens": 73761623.0, "step": 42520 }, { "entropy": 5.888113498687744, "epoch": 3.308578097646372, "grad_norm": 1.46875, "learning_rate": 0.0003921838462059756, "loss": 5.0165, "mean_token_accuracy": 0.21313211768865586, "num_tokens": 73770125.0, "step": 42525 }, { "entropy": 5.8751214981079105, "epoch": 3.30896712701809, "grad_norm": 1.328125, "learning_rate": 0.00039216018539861217, "loss": 5.0546, "mean_token_accuracy": 0.20197821408510208, "num_tokens": 73778683.0, "step": 42530 }, { "entropy": 5.90404748916626, "epoch": 3.3093561563898075, "grad_norm": 1.3125, "learning_rate": 0.0003921365228135293, "loss": 4.9792, "mean_token_accuracy": 0.2064994290471077, "num_tokens": 73787014.0, "step": 42535 }, { "entropy": 5.813021945953369, "epoch": 3.3097451857615248, "grad_norm": 1.265625, "learning_rate": 0.00039211285845108617, "loss": 4.9395, "mean_token_accuracy": 0.2167838454246521, "num_tokens": 73795812.0, "step": 42540 }, { "entropy": 5.840122270584106, "epoch": 3.3101342151332425, "grad_norm": 1.2890625, "learning_rate": 0.0003920891923116418, "loss": 4.9877, "mean_token_accuracy": 0.20903054922819136, "num_tokens": 73805029.0, "step": 42545 }, { "entropy": 5.811117219924927, "epoch": 3.31052324450496, "grad_norm": 1.2890625, "learning_rate": 0.00039206552439555544, "loss": 4.9887, "mean_token_accuracy": 0.21025339215993882, "num_tokens": 73813456.0, "step": 42550 }, { "entropy": 5.930837726593017, "epoch": 3.310912273876678, "grad_norm": 1.453125, "learning_rate": 0.0003920418547031859, "loss": 5.055, "mean_token_accuracy": 0.20942474901676178, "num_tokens": 73822048.0, "step": 42555 }, { "entropy": 5.830178213119507, "epoch": 3.311301303248395, "grad_norm": 1.1875, "learning_rate": 0.0003920181832348926, "loss": 4.9764, "mean_token_accuracy": 0.21472700834274291, "num_tokens": 73831600.0, "step": 42560 }, { "entropy": 5.837258386611938, "epoch": 3.311690332620113, "grad_norm": 1.2734375, "learning_rate": 0.0003919945099910346, "loss": 4.9742, "mean_token_accuracy": 0.20774897187948227, "num_tokens": 73840633.0, "step": 42565 }, { "entropy": 5.799410963058472, "epoch": 3.3120793619918305, "grad_norm": 1.296875, "learning_rate": 0.00039197083497197107, "loss": 4.8856, "mean_token_accuracy": 0.21513110846281053, "num_tokens": 73849329.0, "step": 42570 }, { "entropy": 5.817235040664673, "epoch": 3.3124683913635478, "grad_norm": 1.3515625, "learning_rate": 0.0003919471581780613, "loss": 4.9525, "mean_token_accuracy": 0.21262370198965072, "num_tokens": 73858613.0, "step": 42575 }, { "entropy": 5.80995626449585, "epoch": 3.3128574207352655, "grad_norm": 1.28125, "learning_rate": 0.0003919234796096646, "loss": 4.9435, "mean_token_accuracy": 0.21544256210327148, "num_tokens": 73867326.0, "step": 42580 }, { "entropy": 5.823333644866944, "epoch": 3.313246450106983, "grad_norm": 1.2890625, "learning_rate": 0.0003918997992671402, "loss": 4.9606, "mean_token_accuracy": 0.2091308131814003, "num_tokens": 73875902.0, "step": 42585 }, { "entropy": 5.943651580810547, "epoch": 3.313635479478701, "grad_norm": 1.3359375, "learning_rate": 0.0003918761171508475, "loss": 5.0334, "mean_token_accuracy": 0.21149638146162034, "num_tokens": 73885343.0, "step": 42590 }, { "entropy": 5.926949214935303, "epoch": 3.314024508850418, "grad_norm": 1.4609375, "learning_rate": 0.0003918524332611456, "loss": 5.0997, "mean_token_accuracy": 0.20311731994152069, "num_tokens": 73893302.0, "step": 42595 }, { "entropy": 5.829248237609863, "epoch": 3.314413538222136, "grad_norm": 1.2890625, "learning_rate": 0.0003918287475983941, "loss": 4.9641, "mean_token_accuracy": 0.21530821919441223, "num_tokens": 73902178.0, "step": 42600 }, { "entropy": 5.815505599975586, "epoch": 3.3148025675938535, "grad_norm": 1.3046875, "learning_rate": 0.00039180506016295226, "loss": 4.911, "mean_token_accuracy": 0.21545563340187074, "num_tokens": 73911345.0, "step": 42605 }, { "entropy": 5.84421067237854, "epoch": 3.3151915969655708, "grad_norm": 1.28125, "learning_rate": 0.00039178137095517956, "loss": 4.9297, "mean_token_accuracy": 0.21338322162628173, "num_tokens": 73919693.0, "step": 42610 }, { "entropy": 5.771155118942261, "epoch": 3.3155806263372885, "grad_norm": 1.21875, "learning_rate": 0.0003917576799754354, "loss": 4.877, "mean_token_accuracy": 0.21517099738121032, "num_tokens": 73927962.0, "step": 42615 }, { "entropy": 5.831697034835815, "epoch": 3.315969655709006, "grad_norm": 1.4140625, "learning_rate": 0.0003917339872240793, "loss": 4.9762, "mean_token_accuracy": 0.20830419957637786, "num_tokens": 73936433.0, "step": 42620 }, { "entropy": 5.911880016326904, "epoch": 3.3163586850807234, "grad_norm": 1.40625, "learning_rate": 0.0003917102927014708, "loss": 5.0054, "mean_token_accuracy": 0.20829056799411774, "num_tokens": 73944964.0, "step": 42625 }, { "entropy": 5.816055536270142, "epoch": 3.316747714452441, "grad_norm": 1.359375, "learning_rate": 0.0003916865964079694, "loss": 4.904, "mean_token_accuracy": 0.2189040571451187, "num_tokens": 73954028.0, "step": 42630 }, { "entropy": 5.79279580116272, "epoch": 3.317136743824159, "grad_norm": 1.3125, "learning_rate": 0.0003916628983439345, "loss": 4.9396, "mean_token_accuracy": 0.2087011843919754, "num_tokens": 73962923.0, "step": 42635 }, { "entropy": 5.7940850257873535, "epoch": 3.317525773195876, "grad_norm": 1.3203125, "learning_rate": 0.00039163919850972585, "loss": 4.991, "mean_token_accuracy": 0.2098859280347824, "num_tokens": 73971183.0, "step": 42640 }, { "entropy": 5.8327020645141605, "epoch": 3.3179148025675937, "grad_norm": 1.3125, "learning_rate": 0.0003916154969057031, "loss": 4.9935, "mean_token_accuracy": 0.21230850964784623, "num_tokens": 73979248.0, "step": 42645 }, { "entropy": 5.856299877166748, "epoch": 3.3183038319393114, "grad_norm": 1.3046875, "learning_rate": 0.00039159179353222566, "loss": 4.9958, "mean_token_accuracy": 0.2050314500927925, "num_tokens": 73987869.0, "step": 42650 }, { "entropy": 5.857276868820191, "epoch": 3.318692861311029, "grad_norm": 1.296875, "learning_rate": 0.00039156808838965336, "loss": 4.9938, "mean_token_accuracy": 0.20746403336524963, "num_tokens": 73996562.0, "step": 42655 }, { "entropy": 5.859234094619751, "epoch": 3.3190818906827464, "grad_norm": 1.3125, "learning_rate": 0.00039154438147834595, "loss": 4.958, "mean_token_accuracy": 0.20780195146799088, "num_tokens": 74005202.0, "step": 42660 }, { "entropy": 5.865197086334229, "epoch": 3.319470920054464, "grad_norm": 1.21875, "learning_rate": 0.00039152067279866294, "loss": 5.0235, "mean_token_accuracy": 0.21197966933250428, "num_tokens": 74014541.0, "step": 42665 }, { "entropy": 5.910163640975952, "epoch": 3.319859949426182, "grad_norm": 1.390625, "learning_rate": 0.0003914969623509643, "loss": 5.0045, "mean_token_accuracy": 0.21013777554035187, "num_tokens": 74022613.0, "step": 42670 }, { "entropy": 5.8958807468414305, "epoch": 3.320248978797899, "grad_norm": 1.3828125, "learning_rate": 0.0003914732501356096, "loss": 5.0381, "mean_token_accuracy": 0.20537243783473969, "num_tokens": 74031753.0, "step": 42675 }, { "entropy": 5.89395546913147, "epoch": 3.3206380081696167, "grad_norm": 1.3203125, "learning_rate": 0.00039144953615295877, "loss": 5.0924, "mean_token_accuracy": 0.20061901062726975, "num_tokens": 74040096.0, "step": 42680 }, { "entropy": 5.8199724674224855, "epoch": 3.3210270375413344, "grad_norm": 1.359375, "learning_rate": 0.00039142582040337147, "loss": 5.0221, "mean_token_accuracy": 0.21078623980283737, "num_tokens": 74048533.0, "step": 42685 }, { "entropy": 5.8597313404083256, "epoch": 3.321416066913052, "grad_norm": 1.3046875, "learning_rate": 0.0003914021028872077, "loss": 4.9546, "mean_token_accuracy": 0.21374624818563462, "num_tokens": 74057871.0, "step": 42690 }, { "entropy": 5.894290161132813, "epoch": 3.3218050962847694, "grad_norm": 1.4375, "learning_rate": 0.0003913783836048274, "loss": 4.9634, "mean_token_accuracy": 0.211209736764431, "num_tokens": 74066343.0, "step": 42695 }, { "entropy": 5.835529088973999, "epoch": 3.322194125656487, "grad_norm": 1.3828125, "learning_rate": 0.0003913546625565902, "loss": 4.9071, "mean_token_accuracy": 0.21516996175050734, "num_tokens": 74074784.0, "step": 42700 }, { "entropy": 5.811766481399536, "epoch": 3.322583155028205, "grad_norm": 1.265625, "learning_rate": 0.00039133093974285635, "loss": 4.9577, "mean_token_accuracy": 0.2149084210395813, "num_tokens": 74083708.0, "step": 42705 }, { "entropy": 5.759116840362549, "epoch": 3.322972184399922, "grad_norm": 1.25, "learning_rate": 0.00039130721516398556, "loss": 4.8279, "mean_token_accuracy": 0.21692177653312683, "num_tokens": 74092328.0, "step": 42710 }, { "entropy": 5.8838074684143065, "epoch": 3.3233612137716397, "grad_norm": 1.265625, "learning_rate": 0.0003912834888203379, "loss": 4.9995, "mean_token_accuracy": 0.20795153826475143, "num_tokens": 74100507.0, "step": 42715 }, { "entropy": 5.83881402015686, "epoch": 3.3237502431433574, "grad_norm": 1.375, "learning_rate": 0.0003912597607122734, "loss": 4.9744, "mean_token_accuracy": 0.21333924382925035, "num_tokens": 74109317.0, "step": 42720 }, { "entropy": 5.863425827026367, "epoch": 3.324139272515075, "grad_norm": 1.4140625, "learning_rate": 0.00039123603084015204, "loss": 5.022, "mean_token_accuracy": 0.2032216578722, "num_tokens": 74118726.0, "step": 42725 }, { "entropy": 5.853871631622314, "epoch": 3.3245283018867924, "grad_norm": 1.296875, "learning_rate": 0.00039121229920433394, "loss": 4.9127, "mean_token_accuracy": 0.21436996906995773, "num_tokens": 74127298.0, "step": 42730 }, { "entropy": 5.893998765945435, "epoch": 3.32491733125851, "grad_norm": 1.265625, "learning_rate": 0.0003911885658051792, "loss": 5.0287, "mean_token_accuracy": 0.2038129225373268, "num_tokens": 74136212.0, "step": 42735 }, { "entropy": 5.789471673965454, "epoch": 3.3253063606302278, "grad_norm": 1.234375, "learning_rate": 0.00039116483064304794, "loss": 4.9307, "mean_token_accuracy": 0.21689655482769013, "num_tokens": 74144835.0, "step": 42740 }, { "entropy": 5.803245162963867, "epoch": 3.325695390001945, "grad_norm": 1.34375, "learning_rate": 0.0003911410937183002, "loss": 4.9584, "mean_token_accuracy": 0.20901769548654556, "num_tokens": 74153296.0, "step": 42745 }, { "entropy": 5.752967166900635, "epoch": 3.3260844193736627, "grad_norm": 1.3828125, "learning_rate": 0.00039111735503129626, "loss": 4.8736, "mean_token_accuracy": 0.218157622218132, "num_tokens": 74161157.0, "step": 42750 }, { "entropy": 5.841610050201416, "epoch": 3.3264734487453804, "grad_norm": 1.2578125, "learning_rate": 0.0003910936145823962, "loss": 5.0231, "mean_token_accuracy": 0.2035321295261383, "num_tokens": 74170035.0, "step": 42755 }, { "entropy": 5.863004350662232, "epoch": 3.3268624781170977, "grad_norm": 1.4453125, "learning_rate": 0.0003910698723719604, "loss": 4.9916, "mean_token_accuracy": 0.20073511302471161, "num_tokens": 74178785.0, "step": 42760 }, { "entropy": 5.902700519561767, "epoch": 3.3272515074888154, "grad_norm": 1.2890625, "learning_rate": 0.00039104612840034904, "loss": 4.9881, "mean_token_accuracy": 0.2015640452504158, "num_tokens": 74187421.0, "step": 42765 }, { "entropy": 5.906836986541748, "epoch": 3.327640536860533, "grad_norm": 1.375, "learning_rate": 0.00039102238266792234, "loss": 4.929, "mean_token_accuracy": 0.21622657030820847, "num_tokens": 74195774.0, "step": 42770 }, { "entropy": 5.90985631942749, "epoch": 3.3280295662322503, "grad_norm": 1.34375, "learning_rate": 0.00039099863517504064, "loss": 5.0196, "mean_token_accuracy": 0.20650187730789185, "num_tokens": 74204441.0, "step": 42775 }, { "entropy": 5.790881061553955, "epoch": 3.328418595603968, "grad_norm": 1.2890625, "learning_rate": 0.0003909748859220644, "loss": 4.9451, "mean_token_accuracy": 0.20908161550760268, "num_tokens": 74213042.0, "step": 42780 }, { "entropy": 5.799608945846558, "epoch": 3.3288076249756857, "grad_norm": 1.34375, "learning_rate": 0.00039095113490935377, "loss": 4.9164, "mean_token_accuracy": 0.21475863754749297, "num_tokens": 74221463.0, "step": 42785 }, { "entropy": 5.83936710357666, "epoch": 3.3291966543474034, "grad_norm": 1.3046875, "learning_rate": 0.0003909273821372692, "loss": 4.9468, "mean_token_accuracy": 0.2198818266391754, "num_tokens": 74230019.0, "step": 42790 }, { "entropy": 5.824632453918457, "epoch": 3.3295856837191207, "grad_norm": 1.4140625, "learning_rate": 0.00039090362760617114, "loss": 4.9757, "mean_token_accuracy": 0.20985606461763381, "num_tokens": 74238352.0, "step": 42795 }, { "entropy": 5.833367824554443, "epoch": 3.3299747130908384, "grad_norm": 1.359375, "learning_rate": 0.00039087987131642, "loss": 5.0008, "mean_token_accuracy": 0.21044310480356215, "num_tokens": 74246699.0, "step": 42800 }, { "entropy": 5.833177089691162, "epoch": 3.330363742462556, "grad_norm": 1.25, "learning_rate": 0.0003908561132683762, "loss": 4.9739, "mean_token_accuracy": 0.21834137588739394, "num_tokens": 74255546.0, "step": 42805 }, { "entropy": 5.904789543151855, "epoch": 3.3307527718342733, "grad_norm": 1.1796875, "learning_rate": 0.00039083235346240044, "loss": 4.986, "mean_token_accuracy": 0.20526485592126847, "num_tokens": 74264777.0, "step": 42810 }, { "entropy": 5.8385556697845455, "epoch": 3.331141801205991, "grad_norm": 1.21875, "learning_rate": 0.000390808591898853, "loss": 4.9807, "mean_token_accuracy": 0.2095123291015625, "num_tokens": 74274521.0, "step": 42815 }, { "entropy": 5.778361415863037, "epoch": 3.3315308305777087, "grad_norm": 1.2578125, "learning_rate": 0.0003907848285780945, "loss": 4.9139, "mean_token_accuracy": 0.21654916554689407, "num_tokens": 74283521.0, "step": 42820 }, { "entropy": 5.8118720054626465, "epoch": 3.3319198599494264, "grad_norm": 1.3125, "learning_rate": 0.00039076106350048557, "loss": 4.958, "mean_token_accuracy": 0.20990127176046372, "num_tokens": 74292474.0, "step": 42825 }, { "entropy": 5.82964072227478, "epoch": 3.3323088893211437, "grad_norm": 1.3828125, "learning_rate": 0.0003907372966663867, "loss": 4.9519, "mean_token_accuracy": 0.21784617900848388, "num_tokens": 74300990.0, "step": 42830 }, { "entropy": 5.923128080368042, "epoch": 3.3326979186928614, "grad_norm": 1.28125, "learning_rate": 0.0003907135280761585, "loss": 5.1353, "mean_token_accuracy": 0.19662207067012788, "num_tokens": 74310350.0, "step": 42835 }, { "entropy": 5.8685098648071286, "epoch": 3.333086948064579, "grad_norm": 1.3125, "learning_rate": 0.0003906897577301618, "loss": 4.9921, "mean_token_accuracy": 0.2115735113620758, "num_tokens": 74319468.0, "step": 42840 }, { "entropy": 5.822714471817017, "epoch": 3.3334759774362963, "grad_norm": 1.296875, "learning_rate": 0.0003906659856287571, "loss": 4.9594, "mean_token_accuracy": 0.21357482820749282, "num_tokens": 74327802.0, "step": 42845 }, { "entropy": 5.895671558380127, "epoch": 3.333865006808014, "grad_norm": 1.296875, "learning_rate": 0.00039064221177230517, "loss": 5.0615, "mean_token_accuracy": 0.2010016843676567, "num_tokens": 74337632.0, "step": 42850 }, { "entropy": 5.845259714126587, "epoch": 3.3342540361797317, "grad_norm": 1.25, "learning_rate": 0.00039061843616116683, "loss": 5.028, "mean_token_accuracy": 0.20468274056911467, "num_tokens": 74346082.0, "step": 42855 }, { "entropy": 5.813741731643677, "epoch": 3.334643065551449, "grad_norm": 1.359375, "learning_rate": 0.00039059465879570264, "loss": 4.9501, "mean_token_accuracy": 0.20808258801698684, "num_tokens": 74354238.0, "step": 42860 }, { "entropy": 5.8350170135498045, "epoch": 3.3350320949231667, "grad_norm": 1.4296875, "learning_rate": 0.0003905708796762736, "loss": 4.988, "mean_token_accuracy": 0.2023255154490471, "num_tokens": 74362576.0, "step": 42865 }, { "entropy": 5.8157310962677, "epoch": 3.3354211242948844, "grad_norm": 1.3203125, "learning_rate": 0.0003905470988032403, "loss": 4.9254, "mean_token_accuracy": 0.21614105254411697, "num_tokens": 74371188.0, "step": 42870 }, { "entropy": 5.876766395568848, "epoch": 3.3358101536666016, "grad_norm": 1.375, "learning_rate": 0.0003905233161769637, "loss": 4.9798, "mean_token_accuracy": 0.21647816598415376, "num_tokens": 74379832.0, "step": 42875 }, { "entropy": 5.812815952301025, "epoch": 3.3361991830383193, "grad_norm": 1.296875, "learning_rate": 0.0003904995317978048, "loss": 4.9451, "mean_token_accuracy": 0.21059848070144654, "num_tokens": 74388691.0, "step": 42880 }, { "entropy": 5.783127737045288, "epoch": 3.336588212410037, "grad_norm": 1.2265625, "learning_rate": 0.00039047574566612416, "loss": 4.928, "mean_token_accuracy": 0.20944904386997223, "num_tokens": 74397776.0, "step": 42885 }, { "entropy": 5.839664602279663, "epoch": 3.3369772417817547, "grad_norm": 1.3828125, "learning_rate": 0.00039045195778228295, "loss": 5.0184, "mean_token_accuracy": 0.20882997065782546, "num_tokens": 74406616.0, "step": 42890 }, { "entropy": 5.843802070617675, "epoch": 3.337366271153472, "grad_norm": 1.3125, "learning_rate": 0.0003904281681466421, "loss": 4.9999, "mean_token_accuracy": 0.209655998647213, "num_tokens": 74415029.0, "step": 42895 }, { "entropy": 5.884590768814087, "epoch": 3.3377553005251897, "grad_norm": 1.3203125, "learning_rate": 0.0003904043767595624, "loss": 4.9598, "mean_token_accuracy": 0.21364667862653733, "num_tokens": 74423582.0, "step": 42900 }, { "entropy": 5.919558763504028, "epoch": 3.3381443298969073, "grad_norm": 1.453125, "learning_rate": 0.00039038058362140507, "loss": 5.0479, "mean_token_accuracy": 0.20443604290485382, "num_tokens": 74432458.0, "step": 42905 }, { "entropy": 5.840308618545532, "epoch": 3.3385333592686246, "grad_norm": 1.4140625, "learning_rate": 0.00039035678873253096, "loss": 5.0014, "mean_token_accuracy": 0.20856208503246307, "num_tokens": 74441414.0, "step": 42910 }, { "entropy": 5.9096990585327145, "epoch": 3.3389223886403423, "grad_norm": 1.3203125, "learning_rate": 0.0003903329920933012, "loss": 5.0461, "mean_token_accuracy": 0.2043795868754387, "num_tokens": 74450382.0, "step": 42915 }, { "entropy": 5.927686023712158, "epoch": 3.33931141801206, "grad_norm": 1.359375, "learning_rate": 0.0003903091937040769, "loss": 5.059, "mean_token_accuracy": 0.21061530262231826, "num_tokens": 74459404.0, "step": 42920 }, { "entropy": 5.8168638229370115, "epoch": 3.3397004473837777, "grad_norm": 1.2265625, "learning_rate": 0.0003902853935652191, "loss": 4.8902, "mean_token_accuracy": 0.21427226513624192, "num_tokens": 74468389.0, "step": 42925 }, { "entropy": 5.7763043403625485, "epoch": 3.340089476755495, "grad_norm": 1.40625, "learning_rate": 0.0003902615916770889, "loss": 4.9324, "mean_token_accuracy": 0.21388742029666902, "num_tokens": 74476349.0, "step": 42930 }, { "entropy": 5.838443040847778, "epoch": 3.3404785061272126, "grad_norm": 1.1875, "learning_rate": 0.00039023778804004753, "loss": 4.9995, "mean_token_accuracy": 0.20598880499601363, "num_tokens": 74485294.0, "step": 42935 }, { "entropy": 5.86090579032898, "epoch": 3.3408675354989303, "grad_norm": 1.3046875, "learning_rate": 0.00039021398265445616, "loss": 5.0203, "mean_token_accuracy": 0.2073439359664917, "num_tokens": 74493978.0, "step": 42940 }, { "entropy": 5.919500827789307, "epoch": 3.3412565648706476, "grad_norm": 1.2734375, "learning_rate": 0.000390190175520676, "loss": 5.0132, "mean_token_accuracy": 0.213208669424057, "num_tokens": 74503415.0, "step": 42945 }, { "entropy": 5.863336229324341, "epoch": 3.3416455942423653, "grad_norm": 1.3984375, "learning_rate": 0.0003901663666390683, "loss": 4.9932, "mean_token_accuracy": 0.21455423384904862, "num_tokens": 74512096.0, "step": 42950 }, { "entropy": 5.808670568466186, "epoch": 3.342034623614083, "grad_norm": 1.3828125, "learning_rate": 0.0003901425560099943, "loss": 4.9317, "mean_token_accuracy": 0.21028883904218673, "num_tokens": 74520197.0, "step": 42955 }, { "entropy": 5.780158424377442, "epoch": 3.3424236529858002, "grad_norm": 1.390625, "learning_rate": 0.00039011874363381523, "loss": 4.9633, "mean_token_accuracy": 0.20705867409706116, "num_tokens": 74529583.0, "step": 42960 }, { "entropy": 5.851327610015869, "epoch": 3.342812682357518, "grad_norm": 1.3984375, "learning_rate": 0.00039009492951089236, "loss": 4.9114, "mean_token_accuracy": 0.218940132856369, "num_tokens": 74538269.0, "step": 42965 }, { "entropy": 5.832162666320801, "epoch": 3.3432017117292356, "grad_norm": 1.3359375, "learning_rate": 0.0003900711136415873, "loss": 4.9216, "mean_token_accuracy": 0.21349160373210907, "num_tokens": 74547157.0, "step": 42970 }, { "entropy": 5.806814050674438, "epoch": 3.343590741100953, "grad_norm": 1.3359375, "learning_rate": 0.0003900472960262611, "loss": 5.0349, "mean_token_accuracy": 0.20200174450874328, "num_tokens": 74555374.0, "step": 42975 }, { "entropy": 5.88667311668396, "epoch": 3.3439797704726706, "grad_norm": 1.4375, "learning_rate": 0.00039002347666527537, "loss": 5.0326, "mean_token_accuracy": 0.20361700057983398, "num_tokens": 74564401.0, "step": 42980 }, { "entropy": 5.832461166381836, "epoch": 3.3443687998443883, "grad_norm": 1.28125, "learning_rate": 0.00038999965555899145, "loss": 4.8121, "mean_token_accuracy": 0.22651437371969224, "num_tokens": 74573080.0, "step": 42985 }, { "entropy": 5.879475688934326, "epoch": 3.344757829216106, "grad_norm": 1.3203125, "learning_rate": 0.0003899758327077709, "loss": 5.0213, "mean_token_accuracy": 0.20589971095323562, "num_tokens": 74582267.0, "step": 42990 }, { "entropy": 5.910618638992309, "epoch": 3.3451468585878232, "grad_norm": 1.375, "learning_rate": 0.00038995200811197496, "loss": 4.986, "mean_token_accuracy": 0.21082333773374556, "num_tokens": 74590637.0, "step": 42995 }, { "entropy": 5.795453882217407, "epoch": 3.345535887959541, "grad_norm": 1.34375, "learning_rate": 0.00038992818177196526, "loss": 5.0, "mean_token_accuracy": 0.21156125217676164, "num_tokens": 74599132.0, "step": 43000 }, { "entropy": 5.811682319641113, "epoch": 3.3459249173312586, "grad_norm": 1.4140625, "learning_rate": 0.0003899043536881034, "loss": 4.918, "mean_token_accuracy": 0.21848187744617462, "num_tokens": 74607161.0, "step": 43005 }, { "entropy": 5.839553308486939, "epoch": 3.346313946702976, "grad_norm": 1.34375, "learning_rate": 0.00038988052386075084, "loss": 5.0316, "mean_token_accuracy": 0.20822179019451142, "num_tokens": 74616020.0, "step": 43010 }, { "entropy": 5.893888664245606, "epoch": 3.3467029760746936, "grad_norm": 1.265625, "learning_rate": 0.00038985669229026917, "loss": 5.0102, "mean_token_accuracy": 0.2064686894416809, "num_tokens": 74624410.0, "step": 43015 }, { "entropy": 5.910970211029053, "epoch": 3.3470920054464113, "grad_norm": 1.328125, "learning_rate": 0.00038983285897702005, "loss": 4.97, "mean_token_accuracy": 0.20782451033592225, "num_tokens": 74632702.0, "step": 43020 }, { "entropy": 5.827113294601441, "epoch": 3.347481034818129, "grad_norm": 1.2578125, "learning_rate": 0.00038980902392136496, "loss": 4.9015, "mean_token_accuracy": 0.21118486374616624, "num_tokens": 74641310.0, "step": 43025 }, { "entropy": 5.777649450302124, "epoch": 3.3478700641898462, "grad_norm": 1.28125, "learning_rate": 0.0003897851871236657, "loss": 4.9196, "mean_token_accuracy": 0.21113961488008498, "num_tokens": 74649931.0, "step": 43030 }, { "entropy": 5.825043773651123, "epoch": 3.348259093561564, "grad_norm": 1.3828125, "learning_rate": 0.00038976134858428397, "loss": 4.9619, "mean_token_accuracy": 0.20550073087215423, "num_tokens": 74658110.0, "step": 43035 }, { "entropy": 5.868655014038086, "epoch": 3.3486481229332816, "grad_norm": 1.3515625, "learning_rate": 0.00038973750830358144, "loss": 4.9423, "mean_token_accuracy": 0.21235011667013168, "num_tokens": 74667177.0, "step": 43040 }, { "entropy": 5.806269693374634, "epoch": 3.349037152304999, "grad_norm": 1.28125, "learning_rate": 0.00038971366628191986, "loss": 4.9116, "mean_token_accuracy": 0.21716970354318618, "num_tokens": 74676066.0, "step": 43045 }, { "entropy": 5.818996858596802, "epoch": 3.3494261816767166, "grad_norm": 1.375, "learning_rate": 0.000389689822519661, "loss": 4.9314, "mean_token_accuracy": 0.21810292154550553, "num_tokens": 74683879.0, "step": 43050 }, { "entropy": 5.846711206436157, "epoch": 3.3498152110484343, "grad_norm": 1.359375, "learning_rate": 0.00038966597701716653, "loss": 4.9581, "mean_token_accuracy": 0.21114077270030976, "num_tokens": 74692594.0, "step": 43055 }, { "entropy": 5.890863561630249, "epoch": 3.350204240420152, "grad_norm": 1.3203125, "learning_rate": 0.0003896421297747985, "loss": 4.9865, "mean_token_accuracy": 0.2034825414419174, "num_tokens": 74701674.0, "step": 43060 }, { "entropy": 5.814179229736328, "epoch": 3.350593269791869, "grad_norm": 1.375, "learning_rate": 0.0003896182807929185, "loss": 4.9013, "mean_token_accuracy": 0.21337458193302156, "num_tokens": 74709864.0, "step": 43065 }, { "entropy": 5.862629318237305, "epoch": 3.350982299163587, "grad_norm": 1.3125, "learning_rate": 0.0003895944300718885, "loss": 5.0481, "mean_token_accuracy": 0.20782252550125122, "num_tokens": 74718364.0, "step": 43070 }, { "entropy": 5.844099760055542, "epoch": 3.351371328535304, "grad_norm": 1.359375, "learning_rate": 0.00038957057761207053, "loss": 4.9831, "mean_token_accuracy": 0.2061554566025734, "num_tokens": 74726823.0, "step": 43075 }, { "entropy": 5.815512466430664, "epoch": 3.351760357907022, "grad_norm": 1.28125, "learning_rate": 0.00038954672341382635, "loss": 4.9761, "mean_token_accuracy": 0.20451629608869554, "num_tokens": 74735758.0, "step": 43080 }, { "entropy": 5.857950878143311, "epoch": 3.3521493872787396, "grad_norm": 1.34375, "learning_rate": 0.000389522867477518, "loss": 4.9329, "mean_token_accuracy": 0.21689166724681855, "num_tokens": 74744444.0, "step": 43085 }, { "entropy": 5.8396467685699465, "epoch": 3.3525384166504573, "grad_norm": 1.21875, "learning_rate": 0.0003894990098035074, "loss": 5.0143, "mean_token_accuracy": 0.2069427028298378, "num_tokens": 74753420.0, "step": 43090 }, { "entropy": 5.816665363311768, "epoch": 3.3529274460221745, "grad_norm": 1.2734375, "learning_rate": 0.0003894751503921566, "loss": 4.9222, "mean_token_accuracy": 0.21620472967624665, "num_tokens": 74762641.0, "step": 43095 }, { "entropy": 5.797010326385498, "epoch": 3.353316475393892, "grad_norm": 1.359375, "learning_rate": 0.0003894512892438275, "loss": 4.9005, "mean_token_accuracy": 0.21144979447126389, "num_tokens": 74771481.0, "step": 43100 }, { "entropy": 5.871252775192261, "epoch": 3.35370550476561, "grad_norm": 1.3359375, "learning_rate": 0.00038942742635888236, "loss": 4.9338, "mean_token_accuracy": 0.21203863471746445, "num_tokens": 74779589.0, "step": 43105 }, { "entropy": 5.756110000610351, "epoch": 3.354094534137327, "grad_norm": 1.3046875, "learning_rate": 0.00038940356173768303, "loss": 4.8421, "mean_token_accuracy": 0.2209274113178253, "num_tokens": 74788110.0, "step": 43110 }, { "entropy": 5.80942735671997, "epoch": 3.354483563509045, "grad_norm": 1.578125, "learning_rate": 0.0003893796953805919, "loss": 4.9669, "mean_token_accuracy": 0.21442490965127944, "num_tokens": 74797015.0, "step": 43115 }, { "entropy": 5.830813407897949, "epoch": 3.3548725928807626, "grad_norm": 1.3359375, "learning_rate": 0.00038935582728797085, "loss": 4.9791, "mean_token_accuracy": 0.20420684963464736, "num_tokens": 74807027.0, "step": 43120 }, { "entropy": 5.858003950119018, "epoch": 3.3552616222524803, "grad_norm": 1.359375, "learning_rate": 0.00038933195746018213, "loss": 5.0044, "mean_token_accuracy": 0.2104016825556755, "num_tokens": 74815306.0, "step": 43125 }, { "entropy": 5.825858545303345, "epoch": 3.3556506516241975, "grad_norm": 1.3671875, "learning_rate": 0.00038930808589758797, "loss": 4.9989, "mean_token_accuracy": 0.20586484670639038, "num_tokens": 74823443.0, "step": 43130 }, { "entropy": 5.764940595626831, "epoch": 3.356039680995915, "grad_norm": 1.4296875, "learning_rate": 0.0003892842126005506, "loss": 4.9384, "mean_token_accuracy": 0.22201027870178222, "num_tokens": 74831787.0, "step": 43135 }, { "entropy": 5.836208152770996, "epoch": 3.356428710367633, "grad_norm": 1.3046875, "learning_rate": 0.0003892603375694321, "loss": 4.9409, "mean_token_accuracy": 0.215311960875988, "num_tokens": 74840804.0, "step": 43140 }, { "entropy": 5.8840662956237795, "epoch": 3.35681773973935, "grad_norm": 1.3046875, "learning_rate": 0.00038923646080459484, "loss": 4.9941, "mean_token_accuracy": 0.20953678488731384, "num_tokens": 74849558.0, "step": 43145 }, { "entropy": 5.817625427246094, "epoch": 3.357206769111068, "grad_norm": 1.515625, "learning_rate": 0.00038921258230640123, "loss": 4.9066, "mean_token_accuracy": 0.21595184803009032, "num_tokens": 74857923.0, "step": 43150 }, { "entropy": 5.763276386260986, "epoch": 3.3575957984827856, "grad_norm": 1.3125, "learning_rate": 0.00038918870207521334, "loss": 4.9122, "mean_token_accuracy": 0.20636270344257354, "num_tokens": 74866227.0, "step": 43155 }, { "entropy": 5.903433465957642, "epoch": 3.3579848278545033, "grad_norm": 1.3046875, "learning_rate": 0.00038916482011139373, "loss": 5.0184, "mean_token_accuracy": 0.2082407534122467, "num_tokens": 74874420.0, "step": 43160 }, { "entropy": 5.8736159324646, "epoch": 3.3583738572262205, "grad_norm": 1.2734375, "learning_rate": 0.0003891409364153047, "loss": 5.0176, "mean_token_accuracy": 0.20799576938152314, "num_tokens": 74883888.0, "step": 43165 }, { "entropy": 5.841304349899292, "epoch": 3.358762886597938, "grad_norm": 1.3984375, "learning_rate": 0.0003891170509873086, "loss": 4.961, "mean_token_accuracy": 0.21401079446077348, "num_tokens": 74893873.0, "step": 43170 }, { "entropy": 5.880174446105957, "epoch": 3.359151915969656, "grad_norm": 1.2578125, "learning_rate": 0.00038909316382776784, "loss": 5.0335, "mean_token_accuracy": 0.2036713793873787, "num_tokens": 74903460.0, "step": 43175 }, { "entropy": 5.893458414077759, "epoch": 3.359540945341373, "grad_norm": 1.4296875, "learning_rate": 0.0003890692749370449, "loss": 5.073, "mean_token_accuracy": 0.20022270381450652, "num_tokens": 74912960.0, "step": 43180 }, { "entropy": 5.855274248123169, "epoch": 3.359929974713091, "grad_norm": 1.3359375, "learning_rate": 0.00038904538431550235, "loss": 4.9705, "mean_token_accuracy": 0.21769245862960815, "num_tokens": 74921983.0, "step": 43185 }, { "entropy": 5.912438249588012, "epoch": 3.3603190040848085, "grad_norm": 1.25, "learning_rate": 0.0003890214919635026, "loss": 5.0675, "mean_token_accuracy": 0.20508663207292557, "num_tokens": 74931883.0, "step": 43190 }, { "entropy": 5.804451990127563, "epoch": 3.360708033456526, "grad_norm": 1.3046875, "learning_rate": 0.0003889975978814082, "loss": 4.9189, "mean_token_accuracy": 0.21209487617015838, "num_tokens": 74940852.0, "step": 43195 }, { "entropy": 5.819003009796143, "epoch": 3.3610970628282435, "grad_norm": 1.328125, "learning_rate": 0.0003889737020695817, "loss": 4.9151, "mean_token_accuracy": 0.20883516669273378, "num_tokens": 74949562.0, "step": 43200 }, { "entropy": 5.871111488342285, "epoch": 3.361486092199961, "grad_norm": 1.3203125, "learning_rate": 0.00038894980452838573, "loss": 5.0377, "mean_token_accuracy": 0.21060646176338196, "num_tokens": 74958199.0, "step": 43205 }, { "entropy": 5.874205541610718, "epoch": 3.3618751215716784, "grad_norm": 1.3515625, "learning_rate": 0.0003889259052581828, "loss": 4.9609, "mean_token_accuracy": 0.19816185235977174, "num_tokens": 74966362.0, "step": 43210 }, { "entropy": 5.796246480941773, "epoch": 3.362264150943396, "grad_norm": 1.2734375, "learning_rate": 0.00038890200425933545, "loss": 4.9491, "mean_token_accuracy": 0.21735860854387284, "num_tokens": 74974767.0, "step": 43215 }, { "entropy": 5.871094751358032, "epoch": 3.362653180315114, "grad_norm": 1.3203125, "learning_rate": 0.0003888781015322067, "loss": 5.0361, "mean_token_accuracy": 0.20685530602931976, "num_tokens": 74983604.0, "step": 43220 }, { "entropy": 5.9332959175109865, "epoch": 3.3630422096868315, "grad_norm": 1.375, "learning_rate": 0.00038885419707715885, "loss": 4.9761, "mean_token_accuracy": 0.20884458273649215, "num_tokens": 74991866.0, "step": 43225 }, { "entropy": 5.86727819442749, "epoch": 3.363431239058549, "grad_norm": 1.3359375, "learning_rate": 0.00038883029089455487, "loss": 4.9716, "mean_token_accuracy": 0.215176260471344, "num_tokens": 75001004.0, "step": 43230 }, { "entropy": 5.764481401443481, "epoch": 3.3638202684302665, "grad_norm": 1.2734375, "learning_rate": 0.0003888063829847574, "loss": 4.8599, "mean_token_accuracy": 0.2211586967110634, "num_tokens": 75009766.0, "step": 43235 }, { "entropy": 5.926794242858887, "epoch": 3.364209297801984, "grad_norm": 1.5390625, "learning_rate": 0.0003887824733481292, "loss": 5.0279, "mean_token_accuracy": 0.20281373858451843, "num_tokens": 75018167.0, "step": 43240 }, { "entropy": 5.89974570274353, "epoch": 3.3645983271737014, "grad_norm": 1.2890625, "learning_rate": 0.00038875856198503306, "loss": 4.9606, "mean_token_accuracy": 0.21420126855373384, "num_tokens": 75027084.0, "step": 43245 }, { "entropy": 5.799437952041626, "epoch": 3.364987356545419, "grad_norm": 1.328125, "learning_rate": 0.00038873464889583177, "loss": 4.9342, "mean_token_accuracy": 0.21189447790384291, "num_tokens": 75035069.0, "step": 43250 }, { "entropy": 5.766240167617798, "epoch": 3.365376385917137, "grad_norm": 1.2890625, "learning_rate": 0.00038871073408088826, "loss": 4.9029, "mean_token_accuracy": 0.21025425493717192, "num_tokens": 75043961.0, "step": 43255 }, { "entropy": 5.805471992492675, "epoch": 3.3657654152888545, "grad_norm": 1.328125, "learning_rate": 0.0003886868175405653, "loss": 4.9308, "mean_token_accuracy": 0.210835362970829, "num_tokens": 75052942.0, "step": 43260 }, { "entropy": 5.874312448501587, "epoch": 3.366154444660572, "grad_norm": 1.3515625, "learning_rate": 0.0003886628992752259, "loss": 4.9833, "mean_token_accuracy": 0.20985704213380812, "num_tokens": 75061058.0, "step": 43265 }, { "entropy": 5.875028610229492, "epoch": 3.3665434740322895, "grad_norm": 1.3203125, "learning_rate": 0.0003886389792852329, "loss": 4.9562, "mean_token_accuracy": 0.20855135023593901, "num_tokens": 75069757.0, "step": 43270 }, { "entropy": 5.817039442062378, "epoch": 3.366932503404007, "grad_norm": 1.2421875, "learning_rate": 0.00038861505757094923, "loss": 4.9055, "mean_token_accuracy": 0.2089798480272293, "num_tokens": 75078488.0, "step": 43275 }, { "entropy": 5.920904159545898, "epoch": 3.3673215327757244, "grad_norm": 1.34375, "learning_rate": 0.0003885911341327379, "loss": 5.0914, "mean_token_accuracy": 0.19929058253765106, "num_tokens": 75087220.0, "step": 43280 }, { "entropy": 5.959580278396606, "epoch": 3.367710562147442, "grad_norm": 1.3671875, "learning_rate": 0.000388567208970962, "loss": 5.0755, "mean_token_accuracy": 0.20068210661411284, "num_tokens": 75095412.0, "step": 43285 }, { "entropy": 5.903345203399658, "epoch": 3.36809959151916, "grad_norm": 1.2734375, "learning_rate": 0.0003885432820859844, "loss": 5.0743, "mean_token_accuracy": 0.20170137286186218, "num_tokens": 75104783.0, "step": 43290 }, { "entropy": 5.858115386962891, "epoch": 3.368488620890877, "grad_norm": 1.2578125, "learning_rate": 0.00038851935347816827, "loss": 4.9679, "mean_token_accuracy": 0.2076390027999878, "num_tokens": 75113801.0, "step": 43295 }, { "entropy": 5.935214185714722, "epoch": 3.368877650262595, "grad_norm": 1.3515625, "learning_rate": 0.0003884954231478764, "loss": 5.0379, "mean_token_accuracy": 0.20119248777627946, "num_tokens": 75123116.0, "step": 43300 }, { "entropy": 5.8980601787567135, "epoch": 3.3692666796343125, "grad_norm": 1.21875, "learning_rate": 0.0003884714910954724, "loss": 4.9691, "mean_token_accuracy": 0.20547809451818466, "num_tokens": 75131662.0, "step": 43305 }, { "entropy": 5.763066244125366, "epoch": 3.3696557090060297, "grad_norm": 1.2734375, "learning_rate": 0.000388447557321319, "loss": 4.9305, "mean_token_accuracy": 0.2145422324538231, "num_tokens": 75140897.0, "step": 43310 }, { "entropy": 5.79844069480896, "epoch": 3.3700447383777474, "grad_norm": 1.3203125, "learning_rate": 0.0003884236218257795, "loss": 4.975, "mean_token_accuracy": 0.20715581327676774, "num_tokens": 75150189.0, "step": 43315 }, { "entropy": 5.803768062591553, "epoch": 3.370433767749465, "grad_norm": 1.2578125, "learning_rate": 0.0003883996846092171, "loss": 4.8551, "mean_token_accuracy": 0.2269786313176155, "num_tokens": 75158677.0, "step": 43320 }, { "entropy": 5.8337572574615475, "epoch": 3.370822797121183, "grad_norm": 1.25, "learning_rate": 0.000388375745671995, "loss": 4.9536, "mean_token_accuracy": 0.21378158777952194, "num_tokens": 75167669.0, "step": 43325 }, { "entropy": 5.8386555194854735, "epoch": 3.3712118264929, "grad_norm": 1.3203125, "learning_rate": 0.00038835180501447646, "loss": 4.9744, "mean_token_accuracy": 0.20647733956575393, "num_tokens": 75176379.0, "step": 43330 }, { "entropy": 5.848819971084595, "epoch": 3.3716008558646178, "grad_norm": 1.359375, "learning_rate": 0.0003883278626370245, "loss": 5.0038, "mean_token_accuracy": 0.21000365614891053, "num_tokens": 75185634.0, "step": 43335 }, { "entropy": 5.855559587478638, "epoch": 3.3719898852363355, "grad_norm": 1.2890625, "learning_rate": 0.00038830391854000285, "loss": 4.9353, "mean_token_accuracy": 0.2142452836036682, "num_tokens": 75194101.0, "step": 43340 }, { "entropy": 5.896668577194214, "epoch": 3.3723789146080527, "grad_norm": 1.375, "learning_rate": 0.00038827997272377447, "loss": 4.9958, "mean_token_accuracy": 0.20538676977157594, "num_tokens": 75202738.0, "step": 43345 }, { "entropy": 5.835319900512696, "epoch": 3.3727679439797704, "grad_norm": 1.2734375, "learning_rate": 0.00038825602518870276, "loss": 4.844, "mean_token_accuracy": 0.21763889938592912, "num_tokens": 75211771.0, "step": 43350 }, { "entropy": 5.882034206390381, "epoch": 3.373156973351488, "grad_norm": 1.375, "learning_rate": 0.0003882320759351512, "loss": 5.0023, "mean_token_accuracy": 0.20337293595075606, "num_tokens": 75221270.0, "step": 43355 }, { "entropy": 5.901565217971802, "epoch": 3.373546002723206, "grad_norm": 1.359375, "learning_rate": 0.00038820812496348305, "loss": 4.9566, "mean_token_accuracy": 0.211650288105011, "num_tokens": 75229864.0, "step": 43360 }, { "entropy": 5.85054202079773, "epoch": 3.373935032094923, "grad_norm": 1.2890625, "learning_rate": 0.00038818417227406185, "loss": 5.0378, "mean_token_accuracy": 0.20025272518396378, "num_tokens": 75239446.0, "step": 43365 }, { "entropy": 5.816908597946167, "epoch": 3.3743240614666408, "grad_norm": 1.3046875, "learning_rate": 0.00038816021786725096, "loss": 4.9861, "mean_token_accuracy": 0.20730853378772734, "num_tokens": 75247997.0, "step": 43370 }, { "entropy": 5.810194301605224, "epoch": 3.3747130908383585, "grad_norm": 1.2734375, "learning_rate": 0.00038813626174341386, "loss": 4.9124, "mean_token_accuracy": 0.21124526411294936, "num_tokens": 75256492.0, "step": 43375 }, { "entropy": 5.895193004608155, "epoch": 3.3751021202100757, "grad_norm": 1.3515625, "learning_rate": 0.0003881123039029141, "loss": 5.0018, "mean_token_accuracy": 0.20909362584352492, "num_tokens": 75265057.0, "step": 43380 }, { "entropy": 5.810988187789917, "epoch": 3.3754911495817934, "grad_norm": 1.34375, "learning_rate": 0.0003880883443461152, "loss": 4.9708, "mean_token_accuracy": 0.21300434470176696, "num_tokens": 75274685.0, "step": 43385 }, { "entropy": 5.8117406368255615, "epoch": 3.375880178953511, "grad_norm": 1.3515625, "learning_rate": 0.0003880643830733806, "loss": 4.9595, "mean_token_accuracy": 0.210467866063118, "num_tokens": 75283053.0, "step": 43390 }, { "entropy": 5.828567171096802, "epoch": 3.3762692083252284, "grad_norm": 1.265625, "learning_rate": 0.00038804042008507396, "loss": 5.0016, "mean_token_accuracy": 0.21121222525835037, "num_tokens": 75291823.0, "step": 43395 }, { "entropy": 5.876355361938477, "epoch": 3.376658237696946, "grad_norm": 1.3125, "learning_rate": 0.00038801645538155883, "loss": 5.0575, "mean_token_accuracy": 0.1978149428963661, "num_tokens": 75299858.0, "step": 43400 }, { "entropy": 5.927226829528808, "epoch": 3.3770472670686638, "grad_norm": 1.3359375, "learning_rate": 0.00038799248896319896, "loss": 5.063, "mean_token_accuracy": 0.20472633987665176, "num_tokens": 75308157.0, "step": 43405 }, { "entropy": 5.909140729904175, "epoch": 3.377436296440381, "grad_norm": 1.3671875, "learning_rate": 0.00038796852083035794, "loss": 5.0365, "mean_token_accuracy": 0.20736172795295715, "num_tokens": 75316589.0, "step": 43410 }, { "entropy": 5.8654601097106935, "epoch": 3.3778253258120987, "grad_norm": 1.3515625, "learning_rate": 0.0003879445509833993, "loss": 4.9277, "mean_token_accuracy": 0.20812382847070693, "num_tokens": 75326219.0, "step": 43415 }, { "entropy": 5.900867748260498, "epoch": 3.3782143551838164, "grad_norm": 1.296875, "learning_rate": 0.000387920579422687, "loss": 5.0468, "mean_token_accuracy": 0.20216209143400193, "num_tokens": 75334348.0, "step": 43420 }, { "entropy": 5.921757555007934, "epoch": 3.378603384555534, "grad_norm": 1.2578125, "learning_rate": 0.0003878966061485845, "loss": 5.0935, "mean_token_accuracy": 0.19990944117307663, "num_tokens": 75343242.0, "step": 43425 }, { "entropy": 5.921330881118775, "epoch": 3.3789924139272514, "grad_norm": 1.296875, "learning_rate": 0.00038787263116145577, "loss": 5.062, "mean_token_accuracy": 0.20078145563602448, "num_tokens": 75351760.0, "step": 43430 }, { "entropy": 5.83110933303833, "epoch": 3.379381443298969, "grad_norm": 1.296875, "learning_rate": 0.00038784865446166454, "loss": 4.9352, "mean_token_accuracy": 0.2138667047023773, "num_tokens": 75360605.0, "step": 43435 }, { "entropy": 5.8273553371429445, "epoch": 3.3797704726706868, "grad_norm": 1.3515625, "learning_rate": 0.00038782467604957455, "loss": 4.8848, "mean_token_accuracy": 0.21912334561347963, "num_tokens": 75368801.0, "step": 43440 }, { "entropy": 5.7931946277618405, "epoch": 3.380159502042404, "grad_norm": 1.46875, "learning_rate": 0.00038780069592554977, "loss": 4.9603, "mean_token_accuracy": 0.20600615292787552, "num_tokens": 75377466.0, "step": 43445 }, { "entropy": 5.869297027587891, "epoch": 3.3805485314141217, "grad_norm": 1.25, "learning_rate": 0.0003877767140899539, "loss": 5.0287, "mean_token_accuracy": 0.20937345921993256, "num_tokens": 75386831.0, "step": 43450 }, { "entropy": 5.948837471008301, "epoch": 3.3809375607858394, "grad_norm": 1.375, "learning_rate": 0.00038775273054315087, "loss": 4.9764, "mean_token_accuracy": 0.20542542338371278, "num_tokens": 75394949.0, "step": 43455 }, { "entropy": 5.837774038314819, "epoch": 3.381326590157557, "grad_norm": 1.2109375, "learning_rate": 0.0003877287452855046, "loss": 4.8724, "mean_token_accuracy": 0.22140044271945952, "num_tokens": 75403678.0, "step": 43460 }, { "entropy": 5.809627914428711, "epoch": 3.3817156195292744, "grad_norm": 1.4140625, "learning_rate": 0.00038770475831737905, "loss": 4.9158, "mean_token_accuracy": 0.2186850443482399, "num_tokens": 75412195.0, "step": 43465 }, { "entropy": 5.804500532150269, "epoch": 3.382104648900992, "grad_norm": 1.28125, "learning_rate": 0.00038768076963913823, "loss": 4.8925, "mean_token_accuracy": 0.21176016926765442, "num_tokens": 75421383.0, "step": 43470 }, { "entropy": 5.80602536201477, "epoch": 3.3824936782727097, "grad_norm": 1.40625, "learning_rate": 0.00038765677925114614, "loss": 4.8965, "mean_token_accuracy": 0.21284267157316208, "num_tokens": 75430248.0, "step": 43475 }, { "entropy": 5.76225733757019, "epoch": 3.382882707644427, "grad_norm": 1.359375, "learning_rate": 0.0003876327871537667, "loss": 4.9116, "mean_token_accuracy": 0.21789791733026503, "num_tokens": 75438849.0, "step": 43480 }, { "entropy": 5.868874168395996, "epoch": 3.3832717370161447, "grad_norm": 1.296875, "learning_rate": 0.00038760879334736394, "loss": 5.0149, "mean_token_accuracy": 0.21043260246515275, "num_tokens": 75447562.0, "step": 43485 }, { "entropy": 5.911243915557861, "epoch": 3.3836607663878624, "grad_norm": 1.453125, "learning_rate": 0.00038758479783230197, "loss": 5.0046, "mean_token_accuracy": 0.20378794521093369, "num_tokens": 75456364.0, "step": 43490 }, { "entropy": 5.8536820888519285, "epoch": 3.38404979575958, "grad_norm": 1.296875, "learning_rate": 0.0003875608006089449, "loss": 4.9462, "mean_token_accuracy": 0.2092744752764702, "num_tokens": 75465612.0, "step": 43495 }, { "entropy": 5.845042514801025, "epoch": 3.3844388251312973, "grad_norm": 1.4765625, "learning_rate": 0.0003875368016776569, "loss": 4.9453, "mean_token_accuracy": 0.21377458423376083, "num_tokens": 75474604.0, "step": 43500 }, { "entropy": 5.839162445068359, "epoch": 3.384827854503015, "grad_norm": 1.3046875, "learning_rate": 0.000387512801038802, "loss": 4.9051, "mean_token_accuracy": 0.21862321794033052, "num_tokens": 75483193.0, "step": 43505 }, { "entropy": 5.810390472412109, "epoch": 3.3852168838747323, "grad_norm": 1.4296875, "learning_rate": 0.0003874887986927444, "loss": 4.9152, "mean_token_accuracy": 0.21272409707307816, "num_tokens": 75491813.0, "step": 43510 }, { "entropy": 5.923397445678711, "epoch": 3.38560591324645, "grad_norm": 1.4296875, "learning_rate": 0.0003874647946398484, "loss": 5.0523, "mean_token_accuracy": 0.20736235082149507, "num_tokens": 75500520.0, "step": 43515 }, { "entropy": 5.863705635070801, "epoch": 3.3859949426181677, "grad_norm": 1.2890625, "learning_rate": 0.0003874407888804781, "loss": 4.9436, "mean_token_accuracy": 0.2147574320435524, "num_tokens": 75509249.0, "step": 43520 }, { "entropy": 5.8056402683258055, "epoch": 3.3863839719898854, "grad_norm": 1.328125, "learning_rate": 0.00038741678141499783, "loss": 4.9036, "mean_token_accuracy": 0.2207706719636917, "num_tokens": 75517654.0, "step": 43525 }, { "entropy": 5.9058952808380125, "epoch": 3.3867730013616026, "grad_norm": 1.3984375, "learning_rate": 0.0003873927722437718, "loss": 5.0419, "mean_token_accuracy": 0.20983896702528, "num_tokens": 75526995.0, "step": 43530 }, { "entropy": 5.991169404983521, "epoch": 3.3871620307333203, "grad_norm": 1.390625, "learning_rate": 0.0003873687613671643, "loss": 5.0747, "mean_token_accuracy": 0.20524675995111466, "num_tokens": 75536399.0, "step": 43535 }, { "entropy": 5.760081148147583, "epoch": 3.387551060105038, "grad_norm": 1.453125, "learning_rate": 0.0003873447487855398, "loss": 4.8234, "mean_token_accuracy": 0.22108521908521653, "num_tokens": 75544436.0, "step": 43540 }, { "entropy": 5.863285827636719, "epoch": 3.3879400894767553, "grad_norm": 1.328125, "learning_rate": 0.00038732073449926244, "loss": 5.0564, "mean_token_accuracy": 0.21082198321819307, "num_tokens": 75552757.0, "step": 43545 }, { "entropy": 5.914246225357056, "epoch": 3.388329118848473, "grad_norm": 1.390625, "learning_rate": 0.0003872967185086968, "loss": 5.062, "mean_token_accuracy": 0.207522015273571, "num_tokens": 75560850.0, "step": 43550 }, { "entropy": 5.915704298019409, "epoch": 3.3887181482201907, "grad_norm": 1.390625, "learning_rate": 0.0003872727008142072, "loss": 4.955, "mean_token_accuracy": 0.2098520129919052, "num_tokens": 75569054.0, "step": 43555 }, { "entropy": 5.866705513000488, "epoch": 3.3891071775919084, "grad_norm": 1.296875, "learning_rate": 0.00038724868141615807, "loss": 5.0568, "mean_token_accuracy": 0.20347207635641099, "num_tokens": 75578008.0, "step": 43560 }, { "entropy": 5.869704389572144, "epoch": 3.3894962069636256, "grad_norm": 1.265625, "learning_rate": 0.0003872246603149138, "loss": 4.9266, "mean_token_accuracy": 0.21469050496816636, "num_tokens": 75586332.0, "step": 43565 }, { "entropy": 5.829465579986572, "epoch": 3.3898852363353433, "grad_norm": 1.328125, "learning_rate": 0.0003872006375108389, "loss": 5.0014, "mean_token_accuracy": 0.20756751000881196, "num_tokens": 75594217.0, "step": 43570 }, { "entropy": 5.783953905105591, "epoch": 3.390274265707061, "grad_norm": 1.40625, "learning_rate": 0.000387176613004298, "loss": 4.8175, "mean_token_accuracy": 0.2321384385228157, "num_tokens": 75602287.0, "step": 43575 }, { "entropy": 5.775793027877808, "epoch": 3.3906632950787783, "grad_norm": 1.2734375, "learning_rate": 0.0003871525867956555, "loss": 4.8751, "mean_token_accuracy": 0.21968195140361785, "num_tokens": 75610765.0, "step": 43580 }, { "entropy": 5.864161729812622, "epoch": 3.391052324450496, "grad_norm": 1.3046875, "learning_rate": 0.00038712855888527604, "loss": 5.0517, "mean_token_accuracy": 0.2058502823114395, "num_tokens": 75620103.0, "step": 43585 }, { "entropy": 5.892338562011719, "epoch": 3.3914413538222137, "grad_norm": 1.3203125, "learning_rate": 0.00038710452927352414, "loss": 4.9866, "mean_token_accuracy": 0.2094047486782074, "num_tokens": 75629191.0, "step": 43590 }, { "entropy": 5.920384263992309, "epoch": 3.3918303831939314, "grad_norm": 1.4453125, "learning_rate": 0.0003870804979607645, "loss": 4.9333, "mean_token_accuracy": 0.2104494258761406, "num_tokens": 75637575.0, "step": 43595 }, { "entropy": 5.866631937026978, "epoch": 3.3922194125656486, "grad_norm": 1.2734375, "learning_rate": 0.00038705646494736163, "loss": 5.0833, "mean_token_accuracy": 0.20507924854755402, "num_tokens": 75645925.0, "step": 43600 }, { "entropy": 5.782024717330932, "epoch": 3.3926084419373663, "grad_norm": 1.3203125, "learning_rate": 0.0003870324302336802, "loss": 4.8682, "mean_token_accuracy": 0.21200764626264573, "num_tokens": 75654269.0, "step": 43605 }, { "entropy": 5.891292524337769, "epoch": 3.392997471309084, "grad_norm": 1.390625, "learning_rate": 0.0003870083938200851, "loss": 5.0051, "mean_token_accuracy": 0.2076784312725067, "num_tokens": 75663019.0, "step": 43610 }, { "entropy": 5.897125005722046, "epoch": 3.3933865006808013, "grad_norm": 1.4140625, "learning_rate": 0.00038698435570694084, "loss": 5.0083, "mean_token_accuracy": 0.20762305557727814, "num_tokens": 75671246.0, "step": 43615 }, { "entropy": 5.835525703430176, "epoch": 3.393775530052519, "grad_norm": 1.2421875, "learning_rate": 0.0003869603158946122, "loss": 4.8711, "mean_token_accuracy": 0.2226286932826042, "num_tokens": 75679793.0, "step": 43620 }, { "entropy": 5.863463973999023, "epoch": 3.3941645594242367, "grad_norm": 1.359375, "learning_rate": 0.000386936274383464, "loss": 4.9725, "mean_token_accuracy": 0.205870421230793, "num_tokens": 75688356.0, "step": 43625 }, { "entropy": 5.8460582256317135, "epoch": 3.394553588795954, "grad_norm": 1.4140625, "learning_rate": 0.000386912231173861, "loss": 4.9131, "mean_token_accuracy": 0.21406291723251342, "num_tokens": 75697252.0, "step": 43630 }, { "entropy": 5.8522539138793945, "epoch": 3.3949426181676716, "grad_norm": 1.3125, "learning_rate": 0.000386888186266168, "loss": 4.9782, "mean_token_accuracy": 0.21982807219028472, "num_tokens": 75705947.0, "step": 43635 }, { "entropy": 5.879702949523926, "epoch": 3.3953316475393893, "grad_norm": 1.3828125, "learning_rate": 0.0003868641396607499, "loss": 5.0217, "mean_token_accuracy": 0.20264589190483093, "num_tokens": 75714381.0, "step": 43640 }, { "entropy": 5.809407901763916, "epoch": 3.3957206769111066, "grad_norm": 1.3125, "learning_rate": 0.0003868400913579715, "loss": 4.9523, "mean_token_accuracy": 0.20542743802070618, "num_tokens": 75723170.0, "step": 43645 }, { "entropy": 5.809116172790527, "epoch": 3.3961097062828243, "grad_norm": 1.4921875, "learning_rate": 0.00038681604135819774, "loss": 4.9627, "mean_token_accuracy": 0.20993778258562087, "num_tokens": 75732304.0, "step": 43650 }, { "entropy": 5.904730796813965, "epoch": 3.396498735654542, "grad_norm": 1.3828125, "learning_rate": 0.00038679198966179353, "loss": 5.0289, "mean_token_accuracy": 0.20943732410669327, "num_tokens": 75740967.0, "step": 43655 }, { "entropy": 5.820071744918823, "epoch": 3.3968877650262597, "grad_norm": 1.2734375, "learning_rate": 0.00038676793626912375, "loss": 4.9532, "mean_token_accuracy": 0.21390833109617233, "num_tokens": 75749352.0, "step": 43660 }, { "entropy": 5.855237674713135, "epoch": 3.397276794397977, "grad_norm": 1.3125, "learning_rate": 0.00038674388118055354, "loss": 4.9574, "mean_token_accuracy": 0.21729274988174438, "num_tokens": 75758435.0, "step": 43665 }, { "entropy": 5.836182498931885, "epoch": 3.3976658237696946, "grad_norm": 1.25, "learning_rate": 0.0003867198243964477, "loss": 4.9589, "mean_token_accuracy": 0.2146657720208168, "num_tokens": 75767559.0, "step": 43670 }, { "entropy": 5.876359748840332, "epoch": 3.3980548531414123, "grad_norm": 1.375, "learning_rate": 0.0003866957659171714, "loss": 4.9858, "mean_token_accuracy": 0.20794467478990555, "num_tokens": 75776344.0, "step": 43675 }, { "entropy": 5.944918823242188, "epoch": 3.3984438825131296, "grad_norm": 1.296875, "learning_rate": 0.0003866717057430896, "loss": 5.0568, "mean_token_accuracy": 0.2109245017170906, "num_tokens": 75785488.0, "step": 43680 }, { "entropy": 5.861222410202027, "epoch": 3.3988329118848473, "grad_norm": 1.34375, "learning_rate": 0.0003866476438745675, "loss": 4.9458, "mean_token_accuracy": 0.2139919251203537, "num_tokens": 75793501.0, "step": 43685 }, { "entropy": 5.856098937988281, "epoch": 3.399221941256565, "grad_norm": 1.4140625, "learning_rate": 0.00038662358031197, "loss": 4.9324, "mean_token_accuracy": 0.21445069313049317, "num_tokens": 75801365.0, "step": 43690 }, { "entropy": 5.804084348678589, "epoch": 3.3996109706282827, "grad_norm": 1.4921875, "learning_rate": 0.0003865995150556624, "loss": 4.8584, "mean_token_accuracy": 0.2285398542881012, "num_tokens": 75810061.0, "step": 43695 }, { "entropy": 5.9310651302337645, "epoch": 3.4, "grad_norm": 1.453125, "learning_rate": 0.00038657544810600966, "loss": 4.9682, "mean_token_accuracy": 0.21041859537363053, "num_tokens": 75817574.0, "step": 43700 }, { "entropy": 5.899451208114624, "epoch": 3.4003890293717176, "grad_norm": 1.3359375, "learning_rate": 0.0003865513794633773, "loss": 5.0983, "mean_token_accuracy": 0.20494943410158156, "num_tokens": 75826198.0, "step": 43705 }, { "entropy": 5.8465088367462155, "epoch": 3.4007780587434353, "grad_norm": 1.3046875, "learning_rate": 0.0003865273091281301, "loss": 4.9446, "mean_token_accuracy": 0.21291194707155228, "num_tokens": 75835043.0, "step": 43710 }, { "entropy": 5.902456331253052, "epoch": 3.4011670881151526, "grad_norm": 1.3515625, "learning_rate": 0.0003865032371006336, "loss": 5.0552, "mean_token_accuracy": 0.2049863561987877, "num_tokens": 75843191.0, "step": 43715 }, { "entropy": 5.861647129058838, "epoch": 3.4015561174868703, "grad_norm": 1.34375, "learning_rate": 0.000386479163381253, "loss": 4.9346, "mean_token_accuracy": 0.2209335222840309, "num_tokens": 75852024.0, "step": 43720 }, { "entropy": 5.7848883152008055, "epoch": 3.401945146858588, "grad_norm": 1.390625, "learning_rate": 0.00038645508797035345, "loss": 4.8375, "mean_token_accuracy": 0.22590504288673402, "num_tokens": 75860605.0, "step": 43725 }, { "entropy": 5.814254236221314, "epoch": 3.402334176230305, "grad_norm": 1.296875, "learning_rate": 0.00038643101086830036, "loss": 4.9871, "mean_token_accuracy": 0.21688619405031204, "num_tokens": 75868861.0, "step": 43730 }, { "entropy": 5.800155735015869, "epoch": 3.402723205602023, "grad_norm": 1.3203125, "learning_rate": 0.000386406932075459, "loss": 4.946, "mean_token_accuracy": 0.21470569372177123, "num_tokens": 75876840.0, "step": 43735 }, { "entropy": 5.779456233978271, "epoch": 3.4031122349737406, "grad_norm": 1.28125, "learning_rate": 0.0003863828515921948, "loss": 4.97, "mean_token_accuracy": 0.21442488580942154, "num_tokens": 75885348.0, "step": 43740 }, { "entropy": 5.816876316070557, "epoch": 3.403501264345458, "grad_norm": 1.2578125, "learning_rate": 0.0003863587694188732, "loss": 5.0002, "mean_token_accuracy": 0.21057252436876298, "num_tokens": 75894062.0, "step": 43745 }, { "entropy": 5.899986314773559, "epoch": 3.4038902937171756, "grad_norm": 1.390625, "learning_rate": 0.00038633468555585943, "loss": 5.0266, "mean_token_accuracy": 0.21033218652009963, "num_tokens": 75902103.0, "step": 43750 }, { "entropy": 5.907148170471191, "epoch": 3.4042793230888932, "grad_norm": 1.4296875, "learning_rate": 0.0003863106000035191, "loss": 4.9876, "mean_token_accuracy": 0.20815979987382888, "num_tokens": 75910702.0, "step": 43755 }, { "entropy": 5.867507839202881, "epoch": 3.404668352460611, "grad_norm": 1.3359375, "learning_rate": 0.0003862865127622175, "loss": 4.9561, "mean_token_accuracy": 0.22112989127635957, "num_tokens": 75919085.0, "step": 43760 }, { "entropy": 5.88025918006897, "epoch": 3.405057381832328, "grad_norm": 1.4296875, "learning_rate": 0.0003862624238323201, "loss": 4.9646, "mean_token_accuracy": 0.21158987581729888, "num_tokens": 75927421.0, "step": 43765 }, { "entropy": 5.7898355484008786, "epoch": 3.405446411204046, "grad_norm": 1.3359375, "learning_rate": 0.0003862383332141927, "loss": 4.9978, "mean_token_accuracy": 0.21203978806734086, "num_tokens": 75935719.0, "step": 43770 }, { "entropy": 5.9160990715026855, "epoch": 3.4058354405757636, "grad_norm": 1.3828125, "learning_rate": 0.0003862142409082006, "loss": 4.9555, "mean_token_accuracy": 0.20951660722494125, "num_tokens": 75944159.0, "step": 43775 }, { "entropy": 5.8175774097442625, "epoch": 3.406224469947481, "grad_norm": 1.28125, "learning_rate": 0.0003861901469147093, "loss": 4.8185, "mean_token_accuracy": 0.22251327335834503, "num_tokens": 75951551.0, "step": 43780 }, { "entropy": 5.763814496994018, "epoch": 3.4066134993191985, "grad_norm": 1.28125, "learning_rate": 0.00038616605123408464, "loss": 4.9362, "mean_token_accuracy": 0.208657206594944, "num_tokens": 75960422.0, "step": 43785 }, { "entropy": 5.808055257797241, "epoch": 3.4070025286909162, "grad_norm": 1.3359375, "learning_rate": 0.00038614195386669207, "loss": 4.9795, "mean_token_accuracy": 0.20771874934434892, "num_tokens": 75969318.0, "step": 43790 }, { "entropy": 5.824270296096802, "epoch": 3.407391558062634, "grad_norm": 1.2578125, "learning_rate": 0.0003861178548128972, "loss": 4.9797, "mean_token_accuracy": 0.2069397136569023, "num_tokens": 75978367.0, "step": 43795 }, { "entropy": 5.971016263961792, "epoch": 3.407780587434351, "grad_norm": 1.40625, "learning_rate": 0.00038609375407306566, "loss": 5.0583, "mean_token_accuracy": 0.2057945042848587, "num_tokens": 75987211.0, "step": 43800 }, { "entropy": 5.894583606719971, "epoch": 3.408169616806069, "grad_norm": 1.2421875, "learning_rate": 0.00038606965164756334, "loss": 5.0389, "mean_token_accuracy": 0.20768342167139053, "num_tokens": 75996892.0, "step": 43805 }, { "entropy": 5.832450723648071, "epoch": 3.4085586461777866, "grad_norm": 1.375, "learning_rate": 0.00038604554753675585, "loss": 4.9801, "mean_token_accuracy": 0.21070825904607773, "num_tokens": 76005160.0, "step": 43810 }, { "entropy": 5.869582462310791, "epoch": 3.408947675549504, "grad_norm": 1.3671875, "learning_rate": 0.0003860214417410089, "loss": 4.9942, "mean_token_accuracy": 0.21537842303514482, "num_tokens": 76013623.0, "step": 43815 }, { "entropy": 5.902950668334961, "epoch": 3.4093367049212215, "grad_norm": 1.25, "learning_rate": 0.00038599733426068826, "loss": 5.0183, "mean_token_accuracy": 0.20660870671272277, "num_tokens": 76022735.0, "step": 43820 }, { "entropy": 5.846972274780273, "epoch": 3.4097257342929392, "grad_norm": 1.4609375, "learning_rate": 0.00038597322509615977, "loss": 4.8706, "mean_token_accuracy": 0.22903195321559905, "num_tokens": 76031430.0, "step": 43825 }, { "entropy": 5.823302173614502, "epoch": 3.4101147636646565, "grad_norm": 1.40625, "learning_rate": 0.00038594911424778925, "loss": 4.9398, "mean_token_accuracy": 0.21545860022306443, "num_tokens": 76039387.0, "step": 43830 }, { "entropy": 5.845300722122192, "epoch": 3.410503793036374, "grad_norm": 1.3359375, "learning_rate": 0.00038592500171594245, "loss": 4.9027, "mean_token_accuracy": 0.20591666400432587, "num_tokens": 76047461.0, "step": 43835 }, { "entropy": 5.792436504364014, "epoch": 3.410892822408092, "grad_norm": 1.3046875, "learning_rate": 0.00038590088750098536, "loss": 4.9468, "mean_token_accuracy": 0.211945278942585, "num_tokens": 76056194.0, "step": 43840 }, { "entropy": 5.907734680175781, "epoch": 3.411281851779809, "grad_norm": 1.28125, "learning_rate": 0.00038587677160328377, "loss": 5.1354, "mean_token_accuracy": 0.1988607481122017, "num_tokens": 76064848.0, "step": 43845 }, { "entropy": 5.824720764160157, "epoch": 3.411670881151527, "grad_norm": 1.3125, "learning_rate": 0.0003858526540232037, "loss": 4.9603, "mean_token_accuracy": 0.21031819730997087, "num_tokens": 76073972.0, "step": 43850 }, { "entropy": 5.840104770660401, "epoch": 3.4120599105232445, "grad_norm": 1.296875, "learning_rate": 0.00038582853476111094, "loss": 5.0036, "mean_token_accuracy": 0.20448665022850038, "num_tokens": 76082763.0, "step": 43855 }, { "entropy": 5.819099235534668, "epoch": 3.4124489398949622, "grad_norm": 1.3125, "learning_rate": 0.0003858044138173717, "loss": 4.9475, "mean_token_accuracy": 0.21147241443395615, "num_tokens": 76091093.0, "step": 43860 }, { "entropy": 5.822482490539551, "epoch": 3.4128379692666795, "grad_norm": 1.2421875, "learning_rate": 0.00038578029119235176, "loss": 4.9155, "mean_token_accuracy": 0.21598471254110335, "num_tokens": 76099633.0, "step": 43865 }, { "entropy": 5.87732162475586, "epoch": 3.413226998638397, "grad_norm": 1.328125, "learning_rate": 0.00038575616688641724, "loss": 4.9629, "mean_token_accuracy": 0.20790741443634034, "num_tokens": 76108519.0, "step": 43870 }, { "entropy": 5.807954216003418, "epoch": 3.413616028010115, "grad_norm": 1.3359375, "learning_rate": 0.0003857320408999342, "loss": 4.8855, "mean_token_accuracy": 0.2212754800915718, "num_tokens": 76116700.0, "step": 43875 }, { "entropy": 5.782957935333252, "epoch": 3.414005057381832, "grad_norm": 1.3828125, "learning_rate": 0.0003857079132332687, "loss": 4.9387, "mean_token_accuracy": 0.21093517392873765, "num_tokens": 76125200.0, "step": 43880 }, { "entropy": 5.824362802505493, "epoch": 3.41439408675355, "grad_norm": 1.2734375, "learning_rate": 0.00038568378388678675, "loss": 5.0074, "mean_token_accuracy": 0.20993922650814056, "num_tokens": 76134586.0, "step": 43885 }, { "entropy": 5.886890172958374, "epoch": 3.4147831161252675, "grad_norm": 1.3515625, "learning_rate": 0.0003856596528608546, "loss": 4.9753, "mean_token_accuracy": 0.2100835531949997, "num_tokens": 76143334.0, "step": 43890 }, { "entropy": 5.945027256011963, "epoch": 3.4151721454969852, "grad_norm": 1.3359375, "learning_rate": 0.0003856355201558384, "loss": 5.0795, "mean_token_accuracy": 0.20208909660577773, "num_tokens": 76152896.0, "step": 43895 }, { "entropy": 5.7728355884552, "epoch": 3.4155611748687025, "grad_norm": 1.390625, "learning_rate": 0.00038561138577210426, "loss": 4.8603, "mean_token_accuracy": 0.21950095742940903, "num_tokens": 76161288.0, "step": 43900 }, { "entropy": 5.8665062427520756, "epoch": 3.41595020424042, "grad_norm": 1.296875, "learning_rate": 0.00038558724971001835, "loss": 4.9127, "mean_token_accuracy": 0.21739864349365234, "num_tokens": 76169517.0, "step": 43905 }, { "entropy": 5.836590194702149, "epoch": 3.416339233612138, "grad_norm": 1.3046875, "learning_rate": 0.000385563111969947, "loss": 5.0133, "mean_token_accuracy": 0.21415163874626159, "num_tokens": 76178536.0, "step": 43910 }, { "entropy": 5.789945602416992, "epoch": 3.416728262983855, "grad_norm": 1.28125, "learning_rate": 0.00038553897255225633, "loss": 4.982, "mean_token_accuracy": 0.2053741455078125, "num_tokens": 76186660.0, "step": 43915 }, { "entropy": 5.7879496097564695, "epoch": 3.417117292355573, "grad_norm": 1.3359375, "learning_rate": 0.00038551483145731277, "loss": 4.8446, "mean_token_accuracy": 0.2163775384426117, "num_tokens": 76195185.0, "step": 43920 }, { "entropy": 5.8237841606140135, "epoch": 3.4175063217272905, "grad_norm": 1.4140625, "learning_rate": 0.0003854906886854825, "loss": 4.8956, "mean_token_accuracy": 0.21647748351097107, "num_tokens": 76204060.0, "step": 43925 }, { "entropy": 5.831596708297729, "epoch": 3.417895351099008, "grad_norm": 1.40625, "learning_rate": 0.00038546654423713187, "loss": 4.9763, "mean_token_accuracy": 0.2152456447482109, "num_tokens": 76212007.0, "step": 43930 }, { "entropy": 5.827530479431152, "epoch": 3.4182843804707255, "grad_norm": 1.34375, "learning_rate": 0.0003854423981126273, "loss": 4.9797, "mean_token_accuracy": 0.20387081205844879, "num_tokens": 76220258.0, "step": 43935 }, { "entropy": 5.852058744430542, "epoch": 3.418673409842443, "grad_norm": 1.328125, "learning_rate": 0.0003854182503123351, "loss": 4.9467, "mean_token_accuracy": 0.21196922957897185, "num_tokens": 76228097.0, "step": 43940 }, { "entropy": 5.882218360900879, "epoch": 3.4190624392141604, "grad_norm": 1.3359375, "learning_rate": 0.00038539410083662166, "loss": 4.9854, "mean_token_accuracy": 0.20443921983242036, "num_tokens": 76236227.0, "step": 43945 }, { "entropy": 5.854920196533203, "epoch": 3.419451468585878, "grad_norm": 1.3828125, "learning_rate": 0.00038536994968585355, "loss": 4.9848, "mean_token_accuracy": 0.20739775896072388, "num_tokens": 76245009.0, "step": 43950 }, { "entropy": 5.919456148147583, "epoch": 3.419840497957596, "grad_norm": 1.1953125, "learning_rate": 0.00038534579686039705, "loss": 5.0868, "mean_token_accuracy": 0.1970907285809517, "num_tokens": 76254553.0, "step": 43955 }, { "entropy": 5.854041337966919, "epoch": 3.4202295273293135, "grad_norm": 1.2109375, "learning_rate": 0.00038532164236061874, "loss": 5.0032, "mean_token_accuracy": 0.21112479418516159, "num_tokens": 76263822.0, "step": 43960 }, { "entropy": 5.764766693115234, "epoch": 3.4206185567010308, "grad_norm": 1.2734375, "learning_rate": 0.000385297486186885, "loss": 4.7816, "mean_token_accuracy": 0.21902240961790084, "num_tokens": 76273103.0, "step": 43965 }, { "entropy": 5.8248310565948485, "epoch": 3.4210075860727485, "grad_norm": 1.2890625, "learning_rate": 0.0003852733283395626, "loss": 4.9962, "mean_token_accuracy": 0.21147226691246032, "num_tokens": 76282248.0, "step": 43970 }, { "entropy": 5.8378016471862795, "epoch": 3.421396615444466, "grad_norm": 1.359375, "learning_rate": 0.000385249168819018, "loss": 4.9349, "mean_token_accuracy": 0.2157124400138855, "num_tokens": 76291147.0, "step": 43975 }, { "entropy": 5.88880090713501, "epoch": 3.4217856448161834, "grad_norm": 1.3828125, "learning_rate": 0.0003852250076256177, "loss": 4.9535, "mean_token_accuracy": 0.21774826645851136, "num_tokens": 76299713.0, "step": 43980 }, { "entropy": 5.772650575637817, "epoch": 3.422174674187901, "grad_norm": 1.265625, "learning_rate": 0.0003852008447597283, "loss": 4.9252, "mean_token_accuracy": 0.21542322039604186, "num_tokens": 76309661.0, "step": 43985 }, { "entropy": 5.832460546493531, "epoch": 3.422563703559619, "grad_norm": 1.2890625, "learning_rate": 0.00038517668022171656, "loss": 5.0137, "mean_token_accuracy": 0.20649162232875823, "num_tokens": 76318473.0, "step": 43990 }, { "entropy": 5.9087177276611325, "epoch": 3.4229527329313365, "grad_norm": 1.3203125, "learning_rate": 0.0003851525140119489, "loss": 4.9825, "mean_token_accuracy": 0.21006109863519667, "num_tokens": 76327503.0, "step": 43995 }, { "entropy": 5.845364809036255, "epoch": 3.4233417623030538, "grad_norm": 1.3828125, "learning_rate": 0.00038512834613079226, "loss": 5.0194, "mean_token_accuracy": 0.2066958725452423, "num_tokens": 76335582.0, "step": 44000 }, { "entropy": 5.83451771736145, "epoch": 3.4237307916747715, "grad_norm": 1.3125, "learning_rate": 0.0003851041765786133, "loss": 4.9893, "mean_token_accuracy": 0.21417795568704606, "num_tokens": 76344978.0, "step": 44005 }, { "entropy": 5.888021802902221, "epoch": 3.424119821046489, "grad_norm": 1.3359375, "learning_rate": 0.00038508000535577864, "loss": 5.002, "mean_token_accuracy": 0.2062072053551674, "num_tokens": 76353616.0, "step": 44010 }, { "entropy": 5.935391187667847, "epoch": 3.4245088504182064, "grad_norm": 1.3671875, "learning_rate": 0.0003850558324626552, "loss": 4.9977, "mean_token_accuracy": 0.20849503129720687, "num_tokens": 76361468.0, "step": 44015 }, { "entropy": 5.852973890304566, "epoch": 3.424897879789924, "grad_norm": 1.2734375, "learning_rate": 0.0003850316578996096, "loss": 4.9743, "mean_token_accuracy": 0.21723642796278, "num_tokens": 76370100.0, "step": 44020 }, { "entropy": 5.849349880218506, "epoch": 3.425286909161642, "grad_norm": 1.3984375, "learning_rate": 0.0003850074816670087, "loss": 4.9949, "mean_token_accuracy": 0.21705928146839143, "num_tokens": 76379167.0, "step": 44025 }, { "entropy": 5.760069799423218, "epoch": 3.4256759385333595, "grad_norm": 1.2109375, "learning_rate": 0.00038498330376521945, "loss": 4.7983, "mean_token_accuracy": 0.22141379117965698, "num_tokens": 76387456.0, "step": 44030 }, { "entropy": 5.929547882080078, "epoch": 3.4260649679050768, "grad_norm": 1.296875, "learning_rate": 0.0003849591241946085, "loss": 5.0886, "mean_token_accuracy": 0.1950438439846039, "num_tokens": 76397139.0, "step": 44035 }, { "entropy": 5.864507007598877, "epoch": 3.4264539972767944, "grad_norm": 1.328125, "learning_rate": 0.000384934942955543, "loss": 4.944, "mean_token_accuracy": 0.21518368273973465, "num_tokens": 76405198.0, "step": 44040 }, { "entropy": 5.887068271636963, "epoch": 3.426843026648512, "grad_norm": 1.34375, "learning_rate": 0.00038491076004838965, "loss": 4.9874, "mean_token_accuracy": 0.20953595340251924, "num_tokens": 76413237.0, "step": 44045 }, { "entropy": 5.875796461105347, "epoch": 3.4272320560202294, "grad_norm": 1.265625, "learning_rate": 0.00038488657547351544, "loss": 5.0019, "mean_token_accuracy": 0.21083976328372955, "num_tokens": 76421675.0, "step": 44050 }, { "entropy": 5.869209432601929, "epoch": 3.427621085391947, "grad_norm": 1.4140625, "learning_rate": 0.0003848623892312874, "loss": 4.9695, "mean_token_accuracy": 0.21260202527046204, "num_tokens": 76430338.0, "step": 44055 }, { "entropy": 5.924650764465332, "epoch": 3.428010114763665, "grad_norm": 1.4140625, "learning_rate": 0.0003848382013220725, "loss": 5.131, "mean_token_accuracy": 0.19443540424108505, "num_tokens": 76439001.0, "step": 44060 }, { "entropy": 5.879854774475097, "epoch": 3.428399144135382, "grad_norm": 1.34375, "learning_rate": 0.0003848140117462376, "loss": 5.0134, "mean_token_accuracy": 0.2093374699354172, "num_tokens": 76447695.0, "step": 44065 }, { "entropy": 5.895300579071045, "epoch": 3.4287881735070997, "grad_norm": 1.40625, "learning_rate": 0.0003847898205041499, "loss": 4.9874, "mean_token_accuracy": 0.20581070482730865, "num_tokens": 76456297.0, "step": 44070 }, { "entropy": 5.920821714401245, "epoch": 3.4291772028788174, "grad_norm": 1.3671875, "learning_rate": 0.00038476562759617644, "loss": 5.1016, "mean_token_accuracy": 0.20470652729272842, "num_tokens": 76464971.0, "step": 44075 }, { "entropy": 5.776926708221436, "epoch": 3.4295662322505347, "grad_norm": 1.28125, "learning_rate": 0.00038474143302268425, "loss": 4.9144, "mean_token_accuracy": 0.21680910438299178, "num_tokens": 76474134.0, "step": 44080 }, { "entropy": 5.946998453140258, "epoch": 3.4299552616222524, "grad_norm": 1.328125, "learning_rate": 0.0003847172367840406, "loss": 5.1546, "mean_token_accuracy": 0.1979419022798538, "num_tokens": 76482902.0, "step": 44085 }, { "entropy": 5.924585819244385, "epoch": 3.43034429099397, "grad_norm": 1.3671875, "learning_rate": 0.0003846930388806124, "loss": 5.0078, "mean_token_accuracy": 0.20791225135326385, "num_tokens": 76490935.0, "step": 44090 }, { "entropy": 5.905887079238892, "epoch": 3.430733320365688, "grad_norm": 1.3828125, "learning_rate": 0.00038466883931276703, "loss": 5.0027, "mean_token_accuracy": 0.21106399446725846, "num_tokens": 76498663.0, "step": 44095 }, { "entropy": 5.861296272277832, "epoch": 3.431122349737405, "grad_norm": 1.4140625, "learning_rate": 0.00038464463808087146, "loss": 4.9979, "mean_token_accuracy": 0.20566127598285674, "num_tokens": 76507353.0, "step": 44100 }, { "entropy": 5.855917930603027, "epoch": 3.4315113791091227, "grad_norm": 1.4921875, "learning_rate": 0.0003846204351852931, "loss": 4.989, "mean_token_accuracy": 0.21015361398458482, "num_tokens": 76515396.0, "step": 44105 }, { "entropy": 5.898738670349121, "epoch": 3.4319004084808404, "grad_norm": 1.40625, "learning_rate": 0.00038459623062639907, "loss": 4.9455, "mean_token_accuracy": 0.20896498411893843, "num_tokens": 76523715.0, "step": 44110 }, { "entropy": 5.811381864547729, "epoch": 3.4322894378525577, "grad_norm": 1.25, "learning_rate": 0.00038457202440455673, "loss": 4.9097, "mean_token_accuracy": 0.21946179866790771, "num_tokens": 76532576.0, "step": 44115 }, { "entropy": 5.8292468070983885, "epoch": 3.4326784672242754, "grad_norm": 2.171875, "learning_rate": 0.0003845478165201333, "loss": 4.8454, "mean_token_accuracy": 0.23248335719108582, "num_tokens": 76541747.0, "step": 44120 }, { "entropy": 5.804116487503052, "epoch": 3.433067496595993, "grad_norm": 1.3828125, "learning_rate": 0.00038452360697349615, "loss": 5.0084, "mean_token_accuracy": 0.21379686146974564, "num_tokens": 76550399.0, "step": 44125 }, { "entropy": 5.889016342163086, "epoch": 3.433456525967711, "grad_norm": 1.28125, "learning_rate": 0.0003844993957650125, "loss": 5.0462, "mean_token_accuracy": 0.19934344291687012, "num_tokens": 76559222.0, "step": 44130 }, { "entropy": 5.883822774887085, "epoch": 3.433845555339428, "grad_norm": 1.3203125, "learning_rate": 0.0003844751828950499, "loss": 5.0451, "mean_token_accuracy": 0.20084514915943147, "num_tokens": 76568097.0, "step": 44135 }, { "entropy": 5.8990936279296875, "epoch": 3.4342345847111457, "grad_norm": 1.28125, "learning_rate": 0.00038445096836397564, "loss": 5.0429, "mean_token_accuracy": 0.20541415959596634, "num_tokens": 76577014.0, "step": 44140 }, { "entropy": 5.864108610153198, "epoch": 3.4346236140828634, "grad_norm": 1.328125, "learning_rate": 0.00038442675217215713, "loss": 5.0092, "mean_token_accuracy": 0.2038536861538887, "num_tokens": 76585787.0, "step": 44145 }, { "entropy": 5.853636264801025, "epoch": 3.4350126434545807, "grad_norm": 1.2734375, "learning_rate": 0.00038440253431996175, "loss": 4.9823, "mean_token_accuracy": 0.21245600432157516, "num_tokens": 76594211.0, "step": 44150 }, { "entropy": 5.81405348777771, "epoch": 3.4354016728262984, "grad_norm": 1.3203125, "learning_rate": 0.00038437831480775717, "loss": 4.9106, "mean_token_accuracy": 0.21415332555770875, "num_tokens": 76602536.0, "step": 44155 }, { "entropy": 5.893564939498901, "epoch": 3.435790702198016, "grad_norm": 1.4765625, "learning_rate": 0.00038435409363591066, "loss": 5.0546, "mean_token_accuracy": 0.20723741501569748, "num_tokens": 76611138.0, "step": 44160 }, { "entropy": 5.875454521179199, "epoch": 3.4361797315697333, "grad_norm": 1.3515625, "learning_rate": 0.00038432987080478986, "loss": 5.0067, "mean_token_accuracy": 0.21487057507038115, "num_tokens": 76619377.0, "step": 44165 }, { "entropy": 5.916072511672974, "epoch": 3.436568760941451, "grad_norm": 1.3046875, "learning_rate": 0.0003843056463147623, "loss": 5.1238, "mean_token_accuracy": 0.20404950082302092, "num_tokens": 76627860.0, "step": 44170 }, { "entropy": 5.7767781734466555, "epoch": 3.4369577903131687, "grad_norm": 1.203125, "learning_rate": 0.00038428142016619555, "loss": 4.9788, "mean_token_accuracy": 0.2046142816543579, "num_tokens": 76637195.0, "step": 44175 }, { "entropy": 5.896539878845215, "epoch": 3.437346819684886, "grad_norm": 1.296875, "learning_rate": 0.0003842571923594572, "loss": 4.9718, "mean_token_accuracy": 0.2172362193465233, "num_tokens": 76645988.0, "step": 44180 }, { "entropy": 5.899210834503174, "epoch": 3.4377358490566037, "grad_norm": 1.328125, "learning_rate": 0.00038423296289491477, "loss": 5.0173, "mean_token_accuracy": 0.21032586097717285, "num_tokens": 76654375.0, "step": 44185 }, { "entropy": 5.798703622817993, "epoch": 3.4381248784283214, "grad_norm": 1.3828125, "learning_rate": 0.00038420873177293606, "loss": 4.9709, "mean_token_accuracy": 0.21007563471794127, "num_tokens": 76663217.0, "step": 44190 }, { "entropy": 5.9870216846466064, "epoch": 3.438513907800039, "grad_norm": 1.4921875, "learning_rate": 0.0003841844989938886, "loss": 5.1064, "mean_token_accuracy": 0.20313764363527298, "num_tokens": 76672328.0, "step": 44195 }, { "entropy": 5.89600977897644, "epoch": 3.4389029371717563, "grad_norm": 1.2734375, "learning_rate": 0.0003841602645581402, "loss": 4.9856, "mean_token_accuracy": 0.21131310611963272, "num_tokens": 76681005.0, "step": 44200 }, { "entropy": 5.809788608551026, "epoch": 3.439291966543474, "grad_norm": 1.4296875, "learning_rate": 0.00038413602846605854, "loss": 4.9022, "mean_token_accuracy": 0.21348177939653395, "num_tokens": 76689883.0, "step": 44205 }, { "entropy": 5.860534811019898, "epoch": 3.4396809959151917, "grad_norm": 1.3359375, "learning_rate": 0.0003841117907180114, "loss": 5.0145, "mean_token_accuracy": 0.20696192234754562, "num_tokens": 76698953.0, "step": 44210 }, { "entropy": 5.922059202194214, "epoch": 3.440070025286909, "grad_norm": 1.3203125, "learning_rate": 0.00038408755131436647, "loss": 5.0559, "mean_token_accuracy": 0.20818686485290527, "num_tokens": 76708531.0, "step": 44215 }, { "entropy": 5.926369619369507, "epoch": 3.4404590546586267, "grad_norm": 1.4609375, "learning_rate": 0.00038406331025549157, "loss": 5.0223, "mean_token_accuracy": 0.20300254672765733, "num_tokens": 76716715.0, "step": 44220 }, { "entropy": 5.89971604347229, "epoch": 3.4408480840303444, "grad_norm": 1.2890625, "learning_rate": 0.0003840390675417545, "loss": 4.9489, "mean_token_accuracy": 0.2173616334795952, "num_tokens": 76725081.0, "step": 44225 }, { "entropy": 5.841331148147583, "epoch": 3.441237113402062, "grad_norm": 1.3828125, "learning_rate": 0.0003840148231735231, "loss": 4.9434, "mean_token_accuracy": 0.21376111209392548, "num_tokens": 76732995.0, "step": 44230 }, { "entropy": 5.848056125640869, "epoch": 3.4416261427737793, "grad_norm": 1.328125, "learning_rate": 0.00038399057715116536, "loss": 4.9683, "mean_token_accuracy": 0.21805143505334854, "num_tokens": 76741863.0, "step": 44235 }, { "entropy": 5.911487197875976, "epoch": 3.442015172145497, "grad_norm": 1.2421875, "learning_rate": 0.00038396632947504904, "loss": 4.9797, "mean_token_accuracy": 0.21770156025886536, "num_tokens": 76751281.0, "step": 44240 }, { "entropy": 5.901050424575805, "epoch": 3.4424042015172147, "grad_norm": 1.34375, "learning_rate": 0.0003839420801455422, "loss": 4.9413, "mean_token_accuracy": 0.21233413368463516, "num_tokens": 76758803.0, "step": 44245 }, { "entropy": 5.874415683746338, "epoch": 3.442793230888932, "grad_norm": 1.296875, "learning_rate": 0.0003839178291630126, "loss": 5.0513, "mean_token_accuracy": 0.20249511152505875, "num_tokens": 76767833.0, "step": 44250 }, { "entropy": 5.943673086166382, "epoch": 3.4431822602606497, "grad_norm": 1.3203125, "learning_rate": 0.00038389357652782836, "loss": 5.0273, "mean_token_accuracy": 0.21299265176057816, "num_tokens": 76776046.0, "step": 44255 }, { "entropy": 5.907406759262085, "epoch": 3.4435712896323674, "grad_norm": 1.40625, "learning_rate": 0.00038386932224035734, "loss": 4.928, "mean_token_accuracy": 0.2177903324365616, "num_tokens": 76784753.0, "step": 44260 }, { "entropy": 5.845219230651855, "epoch": 3.443960319004085, "grad_norm": 1.4765625, "learning_rate": 0.00038384506630096765, "loss": 5.018, "mean_token_accuracy": 0.20693393647670746, "num_tokens": 76793920.0, "step": 44265 }, { "entropy": 5.890315151214599, "epoch": 3.4443493483758023, "grad_norm": 1.3828125, "learning_rate": 0.0003838208087100274, "loss": 5.0756, "mean_token_accuracy": 0.20843016654253005, "num_tokens": 76802575.0, "step": 44270 }, { "entropy": 5.786786127090454, "epoch": 3.44473837774752, "grad_norm": 1.40625, "learning_rate": 0.0003837965494679045, "loss": 4.9202, "mean_token_accuracy": 0.2169828549027443, "num_tokens": 76810962.0, "step": 44275 }, { "entropy": 5.792293930053711, "epoch": 3.4451274071192373, "grad_norm": 1.3671875, "learning_rate": 0.0003837722885749672, "loss": 4.9449, "mean_token_accuracy": 0.2142533466219902, "num_tokens": 76819408.0, "step": 44280 }, { "entropy": 5.872972440719605, "epoch": 3.445516436490955, "grad_norm": 1.3515625, "learning_rate": 0.0003837480260315835, "loss": 4.9276, "mean_token_accuracy": 0.2159590482711792, "num_tokens": 76826888.0, "step": 44285 }, { "entropy": 5.913843059539795, "epoch": 3.4459054658626727, "grad_norm": 1.2890625, "learning_rate": 0.00038372376183812165, "loss": 4.9754, "mean_token_accuracy": 0.213849338889122, "num_tokens": 76836649.0, "step": 44290 }, { "entropy": 5.83642692565918, "epoch": 3.4462944952343904, "grad_norm": 1.3125, "learning_rate": 0.0003836994959949497, "loss": 4.9742, "mean_token_accuracy": 0.2113280713558197, "num_tokens": 76845123.0, "step": 44295 }, { "entropy": 5.826214122772217, "epoch": 3.4466835246061076, "grad_norm": 1.3828125, "learning_rate": 0.00038367522850243593, "loss": 4.8854, "mean_token_accuracy": 0.21889735907316207, "num_tokens": 76853595.0, "step": 44300 }, { "entropy": 5.82852578163147, "epoch": 3.4470725539778253, "grad_norm": 1.328125, "learning_rate": 0.00038365095936094857, "loss": 4.9745, "mean_token_accuracy": 0.21296181827783583, "num_tokens": 76862765.0, "step": 44305 }, { "entropy": 5.814942216873169, "epoch": 3.447461583349543, "grad_norm": 1.3828125, "learning_rate": 0.0003836266885708558, "loss": 4.9498, "mean_token_accuracy": 0.20942875146865844, "num_tokens": 76870825.0, "step": 44310 }, { "entropy": 5.942566967010498, "epoch": 3.4478506127212603, "grad_norm": 1.34375, "learning_rate": 0.00038360241613252593, "loss": 5.0322, "mean_token_accuracy": 0.20974048525094985, "num_tokens": 76880085.0, "step": 44315 }, { "entropy": 5.872527027130127, "epoch": 3.448239642092978, "grad_norm": 1.2890625, "learning_rate": 0.0003835781420463273, "loss": 4.9944, "mean_token_accuracy": 0.20799621492624282, "num_tokens": 76889231.0, "step": 44320 }, { "entropy": 5.826364469528198, "epoch": 3.4486286714646956, "grad_norm": 1.4140625, "learning_rate": 0.0003835538663126282, "loss": 4.9981, "mean_token_accuracy": 0.2091787949204445, "num_tokens": 76898151.0, "step": 44325 }, { "entropy": 5.9477729320526125, "epoch": 3.4490177008364133, "grad_norm": 1.359375, "learning_rate": 0.0003835295889317969, "loss": 5.0476, "mean_token_accuracy": 0.20028073191642762, "num_tokens": 76906638.0, "step": 44330 }, { "entropy": 5.872470569610596, "epoch": 3.4494067302081306, "grad_norm": 1.421875, "learning_rate": 0.00038350530990420177, "loss": 4.9842, "mean_token_accuracy": 0.21813303232192993, "num_tokens": 76914986.0, "step": 44335 }, { "entropy": 5.848671007156372, "epoch": 3.4497957595798483, "grad_norm": 1.3671875, "learning_rate": 0.0003834810292302114, "loss": 4.9083, "mean_token_accuracy": 0.2166862815618515, "num_tokens": 76924290.0, "step": 44340 }, { "entropy": 5.8444701671600345, "epoch": 3.450184788951566, "grad_norm": 1.3515625, "learning_rate": 0.000383456746910194, "loss": 4.9959, "mean_token_accuracy": 0.21167974621057511, "num_tokens": 76933159.0, "step": 44345 }, { "entropy": 5.853628253936767, "epoch": 3.4505738183232832, "grad_norm": 1.265625, "learning_rate": 0.0003834324629445182, "loss": 5.0065, "mean_token_accuracy": 0.2064526528120041, "num_tokens": 76941436.0, "step": 44350 }, { "entropy": 5.873377418518066, "epoch": 3.450962847695001, "grad_norm": 1.359375, "learning_rate": 0.0003834081773335522, "loss": 4.9882, "mean_token_accuracy": 0.20205493569374083, "num_tokens": 76949760.0, "step": 44355 }, { "entropy": 5.836436176300049, "epoch": 3.4513518770667186, "grad_norm": 1.21875, "learning_rate": 0.00038338389007766473, "loss": 4.9542, "mean_token_accuracy": 0.21715426146984101, "num_tokens": 76958941.0, "step": 44360 }, { "entropy": 5.879078435897827, "epoch": 3.4517409064384363, "grad_norm": 1.390625, "learning_rate": 0.0003833596011772242, "loss": 5.0474, "mean_token_accuracy": 0.20372789800167085, "num_tokens": 76967881.0, "step": 44365 }, { "entropy": 5.856692743301392, "epoch": 3.4521299358101536, "grad_norm": 1.34375, "learning_rate": 0.0003833353106325993, "loss": 4.9891, "mean_token_accuracy": 0.20820915549993516, "num_tokens": 76976059.0, "step": 44370 }, { "entropy": 5.8218165874481205, "epoch": 3.4525189651818713, "grad_norm": 1.3125, "learning_rate": 0.0003833110184441584, "loss": 4.9363, "mean_token_accuracy": 0.21285669654607772, "num_tokens": 76985224.0, "step": 44375 }, { "entropy": 5.927899169921875, "epoch": 3.452907994553589, "grad_norm": 1.3046875, "learning_rate": 0.00038328672461227024, "loss": 4.9999, "mean_token_accuracy": 0.20375314950942994, "num_tokens": 76994189.0, "step": 44380 }, { "entropy": 5.892507648468017, "epoch": 3.4532970239253062, "grad_norm": 1.2421875, "learning_rate": 0.0003832624291373034, "loss": 4.9696, "mean_token_accuracy": 0.2096343070268631, "num_tokens": 77003701.0, "step": 44385 }, { "entropy": 5.822946643829345, "epoch": 3.453686053297024, "grad_norm": 1.3359375, "learning_rate": 0.00038323813201962645, "loss": 4.9515, "mean_token_accuracy": 0.21411342322826385, "num_tokens": 77012929.0, "step": 44390 }, { "entropy": 5.805064916610718, "epoch": 3.4540750826687416, "grad_norm": 1.265625, "learning_rate": 0.00038321383325960816, "loss": 4.9317, "mean_token_accuracy": 0.2116946056485176, "num_tokens": 77022045.0, "step": 44395 }, { "entropy": 5.8638969421386715, "epoch": 3.454464112040459, "grad_norm": 1.3203125, "learning_rate": 0.0003831895328576172, "loss": 4.9474, "mean_token_accuracy": 0.22019802033901215, "num_tokens": 77030197.0, "step": 44400 }, { "entropy": 5.773309946060181, "epoch": 3.4548531414121766, "grad_norm": 1.25, "learning_rate": 0.0003831652308140223, "loss": 4.9242, "mean_token_accuracy": 0.2069219633936882, "num_tokens": 77038939.0, "step": 44405 }, { "entropy": 5.828426218032837, "epoch": 3.4552421707838943, "grad_norm": 1.3984375, "learning_rate": 0.0003831409271291921, "loss": 5.0086, "mean_token_accuracy": 0.2117981106042862, "num_tokens": 77047314.0, "step": 44410 }, { "entropy": 5.8918601989746096, "epoch": 3.4556312001556115, "grad_norm": 1.40625, "learning_rate": 0.00038311662180349554, "loss": 4.999, "mean_token_accuracy": 0.2089047908782959, "num_tokens": 77055100.0, "step": 44415 }, { "entropy": 5.835245084762573, "epoch": 3.4560202295273292, "grad_norm": 1.375, "learning_rate": 0.00038309231483730133, "loss": 5.0103, "mean_token_accuracy": 0.20763815939426422, "num_tokens": 77064240.0, "step": 44420 }, { "entropy": 5.823662900924683, "epoch": 3.456409258899047, "grad_norm": 1.2265625, "learning_rate": 0.0003830680062309782, "loss": 4.8898, "mean_token_accuracy": 0.21590039432048796, "num_tokens": 77073274.0, "step": 44425 }, { "entropy": 5.84425539970398, "epoch": 3.4567982882707646, "grad_norm": 1.421875, "learning_rate": 0.00038304369598489516, "loss": 4.9975, "mean_token_accuracy": 0.21598760187625884, "num_tokens": 77081157.0, "step": 44430 }, { "entropy": 5.850561714172363, "epoch": 3.457187317642482, "grad_norm": 1.3046875, "learning_rate": 0.000383019384099421, "loss": 4.9716, "mean_token_accuracy": 0.20854909271001815, "num_tokens": 77090045.0, "step": 44435 }, { "entropy": 5.890961742401123, "epoch": 3.4575763470141996, "grad_norm": 1.4453125, "learning_rate": 0.0003829950705749246, "loss": 4.9418, "mean_token_accuracy": 0.21714490205049514, "num_tokens": 77098559.0, "step": 44440 }, { "entropy": 5.919901704788208, "epoch": 3.4579653763859173, "grad_norm": 1.359375, "learning_rate": 0.00038297075541177496, "loss": 5.0545, "mean_token_accuracy": 0.212209253013134, "num_tokens": 77107033.0, "step": 44445 }, { "entropy": 5.8210916996002195, "epoch": 3.4583544057576345, "grad_norm": 1.34375, "learning_rate": 0.00038294643861034087, "loss": 4.9056, "mean_token_accuracy": 0.2134287789463997, "num_tokens": 77115867.0, "step": 44450 }, { "entropy": 5.866188669204712, "epoch": 3.4587434351293522, "grad_norm": 1.3515625, "learning_rate": 0.0003829221201709914, "loss": 5.0265, "mean_token_accuracy": 0.2061479091644287, "num_tokens": 77124938.0, "step": 44455 }, { "entropy": 5.863016796112061, "epoch": 3.45913246450107, "grad_norm": 1.265625, "learning_rate": 0.0003828978000940955, "loss": 4.9785, "mean_token_accuracy": 0.20372442454099654, "num_tokens": 77134362.0, "step": 44460 }, { "entropy": 5.932760715484619, "epoch": 3.4595214938727876, "grad_norm": 1.3203125, "learning_rate": 0.0003828734783800223, "loss": 4.9893, "mean_token_accuracy": 0.208194862306118, "num_tokens": 77142633.0, "step": 44465 }, { "entropy": 5.86742844581604, "epoch": 3.459910523244505, "grad_norm": 1.4453125, "learning_rate": 0.0003828491550291408, "loss": 4.942, "mean_token_accuracy": 0.21366048008203506, "num_tokens": 77151313.0, "step": 44470 }, { "entropy": 5.86872444152832, "epoch": 3.4602995526162226, "grad_norm": 1.4453125, "learning_rate": 0.0003828248300418199, "loss": 5.0029, "mean_token_accuracy": 0.20709519237279891, "num_tokens": 77159139.0, "step": 44475 }, { "entropy": 5.870968437194824, "epoch": 3.4606885819879403, "grad_norm": 1.3203125, "learning_rate": 0.00038280050341842894, "loss": 5.0399, "mean_token_accuracy": 0.1981135219335556, "num_tokens": 77167747.0, "step": 44480 }, { "entropy": 5.8439706325531, "epoch": 3.4610776113596575, "grad_norm": 1.3671875, "learning_rate": 0.0003827761751593369, "loss": 4.9297, "mean_token_accuracy": 0.21200936883687974, "num_tokens": 77176505.0, "step": 44485 }, { "entropy": 5.869344091415405, "epoch": 3.461466640731375, "grad_norm": 1.25, "learning_rate": 0.0003827518452649129, "loss": 4.9957, "mean_token_accuracy": 0.20692320317029952, "num_tokens": 77185396.0, "step": 44490 }, { "entropy": 5.939345455169677, "epoch": 3.461855670103093, "grad_norm": 1.265625, "learning_rate": 0.0003827275137355261, "loss": 5.0454, "mean_token_accuracy": 0.2015735313296318, "num_tokens": 77193558.0, "step": 44495 }, { "entropy": 5.917511701583862, "epoch": 3.46224469947481, "grad_norm": 1.359375, "learning_rate": 0.0003827031805715458, "loss": 5.0037, "mean_token_accuracy": 0.20787128210067748, "num_tokens": 77202783.0, "step": 44500 }, { "entropy": 5.846156978607178, "epoch": 3.462633728846528, "grad_norm": 1.328125, "learning_rate": 0.00038267884577334124, "loss": 4.9522, "mean_token_accuracy": 0.21177664250135422, "num_tokens": 77211356.0, "step": 44505 }, { "entropy": 5.9159839153289795, "epoch": 3.4630227582182456, "grad_norm": 1.46875, "learning_rate": 0.0003826545093412815, "loss": 4.9756, "mean_token_accuracy": 0.2117762193083763, "num_tokens": 77219401.0, "step": 44510 }, { "entropy": 5.872131109237671, "epoch": 3.463411787589963, "grad_norm": 1.3125, "learning_rate": 0.00038263017127573596, "loss": 5.035, "mean_token_accuracy": 0.20968535989522935, "num_tokens": 77228436.0, "step": 44515 }, { "entropy": 5.885397911071777, "epoch": 3.4638008169616805, "grad_norm": 1.3125, "learning_rate": 0.0003826058315770739, "loss": 5.0436, "mean_token_accuracy": 0.20858116149902345, "num_tokens": 77237547.0, "step": 44520 }, { "entropy": 5.8960357189178465, "epoch": 3.464189846333398, "grad_norm": 1.390625, "learning_rate": 0.00038258149024566465, "loss": 4.9909, "mean_token_accuracy": 0.21531523615121842, "num_tokens": 77247512.0, "step": 44525 }, { "entropy": 5.895198917388916, "epoch": 3.464578875705116, "grad_norm": 1.171875, "learning_rate": 0.0003825571472818774, "loss": 5.0325, "mean_token_accuracy": 0.20045370906591414, "num_tokens": 77256511.0, "step": 44530 }, { "entropy": 5.95631685256958, "epoch": 3.464967905076833, "grad_norm": 1.3671875, "learning_rate": 0.0003825328026860817, "loss": 5.0717, "mean_token_accuracy": 0.20416852086782455, "num_tokens": 77264986.0, "step": 44535 }, { "entropy": 5.919108772277832, "epoch": 3.465356934448551, "grad_norm": 1.375, "learning_rate": 0.00038250845645864686, "loss": 5.0445, "mean_token_accuracy": 0.21106908321380616, "num_tokens": 77273531.0, "step": 44540 }, { "entropy": 5.832286596298218, "epoch": 3.4657459638202686, "grad_norm": 1.3125, "learning_rate": 0.0003824841085999423, "loss": 4.9387, "mean_token_accuracy": 0.2083718404173851, "num_tokens": 77282279.0, "step": 44545 }, { "entropy": 5.890779495239258, "epoch": 3.466134993191986, "grad_norm": 1.4375, "learning_rate": 0.0003824597591103375, "loss": 4.9544, "mean_token_accuracy": 0.2134363666176796, "num_tokens": 77290584.0, "step": 44550 }, { "entropy": 5.874242687225342, "epoch": 3.4665240225637035, "grad_norm": 1.390625, "learning_rate": 0.00038243540799020193, "loss": 5.0525, "mean_token_accuracy": 0.20557764172554016, "num_tokens": 77299706.0, "step": 44555 }, { "entropy": 5.918213748931885, "epoch": 3.466913051935421, "grad_norm": 1.2421875, "learning_rate": 0.00038241105523990497, "loss": 4.9997, "mean_token_accuracy": 0.20792745500802995, "num_tokens": 77308616.0, "step": 44560 }, { "entropy": 5.88009877204895, "epoch": 3.467302081307139, "grad_norm": 1.3046875, "learning_rate": 0.0003823867008598163, "loss": 5.0212, "mean_token_accuracy": 0.20499771684408188, "num_tokens": 77317740.0, "step": 44565 }, { "entropy": 5.8326293468475345, "epoch": 3.467691110678856, "grad_norm": 1.3828125, "learning_rate": 0.00038236234485030524, "loss": 4.9518, "mean_token_accuracy": 0.2144574925303459, "num_tokens": 77326868.0, "step": 44570 }, { "entropy": 5.876618671417236, "epoch": 3.468080140050574, "grad_norm": 1.359375, "learning_rate": 0.00038233798721174156, "loss": 5.0065, "mean_token_accuracy": 0.21197029799222947, "num_tokens": 77335276.0, "step": 44575 }, { "entropy": 5.834342813491821, "epoch": 3.4684691694222916, "grad_norm": 1.3046875, "learning_rate": 0.0003823136279444948, "loss": 4.9459, "mean_token_accuracy": 0.22099836468696593, "num_tokens": 77343765.0, "step": 44580 }, { "entropy": 5.844537162780762, "epoch": 3.468858198794009, "grad_norm": 1.296875, "learning_rate": 0.0003822892670489345, "loss": 4.948, "mean_token_accuracy": 0.21600262969732284, "num_tokens": 77352326.0, "step": 44585 }, { "entropy": 5.882081317901611, "epoch": 3.4692472281657265, "grad_norm": 1.3359375, "learning_rate": 0.00038226490452543036, "loss": 5.0025, "mean_token_accuracy": 0.2068750113248825, "num_tokens": 77360893.0, "step": 44590 }, { "entropy": 5.845548629760742, "epoch": 3.469636257537444, "grad_norm": 1.3828125, "learning_rate": 0.000382240540374352, "loss": 4.9289, "mean_token_accuracy": 0.21735809296369552, "num_tokens": 77370376.0, "step": 44595 }, { "entropy": 5.8438496589660645, "epoch": 3.4700252869091615, "grad_norm": 1.21875, "learning_rate": 0.0003822161745960691, "loss": 4.9853, "mean_token_accuracy": 0.21068590730428696, "num_tokens": 77379800.0, "step": 44600 }, { "entropy": 5.827046060562134, "epoch": 3.470414316280879, "grad_norm": 1.3515625, "learning_rate": 0.0003821918071909515, "loss": 4.9233, "mean_token_accuracy": 0.2136423483490944, "num_tokens": 77388128.0, "step": 44605 }, { "entropy": 5.915372848510742, "epoch": 3.470803345652597, "grad_norm": 1.3984375, "learning_rate": 0.0003821674381593687, "loss": 5.0954, "mean_token_accuracy": 0.20389765352010727, "num_tokens": 77396320.0, "step": 44610 }, { "entropy": 5.861430883407593, "epoch": 3.471192375024314, "grad_norm": 1.3984375, "learning_rate": 0.0003821430675016907, "loss": 5.0244, "mean_token_accuracy": 0.20270322114229203, "num_tokens": 77405980.0, "step": 44615 }, { "entropy": 5.8808784008026125, "epoch": 3.471581404396032, "grad_norm": 1.3671875, "learning_rate": 0.00038211869521828716, "loss": 5.0032, "mean_token_accuracy": 0.21069419980049134, "num_tokens": 77414634.0, "step": 44620 }, { "entropy": 5.84755539894104, "epoch": 3.4719704337677495, "grad_norm": 1.4765625, "learning_rate": 0.000382094321309528, "loss": 4.8783, "mean_token_accuracy": 0.21882979869842528, "num_tokens": 77422945.0, "step": 44625 }, { "entropy": 5.819676160812378, "epoch": 3.472359463139467, "grad_norm": 1.3203125, "learning_rate": 0.0003820699457757829, "loss": 4.9839, "mean_token_accuracy": 0.21350980997085572, "num_tokens": 77431848.0, "step": 44630 }, { "entropy": 5.827579593658447, "epoch": 3.4727484925111844, "grad_norm": 1.265625, "learning_rate": 0.0003820455686174218, "loss": 5.0319, "mean_token_accuracy": 0.19985178709030152, "num_tokens": 77440822.0, "step": 44635 }, { "entropy": 5.917607307434082, "epoch": 3.473137521882902, "grad_norm": 1.3515625, "learning_rate": 0.00038202118983481456, "loss": 5.0998, "mean_token_accuracy": 0.20173296332359314, "num_tokens": 77449320.0, "step": 44640 }, { "entropy": 5.771625709533692, "epoch": 3.47352655125462, "grad_norm": 1.328125, "learning_rate": 0.0003819968094283311, "loss": 4.789, "mean_token_accuracy": 0.22145420908927918, "num_tokens": 77457841.0, "step": 44645 }, { "entropy": 5.839608478546142, "epoch": 3.473915580626337, "grad_norm": 1.25, "learning_rate": 0.0003819724273983414, "loss": 4.9398, "mean_token_accuracy": 0.218255715072155, "num_tokens": 77466751.0, "step": 44650 }, { "entropy": 5.9424254417419435, "epoch": 3.474304609998055, "grad_norm": 1.421875, "learning_rate": 0.00038194804374521536, "loss": 5.1393, "mean_token_accuracy": 0.19994935691356658, "num_tokens": 77475355.0, "step": 44655 }, { "entropy": 5.897541332244873, "epoch": 3.4746936393697725, "grad_norm": 1.3515625, "learning_rate": 0.0003819236584693229, "loss": 4.9414, "mean_token_accuracy": 0.2099450409412384, "num_tokens": 77483929.0, "step": 44660 }, { "entropy": 5.84615569114685, "epoch": 3.47508266874149, "grad_norm": 1.296875, "learning_rate": 0.00038189927157103427, "loss": 4.8822, "mean_token_accuracy": 0.2127579554915428, "num_tokens": 77492599.0, "step": 44665 }, { "entropy": 5.758064460754395, "epoch": 3.4754716981132074, "grad_norm": 1.3515625, "learning_rate": 0.0003818748830507192, "loss": 4.9031, "mean_token_accuracy": 0.21731504052877426, "num_tokens": 77501856.0, "step": 44670 }, { "entropy": 5.807080173492432, "epoch": 3.475860727484925, "grad_norm": 1.3046875, "learning_rate": 0.000381850492908748, "loss": 4.9219, "mean_token_accuracy": 0.22511528432369232, "num_tokens": 77510557.0, "step": 44675 }, { "entropy": 5.840623903274536, "epoch": 3.476249756856643, "grad_norm": 1.28125, "learning_rate": 0.00038182610114549057, "loss": 4.9322, "mean_token_accuracy": 0.20995031893253327, "num_tokens": 77518737.0, "step": 44680 }, { "entropy": 5.786155462265015, "epoch": 3.47663878622836, "grad_norm": 1.2890625, "learning_rate": 0.00038180170776131714, "loss": 4.8287, "mean_token_accuracy": 0.21844499111175536, "num_tokens": 77527433.0, "step": 44685 }, { "entropy": 5.874866056442261, "epoch": 3.477027815600078, "grad_norm": 1.515625, "learning_rate": 0.0003817773127565977, "loss": 4.9639, "mean_token_accuracy": 0.21056477576494217, "num_tokens": 77536441.0, "step": 44690 }, { "entropy": 5.855126190185547, "epoch": 3.4774168449717955, "grad_norm": 1.3125, "learning_rate": 0.00038175291613170247, "loss": 5.017, "mean_token_accuracy": 0.2122418537735939, "num_tokens": 77545772.0, "step": 44695 }, { "entropy": 5.8513476848602295, "epoch": 3.477805874343513, "grad_norm": 1.25, "learning_rate": 0.00038172851788700174, "loss": 4.8914, "mean_token_accuracy": 0.22107330113649368, "num_tokens": 77554631.0, "step": 44700 }, { "entropy": 5.9209259986877445, "epoch": 3.4781949037152304, "grad_norm": 1.375, "learning_rate": 0.0003817041180228657, "loss": 5.0275, "mean_token_accuracy": 0.1992516651749611, "num_tokens": 77563026.0, "step": 44705 }, { "entropy": 5.863089084625244, "epoch": 3.478583933086948, "grad_norm": 1.4609375, "learning_rate": 0.0003816797165396643, "loss": 5.0584, "mean_token_accuracy": 0.20576203614473343, "num_tokens": 77571559.0, "step": 44710 }, { "entropy": 5.824941730499267, "epoch": 3.4789729624586654, "grad_norm": 1.3125, "learning_rate": 0.00038165531343776815, "loss": 4.9011, "mean_token_accuracy": 0.20984706729650499, "num_tokens": 77579615.0, "step": 44715 }, { "entropy": 5.8749120235443115, "epoch": 3.479361991830383, "grad_norm": 1.3828125, "learning_rate": 0.0003816309087175474, "loss": 5.0771, "mean_token_accuracy": 0.20524393022060394, "num_tokens": 77587967.0, "step": 44720 }, { "entropy": 5.930889320373535, "epoch": 3.479751021202101, "grad_norm": 1.2734375, "learning_rate": 0.00038160650237937225, "loss": 5.0614, "mean_token_accuracy": 0.19971709847450256, "num_tokens": 77597358.0, "step": 44725 }, { "entropy": 5.905979633331299, "epoch": 3.4801400505738185, "grad_norm": 1.296875, "learning_rate": 0.0003815820944236131, "loss": 4.9355, "mean_token_accuracy": 0.21185854077339172, "num_tokens": 77605354.0, "step": 44730 }, { "entropy": 5.873653888702393, "epoch": 3.4805290799455357, "grad_norm": 1.3515625, "learning_rate": 0.00038155768485064037, "loss": 5.0383, "mean_token_accuracy": 0.20807576179504395, "num_tokens": 77614879.0, "step": 44735 }, { "entropy": 5.900464630126953, "epoch": 3.4809181093172534, "grad_norm": 1.46875, "learning_rate": 0.00038153327366082434, "loss": 5.0624, "mean_token_accuracy": 0.20154136568307876, "num_tokens": 77623437.0, "step": 44740 }, { "entropy": 5.845536184310913, "epoch": 3.481307138688971, "grad_norm": 1.265625, "learning_rate": 0.00038150886085453546, "loss": 4.9861, "mean_token_accuracy": 0.20731067657470703, "num_tokens": 77632054.0, "step": 44745 }, { "entropy": 5.900174951553344, "epoch": 3.4816961680606884, "grad_norm": 1.2890625, "learning_rate": 0.00038148444643214415, "loss": 5.0281, "mean_token_accuracy": 0.20529271215200423, "num_tokens": 77640616.0, "step": 44750 }, { "entropy": 5.976004028320313, "epoch": 3.482085197432406, "grad_norm": 1.21875, "learning_rate": 0.0003814600303940208, "loss": 5.0875, "mean_token_accuracy": 0.1962366670370102, "num_tokens": 77649533.0, "step": 44755 }, { "entropy": 5.828184747695923, "epoch": 3.4824742268041238, "grad_norm": 1.265625, "learning_rate": 0.000381435612740536, "loss": 4.916, "mean_token_accuracy": 0.2239959254860878, "num_tokens": 77657929.0, "step": 44760 }, { "entropy": 5.843001508712769, "epoch": 3.4828632561758415, "grad_norm": 1.2734375, "learning_rate": 0.00038141119347206016, "loss": 5.0152, "mean_token_accuracy": 0.2024470493197441, "num_tokens": 77666861.0, "step": 44765 }, { "entropy": 5.862302446365357, "epoch": 3.4832522855475587, "grad_norm": 1.3203125, "learning_rate": 0.00038138677258896383, "loss": 4.9019, "mean_token_accuracy": 0.21564800292253494, "num_tokens": 77675033.0, "step": 44770 }, { "entropy": 5.850249814987182, "epoch": 3.4836413149192764, "grad_norm": 1.375, "learning_rate": 0.0003813623500916176, "loss": 4.9659, "mean_token_accuracy": 0.2174173876643181, "num_tokens": 77682971.0, "step": 44775 }, { "entropy": 5.8964393615722654, "epoch": 3.484030344290994, "grad_norm": 1.359375, "learning_rate": 0.00038133792598039196, "loss": 4.9971, "mean_token_accuracy": 0.20960344821214677, "num_tokens": 77691735.0, "step": 44780 }, { "entropy": 5.908811759948731, "epoch": 3.4844193736627114, "grad_norm": 1.2890625, "learning_rate": 0.0003813135002556575, "loss": 5.0289, "mean_token_accuracy": 0.2087090104818344, "num_tokens": 77700416.0, "step": 44785 }, { "entropy": 5.822631597518921, "epoch": 3.484808403034429, "grad_norm": 1.375, "learning_rate": 0.00038128907291778497, "loss": 4.8984, "mean_token_accuracy": 0.22063064873218535, "num_tokens": 77708814.0, "step": 44790 }, { "entropy": 5.839618444442749, "epoch": 3.4851974324061468, "grad_norm": 1.2421875, "learning_rate": 0.00038126464396714494, "loss": 5.0031, "mean_token_accuracy": 0.21548448652029037, "num_tokens": 77717065.0, "step": 44795 }, { "entropy": 5.830079507827759, "epoch": 3.4855864617778645, "grad_norm": 1.296875, "learning_rate": 0.00038124021340410795, "loss": 5.0065, "mean_token_accuracy": 0.2075408712029457, "num_tokens": 77725866.0, "step": 44800 }, { "entropy": 5.932476949691773, "epoch": 3.4859754911495817, "grad_norm": 1.5390625, "learning_rate": 0.00038121578122904496, "loss": 4.983, "mean_token_accuracy": 0.21454715877771377, "num_tokens": 77734281.0, "step": 44805 }, { "entropy": 5.820304489135742, "epoch": 3.4863645205212994, "grad_norm": 1.3359375, "learning_rate": 0.0003811913474423265, "loss": 4.9114, "mean_token_accuracy": 0.22208681404590608, "num_tokens": 77742836.0, "step": 44810 }, { "entropy": 5.883713817596435, "epoch": 3.486753549893017, "grad_norm": 1.4609375, "learning_rate": 0.0003811669120443234, "loss": 5.0072, "mean_token_accuracy": 0.21091004610061645, "num_tokens": 77751495.0, "step": 44815 }, { "entropy": 5.940904998779297, "epoch": 3.4871425792647344, "grad_norm": 1.25, "learning_rate": 0.0003811424750354063, "loss": 5.0609, "mean_token_accuracy": 0.20464243739843369, "num_tokens": 77760705.0, "step": 44820 }, { "entropy": 5.885308408737183, "epoch": 3.487531608636452, "grad_norm": 1.28125, "learning_rate": 0.0003811180364159462, "loss": 4.8928, "mean_token_accuracy": 0.2120475649833679, "num_tokens": 77769383.0, "step": 44825 }, { "entropy": 5.859677791595459, "epoch": 3.4879206380081698, "grad_norm": 1.3125, "learning_rate": 0.00038109359618631374, "loss": 4.9854, "mean_token_accuracy": 0.20647010952234268, "num_tokens": 77778338.0, "step": 44830 }, { "entropy": 5.794975614547729, "epoch": 3.488309667379887, "grad_norm": 1.2578125, "learning_rate": 0.00038106915434687983, "loss": 4.9201, "mean_token_accuracy": 0.21771511137485505, "num_tokens": 77786585.0, "step": 44835 }, { "entropy": 5.90019965171814, "epoch": 3.4886986967516047, "grad_norm": 1.5234375, "learning_rate": 0.0003810447108980153, "loss": 4.9992, "mean_token_accuracy": 0.2086635485291481, "num_tokens": 77794469.0, "step": 44840 }, { "entropy": 5.775630187988281, "epoch": 3.4890877261233224, "grad_norm": 1.3046875, "learning_rate": 0.0003810202658400911, "loss": 4.9487, "mean_token_accuracy": 0.20990603119134904, "num_tokens": 77803026.0, "step": 44845 }, { "entropy": 5.92583122253418, "epoch": 3.4894767554950397, "grad_norm": 1.390625, "learning_rate": 0.0003809958191734781, "loss": 5.0523, "mean_token_accuracy": 0.2005174219608307, "num_tokens": 77811581.0, "step": 44850 }, { "entropy": 5.912703657150269, "epoch": 3.4898657848667574, "grad_norm": 1.3046875, "learning_rate": 0.00038097137089854725, "loss": 5.0035, "mean_token_accuracy": 0.20876436531543732, "num_tokens": 77819405.0, "step": 44855 }, { "entropy": 5.967259788513184, "epoch": 3.490254814238475, "grad_norm": 1.375, "learning_rate": 0.00038094692101566955, "loss": 5.1288, "mean_token_accuracy": 0.20421157479286195, "num_tokens": 77828189.0, "step": 44860 }, { "entropy": 5.846439361572266, "epoch": 3.4906438436101928, "grad_norm": 1.4453125, "learning_rate": 0.0003809224695252159, "loss": 4.9051, "mean_token_accuracy": 0.2208015576004982, "num_tokens": 77837377.0, "step": 44865 }, { "entropy": 5.833496713638306, "epoch": 3.49103287298191, "grad_norm": 1.3671875, "learning_rate": 0.00038089801642755746, "loss": 4.9918, "mean_token_accuracy": 0.20895759016275406, "num_tokens": 77846155.0, "step": 44870 }, { "entropy": 5.852547931671142, "epoch": 3.4914219023536277, "grad_norm": 1.3671875, "learning_rate": 0.00038087356172306514, "loss": 4.9697, "mean_token_accuracy": 0.2119869962334633, "num_tokens": 77854498.0, "step": 44875 }, { "entropy": 5.8093791007995605, "epoch": 3.4918109317253454, "grad_norm": 1.3671875, "learning_rate": 0.00038084910541211, "loss": 4.9714, "mean_token_accuracy": 0.21122411489486695, "num_tokens": 77862859.0, "step": 44880 }, { "entropy": 5.915842294692993, "epoch": 3.4921999610970627, "grad_norm": 1.3984375, "learning_rate": 0.00038082464749506314, "loss": 5.0712, "mean_token_accuracy": 0.21275665760040283, "num_tokens": 77871363.0, "step": 44885 }, { "entropy": 5.803472375869751, "epoch": 3.4925889904687804, "grad_norm": 1.3671875, "learning_rate": 0.00038080018797229576, "loss": 4.9128, "mean_token_accuracy": 0.21097746044397353, "num_tokens": 77880392.0, "step": 44890 }, { "entropy": 5.871707153320313, "epoch": 3.492978019840498, "grad_norm": 1.328125, "learning_rate": 0.0003807757268441789, "loss": 4.9971, "mean_token_accuracy": 0.21479251980781555, "num_tokens": 77888481.0, "step": 44895 }, { "entropy": 5.778295421600342, "epoch": 3.4933670492122157, "grad_norm": 1.3203125, "learning_rate": 0.00038075126411108367, "loss": 4.9553, "mean_token_accuracy": 0.21414764523506163, "num_tokens": 77896607.0, "step": 44900 }, { "entropy": 5.849267196655274, "epoch": 3.493756078583933, "grad_norm": 1.4140625, "learning_rate": 0.00038072679977338143, "loss": 5.0319, "mean_token_accuracy": 0.20337370336055755, "num_tokens": 77905449.0, "step": 44905 }, { "entropy": 5.913154363632202, "epoch": 3.4941451079556507, "grad_norm": 1.328125, "learning_rate": 0.00038070233383144324, "loss": 4.9107, "mean_token_accuracy": 0.21128833293914795, "num_tokens": 77914307.0, "step": 44910 }, { "entropy": 5.84696855545044, "epoch": 3.4945341373273684, "grad_norm": 1.359375, "learning_rate": 0.0003806778662856404, "loss": 4.9222, "mean_token_accuracy": 0.21114497780799865, "num_tokens": 77923023.0, "step": 44915 }, { "entropy": 5.834674930572509, "epoch": 3.4949231666990856, "grad_norm": 1.28125, "learning_rate": 0.0003806533971363441, "loss": 4.9813, "mean_token_accuracy": 0.2066175788640976, "num_tokens": 77932213.0, "step": 44920 }, { "entropy": 5.8748985767364506, "epoch": 3.4953121960708033, "grad_norm": 1.265625, "learning_rate": 0.0003806289263839257, "loss": 5.0087, "mean_token_accuracy": 0.20919941365718842, "num_tokens": 77941232.0, "step": 44925 }, { "entropy": 5.918903636932373, "epoch": 3.495701225442521, "grad_norm": 1.296875, "learning_rate": 0.0003806044540287564, "loss": 4.9976, "mean_token_accuracy": 0.20974234938621522, "num_tokens": 77949783.0, "step": 44930 }, { "entropy": 5.880999326705933, "epoch": 3.4960902548142383, "grad_norm": 1.28125, "learning_rate": 0.00038057998007120776, "loss": 4.99, "mean_token_accuracy": 0.2064649760723114, "num_tokens": 77958330.0, "step": 44935 }, { "entropy": 5.828049182891846, "epoch": 3.496479284185956, "grad_norm": 1.375, "learning_rate": 0.00038055550451165086, "loss": 4.9575, "mean_token_accuracy": 0.2095625177025795, "num_tokens": 77966628.0, "step": 44940 }, { "entropy": 5.8363207340240475, "epoch": 3.4968683135576737, "grad_norm": 1.2734375, "learning_rate": 0.0003805310273504572, "loss": 5.044, "mean_token_accuracy": 0.20599292516708373, "num_tokens": 77975823.0, "step": 44945 }, { "entropy": 5.9194543838500975, "epoch": 3.497257342929391, "grad_norm": 1.4296875, "learning_rate": 0.0003805065485879982, "loss": 5.0697, "mean_token_accuracy": 0.20149530619382858, "num_tokens": 77984437.0, "step": 44950 }, { "entropy": 5.919117164611817, "epoch": 3.4976463723011086, "grad_norm": 1.3828125, "learning_rate": 0.00038048206822464514, "loss": 4.9149, "mean_token_accuracy": 0.2154546320438385, "num_tokens": 77992260.0, "step": 44955 }, { "entropy": 5.907607555389404, "epoch": 3.4980354016728263, "grad_norm": 1.53125, "learning_rate": 0.00038045758626076965, "loss": 5.0668, "mean_token_accuracy": 0.21097473353147506, "num_tokens": 78000454.0, "step": 44960 }, { "entropy": 5.802175760269165, "epoch": 3.498424431044544, "grad_norm": 1.375, "learning_rate": 0.0003804331026967432, "loss": 4.9139, "mean_token_accuracy": 0.21668574810028077, "num_tokens": 78009664.0, "step": 44965 }, { "entropy": 5.813556051254272, "epoch": 3.4988134604162613, "grad_norm": 1.421875, "learning_rate": 0.0003804086175329372, "loss": 4.8542, "mean_token_accuracy": 0.21460025161504745, "num_tokens": 78017422.0, "step": 44970 }, { "entropy": 5.8515842914581295, "epoch": 3.499202489787979, "grad_norm": 1.4140625, "learning_rate": 0.0003803841307697232, "loss": 4.9672, "mean_token_accuracy": 0.2082340255379677, "num_tokens": 78026128.0, "step": 44975 }, { "entropy": 5.796940326690674, "epoch": 3.4995915191596967, "grad_norm": 1.40625, "learning_rate": 0.00038035964240747274, "loss": 4.9629, "mean_token_accuracy": 0.21070099025964736, "num_tokens": 78034030.0, "step": 44980 }, { "entropy": 5.821059226989746, "epoch": 3.499980548531414, "grad_norm": 1.421875, "learning_rate": 0.0003803351524465574, "loss": 4.9339, "mean_token_accuracy": 0.21264251470565795, "num_tokens": 78042090.0, "step": 44985 }, { "entropy": 5.8644993782043455, "epoch": 3.5003695779031316, "grad_norm": 1.3203125, "learning_rate": 0.00038031066088734883, "loss": 5.0061, "mean_token_accuracy": 0.21654389798641205, "num_tokens": 78050484.0, "step": 44990 }, { "entropy": 5.927216005325318, "epoch": 3.5007586072748493, "grad_norm": 1.2421875, "learning_rate": 0.0003802861677302185, "loss": 5.0192, "mean_token_accuracy": 0.20676873177289962, "num_tokens": 78058850.0, "step": 44995 }, { "entropy": 5.829816102981567, "epoch": 3.501147636646567, "grad_norm": 1.3125, "learning_rate": 0.00038026167297553826, "loss": 4.9489, "mean_token_accuracy": 0.21237030029296874, "num_tokens": 78068088.0, "step": 45000 }, { "epoch": 3.501147636646567, "eval_entropy": 5.626769499094929, "eval_loss": 5.066978454589844, "eval_mean_token_accuracy": 0.21624493246702647, "eval_num_tokens": 78068088.0, "eval_runtime": 21.8291, "eval_samples_per_second": 1903.79, "eval_steps_per_second": 237.985, "step": 45000 }, { "entropy": 5.932721376419067, "epoch": 3.5015366660182843, "grad_norm": 1.2578125, "learning_rate": 0.00038023717662367956, "loss": 5.0747, "mean_token_accuracy": 0.20003687590360641, "num_tokens": 78076894.0, "step": 45005 }, { "entropy": 5.869003057479858, "epoch": 3.501925695390002, "grad_norm": 1.2890625, "learning_rate": 0.0003802126786750143, "loss": 4.9043, "mean_token_accuracy": 0.22397035658359526, "num_tokens": 78085267.0, "step": 45010 }, { "entropy": 5.817862606048584, "epoch": 3.5023147247617192, "grad_norm": 1.5625, "learning_rate": 0.00038018817912991413, "loss": 4.9629, "mean_token_accuracy": 0.21774177849292756, "num_tokens": 78093702.0, "step": 45015 }, { "entropy": 5.88811182975769, "epoch": 3.502703754133437, "grad_norm": 1.3359375, "learning_rate": 0.00038016367798875074, "loss": 4.9778, "mean_token_accuracy": 0.21332552134990693, "num_tokens": 78102816.0, "step": 45020 }, { "entropy": 5.929887914657593, "epoch": 3.5030927835051546, "grad_norm": 1.4375, "learning_rate": 0.0003801391752518959, "loss": 5.0668, "mean_token_accuracy": 0.1998712107539177, "num_tokens": 78110918.0, "step": 45025 }, { "entropy": 5.822823858261108, "epoch": 3.5034818128768723, "grad_norm": 1.3984375, "learning_rate": 0.00038011467091972134, "loss": 4.9271, "mean_token_accuracy": 0.20817546248435975, "num_tokens": 78120344.0, "step": 45030 }, { "entropy": 5.971571969985962, "epoch": 3.50387084224859, "grad_norm": 1.3203125, "learning_rate": 0.0003800901649925991, "loss": 5.1052, "mean_token_accuracy": 0.19882993400096893, "num_tokens": 78128836.0, "step": 45035 }, { "entropy": 5.927473306655884, "epoch": 3.5042598716203073, "grad_norm": 1.421875, "learning_rate": 0.00038006565747090076, "loss": 5.0189, "mean_token_accuracy": 0.20979005098342896, "num_tokens": 78138487.0, "step": 45040 }, { "entropy": 5.856084394454956, "epoch": 3.504648900992025, "grad_norm": 1.3125, "learning_rate": 0.00038004114835499833, "loss": 4.901, "mean_token_accuracy": 0.21462844908237458, "num_tokens": 78147851.0, "step": 45045 }, { "entropy": 5.88827223777771, "epoch": 3.5050379303637422, "grad_norm": 1.421875, "learning_rate": 0.00038001663764526374, "loss": 4.9873, "mean_token_accuracy": 0.20696263164281845, "num_tokens": 78155748.0, "step": 45050 }, { "entropy": 5.93864254951477, "epoch": 3.50542695973546, "grad_norm": 1.296875, "learning_rate": 0.00037999212534206876, "loss": 5.0868, "mean_token_accuracy": 0.20654332339763642, "num_tokens": 78165050.0, "step": 45055 }, { "entropy": 5.926043510437012, "epoch": 3.5058159891071776, "grad_norm": 1.3203125, "learning_rate": 0.0003799676114457853, "loss": 5.0449, "mean_token_accuracy": 0.20292008966207503, "num_tokens": 78173550.0, "step": 45060 }, { "entropy": 5.846756076812744, "epoch": 3.5062050184788953, "grad_norm": 1.328125, "learning_rate": 0.00037994309595678553, "loss": 5.0245, "mean_token_accuracy": 0.2092999204993248, "num_tokens": 78182909.0, "step": 45065 }, { "entropy": 5.884186315536499, "epoch": 3.5065940478506126, "grad_norm": 1.3125, "learning_rate": 0.0003799185788754413, "loss": 4.9256, "mean_token_accuracy": 0.21486144363880158, "num_tokens": 78190814.0, "step": 45070 }, { "entropy": 5.829663944244385, "epoch": 3.5069830772223303, "grad_norm": 1.2734375, "learning_rate": 0.0003798940602021247, "loss": 4.9574, "mean_token_accuracy": 0.2149548202753067, "num_tokens": 78199634.0, "step": 45075 }, { "entropy": 5.823628044128418, "epoch": 3.507372106594048, "grad_norm": 1.4296875, "learning_rate": 0.0003798695399372076, "loss": 4.9367, "mean_token_accuracy": 0.21718997210264207, "num_tokens": 78208650.0, "step": 45080 }, { "entropy": 5.925009059906006, "epoch": 3.507761135965765, "grad_norm": 1.2421875, "learning_rate": 0.0003798450180810621, "loss": 5.0294, "mean_token_accuracy": 0.2071436658501625, "num_tokens": 78217451.0, "step": 45085 }, { "entropy": 5.9026854038238525, "epoch": 3.508150165337483, "grad_norm": 1.2421875, "learning_rate": 0.00037982049463406044, "loss": 5.0397, "mean_token_accuracy": 0.20616032779216767, "num_tokens": 78226985.0, "step": 45090 }, { "entropy": 5.849848413467408, "epoch": 3.5085391947092006, "grad_norm": 1.3828125, "learning_rate": 0.0003797959695965745, "loss": 4.9345, "mean_token_accuracy": 0.21660025417804718, "num_tokens": 78235318.0, "step": 45095 }, { "entropy": 5.815673971176148, "epoch": 3.5089282240809183, "grad_norm": 1.390625, "learning_rate": 0.00037977144296897665, "loss": 4.979, "mean_token_accuracy": 0.21527139246463775, "num_tokens": 78243582.0, "step": 45100 }, { "entropy": 5.7990875244140625, "epoch": 3.5093172534526356, "grad_norm": 1.234375, "learning_rate": 0.0003797469147516388, "loss": 4.9171, "mean_token_accuracy": 0.21587480902671813, "num_tokens": 78252638.0, "step": 45105 }, { "entropy": 5.911598873138428, "epoch": 3.5097062828243533, "grad_norm": 1.3203125, "learning_rate": 0.00037972238494493333, "loss": 5.0188, "mean_token_accuracy": 0.2049779549241066, "num_tokens": 78261442.0, "step": 45110 }, { "entropy": 5.832846593856812, "epoch": 3.510095312196071, "grad_norm": 1.4375, "learning_rate": 0.0003796978535492323, "loss": 4.9046, "mean_token_accuracy": 0.2232723578810692, "num_tokens": 78270282.0, "step": 45115 }, { "entropy": 5.8629225730896, "epoch": 3.510484341567788, "grad_norm": 1.3515625, "learning_rate": 0.000379673320564908, "loss": 4.9836, "mean_token_accuracy": 0.20384276956319808, "num_tokens": 78278906.0, "step": 45120 }, { "entropy": 5.885653972625732, "epoch": 3.510873370939506, "grad_norm": 1.421875, "learning_rate": 0.00037964878599233264, "loss": 4.9873, "mean_token_accuracy": 0.2142725721001625, "num_tokens": 78286834.0, "step": 45125 }, { "entropy": 5.835375261306763, "epoch": 3.5112624003112236, "grad_norm": 1.390625, "learning_rate": 0.00037962424983187856, "loss": 5.0482, "mean_token_accuracy": 0.2007294178009033, "num_tokens": 78295841.0, "step": 45130 }, { "entropy": 5.894398164749146, "epoch": 3.5116514296829413, "grad_norm": 1.421875, "learning_rate": 0.000379599712083918, "loss": 4.9814, "mean_token_accuracy": 0.21155588775873185, "num_tokens": 78304020.0, "step": 45135 }, { "entropy": 5.902297782897949, "epoch": 3.5120404590546586, "grad_norm": 1.3671875, "learning_rate": 0.0003795751727488233, "loss": 4.9315, "mean_token_accuracy": 0.2119233250617981, "num_tokens": 78312447.0, "step": 45140 }, { "entropy": 5.800845336914063, "epoch": 3.5124294884263763, "grad_norm": 1.28125, "learning_rate": 0.00037955063182696676, "loss": 4.9219, "mean_token_accuracy": 0.2202686548233032, "num_tokens": 78321321.0, "step": 45145 }, { "entropy": 5.878175354003906, "epoch": 3.5128185177980935, "grad_norm": 1.3125, "learning_rate": 0.00037952608931872086, "loss": 4.9838, "mean_token_accuracy": 0.20980445742607118, "num_tokens": 78330413.0, "step": 45150 }, { "entropy": 5.877806091308594, "epoch": 3.513207547169811, "grad_norm": 1.421875, "learning_rate": 0.00037950154522445784, "loss": 4.8946, "mean_token_accuracy": 0.2179975315928459, "num_tokens": 78338228.0, "step": 45155 }, { "entropy": 5.847499847412109, "epoch": 3.513596576541529, "grad_norm": 1.4296875, "learning_rate": 0.0003794769995445502, "loss": 5.0257, "mean_token_accuracy": 0.20664810240268708, "num_tokens": 78346702.0, "step": 45160 }, { "entropy": 5.804989624023437, "epoch": 3.5139856059132466, "grad_norm": 1.296875, "learning_rate": 0.0003794524522793705, "loss": 4.9988, "mean_token_accuracy": 0.2157856285572052, "num_tokens": 78355289.0, "step": 45165 }, { "entropy": 5.8072878360748295, "epoch": 3.514374635284964, "grad_norm": 1.296875, "learning_rate": 0.00037942790342929106, "loss": 4.9127, "mean_token_accuracy": 0.21594730466604234, "num_tokens": 78364884.0, "step": 45170 }, { "entropy": 5.8253847599029545, "epoch": 3.5147636646566816, "grad_norm": 1.2890625, "learning_rate": 0.00037940335299468437, "loss": 4.9234, "mean_token_accuracy": 0.217653089761734, "num_tokens": 78373486.0, "step": 45175 }, { "entropy": 5.853621482849121, "epoch": 3.5151526940283992, "grad_norm": 1.390625, "learning_rate": 0.00037937880097592294, "loss": 4.9222, "mean_token_accuracy": 0.21658690571784972, "num_tokens": 78382169.0, "step": 45180 }, { "entropy": 5.8187802791595455, "epoch": 3.5155417234001165, "grad_norm": 1.2265625, "learning_rate": 0.00037935424737337936, "loss": 4.9875, "mean_token_accuracy": 0.21169629245996474, "num_tokens": 78391127.0, "step": 45185 }, { "entropy": 5.821754407882691, "epoch": 3.515930752771834, "grad_norm": 1.25, "learning_rate": 0.00037932969218742616, "loss": 4.8746, "mean_token_accuracy": 0.21045132577419282, "num_tokens": 78399773.0, "step": 45190 }, { "entropy": 5.825250148773193, "epoch": 3.516319782143552, "grad_norm": 1.3828125, "learning_rate": 0.00037930513541843593, "loss": 4.9783, "mean_token_accuracy": 0.20947145968675612, "num_tokens": 78409403.0, "step": 45195 }, { "entropy": 5.840211248397827, "epoch": 3.5167088115152696, "grad_norm": 1.28125, "learning_rate": 0.00037928057706678136, "loss": 4.9572, "mean_token_accuracy": 0.21833537817001342, "num_tokens": 78418284.0, "step": 45200 }, { "entropy": 5.879475498199463, "epoch": 3.517097840886987, "grad_norm": 1.3828125, "learning_rate": 0.00037925601713283504, "loss": 4.9617, "mean_token_accuracy": 0.21302390992641448, "num_tokens": 78426570.0, "step": 45205 }, { "entropy": 5.87636775970459, "epoch": 3.5174868702587045, "grad_norm": 1.2265625, "learning_rate": 0.0003792314556169695, "loss": 4.992, "mean_token_accuracy": 0.21208970695734025, "num_tokens": 78435816.0, "step": 45210 }, { "entropy": 5.871246194839477, "epoch": 3.5178758996304222, "grad_norm": 1.3828125, "learning_rate": 0.0003792068925195576, "loss": 4.9547, "mean_token_accuracy": 0.22153990268707274, "num_tokens": 78444002.0, "step": 45215 }, { "entropy": 5.826976299285889, "epoch": 3.5182649290021395, "grad_norm": 1.3515625, "learning_rate": 0.0003791823278409719, "loss": 5.005, "mean_token_accuracy": 0.21417439728975296, "num_tokens": 78452175.0, "step": 45220 }, { "entropy": 5.91998701095581, "epoch": 3.518653958373857, "grad_norm": 1.34375, "learning_rate": 0.00037915776158158515, "loss": 5.0136, "mean_token_accuracy": 0.20154198706150056, "num_tokens": 78460506.0, "step": 45225 }, { "entropy": 5.804496097564697, "epoch": 3.519042987745575, "grad_norm": 1.203125, "learning_rate": 0.0003791331937417703, "loss": 4.994, "mean_token_accuracy": 0.20605075657367705, "num_tokens": 78469771.0, "step": 45230 }, { "entropy": 5.872729778289795, "epoch": 3.5194320171172926, "grad_norm": 1.2734375, "learning_rate": 0.00037910862432189986, "loss": 5.0284, "mean_token_accuracy": 0.20851699262857437, "num_tokens": 78478666.0, "step": 45235 }, { "entropy": 5.822877597808838, "epoch": 3.51982104648901, "grad_norm": 1.3125, "learning_rate": 0.0003790840533223467, "loss": 4.9639, "mean_token_accuracy": 0.21568614095449448, "num_tokens": 78487534.0, "step": 45240 }, { "entropy": 5.7737963676452635, "epoch": 3.5202100758607275, "grad_norm": 1.2578125, "learning_rate": 0.00037905948074348387, "loss": 4.9243, "mean_token_accuracy": 0.2086750715970993, "num_tokens": 78496255.0, "step": 45245 }, { "entropy": 5.911154079437256, "epoch": 3.520599105232445, "grad_norm": 1.4296875, "learning_rate": 0.000379034906585684, "loss": 4.988, "mean_token_accuracy": 0.21195125132799147, "num_tokens": 78504045.0, "step": 45250 }, { "entropy": 5.849690198898315, "epoch": 3.5209881346041625, "grad_norm": 1.3359375, "learning_rate": 0.00037901033084932, "loss": 4.9172, "mean_token_accuracy": 0.21154258251190186, "num_tokens": 78512696.0, "step": 45255 }, { "entropy": 5.838649940490723, "epoch": 3.52137716397588, "grad_norm": 1.328125, "learning_rate": 0.0003789857535347648, "loss": 4.9767, "mean_token_accuracy": 0.20899676978588105, "num_tokens": 78521378.0, "step": 45260 }, { "entropy": 5.839627265930176, "epoch": 3.521766193347598, "grad_norm": 1.4375, "learning_rate": 0.0003789611746423912, "loss": 5.0142, "mean_token_accuracy": 0.20644188970327376, "num_tokens": 78529975.0, "step": 45265 }, { "entropy": 5.89998607635498, "epoch": 3.5221552227193156, "grad_norm": 1.359375, "learning_rate": 0.00037893659417257233, "loss": 4.9489, "mean_token_accuracy": 0.20823965966701508, "num_tokens": 78538486.0, "step": 45270 }, { "entropy": 5.783394622802734, "epoch": 3.522544252091033, "grad_norm": 1.46875, "learning_rate": 0.00037891201212568107, "loss": 4.9557, "mean_token_accuracy": 0.21207451522350312, "num_tokens": 78546761.0, "step": 45275 }, { "entropy": 5.801366090774536, "epoch": 3.5229332814627505, "grad_norm": 1.359375, "learning_rate": 0.00037888742850209037, "loss": 4.9242, "mean_token_accuracy": 0.21571864187717438, "num_tokens": 78555361.0, "step": 45280 }, { "entropy": 5.825440120697022, "epoch": 3.523322310834468, "grad_norm": 1.34375, "learning_rate": 0.0003788628433021733, "loss": 4.9634, "mean_token_accuracy": 0.21500884741544724, "num_tokens": 78564037.0, "step": 45285 }, { "entropy": 5.86397910118103, "epoch": 3.5237113402061855, "grad_norm": 1.34375, "learning_rate": 0.000378838256526303, "loss": 5.0592, "mean_token_accuracy": 0.1980877235531807, "num_tokens": 78572576.0, "step": 45290 }, { "entropy": 5.963622808456421, "epoch": 3.524100369577903, "grad_norm": 1.3125, "learning_rate": 0.0003788136681748523, "loss": 5.1019, "mean_token_accuracy": 0.2039520338177681, "num_tokens": 78581400.0, "step": 45295 }, { "entropy": 5.77984299659729, "epoch": 3.524489398949621, "grad_norm": 1.421875, "learning_rate": 0.0003787890782481945, "loss": 4.8295, "mean_token_accuracy": 0.22604072391986846, "num_tokens": 78589633.0, "step": 45300 }, { "entropy": 5.782489204406739, "epoch": 3.524878428321338, "grad_norm": 1.28125, "learning_rate": 0.0003787644867467026, "loss": 4.9667, "mean_token_accuracy": 0.2139367714524269, "num_tokens": 78598807.0, "step": 45305 }, { "entropy": 5.8394664287567135, "epoch": 3.525267457693056, "grad_norm": 1.3515625, "learning_rate": 0.00037873989367074977, "loss": 5.0033, "mean_token_accuracy": 0.20914938449859619, "num_tokens": 78607470.0, "step": 45310 }, { "entropy": 5.936884593963623, "epoch": 3.5256564870647735, "grad_norm": 1.484375, "learning_rate": 0.00037871529902070924, "loss": 5.0529, "mean_token_accuracy": 0.20796950459480285, "num_tokens": 78615907.0, "step": 45315 }, { "entropy": 5.90245475769043, "epoch": 3.526045516436491, "grad_norm": 1.359375, "learning_rate": 0.00037869070279695404, "loss": 5.1249, "mean_token_accuracy": 0.2019887700676918, "num_tokens": 78625009.0, "step": 45320 }, { "entropy": 5.8416054248809814, "epoch": 3.5264345458082085, "grad_norm": 1.2578125, "learning_rate": 0.00037866610499985755, "loss": 4.9607, "mean_token_accuracy": 0.21765768826007842, "num_tokens": 78633854.0, "step": 45325 }, { "entropy": 5.834599304199219, "epoch": 3.526823575179926, "grad_norm": 1.328125, "learning_rate": 0.0003786415056297929, "loss": 4.9581, "mean_token_accuracy": 0.2087261900305748, "num_tokens": 78641957.0, "step": 45330 }, { "entropy": 5.891305923461914, "epoch": 3.527212604551644, "grad_norm": 1.3359375, "learning_rate": 0.0003786169046871333, "loss": 5.0325, "mean_token_accuracy": 0.2005322515964508, "num_tokens": 78650984.0, "step": 45335 }, { "entropy": 5.850249338150024, "epoch": 3.527601633923361, "grad_norm": 1.3203125, "learning_rate": 0.0003785923021722521, "loss": 4.9397, "mean_token_accuracy": 0.20504023730754853, "num_tokens": 78659216.0, "step": 45340 }, { "entropy": 5.862275791168213, "epoch": 3.527990663295079, "grad_norm": 1.3125, "learning_rate": 0.00037856769808552267, "loss": 4.9691, "mean_token_accuracy": 0.2144316166639328, "num_tokens": 78668099.0, "step": 45345 }, { "entropy": 5.804915237426758, "epoch": 3.528379692666796, "grad_norm": 1.328125, "learning_rate": 0.0003785430924273182, "loss": 4.8929, "mean_token_accuracy": 0.21531765162944794, "num_tokens": 78677022.0, "step": 45350 }, { "entropy": 5.906276798248291, "epoch": 3.5287687220385138, "grad_norm": 1.40625, "learning_rate": 0.00037851848519801214, "loss": 5.0762, "mean_token_accuracy": 0.20642807483673095, "num_tokens": 78685942.0, "step": 45355 }, { "entropy": 5.87044939994812, "epoch": 3.5291577514102315, "grad_norm": 1.25, "learning_rate": 0.0003784938763979778, "loss": 4.9622, "mean_token_accuracy": 0.2147611767053604, "num_tokens": 78694522.0, "step": 45360 }, { "entropy": 5.835910081863403, "epoch": 3.529546780781949, "grad_norm": 1.265625, "learning_rate": 0.0003784692660275886, "loss": 4.9012, "mean_token_accuracy": 0.21867570877075196, "num_tokens": 78704053.0, "step": 45365 }, { "entropy": 5.88354606628418, "epoch": 3.529935810153667, "grad_norm": 1.3515625, "learning_rate": 0.0003784446540872181, "loss": 4.9192, "mean_token_accuracy": 0.2147444888949394, "num_tokens": 78712721.0, "step": 45370 }, { "entropy": 5.826020336151123, "epoch": 3.530324839525384, "grad_norm": 1.2578125, "learning_rate": 0.00037842004057723957, "loss": 4.9652, "mean_token_accuracy": 0.20936896055936813, "num_tokens": 78722087.0, "step": 45375 }, { "entropy": 5.853988265991211, "epoch": 3.530713868897102, "grad_norm": 1.359375, "learning_rate": 0.0003783954254980265, "loss": 5.0198, "mean_token_accuracy": 0.20846703946590422, "num_tokens": 78730140.0, "step": 45380 }, { "entropy": 5.930027103424072, "epoch": 3.531102898268819, "grad_norm": 1.421875, "learning_rate": 0.0003783708088499524, "loss": 5.0039, "mean_token_accuracy": 0.20584528744220734, "num_tokens": 78738353.0, "step": 45385 }, { "entropy": 5.886236190795898, "epoch": 3.5314919276405368, "grad_norm": 1.390625, "learning_rate": 0.00037834619063339085, "loss": 5.0156, "mean_token_accuracy": 0.21124156266450883, "num_tokens": 78747163.0, "step": 45390 }, { "entropy": 5.802527332305909, "epoch": 3.5318809570122545, "grad_norm": 1.359375, "learning_rate": 0.0003783215708487153, "loss": 5.0105, "mean_token_accuracy": 0.20071533769369126, "num_tokens": 78756274.0, "step": 45395 }, { "entropy": 5.8513579845428465, "epoch": 3.532269986383972, "grad_norm": 1.2890625, "learning_rate": 0.0003782969494962994, "loss": 4.9735, "mean_token_accuracy": 0.21177105456590653, "num_tokens": 78765553.0, "step": 45400 }, { "entropy": 5.87096848487854, "epoch": 3.5326590157556894, "grad_norm": 1.3359375, "learning_rate": 0.0003782723265765167, "loss": 4.9412, "mean_token_accuracy": 0.2158966615796089, "num_tokens": 78774275.0, "step": 45405 }, { "entropy": 5.889529371261597, "epoch": 3.533048045127407, "grad_norm": 1.2890625, "learning_rate": 0.00037824770208974085, "loss": 5.0182, "mean_token_accuracy": 0.20445874482393264, "num_tokens": 78783339.0, "step": 45410 }, { "entropy": 5.7906488418579105, "epoch": 3.533437074499125, "grad_norm": 1.25, "learning_rate": 0.0003782230760363454, "loss": 4.9012, "mean_token_accuracy": 0.217826946079731, "num_tokens": 78792247.0, "step": 45415 }, { "entropy": 5.851281929016113, "epoch": 3.533826103870842, "grad_norm": 1.3515625, "learning_rate": 0.00037819844841670416, "loss": 5.0328, "mean_token_accuracy": 0.20981960594654084, "num_tokens": 78800331.0, "step": 45420 }, { "entropy": 5.807776546478271, "epoch": 3.5342151332425598, "grad_norm": 1.2890625, "learning_rate": 0.0003781738192311906, "loss": 4.8983, "mean_token_accuracy": 0.21264511495828628, "num_tokens": 78808984.0, "step": 45425 }, { "entropy": 5.855939197540283, "epoch": 3.5346041626142775, "grad_norm": 1.3125, "learning_rate": 0.00037814918848017855, "loss": 4.9918, "mean_token_accuracy": 0.20888191908597947, "num_tokens": 78817485.0, "step": 45430 }, { "entropy": 5.877398872375489, "epoch": 3.534993191985995, "grad_norm": 1.2421875, "learning_rate": 0.0003781245561640418, "loss": 5.0302, "mean_token_accuracy": 0.20741984248161316, "num_tokens": 78826134.0, "step": 45435 }, { "entropy": 5.841350841522217, "epoch": 3.5353822213577124, "grad_norm": 1.34375, "learning_rate": 0.0003780999222831541, "loss": 4.9922, "mean_token_accuracy": 0.21840549111366273, "num_tokens": 78834569.0, "step": 45440 }, { "entropy": 5.91485366821289, "epoch": 3.53577125072943, "grad_norm": 1.4296875, "learning_rate": 0.0003780752868378892, "loss": 5.0287, "mean_token_accuracy": 0.21029309779405594, "num_tokens": 78843395.0, "step": 45445 }, { "entropy": 5.903423643112182, "epoch": 3.536160280101148, "grad_norm": 1.4140625, "learning_rate": 0.00037805064982862076, "loss": 4.9826, "mean_token_accuracy": 0.20569756478071213, "num_tokens": 78851800.0, "step": 45450 }, { "entropy": 5.866128063201904, "epoch": 3.536549309472865, "grad_norm": 1.390625, "learning_rate": 0.0003780260112557228, "loss": 5.0591, "mean_token_accuracy": 0.20324162840843202, "num_tokens": 78859926.0, "step": 45455 }, { "entropy": 5.871235179901123, "epoch": 3.5369383388445828, "grad_norm": 1.3515625, "learning_rate": 0.00037800137111956904, "loss": 5.0113, "mean_token_accuracy": 0.20618481189012527, "num_tokens": 78868654.0, "step": 45460 }, { "entropy": 5.910176372528076, "epoch": 3.5373273682163004, "grad_norm": 1.3125, "learning_rate": 0.00037797672942053344, "loss": 4.9873, "mean_token_accuracy": 0.2132035657763481, "num_tokens": 78877545.0, "step": 45465 }, { "entropy": 5.877975988388061, "epoch": 3.537716397588018, "grad_norm": 1.3046875, "learning_rate": 0.00037795208615898997, "loss": 5.0361, "mean_token_accuracy": 0.20163301527500152, "num_tokens": 78886794.0, "step": 45470 }, { "entropy": 5.880583810806274, "epoch": 3.5381054269597354, "grad_norm": 1.265625, "learning_rate": 0.0003779274413353124, "loss": 5.02, "mean_token_accuracy": 0.20416702032089235, "num_tokens": 78895617.0, "step": 45475 }, { "entropy": 5.934981203079223, "epoch": 3.538494456331453, "grad_norm": 1.2421875, "learning_rate": 0.00037790279494987475, "loss": 5.0685, "mean_token_accuracy": 0.21209078878164292, "num_tokens": 78904300.0, "step": 45480 }, { "entropy": 5.888391971588135, "epoch": 3.5388834857031704, "grad_norm": 1.3984375, "learning_rate": 0.00037787814700305096, "loss": 4.9937, "mean_token_accuracy": 0.21303920000791549, "num_tokens": 78913470.0, "step": 45485 }, { "entropy": 5.871713066101075, "epoch": 3.539272515074888, "grad_norm": 1.203125, "learning_rate": 0.000377853497495215, "loss": 4.9907, "mean_token_accuracy": 0.20933856815099716, "num_tokens": 78921923.0, "step": 45490 }, { "entropy": 5.800688886642456, "epoch": 3.5396615444466057, "grad_norm": 1.3046875, "learning_rate": 0.00037782884642674085, "loss": 4.9148, "mean_token_accuracy": 0.21321197599172592, "num_tokens": 78930218.0, "step": 45495 }, { "entropy": 5.813690423965454, "epoch": 3.5400505738183234, "grad_norm": 1.3671875, "learning_rate": 0.0003778041937980028, "loss": 4.9546, "mean_token_accuracy": 0.2156895264983177, "num_tokens": 78938272.0, "step": 45500 }, { "entropy": 5.758527088165283, "epoch": 3.5404396031900407, "grad_norm": 1.3359375, "learning_rate": 0.00037777953960937467, "loss": 4.8974, "mean_token_accuracy": 0.22340509444475173, "num_tokens": 78946859.0, "step": 45505 }, { "entropy": 5.832810926437378, "epoch": 3.5408286325617584, "grad_norm": 1.5234375, "learning_rate": 0.00037775488386123057, "loss": 5.0599, "mean_token_accuracy": 0.20361458212137223, "num_tokens": 78957029.0, "step": 45510 }, { "entropy": 5.964425086975098, "epoch": 3.541217661933476, "grad_norm": 1.3125, "learning_rate": 0.00037773022655394466, "loss": 5.0582, "mean_token_accuracy": 0.20582681596279145, "num_tokens": 78965943.0, "step": 45515 }, { "entropy": 5.832622718811035, "epoch": 3.5416066913051933, "grad_norm": 1.3984375, "learning_rate": 0.00037770556768789115, "loss": 4.8393, "mean_token_accuracy": 0.21669335663318634, "num_tokens": 78974713.0, "step": 45520 }, { "entropy": 5.877196550369263, "epoch": 3.541995720676911, "grad_norm": 1.484375, "learning_rate": 0.00037768090726344414, "loss": 5.0085, "mean_token_accuracy": 0.20935473144054412, "num_tokens": 78983489.0, "step": 45525 }, { "entropy": 5.904327821731568, "epoch": 3.5423847500486287, "grad_norm": 1.3515625, "learning_rate": 0.0003776562452809777, "loss": 5.0342, "mean_token_accuracy": 0.20669298619031906, "num_tokens": 78992355.0, "step": 45530 }, { "entropy": 5.863565254211426, "epoch": 3.5427737794203464, "grad_norm": 1.4296875, "learning_rate": 0.00037763158174086616, "loss": 4.9824, "mean_token_accuracy": 0.21712840348482132, "num_tokens": 79000505.0, "step": 45535 }, { "entropy": 5.849595737457276, "epoch": 3.5431628087920637, "grad_norm": 1.3984375, "learning_rate": 0.00037760691664348367, "loss": 5.0163, "mean_token_accuracy": 0.20989047586917878, "num_tokens": 79008697.0, "step": 45540 }, { "entropy": 5.905746793746948, "epoch": 3.5435518381637814, "grad_norm": 1.3515625, "learning_rate": 0.0003775822499892046, "loss": 4.9729, "mean_token_accuracy": 0.21464051604270934, "num_tokens": 79017636.0, "step": 45545 }, { "entropy": 5.795956754684449, "epoch": 3.543940867535499, "grad_norm": 1.34375, "learning_rate": 0.0003775575817784032, "loss": 4.8851, "mean_token_accuracy": 0.21160683631896973, "num_tokens": 79026185.0, "step": 45550 }, { "entropy": 5.925047445297241, "epoch": 3.5443298969072163, "grad_norm": 1.3828125, "learning_rate": 0.00037753291201145375, "loss": 5.0153, "mean_token_accuracy": 0.20147063881158828, "num_tokens": 79034076.0, "step": 45555 }, { "entropy": 5.89366397857666, "epoch": 3.544718926278934, "grad_norm": 1.359375, "learning_rate": 0.0003775082406887305, "loss": 4.9861, "mean_token_accuracy": 0.19643015414476395, "num_tokens": 79042519.0, "step": 45560 }, { "entropy": 5.884097766876221, "epoch": 3.5451079556506517, "grad_norm": 1.515625, "learning_rate": 0.00037748356781060785, "loss": 5.0406, "mean_token_accuracy": 0.2060250833630562, "num_tokens": 79050316.0, "step": 45565 }, { "entropy": 5.84866156578064, "epoch": 3.5454969850223694, "grad_norm": 1.328125, "learning_rate": 0.0003774588933774602, "loss": 5.0111, "mean_token_accuracy": 0.20687042623758317, "num_tokens": 79059378.0, "step": 45570 }, { "entropy": 5.833556175231934, "epoch": 3.5458860143940867, "grad_norm": 1.359375, "learning_rate": 0.0003774342173896619, "loss": 4.9674, "mean_token_accuracy": 0.2077896162867546, "num_tokens": 79068241.0, "step": 45575 }, { "entropy": 5.928825378417969, "epoch": 3.5462750437658044, "grad_norm": 1.390625, "learning_rate": 0.00037740953984758736, "loss": 4.9677, "mean_token_accuracy": 0.20532742589712144, "num_tokens": 79077033.0, "step": 45580 }, { "entropy": 5.8090461730957035, "epoch": 3.5466640731375216, "grad_norm": 1.359375, "learning_rate": 0.0003773848607516111, "loss": 4.9549, "mean_token_accuracy": 0.2114281475543976, "num_tokens": 79086927.0, "step": 45585 }, { "entropy": 5.9639427185058596, "epoch": 3.5470531025092393, "grad_norm": 1.296875, "learning_rate": 0.0003773601801021075, "loss": 5.1813, "mean_token_accuracy": 0.19972584396600723, "num_tokens": 79095593.0, "step": 45590 }, { "entropy": 5.911545944213867, "epoch": 3.547442131880957, "grad_norm": 1.296875, "learning_rate": 0.0003773354978994512, "loss": 4.9697, "mean_token_accuracy": 0.21421399861574172, "num_tokens": 79104173.0, "step": 45595 }, { "entropy": 5.925880002975464, "epoch": 3.5478311612526747, "grad_norm": 1.3125, "learning_rate": 0.00037731081414401653, "loss": 5.0099, "mean_token_accuracy": 0.2088039994239807, "num_tokens": 79112728.0, "step": 45600 }, { "entropy": 5.90098614692688, "epoch": 3.548220190624392, "grad_norm": 1.296875, "learning_rate": 0.00037728612883617806, "loss": 5.0307, "mean_token_accuracy": 0.20740415900945663, "num_tokens": 79121488.0, "step": 45605 }, { "entropy": 5.878537321090699, "epoch": 3.5486092199961097, "grad_norm": 1.3984375, "learning_rate": 0.0003772614419763104, "loss": 4.9203, "mean_token_accuracy": 0.21487898975610734, "num_tokens": 79130411.0, "step": 45610 }, { "entropy": 5.8762133598327635, "epoch": 3.5489982493678274, "grad_norm": 1.21875, "learning_rate": 0.0003772367535647882, "loss": 4.926, "mean_token_accuracy": 0.2152986854314804, "num_tokens": 79139943.0, "step": 45615 }, { "entropy": 5.846447610855103, "epoch": 3.5493872787395446, "grad_norm": 1.3671875, "learning_rate": 0.00037721206360198596, "loss": 4.858, "mean_token_accuracy": 0.21627771556377412, "num_tokens": 79148478.0, "step": 45620 }, { "entropy": 5.826213407516479, "epoch": 3.5497763081112623, "grad_norm": 1.4296875, "learning_rate": 0.0003771873720882783, "loss": 4.9745, "mean_token_accuracy": 0.21221626549959183, "num_tokens": 79156390.0, "step": 45625 }, { "entropy": 5.800556707382202, "epoch": 3.55016533748298, "grad_norm": 1.1953125, "learning_rate": 0.00037716267902403996, "loss": 4.9465, "mean_token_accuracy": 0.21528827100992204, "num_tokens": 79165603.0, "step": 45630 }, { "entropy": 5.860878372192383, "epoch": 3.5505543668546977, "grad_norm": 1.46875, "learning_rate": 0.0003771379844096456, "loss": 5.0019, "mean_token_accuracy": 0.20813124775886535, "num_tokens": 79174529.0, "step": 45635 }, { "entropy": 5.857524490356445, "epoch": 3.550943396226415, "grad_norm": 1.3203125, "learning_rate": 0.0003771132882454698, "loss": 4.9351, "mean_token_accuracy": 0.2114263191819191, "num_tokens": 79183127.0, "step": 45640 }, { "entropy": 5.85979700088501, "epoch": 3.5513324255981327, "grad_norm": 1.28125, "learning_rate": 0.0003770885905318874, "loss": 4.961, "mean_token_accuracy": 0.2104208290576935, "num_tokens": 79192057.0, "step": 45645 }, { "entropy": 5.875337743759156, "epoch": 3.5517214549698504, "grad_norm": 1.5, "learning_rate": 0.0003770638912692732, "loss": 4.9579, "mean_token_accuracy": 0.21083979159593583, "num_tokens": 79200354.0, "step": 45650 }, { "entropy": 5.859758472442627, "epoch": 3.5521104843415676, "grad_norm": 1.5390625, "learning_rate": 0.0003770391904580019, "loss": 4.9819, "mean_token_accuracy": 0.2142678201198578, "num_tokens": 79209456.0, "step": 45655 }, { "entropy": 5.8424718379974365, "epoch": 3.5524995137132853, "grad_norm": 1.34375, "learning_rate": 0.0003770144880984482, "loss": 5.0202, "mean_token_accuracy": 0.20960631668567659, "num_tokens": 79217737.0, "step": 45660 }, { "entropy": 5.941015529632568, "epoch": 3.552888543085003, "grad_norm": 1.421875, "learning_rate": 0.00037698978419098704, "loss": 5.0676, "mean_token_accuracy": 0.20829030871391296, "num_tokens": 79225501.0, "step": 45665 }, { "entropy": 5.860081958770752, "epoch": 3.5532775724567207, "grad_norm": 1.203125, "learning_rate": 0.00037696507873599336, "loss": 5.0178, "mean_token_accuracy": 0.21263686269521714, "num_tokens": 79235518.0, "step": 45670 }, { "entropy": 5.822968482971191, "epoch": 3.553666601828438, "grad_norm": 1.3046875, "learning_rate": 0.00037694037173384177, "loss": 4.9859, "mean_token_accuracy": 0.21790971457958222, "num_tokens": 79244876.0, "step": 45675 }, { "entropy": 5.873045253753662, "epoch": 3.5540556312001557, "grad_norm": 1.375, "learning_rate": 0.0003769156631849074, "loss": 4.9962, "mean_token_accuracy": 0.20969051122665405, "num_tokens": 79252720.0, "step": 45680 }, { "entropy": 5.862482786178589, "epoch": 3.554444660571873, "grad_norm": 1.2890625, "learning_rate": 0.000376890953089565, "loss": 4.9536, "mean_token_accuracy": 0.21131736934185028, "num_tokens": 79260891.0, "step": 45685 }, { "entropy": 5.889886713027954, "epoch": 3.5548336899435906, "grad_norm": 1.25, "learning_rate": 0.0003768662414481895, "loss": 5.0564, "mean_token_accuracy": 0.21019736230373381, "num_tokens": 79269649.0, "step": 45690 }, { "entropy": 5.870569562911987, "epoch": 3.5552227193153083, "grad_norm": 1.328125, "learning_rate": 0.00037684152826115595, "loss": 5.0073, "mean_token_accuracy": 0.20639795511960984, "num_tokens": 79278598.0, "step": 45695 }, { "entropy": 5.8846289157867435, "epoch": 3.555611748687026, "grad_norm": 1.3359375, "learning_rate": 0.0003768168135288394, "loss": 4.969, "mean_token_accuracy": 0.2163334757089615, "num_tokens": 79287457.0, "step": 45700 }, { "entropy": 5.867749404907227, "epoch": 3.5560007780587437, "grad_norm": 1.3828125, "learning_rate": 0.0003767920972516147, "loss": 4.8698, "mean_token_accuracy": 0.22301874160766602, "num_tokens": 79296157.0, "step": 45705 }, { "entropy": 5.77487154006958, "epoch": 3.556389807430461, "grad_norm": 1.2109375, "learning_rate": 0.00037676737942985697, "loss": 4.9207, "mean_token_accuracy": 0.21886297762393953, "num_tokens": 79304784.0, "step": 45710 }, { "entropy": 5.844782924652099, "epoch": 3.5567788368021787, "grad_norm": 1.3515625, "learning_rate": 0.00037674266006394123, "loss": 5.0513, "mean_token_accuracy": 0.2003174051642418, "num_tokens": 79313442.0, "step": 45715 }, { "entropy": 5.900986003875732, "epoch": 3.557167866173896, "grad_norm": 1.4296875, "learning_rate": 0.00037671793915424254, "loss": 5.0011, "mean_token_accuracy": 0.21074083298444748, "num_tokens": 79322191.0, "step": 45720 }, { "entropy": 5.922296619415283, "epoch": 3.5575568955456136, "grad_norm": 1.453125, "learning_rate": 0.000376693216701136, "loss": 5.0206, "mean_token_accuracy": 0.20228171050548555, "num_tokens": 79330505.0, "step": 45725 }, { "entropy": 5.911898279190064, "epoch": 3.5579459249173313, "grad_norm": 1.3671875, "learning_rate": 0.0003766684927049968, "loss": 5.0356, "mean_token_accuracy": 0.21892029941082, "num_tokens": 79339519.0, "step": 45730 }, { "entropy": 5.820607614517212, "epoch": 3.558334954289049, "grad_norm": 1.328125, "learning_rate": 0.0003766437671662, "loss": 4.9757, "mean_token_accuracy": 0.20914221853017806, "num_tokens": 79348177.0, "step": 45735 }, { "entropy": 5.732741117477417, "epoch": 3.5587239836607663, "grad_norm": 1.3359375, "learning_rate": 0.0003766190400851209, "loss": 4.888, "mean_token_accuracy": 0.21921923905611038, "num_tokens": 79357243.0, "step": 45740 }, { "entropy": 5.893880605697632, "epoch": 3.559113013032484, "grad_norm": 1.4453125, "learning_rate": 0.0003765943114621345, "loss": 4.9873, "mean_token_accuracy": 0.20770905464887618, "num_tokens": 79365299.0, "step": 45745 }, { "entropy": 5.85505256652832, "epoch": 3.5595020424042016, "grad_norm": 1.3515625, "learning_rate": 0.00037656958129761626, "loss": 4.9694, "mean_token_accuracy": 0.21364941149950029, "num_tokens": 79373567.0, "step": 45750 }, { "entropy": 5.797436761856079, "epoch": 3.559891071775919, "grad_norm": 1.2734375, "learning_rate": 0.00037654484959194126, "loss": 4.9996, "mean_token_accuracy": 0.19979981631040572, "num_tokens": 79383090.0, "step": 45755 }, { "entropy": 5.8583417415618895, "epoch": 3.5602801011476366, "grad_norm": 1.2578125, "learning_rate": 0.00037652011634548466, "loss": 4.9353, "mean_token_accuracy": 0.2106696382164955, "num_tokens": 79391522.0, "step": 45760 }, { "entropy": 5.8792425155639645, "epoch": 3.5606691305193543, "grad_norm": 1.3984375, "learning_rate": 0.000376495381558622, "loss": 4.9926, "mean_token_accuracy": 0.21427711099386215, "num_tokens": 79399644.0, "step": 45765 }, { "entropy": 5.832421207427979, "epoch": 3.561058159891072, "grad_norm": 1.375, "learning_rate": 0.0003764706452317284, "loss": 4.9215, "mean_token_accuracy": 0.22437880039215088, "num_tokens": 79408029.0, "step": 45770 }, { "entropy": 5.723764133453369, "epoch": 3.5614471892627892, "grad_norm": 1.3984375, "learning_rate": 0.00037644590736517935, "loss": 4.8325, "mean_token_accuracy": 0.21959281712770462, "num_tokens": 79415917.0, "step": 45775 }, { "entropy": 5.804325008392334, "epoch": 3.561836218634507, "grad_norm": 1.3828125, "learning_rate": 0.0003764211679593501, "loss": 5.0225, "mean_token_accuracy": 0.20635680854320526, "num_tokens": 79425122.0, "step": 45780 }, { "entropy": 5.8740379333496096, "epoch": 3.562225248006224, "grad_norm": 1.3203125, "learning_rate": 0.00037639642701461603, "loss": 4.8946, "mean_token_accuracy": 0.21563945412635804, "num_tokens": 79433319.0, "step": 45785 }, { "entropy": 5.888499927520752, "epoch": 3.562614277377942, "grad_norm": 1.1953125, "learning_rate": 0.0003763716845313526, "loss": 4.9937, "mean_token_accuracy": 0.2124168172478676, "num_tokens": 79442027.0, "step": 45790 }, { "entropy": 5.851191568374634, "epoch": 3.5630033067496596, "grad_norm": 1.390625, "learning_rate": 0.0003763469405099352, "loss": 4.9094, "mean_token_accuracy": 0.21054278761148454, "num_tokens": 79450449.0, "step": 45795 }, { "entropy": 5.78983588218689, "epoch": 3.5633923361213773, "grad_norm": 1.2578125, "learning_rate": 0.0003763221949507392, "loss": 4.9317, "mean_token_accuracy": 0.21200930923223496, "num_tokens": 79459416.0, "step": 45800 }, { "entropy": 5.820954513549805, "epoch": 3.563781365493095, "grad_norm": 1.2265625, "learning_rate": 0.00037629744785414027, "loss": 4.9305, "mean_token_accuracy": 0.21047134548425675, "num_tokens": 79468906.0, "step": 45805 }, { "entropy": 5.904242897033692, "epoch": 3.5641703948648122, "grad_norm": 1.3359375, "learning_rate": 0.00037627269922051377, "loss": 5.0217, "mean_token_accuracy": 0.20674313604831696, "num_tokens": 79478472.0, "step": 45810 }, { "entropy": 5.876113224029541, "epoch": 3.56455942423653, "grad_norm": 1.34375, "learning_rate": 0.00037624794905023523, "loss": 4.9644, "mean_token_accuracy": 0.21913743168115615, "num_tokens": 79486418.0, "step": 45815 }, { "entropy": 5.907744121551514, "epoch": 3.564948453608247, "grad_norm": 1.3515625, "learning_rate": 0.0003762231973436802, "loss": 5.008, "mean_token_accuracy": 0.20920095443725586, "num_tokens": 79495238.0, "step": 45820 }, { "entropy": 5.8446667194366455, "epoch": 3.565337482979965, "grad_norm": 1.265625, "learning_rate": 0.0003761984441012243, "loss": 4.9033, "mean_token_accuracy": 0.22427387684583663, "num_tokens": 79504136.0, "step": 45825 }, { "entropy": 5.952948522567749, "epoch": 3.5657265123516826, "grad_norm": 1.3515625, "learning_rate": 0.0003761736893232431, "loss": 5.1032, "mean_token_accuracy": 0.20073896646499634, "num_tokens": 79513013.0, "step": 45830 }, { "entropy": 5.823034000396729, "epoch": 3.5661155417234003, "grad_norm": 1.265625, "learning_rate": 0.00037614893301011223, "loss": 5.0837, "mean_token_accuracy": 0.20065441876649856, "num_tokens": 79521930.0, "step": 45835 }, { "entropy": 5.836878490447998, "epoch": 3.5665045710951175, "grad_norm": 1.3984375, "learning_rate": 0.0003761241751622072, "loss": 4.9544, "mean_token_accuracy": 0.21930686980485917, "num_tokens": 79530596.0, "step": 45840 }, { "entropy": 5.828778696060181, "epoch": 3.5668936004668352, "grad_norm": 1.3671875, "learning_rate": 0.0003760994157799038, "loss": 4.9503, "mean_token_accuracy": 0.21095447689294816, "num_tokens": 79539145.0, "step": 45845 }, { "entropy": 5.8811522960662845, "epoch": 3.567282629838553, "grad_norm": 1.3203125, "learning_rate": 0.0003760746548635777, "loss": 4.9085, "mean_token_accuracy": 0.2207944467663765, "num_tokens": 79548041.0, "step": 45850 }, { "entropy": 5.881802368164062, "epoch": 3.56767165921027, "grad_norm": 1.328125, "learning_rate": 0.0003760498924136046, "loss": 5.0722, "mean_token_accuracy": 0.20737486481666564, "num_tokens": 79557302.0, "step": 45855 }, { "entropy": 5.791285371780395, "epoch": 3.568060688581988, "grad_norm": 1.2890625, "learning_rate": 0.00037602512843036025, "loss": 4.9008, "mean_token_accuracy": 0.21256273090839387, "num_tokens": 79565718.0, "step": 45860 }, { "entropy": 5.823634672164917, "epoch": 3.5684497179537056, "grad_norm": 1.359375, "learning_rate": 0.0003760003629142203, "loss": 4.8755, "mean_token_accuracy": 0.2139604791998863, "num_tokens": 79573561.0, "step": 45865 }, { "entropy": 5.862139081954956, "epoch": 3.5688387473254233, "grad_norm": 1.296875, "learning_rate": 0.00037597559586556063, "loss": 4.8538, "mean_token_accuracy": 0.22195274382829666, "num_tokens": 79582492.0, "step": 45870 }, { "entropy": 5.943076276779175, "epoch": 3.5692277766971405, "grad_norm": 1.3359375, "learning_rate": 0.000375950827284757, "loss": 5.0549, "mean_token_accuracy": 0.20898479223251343, "num_tokens": 79591244.0, "step": 45875 }, { "entropy": 5.896769762039185, "epoch": 3.5696168060688582, "grad_norm": 1.328125, "learning_rate": 0.00037592605717218523, "loss": 5.0799, "mean_token_accuracy": 0.20008875727653502, "num_tokens": 79599718.0, "step": 45880 }, { "entropy": 5.858865737915039, "epoch": 3.570005835440576, "grad_norm": 1.3984375, "learning_rate": 0.00037590128552822123, "loss": 4.8925, "mean_token_accuracy": 0.2194092407822609, "num_tokens": 79607408.0, "step": 45885 }, { "entropy": 5.914982843399048, "epoch": 3.570394864812293, "grad_norm": 1.265625, "learning_rate": 0.0003758765123532407, "loss": 5.0348, "mean_token_accuracy": 0.20701408833265306, "num_tokens": 79616033.0, "step": 45890 }, { "entropy": 5.89799485206604, "epoch": 3.570783894184011, "grad_norm": 1.2578125, "learning_rate": 0.0003758517376476198, "loss": 5.0472, "mean_token_accuracy": 0.20917126834392546, "num_tokens": 79625512.0, "step": 45895 }, { "entropy": 5.8384157657623295, "epoch": 3.5711729235557286, "grad_norm": 1.296875, "learning_rate": 0.00037582696141173435, "loss": 4.9576, "mean_token_accuracy": 0.21272702664136886, "num_tokens": 79635429.0, "step": 45900 }, { "entropy": 5.859475231170654, "epoch": 3.5715619529274463, "grad_norm": 1.421875, "learning_rate": 0.00037580218364596015, "loss": 4.8545, "mean_token_accuracy": 0.22064073830842973, "num_tokens": 79643778.0, "step": 45905 }, { "entropy": 5.8814873695373535, "epoch": 3.5719509822991635, "grad_norm": 1.3203125, "learning_rate": 0.00037577740435067327, "loss": 4.9795, "mean_token_accuracy": 0.20763864666223525, "num_tokens": 79652203.0, "step": 45910 }, { "entropy": 5.882450294494629, "epoch": 3.572340011670881, "grad_norm": 1.375, "learning_rate": 0.00037575262352624965, "loss": 4.9784, "mean_token_accuracy": 0.20885082334280014, "num_tokens": 79660891.0, "step": 45915 }, { "entropy": 5.834826231002808, "epoch": 3.5727290410425985, "grad_norm": 1.3828125, "learning_rate": 0.00037572784117306535, "loss": 5.006, "mean_token_accuracy": 0.2111694797873497, "num_tokens": 79669489.0, "step": 45920 }, { "entropy": 5.878077363967895, "epoch": 3.573118070414316, "grad_norm": 1.3515625, "learning_rate": 0.0003757030572914963, "loss": 4.9334, "mean_token_accuracy": 0.2153889462351799, "num_tokens": 79678167.0, "step": 45925 }, { "entropy": 5.940540599822998, "epoch": 3.573507099786034, "grad_norm": 1.28125, "learning_rate": 0.0003756782718819188, "loss": 5.0094, "mean_token_accuracy": 0.2104715123772621, "num_tokens": 79686202.0, "step": 45930 }, { "entropy": 5.864874219894409, "epoch": 3.5738961291577516, "grad_norm": 1.328125, "learning_rate": 0.00037565348494470873, "loss": 5.0227, "mean_token_accuracy": 0.20707044899463653, "num_tokens": 79694187.0, "step": 45935 }, { "entropy": 5.7899213314056395, "epoch": 3.574285158529469, "grad_norm": 1.2265625, "learning_rate": 0.0003756286964802422, "loss": 4.9713, "mean_token_accuracy": 0.21531477719545364, "num_tokens": 79702898.0, "step": 45940 }, { "entropy": 5.92048921585083, "epoch": 3.5746741879011865, "grad_norm": 1.4921875, "learning_rate": 0.0003756039064888954, "loss": 5.0563, "mean_token_accuracy": 0.19817824214696883, "num_tokens": 79712122.0, "step": 45945 }, { "entropy": 5.875470399856567, "epoch": 3.575063217272904, "grad_norm": 1.2890625, "learning_rate": 0.0003755791149710444, "loss": 4.9565, "mean_token_accuracy": 0.2159022495150566, "num_tokens": 79720623.0, "step": 45950 }, { "entropy": 5.877656173706055, "epoch": 3.5754522466446215, "grad_norm": 1.28125, "learning_rate": 0.00037555432192706547, "loss": 5.0122, "mean_token_accuracy": 0.21374149471521378, "num_tokens": 79729750.0, "step": 45955 }, { "entropy": 5.866694164276123, "epoch": 3.575841276016339, "grad_norm": 1.3203125, "learning_rate": 0.00037552952735733466, "loss": 4.9193, "mean_token_accuracy": 0.22105976343154907, "num_tokens": 79738485.0, "step": 45960 }, { "entropy": 5.944686937332153, "epoch": 3.576230305388057, "grad_norm": 1.40625, "learning_rate": 0.0003755047312622283, "loss": 5.1587, "mean_token_accuracy": 0.20127062946558, "num_tokens": 79747378.0, "step": 45965 }, { "entropy": 5.920019102096558, "epoch": 3.5766193347597746, "grad_norm": 1.296875, "learning_rate": 0.00037547993364212267, "loss": 5.0131, "mean_token_accuracy": 0.21087877750396727, "num_tokens": 79756106.0, "step": 45970 }, { "entropy": 5.891671752929687, "epoch": 3.577008364131492, "grad_norm": 1.359375, "learning_rate": 0.000375455134497394, "loss": 4.9735, "mean_token_accuracy": 0.21524260342121124, "num_tokens": 79764347.0, "step": 45975 }, { "entropy": 5.811753797531128, "epoch": 3.5773973935032095, "grad_norm": 1.4453125, "learning_rate": 0.0003754303338284186, "loss": 4.9463, "mean_token_accuracy": 0.21230557411909104, "num_tokens": 79772811.0, "step": 45980 }, { "entropy": 5.864470481872559, "epoch": 3.577786422874927, "grad_norm": 1.4375, "learning_rate": 0.00037540553163557263, "loss": 5.0355, "mean_token_accuracy": 0.21046366542577744, "num_tokens": 79781968.0, "step": 45985 }, { "entropy": 5.923332643508911, "epoch": 3.5781754522466445, "grad_norm": 1.375, "learning_rate": 0.00037538072791923257, "loss": 5.0408, "mean_token_accuracy": 0.21181668788194657, "num_tokens": 79790289.0, "step": 45990 }, { "entropy": 5.898117017745972, "epoch": 3.578564481618362, "grad_norm": 1.390625, "learning_rate": 0.00037535592267977467, "loss": 5.0148, "mean_token_accuracy": 0.20468965768814087, "num_tokens": 79799007.0, "step": 45995 }, { "entropy": 5.865650033950805, "epoch": 3.57895351099008, "grad_norm": 1.3515625, "learning_rate": 0.0003753311159175754, "loss": 5.0035, "mean_token_accuracy": 0.20628161281347274, "num_tokens": 79807445.0, "step": 46000 }, { "entropy": 5.880518007278442, "epoch": 3.5793425403617976, "grad_norm": 1.3828125, "learning_rate": 0.00037530630763301113, "loss": 5.0714, "mean_token_accuracy": 0.2052274152636528, "num_tokens": 79817169.0, "step": 46005 }, { "entropy": 5.875416564941406, "epoch": 3.579731569733515, "grad_norm": 1.390625, "learning_rate": 0.0003752814978264584, "loss": 4.9019, "mean_token_accuracy": 0.20770440697669984, "num_tokens": 79825491.0, "step": 46010 }, { "entropy": 5.961150979995727, "epoch": 3.5801205991052325, "grad_norm": 1.4609375, "learning_rate": 0.0003752566864982934, "loss": 5.0189, "mean_token_accuracy": 0.20848783254623413, "num_tokens": 79833904.0, "step": 46015 }, { "entropy": 5.879149675369263, "epoch": 3.5805096284769498, "grad_norm": 1.4609375, "learning_rate": 0.00037523187364889293, "loss": 5.024, "mean_token_accuracy": 0.1999804899096489, "num_tokens": 79842778.0, "step": 46020 }, { "entropy": 5.868411731719971, "epoch": 3.5808986578486675, "grad_norm": 1.46875, "learning_rate": 0.0003752070592786332, "loss": 4.9591, "mean_token_accuracy": 0.21574199944734573, "num_tokens": 79851175.0, "step": 46025 }, { "entropy": 5.854500770568848, "epoch": 3.581287687220385, "grad_norm": 1.203125, "learning_rate": 0.00037518224338789084, "loss": 4.9602, "mean_token_accuracy": 0.21392289847135543, "num_tokens": 79860509.0, "step": 46030 }, { "entropy": 5.901912689208984, "epoch": 3.581676716592103, "grad_norm": 1.3359375, "learning_rate": 0.0003751574259770424, "loss": 5.0284, "mean_token_accuracy": 0.20559228360652923, "num_tokens": 79869405.0, "step": 46035 }, { "entropy": 5.856354427337647, "epoch": 3.58206574596382, "grad_norm": 1.3125, "learning_rate": 0.0003751326070464645, "loss": 4.9914, "mean_token_accuracy": 0.212415511906147, "num_tokens": 79877929.0, "step": 46040 }, { "entropy": 5.941971969604492, "epoch": 3.582454775335538, "grad_norm": 1.4140625, "learning_rate": 0.0003751077865965337, "loss": 5.0289, "mean_token_accuracy": 0.2112569361925125, "num_tokens": 79885860.0, "step": 46045 }, { "entropy": 5.895830154418945, "epoch": 3.5828438047072555, "grad_norm": 1.3203125, "learning_rate": 0.00037508296462762647, "loss": 4.969, "mean_token_accuracy": 0.20711284577846528, "num_tokens": 79894031.0, "step": 46050 }, { "entropy": 5.829115152359009, "epoch": 3.5832328340789728, "grad_norm": 1.3125, "learning_rate": 0.00037505814114011956, "loss": 4.9093, "mean_token_accuracy": 0.21497206538915634, "num_tokens": 79902228.0, "step": 46055 }, { "entropy": 5.845581293106079, "epoch": 3.5836218634506904, "grad_norm": 1.234375, "learning_rate": 0.00037503331613438965, "loss": 4.9639, "mean_token_accuracy": 0.21814270168542862, "num_tokens": 79911195.0, "step": 46060 }, { "entropy": 5.878824090957641, "epoch": 3.584010892822408, "grad_norm": 1.3984375, "learning_rate": 0.00037500848961081334, "loss": 4.9715, "mean_token_accuracy": 0.20980352610349656, "num_tokens": 79919844.0, "step": 46065 }, { "entropy": 5.881328773498535, "epoch": 3.584399922194126, "grad_norm": 1.453125, "learning_rate": 0.00037498366156976746, "loss": 4.9134, "mean_token_accuracy": 0.21261506527662277, "num_tokens": 79927925.0, "step": 46070 }, { "entropy": 5.866397285461426, "epoch": 3.584788951565843, "grad_norm": 1.1953125, "learning_rate": 0.00037495883201162854, "loss": 5.068, "mean_token_accuracy": 0.20412982404232025, "num_tokens": 79937517.0, "step": 46075 }, { "entropy": 5.807900381088257, "epoch": 3.585177980937561, "grad_norm": 1.2421875, "learning_rate": 0.0003749340009367736, "loss": 4.9448, "mean_token_accuracy": 0.21405884325504304, "num_tokens": 79946203.0, "step": 46080 }, { "entropy": 5.883450174331665, "epoch": 3.5855670103092785, "grad_norm": 1.4609375, "learning_rate": 0.00037490916834557916, "loss": 4.9274, "mean_token_accuracy": 0.21738828122615814, "num_tokens": 79954216.0, "step": 46085 }, { "entropy": 5.85238995552063, "epoch": 3.5859560396809957, "grad_norm": 1.3359375, "learning_rate": 0.0003748843342384221, "loss": 4.984, "mean_token_accuracy": 0.21415503770112992, "num_tokens": 79962420.0, "step": 46090 }, { "entropy": 5.875460910797119, "epoch": 3.5863450690527134, "grad_norm": 1.2734375, "learning_rate": 0.00037485949861567925, "loss": 4.9979, "mean_token_accuracy": 0.20908914208412172, "num_tokens": 79971650.0, "step": 46095 }, { "entropy": 5.866400909423828, "epoch": 3.586734098424431, "grad_norm": 1.25, "learning_rate": 0.0003748346614777275, "loss": 4.9942, "mean_token_accuracy": 0.20947646498680114, "num_tokens": 79980046.0, "step": 46100 }, { "entropy": 5.857568597793579, "epoch": 3.587123127796149, "grad_norm": 1.34375, "learning_rate": 0.0003748098228249437, "loss": 4.9045, "mean_token_accuracy": 0.21181931644678115, "num_tokens": 79988257.0, "step": 46105 }, { "entropy": 5.849348831176758, "epoch": 3.587512157167866, "grad_norm": 1.4375, "learning_rate": 0.00037478498265770463, "loss": 4.9233, "mean_token_accuracy": 0.21124979853630066, "num_tokens": 79996982.0, "step": 46110 }, { "entropy": 5.8945395946502686, "epoch": 3.587901186539584, "grad_norm": 1.28125, "learning_rate": 0.0003747601409763872, "loss": 5.0619, "mean_token_accuracy": 0.20623077899217607, "num_tokens": 80006309.0, "step": 46115 }, { "entropy": 5.883035802841187, "epoch": 3.588290215911301, "grad_norm": 1.3203125, "learning_rate": 0.00037473529778136853, "loss": 4.9779, "mean_token_accuracy": 0.2090377241373062, "num_tokens": 80015082.0, "step": 46120 }, { "entropy": 5.840625858306884, "epoch": 3.5886792452830187, "grad_norm": 1.3046875, "learning_rate": 0.00037471045307302544, "loss": 4.8835, "mean_token_accuracy": 0.2141177996993065, "num_tokens": 80023469.0, "step": 46125 }, { "entropy": 5.88462266921997, "epoch": 3.5890682746547364, "grad_norm": 1.5, "learning_rate": 0.00037468560685173497, "loss": 4.983, "mean_token_accuracy": 0.21068092286586762, "num_tokens": 80033359.0, "step": 46130 }, { "entropy": 5.808923053741455, "epoch": 3.589457304026454, "grad_norm": 1.3984375, "learning_rate": 0.000374660759117874, "loss": 4.8563, "mean_token_accuracy": 0.2218080699443817, "num_tokens": 80042182.0, "step": 46135 }, { "entropy": 5.828692245483398, "epoch": 3.589846333398172, "grad_norm": 1.3828125, "learning_rate": 0.00037463590987181966, "loss": 4.9878, "mean_token_accuracy": 0.21008822917938233, "num_tokens": 80050372.0, "step": 46140 }, { "entropy": 5.808371639251709, "epoch": 3.590235362769889, "grad_norm": 1.484375, "learning_rate": 0.00037461105911394904, "loss": 4.8537, "mean_token_accuracy": 0.2209500104188919, "num_tokens": 80058001.0, "step": 46145 }, { "entropy": 5.822599935531616, "epoch": 3.590624392141607, "grad_norm": 1.3203125, "learning_rate": 0.00037458620684463907, "loss": 4.9506, "mean_token_accuracy": 0.21376388370990754, "num_tokens": 80066549.0, "step": 46150 }, { "entropy": 5.795543670654297, "epoch": 3.591013421513324, "grad_norm": 1.25, "learning_rate": 0.00037456135306426693, "loss": 4.8379, "mean_token_accuracy": 0.21953493356704712, "num_tokens": 80075316.0, "step": 46155 }, { "entropy": 5.898145627975464, "epoch": 3.5914024508850417, "grad_norm": 1.34375, "learning_rate": 0.0003745364977732097, "loss": 5.0464, "mean_token_accuracy": 0.2096621200442314, "num_tokens": 80083644.0, "step": 46160 }, { "entropy": 5.875305271148681, "epoch": 3.5917914802567594, "grad_norm": 1.3046875, "learning_rate": 0.0003745116409718446, "loss": 4.9276, "mean_token_accuracy": 0.21191998124122619, "num_tokens": 80092266.0, "step": 46165 }, { "entropy": 5.925926351547242, "epoch": 3.592180509628477, "grad_norm": 1.34375, "learning_rate": 0.0003744867826605488, "loss": 4.9692, "mean_token_accuracy": 0.21589736342430116, "num_tokens": 80101039.0, "step": 46170 }, { "entropy": 5.827014970779419, "epoch": 3.5925695390001944, "grad_norm": 1.4453125, "learning_rate": 0.0003744619228396993, "loss": 4.952, "mean_token_accuracy": 0.2111702173948288, "num_tokens": 80109210.0, "step": 46175 }, { "entropy": 5.8238622665405275, "epoch": 3.592958568371912, "grad_norm": 1.2578125, "learning_rate": 0.0003744370615096734, "loss": 4.9237, "mean_token_accuracy": 0.21691021621227263, "num_tokens": 80118438.0, "step": 46180 }, { "entropy": 5.901769971847534, "epoch": 3.5933475977436298, "grad_norm": 1.3671875, "learning_rate": 0.0003744121986708485, "loss": 4.958, "mean_token_accuracy": 0.2069777473807335, "num_tokens": 80126363.0, "step": 46185 }, { "entropy": 5.906550884246826, "epoch": 3.593736627115347, "grad_norm": 1.375, "learning_rate": 0.00037438733432360163, "loss": 4.9411, "mean_token_accuracy": 0.21050717681646347, "num_tokens": 80134186.0, "step": 46190 }, { "entropy": 5.849613046646118, "epoch": 3.5941256564870647, "grad_norm": 1.3046875, "learning_rate": 0.0003743624684683102, "loss": 4.994, "mean_token_accuracy": 0.2044980674982071, "num_tokens": 80141881.0, "step": 46195 }, { "entropy": 5.857237911224365, "epoch": 3.5945146858587824, "grad_norm": 1.296875, "learning_rate": 0.0003743376011053514, "loss": 5.0656, "mean_token_accuracy": 0.20415599197149276, "num_tokens": 80150047.0, "step": 46200 }, { "entropy": 5.8955518245697025, "epoch": 3.5949037152305, "grad_norm": 1.4140625, "learning_rate": 0.00037431273223510265, "loss": 4.9892, "mean_token_accuracy": 0.20903924554586412, "num_tokens": 80158126.0, "step": 46205 }, { "entropy": 5.886825323104858, "epoch": 3.5952927446022174, "grad_norm": 1.25, "learning_rate": 0.0003742878618579413, "loss": 4.9813, "mean_token_accuracy": 0.20976168513298035, "num_tokens": 80167046.0, "step": 46210 }, { "entropy": 5.928079223632812, "epoch": 3.595681773973935, "grad_norm": 1.3046875, "learning_rate": 0.0003742629899742446, "loss": 5.0578, "mean_token_accuracy": 0.19952477663755416, "num_tokens": 80176296.0, "step": 46215 }, { "entropy": 5.869991683959961, "epoch": 3.5960708033456523, "grad_norm": 1.3515625, "learning_rate": 0.00037423811658439014, "loss": 4.935, "mean_token_accuracy": 0.21350838840007783, "num_tokens": 80184472.0, "step": 46220 }, { "entropy": 5.876732921600341, "epoch": 3.59645983271737, "grad_norm": 1.34375, "learning_rate": 0.00037421324168875503, "loss": 5.0123, "mean_token_accuracy": 0.2097334608435631, "num_tokens": 80193334.0, "step": 46225 }, { "entropy": 5.8576991081237795, "epoch": 3.5968488620890877, "grad_norm": 1.3125, "learning_rate": 0.000374188365287717, "loss": 5.0398, "mean_token_accuracy": 0.20874162912368774, "num_tokens": 80202633.0, "step": 46230 }, { "entropy": 5.880957984924317, "epoch": 3.5972378914608054, "grad_norm": 1.3125, "learning_rate": 0.0003741634873816534, "loss": 5.0024, "mean_token_accuracy": 0.20587234497070311, "num_tokens": 80211454.0, "step": 46235 }, { "entropy": 5.810548305511475, "epoch": 3.597626920832523, "grad_norm": 1.328125, "learning_rate": 0.00037413860797094175, "loss": 4.9428, "mean_token_accuracy": 0.21535708457231523, "num_tokens": 80219748.0, "step": 46240 }, { "entropy": 5.86266713142395, "epoch": 3.5980159502042404, "grad_norm": 1.2421875, "learning_rate": 0.00037411372705595947, "loss": 5.0881, "mean_token_accuracy": 0.20693282186985015, "num_tokens": 80229503.0, "step": 46245 }, { "entropy": 5.909901094436646, "epoch": 3.598404979575958, "grad_norm": 1.2421875, "learning_rate": 0.0003740888446370842, "loss": 4.9001, "mean_token_accuracy": 0.22200883477926253, "num_tokens": 80238432.0, "step": 46250 }, { "entropy": 5.887056589126587, "epoch": 3.5987940089476753, "grad_norm": 1.328125, "learning_rate": 0.0003740639607146933, "loss": 4.9253, "mean_token_accuracy": 0.21928769201040268, "num_tokens": 80247478.0, "step": 46255 }, { "entropy": 5.898938417434692, "epoch": 3.599183038319393, "grad_norm": 1.46875, "learning_rate": 0.00037403907528916455, "loss": 5.1106, "mean_token_accuracy": 0.20271747559309006, "num_tokens": 80256643.0, "step": 46260 }, { "entropy": 5.894898366928101, "epoch": 3.5995720676911107, "grad_norm": 1.2734375, "learning_rate": 0.0003740141883608755, "loss": 5.003, "mean_token_accuracy": 0.2050217017531395, "num_tokens": 80265351.0, "step": 46265 }, { "entropy": 5.858670043945312, "epoch": 3.5999610970628284, "grad_norm": 1.2109375, "learning_rate": 0.0003739892999302037, "loss": 4.9019, "mean_token_accuracy": 0.22504570484161376, "num_tokens": 80274698.0, "step": 46270 }, { "entropy": 5.849434852600098, "epoch": 3.6003501264345457, "grad_norm": 1.3515625, "learning_rate": 0.0003739644099975269, "loss": 4.9037, "mean_token_accuracy": 0.20673559606075287, "num_tokens": 80282763.0, "step": 46275 }, { "entropy": 5.879590749740601, "epoch": 3.6007391558062634, "grad_norm": 1.2578125, "learning_rate": 0.00037393951856322263, "loss": 5.0503, "mean_token_accuracy": 0.20671216696500777, "num_tokens": 80292095.0, "step": 46280 }, { "entropy": 5.862115716934204, "epoch": 3.601128185177981, "grad_norm": 1.3203125, "learning_rate": 0.0003739146256276686, "loss": 4.938, "mean_token_accuracy": 0.21387362033128737, "num_tokens": 80299897.0, "step": 46285 }, { "entropy": 5.823745059967041, "epoch": 3.6015172145496983, "grad_norm": 1.3203125, "learning_rate": 0.00037388973119124267, "loss": 5.0015, "mean_token_accuracy": 0.20010467022657394, "num_tokens": 80309371.0, "step": 46290 }, { "entropy": 5.828321075439453, "epoch": 3.601906243921416, "grad_norm": 1.359375, "learning_rate": 0.0003738648352543224, "loss": 4.9793, "mean_token_accuracy": 0.21129647493362427, "num_tokens": 80319177.0, "step": 46295 }, { "entropy": 5.871084547042846, "epoch": 3.6022952732931337, "grad_norm": 1.3515625, "learning_rate": 0.0003738399378172856, "loss": 4.9475, "mean_token_accuracy": 0.2121367871761322, "num_tokens": 80327618.0, "step": 46300 }, { "entropy": 5.876247692108154, "epoch": 3.6026843026648514, "grad_norm": 1.3046875, "learning_rate": 0.0003738150388805101, "loss": 5.023, "mean_token_accuracy": 0.20406688749790192, "num_tokens": 80336576.0, "step": 46305 }, { "entropy": 5.883008861541748, "epoch": 3.6030733320365687, "grad_norm": 1.515625, "learning_rate": 0.00037379013844437373, "loss": 4.9531, "mean_token_accuracy": 0.21754887998104094, "num_tokens": 80344614.0, "step": 46310 }, { "entropy": 5.92507905960083, "epoch": 3.6034623614082864, "grad_norm": 1.3125, "learning_rate": 0.00037376523650925415, "loss": 4.9815, "mean_token_accuracy": 0.20936556458473204, "num_tokens": 80353414.0, "step": 46315 }, { "entropy": 5.830273771286011, "epoch": 3.603851390780004, "grad_norm": 1.3359375, "learning_rate": 0.0003737403330755293, "loss": 5.0077, "mean_token_accuracy": 0.2048140600323677, "num_tokens": 80362472.0, "step": 46320 }, { "entropy": 5.893815517425537, "epoch": 3.6042404201517213, "grad_norm": 1.46875, "learning_rate": 0.0003737154281435771, "loss": 4.9847, "mean_token_accuracy": 0.21396642327308654, "num_tokens": 80370995.0, "step": 46325 }, { "entropy": 5.882711505889892, "epoch": 3.604629449523439, "grad_norm": 1.3984375, "learning_rate": 0.00037369052171377535, "loss": 5.0793, "mean_token_accuracy": 0.20336281210184098, "num_tokens": 80379725.0, "step": 46330 }, { "entropy": 5.875619840621948, "epoch": 3.6050184788951567, "grad_norm": 1.421875, "learning_rate": 0.0003736656137865021, "loss": 4.8821, "mean_token_accuracy": 0.21493092477321624, "num_tokens": 80388289.0, "step": 46335 }, { "entropy": 5.87822904586792, "epoch": 3.6054075082668744, "grad_norm": 1.328125, "learning_rate": 0.00037364070436213514, "loss": 4.9462, "mean_token_accuracy": 0.22077955305576324, "num_tokens": 80396293.0, "step": 46340 }, { "entropy": 5.85198130607605, "epoch": 3.6057965376385916, "grad_norm": 1.28125, "learning_rate": 0.0003736157934410525, "loss": 4.9908, "mean_token_accuracy": 0.21193979382514955, "num_tokens": 80405258.0, "step": 46345 }, { "entropy": 5.820558071136475, "epoch": 3.6061855670103093, "grad_norm": 1.28125, "learning_rate": 0.0003735908810236322, "loss": 4.8683, "mean_token_accuracy": 0.21868887096643447, "num_tokens": 80413198.0, "step": 46350 }, { "entropy": 5.848029518127442, "epoch": 3.6065745963820266, "grad_norm": 1.28125, "learning_rate": 0.00037356596711025214, "loss": 4.9496, "mean_token_accuracy": 0.2101803109049797, "num_tokens": 80421707.0, "step": 46355 }, { "entropy": 5.893310546875, "epoch": 3.6069636257537443, "grad_norm": 1.4296875, "learning_rate": 0.0003735410517012905, "loss": 5.0016, "mean_token_accuracy": 0.20872990489006044, "num_tokens": 80430207.0, "step": 46360 }, { "entropy": 5.9498326778411865, "epoch": 3.607352655125462, "grad_norm": 1.46875, "learning_rate": 0.0003735161347971252, "loss": 5.0181, "mean_token_accuracy": 0.20334067940711975, "num_tokens": 80439255.0, "step": 46365 }, { "entropy": 5.87770709991455, "epoch": 3.6077416844971797, "grad_norm": 1.375, "learning_rate": 0.0003734912163981344, "loss": 4.9488, "mean_token_accuracy": 0.21765171736478806, "num_tokens": 80447468.0, "step": 46370 }, { "entropy": 5.848084354400635, "epoch": 3.608130713868897, "grad_norm": 1.3046875, "learning_rate": 0.00037346629650469605, "loss": 5.0083, "mean_token_accuracy": 0.20012205988168716, "num_tokens": 80456496.0, "step": 46375 }, { "entropy": 5.91798620223999, "epoch": 3.6085197432406146, "grad_norm": 1.375, "learning_rate": 0.00037344137511718847, "loss": 5.0636, "mean_token_accuracy": 0.204497130215168, "num_tokens": 80465078.0, "step": 46380 }, { "entropy": 5.825898218154907, "epoch": 3.6089087726123323, "grad_norm": 1.3046875, "learning_rate": 0.00037341645223598965, "loss": 4.9661, "mean_token_accuracy": 0.21278919875621796, "num_tokens": 80473241.0, "step": 46385 }, { "entropy": 5.855575037002564, "epoch": 3.6092978019840496, "grad_norm": 1.3359375, "learning_rate": 0.00037339152786147777, "loss": 4.927, "mean_token_accuracy": 0.21428704559803008, "num_tokens": 80481487.0, "step": 46390 }, { "entropy": 5.87964129447937, "epoch": 3.6096868313557673, "grad_norm": 1.3828125, "learning_rate": 0.00037336660199403115, "loss": 4.975, "mean_token_accuracy": 0.21076726913452148, "num_tokens": 80489327.0, "step": 46395 }, { "entropy": 5.835446500778199, "epoch": 3.610075860727485, "grad_norm": 1.3359375, "learning_rate": 0.0003733416746340279, "loss": 5.0499, "mean_token_accuracy": 0.20607276111841202, "num_tokens": 80497597.0, "step": 46400 }, { "entropy": 5.914765882492065, "epoch": 3.6104648900992027, "grad_norm": 1.359375, "learning_rate": 0.0003733167457818463, "loss": 4.944, "mean_token_accuracy": 0.2136630743741989, "num_tokens": 80505734.0, "step": 46405 }, { "entropy": 5.87595944404602, "epoch": 3.61085391947092, "grad_norm": 1.2890625, "learning_rate": 0.0003732918154378645, "loss": 4.8539, "mean_token_accuracy": 0.21776183247566222, "num_tokens": 80514080.0, "step": 46410 }, { "entropy": 5.855459070205688, "epoch": 3.6112429488426376, "grad_norm": 1.4140625, "learning_rate": 0.00037326688360246087, "loss": 4.954, "mean_token_accuracy": 0.21237864196300507, "num_tokens": 80522748.0, "step": 46415 }, { "entropy": 5.90538592338562, "epoch": 3.6116319782143553, "grad_norm": 1.359375, "learning_rate": 0.0003732419502760137, "loss": 4.9146, "mean_token_accuracy": 0.21069543659687043, "num_tokens": 80531060.0, "step": 46420 }, { "entropy": 5.818411874771118, "epoch": 3.6120210075860726, "grad_norm": 1.359375, "learning_rate": 0.00037321701545890126, "loss": 4.9841, "mean_token_accuracy": 0.21415457725524903, "num_tokens": 80539317.0, "step": 46425 }, { "entropy": 5.898630428314209, "epoch": 3.6124100369577903, "grad_norm": 1.484375, "learning_rate": 0.0003731920791515019, "loss": 5.0122, "mean_token_accuracy": 0.20522041022777557, "num_tokens": 80548382.0, "step": 46430 }, { "entropy": 5.906782531738282, "epoch": 3.612799066329508, "grad_norm": 1.2734375, "learning_rate": 0.0003731671413541942, "loss": 4.9986, "mean_token_accuracy": 0.20882537662982942, "num_tokens": 80556957.0, "step": 46435 }, { "entropy": 5.854633045196533, "epoch": 3.6131880957012257, "grad_norm": 1.296875, "learning_rate": 0.00037314220206735626, "loss": 4.8857, "mean_token_accuracy": 0.2204595535993576, "num_tokens": 80565102.0, "step": 46440 }, { "entropy": 5.824913549423218, "epoch": 3.613577125072943, "grad_norm": 1.453125, "learning_rate": 0.00037311726129136665, "loss": 4.878, "mean_token_accuracy": 0.21720949709415435, "num_tokens": 80573774.0, "step": 46445 }, { "entropy": 5.8358931064605715, "epoch": 3.6139661544446606, "grad_norm": 1.25, "learning_rate": 0.0003730923190266038, "loss": 4.9762, "mean_token_accuracy": 0.20975459665060042, "num_tokens": 80582217.0, "step": 46450 }, { "entropy": 5.867620897293091, "epoch": 3.614355183816378, "grad_norm": 1.3671875, "learning_rate": 0.000373067375273446, "loss": 5.0227, "mean_token_accuracy": 0.20011592358350755, "num_tokens": 80589978.0, "step": 46455 }, { "entropy": 5.96382851600647, "epoch": 3.6147442131880956, "grad_norm": 1.390625, "learning_rate": 0.00037304243003227197, "loss": 5.1716, "mean_token_accuracy": 0.2022392377257347, "num_tokens": 80598333.0, "step": 46460 }, { "entropy": 5.891906213760376, "epoch": 3.6151332425598133, "grad_norm": 1.328125, "learning_rate": 0.0003730174833034601, "loss": 4.9898, "mean_token_accuracy": 0.20581740736961365, "num_tokens": 80607442.0, "step": 46465 }, { "entropy": 5.90625696182251, "epoch": 3.615522271931531, "grad_norm": 1.359375, "learning_rate": 0.00037299253508738894, "loss": 4.9191, "mean_token_accuracy": 0.21384364515542983, "num_tokens": 80616002.0, "step": 46470 }, { "entropy": 5.953362131118775, "epoch": 3.6159113013032487, "grad_norm": 1.3203125, "learning_rate": 0.00037296758538443703, "loss": 5.0941, "mean_token_accuracy": 0.19955772459506987, "num_tokens": 80625066.0, "step": 46475 }, { "entropy": 5.924220323562622, "epoch": 3.616300330674966, "grad_norm": 1.328125, "learning_rate": 0.00037294263419498295, "loss": 4.978, "mean_token_accuracy": 0.21444753408432007, "num_tokens": 80633809.0, "step": 46480 }, { "entropy": 5.882300662994385, "epoch": 3.6166893600466836, "grad_norm": 1.3359375, "learning_rate": 0.0003729176815194053, "loss": 4.9312, "mean_token_accuracy": 0.2062678411602974, "num_tokens": 80641761.0, "step": 46485 }, { "entropy": 5.832078456878662, "epoch": 3.617078389418401, "grad_norm": 1.2421875, "learning_rate": 0.00037289272735808267, "loss": 4.9422, "mean_token_accuracy": 0.22402411848306655, "num_tokens": 80649977.0, "step": 46490 }, { "entropy": 5.825156021118164, "epoch": 3.6174674187901186, "grad_norm": 1.3515625, "learning_rate": 0.0003728677717113936, "loss": 4.9761, "mean_token_accuracy": 0.20727197527885438, "num_tokens": 80658851.0, "step": 46495 }, { "entropy": 5.77953987121582, "epoch": 3.6178564481618363, "grad_norm": 1.296875, "learning_rate": 0.00037284281457971707, "loss": 4.8931, "mean_token_accuracy": 0.20774994790554047, "num_tokens": 80667758.0, "step": 46500 }, { "entropy": 5.860615825653076, "epoch": 3.618245477533554, "grad_norm": 1.34375, "learning_rate": 0.0003728178559634315, "loss": 4.9345, "mean_token_accuracy": 0.21559597849845885, "num_tokens": 80676309.0, "step": 46505 }, { "entropy": 5.856022834777832, "epoch": 3.618634506905271, "grad_norm": 1.4453125, "learning_rate": 0.0003727928958629156, "loss": 4.9131, "mean_token_accuracy": 0.21178776770830154, "num_tokens": 80683966.0, "step": 46510 }, { "entropy": 5.891255569458008, "epoch": 3.619023536276989, "grad_norm": 1.359375, "learning_rate": 0.00037276793427854817, "loss": 5.0823, "mean_token_accuracy": 0.2026694357395172, "num_tokens": 80692850.0, "step": 46515 }, { "entropy": 5.903160095214844, "epoch": 3.6194125656487066, "grad_norm": 1.3359375, "learning_rate": 0.00037274297121070796, "loss": 4.9774, "mean_token_accuracy": 0.20803457796573638, "num_tokens": 80701404.0, "step": 46520 }, { "entropy": 5.881598424911499, "epoch": 3.619801595020424, "grad_norm": 1.421875, "learning_rate": 0.0003727180066597737, "loss": 5.0241, "mean_token_accuracy": 0.20474547445774077, "num_tokens": 80710264.0, "step": 46525 }, { "entropy": 5.9047668933868405, "epoch": 3.6201906243921416, "grad_norm": 1.359375, "learning_rate": 0.0003726930406261243, "loss": 5.0004, "mean_token_accuracy": 0.20578745901584625, "num_tokens": 80718946.0, "step": 46530 }, { "entropy": 5.85740327835083, "epoch": 3.6205796537638593, "grad_norm": 1.3046875, "learning_rate": 0.0003726680731101385, "loss": 4.9287, "mean_token_accuracy": 0.21857842057943344, "num_tokens": 80726918.0, "step": 46535 }, { "entropy": 5.868860149383545, "epoch": 3.620968683135577, "grad_norm": 1.515625, "learning_rate": 0.0003726431041121951, "loss": 4.9587, "mean_token_accuracy": 0.2118617445230484, "num_tokens": 80735024.0, "step": 46540 }, { "entropy": 5.876454639434814, "epoch": 3.621357712507294, "grad_norm": 1.34375, "learning_rate": 0.000372618133632673, "loss": 5.0011, "mean_token_accuracy": 0.20349937081336975, "num_tokens": 80743393.0, "step": 46545 }, { "entropy": 5.7621081352233885, "epoch": 3.621746741879012, "grad_norm": 1.3671875, "learning_rate": 0.0003725931616719511, "loss": 4.9028, "mean_token_accuracy": 0.21248666793107987, "num_tokens": 80753058.0, "step": 46550 }, { "entropy": 5.936996793746948, "epoch": 3.622135771250729, "grad_norm": 1.34375, "learning_rate": 0.0003725681882304084, "loss": 5.0302, "mean_token_accuracy": 0.20232336670160295, "num_tokens": 80761883.0, "step": 46555 }, { "entropy": 5.9229692935943605, "epoch": 3.622524800622447, "grad_norm": 1.390625, "learning_rate": 0.0003725432133084237, "loss": 4.969, "mean_token_accuracy": 0.21203252375125886, "num_tokens": 80770665.0, "step": 46560 }, { "entropy": 6.032285404205322, "epoch": 3.6229138299941646, "grad_norm": 1.4921875, "learning_rate": 0.0003725182369063759, "loss": 5.1275, "mean_token_accuracy": 0.19932887256145476, "num_tokens": 80779123.0, "step": 46565 }, { "entropy": 5.865744590759277, "epoch": 3.6233028593658823, "grad_norm": 1.3828125, "learning_rate": 0.0003724932590246441, "loss": 4.9338, "mean_token_accuracy": 0.2123592883348465, "num_tokens": 80787643.0, "step": 46570 }, { "entropy": 5.881605720520019, "epoch": 3.6236918887376, "grad_norm": 1.234375, "learning_rate": 0.0003724682796636073, "loss": 5.0152, "mean_token_accuracy": 0.2087026759982109, "num_tokens": 80797457.0, "step": 46575 }, { "entropy": 5.883164119720459, "epoch": 3.624080918109317, "grad_norm": 1.3515625, "learning_rate": 0.0003724432988236445, "loss": 5.0391, "mean_token_accuracy": 0.20505425035953523, "num_tokens": 80806632.0, "step": 46580 }, { "entropy": 5.935055446624756, "epoch": 3.624469947481035, "grad_norm": 1.2890625, "learning_rate": 0.0003724183165051347, "loss": 5.0675, "mean_token_accuracy": 0.20734118521213532, "num_tokens": 80815625.0, "step": 46585 }, { "entropy": 5.92406735420227, "epoch": 3.624858976852752, "grad_norm": 1.453125, "learning_rate": 0.00037239333270845714, "loss": 4.913, "mean_token_accuracy": 0.21828123033046723, "num_tokens": 80823808.0, "step": 46590 }, { "entropy": 5.906607532501221, "epoch": 3.62524800622447, "grad_norm": 1.359375, "learning_rate": 0.0003723683474339907, "loss": 5.0092, "mean_token_accuracy": 0.20444276034832, "num_tokens": 80832093.0, "step": 46595 }, { "entropy": 5.849700975418091, "epoch": 3.6256370355961876, "grad_norm": 1.3984375, "learning_rate": 0.0003723433606821145, "loss": 4.9682, "mean_token_accuracy": 0.2150287002325058, "num_tokens": 80840411.0, "step": 46600 }, { "entropy": 5.890695190429687, "epoch": 3.6260260649679052, "grad_norm": 1.2578125, "learning_rate": 0.00037231837245320777, "loss": 4.9539, "mean_token_accuracy": 0.2094782754778862, "num_tokens": 80848923.0, "step": 46605 }, { "entropy": 5.913061618804932, "epoch": 3.6264150943396225, "grad_norm": 1.3203125, "learning_rate": 0.00037229338274764965, "loss": 5.0189, "mean_token_accuracy": 0.209695440530777, "num_tokens": 80858459.0, "step": 46610 }, { "entropy": 5.970396566390991, "epoch": 3.62680412371134, "grad_norm": 1.2265625, "learning_rate": 0.0003722683915658193, "loss": 5.0661, "mean_token_accuracy": 0.20314272195100785, "num_tokens": 80867559.0, "step": 46615 }, { "entropy": 5.8923484802246096, "epoch": 3.627193153083058, "grad_norm": 1.3125, "learning_rate": 0.00037224339890809587, "loss": 4.9623, "mean_token_accuracy": 0.2098035469651222, "num_tokens": 80875285.0, "step": 46620 }, { "entropy": 5.7909900665283205, "epoch": 3.627582182454775, "grad_norm": 1.3359375, "learning_rate": 0.0003722184047748587, "loss": 4.9318, "mean_token_accuracy": 0.2115820527076721, "num_tokens": 80883805.0, "step": 46625 }, { "entropy": 5.90681939125061, "epoch": 3.627971211826493, "grad_norm": 1.4140625, "learning_rate": 0.00037219340916648703, "loss": 5.0132, "mean_token_accuracy": 0.21286354959011078, "num_tokens": 80892496.0, "step": 46630 }, { "entropy": 5.832587862014771, "epoch": 3.6283602411982105, "grad_norm": 1.3203125, "learning_rate": 0.00037216841208336, "loss": 4.9644, "mean_token_accuracy": 0.21940865516662597, "num_tokens": 80901364.0, "step": 46635 }, { "entropy": 5.824172163009644, "epoch": 3.6287492705699282, "grad_norm": 1.296875, "learning_rate": 0.00037214341352585697, "loss": 4.9323, "mean_token_accuracy": 0.21472516804933547, "num_tokens": 80910563.0, "step": 46640 }, { "entropy": 5.858545923233033, "epoch": 3.6291382999416455, "grad_norm": 1.3203125, "learning_rate": 0.0003721184134943573, "loss": 4.9362, "mean_token_accuracy": 0.2087385579943657, "num_tokens": 80918939.0, "step": 46645 }, { "entropy": 5.920136260986328, "epoch": 3.629527329313363, "grad_norm": 1.2890625, "learning_rate": 0.00037209341198924024, "loss": 5.066, "mean_token_accuracy": 0.20816862732172012, "num_tokens": 80927896.0, "step": 46650 }, { "entropy": 5.877099847793579, "epoch": 3.6299163586850804, "grad_norm": 1.3125, "learning_rate": 0.0003720684090108852, "loss": 4.9963, "mean_token_accuracy": 0.2129910632967949, "num_tokens": 80936961.0, "step": 46655 }, { "entropy": 5.891387271881103, "epoch": 3.630305388056798, "grad_norm": 1.296875, "learning_rate": 0.0003720434045596716, "loss": 5.0122, "mean_token_accuracy": 0.2051403343677521, "num_tokens": 80947240.0, "step": 46660 }, { "entropy": 5.87029390335083, "epoch": 3.630694417428516, "grad_norm": 1.59375, "learning_rate": 0.0003720183986359788, "loss": 4.8988, "mean_token_accuracy": 0.22364370673894882, "num_tokens": 80955722.0, "step": 46665 }, { "entropy": 5.825017213821411, "epoch": 3.6310834468002335, "grad_norm": 1.3984375, "learning_rate": 0.0003719933912401862, "loss": 4.9201, "mean_token_accuracy": 0.21871040612459183, "num_tokens": 80964224.0, "step": 46670 }, { "entropy": 5.858215284347534, "epoch": 3.6314724761719512, "grad_norm": 1.28125, "learning_rate": 0.0003719683823726732, "loss": 5.0009, "mean_token_accuracy": 0.20352280437946318, "num_tokens": 80972379.0, "step": 46675 }, { "entropy": 5.769119358062744, "epoch": 3.6318615055436685, "grad_norm": 1.3984375, "learning_rate": 0.00037194337203381945, "loss": 4.8192, "mean_token_accuracy": 0.22052616477012635, "num_tokens": 80980365.0, "step": 46680 }, { "entropy": 5.8707255840301515, "epoch": 3.632250534915386, "grad_norm": 1.3671875, "learning_rate": 0.00037191836022400427, "loss": 5.0681, "mean_token_accuracy": 0.20385424345731734, "num_tokens": 80989938.0, "step": 46685 }, { "entropy": 5.93416428565979, "epoch": 3.6326395642871034, "grad_norm": 1.390625, "learning_rate": 0.00037189334694360724, "loss": 5.0234, "mean_token_accuracy": 0.2064856395125389, "num_tokens": 80998300.0, "step": 46690 }, { "entropy": 5.987253046035766, "epoch": 3.633028593658821, "grad_norm": 1.3203125, "learning_rate": 0.0003718683321930079, "loss": 5.1411, "mean_token_accuracy": 0.203850919008255, "num_tokens": 81007802.0, "step": 46695 }, { "entropy": 5.88831353187561, "epoch": 3.633417623030539, "grad_norm": 1.3125, "learning_rate": 0.0003718433159725857, "loss": 5.0221, "mean_token_accuracy": 0.2063385874032974, "num_tokens": 81016668.0, "step": 46700 }, { "entropy": 5.8856714248657225, "epoch": 3.6338066524022565, "grad_norm": 1.5, "learning_rate": 0.0003718182982827205, "loss": 4.9411, "mean_token_accuracy": 0.21400780230760574, "num_tokens": 81024492.0, "step": 46705 }, { "entropy": 5.840031671524048, "epoch": 3.634195681773974, "grad_norm": 1.296875, "learning_rate": 0.00037179327912379166, "loss": 5.03, "mean_token_accuracy": 0.20880710929632187, "num_tokens": 81033787.0, "step": 46710 }, { "entropy": 5.880104017257691, "epoch": 3.6345847111456915, "grad_norm": 1.2578125, "learning_rate": 0.00037176825849617886, "loss": 5.017, "mean_token_accuracy": 0.20855602324008943, "num_tokens": 81043098.0, "step": 46715 }, { "entropy": 5.854564476013183, "epoch": 3.634973740517409, "grad_norm": 1.25, "learning_rate": 0.00037174323640026173, "loss": 4.9672, "mean_token_accuracy": 0.21144081503152848, "num_tokens": 81052638.0, "step": 46720 }, { "entropy": 5.885738468170166, "epoch": 3.6353627698891264, "grad_norm": 1.265625, "learning_rate": 0.00037171821283642003, "loss": 4.9412, "mean_token_accuracy": 0.21109349131584168, "num_tokens": 81061350.0, "step": 46725 }, { "entropy": 5.792341041564941, "epoch": 3.635751799260844, "grad_norm": 1.3125, "learning_rate": 0.0003716931878050334, "loss": 4.8483, "mean_token_accuracy": 0.22055627703666686, "num_tokens": 81071013.0, "step": 46730 }, { "entropy": 5.875975894927978, "epoch": 3.636140828632562, "grad_norm": 1.40625, "learning_rate": 0.00037166816130648143, "loss": 5.0428, "mean_token_accuracy": 0.20620951801538467, "num_tokens": 81080705.0, "step": 46735 }, { "entropy": 5.915296459197998, "epoch": 3.6365298580042795, "grad_norm": 1.3125, "learning_rate": 0.00037164313334114407, "loss": 4.9944, "mean_token_accuracy": 0.21317459642887115, "num_tokens": 81089422.0, "step": 46740 }, { "entropy": 5.902558040618897, "epoch": 3.636918887375997, "grad_norm": 1.4609375, "learning_rate": 0.000371618103909401, "loss": 4.9912, "mean_token_accuracy": 0.20946327298879625, "num_tokens": 81097348.0, "step": 46745 }, { "entropy": 5.870756149291992, "epoch": 3.6373079167477145, "grad_norm": 1.4296875, "learning_rate": 0.000371593073011632, "loss": 4.9815, "mean_token_accuracy": 0.21996910721063614, "num_tokens": 81106083.0, "step": 46750 }, { "entropy": 5.878364133834839, "epoch": 3.637696946119432, "grad_norm": 1.28125, "learning_rate": 0.00037156804064821674, "loss": 5.0326, "mean_token_accuracy": 0.20342165231704712, "num_tokens": 81114822.0, "step": 46755 }, { "entropy": 5.9075604438781735, "epoch": 3.6380859754911494, "grad_norm": 1.3515625, "learning_rate": 0.00037154300681953523, "loss": 4.991, "mean_token_accuracy": 0.20620027333498, "num_tokens": 81124037.0, "step": 46760 }, { "entropy": 5.93548173904419, "epoch": 3.638475004862867, "grad_norm": 1.3125, "learning_rate": 0.0003715179715259673, "loss": 5.0085, "mean_token_accuracy": 0.2102886527776718, "num_tokens": 81133578.0, "step": 46765 }, { "entropy": 5.882705163955689, "epoch": 3.638864034234585, "grad_norm": 1.3515625, "learning_rate": 0.00037149293476789277, "loss": 4.9121, "mean_token_accuracy": 0.21679313182830812, "num_tokens": 81142073.0, "step": 46770 }, { "entropy": 5.90130877494812, "epoch": 3.6392530636063025, "grad_norm": 1.3984375, "learning_rate": 0.0003714678965456915, "loss": 5.0353, "mean_token_accuracy": 0.20645336657762528, "num_tokens": 81150271.0, "step": 46775 }, { "entropy": 5.929980134963989, "epoch": 3.6396420929780198, "grad_norm": 1.46875, "learning_rate": 0.00037144285685974346, "loss": 5.0399, "mean_token_accuracy": 0.21021473556756973, "num_tokens": 81158355.0, "step": 46780 }, { "entropy": 5.89545521736145, "epoch": 3.6400311223497375, "grad_norm": 1.265625, "learning_rate": 0.00037141781571042854, "loss": 5.0231, "mean_token_accuracy": 0.2101237490773201, "num_tokens": 81167573.0, "step": 46785 }, { "entropy": 5.865622043609619, "epoch": 3.6404201517214547, "grad_norm": 1.28125, "learning_rate": 0.00037139277309812676, "loss": 4.9176, "mean_token_accuracy": 0.21763512045145034, "num_tokens": 81176756.0, "step": 46790 }, { "entropy": 5.825727653503418, "epoch": 3.6408091810931724, "grad_norm": 1.265625, "learning_rate": 0.0003713677290232181, "loss": 4.9011, "mean_token_accuracy": 0.21397103369235992, "num_tokens": 81185589.0, "step": 46795 }, { "entropy": 5.806036567687988, "epoch": 3.64119821046489, "grad_norm": 1.3359375, "learning_rate": 0.00037134268348608255, "loss": 4.9162, "mean_token_accuracy": 0.21238091588020325, "num_tokens": 81194381.0, "step": 46800 }, { "entropy": 5.9399206161499025, "epoch": 3.641587239836608, "grad_norm": 1.390625, "learning_rate": 0.00037131763648710003, "loss": 5.0303, "mean_token_accuracy": 0.2019777625799179, "num_tokens": 81202441.0, "step": 46805 }, { "entropy": 5.92555832862854, "epoch": 3.641976269208325, "grad_norm": 1.359375, "learning_rate": 0.00037129258802665076, "loss": 4.9915, "mean_token_accuracy": 0.20542169213294983, "num_tokens": 81211008.0, "step": 46810 }, { "entropy": 5.8925525665283205, "epoch": 3.6423652985800428, "grad_norm": 1.4375, "learning_rate": 0.0003712675381051147, "loss": 4.9918, "mean_token_accuracy": 0.21255370676517488, "num_tokens": 81220585.0, "step": 46815 }, { "entropy": 5.8374334335327145, "epoch": 3.6427543279517605, "grad_norm": 1.46875, "learning_rate": 0.000371242486722872, "loss": 4.9701, "mean_token_accuracy": 0.2102351129055023, "num_tokens": 81229086.0, "step": 46820 }, { "entropy": 5.89926552772522, "epoch": 3.6431433573234777, "grad_norm": 1.28125, "learning_rate": 0.0003712174338803027, "loss": 4.9858, "mean_token_accuracy": 0.20744353532791138, "num_tokens": 81237755.0, "step": 46825 }, { "entropy": 5.923137092590332, "epoch": 3.6435323866951954, "grad_norm": 1.3203125, "learning_rate": 0.000371192379577787, "loss": 5.0667, "mean_token_accuracy": 0.20846085250377655, "num_tokens": 81247098.0, "step": 46830 }, { "entropy": 5.851921510696411, "epoch": 3.643921416066913, "grad_norm": 1.265625, "learning_rate": 0.0003711673238157051, "loss": 4.9945, "mean_token_accuracy": 0.21187085658311844, "num_tokens": 81256103.0, "step": 46835 }, { "entropy": 5.833305978775025, "epoch": 3.644310445438631, "grad_norm": 1.3203125, "learning_rate": 0.00037114226659443704, "loss": 4.9337, "mean_token_accuracy": 0.20982952713966369, "num_tokens": 81264375.0, "step": 46840 }, { "entropy": 5.860716724395752, "epoch": 3.644699474810348, "grad_norm": 1.4140625, "learning_rate": 0.0003711172079143632, "loss": 4.8529, "mean_token_accuracy": 0.21892087161540985, "num_tokens": 81272589.0, "step": 46845 }, { "entropy": 5.813661432266235, "epoch": 3.6450885041820658, "grad_norm": 1.3046875, "learning_rate": 0.0003710921477758637, "loss": 4.929, "mean_token_accuracy": 0.2200906589627266, "num_tokens": 81280777.0, "step": 46850 }, { "entropy": 5.922341966629029, "epoch": 3.6454775335537835, "grad_norm": 1.40625, "learning_rate": 0.0003710670861793187, "loss": 5.0729, "mean_token_accuracy": 0.20805466175079346, "num_tokens": 81290451.0, "step": 46855 }, { "entropy": 5.871334886550903, "epoch": 3.6458665629255007, "grad_norm": 1.3828125, "learning_rate": 0.0003710420231251087, "loss": 4.9238, "mean_token_accuracy": 0.21820848137140275, "num_tokens": 81299450.0, "step": 46860 }, { "entropy": 5.810213375091553, "epoch": 3.6462555922972184, "grad_norm": 1.2734375, "learning_rate": 0.00037101695861361384, "loss": 4.9162, "mean_token_accuracy": 0.21733849197626115, "num_tokens": 81308400.0, "step": 46865 }, { "entropy": 5.81704044342041, "epoch": 3.646644621668936, "grad_norm": 1.4140625, "learning_rate": 0.00037099189264521446, "loss": 4.9319, "mean_token_accuracy": 0.21933533549308776, "num_tokens": 81316322.0, "step": 46870 }, { "entropy": 5.765547561645508, "epoch": 3.647033651040654, "grad_norm": 1.2734375, "learning_rate": 0.0003709668252202909, "loss": 4.8525, "mean_token_accuracy": 0.21882947832345961, "num_tokens": 81325444.0, "step": 46875 }, { "entropy": 5.848865652084351, "epoch": 3.647422680412371, "grad_norm": 1.375, "learning_rate": 0.0003709417563392235, "loss": 4.8861, "mean_token_accuracy": 0.22343226820230483, "num_tokens": 81334279.0, "step": 46880 }, { "entropy": 5.882297468185425, "epoch": 3.6478117097840888, "grad_norm": 1.390625, "learning_rate": 0.0003709166860023926, "loss": 4.8896, "mean_token_accuracy": 0.2170726016163826, "num_tokens": 81342641.0, "step": 46885 }, { "entropy": 5.814369440078735, "epoch": 3.648200739155806, "grad_norm": 1.3359375, "learning_rate": 0.00037089161421017874, "loss": 4.9267, "mean_token_accuracy": 0.21857561320066451, "num_tokens": 81352029.0, "step": 46890 }, { "entropy": 5.8552083492279055, "epoch": 3.6485897685275237, "grad_norm": 1.578125, "learning_rate": 0.00037086654096296217, "loss": 4.9718, "mean_token_accuracy": 0.21150198131799697, "num_tokens": 81361084.0, "step": 46895 }, { "entropy": 5.795525121688843, "epoch": 3.6489787978992414, "grad_norm": 1.3125, "learning_rate": 0.0003708414662611235, "loss": 4.8842, "mean_token_accuracy": 0.2188178554177284, "num_tokens": 81369945.0, "step": 46900 }, { "entropy": 5.8677267074584964, "epoch": 3.649367827270959, "grad_norm": 1.34375, "learning_rate": 0.0003708163901050432, "loss": 4.9971, "mean_token_accuracy": 0.21284661293029786, "num_tokens": 81378918.0, "step": 46905 }, { "entropy": 5.856452512741089, "epoch": 3.649756856642677, "grad_norm": 1.3984375, "learning_rate": 0.00037079131249510155, "loss": 4.9698, "mean_token_accuracy": 0.21594124436378478, "num_tokens": 81386937.0, "step": 46910 }, { "entropy": 5.889850044250489, "epoch": 3.650145886014394, "grad_norm": 1.375, "learning_rate": 0.0003707662334316793, "loss": 5.0358, "mean_token_accuracy": 0.21108922511339187, "num_tokens": 81396042.0, "step": 46915 }, { "entropy": 5.9429543018341064, "epoch": 3.6505349153861117, "grad_norm": 1.4453125, "learning_rate": 0.0003707411529151568, "loss": 5.0138, "mean_token_accuracy": 0.20987160950899125, "num_tokens": 81404737.0, "step": 46920 }, { "entropy": 5.910168695449829, "epoch": 3.650923944757829, "grad_norm": 1.3671875, "learning_rate": 0.0003707160709459147, "loss": 5.1012, "mean_token_accuracy": 0.19917007088661193, "num_tokens": 81414197.0, "step": 46925 }, { "entropy": 5.824350452423095, "epoch": 3.6513129741295467, "grad_norm": 1.3203125, "learning_rate": 0.0003706909875243336, "loss": 4.9486, "mean_token_accuracy": 0.21237266808748245, "num_tokens": 81423033.0, "step": 46930 }, { "entropy": 5.835911750793457, "epoch": 3.6517020035012644, "grad_norm": 1.390625, "learning_rate": 0.000370665902650794, "loss": 4.9471, "mean_token_accuracy": 0.21599343717098235, "num_tokens": 81431450.0, "step": 46935 }, { "entropy": 5.844062614440918, "epoch": 3.652091032872982, "grad_norm": 1.40625, "learning_rate": 0.00037064081632567675, "loss": 5.0143, "mean_token_accuracy": 0.20958954691886902, "num_tokens": 81440928.0, "step": 46940 }, { "entropy": 5.943365955352784, "epoch": 3.6524800622446993, "grad_norm": 1.34375, "learning_rate": 0.00037061572854936225, "loss": 5.0391, "mean_token_accuracy": 0.2096440836787224, "num_tokens": 81448740.0, "step": 46945 }, { "entropy": 5.874339866638183, "epoch": 3.652869091616417, "grad_norm": 1.4296875, "learning_rate": 0.0003705906393222313, "loss": 4.9822, "mean_token_accuracy": 0.21593944132328033, "num_tokens": 81456992.0, "step": 46950 }, { "entropy": 5.806954765319825, "epoch": 3.6532581209881347, "grad_norm": 1.203125, "learning_rate": 0.0003705655486446645, "loss": 4.9321, "mean_token_accuracy": 0.216282220184803, "num_tokens": 81465711.0, "step": 46955 }, { "entropy": 5.908067464828491, "epoch": 3.653647150359852, "grad_norm": 1.4765625, "learning_rate": 0.0003705404565170426, "loss": 5.0022, "mean_token_accuracy": 0.2064366713166237, "num_tokens": 81473469.0, "step": 46960 }, { "entropy": 5.933704376220703, "epoch": 3.6540361797315697, "grad_norm": 1.3359375, "learning_rate": 0.0003705153629397463, "loss": 5.0388, "mean_token_accuracy": 0.2017107844352722, "num_tokens": 81482984.0, "step": 46965 }, { "entropy": 5.878258800506591, "epoch": 3.6544252091032874, "grad_norm": 1.328125, "learning_rate": 0.00037049026791315646, "loss": 4.9334, "mean_token_accuracy": 0.21487851142883302, "num_tokens": 81491172.0, "step": 46970 }, { "entropy": 5.926511287689209, "epoch": 3.654814238475005, "grad_norm": 1.4609375, "learning_rate": 0.0003704651714376538, "loss": 5.0114, "mean_token_accuracy": 0.2088474377989769, "num_tokens": 81499712.0, "step": 46975 }, { "entropy": 5.898883199691772, "epoch": 3.6552032678467223, "grad_norm": 1.390625, "learning_rate": 0.0003704400735136191, "loss": 5.0853, "mean_token_accuracy": 0.19693916738033296, "num_tokens": 81508937.0, "step": 46980 }, { "entropy": 5.84464430809021, "epoch": 3.65559229721844, "grad_norm": 1.3046875, "learning_rate": 0.0003704149741414332, "loss": 4.9559, "mean_token_accuracy": 0.214585842192173, "num_tokens": 81517755.0, "step": 46985 }, { "entropy": 5.859436559677124, "epoch": 3.6559813265901573, "grad_norm": 1.3125, "learning_rate": 0.0003703898733214769, "loss": 4.9538, "mean_token_accuracy": 0.2163550451397896, "num_tokens": 81525894.0, "step": 46990 }, { "entropy": 5.9042294979095455, "epoch": 3.656370355961875, "grad_norm": 1.5625, "learning_rate": 0.0003703647710541311, "loss": 4.9346, "mean_token_accuracy": 0.21389556378126146, "num_tokens": 81533907.0, "step": 46995 }, { "entropy": 5.8482812404632565, "epoch": 3.6567593853335927, "grad_norm": 1.3203125, "learning_rate": 0.0003703396673397768, "loss": 5.0335, "mean_token_accuracy": 0.2111420676112175, "num_tokens": 81542329.0, "step": 47000 }, { "entropy": 5.778375673294067, "epoch": 3.6571484147053104, "grad_norm": 1.28125, "learning_rate": 0.0003703145621787947, "loss": 4.8866, "mean_token_accuracy": 0.21735000759363174, "num_tokens": 81551746.0, "step": 47005 }, { "entropy": 5.9086973667144775, "epoch": 3.657537444077028, "grad_norm": 1.4453125, "learning_rate": 0.00037028945557156587, "loss": 5.001, "mean_token_accuracy": 0.21235192716121673, "num_tokens": 81561064.0, "step": 47010 }, { "entropy": 5.829688310623169, "epoch": 3.6579264734487453, "grad_norm": 1.2890625, "learning_rate": 0.00037026434751847117, "loss": 4.893, "mean_token_accuracy": 0.223715740442276, "num_tokens": 81570808.0, "step": 47015 }, { "entropy": 5.865843439102173, "epoch": 3.658315502820463, "grad_norm": 1.265625, "learning_rate": 0.00037023923801989163, "loss": 5.038, "mean_token_accuracy": 0.20480707585811614, "num_tokens": 81579871.0, "step": 47020 }, { "entropy": 5.962576866149902, "epoch": 3.6587045321921803, "grad_norm": 1.4140625, "learning_rate": 0.0003702141270762083, "loss": 5.1474, "mean_token_accuracy": 0.19772750735282899, "num_tokens": 81588422.0, "step": 47025 }, { "entropy": 5.955078840255737, "epoch": 3.659093561563898, "grad_norm": 1.2578125, "learning_rate": 0.00037018901468780207, "loss": 5.0754, "mean_token_accuracy": 0.20600162893533708, "num_tokens": 81597026.0, "step": 47030 }, { "entropy": 5.811412000656128, "epoch": 3.6594825909356157, "grad_norm": 1.265625, "learning_rate": 0.0003701639008550541, "loss": 4.9574, "mean_token_accuracy": 0.21007381826639177, "num_tokens": 81605480.0, "step": 47035 }, { "entropy": 5.837076425552368, "epoch": 3.6598716203073334, "grad_norm": 1.3984375, "learning_rate": 0.0003701387855783454, "loss": 4.892, "mean_token_accuracy": 0.21660759299993515, "num_tokens": 81613953.0, "step": 47040 }, { "entropy": 5.88428897857666, "epoch": 3.6602606496790506, "grad_norm": 1.3203125, "learning_rate": 0.000370113668858057, "loss": 5.0315, "mean_token_accuracy": 0.21145493686199188, "num_tokens": 81623660.0, "step": 47045 }, { "entropy": 5.865754318237305, "epoch": 3.6606496790507683, "grad_norm": 1.4765625, "learning_rate": 0.0003700885506945701, "loss": 4.9518, "mean_token_accuracy": 0.21455022394657136, "num_tokens": 81631920.0, "step": 47050 }, { "entropy": 5.896390819549561, "epoch": 3.661038708422486, "grad_norm": 1.25, "learning_rate": 0.0003700634310882658, "loss": 4.9212, "mean_token_accuracy": 0.21557882726192473, "num_tokens": 81640501.0, "step": 47055 }, { "entropy": 5.85871262550354, "epoch": 3.6614277377942033, "grad_norm": 1.3984375, "learning_rate": 0.00037003831003952525, "loss": 5.0188, "mean_token_accuracy": 0.2048247531056404, "num_tokens": 81648494.0, "step": 47060 }, { "entropy": 5.836420679092408, "epoch": 3.661816767165921, "grad_norm": 1.3671875, "learning_rate": 0.00037001318754872957, "loss": 4.9271, "mean_token_accuracy": 0.20911206901073456, "num_tokens": 81657611.0, "step": 47065 }, { "entropy": 5.893690347671509, "epoch": 3.6622057965376387, "grad_norm": 1.3515625, "learning_rate": 0.00036998806361626, "loss": 4.9582, "mean_token_accuracy": 0.21384949684143068, "num_tokens": 81666116.0, "step": 47070 }, { "entropy": 5.865044832229614, "epoch": 3.6625948259093564, "grad_norm": 1.5, "learning_rate": 0.0003699629382424979, "loss": 4.9123, "mean_token_accuracy": 0.21660293340682985, "num_tokens": 81674720.0, "step": 47075 }, { "entropy": 5.786578559875489, "epoch": 3.6629838552810736, "grad_norm": 1.5703125, "learning_rate": 0.00036993781142782416, "loss": 4.8445, "mean_token_accuracy": 0.22837084233760835, "num_tokens": 81683086.0, "step": 47080 }, { "entropy": 5.821144533157349, "epoch": 3.6633728846527913, "grad_norm": 1.2734375, "learning_rate": 0.00036991268317262033, "loss": 4.9559, "mean_token_accuracy": 0.21503710150718688, "num_tokens": 81691769.0, "step": 47085 }, { "entropy": 5.815629291534424, "epoch": 3.663761914024509, "grad_norm": 1.3984375, "learning_rate": 0.00036988755347726766, "loss": 4.9202, "mean_token_accuracy": 0.2131766065955162, "num_tokens": 81700036.0, "step": 47090 }, { "entropy": 5.935163259506226, "epoch": 3.6641509433962263, "grad_norm": 1.453125, "learning_rate": 0.00036986242234214736, "loss": 5.0852, "mean_token_accuracy": 0.2060905024409294, "num_tokens": 81708652.0, "step": 47095 }, { "entropy": 5.865155363082886, "epoch": 3.664539972767944, "grad_norm": 1.375, "learning_rate": 0.00036983728976764074, "loss": 4.9257, "mean_token_accuracy": 0.21482794731855392, "num_tokens": 81717272.0, "step": 47100 }, { "entropy": 5.871768474578857, "epoch": 3.6649290021396617, "grad_norm": 1.5, "learning_rate": 0.00036981215575412923, "loss": 4.8419, "mean_token_accuracy": 0.22212135493755342, "num_tokens": 81726085.0, "step": 47105 }, { "entropy": 5.866903066635132, "epoch": 3.6653180315113794, "grad_norm": 1.40625, "learning_rate": 0.0003697870203019942, "loss": 5.0457, "mean_token_accuracy": 0.20276347249746324, "num_tokens": 81734757.0, "step": 47110 }, { "entropy": 5.873139905929565, "epoch": 3.6657070608830966, "grad_norm": 1.4375, "learning_rate": 0.00036976188341161694, "loss": 4.9634, "mean_token_accuracy": 0.21564424335956572, "num_tokens": 81743419.0, "step": 47115 }, { "entropy": 5.918490076065064, "epoch": 3.6660960902548143, "grad_norm": 1.2734375, "learning_rate": 0.0003697367450833789, "loss": 5.0695, "mean_token_accuracy": 0.20339560210704805, "num_tokens": 81752199.0, "step": 47120 }, { "entropy": 5.945154523849487, "epoch": 3.6664851196265316, "grad_norm": 1.390625, "learning_rate": 0.00036971160531766155, "loss": 5.0552, "mean_token_accuracy": 0.2047775536775589, "num_tokens": 81760722.0, "step": 47125 }, { "entropy": 5.9280845642089846, "epoch": 3.6668741489982493, "grad_norm": 1.328125, "learning_rate": 0.0003696864641148465, "loss": 5.0851, "mean_token_accuracy": 0.2049752652645111, "num_tokens": 81769826.0, "step": 47130 }, { "entropy": 5.8825586318969725, "epoch": 3.667263178369967, "grad_norm": 1.328125, "learning_rate": 0.00036966132147531487, "loss": 4.8935, "mean_token_accuracy": 0.22377275228500365, "num_tokens": 81778074.0, "step": 47135 }, { "entropy": 5.91159200668335, "epoch": 3.6676522077416847, "grad_norm": 1.28125, "learning_rate": 0.00036963617739944844, "loss": 5.0697, "mean_token_accuracy": 0.20271925777196884, "num_tokens": 81786621.0, "step": 47140 }, { "entropy": 5.862623977661133, "epoch": 3.668041237113402, "grad_norm": 1.3515625, "learning_rate": 0.00036961103188762866, "loss": 4.9848, "mean_token_accuracy": 0.2099633187055588, "num_tokens": 81795660.0, "step": 47145 }, { "entropy": 5.75711874961853, "epoch": 3.6684302664851196, "grad_norm": 1.3515625, "learning_rate": 0.00036958588494023705, "loss": 4.848, "mean_token_accuracy": 0.2137064129114151, "num_tokens": 81803850.0, "step": 47150 }, { "entropy": 5.868940353393555, "epoch": 3.6688192958568373, "grad_norm": 1.2265625, "learning_rate": 0.0003695607365576551, "loss": 4.9531, "mean_token_accuracy": 0.21491249054670333, "num_tokens": 81813210.0, "step": 47155 }, { "entropy": 5.870437097549439, "epoch": 3.6692083252285546, "grad_norm": 1.4609375, "learning_rate": 0.0003695355867402646, "loss": 4.987, "mean_token_accuracy": 0.21909279525279998, "num_tokens": 81821892.0, "step": 47160 }, { "entropy": 5.824654197692871, "epoch": 3.6695973546002723, "grad_norm": 1.3359375, "learning_rate": 0.000369510435488447, "loss": 4.9022, "mean_token_accuracy": 0.21735740303993226, "num_tokens": 81830516.0, "step": 47165 }, { "entropy": 5.862827110290527, "epoch": 3.66998638397199, "grad_norm": 1.234375, "learning_rate": 0.000369485282802584, "loss": 5.0382, "mean_token_accuracy": 0.20220848321914672, "num_tokens": 81839613.0, "step": 47170 }, { "entropy": 5.884251546859741, "epoch": 3.6703754133437076, "grad_norm": 1.3203125, "learning_rate": 0.00036946012868305716, "loss": 5.0053, "mean_token_accuracy": 0.21161291897296905, "num_tokens": 81847693.0, "step": 47175 }, { "entropy": 5.875396060943603, "epoch": 3.670764442715425, "grad_norm": 1.3359375, "learning_rate": 0.0003694349731302483, "loss": 4.9236, "mean_token_accuracy": 0.22211882174015046, "num_tokens": 81856137.0, "step": 47180 }, { "entropy": 5.835538721084594, "epoch": 3.6711534720871426, "grad_norm": 1.4453125, "learning_rate": 0.0003694098161445389, "loss": 4.8805, "mean_token_accuracy": 0.21363172680139542, "num_tokens": 81865097.0, "step": 47185 }, { "entropy": 5.809325408935547, "epoch": 3.6715425014588603, "grad_norm": 1.3984375, "learning_rate": 0.0003693846577263109, "loss": 4.898, "mean_token_accuracy": 0.20695205479860307, "num_tokens": 81873923.0, "step": 47190 }, { "entropy": 5.878504848480224, "epoch": 3.6719315308305776, "grad_norm": 1.40625, "learning_rate": 0.0003693594978759459, "loss": 4.9892, "mean_token_accuracy": 0.20688411295413972, "num_tokens": 81882253.0, "step": 47195 }, { "entropy": 5.823017168045044, "epoch": 3.6723205602022952, "grad_norm": 1.265625, "learning_rate": 0.00036933433659382575, "loss": 4.91, "mean_token_accuracy": 0.20734661370515822, "num_tokens": 81890614.0, "step": 47200 }, { "entropy": 5.844015789031983, "epoch": 3.672709589574013, "grad_norm": 1.2734375, "learning_rate": 0.0003693091738803322, "loss": 4.9345, "mean_token_accuracy": 0.2156512752175331, "num_tokens": 81899101.0, "step": 47205 }, { "entropy": 5.934416627883911, "epoch": 3.6730986189457306, "grad_norm": 1.6875, "learning_rate": 0.000369284009735847, "loss": 5.017, "mean_token_accuracy": 0.21558071970939635, "num_tokens": 81908454.0, "step": 47210 }, { "entropy": 5.863157081604004, "epoch": 3.673487648317448, "grad_norm": 1.3359375, "learning_rate": 0.0003692588441607521, "loss": 4.9518, "mean_token_accuracy": 0.21059620082378389, "num_tokens": 81916963.0, "step": 47215 }, { "entropy": 5.857166051864624, "epoch": 3.6738766776891656, "grad_norm": 1.3984375, "learning_rate": 0.00036923367715542923, "loss": 5.0397, "mean_token_accuracy": 0.20788625478744507, "num_tokens": 81925292.0, "step": 47220 }, { "entropy": 5.919726753234864, "epoch": 3.674265707060883, "grad_norm": 1.2578125, "learning_rate": 0.00036920850872026025, "loss": 5.0039, "mean_token_accuracy": 0.21209299117326735, "num_tokens": 81934088.0, "step": 47225 }, { "entropy": 5.879449653625488, "epoch": 3.6746547364326005, "grad_norm": 1.3125, "learning_rate": 0.0003691833388556272, "loss": 4.9131, "mean_token_accuracy": 0.2174004778265953, "num_tokens": 81942656.0, "step": 47230 }, { "entropy": 5.9062388896942135, "epoch": 3.6750437658043182, "grad_norm": 1.453125, "learning_rate": 0.0003691581675619118, "loss": 5.0339, "mean_token_accuracy": 0.21296038031578063, "num_tokens": 81951493.0, "step": 47235 }, { "entropy": 5.8033582210540775, "epoch": 3.675432795176036, "grad_norm": 1.2421875, "learning_rate": 0.0003691329948394961, "loss": 4.8867, "mean_token_accuracy": 0.22258873283863068, "num_tokens": 81960149.0, "step": 47240 }, { "entropy": 5.965799331665039, "epoch": 3.675821824547753, "grad_norm": 1.3671875, "learning_rate": 0.00036910782068876204, "loss": 5.0164, "mean_token_accuracy": 0.2026522308588028, "num_tokens": 81968315.0, "step": 47245 }, { "entropy": 5.874694871902466, "epoch": 3.676210853919471, "grad_norm": 1.3671875, "learning_rate": 0.00036908264511009155, "loss": 4.9154, "mean_token_accuracy": 0.21032766848802567, "num_tokens": 81976941.0, "step": 47250 }, { "entropy": 5.887384843826294, "epoch": 3.6765998832911886, "grad_norm": 1.2734375, "learning_rate": 0.0003690574681038667, "loss": 5.0105, "mean_token_accuracy": 0.2090612143278122, "num_tokens": 81985763.0, "step": 47255 }, { "entropy": 5.787668371200562, "epoch": 3.676988912662906, "grad_norm": 1.3515625, "learning_rate": 0.00036903228967046946, "loss": 4.8828, "mean_token_accuracy": 0.21922686100006103, "num_tokens": 81994551.0, "step": 47260 }, { "entropy": 5.898846578598023, "epoch": 3.6773779420346235, "grad_norm": 1.3671875, "learning_rate": 0.0003690071098102819, "loss": 5.0024, "mean_token_accuracy": 0.21343599408864974, "num_tokens": 82002889.0, "step": 47265 }, { "entropy": 5.903883218765259, "epoch": 3.6777669714063412, "grad_norm": 1.390625, "learning_rate": 0.0003689819285236861, "loss": 5.0342, "mean_token_accuracy": 0.20295630842447282, "num_tokens": 82011137.0, "step": 47270 }, { "entropy": 5.9146342277526855, "epoch": 3.678156000778059, "grad_norm": 1.3359375, "learning_rate": 0.00036895674581106415, "loss": 4.9825, "mean_token_accuracy": 0.2116169735789299, "num_tokens": 82019857.0, "step": 47275 }, { "entropy": 5.772842121124268, "epoch": 3.678545030149776, "grad_norm": 1.1796875, "learning_rate": 0.00036893156167279803, "loss": 4.8504, "mean_token_accuracy": 0.2138437047600746, "num_tokens": 82029407.0, "step": 47280 }, { "entropy": 5.821469449996949, "epoch": 3.678934059521494, "grad_norm": 1.3203125, "learning_rate": 0.0003689063761092701, "loss": 4.9667, "mean_token_accuracy": 0.21591445654630662, "num_tokens": 82038086.0, "step": 47285 }, { "entropy": 5.855459451675415, "epoch": 3.6793230888932116, "grad_norm": 1.3359375, "learning_rate": 0.00036888118912086225, "loss": 4.9278, "mean_token_accuracy": 0.22176550030708314, "num_tokens": 82046696.0, "step": 47290 }, { "entropy": 5.871962404251098, "epoch": 3.679712118264929, "grad_norm": 1.4453125, "learning_rate": 0.0003688560007079569, "loss": 5.0101, "mean_token_accuracy": 0.2026022955775261, "num_tokens": 82056082.0, "step": 47295 }, { "entropy": 5.876474809646607, "epoch": 3.6801011476366465, "grad_norm": 1.296875, "learning_rate": 0.000368830810870936, "loss": 4.9616, "mean_token_accuracy": 0.2131582498550415, "num_tokens": 82065008.0, "step": 47300 }, { "entropy": 5.818769693374634, "epoch": 3.6804901770083642, "grad_norm": 1.3203125, "learning_rate": 0.000368805619610182, "loss": 4.9, "mean_token_accuracy": 0.21206071525812148, "num_tokens": 82073722.0, "step": 47305 }, { "entropy": 5.7744122505187985, "epoch": 3.680879206380082, "grad_norm": 1.171875, "learning_rate": 0.00036878042692607693, "loss": 4.9423, "mean_token_accuracy": 0.21160048842430115, "num_tokens": 82082240.0, "step": 47310 }, { "entropy": 5.857927370071411, "epoch": 3.681268235751799, "grad_norm": 1.328125, "learning_rate": 0.00036875523281900324, "loss": 4.9264, "mean_token_accuracy": 0.21341080367565154, "num_tokens": 82090954.0, "step": 47315 }, { "entropy": 5.903256559371949, "epoch": 3.681657265123517, "grad_norm": 1.28125, "learning_rate": 0.0003687300372893431, "loss": 5.0487, "mean_token_accuracy": 0.2102670818567276, "num_tokens": 82099426.0, "step": 47320 }, { "entropy": 5.957647228240967, "epoch": 3.682046294495234, "grad_norm": 1.40625, "learning_rate": 0.00036870484033747883, "loss": 5.0247, "mean_token_accuracy": 0.20761010497808458, "num_tokens": 82107240.0, "step": 47325 }, { "entropy": 5.946564054489135, "epoch": 3.682435323866952, "grad_norm": 1.3828125, "learning_rate": 0.00036867964196379274, "loss": 5.0442, "mean_token_accuracy": 0.2088195025920868, "num_tokens": 82115985.0, "step": 47330 }, { "entropy": 5.900092697143554, "epoch": 3.6828243532386695, "grad_norm": 1.375, "learning_rate": 0.0003686544421686672, "loss": 5.0001, "mean_token_accuracy": 0.20620049089193343, "num_tokens": 82124820.0, "step": 47335 }, { "entropy": 5.820423316955567, "epoch": 3.683213382610387, "grad_norm": 1.3984375, "learning_rate": 0.00036862924095248457, "loss": 4.8942, "mean_token_accuracy": 0.22637704461812974, "num_tokens": 82133124.0, "step": 47340 }, { "entropy": 5.917011260986328, "epoch": 3.683602411982105, "grad_norm": 1.4453125, "learning_rate": 0.00036860403831562717, "loss": 5.0873, "mean_token_accuracy": 0.2039943218231201, "num_tokens": 82141524.0, "step": 47345 }, { "entropy": 5.951389026641846, "epoch": 3.683991441353822, "grad_norm": 1.3671875, "learning_rate": 0.0003685788342584775, "loss": 5.0325, "mean_token_accuracy": 0.20540373027324677, "num_tokens": 82150068.0, "step": 47350 }, { "entropy": 5.865971231460572, "epoch": 3.68438047072554, "grad_norm": 1.2734375, "learning_rate": 0.000368553628781418, "loss": 4.9903, "mean_token_accuracy": 0.20933420062065125, "num_tokens": 82159642.0, "step": 47355 }, { "entropy": 5.8826268196105955, "epoch": 3.684769500097257, "grad_norm": 1.5234375, "learning_rate": 0.0003685284218848311, "loss": 4.8981, "mean_token_accuracy": 0.21715060770511627, "num_tokens": 82168501.0, "step": 47360 }, { "entropy": 5.91005859375, "epoch": 3.685158529468975, "grad_norm": 1.4296875, "learning_rate": 0.00036850321356909926, "loss": 5.063, "mean_token_accuracy": 0.2033192679286003, "num_tokens": 82178517.0, "step": 47365 }, { "entropy": 5.885046672821045, "epoch": 3.6855475588406925, "grad_norm": 1.515625, "learning_rate": 0.00036847800383460493, "loss": 5.0349, "mean_token_accuracy": 0.2118054062128067, "num_tokens": 82186271.0, "step": 47370 }, { "entropy": 5.931359386444091, "epoch": 3.68593658821241, "grad_norm": 1.34375, "learning_rate": 0.00036845279268173076, "loss": 5.0371, "mean_token_accuracy": 0.21168748736381532, "num_tokens": 82195731.0, "step": 47375 }, { "entropy": 5.768580770492553, "epoch": 3.6863256175841275, "grad_norm": 1.34375, "learning_rate": 0.00036842758011085914, "loss": 4.8757, "mean_token_accuracy": 0.21822210252285004, "num_tokens": 82204179.0, "step": 47380 }, { "entropy": 5.836758184432983, "epoch": 3.686714646955845, "grad_norm": 1.390625, "learning_rate": 0.0003684023661223727, "loss": 4.9807, "mean_token_accuracy": 0.21092383116483687, "num_tokens": 82212549.0, "step": 47385 }, { "entropy": 5.854185009002686, "epoch": 3.687103676327563, "grad_norm": 1.3671875, "learning_rate": 0.00036837715071665403, "loss": 4.9212, "mean_token_accuracy": 0.21795668601989746, "num_tokens": 82221434.0, "step": 47390 }, { "entropy": 5.894934368133545, "epoch": 3.68749270569928, "grad_norm": 1.3125, "learning_rate": 0.0003683519338940857, "loss": 4.9621, "mean_token_accuracy": 0.2134670913219452, "num_tokens": 82230869.0, "step": 47395 }, { "entropy": 5.929989242553711, "epoch": 3.687881735070998, "grad_norm": 1.328125, "learning_rate": 0.00036832671565505045, "loss": 4.9918, "mean_token_accuracy": 0.2142057552933693, "num_tokens": 82239238.0, "step": 47400 }, { "entropy": 5.904805278778076, "epoch": 3.6882707644427155, "grad_norm": 1.4375, "learning_rate": 0.0003683014959999307, "loss": 5.0615, "mean_token_accuracy": 0.20968099385499955, "num_tokens": 82247588.0, "step": 47405 }, { "entropy": 5.900343179702759, "epoch": 3.688659793814433, "grad_norm": 1.3828125, "learning_rate": 0.0003682762749291094, "loss": 4.9503, "mean_token_accuracy": 0.21503131687641144, "num_tokens": 82255372.0, "step": 47410 }, { "entropy": 5.895303630828858, "epoch": 3.6890488231861505, "grad_norm": 1.3359375, "learning_rate": 0.000368251052442969, "loss": 5.0113, "mean_token_accuracy": 0.20724520683288575, "num_tokens": 82263399.0, "step": 47415 }, { "entropy": 5.87931489944458, "epoch": 3.689437852557868, "grad_norm": 1.2421875, "learning_rate": 0.00036822582854189234, "loss": 4.9444, "mean_token_accuracy": 0.21244235336780548, "num_tokens": 82272394.0, "step": 47420 }, { "entropy": 5.831026411056518, "epoch": 3.6898268819295854, "grad_norm": 1.2421875, "learning_rate": 0.000368200603226262, "loss": 4.9457, "mean_token_accuracy": 0.21571694910526276, "num_tokens": 82282342.0, "step": 47425 }, { "entropy": 5.945184659957886, "epoch": 3.690215911301303, "grad_norm": 1.28125, "learning_rate": 0.000368175376496461, "loss": 5.0425, "mean_token_accuracy": 0.20774406045675278, "num_tokens": 82291727.0, "step": 47430 }, { "entropy": 5.929994201660156, "epoch": 3.690604940673021, "grad_norm": 1.2890625, "learning_rate": 0.0003681501483528719, "loss": 4.9638, "mean_token_accuracy": 0.20847769528627397, "num_tokens": 82300606.0, "step": 47435 }, { "entropy": 5.929299592971802, "epoch": 3.6909939700447385, "grad_norm": 1.484375, "learning_rate": 0.0003681249187958776, "loss": 4.9924, "mean_token_accuracy": 0.21280840188264846, "num_tokens": 82309034.0, "step": 47440 }, { "entropy": 5.844507074356079, "epoch": 3.691382999416456, "grad_norm": 1.2578125, "learning_rate": 0.00036809968782586087, "loss": 4.9232, "mean_token_accuracy": 0.21318621784448624, "num_tokens": 82317850.0, "step": 47445 }, { "entropy": 5.821482133865357, "epoch": 3.6917720287881735, "grad_norm": 1.40625, "learning_rate": 0.0003680744554432045, "loss": 4.9317, "mean_token_accuracy": 0.21581053882837295, "num_tokens": 82326471.0, "step": 47450 }, { "entropy": 5.9228750705719, "epoch": 3.692161058159891, "grad_norm": 1.3828125, "learning_rate": 0.00036804922164829153, "loss": 5.0178, "mean_token_accuracy": 0.2060135453939438, "num_tokens": 82335138.0, "step": 47455 }, { "entropy": 5.893397045135498, "epoch": 3.6925500875316084, "grad_norm": 1.375, "learning_rate": 0.0003680239864415046, "loss": 5.011, "mean_token_accuracy": 0.21087074428796768, "num_tokens": 82344208.0, "step": 47460 }, { "entropy": 5.878235673904419, "epoch": 3.692939116903326, "grad_norm": 1.40625, "learning_rate": 0.0003679987498232268, "loss": 4.9948, "mean_token_accuracy": 0.21751565337181092, "num_tokens": 82353778.0, "step": 47465 }, { "entropy": 5.859918546676636, "epoch": 3.693328146275044, "grad_norm": 1.375, "learning_rate": 0.000367973511793841, "loss": 4.9201, "mean_token_accuracy": 0.21796105653047562, "num_tokens": 82362198.0, "step": 47470 }, { "entropy": 5.916689157485962, "epoch": 3.6937171756467615, "grad_norm": 1.453125, "learning_rate": 0.00036794827235373006, "loss": 5.0067, "mean_token_accuracy": 0.21473181694746019, "num_tokens": 82371274.0, "step": 47475 }, { "entropy": 5.87775673866272, "epoch": 3.6941062050184788, "grad_norm": 1.4453125, "learning_rate": 0.0003679230315032772, "loss": 5.0131, "mean_token_accuracy": 0.2055780529975891, "num_tokens": 82380107.0, "step": 47480 }, { "entropy": 5.825700330734253, "epoch": 3.6944952343901964, "grad_norm": 1.4921875, "learning_rate": 0.0003678977892428651, "loss": 4.8962, "mean_token_accuracy": 0.2171643406152725, "num_tokens": 82388874.0, "step": 47485 }, { "entropy": 5.948813152313233, "epoch": 3.694884263761914, "grad_norm": 1.359375, "learning_rate": 0.0003678725455728769, "loss": 5.0736, "mean_token_accuracy": 0.20502327531576156, "num_tokens": 82397015.0, "step": 47490 }, { "entropy": 5.866436958312988, "epoch": 3.6952732931336314, "grad_norm": 1.390625, "learning_rate": 0.00036784730049369577, "loss": 4.944, "mean_token_accuracy": 0.21051363945007323, "num_tokens": 82405870.0, "step": 47495 }, { "entropy": 5.898384141921997, "epoch": 3.695662322505349, "grad_norm": 1.3125, "learning_rate": 0.0003678220540057045, "loss": 4.9933, "mean_token_accuracy": 0.20920102894306183, "num_tokens": 82415120.0, "step": 47500 }, { "entropy": 5.821006965637207, "epoch": 3.696051351877067, "grad_norm": 1.328125, "learning_rate": 0.00036779680610928635, "loss": 4.9479, "mean_token_accuracy": 0.21709294021129608, "num_tokens": 82423082.0, "step": 47505 }, { "entropy": 5.841439867019654, "epoch": 3.6964403812487845, "grad_norm": 1.3203125, "learning_rate": 0.0003677715568048244, "loss": 4.9711, "mean_token_accuracy": 0.21107546091079712, "num_tokens": 82431250.0, "step": 47510 }, { "entropy": 5.8742344856262205, "epoch": 3.6968294106205017, "grad_norm": 1.3359375, "learning_rate": 0.00036774630609270165, "loss": 5.0624, "mean_token_accuracy": 0.20867359936237334, "num_tokens": 82439731.0, "step": 47515 }, { "entropy": 5.928369188308716, "epoch": 3.6972184399922194, "grad_norm": 1.4375, "learning_rate": 0.00036772105397330147, "loss": 5.1073, "mean_token_accuracy": 0.21032053381204605, "num_tokens": 82447808.0, "step": 47520 }, { "entropy": 5.912308311462402, "epoch": 3.697607469363937, "grad_norm": 1.4375, "learning_rate": 0.0003676958004470067, "loss": 4.9694, "mean_token_accuracy": 0.2006336823105812, "num_tokens": 82456030.0, "step": 47525 }, { "entropy": 5.9012779712677, "epoch": 3.6979964987356544, "grad_norm": 1.3203125, "learning_rate": 0.0003676705455142009, "loss": 4.9431, "mean_token_accuracy": 0.20773434787988662, "num_tokens": 82465368.0, "step": 47530 }, { "entropy": 5.929051542282105, "epoch": 3.698385528107372, "grad_norm": 1.2890625, "learning_rate": 0.0003676452891752669, "loss": 5.0192, "mean_token_accuracy": 0.21657595336437224, "num_tokens": 82473615.0, "step": 47535 }, { "entropy": 5.928440523147583, "epoch": 3.69877455747909, "grad_norm": 1.296875, "learning_rate": 0.0003676200314305882, "loss": 5.0005, "mean_token_accuracy": 0.21071732342243193, "num_tokens": 82482603.0, "step": 47540 }, { "entropy": 5.861611557006836, "epoch": 3.6991635868508075, "grad_norm": 1.2265625, "learning_rate": 0.0003675947722805479, "loss": 4.98, "mean_token_accuracy": 0.2089359000325203, "num_tokens": 82491807.0, "step": 47545 }, { "entropy": 5.88281283378601, "epoch": 3.6995526162225247, "grad_norm": 1.4375, "learning_rate": 0.0003675695117255293, "loss": 4.9581, "mean_token_accuracy": 0.21827838122844695, "num_tokens": 82500288.0, "step": 47550 }, { "entropy": 5.8631415367126465, "epoch": 3.6999416455942424, "grad_norm": 1.265625, "learning_rate": 0.0003675442497659157, "loss": 4.8998, "mean_token_accuracy": 0.21825513988733292, "num_tokens": 82509272.0, "step": 47555 }, { "entropy": 5.848896121978759, "epoch": 3.7003306749659597, "grad_norm": 1.3515625, "learning_rate": 0.0003675189864020905, "loss": 4.8554, "mean_token_accuracy": 0.219254207611084, "num_tokens": 82518121.0, "step": 47560 }, { "entropy": 5.873148679733276, "epoch": 3.7007197043376774, "grad_norm": 1.34375, "learning_rate": 0.0003674937216344368, "loss": 4.9385, "mean_token_accuracy": 0.21447642147541046, "num_tokens": 82527110.0, "step": 47565 }, { "entropy": 5.851773691177368, "epoch": 3.701108733709395, "grad_norm": 1.4296875, "learning_rate": 0.0003674684554633382, "loss": 5.0215, "mean_token_accuracy": 0.20834087580442429, "num_tokens": 82536493.0, "step": 47570 }, { "entropy": 5.89495964050293, "epoch": 3.701497763081113, "grad_norm": 1.2578125, "learning_rate": 0.0003674431878891779, "loss": 4.9203, "mean_token_accuracy": 0.21307066828012466, "num_tokens": 82545214.0, "step": 47575 }, { "entropy": 5.891555643081665, "epoch": 3.70188679245283, "grad_norm": 1.5703125, "learning_rate": 0.0003674179189123393, "loss": 5.0538, "mean_token_accuracy": 0.20723798274993896, "num_tokens": 82552947.0, "step": 47580 }, { "entropy": 5.889625453948975, "epoch": 3.7022758218245477, "grad_norm": 1.4375, "learning_rate": 0.00036739264853320606, "loss": 4.9951, "mean_token_accuracy": 0.21966756582260133, "num_tokens": 82560812.0, "step": 47585 }, { "entropy": 5.803754663467407, "epoch": 3.7026648511962654, "grad_norm": 1.28125, "learning_rate": 0.00036736737675216127, "loss": 4.9272, "mean_token_accuracy": 0.21546991914510727, "num_tokens": 82569494.0, "step": 47590 }, { "entropy": 5.88056788444519, "epoch": 3.7030538805679827, "grad_norm": 1.3828125, "learning_rate": 0.0003673421035695887, "loss": 4.8955, "mean_token_accuracy": 0.20866105258464812, "num_tokens": 82577194.0, "step": 47595 }, { "entropy": 5.892652273178101, "epoch": 3.7034429099397004, "grad_norm": 1.21875, "learning_rate": 0.0003673168289858716, "loss": 4.978, "mean_token_accuracy": 0.20659514814615249, "num_tokens": 82585652.0, "step": 47600 }, { "entropy": 5.845430660247803, "epoch": 3.703831939311418, "grad_norm": 1.3125, "learning_rate": 0.0003672915530013936, "loss": 5.0027, "mean_token_accuracy": 0.21350591331720353, "num_tokens": 82595044.0, "step": 47605 }, { "entropy": 5.897797060012818, "epoch": 3.7042209686831358, "grad_norm": 1.3671875, "learning_rate": 0.00036726627561653815, "loss": 5.0273, "mean_token_accuracy": 0.20445096492767334, "num_tokens": 82603483.0, "step": 47610 }, { "entropy": 5.952613258361817, "epoch": 3.704609998054853, "grad_norm": 1.4296875, "learning_rate": 0.0003672409968316888, "loss": 5.0802, "mean_token_accuracy": 0.20293897539377212, "num_tokens": 82611632.0, "step": 47615 }, { "entropy": 5.868357372283936, "epoch": 3.7049990274265707, "grad_norm": 1.375, "learning_rate": 0.00036721571664722914, "loss": 4.944, "mean_token_accuracy": 0.21880002468824386, "num_tokens": 82620595.0, "step": 47620 }, { "entropy": 5.914335441589356, "epoch": 3.7053880567982884, "grad_norm": 1.328125, "learning_rate": 0.0003671904350635428, "loss": 5.0635, "mean_token_accuracy": 0.20641884803771973, "num_tokens": 82630140.0, "step": 47625 }, { "entropy": 5.8944004535675045, "epoch": 3.7057770861700057, "grad_norm": 1.28125, "learning_rate": 0.00036716515208101334, "loss": 5.0077, "mean_token_accuracy": 0.20012824535369872, "num_tokens": 82639361.0, "step": 47630 }, { "entropy": 5.9419232368469235, "epoch": 3.7061661155417234, "grad_norm": 1.421875, "learning_rate": 0.0003671398677000244, "loss": 5.0266, "mean_token_accuracy": 0.2084161639213562, "num_tokens": 82647248.0, "step": 47635 }, { "entropy": 5.913771533966065, "epoch": 3.706555144913441, "grad_norm": 1.4609375, "learning_rate": 0.0003671145819209596, "loss": 4.9237, "mean_token_accuracy": 0.21914731115102767, "num_tokens": 82655428.0, "step": 47640 }, { "entropy": 5.8054060459136965, "epoch": 3.7069441742851588, "grad_norm": 1.2890625, "learning_rate": 0.0003670892947442026, "loss": 4.9082, "mean_token_accuracy": 0.21999040395021438, "num_tokens": 82664079.0, "step": 47645 }, { "entropy": 5.856548833847046, "epoch": 3.707333203656876, "grad_norm": 1.359375, "learning_rate": 0.0003670640061701371, "loss": 5.005, "mean_token_accuracy": 0.20887198448181152, "num_tokens": 82672557.0, "step": 47650 }, { "entropy": 5.888843679428101, "epoch": 3.7077222330285937, "grad_norm": 1.3046875, "learning_rate": 0.0003670387161991469, "loss": 4.9831, "mean_token_accuracy": 0.21221133470535278, "num_tokens": 82681247.0, "step": 47655 }, { "entropy": 5.8657567501068115, "epoch": 3.708111262400311, "grad_norm": 1.3203125, "learning_rate": 0.0003670134248316157, "loss": 4.8815, "mean_token_accuracy": 0.22012775242328644, "num_tokens": 82690631.0, "step": 47660 }, { "entropy": 5.934181070327758, "epoch": 3.7085002917720287, "grad_norm": 1.46875, "learning_rate": 0.00036698813206792724, "loss": 5.0575, "mean_token_accuracy": 0.2045275166630745, "num_tokens": 82699244.0, "step": 47665 }, { "entropy": 5.909397745132447, "epoch": 3.7088893211437464, "grad_norm": 1.328125, "learning_rate": 0.00036696283790846524, "loss": 4.982, "mean_token_accuracy": 0.20795222371816635, "num_tokens": 82707630.0, "step": 47670 }, { "entropy": 5.928687810897827, "epoch": 3.709278350515464, "grad_norm": 1.53125, "learning_rate": 0.00036693754235361364, "loss": 5.0228, "mean_token_accuracy": 0.20884073227643968, "num_tokens": 82716853.0, "step": 47675 }, { "entropy": 5.935403108596802, "epoch": 3.7096673798871818, "grad_norm": 1.3359375, "learning_rate": 0.0003669122454037561, "loss": 5.0022, "mean_token_accuracy": 0.20814314633607864, "num_tokens": 82725350.0, "step": 47680 }, { "entropy": 5.841417741775513, "epoch": 3.710056409258899, "grad_norm": 1.3828125, "learning_rate": 0.0003668869470592765, "loss": 4.9889, "mean_token_accuracy": 0.22059328407049178, "num_tokens": 82734021.0, "step": 47685 }, { "entropy": 5.831270599365235, "epoch": 3.7104454386306167, "grad_norm": 1.4375, "learning_rate": 0.00036686164732055876, "loss": 4.9146, "mean_token_accuracy": 0.21359071731567383, "num_tokens": 82742086.0, "step": 47690 }, { "entropy": 5.816365051269531, "epoch": 3.710834468002334, "grad_norm": 1.453125, "learning_rate": 0.00036683634618798675, "loss": 4.8824, "mean_token_accuracy": 0.21874499022960664, "num_tokens": 82750382.0, "step": 47695 }, { "entropy": 5.905793523788452, "epoch": 3.7112234973740517, "grad_norm": 1.3359375, "learning_rate": 0.0003668110436619443, "loss": 5.0801, "mean_token_accuracy": 0.20578447729349136, "num_tokens": 82759118.0, "step": 47700 }, { "entropy": 5.92527494430542, "epoch": 3.7116125267457694, "grad_norm": 1.3828125, "learning_rate": 0.00036678573974281546, "loss": 5.0646, "mean_token_accuracy": 0.2041286736726761, "num_tokens": 82767742.0, "step": 47705 }, { "entropy": 5.926243019104004, "epoch": 3.712001556117487, "grad_norm": 1.3828125, "learning_rate": 0.0003667604344309841, "loss": 5.0432, "mean_token_accuracy": 0.20635371506214142, "num_tokens": 82776608.0, "step": 47710 }, { "entropy": 5.875054883956909, "epoch": 3.7123905854892043, "grad_norm": 1.3203125, "learning_rate": 0.00036673512772683424, "loss": 4.8911, "mean_token_accuracy": 0.21911421567201614, "num_tokens": 82785090.0, "step": 47715 }, { "entropy": 5.915210819244384, "epoch": 3.712779614860922, "grad_norm": 1.359375, "learning_rate": 0.0003667098196307498, "loss": 5.0783, "mean_token_accuracy": 0.20266338139772416, "num_tokens": 82793222.0, "step": 47720 }, { "entropy": 5.966049528121948, "epoch": 3.7131686442326397, "grad_norm": 1.4375, "learning_rate": 0.00036668451014311475, "loss": 5.0771, "mean_token_accuracy": 0.20689714401960374, "num_tokens": 82801991.0, "step": 47725 }, { "entropy": 5.902362632751465, "epoch": 3.713557673604357, "grad_norm": 1.4609375, "learning_rate": 0.00036665919926431325, "loss": 4.9645, "mean_token_accuracy": 0.2159545212984085, "num_tokens": 82809972.0, "step": 47730 }, { "entropy": 5.8952607154846195, "epoch": 3.7139467029760747, "grad_norm": 1.2890625, "learning_rate": 0.0003666338869947293, "loss": 5.0197, "mean_token_accuracy": 0.21077741235494613, "num_tokens": 82819244.0, "step": 47735 }, { "entropy": 5.882529306411743, "epoch": 3.7143357323477924, "grad_norm": 1.328125, "learning_rate": 0.0003666085733347469, "loss": 4.9142, "mean_token_accuracy": 0.21556648313999177, "num_tokens": 82827725.0, "step": 47740 }, { "entropy": 5.796825551986695, "epoch": 3.71472476171951, "grad_norm": 1.3359375, "learning_rate": 0.00036658325828475033, "loss": 4.9029, "mean_token_accuracy": 0.22155662029981613, "num_tokens": 82835599.0, "step": 47745 }, { "entropy": 5.835478639602661, "epoch": 3.7151137910912273, "grad_norm": 1.2109375, "learning_rate": 0.0003665579418451235, "loss": 4.907, "mean_token_accuracy": 0.2176805019378662, "num_tokens": 82844592.0, "step": 47750 }, { "entropy": 5.892356300354004, "epoch": 3.715502820462945, "grad_norm": 1.25, "learning_rate": 0.0003665326240162506, "loss": 5.034, "mean_token_accuracy": 0.21091899573802947, "num_tokens": 82853648.0, "step": 47755 }, { "entropy": 5.952601623535156, "epoch": 3.7158918498346623, "grad_norm": 2.21875, "learning_rate": 0.00036650730479851593, "loss": 4.9701, "mean_token_accuracy": 0.21267052441835405, "num_tokens": 82862328.0, "step": 47760 }, { "entropy": 5.912382888793945, "epoch": 3.71628087920638, "grad_norm": 1.328125, "learning_rate": 0.00036648198419230344, "loss": 5.0296, "mean_token_accuracy": 0.21655944138765335, "num_tokens": 82870870.0, "step": 47765 }, { "entropy": 5.8687700748443605, "epoch": 3.7166699085780976, "grad_norm": 1.296875, "learning_rate": 0.00036645666219799753, "loss": 4.9685, "mean_token_accuracy": 0.20914117693901063, "num_tokens": 82879913.0, "step": 47770 }, { "entropy": 5.921257543563843, "epoch": 3.7170589379498153, "grad_norm": 1.4375, "learning_rate": 0.0003664313388159823, "loss": 4.9868, "mean_token_accuracy": 0.20879445374011993, "num_tokens": 82888821.0, "step": 47775 }, { "entropy": 5.848430204391479, "epoch": 3.717447967321533, "grad_norm": 1.3203125, "learning_rate": 0.000366406014046642, "loss": 4.9003, "mean_token_accuracy": 0.21648698002099992, "num_tokens": 82897539.0, "step": 47780 }, { "entropy": 5.828088760375977, "epoch": 3.7178369966932503, "grad_norm": 1.390625, "learning_rate": 0.000366380687890361, "loss": 4.912, "mean_token_accuracy": 0.2196787491440773, "num_tokens": 82905875.0, "step": 47785 }, { "entropy": 5.757492637634277, "epoch": 3.718226026064968, "grad_norm": 1.4296875, "learning_rate": 0.0003663553603475235, "loss": 4.8842, "mean_token_accuracy": 0.2143015593290329, "num_tokens": 82913781.0, "step": 47790 }, { "entropy": 5.840970039367676, "epoch": 3.7186150554366852, "grad_norm": 1.3984375, "learning_rate": 0.00036633003141851373, "loss": 4.9065, "mean_token_accuracy": 0.21258942037820816, "num_tokens": 82922688.0, "step": 47795 }, { "entropy": 5.896210765838623, "epoch": 3.719004084808403, "grad_norm": 1.2578125, "learning_rate": 0.0003663047011037162, "loss": 5.0413, "mean_token_accuracy": 0.2105635419487953, "num_tokens": 82931682.0, "step": 47800 }, { "entropy": 5.934612846374511, "epoch": 3.7193931141801206, "grad_norm": 1.390625, "learning_rate": 0.0003662793694035151, "loss": 5.0093, "mean_token_accuracy": 0.20816944986581803, "num_tokens": 82939838.0, "step": 47805 }, { "entropy": 5.930421829223633, "epoch": 3.7197821435518383, "grad_norm": 1.3359375, "learning_rate": 0.0003662540363182949, "loss": 5.0685, "mean_token_accuracy": 0.20340142548084258, "num_tokens": 82948655.0, "step": 47810 }, { "entropy": 5.9347755908966064, "epoch": 3.7201711729235556, "grad_norm": 1.3671875, "learning_rate": 0.0003662287018484398, "loss": 5.0467, "mean_token_accuracy": 0.2129087671637535, "num_tokens": 82957884.0, "step": 47815 }, { "entropy": 5.88123517036438, "epoch": 3.7205602022952733, "grad_norm": 1.3359375, "learning_rate": 0.0003662033659943345, "loss": 5.0007, "mean_token_accuracy": 0.2183639660477638, "num_tokens": 82966164.0, "step": 47820 }, { "entropy": 5.899237871170044, "epoch": 3.720949231666991, "grad_norm": 1.328125, "learning_rate": 0.00036617802875636333, "loss": 4.9434, "mean_token_accuracy": 0.2165793001651764, "num_tokens": 82975010.0, "step": 47825 }, { "entropy": 5.931487035751343, "epoch": 3.7213382610387082, "grad_norm": 1.421875, "learning_rate": 0.0003661526901349106, "loss": 5.0362, "mean_token_accuracy": 0.21135224103927613, "num_tokens": 82984302.0, "step": 47830 }, { "entropy": 5.826360082626342, "epoch": 3.721727290410426, "grad_norm": 1.328125, "learning_rate": 0.00036612735013036085, "loss": 4.9826, "mean_token_accuracy": 0.20848394930362701, "num_tokens": 82992886.0, "step": 47835 }, { "entropy": 5.838512182235718, "epoch": 3.7221163197821436, "grad_norm": 1.4296875, "learning_rate": 0.0003661020087430987, "loss": 4.9641, "mean_token_accuracy": 0.21535406708717347, "num_tokens": 83000840.0, "step": 47840 }, { "entropy": 5.920995044708252, "epoch": 3.7225053491538613, "grad_norm": 1.3359375, "learning_rate": 0.0003660766659735086, "loss": 4.9405, "mean_token_accuracy": 0.21438690423965454, "num_tokens": 83009410.0, "step": 47845 }, { "entropy": 5.84325475692749, "epoch": 3.7228943785255786, "grad_norm": 1.328125, "learning_rate": 0.0003660513218219749, "loss": 4.9601, "mean_token_accuracy": 0.22165871262550355, "num_tokens": 83018738.0, "step": 47850 }, { "entropy": 5.8683864116668705, "epoch": 3.7232834078972963, "grad_norm": 1.375, "learning_rate": 0.0003660259762888824, "loss": 5.0175, "mean_token_accuracy": 0.20600922554731368, "num_tokens": 83027234.0, "step": 47855 }, { "entropy": 5.870380449295044, "epoch": 3.7236724372690135, "grad_norm": 1.34375, "learning_rate": 0.0003660006293746156, "loss": 4.9333, "mean_token_accuracy": 0.21544401496648788, "num_tokens": 83036180.0, "step": 47860 }, { "entropy": 5.947040319442749, "epoch": 3.7240614666407312, "grad_norm": 1.4296875, "learning_rate": 0.00036597528107955914, "loss": 5.0481, "mean_token_accuracy": 0.20773148238658906, "num_tokens": 83044301.0, "step": 47865 }, { "entropy": 5.85324182510376, "epoch": 3.724450496012449, "grad_norm": 1.34375, "learning_rate": 0.00036594993140409753, "loss": 4.8294, "mean_token_accuracy": 0.2251978784799576, "num_tokens": 83052814.0, "step": 47870 }, { "entropy": 5.852813816070556, "epoch": 3.7248395253841666, "grad_norm": 1.3125, "learning_rate": 0.0003659245803486155, "loss": 5.018, "mean_token_accuracy": 0.21338242590427398, "num_tokens": 83061695.0, "step": 47875 }, { "entropy": 5.871242427825928, "epoch": 3.7252285547558843, "grad_norm": 1.6484375, "learning_rate": 0.0003658992279134977, "loss": 5.1003, "mean_token_accuracy": 0.20656393021345137, "num_tokens": 83070568.0, "step": 47880 }, { "entropy": 5.91375584602356, "epoch": 3.7256175841276016, "grad_norm": 1.4609375, "learning_rate": 0.0003658738740991287, "loss": 5.0195, "mean_token_accuracy": 0.20435935407876968, "num_tokens": 83079254.0, "step": 47885 }, { "entropy": 5.87984299659729, "epoch": 3.7260066134993193, "grad_norm": 1.3984375, "learning_rate": 0.00036584851890589335, "loss": 4.8735, "mean_token_accuracy": 0.21962738186120986, "num_tokens": 83087192.0, "step": 47890 }, { "entropy": 5.851999568939209, "epoch": 3.7263956428710365, "grad_norm": 1.3515625, "learning_rate": 0.00036582316233417636, "loss": 4.9317, "mean_token_accuracy": 0.2050440415740013, "num_tokens": 83095446.0, "step": 47895 }, { "entropy": 5.890657901763916, "epoch": 3.7267846722427542, "grad_norm": 1.515625, "learning_rate": 0.00036579780438436246, "loss": 5.0134, "mean_token_accuracy": 0.21194821298122407, "num_tokens": 83103242.0, "step": 47900 }, { "entropy": 5.792805528640747, "epoch": 3.727173701614472, "grad_norm": 1.3671875, "learning_rate": 0.0003657724450568363, "loss": 4.9234, "mean_token_accuracy": 0.21826227903366088, "num_tokens": 83112691.0, "step": 47905 }, { "entropy": 5.890968179702758, "epoch": 3.7275627309861896, "grad_norm": 1.5078125, "learning_rate": 0.0003657470843519829, "loss": 4.9975, "mean_token_accuracy": 0.21080065667629241, "num_tokens": 83120680.0, "step": 47910 }, { "entropy": 5.82760066986084, "epoch": 3.727951760357907, "grad_norm": 1.4140625, "learning_rate": 0.0003657217222701868, "loss": 4.9614, "mean_token_accuracy": 0.21651224195957183, "num_tokens": 83128777.0, "step": 47915 }, { "entropy": 5.853410148620606, "epoch": 3.7283407897296246, "grad_norm": 1.3984375, "learning_rate": 0.000365696358811833, "loss": 4.983, "mean_token_accuracy": 0.2093761071562767, "num_tokens": 83136632.0, "step": 47920 }, { "entropy": 5.896419858932495, "epoch": 3.7287298191013423, "grad_norm": 1.296875, "learning_rate": 0.00036567099397730635, "loss": 5.0274, "mean_token_accuracy": 0.20074321925640107, "num_tokens": 83145069.0, "step": 47925 }, { "entropy": 5.852449655532837, "epoch": 3.7291188484730595, "grad_norm": 1.2734375, "learning_rate": 0.0003656456277669917, "loss": 4.8675, "mean_token_accuracy": 0.2201487809419632, "num_tokens": 83154484.0, "step": 47930 }, { "entropy": 5.930552625656128, "epoch": 3.729507877844777, "grad_norm": 1.359375, "learning_rate": 0.00036562026018127386, "loss": 5.0069, "mean_token_accuracy": 0.21395441442728041, "num_tokens": 83162899.0, "step": 47935 }, { "entropy": 5.845112037658692, "epoch": 3.729896907216495, "grad_norm": 1.453125, "learning_rate": 0.00036559489122053786, "loss": 4.939, "mean_token_accuracy": 0.22011471837759017, "num_tokens": 83171171.0, "step": 47940 }, { "entropy": 5.826121997833252, "epoch": 3.7302859365882126, "grad_norm": 1.34375, "learning_rate": 0.0003655695208851686, "loss": 4.9389, "mean_token_accuracy": 0.21325213313102723, "num_tokens": 83179139.0, "step": 47945 }, { "entropy": 5.9026415824890135, "epoch": 3.73067496595993, "grad_norm": 1.375, "learning_rate": 0.00036554414917555096, "loss": 4.9968, "mean_token_accuracy": 0.20919049382209778, "num_tokens": 83187729.0, "step": 47950 }, { "entropy": 5.928280019760132, "epoch": 3.7310639953316476, "grad_norm": 1.3828125, "learning_rate": 0.00036551877609207, "loss": 5.0385, "mean_token_accuracy": 0.20397934019565583, "num_tokens": 83195930.0, "step": 47955 }, { "entropy": 5.773700904846192, "epoch": 3.7314530247033653, "grad_norm": 1.4609375, "learning_rate": 0.0003654934016351107, "loss": 4.8877, "mean_token_accuracy": 0.21167474389076232, "num_tokens": 83203926.0, "step": 47960 }, { "entropy": 5.851754093170166, "epoch": 3.7318420540750825, "grad_norm": 1.421875, "learning_rate": 0.00036546802580505805, "loss": 4.9056, "mean_token_accuracy": 0.21901919245719909, "num_tokens": 83212385.0, "step": 47965 }, { "entropy": 5.857619047164917, "epoch": 3.7322310834468, "grad_norm": 1.2109375, "learning_rate": 0.0003654426486022971, "loss": 4.9613, "mean_token_accuracy": 0.2167314112186432, "num_tokens": 83221011.0, "step": 47970 }, { "entropy": 5.883874464035034, "epoch": 3.732620112818518, "grad_norm": 1.2109375, "learning_rate": 0.0003654172700272129, "loss": 4.9297, "mean_token_accuracy": 0.22126694321632384, "num_tokens": 83230554.0, "step": 47975 }, { "entropy": 5.856896591186524, "epoch": 3.7330091421902356, "grad_norm": 1.1875, "learning_rate": 0.0003653918900801905, "loss": 4.9704, "mean_token_accuracy": 0.21048498302698135, "num_tokens": 83239959.0, "step": 47980 }, { "entropy": 5.9156165599823, "epoch": 3.733398171561953, "grad_norm": 1.453125, "learning_rate": 0.00036536650876161514, "loss": 5.0862, "mean_token_accuracy": 0.19858671128749847, "num_tokens": 83248345.0, "step": 47985 }, { "entropy": 5.8642051219940186, "epoch": 3.7337872009336706, "grad_norm": 1.296875, "learning_rate": 0.0003653411260718718, "loss": 4.899, "mean_token_accuracy": 0.2160438358783722, "num_tokens": 83256285.0, "step": 47990 }, { "entropy": 5.854768896102906, "epoch": 3.734176230305388, "grad_norm": 1.40625, "learning_rate": 0.0003653157420113457, "loss": 4.9405, "mean_token_accuracy": 0.2179851844906807, "num_tokens": 83264685.0, "step": 47995 }, { "entropy": 5.862247896194458, "epoch": 3.7345652596771055, "grad_norm": 1.40625, "learning_rate": 0.0003652903565804219, "loss": 5.0126, "mean_token_accuracy": 0.2081531971693039, "num_tokens": 83273352.0, "step": 48000 }, { "epoch": 3.7345652596771055, "eval_entropy": 5.639032107620313, "eval_loss": 5.06563663482666, "eval_mean_token_accuracy": 0.2170177726187995, "eval_num_tokens": 83273352.0, "eval_runtime": 21.8025, "eval_samples_per_second": 1906.109, "eval_steps_per_second": 238.275, "step": 48000 }, { "entropy": 5.854826259613037, "epoch": 3.734954289048823, "grad_norm": 1.34375, "learning_rate": 0.00036526496977948574, "loss": 4.9438, "mean_token_accuracy": 0.2165261000394821, "num_tokens": 83281787.0, "step": 48005 }, { "entropy": 5.826662063598633, "epoch": 3.735343318420541, "grad_norm": 1.390625, "learning_rate": 0.00036523958160892227, "loss": 4.9827, "mean_token_accuracy": 0.20684851557016373, "num_tokens": 83290367.0, "step": 48010 }, { "entropy": 5.897960090637207, "epoch": 3.735732347792258, "grad_norm": 1.328125, "learning_rate": 0.00036521419206911684, "loss": 4.9963, "mean_token_accuracy": 0.20624033808708192, "num_tokens": 83299094.0, "step": 48015 }, { "entropy": 5.857441091537476, "epoch": 3.736121377163976, "grad_norm": 1.40625, "learning_rate": 0.0003651888011604545, "loss": 4.8983, "mean_token_accuracy": 0.22256296575069429, "num_tokens": 83308270.0, "step": 48020 }, { "entropy": 5.911079597473145, "epoch": 3.7365104065356936, "grad_norm": 1.5234375, "learning_rate": 0.00036516340888332076, "loss": 5.0409, "mean_token_accuracy": 0.20911362767219543, "num_tokens": 83316697.0, "step": 48025 }, { "entropy": 5.875934886932373, "epoch": 3.736899435907411, "grad_norm": 1.3828125, "learning_rate": 0.00036513801523810075, "loss": 4.9417, "mean_token_accuracy": 0.21533966511487962, "num_tokens": 83325281.0, "step": 48030 }, { "entropy": 5.908315420150757, "epoch": 3.7372884652791285, "grad_norm": 1.3515625, "learning_rate": 0.0003651126202251799, "loss": 5.009, "mean_token_accuracy": 0.2048704907298088, "num_tokens": 83333759.0, "step": 48035 }, { "entropy": 5.883016872406006, "epoch": 3.737677494650846, "grad_norm": 1.390625, "learning_rate": 0.0003650872238449434, "loss": 5.0132, "mean_token_accuracy": 0.2131052076816559, "num_tokens": 83342703.0, "step": 48040 }, { "entropy": 5.921681833267212, "epoch": 3.738066524022564, "grad_norm": 1.3671875, "learning_rate": 0.0003650618260977767, "loss": 4.9993, "mean_token_accuracy": 0.2101897895336151, "num_tokens": 83351521.0, "step": 48045 }, { "entropy": 5.933659648895263, "epoch": 3.738455553394281, "grad_norm": 1.328125, "learning_rate": 0.0003650364269840651, "loss": 5.0179, "mean_token_accuracy": 0.2100882723927498, "num_tokens": 83359702.0, "step": 48050 }, { "entropy": 5.913753318786621, "epoch": 3.738844582765999, "grad_norm": 1.4296875, "learning_rate": 0.0003650110265041941, "loss": 5.0499, "mean_token_accuracy": 0.2055484414100647, "num_tokens": 83368121.0, "step": 48055 }, { "entropy": 5.877788543701172, "epoch": 3.7392336121377165, "grad_norm": 1.3828125, "learning_rate": 0.00036498562465854897, "loss": 4.9389, "mean_token_accuracy": 0.21223054379224776, "num_tokens": 83376742.0, "step": 48060 }, { "entropy": 5.8548308372497555, "epoch": 3.739622641509434, "grad_norm": 1.3203125, "learning_rate": 0.0003649602214475152, "loss": 4.899, "mean_token_accuracy": 0.21868574023246765, "num_tokens": 83385825.0, "step": 48065 }, { "entropy": 5.90470323562622, "epoch": 3.7400116708811515, "grad_norm": 1.3046875, "learning_rate": 0.00036493481687147836, "loss": 5.0024, "mean_token_accuracy": 0.21145954579114914, "num_tokens": 83395339.0, "step": 48070 }, { "entropy": 5.865393161773682, "epoch": 3.740400700252869, "grad_norm": 1.2734375, "learning_rate": 0.0003649094109308237, "loss": 4.9749, "mean_token_accuracy": 0.20764390975236893, "num_tokens": 83404318.0, "step": 48075 }, { "entropy": 5.861928081512451, "epoch": 3.740789729624587, "grad_norm": 1.5078125, "learning_rate": 0.00036488400362593695, "loss": 4.9343, "mean_token_accuracy": 0.21131043285131454, "num_tokens": 83412511.0, "step": 48080 }, { "entropy": 5.843631744384766, "epoch": 3.741178758996304, "grad_norm": 1.421875, "learning_rate": 0.00036485859495720337, "loss": 5.0269, "mean_token_accuracy": 0.21402496695518494, "num_tokens": 83421628.0, "step": 48085 }, { "entropy": 5.886945390701294, "epoch": 3.741567788368022, "grad_norm": 1.3515625, "learning_rate": 0.00036483318492500875, "loss": 4.9839, "mean_token_accuracy": 0.2043114572763443, "num_tokens": 83430427.0, "step": 48090 }, { "entropy": 5.874609327316284, "epoch": 3.741956817739739, "grad_norm": 1.3203125, "learning_rate": 0.00036480777352973856, "loss": 4.961, "mean_token_accuracy": 0.21462851464748384, "num_tokens": 83440025.0, "step": 48095 }, { "entropy": 5.948618650436401, "epoch": 3.742345847111457, "grad_norm": 1.3359375, "learning_rate": 0.00036478236077177825, "loss": 5.0157, "mean_token_accuracy": 0.20820534080266953, "num_tokens": 83448457.0, "step": 48100 }, { "entropy": 5.931408452987671, "epoch": 3.7427348764831745, "grad_norm": 1.328125, "learning_rate": 0.00036475694665151357, "loss": 5.0106, "mean_token_accuracy": 0.20751720070838928, "num_tokens": 83457544.0, "step": 48105 }, { "entropy": 5.854187488555908, "epoch": 3.743123905854892, "grad_norm": 1.421875, "learning_rate": 0.00036473153116933007, "loss": 4.8941, "mean_token_accuracy": 0.21558720767498016, "num_tokens": 83466069.0, "step": 48110 }, { "entropy": 5.87074990272522, "epoch": 3.74351293522661, "grad_norm": 1.4453125, "learning_rate": 0.00036470611432561334, "loss": 4.9198, "mean_token_accuracy": 0.21550531983375548, "num_tokens": 83474847.0, "step": 48115 }, { "entropy": 5.782390689849853, "epoch": 3.743901964598327, "grad_norm": 1.3671875, "learning_rate": 0.0003646806961207492, "loss": 4.9327, "mean_token_accuracy": 0.21232952922582626, "num_tokens": 83483337.0, "step": 48120 }, { "entropy": 5.922655248641968, "epoch": 3.744290993970045, "grad_norm": 1.359375, "learning_rate": 0.00036465527655512323, "loss": 5.0735, "mean_token_accuracy": 0.19859220832586288, "num_tokens": 83492403.0, "step": 48125 }, { "entropy": 5.912694072723388, "epoch": 3.744680023341762, "grad_norm": 1.296875, "learning_rate": 0.0003646298556291211, "loss": 4.9943, "mean_token_accuracy": 0.21157421469688414, "num_tokens": 83501555.0, "step": 48130 }, { "entropy": 5.91883487701416, "epoch": 3.74506905271348, "grad_norm": 1.375, "learning_rate": 0.00036460443334312867, "loss": 5.0139, "mean_token_accuracy": 0.21132491379976273, "num_tokens": 83509886.0, "step": 48135 }, { "entropy": 5.9509519100189205, "epoch": 3.7454580820851975, "grad_norm": 1.3046875, "learning_rate": 0.0003645790096975315, "loss": 5.0074, "mean_token_accuracy": 0.21166204959154128, "num_tokens": 83518576.0, "step": 48140 }, { "entropy": 5.939409303665161, "epoch": 3.745847111456915, "grad_norm": 1.3828125, "learning_rate": 0.00036455358469271546, "loss": 5.014, "mean_token_accuracy": 0.21124004274606706, "num_tokens": 83526757.0, "step": 48145 }, { "entropy": 5.878424024581909, "epoch": 3.7462361408286324, "grad_norm": 1.3828125, "learning_rate": 0.00036452815832906625, "loss": 4.9774, "mean_token_accuracy": 0.2164441466331482, "num_tokens": 83536346.0, "step": 48150 }, { "entropy": 5.848426103591919, "epoch": 3.74662517020035, "grad_norm": 1.4453125, "learning_rate": 0.00036450273060696984, "loss": 4.8823, "mean_token_accuracy": 0.22519754767417907, "num_tokens": 83544368.0, "step": 48155 }, { "entropy": 5.871972370147705, "epoch": 3.747014199572068, "grad_norm": 1.3671875, "learning_rate": 0.0003644773015268118, "loss": 5.0114, "mean_token_accuracy": 0.2104874312877655, "num_tokens": 83553719.0, "step": 48160 }, { "entropy": 5.926652956008911, "epoch": 3.747403228943785, "grad_norm": 1.4140625, "learning_rate": 0.00036445187108897825, "loss": 4.9526, "mean_token_accuracy": 0.21617908030748367, "num_tokens": 83562180.0, "step": 48165 }, { "entropy": 5.923716115951538, "epoch": 3.747792258315503, "grad_norm": 1.3046875, "learning_rate": 0.0003644264392938549, "loss": 5.0316, "mean_token_accuracy": 0.21308171153068542, "num_tokens": 83571255.0, "step": 48170 }, { "entropy": 5.872839498519897, "epoch": 3.7481812876872205, "grad_norm": 1.3828125, "learning_rate": 0.00036440100614182775, "loss": 5.0, "mean_token_accuracy": 0.20843035578727723, "num_tokens": 83580352.0, "step": 48175 }, { "entropy": 5.882680892944336, "epoch": 3.748570317058938, "grad_norm": 1.328125, "learning_rate": 0.00036437557163328255, "loss": 5.0019, "mean_token_accuracy": 0.2109435096383095, "num_tokens": 83589132.0, "step": 48180 }, { "entropy": 5.888722610473633, "epoch": 3.7489593464306554, "grad_norm": 1.2265625, "learning_rate": 0.0003643501357686053, "loss": 5.0064, "mean_token_accuracy": 0.21606704145669936, "num_tokens": 83597863.0, "step": 48185 }, { "entropy": 5.878688001632691, "epoch": 3.749348375802373, "grad_norm": 1.3828125, "learning_rate": 0.00036432469854818194, "loss": 4.9431, "mean_token_accuracy": 0.20874632596969606, "num_tokens": 83606705.0, "step": 48190 }, { "entropy": 5.869173002243042, "epoch": 3.7497374051740904, "grad_norm": 1.3046875, "learning_rate": 0.0003642992599723985, "loss": 4.9789, "mean_token_accuracy": 0.2084087014198303, "num_tokens": 83615164.0, "step": 48195 }, { "entropy": 5.837147331237793, "epoch": 3.750126434545808, "grad_norm": 1.3046875, "learning_rate": 0.0003642738200416409, "loss": 4.9571, "mean_token_accuracy": 0.2182650610804558, "num_tokens": 83624015.0, "step": 48200 }, { "entropy": 5.912715291976928, "epoch": 3.7505154639175258, "grad_norm": 1.4296875, "learning_rate": 0.00036424837875629517, "loss": 4.9913, "mean_token_accuracy": 0.20875738859176635, "num_tokens": 83631946.0, "step": 48205 }, { "entropy": 5.847022867202758, "epoch": 3.7509044932892435, "grad_norm": 1.3828125, "learning_rate": 0.00036422293611674736, "loss": 4.918, "mean_token_accuracy": 0.2164605438709259, "num_tokens": 83640279.0, "step": 48210 }, { "entropy": 5.875805330276489, "epoch": 3.751293522660961, "grad_norm": 1.296875, "learning_rate": 0.00036419749212338346, "loss": 5.0737, "mean_token_accuracy": 0.20834892094135285, "num_tokens": 83649275.0, "step": 48215 }, { "entropy": 5.921933889389038, "epoch": 3.7516825520326784, "grad_norm": 1.34375, "learning_rate": 0.0003641720467765897, "loss": 4.9661, "mean_token_accuracy": 0.21490372866392135, "num_tokens": 83657381.0, "step": 48220 }, { "entropy": 5.830944585800171, "epoch": 3.752071581404396, "grad_norm": 1.3828125, "learning_rate": 0.000364146600076752, "loss": 4.8729, "mean_token_accuracy": 0.21288878917694093, "num_tokens": 83665778.0, "step": 48225 }, { "entropy": 5.908101511001587, "epoch": 3.7524606107761134, "grad_norm": 1.328125, "learning_rate": 0.0003641211520242565, "loss": 5.0651, "mean_token_accuracy": 0.19733507931232452, "num_tokens": 83674644.0, "step": 48230 }, { "entropy": 5.982935237884521, "epoch": 3.752849640147831, "grad_norm": 1.34375, "learning_rate": 0.00036409570261948943, "loss": 5.0865, "mean_token_accuracy": 0.19708358645439147, "num_tokens": 83682207.0, "step": 48235 }, { "entropy": 5.867715692520141, "epoch": 3.7532386695195488, "grad_norm": 1.390625, "learning_rate": 0.0003640702518628369, "loss": 4.9625, "mean_token_accuracy": 0.21439034938812257, "num_tokens": 83691176.0, "step": 48240 }, { "entropy": 5.997307968139649, "epoch": 3.7536276988912665, "grad_norm": 1.3984375, "learning_rate": 0.000364044799754685, "loss": 5.1168, "mean_token_accuracy": 0.19908307492733002, "num_tokens": 83699646.0, "step": 48245 }, { "entropy": 5.886437129974365, "epoch": 3.7540167282629837, "grad_norm": 1.328125, "learning_rate": 0.00036401934629542, "loss": 4.9902, "mean_token_accuracy": 0.21033261418342591, "num_tokens": 83708287.0, "step": 48250 }, { "entropy": 5.945775318145752, "epoch": 3.7544057576347014, "grad_norm": 1.328125, "learning_rate": 0.00036399389148542813, "loss": 5.105, "mean_token_accuracy": 0.1981591612100601, "num_tokens": 83716842.0, "step": 48255 }, { "entropy": 5.859292936325073, "epoch": 3.754794787006419, "grad_norm": 1.359375, "learning_rate": 0.00036396843532509563, "loss": 4.9659, "mean_token_accuracy": 0.21460585445165634, "num_tokens": 83725464.0, "step": 48260 }, { "entropy": 5.90838098526001, "epoch": 3.7551838163781364, "grad_norm": 1.3125, "learning_rate": 0.0003639429778148087, "loss": 4.9542, "mean_token_accuracy": 0.20946005135774612, "num_tokens": 83734478.0, "step": 48265 }, { "entropy": 5.884678840637207, "epoch": 3.755572845749854, "grad_norm": 1.359375, "learning_rate": 0.0003639175189549536, "loss": 4.9473, "mean_token_accuracy": 0.2202048718929291, "num_tokens": 83743513.0, "step": 48270 }, { "entropy": 5.914224863052368, "epoch": 3.7559618751215718, "grad_norm": 1.40625, "learning_rate": 0.00036389205874591676, "loss": 5.0002, "mean_token_accuracy": 0.21169825047254562, "num_tokens": 83751483.0, "step": 48275 }, { "entropy": 5.79984073638916, "epoch": 3.7563509044932895, "grad_norm": 1.3671875, "learning_rate": 0.00036386659718808437, "loss": 4.8206, "mean_token_accuracy": 0.2220975711941719, "num_tokens": 83759781.0, "step": 48280 }, { "entropy": 5.864936971664429, "epoch": 3.7567399338650067, "grad_norm": 1.328125, "learning_rate": 0.00036384113428184286, "loss": 4.9353, "mean_token_accuracy": 0.20898450314998626, "num_tokens": 83767717.0, "step": 48285 }, { "entropy": 5.8957971096038815, "epoch": 3.7571289632367244, "grad_norm": 1.421875, "learning_rate": 0.0003638156700275784, "loss": 4.9942, "mean_token_accuracy": 0.21222014129161834, "num_tokens": 83776160.0, "step": 48290 }, { "entropy": 5.870040416717529, "epoch": 3.757517992608442, "grad_norm": 1.3203125, "learning_rate": 0.0003637902044256777, "loss": 4.8999, "mean_token_accuracy": 0.21886495798826217, "num_tokens": 83784885.0, "step": 48295 }, { "entropy": 5.798266458511352, "epoch": 3.7579070219801594, "grad_norm": 1.3125, "learning_rate": 0.0003637647374765269, "loss": 4.9572, "mean_token_accuracy": 0.22388071268796922, "num_tokens": 83793746.0, "step": 48300 }, { "entropy": 5.858450126647949, "epoch": 3.758296051351877, "grad_norm": 1.4296875, "learning_rate": 0.00036373926918051243, "loss": 4.9165, "mean_token_accuracy": 0.2135024756193161, "num_tokens": 83803221.0, "step": 48305 }, { "entropy": 5.910942602157593, "epoch": 3.7586850807235948, "grad_norm": 1.3671875, "learning_rate": 0.00036371379953802085, "loss": 4.9379, "mean_token_accuracy": 0.21292421221733093, "num_tokens": 83812973.0, "step": 48310 }, { "entropy": 5.862515783309936, "epoch": 3.7590741100953124, "grad_norm": 1.3203125, "learning_rate": 0.00036368832854943856, "loss": 4.9346, "mean_token_accuracy": 0.2146860510110855, "num_tokens": 83821560.0, "step": 48315 }, { "entropy": 5.891303777694702, "epoch": 3.7594631394670297, "grad_norm": 1.2421875, "learning_rate": 0.00036366285621515206, "loss": 5.0186, "mean_token_accuracy": 0.2018510013818741, "num_tokens": 83830743.0, "step": 48320 }, { "entropy": 5.936154699325561, "epoch": 3.7598521688387474, "grad_norm": 1.34375, "learning_rate": 0.0003636373825355478, "loss": 4.9632, "mean_token_accuracy": 0.20942680090665816, "num_tokens": 83839400.0, "step": 48325 }, { "entropy": 5.9548423290252686, "epoch": 3.7602411982104647, "grad_norm": 1.390625, "learning_rate": 0.0003636119075110124, "loss": 5.1158, "mean_token_accuracy": 0.20146631300449372, "num_tokens": 83848074.0, "step": 48330 }, { "entropy": 5.843993663787842, "epoch": 3.7606302275821823, "grad_norm": 1.40625, "learning_rate": 0.0003635864311419323, "loss": 4.9528, "mean_token_accuracy": 0.21656300574541093, "num_tokens": 83856471.0, "step": 48335 }, { "entropy": 5.813853979110718, "epoch": 3.7610192569539, "grad_norm": 1.3671875, "learning_rate": 0.00036356095342869414, "loss": 4.8909, "mean_token_accuracy": 0.21711220741271972, "num_tokens": 83865300.0, "step": 48340 }, { "entropy": 5.8402234554290775, "epoch": 3.7614082863256177, "grad_norm": 1.3359375, "learning_rate": 0.0003635354743716844, "loss": 4.9365, "mean_token_accuracy": 0.21621186137199402, "num_tokens": 83873797.0, "step": 48345 }, { "entropy": 5.860577583312988, "epoch": 3.761797315697335, "grad_norm": 1.328125, "learning_rate": 0.0003635099939712898, "loss": 4.9791, "mean_token_accuracy": 0.21004964858293534, "num_tokens": 83882595.0, "step": 48350 }, { "entropy": 5.88159761428833, "epoch": 3.7621863450690527, "grad_norm": 1.375, "learning_rate": 0.00036348451222789694, "loss": 4.8922, "mean_token_accuracy": 0.22143671065568923, "num_tokens": 83891323.0, "step": 48355 }, { "entropy": 5.889911746978759, "epoch": 3.7625753744407704, "grad_norm": 1.3671875, "learning_rate": 0.00036345902914189246, "loss": 4.9352, "mean_token_accuracy": 0.21332240849733353, "num_tokens": 83899761.0, "step": 48360 }, { "entropy": 5.809483385086059, "epoch": 3.7629644038124876, "grad_norm": 1.2734375, "learning_rate": 0.000363433544713663, "loss": 4.8776, "mean_token_accuracy": 0.2168743446469307, "num_tokens": 83908870.0, "step": 48365 }, { "entropy": 5.807506418228149, "epoch": 3.7633534331842053, "grad_norm": 1.3984375, "learning_rate": 0.00036340805894359524, "loss": 4.9377, "mean_token_accuracy": 0.21271784901618956, "num_tokens": 83916961.0, "step": 48370 }, { "entropy": 5.896142387390137, "epoch": 3.763742462555923, "grad_norm": 1.28125, "learning_rate": 0.00036338257183207587, "loss": 4.9705, "mean_token_accuracy": 0.2061152219772339, "num_tokens": 83926098.0, "step": 48375 }, { "entropy": 5.808431482315063, "epoch": 3.7641314919276407, "grad_norm": 1.3203125, "learning_rate": 0.00036335708337949165, "loss": 4.9087, "mean_token_accuracy": 0.21584024429321289, "num_tokens": 83934903.0, "step": 48380 }, { "entropy": 5.899194812774658, "epoch": 3.764520521299358, "grad_norm": 1.3984375, "learning_rate": 0.0003633315935862293, "loss": 5.0699, "mean_token_accuracy": 0.20630761086940766, "num_tokens": 83943743.0, "step": 48385 }, { "entropy": 5.926990509033203, "epoch": 3.7649095506710757, "grad_norm": 1.34375, "learning_rate": 0.0003633061024526757, "loss": 5.0544, "mean_token_accuracy": 0.2073652297258377, "num_tokens": 83952892.0, "step": 48390 }, { "entropy": 5.845371866226197, "epoch": 3.7652985800427934, "grad_norm": 1.3203125, "learning_rate": 0.0003632806099792175, "loss": 4.9622, "mean_token_accuracy": 0.20980707705020904, "num_tokens": 83961820.0, "step": 48395 }, { "entropy": 5.862010955810547, "epoch": 3.7656876094145106, "grad_norm": 1.5, "learning_rate": 0.00036325511616624155, "loss": 4.9087, "mean_token_accuracy": 0.21851401031017303, "num_tokens": 83969730.0, "step": 48400 }, { "entropy": 5.898706388473511, "epoch": 3.7660766387862283, "grad_norm": 1.359375, "learning_rate": 0.0003632296210141348, "loss": 4.9545, "mean_token_accuracy": 0.20416849553585054, "num_tokens": 83977740.0, "step": 48405 }, { "entropy": 5.8004320621490475, "epoch": 3.766465668157946, "grad_norm": 1.328125, "learning_rate": 0.00036320412452328383, "loss": 4.8517, "mean_token_accuracy": 0.22398382872343064, "num_tokens": 83986165.0, "step": 48410 }, { "entropy": 5.888893413543701, "epoch": 3.7668546975296637, "grad_norm": 1.2890625, "learning_rate": 0.0003631786266940757, "loss": 4.9894, "mean_token_accuracy": 0.209625805914402, "num_tokens": 83994796.0, "step": 48415 }, { "entropy": 5.93151216506958, "epoch": 3.767243726901381, "grad_norm": 1.609375, "learning_rate": 0.00036315312752689726, "loss": 4.9589, "mean_token_accuracy": 0.20985649526119232, "num_tokens": 84003865.0, "step": 48420 }, { "entropy": 5.95916600227356, "epoch": 3.7676327562730987, "grad_norm": 1.3828125, "learning_rate": 0.0003631276270221354, "loss": 5.0662, "mean_token_accuracy": 0.2057712718844414, "num_tokens": 84012872.0, "step": 48425 }, { "entropy": 5.8916198253631595, "epoch": 3.768021785644816, "grad_norm": 1.3828125, "learning_rate": 0.00036310212518017717, "loss": 4.9549, "mean_token_accuracy": 0.21782825589179994, "num_tokens": 84022162.0, "step": 48430 }, { "entropy": 5.901426029205322, "epoch": 3.7684108150165336, "grad_norm": 1.3359375, "learning_rate": 0.00036307662200140935, "loss": 4.9989, "mean_token_accuracy": 0.20590577870607377, "num_tokens": 84030327.0, "step": 48435 }, { "entropy": 5.920516586303711, "epoch": 3.7687998443882513, "grad_norm": 1.2578125, "learning_rate": 0.0003630511174862189, "loss": 5.0223, "mean_token_accuracy": 0.20111789405345917, "num_tokens": 84039613.0, "step": 48440 }, { "entropy": 5.935374689102173, "epoch": 3.769188873759969, "grad_norm": 1.3671875, "learning_rate": 0.0003630256116349931, "loss": 5.0644, "mean_token_accuracy": 0.20172394216060638, "num_tokens": 84049216.0, "step": 48445 }, { "entropy": 5.875127553939819, "epoch": 3.7695779031316863, "grad_norm": 1.3515625, "learning_rate": 0.0003630001044481186, "loss": 4.9698, "mean_token_accuracy": 0.20724075436592101, "num_tokens": 84057734.0, "step": 48450 }, { "entropy": 5.933534717559814, "epoch": 3.769966932503404, "grad_norm": 1.4921875, "learning_rate": 0.00036297459592598256, "loss": 5.0358, "mean_token_accuracy": 0.2036649242043495, "num_tokens": 84065468.0, "step": 48455 }, { "entropy": 5.899046182632446, "epoch": 3.7703559618751217, "grad_norm": 1.4296875, "learning_rate": 0.0003629490860689721, "loss": 4.9788, "mean_token_accuracy": 0.21242628544569014, "num_tokens": 84074078.0, "step": 48460 }, { "entropy": 5.86505708694458, "epoch": 3.770744991246839, "grad_norm": 1.3671875, "learning_rate": 0.00036292357487747426, "loss": 4.9643, "mean_token_accuracy": 0.21210132539272308, "num_tokens": 84082489.0, "step": 48465 }, { "entropy": 5.869071578979492, "epoch": 3.7711340206185566, "grad_norm": 1.28125, "learning_rate": 0.00036289806235187606, "loss": 4.9906, "mean_token_accuracy": 0.20853897631168367, "num_tokens": 84090993.0, "step": 48470 }, { "entropy": 5.815415382385254, "epoch": 3.7715230499902743, "grad_norm": 1.421875, "learning_rate": 0.0003628725484925647, "loss": 4.9246, "mean_token_accuracy": 0.21623148620128632, "num_tokens": 84099256.0, "step": 48475 }, { "entropy": 5.891503477096558, "epoch": 3.771912079361992, "grad_norm": 1.3203125, "learning_rate": 0.00036284703329992734, "loss": 4.9992, "mean_token_accuracy": 0.21152681857347488, "num_tokens": 84108599.0, "step": 48480 }, { "entropy": 5.848405265808106, "epoch": 3.7723011087337093, "grad_norm": 1.4296875, "learning_rate": 0.000362821516774351, "loss": 4.8984, "mean_token_accuracy": 0.21647050678730012, "num_tokens": 84116802.0, "step": 48485 }, { "entropy": 5.867918539047241, "epoch": 3.772690138105427, "grad_norm": 1.359375, "learning_rate": 0.00036279599891622297, "loss": 5.0213, "mean_token_accuracy": 0.21045306473970413, "num_tokens": 84124626.0, "step": 48490 }, { "entropy": 5.872149801254272, "epoch": 3.7730791674771447, "grad_norm": 1.390625, "learning_rate": 0.00036277047972593036, "loss": 4.9553, "mean_token_accuracy": 0.21770405322313308, "num_tokens": 84133795.0, "step": 48495 }, { "entropy": 5.848955345153809, "epoch": 3.773468196848862, "grad_norm": 1.375, "learning_rate": 0.0003627449592038604, "loss": 4.9531, "mean_token_accuracy": 0.21135829240083695, "num_tokens": 84142026.0, "step": 48500 }, { "entropy": 5.907657814025879, "epoch": 3.7738572262205796, "grad_norm": 1.359375, "learning_rate": 0.0003627194373504004, "loss": 5.0098, "mean_token_accuracy": 0.2095989093184471, "num_tokens": 84150398.0, "step": 48505 }, { "entropy": 5.94256820678711, "epoch": 3.7742462555922973, "grad_norm": 1.4765625, "learning_rate": 0.00036269391416593753, "loss": 4.9535, "mean_token_accuracy": 0.2101661041378975, "num_tokens": 84159060.0, "step": 48510 }, { "entropy": 5.905809450149536, "epoch": 3.774635284964015, "grad_norm": 1.25, "learning_rate": 0.0003626683896508591, "loss": 4.9622, "mean_token_accuracy": 0.213009113073349, "num_tokens": 84168577.0, "step": 48515 }, { "entropy": 5.858496379852295, "epoch": 3.7750243143357323, "grad_norm": 1.3359375, "learning_rate": 0.0003626428638055524, "loss": 4.9084, "mean_token_accuracy": 0.21128497570753096, "num_tokens": 84177052.0, "step": 48520 }, { "entropy": 5.90947790145874, "epoch": 3.77541334370745, "grad_norm": 1.3984375, "learning_rate": 0.00036261733663040473, "loss": 5.0355, "mean_token_accuracy": 0.20872995704412461, "num_tokens": 84185731.0, "step": 48525 }, { "entropy": 5.87296051979065, "epoch": 3.775802373079167, "grad_norm": 1.3671875, "learning_rate": 0.00036259180812580347, "loss": 4.9802, "mean_token_accuracy": 0.2118247225880623, "num_tokens": 84194809.0, "step": 48530 }, { "entropy": 5.948032522201538, "epoch": 3.776191402450885, "grad_norm": 1.4296875, "learning_rate": 0.00036256627829213585, "loss": 5.0489, "mean_token_accuracy": 0.20938842743635178, "num_tokens": 84203643.0, "step": 48535 }, { "entropy": 5.872265577316284, "epoch": 3.7765804318226026, "grad_norm": 1.3515625, "learning_rate": 0.00036254074712978947, "loss": 4.8974, "mean_token_accuracy": 0.2135225296020508, "num_tokens": 84212115.0, "step": 48540 }, { "entropy": 5.89473819732666, "epoch": 3.7769694611943203, "grad_norm": 1.4140625, "learning_rate": 0.00036251521463915144, "loss": 4.9518, "mean_token_accuracy": 0.2124090701341629, "num_tokens": 84220092.0, "step": 48545 }, { "entropy": 5.881883716583252, "epoch": 3.777358490566038, "grad_norm": 1.359375, "learning_rate": 0.0003624896808206093, "loss": 4.9336, "mean_token_accuracy": 0.21594312638044358, "num_tokens": 84228142.0, "step": 48550 }, { "entropy": 5.868704462051392, "epoch": 3.7777475199377553, "grad_norm": 1.359375, "learning_rate": 0.0003624641456745507, "loss": 4.9488, "mean_token_accuracy": 0.2166791081428528, "num_tokens": 84237017.0, "step": 48555 }, { "entropy": 5.9591591358184814, "epoch": 3.778136549309473, "grad_norm": 1.3515625, "learning_rate": 0.00036243860920136283, "loss": 5.0444, "mean_token_accuracy": 0.212117762863636, "num_tokens": 84245464.0, "step": 48560 }, { "entropy": 5.903661394119263, "epoch": 3.77852557868119, "grad_norm": 1.40625, "learning_rate": 0.00036241307140143323, "loss": 5.0274, "mean_token_accuracy": 0.20549351423978807, "num_tokens": 84253781.0, "step": 48565 }, { "entropy": 5.895534038543701, "epoch": 3.778914608052908, "grad_norm": 1.359375, "learning_rate": 0.00036238753227514934, "loss": 4.9692, "mean_token_accuracy": 0.2121538683772087, "num_tokens": 84262632.0, "step": 48570 }, { "entropy": 5.861011505126953, "epoch": 3.7793036374246256, "grad_norm": 1.390625, "learning_rate": 0.00036236199182289883, "loss": 4.9167, "mean_token_accuracy": 0.21718286126852035, "num_tokens": 84271244.0, "step": 48575 }, { "entropy": 5.919312906265259, "epoch": 3.7796926667963433, "grad_norm": 1.46875, "learning_rate": 0.000362336450045069, "loss": 5.1125, "mean_token_accuracy": 0.2056755930185318, "num_tokens": 84279343.0, "step": 48580 }, { "entropy": 5.842883586883545, "epoch": 3.7800816961680606, "grad_norm": 1.3984375, "learning_rate": 0.00036231090694204763, "loss": 4.9333, "mean_token_accuracy": 0.22065501660108566, "num_tokens": 84288304.0, "step": 48585 }, { "entropy": 5.8491288185119625, "epoch": 3.7804707255397783, "grad_norm": 1.3125, "learning_rate": 0.00036228536251422226, "loss": 4.9758, "mean_token_accuracy": 0.21005798131227493, "num_tokens": 84296844.0, "step": 48590 }, { "entropy": 5.8907819271087645, "epoch": 3.780859754911496, "grad_norm": 1.3359375, "learning_rate": 0.00036225981676198045, "loss": 4.9356, "mean_token_accuracy": 0.21562714129686356, "num_tokens": 84305521.0, "step": 48595 }, { "entropy": 5.961500263214111, "epoch": 3.781248784283213, "grad_norm": 1.40625, "learning_rate": 0.0003622342696857098, "loss": 5.0857, "mean_token_accuracy": 0.20564025938510894, "num_tokens": 84314072.0, "step": 48600 }, { "entropy": 5.838432502746582, "epoch": 3.781637813654931, "grad_norm": 1.3515625, "learning_rate": 0.0003622087212857979, "loss": 4.9782, "mean_token_accuracy": 0.20770912766456603, "num_tokens": 84323198.0, "step": 48605 }, { "entropy": 5.924706172943115, "epoch": 3.7820268430266486, "grad_norm": 1.3515625, "learning_rate": 0.0003621831715626325, "loss": 5.0353, "mean_token_accuracy": 0.2094405934214592, "num_tokens": 84331618.0, "step": 48610 }, { "entropy": 5.803772592544556, "epoch": 3.7824158723983663, "grad_norm": 1.3046875, "learning_rate": 0.00036215762051660115, "loss": 4.9059, "mean_token_accuracy": 0.22132749408483504, "num_tokens": 84340043.0, "step": 48615 }, { "entropy": 5.853991889953614, "epoch": 3.7828049017700835, "grad_norm": 1.328125, "learning_rate": 0.00036213206814809175, "loss": 4.9635, "mean_token_accuracy": 0.21315771639347075, "num_tokens": 84348326.0, "step": 48620 }, { "entropy": 5.948745155334473, "epoch": 3.7831939311418012, "grad_norm": 1.2890625, "learning_rate": 0.0003621065144574919, "loss": 5.044, "mean_token_accuracy": 0.20476083606481552, "num_tokens": 84357213.0, "step": 48625 }, { "entropy": 5.974864387512207, "epoch": 3.7835829605135185, "grad_norm": 1.3046875, "learning_rate": 0.0003620809594451893, "loss": 5.0803, "mean_token_accuracy": 0.20737089067697526, "num_tokens": 84366431.0, "step": 48630 }, { "entropy": 6.006722831726075, "epoch": 3.783971989885236, "grad_norm": 1.34375, "learning_rate": 0.0003620554031115718, "loss": 5.0173, "mean_token_accuracy": 0.21659037321805955, "num_tokens": 84374955.0, "step": 48635 }, { "entropy": 5.886042785644531, "epoch": 3.784361019256954, "grad_norm": 1.265625, "learning_rate": 0.0003620298454570271, "loss": 4.9799, "mean_token_accuracy": 0.2117963030934334, "num_tokens": 84384103.0, "step": 48640 }, { "entropy": 5.9071355819702145, "epoch": 3.7847500486286716, "grad_norm": 1.4140625, "learning_rate": 0.0003620042864819429, "loss": 5.0636, "mean_token_accuracy": 0.20445960462093354, "num_tokens": 84393419.0, "step": 48645 }, { "entropy": 5.850815391540527, "epoch": 3.7851390780003893, "grad_norm": 1.453125, "learning_rate": 0.0003619787261867072, "loss": 4.9113, "mean_token_accuracy": 0.21762387901544572, "num_tokens": 84402321.0, "step": 48650 }, { "entropy": 5.885432147979737, "epoch": 3.7855281073721065, "grad_norm": 1.3984375, "learning_rate": 0.0003619531645717078, "loss": 5.0629, "mean_token_accuracy": 0.20222173929214476, "num_tokens": 84410943.0, "step": 48655 }, { "entropy": 5.953517103195191, "epoch": 3.7859171367438242, "grad_norm": 1.3515625, "learning_rate": 0.0003619276016373325, "loss": 4.977, "mean_token_accuracy": 0.20801522582769394, "num_tokens": 84419256.0, "step": 48660 }, { "entropy": 5.89577808380127, "epoch": 3.7863061661155415, "grad_norm": 1.3046875, "learning_rate": 0.0003619020373839693, "loss": 5.0393, "mean_token_accuracy": 0.20747072398662567, "num_tokens": 84427511.0, "step": 48665 }, { "entropy": 5.837087202072143, "epoch": 3.786695195487259, "grad_norm": 1.4140625, "learning_rate": 0.0003618764718120059, "loss": 4.9342, "mean_token_accuracy": 0.21127746105194092, "num_tokens": 84436491.0, "step": 48670 }, { "entropy": 5.833677577972412, "epoch": 3.787084224858977, "grad_norm": 1.46875, "learning_rate": 0.0003618509049218304, "loss": 4.8953, "mean_token_accuracy": 0.22256937325000764, "num_tokens": 84445152.0, "step": 48675 }, { "entropy": 5.952721071243286, "epoch": 3.7874732542306946, "grad_norm": 1.4453125, "learning_rate": 0.00036182533671383056, "loss": 5.0807, "mean_token_accuracy": 0.21602991968393326, "num_tokens": 84453766.0, "step": 48680 }, { "entropy": 5.788374137878418, "epoch": 3.787862283602412, "grad_norm": 1.3515625, "learning_rate": 0.0003617997671883944, "loss": 4.8153, "mean_token_accuracy": 0.22304548919200898, "num_tokens": 84462754.0, "step": 48685 }, { "entropy": 5.863444852828979, "epoch": 3.7882513129741295, "grad_norm": 1.4140625, "learning_rate": 0.00036177419634591, "loss": 4.9832, "mean_token_accuracy": 0.207102170586586, "num_tokens": 84470576.0, "step": 48690 }, { "entropy": 5.848718309402466, "epoch": 3.7886403423458472, "grad_norm": 1.28125, "learning_rate": 0.0003617486241867654, "loss": 4.8804, "mean_token_accuracy": 0.2252107635140419, "num_tokens": 84478616.0, "step": 48695 }, { "entropy": 5.902966117858886, "epoch": 3.7890293717175645, "grad_norm": 1.4453125, "learning_rate": 0.0003617230507113483, "loss": 5.0024, "mean_token_accuracy": 0.20299587100744249, "num_tokens": 84487070.0, "step": 48700 }, { "entropy": 5.832431983947754, "epoch": 3.789418401089282, "grad_norm": 1.5234375, "learning_rate": 0.00036169747592004704, "loss": 4.9218, "mean_token_accuracy": 0.22317652851343156, "num_tokens": 84495570.0, "step": 48705 }, { "entropy": 5.910794401168824, "epoch": 3.789807430461, "grad_norm": 1.2890625, "learning_rate": 0.00036167189981324956, "loss": 5.0342, "mean_token_accuracy": 0.2025470644235611, "num_tokens": 84505321.0, "step": 48710 }, { "entropy": 5.93018069267273, "epoch": 3.7901964598327176, "grad_norm": 1.359375, "learning_rate": 0.000361646322391344, "loss": 4.9952, "mean_token_accuracy": 0.216048002243042, "num_tokens": 84514107.0, "step": 48715 }, { "entropy": 5.887635135650635, "epoch": 3.790585489204435, "grad_norm": 1.34375, "learning_rate": 0.0003616207436547183, "loss": 4.9596, "mean_token_accuracy": 0.21245805025100709, "num_tokens": 84523394.0, "step": 48720 }, { "entropy": 5.93947114944458, "epoch": 3.7909745185761525, "grad_norm": 1.453125, "learning_rate": 0.00036159516360376084, "loss": 5.0252, "mean_token_accuracy": 0.2092490091919899, "num_tokens": 84532237.0, "step": 48725 }, { "entropy": 5.881946420669555, "epoch": 3.7913635479478702, "grad_norm": 1.34375, "learning_rate": 0.00036156958223885945, "loss": 4.9911, "mean_token_accuracy": 0.21167093515396118, "num_tokens": 84540618.0, "step": 48730 }, { "entropy": 5.865811347961426, "epoch": 3.7917525773195875, "grad_norm": 1.3515625, "learning_rate": 0.0003615439995604025, "loss": 4.9676, "mean_token_accuracy": 0.21578311771154404, "num_tokens": 84548951.0, "step": 48735 }, { "entropy": 5.782876014709473, "epoch": 3.792141606691305, "grad_norm": 1.2890625, "learning_rate": 0.0003615184155687781, "loss": 4.8785, "mean_token_accuracy": 0.21204535514116288, "num_tokens": 84557631.0, "step": 48740 }, { "entropy": 5.865848875045776, "epoch": 3.792530636063023, "grad_norm": 1.359375, "learning_rate": 0.00036149283026437444, "loss": 4.9446, "mean_token_accuracy": 0.21726535856723786, "num_tokens": 84567188.0, "step": 48745 }, { "entropy": 5.945171451568603, "epoch": 3.7929196654347406, "grad_norm": 1.421875, "learning_rate": 0.00036146724364757984, "loss": 4.9767, "mean_token_accuracy": 0.21601348519325256, "num_tokens": 84575730.0, "step": 48750 }, { "entropy": 5.749672555923462, "epoch": 3.793308694806458, "grad_norm": 1.4609375, "learning_rate": 0.00036144165571878233, "loss": 4.7962, "mean_token_accuracy": 0.22848126888275147, "num_tokens": 84583813.0, "step": 48755 }, { "entropy": 5.747557783126831, "epoch": 3.7936977241781755, "grad_norm": 1.359375, "learning_rate": 0.0003614160664783703, "loss": 4.9042, "mean_token_accuracy": 0.2184164583683014, "num_tokens": 84592868.0, "step": 48760 }, { "entropy": 5.841302013397216, "epoch": 3.7940867535498928, "grad_norm": 1.2578125, "learning_rate": 0.000361390475926732, "loss": 4.9463, "mean_token_accuracy": 0.21587400138378143, "num_tokens": 84601693.0, "step": 48765 }, { "entropy": 5.907858657836914, "epoch": 3.7944757829216105, "grad_norm": 1.3359375, "learning_rate": 0.0003613648840642558, "loss": 4.9405, "mean_token_accuracy": 0.20912210494279862, "num_tokens": 84610173.0, "step": 48770 }, { "entropy": 5.866399478912354, "epoch": 3.794864812293328, "grad_norm": 1.4375, "learning_rate": 0.0003613392908913299, "loss": 4.9908, "mean_token_accuracy": 0.20805558562278748, "num_tokens": 84618041.0, "step": 48775 }, { "entropy": 5.876042652130127, "epoch": 3.795253841665046, "grad_norm": 1.3359375, "learning_rate": 0.0003613136964083427, "loss": 4.9747, "mean_token_accuracy": 0.20783669501543045, "num_tokens": 84626624.0, "step": 48780 }, { "entropy": 5.808679628372192, "epoch": 3.795642871036763, "grad_norm": 1.421875, "learning_rate": 0.0003612881006156826, "loss": 4.8247, "mean_token_accuracy": 0.22786216139793397, "num_tokens": 84634746.0, "step": 48785 }, { "entropy": 5.896240711212158, "epoch": 3.796031900408481, "grad_norm": 1.3125, "learning_rate": 0.00036126250351373786, "loss": 5.0248, "mean_token_accuracy": 0.210909503698349, "num_tokens": 84643695.0, "step": 48790 }, { "entropy": 5.863849258422851, "epoch": 3.7964209297801985, "grad_norm": 1.3671875, "learning_rate": 0.00036123690510289684, "loss": 4.9782, "mean_token_accuracy": 0.20545587837696075, "num_tokens": 84652517.0, "step": 48795 }, { "entropy": 5.9930016040802006, "epoch": 3.7968099591519158, "grad_norm": 1.359375, "learning_rate": 0.0003612113053835482, "loss": 5.0768, "mean_token_accuracy": 0.19964774698019028, "num_tokens": 84660987.0, "step": 48800 }, { "entropy": 5.9639365673065186, "epoch": 3.7971989885236335, "grad_norm": 1.3515625, "learning_rate": 0.0003611857043560801, "loss": 4.9994, "mean_token_accuracy": 0.20921349674463272, "num_tokens": 84669776.0, "step": 48805 }, { "entropy": 5.939868783950805, "epoch": 3.797588017895351, "grad_norm": 1.34375, "learning_rate": 0.0003611601020208812, "loss": 4.9798, "mean_token_accuracy": 0.21237122416496276, "num_tokens": 84678456.0, "step": 48810 }, { "entropy": 5.883872985839844, "epoch": 3.797977047267069, "grad_norm": 1.4296875, "learning_rate": 0.0003611344983783398, "loss": 5.0176, "mean_token_accuracy": 0.20332980453968047, "num_tokens": 84686493.0, "step": 48815 }, { "entropy": 5.9042047500610355, "epoch": 3.798366076638786, "grad_norm": 1.40625, "learning_rate": 0.0003611088934288445, "loss": 4.9786, "mean_token_accuracy": 0.21438491493463516, "num_tokens": 84695152.0, "step": 48820 }, { "entropy": 5.88040566444397, "epoch": 3.798755106010504, "grad_norm": 1.3125, "learning_rate": 0.00036108328717278387, "loss": 5.0049, "mean_token_accuracy": 0.21014520823955535, "num_tokens": 84704511.0, "step": 48825 }, { "entropy": 5.900492191314697, "epoch": 3.7991441353822215, "grad_norm": 1.328125, "learning_rate": 0.00036105767961054636, "loss": 5.035, "mean_token_accuracy": 0.2104365274310112, "num_tokens": 84713102.0, "step": 48830 }, { "entropy": 5.932271432876587, "epoch": 3.7995331647539388, "grad_norm": 1.4296875, "learning_rate": 0.0003610320707425205, "loss": 4.9998, "mean_token_accuracy": 0.21525168418884277, "num_tokens": 84721496.0, "step": 48835 }, { "entropy": 5.945984029769898, "epoch": 3.7999221941256565, "grad_norm": 1.3828125, "learning_rate": 0.000361006460569095, "loss": 5.0395, "mean_token_accuracy": 0.20839597284793854, "num_tokens": 84730069.0, "step": 48840 }, { "entropy": 5.9227526664733885, "epoch": 3.800311223497374, "grad_norm": 1.34375, "learning_rate": 0.00036098084909065814, "loss": 4.9372, "mean_token_accuracy": 0.2165498897433281, "num_tokens": 84738434.0, "step": 48845 }, { "entropy": 5.900686120986938, "epoch": 3.800700252869092, "grad_norm": 1.3359375, "learning_rate": 0.0003609552363075989, "loss": 4.9304, "mean_token_accuracy": 0.2197186291217804, "num_tokens": 84747381.0, "step": 48850 }, { "entropy": 5.81136417388916, "epoch": 3.801089282240809, "grad_norm": 1.3046875, "learning_rate": 0.00036092962222030573, "loss": 4.9164, "mean_token_accuracy": 0.21362605690956116, "num_tokens": 84756763.0, "step": 48855 }, { "entropy": 5.902033901214599, "epoch": 3.801478311612527, "grad_norm": 1.328125, "learning_rate": 0.0003609040068291673, "loss": 5.0193, "mean_token_accuracy": 0.2166093945503235, "num_tokens": 84765128.0, "step": 48860 }, { "entropy": 5.829157924652099, "epoch": 3.801867340984244, "grad_norm": 1.2109375, "learning_rate": 0.0003608783901345724, "loss": 4.9252, "mean_token_accuracy": 0.20910997688770294, "num_tokens": 84773730.0, "step": 48865 }, { "entropy": 5.862717580795288, "epoch": 3.8022563703559618, "grad_norm": 1.3984375, "learning_rate": 0.00036085277213690947, "loss": 4.8821, "mean_token_accuracy": 0.21603417843580247, "num_tokens": 84782014.0, "step": 48870 }, { "entropy": 5.928815746307373, "epoch": 3.8026453997276795, "grad_norm": 1.359375, "learning_rate": 0.0003608271528365675, "loss": 4.9403, "mean_token_accuracy": 0.20917174816131592, "num_tokens": 84790789.0, "step": 48875 }, { "entropy": 5.942600393295288, "epoch": 3.803034429099397, "grad_norm": 1.4140625, "learning_rate": 0.000360801532233935, "loss": 5.0466, "mean_token_accuracy": 0.2093389630317688, "num_tokens": 84799765.0, "step": 48880 }, { "entropy": 5.816871404647827, "epoch": 3.8034234584711144, "grad_norm": 1.3828125, "learning_rate": 0.0003607759103294008, "loss": 4.8837, "mean_token_accuracy": 0.21778505742549897, "num_tokens": 84808319.0, "step": 48885 }, { "entropy": 5.835119676589966, "epoch": 3.803812487842832, "grad_norm": 1.2578125, "learning_rate": 0.0003607502871233538, "loss": 4.9475, "mean_token_accuracy": 0.21441784650087356, "num_tokens": 84817995.0, "step": 48890 }, { "entropy": 5.8853302001953125, "epoch": 3.80420151721455, "grad_norm": 1.34375, "learning_rate": 0.0003607246626161826, "loss": 5.0324, "mean_token_accuracy": 0.20639730244874954, "num_tokens": 84826791.0, "step": 48895 }, { "entropy": 5.912590169906617, "epoch": 3.804590546586267, "grad_norm": 1.40625, "learning_rate": 0.000360699036808276, "loss": 4.9204, "mean_token_accuracy": 0.20942153930664062, "num_tokens": 84835395.0, "step": 48900 }, { "entropy": 5.883716058731079, "epoch": 3.8049795759579847, "grad_norm": 1.296875, "learning_rate": 0.0003606734097000231, "loss": 5.0026, "mean_token_accuracy": 0.20871864557266234, "num_tokens": 84844137.0, "step": 48905 }, { "entropy": 5.873722267150879, "epoch": 3.8053686053297024, "grad_norm": 1.34375, "learning_rate": 0.0003606477812918125, "loss": 4.9923, "mean_token_accuracy": 0.2078575983643532, "num_tokens": 84852773.0, "step": 48910 }, { "entropy": 5.958504724502563, "epoch": 3.80575763470142, "grad_norm": 1.4140625, "learning_rate": 0.0003606221515840331, "loss": 5.0686, "mean_token_accuracy": 0.21206944733858107, "num_tokens": 84861437.0, "step": 48915 }, { "entropy": 5.940086078643799, "epoch": 3.8061466640731374, "grad_norm": 1.2734375, "learning_rate": 0.00036059652057707394, "loss": 5.0214, "mean_token_accuracy": 0.21235112398862838, "num_tokens": 84870185.0, "step": 48920 }, { "entropy": 5.903927230834961, "epoch": 3.806535693444855, "grad_norm": 1.359375, "learning_rate": 0.0003605708882713237, "loss": 5.0065, "mean_token_accuracy": 0.21221843510866165, "num_tokens": 84878701.0, "step": 48925 }, { "entropy": 5.825904798507691, "epoch": 3.806924722816573, "grad_norm": 1.3203125, "learning_rate": 0.00036054525466717145, "loss": 4.9359, "mean_token_accuracy": 0.21322670727968215, "num_tokens": 84887329.0, "step": 48930 }, { "entropy": 5.853927946090698, "epoch": 3.80731375218829, "grad_norm": 1.390625, "learning_rate": 0.0003605196197650062, "loss": 4.9294, "mean_token_accuracy": 0.21351401805877684, "num_tokens": 84895283.0, "step": 48935 }, { "entropy": 5.891686582565308, "epoch": 3.8077027815600077, "grad_norm": 1.328125, "learning_rate": 0.0003604939835652167, "loss": 4.9679, "mean_token_accuracy": 0.2145231157541275, "num_tokens": 84903975.0, "step": 48940 }, { "entropy": 5.882328176498413, "epoch": 3.8080918109317254, "grad_norm": 1.34375, "learning_rate": 0.00036046834606819224, "loss": 4.8791, "mean_token_accuracy": 0.22422532886266708, "num_tokens": 84912244.0, "step": 48945 }, { "entropy": 5.834018850326538, "epoch": 3.808480840303443, "grad_norm": 1.2890625, "learning_rate": 0.0003604427072743216, "loss": 4.9509, "mean_token_accuracy": 0.2149347871541977, "num_tokens": 84920824.0, "step": 48950 }, { "entropy": 5.79565658569336, "epoch": 3.8088698696751604, "grad_norm": 1.359375, "learning_rate": 0.00036041706718399386, "loss": 4.9732, "mean_token_accuracy": 0.20446009188890457, "num_tokens": 84929661.0, "step": 48955 }, { "entropy": 5.941824197769165, "epoch": 3.809258899046878, "grad_norm": 1.46875, "learning_rate": 0.000360391425797598, "loss": 4.9946, "mean_token_accuracy": 0.21400182396173478, "num_tokens": 84938368.0, "step": 48960 }, { "entropy": 5.902072620391846, "epoch": 3.8096479284185953, "grad_norm": 1.375, "learning_rate": 0.0003603657831155233, "loss": 4.8998, "mean_token_accuracy": 0.2152867242693901, "num_tokens": 84946826.0, "step": 48965 }, { "entropy": 5.866127920150757, "epoch": 3.810036957790313, "grad_norm": 1.34375, "learning_rate": 0.0003603401391381587, "loss": 4.9866, "mean_token_accuracy": 0.21702080368995666, "num_tokens": 84955164.0, "step": 48970 }, { "entropy": 5.85193190574646, "epoch": 3.8104259871620307, "grad_norm": 1.28125, "learning_rate": 0.00036031449386589326, "loss": 4.9725, "mean_token_accuracy": 0.21098556816577912, "num_tokens": 84963857.0, "step": 48975 }, { "entropy": 5.905687379837036, "epoch": 3.8108150165337484, "grad_norm": 1.4140625, "learning_rate": 0.0003602888472991162, "loss": 4.9877, "mean_token_accuracy": 0.2038487359881401, "num_tokens": 84973216.0, "step": 48980 }, { "entropy": 5.91627082824707, "epoch": 3.811204045905466, "grad_norm": 1.3515625, "learning_rate": 0.00036026319943821664, "loss": 4.9642, "mean_token_accuracy": 0.20825836956501007, "num_tokens": 84982104.0, "step": 48985 }, { "entropy": 5.9184494972229, "epoch": 3.8115930752771834, "grad_norm": 1.375, "learning_rate": 0.0003602375502835837, "loss": 4.9968, "mean_token_accuracy": 0.20243929624557494, "num_tokens": 84991499.0, "step": 48990 }, { "entropy": 5.897100448608398, "epoch": 3.811982104648901, "grad_norm": 1.3828125, "learning_rate": 0.00036021189983560667, "loss": 4.9655, "mean_token_accuracy": 0.2152772918343544, "num_tokens": 85000084.0, "step": 48995 }, { "entropy": 5.904660892486572, "epoch": 3.8123711340206183, "grad_norm": 1.359375, "learning_rate": 0.00036018624809467466, "loss": 4.9897, "mean_token_accuracy": 0.20659076124429704, "num_tokens": 85008936.0, "step": 49000 }, { "entropy": 5.889039707183838, "epoch": 3.812760163392336, "grad_norm": 1.3359375, "learning_rate": 0.00036016059506117687, "loss": 5.0483, "mean_token_accuracy": 0.20299322456121444, "num_tokens": 85017483.0, "step": 49005 }, { "entropy": 5.868708705902099, "epoch": 3.8131491927640537, "grad_norm": 1.265625, "learning_rate": 0.0003601349407355027, "loss": 4.9389, "mean_token_accuracy": 0.2181716874241829, "num_tokens": 85026040.0, "step": 49010 }, { "entropy": 5.94707727432251, "epoch": 3.8135382221357714, "grad_norm": 1.3828125, "learning_rate": 0.0003601092851180412, "loss": 5.0203, "mean_token_accuracy": 0.21625827699899675, "num_tokens": 85034104.0, "step": 49015 }, { "entropy": 5.850922346115112, "epoch": 3.8139272515074887, "grad_norm": 1.328125, "learning_rate": 0.00036008362820918186, "loss": 4.9098, "mean_token_accuracy": 0.21770786494016647, "num_tokens": 85041399.0, "step": 49020 }, { "entropy": 5.8732133388519285, "epoch": 3.8143162808792064, "grad_norm": 1.390625, "learning_rate": 0.0003600579700093138, "loss": 5.0153, "mean_token_accuracy": 0.20944169908761978, "num_tokens": 85050077.0, "step": 49025 }, { "entropy": 5.862433671951294, "epoch": 3.814705310250924, "grad_norm": 1.46875, "learning_rate": 0.00036003231051882646, "loss": 4.9532, "mean_token_accuracy": 0.2173406586050987, "num_tokens": 85058548.0, "step": 49030 }, { "entropy": 5.994568586349487, "epoch": 3.8150943396226413, "grad_norm": 1.53125, "learning_rate": 0.00036000664973810914, "loss": 5.0003, "mean_token_accuracy": 0.2112899601459503, "num_tokens": 85067290.0, "step": 49035 }, { "entropy": 5.945260000228882, "epoch": 3.815483368994359, "grad_norm": 1.4296875, "learning_rate": 0.0003599809876675513, "loss": 5.015, "mean_token_accuracy": 0.20989690572023392, "num_tokens": 85076420.0, "step": 49040 }, { "entropy": 5.888666772842408, "epoch": 3.8158723983660767, "grad_norm": 1.265625, "learning_rate": 0.00035995532430754205, "loss": 5.018, "mean_token_accuracy": 0.20737213790416717, "num_tokens": 85085664.0, "step": 49045 }, { "entropy": 5.940039873123169, "epoch": 3.8162614277377944, "grad_norm": 1.359375, "learning_rate": 0.0003599296596584711, "loss": 5.077, "mean_token_accuracy": 0.20953987389802933, "num_tokens": 85094489.0, "step": 49050 }, { "entropy": 5.896390199661255, "epoch": 3.8166504571095117, "grad_norm": 1.3125, "learning_rate": 0.0003599039937207278, "loss": 4.9669, "mean_token_accuracy": 0.2164403960108757, "num_tokens": 85103105.0, "step": 49055 }, { "entropy": 5.819214725494385, "epoch": 3.8170394864812294, "grad_norm": 1.4140625, "learning_rate": 0.0003598783264947015, "loss": 4.9044, "mean_token_accuracy": 0.21478349566459656, "num_tokens": 85110956.0, "step": 49060 }, { "entropy": 5.851478338241577, "epoch": 3.8174285158529466, "grad_norm": 1.3359375, "learning_rate": 0.00035985265798078165, "loss": 5.012, "mean_token_accuracy": 0.21419051438570022, "num_tokens": 85119775.0, "step": 49065 }, { "entropy": 5.912068700790405, "epoch": 3.8178175452246643, "grad_norm": 1.3984375, "learning_rate": 0.00035982698817935783, "loss": 5.0538, "mean_token_accuracy": 0.20906738340854644, "num_tokens": 85128491.0, "step": 49070 }, { "entropy": 5.916338920593262, "epoch": 3.818206574596382, "grad_norm": 1.4453125, "learning_rate": 0.0003598013170908194, "loss": 4.9998, "mean_token_accuracy": 0.20591468513011932, "num_tokens": 85136866.0, "step": 49075 }, { "entropy": 5.8801473617553714, "epoch": 3.8185956039680997, "grad_norm": 1.421875, "learning_rate": 0.0003597756447155559, "loss": 4.8954, "mean_token_accuracy": 0.21352397054433822, "num_tokens": 85145209.0, "step": 49080 }, { "entropy": 5.9180950164794925, "epoch": 3.8189846333398174, "grad_norm": 1.5390625, "learning_rate": 0.00035974997105395705, "loss": 5.1569, "mean_token_accuracy": 0.19886057823896408, "num_tokens": 85154448.0, "step": 49085 }, { "entropy": 5.902649879455566, "epoch": 3.8193736627115347, "grad_norm": 1.59375, "learning_rate": 0.00035972429610641224, "loss": 4.9911, "mean_token_accuracy": 0.2078552082180977, "num_tokens": 85162345.0, "step": 49090 }, { "entropy": 5.931975507736206, "epoch": 3.8197626920832524, "grad_norm": 1.328125, "learning_rate": 0.00035969861987331114, "loss": 4.9768, "mean_token_accuracy": 0.2181047171354294, "num_tokens": 85171297.0, "step": 49095 }, { "entropy": 5.97546420097351, "epoch": 3.8201517214549696, "grad_norm": 1.328125, "learning_rate": 0.0003596729423550433, "loss": 4.979, "mean_token_accuracy": 0.21391634345054628, "num_tokens": 85179509.0, "step": 49100 }, { "entropy": 5.945387649536133, "epoch": 3.8205407508266873, "grad_norm": 1.359375, "learning_rate": 0.0003596472635519983, "loss": 5.0447, "mean_token_accuracy": 0.20629948377609253, "num_tokens": 85188338.0, "step": 49105 }, { "entropy": 5.875040435791016, "epoch": 3.820929780198405, "grad_norm": 1.421875, "learning_rate": 0.0003596215834645657, "loss": 4.9477, "mean_token_accuracy": 0.21994423121213913, "num_tokens": 85196229.0, "step": 49110 }, { "entropy": 5.875749206542968, "epoch": 3.8213188095701227, "grad_norm": 1.359375, "learning_rate": 0.00035959590209313537, "loss": 4.9583, "mean_token_accuracy": 0.21297667175531387, "num_tokens": 85204897.0, "step": 49115 }, { "entropy": 5.885037660598755, "epoch": 3.82170783894184, "grad_norm": 1.3984375, "learning_rate": 0.0003595702194380968, "loss": 4.9255, "mean_token_accuracy": 0.21585139781236648, "num_tokens": 85213871.0, "step": 49120 }, { "entropy": 5.909312343597412, "epoch": 3.8220968683135577, "grad_norm": 1.453125, "learning_rate": 0.00035954453549983984, "loss": 5.0186, "mean_token_accuracy": 0.20311688929796218, "num_tokens": 85222573.0, "step": 49125 }, { "entropy": 5.860403203964234, "epoch": 3.8224858976852754, "grad_norm": 1.328125, "learning_rate": 0.00035951885027875406, "loss": 4.9778, "mean_token_accuracy": 0.2101161390542984, "num_tokens": 85230535.0, "step": 49130 }, { "entropy": 5.867007303237915, "epoch": 3.8228749270569926, "grad_norm": 1.3125, "learning_rate": 0.00035949316377522934, "loss": 4.9243, "mean_token_accuracy": 0.21654145419597626, "num_tokens": 85239785.0, "step": 49135 }, { "entropy": 5.82874174118042, "epoch": 3.8232639564287103, "grad_norm": 1.3046875, "learning_rate": 0.0003594674759896553, "loss": 4.8439, "mean_token_accuracy": 0.21349311918020247, "num_tokens": 85248262.0, "step": 49140 }, { "entropy": 5.916867017745972, "epoch": 3.823652985800428, "grad_norm": 1.2734375, "learning_rate": 0.0003594417869224217, "loss": 5.0065, "mean_token_accuracy": 0.2099852591753006, "num_tokens": 85257647.0, "step": 49145 }, { "entropy": 5.8619428157806395, "epoch": 3.8240420151721457, "grad_norm": 1.3828125, "learning_rate": 0.00035941609657391845, "loss": 5.0016, "mean_token_accuracy": 0.20683867782354354, "num_tokens": 85266065.0, "step": 49150 }, { "entropy": 5.882521104812622, "epoch": 3.824431044543863, "grad_norm": 1.375, "learning_rate": 0.0003593904049445353, "loss": 5.0542, "mean_token_accuracy": 0.2088477209210396, "num_tokens": 85274100.0, "step": 49155 }, { "entropy": 5.89699239730835, "epoch": 3.8248200739155807, "grad_norm": 1.3125, "learning_rate": 0.00035936471203466206, "loss": 4.9464, "mean_token_accuracy": 0.21726315915584565, "num_tokens": 85282690.0, "step": 49160 }, { "entropy": 5.901795387268066, "epoch": 3.8252091032872984, "grad_norm": 1.3125, "learning_rate": 0.0003593390178446886, "loss": 4.9435, "mean_token_accuracy": 0.21812914162874222, "num_tokens": 85291136.0, "step": 49165 }, { "entropy": 5.8666411399841305, "epoch": 3.8255981326590156, "grad_norm": 1.4296875, "learning_rate": 0.0003593133223750047, "loss": 4.9627, "mean_token_accuracy": 0.2069456845521927, "num_tokens": 85299531.0, "step": 49170 }, { "entropy": 5.865469217300415, "epoch": 3.8259871620307333, "grad_norm": 1.3671875, "learning_rate": 0.0003592876256260004, "loss": 5.0008, "mean_token_accuracy": 0.21047211289405823, "num_tokens": 85308975.0, "step": 49175 }, { "entropy": 6.000840711593628, "epoch": 3.826376191402451, "grad_norm": 1.4375, "learning_rate": 0.0003592619275980656, "loss": 5.1008, "mean_token_accuracy": 0.20032065808773042, "num_tokens": 85316878.0, "step": 49180 }, { "entropy": 5.876325464248657, "epoch": 3.8267652207741687, "grad_norm": 1.375, "learning_rate": 0.00035923622829159014, "loss": 4.9467, "mean_token_accuracy": 0.20984466820955278, "num_tokens": 85325330.0, "step": 49185 }, { "entropy": 5.897516870498658, "epoch": 3.827154250145886, "grad_norm": 1.3515625, "learning_rate": 0.0003592105277069639, "loss": 5.0618, "mean_token_accuracy": 0.20819537937641144, "num_tokens": 85334137.0, "step": 49190 }, { "entropy": 5.810792112350464, "epoch": 3.8275432795176036, "grad_norm": 1.3984375, "learning_rate": 0.000359184825844577, "loss": 4.9238, "mean_token_accuracy": 0.2127223029732704, "num_tokens": 85342505.0, "step": 49195 }, { "entropy": 5.9118194580078125, "epoch": 3.827932308889321, "grad_norm": 1.359375, "learning_rate": 0.00035915912270481935, "loss": 5.0027, "mean_token_accuracy": 0.20893150717020034, "num_tokens": 85350831.0, "step": 49200 }, { "entropy": 5.941920757293701, "epoch": 3.8283213382610386, "grad_norm": 1.296875, "learning_rate": 0.000359133418288081, "loss": 5.0442, "mean_token_accuracy": 0.203595632314682, "num_tokens": 85360078.0, "step": 49205 }, { "entropy": 5.876425743103027, "epoch": 3.8287103676327563, "grad_norm": 1.390625, "learning_rate": 0.00035910771259475187, "loss": 4.9029, "mean_token_accuracy": 0.21201393455266954, "num_tokens": 85368731.0, "step": 49210 }, { "entropy": 5.901688432693481, "epoch": 3.829099397004474, "grad_norm": 1.3984375, "learning_rate": 0.0003590820056252222, "loss": 5.0706, "mean_token_accuracy": 0.20542028099298476, "num_tokens": 85377193.0, "step": 49215 }, { "entropy": 5.8391945362091064, "epoch": 3.8294884263761912, "grad_norm": 1.4296875, "learning_rate": 0.0003590562973798818, "loss": 4.8881, "mean_token_accuracy": 0.2210157707333565, "num_tokens": 85386808.0, "step": 49220 }, { "entropy": 5.879534339904785, "epoch": 3.829877455747909, "grad_norm": 1.4921875, "learning_rate": 0.0003590305878591209, "loss": 4.9904, "mean_token_accuracy": 0.21246301382780075, "num_tokens": 85394831.0, "step": 49225 }, { "entropy": 5.852814722061157, "epoch": 3.8302664851196266, "grad_norm": 1.3046875, "learning_rate": 0.00035900487706332963, "loss": 4.9185, "mean_token_accuracy": 0.21568588465452193, "num_tokens": 85403604.0, "step": 49230 }, { "entropy": 5.943615961074829, "epoch": 3.830655514491344, "grad_norm": 1.359375, "learning_rate": 0.000358979164992898, "loss": 5.0148, "mean_token_accuracy": 0.2093362793326378, "num_tokens": 85412030.0, "step": 49235 }, { "entropy": 5.852046489715576, "epoch": 3.8310445438630616, "grad_norm": 1.3515625, "learning_rate": 0.00035895345164821624, "loss": 4.9036, "mean_token_accuracy": 0.22068717926740647, "num_tokens": 85421059.0, "step": 49240 }, { "entropy": 5.842216539382934, "epoch": 3.8314335732347793, "grad_norm": 1.3984375, "learning_rate": 0.0003589277370296745, "loss": 4.9855, "mean_token_accuracy": 0.21445718556642532, "num_tokens": 85430782.0, "step": 49245 }, { "entropy": 5.984556245803833, "epoch": 3.831822602606497, "grad_norm": 1.2890625, "learning_rate": 0.00035890202113766283, "loss": 5.1381, "mean_token_accuracy": 0.19815652966499328, "num_tokens": 85439749.0, "step": 49250 }, { "entropy": 5.921663427352906, "epoch": 3.8322116319782142, "grad_norm": 1.3828125, "learning_rate": 0.00035887630397257167, "loss": 5.0331, "mean_token_accuracy": 0.2135204181075096, "num_tokens": 85449156.0, "step": 49255 }, { "entropy": 5.924413013458252, "epoch": 3.832600661349932, "grad_norm": 1.390625, "learning_rate": 0.000358850585534791, "loss": 4.9391, "mean_token_accuracy": 0.20843184888362884, "num_tokens": 85457218.0, "step": 49260 }, { "entropy": 5.8369842052459715, "epoch": 3.8329896907216496, "grad_norm": 1.4375, "learning_rate": 0.00035882486582471124, "loss": 4.9443, "mean_token_accuracy": 0.21167470663785934, "num_tokens": 85466164.0, "step": 49265 }, { "entropy": 5.8762514114379885, "epoch": 3.833378720093367, "grad_norm": 1.28125, "learning_rate": 0.0003587991448427225, "loss": 4.946, "mean_token_accuracy": 0.2141008511185646, "num_tokens": 85474826.0, "step": 49270 }, { "entropy": 5.886213779449463, "epoch": 3.8337677494650846, "grad_norm": 1.328125, "learning_rate": 0.00035877342258921514, "loss": 5.0119, "mean_token_accuracy": 0.21271411180496216, "num_tokens": 85484251.0, "step": 49275 }, { "entropy": 5.906606388092041, "epoch": 3.8341567788368023, "grad_norm": 1.3671875, "learning_rate": 0.00035874769906457936, "loss": 4.9933, "mean_token_accuracy": 0.20562374144792556, "num_tokens": 85492911.0, "step": 49280 }, { "entropy": 6.007534313201904, "epoch": 3.83454580820852, "grad_norm": 1.484375, "learning_rate": 0.00035872197426920567, "loss": 5.0437, "mean_token_accuracy": 0.2082899108529091, "num_tokens": 85501171.0, "step": 49285 }, { "entropy": 5.8936254501342775, "epoch": 3.8349348375802372, "grad_norm": 1.421875, "learning_rate": 0.0003586962482034842, "loss": 4.9988, "mean_token_accuracy": 0.20873216390609742, "num_tokens": 85509277.0, "step": 49290 }, { "entropy": 5.910317754745483, "epoch": 3.835323866951955, "grad_norm": 1.4765625, "learning_rate": 0.00035867052086780544, "loss": 5.0698, "mean_token_accuracy": 0.20565247982740403, "num_tokens": 85518012.0, "step": 49295 }, { "entropy": 5.92736291885376, "epoch": 3.835712896323672, "grad_norm": 1.359375, "learning_rate": 0.0003586447922625596, "loss": 4.976, "mean_token_accuracy": 0.21612330973148347, "num_tokens": 85526750.0, "step": 49300 }, { "entropy": 5.925536346435547, "epoch": 3.83610192569539, "grad_norm": 1.34375, "learning_rate": 0.00035861906238813726, "loss": 5.0372, "mean_token_accuracy": 0.20125157833099366, "num_tokens": 85535535.0, "step": 49305 }, { "entropy": 5.878973579406738, "epoch": 3.8364909550671076, "grad_norm": 1.3984375, "learning_rate": 0.00035859333124492866, "loss": 4.9407, "mean_token_accuracy": 0.21806163489818572, "num_tokens": 85543528.0, "step": 49310 }, { "entropy": 5.907936668395996, "epoch": 3.8368799844388253, "grad_norm": 1.4375, "learning_rate": 0.0003585675988333244, "loss": 4.9689, "mean_token_accuracy": 0.2133386328816414, "num_tokens": 85552416.0, "step": 49315 }, { "entropy": 5.899492359161377, "epoch": 3.837269013810543, "grad_norm": 1.34375, "learning_rate": 0.0003585418651537147, "loss": 5.011, "mean_token_accuracy": 0.21662275940179826, "num_tokens": 85561323.0, "step": 49320 }, { "entropy": 5.904488134384155, "epoch": 3.8376580431822602, "grad_norm": 1.34375, "learning_rate": 0.00035851613020649036, "loss": 5.0052, "mean_token_accuracy": 0.205824775993824, "num_tokens": 85570452.0, "step": 49325 }, { "entropy": 5.88805661201477, "epoch": 3.838047072553978, "grad_norm": 1.3203125, "learning_rate": 0.00035849039399204157, "loss": 4.9615, "mean_token_accuracy": 0.2129218637943268, "num_tokens": 85579091.0, "step": 49330 }, { "entropy": 5.87508225440979, "epoch": 3.838436101925695, "grad_norm": 1.2734375, "learning_rate": 0.00035846465651075897, "loss": 5.0227, "mean_token_accuracy": 0.2129583939909935, "num_tokens": 85587892.0, "step": 49335 }, { "entropy": 5.824540901184082, "epoch": 3.838825131297413, "grad_norm": 1.28125, "learning_rate": 0.00035843891776303304, "loss": 4.9594, "mean_token_accuracy": 0.21353771835565566, "num_tokens": 85596710.0, "step": 49340 }, { "entropy": 5.92581729888916, "epoch": 3.8392141606691306, "grad_norm": 1.4453125, "learning_rate": 0.0003584131777492543, "loss": 4.9863, "mean_token_accuracy": 0.21097322851419448, "num_tokens": 85605591.0, "step": 49345 }, { "entropy": 5.910016870498657, "epoch": 3.8396031900408483, "grad_norm": 1.3984375, "learning_rate": 0.0003583874364698134, "loss": 5.0626, "mean_token_accuracy": 0.20946840047836304, "num_tokens": 85613988.0, "step": 49350 }, { "entropy": 5.831673192977905, "epoch": 3.8399922194125655, "grad_norm": 1.4453125, "learning_rate": 0.0003583616939251009, "loss": 4.9699, "mean_token_accuracy": 0.20580997169017792, "num_tokens": 85622880.0, "step": 49355 }, { "entropy": 5.9092248439788815, "epoch": 3.840381248784283, "grad_norm": 1.28125, "learning_rate": 0.0003583359501155073, "loss": 5.0363, "mean_token_accuracy": 0.2075486183166504, "num_tokens": 85631611.0, "step": 49360 }, { "entropy": 5.922773170471191, "epoch": 3.840770278156001, "grad_norm": 1.3828125, "learning_rate": 0.0003583102050414234, "loss": 4.9504, "mean_token_accuracy": 0.20957036316394806, "num_tokens": 85639715.0, "step": 49365 }, { "entropy": 5.893848943710327, "epoch": 3.841159307527718, "grad_norm": 1.3125, "learning_rate": 0.00035828445870323967, "loss": 5.0861, "mean_token_accuracy": 0.2073373943567276, "num_tokens": 85649609.0, "step": 49370 }, { "entropy": 5.879936361312867, "epoch": 3.841548336899436, "grad_norm": 1.2578125, "learning_rate": 0.0003582587111013469, "loss": 4.9778, "mean_token_accuracy": 0.22126031070947647, "num_tokens": 85658404.0, "step": 49375 }, { "entropy": 5.897621965408325, "epoch": 3.8419373662711536, "grad_norm": 1.3203125, "learning_rate": 0.0003582329622361356, "loss": 4.9279, "mean_token_accuracy": 0.21554087847471237, "num_tokens": 85666682.0, "step": 49380 }, { "entropy": 5.931985139846802, "epoch": 3.8423263956428713, "grad_norm": 1.359375, "learning_rate": 0.0003582072121079966, "loss": 5.0808, "mean_token_accuracy": 0.2006845772266388, "num_tokens": 85675833.0, "step": 49385 }, { "entropy": 5.9050031185150145, "epoch": 3.8427154250145885, "grad_norm": 1.359375, "learning_rate": 0.00035818146071732064, "loss": 4.9348, "mean_token_accuracy": 0.2118572935461998, "num_tokens": 85684449.0, "step": 49390 }, { "entropy": 5.957858943939209, "epoch": 3.843104454386306, "grad_norm": 1.3828125, "learning_rate": 0.00035815570806449845, "loss": 5.1049, "mean_token_accuracy": 0.19879860132932664, "num_tokens": 85693164.0, "step": 49395 }, { "entropy": 5.892121362686157, "epoch": 3.8434934837580235, "grad_norm": 1.3359375, "learning_rate": 0.00035812995414992075, "loss": 5.0564, "mean_token_accuracy": 0.20386233925819397, "num_tokens": 85701722.0, "step": 49400 }, { "entropy": 6.008479738235474, "epoch": 3.843882513129741, "grad_norm": 1.28125, "learning_rate": 0.00035810419897397823, "loss": 5.0731, "mean_token_accuracy": 0.19837931990623475, "num_tokens": 85710290.0, "step": 49405 }, { "entropy": 5.891609811782837, "epoch": 3.844271542501459, "grad_norm": 1.3203125, "learning_rate": 0.0003580784425370618, "loss": 4.9194, "mean_token_accuracy": 0.2164851114153862, "num_tokens": 85719321.0, "step": 49410 }, { "entropy": 5.962700891494751, "epoch": 3.8446605718731766, "grad_norm": 1.375, "learning_rate": 0.0003580526848395622, "loss": 5.0789, "mean_token_accuracy": 0.20483056157827378, "num_tokens": 85728386.0, "step": 49415 }, { "entropy": 5.972732925415039, "epoch": 3.8450496012448943, "grad_norm": 1.3671875, "learning_rate": 0.00035802692588187036, "loss": 5.0597, "mean_token_accuracy": 0.2003506153821945, "num_tokens": 85737460.0, "step": 49420 }, { "entropy": 5.929497814178466, "epoch": 3.8454386306166115, "grad_norm": 1.3203125, "learning_rate": 0.000358001165664377, "loss": 4.9643, "mean_token_accuracy": 0.20923516303300857, "num_tokens": 85745732.0, "step": 49425 }, { "entropy": 5.906579160690308, "epoch": 3.845827659988329, "grad_norm": 1.3203125, "learning_rate": 0.0003579754041874731, "loss": 4.9672, "mean_token_accuracy": 0.21690774857997894, "num_tokens": 85754180.0, "step": 49430 }, { "entropy": 5.860488367080689, "epoch": 3.8462166893600465, "grad_norm": 1.328125, "learning_rate": 0.0003579496414515495, "loss": 4.9804, "mean_token_accuracy": 0.21136310547590256, "num_tokens": 85764189.0, "step": 49435 }, { "entropy": 5.908385753631592, "epoch": 3.846605718731764, "grad_norm": 1.40625, "learning_rate": 0.00035792387745699715, "loss": 4.9181, "mean_token_accuracy": 0.21308577060699463, "num_tokens": 85773104.0, "step": 49440 }, { "entropy": 5.944346189498901, "epoch": 3.846994748103482, "grad_norm": 1.453125, "learning_rate": 0.0003578981122042069, "loss": 4.9794, "mean_token_accuracy": 0.2118445411324501, "num_tokens": 85781198.0, "step": 49445 }, { "entropy": 5.890374612808228, "epoch": 3.8473837774751996, "grad_norm": 1.328125, "learning_rate": 0.0003578723456935698, "loss": 4.9497, "mean_token_accuracy": 0.20916337966918946, "num_tokens": 85789662.0, "step": 49450 }, { "entropy": 5.811501979827881, "epoch": 3.847772806846917, "grad_norm": 1.34375, "learning_rate": 0.0003578465779254768, "loss": 4.8571, "mean_token_accuracy": 0.2253691166639328, "num_tokens": 85797758.0, "step": 49455 }, { "entropy": 5.87333345413208, "epoch": 3.8481618362186345, "grad_norm": 1.390625, "learning_rate": 0.00035782080890031876, "loss": 4.9291, "mean_token_accuracy": 0.2186008647084236, "num_tokens": 85806310.0, "step": 49460 }, { "entropy": 5.875651264190674, "epoch": 3.848550865590352, "grad_norm": 1.2734375, "learning_rate": 0.00035779503861848677, "loss": 4.9518, "mean_token_accuracy": 0.21422866731882095, "num_tokens": 85815340.0, "step": 49465 }, { "entropy": 5.91192626953125, "epoch": 3.8489398949620695, "grad_norm": 1.3203125, "learning_rate": 0.0003577692670803719, "loss": 4.986, "mean_token_accuracy": 0.211429663002491, "num_tokens": 85824700.0, "step": 49470 }, { "entropy": 5.926465845108032, "epoch": 3.849328924333787, "grad_norm": 1.5, "learning_rate": 0.0003577434942863651, "loss": 4.9885, "mean_token_accuracy": 0.21352363526821136, "num_tokens": 85832710.0, "step": 49475 }, { "entropy": 5.850472021102905, "epoch": 3.849717953705505, "grad_norm": 1.40625, "learning_rate": 0.0003577177202368575, "loss": 5.012, "mean_token_accuracy": 0.20687387585639955, "num_tokens": 85841359.0, "step": 49480 }, { "entropy": 5.851738739013672, "epoch": 3.8501069830772225, "grad_norm": 1.25, "learning_rate": 0.00035769194493224014, "loss": 4.9922, "mean_token_accuracy": 0.20448113828897477, "num_tokens": 85850877.0, "step": 49485 }, { "entropy": 5.961606121063232, "epoch": 3.85049601244894, "grad_norm": 1.296875, "learning_rate": 0.00035766616837290413, "loss": 5.0023, "mean_token_accuracy": 0.207453890144825, "num_tokens": 85859140.0, "step": 49490 }, { "entropy": 5.948023128509521, "epoch": 3.8508850418206575, "grad_norm": 1.4296875, "learning_rate": 0.0003576403905592406, "loss": 5.0326, "mean_token_accuracy": 0.21148218512535094, "num_tokens": 85867039.0, "step": 49495 }, { "entropy": 5.8297224044799805, "epoch": 3.8512740711923747, "grad_norm": 1.484375, "learning_rate": 0.00035761461149164066, "loss": 4.9088, "mean_token_accuracy": 0.21660172045230866, "num_tokens": 85875199.0, "step": 49500 }, { "entropy": 5.947691202163696, "epoch": 3.8516631005640924, "grad_norm": 1.453125, "learning_rate": 0.00035758883117049543, "loss": 5.0227, "mean_token_accuracy": 0.21306429505348207, "num_tokens": 85883937.0, "step": 49505 }, { "entropy": 5.851103019714356, "epoch": 3.85205212993581, "grad_norm": 1.25, "learning_rate": 0.0003575630495961962, "loss": 4.9085, "mean_token_accuracy": 0.21646764278411865, "num_tokens": 85892750.0, "step": 49510 }, { "entropy": 5.847301387786866, "epoch": 3.852441159307528, "grad_norm": 1.3828125, "learning_rate": 0.00035753726676913413, "loss": 4.9351, "mean_token_accuracy": 0.21430059373378754, "num_tokens": 85900967.0, "step": 49515 }, { "entropy": 5.871849822998047, "epoch": 3.8528301886792455, "grad_norm": 1.53125, "learning_rate": 0.00035751148268970046, "loss": 5.0326, "mean_token_accuracy": 0.2041352793574333, "num_tokens": 85908953.0, "step": 49520 }, { "entropy": 5.901280403137207, "epoch": 3.853219218050963, "grad_norm": 1.40625, "learning_rate": 0.0003574856973582863, "loss": 4.9046, "mean_token_accuracy": 0.21914848685264587, "num_tokens": 85916754.0, "step": 49525 }, { "entropy": 5.860062217712402, "epoch": 3.8536082474226805, "grad_norm": 1.3671875, "learning_rate": 0.00035745991077528296, "loss": 4.907, "mean_token_accuracy": 0.21508288383483887, "num_tokens": 85925338.0, "step": 49530 }, { "entropy": 5.8786091804504395, "epoch": 3.8539972767943977, "grad_norm": 1.4296875, "learning_rate": 0.00035743412294108175, "loss": 4.937, "mean_token_accuracy": 0.21505581587553024, "num_tokens": 85933053.0, "step": 49535 }, { "entropy": 5.961914110183716, "epoch": 3.8543863061661154, "grad_norm": 1.375, "learning_rate": 0.0003574083338560739, "loss": 5.0817, "mean_token_accuracy": 0.20651623904705046, "num_tokens": 85942552.0, "step": 49540 }, { "entropy": 5.871679353713989, "epoch": 3.854775335537833, "grad_norm": 1.2734375, "learning_rate": 0.00035738254352065074, "loss": 4.8736, "mean_token_accuracy": 0.21851248890161515, "num_tokens": 85950843.0, "step": 49545 }, { "entropy": 5.894000482559204, "epoch": 3.855164364909551, "grad_norm": 1.3046875, "learning_rate": 0.00035735675193520364, "loss": 4.9703, "mean_token_accuracy": 0.2138999357819557, "num_tokens": 85959383.0, "step": 49550 }, { "entropy": 5.846316909790039, "epoch": 3.855553394281268, "grad_norm": 1.4609375, "learning_rate": 0.0003573309591001239, "loss": 4.8979, "mean_token_accuracy": 0.2154393747448921, "num_tokens": 85967134.0, "step": 49555 }, { "entropy": 5.915923118591309, "epoch": 3.855942423652986, "grad_norm": 1.3046875, "learning_rate": 0.000357305165015803, "loss": 5.0077, "mean_token_accuracy": 0.21036537736654282, "num_tokens": 85975921.0, "step": 49560 }, { "entropy": 5.903443145751953, "epoch": 3.8563314530247035, "grad_norm": 1.3984375, "learning_rate": 0.00035727936968263206, "loss": 5.0284, "mean_token_accuracy": 0.20756752789020538, "num_tokens": 85984447.0, "step": 49565 }, { "entropy": 5.928441381454467, "epoch": 3.8567204823964207, "grad_norm": 1.375, "learning_rate": 0.0003572535731010028, "loss": 5.0355, "mean_token_accuracy": 0.2065972164273262, "num_tokens": 85993548.0, "step": 49570 }, { "entropy": 5.960633373260498, "epoch": 3.8571095117681384, "grad_norm": 1.3828125, "learning_rate": 0.0003572277752713063, "loss": 5.0686, "mean_token_accuracy": 0.20573433339595795, "num_tokens": 86002471.0, "step": 49575 }, { "entropy": 5.9383544921875, "epoch": 3.857498541139856, "grad_norm": 1.3671875, "learning_rate": 0.0003572019761939343, "loss": 4.9775, "mean_token_accuracy": 0.20848557054996492, "num_tokens": 86010488.0, "step": 49580 }, { "entropy": 5.875814151763916, "epoch": 3.857887570511574, "grad_norm": 1.296875, "learning_rate": 0.00035717617586927814, "loss": 4.9704, "mean_token_accuracy": 0.21251550912857056, "num_tokens": 86019686.0, "step": 49585 }, { "entropy": 5.93630838394165, "epoch": 3.858276599883291, "grad_norm": 1.3828125, "learning_rate": 0.00035715037429772935, "loss": 4.9843, "mean_token_accuracy": 0.21156545281410216, "num_tokens": 86028510.0, "step": 49590 }, { "entropy": 5.8833996772766115, "epoch": 3.8586656292550088, "grad_norm": 1.359375, "learning_rate": 0.0003571245714796793, "loss": 4.9284, "mean_token_accuracy": 0.21667902916669846, "num_tokens": 86038029.0, "step": 49595 }, { "entropy": 5.860598230361939, "epoch": 3.8590546586267265, "grad_norm": 1.296875, "learning_rate": 0.0003570987674155197, "loss": 4.9847, "mean_token_accuracy": 0.2169323444366455, "num_tokens": 86046530.0, "step": 49600 }, { "entropy": 5.819795417785644, "epoch": 3.8594436879984437, "grad_norm": 1.34375, "learning_rate": 0.0003570729621056419, "loss": 4.8926, "mean_token_accuracy": 0.22292157858610154, "num_tokens": 86055502.0, "step": 49605 }, { "entropy": 5.9052674770355225, "epoch": 3.8598327173701614, "grad_norm": 1.4765625, "learning_rate": 0.00035704715555043753, "loss": 4.9722, "mean_token_accuracy": 0.21512884348630906, "num_tokens": 86063357.0, "step": 49610 }, { "entropy": 5.862415218353272, "epoch": 3.860221746741879, "grad_norm": 1.5, "learning_rate": 0.00035702134775029813, "loss": 4.9404, "mean_token_accuracy": 0.21755334883928298, "num_tokens": 86071507.0, "step": 49615 }, { "entropy": 5.79955472946167, "epoch": 3.860610776113597, "grad_norm": 1.3984375, "learning_rate": 0.0003569955387056154, "loss": 4.8667, "mean_token_accuracy": 0.21954558342695235, "num_tokens": 86080456.0, "step": 49620 }, { "entropy": 5.848525524139404, "epoch": 3.860999805485314, "grad_norm": 1.3828125, "learning_rate": 0.00035696972841678094, "loss": 4.9027, "mean_token_accuracy": 0.21932505816221237, "num_tokens": 86088933.0, "step": 49625 }, { "entropy": 5.948590087890625, "epoch": 3.8613888348570318, "grad_norm": 1.3125, "learning_rate": 0.0003569439168841862, "loss": 4.9727, "mean_token_accuracy": 0.2153840497136116, "num_tokens": 86097035.0, "step": 49630 }, { "entropy": 5.826184511184692, "epoch": 3.861777864228749, "grad_norm": 1.2578125, "learning_rate": 0.00035691810410822303, "loss": 4.8917, "mean_token_accuracy": 0.2149326503276825, "num_tokens": 86105898.0, "step": 49635 }, { "entropy": 5.929840469360352, "epoch": 3.8621668936004667, "grad_norm": 1.421875, "learning_rate": 0.00035689229008928304, "loss": 5.002, "mean_token_accuracy": 0.21724387705326081, "num_tokens": 86113757.0, "step": 49640 }, { "entropy": 5.886704635620117, "epoch": 3.8625559229721844, "grad_norm": 1.28125, "learning_rate": 0.00035686647482775774, "loss": 5.0092, "mean_token_accuracy": 0.20430192053318025, "num_tokens": 86122487.0, "step": 49645 }, { "entropy": 6.024584054946899, "epoch": 3.862944952343902, "grad_norm": 1.296875, "learning_rate": 0.00035684065832403903, "loss": 5.0343, "mean_token_accuracy": 0.21021942794322968, "num_tokens": 86132146.0, "step": 49650 }, { "entropy": 5.858136510848999, "epoch": 3.8633339817156194, "grad_norm": 1.40625, "learning_rate": 0.0003568148405785187, "loss": 4.9057, "mean_token_accuracy": 0.21554238349199295, "num_tokens": 86140247.0, "step": 49655 }, { "entropy": 5.88458662033081, "epoch": 3.863723011087337, "grad_norm": 1.3515625, "learning_rate": 0.0003567890215915883, "loss": 5.0282, "mean_token_accuracy": 0.20507986545562745, "num_tokens": 86148410.0, "step": 49660 }, { "entropy": 5.840918445587159, "epoch": 3.8641120404590548, "grad_norm": 1.3671875, "learning_rate": 0.00035676320136363975, "loss": 4.9228, "mean_token_accuracy": 0.2198563814163208, "num_tokens": 86157089.0, "step": 49665 }, { "entropy": 5.967732954025268, "epoch": 3.864501069830772, "grad_norm": 1.3671875, "learning_rate": 0.0003567373798950647, "loss": 5.0042, "mean_token_accuracy": 0.20341504365205765, "num_tokens": 86165071.0, "step": 49670 }, { "entropy": 5.903130912780762, "epoch": 3.8648900992024897, "grad_norm": 1.3515625, "learning_rate": 0.00035671155718625504, "loss": 4.9538, "mean_token_accuracy": 0.22221267521381377, "num_tokens": 86173685.0, "step": 49675 }, { "entropy": 5.875367498397827, "epoch": 3.8652791285742074, "grad_norm": 1.2578125, "learning_rate": 0.0003566857332376025, "loss": 4.9736, "mean_token_accuracy": 0.2106228932738304, "num_tokens": 86181642.0, "step": 49680 }, { "entropy": 5.948966836929321, "epoch": 3.865668157945925, "grad_norm": 1.3671875, "learning_rate": 0.00035665990804949904, "loss": 5.1017, "mean_token_accuracy": 0.2040363222360611, "num_tokens": 86190261.0, "step": 49685 }, { "entropy": 6.020456266403198, "epoch": 3.8660571873176424, "grad_norm": 1.4765625, "learning_rate": 0.0003566340816223364, "loss": 5.1097, "mean_token_accuracy": 0.19796894937753678, "num_tokens": 86200086.0, "step": 49690 }, { "entropy": 5.994291639328003, "epoch": 3.86644621668936, "grad_norm": 1.3671875, "learning_rate": 0.0003566082539565066, "loss": 5.0274, "mean_token_accuracy": 0.20669254064559936, "num_tokens": 86209312.0, "step": 49695 }, { "entropy": 5.9707887172698975, "epoch": 3.8668352460610778, "grad_norm": 1.3203125, "learning_rate": 0.0003565824250524013, "loss": 5.0436, "mean_token_accuracy": 0.2056431621313095, "num_tokens": 86218762.0, "step": 49700 }, { "entropy": 5.939906454086303, "epoch": 3.867224275432795, "grad_norm": 1.296875, "learning_rate": 0.00035655659491041266, "loss": 5.1041, "mean_token_accuracy": 0.20547030866146088, "num_tokens": 86227478.0, "step": 49705 }, { "entropy": 5.900994682312012, "epoch": 3.8676133048045127, "grad_norm": 1.3203125, "learning_rate": 0.0003565307635309325, "loss": 5.039, "mean_token_accuracy": 0.2042345032095909, "num_tokens": 86236122.0, "step": 49710 }, { "entropy": 5.939699125289917, "epoch": 3.8680023341762304, "grad_norm": 1.453125, "learning_rate": 0.0003565049309143527, "loss": 5.0381, "mean_token_accuracy": 0.20409068316221238, "num_tokens": 86244838.0, "step": 49715 }, { "entropy": 5.944669008255005, "epoch": 3.868391363547948, "grad_norm": 1.296875, "learning_rate": 0.00035647909706106533, "loss": 5.004, "mean_token_accuracy": 0.20713644921779634, "num_tokens": 86253362.0, "step": 49720 }, { "entropy": 5.899145078659058, "epoch": 3.8687803929196654, "grad_norm": 1.3359375, "learning_rate": 0.0003564532619714624, "loss": 4.966, "mean_token_accuracy": 0.21391140520572663, "num_tokens": 86262337.0, "step": 49725 }, { "entropy": 5.990558195114136, "epoch": 3.869169422291383, "grad_norm": 1.40625, "learning_rate": 0.0003564274256459358, "loss": 5.0884, "mean_token_accuracy": 0.2038117155432701, "num_tokens": 86271021.0, "step": 49730 }, { "entropy": 5.8866363048553465, "epoch": 3.8695584516631003, "grad_norm": 1.3515625, "learning_rate": 0.0003564015880848777, "loss": 4.9432, "mean_token_accuracy": 0.21734942197799684, "num_tokens": 86279561.0, "step": 49735 }, { "entropy": 5.836661338806152, "epoch": 3.869947481034818, "grad_norm": 1.265625, "learning_rate": 0.00035637574928867996, "loss": 4.8956, "mean_token_accuracy": 0.21963123828172684, "num_tokens": 86289358.0, "step": 49740 }, { "entropy": 5.905851221084594, "epoch": 3.8703365104065357, "grad_norm": 1.46875, "learning_rate": 0.00035634990925773475, "loss": 4.9846, "mean_token_accuracy": 0.21490618288517, "num_tokens": 86297758.0, "step": 49745 }, { "entropy": 5.845110511779785, "epoch": 3.8707255397782534, "grad_norm": 1.40625, "learning_rate": 0.0003563240679924342, "loss": 4.9205, "mean_token_accuracy": 0.21522506028413774, "num_tokens": 86306214.0, "step": 49750 }, { "entropy": 5.9187065124511715, "epoch": 3.871114569149971, "grad_norm": 1.46875, "learning_rate": 0.0003562982254931704, "loss": 5.0192, "mean_token_accuracy": 0.21234747171401977, "num_tokens": 86314249.0, "step": 49755 }, { "entropy": 5.915904760360718, "epoch": 3.8715035985216883, "grad_norm": 1.375, "learning_rate": 0.0003562723817603354, "loss": 5.0004, "mean_token_accuracy": 0.21233959943056108, "num_tokens": 86322516.0, "step": 49760 }, { "entropy": 6.021694707870483, "epoch": 3.871892627893406, "grad_norm": 1.3359375, "learning_rate": 0.00035624653679432135, "loss": 5.1096, "mean_token_accuracy": 0.20661191046237945, "num_tokens": 86331637.0, "step": 49765 }, { "entropy": 5.933902549743652, "epoch": 3.8722816572651233, "grad_norm": 1.390625, "learning_rate": 0.00035622069059552036, "loss": 5.0023, "mean_token_accuracy": 0.20758727043867112, "num_tokens": 86340147.0, "step": 49770 }, { "entropy": 5.892926979064941, "epoch": 3.872670686636841, "grad_norm": 1.3671875, "learning_rate": 0.0003561948431643247, "loss": 4.9737, "mean_token_accuracy": 0.21016692817211152, "num_tokens": 86348599.0, "step": 49775 }, { "entropy": 5.897628927230835, "epoch": 3.8730597160085587, "grad_norm": 1.4453125, "learning_rate": 0.00035616899450112655, "loss": 5.0188, "mean_token_accuracy": 0.21717392206192015, "num_tokens": 86357409.0, "step": 49780 }, { "entropy": 5.884993076324463, "epoch": 3.8734487453802764, "grad_norm": 1.3203125, "learning_rate": 0.00035614314460631814, "loss": 4.9217, "mean_token_accuracy": 0.21625805050134658, "num_tokens": 86365826.0, "step": 49785 }, { "entropy": 5.89710431098938, "epoch": 3.8738377747519936, "grad_norm": 1.4453125, "learning_rate": 0.0003561172934802917, "loss": 5.0253, "mean_token_accuracy": 0.21099531799554824, "num_tokens": 86373784.0, "step": 49790 }, { "entropy": 5.871261119842529, "epoch": 3.8742268041237113, "grad_norm": 1.328125, "learning_rate": 0.0003560914411234393, "loss": 4.9663, "mean_token_accuracy": 0.21572889983654023, "num_tokens": 86382761.0, "step": 49795 }, { "entropy": 5.920084667205811, "epoch": 3.874615833495429, "grad_norm": 1.3125, "learning_rate": 0.0003560655875361535, "loss": 4.9804, "mean_token_accuracy": 0.20598232746124268, "num_tokens": 86391025.0, "step": 49800 }, { "entropy": 5.87377552986145, "epoch": 3.8750048628671463, "grad_norm": 1.28125, "learning_rate": 0.0003560397327188263, "loss": 5.0142, "mean_token_accuracy": 0.20639852583408355, "num_tokens": 86399802.0, "step": 49805 }, { "entropy": 5.827319955825805, "epoch": 3.875393892238864, "grad_norm": 1.4296875, "learning_rate": 0.0003560138766718502, "loss": 4.8484, "mean_token_accuracy": 0.22213265895843506, "num_tokens": 86407942.0, "step": 49810 }, { "entropy": 5.837137508392334, "epoch": 3.8757829216105817, "grad_norm": 1.359375, "learning_rate": 0.00035598801939561755, "loss": 4.9391, "mean_token_accuracy": 0.21369633376598357, "num_tokens": 86416399.0, "step": 49815 }, { "entropy": 5.87867579460144, "epoch": 3.8761719509822994, "grad_norm": 1.390625, "learning_rate": 0.00035596216089052045, "loss": 4.9506, "mean_token_accuracy": 0.2113206535577774, "num_tokens": 86424325.0, "step": 49820 }, { "entropy": 5.900385951995849, "epoch": 3.8765609803540166, "grad_norm": 1.328125, "learning_rate": 0.00035593630115695154, "loss": 5.008, "mean_token_accuracy": 0.21024041175842284, "num_tokens": 86433023.0, "step": 49825 }, { "entropy": 5.853997087478637, "epoch": 3.8769500097257343, "grad_norm": 1.34375, "learning_rate": 0.0003559104401953031, "loss": 4.9341, "mean_token_accuracy": 0.22106249183416365, "num_tokens": 86442156.0, "step": 49830 }, { "entropy": 5.920306062698364, "epoch": 3.8773390390974516, "grad_norm": 1.40625, "learning_rate": 0.00035588457800596747, "loss": 4.9453, "mean_token_accuracy": 0.21778531670570372, "num_tokens": 86450884.0, "step": 49835 }, { "entropy": 5.894975709915161, "epoch": 3.8777280684691693, "grad_norm": 1.3203125, "learning_rate": 0.0003558587145893371, "loss": 5.0816, "mean_token_accuracy": 0.20594456642866135, "num_tokens": 86460509.0, "step": 49840 }, { "entropy": 5.957233333587647, "epoch": 3.878117097840887, "grad_norm": 1.296875, "learning_rate": 0.0003558328499458044, "loss": 5.1085, "mean_token_accuracy": 0.20111797451972963, "num_tokens": 86468547.0, "step": 49845 }, { "entropy": 5.93181004524231, "epoch": 3.8785061272126047, "grad_norm": 1.2421875, "learning_rate": 0.0003558069840757619, "loss": 5.0106, "mean_token_accuracy": 0.20987920463085175, "num_tokens": 86477208.0, "step": 49850 }, { "entropy": 5.913388586044311, "epoch": 3.8788951565843224, "grad_norm": 1.4296875, "learning_rate": 0.000355781116979602, "loss": 5.024, "mean_token_accuracy": 0.2138962045311928, "num_tokens": 86485825.0, "step": 49855 }, { "entropy": 5.910169982910157, "epoch": 3.8792841859560396, "grad_norm": 1.484375, "learning_rate": 0.0003557552486577173, "loss": 5.031, "mean_token_accuracy": 0.21134063899517058, "num_tokens": 86493364.0, "step": 49860 }, { "entropy": 5.915397310256958, "epoch": 3.8796732153277573, "grad_norm": 1.265625, "learning_rate": 0.0003557293791105002, "loss": 4.982, "mean_token_accuracy": 0.21194352060556412, "num_tokens": 86502641.0, "step": 49865 }, { "entropy": 5.868005180358887, "epoch": 3.8800622446994746, "grad_norm": 1.2578125, "learning_rate": 0.00035570350833834334, "loss": 4.9342, "mean_token_accuracy": 0.2168838545680046, "num_tokens": 86511523.0, "step": 49870 }, { "entropy": 5.907673978805542, "epoch": 3.8804512740711923, "grad_norm": 1.453125, "learning_rate": 0.00035567763634163904, "loss": 4.9766, "mean_token_accuracy": 0.21375919580459596, "num_tokens": 86519782.0, "step": 49875 }, { "entropy": 5.930201768875122, "epoch": 3.88084030344291, "grad_norm": 1.390625, "learning_rate": 0.0003556517631207802, "loss": 5.0145, "mean_token_accuracy": 0.21050166785717012, "num_tokens": 86529102.0, "step": 49880 }, { "entropy": 5.949878692626953, "epoch": 3.8812293328146277, "grad_norm": 1.3515625, "learning_rate": 0.00035562588867615907, "loss": 5.0029, "mean_token_accuracy": 0.20914242863655091, "num_tokens": 86538145.0, "step": 49885 }, { "entropy": 5.90383882522583, "epoch": 3.881618362186345, "grad_norm": 1.5390625, "learning_rate": 0.00035560001300816846, "loss": 5.0438, "mean_token_accuracy": 0.2104927822947502, "num_tokens": 86547268.0, "step": 49890 }, { "entropy": 5.929309368133545, "epoch": 3.8820073915580626, "grad_norm": 1.3671875, "learning_rate": 0.00035557413611720095, "loss": 4.9855, "mean_token_accuracy": 0.21054494231939316, "num_tokens": 86555676.0, "step": 49895 }, { "entropy": 5.919291353225708, "epoch": 3.8823964209297803, "grad_norm": 1.4609375, "learning_rate": 0.00035554825800364917, "loss": 4.9999, "mean_token_accuracy": 0.2058631807565689, "num_tokens": 86564056.0, "step": 49900 }, { "entropy": 5.942048501968384, "epoch": 3.8827854503014976, "grad_norm": 1.4375, "learning_rate": 0.0003555223786679058, "loss": 5.0042, "mean_token_accuracy": 0.20885255187749863, "num_tokens": 86571909.0, "step": 49905 }, { "entropy": 5.930173730850219, "epoch": 3.8831744796732153, "grad_norm": 1.3984375, "learning_rate": 0.00035549649811036346, "loss": 5.098, "mean_token_accuracy": 0.20814307779073715, "num_tokens": 86580772.0, "step": 49910 }, { "entropy": 5.912869691848755, "epoch": 3.883563509044933, "grad_norm": 1.390625, "learning_rate": 0.00035547061633141487, "loss": 5.0805, "mean_token_accuracy": 0.2074701428413391, "num_tokens": 86590018.0, "step": 49915 }, { "entropy": 6.0084434986114506, "epoch": 3.8839525384166507, "grad_norm": 1.4140625, "learning_rate": 0.00035544473333145275, "loss": 5.0725, "mean_token_accuracy": 0.21657355278730392, "num_tokens": 86597702.0, "step": 49920 }, { "entropy": 5.910910606384277, "epoch": 3.884341567788368, "grad_norm": 1.3359375, "learning_rate": 0.0003554188491108699, "loss": 4.9432, "mean_token_accuracy": 0.21158004105091094, "num_tokens": 86605780.0, "step": 49925 }, { "entropy": 5.915832281112671, "epoch": 3.8847305971600856, "grad_norm": 1.375, "learning_rate": 0.000355392963670059, "loss": 4.9362, "mean_token_accuracy": 0.21747543811798095, "num_tokens": 86614449.0, "step": 49930 }, { "entropy": 5.981594133377075, "epoch": 3.8851196265318033, "grad_norm": 1.375, "learning_rate": 0.0003553670770094129, "loss": 5.0483, "mean_token_accuracy": 0.20831324011087418, "num_tokens": 86622715.0, "step": 49935 }, { "entropy": 5.870710563659668, "epoch": 3.8855086559035206, "grad_norm": 1.3828125, "learning_rate": 0.00035534118912932425, "loss": 4.9487, "mean_token_accuracy": 0.21014446765184402, "num_tokens": 86631007.0, "step": 49940 }, { "entropy": 5.8792259216308596, "epoch": 3.8858976852752383, "grad_norm": 1.3515625, "learning_rate": 0.00035531530003018584, "loss": 4.9097, "mean_token_accuracy": 0.21683760732412338, "num_tokens": 86639079.0, "step": 49945 }, { "entropy": 5.941952896118164, "epoch": 3.886286714646956, "grad_norm": 1.3515625, "learning_rate": 0.0003552894097123907, "loss": 5.0238, "mean_token_accuracy": 0.2089035302400589, "num_tokens": 86647793.0, "step": 49950 }, { "entropy": 5.890746021270752, "epoch": 3.8866757440186737, "grad_norm": 1.3359375, "learning_rate": 0.00035526351817633157, "loss": 4.955, "mean_token_accuracy": 0.21389715373516083, "num_tokens": 86656321.0, "step": 49955 }, { "entropy": 5.843081855773926, "epoch": 3.887064773390391, "grad_norm": 1.2890625, "learning_rate": 0.0003552376254224013, "loss": 4.9344, "mean_token_accuracy": 0.21543222814798355, "num_tokens": 86665295.0, "step": 49960 }, { "entropy": 5.859136486053467, "epoch": 3.8874538027621086, "grad_norm": 1.390625, "learning_rate": 0.0003552117314509928, "loss": 4.8955, "mean_token_accuracy": 0.21749415546655654, "num_tokens": 86674229.0, "step": 49965 }, { "entropy": 5.936794567108154, "epoch": 3.887842832133826, "grad_norm": 1.40625, "learning_rate": 0.0003551858362624989, "loss": 5.0569, "mean_token_accuracy": 0.20553871244192123, "num_tokens": 86682362.0, "step": 49970 }, { "entropy": 5.939830923080445, "epoch": 3.8882318615055436, "grad_norm": 1.390625, "learning_rate": 0.0003551599398573125, "loss": 5.0401, "mean_token_accuracy": 0.20618510097265244, "num_tokens": 86690670.0, "step": 49975 }, { "entropy": 5.871878242492675, "epoch": 3.8886208908772613, "grad_norm": 1.375, "learning_rate": 0.00035513404223582666, "loss": 4.9364, "mean_token_accuracy": 0.2122965008020401, "num_tokens": 86698861.0, "step": 49980 }, { "entropy": 5.866643476486206, "epoch": 3.889009920248979, "grad_norm": 1.328125, "learning_rate": 0.00035510814339843427, "loss": 4.9162, "mean_token_accuracy": 0.21246618628501893, "num_tokens": 86706866.0, "step": 49985 }, { "entropy": 5.9182273864746096, "epoch": 3.889398949620696, "grad_norm": 1.46875, "learning_rate": 0.00035508224334552835, "loss": 5.0231, "mean_token_accuracy": 0.21047684997320176, "num_tokens": 86715313.0, "step": 49990 }, { "entropy": 5.80032868385315, "epoch": 3.889787978992414, "grad_norm": 1.4375, "learning_rate": 0.0003550563420775018, "loss": 4.8842, "mean_token_accuracy": 0.21967146545648575, "num_tokens": 86724926.0, "step": 49995 }, { "entropy": 5.87828950881958, "epoch": 3.8901770083641316, "grad_norm": 1.3359375, "learning_rate": 0.00035503043959474775, "loss": 4.826, "mean_token_accuracy": 0.2227575346827507, "num_tokens": 86732645.0, "step": 50000 }, { "entropy": 5.862406301498413, "epoch": 3.890566037735849, "grad_norm": 1.3984375, "learning_rate": 0.00035500453589765906, "loss": 4.948, "mean_token_accuracy": 0.21635289043188094, "num_tokens": 86741351.0, "step": 50005 }, { "entropy": 5.903558826446533, "epoch": 3.8909550671075666, "grad_norm": 1.375, "learning_rate": 0.00035497863098662893, "loss": 4.9487, "mean_token_accuracy": 0.21577460318803787, "num_tokens": 86749220.0, "step": 50010 }, { "entropy": 5.893824863433838, "epoch": 3.8913440964792843, "grad_norm": 1.3125, "learning_rate": 0.00035495272486205033, "loss": 4.9711, "mean_token_accuracy": 0.21402205228805543, "num_tokens": 86757006.0, "step": 50015 }, { "entropy": 5.923338842391968, "epoch": 3.891733125851002, "grad_norm": 1.4609375, "learning_rate": 0.0003549268175243165, "loss": 5.0237, "mean_token_accuracy": 0.2077975243330002, "num_tokens": 86765447.0, "step": 50020 }, { "entropy": 5.792822551727295, "epoch": 3.892122155222719, "grad_norm": 1.515625, "learning_rate": 0.0003549009089738204, "loss": 4.8894, "mean_token_accuracy": 0.22218640744686127, "num_tokens": 86774546.0, "step": 50025 }, { "entropy": 5.855463600158691, "epoch": 3.892511184594437, "grad_norm": 1.3828125, "learning_rate": 0.0003548749992109551, "loss": 4.9766, "mean_token_accuracy": 0.2131939098238945, "num_tokens": 86784155.0, "step": 50030 }, { "entropy": 5.912651252746582, "epoch": 3.8929002139661546, "grad_norm": 1.3671875, "learning_rate": 0.0003548490882361139, "loss": 4.9823, "mean_token_accuracy": 0.21194558143615722, "num_tokens": 86792463.0, "step": 50035 }, { "entropy": 5.977617883682251, "epoch": 3.893289243337872, "grad_norm": 1.1796875, "learning_rate": 0.0003548231760496898, "loss": 5.0805, "mean_token_accuracy": 0.20782548934221268, "num_tokens": 86801880.0, "step": 50040 }, { "entropy": 5.880118322372437, "epoch": 3.8936782727095895, "grad_norm": 1.390625, "learning_rate": 0.00035479726265207604, "loss": 4.9117, "mean_token_accuracy": 0.21418636441230773, "num_tokens": 86810813.0, "step": 50045 }, { "entropy": 5.897434091567993, "epoch": 3.8940673020813072, "grad_norm": 1.46875, "learning_rate": 0.0003547713480436659, "loss": 5.0263, "mean_token_accuracy": 0.20230769366025925, "num_tokens": 86819373.0, "step": 50050 }, { "entropy": 5.840103578567505, "epoch": 3.894456331453025, "grad_norm": 1.484375, "learning_rate": 0.00035474543222485254, "loss": 4.9286, "mean_token_accuracy": 0.2125045746564865, "num_tokens": 86827369.0, "step": 50055 }, { "entropy": 5.887427091598511, "epoch": 3.894845360824742, "grad_norm": 1.3515625, "learning_rate": 0.00035471951519602926, "loss": 5.0545, "mean_token_accuracy": 0.2062416896224022, "num_tokens": 86836119.0, "step": 50060 }, { "entropy": 5.957984352111817, "epoch": 3.89523439019646, "grad_norm": 1.4453125, "learning_rate": 0.00035469359695758905, "loss": 5.1126, "mean_token_accuracy": 0.20347007364034653, "num_tokens": 86844976.0, "step": 50065 }, { "entropy": 5.980688619613647, "epoch": 3.895623419568177, "grad_norm": 1.484375, "learning_rate": 0.0003546676775099254, "loss": 5.0215, "mean_token_accuracy": 0.21019212901592255, "num_tokens": 86853245.0, "step": 50070 }, { "entropy": 5.888351392745972, "epoch": 3.896012448939895, "grad_norm": 1.265625, "learning_rate": 0.0003546417568534315, "loss": 4.9584, "mean_token_accuracy": 0.215139140188694, "num_tokens": 86862682.0, "step": 50075 }, { "entropy": 5.931468296051025, "epoch": 3.8964014783116125, "grad_norm": 1.328125, "learning_rate": 0.00035461583498850083, "loss": 5.0673, "mean_token_accuracy": 0.2063592791557312, "num_tokens": 86871900.0, "step": 50080 }, { "entropy": 5.915826606750488, "epoch": 3.8967905076833302, "grad_norm": 1.4140625, "learning_rate": 0.0003545899119155265, "loss": 5.0396, "mean_token_accuracy": 0.21245780140161513, "num_tokens": 86880417.0, "step": 50085 }, { "entropy": 5.860255146026612, "epoch": 3.8971795370550475, "grad_norm": 1.34375, "learning_rate": 0.00035456398763490193, "loss": 4.9235, "mean_token_accuracy": 0.21974065601825715, "num_tokens": 86888489.0, "step": 50090 }, { "entropy": 5.910390424728393, "epoch": 3.897568566426765, "grad_norm": 1.4140625, "learning_rate": 0.0003545380621470205, "loss": 5.025, "mean_token_accuracy": 0.21794474720954896, "num_tokens": 86897189.0, "step": 50095 }, { "entropy": 5.9353594303131105, "epoch": 3.897957595798483, "grad_norm": 1.3125, "learning_rate": 0.0003545121354522756, "loss": 5.0529, "mean_token_accuracy": 0.21174402087926864, "num_tokens": 86906174.0, "step": 50100 }, { "entropy": 5.845537614822388, "epoch": 3.8983466251702, "grad_norm": 1.421875, "learning_rate": 0.00035448620755106064, "loss": 4.9298, "mean_token_accuracy": 0.21674865782260894, "num_tokens": 86915002.0, "step": 50105 }, { "entropy": 5.9149223327636715, "epoch": 3.898735654541918, "grad_norm": 1.484375, "learning_rate": 0.0003544602784437689, "loss": 5.0054, "mean_token_accuracy": 0.2094147324562073, "num_tokens": 86923611.0, "step": 50110 }, { "entropy": 5.908443975448608, "epoch": 3.8991246839136355, "grad_norm": 1.2734375, "learning_rate": 0.00035443434813079393, "loss": 4.9721, "mean_token_accuracy": 0.20889769047498702, "num_tokens": 86932717.0, "step": 50115 }, { "entropy": 5.916933965682984, "epoch": 3.8995137132853532, "grad_norm": 1.375, "learning_rate": 0.0003544084166125292, "loss": 5.0468, "mean_token_accuracy": 0.20657638609409332, "num_tokens": 86941522.0, "step": 50120 }, { "entropy": 5.87265419960022, "epoch": 3.8999027426570705, "grad_norm": 1.3515625, "learning_rate": 0.0003543824838893682, "loss": 4.9821, "mean_token_accuracy": 0.20651367902755738, "num_tokens": 86950593.0, "step": 50125 }, { "entropy": 5.949397897720337, "epoch": 3.900291772028788, "grad_norm": 1.359375, "learning_rate": 0.00035435654996170417, "loss": 5.0163, "mean_token_accuracy": 0.20709467083215713, "num_tokens": 86959110.0, "step": 50130 }, { "entropy": 5.9439630031585695, "epoch": 3.900680801400506, "grad_norm": 1.3515625, "learning_rate": 0.000354330614829931, "loss": 5.0968, "mean_token_accuracy": 0.20207741260528564, "num_tokens": 86968631.0, "step": 50135 }, { "entropy": 5.92245569229126, "epoch": 3.901069830772223, "grad_norm": 1.2578125, "learning_rate": 0.0003543046784944419, "loss": 4.9672, "mean_token_accuracy": 0.21018511354923247, "num_tokens": 86977377.0, "step": 50140 }, { "entropy": 6.05735330581665, "epoch": 3.901458860143941, "grad_norm": 1.5859375, "learning_rate": 0.00035427874095563054, "loss": 5.1534, "mean_token_accuracy": 0.20767497420310974, "num_tokens": 86985931.0, "step": 50145 }, { "entropy": 5.882279348373413, "epoch": 3.9018478895156585, "grad_norm": 1.2890625, "learning_rate": 0.0003542528022138905, "loss": 4.9264, "mean_token_accuracy": 0.21683316081762313, "num_tokens": 86994038.0, "step": 50150 }, { "entropy": 5.805412435531617, "epoch": 3.9022369188873762, "grad_norm": 1.3359375, "learning_rate": 0.0003542268622696153, "loss": 4.935, "mean_token_accuracy": 0.22011127918958664, "num_tokens": 87003740.0, "step": 50155 }, { "entropy": 5.886851501464844, "epoch": 3.9026259482590935, "grad_norm": 1.3671875, "learning_rate": 0.0003542009211231986, "loss": 4.8846, "mean_token_accuracy": 0.21532836705446243, "num_tokens": 87012120.0, "step": 50160 }, { "entropy": 5.910329675674438, "epoch": 3.903014977630811, "grad_norm": 1.4609375, "learning_rate": 0.00035417497877503396, "loss": 4.9681, "mean_token_accuracy": 0.21857584714889527, "num_tokens": 87020292.0, "step": 50165 }, { "entropy": 5.914029788970947, "epoch": 3.9034040070025284, "grad_norm": 1.296875, "learning_rate": 0.00035414903522551505, "loss": 4.9858, "mean_token_accuracy": 0.21186985820531845, "num_tokens": 87028524.0, "step": 50170 }, { "entropy": 5.866074943542481, "epoch": 3.903793036374246, "grad_norm": 1.3828125, "learning_rate": 0.00035412309047503553, "loss": 4.9668, "mean_token_accuracy": 0.2085736021399498, "num_tokens": 87037772.0, "step": 50175 }, { "entropy": 5.933314990997315, "epoch": 3.904182065745964, "grad_norm": 1.2890625, "learning_rate": 0.000354097144523989, "loss": 4.922, "mean_token_accuracy": 0.21190500557422637, "num_tokens": 87046333.0, "step": 50180 }, { "entropy": 5.864216041564942, "epoch": 3.9045710951176815, "grad_norm": 1.3359375, "learning_rate": 0.0003540711973727693, "loss": 4.8621, "mean_token_accuracy": 0.21888171881437302, "num_tokens": 87055507.0, "step": 50185 }, { "entropy": 5.9024125099182125, "epoch": 3.904960124489399, "grad_norm": 1.4375, "learning_rate": 0.0003540452490217699, "loss": 4.9547, "mean_token_accuracy": 0.21199716478586197, "num_tokens": 87063817.0, "step": 50190 }, { "entropy": 5.857805633544922, "epoch": 3.9053491538611165, "grad_norm": 1.3828125, "learning_rate": 0.0003540192994713847, "loss": 4.9195, "mean_token_accuracy": 0.21837370991706848, "num_tokens": 87072404.0, "step": 50195 }, { "entropy": 5.876820659637451, "epoch": 3.905738183232834, "grad_norm": 1.421875, "learning_rate": 0.00035399334872200747, "loss": 4.8968, "mean_token_accuracy": 0.21984235495328902, "num_tokens": 87081074.0, "step": 50200 }, { "entropy": 5.870394945144653, "epoch": 3.9061272126045514, "grad_norm": 1.3125, "learning_rate": 0.0003539673967740318, "loss": 4.9637, "mean_token_accuracy": 0.20919657200574876, "num_tokens": 87089651.0, "step": 50205 }, { "entropy": 5.845789861679077, "epoch": 3.906516241976269, "grad_norm": 1.4375, "learning_rate": 0.0003539414436278516, "loss": 4.9141, "mean_token_accuracy": 0.21383048295974733, "num_tokens": 87098255.0, "step": 50210 }, { "entropy": 5.831580448150635, "epoch": 3.906905271347987, "grad_norm": 1.40625, "learning_rate": 0.00035391548928386077, "loss": 4.8955, "mean_token_accuracy": 0.21181600987911225, "num_tokens": 87107880.0, "step": 50215 }, { "entropy": 5.921594285964966, "epoch": 3.9072943007197045, "grad_norm": 1.3359375, "learning_rate": 0.0003538895337424529, "loss": 4.9918, "mean_token_accuracy": 0.21468723118305205, "num_tokens": 87116276.0, "step": 50220 }, { "entropy": 5.90599513053894, "epoch": 3.9076833300914218, "grad_norm": 1.4453125, "learning_rate": 0.00035386357700402187, "loss": 4.9505, "mean_token_accuracy": 0.21896442472934724, "num_tokens": 87124682.0, "step": 50225 }, { "entropy": 5.851755809783936, "epoch": 3.9080723594631395, "grad_norm": 1.4375, "learning_rate": 0.0003538376190689616, "loss": 4.8404, "mean_token_accuracy": 0.22835186272859573, "num_tokens": 87133428.0, "step": 50230 }, { "entropy": 5.8333264827728275, "epoch": 3.908461388834857, "grad_norm": 1.4609375, "learning_rate": 0.0003538116599376661, "loss": 4.9487, "mean_token_accuracy": 0.21107601821422578, "num_tokens": 87142471.0, "step": 50235 }, { "entropy": 5.806998157501221, "epoch": 3.9088504182065744, "grad_norm": 1.359375, "learning_rate": 0.00035378569961052887, "loss": 4.8379, "mean_token_accuracy": 0.2224346086382866, "num_tokens": 87151813.0, "step": 50240 }, { "entropy": 5.877148580551148, "epoch": 3.909239447578292, "grad_norm": 1.3515625, "learning_rate": 0.00035375973808794416, "loss": 4.9892, "mean_token_accuracy": 0.21060765385627747, "num_tokens": 87160438.0, "step": 50245 }, { "entropy": 5.827613401412964, "epoch": 3.90962847695001, "grad_norm": 1.46875, "learning_rate": 0.0003537337753703058, "loss": 4.9332, "mean_token_accuracy": 0.21244496256113052, "num_tokens": 87168937.0, "step": 50250 }, { "entropy": 5.93652720451355, "epoch": 3.9100175063217275, "grad_norm": 1.3984375, "learning_rate": 0.0003537078114580077, "loss": 4.924, "mean_token_accuracy": 0.21513839513063432, "num_tokens": 87176511.0, "step": 50255 }, { "entropy": 5.901549863815307, "epoch": 3.9104065356934448, "grad_norm": 1.34375, "learning_rate": 0.0003536818463514438, "loss": 4.9362, "mean_token_accuracy": 0.21373755484819412, "num_tokens": 87185250.0, "step": 50260 }, { "entropy": 5.881203317642212, "epoch": 3.9107955650651625, "grad_norm": 1.2734375, "learning_rate": 0.00035365588005100817, "loss": 5.0533, "mean_token_accuracy": 0.20628661215305327, "num_tokens": 87193621.0, "step": 50265 }, { "entropy": 5.934397745132446, "epoch": 3.9111845944368797, "grad_norm": 1.46875, "learning_rate": 0.0003536299125570947, "loss": 5.1154, "mean_token_accuracy": 0.1933930665254593, "num_tokens": 87202307.0, "step": 50270 }, { "entropy": 5.928903293609619, "epoch": 3.9115736238085974, "grad_norm": 1.375, "learning_rate": 0.0003536039438700975, "loss": 4.9765, "mean_token_accuracy": 0.2120120570063591, "num_tokens": 87210504.0, "step": 50275 }, { "entropy": 5.9600667476654055, "epoch": 3.911962653180315, "grad_norm": 1.4375, "learning_rate": 0.00035357797399041056, "loss": 5.0334, "mean_token_accuracy": 0.2073104739189148, "num_tokens": 87219541.0, "step": 50280 }, { "entropy": 5.917445373535156, "epoch": 3.912351682552033, "grad_norm": 1.3671875, "learning_rate": 0.0003535520029184279, "loss": 4.9946, "mean_token_accuracy": 0.21059515774250032, "num_tokens": 87227996.0, "step": 50285 }, { "entropy": 5.867440605163575, "epoch": 3.9127407119237505, "grad_norm": 1.5703125, "learning_rate": 0.0003535260306545437, "loss": 4.9545, "mean_token_accuracy": 0.21784480214118956, "num_tokens": 87235840.0, "step": 50290 }, { "entropy": 5.904961252212525, "epoch": 3.9131297412954678, "grad_norm": 1.421875, "learning_rate": 0.00035350005719915196, "loss": 4.9991, "mean_token_accuracy": 0.209321291744709, "num_tokens": 87243942.0, "step": 50295 }, { "entropy": 5.884698963165283, "epoch": 3.9135187706671855, "grad_norm": 1.2265625, "learning_rate": 0.00035347408255264674, "loss": 4.9583, "mean_token_accuracy": 0.21425328254699708, "num_tokens": 87252435.0, "step": 50300 }, { "entropy": 5.90400242805481, "epoch": 3.9139078000389027, "grad_norm": 1.4921875, "learning_rate": 0.0003534481067154223, "loss": 5.0005, "mean_token_accuracy": 0.20740165561437607, "num_tokens": 87261251.0, "step": 50305 }, { "entropy": 5.958360767364502, "epoch": 3.9142968294106204, "grad_norm": 1.421875, "learning_rate": 0.0003534221296878726, "loss": 5.0401, "mean_token_accuracy": 0.20490928292274474, "num_tokens": 87269320.0, "step": 50310 }, { "entropy": 5.897350883483886, "epoch": 3.914685858782338, "grad_norm": 1.2734375, "learning_rate": 0.00035339615147039196, "loss": 4.9616, "mean_token_accuracy": 0.21413628458976747, "num_tokens": 87277934.0, "step": 50315 }, { "entropy": 5.964792156219483, "epoch": 3.915074888154056, "grad_norm": 1.359375, "learning_rate": 0.00035337017206337444, "loss": 5.0932, "mean_token_accuracy": 0.2037027359008789, "num_tokens": 87287042.0, "step": 50320 }, { "entropy": 5.8947258472442625, "epoch": 3.915463917525773, "grad_norm": 1.4921875, "learning_rate": 0.0003533441914672144, "loss": 5.0285, "mean_token_accuracy": 0.21239891946315764, "num_tokens": 87295495.0, "step": 50325 }, { "entropy": 5.909796190261841, "epoch": 3.9158529468974907, "grad_norm": 1.375, "learning_rate": 0.00035331820968230595, "loss": 4.913, "mean_token_accuracy": 0.22106371372938155, "num_tokens": 87304242.0, "step": 50330 }, { "entropy": 5.906122255325317, "epoch": 3.9162419762692084, "grad_norm": 1.25, "learning_rate": 0.00035329222670904325, "loss": 4.9728, "mean_token_accuracy": 0.20458732694387435, "num_tokens": 87313896.0, "step": 50335 }, { "entropy": 5.859498310089111, "epoch": 3.9166310056409257, "grad_norm": 1.3203125, "learning_rate": 0.0003532662425478206, "loss": 4.9336, "mean_token_accuracy": 0.22614033669233322, "num_tokens": 87322187.0, "step": 50340 }, { "entropy": 5.863008880615235, "epoch": 3.9170200350126434, "grad_norm": 1.4921875, "learning_rate": 0.00035324025719903236, "loss": 4.9385, "mean_token_accuracy": 0.21537211239337922, "num_tokens": 87331170.0, "step": 50345 }, { "entropy": 5.873621988296509, "epoch": 3.917409064384361, "grad_norm": 1.4609375, "learning_rate": 0.00035321427066307276, "loss": 4.9723, "mean_token_accuracy": 0.21462617665529252, "num_tokens": 87339673.0, "step": 50350 }, { "entropy": 5.920474815368652, "epoch": 3.917798093756079, "grad_norm": 1.46875, "learning_rate": 0.0003531882829403361, "loss": 5.0062, "mean_token_accuracy": 0.20745428949594497, "num_tokens": 87347443.0, "step": 50355 }, { "entropy": 5.872058153152466, "epoch": 3.918187123127796, "grad_norm": 1.40625, "learning_rate": 0.00035316229403121666, "loss": 4.9989, "mean_token_accuracy": 0.2058949738740921, "num_tokens": 87355554.0, "step": 50360 }, { "entropy": 5.922288703918457, "epoch": 3.9185761524995137, "grad_norm": 1.328125, "learning_rate": 0.0003531363039361088, "loss": 4.9936, "mean_token_accuracy": 0.21099065542221068, "num_tokens": 87364392.0, "step": 50365 }, { "entropy": 5.8887474060058596, "epoch": 3.9189651818712314, "grad_norm": 1.3828125, "learning_rate": 0.00035311031265540695, "loss": 4.968, "mean_token_accuracy": 0.21295930594205856, "num_tokens": 87373474.0, "step": 50370 }, { "entropy": 6.000442981719971, "epoch": 3.9193542112429487, "grad_norm": 1.3515625, "learning_rate": 0.00035308432018950537, "loss": 4.9911, "mean_token_accuracy": 0.21125533282756806, "num_tokens": 87382158.0, "step": 50375 }, { "entropy": 5.995359277725219, "epoch": 3.9197432406146664, "grad_norm": 1.3359375, "learning_rate": 0.00035305832653879856, "loss": 5.0029, "mean_token_accuracy": 0.2086159884929657, "num_tokens": 87390032.0, "step": 50380 }, { "entropy": 5.922431802749633, "epoch": 3.920132269986384, "grad_norm": 1.3515625, "learning_rate": 0.00035303233170368083, "loss": 5.0292, "mean_token_accuracy": 0.20407381951808928, "num_tokens": 87398409.0, "step": 50385 }, { "entropy": 5.893648767471314, "epoch": 3.920521299358102, "grad_norm": 1.2890625, "learning_rate": 0.00035300633568454673, "loss": 4.9123, "mean_token_accuracy": 0.21105469316244124, "num_tokens": 87407218.0, "step": 50390 }, { "entropy": 5.877258014678955, "epoch": 3.920910328729819, "grad_norm": 1.328125, "learning_rate": 0.00035298033848179064, "loss": 4.9457, "mean_token_accuracy": 0.2116571456193924, "num_tokens": 87415869.0, "step": 50395 }, { "entropy": 5.845294523239136, "epoch": 3.9212993581015367, "grad_norm": 1.3125, "learning_rate": 0.000352954340095807, "loss": 4.9678, "mean_token_accuracy": 0.21793511807918547, "num_tokens": 87424636.0, "step": 50400 }, { "entropy": 5.8885386943817135, "epoch": 3.921688387473254, "grad_norm": 1.4296875, "learning_rate": 0.00035292834052699036, "loss": 4.9847, "mean_token_accuracy": 0.20811957120895386, "num_tokens": 87432833.0, "step": 50405 }, { "entropy": 5.94917778968811, "epoch": 3.9220774168449717, "grad_norm": 1.328125, "learning_rate": 0.0003529023397757351, "loss": 5.0526, "mean_token_accuracy": 0.20956340730190276, "num_tokens": 87442002.0, "step": 50410 }, { "entropy": 5.907338953018188, "epoch": 3.9224664462166894, "grad_norm": 1.2265625, "learning_rate": 0.00035287633784243595, "loss": 4.995, "mean_token_accuracy": 0.2081120118498802, "num_tokens": 87451271.0, "step": 50415 }, { "entropy": 5.9394889831542965, "epoch": 3.922855475588407, "grad_norm": 1.328125, "learning_rate": 0.00035285033472748725, "loss": 4.9893, "mean_token_accuracy": 0.2068886861205101, "num_tokens": 87460290.0, "step": 50420 }, { "entropy": 5.910650444030762, "epoch": 3.9232445049601243, "grad_norm": 1.40625, "learning_rate": 0.0003528243304312837, "loss": 4.961, "mean_token_accuracy": 0.21754674315452577, "num_tokens": 87469131.0, "step": 50425 }, { "entropy": 5.891176176071167, "epoch": 3.923633534331842, "grad_norm": 1.4453125, "learning_rate": 0.0003527983249542197, "loss": 4.9333, "mean_token_accuracy": 0.21013073176145552, "num_tokens": 87477445.0, "step": 50430 }, { "entropy": 5.9382692813873295, "epoch": 3.9240225637035597, "grad_norm": 1.3203125, "learning_rate": 0.00035277231829669006, "loss": 5.0659, "mean_token_accuracy": 0.20761577039957047, "num_tokens": 87486080.0, "step": 50435 }, { "entropy": 5.944386529922485, "epoch": 3.924411593075277, "grad_norm": 1.3125, "learning_rate": 0.0003527463104590892, "loss": 5.0188, "mean_token_accuracy": 0.20501877516508102, "num_tokens": 87494669.0, "step": 50440 }, { "entropy": 5.931106424331665, "epoch": 3.9248006224469947, "grad_norm": 1.3046875, "learning_rate": 0.0003527203014418119, "loss": 5.0337, "mean_token_accuracy": 0.20832479596138, "num_tokens": 87503497.0, "step": 50445 }, { "entropy": 5.866706800460816, "epoch": 3.9251896518187124, "grad_norm": 1.5, "learning_rate": 0.0003526942912452526, "loss": 4.9905, "mean_token_accuracy": 0.2143278867006302, "num_tokens": 87512038.0, "step": 50450 }, { "entropy": 5.896438550949097, "epoch": 3.92557868119043, "grad_norm": 1.3671875, "learning_rate": 0.0003526682798698062, "loss": 5.0157, "mean_token_accuracy": 0.20606726855039598, "num_tokens": 87520176.0, "step": 50455 }, { "entropy": 5.955945777893066, "epoch": 3.9259677105621473, "grad_norm": 1.3984375, "learning_rate": 0.0003526422673158673, "loss": 5.0126, "mean_token_accuracy": 0.20951262414455413, "num_tokens": 87528961.0, "step": 50460 }, { "entropy": 5.911625576019287, "epoch": 3.926356739933865, "grad_norm": 1.2890625, "learning_rate": 0.0003526162535838305, "loss": 4.9816, "mean_token_accuracy": 0.20987471491098403, "num_tokens": 87538424.0, "step": 50465 }, { "entropy": 5.885615062713623, "epoch": 3.9267457693055827, "grad_norm": 1.3984375, "learning_rate": 0.00035259023867409065, "loss": 4.9844, "mean_token_accuracy": 0.21681899726390838, "num_tokens": 87547234.0, "step": 50470 }, { "entropy": 5.811842393875122, "epoch": 3.9271347986773, "grad_norm": 1.2890625, "learning_rate": 0.0003525642225870423, "loss": 4.8808, "mean_token_accuracy": 0.2244354635477066, "num_tokens": 87556276.0, "step": 50475 }, { "entropy": 5.953203630447388, "epoch": 3.9275238280490177, "grad_norm": 1.2734375, "learning_rate": 0.00035253820532308043, "loss": 5.0383, "mean_token_accuracy": 0.20998992025852203, "num_tokens": 87565808.0, "step": 50480 }, { "entropy": 5.883889532089233, "epoch": 3.9279128574207354, "grad_norm": 1.6015625, "learning_rate": 0.0003525121868825997, "loss": 4.8862, "mean_token_accuracy": 0.22596168220043183, "num_tokens": 87573124.0, "step": 50485 }, { "entropy": 5.874752426147461, "epoch": 3.928301886792453, "grad_norm": 1.375, "learning_rate": 0.0003524861672659949, "loss": 4.9901, "mean_token_accuracy": 0.2142250880599022, "num_tokens": 87581635.0, "step": 50490 }, { "entropy": 5.847004032135009, "epoch": 3.9286909161641703, "grad_norm": 1.421875, "learning_rate": 0.0003524601464736609, "loss": 4.9628, "mean_token_accuracy": 0.2151826500892639, "num_tokens": 87589733.0, "step": 50495 }, { "entropy": 5.81771445274353, "epoch": 3.929079945535888, "grad_norm": 1.234375, "learning_rate": 0.0003524341245059924, "loss": 4.948, "mean_token_accuracy": 0.21453103125095369, "num_tokens": 87598593.0, "step": 50500 }, { "entropy": 5.859150981903076, "epoch": 3.9294689749076053, "grad_norm": 1.375, "learning_rate": 0.0003524081013633843, "loss": 4.91, "mean_token_accuracy": 0.21639949083328247, "num_tokens": 87607418.0, "step": 50505 }, { "entropy": 5.889812994003296, "epoch": 3.929858004279323, "grad_norm": 1.3515625, "learning_rate": 0.00035238207704623147, "loss": 4.9686, "mean_token_accuracy": 0.21492732018232347, "num_tokens": 87615799.0, "step": 50510 }, { "entropy": 5.904260921478271, "epoch": 3.9302470336510407, "grad_norm": 1.40625, "learning_rate": 0.00035235605155492885, "loss": 4.9711, "mean_token_accuracy": 0.21084872931241988, "num_tokens": 87624403.0, "step": 50515 }, { "entropy": 5.890996932983398, "epoch": 3.9306360630227584, "grad_norm": 1.375, "learning_rate": 0.00035233002488987123, "loss": 5.0038, "mean_token_accuracy": 0.20418586432933808, "num_tokens": 87632963.0, "step": 50520 }, { "entropy": 5.889699459075928, "epoch": 3.9310250923944756, "grad_norm": 1.3359375, "learning_rate": 0.00035230399705145365, "loss": 4.9596, "mean_token_accuracy": 0.21526117771863937, "num_tokens": 87641441.0, "step": 50525 }, { "entropy": 5.86859359741211, "epoch": 3.9314141217661933, "grad_norm": 1.3359375, "learning_rate": 0.0003522779680400709, "loss": 5.0292, "mean_token_accuracy": 0.20645926743745804, "num_tokens": 87650383.0, "step": 50530 }, { "entropy": 5.837763023376465, "epoch": 3.931803151137911, "grad_norm": 1.25, "learning_rate": 0.00035225193785611795, "loss": 4.9419, "mean_token_accuracy": 0.2159390330314636, "num_tokens": 87658963.0, "step": 50535 }, { "entropy": 5.846101856231689, "epoch": 3.9321921805096283, "grad_norm": 1.3671875, "learning_rate": 0.0003522259064999898, "loss": 4.891, "mean_token_accuracy": 0.21844946444034577, "num_tokens": 87667459.0, "step": 50540 }, { "entropy": 5.950911617279052, "epoch": 3.932581209881346, "grad_norm": 1.2578125, "learning_rate": 0.00035219987397208137, "loss": 5.0479, "mean_token_accuracy": 0.2054503694176674, "num_tokens": 87677443.0, "step": 50545 }, { "entropy": 5.927232694625855, "epoch": 3.9329702392530637, "grad_norm": 1.4765625, "learning_rate": 0.0003521738402727878, "loss": 5.0054, "mean_token_accuracy": 0.2104513540863991, "num_tokens": 87686019.0, "step": 50550 }, { "entropy": 5.874931335449219, "epoch": 3.9333592686247814, "grad_norm": 1.3515625, "learning_rate": 0.0003521478054025041, "loss": 4.9742, "mean_token_accuracy": 0.21403136253356933, "num_tokens": 87695754.0, "step": 50555 }, { "entropy": 5.895137214660645, "epoch": 3.9337482979964986, "grad_norm": 1.28125, "learning_rate": 0.00035212176936162524, "loss": 4.9815, "mean_token_accuracy": 0.2151082471013069, "num_tokens": 87704961.0, "step": 50560 }, { "entropy": 5.80647873878479, "epoch": 3.9341373273682163, "grad_norm": 1.578125, "learning_rate": 0.0003520957321505462, "loss": 4.849, "mean_token_accuracy": 0.22096519470214843, "num_tokens": 87713378.0, "step": 50565 }, { "entropy": 5.873860263824463, "epoch": 3.934526356739934, "grad_norm": 1.1875, "learning_rate": 0.00035206969376966226, "loss": 4.9402, "mean_token_accuracy": 0.21443846821784973, "num_tokens": 87722880.0, "step": 50570 }, { "entropy": 5.880841207504273, "epoch": 3.9349153861116513, "grad_norm": 1.5, "learning_rate": 0.00035204365421936826, "loss": 4.9411, "mean_token_accuracy": 0.2129504770040512, "num_tokens": 87730794.0, "step": 50575 }, { "entropy": 6.014259576797485, "epoch": 3.935304415483369, "grad_norm": 1.5234375, "learning_rate": 0.0003520176135000594, "loss": 5.045, "mean_token_accuracy": 0.20272360295057296, "num_tokens": 87739906.0, "step": 50580 }, { "entropy": 5.906285381317138, "epoch": 3.9356934448550867, "grad_norm": 1.375, "learning_rate": 0.0003519915716121309, "loss": 4.9438, "mean_token_accuracy": 0.2147137239575386, "num_tokens": 87748656.0, "step": 50585 }, { "entropy": 5.860756206512451, "epoch": 3.9360824742268044, "grad_norm": 1.4453125, "learning_rate": 0.0003519655285559779, "loss": 4.9812, "mean_token_accuracy": 0.21556138396263122, "num_tokens": 87756672.0, "step": 50590 }, { "entropy": 5.882245397567749, "epoch": 3.9364715035985216, "grad_norm": 1.328125, "learning_rate": 0.00035193948433199547, "loss": 4.9586, "mean_token_accuracy": 0.21297724694013595, "num_tokens": 87765506.0, "step": 50595 }, { "entropy": 5.922574281692505, "epoch": 3.9368605329702393, "grad_norm": 1.40625, "learning_rate": 0.00035191343894057885, "loss": 5.0181, "mean_token_accuracy": 0.21283968389034272, "num_tokens": 87774401.0, "step": 50600 }, { "entropy": 5.950524616241455, "epoch": 3.9372495623419566, "grad_norm": 1.3359375, "learning_rate": 0.00035188739238212316, "loss": 5.0795, "mean_token_accuracy": 0.19888032972812653, "num_tokens": 87783277.0, "step": 50605 }, { "entropy": 5.895290279388428, "epoch": 3.9376385917136743, "grad_norm": 1.3671875, "learning_rate": 0.0003518613446570237, "loss": 5.0279, "mean_token_accuracy": 0.20867571234703064, "num_tokens": 87791532.0, "step": 50610 }, { "entropy": 5.8752950668334964, "epoch": 3.938027621085392, "grad_norm": 1.3671875, "learning_rate": 0.00035183529576567567, "loss": 4.9277, "mean_token_accuracy": 0.22382221966981888, "num_tokens": 87800179.0, "step": 50615 }, { "entropy": 5.882565116882324, "epoch": 3.9384166504571096, "grad_norm": 1.40625, "learning_rate": 0.0003518092457084743, "loss": 5.0289, "mean_token_accuracy": 0.20625824332237244, "num_tokens": 87808940.0, "step": 50620 }, { "entropy": 5.894248819351196, "epoch": 3.9388056798288273, "grad_norm": 1.4921875, "learning_rate": 0.0003517831944858149, "loss": 5.0463, "mean_token_accuracy": 0.21112489849328994, "num_tokens": 87817730.0, "step": 50625 }, { "entropy": 5.930561494827271, "epoch": 3.9391947092005446, "grad_norm": 1.4375, "learning_rate": 0.00035175714209809275, "loss": 4.9347, "mean_token_accuracy": 0.21212247610092164, "num_tokens": 87825836.0, "step": 50630 }, { "entropy": 5.871069669723511, "epoch": 3.9395837385722623, "grad_norm": 1.390625, "learning_rate": 0.0003517310885457032, "loss": 4.8361, "mean_token_accuracy": 0.22699456959962844, "num_tokens": 87834977.0, "step": 50635 }, { "entropy": 5.850802326202393, "epoch": 3.9399727679439795, "grad_norm": 1.3203125, "learning_rate": 0.0003517050338290414, "loss": 5.0249, "mean_token_accuracy": 0.20773414224386216, "num_tokens": 87843290.0, "step": 50640 }, { "entropy": 5.91695761680603, "epoch": 3.9403617973156972, "grad_norm": 1.3203125, "learning_rate": 0.00035167897794850285, "loss": 5.0088, "mean_token_accuracy": 0.20507010370492934, "num_tokens": 87851826.0, "step": 50645 }, { "entropy": 5.941468381881714, "epoch": 3.940750826687415, "grad_norm": 1.4921875, "learning_rate": 0.00035165292090448287, "loss": 5.037, "mean_token_accuracy": 0.20769549012184144, "num_tokens": 87860537.0, "step": 50650 }, { "entropy": 5.937904214859008, "epoch": 3.9411398560591326, "grad_norm": 1.3359375, "learning_rate": 0.00035162686269737676, "loss": 5.031, "mean_token_accuracy": 0.20416270792484284, "num_tokens": 87869006.0, "step": 50655 }, { "entropy": 5.911216688156128, "epoch": 3.94152888543085, "grad_norm": 1.390625, "learning_rate": 0.00035160080332758006, "loss": 4.9371, "mean_token_accuracy": 0.2107901766896248, "num_tokens": 87877491.0, "step": 50660 }, { "entropy": 5.899318027496338, "epoch": 3.9419179148025676, "grad_norm": 1.3828125, "learning_rate": 0.000351574742795488, "loss": 5.0018, "mean_token_accuracy": 0.21113879680633546, "num_tokens": 87885346.0, "step": 50665 }, { "entropy": 5.92356424331665, "epoch": 3.9423069441742853, "grad_norm": 1.28125, "learning_rate": 0.0003515486811014962, "loss": 5.0652, "mean_token_accuracy": 0.20590630024671555, "num_tokens": 87894469.0, "step": 50670 }, { "entropy": 5.92971248626709, "epoch": 3.9426959735460025, "grad_norm": 1.46875, "learning_rate": 0.0003515226182459999, "loss": 5.0299, "mean_token_accuracy": 0.20347026437520982, "num_tokens": 87902735.0, "step": 50675 }, { "entropy": 5.956442260742188, "epoch": 3.9430850029177202, "grad_norm": 1.390625, "learning_rate": 0.00035149655422939477, "loss": 4.966, "mean_token_accuracy": 0.21791040003299714, "num_tokens": 87911712.0, "step": 50680 }, { "entropy": 5.885373497009278, "epoch": 3.943474032289438, "grad_norm": 1.328125, "learning_rate": 0.0003514704890520761, "loss": 4.946, "mean_token_accuracy": 0.21934774518013, "num_tokens": 87920655.0, "step": 50685 }, { "entropy": 5.8598816871643065, "epoch": 3.9438630616611556, "grad_norm": 1.421875, "learning_rate": 0.0003514444227144395, "loss": 4.9519, "mean_token_accuracy": 0.21397238224744797, "num_tokens": 87929221.0, "step": 50690 }, { "entropy": 5.940036964416504, "epoch": 3.944252091032873, "grad_norm": 1.484375, "learning_rate": 0.0003514183552168804, "loss": 5.0353, "mean_token_accuracy": 0.2082590103149414, "num_tokens": 87938519.0, "step": 50695 }, { "entropy": 5.931116008758545, "epoch": 3.9446411204045906, "grad_norm": 1.359375, "learning_rate": 0.00035139228655979457, "loss": 4.9839, "mean_token_accuracy": 0.2177615061402321, "num_tokens": 87947154.0, "step": 50700 }, { "entropy": 5.885914468765259, "epoch": 3.945030149776308, "grad_norm": 1.2890625, "learning_rate": 0.00035136621674357717, "loss": 4.9609, "mean_token_accuracy": 0.21244670152664186, "num_tokens": 87956352.0, "step": 50705 }, { "entropy": 5.869151544570923, "epoch": 3.9454191791480255, "grad_norm": 1.28125, "learning_rate": 0.0003513401457686242, "loss": 4.916, "mean_token_accuracy": 0.21866313070058824, "num_tokens": 87965722.0, "step": 50710 }, { "entropy": 5.901678657531738, "epoch": 3.9458082085197432, "grad_norm": 1.3359375, "learning_rate": 0.00035131407363533083, "loss": 4.8931, "mean_token_accuracy": 0.225302854180336, "num_tokens": 87973869.0, "step": 50715 }, { "entropy": 5.793305921554565, "epoch": 3.946197237891461, "grad_norm": 1.375, "learning_rate": 0.0003512880003440929, "loss": 4.9349, "mean_token_accuracy": 0.2137158051133156, "num_tokens": 87982440.0, "step": 50720 }, { "entropy": 5.886638069152832, "epoch": 3.9465862672631786, "grad_norm": 1.3515625, "learning_rate": 0.0003512619258953061, "loss": 4.9727, "mean_token_accuracy": 0.2115711897611618, "num_tokens": 87990965.0, "step": 50725 }, { "entropy": 5.865990495681762, "epoch": 3.946975296634896, "grad_norm": 1.3984375, "learning_rate": 0.0003512358502893658, "loss": 4.9254, "mean_token_accuracy": 0.21386488229036332, "num_tokens": 87998884.0, "step": 50730 }, { "entropy": 5.856468915939331, "epoch": 3.9473643260066136, "grad_norm": 1.328125, "learning_rate": 0.000351209773526668, "loss": 4.9158, "mean_token_accuracy": 0.2082754999399185, "num_tokens": 88007404.0, "step": 50735 }, { "entropy": 5.799933910369873, "epoch": 3.947753355378331, "grad_norm": 1.3359375, "learning_rate": 0.000351183695607608, "loss": 4.8999, "mean_token_accuracy": 0.21204039752483367, "num_tokens": 88015559.0, "step": 50740 }, { "entropy": 5.919894170761109, "epoch": 3.9481423847500485, "grad_norm": 1.3984375, "learning_rate": 0.00035115761653258177, "loss": 4.9987, "mean_token_accuracy": 0.21437261253595352, "num_tokens": 88024374.0, "step": 50745 }, { "entropy": 5.886981344223022, "epoch": 3.9485314141217662, "grad_norm": 1.359375, "learning_rate": 0.00035113153630198494, "loss": 4.9792, "mean_token_accuracy": 0.21586696803569794, "num_tokens": 88032372.0, "step": 50750 }, { "entropy": 5.862481117248535, "epoch": 3.948920443493484, "grad_norm": 1.328125, "learning_rate": 0.0003511054549162132, "loss": 4.9599, "mean_token_accuracy": 0.2198229879140854, "num_tokens": 88040859.0, "step": 50755 }, { "entropy": 5.911664009094238, "epoch": 3.949309472865201, "grad_norm": 1.2890625, "learning_rate": 0.00035107937237566233, "loss": 4.9834, "mean_token_accuracy": 0.20788655430078506, "num_tokens": 88049894.0, "step": 50760 }, { "entropy": 5.871280860900879, "epoch": 3.949698502236919, "grad_norm": 1.390625, "learning_rate": 0.0003510532886807281, "loss": 4.8839, "mean_token_accuracy": 0.21917642652988434, "num_tokens": 88057692.0, "step": 50765 }, { "entropy": 5.814662742614746, "epoch": 3.9500875316086366, "grad_norm": 1.25, "learning_rate": 0.0003510272038318062, "loss": 4.9349, "mean_token_accuracy": 0.21631101965904237, "num_tokens": 88066482.0, "step": 50770 }, { "entropy": 5.829773616790772, "epoch": 3.950476560980354, "grad_norm": 1.484375, "learning_rate": 0.0003510011178292925, "loss": 4.9108, "mean_token_accuracy": 0.21245686262845992, "num_tokens": 88075318.0, "step": 50775 }, { "entropy": 5.883805847167968, "epoch": 3.9508655903520715, "grad_norm": 1.4765625, "learning_rate": 0.0003509750306735828, "loss": 4.9535, "mean_token_accuracy": 0.21332098990678788, "num_tokens": 88083471.0, "step": 50780 }, { "entropy": 5.900699710845947, "epoch": 3.951254619723789, "grad_norm": 1.2578125, "learning_rate": 0.000350948942365073, "loss": 4.9925, "mean_token_accuracy": 0.20952294319868087, "num_tokens": 88093473.0, "step": 50785 }, { "entropy": 5.972920656204224, "epoch": 3.951643649095507, "grad_norm": 1.3203125, "learning_rate": 0.00035092285290415885, "loss": 5.0526, "mean_token_accuracy": 0.20211092829704286, "num_tokens": 88102512.0, "step": 50790 }, { "entropy": 5.918581485748291, "epoch": 3.952032678467224, "grad_norm": 1.4453125, "learning_rate": 0.0003508967622912362, "loss": 5.0059, "mean_token_accuracy": 0.20745243579149247, "num_tokens": 88111171.0, "step": 50795 }, { "entropy": 5.991065835952758, "epoch": 3.952421707838942, "grad_norm": 1.546875, "learning_rate": 0.00035087067052670115, "loss": 5.0704, "mean_token_accuracy": 0.2020331710577011, "num_tokens": 88119565.0, "step": 50800 }, { "entropy": 5.961199235916138, "epoch": 3.9528107372106596, "grad_norm": 1.3203125, "learning_rate": 0.00035084457761094925, "loss": 5.0499, "mean_token_accuracy": 0.206028351187706, "num_tokens": 88128647.0, "step": 50805 }, { "entropy": 5.928804397583008, "epoch": 3.953199766582377, "grad_norm": 1.171875, "learning_rate": 0.0003508184835443766, "loss": 4.9909, "mean_token_accuracy": 0.214894862473011, "num_tokens": 88138154.0, "step": 50810 }, { "entropy": 5.843280029296875, "epoch": 3.9535887959540945, "grad_norm": 1.453125, "learning_rate": 0.00035079238832737926, "loss": 4.991, "mean_token_accuracy": 0.2065334677696228, "num_tokens": 88147024.0, "step": 50815 }, { "entropy": 5.925642681121826, "epoch": 3.953977825325812, "grad_norm": 1.3359375, "learning_rate": 0.000350766291960353, "loss": 5.0499, "mean_token_accuracy": 0.20830301344394683, "num_tokens": 88156132.0, "step": 50820 }, { "entropy": 5.973859119415283, "epoch": 3.95436685469753, "grad_norm": 1.484375, "learning_rate": 0.0003507401944436939, "loss": 5.0841, "mean_token_accuracy": 0.20377764254808425, "num_tokens": 88165393.0, "step": 50825 }, { "entropy": 5.892049646377563, "epoch": 3.954755884069247, "grad_norm": 1.4609375, "learning_rate": 0.0003507140957777979, "loss": 4.9303, "mean_token_accuracy": 0.21226710677146912, "num_tokens": 88173452.0, "step": 50830 }, { "entropy": 5.894001817703247, "epoch": 3.955144913440965, "grad_norm": 1.3203125, "learning_rate": 0.00035068799596306096, "loss": 5.0033, "mean_token_accuracy": 0.2130879357457161, "num_tokens": 88182756.0, "step": 50835 }, { "entropy": 5.8498951435089115, "epoch": 3.955533942812682, "grad_norm": 1.390625, "learning_rate": 0.0003506618949998791, "loss": 4.9458, "mean_token_accuracy": 0.21155122816562652, "num_tokens": 88191040.0, "step": 50840 }, { "entropy": 5.92398509979248, "epoch": 3.9559229721844, "grad_norm": 1.3828125, "learning_rate": 0.00035063579288864853, "loss": 4.9627, "mean_token_accuracy": 0.2140589326620102, "num_tokens": 88199346.0, "step": 50845 }, { "entropy": 5.883610391616822, "epoch": 3.9563120015561175, "grad_norm": 1.453125, "learning_rate": 0.0003506096896297651, "loss": 4.9968, "mean_token_accuracy": 0.21068155467510224, "num_tokens": 88208108.0, "step": 50850 }, { "entropy": 5.888367223739624, "epoch": 3.956701030927835, "grad_norm": 1.390625, "learning_rate": 0.00035058358522362505, "loss": 4.9107, "mean_token_accuracy": 0.21909426897764206, "num_tokens": 88216747.0, "step": 50855 }, { "entropy": 5.962978744506836, "epoch": 3.9570900602995525, "grad_norm": 1.328125, "learning_rate": 0.00035055747967062433, "loss": 5.1205, "mean_token_accuracy": 0.20052213221788406, "num_tokens": 88225943.0, "step": 50860 }, { "entropy": 5.896740961074829, "epoch": 3.95747908967127, "grad_norm": 1.3984375, "learning_rate": 0.0003505313729711592, "loss": 4.9976, "mean_token_accuracy": 0.22165123224258423, "num_tokens": 88235209.0, "step": 50865 }, { "entropy": 5.900451707839966, "epoch": 3.957868119042988, "grad_norm": 1.3203125, "learning_rate": 0.00035050526512562564, "loss": 4.9503, "mean_token_accuracy": 0.21454713493585587, "num_tokens": 88244164.0, "step": 50870 }, { "entropy": 5.89416823387146, "epoch": 3.958257148414705, "grad_norm": 1.328125, "learning_rate": 0.0003504791561344199, "loss": 4.9888, "mean_token_accuracy": 0.21069570183753966, "num_tokens": 88253099.0, "step": 50875 }, { "entropy": 5.933249568939209, "epoch": 3.958646177786423, "grad_norm": 1.484375, "learning_rate": 0.00035045304599793807, "loss": 5.024, "mean_token_accuracy": 0.21191158890724182, "num_tokens": 88260903.0, "step": 50880 }, { "entropy": 5.886406135559082, "epoch": 3.9590352071581405, "grad_norm": 1.28125, "learning_rate": 0.00035042693471657637, "loss": 4.9572, "mean_token_accuracy": 0.22632163614034653, "num_tokens": 88270429.0, "step": 50885 }, { "entropy": 5.897616767883301, "epoch": 3.959424236529858, "grad_norm": 1.21875, "learning_rate": 0.00035040082229073096, "loss": 5.0474, "mean_token_accuracy": 0.21058336943387984, "num_tokens": 88279777.0, "step": 50890 }, { "entropy": 5.8868523120880125, "epoch": 3.9598132659015755, "grad_norm": 1.375, "learning_rate": 0.0003503747087207981, "loss": 4.9416, "mean_token_accuracy": 0.21698378622531891, "num_tokens": 88288247.0, "step": 50895 }, { "entropy": 5.95027904510498, "epoch": 3.960202295273293, "grad_norm": 1.3984375, "learning_rate": 0.00035034859400717407, "loss": 5.025, "mean_token_accuracy": 0.20573436766862868, "num_tokens": 88296552.0, "step": 50900 }, { "entropy": 5.8641704559326175, "epoch": 3.960591324645011, "grad_norm": 1.4375, "learning_rate": 0.00035032247815025504, "loss": 4.8549, "mean_token_accuracy": 0.22071026265621185, "num_tokens": 88304017.0, "step": 50905 }, { "entropy": 5.929469776153565, "epoch": 3.960980354016728, "grad_norm": 1.3515625, "learning_rate": 0.00035029636115043724, "loss": 5.0773, "mean_token_accuracy": 0.2078970640897751, "num_tokens": 88312650.0, "step": 50910 }, { "entropy": 5.874738597869873, "epoch": 3.961369383388446, "grad_norm": 1.3203125, "learning_rate": 0.00035027024300811707, "loss": 4.9416, "mean_token_accuracy": 0.21387553215026855, "num_tokens": 88321409.0, "step": 50915 }, { "entropy": 5.936597776412964, "epoch": 3.9617584127601635, "grad_norm": 1.421875, "learning_rate": 0.0003502441237236907, "loss": 5.0044, "mean_token_accuracy": 0.20834557265043258, "num_tokens": 88329426.0, "step": 50920 }, { "entropy": 5.952096939086914, "epoch": 3.962147442131881, "grad_norm": 1.296875, "learning_rate": 0.0003502180032975545, "loss": 5.0393, "mean_token_accuracy": 0.20776718705892563, "num_tokens": 88338151.0, "step": 50925 }, { "entropy": 5.9335136890411375, "epoch": 3.9625364715035984, "grad_norm": 1.296875, "learning_rate": 0.0003501918817301049, "loss": 4.9653, "mean_token_accuracy": 0.21491142064332963, "num_tokens": 88346090.0, "step": 50930 }, { "entropy": 5.851593255996704, "epoch": 3.962925500875316, "grad_norm": 1.3359375, "learning_rate": 0.00035016575902173814, "loss": 4.9873, "mean_token_accuracy": 0.21217916756868363, "num_tokens": 88354646.0, "step": 50935 }, { "entropy": 5.868579769134522, "epoch": 3.9633145302470334, "grad_norm": 1.3828125, "learning_rate": 0.00035013963517285064, "loss": 4.9505, "mean_token_accuracy": 0.2103911742568016, "num_tokens": 88363024.0, "step": 50940 }, { "entropy": 5.930336380004883, "epoch": 3.963703559618751, "grad_norm": 1.5234375, "learning_rate": 0.00035011351018383874, "loss": 5.073, "mean_token_accuracy": 0.20166740119457244, "num_tokens": 88371399.0, "step": 50945 }, { "entropy": 5.909909582138061, "epoch": 3.964092588990469, "grad_norm": 1.34375, "learning_rate": 0.0003500873840550989, "loss": 4.949, "mean_token_accuracy": 0.21228737980127335, "num_tokens": 88381178.0, "step": 50950 }, { "entropy": 5.891779518127441, "epoch": 3.9644816183621865, "grad_norm": 1.390625, "learning_rate": 0.00035006125678702755, "loss": 4.932, "mean_token_accuracy": 0.21986540406942368, "num_tokens": 88389031.0, "step": 50955 }, { "entropy": 5.7916460037231445, "epoch": 3.964870647733904, "grad_norm": 1.4140625, "learning_rate": 0.00035003512838002103, "loss": 4.8476, "mean_token_accuracy": 0.21537399142980576, "num_tokens": 88397242.0, "step": 50960 }, { "entropy": 5.8204034805297855, "epoch": 3.9652596771056214, "grad_norm": 1.3046875, "learning_rate": 0.0003500089988344759, "loss": 4.9598, "mean_token_accuracy": 0.21078855991363527, "num_tokens": 88406102.0, "step": 50965 }, { "entropy": 5.90370659828186, "epoch": 3.965648706477339, "grad_norm": 1.40625, "learning_rate": 0.00034998286815078855, "loss": 4.9009, "mean_token_accuracy": 0.21408475041389466, "num_tokens": 88414833.0, "step": 50970 }, { "entropy": 5.971953916549682, "epoch": 3.9660377358490564, "grad_norm": 1.4765625, "learning_rate": 0.00034995673632935557, "loss": 5.0277, "mean_token_accuracy": 0.21060966998338698, "num_tokens": 88423282.0, "step": 50975 }, { "entropy": 5.854204797744751, "epoch": 3.966426765220774, "grad_norm": 1.421875, "learning_rate": 0.0003499306033705735, "loss": 4.9316, "mean_token_accuracy": 0.21204428523778915, "num_tokens": 88431745.0, "step": 50980 }, { "entropy": 5.825411367416382, "epoch": 3.966815794592492, "grad_norm": 1.359375, "learning_rate": 0.00034990446927483877, "loss": 4.9653, "mean_token_accuracy": 0.21440336108207703, "num_tokens": 88439724.0, "step": 50985 }, { "entropy": 5.825381422042847, "epoch": 3.9672048239642095, "grad_norm": 1.40625, "learning_rate": 0.0003498783340425479, "loss": 4.8811, "mean_token_accuracy": 0.2168792173266411, "num_tokens": 88448225.0, "step": 50990 }, { "entropy": 5.919149589538574, "epoch": 3.9675938533359267, "grad_norm": 1.4140625, "learning_rate": 0.00034985219767409747, "loss": 5.0099, "mean_token_accuracy": 0.21551765501499176, "num_tokens": 88456495.0, "step": 50995 }, { "entropy": 5.888489532470703, "epoch": 3.9679828827076444, "grad_norm": 1.3828125, "learning_rate": 0.00034982606016988407, "loss": 4.9546, "mean_token_accuracy": 0.21605252027511596, "num_tokens": 88465225.0, "step": 51000 }, { "epoch": 3.9679828827076444, "eval_entropy": 5.641780911005955, "eval_loss": 5.067383289337158, "eval_mean_token_accuracy": 0.21794036806088668, "eval_num_tokens": 88465225.0, "eval_runtime": 21.624, "eval_samples_per_second": 1921.849, "eval_steps_per_second": 240.243, "step": 51000 }, { "entropy": 5.946999359130859, "epoch": 3.968371912079362, "grad_norm": 1.3984375, "learning_rate": 0.00034979992153030424, "loss": 5.0312, "mean_token_accuracy": 0.21053029894828795, "num_tokens": 88474393.0, "step": 51005 }, { "entropy": 5.912715148925781, "epoch": 3.9687609414510794, "grad_norm": 1.3046875, "learning_rate": 0.0003497737817557548, "loss": 5.083, "mean_token_accuracy": 0.20431047379970552, "num_tokens": 88483257.0, "step": 51010 }, { "entropy": 5.926120662689209, "epoch": 3.969149970822797, "grad_norm": 1.3359375, "learning_rate": 0.00034974764084663213, "loss": 5.0379, "mean_token_accuracy": 0.21213313341140747, "num_tokens": 88492077.0, "step": 51015 }, { "entropy": 5.883660507202149, "epoch": 3.9695390001945148, "grad_norm": 1.28125, "learning_rate": 0.00034972149880333316, "loss": 4.8903, "mean_token_accuracy": 0.21478844285011292, "num_tokens": 88501077.0, "step": 51020 }, { "entropy": 5.896730709075928, "epoch": 3.9699280295662325, "grad_norm": 1.359375, "learning_rate": 0.0003496953556262542, "loss": 4.9766, "mean_token_accuracy": 0.2159280851483345, "num_tokens": 88509281.0, "step": 51025 }, { "entropy": 5.851402521133423, "epoch": 3.9703170589379497, "grad_norm": 1.421875, "learning_rate": 0.00034966921131579216, "loss": 4.9681, "mean_token_accuracy": 0.21660338640213012, "num_tokens": 88518019.0, "step": 51030 }, { "entropy": 5.810026454925537, "epoch": 3.9707060883096674, "grad_norm": 1.3984375, "learning_rate": 0.00034964306587234367, "loss": 4.9107, "mean_token_accuracy": 0.21791840344667435, "num_tokens": 88525625.0, "step": 51035 }, { "entropy": 5.864147615432739, "epoch": 3.9710951176813847, "grad_norm": 1.4453125, "learning_rate": 0.00034961691929630544, "loss": 4.9508, "mean_token_accuracy": 0.21436722874641417, "num_tokens": 88533733.0, "step": 51040 }, { "entropy": 5.853624725341797, "epoch": 3.9714841470531024, "grad_norm": 1.46875, "learning_rate": 0.0003495907715880743, "loss": 4.9251, "mean_token_accuracy": 0.2131596803665161, "num_tokens": 88541565.0, "step": 51045 }, { "entropy": 5.930598449707031, "epoch": 3.97187317642482, "grad_norm": 1.484375, "learning_rate": 0.0003495646227480469, "loss": 5.1032, "mean_token_accuracy": 0.2036469519138336, "num_tokens": 88549654.0, "step": 51050 }, { "entropy": 5.924565601348877, "epoch": 3.9722622057965378, "grad_norm": 1.6640625, "learning_rate": 0.00034953847277662, "loss": 4.915, "mean_token_accuracy": 0.21339840739965438, "num_tokens": 88558572.0, "step": 51055 }, { "entropy": 5.924161911010742, "epoch": 3.9726512351682555, "grad_norm": 1.359375, "learning_rate": 0.00034951232167419044, "loss": 4.9503, "mean_token_accuracy": 0.2136978477239609, "num_tokens": 88566810.0, "step": 51060 }, { "entropy": 5.997542428970337, "epoch": 3.9730402645399727, "grad_norm": 1.34375, "learning_rate": 0.00034948616944115504, "loss": 5.1881, "mean_token_accuracy": 0.20055115967988968, "num_tokens": 88576439.0, "step": 51065 }, { "entropy": 5.91132173538208, "epoch": 3.9734292939116904, "grad_norm": 1.4375, "learning_rate": 0.0003494600160779105, "loss": 4.8882, "mean_token_accuracy": 0.21542707532644273, "num_tokens": 88584801.0, "step": 51070 }, { "entropy": 5.880360460281372, "epoch": 3.9738183232834077, "grad_norm": 1.3515625, "learning_rate": 0.0003494338615848537, "loss": 5.0043, "mean_token_accuracy": 0.20871713906526565, "num_tokens": 88593894.0, "step": 51075 }, { "entropy": 5.824681615829467, "epoch": 3.9742073526551254, "grad_norm": 1.5, "learning_rate": 0.0003494077059623816, "loss": 4.9248, "mean_token_accuracy": 0.21743262708187103, "num_tokens": 88601572.0, "step": 51080 }, { "entropy": 5.856284046173096, "epoch": 3.974596382026843, "grad_norm": 1.421875, "learning_rate": 0.00034938154921089097, "loss": 4.9832, "mean_token_accuracy": 0.21898461431264876, "num_tokens": 88610447.0, "step": 51085 }, { "entropy": 5.857293748855591, "epoch": 3.9749854113985608, "grad_norm": 1.3046875, "learning_rate": 0.0003493553913307788, "loss": 4.9754, "mean_token_accuracy": 0.2016680732369423, "num_tokens": 88619363.0, "step": 51090 }, { "entropy": 5.915251636505127, "epoch": 3.975374440770278, "grad_norm": 1.3203125, "learning_rate": 0.00034932923232244183, "loss": 5.0279, "mean_token_accuracy": 0.2086326077580452, "num_tokens": 88627797.0, "step": 51095 }, { "entropy": 5.95707139968872, "epoch": 3.9757634701419957, "grad_norm": 1.3671875, "learning_rate": 0.00034930307218627706, "loss": 5.016, "mean_token_accuracy": 0.21039636582136154, "num_tokens": 88637080.0, "step": 51100 }, { "entropy": 5.906458711624145, "epoch": 3.9761524995137134, "grad_norm": 1.3828125, "learning_rate": 0.0003492769109226815, "loss": 4.9761, "mean_token_accuracy": 0.2155553102493286, "num_tokens": 88646252.0, "step": 51105 }, { "entropy": 5.9199940204620365, "epoch": 3.9765415288854307, "grad_norm": 1.3203125, "learning_rate": 0.00034925074853205194, "loss": 5.0274, "mean_token_accuracy": 0.2006924957036972, "num_tokens": 88655629.0, "step": 51110 }, { "entropy": 5.967312955856324, "epoch": 3.9769305582571484, "grad_norm": 1.3984375, "learning_rate": 0.00034922458501478556, "loss": 5.0027, "mean_token_accuracy": 0.22319788634777069, "num_tokens": 88664501.0, "step": 51115 }, { "entropy": 5.85486249923706, "epoch": 3.977319587628866, "grad_norm": 1.4296875, "learning_rate": 0.0003491984203712792, "loss": 4.9169, "mean_token_accuracy": 0.2135988250374794, "num_tokens": 88672511.0, "step": 51120 }, { "entropy": 5.935390758514404, "epoch": 3.9777086170005838, "grad_norm": 1.4375, "learning_rate": 0.0003491722546019299, "loss": 5.0493, "mean_token_accuracy": 0.2100460097193718, "num_tokens": 88680987.0, "step": 51125 }, { "entropy": 5.931789827346802, "epoch": 3.978097646372301, "grad_norm": 1.296875, "learning_rate": 0.0003491460877071347, "loss": 5.055, "mean_token_accuracy": 0.20573009997606279, "num_tokens": 88690234.0, "step": 51130 }, { "entropy": 5.971969985961914, "epoch": 3.9784866757440187, "grad_norm": 1.3671875, "learning_rate": 0.0003491199196872906, "loss": 5.0389, "mean_token_accuracy": 0.2136078119277954, "num_tokens": 88698840.0, "step": 51135 }, { "entropy": 5.898155307769775, "epoch": 3.978875705115736, "grad_norm": 1.3359375, "learning_rate": 0.0003490937505427947, "loss": 4.9429, "mean_token_accuracy": 0.21416521072387695, "num_tokens": 88706993.0, "step": 51140 }, { "entropy": 5.8424286365509035, "epoch": 3.9792647344874537, "grad_norm": 1.2578125, "learning_rate": 0.0003490675802740441, "loss": 4.9235, "mean_token_accuracy": 0.21641771346330643, "num_tokens": 88715629.0, "step": 51145 }, { "entropy": 5.902287149429322, "epoch": 3.9796537638591714, "grad_norm": 1.3671875, "learning_rate": 0.0003490414088814359, "loss": 4.9247, "mean_token_accuracy": 0.22157925069332124, "num_tokens": 88724874.0, "step": 51150 }, { "entropy": 5.937044954299926, "epoch": 3.980042793230889, "grad_norm": 1.4453125, "learning_rate": 0.0003490152363653671, "loss": 5.0274, "mean_token_accuracy": 0.2071641817688942, "num_tokens": 88733173.0, "step": 51155 }, { "entropy": 5.847459983825684, "epoch": 3.9804318226026068, "grad_norm": 1.3046875, "learning_rate": 0.0003489890627262349, "loss": 5.0056, "mean_token_accuracy": 0.21110834628343583, "num_tokens": 88741557.0, "step": 51160 }, { "entropy": 5.838502264022827, "epoch": 3.980820851974324, "grad_norm": 1.2421875, "learning_rate": 0.00034896288796443654, "loss": 4.913, "mean_token_accuracy": 0.21508955657482148, "num_tokens": 88749958.0, "step": 51165 }, { "entropy": 5.89239821434021, "epoch": 3.9812098813460417, "grad_norm": 1.328125, "learning_rate": 0.00034893671208036895, "loss": 4.913, "mean_token_accuracy": 0.2232305496931076, "num_tokens": 88758034.0, "step": 51170 }, { "entropy": 5.9087950706481935, "epoch": 3.981598910717759, "grad_norm": 1.3125, "learning_rate": 0.00034891053507442944, "loss": 4.9627, "mean_token_accuracy": 0.2170702889561653, "num_tokens": 88767101.0, "step": 51175 }, { "entropy": 5.821817827224732, "epoch": 3.9819879400894767, "grad_norm": 1.34375, "learning_rate": 0.0003488843569470153, "loss": 4.8918, "mean_token_accuracy": 0.2146038755774498, "num_tokens": 88775590.0, "step": 51180 }, { "entropy": 5.880641222000122, "epoch": 3.9823769694611943, "grad_norm": 1.40625, "learning_rate": 0.00034885817769852355, "loss": 4.9797, "mean_token_accuracy": 0.21303718388080597, "num_tokens": 88784575.0, "step": 51185 }, { "entropy": 5.9298052310943605, "epoch": 3.982765998832912, "grad_norm": 1.390625, "learning_rate": 0.00034883199732935156, "loss": 5.007, "mean_token_accuracy": 0.20884982049465178, "num_tokens": 88793479.0, "step": 51190 }, { "entropy": 5.917762660980225, "epoch": 3.9831550282046293, "grad_norm": 1.53125, "learning_rate": 0.00034880581583989655, "loss": 4.8993, "mean_token_accuracy": 0.21762374937534332, "num_tokens": 88801155.0, "step": 51195 }, { "entropy": 5.845101404190063, "epoch": 3.983544057576347, "grad_norm": 1.4453125, "learning_rate": 0.0003487796332305557, "loss": 4.8926, "mean_token_accuracy": 0.22117125242948532, "num_tokens": 88810228.0, "step": 51200 }, { "entropy": 5.814281415939331, "epoch": 3.9839330869480647, "grad_norm": 1.4453125, "learning_rate": 0.00034875344950172635, "loss": 5.0015, "mean_token_accuracy": 0.21652389764785768, "num_tokens": 88818090.0, "step": 51205 }, { "entropy": 5.828624057769775, "epoch": 3.984322116319782, "grad_norm": 1.3828125, "learning_rate": 0.0003487272646538058, "loss": 4.9514, "mean_token_accuracy": 0.21039635092020034, "num_tokens": 88826683.0, "step": 51210 }, { "entropy": 5.848966979980469, "epoch": 3.9847111456914996, "grad_norm": 1.3515625, "learning_rate": 0.00034870107868719135, "loss": 4.9039, "mean_token_accuracy": 0.22026965618133545, "num_tokens": 88836205.0, "step": 51215 }, { "entropy": 5.859218406677246, "epoch": 3.9851001750632173, "grad_norm": 1.3828125, "learning_rate": 0.0003486748916022804, "loss": 4.925, "mean_token_accuracy": 0.21897902637720107, "num_tokens": 88845492.0, "step": 51220 }, { "entropy": 5.900882005691528, "epoch": 3.985489204434935, "grad_norm": 1.4375, "learning_rate": 0.0003486487033994702, "loss": 4.9642, "mean_token_accuracy": 0.20634374022483826, "num_tokens": 88853862.0, "step": 51225 }, { "entropy": 5.816099214553833, "epoch": 3.9858782338066523, "grad_norm": 1.3125, "learning_rate": 0.00034862251407915813, "loss": 4.9397, "mean_token_accuracy": 0.21504469066858292, "num_tokens": 88863436.0, "step": 51230 }, { "entropy": 5.863626480102539, "epoch": 3.98626726317837, "grad_norm": 1.4140625, "learning_rate": 0.00034859632364174167, "loss": 4.935, "mean_token_accuracy": 0.21866805404424666, "num_tokens": 88871917.0, "step": 51235 }, { "entropy": 5.922841215133667, "epoch": 3.9866562925500877, "grad_norm": 1.3984375, "learning_rate": 0.000348570132087618, "loss": 5.0655, "mean_token_accuracy": 0.21212382316589357, "num_tokens": 88880634.0, "step": 51240 }, { "entropy": 5.928359079360962, "epoch": 3.987045321921805, "grad_norm": 1.28125, "learning_rate": 0.0003485439394171847, "loss": 5.057, "mean_token_accuracy": 0.20951623767614364, "num_tokens": 88889542.0, "step": 51245 }, { "entropy": 5.912408494949341, "epoch": 3.9874343512935226, "grad_norm": 1.3125, "learning_rate": 0.00034851774563083925, "loss": 5.0397, "mean_token_accuracy": 0.2040437787771225, "num_tokens": 88898238.0, "step": 51250 }, { "entropy": 5.845378303527832, "epoch": 3.9878233806652403, "grad_norm": 1.484375, "learning_rate": 0.0003484915507289791, "loss": 4.9624, "mean_token_accuracy": 0.2179309144616127, "num_tokens": 88906591.0, "step": 51255 }, { "entropy": 5.812925577163696, "epoch": 3.988212410036958, "grad_norm": 1.359375, "learning_rate": 0.00034846535471200153, "loss": 4.8835, "mean_token_accuracy": 0.22041261494159697, "num_tokens": 88915008.0, "step": 51260 }, { "entropy": 5.950852584838867, "epoch": 3.9886014394086753, "grad_norm": 1.3828125, "learning_rate": 0.0003484391575803041, "loss": 5.007, "mean_token_accuracy": 0.20693634450435638, "num_tokens": 88923936.0, "step": 51265 }, { "entropy": 5.897033309936523, "epoch": 3.988990468780393, "grad_norm": 1.2734375, "learning_rate": 0.0003484129593342844, "loss": 4.9164, "mean_token_accuracy": 0.21858056038618087, "num_tokens": 88932770.0, "step": 51270 }, { "entropy": 5.876382493972779, "epoch": 3.9893794981521102, "grad_norm": 1.359375, "learning_rate": 0.00034838675997433987, "loss": 4.9694, "mean_token_accuracy": 0.2075872913002968, "num_tokens": 88941233.0, "step": 51275 }, { "entropy": 5.87048373222351, "epoch": 3.989768527523828, "grad_norm": 1.421875, "learning_rate": 0.0003483605595008681, "loss": 5.0478, "mean_token_accuracy": 0.2018609717488289, "num_tokens": 88949527.0, "step": 51280 }, { "entropy": 5.84958701133728, "epoch": 3.9901575568955456, "grad_norm": 1.375, "learning_rate": 0.00034833435791426653, "loss": 4.9647, "mean_token_accuracy": 0.2102692022919655, "num_tokens": 88957961.0, "step": 51285 }, { "entropy": 5.964362478256225, "epoch": 3.9905465862672633, "grad_norm": 1.4453125, "learning_rate": 0.00034830815521493295, "loss": 5.0343, "mean_token_accuracy": 0.20921943634748458, "num_tokens": 88966551.0, "step": 51290 }, { "entropy": 5.963025093078613, "epoch": 3.9909356156389806, "grad_norm": 1.390625, "learning_rate": 0.0003482819514032647, "loss": 4.9822, "mean_token_accuracy": 0.21536827981472015, "num_tokens": 88974994.0, "step": 51295 }, { "entropy": 5.894117927551269, "epoch": 3.9913246450106983, "grad_norm": 1.3125, "learning_rate": 0.00034825574647965945, "loss": 4.8939, "mean_token_accuracy": 0.21932432651519776, "num_tokens": 88982664.0, "step": 51300 }, { "entropy": 5.913053321838379, "epoch": 3.991713674382416, "grad_norm": 1.40625, "learning_rate": 0.00034822954044451485, "loss": 4.9077, "mean_token_accuracy": 0.2165893018245697, "num_tokens": 88990901.0, "step": 51305 }, { "entropy": 5.853804683685302, "epoch": 3.9921027037541332, "grad_norm": 1.375, "learning_rate": 0.0003482033332982286, "loss": 4.9471, "mean_token_accuracy": 0.218132184445858, "num_tokens": 88999439.0, "step": 51310 }, { "entropy": 5.897780084609986, "epoch": 3.992491733125851, "grad_norm": 1.359375, "learning_rate": 0.0003481771250411982, "loss": 5.0462, "mean_token_accuracy": 0.20589831471443176, "num_tokens": 89007819.0, "step": 51315 }, { "entropy": 5.849972486495972, "epoch": 3.9928807624975686, "grad_norm": 1.265625, "learning_rate": 0.0003481509156738214, "loss": 4.8686, "mean_token_accuracy": 0.22297106087207794, "num_tokens": 89016620.0, "step": 51320 }, { "entropy": 5.871960926055908, "epoch": 3.9932697918692863, "grad_norm": 1.3671875, "learning_rate": 0.00034812470519649593, "loss": 4.9255, "mean_token_accuracy": 0.2118513196706772, "num_tokens": 89025327.0, "step": 51325 }, { "entropy": 5.923964405059815, "epoch": 3.9936588212410036, "grad_norm": 1.359375, "learning_rate": 0.0003480984936096194, "loss": 5.0178, "mean_token_accuracy": 0.213408000767231, "num_tokens": 89034527.0, "step": 51330 }, { "entropy": 5.882249736785889, "epoch": 3.9940478506127213, "grad_norm": 1.53125, "learning_rate": 0.00034807228091358964, "loss": 4.9828, "mean_token_accuracy": 0.20976798981428146, "num_tokens": 89043923.0, "step": 51335 }, { "entropy": 5.870542573928833, "epoch": 3.994436879984439, "grad_norm": 1.328125, "learning_rate": 0.0003480460671088043, "loss": 4.9169, "mean_token_accuracy": 0.22477118223905562, "num_tokens": 89052619.0, "step": 51340 }, { "entropy": 5.891075086593628, "epoch": 3.9948259093561562, "grad_norm": 1.359375, "learning_rate": 0.00034801985219566124, "loss": 5.0471, "mean_token_accuracy": 0.20686447918415068, "num_tokens": 89062228.0, "step": 51345 }, { "entropy": 5.97468523979187, "epoch": 3.995214938727874, "grad_norm": 1.4765625, "learning_rate": 0.000347993636174558, "loss": 5.0741, "mean_token_accuracy": 0.2113485410809517, "num_tokens": 89070784.0, "step": 51350 }, { "entropy": 5.881267833709717, "epoch": 3.9956039680995916, "grad_norm": 1.296875, "learning_rate": 0.00034796741904589263, "loss": 5.033, "mean_token_accuracy": 0.21018338054418564, "num_tokens": 89079758.0, "step": 51355 }, { "entropy": 5.859053611755371, "epoch": 3.9959929974713093, "grad_norm": 1.3671875, "learning_rate": 0.00034794120081006275, "loss": 4.9269, "mean_token_accuracy": 0.21520709693431855, "num_tokens": 89088176.0, "step": 51360 }, { "entropy": 5.911710119247436, "epoch": 3.9963820268430266, "grad_norm": 1.2890625, "learning_rate": 0.0003479149814674663, "loss": 4.9648, "mean_token_accuracy": 0.2098015785217285, "num_tokens": 89097329.0, "step": 51365 }, { "entropy": 5.897600364685059, "epoch": 3.9967710562147443, "grad_norm": 1.3125, "learning_rate": 0.000347888761018501, "loss": 4.9953, "mean_token_accuracy": 0.21509635895490647, "num_tokens": 89105973.0, "step": 51370 }, { "entropy": 5.8907938480377195, "epoch": 3.9971600855864615, "grad_norm": 1.4296875, "learning_rate": 0.0003478625394635648, "loss": 4.973, "mean_token_accuracy": 0.20917249023914336, "num_tokens": 89115618.0, "step": 51375 }, { "entropy": 5.929049444198609, "epoch": 3.997549114958179, "grad_norm": 1.359375, "learning_rate": 0.00034783631680305554, "loss": 4.9432, "mean_token_accuracy": 0.21390130668878554, "num_tokens": 89124072.0, "step": 51380 }, { "entropy": 5.8912557601928714, "epoch": 3.997938144329897, "grad_norm": 1.3203125, "learning_rate": 0.0003478100930373711, "loss": 4.9918, "mean_token_accuracy": 0.21044548153877257, "num_tokens": 89132693.0, "step": 51385 }, { "entropy": 5.807271480560303, "epoch": 3.9983271737016146, "grad_norm": 1.4453125, "learning_rate": 0.0003477838681669094, "loss": 4.9261, "mean_token_accuracy": 0.21389484852552415, "num_tokens": 89141315.0, "step": 51390 }, { "entropy": 5.9639739990234375, "epoch": 3.9987162030733323, "grad_norm": 1.34375, "learning_rate": 0.0003477576421920682, "loss": 5.125, "mean_token_accuracy": 0.2041578084230423, "num_tokens": 89148983.0, "step": 51395 }, { "entropy": 5.941881608963013, "epoch": 3.9991052324450496, "grad_norm": 1.40625, "learning_rate": 0.0003477314151132458, "loss": 5.0684, "mean_token_accuracy": 0.2040597453713417, "num_tokens": 89158209.0, "step": 51400 }, { "entropy": 5.985758304595947, "epoch": 3.9994942618167673, "grad_norm": 1.3359375, "learning_rate": 0.00034770518693083986, "loss": 5.0997, "mean_token_accuracy": 0.20041133016347884, "num_tokens": 89166805.0, "step": 51405 }, { "entropy": 5.910163831710816, "epoch": 3.9998832911884845, "grad_norm": 1.328125, "learning_rate": 0.00034767895764524845, "loss": 4.9794, "mean_token_accuracy": 0.21112971603870392, "num_tokens": 89175678.0, "step": 51410 }, { "entropy": 5.97582467397054, "epoch": 4.000233417623031, "grad_norm": 1.5234375, "learning_rate": 0.00034765272725686947, "loss": 4.9776, "mean_token_accuracy": 0.21074849863847098, "num_tokens": 89183078.0, "step": 51415 }, { "entropy": 5.8420196056365965, "epoch": 4.000622446994748, "grad_norm": 1.3984375, "learning_rate": 0.00034762649576610105, "loss": 4.9226, "mean_token_accuracy": 0.21914774626493455, "num_tokens": 89191249.0, "step": 51420 }, { "entropy": 5.8402751922607425, "epoch": 4.0010114763664655, "grad_norm": 1.4453125, "learning_rate": 0.00034760026317334113, "loss": 4.8632, "mean_token_accuracy": 0.2195607140660286, "num_tokens": 89199848.0, "step": 51425 }, { "entropy": 5.8676862716674805, "epoch": 4.001400505738183, "grad_norm": 1.421875, "learning_rate": 0.0003475740294789878, "loss": 5.0013, "mean_token_accuracy": 0.20982439815998077, "num_tokens": 89209258.0, "step": 51430 }, { "entropy": 5.90981969833374, "epoch": 4.001789535109901, "grad_norm": 1.3671875, "learning_rate": 0.000347547794683439, "loss": 5.0042, "mean_token_accuracy": 0.21824139952659607, "num_tokens": 89218260.0, "step": 51435 }, { "entropy": 5.909048080444336, "epoch": 4.002178564481619, "grad_norm": 1.484375, "learning_rate": 0.0003475215587870929, "loss": 4.9413, "mean_token_accuracy": 0.21335484087467194, "num_tokens": 89226214.0, "step": 51440 }, { "entropy": 5.877802944183349, "epoch": 4.002567593853336, "grad_norm": 1.34375, "learning_rate": 0.0003474953217903477, "loss": 4.9156, "mean_token_accuracy": 0.21453987509012223, "num_tokens": 89234936.0, "step": 51445 }, { "entropy": 5.877139234542847, "epoch": 4.002956623225053, "grad_norm": 1.28125, "learning_rate": 0.0003474690836936013, "loss": 4.9684, "mean_token_accuracy": 0.21407377272844313, "num_tokens": 89243516.0, "step": 51450 }, { "entropy": 5.898499965667725, "epoch": 4.003345652596771, "grad_norm": 1.3359375, "learning_rate": 0.0003474428444972519, "loss": 4.954, "mean_token_accuracy": 0.2105195105075836, "num_tokens": 89252680.0, "step": 51455 }, { "entropy": 5.880385971069336, "epoch": 4.0037346819684885, "grad_norm": 1.4453125, "learning_rate": 0.0003474166042016977, "loss": 4.8566, "mean_token_accuracy": 0.22143347710371017, "num_tokens": 89260965.0, "step": 51460 }, { "entropy": 5.984302663803101, "epoch": 4.004123711340206, "grad_norm": 1.46875, "learning_rate": 0.00034739036280733674, "loss": 5.0432, "mean_token_accuracy": 0.20459716767072678, "num_tokens": 89270269.0, "step": 51465 }, { "entropy": 5.871835517883301, "epoch": 4.004512740711924, "grad_norm": 1.328125, "learning_rate": 0.00034736412031456714, "loss": 4.8775, "mean_token_accuracy": 0.2225031092762947, "num_tokens": 89278825.0, "step": 51470 }, { "entropy": 5.830157518386841, "epoch": 4.004901770083642, "grad_norm": 1.3828125, "learning_rate": 0.00034733787672378734, "loss": 4.9226, "mean_token_accuracy": 0.21398176103830338, "num_tokens": 89287413.0, "step": 51475 }, { "entropy": 5.851902198791504, "epoch": 4.005290799455359, "grad_norm": 1.3203125, "learning_rate": 0.0003473116320353953, "loss": 4.9815, "mean_token_accuracy": 0.2110906034708023, "num_tokens": 89295379.0, "step": 51480 }, { "entropy": 5.862320184707642, "epoch": 4.005679828827076, "grad_norm": 1.359375, "learning_rate": 0.0003472853862497895, "loss": 4.9448, "mean_token_accuracy": 0.20952885895967482, "num_tokens": 89303671.0, "step": 51485 }, { "entropy": 5.949629163742065, "epoch": 4.006068858198794, "grad_norm": 1.359375, "learning_rate": 0.0003472591393673679, "loss": 4.9616, "mean_token_accuracy": 0.21784767359495164, "num_tokens": 89312177.0, "step": 51490 }, { "entropy": 5.839616012573242, "epoch": 4.0064578875705115, "grad_norm": 1.4453125, "learning_rate": 0.00034723289138852885, "loss": 4.9139, "mean_token_accuracy": 0.21895986348390578, "num_tokens": 89321002.0, "step": 51495 }, { "entropy": 5.84339075088501, "epoch": 4.006846916942229, "grad_norm": 1.4140625, "learning_rate": 0.0003472066423136707, "loss": 4.8985, "mean_token_accuracy": 0.21512024253606796, "num_tokens": 89329761.0, "step": 51500 }, { "entropy": 5.896760654449463, "epoch": 4.007235946313947, "grad_norm": 1.4609375, "learning_rate": 0.0003471803921431917, "loss": 4.9273, "mean_token_accuracy": 0.21654462516307832, "num_tokens": 89338345.0, "step": 51505 }, { "entropy": 5.902386665344238, "epoch": 4.007624975685665, "grad_norm": 1.4375, "learning_rate": 0.00034715414087749003, "loss": 4.9388, "mean_token_accuracy": 0.21777443438768387, "num_tokens": 89347229.0, "step": 51510 }, { "entropy": 5.912940263748169, "epoch": 4.008014005057382, "grad_norm": 1.40625, "learning_rate": 0.0003471278885169642, "loss": 4.9338, "mean_token_accuracy": 0.21891834437847138, "num_tokens": 89355590.0, "step": 51515 }, { "entropy": 5.937684059143066, "epoch": 4.008403034429099, "grad_norm": 1.421875, "learning_rate": 0.00034710163506201247, "loss": 4.9648, "mean_token_accuracy": 0.210394087433815, "num_tokens": 89363442.0, "step": 51520 }, { "entropy": 5.897476720809936, "epoch": 4.008792063800817, "grad_norm": 1.4453125, "learning_rate": 0.00034707538051303316, "loss": 4.9551, "mean_token_accuracy": 0.21237749755382537, "num_tokens": 89372363.0, "step": 51525 }, { "entropy": 5.933529996871949, "epoch": 4.0091810931725345, "grad_norm": 1.375, "learning_rate": 0.0003470491248704247, "loss": 5.038, "mean_token_accuracy": 0.20637766122817994, "num_tokens": 89380870.0, "step": 51530 }, { "entropy": 5.868474245071411, "epoch": 4.009570122544252, "grad_norm": 1.4140625, "learning_rate": 0.00034702286813458543, "loss": 4.8943, "mean_token_accuracy": 0.21358744651079178, "num_tokens": 89389047.0, "step": 51535 }, { "entropy": 5.843909788131714, "epoch": 4.00995915191597, "grad_norm": 1.4453125, "learning_rate": 0.00034699661030591374, "loss": 4.9147, "mean_token_accuracy": 0.22017130702733995, "num_tokens": 89397413.0, "step": 51540 }, { "entropy": 5.877579927444458, "epoch": 4.0103481812876876, "grad_norm": 1.375, "learning_rate": 0.0003469703513848081, "loss": 4.9778, "mean_token_accuracy": 0.21067177802324294, "num_tokens": 89405507.0, "step": 51545 }, { "entropy": 5.861230993270874, "epoch": 4.010737210659404, "grad_norm": 1.5390625, "learning_rate": 0.000346944091371667, "loss": 4.9446, "mean_token_accuracy": 0.2288581058382988, "num_tokens": 89413544.0, "step": 51550 }, { "entropy": 5.863749408721924, "epoch": 4.011126240031122, "grad_norm": 1.4375, "learning_rate": 0.0003469178302668888, "loss": 4.9169, "mean_token_accuracy": 0.2223828077316284, "num_tokens": 89421567.0, "step": 51555 }, { "entropy": 5.794481229782105, "epoch": 4.01151526940284, "grad_norm": 1.359375, "learning_rate": 0.0003468915680708719, "loss": 4.8132, "mean_token_accuracy": 0.23565987944602967, "num_tokens": 89430425.0, "step": 51560 }, { "entropy": 5.942691946029663, "epoch": 4.0119042987745575, "grad_norm": 1.359375, "learning_rate": 0.000346865304784015, "loss": 4.9976, "mean_token_accuracy": 0.20705384761095047, "num_tokens": 89438219.0, "step": 51565 }, { "entropy": 5.867607688903808, "epoch": 4.012293328146275, "grad_norm": 1.28125, "learning_rate": 0.0003468390404067164, "loss": 4.9904, "mean_token_accuracy": 0.2116684392094612, "num_tokens": 89447145.0, "step": 51570 }, { "entropy": 5.968862152099609, "epoch": 4.012682357517993, "grad_norm": 1.390625, "learning_rate": 0.0003468127749393747, "loss": 5.0456, "mean_token_accuracy": 0.2131548821926117, "num_tokens": 89457060.0, "step": 51575 }, { "entropy": 5.978016185760498, "epoch": 4.0130713868897105, "grad_norm": 1.46875, "learning_rate": 0.0003467865083823885, "loss": 5.0401, "mean_token_accuracy": 0.21333996057510377, "num_tokens": 89465925.0, "step": 51580 }, { "entropy": 5.927683925628662, "epoch": 4.013460416261427, "grad_norm": 1.359375, "learning_rate": 0.0003467602407361563, "loss": 4.9546, "mean_token_accuracy": 0.21414511799812316, "num_tokens": 89474863.0, "step": 51585 }, { "entropy": 5.866687679290772, "epoch": 4.013849445633145, "grad_norm": 1.3125, "learning_rate": 0.00034673397200107663, "loss": 4.8874, "mean_token_accuracy": 0.2190448597073555, "num_tokens": 89483623.0, "step": 51590 }, { "entropy": 5.899594116210937, "epoch": 4.014238475004863, "grad_norm": 1.40625, "learning_rate": 0.0003467077021775481, "loss": 4.9409, "mean_token_accuracy": 0.21481382101774216, "num_tokens": 89492677.0, "step": 51595 }, { "entropy": 5.869575262069702, "epoch": 4.0146275043765804, "grad_norm": 1.40625, "learning_rate": 0.00034668143126596933, "loss": 4.9346, "mean_token_accuracy": 0.2163792982697487, "num_tokens": 89501611.0, "step": 51600 }, { "entropy": 5.9594621658325195, "epoch": 4.015016533748298, "grad_norm": 1.3671875, "learning_rate": 0.00034665515926673903, "loss": 4.9929, "mean_token_accuracy": 0.21615516990423203, "num_tokens": 89510842.0, "step": 51605 }, { "entropy": 5.926382780075073, "epoch": 4.015405563120016, "grad_norm": 1.3203125, "learning_rate": 0.0003466288861802556, "loss": 4.937, "mean_token_accuracy": 0.21702005416154863, "num_tokens": 89520015.0, "step": 51610 }, { "entropy": 5.867415714263916, "epoch": 4.0157945924917335, "grad_norm": 1.3046875, "learning_rate": 0.0003466026120069179, "loss": 4.9556, "mean_token_accuracy": 0.2193633422255516, "num_tokens": 89529272.0, "step": 51615 }, { "entropy": 5.8528331279754635, "epoch": 4.01618362186345, "grad_norm": 1.2734375, "learning_rate": 0.0003465763367471245, "loss": 4.9165, "mean_token_accuracy": 0.21379163414239882, "num_tokens": 89537641.0, "step": 51620 }, { "entropy": 5.96091365814209, "epoch": 4.016572651235168, "grad_norm": 1.3828125, "learning_rate": 0.00034655006040127415, "loss": 5.0457, "mean_token_accuracy": 0.2057829350233078, "num_tokens": 89546454.0, "step": 51625 }, { "entropy": 5.885729694366455, "epoch": 4.016961680606886, "grad_norm": 1.3984375, "learning_rate": 0.0003465237829697655, "loss": 4.9086, "mean_token_accuracy": 0.22202978879213334, "num_tokens": 89555292.0, "step": 51630 }, { "entropy": 5.942846202850342, "epoch": 4.017350709978603, "grad_norm": 1.3984375, "learning_rate": 0.00034649750445299725, "loss": 5.0466, "mean_token_accuracy": 0.21129234731197358, "num_tokens": 89563464.0, "step": 51635 }, { "entropy": 5.878468751907349, "epoch": 4.017739739350321, "grad_norm": 1.3671875, "learning_rate": 0.0003464712248513682, "loss": 4.9438, "mean_token_accuracy": 0.2125246226787567, "num_tokens": 89572636.0, "step": 51640 }, { "entropy": 5.923302507400512, "epoch": 4.018128768722039, "grad_norm": 1.375, "learning_rate": 0.0003464449441652771, "loss": 5.0598, "mean_token_accuracy": 0.20053177177906037, "num_tokens": 89581080.0, "step": 51645 }, { "entropy": 5.90190372467041, "epoch": 4.018517798093756, "grad_norm": 1.3203125, "learning_rate": 0.0003464186623951227, "loss": 4.9255, "mean_token_accuracy": 0.2173517107963562, "num_tokens": 89589903.0, "step": 51650 }, { "entropy": 5.952067613601685, "epoch": 4.018906827465473, "grad_norm": 1.4375, "learning_rate": 0.0003463923795413037, "loss": 4.9278, "mean_token_accuracy": 0.22032854557037354, "num_tokens": 89597799.0, "step": 51655 }, { "entropy": 5.881106662750244, "epoch": 4.019295856837191, "grad_norm": 1.40625, "learning_rate": 0.00034636609560421906, "loss": 5.0106, "mean_token_accuracy": 0.20971026569604873, "num_tokens": 89606301.0, "step": 51660 }, { "entropy": 5.895504188537598, "epoch": 4.019684886208909, "grad_norm": 1.3359375, "learning_rate": 0.00034633981058426744, "loss": 4.9696, "mean_token_accuracy": 0.21039099991321564, "num_tokens": 89616081.0, "step": 51665 }, { "entropy": 5.875878858566284, "epoch": 4.020073915580626, "grad_norm": 1.53125, "learning_rate": 0.0003463135244818477, "loss": 4.8726, "mean_token_accuracy": 0.21888205856084825, "num_tokens": 89624014.0, "step": 51670 }, { "entropy": 5.8793755054473875, "epoch": 4.020462944952344, "grad_norm": 1.4296875, "learning_rate": 0.0003462872372973588, "loss": 4.9652, "mean_token_accuracy": 0.21547592878341676, "num_tokens": 89631636.0, "step": 51675 }, { "entropy": 5.825847959518432, "epoch": 4.020851974324062, "grad_norm": 1.359375, "learning_rate": 0.0003462609490311996, "loss": 4.8655, "mean_token_accuracy": 0.22567352801561355, "num_tokens": 89639771.0, "step": 51680 }, { "entropy": 5.9022430896759035, "epoch": 4.021241003695779, "grad_norm": 1.359375, "learning_rate": 0.0003462346596837689, "loss": 5.0264, "mean_token_accuracy": 0.2118979051709175, "num_tokens": 89648186.0, "step": 51685 }, { "entropy": 5.8689357280731205, "epoch": 4.021630033067496, "grad_norm": 1.359375, "learning_rate": 0.0003462083692554655, "loss": 4.8785, "mean_token_accuracy": 0.22017496973276138, "num_tokens": 89656812.0, "step": 51690 }, { "entropy": 5.939738035202026, "epoch": 4.022019062439214, "grad_norm": 1.3359375, "learning_rate": 0.00034618207774668854, "loss": 4.908, "mean_token_accuracy": 0.22098247557878495, "num_tokens": 89664824.0, "step": 51695 }, { "entropy": 5.9381858825683596, "epoch": 4.022408091810932, "grad_norm": 1.40625, "learning_rate": 0.00034615578515783687, "loss": 4.9981, "mean_token_accuracy": 0.21227751970291137, "num_tokens": 89674323.0, "step": 51700 }, { "entropy": 5.915309286117553, "epoch": 4.022797121182649, "grad_norm": 1.3984375, "learning_rate": 0.00034612949148930935, "loss": 4.9978, "mean_token_accuracy": 0.20927779674530028, "num_tokens": 89683233.0, "step": 51705 }, { "entropy": 5.890073919296265, "epoch": 4.023186150554367, "grad_norm": 1.421875, "learning_rate": 0.000346103196741505, "loss": 4.8643, "mean_token_accuracy": 0.22136933654546737, "num_tokens": 89691704.0, "step": 51710 }, { "entropy": 5.953982305526734, "epoch": 4.023575179926085, "grad_norm": 1.2890625, "learning_rate": 0.00034607690091482284, "loss": 5.0003, "mean_token_accuracy": 0.21588967442512513, "num_tokens": 89700829.0, "step": 51715 }, { "entropy": 5.932560729980469, "epoch": 4.023964209297802, "grad_norm": 1.4296875, "learning_rate": 0.0003460506040096619, "loss": 4.9082, "mean_token_accuracy": 0.21344215720891951, "num_tokens": 89709026.0, "step": 51720 }, { "entropy": 5.850546026229859, "epoch": 4.024353238669519, "grad_norm": 1.3515625, "learning_rate": 0.0003460243060264211, "loss": 4.9471, "mean_token_accuracy": 0.21272530555725097, "num_tokens": 89717934.0, "step": 51725 }, { "entropy": 5.7960621356964115, "epoch": 4.024742268041237, "grad_norm": 1.3515625, "learning_rate": 0.00034599800696549944, "loss": 4.8345, "mean_token_accuracy": 0.21892877221107482, "num_tokens": 89726922.0, "step": 51730 }, { "entropy": 5.839752292633056, "epoch": 4.025131297412955, "grad_norm": 1.296875, "learning_rate": 0.000345971706827296, "loss": 4.9209, "mean_token_accuracy": 0.21678055077791214, "num_tokens": 89735656.0, "step": 51735 }, { "entropy": 5.8838310718536375, "epoch": 4.025520326784672, "grad_norm": 1.3359375, "learning_rate": 0.00034594540561221, "loss": 4.9918, "mean_token_accuracy": 0.2187206581234932, "num_tokens": 89744741.0, "step": 51740 }, { "entropy": 5.905480194091797, "epoch": 4.02590935615639, "grad_norm": 1.3984375, "learning_rate": 0.00034591910332064027, "loss": 4.9212, "mean_token_accuracy": 0.22085680067539215, "num_tokens": 89753588.0, "step": 51745 }, { "entropy": 6.008329296112061, "epoch": 4.026298385528108, "grad_norm": 1.421875, "learning_rate": 0.0003458927999529861, "loss": 5.0225, "mean_token_accuracy": 0.21085150092840194, "num_tokens": 89761527.0, "step": 51750 }, { "entropy": 5.950730848312378, "epoch": 4.026687414899825, "grad_norm": 1.390625, "learning_rate": 0.00034586649550964656, "loss": 4.9801, "mean_token_accuracy": 0.20928021073341369, "num_tokens": 89771524.0, "step": 51755 }, { "entropy": 5.884275245666504, "epoch": 4.027076444271542, "grad_norm": 1.484375, "learning_rate": 0.00034584018999102073, "loss": 4.9323, "mean_token_accuracy": 0.21991979479789733, "num_tokens": 89779664.0, "step": 51760 }, { "entropy": 5.990915679931641, "epoch": 4.02746547364326, "grad_norm": 1.328125, "learning_rate": 0.00034581388339750775, "loss": 5.1526, "mean_token_accuracy": 0.2040310189127922, "num_tokens": 89787984.0, "step": 51765 }, { "entropy": 5.892055606842041, "epoch": 4.027854503014978, "grad_norm": 1.40625, "learning_rate": 0.0003457875757295067, "loss": 4.971, "mean_token_accuracy": 0.2088671639561653, "num_tokens": 89796175.0, "step": 51770 }, { "entropy": 6.022421360015869, "epoch": 4.028243532386695, "grad_norm": 1.4375, "learning_rate": 0.00034576126698741697, "loss": 5.1434, "mean_token_accuracy": 0.20306421518325807, "num_tokens": 89804947.0, "step": 51775 }, { "entropy": 5.892018985748291, "epoch": 4.028632561758413, "grad_norm": 1.34375, "learning_rate": 0.0003457349571716376, "loss": 5.0065, "mean_token_accuracy": 0.2099792927503586, "num_tokens": 89812947.0, "step": 51780 }, { "entropy": 5.858810138702393, "epoch": 4.02902159113013, "grad_norm": 1.34375, "learning_rate": 0.00034570864628256795, "loss": 4.9224, "mean_token_accuracy": 0.21623849123716354, "num_tokens": 89821897.0, "step": 51785 }, { "entropy": 5.921432781219482, "epoch": 4.029410620501848, "grad_norm": 1.3828125, "learning_rate": 0.00034568233432060705, "loss": 4.9998, "mean_token_accuracy": 0.21561850160360335, "num_tokens": 89830690.0, "step": 51790 }, { "entropy": 5.925419330596924, "epoch": 4.029799649873565, "grad_norm": 1.5546875, "learning_rate": 0.0003456560212861543, "loss": 4.9733, "mean_token_accuracy": 0.21075913459062576, "num_tokens": 89839494.0, "step": 51795 }, { "entropy": 5.865956878662109, "epoch": 4.030188679245283, "grad_norm": 1.4453125, "learning_rate": 0.0003456297071796087, "loss": 4.8429, "mean_token_accuracy": 0.22570459991693498, "num_tokens": 89848450.0, "step": 51800 }, { "entropy": 5.814689588546753, "epoch": 4.030577708617001, "grad_norm": 1.328125, "learning_rate": 0.00034560339200136983, "loss": 4.9046, "mean_token_accuracy": 0.21962074637413026, "num_tokens": 89856950.0, "step": 51805 }, { "entropy": 5.813710451126099, "epoch": 4.030966737988718, "grad_norm": 1.421875, "learning_rate": 0.00034557707575183684, "loss": 4.8698, "mean_token_accuracy": 0.22321503162384032, "num_tokens": 89865889.0, "step": 51810 }, { "entropy": 5.92737979888916, "epoch": 4.031355767360436, "grad_norm": 1.3359375, "learning_rate": 0.00034555075843140917, "loss": 4.9162, "mean_token_accuracy": 0.22035107910633087, "num_tokens": 89874275.0, "step": 51815 }, { "entropy": 5.93666090965271, "epoch": 4.031744796732153, "grad_norm": 1.453125, "learning_rate": 0.00034552444004048587, "loss": 5.0054, "mean_token_accuracy": 0.21510865539312363, "num_tokens": 89882975.0, "step": 51820 }, { "entropy": 5.860597038269043, "epoch": 4.032133826103871, "grad_norm": 1.34375, "learning_rate": 0.00034549812057946657, "loss": 4.9557, "mean_token_accuracy": 0.21119217574596405, "num_tokens": 89892111.0, "step": 51825 }, { "entropy": 5.8945800304412845, "epoch": 4.032522855475588, "grad_norm": 1.375, "learning_rate": 0.0003454718000487505, "loss": 4.972, "mean_token_accuracy": 0.21828320473432541, "num_tokens": 89900731.0, "step": 51830 }, { "entropy": 5.91560959815979, "epoch": 4.032911884847306, "grad_norm": 1.296875, "learning_rate": 0.0003454454784487369, "loss": 4.9584, "mean_token_accuracy": 0.21158554702997207, "num_tokens": 89909360.0, "step": 51835 }, { "entropy": 5.959977006912231, "epoch": 4.033300914219024, "grad_norm": 1.4453125, "learning_rate": 0.0003454191557798254, "loss": 5.0078, "mean_token_accuracy": 0.20687488466501236, "num_tokens": 89917425.0, "step": 51840 }, { "entropy": 5.957312440872192, "epoch": 4.033689943590741, "grad_norm": 1.3359375, "learning_rate": 0.00034539283204241525, "loss": 5.0671, "mean_token_accuracy": 0.20787511467933656, "num_tokens": 89926385.0, "step": 51845 }, { "entropy": 5.951608943939209, "epoch": 4.034078972962459, "grad_norm": 1.421875, "learning_rate": 0.00034536650723690596, "loss": 4.9151, "mean_token_accuracy": 0.21929338425397873, "num_tokens": 89935485.0, "step": 51850 }, { "entropy": 5.948643779754638, "epoch": 4.034468002334176, "grad_norm": 1.296875, "learning_rate": 0.00034534018136369687, "loss": 4.9384, "mean_token_accuracy": 0.21792497634887695, "num_tokens": 89943736.0, "step": 51855 }, { "entropy": 5.787169504165649, "epoch": 4.034857031705894, "grad_norm": 1.4296875, "learning_rate": 0.0003453138544231875, "loss": 4.864, "mean_token_accuracy": 0.22355013489723205, "num_tokens": 89952352.0, "step": 51860 }, { "entropy": 5.881773519515991, "epoch": 4.035246061077611, "grad_norm": 1.390625, "learning_rate": 0.0003452875264157774, "loss": 4.9452, "mean_token_accuracy": 0.2107370138168335, "num_tokens": 89960485.0, "step": 51865 }, { "entropy": 5.883715534210205, "epoch": 4.035635090449329, "grad_norm": 1.34375, "learning_rate": 0.00034526119734186586, "loss": 4.9266, "mean_token_accuracy": 0.21434458941221238, "num_tokens": 89969395.0, "step": 51870 }, { "entropy": 5.927192735671997, "epoch": 4.036024119821047, "grad_norm": 1.3828125, "learning_rate": 0.00034523486720185246, "loss": 4.9478, "mean_token_accuracy": 0.2138140991330147, "num_tokens": 89978078.0, "step": 51875 }, { "entropy": 5.908332061767578, "epoch": 4.036413149192764, "grad_norm": 1.296875, "learning_rate": 0.00034520853599613675, "loss": 4.9564, "mean_token_accuracy": 0.2150764063000679, "num_tokens": 89986294.0, "step": 51880 }, { "entropy": 5.9305031299591064, "epoch": 4.036802178564481, "grad_norm": 1.3671875, "learning_rate": 0.00034518220372511835, "loss": 4.9657, "mean_token_accuracy": 0.208026622235775, "num_tokens": 89994124.0, "step": 51885 }, { "entropy": 5.872569942474366, "epoch": 4.037191207936199, "grad_norm": 1.40625, "learning_rate": 0.0003451558703891967, "loss": 4.8988, "mean_token_accuracy": 0.2195541650056839, "num_tokens": 90002624.0, "step": 51890 }, { "entropy": 5.9115403175354, "epoch": 4.037580237307917, "grad_norm": 1.3828125, "learning_rate": 0.0003451295359887713, "loss": 4.9142, "mean_token_accuracy": 0.2196933165192604, "num_tokens": 90012073.0, "step": 51895 }, { "entropy": 5.958462858200074, "epoch": 4.037969266679634, "grad_norm": 1.375, "learning_rate": 0.0003451032005242418, "loss": 4.9446, "mean_token_accuracy": 0.2085406392812729, "num_tokens": 90020790.0, "step": 51900 }, { "entropy": 5.89507303237915, "epoch": 4.038358296051352, "grad_norm": 1.484375, "learning_rate": 0.00034507686399600786, "loss": 4.911, "mean_token_accuracy": 0.21860469430685042, "num_tokens": 90029318.0, "step": 51905 }, { "entropy": 5.892300939559936, "epoch": 4.03874732542307, "grad_norm": 1.375, "learning_rate": 0.00034505052640446907, "loss": 4.9064, "mean_token_accuracy": 0.22318902909755706, "num_tokens": 90037419.0, "step": 51910 }, { "entropy": 5.877291536331176, "epoch": 4.039136354794787, "grad_norm": 1.3671875, "learning_rate": 0.000345024187750025, "loss": 4.9424, "mean_token_accuracy": 0.21932954341173172, "num_tokens": 90045806.0, "step": 51915 }, { "entropy": 5.898646831512451, "epoch": 4.039525384166504, "grad_norm": 1.4453125, "learning_rate": 0.00034499784803307534, "loss": 4.8863, "mean_token_accuracy": 0.2210891529917717, "num_tokens": 90053969.0, "step": 51920 }, { "entropy": 5.8642332553863525, "epoch": 4.039914413538222, "grad_norm": 1.2890625, "learning_rate": 0.0003449715072540198, "loss": 4.8808, "mean_token_accuracy": 0.22469929605722427, "num_tokens": 90063310.0, "step": 51925 }, { "entropy": 5.834958457946778, "epoch": 4.04030344290994, "grad_norm": 1.765625, "learning_rate": 0.00034494516541325795, "loss": 5.0029, "mean_token_accuracy": 0.21384450048208237, "num_tokens": 90072315.0, "step": 51930 }, { "entropy": 5.791952466964721, "epoch": 4.040692472281657, "grad_norm": 1.4453125, "learning_rate": 0.0003449188225111895, "loss": 4.7957, "mean_token_accuracy": 0.22513895779848098, "num_tokens": 90079817.0, "step": 51935 }, { "entropy": 5.893533563613891, "epoch": 4.041081501653375, "grad_norm": 1.2578125, "learning_rate": 0.00034489247854821426, "loss": 4.9791, "mean_token_accuracy": 0.20553414821624755, "num_tokens": 90089188.0, "step": 51940 }, { "entropy": 5.92146863937378, "epoch": 4.041470531025093, "grad_norm": 1.5859375, "learning_rate": 0.00034486613352473195, "loss": 4.9529, "mean_token_accuracy": 0.2129001185297966, "num_tokens": 90098186.0, "step": 51945 }, { "entropy": 5.811070394515991, "epoch": 4.04185956039681, "grad_norm": 1.4140625, "learning_rate": 0.00034483978744114224, "loss": 4.8376, "mean_token_accuracy": 0.2223162680864334, "num_tokens": 90106136.0, "step": 51950 }, { "entropy": 5.860670137405395, "epoch": 4.042248589768527, "grad_norm": 1.4140625, "learning_rate": 0.0003448134402978449, "loss": 4.9326, "mean_token_accuracy": 0.21533261388540267, "num_tokens": 90114754.0, "step": 51955 }, { "entropy": 5.875341939926147, "epoch": 4.042637619140245, "grad_norm": 1.421875, "learning_rate": 0.00034478709209523974, "loss": 4.9078, "mean_token_accuracy": 0.21165003180503844, "num_tokens": 90122994.0, "step": 51960 }, { "entropy": 5.996651124954224, "epoch": 4.043026648511963, "grad_norm": 1.3671875, "learning_rate": 0.0003447607428337265, "loss": 5.0645, "mean_token_accuracy": 0.20892146825790406, "num_tokens": 90132083.0, "step": 51965 }, { "entropy": 5.884886360168457, "epoch": 4.04341567788368, "grad_norm": 1.5234375, "learning_rate": 0.00034473439251370505, "loss": 4.857, "mean_token_accuracy": 0.21886216402053832, "num_tokens": 90140790.0, "step": 51970 }, { "entropy": 5.806748867034912, "epoch": 4.043804707255398, "grad_norm": 1.40625, "learning_rate": 0.0003447080411355752, "loss": 4.8206, "mean_token_accuracy": 0.22117093354463577, "num_tokens": 90149023.0, "step": 51975 }, { "entropy": 5.934732437133789, "epoch": 4.044193736627116, "grad_norm": 1.453125, "learning_rate": 0.00034468168869973673, "loss": 5.0283, "mean_token_accuracy": 0.20419780015945435, "num_tokens": 90157274.0, "step": 51980 }, { "entropy": 5.870685195922851, "epoch": 4.0445827659988325, "grad_norm": 1.3046875, "learning_rate": 0.00034465533520658967, "loss": 4.9694, "mean_token_accuracy": 0.21150976419448853, "num_tokens": 90166374.0, "step": 51985 }, { "entropy": 5.897975206375122, "epoch": 4.04497179537055, "grad_norm": 1.3125, "learning_rate": 0.00034462898065653366, "loss": 4.9395, "mean_token_accuracy": 0.2129041776061058, "num_tokens": 90175191.0, "step": 51990 }, { "entropy": 5.907422780990601, "epoch": 4.045360824742268, "grad_norm": 1.484375, "learning_rate": 0.0003446026250499687, "loss": 4.9986, "mean_token_accuracy": 0.20995161384344102, "num_tokens": 90183637.0, "step": 51995 }, { "entropy": 5.960235595703125, "epoch": 4.045749854113986, "grad_norm": 1.421875, "learning_rate": 0.0003445762683872946, "loss": 4.9627, "mean_token_accuracy": 0.21673441529273987, "num_tokens": 90192258.0, "step": 52000 }, { "entropy": 6.014357423782348, "epoch": 4.046138883485703, "grad_norm": 1.2890625, "learning_rate": 0.0003445499106689115, "loss": 5.0449, "mean_token_accuracy": 0.21231255382299424, "num_tokens": 90201154.0, "step": 52005 }, { "entropy": 5.8809507369995115, "epoch": 4.046527912857421, "grad_norm": 1.3828125, "learning_rate": 0.00034452355189521915, "loss": 4.86, "mean_token_accuracy": 0.2281960055232048, "num_tokens": 90209343.0, "step": 52010 }, { "entropy": 5.9388152122497555, "epoch": 4.046916942229139, "grad_norm": 1.3828125, "learning_rate": 0.0003444971920666176, "loss": 4.9741, "mean_token_accuracy": 0.2047293797135353, "num_tokens": 90217689.0, "step": 52015 }, { "entropy": 5.919192218780518, "epoch": 4.0473059716008555, "grad_norm": 1.3125, "learning_rate": 0.0003444708311835068, "loss": 4.9818, "mean_token_accuracy": 0.21262185275554657, "num_tokens": 90226855.0, "step": 52020 }, { "entropy": 5.852221345901489, "epoch": 4.047695000972573, "grad_norm": 1.375, "learning_rate": 0.00034444446924628664, "loss": 4.9001, "mean_token_accuracy": 0.22046876400709153, "num_tokens": 90236555.0, "step": 52025 }, { "entropy": 5.995780181884766, "epoch": 4.048084030344291, "grad_norm": 1.4140625, "learning_rate": 0.00034441810625535725, "loss": 5.0652, "mean_token_accuracy": 0.198277547955513, "num_tokens": 90245801.0, "step": 52030 }, { "entropy": 5.953625965118408, "epoch": 4.048473059716009, "grad_norm": 1.3828125, "learning_rate": 0.0003443917422111185, "loss": 4.9388, "mean_token_accuracy": 0.20780290216207503, "num_tokens": 90253892.0, "step": 52035 }, { "entropy": 5.919342517852783, "epoch": 4.048862089087726, "grad_norm": 1.3671875, "learning_rate": 0.00034436537711397054, "loss": 4.9994, "mean_token_accuracy": 0.2163647249341011, "num_tokens": 90263245.0, "step": 52040 }, { "entropy": 5.875862884521484, "epoch": 4.049251118459444, "grad_norm": 1.3046875, "learning_rate": 0.0003443390109643134, "loss": 4.9426, "mean_token_accuracy": 0.21816371977329255, "num_tokens": 90271813.0, "step": 52045 }, { "entropy": 5.884547376632691, "epoch": 4.049640147831162, "grad_norm": 1.5, "learning_rate": 0.0003443126437625472, "loss": 4.986, "mean_token_accuracy": 0.21461054384708406, "num_tokens": 90280682.0, "step": 52050 }, { "entropy": 5.922876644134521, "epoch": 4.0500291772028785, "grad_norm": 1.3203125, "learning_rate": 0.0003442862755090719, "loss": 4.9417, "mean_token_accuracy": 0.21894809305667878, "num_tokens": 90289054.0, "step": 52055 }, { "entropy": 5.8500096797943115, "epoch": 4.050418206574596, "grad_norm": 1.3984375, "learning_rate": 0.00034425990620428763, "loss": 4.9043, "mean_token_accuracy": 0.21728812009096146, "num_tokens": 90297636.0, "step": 52060 }, { "entropy": 5.870144462585449, "epoch": 4.050807235946314, "grad_norm": 1.5546875, "learning_rate": 0.0003442335358485946, "loss": 4.9708, "mean_token_accuracy": 0.21283353865146637, "num_tokens": 90306653.0, "step": 52065 }, { "entropy": 6.007606124877929, "epoch": 4.051196265318032, "grad_norm": 1.3125, "learning_rate": 0.0003442071644423928, "loss": 5.1365, "mean_token_accuracy": 0.20033505707979202, "num_tokens": 90316325.0, "step": 52070 }, { "entropy": 5.913882637023926, "epoch": 4.051585294689749, "grad_norm": 1.296875, "learning_rate": 0.0003441807919860824, "loss": 4.9927, "mean_token_accuracy": 0.2099497362971306, "num_tokens": 90325559.0, "step": 52075 }, { "entropy": 5.934242296218872, "epoch": 4.051974324061467, "grad_norm": 1.4609375, "learning_rate": 0.00034415441848006364, "loss": 4.9643, "mean_token_accuracy": 0.21674539744853974, "num_tokens": 90333908.0, "step": 52080 }, { "entropy": 5.961170768737793, "epoch": 4.052363353433184, "grad_norm": 1.453125, "learning_rate": 0.00034412804392473665, "loss": 4.967, "mean_token_accuracy": 0.21664415150880814, "num_tokens": 90342442.0, "step": 52085 }, { "entropy": 5.815949535369873, "epoch": 4.0527523828049015, "grad_norm": 1.3046875, "learning_rate": 0.0003441016683205016, "loss": 4.8514, "mean_token_accuracy": 0.2209737092256546, "num_tokens": 90351320.0, "step": 52090 }, { "entropy": 5.817745685577393, "epoch": 4.053141412176619, "grad_norm": 1.4375, "learning_rate": 0.00034407529166775874, "loss": 4.8367, "mean_token_accuracy": 0.2221623659133911, "num_tokens": 90359867.0, "step": 52095 }, { "entropy": 5.86921501159668, "epoch": 4.053530441548337, "grad_norm": 1.4296875, "learning_rate": 0.0003440489139669083, "loss": 4.922, "mean_token_accuracy": 0.21708546578884125, "num_tokens": 90369433.0, "step": 52100 }, { "entropy": 5.887403249740601, "epoch": 4.053919470920055, "grad_norm": 1.34375, "learning_rate": 0.00034402253521835036, "loss": 4.8751, "mean_token_accuracy": 0.2166532412171364, "num_tokens": 90379055.0, "step": 52105 }, { "entropy": 5.904199075698853, "epoch": 4.054308500291772, "grad_norm": 1.5390625, "learning_rate": 0.0003439961554224855, "loss": 4.9681, "mean_token_accuracy": 0.20952796339988708, "num_tokens": 90387478.0, "step": 52110 }, { "entropy": 5.920164632797241, "epoch": 4.05469752966349, "grad_norm": 1.390625, "learning_rate": 0.0003439697745797137, "loss": 4.9239, "mean_token_accuracy": 0.2136171743273735, "num_tokens": 90396267.0, "step": 52115 }, { "entropy": 5.839287519454956, "epoch": 4.055086559035207, "grad_norm": 1.921875, "learning_rate": 0.00034394339269043533, "loss": 4.885, "mean_token_accuracy": 0.2294818639755249, "num_tokens": 90405351.0, "step": 52120 }, { "entropy": 5.923763561248779, "epoch": 4.0554755884069245, "grad_norm": 1.421875, "learning_rate": 0.0003439170097550507, "loss": 5.0134, "mean_token_accuracy": 0.21471408158540725, "num_tokens": 90413446.0, "step": 52125 }, { "entropy": 5.928883171081543, "epoch": 4.055864617778642, "grad_norm": 1.359375, "learning_rate": 0.0003438906257739602, "loss": 4.9897, "mean_token_accuracy": 0.21087175011634826, "num_tokens": 90421870.0, "step": 52130 }, { "entropy": 5.970314025878906, "epoch": 4.05625364715036, "grad_norm": 1.3671875, "learning_rate": 0.0003438642407475641, "loss": 5.0405, "mean_token_accuracy": 0.21086794883012772, "num_tokens": 90430229.0, "step": 52135 }, { "entropy": 5.965768432617187, "epoch": 4.0566426765220776, "grad_norm": 1.3671875, "learning_rate": 0.0003438378546762627, "loss": 5.0137, "mean_token_accuracy": 0.210268434882164, "num_tokens": 90439205.0, "step": 52140 }, { "entropy": 5.948880577087403, "epoch": 4.057031705893795, "grad_norm": 1.3828125, "learning_rate": 0.0003438114675604565, "loss": 4.9867, "mean_token_accuracy": 0.20920566320419312, "num_tokens": 90447038.0, "step": 52145 }, { "entropy": 5.853871488571167, "epoch": 4.057420735265513, "grad_norm": 1.3671875, "learning_rate": 0.0003437850794005457, "loss": 4.8942, "mean_token_accuracy": 0.21822089403867723, "num_tokens": 90455231.0, "step": 52150 }, { "entropy": 5.872321128845215, "epoch": 4.05780976463723, "grad_norm": 1.4453125, "learning_rate": 0.0003437586901969309, "loss": 4.9409, "mean_token_accuracy": 0.2098012775182724, "num_tokens": 90464900.0, "step": 52155 }, { "entropy": 5.9274921894073485, "epoch": 4.0581987940089475, "grad_norm": 1.421875, "learning_rate": 0.0003437322999500124, "loss": 4.9914, "mean_token_accuracy": 0.2078676387667656, "num_tokens": 90474354.0, "step": 52160 }, { "entropy": 5.846142911911011, "epoch": 4.058587823380665, "grad_norm": 1.296875, "learning_rate": 0.00034370590866019063, "loss": 4.9292, "mean_token_accuracy": 0.21790043711662294, "num_tokens": 90482884.0, "step": 52165 }, { "entropy": 5.859018421173095, "epoch": 4.058976852752383, "grad_norm": 1.4921875, "learning_rate": 0.000343679516327866, "loss": 5.0037, "mean_token_accuracy": 0.20999144911766052, "num_tokens": 90491626.0, "step": 52170 }, { "entropy": 5.883349084854126, "epoch": 4.0593658821241005, "grad_norm": 1.453125, "learning_rate": 0.0003436531229534391, "loss": 4.915, "mean_token_accuracy": 0.21653378158807754, "num_tokens": 90499686.0, "step": 52175 }, { "entropy": 5.868328475952149, "epoch": 4.059754911495818, "grad_norm": 1.359375, "learning_rate": 0.0003436267285373103, "loss": 4.9302, "mean_token_accuracy": 0.2137988477945328, "num_tokens": 90508523.0, "step": 52180 }, { "entropy": 5.929788732528687, "epoch": 4.060143940867536, "grad_norm": 1.328125, "learning_rate": 0.00034360033307988014, "loss": 4.9193, "mean_token_accuracy": 0.22054191082715988, "num_tokens": 90517383.0, "step": 52185 }, { "entropy": 5.9340404033660885, "epoch": 4.060532970239253, "grad_norm": 1.34375, "learning_rate": 0.00034357393658154914, "loss": 5.0021, "mean_token_accuracy": 0.2118535116314888, "num_tokens": 90526052.0, "step": 52190 }, { "entropy": 5.943279170989991, "epoch": 4.0609219996109704, "grad_norm": 1.3515625, "learning_rate": 0.0003435475390427178, "loss": 5.0152, "mean_token_accuracy": 0.20467731207609177, "num_tokens": 90535521.0, "step": 52195 }, { "entropy": 5.925900602340699, "epoch": 4.061311028982688, "grad_norm": 1.5, "learning_rate": 0.00034352114046378655, "loss": 4.9396, "mean_token_accuracy": 0.2136240139603615, "num_tokens": 90544660.0, "step": 52200 }, { "entropy": 5.87631573677063, "epoch": 4.061700058354406, "grad_norm": 1.4453125, "learning_rate": 0.00034349474084515607, "loss": 4.9491, "mean_token_accuracy": 0.22159697711467743, "num_tokens": 90553648.0, "step": 52205 }, { "entropy": 5.886921977996826, "epoch": 4.0620890877261235, "grad_norm": 1.421875, "learning_rate": 0.00034346834018722706, "loss": 4.9893, "mean_token_accuracy": 0.205280601978302, "num_tokens": 90561819.0, "step": 52210 }, { "entropy": 5.888171720504761, "epoch": 4.062478117097841, "grad_norm": 1.3359375, "learning_rate": 0.00034344193849039997, "loss": 4.9881, "mean_token_accuracy": 0.2101266413927078, "num_tokens": 90570599.0, "step": 52215 }, { "entropy": 5.874212026596069, "epoch": 4.062867146469558, "grad_norm": 1.4296875, "learning_rate": 0.0003434155357550753, "loss": 5.0028, "mean_token_accuracy": 0.2181297391653061, "num_tokens": 90579620.0, "step": 52220 }, { "entropy": 5.926593542098999, "epoch": 4.063256175841276, "grad_norm": 1.25, "learning_rate": 0.00034338913198165373, "loss": 4.9812, "mean_token_accuracy": 0.2083246111869812, "num_tokens": 90589355.0, "step": 52225 }, { "entropy": 5.855221319198608, "epoch": 4.063645205212993, "grad_norm": 1.46875, "learning_rate": 0.000343362727170536, "loss": 4.9277, "mean_token_accuracy": 0.214627043902874, "num_tokens": 90597371.0, "step": 52230 }, { "entropy": 5.886782693862915, "epoch": 4.064034234584711, "grad_norm": 1.359375, "learning_rate": 0.0003433363213221227, "loss": 4.9418, "mean_token_accuracy": 0.21431716084480285, "num_tokens": 90606252.0, "step": 52235 }, { "entropy": 5.930133533477783, "epoch": 4.064423263956429, "grad_norm": 1.3203125, "learning_rate": 0.00034330991443681444, "loss": 4.917, "mean_token_accuracy": 0.21605076044797897, "num_tokens": 90614691.0, "step": 52240 }, { "entropy": 5.932524824142456, "epoch": 4.0648122933281465, "grad_norm": 1.4609375, "learning_rate": 0.000343283506515012, "loss": 4.9533, "mean_token_accuracy": 0.2125212848186493, "num_tokens": 90622711.0, "step": 52245 }, { "entropy": 5.934361267089844, "epoch": 4.065201322699864, "grad_norm": 1.375, "learning_rate": 0.00034325709755711606, "loss": 5.0172, "mean_token_accuracy": 0.20878956019878386, "num_tokens": 90631490.0, "step": 52250 }, { "entropy": 5.87332239151001, "epoch": 4.065590352071581, "grad_norm": 1.3828125, "learning_rate": 0.00034323068756352725, "loss": 4.8829, "mean_token_accuracy": 0.2188686177134514, "num_tokens": 90640022.0, "step": 52255 }, { "entropy": 5.821243524551392, "epoch": 4.065979381443299, "grad_norm": 1.4140625, "learning_rate": 0.0003432042765346464, "loss": 4.8268, "mean_token_accuracy": 0.2282026842236519, "num_tokens": 90648589.0, "step": 52260 }, { "entropy": 5.899890518188476, "epoch": 4.066368410815016, "grad_norm": 1.4453125, "learning_rate": 0.0003431778644708742, "loss": 4.9647, "mean_token_accuracy": 0.2132944092154503, "num_tokens": 90657426.0, "step": 52265 }, { "entropy": 5.879000043869018, "epoch": 4.066757440186734, "grad_norm": 1.296875, "learning_rate": 0.0003431514513726114, "loss": 4.9568, "mean_token_accuracy": 0.20911829471588134, "num_tokens": 90665445.0, "step": 52270 }, { "entropy": 5.914884042739868, "epoch": 4.067146469558452, "grad_norm": 1.4765625, "learning_rate": 0.0003431250372402588, "loss": 4.9873, "mean_token_accuracy": 0.21387426257133485, "num_tokens": 90674442.0, "step": 52275 }, { "entropy": 5.957050561904907, "epoch": 4.0675354989301695, "grad_norm": 1.390625, "learning_rate": 0.00034309862207421724, "loss": 5.0187, "mean_token_accuracy": 0.20510548800230027, "num_tokens": 90682907.0, "step": 52280 }, { "entropy": 5.948835563659668, "epoch": 4.067924528301887, "grad_norm": 1.4296875, "learning_rate": 0.00034307220587488743, "loss": 4.988, "mean_token_accuracy": 0.20683171302080156, "num_tokens": 90691842.0, "step": 52285 }, { "entropy": 5.8799725532531735, "epoch": 4.068313557673604, "grad_norm": 1.46875, "learning_rate": 0.00034304578864267026, "loss": 4.9009, "mean_token_accuracy": 0.21437583416700362, "num_tokens": 90700480.0, "step": 52290 }, { "entropy": 5.94196720123291, "epoch": 4.068702587045322, "grad_norm": 1.4296875, "learning_rate": 0.00034301937037796654, "loss": 5.0397, "mean_token_accuracy": 0.21065893024206161, "num_tokens": 90709822.0, "step": 52295 }, { "entropy": 5.9230893611907955, "epoch": 4.069091616417039, "grad_norm": 1.3828125, "learning_rate": 0.00034299295108117716, "loss": 5.0463, "mean_token_accuracy": 0.20771856158971785, "num_tokens": 90718432.0, "step": 52300 }, { "entropy": 5.86773362159729, "epoch": 4.069480645788757, "grad_norm": 1.25, "learning_rate": 0.00034296653075270296, "loss": 5.0007, "mean_token_accuracy": 0.210592183470726, "num_tokens": 90727318.0, "step": 52305 }, { "entropy": 5.925537109375, "epoch": 4.069869675160475, "grad_norm": 1.46875, "learning_rate": 0.00034294010939294486, "loss": 4.9284, "mean_token_accuracy": 0.21462321728467942, "num_tokens": 90735864.0, "step": 52310 }, { "entropy": 5.867591476440429, "epoch": 4.0702587045321925, "grad_norm": 1.40625, "learning_rate": 0.00034291368700230376, "loss": 4.8772, "mean_token_accuracy": 0.21418919861316682, "num_tokens": 90744600.0, "step": 52315 }, { "entropy": 5.960395097732544, "epoch": 4.070647733903909, "grad_norm": 1.359375, "learning_rate": 0.0003428872635811804, "loss": 5.0189, "mean_token_accuracy": 0.2099539503455162, "num_tokens": 90753409.0, "step": 52320 }, { "entropy": 5.915169191360474, "epoch": 4.071036763275627, "grad_norm": 1.3515625, "learning_rate": 0.000342860839129976, "loss": 4.913, "mean_token_accuracy": 0.21352265924215316, "num_tokens": 90762583.0, "step": 52325 }, { "entropy": 5.995546483993531, "epoch": 4.071425792647345, "grad_norm": 1.515625, "learning_rate": 0.0003428344136490914, "loss": 5.0652, "mean_token_accuracy": 0.2130970135331154, "num_tokens": 90771270.0, "step": 52330 }, { "entropy": 5.891939401626587, "epoch": 4.071814822019062, "grad_norm": 1.375, "learning_rate": 0.00034280798713892744, "loss": 4.9923, "mean_token_accuracy": 0.21517182141542435, "num_tokens": 90780414.0, "step": 52335 }, { "entropy": 5.895632600784301, "epoch": 4.07220385139078, "grad_norm": 1.4296875, "learning_rate": 0.0003427815595998853, "loss": 5.0382, "mean_token_accuracy": 0.2129811942577362, "num_tokens": 90789688.0, "step": 52340 }, { "entropy": 5.932392883300781, "epoch": 4.072592880762498, "grad_norm": 1.421875, "learning_rate": 0.0003427551310323658, "loss": 5.0233, "mean_token_accuracy": 0.20880593955516816, "num_tokens": 90798690.0, "step": 52345 }, { "entropy": 5.905458784103393, "epoch": 4.0729819101342155, "grad_norm": 1.453125, "learning_rate": 0.00034272870143677015, "loss": 4.885, "mean_token_accuracy": 0.2222653791308403, "num_tokens": 90806642.0, "step": 52350 }, { "entropy": 5.8652630805969235, "epoch": 4.073370939505932, "grad_norm": 1.484375, "learning_rate": 0.00034270227081349913, "loss": 4.9939, "mean_token_accuracy": 0.20596519261598586, "num_tokens": 90814836.0, "step": 52355 }, { "entropy": 5.890783452987671, "epoch": 4.07375996887765, "grad_norm": 1.359375, "learning_rate": 0.000342675839162954, "loss": 5.0195, "mean_token_accuracy": 0.21460380256175995, "num_tokens": 90823760.0, "step": 52360 }, { "entropy": 5.906784439086914, "epoch": 4.074148998249368, "grad_norm": 1.3515625, "learning_rate": 0.00034264940648553565, "loss": 4.9734, "mean_token_accuracy": 0.2226565584540367, "num_tokens": 90832588.0, "step": 52365 }, { "entropy": 5.908009243011475, "epoch": 4.074538027621085, "grad_norm": 1.34375, "learning_rate": 0.0003426229727816453, "loss": 4.9544, "mean_token_accuracy": 0.2203405722975731, "num_tokens": 90841289.0, "step": 52370 }, { "entropy": 5.860874605178833, "epoch": 4.074927056992803, "grad_norm": 1.421875, "learning_rate": 0.0003425965380516839, "loss": 4.9367, "mean_token_accuracy": 0.21664959341287612, "num_tokens": 90850180.0, "step": 52375 }, { "entropy": 5.897396087646484, "epoch": 4.075316086364521, "grad_norm": 1.5, "learning_rate": 0.0003425701022960527, "loss": 5.032, "mean_token_accuracy": 0.20738847255706788, "num_tokens": 90858503.0, "step": 52380 }, { "entropy": 5.892825794219971, "epoch": 4.0757051157362385, "grad_norm": 1.4453125, "learning_rate": 0.00034254366551515276, "loss": 4.9518, "mean_token_accuracy": 0.21447215974330902, "num_tokens": 90866834.0, "step": 52385 }, { "entropy": 5.991115140914917, "epoch": 4.076094145107955, "grad_norm": 1.4375, "learning_rate": 0.0003425172277093852, "loss": 5.0702, "mean_token_accuracy": 0.2106425344944, "num_tokens": 90875166.0, "step": 52390 }, { "entropy": 5.942475700378418, "epoch": 4.076483174479673, "grad_norm": 1.3984375, "learning_rate": 0.000342490788879151, "loss": 4.8872, "mean_token_accuracy": 0.22466082870960236, "num_tokens": 90883447.0, "step": 52395 }, { "entropy": 5.889201879501343, "epoch": 4.076872203851391, "grad_norm": 1.3359375, "learning_rate": 0.00034246434902485156, "loss": 4.9388, "mean_token_accuracy": 0.21718860864639283, "num_tokens": 90892218.0, "step": 52400 }, { "entropy": 5.90369143486023, "epoch": 4.077261233223108, "grad_norm": 1.4765625, "learning_rate": 0.00034243790814688816, "loss": 5.0037, "mean_token_accuracy": 0.20884954184293747, "num_tokens": 90900834.0, "step": 52405 }, { "entropy": 5.9149556159973145, "epoch": 4.077650262594826, "grad_norm": 1.3203125, "learning_rate": 0.00034241146624566175, "loss": 5.0261, "mean_token_accuracy": 0.2133224129676819, "num_tokens": 90909902.0, "step": 52410 }, { "entropy": 5.903930139541626, "epoch": 4.078039291966544, "grad_norm": 1.34375, "learning_rate": 0.0003423850233215737, "loss": 4.902, "mean_token_accuracy": 0.21740110963582993, "num_tokens": 90918339.0, "step": 52415 }, { "entropy": 5.861764574050904, "epoch": 4.078428321338261, "grad_norm": 1.484375, "learning_rate": 0.0003423585793750251, "loss": 4.7951, "mean_token_accuracy": 0.23406800478696824, "num_tokens": 90927226.0, "step": 52420 }, { "entropy": 5.8558708190917965, "epoch": 4.078817350709978, "grad_norm": 1.3671875, "learning_rate": 0.00034233213440641724, "loss": 4.8983, "mean_token_accuracy": 0.22018247246742248, "num_tokens": 90935222.0, "step": 52425 }, { "entropy": 5.876427173614502, "epoch": 4.079206380081696, "grad_norm": 1.4296875, "learning_rate": 0.00034230568841615145, "loss": 4.9234, "mean_token_accuracy": 0.21340503990650178, "num_tokens": 90943492.0, "step": 52430 }, { "entropy": 5.92194447517395, "epoch": 4.079595409453414, "grad_norm": 1.5078125, "learning_rate": 0.000342279241404629, "loss": 5.0139, "mean_token_accuracy": 0.2157876193523407, "num_tokens": 90952715.0, "step": 52435 }, { "entropy": 6.006902027130127, "epoch": 4.079984438825131, "grad_norm": 1.390625, "learning_rate": 0.00034225279337225106, "loss": 5.0706, "mean_token_accuracy": 0.2130955696105957, "num_tokens": 90962488.0, "step": 52440 }, { "entropy": 5.9346466064453125, "epoch": 4.080373468196849, "grad_norm": 1.3046875, "learning_rate": 0.0003422263443194191, "loss": 4.9833, "mean_token_accuracy": 0.2131215363740921, "num_tokens": 90971580.0, "step": 52445 }, { "entropy": 5.877329111099243, "epoch": 4.080762497568567, "grad_norm": 1.40625, "learning_rate": 0.0003421998942465344, "loss": 4.9456, "mean_token_accuracy": 0.20889061987400054, "num_tokens": 90980743.0, "step": 52450 }, { "entropy": 5.866905641555786, "epoch": 4.081151526940284, "grad_norm": 1.4375, "learning_rate": 0.00034217344315399823, "loss": 4.8808, "mean_token_accuracy": 0.2173201024532318, "num_tokens": 90989857.0, "step": 52455 }, { "entropy": 5.9375217914581295, "epoch": 4.081540556312001, "grad_norm": 1.515625, "learning_rate": 0.000342146991042212, "loss": 4.941, "mean_token_accuracy": 0.21729382872581482, "num_tokens": 90998261.0, "step": 52460 }, { "entropy": 5.947642707824707, "epoch": 4.081929585683719, "grad_norm": 1.6171875, "learning_rate": 0.00034212053791157695, "loss": 5.0159, "mean_token_accuracy": 0.20193351209163665, "num_tokens": 91006369.0, "step": 52465 }, { "entropy": 5.889685106277466, "epoch": 4.082318615055437, "grad_norm": 1.3671875, "learning_rate": 0.00034209408376249464, "loss": 4.924, "mean_token_accuracy": 0.21703642457723618, "num_tokens": 91015268.0, "step": 52470 }, { "entropy": 5.867584657669068, "epoch": 4.082707644427154, "grad_norm": 1.3515625, "learning_rate": 0.0003420676285953664, "loss": 4.8891, "mean_token_accuracy": 0.21270812600851058, "num_tokens": 91023573.0, "step": 52475 }, { "entropy": 5.807168102264404, "epoch": 4.083096673798872, "grad_norm": 1.296875, "learning_rate": 0.0003420411724105937, "loss": 4.9167, "mean_token_accuracy": 0.21511021703481675, "num_tokens": 91032383.0, "step": 52480 }, { "entropy": 5.926326179504395, "epoch": 4.08348570317059, "grad_norm": 1.375, "learning_rate": 0.00034201471520857793, "loss": 4.9866, "mean_token_accuracy": 0.20646649301052095, "num_tokens": 91041129.0, "step": 52485 }, { "entropy": 5.879046535491943, "epoch": 4.083874732542307, "grad_norm": 1.3125, "learning_rate": 0.0003419882569897204, "loss": 4.8923, "mean_token_accuracy": 0.21938259154558182, "num_tokens": 91049422.0, "step": 52490 }, { "entropy": 5.888399267196656, "epoch": 4.084263761914024, "grad_norm": 1.2734375, "learning_rate": 0.00034196179775442274, "loss": 4.9868, "mean_token_accuracy": 0.21392204314470292, "num_tokens": 91059539.0, "step": 52495 }, { "entropy": 5.880028963088989, "epoch": 4.084652791285742, "grad_norm": 1.4921875, "learning_rate": 0.0003419353375030864, "loss": 4.9526, "mean_token_accuracy": 0.21438999027013778, "num_tokens": 91068068.0, "step": 52500 }, { "entropy": 5.9420241355896, "epoch": 4.08504182065746, "grad_norm": 1.3671875, "learning_rate": 0.0003419088762361128, "loss": 4.9768, "mean_token_accuracy": 0.2147290050983429, "num_tokens": 91077552.0, "step": 52505 }, { "entropy": 5.984156084060669, "epoch": 4.085430850029177, "grad_norm": 1.5, "learning_rate": 0.0003418824139539035, "loss": 5.0319, "mean_token_accuracy": 0.20760720372200012, "num_tokens": 91086705.0, "step": 52510 }, { "entropy": 5.993846988677978, "epoch": 4.085819879400895, "grad_norm": 1.3828125, "learning_rate": 0.0003418559506568601, "loss": 5.0004, "mean_token_accuracy": 0.20637951791286469, "num_tokens": 91095307.0, "step": 52515 }, { "entropy": 5.88824691772461, "epoch": 4.086208908772612, "grad_norm": 1.328125, "learning_rate": 0.00034182948634538403, "loss": 4.8477, "mean_token_accuracy": 0.2186955600976944, "num_tokens": 91104002.0, "step": 52520 }, { "entropy": 5.963755178451538, "epoch": 4.08659793814433, "grad_norm": 1.4375, "learning_rate": 0.0003418030210198769, "loss": 5.0092, "mean_token_accuracy": 0.2078005403280258, "num_tokens": 91112007.0, "step": 52525 }, { "entropy": 5.872098445892334, "epoch": 4.086986967516047, "grad_norm": 1.390625, "learning_rate": 0.00034177655468074027, "loss": 4.9265, "mean_token_accuracy": 0.21992426812648774, "num_tokens": 91120773.0, "step": 52530 }, { "entropy": 5.859691476821899, "epoch": 4.087375996887765, "grad_norm": 1.421875, "learning_rate": 0.0003417500873283756, "loss": 4.9116, "mean_token_accuracy": 0.21801672279834747, "num_tokens": 91129410.0, "step": 52535 }, { "entropy": 5.878656625747681, "epoch": 4.087765026259483, "grad_norm": 1.5234375, "learning_rate": 0.0003417236189631846, "loss": 4.9155, "mean_token_accuracy": 0.22114154696464539, "num_tokens": 91137960.0, "step": 52540 }, { "entropy": 5.916850852966308, "epoch": 4.0881540556312, "grad_norm": 1.5078125, "learning_rate": 0.000341697149585569, "loss": 5.0556, "mean_token_accuracy": 0.2056829333305359, "num_tokens": 91146246.0, "step": 52545 }, { "entropy": 5.904967784881592, "epoch": 4.088543085002918, "grad_norm": 1.375, "learning_rate": 0.0003416706791959302, "loss": 4.9325, "mean_token_accuracy": 0.22398316711187363, "num_tokens": 91154706.0, "step": 52550 }, { "entropy": 5.844547891616822, "epoch": 4.088932114374635, "grad_norm": 1.3984375, "learning_rate": 0.00034164420779467003, "loss": 4.9047, "mean_token_accuracy": 0.22033488005399704, "num_tokens": 91164088.0, "step": 52555 }, { "entropy": 5.928648614883423, "epoch": 4.089321143746353, "grad_norm": 1.4140625, "learning_rate": 0.0003416177353821901, "loss": 4.9568, "mean_token_accuracy": 0.21298209875822066, "num_tokens": 91172712.0, "step": 52560 }, { "entropy": 5.901903533935547, "epoch": 4.08971017311807, "grad_norm": 1.3671875, "learning_rate": 0.000341591261958892, "loss": 4.9148, "mean_token_accuracy": 0.22317806482315064, "num_tokens": 91180931.0, "step": 52565 }, { "entropy": 5.831737327575683, "epoch": 4.090099202489788, "grad_norm": 1.4140625, "learning_rate": 0.00034156478752517754, "loss": 4.8726, "mean_token_accuracy": 0.21744970679283143, "num_tokens": 91190135.0, "step": 52570 }, { "entropy": 5.887293195724487, "epoch": 4.090488231861506, "grad_norm": 1.5390625, "learning_rate": 0.00034153831208144837, "loss": 4.8797, "mean_token_accuracy": 0.22460052818059922, "num_tokens": 91197544.0, "step": 52575 }, { "entropy": 5.93710503578186, "epoch": 4.090877261233223, "grad_norm": 1.4296875, "learning_rate": 0.0003415118356281062, "loss": 4.9897, "mean_token_accuracy": 0.2090143695473671, "num_tokens": 91206186.0, "step": 52580 }, { "entropy": 5.963474893569947, "epoch": 4.091266290604941, "grad_norm": 1.4765625, "learning_rate": 0.0003414853581655528, "loss": 5.0026, "mean_token_accuracy": 0.2136582151055336, "num_tokens": 91215083.0, "step": 52585 }, { "entropy": 5.964396619796753, "epoch": 4.091655319976658, "grad_norm": 1.3984375, "learning_rate": 0.00034145887969419, "loss": 4.9618, "mean_token_accuracy": 0.21241963654756546, "num_tokens": 91223934.0, "step": 52590 }, { "entropy": 5.932173728942871, "epoch": 4.092044349348376, "grad_norm": 1.375, "learning_rate": 0.00034143240021441935, "loss": 5.0021, "mean_token_accuracy": 0.20295039862394332, "num_tokens": 91232466.0, "step": 52595 }, { "entropy": 5.934010362625122, "epoch": 4.092433378720093, "grad_norm": 1.546875, "learning_rate": 0.0003414059197266428, "loss": 4.935, "mean_token_accuracy": 0.2155100405216217, "num_tokens": 91241299.0, "step": 52600 }, { "entropy": 5.9018495082855225, "epoch": 4.092822408091811, "grad_norm": 1.3515625, "learning_rate": 0.00034137943823126215, "loss": 4.9809, "mean_token_accuracy": 0.21469002813100815, "num_tokens": 91250483.0, "step": 52605 }, { "entropy": 5.940790128707886, "epoch": 4.093211437463529, "grad_norm": 1.421875, "learning_rate": 0.0003413529557286792, "loss": 4.991, "mean_token_accuracy": 0.21367815583944322, "num_tokens": 91259099.0, "step": 52610 }, { "entropy": 5.871824645996094, "epoch": 4.093600466835246, "grad_norm": 1.4140625, "learning_rate": 0.0003413264722192957, "loss": 4.8856, "mean_token_accuracy": 0.23089529126882552, "num_tokens": 91267816.0, "step": 52615 }, { "entropy": 5.882388687133789, "epoch": 4.093989496206964, "grad_norm": 1.3125, "learning_rate": 0.0003412999877035136, "loss": 4.9394, "mean_token_accuracy": 0.21121062934398652, "num_tokens": 91277058.0, "step": 52620 }, { "entropy": 5.915574359893799, "epoch": 4.094378525578681, "grad_norm": 1.4140625, "learning_rate": 0.00034127350218173463, "loss": 4.9718, "mean_token_accuracy": 0.2180978015065193, "num_tokens": 91285403.0, "step": 52625 }, { "entropy": 5.917043685913086, "epoch": 4.094767554950399, "grad_norm": 1.46875, "learning_rate": 0.00034124701565436076, "loss": 5.0063, "mean_token_accuracy": 0.19991597682237625, "num_tokens": 91293999.0, "step": 52630 }, { "entropy": 5.9734724998474125, "epoch": 4.095156584322116, "grad_norm": 1.375, "learning_rate": 0.000341220528121794, "loss": 5.0143, "mean_token_accuracy": 0.20683002918958665, "num_tokens": 91303415.0, "step": 52635 }, { "entropy": 5.909023380279541, "epoch": 4.095545613693834, "grad_norm": 1.46875, "learning_rate": 0.000341194039584436, "loss": 4.9452, "mean_token_accuracy": 0.21730211973190308, "num_tokens": 91311791.0, "step": 52640 }, { "entropy": 5.895079803466797, "epoch": 4.095934643065552, "grad_norm": 1.3359375, "learning_rate": 0.0003411675500426888, "loss": 4.934, "mean_token_accuracy": 0.2072712317109108, "num_tokens": 91320175.0, "step": 52645 }, { "entropy": 5.906395006179809, "epoch": 4.096323672437269, "grad_norm": 1.4296875, "learning_rate": 0.00034114105949695445, "loss": 4.9863, "mean_token_accuracy": 0.2061407297849655, "num_tokens": 91330210.0, "step": 52650 }, { "entropy": 5.992322540283203, "epoch": 4.096712701808986, "grad_norm": 1.4609375, "learning_rate": 0.0003411145679476347, "loss": 5.0419, "mean_token_accuracy": 0.2041787639260292, "num_tokens": 91338331.0, "step": 52655 }, { "entropy": 5.893662643432617, "epoch": 4.097101731180704, "grad_norm": 1.359375, "learning_rate": 0.0003410880753951317, "loss": 4.8739, "mean_token_accuracy": 0.22068906128406524, "num_tokens": 91346492.0, "step": 52660 }, { "entropy": 5.841854906082153, "epoch": 4.097490760552422, "grad_norm": 1.3515625, "learning_rate": 0.0003410615818398473, "loss": 4.9363, "mean_token_accuracy": 0.21056584417819976, "num_tokens": 91355734.0, "step": 52665 }, { "entropy": 5.937055826187134, "epoch": 4.097879789924139, "grad_norm": 1.40625, "learning_rate": 0.0003410350872821835, "loss": 4.9597, "mean_token_accuracy": 0.21435479670763016, "num_tokens": 91363982.0, "step": 52670 }, { "entropy": 5.926706171035766, "epoch": 4.098268819295857, "grad_norm": 1.4140625, "learning_rate": 0.00034100859172254245, "loss": 4.987, "mean_token_accuracy": 0.2204262375831604, "num_tokens": 91373031.0, "step": 52675 }, { "entropy": 5.9008454322814945, "epoch": 4.098657848667575, "grad_norm": 1.4609375, "learning_rate": 0.00034098209516132607, "loss": 5.017, "mean_token_accuracy": 0.21275673508644105, "num_tokens": 91381676.0, "step": 52680 }, { "entropy": 5.953544092178345, "epoch": 4.099046878039292, "grad_norm": 1.3203125, "learning_rate": 0.0003409555975989363, "loss": 5.0945, "mean_token_accuracy": 0.2017646238207817, "num_tokens": 91390488.0, "step": 52685 }, { "entropy": 5.916071081161499, "epoch": 4.099435907411009, "grad_norm": 1.421875, "learning_rate": 0.00034092909903577547, "loss": 4.8264, "mean_token_accuracy": 0.22398722916841507, "num_tokens": 91399069.0, "step": 52690 }, { "entropy": 5.892436122894287, "epoch": 4.099824936782727, "grad_norm": 1.4375, "learning_rate": 0.0003409025994722454, "loss": 4.9351, "mean_token_accuracy": 0.21681943535804749, "num_tokens": 91407921.0, "step": 52695 }, { "entropy": 5.8305457592010494, "epoch": 4.100213966154445, "grad_norm": 1.375, "learning_rate": 0.0003408760989087482, "loss": 4.899, "mean_token_accuracy": 0.2193138048052788, "num_tokens": 91416077.0, "step": 52700 }, { "entropy": 5.944351577758789, "epoch": 4.100602995526162, "grad_norm": 1.3125, "learning_rate": 0.00034084959734568616, "loss": 5.0786, "mean_token_accuracy": 0.20689990520477294, "num_tokens": 91424941.0, "step": 52705 }, { "entropy": 6.088378095626831, "epoch": 4.10099202489788, "grad_norm": 1.4140625, "learning_rate": 0.00034082309478346127, "loss": 5.1043, "mean_token_accuracy": 0.20074537694454192, "num_tokens": 91433052.0, "step": 52710 }, { "entropy": 5.886245441436768, "epoch": 4.101381054269598, "grad_norm": 1.390625, "learning_rate": 0.00034079659122247574, "loss": 4.8886, "mean_token_accuracy": 0.21408981680870057, "num_tokens": 91441109.0, "step": 52715 }, { "entropy": 5.846343755722046, "epoch": 4.101770083641315, "grad_norm": 1.40625, "learning_rate": 0.0003407700866631317, "loss": 4.9307, "mean_token_accuracy": 0.2107575699687004, "num_tokens": 91449256.0, "step": 52720 }, { "entropy": 5.848797464370728, "epoch": 4.102159113013032, "grad_norm": 1.3203125, "learning_rate": 0.0003407435811058312, "loss": 4.9022, "mean_token_accuracy": 0.21143162548542022, "num_tokens": 91458398.0, "step": 52725 }, { "entropy": 5.869709730148315, "epoch": 4.10254814238475, "grad_norm": 1.34375, "learning_rate": 0.0003407170745509764, "loss": 4.8783, "mean_token_accuracy": 0.21406591832637786, "num_tokens": 91467291.0, "step": 52730 }, { "entropy": 5.96812105178833, "epoch": 4.1029371717564675, "grad_norm": 1.5078125, "learning_rate": 0.00034069056699896974, "loss": 5.0348, "mean_token_accuracy": 0.2082229033112526, "num_tokens": 91475616.0, "step": 52735 }, { "entropy": 5.967672681808471, "epoch": 4.103326201128185, "grad_norm": 1.4296875, "learning_rate": 0.0003406640584502132, "loss": 5.0348, "mean_token_accuracy": 0.2154568389058113, "num_tokens": 91484289.0, "step": 52740 }, { "entropy": 5.850242614746094, "epoch": 4.103715230499903, "grad_norm": 1.4921875, "learning_rate": 0.0003406375489051091, "loss": 4.8629, "mean_token_accuracy": 0.22030099034309386, "num_tokens": 91492483.0, "step": 52745 }, { "entropy": 5.848580265045166, "epoch": 4.104104259871621, "grad_norm": 1.3125, "learning_rate": 0.0003406110383640597, "loss": 4.9434, "mean_token_accuracy": 0.21315933912992477, "num_tokens": 91502002.0, "step": 52750 }, { "entropy": 5.968935966491699, "epoch": 4.1044932892433375, "grad_norm": 1.296875, "learning_rate": 0.00034058452682746734, "loss": 5.0422, "mean_token_accuracy": 0.21156175881624223, "num_tokens": 91510392.0, "step": 52755 }, { "entropy": 5.937663316726685, "epoch": 4.104882318615055, "grad_norm": 1.421875, "learning_rate": 0.000340558014295734, "loss": 4.9296, "mean_token_accuracy": 0.2151510939002037, "num_tokens": 91518650.0, "step": 52760 }, { "entropy": 5.938623332977295, "epoch": 4.105271347986773, "grad_norm": 1.421875, "learning_rate": 0.00034053150076926214, "loss": 5.0786, "mean_token_accuracy": 0.20556239038705826, "num_tokens": 91528062.0, "step": 52765 }, { "entropy": 5.85027174949646, "epoch": 4.1056603773584905, "grad_norm": 1.5, "learning_rate": 0.0003405049862484541, "loss": 4.9506, "mean_token_accuracy": 0.2107527047395706, "num_tokens": 91536615.0, "step": 52770 }, { "entropy": 5.960754632949829, "epoch": 4.106049406730208, "grad_norm": 1.40625, "learning_rate": 0.0003404784707337122, "loss": 5.0667, "mean_token_accuracy": 0.20279465913772582, "num_tokens": 91544912.0, "step": 52775 }, { "entropy": 5.902083206176758, "epoch": 4.106438436101926, "grad_norm": 1.4375, "learning_rate": 0.00034045195422543865, "loss": 4.9725, "mean_token_accuracy": 0.211878901720047, "num_tokens": 91553568.0, "step": 52780 }, { "entropy": 5.962917137145996, "epoch": 4.106827465473644, "grad_norm": 1.390625, "learning_rate": 0.00034042543672403594, "loss": 5.0813, "mean_token_accuracy": 0.20828411132097244, "num_tokens": 91562473.0, "step": 52785 }, { "entropy": 5.859739160537719, "epoch": 4.10721649484536, "grad_norm": 1.375, "learning_rate": 0.00034039891822990634, "loss": 4.7885, "mean_token_accuracy": 0.22724731713533403, "num_tokens": 91570750.0, "step": 52790 }, { "entropy": 5.920616674423218, "epoch": 4.107605524217078, "grad_norm": 1.3671875, "learning_rate": 0.0003403723987434523, "loss": 4.9607, "mean_token_accuracy": 0.21304586082696914, "num_tokens": 91580463.0, "step": 52795 }, { "entropy": 5.864268255233765, "epoch": 4.107994553588796, "grad_norm": 1.4375, "learning_rate": 0.00034034587826507604, "loss": 4.8684, "mean_token_accuracy": 0.22026564478874205, "num_tokens": 91588690.0, "step": 52800 }, { "entropy": 5.807320785522461, "epoch": 4.1083835829605135, "grad_norm": 1.3984375, "learning_rate": 0.00034031935679518016, "loss": 4.8816, "mean_token_accuracy": 0.2250775709748268, "num_tokens": 91597439.0, "step": 52805 }, { "entropy": 5.859689998626709, "epoch": 4.108772612332231, "grad_norm": 1.3125, "learning_rate": 0.000340292834334167, "loss": 4.897, "mean_token_accuracy": 0.2160307750105858, "num_tokens": 91606711.0, "step": 52810 }, { "entropy": 5.932690000534057, "epoch": 4.109161641703949, "grad_norm": 1.375, "learning_rate": 0.000340266310882439, "loss": 4.896, "mean_token_accuracy": 0.218765552341938, "num_tokens": 91615683.0, "step": 52815 }, { "entropy": 5.871548652648926, "epoch": 4.109550671075667, "grad_norm": 1.359375, "learning_rate": 0.00034023978644039864, "loss": 4.949, "mean_token_accuracy": 0.21354755908250808, "num_tokens": 91623816.0, "step": 52820 }, { "entropy": 5.8265052318573, "epoch": 4.109939700447383, "grad_norm": 1.4296875, "learning_rate": 0.0003402132610084483, "loss": 4.8498, "mean_token_accuracy": 0.21989983320236206, "num_tokens": 91633600.0, "step": 52825 }, { "entropy": 5.8325258731842045, "epoch": 4.110328729819101, "grad_norm": 1.3828125, "learning_rate": 0.00034018673458699055, "loss": 4.9145, "mean_token_accuracy": 0.2131930634379387, "num_tokens": 91642072.0, "step": 52830 }, { "entropy": 5.88376932144165, "epoch": 4.110717759190819, "grad_norm": 1.34375, "learning_rate": 0.0003401602071764279, "loss": 4.9671, "mean_token_accuracy": 0.2141076758503914, "num_tokens": 91651515.0, "step": 52835 }, { "entropy": 5.944074440002441, "epoch": 4.1111067885625365, "grad_norm": 1.3125, "learning_rate": 0.00034013367877716284, "loss": 5.0204, "mean_token_accuracy": 0.209410397708416, "num_tokens": 91660492.0, "step": 52840 }, { "entropy": 5.972733640670777, "epoch": 4.111495817934254, "grad_norm": 1.484375, "learning_rate": 0.0003401071493895977, "loss": 5.0555, "mean_token_accuracy": 0.2058595448732376, "num_tokens": 91669091.0, "step": 52845 }, { "entropy": 5.894702196121216, "epoch": 4.111884847305972, "grad_norm": 1.375, "learning_rate": 0.0003400806190141354, "loss": 4.9402, "mean_token_accuracy": 0.21729811280965805, "num_tokens": 91676957.0, "step": 52850 }, { "entropy": 5.848164463043213, "epoch": 4.112273876677689, "grad_norm": 1.578125, "learning_rate": 0.00034005408765117815, "loss": 4.9675, "mean_token_accuracy": 0.21747759282588958, "num_tokens": 91686230.0, "step": 52855 }, { "entropy": 5.868437242507935, "epoch": 4.112662906049406, "grad_norm": 1.3359375, "learning_rate": 0.00034002755530112877, "loss": 4.9185, "mean_token_accuracy": 0.22282164692878723, "num_tokens": 91695917.0, "step": 52860 }, { "entropy": 5.931685304641723, "epoch": 4.113051935421124, "grad_norm": 1.453125, "learning_rate": 0.0003400010219643897, "loss": 4.9225, "mean_token_accuracy": 0.21332666873931885, "num_tokens": 91704619.0, "step": 52865 }, { "entropy": 5.925198221206665, "epoch": 4.113440964792842, "grad_norm": 1.5703125, "learning_rate": 0.0003399744876413636, "loss": 5.0034, "mean_token_accuracy": 0.20861937701702118, "num_tokens": 91712524.0, "step": 52870 }, { "entropy": 5.883453750610352, "epoch": 4.1138299941645595, "grad_norm": 1.3203125, "learning_rate": 0.000339947952332453, "loss": 5.0196, "mean_token_accuracy": 0.21128413677215577, "num_tokens": 91721455.0, "step": 52875 }, { "entropy": 5.863312101364135, "epoch": 4.114219023536277, "grad_norm": 1.3984375, "learning_rate": 0.00033992141603806064, "loss": 4.8223, "mean_token_accuracy": 0.2245756134390831, "num_tokens": 91729567.0, "step": 52880 }, { "entropy": 5.877848529815674, "epoch": 4.114608052907995, "grad_norm": 1.421875, "learning_rate": 0.00033989487875858915, "loss": 4.9083, "mean_token_accuracy": 0.2183839499950409, "num_tokens": 91738373.0, "step": 52885 }, { "entropy": 5.850502872467041, "epoch": 4.114997082279712, "grad_norm": 1.3828125, "learning_rate": 0.00033986834049444113, "loss": 4.8933, "mean_token_accuracy": 0.22003017663955687, "num_tokens": 91747249.0, "step": 52890 }, { "entropy": 5.861805438995361, "epoch": 4.115386111651429, "grad_norm": 1.4453125, "learning_rate": 0.00033984180124601936, "loss": 4.879, "mean_token_accuracy": 0.21951905339956285, "num_tokens": 91754986.0, "step": 52895 }, { "entropy": 5.878744792938233, "epoch": 4.115775141023147, "grad_norm": 1.3984375, "learning_rate": 0.00033981526101372635, "loss": 4.9156, "mean_token_accuracy": 0.2142985239624977, "num_tokens": 91764127.0, "step": 52900 }, { "entropy": 5.890066146850586, "epoch": 4.116164170394865, "grad_norm": 1.40625, "learning_rate": 0.000339788719797965, "loss": 4.9044, "mean_token_accuracy": 0.21786743998527527, "num_tokens": 91772564.0, "step": 52905 }, { "entropy": 5.871653366088867, "epoch": 4.1165531997665825, "grad_norm": 1.390625, "learning_rate": 0.0003397621775991379, "loss": 4.9394, "mean_token_accuracy": 0.21094811111688613, "num_tokens": 91780810.0, "step": 52910 }, { "entropy": 5.902502250671387, "epoch": 4.1169422291383, "grad_norm": 1.390625, "learning_rate": 0.0003397356344176479, "loss": 4.9243, "mean_token_accuracy": 0.2120744213461876, "num_tokens": 91789065.0, "step": 52915 }, { "entropy": 5.872078275680542, "epoch": 4.117331258510018, "grad_norm": 1.4375, "learning_rate": 0.0003397090902538976, "loss": 4.849, "mean_token_accuracy": 0.22367219775915145, "num_tokens": 91796891.0, "step": 52920 }, { "entropy": 5.896863698959351, "epoch": 4.117720287881735, "grad_norm": 1.4375, "learning_rate": 0.00033968254510828995, "loss": 4.9546, "mean_token_accuracy": 0.215956012904644, "num_tokens": 91805447.0, "step": 52925 }, { "entropy": 5.82548713684082, "epoch": 4.118109317253452, "grad_norm": 1.484375, "learning_rate": 0.0003396559989812275, "loss": 4.8796, "mean_token_accuracy": 0.21698842644691468, "num_tokens": 91814232.0, "step": 52930 }, { "entropy": 5.878021860122681, "epoch": 4.11849834662517, "grad_norm": 1.375, "learning_rate": 0.0003396294518731133, "loss": 4.9899, "mean_token_accuracy": 0.21511362344026566, "num_tokens": 91823557.0, "step": 52935 }, { "entropy": 5.959102582931519, "epoch": 4.118887375996888, "grad_norm": 1.5, "learning_rate": 0.00033960290378435, "loss": 4.9341, "mean_token_accuracy": 0.22572496086359023, "num_tokens": 91831579.0, "step": 52940 }, { "entropy": 5.945687341690063, "epoch": 4.1192764053686055, "grad_norm": 1.5859375, "learning_rate": 0.00033957635471534045, "loss": 5.0048, "mean_token_accuracy": 0.21300116330385208, "num_tokens": 91839456.0, "step": 52945 }, { "entropy": 5.905714321136474, "epoch": 4.119665434740323, "grad_norm": 1.40625, "learning_rate": 0.0003395498046664875, "loss": 5.0104, "mean_token_accuracy": 0.21242806911468506, "num_tokens": 91848051.0, "step": 52950 }, { "entropy": 5.875723028182984, "epoch": 4.120054464112041, "grad_norm": 1.4296875, "learning_rate": 0.000339523253638194, "loss": 4.9154, "mean_token_accuracy": 0.21487711668014525, "num_tokens": 91856153.0, "step": 52955 }, { "entropy": 5.8718345165252686, "epoch": 4.120443493483758, "grad_norm": 1.359375, "learning_rate": 0.0003394967016308629, "loss": 4.9644, "mean_token_accuracy": 0.2136249616742134, "num_tokens": 91865083.0, "step": 52960 }, { "entropy": 5.93446569442749, "epoch": 4.120832522855475, "grad_norm": 1.5, "learning_rate": 0.0003394701486448968, "loss": 5.0493, "mean_token_accuracy": 0.20271414518356323, "num_tokens": 91872655.0, "step": 52965 }, { "entropy": 5.960166358947754, "epoch": 4.121221552227193, "grad_norm": 1.4375, "learning_rate": 0.00033944359468069903, "loss": 5.0199, "mean_token_accuracy": 0.20944157093763352, "num_tokens": 91881735.0, "step": 52970 }, { "entropy": 5.849606847763061, "epoch": 4.121610581598911, "grad_norm": 1.40625, "learning_rate": 0.00033941703973867216, "loss": 4.8875, "mean_token_accuracy": 0.22056015878915786, "num_tokens": 91890730.0, "step": 52975 }, { "entropy": 5.903974914550782, "epoch": 4.1219996109706285, "grad_norm": 1.3359375, "learning_rate": 0.00033939048381921935, "loss": 4.954, "mean_token_accuracy": 0.21133678704500197, "num_tokens": 91899393.0, "step": 52980 }, { "entropy": 5.938225984573364, "epoch": 4.122388640342346, "grad_norm": 1.390625, "learning_rate": 0.0003393639269227434, "loss": 5.0215, "mean_token_accuracy": 0.21261327862739562, "num_tokens": 91908946.0, "step": 52985 }, { "entropy": 5.929977226257324, "epoch": 4.122777669714063, "grad_norm": 1.3984375, "learning_rate": 0.0003393373690496473, "loss": 4.8788, "mean_token_accuracy": 0.217441688477993, "num_tokens": 91917592.0, "step": 52990 }, { "entropy": 5.919007968902588, "epoch": 4.123166699085781, "grad_norm": 1.4609375, "learning_rate": 0.000339310810200334, "loss": 4.8964, "mean_token_accuracy": 0.21340139359235763, "num_tokens": 91925576.0, "step": 52995 }, { "entropy": 5.849965286254883, "epoch": 4.123555728457498, "grad_norm": 1.5390625, "learning_rate": 0.00033928425037520643, "loss": 4.9121, "mean_token_accuracy": 0.22110699564218522, "num_tokens": 91933889.0, "step": 53000 }, { "entropy": 5.87031831741333, "epoch": 4.123944757829216, "grad_norm": 1.4453125, "learning_rate": 0.0003392576895746678, "loss": 4.9158, "mean_token_accuracy": 0.21415314972400665, "num_tokens": 91942733.0, "step": 53005 }, { "entropy": 5.945229816436767, "epoch": 4.124333787200934, "grad_norm": 1.59375, "learning_rate": 0.0003392311277991209, "loss": 4.9836, "mean_token_accuracy": 0.2145493820309639, "num_tokens": 91950780.0, "step": 53010 }, { "entropy": 5.929593753814697, "epoch": 4.1247228165726515, "grad_norm": 1.3984375, "learning_rate": 0.00033920456504896895, "loss": 4.9884, "mean_token_accuracy": 0.21254315376281738, "num_tokens": 91958908.0, "step": 53015 }, { "entropy": 5.833272933959961, "epoch": 4.125111845944369, "grad_norm": 1.3203125, "learning_rate": 0.00033917800132461493, "loss": 4.8658, "mean_token_accuracy": 0.2193354532122612, "num_tokens": 91967288.0, "step": 53020 }, { "entropy": 5.8546998500823975, "epoch": 4.125500875316086, "grad_norm": 1.3828125, "learning_rate": 0.0003391514366264619, "loss": 4.9013, "mean_token_accuracy": 0.2152662456035614, "num_tokens": 91975806.0, "step": 53025 }, { "entropy": 5.947770500183106, "epoch": 4.125889904687804, "grad_norm": 1.3203125, "learning_rate": 0.0003391248709549129, "loss": 4.9223, "mean_token_accuracy": 0.21123569905757905, "num_tokens": 91984992.0, "step": 53030 }, { "entropy": 5.953722429275513, "epoch": 4.126278934059521, "grad_norm": 1.375, "learning_rate": 0.0003390983043103711, "loss": 4.9604, "mean_token_accuracy": 0.21307571679353715, "num_tokens": 91993899.0, "step": 53035 }, { "entropy": 5.865326404571533, "epoch": 4.126667963431239, "grad_norm": 1.3828125, "learning_rate": 0.0003390717366932395, "loss": 4.9362, "mean_token_accuracy": 0.21270429342985153, "num_tokens": 92002628.0, "step": 53040 }, { "entropy": 5.826969194412231, "epoch": 4.127056992802957, "grad_norm": 1.515625, "learning_rate": 0.0003390451681039212, "loss": 4.8806, "mean_token_accuracy": 0.2256618097424507, "num_tokens": 92011406.0, "step": 53045 }, { "entropy": 5.924251317977905, "epoch": 4.1274460221746745, "grad_norm": 1.390625, "learning_rate": 0.00033901859854281954, "loss": 4.9808, "mean_token_accuracy": 0.21165835857391357, "num_tokens": 92019572.0, "step": 53050 }, { "entropy": 5.876049518585205, "epoch": 4.127835051546391, "grad_norm": 1.4453125, "learning_rate": 0.0003389920280103375, "loss": 4.9693, "mean_token_accuracy": 0.22090078443288802, "num_tokens": 92028273.0, "step": 53055 }, { "entropy": 5.96041579246521, "epoch": 4.128224080918109, "grad_norm": 1.28125, "learning_rate": 0.00033896545650687824, "loss": 4.9875, "mean_token_accuracy": 0.21151614487171172, "num_tokens": 92036460.0, "step": 53060 }, { "entropy": 5.973018455505371, "epoch": 4.128613110289827, "grad_norm": 1.3203125, "learning_rate": 0.0003389388840328451, "loss": 5.0431, "mean_token_accuracy": 0.2069725662469864, "num_tokens": 92045109.0, "step": 53065 }, { "entropy": 5.915903806686401, "epoch": 4.129002139661544, "grad_norm": 1.3359375, "learning_rate": 0.0003389123105886411, "loss": 5.0339, "mean_token_accuracy": 0.20924107283353804, "num_tokens": 92053369.0, "step": 53070 }, { "entropy": 5.894375038146973, "epoch": 4.129391169033262, "grad_norm": 1.3359375, "learning_rate": 0.0003388857361746695, "loss": 4.8749, "mean_token_accuracy": 0.22037282586097717, "num_tokens": 92062040.0, "step": 53075 }, { "entropy": 5.8793778896331785, "epoch": 4.12978019840498, "grad_norm": 1.3671875, "learning_rate": 0.00033885916079133354, "loss": 4.892, "mean_token_accuracy": 0.22042303383350373, "num_tokens": 92070832.0, "step": 53080 }, { "entropy": 5.861036920547486, "epoch": 4.1301692277766975, "grad_norm": 1.3203125, "learning_rate": 0.00033883258443903646, "loss": 4.9496, "mean_token_accuracy": 0.20970155745744706, "num_tokens": 92079862.0, "step": 53085 }, { "entropy": 6.02113618850708, "epoch": 4.130558257148414, "grad_norm": 1.3046875, "learning_rate": 0.00033880600711818157, "loss": 5.0514, "mean_token_accuracy": 0.20777950882911683, "num_tokens": 92089403.0, "step": 53090 }, { "entropy": 5.981896018981933, "epoch": 4.130947286520132, "grad_norm": 1.53125, "learning_rate": 0.00033877942882917203, "loss": 4.9727, "mean_token_accuracy": 0.2144062638282776, "num_tokens": 92097902.0, "step": 53095 }, { "entropy": 5.884845924377442, "epoch": 4.13133631589185, "grad_norm": 1.375, "learning_rate": 0.00033875284957241117, "loss": 4.9807, "mean_token_accuracy": 0.2114662081003189, "num_tokens": 92107149.0, "step": 53100 }, { "entropy": 5.8629707336425785, "epoch": 4.131725345263567, "grad_norm": 1.453125, "learning_rate": 0.0003387262693483023, "loss": 4.9827, "mean_token_accuracy": 0.2068902686238289, "num_tokens": 92115650.0, "step": 53105 }, { "entropy": 5.951466989517212, "epoch": 4.132114374635285, "grad_norm": 1.3828125, "learning_rate": 0.00033869968815724866, "loss": 4.9822, "mean_token_accuracy": 0.2173279970884323, "num_tokens": 92124494.0, "step": 53110 }, { "entropy": 5.8978346824646, "epoch": 4.132503404007003, "grad_norm": 1.375, "learning_rate": 0.0003386731059996537, "loss": 4.9488, "mean_token_accuracy": 0.21720950901508332, "num_tokens": 92133223.0, "step": 53115 }, { "entropy": 5.854339122772217, "epoch": 4.1328924333787205, "grad_norm": 1.453125, "learning_rate": 0.00033864652287592074, "loss": 4.9176, "mean_token_accuracy": 0.22681528180837632, "num_tokens": 92141546.0, "step": 53120 }, { "entropy": 5.893673658370972, "epoch": 4.133281462750437, "grad_norm": 1.3359375, "learning_rate": 0.00033861993878645305, "loss": 5.0173, "mean_token_accuracy": 0.21151699125766754, "num_tokens": 92150630.0, "step": 53125 }, { "entropy": 5.9865946769714355, "epoch": 4.133670492122155, "grad_norm": 1.46875, "learning_rate": 0.000338593353731654, "loss": 5.0233, "mean_token_accuracy": 0.21498106569051742, "num_tokens": 92160278.0, "step": 53130 }, { "entropy": 5.955991554260254, "epoch": 4.134059521493873, "grad_norm": 1.4921875, "learning_rate": 0.0003385667677119271, "loss": 4.9275, "mean_token_accuracy": 0.21284471899271012, "num_tokens": 92168078.0, "step": 53135 }, { "entropy": 5.8389918327331545, "epoch": 4.13444855086559, "grad_norm": 1.40625, "learning_rate": 0.00033854018072767574, "loss": 4.8784, "mean_token_accuracy": 0.2197596475481987, "num_tokens": 92176076.0, "step": 53140 }, { "entropy": 5.758515214920044, "epoch": 4.134837580237308, "grad_norm": 1.4609375, "learning_rate": 0.00033851359277930316, "loss": 4.8703, "mean_token_accuracy": 0.21958047747612, "num_tokens": 92183978.0, "step": 53145 }, { "entropy": 5.836000633239746, "epoch": 4.135226609609026, "grad_norm": 1.3515625, "learning_rate": 0.0003384870038672129, "loss": 4.9027, "mean_token_accuracy": 0.21999291628599166, "num_tokens": 92192788.0, "step": 53150 }, { "entropy": 5.832181978225708, "epoch": 4.1356156389807435, "grad_norm": 1.40625, "learning_rate": 0.0003384604139918085, "loss": 4.8006, "mean_token_accuracy": 0.22784579992294313, "num_tokens": 92201210.0, "step": 53155 }, { "entropy": 5.915728330612183, "epoch": 4.13600466835246, "grad_norm": 1.3828125, "learning_rate": 0.00033843382315349325, "loss": 4.9577, "mean_token_accuracy": 0.21042668372392653, "num_tokens": 92210107.0, "step": 53160 }, { "entropy": 5.948424530029297, "epoch": 4.136393697724178, "grad_norm": 1.390625, "learning_rate": 0.00033840723135267073, "loss": 5.0167, "mean_token_accuracy": 0.2129012778401375, "num_tokens": 92219206.0, "step": 53165 }, { "entropy": 5.87229323387146, "epoch": 4.136782727095896, "grad_norm": 1.4609375, "learning_rate": 0.00033838063858974434, "loss": 4.9266, "mean_token_accuracy": 0.2198166862130165, "num_tokens": 92227974.0, "step": 53170 }, { "entropy": 5.8090348720550535, "epoch": 4.137171756467613, "grad_norm": 1.5234375, "learning_rate": 0.0003383540448651177, "loss": 4.8373, "mean_token_accuracy": 0.2178857818245888, "num_tokens": 92235743.0, "step": 53175 }, { "entropy": 5.858920001983643, "epoch": 4.137560785839331, "grad_norm": 1.40625, "learning_rate": 0.00033832745017919424, "loss": 4.9549, "mean_token_accuracy": 0.2116394892334938, "num_tokens": 92243756.0, "step": 53180 }, { "entropy": 5.868471002578735, "epoch": 4.137949815211049, "grad_norm": 1.40625, "learning_rate": 0.00033830085453237757, "loss": 4.9802, "mean_token_accuracy": 0.20792966932058335, "num_tokens": 92252770.0, "step": 53185 }, { "entropy": 5.916534519195556, "epoch": 4.138338844582766, "grad_norm": 1.3671875, "learning_rate": 0.0003382742579250712, "loss": 5.005, "mean_token_accuracy": 0.20948924124240875, "num_tokens": 92261431.0, "step": 53190 }, { "entropy": 5.985233736038208, "epoch": 4.138727873954483, "grad_norm": 1.4296875, "learning_rate": 0.0003382476603576785, "loss": 4.9872, "mean_token_accuracy": 0.2044818952679634, "num_tokens": 92269669.0, "step": 53195 }, { "entropy": 5.893612194061279, "epoch": 4.139116903326201, "grad_norm": 1.3203125, "learning_rate": 0.0003382210618306034, "loss": 4.9565, "mean_token_accuracy": 0.2104913666844368, "num_tokens": 92278723.0, "step": 53200 }, { "entropy": 5.9354432106018065, "epoch": 4.139505932697919, "grad_norm": 1.3984375, "learning_rate": 0.0003381944623442492, "loss": 5.0639, "mean_token_accuracy": 0.2117059901356697, "num_tokens": 92287905.0, "step": 53205 }, { "entropy": 5.8875645160675045, "epoch": 4.139894962069636, "grad_norm": 1.5, "learning_rate": 0.0003381678618990197, "loss": 4.9358, "mean_token_accuracy": 0.21197791695594786, "num_tokens": 92296882.0, "step": 53210 }, { "entropy": 5.9310266971588135, "epoch": 4.140283991441354, "grad_norm": 1.4140625, "learning_rate": 0.0003381412604953185, "loss": 4.9826, "mean_token_accuracy": 0.21040562242269517, "num_tokens": 92306425.0, "step": 53215 }, { "entropy": 5.934935855865478, "epoch": 4.140673020813072, "grad_norm": 1.3125, "learning_rate": 0.0003381146581335491, "loss": 4.9951, "mean_token_accuracy": 0.21959634870290756, "num_tokens": 92315607.0, "step": 53220 }, { "entropy": 5.782837390899658, "epoch": 4.141062050184789, "grad_norm": 1.296875, "learning_rate": 0.0003380880548141152, "loss": 4.8022, "mean_token_accuracy": 0.22800897657871247, "num_tokens": 92324673.0, "step": 53225 }, { "entropy": 5.863712882995605, "epoch": 4.141451079556506, "grad_norm": 1.2890625, "learning_rate": 0.00033806145053742043, "loss": 4.9919, "mean_token_accuracy": 0.21263565868139267, "num_tokens": 92333073.0, "step": 53230 }, { "entropy": 5.964238452911377, "epoch": 4.141840108928224, "grad_norm": 1.421875, "learning_rate": 0.0003380348453038686, "loss": 4.9697, "mean_token_accuracy": 0.2206350177526474, "num_tokens": 92341559.0, "step": 53235 }, { "entropy": 5.972965478897095, "epoch": 4.142229138299942, "grad_norm": 1.421875, "learning_rate": 0.0003380082391138633, "loss": 5.0301, "mean_token_accuracy": 0.21591034084558486, "num_tokens": 92350735.0, "step": 53240 }, { "entropy": 5.923988008499146, "epoch": 4.142618167671659, "grad_norm": 1.4140625, "learning_rate": 0.0003379816319678083, "loss": 5.0071, "mean_token_accuracy": 0.2115897372364998, "num_tokens": 92359554.0, "step": 53245 }, { "entropy": 5.916676235198975, "epoch": 4.143007197043377, "grad_norm": 1.4375, "learning_rate": 0.0003379550238661072, "loss": 5.052, "mean_token_accuracy": 0.2146249607205391, "num_tokens": 92368098.0, "step": 53250 }, { "entropy": 5.843868160247803, "epoch": 4.143396226415095, "grad_norm": 1.40625, "learning_rate": 0.00033792841480916394, "loss": 4.9128, "mean_token_accuracy": 0.2171401023864746, "num_tokens": 92376373.0, "step": 53255 }, { "entropy": 5.885285377502441, "epoch": 4.143785255786812, "grad_norm": 1.46875, "learning_rate": 0.00033790180479738205, "loss": 4.9391, "mean_token_accuracy": 0.21431785374879836, "num_tokens": 92384621.0, "step": 53260 }, { "entropy": 5.956968927383423, "epoch": 4.144174285158529, "grad_norm": 1.296875, "learning_rate": 0.0003378751938311654, "loss": 4.9845, "mean_token_accuracy": 0.2113196611404419, "num_tokens": 92393170.0, "step": 53265 }, { "entropy": 5.946611928939819, "epoch": 4.144563314530247, "grad_norm": 1.421875, "learning_rate": 0.0003378485819109177, "loss": 4.9807, "mean_token_accuracy": 0.2142006739974022, "num_tokens": 92401874.0, "step": 53270 }, { "entropy": 5.894551563262939, "epoch": 4.144952343901965, "grad_norm": 1.40625, "learning_rate": 0.00033782196903704286, "loss": 4.9885, "mean_token_accuracy": 0.2128918468952179, "num_tokens": 92410735.0, "step": 53275 }, { "entropy": 5.8234357833862305, "epoch": 4.145341373273682, "grad_norm": 1.453125, "learning_rate": 0.0003377953552099447, "loss": 4.8631, "mean_token_accuracy": 0.22030453830957414, "num_tokens": 92419046.0, "step": 53280 }, { "entropy": 5.862298965454102, "epoch": 4.1457304026454, "grad_norm": 1.2890625, "learning_rate": 0.0003377687404300269, "loss": 4.903, "mean_token_accuracy": 0.22330783009529115, "num_tokens": 92428529.0, "step": 53285 }, { "entropy": 5.923554944992065, "epoch": 4.146119432017118, "grad_norm": 1.4140625, "learning_rate": 0.0003377421246976934, "loss": 4.9971, "mean_token_accuracy": 0.211757892370224, "num_tokens": 92437717.0, "step": 53290 }, { "entropy": 5.933090114593506, "epoch": 4.1465084613888346, "grad_norm": 1.5, "learning_rate": 0.00033771550801334806, "loss": 4.9079, "mean_token_accuracy": 0.2216992348432541, "num_tokens": 92446152.0, "step": 53295 }, { "entropy": 6.002976369857788, "epoch": 4.146897490760552, "grad_norm": 1.3671875, "learning_rate": 0.00033768889037739464, "loss": 5.0143, "mean_token_accuracy": 0.20954060703516006, "num_tokens": 92454671.0, "step": 53300 }, { "entropy": 5.904496097564698, "epoch": 4.14728652013227, "grad_norm": 1.5078125, "learning_rate": 0.00033766227179023704, "loss": 5.02, "mean_token_accuracy": 0.2119699791073799, "num_tokens": 92463582.0, "step": 53305 }, { "entropy": 5.877216053009033, "epoch": 4.147675549503988, "grad_norm": 1.421875, "learning_rate": 0.00033763565225227934, "loss": 4.9547, "mean_token_accuracy": 0.21369892209768296, "num_tokens": 92472431.0, "step": 53310 }, { "entropy": 5.915773344039917, "epoch": 4.148064578875705, "grad_norm": 1.3828125, "learning_rate": 0.0003376090317639252, "loss": 4.9291, "mean_token_accuracy": 0.21621883362531663, "num_tokens": 92480940.0, "step": 53315 }, { "entropy": 5.905050563812256, "epoch": 4.148453608247423, "grad_norm": 1.4921875, "learning_rate": 0.00033758241032557875, "loss": 4.8885, "mean_token_accuracy": 0.22139197140932082, "num_tokens": 92488563.0, "step": 53320 }, { "entropy": 5.865471029281617, "epoch": 4.14884263761914, "grad_norm": 1.3125, "learning_rate": 0.00033755578793764375, "loss": 4.9614, "mean_token_accuracy": 0.2141645148396492, "num_tokens": 92497733.0, "step": 53325 }, { "entropy": 5.885203218460083, "epoch": 4.1492316669908575, "grad_norm": 1.421875, "learning_rate": 0.0003375291646005243, "loss": 4.889, "mean_token_accuracy": 0.2166086331009865, "num_tokens": 92505970.0, "step": 53330 }, { "entropy": 5.897160530090332, "epoch": 4.149620696362575, "grad_norm": 1.515625, "learning_rate": 0.00033750254031462425, "loss": 4.8164, "mean_token_accuracy": 0.21901627779006957, "num_tokens": 92514189.0, "step": 53335 }, { "entropy": 5.907404375076294, "epoch": 4.150009725734293, "grad_norm": 1.4140625, "learning_rate": 0.00033747591508034765, "loss": 4.991, "mean_token_accuracy": 0.21511359810829161, "num_tokens": 92523158.0, "step": 53340 }, { "entropy": 5.973261451721191, "epoch": 4.150398755106011, "grad_norm": 1.46875, "learning_rate": 0.0003374492888980985, "loss": 4.9445, "mean_token_accuracy": 0.2234194129705429, "num_tokens": 92531762.0, "step": 53345 }, { "entropy": 5.932356548309326, "epoch": 4.150787784477728, "grad_norm": 1.3984375, "learning_rate": 0.00033742266176828073, "loss": 4.9612, "mean_token_accuracy": 0.21476418972015382, "num_tokens": 92540651.0, "step": 53350 }, { "entropy": 5.901476860046387, "epoch": 4.151176813849446, "grad_norm": 1.359375, "learning_rate": 0.00033739603369129846, "loss": 5.0179, "mean_token_accuracy": 0.20615463554859162, "num_tokens": 92549515.0, "step": 53355 }, { "entropy": 5.896136379241943, "epoch": 4.151565843221163, "grad_norm": 1.3203125, "learning_rate": 0.00033736940466755566, "loss": 4.9214, "mean_token_accuracy": 0.21683864295482635, "num_tokens": 92558574.0, "step": 53360 }, { "entropy": 5.947173452377319, "epoch": 4.1519548725928805, "grad_norm": 1.4140625, "learning_rate": 0.00033734277469745644, "loss": 4.939, "mean_token_accuracy": 0.2134280502796173, "num_tokens": 92566980.0, "step": 53365 }, { "entropy": 5.928539419174195, "epoch": 4.152343901964598, "grad_norm": 1.375, "learning_rate": 0.0003373161437814049, "loss": 4.9889, "mean_token_accuracy": 0.20857737213373184, "num_tokens": 92575293.0, "step": 53370 }, { "entropy": 5.883195400238037, "epoch": 4.152732931336316, "grad_norm": 1.4375, "learning_rate": 0.00033728951191980505, "loss": 4.9514, "mean_token_accuracy": 0.22458741068840027, "num_tokens": 92584347.0, "step": 53375 }, { "entropy": 5.8464783191680905, "epoch": 4.153121960708034, "grad_norm": 1.40625, "learning_rate": 0.00033726287911306095, "loss": 4.8755, "mean_token_accuracy": 0.22081366926431656, "num_tokens": 92592614.0, "step": 53380 }, { "entropy": 5.954621696472168, "epoch": 4.153510990079751, "grad_norm": 1.484375, "learning_rate": 0.0003372362453615768, "loss": 5.0296, "mean_token_accuracy": 0.20822788923978805, "num_tokens": 92601238.0, "step": 53385 }, { "entropy": 5.870832633972168, "epoch": 4.153900019451468, "grad_norm": 1.4453125, "learning_rate": 0.0003372096106657566, "loss": 4.9045, "mean_token_accuracy": 0.2165669247508049, "num_tokens": 92609764.0, "step": 53390 }, { "entropy": 5.901909828186035, "epoch": 4.154289048823186, "grad_norm": 1.453125, "learning_rate": 0.00033718297502600465, "loss": 4.9268, "mean_token_accuracy": 0.21533781588077544, "num_tokens": 92618266.0, "step": 53395 }, { "entropy": 5.918218517303467, "epoch": 4.1546780781949035, "grad_norm": 1.3125, "learning_rate": 0.00033715633844272504, "loss": 4.9225, "mean_token_accuracy": 0.21469749510288239, "num_tokens": 92627213.0, "step": 53400 }, { "entropy": 5.8901652812957765, "epoch": 4.155067107566621, "grad_norm": 1.3359375, "learning_rate": 0.00033712970091632187, "loss": 4.9591, "mean_token_accuracy": 0.2148434489965439, "num_tokens": 92635731.0, "step": 53405 }, { "entropy": 5.816846036911011, "epoch": 4.155456136938339, "grad_norm": 1.40625, "learning_rate": 0.00033710306244719954, "loss": 4.8894, "mean_token_accuracy": 0.22217011600732803, "num_tokens": 92644282.0, "step": 53410 }, { "entropy": 5.929310417175293, "epoch": 4.155845166310057, "grad_norm": 1.40625, "learning_rate": 0.0003370764230357619, "loss": 5.0562, "mean_token_accuracy": 0.20064301937818527, "num_tokens": 92652923.0, "step": 53415 }, { "entropy": 5.944867897033691, "epoch": 4.156234195681774, "grad_norm": 1.3984375, "learning_rate": 0.0003370497826824134, "loss": 4.9648, "mean_token_accuracy": 0.2130206808447838, "num_tokens": 92661849.0, "step": 53420 }, { "entropy": 5.933525943756104, "epoch": 4.156623225053491, "grad_norm": 1.4609375, "learning_rate": 0.0003370231413875582, "loss": 4.9746, "mean_token_accuracy": 0.2136972203850746, "num_tokens": 92670152.0, "step": 53425 }, { "entropy": 5.871288537979126, "epoch": 4.157012254425209, "grad_norm": 1.3828125, "learning_rate": 0.00033699649915160053, "loss": 4.9181, "mean_token_accuracy": 0.21274385303258897, "num_tokens": 92678363.0, "step": 53430 }, { "entropy": 5.921407270431518, "epoch": 4.1574012837969265, "grad_norm": 1.390625, "learning_rate": 0.00033696985597494474, "loss": 4.9911, "mean_token_accuracy": 0.21379802525043487, "num_tokens": 92686648.0, "step": 53435 }, { "entropy": 5.974479341506958, "epoch": 4.157790313168644, "grad_norm": 1.3984375, "learning_rate": 0.000336943211857995, "loss": 5.0599, "mean_token_accuracy": 0.2102423459291458, "num_tokens": 92694965.0, "step": 53440 }, { "entropy": 5.905294799804688, "epoch": 4.158179342540362, "grad_norm": 1.4609375, "learning_rate": 0.0003369165668011556, "loss": 4.9339, "mean_token_accuracy": 0.21884283423423767, "num_tokens": 92703274.0, "step": 53445 }, { "entropy": 5.8830845832824705, "epoch": 4.15856837191208, "grad_norm": 1.375, "learning_rate": 0.0003368899208048308, "loss": 4.9339, "mean_token_accuracy": 0.22338421642780304, "num_tokens": 92711758.0, "step": 53450 }, { "entropy": 5.837594795227051, "epoch": 4.158957401283797, "grad_norm": 1.4140625, "learning_rate": 0.00033686327386942504, "loss": 4.8799, "mean_token_accuracy": 0.2190188854932785, "num_tokens": 92720090.0, "step": 53455 }, { "entropy": 5.8626007556915285, "epoch": 4.159346430655514, "grad_norm": 1.4921875, "learning_rate": 0.0003368366259953425, "loss": 4.9265, "mean_token_accuracy": 0.21472094655036927, "num_tokens": 92728951.0, "step": 53460 }, { "entropy": 5.863406467437744, "epoch": 4.159735460027232, "grad_norm": 1.328125, "learning_rate": 0.00033680997718298756, "loss": 4.9359, "mean_token_accuracy": 0.211899097263813, "num_tokens": 92738552.0, "step": 53465 }, { "entropy": 5.975723838806152, "epoch": 4.1601244893989495, "grad_norm": 1.4921875, "learning_rate": 0.00033678332743276466, "loss": 5.0033, "mean_token_accuracy": 0.2125203177332878, "num_tokens": 92747060.0, "step": 53470 }, { "entropy": 5.907132816314697, "epoch": 4.160513518770667, "grad_norm": 1.4453125, "learning_rate": 0.0003367566767450781, "loss": 4.951, "mean_token_accuracy": 0.20979761183261872, "num_tokens": 92755490.0, "step": 53475 }, { "entropy": 5.9527746677398685, "epoch": 4.160902548142385, "grad_norm": 1.421875, "learning_rate": 0.00033673002512033223, "loss": 5.0201, "mean_token_accuracy": 0.21719395369291306, "num_tokens": 92764285.0, "step": 53480 }, { "entropy": 5.940624380111695, "epoch": 4.161291577514103, "grad_norm": 1.5625, "learning_rate": 0.0003367033725589315, "loss": 4.9675, "mean_token_accuracy": 0.21751809269189834, "num_tokens": 92772282.0, "step": 53485 }, { "entropy": 5.929183101654052, "epoch": 4.16168060688582, "grad_norm": 1.3828125, "learning_rate": 0.0003366767190612804, "loss": 4.9861, "mean_token_accuracy": 0.21386780142784118, "num_tokens": 92782441.0, "step": 53490 }, { "entropy": 5.972880077362061, "epoch": 4.162069636257537, "grad_norm": 1.34375, "learning_rate": 0.0003366500646277831, "loss": 5.0099, "mean_token_accuracy": 0.2056671768426895, "num_tokens": 92791758.0, "step": 53495 }, { "entropy": 5.854140138626098, "epoch": 4.162458665629255, "grad_norm": 1.375, "learning_rate": 0.0003366234092588443, "loss": 4.9142, "mean_token_accuracy": 0.2104744866490364, "num_tokens": 92800484.0, "step": 53500 }, { "entropy": 5.911714506149292, "epoch": 4.1628476950009725, "grad_norm": 1.3984375, "learning_rate": 0.00033659675295486826, "loss": 5.0051, "mean_token_accuracy": 0.2139746367931366, "num_tokens": 92809640.0, "step": 53505 }, { "entropy": 5.872619581222534, "epoch": 4.16323672437269, "grad_norm": 1.3984375, "learning_rate": 0.00033657009571625964, "loss": 4.8781, "mean_token_accuracy": 0.20747690945863723, "num_tokens": 92817810.0, "step": 53510 }, { "entropy": 5.940346622467041, "epoch": 4.163625753744408, "grad_norm": 1.5234375, "learning_rate": 0.0003365434375434227, "loss": 4.9514, "mean_token_accuracy": 0.21364800333976747, "num_tokens": 92826719.0, "step": 53515 }, { "entropy": 5.910753297805786, "epoch": 4.164014783116126, "grad_norm": 1.4375, "learning_rate": 0.00033651677843676213, "loss": 4.9928, "mean_token_accuracy": 0.2066065862774849, "num_tokens": 92835612.0, "step": 53520 }, { "entropy": 5.966928243637085, "epoch": 4.164403812487842, "grad_norm": 1.421875, "learning_rate": 0.0003364901183966824, "loss": 4.9931, "mean_token_accuracy": 0.21317997574806213, "num_tokens": 92844980.0, "step": 53525 }, { "entropy": 5.934340190887451, "epoch": 4.16479284185956, "grad_norm": 1.3359375, "learning_rate": 0.0003364634574235879, "loss": 4.9447, "mean_token_accuracy": 0.21803470253944396, "num_tokens": 92853733.0, "step": 53530 }, { "entropy": 5.879807043075561, "epoch": 4.165181871231278, "grad_norm": 1.53125, "learning_rate": 0.00033643679551788325, "loss": 4.9022, "mean_token_accuracy": 0.22135170549154282, "num_tokens": 92861944.0, "step": 53535 }, { "entropy": 5.88996958732605, "epoch": 4.1655709006029955, "grad_norm": 1.3125, "learning_rate": 0.00033641013267997317, "loss": 4.9836, "mean_token_accuracy": 0.21443108916282655, "num_tokens": 92871177.0, "step": 53540 }, { "entropy": 5.868205213546753, "epoch": 4.165959929974713, "grad_norm": 1.3984375, "learning_rate": 0.00033638346891026196, "loss": 4.8813, "mean_token_accuracy": 0.21499197781085969, "num_tokens": 92879848.0, "step": 53545 }, { "entropy": 5.91450719833374, "epoch": 4.166348959346431, "grad_norm": 1.2890625, "learning_rate": 0.00033635680420915424, "loss": 4.8863, "mean_token_accuracy": 0.22100455462932586, "num_tokens": 92888381.0, "step": 53550 }, { "entropy": 5.843396329879761, "epoch": 4.166737988718149, "grad_norm": 1.3984375, "learning_rate": 0.0003363301385770548, "loss": 4.8757, "mean_token_accuracy": 0.21630217581987382, "num_tokens": 92897447.0, "step": 53555 }, { "entropy": 5.898119115829468, "epoch": 4.167127018089865, "grad_norm": 1.4453125, "learning_rate": 0.00033630347201436806, "loss": 5.0347, "mean_token_accuracy": 0.2091578245162964, "num_tokens": 92905820.0, "step": 53560 }, { "entropy": 5.892198753356934, "epoch": 4.167516047461583, "grad_norm": 1.4609375, "learning_rate": 0.00033627680452149873, "loss": 5.0041, "mean_token_accuracy": 0.21721869856119155, "num_tokens": 92913933.0, "step": 53565 }, { "entropy": 5.884625053405761, "epoch": 4.167905076833301, "grad_norm": 1.3984375, "learning_rate": 0.0003362501360988514, "loss": 4.8906, "mean_token_accuracy": 0.21452568471431732, "num_tokens": 92922730.0, "step": 53570 }, { "entropy": 5.904813957214356, "epoch": 4.1682941062050185, "grad_norm": 1.4765625, "learning_rate": 0.0003362234667468308, "loss": 4.8876, "mean_token_accuracy": 0.21633876115083694, "num_tokens": 92931367.0, "step": 53575 }, { "entropy": 5.914651393890381, "epoch": 4.168683135576736, "grad_norm": 1.296875, "learning_rate": 0.0003361967964658415, "loss": 4.9877, "mean_token_accuracy": 0.20863874703645707, "num_tokens": 92939806.0, "step": 53580 }, { "entropy": 5.942535448074341, "epoch": 4.169072164948454, "grad_norm": 1.6640625, "learning_rate": 0.0003361701252562882, "loss": 5.0572, "mean_token_accuracy": 0.21090054512023926, "num_tokens": 92948235.0, "step": 53585 }, { "entropy": 5.9426638126373295, "epoch": 4.169461194320172, "grad_norm": 1.40625, "learning_rate": 0.00033614345311857566, "loss": 4.932, "mean_token_accuracy": 0.21251779049634933, "num_tokens": 92957091.0, "step": 53590 }, { "entropy": 5.886492538452148, "epoch": 4.169850223691888, "grad_norm": 1.3515625, "learning_rate": 0.0003361167800531085, "loss": 4.8882, "mean_token_accuracy": 0.22059376537799835, "num_tokens": 92966792.0, "step": 53595 }, { "entropy": 5.9472582817077635, "epoch": 4.170239253063606, "grad_norm": 1.3828125, "learning_rate": 0.0003360901060602915, "loss": 4.9867, "mean_token_accuracy": 0.2082020729780197, "num_tokens": 92975005.0, "step": 53600 }, { "entropy": 5.827044057846069, "epoch": 4.170628282435324, "grad_norm": 1.296875, "learning_rate": 0.00033606343114052936, "loss": 4.8734, "mean_token_accuracy": 0.22196402102708818, "num_tokens": 92983532.0, "step": 53605 }, { "entropy": 5.92602424621582, "epoch": 4.1710173118070415, "grad_norm": 1.390625, "learning_rate": 0.00033603675529422685, "loss": 5.0078, "mean_token_accuracy": 0.20374674946069718, "num_tokens": 92992554.0, "step": 53610 }, { "entropy": 5.887905788421631, "epoch": 4.171406341178759, "grad_norm": 1.40625, "learning_rate": 0.0003360100785217887, "loss": 4.8799, "mean_token_accuracy": 0.22075749486684798, "num_tokens": 93001596.0, "step": 53615 }, { "entropy": 5.947287654876709, "epoch": 4.171795370550477, "grad_norm": 1.3046875, "learning_rate": 0.0003359834008236198, "loss": 4.9896, "mean_token_accuracy": 0.21106477677822114, "num_tokens": 93010767.0, "step": 53620 }, { "entropy": 5.806873798370361, "epoch": 4.172184399922194, "grad_norm": 1.4453125, "learning_rate": 0.0003359567222001248, "loss": 4.8956, "mean_token_accuracy": 0.22674275040626526, "num_tokens": 93019723.0, "step": 53625 }, { "entropy": 5.877566146850586, "epoch": 4.172573429293911, "grad_norm": 1.3359375, "learning_rate": 0.0003359300426517085, "loss": 4.9193, "mean_token_accuracy": 0.22000922560691832, "num_tokens": 93028642.0, "step": 53630 }, { "entropy": 5.893415451049805, "epoch": 4.172962458665629, "grad_norm": 1.4140625, "learning_rate": 0.0003359033621787759, "loss": 4.916, "mean_token_accuracy": 0.21513424217700958, "num_tokens": 93037789.0, "step": 53635 }, { "entropy": 5.82288088798523, "epoch": 4.173351488037347, "grad_norm": 1.421875, "learning_rate": 0.0003358766807817317, "loss": 4.8797, "mean_token_accuracy": 0.22486298382282258, "num_tokens": 93046351.0, "step": 53640 }, { "entropy": 5.893827724456787, "epoch": 4.1737405174090645, "grad_norm": 1.53125, "learning_rate": 0.0003358499984609807, "loss": 4.9336, "mean_token_accuracy": 0.2190068021416664, "num_tokens": 93054628.0, "step": 53645 }, { "entropy": 5.900408697128296, "epoch": 4.174129546780782, "grad_norm": 1.3359375, "learning_rate": 0.0003358233152169278, "loss": 4.9521, "mean_token_accuracy": 0.21950263977050782, "num_tokens": 93063102.0, "step": 53650 }, { "entropy": 5.90348539352417, "epoch": 4.1745185761525, "grad_norm": 1.3359375, "learning_rate": 0.00033579663104997803, "loss": 4.9479, "mean_token_accuracy": 0.21864834427833557, "num_tokens": 93071874.0, "step": 53655 }, { "entropy": 5.838825845718384, "epoch": 4.174907605524217, "grad_norm": 1.40625, "learning_rate": 0.00033576994596053606, "loss": 4.8693, "mean_token_accuracy": 0.21873281002044678, "num_tokens": 93080353.0, "step": 53660 }, { "entropy": 5.899511384963989, "epoch": 4.175296634895934, "grad_norm": 1.390625, "learning_rate": 0.0003357432599490069, "loss": 5.0528, "mean_token_accuracy": 0.20657528042793274, "num_tokens": 93088952.0, "step": 53665 }, { "entropy": 5.885079002380371, "epoch": 4.175685664267652, "grad_norm": 1.4609375, "learning_rate": 0.00033571657301579547, "loss": 4.9122, "mean_token_accuracy": 0.21375426948070525, "num_tokens": 93096901.0, "step": 53670 }, { "entropy": 5.925373458862305, "epoch": 4.17607469363937, "grad_norm": 1.4140625, "learning_rate": 0.0003356898851613067, "loss": 4.9694, "mean_token_accuracy": 0.21541971415281297, "num_tokens": 93105499.0, "step": 53675 }, { "entropy": 6.004173040390015, "epoch": 4.1764637230110875, "grad_norm": 1.4453125, "learning_rate": 0.0003356631963859455, "loss": 5.0501, "mean_token_accuracy": 0.20558395683765412, "num_tokens": 93114238.0, "step": 53680 }, { "entropy": 5.933343696594238, "epoch": 4.176852752382805, "grad_norm": 1.3515625, "learning_rate": 0.0003356365066901168, "loss": 5.0051, "mean_token_accuracy": 0.21496293395757676, "num_tokens": 93123539.0, "step": 53685 }, { "entropy": 5.882346773147583, "epoch": 4.177241781754523, "grad_norm": 1.40625, "learning_rate": 0.00033560981607422567, "loss": 4.8846, "mean_token_accuracy": 0.22057074904441834, "num_tokens": 93131827.0, "step": 53690 }, { "entropy": 5.860810470581055, "epoch": 4.17763081112624, "grad_norm": 1.3046875, "learning_rate": 0.00033558312453867703, "loss": 4.8836, "mean_token_accuracy": 0.22262519896030425, "num_tokens": 93141389.0, "step": 53695 }, { "entropy": 5.865365076065063, "epoch": 4.178019840497957, "grad_norm": 1.46875, "learning_rate": 0.00033555643208387593, "loss": 4.8252, "mean_token_accuracy": 0.21895772963762283, "num_tokens": 93149564.0, "step": 53700 }, { "entropy": 5.91902265548706, "epoch": 4.178408869869675, "grad_norm": 1.515625, "learning_rate": 0.00033552973871022737, "loss": 4.8853, "mean_token_accuracy": 0.2191261500120163, "num_tokens": 93157386.0, "step": 53705 }, { "entropy": 5.935545921325684, "epoch": 4.178797899241393, "grad_norm": 1.421875, "learning_rate": 0.00033550304441813634, "loss": 4.9957, "mean_token_accuracy": 0.21027239561080932, "num_tokens": 93166785.0, "step": 53710 }, { "entropy": 5.887098932266236, "epoch": 4.1791869286131105, "grad_norm": 1.4140625, "learning_rate": 0.0003354763492080079, "loss": 4.9491, "mean_token_accuracy": 0.21995031386613845, "num_tokens": 93174971.0, "step": 53715 }, { "entropy": 5.903947877883911, "epoch": 4.179575957984828, "grad_norm": 1.3515625, "learning_rate": 0.0003354496530802472, "loss": 4.9388, "mean_token_accuracy": 0.21165534406900405, "num_tokens": 93182619.0, "step": 53720 }, { "entropy": 5.93675127029419, "epoch": 4.179964987356545, "grad_norm": 1.34375, "learning_rate": 0.0003354229560352592, "loss": 4.9898, "mean_token_accuracy": 0.2147631898522377, "num_tokens": 93192200.0, "step": 53725 }, { "entropy": 5.921198463439941, "epoch": 4.180354016728263, "grad_norm": 1.421875, "learning_rate": 0.0003353962580734489, "loss": 4.9371, "mean_token_accuracy": 0.20910192728042604, "num_tokens": 93200310.0, "step": 53730 }, { "entropy": 5.917319393157959, "epoch": 4.18074304609998, "grad_norm": 1.2890625, "learning_rate": 0.00033536955919522167, "loss": 5.0222, "mean_token_accuracy": 0.21281781494617463, "num_tokens": 93209112.0, "step": 53735 }, { "entropy": 5.937884330749512, "epoch": 4.181132075471698, "grad_norm": 1.484375, "learning_rate": 0.0003353428594009824, "loss": 5.0207, "mean_token_accuracy": 0.21170932203531265, "num_tokens": 93217142.0, "step": 53740 }, { "entropy": 5.9074506759643555, "epoch": 4.181521104843416, "grad_norm": 1.3515625, "learning_rate": 0.00033531615869113624, "loss": 4.9157, "mean_token_accuracy": 0.21416405886411666, "num_tokens": 93225483.0, "step": 53745 }, { "entropy": 5.943867492675781, "epoch": 4.1819101342151335, "grad_norm": 1.390625, "learning_rate": 0.00033528945706608844, "loss": 4.9924, "mean_token_accuracy": 0.20643789023160936, "num_tokens": 93234292.0, "step": 53750 }, { "entropy": 5.926475620269775, "epoch": 4.182299163586851, "grad_norm": 1.34375, "learning_rate": 0.00033526275452624407, "loss": 4.9624, "mean_token_accuracy": 0.21229031234979628, "num_tokens": 93242837.0, "step": 53755 }, { "entropy": 5.905855894088745, "epoch": 4.182688192958568, "grad_norm": 1.3359375, "learning_rate": 0.00033523605107200826, "loss": 4.9053, "mean_token_accuracy": 0.22321490645408631, "num_tokens": 93251763.0, "step": 53760 }, { "entropy": 5.8698139667510985, "epoch": 4.183077222330286, "grad_norm": 1.421875, "learning_rate": 0.00033520934670378634, "loss": 4.8434, "mean_token_accuracy": 0.22865576595067977, "num_tokens": 93260262.0, "step": 53765 }, { "entropy": 5.915475130081177, "epoch": 4.183466251702003, "grad_norm": 1.421875, "learning_rate": 0.00033518264142198335, "loss": 4.9522, "mean_token_accuracy": 0.21047503054141997, "num_tokens": 93268924.0, "step": 53770 }, { "entropy": 5.962980842590332, "epoch": 4.183855281073721, "grad_norm": 1.484375, "learning_rate": 0.0003351559352270047, "loss": 4.9913, "mean_token_accuracy": 0.21400743424892427, "num_tokens": 93278073.0, "step": 53775 }, { "entropy": 5.911512422561645, "epoch": 4.184244310445439, "grad_norm": 1.46875, "learning_rate": 0.00033512922811925535, "loss": 4.9297, "mean_token_accuracy": 0.21192835718393327, "num_tokens": 93287164.0, "step": 53780 }, { "entropy": 5.888061952590943, "epoch": 4.1846333398171565, "grad_norm": 1.53125, "learning_rate": 0.0003351025200991406, "loss": 4.9979, "mean_token_accuracy": 0.21248734891414642, "num_tokens": 93295687.0, "step": 53785 }, { "entropy": 5.93458366394043, "epoch": 4.185022369188874, "grad_norm": 1.421875, "learning_rate": 0.0003350758111670659, "loss": 4.9655, "mean_token_accuracy": 0.21652792543172836, "num_tokens": 93304334.0, "step": 53790 }, { "entropy": 5.917180824279785, "epoch": 4.185411398560591, "grad_norm": 1.53125, "learning_rate": 0.0003350491013234364, "loss": 4.9023, "mean_token_accuracy": 0.2128070890903473, "num_tokens": 93312370.0, "step": 53795 }, { "entropy": 5.933994197845459, "epoch": 4.185800427932309, "grad_norm": 1.4296875, "learning_rate": 0.0003350223905686573, "loss": 5.0212, "mean_token_accuracy": 0.20935048907995224, "num_tokens": 93320310.0, "step": 53800 }, { "entropy": 5.916634845733642, "epoch": 4.186189457304026, "grad_norm": 1.5, "learning_rate": 0.000334995678903134, "loss": 4.8874, "mean_token_accuracy": 0.21783160269260407, "num_tokens": 93328480.0, "step": 53805 }, { "entropy": 5.90133228302002, "epoch": 4.186578486675744, "grad_norm": 1.8046875, "learning_rate": 0.0003349689663272718, "loss": 5.008, "mean_token_accuracy": 0.21822841018438338, "num_tokens": 93337643.0, "step": 53810 }, { "entropy": 5.978509950637817, "epoch": 4.186967516047462, "grad_norm": 1.3359375, "learning_rate": 0.0003349422528414759, "loss": 4.989, "mean_token_accuracy": 0.2182777240872383, "num_tokens": 93346216.0, "step": 53815 }, { "entropy": 6.004340744018554, "epoch": 4.1873565454191795, "grad_norm": 1.4140625, "learning_rate": 0.0003349155384461517, "loss": 5.0473, "mean_token_accuracy": 0.20166324377059935, "num_tokens": 93354713.0, "step": 53820 }, { "entropy": 6.00973916053772, "epoch": 4.187745574790897, "grad_norm": 1.4296875, "learning_rate": 0.00033488882314170463, "loss": 5.0542, "mean_token_accuracy": 0.2076243758201599, "num_tokens": 93363373.0, "step": 53825 }, { "entropy": 5.992966222763061, "epoch": 4.188134604162614, "grad_norm": 1.5625, "learning_rate": 0.00033486210692854, "loss": 4.9618, "mean_token_accuracy": 0.21450628489255905, "num_tokens": 93370960.0, "step": 53830 }, { "entropy": 5.9579085350036625, "epoch": 4.188523633534332, "grad_norm": 1.40625, "learning_rate": 0.0003348353898070631, "loss": 4.9739, "mean_token_accuracy": 0.21519456803798676, "num_tokens": 93379807.0, "step": 53835 }, { "entropy": 5.829697704315185, "epoch": 4.188912662906049, "grad_norm": 1.3359375, "learning_rate": 0.0003348086717776795, "loss": 4.8287, "mean_token_accuracy": 0.22600819915533066, "num_tokens": 93388411.0, "step": 53840 }, { "entropy": 5.90871958732605, "epoch": 4.189301692277767, "grad_norm": 1.4921875, "learning_rate": 0.00033478195284079447, "loss": 4.9608, "mean_token_accuracy": 0.21399974822998047, "num_tokens": 93396870.0, "step": 53845 }, { "entropy": 5.899751091003418, "epoch": 4.189690721649485, "grad_norm": 1.3828125, "learning_rate": 0.0003347552329968134, "loss": 4.8938, "mean_token_accuracy": 0.22584719955921173, "num_tokens": 93405065.0, "step": 53850 }, { "entropy": 5.886652231216431, "epoch": 4.1900797510212024, "grad_norm": 1.453125, "learning_rate": 0.0003347285122461419, "loss": 4.8293, "mean_token_accuracy": 0.22612337321043013, "num_tokens": 93413842.0, "step": 53855 }, { "entropy": 5.904062795639038, "epoch": 4.190468780392919, "grad_norm": 1.3515625, "learning_rate": 0.0003347017905891852, "loss": 4.9102, "mean_token_accuracy": 0.21231829077005387, "num_tokens": 93423269.0, "step": 53860 }, { "entropy": 5.839717769622803, "epoch": 4.190857809764637, "grad_norm": 1.4140625, "learning_rate": 0.0003346750680263488, "loss": 4.9288, "mean_token_accuracy": 0.21997540444135666, "num_tokens": 93432294.0, "step": 53865 }, { "entropy": 5.881240177154541, "epoch": 4.191246839136355, "grad_norm": 1.34375, "learning_rate": 0.0003346483445580384, "loss": 4.9202, "mean_token_accuracy": 0.21836688816547395, "num_tokens": 93440791.0, "step": 53870 }, { "entropy": 5.925094842910767, "epoch": 4.191635868508072, "grad_norm": 1.3984375, "learning_rate": 0.00033462162018465917, "loss": 4.8938, "mean_token_accuracy": 0.21971093416213988, "num_tokens": 93449256.0, "step": 53875 }, { "entropy": 5.926153707504272, "epoch": 4.19202489787979, "grad_norm": 1.34375, "learning_rate": 0.00033459489490661676, "loss": 4.9394, "mean_token_accuracy": 0.2190354883670807, "num_tokens": 93457680.0, "step": 53880 }, { "entropy": 5.881261587142944, "epoch": 4.192413927251508, "grad_norm": 1.34375, "learning_rate": 0.00033456816872431673, "loss": 4.9293, "mean_token_accuracy": 0.22156398892402648, "num_tokens": 93465975.0, "step": 53885 }, { "entropy": 5.902797746658325, "epoch": 4.192802956623225, "grad_norm": 1.3984375, "learning_rate": 0.0003345414416381645, "loss": 4.9472, "mean_token_accuracy": 0.22233942598104478, "num_tokens": 93475522.0, "step": 53890 }, { "entropy": 5.882423782348633, "epoch": 4.193191985994942, "grad_norm": 1.5078125, "learning_rate": 0.00033451471364856565, "loss": 4.9314, "mean_token_accuracy": 0.21614208817481995, "num_tokens": 93483876.0, "step": 53895 }, { "entropy": 5.975253582000732, "epoch": 4.19358101536666, "grad_norm": 1.453125, "learning_rate": 0.00033448798475592585, "loss": 5.0129, "mean_token_accuracy": 0.2099709615111351, "num_tokens": 93491628.0, "step": 53900 }, { "entropy": 5.8995108127594, "epoch": 4.193970044738378, "grad_norm": 1.34375, "learning_rate": 0.0003344612549606505, "loss": 4.9584, "mean_token_accuracy": 0.2150569438934326, "num_tokens": 93500513.0, "step": 53905 }, { "entropy": 5.863328742980957, "epoch": 4.194359074110095, "grad_norm": 1.4140625, "learning_rate": 0.0003344345242631453, "loss": 4.882, "mean_token_accuracy": 0.220084285736084, "num_tokens": 93509375.0, "step": 53910 }, { "entropy": 5.986605405807495, "epoch": 4.194748103481813, "grad_norm": 1.515625, "learning_rate": 0.0003344077926638157, "loss": 4.9943, "mean_token_accuracy": 0.2117048218846321, "num_tokens": 93517824.0, "step": 53915 }, { "entropy": 5.922944688796997, "epoch": 4.195137132853531, "grad_norm": 1.515625, "learning_rate": 0.00033438106016306753, "loss": 4.8879, "mean_token_accuracy": 0.22066328078508377, "num_tokens": 93526224.0, "step": 53920 }, { "entropy": 5.8422276973724365, "epoch": 4.195526162225248, "grad_norm": 1.3046875, "learning_rate": 0.0003343543267613062, "loss": 4.9503, "mean_token_accuracy": 0.2202147737145424, "num_tokens": 93534817.0, "step": 53925 }, { "entropy": 5.897165727615357, "epoch": 4.195915191596965, "grad_norm": 1.3359375, "learning_rate": 0.0003343275924589374, "loss": 5.032, "mean_token_accuracy": 0.20735633969306946, "num_tokens": 93544445.0, "step": 53930 }, { "entropy": 5.9483850479125975, "epoch": 4.196304220968683, "grad_norm": 1.34375, "learning_rate": 0.00033430085725636685, "loss": 4.9602, "mean_token_accuracy": 0.21511916518211366, "num_tokens": 93553756.0, "step": 53935 }, { "entropy": 5.893982887268066, "epoch": 4.196693250340401, "grad_norm": 1.5078125, "learning_rate": 0.0003342741211540002, "loss": 4.8816, "mean_token_accuracy": 0.21888074576854705, "num_tokens": 93562118.0, "step": 53940 }, { "entropy": 5.804582786560059, "epoch": 4.197082279712118, "grad_norm": 1.3984375, "learning_rate": 0.0003342473841522431, "loss": 4.8467, "mean_token_accuracy": 0.22164036929607392, "num_tokens": 93570594.0, "step": 53945 }, { "entropy": 5.8978447914123535, "epoch": 4.197471309083836, "grad_norm": 1.484375, "learning_rate": 0.00033422064625150124, "loss": 4.9421, "mean_token_accuracy": 0.21479247659444808, "num_tokens": 93579604.0, "step": 53950 }, { "entropy": 5.907360458374024, "epoch": 4.197860338455554, "grad_norm": 1.453125, "learning_rate": 0.0003341939074521804, "loss": 4.9488, "mean_token_accuracy": 0.2215973913669586, "num_tokens": 93588489.0, "step": 53955 }, { "entropy": 5.912613201141357, "epoch": 4.1982493678272705, "grad_norm": 1.4765625, "learning_rate": 0.0003341671677546861, "loss": 4.946, "mean_token_accuracy": 0.2156466543674469, "num_tokens": 93596935.0, "step": 53960 }, { "entropy": 5.909515285491944, "epoch": 4.198638397198988, "grad_norm": 1.4296875, "learning_rate": 0.00033414042715942423, "loss": 5.0025, "mean_token_accuracy": 0.21308566331863404, "num_tokens": 93605826.0, "step": 53965 }, { "entropy": 5.960588026046753, "epoch": 4.199027426570706, "grad_norm": 1.3984375, "learning_rate": 0.0003341136856668005, "loss": 4.9914, "mean_token_accuracy": 0.21759190112352372, "num_tokens": 93614077.0, "step": 53970 }, { "entropy": 5.910334491729737, "epoch": 4.199416455942424, "grad_norm": 1.421875, "learning_rate": 0.0003340869432772207, "loss": 4.8742, "mean_token_accuracy": 0.2211216390132904, "num_tokens": 93622891.0, "step": 53975 }, { "entropy": 5.883740997314453, "epoch": 4.199805485314141, "grad_norm": 1.4609375, "learning_rate": 0.00033406019999109065, "loss": 4.9221, "mean_token_accuracy": 0.21255738884210587, "num_tokens": 93631454.0, "step": 53980 }, { "entropy": 5.868894004821778, "epoch": 4.200194514685859, "grad_norm": 1.4375, "learning_rate": 0.00033403345580881606, "loss": 4.889, "mean_token_accuracy": 0.21944913268089294, "num_tokens": 93639707.0, "step": 53985 }, { "entropy": 5.896656131744384, "epoch": 4.200583544057577, "grad_norm": 1.53125, "learning_rate": 0.00033400671073080274, "loss": 4.9458, "mean_token_accuracy": 0.21386097371578217, "num_tokens": 93648285.0, "step": 53990 }, { "entropy": 5.922615671157837, "epoch": 4.2009725734292935, "grad_norm": 1.4140625, "learning_rate": 0.0003339799647574564, "loss": 5.0525, "mean_token_accuracy": 0.2110658124089241, "num_tokens": 93656747.0, "step": 53995 }, { "entropy": 5.931103897094727, "epoch": 4.201361602801011, "grad_norm": 1.40625, "learning_rate": 0.0003339532178891831, "loss": 4.9889, "mean_token_accuracy": 0.21166858077049255, "num_tokens": 93665650.0, "step": 54000 }, { "epoch": 4.201361602801011, "eval_entropy": 5.642706782824725, "eval_loss": 5.066500663757324, "eval_mean_token_accuracy": 0.21840525301920896, "eval_num_tokens": 93665650.0, "eval_runtime": 21.6617, "eval_samples_per_second": 1918.502, "eval_steps_per_second": 239.824, "step": 54000 }, { "entropy": 5.925408506393433, "epoch": 4.201750632172729, "grad_norm": 1.4375, "learning_rate": 0.0003339264701263885, "loss": 5.0281, "mean_token_accuracy": 0.20960671454668045, "num_tokens": 93674057.0, "step": 54005 }, { "entropy": 5.881590080261231, "epoch": 4.202139661544447, "grad_norm": 1.421875, "learning_rate": 0.0003338997214694784, "loss": 4.9306, "mean_token_accuracy": 0.2158917173743248, "num_tokens": 93682392.0, "step": 54010 }, { "entropy": 5.970138740539551, "epoch": 4.202528690916164, "grad_norm": 1.5703125, "learning_rate": 0.00033387297191885896, "loss": 5.0046, "mean_token_accuracy": 0.2105448827147484, "num_tokens": 93691477.0, "step": 54015 }, { "entropy": 5.901133489608765, "epoch": 4.202917720287882, "grad_norm": 1.4609375, "learning_rate": 0.0003338462214749358, "loss": 4.8878, "mean_token_accuracy": 0.22796996533870698, "num_tokens": 93700398.0, "step": 54020 }, { "entropy": 5.831226778030396, "epoch": 4.2033067496596, "grad_norm": 1.3515625, "learning_rate": 0.0003338194701381148, "loss": 4.9253, "mean_token_accuracy": 0.21541440188884736, "num_tokens": 93709149.0, "step": 54025 }, { "entropy": 5.961451625823974, "epoch": 4.2036957790313165, "grad_norm": 1.3671875, "learning_rate": 0.00033379271790880203, "loss": 5.079, "mean_token_accuracy": 0.20318375825881957, "num_tokens": 93717355.0, "step": 54030 }, { "entropy": 5.951258134841919, "epoch": 4.204084808403034, "grad_norm": 1.484375, "learning_rate": 0.0003337659647874034, "loss": 4.9909, "mean_token_accuracy": 0.20885471105575562, "num_tokens": 93725798.0, "step": 54035 }, { "entropy": 5.92584080696106, "epoch": 4.204473837774752, "grad_norm": 1.3515625, "learning_rate": 0.0003337392107743248, "loss": 5.0101, "mean_token_accuracy": 0.21253875643014908, "num_tokens": 93734526.0, "step": 54040 }, { "entropy": 5.9423479557037355, "epoch": 4.20486286714647, "grad_norm": 1.375, "learning_rate": 0.0003337124558699721, "loss": 5.0527, "mean_token_accuracy": 0.20558874756097795, "num_tokens": 93742611.0, "step": 54045 }, { "entropy": 5.870625734329224, "epoch": 4.205251896518187, "grad_norm": 1.3046875, "learning_rate": 0.00033368570007475133, "loss": 4.8966, "mean_token_accuracy": 0.21827151328325273, "num_tokens": 93750852.0, "step": 54050 }, { "entropy": 5.967768383026123, "epoch": 4.205640925889905, "grad_norm": 1.5234375, "learning_rate": 0.0003336589433890685, "loss": 5.0354, "mean_token_accuracy": 0.21154582798480986, "num_tokens": 93759382.0, "step": 54055 }, { "entropy": 5.922215700149536, "epoch": 4.206029955261622, "grad_norm": 1.3515625, "learning_rate": 0.00033363218581332956, "loss": 4.9486, "mean_token_accuracy": 0.22194952964782716, "num_tokens": 93768628.0, "step": 54060 }, { "entropy": 5.972916030883789, "epoch": 4.2064189846333395, "grad_norm": 1.5, "learning_rate": 0.0003336054273479405, "loss": 5.0597, "mean_token_accuracy": 0.20634615868330003, "num_tokens": 93776946.0, "step": 54065 }, { "entropy": 5.939820098876953, "epoch": 4.206808014005057, "grad_norm": 1.46875, "learning_rate": 0.00033357866799330743, "loss": 5.0072, "mean_token_accuracy": 0.20996624678373338, "num_tokens": 93786844.0, "step": 54070 }, { "entropy": 5.945168447494507, "epoch": 4.207197043376775, "grad_norm": 1.25, "learning_rate": 0.00033355190774983626, "loss": 4.9389, "mean_token_accuracy": 0.22278840988874435, "num_tokens": 93795341.0, "step": 54075 }, { "entropy": 5.841437435150146, "epoch": 4.207586072748493, "grad_norm": 1.4375, "learning_rate": 0.00033352514661793306, "loss": 4.8943, "mean_token_accuracy": 0.21833660900592805, "num_tokens": 93804035.0, "step": 54080 }, { "entropy": 5.90973653793335, "epoch": 4.20797510212021, "grad_norm": 1.40625, "learning_rate": 0.00033349838459800394, "loss": 4.9321, "mean_token_accuracy": 0.21638155430555345, "num_tokens": 93813127.0, "step": 54085 }, { "entropy": 5.898960304260254, "epoch": 4.208364131491928, "grad_norm": 1.3125, "learning_rate": 0.000333471621690455, "loss": 4.9236, "mean_token_accuracy": 0.21833309382200242, "num_tokens": 93821993.0, "step": 54090 }, { "entropy": 5.954837656021118, "epoch": 4.208753160863645, "grad_norm": 1.421875, "learning_rate": 0.0003334448578956921, "loss": 4.9928, "mean_token_accuracy": 0.21387771368026734, "num_tokens": 93830944.0, "step": 54095 }, { "entropy": 5.9551682472229, "epoch": 4.2091421902353625, "grad_norm": 1.53125, "learning_rate": 0.0003334180932141217, "loss": 4.9366, "mean_token_accuracy": 0.21888377517461777, "num_tokens": 93839088.0, "step": 54100 }, { "entropy": 5.914205741882324, "epoch": 4.20953121960708, "grad_norm": 1.4296875, "learning_rate": 0.0003333913276461497, "loss": 4.9744, "mean_token_accuracy": 0.21496440470218658, "num_tokens": 93848426.0, "step": 54105 }, { "entropy": 5.887797212600708, "epoch": 4.209920248978798, "grad_norm": 1.2890625, "learning_rate": 0.00033336456119218214, "loss": 4.9328, "mean_token_accuracy": 0.21225731074810028, "num_tokens": 93857455.0, "step": 54110 }, { "entropy": 5.952798509597779, "epoch": 4.210309278350516, "grad_norm": 1.3828125, "learning_rate": 0.00033333779385262525, "loss": 5.0353, "mean_token_accuracy": 0.21044208705425263, "num_tokens": 93866331.0, "step": 54115 }, { "entropy": 5.916996765136719, "epoch": 4.210698307722233, "grad_norm": 1.3359375, "learning_rate": 0.00033331102562788527, "loss": 4.9415, "mean_token_accuracy": 0.21817522794008254, "num_tokens": 93875087.0, "step": 54120 }, { "entropy": 5.89392056465149, "epoch": 4.211087337093951, "grad_norm": 1.4765625, "learning_rate": 0.0003332842565183682, "loss": 5.0075, "mean_token_accuracy": 0.2094162881374359, "num_tokens": 93883248.0, "step": 54125 }, { "entropy": 5.954900693893433, "epoch": 4.211476366465668, "grad_norm": 1.34375, "learning_rate": 0.00033325748652448037, "loss": 4.9161, "mean_token_accuracy": 0.22542114853858947, "num_tokens": 93892494.0, "step": 54130 }, { "entropy": 5.928280210494995, "epoch": 4.2118653958373855, "grad_norm": 1.4453125, "learning_rate": 0.00033323071564662796, "loss": 5.1005, "mean_token_accuracy": 0.20460900962352752, "num_tokens": 93901206.0, "step": 54135 }, { "entropy": 5.857502746582031, "epoch": 4.212254425209103, "grad_norm": 1.53125, "learning_rate": 0.00033320394388521707, "loss": 4.8844, "mean_token_accuracy": 0.22027831226587297, "num_tokens": 93909862.0, "step": 54140 }, { "entropy": 5.964752817153931, "epoch": 4.212643454580821, "grad_norm": 1.4296875, "learning_rate": 0.000333177171240654, "loss": 4.9896, "mean_token_accuracy": 0.21682259440422058, "num_tokens": 93918744.0, "step": 54145 }, { "entropy": 6.002886199951172, "epoch": 4.213032483952539, "grad_norm": 1.4296875, "learning_rate": 0.00033315039771334494, "loss": 5.0992, "mean_token_accuracy": 0.20871153175830842, "num_tokens": 93927382.0, "step": 54150 }, { "entropy": 5.95248851776123, "epoch": 4.213421513324256, "grad_norm": 1.359375, "learning_rate": 0.0003331236233036961, "loss": 4.9315, "mean_token_accuracy": 0.22024007588624955, "num_tokens": 93936451.0, "step": 54155 }, { "entropy": 5.895279741287231, "epoch": 4.213810542695974, "grad_norm": 1.5234375, "learning_rate": 0.0003330968480121138, "loss": 4.9389, "mean_token_accuracy": 0.2089978352189064, "num_tokens": 93944995.0, "step": 54160 }, { "entropy": 5.871384525299073, "epoch": 4.214199572067691, "grad_norm": 1.6328125, "learning_rate": 0.0003330700718390043, "loss": 4.902, "mean_token_accuracy": 0.22543398141860962, "num_tokens": 93953377.0, "step": 54165 }, { "entropy": 5.927482557296753, "epoch": 4.2145886014394085, "grad_norm": 1.3125, "learning_rate": 0.00033304329478477395, "loss": 4.9123, "mean_token_accuracy": 0.21452526599168778, "num_tokens": 93961687.0, "step": 54170 }, { "entropy": 5.868473100662231, "epoch": 4.214977630811126, "grad_norm": 1.3671875, "learning_rate": 0.00033301651684982894, "loss": 4.8801, "mean_token_accuracy": 0.21817435920238495, "num_tokens": 93970244.0, "step": 54175 }, { "entropy": 5.8881354331970215, "epoch": 4.215366660182844, "grad_norm": 1.453125, "learning_rate": 0.0003329897380345757, "loss": 4.9813, "mean_token_accuracy": 0.21658388376235962, "num_tokens": 93979278.0, "step": 54180 }, { "entropy": 5.948899221420288, "epoch": 4.215755689554562, "grad_norm": 1.5078125, "learning_rate": 0.0003329629583394204, "loss": 4.9405, "mean_token_accuracy": 0.2112373948097229, "num_tokens": 93987651.0, "step": 54185 }, { "entropy": 5.8548589706420895, "epoch": 4.216144718926279, "grad_norm": 1.46875, "learning_rate": 0.0003329361777647695, "loss": 4.8673, "mean_token_accuracy": 0.2209475204348564, "num_tokens": 93996043.0, "step": 54190 }, { "entropy": 5.859514045715332, "epoch": 4.216533748297996, "grad_norm": 1.3125, "learning_rate": 0.0003329093963110293, "loss": 4.9828, "mean_token_accuracy": 0.21020440608263016, "num_tokens": 94005121.0, "step": 54195 }, { "entropy": 5.900605058670044, "epoch": 4.216922777669714, "grad_norm": 1.375, "learning_rate": 0.00033288261397860613, "loss": 4.9382, "mean_token_accuracy": 0.21281201541423797, "num_tokens": 94013944.0, "step": 54200 }, { "entropy": 5.913072967529297, "epoch": 4.2173118070414315, "grad_norm": 1.359375, "learning_rate": 0.00033285583076790646, "loss": 4.8812, "mean_token_accuracy": 0.21801962256431578, "num_tokens": 94022909.0, "step": 54205 }, { "entropy": 6.013250732421875, "epoch": 4.217700836413149, "grad_norm": 1.40625, "learning_rate": 0.00033282904667933675, "loss": 5.0258, "mean_token_accuracy": 0.20392292886972427, "num_tokens": 94031042.0, "step": 54210 }, { "entropy": 5.86919412612915, "epoch": 4.218089865784867, "grad_norm": 1.4375, "learning_rate": 0.0003328022617133032, "loss": 4.9282, "mean_token_accuracy": 0.21241244077682495, "num_tokens": 94039695.0, "step": 54215 }, { "entropy": 5.774935579299926, "epoch": 4.218478895156585, "grad_norm": 1.375, "learning_rate": 0.0003327754758702124, "loss": 4.8901, "mean_token_accuracy": 0.21944576799869536, "num_tokens": 94048359.0, "step": 54220 }, { "entropy": 6.008325910568237, "epoch": 4.218867924528302, "grad_norm": 1.359375, "learning_rate": 0.00033274868915047064, "loss": 5.073, "mean_token_accuracy": 0.20435744673013687, "num_tokens": 94057113.0, "step": 54225 }, { "entropy": 5.994015169143677, "epoch": 4.219256953900019, "grad_norm": 1.453125, "learning_rate": 0.00033272190155448446, "loss": 4.9844, "mean_token_accuracy": 0.21734994351863862, "num_tokens": 94065104.0, "step": 54230 }, { "entropy": 5.852358436584472, "epoch": 4.219645983271737, "grad_norm": 1.359375, "learning_rate": 0.0003326951130826603, "loss": 4.895, "mean_token_accuracy": 0.21090505868196488, "num_tokens": 94072886.0, "step": 54235 }, { "entropy": 5.902312326431274, "epoch": 4.2200350126434545, "grad_norm": 1.40625, "learning_rate": 0.00033266832373540463, "loss": 4.9473, "mean_token_accuracy": 0.21707794517278672, "num_tokens": 94081863.0, "step": 54240 }, { "entropy": 5.924773216247559, "epoch": 4.220424042015172, "grad_norm": 1.3515625, "learning_rate": 0.0003326415335131239, "loss": 4.9523, "mean_token_accuracy": 0.21685580760240555, "num_tokens": 94090640.0, "step": 54245 }, { "entropy": 5.881767749786377, "epoch": 4.22081307138689, "grad_norm": 1.3671875, "learning_rate": 0.00033261474241622475, "loss": 4.8746, "mean_token_accuracy": 0.2189313441514969, "num_tokens": 94099466.0, "step": 54250 }, { "entropy": 5.911907768249511, "epoch": 4.221202100758608, "grad_norm": 1.34375, "learning_rate": 0.0003325879504451135, "loss": 4.9673, "mean_token_accuracy": 0.20509982258081436, "num_tokens": 94108515.0, "step": 54255 }, { "entropy": 5.882394552230835, "epoch": 4.221591130130324, "grad_norm": 1.3046875, "learning_rate": 0.00033256115760019677, "loss": 4.9157, "mean_token_accuracy": 0.21317753791809083, "num_tokens": 94116901.0, "step": 54260 }, { "entropy": 5.92430100440979, "epoch": 4.221980159502042, "grad_norm": 1.4609375, "learning_rate": 0.00033253436388188106, "loss": 4.962, "mean_token_accuracy": 0.21298840939998626, "num_tokens": 94125797.0, "step": 54265 }, { "entropy": 5.9713661670684814, "epoch": 4.22236918887376, "grad_norm": 1.265625, "learning_rate": 0.000332507569290573, "loss": 5.0341, "mean_token_accuracy": 0.21007930338382722, "num_tokens": 94135446.0, "step": 54270 }, { "entropy": 5.925769948959351, "epoch": 4.2227582182454775, "grad_norm": 1.421875, "learning_rate": 0.00033248077382667913, "loss": 4.9134, "mean_token_accuracy": 0.2297309160232544, "num_tokens": 94144143.0, "step": 54275 }, { "entropy": 5.880003023147583, "epoch": 4.223147247617195, "grad_norm": 1.46875, "learning_rate": 0.000332453977490606, "loss": 4.8989, "mean_token_accuracy": 0.22096201181411743, "num_tokens": 94152831.0, "step": 54280 }, { "entropy": 5.836392784118653, "epoch": 4.223536276988913, "grad_norm": 1.3359375, "learning_rate": 0.0003324271802827602, "loss": 4.8809, "mean_token_accuracy": 0.2187737450003624, "num_tokens": 94161405.0, "step": 54285 }, { "entropy": 5.920187377929688, "epoch": 4.223925306360631, "grad_norm": 1.359375, "learning_rate": 0.0003324003822035483, "loss": 4.9777, "mean_token_accuracy": 0.20955915600061417, "num_tokens": 94170141.0, "step": 54290 }, { "entropy": 5.876787090301514, "epoch": 4.224314335732347, "grad_norm": 1.3515625, "learning_rate": 0.0003323735832533771, "loss": 4.9864, "mean_token_accuracy": 0.21559284925460814, "num_tokens": 94180023.0, "step": 54295 }, { "entropy": 5.978171539306641, "epoch": 4.224703365104065, "grad_norm": 1.328125, "learning_rate": 0.00033234678343265297, "loss": 5.0316, "mean_token_accuracy": 0.20986644327640533, "num_tokens": 94189811.0, "step": 54300 }, { "entropy": 5.9358320236206055, "epoch": 4.225092394475783, "grad_norm": 1.265625, "learning_rate": 0.0003323199827417827, "loss": 5.0001, "mean_token_accuracy": 0.20926810801029205, "num_tokens": 94199666.0, "step": 54305 }, { "entropy": 5.930307817459107, "epoch": 4.2254814238475005, "grad_norm": 1.421875, "learning_rate": 0.00033229318118117293, "loss": 4.9429, "mean_token_accuracy": 0.21365652978420258, "num_tokens": 94208777.0, "step": 54310 }, { "entropy": 6.046535921096802, "epoch": 4.225870453219218, "grad_norm": 1.4296875, "learning_rate": 0.00033226637875123026, "loss": 5.1664, "mean_token_accuracy": 0.20480982810258866, "num_tokens": 94217386.0, "step": 54315 }, { "entropy": 5.876422023773193, "epoch": 4.226259482590936, "grad_norm": 1.3671875, "learning_rate": 0.00033223957545236156, "loss": 4.9098, "mean_token_accuracy": 0.22085874378681183, "num_tokens": 94226630.0, "step": 54320 }, { "entropy": 5.865003967285157, "epoch": 4.226648511962654, "grad_norm": 1.296875, "learning_rate": 0.0003322127712849733, "loss": 4.9247, "mean_token_accuracy": 0.2125531405210495, "num_tokens": 94235420.0, "step": 54325 }, { "entropy": 5.966611862182617, "epoch": 4.22703754133437, "grad_norm": 1.453125, "learning_rate": 0.0003321859662494724, "loss": 4.9855, "mean_token_accuracy": 0.2154558315873146, "num_tokens": 94243773.0, "step": 54330 }, { "entropy": 5.93405966758728, "epoch": 4.227426570706088, "grad_norm": 1.5078125, "learning_rate": 0.0003321591603462654, "loss": 4.9784, "mean_token_accuracy": 0.21020043641328812, "num_tokens": 94251975.0, "step": 54335 }, { "entropy": 5.903223705291748, "epoch": 4.227815600077806, "grad_norm": 1.359375, "learning_rate": 0.0003321323535757592, "loss": 4.9662, "mean_token_accuracy": 0.2145107328891754, "num_tokens": 94261486.0, "step": 54340 }, { "entropy": 5.948007965087891, "epoch": 4.2282046294495235, "grad_norm": 1.4296875, "learning_rate": 0.0003321055459383604, "loss": 4.9776, "mean_token_accuracy": 0.2106636196374893, "num_tokens": 94269706.0, "step": 54345 }, { "entropy": 5.914697980880737, "epoch": 4.228593658821241, "grad_norm": 1.34375, "learning_rate": 0.00033207873743447587, "loss": 4.9466, "mean_token_accuracy": 0.22060708552598954, "num_tokens": 94277861.0, "step": 54350 }, { "entropy": 5.906025409698486, "epoch": 4.228982688192959, "grad_norm": 1.40625, "learning_rate": 0.00033205192806451227, "loss": 4.9685, "mean_token_accuracy": 0.21609849929809571, "num_tokens": 94286012.0, "step": 54355 }, { "entropy": 5.895386743545532, "epoch": 4.229371717564677, "grad_norm": 1.3671875, "learning_rate": 0.00033202511782887655, "loss": 4.9669, "mean_token_accuracy": 0.20952712297439574, "num_tokens": 94294404.0, "step": 54360 }, { "entropy": 6.004039335250854, "epoch": 4.229760746936393, "grad_norm": 1.5, "learning_rate": 0.00033199830672797545, "loss": 5.0367, "mean_token_accuracy": 0.20188789814710617, "num_tokens": 94302716.0, "step": 54365 }, { "entropy": 5.90697135925293, "epoch": 4.230149776308111, "grad_norm": 1.4453125, "learning_rate": 0.0003319714947622157, "loss": 4.917, "mean_token_accuracy": 0.21238841563463212, "num_tokens": 94311311.0, "step": 54370 }, { "entropy": 5.9348108768463135, "epoch": 4.230538805679829, "grad_norm": 1.5546875, "learning_rate": 0.0003319446819320043, "loss": 4.9832, "mean_token_accuracy": 0.20762578547000884, "num_tokens": 94319889.0, "step": 54375 }, { "entropy": 5.870354032516479, "epoch": 4.2309278350515465, "grad_norm": 1.4921875, "learning_rate": 0.0003319178682377479, "loss": 4.9051, "mean_token_accuracy": 0.2257503256201744, "num_tokens": 94328378.0, "step": 54380 }, { "entropy": 5.906464862823486, "epoch": 4.231316864423264, "grad_norm": 1.421875, "learning_rate": 0.00033189105367985343, "loss": 4.9195, "mean_token_accuracy": 0.21812800467014312, "num_tokens": 94336828.0, "step": 54385 }, { "entropy": 5.8827025413513185, "epoch": 4.231705893794982, "grad_norm": 1.3125, "learning_rate": 0.00033186423825872787, "loss": 4.9482, "mean_token_accuracy": 0.20942198783159255, "num_tokens": 94346574.0, "step": 54390 }, { "entropy": 5.935249185562133, "epoch": 4.232094923166699, "grad_norm": 1.6015625, "learning_rate": 0.0003318374219747779, "loss": 4.9022, "mean_token_accuracy": 0.22116161584854127, "num_tokens": 94354159.0, "step": 54395 }, { "entropy": 5.9972052574157715, "epoch": 4.232483952538416, "grad_norm": 1.296875, "learning_rate": 0.00033181060482841054, "loss": 5.0578, "mean_token_accuracy": 0.21034317165613176, "num_tokens": 94363396.0, "step": 54400 }, { "entropy": 5.972744655609131, "epoch": 4.232872981910134, "grad_norm": 1.296875, "learning_rate": 0.0003317837868200327, "loss": 5.0284, "mean_token_accuracy": 0.20554822087287902, "num_tokens": 94371958.0, "step": 54405 }, { "entropy": 5.875565433502198, "epoch": 4.233262011281852, "grad_norm": 1.3984375, "learning_rate": 0.00033175696795005133, "loss": 4.9789, "mean_token_accuracy": 0.21215754449367524, "num_tokens": 94380574.0, "step": 54410 }, { "entropy": 5.841039943695068, "epoch": 4.2336510406535695, "grad_norm": 1.34375, "learning_rate": 0.0003317301482188732, "loss": 4.9009, "mean_token_accuracy": 0.21745998561382293, "num_tokens": 94389102.0, "step": 54415 }, { "entropy": 5.917747497558594, "epoch": 4.234040070025287, "grad_norm": 1.46875, "learning_rate": 0.0003317033276269054, "loss": 4.9113, "mean_token_accuracy": 0.21753203123807907, "num_tokens": 94397125.0, "step": 54420 }, { "entropy": 5.927219486236572, "epoch": 4.234429099397005, "grad_norm": 1.5859375, "learning_rate": 0.00033167650617455484, "loss": 4.9072, "mean_token_accuracy": 0.22607884407043458, "num_tokens": 94405075.0, "step": 54425 }, { "entropy": 5.89725923538208, "epoch": 4.234818128768722, "grad_norm": 1.40625, "learning_rate": 0.00033164968386222856, "loss": 4.9452, "mean_token_accuracy": 0.21272364854812623, "num_tokens": 94414711.0, "step": 54430 }, { "entropy": 5.893005084991455, "epoch": 4.235207158140439, "grad_norm": 1.3828125, "learning_rate": 0.0003316228606903334, "loss": 4.9326, "mean_token_accuracy": 0.2200268566608429, "num_tokens": 94422832.0, "step": 54435 }, { "entropy": 5.840175485610962, "epoch": 4.235596187512157, "grad_norm": 1.3984375, "learning_rate": 0.00033159603665927655, "loss": 4.903, "mean_token_accuracy": 0.2191663846373558, "num_tokens": 94432503.0, "step": 54440 }, { "entropy": 5.922314548492432, "epoch": 4.235985216883875, "grad_norm": 1.5859375, "learning_rate": 0.00033156921176946496, "loss": 4.9478, "mean_token_accuracy": 0.21343046724796294, "num_tokens": 94441059.0, "step": 54445 }, { "entropy": 5.9446971893310545, "epoch": 4.2363742462555924, "grad_norm": 1.328125, "learning_rate": 0.0003315423860213057, "loss": 4.9801, "mean_token_accuracy": 0.2152017742395401, "num_tokens": 94450293.0, "step": 54450 }, { "entropy": 5.947464561462402, "epoch": 4.23676327562731, "grad_norm": 1.6875, "learning_rate": 0.0003315155594152055, "loss": 4.9878, "mean_token_accuracy": 0.2186127245426178, "num_tokens": 94458899.0, "step": 54455 }, { "entropy": 5.8924213409423825, "epoch": 4.237152304999028, "grad_norm": 1.4453125, "learning_rate": 0.0003314887319515717, "loss": 4.8917, "mean_token_accuracy": 0.21822055131196977, "num_tokens": 94467318.0, "step": 54460 }, { "entropy": 5.871268558502197, "epoch": 4.237541334370745, "grad_norm": 1.3359375, "learning_rate": 0.0003314619036308113, "loss": 4.9608, "mean_token_accuracy": 0.21997833102941514, "num_tokens": 94476464.0, "step": 54465 }, { "entropy": 5.917066144943237, "epoch": 4.237930363742462, "grad_norm": 1.5, "learning_rate": 0.00033143507445333145, "loss": 4.9196, "mean_token_accuracy": 0.2172902688384056, "num_tokens": 94484897.0, "step": 54470 }, { "entropy": 5.948601865768433, "epoch": 4.23831939311418, "grad_norm": 1.3515625, "learning_rate": 0.00033140824441953913, "loss": 4.9846, "mean_token_accuracy": 0.21147470623254777, "num_tokens": 94493726.0, "step": 54475 }, { "entropy": 5.904789400100708, "epoch": 4.238708422485898, "grad_norm": 1.3984375, "learning_rate": 0.00033138141352984145, "loss": 4.8819, "mean_token_accuracy": 0.22535137832164764, "num_tokens": 94502277.0, "step": 54480 }, { "entropy": 5.894386053085327, "epoch": 4.239097451857615, "grad_norm": 1.4140625, "learning_rate": 0.00033135458178464565, "loss": 4.9448, "mean_token_accuracy": 0.21768448650836944, "num_tokens": 94510714.0, "step": 54485 }, { "entropy": 5.922714900970459, "epoch": 4.239486481229333, "grad_norm": 1.3984375, "learning_rate": 0.0003313277491843587, "loss": 4.9664, "mean_token_accuracy": 0.21395401209592818, "num_tokens": 94518947.0, "step": 54490 }, { "entropy": 5.9754644393920895, "epoch": 4.239875510601051, "grad_norm": 1.34375, "learning_rate": 0.00033130091572938786, "loss": 4.9926, "mean_token_accuracy": 0.21856670081615448, "num_tokens": 94527265.0, "step": 54495 }, { "entropy": 5.93578519821167, "epoch": 4.240264539972768, "grad_norm": 1.4609375, "learning_rate": 0.0003312740814201402, "loss": 4.9666, "mean_token_accuracy": 0.21449437290430068, "num_tokens": 94535047.0, "step": 54500 }, { "entropy": 5.864808464050293, "epoch": 4.240653569344485, "grad_norm": 1.421875, "learning_rate": 0.0003312472462570229, "loss": 4.9069, "mean_token_accuracy": 0.21434569209814072, "num_tokens": 94543507.0, "step": 54505 }, { "entropy": 5.8731285572052006, "epoch": 4.241042598716203, "grad_norm": 1.390625, "learning_rate": 0.00033122041024044325, "loss": 4.8835, "mean_token_accuracy": 0.21973054558038713, "num_tokens": 94552167.0, "step": 54510 }, { "entropy": 5.9693645477294925, "epoch": 4.241431628087921, "grad_norm": 1.3984375, "learning_rate": 0.00033119357337080827, "loss": 4.9741, "mean_token_accuracy": 0.21690181493759156, "num_tokens": 94560249.0, "step": 54515 }, { "entropy": 5.884009075164795, "epoch": 4.241820657459638, "grad_norm": 1.53125, "learning_rate": 0.0003311667356485253, "loss": 4.89, "mean_token_accuracy": 0.21804728955030442, "num_tokens": 94568518.0, "step": 54520 }, { "entropy": 5.95898814201355, "epoch": 4.242209686831356, "grad_norm": 1.34375, "learning_rate": 0.0003311398970740015, "loss": 5.0885, "mean_token_accuracy": 0.20031265318393707, "num_tokens": 94577334.0, "step": 54525 }, { "entropy": 5.971610069274902, "epoch": 4.242598716203073, "grad_norm": 1.515625, "learning_rate": 0.0003311130576476441, "loss": 5.0402, "mean_token_accuracy": 0.20739947259426117, "num_tokens": 94585583.0, "step": 54530 }, { "entropy": 5.975155210494995, "epoch": 4.242987745574791, "grad_norm": 1.390625, "learning_rate": 0.0003310862173698604, "loss": 4.9732, "mean_token_accuracy": 0.21989604234695434, "num_tokens": 94594492.0, "step": 54535 }, { "entropy": 5.920912456512451, "epoch": 4.243376774946508, "grad_norm": 1.3515625, "learning_rate": 0.0003310593762410576, "loss": 4.9532, "mean_token_accuracy": 0.2143271178007126, "num_tokens": 94603772.0, "step": 54540 }, { "entropy": 5.88807168006897, "epoch": 4.243765804318226, "grad_norm": 1.5625, "learning_rate": 0.000331032534261643, "loss": 4.9514, "mean_token_accuracy": 0.21967253386974334, "num_tokens": 94612049.0, "step": 54545 }, { "entropy": 6.009164524078369, "epoch": 4.244154833689944, "grad_norm": 1.5078125, "learning_rate": 0.0003310056914320239, "loss": 5.0416, "mean_token_accuracy": 0.20396026819944382, "num_tokens": 94620554.0, "step": 54550 }, { "entropy": 5.901394414901733, "epoch": 4.244543863061661, "grad_norm": 1.453125, "learning_rate": 0.00033097884775260754, "loss": 4.9114, "mean_token_accuracy": 0.21374585926532746, "num_tokens": 94628673.0, "step": 54555 }, { "entropy": 5.907778596878051, "epoch": 4.244932892433379, "grad_norm": 1.3125, "learning_rate": 0.00033095200322380124, "loss": 5.0287, "mean_token_accuracy": 0.2163769021630287, "num_tokens": 94637804.0, "step": 54560 }, { "entropy": 5.905387735366821, "epoch": 4.245321921805096, "grad_norm": 1.46875, "learning_rate": 0.00033092515784601245, "loss": 4.9826, "mean_token_accuracy": 0.21394221037626265, "num_tokens": 94647528.0, "step": 54565 }, { "entropy": 6.002347707748413, "epoch": 4.245710951176814, "grad_norm": 1.4296875, "learning_rate": 0.0003308983116196483, "loss": 4.965, "mean_token_accuracy": 0.2108680322766304, "num_tokens": 94656797.0, "step": 54570 }, { "entropy": 5.948218536376953, "epoch": 4.246099980548531, "grad_norm": 1.390625, "learning_rate": 0.0003308714645451163, "loss": 5.0372, "mean_token_accuracy": 0.20686530470848083, "num_tokens": 94665462.0, "step": 54575 }, { "entropy": 5.952086353302002, "epoch": 4.246489009920249, "grad_norm": 1.3984375, "learning_rate": 0.0003308446166228237, "loss": 4.9612, "mean_token_accuracy": 0.21151547580957414, "num_tokens": 94673428.0, "step": 54580 }, { "entropy": 5.927017450332642, "epoch": 4.246878039291967, "grad_norm": 1.5, "learning_rate": 0.00033081776785317803, "loss": 4.9527, "mean_token_accuracy": 0.21483672857284547, "num_tokens": 94682521.0, "step": 54585 }, { "entropy": 5.934924650192261, "epoch": 4.247267068663684, "grad_norm": 1.375, "learning_rate": 0.00033079091823658645, "loss": 4.9811, "mean_token_accuracy": 0.21247403919696808, "num_tokens": 94691317.0, "step": 54590 }, { "entropy": 5.938552713394165, "epoch": 4.247656098035401, "grad_norm": 1.4765625, "learning_rate": 0.0003307640677734566, "loss": 4.8734, "mean_token_accuracy": 0.2194083407521248, "num_tokens": 94700164.0, "step": 54595 }, { "entropy": 5.87406587600708, "epoch": 4.248045127407119, "grad_norm": 1.375, "learning_rate": 0.0003307372164641957, "loss": 4.87, "mean_token_accuracy": 0.2213505893945694, "num_tokens": 94708263.0, "step": 54600 }, { "entropy": 5.8182000637054445, "epoch": 4.248434156778837, "grad_norm": 1.4453125, "learning_rate": 0.00033071036430921133, "loss": 4.9107, "mean_token_accuracy": 0.22415741682052612, "num_tokens": 94716953.0, "step": 54605 }, { "entropy": 5.929973316192627, "epoch": 4.248823186150554, "grad_norm": 1.4375, "learning_rate": 0.00033068351130891076, "loss": 4.9312, "mean_token_accuracy": 0.21574445366859435, "num_tokens": 94725985.0, "step": 54610 }, { "entropy": 5.924100923538208, "epoch": 4.249212215522272, "grad_norm": 1.3984375, "learning_rate": 0.0003306566574637016, "loss": 4.9282, "mean_token_accuracy": 0.21917377710342406, "num_tokens": 94733997.0, "step": 54615 }, { "entropy": 5.905703210830689, "epoch": 4.24960124489399, "grad_norm": 1.3203125, "learning_rate": 0.00033062980277399125, "loss": 4.9577, "mean_token_accuracy": 0.21813781559467316, "num_tokens": 94742595.0, "step": 54620 }, { "entropy": 5.866001796722412, "epoch": 4.249990274265707, "grad_norm": 1.4453125, "learning_rate": 0.0003306029472401871, "loss": 4.8334, "mean_token_accuracy": 0.2281695544719696, "num_tokens": 94750150.0, "step": 54625 }, { "entropy": 5.910736179351806, "epoch": 4.250379303637424, "grad_norm": 1.328125, "learning_rate": 0.0003305760908626968, "loss": 4.9709, "mean_token_accuracy": 0.21897337436676026, "num_tokens": 94758470.0, "step": 54630 }, { "entropy": 5.899111413955689, "epoch": 4.250768333009142, "grad_norm": 1.390625, "learning_rate": 0.0003305492336419277, "loss": 5.0148, "mean_token_accuracy": 0.2048146277666092, "num_tokens": 94767372.0, "step": 54635 }, { "entropy": 5.870058393478393, "epoch": 4.25115736238086, "grad_norm": 1.3125, "learning_rate": 0.00033052237557828763, "loss": 4.9417, "mean_token_accuracy": 0.21511054635047913, "num_tokens": 94775683.0, "step": 54640 }, { "entropy": 5.965483951568603, "epoch": 4.251546391752577, "grad_norm": 1.484375, "learning_rate": 0.0003304955166721837, "loss": 4.9718, "mean_token_accuracy": 0.20918405950069427, "num_tokens": 94784076.0, "step": 54645 }, { "entropy": 5.913328647613525, "epoch": 4.251935421124295, "grad_norm": 1.390625, "learning_rate": 0.0003304686569240237, "loss": 4.9442, "mean_token_accuracy": 0.213658644258976, "num_tokens": 94793512.0, "step": 54650 }, { "entropy": 5.913216924667358, "epoch": 4.252324450496013, "grad_norm": 1.5078125, "learning_rate": 0.000330441796334215, "loss": 4.9131, "mean_token_accuracy": 0.21754608154296876, "num_tokens": 94801919.0, "step": 54655 }, { "entropy": 5.977505207061768, "epoch": 4.25271347986773, "grad_norm": 1.453125, "learning_rate": 0.0003304149349031653, "loss": 5.0169, "mean_token_accuracy": 0.20953661054372788, "num_tokens": 94811104.0, "step": 54660 }, { "entropy": 5.84434404373169, "epoch": 4.253102509239447, "grad_norm": 1.5078125, "learning_rate": 0.0003303880726312822, "loss": 4.9039, "mean_token_accuracy": 0.22365008890628815, "num_tokens": 94819836.0, "step": 54665 }, { "entropy": 5.971727991104126, "epoch": 4.253491538611165, "grad_norm": 1.390625, "learning_rate": 0.00033036120951897334, "loss": 5.0316, "mean_token_accuracy": 0.20984099060297012, "num_tokens": 94829023.0, "step": 54670 }, { "entropy": 6.0348070621490475, "epoch": 4.253880567982883, "grad_norm": 1.4296875, "learning_rate": 0.0003303343455666462, "loss": 5.0372, "mean_token_accuracy": 0.20979625582695008, "num_tokens": 94837781.0, "step": 54675 }, { "entropy": 5.960360813140869, "epoch": 4.2542695973546, "grad_norm": 1.4296875, "learning_rate": 0.00033030748077470846, "loss": 5.0084, "mean_token_accuracy": 0.22425804585218428, "num_tokens": 94846772.0, "step": 54680 }, { "entropy": 5.955118942260742, "epoch": 4.254658626726318, "grad_norm": 1.734375, "learning_rate": 0.00033028061514356766, "loss": 5.0298, "mean_token_accuracy": 0.21190354973077774, "num_tokens": 94855114.0, "step": 54685 }, { "entropy": 5.993079948425293, "epoch": 4.255047656098036, "grad_norm": 1.484375, "learning_rate": 0.0003302537486736315, "loss": 5.0299, "mean_token_accuracy": 0.2111533299088478, "num_tokens": 94864144.0, "step": 54690 }, { "entropy": 5.940740346908569, "epoch": 4.255436685469753, "grad_norm": 1.3828125, "learning_rate": 0.0003302268813653077, "loss": 4.967, "mean_token_accuracy": 0.21686182916164398, "num_tokens": 94872497.0, "step": 54695 }, { "entropy": 5.950805282592773, "epoch": 4.25582571484147, "grad_norm": 1.359375, "learning_rate": 0.0003302000132190039, "loss": 5.0033, "mean_token_accuracy": 0.22027105689048768, "num_tokens": 94881326.0, "step": 54700 }, { "entropy": 5.920584011077881, "epoch": 4.256214744213188, "grad_norm": 1.484375, "learning_rate": 0.0003301731442351277, "loss": 4.9866, "mean_token_accuracy": 0.2093284621834755, "num_tokens": 94889887.0, "step": 54705 }, { "entropy": 5.88416600227356, "epoch": 4.256603773584906, "grad_norm": 1.40625, "learning_rate": 0.0003301462744140869, "loss": 4.8701, "mean_token_accuracy": 0.22125812768936157, "num_tokens": 94899210.0, "step": 54710 }, { "entropy": 5.9782342433929445, "epoch": 4.256992802956623, "grad_norm": 1.421875, "learning_rate": 0.0003301194037562892, "loss": 5.0414, "mean_token_accuracy": 0.21191616654396056, "num_tokens": 94907303.0, "step": 54715 }, { "entropy": 5.879955768585205, "epoch": 4.257381832328341, "grad_norm": 1.453125, "learning_rate": 0.0003300925322621422, "loss": 4.867, "mean_token_accuracy": 0.22361826449632644, "num_tokens": 94916069.0, "step": 54720 }, { "entropy": 5.844481182098389, "epoch": 4.257770861700059, "grad_norm": 1.265625, "learning_rate": 0.0003300656599320537, "loss": 4.9301, "mean_token_accuracy": 0.2186798185110092, "num_tokens": 94926209.0, "step": 54725 }, { "entropy": 5.923324155807495, "epoch": 4.2581598910717755, "grad_norm": 1.3203125, "learning_rate": 0.0003300387867664315, "loss": 4.9651, "mean_token_accuracy": 0.21191472113132476, "num_tokens": 94934671.0, "step": 54730 }, { "entropy": 5.944418287277221, "epoch": 4.258548920443493, "grad_norm": 1.4765625, "learning_rate": 0.0003300119127656833, "loss": 5.0265, "mean_token_accuracy": 0.21447554975748062, "num_tokens": 94942992.0, "step": 54735 }, { "entropy": 5.873823451995849, "epoch": 4.258937949815211, "grad_norm": 1.421875, "learning_rate": 0.00032998503793021694, "loss": 4.9248, "mean_token_accuracy": 0.2198515087366104, "num_tokens": 94951356.0, "step": 54740 }, { "entropy": 5.918998289108276, "epoch": 4.259326979186929, "grad_norm": 1.328125, "learning_rate": 0.0003299581622604401, "loss": 4.9325, "mean_token_accuracy": 0.21402983069419862, "num_tokens": 94960412.0, "step": 54745 }, { "entropy": 5.896385574340821, "epoch": 4.259716008558646, "grad_norm": 1.484375, "learning_rate": 0.00032993128575676064, "loss": 4.9176, "mean_token_accuracy": 0.22058046609163284, "num_tokens": 94969005.0, "step": 54750 }, { "entropy": 5.931352996826172, "epoch": 4.260105037930364, "grad_norm": 1.5390625, "learning_rate": 0.00032990440841958635, "loss": 5.0708, "mean_token_accuracy": 0.2082776367664337, "num_tokens": 94977142.0, "step": 54755 }, { "entropy": 5.9317127704620365, "epoch": 4.260494067302082, "grad_norm": 1.34375, "learning_rate": 0.000329877530249325, "loss": 4.9602, "mean_token_accuracy": 0.20847708582878113, "num_tokens": 94985936.0, "step": 54760 }, { "entropy": 5.927503395080566, "epoch": 4.2608830966737985, "grad_norm": 1.375, "learning_rate": 0.0003298506512463845, "loss": 4.9757, "mean_token_accuracy": 0.21178323924541473, "num_tokens": 94994187.0, "step": 54765 }, { "entropy": 5.913310241699219, "epoch": 4.261272126045516, "grad_norm": 1.3984375, "learning_rate": 0.0003298237714111727, "loss": 4.9496, "mean_token_accuracy": 0.2158214658498764, "num_tokens": 95003921.0, "step": 54770 }, { "entropy": 5.93520975112915, "epoch": 4.261661155417234, "grad_norm": 1.3671875, "learning_rate": 0.0003297968907440974, "loss": 4.9344, "mean_token_accuracy": 0.21660510152578355, "num_tokens": 95012752.0, "step": 54775 }, { "entropy": 5.901351070404052, "epoch": 4.262050184788952, "grad_norm": 1.3046875, "learning_rate": 0.0003297700092455665, "loss": 4.9648, "mean_token_accuracy": 0.21474601626396178, "num_tokens": 95021910.0, "step": 54780 }, { "entropy": 5.8472565650939945, "epoch": 4.262439214160669, "grad_norm": 1.3828125, "learning_rate": 0.00032974312691598794, "loss": 4.8447, "mean_token_accuracy": 0.22162685096263884, "num_tokens": 95030261.0, "step": 54785 }, { "entropy": 5.902706050872803, "epoch": 4.262828243532387, "grad_norm": 1.3125, "learning_rate": 0.00032971624375576956, "loss": 4.8857, "mean_token_accuracy": 0.221635602414608, "num_tokens": 95038906.0, "step": 54790 }, { "entropy": 5.899225378036499, "epoch": 4.263217272904104, "grad_norm": 1.34375, "learning_rate": 0.0003296893597653192, "loss": 4.9514, "mean_token_accuracy": 0.21382581442594528, "num_tokens": 95047690.0, "step": 54795 }, { "entropy": 5.9156729221344, "epoch": 4.2636063022758215, "grad_norm": 1.359375, "learning_rate": 0.0003296624749450448, "loss": 4.9925, "mean_token_accuracy": 0.2123454675078392, "num_tokens": 95056294.0, "step": 54800 }, { "entropy": 5.94627366065979, "epoch": 4.263995331647539, "grad_norm": 1.2265625, "learning_rate": 0.0003296355892953545, "loss": 4.9712, "mean_token_accuracy": 0.2076500102877617, "num_tokens": 95065756.0, "step": 54805 }, { "entropy": 5.891101837158203, "epoch": 4.264384361019257, "grad_norm": 1.4765625, "learning_rate": 0.000329608702816656, "loss": 4.9826, "mean_token_accuracy": 0.2092406392097473, "num_tokens": 95074459.0, "step": 54810 }, { "entropy": 5.931795120239258, "epoch": 4.264773390390975, "grad_norm": 1.40625, "learning_rate": 0.0003295818155093574, "loss": 4.9862, "mean_token_accuracy": 0.21877542436122893, "num_tokens": 95083163.0, "step": 54815 }, { "entropy": 5.909637928009033, "epoch": 4.265162419762692, "grad_norm": 1.390625, "learning_rate": 0.00032955492737386663, "loss": 4.9228, "mean_token_accuracy": 0.22160348892211915, "num_tokens": 95092324.0, "step": 54820 }, { "entropy": 5.91535792350769, "epoch": 4.26555144913441, "grad_norm": 1.4765625, "learning_rate": 0.0003295280384105916, "loss": 4.8564, "mean_token_accuracy": 0.23067598789930344, "num_tokens": 95100250.0, "step": 54825 }, { "entropy": 5.873905181884766, "epoch": 4.265940478506128, "grad_norm": 1.3984375, "learning_rate": 0.00032950114861994047, "loss": 4.898, "mean_token_accuracy": 0.21934334188699722, "num_tokens": 95108641.0, "step": 54830 }, { "entropy": 5.920182943344116, "epoch": 4.2663295078778445, "grad_norm": 1.4921875, "learning_rate": 0.00032947425800232107, "loss": 4.9516, "mean_token_accuracy": 0.21476654410362245, "num_tokens": 95116547.0, "step": 54835 }, { "entropy": 5.882655668258667, "epoch": 4.266718537249562, "grad_norm": 1.3046875, "learning_rate": 0.0003294473665581415, "loss": 4.8854, "mean_token_accuracy": 0.21966099441051484, "num_tokens": 95125334.0, "step": 54840 }, { "entropy": 5.919733715057373, "epoch": 4.26710756662128, "grad_norm": 1.3125, "learning_rate": 0.00032942047428780985, "loss": 4.9511, "mean_token_accuracy": 0.20866973847150802, "num_tokens": 95134805.0, "step": 54845 }, { "entropy": 5.925727224349975, "epoch": 4.267496595992998, "grad_norm": 1.4296875, "learning_rate": 0.0003293935811917342, "loss": 4.9932, "mean_token_accuracy": 0.21327505111694336, "num_tokens": 95143539.0, "step": 54850 }, { "entropy": 5.876774311065674, "epoch": 4.267885625364715, "grad_norm": 1.4140625, "learning_rate": 0.0003293666872703224, "loss": 4.8892, "mean_token_accuracy": 0.2277057334780693, "num_tokens": 95152394.0, "step": 54855 }, { "entropy": 5.862449312210083, "epoch": 4.268274654736433, "grad_norm": 1.546875, "learning_rate": 0.0003293397925239827, "loss": 4.9124, "mean_token_accuracy": 0.22262572050094603, "num_tokens": 95160666.0, "step": 54860 }, { "entropy": 5.9539327144622805, "epoch": 4.26866368410815, "grad_norm": 1.3671875, "learning_rate": 0.0003293128969531231, "loss": 5.0267, "mean_token_accuracy": 0.20479939579963685, "num_tokens": 95170007.0, "step": 54865 }, { "entropy": 6.0117440700531, "epoch": 4.2690527134798675, "grad_norm": 1.3984375, "learning_rate": 0.0003292860005581518, "loss": 5.0529, "mean_token_accuracy": 0.20532880127429962, "num_tokens": 95178169.0, "step": 54870 }, { "entropy": 5.947081136703491, "epoch": 4.269441742851585, "grad_norm": 1.5, "learning_rate": 0.00032925910333947694, "loss": 4.9804, "mean_token_accuracy": 0.21240086406469344, "num_tokens": 95186357.0, "step": 54875 }, { "entropy": 5.91890139579773, "epoch": 4.269830772223303, "grad_norm": 1.4453125, "learning_rate": 0.0003292322052975064, "loss": 4.9698, "mean_token_accuracy": 0.21924578100442887, "num_tokens": 95195678.0, "step": 54880 }, { "entropy": 5.942370223999023, "epoch": 4.270219801595021, "grad_norm": 1.3828125, "learning_rate": 0.0003292053064326485, "loss": 4.9648, "mean_token_accuracy": 0.20888793617486953, "num_tokens": 95204094.0, "step": 54885 }, { "entropy": 5.861639070510864, "epoch": 4.270608830966738, "grad_norm": 1.4140625, "learning_rate": 0.0003291784067453114, "loss": 4.9227, "mean_token_accuracy": 0.2161780431866646, "num_tokens": 95211976.0, "step": 54890 }, { "entropy": 5.864830160140992, "epoch": 4.270997860338456, "grad_norm": 1.4140625, "learning_rate": 0.00032915150623590304, "loss": 4.8382, "mean_token_accuracy": 0.22360936254262925, "num_tokens": 95220207.0, "step": 54895 }, { "entropy": 5.844212341308594, "epoch": 4.271386889710173, "grad_norm": 1.4296875, "learning_rate": 0.00032912460490483193, "loss": 4.8248, "mean_token_accuracy": 0.22407771944999694, "num_tokens": 95228226.0, "step": 54900 }, { "entropy": 5.839849042892456, "epoch": 4.2717759190818905, "grad_norm": 1.3671875, "learning_rate": 0.0003290977027525061, "loss": 4.8173, "mean_token_accuracy": 0.22076697647571564, "num_tokens": 95237159.0, "step": 54905 }, { "entropy": 5.833155775070191, "epoch": 4.272164948453608, "grad_norm": 1.46875, "learning_rate": 0.00032907079977933373, "loss": 4.8639, "mean_token_accuracy": 0.2169177070260048, "num_tokens": 95245684.0, "step": 54910 }, { "entropy": 5.943340063095093, "epoch": 4.272553977825326, "grad_norm": 1.4140625, "learning_rate": 0.00032904389598572295, "loss": 5.0574, "mean_token_accuracy": 0.2081340253353119, "num_tokens": 95254097.0, "step": 54915 }, { "entropy": 5.964110374450684, "epoch": 4.272943007197044, "grad_norm": 1.4140625, "learning_rate": 0.00032901699137208215, "loss": 5.0401, "mean_token_accuracy": 0.20288221687078475, "num_tokens": 95263216.0, "step": 54920 }, { "entropy": 5.959118127822876, "epoch": 4.273332036568761, "grad_norm": 1.359375, "learning_rate": 0.0003289900859388194, "loss": 4.987, "mean_token_accuracy": 0.2160157635807991, "num_tokens": 95272084.0, "step": 54925 }, { "entropy": 5.918903398513794, "epoch": 4.273721065940478, "grad_norm": 1.375, "learning_rate": 0.00032896317968634305, "loss": 4.931, "mean_token_accuracy": 0.2152649313211441, "num_tokens": 95280505.0, "step": 54930 }, { "entropy": 5.907107353210449, "epoch": 4.274110095312196, "grad_norm": 1.3203125, "learning_rate": 0.0003289362726150614, "loss": 4.8971, "mean_token_accuracy": 0.22444306910037995, "num_tokens": 95290037.0, "step": 54935 }, { "entropy": 5.968106031417847, "epoch": 4.2744991246839135, "grad_norm": 1.40625, "learning_rate": 0.00032890936472538255, "loss": 4.9628, "mean_token_accuracy": 0.21619293093681335, "num_tokens": 95299370.0, "step": 54940 }, { "entropy": 5.9368799209594725, "epoch": 4.274888154055631, "grad_norm": 1.421875, "learning_rate": 0.000328882456017715, "loss": 4.8758, "mean_token_accuracy": 0.21603064984083176, "num_tokens": 95307349.0, "step": 54945 }, { "entropy": 5.866839027404785, "epoch": 4.275277183427349, "grad_norm": 1.5546875, "learning_rate": 0.00032885554649246697, "loss": 4.9717, "mean_token_accuracy": 0.21191533505916596, "num_tokens": 95316084.0, "step": 54950 }, { "entropy": 5.9466125011444095, "epoch": 4.275666212799067, "grad_norm": 1.5703125, "learning_rate": 0.0003288286361500467, "loss": 4.9481, "mean_token_accuracy": 0.2209256410598755, "num_tokens": 95323907.0, "step": 54955 }, { "entropy": 5.883621311187744, "epoch": 4.276055242170784, "grad_norm": 1.359375, "learning_rate": 0.00032880172499086247, "loss": 4.9507, "mean_token_accuracy": 0.21169123649597169, "num_tokens": 95332850.0, "step": 54960 }, { "entropy": 5.901259708404541, "epoch": 4.276444271542501, "grad_norm": 1.4921875, "learning_rate": 0.0003287748130153228, "loss": 4.9802, "mean_token_accuracy": 0.21438556015491486, "num_tokens": 95341944.0, "step": 54965 }, { "entropy": 5.93082332611084, "epoch": 4.276833300914219, "grad_norm": 1.4140625, "learning_rate": 0.0003287479002238359, "loss": 5.0266, "mean_token_accuracy": 0.20667191445827485, "num_tokens": 95350224.0, "step": 54970 }, { "entropy": 5.9090526580810545, "epoch": 4.2772223302859365, "grad_norm": 1.328125, "learning_rate": 0.0003287209866168102, "loss": 4.8844, "mean_token_accuracy": 0.21957225054502488, "num_tokens": 95359860.0, "step": 54975 }, { "entropy": 5.940339374542236, "epoch": 4.277611359657654, "grad_norm": 1.3828125, "learning_rate": 0.000328694072194654, "loss": 4.9739, "mean_token_accuracy": 0.21604870408773422, "num_tokens": 95368734.0, "step": 54980 }, { "entropy": 5.976496410369873, "epoch": 4.278000389029372, "grad_norm": 1.3515625, "learning_rate": 0.00032866715695777565, "loss": 5.0442, "mean_token_accuracy": 0.2045149877667427, "num_tokens": 95378159.0, "step": 54985 }, { "entropy": 5.977135705947876, "epoch": 4.2783894184010896, "grad_norm": 1.4453125, "learning_rate": 0.0003286402409065837, "loss": 5.0384, "mean_token_accuracy": 0.20458727926015854, "num_tokens": 95386385.0, "step": 54990 }, { "entropy": 5.904051446914673, "epoch": 4.278778447772807, "grad_norm": 1.375, "learning_rate": 0.00032861332404148647, "loss": 4.963, "mean_token_accuracy": 0.21119810342788697, "num_tokens": 95395454.0, "step": 54995 }, { "entropy": 5.969295024871826, "epoch": 4.279167477144524, "grad_norm": 1.3359375, "learning_rate": 0.00032858640636289235, "loss": 5.0497, "mean_token_accuracy": 0.20861918926239015, "num_tokens": 95403832.0, "step": 55000 }, { "entropy": 5.901451444625854, "epoch": 4.279556506516242, "grad_norm": 1.4140625, "learning_rate": 0.0003285594878712098, "loss": 4.8967, "mean_token_accuracy": 0.22022674530744552, "num_tokens": 95413023.0, "step": 55005 }, { "entropy": 5.93023910522461, "epoch": 4.2799455358879595, "grad_norm": 1.4453125, "learning_rate": 0.0003285325685668473, "loss": 4.9841, "mean_token_accuracy": 0.21652329713106155, "num_tokens": 95421891.0, "step": 55010 }, { "entropy": 5.891927671432495, "epoch": 4.280334565259677, "grad_norm": 1.2890625, "learning_rate": 0.00032850564845021327, "loss": 5.0133, "mean_token_accuracy": 0.21354079842567444, "num_tokens": 95430515.0, "step": 55015 }, { "entropy": 5.915850734710693, "epoch": 4.280723594631395, "grad_norm": 1.4296875, "learning_rate": 0.00032847872752171615, "loss": 4.9071, "mean_token_accuracy": 0.21579401642084123, "num_tokens": 95440327.0, "step": 55020 }, { "entropy": 5.94127049446106, "epoch": 4.2811126240031125, "grad_norm": 1.3515625, "learning_rate": 0.00032845180578176456, "loss": 4.8901, "mean_token_accuracy": 0.21167974621057511, "num_tokens": 95448327.0, "step": 55025 }, { "entropy": 5.928249168395996, "epoch": 4.28150165337483, "grad_norm": 1.4296875, "learning_rate": 0.00032842488323076675, "loss": 4.9823, "mean_token_accuracy": 0.21034881025552749, "num_tokens": 95457994.0, "step": 55030 }, { "entropy": 5.882372188568115, "epoch": 4.281890682746547, "grad_norm": 1.4296875, "learning_rate": 0.00032839795986913146, "loss": 4.9265, "mean_token_accuracy": 0.21986666023731233, "num_tokens": 95466398.0, "step": 55035 }, { "entropy": 5.90666880607605, "epoch": 4.282279712118265, "grad_norm": 1.4765625, "learning_rate": 0.00032837103569726713, "loss": 4.9795, "mean_token_accuracy": 0.2102600798010826, "num_tokens": 95475378.0, "step": 55040 }, { "entropy": 5.947157144546509, "epoch": 4.2826687414899824, "grad_norm": 1.28125, "learning_rate": 0.0003283441107155822, "loss": 5.0386, "mean_token_accuracy": 0.2063481628894806, "num_tokens": 95484210.0, "step": 55045 }, { "entropy": 6.000141763687134, "epoch": 4.2830577708617, "grad_norm": 1.328125, "learning_rate": 0.0003283171849244854, "loss": 4.9734, "mean_token_accuracy": 0.21504384875297547, "num_tokens": 95492572.0, "step": 55050 }, { "entropy": 5.921865510940552, "epoch": 4.283446800233418, "grad_norm": 1.2578125, "learning_rate": 0.00032829025832438507, "loss": 4.9303, "mean_token_accuracy": 0.22068173289299012, "num_tokens": 95501547.0, "step": 55055 }, { "entropy": 5.877391004562378, "epoch": 4.2838358296051355, "grad_norm": 1.453125, "learning_rate": 0.00032826333091569, "loss": 4.9395, "mean_token_accuracy": 0.21969527751207352, "num_tokens": 95509550.0, "step": 55060 }, { "entropy": 5.8734293460845945, "epoch": 4.284224858976852, "grad_norm": 1.2734375, "learning_rate": 0.0003282364026988087, "loss": 4.9653, "mean_token_accuracy": 0.21081321239471434, "num_tokens": 95518191.0, "step": 55065 }, { "entropy": 5.88088960647583, "epoch": 4.28461388834857, "grad_norm": 1.4375, "learning_rate": 0.00032820947367414953, "loss": 4.9143, "mean_token_accuracy": 0.22237202376127244, "num_tokens": 95526187.0, "step": 55070 }, { "entropy": 5.764674520492553, "epoch": 4.285002917720288, "grad_norm": 1.4765625, "learning_rate": 0.0003281825438421215, "loss": 4.8408, "mean_token_accuracy": 0.22053172141313554, "num_tokens": 95534850.0, "step": 55075 }, { "entropy": 5.88139853477478, "epoch": 4.285391947092005, "grad_norm": 1.5859375, "learning_rate": 0.00032815561320313286, "loss": 4.9318, "mean_token_accuracy": 0.21655327677726746, "num_tokens": 95542916.0, "step": 55080 }, { "entropy": 5.9635316848754885, "epoch": 4.285780976463723, "grad_norm": 1.578125, "learning_rate": 0.00032812868175759245, "loss": 5.0245, "mean_token_accuracy": 0.21074368357658385, "num_tokens": 95551009.0, "step": 55085 }, { "entropy": 5.934903335571289, "epoch": 4.286170005835441, "grad_norm": 1.3046875, "learning_rate": 0.0003281017495059088, "loss": 5.0121, "mean_token_accuracy": 0.22104764878749847, "num_tokens": 95560964.0, "step": 55090 }, { "entropy": 5.917796945571899, "epoch": 4.2865590352071585, "grad_norm": 1.3359375, "learning_rate": 0.0003280748164484907, "loss": 4.8798, "mean_token_accuracy": 0.21807412952184677, "num_tokens": 95569902.0, "step": 55095 }, { "entropy": 5.965263080596924, "epoch": 4.286948064578875, "grad_norm": 1.53125, "learning_rate": 0.0003280478825857468, "loss": 4.9431, "mean_token_accuracy": 0.21638462245464324, "num_tokens": 95578759.0, "step": 55100 }, { "entropy": 5.983382892608643, "epoch": 4.287337093950593, "grad_norm": 1.390625, "learning_rate": 0.00032802094791808565, "loss": 5.0653, "mean_token_accuracy": 0.20726783722639083, "num_tokens": 95587288.0, "step": 55105 }, { "entropy": 5.924701261520386, "epoch": 4.287726123322311, "grad_norm": 1.625, "learning_rate": 0.000327994012445916, "loss": 4.9178, "mean_token_accuracy": 0.2199135586619377, "num_tokens": 95595698.0, "step": 55110 }, { "entropy": 5.878912782669067, "epoch": 4.288115152694028, "grad_norm": 1.3984375, "learning_rate": 0.0003279670761696465, "loss": 4.9169, "mean_token_accuracy": 0.21757130026817323, "num_tokens": 95603851.0, "step": 55115 }, { "entropy": 5.904960870742798, "epoch": 4.288504182065746, "grad_norm": 1.375, "learning_rate": 0.00032794013908968593, "loss": 4.977, "mean_token_accuracy": 0.20951825976371766, "num_tokens": 95612466.0, "step": 55120 }, { "entropy": 5.9170814037323, "epoch": 4.288893211437464, "grad_norm": 1.4375, "learning_rate": 0.0003279132012064431, "loss": 4.9808, "mean_token_accuracy": 0.20918555110692977, "num_tokens": 95621194.0, "step": 55125 }, { "entropy": 5.933392333984375, "epoch": 4.289282240809181, "grad_norm": 1.3671875, "learning_rate": 0.0003278862625203266, "loss": 4.9852, "mean_token_accuracy": 0.2184272974729538, "num_tokens": 95630207.0, "step": 55130 }, { "entropy": 5.914591550827026, "epoch": 4.289671270180898, "grad_norm": 1.5078125, "learning_rate": 0.00032785932303174524, "loss": 4.9211, "mean_token_accuracy": 0.21909142136573792, "num_tokens": 95638664.0, "step": 55135 }, { "entropy": 5.925998592376709, "epoch": 4.290060299552616, "grad_norm": 1.4609375, "learning_rate": 0.00032783238274110787, "loss": 4.962, "mean_token_accuracy": 0.21837485879659652, "num_tokens": 95647442.0, "step": 55140 }, { "entropy": 5.935156583786011, "epoch": 4.290449328924334, "grad_norm": 1.4453125, "learning_rate": 0.00032780544164882317, "loss": 4.9955, "mean_token_accuracy": 0.2243955463171005, "num_tokens": 95655641.0, "step": 55145 }, { "entropy": 5.963480472564697, "epoch": 4.290838358296051, "grad_norm": 1.484375, "learning_rate": 0.0003277784997552999, "loss": 4.9457, "mean_token_accuracy": 0.21119096577167512, "num_tokens": 95664107.0, "step": 55150 }, { "entropy": 5.9393861293792725, "epoch": 4.291227387667769, "grad_norm": 1.40625, "learning_rate": 0.00032775155706094684, "loss": 4.9726, "mean_token_accuracy": 0.2143098384141922, "num_tokens": 95672936.0, "step": 55155 }, { "entropy": 5.855972814559936, "epoch": 4.291616417039487, "grad_norm": 1.4296875, "learning_rate": 0.0003277246135661729, "loss": 4.8567, "mean_token_accuracy": 0.2212250202894211, "num_tokens": 95681671.0, "step": 55160 }, { "entropy": 5.859768295288086, "epoch": 4.2920054464112045, "grad_norm": 1.4453125, "learning_rate": 0.0003276976692713869, "loss": 4.9042, "mean_token_accuracy": 0.21740612238645554, "num_tokens": 95690748.0, "step": 55165 }, { "entropy": 5.97273473739624, "epoch": 4.292394475782921, "grad_norm": 1.4140625, "learning_rate": 0.0003276707241769976, "loss": 5.0355, "mean_token_accuracy": 0.2081717312335968, "num_tokens": 95698948.0, "step": 55170 }, { "entropy": 5.952265453338623, "epoch": 4.292783505154639, "grad_norm": 1.3984375, "learning_rate": 0.000327643778283414, "loss": 5.1128, "mean_token_accuracy": 0.20296162366867065, "num_tokens": 95707868.0, "step": 55175 }, { "entropy": 5.827863931655884, "epoch": 4.293172534526357, "grad_norm": 1.328125, "learning_rate": 0.00032761683159104475, "loss": 4.8443, "mean_token_accuracy": 0.22736350893974305, "num_tokens": 95716567.0, "step": 55180 }, { "entropy": 5.92322096824646, "epoch": 4.293561563898074, "grad_norm": 1.4296875, "learning_rate": 0.0003275898841002989, "loss": 4.9354, "mean_token_accuracy": 0.22188310325145721, "num_tokens": 95725435.0, "step": 55185 }, { "entropy": 5.966817188262939, "epoch": 4.293950593269792, "grad_norm": 1.3515625, "learning_rate": 0.00032756293581158517, "loss": 5.0767, "mean_token_accuracy": 0.2077276587486267, "num_tokens": 95734769.0, "step": 55190 }, { "entropy": 5.925601291656494, "epoch": 4.29433962264151, "grad_norm": 1.5, "learning_rate": 0.0003275359867253127, "loss": 4.969, "mean_token_accuracy": 0.2204594522714615, "num_tokens": 95742726.0, "step": 55195 }, { "entropy": 5.905518293380737, "epoch": 4.294728652013227, "grad_norm": 1.453125, "learning_rate": 0.0003275090368418901, "loss": 4.9067, "mean_token_accuracy": 0.2223271682858467, "num_tokens": 95751086.0, "step": 55200 }, { "entropy": 5.92593903541565, "epoch": 4.295117681384944, "grad_norm": 1.4140625, "learning_rate": 0.0003274820861617265, "loss": 4.9458, "mean_token_accuracy": 0.21023458391427993, "num_tokens": 95759420.0, "step": 55205 }, { "entropy": 5.934212684631348, "epoch": 4.295506710756662, "grad_norm": 1.4609375, "learning_rate": 0.0003274551346852308, "loss": 5.0368, "mean_token_accuracy": 0.21251590698957443, "num_tokens": 95768011.0, "step": 55210 }, { "entropy": 5.905106735229492, "epoch": 4.29589574012838, "grad_norm": 1.484375, "learning_rate": 0.0003274281824128119, "loss": 4.9275, "mean_token_accuracy": 0.22029270827770234, "num_tokens": 95777138.0, "step": 55215 }, { "entropy": 5.8655658721923825, "epoch": 4.296284769500097, "grad_norm": 1.3984375, "learning_rate": 0.00032740122934487876, "loss": 4.8765, "mean_token_accuracy": 0.216781285405159, "num_tokens": 95785881.0, "step": 55220 }, { "entropy": 5.954648828506469, "epoch": 4.296673798871815, "grad_norm": 1.4453125, "learning_rate": 0.0003273742754818405, "loss": 4.9376, "mean_token_accuracy": 0.21818303763866426, "num_tokens": 95794533.0, "step": 55225 }, { "entropy": 5.891070938110351, "epoch": 4.297062828243533, "grad_norm": 1.25, "learning_rate": 0.0003273473208241058, "loss": 4.9834, "mean_token_accuracy": 0.20637192726135253, "num_tokens": 95804135.0, "step": 55230 }, { "entropy": 5.848950386047363, "epoch": 4.29745185761525, "grad_norm": 1.53125, "learning_rate": 0.00032732036537208386, "loss": 4.8927, "mean_token_accuracy": 0.21908506900072097, "num_tokens": 95813286.0, "step": 55235 }, { "entropy": 5.980234670639038, "epoch": 4.297840886986967, "grad_norm": 1.390625, "learning_rate": 0.0003272934091261837, "loss": 5.0332, "mean_token_accuracy": 0.2116427019238472, "num_tokens": 95822234.0, "step": 55240 }, { "entropy": 5.84839358329773, "epoch": 4.298229916358685, "grad_norm": 1.40625, "learning_rate": 0.00032726645208681427, "loss": 4.8867, "mean_token_accuracy": 0.21820137053728103, "num_tokens": 95830667.0, "step": 55245 }, { "entropy": 5.90915150642395, "epoch": 4.298618945730403, "grad_norm": 1.34375, "learning_rate": 0.00032723949425438465, "loss": 5.0207, "mean_token_accuracy": 0.21370573490858077, "num_tokens": 95840347.0, "step": 55250 }, { "entropy": 5.951452159881592, "epoch": 4.29900797510212, "grad_norm": 1.578125, "learning_rate": 0.00032721253562930383, "loss": 5.0892, "mean_token_accuracy": 0.20923541933298112, "num_tokens": 95848237.0, "step": 55255 }, { "entropy": 5.987345218658447, "epoch": 4.299397004473838, "grad_norm": 1.3125, "learning_rate": 0.00032718557621198087, "loss": 5.0981, "mean_token_accuracy": 0.2092142090201378, "num_tokens": 95857262.0, "step": 55260 }, { "entropy": 5.963543510437011, "epoch": 4.299786033845555, "grad_norm": 1.4375, "learning_rate": 0.0003271586160028249, "loss": 5.0307, "mean_token_accuracy": 0.20898465812206268, "num_tokens": 95865807.0, "step": 55265 }, { "entropy": 5.906054162979126, "epoch": 4.300175063217273, "grad_norm": 1.3515625, "learning_rate": 0.0003271316550022449, "loss": 4.9546, "mean_token_accuracy": 0.21874375343322755, "num_tokens": 95874734.0, "step": 55270 }, { "entropy": 6.010351896286011, "epoch": 4.30056409258899, "grad_norm": 1.46875, "learning_rate": 0.00032710469321065, "loss": 4.9662, "mean_token_accuracy": 0.21215960532426834, "num_tokens": 95883328.0, "step": 55275 }, { "entropy": 5.866271924972534, "epoch": 4.300953121960708, "grad_norm": 1.3203125, "learning_rate": 0.0003270777306284493, "loss": 4.9266, "mean_token_accuracy": 0.21694801449775697, "num_tokens": 95892152.0, "step": 55280 }, { "entropy": 5.947036552429199, "epoch": 4.301342151332426, "grad_norm": 1.484375, "learning_rate": 0.000327050767256052, "loss": 4.9657, "mean_token_accuracy": 0.21250649392604828, "num_tokens": 95900898.0, "step": 55285 }, { "entropy": 5.904823255538941, "epoch": 4.301731180704143, "grad_norm": 1.5625, "learning_rate": 0.00032702380309386714, "loss": 4.9241, "mean_token_accuracy": 0.21585486680269242, "num_tokens": 95909588.0, "step": 55290 }, { "entropy": 5.8983745098114015, "epoch": 4.302120210075861, "grad_norm": 1.390625, "learning_rate": 0.00032699683814230385, "loss": 4.9196, "mean_token_accuracy": 0.21903885304927825, "num_tokens": 95918163.0, "step": 55295 }, { "entropy": 5.931772613525391, "epoch": 4.302509239447578, "grad_norm": 1.546875, "learning_rate": 0.0003269698724017713, "loss": 5.003, "mean_token_accuracy": 0.2155136436223984, "num_tokens": 95926073.0, "step": 55300 }, { "entropy": 5.8874587059021, "epoch": 4.302898268819296, "grad_norm": 1.3828125, "learning_rate": 0.00032694290587267867, "loss": 4.9636, "mean_token_accuracy": 0.21912557631731033, "num_tokens": 95934136.0, "step": 55305 }, { "entropy": 5.875033712387085, "epoch": 4.303287298191013, "grad_norm": 1.515625, "learning_rate": 0.0003269159385554352, "loss": 4.8911, "mean_token_accuracy": 0.22130660563707352, "num_tokens": 95942583.0, "step": 55310 }, { "entropy": 6.043048906326294, "epoch": 4.303676327562731, "grad_norm": 1.484375, "learning_rate": 0.0003268889704504499, "loss": 5.0559, "mean_token_accuracy": 0.20804841965436935, "num_tokens": 95951267.0, "step": 55315 }, { "entropy": 5.981771087646484, "epoch": 4.304065356934449, "grad_norm": 1.40625, "learning_rate": 0.00032686200155813196, "loss": 5.0913, "mean_token_accuracy": 0.20113102793693544, "num_tokens": 95959830.0, "step": 55320 }, { "entropy": 5.934607887268067, "epoch": 4.304454386306166, "grad_norm": 1.359375, "learning_rate": 0.0003268350318788908, "loss": 5.013, "mean_token_accuracy": 0.21188382506370546, "num_tokens": 95967867.0, "step": 55325 }, { "entropy": 5.989916849136352, "epoch": 4.304843415677884, "grad_norm": 1.4921875, "learning_rate": 0.0003268080614131356, "loss": 5.1097, "mean_token_accuracy": 0.20354807525873184, "num_tokens": 95976521.0, "step": 55330 }, { "entropy": 5.9397862434387205, "epoch": 4.305232445049601, "grad_norm": 1.484375, "learning_rate": 0.0003267810901612754, "loss": 4.9717, "mean_token_accuracy": 0.21563531458377838, "num_tokens": 95984640.0, "step": 55335 }, { "entropy": 5.872354888916016, "epoch": 4.305621474421319, "grad_norm": 1.4375, "learning_rate": 0.00032675411812371975, "loss": 4.9431, "mean_token_accuracy": 0.21830699145793914, "num_tokens": 95992894.0, "step": 55340 }, { "entropy": 5.85751371383667, "epoch": 4.306010503793036, "grad_norm": 1.4453125, "learning_rate": 0.00032672714530087763, "loss": 4.929, "mean_token_accuracy": 0.21145529448986053, "num_tokens": 96002084.0, "step": 55345 }, { "entropy": 5.922606086730957, "epoch": 4.306399533164754, "grad_norm": 1.25, "learning_rate": 0.00032670017169315836, "loss": 4.9377, "mean_token_accuracy": 0.21180877089500427, "num_tokens": 96010864.0, "step": 55350 }, { "entropy": 5.937146091461182, "epoch": 4.306788562536472, "grad_norm": 1.3046875, "learning_rate": 0.0003266731973009713, "loss": 4.9629, "mean_token_accuracy": 0.2194577142596245, "num_tokens": 96020166.0, "step": 55355 }, { "entropy": 5.907773065567016, "epoch": 4.307177591908189, "grad_norm": 1.359375, "learning_rate": 0.0003266462221247257, "loss": 4.9153, "mean_token_accuracy": 0.2150722861289978, "num_tokens": 96028329.0, "step": 55360 }, { "entropy": 5.976131439208984, "epoch": 4.307566621279907, "grad_norm": 1.3984375, "learning_rate": 0.000326619246164831, "loss": 4.9991, "mean_token_accuracy": 0.2067098170518875, "num_tokens": 96036762.0, "step": 55365 }, { "entropy": 5.897979640960694, "epoch": 4.307955650651624, "grad_norm": 1.5078125, "learning_rate": 0.0003265922694216963, "loss": 4.8254, "mean_token_accuracy": 0.23048423379659652, "num_tokens": 96044192.0, "step": 55370 }, { "entropy": 5.904801511764527, "epoch": 4.308344680023342, "grad_norm": 1.3984375, "learning_rate": 0.00032656529189573107, "loss": 4.8941, "mean_token_accuracy": 0.22350123524665833, "num_tokens": 96052628.0, "step": 55375 }, { "entropy": 5.8809528827667235, "epoch": 4.308733709395059, "grad_norm": 1.421875, "learning_rate": 0.0003265383135873446, "loss": 4.9906, "mean_token_accuracy": 0.208490788936615, "num_tokens": 96060766.0, "step": 55380 }, { "entropy": 5.901923131942749, "epoch": 4.309122738766777, "grad_norm": 1.4765625, "learning_rate": 0.0003265113344969462, "loss": 4.9666, "mean_token_accuracy": 0.21055087447166443, "num_tokens": 96068925.0, "step": 55385 }, { "entropy": 5.911430168151855, "epoch": 4.309511768138495, "grad_norm": 1.359375, "learning_rate": 0.0003264843546249453, "loss": 4.9082, "mean_token_accuracy": 0.21956858336925505, "num_tokens": 96077318.0, "step": 55390 }, { "entropy": 5.899334144592285, "epoch": 4.309900797510212, "grad_norm": 1.40625, "learning_rate": 0.00032645737397175135, "loss": 4.9392, "mean_token_accuracy": 0.2125054642558098, "num_tokens": 96086077.0, "step": 55395 }, { "entropy": 5.984917068481446, "epoch": 4.310289826881929, "grad_norm": 1.4296875, "learning_rate": 0.00032643039253777356, "loss": 5.0249, "mean_token_accuracy": 0.20374854207038878, "num_tokens": 96095155.0, "step": 55400 }, { "entropy": 5.965982151031494, "epoch": 4.310678856253647, "grad_norm": 1.4609375, "learning_rate": 0.00032640341032342147, "loss": 4.9368, "mean_token_accuracy": 0.21403609812259675, "num_tokens": 96103755.0, "step": 55405 }, { "entropy": 5.886755800247192, "epoch": 4.311067885625365, "grad_norm": 1.3828125, "learning_rate": 0.00032637642732910447, "loss": 4.8687, "mean_token_accuracy": 0.22552481889724732, "num_tokens": 96112025.0, "step": 55410 }, { "entropy": 5.96072564125061, "epoch": 4.311456914997082, "grad_norm": 1.40625, "learning_rate": 0.00032634944355523196, "loss": 5.0185, "mean_token_accuracy": 0.20774497985839843, "num_tokens": 96120043.0, "step": 55415 }, { "entropy": 5.933227682113648, "epoch": 4.3118459443688, "grad_norm": 1.3125, "learning_rate": 0.0003263224590022133, "loss": 4.992, "mean_token_accuracy": 0.2078128382563591, "num_tokens": 96128751.0, "step": 55420 }, { "entropy": 5.959924125671387, "epoch": 4.312234973740518, "grad_norm": 1.453125, "learning_rate": 0.00032629547367045805, "loss": 5.0432, "mean_token_accuracy": 0.21657536923885345, "num_tokens": 96138004.0, "step": 55425 }, { "entropy": 5.918430042266846, "epoch": 4.312624003112235, "grad_norm": 1.3359375, "learning_rate": 0.00032626848756037565, "loss": 4.9172, "mean_token_accuracy": 0.21930391043424607, "num_tokens": 96146472.0, "step": 55430 }, { "entropy": 5.906902551651001, "epoch": 4.313013032483952, "grad_norm": 1.40625, "learning_rate": 0.00032624150067237553, "loss": 4.9134, "mean_token_accuracy": 0.22621539533138274, "num_tokens": 96154389.0, "step": 55435 }, { "entropy": 5.947495841979981, "epoch": 4.31340206185567, "grad_norm": 1.3828125, "learning_rate": 0.0003262145130068672, "loss": 4.9322, "mean_token_accuracy": 0.21716121733188629, "num_tokens": 96162734.0, "step": 55440 }, { "entropy": 5.943421840667725, "epoch": 4.313791091227388, "grad_norm": 1.453125, "learning_rate": 0.00032618752456426017, "loss": 5.0133, "mean_token_accuracy": 0.2141237810254097, "num_tokens": 96171148.0, "step": 55445 }, { "entropy": 5.969653177261352, "epoch": 4.314180120599105, "grad_norm": 1.40625, "learning_rate": 0.00032616053534496387, "loss": 4.9952, "mean_token_accuracy": 0.20969539880752563, "num_tokens": 96179810.0, "step": 55450 }, { "entropy": 5.906009864807129, "epoch": 4.314569149970823, "grad_norm": 1.4609375, "learning_rate": 0.0003261335453493879, "loss": 4.9709, "mean_token_accuracy": 0.20920396894216536, "num_tokens": 96189024.0, "step": 55455 }, { "entropy": 5.965884637832642, "epoch": 4.314958179342541, "grad_norm": 1.4296875, "learning_rate": 0.00032610655457794184, "loss": 5.0562, "mean_token_accuracy": 0.20895423144102096, "num_tokens": 96197848.0, "step": 55460 }, { "entropy": 5.959708786010742, "epoch": 4.3153472087142575, "grad_norm": 1.390625, "learning_rate": 0.00032607956303103516, "loss": 4.9696, "mean_token_accuracy": 0.20848642140626908, "num_tokens": 96206220.0, "step": 55465 }, { "entropy": 5.989362335205078, "epoch": 4.315736238085975, "grad_norm": 1.359375, "learning_rate": 0.00032605257070907734, "loss": 5.0453, "mean_token_accuracy": 0.20335549414157866, "num_tokens": 96214615.0, "step": 55470 }, { "entropy": 5.9546948909759525, "epoch": 4.316125267457693, "grad_norm": 1.546875, "learning_rate": 0.00032602557761247805, "loss": 4.9849, "mean_token_accuracy": 0.22163470089435577, "num_tokens": 96222884.0, "step": 55475 }, { "entropy": 5.865255689620971, "epoch": 4.316514296829411, "grad_norm": 1.3828125, "learning_rate": 0.0003259985837416468, "loss": 4.9038, "mean_token_accuracy": 0.22064450830221177, "num_tokens": 96232597.0, "step": 55480 }, { "entropy": 5.862288188934326, "epoch": 4.316903326201128, "grad_norm": 1.5, "learning_rate": 0.0003259715890969932, "loss": 4.8112, "mean_token_accuracy": 0.228871189057827, "num_tokens": 96241223.0, "step": 55485 }, { "entropy": 5.975696134567261, "epoch": 4.317292355572846, "grad_norm": 1.5234375, "learning_rate": 0.0003259445936789269, "loss": 5.0204, "mean_token_accuracy": 0.20990477204322816, "num_tokens": 96249253.0, "step": 55490 }, { "entropy": 5.9124062061309814, "epoch": 4.317681384944564, "grad_norm": 1.4609375, "learning_rate": 0.00032591759748785753, "loss": 4.8499, "mean_token_accuracy": 0.21776163280010224, "num_tokens": 96257748.0, "step": 55495 }, { "entropy": 5.9783851146698, "epoch": 4.3180704143162805, "grad_norm": 1.5625, "learning_rate": 0.0003258906005241946, "loss": 4.9505, "mean_token_accuracy": 0.21227151900529861, "num_tokens": 96266527.0, "step": 55500 }, { "entropy": 5.850212574005127, "epoch": 4.318459443687998, "grad_norm": 1.4453125, "learning_rate": 0.0003258636027883478, "loss": 4.8764, "mean_token_accuracy": 0.21739228516817094, "num_tokens": 96274873.0, "step": 55505 }, { "entropy": 5.816943168640137, "epoch": 4.318848473059716, "grad_norm": 1.4140625, "learning_rate": 0.0003258366042807269, "loss": 4.8705, "mean_token_accuracy": 0.22213295698165894, "num_tokens": 96282754.0, "step": 55510 }, { "entropy": 5.858556509017944, "epoch": 4.319237502431434, "grad_norm": 1.46875, "learning_rate": 0.0003258096050017413, "loss": 4.9197, "mean_token_accuracy": 0.21789858490228653, "num_tokens": 96291833.0, "step": 55515 }, { "entropy": 5.983089256286621, "epoch": 4.319626531803151, "grad_norm": 1.328125, "learning_rate": 0.0003257826049518008, "loss": 4.9683, "mean_token_accuracy": 0.21144139617681504, "num_tokens": 96300533.0, "step": 55520 }, { "entropy": 5.8526547908782955, "epoch": 4.320015561174869, "grad_norm": 1.5234375, "learning_rate": 0.0003257556041313153, "loss": 4.8344, "mean_token_accuracy": 0.22152081429958342, "num_tokens": 96309254.0, "step": 55525 }, { "entropy": 5.879026699066162, "epoch": 4.320404590546587, "grad_norm": 1.3984375, "learning_rate": 0.0003257286025406941, "loss": 4.9281, "mean_token_accuracy": 0.21833261102437973, "num_tokens": 96317884.0, "step": 55530 }, { "entropy": 5.806975555419922, "epoch": 4.3207936199183035, "grad_norm": 1.4375, "learning_rate": 0.00032570160018034717, "loss": 4.7671, "mean_token_accuracy": 0.2249694675207138, "num_tokens": 96326245.0, "step": 55535 }, { "entropy": 5.926566791534424, "epoch": 4.321182649290021, "grad_norm": 1.515625, "learning_rate": 0.00032567459705068415, "loss": 5.057, "mean_token_accuracy": 0.20405865609645843, "num_tokens": 96334952.0, "step": 55540 }, { "entropy": 5.881127786636353, "epoch": 4.321571678661739, "grad_norm": 1.40625, "learning_rate": 0.00032564759315211475, "loss": 4.8782, "mean_token_accuracy": 0.2210049420595169, "num_tokens": 96343577.0, "step": 55545 }, { "entropy": 5.936071872711182, "epoch": 4.3219607080334566, "grad_norm": 1.515625, "learning_rate": 0.00032562058848504877, "loss": 5.0285, "mean_token_accuracy": 0.2048900917172432, "num_tokens": 96351837.0, "step": 55550 }, { "entropy": 5.914323234558106, "epoch": 4.322349737405174, "grad_norm": 1.3984375, "learning_rate": 0.0003255935830498959, "loss": 4.9768, "mean_token_accuracy": 0.21386099904775618, "num_tokens": 96359812.0, "step": 55555 }, { "entropy": 5.943222427368164, "epoch": 4.322738766776892, "grad_norm": 1.4765625, "learning_rate": 0.000325566576847066, "loss": 5.0269, "mean_token_accuracy": 0.21511978507041932, "num_tokens": 96368441.0, "step": 55560 }, { "entropy": 5.924837303161621, "epoch": 4.32312779614861, "grad_norm": 1.515625, "learning_rate": 0.0003255395698769687, "loss": 4.9129, "mean_token_accuracy": 0.22975900322198867, "num_tokens": 96376756.0, "step": 55565 }, { "entropy": 5.902131652832031, "epoch": 4.3235168255203265, "grad_norm": 1.5234375, "learning_rate": 0.0003255125621400139, "loss": 4.9263, "mean_token_accuracy": 0.21941958069801332, "num_tokens": 96385325.0, "step": 55570 }, { "entropy": 5.94778847694397, "epoch": 4.323905854892044, "grad_norm": 1.4140625, "learning_rate": 0.0003254855536366114, "loss": 4.959, "mean_token_accuracy": 0.22304253727197648, "num_tokens": 96393993.0, "step": 55575 }, { "entropy": 5.9074725151062015, "epoch": 4.324294884263762, "grad_norm": 1.5078125, "learning_rate": 0.000325458544367171, "loss": 4.8564, "mean_token_accuracy": 0.22325484901666642, "num_tokens": 96402221.0, "step": 55580 }, { "entropy": 5.8628215312957765, "epoch": 4.3246839136354795, "grad_norm": 1.390625, "learning_rate": 0.00032543153433210243, "loss": 4.9125, "mean_token_accuracy": 0.21844890117645263, "num_tokens": 96411671.0, "step": 55585 }, { "entropy": 5.894718265533447, "epoch": 4.325072943007197, "grad_norm": 1.4140625, "learning_rate": 0.0003254045235318156, "loss": 4.9135, "mean_token_accuracy": 0.2181897684931755, "num_tokens": 96420294.0, "step": 55590 }, { "entropy": 5.989685916900635, "epoch": 4.325461972378915, "grad_norm": 1.4375, "learning_rate": 0.00032537751196672033, "loss": 5.015, "mean_token_accuracy": 0.2142360508441925, "num_tokens": 96428817.0, "step": 55595 }, { "entropy": 6.028869009017944, "epoch": 4.325851001750632, "grad_norm": 1.3828125, "learning_rate": 0.0003253504996372266, "loss": 5.0328, "mean_token_accuracy": 0.20879340618848802, "num_tokens": 96437383.0, "step": 55600 }, { "entropy": 5.8979973793029785, "epoch": 4.3262400311223494, "grad_norm": 1.3671875, "learning_rate": 0.0003253234865437442, "loss": 4.8447, "mean_token_accuracy": 0.22378999441862107, "num_tokens": 96446451.0, "step": 55605 }, { "entropy": 5.961281394958496, "epoch": 4.326629060494067, "grad_norm": 1.3515625, "learning_rate": 0.0003252964726866829, "loss": 5.0641, "mean_token_accuracy": 0.2114281788468361, "num_tokens": 96455478.0, "step": 55610 }, { "entropy": 5.870669221878051, "epoch": 4.327018089865785, "grad_norm": 1.5078125, "learning_rate": 0.00032526945806645265, "loss": 4.914, "mean_token_accuracy": 0.21908537447452545, "num_tokens": 96464393.0, "step": 55615 }, { "entropy": 5.930798864364624, "epoch": 4.3274071192375025, "grad_norm": 1.390625, "learning_rate": 0.0003252424426834634, "loss": 4.8937, "mean_token_accuracy": 0.233104844391346, "num_tokens": 96473167.0, "step": 55620 }, { "entropy": 5.948755598068237, "epoch": 4.32779614860922, "grad_norm": 1.390625, "learning_rate": 0.0003252154265381251, "loss": 4.9818, "mean_token_accuracy": 0.2136526256799698, "num_tokens": 96482355.0, "step": 55625 }, { "entropy": 5.949413633346557, "epoch": 4.328185177980938, "grad_norm": 1.4765625, "learning_rate": 0.0003251884096308476, "loss": 4.9941, "mean_token_accuracy": 0.2171738028526306, "num_tokens": 96490704.0, "step": 55630 }, { "entropy": 6.0008879661560055, "epoch": 4.328574207352655, "grad_norm": 1.53125, "learning_rate": 0.00032516139196204087, "loss": 4.9912, "mean_token_accuracy": 0.2173539087176323, "num_tokens": 96498469.0, "step": 55635 }, { "entropy": 6.015224504470825, "epoch": 4.328963236724372, "grad_norm": 1.4140625, "learning_rate": 0.00032513437353211483, "loss": 5.0291, "mean_token_accuracy": 0.21051740944385527, "num_tokens": 96506743.0, "step": 55640 }, { "entropy": 5.905644702911377, "epoch": 4.32935226609609, "grad_norm": 1.359375, "learning_rate": 0.0003251073543414796, "loss": 4.9535, "mean_token_accuracy": 0.21195093989372255, "num_tokens": 96515084.0, "step": 55645 }, { "entropy": 5.878390264511109, "epoch": 4.329741295467808, "grad_norm": 1.3828125, "learning_rate": 0.00032508033439054493, "loss": 4.9885, "mean_token_accuracy": 0.21379218250513077, "num_tokens": 96523750.0, "step": 55650 }, { "entropy": 5.9908370018005375, "epoch": 4.3301303248395255, "grad_norm": 1.375, "learning_rate": 0.0003250533136797208, "loss": 5.0007, "mean_token_accuracy": 0.21402197182178498, "num_tokens": 96532939.0, "step": 55655 }, { "entropy": 5.95718994140625, "epoch": 4.330519354211243, "grad_norm": 1.421875, "learning_rate": 0.00032502629220941743, "loss": 4.9552, "mean_token_accuracy": 0.2090720236301422, "num_tokens": 96541276.0, "step": 55660 }, { "entropy": 5.9001209259033205, "epoch": 4.33090838358296, "grad_norm": 1.5, "learning_rate": 0.00032499926998004464, "loss": 4.9606, "mean_token_accuracy": 0.2145879954099655, "num_tokens": 96550068.0, "step": 55665 }, { "entropy": 5.838719654083252, "epoch": 4.331297412954678, "grad_norm": 1.4375, "learning_rate": 0.0003249722469920126, "loss": 4.8398, "mean_token_accuracy": 0.22208221405744552, "num_tokens": 96558939.0, "step": 55670 }, { "entropy": 5.948802900314331, "epoch": 4.331686442326395, "grad_norm": 1.8125, "learning_rate": 0.0003249452232457312, "loss": 4.9286, "mean_token_accuracy": 0.2236321523785591, "num_tokens": 96567277.0, "step": 55675 }, { "entropy": 5.883264541625977, "epoch": 4.332075471698113, "grad_norm": 1.3125, "learning_rate": 0.00032491819874161046, "loss": 4.9018, "mean_token_accuracy": 0.20881546139717103, "num_tokens": 96576013.0, "step": 55680 }, { "entropy": 5.971567010879516, "epoch": 4.332464501069831, "grad_norm": 1.3671875, "learning_rate": 0.0003248911734800606, "loss": 5.0475, "mean_token_accuracy": 0.20842851847410201, "num_tokens": 96585098.0, "step": 55685 }, { "entropy": 5.880332326889038, "epoch": 4.3328535304415485, "grad_norm": 1.4765625, "learning_rate": 0.00032486414746149154, "loss": 4.8875, "mean_token_accuracy": 0.21800680905580522, "num_tokens": 96593770.0, "step": 55690 }, { "entropy": 5.961987257003784, "epoch": 4.333242559813266, "grad_norm": 1.3828125, "learning_rate": 0.00032483712068631345, "loss": 4.9915, "mean_token_accuracy": 0.20999549478292465, "num_tokens": 96602249.0, "step": 55695 }, { "entropy": 5.875831031799317, "epoch": 4.333631589184984, "grad_norm": 1.4609375, "learning_rate": 0.0003248100931549364, "loss": 4.9277, "mean_token_accuracy": 0.2208929792046547, "num_tokens": 96610267.0, "step": 55700 }, { "entropy": 5.936951494216919, "epoch": 4.334020618556701, "grad_norm": 1.3828125, "learning_rate": 0.00032478306486777037, "loss": 4.9842, "mean_token_accuracy": 0.21088332086801528, "num_tokens": 96618954.0, "step": 55705 }, { "entropy": 6.013401889801026, "epoch": 4.334409647928418, "grad_norm": 1.4296875, "learning_rate": 0.0003247560358252256, "loss": 5.0195, "mean_token_accuracy": 0.20819290429353715, "num_tokens": 96628130.0, "step": 55710 }, { "entropy": 5.938758325576782, "epoch": 4.334798677300136, "grad_norm": 1.3828125, "learning_rate": 0.00032472900602771224, "loss": 4.9558, "mean_token_accuracy": 0.217748261988163, "num_tokens": 96636671.0, "step": 55715 }, { "entropy": 5.915176200866699, "epoch": 4.335187706671854, "grad_norm": 1.3125, "learning_rate": 0.00032470197547564036, "loss": 5.0419, "mean_token_accuracy": 0.21294764876365663, "num_tokens": 96646496.0, "step": 55720 }, { "entropy": 5.970814943313599, "epoch": 4.3355767360435715, "grad_norm": 1.3828125, "learning_rate": 0.00032467494416942006, "loss": 5.0272, "mean_token_accuracy": 0.20418087393045425, "num_tokens": 96654985.0, "step": 55725 }, { "entropy": 5.922613906860351, "epoch": 4.335965765415289, "grad_norm": 1.421875, "learning_rate": 0.0003246479121094616, "loss": 4.8655, "mean_token_accuracy": 0.21308761984109878, "num_tokens": 96663533.0, "step": 55730 }, { "entropy": 5.98245267868042, "epoch": 4.336354794787006, "grad_norm": 1.3671875, "learning_rate": 0.000324620879296175, "loss": 5.0766, "mean_token_accuracy": 0.20774131417274475, "num_tokens": 96672111.0, "step": 55735 }, { "entropy": 5.9694822311401365, "epoch": 4.336743824158724, "grad_norm": 1.4453125, "learning_rate": 0.0003245938457299706, "loss": 4.9261, "mean_token_accuracy": 0.22368149012327193, "num_tokens": 96680312.0, "step": 55740 }, { "entropy": 5.857763004302979, "epoch": 4.337132853530441, "grad_norm": 1.328125, "learning_rate": 0.00032456681141125853, "loss": 4.7943, "mean_token_accuracy": 0.23133268803358079, "num_tokens": 96688881.0, "step": 55745 }, { "entropy": 5.8842949867248535, "epoch": 4.337521882902159, "grad_norm": 1.3203125, "learning_rate": 0.000324539776340449, "loss": 4.9119, "mean_token_accuracy": 0.2148086115717888, "num_tokens": 96697899.0, "step": 55750 }, { "entropy": 5.9994312763214115, "epoch": 4.337910912273877, "grad_norm": 1.421875, "learning_rate": 0.0003245127405179522, "loss": 5.0968, "mean_token_accuracy": 0.20263098180294037, "num_tokens": 96707124.0, "step": 55755 }, { "entropy": 5.90067687034607, "epoch": 4.3382999416455945, "grad_norm": 1.296875, "learning_rate": 0.0003244857039441784, "loss": 4.8696, "mean_token_accuracy": 0.22495445013046264, "num_tokens": 96716441.0, "step": 55760 }, { "entropy": 5.996205139160156, "epoch": 4.338688971017312, "grad_norm": 1.46875, "learning_rate": 0.00032445866661953774, "loss": 5.0131, "mean_token_accuracy": 0.1987402081489563, "num_tokens": 96723700.0, "step": 55765 }, { "entropy": 5.886493587493897, "epoch": 4.339078000389029, "grad_norm": 1.3828125, "learning_rate": 0.00032443162854444064, "loss": 4.9238, "mean_token_accuracy": 0.21669620275497437, "num_tokens": 96732391.0, "step": 55770 }, { "entropy": 5.873948192596435, "epoch": 4.339467029760747, "grad_norm": 1.6171875, "learning_rate": 0.0003244045897192972, "loss": 4.9663, "mean_token_accuracy": 0.21250430792570113, "num_tokens": 96740796.0, "step": 55775 }, { "entropy": 6.009280729293823, "epoch": 4.339856059132464, "grad_norm": 1.421875, "learning_rate": 0.00032437755014451777, "loss": 4.9761, "mean_token_accuracy": 0.21308899372816087, "num_tokens": 96748976.0, "step": 55780 }, { "entropy": 6.019100904464722, "epoch": 4.340245088504182, "grad_norm": 1.3828125, "learning_rate": 0.00032435050982051246, "loss": 5.0724, "mean_token_accuracy": 0.20367142856121062, "num_tokens": 96758923.0, "step": 55785 }, { "entropy": 5.918279409408569, "epoch": 4.3406341178759, "grad_norm": 1.328125, "learning_rate": 0.00032432346874769187, "loss": 4.9464, "mean_token_accuracy": 0.21782004684209824, "num_tokens": 96768636.0, "step": 55790 }, { "entropy": 5.916307592391968, "epoch": 4.3410231472476175, "grad_norm": 1.4921875, "learning_rate": 0.00032429642692646614, "loss": 4.911, "mean_token_accuracy": 0.2162455588579178, "num_tokens": 96777200.0, "step": 55795 }, { "entropy": 5.942195653915405, "epoch": 4.341412176619334, "grad_norm": 1.421875, "learning_rate": 0.00032426938435724554, "loss": 5.0572, "mean_token_accuracy": 0.2048630326986313, "num_tokens": 96785775.0, "step": 55800 }, { "entropy": 5.958122587203979, "epoch": 4.341801205991052, "grad_norm": 1.421875, "learning_rate": 0.00032424234104044055, "loss": 5.0446, "mean_token_accuracy": 0.20813334882259368, "num_tokens": 96793996.0, "step": 55805 }, { "entropy": 5.910165166854858, "epoch": 4.34219023536277, "grad_norm": 1.4375, "learning_rate": 0.0003242152969764613, "loss": 4.9849, "mean_token_accuracy": 0.20624516308307647, "num_tokens": 96802433.0, "step": 55810 }, { "entropy": 5.968124580383301, "epoch": 4.342579264734487, "grad_norm": 1.3125, "learning_rate": 0.0003241882521657183, "loss": 5.0079, "mean_token_accuracy": 0.20822871327400208, "num_tokens": 96812077.0, "step": 55815 }, { "entropy": 5.956984424591065, "epoch": 4.342968294106205, "grad_norm": 1.53125, "learning_rate": 0.00032416120660862187, "loss": 4.9494, "mean_token_accuracy": 0.21741608530282974, "num_tokens": 96820148.0, "step": 55820 }, { "entropy": 5.923762273788452, "epoch": 4.343357323477923, "grad_norm": 1.5546875, "learning_rate": 0.0003241341603055823, "loss": 4.9952, "mean_token_accuracy": 0.2139963001012802, "num_tokens": 96828341.0, "step": 55825 }, { "entropy": 5.899516487121582, "epoch": 4.3437463528496405, "grad_norm": 1.40625, "learning_rate": 0.0003241071132570101, "loss": 4.9655, "mean_token_accuracy": 0.21616213023662567, "num_tokens": 96837076.0, "step": 55830 }, { "entropy": 5.952333402633667, "epoch": 4.344135382221357, "grad_norm": 1.34375, "learning_rate": 0.0003240800654633157, "loss": 4.9831, "mean_token_accuracy": 0.2135088250041008, "num_tokens": 96845784.0, "step": 55835 }, { "entropy": 5.999456453323364, "epoch": 4.344524411593075, "grad_norm": 1.453125, "learning_rate": 0.0003240530169249094, "loss": 4.9404, "mean_token_accuracy": 0.2231002628803253, "num_tokens": 96853927.0, "step": 55840 }, { "entropy": 5.876666069030762, "epoch": 4.344913440964793, "grad_norm": 1.34375, "learning_rate": 0.0003240259676422016, "loss": 4.842, "mean_token_accuracy": 0.22084612846374513, "num_tokens": 96863286.0, "step": 55845 }, { "entropy": 5.973383140563965, "epoch": 4.34530247033651, "grad_norm": 1.484375, "learning_rate": 0.00032399891761560274, "loss": 4.9903, "mean_token_accuracy": 0.2116517648100853, "num_tokens": 96871168.0, "step": 55850 }, { "entropy": 5.894485187530518, "epoch": 4.345691499708228, "grad_norm": 1.34375, "learning_rate": 0.0003239718668455233, "loss": 4.9164, "mean_token_accuracy": 0.21415430903434754, "num_tokens": 96880006.0, "step": 55855 }, { "entropy": 5.94235782623291, "epoch": 4.346080529079946, "grad_norm": 1.3203125, "learning_rate": 0.0003239448153323737, "loss": 4.988, "mean_token_accuracy": 0.21311260610818863, "num_tokens": 96888456.0, "step": 55860 }, { "entropy": 5.896415853500367, "epoch": 4.3464695584516635, "grad_norm": 1.5234375, "learning_rate": 0.00032391776307656456, "loss": 4.8577, "mean_token_accuracy": 0.22564922720193864, "num_tokens": 96898027.0, "step": 55865 }, { "entropy": 5.9129640579223635, "epoch": 4.34685858782338, "grad_norm": 1.3671875, "learning_rate": 0.00032389071007850616, "loss": 4.9598, "mean_token_accuracy": 0.2193996161222458, "num_tokens": 96907091.0, "step": 55870 }, { "entropy": 5.972544431686401, "epoch": 4.347247617195098, "grad_norm": 1.3984375, "learning_rate": 0.00032386365633860914, "loss": 5.0069, "mean_token_accuracy": 0.20755694210529327, "num_tokens": 96915958.0, "step": 55875 }, { "entropy": 5.870822906494141, "epoch": 4.347636646566816, "grad_norm": 1.296875, "learning_rate": 0.0003238366018572838, "loss": 4.914, "mean_token_accuracy": 0.2201402187347412, "num_tokens": 96924793.0, "step": 55880 }, { "entropy": 5.971823501586914, "epoch": 4.348025675938533, "grad_norm": 1.421875, "learning_rate": 0.0003238095466349407, "loss": 5.0841, "mean_token_accuracy": 0.20929877012968062, "num_tokens": 96933763.0, "step": 55885 }, { "entropy": 5.999117994308472, "epoch": 4.348414705310251, "grad_norm": 1.3515625, "learning_rate": 0.0003237824906719905, "loss": 4.9756, "mean_token_accuracy": 0.2184861943125725, "num_tokens": 96942325.0, "step": 55890 }, { "entropy": 5.937520122528076, "epoch": 4.348803734681969, "grad_norm": 1.46875, "learning_rate": 0.00032375543396884367, "loss": 5.0165, "mean_token_accuracy": 0.21021803468465805, "num_tokens": 96951804.0, "step": 55895 }, { "entropy": 5.916098356246948, "epoch": 4.3491927640536865, "grad_norm": 1.40625, "learning_rate": 0.0003237283765259107, "loss": 5.0015, "mean_token_accuracy": 0.21524731665849686, "num_tokens": 96960272.0, "step": 55900 }, { "entropy": 5.871624898910523, "epoch": 4.349581793425403, "grad_norm": 1.4140625, "learning_rate": 0.00032370131834360215, "loss": 4.8475, "mean_token_accuracy": 0.22052532732486724, "num_tokens": 96968979.0, "step": 55905 }, { "entropy": 5.9452403545379635, "epoch": 4.349970822797121, "grad_norm": 1.359375, "learning_rate": 0.0003236742594223287, "loss": 4.9693, "mean_token_accuracy": 0.20842225849628448, "num_tokens": 96977836.0, "step": 55910 }, { "entropy": 5.935708332061767, "epoch": 4.350359852168839, "grad_norm": 1.4609375, "learning_rate": 0.0003236471997625008, "loss": 4.9152, "mean_token_accuracy": 0.21648208200931549, "num_tokens": 96986220.0, "step": 55915 }, { "entropy": 5.916415071487426, "epoch": 4.350748881540556, "grad_norm": 1.4765625, "learning_rate": 0.0003236201393645291, "loss": 4.9826, "mean_token_accuracy": 0.2132427453994751, "num_tokens": 96995261.0, "step": 55920 }, { "entropy": 5.93584566116333, "epoch": 4.351137910912274, "grad_norm": 1.359375, "learning_rate": 0.00032359307822882403, "loss": 5.0202, "mean_token_accuracy": 0.21350504457950592, "num_tokens": 97004893.0, "step": 55925 }, { "entropy": 5.978117847442627, "epoch": 4.351526940283992, "grad_norm": 1.390625, "learning_rate": 0.00032356601635579645, "loss": 4.9907, "mean_token_accuracy": 0.21074840128421785, "num_tokens": 97013244.0, "step": 55930 }, { "entropy": 6.0033854961395265, "epoch": 4.351915969655709, "grad_norm": 1.421875, "learning_rate": 0.0003235389537458569, "loss": 5.0217, "mean_token_accuracy": 0.2141931548714638, "num_tokens": 97021305.0, "step": 55935 }, { "entropy": 5.939027738571167, "epoch": 4.352304999027426, "grad_norm": 1.5078125, "learning_rate": 0.00032351189039941594, "loss": 4.9401, "mean_token_accuracy": 0.21352207213640212, "num_tokens": 97029666.0, "step": 55940 }, { "entropy": 5.865205955505371, "epoch": 4.352694028399144, "grad_norm": 1.546875, "learning_rate": 0.00032348482631688424, "loss": 4.9787, "mean_token_accuracy": 0.20683272927999496, "num_tokens": 97038270.0, "step": 55945 }, { "entropy": 5.941774463653564, "epoch": 4.353083057770862, "grad_norm": 1.5078125, "learning_rate": 0.0003234577614986725, "loss": 4.9683, "mean_token_accuracy": 0.21826982945203782, "num_tokens": 97047019.0, "step": 55950 }, { "entropy": 5.913543605804444, "epoch": 4.353472087142579, "grad_norm": 1.2734375, "learning_rate": 0.0003234306959451914, "loss": 4.9102, "mean_token_accuracy": 0.20883888900279998, "num_tokens": 97056193.0, "step": 55955 }, { "entropy": 5.901032114028931, "epoch": 4.353861116514297, "grad_norm": 1.5234375, "learning_rate": 0.00032340362965685145, "loss": 4.8806, "mean_token_accuracy": 0.22198074907064438, "num_tokens": 97064556.0, "step": 55960 }, { "entropy": 5.958832502365112, "epoch": 4.354250145886015, "grad_norm": 1.5625, "learning_rate": 0.0003233765626340636, "loss": 5.0767, "mean_token_accuracy": 0.20854007005691527, "num_tokens": 97072923.0, "step": 55965 }, { "entropy": 5.980124139785767, "epoch": 4.354639175257732, "grad_norm": 1.3671875, "learning_rate": 0.0003233494948772384, "loss": 5.0441, "mean_token_accuracy": 0.2147770807147026, "num_tokens": 97081811.0, "step": 55970 }, { "entropy": 5.908018970489502, "epoch": 4.355028204629449, "grad_norm": 1.4921875, "learning_rate": 0.00032332242638678647, "loss": 4.913, "mean_token_accuracy": 0.22189415395259857, "num_tokens": 97090051.0, "step": 55975 }, { "entropy": 5.976730489730835, "epoch": 4.355417234001167, "grad_norm": 1.3515625, "learning_rate": 0.0003232953571631187, "loss": 4.979, "mean_token_accuracy": 0.219314044713974, "num_tokens": 97098538.0, "step": 55980 }, { "entropy": 5.940883779525757, "epoch": 4.355806263372885, "grad_norm": 1.3984375, "learning_rate": 0.0003232682872066457, "loss": 4.9768, "mean_token_accuracy": 0.21777852922677993, "num_tokens": 97107163.0, "step": 55985 }, { "entropy": 5.905527877807617, "epoch": 4.356195292744602, "grad_norm": 1.390625, "learning_rate": 0.0003232412165177783, "loss": 4.885, "mean_token_accuracy": 0.21814920604228974, "num_tokens": 97115855.0, "step": 55990 }, { "entropy": 5.872034978866577, "epoch": 4.35658432211632, "grad_norm": 1.3828125, "learning_rate": 0.00032321414509692726, "loss": 4.9141, "mean_token_accuracy": 0.21843722313642502, "num_tokens": 97125383.0, "step": 55995 }, { "entropy": 5.929622840881348, "epoch": 4.356973351488037, "grad_norm": 1.4140625, "learning_rate": 0.00032318707294450326, "loss": 5.0103, "mean_token_accuracy": 0.21229803264141084, "num_tokens": 97133932.0, "step": 56000 }, { "entropy": 5.972325420379638, "epoch": 4.357362380859755, "grad_norm": 1.5, "learning_rate": 0.0003231600000609171, "loss": 4.9904, "mean_token_accuracy": 0.21252066493034363, "num_tokens": 97142371.0, "step": 56005 }, { "entropy": 5.95780987739563, "epoch": 4.357751410231472, "grad_norm": 1.5078125, "learning_rate": 0.00032313292644657967, "loss": 4.9888, "mean_token_accuracy": 0.20960887223482133, "num_tokens": 97150369.0, "step": 56010 }, { "entropy": 5.944254159927368, "epoch": 4.35814043960319, "grad_norm": 1.390625, "learning_rate": 0.0003231058521019017, "loss": 5.011, "mean_token_accuracy": 0.20740724951028824, "num_tokens": 97158967.0, "step": 56015 }, { "entropy": 5.875265741348267, "epoch": 4.358529468974908, "grad_norm": 1.4921875, "learning_rate": 0.0003230787770272939, "loss": 4.9377, "mean_token_accuracy": 0.2161858409643173, "num_tokens": 97167420.0, "step": 56020 }, { "entropy": 5.941634321212769, "epoch": 4.358918498346625, "grad_norm": 1.4921875, "learning_rate": 0.0003230517012231673, "loss": 4.9429, "mean_token_accuracy": 0.20788084715604782, "num_tokens": 97175557.0, "step": 56025 }, { "entropy": 5.966920804977417, "epoch": 4.359307527718343, "grad_norm": 1.421875, "learning_rate": 0.00032302462468993253, "loss": 4.9912, "mean_token_accuracy": 0.20945829451084136, "num_tokens": 97184206.0, "step": 56030 }, { "entropy": 5.963095378875733, "epoch": 4.359696557090061, "grad_norm": 1.34375, "learning_rate": 0.0003229975474280006, "loss": 4.9504, "mean_token_accuracy": 0.21910752803087236, "num_tokens": 97193496.0, "step": 56035 }, { "entropy": 5.923631191253662, "epoch": 4.360085586461778, "grad_norm": 1.3984375, "learning_rate": 0.00032297046943778216, "loss": 4.9488, "mean_token_accuracy": 0.22001154273748397, "num_tokens": 97202608.0, "step": 56040 }, { "entropy": 5.94158091545105, "epoch": 4.360474615833495, "grad_norm": 1.3515625, "learning_rate": 0.00032294339071968833, "loss": 5.0219, "mean_token_accuracy": 0.20597779601812363, "num_tokens": 97211692.0, "step": 56045 }, { "entropy": 5.958036088943482, "epoch": 4.360863645205213, "grad_norm": 1.453125, "learning_rate": 0.00032291631127412976, "loss": 4.9382, "mean_token_accuracy": 0.21796551197767258, "num_tokens": 97220148.0, "step": 56050 }, { "entropy": 5.92380313873291, "epoch": 4.361252674576931, "grad_norm": 1.4453125, "learning_rate": 0.0003228892311015174, "loss": 4.8826, "mean_token_accuracy": 0.22404381036758422, "num_tokens": 97229687.0, "step": 56055 }, { "entropy": 5.918945741653443, "epoch": 4.361641703948648, "grad_norm": 1.3984375, "learning_rate": 0.00032286215020226224, "loss": 4.8621, "mean_token_accuracy": 0.2236122280359268, "num_tokens": 97238122.0, "step": 56060 }, { "entropy": 5.919385290145874, "epoch": 4.362030733320366, "grad_norm": 1.375, "learning_rate": 0.00032283506857677517, "loss": 4.9326, "mean_token_accuracy": 0.223294934630394, "num_tokens": 97246617.0, "step": 56065 }, { "entropy": 5.841565227508545, "epoch": 4.362419762692083, "grad_norm": 1.390625, "learning_rate": 0.0003228079862254671, "loss": 4.8969, "mean_token_accuracy": 0.22199808210134506, "num_tokens": 97254863.0, "step": 56070 }, { "entropy": 5.902840948104858, "epoch": 4.362808792063801, "grad_norm": 1.375, "learning_rate": 0.00032278090314874887, "loss": 5.0231, "mean_token_accuracy": 0.19830291718244553, "num_tokens": 97263818.0, "step": 56075 }, { "entropy": 5.8855448246002195, "epoch": 4.363197821435518, "grad_norm": 1.4765625, "learning_rate": 0.00032275381934703147, "loss": 4.9131, "mean_token_accuracy": 0.21328169852495193, "num_tokens": 97271974.0, "step": 56080 }, { "entropy": 5.956129360198974, "epoch": 4.363586850807236, "grad_norm": 1.421875, "learning_rate": 0.0003227267348207258, "loss": 4.9409, "mean_token_accuracy": 0.22072838842868805, "num_tokens": 97281192.0, "step": 56085 }, { "entropy": 5.967231941223145, "epoch": 4.363975880178954, "grad_norm": 1.40625, "learning_rate": 0.00032269964957024305, "loss": 5.0186, "mean_token_accuracy": 0.2091701716184616, "num_tokens": 97290290.0, "step": 56090 }, { "entropy": 5.9358617782592775, "epoch": 4.364364909550671, "grad_norm": 1.453125, "learning_rate": 0.00032267256359599396, "loss": 4.8754, "mean_token_accuracy": 0.22697941660881044, "num_tokens": 97298422.0, "step": 56095 }, { "entropy": 5.978378868103027, "epoch": 4.364753938922389, "grad_norm": 1.484375, "learning_rate": 0.00032264547689838963, "loss": 4.9668, "mean_token_accuracy": 0.21296575516462327, "num_tokens": 97306741.0, "step": 56100 }, { "entropy": 5.89862642288208, "epoch": 4.365142968294106, "grad_norm": 1.6796875, "learning_rate": 0.00032261838947784103, "loss": 4.9057, "mean_token_accuracy": 0.22273586243391036, "num_tokens": 97315585.0, "step": 56105 }, { "entropy": 5.938363122940063, "epoch": 4.365531997665824, "grad_norm": 1.40625, "learning_rate": 0.0003225913013347591, "loss": 5.0001, "mean_token_accuracy": 0.20903493762016295, "num_tokens": 97324137.0, "step": 56110 }, { "entropy": 5.977956676483155, "epoch": 4.365921027037541, "grad_norm": 1.4296875, "learning_rate": 0.00032256421246955504, "loss": 4.9748, "mean_token_accuracy": 0.21186740547418595, "num_tokens": 97332701.0, "step": 56115 }, { "entropy": 5.925376462936401, "epoch": 4.366310056409259, "grad_norm": 1.3984375, "learning_rate": 0.0003225371228826396, "loss": 4.9313, "mean_token_accuracy": 0.22004767805337905, "num_tokens": 97342365.0, "step": 56120 }, { "entropy": 6.016350603103637, "epoch": 4.366699085780977, "grad_norm": 1.421875, "learning_rate": 0.0003225100325744241, "loss": 4.9977, "mean_token_accuracy": 0.2063423216342926, "num_tokens": 97350031.0, "step": 56125 }, { "entropy": 5.904652500152588, "epoch": 4.367088115152694, "grad_norm": 1.3359375, "learning_rate": 0.0003224829415453194, "loss": 4.9547, "mean_token_accuracy": 0.21403586566448213, "num_tokens": 97358942.0, "step": 56130 }, { "entropy": 5.952938508987427, "epoch": 4.367477144524411, "grad_norm": 1.4609375, "learning_rate": 0.0003224558497957367, "loss": 5.0036, "mean_token_accuracy": 0.21067202240228652, "num_tokens": 97367019.0, "step": 56135 }, { "entropy": 5.902221918106079, "epoch": 4.367866173896129, "grad_norm": 1.4375, "learning_rate": 0.00032242875732608697, "loss": 4.9232, "mean_token_accuracy": 0.2214179590344429, "num_tokens": 97375812.0, "step": 56140 }, { "entropy": 5.915839338302613, "epoch": 4.3682552032678466, "grad_norm": 1.5078125, "learning_rate": 0.0003224016641367814, "loss": 4.9817, "mean_token_accuracy": 0.21580185741186142, "num_tokens": 97385038.0, "step": 56145 }, { "entropy": 5.947696685791016, "epoch": 4.368644232639564, "grad_norm": 1.4375, "learning_rate": 0.00032237457022823095, "loss": 4.9739, "mean_token_accuracy": 0.2163414478302002, "num_tokens": 97393695.0, "step": 56150 }, { "entropy": 5.952973318099976, "epoch": 4.369033262011282, "grad_norm": 1.5, "learning_rate": 0.00032234747560084675, "loss": 4.9613, "mean_token_accuracy": 0.21989718377590178, "num_tokens": 97401959.0, "step": 56155 }, { "entropy": 5.991323757171631, "epoch": 4.369422291383, "grad_norm": 1.4609375, "learning_rate": 0.00032232038025504015, "loss": 4.9763, "mean_token_accuracy": 0.2169852778315544, "num_tokens": 97410756.0, "step": 56160 }, { "entropy": 5.933845806121826, "epoch": 4.369811320754717, "grad_norm": 1.40625, "learning_rate": 0.00032229328419122196, "loss": 4.9188, "mean_token_accuracy": 0.216201551258564, "num_tokens": 97418910.0, "step": 56165 }, { "entropy": 5.927053546905517, "epoch": 4.370200350126434, "grad_norm": 1.5, "learning_rate": 0.0003222661874098035, "loss": 4.9956, "mean_token_accuracy": 0.20316251665353774, "num_tokens": 97427552.0, "step": 56170 }, { "entropy": 5.946160459518433, "epoch": 4.370589379498152, "grad_norm": 1.5078125, "learning_rate": 0.0003222390899111959, "loss": 4.9697, "mean_token_accuracy": 0.21411100178956985, "num_tokens": 97436242.0, "step": 56175 }, { "entropy": 5.980920314788818, "epoch": 4.3709784088698695, "grad_norm": 1.4921875, "learning_rate": 0.0003222119916958103, "loss": 4.9921, "mean_token_accuracy": 0.208387354016304, "num_tokens": 97444299.0, "step": 56180 }, { "entropy": 5.884223890304566, "epoch": 4.371367438241587, "grad_norm": 1.4609375, "learning_rate": 0.00032218489276405777, "loss": 4.9714, "mean_token_accuracy": 0.21913256794214248, "num_tokens": 97452768.0, "step": 56185 }, { "entropy": 5.9413690090179445, "epoch": 4.371756467613305, "grad_norm": 1.4921875, "learning_rate": 0.00032215779311634967, "loss": 5.0843, "mean_token_accuracy": 0.2085232451558113, "num_tokens": 97461657.0, "step": 56190 }, { "entropy": 5.947444772720337, "epoch": 4.372145496985023, "grad_norm": 1.4609375, "learning_rate": 0.00032213069275309714, "loss": 4.9089, "mean_token_accuracy": 0.21769207268953322, "num_tokens": 97469720.0, "step": 56195 }, { "entropy": 5.872397708892822, "epoch": 4.37253452635674, "grad_norm": 1.3359375, "learning_rate": 0.00032210359167471136, "loss": 4.8818, "mean_token_accuracy": 0.21272236108779907, "num_tokens": 97478004.0, "step": 56200 }, { "entropy": 5.9213978290557865, "epoch": 4.372923555728457, "grad_norm": 1.4296875, "learning_rate": 0.0003220764898816035, "loss": 5.0119, "mean_token_accuracy": 0.20327015370130538, "num_tokens": 97487421.0, "step": 56205 }, { "entropy": 5.970058393478394, "epoch": 4.373312585100175, "grad_norm": 1.46875, "learning_rate": 0.00032204938737418495, "loss": 4.977, "mean_token_accuracy": 0.21098547875881196, "num_tokens": 97495533.0, "step": 56210 }, { "entropy": 5.984961605072021, "epoch": 4.3737016144718925, "grad_norm": 1.4921875, "learning_rate": 0.00032202228415286664, "loss": 5.0702, "mean_token_accuracy": 0.20539511293172835, "num_tokens": 97504398.0, "step": 56215 }, { "entropy": 5.967674493789673, "epoch": 4.37409064384361, "grad_norm": 1.3046875, "learning_rate": 0.0003219951802180602, "loss": 5.0137, "mean_token_accuracy": 0.2133561208844185, "num_tokens": 97513024.0, "step": 56220 }, { "entropy": 5.926362609863281, "epoch": 4.374479673215328, "grad_norm": 1.8203125, "learning_rate": 0.0003219680755701766, "loss": 4.8969, "mean_token_accuracy": 0.22283420115709304, "num_tokens": 97522514.0, "step": 56225 }, { "entropy": 5.969330358505249, "epoch": 4.374868702587046, "grad_norm": 1.390625, "learning_rate": 0.00032194097020962726, "loss": 4.9915, "mean_token_accuracy": 0.2125408098101616, "num_tokens": 97530972.0, "step": 56230 }, { "entropy": 6.015900897979736, "epoch": 4.375257731958763, "grad_norm": 1.40625, "learning_rate": 0.0003219138641368234, "loss": 5.0921, "mean_token_accuracy": 0.21186351627111435, "num_tokens": 97539551.0, "step": 56235 }, { "entropy": 5.910834169387817, "epoch": 4.37564676133048, "grad_norm": 1.40625, "learning_rate": 0.00032188675735217627, "loss": 4.9582, "mean_token_accuracy": 0.2131665378808975, "num_tokens": 97548521.0, "step": 56240 }, { "entropy": 5.9350823879241945, "epoch": 4.376035790702198, "grad_norm": 1.546875, "learning_rate": 0.0003218596498560973, "loss": 4.9648, "mean_token_accuracy": 0.21525688469409943, "num_tokens": 97556602.0, "step": 56245 }, { "entropy": 5.904653263092041, "epoch": 4.3764248200739155, "grad_norm": 1.46875, "learning_rate": 0.0003218325416489976, "loss": 4.9271, "mean_token_accuracy": 0.2170117661356926, "num_tokens": 97564728.0, "step": 56250 }, { "entropy": 5.864369535446167, "epoch": 4.376813849445633, "grad_norm": 1.3359375, "learning_rate": 0.0003218054327312888, "loss": 4.8918, "mean_token_accuracy": 0.2243138685822487, "num_tokens": 97574445.0, "step": 56255 }, { "entropy": 5.936367177963257, "epoch": 4.377202878817351, "grad_norm": 1.2734375, "learning_rate": 0.00032177832310338193, "loss": 4.8839, "mean_token_accuracy": 0.22559448778629304, "num_tokens": 97583313.0, "step": 56260 }, { "entropy": 5.954859733581543, "epoch": 4.377591908189069, "grad_norm": 1.3984375, "learning_rate": 0.00032175121276568853, "loss": 4.9546, "mean_token_accuracy": 0.2172989308834076, "num_tokens": 97591429.0, "step": 56265 }, { "entropy": 5.838796997070313, "epoch": 4.377980937560785, "grad_norm": 1.4296875, "learning_rate": 0.00032172410171861987, "loss": 4.9016, "mean_token_accuracy": 0.2140534847974777, "num_tokens": 97600062.0, "step": 56270 }, { "entropy": 5.961314630508423, "epoch": 4.378369966932503, "grad_norm": 1.4296875, "learning_rate": 0.00032169698996258733, "loss": 4.8995, "mean_token_accuracy": 0.22232256829738617, "num_tokens": 97607893.0, "step": 56275 }, { "entropy": 5.908568859100342, "epoch": 4.378758996304221, "grad_norm": 1.46875, "learning_rate": 0.0003216698774980023, "loss": 4.9108, "mean_token_accuracy": 0.21947636753320693, "num_tokens": 97615965.0, "step": 56280 }, { "entropy": 5.914955949783325, "epoch": 4.3791480256759385, "grad_norm": 1.5546875, "learning_rate": 0.00032164276432527605, "loss": 5.001, "mean_token_accuracy": 0.21439209431409836, "num_tokens": 97625191.0, "step": 56285 }, { "entropy": 5.941383790969849, "epoch": 4.379537055047656, "grad_norm": 1.484375, "learning_rate": 0.0003216156504448202, "loss": 4.8994, "mean_token_accuracy": 0.2185932993888855, "num_tokens": 97633323.0, "step": 56290 }, { "entropy": 6.0086273670196535, "epoch": 4.379926084419374, "grad_norm": 1.3671875, "learning_rate": 0.0003215885358570461, "loss": 5.0124, "mean_token_accuracy": 0.21894364953041076, "num_tokens": 97642597.0, "step": 56295 }, { "entropy": 5.9069640159606935, "epoch": 4.380315113791092, "grad_norm": 1.3671875, "learning_rate": 0.0003215614205623651, "loss": 4.9546, "mean_token_accuracy": 0.22181523740291595, "num_tokens": 97651912.0, "step": 56300 }, { "entropy": 5.921082925796509, "epoch": 4.380704143162808, "grad_norm": 1.3984375, "learning_rate": 0.0003215343045611886, "loss": 5.015, "mean_token_accuracy": 0.21282305419445038, "num_tokens": 97660757.0, "step": 56305 }, { "entropy": 5.949446296691894, "epoch": 4.381093172534526, "grad_norm": 1.328125, "learning_rate": 0.0003215071878539281, "loss": 4.9723, "mean_token_accuracy": 0.2135314866900444, "num_tokens": 97669310.0, "step": 56310 }, { "entropy": 5.918653106689453, "epoch": 4.381482201906244, "grad_norm": 1.328125, "learning_rate": 0.00032148007044099507, "loss": 4.9999, "mean_token_accuracy": 0.21205658465623856, "num_tokens": 97678624.0, "step": 56315 }, { "entropy": 5.897065782546997, "epoch": 4.3818712312779615, "grad_norm": 1.46875, "learning_rate": 0.0003214529523228009, "loss": 4.9326, "mean_token_accuracy": 0.20947071313858032, "num_tokens": 97687763.0, "step": 56320 }, { "entropy": 5.813525295257568, "epoch": 4.382260260649679, "grad_norm": 1.4296875, "learning_rate": 0.0003214258334997572, "loss": 4.82, "mean_token_accuracy": 0.22335976362228394, "num_tokens": 97696992.0, "step": 56325 }, { "entropy": 5.877807903289795, "epoch": 4.382649290021397, "grad_norm": 1.46875, "learning_rate": 0.0003213987139722753, "loss": 4.9581, "mean_token_accuracy": 0.2174182191491127, "num_tokens": 97706544.0, "step": 56330 }, { "entropy": 5.90077919960022, "epoch": 4.383038319393114, "grad_norm": 1.3828125, "learning_rate": 0.00032137159374076693, "loss": 4.9311, "mean_token_accuracy": 0.20944517552852632, "num_tokens": 97715672.0, "step": 56335 }, { "entropy": 5.919169521331787, "epoch": 4.383427348764831, "grad_norm": 1.453125, "learning_rate": 0.0003213444728056432, "loss": 4.9043, "mean_token_accuracy": 0.2251693934202194, "num_tokens": 97724526.0, "step": 56340 }, { "entropy": 5.859677505493164, "epoch": 4.383816378136549, "grad_norm": 1.375, "learning_rate": 0.00032131735116731604, "loss": 4.8768, "mean_token_accuracy": 0.21731405109167098, "num_tokens": 97733275.0, "step": 56345 }, { "entropy": 5.99262490272522, "epoch": 4.384205407508267, "grad_norm": 1.4296875, "learning_rate": 0.0003212902288261966, "loss": 5.0497, "mean_token_accuracy": 0.20619826167821884, "num_tokens": 97742490.0, "step": 56350 }, { "entropy": 5.93501615524292, "epoch": 4.3845944368799845, "grad_norm": 1.4921875, "learning_rate": 0.0003212631057826968, "loss": 4.9822, "mean_token_accuracy": 0.2118422955274582, "num_tokens": 97751596.0, "step": 56355 }, { "entropy": 5.887598752975464, "epoch": 4.384983466251702, "grad_norm": 1.421875, "learning_rate": 0.00032123598203722786, "loss": 4.9583, "mean_token_accuracy": 0.204955492913723, "num_tokens": 97760236.0, "step": 56360 }, { "entropy": 5.932577323913574, "epoch": 4.38537249562342, "grad_norm": 1.46875, "learning_rate": 0.0003212088575902016, "loss": 5.0442, "mean_token_accuracy": 0.2122553765773773, "num_tokens": 97769150.0, "step": 56365 }, { "entropy": 5.962339925765991, "epoch": 4.385761524995137, "grad_norm": 1.4453125, "learning_rate": 0.00032118173244202947, "loss": 4.9646, "mean_token_accuracy": 0.2105802834033966, "num_tokens": 97777864.0, "step": 56370 }, { "entropy": 5.978813982009887, "epoch": 4.386150554366854, "grad_norm": 1.421875, "learning_rate": 0.00032115460659312304, "loss": 4.9545, "mean_token_accuracy": 0.21664247065782546, "num_tokens": 97786417.0, "step": 56375 }, { "entropy": 5.958394527435303, "epoch": 4.386539583738572, "grad_norm": 1.4609375, "learning_rate": 0.0003211274800438939, "loss": 5.0502, "mean_token_accuracy": 0.2077595978975296, "num_tokens": 97795331.0, "step": 56380 }, { "entropy": 5.977413702011108, "epoch": 4.38692861311029, "grad_norm": 1.4140625, "learning_rate": 0.0003211003527947537, "loss": 5.0097, "mean_token_accuracy": 0.21154166162014007, "num_tokens": 97804099.0, "step": 56385 }, { "entropy": 5.949991369247437, "epoch": 4.3873176424820075, "grad_norm": 1.359375, "learning_rate": 0.00032107322484611396, "loss": 4.9044, "mean_token_accuracy": 0.21822178810834886, "num_tokens": 97812401.0, "step": 56390 }, { "entropy": 5.906556510925293, "epoch": 4.387706671853725, "grad_norm": 1.375, "learning_rate": 0.00032104609619838635, "loss": 4.9729, "mean_token_accuracy": 0.2084787979722023, "num_tokens": 97821842.0, "step": 56395 }, { "entropy": 5.926098108291626, "epoch": 4.388095701225443, "grad_norm": 1.46875, "learning_rate": 0.0003210189668519826, "loss": 4.9412, "mean_token_accuracy": 0.2207949623465538, "num_tokens": 97829911.0, "step": 56400 }, { "entropy": 5.86351466178894, "epoch": 4.38848473059716, "grad_norm": 1.5390625, "learning_rate": 0.0003209918368073143, "loss": 4.8851, "mean_token_accuracy": 0.2165749505162239, "num_tokens": 97838789.0, "step": 56405 }, { "entropy": 5.944088268280029, "epoch": 4.388873759968877, "grad_norm": 1.4765625, "learning_rate": 0.000320964706064793, "loss": 4.9762, "mean_token_accuracy": 0.21002319306135178, "num_tokens": 97847440.0, "step": 56410 }, { "entropy": 5.9059055805206295, "epoch": 4.389262789340595, "grad_norm": 1.4609375, "learning_rate": 0.00032093757462483055, "loss": 4.882, "mean_token_accuracy": 0.2160208895802498, "num_tokens": 97856265.0, "step": 56415 }, { "entropy": 5.929558801651001, "epoch": 4.389651818712313, "grad_norm": 1.296875, "learning_rate": 0.00032091044248783835, "loss": 4.9682, "mean_token_accuracy": 0.21483466476202012, "num_tokens": 97865226.0, "step": 56420 }, { "entropy": 5.9117718696594235, "epoch": 4.3900408480840305, "grad_norm": 1.375, "learning_rate": 0.00032088330965422836, "loss": 4.942, "mean_token_accuracy": 0.21430072337388992, "num_tokens": 97874396.0, "step": 56425 }, { "entropy": 5.876473236083984, "epoch": 4.390429877455748, "grad_norm": 1.296875, "learning_rate": 0.00032085617612441215, "loss": 4.9017, "mean_token_accuracy": 0.22171937972307204, "num_tokens": 97883349.0, "step": 56430 }, { "entropy": 5.926604795455932, "epoch": 4.390818906827466, "grad_norm": 1.484375, "learning_rate": 0.0003208290418988015, "loss": 5.0066, "mean_token_accuracy": 0.20565370768308638, "num_tokens": 97891594.0, "step": 56435 }, { "entropy": 5.949440145492554, "epoch": 4.391207936199183, "grad_norm": 1.5390625, "learning_rate": 0.000320801906977808, "loss": 4.9611, "mean_token_accuracy": 0.21548758298158646, "num_tokens": 97900322.0, "step": 56440 }, { "entropy": 6.001616621017456, "epoch": 4.3915969655709, "grad_norm": 1.4453125, "learning_rate": 0.00032077477136184356, "loss": 4.9548, "mean_token_accuracy": 0.21395036280155183, "num_tokens": 97909169.0, "step": 56445 }, { "entropy": 5.96880989074707, "epoch": 4.391985994942618, "grad_norm": 1.6171875, "learning_rate": 0.0003207476350513198, "loss": 5.0152, "mean_token_accuracy": 0.2139275550842285, "num_tokens": 97916784.0, "step": 56450 }, { "entropy": 5.938837003707886, "epoch": 4.392375024314336, "grad_norm": 1.453125, "learning_rate": 0.0003207204980466485, "loss": 5.0244, "mean_token_accuracy": 0.20933600813150405, "num_tokens": 97925899.0, "step": 56455 }, { "entropy": 5.88900318145752, "epoch": 4.3927640536860535, "grad_norm": 1.390625, "learning_rate": 0.00032069336034824136, "loss": 4.9474, "mean_token_accuracy": 0.21331433951854706, "num_tokens": 97934632.0, "step": 56460 }, { "entropy": 5.9370969295501705, "epoch": 4.393153083057771, "grad_norm": 1.4296875, "learning_rate": 0.00032066622195651024, "loss": 4.9456, "mean_token_accuracy": 0.2151886910200119, "num_tokens": 97943381.0, "step": 56465 }, { "entropy": 5.938102436065674, "epoch": 4.393542112429488, "grad_norm": 1.4375, "learning_rate": 0.00032063908287186687, "loss": 4.9729, "mean_token_accuracy": 0.21777980923652648, "num_tokens": 97952667.0, "step": 56470 }, { "entropy": 5.895109510421753, "epoch": 4.393931141801206, "grad_norm": 1.59375, "learning_rate": 0.00032061194309472314, "loss": 4.9336, "mean_token_accuracy": 0.2169489488005638, "num_tokens": 97960820.0, "step": 56475 }, { "entropy": 5.960391664505005, "epoch": 4.394320171172923, "grad_norm": 1.4375, "learning_rate": 0.00032058480262549065, "loss": 4.972, "mean_token_accuracy": 0.21583024114370347, "num_tokens": 97969519.0, "step": 56480 }, { "entropy": 5.867330646514892, "epoch": 4.394709200544641, "grad_norm": 1.515625, "learning_rate": 0.0003205576614645814, "loss": 4.9407, "mean_token_accuracy": 0.21840080469846726, "num_tokens": 97978838.0, "step": 56485 }, { "entropy": 5.865899848937988, "epoch": 4.395098229916359, "grad_norm": 1.546875, "learning_rate": 0.00032053051961240716, "loss": 4.855, "mean_token_accuracy": 0.22793754786252976, "num_tokens": 97986912.0, "step": 56490 }, { "entropy": 5.928740310668945, "epoch": 4.3954872592880765, "grad_norm": 1.34375, "learning_rate": 0.0003205033770693797, "loss": 4.9949, "mean_token_accuracy": 0.21615003645420075, "num_tokens": 97995716.0, "step": 56495 }, { "entropy": 5.984345388412476, "epoch": 4.395876288659794, "grad_norm": 1.375, "learning_rate": 0.000320476233835911, "loss": 5.0281, "mean_token_accuracy": 0.21139513999223708, "num_tokens": 98004353.0, "step": 56500 }, { "entropy": 5.9611045837402346, "epoch": 4.396265318031511, "grad_norm": 1.6015625, "learning_rate": 0.00032044908991241274, "loss": 4.9873, "mean_token_accuracy": 0.20275863260030746, "num_tokens": 98013091.0, "step": 56505 }, { "entropy": 5.9299938678741455, "epoch": 4.396654347403229, "grad_norm": 1.46875, "learning_rate": 0.00032042194529929694, "loss": 4.901, "mean_token_accuracy": 0.2232312634587288, "num_tokens": 98021296.0, "step": 56510 }, { "entropy": 5.927159929275513, "epoch": 4.397043376774946, "grad_norm": 1.40625, "learning_rate": 0.00032039479999697545, "loss": 4.9551, "mean_token_accuracy": 0.22175492495298385, "num_tokens": 98029470.0, "step": 56515 }, { "entropy": 5.9263989448547365, "epoch": 4.397432406146664, "grad_norm": 1.328125, "learning_rate": 0.00032036765400586005, "loss": 4.9636, "mean_token_accuracy": 0.21583996415138246, "num_tokens": 98037542.0, "step": 56520 }, { "entropy": 5.948272275924682, "epoch": 4.397821435518382, "grad_norm": 1.4140625, "learning_rate": 0.00032034050732636274, "loss": 4.9518, "mean_token_accuracy": 0.2176176503300667, "num_tokens": 98045683.0, "step": 56525 }, { "entropy": 5.92075834274292, "epoch": 4.3982104648900995, "grad_norm": 1.4453125, "learning_rate": 0.0003203133599588954, "loss": 4.9924, "mean_token_accuracy": 0.2161384180188179, "num_tokens": 98054147.0, "step": 56530 }, { "entropy": 5.952115154266357, "epoch": 4.398599494261817, "grad_norm": 1.515625, "learning_rate": 0.00032028621190386997, "loss": 5.0296, "mean_token_accuracy": 0.20907048732042313, "num_tokens": 98063140.0, "step": 56535 }, { "entropy": 5.883146333694458, "epoch": 4.398988523633534, "grad_norm": 1.3359375, "learning_rate": 0.00032025906316169835, "loss": 4.8856, "mean_token_accuracy": 0.22200715988874437, "num_tokens": 98071725.0, "step": 56540 }, { "entropy": 5.874318933486938, "epoch": 4.399377553005252, "grad_norm": 1.3984375, "learning_rate": 0.0003202319137327924, "loss": 4.9157, "mean_token_accuracy": 0.2241577312350273, "num_tokens": 98080810.0, "step": 56545 }, { "entropy": 5.958617401123047, "epoch": 4.399766582376969, "grad_norm": 1.484375, "learning_rate": 0.00032020476361756424, "loss": 4.9816, "mean_token_accuracy": 0.21890343874692916, "num_tokens": 98089420.0, "step": 56550 }, { "entropy": 5.873955011367798, "epoch": 4.400155611748687, "grad_norm": 1.4375, "learning_rate": 0.00032017761281642564, "loss": 4.903, "mean_token_accuracy": 0.2219498112797737, "num_tokens": 98098517.0, "step": 56555 }, { "entropy": 5.926497507095337, "epoch": 4.400544641120405, "grad_norm": 1.40625, "learning_rate": 0.0003201504613297888, "loss": 4.8868, "mean_token_accuracy": 0.21882407367229462, "num_tokens": 98106895.0, "step": 56560 }, { "entropy": 5.984807968139648, "epoch": 4.4009336704921225, "grad_norm": 1.4375, "learning_rate": 0.00032012330915806553, "loss": 5.0722, "mean_token_accuracy": 0.2066210463643074, "num_tokens": 98116001.0, "step": 56565 }, { "entropy": 5.895428943634033, "epoch": 4.40132269986384, "grad_norm": 1.453125, "learning_rate": 0.00032009615630166786, "loss": 4.9113, "mean_token_accuracy": 0.21669747084379196, "num_tokens": 98124369.0, "step": 56570 }, { "entropy": 5.870689249038696, "epoch": 4.401711729235557, "grad_norm": 1.4296875, "learning_rate": 0.0003200690027610078, "loss": 4.8145, "mean_token_accuracy": 0.22550151646137237, "num_tokens": 98132875.0, "step": 56575 }, { "entropy": 5.971677017211914, "epoch": 4.402100758607275, "grad_norm": 1.4140625, "learning_rate": 0.0003200418485364974, "loss": 5.0586, "mean_token_accuracy": 0.21063570976257323, "num_tokens": 98141185.0, "step": 56580 }, { "entropy": 5.928086662292481, "epoch": 4.402489787978992, "grad_norm": 1.3828125, "learning_rate": 0.0003200146936285485, "loss": 4.9456, "mean_token_accuracy": 0.21375012993812562, "num_tokens": 98149944.0, "step": 56585 }, { "entropy": 5.965887975692749, "epoch": 4.40287881735071, "grad_norm": 1.3984375, "learning_rate": 0.0003199875380375734, "loss": 5.0293, "mean_token_accuracy": 0.20691123008728027, "num_tokens": 98157716.0, "step": 56590 }, { "entropy": 5.949393272399902, "epoch": 4.403267846722428, "grad_norm": 1.46875, "learning_rate": 0.000319960381763984, "loss": 4.9981, "mean_token_accuracy": 0.2118916094303131, "num_tokens": 98166108.0, "step": 56595 }, { "entropy": 5.845628452301026, "epoch": 4.4036568760941455, "grad_norm": 1.5234375, "learning_rate": 0.0003199332248081923, "loss": 4.8259, "mean_token_accuracy": 0.22670550048351287, "num_tokens": 98174182.0, "step": 56600 }, { "entropy": 5.8828497409820555, "epoch": 4.404045905465862, "grad_norm": 1.4140625, "learning_rate": 0.00031990606717061055, "loss": 4.9753, "mean_token_accuracy": 0.22398349046707153, "num_tokens": 98182955.0, "step": 56605 }, { "entropy": 5.918631601333618, "epoch": 4.40443493483758, "grad_norm": 1.4453125, "learning_rate": 0.0003198789088516506, "loss": 4.9078, "mean_token_accuracy": 0.2223304182291031, "num_tokens": 98192200.0, "step": 56610 }, { "entropy": 6.031404781341553, "epoch": 4.404823964209298, "grad_norm": 1.5390625, "learning_rate": 0.00031985174985172467, "loss": 5.0063, "mean_token_accuracy": 0.21497859358787536, "num_tokens": 98199731.0, "step": 56615 }, { "entropy": 5.958570241928101, "epoch": 4.405212993581015, "grad_norm": 1.46875, "learning_rate": 0.0003198245901712449, "loss": 4.9957, "mean_token_accuracy": 0.2112015664577484, "num_tokens": 98208535.0, "step": 56620 }, { "entropy": 5.970226526260376, "epoch": 4.405602022952733, "grad_norm": 1.375, "learning_rate": 0.0003197974298106232, "loss": 4.9738, "mean_token_accuracy": 0.22197719812393188, "num_tokens": 98217869.0, "step": 56625 }, { "entropy": 5.938514232635498, "epoch": 4.405991052324451, "grad_norm": 1.5859375, "learning_rate": 0.00031977026877027186, "loss": 4.9086, "mean_token_accuracy": 0.2174789860844612, "num_tokens": 98225795.0, "step": 56630 }, { "entropy": 5.940296030044555, "epoch": 4.4063800816961685, "grad_norm": 1.2421875, "learning_rate": 0.00031974310705060297, "loss": 4.9747, "mean_token_accuracy": 0.2140609696507454, "num_tokens": 98235367.0, "step": 56635 }, { "entropy": 5.9591333866119385, "epoch": 4.406769111067885, "grad_norm": 1.375, "learning_rate": 0.0003197159446520286, "loss": 5.009, "mean_token_accuracy": 0.21677228808403015, "num_tokens": 98244530.0, "step": 56640 }, { "entropy": 5.948100805282593, "epoch": 4.407158140439603, "grad_norm": 1.4453125, "learning_rate": 0.00031968878157496105, "loss": 4.939, "mean_token_accuracy": 0.21955470442771913, "num_tokens": 98254435.0, "step": 56645 }, { "entropy": 5.937676811218262, "epoch": 4.407547169811321, "grad_norm": 1.46875, "learning_rate": 0.00031966161781981224, "loss": 4.9754, "mean_token_accuracy": 0.21046240478754044, "num_tokens": 98263600.0, "step": 56650 }, { "entropy": 5.943836975097656, "epoch": 4.407936199183038, "grad_norm": 1.4921875, "learning_rate": 0.00031963445338699446, "loss": 4.9133, "mean_token_accuracy": 0.21837540417909623, "num_tokens": 98271743.0, "step": 56655 }, { "entropy": 5.9307169914245605, "epoch": 4.408325228554756, "grad_norm": 1.4453125, "learning_rate": 0.00031960728827692, "loss": 4.9321, "mean_token_accuracy": 0.2249053806066513, "num_tokens": 98280244.0, "step": 56660 }, { "entropy": 5.977306175231933, "epoch": 4.408714257926474, "grad_norm": 1.515625, "learning_rate": 0.0003195801224900009, "loss": 5.0341, "mean_token_accuracy": 0.20814796090126036, "num_tokens": 98289005.0, "step": 56665 }, { "entropy": 6.040990781784058, "epoch": 4.409103287298191, "grad_norm": 1.421875, "learning_rate": 0.00031955295602664936, "loss": 5.0367, "mean_token_accuracy": 0.21656417548656465, "num_tokens": 98297687.0, "step": 56670 }, { "entropy": 5.9367907524108885, "epoch": 4.409492316669908, "grad_norm": 1.3046875, "learning_rate": 0.00031952578888727763, "loss": 4.9183, "mean_token_accuracy": 0.22128846794366835, "num_tokens": 98306159.0, "step": 56675 }, { "entropy": 5.890282392501831, "epoch": 4.409881346041626, "grad_norm": 1.3828125, "learning_rate": 0.00031949862107229796, "loss": 4.9206, "mean_token_accuracy": 0.21719149500131607, "num_tokens": 98315114.0, "step": 56680 }, { "entropy": 5.960938262939453, "epoch": 4.410270375413344, "grad_norm": 1.515625, "learning_rate": 0.0003194714525821225, "loss": 5.069, "mean_token_accuracy": 0.20947894901037217, "num_tokens": 98323413.0, "step": 56685 }, { "entropy": 5.996547269821167, "epoch": 4.410659404785061, "grad_norm": 1.5, "learning_rate": 0.0003194442834171636, "loss": 4.9376, "mean_token_accuracy": 0.2121077820658684, "num_tokens": 98331946.0, "step": 56690 }, { "entropy": 5.95749945640564, "epoch": 4.411048434156779, "grad_norm": 1.3125, "learning_rate": 0.0003194171135778334, "loss": 4.9666, "mean_token_accuracy": 0.20684940367937088, "num_tokens": 98341583.0, "step": 56695 }, { "entropy": 5.907864570617676, "epoch": 4.411437463528497, "grad_norm": 1.359375, "learning_rate": 0.0003193899430645442, "loss": 4.8977, "mean_token_accuracy": 0.21910208016633986, "num_tokens": 98350403.0, "step": 56700 }, { "entropy": 5.9756568431854244, "epoch": 4.411826492900214, "grad_norm": 1.2578125, "learning_rate": 0.00031936277187770824, "loss": 5.0842, "mean_token_accuracy": 0.2027921810746193, "num_tokens": 98358803.0, "step": 56705 }, { "entropy": 5.970907163619995, "epoch": 4.412215522271931, "grad_norm": 1.4140625, "learning_rate": 0.0003193356000177378, "loss": 4.9335, "mean_token_accuracy": 0.21828947365283966, "num_tokens": 98367971.0, "step": 56710 }, { "entropy": 5.958186340332031, "epoch": 4.412604551643649, "grad_norm": 1.390625, "learning_rate": 0.0003193084274850453, "loss": 4.9892, "mean_token_accuracy": 0.22026481926441194, "num_tokens": 98377036.0, "step": 56715 }, { "entropy": 5.920546531677246, "epoch": 4.412993581015367, "grad_norm": 1.4140625, "learning_rate": 0.00031928125428004286, "loss": 4.9765, "mean_token_accuracy": 0.21383829265832902, "num_tokens": 98385424.0, "step": 56720 }, { "entropy": 5.996419906616211, "epoch": 4.413382610387084, "grad_norm": 1.3828125, "learning_rate": 0.0003192540804031429, "loss": 4.9876, "mean_token_accuracy": 0.21340801566839218, "num_tokens": 98393621.0, "step": 56725 }, { "entropy": 6.013441896438598, "epoch": 4.413771639758802, "grad_norm": 1.4296875, "learning_rate": 0.0003192269058547577, "loss": 5.1052, "mean_token_accuracy": 0.20797307640314103, "num_tokens": 98402171.0, "step": 56730 }, { "entropy": 5.9125657081604, "epoch": 4.41416066913052, "grad_norm": 1.3359375, "learning_rate": 0.0003191997306352996, "loss": 4.9472, "mean_token_accuracy": 0.21520679891109468, "num_tokens": 98411111.0, "step": 56735 }, { "entropy": 5.933580684661865, "epoch": 4.4145496985022366, "grad_norm": 1.671875, "learning_rate": 0.000319172554745181, "loss": 4.8984, "mean_token_accuracy": 0.22040425091981888, "num_tokens": 98419658.0, "step": 56740 }, { "entropy": 5.972822523117065, "epoch": 4.414938727873954, "grad_norm": 1.4140625, "learning_rate": 0.00031914537818481404, "loss": 5.0934, "mean_token_accuracy": 0.20754118114709855, "num_tokens": 98428110.0, "step": 56745 }, { "entropy": 5.914547348022461, "epoch": 4.415327757245672, "grad_norm": 1.4609375, "learning_rate": 0.0003191182009546113, "loss": 4.9313, "mean_token_accuracy": 0.21953604221343995, "num_tokens": 98436871.0, "step": 56750 }, { "entropy": 5.855015230178833, "epoch": 4.41571678661739, "grad_norm": 1.40625, "learning_rate": 0.00031909102305498514, "loss": 4.8626, "mean_token_accuracy": 0.21681714355945586, "num_tokens": 98444968.0, "step": 56755 }, { "entropy": 5.9820740699768065, "epoch": 4.416105815989107, "grad_norm": 1.3515625, "learning_rate": 0.00031906384448634784, "loss": 5.0398, "mean_token_accuracy": 0.21327763199806213, "num_tokens": 98454067.0, "step": 56760 }, { "entropy": 5.994354724884033, "epoch": 4.416494845360825, "grad_norm": 1.28125, "learning_rate": 0.00031903666524911185, "loss": 5.0589, "mean_token_accuracy": 0.21250736117362976, "num_tokens": 98463604.0, "step": 56765 }, { "entropy": 5.900160026550293, "epoch": 4.416883874732543, "grad_norm": 1.3671875, "learning_rate": 0.00031900948534368954, "loss": 4.938, "mean_token_accuracy": 0.22009223103523254, "num_tokens": 98472790.0, "step": 56770 }, { "entropy": 5.962891483306885, "epoch": 4.4172729041042595, "grad_norm": 1.3125, "learning_rate": 0.00031898230477049334, "loss": 5.0011, "mean_token_accuracy": 0.21671175062656403, "num_tokens": 98482382.0, "step": 56775 }, { "entropy": 5.867442226409912, "epoch": 4.417661933475977, "grad_norm": 1.3046875, "learning_rate": 0.0003189551235299357, "loss": 4.8896, "mean_token_accuracy": 0.2217137634754181, "num_tokens": 98491362.0, "step": 56780 }, { "entropy": 5.953394269943237, "epoch": 4.418050962847695, "grad_norm": 1.390625, "learning_rate": 0.0003189279416224289, "loss": 4.9707, "mean_token_accuracy": 0.21368285715579988, "num_tokens": 98499293.0, "step": 56785 }, { "entropy": 5.996138286590576, "epoch": 4.418439992219413, "grad_norm": 1.4765625, "learning_rate": 0.00031890075904838556, "loss": 5.034, "mean_token_accuracy": 0.2090111717581749, "num_tokens": 98507665.0, "step": 56790 }, { "entropy": 5.905490779876709, "epoch": 4.41882902159113, "grad_norm": 1.3203125, "learning_rate": 0.00031887357580821817, "loss": 4.8926, "mean_token_accuracy": 0.22003644555807114, "num_tokens": 98516662.0, "step": 56795 }, { "entropy": 5.924647855758667, "epoch": 4.419218050962848, "grad_norm": 1.4453125, "learning_rate": 0.00031884639190233905, "loss": 4.9819, "mean_token_accuracy": 0.21059444546699524, "num_tokens": 98524642.0, "step": 56800 }, { "entropy": 6.00779504776001, "epoch": 4.419607080334565, "grad_norm": 1.453125, "learning_rate": 0.0003188192073311608, "loss": 5.0256, "mean_token_accuracy": 0.2092769429087639, "num_tokens": 98532805.0, "step": 56805 }, { "entropy": 5.914027500152588, "epoch": 4.4199961097062825, "grad_norm": 1.40625, "learning_rate": 0.00031879202209509564, "loss": 4.94, "mean_token_accuracy": 0.22320854365825654, "num_tokens": 98541479.0, "step": 56810 }, { "entropy": 5.892930412292481, "epoch": 4.420385139078, "grad_norm": 1.4140625, "learning_rate": 0.00031876483619455633, "loss": 5.0243, "mean_token_accuracy": 0.21446819901466369, "num_tokens": 98550208.0, "step": 56815 }, { "entropy": 5.975541782379151, "epoch": 4.420774168449718, "grad_norm": 1.46875, "learning_rate": 0.0003187376496299553, "loss": 5.0158, "mean_token_accuracy": 0.20977468490600587, "num_tokens": 98558890.0, "step": 56820 }, { "entropy": 5.988870096206665, "epoch": 4.421163197821436, "grad_norm": 1.34375, "learning_rate": 0.000318710462401705, "loss": 4.9409, "mean_token_accuracy": 0.21382893323898317, "num_tokens": 98567269.0, "step": 56825 }, { "entropy": 6.020040273666382, "epoch": 4.421552227193153, "grad_norm": 1.421875, "learning_rate": 0.00031868327451021816, "loss": 5.0745, "mean_token_accuracy": 0.2088913083076477, "num_tokens": 98576554.0, "step": 56830 }, { "entropy": 5.915755128860473, "epoch": 4.421941256564871, "grad_norm": 1.46875, "learning_rate": 0.00031865608595590706, "loss": 4.9614, "mean_token_accuracy": 0.21389412581920625, "num_tokens": 98584667.0, "step": 56835 }, { "entropy": 5.947736597061157, "epoch": 4.422330285936588, "grad_norm": 1.4375, "learning_rate": 0.00031862889673918437, "loss": 4.9894, "mean_token_accuracy": 0.2134447604417801, "num_tokens": 98592976.0, "step": 56840 }, { "entropy": 5.942670202255249, "epoch": 4.4227193153083055, "grad_norm": 1.4453125, "learning_rate": 0.0003186017068604626, "loss": 4.9317, "mean_token_accuracy": 0.22419904321432113, "num_tokens": 98601406.0, "step": 56845 }, { "entropy": 5.9527791976928714, "epoch": 4.423108344680023, "grad_norm": 1.4296875, "learning_rate": 0.0003185745163201543, "loss": 4.9511, "mean_token_accuracy": 0.21429968178272246, "num_tokens": 98609797.0, "step": 56850 }, { "entropy": 5.862278652191162, "epoch": 4.423497374051741, "grad_norm": 1.3359375, "learning_rate": 0.0003185473251186721, "loss": 4.9305, "mean_token_accuracy": 0.217645063996315, "num_tokens": 98618428.0, "step": 56855 }, { "entropy": 5.8954509735107425, "epoch": 4.423886403423459, "grad_norm": 1.265625, "learning_rate": 0.0003185201332564285, "loss": 4.9125, "mean_token_accuracy": 0.21673950403928757, "num_tokens": 98627294.0, "step": 56860 }, { "entropy": 5.943177127838135, "epoch": 4.424275432795176, "grad_norm": 1.3671875, "learning_rate": 0.0003184929407338362, "loss": 4.9336, "mean_token_accuracy": 0.2123803973197937, "num_tokens": 98636721.0, "step": 56865 }, { "entropy": 5.9382078647613525, "epoch": 4.424664462166893, "grad_norm": 1.5390625, "learning_rate": 0.00031846574755130773, "loss": 4.9457, "mean_token_accuracy": 0.22137642353773118, "num_tokens": 98645325.0, "step": 56870 }, { "entropy": 5.897609233856201, "epoch": 4.425053491538611, "grad_norm": 1.5078125, "learning_rate": 0.00031843855370925574, "loss": 4.9061, "mean_token_accuracy": 0.22479104101657868, "num_tokens": 98653524.0, "step": 56875 }, { "entropy": 5.9612624168396, "epoch": 4.4254425209103285, "grad_norm": 1.6171875, "learning_rate": 0.00031841135920809285, "loss": 4.9519, "mean_token_accuracy": 0.22124587893486022, "num_tokens": 98661483.0, "step": 56880 }, { "entropy": 5.9634778022766115, "epoch": 4.425831550282046, "grad_norm": 1.4453125, "learning_rate": 0.0003183841640482316, "loss": 5.013, "mean_token_accuracy": 0.21130256354808807, "num_tokens": 98670202.0, "step": 56885 }, { "entropy": 5.93214864730835, "epoch": 4.426220579653764, "grad_norm": 1.4453125, "learning_rate": 0.00031835696823008476, "loss": 4.9811, "mean_token_accuracy": 0.2149977296590805, "num_tokens": 98678632.0, "step": 56890 }, { "entropy": 5.975233268737793, "epoch": 4.426609609025482, "grad_norm": 1.4140625, "learning_rate": 0.00031832977175406496, "loss": 4.9963, "mean_token_accuracy": 0.2107300192117691, "num_tokens": 98686908.0, "step": 56895 }, { "entropy": 5.98721604347229, "epoch": 4.426998638397199, "grad_norm": 1.5625, "learning_rate": 0.0003183025746205848, "loss": 5.0175, "mean_token_accuracy": 0.2167464703321457, "num_tokens": 98694954.0, "step": 56900 }, { "entropy": 5.919262647628784, "epoch": 4.427387667768917, "grad_norm": 1.390625, "learning_rate": 0.0003182753768300571, "loss": 4.9186, "mean_token_accuracy": 0.22369845509529113, "num_tokens": 98703813.0, "step": 56905 }, { "entropy": 5.919897127151489, "epoch": 4.427776697140634, "grad_norm": 1.4296875, "learning_rate": 0.0003182481783828943, "loss": 4.9353, "mean_token_accuracy": 0.21661010086536409, "num_tokens": 98712198.0, "step": 56910 }, { "entropy": 6.01188383102417, "epoch": 4.4281657265123515, "grad_norm": 1.3359375, "learning_rate": 0.00031822097927950934, "loss": 5.015, "mean_token_accuracy": 0.21164233684539796, "num_tokens": 98721693.0, "step": 56915 }, { "entropy": 6.019493103027344, "epoch": 4.428554755884069, "grad_norm": 1.3515625, "learning_rate": 0.00031819377952031476, "loss": 5.0398, "mean_token_accuracy": 0.20627864301204682, "num_tokens": 98730238.0, "step": 56920 }, { "entropy": 5.92161226272583, "epoch": 4.428943785255787, "grad_norm": 1.328125, "learning_rate": 0.00031816657910572327, "loss": 4.9391, "mean_token_accuracy": 0.21502457559108734, "num_tokens": 98739298.0, "step": 56925 }, { "entropy": 6.040129518508911, "epoch": 4.429332814627505, "grad_norm": 1.5703125, "learning_rate": 0.00031813937803614774, "loss": 5.0714, "mean_token_accuracy": 0.2099572166800499, "num_tokens": 98748862.0, "step": 56930 }, { "entropy": 5.878735065460205, "epoch": 4.429721843999222, "grad_norm": 1.46875, "learning_rate": 0.0003181121763120008, "loss": 4.8874, "mean_token_accuracy": 0.2254655569791794, "num_tokens": 98757445.0, "step": 56935 }, { "entropy": 5.961406612396241, "epoch": 4.430110873370939, "grad_norm": 1.6953125, "learning_rate": 0.0003180849739336952, "loss": 4.9945, "mean_token_accuracy": 0.21152057200670243, "num_tokens": 98765856.0, "step": 56940 }, { "entropy": 5.93566484451294, "epoch": 4.430499902742657, "grad_norm": 1.453125, "learning_rate": 0.00031805777090164364, "loss": 5.0282, "mean_token_accuracy": 0.21019337028265, "num_tokens": 98774819.0, "step": 56945 }, { "entropy": 5.983921051025391, "epoch": 4.4308889321143745, "grad_norm": 1.4140625, "learning_rate": 0.000318030567216259, "loss": 4.9376, "mean_token_accuracy": 0.21509525775909424, "num_tokens": 98783532.0, "step": 56950 }, { "entropy": 5.975806999206543, "epoch": 4.431277961486092, "grad_norm": 1.328125, "learning_rate": 0.00031800336287795395, "loss": 5.0368, "mean_token_accuracy": 0.20736061930656433, "num_tokens": 98792062.0, "step": 56955 }, { "entropy": 5.860547161102295, "epoch": 4.43166699085781, "grad_norm": 1.3828125, "learning_rate": 0.00031797615788714133, "loss": 4.8754, "mean_token_accuracy": 0.21118629723787308, "num_tokens": 98800558.0, "step": 56960 }, { "entropy": 5.884994125366211, "epoch": 4.432056020229528, "grad_norm": 1.328125, "learning_rate": 0.00031794895224423396, "loss": 4.873, "mean_token_accuracy": 0.22376664727926254, "num_tokens": 98808612.0, "step": 56965 }, { "entropy": 5.9277924537658695, "epoch": 4.432445049601245, "grad_norm": 1.390625, "learning_rate": 0.0003179217459496446, "loss": 4.9079, "mean_token_accuracy": 0.22111464589834212, "num_tokens": 98817077.0, "step": 56970 }, { "entropy": 5.839706897735596, "epoch": 4.432834078972962, "grad_norm": 1.421875, "learning_rate": 0.000317894539003786, "loss": 4.8691, "mean_token_accuracy": 0.22283138632774352, "num_tokens": 98825506.0, "step": 56975 }, { "entropy": 5.872729969024658, "epoch": 4.43322310834468, "grad_norm": 1.421875, "learning_rate": 0.000317867331407071, "loss": 4.9182, "mean_token_accuracy": 0.21669227927923201, "num_tokens": 98834112.0, "step": 56980 }, { "entropy": 5.965631628036499, "epoch": 4.4336121377163975, "grad_norm": 1.3515625, "learning_rate": 0.0003178401231599126, "loss": 4.9379, "mean_token_accuracy": 0.21779697835445405, "num_tokens": 98843933.0, "step": 56985 }, { "entropy": 5.82295789718628, "epoch": 4.434001167088115, "grad_norm": 1.3984375, "learning_rate": 0.00031781291426272347, "loss": 4.8536, "mean_token_accuracy": 0.21710425466299058, "num_tokens": 98852646.0, "step": 56990 }, { "entropy": 5.904745721817017, "epoch": 4.434390196459833, "grad_norm": 1.4296875, "learning_rate": 0.0003177857047159165, "loss": 4.8556, "mean_token_accuracy": 0.23176491558551787, "num_tokens": 98860819.0, "step": 56995 }, { "entropy": 5.949557113647461, "epoch": 4.434779225831551, "grad_norm": 1.5, "learning_rate": 0.0003177584945199046, "loss": 5.0078, "mean_token_accuracy": 0.220664881169796, "num_tokens": 98869000.0, "step": 57000 }, { "epoch": 4.434779225831551, "eval_entropy": 5.618273828486276, "eval_loss": 5.064419746398926, "eval_mean_token_accuracy": 0.2197029515900098, "eval_num_tokens": 98869000.0, "eval_runtime": 21.6322, "eval_samples_per_second": 1921.116, "eval_steps_per_second": 240.151, "step": 57000 }, { "entropy": 5.905194711685181, "epoch": 4.435168255203267, "grad_norm": 1.515625, "learning_rate": 0.0003177312836751005, "loss": 4.8771, "mean_token_accuracy": 0.22685130983591079, "num_tokens": 98877174.0, "step": 57005 }, { "entropy": 5.896127843856812, "epoch": 4.435557284574985, "grad_norm": 1.453125, "learning_rate": 0.00031770407218191727, "loss": 4.9396, "mean_token_accuracy": 0.21606757640838622, "num_tokens": 98885934.0, "step": 57010 }, { "entropy": 5.87311053276062, "epoch": 4.435946313946703, "grad_norm": 1.4296875, "learning_rate": 0.0003176768600407677, "loss": 4.932, "mean_token_accuracy": 0.21097803711891175, "num_tokens": 98894824.0, "step": 57015 }, { "entropy": 5.970147895812988, "epoch": 4.4363353433184205, "grad_norm": 1.46875, "learning_rate": 0.0003176496472520647, "loss": 4.9049, "mean_token_accuracy": 0.2207731530070305, "num_tokens": 98903173.0, "step": 57020 }, { "entropy": 5.927363061904908, "epoch": 4.436724372690138, "grad_norm": 1.3828125, "learning_rate": 0.0003176224338162212, "loss": 4.9602, "mean_token_accuracy": 0.2160036563873291, "num_tokens": 98912730.0, "step": 57025 }, { "entropy": 5.933333253860473, "epoch": 4.437113402061856, "grad_norm": 1.3359375, "learning_rate": 0.00031759521973365006, "loss": 5.0698, "mean_token_accuracy": 0.20470034182071686, "num_tokens": 98922182.0, "step": 57030 }, { "entropy": 5.9016188621521, "epoch": 4.437502431433574, "grad_norm": 1.3828125, "learning_rate": 0.00031756800500476435, "loss": 4.8616, "mean_token_accuracy": 0.22405731528997422, "num_tokens": 98930243.0, "step": 57035 }, { "entropy": 5.958464908599853, "epoch": 4.43789146080529, "grad_norm": 1.4296875, "learning_rate": 0.00031754078962997686, "loss": 4.9684, "mean_token_accuracy": 0.21757351905107497, "num_tokens": 98938281.0, "step": 57040 }, { "entropy": 5.875172567367554, "epoch": 4.438280490177008, "grad_norm": 1.4140625, "learning_rate": 0.0003175135736097006, "loss": 4.9154, "mean_token_accuracy": 0.21191619336605072, "num_tokens": 98946960.0, "step": 57045 }, { "entropy": 5.932411098480225, "epoch": 4.438669519548726, "grad_norm": 1.4375, "learning_rate": 0.00031748635694434844, "loss": 4.8835, "mean_token_accuracy": 0.2192670226097107, "num_tokens": 98955322.0, "step": 57050 }, { "entropy": 5.945613670349121, "epoch": 4.4390585489204435, "grad_norm": 1.28125, "learning_rate": 0.0003174591396343336, "loss": 5.0225, "mean_token_accuracy": 0.2130824714899063, "num_tokens": 98964517.0, "step": 57055 }, { "entropy": 5.975570154190064, "epoch": 4.439447578292161, "grad_norm": 1.3984375, "learning_rate": 0.0003174319216800688, "loss": 4.9784, "mean_token_accuracy": 0.21378668248653412, "num_tokens": 98973728.0, "step": 57060 }, { "entropy": 5.874374675750732, "epoch": 4.439836607663879, "grad_norm": 1.546875, "learning_rate": 0.00031740470308196724, "loss": 4.9535, "mean_token_accuracy": 0.2149740934371948, "num_tokens": 98981799.0, "step": 57065 }, { "entropy": 6.001570415496826, "epoch": 4.440225637035597, "grad_norm": 1.4609375, "learning_rate": 0.0003173774838404417, "loss": 4.9692, "mean_token_accuracy": 0.21336007118225098, "num_tokens": 98990929.0, "step": 57070 }, { "entropy": 5.973786735534668, "epoch": 4.440614666407313, "grad_norm": 1.4453125, "learning_rate": 0.00031735026395590535, "loss": 4.8956, "mean_token_accuracy": 0.22144406884908677, "num_tokens": 98998676.0, "step": 57075 }, { "entropy": 5.894015121459961, "epoch": 4.441003695779031, "grad_norm": 1.3359375, "learning_rate": 0.000317323043428771, "loss": 4.8994, "mean_token_accuracy": 0.21539787352085113, "num_tokens": 99007557.0, "step": 57080 }, { "entropy": 5.914684152603149, "epoch": 4.441392725150749, "grad_norm": 1.4140625, "learning_rate": 0.0003172958222594519, "loss": 5.0115, "mean_token_accuracy": 0.21123959571123124, "num_tokens": 99016274.0, "step": 57085 }, { "entropy": 5.9649683952331545, "epoch": 4.4417817545224665, "grad_norm": 1.484375, "learning_rate": 0.0003172686004483611, "loss": 4.9287, "mean_token_accuracy": 0.21677168607711791, "num_tokens": 99024307.0, "step": 57090 }, { "entropy": 5.994546937942505, "epoch": 4.442170783894184, "grad_norm": 1.3984375, "learning_rate": 0.00031724137799591154, "loss": 5.067, "mean_token_accuracy": 0.20798503160476683, "num_tokens": 99033295.0, "step": 57095 }, { "entropy": 5.979236268997193, "epoch": 4.442559813265902, "grad_norm": 1.46875, "learning_rate": 0.00031721415490251634, "loss": 4.995, "mean_token_accuracy": 0.2075594261288643, "num_tokens": 99042028.0, "step": 57100 }, { "entropy": 5.925299263000488, "epoch": 4.44294884263762, "grad_norm": 1.375, "learning_rate": 0.0003171869311685885, "loss": 4.9342, "mean_token_accuracy": 0.21608500480651854, "num_tokens": 99050915.0, "step": 57105 }, { "entropy": 5.978424787521362, "epoch": 4.443337872009336, "grad_norm": 1.46875, "learning_rate": 0.0003171597067945411, "loss": 4.9417, "mean_token_accuracy": 0.21003836244344712, "num_tokens": 99059474.0, "step": 57110 }, { "entropy": 5.867600440979004, "epoch": 4.443726901381054, "grad_norm": 1.390625, "learning_rate": 0.00031713248178078717, "loss": 4.8383, "mean_token_accuracy": 0.22539416700601578, "num_tokens": 99068068.0, "step": 57115 }, { "entropy": 5.934176874160767, "epoch": 4.444115930752772, "grad_norm": 1.328125, "learning_rate": 0.00031710525612774, "loss": 5.0635, "mean_token_accuracy": 0.20957596600055695, "num_tokens": 99077158.0, "step": 57120 }, { "entropy": 5.936445856094361, "epoch": 4.4445049601244895, "grad_norm": 1.40625, "learning_rate": 0.0003170780298358126, "loss": 4.9519, "mean_token_accuracy": 0.21439535766839982, "num_tokens": 99085270.0, "step": 57125 }, { "entropy": 5.980767869949341, "epoch": 4.444893989496207, "grad_norm": 1.296875, "learning_rate": 0.00031705080290541797, "loss": 4.9804, "mean_token_accuracy": 0.2070990025997162, "num_tokens": 99094420.0, "step": 57130 }, { "entropy": 5.921824169158936, "epoch": 4.445283018867925, "grad_norm": 1.4296875, "learning_rate": 0.00031702357533696946, "loss": 4.9331, "mean_token_accuracy": 0.22231628000736237, "num_tokens": 99103399.0, "step": 57135 }, { "entropy": 5.825370931625367, "epoch": 4.445672048239642, "grad_norm": 1.421875, "learning_rate": 0.00031699634713088, "loss": 4.7973, "mean_token_accuracy": 0.22457805275917053, "num_tokens": 99112417.0, "step": 57140 }, { "entropy": 5.909503602981568, "epoch": 4.446061077611359, "grad_norm": 1.40625, "learning_rate": 0.0003169691182875628, "loss": 4.9323, "mean_token_accuracy": 0.21884176433086394, "num_tokens": 99120823.0, "step": 57145 }, { "entropy": 5.9147392272949215, "epoch": 4.446450106983077, "grad_norm": 1.4453125, "learning_rate": 0.0003169418888074311, "loss": 4.9204, "mean_token_accuracy": 0.2151761993765831, "num_tokens": 99129154.0, "step": 57150 }, { "entropy": 5.953570604324341, "epoch": 4.446839136354795, "grad_norm": 1.453125, "learning_rate": 0.00031691465869089795, "loss": 4.9669, "mean_token_accuracy": 0.21604932248592376, "num_tokens": 99137294.0, "step": 57155 }, { "entropy": 5.945612049102783, "epoch": 4.4472281657265125, "grad_norm": 1.484375, "learning_rate": 0.0003168874279383766, "loss": 5.0579, "mean_token_accuracy": 0.20919550210237503, "num_tokens": 99146219.0, "step": 57160 }, { "entropy": 5.935383558273315, "epoch": 4.44761719509823, "grad_norm": 1.3828125, "learning_rate": 0.0003168601965502802, "loss": 4.9913, "mean_token_accuracy": 0.2080627426505089, "num_tokens": 99154656.0, "step": 57165 }, { "entropy": 5.9690492153167725, "epoch": 4.448006224469948, "grad_norm": 1.3671875, "learning_rate": 0.0003168329645270219, "loss": 4.9603, "mean_token_accuracy": 0.21847521811723708, "num_tokens": 99163384.0, "step": 57170 }, { "entropy": 5.894696760177612, "epoch": 4.448395253841665, "grad_norm": 1.453125, "learning_rate": 0.000316805731869015, "loss": 4.9045, "mean_token_accuracy": 0.21736711114645005, "num_tokens": 99172237.0, "step": 57175 }, { "entropy": 5.9461627960205075, "epoch": 4.448784283213382, "grad_norm": 1.3671875, "learning_rate": 0.00031677849857667266, "loss": 5.0726, "mean_token_accuracy": 0.21444928795099258, "num_tokens": 99181418.0, "step": 57180 }, { "entropy": 5.954098224639893, "epoch": 4.4491733125851, "grad_norm": 1.46875, "learning_rate": 0.0003167512646504081, "loss": 4.9624, "mean_token_accuracy": 0.21858360916376113, "num_tokens": 99190683.0, "step": 57185 }, { "entropy": 5.88373703956604, "epoch": 4.449562341956818, "grad_norm": 1.546875, "learning_rate": 0.0003167240300906345, "loss": 4.8663, "mean_token_accuracy": 0.2321986198425293, "num_tokens": 99199284.0, "step": 57190 }, { "entropy": 5.9756935119628904, "epoch": 4.4499513713285355, "grad_norm": 1.3984375, "learning_rate": 0.0003166967948977652, "loss": 5.1388, "mean_token_accuracy": 0.20770090222358703, "num_tokens": 99207616.0, "step": 57195 }, { "entropy": 5.93669958114624, "epoch": 4.450340400700253, "grad_norm": 1.3671875, "learning_rate": 0.0003166695590722134, "loss": 4.9407, "mean_token_accuracy": 0.21762867122888566, "num_tokens": 99216329.0, "step": 57200 }, { "entropy": 5.973982906341552, "epoch": 4.45072943007197, "grad_norm": 1.40625, "learning_rate": 0.00031664232261439235, "loss": 4.9913, "mean_token_accuracy": 0.21524061560630797, "num_tokens": 99225161.0, "step": 57205 }, { "entropy": 5.9675816059112545, "epoch": 4.451118459443688, "grad_norm": 1.46875, "learning_rate": 0.0003166150855247153, "loss": 5.008, "mean_token_accuracy": 0.20122611075639724, "num_tokens": 99234205.0, "step": 57210 }, { "entropy": 5.886396360397339, "epoch": 4.451507488815405, "grad_norm": 1.4453125, "learning_rate": 0.0003165878478035956, "loss": 4.94, "mean_token_accuracy": 0.22127435952425004, "num_tokens": 99243533.0, "step": 57215 }, { "entropy": 5.983232688903809, "epoch": 4.451896518187123, "grad_norm": 1.46875, "learning_rate": 0.0003165606094514465, "loss": 4.9891, "mean_token_accuracy": 0.21591623723506928, "num_tokens": 99252563.0, "step": 57220 }, { "entropy": 5.925714063644409, "epoch": 4.452285547558841, "grad_norm": 1.5390625, "learning_rate": 0.00031653337046868137, "loss": 4.9532, "mean_token_accuracy": 0.21331370919942855, "num_tokens": 99260845.0, "step": 57225 }, { "entropy": 5.929655313491821, "epoch": 4.4526745769305585, "grad_norm": 1.4765625, "learning_rate": 0.00031650613085571334, "loss": 4.8673, "mean_token_accuracy": 0.22461340129375457, "num_tokens": 99269309.0, "step": 57230 }, { "entropy": 5.88968186378479, "epoch": 4.453063606302276, "grad_norm": 1.375, "learning_rate": 0.0003164788906129559, "loss": 4.9758, "mean_token_accuracy": 0.21726243197917938, "num_tokens": 99277659.0, "step": 57235 }, { "entropy": 5.906838607788086, "epoch": 4.453452635673994, "grad_norm": 1.3125, "learning_rate": 0.0003164516497408223, "loss": 5.0225, "mean_token_accuracy": 0.2136093035340309, "num_tokens": 99286422.0, "step": 57240 }, { "entropy": 6.032088804244995, "epoch": 4.453841665045711, "grad_norm": 1.5390625, "learning_rate": 0.0003164244082397259, "loss": 5.0318, "mean_token_accuracy": 0.21278442740440368, "num_tokens": 99295140.0, "step": 57245 }, { "entropy": 5.963583087921142, "epoch": 4.454230694417428, "grad_norm": 1.5234375, "learning_rate": 0.00031639716611008, "loss": 5.0092, "mean_token_accuracy": 0.2104533240199089, "num_tokens": 99304180.0, "step": 57250 }, { "entropy": 5.928808879852295, "epoch": 4.454619723789146, "grad_norm": 1.4921875, "learning_rate": 0.0003163699233522981, "loss": 4.9754, "mean_token_accuracy": 0.2114589810371399, "num_tokens": 99312765.0, "step": 57255 }, { "entropy": 5.912766981124878, "epoch": 4.455008753160864, "grad_norm": 1.46875, "learning_rate": 0.0003163426799667934, "loss": 4.9648, "mean_token_accuracy": 0.21090328693389893, "num_tokens": 99321530.0, "step": 57260 }, { "entropy": 5.91319842338562, "epoch": 4.4553977825325815, "grad_norm": 1.453125, "learning_rate": 0.0003163154359539793, "loss": 4.9833, "mean_token_accuracy": 0.20515942573547363, "num_tokens": 99329868.0, "step": 57265 }, { "entropy": 5.998158311843872, "epoch": 4.455786811904299, "grad_norm": 1.40625, "learning_rate": 0.00031628819131426924, "loss": 4.9929, "mean_token_accuracy": 0.20849019587039946, "num_tokens": 99338780.0, "step": 57270 }, { "entropy": 5.943441390991211, "epoch": 4.456175841276016, "grad_norm": 1.296875, "learning_rate": 0.0003162609460480766, "loss": 4.913, "mean_token_accuracy": 0.21866649240255356, "num_tokens": 99348159.0, "step": 57275 }, { "entropy": 5.953143072128296, "epoch": 4.456564870647734, "grad_norm": 1.5234375, "learning_rate": 0.0003162337001558147, "loss": 4.9126, "mean_token_accuracy": 0.2165081098675728, "num_tokens": 99356136.0, "step": 57280 }, { "entropy": 5.995149993896485, "epoch": 4.456953900019451, "grad_norm": 1.3671875, "learning_rate": 0.00031620645363789713, "loss": 5.0375, "mean_token_accuracy": 0.20943720787763595, "num_tokens": 99364537.0, "step": 57285 }, { "entropy": 5.913239288330078, "epoch": 4.457342929391169, "grad_norm": 1.3828125, "learning_rate": 0.0003161792064947372, "loss": 4.8932, "mean_token_accuracy": 0.2224335864186287, "num_tokens": 99374263.0, "step": 57290 }, { "entropy": 5.969743251800537, "epoch": 4.457731958762887, "grad_norm": 1.34375, "learning_rate": 0.00031615195872674836, "loss": 5.037, "mean_token_accuracy": 0.21639725118875502, "num_tokens": 99382534.0, "step": 57295 }, { "entropy": 5.897247552871704, "epoch": 4.4581209881346044, "grad_norm": 1.4296875, "learning_rate": 0.00031612471033434406, "loss": 4.9035, "mean_token_accuracy": 0.2133727878332138, "num_tokens": 99390665.0, "step": 57300 }, { "entropy": 5.924976348876953, "epoch": 4.458510017506322, "grad_norm": 1.421875, "learning_rate": 0.0003160974613179377, "loss": 4.9048, "mean_token_accuracy": 0.21887648850679398, "num_tokens": 99399700.0, "step": 57305 }, { "entropy": 6.004235458374024, "epoch": 4.458899046878039, "grad_norm": 1.46875, "learning_rate": 0.0003160702116779428, "loss": 4.9828, "mean_token_accuracy": 0.20929044932127, "num_tokens": 99407505.0, "step": 57310 }, { "entropy": 5.9128087043762205, "epoch": 4.459288076249757, "grad_norm": 1.390625, "learning_rate": 0.0003160429614147727, "loss": 4.9033, "mean_token_accuracy": 0.22038080394268036, "num_tokens": 99416454.0, "step": 57315 }, { "entropy": 5.882433223724365, "epoch": 4.459677105621474, "grad_norm": 1.5625, "learning_rate": 0.00031601571052884117, "loss": 4.9388, "mean_token_accuracy": 0.22060583531856537, "num_tokens": 99425134.0, "step": 57320 }, { "entropy": 5.918792247772217, "epoch": 4.460066134993192, "grad_norm": 1.515625, "learning_rate": 0.0003159884590205613, "loss": 4.9429, "mean_token_accuracy": 0.21820741444826125, "num_tokens": 99433061.0, "step": 57325 }, { "entropy": 5.997221755981445, "epoch": 4.46045516436491, "grad_norm": 1.4921875, "learning_rate": 0.000315961206890347, "loss": 4.9871, "mean_token_accuracy": 0.22209499627351761, "num_tokens": 99441814.0, "step": 57330 }, { "entropy": 5.988689422607422, "epoch": 4.460844193736627, "grad_norm": 1.4296875, "learning_rate": 0.0003159339541386115, "loss": 5.0239, "mean_token_accuracy": 0.21653041243553162, "num_tokens": 99450430.0, "step": 57335 }, { "entropy": 5.963972568511963, "epoch": 4.461233223108344, "grad_norm": 1.453125, "learning_rate": 0.00031590670076576846, "loss": 5.0294, "mean_token_accuracy": 0.21142186969518661, "num_tokens": 99459408.0, "step": 57340 }, { "entropy": 5.95520396232605, "epoch": 4.461622252480062, "grad_norm": 1.5, "learning_rate": 0.00031587944677223133, "loss": 4.9078, "mean_token_accuracy": 0.2208254024386406, "num_tokens": 99468014.0, "step": 57345 }, { "entropy": 5.9869224548339846, "epoch": 4.46201128185178, "grad_norm": 1.4375, "learning_rate": 0.0003158521921584136, "loss": 4.9875, "mean_token_accuracy": 0.22130175232887267, "num_tokens": 99476245.0, "step": 57350 }, { "entropy": 5.959428834915161, "epoch": 4.462400311223497, "grad_norm": 1.5390625, "learning_rate": 0.00031582493692472886, "loss": 4.9144, "mean_token_accuracy": 0.2221628397703171, "num_tokens": 99484390.0, "step": 57355 }, { "entropy": 5.852032423019409, "epoch": 4.462789340595215, "grad_norm": 1.3984375, "learning_rate": 0.0003157976810715907, "loss": 4.8921, "mean_token_accuracy": 0.2217566654086113, "num_tokens": 99492885.0, "step": 57360 }, { "entropy": 5.941972541809082, "epoch": 4.463178369966933, "grad_norm": 1.4140625, "learning_rate": 0.00031577042459941275, "loss": 4.9897, "mean_token_accuracy": 0.21386562734842302, "num_tokens": 99501669.0, "step": 57365 }, { "entropy": 5.945519256591797, "epoch": 4.46356739933865, "grad_norm": 1.4140625, "learning_rate": 0.00031574316750860844, "loss": 4.9343, "mean_token_accuracy": 0.2168682858347893, "num_tokens": 99509992.0, "step": 57370 }, { "entropy": 5.948888826370239, "epoch": 4.463956428710367, "grad_norm": 1.4609375, "learning_rate": 0.0003157159097995914, "loss": 4.9975, "mean_token_accuracy": 0.21237008571624755, "num_tokens": 99518867.0, "step": 57375 }, { "entropy": 5.909712076187134, "epoch": 4.464345458082085, "grad_norm": 1.3515625, "learning_rate": 0.00031568865147277525, "loss": 4.9665, "mean_token_accuracy": 0.21459220051765443, "num_tokens": 99528070.0, "step": 57380 }, { "entropy": 5.903021335601807, "epoch": 4.464734487453803, "grad_norm": 1.3984375, "learning_rate": 0.00031566139252857357, "loss": 4.9173, "mean_token_accuracy": 0.2213527098298073, "num_tokens": 99536386.0, "step": 57385 }, { "entropy": 5.887178659439087, "epoch": 4.46512351682552, "grad_norm": 1.4296875, "learning_rate": 0.0003156341329674, "loss": 4.8943, "mean_token_accuracy": 0.2162710890173912, "num_tokens": 99544519.0, "step": 57390 }, { "entropy": 5.921792507171631, "epoch": 4.465512546197238, "grad_norm": 1.4609375, "learning_rate": 0.0003156068727896681, "loss": 5.006, "mean_token_accuracy": 0.21417365372180938, "num_tokens": 99553332.0, "step": 57395 }, { "entropy": 5.9782267093658445, "epoch": 4.465901575568956, "grad_norm": 1.3984375, "learning_rate": 0.0003155796119957915, "loss": 5.0279, "mean_token_accuracy": 0.2073320358991623, "num_tokens": 99561423.0, "step": 57400 }, { "entropy": 5.934919786453247, "epoch": 4.466290604940673, "grad_norm": 1.4375, "learning_rate": 0.00031555235058618403, "loss": 4.923, "mean_token_accuracy": 0.21565380543470383, "num_tokens": 99570008.0, "step": 57405 }, { "entropy": 5.941976022720337, "epoch": 4.46667963431239, "grad_norm": 1.4765625, "learning_rate": 0.00031552508856125906, "loss": 5.0435, "mean_token_accuracy": 0.2091601863503456, "num_tokens": 99579351.0, "step": 57410 }, { "entropy": 6.035035800933838, "epoch": 4.467068663684108, "grad_norm": 1.2578125, "learning_rate": 0.0003154978259214304, "loss": 5.085, "mean_token_accuracy": 0.19620254635810852, "num_tokens": 99588431.0, "step": 57415 }, { "entropy": 6.02313003540039, "epoch": 4.467457693055826, "grad_norm": 1.515625, "learning_rate": 0.00031547056266711173, "loss": 5.0021, "mean_token_accuracy": 0.2127077177166939, "num_tokens": 99596982.0, "step": 57420 }, { "entropy": 5.94403338432312, "epoch": 4.467846722427543, "grad_norm": 1.3984375, "learning_rate": 0.0003154432987987166, "loss": 5.0183, "mean_token_accuracy": 0.21316463649272918, "num_tokens": 99606315.0, "step": 57425 }, { "entropy": 5.988648700714111, "epoch": 4.468235751799261, "grad_norm": 1.5, "learning_rate": 0.0003154160343166589, "loss": 5.02, "mean_token_accuracy": 0.20944138765335082, "num_tokens": 99614617.0, "step": 57430 }, { "entropy": 6.008930635452271, "epoch": 4.468624781170979, "grad_norm": 1.4609375, "learning_rate": 0.00031538876922135214, "loss": 5.0384, "mean_token_accuracy": 0.2118157386779785, "num_tokens": 99623369.0, "step": 57435 }, { "entropy": 5.9637336254119875, "epoch": 4.469013810542696, "grad_norm": 1.5078125, "learning_rate": 0.0003153615035132101, "loss": 4.9671, "mean_token_accuracy": 0.21535481810569762, "num_tokens": 99632859.0, "step": 57440 }, { "entropy": 5.878107261657715, "epoch": 4.469402839914413, "grad_norm": 1.3828125, "learning_rate": 0.00031533423719264645, "loss": 4.8325, "mean_token_accuracy": 0.23468345999717713, "num_tokens": 99641809.0, "step": 57445 }, { "entropy": 5.954575872421264, "epoch": 4.469791869286131, "grad_norm": 1.5234375, "learning_rate": 0.000315306970260075, "loss": 4.9698, "mean_token_accuracy": 0.2241729184985161, "num_tokens": 99649335.0, "step": 57450 }, { "entropy": 5.902673864364624, "epoch": 4.470180898657849, "grad_norm": 1.3984375, "learning_rate": 0.0003152797027159094, "loss": 4.9469, "mean_token_accuracy": 0.21339701861143112, "num_tokens": 99657961.0, "step": 57455 }, { "entropy": 5.903442430496216, "epoch": 4.470569928029566, "grad_norm": 1.3359375, "learning_rate": 0.00031525243456056345, "loss": 4.9231, "mean_token_accuracy": 0.22357354313135147, "num_tokens": 99667148.0, "step": 57460 }, { "entropy": 5.905039548873901, "epoch": 4.470958957401284, "grad_norm": 1.515625, "learning_rate": 0.0003152251657944509, "loss": 4.9257, "mean_token_accuracy": 0.22159579694271087, "num_tokens": 99675110.0, "step": 57465 }, { "entropy": 5.896014785766601, "epoch": 4.471347986773002, "grad_norm": 1.515625, "learning_rate": 0.0003151978964179854, "loss": 4.9484, "mean_token_accuracy": 0.219231516122818, "num_tokens": 99683173.0, "step": 57470 }, { "entropy": 5.9502325534820555, "epoch": 4.4717370161447185, "grad_norm": 1.4140625, "learning_rate": 0.00031517062643158085, "loss": 4.9945, "mean_token_accuracy": 0.21580644249916076, "num_tokens": 99691773.0, "step": 57475 }, { "entropy": 5.9457601547241214, "epoch": 4.472126045516436, "grad_norm": 1.46875, "learning_rate": 0.00031514335583565097, "loss": 4.9412, "mean_token_accuracy": 0.2129787191748619, "num_tokens": 99699414.0, "step": 57480 }, { "entropy": 5.948827505111694, "epoch": 4.472515074888154, "grad_norm": 1.34375, "learning_rate": 0.00031511608463060954, "loss": 4.9711, "mean_token_accuracy": 0.21007128208875656, "num_tokens": 99708343.0, "step": 57485 }, { "entropy": 5.959079456329346, "epoch": 4.472904104259872, "grad_norm": 1.515625, "learning_rate": 0.00031508881281687044, "loss": 5.0116, "mean_token_accuracy": 0.21384498924016954, "num_tokens": 99716393.0, "step": 57490 }, { "entropy": 5.821180582046509, "epoch": 4.473293133631589, "grad_norm": 1.4296875, "learning_rate": 0.00031506154039484736, "loss": 4.8045, "mean_token_accuracy": 0.22567864656448364, "num_tokens": 99724741.0, "step": 57495 }, { "entropy": 5.919459819793701, "epoch": 4.473682163003307, "grad_norm": 1.375, "learning_rate": 0.00031503426736495424, "loss": 4.9739, "mean_token_accuracy": 0.21527534276247023, "num_tokens": 99733429.0, "step": 57500 }, { "entropy": 5.95928840637207, "epoch": 4.474071192375025, "grad_norm": 1.453125, "learning_rate": 0.00031500699372760476, "loss": 5.0005, "mean_token_accuracy": 0.20812428295612334, "num_tokens": 99742027.0, "step": 57505 }, { "entropy": 5.9797920227050785, "epoch": 4.4744602217467415, "grad_norm": 1.5, "learning_rate": 0.00031497971948321287, "loss": 4.9858, "mean_token_accuracy": 0.2149359717965126, "num_tokens": 99751375.0, "step": 57510 }, { "entropy": 5.948651266098023, "epoch": 4.474849251118459, "grad_norm": 1.3125, "learning_rate": 0.0003149524446321923, "loss": 4.9375, "mean_token_accuracy": 0.21439621597528458, "num_tokens": 99759980.0, "step": 57515 }, { "entropy": 5.938612794876098, "epoch": 4.475238280490177, "grad_norm": 1.453125, "learning_rate": 0.000314925169174957, "loss": 4.9548, "mean_token_accuracy": 0.21585564464330673, "num_tokens": 99768570.0, "step": 57520 }, { "entropy": 5.962278413772583, "epoch": 4.475627309861895, "grad_norm": 1.4296875, "learning_rate": 0.00031489789311192086, "loss": 5.0441, "mean_token_accuracy": 0.20781535059213638, "num_tokens": 99777843.0, "step": 57525 }, { "entropy": 5.953825759887695, "epoch": 4.476016339233612, "grad_norm": 1.3515625, "learning_rate": 0.0003148706164434977, "loss": 4.9276, "mean_token_accuracy": 0.21425359696149826, "num_tokens": 99786873.0, "step": 57530 }, { "entropy": 5.956406593322754, "epoch": 4.47640536860533, "grad_norm": 1.359375, "learning_rate": 0.0003148433391701014, "loss": 4.9765, "mean_token_accuracy": 0.21408039331436157, "num_tokens": 99795854.0, "step": 57535 }, { "entropy": 5.943245077133179, "epoch": 4.476794397977047, "grad_norm": 1.3125, "learning_rate": 0.0003148160612921457, "loss": 4.9487, "mean_token_accuracy": 0.20961966812610627, "num_tokens": 99804927.0, "step": 57540 }, { "entropy": 6.021684980392456, "epoch": 4.4771834273487645, "grad_norm": 1.5625, "learning_rate": 0.00031478878281004474, "loss": 5.0714, "mean_token_accuracy": 0.21096121072769164, "num_tokens": 99812859.0, "step": 57545 }, { "entropy": 5.922207355499268, "epoch": 4.477572456720482, "grad_norm": 1.5234375, "learning_rate": 0.00031476150372421234, "loss": 4.9428, "mean_token_accuracy": 0.21480560451745986, "num_tokens": 99821540.0, "step": 57550 }, { "entropy": 5.903932189941406, "epoch": 4.4779614860922, "grad_norm": 1.4140625, "learning_rate": 0.0003147342240350625, "loss": 4.9034, "mean_token_accuracy": 0.22199461460113526, "num_tokens": 99830399.0, "step": 57555 }, { "entropy": 5.883170127868652, "epoch": 4.478350515463918, "grad_norm": 1.4609375, "learning_rate": 0.0003147069437430089, "loss": 4.9236, "mean_token_accuracy": 0.21566027253866196, "num_tokens": 99839936.0, "step": 57560 }, { "entropy": 5.925524091720581, "epoch": 4.478739544835635, "grad_norm": 1.375, "learning_rate": 0.00031467966284846573, "loss": 4.9969, "mean_token_accuracy": 0.21042490452528, "num_tokens": 99848760.0, "step": 57565 }, { "entropy": 6.052072048187256, "epoch": 4.479128574207353, "grad_norm": 1.5703125, "learning_rate": 0.0003146523813518468, "loss": 5.0365, "mean_token_accuracy": 0.20962952971458435, "num_tokens": 99856639.0, "step": 57570 }, { "entropy": 5.923245096206665, "epoch": 4.47951760357907, "grad_norm": 1.421875, "learning_rate": 0.00031462509925356616, "loss": 4.891, "mean_token_accuracy": 0.22599357217550278, "num_tokens": 99865213.0, "step": 57575 }, { "entropy": 5.859971141815185, "epoch": 4.4799066329507875, "grad_norm": 1.546875, "learning_rate": 0.00031459781655403756, "loss": 4.8874, "mean_token_accuracy": 0.2259276643395424, "num_tokens": 99873763.0, "step": 57580 }, { "entropy": 5.972398042678833, "epoch": 4.480295662322505, "grad_norm": 1.4140625, "learning_rate": 0.0003145705332536752, "loss": 5.0022, "mean_token_accuracy": 0.21115858405828475, "num_tokens": 99881786.0, "step": 57585 }, { "entropy": 5.950938367843628, "epoch": 4.480684691694223, "grad_norm": 1.515625, "learning_rate": 0.000314543249352893, "loss": 4.985, "mean_token_accuracy": 0.2106778532266617, "num_tokens": 99890224.0, "step": 57590 }, { "entropy": 5.891128444671631, "epoch": 4.481073721065941, "grad_norm": 1.5, "learning_rate": 0.00031451596485210486, "loss": 4.8383, "mean_token_accuracy": 0.21807336211204528, "num_tokens": 99898523.0, "step": 57595 }, { "entropy": 5.8926342010498045, "epoch": 4.481462750437658, "grad_norm": 1.4296875, "learning_rate": 0.00031448867975172493, "loss": 4.9129, "mean_token_accuracy": 0.2168262019753456, "num_tokens": 99906920.0, "step": 57600 }, { "entropy": 6.026831817626953, "epoch": 4.481851779809376, "grad_norm": 1.453125, "learning_rate": 0.00031446139405216713, "loss": 5.0268, "mean_token_accuracy": 0.2158502906560898, "num_tokens": 99915813.0, "step": 57605 }, { "entropy": 5.899924325942993, "epoch": 4.482240809181093, "grad_norm": 1.4140625, "learning_rate": 0.0003144341077538455, "loss": 4.9103, "mean_token_accuracy": 0.21995767205953598, "num_tokens": 99924912.0, "step": 57610 }, { "entropy": 5.943276834487915, "epoch": 4.4826298385528105, "grad_norm": 1.4140625, "learning_rate": 0.000314406820857174, "loss": 4.9738, "mean_token_accuracy": 0.218840192258358, "num_tokens": 99933107.0, "step": 57615 }, { "entropy": 5.868537378311157, "epoch": 4.483018867924528, "grad_norm": 1.3046875, "learning_rate": 0.00031437953336256667, "loss": 4.8777, "mean_token_accuracy": 0.230436509847641, "num_tokens": 99942205.0, "step": 57620 }, { "entropy": 5.928694581985473, "epoch": 4.483407897296246, "grad_norm": 1.3515625, "learning_rate": 0.0003143522452704377, "loss": 4.9621, "mean_token_accuracy": 0.21687428206205367, "num_tokens": 99950807.0, "step": 57625 }, { "entropy": 5.878244352340698, "epoch": 4.483796926667964, "grad_norm": 1.4375, "learning_rate": 0.000314324956581201, "loss": 4.9764, "mean_token_accuracy": 0.21714761704206467, "num_tokens": 99960030.0, "step": 57630 }, { "entropy": 5.966232776641846, "epoch": 4.484185956039681, "grad_norm": 1.3984375, "learning_rate": 0.0003142976672952707, "loss": 5.0538, "mean_token_accuracy": 0.20714084059000015, "num_tokens": 99969607.0, "step": 57635 }, { "entropy": 5.966753673553467, "epoch": 4.484574985411399, "grad_norm": 1.359375, "learning_rate": 0.00031427037741306083, "loss": 4.9619, "mean_token_accuracy": 0.21584053039550782, "num_tokens": 99978453.0, "step": 57640 }, { "entropy": 5.9479176044464115, "epoch": 4.484964014783116, "grad_norm": 1.375, "learning_rate": 0.0003142430869349855, "loss": 4.9296, "mean_token_accuracy": 0.22080231606960296, "num_tokens": 99987150.0, "step": 57645 }, { "entropy": 5.87459659576416, "epoch": 4.4853530441548335, "grad_norm": 1.328125, "learning_rate": 0.0003142157958614588, "loss": 4.8868, "mean_token_accuracy": 0.21633867919445038, "num_tokens": 99996437.0, "step": 57650 }, { "entropy": 5.888665676116943, "epoch": 4.485742073526551, "grad_norm": 1.4296875, "learning_rate": 0.0003141885041928948, "loss": 4.8656, "mean_token_accuracy": 0.22074079215526582, "num_tokens": 100005159.0, "step": 57655 }, { "entropy": 5.955147457122803, "epoch": 4.486131102898269, "grad_norm": 1.421875, "learning_rate": 0.00031416121192970754, "loss": 5.049, "mean_token_accuracy": 0.2093716561794281, "num_tokens": 100014611.0, "step": 57660 }, { "entropy": 5.937571477890015, "epoch": 4.486520132269987, "grad_norm": 1.515625, "learning_rate": 0.00031413391907231133, "loss": 4.9821, "mean_token_accuracy": 0.21225055456161498, "num_tokens": 100022708.0, "step": 57665 }, { "entropy": 5.928589868545532, "epoch": 4.486909161641704, "grad_norm": 1.4140625, "learning_rate": 0.00031410662562112015, "loss": 4.9952, "mean_token_accuracy": 0.2150104448199272, "num_tokens": 100031813.0, "step": 57670 }, { "entropy": 5.933185958862305, "epoch": 4.487298191013421, "grad_norm": 1.359375, "learning_rate": 0.00031407933157654816, "loss": 5.0073, "mean_token_accuracy": 0.21717143207788467, "num_tokens": 100040781.0, "step": 57675 }, { "entropy": 5.900042343139648, "epoch": 4.487687220385139, "grad_norm": 1.421875, "learning_rate": 0.0003140520369390095, "loss": 4.8892, "mean_token_accuracy": 0.21994658708572387, "num_tokens": 100049206.0, "step": 57680 }, { "entropy": 5.923494672775268, "epoch": 4.4880762497568565, "grad_norm": 1.296875, "learning_rate": 0.0003140247417089184, "loss": 4.9632, "mean_token_accuracy": 0.22148555666208267, "num_tokens": 100059034.0, "step": 57685 }, { "entropy": 5.93550124168396, "epoch": 4.488465279128574, "grad_norm": 1.4609375, "learning_rate": 0.0003139974458866889, "loss": 4.9624, "mean_token_accuracy": 0.2210059255361557, "num_tokens": 100067093.0, "step": 57690 }, { "entropy": 5.985317611694336, "epoch": 4.488854308500292, "grad_norm": 1.5390625, "learning_rate": 0.0003139701494727353, "loss": 4.9673, "mean_token_accuracy": 0.21572909951210023, "num_tokens": 100075235.0, "step": 57695 }, { "entropy": 5.982493352890015, "epoch": 4.48924333787201, "grad_norm": 1.484375, "learning_rate": 0.0003139428524674716, "loss": 5.026, "mean_token_accuracy": 0.2073841780424118, "num_tokens": 100083032.0, "step": 57700 }, { "entropy": 5.976552057266235, "epoch": 4.489632367243727, "grad_norm": 1.34375, "learning_rate": 0.0003139155548713122, "loss": 5.0688, "mean_token_accuracy": 0.20331808179616928, "num_tokens": 100091613.0, "step": 57705 }, { "entropy": 5.921510934829712, "epoch": 4.490021396615444, "grad_norm": 1.4765625, "learning_rate": 0.00031388825668467115, "loss": 4.932, "mean_token_accuracy": 0.21367980986833573, "num_tokens": 100100234.0, "step": 57710 }, { "entropy": 5.936568927764893, "epoch": 4.490410425987162, "grad_norm": 1.4765625, "learning_rate": 0.00031386095790796265, "loss": 5.0035, "mean_token_accuracy": 0.21372120529413224, "num_tokens": 100108881.0, "step": 57715 }, { "entropy": 5.961302042007446, "epoch": 4.4907994553588795, "grad_norm": 1.5, "learning_rate": 0.00031383365854160104, "loss": 4.9916, "mean_token_accuracy": 0.2061997652053833, "num_tokens": 100117338.0, "step": 57720 }, { "entropy": 5.978952169418335, "epoch": 4.491188484730597, "grad_norm": 1.4375, "learning_rate": 0.0003138063585860005, "loss": 4.944, "mean_token_accuracy": 0.22043062895536422, "num_tokens": 100125708.0, "step": 57725 }, { "entropy": 5.886020374298096, "epoch": 4.491577514102315, "grad_norm": 1.453125, "learning_rate": 0.0003137790580415752, "loss": 4.9027, "mean_token_accuracy": 0.21921835839748383, "num_tokens": 100134039.0, "step": 57730 }, { "entropy": 5.939590215682983, "epoch": 4.491966543474033, "grad_norm": 1.515625, "learning_rate": 0.00031375175690873943, "loss": 5.0131, "mean_token_accuracy": 0.21159750521183013, "num_tokens": 100142204.0, "step": 57735 }, { "entropy": 5.926702833175659, "epoch": 4.49235557284575, "grad_norm": 1.3984375, "learning_rate": 0.00031372445518790737, "loss": 4.8939, "mean_token_accuracy": 0.22311621457338332, "num_tokens": 100150831.0, "step": 57740 }, { "entropy": 5.985374832153321, "epoch": 4.492744602217467, "grad_norm": 1.3828125, "learning_rate": 0.00031369715287949334, "loss": 5.0455, "mean_token_accuracy": 0.21759130656719208, "num_tokens": 100159584.0, "step": 57745 }, { "entropy": 5.88170428276062, "epoch": 4.493133631589185, "grad_norm": 1.59375, "learning_rate": 0.00031366984998391163, "loss": 4.9358, "mean_token_accuracy": 0.21962212771177292, "num_tokens": 100167907.0, "step": 57750 }, { "entropy": 5.937469005584717, "epoch": 4.4935226609609025, "grad_norm": 1.5859375, "learning_rate": 0.00031364254650157646, "loss": 4.9449, "mean_token_accuracy": 0.2239786207675934, "num_tokens": 100176578.0, "step": 57755 }, { "entropy": 5.977820348739624, "epoch": 4.49391169033262, "grad_norm": 1.546875, "learning_rate": 0.0003136152424329023, "loss": 5.0555, "mean_token_accuracy": 0.20882636606693267, "num_tokens": 100184514.0, "step": 57760 }, { "entropy": 5.942767858505249, "epoch": 4.494300719704338, "grad_norm": 1.328125, "learning_rate": 0.0003135879377783032, "loss": 4.8988, "mean_token_accuracy": 0.21859647184610367, "num_tokens": 100192851.0, "step": 57765 }, { "entropy": 5.882703495025635, "epoch": 4.494689749076056, "grad_norm": 1.40625, "learning_rate": 0.00031356063253819354, "loss": 4.8746, "mean_token_accuracy": 0.22332196533679963, "num_tokens": 100201874.0, "step": 57770 }, { "entropy": 5.939625453948975, "epoch": 4.495078778447773, "grad_norm": 1.484375, "learning_rate": 0.0003135333267129877, "loss": 4.9164, "mean_token_accuracy": 0.2137034296989441, "num_tokens": 100210032.0, "step": 57775 }, { "entropy": 5.998376655578613, "epoch": 4.49546780781949, "grad_norm": 1.4375, "learning_rate": 0.0003135060203030999, "loss": 5.094, "mean_token_accuracy": 0.20147220492362977, "num_tokens": 100219780.0, "step": 57780 }, { "entropy": 6.040231800079345, "epoch": 4.495856837191208, "grad_norm": 1.5078125, "learning_rate": 0.00031347871330894464, "loss": 5.0595, "mean_token_accuracy": 0.21232319325208665, "num_tokens": 100227951.0, "step": 57785 }, { "entropy": 5.977315950393677, "epoch": 4.4962458665629255, "grad_norm": 1.4453125, "learning_rate": 0.000313451405730936, "loss": 4.9461, "mean_token_accuracy": 0.21672005951404572, "num_tokens": 100236304.0, "step": 57790 }, { "entropy": 5.898017406463623, "epoch": 4.496634895934643, "grad_norm": 1.375, "learning_rate": 0.0003134240975694886, "loss": 4.9315, "mean_token_accuracy": 0.21468886584043503, "num_tokens": 100244889.0, "step": 57795 }, { "entropy": 5.918809700012207, "epoch": 4.497023925306361, "grad_norm": 1.390625, "learning_rate": 0.00031339678882501667, "loss": 4.9297, "mean_token_accuracy": 0.22092988193035126, "num_tokens": 100253043.0, "step": 57800 }, { "entropy": 5.949669885635376, "epoch": 4.497412954678079, "grad_norm": 1.40625, "learning_rate": 0.00031336947949793455, "loss": 4.9797, "mean_token_accuracy": 0.21337084323167801, "num_tokens": 100262184.0, "step": 57805 }, { "entropy": 5.934546279907226, "epoch": 4.497801984049795, "grad_norm": 1.3828125, "learning_rate": 0.00031334216958865663, "loss": 4.9102, "mean_token_accuracy": 0.2185825526714325, "num_tokens": 100270564.0, "step": 57810 }, { "entropy": 5.974032926559448, "epoch": 4.498191013421513, "grad_norm": 1.359375, "learning_rate": 0.00031331485909759734, "loss": 4.9906, "mean_token_accuracy": 0.21082500070333482, "num_tokens": 100279406.0, "step": 57815 }, { "entropy": 5.955420875549317, "epoch": 4.498580042793231, "grad_norm": 1.3671875, "learning_rate": 0.000313287548025171, "loss": 4.9847, "mean_token_accuracy": 0.21955261677503585, "num_tokens": 100288191.0, "step": 57820 }, { "entropy": 5.8724517822265625, "epoch": 4.4989690721649485, "grad_norm": 1.3125, "learning_rate": 0.0003132602363717921, "loss": 4.8581, "mean_token_accuracy": 0.2180185616016388, "num_tokens": 100297269.0, "step": 57825 }, { "entropy": 5.9340564727783205, "epoch": 4.499358101536666, "grad_norm": 1.421875, "learning_rate": 0.00031323292413787504, "loss": 4.9609, "mean_token_accuracy": 0.2196611136198044, "num_tokens": 100306009.0, "step": 57830 }, { "entropy": 5.995954370498657, "epoch": 4.499747130908384, "grad_norm": 1.390625, "learning_rate": 0.0003132056113238341, "loss": 5.0578, "mean_token_accuracy": 0.2044097065925598, "num_tokens": 100314771.0, "step": 57835 }, { "entropy": 5.973256969451905, "epoch": 4.5001361602801015, "grad_norm": 1.4375, "learning_rate": 0.00031317829793008403, "loss": 4.9461, "mean_token_accuracy": 0.2126249760389328, "num_tokens": 100323912.0, "step": 57840 }, { "entropy": 5.97506890296936, "epoch": 4.500525189651818, "grad_norm": 1.5078125, "learning_rate": 0.0003131509839570389, "loss": 4.9901, "mean_token_accuracy": 0.20717935711145402, "num_tokens": 100332351.0, "step": 57845 }, { "entropy": 5.941787815093994, "epoch": 4.500914219023536, "grad_norm": 1.46875, "learning_rate": 0.00031312366940511327, "loss": 4.8912, "mean_token_accuracy": 0.22120385318994523, "num_tokens": 100340547.0, "step": 57850 }, { "entropy": 5.896755743026733, "epoch": 4.501303248395254, "grad_norm": 1.484375, "learning_rate": 0.0003130963542747217, "loss": 4.9059, "mean_token_accuracy": 0.21704573631286622, "num_tokens": 100349067.0, "step": 57855 }, { "entropy": 5.872461891174316, "epoch": 4.5016922777669715, "grad_norm": 1.4609375, "learning_rate": 0.00031306903856627866, "loss": 4.8989, "mean_token_accuracy": 0.22063470929861068, "num_tokens": 100357735.0, "step": 57860 }, { "entropy": 5.945851373672485, "epoch": 4.502081307138689, "grad_norm": 1.40625, "learning_rate": 0.00031304172228019845, "loss": 4.9765, "mean_token_accuracy": 0.2170764222741127, "num_tokens": 100366389.0, "step": 57865 }, { "entropy": 5.9636180877685545, "epoch": 4.502470336510407, "grad_norm": 1.359375, "learning_rate": 0.00031301440541689577, "loss": 4.9053, "mean_token_accuracy": 0.22397948205471038, "num_tokens": 100374367.0, "step": 57870 }, { "entropy": 5.939149522781372, "epoch": 4.502859365882124, "grad_norm": 1.5546875, "learning_rate": 0.0003129870879767849, "loss": 4.939, "mean_token_accuracy": 0.2165229767560959, "num_tokens": 100382316.0, "step": 57875 }, { "entropy": 5.836052799224854, "epoch": 4.503248395253841, "grad_norm": 1.7734375, "learning_rate": 0.0003129597699602804, "loss": 4.8859, "mean_token_accuracy": 0.2217896744608879, "num_tokens": 100390771.0, "step": 57880 }, { "entropy": 5.975125885009765, "epoch": 4.503637424625559, "grad_norm": 1.4140625, "learning_rate": 0.0003129324513677969, "loss": 5.0164, "mean_token_accuracy": 0.21014364659786225, "num_tokens": 100399777.0, "step": 57885 }, { "entropy": 5.951526355743408, "epoch": 4.504026453997277, "grad_norm": 1.3828125, "learning_rate": 0.00031290513219974875, "loss": 4.992, "mean_token_accuracy": 0.216563680768013, "num_tokens": 100408750.0, "step": 57890 }, { "entropy": 5.912357997894287, "epoch": 4.504415483368994, "grad_norm": 1.2734375, "learning_rate": 0.00031287781245655064, "loss": 4.9855, "mean_token_accuracy": 0.21447935253381728, "num_tokens": 100417278.0, "step": 57895 }, { "entropy": 5.946004152297974, "epoch": 4.504804512740712, "grad_norm": 1.4609375, "learning_rate": 0.000312850492138617, "loss": 5.0126, "mean_token_accuracy": 0.21143608093261718, "num_tokens": 100425542.0, "step": 57900 }, { "entropy": 5.955247783660889, "epoch": 4.50519354211243, "grad_norm": 1.4609375, "learning_rate": 0.0003128231712463623, "loss": 4.9493, "mean_token_accuracy": 0.21840673983097075, "num_tokens": 100433492.0, "step": 57905 }, { "entropy": 5.927680110931396, "epoch": 4.5055825714841475, "grad_norm": 1.578125, "learning_rate": 0.0003127958497802012, "loss": 4.8906, "mean_token_accuracy": 0.2204967275261879, "num_tokens": 100442262.0, "step": 57910 }, { "entropy": 6.011193418502808, "epoch": 4.505971600855864, "grad_norm": 1.546875, "learning_rate": 0.0003127685277405483, "loss": 5.0943, "mean_token_accuracy": 0.20572330206632614, "num_tokens": 100450886.0, "step": 57915 }, { "entropy": 5.952038145065307, "epoch": 4.506360630227582, "grad_norm": 1.4140625, "learning_rate": 0.00031274120512781806, "loss": 4.9394, "mean_token_accuracy": 0.21237735450267792, "num_tokens": 100459379.0, "step": 57920 }, { "entropy": 5.924078464508057, "epoch": 4.5067496595993, "grad_norm": 1.4140625, "learning_rate": 0.0003127138819424252, "loss": 4.9341, "mean_token_accuracy": 0.21729949116706848, "num_tokens": 100467809.0, "step": 57925 }, { "entropy": 5.9069318771362305, "epoch": 4.507138688971017, "grad_norm": 1.6015625, "learning_rate": 0.0003126865581847841, "loss": 4.9438, "mean_token_accuracy": 0.2180008977651596, "num_tokens": 100476097.0, "step": 57930 }, { "entropy": 6.01404185295105, "epoch": 4.507527718342735, "grad_norm": 1.421875, "learning_rate": 0.00031265923385530943, "loss": 5.1029, "mean_token_accuracy": 0.20472257137298583, "num_tokens": 100485403.0, "step": 57935 }, { "entropy": 5.955080318450928, "epoch": 4.507916747714452, "grad_norm": 1.484375, "learning_rate": 0.0003126319089544159, "loss": 4.8859, "mean_token_accuracy": 0.22053979933261872, "num_tokens": 100493782.0, "step": 57940 }, { "entropy": 6.044373989105225, "epoch": 4.50830577708617, "grad_norm": 1.4296875, "learning_rate": 0.000312604583482518, "loss": 5.1237, "mean_token_accuracy": 0.20716950297355652, "num_tokens": 100503346.0, "step": 57945 }, { "entropy": 5.901104545593261, "epoch": 4.508694806457887, "grad_norm": 1.4453125, "learning_rate": 0.0003125772574400305, "loss": 4.9211, "mean_token_accuracy": 0.21207444220781327, "num_tokens": 100512015.0, "step": 57950 }, { "entropy": 5.883977031707763, "epoch": 4.509083835829605, "grad_norm": 1.390625, "learning_rate": 0.0003125499308273679, "loss": 4.9874, "mean_token_accuracy": 0.21742089539766313, "num_tokens": 100520567.0, "step": 57955 }, { "entropy": 5.954219484329224, "epoch": 4.509472865201323, "grad_norm": 1.4921875, "learning_rate": 0.00031252260364494477, "loss": 5.012, "mean_token_accuracy": 0.2082167685031891, "num_tokens": 100529004.0, "step": 57960 }, { "entropy": 5.940612649917602, "epoch": 4.50986189457304, "grad_norm": 1.375, "learning_rate": 0.00031249527589317596, "loss": 4.9897, "mean_token_accuracy": 0.21481944769620895, "num_tokens": 100538543.0, "step": 57965 }, { "entropy": 5.916070938110352, "epoch": 4.510250923944758, "grad_norm": 1.5, "learning_rate": 0.0003124679475724759, "loss": 4.9764, "mean_token_accuracy": 0.21857193112373352, "num_tokens": 100547456.0, "step": 57970 }, { "entropy": 5.909831190109253, "epoch": 4.510639953316476, "grad_norm": 1.3046875, "learning_rate": 0.0003124406186832595, "loss": 4.9193, "mean_token_accuracy": 0.21065421849489213, "num_tokens": 100556649.0, "step": 57975 }, { "entropy": 6.011018848419189, "epoch": 4.511028982688193, "grad_norm": 1.4296875, "learning_rate": 0.0003124132892259412, "loss": 5.0354, "mean_token_accuracy": 0.20909819304943084, "num_tokens": 100565323.0, "step": 57980 }, { "entropy": 5.9642504215240475, "epoch": 4.51141801205991, "grad_norm": 1.515625, "learning_rate": 0.00031238595920093584, "loss": 4.9114, "mean_token_accuracy": 0.22024666666984558, "num_tokens": 100574801.0, "step": 57985 }, { "entropy": 5.969989156723022, "epoch": 4.511807041431628, "grad_norm": 1.359375, "learning_rate": 0.00031235862860865807, "loss": 4.9979, "mean_token_accuracy": 0.21524639427661896, "num_tokens": 100583879.0, "step": 57990 }, { "entropy": 5.907824373245239, "epoch": 4.512196070803346, "grad_norm": 1.3203125, "learning_rate": 0.0003123312974495226, "loss": 4.9109, "mean_token_accuracy": 0.22304484248161316, "num_tokens": 100592886.0, "step": 57995 }, { "entropy": 5.9389252185821535, "epoch": 4.512585100175063, "grad_norm": 1.4453125, "learning_rate": 0.00031230396572394406, "loss": 4.9769, "mean_token_accuracy": 0.22157772034406661, "num_tokens": 100601604.0, "step": 58000 }, { "entropy": 5.927848291397095, "epoch": 4.512974129546781, "grad_norm": 1.40625, "learning_rate": 0.0003122766334323372, "loss": 5.0518, "mean_token_accuracy": 0.2080589011311531, "num_tokens": 100610436.0, "step": 58005 }, { "entropy": 5.980579471588134, "epoch": 4.513363158918498, "grad_norm": 1.3671875, "learning_rate": 0.00031224930057511673, "loss": 5.0112, "mean_token_accuracy": 0.21565478444099426, "num_tokens": 100618704.0, "step": 58010 }, { "entropy": 6.0168064594268795, "epoch": 4.513752188290216, "grad_norm": 1.4921875, "learning_rate": 0.0003122219671526974, "loss": 5.0224, "mean_token_accuracy": 0.2086917668581009, "num_tokens": 100627387.0, "step": 58015 }, { "entropy": 5.944635057449341, "epoch": 4.514141217661933, "grad_norm": 1.4375, "learning_rate": 0.00031219463316549406, "loss": 4.8939, "mean_token_accuracy": 0.21469616293907165, "num_tokens": 100635862.0, "step": 58020 }, { "entropy": 5.907937288284302, "epoch": 4.514530247033651, "grad_norm": 1.546875, "learning_rate": 0.00031216729861392137, "loss": 5.0217, "mean_token_accuracy": 0.20405325442552566, "num_tokens": 100644728.0, "step": 58025 }, { "entropy": 5.945425415039063, "epoch": 4.514919276405369, "grad_norm": 1.453125, "learning_rate": 0.0003121399634983941, "loss": 4.9403, "mean_token_accuracy": 0.22173851430416108, "num_tokens": 100653684.0, "step": 58030 }, { "entropy": 5.986827421188354, "epoch": 4.515308305777086, "grad_norm": 1.453125, "learning_rate": 0.00031211262781932693, "loss": 4.9578, "mean_token_accuracy": 0.22344642281532287, "num_tokens": 100662522.0, "step": 58035 }, { "entropy": 6.002403736114502, "epoch": 4.515697335148804, "grad_norm": 1.4296875, "learning_rate": 0.00031208529157713465, "loss": 5.0481, "mean_token_accuracy": 0.21523663252592087, "num_tokens": 100670810.0, "step": 58040 }, { "entropy": 5.921158218383789, "epoch": 4.516086364520521, "grad_norm": 1.46875, "learning_rate": 0.00031205795477223217, "loss": 4.9861, "mean_token_accuracy": 0.2157572850584984, "num_tokens": 100679749.0, "step": 58045 }, { "entropy": 5.958259773254395, "epoch": 4.516475393892239, "grad_norm": 1.375, "learning_rate": 0.00031203061740503414, "loss": 5.0412, "mean_token_accuracy": 0.20701769590377808, "num_tokens": 100689753.0, "step": 58050 }, { "entropy": 5.979867744445801, "epoch": 4.516864423263956, "grad_norm": 1.2734375, "learning_rate": 0.0003120032794759555, "loss": 5.0475, "mean_token_accuracy": 0.21024521440267563, "num_tokens": 100698278.0, "step": 58055 }, { "entropy": 5.926177263259888, "epoch": 4.517253452635674, "grad_norm": 1.46875, "learning_rate": 0.000311975940985411, "loss": 4.9086, "mean_token_accuracy": 0.22328974157571793, "num_tokens": 100707354.0, "step": 58060 }, { "entropy": 5.9505815505981445, "epoch": 4.517642482007392, "grad_norm": 1.453125, "learning_rate": 0.0003119486019338154, "loss": 4.9565, "mean_token_accuracy": 0.2207326591014862, "num_tokens": 100715946.0, "step": 58065 }, { "entropy": 6.044514751434326, "epoch": 4.518031511379109, "grad_norm": 1.4765625, "learning_rate": 0.00031192126232158367, "loss": 5.0245, "mean_token_accuracy": 0.21429793983697892, "num_tokens": 100725288.0, "step": 58070 }, { "entropy": 5.952231979370117, "epoch": 4.518420540750826, "grad_norm": 1.421875, "learning_rate": 0.0003118939221491305, "loss": 5.0001, "mean_token_accuracy": 0.21090563982725144, "num_tokens": 100733565.0, "step": 58075 }, { "entropy": 5.95211615562439, "epoch": 4.518809570122544, "grad_norm": 1.4375, "learning_rate": 0.0003118665814168707, "loss": 4.982, "mean_token_accuracy": 0.21899991929531099, "num_tokens": 100741937.0, "step": 58080 }, { "entropy": 5.932010841369629, "epoch": 4.519198599494262, "grad_norm": 1.4921875, "learning_rate": 0.00031183924012521925, "loss": 4.9435, "mean_token_accuracy": 0.21757580041885377, "num_tokens": 100750581.0, "step": 58085 }, { "entropy": 5.894408798217773, "epoch": 4.519587628865979, "grad_norm": 1.421875, "learning_rate": 0.000311811898274591, "loss": 4.9383, "mean_token_accuracy": 0.22093418836593628, "num_tokens": 100758775.0, "step": 58090 }, { "entropy": 5.938787794113159, "epoch": 4.519976658237697, "grad_norm": 1.4296875, "learning_rate": 0.00031178455586540076, "loss": 4.9408, "mean_token_accuracy": 0.22057174891233444, "num_tokens": 100767002.0, "step": 58095 }, { "entropy": 6.046633338928222, "epoch": 4.520365687609415, "grad_norm": 1.4609375, "learning_rate": 0.00031175721289806345, "loss": 5.0269, "mean_token_accuracy": 0.20922839045524597, "num_tokens": 100775428.0, "step": 58100 }, { "entropy": 5.992326736450195, "epoch": 4.520754716981132, "grad_norm": 1.5, "learning_rate": 0.00031172986937299396, "loss": 5.0104, "mean_token_accuracy": 0.212798373401165, "num_tokens": 100784164.0, "step": 58105 }, { "entropy": 5.99232497215271, "epoch": 4.52114374635285, "grad_norm": 1.4453125, "learning_rate": 0.00031170252529060715, "loss": 5.0049, "mean_token_accuracy": 0.21700541377067567, "num_tokens": 100792627.0, "step": 58110 }, { "entropy": 5.906730270385742, "epoch": 4.521532775724567, "grad_norm": 1.4375, "learning_rate": 0.0003116751806513179, "loss": 4.9752, "mean_token_accuracy": 0.22187259495258332, "num_tokens": 100802179.0, "step": 58115 }, { "entropy": 5.9361485004425045, "epoch": 4.521921805096285, "grad_norm": 1.4375, "learning_rate": 0.0003116478354555412, "loss": 4.905, "mean_token_accuracy": 0.21661875396966934, "num_tokens": 100810875.0, "step": 58120 }, { "entropy": 5.91546139717102, "epoch": 4.522310834468002, "grad_norm": 1.453125, "learning_rate": 0.00031162048970369196, "loss": 4.996, "mean_token_accuracy": 0.21462104767560958, "num_tokens": 100820110.0, "step": 58125 }, { "entropy": 5.979083824157715, "epoch": 4.52269986383972, "grad_norm": 1.40625, "learning_rate": 0.000311593143396185, "loss": 5.0544, "mean_token_accuracy": 0.20374642312526703, "num_tokens": 100829573.0, "step": 58130 }, { "entropy": 6.031494140625, "epoch": 4.523088893211438, "grad_norm": 1.421875, "learning_rate": 0.00031156579653343543, "loss": 5.0824, "mean_token_accuracy": 0.20815053582191467, "num_tokens": 100838430.0, "step": 58135 }, { "entropy": 5.926622438430786, "epoch": 4.523477922583155, "grad_norm": 1.28125, "learning_rate": 0.000311538449115858, "loss": 4.9332, "mean_token_accuracy": 0.21772463023662567, "num_tokens": 100847400.0, "step": 58140 }, { "entropy": 5.908663272857666, "epoch": 4.523866951954872, "grad_norm": 1.296875, "learning_rate": 0.0003115111011438678, "loss": 4.9401, "mean_token_accuracy": 0.21329007297754288, "num_tokens": 100855909.0, "step": 58145 }, { "entropy": 6.008129072189331, "epoch": 4.52425598132659, "grad_norm": 1.3828125, "learning_rate": 0.0003114837526178797, "loss": 5.052, "mean_token_accuracy": 0.21219624280929567, "num_tokens": 100864577.0, "step": 58150 }, { "entropy": 5.967572116851807, "epoch": 4.524645010698308, "grad_norm": 1.546875, "learning_rate": 0.0003114564035383088, "loss": 5.0196, "mean_token_accuracy": 0.2084329307079315, "num_tokens": 100873059.0, "step": 58155 }, { "entropy": 5.947109651565552, "epoch": 4.525034040070025, "grad_norm": 1.4296875, "learning_rate": 0.00031142905390556995, "loss": 4.9895, "mean_token_accuracy": 0.21399738192558287, "num_tokens": 100881548.0, "step": 58160 }, { "entropy": 5.908093881607056, "epoch": 4.525423069441743, "grad_norm": 1.40625, "learning_rate": 0.0003114017037200782, "loss": 4.9665, "mean_token_accuracy": 0.21674164682626723, "num_tokens": 100890732.0, "step": 58165 }, { "entropy": 5.9392472267150875, "epoch": 4.525812098813461, "grad_norm": 1.34375, "learning_rate": 0.00031137435298224863, "loss": 4.9599, "mean_token_accuracy": 0.21220220774412155, "num_tokens": 100899273.0, "step": 58170 }, { "entropy": 6.0436419486999515, "epoch": 4.526201128185178, "grad_norm": 1.421875, "learning_rate": 0.0003113470016924961, "loss": 4.9742, "mean_token_accuracy": 0.21335437148809433, "num_tokens": 100907920.0, "step": 58175 }, { "entropy": 5.938825416564941, "epoch": 4.526590157556895, "grad_norm": 1.3671875, "learning_rate": 0.00031131964985123555, "loss": 4.9705, "mean_token_accuracy": 0.2114158809185028, "num_tokens": 100916754.0, "step": 58180 }, { "entropy": 5.89545168876648, "epoch": 4.526979186928613, "grad_norm": 1.4375, "learning_rate": 0.0003112922974588822, "loss": 4.9573, "mean_token_accuracy": 0.2165951356291771, "num_tokens": 100925816.0, "step": 58185 }, { "entropy": 5.879301452636719, "epoch": 4.527368216300331, "grad_norm": 1.375, "learning_rate": 0.000311264944515851, "loss": 4.8365, "mean_token_accuracy": 0.22944784313440322, "num_tokens": 100933833.0, "step": 58190 }, { "entropy": 5.993469715118408, "epoch": 4.527757245672048, "grad_norm": 1.4921875, "learning_rate": 0.00031123759102255714, "loss": 5.0113, "mean_token_accuracy": 0.2101433530449867, "num_tokens": 100941945.0, "step": 58195 }, { "entropy": 5.9760418891906735, "epoch": 4.528146275043766, "grad_norm": 1.609375, "learning_rate": 0.0003112102369794153, "loss": 4.9141, "mean_token_accuracy": 0.2166390985250473, "num_tokens": 100949638.0, "step": 58200 }, { "entropy": 5.9400999546051025, "epoch": 4.528535304415484, "grad_norm": 1.3203125, "learning_rate": 0.00031118288238684086, "loss": 4.9995, "mean_token_accuracy": 0.21039969027042388, "num_tokens": 100959083.0, "step": 58205 }, { "entropy": 6.008056879043579, "epoch": 4.5289243337872005, "grad_norm": 1.4453125, "learning_rate": 0.0003111555272452486, "loss": 4.9852, "mean_token_accuracy": 0.21312781274318696, "num_tokens": 100967532.0, "step": 58210 }, { "entropy": 5.898654174804688, "epoch": 4.529313363158918, "grad_norm": 1.4296875, "learning_rate": 0.00031112817155505394, "loss": 4.917, "mean_token_accuracy": 0.2165583923459053, "num_tokens": 100975683.0, "step": 58215 }, { "entropy": 5.873921728134155, "epoch": 4.529702392530636, "grad_norm": 1.6640625, "learning_rate": 0.00031110081531667184, "loss": 4.9096, "mean_token_accuracy": 0.2201073944568634, "num_tokens": 100984946.0, "step": 58220 }, { "entropy": 5.890289449691773, "epoch": 4.530091421902354, "grad_norm": 1.5, "learning_rate": 0.00031107345853051714, "loss": 4.9165, "mean_token_accuracy": 0.2166956514120102, "num_tokens": 100993925.0, "step": 58225 }, { "entropy": 6.00723934173584, "epoch": 4.530480451274071, "grad_norm": 1.4375, "learning_rate": 0.00031104610119700525, "loss": 5.0107, "mean_token_accuracy": 0.21244004219770432, "num_tokens": 101002777.0, "step": 58230 }, { "entropy": 5.895885896682739, "epoch": 4.530869480645789, "grad_norm": 1.4609375, "learning_rate": 0.0003110187433165511, "loss": 4.9282, "mean_token_accuracy": 0.21465131640434265, "num_tokens": 101010870.0, "step": 58235 }, { "entropy": 5.947065591812134, "epoch": 4.531258510017507, "grad_norm": 1.3984375, "learning_rate": 0.0003109913848895699, "loss": 4.9606, "mean_token_accuracy": 0.2117588058114052, "num_tokens": 101020279.0, "step": 58240 }, { "entropy": 5.940305995941162, "epoch": 4.531647539389224, "grad_norm": 1.546875, "learning_rate": 0.0003109640259164766, "loss": 4.991, "mean_token_accuracy": 0.21450170874595642, "num_tokens": 101028362.0, "step": 58245 }, { "entropy": 5.90500226020813, "epoch": 4.532036568760941, "grad_norm": 1.40625, "learning_rate": 0.00031093666639768654, "loss": 4.8987, "mean_token_accuracy": 0.22023587077856063, "num_tokens": 101037143.0, "step": 58250 }, { "entropy": 5.960330820083618, "epoch": 4.532425598132659, "grad_norm": 1.375, "learning_rate": 0.0003109093063336147, "loss": 4.9785, "mean_token_accuracy": 0.21750691831111907, "num_tokens": 101046625.0, "step": 58255 }, { "entropy": 6.009812450408935, "epoch": 4.532814627504377, "grad_norm": 1.3671875, "learning_rate": 0.0003108819457246764, "loss": 5.1133, "mean_token_accuracy": 0.20294404029846191, "num_tokens": 101055960.0, "step": 58260 }, { "entropy": 5.963505506515503, "epoch": 4.533203656876094, "grad_norm": 1.453125, "learning_rate": 0.00031085458457128667, "loss": 4.9898, "mean_token_accuracy": 0.20492182224988936, "num_tokens": 101064074.0, "step": 58265 }, { "entropy": 5.9894860744476315, "epoch": 4.533592686247812, "grad_norm": 1.375, "learning_rate": 0.00031082722287386065, "loss": 5.0364, "mean_token_accuracy": 0.2128014013171196, "num_tokens": 101072379.0, "step": 58270 }, { "entropy": 5.959867477416992, "epoch": 4.533981715619529, "grad_norm": 1.359375, "learning_rate": 0.0003107998606328135, "loss": 4.9694, "mean_token_accuracy": 0.21974776238203048, "num_tokens": 101081841.0, "step": 58275 }, { "entropy": 5.9559191226959225, "epoch": 4.5343707449912465, "grad_norm": 1.3671875, "learning_rate": 0.00031077249784856057, "loss": 5.0181, "mean_token_accuracy": 0.20889939963817597, "num_tokens": 101091294.0, "step": 58280 }, { "entropy": 5.92326922416687, "epoch": 4.534759774362964, "grad_norm": 1.4296875, "learning_rate": 0.00031074513452151683, "loss": 4.9072, "mean_token_accuracy": 0.21585903018712999, "num_tokens": 101099677.0, "step": 58285 }, { "entropy": 5.978474521636963, "epoch": 4.535148803734682, "grad_norm": 1.4921875, "learning_rate": 0.0003107177706520975, "loss": 5.0258, "mean_token_accuracy": 0.21350251287221908, "num_tokens": 101108442.0, "step": 58290 }, { "entropy": 5.9244619846344, "epoch": 4.5355378331064, "grad_norm": 1.4453125, "learning_rate": 0.000310690406240718, "loss": 5.0317, "mean_token_accuracy": 0.20912282466888427, "num_tokens": 101116663.0, "step": 58295 }, { "entropy": 5.990008115768433, "epoch": 4.535926862478117, "grad_norm": 1.515625, "learning_rate": 0.00031066304128779336, "loss": 5.0005, "mean_token_accuracy": 0.21326595693826675, "num_tokens": 101125202.0, "step": 58300 }, { "entropy": 5.981547594070435, "epoch": 4.536315891849835, "grad_norm": 1.4375, "learning_rate": 0.00031063567579373876, "loss": 4.9788, "mean_token_accuracy": 0.20939721614122392, "num_tokens": 101134075.0, "step": 58305 }, { "entropy": 5.991951656341553, "epoch": 4.536704921221553, "grad_norm": 1.4921875, "learning_rate": 0.00031060830975896954, "loss": 4.9897, "mean_token_accuracy": 0.21683793365955353, "num_tokens": 101142415.0, "step": 58310 }, { "entropy": 5.885130548477173, "epoch": 4.5370939505932695, "grad_norm": 1.359375, "learning_rate": 0.00031058094318390085, "loss": 4.9327, "mean_token_accuracy": 0.2166779637336731, "num_tokens": 101151057.0, "step": 58315 }, { "entropy": 5.870819997787476, "epoch": 4.537482979964987, "grad_norm": 1.4296875, "learning_rate": 0.00031055357606894806, "loss": 4.9695, "mean_token_accuracy": 0.21005047410726546, "num_tokens": 101159604.0, "step": 58320 }, { "entropy": 5.963169288635254, "epoch": 4.537872009336705, "grad_norm": 1.4296875, "learning_rate": 0.0003105262084145263, "loss": 4.9063, "mean_token_accuracy": 0.2237996503710747, "num_tokens": 101167936.0, "step": 58325 }, { "entropy": 5.995974063873291, "epoch": 4.538261038708423, "grad_norm": 1.46875, "learning_rate": 0.0003104988402210509, "loss": 4.9815, "mean_token_accuracy": 0.21224923878908158, "num_tokens": 101176605.0, "step": 58330 }, { "entropy": 5.912528562545776, "epoch": 4.53865006808014, "grad_norm": 1.5, "learning_rate": 0.0003104714714889371, "loss": 4.9819, "mean_token_accuracy": 0.2128423348069191, "num_tokens": 101185669.0, "step": 58335 }, { "entropy": 5.9232262134552, "epoch": 4.539039097451858, "grad_norm": 1.40625, "learning_rate": 0.00031044410221860017, "loss": 4.9307, "mean_token_accuracy": 0.22111738622188568, "num_tokens": 101194425.0, "step": 58340 }, { "entropy": 5.95557050704956, "epoch": 4.539428126823575, "grad_norm": 1.4140625, "learning_rate": 0.0003104167324104553, "loss": 4.9426, "mean_token_accuracy": 0.22172147780656815, "num_tokens": 101203232.0, "step": 58345 }, { "entropy": 5.9572936534881595, "epoch": 4.5398171561952925, "grad_norm": 1.484375, "learning_rate": 0.00031038936206491803, "loss": 4.9349, "mean_token_accuracy": 0.21463282704353331, "num_tokens": 101210948.0, "step": 58350 }, { "entropy": 5.820258140563965, "epoch": 4.54020618556701, "grad_norm": 1.3125, "learning_rate": 0.0003103619911824035, "loss": 4.8454, "mean_token_accuracy": 0.22741685956716537, "num_tokens": 101220296.0, "step": 58355 }, { "entropy": 5.91034083366394, "epoch": 4.540595214938728, "grad_norm": 1.4921875, "learning_rate": 0.000310334619763327, "loss": 5.0063, "mean_token_accuracy": 0.2147918686270714, "num_tokens": 101228908.0, "step": 58360 }, { "entropy": 5.940120697021484, "epoch": 4.540984244310446, "grad_norm": 1.453125, "learning_rate": 0.00031030724780810385, "loss": 4.9821, "mean_token_accuracy": 0.215407295525074, "num_tokens": 101237919.0, "step": 58365 }, { "entropy": 6.046345853805542, "epoch": 4.541373273682163, "grad_norm": 1.421875, "learning_rate": 0.00031027987531714944, "loss": 5.0199, "mean_token_accuracy": 0.20666933953762054, "num_tokens": 101246341.0, "step": 58370 }, { "entropy": 5.916973495483399, "epoch": 4.541762303053881, "grad_norm": 1.4296875, "learning_rate": 0.00031025250229087915, "loss": 4.8988, "mean_token_accuracy": 0.21875904202461244, "num_tokens": 101254626.0, "step": 58375 }, { "entropy": 5.9798685073852536, "epoch": 4.542151332425598, "grad_norm": 1.5234375, "learning_rate": 0.00031022512872970823, "loss": 5.0804, "mean_token_accuracy": 0.20609446316957475, "num_tokens": 101263390.0, "step": 58380 }, { "entropy": 5.868487071990967, "epoch": 4.5425403617973155, "grad_norm": 1.390625, "learning_rate": 0.000310197754634052, "loss": 4.9202, "mean_token_accuracy": 0.21734785437583923, "num_tokens": 101272276.0, "step": 58385 }, { "entropy": 6.017352867126465, "epoch": 4.542929391169033, "grad_norm": 1.4296875, "learning_rate": 0.0003101703800043258, "loss": 4.998, "mean_token_accuracy": 0.21534724831581115, "num_tokens": 101280201.0, "step": 58390 }, { "entropy": 5.965345859527588, "epoch": 4.543318420540751, "grad_norm": 1.4375, "learning_rate": 0.00031014300484094516, "loss": 4.9846, "mean_token_accuracy": 0.21885154098272325, "num_tokens": 101289170.0, "step": 58395 }, { "entropy": 5.924568462371826, "epoch": 4.5437074499124686, "grad_norm": 1.46875, "learning_rate": 0.0003101156291443254, "loss": 4.9683, "mean_token_accuracy": 0.21679244488477706, "num_tokens": 101298687.0, "step": 58400 }, { "entropy": 6.063735151290894, "epoch": 4.544096479284186, "grad_norm": 1.40625, "learning_rate": 0.0003100882529148817, "loss": 5.163, "mean_token_accuracy": 0.1990307942032814, "num_tokens": 101306898.0, "step": 58405 }, { "entropy": 6.020080089569092, "epoch": 4.544485508655903, "grad_norm": 1.4140625, "learning_rate": 0.00031006087615302976, "loss": 5.0271, "mean_token_accuracy": 0.2125757083296776, "num_tokens": 101316176.0, "step": 58410 }, { "entropy": 5.994750022888184, "epoch": 4.544874538027621, "grad_norm": 1.5, "learning_rate": 0.00031003349885918473, "loss": 4.9368, "mean_token_accuracy": 0.21369680911302566, "num_tokens": 101324264.0, "step": 58415 }, { "entropy": 5.965234851837158, "epoch": 4.5452635673993385, "grad_norm": 1.375, "learning_rate": 0.00031000612103376226, "loss": 4.947, "mean_token_accuracy": 0.21250844597816468, "num_tokens": 101333199.0, "step": 58420 }, { "entropy": 5.974844455718994, "epoch": 4.545652596771056, "grad_norm": 1.4296875, "learning_rate": 0.0003099787426771775, "loss": 4.9996, "mean_token_accuracy": 0.21571554392576217, "num_tokens": 101341851.0, "step": 58425 }, { "entropy": 5.918615293502808, "epoch": 4.546041626142774, "grad_norm": 1.34375, "learning_rate": 0.000309951363789846, "loss": 4.963, "mean_token_accuracy": 0.21680498421192168, "num_tokens": 101350595.0, "step": 58430 }, { "entropy": 5.891674900054932, "epoch": 4.5464306555144915, "grad_norm": 1.515625, "learning_rate": 0.00030992398437218314, "loss": 4.8804, "mean_token_accuracy": 0.22304200381040573, "num_tokens": 101359085.0, "step": 58435 }, { "entropy": 5.940161228179932, "epoch": 4.546819684886209, "grad_norm": 1.4453125, "learning_rate": 0.0003098966044246045, "loss": 4.9833, "mean_token_accuracy": 0.2095121443271637, "num_tokens": 101367965.0, "step": 58440 }, { "entropy": 5.977306604385376, "epoch": 4.547208714257927, "grad_norm": 1.3203125, "learning_rate": 0.00030986922394752534, "loss": 4.9847, "mean_token_accuracy": 0.22229924201965331, "num_tokens": 101376986.0, "step": 58445 }, { "entropy": 5.981124639511108, "epoch": 4.547597743629644, "grad_norm": 1.5703125, "learning_rate": 0.00030984184294136134, "loss": 4.9742, "mean_token_accuracy": 0.2147505760192871, "num_tokens": 101385691.0, "step": 58450 }, { "entropy": 5.875857543945313, "epoch": 4.5479867730013614, "grad_norm": 1.453125, "learning_rate": 0.00030981446140652773, "loss": 4.8833, "mean_token_accuracy": 0.22326604276895523, "num_tokens": 101394328.0, "step": 58455 }, { "entropy": 5.981966829299926, "epoch": 4.548375802373079, "grad_norm": 1.53125, "learning_rate": 0.00030978707934344014, "loss": 4.9791, "mean_token_accuracy": 0.2144719272851944, "num_tokens": 101403165.0, "step": 58460 }, { "entropy": 5.94707145690918, "epoch": 4.548764831744797, "grad_norm": 1.4765625, "learning_rate": 0.000309759696752514, "loss": 4.9401, "mean_token_accuracy": 0.21545272022485734, "num_tokens": 101411609.0, "step": 58465 }, { "entropy": 5.886676406860351, "epoch": 4.5491538611165145, "grad_norm": 1.3515625, "learning_rate": 0.0003097323136341647, "loss": 4.8934, "mean_token_accuracy": 0.22017668187618256, "num_tokens": 101420609.0, "step": 58470 }, { "entropy": 5.958272314071655, "epoch": 4.549542890488232, "grad_norm": 1.484375, "learning_rate": 0.0003097049299888078, "loss": 5.0345, "mean_token_accuracy": 0.21841762363910674, "num_tokens": 101428931.0, "step": 58475 }, { "entropy": 5.964497995376587, "epoch": 4.549931919859949, "grad_norm": 1.4296875, "learning_rate": 0.0003096775458168589, "loss": 5.0108, "mean_token_accuracy": 0.20915891826152802, "num_tokens": 101438329.0, "step": 58480 }, { "entropy": 5.96292552947998, "epoch": 4.550320949231667, "grad_norm": 1.4921875, "learning_rate": 0.00030965016111873345, "loss": 4.9305, "mean_token_accuracy": 0.21661896854639054, "num_tokens": 101446453.0, "step": 58485 }, { "entropy": 5.978559923171997, "epoch": 4.550709978603384, "grad_norm": 1.4765625, "learning_rate": 0.00030962277589484697, "loss": 4.9775, "mean_token_accuracy": 0.21155090183019637, "num_tokens": 101455368.0, "step": 58490 }, { "entropy": 5.937911319732666, "epoch": 4.551099007975102, "grad_norm": 1.6328125, "learning_rate": 0.00030959539014561494, "loss": 4.9788, "mean_token_accuracy": 0.21017447263002395, "num_tokens": 101463573.0, "step": 58495 }, { "entropy": 5.899010419845581, "epoch": 4.55148803734682, "grad_norm": 1.4765625, "learning_rate": 0.00030956800387145294, "loss": 4.9218, "mean_token_accuracy": 0.21537830233573912, "num_tokens": 101471534.0, "step": 58500 }, { "entropy": 5.942011976242066, "epoch": 4.5518770667185375, "grad_norm": 1.453125, "learning_rate": 0.00030954061707277647, "loss": 4.9956, "mean_token_accuracy": 0.215328411757946, "num_tokens": 101479617.0, "step": 58505 }, { "entropy": 5.919935989379883, "epoch": 4.552266096090255, "grad_norm": 1.3671875, "learning_rate": 0.0003095132297500011, "loss": 4.931, "mean_token_accuracy": 0.22263543754816056, "num_tokens": 101487947.0, "step": 58510 }, { "entropy": 5.925440311431885, "epoch": 4.552655125461972, "grad_norm": 1.359375, "learning_rate": 0.00030948584190354246, "loss": 4.9833, "mean_token_accuracy": 0.2216104283928871, "num_tokens": 101496542.0, "step": 58515 }, { "entropy": 5.95532078742981, "epoch": 4.55304415483369, "grad_norm": 1.3984375, "learning_rate": 0.000309458453533816, "loss": 5.0086, "mean_token_accuracy": 0.21065550148487092, "num_tokens": 101505552.0, "step": 58520 }, { "entropy": 5.971432685852051, "epoch": 4.553433184205407, "grad_norm": 1.515625, "learning_rate": 0.00030943106464123744, "loss": 4.9357, "mean_token_accuracy": 0.21792164593935012, "num_tokens": 101514612.0, "step": 58525 }, { "entropy": 5.927151393890381, "epoch": 4.553822213577125, "grad_norm": 1.3515625, "learning_rate": 0.00030940367522622224, "loss": 4.9997, "mean_token_accuracy": 0.2211836576461792, "num_tokens": 101524316.0, "step": 58530 }, { "entropy": 5.947913932800293, "epoch": 4.554211242948843, "grad_norm": 1.421875, "learning_rate": 0.000309376285289186, "loss": 4.9813, "mean_token_accuracy": 0.21202642768621444, "num_tokens": 101532905.0, "step": 58535 }, { "entropy": 6.004165363311768, "epoch": 4.5546002723205605, "grad_norm": 1.4765625, "learning_rate": 0.00030934889483054433, "loss": 5.0436, "mean_token_accuracy": 0.20984185189008714, "num_tokens": 101541561.0, "step": 58540 }, { "entropy": 6.053962135314942, "epoch": 4.554989301692277, "grad_norm": 1.390625, "learning_rate": 0.0003093215038507129, "loss": 5.108, "mean_token_accuracy": 0.19978517293930054, "num_tokens": 101550774.0, "step": 58545 }, { "entropy": 6.016974306106567, "epoch": 4.555378331063995, "grad_norm": 1.515625, "learning_rate": 0.0003092941123501073, "loss": 5.0188, "mean_token_accuracy": 0.2169467940926552, "num_tokens": 101559562.0, "step": 58550 }, { "entropy": 6.0086188316345215, "epoch": 4.555767360435713, "grad_norm": 1.421875, "learning_rate": 0.00030926672032914306, "loss": 4.9776, "mean_token_accuracy": 0.2118993103504181, "num_tokens": 101568458.0, "step": 58555 }, { "entropy": 5.920924043655395, "epoch": 4.55615638980743, "grad_norm": 1.5078125, "learning_rate": 0.0003092393277882359, "loss": 4.9403, "mean_token_accuracy": 0.2113639548420906, "num_tokens": 101577396.0, "step": 58560 }, { "entropy": 5.918664216995239, "epoch": 4.556545419179148, "grad_norm": 1.3515625, "learning_rate": 0.00030921193472780144, "loss": 4.9564, "mean_token_accuracy": 0.2137495383620262, "num_tokens": 101585464.0, "step": 58565 }, { "entropy": 5.87604513168335, "epoch": 4.556934448550866, "grad_norm": 1.4296875, "learning_rate": 0.0003091845411482554, "loss": 4.8547, "mean_token_accuracy": 0.22694648653268815, "num_tokens": 101593663.0, "step": 58570 }, { "entropy": 5.9865258693695065, "epoch": 4.5573234779225835, "grad_norm": 1.4140625, "learning_rate": 0.00030915714705001323, "loss": 5.0403, "mean_token_accuracy": 0.20996366292238236, "num_tokens": 101602678.0, "step": 58575 }, { "entropy": 6.012033605575562, "epoch": 4.557712507294301, "grad_norm": 1.3515625, "learning_rate": 0.0003091297524334908, "loss": 5.0315, "mean_token_accuracy": 0.2138388454914093, "num_tokens": 101610957.0, "step": 58580 }, { "entropy": 5.9539727687835695, "epoch": 4.558101536666018, "grad_norm": 1.5, "learning_rate": 0.0003091023572991036, "loss": 4.9373, "mean_token_accuracy": 0.2173429936170578, "num_tokens": 101619770.0, "step": 58585 }, { "entropy": 5.9686966896057125, "epoch": 4.558490566037736, "grad_norm": 1.421875, "learning_rate": 0.0003090749616472675, "loss": 5.0585, "mean_token_accuracy": 0.2064809024333954, "num_tokens": 101628675.0, "step": 58590 }, { "entropy": 5.955616188049317, "epoch": 4.558879595409453, "grad_norm": 1.40625, "learning_rate": 0.0003090475654783981, "loss": 4.9905, "mean_token_accuracy": 0.21637198328971863, "num_tokens": 101637861.0, "step": 58595 }, { "entropy": 5.839438772201538, "epoch": 4.559268624781171, "grad_norm": 1.3984375, "learning_rate": 0.0003090201687929111, "loss": 4.8908, "mean_token_accuracy": 0.2179200083017349, "num_tokens": 101645825.0, "step": 58600 }, { "entropy": 5.938732004165649, "epoch": 4.559657654152889, "grad_norm": 1.6171875, "learning_rate": 0.00030899277159122213, "loss": 5.0206, "mean_token_accuracy": 0.2175292953848839, "num_tokens": 101654186.0, "step": 58605 }, { "entropy": 6.023279285430908, "epoch": 4.560046683524606, "grad_norm": 1.421875, "learning_rate": 0.00030896537387374703, "loss": 5.1536, "mean_token_accuracy": 0.19467951506376266, "num_tokens": 101663195.0, "step": 58610 }, { "entropy": 5.9311261653900145, "epoch": 4.560435712896323, "grad_norm": 1.4453125, "learning_rate": 0.00030893797564090136, "loss": 4.9585, "mean_token_accuracy": 0.21384785026311875, "num_tokens": 101672070.0, "step": 58615 }, { "entropy": 5.935377836227417, "epoch": 4.560824742268041, "grad_norm": 1.3828125, "learning_rate": 0.00030891057689310097, "loss": 4.9608, "mean_token_accuracy": 0.21435239166021347, "num_tokens": 101680738.0, "step": 58620 }, { "entropy": 5.950182008743286, "epoch": 4.561213771639759, "grad_norm": 1.5546875, "learning_rate": 0.0003088831776307616, "loss": 4.9857, "mean_token_accuracy": 0.2137000545859337, "num_tokens": 101688473.0, "step": 58625 }, { "entropy": 6.009902143478394, "epoch": 4.561602801011476, "grad_norm": 1.3828125, "learning_rate": 0.00030885577785429885, "loss": 5.0309, "mean_token_accuracy": 0.2093917101621628, "num_tokens": 101698129.0, "step": 58630 }, { "entropy": 5.942453670501709, "epoch": 4.561991830383194, "grad_norm": 1.4140625, "learning_rate": 0.0003088283775641286, "loss": 4.92, "mean_token_accuracy": 0.21736256182193756, "num_tokens": 101707096.0, "step": 58635 }, { "entropy": 5.981146049499512, "epoch": 4.562380859754912, "grad_norm": 1.3515625, "learning_rate": 0.00030880097676066646, "loss": 4.994, "mean_token_accuracy": 0.21264870315790177, "num_tokens": 101715173.0, "step": 58640 }, { "entropy": 5.9368593215942385, "epoch": 4.5627698891266295, "grad_norm": 1.4296875, "learning_rate": 0.0003087735754443285, "loss": 4.9945, "mean_token_accuracy": 0.2111407458782196, "num_tokens": 101723396.0, "step": 58645 }, { "entropy": 5.983474254608154, "epoch": 4.563158918498346, "grad_norm": 1.46875, "learning_rate": 0.0003087461736155301, "loss": 5.0161, "mean_token_accuracy": 0.21227810978889466, "num_tokens": 101732143.0, "step": 58650 }, { "entropy": 5.957684421539307, "epoch": 4.563547947870064, "grad_norm": 1.5, "learning_rate": 0.0003087187712746873, "loss": 4.9653, "mean_token_accuracy": 0.2161446198821068, "num_tokens": 101740769.0, "step": 58655 }, { "entropy": 5.8591326713562015, "epoch": 4.563936977241782, "grad_norm": 1.5, "learning_rate": 0.0003086913684222159, "loss": 4.9152, "mean_token_accuracy": 0.22071201652288436, "num_tokens": 101749518.0, "step": 58660 }, { "entropy": 5.964906787872314, "epoch": 4.564326006613499, "grad_norm": 1.46875, "learning_rate": 0.0003086639650585315, "loss": 4.9602, "mean_token_accuracy": 0.2245492309331894, "num_tokens": 101757891.0, "step": 58665 }, { "entropy": 5.954412221908569, "epoch": 4.564715035985217, "grad_norm": 1.4140625, "learning_rate": 0.00030863656118405007, "loss": 4.8801, "mean_token_accuracy": 0.21600429862737655, "num_tokens": 101766393.0, "step": 58670 }, { "entropy": 5.94890022277832, "epoch": 4.565104065356935, "grad_norm": 1.453125, "learning_rate": 0.00030860915679918724, "loss": 4.9703, "mean_token_accuracy": 0.21318492144346238, "num_tokens": 101774896.0, "step": 58675 }, { "entropy": 5.912567281723023, "epoch": 4.565493094728652, "grad_norm": 1.4296875, "learning_rate": 0.00030858175190435913, "loss": 4.9527, "mean_token_accuracy": 0.21803636401891707, "num_tokens": 101784175.0, "step": 58680 }, { "entropy": 5.929139471054077, "epoch": 4.565882124100369, "grad_norm": 1.296875, "learning_rate": 0.0003085543464999813, "loss": 4.9386, "mean_token_accuracy": 0.2167488992214203, "num_tokens": 101792960.0, "step": 58685 }, { "entropy": 5.950344800949097, "epoch": 4.566271153472087, "grad_norm": 1.4140625, "learning_rate": 0.0003085269405864697, "loss": 4.9511, "mean_token_accuracy": 0.21659803986549378, "num_tokens": 101801777.0, "step": 58690 }, { "entropy": 5.943732500076294, "epoch": 4.566660182843805, "grad_norm": 1.4375, "learning_rate": 0.0003084995341642401, "loss": 4.9764, "mean_token_accuracy": 0.21218783110380174, "num_tokens": 101810235.0, "step": 58695 }, { "entropy": 5.951359415054322, "epoch": 4.567049212215522, "grad_norm": 1.5625, "learning_rate": 0.0003084721272337084, "loss": 4.9982, "mean_token_accuracy": 0.20874246954917908, "num_tokens": 101818203.0, "step": 58700 }, { "entropy": 5.865972805023193, "epoch": 4.56743824158724, "grad_norm": 1.3671875, "learning_rate": 0.0003084447197952904, "loss": 4.8552, "mean_token_accuracy": 0.22032213509082793, "num_tokens": 101826438.0, "step": 58705 }, { "entropy": 5.992106819152832, "epoch": 4.567827270958958, "grad_norm": 1.421875, "learning_rate": 0.00030841731184940205, "loss": 5.0464, "mean_token_accuracy": 0.2079189494252205, "num_tokens": 101835133.0, "step": 58710 }, { "entropy": 5.928923892974853, "epoch": 4.568216300330675, "grad_norm": 1.4453125, "learning_rate": 0.00030838990339645915, "loss": 4.9076, "mean_token_accuracy": 0.219659623503685, "num_tokens": 101843539.0, "step": 58715 }, { "entropy": 5.92302827835083, "epoch": 4.568605329702392, "grad_norm": 1.484375, "learning_rate": 0.00030836249443687774, "loss": 4.9857, "mean_token_accuracy": 0.21148117631673813, "num_tokens": 101851469.0, "step": 58720 }, { "entropy": 5.93510684967041, "epoch": 4.56899435907411, "grad_norm": 1.484375, "learning_rate": 0.00030833508497107344, "loss": 5.0079, "mean_token_accuracy": 0.21083535254001617, "num_tokens": 101859346.0, "step": 58725 }, { "entropy": 5.960146522521972, "epoch": 4.569383388445828, "grad_norm": 1.5625, "learning_rate": 0.0003083076749994623, "loss": 4.9788, "mean_token_accuracy": 0.21525996625423433, "num_tokens": 101867574.0, "step": 58730 }, { "entropy": 5.915790319442749, "epoch": 4.569772417817545, "grad_norm": 1.421875, "learning_rate": 0.0003082802645224603, "loss": 5.0263, "mean_token_accuracy": 0.21086502969264984, "num_tokens": 101877147.0, "step": 58735 }, { "entropy": 5.910672283172607, "epoch": 4.570161447189263, "grad_norm": 1.4296875, "learning_rate": 0.0003082528535404832, "loss": 4.92, "mean_token_accuracy": 0.22247439175844191, "num_tokens": 101885486.0, "step": 58740 }, { "entropy": 5.967355728149414, "epoch": 4.57055047656098, "grad_norm": 1.390625, "learning_rate": 0.00030822544205394686, "loss": 5.0241, "mean_token_accuracy": 0.20442670434713364, "num_tokens": 101893651.0, "step": 58745 }, { "entropy": 5.93948221206665, "epoch": 4.570939505932698, "grad_norm": 1.34375, "learning_rate": 0.00030819803006326745, "loss": 4.9586, "mean_token_accuracy": 0.21547514647245408, "num_tokens": 101901709.0, "step": 58750 }, { "entropy": 5.971761322021484, "epoch": 4.571328535304415, "grad_norm": 1.5, "learning_rate": 0.00030817061756886077, "loss": 4.9178, "mean_token_accuracy": 0.22071709483861923, "num_tokens": 101909568.0, "step": 58755 }, { "entropy": 5.989965200424194, "epoch": 4.571717564676133, "grad_norm": 1.390625, "learning_rate": 0.00030814320457114283, "loss": 5.049, "mean_token_accuracy": 0.2139080986380577, "num_tokens": 101918269.0, "step": 58760 }, { "entropy": 5.924484205245972, "epoch": 4.572106594047851, "grad_norm": 1.375, "learning_rate": 0.00030811579107052937, "loss": 4.9454, "mean_token_accuracy": 0.20906743854284288, "num_tokens": 101926666.0, "step": 58765 }, { "entropy": 5.946925401687622, "epoch": 4.572495623419568, "grad_norm": 1.359375, "learning_rate": 0.00030808837706743666, "loss": 5.0573, "mean_token_accuracy": 0.20284990221261978, "num_tokens": 101936667.0, "step": 58770 }, { "entropy": 6.009098672866822, "epoch": 4.572884652791286, "grad_norm": 1.4296875, "learning_rate": 0.0003080609625622803, "loss": 4.9321, "mean_token_accuracy": 0.22043293863534927, "num_tokens": 101945909.0, "step": 58775 }, { "entropy": 5.96932282447815, "epoch": 4.573273682163004, "grad_norm": 1.453125, "learning_rate": 0.00030803354755547653, "loss": 5.0081, "mean_token_accuracy": 0.21502549946308136, "num_tokens": 101954511.0, "step": 58780 }, { "entropy": 5.976952362060547, "epoch": 4.573662711534721, "grad_norm": 1.5078125, "learning_rate": 0.0003080061320474412, "loss": 4.9905, "mean_token_accuracy": 0.2058105483651161, "num_tokens": 101962879.0, "step": 58785 }, { "entropy": 5.910180568695068, "epoch": 4.574051740906438, "grad_norm": 1.4453125, "learning_rate": 0.0003079787160385905, "loss": 4.8725, "mean_token_accuracy": 0.23114990890026094, "num_tokens": 101971778.0, "step": 58790 }, { "entropy": 5.998329830169678, "epoch": 4.574440770278156, "grad_norm": 1.4375, "learning_rate": 0.0003079512995293402, "loss": 5.0435, "mean_token_accuracy": 0.2102557361125946, "num_tokens": 101980483.0, "step": 58795 }, { "entropy": 5.93962779045105, "epoch": 4.574829799649874, "grad_norm": 1.4375, "learning_rate": 0.0003079238825201064, "loss": 4.9293, "mean_token_accuracy": 0.21602404862642288, "num_tokens": 101989715.0, "step": 58800 }, { "entropy": 5.929000329971314, "epoch": 4.575218829021591, "grad_norm": 1.40625, "learning_rate": 0.000307896465011305, "loss": 5.015, "mean_token_accuracy": 0.2163167729973793, "num_tokens": 101998296.0, "step": 58805 }, { "entropy": 5.96214451789856, "epoch": 4.575607858393309, "grad_norm": 1.4453125, "learning_rate": 0.00030786904700335217, "loss": 4.9869, "mean_token_accuracy": 0.2158162921667099, "num_tokens": 102006610.0, "step": 58810 }, { "entropy": 5.930808877944946, "epoch": 4.575996887765026, "grad_norm": 1.515625, "learning_rate": 0.0003078416284966639, "loss": 4.8665, "mean_token_accuracy": 0.22697226107120513, "num_tokens": 102014168.0, "step": 58815 }, { "entropy": 5.913540029525757, "epoch": 4.576385917136744, "grad_norm": 1.390625, "learning_rate": 0.00030781420949165607, "loss": 4.985, "mean_token_accuracy": 0.21210678964853286, "num_tokens": 102023292.0, "step": 58820 }, { "entropy": 5.976796007156372, "epoch": 4.576774946508461, "grad_norm": 1.375, "learning_rate": 0.00030778678998874494, "loss": 4.9979, "mean_token_accuracy": 0.2142992153763771, "num_tokens": 102032366.0, "step": 58825 }, { "entropy": 5.99838662147522, "epoch": 4.577163975880179, "grad_norm": 1.390625, "learning_rate": 0.0003077593699883465, "loss": 4.9733, "mean_token_accuracy": 0.2138890191912651, "num_tokens": 102040705.0, "step": 58830 }, { "entropy": 5.987545204162598, "epoch": 4.577553005251897, "grad_norm": 1.5859375, "learning_rate": 0.00030773194949087665, "loss": 4.9187, "mean_token_accuracy": 0.21598704606294633, "num_tokens": 102049691.0, "step": 58835 }, { "entropy": 6.008904314041137, "epoch": 4.577942034623614, "grad_norm": 1.34375, "learning_rate": 0.0003077045284967516, "loss": 5.051, "mean_token_accuracy": 0.20991770923137665, "num_tokens": 102058016.0, "step": 58840 }, { "entropy": 5.886815452575684, "epoch": 4.578331063995332, "grad_norm": 1.3828125, "learning_rate": 0.0003076771070063874, "loss": 4.9387, "mean_token_accuracy": 0.2133013591170311, "num_tokens": 102066814.0, "step": 58845 }, { "entropy": 6.04103422164917, "epoch": 4.578720093367049, "grad_norm": 1.515625, "learning_rate": 0.0003076496850202001, "loss": 5.1665, "mean_token_accuracy": 0.20664051473140715, "num_tokens": 102075255.0, "step": 58850 }, { "entropy": 6.011362791061401, "epoch": 4.579109122738767, "grad_norm": 1.5078125, "learning_rate": 0.00030762226253860584, "loss": 4.9568, "mean_token_accuracy": 0.21911944597959518, "num_tokens": 102083807.0, "step": 58855 }, { "entropy": 5.965685892105102, "epoch": 4.579498152110484, "grad_norm": 1.5859375, "learning_rate": 0.0003075948395620206, "loss": 4.991, "mean_token_accuracy": 0.21085403859615326, "num_tokens": 102093185.0, "step": 58860 }, { "entropy": 6.017434978485108, "epoch": 4.579887181482202, "grad_norm": 1.3671875, "learning_rate": 0.00030756741609086057, "loss": 5.0813, "mean_token_accuracy": 0.21438451409339904, "num_tokens": 102101841.0, "step": 58865 }, { "entropy": 5.954827499389649, "epoch": 4.58027621085392, "grad_norm": 1.4453125, "learning_rate": 0.00030753999212554183, "loss": 5.0078, "mean_token_accuracy": 0.21055535078048707, "num_tokens": 102111190.0, "step": 58870 }, { "entropy": 6.018886661529541, "epoch": 4.580665240225637, "grad_norm": 1.5390625, "learning_rate": 0.0003075125676664806, "loss": 5.0553, "mean_token_accuracy": 0.2144513726234436, "num_tokens": 102119870.0, "step": 58875 }, { "entropy": 5.96637864112854, "epoch": 4.581054269597354, "grad_norm": 1.4921875, "learning_rate": 0.0003074851427140928, "loss": 4.9354, "mean_token_accuracy": 0.21294522136449814, "num_tokens": 102129372.0, "step": 58880 }, { "entropy": 5.908979606628418, "epoch": 4.581443298969072, "grad_norm": 1.3984375, "learning_rate": 0.00030745771726879467, "loss": 4.9073, "mean_token_accuracy": 0.21978216022253036, "num_tokens": 102137488.0, "step": 58885 }, { "entropy": 5.921315383911133, "epoch": 4.58183232834079, "grad_norm": 1.328125, "learning_rate": 0.0003074302913310024, "loss": 5.0251, "mean_token_accuracy": 0.2060428589582443, "num_tokens": 102146245.0, "step": 58890 }, { "entropy": 5.924926662445069, "epoch": 4.582221357712507, "grad_norm": 1.4765625, "learning_rate": 0.000307402864901132, "loss": 4.9215, "mean_token_accuracy": 0.2214808776974678, "num_tokens": 102154950.0, "step": 58895 }, { "entropy": 5.949667119979859, "epoch": 4.582610387084225, "grad_norm": 1.53125, "learning_rate": 0.0003073754379795998, "loss": 5.0362, "mean_token_accuracy": 0.21295692026615143, "num_tokens": 102163887.0, "step": 58900 }, { "entropy": 5.973671627044678, "epoch": 4.582999416455943, "grad_norm": 1.3359375, "learning_rate": 0.00030734801056682176, "loss": 5.0629, "mean_token_accuracy": 0.20917702168226243, "num_tokens": 102172864.0, "step": 58905 }, { "entropy": 5.946758460998535, "epoch": 4.58338844582766, "grad_norm": 1.4375, "learning_rate": 0.00030732058266321415, "loss": 4.9094, "mean_token_accuracy": 0.22059286683797835, "num_tokens": 102181167.0, "step": 58910 }, { "entropy": 5.96749792098999, "epoch": 4.583777475199377, "grad_norm": 1.6015625, "learning_rate": 0.0003072931542691932, "loss": 5.0316, "mean_token_accuracy": 0.21100189089775084, "num_tokens": 102189801.0, "step": 58915 }, { "entropy": 5.966647529602051, "epoch": 4.584166504571095, "grad_norm": 1.3828125, "learning_rate": 0.000307265725385175, "loss": 4.9412, "mean_token_accuracy": 0.2219487875699997, "num_tokens": 102198477.0, "step": 58920 }, { "entropy": 5.97558364868164, "epoch": 4.584555533942813, "grad_norm": 1.46875, "learning_rate": 0.0003072382960115758, "loss": 4.9457, "mean_token_accuracy": 0.21573416143655777, "num_tokens": 102207763.0, "step": 58925 }, { "entropy": 6.023884677886963, "epoch": 4.58494456331453, "grad_norm": 1.484375, "learning_rate": 0.00030721086614881183, "loss": 4.9926, "mean_token_accuracy": 0.214885114133358, "num_tokens": 102216143.0, "step": 58930 }, { "entropy": 5.955588150024414, "epoch": 4.585333592686248, "grad_norm": 1.4375, "learning_rate": 0.0003071834357972991, "loss": 4.9987, "mean_token_accuracy": 0.21656915545463562, "num_tokens": 102225127.0, "step": 58935 }, { "entropy": 5.909287405014038, "epoch": 4.585722622057966, "grad_norm": 1.4609375, "learning_rate": 0.000307156004957454, "loss": 4.9061, "mean_token_accuracy": 0.21914063394069672, "num_tokens": 102234210.0, "step": 58940 }, { "entropy": 5.895959711074829, "epoch": 4.5861116514296825, "grad_norm": 1.515625, "learning_rate": 0.0003071285736296928, "loss": 4.8759, "mean_token_accuracy": 0.2168147772550583, "num_tokens": 102242382.0, "step": 58945 }, { "entropy": 5.864328336715698, "epoch": 4.5865006808014, "grad_norm": 1.40625, "learning_rate": 0.0003071011418144315, "loss": 4.9262, "mean_token_accuracy": 0.21552136689424514, "num_tokens": 102251426.0, "step": 58950 }, { "entropy": 5.98614182472229, "epoch": 4.586889710173118, "grad_norm": 1.375, "learning_rate": 0.00030707370951208655, "loss": 5.0462, "mean_token_accuracy": 0.2112046629190445, "num_tokens": 102260246.0, "step": 58955 }, { "entropy": 6.004589509963989, "epoch": 4.587278739544836, "grad_norm": 1.3984375, "learning_rate": 0.0003070462767230741, "loss": 4.9955, "mean_token_accuracy": 0.2119741529226303, "num_tokens": 102268804.0, "step": 58960 }, { "entropy": 5.917537117004395, "epoch": 4.587667768916553, "grad_norm": 1.3984375, "learning_rate": 0.0003070188434478104, "loss": 4.8566, "mean_token_accuracy": 0.2214253842830658, "num_tokens": 102277188.0, "step": 58965 }, { "entropy": 5.981005239486694, "epoch": 4.588056798288271, "grad_norm": 1.390625, "learning_rate": 0.0003069914096867117, "loss": 5.0414, "mean_token_accuracy": 0.21086664795875548, "num_tokens": 102286192.0, "step": 58970 }, { "entropy": 5.957050085067749, "epoch": 4.588445827659989, "grad_norm": 1.3984375, "learning_rate": 0.0003069639754401942, "loss": 5.0144, "mean_token_accuracy": 0.21152419000864028, "num_tokens": 102294687.0, "step": 58975 }, { "entropy": 5.8860499382019045, "epoch": 4.588834857031706, "grad_norm": 1.4453125, "learning_rate": 0.0003069365407086744, "loss": 4.9552, "mean_token_accuracy": 0.20674492716789244, "num_tokens": 102303490.0, "step": 58980 }, { "entropy": 6.054447841644287, "epoch": 4.589223886403423, "grad_norm": 1.359375, "learning_rate": 0.00030690910549256836, "loss": 5.1261, "mean_token_accuracy": 0.19932192265987397, "num_tokens": 102311993.0, "step": 58985 }, { "entropy": 6.030044507980347, "epoch": 4.589612915775141, "grad_norm": 1.375, "learning_rate": 0.0003068816697922925, "loss": 4.9929, "mean_token_accuracy": 0.2106467977166176, "num_tokens": 102320544.0, "step": 58990 }, { "entropy": 5.97399320602417, "epoch": 4.5900019451468586, "grad_norm": 1.375, "learning_rate": 0.0003068542336082629, "loss": 5.0269, "mean_token_accuracy": 0.20406902432441712, "num_tokens": 102329192.0, "step": 58995 }, { "entropy": 5.9314109802246096, "epoch": 4.590390974518576, "grad_norm": 1.3984375, "learning_rate": 0.00030682679694089615, "loss": 4.9813, "mean_token_accuracy": 0.21335501372814178, "num_tokens": 102338146.0, "step": 59000 }, { "entropy": 5.908329677581787, "epoch": 4.590780003890294, "grad_norm": 1.6640625, "learning_rate": 0.0003067993597906083, "loss": 5.0343, "mean_token_accuracy": 0.2059118077158928, "num_tokens": 102346883.0, "step": 59005 }, { "entropy": 5.98775086402893, "epoch": 4.591169033262012, "grad_norm": 1.484375, "learning_rate": 0.0003067719221578158, "loss": 5.0255, "mean_token_accuracy": 0.21922040432691575, "num_tokens": 102355796.0, "step": 59010 }, { "entropy": 6.005100345611572, "epoch": 4.5915580626337285, "grad_norm": 1.5, "learning_rate": 0.000306744484042935, "loss": 4.9482, "mean_token_accuracy": 0.2193056657910347, "num_tokens": 102364680.0, "step": 59015 }, { "entropy": 6.015369558334351, "epoch": 4.591947092005446, "grad_norm": 1.40625, "learning_rate": 0.0003067170454463822, "loss": 5.0604, "mean_token_accuracy": 0.21222323477268218, "num_tokens": 102373218.0, "step": 59020 }, { "entropy": 5.991926383972168, "epoch": 4.592336121377164, "grad_norm": 1.4609375, "learning_rate": 0.00030668960636857364, "loss": 5.0433, "mean_token_accuracy": 0.21496972143650056, "num_tokens": 102381839.0, "step": 59025 }, { "entropy": 6.023768758773803, "epoch": 4.5927251507488815, "grad_norm": 1.609375, "learning_rate": 0.0003066621668099258, "loss": 5.0982, "mean_token_accuracy": 0.20862198621034622, "num_tokens": 102390796.0, "step": 59030 }, { "entropy": 5.982073497772217, "epoch": 4.593114180120599, "grad_norm": 1.359375, "learning_rate": 0.00030663472677085494, "loss": 4.9361, "mean_token_accuracy": 0.21581994891166686, "num_tokens": 102399342.0, "step": 59035 }, { "entropy": 5.978408575057983, "epoch": 4.593503209492317, "grad_norm": 1.421875, "learning_rate": 0.00030660728625177746, "loss": 4.9343, "mean_token_accuracy": 0.2189146488904953, "num_tokens": 102408075.0, "step": 59040 }, { "entropy": 5.935489082336426, "epoch": 4.593892238864035, "grad_norm": 1.421875, "learning_rate": 0.0003065798452531097, "loss": 4.9509, "mean_token_accuracy": 0.2179875984787941, "num_tokens": 102416484.0, "step": 59045 }, { "entropy": 5.981276273727417, "epoch": 4.5942812682357514, "grad_norm": 1.4296875, "learning_rate": 0.00030655240377526813, "loss": 5.0497, "mean_token_accuracy": 0.20332966446876527, "num_tokens": 102424545.0, "step": 59050 }, { "entropy": 5.968435192108155, "epoch": 4.594670297607469, "grad_norm": 1.515625, "learning_rate": 0.000306524961818669, "loss": 5.0453, "mean_token_accuracy": 0.21243750751018525, "num_tokens": 102433019.0, "step": 59055 }, { "entropy": 5.886138534545898, "epoch": 4.595059326979187, "grad_norm": 1.4609375, "learning_rate": 0.0003064975193837287, "loss": 4.8677, "mean_token_accuracy": 0.21428215205669404, "num_tokens": 102441350.0, "step": 59060 }, { "entropy": 5.992455196380615, "epoch": 4.5954483563509045, "grad_norm": 1.3515625, "learning_rate": 0.0003064700764708638, "loss": 5.0358, "mean_token_accuracy": 0.21895599216222764, "num_tokens": 102449759.0, "step": 59065 }, { "entropy": 5.935897016525269, "epoch": 4.595837385722622, "grad_norm": 1.484375, "learning_rate": 0.00030644263308049046, "loss": 4.8599, "mean_token_accuracy": 0.22000134289264678, "num_tokens": 102457755.0, "step": 59070 }, { "entropy": 5.939029788970947, "epoch": 4.59622641509434, "grad_norm": 1.3828125, "learning_rate": 0.0003064151892130252, "loss": 4.935, "mean_token_accuracy": 0.22259055972099304, "num_tokens": 102466986.0, "step": 59075 }, { "entropy": 5.913162612915039, "epoch": 4.596615444466057, "grad_norm": 1.3984375, "learning_rate": 0.0003063877448688846, "loss": 4.9882, "mean_token_accuracy": 0.2092021018266678, "num_tokens": 102475625.0, "step": 59080 }, { "entropy": 5.970071315765381, "epoch": 4.597004473837774, "grad_norm": 1.390625, "learning_rate": 0.0003063603000484848, "loss": 4.9949, "mean_token_accuracy": 0.20898510366678238, "num_tokens": 102484365.0, "step": 59085 }, { "entropy": 5.9684759140014645, "epoch": 4.597393503209492, "grad_norm": 1.453125, "learning_rate": 0.00030633285475224244, "loss": 5.0358, "mean_token_accuracy": 0.2080918163061142, "num_tokens": 102492948.0, "step": 59090 }, { "entropy": 5.946693992614746, "epoch": 4.59778253258121, "grad_norm": 1.4140625, "learning_rate": 0.00030630540898057384, "loss": 4.9242, "mean_token_accuracy": 0.21360691040754318, "num_tokens": 102501250.0, "step": 59095 }, { "entropy": 5.909185552597046, "epoch": 4.5981715619529275, "grad_norm": 1.4140625, "learning_rate": 0.00030627796273389546, "loss": 4.969, "mean_token_accuracy": 0.20937100797891617, "num_tokens": 102510258.0, "step": 59100 }, { "entropy": 5.893084001541138, "epoch": 4.598560591324645, "grad_norm": 1.4609375, "learning_rate": 0.00030625051601262384, "loss": 4.9815, "mean_token_accuracy": 0.21534937471151352, "num_tokens": 102518600.0, "step": 59105 }, { "entropy": 5.990673208236695, "epoch": 4.598949620696363, "grad_norm": 1.4453125, "learning_rate": 0.0003062230688171753, "loss": 5.0295, "mean_token_accuracy": 0.2044035792350769, "num_tokens": 102526690.0, "step": 59110 }, { "entropy": 5.962455177307129, "epoch": 4.599338650068081, "grad_norm": 1.3828125, "learning_rate": 0.0003061956211479665, "loss": 4.9554, "mean_token_accuracy": 0.21708112359046935, "num_tokens": 102535896.0, "step": 59115 }, { "entropy": 5.98532133102417, "epoch": 4.599727679439797, "grad_norm": 1.390625, "learning_rate": 0.0003061681730054137, "loss": 5.0638, "mean_token_accuracy": 0.19663383662700654, "num_tokens": 102544442.0, "step": 59120 }, { "entropy": 5.938311576843262, "epoch": 4.600116708811515, "grad_norm": 1.484375, "learning_rate": 0.0003061407243899335, "loss": 4.9143, "mean_token_accuracy": 0.21889810562133788, "num_tokens": 102552611.0, "step": 59125 }, { "entropy": 5.9978663444519045, "epoch": 4.600505738183233, "grad_norm": 1.4765625, "learning_rate": 0.00030611327530194243, "loss": 5.018, "mean_token_accuracy": 0.20889406502246857, "num_tokens": 102561009.0, "step": 59130 }, { "entropy": 5.943119049072266, "epoch": 4.6008947675549505, "grad_norm": 1.3515625, "learning_rate": 0.0003060858257418569, "loss": 5.0249, "mean_token_accuracy": 0.2078838512301445, "num_tokens": 102571001.0, "step": 59135 }, { "entropy": 5.924479007720947, "epoch": 4.601283796926668, "grad_norm": 1.4453125, "learning_rate": 0.0003060583757100934, "loss": 4.9225, "mean_token_accuracy": 0.22280605882406235, "num_tokens": 102579569.0, "step": 59140 }, { "entropy": 6.034378862380981, "epoch": 4.601672826298385, "grad_norm": 1.515625, "learning_rate": 0.0003060309252070685, "loss": 5.1273, "mean_token_accuracy": 0.20755570530891418, "num_tokens": 102589120.0, "step": 59145 }, { "entropy": 5.96711049079895, "epoch": 4.602061855670103, "grad_norm": 1.3671875, "learning_rate": 0.0003060034742331987, "loss": 5.0506, "mean_token_accuracy": 0.20910661071538925, "num_tokens": 102598708.0, "step": 59150 }, { "entropy": 6.024827241897583, "epoch": 4.60245088504182, "grad_norm": 1.4296875, "learning_rate": 0.0003059760227889006, "loss": 5.0815, "mean_token_accuracy": 0.20881217420101167, "num_tokens": 102607053.0, "step": 59155 }, { "entropy": 5.860289096832275, "epoch": 4.602839914413538, "grad_norm": 1.40625, "learning_rate": 0.0003059485708745906, "loss": 4.8367, "mean_token_accuracy": 0.22376374155282974, "num_tokens": 102615438.0, "step": 59160 }, { "entropy": 6.0010453224182125, "epoch": 4.603228943785256, "grad_norm": 1.4296875, "learning_rate": 0.0003059211184906853, "loss": 5.0177, "mean_token_accuracy": 0.20886463671922684, "num_tokens": 102623989.0, "step": 59165 }, { "entropy": 5.927425861358643, "epoch": 4.6036179731569735, "grad_norm": 1.34375, "learning_rate": 0.00030589366563760125, "loss": 4.9463, "mean_token_accuracy": 0.2121858224272728, "num_tokens": 102633180.0, "step": 59170 }, { "entropy": 5.92069263458252, "epoch": 4.604007002528691, "grad_norm": 1.4453125, "learning_rate": 0.00030586621231575494, "loss": 4.9244, "mean_token_accuracy": 0.22083283513784407, "num_tokens": 102642376.0, "step": 59175 }, { "entropy": 5.9898717403411865, "epoch": 4.604396031900409, "grad_norm": 1.5234375, "learning_rate": 0.000305838758525563, "loss": 5.0214, "mean_token_accuracy": 0.20649200081825256, "num_tokens": 102651347.0, "step": 59180 }, { "entropy": 5.918342065811157, "epoch": 4.604785061272126, "grad_norm": 1.4609375, "learning_rate": 0.0003058113042674421, "loss": 4.9447, "mean_token_accuracy": 0.22265535145998, "num_tokens": 102659921.0, "step": 59185 }, { "entropy": 5.990040826797485, "epoch": 4.605174090643843, "grad_norm": 1.4140625, "learning_rate": 0.00030578384954180866, "loss": 5.0274, "mean_token_accuracy": 0.20443608611822128, "num_tokens": 102668251.0, "step": 59190 }, { "entropy": 6.000902986526489, "epoch": 4.605563120015561, "grad_norm": 1.359375, "learning_rate": 0.0003057563943490792, "loss": 5.0722, "mean_token_accuracy": 0.20436132848262786, "num_tokens": 102676858.0, "step": 59195 }, { "entropy": 5.973453426361084, "epoch": 4.605952149387279, "grad_norm": 1.421875, "learning_rate": 0.00030572893868967044, "loss": 4.962, "mean_token_accuracy": 0.2142004609107971, "num_tokens": 102685283.0, "step": 59200 }, { "entropy": 6.042931365966797, "epoch": 4.6063411787589965, "grad_norm": 1.578125, "learning_rate": 0.000305701482563999, "loss": 5.0577, "mean_token_accuracy": 0.20779280811548234, "num_tokens": 102693500.0, "step": 59205 }, { "entropy": 5.941933441162109, "epoch": 4.606730208130714, "grad_norm": 1.4296875, "learning_rate": 0.0003056740259724814, "loss": 4.9521, "mean_token_accuracy": 0.22178158909082413, "num_tokens": 102702189.0, "step": 59210 }, { "entropy": 5.953090238571167, "epoch": 4.607119237502431, "grad_norm": 1.546875, "learning_rate": 0.0003056465689155342, "loss": 5.025, "mean_token_accuracy": 0.21322276890277864, "num_tokens": 102711808.0, "step": 59215 }, { "entropy": 5.957609462738037, "epoch": 4.607508266874149, "grad_norm": 1.34375, "learning_rate": 0.00030561911139357424, "loss": 5.034, "mean_token_accuracy": 0.20782601237297058, "num_tokens": 102720389.0, "step": 59220 }, { "entropy": 5.904064035415649, "epoch": 4.607897296245866, "grad_norm": 1.3984375, "learning_rate": 0.00030559165340701797, "loss": 4.8163, "mean_token_accuracy": 0.2218530982732773, "num_tokens": 102728696.0, "step": 59225 }, { "entropy": 5.966795253753662, "epoch": 4.608286325617584, "grad_norm": 1.359375, "learning_rate": 0.000305564194956282, "loss": 5.0477, "mean_token_accuracy": 0.20276754796504975, "num_tokens": 102737552.0, "step": 59230 }, { "entropy": 5.917603492736816, "epoch": 4.608675354989302, "grad_norm": 1.5546875, "learning_rate": 0.00030553673604178305, "loss": 4.9305, "mean_token_accuracy": 0.21193026304244994, "num_tokens": 102746263.0, "step": 59235 }, { "entropy": 5.940702486038208, "epoch": 4.6090643843610195, "grad_norm": 1.5546875, "learning_rate": 0.00030550927666393767, "loss": 5.0344, "mean_token_accuracy": 0.20888848453760148, "num_tokens": 102754774.0, "step": 59240 }, { "entropy": 5.943389415740967, "epoch": 4.609453413732737, "grad_norm": 1.46875, "learning_rate": 0.00030548181682316263, "loss": 4.8567, "mean_token_accuracy": 0.2195924311876297, "num_tokens": 102763049.0, "step": 59245 }, { "entropy": 5.930915307998657, "epoch": 4.609842443104454, "grad_norm": 1.421875, "learning_rate": 0.00030545435651987453, "loss": 4.9576, "mean_token_accuracy": 0.21346021294593812, "num_tokens": 102771995.0, "step": 59250 }, { "entropy": 5.893159675598144, "epoch": 4.610231472476172, "grad_norm": 1.5, "learning_rate": 0.0003054268957544901, "loss": 4.9813, "mean_token_accuracy": 0.20838552564382554, "num_tokens": 102780336.0, "step": 59255 }, { "entropy": 5.969234418869019, "epoch": 4.610620501847889, "grad_norm": 1.375, "learning_rate": 0.00030539943452742585, "loss": 5.0224, "mean_token_accuracy": 0.21511559188365936, "num_tokens": 102788881.0, "step": 59260 }, { "entropy": 5.94543719291687, "epoch": 4.611009531219607, "grad_norm": 1.3984375, "learning_rate": 0.00030537197283909875, "loss": 4.9053, "mean_token_accuracy": 0.2175610989332199, "num_tokens": 102797514.0, "step": 59265 }, { "entropy": 5.940406084060669, "epoch": 4.611398560591325, "grad_norm": 1.4296875, "learning_rate": 0.00030534451068992506, "loss": 5.0422, "mean_token_accuracy": 0.21846988946199417, "num_tokens": 102805567.0, "step": 59270 }, { "entropy": 5.91773247718811, "epoch": 4.6117875899630425, "grad_norm": 1.4765625, "learning_rate": 0.00030531704808032183, "loss": 4.9767, "mean_token_accuracy": 0.21391172409057618, "num_tokens": 102814073.0, "step": 59275 }, { "entropy": 5.89242639541626, "epoch": 4.612176619334759, "grad_norm": 1.3828125, "learning_rate": 0.0003052895850107057, "loss": 4.8341, "mean_token_accuracy": 0.22623540610074996, "num_tokens": 102822787.0, "step": 59280 }, { "entropy": 5.890420532226562, "epoch": 4.612565648706477, "grad_norm": 1.3203125, "learning_rate": 0.00030526212148149326, "loss": 4.8611, "mean_token_accuracy": 0.2226916655898094, "num_tokens": 102831411.0, "step": 59285 }, { "entropy": 5.938187980651856, "epoch": 4.612954678078195, "grad_norm": 1.3828125, "learning_rate": 0.0003052346574931013, "loss": 4.9602, "mean_token_accuracy": 0.2177382379770279, "num_tokens": 102839608.0, "step": 59290 }, { "entropy": 5.8607666015625, "epoch": 4.613343707449912, "grad_norm": 1.3984375, "learning_rate": 0.0003052071930459465, "loss": 4.9028, "mean_token_accuracy": 0.21924732774496078, "num_tokens": 102848335.0, "step": 59295 }, { "entropy": 5.938835525512696, "epoch": 4.61373273682163, "grad_norm": 1.2421875, "learning_rate": 0.0003051797281404457, "loss": 4.9101, "mean_token_accuracy": 0.21824652701616287, "num_tokens": 102857376.0, "step": 59300 }, { "entropy": 6.000780773162842, "epoch": 4.614121766193348, "grad_norm": 1.40625, "learning_rate": 0.00030515226277701553, "loss": 5.0123, "mean_token_accuracy": 0.2085227370262146, "num_tokens": 102865832.0, "step": 59305 }, { "entropy": 6.012026023864746, "epoch": 4.6145107955650655, "grad_norm": 1.4296875, "learning_rate": 0.0003051247969560728, "loss": 5.0498, "mean_token_accuracy": 0.21119601428508758, "num_tokens": 102874555.0, "step": 59310 }, { "entropy": 5.930571174621582, "epoch": 4.614899824936783, "grad_norm": 1.4296875, "learning_rate": 0.0003050973306780342, "loss": 4.9693, "mean_token_accuracy": 0.21370158344507217, "num_tokens": 102883325.0, "step": 59315 }, { "entropy": 5.957516431808472, "epoch": 4.6152888543085, "grad_norm": 1.4140625, "learning_rate": 0.00030506986394331656, "loss": 5.0707, "mean_token_accuracy": 0.20858072638511657, "num_tokens": 102892712.0, "step": 59320 }, { "entropy": 5.91046109199524, "epoch": 4.615677883680218, "grad_norm": 1.4375, "learning_rate": 0.00030504239675233655, "loss": 4.9482, "mean_token_accuracy": 0.2140487924218178, "num_tokens": 102901502.0, "step": 59325 }, { "entropy": 5.984750461578369, "epoch": 4.616066913051935, "grad_norm": 1.3828125, "learning_rate": 0.00030501492910551094, "loss": 4.9704, "mean_token_accuracy": 0.21568020433187485, "num_tokens": 102910531.0, "step": 59330 }, { "entropy": 5.885979461669922, "epoch": 4.616455942423653, "grad_norm": 1.453125, "learning_rate": 0.00030498746100325656, "loss": 4.8733, "mean_token_accuracy": 0.23082284182310103, "num_tokens": 102919884.0, "step": 59335 }, { "entropy": 5.987094068527222, "epoch": 4.616844971795371, "grad_norm": 1.484375, "learning_rate": 0.0003049599924459903, "loss": 4.9749, "mean_token_accuracy": 0.21598953306674956, "num_tokens": 102928003.0, "step": 59340 }, { "entropy": 5.972020435333252, "epoch": 4.6172340011670885, "grad_norm": 1.546875, "learning_rate": 0.0003049325234341287, "loss": 4.979, "mean_token_accuracy": 0.21572611033916472, "num_tokens": 102936624.0, "step": 59345 }, { "entropy": 5.936128759384156, "epoch": 4.617623030538805, "grad_norm": 1.3515625, "learning_rate": 0.00030490505396808874, "loss": 5.0233, "mean_token_accuracy": 0.21933944821357726, "num_tokens": 102945696.0, "step": 59350 }, { "entropy": 5.960077905654908, "epoch": 4.618012059910523, "grad_norm": 1.4609375, "learning_rate": 0.0003048775840482873, "loss": 4.9586, "mean_token_accuracy": 0.21459437012672425, "num_tokens": 102953472.0, "step": 59355 }, { "entropy": 5.999762105941772, "epoch": 4.618401089282241, "grad_norm": 1.4296875, "learning_rate": 0.000304850113675141, "loss": 5.0998, "mean_token_accuracy": 0.21144948154687881, "num_tokens": 102962445.0, "step": 59360 }, { "entropy": 5.943924903869629, "epoch": 4.618790118653958, "grad_norm": 1.5078125, "learning_rate": 0.0003048226428490666, "loss": 4.9255, "mean_token_accuracy": 0.21812967509031295, "num_tokens": 102971223.0, "step": 59365 }, { "entropy": 5.895195245742798, "epoch": 4.619179148025676, "grad_norm": 1.3828125, "learning_rate": 0.00030479517157048125, "loss": 4.8599, "mean_token_accuracy": 0.22359820157289506, "num_tokens": 102979794.0, "step": 59370 }, { "entropy": 5.9199432849884035, "epoch": 4.619568177397394, "grad_norm": 1.5, "learning_rate": 0.0003047676998398015, "loss": 4.9437, "mean_token_accuracy": 0.21787693798542024, "num_tokens": 102989013.0, "step": 59375 }, { "entropy": 5.978321552276611, "epoch": 4.6199572067691115, "grad_norm": 1.5234375, "learning_rate": 0.00030474022765744434, "loss": 5.0038, "mean_token_accuracy": 0.21596390008926392, "num_tokens": 102998050.0, "step": 59380 }, { "entropy": 5.937510919570923, "epoch": 4.620346236140828, "grad_norm": 1.4140625, "learning_rate": 0.00030471275502382656, "loss": 4.8803, "mean_token_accuracy": 0.2216783732175827, "num_tokens": 103005999.0, "step": 59385 }, { "entropy": 5.933714771270752, "epoch": 4.620735265512546, "grad_norm": 1.390625, "learning_rate": 0.000304685281939365, "loss": 4.8874, "mean_token_accuracy": 0.21822693049907685, "num_tokens": 103014217.0, "step": 59390 }, { "entropy": 5.9223555564880375, "epoch": 4.621124294884264, "grad_norm": 1.3671875, "learning_rate": 0.0003046578084044765, "loss": 5.0237, "mean_token_accuracy": 0.21587464958429337, "num_tokens": 103023649.0, "step": 59395 }, { "entropy": 5.914524030685425, "epoch": 4.621513324255981, "grad_norm": 1.3359375, "learning_rate": 0.000304630334419578, "loss": 4.9528, "mean_token_accuracy": 0.21503783166408538, "num_tokens": 103032743.0, "step": 59400 }, { "entropy": 5.942310762405396, "epoch": 4.621902353627699, "grad_norm": 1.3828125, "learning_rate": 0.0003046028599850863, "loss": 4.974, "mean_token_accuracy": 0.21579717248678207, "num_tokens": 103041185.0, "step": 59405 }, { "entropy": 5.938474941253662, "epoch": 4.622291382999417, "grad_norm": 1.4375, "learning_rate": 0.0003045753851014184, "loss": 4.984, "mean_token_accuracy": 0.21446997970342635, "num_tokens": 103049893.0, "step": 59410 }, { "entropy": 5.961822271347046, "epoch": 4.622680412371134, "grad_norm": 1.421875, "learning_rate": 0.00030454790976899105, "loss": 4.9863, "mean_token_accuracy": 0.21533093303442002, "num_tokens": 103058598.0, "step": 59415 }, { "entropy": 5.899148893356323, "epoch": 4.623069441742851, "grad_norm": 1.5390625, "learning_rate": 0.0003045204339882212, "loss": 4.843, "mean_token_accuracy": 0.22821187525987624, "num_tokens": 103067089.0, "step": 59420 }, { "entropy": 5.9310156345367435, "epoch": 4.623458471114569, "grad_norm": 1.4453125, "learning_rate": 0.0003044929577595257, "loss": 4.9402, "mean_token_accuracy": 0.21629907935857773, "num_tokens": 103075304.0, "step": 59425 }, { "entropy": 5.971226167678833, "epoch": 4.623847500486287, "grad_norm": 1.421875, "learning_rate": 0.00030446548108332164, "loss": 5.0252, "mean_token_accuracy": 0.20771866738796235, "num_tokens": 103083303.0, "step": 59430 }, { "entropy": 5.906799983978272, "epoch": 4.624236529858004, "grad_norm": 1.421875, "learning_rate": 0.00030443800396002575, "loss": 4.8451, "mean_token_accuracy": 0.2362408608198166, "num_tokens": 103092285.0, "step": 59435 }, { "entropy": 5.985685968399048, "epoch": 4.624625559229722, "grad_norm": 1.5625, "learning_rate": 0.0003044105263900549, "loss": 5.004, "mean_token_accuracy": 0.21162452697753906, "num_tokens": 103101807.0, "step": 59440 }, { "entropy": 5.922775745391846, "epoch": 4.62501458860144, "grad_norm": 1.4296875, "learning_rate": 0.0003043830483738262, "loss": 4.9529, "mean_token_accuracy": 0.21218038052320481, "num_tokens": 103110317.0, "step": 59445 }, { "entropy": 5.83160924911499, "epoch": 4.6254036179731575, "grad_norm": 1.4453125, "learning_rate": 0.0003043555699117565, "loss": 4.8175, "mean_token_accuracy": 0.22202649861574172, "num_tokens": 103118861.0, "step": 59450 }, { "entropy": 5.901962471008301, "epoch": 4.625792647344874, "grad_norm": 1.4765625, "learning_rate": 0.00030432809100426286, "loss": 4.9358, "mean_token_accuracy": 0.21301253288984298, "num_tokens": 103126817.0, "step": 59455 }, { "entropy": 5.96149845123291, "epoch": 4.626181676716592, "grad_norm": 1.484375, "learning_rate": 0.0003043006116517619, "loss": 5.0349, "mean_token_accuracy": 0.2121929258108139, "num_tokens": 103135619.0, "step": 59460 }, { "entropy": 5.869906568527222, "epoch": 4.62657070608831, "grad_norm": 1.4765625, "learning_rate": 0.00030427313185467104, "loss": 4.8541, "mean_token_accuracy": 0.22311229556798934, "num_tokens": 103143877.0, "step": 59465 }, { "entropy": 5.902308416366577, "epoch": 4.626959735460027, "grad_norm": 1.359375, "learning_rate": 0.0003042456516134068, "loss": 4.829, "mean_token_accuracy": 0.22154193818569184, "num_tokens": 103152933.0, "step": 59470 }, { "entropy": 5.90068211555481, "epoch": 4.627348764831745, "grad_norm": 1.4921875, "learning_rate": 0.00030421817092838644, "loss": 4.9103, "mean_token_accuracy": 0.21987145096063615, "num_tokens": 103161755.0, "step": 59475 }, { "entropy": 5.968494844436646, "epoch": 4.627737794203462, "grad_norm": 1.3359375, "learning_rate": 0.0003041906898000268, "loss": 4.9376, "mean_token_accuracy": 0.2122408464550972, "num_tokens": 103170613.0, "step": 59480 }, { "entropy": 5.940574359893799, "epoch": 4.62812682357518, "grad_norm": 1.484375, "learning_rate": 0.0003041632082287449, "loss": 4.8963, "mean_token_accuracy": 0.2222209542989731, "num_tokens": 103178571.0, "step": 59485 }, { "entropy": 5.875456762313843, "epoch": 4.628515852946897, "grad_norm": 1.4609375, "learning_rate": 0.0003041357262149577, "loss": 4.9072, "mean_token_accuracy": 0.22155694514513016, "num_tokens": 103186879.0, "step": 59490 }, { "entropy": 5.945737504959107, "epoch": 4.628904882318615, "grad_norm": 1.3984375, "learning_rate": 0.0003041082437590824, "loss": 4.9547, "mean_token_accuracy": 0.21766619831323625, "num_tokens": 103195090.0, "step": 59495 }, { "entropy": 5.932640647888183, "epoch": 4.629293911690333, "grad_norm": 1.390625, "learning_rate": 0.00030408076086153575, "loss": 4.93, "mean_token_accuracy": 0.21464783996343612, "num_tokens": 103204349.0, "step": 59500 }, { "entropy": 5.969381618499756, "epoch": 4.62968294106205, "grad_norm": 1.5, "learning_rate": 0.0003040532775227347, "loss": 5.0025, "mean_token_accuracy": 0.2150615081191063, "num_tokens": 103212561.0, "step": 59505 }, { "entropy": 5.927111339569092, "epoch": 4.630071970433768, "grad_norm": 1.625, "learning_rate": 0.00030402579374309656, "loss": 4.9477, "mean_token_accuracy": 0.2138621225953102, "num_tokens": 103220876.0, "step": 59510 }, { "entropy": 5.9726580619812015, "epoch": 4.630460999805486, "grad_norm": 1.53125, "learning_rate": 0.00030399830952303815, "loss": 4.9958, "mean_token_accuracy": 0.2135028839111328, "num_tokens": 103229614.0, "step": 59515 }, { "entropy": 5.955676889419555, "epoch": 4.630850029177203, "grad_norm": 1.4765625, "learning_rate": 0.00030397082486297657, "loss": 4.9329, "mean_token_accuracy": 0.2159489393234253, "num_tokens": 103238092.0, "step": 59520 }, { "entropy": 5.966749954223633, "epoch": 4.63123905854892, "grad_norm": 1.4375, "learning_rate": 0.0003039433397633288, "loss": 5.0117, "mean_token_accuracy": 0.21646805703639985, "num_tokens": 103247146.0, "step": 59525 }, { "entropy": 5.902210998535156, "epoch": 4.631628087920638, "grad_norm": 1.390625, "learning_rate": 0.00030391585422451196, "loss": 4.8324, "mean_token_accuracy": 0.22386206835508346, "num_tokens": 103255718.0, "step": 59530 }, { "entropy": 5.959663677215576, "epoch": 4.632017117292356, "grad_norm": 1.4609375, "learning_rate": 0.00030388836824694307, "loss": 5.014, "mean_token_accuracy": 0.212480066716671, "num_tokens": 103264120.0, "step": 59535 }, { "entropy": 5.92330322265625, "epoch": 4.632406146664073, "grad_norm": 1.5078125, "learning_rate": 0.0003038608818310391, "loss": 4.9555, "mean_token_accuracy": 0.20944853574037553, "num_tokens": 103273172.0, "step": 59540 }, { "entropy": 5.961110925674438, "epoch": 4.632795176035791, "grad_norm": 1.2890625, "learning_rate": 0.00030383339497721726, "loss": 5.0417, "mean_token_accuracy": 0.20883206725120546, "num_tokens": 103282345.0, "step": 59545 }, { "entropy": 5.993428564071655, "epoch": 4.633184205407508, "grad_norm": 1.4453125, "learning_rate": 0.0003038059076858944, "loss": 5.038, "mean_token_accuracy": 0.20808208882808685, "num_tokens": 103290845.0, "step": 59550 }, { "entropy": 5.955304670333862, "epoch": 4.633573234779226, "grad_norm": 1.3203125, "learning_rate": 0.0003037784199574879, "loss": 4.9382, "mean_token_accuracy": 0.2144925132393837, "num_tokens": 103299729.0, "step": 59555 }, { "entropy": 5.967109441757202, "epoch": 4.633962264150943, "grad_norm": 1.515625, "learning_rate": 0.00030375093179241464, "loss": 5.0541, "mean_token_accuracy": 0.21334277391433715, "num_tokens": 103308293.0, "step": 59560 }, { "entropy": 6.01031904220581, "epoch": 4.634351293522661, "grad_norm": 1.515625, "learning_rate": 0.00030372344319109173, "loss": 5.0527, "mean_token_accuracy": 0.21260146647691727, "num_tokens": 103317723.0, "step": 59565 }, { "entropy": 6.024979209899902, "epoch": 4.634740322894379, "grad_norm": 1.4921875, "learning_rate": 0.0003036959541539363, "loss": 5.0091, "mean_token_accuracy": 0.2067669451236725, "num_tokens": 103326252.0, "step": 59570 }, { "entropy": 5.924671602249146, "epoch": 4.635129352266096, "grad_norm": 1.3828125, "learning_rate": 0.00030366846468136543, "loss": 4.8452, "mean_token_accuracy": 0.22905461937189103, "num_tokens": 103334972.0, "step": 59575 }, { "entropy": 5.988159227371216, "epoch": 4.635518381637814, "grad_norm": 1.6875, "learning_rate": 0.0003036409747737963, "loss": 4.957, "mean_token_accuracy": 0.21538517922163009, "num_tokens": 103344116.0, "step": 59580 }, { "entropy": 5.963292407989502, "epoch": 4.635907411009531, "grad_norm": 1.546875, "learning_rate": 0.00030361348443164583, "loss": 5.0313, "mean_token_accuracy": 0.2101670891046524, "num_tokens": 103352500.0, "step": 59585 }, { "entropy": 5.940342378616333, "epoch": 4.6362964403812486, "grad_norm": 1.5234375, "learning_rate": 0.0003035859936553314, "loss": 4.9844, "mean_token_accuracy": 0.2185792863368988, "num_tokens": 103360233.0, "step": 59590 }, { "entropy": 5.916723823547363, "epoch": 4.636685469752966, "grad_norm": 1.4296875, "learning_rate": 0.00030355850244527, "loss": 4.9204, "mean_token_accuracy": 0.22125461101531982, "num_tokens": 103369574.0, "step": 59595 }, { "entropy": 5.895914077758789, "epoch": 4.637074499124684, "grad_norm": 1.375, "learning_rate": 0.0003035310108018787, "loss": 4.9086, "mean_token_accuracy": 0.2222664773464203, "num_tokens": 103378455.0, "step": 59600 }, { "entropy": 5.964471340179443, "epoch": 4.637463528496402, "grad_norm": 1.4609375, "learning_rate": 0.0003035035187255748, "loss": 5.0176, "mean_token_accuracy": 0.21246451437473296, "num_tokens": 103386790.0, "step": 59605 }, { "entropy": 5.938351106643677, "epoch": 4.637852557868119, "grad_norm": 1.4921875, "learning_rate": 0.00030347602621677534, "loss": 4.8925, "mean_token_accuracy": 0.22738542705774306, "num_tokens": 103395566.0, "step": 59610 }, { "entropy": 5.990320873260498, "epoch": 4.638241587239836, "grad_norm": 1.546875, "learning_rate": 0.0003034485332758975, "loss": 5.0105, "mean_token_accuracy": 0.20197684317827225, "num_tokens": 103404642.0, "step": 59615 }, { "entropy": 6.072265481948852, "epoch": 4.638630616611554, "grad_norm": 1.46875, "learning_rate": 0.00030342103990335846, "loss": 5.141, "mean_token_accuracy": 0.2016729772090912, "num_tokens": 103414149.0, "step": 59620 }, { "entropy": 5.971632289886474, "epoch": 4.6390196459832715, "grad_norm": 1.546875, "learning_rate": 0.00030339354609957545, "loss": 4.8677, "mean_token_accuracy": 0.22891562283039094, "num_tokens": 103422554.0, "step": 59625 }, { "entropy": 6.036442995071411, "epoch": 4.639408675354989, "grad_norm": 1.5234375, "learning_rate": 0.00030336605186496546, "loss": 5.0065, "mean_token_accuracy": 0.211683189868927, "num_tokens": 103430795.0, "step": 59630 }, { "entropy": 5.9158721446990965, "epoch": 4.639797704726707, "grad_norm": 1.3828125, "learning_rate": 0.00030333855719994585, "loss": 4.9206, "mean_token_accuracy": 0.220899498462677, "num_tokens": 103439862.0, "step": 59635 }, { "entropy": 5.924229145050049, "epoch": 4.640186734098425, "grad_norm": 1.3671875, "learning_rate": 0.0003033110621049336, "loss": 4.915, "mean_token_accuracy": 0.21842632591724395, "num_tokens": 103448372.0, "step": 59640 }, { "entropy": 5.944809818267823, "epoch": 4.640575763470142, "grad_norm": 1.453125, "learning_rate": 0.00030328356658034623, "loss": 4.9428, "mean_token_accuracy": 0.21024688631296157, "num_tokens": 103457004.0, "step": 59645 }, { "entropy": 5.942098569869995, "epoch": 4.64096479284186, "grad_norm": 1.578125, "learning_rate": 0.00030325607062660066, "loss": 4.9147, "mean_token_accuracy": 0.2236834317445755, "num_tokens": 103465655.0, "step": 59650 }, { "entropy": 5.920984411239624, "epoch": 4.641353822213577, "grad_norm": 1.3515625, "learning_rate": 0.0003032285742441143, "loss": 4.9164, "mean_token_accuracy": 0.21808114647865295, "num_tokens": 103474113.0, "step": 59655 }, { "entropy": 5.934466361999512, "epoch": 4.6417428515852945, "grad_norm": 1.46875, "learning_rate": 0.0003032010774333041, "loss": 4.9902, "mean_token_accuracy": 0.20940814167261124, "num_tokens": 103483200.0, "step": 59660 }, { "entropy": 6.016442489624024, "epoch": 4.642131880957012, "grad_norm": 1.390625, "learning_rate": 0.00030317358019458753, "loss": 5.0838, "mean_token_accuracy": 0.21545441895723344, "num_tokens": 103491899.0, "step": 59665 }, { "entropy": 5.960640144348145, "epoch": 4.64252091032873, "grad_norm": 1.515625, "learning_rate": 0.0003031460825283817, "loss": 4.9539, "mean_token_accuracy": 0.22066253870725633, "num_tokens": 103501063.0, "step": 59670 }, { "entropy": 5.9230186462402346, "epoch": 4.642909939700448, "grad_norm": 1.421875, "learning_rate": 0.00030311858443510383, "loss": 4.9799, "mean_token_accuracy": 0.20904681235551834, "num_tokens": 103510202.0, "step": 59675 }, { "entropy": 5.914337062835694, "epoch": 4.643298969072165, "grad_norm": 1.421875, "learning_rate": 0.0003030910859151712, "loss": 4.9042, "mean_token_accuracy": 0.21939670741558076, "num_tokens": 103518389.0, "step": 59680 }, { "entropy": 5.965895748138427, "epoch": 4.643687998443882, "grad_norm": 1.5703125, "learning_rate": 0.00030306358696900114, "loss": 4.9931, "mean_token_accuracy": 0.21401809453964232, "num_tokens": 103527037.0, "step": 59685 }, { "entropy": 5.995781803131104, "epoch": 4.6440770278156, "grad_norm": 1.4765625, "learning_rate": 0.00030303608759701077, "loss": 4.9338, "mean_token_accuracy": 0.22205109596252443, "num_tokens": 103535436.0, "step": 59690 }, { "entropy": 5.998572874069214, "epoch": 4.6444660571873175, "grad_norm": 1.5, "learning_rate": 0.0003030085877996174, "loss": 5.0117, "mean_token_accuracy": 0.21217791587114335, "num_tokens": 103543396.0, "step": 59695 }, { "entropy": 5.925953102111817, "epoch": 4.644855086559035, "grad_norm": 1.375, "learning_rate": 0.00030298108757723823, "loss": 4.9933, "mean_token_accuracy": 0.2115253046154976, "num_tokens": 103552341.0, "step": 59700 }, { "entropy": 5.941769027709961, "epoch": 4.645244115930753, "grad_norm": 1.4453125, "learning_rate": 0.0003029535869302906, "loss": 4.997, "mean_token_accuracy": 0.2107442647218704, "num_tokens": 103561209.0, "step": 59705 }, { "entropy": 6.015166187286377, "epoch": 4.645633145302471, "grad_norm": 1.421875, "learning_rate": 0.00030292608585919185, "loss": 5.0047, "mean_token_accuracy": 0.21223630905151367, "num_tokens": 103568807.0, "step": 59710 }, { "entropy": 5.999033689498901, "epoch": 4.646022174674188, "grad_norm": 1.4140625, "learning_rate": 0.00030289858436435916, "loss": 5.0496, "mean_token_accuracy": 0.2177787736058235, "num_tokens": 103577770.0, "step": 59715 }, { "entropy": 5.899955701828003, "epoch": 4.646411204045905, "grad_norm": 1.4140625, "learning_rate": 0.00030287108244620993, "loss": 4.8513, "mean_token_accuracy": 0.22263091057538986, "num_tokens": 103586765.0, "step": 59720 }, { "entropy": 6.011713647842408, "epoch": 4.646800233417623, "grad_norm": 1.5078125, "learning_rate": 0.00030284358010516135, "loss": 4.9921, "mean_token_accuracy": 0.2121526375412941, "num_tokens": 103595395.0, "step": 59725 }, { "entropy": 5.995758485794068, "epoch": 4.6471892627893405, "grad_norm": 1.421875, "learning_rate": 0.0003028160773416307, "loss": 4.9843, "mean_token_accuracy": 0.20997796356678008, "num_tokens": 103604154.0, "step": 59730 }, { "entropy": 5.977533340454102, "epoch": 4.647578292161058, "grad_norm": 1.5234375, "learning_rate": 0.00030278857415603534, "loss": 5.0008, "mean_token_accuracy": 0.212240768969059, "num_tokens": 103612682.0, "step": 59735 }, { "entropy": 5.837417793273926, "epoch": 4.647967321532776, "grad_norm": 1.3515625, "learning_rate": 0.00030276107054879263, "loss": 4.8516, "mean_token_accuracy": 0.2196103513240814, "num_tokens": 103620741.0, "step": 59740 }, { "entropy": 5.959500980377197, "epoch": 4.648356350904494, "grad_norm": 1.4296875, "learning_rate": 0.00030273356652031993, "loss": 5.0821, "mean_token_accuracy": 0.2080782860517502, "num_tokens": 103629371.0, "step": 59745 }, { "entropy": 6.036035060882568, "epoch": 4.64874538027621, "grad_norm": 1.5, "learning_rate": 0.0003027060620710344, "loss": 5.0861, "mean_token_accuracy": 0.20213526040315627, "num_tokens": 103638345.0, "step": 59750 }, { "entropy": 5.999483585357666, "epoch": 4.649134409647928, "grad_norm": 1.5625, "learning_rate": 0.00030267855720135343, "loss": 4.969, "mean_token_accuracy": 0.21915798783302307, "num_tokens": 103647078.0, "step": 59755 }, { "entropy": 5.924279975891113, "epoch": 4.649523439019646, "grad_norm": 1.515625, "learning_rate": 0.0003026510519116946, "loss": 4.8725, "mean_token_accuracy": 0.22552172541618348, "num_tokens": 103655260.0, "step": 59760 }, { "entropy": 5.889341211318969, "epoch": 4.6499124683913635, "grad_norm": 1.375, "learning_rate": 0.000302623546202475, "loss": 4.8791, "mean_token_accuracy": 0.22440139204263687, "num_tokens": 103664933.0, "step": 59765 }, { "entropy": 5.933447408676147, "epoch": 4.650301497763081, "grad_norm": 1.359375, "learning_rate": 0.0003025960400741119, "loss": 4.9037, "mean_token_accuracy": 0.2199086368083954, "num_tokens": 103673478.0, "step": 59770 }, { "entropy": 5.940554571151734, "epoch": 4.650690527134799, "grad_norm": 1.46875, "learning_rate": 0.000302568533527023, "loss": 5.0033, "mean_token_accuracy": 0.21493564397096634, "num_tokens": 103682534.0, "step": 59775 }, { "entropy": 5.998607397079468, "epoch": 4.651079556506517, "grad_norm": 1.53125, "learning_rate": 0.0003025410265616254, "loss": 5.0499, "mean_token_accuracy": 0.2098961815237999, "num_tokens": 103691626.0, "step": 59780 }, { "entropy": 5.870136165618897, "epoch": 4.651468585878233, "grad_norm": 1.515625, "learning_rate": 0.0003025135191783366, "loss": 4.9521, "mean_token_accuracy": 0.21231155544519426, "num_tokens": 103700707.0, "step": 59785 }, { "entropy": 6.059704685211182, "epoch": 4.651857615249951, "grad_norm": 1.34375, "learning_rate": 0.00030248601137757394, "loss": 5.1006, "mean_token_accuracy": 0.20184117555618286, "num_tokens": 103709521.0, "step": 59790 }, { "entropy": 6.011986112594604, "epoch": 4.652246644621669, "grad_norm": 1.46875, "learning_rate": 0.0003024585031597547, "loss": 5.0011, "mean_token_accuracy": 0.21430256515741347, "num_tokens": 103718046.0, "step": 59795 }, { "entropy": 5.997113132476807, "epoch": 4.6526356739933865, "grad_norm": 1.5390625, "learning_rate": 0.0003024309945252965, "loss": 5.0116, "mean_token_accuracy": 0.20558273047208786, "num_tokens": 103727107.0, "step": 59800 }, { "entropy": 5.895060729980469, "epoch": 4.653024703365104, "grad_norm": 1.4375, "learning_rate": 0.00030240348547461653, "loss": 4.8862, "mean_token_accuracy": 0.21892718672752381, "num_tokens": 103735133.0, "step": 59805 }, { "entropy": 5.945917463302612, "epoch": 4.653413732736822, "grad_norm": 1.4921875, "learning_rate": 0.00030237597600813235, "loss": 5.0323, "mean_token_accuracy": 0.1992183655500412, "num_tokens": 103743945.0, "step": 59810 }, { "entropy": 5.979691886901856, "epoch": 4.653802762108539, "grad_norm": 1.515625, "learning_rate": 0.0003023484661262613, "loss": 4.9375, "mean_token_accuracy": 0.2115895688533783, "num_tokens": 103752316.0, "step": 59815 }, { "entropy": 5.95389347076416, "epoch": 4.654191791480256, "grad_norm": 1.4609375, "learning_rate": 0.0003023209558294208, "loss": 4.9303, "mean_token_accuracy": 0.2208834707736969, "num_tokens": 103760660.0, "step": 59820 }, { "entropy": 5.908425807952881, "epoch": 4.654580820851974, "grad_norm": 1.453125, "learning_rate": 0.00030229344511802824, "loss": 4.8569, "mean_token_accuracy": 0.2259666845202446, "num_tokens": 103769078.0, "step": 59825 }, { "entropy": 6.003791666030883, "epoch": 4.654969850223692, "grad_norm": 1.4140625, "learning_rate": 0.00030226593399250114, "loss": 5.1268, "mean_token_accuracy": 0.20201010257005692, "num_tokens": 103778539.0, "step": 59830 }, { "entropy": 5.897380685806274, "epoch": 4.6553588795954095, "grad_norm": 1.359375, "learning_rate": 0.00030223842245325687, "loss": 4.9248, "mean_token_accuracy": 0.22767056077718734, "num_tokens": 103787614.0, "step": 59835 }, { "entropy": 6.002761697769165, "epoch": 4.655747908967127, "grad_norm": 1.484375, "learning_rate": 0.00030221091050071293, "loss": 5.0143, "mean_token_accuracy": 0.21097975522279738, "num_tokens": 103796577.0, "step": 59840 }, { "entropy": 5.972037506103516, "epoch": 4.656136938338845, "grad_norm": 1.4921875, "learning_rate": 0.00030218339813528665, "loss": 4.9465, "mean_token_accuracy": 0.21965831369161606, "num_tokens": 103804827.0, "step": 59845 }, { "entropy": 5.941406536102295, "epoch": 4.656525967710563, "grad_norm": 1.4609375, "learning_rate": 0.0003021558853573957, "loss": 4.9314, "mean_token_accuracy": 0.22272339165210725, "num_tokens": 103813586.0, "step": 59850 }, { "entropy": 5.9654182434082035, "epoch": 4.656914997082279, "grad_norm": 1.375, "learning_rate": 0.0003021283721674573, "loss": 5.039, "mean_token_accuracy": 0.21040942519903183, "num_tokens": 103822461.0, "step": 59855 }, { "entropy": 5.998545694351196, "epoch": 4.657304026453997, "grad_norm": 1.3828125, "learning_rate": 0.0003021008585658891, "loss": 4.9587, "mean_token_accuracy": 0.2132973313331604, "num_tokens": 103831100.0, "step": 59860 }, { "entropy": 5.9744713306427, "epoch": 4.657693055825715, "grad_norm": 1.46875, "learning_rate": 0.00030207334455310846, "loss": 4.9569, "mean_token_accuracy": 0.21521892100572587, "num_tokens": 103839470.0, "step": 59865 }, { "entropy": 5.9622889995574955, "epoch": 4.6580820851974325, "grad_norm": 1.453125, "learning_rate": 0.0003020458301295329, "loss": 5.0166, "mean_token_accuracy": 0.21285756528377534, "num_tokens": 103847930.0, "step": 59870 }, { "entropy": 5.940825080871582, "epoch": 4.65847111456915, "grad_norm": 1.5625, "learning_rate": 0.00030201831529557994, "loss": 4.8892, "mean_token_accuracy": 0.21458386033773422, "num_tokens": 103856296.0, "step": 59875 }, { "entropy": 5.933492231369018, "epoch": 4.658860143940868, "grad_norm": 1.453125, "learning_rate": 0.0003019908000516671, "loss": 4.9029, "mean_token_accuracy": 0.22115705013275147, "num_tokens": 103865634.0, "step": 59880 }, { "entropy": 5.991169500350952, "epoch": 4.659249173312585, "grad_norm": 1.53125, "learning_rate": 0.0003019632843982117, "loss": 5.0601, "mean_token_accuracy": 0.206548011302948, "num_tokens": 103874231.0, "step": 59885 }, { "entropy": 5.931983947753906, "epoch": 4.659638202684302, "grad_norm": 1.46875, "learning_rate": 0.00030193576833563153, "loss": 4.8781, "mean_token_accuracy": 0.21873256415128708, "num_tokens": 103882944.0, "step": 59890 }, { "entropy": 5.957025051116943, "epoch": 4.66002723205602, "grad_norm": 1.4296875, "learning_rate": 0.0003019082518643438, "loss": 4.9242, "mean_token_accuracy": 0.21811700463294983, "num_tokens": 103891963.0, "step": 59895 }, { "entropy": 5.9723228931427, "epoch": 4.660416261427738, "grad_norm": 1.53125, "learning_rate": 0.00030188073498476633, "loss": 4.947, "mean_token_accuracy": 0.21437387764453888, "num_tokens": 103900329.0, "step": 59900 }, { "entropy": 5.974957895278931, "epoch": 4.6608052907994555, "grad_norm": 1.4453125, "learning_rate": 0.0003018532176973163, "loss": 4.99, "mean_token_accuracy": 0.2133247122168541, "num_tokens": 103909086.0, "step": 59905 }, { "entropy": 5.984570026397705, "epoch": 4.661194320171173, "grad_norm": 1.5390625, "learning_rate": 0.00030182570000241154, "loss": 4.9913, "mean_token_accuracy": 0.2262101098895073, "num_tokens": 103917446.0, "step": 59910 }, { "entropy": 5.941393232345581, "epoch": 4.661583349542891, "grad_norm": 1.4765625, "learning_rate": 0.0003017981819004696, "loss": 4.946, "mean_token_accuracy": 0.22162995636463165, "num_tokens": 103925451.0, "step": 59915 }, { "entropy": 5.895519971847534, "epoch": 4.661972378914608, "grad_norm": 1.5078125, "learning_rate": 0.0003017706633919078, "loss": 4.9499, "mean_token_accuracy": 0.2190278798341751, "num_tokens": 103934368.0, "step": 59920 }, { "entropy": 5.925657081604004, "epoch": 4.662361408286325, "grad_norm": 1.4375, "learning_rate": 0.0003017431444771437, "loss": 4.9361, "mean_token_accuracy": 0.215387824177742, "num_tokens": 103943368.0, "step": 59925 }, { "entropy": 5.985759258270264, "epoch": 4.662750437658043, "grad_norm": 1.359375, "learning_rate": 0.00030171562515659504, "loss": 4.9352, "mean_token_accuracy": 0.21602018028497696, "num_tokens": 103952387.0, "step": 59930 }, { "entropy": 6.040463209152222, "epoch": 4.663139467029761, "grad_norm": 1.5, "learning_rate": 0.0003016881054306793, "loss": 5.0951, "mean_token_accuracy": 0.2017020970582962, "num_tokens": 103961067.0, "step": 59935 }, { "entropy": 5.977185821533203, "epoch": 4.6635284964014785, "grad_norm": 1.3984375, "learning_rate": 0.0003016605852998139, "loss": 4.9502, "mean_token_accuracy": 0.21953993886709214, "num_tokens": 103970275.0, "step": 59940 }, { "entropy": 5.921248722076416, "epoch": 4.663917525773196, "grad_norm": 1.5625, "learning_rate": 0.00030163306476441675, "loss": 4.9783, "mean_token_accuracy": 0.21262012273073197, "num_tokens": 103978379.0, "step": 59945 }, { "entropy": 5.872812271118164, "epoch": 4.664306555144913, "grad_norm": 1.375, "learning_rate": 0.0003016055438249051, "loss": 4.8895, "mean_token_accuracy": 0.21890972107648848, "num_tokens": 103986726.0, "step": 59950 }, { "entropy": 5.889617109298706, "epoch": 4.664695584516631, "grad_norm": 1.375, "learning_rate": 0.0003015780224816968, "loss": 4.886, "mean_token_accuracy": 0.21857771426439285, "num_tokens": 103995073.0, "step": 59955 }, { "entropy": 5.944302129745483, "epoch": 4.665084613888348, "grad_norm": 1.484375, "learning_rate": 0.0003015505007352093, "loss": 4.9665, "mean_token_accuracy": 0.2151861757040024, "num_tokens": 104004285.0, "step": 59960 }, { "entropy": 5.9863207817077635, "epoch": 4.665473643260066, "grad_norm": 1.4140625, "learning_rate": 0.00030152297858586016, "loss": 4.9095, "mean_token_accuracy": 0.21446677744388581, "num_tokens": 104012500.0, "step": 59965 }, { "entropy": 6.010613822937012, "epoch": 4.665862672631784, "grad_norm": 1.5234375, "learning_rate": 0.00030149545603406694, "loss": 5.0493, "mean_token_accuracy": 0.2088080585002899, "num_tokens": 104021246.0, "step": 59970 }, { "entropy": 5.975566101074219, "epoch": 4.6662517020035015, "grad_norm": 1.546875, "learning_rate": 0.0003014679330802474, "loss": 4.9628, "mean_token_accuracy": 0.21519633382558823, "num_tokens": 104029506.0, "step": 59975 }, { "entropy": 6.022634792327881, "epoch": 4.666640731375219, "grad_norm": 1.453125, "learning_rate": 0.00030144040972481916, "loss": 5.0764, "mean_token_accuracy": 0.21139664947986603, "num_tokens": 104038669.0, "step": 59980 }, { "entropy": 5.903010034561158, "epoch": 4.667029760746937, "grad_norm": 1.5078125, "learning_rate": 0.00030141288596819977, "loss": 4.9276, "mean_token_accuracy": 0.21862666308879852, "num_tokens": 104046859.0, "step": 59985 }, { "entropy": 5.979983472824097, "epoch": 4.667418790118654, "grad_norm": 1.3828125, "learning_rate": 0.00030138536181080683, "loss": 5.0316, "mean_token_accuracy": 0.21310158520936967, "num_tokens": 104055270.0, "step": 59990 }, { "entropy": 5.96666955947876, "epoch": 4.667807819490371, "grad_norm": 1.375, "learning_rate": 0.00030135783725305815, "loss": 4.9444, "mean_token_accuracy": 0.22415553629398347, "num_tokens": 104063819.0, "step": 59995 }, { "entropy": 5.941407823562622, "epoch": 4.668196848862089, "grad_norm": 1.390625, "learning_rate": 0.0003013303122953712, "loss": 4.8909, "mean_token_accuracy": 0.22906938940286636, "num_tokens": 104072392.0, "step": 60000 }, { "epoch": 4.668196848862089, "eval_entropy": 5.687876052507652, "eval_loss": 5.061351299285889, "eval_mean_token_accuracy": 0.21988547209137557, "eval_num_tokens": 104072392.0, "eval_runtime": 21.6349, "eval_samples_per_second": 1920.881, "eval_steps_per_second": 240.122, "step": 60000 }, { "entropy": 5.9749502658844, "epoch": 4.668585878233807, "grad_norm": 1.3828125, "learning_rate": 0.0003013027869381635, "loss": 5.0189, "mean_token_accuracy": 0.2165118411183357, "num_tokens": 104080918.0, "step": 60005 }, { "entropy": 5.950287914276123, "epoch": 4.6689749076055245, "grad_norm": 1.46875, "learning_rate": 0.000301275261181853, "loss": 5.0366, "mean_token_accuracy": 0.20016543567180634, "num_tokens": 104089221.0, "step": 60010 }, { "entropy": 6.0116273880004885, "epoch": 4.669363936977242, "grad_norm": 1.5078125, "learning_rate": 0.0003012477350268572, "loss": 4.983, "mean_token_accuracy": 0.22090367078781128, "num_tokens": 104097863.0, "step": 60015 }, { "entropy": 5.946863126754761, "epoch": 4.669752966348959, "grad_norm": 1.6171875, "learning_rate": 0.00030122020847359385, "loss": 4.9335, "mean_token_accuracy": 0.21443540453910828, "num_tokens": 104106095.0, "step": 60020 }, { "entropy": 5.941083860397339, "epoch": 4.670141995720677, "grad_norm": 1.4609375, "learning_rate": 0.0003011926815224805, "loss": 4.9165, "mean_token_accuracy": 0.22072327584028245, "num_tokens": 104114225.0, "step": 60025 }, { "entropy": 5.919875383377075, "epoch": 4.670531025092394, "grad_norm": 1.3828125, "learning_rate": 0.00030116515417393495, "loss": 4.9414, "mean_token_accuracy": 0.2197279542684555, "num_tokens": 104123231.0, "step": 60030 }, { "entropy": 5.972499895095825, "epoch": 4.670920054464112, "grad_norm": 1.484375, "learning_rate": 0.00030113762642837487, "loss": 4.9438, "mean_token_accuracy": 0.2179143935441971, "num_tokens": 104131415.0, "step": 60035 }, { "entropy": 5.989145088195801, "epoch": 4.67130908383583, "grad_norm": 1.3515625, "learning_rate": 0.00030111009828621786, "loss": 4.999, "mean_token_accuracy": 0.21043936163187027, "num_tokens": 104139553.0, "step": 60040 }, { "entropy": 5.941040992736816, "epoch": 4.6716981132075475, "grad_norm": 1.34375, "learning_rate": 0.0003010825697478817, "loss": 4.9708, "mean_token_accuracy": 0.21498003453016282, "num_tokens": 104148746.0, "step": 60045 }, { "entropy": 5.9946372509002686, "epoch": 4.672087142579265, "grad_norm": 1.4921875, "learning_rate": 0.000301055040813784, "loss": 5.0704, "mean_token_accuracy": 0.20169862359762192, "num_tokens": 104157581.0, "step": 60050 }, { "entropy": 5.974107646942139, "epoch": 4.672476171950982, "grad_norm": 1.484375, "learning_rate": 0.00030102751148434255, "loss": 4.9497, "mean_token_accuracy": 0.21227034628391267, "num_tokens": 104166367.0, "step": 60055 }, { "entropy": 5.885491514205933, "epoch": 4.6728652013227, "grad_norm": 1.484375, "learning_rate": 0.000300999981759975, "loss": 4.9004, "mean_token_accuracy": 0.2222553849220276, "num_tokens": 104174412.0, "step": 60060 }, { "entropy": 5.9316713333129885, "epoch": 4.673254230694417, "grad_norm": 1.484375, "learning_rate": 0.0003009724516410992, "loss": 4.8945, "mean_token_accuracy": 0.2245864138007164, "num_tokens": 104182344.0, "step": 60065 }, { "entropy": 5.90769476890564, "epoch": 4.673643260066135, "grad_norm": 1.3828125, "learning_rate": 0.0003009449211281328, "loss": 4.9549, "mean_token_accuracy": 0.21476221084594727, "num_tokens": 104190612.0, "step": 60070 }, { "entropy": 5.963969612121582, "epoch": 4.674032289437853, "grad_norm": 1.4609375, "learning_rate": 0.0003009173902214934, "loss": 4.9366, "mean_token_accuracy": 0.21231108903884888, "num_tokens": 104198936.0, "step": 60075 }, { "entropy": 5.960894060134888, "epoch": 4.6744213188095705, "grad_norm": 1.5703125, "learning_rate": 0.0003008898589215989, "loss": 5.016, "mean_token_accuracy": 0.21611536145210267, "num_tokens": 104207707.0, "step": 60080 }, { "entropy": 5.9502147197723385, "epoch": 4.674810348181287, "grad_norm": 1.46875, "learning_rate": 0.00030086232722886704, "loss": 4.9334, "mean_token_accuracy": 0.22773289531469346, "num_tokens": 104216025.0, "step": 60085 }, { "entropy": 5.892511606216431, "epoch": 4.675199377553005, "grad_norm": 1.453125, "learning_rate": 0.00030083479514371545, "loss": 4.8314, "mean_token_accuracy": 0.22890988737344742, "num_tokens": 104225283.0, "step": 60090 }, { "entropy": 5.931044578552246, "epoch": 4.675588406924723, "grad_norm": 1.53125, "learning_rate": 0.00030080726266656205, "loss": 4.9608, "mean_token_accuracy": 0.2216862052679062, "num_tokens": 104233252.0, "step": 60095 }, { "entropy": 5.899866008758545, "epoch": 4.67597743629644, "grad_norm": 1.46875, "learning_rate": 0.0003007797297978245, "loss": 4.8726, "mean_token_accuracy": 0.2144427165389061, "num_tokens": 104241234.0, "step": 60100 }, { "entropy": 5.909007024765015, "epoch": 4.676366465668158, "grad_norm": 1.4296875, "learning_rate": 0.0003007521965379206, "loss": 4.9109, "mean_token_accuracy": 0.21852957606315612, "num_tokens": 104250091.0, "step": 60105 }, { "entropy": 5.904195356369018, "epoch": 4.676755495039876, "grad_norm": 1.3984375, "learning_rate": 0.000300724662887268, "loss": 4.9864, "mean_token_accuracy": 0.20896863043308259, "num_tokens": 104258668.0, "step": 60110 }, { "entropy": 5.939421796798706, "epoch": 4.6771445244115935, "grad_norm": 1.5, "learning_rate": 0.00030069712884628477, "loss": 4.8757, "mean_token_accuracy": 0.22455400675535203, "num_tokens": 104266799.0, "step": 60115 }, { "entropy": 6.000022459030151, "epoch": 4.67753355378331, "grad_norm": 1.5234375, "learning_rate": 0.0003006695944153883, "loss": 5.0411, "mean_token_accuracy": 0.20453110188245774, "num_tokens": 104275005.0, "step": 60120 }, { "entropy": 5.919785118103027, "epoch": 4.677922583155028, "grad_norm": 1.4140625, "learning_rate": 0.0003006420595949967, "loss": 4.9422, "mean_token_accuracy": 0.21564596891403198, "num_tokens": 104283997.0, "step": 60125 }, { "entropy": 6.0065771579742435, "epoch": 4.678311612526746, "grad_norm": 1.59375, "learning_rate": 0.00030061452438552767, "loss": 5.0419, "mean_token_accuracy": 0.2028913140296936, "num_tokens": 104291907.0, "step": 60130 }, { "entropy": 5.875115394592285, "epoch": 4.678700641898463, "grad_norm": 1.5234375, "learning_rate": 0.000300586988787399, "loss": 4.9264, "mean_token_accuracy": 0.22264128029346467, "num_tokens": 104300917.0, "step": 60135 }, { "entropy": 5.918645572662354, "epoch": 4.679089671270181, "grad_norm": 1.3984375, "learning_rate": 0.00030055945280102844, "loss": 4.999, "mean_token_accuracy": 0.21630427688360215, "num_tokens": 104309814.0, "step": 60140 }, { "entropy": 5.965992498397827, "epoch": 4.679478700641899, "grad_norm": 1.3828125, "learning_rate": 0.00030053191642683393, "loss": 5.0179, "mean_token_accuracy": 0.20286183953285217, "num_tokens": 104318918.0, "step": 60145 }, { "entropy": 5.955486726760864, "epoch": 4.679867730013616, "grad_norm": 1.4296875, "learning_rate": 0.0003005043796652332, "loss": 4.9509, "mean_token_accuracy": 0.21741945445537567, "num_tokens": 104327885.0, "step": 60150 }, { "entropy": 5.99527153968811, "epoch": 4.680256759385333, "grad_norm": 1.3359375, "learning_rate": 0.00030047684251664417, "loss": 5.0471, "mean_token_accuracy": 0.20868892967700958, "num_tokens": 104337884.0, "step": 60155 }, { "entropy": 5.973678731918335, "epoch": 4.680645788757051, "grad_norm": 1.4609375, "learning_rate": 0.0003004493049814845, "loss": 4.9613, "mean_token_accuracy": 0.21858785748481752, "num_tokens": 104346572.0, "step": 60160 }, { "entropy": 5.920450592041016, "epoch": 4.681034818128769, "grad_norm": 1.578125, "learning_rate": 0.00030042176706017215, "loss": 4.9382, "mean_token_accuracy": 0.21860906928777696, "num_tokens": 104355243.0, "step": 60165 }, { "entropy": 5.94726185798645, "epoch": 4.681423847500486, "grad_norm": 1.453125, "learning_rate": 0.00030039422875312495, "loss": 4.9366, "mean_token_accuracy": 0.21914635747671127, "num_tokens": 104363517.0, "step": 60170 }, { "entropy": 5.953428077697754, "epoch": 4.681812876872204, "grad_norm": 1.578125, "learning_rate": 0.00030036669006076075, "loss": 5.0212, "mean_token_accuracy": 0.2099926143884659, "num_tokens": 104372110.0, "step": 60175 }, { "entropy": 5.8969542503356935, "epoch": 4.682201906243922, "grad_norm": 1.421875, "learning_rate": 0.00030033915098349746, "loss": 4.9692, "mean_token_accuracy": 0.21893234252929689, "num_tokens": 104380641.0, "step": 60180 }, { "entropy": 5.924350452423096, "epoch": 4.682590935615639, "grad_norm": 1.5078125, "learning_rate": 0.0003003116115217529, "loss": 4.869, "mean_token_accuracy": 0.2183280348777771, "num_tokens": 104389196.0, "step": 60185 }, { "entropy": 5.924060392379761, "epoch": 4.682979964987356, "grad_norm": 1.5234375, "learning_rate": 0.00030028407167594486, "loss": 4.9413, "mean_token_accuracy": 0.22119003385305405, "num_tokens": 104397367.0, "step": 60190 }, { "entropy": 5.973294115066528, "epoch": 4.683368994359074, "grad_norm": 1.4765625, "learning_rate": 0.0003002565314464913, "loss": 5.0153, "mean_token_accuracy": 0.22505468875169754, "num_tokens": 104405750.0, "step": 60195 }, { "entropy": 5.978758668899536, "epoch": 4.683758023730792, "grad_norm": 1.3671875, "learning_rate": 0.00030022899083381006, "loss": 4.9351, "mean_token_accuracy": 0.21707394421100618, "num_tokens": 104415320.0, "step": 60200 }, { "entropy": 5.96633014678955, "epoch": 4.684147053102509, "grad_norm": 1.4375, "learning_rate": 0.000300201449838319, "loss": 5.0013, "mean_token_accuracy": 0.20804767310619354, "num_tokens": 104424181.0, "step": 60205 }, { "entropy": 5.992878246307373, "epoch": 4.684536082474227, "grad_norm": 1.4140625, "learning_rate": 0.0003001739084604361, "loss": 5.0349, "mean_token_accuracy": 0.21035778373479844, "num_tokens": 104432858.0, "step": 60210 }, { "entropy": 5.946849298477173, "epoch": 4.684925111845945, "grad_norm": 2.71875, "learning_rate": 0.00030014636670057913, "loss": 4.8817, "mean_token_accuracy": 0.22842093259096147, "num_tokens": 104441662.0, "step": 60215 }, { "entropy": 5.928257417678833, "epoch": 4.6853141412176615, "grad_norm": 1.3359375, "learning_rate": 0.0003001188245591662, "loss": 4.9602, "mean_token_accuracy": 0.21583738625049592, "num_tokens": 104450512.0, "step": 60220 }, { "entropy": 5.984553098678589, "epoch": 4.685703170589379, "grad_norm": 1.421875, "learning_rate": 0.0003000912820366151, "loss": 4.9683, "mean_token_accuracy": 0.2116843655705452, "num_tokens": 104459056.0, "step": 60225 }, { "entropy": 5.930968999862671, "epoch": 4.686092199961097, "grad_norm": 1.4296875, "learning_rate": 0.00030006373913334366, "loss": 4.9993, "mean_token_accuracy": 0.214417727291584, "num_tokens": 104469258.0, "step": 60230 }, { "entropy": 5.96537504196167, "epoch": 4.686481229332815, "grad_norm": 1.421875, "learning_rate": 0.0003000361958497699, "loss": 4.9841, "mean_token_accuracy": 0.2127759799361229, "num_tokens": 104477177.0, "step": 60235 }, { "entropy": 5.966023969650268, "epoch": 4.686870258704532, "grad_norm": 1.4609375, "learning_rate": 0.0003000086521863116, "loss": 4.9519, "mean_token_accuracy": 0.21279906034469603, "num_tokens": 104486235.0, "step": 60240 }, { "entropy": 5.916788101196289, "epoch": 4.68725928807625, "grad_norm": 1.3359375, "learning_rate": 0.000299981108143387, "loss": 4.9483, "mean_token_accuracy": 0.21391281336545945, "num_tokens": 104494736.0, "step": 60245 }, { "entropy": 5.973854064941406, "epoch": 4.687648317447968, "grad_norm": 1.4140625, "learning_rate": 0.00029995356372141367, "loss": 5.0347, "mean_token_accuracy": 0.20278994292020797, "num_tokens": 104503293.0, "step": 60250 }, { "entropy": 5.878686571121216, "epoch": 4.6880373468196845, "grad_norm": 1.40625, "learning_rate": 0.0002999260189208098, "loss": 4.9181, "mean_token_accuracy": 0.215238581597805, "num_tokens": 104511350.0, "step": 60255 }, { "entropy": 5.914842128753662, "epoch": 4.688426376191402, "grad_norm": 1.5078125, "learning_rate": 0.00029989847374199333, "loss": 4.8767, "mean_token_accuracy": 0.22610887587070466, "num_tokens": 104519902.0, "step": 60260 }, { "entropy": 5.963406085968018, "epoch": 4.68881540556312, "grad_norm": 1.359375, "learning_rate": 0.00029987092818538217, "loss": 5.0252, "mean_token_accuracy": 0.2113843873143196, "num_tokens": 104528874.0, "step": 60265 }, { "entropy": 5.942490530014038, "epoch": 4.689204434934838, "grad_norm": 1.578125, "learning_rate": 0.00029984338225139405, "loss": 4.9052, "mean_token_accuracy": 0.22710263431072236, "num_tokens": 104536778.0, "step": 60270 }, { "entropy": 5.992015933990478, "epoch": 4.689593464306555, "grad_norm": 1.609375, "learning_rate": 0.0002998158359404473, "loss": 5.0387, "mean_token_accuracy": 0.21157924383878707, "num_tokens": 104545207.0, "step": 60275 }, { "entropy": 5.919056606292725, "epoch": 4.689982493678273, "grad_norm": 1.453125, "learning_rate": 0.0002997882892529597, "loss": 4.9302, "mean_token_accuracy": 0.22299935519695283, "num_tokens": 104553497.0, "step": 60280 }, { "entropy": 5.94305100440979, "epoch": 4.69037152304999, "grad_norm": 1.4140625, "learning_rate": 0.0002997607421893493, "loss": 5.0091, "mean_token_accuracy": 0.21505619287490846, "num_tokens": 104562837.0, "step": 60285 }, { "entropy": 5.937341356277466, "epoch": 4.6907605524217075, "grad_norm": 1.546875, "learning_rate": 0.000299733194750034, "loss": 4.9071, "mean_token_accuracy": 0.21794671267271043, "num_tokens": 104570628.0, "step": 60290 }, { "entropy": 5.934597778320312, "epoch": 4.691149581793425, "grad_norm": 1.3984375, "learning_rate": 0.0002997056469354319, "loss": 5.0411, "mean_token_accuracy": 0.20867305099964142, "num_tokens": 104579910.0, "step": 60295 }, { "entropy": 5.950962829589844, "epoch": 4.691538611165143, "grad_norm": 1.4609375, "learning_rate": 0.0002996780987459609, "loss": 4.9164, "mean_token_accuracy": 0.21882133781909943, "num_tokens": 104587936.0, "step": 60300 }, { "entropy": 6.031591749191284, "epoch": 4.691927640536861, "grad_norm": 1.3671875, "learning_rate": 0.0002996505501820391, "loss": 5.0586, "mean_token_accuracy": 0.20456299036741257, "num_tokens": 104597072.0, "step": 60305 }, { "entropy": 5.947728967666626, "epoch": 4.692316669908578, "grad_norm": 1.4375, "learning_rate": 0.0002996230012440843, "loss": 4.9487, "mean_token_accuracy": 0.22061653584241867, "num_tokens": 104605573.0, "step": 60310 }, { "entropy": 5.910471677780151, "epoch": 4.692705699280296, "grad_norm": 1.515625, "learning_rate": 0.00029959545193251473, "loss": 5.0098, "mean_token_accuracy": 0.2157890409231186, "num_tokens": 104613954.0, "step": 60315 }, { "entropy": 5.946838617324829, "epoch": 4.693094728652014, "grad_norm": 1.5078125, "learning_rate": 0.00029956790224774834, "loss": 5.0065, "mean_token_accuracy": 0.21560630798339844, "num_tokens": 104622410.0, "step": 60320 }, { "entropy": 5.992386054992676, "epoch": 4.6934837580237305, "grad_norm": 1.3984375, "learning_rate": 0.00029954035219020305, "loss": 4.9539, "mean_token_accuracy": 0.2133355438709259, "num_tokens": 104631953.0, "step": 60325 }, { "entropy": 5.920720529556275, "epoch": 4.693872787395448, "grad_norm": 1.3515625, "learning_rate": 0.00029951280176029703, "loss": 4.9099, "mean_token_accuracy": 0.2224492311477661, "num_tokens": 104640714.0, "step": 60330 }, { "entropy": 5.974487781524658, "epoch": 4.694261816767166, "grad_norm": 1.3828125, "learning_rate": 0.00029948525095844825, "loss": 5.0322, "mean_token_accuracy": 0.2098902329802513, "num_tokens": 104649773.0, "step": 60335 }, { "entropy": 5.972251462936401, "epoch": 4.694650846138884, "grad_norm": 1.3515625, "learning_rate": 0.0002994576997850748, "loss": 5.0039, "mean_token_accuracy": 0.2177252322435379, "num_tokens": 104658581.0, "step": 60340 }, { "entropy": 5.9842249870300295, "epoch": 4.695039875510601, "grad_norm": 1.578125, "learning_rate": 0.0002994301482405946, "loss": 5.0337, "mean_token_accuracy": 0.211082324385643, "num_tokens": 104666735.0, "step": 60345 }, { "entropy": 5.869221639633179, "epoch": 4.695428904882318, "grad_norm": 1.609375, "learning_rate": 0.0002994025963254259, "loss": 4.9318, "mean_token_accuracy": 0.2180479198694229, "num_tokens": 104675301.0, "step": 60350 }, { "entropy": 6.003762531280517, "epoch": 4.695817934254036, "grad_norm": 1.5078125, "learning_rate": 0.0002993750440399866, "loss": 4.9924, "mean_token_accuracy": 0.21911318898200988, "num_tokens": 104684468.0, "step": 60355 }, { "entropy": 5.975041484832763, "epoch": 4.6962069636257535, "grad_norm": 1.4296875, "learning_rate": 0.0002993474913846948, "loss": 4.9125, "mean_token_accuracy": 0.2138512298464775, "num_tokens": 104693090.0, "step": 60360 }, { "entropy": 5.92622332572937, "epoch": 4.696595992997471, "grad_norm": 1.4375, "learning_rate": 0.0002993199383599685, "loss": 4.969, "mean_token_accuracy": 0.2125132903456688, "num_tokens": 104701597.0, "step": 60365 }, { "entropy": 5.95840048789978, "epoch": 4.696985022369189, "grad_norm": 1.3828125, "learning_rate": 0.0002992923849662259, "loss": 5.0486, "mean_token_accuracy": 0.20684927850961685, "num_tokens": 104711000.0, "step": 60370 }, { "entropy": 5.974198675155639, "epoch": 4.697374051740907, "grad_norm": 1.375, "learning_rate": 0.00029926483120388506, "loss": 5.0088, "mean_token_accuracy": 0.20799960047006608, "num_tokens": 104719581.0, "step": 60375 }, { "entropy": 5.961877679824829, "epoch": 4.697763081112624, "grad_norm": 1.59375, "learning_rate": 0.000299237277073364, "loss": 5.0067, "mean_token_accuracy": 0.20907308161258698, "num_tokens": 104727060.0, "step": 60380 }, { "entropy": 5.998099899291992, "epoch": 4.698152110484342, "grad_norm": 1.5234375, "learning_rate": 0.0002992097225750808, "loss": 4.9813, "mean_token_accuracy": 0.2156379461288452, "num_tokens": 104734974.0, "step": 60385 }, { "entropy": 5.9509923458099365, "epoch": 4.698541139856059, "grad_norm": 1.5703125, "learning_rate": 0.00029918216770945363, "loss": 4.9666, "mean_token_accuracy": 0.2127162903547287, "num_tokens": 104744352.0, "step": 60390 }, { "entropy": 5.966688632965088, "epoch": 4.6989301692277765, "grad_norm": 1.546875, "learning_rate": 0.0002991546124769005, "loss": 4.9536, "mean_token_accuracy": 0.2166674554347992, "num_tokens": 104752485.0, "step": 60395 }, { "entropy": 5.945555591583252, "epoch": 4.699319198599494, "grad_norm": 1.578125, "learning_rate": 0.0002991270568778396, "loss": 4.972, "mean_token_accuracy": 0.21471191197633743, "num_tokens": 104760469.0, "step": 60400 }, { "entropy": 5.914256143569946, "epoch": 4.699708227971212, "grad_norm": 1.4765625, "learning_rate": 0.0002990995009126891, "loss": 5.0085, "mean_token_accuracy": 0.21454692333936692, "num_tokens": 104769381.0, "step": 60405 }, { "entropy": 5.985376310348511, "epoch": 4.70009725734293, "grad_norm": 1.484375, "learning_rate": 0.0002990719445818669, "loss": 5.0279, "mean_token_accuracy": 0.20911774933338165, "num_tokens": 104778222.0, "step": 60410 }, { "entropy": 5.969920063018799, "epoch": 4.700486286714647, "grad_norm": 1.3671875, "learning_rate": 0.0002990443878857914, "loss": 4.9418, "mean_token_accuracy": 0.2146775722503662, "num_tokens": 104786784.0, "step": 60415 }, { "entropy": 5.966796922683716, "epoch": 4.700875316086364, "grad_norm": 1.484375, "learning_rate": 0.00029901683082488045, "loss": 4.9516, "mean_token_accuracy": 0.21216151267290115, "num_tokens": 104795260.0, "step": 60420 }, { "entropy": 5.9179071426391605, "epoch": 4.701264345458082, "grad_norm": 1.3515625, "learning_rate": 0.0002989892733995524, "loss": 4.9208, "mean_token_accuracy": 0.21633727550506593, "num_tokens": 104804330.0, "step": 60425 }, { "entropy": 5.898036956787109, "epoch": 4.7016533748297995, "grad_norm": 1.4453125, "learning_rate": 0.0002989617156102253, "loss": 4.9722, "mean_token_accuracy": 0.21213054656982422, "num_tokens": 104812605.0, "step": 60430 }, { "entropy": 5.929125070571899, "epoch": 4.702042404201517, "grad_norm": 1.40625, "learning_rate": 0.0002989341574573172, "loss": 5.0265, "mean_token_accuracy": 0.21408019512891768, "num_tokens": 104821207.0, "step": 60435 }, { "entropy": 5.949772644042969, "epoch": 4.702431433573235, "grad_norm": 1.328125, "learning_rate": 0.00029890659894124647, "loss": 5.01, "mean_token_accuracy": 0.2191919520497322, "num_tokens": 104829628.0, "step": 60440 }, { "entropy": 5.9774659156799315, "epoch": 4.702820462944953, "grad_norm": 1.453125, "learning_rate": 0.0002988790400624312, "loss": 4.9329, "mean_token_accuracy": 0.21224894225597382, "num_tokens": 104838003.0, "step": 60445 }, { "entropy": 5.907231378555298, "epoch": 4.70320949231667, "grad_norm": 1.5078125, "learning_rate": 0.0002988514808212894, "loss": 4.9053, "mean_token_accuracy": 0.21582765728235245, "num_tokens": 104846008.0, "step": 60450 }, { "entropy": 5.927509403228759, "epoch": 4.703598521688387, "grad_norm": 1.515625, "learning_rate": 0.0002988239212182394, "loss": 4.9161, "mean_token_accuracy": 0.2345385178923607, "num_tokens": 104855337.0, "step": 60455 }, { "entropy": 5.873818635940552, "epoch": 4.703987551060105, "grad_norm": 1.4296875, "learning_rate": 0.0002987963612536993, "loss": 4.8197, "mean_token_accuracy": 0.2339138299226761, "num_tokens": 104863780.0, "step": 60460 }, { "entropy": 5.842816495895386, "epoch": 4.7043765804318225, "grad_norm": 1.4921875, "learning_rate": 0.00029876880092808724, "loss": 4.8074, "mean_token_accuracy": 0.22662388235330583, "num_tokens": 104871956.0, "step": 60465 }, { "entropy": 5.925304985046386, "epoch": 4.70476560980354, "grad_norm": 1.46875, "learning_rate": 0.0002987412402418215, "loss": 4.9706, "mean_token_accuracy": 0.21215767413377762, "num_tokens": 104880454.0, "step": 60470 }, { "entropy": 5.849478006362915, "epoch": 4.705154639175258, "grad_norm": 1.421875, "learning_rate": 0.00029871367919532014, "loss": 4.8733, "mean_token_accuracy": 0.22777743637561798, "num_tokens": 104888224.0, "step": 60475 }, { "entropy": 5.988302326202392, "epoch": 4.705543668546976, "grad_norm": 1.3203125, "learning_rate": 0.0002986861177890016, "loss": 5.0005, "mean_token_accuracy": 0.21135144978761672, "num_tokens": 104897496.0, "step": 60480 }, { "entropy": 5.996218967437744, "epoch": 4.705932697918692, "grad_norm": 1.46875, "learning_rate": 0.0002986585560232838, "loss": 5.0191, "mean_token_accuracy": 0.2080491617321968, "num_tokens": 104905911.0, "step": 60485 }, { "entropy": 6.001829481124878, "epoch": 4.70632172729041, "grad_norm": 1.453125, "learning_rate": 0.00029863099389858516, "loss": 4.9488, "mean_token_accuracy": 0.2178354650735855, "num_tokens": 104914174.0, "step": 60490 }, { "entropy": 5.897401332855225, "epoch": 4.706710756662128, "grad_norm": 1.484375, "learning_rate": 0.0002986034314153238, "loss": 4.8749, "mean_token_accuracy": 0.22708578109741212, "num_tokens": 104922712.0, "step": 60495 }, { "entropy": 5.927610778808594, "epoch": 4.7070997860338455, "grad_norm": 1.34375, "learning_rate": 0.00029857586857391796, "loss": 4.9302, "mean_token_accuracy": 0.2189048007130623, "num_tokens": 104930821.0, "step": 60500 }, { "entropy": 5.866061496734619, "epoch": 4.707488815405563, "grad_norm": 1.484375, "learning_rate": 0.00029854830537478567, "loss": 5.0051, "mean_token_accuracy": 0.21676801890134811, "num_tokens": 104938843.0, "step": 60505 }, { "entropy": 5.812976455688476, "epoch": 4.707877844777281, "grad_norm": 1.5625, "learning_rate": 0.00029852074181834545, "loss": 4.8362, "mean_token_accuracy": 0.22138829231262208, "num_tokens": 104947162.0, "step": 60510 }, { "entropy": 5.958100461959839, "epoch": 4.708266874148999, "grad_norm": 1.40625, "learning_rate": 0.00029849317790501536, "loss": 4.9843, "mean_token_accuracy": 0.21008038967847825, "num_tokens": 104956478.0, "step": 60515 }, { "entropy": 6.029663944244385, "epoch": 4.708655903520716, "grad_norm": 1.375, "learning_rate": 0.00029846561363521375, "loss": 5.0189, "mean_token_accuracy": 0.20409189015626908, "num_tokens": 104964968.0, "step": 60520 }, { "entropy": 5.918820142745972, "epoch": 4.709044932892433, "grad_norm": 1.2890625, "learning_rate": 0.0002984380490093588, "loss": 4.9322, "mean_token_accuracy": 0.2139691084623337, "num_tokens": 104973965.0, "step": 60525 }, { "entropy": 5.973032379150391, "epoch": 4.709433962264151, "grad_norm": 1.5390625, "learning_rate": 0.0002984104840278687, "loss": 5.0305, "mean_token_accuracy": 0.21424041241407393, "num_tokens": 104982928.0, "step": 60530 }, { "entropy": 5.989659357070923, "epoch": 4.7098229916358685, "grad_norm": 1.4296875, "learning_rate": 0.0002983829186911618, "loss": 4.9605, "mean_token_accuracy": 0.21364318281412126, "num_tokens": 104991189.0, "step": 60535 }, { "entropy": 5.947399234771728, "epoch": 4.710212021007586, "grad_norm": 1.46875, "learning_rate": 0.00029835535299965635, "loss": 4.9515, "mean_token_accuracy": 0.21920880824327468, "num_tokens": 104999556.0, "step": 60540 }, { "entropy": 5.999871397018433, "epoch": 4.710601050379304, "grad_norm": 1.5, "learning_rate": 0.00029832778695377057, "loss": 5.0279, "mean_token_accuracy": 0.21180133074522017, "num_tokens": 105008726.0, "step": 60545 }, { "entropy": 5.914922904968262, "epoch": 4.710990079751022, "grad_norm": 1.4765625, "learning_rate": 0.00029830022055392277, "loss": 4.917, "mean_token_accuracy": 0.2216814339160919, "num_tokens": 105017591.0, "step": 60550 }, { "entropy": 5.979308176040649, "epoch": 4.711379109122738, "grad_norm": 1.265625, "learning_rate": 0.00029827265380053116, "loss": 5.0411, "mean_token_accuracy": 0.20886907875537872, "num_tokens": 105026939.0, "step": 60555 }, { "entropy": 5.996488189697265, "epoch": 4.711768138494456, "grad_norm": 1.421875, "learning_rate": 0.0002982450866940141, "loss": 5.0063, "mean_token_accuracy": 0.21026464849710463, "num_tokens": 105035889.0, "step": 60560 }, { "entropy": 5.998342800140381, "epoch": 4.712157167866174, "grad_norm": 1.40625, "learning_rate": 0.0002982175192347899, "loss": 5.0545, "mean_token_accuracy": 0.2110433652997017, "num_tokens": 105044118.0, "step": 60565 }, { "entropy": 5.9598921775817875, "epoch": 4.7125461972378915, "grad_norm": 1.46875, "learning_rate": 0.0002981899514232767, "loss": 4.9858, "mean_token_accuracy": 0.21285568326711654, "num_tokens": 105051923.0, "step": 60570 }, { "entropy": 6.027708673477173, "epoch": 4.712935226609609, "grad_norm": 1.40625, "learning_rate": 0.000298162383259893, "loss": 5.1374, "mean_token_accuracy": 0.20247529745101928, "num_tokens": 105060892.0, "step": 60575 }, { "entropy": 6.031220436096191, "epoch": 4.713324255981327, "grad_norm": 1.4453125, "learning_rate": 0.00029813481474505693, "loss": 5.0305, "mean_token_accuracy": 0.21414585709571837, "num_tokens": 105069147.0, "step": 60580 }, { "entropy": 5.974422407150269, "epoch": 4.713713285353045, "grad_norm": 1.3515625, "learning_rate": 0.00029810724587918684, "loss": 4.8932, "mean_token_accuracy": 0.22520148605108262, "num_tokens": 105077751.0, "step": 60585 }, { "entropy": 5.931685590744019, "epoch": 4.714102314724761, "grad_norm": 1.359375, "learning_rate": 0.0002980796766627012, "loss": 4.8774, "mean_token_accuracy": 0.2243342563509941, "num_tokens": 105085980.0, "step": 60590 }, { "entropy": 5.891200351715088, "epoch": 4.714491344096479, "grad_norm": 1.4765625, "learning_rate": 0.0002980521070960181, "loss": 4.8812, "mean_token_accuracy": 0.22216591089963914, "num_tokens": 105094147.0, "step": 60595 }, { "entropy": 5.912204933166504, "epoch": 4.714880373468197, "grad_norm": 1.40625, "learning_rate": 0.00029802453717955597, "loss": 4.9121, "mean_token_accuracy": 0.22138848751783372, "num_tokens": 105102304.0, "step": 60600 }, { "entropy": 5.952026987075806, "epoch": 4.7152694028399145, "grad_norm": 1.4453125, "learning_rate": 0.0002979969669137332, "loss": 4.9568, "mean_token_accuracy": 0.21896468698978425, "num_tokens": 105110702.0, "step": 60605 }, { "entropy": 5.990160894393921, "epoch": 4.715658432211632, "grad_norm": 1.4765625, "learning_rate": 0.000297969396298968, "loss": 4.9031, "mean_token_accuracy": 0.2238642618060112, "num_tokens": 105119408.0, "step": 60610 }, { "entropy": 5.94277024269104, "epoch": 4.71604746158335, "grad_norm": 1.5546875, "learning_rate": 0.0002979418253356788, "loss": 4.9559, "mean_token_accuracy": 0.2168534904718399, "num_tokens": 105127921.0, "step": 60615 }, { "entropy": 5.916078853607178, "epoch": 4.716436490955067, "grad_norm": 1.3671875, "learning_rate": 0.0002979142540242839, "loss": 4.9374, "mean_token_accuracy": 0.21593323051929475, "num_tokens": 105136660.0, "step": 60620 }, { "entropy": 5.937439012527466, "epoch": 4.716825520326784, "grad_norm": 1.40625, "learning_rate": 0.00029788668236520164, "loss": 5.01, "mean_token_accuracy": 0.21429550051689147, "num_tokens": 105145648.0, "step": 60625 }, { "entropy": 5.914355134963989, "epoch": 4.717214549698502, "grad_norm": 1.390625, "learning_rate": 0.00029785911035885046, "loss": 4.9314, "mean_token_accuracy": 0.22205056697130204, "num_tokens": 105154730.0, "step": 60630 }, { "entropy": 5.946883296966552, "epoch": 4.71760357907022, "grad_norm": 1.4296875, "learning_rate": 0.00029783153800564863, "loss": 4.9674, "mean_token_accuracy": 0.21616688668727874, "num_tokens": 105163771.0, "step": 60635 }, { "entropy": 5.935117244720459, "epoch": 4.7179926084419375, "grad_norm": 1.390625, "learning_rate": 0.00029780396530601456, "loss": 4.9761, "mean_token_accuracy": 0.21681013703346252, "num_tokens": 105172699.0, "step": 60640 }, { "entropy": 5.975795841217041, "epoch": 4.718381637813655, "grad_norm": 1.4375, "learning_rate": 0.00029777639226036663, "loss": 5.0161, "mean_token_accuracy": 0.21433059275150299, "num_tokens": 105180777.0, "step": 60645 }, { "entropy": 5.887193584442139, "epoch": 4.718770667185373, "grad_norm": 1.3515625, "learning_rate": 0.0002977488188691232, "loss": 4.9362, "mean_token_accuracy": 0.21883702427148818, "num_tokens": 105189858.0, "step": 60650 }, { "entropy": 6.016885375976562, "epoch": 4.7191596965570906, "grad_norm": 1.5078125, "learning_rate": 0.0002977212451327026, "loss": 5.0579, "mean_token_accuracy": 0.210029736161232, "num_tokens": 105198502.0, "step": 60655 }, { "entropy": 5.973077487945557, "epoch": 4.719548725928807, "grad_norm": 1.390625, "learning_rate": 0.0002976936710515233, "loss": 5.0542, "mean_token_accuracy": 0.21264886409044265, "num_tokens": 105207916.0, "step": 60660 }, { "entropy": 6.012224435806274, "epoch": 4.719937755300525, "grad_norm": 1.5234375, "learning_rate": 0.00029766609662600367, "loss": 4.9797, "mean_token_accuracy": 0.22141997367143632, "num_tokens": 105215355.0, "step": 60665 }, { "entropy": 6.002992153167725, "epoch": 4.720326784672243, "grad_norm": 1.3828125, "learning_rate": 0.00029763852185656206, "loss": 5.0291, "mean_token_accuracy": 0.20452914834022523, "num_tokens": 105224805.0, "step": 60670 }, { "entropy": 6.020327234268189, "epoch": 4.7207158140439605, "grad_norm": 1.453125, "learning_rate": 0.00029761094674361695, "loss": 4.9567, "mean_token_accuracy": 0.22562595456838608, "num_tokens": 105233219.0, "step": 60675 }, { "entropy": 5.889328289031982, "epoch": 4.721104843415678, "grad_norm": 1.4453125, "learning_rate": 0.00029758337128758675, "loss": 4.933, "mean_token_accuracy": 0.2189657673239708, "num_tokens": 105241895.0, "step": 60680 }, { "entropy": 5.8939097881317135, "epoch": 4.721493872787395, "grad_norm": 1.5, "learning_rate": 0.0002975557954888898, "loss": 4.8773, "mean_token_accuracy": 0.22120548784732819, "num_tokens": 105250058.0, "step": 60685 }, { "entropy": 5.994195985794067, "epoch": 4.721882902159113, "grad_norm": 1.453125, "learning_rate": 0.00029752821934794457, "loss": 4.9783, "mean_token_accuracy": 0.21168881356716157, "num_tokens": 105258946.0, "step": 60690 }, { "entropy": 5.9928162574768065, "epoch": 4.72227193153083, "grad_norm": 1.4140625, "learning_rate": 0.00029750064286516943, "loss": 5.0683, "mean_token_accuracy": 0.21164128482341765, "num_tokens": 105267598.0, "step": 60695 }, { "entropy": 6.010844087600708, "epoch": 4.722660960902548, "grad_norm": 1.5390625, "learning_rate": 0.0002974730660409828, "loss": 5.0126, "mean_token_accuracy": 0.21195673644542695, "num_tokens": 105275836.0, "step": 60700 }, { "entropy": 5.987272882461548, "epoch": 4.723049990274266, "grad_norm": 1.421875, "learning_rate": 0.00029744548887580325, "loss": 4.9631, "mean_token_accuracy": 0.2111201211810112, "num_tokens": 105284378.0, "step": 60705 }, { "entropy": 5.876537704467774, "epoch": 4.7234390196459834, "grad_norm": 1.421875, "learning_rate": 0.00029741791137004916, "loss": 4.8727, "mean_token_accuracy": 0.21991569101810454, "num_tokens": 105292575.0, "step": 60710 }, { "entropy": 5.943286991119384, "epoch": 4.723828049017701, "grad_norm": 1.375, "learning_rate": 0.00029739033352413883, "loss": 4.9955, "mean_token_accuracy": 0.21339594572782516, "num_tokens": 105301379.0, "step": 60715 }, { "entropy": 5.942796134948731, "epoch": 4.724217078389419, "grad_norm": 1.4921875, "learning_rate": 0.00029736275533849094, "loss": 4.9796, "mean_token_accuracy": 0.21703360825777054, "num_tokens": 105309043.0, "step": 60720 }, { "entropy": 5.972658920288086, "epoch": 4.724606107761136, "grad_norm": 1.5546875, "learning_rate": 0.0002973351768135239, "loss": 5.0126, "mean_token_accuracy": 0.2171315997838974, "num_tokens": 105317137.0, "step": 60725 }, { "entropy": 5.939786958694458, "epoch": 4.724995137132853, "grad_norm": 1.46875, "learning_rate": 0.00029730759794965595, "loss": 4.9143, "mean_token_accuracy": 0.2229238286614418, "num_tokens": 105325916.0, "step": 60730 }, { "entropy": 6.003970813751221, "epoch": 4.725384166504571, "grad_norm": 1.3671875, "learning_rate": 0.0002972800187473057, "loss": 5.0917, "mean_token_accuracy": 0.2137078672647476, "num_tokens": 105334694.0, "step": 60735 }, { "entropy": 5.905937147140503, "epoch": 4.725773195876289, "grad_norm": 1.3828125, "learning_rate": 0.00029725243920689163, "loss": 4.857, "mean_token_accuracy": 0.21843256950378417, "num_tokens": 105343604.0, "step": 60740 }, { "entropy": 5.9658522605896, "epoch": 4.726162225248006, "grad_norm": 1.4140625, "learning_rate": 0.00029722485932883233, "loss": 5.0316, "mean_token_accuracy": 0.20829534530639648, "num_tokens": 105351677.0, "step": 60745 }, { "entropy": 5.952255773544311, "epoch": 4.726551254619724, "grad_norm": 1.4375, "learning_rate": 0.00029719727911354604, "loss": 4.9439, "mean_token_accuracy": 0.2193733811378479, "num_tokens": 105360348.0, "step": 60750 }, { "entropy": 5.979145908355713, "epoch": 4.726940283991441, "grad_norm": 1.609375, "learning_rate": 0.00029716969856145143, "loss": 5.0877, "mean_token_accuracy": 0.2053809344768524, "num_tokens": 105368816.0, "step": 60755 }, { "entropy": 5.935454511642456, "epoch": 4.727329313363159, "grad_norm": 1.5078125, "learning_rate": 0.00029714211767296693, "loss": 4.9139, "mean_token_accuracy": 0.22055646479129792, "num_tokens": 105377524.0, "step": 60760 }, { "entropy": 6.0137535572052006, "epoch": 4.727718342734876, "grad_norm": 1.4453125, "learning_rate": 0.0002971145364485111, "loss": 4.9968, "mean_token_accuracy": 0.21270500868558884, "num_tokens": 105386349.0, "step": 60765 }, { "entropy": 5.996789264678955, "epoch": 4.728107372106594, "grad_norm": 1.4921875, "learning_rate": 0.0002970869548885023, "loss": 4.9733, "mean_token_accuracy": 0.2200220748782158, "num_tokens": 105394995.0, "step": 60770 }, { "entropy": 5.925554895401001, "epoch": 4.728496401478312, "grad_norm": 1.5390625, "learning_rate": 0.0002970593729933591, "loss": 4.9539, "mean_token_accuracy": 0.21670310348272323, "num_tokens": 105403820.0, "step": 60775 }, { "entropy": 6.018563604354858, "epoch": 4.728885430850029, "grad_norm": 1.40625, "learning_rate": 0.00029703179076350005, "loss": 5.0773, "mean_token_accuracy": 0.21080236583948136, "num_tokens": 105413108.0, "step": 60780 }, { "entropy": 5.948452949523926, "epoch": 4.729274460221747, "grad_norm": 1.359375, "learning_rate": 0.00029700420819934363, "loss": 4.9261, "mean_token_accuracy": 0.21941008269786835, "num_tokens": 105420405.0, "step": 60785 }, { "entropy": 5.890806341171265, "epoch": 4.729663489593464, "grad_norm": 1.4453125, "learning_rate": 0.00029697662530130836, "loss": 4.9364, "mean_token_accuracy": 0.21683682054281234, "num_tokens": 105428737.0, "step": 60790 }, { "entropy": 5.87924280166626, "epoch": 4.730052518965182, "grad_norm": 1.3828125, "learning_rate": 0.0002969490420698129, "loss": 4.947, "mean_token_accuracy": 0.22036742866039277, "num_tokens": 105437680.0, "step": 60795 }, { "entropy": 5.967392492294311, "epoch": 4.730441548336899, "grad_norm": 1.34375, "learning_rate": 0.00029692145850527553, "loss": 4.9147, "mean_token_accuracy": 0.21189166903495787, "num_tokens": 105446329.0, "step": 60800 }, { "entropy": 6.0005714893341064, "epoch": 4.730830577708617, "grad_norm": 1.4375, "learning_rate": 0.00029689387460811494, "loss": 5.0242, "mean_token_accuracy": 0.20486094951629638, "num_tokens": 105455278.0, "step": 60805 }, { "entropy": 5.9375592231750485, "epoch": 4.731219607080335, "grad_norm": 1.34375, "learning_rate": 0.0002968662903787497, "loss": 4.9872, "mean_token_accuracy": 0.21125925928354264, "num_tokens": 105464384.0, "step": 60810 }, { "entropy": 5.871532535552978, "epoch": 4.731608636452052, "grad_norm": 1.421875, "learning_rate": 0.0002968387058175983, "loss": 4.9136, "mean_token_accuracy": 0.22466182410717012, "num_tokens": 105473637.0, "step": 60815 }, { "entropy": 5.976289176940918, "epoch": 4.731997665823769, "grad_norm": 1.3984375, "learning_rate": 0.0002968111209250792, "loss": 4.9624, "mean_token_accuracy": 0.2125663548707962, "num_tokens": 105481975.0, "step": 60820 }, { "entropy": 5.9756158828735355, "epoch": 4.732386695195487, "grad_norm": 1.4375, "learning_rate": 0.00029678353570161117, "loss": 5.0436, "mean_token_accuracy": 0.20751359760761262, "num_tokens": 105490464.0, "step": 60825 }, { "entropy": 5.970704555511475, "epoch": 4.732775724567205, "grad_norm": 1.4765625, "learning_rate": 0.0002967559501476126, "loss": 5.0516, "mean_token_accuracy": 0.20667077749967575, "num_tokens": 105498777.0, "step": 60830 }, { "entropy": 6.009219408035278, "epoch": 4.733164753938922, "grad_norm": 1.546875, "learning_rate": 0.00029672836426350213, "loss": 5.0919, "mean_token_accuracy": 0.20572975575923919, "num_tokens": 105507629.0, "step": 60835 }, { "entropy": 6.026579856872559, "epoch": 4.73355378331064, "grad_norm": 1.3984375, "learning_rate": 0.00029670077804969835, "loss": 5.0575, "mean_token_accuracy": 0.20777708739042283, "num_tokens": 105516193.0, "step": 60840 }, { "entropy": 5.957734537124634, "epoch": 4.733942812682358, "grad_norm": 1.3671875, "learning_rate": 0.00029667319150661976, "loss": 4.9815, "mean_token_accuracy": 0.21069980412721634, "num_tokens": 105524912.0, "step": 60845 }, { "entropy": 5.912285900115966, "epoch": 4.734331842054075, "grad_norm": 1.3984375, "learning_rate": 0.000296645604634685, "loss": 4.8911, "mean_token_accuracy": 0.2256319835782051, "num_tokens": 105533594.0, "step": 60850 }, { "entropy": 5.954019260406494, "epoch": 4.734720871425793, "grad_norm": 1.4609375, "learning_rate": 0.0002966180174343127, "loss": 4.9664, "mean_token_accuracy": 0.21778521090745925, "num_tokens": 105541896.0, "step": 60855 }, { "entropy": 5.923523473739624, "epoch": 4.73510990079751, "grad_norm": 1.375, "learning_rate": 0.00029659042990592125, "loss": 4.9674, "mean_token_accuracy": 0.21479176431894303, "num_tokens": 105551132.0, "step": 60860 }, { "entropy": 5.915620756149292, "epoch": 4.735498930169228, "grad_norm": 1.375, "learning_rate": 0.0002965628420499295, "loss": 4.9069, "mean_token_accuracy": 0.22410782277584076, "num_tokens": 105560223.0, "step": 60865 }, { "entropy": 5.940981769561768, "epoch": 4.735887959540945, "grad_norm": 1.4609375, "learning_rate": 0.0002965352538667559, "loss": 4.923, "mean_token_accuracy": 0.22479704767465591, "num_tokens": 105569282.0, "step": 60870 }, { "entropy": 5.902200412750244, "epoch": 4.736276988912663, "grad_norm": 1.4375, "learning_rate": 0.00029650766535681917, "loss": 4.87, "mean_token_accuracy": 0.22129233479499816, "num_tokens": 105577302.0, "step": 60875 }, { "entropy": 5.926599407196045, "epoch": 4.736666018284381, "grad_norm": 1.6328125, "learning_rate": 0.00029648007652053774, "loss": 4.9775, "mean_token_accuracy": 0.2240156874060631, "num_tokens": 105586163.0, "step": 60880 }, { "entropy": 5.897101783752442, "epoch": 4.737055047656098, "grad_norm": 1.40625, "learning_rate": 0.00029645248735833045, "loss": 4.9338, "mean_token_accuracy": 0.21011360585689545, "num_tokens": 105594739.0, "step": 60885 }, { "entropy": 5.911568355560303, "epoch": 4.737444077027815, "grad_norm": 1.3984375, "learning_rate": 0.00029642489787061574, "loss": 4.8915, "mean_token_accuracy": 0.21753791570663453, "num_tokens": 105604012.0, "step": 60890 }, { "entropy": 5.944912719726562, "epoch": 4.737833106399533, "grad_norm": 1.4453125, "learning_rate": 0.0002963973080578123, "loss": 4.9101, "mean_token_accuracy": 0.21998822689056396, "num_tokens": 105612217.0, "step": 60895 }, { "entropy": 6.032860469818115, "epoch": 4.738222135771251, "grad_norm": 1.390625, "learning_rate": 0.00029636971792033873, "loss": 5.1235, "mean_token_accuracy": 0.2030549317598343, "num_tokens": 105622062.0, "step": 60900 }, { "entropy": 5.939892435073853, "epoch": 4.738611165142968, "grad_norm": 1.46875, "learning_rate": 0.0002963421274586138, "loss": 4.9551, "mean_token_accuracy": 0.22139153331518174, "num_tokens": 105630415.0, "step": 60905 }, { "entropy": 5.951379251480103, "epoch": 4.739000194514686, "grad_norm": 1.53125, "learning_rate": 0.00029631453667305603, "loss": 4.9344, "mean_token_accuracy": 0.21685852557420732, "num_tokens": 105638631.0, "step": 60910 }, { "entropy": 5.997984123229981, "epoch": 4.739389223886404, "grad_norm": 1.3671875, "learning_rate": 0.0002962869455640841, "loss": 5.0164, "mean_token_accuracy": 0.21207151263952256, "num_tokens": 105647448.0, "step": 60915 }, { "entropy": 5.891494464874268, "epoch": 4.739778253258121, "grad_norm": 1.34375, "learning_rate": 0.0002962593541321167, "loss": 4.8594, "mean_token_accuracy": 0.23076231628656388, "num_tokens": 105655600.0, "step": 60920 }, { "entropy": 5.936135482788086, "epoch": 4.740167282629838, "grad_norm": 1.515625, "learning_rate": 0.0002962317623775723, "loss": 4.9083, "mean_token_accuracy": 0.22458963841199875, "num_tokens": 105663619.0, "step": 60925 }, { "entropy": 5.975107479095459, "epoch": 4.740556312001556, "grad_norm": 1.4609375, "learning_rate": 0.00029620417030086976, "loss": 4.9563, "mean_token_accuracy": 0.21841800659894944, "num_tokens": 105671835.0, "step": 60930 }, { "entropy": 5.978746509552002, "epoch": 4.740945341373274, "grad_norm": 1.5546875, "learning_rate": 0.00029617657790242767, "loss": 4.9772, "mean_token_accuracy": 0.21409225314855576, "num_tokens": 105680334.0, "step": 60935 }, { "entropy": 5.94514536857605, "epoch": 4.741334370744991, "grad_norm": 1.484375, "learning_rate": 0.00029614898518266476, "loss": 5.0151, "mean_token_accuracy": 0.21008685529232024, "num_tokens": 105689374.0, "step": 60940 }, { "entropy": 5.929374265670776, "epoch": 4.741723400116709, "grad_norm": 1.515625, "learning_rate": 0.0002961213921419997, "loss": 4.9669, "mean_token_accuracy": 0.2112218737602234, "num_tokens": 105698008.0, "step": 60945 }, { "entropy": 5.887220001220703, "epoch": 4.742112429488427, "grad_norm": 1.375, "learning_rate": 0.000296093798780851, "loss": 4.9481, "mean_token_accuracy": 0.2213636502623558, "num_tokens": 105706574.0, "step": 60950 }, { "entropy": 6.001836252212525, "epoch": 4.7425014588601435, "grad_norm": 1.5546875, "learning_rate": 0.0002960662050996377, "loss": 5.0464, "mean_token_accuracy": 0.21277009397745134, "num_tokens": 105715123.0, "step": 60955 }, { "entropy": 6.0183172702789305, "epoch": 4.742890488231861, "grad_norm": 1.46875, "learning_rate": 0.00029603861109877807, "loss": 5.0486, "mean_token_accuracy": 0.2006484717130661, "num_tokens": 105723773.0, "step": 60960 }, { "entropy": 6.060317325592041, "epoch": 4.743279517603579, "grad_norm": 1.375, "learning_rate": 0.00029601101677869106, "loss": 5.084, "mean_token_accuracy": 0.20515455454587936, "num_tokens": 105732374.0, "step": 60965 }, { "entropy": 6.003231716156006, "epoch": 4.743668546975297, "grad_norm": 1.4375, "learning_rate": 0.0002959834221397952, "loss": 5.0577, "mean_token_accuracy": 0.20738590657711028, "num_tokens": 105741527.0, "step": 60970 }, { "entropy": 5.91450252532959, "epoch": 4.744057576347014, "grad_norm": 1.40625, "learning_rate": 0.00029595582718250954, "loss": 4.9147, "mean_token_accuracy": 0.22071204632520675, "num_tokens": 105750484.0, "step": 60975 }, { "entropy": 5.944791698455811, "epoch": 4.744446605718732, "grad_norm": 1.484375, "learning_rate": 0.0002959282319072524, "loss": 4.9402, "mean_token_accuracy": 0.21476669311523439, "num_tokens": 105759404.0, "step": 60980 }, { "entropy": 5.957839679718018, "epoch": 4.74483563509045, "grad_norm": 1.515625, "learning_rate": 0.0002959006363144427, "loss": 4.9771, "mean_token_accuracy": 0.21243807226419448, "num_tokens": 105767188.0, "step": 60985 }, { "entropy": 5.95011682510376, "epoch": 4.7452246644621665, "grad_norm": 1.5, "learning_rate": 0.0002958730404044991, "loss": 5.0201, "mean_token_accuracy": 0.21458264142274858, "num_tokens": 105775862.0, "step": 60990 }, { "entropy": 5.887906789779663, "epoch": 4.745613693833884, "grad_norm": 1.4921875, "learning_rate": 0.0002958454441778403, "loss": 4.9093, "mean_token_accuracy": 0.2127907857298851, "num_tokens": 105784253.0, "step": 60995 }, { "entropy": 5.959939002990723, "epoch": 4.746002723205602, "grad_norm": 1.421875, "learning_rate": 0.00029581784763488506, "loss": 5.0213, "mean_token_accuracy": 0.20706727504730224, "num_tokens": 105792943.0, "step": 61000 }, { "entropy": 5.986517333984375, "epoch": 4.74639175257732, "grad_norm": 1.3984375, "learning_rate": 0.0002957902507760522, "loss": 4.9538, "mean_token_accuracy": 0.22315257638692856, "num_tokens": 105801764.0, "step": 61005 }, { "entropy": 5.910501003265381, "epoch": 4.746780781949037, "grad_norm": 1.5, "learning_rate": 0.0002957626536017603, "loss": 4.9266, "mean_token_accuracy": 0.2222191348671913, "num_tokens": 105809842.0, "step": 61010 }, { "entropy": 5.953701782226562, "epoch": 4.747169811320755, "grad_norm": 1.5, "learning_rate": 0.0002957350561124282, "loss": 5.016, "mean_token_accuracy": 0.21612288057804108, "num_tokens": 105817535.0, "step": 61015 }, { "entropy": 5.916814661026001, "epoch": 4.747558840692472, "grad_norm": 1.359375, "learning_rate": 0.0002957074583084747, "loss": 4.9272, "mean_token_accuracy": 0.221745041012764, "num_tokens": 105826838.0, "step": 61020 }, { "entropy": 6.031156158447265, "epoch": 4.7479478700641895, "grad_norm": 1.328125, "learning_rate": 0.0002956798601903184, "loss": 5.0126, "mean_token_accuracy": 0.21212237924337388, "num_tokens": 105836603.0, "step": 61025 }, { "entropy": 6.025122261047363, "epoch": 4.748336899435907, "grad_norm": 1.3359375, "learning_rate": 0.00029565226175837814, "loss": 5.0365, "mean_token_accuracy": 0.20759295523166657, "num_tokens": 105845888.0, "step": 61030 }, { "entropy": 5.971699666976929, "epoch": 4.748725928807625, "grad_norm": 1.4375, "learning_rate": 0.0002956246630130727, "loss": 4.9072, "mean_token_accuracy": 0.21607222706079482, "num_tokens": 105854736.0, "step": 61035 }, { "entropy": 5.959136724472046, "epoch": 4.749114958179343, "grad_norm": 1.4296875, "learning_rate": 0.00029559706395482075, "loss": 5.0049, "mean_token_accuracy": 0.2072744369506836, "num_tokens": 105863423.0, "step": 61040 }, { "entropy": 5.929248857498169, "epoch": 4.74950398755106, "grad_norm": 1.421875, "learning_rate": 0.00029556946458404124, "loss": 4.931, "mean_token_accuracy": 0.21890706717967987, "num_tokens": 105871656.0, "step": 61045 }, { "entropy": 5.958563041687012, "epoch": 4.749893016922778, "grad_norm": 1.4609375, "learning_rate": 0.00029554186490115284, "loss": 5.0474, "mean_token_accuracy": 0.2163580521941185, "num_tokens": 105881119.0, "step": 61050 }, { "entropy": 5.964885282516479, "epoch": 4.750282046294496, "grad_norm": 1.4296875, "learning_rate": 0.0002955142649065743, "loss": 4.9827, "mean_token_accuracy": 0.21643858253955842, "num_tokens": 105889601.0, "step": 61055 }, { "entropy": 6.027698373794555, "epoch": 4.7506710756662125, "grad_norm": 1.375, "learning_rate": 0.0002954866646007244, "loss": 5.0, "mean_token_accuracy": 0.20681782215833663, "num_tokens": 105898106.0, "step": 61060 }, { "entropy": 5.921792125701904, "epoch": 4.75106010503793, "grad_norm": 1.3671875, "learning_rate": 0.00029545906398402205, "loss": 4.891, "mean_token_accuracy": 0.2256097063422203, "num_tokens": 105907403.0, "step": 61065 }, { "entropy": 5.930987119674683, "epoch": 4.751449134409648, "grad_norm": 1.5, "learning_rate": 0.00029543146305688594, "loss": 4.9998, "mean_token_accuracy": 0.2158896416425705, "num_tokens": 105916097.0, "step": 61070 }, { "entropy": 5.940780353546143, "epoch": 4.751838163781366, "grad_norm": 1.5859375, "learning_rate": 0.0002954038618197349, "loss": 4.8886, "mean_token_accuracy": 0.2247534692287445, "num_tokens": 105924511.0, "step": 61075 }, { "entropy": 6.03198938369751, "epoch": 4.752227193153083, "grad_norm": 1.4921875, "learning_rate": 0.0002953762602729877, "loss": 5.0705, "mean_token_accuracy": 0.20593287646770478, "num_tokens": 105933904.0, "step": 61080 }, { "entropy": 6.03869047164917, "epoch": 4.752616222524801, "grad_norm": 1.421875, "learning_rate": 0.00029534865841706324, "loss": 4.997, "mean_token_accuracy": 0.21649632900953292, "num_tokens": 105942581.0, "step": 61085 }, { "entropy": 5.999623394012451, "epoch": 4.753005251896518, "grad_norm": 1.546875, "learning_rate": 0.0002953210562523803, "loss": 4.9509, "mean_token_accuracy": 0.21703209429979325, "num_tokens": 105950526.0, "step": 61090 }, { "entropy": 5.921844863891602, "epoch": 4.7533942812682355, "grad_norm": 1.4375, "learning_rate": 0.0002952934537793576, "loss": 4.9216, "mean_token_accuracy": 0.21889466494321824, "num_tokens": 105959668.0, "step": 61095 }, { "entropy": 5.94790358543396, "epoch": 4.753783310639953, "grad_norm": 1.46875, "learning_rate": 0.00029526585099841395, "loss": 5.0304, "mean_token_accuracy": 0.21065551340579985, "num_tokens": 105968556.0, "step": 61100 }, { "entropy": 5.953811836242676, "epoch": 4.754172340011671, "grad_norm": 1.5078125, "learning_rate": 0.00029523824790996845, "loss": 4.9311, "mean_token_accuracy": 0.2210144206881523, "num_tokens": 105976709.0, "step": 61105 }, { "entropy": 5.933486604690552, "epoch": 4.754561369383389, "grad_norm": 1.4453125, "learning_rate": 0.00029521064451443966, "loss": 4.9318, "mean_token_accuracy": 0.21330556869506836, "num_tokens": 105985490.0, "step": 61110 }, { "entropy": 6.007768011093139, "epoch": 4.754950398755106, "grad_norm": 1.4609375, "learning_rate": 0.00029518304081224656, "loss": 5.0859, "mean_token_accuracy": 0.20099729001522065, "num_tokens": 105994530.0, "step": 61115 }, { "entropy": 5.968001794815064, "epoch": 4.755339428126824, "grad_norm": 1.34375, "learning_rate": 0.00029515543680380793, "loss": 4.9028, "mean_token_accuracy": 0.21956778913736344, "num_tokens": 106003960.0, "step": 61120 }, { "entropy": 5.915892457962036, "epoch": 4.755728457498541, "grad_norm": 1.5390625, "learning_rate": 0.00029512783248954253, "loss": 4.932, "mean_token_accuracy": 0.2177500158548355, "num_tokens": 106013390.0, "step": 61125 }, { "entropy": 6.009138202667236, "epoch": 4.7561174868702585, "grad_norm": 1.5234375, "learning_rate": 0.0002951002278698695, "loss": 5.0537, "mean_token_accuracy": 0.21438927054405213, "num_tokens": 106021644.0, "step": 61130 }, { "entropy": 5.9981162548065186, "epoch": 4.756506516241976, "grad_norm": 1.390625, "learning_rate": 0.00029507262294520726, "loss": 4.9431, "mean_token_accuracy": 0.22104644775390625, "num_tokens": 106030300.0, "step": 61135 }, { "entropy": 5.89173731803894, "epoch": 4.756895545613694, "grad_norm": 1.3828125, "learning_rate": 0.0002950450177159751, "loss": 4.8331, "mean_token_accuracy": 0.22320046573877333, "num_tokens": 106038965.0, "step": 61140 }, { "entropy": 5.999897146224976, "epoch": 4.757284574985412, "grad_norm": 1.4609375, "learning_rate": 0.00029501741218259167, "loss": 5.0022, "mean_token_accuracy": 0.22010022401809692, "num_tokens": 106047526.0, "step": 61145 }, { "entropy": 5.879130601882935, "epoch": 4.757673604357129, "grad_norm": 1.453125, "learning_rate": 0.00029498980634547585, "loss": 4.8859, "mean_token_accuracy": 0.21886476874351501, "num_tokens": 106056429.0, "step": 61150 }, { "entropy": 5.920104837417602, "epoch": 4.758062633728846, "grad_norm": 1.4296875, "learning_rate": 0.00029496220020504656, "loss": 4.986, "mean_token_accuracy": 0.2122851312160492, "num_tokens": 106064596.0, "step": 61155 }, { "entropy": 5.968941020965576, "epoch": 4.758451663100564, "grad_norm": 1.4765625, "learning_rate": 0.00029493459376172263, "loss": 4.9876, "mean_token_accuracy": 0.2206583634018898, "num_tokens": 106072379.0, "step": 61160 }, { "entropy": 5.987525844573975, "epoch": 4.7588406924722815, "grad_norm": 1.453125, "learning_rate": 0.0002949069870159229, "loss": 4.97, "mean_token_accuracy": 0.2173006147146225, "num_tokens": 106080910.0, "step": 61165 }, { "entropy": 5.9502486228942875, "epoch": 4.759229721843999, "grad_norm": 1.4296875, "learning_rate": 0.00029487937996806635, "loss": 4.9645, "mean_token_accuracy": 0.21928199529647827, "num_tokens": 106089814.0, "step": 61170 }, { "entropy": 5.96786470413208, "epoch": 4.759618751215717, "grad_norm": 1.4609375, "learning_rate": 0.00029485177261857193, "loss": 4.9769, "mean_token_accuracy": 0.20693484246730803, "num_tokens": 106098206.0, "step": 61175 }, { "entropy": 5.885225534439087, "epoch": 4.760007780587435, "grad_norm": 1.5, "learning_rate": 0.0002948241649678584, "loss": 4.9176, "mean_token_accuracy": 0.22199296951293945, "num_tokens": 106107516.0, "step": 61180 }, { "entropy": 5.893211364746094, "epoch": 4.760396809959152, "grad_norm": 1.4609375, "learning_rate": 0.0002947965570163448, "loss": 4.9057, "mean_token_accuracy": 0.2103322848677635, "num_tokens": 106116407.0, "step": 61185 }, { "entropy": 5.976173543930054, "epoch": 4.76078583933087, "grad_norm": 1.546875, "learning_rate": 0.0002947689487644499, "loss": 5.0779, "mean_token_accuracy": 0.2085563987493515, "num_tokens": 106125761.0, "step": 61190 }, { "entropy": 6.0021806240081785, "epoch": 4.761174868702587, "grad_norm": 1.359375, "learning_rate": 0.0002947413402125927, "loss": 4.9927, "mean_token_accuracy": 0.21025941967964173, "num_tokens": 106135220.0, "step": 61195 }, { "entropy": 6.054682445526123, "epoch": 4.7615638980743045, "grad_norm": 1.4375, "learning_rate": 0.0002947137313611919, "loss": 5.0172, "mean_token_accuracy": 0.2104533925652504, "num_tokens": 106143851.0, "step": 61200 }, { "entropy": 5.972072982788086, "epoch": 4.761952927446022, "grad_norm": 1.546875, "learning_rate": 0.00029468612221066683, "loss": 4.9278, "mean_token_accuracy": 0.2175328776240349, "num_tokens": 106152681.0, "step": 61205 }, { "entropy": 5.921595668792724, "epoch": 4.76234195681774, "grad_norm": 1.5, "learning_rate": 0.0002946585127614361, "loss": 5.0083, "mean_token_accuracy": 0.21182254254817962, "num_tokens": 106161805.0, "step": 61210 }, { "entropy": 5.985337734222412, "epoch": 4.762730986189458, "grad_norm": 1.4375, "learning_rate": 0.0002946309030139188, "loss": 5.0528, "mean_token_accuracy": 0.21301131099462509, "num_tokens": 106170308.0, "step": 61215 }, { "entropy": 6.025498294830323, "epoch": 4.763120015561174, "grad_norm": 1.390625, "learning_rate": 0.0002946032929685337, "loss": 5.0587, "mean_token_accuracy": 0.2182350665330887, "num_tokens": 106179280.0, "step": 61220 }, { "entropy": 5.917948532104492, "epoch": 4.763509044932892, "grad_norm": 1.453125, "learning_rate": 0.0002945756826256999, "loss": 4.9209, "mean_token_accuracy": 0.21364012211561204, "num_tokens": 106188467.0, "step": 61225 }, { "entropy": 5.927189683914184, "epoch": 4.76389807430461, "grad_norm": 1.3828125, "learning_rate": 0.0002945480719858363, "loss": 4.9309, "mean_token_accuracy": 0.21511257588863372, "num_tokens": 106197479.0, "step": 61230 }, { "entropy": 6.102901363372803, "epoch": 4.7642871036763275, "grad_norm": 1.5, "learning_rate": 0.0002945204610493617, "loss": 5.0121, "mean_token_accuracy": 0.21197570860385895, "num_tokens": 106205608.0, "step": 61235 }, { "entropy": 5.960202360153199, "epoch": 4.764676133048045, "grad_norm": 1.3203125, "learning_rate": 0.00029449284981669524, "loss": 4.96, "mean_token_accuracy": 0.21512148827314376, "num_tokens": 106214719.0, "step": 61240 }, { "entropy": 5.913327980041504, "epoch": 4.765065162419763, "grad_norm": 1.515625, "learning_rate": 0.00029446523828825577, "loss": 4.9424, "mean_token_accuracy": 0.21678148657083512, "num_tokens": 106223372.0, "step": 61245 }, { "entropy": 5.923130178451538, "epoch": 4.7654541917914806, "grad_norm": 1.5078125, "learning_rate": 0.0002944376264644624, "loss": 4.9586, "mean_token_accuracy": 0.21946075558662415, "num_tokens": 106231342.0, "step": 61250 }, { "entropy": 5.958522319793701, "epoch": 4.765843221163198, "grad_norm": 1.4296875, "learning_rate": 0.0002944100143457339, "loss": 5.0045, "mean_token_accuracy": 0.2105649530887604, "num_tokens": 106238702.0, "step": 61255 }, { "entropy": 5.984606313705444, "epoch": 4.766232250534915, "grad_norm": 1.3359375, "learning_rate": 0.0002943824019324893, "loss": 4.9597, "mean_token_accuracy": 0.2206313580274582, "num_tokens": 106246585.0, "step": 61260 }, { "entropy": 5.923702096939087, "epoch": 4.766621279906633, "grad_norm": 1.4765625, "learning_rate": 0.0002943547892251476, "loss": 4.9355, "mean_token_accuracy": 0.21878782361745835, "num_tokens": 106254685.0, "step": 61265 }, { "entropy": 5.880874347686768, "epoch": 4.7670103092783505, "grad_norm": 1.578125, "learning_rate": 0.00029432717622412784, "loss": 4.9339, "mean_token_accuracy": 0.21842967867851257, "num_tokens": 106263115.0, "step": 61270 }, { "entropy": 5.964881229400635, "epoch": 4.767399338650068, "grad_norm": 1.3671875, "learning_rate": 0.00029429956292984893, "loss": 5.0129, "mean_token_accuracy": 0.20675815939903258, "num_tokens": 106271621.0, "step": 61275 }, { "entropy": 5.899925422668457, "epoch": 4.767788368021786, "grad_norm": 1.40625, "learning_rate": 0.0002942719493427299, "loss": 4.8709, "mean_token_accuracy": 0.2250313177704811, "num_tokens": 106280276.0, "step": 61280 }, { "entropy": 5.958998823165894, "epoch": 4.7681773973935035, "grad_norm": 1.5078125, "learning_rate": 0.0002942443354631897, "loss": 4.9166, "mean_token_accuracy": 0.2255090057849884, "num_tokens": 106288117.0, "step": 61285 }, { "entropy": 5.8781343460083, "epoch": 4.76856642676522, "grad_norm": 1.3828125, "learning_rate": 0.00029421672129164726, "loss": 4.9348, "mean_token_accuracy": 0.22266266644001007, "num_tokens": 106296794.0, "step": 61290 }, { "entropy": 5.848884773254395, "epoch": 4.768955456136938, "grad_norm": 1.40625, "learning_rate": 0.00029418910682852176, "loss": 4.9227, "mean_token_accuracy": 0.22358662784099578, "num_tokens": 106305706.0, "step": 61295 }, { "entropy": 5.894838809967041, "epoch": 4.769344485508656, "grad_norm": 1.34375, "learning_rate": 0.00029416149207423203, "loss": 4.9445, "mean_token_accuracy": 0.21766692101955415, "num_tokens": 106314827.0, "step": 61300 }, { "entropy": 5.948349285125732, "epoch": 4.7697335148803734, "grad_norm": 1.4453125, "learning_rate": 0.00029413387702919723, "loss": 4.9466, "mean_token_accuracy": 0.2217831239104271, "num_tokens": 106323086.0, "step": 61305 }, { "entropy": 5.932986259460449, "epoch": 4.770122544252091, "grad_norm": 1.4140625, "learning_rate": 0.00029410626169383623, "loss": 4.9807, "mean_token_accuracy": 0.21633775234222413, "num_tokens": 106332152.0, "step": 61310 }, { "entropy": 5.946397924423218, "epoch": 4.770511573623809, "grad_norm": 1.453125, "learning_rate": 0.00029407864606856814, "loss": 4.9208, "mean_token_accuracy": 0.2188173398375511, "num_tokens": 106341125.0, "step": 61315 }, { "entropy": 5.9035626411437985, "epoch": 4.7709006029955265, "grad_norm": 1.4375, "learning_rate": 0.000294051030153812, "loss": 4.8578, "mean_token_accuracy": 0.2178629919886589, "num_tokens": 106349825.0, "step": 61320 }, { "entropy": 5.94481840133667, "epoch": 4.771289632367243, "grad_norm": 1.4453125, "learning_rate": 0.0002940234139499868, "loss": 4.9365, "mean_token_accuracy": 0.21076703667640687, "num_tokens": 106358081.0, "step": 61325 }, { "entropy": 5.882958889007568, "epoch": 4.771678661738961, "grad_norm": 1.3359375, "learning_rate": 0.00029399579745751156, "loss": 4.9758, "mean_token_accuracy": 0.21090442091226577, "num_tokens": 106366624.0, "step": 61330 }, { "entropy": 5.9713812351226805, "epoch": 4.772067691110679, "grad_norm": 1.5546875, "learning_rate": 0.00029396818067680525, "loss": 4.9817, "mean_token_accuracy": 0.2186049520969391, "num_tokens": 106374584.0, "step": 61335 }, { "entropy": 6.042605352401734, "epoch": 4.772456720482396, "grad_norm": 1.40625, "learning_rate": 0.00029394056360828707, "loss": 4.9759, "mean_token_accuracy": 0.21666189283132553, "num_tokens": 106383553.0, "step": 61340 }, { "entropy": 5.983492183685303, "epoch": 4.772845749854114, "grad_norm": 1.4453125, "learning_rate": 0.00029391294625237595, "loss": 4.9441, "mean_token_accuracy": 0.21907827109098435, "num_tokens": 106392431.0, "step": 61345 }, { "entropy": 5.862145137786865, "epoch": 4.773234779225832, "grad_norm": 1.4140625, "learning_rate": 0.0002938853286094911, "loss": 4.8869, "mean_token_accuracy": 0.21722941100597382, "num_tokens": 106400766.0, "step": 61350 }, { "entropy": 5.952121877670288, "epoch": 4.773623808597549, "grad_norm": 1.4296875, "learning_rate": 0.00029385771068005123, "loss": 5.0138, "mean_token_accuracy": 0.21859457790851594, "num_tokens": 106409484.0, "step": 61355 }, { "entropy": 5.9057807445526125, "epoch": 4.774012837969266, "grad_norm": 1.34375, "learning_rate": 0.0002938300924644757, "loss": 4.9436, "mean_token_accuracy": 0.21534850746393203, "num_tokens": 106418346.0, "step": 61360 }, { "entropy": 5.926250982284546, "epoch": 4.774401867340984, "grad_norm": 1.453125, "learning_rate": 0.00029380247396318355, "loss": 4.9524, "mean_token_accuracy": 0.2181362509727478, "num_tokens": 106427036.0, "step": 61365 }, { "entropy": 5.884410667419433, "epoch": 4.774790896712702, "grad_norm": 1.34375, "learning_rate": 0.0002937748551765937, "loss": 4.9217, "mean_token_accuracy": 0.21096862703561783, "num_tokens": 106436466.0, "step": 61370 }, { "entropy": 6.032669305801392, "epoch": 4.775179926084419, "grad_norm": 1.4765625, "learning_rate": 0.0002937472361051254, "loss": 5.0932, "mean_token_accuracy": 0.20683833956718445, "num_tokens": 106444715.0, "step": 61375 }, { "entropy": 5.998015022277832, "epoch": 4.775568955456137, "grad_norm": 1.5234375, "learning_rate": 0.0002937196167491976, "loss": 4.9229, "mean_token_accuracy": 0.21962317526340486, "num_tokens": 106452508.0, "step": 61380 }, { "entropy": 5.949276447296143, "epoch": 4.775957984827855, "grad_norm": 1.46875, "learning_rate": 0.00029369199710922944, "loss": 4.9289, "mean_token_accuracy": 0.220414000749588, "num_tokens": 106461194.0, "step": 61385 }, { "entropy": 5.86795711517334, "epoch": 4.7763470141995725, "grad_norm": 1.5390625, "learning_rate": 0.00029366437718563994, "loss": 5.035, "mean_token_accuracy": 0.20605459362268447, "num_tokens": 106470450.0, "step": 61390 }, { "entropy": 5.99954776763916, "epoch": 4.776736043571289, "grad_norm": 1.4296875, "learning_rate": 0.0002936367569788482, "loss": 5.0247, "mean_token_accuracy": 0.20747994184494017, "num_tokens": 106479338.0, "step": 61395 }, { "entropy": 6.005270290374756, "epoch": 4.777125072943007, "grad_norm": 1.453125, "learning_rate": 0.0002936091364892733, "loss": 4.9403, "mean_token_accuracy": 0.21769641041755677, "num_tokens": 106488035.0, "step": 61400 }, { "entropy": 5.9399219989776615, "epoch": 4.777514102314725, "grad_norm": 1.4765625, "learning_rate": 0.00029358151571733446, "loss": 4.9417, "mean_token_accuracy": 0.20748697966337204, "num_tokens": 106496190.0, "step": 61405 }, { "entropy": 5.931431245803833, "epoch": 4.777903131686442, "grad_norm": 1.5390625, "learning_rate": 0.00029355389466345064, "loss": 5.0024, "mean_token_accuracy": 0.20970351994037628, "num_tokens": 106504894.0, "step": 61410 }, { "entropy": 5.992014169692993, "epoch": 4.77829216105816, "grad_norm": 1.4375, "learning_rate": 0.00029352627332804104, "loss": 5.0482, "mean_token_accuracy": 0.20823558270931244, "num_tokens": 106513506.0, "step": 61415 }, { "entropy": 5.973284530639648, "epoch": 4.778681190429878, "grad_norm": 1.3984375, "learning_rate": 0.00029349865171152475, "loss": 4.8937, "mean_token_accuracy": 0.2211463361978531, "num_tokens": 106522354.0, "step": 61420 }, { "entropy": 6.0235950469970705, "epoch": 4.779070219801595, "grad_norm": 1.328125, "learning_rate": 0.00029347102981432084, "loss": 5.1218, "mean_token_accuracy": 0.2072615757584572, "num_tokens": 106531516.0, "step": 61425 }, { "entropy": 5.907263469696045, "epoch": 4.779459249173312, "grad_norm": 1.53125, "learning_rate": 0.0002934434076368484, "loss": 4.9271, "mean_token_accuracy": 0.2165688768029213, "num_tokens": 106539759.0, "step": 61430 }, { "entropy": 5.994666194915771, "epoch": 4.77984827854503, "grad_norm": 1.4453125, "learning_rate": 0.0002934157851795266, "loss": 5.0082, "mean_token_accuracy": 0.21297886669635774, "num_tokens": 106548421.0, "step": 61435 }, { "entropy": 6.004288053512573, "epoch": 4.780237307916748, "grad_norm": 1.5078125, "learning_rate": 0.0002933881624427746, "loss": 5.0622, "mean_token_accuracy": 0.21275173723697663, "num_tokens": 106556919.0, "step": 61440 }, { "entropy": 5.922523832321167, "epoch": 4.780626337288465, "grad_norm": 1.359375, "learning_rate": 0.0002933605394270116, "loss": 4.8604, "mean_token_accuracy": 0.22581852972507477, "num_tokens": 106565394.0, "step": 61445 }, { "entropy": 5.962975931167603, "epoch": 4.781015366660183, "grad_norm": 1.40625, "learning_rate": 0.0002933329161326565, "loss": 5.0025, "mean_token_accuracy": 0.2135481745004654, "num_tokens": 106574669.0, "step": 61450 }, { "entropy": 5.962053632736206, "epoch": 4.781404396031901, "grad_norm": 1.4453125, "learning_rate": 0.00029330529256012863, "loss": 4.9289, "mean_token_accuracy": 0.2167219340801239, "num_tokens": 106582505.0, "step": 61455 }, { "entropy": 5.966962671279907, "epoch": 4.781793425403618, "grad_norm": 1.3125, "learning_rate": 0.00029327766870984714, "loss": 4.9295, "mean_token_accuracy": 0.22376034855842591, "num_tokens": 106591777.0, "step": 61460 }, { "entropy": 5.943751287460327, "epoch": 4.782182454775335, "grad_norm": 1.359375, "learning_rate": 0.00029325004458223097, "loss": 4.9679, "mean_token_accuracy": 0.21213174164295195, "num_tokens": 106600951.0, "step": 61465 }, { "entropy": 5.86459584236145, "epoch": 4.782571484147053, "grad_norm": 1.5078125, "learning_rate": 0.00029322242017769954, "loss": 4.8405, "mean_token_accuracy": 0.224060720205307, "num_tokens": 106608955.0, "step": 61470 }, { "entropy": 6.01353349685669, "epoch": 4.782960513518771, "grad_norm": 1.40625, "learning_rate": 0.00029319479549667183, "loss": 5.0709, "mean_token_accuracy": 0.20552381724119187, "num_tokens": 106617778.0, "step": 61475 }, { "entropy": 5.987853956222534, "epoch": 4.783349542890488, "grad_norm": 1.4453125, "learning_rate": 0.0002931671705395671, "loss": 5.0045, "mean_token_accuracy": 0.2065620929002762, "num_tokens": 106626781.0, "step": 61480 }, { "entropy": 5.992259454727173, "epoch": 4.783738572262206, "grad_norm": 1.5703125, "learning_rate": 0.00029313954530680447, "loss": 4.9501, "mean_token_accuracy": 0.21295444816350936, "num_tokens": 106635013.0, "step": 61485 }, { "entropy": 5.908585882186889, "epoch": 4.784127601633923, "grad_norm": 1.53125, "learning_rate": 0.00029311191979880313, "loss": 4.8671, "mean_token_accuracy": 0.2235936164855957, "num_tokens": 106643473.0, "step": 61490 }, { "entropy": 5.887950038909912, "epoch": 4.784516631005641, "grad_norm": 1.5234375, "learning_rate": 0.0002930842940159822, "loss": 4.9539, "mean_token_accuracy": 0.21317344009876252, "num_tokens": 106652681.0, "step": 61495 }, { "entropy": 5.949651575088501, "epoch": 4.784905660377358, "grad_norm": 1.375, "learning_rate": 0.00029305666795876093, "loss": 4.9815, "mean_token_accuracy": 0.21482092887163162, "num_tokens": 106660988.0, "step": 61500 }, { "entropy": 5.927076768875122, "epoch": 4.785294689749076, "grad_norm": 1.375, "learning_rate": 0.00029302904162755843, "loss": 4.8964, "mean_token_accuracy": 0.22049204558134078, "num_tokens": 106669799.0, "step": 61505 }, { "entropy": 6.008852815628051, "epoch": 4.785683719120794, "grad_norm": 1.3828125, "learning_rate": 0.00029300141502279395, "loss": 5.0382, "mean_token_accuracy": 0.21154449880123138, "num_tokens": 106678730.0, "step": 61510 }, { "entropy": 5.897548675537109, "epoch": 4.786072748492511, "grad_norm": 1.4765625, "learning_rate": 0.00029297378814488657, "loss": 4.9092, "mean_token_accuracy": 0.2300153598189354, "num_tokens": 106687819.0, "step": 61515 }, { "entropy": 5.960308980941773, "epoch": 4.786461777864229, "grad_norm": 1.46875, "learning_rate": 0.00029294616099425556, "loss": 4.9783, "mean_token_accuracy": 0.2101923868060112, "num_tokens": 106697033.0, "step": 61520 }, { "entropy": 5.969588327407837, "epoch": 4.786850807235947, "grad_norm": 1.3984375, "learning_rate": 0.0002929185335713202, "loss": 4.9865, "mean_token_accuracy": 0.20933570116758346, "num_tokens": 106705076.0, "step": 61525 }, { "entropy": 5.960909652709961, "epoch": 4.787239836607664, "grad_norm": 1.3515625, "learning_rate": 0.00029289090587649965, "loss": 4.9561, "mean_token_accuracy": 0.2112593248486519, "num_tokens": 106713946.0, "step": 61530 }, { "entropy": 5.881396770477295, "epoch": 4.787628865979381, "grad_norm": 1.4453125, "learning_rate": 0.000292863277910213, "loss": 4.8542, "mean_token_accuracy": 0.22174736261367797, "num_tokens": 106722671.0, "step": 61535 }, { "entropy": 5.968640375137329, "epoch": 4.788017895351099, "grad_norm": 1.5390625, "learning_rate": 0.0002928356496728796, "loss": 4.9439, "mean_token_accuracy": 0.22249559313058853, "num_tokens": 106730711.0, "step": 61540 }, { "entropy": 6.02301139831543, "epoch": 4.788406924722817, "grad_norm": 1.546875, "learning_rate": 0.00029280802116491854, "loss": 5.0764, "mean_token_accuracy": 0.20820405781269075, "num_tokens": 106738918.0, "step": 61545 }, { "entropy": 5.997980833053589, "epoch": 4.788795954094534, "grad_norm": 1.3984375, "learning_rate": 0.00029278039238674915, "loss": 4.9862, "mean_token_accuracy": 0.21173553615808488, "num_tokens": 106748327.0, "step": 61550 }, { "entropy": 6.080959987640381, "epoch": 4.789184983466251, "grad_norm": 1.4921875, "learning_rate": 0.0002927527633387906, "loss": 5.0619, "mean_token_accuracy": 0.21607758700847626, "num_tokens": 106757029.0, "step": 61555 }, { "entropy": 6.0694502830505375, "epoch": 4.789574012837969, "grad_norm": 1.4609375, "learning_rate": 0.00029272513402146203, "loss": 5.0915, "mean_token_accuracy": 0.2029522478580475, "num_tokens": 106766459.0, "step": 61560 }, { "entropy": 5.941664314270019, "epoch": 4.789963042209687, "grad_norm": 1.5078125, "learning_rate": 0.0002926975044351828, "loss": 4.9722, "mean_token_accuracy": 0.2114310473203659, "num_tokens": 106775841.0, "step": 61565 }, { "entropy": 5.944850826263428, "epoch": 4.790352071581404, "grad_norm": 1.4765625, "learning_rate": 0.0002926698745803723, "loss": 4.8935, "mean_token_accuracy": 0.21420353800058364, "num_tokens": 106784684.0, "step": 61570 }, { "entropy": 5.946134185791015, "epoch": 4.790741100953122, "grad_norm": 1.4609375, "learning_rate": 0.00029264224445744937, "loss": 4.8415, "mean_token_accuracy": 0.22889447957277298, "num_tokens": 106792932.0, "step": 61575 }, { "entropy": 5.900412225723267, "epoch": 4.79113013032484, "grad_norm": 1.5, "learning_rate": 0.00029261461406683353, "loss": 4.951, "mean_token_accuracy": 0.21444661915302277, "num_tokens": 106801753.0, "step": 61580 }, { "entropy": 5.922268342971802, "epoch": 4.791519159696557, "grad_norm": 1.421875, "learning_rate": 0.00029258698340894397, "loss": 5.0045, "mean_token_accuracy": 0.213982093334198, "num_tokens": 106810710.0, "step": 61585 }, { "entropy": 5.988828468322754, "epoch": 4.791908189068275, "grad_norm": 1.5234375, "learning_rate": 0.00029255935248419983, "loss": 5.0077, "mean_token_accuracy": 0.208380825817585, "num_tokens": 106818677.0, "step": 61590 }, { "entropy": 5.968517732620239, "epoch": 4.792297218439992, "grad_norm": 1.453125, "learning_rate": 0.0002925317212930206, "loss": 4.9871, "mean_token_accuracy": 0.21657801419496536, "num_tokens": 106828164.0, "step": 61595 }, { "entropy": 5.978539562225341, "epoch": 4.79268624781171, "grad_norm": 1.3359375, "learning_rate": 0.00029250408983582527, "loss": 4.987, "mean_token_accuracy": 0.2154807835817337, "num_tokens": 106837545.0, "step": 61600 }, { "entropy": 5.998735761642456, "epoch": 4.793075277183427, "grad_norm": 1.3515625, "learning_rate": 0.0002924764581130333, "loss": 5.015, "mean_token_accuracy": 0.2064029887318611, "num_tokens": 106845864.0, "step": 61605 }, { "entropy": 6.050983047485351, "epoch": 4.793464306555145, "grad_norm": 1.578125, "learning_rate": 0.000292448826125064, "loss": 5.0466, "mean_token_accuracy": 0.20993514508008956, "num_tokens": 106853744.0, "step": 61610 }, { "entropy": 5.850368499755859, "epoch": 4.793853335926863, "grad_norm": 1.390625, "learning_rate": 0.0002924211938723364, "loss": 4.8146, "mean_token_accuracy": 0.21976527571678162, "num_tokens": 106862847.0, "step": 61615 }, { "entropy": 5.928741312026977, "epoch": 4.79424236529858, "grad_norm": 1.4765625, "learning_rate": 0.00029239356135526994, "loss": 4.9418, "mean_token_accuracy": 0.21686784625053407, "num_tokens": 106871361.0, "step": 61620 }, { "entropy": 5.9424224376678465, "epoch": 4.794631394670297, "grad_norm": 1.359375, "learning_rate": 0.000292365928574284, "loss": 4.9355, "mean_token_accuracy": 0.21383305490016938, "num_tokens": 106880512.0, "step": 61625 }, { "entropy": 5.954893779754639, "epoch": 4.795020424042015, "grad_norm": 1.5078125, "learning_rate": 0.0002923382955297975, "loss": 4.9509, "mean_token_accuracy": 0.22274935990571976, "num_tokens": 106888602.0, "step": 61630 }, { "entropy": 5.981440687179566, "epoch": 4.795409453413733, "grad_norm": 1.3671875, "learning_rate": 0.0002923106622222301, "loss": 5.0443, "mean_token_accuracy": 0.21654405295848847, "num_tokens": 106898031.0, "step": 61635 }, { "entropy": 5.935976934432984, "epoch": 4.79579848278545, "grad_norm": 1.4140625, "learning_rate": 0.0002922830286520009, "loss": 4.9585, "mean_token_accuracy": 0.21700815707445145, "num_tokens": 106907340.0, "step": 61640 }, { "entropy": 5.9965332508087155, "epoch": 4.796187512157168, "grad_norm": 1.53125, "learning_rate": 0.00029225539481952934, "loss": 5.0099, "mean_token_accuracy": 0.21199132949113847, "num_tokens": 106915786.0, "step": 61645 }, { "entropy": 5.9836585521698, "epoch": 4.796576541528886, "grad_norm": 1.515625, "learning_rate": 0.0002922277607252346, "loss": 5.0016, "mean_token_accuracy": 0.2111242264509201, "num_tokens": 106925094.0, "step": 61650 }, { "entropy": 5.984159851074219, "epoch": 4.796965570900603, "grad_norm": 1.421875, "learning_rate": 0.000292200126369536, "loss": 5.0768, "mean_token_accuracy": 0.20464636236429215, "num_tokens": 106933696.0, "step": 61655 }, { "entropy": 6.023592901229859, "epoch": 4.79735460027232, "grad_norm": 1.4453125, "learning_rate": 0.00029217249175285284, "loss": 5.0664, "mean_token_accuracy": 0.20999234169721603, "num_tokens": 106943280.0, "step": 61660 }, { "entropy": 5.980923795700074, "epoch": 4.797743629644038, "grad_norm": 1.375, "learning_rate": 0.00029214485687560437, "loss": 4.9509, "mean_token_accuracy": 0.20966610312461853, "num_tokens": 106951822.0, "step": 61665 }, { "entropy": 5.946805715560913, "epoch": 4.798132659015756, "grad_norm": 1.5234375, "learning_rate": 0.0002921172217382101, "loss": 4.9483, "mean_token_accuracy": 0.21902274042367936, "num_tokens": 106959866.0, "step": 61670 }, { "entropy": 5.916334533691407, "epoch": 4.798521688387473, "grad_norm": 1.46875, "learning_rate": 0.00029208958634108917, "loss": 4.9095, "mean_token_accuracy": 0.22238699346780777, "num_tokens": 106968664.0, "step": 61675 }, { "entropy": 6.013497972488404, "epoch": 4.798910717759191, "grad_norm": 1.40625, "learning_rate": 0.000292061950684661, "loss": 5.0218, "mean_token_accuracy": 0.2110625147819519, "num_tokens": 106977792.0, "step": 61680 }, { "entropy": 5.974016904830933, "epoch": 4.799299747130909, "grad_norm": 1.3359375, "learning_rate": 0.00029203431476934496, "loss": 5.0035, "mean_token_accuracy": 0.2198063999414444, "num_tokens": 106986877.0, "step": 61685 }, { "entropy": 5.917117309570313, "epoch": 4.7996887765026255, "grad_norm": 1.53125, "learning_rate": 0.00029200667859556026, "loss": 4.8676, "mean_token_accuracy": 0.2186676010489464, "num_tokens": 106995388.0, "step": 61690 }, { "entropy": 5.9187798500061035, "epoch": 4.800077805874343, "grad_norm": 1.4375, "learning_rate": 0.0002919790421637262, "loss": 4.8634, "mean_token_accuracy": 0.21949893236160278, "num_tokens": 107004617.0, "step": 61695 }, { "entropy": 5.945383501052857, "epoch": 4.800466835246061, "grad_norm": 1.484375, "learning_rate": 0.0002919514054742622, "loss": 4.9517, "mean_token_accuracy": 0.2155870497226715, "num_tokens": 107013892.0, "step": 61700 }, { "entropy": 5.8845862865448, "epoch": 4.800855864617779, "grad_norm": 1.5546875, "learning_rate": 0.00029192376852758774, "loss": 4.8461, "mean_token_accuracy": 0.21898577213287354, "num_tokens": 107022258.0, "step": 61705 }, { "entropy": 5.8645405769348145, "epoch": 4.801244893989496, "grad_norm": 1.34375, "learning_rate": 0.0002918961313241219, "loss": 4.9182, "mean_token_accuracy": 0.2260574385523796, "num_tokens": 107031196.0, "step": 61710 }, { "entropy": 5.921511030197143, "epoch": 4.801633923361214, "grad_norm": 1.3203125, "learning_rate": 0.0002918684938642842, "loss": 4.8821, "mean_token_accuracy": 0.2251448392868042, "num_tokens": 107039662.0, "step": 61715 }, { "entropy": 5.941891241073608, "epoch": 4.802022952732932, "grad_norm": 1.375, "learning_rate": 0.00029184085614849403, "loss": 4.9632, "mean_token_accuracy": 0.2125189870595932, "num_tokens": 107048855.0, "step": 61720 }, { "entropy": 5.946382904052735, "epoch": 4.802411982104649, "grad_norm": 1.40625, "learning_rate": 0.0002918132181771706, "loss": 4.9297, "mean_token_accuracy": 0.21203707456588744, "num_tokens": 107057687.0, "step": 61725 }, { "entropy": 6.003921031951904, "epoch": 4.802801011476366, "grad_norm": 1.453125, "learning_rate": 0.00029178557995073335, "loss": 4.9811, "mean_token_accuracy": 0.2174824669957161, "num_tokens": 107065692.0, "step": 61730 }, { "entropy": 5.905394887924194, "epoch": 4.803190040848084, "grad_norm": 1.46875, "learning_rate": 0.0002917579414696017, "loss": 4.8713, "mean_token_accuracy": 0.21708856970071794, "num_tokens": 107073975.0, "step": 61735 }, { "entropy": 5.9792173385620115, "epoch": 4.803579070219802, "grad_norm": 1.328125, "learning_rate": 0.00029173030273419484, "loss": 5.001, "mean_token_accuracy": 0.21285705715417863, "num_tokens": 107082566.0, "step": 61740 }, { "entropy": 6.004631471633911, "epoch": 4.803968099591519, "grad_norm": 1.546875, "learning_rate": 0.0002917026637449323, "loss": 5.0456, "mean_token_accuracy": 0.20810424238443376, "num_tokens": 107091293.0, "step": 61745 }, { "entropy": 5.974508810043335, "epoch": 4.804357128963237, "grad_norm": 1.515625, "learning_rate": 0.0002916750245022335, "loss": 4.9306, "mean_token_accuracy": 0.22276796102523805, "num_tokens": 107099978.0, "step": 61750 }, { "entropy": 5.951584529876709, "epoch": 4.804746158334955, "grad_norm": 1.421875, "learning_rate": 0.0002916473850065177, "loss": 5.0232, "mean_token_accuracy": 0.20538302809000014, "num_tokens": 107108467.0, "step": 61755 }, { "entropy": 5.925952196121216, "epoch": 4.8051351877066715, "grad_norm": 1.4453125, "learning_rate": 0.00029161974525820434, "loss": 4.893, "mean_token_accuracy": 0.2125195875763893, "num_tokens": 107117715.0, "step": 61760 }, { "entropy": 6.039210462570191, "epoch": 4.805524217078389, "grad_norm": 1.4140625, "learning_rate": 0.0002915921052577127, "loss": 5.0412, "mean_token_accuracy": 0.21319814771413803, "num_tokens": 107126693.0, "step": 61765 }, { "entropy": 5.997626781463623, "epoch": 4.805913246450107, "grad_norm": 1.4765625, "learning_rate": 0.00029156446500546243, "loss": 5.0173, "mean_token_accuracy": 0.21433499455451965, "num_tokens": 107136150.0, "step": 61770 }, { "entropy": 6.036182308197022, "epoch": 4.806302275821825, "grad_norm": 1.453125, "learning_rate": 0.00029153682450187265, "loss": 4.9564, "mean_token_accuracy": 0.2097330555319786, "num_tokens": 107144776.0, "step": 61775 }, { "entropy": 5.929311609268188, "epoch": 4.806691305193542, "grad_norm": 1.5, "learning_rate": 0.00029150918374736294, "loss": 4.9013, "mean_token_accuracy": 0.21806749999523162, "num_tokens": 107152993.0, "step": 61780 }, { "entropy": 5.926703643798828, "epoch": 4.80708033456526, "grad_norm": 1.3828125, "learning_rate": 0.0002914815427423526, "loss": 4.9062, "mean_token_accuracy": 0.22964268922805786, "num_tokens": 107161871.0, "step": 61785 }, { "entropy": 6.020199918746949, "epoch": 4.807469363936978, "grad_norm": 1.484375, "learning_rate": 0.0002914539014872612, "loss": 5.101, "mean_token_accuracy": 0.19928285777568816, "num_tokens": 107171145.0, "step": 61790 }, { "entropy": 6.011377239227295, "epoch": 4.8078583933086945, "grad_norm": 1.5, "learning_rate": 0.00029142625998250786, "loss": 5.0397, "mean_token_accuracy": 0.21381450742483138, "num_tokens": 107179718.0, "step": 61795 }, { "entropy": 5.971212005615234, "epoch": 4.808247422680412, "grad_norm": 1.40625, "learning_rate": 0.00029139861822851233, "loss": 4.9696, "mean_token_accuracy": 0.21846384257078172, "num_tokens": 107187753.0, "step": 61800 }, { "entropy": 5.862743997573853, "epoch": 4.80863645205213, "grad_norm": 1.3671875, "learning_rate": 0.00029137097622569376, "loss": 4.9106, "mean_token_accuracy": 0.216135635972023, "num_tokens": 107196382.0, "step": 61805 }, { "entropy": 5.916265821456909, "epoch": 4.809025481423848, "grad_norm": 1.4765625, "learning_rate": 0.0002913433339744718, "loss": 4.9616, "mean_token_accuracy": 0.22321856021881104, "num_tokens": 107204750.0, "step": 61810 }, { "entropy": 5.94086594581604, "epoch": 4.809414510795565, "grad_norm": 1.2890625, "learning_rate": 0.0002913156914752656, "loss": 4.9406, "mean_token_accuracy": 0.21400032341480255, "num_tokens": 107213860.0, "step": 61815 }, { "entropy": 6.041183567047119, "epoch": 4.809803540167283, "grad_norm": 1.390625, "learning_rate": 0.0002912880487284948, "loss": 5.0554, "mean_token_accuracy": 0.2072896331548691, "num_tokens": 107222737.0, "step": 61820 }, { "entropy": 6.014329481124878, "epoch": 4.810192569539, "grad_norm": 1.3359375, "learning_rate": 0.00029126040573457886, "loss": 5.0074, "mean_token_accuracy": 0.21232164204120635, "num_tokens": 107232006.0, "step": 61825 }, { "entropy": 6.057813405990601, "epoch": 4.8105815989107175, "grad_norm": 1.421875, "learning_rate": 0.00029123276249393707, "loss": 5.0503, "mean_token_accuracy": 0.20954277813434602, "num_tokens": 107240175.0, "step": 61830 }, { "entropy": 5.982154750823975, "epoch": 4.810970628282435, "grad_norm": 1.3984375, "learning_rate": 0.00029120511900698894, "loss": 5.0268, "mean_token_accuracy": 0.20864997953176498, "num_tokens": 107248344.0, "step": 61835 }, { "entropy": 5.906527185440064, "epoch": 4.811359657654153, "grad_norm": 1.4765625, "learning_rate": 0.000291177475274154, "loss": 4.967, "mean_token_accuracy": 0.22124786227941512, "num_tokens": 107257849.0, "step": 61840 }, { "entropy": 5.934559059143067, "epoch": 4.8117486870258706, "grad_norm": 1.421875, "learning_rate": 0.0002911498312958516, "loss": 4.9968, "mean_token_accuracy": 0.21305757910013198, "num_tokens": 107267065.0, "step": 61845 }, { "entropy": 6.020502042770386, "epoch": 4.812137716397588, "grad_norm": 1.3515625, "learning_rate": 0.00029112218707250115, "loss": 5.0174, "mean_token_accuracy": 0.21275440752506256, "num_tokens": 107275460.0, "step": 61850 }, { "entropy": 5.927441024780274, "epoch": 4.812526745769306, "grad_norm": 1.328125, "learning_rate": 0.00029109454260452223, "loss": 4.9216, "mean_token_accuracy": 0.2153344377875328, "num_tokens": 107284187.0, "step": 61855 }, { "entropy": 5.911665296554565, "epoch": 4.812915775141024, "grad_norm": 1.375, "learning_rate": 0.00029106689789233425, "loss": 4.9459, "mean_token_accuracy": 0.21421818286180497, "num_tokens": 107292959.0, "step": 61860 }, { "entropy": 5.923187494277954, "epoch": 4.8133048045127405, "grad_norm": 1.421875, "learning_rate": 0.0002910392529363566, "loss": 4.9542, "mean_token_accuracy": 0.21480103731155395, "num_tokens": 107301936.0, "step": 61865 }, { "entropy": 5.966071462631225, "epoch": 4.813693833884458, "grad_norm": 1.4453125, "learning_rate": 0.00029101160773700887, "loss": 4.977, "mean_token_accuracy": 0.21877652257680893, "num_tokens": 107310996.0, "step": 61870 }, { "entropy": 5.933529710769653, "epoch": 4.814082863256176, "grad_norm": 1.6015625, "learning_rate": 0.0002909839622947104, "loss": 4.8599, "mean_token_accuracy": 0.22365160584449767, "num_tokens": 107319291.0, "step": 61875 }, { "entropy": 6.023220586776733, "epoch": 4.8144718926278935, "grad_norm": 1.4453125, "learning_rate": 0.0002909563166098809, "loss": 5.0791, "mean_token_accuracy": 0.1995217964053154, "num_tokens": 107328169.0, "step": 61880 }, { "entropy": 5.881319761276245, "epoch": 4.814860921999611, "grad_norm": 1.4296875, "learning_rate": 0.00029092867068293966, "loss": 4.9303, "mean_token_accuracy": 0.21597301065921784, "num_tokens": 107336992.0, "step": 61885 }, { "entropy": 5.920500898361206, "epoch": 4.815249951371328, "grad_norm": 1.4375, "learning_rate": 0.0002909010245143061, "loss": 4.959, "mean_token_accuracy": 0.21946073472499847, "num_tokens": 107345292.0, "step": 61890 }, { "entropy": 5.871447992324829, "epoch": 4.815638980743046, "grad_norm": 1.421875, "learning_rate": 0.0002908733781043998, "loss": 4.9281, "mean_token_accuracy": 0.22117433995008468, "num_tokens": 107353567.0, "step": 61895 }, { "entropy": 5.970368528366089, "epoch": 4.8160280101147634, "grad_norm": 1.40625, "learning_rate": 0.0002908457314536403, "loss": 4.9977, "mean_token_accuracy": 0.21277628391981124, "num_tokens": 107361675.0, "step": 61900 }, { "entropy": 5.940203905105591, "epoch": 4.816417039486481, "grad_norm": 1.6640625, "learning_rate": 0.00029081808456244703, "loss": 4.9281, "mean_token_accuracy": 0.21450794637203216, "num_tokens": 107370198.0, "step": 61905 }, { "entropy": 5.951638317108154, "epoch": 4.816806068858199, "grad_norm": 1.3671875, "learning_rate": 0.00029079043743123953, "loss": 4.9851, "mean_token_accuracy": 0.21339751034975052, "num_tokens": 107379492.0, "step": 61910 }, { "entropy": 5.938049936294556, "epoch": 4.8171950982299165, "grad_norm": 1.4453125, "learning_rate": 0.00029076279006043723, "loss": 4.9214, "mean_token_accuracy": 0.22354572117328644, "num_tokens": 107388690.0, "step": 61915 }, { "entropy": 6.004018115997314, "epoch": 4.817584127601634, "grad_norm": 1.3984375, "learning_rate": 0.0002907351424504597, "loss": 5.0726, "mean_token_accuracy": 0.20593581199645997, "num_tokens": 107397158.0, "step": 61920 }, { "entropy": 5.868466901779175, "epoch": 4.817973156973352, "grad_norm": 1.4609375, "learning_rate": 0.0002907074946017265, "loss": 4.862, "mean_token_accuracy": 0.22442245930433274, "num_tokens": 107405832.0, "step": 61925 }, { "entropy": 5.933877563476562, "epoch": 4.818362186345069, "grad_norm": 1.4765625, "learning_rate": 0.000290679846514657, "loss": 4.9592, "mean_token_accuracy": 0.21285081654787064, "num_tokens": 107414446.0, "step": 61930 }, { "entropy": 5.979132986068725, "epoch": 4.818751215716786, "grad_norm": 1.390625, "learning_rate": 0.00029065219818967075, "loss": 4.9841, "mean_token_accuracy": 0.2191564619541168, "num_tokens": 107423402.0, "step": 61935 }, { "entropy": 5.995204019546509, "epoch": 4.819140245088504, "grad_norm": 1.3984375, "learning_rate": 0.00029062454962718736, "loss": 4.9744, "mean_token_accuracy": 0.21284471750259398, "num_tokens": 107432415.0, "step": 61940 }, { "entropy": 5.944805669784546, "epoch": 4.819529274460222, "grad_norm": 1.484375, "learning_rate": 0.0002905969008276263, "loss": 4.9468, "mean_token_accuracy": 0.21257275342941284, "num_tokens": 107441170.0, "step": 61945 }, { "entropy": 6.004467630386353, "epoch": 4.8199183038319395, "grad_norm": 1.4296875, "learning_rate": 0.0002905692517914071, "loss": 5.0454, "mean_token_accuracy": 0.21161332130432128, "num_tokens": 107449523.0, "step": 61950 }, { "entropy": 5.945244359970093, "epoch": 4.820307333203657, "grad_norm": 1.4765625, "learning_rate": 0.00029054160251894924, "loss": 4.9633, "mean_token_accuracy": 0.22114895284175873, "num_tokens": 107458629.0, "step": 61955 }, { "entropy": 5.966711235046387, "epoch": 4.820696362575374, "grad_norm": 1.4453125, "learning_rate": 0.0002905139530106724, "loss": 4.9803, "mean_token_accuracy": 0.2118236929178238, "num_tokens": 107467016.0, "step": 61960 }, { "entropy": 5.967395305633545, "epoch": 4.821085391947092, "grad_norm": 1.5234375, "learning_rate": 0.00029048630326699594, "loss": 4.9067, "mean_token_accuracy": 0.21574630886316298, "num_tokens": 107475128.0, "step": 61965 }, { "entropy": 5.983470010757446, "epoch": 4.821474421318809, "grad_norm": 1.359375, "learning_rate": 0.00029045865328833944, "loss": 5.0177, "mean_token_accuracy": 0.20763752460479737, "num_tokens": 107484344.0, "step": 61970 }, { "entropy": 5.8396485328674315, "epoch": 4.821863450690527, "grad_norm": 1.4609375, "learning_rate": 0.00029043100307512247, "loss": 4.8813, "mean_token_accuracy": 0.22760993540287017, "num_tokens": 107493252.0, "step": 61975 }, { "entropy": 6.00921139717102, "epoch": 4.822252480062245, "grad_norm": 1.40625, "learning_rate": 0.00029040335262776467, "loss": 5.0445, "mean_token_accuracy": 0.20700038075447083, "num_tokens": 107502335.0, "step": 61980 }, { "entropy": 6.002280282974243, "epoch": 4.8226415094339625, "grad_norm": 1.4921875, "learning_rate": 0.0002903757019466855, "loss": 4.9865, "mean_token_accuracy": 0.2076638326048851, "num_tokens": 107510532.0, "step": 61985 }, { "entropy": 5.989982843399048, "epoch": 4.82303053880568, "grad_norm": 1.4140625, "learning_rate": 0.00029034805103230453, "loss": 4.9744, "mean_token_accuracy": 0.22255508452653885, "num_tokens": 107518628.0, "step": 61990 }, { "entropy": 5.996124029159546, "epoch": 4.823419568177397, "grad_norm": 1.515625, "learning_rate": 0.00029032039988504126, "loss": 5.0435, "mean_token_accuracy": 0.20888043195009232, "num_tokens": 107527213.0, "step": 61995 }, { "entropy": 5.99093599319458, "epoch": 4.823808597549115, "grad_norm": 1.4921875, "learning_rate": 0.00029029274850531534, "loss": 5.0301, "mean_token_accuracy": 0.2125764012336731, "num_tokens": 107536382.0, "step": 62000 }, { "entropy": 5.8976154804229735, "epoch": 4.824197626920832, "grad_norm": 1.453125, "learning_rate": 0.00029026509689354635, "loss": 4.9352, "mean_token_accuracy": 0.22133806794881822, "num_tokens": 107545419.0, "step": 62005 }, { "entropy": 5.946125268936157, "epoch": 4.82458665629255, "grad_norm": 1.453125, "learning_rate": 0.00029023744505015373, "loss": 4.975, "mean_token_accuracy": 0.2105588749051094, "num_tokens": 107554458.0, "step": 62010 }, { "entropy": 6.007529258728027, "epoch": 4.824975685664268, "grad_norm": 1.3984375, "learning_rate": 0.00029020979297555717, "loss": 5.021, "mean_token_accuracy": 0.20661982893943787, "num_tokens": 107563121.0, "step": 62015 }, { "entropy": 5.977300930023193, "epoch": 4.8253647150359855, "grad_norm": 1.421875, "learning_rate": 0.00029018214067017624, "loss": 4.9726, "mean_token_accuracy": 0.21709932535886764, "num_tokens": 107571380.0, "step": 62020 }, { "entropy": 5.9770989418029785, "epoch": 4.825753744407702, "grad_norm": 1.4375, "learning_rate": 0.0002901544881344305, "loss": 4.9627, "mean_token_accuracy": 0.21084933876991271, "num_tokens": 107580524.0, "step": 62025 }, { "entropy": 5.979213523864746, "epoch": 4.82614277377942, "grad_norm": 1.4140625, "learning_rate": 0.0002901268353687394, "loss": 5.029, "mean_token_accuracy": 0.2114427998661995, "num_tokens": 107589492.0, "step": 62030 }, { "entropy": 5.9769768714904785, "epoch": 4.826531803151138, "grad_norm": 1.390625, "learning_rate": 0.00029009918237352274, "loss": 5.0003, "mean_token_accuracy": 0.20840680003166198, "num_tokens": 107598258.0, "step": 62035 }, { "entropy": 5.922567319869995, "epoch": 4.826920832522855, "grad_norm": 1.3984375, "learning_rate": 0.0002900715291492, "loss": 4.9139, "mean_token_accuracy": 0.22051929384469987, "num_tokens": 107606526.0, "step": 62040 }, { "entropy": 5.979802036285401, "epoch": 4.827309861894573, "grad_norm": 1.46875, "learning_rate": 0.0002900438756961908, "loss": 5.001, "mean_token_accuracy": 0.20780059397220613, "num_tokens": 107615321.0, "step": 62045 }, { "entropy": 5.959657478332519, "epoch": 4.827698891266291, "grad_norm": 1.390625, "learning_rate": 0.0002900162220149148, "loss": 5.0016, "mean_token_accuracy": 0.21107443571090698, "num_tokens": 107625295.0, "step": 62050 }, { "entropy": 5.9835145473480225, "epoch": 4.8280879206380085, "grad_norm": 1.453125, "learning_rate": 0.00028998856810579144, "loss": 5.0281, "mean_token_accuracy": 0.21203786879777908, "num_tokens": 107634453.0, "step": 62055 }, { "entropy": 6.005669164657593, "epoch": 4.828476950009726, "grad_norm": 1.4140625, "learning_rate": 0.0002899609139692405, "loss": 4.9424, "mean_token_accuracy": 0.21608620136976242, "num_tokens": 107642987.0, "step": 62060 }, { "entropy": 6.065689468383789, "epoch": 4.828865979381443, "grad_norm": 1.484375, "learning_rate": 0.00028993325960568133, "loss": 5.0876, "mean_token_accuracy": 0.21227670162916185, "num_tokens": 107651614.0, "step": 62065 }, { "entropy": 5.97391905784607, "epoch": 4.829255008753161, "grad_norm": 1.453125, "learning_rate": 0.0002899056050155339, "loss": 4.9089, "mean_token_accuracy": 0.22286701202392578, "num_tokens": 107660367.0, "step": 62070 }, { "entropy": 5.94419903755188, "epoch": 4.829644038124878, "grad_norm": 1.40625, "learning_rate": 0.0002898779501992176, "loss": 5.0187, "mean_token_accuracy": 0.21665442436933519, "num_tokens": 107668763.0, "step": 62075 }, { "entropy": 5.968116283416748, "epoch": 4.830033067496596, "grad_norm": 1.4140625, "learning_rate": 0.000289850295157152, "loss": 4.9724, "mean_token_accuracy": 0.20946889519691467, "num_tokens": 107677846.0, "step": 62080 }, { "entropy": 5.956566047668457, "epoch": 4.830422096868314, "grad_norm": 1.3203125, "learning_rate": 0.00028982263988975687, "loss": 4.9048, "mean_token_accuracy": 0.2181496575474739, "num_tokens": 107687049.0, "step": 62085 }, { "entropy": 5.938007068634033, "epoch": 4.8308111262400315, "grad_norm": 1.484375, "learning_rate": 0.0002897949843974518, "loss": 4.9777, "mean_token_accuracy": 0.21508435606956483, "num_tokens": 107695487.0, "step": 62090 }, { "entropy": 5.963528394699097, "epoch": 4.831200155611748, "grad_norm": 1.453125, "learning_rate": 0.0002897673286806562, "loss": 4.969, "mean_token_accuracy": 0.21040670722723007, "num_tokens": 107703814.0, "step": 62095 }, { "entropy": 6.019762992858887, "epoch": 4.831589184983466, "grad_norm": 1.4140625, "learning_rate": 0.0002897396727397901, "loss": 5.0015, "mean_token_accuracy": 0.21294335126876832, "num_tokens": 107712402.0, "step": 62100 }, { "entropy": 5.979795169830322, "epoch": 4.831978214355184, "grad_norm": 1.4453125, "learning_rate": 0.0002897120165752729, "loss": 4.9942, "mean_token_accuracy": 0.20664868205785752, "num_tokens": 107720863.0, "step": 62105 }, { "entropy": 5.956272983551026, "epoch": 4.832367243726901, "grad_norm": 1.3203125, "learning_rate": 0.0002896843601875243, "loss": 5.0308, "mean_token_accuracy": 0.2085858851671219, "num_tokens": 107730079.0, "step": 62110 }, { "entropy": 5.959002542495727, "epoch": 4.832756273098619, "grad_norm": 1.3828125, "learning_rate": 0.00028965670357696384, "loss": 4.9644, "mean_token_accuracy": 0.21357775777578353, "num_tokens": 107738328.0, "step": 62115 }, { "entropy": 5.886544322967529, "epoch": 4.833145302470337, "grad_norm": 1.4375, "learning_rate": 0.00028962904674401124, "loss": 4.8679, "mean_token_accuracy": 0.2238164708018303, "num_tokens": 107747159.0, "step": 62120 }, { "entropy": 5.887013483047485, "epoch": 4.8335343318420545, "grad_norm": 1.4296875, "learning_rate": 0.0002896013896890862, "loss": 5.0186, "mean_token_accuracy": 0.20866921544075012, "num_tokens": 107756282.0, "step": 62125 }, { "entropy": 5.933960866928101, "epoch": 4.833923361213771, "grad_norm": 1.40625, "learning_rate": 0.00028957373241260816, "loss": 4.88, "mean_token_accuracy": 0.22534471601247788, "num_tokens": 107764967.0, "step": 62130 }, { "entropy": 5.982131052017212, "epoch": 4.834312390585489, "grad_norm": 1.4765625, "learning_rate": 0.000289546074914997, "loss": 4.9792, "mean_token_accuracy": 0.2151278018951416, "num_tokens": 107773544.0, "step": 62135 }, { "entropy": 5.849381303787231, "epoch": 4.834701419957207, "grad_norm": 1.546875, "learning_rate": 0.0002895184171966724, "loss": 4.8625, "mean_token_accuracy": 0.22136432081460952, "num_tokens": 107781996.0, "step": 62140 }, { "entropy": 5.962338924407959, "epoch": 4.835090449328924, "grad_norm": 1.4140625, "learning_rate": 0.0002894907592580538, "loss": 4.9862, "mean_token_accuracy": 0.21616612374782562, "num_tokens": 107790708.0, "step": 62145 }, { "entropy": 5.987463045120239, "epoch": 4.835479478700642, "grad_norm": 1.4609375, "learning_rate": 0.00028946310109956107, "loss": 4.9212, "mean_token_accuracy": 0.22406015694141387, "num_tokens": 107798829.0, "step": 62150 }, { "entropy": 5.958460807800293, "epoch": 4.83586850807236, "grad_norm": 1.421875, "learning_rate": 0.0002894354427216138, "loss": 5.0071, "mean_token_accuracy": 0.21203849017620086, "num_tokens": 107808498.0, "step": 62155 }, { "entropy": 6.004882860183716, "epoch": 4.836257537444077, "grad_norm": 1.65625, "learning_rate": 0.00028940778412463164, "loss": 4.9599, "mean_token_accuracy": 0.21032360345125198, "num_tokens": 107815831.0, "step": 62160 }, { "entropy": 5.9539214134216305, "epoch": 4.836646566815794, "grad_norm": 1.421875, "learning_rate": 0.00028938012530903425, "loss": 4.9942, "mean_token_accuracy": 0.20935427248477936, "num_tokens": 107825258.0, "step": 62165 }, { "entropy": 5.884432411193847, "epoch": 4.837035596187512, "grad_norm": 1.375, "learning_rate": 0.0002893524662752414, "loss": 4.8889, "mean_token_accuracy": 0.21961808949708939, "num_tokens": 107833725.0, "step": 62170 }, { "entropy": 5.88515944480896, "epoch": 4.83742462555923, "grad_norm": 1.46875, "learning_rate": 0.00028932480702367264, "loss": 4.9014, "mean_token_accuracy": 0.21450790911912918, "num_tokens": 107841906.0, "step": 62175 }, { "entropy": 5.951255464553833, "epoch": 4.837813654930947, "grad_norm": 1.359375, "learning_rate": 0.0002892971475547478, "loss": 5.0282, "mean_token_accuracy": 0.2220454692840576, "num_tokens": 107850629.0, "step": 62180 }, { "entropy": 6.044350624084473, "epoch": 4.838202684302665, "grad_norm": 1.46875, "learning_rate": 0.00028926948786888655, "loss": 5.0734, "mean_token_accuracy": 0.20971916615962982, "num_tokens": 107859829.0, "step": 62185 }, { "entropy": 5.98042311668396, "epoch": 4.838591713674383, "grad_norm": 1.453125, "learning_rate": 0.00028924182796650854, "loss": 4.9722, "mean_token_accuracy": 0.21009718924760817, "num_tokens": 107867859.0, "step": 62190 }, { "entropy": 5.8776692867279055, "epoch": 4.8389807430461, "grad_norm": 1.4140625, "learning_rate": 0.00028921416784803336, "loss": 4.8555, "mean_token_accuracy": 0.21767117232084274, "num_tokens": 107876460.0, "step": 62195 }, { "entropy": 5.919812726974487, "epoch": 4.839369772417817, "grad_norm": 1.390625, "learning_rate": 0.0002891865075138809, "loss": 4.948, "mean_token_accuracy": 0.21607521325349807, "num_tokens": 107884904.0, "step": 62200 }, { "entropy": 5.856677103042602, "epoch": 4.839758801789535, "grad_norm": 1.5234375, "learning_rate": 0.00028915884696447064, "loss": 4.8787, "mean_token_accuracy": 0.22695459127426149, "num_tokens": 107893397.0, "step": 62205 }, { "entropy": 5.998841667175293, "epoch": 4.840147831161253, "grad_norm": 1.5, "learning_rate": 0.0002891311862002225, "loss": 5.0509, "mean_token_accuracy": 0.21474215984344483, "num_tokens": 107901736.0, "step": 62210 }, { "entropy": 5.9551084518432615, "epoch": 4.84053686053297, "grad_norm": 1.4140625, "learning_rate": 0.0002891035252215561, "loss": 4.9274, "mean_token_accuracy": 0.21660346984863282, "num_tokens": 107910370.0, "step": 62215 }, { "entropy": 5.921539545059204, "epoch": 4.840925889904688, "grad_norm": 1.5, "learning_rate": 0.00028907586402889115, "loss": 4.9692, "mean_token_accuracy": 0.21637522131204606, "num_tokens": 107918732.0, "step": 62220 }, { "entropy": 5.9289031505584715, "epoch": 4.841314919276405, "grad_norm": 1.34375, "learning_rate": 0.0002890482026226473, "loss": 4.9406, "mean_token_accuracy": 0.219663405418396, "num_tokens": 107927854.0, "step": 62225 }, { "entropy": 5.915649557113648, "epoch": 4.841703948648123, "grad_norm": 1.3828125, "learning_rate": 0.00028902054100324445, "loss": 4.8708, "mean_token_accuracy": 0.22470742017030715, "num_tokens": 107937144.0, "step": 62230 }, { "entropy": 5.980217599868775, "epoch": 4.84209297801984, "grad_norm": 1.46875, "learning_rate": 0.00028899287917110214, "loss": 5.0161, "mean_token_accuracy": 0.20845099538564682, "num_tokens": 107945590.0, "step": 62235 }, { "entropy": 5.930459594726562, "epoch": 4.842482007391558, "grad_norm": 1.3203125, "learning_rate": 0.0002889652171266402, "loss": 4.9478, "mean_token_accuracy": 0.2215537741780281, "num_tokens": 107954191.0, "step": 62240 }, { "entropy": 5.997185564041137, "epoch": 4.842871036763276, "grad_norm": 1.3828125, "learning_rate": 0.00028893755487027827, "loss": 4.9618, "mean_token_accuracy": 0.21665312796831132, "num_tokens": 107963530.0, "step": 62245 }, { "entropy": 6.032745742797852, "epoch": 4.843260066134993, "grad_norm": 1.5, "learning_rate": 0.00028890989240243614, "loss": 5.066, "mean_token_accuracy": 0.20527476221323013, "num_tokens": 107971540.0, "step": 62250 }, { "entropy": 5.887638568878174, "epoch": 4.843649095506711, "grad_norm": 1.3359375, "learning_rate": 0.00028888222972353356, "loss": 4.9055, "mean_token_accuracy": 0.2207385316491127, "num_tokens": 107980013.0, "step": 62255 }, { "entropy": 5.956586122512817, "epoch": 4.844038124878429, "grad_norm": 1.4453125, "learning_rate": 0.00028885456683399024, "loss": 5.0035, "mean_token_accuracy": 0.21161157488822938, "num_tokens": 107989061.0, "step": 62260 }, { "entropy": 5.868087339401245, "epoch": 4.844427154250146, "grad_norm": 1.4140625, "learning_rate": 0.00028882690373422586, "loss": 4.8815, "mean_token_accuracy": 0.21387384980916976, "num_tokens": 107997491.0, "step": 62265 }, { "entropy": 5.954627609252929, "epoch": 4.844816183621863, "grad_norm": 1.46875, "learning_rate": 0.0002887992404246603, "loss": 4.9491, "mean_token_accuracy": 0.21530840545892715, "num_tokens": 108006564.0, "step": 62270 }, { "entropy": 5.919207620620727, "epoch": 4.845205212993581, "grad_norm": 1.296875, "learning_rate": 0.0002887715769057132, "loss": 4.909, "mean_token_accuracy": 0.22007119804620742, "num_tokens": 108015355.0, "step": 62275 }, { "entropy": 5.925663852691651, "epoch": 4.845594242365299, "grad_norm": 1.53125, "learning_rate": 0.00028874391317780437, "loss": 4.9719, "mean_token_accuracy": 0.2168294295668602, "num_tokens": 108023786.0, "step": 62280 }, { "entropy": 5.8906255722045895, "epoch": 4.845983271737016, "grad_norm": 1.390625, "learning_rate": 0.0002887162492413534, "loss": 4.8084, "mean_token_accuracy": 0.2257682979106903, "num_tokens": 108031919.0, "step": 62285 }, { "entropy": 5.9154726505279545, "epoch": 4.846372301108734, "grad_norm": 1.5390625, "learning_rate": 0.0002886885850967803, "loss": 4.9052, "mean_token_accuracy": 0.22301119565963745, "num_tokens": 108040572.0, "step": 62290 }, { "entropy": 5.998310375213623, "epoch": 4.846761330480451, "grad_norm": 1.5, "learning_rate": 0.00028866092074450467, "loss": 5.0143, "mean_token_accuracy": 0.21536397337913513, "num_tokens": 108048293.0, "step": 62295 }, { "entropy": 6.007065486907959, "epoch": 4.847150359852169, "grad_norm": 1.515625, "learning_rate": 0.0002886332561849464, "loss": 5.0765, "mean_token_accuracy": 0.20775685906410218, "num_tokens": 108056862.0, "step": 62300 }, { "entropy": 6.010410976409912, "epoch": 4.847539389223886, "grad_norm": 1.4453125, "learning_rate": 0.00028860559141852504, "loss": 5.0429, "mean_token_accuracy": 0.21159214079380034, "num_tokens": 108065466.0, "step": 62305 }, { "entropy": 5.963889312744141, "epoch": 4.847928418595604, "grad_norm": 1.53125, "learning_rate": 0.00028857792644566057, "loss": 4.8511, "mean_token_accuracy": 0.21954134851694107, "num_tokens": 108073558.0, "step": 62310 }, { "entropy": 5.833923244476319, "epoch": 4.848317447967322, "grad_norm": 1.3203125, "learning_rate": 0.0002885502612667727, "loss": 4.8274, "mean_token_accuracy": 0.22944421023130418, "num_tokens": 108083181.0, "step": 62315 }, { "entropy": 5.818351554870605, "epoch": 4.848706477339039, "grad_norm": 1.46875, "learning_rate": 0.00028852259588228106, "loss": 4.8429, "mean_token_accuracy": 0.22114098370075225, "num_tokens": 108091643.0, "step": 62320 }, { "entropy": 5.923635339736938, "epoch": 4.849095506710757, "grad_norm": 1.546875, "learning_rate": 0.00028849493029260573, "loss": 4.866, "mean_token_accuracy": 0.23055962920188905, "num_tokens": 108099815.0, "step": 62325 }, { "entropy": 5.930892419815064, "epoch": 4.849484536082474, "grad_norm": 1.3671875, "learning_rate": 0.0002884672644981661, "loss": 4.9378, "mean_token_accuracy": 0.21286232322454451, "num_tokens": 108108360.0, "step": 62330 }, { "entropy": 5.965675115585327, "epoch": 4.849873565454192, "grad_norm": 1.4921875, "learning_rate": 0.0002884395984993823, "loss": 4.94, "mean_token_accuracy": 0.2166549175977707, "num_tokens": 108116368.0, "step": 62335 }, { "entropy": 5.917623138427734, "epoch": 4.850262594825909, "grad_norm": 1.515625, "learning_rate": 0.000288411932296674, "loss": 4.9039, "mean_token_accuracy": 0.21243095993995667, "num_tokens": 108124997.0, "step": 62340 }, { "entropy": 5.954190254211426, "epoch": 4.850651624197627, "grad_norm": 1.484375, "learning_rate": 0.0002883842658904609, "loss": 4.9669, "mean_token_accuracy": 0.21762391477823256, "num_tokens": 108133440.0, "step": 62345 }, { "entropy": 5.957757091522216, "epoch": 4.851040653569345, "grad_norm": 1.359375, "learning_rate": 0.0002883565992811629, "loss": 4.9507, "mean_token_accuracy": 0.21837241053581238, "num_tokens": 108142730.0, "step": 62350 }, { "entropy": 5.965146589279175, "epoch": 4.851429682941062, "grad_norm": 1.46875, "learning_rate": 0.0002883289324691998, "loss": 4.961, "mean_token_accuracy": 0.21059280037879943, "num_tokens": 108151470.0, "step": 62355 }, { "entropy": 5.878978061676025, "epoch": 4.851818712312779, "grad_norm": 1.5078125, "learning_rate": 0.0002883012654549913, "loss": 4.8867, "mean_token_accuracy": 0.22210302203893661, "num_tokens": 108160165.0, "step": 62360 }, { "entropy": 5.910700178146362, "epoch": 4.852207741684497, "grad_norm": 1.546875, "learning_rate": 0.00028827359823895726, "loss": 4.9231, "mean_token_accuracy": 0.2111850008368492, "num_tokens": 108168124.0, "step": 62365 }, { "entropy": 6.002094268798828, "epoch": 4.852596771056215, "grad_norm": 1.4453125, "learning_rate": 0.00028824593082151754, "loss": 5.0707, "mean_token_accuracy": 0.2012113645672798, "num_tokens": 108176579.0, "step": 62370 }, { "entropy": 5.949891090393066, "epoch": 4.852985800427932, "grad_norm": 1.4921875, "learning_rate": 0.0002882182632030919, "loss": 4.884, "mean_token_accuracy": 0.22614724040031434, "num_tokens": 108184638.0, "step": 62375 }, { "entropy": 5.966904163360596, "epoch": 4.85337482979965, "grad_norm": 1.5234375, "learning_rate": 0.0002881905953841002, "loss": 4.9248, "mean_token_accuracy": 0.2189707487821579, "num_tokens": 108192751.0, "step": 62380 }, { "entropy": 5.952373743057251, "epoch": 4.853763859171368, "grad_norm": 1.53125, "learning_rate": 0.0002881629273649621, "loss": 4.9683, "mean_token_accuracy": 0.2153223693370819, "num_tokens": 108201219.0, "step": 62385 }, { "entropy": 5.95755352973938, "epoch": 4.854152888543085, "grad_norm": 1.546875, "learning_rate": 0.00028813525914609767, "loss": 5.0831, "mean_token_accuracy": 0.20762702077627182, "num_tokens": 108210184.0, "step": 62390 }, { "entropy": 5.9866392612457275, "epoch": 4.854541917914803, "grad_norm": 1.390625, "learning_rate": 0.00028810759072792644, "loss": 4.9893, "mean_token_accuracy": 0.21291426420211793, "num_tokens": 108218549.0, "step": 62395 }, { "entropy": 6.039851951599121, "epoch": 4.85493094728652, "grad_norm": 1.46875, "learning_rate": 0.0002880799221108684, "loss": 5.037, "mean_token_accuracy": 0.21474067121744156, "num_tokens": 108226608.0, "step": 62400 }, { "entropy": 5.9445085525512695, "epoch": 4.855319976658238, "grad_norm": 1.5625, "learning_rate": 0.0002880522532953435, "loss": 4.9754, "mean_token_accuracy": 0.21942467838525773, "num_tokens": 108234384.0, "step": 62405 }, { "entropy": 5.980475950241089, "epoch": 4.855709006029955, "grad_norm": 1.453125, "learning_rate": 0.0002880245842817713, "loss": 5.0181, "mean_token_accuracy": 0.21448771357536317, "num_tokens": 108243534.0, "step": 62410 }, { "entropy": 5.9517323017120365, "epoch": 4.856098035401673, "grad_norm": 1.46875, "learning_rate": 0.0002879969150705718, "loss": 5.0141, "mean_token_accuracy": 0.2178867295384407, "num_tokens": 108252658.0, "step": 62415 }, { "entropy": 5.948013877868652, "epoch": 4.856487064773391, "grad_norm": 1.4765625, "learning_rate": 0.0002879692456621649, "loss": 4.8856, "mean_token_accuracy": 0.22678062617778777, "num_tokens": 108261464.0, "step": 62420 }, { "entropy": 5.898688745498657, "epoch": 4.8568760941451075, "grad_norm": 1.3203125, "learning_rate": 0.0002879415760569702, "loss": 4.9158, "mean_token_accuracy": 0.22375869750976562, "num_tokens": 108269936.0, "step": 62425 }, { "entropy": 5.9854659080505375, "epoch": 4.857265123516825, "grad_norm": 1.5, "learning_rate": 0.0002879139062554077, "loss": 5.0327, "mean_token_accuracy": 0.20757278949022293, "num_tokens": 108279112.0, "step": 62430 }, { "entropy": 6.002867364883423, "epoch": 4.857654152888543, "grad_norm": 1.5546875, "learning_rate": 0.00028788623625789725, "loss": 4.9752, "mean_token_accuracy": 0.20916147381067277, "num_tokens": 108287205.0, "step": 62435 }, { "entropy": 6.021507787704468, "epoch": 4.8580431822602606, "grad_norm": 1.4453125, "learning_rate": 0.0002878585660648587, "loss": 5.0096, "mean_token_accuracy": 0.20732629895210267, "num_tokens": 108296118.0, "step": 62440 }, { "entropy": 5.995490312576294, "epoch": 4.858432211631978, "grad_norm": 1.375, "learning_rate": 0.0002878308956767118, "loss": 5.014, "mean_token_accuracy": 0.20312580317258835, "num_tokens": 108306012.0, "step": 62445 }, { "entropy": 5.963175821304321, "epoch": 4.858821241003696, "grad_norm": 1.390625, "learning_rate": 0.0002878032250938766, "loss": 4.9777, "mean_token_accuracy": 0.21770790815353394, "num_tokens": 108315359.0, "step": 62450 }, { "entropy": 5.945657253265381, "epoch": 4.859210270375414, "grad_norm": 1.5078125, "learning_rate": 0.00028777555431677276, "loss": 4.9137, "mean_token_accuracy": 0.2229872465133667, "num_tokens": 108323093.0, "step": 62455 }, { "entropy": 5.867759752273559, "epoch": 4.859599299747131, "grad_norm": 1.453125, "learning_rate": 0.00028774788334582025, "loss": 4.8818, "mean_token_accuracy": 0.22571109235286713, "num_tokens": 108332556.0, "step": 62460 }, { "entropy": 5.920924091339112, "epoch": 4.859988329118848, "grad_norm": 1.3984375, "learning_rate": 0.0002877202121814389, "loss": 4.957, "mean_token_accuracy": 0.20899031907320023, "num_tokens": 108341794.0, "step": 62465 }, { "entropy": 6.068184804916382, "epoch": 4.860377358490566, "grad_norm": 1.5859375, "learning_rate": 0.0002876925408240485, "loss": 5.0418, "mean_token_accuracy": 0.20976990312337876, "num_tokens": 108349772.0, "step": 62470 }, { "entropy": 5.9050750732421875, "epoch": 4.8607663878622835, "grad_norm": 1.375, "learning_rate": 0.0002876648692740691, "loss": 4.8507, "mean_token_accuracy": 0.2298590362071991, "num_tokens": 108358406.0, "step": 62475 }, { "entropy": 5.983275127410889, "epoch": 4.861155417234001, "grad_norm": 1.421875, "learning_rate": 0.00028763719753192044, "loss": 5.0652, "mean_token_accuracy": 0.20897759050130843, "num_tokens": 108368203.0, "step": 62480 }, { "entropy": 5.9673772811889645, "epoch": 4.861544446605719, "grad_norm": 1.3828125, "learning_rate": 0.0002876095255980224, "loss": 4.998, "mean_token_accuracy": 0.21131344884634018, "num_tokens": 108377482.0, "step": 62485 }, { "entropy": 5.870056390762329, "epoch": 4.861933475977437, "grad_norm": 1.5546875, "learning_rate": 0.00028758185347279485, "loss": 4.8055, "mean_token_accuracy": 0.23057566583156586, "num_tokens": 108385993.0, "step": 62490 }, { "entropy": 5.9704900741577145, "epoch": 4.8623225053491534, "grad_norm": 1.5234375, "learning_rate": 0.0002875541811566578, "loss": 5.0557, "mean_token_accuracy": 0.2104988396167755, "num_tokens": 108394143.0, "step": 62495 }, { "entropy": 5.959816598892212, "epoch": 4.862711534720871, "grad_norm": 1.53125, "learning_rate": 0.0002875265086500309, "loss": 4.937, "mean_token_accuracy": 0.22604523599147797, "num_tokens": 108402531.0, "step": 62500 }, { "entropy": 5.931360149383545, "epoch": 4.863100564092589, "grad_norm": 1.3125, "learning_rate": 0.00028749883595333424, "loss": 5.0073, "mean_token_accuracy": 0.20964014828205108, "num_tokens": 108411884.0, "step": 62505 }, { "entropy": 5.919588470458985, "epoch": 4.8634895934643065, "grad_norm": 1.3828125, "learning_rate": 0.0002874711630669876, "loss": 5.0328, "mean_token_accuracy": 0.20710403323173524, "num_tokens": 108421246.0, "step": 62510 }, { "entropy": 5.920648097991943, "epoch": 4.863878622836024, "grad_norm": 1.421875, "learning_rate": 0.000287443489991411, "loss": 4.8698, "mean_token_accuracy": 0.22473251074552536, "num_tokens": 108429858.0, "step": 62515 }, { "entropy": 6.0476991653442385, "epoch": 4.864267652207742, "grad_norm": 1.3828125, "learning_rate": 0.0002874158167270242, "loss": 5.0342, "mean_token_accuracy": 0.2124841332435608, "num_tokens": 108438647.0, "step": 62520 }, { "entropy": 6.004568147659302, "epoch": 4.86465668157946, "grad_norm": 1.390625, "learning_rate": 0.00028738814327424714, "loss": 4.9433, "mean_token_accuracy": 0.21430870294570922, "num_tokens": 108446695.0, "step": 62525 }, { "entropy": 5.937493085861206, "epoch": 4.865045710951176, "grad_norm": 1.5859375, "learning_rate": 0.0002873604696334997, "loss": 4.9047, "mean_token_accuracy": 0.21397738456726073, "num_tokens": 108455299.0, "step": 62530 }, { "entropy": 5.966624212265015, "epoch": 4.865434740322894, "grad_norm": 1.3671875, "learning_rate": 0.00028733279580520185, "loss": 5.0051, "mean_token_accuracy": 0.21181025952100754, "num_tokens": 108464227.0, "step": 62535 }, { "entropy": 5.926171588897705, "epoch": 4.865823769694612, "grad_norm": 1.421875, "learning_rate": 0.00028730512178977343, "loss": 4.9295, "mean_token_accuracy": 0.2216956064105034, "num_tokens": 108473806.0, "step": 62540 }, { "entropy": 5.970411252975464, "epoch": 4.8662127990663295, "grad_norm": 1.390625, "learning_rate": 0.00028727744758763434, "loss": 5.027, "mean_token_accuracy": 0.214263716340065, "num_tokens": 108482291.0, "step": 62545 }, { "entropy": 5.931823301315307, "epoch": 4.866601828438047, "grad_norm": 1.359375, "learning_rate": 0.00028724977319920453, "loss": 4.9864, "mean_token_accuracy": 0.21358804553747177, "num_tokens": 108490662.0, "step": 62550 }, { "entropy": 5.895310640335083, "epoch": 4.866990857809765, "grad_norm": 1.3671875, "learning_rate": 0.00028722209862490393, "loss": 4.9418, "mean_token_accuracy": 0.21827817857265472, "num_tokens": 108500005.0, "step": 62555 }, { "entropy": 5.888722085952759, "epoch": 4.867379887181482, "grad_norm": 1.359375, "learning_rate": 0.00028719442386515245, "loss": 4.8908, "mean_token_accuracy": 0.22265540808439255, "num_tokens": 108509226.0, "step": 62560 }, { "entropy": 5.856849479675293, "epoch": 4.867768916553199, "grad_norm": 1.4765625, "learning_rate": 0.00028716674892036994, "loss": 4.8679, "mean_token_accuracy": 0.22694025933742523, "num_tokens": 108518417.0, "step": 62565 }, { "entropy": 5.949336576461792, "epoch": 4.868157945924917, "grad_norm": 1.328125, "learning_rate": 0.0002871390737909765, "loss": 4.9557, "mean_token_accuracy": 0.2165167361497879, "num_tokens": 108527603.0, "step": 62570 }, { "entropy": 5.95817084312439, "epoch": 4.868546975296635, "grad_norm": 1.4140625, "learning_rate": 0.00028711139847739187, "loss": 4.9871, "mean_token_accuracy": 0.21476602405309678, "num_tokens": 108535908.0, "step": 62575 }, { "entropy": 5.945937252044677, "epoch": 4.8689360046683525, "grad_norm": 1.46875, "learning_rate": 0.00028708372298003607, "loss": 4.9324, "mean_token_accuracy": 0.2162817656993866, "num_tokens": 108544250.0, "step": 62580 }, { "entropy": 5.926062059402466, "epoch": 4.86932503404007, "grad_norm": 1.6328125, "learning_rate": 0.00028705604729932895, "loss": 4.9264, "mean_token_accuracy": 0.21510962694883345, "num_tokens": 108553053.0, "step": 62585 }, { "entropy": 5.9675208568573, "epoch": 4.869714063411788, "grad_norm": 1.4765625, "learning_rate": 0.00028702837143569057, "loss": 4.9551, "mean_token_accuracy": 0.21661992371082306, "num_tokens": 108561686.0, "step": 62590 }, { "entropy": 5.860761451721191, "epoch": 4.870103092783506, "grad_norm": 1.515625, "learning_rate": 0.00028700069538954064, "loss": 4.8524, "mean_token_accuracy": 0.22031694799661636, "num_tokens": 108570219.0, "step": 62595 }, { "entropy": 5.982944488525391, "epoch": 4.870492122155222, "grad_norm": 1.5234375, "learning_rate": 0.00028697301916129944, "loss": 4.9912, "mean_token_accuracy": 0.2181403696537018, "num_tokens": 108579056.0, "step": 62600 }, { "entropy": 5.947331523895263, "epoch": 4.87088115152694, "grad_norm": 1.5078125, "learning_rate": 0.0002869453427513866, "loss": 4.895, "mean_token_accuracy": 0.22354386895895004, "num_tokens": 108587486.0, "step": 62605 }, { "entropy": 5.956013250350952, "epoch": 4.871270180898658, "grad_norm": 1.5, "learning_rate": 0.00028691766616022234, "loss": 4.9729, "mean_token_accuracy": 0.2121080458164215, "num_tokens": 108595989.0, "step": 62610 }, { "entropy": 5.950033855438233, "epoch": 4.8716592102703755, "grad_norm": 1.4140625, "learning_rate": 0.0002868899893882264, "loss": 4.8635, "mean_token_accuracy": 0.2227548986673355, "num_tokens": 108604807.0, "step": 62615 }, { "entropy": 5.97179069519043, "epoch": 4.872048239642093, "grad_norm": 1.4921875, "learning_rate": 0.00028686231243581873, "loss": 5.0219, "mean_token_accuracy": 0.20783150792121888, "num_tokens": 108613338.0, "step": 62620 }, { "entropy": 5.883927536010742, "epoch": 4.872437269013811, "grad_norm": 1.359375, "learning_rate": 0.00028683463530341944, "loss": 4.8902, "mean_token_accuracy": 0.22053857296705245, "num_tokens": 108621695.0, "step": 62625 }, { "entropy": 5.896273422241211, "epoch": 4.872826298385528, "grad_norm": 1.328125, "learning_rate": 0.0002868069579914483, "loss": 4.9411, "mean_token_accuracy": 0.22312623560428618, "num_tokens": 108631238.0, "step": 62630 }, { "entropy": 5.895962476730347, "epoch": 4.873215327757245, "grad_norm": 1.4921875, "learning_rate": 0.00028677928050032547, "loss": 4.8182, "mean_token_accuracy": 0.23048595190048218, "num_tokens": 108639829.0, "step": 62635 }, { "entropy": 6.011116409301758, "epoch": 4.873604357128963, "grad_norm": 1.4765625, "learning_rate": 0.00028675160283047073, "loss": 5.0198, "mean_token_accuracy": 0.21055786311626434, "num_tokens": 108648244.0, "step": 62640 }, { "entropy": 5.994265174865722, "epoch": 4.873993386500681, "grad_norm": 1.4375, "learning_rate": 0.00028672392498230414, "loss": 4.9938, "mean_token_accuracy": 0.20839695185422896, "num_tokens": 108656642.0, "step": 62645 }, { "entropy": 5.992451763153076, "epoch": 4.8743824158723985, "grad_norm": 1.5625, "learning_rate": 0.00028669624695624573, "loss": 5.0347, "mean_token_accuracy": 0.21017993241548538, "num_tokens": 108664720.0, "step": 62650 }, { "entropy": 5.920983409881591, "epoch": 4.874771445244116, "grad_norm": 1.3671875, "learning_rate": 0.00028666856875271535, "loss": 4.8525, "mean_token_accuracy": 0.23205921798944473, "num_tokens": 108674145.0, "step": 62655 }, { "entropy": 5.982768106460571, "epoch": 4.875160474615834, "grad_norm": 1.453125, "learning_rate": 0.0002866408903721329, "loss": 5.0258, "mean_token_accuracy": 0.21012409329414367, "num_tokens": 108682914.0, "step": 62660 }, { "entropy": 5.934384965896607, "epoch": 4.875549503987551, "grad_norm": 1.5546875, "learning_rate": 0.00028661321181491854, "loss": 4.8957, "mean_token_accuracy": 0.22287616580724717, "num_tokens": 108691449.0, "step": 62665 }, { "entropy": 5.959488821029663, "epoch": 4.875938533359268, "grad_norm": 1.5546875, "learning_rate": 0.0002865855330814922, "loss": 5.0099, "mean_token_accuracy": 0.2124689757823944, "num_tokens": 108699978.0, "step": 62670 }, { "entropy": 5.932666158676147, "epoch": 4.876327562730986, "grad_norm": 1.6171875, "learning_rate": 0.0002865578541722738, "loss": 4.9884, "mean_token_accuracy": 0.2206720605492592, "num_tokens": 108707864.0, "step": 62675 }, { "entropy": 5.931645345687866, "epoch": 4.876716592102704, "grad_norm": 1.3671875, "learning_rate": 0.0002865301750876834, "loss": 4.9714, "mean_token_accuracy": 0.224133962392807, "num_tokens": 108716781.0, "step": 62680 }, { "entropy": 6.007809162139893, "epoch": 4.8771056214744215, "grad_norm": 1.4375, "learning_rate": 0.0002865024958281409, "loss": 5.0464, "mean_token_accuracy": 0.21893274337053298, "num_tokens": 108725909.0, "step": 62685 }, { "entropy": 5.992783164978027, "epoch": 4.877494650846139, "grad_norm": 1.4375, "learning_rate": 0.00028647481639406644, "loss": 4.9941, "mean_token_accuracy": 0.21300367563962935, "num_tokens": 108735548.0, "step": 62690 }, { "entropy": 5.953064584732056, "epoch": 4.877883680217856, "grad_norm": 1.390625, "learning_rate": 0.00028644713678587983, "loss": 4.9242, "mean_token_accuracy": 0.2172428086400032, "num_tokens": 108744006.0, "step": 62695 }, { "entropy": 5.959431314468384, "epoch": 4.878272709589574, "grad_norm": 1.53125, "learning_rate": 0.00028641945700400104, "loss": 4.9515, "mean_token_accuracy": 0.21521011292934417, "num_tokens": 108752490.0, "step": 62700 }, { "entropy": 5.933838605880737, "epoch": 4.878661738961291, "grad_norm": 1.3203125, "learning_rate": 0.00028639177704885033, "loss": 4.9974, "mean_token_accuracy": 0.218491593003273, "num_tokens": 108761685.0, "step": 62705 }, { "entropy": 5.93937315940857, "epoch": 4.879050768333009, "grad_norm": 1.53125, "learning_rate": 0.00028636409692084743, "loss": 4.9618, "mean_token_accuracy": 0.21762053668498993, "num_tokens": 108769880.0, "step": 62710 }, { "entropy": 5.982127857208252, "epoch": 4.879439797704727, "grad_norm": 1.421875, "learning_rate": 0.0002863364166204125, "loss": 5.0087, "mean_token_accuracy": 0.20779570788145066, "num_tokens": 108779018.0, "step": 62715 }, { "entropy": 5.9794846534729, "epoch": 4.8798288270764445, "grad_norm": 1.6484375, "learning_rate": 0.00028630873614796543, "loss": 4.9535, "mean_token_accuracy": 0.21243578791618348, "num_tokens": 108786908.0, "step": 62720 }, { "entropy": 5.946661138534546, "epoch": 4.880217856448162, "grad_norm": 1.5390625, "learning_rate": 0.00028628105550392637, "loss": 4.8812, "mean_token_accuracy": 0.2158359944820404, "num_tokens": 108795156.0, "step": 62725 }, { "entropy": 5.940703582763672, "epoch": 4.88060688581988, "grad_norm": 1.53125, "learning_rate": 0.0002862533746887152, "loss": 4.8963, "mean_token_accuracy": 0.22232444882392882, "num_tokens": 108803175.0, "step": 62730 }, { "entropy": 5.925836372375488, "epoch": 4.880995915191597, "grad_norm": 1.4140625, "learning_rate": 0.00028622569370275196, "loss": 4.916, "mean_token_accuracy": 0.21965106427669526, "num_tokens": 108813187.0, "step": 62735 }, { "entropy": 5.966361045837402, "epoch": 4.881384944563314, "grad_norm": 1.5625, "learning_rate": 0.00028619801254645675, "loss": 5.0037, "mean_token_accuracy": 0.21276121586561203, "num_tokens": 108820913.0, "step": 62740 }, { "entropy": 5.9602337837219235, "epoch": 4.881773973935032, "grad_norm": 1.3515625, "learning_rate": 0.0002861703312202495, "loss": 4.9954, "mean_token_accuracy": 0.21729689836502075, "num_tokens": 108829927.0, "step": 62745 }, { "entropy": 5.9583131790161135, "epoch": 4.88216300330675, "grad_norm": 1.4609375, "learning_rate": 0.00028614264972455023, "loss": 5.022, "mean_token_accuracy": 0.21362959146499633, "num_tokens": 108838556.0, "step": 62750 }, { "entropy": 5.969022464752197, "epoch": 4.8825520326784675, "grad_norm": 1.5859375, "learning_rate": 0.00028611496805977906, "loss": 5.031, "mean_token_accuracy": 0.20862161368131638, "num_tokens": 108846640.0, "step": 62755 }, { "entropy": 5.959452867507935, "epoch": 4.882941062050184, "grad_norm": 1.421875, "learning_rate": 0.00028608728622635585, "loss": 4.8847, "mean_token_accuracy": 0.22041326016187668, "num_tokens": 108855008.0, "step": 62760 }, { "entropy": 6.044925498962402, "epoch": 4.883330091421902, "grad_norm": 1.4296875, "learning_rate": 0.00028605960422470073, "loss": 5.0686, "mean_token_accuracy": 0.21455166041851043, "num_tokens": 108863824.0, "step": 62765 }, { "entropy": 6.001237058639527, "epoch": 4.88371912079362, "grad_norm": 1.5, "learning_rate": 0.0002860319220552338, "loss": 5.0009, "mean_token_accuracy": 0.20919059216976166, "num_tokens": 108872365.0, "step": 62770 }, { "entropy": 5.918903350830078, "epoch": 4.884108150165337, "grad_norm": 1.4453125, "learning_rate": 0.00028600423971837484, "loss": 4.8444, "mean_token_accuracy": 0.2256878137588501, "num_tokens": 108881024.0, "step": 62775 }, { "entropy": 5.870365905761719, "epoch": 4.884497179537055, "grad_norm": 1.546875, "learning_rate": 0.00028597655721454427, "loss": 4.9456, "mean_token_accuracy": 0.21443799287080764, "num_tokens": 108889049.0, "step": 62780 }, { "entropy": 5.93803768157959, "epoch": 4.884886208908773, "grad_norm": 1.4140625, "learning_rate": 0.00028594887454416176, "loss": 4.9423, "mean_token_accuracy": 0.22198717892169953, "num_tokens": 108897819.0, "step": 62785 }, { "entropy": 5.966743803024292, "epoch": 4.8852752382804905, "grad_norm": 1.46875, "learning_rate": 0.0002859211917076476, "loss": 4.9534, "mean_token_accuracy": 0.22078824192285537, "num_tokens": 108906249.0, "step": 62790 }, { "entropy": 5.942706060409546, "epoch": 4.885664267652208, "grad_norm": 1.53125, "learning_rate": 0.00028589350870542165, "loss": 5.0175, "mean_token_accuracy": 0.21060277223587037, "num_tokens": 108914502.0, "step": 62795 }, { "entropy": 5.982306909561157, "epoch": 4.886053297023925, "grad_norm": 1.5, "learning_rate": 0.0002858658255379041, "loss": 5.0997, "mean_token_accuracy": 0.2100283607840538, "num_tokens": 108922945.0, "step": 62800 }, { "entropy": 5.949176597595215, "epoch": 4.886442326395643, "grad_norm": 1.3203125, "learning_rate": 0.00028583814220551495, "loss": 4.9531, "mean_token_accuracy": 0.2168431207537651, "num_tokens": 108931920.0, "step": 62805 }, { "entropy": 6.020411968231201, "epoch": 4.88683135576736, "grad_norm": 1.3984375, "learning_rate": 0.0002858104587086742, "loss": 5.0994, "mean_token_accuracy": 0.20849640369415284, "num_tokens": 108940529.0, "step": 62810 }, { "entropy": 5.954330825805664, "epoch": 4.887220385139078, "grad_norm": 1.5234375, "learning_rate": 0.000285782775047802, "loss": 4.9284, "mean_token_accuracy": 0.21844000667333602, "num_tokens": 108949623.0, "step": 62815 }, { "entropy": 6.012961721420288, "epoch": 4.887609414510796, "grad_norm": 1.3984375, "learning_rate": 0.0002857550912233183, "loss": 5.0506, "mean_token_accuracy": 0.20945561677217484, "num_tokens": 108958324.0, "step": 62820 }, { "entropy": 5.850955867767334, "epoch": 4.8879984438825135, "grad_norm": 1.3984375, "learning_rate": 0.0002857274072356432, "loss": 4.9204, "mean_token_accuracy": 0.22435320168733597, "num_tokens": 108967419.0, "step": 62825 }, { "entropy": 5.876270914077759, "epoch": 4.88838747325423, "grad_norm": 1.3828125, "learning_rate": 0.00028569972308519674, "loss": 4.896, "mean_token_accuracy": 0.22698958814144135, "num_tokens": 108976570.0, "step": 62830 }, { "entropy": 5.940917253494263, "epoch": 4.888776502625948, "grad_norm": 1.4609375, "learning_rate": 0.00028567203877239914, "loss": 5.0416, "mean_token_accuracy": 0.21107975095510484, "num_tokens": 108985494.0, "step": 62835 }, { "entropy": 6.046118211746216, "epoch": 4.889165531997666, "grad_norm": 1.484375, "learning_rate": 0.00028564435429767035, "loss": 5.0312, "mean_token_accuracy": 0.2123110443353653, "num_tokens": 108994252.0, "step": 62840 }, { "entropy": 5.948751926422119, "epoch": 4.889554561369383, "grad_norm": 1.3984375, "learning_rate": 0.0002856166696614303, "loss": 4.9698, "mean_token_accuracy": 0.2239857643842697, "num_tokens": 109003995.0, "step": 62845 }, { "entropy": 5.964430618286133, "epoch": 4.889943590741101, "grad_norm": 1.46875, "learning_rate": 0.0002855889848640992, "loss": 4.924, "mean_token_accuracy": 0.22492528706789017, "num_tokens": 109012914.0, "step": 62850 }, { "entropy": 6.027150058746338, "epoch": 4.890332620112819, "grad_norm": 1.4296875, "learning_rate": 0.0002855612999060971, "loss": 5.0474, "mean_token_accuracy": 0.2087967649102211, "num_tokens": 109021543.0, "step": 62855 }, { "entropy": 5.891846323013306, "epoch": 4.8907216494845365, "grad_norm": 1.546875, "learning_rate": 0.0002855336147878442, "loss": 4.9439, "mean_token_accuracy": 0.22011609375476837, "num_tokens": 109030228.0, "step": 62860 }, { "entropy": 5.8612734317779545, "epoch": 4.891110678856253, "grad_norm": 1.453125, "learning_rate": 0.00028550592950976036, "loss": 4.9314, "mean_token_accuracy": 0.21889870166778563, "num_tokens": 109040203.0, "step": 62865 }, { "entropy": 6.011459922790527, "epoch": 4.891499708227971, "grad_norm": 1.578125, "learning_rate": 0.00028547824407226574, "loss": 4.9769, "mean_token_accuracy": 0.21611387580633162, "num_tokens": 109048718.0, "step": 62870 }, { "entropy": 5.932864189147949, "epoch": 4.891888737599689, "grad_norm": 1.5625, "learning_rate": 0.0002854505584757805, "loss": 4.9353, "mean_token_accuracy": 0.21402130275964737, "num_tokens": 109057006.0, "step": 62875 }, { "entropy": 5.965393018722534, "epoch": 4.892277766971406, "grad_norm": 1.3828125, "learning_rate": 0.00028542287272072475, "loss": 5.0114, "mean_token_accuracy": 0.20908736139535905, "num_tokens": 109065547.0, "step": 62880 }, { "entropy": 5.888929986953736, "epoch": 4.892666796343124, "grad_norm": 1.453125, "learning_rate": 0.0002853951868075184, "loss": 4.9034, "mean_token_accuracy": 0.21744290739297867, "num_tokens": 109074856.0, "step": 62885 }, { "entropy": 5.950581789016724, "epoch": 4.893055825714842, "grad_norm": 1.515625, "learning_rate": 0.0002853675007365816, "loss": 4.9505, "mean_token_accuracy": 0.21567222028970717, "num_tokens": 109082810.0, "step": 62890 }, { "entropy": 5.8925902366638185, "epoch": 4.893444855086559, "grad_norm": 1.390625, "learning_rate": 0.0002853398145083345, "loss": 4.9158, "mean_token_accuracy": 0.22758617848157883, "num_tokens": 109091737.0, "step": 62895 }, { "entropy": 5.963476610183716, "epoch": 4.893833884458276, "grad_norm": 1.421875, "learning_rate": 0.00028531212812319724, "loss": 5.0543, "mean_token_accuracy": 0.20738180875778198, "num_tokens": 109101145.0, "step": 62900 }, { "entropy": 5.998518323898315, "epoch": 4.894222913829994, "grad_norm": 1.3046875, "learning_rate": 0.0002852844415815898, "loss": 4.9943, "mean_token_accuracy": 0.2150094226002693, "num_tokens": 109110633.0, "step": 62905 }, { "entropy": 5.991554594039917, "epoch": 4.894611943201712, "grad_norm": 1.3359375, "learning_rate": 0.00028525675488393234, "loss": 5.0588, "mean_token_accuracy": 0.206807379424572, "num_tokens": 109120496.0, "step": 62910 }, { "entropy": 5.925271940231323, "epoch": 4.895000972573429, "grad_norm": 1.453125, "learning_rate": 0.00028522906803064494, "loss": 4.9205, "mean_token_accuracy": 0.2188255399465561, "num_tokens": 109129270.0, "step": 62915 }, { "entropy": 5.9234319686889645, "epoch": 4.895390001945147, "grad_norm": 1.5546875, "learning_rate": 0.0002852013810221477, "loss": 4.9214, "mean_token_accuracy": 0.22282865196466445, "num_tokens": 109137285.0, "step": 62920 }, { "entropy": 5.917309427261353, "epoch": 4.895779031316865, "grad_norm": 1.421875, "learning_rate": 0.0002851736938588607, "loss": 4.9705, "mean_token_accuracy": 0.21477615237236022, "num_tokens": 109145613.0, "step": 62925 }, { "entropy": 5.920075130462647, "epoch": 4.8961680606885825, "grad_norm": 1.421875, "learning_rate": 0.0002851460065412042, "loss": 5.0531, "mean_token_accuracy": 0.21613599509000778, "num_tokens": 109154894.0, "step": 62930 }, { "entropy": 5.972373914718628, "epoch": 4.896557090060299, "grad_norm": 1.5078125, "learning_rate": 0.0002851183190695981, "loss": 4.995, "mean_token_accuracy": 0.2169308543205261, "num_tokens": 109163588.0, "step": 62935 }, { "entropy": 6.050361156463623, "epoch": 4.896946119432017, "grad_norm": 1.390625, "learning_rate": 0.0002850906314444627, "loss": 4.9696, "mean_token_accuracy": 0.20923201143741607, "num_tokens": 109172120.0, "step": 62940 }, { "entropy": 5.988979339599609, "epoch": 4.897335148803735, "grad_norm": 1.5546875, "learning_rate": 0.00028506294366621796, "loss": 4.9137, "mean_token_accuracy": 0.22414956539869307, "num_tokens": 109180474.0, "step": 62945 }, { "entropy": 5.924572944641113, "epoch": 4.897724178175452, "grad_norm": 1.421875, "learning_rate": 0.00028503525573528413, "loss": 4.8542, "mean_token_accuracy": 0.22324741035699844, "num_tokens": 109188832.0, "step": 62950 }, { "entropy": 5.848375701904297, "epoch": 4.89811320754717, "grad_norm": 1.484375, "learning_rate": 0.0002850075676520812, "loss": 4.8564, "mean_token_accuracy": 0.22773393392562866, "num_tokens": 109197508.0, "step": 62955 }, { "entropy": 5.919560050964355, "epoch": 4.898502236918888, "grad_norm": 1.4140625, "learning_rate": 0.0002849798794170294, "loss": 5.0212, "mean_token_accuracy": 0.21003840863704681, "num_tokens": 109205980.0, "step": 62960 }, { "entropy": 5.880718421936035, "epoch": 4.898891266290605, "grad_norm": 1.4609375, "learning_rate": 0.0002849521910305488, "loss": 4.8845, "mean_token_accuracy": 0.21703977584838868, "num_tokens": 109215169.0, "step": 62965 }, { "entropy": 5.916193962097168, "epoch": 4.899280295662322, "grad_norm": 1.3984375, "learning_rate": 0.00028492450249305957, "loss": 4.9266, "mean_token_accuracy": 0.2168121874332428, "num_tokens": 109224539.0, "step": 62970 }, { "entropy": 6.097114944458008, "epoch": 4.89966932503404, "grad_norm": 1.46875, "learning_rate": 0.00028489681380498177, "loss": 5.1377, "mean_token_accuracy": 0.20167911052703857, "num_tokens": 109233455.0, "step": 62975 }, { "entropy": 5.892354583740234, "epoch": 4.900058354405758, "grad_norm": 1.515625, "learning_rate": 0.00028486912496673557, "loss": 4.8298, "mean_token_accuracy": 0.22719240039587021, "num_tokens": 109241711.0, "step": 62980 }, { "entropy": 5.9986247539520265, "epoch": 4.900447383777475, "grad_norm": 1.546875, "learning_rate": 0.00028484143597874115, "loss": 5.0373, "mean_token_accuracy": 0.2098922997713089, "num_tokens": 109249459.0, "step": 62985 }, { "entropy": 5.91586742401123, "epoch": 4.900836413149193, "grad_norm": 1.390625, "learning_rate": 0.0002848137468414186, "loss": 4.95, "mean_token_accuracy": 0.20841717422008516, "num_tokens": 109258404.0, "step": 62990 }, { "entropy": 5.974041748046875, "epoch": 4.901225442520911, "grad_norm": 1.484375, "learning_rate": 0.000284786057555188, "loss": 4.9111, "mean_token_accuracy": 0.2193846434354782, "num_tokens": 109266519.0, "step": 62995 }, { "entropy": 5.930045032501221, "epoch": 4.9016144718926276, "grad_norm": 1.4453125, "learning_rate": 0.0002847583681204696, "loss": 4.9335, "mean_token_accuracy": 0.21822151839733123, "num_tokens": 109275177.0, "step": 63000 }, { "epoch": 4.9016144718926276, "eval_entropy": 5.652714310665332, "eval_loss": 5.0592145919799805, "eval_mean_token_accuracy": 0.22115875099919186, "eval_num_tokens": 109275177.0, "eval_runtime": 21.6139, "eval_samples_per_second": 1922.745, "eval_steps_per_second": 240.355, "step": 63000 }, { "entropy": 5.85461311340332, "epoch": 4.902003501264345, "grad_norm": 1.4609375, "learning_rate": 0.00028473067853768347, "loss": 4.8542, "mean_token_accuracy": 0.22625658363103868, "num_tokens": 109284009.0, "step": 63005 }, { "entropy": 5.888583612442017, "epoch": 4.902392530636063, "grad_norm": 1.484375, "learning_rate": 0.00028470298880724985, "loss": 4.9368, "mean_token_accuracy": 0.22174277454614638, "num_tokens": 109292197.0, "step": 63010 }, { "entropy": 5.957393980026245, "epoch": 4.902781560007781, "grad_norm": 1.484375, "learning_rate": 0.0002846752989295888, "loss": 4.9689, "mean_token_accuracy": 0.21476148813962936, "num_tokens": 109300949.0, "step": 63015 }, { "entropy": 5.9886205196380615, "epoch": 4.903170589379498, "grad_norm": 1.359375, "learning_rate": 0.0002846476089051204, "loss": 4.9704, "mean_token_accuracy": 0.21919180899858476, "num_tokens": 109309331.0, "step": 63020 }, { "entropy": 5.962155771255493, "epoch": 4.903559618751216, "grad_norm": 1.6171875, "learning_rate": 0.00028461991873426494, "loss": 4.9842, "mean_token_accuracy": 0.21331615447998048, "num_tokens": 109319025.0, "step": 63025 }, { "entropy": 5.929145860671997, "epoch": 4.903948648122933, "grad_norm": 1.4296875, "learning_rate": 0.0002845922284174426, "loss": 4.8825, "mean_token_accuracy": 0.21861564069986344, "num_tokens": 109328063.0, "step": 63030 }, { "entropy": 5.902605152130127, "epoch": 4.9043376774946505, "grad_norm": 1.390625, "learning_rate": 0.00028456453795507335, "loss": 4.8306, "mean_token_accuracy": 0.22251228541135787, "num_tokens": 109336214.0, "step": 63035 }, { "entropy": 5.940720176696777, "epoch": 4.904726706866368, "grad_norm": 1.4921875, "learning_rate": 0.0002845368473475776, "loss": 5.008, "mean_token_accuracy": 0.21293063461780548, "num_tokens": 109345479.0, "step": 63040 }, { "entropy": 5.951022672653198, "epoch": 4.905115736238086, "grad_norm": 1.546875, "learning_rate": 0.00028450915659537524, "loss": 4.9215, "mean_token_accuracy": 0.22367617189884187, "num_tokens": 109353881.0, "step": 63045 }, { "entropy": 5.927049350738526, "epoch": 4.905504765609804, "grad_norm": 1.375, "learning_rate": 0.0002844814656988866, "loss": 4.972, "mean_token_accuracy": 0.21864169836044312, "num_tokens": 109362693.0, "step": 63050 }, { "entropy": 5.853742027282715, "epoch": 4.905893794981521, "grad_norm": 1.4609375, "learning_rate": 0.00028445377465853176, "loss": 4.8163, "mean_token_accuracy": 0.2237616539001465, "num_tokens": 109372187.0, "step": 63055 }, { "entropy": 5.916268730163575, "epoch": 4.906282824353239, "grad_norm": 1.5234375, "learning_rate": 0.00028442608347473093, "loss": 4.9517, "mean_token_accuracy": 0.21607140302658082, "num_tokens": 109380773.0, "step": 63060 }, { "entropy": 5.841884803771973, "epoch": 4.906671853724957, "grad_norm": 1.515625, "learning_rate": 0.00028439839214790437, "loss": 4.8816, "mean_token_accuracy": 0.23068843632936478, "num_tokens": 109390005.0, "step": 63065 }, { "entropy": 5.952748727798462, "epoch": 4.9070608830966735, "grad_norm": 1.6015625, "learning_rate": 0.0002843707006784722, "loss": 4.9273, "mean_token_accuracy": 0.21825793087482454, "num_tokens": 109398524.0, "step": 63070 }, { "entropy": 6.007682991027832, "epoch": 4.907449912468391, "grad_norm": 1.4921875, "learning_rate": 0.0002843430090668545, "loss": 5.0055, "mean_token_accuracy": 0.2087055191397667, "num_tokens": 109407966.0, "step": 63075 }, { "entropy": 5.9114298820495605, "epoch": 4.907838941840109, "grad_norm": 1.453125, "learning_rate": 0.00028431531731347155, "loss": 4.9389, "mean_token_accuracy": 0.21217501908540726, "num_tokens": 109416735.0, "step": 63080 }, { "entropy": 5.9625335216522215, "epoch": 4.908227971211827, "grad_norm": 1.5078125, "learning_rate": 0.0002842876254187434, "loss": 4.9963, "mean_token_accuracy": 0.21428932398557662, "num_tokens": 109425770.0, "step": 63085 }, { "entropy": 5.956892299652099, "epoch": 4.908617000583544, "grad_norm": 1.484375, "learning_rate": 0.00028425993338309036, "loss": 4.9174, "mean_token_accuracy": 0.21090444028377534, "num_tokens": 109433631.0, "step": 63090 }, { "entropy": 5.980113172531128, "epoch": 4.909006029955261, "grad_norm": 1.5234375, "learning_rate": 0.0002842322412069325, "loss": 5.0563, "mean_token_accuracy": 0.20872304439544678, "num_tokens": 109441692.0, "step": 63095 }, { "entropy": 5.955261468887329, "epoch": 4.909395059326979, "grad_norm": 1.3671875, "learning_rate": 0.0002842045488906902, "loss": 4.9924, "mean_token_accuracy": 0.21723778396844864, "num_tokens": 109450805.0, "step": 63100 }, { "entropy": 5.934364461898804, "epoch": 4.9097840886986965, "grad_norm": 1.421875, "learning_rate": 0.00028417685643478347, "loss": 4.8754, "mean_token_accuracy": 0.22776860892772674, "num_tokens": 109459500.0, "step": 63105 }, { "entropy": 5.962911939620971, "epoch": 4.910173118070414, "grad_norm": 1.5234375, "learning_rate": 0.00028414916383963265, "loss": 4.9898, "mean_token_accuracy": 0.21713587492704392, "num_tokens": 109467303.0, "step": 63110 }, { "entropy": 5.908255958557129, "epoch": 4.910562147442132, "grad_norm": 1.421875, "learning_rate": 0.0002841214711056577, "loss": 4.978, "mean_token_accuracy": 0.2208307832479477, "num_tokens": 109475752.0, "step": 63115 }, { "entropy": 5.965822315216064, "epoch": 4.91095117681385, "grad_norm": 1.4375, "learning_rate": 0.000284093778233279, "loss": 4.9269, "mean_token_accuracy": 0.22186021208763124, "num_tokens": 109484385.0, "step": 63120 }, { "entropy": 5.914725589752197, "epoch": 4.911340206185567, "grad_norm": 1.4375, "learning_rate": 0.0002840660852229166, "loss": 4.9932, "mean_token_accuracy": 0.21080339848995208, "num_tokens": 109492674.0, "step": 63125 }, { "entropy": 6.014460945129395, "epoch": 4.911729235557285, "grad_norm": 1.40625, "learning_rate": 0.0002840383920749908, "loss": 5.0322, "mean_token_accuracy": 0.21515663266181945, "num_tokens": 109502027.0, "step": 63130 }, { "entropy": 6.028676080703735, "epoch": 4.912118264929002, "grad_norm": 1.421875, "learning_rate": 0.0002840106987899219, "loss": 4.9586, "mean_token_accuracy": 0.21193777918815612, "num_tokens": 109510324.0, "step": 63135 }, { "entropy": 5.919425535202026, "epoch": 4.9125072943007195, "grad_norm": 1.4765625, "learning_rate": 0.0002839830053681299, "loss": 4.9391, "mean_token_accuracy": 0.2134452596306801, "num_tokens": 109519097.0, "step": 63140 }, { "entropy": 5.941795063018799, "epoch": 4.912896323672437, "grad_norm": 1.4921875, "learning_rate": 0.00028395531181003516, "loss": 4.9431, "mean_token_accuracy": 0.21991322040557862, "num_tokens": 109527841.0, "step": 63145 }, { "entropy": 5.9953711986541744, "epoch": 4.913285353044155, "grad_norm": 1.484375, "learning_rate": 0.0002839276181160577, "loss": 4.9777, "mean_token_accuracy": 0.21783761382102967, "num_tokens": 109536222.0, "step": 63150 }, { "entropy": 6.038424491882324, "epoch": 4.913674382415873, "grad_norm": 1.359375, "learning_rate": 0.000283899924286618, "loss": 5.0843, "mean_token_accuracy": 0.20836381763219833, "num_tokens": 109545727.0, "step": 63155 }, { "entropy": 5.993653154373169, "epoch": 4.91406341178759, "grad_norm": 1.4140625, "learning_rate": 0.000283872230322136, "loss": 5.0282, "mean_token_accuracy": 0.20641112476587295, "num_tokens": 109554350.0, "step": 63160 }, { "entropy": 6.023221015930176, "epoch": 4.914452441159307, "grad_norm": 1.546875, "learning_rate": 0.00028384453622303207, "loss": 5.0713, "mean_token_accuracy": 0.20121698081493378, "num_tokens": 109562950.0, "step": 63165 }, { "entropy": 6.006545925140381, "epoch": 4.914841470531025, "grad_norm": 1.59375, "learning_rate": 0.00028381684198972636, "loss": 4.9943, "mean_token_accuracy": 0.21690357476472855, "num_tokens": 109570956.0, "step": 63170 }, { "entropy": 5.959226036071778, "epoch": 4.9152304999027425, "grad_norm": 1.421875, "learning_rate": 0.00028378914762263905, "loss": 4.9924, "mean_token_accuracy": 0.21950844824314117, "num_tokens": 109579991.0, "step": 63175 }, { "entropy": 5.920270681381226, "epoch": 4.91561952927446, "grad_norm": 1.484375, "learning_rate": 0.00028376145312219054, "loss": 4.972, "mean_token_accuracy": 0.21749282032251357, "num_tokens": 109588006.0, "step": 63180 }, { "entropy": 5.895156145095825, "epoch": 4.916008558646178, "grad_norm": 1.640625, "learning_rate": 0.0002837337584888009, "loss": 4.8598, "mean_token_accuracy": 0.2223282963037491, "num_tokens": 109595568.0, "step": 63185 }, { "entropy": 5.984888744354248, "epoch": 4.916397588017896, "grad_norm": 1.4765625, "learning_rate": 0.0002837060637228903, "loss": 5.0061, "mean_token_accuracy": 0.21437182873487473, "num_tokens": 109603654.0, "step": 63190 }, { "entropy": 6.0535430908203125, "epoch": 4.916786617389613, "grad_norm": 1.421875, "learning_rate": 0.00028367836882487905, "loss": 5.084, "mean_token_accuracy": 0.20416779518127443, "num_tokens": 109612303.0, "step": 63195 }, { "entropy": 6.0062463760375975, "epoch": 4.91717564676133, "grad_norm": 1.4375, "learning_rate": 0.0002836506737951875, "loss": 5.0496, "mean_token_accuracy": 0.2100728929042816, "num_tokens": 109620829.0, "step": 63200 }, { "entropy": 6.015235900878906, "epoch": 4.917564676133048, "grad_norm": 1.421875, "learning_rate": 0.0002836229786342356, "loss": 5.0459, "mean_token_accuracy": 0.20695452243089676, "num_tokens": 109629140.0, "step": 63205 }, { "entropy": 5.911878442764282, "epoch": 4.9179537055047655, "grad_norm": 1.6015625, "learning_rate": 0.0002835952833424438, "loss": 4.9595, "mean_token_accuracy": 0.21258497834205628, "num_tokens": 109637951.0, "step": 63210 }, { "entropy": 5.953508138656616, "epoch": 4.918342734876483, "grad_norm": 1.484375, "learning_rate": 0.00028356758792023217, "loss": 4.9155, "mean_token_accuracy": 0.22351914048194885, "num_tokens": 109646243.0, "step": 63215 }, { "entropy": 5.981290674209594, "epoch": 4.918731764248201, "grad_norm": 1.4609375, "learning_rate": 0.00028353989236802114, "loss": 4.9649, "mean_token_accuracy": 0.212136909365654, "num_tokens": 109655426.0, "step": 63220 }, { "entropy": 5.998653078079224, "epoch": 4.919120793619919, "grad_norm": 1.4453125, "learning_rate": 0.00028351219668623076, "loss": 5.0198, "mean_token_accuracy": 0.20141818821430207, "num_tokens": 109664131.0, "step": 63225 }, { "entropy": 5.969208717346191, "epoch": 4.919509822991635, "grad_norm": 1.5, "learning_rate": 0.0002834845008752813, "loss": 4.9109, "mean_token_accuracy": 0.21544253677129746, "num_tokens": 109673252.0, "step": 63230 }, { "entropy": 5.954246282577515, "epoch": 4.919898852363353, "grad_norm": 1.390625, "learning_rate": 0.00028345680493559313, "loss": 4.9093, "mean_token_accuracy": 0.22585375010967254, "num_tokens": 109681224.0, "step": 63235 }, { "entropy": 5.983716726303101, "epoch": 4.920287881735071, "grad_norm": 1.5390625, "learning_rate": 0.0002834291088675864, "loss": 4.9866, "mean_token_accuracy": 0.21000488996505737, "num_tokens": 109690187.0, "step": 63240 }, { "entropy": 5.950297737121582, "epoch": 4.9206769111067885, "grad_norm": 1.5234375, "learning_rate": 0.00028340141267168135, "loss": 4.9598, "mean_token_accuracy": 0.22097481340169906, "num_tokens": 109699204.0, "step": 63245 }, { "entropy": 5.952619314193726, "epoch": 4.921065940478506, "grad_norm": 1.4609375, "learning_rate": 0.00028337371634829824, "loss": 4.9662, "mean_token_accuracy": 0.2160538002848625, "num_tokens": 109708151.0, "step": 63250 }, { "entropy": 5.976229810714722, "epoch": 4.921454969850224, "grad_norm": 1.5, "learning_rate": 0.0002833460198978573, "loss": 5.0209, "mean_token_accuracy": 0.21549562811851503, "num_tokens": 109717304.0, "step": 63255 }, { "entropy": 5.995584487915039, "epoch": 4.921843999221942, "grad_norm": 1.34375, "learning_rate": 0.0002833183233207788, "loss": 5.0198, "mean_token_accuracy": 0.2153089627623558, "num_tokens": 109727088.0, "step": 63260 }, { "entropy": 6.0054210186004635, "epoch": 4.922233028593659, "grad_norm": 1.484375, "learning_rate": 0.00028329062661748295, "loss": 4.9669, "mean_token_accuracy": 0.2194717973470688, "num_tokens": 109735699.0, "step": 63265 }, { "entropy": 6.041084718704224, "epoch": 4.922622057965376, "grad_norm": 1.4765625, "learning_rate": 0.00028326292978839005, "loss": 4.969, "mean_token_accuracy": 0.2195608824491501, "num_tokens": 109743596.0, "step": 63270 }, { "entropy": 5.901253080368042, "epoch": 4.923011087337094, "grad_norm": 1.6015625, "learning_rate": 0.00028323523283392034, "loss": 4.8931, "mean_token_accuracy": 0.22465574592351914, "num_tokens": 109751699.0, "step": 63275 }, { "entropy": 5.961084604263306, "epoch": 4.9234001167088115, "grad_norm": 1.4140625, "learning_rate": 0.00028320753575449415, "loss": 4.9923, "mean_token_accuracy": 0.20973095297813416, "num_tokens": 109759890.0, "step": 63280 }, { "entropy": 6.010225868225097, "epoch": 4.923789146080529, "grad_norm": 1.5625, "learning_rate": 0.0002831798385505316, "loss": 5.1123, "mean_token_accuracy": 0.20896685123443604, "num_tokens": 109768428.0, "step": 63285 }, { "entropy": 5.966949415206909, "epoch": 4.924178175452247, "grad_norm": 1.5546875, "learning_rate": 0.00028315214122245295, "loss": 4.9139, "mean_token_accuracy": 0.2185269147157669, "num_tokens": 109776758.0, "step": 63290 }, { "entropy": 6.007488489151001, "epoch": 4.924567204823965, "grad_norm": 1.453125, "learning_rate": 0.0002831244437706786, "loss": 5.0092, "mean_token_accuracy": 0.2021022543311119, "num_tokens": 109785572.0, "step": 63295 }, { "entropy": 5.950564575195313, "epoch": 4.924956234195681, "grad_norm": 1.3671875, "learning_rate": 0.0002830967461956288, "loss": 4.9732, "mean_token_accuracy": 0.21577254980802535, "num_tokens": 109794395.0, "step": 63300 }, { "entropy": 6.005304145812988, "epoch": 4.925345263567399, "grad_norm": 1.53125, "learning_rate": 0.00028306904849772374, "loss": 4.9539, "mean_token_accuracy": 0.21857646554708482, "num_tokens": 109802238.0, "step": 63305 }, { "entropy": 5.958049964904785, "epoch": 4.925734292939117, "grad_norm": 1.3984375, "learning_rate": 0.0002830413506773837, "loss": 4.9613, "mean_token_accuracy": 0.21227618604898452, "num_tokens": 109811151.0, "step": 63310 }, { "entropy": 5.917121934890747, "epoch": 4.9261233223108345, "grad_norm": 1.4921875, "learning_rate": 0.000283013652735029, "loss": 4.9732, "mean_token_accuracy": 0.22661359310150148, "num_tokens": 109819622.0, "step": 63315 }, { "entropy": 6.0441161632537845, "epoch": 4.926512351682552, "grad_norm": 1.5, "learning_rate": 0.00028298595467107985, "loss": 5.0571, "mean_token_accuracy": 0.2033882573246956, "num_tokens": 109827993.0, "step": 63320 }, { "entropy": 6.068973064422607, "epoch": 4.92690138105427, "grad_norm": 1.515625, "learning_rate": 0.0002829582564859565, "loss": 5.0779, "mean_token_accuracy": 0.20832820534706115, "num_tokens": 109836731.0, "step": 63325 }, { "entropy": 6.009917449951172, "epoch": 4.927290410425988, "grad_norm": 1.53125, "learning_rate": 0.0002829305581800793, "loss": 5.0101, "mean_token_accuracy": 0.21852977573871613, "num_tokens": 109845083.0, "step": 63330 }, { "entropy": 6.019495820999145, "epoch": 4.927679439797704, "grad_norm": 1.609375, "learning_rate": 0.0002829028597538685, "loss": 4.9186, "mean_token_accuracy": 0.21844810396432876, "num_tokens": 109853118.0, "step": 63335 }, { "entropy": 5.976355695724488, "epoch": 4.928068469169422, "grad_norm": 1.546875, "learning_rate": 0.00028287516120774445, "loss": 5.0445, "mean_token_accuracy": 0.21278872191905976, "num_tokens": 109861212.0, "step": 63340 }, { "entropy": 5.9101625919342045, "epoch": 4.92845749854114, "grad_norm": 1.4765625, "learning_rate": 0.0002828474625421273, "loss": 4.9244, "mean_token_accuracy": 0.21823876053094865, "num_tokens": 109868969.0, "step": 63345 }, { "entropy": 5.988764142990112, "epoch": 4.9288465279128575, "grad_norm": 1.4453125, "learning_rate": 0.0002828197637574374, "loss": 4.9994, "mean_token_accuracy": 0.2206467255949974, "num_tokens": 109878284.0, "step": 63350 }, { "entropy": 5.98193850517273, "epoch": 4.929235557284575, "grad_norm": 1.453125, "learning_rate": 0.00028279206485409505, "loss": 4.9813, "mean_token_accuracy": 0.21575236916542054, "num_tokens": 109886815.0, "step": 63355 }, { "entropy": 6.007997179031372, "epoch": 4.929624586656293, "grad_norm": 1.4765625, "learning_rate": 0.0002827643658325205, "loss": 4.9611, "mean_token_accuracy": 0.21635722219944, "num_tokens": 109896163.0, "step": 63360 }, { "entropy": 6.005470228195191, "epoch": 4.93001361602801, "grad_norm": 1.609375, "learning_rate": 0.000282736666693134, "loss": 4.976, "mean_token_accuracy": 0.21511476784944533, "num_tokens": 109904995.0, "step": 63365 }, { "entropy": 6.000383090972901, "epoch": 4.930402645399727, "grad_norm": 1.515625, "learning_rate": 0.0002827089674363559, "loss": 4.9335, "mean_token_accuracy": 0.2165600150823593, "num_tokens": 109913168.0, "step": 63370 }, { "entropy": 5.893802499771118, "epoch": 4.930791674771445, "grad_norm": 1.4609375, "learning_rate": 0.0002826812680626066, "loss": 4.9933, "mean_token_accuracy": 0.21067523658275605, "num_tokens": 109921915.0, "step": 63375 }, { "entropy": 5.914792156219482, "epoch": 4.931180704143163, "grad_norm": 1.453125, "learning_rate": 0.0002826535685723062, "loss": 4.977, "mean_token_accuracy": 0.2129411831498146, "num_tokens": 109931294.0, "step": 63380 }, { "entropy": 6.013063955307007, "epoch": 4.9315697335148805, "grad_norm": 1.4296875, "learning_rate": 0.00028262586896587517, "loss": 4.9669, "mean_token_accuracy": 0.2112464725971222, "num_tokens": 109939864.0, "step": 63385 }, { "entropy": 5.958077096939087, "epoch": 4.931958762886598, "grad_norm": 1.5625, "learning_rate": 0.0002825981692437336, "loss": 4.9713, "mean_token_accuracy": 0.218314266204834, "num_tokens": 109948715.0, "step": 63390 }, { "entropy": 6.015986490249634, "epoch": 4.932347792258316, "grad_norm": 1.4921875, "learning_rate": 0.00028257046940630197, "loss": 5.0668, "mean_token_accuracy": 0.2084370583295822, "num_tokens": 109957763.0, "step": 63395 }, { "entropy": 5.95835313796997, "epoch": 4.932736821630033, "grad_norm": 1.4375, "learning_rate": 0.00028254276945400056, "loss": 4.9215, "mean_token_accuracy": 0.21456012427806853, "num_tokens": 109966215.0, "step": 63400 }, { "entropy": 5.978005313873291, "epoch": 4.93312585100175, "grad_norm": 1.53125, "learning_rate": 0.00028251506938724953, "loss": 5.017, "mean_token_accuracy": 0.21322564035654068, "num_tokens": 109975393.0, "step": 63405 }, { "entropy": 5.932893705368042, "epoch": 4.933514880373468, "grad_norm": 1.234375, "learning_rate": 0.00028248736920646927, "loss": 4.9176, "mean_token_accuracy": 0.22542205601930618, "num_tokens": 109984749.0, "step": 63410 }, { "entropy": 5.930654907226563, "epoch": 4.933903909745186, "grad_norm": 1.4296875, "learning_rate": 0.00028245966891208017, "loss": 4.9304, "mean_token_accuracy": 0.21855888664722442, "num_tokens": 109993397.0, "step": 63415 }, { "entropy": 5.911979007720947, "epoch": 4.9342929391169035, "grad_norm": 1.4453125, "learning_rate": 0.0002824319685045025, "loss": 4.9293, "mean_token_accuracy": 0.21808079034090042, "num_tokens": 110002261.0, "step": 63420 }, { "entropy": 5.9960957050323485, "epoch": 4.934681968488621, "grad_norm": 1.390625, "learning_rate": 0.00028240426798415645, "loss": 4.9833, "mean_token_accuracy": 0.21386766582727432, "num_tokens": 110011276.0, "step": 63425 }, { "entropy": 5.9283815860748295, "epoch": 4.935070997860338, "grad_norm": 1.4375, "learning_rate": 0.0002823765673514625, "loss": 4.9492, "mean_token_accuracy": 0.20741480886936187, "num_tokens": 110020066.0, "step": 63430 }, { "entropy": 6.040676784515381, "epoch": 4.935460027232056, "grad_norm": 1.484375, "learning_rate": 0.00028234886660684084, "loss": 5.0929, "mean_token_accuracy": 0.19967034906148912, "num_tokens": 110028650.0, "step": 63435 }, { "entropy": 5.977835035324096, "epoch": 4.935849056603773, "grad_norm": 1.5234375, "learning_rate": 0.0002823211657507118, "loss": 4.9468, "mean_token_accuracy": 0.21339952945709229, "num_tokens": 110037422.0, "step": 63440 }, { "entropy": 5.945356321334839, "epoch": 4.936238085975491, "grad_norm": 1.4375, "learning_rate": 0.0002822934647834958, "loss": 4.945, "mean_token_accuracy": 0.21767951548099518, "num_tokens": 110046449.0, "step": 63445 }, { "entropy": 5.992082405090332, "epoch": 4.936627115347209, "grad_norm": 1.4765625, "learning_rate": 0.00028226576370561304, "loss": 5.0431, "mean_token_accuracy": 0.20125000923871994, "num_tokens": 110055089.0, "step": 63450 }, { "entropy": 5.957101678848266, "epoch": 4.9370161447189265, "grad_norm": 1.390625, "learning_rate": 0.00028223806251748384, "loss": 4.9868, "mean_token_accuracy": 0.2128631815314293, "num_tokens": 110064512.0, "step": 63455 }, { "entropy": 6.015191984176636, "epoch": 4.937405174090644, "grad_norm": 1.3515625, "learning_rate": 0.0002822103612195286, "loss": 5.0449, "mean_token_accuracy": 0.2126172110438347, "num_tokens": 110073043.0, "step": 63460 }, { "entropy": 5.991922807693482, "epoch": 4.937794203462362, "grad_norm": 1.53125, "learning_rate": 0.0002821826598121676, "loss": 4.9766, "mean_token_accuracy": 0.21445770114660262, "num_tokens": 110080846.0, "step": 63465 }, { "entropy": 6.005674552917481, "epoch": 4.938183232834079, "grad_norm": 1.578125, "learning_rate": 0.0002821549582958212, "loss": 5.0235, "mean_token_accuracy": 0.2090216636657715, "num_tokens": 110090442.0, "step": 63470 }, { "entropy": 5.947021770477295, "epoch": 4.938572262205796, "grad_norm": 1.4609375, "learning_rate": 0.0002821272566709096, "loss": 4.881, "mean_token_accuracy": 0.21784914880990983, "num_tokens": 110098982.0, "step": 63475 }, { "entropy": 6.060851192474365, "epoch": 4.938961291577514, "grad_norm": 1.421875, "learning_rate": 0.00028209955493785333, "loss": 5.1225, "mean_token_accuracy": 0.20657771974802017, "num_tokens": 110107912.0, "step": 63480 }, { "entropy": 5.914357376098633, "epoch": 4.939350320949232, "grad_norm": 1.5234375, "learning_rate": 0.0002820718530970726, "loss": 4.871, "mean_token_accuracy": 0.22238297313451766, "num_tokens": 110116484.0, "step": 63485 }, { "entropy": 5.97326889038086, "epoch": 4.9397393503209495, "grad_norm": 1.515625, "learning_rate": 0.00028204415114898765, "loss": 4.971, "mean_token_accuracy": 0.21657685488462447, "num_tokens": 110125412.0, "step": 63490 }, { "entropy": 5.946655130386352, "epoch": 4.940128379692667, "grad_norm": 1.484375, "learning_rate": 0.00028201644909401903, "loss": 4.9024, "mean_token_accuracy": 0.2187240019440651, "num_tokens": 110133159.0, "step": 63495 }, { "entropy": 5.955028009414673, "epoch": 4.940517409064384, "grad_norm": 1.4765625, "learning_rate": 0.00028198874693258696, "loss": 4.9828, "mean_token_accuracy": 0.21358607411384584, "num_tokens": 110142167.0, "step": 63500 }, { "entropy": 6.044516468048096, "epoch": 4.940906438436102, "grad_norm": 1.375, "learning_rate": 0.0002819610446651117, "loss": 5.1063, "mean_token_accuracy": 0.20724042356014252, "num_tokens": 110151097.0, "step": 63505 }, { "entropy": 5.938747215270996, "epoch": 4.941295467807819, "grad_norm": 1.3671875, "learning_rate": 0.00028193334229201374, "loss": 4.9301, "mean_token_accuracy": 0.2138589709997177, "num_tokens": 110160982.0, "step": 63510 }, { "entropy": 6.0448261260986325, "epoch": 4.941684497179537, "grad_norm": 1.484375, "learning_rate": 0.00028190563981371334, "loss": 5.0798, "mean_token_accuracy": 0.218965807557106, "num_tokens": 110169572.0, "step": 63515 }, { "entropy": 5.979134225845337, "epoch": 4.942073526551255, "grad_norm": 1.3828125, "learning_rate": 0.0002818779372306308, "loss": 5.0086, "mean_token_accuracy": 0.20818604081869124, "num_tokens": 110177901.0, "step": 63520 }, { "entropy": 6.055978727340698, "epoch": 4.9424625559229725, "grad_norm": 1.40625, "learning_rate": 0.00028185023454318646, "loss": 5.1014, "mean_token_accuracy": 0.21146378219127654, "num_tokens": 110187153.0, "step": 63525 }, { "entropy": 6.060267925262451, "epoch": 4.94285158529469, "grad_norm": 1.453125, "learning_rate": 0.00028182253175180084, "loss": 5.0698, "mean_token_accuracy": 0.20995452702045442, "num_tokens": 110195445.0, "step": 63530 }, { "entropy": 5.959158277511596, "epoch": 4.943240614666407, "grad_norm": 1.53125, "learning_rate": 0.0002817948288568942, "loss": 4.9071, "mean_token_accuracy": 0.2203369230031967, "num_tokens": 110204219.0, "step": 63535 }, { "entropy": 5.931695461273193, "epoch": 4.943629644038125, "grad_norm": 1.3515625, "learning_rate": 0.0002817671258588868, "loss": 5.0088, "mean_token_accuracy": 0.21358156055212021, "num_tokens": 110213242.0, "step": 63540 }, { "entropy": 5.922355604171753, "epoch": 4.944018673409842, "grad_norm": 1.4453125, "learning_rate": 0.0002817394227581989, "loss": 4.9245, "mean_token_accuracy": 0.21864015311002732, "num_tokens": 110221557.0, "step": 63545 }, { "entropy": 6.030595302581787, "epoch": 4.94440770278156, "grad_norm": 1.90625, "learning_rate": 0.0002817117195552511, "loss": 5.0969, "mean_token_accuracy": 0.201298888027668, "num_tokens": 110230229.0, "step": 63550 }, { "entropy": 5.948713111877441, "epoch": 4.944796732153278, "grad_norm": 1.4921875, "learning_rate": 0.00028168401625046363, "loss": 4.9552, "mean_token_accuracy": 0.21887002140283585, "num_tokens": 110238950.0, "step": 63555 }, { "entropy": 5.996391010284424, "epoch": 4.9451857615249954, "grad_norm": 1.59375, "learning_rate": 0.0002816563128442568, "loss": 4.9626, "mean_token_accuracy": 0.21717875599861144, "num_tokens": 110248216.0, "step": 63560 }, { "entropy": 5.966849517822266, "epoch": 4.945574790896712, "grad_norm": 1.40625, "learning_rate": 0.00028162860933705105, "loss": 4.9671, "mean_token_accuracy": 0.20692503005266188, "num_tokens": 110257830.0, "step": 63565 }, { "entropy": 5.955839061737061, "epoch": 4.94596382026843, "grad_norm": 1.375, "learning_rate": 0.0002816009057292667, "loss": 4.9609, "mean_token_accuracy": 0.21407763808965682, "num_tokens": 110266432.0, "step": 63570 }, { "entropy": 5.941349744796753, "epoch": 4.946352849640148, "grad_norm": 1.4375, "learning_rate": 0.00028157320202132417, "loss": 4.9632, "mean_token_accuracy": 0.21761271208524705, "num_tokens": 110275268.0, "step": 63575 }, { "entropy": 5.946577882766723, "epoch": 4.946741879011865, "grad_norm": 1.375, "learning_rate": 0.00028154549821364375, "loss": 4.9321, "mean_token_accuracy": 0.22142809331417085, "num_tokens": 110284100.0, "step": 63580 }, { "entropy": 5.941385173797608, "epoch": 4.947130908383583, "grad_norm": 1.375, "learning_rate": 0.00028151779430664575, "loss": 4.992, "mean_token_accuracy": 0.2147132560610771, "num_tokens": 110292672.0, "step": 63585 }, { "entropy": 5.989567613601684, "epoch": 4.947519937755301, "grad_norm": 1.53125, "learning_rate": 0.00028149009030075056, "loss": 4.9508, "mean_token_accuracy": 0.2168251484632492, "num_tokens": 110301160.0, "step": 63590 }, { "entropy": 5.971408891677856, "epoch": 4.947908967127018, "grad_norm": 1.2734375, "learning_rate": 0.00028146238619637865, "loss": 4.9444, "mean_token_accuracy": 0.21731097549200057, "num_tokens": 110310585.0, "step": 63595 }, { "entropy": 5.956007766723633, "epoch": 4.948297996498736, "grad_norm": 1.4453125, "learning_rate": 0.00028143468199395036, "loss": 4.9764, "mean_token_accuracy": 0.2153783842921257, "num_tokens": 110318754.0, "step": 63600 }, { "entropy": 5.929397535324097, "epoch": 4.948687025870453, "grad_norm": 1.4921875, "learning_rate": 0.00028140697769388597, "loss": 5.0067, "mean_token_accuracy": 0.21503014713525773, "num_tokens": 110328144.0, "step": 63605 }, { "entropy": 5.9350017547607425, "epoch": 4.949076055242171, "grad_norm": 1.3984375, "learning_rate": 0.0002813792732966059, "loss": 4.9191, "mean_token_accuracy": 0.21589315980672835, "num_tokens": 110337151.0, "step": 63610 }, { "entropy": 5.946207714080811, "epoch": 4.949465084613888, "grad_norm": 1.578125, "learning_rate": 0.0002813515688025305, "loss": 4.9217, "mean_token_accuracy": 0.21406424790620804, "num_tokens": 110344899.0, "step": 63615 }, { "entropy": 6.006354236602784, "epoch": 4.949854113985606, "grad_norm": 1.4765625, "learning_rate": 0.0002813238642120802, "loss": 5.0176, "mean_token_accuracy": 0.21048103272914886, "num_tokens": 110354745.0, "step": 63620 }, { "entropy": 5.918613481521606, "epoch": 4.950243143357324, "grad_norm": 1.4453125, "learning_rate": 0.00028129615952567517, "loss": 4.9478, "mean_token_accuracy": 0.21566716134548186, "num_tokens": 110363226.0, "step": 63625 }, { "entropy": 5.973747205734253, "epoch": 4.9506321727290405, "grad_norm": 1.3828125, "learning_rate": 0.0002812684547437361, "loss": 4.9908, "mean_token_accuracy": 0.21028875112533568, "num_tokens": 110371775.0, "step": 63630 }, { "entropy": 6.033539962768555, "epoch": 4.951021202100758, "grad_norm": 1.359375, "learning_rate": 0.0002812407498666831, "loss": 5.0665, "mean_token_accuracy": 0.2063036948442459, "num_tokens": 110380769.0, "step": 63635 }, { "entropy": 5.9688104629516605, "epoch": 4.951410231472476, "grad_norm": 1.546875, "learning_rate": 0.0002812130448949367, "loss": 4.948, "mean_token_accuracy": 0.21649263203144073, "num_tokens": 110388858.0, "step": 63640 }, { "entropy": 5.90745964050293, "epoch": 4.951799260844194, "grad_norm": 1.40625, "learning_rate": 0.00028118533982891727, "loss": 4.8258, "mean_token_accuracy": 0.22260864377021788, "num_tokens": 110397285.0, "step": 63645 }, { "entropy": 5.999681091308593, "epoch": 4.952188290215911, "grad_norm": 1.53125, "learning_rate": 0.0002811576346690451, "loss": 4.9624, "mean_token_accuracy": 0.2195064753293991, "num_tokens": 110404954.0, "step": 63650 }, { "entropy": 5.897418451309204, "epoch": 4.952577319587629, "grad_norm": 1.4921875, "learning_rate": 0.00028112992941574074, "loss": 4.9254, "mean_token_accuracy": 0.22009748667478563, "num_tokens": 110413546.0, "step": 63655 }, { "entropy": 5.929078912734985, "epoch": 4.952966348959347, "grad_norm": 1.5546875, "learning_rate": 0.00028110222406942424, "loss": 4.9444, "mean_token_accuracy": 0.2209790751338005, "num_tokens": 110421670.0, "step": 63660 }, { "entropy": 5.986019039154053, "epoch": 4.953355378331064, "grad_norm": 1.3828125, "learning_rate": 0.0002810745186305164, "loss": 4.9839, "mean_token_accuracy": 0.21751054972410203, "num_tokens": 110430362.0, "step": 63665 }, { "entropy": 5.991124153137207, "epoch": 4.953744407702781, "grad_norm": 1.6171875, "learning_rate": 0.0002810468130994373, "loss": 5.0026, "mean_token_accuracy": 0.22032052874565125, "num_tokens": 110438632.0, "step": 63670 }, { "entropy": 6.024920463562012, "epoch": 4.954133437074499, "grad_norm": 1.4609375, "learning_rate": 0.00028101910747660745, "loss": 4.9777, "mean_token_accuracy": 0.20974259823560715, "num_tokens": 110448080.0, "step": 63675 }, { "entropy": 5.980934286117554, "epoch": 4.954522466446217, "grad_norm": 1.3984375, "learning_rate": 0.0002809914017624472, "loss": 4.903, "mean_token_accuracy": 0.2216262251138687, "num_tokens": 110457028.0, "step": 63680 }, { "entropy": 5.9656037330627445, "epoch": 4.954911495817934, "grad_norm": 1.40625, "learning_rate": 0.0002809636959573771, "loss": 4.972, "mean_token_accuracy": 0.2158194825053215, "num_tokens": 110466671.0, "step": 63685 }, { "entropy": 6.050493574142456, "epoch": 4.955300525189652, "grad_norm": 1.390625, "learning_rate": 0.0002809359900618173, "loss": 5.1307, "mean_token_accuracy": 0.1987726017832756, "num_tokens": 110475679.0, "step": 63690 }, { "entropy": 6.0023431301116945, "epoch": 4.95568955456137, "grad_norm": 1.4609375, "learning_rate": 0.00028090828407618837, "loss": 4.9867, "mean_token_accuracy": 0.21258708834648132, "num_tokens": 110484280.0, "step": 63695 }, { "entropy": 6.004178142547607, "epoch": 4.9560785839330865, "grad_norm": 1.5546875, "learning_rate": 0.00028088057800091054, "loss": 5.041, "mean_token_accuracy": 0.21251711398363113, "num_tokens": 110493160.0, "step": 63700 }, { "entropy": 5.971774101257324, "epoch": 4.956467613304804, "grad_norm": 1.4296875, "learning_rate": 0.0002808528718364043, "loss": 4.9077, "mean_token_accuracy": 0.2203864723443985, "num_tokens": 110501409.0, "step": 63705 }, { "entropy": 5.986966276168824, "epoch": 4.956856642676522, "grad_norm": 1.3515625, "learning_rate": 0.00028082516558309005, "loss": 5.0166, "mean_token_accuracy": 0.20873988717794417, "num_tokens": 110510342.0, "step": 63710 }, { "entropy": 5.92267336845398, "epoch": 4.95724567204824, "grad_norm": 1.5, "learning_rate": 0.0002807974592413883, "loss": 4.9176, "mean_token_accuracy": 0.21992526650428773, "num_tokens": 110519226.0, "step": 63715 }, { "entropy": 5.944930791854858, "epoch": 4.957634701419957, "grad_norm": 1.46875, "learning_rate": 0.00028076975281171926, "loss": 4.9072, "mean_token_accuracy": 0.22562885880470276, "num_tokens": 110528116.0, "step": 63720 }, { "entropy": 5.992868328094483, "epoch": 4.958023730791675, "grad_norm": 1.4765625, "learning_rate": 0.00028074204629450334, "loss": 4.9913, "mean_token_accuracy": 0.22008632272481918, "num_tokens": 110536853.0, "step": 63725 }, { "entropy": 5.929089069366455, "epoch": 4.958412760163393, "grad_norm": 1.4140625, "learning_rate": 0.0002807143396901611, "loss": 4.9524, "mean_token_accuracy": 0.21657758057117463, "num_tokens": 110547111.0, "step": 63730 }, { "entropy": 5.9626435279846195, "epoch": 4.9588017895351095, "grad_norm": 1.40625, "learning_rate": 0.00028068663299911286, "loss": 4.9313, "mean_token_accuracy": 0.2258359596133232, "num_tokens": 110556223.0, "step": 63735 }, { "entropy": 5.950687742233276, "epoch": 4.959190818906827, "grad_norm": 1.5234375, "learning_rate": 0.0002806589262217789, "loss": 4.8906, "mean_token_accuracy": 0.22261662930250167, "num_tokens": 110564531.0, "step": 63740 }, { "entropy": 5.943018102645874, "epoch": 4.959579848278545, "grad_norm": 1.59375, "learning_rate": 0.00028063121935857985, "loss": 4.9269, "mean_token_accuracy": 0.22053411602973938, "num_tokens": 110572298.0, "step": 63745 }, { "entropy": 5.933963489532471, "epoch": 4.959968877650263, "grad_norm": 1.5703125, "learning_rate": 0.0002806035124099359, "loss": 4.9507, "mean_token_accuracy": 0.21394215673208236, "num_tokens": 110580774.0, "step": 63750 }, { "entropy": 5.898367500305175, "epoch": 4.96035790702198, "grad_norm": 1.5859375, "learning_rate": 0.00028057580537626766, "loss": 4.9627, "mean_token_accuracy": 0.21935340911149978, "num_tokens": 110589681.0, "step": 63755 }, { "entropy": 6.004323482513428, "epoch": 4.960746936393698, "grad_norm": 1.421875, "learning_rate": 0.00028054809825799537, "loss": 4.9782, "mean_token_accuracy": 0.2105149194598198, "num_tokens": 110598409.0, "step": 63760 }, { "entropy": 5.9494309425354, "epoch": 4.961135965765415, "grad_norm": 1.453125, "learning_rate": 0.00028052039105553965, "loss": 4.9682, "mean_token_accuracy": 0.21629618257284164, "num_tokens": 110607235.0, "step": 63765 }, { "entropy": 6.0056249618530275, "epoch": 4.9615249951371325, "grad_norm": 1.3515625, "learning_rate": 0.0002804926837693207, "loss": 4.9682, "mean_token_accuracy": 0.22260719984769822, "num_tokens": 110616444.0, "step": 63770 }, { "entropy": 5.976556634902954, "epoch": 4.96191402450885, "grad_norm": 1.5, "learning_rate": 0.000280464976399759, "loss": 4.8952, "mean_token_accuracy": 0.22020761519670487, "num_tokens": 110624766.0, "step": 63775 }, { "entropy": 5.939637136459351, "epoch": 4.962303053880568, "grad_norm": 1.5703125, "learning_rate": 0.000280437268947275, "loss": 4.8935, "mean_token_accuracy": 0.21726289242506028, "num_tokens": 110633197.0, "step": 63780 }, { "entropy": 5.903435707092285, "epoch": 4.962692083252286, "grad_norm": 1.4140625, "learning_rate": 0.0002804095614122891, "loss": 5.0021, "mean_token_accuracy": 0.21757557094097138, "num_tokens": 110641883.0, "step": 63785 }, { "entropy": 5.906747341156006, "epoch": 4.963081112624003, "grad_norm": 1.4765625, "learning_rate": 0.00028038185379522176, "loss": 4.8889, "mean_token_accuracy": 0.22155261039733887, "num_tokens": 110650285.0, "step": 63790 }, { "entropy": 5.959514617919922, "epoch": 4.963470141995721, "grad_norm": 1.421875, "learning_rate": 0.00028035414609649327, "loss": 4.9497, "mean_token_accuracy": 0.21106860488653184, "num_tokens": 110658418.0, "step": 63795 }, { "entropy": 5.954483222961426, "epoch": 4.963859171367439, "grad_norm": 1.4609375, "learning_rate": 0.00028032643831652415, "loss": 4.9752, "mean_token_accuracy": 0.21498009711503982, "num_tokens": 110667148.0, "step": 63800 }, { "entropy": 5.939287328720093, "epoch": 4.9642482007391555, "grad_norm": 1.4296875, "learning_rate": 0.0002802987304557349, "loss": 4.9828, "mean_token_accuracy": 0.2187413290143013, "num_tokens": 110675244.0, "step": 63805 }, { "entropy": 5.962346410751342, "epoch": 4.964637230110873, "grad_norm": 1.4296875, "learning_rate": 0.0002802710225145458, "loss": 4.8989, "mean_token_accuracy": 0.22940557301044465, "num_tokens": 110683201.0, "step": 63810 }, { "entropy": 5.964638900756836, "epoch": 4.965026259482591, "grad_norm": 1.515625, "learning_rate": 0.00028024331449337726, "loss": 5.0062, "mean_token_accuracy": 0.20865247249603272, "num_tokens": 110692306.0, "step": 63815 }, { "entropy": 5.965317344665527, "epoch": 4.965415288854309, "grad_norm": 1.375, "learning_rate": 0.00028021560639264985, "loss": 5.0511, "mean_token_accuracy": 0.21114179342985154, "num_tokens": 110702483.0, "step": 63820 }, { "entropy": 6.059542036056518, "epoch": 4.965804318226026, "grad_norm": 1.4296875, "learning_rate": 0.0002801878982127838, "loss": 4.9957, "mean_token_accuracy": 0.21155906468629837, "num_tokens": 110711426.0, "step": 63825 }, { "entropy": 6.022303104400635, "epoch": 4.966193347597744, "grad_norm": 1.796875, "learning_rate": 0.0002801601899541998, "loss": 4.9509, "mean_token_accuracy": 0.22528134435415267, "num_tokens": 110720368.0, "step": 63830 }, { "entropy": 6.010675621032715, "epoch": 4.966582376969461, "grad_norm": 1.4375, "learning_rate": 0.000280132481617318, "loss": 5.0271, "mean_token_accuracy": 0.21558926701545716, "num_tokens": 110728910.0, "step": 63835 }, { "entropy": 5.958311462402344, "epoch": 4.9669714063411785, "grad_norm": 1.484375, "learning_rate": 0.00028010477320255904, "loss": 5.0236, "mean_token_accuracy": 0.20842650830745696, "num_tokens": 110738248.0, "step": 63840 }, { "entropy": 5.9994734764099125, "epoch": 4.967360435712896, "grad_norm": 1.421875, "learning_rate": 0.0002800770647103433, "loss": 4.9974, "mean_token_accuracy": 0.21460507065057755, "num_tokens": 110747255.0, "step": 63845 }, { "entropy": 5.9364762783050535, "epoch": 4.967749465084614, "grad_norm": 1.4921875, "learning_rate": 0.0002800493561410911, "loss": 4.9538, "mean_token_accuracy": 0.22037217766046524, "num_tokens": 110756828.0, "step": 63850 }, { "entropy": 5.999535274505615, "epoch": 4.968138494456332, "grad_norm": 1.390625, "learning_rate": 0.000280021647495223, "loss": 5.0123, "mean_token_accuracy": 0.21505232751369477, "num_tokens": 110766364.0, "step": 63855 }, { "entropy": 5.987196636199951, "epoch": 4.968527523828049, "grad_norm": 1.4921875, "learning_rate": 0.00027999393877315944, "loss": 5.0471, "mean_token_accuracy": 0.2185453236103058, "num_tokens": 110774656.0, "step": 63860 }, { "entropy": 5.9618542194366455, "epoch": 4.968916553199767, "grad_norm": 1.3671875, "learning_rate": 0.0002799662299753207, "loss": 4.9512, "mean_token_accuracy": 0.21635394245386125, "num_tokens": 110783762.0, "step": 63865 }, { "entropy": 5.954960107803345, "epoch": 4.969305582571484, "grad_norm": 1.3984375, "learning_rate": 0.00027993852110212735, "loss": 4.9586, "mean_token_accuracy": 0.2182486593723297, "num_tokens": 110792978.0, "step": 63870 }, { "entropy": 6.029923963546753, "epoch": 4.9696946119432015, "grad_norm": 1.4765625, "learning_rate": 0.0002799108121539999, "loss": 5.0832, "mean_token_accuracy": 0.2027270182967186, "num_tokens": 110801572.0, "step": 63875 }, { "entropy": 5.916785717010498, "epoch": 4.970083641314919, "grad_norm": 1.546875, "learning_rate": 0.00027988310313135857, "loss": 4.8254, "mean_token_accuracy": 0.22330797016620635, "num_tokens": 110809362.0, "step": 63880 }, { "entropy": 5.9976640224456785, "epoch": 4.970472670686637, "grad_norm": 1.5390625, "learning_rate": 0.00027985539403462407, "loss": 5.0228, "mean_token_accuracy": 0.217745079100132, "num_tokens": 110818078.0, "step": 63885 }, { "entropy": 5.872941970825195, "epoch": 4.970861700058355, "grad_norm": 1.59375, "learning_rate": 0.00027982768486421657, "loss": 4.8597, "mean_token_accuracy": 0.21133479326963425, "num_tokens": 110825622.0, "step": 63890 }, { "entropy": 5.8495588302612305, "epoch": 4.971250729430072, "grad_norm": 1.4296875, "learning_rate": 0.00027979997562055663, "loss": 4.9949, "mean_token_accuracy": 0.21648041009902955, "num_tokens": 110833985.0, "step": 63895 }, { "entropy": 5.91601710319519, "epoch": 4.971639758801789, "grad_norm": 1.3984375, "learning_rate": 0.00027977226630406476, "loss": 4.9324, "mean_token_accuracy": 0.22367036044597627, "num_tokens": 110842565.0, "step": 63900 }, { "entropy": 6.029841518402099, "epoch": 4.972028788173507, "grad_norm": 1.5234375, "learning_rate": 0.0002797445569151613, "loss": 5.0861, "mean_token_accuracy": 0.20379938185214996, "num_tokens": 110851463.0, "step": 63905 }, { "entropy": 6.018596506118774, "epoch": 4.9724178175452245, "grad_norm": 1.5, "learning_rate": 0.0002797168474542668, "loss": 5.0474, "mean_token_accuracy": 0.2038809299468994, "num_tokens": 110860317.0, "step": 63910 }, { "entropy": 6.0174633979797365, "epoch": 4.972806846916942, "grad_norm": 1.4609375, "learning_rate": 0.00027968913792180154, "loss": 5.0382, "mean_token_accuracy": 0.21298862844705582, "num_tokens": 110868940.0, "step": 63915 }, { "entropy": 5.960891675949097, "epoch": 4.97319587628866, "grad_norm": 1.453125, "learning_rate": 0.0002796614283181862, "loss": 4.9265, "mean_token_accuracy": 0.2182511031627655, "num_tokens": 110877300.0, "step": 63920 }, { "entropy": 5.903309106826782, "epoch": 4.973584905660378, "grad_norm": 1.3671875, "learning_rate": 0.000279633718643841, "loss": 4.9703, "mean_token_accuracy": 0.21575938910245895, "num_tokens": 110887016.0, "step": 63925 }, { "entropy": 6.043300533294678, "epoch": 4.973973935032095, "grad_norm": 1.3359375, "learning_rate": 0.00027960600889918657, "loss": 5.0762, "mean_token_accuracy": 0.20491232872009277, "num_tokens": 110897299.0, "step": 63930 }, { "entropy": 5.9703610897064205, "epoch": 4.974362964403813, "grad_norm": 1.3671875, "learning_rate": 0.0002795782990846433, "loss": 4.9768, "mean_token_accuracy": 0.2096459150314331, "num_tokens": 110906379.0, "step": 63935 }, { "entropy": 5.959058237075806, "epoch": 4.97475199377553, "grad_norm": 1.34375, "learning_rate": 0.0002795505892006316, "loss": 4.9409, "mean_token_accuracy": 0.2128370836377144, "num_tokens": 110915007.0, "step": 63940 }, { "entropy": 6.022095680236816, "epoch": 4.9751410231472475, "grad_norm": 1.5859375, "learning_rate": 0.0002795228792475719, "loss": 5.073, "mean_token_accuracy": 0.20872470140457153, "num_tokens": 110923878.0, "step": 63945 }, { "entropy": 5.977816867828369, "epoch": 4.975530052518965, "grad_norm": 1.5390625, "learning_rate": 0.0002794951692258848, "loss": 5.0059, "mean_token_accuracy": 0.20403165221214295, "num_tokens": 110932262.0, "step": 63950 }, { "entropy": 5.940880346298218, "epoch": 4.975919081890683, "grad_norm": 1.453125, "learning_rate": 0.0002794674591359906, "loss": 4.8707, "mean_token_accuracy": 0.22647271752357484, "num_tokens": 110940494.0, "step": 63955 }, { "entropy": 5.891310548782348, "epoch": 4.976308111262401, "grad_norm": 1.421875, "learning_rate": 0.0002794397489783098, "loss": 4.8407, "mean_token_accuracy": 0.22248669862747192, "num_tokens": 110949067.0, "step": 63960 }, { "entropy": 5.948409366607666, "epoch": 4.976697140634117, "grad_norm": 1.4453125, "learning_rate": 0.0002794120387532629, "loss": 4.9772, "mean_token_accuracy": 0.21739549934864044, "num_tokens": 110957799.0, "step": 63965 }, { "entropy": 5.959265279769897, "epoch": 4.977086170005835, "grad_norm": 1.4765625, "learning_rate": 0.0002793843284612703, "loss": 5.002, "mean_token_accuracy": 0.21712651550769807, "num_tokens": 110965887.0, "step": 63970 }, { "entropy": 6.031672859191895, "epoch": 4.977475199377553, "grad_norm": 1.578125, "learning_rate": 0.0002793566181027526, "loss": 5.0892, "mean_token_accuracy": 0.20941001176834106, "num_tokens": 110974068.0, "step": 63975 }, { "entropy": 5.884252452850342, "epoch": 4.9778642287492705, "grad_norm": 1.5, "learning_rate": 0.00027932890767813005, "loss": 4.9071, "mean_token_accuracy": 0.21988178193569183, "num_tokens": 110982264.0, "step": 63980 }, { "entropy": 5.927508687973022, "epoch": 4.978253258120988, "grad_norm": 1.5, "learning_rate": 0.0002793011971878233, "loss": 4.9358, "mean_token_accuracy": 0.22059098929166793, "num_tokens": 110989882.0, "step": 63985 }, { "entropy": 5.961652231216431, "epoch": 4.978642287492706, "grad_norm": 1.5859375, "learning_rate": 0.0002792734866322526, "loss": 4.9383, "mean_token_accuracy": 0.21650320142507554, "num_tokens": 110998081.0, "step": 63990 }, { "entropy": 5.9721049785614015, "epoch": 4.979031316864424, "grad_norm": 1.3984375, "learning_rate": 0.0002792457760118387, "loss": 4.9907, "mean_token_accuracy": 0.2134132519364357, "num_tokens": 111007229.0, "step": 63995 }, { "entropy": 6.02068943977356, "epoch": 4.979420346236141, "grad_norm": 1.484375, "learning_rate": 0.00027921806532700186, "loss": 4.9952, "mean_token_accuracy": 0.2170492649078369, "num_tokens": 111016097.0, "step": 64000 }, { "entropy": 6.007446002960205, "epoch": 4.979809375607858, "grad_norm": 1.4921875, "learning_rate": 0.0002791903545781625, "loss": 5.0088, "mean_token_accuracy": 0.2150631546974182, "num_tokens": 111024078.0, "step": 64005 }, { "entropy": 5.93270959854126, "epoch": 4.980198404979576, "grad_norm": 1.34375, "learning_rate": 0.00027916264376574124, "loss": 4.9587, "mean_token_accuracy": 0.2165970116853714, "num_tokens": 111033214.0, "step": 64010 }, { "entropy": 5.965338230133057, "epoch": 4.9805874343512935, "grad_norm": 1.40625, "learning_rate": 0.00027913493289015857, "loss": 4.9926, "mean_token_accuracy": 0.21466201841831206, "num_tokens": 111042307.0, "step": 64015 }, { "entropy": 5.999902772903442, "epoch": 4.980976463723011, "grad_norm": 1.4140625, "learning_rate": 0.00027910722195183474, "loss": 4.9863, "mean_token_accuracy": 0.21665821820497513, "num_tokens": 111050490.0, "step": 64020 }, { "entropy": 5.940768194198609, "epoch": 4.981365493094729, "grad_norm": 1.3203125, "learning_rate": 0.0002790795109511904, "loss": 4.9545, "mean_token_accuracy": 0.21786734759807586, "num_tokens": 111059378.0, "step": 64025 }, { "entropy": 5.939095830917358, "epoch": 4.981754522466447, "grad_norm": 1.5703125, "learning_rate": 0.00027905179988864593, "loss": 4.9722, "mean_token_accuracy": 0.20884962677955626, "num_tokens": 111067157.0, "step": 64030 }, { "entropy": 6.009640836715699, "epoch": 4.982143551838163, "grad_norm": 1.4375, "learning_rate": 0.0002790240887646219, "loss": 5.0224, "mean_token_accuracy": 0.21580564528703688, "num_tokens": 111076016.0, "step": 64035 }, { "entropy": 5.950236034393311, "epoch": 4.982532581209881, "grad_norm": 1.5703125, "learning_rate": 0.00027899637757953876, "loss": 4.9087, "mean_token_accuracy": 0.22437747716903686, "num_tokens": 111084413.0, "step": 64040 }, { "entropy": 5.953349018096924, "epoch": 4.982921610581599, "grad_norm": 1.5859375, "learning_rate": 0.00027896866633381694, "loss": 5.0252, "mean_token_accuracy": 0.21033919155597686, "num_tokens": 111092000.0, "step": 64045 }, { "entropy": 5.938661193847656, "epoch": 4.9833106399533165, "grad_norm": 1.46875, "learning_rate": 0.0002789409550278769, "loss": 4.9972, "mean_token_accuracy": 0.20722602158784867, "num_tokens": 111100918.0, "step": 64050 }, { "entropy": 5.931330919265747, "epoch": 4.983699669325034, "grad_norm": 1.3984375, "learning_rate": 0.0002789132436621391, "loss": 4.9851, "mean_token_accuracy": 0.22071402072906493, "num_tokens": 111109653.0, "step": 64055 }, { "entropy": 6.030182361602783, "epoch": 4.984088698696752, "grad_norm": 1.328125, "learning_rate": 0.0002788855322370241, "loss": 4.9934, "mean_token_accuracy": 0.21908103227615355, "num_tokens": 111118101.0, "step": 64060 }, { "entropy": 5.99071249961853, "epoch": 4.98447772806847, "grad_norm": 1.4765625, "learning_rate": 0.00027885782075295234, "loss": 4.9506, "mean_token_accuracy": 0.2212925747036934, "num_tokens": 111126552.0, "step": 64065 }, { "entropy": 5.983301210403442, "epoch": 4.984866757440186, "grad_norm": 1.7890625, "learning_rate": 0.0002788301092103443, "loss": 5.0137, "mean_token_accuracy": 0.2152522921562195, "num_tokens": 111135285.0, "step": 64070 }, { "entropy": 5.866214752197266, "epoch": 4.985255786811904, "grad_norm": 1.46875, "learning_rate": 0.00027880239760962044, "loss": 4.8684, "mean_token_accuracy": 0.22803619056940078, "num_tokens": 111144358.0, "step": 64075 }, { "entropy": 5.966524076461792, "epoch": 4.985644816183622, "grad_norm": 1.5078125, "learning_rate": 0.00027877468595120125, "loss": 5.0675, "mean_token_accuracy": 0.20582932829856873, "num_tokens": 111152396.0, "step": 64080 }, { "entropy": 6.087909412384033, "epoch": 4.9860338455553395, "grad_norm": 1.40625, "learning_rate": 0.0002787469742355072, "loss": 5.0396, "mean_token_accuracy": 0.2090340331196785, "num_tokens": 111161452.0, "step": 64085 }, { "entropy": 5.999317073822022, "epoch": 4.986422874927057, "grad_norm": 1.4765625, "learning_rate": 0.0002787192624629587, "loss": 5.0069, "mean_token_accuracy": 0.20891609638929368, "num_tokens": 111169773.0, "step": 64090 }, { "entropy": 5.982045888900757, "epoch": 4.986811904298775, "grad_norm": 1.4921875, "learning_rate": 0.0002786915506339764, "loss": 4.8924, "mean_token_accuracy": 0.21881015300750734, "num_tokens": 111178202.0, "step": 64095 }, { "entropy": 5.943727207183838, "epoch": 4.987200933670492, "grad_norm": 1.484375, "learning_rate": 0.0002786638387489807, "loss": 5.0163, "mean_token_accuracy": 0.2100713849067688, "num_tokens": 111186384.0, "step": 64100 }, { "entropy": 5.960705757141113, "epoch": 4.987589963042209, "grad_norm": 1.34375, "learning_rate": 0.00027863612680839204, "loss": 5.0156, "mean_token_accuracy": 0.21157492101192474, "num_tokens": 111195086.0, "step": 64105 }, { "entropy": 5.99471492767334, "epoch": 4.987978992413927, "grad_norm": 1.4375, "learning_rate": 0.000278608414812631, "loss": 5.009, "mean_token_accuracy": 0.21238764822483064, "num_tokens": 111203537.0, "step": 64110 }, { "entropy": 5.997534465789795, "epoch": 4.988368021785645, "grad_norm": 1.3671875, "learning_rate": 0.00027858070276211804, "loss": 4.9071, "mean_token_accuracy": 0.22279173135757446, "num_tokens": 111212518.0, "step": 64115 }, { "entropy": 6.032884407043457, "epoch": 4.9887570511573625, "grad_norm": 1.6328125, "learning_rate": 0.0002785529906572735, "loss": 5.0121, "mean_token_accuracy": 0.21396758556365966, "num_tokens": 111220747.0, "step": 64120 }, { "entropy": 6.016614723205566, "epoch": 4.98914608052908, "grad_norm": 1.4140625, "learning_rate": 0.000278525278498518, "loss": 5.0516, "mean_token_accuracy": 0.20340076237916946, "num_tokens": 111229938.0, "step": 64125 }, { "entropy": 6.05537691116333, "epoch": 4.989535109900798, "grad_norm": 1.515625, "learning_rate": 0.00027849756628627205, "loss": 5.0159, "mean_token_accuracy": 0.20467608869075776, "num_tokens": 111237601.0, "step": 64130 }, { "entropy": 5.968055343627929, "epoch": 4.9899241392725155, "grad_norm": 1.546875, "learning_rate": 0.0002784698540209561, "loss": 5.0144, "mean_token_accuracy": 0.20931281000375748, "num_tokens": 111245439.0, "step": 64135 }, { "entropy": 5.889980983734131, "epoch": 4.990313168644232, "grad_norm": 1.53125, "learning_rate": 0.00027844214170299065, "loss": 4.9325, "mean_token_accuracy": 0.22199618965387344, "num_tokens": 111254661.0, "step": 64140 }, { "entropy": 5.992573833465576, "epoch": 4.99070219801595, "grad_norm": 1.4375, "learning_rate": 0.00027841442933279614, "loss": 4.9828, "mean_token_accuracy": 0.22415275126695633, "num_tokens": 111263038.0, "step": 64145 }, { "entropy": 5.907088136672973, "epoch": 4.991091227387668, "grad_norm": 1.5, "learning_rate": 0.00027838671691079314, "loss": 4.8612, "mean_token_accuracy": 0.22346449494361878, "num_tokens": 111270781.0, "step": 64150 }, { "entropy": 5.848456478118896, "epoch": 4.9914802567593854, "grad_norm": 1.34375, "learning_rate": 0.0002783590044374021, "loss": 4.9659, "mean_token_accuracy": 0.212752628326416, "num_tokens": 111279555.0, "step": 64155 }, { "entropy": 5.9197510242462155, "epoch": 4.991869286131103, "grad_norm": 1.4140625, "learning_rate": 0.0002783312919130435, "loss": 4.8847, "mean_token_accuracy": 0.222040556371212, "num_tokens": 111288252.0, "step": 64160 }, { "entropy": 5.8765068531036375, "epoch": 4.992258315502821, "grad_norm": 1.375, "learning_rate": 0.0002783035793381378, "loss": 4.949, "mean_token_accuracy": 0.2156123548746109, "num_tokens": 111298293.0, "step": 64165 }, { "entropy": 6.02159423828125, "epoch": 4.992647344874538, "grad_norm": 1.5, "learning_rate": 0.00027827586671310556, "loss": 4.971, "mean_token_accuracy": 0.21450741291046144, "num_tokens": 111306408.0, "step": 64170 }, { "entropy": 5.933205080032349, "epoch": 4.993036374246255, "grad_norm": 1.390625, "learning_rate": 0.0002782481540383673, "loss": 4.8883, "mean_token_accuracy": 0.22526173889636994, "num_tokens": 111315412.0, "step": 64175 }, { "entropy": 5.887360954284668, "epoch": 4.993425403617973, "grad_norm": 1.2734375, "learning_rate": 0.00027822044131434344, "loss": 4.9428, "mean_token_accuracy": 0.22040002942085266, "num_tokens": 111324331.0, "step": 64180 }, { "entropy": 5.914601182937622, "epoch": 4.993814432989691, "grad_norm": 1.2890625, "learning_rate": 0.0002781927285414545, "loss": 4.9825, "mean_token_accuracy": 0.21791246384382248, "num_tokens": 111333327.0, "step": 64185 }, { "entropy": 5.964279651641846, "epoch": 4.994203462361408, "grad_norm": 1.4453125, "learning_rate": 0.00027816501572012104, "loss": 4.9502, "mean_token_accuracy": 0.22117865979671478, "num_tokens": 111342191.0, "step": 64190 }, { "entropy": 5.9876556396484375, "epoch": 4.994592491733126, "grad_norm": 1.5078125, "learning_rate": 0.0002781373028507634, "loss": 4.9998, "mean_token_accuracy": 0.2147589221596718, "num_tokens": 111350647.0, "step": 64195 }, { "entropy": 5.903028869628907, "epoch": 4.994981521104844, "grad_norm": 1.4921875, "learning_rate": 0.0002781095899338023, "loss": 4.868, "mean_token_accuracy": 0.22256578654050826, "num_tokens": 111358745.0, "step": 64200 }, { "entropy": 5.978062677383423, "epoch": 4.995370550476561, "grad_norm": 1.390625, "learning_rate": 0.0002780818769696581, "loss": 5.0254, "mean_token_accuracy": 0.20791832804679872, "num_tokens": 111368369.0, "step": 64205 }, { "entropy": 5.975418567657471, "epoch": 4.995759579848278, "grad_norm": 1.4453125, "learning_rate": 0.00027805416395875127, "loss": 4.9756, "mean_token_accuracy": 0.21357603669166564, "num_tokens": 111377637.0, "step": 64210 }, { "entropy": 6.00588583946228, "epoch": 4.996148609219996, "grad_norm": 1.5, "learning_rate": 0.0002780264509015024, "loss": 4.9776, "mean_token_accuracy": 0.213634891808033, "num_tokens": 111386016.0, "step": 64215 }, { "entropy": 5.966055488586425, "epoch": 4.996537638591714, "grad_norm": 1.484375, "learning_rate": 0.00027799873779833193, "loss": 4.9536, "mean_token_accuracy": 0.22317275404930115, "num_tokens": 111394811.0, "step": 64220 }, { "entropy": 5.986238622665406, "epoch": 4.996926667963431, "grad_norm": 1.4375, "learning_rate": 0.0002779710246496604, "loss": 4.9753, "mean_token_accuracy": 0.2201543465256691, "num_tokens": 111403842.0, "step": 64225 }, { "entropy": 5.949134683609008, "epoch": 4.997315697335149, "grad_norm": 1.3671875, "learning_rate": 0.0002779433114559083, "loss": 4.9426, "mean_token_accuracy": 0.222234508395195, "num_tokens": 111412164.0, "step": 64230 }, { "entropy": 5.928938198089599, "epoch": 4.997704726706866, "grad_norm": 1.453125, "learning_rate": 0.00027791559821749615, "loss": 4.9462, "mean_token_accuracy": 0.21307792216539384, "num_tokens": 111421202.0, "step": 64235 }, { "entropy": 5.964136028289795, "epoch": 4.998093756078584, "grad_norm": 1.4453125, "learning_rate": 0.00027788788493484447, "loss": 4.8999, "mean_token_accuracy": 0.22490315288305282, "num_tokens": 111429531.0, "step": 64240 }, { "entropy": 6.036328649520874, "epoch": 4.998482785450301, "grad_norm": 1.484375, "learning_rate": 0.0002778601716083736, "loss": 4.9645, "mean_token_accuracy": 0.21246591359376907, "num_tokens": 111438090.0, "step": 64245 }, { "entropy": 5.958028554916382, "epoch": 4.998871814822019, "grad_norm": 1.40625, "learning_rate": 0.0002778324582385043, "loss": 5.0123, "mean_token_accuracy": 0.20755317211151122, "num_tokens": 111447011.0, "step": 64250 }, { "entropy": 5.918970775604248, "epoch": 4.999260844193737, "grad_norm": 1.5390625, "learning_rate": 0.00027780474482565687, "loss": 4.9621, "mean_token_accuracy": 0.2196969985961914, "num_tokens": 111455486.0, "step": 64255 }, { "entropy": 5.94116735458374, "epoch": 4.999649873565454, "grad_norm": 1.484375, "learning_rate": 0.00027777703137025193, "loss": 4.9605, "mean_token_accuracy": 0.21686898171901703, "num_tokens": 111464053.0, "step": 64260 }, { "entropy": 5.938394069671631, "epoch": 5.0, "grad_norm": 2.953125, "learning_rate": 0.00027774931787271, "loss": 4.9299, "mean_token_accuracy": 0.2189635154273775, "num_tokens": 111471835.0, "step": 64265 }, { "entropy": 5.9992913722991945, "epoch": 5.000389029371718, "grad_norm": 1.375, "learning_rate": 0.0002777216043334516, "loss": 4.9992, "mean_token_accuracy": 0.21412764936685563, "num_tokens": 111480800.0, "step": 64270 }, { "entropy": 5.915005874633789, "epoch": 5.000778058743435, "grad_norm": 1.359375, "learning_rate": 0.00027769389075289714, "loss": 4.9261, "mean_token_accuracy": 0.2255018264055252, "num_tokens": 111490128.0, "step": 64275 }, { "entropy": 5.963856554031372, "epoch": 5.001167088115153, "grad_norm": 1.5234375, "learning_rate": 0.0002776661771314671, "loss": 4.9199, "mean_token_accuracy": 0.22687022536993026, "num_tokens": 111498196.0, "step": 64280 }, { "entropy": 5.948149299621582, "epoch": 5.00155611748687, "grad_norm": 1.546875, "learning_rate": 0.0002776384634695821, "loss": 4.9102, "mean_token_accuracy": 0.22363985627889632, "num_tokens": 111505892.0, "step": 64285 }, { "entropy": 6.00820779800415, "epoch": 5.001945146858588, "grad_norm": 1.4609375, "learning_rate": 0.0002776107497676626, "loss": 5.0162, "mean_token_accuracy": 0.21780850291252135, "num_tokens": 111514945.0, "step": 64290 }, { "entropy": 5.922317600250244, "epoch": 5.002334176230305, "grad_norm": 1.375, "learning_rate": 0.0002775830360261291, "loss": 4.8823, "mean_token_accuracy": 0.21582133024930955, "num_tokens": 111523113.0, "step": 64295 }, { "entropy": 5.89165768623352, "epoch": 5.002723205602023, "grad_norm": 1.3515625, "learning_rate": 0.00027755532224540226, "loss": 4.8797, "mean_token_accuracy": 0.2207957312464714, "num_tokens": 111531396.0, "step": 64300 }, { "entropy": 5.9533556461334225, "epoch": 5.003112234973741, "grad_norm": 1.640625, "learning_rate": 0.00027752760842590245, "loss": 5.034, "mean_token_accuracy": 0.20952605158090593, "num_tokens": 111539600.0, "step": 64305 }, { "entropy": 5.912472677230835, "epoch": 5.003501264345458, "grad_norm": 1.5078125, "learning_rate": 0.0002774998945680502, "loss": 4.8839, "mean_token_accuracy": 0.22143614739179612, "num_tokens": 111547837.0, "step": 64310 }, { "entropy": 5.9206352710723875, "epoch": 5.003890293717176, "grad_norm": 1.5859375, "learning_rate": 0.000277472180672266, "loss": 4.9643, "mean_token_accuracy": 0.21412252336740495, "num_tokens": 111556914.0, "step": 64315 }, { "entropy": 5.991730260848999, "epoch": 5.004279323088893, "grad_norm": 1.6484375, "learning_rate": 0.00027744446673897034, "loss": 5.0099, "mean_token_accuracy": 0.2173427537083626, "num_tokens": 111566373.0, "step": 64320 }, { "entropy": 5.916161060333252, "epoch": 5.004668352460611, "grad_norm": 1.4765625, "learning_rate": 0.00027741675276858374, "loss": 4.9164, "mean_token_accuracy": 0.2203942820429802, "num_tokens": 111575155.0, "step": 64325 }, { "entropy": 6.028845357894897, "epoch": 5.005057381832328, "grad_norm": 1.5390625, "learning_rate": 0.00027738903876152693, "loss": 5.0101, "mean_token_accuracy": 0.21571316868066787, "num_tokens": 111584448.0, "step": 64330 }, { "entropy": 5.901907682418823, "epoch": 5.005446411204046, "grad_norm": 1.4765625, "learning_rate": 0.0002773613247182202, "loss": 4.8943, "mean_token_accuracy": 0.2256663054227829, "num_tokens": 111592761.0, "step": 64335 }, { "entropy": 5.941567611694336, "epoch": 5.005835440575764, "grad_norm": 1.5859375, "learning_rate": 0.00027733361063908405, "loss": 4.8848, "mean_token_accuracy": 0.22712364941835403, "num_tokens": 111600591.0, "step": 64340 }, { "entropy": 5.8213623523712155, "epoch": 5.006224469947481, "grad_norm": 1.3828125, "learning_rate": 0.0002773058965245393, "loss": 4.8417, "mean_token_accuracy": 0.22544692158699037, "num_tokens": 111609089.0, "step": 64345 }, { "entropy": 5.825745868682861, "epoch": 5.006613499319198, "grad_norm": 1.4609375, "learning_rate": 0.000277278182375006, "loss": 4.8483, "mean_token_accuracy": 0.2243263989686966, "num_tokens": 111617211.0, "step": 64350 }, { "entropy": 5.9841516494750975, "epoch": 5.007002528690916, "grad_norm": 1.3671875, "learning_rate": 0.0002772504681909049, "loss": 4.9988, "mean_token_accuracy": 0.2145882233977318, "num_tokens": 111625562.0, "step": 64355 }, { "entropy": 5.963325500488281, "epoch": 5.007391558062634, "grad_norm": 1.5078125, "learning_rate": 0.0002772227539726566, "loss": 4.9496, "mean_token_accuracy": 0.2157747268676758, "num_tokens": 111634095.0, "step": 64360 }, { "entropy": 5.9477873802185055, "epoch": 5.007780587434351, "grad_norm": 1.5078125, "learning_rate": 0.0002771950397206816, "loss": 4.9444, "mean_token_accuracy": 0.2181429848074913, "num_tokens": 111642386.0, "step": 64365 }, { "entropy": 5.895689630508423, "epoch": 5.008169616806069, "grad_norm": 1.5859375, "learning_rate": 0.0002771673254354003, "loss": 4.8883, "mean_token_accuracy": 0.22305791825056076, "num_tokens": 111650561.0, "step": 64370 }, { "entropy": 5.9402069568634035, "epoch": 5.008558646177787, "grad_norm": 1.4375, "learning_rate": 0.00027713961111723335, "loss": 4.9836, "mean_token_accuracy": 0.21357118636369704, "num_tokens": 111659264.0, "step": 64375 }, { "entropy": 5.942184686660767, "epoch": 5.008947675549504, "grad_norm": 1.484375, "learning_rate": 0.00027711189676660116, "loss": 4.9512, "mean_token_accuracy": 0.2165623798966408, "num_tokens": 111667254.0, "step": 64380 }, { "entropy": 6.023373460769653, "epoch": 5.009336704921221, "grad_norm": 1.4140625, "learning_rate": 0.00027708418238392435, "loss": 5.0173, "mean_token_accuracy": 0.21320536732673645, "num_tokens": 111676160.0, "step": 64385 }, { "entropy": 5.897787237167359, "epoch": 5.009725734292939, "grad_norm": 1.3671875, "learning_rate": 0.0002770564679696233, "loss": 4.8483, "mean_token_accuracy": 0.22351074814796448, "num_tokens": 111685109.0, "step": 64390 }, { "entropy": 5.878963375091553, "epoch": 5.010114763664657, "grad_norm": 1.5, "learning_rate": 0.00027702875352411866, "loss": 4.8196, "mean_token_accuracy": 0.22820911705493926, "num_tokens": 111694949.0, "step": 64395 }, { "entropy": 5.997205114364624, "epoch": 5.010503793036374, "grad_norm": 1.46875, "learning_rate": 0.0002770010390478309, "loss": 4.9989, "mean_token_accuracy": 0.22195437997579576, "num_tokens": 111704141.0, "step": 64400 }, { "entropy": 5.954021453857422, "epoch": 5.010892822408092, "grad_norm": 1.3828125, "learning_rate": 0.00027697332454118057, "loss": 4.9566, "mean_token_accuracy": 0.21605437397956848, "num_tokens": 111713776.0, "step": 64405 }, { "entropy": 5.911357259750366, "epoch": 5.01128185177981, "grad_norm": 1.453125, "learning_rate": 0.00027694561000458825, "loss": 4.8786, "mean_token_accuracy": 0.22575565576553344, "num_tokens": 111721914.0, "step": 64410 }, { "entropy": 5.966030693054199, "epoch": 5.011670881151527, "grad_norm": 1.484375, "learning_rate": 0.0002769178954384743, "loss": 4.9869, "mean_token_accuracy": 0.2218691036105156, "num_tokens": 111730835.0, "step": 64415 }, { "entropy": 5.966979026794434, "epoch": 5.012059910523244, "grad_norm": 1.421875, "learning_rate": 0.0002768901808432594, "loss": 4.9947, "mean_token_accuracy": 0.21712421774864196, "num_tokens": 111739621.0, "step": 64420 }, { "entropy": 5.936514854431152, "epoch": 5.012448939894962, "grad_norm": 1.4765625, "learning_rate": 0.000276862466219364, "loss": 4.9595, "mean_token_accuracy": 0.22356475591659547, "num_tokens": 111748818.0, "step": 64425 }, { "entropy": 6.013345718383789, "epoch": 5.01283796926668, "grad_norm": 1.4609375, "learning_rate": 0.0002768347515672086, "loss": 4.9729, "mean_token_accuracy": 0.21295957416296005, "num_tokens": 111757234.0, "step": 64430 }, { "entropy": 5.936593341827392, "epoch": 5.013226998638397, "grad_norm": 1.5546875, "learning_rate": 0.00027680703688721383, "loss": 4.8315, "mean_token_accuracy": 0.22767816334962845, "num_tokens": 111765991.0, "step": 64435 }, { "entropy": 5.885225915908814, "epoch": 5.013616028010115, "grad_norm": 1.5, "learning_rate": 0.00027677932217980004, "loss": 4.8883, "mean_token_accuracy": 0.22330691069364547, "num_tokens": 111774752.0, "step": 64440 }, { "entropy": 5.982660007476807, "epoch": 5.014005057381833, "grad_norm": 1.46875, "learning_rate": 0.000276751607445388, "loss": 5.0153, "mean_token_accuracy": 0.21027986258268355, "num_tokens": 111783433.0, "step": 64445 }, { "entropy": 5.961589574813843, "epoch": 5.0143940867535495, "grad_norm": 1.390625, "learning_rate": 0.000276723892684398, "loss": 4.9238, "mean_token_accuracy": 0.2248132646083832, "num_tokens": 111793284.0, "step": 64450 }, { "entropy": 5.982715511322022, "epoch": 5.014783116125267, "grad_norm": 1.5234375, "learning_rate": 0.00027669617789725074, "loss": 4.9588, "mean_token_accuracy": 0.21696071326732635, "num_tokens": 111801079.0, "step": 64455 }, { "entropy": 5.870068883895874, "epoch": 5.015172145496985, "grad_norm": 1.5390625, "learning_rate": 0.0002766684630843667, "loss": 4.8416, "mean_token_accuracy": 0.231181101500988, "num_tokens": 111809832.0, "step": 64460 }, { "entropy": 5.954134845733643, "epoch": 5.015561174868703, "grad_norm": 1.3828125, "learning_rate": 0.0002766407482461663, "loss": 5.0056, "mean_token_accuracy": 0.21122754365205765, "num_tokens": 111817846.0, "step": 64465 }, { "entropy": 5.952762031555176, "epoch": 5.01595020424042, "grad_norm": 1.40625, "learning_rate": 0.0002766130333830702, "loss": 4.9416, "mean_token_accuracy": 0.21512737721204758, "num_tokens": 111826340.0, "step": 64470 }, { "entropy": 5.8644458770751955, "epoch": 5.016339233612138, "grad_norm": 1.4609375, "learning_rate": 0.00027658531849549894, "loss": 4.8634, "mean_token_accuracy": 0.21851956248283386, "num_tokens": 111834965.0, "step": 64475 }, { "entropy": 6.00278263092041, "epoch": 5.016728262983856, "grad_norm": 1.3828125, "learning_rate": 0.0002765576035838729, "loss": 4.959, "mean_token_accuracy": 0.21304924488067628, "num_tokens": 111843809.0, "step": 64480 }, { "entropy": 5.941182851791382, "epoch": 5.0171172923555725, "grad_norm": 1.5078125, "learning_rate": 0.0002765298886486128, "loss": 4.9299, "mean_token_accuracy": 0.22365241646766662, "num_tokens": 111853102.0, "step": 64485 }, { "entropy": 5.945188713073731, "epoch": 5.01750632172729, "grad_norm": 1.390625, "learning_rate": 0.0002765021736901389, "loss": 4.9546, "mean_token_accuracy": 0.21909375339746476, "num_tokens": 111861909.0, "step": 64490 }, { "entropy": 5.913717412948609, "epoch": 5.017895351099008, "grad_norm": 1.4296875, "learning_rate": 0.0002764744587088721, "loss": 4.8783, "mean_token_accuracy": 0.22588928043842316, "num_tokens": 111870253.0, "step": 64495 }, { "entropy": 5.955865287780762, "epoch": 5.018284380470726, "grad_norm": 1.5234375, "learning_rate": 0.0002764467437052327, "loss": 4.8727, "mean_token_accuracy": 0.22777946442365646, "num_tokens": 111878295.0, "step": 64500 }, { "entropy": 5.950929117202759, "epoch": 5.018673409842443, "grad_norm": 1.5625, "learning_rate": 0.00027641902867964126, "loss": 4.9397, "mean_token_accuracy": 0.22387677878141404, "num_tokens": 111886684.0, "step": 64505 }, { "entropy": 5.900404453277588, "epoch": 5.019062439214161, "grad_norm": 1.4375, "learning_rate": 0.00027639131363251825, "loss": 4.9023, "mean_token_accuracy": 0.22259812504053117, "num_tokens": 111895746.0, "step": 64510 }, { "entropy": 5.938545799255371, "epoch": 5.019451468585879, "grad_norm": 1.609375, "learning_rate": 0.00027636359856428436, "loss": 4.9136, "mean_token_accuracy": 0.21792158335447312, "num_tokens": 111903662.0, "step": 64515 }, { "entropy": 5.93454875946045, "epoch": 5.0198404979575955, "grad_norm": 1.4765625, "learning_rate": 0.0002763358834753599, "loss": 4.9697, "mean_token_accuracy": 0.216750305891037, "num_tokens": 111912990.0, "step": 64520 }, { "entropy": 5.984649133682251, "epoch": 5.020229527329313, "grad_norm": 1.5078125, "learning_rate": 0.00027630816836616564, "loss": 4.9522, "mean_token_accuracy": 0.2210889220237732, "num_tokens": 111921417.0, "step": 64525 }, { "entropy": 5.9259730815887455, "epoch": 5.020618556701031, "grad_norm": 1.4765625, "learning_rate": 0.00027628045323712194, "loss": 4.8637, "mean_token_accuracy": 0.22165046036243438, "num_tokens": 111930625.0, "step": 64530 }, { "entropy": 5.953272438049316, "epoch": 5.0210075860727486, "grad_norm": 1.390625, "learning_rate": 0.00027625273808864955, "loss": 4.9263, "mean_token_accuracy": 0.2228071391582489, "num_tokens": 111939962.0, "step": 64535 }, { "entropy": 5.984951448440552, "epoch": 5.021396615444466, "grad_norm": 1.5, "learning_rate": 0.0002762250229211687, "loss": 5.0491, "mean_token_accuracy": 0.2120636761188507, "num_tokens": 111948461.0, "step": 64540 }, { "entropy": 5.932856512069702, "epoch": 5.021785644816184, "grad_norm": 1.4140625, "learning_rate": 0.00027619730773510015, "loss": 4.9265, "mean_token_accuracy": 0.22442819476127623, "num_tokens": 111956806.0, "step": 64545 }, { "entropy": 5.996646881103516, "epoch": 5.022174674187901, "grad_norm": 1.4453125, "learning_rate": 0.00027616959253086437, "loss": 5.0321, "mean_token_accuracy": 0.21168937236070634, "num_tokens": 111965947.0, "step": 64550 }, { "entropy": 5.965319728851318, "epoch": 5.0225637035596185, "grad_norm": 1.5234375, "learning_rate": 0.0002761418773088818, "loss": 4.9307, "mean_token_accuracy": 0.2172708258032799, "num_tokens": 111974729.0, "step": 64555 }, { "entropy": 5.999999570846557, "epoch": 5.022952732931336, "grad_norm": 1.4296875, "learning_rate": 0.0002761141620695731, "loss": 4.9736, "mean_token_accuracy": 0.2131114736199379, "num_tokens": 111983010.0, "step": 64560 }, { "entropy": 5.8825568675994875, "epoch": 5.023341762303054, "grad_norm": 1.6171875, "learning_rate": 0.00027608644681335876, "loss": 4.8295, "mean_token_accuracy": 0.229107004404068, "num_tokens": 111990739.0, "step": 64565 }, { "entropy": 5.853581476211548, "epoch": 5.0237307916747715, "grad_norm": 1.4453125, "learning_rate": 0.00027605873154065935, "loss": 4.7885, "mean_token_accuracy": 0.23045054078102112, "num_tokens": 111998532.0, "step": 64570 }, { "entropy": 5.801084804534912, "epoch": 5.024119821046489, "grad_norm": 1.4375, "learning_rate": 0.00027603101625189543, "loss": 4.7826, "mean_token_accuracy": 0.22840965837240218, "num_tokens": 112008592.0, "step": 64575 }, { "entropy": 5.948647117614746, "epoch": 5.024508850418207, "grad_norm": 1.5859375, "learning_rate": 0.0002760033009474874, "loss": 4.918, "mean_token_accuracy": 0.22756849527359008, "num_tokens": 112016700.0, "step": 64580 }, { "entropy": 6.027149677276611, "epoch": 5.024897879789924, "grad_norm": 1.5, "learning_rate": 0.0002759755856278558, "loss": 5.0566, "mean_token_accuracy": 0.20929763913154603, "num_tokens": 112026129.0, "step": 64585 }, { "entropy": 5.993504428863526, "epoch": 5.0252869091616414, "grad_norm": 1.53125, "learning_rate": 0.0002759478702934213, "loss": 5.0431, "mean_token_accuracy": 0.20621503591537477, "num_tokens": 112035784.0, "step": 64590 }, { "entropy": 5.951185703277588, "epoch": 5.025675938533359, "grad_norm": 1.421875, "learning_rate": 0.00027592015494460443, "loss": 4.8844, "mean_token_accuracy": 0.22701186686754227, "num_tokens": 112044901.0, "step": 64595 }, { "entropy": 5.981384134292602, "epoch": 5.026064967905077, "grad_norm": 1.453125, "learning_rate": 0.00027589243958182566, "loss": 4.9562, "mean_token_accuracy": 0.21973519772291183, "num_tokens": 112054608.0, "step": 64600 }, { "entropy": 5.995902156829834, "epoch": 5.0264539972767945, "grad_norm": 1.40625, "learning_rate": 0.00027586472420550553, "loss": 4.9001, "mean_token_accuracy": 0.2242453619837761, "num_tokens": 112063305.0, "step": 64605 }, { "entropy": 5.943789100646972, "epoch": 5.026843026648512, "grad_norm": 1.5546875, "learning_rate": 0.0002758370088160646, "loss": 4.9108, "mean_token_accuracy": 0.21922565698623658, "num_tokens": 112071953.0, "step": 64610 }, { "entropy": 5.910513639450073, "epoch": 5.02723205602023, "grad_norm": 1.5546875, "learning_rate": 0.0002758092934139234, "loss": 4.9037, "mean_token_accuracy": 0.2183284655213356, "num_tokens": 112080912.0, "step": 64615 }, { "entropy": 5.999034309387207, "epoch": 5.027621085391947, "grad_norm": 1.453125, "learning_rate": 0.0002757815779995023, "loss": 4.9346, "mean_token_accuracy": 0.21927718222141265, "num_tokens": 112089670.0, "step": 64620 }, { "entropy": 5.9748927593231205, "epoch": 5.028010114763664, "grad_norm": 1.453125, "learning_rate": 0.0002757538625732222, "loss": 4.9864, "mean_token_accuracy": 0.2168762430548668, "num_tokens": 112098534.0, "step": 64625 }, { "entropy": 5.889771461486816, "epoch": 5.028399144135382, "grad_norm": 1.3984375, "learning_rate": 0.0002757261471355034, "loss": 4.8314, "mean_token_accuracy": 0.22442008256912233, "num_tokens": 112107494.0, "step": 64630 }, { "entropy": 5.944204473495484, "epoch": 5.0287881735071, "grad_norm": 1.46875, "learning_rate": 0.00027569843168676647, "loss": 4.9554, "mean_token_accuracy": 0.2106885641813278, "num_tokens": 112115831.0, "step": 64635 }, { "entropy": 5.932636070251465, "epoch": 5.0291772028788175, "grad_norm": 1.3828125, "learning_rate": 0.0002756707162274319, "loss": 4.9089, "mean_token_accuracy": 0.22630784064531326, "num_tokens": 112124683.0, "step": 64640 }, { "entropy": 5.920764970779419, "epoch": 5.029566232250535, "grad_norm": 1.5546875, "learning_rate": 0.00027564300075792026, "loss": 4.8595, "mean_token_accuracy": 0.22869690060615538, "num_tokens": 112133221.0, "step": 64645 }, { "entropy": 5.90343542098999, "epoch": 5.029955261622252, "grad_norm": 1.3828125, "learning_rate": 0.00027561528527865215, "loss": 4.9049, "mean_token_accuracy": 0.21364986449480056, "num_tokens": 112142295.0, "step": 64650 }, { "entropy": 5.931903982162476, "epoch": 5.03034429099397, "grad_norm": 1.4609375, "learning_rate": 0.0002755875697900481, "loss": 4.9117, "mean_token_accuracy": 0.2198319599032402, "num_tokens": 112150959.0, "step": 64655 }, { "entropy": 5.912628984451294, "epoch": 5.030733320365687, "grad_norm": 1.4921875, "learning_rate": 0.00027555985429252857, "loss": 4.8281, "mean_token_accuracy": 0.22266353368759156, "num_tokens": 112159314.0, "step": 64660 }, { "entropy": 5.945159196853638, "epoch": 5.031122349737405, "grad_norm": 1.6015625, "learning_rate": 0.0002755321387865141, "loss": 4.9523, "mean_token_accuracy": 0.2211337774991989, "num_tokens": 112168010.0, "step": 64665 }, { "entropy": 5.969783306121826, "epoch": 5.031511379109123, "grad_norm": 1.484375, "learning_rate": 0.0002755044232724253, "loss": 4.8866, "mean_token_accuracy": 0.22506098002195357, "num_tokens": 112175743.0, "step": 64670 }, { "entropy": 6.0086658000946045, "epoch": 5.0319004084808405, "grad_norm": 1.578125, "learning_rate": 0.00027547670775068274, "loss": 4.9966, "mean_token_accuracy": 0.2057319313287735, "num_tokens": 112184148.0, "step": 64675 }, { "entropy": 6.047475910186767, "epoch": 5.032289437852558, "grad_norm": 1.4921875, "learning_rate": 0.00027544899222170684, "loss": 4.985, "mean_token_accuracy": 0.2184407204389572, "num_tokens": 112193534.0, "step": 64680 }, { "entropy": 5.954745149612426, "epoch": 5.032678467224275, "grad_norm": 1.4453125, "learning_rate": 0.00027542127668591824, "loss": 4.9295, "mean_token_accuracy": 0.225139619410038, "num_tokens": 112202007.0, "step": 64685 }, { "entropy": 5.868213796615601, "epoch": 5.033067496595993, "grad_norm": 1.5625, "learning_rate": 0.0002753935611437374, "loss": 4.8409, "mean_token_accuracy": 0.2285771444439888, "num_tokens": 112210305.0, "step": 64690 }, { "entropy": 5.961578464508056, "epoch": 5.03345652596771, "grad_norm": 1.484375, "learning_rate": 0.00027536584559558494, "loss": 4.9254, "mean_token_accuracy": 0.21526242941617965, "num_tokens": 112218744.0, "step": 64695 }, { "entropy": 5.919012498855591, "epoch": 5.033845555339428, "grad_norm": 1.53125, "learning_rate": 0.0002753381300418813, "loss": 4.9252, "mean_token_accuracy": 0.21993912607431412, "num_tokens": 112227807.0, "step": 64700 }, { "entropy": 5.908535432815552, "epoch": 5.034234584711146, "grad_norm": 1.453125, "learning_rate": 0.0002753104144830471, "loss": 4.9588, "mean_token_accuracy": 0.21832275688648223, "num_tokens": 112236668.0, "step": 64705 }, { "entropy": 5.988567066192627, "epoch": 5.0346236140828635, "grad_norm": 1.40625, "learning_rate": 0.00027528269891950285, "loss": 5.0206, "mean_token_accuracy": 0.2114863485097885, "num_tokens": 112245190.0, "step": 64710 }, { "entropy": 5.9327507495880125, "epoch": 5.035012643454581, "grad_norm": 1.515625, "learning_rate": 0.0002752549833516691, "loss": 4.9329, "mean_token_accuracy": 0.21545108109712602, "num_tokens": 112253558.0, "step": 64715 }, { "entropy": 5.911591625213623, "epoch": 5.035401672826298, "grad_norm": 1.4453125, "learning_rate": 0.0002752272677799664, "loss": 4.8536, "mean_token_accuracy": 0.2289659634232521, "num_tokens": 112262669.0, "step": 64720 }, { "entropy": 5.903499937057495, "epoch": 5.035790702198016, "grad_norm": 1.5703125, "learning_rate": 0.00027519955220481525, "loss": 4.8807, "mean_token_accuracy": 0.2215979963541031, "num_tokens": 112270750.0, "step": 64725 }, { "entropy": 5.980356645584107, "epoch": 5.036179731569733, "grad_norm": 1.3984375, "learning_rate": 0.0002751718366266362, "loss": 4.9524, "mean_token_accuracy": 0.21776337474584578, "num_tokens": 112279317.0, "step": 64730 }, { "entropy": 5.919329214096069, "epoch": 5.036568760941451, "grad_norm": 1.5546875, "learning_rate": 0.0002751441210458498, "loss": 4.9642, "mean_token_accuracy": 0.22425423115491866, "num_tokens": 112288343.0, "step": 64735 }, { "entropy": 5.893426370620728, "epoch": 5.036957790313169, "grad_norm": 1.4921875, "learning_rate": 0.00027511640546287665, "loss": 4.8563, "mean_token_accuracy": 0.22952343970537187, "num_tokens": 112296651.0, "step": 64740 }, { "entropy": 5.920495080947876, "epoch": 5.0373468196848865, "grad_norm": 1.484375, "learning_rate": 0.0002750886898781372, "loss": 4.8849, "mean_token_accuracy": 0.23480149060487748, "num_tokens": 112305716.0, "step": 64745 }, { "entropy": 5.84849066734314, "epoch": 5.037735849056604, "grad_norm": 1.5859375, "learning_rate": 0.000275060974292052, "loss": 4.7411, "mean_token_accuracy": 0.2382361650466919, "num_tokens": 112314250.0, "step": 64750 }, { "entropy": 5.935089826583862, "epoch": 5.038124878428321, "grad_norm": 1.5546875, "learning_rate": 0.0002750332587050416, "loss": 4.9653, "mean_token_accuracy": 0.21852075308561325, "num_tokens": 112322621.0, "step": 64755 }, { "entropy": 5.932641696929932, "epoch": 5.038513907800039, "grad_norm": 1.3359375, "learning_rate": 0.0002750055431175266, "loss": 4.9424, "mean_token_accuracy": 0.21677245199680328, "num_tokens": 112331471.0, "step": 64760 }, { "entropy": 6.006406259536743, "epoch": 5.038902937171756, "grad_norm": 1.53125, "learning_rate": 0.00027497782752992743, "loss": 4.9709, "mean_token_accuracy": 0.21237770318984986, "num_tokens": 112339686.0, "step": 64765 }, { "entropy": 5.902475452423095, "epoch": 5.039291966543474, "grad_norm": 1.5234375, "learning_rate": 0.0002749501119426647, "loss": 4.8457, "mean_token_accuracy": 0.22895268797874452, "num_tokens": 112347926.0, "step": 64770 }, { "entropy": 5.895757055282592, "epoch": 5.039680995915192, "grad_norm": 1.484375, "learning_rate": 0.00027492239635615903, "loss": 4.9725, "mean_token_accuracy": 0.2224930316209793, "num_tokens": 112357051.0, "step": 64775 }, { "entropy": 5.859316635131836, "epoch": 5.0400700252869095, "grad_norm": 1.421875, "learning_rate": 0.0002748946807708308, "loss": 4.8941, "mean_token_accuracy": 0.2247803807258606, "num_tokens": 112366330.0, "step": 64780 }, { "entropy": 5.984780359268188, "epoch": 5.040459054658626, "grad_norm": 1.4609375, "learning_rate": 0.0002748669651871006, "loss": 5.0118, "mean_token_accuracy": 0.21367742419242858, "num_tokens": 112375198.0, "step": 64785 }, { "entropy": 5.960772371292114, "epoch": 5.040848084030344, "grad_norm": 1.3828125, "learning_rate": 0.00027483924960538907, "loss": 4.8844, "mean_token_accuracy": 0.21841208189725875, "num_tokens": 112384176.0, "step": 64790 }, { "entropy": 5.994722843170166, "epoch": 5.041237113402062, "grad_norm": 1.4453125, "learning_rate": 0.00027481153402611664, "loss": 4.9905, "mean_token_accuracy": 0.21865815073251724, "num_tokens": 112392861.0, "step": 64795 }, { "entropy": 5.956846475601196, "epoch": 5.041626142773779, "grad_norm": 1.515625, "learning_rate": 0.00027478381844970386, "loss": 4.952, "mean_token_accuracy": 0.21239129304885865, "num_tokens": 112402198.0, "step": 64800 }, { "entropy": 5.922763681411743, "epoch": 5.042015172145497, "grad_norm": 1.6015625, "learning_rate": 0.0002747561028765713, "loss": 4.8689, "mean_token_accuracy": 0.22311809659004211, "num_tokens": 112410175.0, "step": 64805 }, { "entropy": 5.939531326293945, "epoch": 5.042404201517215, "grad_norm": 1.421875, "learning_rate": 0.00027472838730713956, "loss": 4.9861, "mean_token_accuracy": 0.21517639011144638, "num_tokens": 112418955.0, "step": 64810 }, { "entropy": 5.83917202949524, "epoch": 5.0427932308889325, "grad_norm": 1.4453125, "learning_rate": 0.00027470067174182905, "loss": 4.8501, "mean_token_accuracy": 0.22274995744228362, "num_tokens": 112427794.0, "step": 64815 }, { "entropy": 6.0189189434051515, "epoch": 5.043182260260649, "grad_norm": 1.4375, "learning_rate": 0.0002746729561810604, "loss": 5.0025, "mean_token_accuracy": 0.21766810715198517, "num_tokens": 112437156.0, "step": 64820 }, { "entropy": 5.923266887664795, "epoch": 5.043571289632367, "grad_norm": 1.4375, "learning_rate": 0.00027464524062525405, "loss": 4.8653, "mean_token_accuracy": 0.22640130966901778, "num_tokens": 112446082.0, "step": 64825 }, { "entropy": 6.014674234390259, "epoch": 5.043960319004085, "grad_norm": 1.40625, "learning_rate": 0.0002746175250748306, "loss": 5.0424, "mean_token_accuracy": 0.2133150354027748, "num_tokens": 112454983.0, "step": 64830 }, { "entropy": 6.002985334396362, "epoch": 5.044349348375802, "grad_norm": 1.5234375, "learning_rate": 0.0002745898095302106, "loss": 5.0392, "mean_token_accuracy": 0.21668250858783722, "num_tokens": 112464933.0, "step": 64835 }, { "entropy": 6.016051959991455, "epoch": 5.04473837774752, "grad_norm": 1.484375, "learning_rate": 0.00027456209399181466, "loss": 4.9542, "mean_token_accuracy": 0.21497328579425812, "num_tokens": 112473834.0, "step": 64840 }, { "entropy": 5.960535001754761, "epoch": 5.045127407119238, "grad_norm": 1.390625, "learning_rate": 0.00027453437846006325, "loss": 4.8884, "mean_token_accuracy": 0.22180876582860948, "num_tokens": 112482113.0, "step": 64845 }, { "entropy": 5.976833534240723, "epoch": 5.0455164364909555, "grad_norm": 1.578125, "learning_rate": 0.00027450666293537683, "loss": 4.931, "mean_token_accuracy": 0.2208910256624222, "num_tokens": 112490425.0, "step": 64850 }, { "entropy": 5.985898685455322, "epoch": 5.045905465862672, "grad_norm": 1.5078125, "learning_rate": 0.000274478947418176, "loss": 5.0334, "mean_token_accuracy": 0.2147115707397461, "num_tokens": 112499456.0, "step": 64855 }, { "entropy": 5.955044841766357, "epoch": 5.04629449523439, "grad_norm": 1.515625, "learning_rate": 0.0002744512319088814, "loss": 4.8936, "mean_token_accuracy": 0.22036911100149154, "num_tokens": 112508692.0, "step": 64860 }, { "entropy": 5.978382921218872, "epoch": 5.046683524606108, "grad_norm": 1.5234375, "learning_rate": 0.0002744235164079135, "loss": 4.9916, "mean_token_accuracy": 0.21495700776576995, "num_tokens": 112517262.0, "step": 64865 }, { "entropy": 5.952741956710815, "epoch": 5.047072553977825, "grad_norm": 1.4140625, "learning_rate": 0.0002743958009156928, "loss": 4.8855, "mean_token_accuracy": 0.2230050280690193, "num_tokens": 112526464.0, "step": 64870 }, { "entropy": 5.988785266876221, "epoch": 5.047461583349543, "grad_norm": 1.6484375, "learning_rate": 0.0002743680854326398, "loss": 5.0682, "mean_token_accuracy": 0.20602674931287765, "num_tokens": 112534582.0, "step": 64875 }, { "entropy": 6.000503587722778, "epoch": 5.047850612721261, "grad_norm": 1.375, "learning_rate": 0.0002743403699591751, "loss": 5.0605, "mean_token_accuracy": 0.20553330034017564, "num_tokens": 112543561.0, "step": 64880 }, { "entropy": 5.98208703994751, "epoch": 5.048239642092978, "grad_norm": 1.4453125, "learning_rate": 0.00027431265449571937, "loss": 4.9443, "mean_token_accuracy": 0.21677876859903336, "num_tokens": 112552500.0, "step": 64885 }, { "entropy": 6.008733415603638, "epoch": 5.048628671464695, "grad_norm": 1.5078125, "learning_rate": 0.00027428493904269285, "loss": 4.9758, "mean_token_accuracy": 0.20962157249450683, "num_tokens": 112561008.0, "step": 64890 }, { "entropy": 5.929378509521484, "epoch": 5.049017700836413, "grad_norm": 1.5, "learning_rate": 0.0002742572236005164, "loss": 4.8468, "mean_token_accuracy": 0.2307700112462044, "num_tokens": 112569088.0, "step": 64895 }, { "entropy": 5.827186250686646, "epoch": 5.049406730208131, "grad_norm": 1.5234375, "learning_rate": 0.00027422950816961025, "loss": 4.832, "mean_token_accuracy": 0.2260448753833771, "num_tokens": 112577590.0, "step": 64900 }, { "entropy": 5.982899522781372, "epoch": 5.049795759579848, "grad_norm": 1.4765625, "learning_rate": 0.000274201792750395, "loss": 4.9818, "mean_token_accuracy": 0.21708086431026458, "num_tokens": 112586684.0, "step": 64905 }, { "entropy": 5.999047136306762, "epoch": 5.050184788951566, "grad_norm": 1.453125, "learning_rate": 0.0002741740773432914, "loss": 4.9972, "mean_token_accuracy": 0.21108605414628984, "num_tokens": 112595460.0, "step": 64910 }, { "entropy": 5.884735202789306, "epoch": 5.050573818323284, "grad_norm": 1.359375, "learning_rate": 0.0002741463619487199, "loss": 4.8553, "mean_token_accuracy": 0.2219989389181137, "num_tokens": 112604487.0, "step": 64915 }, { "entropy": 5.948068380355835, "epoch": 5.050962847695001, "grad_norm": 1.5390625, "learning_rate": 0.0002741186465671011, "loss": 4.9361, "mean_token_accuracy": 0.21746286302804946, "num_tokens": 112613367.0, "step": 64920 }, { "entropy": 5.907820749282837, "epoch": 5.051351877066718, "grad_norm": 1.5703125, "learning_rate": 0.0002740909311988553, "loss": 4.8608, "mean_token_accuracy": 0.2226157456636429, "num_tokens": 112621885.0, "step": 64925 }, { "entropy": 6.007283735275268, "epoch": 5.051740906438436, "grad_norm": 1.4140625, "learning_rate": 0.0002740632158444031, "loss": 4.9963, "mean_token_accuracy": 0.21715058237314225, "num_tokens": 112630471.0, "step": 64930 }, { "entropy": 6.069671964645385, "epoch": 5.052129935810154, "grad_norm": 1.515625, "learning_rate": 0.0002740355005041652, "loss": 5.0786, "mean_token_accuracy": 0.19822930693626403, "num_tokens": 112638910.0, "step": 64935 }, { "entropy": 5.951589298248291, "epoch": 5.052518965181871, "grad_norm": 1.671875, "learning_rate": 0.0002740077851785621, "loss": 4.9364, "mean_token_accuracy": 0.22440241575241088, "num_tokens": 112647363.0, "step": 64940 }, { "entropy": 5.907050085067749, "epoch": 5.052907994553589, "grad_norm": 1.4921875, "learning_rate": 0.00027398006986801415, "loss": 4.8987, "mean_token_accuracy": 0.21776199340820312, "num_tokens": 112656464.0, "step": 64945 }, { "entropy": 5.945102405548096, "epoch": 5.053297023925307, "grad_norm": 1.6328125, "learning_rate": 0.0002739523545729421, "loss": 4.8816, "mean_token_accuracy": 0.23098332583904266, "num_tokens": 112665277.0, "step": 64950 }, { "entropy": 6.006834316253662, "epoch": 5.053686053297024, "grad_norm": 1.53125, "learning_rate": 0.0002739246392937664, "loss": 5.0493, "mean_token_accuracy": 0.2104157954454422, "num_tokens": 112674627.0, "step": 64955 }, { "entropy": 5.88004059791565, "epoch": 5.054075082668741, "grad_norm": 1.40625, "learning_rate": 0.00027389692403090754, "loss": 4.8177, "mean_token_accuracy": 0.23242831826210023, "num_tokens": 112683495.0, "step": 64960 }, { "entropy": 5.903785228729248, "epoch": 5.054464112040459, "grad_norm": 1.28125, "learning_rate": 0.00027386920878478616, "loss": 4.8665, "mean_token_accuracy": 0.2234046846628189, "num_tokens": 112693354.0, "step": 64965 }, { "entropy": 5.961070919036866, "epoch": 5.054853141412177, "grad_norm": 1.4296875, "learning_rate": 0.00027384149355582266, "loss": 4.9271, "mean_token_accuracy": 0.21609951853752135, "num_tokens": 112702139.0, "step": 64970 }, { "entropy": 5.985744857788086, "epoch": 5.055242170783894, "grad_norm": 1.609375, "learning_rate": 0.0002738137783444377, "loss": 4.926, "mean_token_accuracy": 0.21396335810422898, "num_tokens": 112710696.0, "step": 64975 }, { "entropy": 5.971740055084228, "epoch": 5.055631200155612, "grad_norm": 1.421875, "learning_rate": 0.00027378606315105175, "loss": 5.0054, "mean_token_accuracy": 0.20940473824739456, "num_tokens": 112719058.0, "step": 64980 }, { "entropy": 6.046074867248535, "epoch": 5.056020229527329, "grad_norm": 1.625, "learning_rate": 0.0002737583479760854, "loss": 5.0296, "mean_token_accuracy": 0.21401085555553437, "num_tokens": 112727719.0, "step": 64985 }, { "entropy": 6.0324279308319095, "epoch": 5.056409258899047, "grad_norm": 1.5546875, "learning_rate": 0.0002737306328199591, "loss": 5.046, "mean_token_accuracy": 0.21264223903417587, "num_tokens": 112736631.0, "step": 64990 }, { "entropy": 5.922986936569214, "epoch": 5.056798288270764, "grad_norm": 1.3359375, "learning_rate": 0.00027370291768309354, "loss": 4.8445, "mean_token_accuracy": 0.22336238324642183, "num_tokens": 112745609.0, "step": 64995 }, { "entropy": 5.882319736480713, "epoch": 5.057187317642482, "grad_norm": 1.4765625, "learning_rate": 0.000273675202565909, "loss": 4.992, "mean_token_accuracy": 0.2113862529397011, "num_tokens": 112754505.0, "step": 65000 }, { "entropy": 5.981713390350341, "epoch": 5.0575763470142, "grad_norm": 1.5625, "learning_rate": 0.00027364748746882623, "loss": 4.9264, "mean_token_accuracy": 0.2180582568049431, "num_tokens": 112763237.0, "step": 65005 }, { "entropy": 5.990506601333618, "epoch": 5.057965376385917, "grad_norm": 1.3671875, "learning_rate": 0.00027361977239226566, "loss": 4.9738, "mean_token_accuracy": 0.21801112592220306, "num_tokens": 112772011.0, "step": 65010 }, { "entropy": 5.974327468872071, "epoch": 5.058354405757635, "grad_norm": 1.5859375, "learning_rate": 0.0002735920573366478, "loss": 4.9183, "mean_token_accuracy": 0.22197403907775878, "num_tokens": 112780143.0, "step": 65015 }, { "entropy": 5.934564065933228, "epoch": 5.058743435129352, "grad_norm": 1.5234375, "learning_rate": 0.0002735643423023933, "loss": 4.9365, "mean_token_accuracy": 0.21756203919649125, "num_tokens": 112789154.0, "step": 65020 }, { "entropy": 5.927538061141968, "epoch": 5.05913246450107, "grad_norm": 1.5, "learning_rate": 0.0002735366272899226, "loss": 4.8996, "mean_token_accuracy": 0.2291517212986946, "num_tokens": 112797285.0, "step": 65025 }, { "entropy": 5.928336048126221, "epoch": 5.059521493872787, "grad_norm": 1.4765625, "learning_rate": 0.00027350891229965623, "loss": 4.9549, "mean_token_accuracy": 0.2109627828001976, "num_tokens": 112805882.0, "step": 65030 }, { "entropy": 5.870224857330323, "epoch": 5.059910523244505, "grad_norm": 1.4375, "learning_rate": 0.0002734811973320147, "loss": 4.8902, "mean_token_accuracy": 0.21746993213891982, "num_tokens": 112814830.0, "step": 65035 }, { "entropy": 6.0118919849395756, "epoch": 5.060299552616223, "grad_norm": 1.5234375, "learning_rate": 0.00027345348238741864, "loss": 4.9844, "mean_token_accuracy": 0.21630282700061798, "num_tokens": 112823778.0, "step": 65040 }, { "entropy": 5.944325876235962, "epoch": 5.06068858198794, "grad_norm": 1.5234375, "learning_rate": 0.00027342576746628854, "loss": 4.9655, "mean_token_accuracy": 0.215819251537323, "num_tokens": 112832255.0, "step": 65045 }, { "entropy": 5.98446741104126, "epoch": 5.061077611359658, "grad_norm": 1.5546875, "learning_rate": 0.0002733980525690449, "loss": 5.0198, "mean_token_accuracy": 0.21596342772245408, "num_tokens": 112840913.0, "step": 65050 }, { "entropy": 5.984060335159302, "epoch": 5.061466640731375, "grad_norm": 1.625, "learning_rate": 0.00027337033769610827, "loss": 4.989, "mean_token_accuracy": 0.2151486873626709, "num_tokens": 112849285.0, "step": 65055 }, { "entropy": 5.96875524520874, "epoch": 5.061855670103093, "grad_norm": 1.5, "learning_rate": 0.0002733426228478991, "loss": 4.9667, "mean_token_accuracy": 0.21276404857635497, "num_tokens": 112858228.0, "step": 65060 }, { "entropy": 5.8846405982971195, "epoch": 5.06224469947481, "grad_norm": 1.453125, "learning_rate": 0.0002733149080248381, "loss": 4.813, "mean_token_accuracy": 0.22906408160924913, "num_tokens": 112866768.0, "step": 65065 }, { "entropy": 5.935096645355225, "epoch": 5.062633728846528, "grad_norm": 1.53125, "learning_rate": 0.0002732871932273456, "loss": 4.9408, "mean_token_accuracy": 0.22284477353096008, "num_tokens": 112875021.0, "step": 65070 }, { "entropy": 5.896332406997681, "epoch": 5.063022758218246, "grad_norm": 1.4453125, "learning_rate": 0.0002732594784558423, "loss": 4.9177, "mean_token_accuracy": 0.2210765540599823, "num_tokens": 112884139.0, "step": 65075 }, { "entropy": 5.860652065277099, "epoch": 5.063411787589963, "grad_norm": 1.4765625, "learning_rate": 0.0002732317637107486, "loss": 4.8275, "mean_token_accuracy": 0.22939564734697343, "num_tokens": 112891979.0, "step": 65080 }, { "entropy": 5.975470161437988, "epoch": 5.063800816961681, "grad_norm": 1.40625, "learning_rate": 0.00027320404899248507, "loss": 4.9662, "mean_token_accuracy": 0.21652035117149354, "num_tokens": 112901479.0, "step": 65085 }, { "entropy": 5.941552448272705, "epoch": 5.064189846333398, "grad_norm": 1.578125, "learning_rate": 0.0002731763343014722, "loss": 4.8838, "mean_token_accuracy": 0.22376079857349396, "num_tokens": 112909479.0, "step": 65090 }, { "entropy": 6.045760536193848, "epoch": 5.064578875705116, "grad_norm": 1.6015625, "learning_rate": 0.00027314861963813065, "loss": 5.0295, "mean_token_accuracy": 0.21272787153720857, "num_tokens": 112918457.0, "step": 65095 }, { "entropy": 6.001100683212281, "epoch": 5.064967905076833, "grad_norm": 1.4609375, "learning_rate": 0.00027312090500288065, "loss": 4.9612, "mean_token_accuracy": 0.2196800321340561, "num_tokens": 112927833.0, "step": 65100 }, { "entropy": 5.9191446781158445, "epoch": 5.065356934448551, "grad_norm": 1.484375, "learning_rate": 0.0002730931903961431, "loss": 4.93, "mean_token_accuracy": 0.22177924662828447, "num_tokens": 112935906.0, "step": 65105 }, { "entropy": 5.965351009368897, "epoch": 5.065745963820269, "grad_norm": 1.53125, "learning_rate": 0.00027306547581833836, "loss": 4.9932, "mean_token_accuracy": 0.223183673620224, "num_tokens": 112944375.0, "step": 65110 }, { "entropy": 5.984156799316406, "epoch": 5.066134993191986, "grad_norm": 1.4140625, "learning_rate": 0.00027303776126988687, "loss": 4.9434, "mean_token_accuracy": 0.21819078475236892, "num_tokens": 112953280.0, "step": 65115 }, { "entropy": 5.984451723098755, "epoch": 5.066524022563703, "grad_norm": 1.375, "learning_rate": 0.00027301004675120926, "loss": 4.9249, "mean_token_accuracy": 0.22579724937677384, "num_tokens": 112961752.0, "step": 65120 }, { "entropy": 5.960571813583374, "epoch": 5.066913051935421, "grad_norm": 1.4609375, "learning_rate": 0.0002729823322627261, "loss": 4.9053, "mean_token_accuracy": 0.2195689484477043, "num_tokens": 112970558.0, "step": 65125 }, { "entropy": 5.972404718399048, "epoch": 5.0673020813071386, "grad_norm": 1.515625, "learning_rate": 0.0002729546178048577, "loss": 4.9873, "mean_token_accuracy": 0.21649586260318757, "num_tokens": 112979259.0, "step": 65130 }, { "entropy": 5.948299074172974, "epoch": 5.067691110678856, "grad_norm": 1.5, "learning_rate": 0.0002729269033780248, "loss": 4.9335, "mean_token_accuracy": 0.21851952373981476, "num_tokens": 112987807.0, "step": 65135 }, { "entropy": 5.998951435089111, "epoch": 5.068080140050574, "grad_norm": 1.40625, "learning_rate": 0.00027289918898264784, "loss": 4.9879, "mean_token_accuracy": 0.21094974428415297, "num_tokens": 112997102.0, "step": 65140 }, { "entropy": 6.001391077041626, "epoch": 5.068469169422292, "grad_norm": 1.59375, "learning_rate": 0.0002728714746191473, "loss": 4.9527, "mean_token_accuracy": 0.21674688160419464, "num_tokens": 113005036.0, "step": 65145 }, { "entropy": 5.993588924407959, "epoch": 5.068858198794009, "grad_norm": 1.421875, "learning_rate": 0.00027284376028794376, "loss": 4.9575, "mean_token_accuracy": 0.22314064353704452, "num_tokens": 113013415.0, "step": 65150 }, { "entropy": 5.915716314315796, "epoch": 5.069247228165726, "grad_norm": 1.4453125, "learning_rate": 0.00027281604598945774, "loss": 4.906, "mean_token_accuracy": 0.22116379588842391, "num_tokens": 113022239.0, "step": 65155 }, { "entropy": 5.921736478805542, "epoch": 5.069636257537444, "grad_norm": 1.421875, "learning_rate": 0.0002727883317241098, "loss": 4.938, "mean_token_accuracy": 0.21675106137990952, "num_tokens": 113030910.0, "step": 65160 }, { "entropy": 5.935070943832398, "epoch": 5.0700252869091615, "grad_norm": 1.5859375, "learning_rate": 0.00027276061749232034, "loss": 4.9374, "mean_token_accuracy": 0.2195601910352707, "num_tokens": 113039672.0, "step": 65165 }, { "entropy": 6.021441173553467, "epoch": 5.070414316280879, "grad_norm": 1.4296875, "learning_rate": 0.0002727329032945099, "loss": 4.9993, "mean_token_accuracy": 0.2162391796708107, "num_tokens": 113047951.0, "step": 65170 }, { "entropy": 5.97096529006958, "epoch": 5.070803345652597, "grad_norm": 1.6171875, "learning_rate": 0.0002727051891310991, "loss": 5.0113, "mean_token_accuracy": 0.2131443127989769, "num_tokens": 113056590.0, "step": 65175 }, { "entropy": 6.005364036560058, "epoch": 5.071192375024315, "grad_norm": 1.7265625, "learning_rate": 0.0002726774750025084, "loss": 4.9558, "mean_token_accuracy": 0.2167626604437828, "num_tokens": 113065427.0, "step": 65180 }, { "entropy": 6.029196166992188, "epoch": 5.071581404396032, "grad_norm": 1.3515625, "learning_rate": 0.00027264976090915835, "loss": 5.0555, "mean_token_accuracy": 0.20568238496780394, "num_tokens": 113074619.0, "step": 65185 }, { "entropy": 5.986215829849243, "epoch": 5.071970433767749, "grad_norm": 1.4375, "learning_rate": 0.0002726220468514694, "loss": 5.0128, "mean_token_accuracy": 0.20942171961069106, "num_tokens": 113083360.0, "step": 65190 }, { "entropy": 5.934966564178467, "epoch": 5.072359463139467, "grad_norm": 1.4296875, "learning_rate": 0.0002725943328298621, "loss": 4.8828, "mean_token_accuracy": 0.2175072818994522, "num_tokens": 113091413.0, "step": 65195 }, { "entropy": 5.958190059661865, "epoch": 5.0727484925111845, "grad_norm": 1.4140625, "learning_rate": 0.000272566618844757, "loss": 4.932, "mean_token_accuracy": 0.22031228691339494, "num_tokens": 113100645.0, "step": 65200 }, { "entropy": 5.975075197219849, "epoch": 5.073137521882902, "grad_norm": 1.453125, "learning_rate": 0.00027253890489657457, "loss": 4.8992, "mean_token_accuracy": 0.2172503411769867, "num_tokens": 113109046.0, "step": 65205 }, { "entropy": 5.991329526901245, "epoch": 5.07352655125462, "grad_norm": 1.5234375, "learning_rate": 0.00027251119098573533, "loss": 4.9911, "mean_token_accuracy": 0.20559496730566024, "num_tokens": 113117046.0, "step": 65210 }, { "entropy": 6.021987104415894, "epoch": 5.073915580626338, "grad_norm": 1.3828125, "learning_rate": 0.00027248347711265983, "loss": 5.0927, "mean_token_accuracy": 0.20659649819135667, "num_tokens": 113126854.0, "step": 65215 }, { "entropy": 5.975305223464966, "epoch": 5.074304609998054, "grad_norm": 1.46875, "learning_rate": 0.0002724557632777686, "loss": 4.9326, "mean_token_accuracy": 0.21689300686120988, "num_tokens": 113135471.0, "step": 65220 }, { "entropy": 6.00200834274292, "epoch": 5.074693639369772, "grad_norm": 1.5234375, "learning_rate": 0.00027242804948148197, "loss": 4.9628, "mean_token_accuracy": 0.21256966143846512, "num_tokens": 113143592.0, "step": 65225 }, { "entropy": 5.917579460144043, "epoch": 5.07508266874149, "grad_norm": 1.515625, "learning_rate": 0.0002724003357242207, "loss": 4.889, "mean_token_accuracy": 0.2196398213505745, "num_tokens": 113152415.0, "step": 65230 }, { "entropy": 5.973000574111938, "epoch": 5.0754716981132075, "grad_norm": 1.4609375, "learning_rate": 0.0002723726220064051, "loss": 4.9508, "mean_token_accuracy": 0.21663213074207305, "num_tokens": 113161589.0, "step": 65235 }, { "entropy": 5.961618518829345, "epoch": 5.075860727484925, "grad_norm": 1.578125, "learning_rate": 0.0002723449083284559, "loss": 4.9633, "mean_token_accuracy": 0.21506914049386977, "num_tokens": 113169785.0, "step": 65240 }, { "entropy": 6.003759860992432, "epoch": 5.076249756856643, "grad_norm": 1.3828125, "learning_rate": 0.00027231719469079344, "loss": 5.0433, "mean_token_accuracy": 0.21410675197839737, "num_tokens": 113178835.0, "step": 65245 }, { "entropy": 5.939591026306152, "epoch": 5.076638786228361, "grad_norm": 1.390625, "learning_rate": 0.00027228948109383826, "loss": 4.9436, "mean_token_accuracy": 0.22023582756519317, "num_tokens": 113187821.0, "step": 65250 }, { "entropy": 5.932314395904541, "epoch": 5.077027815600077, "grad_norm": 1.3828125, "learning_rate": 0.00027226176753801095, "loss": 4.9853, "mean_token_accuracy": 0.21344951242208482, "num_tokens": 113196776.0, "step": 65255 }, { "entropy": 5.911448335647583, "epoch": 5.077416844971795, "grad_norm": 1.5234375, "learning_rate": 0.00027223405402373194, "loss": 4.9127, "mean_token_accuracy": 0.219694322347641, "num_tokens": 113205206.0, "step": 65260 }, { "entropy": 5.9763267993927, "epoch": 5.077805874343513, "grad_norm": 1.5625, "learning_rate": 0.00027220634055142174, "loss": 4.9564, "mean_token_accuracy": 0.22077599614858628, "num_tokens": 113213728.0, "step": 65265 }, { "entropy": 5.9543843269348145, "epoch": 5.0781949037152305, "grad_norm": 1.6484375, "learning_rate": 0.0002721786271215009, "loss": 4.9393, "mean_token_accuracy": 0.22649639546871186, "num_tokens": 113222135.0, "step": 65270 }, { "entropy": 5.9871947288513185, "epoch": 5.078583933086948, "grad_norm": 1.4765625, "learning_rate": 0.0002721509137343899, "loss": 4.9308, "mean_token_accuracy": 0.21651903241872789, "num_tokens": 113231841.0, "step": 65275 }, { "entropy": 5.989714241027832, "epoch": 5.078972962458666, "grad_norm": 1.4296875, "learning_rate": 0.00027212320039050924, "loss": 4.9672, "mean_token_accuracy": 0.21700379252433777, "num_tokens": 113240639.0, "step": 65280 }, { "entropy": 5.997336387634277, "epoch": 5.079361991830384, "grad_norm": 1.5703125, "learning_rate": 0.00027209548709027944, "loss": 4.9857, "mean_token_accuracy": 0.2146141916513443, "num_tokens": 113249240.0, "step": 65285 }, { "entropy": 5.9954146385192875, "epoch": 5.0797510212021, "grad_norm": 1.5, "learning_rate": 0.000272067773834121, "loss": 4.9859, "mean_token_accuracy": 0.21949173957109452, "num_tokens": 113258403.0, "step": 65290 }, { "entropy": 5.987963056564331, "epoch": 5.080140050573818, "grad_norm": 1.4140625, "learning_rate": 0.0002720400606224544, "loss": 4.9177, "mean_token_accuracy": 0.22609300911426544, "num_tokens": 113267254.0, "step": 65295 }, { "entropy": 5.987097692489624, "epoch": 5.080529079945536, "grad_norm": 1.5234375, "learning_rate": 0.00027201234745570014, "loss": 4.9688, "mean_token_accuracy": 0.21421261578798295, "num_tokens": 113275836.0, "step": 65300 }, { "entropy": 5.962496185302735, "epoch": 5.0809181093172535, "grad_norm": 1.53125, "learning_rate": 0.0002719846343342788, "loss": 4.9442, "mean_token_accuracy": 0.21429015845060348, "num_tokens": 113284261.0, "step": 65305 }, { "entropy": 5.96199254989624, "epoch": 5.081307138688971, "grad_norm": 1.3984375, "learning_rate": 0.0002719569212586108, "loss": 4.9384, "mean_token_accuracy": 0.21760209500789643, "num_tokens": 113293444.0, "step": 65310 }, { "entropy": 5.987563896179199, "epoch": 5.081696168060689, "grad_norm": 1.4296875, "learning_rate": 0.0002719292082291167, "loss": 4.9309, "mean_token_accuracy": 0.21371857523918153, "num_tokens": 113302566.0, "step": 65315 }, { "entropy": 6.0054858207702635, "epoch": 5.082085197432406, "grad_norm": 1.53125, "learning_rate": 0.000271901495246217, "loss": 4.9343, "mean_token_accuracy": 0.2190324604511261, "num_tokens": 113311668.0, "step": 65320 }, { "entropy": 5.908246326446533, "epoch": 5.082474226804123, "grad_norm": 1.3984375, "learning_rate": 0.0002718737823103322, "loss": 4.9636, "mean_token_accuracy": 0.21549442559480667, "num_tokens": 113321450.0, "step": 65325 }, { "entropy": 5.897635841369629, "epoch": 5.082863256175841, "grad_norm": 1.4921875, "learning_rate": 0.00027184606942188275, "loss": 4.8281, "mean_token_accuracy": 0.2301758423447609, "num_tokens": 113329707.0, "step": 65330 }, { "entropy": 5.993349075317383, "epoch": 5.083252285547559, "grad_norm": 1.4609375, "learning_rate": 0.00027181835658128913, "loss": 4.9979, "mean_token_accuracy": 0.21561479717493057, "num_tokens": 113338483.0, "step": 65335 }, { "entropy": 5.998838615417481, "epoch": 5.0836413149192765, "grad_norm": 1.59375, "learning_rate": 0.0002717906437889719, "loss": 4.9609, "mean_token_accuracy": 0.21652824580669403, "num_tokens": 113346503.0, "step": 65340 }, { "entropy": 5.946887016296387, "epoch": 5.084030344290994, "grad_norm": 1.4609375, "learning_rate": 0.00027176293104535154, "loss": 4.9228, "mean_token_accuracy": 0.21709365248680115, "num_tokens": 113354859.0, "step": 65345 }, { "entropy": 5.939001083374023, "epoch": 5.084419373662712, "grad_norm": 1.5234375, "learning_rate": 0.00027173521835084863, "loss": 4.9368, "mean_token_accuracy": 0.218848879635334, "num_tokens": 113363534.0, "step": 65350 }, { "entropy": 5.935678958892822, "epoch": 5.084808403034429, "grad_norm": 1.4609375, "learning_rate": 0.0002717075057058835, "loss": 4.9234, "mean_token_accuracy": 0.21607306897640227, "num_tokens": 113372234.0, "step": 65355 }, { "entropy": 5.950419092178345, "epoch": 5.085197432406146, "grad_norm": 1.4609375, "learning_rate": 0.0002716797931108768, "loss": 5.0201, "mean_token_accuracy": 0.20643693655729295, "num_tokens": 113381021.0, "step": 65360 }, { "entropy": 6.006762361526489, "epoch": 5.085586461777864, "grad_norm": 1.4453125, "learning_rate": 0.0002716520805662489, "loss": 4.9845, "mean_token_accuracy": 0.21077614426612853, "num_tokens": 113388889.0, "step": 65365 }, { "entropy": 5.9278655529022215, "epoch": 5.085975491149582, "grad_norm": 1.5078125, "learning_rate": 0.00027162436807242024, "loss": 4.9131, "mean_token_accuracy": 0.2195081368088722, "num_tokens": 113397080.0, "step": 65370 }, { "entropy": 5.959735298156739, "epoch": 5.0863645205212995, "grad_norm": 1.4140625, "learning_rate": 0.00027159665562981154, "loss": 4.9644, "mean_token_accuracy": 0.2131648227572441, "num_tokens": 113405756.0, "step": 65375 }, { "entropy": 5.923728561401367, "epoch": 5.086753549893017, "grad_norm": 1.6171875, "learning_rate": 0.0002715689432388433, "loss": 4.9487, "mean_token_accuracy": 0.22262462824583054, "num_tokens": 113413729.0, "step": 65380 }, { "entropy": 5.955289030075074, "epoch": 5.087142579264735, "grad_norm": 1.5, "learning_rate": 0.0002715412308999357, "loss": 4.9971, "mean_token_accuracy": 0.21626293510198594, "num_tokens": 113423649.0, "step": 65385 }, { "entropy": 5.957227945327759, "epoch": 5.087531608636452, "grad_norm": 1.5703125, "learning_rate": 0.00027151351861350953, "loss": 4.955, "mean_token_accuracy": 0.21354981809854506, "num_tokens": 113432579.0, "step": 65390 }, { "entropy": 5.945972347259522, "epoch": 5.087920638008169, "grad_norm": 1.515625, "learning_rate": 0.0002714858063799851, "loss": 4.8379, "mean_token_accuracy": 0.22348373979330063, "num_tokens": 113440158.0, "step": 65395 }, { "entropy": 5.971912527084351, "epoch": 5.088309667379887, "grad_norm": 1.4140625, "learning_rate": 0.00027145809419978293, "loss": 4.933, "mean_token_accuracy": 0.2201162949204445, "num_tokens": 113448757.0, "step": 65400 }, { "entropy": 5.926597547531128, "epoch": 5.088698696751605, "grad_norm": 1.5625, "learning_rate": 0.00027143038207332363, "loss": 4.9398, "mean_token_accuracy": 0.21838116347789766, "num_tokens": 113457454.0, "step": 65405 }, { "entropy": 5.9431370258331295, "epoch": 5.0890877261233225, "grad_norm": 1.46875, "learning_rate": 0.00027140267000102755, "loss": 4.924, "mean_token_accuracy": 0.21589357107877732, "num_tokens": 113465783.0, "step": 65410 }, { "entropy": 5.923536014556885, "epoch": 5.08947675549504, "grad_norm": 1.4296875, "learning_rate": 0.00027137495798331524, "loss": 4.9542, "mean_token_accuracy": 0.2177286699414253, "num_tokens": 113474376.0, "step": 65415 }, { "entropy": 5.9130407810211185, "epoch": 5.089865784866757, "grad_norm": 1.5234375, "learning_rate": 0.00027134724602060717, "loss": 4.8964, "mean_token_accuracy": 0.2217514768242836, "num_tokens": 113482769.0, "step": 65420 }, { "entropy": 6.0055278778076175, "epoch": 5.090254814238475, "grad_norm": 1.34375, "learning_rate": 0.00027131953411332384, "loss": 5.0131, "mean_token_accuracy": 0.2143533393740654, "num_tokens": 113491579.0, "step": 65425 }, { "entropy": 5.995757055282593, "epoch": 5.090643843610192, "grad_norm": 1.484375, "learning_rate": 0.00027129182226188575, "loss": 5.004, "mean_token_accuracy": 0.2138711169362068, "num_tokens": 113500150.0, "step": 65430 }, { "entropy": 5.995841312408447, "epoch": 5.09103287298191, "grad_norm": 1.5078125, "learning_rate": 0.0002712641104667132, "loss": 4.9674, "mean_token_accuracy": 0.21451892852783203, "num_tokens": 113508251.0, "step": 65435 }, { "entropy": 5.96952075958252, "epoch": 5.091421902353628, "grad_norm": 1.4140625, "learning_rate": 0.000271236398728227, "loss": 4.94, "mean_token_accuracy": 0.21607869863510132, "num_tokens": 113517108.0, "step": 65440 }, { "entropy": 5.895830059051514, "epoch": 5.0918109317253455, "grad_norm": 1.640625, "learning_rate": 0.00027120868704684736, "loss": 4.8317, "mean_token_accuracy": 0.22424757182598115, "num_tokens": 113525971.0, "step": 65445 }, { "entropy": 6.0145957469940186, "epoch": 5.092199961097063, "grad_norm": 1.453125, "learning_rate": 0.0002711809754229949, "loss": 5.0444, "mean_token_accuracy": 0.211050321161747, "num_tokens": 113534800.0, "step": 65450 }, { "entropy": 5.933331632614136, "epoch": 5.09258899046878, "grad_norm": 1.5390625, "learning_rate": 0.00027115326385709004, "loss": 4.8795, "mean_token_accuracy": 0.2192299023270607, "num_tokens": 113542871.0, "step": 65455 }, { "entropy": 6.008037042617798, "epoch": 5.092978019840498, "grad_norm": 1.59375, "learning_rate": 0.0002711255523495534, "loss": 5.0232, "mean_token_accuracy": 0.2143043100833893, "num_tokens": 113551317.0, "step": 65460 }, { "entropy": 6.017021608352661, "epoch": 5.093367049212215, "grad_norm": 1.4375, "learning_rate": 0.0002710978409008052, "loss": 4.9969, "mean_token_accuracy": 0.2175760880112648, "num_tokens": 113560636.0, "step": 65465 }, { "entropy": 5.965992164611817, "epoch": 5.093756078583933, "grad_norm": 1.4765625, "learning_rate": 0.00027107012951126607, "loss": 4.9065, "mean_token_accuracy": 0.22037338614463806, "num_tokens": 113569404.0, "step": 65470 }, { "entropy": 5.957309818267822, "epoch": 5.094145107955651, "grad_norm": 1.46875, "learning_rate": 0.00027104241818135655, "loss": 4.9343, "mean_token_accuracy": 0.22087874859571457, "num_tokens": 113577997.0, "step": 65475 }, { "entropy": 5.9449866771697994, "epoch": 5.0945341373273685, "grad_norm": 1.3515625, "learning_rate": 0.00027101470691149693, "loss": 4.921, "mean_token_accuracy": 0.222595152258873, "num_tokens": 113587169.0, "step": 65480 }, { "entropy": 5.885840845108032, "epoch": 5.094923166699086, "grad_norm": 1.3671875, "learning_rate": 0.00027098699570210787, "loss": 4.9194, "mean_token_accuracy": 0.2176942154765129, "num_tokens": 113595406.0, "step": 65485 }, { "entropy": 5.895366621017456, "epoch": 5.095312196070803, "grad_norm": 1.6015625, "learning_rate": 0.00027095928455360977, "loss": 4.9388, "mean_token_accuracy": 0.2171615928411484, "num_tokens": 113603530.0, "step": 65490 }, { "entropy": 5.958537864685058, "epoch": 5.095701225442521, "grad_norm": 1.40625, "learning_rate": 0.000270931573466423, "loss": 4.9539, "mean_token_accuracy": 0.21815474331378937, "num_tokens": 113612066.0, "step": 65495 }, { "entropy": 5.95005841255188, "epoch": 5.096090254814238, "grad_norm": 1.484375, "learning_rate": 0.0002709038624409681, "loss": 4.9193, "mean_token_accuracy": 0.22208423167467117, "num_tokens": 113619939.0, "step": 65500 }, { "entropy": 5.938938045501709, "epoch": 5.096479284185956, "grad_norm": 1.6015625, "learning_rate": 0.00027087615147766567, "loss": 4.9004, "mean_token_accuracy": 0.22633223831653596, "num_tokens": 113628425.0, "step": 65505 }, { "entropy": 5.925915002822876, "epoch": 5.096868313557674, "grad_norm": 1.5078125, "learning_rate": 0.000270848440576936, "loss": 4.975, "mean_token_accuracy": 0.21568122506141663, "num_tokens": 113637037.0, "step": 65510 }, { "entropy": 5.9763024806976315, "epoch": 5.0972573429293915, "grad_norm": 1.421875, "learning_rate": 0.00027082072973919974, "loss": 4.9505, "mean_token_accuracy": 0.22626060545444487, "num_tokens": 113646586.0, "step": 65515 }, { "entropy": 5.966061925888061, "epoch": 5.097646372301108, "grad_norm": 1.6015625, "learning_rate": 0.00027079301896487716, "loss": 4.9494, "mean_token_accuracy": 0.2201508939266205, "num_tokens": 113655695.0, "step": 65520 }, { "entropy": 6.008488321304322, "epoch": 5.098035401672826, "grad_norm": 1.53125, "learning_rate": 0.0002707653082543889, "loss": 4.9645, "mean_token_accuracy": 0.2179410144686699, "num_tokens": 113663930.0, "step": 65525 }, { "entropy": 5.99328932762146, "epoch": 5.098424431044544, "grad_norm": 1.5078125, "learning_rate": 0.0002707375976081553, "loss": 4.967, "mean_token_accuracy": 0.21146235316991807, "num_tokens": 113672628.0, "step": 65530 }, { "entropy": 6.001133108139038, "epoch": 5.098813460416261, "grad_norm": 1.5546875, "learning_rate": 0.00027070988702659687, "loss": 5.0007, "mean_token_accuracy": 0.21745990067720414, "num_tokens": 113681703.0, "step": 65535 }, { "entropy": 5.986928510665893, "epoch": 5.099202489787979, "grad_norm": 1.4609375, "learning_rate": 0.00027068217651013415, "loss": 4.9761, "mean_token_accuracy": 0.21054674535989762, "num_tokens": 113690164.0, "step": 65540 }, { "entropy": 5.942771482467651, "epoch": 5.099591519159697, "grad_norm": 1.6015625, "learning_rate": 0.0002706544660591875, "loss": 4.8901, "mean_token_accuracy": 0.22384084910154342, "num_tokens": 113698724.0, "step": 65545 }, { "entropy": 5.97576756477356, "epoch": 5.0999805485314145, "grad_norm": 1.5625, "learning_rate": 0.00027062675567417736, "loss": 4.9503, "mean_token_accuracy": 0.21544487178325653, "num_tokens": 113707567.0, "step": 65550 }, { "entropy": 5.985833549499512, "epoch": 5.100369577903131, "grad_norm": 1.578125, "learning_rate": 0.00027059904535552424, "loss": 4.9861, "mean_token_accuracy": 0.21180417537689208, "num_tokens": 113717546.0, "step": 65555 }, { "entropy": 5.956966304779053, "epoch": 5.100758607274849, "grad_norm": 1.65625, "learning_rate": 0.00027057133510364866, "loss": 4.8585, "mean_token_accuracy": 0.22728909701108932, "num_tokens": 113726234.0, "step": 65560 }, { "entropy": 5.8946271419525145, "epoch": 5.101147636646567, "grad_norm": 1.46875, "learning_rate": 0.0002705436249189709, "loss": 4.7948, "mean_token_accuracy": 0.23061707764863967, "num_tokens": 113734659.0, "step": 65565 }, { "entropy": 5.931036520004272, "epoch": 5.101536666018284, "grad_norm": 1.359375, "learning_rate": 0.00027051591480191167, "loss": 4.988, "mean_token_accuracy": 0.2126322016119957, "num_tokens": 113743788.0, "step": 65570 }, { "entropy": 5.915783071517945, "epoch": 5.101925695390002, "grad_norm": 1.4609375, "learning_rate": 0.0002704882047528912, "loss": 4.9076, "mean_token_accuracy": 0.2233823522925377, "num_tokens": 113753116.0, "step": 65575 }, { "entropy": 5.950930213928222, "epoch": 5.10231472476172, "grad_norm": 1.296875, "learning_rate": 0.00027046049477233013, "loss": 4.9791, "mean_token_accuracy": 0.2197417438030243, "num_tokens": 113762364.0, "step": 65580 }, { "entropy": 5.883121395111084, "epoch": 5.1027037541334375, "grad_norm": 1.5234375, "learning_rate": 0.0002704327848606488, "loss": 4.8434, "mean_token_accuracy": 0.22654048800468446, "num_tokens": 113771550.0, "step": 65585 }, { "entropy": 5.920892572402954, "epoch": 5.103092783505154, "grad_norm": 1.421875, "learning_rate": 0.0002704050750182677, "loss": 4.9036, "mean_token_accuracy": 0.22428347468376159, "num_tokens": 113779897.0, "step": 65590 }, { "entropy": 5.931081533432007, "epoch": 5.103481812876872, "grad_norm": 1.453125, "learning_rate": 0.00027037736524560717, "loss": 4.9312, "mean_token_accuracy": 0.21831361949443817, "num_tokens": 113788608.0, "step": 65595 }, { "entropy": 5.8857725143432615, "epoch": 5.10387084224859, "grad_norm": 1.5625, "learning_rate": 0.0002703496555430879, "loss": 4.8735, "mean_token_accuracy": 0.21328488886356353, "num_tokens": 113796624.0, "step": 65600 }, { "entropy": 5.964398384094238, "epoch": 5.104259871620307, "grad_norm": 1.4921875, "learning_rate": 0.00027032194591113015, "loss": 4.9452, "mean_token_accuracy": 0.2122003361582756, "num_tokens": 113805133.0, "step": 65605 }, { "entropy": 5.941225624084472, "epoch": 5.104648900992025, "grad_norm": 1.4140625, "learning_rate": 0.0002702942363501544, "loss": 4.9719, "mean_token_accuracy": 0.21329574435949325, "num_tokens": 113814305.0, "step": 65610 }, { "entropy": 5.909062099456787, "epoch": 5.105037930363743, "grad_norm": 1.4375, "learning_rate": 0.00027026652686058117, "loss": 4.8681, "mean_token_accuracy": 0.22504508644342422, "num_tokens": 113822958.0, "step": 65615 }, { "entropy": 6.011416482925415, "epoch": 5.1054269597354605, "grad_norm": 1.515625, "learning_rate": 0.00027023881744283083, "loss": 4.9521, "mean_token_accuracy": 0.21228974610567092, "num_tokens": 113831665.0, "step": 65620 }, { "entropy": 6.021967458724975, "epoch": 5.105815989107177, "grad_norm": 1.3984375, "learning_rate": 0.0002702111080973239, "loss": 5.067, "mean_token_accuracy": 0.20496160984039308, "num_tokens": 113840777.0, "step": 65625 }, { "entropy": 5.981190872192383, "epoch": 5.106205018478895, "grad_norm": 1.546875, "learning_rate": 0.0002701833988244808, "loss": 4.9606, "mean_token_accuracy": 0.21615783572196962, "num_tokens": 113849014.0, "step": 65630 }, { "entropy": 5.896233463287354, "epoch": 5.106594047850613, "grad_norm": 1.40625, "learning_rate": 0.00027015568962472175, "loss": 4.8405, "mean_token_accuracy": 0.22291838228702546, "num_tokens": 113857814.0, "step": 65635 }, { "entropy": 5.965276002883911, "epoch": 5.10698307722233, "grad_norm": 1.4609375, "learning_rate": 0.00027012798049846757, "loss": 4.9858, "mean_token_accuracy": 0.21384083330631257, "num_tokens": 113866400.0, "step": 65640 }, { "entropy": 5.945168590545654, "epoch": 5.107372106594048, "grad_norm": 1.5859375, "learning_rate": 0.0002701002714461385, "loss": 4.9492, "mean_token_accuracy": 0.21756862848997116, "num_tokens": 113874756.0, "step": 65645 }, { "entropy": 5.9400066375732425, "epoch": 5.107761135965766, "grad_norm": 1.4375, "learning_rate": 0.0002700725624681551, "loss": 4.9513, "mean_token_accuracy": 0.22223164588212968, "num_tokens": 113884172.0, "step": 65650 }, { "entropy": 5.973586368560791, "epoch": 5.108150165337483, "grad_norm": 1.5078125, "learning_rate": 0.00027004485356493763, "loss": 4.9753, "mean_token_accuracy": 0.21653239876031877, "num_tokens": 113892757.0, "step": 65655 }, { "entropy": 5.924812650680542, "epoch": 5.1085391947092, "grad_norm": 1.3671875, "learning_rate": 0.00027001714473690665, "loss": 4.9026, "mean_token_accuracy": 0.22634202986955643, "num_tokens": 113901907.0, "step": 65660 }, { "entropy": 5.9740862369537355, "epoch": 5.108928224080918, "grad_norm": 1.59375, "learning_rate": 0.00026998943598448256, "loss": 5.0069, "mean_token_accuracy": 0.21508377343416213, "num_tokens": 113910612.0, "step": 65665 }, { "entropy": 5.918333625793457, "epoch": 5.109317253452636, "grad_norm": 1.4296875, "learning_rate": 0.0002699617273080858, "loss": 4.9238, "mean_token_accuracy": 0.2196083128452301, "num_tokens": 113919586.0, "step": 65670 }, { "entropy": 5.940459823608398, "epoch": 5.109706282824353, "grad_norm": 1.46875, "learning_rate": 0.0002699340187081368, "loss": 4.8838, "mean_token_accuracy": 0.22644262462854386, "num_tokens": 113928775.0, "step": 65675 }, { "entropy": 5.939147520065307, "epoch": 5.110095312196071, "grad_norm": 1.4609375, "learning_rate": 0.000269906310185056, "loss": 5.0115, "mean_token_accuracy": 0.21672501862049104, "num_tokens": 113937300.0, "step": 65680 }, { "entropy": 6.055330276489258, "epoch": 5.110484341567789, "grad_norm": 1.375, "learning_rate": 0.00026987860173926387, "loss": 5.1075, "mean_token_accuracy": 0.20668116509914397, "num_tokens": 113946278.0, "step": 65685 }, { "entropy": 6.013170003890991, "epoch": 5.1108733709395056, "grad_norm": 1.5546875, "learning_rate": 0.00026985089337118077, "loss": 5.027, "mean_token_accuracy": 0.2097335323691368, "num_tokens": 113955212.0, "step": 65690 }, { "entropy": 5.9869029998779295, "epoch": 5.111262400311223, "grad_norm": 1.4765625, "learning_rate": 0.00026982318508122724, "loss": 5.0005, "mean_token_accuracy": 0.2259412080049515, "num_tokens": 113963938.0, "step": 65695 }, { "entropy": 5.995023632049561, "epoch": 5.111651429682941, "grad_norm": 1.484375, "learning_rate": 0.0002697954768698235, "loss": 5.0328, "mean_token_accuracy": 0.21452368497848512, "num_tokens": 113973002.0, "step": 65700 }, { "entropy": 5.944068670272827, "epoch": 5.112040459054659, "grad_norm": 1.4375, "learning_rate": 0.00026976776873739017, "loss": 4.9554, "mean_token_accuracy": 0.2166252017021179, "num_tokens": 113982955.0, "step": 65705 }, { "entropy": 5.953969287872314, "epoch": 5.112429488426376, "grad_norm": 1.40625, "learning_rate": 0.0002697400606843477, "loss": 4.9311, "mean_token_accuracy": 0.21803608238697053, "num_tokens": 113992221.0, "step": 65710 }, { "entropy": 5.988649082183838, "epoch": 5.112818517798094, "grad_norm": 1.4921875, "learning_rate": 0.00026971235271111636, "loss": 4.9556, "mean_token_accuracy": 0.22221828997135162, "num_tokens": 114000820.0, "step": 65715 }, { "entropy": 5.9143448829650875, "epoch": 5.113207547169812, "grad_norm": 1.375, "learning_rate": 0.00026968464481811667, "loss": 4.8699, "mean_token_accuracy": 0.22805819362401963, "num_tokens": 114010240.0, "step": 65720 }, { "entropy": 5.937300729751587, "epoch": 5.1135965765415285, "grad_norm": 1.515625, "learning_rate": 0.00026965693700576904, "loss": 4.8912, "mean_token_accuracy": 0.22713427394628524, "num_tokens": 114018201.0, "step": 65725 }, { "entropy": 5.950121355056763, "epoch": 5.113985605913246, "grad_norm": 1.453125, "learning_rate": 0.00026962922927449394, "loss": 4.9647, "mean_token_accuracy": 0.22225951105356218, "num_tokens": 114026407.0, "step": 65730 }, { "entropy": 5.94598388671875, "epoch": 5.114374635284964, "grad_norm": 1.515625, "learning_rate": 0.0002696015216247117, "loss": 4.9515, "mean_token_accuracy": 0.21666204631328584, "num_tokens": 114035202.0, "step": 65735 }, { "entropy": 5.900272607803345, "epoch": 5.114763664656682, "grad_norm": 1.484375, "learning_rate": 0.0002695738140568427, "loss": 4.9172, "mean_token_accuracy": 0.21945204436779023, "num_tokens": 114043631.0, "step": 65740 }, { "entropy": 5.9470654964447025, "epoch": 5.115152694028399, "grad_norm": 1.6171875, "learning_rate": 0.0002695461065713075, "loss": 4.8843, "mean_token_accuracy": 0.2226795420050621, "num_tokens": 114051784.0, "step": 65745 }, { "entropy": 5.939059782028198, "epoch": 5.115541723400117, "grad_norm": 1.53125, "learning_rate": 0.00026951839916852647, "loss": 4.9728, "mean_token_accuracy": 0.22155822664499283, "num_tokens": 114060391.0, "step": 65750 }, { "entropy": 5.879908704757691, "epoch": 5.115930752771834, "grad_norm": 1.53125, "learning_rate": 0.00026949069184892, "loss": 4.9363, "mean_token_accuracy": 0.21739491522312165, "num_tokens": 114068779.0, "step": 65755 }, { "entropy": 5.9142590999603275, "epoch": 5.1163197821435515, "grad_norm": 1.609375, "learning_rate": 0.00026946298461290845, "loss": 4.9364, "mean_token_accuracy": 0.2163964882493019, "num_tokens": 114077087.0, "step": 65760 }, { "entropy": 5.973569393157959, "epoch": 5.116708811515269, "grad_norm": 1.5078125, "learning_rate": 0.0002694352774609123, "loss": 4.917, "mean_token_accuracy": 0.22149318754673003, "num_tokens": 114085821.0, "step": 65765 }, { "entropy": 5.933302307128907, "epoch": 5.117097840886987, "grad_norm": 1.5859375, "learning_rate": 0.000269407570393352, "loss": 4.9792, "mean_token_accuracy": 0.21646054238080978, "num_tokens": 114094420.0, "step": 65770 }, { "entropy": 5.822155380249024, "epoch": 5.117486870258705, "grad_norm": 1.546875, "learning_rate": 0.000269379863410648, "loss": 4.8224, "mean_token_accuracy": 0.2276206612586975, "num_tokens": 114103332.0, "step": 65775 }, { "entropy": 5.972478246688842, "epoch": 5.117875899630422, "grad_norm": 1.4140625, "learning_rate": 0.0002693521565132205, "loss": 5.0057, "mean_token_accuracy": 0.2141551584005356, "num_tokens": 114111692.0, "step": 65780 }, { "entropy": 6.001748943328858, "epoch": 5.11826492900214, "grad_norm": 1.4765625, "learning_rate": 0.00026932444970149006, "loss": 4.9323, "mean_token_accuracy": 0.21393433660268785, "num_tokens": 114120740.0, "step": 65785 }, { "entropy": 5.956196737289429, "epoch": 5.118653958373857, "grad_norm": 1.5703125, "learning_rate": 0.0002692967429758771, "loss": 4.8795, "mean_token_accuracy": 0.2211485281586647, "num_tokens": 114129028.0, "step": 65790 }, { "entropy": 6.0029072761535645, "epoch": 5.1190429877455745, "grad_norm": 1.484375, "learning_rate": 0.00026926903633680193, "loss": 5.0216, "mean_token_accuracy": 0.2101919025182724, "num_tokens": 114137076.0, "step": 65795 }, { "entropy": 5.965333652496338, "epoch": 5.119432017117292, "grad_norm": 1.46875, "learning_rate": 0.00026924132978468505, "loss": 4.9965, "mean_token_accuracy": 0.21408455073833466, "num_tokens": 114145948.0, "step": 65800 }, { "entropy": 5.957700490951538, "epoch": 5.11982104648901, "grad_norm": 1.578125, "learning_rate": 0.00026921362331994684, "loss": 4.9327, "mean_token_accuracy": 0.226883402466774, "num_tokens": 114153690.0, "step": 65805 }, { "entropy": 5.888636064529419, "epoch": 5.120210075860728, "grad_norm": 1.4921875, "learning_rate": 0.00026918591694300776, "loss": 4.8868, "mean_token_accuracy": 0.2271373987197876, "num_tokens": 114162132.0, "step": 65810 }, { "entropy": 5.895900678634644, "epoch": 5.120599105232445, "grad_norm": 1.359375, "learning_rate": 0.00026915821065428804, "loss": 4.8972, "mean_token_accuracy": 0.22012446820735931, "num_tokens": 114172191.0, "step": 65815 }, { "entropy": 5.95011682510376, "epoch": 5.120988134604163, "grad_norm": 1.421875, "learning_rate": 0.0002691305044542082, "loss": 4.8138, "mean_token_accuracy": 0.22472718954086304, "num_tokens": 114180113.0, "step": 65820 }, { "entropy": 5.961768102645874, "epoch": 5.12137716397588, "grad_norm": 1.4140625, "learning_rate": 0.00026910279834318855, "loss": 4.8697, "mean_token_accuracy": 0.22429970204830169, "num_tokens": 114188354.0, "step": 65825 }, { "entropy": 5.9278017520904545, "epoch": 5.1217661933475975, "grad_norm": 1.5078125, "learning_rate": 0.00026907509232164964, "loss": 4.8544, "mean_token_accuracy": 0.2284561201930046, "num_tokens": 114197744.0, "step": 65830 }, { "entropy": 5.957499980926514, "epoch": 5.122155222719315, "grad_norm": 1.46875, "learning_rate": 0.00026904738639001163, "loss": 4.9235, "mean_token_accuracy": 0.22117093354463577, "num_tokens": 114206779.0, "step": 65835 }, { "entropy": 5.951617479324341, "epoch": 5.122544252091033, "grad_norm": 1.5234375, "learning_rate": 0.0002690196805486952, "loss": 5.056, "mean_token_accuracy": 0.204644513130188, "num_tokens": 114215737.0, "step": 65840 }, { "entropy": 5.918093061447143, "epoch": 5.122933281462751, "grad_norm": 1.546875, "learning_rate": 0.00026899197479812053, "loss": 4.935, "mean_token_accuracy": 0.222791950404644, "num_tokens": 114223686.0, "step": 65845 }, { "entropy": 5.985047245025635, "epoch": 5.123322310834468, "grad_norm": 1.515625, "learning_rate": 0.0002689642691387081, "loss": 4.9799, "mean_token_accuracy": 0.22100777477025985, "num_tokens": 114232562.0, "step": 65850 }, { "entropy": 5.9949455738067625, "epoch": 5.123711340206185, "grad_norm": 1.5625, "learning_rate": 0.00026893656357087833, "loss": 4.9554, "mean_token_accuracy": 0.2107866257429123, "num_tokens": 114240880.0, "step": 65855 }, { "entropy": 5.950732040405273, "epoch": 5.124100369577903, "grad_norm": 1.46875, "learning_rate": 0.0002689088580950515, "loss": 4.9151, "mean_token_accuracy": 0.22165625989437104, "num_tokens": 114249752.0, "step": 65860 }, { "entropy": 5.918896341323853, "epoch": 5.1244893989496205, "grad_norm": 1.40625, "learning_rate": 0.000268881152711648, "loss": 4.9838, "mean_token_accuracy": 0.2099757432937622, "num_tokens": 114258637.0, "step": 65865 }, { "entropy": 6.021253204345703, "epoch": 5.124878428321338, "grad_norm": 1.53125, "learning_rate": 0.0002688534474210884, "loss": 4.9461, "mean_token_accuracy": 0.21441469341516495, "num_tokens": 114266966.0, "step": 65870 }, { "entropy": 5.976773023605347, "epoch": 5.125267457693056, "grad_norm": 1.3828125, "learning_rate": 0.00026882574222379283, "loss": 4.9865, "mean_token_accuracy": 0.20911132395267487, "num_tokens": 114276268.0, "step": 65875 }, { "entropy": 5.992915105819702, "epoch": 5.125656487064774, "grad_norm": 1.5078125, "learning_rate": 0.00026879803712018187, "loss": 5.0585, "mean_token_accuracy": 0.21117571592330933, "num_tokens": 114284819.0, "step": 65880 }, { "entropy": 5.965303087234497, "epoch": 5.126045516436491, "grad_norm": 1.4296875, "learning_rate": 0.0002687703321106758, "loss": 4.9386, "mean_token_accuracy": 0.22038483917713164, "num_tokens": 114294184.0, "step": 65885 }, { "entropy": 6.015755605697632, "epoch": 5.126434545808208, "grad_norm": 1.5234375, "learning_rate": 0.0002687426271956951, "loss": 5.0141, "mean_token_accuracy": 0.2122604012489319, "num_tokens": 114302812.0, "step": 65890 }, { "entropy": 5.946567392349243, "epoch": 5.126823575179926, "grad_norm": 1.4765625, "learning_rate": 0.00026871492237566, "loss": 4.8991, "mean_token_accuracy": 0.22335785031318664, "num_tokens": 114312283.0, "step": 65895 }, { "entropy": 5.877245092391968, "epoch": 5.1272126045516435, "grad_norm": 1.53125, "learning_rate": 0.00026868721765099086, "loss": 4.8678, "mean_token_accuracy": 0.2288868635892868, "num_tokens": 114320488.0, "step": 65900 }, { "entropy": 5.90310754776001, "epoch": 5.127601633923361, "grad_norm": 1.4140625, "learning_rate": 0.0002686595130221082, "loss": 4.961, "mean_token_accuracy": 0.21879468858242035, "num_tokens": 114329097.0, "step": 65905 }, { "entropy": 5.903626728057861, "epoch": 5.127990663295079, "grad_norm": 1.5234375, "learning_rate": 0.00026863180848943244, "loss": 4.9478, "mean_token_accuracy": 0.21968848556280135, "num_tokens": 114338146.0, "step": 65910 }, { "entropy": 5.870364618301392, "epoch": 5.128379692666797, "grad_norm": 1.5078125, "learning_rate": 0.0002686041040533838, "loss": 4.9241, "mean_token_accuracy": 0.21870217174291612, "num_tokens": 114346563.0, "step": 65915 }, { "entropy": 5.961306858062744, "epoch": 5.128768722038514, "grad_norm": 1.6328125, "learning_rate": 0.0002685763997143827, "loss": 4.9981, "mean_token_accuracy": 0.21138186007738113, "num_tokens": 114355067.0, "step": 65920 }, { "entropy": 5.888578176498413, "epoch": 5.129157751410231, "grad_norm": 1.515625, "learning_rate": 0.00026854869547284947, "loss": 4.9322, "mean_token_accuracy": 0.22094670534133912, "num_tokens": 114363983.0, "step": 65925 }, { "entropy": 5.934127473831177, "epoch": 5.129546780781949, "grad_norm": 1.4609375, "learning_rate": 0.00026852099132920455, "loss": 4.8958, "mean_token_accuracy": 0.21835627853870393, "num_tokens": 114373515.0, "step": 65930 }, { "entropy": 5.954549789428711, "epoch": 5.1299358101536665, "grad_norm": 1.4921875, "learning_rate": 0.0002684932872838683, "loss": 4.9016, "mean_token_accuracy": 0.22577159702777863, "num_tokens": 114381732.0, "step": 65935 }, { "entropy": 5.928292608261108, "epoch": 5.130324839525384, "grad_norm": 1.4453125, "learning_rate": 0.000268465583337261, "loss": 4.9491, "mean_token_accuracy": 0.20849705189466478, "num_tokens": 114390450.0, "step": 65940 }, { "entropy": 6.0004151344299315, "epoch": 5.130713868897102, "grad_norm": 1.4375, "learning_rate": 0.0002684378794898031, "loss": 5.0769, "mean_token_accuracy": 0.2110137477517128, "num_tokens": 114399152.0, "step": 65945 }, { "entropy": 5.929229307174682, "epoch": 5.13110289826882, "grad_norm": 1.4921875, "learning_rate": 0.00026841017574191496, "loss": 4.9074, "mean_token_accuracy": 0.22128274738788606, "num_tokens": 114408489.0, "step": 65950 }, { "entropy": 6.003842067718506, "epoch": 5.131491927640537, "grad_norm": 1.46875, "learning_rate": 0.0002683824720940168, "loss": 5.0762, "mean_token_accuracy": 0.20456138253211975, "num_tokens": 114417360.0, "step": 65955 }, { "entropy": 5.975010061264038, "epoch": 5.131880957012254, "grad_norm": 1.515625, "learning_rate": 0.00026835476854652926, "loss": 4.9738, "mean_token_accuracy": 0.21312254667282104, "num_tokens": 114426036.0, "step": 65960 }, { "entropy": 5.924704837799072, "epoch": 5.132269986383972, "grad_norm": 1.4140625, "learning_rate": 0.0002683270650998724, "loss": 4.8584, "mean_token_accuracy": 0.2247190520167351, "num_tokens": 114434713.0, "step": 65965 }, { "entropy": 5.910692262649536, "epoch": 5.1326590157556895, "grad_norm": 1.4296875, "learning_rate": 0.0002682993617544667, "loss": 4.9172, "mean_token_accuracy": 0.21432085633277892, "num_tokens": 114442846.0, "step": 65970 }, { "entropy": 5.90911340713501, "epoch": 5.133048045127407, "grad_norm": 1.484375, "learning_rate": 0.0002682716585107326, "loss": 5.0087, "mean_token_accuracy": 0.20875125825405122, "num_tokens": 114451427.0, "step": 65975 }, { "entropy": 5.974067640304566, "epoch": 5.133437074499125, "grad_norm": 1.4921875, "learning_rate": 0.00026824395536909036, "loss": 5.0525, "mean_token_accuracy": 0.20319728553295135, "num_tokens": 114459962.0, "step": 65980 }, { "entropy": 5.967390012741089, "epoch": 5.133826103870843, "grad_norm": 1.46875, "learning_rate": 0.0002682162523299603, "loss": 4.9147, "mean_token_accuracy": 0.21885674446821213, "num_tokens": 114468197.0, "step": 65985 }, { "entropy": 6.011351013183594, "epoch": 5.134215133242559, "grad_norm": 1.421875, "learning_rate": 0.00026818854939376284, "loss": 5.0015, "mean_token_accuracy": 0.2033700242638588, "num_tokens": 114477274.0, "step": 65990 }, { "entropy": 5.9623270511627195, "epoch": 5.134604162614277, "grad_norm": 1.4921875, "learning_rate": 0.00026816084656091835, "loss": 4.962, "mean_token_accuracy": 0.2173716738820076, "num_tokens": 114485264.0, "step": 65995 }, { "entropy": 5.9447057247161865, "epoch": 5.134993191985995, "grad_norm": 1.6328125, "learning_rate": 0.00026813314383184714, "loss": 4.9443, "mean_token_accuracy": 0.22206167876720428, "num_tokens": 114494748.0, "step": 66000 }, { "epoch": 5.134993191985995, "eval_entropy": 5.642671900282007, "eval_loss": 5.057388782501221, "eval_mean_token_accuracy": 0.22136148332086633, "eval_num_tokens": 114494748.0, "eval_runtime": 21.6337, "eval_samples_per_second": 1920.982, "eval_steps_per_second": 240.134, "step": 66000 }, { "entropy": 5.968369817733764, "epoch": 5.1353822213577125, "grad_norm": 1.453125, "learning_rate": 0.00026810544120696943, "loss": 4.9733, "mean_token_accuracy": 0.22180901914834977, "num_tokens": 114503235.0, "step": 66005 }, { "entropy": 6.004914379119873, "epoch": 5.13577125072943, "grad_norm": 1.5234375, "learning_rate": 0.00026807773868670575, "loss": 4.9803, "mean_token_accuracy": 0.21408244967460632, "num_tokens": 114512352.0, "step": 66010 }, { "entropy": 6.001668405532837, "epoch": 5.136160280101148, "grad_norm": 1.4140625, "learning_rate": 0.0002680500362714764, "loss": 5.0024, "mean_token_accuracy": 0.21757737398147584, "num_tokens": 114521205.0, "step": 66015 }, { "entropy": 6.045230770111084, "epoch": 5.136549309472866, "grad_norm": 1.5546875, "learning_rate": 0.00026802233396170164, "loss": 5.069, "mean_token_accuracy": 0.2074189618229866, "num_tokens": 114529817.0, "step": 66020 }, { "entropy": 5.948325109481812, "epoch": 5.136938338844582, "grad_norm": 1.609375, "learning_rate": 0.0002679946317578018, "loss": 4.9945, "mean_token_accuracy": 0.21114526838064193, "num_tokens": 114538394.0, "step": 66025 }, { "entropy": 5.960832023620606, "epoch": 5.1373273682163, "grad_norm": 1.4921875, "learning_rate": 0.0002679669296601973, "loss": 5.0051, "mean_token_accuracy": 0.210135056078434, "num_tokens": 114547137.0, "step": 66030 }, { "entropy": 5.9174871921539305, "epoch": 5.137716397588018, "grad_norm": 1.515625, "learning_rate": 0.00026793922766930845, "loss": 4.9758, "mean_token_accuracy": 0.2211844205856323, "num_tokens": 114556633.0, "step": 66035 }, { "entropy": 5.956279850006103, "epoch": 5.1381054269597355, "grad_norm": 1.3203125, "learning_rate": 0.00026791152578555563, "loss": 4.9527, "mean_token_accuracy": 0.21473459154367447, "num_tokens": 114565982.0, "step": 66040 }, { "entropy": 5.864475393295288, "epoch": 5.138494456331453, "grad_norm": 1.5546875, "learning_rate": 0.00026788382400935913, "loss": 4.8049, "mean_token_accuracy": 0.22443415373563766, "num_tokens": 114574619.0, "step": 66045 }, { "entropy": 5.9222723007202145, "epoch": 5.138883485703171, "grad_norm": 1.5234375, "learning_rate": 0.0002678561223411392, "loss": 4.9555, "mean_token_accuracy": 0.21397764533758162, "num_tokens": 114582691.0, "step": 66050 }, { "entropy": 6.023573160171509, "epoch": 5.139272515074889, "grad_norm": 1.59375, "learning_rate": 0.0002678284207813163, "loss": 4.9764, "mean_token_accuracy": 0.2210636928677559, "num_tokens": 114591551.0, "step": 66055 }, { "entropy": 6.0088457584381105, "epoch": 5.139661544446605, "grad_norm": 1.640625, "learning_rate": 0.0002678007193303107, "loss": 5.0126, "mean_token_accuracy": 0.21663156002759934, "num_tokens": 114599874.0, "step": 66060 }, { "entropy": 5.958954000473023, "epoch": 5.140050573818323, "grad_norm": 1.5078125, "learning_rate": 0.0002677730179885427, "loss": 4.9339, "mean_token_accuracy": 0.21804394274950029, "num_tokens": 114608011.0, "step": 66065 }, { "entropy": 5.980318880081176, "epoch": 5.140439603190041, "grad_norm": 1.5625, "learning_rate": 0.00026774531675643267, "loss": 4.9909, "mean_token_accuracy": 0.22311275750398635, "num_tokens": 114615980.0, "step": 66070 }, { "entropy": 5.887480354309082, "epoch": 5.1408286325617585, "grad_norm": 1.4921875, "learning_rate": 0.0002677176156344009, "loss": 4.8976, "mean_token_accuracy": 0.22027385532855986, "num_tokens": 114624336.0, "step": 66075 }, { "entropy": 5.975999927520752, "epoch": 5.141217661933476, "grad_norm": 1.359375, "learning_rate": 0.0002676899146228678, "loss": 5.0531, "mean_token_accuracy": 0.21189430356025696, "num_tokens": 114633014.0, "step": 66080 }, { "entropy": 6.034994792938233, "epoch": 5.141606691305194, "grad_norm": 1.4453125, "learning_rate": 0.00026766221372225354, "loss": 5.0215, "mean_token_accuracy": 0.20964909344911575, "num_tokens": 114641562.0, "step": 66085 }, { "entropy": 5.998503541946411, "epoch": 5.141995720676911, "grad_norm": 1.4375, "learning_rate": 0.0002676345129329785, "loss": 4.9527, "mean_token_accuracy": 0.21356947720050812, "num_tokens": 114650688.0, "step": 66090 }, { "entropy": 6.000461912155151, "epoch": 5.142384750048628, "grad_norm": 1.5390625, "learning_rate": 0.00026760681225546296, "loss": 5.0109, "mean_token_accuracy": 0.20865440219640732, "num_tokens": 114658797.0, "step": 66095 }, { "entropy": 6.005948066711426, "epoch": 5.142773779420346, "grad_norm": 1.4921875, "learning_rate": 0.0002675791116901273, "loss": 4.9878, "mean_token_accuracy": 0.21546838581562042, "num_tokens": 114667777.0, "step": 66100 }, { "entropy": 6.003689241409302, "epoch": 5.143162808792064, "grad_norm": 1.5234375, "learning_rate": 0.0002675514112373918, "loss": 5.034, "mean_token_accuracy": 0.21209670305252076, "num_tokens": 114676523.0, "step": 66105 }, { "entropy": 6.002839279174805, "epoch": 5.1435518381637815, "grad_norm": 1.3984375, "learning_rate": 0.00026752371089767686, "loss": 4.9499, "mean_token_accuracy": 0.22065724283456803, "num_tokens": 114686121.0, "step": 66110 }, { "entropy": 5.91845817565918, "epoch": 5.143940867535499, "grad_norm": 1.5390625, "learning_rate": 0.0002674960106714026, "loss": 4.8742, "mean_token_accuracy": 0.22569520622491837, "num_tokens": 114694386.0, "step": 66115 }, { "entropy": 5.931867599487305, "epoch": 5.144329896907217, "grad_norm": 1.515625, "learning_rate": 0.00026746831055898953, "loss": 4.9281, "mean_token_accuracy": 0.21396079659461975, "num_tokens": 114702785.0, "step": 66120 }, { "entropy": 5.902122449874878, "epoch": 5.144718926278934, "grad_norm": 1.421875, "learning_rate": 0.0002674406105608578, "loss": 4.8365, "mean_token_accuracy": 0.22387531250715256, "num_tokens": 114711524.0, "step": 66125 }, { "entropy": 5.9908294677734375, "epoch": 5.145107955650651, "grad_norm": 1.6328125, "learning_rate": 0.0002674129106774278, "loss": 4.9276, "mean_token_accuracy": 0.2178006574511528, "num_tokens": 114719663.0, "step": 66130 }, { "entropy": 6.004221105575562, "epoch": 5.145496985022369, "grad_norm": 1.375, "learning_rate": 0.00026738521090911984, "loss": 4.9175, "mean_token_accuracy": 0.22079660296440123, "num_tokens": 114728913.0, "step": 66135 }, { "entropy": 5.920045709609985, "epoch": 5.145886014394087, "grad_norm": 1.375, "learning_rate": 0.0002673575112563541, "loss": 4.9179, "mean_token_accuracy": 0.22297706454992294, "num_tokens": 114738130.0, "step": 66140 }, { "entropy": 5.921075010299683, "epoch": 5.1462750437658045, "grad_norm": 1.5390625, "learning_rate": 0.000267329811719551, "loss": 4.9262, "mean_token_accuracy": 0.21572670638561248, "num_tokens": 114746893.0, "step": 66145 }, { "entropy": 5.969542646408081, "epoch": 5.146664073137522, "grad_norm": 1.4453125, "learning_rate": 0.0002673021122991308, "loss": 4.9218, "mean_token_accuracy": 0.2267557978630066, "num_tokens": 114755637.0, "step": 66150 }, { "entropy": 5.973942756652832, "epoch": 5.14705310250924, "grad_norm": 1.5078125, "learning_rate": 0.0002672744129955138, "loss": 4.8864, "mean_token_accuracy": 0.223860564827919, "num_tokens": 114764767.0, "step": 66155 }, { "entropy": 5.974945020675659, "epoch": 5.147442131880957, "grad_norm": 1.484375, "learning_rate": 0.0002672467138091204, "loss": 4.9486, "mean_token_accuracy": 0.21212176531553267, "num_tokens": 114773013.0, "step": 66160 }, { "entropy": 5.944044017791748, "epoch": 5.147831161252674, "grad_norm": 1.328125, "learning_rate": 0.0002672190147403705, "loss": 4.9637, "mean_token_accuracy": 0.21131613105535507, "num_tokens": 114782361.0, "step": 66165 }, { "entropy": 5.940251159667969, "epoch": 5.148220190624392, "grad_norm": 1.4453125, "learning_rate": 0.0002671913157896849, "loss": 4.8872, "mean_token_accuracy": 0.22422416657209396, "num_tokens": 114791425.0, "step": 66170 }, { "entropy": 5.942361688613891, "epoch": 5.14860921999611, "grad_norm": 1.4921875, "learning_rate": 0.00026716361695748353, "loss": 4.9168, "mean_token_accuracy": 0.21838788837194442, "num_tokens": 114800260.0, "step": 66175 }, { "entropy": 5.949578189849854, "epoch": 5.1489982493678275, "grad_norm": 1.53125, "learning_rate": 0.0002671359182441868, "loss": 4.9799, "mean_token_accuracy": 0.21003224998712539, "num_tokens": 114809035.0, "step": 66180 }, { "entropy": 5.97370171546936, "epoch": 5.149387278739545, "grad_norm": 1.4140625, "learning_rate": 0.00026710821965021507, "loss": 5.0371, "mean_token_accuracy": 0.21178975254297255, "num_tokens": 114817786.0, "step": 66185 }, { "entropy": 5.954459381103516, "epoch": 5.149776308111262, "grad_norm": 1.4765625, "learning_rate": 0.0002670805211759886, "loss": 4.9101, "mean_token_accuracy": 0.221334408223629, "num_tokens": 114826065.0, "step": 66190 }, { "entropy": 5.902453136444092, "epoch": 5.15016533748298, "grad_norm": 1.5078125, "learning_rate": 0.0002670528228219275, "loss": 4.9046, "mean_token_accuracy": 0.22179118990898133, "num_tokens": 114834337.0, "step": 66195 }, { "entropy": 5.993678426742553, "epoch": 5.150554366854697, "grad_norm": 1.5546875, "learning_rate": 0.00026702512458845224, "loss": 4.9555, "mean_token_accuracy": 0.22093888819217683, "num_tokens": 114843577.0, "step": 66200 }, { "entropy": 5.965053606033325, "epoch": 5.150943396226415, "grad_norm": 1.4296875, "learning_rate": 0.00026699742647598294, "loss": 5.0306, "mean_token_accuracy": 0.21614261567592621, "num_tokens": 114852288.0, "step": 66205 }, { "entropy": 6.00840311050415, "epoch": 5.151332425598133, "grad_norm": 1.546875, "learning_rate": 0.00026696972848494005, "loss": 4.9815, "mean_token_accuracy": 0.21348073631525039, "num_tokens": 114861163.0, "step": 66210 }, { "entropy": 5.90447998046875, "epoch": 5.1517214549698505, "grad_norm": 1.546875, "learning_rate": 0.00026694203061574366, "loss": 4.9644, "mean_token_accuracy": 0.2179018273949623, "num_tokens": 114869665.0, "step": 66215 }, { "entropy": 5.8574096202850345, "epoch": 5.152110484341568, "grad_norm": 1.46875, "learning_rate": 0.00026691433286881415, "loss": 4.8202, "mean_token_accuracy": 0.22898027747869493, "num_tokens": 114878296.0, "step": 66220 }, { "entropy": 5.891721630096436, "epoch": 5.152499513713285, "grad_norm": 1.5390625, "learning_rate": 0.0002668866352445718, "loss": 4.9154, "mean_token_accuracy": 0.22308670729398727, "num_tokens": 114886879.0, "step": 66225 }, { "entropy": 6.043492031097412, "epoch": 5.152888543085003, "grad_norm": 1.5390625, "learning_rate": 0.0002668589377434368, "loss": 5.0402, "mean_token_accuracy": 0.21238311529159545, "num_tokens": 114894831.0, "step": 66230 }, { "entropy": 5.935453176498413, "epoch": 5.15327757245672, "grad_norm": 1.53125, "learning_rate": 0.0002668312403658295, "loss": 4.9086, "mean_token_accuracy": 0.21476451754570008, "num_tokens": 114903648.0, "step": 66235 }, { "entropy": 5.983807754516602, "epoch": 5.153666601828438, "grad_norm": 1.4140625, "learning_rate": 0.00026680354311217006, "loss": 4.9493, "mean_token_accuracy": 0.22308097183704376, "num_tokens": 114912207.0, "step": 66240 }, { "entropy": 5.9431437969207765, "epoch": 5.154055631200156, "grad_norm": 1.5, "learning_rate": 0.00026677584598287893, "loss": 4.9012, "mean_token_accuracy": 0.22648254483938218, "num_tokens": 114921326.0, "step": 66245 }, { "entropy": 5.889452695846558, "epoch": 5.1544446605718734, "grad_norm": 1.46875, "learning_rate": 0.00026674814897837616, "loss": 4.8748, "mean_token_accuracy": 0.2186141535639763, "num_tokens": 114929415.0, "step": 66250 }, { "entropy": 5.967493057250977, "epoch": 5.154833689943591, "grad_norm": 1.5234375, "learning_rate": 0.00026672045209908215, "loss": 4.9648, "mean_token_accuracy": 0.21868237406015395, "num_tokens": 114939277.0, "step": 66255 }, { "entropy": 5.990393829345703, "epoch": 5.155222719315308, "grad_norm": 1.5, "learning_rate": 0.00026669275534541703, "loss": 4.9645, "mean_token_accuracy": 0.2190350756049156, "num_tokens": 114948241.0, "step": 66260 }, { "entropy": 5.941273260116577, "epoch": 5.155611748687026, "grad_norm": 1.4296875, "learning_rate": 0.00026666505871780115, "loss": 4.9255, "mean_token_accuracy": 0.21823175996541977, "num_tokens": 114956792.0, "step": 66265 }, { "entropy": 5.982630586624145, "epoch": 5.156000778058743, "grad_norm": 1.359375, "learning_rate": 0.0002666373622166548, "loss": 5.0553, "mean_token_accuracy": 0.20897439867258072, "num_tokens": 114966032.0, "step": 66270 }, { "entropy": 5.945557594299316, "epoch": 5.156389807430461, "grad_norm": 1.46875, "learning_rate": 0.00026660966584239815, "loss": 4.8896, "mean_token_accuracy": 0.21634197980165482, "num_tokens": 114974321.0, "step": 66275 }, { "entropy": 6.0597845077514645, "epoch": 5.156778836802179, "grad_norm": 1.5625, "learning_rate": 0.00026658196959545145, "loss": 5.0644, "mean_token_accuracy": 0.2095256567001343, "num_tokens": 114982326.0, "step": 66280 }, { "entropy": 6.006787109375, "epoch": 5.157167866173896, "grad_norm": 1.53125, "learning_rate": 0.00026655427347623494, "loss": 5.0487, "mean_token_accuracy": 0.21075440496206282, "num_tokens": 114992277.0, "step": 66285 }, { "entropy": 5.962014293670654, "epoch": 5.157556895545614, "grad_norm": 1.453125, "learning_rate": 0.0002665265774851689, "loss": 4.9257, "mean_token_accuracy": 0.22361376881599426, "num_tokens": 115000612.0, "step": 66290 }, { "entropy": 5.879933023452759, "epoch": 5.157945924917331, "grad_norm": 1.4765625, "learning_rate": 0.00026649888162267357, "loss": 4.7969, "mean_token_accuracy": 0.22443905770778655, "num_tokens": 115009538.0, "step": 66295 }, { "entropy": 5.986502265930175, "epoch": 5.158334954289049, "grad_norm": 1.6328125, "learning_rate": 0.0002664711858891691, "loss": 4.9388, "mean_token_accuracy": 0.21941001564264298, "num_tokens": 115017632.0, "step": 66300 }, { "entropy": 6.039589691162109, "epoch": 5.158723983660766, "grad_norm": 1.4375, "learning_rate": 0.0002664434902850759, "loss": 5.0791, "mean_token_accuracy": 0.21063016057014466, "num_tokens": 115027333.0, "step": 66305 }, { "entropy": 5.994335412979126, "epoch": 5.159113013032484, "grad_norm": 1.53125, "learning_rate": 0.00026641579481081405, "loss": 4.9736, "mean_token_accuracy": 0.21265549957752228, "num_tokens": 115035466.0, "step": 66310 }, { "entropy": 5.900611448287964, "epoch": 5.159502042404202, "grad_norm": 1.53125, "learning_rate": 0.00026638809946680393, "loss": 4.851, "mean_token_accuracy": 0.22301319390535354, "num_tokens": 115043998.0, "step": 66315 }, { "entropy": 5.964009428024292, "epoch": 5.159891071775919, "grad_norm": 1.453125, "learning_rate": 0.00026636040425346565, "loss": 4.9612, "mean_token_accuracy": 0.21696593165397643, "num_tokens": 115053445.0, "step": 66320 }, { "entropy": 5.9875139713287355, "epoch": 5.160280101147636, "grad_norm": 1.46875, "learning_rate": 0.0002663327091712195, "loss": 4.9783, "mean_token_accuracy": 0.2124479591846466, "num_tokens": 115061633.0, "step": 66325 }, { "entropy": 6.001373624801635, "epoch": 5.160669130519354, "grad_norm": 1.546875, "learning_rate": 0.0002663050142204856, "loss": 4.9744, "mean_token_accuracy": 0.22460308969020842, "num_tokens": 115070276.0, "step": 66330 }, { "entropy": 5.934246492385864, "epoch": 5.161058159891072, "grad_norm": 1.546875, "learning_rate": 0.00026627731940168445, "loss": 4.9431, "mean_token_accuracy": 0.2148566871881485, "num_tokens": 115078765.0, "step": 66335 }, { "entropy": 5.934921216964722, "epoch": 5.161447189262789, "grad_norm": 1.46875, "learning_rate": 0.00026624962471523595, "loss": 4.8893, "mean_token_accuracy": 0.22312661558389663, "num_tokens": 115087609.0, "step": 66340 }, { "entropy": 5.9245726585388185, "epoch": 5.161836218634507, "grad_norm": 1.390625, "learning_rate": 0.00026622193016156054, "loss": 4.9165, "mean_token_accuracy": 0.22077118009328842, "num_tokens": 115096323.0, "step": 66345 }, { "entropy": 5.99429669380188, "epoch": 5.162225248006225, "grad_norm": 1.5, "learning_rate": 0.0002661942357410784, "loss": 5.0314, "mean_token_accuracy": 0.2137010246515274, "num_tokens": 115104566.0, "step": 66350 }, { "entropy": 5.992999935150147, "epoch": 5.162614277377942, "grad_norm": 1.421875, "learning_rate": 0.0002661665414542097, "loss": 4.9832, "mean_token_accuracy": 0.21974223703145981, "num_tokens": 115112712.0, "step": 66355 }, { "entropy": 5.928037023544311, "epoch": 5.163003306749659, "grad_norm": 1.3828125, "learning_rate": 0.00026613884730137454, "loss": 4.8543, "mean_token_accuracy": 0.22582966238260269, "num_tokens": 115121071.0, "step": 66360 }, { "entropy": 5.997103357315064, "epoch": 5.163392336121377, "grad_norm": 1.5546875, "learning_rate": 0.0002661111532829933, "loss": 5.0372, "mean_token_accuracy": 0.2067706525325775, "num_tokens": 115130042.0, "step": 66365 }, { "entropy": 5.929024505615234, "epoch": 5.163781365493095, "grad_norm": 1.5234375, "learning_rate": 0.00026608345939948625, "loss": 4.8943, "mean_token_accuracy": 0.2258744165301323, "num_tokens": 115138446.0, "step": 66370 }, { "entropy": 5.903096771240234, "epoch": 5.164170394864812, "grad_norm": 1.4453125, "learning_rate": 0.0002660557656512734, "loss": 4.9235, "mean_token_accuracy": 0.21583758294582367, "num_tokens": 115147764.0, "step": 66375 }, { "entropy": 5.983061647415161, "epoch": 5.16455942423653, "grad_norm": 1.484375, "learning_rate": 0.00026602807203877525, "loss": 4.9855, "mean_token_accuracy": 0.2136365666985512, "num_tokens": 115156147.0, "step": 66380 }, { "entropy": 5.969338750839233, "epoch": 5.164948453608248, "grad_norm": 1.484375, "learning_rate": 0.00026600037856241174, "loss": 4.9208, "mean_token_accuracy": 0.22514802366495132, "num_tokens": 115164319.0, "step": 66385 }, { "entropy": 5.956699800491333, "epoch": 5.1653374829799645, "grad_norm": 1.5078125, "learning_rate": 0.00026597268522260317, "loss": 4.9856, "mean_token_accuracy": 0.20743007957935333, "num_tokens": 115172985.0, "step": 66390 }, { "entropy": 5.916711664199829, "epoch": 5.165726512351682, "grad_norm": 1.5, "learning_rate": 0.00026594499201976966, "loss": 4.9324, "mean_token_accuracy": 0.21323742419481279, "num_tokens": 115181551.0, "step": 66395 }, { "entropy": 5.979283571243286, "epoch": 5.1661155417234, "grad_norm": 1.53125, "learning_rate": 0.00026591729895433157, "loss": 4.9441, "mean_token_accuracy": 0.21716931015253066, "num_tokens": 115190170.0, "step": 66400 }, { "entropy": 5.942608165740967, "epoch": 5.166504571095118, "grad_norm": 1.5078125, "learning_rate": 0.00026588960602670896, "loss": 4.9132, "mean_token_accuracy": 0.22490473389625548, "num_tokens": 115198565.0, "step": 66405 }, { "entropy": 5.984029722213745, "epoch": 5.166893600466835, "grad_norm": 1.5234375, "learning_rate": 0.00026586191323732213, "loss": 5.0166, "mean_token_accuracy": 0.2181270092725754, "num_tokens": 115206741.0, "step": 66410 }, { "entropy": 5.8804222583770756, "epoch": 5.167282629838553, "grad_norm": 1.46875, "learning_rate": 0.0002658342205865912, "loss": 4.8843, "mean_token_accuracy": 0.22230149656534196, "num_tokens": 115215301.0, "step": 66415 }, { "entropy": 5.918810129165649, "epoch": 5.167671659210271, "grad_norm": 1.6953125, "learning_rate": 0.0002658065280749363, "loss": 4.8568, "mean_token_accuracy": 0.22524704337120055, "num_tokens": 115223749.0, "step": 66420 }, { "entropy": 5.864546155929565, "epoch": 5.1680606885819875, "grad_norm": 1.4609375, "learning_rate": 0.00026577883570277786, "loss": 4.8139, "mean_token_accuracy": 0.22768890857696533, "num_tokens": 115233161.0, "step": 66425 }, { "entropy": 5.936381530761719, "epoch": 5.168449717953705, "grad_norm": 1.6015625, "learning_rate": 0.00026575114347053574, "loss": 4.8872, "mean_token_accuracy": 0.22647102326154708, "num_tokens": 115241063.0, "step": 66430 }, { "entropy": 5.910263156890869, "epoch": 5.168838747325423, "grad_norm": 1.4921875, "learning_rate": 0.0002657234513786304, "loss": 4.8631, "mean_token_accuracy": 0.21983306854963303, "num_tokens": 115249387.0, "step": 66435 }, { "entropy": 5.970818948745728, "epoch": 5.169227776697141, "grad_norm": 1.421875, "learning_rate": 0.0002656957594274819, "loss": 5.0335, "mean_token_accuracy": 0.20826046615839006, "num_tokens": 115258222.0, "step": 66440 }, { "entropy": 5.949391412734985, "epoch": 5.169616806068858, "grad_norm": 1.4765625, "learning_rate": 0.00026566806761751043, "loss": 4.8983, "mean_token_accuracy": 0.22223554104566573, "num_tokens": 115266807.0, "step": 66445 }, { "entropy": 5.890896129608154, "epoch": 5.170005835440576, "grad_norm": 1.5, "learning_rate": 0.0002656403759491362, "loss": 4.7957, "mean_token_accuracy": 0.228914475440979, "num_tokens": 115274914.0, "step": 66450 }, { "entropy": 5.903735256195068, "epoch": 5.170394864812294, "grad_norm": 1.453125, "learning_rate": 0.0002656126844227794, "loss": 4.9259, "mean_token_accuracy": 0.2184283271431923, "num_tokens": 115283836.0, "step": 66455 }, { "entropy": 5.958111572265625, "epoch": 5.1707838941840105, "grad_norm": 1.4765625, "learning_rate": 0.00026558499303886015, "loss": 4.9936, "mean_token_accuracy": 0.21513524204492568, "num_tokens": 115292684.0, "step": 66460 }, { "entropy": 5.957755994796753, "epoch": 5.171172923555728, "grad_norm": 1.40625, "learning_rate": 0.00026555730179779864, "loss": 5.0027, "mean_token_accuracy": 0.21319006234407425, "num_tokens": 115301219.0, "step": 66465 }, { "entropy": 6.019247007369995, "epoch": 5.171561952927446, "grad_norm": 1.546875, "learning_rate": 0.000265529610700015, "loss": 4.932, "mean_token_accuracy": 0.22019873261451722, "num_tokens": 115310250.0, "step": 66470 }, { "entropy": 5.988768672943115, "epoch": 5.171950982299164, "grad_norm": 1.4375, "learning_rate": 0.0002655019197459295, "loss": 4.9117, "mean_token_accuracy": 0.23307146430015563, "num_tokens": 115318970.0, "step": 66475 }, { "entropy": 5.962932443618774, "epoch": 5.172340011670881, "grad_norm": 1.4765625, "learning_rate": 0.00026547422893596223, "loss": 5.0213, "mean_token_accuracy": 0.21874122321605682, "num_tokens": 115327380.0, "step": 66480 }, { "entropy": 5.93153223991394, "epoch": 5.172729041042599, "grad_norm": 1.5234375, "learning_rate": 0.00026544653827053336, "loss": 4.9503, "mean_token_accuracy": 0.21946187764406205, "num_tokens": 115335285.0, "step": 66485 }, { "entropy": 6.002415895462036, "epoch": 5.173118070414317, "grad_norm": 1.4765625, "learning_rate": 0.0002654188477500631, "loss": 5.0273, "mean_token_accuracy": 0.21890933364629744, "num_tokens": 115344562.0, "step": 66490 }, { "entropy": 6.005094003677368, "epoch": 5.1735070997860335, "grad_norm": 1.578125, "learning_rate": 0.0002653911573749715, "loss": 4.9469, "mean_token_accuracy": 0.21747490018606186, "num_tokens": 115352555.0, "step": 66495 }, { "entropy": 5.9982678413391115, "epoch": 5.173896129157751, "grad_norm": 1.75, "learning_rate": 0.00026536346714567887, "loss": 4.9391, "mean_token_accuracy": 0.2261232078075409, "num_tokens": 115361043.0, "step": 66500 }, { "entropy": 5.971865797042847, "epoch": 5.174285158529469, "grad_norm": 1.4375, "learning_rate": 0.00026533577706260524, "loss": 4.9765, "mean_token_accuracy": 0.2178919404745102, "num_tokens": 115369736.0, "step": 66505 }, { "entropy": 5.909951639175415, "epoch": 5.174674187901187, "grad_norm": 1.4296875, "learning_rate": 0.0002653080871261709, "loss": 4.9098, "mean_token_accuracy": 0.22167007029056549, "num_tokens": 115378520.0, "step": 66510 }, { "entropy": 5.97301173210144, "epoch": 5.175063217272904, "grad_norm": 1.5078125, "learning_rate": 0.0002652803973367958, "loss": 4.9931, "mean_token_accuracy": 0.2126220941543579, "num_tokens": 115387307.0, "step": 66515 }, { "entropy": 5.907970905303955, "epoch": 5.175452246644622, "grad_norm": 1.4296875, "learning_rate": 0.00026525270769490024, "loss": 4.9157, "mean_token_accuracy": 0.2151072606444359, "num_tokens": 115396422.0, "step": 66520 }, { "entropy": 5.90191683769226, "epoch": 5.175841276016339, "grad_norm": 1.515625, "learning_rate": 0.00026522501820090433, "loss": 4.9444, "mean_token_accuracy": 0.22937846332788467, "num_tokens": 115405779.0, "step": 66525 }, { "entropy": 6.033365058898926, "epoch": 5.1762303053880565, "grad_norm": 1.6171875, "learning_rate": 0.00026519732885522826, "loss": 5.0013, "mean_token_accuracy": 0.21341147720813752, "num_tokens": 115414300.0, "step": 66530 }, { "entropy": 5.9769867897033695, "epoch": 5.176619334759774, "grad_norm": 1.546875, "learning_rate": 0.00026516963965829204, "loss": 4.8795, "mean_token_accuracy": 0.22244765609502792, "num_tokens": 115422499.0, "step": 66535 }, { "entropy": 5.994920921325684, "epoch": 5.177008364131492, "grad_norm": 1.40625, "learning_rate": 0.000265141950610516, "loss": 5.03, "mean_token_accuracy": 0.21086086481809616, "num_tokens": 115431478.0, "step": 66540 }, { "entropy": 5.874392890930176, "epoch": 5.17739739350321, "grad_norm": 1.4765625, "learning_rate": 0.0002651142617123201, "loss": 4.8658, "mean_token_accuracy": 0.22605574429035186, "num_tokens": 115439963.0, "step": 66545 }, { "entropy": 5.915239953994751, "epoch": 5.177786422874927, "grad_norm": 1.625, "learning_rate": 0.0002650865729641246, "loss": 4.9294, "mean_token_accuracy": 0.21355801075696945, "num_tokens": 115448452.0, "step": 66550 }, { "entropy": 5.96868405342102, "epoch": 5.178175452246645, "grad_norm": 1.5, "learning_rate": 0.0002650588843663495, "loss": 5.0023, "mean_token_accuracy": 0.2224422886967659, "num_tokens": 115457506.0, "step": 66555 }, { "entropy": 5.931577968597412, "epoch": 5.178564481618362, "grad_norm": 1.4375, "learning_rate": 0.000265031195919415, "loss": 4.9147, "mean_token_accuracy": 0.2216121658682823, "num_tokens": 115465736.0, "step": 66560 }, { "entropy": 5.938823175430298, "epoch": 5.1789535109900795, "grad_norm": 1.515625, "learning_rate": 0.00026500350762374115, "loss": 4.9411, "mean_token_accuracy": 0.21767596900463104, "num_tokens": 115474699.0, "step": 66565 }, { "entropy": 5.9521890640258786, "epoch": 5.179342540361797, "grad_norm": 1.4453125, "learning_rate": 0.00026497581947974836, "loss": 4.9249, "mean_token_accuracy": 0.2129475235939026, "num_tokens": 115483321.0, "step": 66570 }, { "entropy": 6.012880182266235, "epoch": 5.179731569733515, "grad_norm": 1.4375, "learning_rate": 0.00026494813148785645, "loss": 4.9825, "mean_token_accuracy": 0.213930843770504, "num_tokens": 115492082.0, "step": 66575 }, { "entropy": 5.938001394271851, "epoch": 5.180120599105233, "grad_norm": 1.5546875, "learning_rate": 0.00026492044364848566, "loss": 4.8916, "mean_token_accuracy": 0.22605274617671967, "num_tokens": 115500084.0, "step": 66580 }, { "entropy": 5.878219747543335, "epoch": 5.18050962847695, "grad_norm": 1.4609375, "learning_rate": 0.0002648927559620561, "loss": 4.8823, "mean_token_accuracy": 0.22185494750738144, "num_tokens": 115508289.0, "step": 66585 }, { "entropy": 5.9562476634979244, "epoch": 5.180898657848668, "grad_norm": 1.4453125, "learning_rate": 0.0002648650684289879, "loss": 5.0076, "mean_token_accuracy": 0.21302755922079086, "num_tokens": 115517227.0, "step": 66590 }, { "entropy": 5.9779986381530765, "epoch": 5.181287687220385, "grad_norm": 1.34375, "learning_rate": 0.0002648373810497011, "loss": 5.0034, "mean_token_accuracy": 0.21729738563299178, "num_tokens": 115526084.0, "step": 66595 }, { "entropy": 5.943472671508789, "epoch": 5.1816767165921025, "grad_norm": 1.453125, "learning_rate": 0.0002648096938246159, "loss": 4.9284, "mean_token_accuracy": 0.21740686893463135, "num_tokens": 115534595.0, "step": 66600 }, { "entropy": 5.934382677078247, "epoch": 5.18206574596382, "grad_norm": 1.625, "learning_rate": 0.0002647820067541524, "loss": 4.9009, "mean_token_accuracy": 0.22420788407325745, "num_tokens": 115543005.0, "step": 66605 }, { "entropy": 5.9620753765106205, "epoch": 5.182454775335538, "grad_norm": 1.4140625, "learning_rate": 0.00026475431983873066, "loss": 4.9362, "mean_token_accuracy": 0.2201591983437538, "num_tokens": 115551992.0, "step": 66610 }, { "entropy": 6.005690717697144, "epoch": 5.182843804707256, "grad_norm": 1.421875, "learning_rate": 0.0002647266330787708, "loss": 4.9631, "mean_token_accuracy": 0.2171798378229141, "num_tokens": 115560769.0, "step": 66615 }, { "entropy": 5.949775075912475, "epoch": 5.183232834078973, "grad_norm": 1.453125, "learning_rate": 0.00026469894647469295, "loss": 4.9726, "mean_token_accuracy": 0.20849032551050187, "num_tokens": 115569984.0, "step": 66620 }, { "entropy": 5.980661106109619, "epoch": 5.183621863450691, "grad_norm": 1.7265625, "learning_rate": 0.0002646712600269172, "loss": 5.0167, "mean_token_accuracy": 0.21600945591926574, "num_tokens": 115578757.0, "step": 66625 }, { "entropy": 5.983853578567505, "epoch": 5.184010892822408, "grad_norm": 1.546875, "learning_rate": 0.0002646435737358635, "loss": 4.9634, "mean_token_accuracy": 0.22297757714986802, "num_tokens": 115587234.0, "step": 66630 }, { "entropy": 5.9093116283416744, "epoch": 5.1843999221941255, "grad_norm": 1.578125, "learning_rate": 0.0002646158876019522, "loss": 4.8772, "mean_token_accuracy": 0.22673479169607164, "num_tokens": 115596045.0, "step": 66635 }, { "entropy": 5.9347052574157715, "epoch": 5.184788951565843, "grad_norm": 1.5703125, "learning_rate": 0.0002645882016256033, "loss": 4.8892, "mean_token_accuracy": 0.2210402637720108, "num_tokens": 115604579.0, "step": 66640 }, { "entropy": 5.991714572906494, "epoch": 5.185177980937561, "grad_norm": 1.5, "learning_rate": 0.0002645605158072368, "loss": 4.9259, "mean_token_accuracy": 0.21870239675045014, "num_tokens": 115613084.0, "step": 66645 }, { "entropy": 6.024325180053711, "epoch": 5.185567010309279, "grad_norm": 1.4765625, "learning_rate": 0.000264532830147273, "loss": 4.98, "mean_token_accuracy": 0.22079526036977767, "num_tokens": 115622166.0, "step": 66650 }, { "entropy": 5.897892475128174, "epoch": 5.185956039680996, "grad_norm": 1.4921875, "learning_rate": 0.00026450514464613177, "loss": 4.8619, "mean_token_accuracy": 0.2215588942170143, "num_tokens": 115630196.0, "step": 66655 }, { "entropy": 5.948202133178711, "epoch": 5.186345069052713, "grad_norm": 1.609375, "learning_rate": 0.0002644774593042332, "loss": 4.9524, "mean_token_accuracy": 0.21815174221992492, "num_tokens": 115638116.0, "step": 66660 }, { "entropy": 5.8935283660888675, "epoch": 5.186734098424431, "grad_norm": 1.453125, "learning_rate": 0.0002644497741219975, "loss": 4.9087, "mean_token_accuracy": 0.22061051577329635, "num_tokens": 115647172.0, "step": 66665 }, { "entropy": 6.000073766708374, "epoch": 5.1871231277961485, "grad_norm": 1.4453125, "learning_rate": 0.0002644220890998447, "loss": 5.0106, "mean_token_accuracy": 0.21943570524454117, "num_tokens": 115657129.0, "step": 66670 }, { "entropy": 5.980986881256103, "epoch": 5.187512157167866, "grad_norm": 1.4609375, "learning_rate": 0.00026439440423819483, "loss": 4.8837, "mean_token_accuracy": 0.22461167275905608, "num_tokens": 115665933.0, "step": 66675 }, { "entropy": 6.0121807098388675, "epoch": 5.187901186539584, "grad_norm": 1.6015625, "learning_rate": 0.000264366719537468, "loss": 4.9767, "mean_token_accuracy": 0.2183927997946739, "num_tokens": 115674433.0, "step": 66680 }, { "entropy": 5.976059913635254, "epoch": 5.188290215911302, "grad_norm": 1.4140625, "learning_rate": 0.0002643390349980843, "loss": 5.0432, "mean_token_accuracy": 0.20859669297933578, "num_tokens": 115683251.0, "step": 66685 }, { "entropy": 5.90155725479126, "epoch": 5.188679245283019, "grad_norm": 1.4375, "learning_rate": 0.0002643113506204637, "loss": 4.9292, "mean_token_accuracy": 0.2196235477924347, "num_tokens": 115692257.0, "step": 66690 }, { "entropy": 5.943556261062622, "epoch": 5.189068274654736, "grad_norm": 1.625, "learning_rate": 0.0002642836664050263, "loss": 4.907, "mean_token_accuracy": 0.22124728113412856, "num_tokens": 115700624.0, "step": 66695 }, { "entropy": 5.924200105667114, "epoch": 5.189457304026454, "grad_norm": 1.4453125, "learning_rate": 0.00026425598235219235, "loss": 4.917, "mean_token_accuracy": 0.22173608988523483, "num_tokens": 115709456.0, "step": 66700 }, { "entropy": 5.947666215896606, "epoch": 5.1898463333981715, "grad_norm": 1.4453125, "learning_rate": 0.00026422829846238174, "loss": 4.9194, "mean_token_accuracy": 0.21792084723711014, "num_tokens": 115718771.0, "step": 66705 }, { "entropy": 6.025786542892456, "epoch": 5.190235362769889, "grad_norm": 1.4453125, "learning_rate": 0.00026420061473601445, "loss": 5.034, "mean_token_accuracy": 0.20923073291778566, "num_tokens": 115727826.0, "step": 66710 }, { "entropy": 6.003018808364868, "epoch": 5.190624392141607, "grad_norm": 1.4609375, "learning_rate": 0.00026417293117351077, "loss": 5.0249, "mean_token_accuracy": 0.21205544471740723, "num_tokens": 115736125.0, "step": 66715 }, { "entropy": 6.007673025131226, "epoch": 5.191013421513325, "grad_norm": 1.34375, "learning_rate": 0.00026414524777529055, "loss": 4.9824, "mean_token_accuracy": 0.21497223675251007, "num_tokens": 115744038.0, "step": 66720 }, { "entropy": 5.9365119457244875, "epoch": 5.191402450885041, "grad_norm": 1.4453125, "learning_rate": 0.0002641175645417739, "loss": 4.9322, "mean_token_accuracy": 0.21846683472394943, "num_tokens": 115753036.0, "step": 66725 }, { "entropy": 5.916239786148071, "epoch": 5.191791480256759, "grad_norm": 1.3984375, "learning_rate": 0.000264089881473381, "loss": 4.8867, "mean_token_accuracy": 0.22359254211187363, "num_tokens": 115762145.0, "step": 66730 }, { "entropy": 5.972447347640991, "epoch": 5.192180509628477, "grad_norm": 1.6171875, "learning_rate": 0.0002640621985705318, "loss": 5.0164, "mean_token_accuracy": 0.21508548706769942, "num_tokens": 115770799.0, "step": 66735 }, { "entropy": 5.975220441818237, "epoch": 5.1925695390001945, "grad_norm": 1.578125, "learning_rate": 0.00026403451583364616, "loss": 4.9503, "mean_token_accuracy": 0.21522020399570466, "num_tokens": 115778652.0, "step": 66740 }, { "entropy": 5.938592386245728, "epoch": 5.192958568371912, "grad_norm": 1.5390625, "learning_rate": 0.0002640068332631444, "loss": 4.8952, "mean_token_accuracy": 0.2193417564034462, "num_tokens": 115787262.0, "step": 66745 }, { "entropy": 6.007817554473877, "epoch": 5.19334759774363, "grad_norm": 1.4765625, "learning_rate": 0.0002639791508594464, "loss": 5.0097, "mean_token_accuracy": 0.21527755111455918, "num_tokens": 115795622.0, "step": 66750 }, { "entropy": 5.9245460510253904, "epoch": 5.193736627115348, "grad_norm": 1.4921875, "learning_rate": 0.00026395146862297225, "loss": 4.894, "mean_token_accuracy": 0.22461221218109131, "num_tokens": 115804107.0, "step": 66755 }, { "entropy": 5.955900716781616, "epoch": 5.194125656487064, "grad_norm": 1.5234375, "learning_rate": 0.000263923786554142, "loss": 4.9413, "mean_token_accuracy": 0.2210921064019203, "num_tokens": 115812442.0, "step": 66760 }, { "entropy": 5.989454317092895, "epoch": 5.194514685858782, "grad_norm": 1.578125, "learning_rate": 0.0002638961046533756, "loss": 4.9828, "mean_token_accuracy": 0.21563769429922103, "num_tokens": 115820296.0, "step": 66765 }, { "entropy": 5.963762092590332, "epoch": 5.1949037152305, "grad_norm": 1.359375, "learning_rate": 0.0002638684229210932, "loss": 4.9458, "mean_token_accuracy": 0.21823097616434098, "num_tokens": 115829280.0, "step": 66770 }, { "entropy": 5.942563152313232, "epoch": 5.1952927446022175, "grad_norm": 1.4609375, "learning_rate": 0.00026384074135771474, "loss": 4.9444, "mean_token_accuracy": 0.21190258115530014, "num_tokens": 115838452.0, "step": 66775 }, { "entropy": 5.960718011856079, "epoch": 5.195681773973935, "grad_norm": 1.5, "learning_rate": 0.0002638130599636603, "loss": 4.9403, "mean_token_accuracy": 0.21989195495843888, "num_tokens": 115847382.0, "step": 66780 }, { "entropy": 5.957814931869507, "epoch": 5.196070803345653, "grad_norm": 1.46875, "learning_rate": 0.00026378537873934983, "loss": 4.9742, "mean_token_accuracy": 0.21336373835802078, "num_tokens": 115856818.0, "step": 66785 }, { "entropy": 5.921224164962768, "epoch": 5.1964598327173706, "grad_norm": 1.484375, "learning_rate": 0.00026375769768520344, "loss": 4.9269, "mean_token_accuracy": 0.2165870651602745, "num_tokens": 115865086.0, "step": 66790 }, { "entropy": 6.015837144851685, "epoch": 5.196848862089087, "grad_norm": 1.609375, "learning_rate": 0.000263730016801641, "loss": 5.0127, "mean_token_accuracy": 0.20953391045331954, "num_tokens": 115874091.0, "step": 66795 }, { "entropy": 5.971311092376709, "epoch": 5.197237891460805, "grad_norm": 1.4375, "learning_rate": 0.0002637023360890827, "loss": 4.9594, "mean_token_accuracy": 0.22122769206762313, "num_tokens": 115883227.0, "step": 66800 }, { "entropy": 6.007909154891967, "epoch": 5.197626920832523, "grad_norm": 1.4765625, "learning_rate": 0.00026367465554794843, "loss": 4.9997, "mean_token_accuracy": 0.21437253803014755, "num_tokens": 115891808.0, "step": 66805 }, { "entropy": 5.941662454605103, "epoch": 5.1980159502042405, "grad_norm": 1.5078125, "learning_rate": 0.00026364697517865834, "loss": 4.9003, "mean_token_accuracy": 0.22316804826259612, "num_tokens": 115899724.0, "step": 66810 }, { "entropy": 5.9394158840179445, "epoch": 5.198404979575958, "grad_norm": 1.4609375, "learning_rate": 0.0002636192949816322, "loss": 4.9434, "mean_token_accuracy": 0.22258237153291702, "num_tokens": 115909027.0, "step": 66815 }, { "entropy": 6.005552196502686, "epoch": 5.198794008947676, "grad_norm": 1.6171875, "learning_rate": 0.0002635916149572902, "loss": 5.006, "mean_token_accuracy": 0.21511903405189514, "num_tokens": 115916893.0, "step": 66820 }, { "entropy": 5.9230433940887455, "epoch": 5.1991830383193935, "grad_norm": 1.625, "learning_rate": 0.00026356393510605224, "loss": 4.9107, "mean_token_accuracy": 0.22207140177488327, "num_tokens": 115925168.0, "step": 66825 }, { "entropy": 5.926455736160278, "epoch": 5.19957206769111, "grad_norm": 1.4140625, "learning_rate": 0.0002635362554283383, "loss": 4.9773, "mean_token_accuracy": 0.2124258503317833, "num_tokens": 115933897.0, "step": 66830 }, { "entropy": 5.941997146606445, "epoch": 5.199961097062828, "grad_norm": 1.5, "learning_rate": 0.0002635085759245686, "loss": 4.9243, "mean_token_accuracy": 0.2218412473797798, "num_tokens": 115942575.0, "step": 66835 }, { "entropy": 5.999353075027466, "epoch": 5.200350126434546, "grad_norm": 1.5078125, "learning_rate": 0.0002634808965951629, "loss": 4.9121, "mean_token_accuracy": 0.22421287894248962, "num_tokens": 115951298.0, "step": 66840 }, { "entropy": 5.908012056350708, "epoch": 5.2007391558062634, "grad_norm": 1.4453125, "learning_rate": 0.0002634532174405413, "loss": 4.9055, "mean_token_accuracy": 0.21508170515298844, "num_tokens": 115959706.0, "step": 66845 }, { "entropy": 5.912952518463134, "epoch": 5.201128185177981, "grad_norm": 1.5078125, "learning_rate": 0.00026342553846112364, "loss": 4.9437, "mean_token_accuracy": 0.2237588256597519, "num_tokens": 115968040.0, "step": 66850 }, { "entropy": 6.011100244522095, "epoch": 5.201517214549699, "grad_norm": 1.4765625, "learning_rate": 0.0002633978596573301, "loss": 4.9722, "mean_token_accuracy": 0.20873406976461412, "num_tokens": 115976101.0, "step": 66855 }, { "entropy": 6.003397655487061, "epoch": 5.201906243921416, "grad_norm": 1.5390625, "learning_rate": 0.00026337018102958056, "loss": 4.9812, "mean_token_accuracy": 0.21380960047245026, "num_tokens": 115984652.0, "step": 66860 }, { "entropy": 5.9457159519195555, "epoch": 5.202295273293133, "grad_norm": 1.6953125, "learning_rate": 0.000263342502578295, "loss": 4.8863, "mean_token_accuracy": 0.226133131980896, "num_tokens": 115992423.0, "step": 66865 }, { "entropy": 5.931352519989014, "epoch": 5.202684302664851, "grad_norm": 1.34375, "learning_rate": 0.00026331482430389343, "loss": 5.0071, "mean_token_accuracy": 0.21697636395692826, "num_tokens": 116001992.0, "step": 66870 }, { "entropy": 5.934729671478271, "epoch": 5.203073332036569, "grad_norm": 1.4921875, "learning_rate": 0.00026328714620679576, "loss": 4.8838, "mean_token_accuracy": 0.22169479727745056, "num_tokens": 116010434.0, "step": 66875 }, { "entropy": 5.938559484481812, "epoch": 5.203462361408286, "grad_norm": 1.5625, "learning_rate": 0.00026325946828742203, "loss": 4.9291, "mean_token_accuracy": 0.21455109715461732, "num_tokens": 116019460.0, "step": 66880 }, { "entropy": 5.947332859039307, "epoch": 5.203851390780004, "grad_norm": 1.4375, "learning_rate": 0.00026323179054619215, "loss": 5.0217, "mean_token_accuracy": 0.2153773933649063, "num_tokens": 116028324.0, "step": 66885 }, { "entropy": 5.9788295269012455, "epoch": 5.204240420151722, "grad_norm": 1.59375, "learning_rate": 0.0002632041129835262, "loss": 4.9376, "mean_token_accuracy": 0.2111601337790489, "num_tokens": 116037384.0, "step": 66890 }, { "entropy": 6.005895519256592, "epoch": 5.204629449523439, "grad_norm": 1.5546875, "learning_rate": 0.00026317643559984396, "loss": 5.0515, "mean_token_accuracy": 0.2141922652721405, "num_tokens": 116046103.0, "step": 66895 }, { "entropy": 6.047944164276123, "epoch": 5.205018478895156, "grad_norm": 1.671875, "learning_rate": 0.0002631487583955655, "loss": 4.9906, "mean_token_accuracy": 0.21233060359954833, "num_tokens": 116055504.0, "step": 66900 }, { "entropy": 5.995011663436889, "epoch": 5.205407508266874, "grad_norm": 1.6328125, "learning_rate": 0.00026312108137111086, "loss": 4.9011, "mean_token_accuracy": 0.21788831055164337, "num_tokens": 116063481.0, "step": 66905 }, { "entropy": 5.888275861740112, "epoch": 5.205796537638592, "grad_norm": 1.578125, "learning_rate": 0.0002630934045268998, "loss": 4.8428, "mean_token_accuracy": 0.22547418922185897, "num_tokens": 116072068.0, "step": 66910 }, { "entropy": 5.9567742347717285, "epoch": 5.206185567010309, "grad_norm": 1.578125, "learning_rate": 0.0002630657278633525, "loss": 4.9315, "mean_token_accuracy": 0.21005211472511293, "num_tokens": 116079605.0, "step": 66915 }, { "entropy": 5.874494981765747, "epoch": 5.206574596382027, "grad_norm": 1.4296875, "learning_rate": 0.0002630380513808887, "loss": 4.8552, "mean_token_accuracy": 0.23065195530653, "num_tokens": 116088615.0, "step": 66920 }, { "entropy": 5.975090885162354, "epoch": 5.206963625753745, "grad_norm": 1.4609375, "learning_rate": 0.0002630103750799284, "loss": 5.0048, "mean_token_accuracy": 0.2065598711371422, "num_tokens": 116097010.0, "step": 66925 }, { "entropy": 5.955994606018066, "epoch": 5.207352655125462, "grad_norm": 1.59375, "learning_rate": 0.00026298269896089164, "loss": 4.9539, "mean_token_accuracy": 0.21543947756290435, "num_tokens": 116106069.0, "step": 66930 }, { "entropy": 5.949639892578125, "epoch": 5.207741684497179, "grad_norm": 1.4765625, "learning_rate": 0.00026295502302419826, "loss": 4.8892, "mean_token_accuracy": 0.2266635403037071, "num_tokens": 116114482.0, "step": 66935 }, { "entropy": 5.982015895843506, "epoch": 5.208130713868897, "grad_norm": 1.4921875, "learning_rate": 0.0002629273472702683, "loss": 4.999, "mean_token_accuracy": 0.21833478063344955, "num_tokens": 116123529.0, "step": 66940 }, { "entropy": 5.901161193847656, "epoch": 5.208519743240615, "grad_norm": 1.609375, "learning_rate": 0.0002628996716995215, "loss": 4.9, "mean_token_accuracy": 0.2245624005794525, "num_tokens": 116132118.0, "step": 66945 }, { "entropy": 5.947268676757813, "epoch": 5.208908772612332, "grad_norm": 1.578125, "learning_rate": 0.000262871996312378, "loss": 5.0108, "mean_token_accuracy": 0.21327919363975525, "num_tokens": 116140468.0, "step": 66950 }, { "entropy": 6.007161235809326, "epoch": 5.20929780198405, "grad_norm": 1.359375, "learning_rate": 0.00026284432110925765, "loss": 5.0185, "mean_token_accuracy": 0.21165337711572646, "num_tokens": 116148719.0, "step": 66955 }, { "entropy": 6.026771354675293, "epoch": 5.209686831355767, "grad_norm": 1.421875, "learning_rate": 0.00026281664609058037, "loss": 4.9881, "mean_token_accuracy": 0.2111056089401245, "num_tokens": 116157738.0, "step": 66960 }, { "entropy": 5.8964488983154295, "epoch": 5.210075860727485, "grad_norm": 1.40625, "learning_rate": 0.0002627889712567661, "loss": 4.906, "mean_token_accuracy": 0.21750743091106414, "num_tokens": 116166860.0, "step": 66965 }, { "entropy": 5.956106805801392, "epoch": 5.210464890099202, "grad_norm": 1.734375, "learning_rate": 0.00026276129660823475, "loss": 4.9311, "mean_token_accuracy": 0.2220573380589485, "num_tokens": 116174772.0, "step": 66970 }, { "entropy": 5.974246835708618, "epoch": 5.21085391947092, "grad_norm": 1.5, "learning_rate": 0.00026273362214540623, "loss": 5.0049, "mean_token_accuracy": 0.2151297375559807, "num_tokens": 116184007.0, "step": 66975 }, { "entropy": 5.9906055450439455, "epoch": 5.211242948842638, "grad_norm": 1.3984375, "learning_rate": 0.0002627059478687005, "loss": 4.9829, "mean_token_accuracy": 0.21531809270381927, "num_tokens": 116193049.0, "step": 66980 }, { "entropy": 6.015655994415283, "epoch": 5.211631978214355, "grad_norm": 1.5859375, "learning_rate": 0.0002626782737785374, "loss": 5.0276, "mean_token_accuracy": 0.21609100699424744, "num_tokens": 116201474.0, "step": 66985 }, { "entropy": 6.037283182144165, "epoch": 5.212021007586073, "grad_norm": 1.6953125, "learning_rate": 0.00026265059987533697, "loss": 5.0254, "mean_token_accuracy": 0.21452055424451827, "num_tokens": 116210253.0, "step": 66990 }, { "entropy": 6.016984462738037, "epoch": 5.21241003695779, "grad_norm": 1.46875, "learning_rate": 0.00026262292615951893, "loss": 5.0623, "mean_token_accuracy": 0.2129225954413414, "num_tokens": 116218784.0, "step": 66995 }, { "entropy": 5.939670562744141, "epoch": 5.212799066329508, "grad_norm": 1.5, "learning_rate": 0.0002625952526315034, "loss": 4.8953, "mean_token_accuracy": 0.22594502717256545, "num_tokens": 116227078.0, "step": 67000 }, { "entropy": 5.97763147354126, "epoch": 5.213188095701225, "grad_norm": 1.53125, "learning_rate": 0.0002625675792917101, "loss": 4.8759, "mean_token_accuracy": 0.2284654900431633, "num_tokens": 116235840.0, "step": 67005 }, { "entropy": 5.961347007751465, "epoch": 5.213577125072943, "grad_norm": 1.4140625, "learning_rate": 0.000262539906140559, "loss": 4.9745, "mean_token_accuracy": 0.21392288506031037, "num_tokens": 116244686.0, "step": 67010 }, { "entropy": 5.864618492126465, "epoch": 5.213966154444661, "grad_norm": 1.5078125, "learning_rate": 0.00026251223317847003, "loss": 4.891, "mean_token_accuracy": 0.22194795906543732, "num_tokens": 116252836.0, "step": 67015 }, { "entropy": 5.873418521881104, "epoch": 5.214355183816378, "grad_norm": 1.5390625, "learning_rate": 0.000262484560405863, "loss": 4.856, "mean_token_accuracy": 0.22879645377397537, "num_tokens": 116261619.0, "step": 67020 }, { "entropy": 5.9820723056793215, "epoch": 5.214744213188096, "grad_norm": 1.4765625, "learning_rate": 0.00026245688782315787, "loss": 4.9586, "mean_token_accuracy": 0.20923326015472413, "num_tokens": 116269960.0, "step": 67025 }, { "entropy": 6.012358331680298, "epoch": 5.215133242559813, "grad_norm": 1.515625, "learning_rate": 0.00026242921543077435, "loss": 4.9005, "mean_token_accuracy": 0.22624083310365678, "num_tokens": 116278286.0, "step": 67030 }, { "entropy": 5.96365647315979, "epoch": 5.215522271931531, "grad_norm": 1.4375, "learning_rate": 0.0002624015432291326, "loss": 4.9311, "mean_token_accuracy": 0.22628503143787385, "num_tokens": 116286798.0, "step": 67035 }, { "entropy": 5.926325464248658, "epoch": 5.215911301303248, "grad_norm": 1.625, "learning_rate": 0.0002623738712186525, "loss": 4.9519, "mean_token_accuracy": 0.22156002521514892, "num_tokens": 116295279.0, "step": 67040 }, { "entropy": 5.920442390441894, "epoch": 5.216300330674966, "grad_norm": 1.5390625, "learning_rate": 0.00026234619939975365, "loss": 4.9375, "mean_token_accuracy": 0.22073664516210556, "num_tokens": 116303788.0, "step": 67045 }, { "entropy": 5.946451711654663, "epoch": 5.216689360046684, "grad_norm": 1.46875, "learning_rate": 0.00026231852777285606, "loss": 4.8955, "mean_token_accuracy": 0.22114986032247544, "num_tokens": 116312023.0, "step": 67050 }, { "entropy": 5.934589195251465, "epoch": 5.217078389418401, "grad_norm": 1.390625, "learning_rate": 0.00026229085633837975, "loss": 4.9364, "mean_token_accuracy": 0.21604447811841965, "num_tokens": 116320755.0, "step": 67055 }, { "entropy": 5.980952358245849, "epoch": 5.217467418790118, "grad_norm": 1.3828125, "learning_rate": 0.0002622631850967444, "loss": 5.0162, "mean_token_accuracy": 0.215207239985466, "num_tokens": 116329259.0, "step": 67060 }, { "entropy": 5.899078989028931, "epoch": 5.217856448161836, "grad_norm": 1.5390625, "learning_rate": 0.00026223551404837, "loss": 4.8882, "mean_token_accuracy": 0.22085072696208954, "num_tokens": 116337573.0, "step": 67065 }, { "entropy": 5.946717405319214, "epoch": 5.218245477533554, "grad_norm": 1.4375, "learning_rate": 0.00026220784319367626, "loss": 4.9289, "mean_token_accuracy": 0.2237103119492531, "num_tokens": 116346249.0, "step": 67070 }, { "entropy": 5.991045951843262, "epoch": 5.218634506905271, "grad_norm": 1.5234375, "learning_rate": 0.0002621801725330832, "loss": 4.9914, "mean_token_accuracy": 0.21662231981754304, "num_tokens": 116354670.0, "step": 67075 }, { "entropy": 6.003362941741943, "epoch": 5.219023536276989, "grad_norm": 1.4609375, "learning_rate": 0.0002621525020670106, "loss": 5.0002, "mean_token_accuracy": 0.2165423408150673, "num_tokens": 116363578.0, "step": 67080 }, { "entropy": 5.994909048080444, "epoch": 5.219412565648707, "grad_norm": 1.5234375, "learning_rate": 0.0002621248317958784, "loss": 4.9388, "mean_token_accuracy": 0.22562653124332427, "num_tokens": 116372639.0, "step": 67085 }, { "entropy": 6.001397514343262, "epoch": 5.219801595020424, "grad_norm": 1.453125, "learning_rate": 0.00026209716172010636, "loss": 4.9514, "mean_token_accuracy": 0.2220144286751747, "num_tokens": 116380808.0, "step": 67090 }, { "entropy": 5.956270027160644, "epoch": 5.220190624392141, "grad_norm": 1.4609375, "learning_rate": 0.0002620694918401142, "loss": 4.9686, "mean_token_accuracy": 0.2127075105905533, "num_tokens": 116389456.0, "step": 67095 }, { "entropy": 6.0104651927948, "epoch": 5.220579653763859, "grad_norm": 1.6484375, "learning_rate": 0.000262041822156322, "loss": 5.0204, "mean_token_accuracy": 0.2180896982550621, "num_tokens": 116397634.0, "step": 67100 }, { "entropy": 5.979139137268066, "epoch": 5.220968683135577, "grad_norm": 1.4140625, "learning_rate": 0.0002620141526691496, "loss": 4.9998, "mean_token_accuracy": 0.21423858106136323, "num_tokens": 116407068.0, "step": 67105 }, { "entropy": 6.021339654922485, "epoch": 5.221357712507294, "grad_norm": 1.4296875, "learning_rate": 0.00026198648337901674, "loss": 5.0054, "mean_token_accuracy": 0.22253150641918182, "num_tokens": 116415601.0, "step": 67110 }, { "entropy": 5.904582977294922, "epoch": 5.221746741879012, "grad_norm": 1.671875, "learning_rate": 0.00026195881428634334, "loss": 4.8033, "mean_token_accuracy": 0.23814280182123185, "num_tokens": 116424095.0, "step": 67115 }, { "entropy": 5.884514188766479, "epoch": 5.22213577125073, "grad_norm": 1.4140625, "learning_rate": 0.00026193114539154903, "loss": 4.8265, "mean_token_accuracy": 0.2234618678689003, "num_tokens": 116432581.0, "step": 67120 }, { "entropy": 5.992266035079956, "epoch": 5.222524800622447, "grad_norm": 1.5078125, "learning_rate": 0.0002619034766950539, "loss": 4.9407, "mean_token_accuracy": 0.21185623109340668, "num_tokens": 116440936.0, "step": 67125 }, { "entropy": 5.998810338973999, "epoch": 5.222913829994164, "grad_norm": 1.5234375, "learning_rate": 0.0002618758081972776, "loss": 4.9942, "mean_token_accuracy": 0.21485570520162584, "num_tokens": 116449273.0, "step": 67130 }, { "entropy": 5.968427944183349, "epoch": 5.223302859365882, "grad_norm": 1.4140625, "learning_rate": 0.0002618481398986401, "loss": 4.9885, "mean_token_accuracy": 0.21848909556865692, "num_tokens": 116458073.0, "step": 67135 }, { "entropy": 5.927435493469238, "epoch": 5.2236918887376, "grad_norm": 1.484375, "learning_rate": 0.00026182047179956107, "loss": 4.9081, "mean_token_accuracy": 0.22533820569515228, "num_tokens": 116466086.0, "step": 67140 }, { "entropy": 5.953805351257325, "epoch": 5.224080918109317, "grad_norm": 1.3984375, "learning_rate": 0.00026179280390046047, "loss": 4.9111, "mean_token_accuracy": 0.2251986861228943, "num_tokens": 116474496.0, "step": 67145 }, { "entropy": 5.9867737770080565, "epoch": 5.224469947481035, "grad_norm": 1.59375, "learning_rate": 0.00026176513620175795, "loss": 5.029, "mean_token_accuracy": 0.2086343139410019, "num_tokens": 116483606.0, "step": 67150 }, { "entropy": 6.024207019805909, "epoch": 5.224858976852753, "grad_norm": 1.4609375, "learning_rate": 0.0002617374687038735, "loss": 5.041, "mean_token_accuracy": 0.21349333822727204, "num_tokens": 116493033.0, "step": 67155 }, { "entropy": 5.94017391204834, "epoch": 5.22524800622447, "grad_norm": 1.5234375, "learning_rate": 0.00026170980140722677, "loss": 4.8594, "mean_token_accuracy": 0.229592065513134, "num_tokens": 116501054.0, "step": 67160 }, { "entropy": 6.002553558349609, "epoch": 5.225637035596187, "grad_norm": 1.4921875, "learning_rate": 0.00026168213431223777, "loss": 4.9834, "mean_token_accuracy": 0.20949667394161225, "num_tokens": 116509681.0, "step": 67165 }, { "entropy": 5.993343544006348, "epoch": 5.226026064967905, "grad_norm": 1.6015625, "learning_rate": 0.00026165446741932606, "loss": 4.979, "mean_token_accuracy": 0.21300880908966063, "num_tokens": 116518490.0, "step": 67170 }, { "entropy": 5.985824632644653, "epoch": 5.226415094339623, "grad_norm": 1.5546875, "learning_rate": 0.00026162680072891166, "loss": 5.0, "mean_token_accuracy": 0.2130703240633011, "num_tokens": 116526598.0, "step": 67175 }, { "entropy": 6.045921373367309, "epoch": 5.22680412371134, "grad_norm": 1.453125, "learning_rate": 0.00026159913424141426, "loss": 5.0965, "mean_token_accuracy": 0.20459864884614945, "num_tokens": 116535650.0, "step": 67180 }, { "entropy": 5.897486448287964, "epoch": 5.227193153083058, "grad_norm": 1.4296875, "learning_rate": 0.0002615714679572536, "loss": 4.8833, "mean_token_accuracy": 0.22449268102645875, "num_tokens": 116544569.0, "step": 67185 }, { "entropy": 5.971323442459107, "epoch": 5.227582182454776, "grad_norm": 1.5234375, "learning_rate": 0.00026154380187684963, "loss": 4.9215, "mean_token_accuracy": 0.2131018415093422, "num_tokens": 116552351.0, "step": 67190 }, { "entropy": 5.900402307510376, "epoch": 5.2279712118264925, "grad_norm": 1.4765625, "learning_rate": 0.000261516136000622, "loss": 4.8786, "mean_token_accuracy": 0.2262655422091484, "num_tokens": 116561761.0, "step": 67195 }, { "entropy": 6.011790180206299, "epoch": 5.22836024119821, "grad_norm": 1.453125, "learning_rate": 0.0002614884703289906, "loss": 4.9957, "mean_token_accuracy": 0.21118742376565933, "num_tokens": 116570573.0, "step": 67200 }, { "entropy": 5.918563413619995, "epoch": 5.228749270569928, "grad_norm": 1.515625, "learning_rate": 0.00026146080486237513, "loss": 4.774, "mean_token_accuracy": 0.23690352886915206, "num_tokens": 116580840.0, "step": 67205 }, { "entropy": 5.945854806900025, "epoch": 5.229138299941646, "grad_norm": 1.5625, "learning_rate": 0.00026143313960119534, "loss": 4.8993, "mean_token_accuracy": 0.21707655787467955, "num_tokens": 116589657.0, "step": 67210 }, { "entropy": 5.968327331542969, "epoch": 5.229527329313363, "grad_norm": 1.5078125, "learning_rate": 0.0002614054745458711, "loss": 4.9454, "mean_token_accuracy": 0.21669345647096633, "num_tokens": 116597796.0, "step": 67215 }, { "entropy": 5.872777938842773, "epoch": 5.229916358685081, "grad_norm": 1.53125, "learning_rate": 0.00026137780969682215, "loss": 4.8186, "mean_token_accuracy": 0.22715088129043579, "num_tokens": 116606750.0, "step": 67220 }, { "entropy": 5.893414402008057, "epoch": 5.230305388056799, "grad_norm": 1.609375, "learning_rate": 0.0002613501450544683, "loss": 4.889, "mean_token_accuracy": 0.21555591076612474, "num_tokens": 116614552.0, "step": 67225 }, { "entropy": 5.861094903945923, "epoch": 5.2306944174285155, "grad_norm": 1.5625, "learning_rate": 0.0002613224806192291, "loss": 4.7745, "mean_token_accuracy": 0.23180656433105468, "num_tokens": 116622669.0, "step": 67230 }, { "entropy": 5.946749258041382, "epoch": 5.231083446800233, "grad_norm": 1.4609375, "learning_rate": 0.0002612948163915247, "loss": 4.9572, "mean_token_accuracy": 0.21943146288394927, "num_tokens": 116631828.0, "step": 67235 }, { "entropy": 5.918754577636719, "epoch": 5.231472476171951, "grad_norm": 1.4296875, "learning_rate": 0.0002612671523717745, "loss": 4.8552, "mean_token_accuracy": 0.21917740851640702, "num_tokens": 116640482.0, "step": 67240 }, { "entropy": 6.014663791656494, "epoch": 5.231861505543669, "grad_norm": 1.5, "learning_rate": 0.0002612394885603985, "loss": 4.9406, "mean_token_accuracy": 0.21510806679725647, "num_tokens": 116649029.0, "step": 67245 }, { "entropy": 5.906226015090942, "epoch": 5.232250534915386, "grad_norm": 1.515625, "learning_rate": 0.0002612118249578163, "loss": 4.9222, "mean_token_accuracy": 0.22507931143045426, "num_tokens": 116657698.0, "step": 67250 }, { "entropy": 5.910842227935791, "epoch": 5.232639564287104, "grad_norm": 1.6171875, "learning_rate": 0.0002611841615644477, "loss": 4.9564, "mean_token_accuracy": 0.21994110345840454, "num_tokens": 116665890.0, "step": 67255 }, { "entropy": 5.935106229782105, "epoch": 5.233028593658822, "grad_norm": 1.7109375, "learning_rate": 0.00026115649838071253, "loss": 4.91, "mean_token_accuracy": 0.2199905350804329, "num_tokens": 116674075.0, "step": 67260 }, { "entropy": 6.024548768997192, "epoch": 5.2334176230305385, "grad_norm": 1.4453125, "learning_rate": 0.0002611288354070304, "loss": 5.0898, "mean_token_accuracy": 0.20910734236240386, "num_tokens": 116683119.0, "step": 67265 }, { "entropy": 5.94524655342102, "epoch": 5.233806652402256, "grad_norm": 1.5859375, "learning_rate": 0.0002611011726438212, "loss": 4.8755, "mean_token_accuracy": 0.2212102919816971, "num_tokens": 116690931.0, "step": 67270 }, { "entropy": 5.852141571044922, "epoch": 5.234195681773974, "grad_norm": 1.4921875, "learning_rate": 0.00026107351009150453, "loss": 4.8284, "mean_token_accuracy": 0.2245680034160614, "num_tokens": 116699415.0, "step": 67275 }, { "entropy": 5.892734718322754, "epoch": 5.234584711145692, "grad_norm": 1.4765625, "learning_rate": 0.0002610458477505002, "loss": 4.917, "mean_token_accuracy": 0.2279587984085083, "num_tokens": 116707807.0, "step": 67280 }, { "entropy": 5.921682262420655, "epoch": 5.234973740517409, "grad_norm": 1.5234375, "learning_rate": 0.0002610181856212279, "loss": 4.85, "mean_token_accuracy": 0.2278549477458, "num_tokens": 116716941.0, "step": 67285 }, { "entropy": 5.976714754104615, "epoch": 5.235362769889127, "grad_norm": 1.6171875, "learning_rate": 0.0002609905237041074, "loss": 4.9689, "mean_token_accuracy": 0.21142105162143707, "num_tokens": 116725398.0, "step": 67290 }, { "entropy": 6.031628084182739, "epoch": 5.235751799260844, "grad_norm": 1.5, "learning_rate": 0.0002609628619995582, "loss": 5.0367, "mean_token_accuracy": 0.21499659717082978, "num_tokens": 116733652.0, "step": 67295 }, { "entropy": 5.958323812484741, "epoch": 5.2361408286325615, "grad_norm": 1.5390625, "learning_rate": 0.00026093520050800046, "loss": 4.9144, "mean_token_accuracy": 0.21862298995256424, "num_tokens": 116741822.0, "step": 67300 }, { "entropy": 5.993869209289551, "epoch": 5.236529858004279, "grad_norm": 1.5703125, "learning_rate": 0.0002609075392298536, "loss": 5.0001, "mean_token_accuracy": 0.21936078518629074, "num_tokens": 116750338.0, "step": 67305 }, { "entropy": 5.913096809387207, "epoch": 5.236918887375997, "grad_norm": 1.5, "learning_rate": 0.0002608798781655374, "loss": 4.8893, "mean_token_accuracy": 0.222600582242012, "num_tokens": 116758587.0, "step": 67310 }, { "entropy": 5.976931142807007, "epoch": 5.237307916747715, "grad_norm": 1.4375, "learning_rate": 0.0002608522173154716, "loss": 5.0059, "mean_token_accuracy": 0.2131909266114235, "num_tokens": 116767255.0, "step": 67315 }, { "entropy": 5.943133735656739, "epoch": 5.237696946119432, "grad_norm": 1.515625, "learning_rate": 0.0002608245566800759, "loss": 4.9571, "mean_token_accuracy": 0.21705740094184875, "num_tokens": 116775174.0, "step": 67320 }, { "entropy": 5.9356146335601805, "epoch": 5.23808597549115, "grad_norm": 1.4296875, "learning_rate": 0.00026079689625976995, "loss": 4.9574, "mean_token_accuracy": 0.21710429191589356, "num_tokens": 116783237.0, "step": 67325 }, { "entropy": 5.954853534698486, "epoch": 5.238475004862867, "grad_norm": 1.359375, "learning_rate": 0.00026076923605497347, "loss": 4.9332, "mean_token_accuracy": 0.21751187443733216, "num_tokens": 116793143.0, "step": 67330 }, { "entropy": 5.976344776153565, "epoch": 5.2388640342345845, "grad_norm": 1.5859375, "learning_rate": 0.00026074157606610626, "loss": 4.9312, "mean_token_accuracy": 0.2237047255039215, "num_tokens": 116801130.0, "step": 67335 }, { "entropy": 5.9367701530456545, "epoch": 5.239253063606302, "grad_norm": 1.484375, "learning_rate": 0.00026071391629358786, "loss": 4.9263, "mean_token_accuracy": 0.2184154912829399, "num_tokens": 116809641.0, "step": 67340 }, { "entropy": 5.95395565032959, "epoch": 5.23964209297802, "grad_norm": 1.453125, "learning_rate": 0.00026068625673783807, "loss": 4.937, "mean_token_accuracy": 0.2190174415707588, "num_tokens": 116817569.0, "step": 67345 }, { "entropy": 5.929007244110108, "epoch": 5.240031122349738, "grad_norm": 1.5390625, "learning_rate": 0.00026065859739927657, "loss": 4.9016, "mean_token_accuracy": 0.22254942804574968, "num_tokens": 116825676.0, "step": 67350 }, { "entropy": 6.02333698272705, "epoch": 5.240420151721455, "grad_norm": 1.4375, "learning_rate": 0.000260630938278323, "loss": 5.0952, "mean_token_accuracy": 0.20371092855930328, "num_tokens": 116835046.0, "step": 67355 }, { "entropy": 6.011357641220092, "epoch": 5.240809181093173, "grad_norm": 1.515625, "learning_rate": 0.00026060327937539704, "loss": 4.9962, "mean_token_accuracy": 0.2141246572136879, "num_tokens": 116844037.0, "step": 67360 }, { "entropy": 5.956971740722656, "epoch": 5.24119821046489, "grad_norm": 1.359375, "learning_rate": 0.00026057562069091845, "loss": 4.9588, "mean_token_accuracy": 0.21505456566810607, "num_tokens": 116852680.0, "step": 67365 }, { "entropy": 6.005250358581543, "epoch": 5.2415872398366075, "grad_norm": 1.3515625, "learning_rate": 0.00026054796222530684, "loss": 4.9897, "mean_token_accuracy": 0.21494847238063813, "num_tokens": 116862012.0, "step": 67370 }, { "entropy": 6.019654035568237, "epoch": 5.241976269208325, "grad_norm": 1.5625, "learning_rate": 0.0002605203039789819, "loss": 4.9569, "mean_token_accuracy": 0.22150174528360367, "num_tokens": 116870418.0, "step": 67375 }, { "entropy": 6.025184154510498, "epoch": 5.242365298580043, "grad_norm": 1.4375, "learning_rate": 0.0002604926459523633, "loss": 5.0162, "mean_token_accuracy": 0.2078032523393631, "num_tokens": 116879377.0, "step": 67380 }, { "entropy": 6.0381426334381105, "epoch": 5.2427543279517606, "grad_norm": 1.5234375, "learning_rate": 0.00026046498814587076, "loss": 4.9666, "mean_token_accuracy": 0.21931336522102357, "num_tokens": 116888045.0, "step": 67385 }, { "entropy": 5.973710775375366, "epoch": 5.243143357323478, "grad_norm": 1.546875, "learning_rate": 0.00026043733055992386, "loss": 4.959, "mean_token_accuracy": 0.2144218549132347, "num_tokens": 116896304.0, "step": 67390 }, { "entropy": 5.956200218200683, "epoch": 5.243532386695195, "grad_norm": 1.5390625, "learning_rate": 0.00026040967319494225, "loss": 5.0165, "mean_token_accuracy": 0.21816113442182541, "num_tokens": 116905208.0, "step": 67395 }, { "entropy": 6.012505912780762, "epoch": 5.243921416066913, "grad_norm": 1.4453125, "learning_rate": 0.00026038201605134567, "loss": 4.9949, "mean_token_accuracy": 0.21771894991397858, "num_tokens": 116913550.0, "step": 67400 }, { "entropy": 5.933548212051392, "epoch": 5.2443104454386305, "grad_norm": 1.4375, "learning_rate": 0.00026035435912955375, "loss": 4.8972, "mean_token_accuracy": 0.21573529690504073, "num_tokens": 116922014.0, "step": 67405 }, { "entropy": 6.025525617599487, "epoch": 5.244699474810348, "grad_norm": 1.4296875, "learning_rate": 0.0002603267024299861, "loss": 4.9839, "mean_token_accuracy": 0.21877204477787018, "num_tokens": 116930402.0, "step": 67410 }, { "entropy": 5.962979888916015, "epoch": 5.245088504182066, "grad_norm": 1.484375, "learning_rate": 0.0002602990459530623, "loss": 4.9414, "mean_token_accuracy": 0.21893858313560485, "num_tokens": 116938549.0, "step": 67415 }, { "entropy": 5.999041795730591, "epoch": 5.2454775335537835, "grad_norm": 1.5078125, "learning_rate": 0.0002602713896992022, "loss": 5.02, "mean_token_accuracy": 0.21472976952791215, "num_tokens": 116947772.0, "step": 67420 }, { "entropy": 5.898231363296508, "epoch": 5.245866562925501, "grad_norm": 1.484375, "learning_rate": 0.0002602437336688252, "loss": 4.9339, "mean_token_accuracy": 0.21743259578943253, "num_tokens": 116956242.0, "step": 67425 }, { "entropy": 5.9734001636505125, "epoch": 5.246255592297218, "grad_norm": 1.5390625, "learning_rate": 0.0002602160778623511, "loss": 4.8621, "mean_token_accuracy": 0.22080378979444504, "num_tokens": 116964448.0, "step": 67430 }, { "entropy": 6.015415191650391, "epoch": 5.246644621668936, "grad_norm": 1.5625, "learning_rate": 0.00026018842228019953, "loss": 4.9395, "mean_token_accuracy": 0.21415061503648758, "num_tokens": 116972794.0, "step": 67435 }, { "entropy": 5.978651285171509, "epoch": 5.2470336510406534, "grad_norm": 1.40625, "learning_rate": 0.00026016076692279003, "loss": 5.0457, "mean_token_accuracy": 0.21299476325511932, "num_tokens": 116981518.0, "step": 67440 }, { "entropy": 5.971816682815552, "epoch": 5.247422680412371, "grad_norm": 1.515625, "learning_rate": 0.0002601331117905423, "loss": 4.9296, "mean_token_accuracy": 0.21835253089666368, "num_tokens": 116989408.0, "step": 67445 }, { "entropy": 5.955803489685058, "epoch": 5.247811709784089, "grad_norm": 1.5234375, "learning_rate": 0.00026010545688387595, "loss": 4.9983, "mean_token_accuracy": 0.2091404154896736, "num_tokens": 116998253.0, "step": 67450 }, { "entropy": 6.001044225692749, "epoch": 5.2482007391558065, "grad_norm": 1.421875, "learning_rate": 0.00026007780220321054, "loss": 5.0082, "mean_token_accuracy": 0.21240423023700714, "num_tokens": 117006580.0, "step": 67455 }, { "entropy": 5.954071187973023, "epoch": 5.248589768527524, "grad_norm": 1.3671875, "learning_rate": 0.00026005014774896574, "loss": 4.9183, "mean_token_accuracy": 0.22001922875642776, "num_tokens": 117015388.0, "step": 67460 }, { "entropy": 6.05723385810852, "epoch": 5.248978797899241, "grad_norm": 1.5859375, "learning_rate": 0.00026002249352156124, "loss": 5.067, "mean_token_accuracy": 0.20637932568788528, "num_tokens": 117024047.0, "step": 67465 }, { "entropy": 6.0372590065002445, "epoch": 5.249367827270959, "grad_norm": 1.5390625, "learning_rate": 0.0002599948395214165, "loss": 5.0407, "mean_token_accuracy": 0.21453590244054793, "num_tokens": 117031858.0, "step": 67470 }, { "entropy": 5.951749324798584, "epoch": 5.249756856642676, "grad_norm": 1.5078125, "learning_rate": 0.00025996718574895116, "loss": 4.9096, "mean_token_accuracy": 0.2232792615890503, "num_tokens": 117041336.0, "step": 67475 }, { "entropy": 5.9806647300720215, "epoch": 5.250145886014394, "grad_norm": 1.5390625, "learning_rate": 0.00025993953220458487, "loss": 4.9775, "mean_token_accuracy": 0.20810811072587967, "num_tokens": 117049929.0, "step": 67480 }, { "entropy": 5.904570245742798, "epoch": 5.250534915386112, "grad_norm": 1.53125, "learning_rate": 0.0002599118788887372, "loss": 4.8441, "mean_token_accuracy": 0.23001528084278106, "num_tokens": 117058099.0, "step": 67485 }, { "entropy": 6.006984090805053, "epoch": 5.2509239447578295, "grad_norm": 1.515625, "learning_rate": 0.00025988422580182775, "loss": 5.0007, "mean_token_accuracy": 0.21607559472322463, "num_tokens": 117066778.0, "step": 67490 }, { "entropy": 5.933389472961426, "epoch": 5.251312974129547, "grad_norm": 1.609375, "learning_rate": 0.0002598565729442761, "loss": 4.9245, "mean_token_accuracy": 0.22233477979898453, "num_tokens": 117075459.0, "step": 67495 }, { "entropy": 5.943446254730224, "epoch": 5.251702003501264, "grad_norm": 1.4609375, "learning_rate": 0.00025982892031650186, "loss": 5.0251, "mean_token_accuracy": 0.21826497912406922, "num_tokens": 117084793.0, "step": 67500 }, { "entropy": 5.965963363647461, "epoch": 5.252091032872982, "grad_norm": 1.5546875, "learning_rate": 0.0002598012679189246, "loss": 4.9416, "mean_token_accuracy": 0.2156515747308731, "num_tokens": 117093002.0, "step": 67505 }, { "entropy": 5.977499532699585, "epoch": 5.252480062244699, "grad_norm": 1.3984375, "learning_rate": 0.00025977361575196394, "loss": 4.9409, "mean_token_accuracy": 0.22108418643474578, "num_tokens": 117101879.0, "step": 67510 }, { "entropy": 5.982732629776001, "epoch": 5.252869091616417, "grad_norm": 1.4765625, "learning_rate": 0.00025974596381603943, "loss": 4.9747, "mean_token_accuracy": 0.2210507497191429, "num_tokens": 117110437.0, "step": 67515 }, { "entropy": 6.003619766235351, "epoch": 5.253258120988135, "grad_norm": 1.453125, "learning_rate": 0.0002597183121115707, "loss": 5.0733, "mean_token_accuracy": 0.21963540464639664, "num_tokens": 117119306.0, "step": 67520 }, { "entropy": 5.9856935977935795, "epoch": 5.2536471503598525, "grad_norm": 1.484375, "learning_rate": 0.0002596906606389771, "loss": 4.9099, "mean_token_accuracy": 0.2174041301012039, "num_tokens": 117128071.0, "step": 67525 }, { "entropy": 5.944335985183716, "epoch": 5.254036179731569, "grad_norm": 1.5390625, "learning_rate": 0.00025966300939867843, "loss": 4.8246, "mean_token_accuracy": 0.2332903802394867, "num_tokens": 117136026.0, "step": 67530 }, { "entropy": 5.907544660568237, "epoch": 5.254425209103287, "grad_norm": 1.515625, "learning_rate": 0.0002596353583910942, "loss": 4.8987, "mean_token_accuracy": 0.2193308711051941, "num_tokens": 117144693.0, "step": 67535 }, { "entropy": 5.998728179931641, "epoch": 5.254814238475005, "grad_norm": 1.5, "learning_rate": 0.00025960770761664396, "loss": 5.0923, "mean_token_accuracy": 0.2034485310316086, "num_tokens": 117154076.0, "step": 67540 }, { "entropy": 5.996291875839233, "epoch": 5.255203267846722, "grad_norm": 1.4375, "learning_rate": 0.00025958005707574726, "loss": 4.9755, "mean_token_accuracy": 0.2131444275379181, "num_tokens": 117163581.0, "step": 67545 }, { "entropy": 5.993049383163452, "epoch": 5.25559229721844, "grad_norm": 1.609375, "learning_rate": 0.0002595524067688237, "loss": 4.8384, "mean_token_accuracy": 0.22515734583139418, "num_tokens": 117171734.0, "step": 67550 }, { "entropy": 5.982550048828125, "epoch": 5.255981326590158, "grad_norm": 1.5, "learning_rate": 0.00025952475669629267, "loss": 5.0011, "mean_token_accuracy": 0.21663331538438796, "num_tokens": 117180399.0, "step": 67555 }, { "entropy": 5.970515346527099, "epoch": 5.2563703559618755, "grad_norm": 1.4921875, "learning_rate": 0.00025949710685857383, "loss": 5.0173, "mean_token_accuracy": 0.21684306859970093, "num_tokens": 117189135.0, "step": 67560 }, { "entropy": 5.951988458633423, "epoch": 5.256759385333592, "grad_norm": 1.46875, "learning_rate": 0.00025946945725608675, "loss": 4.8672, "mean_token_accuracy": 0.22158548086881638, "num_tokens": 117198717.0, "step": 67565 }, { "entropy": 5.927959680557251, "epoch": 5.25714841470531, "grad_norm": 1.5703125, "learning_rate": 0.0002594418078892509, "loss": 4.9272, "mean_token_accuracy": 0.22490579634904861, "num_tokens": 117207887.0, "step": 67570 }, { "entropy": 5.9595386505126955, "epoch": 5.257537444077028, "grad_norm": 1.390625, "learning_rate": 0.000259414158758486, "loss": 4.9246, "mean_token_accuracy": 0.2206644594669342, "num_tokens": 117216843.0, "step": 67575 }, { "entropy": 5.971211290359497, "epoch": 5.257926473448745, "grad_norm": 1.5390625, "learning_rate": 0.00025938650986421125, "loss": 5.0054, "mean_token_accuracy": 0.20718593150377274, "num_tokens": 117225565.0, "step": 67580 }, { "entropy": 6.014598608016968, "epoch": 5.258315502820463, "grad_norm": 1.484375, "learning_rate": 0.0002593588612068465, "loss": 5.0533, "mean_token_accuracy": 0.21116822063922883, "num_tokens": 117234084.0, "step": 67585 }, { "entropy": 5.980208253860473, "epoch": 5.258704532192181, "grad_norm": 1.53125, "learning_rate": 0.000259331212786811, "loss": 4.9742, "mean_token_accuracy": 0.21508805453777313, "num_tokens": 117243222.0, "step": 67590 }, { "entropy": 5.924001884460449, "epoch": 5.259093561563898, "grad_norm": 1.5078125, "learning_rate": 0.00025930356460452454, "loss": 4.8988, "mean_token_accuracy": 0.22040313482284546, "num_tokens": 117251334.0, "step": 67595 }, { "entropy": 5.997925853729248, "epoch": 5.259482590935615, "grad_norm": 1.421875, "learning_rate": 0.0002592759166604064, "loss": 5.0242, "mean_token_accuracy": 0.20812930762767792, "num_tokens": 117260393.0, "step": 67600 }, { "entropy": 5.951492214202881, "epoch": 5.259871620307333, "grad_norm": 1.515625, "learning_rate": 0.00025924826895487623, "loss": 4.9099, "mean_token_accuracy": 0.21920438557863237, "num_tokens": 117269271.0, "step": 67605 }, { "entropy": 6.015502262115478, "epoch": 5.260260649679051, "grad_norm": 1.5, "learning_rate": 0.00025922062148835357, "loss": 5.0163, "mean_token_accuracy": 0.21689097136259078, "num_tokens": 117277888.0, "step": 67610 }, { "entropy": 5.973323392868042, "epoch": 5.260649679050768, "grad_norm": 1.4765625, "learning_rate": 0.0002591929742612578, "loss": 4.9748, "mean_token_accuracy": 0.2149810701608658, "num_tokens": 117286251.0, "step": 67615 }, { "entropy": 5.963575172424316, "epoch": 5.261038708422486, "grad_norm": 1.4609375, "learning_rate": 0.0002591653272740085, "loss": 4.9535, "mean_token_accuracy": 0.2143026664853096, "num_tokens": 117295280.0, "step": 67620 }, { "entropy": 6.0192780017852785, "epoch": 5.261427737794204, "grad_norm": 1.4609375, "learning_rate": 0.00025913768052702514, "loss": 4.9794, "mean_token_accuracy": 0.2192216098308563, "num_tokens": 117304008.0, "step": 67625 }, { "entropy": 5.979583978652954, "epoch": 5.261816767165921, "grad_norm": 1.421875, "learning_rate": 0.0002591100340207272, "loss": 4.9639, "mean_token_accuracy": 0.21068847924470901, "num_tokens": 117313052.0, "step": 67630 }, { "entropy": 5.978602600097656, "epoch": 5.262205796537638, "grad_norm": 1.5, "learning_rate": 0.0002590823877555343, "loss": 4.9695, "mean_token_accuracy": 0.2220069244503975, "num_tokens": 117321807.0, "step": 67635 }, { "entropy": 5.9941566467285154, "epoch": 5.262594825909356, "grad_norm": 1.5390625, "learning_rate": 0.0002590547417318657, "loss": 4.9741, "mean_token_accuracy": 0.2164134278893471, "num_tokens": 117330646.0, "step": 67640 }, { "entropy": 5.9821264266967775, "epoch": 5.262983855281074, "grad_norm": 1.515625, "learning_rate": 0.0002590270959501411, "loss": 4.9202, "mean_token_accuracy": 0.2209234282374382, "num_tokens": 117339585.0, "step": 67645 }, { "entropy": 5.936215734481811, "epoch": 5.263372884652791, "grad_norm": 1.515625, "learning_rate": 0.00025899945041077995, "loss": 4.9165, "mean_token_accuracy": 0.2252254456281662, "num_tokens": 117348036.0, "step": 67650 }, { "entropy": 5.981120204925537, "epoch": 5.263761914024509, "grad_norm": 1.5, "learning_rate": 0.00025897180511420164, "loss": 4.9656, "mean_token_accuracy": 0.21870957612991332, "num_tokens": 117356397.0, "step": 67655 }, { "entropy": 5.909137630462647, "epoch": 5.264150943396227, "grad_norm": 1.421875, "learning_rate": 0.00025894416006082564, "loss": 4.9706, "mean_token_accuracy": 0.21453395932912828, "num_tokens": 117364832.0, "step": 67660 }, { "entropy": 6.024837303161621, "epoch": 5.264539972767944, "grad_norm": 1.484375, "learning_rate": 0.00025891651525107145, "loss": 5.0307, "mean_token_accuracy": 0.21221089661121367, "num_tokens": 117373987.0, "step": 67665 }, { "entropy": 5.924259185791016, "epoch": 5.264929002139661, "grad_norm": 1.4453125, "learning_rate": 0.00025888887068535853, "loss": 4.9363, "mean_token_accuracy": 0.2253112718462944, "num_tokens": 117382279.0, "step": 67670 }, { "entropy": 5.88146653175354, "epoch": 5.265318031511379, "grad_norm": 1.5390625, "learning_rate": 0.00025886122636410643, "loss": 4.8252, "mean_token_accuracy": 0.22863128185272216, "num_tokens": 117390682.0, "step": 67675 }, { "entropy": 5.972973823547363, "epoch": 5.265707060883097, "grad_norm": 1.46875, "learning_rate": 0.00025883358228773445, "loss": 4.9737, "mean_token_accuracy": 0.21298437863588332, "num_tokens": 117399604.0, "step": 67680 }, { "entropy": 5.974107265472412, "epoch": 5.266096090254814, "grad_norm": 1.4609375, "learning_rate": 0.0002588059384566622, "loss": 4.9382, "mean_token_accuracy": 0.21664115637540818, "num_tokens": 117408483.0, "step": 67685 }, { "entropy": 5.982531023025513, "epoch": 5.266485119626532, "grad_norm": 1.359375, "learning_rate": 0.00025877829487130894, "loss": 5.0071, "mean_token_accuracy": 0.22118644118309022, "num_tokens": 117417838.0, "step": 67690 }, { "entropy": 5.911885738372803, "epoch": 5.26687414899825, "grad_norm": 1.65625, "learning_rate": 0.0002587506515320943, "loss": 4.9648, "mean_token_accuracy": 0.21247802674770355, "num_tokens": 117426486.0, "step": 67695 }, { "entropy": 6.034180974960327, "epoch": 5.267263178369967, "grad_norm": 1.5703125, "learning_rate": 0.0002587230084394377, "loss": 4.982, "mean_token_accuracy": 0.22045515924692155, "num_tokens": 117434839.0, "step": 67700 }, { "entropy": 5.940950727462768, "epoch": 5.267652207741684, "grad_norm": 1.5, "learning_rate": 0.0002586953655937585, "loss": 4.8914, "mean_token_accuracy": 0.21908270418643952, "num_tokens": 117443184.0, "step": 67705 }, { "entropy": 5.961883974075318, "epoch": 5.268041237113402, "grad_norm": 1.5625, "learning_rate": 0.0002586677229954761, "loss": 4.8605, "mean_token_accuracy": 0.22108512967824936, "num_tokens": 117451183.0, "step": 67710 }, { "entropy": 5.968191194534302, "epoch": 5.26843026648512, "grad_norm": 1.4921875, "learning_rate": 0.0002586400806450102, "loss": 4.9178, "mean_token_accuracy": 0.22062088549137115, "num_tokens": 117459804.0, "step": 67715 }, { "entropy": 5.928032255172729, "epoch": 5.268819295856837, "grad_norm": 1.4609375, "learning_rate": 0.00025861243854277986, "loss": 4.8907, "mean_token_accuracy": 0.22233970165252687, "num_tokens": 117469365.0, "step": 67720 }, { "entropy": 5.946619653701783, "epoch": 5.269208325228555, "grad_norm": 1.65625, "learning_rate": 0.0002585847966892048, "loss": 4.9211, "mean_token_accuracy": 0.2221261218190193, "num_tokens": 117477590.0, "step": 67725 }, { "entropy": 6.030374670028687, "epoch": 5.269597354600272, "grad_norm": 1.3359375, "learning_rate": 0.0002585571550847042, "loss": 4.994, "mean_token_accuracy": 0.21638210415840148, "num_tokens": 117487559.0, "step": 67730 }, { "entropy": 5.953281879425049, "epoch": 5.26998638397199, "grad_norm": 1.4140625, "learning_rate": 0.0002585295137296978, "loss": 4.942, "mean_token_accuracy": 0.21133701950311662, "num_tokens": 117496242.0, "step": 67735 }, { "entropy": 6.015468406677246, "epoch": 5.270375413343707, "grad_norm": 1.6328125, "learning_rate": 0.0002585018726246047, "loss": 4.9763, "mean_token_accuracy": 0.21944270133972169, "num_tokens": 117504281.0, "step": 67740 }, { "entropy": 6.0001167297363285, "epoch": 5.270764442715425, "grad_norm": 1.53125, "learning_rate": 0.0002584742317698444, "loss": 4.9362, "mean_token_accuracy": 0.21966755539178848, "num_tokens": 117512969.0, "step": 67745 }, { "entropy": 6.020474290847778, "epoch": 5.271153472087143, "grad_norm": 1.515625, "learning_rate": 0.00025844659116583635, "loss": 5.0873, "mean_token_accuracy": 0.20550852715969087, "num_tokens": 117522189.0, "step": 67750 }, { "entropy": 5.962597846984863, "epoch": 5.27154250145886, "grad_norm": 1.4609375, "learning_rate": 0.0002584189508129999, "loss": 4.9809, "mean_token_accuracy": 0.21557166278362275, "num_tokens": 117530994.0, "step": 67755 }, { "entropy": 5.887809085845947, "epoch": 5.271931530830578, "grad_norm": 1.4609375, "learning_rate": 0.0002583913107117544, "loss": 4.7914, "mean_token_accuracy": 0.22135401368141175, "num_tokens": 117539967.0, "step": 67760 }, { "entropy": 5.936080694198608, "epoch": 5.272320560202295, "grad_norm": 1.46875, "learning_rate": 0.0002583636708625195, "loss": 4.9337, "mean_token_accuracy": 0.21798508018255233, "num_tokens": 117549220.0, "step": 67765 }, { "entropy": 5.9961730480194095, "epoch": 5.272709589574013, "grad_norm": 1.515625, "learning_rate": 0.0002583360312657143, "loss": 4.9364, "mean_token_accuracy": 0.22163780629634858, "num_tokens": 117557039.0, "step": 67770 }, { "entropy": 5.976439046859741, "epoch": 5.27309861894573, "grad_norm": 1.453125, "learning_rate": 0.00025830839192175835, "loss": 4.889, "mean_token_accuracy": 0.228982974588871, "num_tokens": 117564828.0, "step": 67775 }, { "entropy": 5.9513756275177006, "epoch": 5.273487648317448, "grad_norm": 1.546875, "learning_rate": 0.000258280752831071, "loss": 4.9524, "mean_token_accuracy": 0.2213790625333786, "num_tokens": 117573860.0, "step": 67780 }, { "entropy": 5.9165136337280275, "epoch": 5.273876677689166, "grad_norm": 1.4765625, "learning_rate": 0.00025825311399407157, "loss": 4.9534, "mean_token_accuracy": 0.2195112094283104, "num_tokens": 117582536.0, "step": 67785 }, { "entropy": 5.99713888168335, "epoch": 5.274265707060883, "grad_norm": 1.4921875, "learning_rate": 0.0002582254754111795, "loss": 4.9689, "mean_token_accuracy": 0.21397227942943572, "num_tokens": 117590986.0, "step": 67790 }, { "entropy": 5.961357498168946, "epoch": 5.274654736432601, "grad_norm": 1.515625, "learning_rate": 0.0002581978370828142, "loss": 4.9269, "mean_token_accuracy": 0.21776940077543258, "num_tokens": 117599637.0, "step": 67795 }, { "entropy": 5.983619546890258, "epoch": 5.275043765804318, "grad_norm": 1.4609375, "learning_rate": 0.0002581701990093949, "loss": 4.9712, "mean_token_accuracy": 0.21711639165878296, "num_tokens": 117608367.0, "step": 67800 }, { "entropy": 6.005378198623657, "epoch": 5.275432795176036, "grad_norm": 1.4609375, "learning_rate": 0.0002581425611913411, "loss": 5.0244, "mean_token_accuracy": 0.2101608246564865, "num_tokens": 117617787.0, "step": 67805 }, { "entropy": 6.033416843414306, "epoch": 5.275821824547753, "grad_norm": 1.578125, "learning_rate": 0.0002581149236290721, "loss": 5.0229, "mean_token_accuracy": 0.21322278380393983, "num_tokens": 117625925.0, "step": 67810 }, { "entropy": 5.912703609466552, "epoch": 5.276210853919471, "grad_norm": 1.5546875, "learning_rate": 0.0002580872863230072, "loss": 4.9021, "mean_token_accuracy": 0.21993038505315782, "num_tokens": 117634970.0, "step": 67815 }, { "entropy": 5.904629468917847, "epoch": 5.276599883291189, "grad_norm": 1.328125, "learning_rate": 0.00025805964927356584, "loss": 4.8427, "mean_token_accuracy": 0.22811115980148317, "num_tokens": 117644177.0, "step": 67820 }, { "entropy": 5.9897730350494385, "epoch": 5.276988912662906, "grad_norm": 1.6640625, "learning_rate": 0.00025803201248116725, "loss": 4.9331, "mean_token_accuracy": 0.2187851458787918, "num_tokens": 117651901.0, "step": 67825 }, { "entropy": 6.023100519180298, "epoch": 5.277377942034624, "grad_norm": 1.5, "learning_rate": 0.00025800437594623095, "loss": 5.0683, "mean_token_accuracy": 0.2137395054101944, "num_tokens": 117661464.0, "step": 67830 }, { "entropy": 6.041058111190796, "epoch": 5.277766971406341, "grad_norm": 1.6015625, "learning_rate": 0.0002579767396691762, "loss": 5.0698, "mean_token_accuracy": 0.20243177711963653, "num_tokens": 117670260.0, "step": 67835 }, { "entropy": 5.9597327709198, "epoch": 5.278156000778059, "grad_norm": 1.4140625, "learning_rate": 0.00025794910365042233, "loss": 4.9781, "mean_token_accuracy": 0.21887548863887787, "num_tokens": 117679432.0, "step": 67840 }, { "entropy": 5.975893640518189, "epoch": 5.278545030149776, "grad_norm": 1.484375, "learning_rate": 0.00025792146789038875, "loss": 4.9305, "mean_token_accuracy": 0.21914642602205275, "num_tokens": 117687668.0, "step": 67845 }, { "entropy": 5.979355573654175, "epoch": 5.278934059521494, "grad_norm": 1.5, "learning_rate": 0.0002578938323894946, "loss": 4.9431, "mean_token_accuracy": 0.2167784407734871, "num_tokens": 117696950.0, "step": 67850 }, { "entropy": 5.969687986373901, "epoch": 5.279323088893212, "grad_norm": 1.4140625, "learning_rate": 0.00025786619714815933, "loss": 4.958, "mean_token_accuracy": 0.2214703619480133, "num_tokens": 117706003.0, "step": 67855 }, { "entropy": 5.878231811523437, "epoch": 5.279712118264929, "grad_norm": 1.4765625, "learning_rate": 0.0002578385621668023, "loss": 4.9065, "mean_token_accuracy": 0.22559356838464736, "num_tokens": 117715142.0, "step": 67860 }, { "entropy": 5.925505590438843, "epoch": 5.280101147636646, "grad_norm": 1.515625, "learning_rate": 0.0002578109274458427, "loss": 5.0236, "mean_token_accuracy": 0.20252797305583953, "num_tokens": 117724500.0, "step": 67865 }, { "entropy": 5.98210186958313, "epoch": 5.280490177008364, "grad_norm": 1.484375, "learning_rate": 0.00025778329298569997, "loss": 4.9728, "mean_token_accuracy": 0.21505208164453507, "num_tokens": 117733056.0, "step": 67870 }, { "entropy": 6.0959666728973385, "epoch": 5.280879206380082, "grad_norm": 1.3671875, "learning_rate": 0.0002577556587867934, "loss": 5.114, "mean_token_accuracy": 0.2012871116399765, "num_tokens": 117741854.0, "step": 67875 }, { "entropy": 5.953777217864991, "epoch": 5.281268235751799, "grad_norm": 1.5625, "learning_rate": 0.00025772802484954217, "loss": 4.9346, "mean_token_accuracy": 0.22369454950094222, "num_tokens": 117751104.0, "step": 67880 }, { "entropy": 5.927759790420533, "epoch": 5.281657265123517, "grad_norm": 1.484375, "learning_rate": 0.00025770039117436566, "loss": 4.8596, "mean_token_accuracy": 0.21584402471780778, "num_tokens": 117758529.0, "step": 67885 }, { "entropy": 6.077860927581787, "epoch": 5.282046294495235, "grad_norm": 1.6015625, "learning_rate": 0.0002576727577616832, "loss": 5.073, "mean_token_accuracy": 0.21445686370134354, "num_tokens": 117768011.0, "step": 67890 }, { "entropy": 5.977238130569458, "epoch": 5.282435323866952, "grad_norm": 1.4921875, "learning_rate": 0.00025764512461191413, "loss": 4.9224, "mean_token_accuracy": 0.21748718172311782, "num_tokens": 117776461.0, "step": 67895 }, { "entropy": 6.0271893501281735, "epoch": 5.282824353238669, "grad_norm": 1.4921875, "learning_rate": 0.0002576174917254776, "loss": 5.0406, "mean_token_accuracy": 0.21793659180402755, "num_tokens": 117785634.0, "step": 67900 }, { "entropy": 5.940367364883423, "epoch": 5.283213382610387, "grad_norm": 1.484375, "learning_rate": 0.00025758985910279304, "loss": 4.9148, "mean_token_accuracy": 0.22272120118141175, "num_tokens": 117794287.0, "step": 67905 }, { "entropy": 5.9818182468414305, "epoch": 5.283602411982105, "grad_norm": 1.5390625, "learning_rate": 0.0002575622267442796, "loss": 4.9645, "mean_token_accuracy": 0.22372244745492936, "num_tokens": 117802664.0, "step": 67910 }, { "entropy": 5.955509662628174, "epoch": 5.283991441353822, "grad_norm": 1.390625, "learning_rate": 0.0002575345946503566, "loss": 4.9604, "mean_token_accuracy": 0.2203936383128166, "num_tokens": 117811620.0, "step": 67915 }, { "entropy": 5.955630826950073, "epoch": 5.28438047072554, "grad_norm": 1.53125, "learning_rate": 0.00025750696282144335, "loss": 4.9616, "mean_token_accuracy": 0.2234398052096367, "num_tokens": 117819925.0, "step": 67920 }, { "entropy": 6.028868961334228, "epoch": 5.284769500097258, "grad_norm": 1.359375, "learning_rate": 0.0002574793312579592, "loss": 5.0959, "mean_token_accuracy": 0.20464053750038147, "num_tokens": 117829734.0, "step": 67925 }, { "entropy": 5.969915533065796, "epoch": 5.2851585294689745, "grad_norm": 1.5390625, "learning_rate": 0.00025745169996032317, "loss": 4.8887, "mean_token_accuracy": 0.22824964821338653, "num_tokens": 117837751.0, "step": 67930 }, { "entropy": 5.988775396347046, "epoch": 5.285547558840692, "grad_norm": 1.46875, "learning_rate": 0.0002574240689289547, "loss": 4.9376, "mean_token_accuracy": 0.21857507079839705, "num_tokens": 117846661.0, "step": 67935 }, { "entropy": 5.8921019554138185, "epoch": 5.28593658821241, "grad_norm": 1.5, "learning_rate": 0.00025739643816427305, "loss": 4.9003, "mean_token_accuracy": 0.22008283138275148, "num_tokens": 117855802.0, "step": 67940 }, { "entropy": 5.98436222076416, "epoch": 5.286325617584128, "grad_norm": 1.4765625, "learning_rate": 0.0002573688076666974, "loss": 4.9289, "mean_token_accuracy": 0.2196797251701355, "num_tokens": 117864150.0, "step": 67945 }, { "entropy": 5.946332740783691, "epoch": 5.286714646955845, "grad_norm": 1.4453125, "learning_rate": 0.00025734117743664704, "loss": 4.969, "mean_token_accuracy": 0.21360151022672652, "num_tokens": 117873048.0, "step": 67950 }, { "entropy": 5.972882223129273, "epoch": 5.287103676327563, "grad_norm": 1.4296875, "learning_rate": 0.0002573135474745412, "loss": 4.9244, "mean_token_accuracy": 0.218148772418499, "num_tokens": 117881607.0, "step": 67955 }, { "entropy": 5.906508207321167, "epoch": 5.287492705699281, "grad_norm": 1.5390625, "learning_rate": 0.00025728591778079906, "loss": 4.8494, "mean_token_accuracy": 0.23455032259225844, "num_tokens": 117890627.0, "step": 67960 }, { "entropy": 5.9497801780700685, "epoch": 5.2878817350709975, "grad_norm": 1.4453125, "learning_rate": 0.00025725828835584, "loss": 4.9612, "mean_token_accuracy": 0.22152750939130783, "num_tokens": 117900213.0, "step": 67965 }, { "entropy": 6.033314752578735, "epoch": 5.288270764442715, "grad_norm": 1.453125, "learning_rate": 0.00025723065920008314, "loss": 4.9385, "mean_token_accuracy": 0.21802776604890822, "num_tokens": 117909215.0, "step": 67970 }, { "entropy": 5.9280993938446045, "epoch": 5.288659793814433, "grad_norm": 1.453125, "learning_rate": 0.0002572030303139477, "loss": 4.8972, "mean_token_accuracy": 0.21690268963575363, "num_tokens": 117918372.0, "step": 67975 }, { "entropy": 5.977475547790528, "epoch": 5.2890488231861505, "grad_norm": 1.4921875, "learning_rate": 0.00025717540169785304, "loss": 4.9767, "mean_token_accuracy": 0.21845737844705582, "num_tokens": 117928135.0, "step": 67980 }, { "entropy": 5.955758666992187, "epoch": 5.289437852557868, "grad_norm": 1.5, "learning_rate": 0.0002571477733522183, "loss": 4.9561, "mean_token_accuracy": 0.2193334624171257, "num_tokens": 117937047.0, "step": 67985 }, { "entropy": 5.980472660064697, "epoch": 5.289826881929586, "grad_norm": 1.46875, "learning_rate": 0.00025712014527746264, "loss": 4.9589, "mean_token_accuracy": 0.22593217939138413, "num_tokens": 117945387.0, "step": 67990 }, { "entropy": 5.935102701187134, "epoch": 5.290215911301304, "grad_norm": 1.453125, "learning_rate": 0.0002570925174740053, "loss": 4.9159, "mean_token_accuracy": 0.2308706074953079, "num_tokens": 117953845.0, "step": 67995 }, { "entropy": 5.95358452796936, "epoch": 5.2906049406730205, "grad_norm": 1.5859375, "learning_rate": 0.0002570648899422655, "loss": 4.9419, "mean_token_accuracy": 0.2197519749403, "num_tokens": 117962009.0, "step": 68000 }, { "entropy": 5.917940092086792, "epoch": 5.290993970044738, "grad_norm": 1.46875, "learning_rate": 0.0002570372626826625, "loss": 5.0294, "mean_token_accuracy": 0.216458360850811, "num_tokens": 117971314.0, "step": 68005 }, { "entropy": 5.9393883228302, "epoch": 5.291382999416456, "grad_norm": 1.6015625, "learning_rate": 0.0002570096356956155, "loss": 4.9566, "mean_token_accuracy": 0.2139214336872101, "num_tokens": 117979074.0, "step": 68010 }, { "entropy": 5.950162029266357, "epoch": 5.2917720287881735, "grad_norm": 1.6171875, "learning_rate": 0.00025698200898154354, "loss": 4.8842, "mean_token_accuracy": 0.225216306746006, "num_tokens": 117987806.0, "step": 68015 }, { "entropy": 5.956601572036743, "epoch": 5.292161058159891, "grad_norm": 1.5546875, "learning_rate": 0.00025695438254086595, "loss": 4.9192, "mean_token_accuracy": 0.21760119795799254, "num_tokens": 117997392.0, "step": 68020 }, { "entropy": 5.928466129302978, "epoch": 5.292550087531609, "grad_norm": 1.578125, "learning_rate": 0.0002569267563740018, "loss": 4.907, "mean_token_accuracy": 0.23111872673034667, "num_tokens": 118006117.0, "step": 68025 }, { "entropy": 5.98553352355957, "epoch": 5.292939116903327, "grad_norm": 1.453125, "learning_rate": 0.0002568991304813704, "loss": 4.9663, "mean_token_accuracy": 0.2185293436050415, "num_tokens": 118014550.0, "step": 68030 }, { "entropy": 5.987444067001343, "epoch": 5.2933281462750434, "grad_norm": 1.4765625, "learning_rate": 0.00025687150486339094, "loss": 4.9628, "mean_token_accuracy": 0.22105581909418107, "num_tokens": 118023389.0, "step": 68035 }, { "entropy": 6.007596063613891, "epoch": 5.293717175646761, "grad_norm": 1.5390625, "learning_rate": 0.00025684387952048247, "loss": 4.972, "mean_token_accuracy": 0.2186387985944748, "num_tokens": 118031949.0, "step": 68040 }, { "entropy": 5.985912704467774, "epoch": 5.294106205018479, "grad_norm": 1.453125, "learning_rate": 0.00025681625445306435, "loss": 4.9793, "mean_token_accuracy": 0.21374718844890594, "num_tokens": 118040788.0, "step": 68045 }, { "entropy": 5.890295886993409, "epoch": 5.2944952343901965, "grad_norm": 1.4609375, "learning_rate": 0.0002567886296615555, "loss": 4.9065, "mean_token_accuracy": 0.2262079581618309, "num_tokens": 118049945.0, "step": 68050 }, { "entropy": 6.016670751571655, "epoch": 5.294884263761914, "grad_norm": 1.4453125, "learning_rate": 0.00025676100514637523, "loss": 5.008, "mean_token_accuracy": 0.2097589373588562, "num_tokens": 118059205.0, "step": 68055 }, { "entropy": 5.9184588432312015, "epoch": 5.295273293133632, "grad_norm": 1.46875, "learning_rate": 0.00025673338090794276, "loss": 4.9077, "mean_token_accuracy": 0.2226523905992508, "num_tokens": 118067444.0, "step": 68060 }, { "entropy": 5.921497631072998, "epoch": 5.295662322505349, "grad_norm": 1.59375, "learning_rate": 0.0002567057569466771, "loss": 4.8873, "mean_token_accuracy": 0.22092754393815994, "num_tokens": 118075269.0, "step": 68065 }, { "entropy": 5.992755174636841, "epoch": 5.296051351877066, "grad_norm": 1.578125, "learning_rate": 0.00025667813326299746, "loss": 5.0033, "mean_token_accuracy": 0.21625787168741226, "num_tokens": 118083424.0, "step": 68070 }, { "entropy": 5.982354688644409, "epoch": 5.296440381248784, "grad_norm": 1.546875, "learning_rate": 0.00025665050985732295, "loss": 4.9258, "mean_token_accuracy": 0.21906355321407317, "num_tokens": 118091505.0, "step": 68075 }, { "entropy": 5.979870986938477, "epoch": 5.296829410620502, "grad_norm": 1.515625, "learning_rate": 0.00025662288673007286, "loss": 4.9384, "mean_token_accuracy": 0.22124415040016174, "num_tokens": 118100111.0, "step": 68080 }, { "entropy": 5.960256814956665, "epoch": 5.2972184399922195, "grad_norm": 1.4765625, "learning_rate": 0.00025659526388166617, "loss": 4.9362, "mean_token_accuracy": 0.21691467016935348, "num_tokens": 118109174.0, "step": 68085 }, { "entropy": 5.955220937728882, "epoch": 5.297607469363937, "grad_norm": 1.578125, "learning_rate": 0.00025656764131252194, "loss": 4.9253, "mean_token_accuracy": 0.21405142694711685, "num_tokens": 118117611.0, "step": 68090 }, { "entropy": 6.006940126419067, "epoch": 5.297996498735655, "grad_norm": 1.625, "learning_rate": 0.0002565400190230595, "loss": 4.98, "mean_token_accuracy": 0.21333175748586655, "num_tokens": 118126585.0, "step": 68095 }, { "entropy": 5.958860731124878, "epoch": 5.298385528107372, "grad_norm": 1.4453125, "learning_rate": 0.0002565123970136978, "loss": 4.8851, "mean_token_accuracy": 0.21939504593610765, "num_tokens": 118135430.0, "step": 68100 }, { "entropy": 5.982917213439942, "epoch": 5.298774557479089, "grad_norm": 1.53125, "learning_rate": 0.0002564847752848562, "loss": 4.9586, "mean_token_accuracy": 0.2155200347304344, "num_tokens": 118144332.0, "step": 68105 }, { "entropy": 5.982881307601929, "epoch": 5.299163586850807, "grad_norm": 1.4375, "learning_rate": 0.00025645715383695357, "loss": 4.9705, "mean_token_accuracy": 0.21116551607847214, "num_tokens": 118153588.0, "step": 68110 }, { "entropy": 5.98503942489624, "epoch": 5.299552616222525, "grad_norm": 1.484375, "learning_rate": 0.0002564295326704092, "loss": 4.9316, "mean_token_accuracy": 0.21525246649980545, "num_tokens": 118161286.0, "step": 68115 }, { "entropy": 5.94559006690979, "epoch": 5.2999416455942425, "grad_norm": 1.4609375, "learning_rate": 0.0002564019117856421, "loss": 4.9233, "mean_token_accuracy": 0.22242445647716522, "num_tokens": 118169392.0, "step": 68120 }, { "entropy": 5.9724445819854735, "epoch": 5.30033067496596, "grad_norm": 1.5859375, "learning_rate": 0.00025637429118307133, "loss": 4.9784, "mean_token_accuracy": 0.21505019217729568, "num_tokens": 118178178.0, "step": 68125 }, { "entropy": 5.9332911491394045, "epoch": 5.300719704337677, "grad_norm": 1.4296875, "learning_rate": 0.0002563466708631161, "loss": 4.9254, "mean_token_accuracy": 0.22648773789405824, "num_tokens": 118187492.0, "step": 68130 }, { "entropy": 5.850452327728272, "epoch": 5.301108733709395, "grad_norm": 1.34375, "learning_rate": 0.0002563190508261954, "loss": 4.7431, "mean_token_accuracy": 0.23320295065641403, "num_tokens": 118197123.0, "step": 68135 }, { "entropy": 5.9589324474334715, "epoch": 5.301497763081112, "grad_norm": 1.46875, "learning_rate": 0.00025629143107272837, "loss": 4.9996, "mean_token_accuracy": 0.20879955291748048, "num_tokens": 118206600.0, "step": 68140 }, { "entropy": 5.9717308521270756, "epoch": 5.30188679245283, "grad_norm": 1.53125, "learning_rate": 0.0002562638116031341, "loss": 5.0459, "mean_token_accuracy": 0.22101704478263856, "num_tokens": 118215250.0, "step": 68145 }, { "entropy": 5.975613689422607, "epoch": 5.302275821824548, "grad_norm": 1.5703125, "learning_rate": 0.0002562361924178317, "loss": 4.9306, "mean_token_accuracy": 0.21861519962549208, "num_tokens": 118223739.0, "step": 68150 }, { "entropy": 5.971756792068481, "epoch": 5.3026648511962655, "grad_norm": 1.609375, "learning_rate": 0.00025620857351724017, "loss": 4.9969, "mean_token_accuracy": 0.2177880585193634, "num_tokens": 118232446.0, "step": 68155 }, { "entropy": 5.951284408569336, "epoch": 5.303053880567983, "grad_norm": 1.578125, "learning_rate": 0.00025618095490177864, "loss": 4.9258, "mean_token_accuracy": 0.21249286234378814, "num_tokens": 118241057.0, "step": 68160 }, { "entropy": 6.0204792499542235, "epoch": 5.303442909939701, "grad_norm": 1.4609375, "learning_rate": 0.00025615333657186615, "loss": 4.9703, "mean_token_accuracy": 0.21929802149534225, "num_tokens": 118249173.0, "step": 68165 }, { "entropy": 5.925481271743775, "epoch": 5.303831939311418, "grad_norm": 1.34375, "learning_rate": 0.0002561257185279218, "loss": 4.917, "mean_token_accuracy": 0.22514718025922775, "num_tokens": 118257976.0, "step": 68170 }, { "entropy": 5.991113662719727, "epoch": 5.304220968683135, "grad_norm": 1.4765625, "learning_rate": 0.00025609810077036467, "loss": 4.9904, "mean_token_accuracy": 0.21183126419782639, "num_tokens": 118266836.0, "step": 68175 }, { "entropy": 5.938324594497681, "epoch": 5.304609998054853, "grad_norm": 1.453125, "learning_rate": 0.0002560704832996137, "loss": 4.8784, "mean_token_accuracy": 0.2308041587471962, "num_tokens": 118275442.0, "step": 68180 }, { "entropy": 6.046685028076172, "epoch": 5.304999027426571, "grad_norm": 1.53125, "learning_rate": 0.0002560428661160881, "loss": 5.0754, "mean_token_accuracy": 0.20719914883375168, "num_tokens": 118284106.0, "step": 68185 }, { "entropy": 5.921615505218506, "epoch": 5.3053880567982885, "grad_norm": 1.5546875, "learning_rate": 0.00025601524922020676, "loss": 4.843, "mean_token_accuracy": 0.2375665009021759, "num_tokens": 118292541.0, "step": 68190 }, { "entropy": 5.964902257919311, "epoch": 5.305777086170006, "grad_norm": 1.4296875, "learning_rate": 0.0002559876326123889, "loss": 4.9218, "mean_token_accuracy": 0.21858649998903273, "num_tokens": 118301168.0, "step": 68195 }, { "entropy": 5.951911878585816, "epoch": 5.306166115541723, "grad_norm": 1.5546875, "learning_rate": 0.0002559600162930534, "loss": 4.9684, "mean_token_accuracy": 0.2081761747598648, "num_tokens": 118309652.0, "step": 68200 }, { "entropy": 5.943492221832275, "epoch": 5.306555144913441, "grad_norm": 1.4296875, "learning_rate": 0.0002559324002626193, "loss": 4.8758, "mean_token_accuracy": 0.22620240598917007, "num_tokens": 118318985.0, "step": 68205 }, { "entropy": 5.958231639862061, "epoch": 5.306944174285158, "grad_norm": 1.4375, "learning_rate": 0.0002559047845215057, "loss": 4.9272, "mean_token_accuracy": 0.22273888438940048, "num_tokens": 118327637.0, "step": 68210 }, { "entropy": 6.005891990661621, "epoch": 5.307333203656876, "grad_norm": 1.515625, "learning_rate": 0.0002558771690701316, "loss": 4.9555, "mean_token_accuracy": 0.21176522672176362, "num_tokens": 118336584.0, "step": 68215 }, { "entropy": 5.993188714981079, "epoch": 5.307722233028594, "grad_norm": 1.515625, "learning_rate": 0.000255849553908916, "loss": 5.0426, "mean_token_accuracy": 0.22552598416805267, "num_tokens": 118345211.0, "step": 68220 }, { "entropy": 5.980638742446899, "epoch": 5.3081112624003115, "grad_norm": 1.4296875, "learning_rate": 0.00025582193903827795, "loss": 4.9514, "mean_token_accuracy": 0.2156098872423172, "num_tokens": 118353894.0, "step": 68225 }, { "entropy": 5.970308065414429, "epoch": 5.308500291772029, "grad_norm": 1.6171875, "learning_rate": 0.0002557943244586365, "loss": 4.9545, "mean_token_accuracy": 0.2234280914068222, "num_tokens": 118362683.0, "step": 68230 }, { "entropy": 5.937115097045899, "epoch": 5.308889321143746, "grad_norm": 1.4453125, "learning_rate": 0.00025576671017041053, "loss": 5.0311, "mean_token_accuracy": 0.22063904255628586, "num_tokens": 118371860.0, "step": 68235 }, { "entropy": 5.953917074203491, "epoch": 5.309278350515464, "grad_norm": 1.53125, "learning_rate": 0.0002557390961740192, "loss": 4.9982, "mean_token_accuracy": 0.21407688558101653, "num_tokens": 118380404.0, "step": 68240 }, { "entropy": 6.024641227722168, "epoch": 5.309667379887181, "grad_norm": 1.5, "learning_rate": 0.00025571148246988137, "loss": 5.0293, "mean_token_accuracy": 0.21674028486013414, "num_tokens": 118388467.0, "step": 68245 }, { "entropy": 6.040879106521606, "epoch": 5.310056409258899, "grad_norm": 1.4453125, "learning_rate": 0.00025568386905841614, "loss": 4.9306, "mean_token_accuracy": 0.2168242484331131, "num_tokens": 118396975.0, "step": 68250 }, { "entropy": 5.991826057434082, "epoch": 5.310445438630617, "grad_norm": 1.5, "learning_rate": 0.0002556562559400424, "loss": 4.9542, "mean_token_accuracy": 0.2128160759806633, "num_tokens": 118405339.0, "step": 68255 }, { "entropy": 5.961790084838867, "epoch": 5.3108344680023345, "grad_norm": 1.4375, "learning_rate": 0.0002556286431151792, "loss": 4.9437, "mean_token_accuracy": 0.22477167546749116, "num_tokens": 118413328.0, "step": 68260 }, { "entropy": 5.993412780761719, "epoch": 5.311223497374051, "grad_norm": 1.625, "learning_rate": 0.0002556010305842456, "loss": 5.0271, "mean_token_accuracy": 0.2083316907286644, "num_tokens": 118421337.0, "step": 68265 }, { "entropy": 6.012970876693726, "epoch": 5.311612526745769, "grad_norm": 1.390625, "learning_rate": 0.0002555734183476603, "loss": 5.0028, "mean_token_accuracy": 0.21002837568521499, "num_tokens": 118429692.0, "step": 68270 }, { "entropy": 5.974552822113037, "epoch": 5.312001556117487, "grad_norm": 1.3828125, "learning_rate": 0.0002555458064058427, "loss": 4.9687, "mean_token_accuracy": 0.21571324467658998, "num_tokens": 118438904.0, "step": 68275 }, { "entropy": 6.106216669082642, "epoch": 5.312390585489204, "grad_norm": 1.5, "learning_rate": 0.00025551819475921135, "loss": 5.0399, "mean_token_accuracy": 0.2099968209862709, "num_tokens": 118447697.0, "step": 68280 }, { "entropy": 6.034918403625488, "epoch": 5.312779614860922, "grad_norm": 1.546875, "learning_rate": 0.0002554905834081854, "loss": 4.9794, "mean_token_accuracy": 0.22075135856866837, "num_tokens": 118456163.0, "step": 68285 }, { "entropy": 5.998078775405884, "epoch": 5.31316864423264, "grad_norm": 1.40625, "learning_rate": 0.0002554629723531838, "loss": 4.9722, "mean_token_accuracy": 0.21584932506084442, "num_tokens": 118465152.0, "step": 68290 }, { "entropy": 5.969123029708863, "epoch": 5.3135576736043575, "grad_norm": 1.4765625, "learning_rate": 0.0002554353615946255, "loss": 4.9829, "mean_token_accuracy": 0.22040852159261703, "num_tokens": 118474580.0, "step": 68295 }, { "entropy": 6.009294319152832, "epoch": 5.313946702976074, "grad_norm": 1.40625, "learning_rate": 0.00025540775113292943, "loss": 4.9668, "mean_token_accuracy": 0.21590973138809205, "num_tokens": 118484216.0, "step": 68300 }, { "entropy": 5.981473350524903, "epoch": 5.314335732347792, "grad_norm": 1.4140625, "learning_rate": 0.0002553801409685146, "loss": 4.965, "mean_token_accuracy": 0.21797425746917726, "num_tokens": 118493889.0, "step": 68305 }, { "entropy": 6.050318050384521, "epoch": 5.31472476171951, "grad_norm": 1.5234375, "learning_rate": 0.00025535253110179994, "loss": 5.0414, "mean_token_accuracy": 0.2085738003253937, "num_tokens": 118502134.0, "step": 68310 }, { "entropy": 5.916487503051758, "epoch": 5.315113791091227, "grad_norm": 1.390625, "learning_rate": 0.0002553249215332043, "loss": 4.8786, "mean_token_accuracy": 0.22368923872709273, "num_tokens": 118510478.0, "step": 68315 }, { "entropy": 5.959349298477173, "epoch": 5.315502820462945, "grad_norm": 1.6328125, "learning_rate": 0.00025529731226314663, "loss": 5.0048, "mean_token_accuracy": 0.22175308018922807, "num_tokens": 118518492.0, "step": 68320 }, { "entropy": 5.987621402740478, "epoch": 5.315891849834663, "grad_norm": 1.5234375, "learning_rate": 0.0002552697032920459, "loss": 4.9791, "mean_token_accuracy": 0.2137409344315529, "num_tokens": 118527033.0, "step": 68325 }, { "entropy": 6.014165019989013, "epoch": 5.3162808792063805, "grad_norm": 1.515625, "learning_rate": 0.00025524209462032105, "loss": 4.9244, "mean_token_accuracy": 0.21551700532436371, "num_tokens": 118534850.0, "step": 68330 }, { "entropy": 5.948311710357666, "epoch": 5.316669908578097, "grad_norm": 1.578125, "learning_rate": 0.0002552144862483909, "loss": 4.9215, "mean_token_accuracy": 0.21659501343965532, "num_tokens": 118543470.0, "step": 68335 }, { "entropy": 5.898744010925293, "epoch": 5.317058937949815, "grad_norm": 1.375, "learning_rate": 0.0002551868781766745, "loss": 4.9192, "mean_token_accuracy": 0.21884360611438752, "num_tokens": 118553052.0, "step": 68340 }, { "entropy": 5.887262535095215, "epoch": 5.317447967321533, "grad_norm": 1.5078125, "learning_rate": 0.0002551592704055907, "loss": 4.8407, "mean_token_accuracy": 0.22473496496677398, "num_tokens": 118561466.0, "step": 68345 }, { "entropy": 5.9857958316802975, "epoch": 5.31783699669325, "grad_norm": 1.515625, "learning_rate": 0.00025513166293555836, "loss": 4.9155, "mean_token_accuracy": 0.22444014698266984, "num_tokens": 118569693.0, "step": 68350 }, { "entropy": 5.983163213729858, "epoch": 5.318226026064968, "grad_norm": 1.484375, "learning_rate": 0.00025510405576699636, "loss": 4.9726, "mean_token_accuracy": 0.206914921104908, "num_tokens": 118578217.0, "step": 68355 }, { "entropy": 5.913167285919189, "epoch": 5.318615055436686, "grad_norm": 1.6171875, "learning_rate": 0.0002550764489003237, "loss": 4.82, "mean_token_accuracy": 0.22570654302835463, "num_tokens": 118586438.0, "step": 68360 }, { "entropy": 6.013030624389648, "epoch": 5.3190040848084035, "grad_norm": 1.5234375, "learning_rate": 0.0002550488423359592, "loss": 5.0326, "mean_token_accuracy": 0.21578581333160402, "num_tokens": 118594665.0, "step": 68365 }, { "entropy": 5.933290910720825, "epoch": 5.31939311418012, "grad_norm": 1.515625, "learning_rate": 0.00025502123607432174, "loss": 4.9248, "mean_token_accuracy": 0.22106171399354935, "num_tokens": 118602899.0, "step": 68370 }, { "entropy": 5.946288394927978, "epoch": 5.319782143551838, "grad_norm": 1.5703125, "learning_rate": 0.00025499363011583024, "loss": 4.92, "mean_token_accuracy": 0.2160491868853569, "num_tokens": 118611319.0, "step": 68375 }, { "entropy": 5.980380535125732, "epoch": 5.320171172923556, "grad_norm": 1.3203125, "learning_rate": 0.0002549660244609036, "loss": 4.9197, "mean_token_accuracy": 0.21199082732200622, "num_tokens": 118620312.0, "step": 68380 }, { "entropy": 5.947138166427612, "epoch": 5.320560202295273, "grad_norm": 1.5078125, "learning_rate": 0.0002549384191099607, "loss": 4.8199, "mean_token_accuracy": 0.22625802308321, "num_tokens": 118629243.0, "step": 68385 }, { "entropy": 5.9385583877563475, "epoch": 5.320949231666991, "grad_norm": 1.6484375, "learning_rate": 0.00025491081406342025, "loss": 4.9144, "mean_token_accuracy": 0.23004505932331085, "num_tokens": 118637914.0, "step": 68390 }, { "entropy": 5.9176939010620115, "epoch": 5.321338261038709, "grad_norm": 1.421875, "learning_rate": 0.00025488320932170127, "loss": 4.859, "mean_token_accuracy": 0.2311266303062439, "num_tokens": 118646638.0, "step": 68395 }, { "entropy": 5.982489109039307, "epoch": 5.321727290410426, "grad_norm": 1.4140625, "learning_rate": 0.0002548556048852226, "loss": 4.9968, "mean_token_accuracy": 0.21720242202281953, "num_tokens": 118655548.0, "step": 68400 }, { "entropy": 5.995305442810059, "epoch": 5.322116319782143, "grad_norm": 1.609375, "learning_rate": 0.00025482800075440296, "loss": 4.96, "mean_token_accuracy": 0.22541037648916246, "num_tokens": 118664120.0, "step": 68405 }, { "entropy": 6.02892918586731, "epoch": 5.322505349153861, "grad_norm": 1.5078125, "learning_rate": 0.0002548003969296614, "loss": 5.0218, "mean_token_accuracy": 0.20813868045806885, "num_tokens": 118672479.0, "step": 68410 }, { "entropy": 5.993100118637085, "epoch": 5.322894378525579, "grad_norm": 1.5, "learning_rate": 0.00025477279341141665, "loss": 4.9462, "mean_token_accuracy": 0.21778721660375594, "num_tokens": 118681413.0, "step": 68415 }, { "entropy": 5.911940383911133, "epoch": 5.323283407897296, "grad_norm": 1.625, "learning_rate": 0.0002547451902000875, "loss": 4.902, "mean_token_accuracy": 0.21896504163742064, "num_tokens": 118690059.0, "step": 68420 }, { "entropy": 5.88900671005249, "epoch": 5.323672437269014, "grad_norm": 1.6875, "learning_rate": 0.00025471758729609284, "loss": 4.8751, "mean_token_accuracy": 0.2289841964840889, "num_tokens": 118698304.0, "step": 68425 }, { "entropy": 5.903467750549316, "epoch": 5.324061466640732, "grad_norm": 1.5, "learning_rate": 0.00025468998469985155, "loss": 4.9246, "mean_token_accuracy": 0.22387812584638594, "num_tokens": 118706680.0, "step": 68430 }, { "entropy": 6.032144355773926, "epoch": 5.324450496012449, "grad_norm": 1.609375, "learning_rate": 0.0002546623824117824, "loss": 4.9573, "mean_token_accuracy": 0.2247374400496483, "num_tokens": 118714981.0, "step": 68435 }, { "entropy": 5.9985755443572994, "epoch": 5.324839525384166, "grad_norm": 1.484375, "learning_rate": 0.0002546347804323043, "loss": 4.9437, "mean_token_accuracy": 0.22131745368242264, "num_tokens": 118723043.0, "step": 68440 }, { "entropy": 5.965850782394409, "epoch": 5.325228554755884, "grad_norm": 1.4296875, "learning_rate": 0.0002546071787618359, "loss": 5.0168, "mean_token_accuracy": 0.21590138226747513, "num_tokens": 118731049.0, "step": 68445 }, { "entropy": 5.961363506317139, "epoch": 5.325617584127602, "grad_norm": 1.703125, "learning_rate": 0.0002545795774007962, "loss": 4.9596, "mean_token_accuracy": 0.2234008714556694, "num_tokens": 118739809.0, "step": 68450 }, { "entropy": 5.969890117645264, "epoch": 5.326006613499319, "grad_norm": 1.484375, "learning_rate": 0.0002545519763496038, "loss": 4.9428, "mean_token_accuracy": 0.2242473766207695, "num_tokens": 118748400.0, "step": 68455 }, { "entropy": 5.944365453720093, "epoch": 5.326395642871037, "grad_norm": 1.4609375, "learning_rate": 0.00025452437560867774, "loss": 4.8911, "mean_token_accuracy": 0.22004154622554778, "num_tokens": 118757225.0, "step": 68460 }, { "entropy": 5.957920122146606, "epoch": 5.326784672242754, "grad_norm": 1.5703125, "learning_rate": 0.0002544967751784367, "loss": 4.9189, "mean_token_accuracy": 0.21668036580085753, "num_tokens": 118765493.0, "step": 68465 }, { "entropy": 6.005521821975708, "epoch": 5.327173701614472, "grad_norm": 1.3828125, "learning_rate": 0.00025446917505929937, "loss": 5.0024, "mean_token_accuracy": 0.21753767281770706, "num_tokens": 118774822.0, "step": 68470 }, { "entropy": 6.021592807769776, "epoch": 5.327562730986189, "grad_norm": 1.5625, "learning_rate": 0.0002544415752516846, "loss": 4.9972, "mean_token_accuracy": 0.21167413592338563, "num_tokens": 118783091.0, "step": 68475 }, { "entropy": 6.002358293533325, "epoch": 5.327951760357907, "grad_norm": 1.5234375, "learning_rate": 0.00025441397575601125, "loss": 5.0597, "mean_token_accuracy": 0.2069375604391098, "num_tokens": 118792658.0, "step": 68480 }, { "entropy": 6.0177875518798825, "epoch": 5.328340789729625, "grad_norm": 1.46875, "learning_rate": 0.00025438637657269805, "loss": 5.0303, "mean_token_accuracy": 0.21282542794942855, "num_tokens": 118801281.0, "step": 68485 }, { "entropy": 6.019017696380615, "epoch": 5.328729819101342, "grad_norm": 1.5234375, "learning_rate": 0.0002543587777021636, "loss": 4.9905, "mean_token_accuracy": 0.2160816252231598, "num_tokens": 118809551.0, "step": 68490 }, { "entropy": 5.943583059310913, "epoch": 5.32911884847306, "grad_norm": 1.625, "learning_rate": 0.0002543311791448271, "loss": 4.9449, "mean_token_accuracy": 0.21791905611753465, "num_tokens": 118818284.0, "step": 68495 }, { "entropy": 6.0152685165405275, "epoch": 5.329507877844778, "grad_norm": 1.4609375, "learning_rate": 0.00025430358090110705, "loss": 5.0123, "mean_token_accuracy": 0.21641748994588852, "num_tokens": 118827255.0, "step": 68500 }, { "entropy": 5.953259229660034, "epoch": 5.329896907216495, "grad_norm": 1.7265625, "learning_rate": 0.00025427598297142213, "loss": 4.8883, "mean_token_accuracy": 0.2179053395986557, "num_tokens": 118835761.0, "step": 68505 }, { "entropy": 5.948803329467774, "epoch": 5.330285936588212, "grad_norm": 1.546875, "learning_rate": 0.0002542483853561912, "loss": 4.8861, "mean_token_accuracy": 0.22528119534254074, "num_tokens": 118844107.0, "step": 68510 }, { "entropy": 5.9101897239685055, "epoch": 5.33067496595993, "grad_norm": 1.4765625, "learning_rate": 0.000254220788055833, "loss": 4.9372, "mean_token_accuracy": 0.21991024166345596, "num_tokens": 118853392.0, "step": 68515 }, { "entropy": 5.938868665695191, "epoch": 5.331063995331648, "grad_norm": 1.4140625, "learning_rate": 0.0002541931910707662, "loss": 4.9074, "mean_token_accuracy": 0.2271184042096138, "num_tokens": 118861764.0, "step": 68520 }, { "entropy": 6.043102216720581, "epoch": 5.331453024703365, "grad_norm": 1.5, "learning_rate": 0.0002541655944014097, "loss": 4.9838, "mean_token_accuracy": 0.21622209399938583, "num_tokens": 118870389.0, "step": 68525 }, { "entropy": 5.958861303329468, "epoch": 5.331842054075083, "grad_norm": 1.4609375, "learning_rate": 0.0002541379980481821, "loss": 4.9363, "mean_token_accuracy": 0.21867304146289826, "num_tokens": 118878623.0, "step": 68530 }, { "entropy": 5.953266954421997, "epoch": 5.3322310834468, "grad_norm": 1.59375, "learning_rate": 0.0002541104020115022, "loss": 4.9556, "mean_token_accuracy": 0.20903703719377517, "num_tokens": 118886590.0, "step": 68535 }, { "entropy": 5.988226699829101, "epoch": 5.3326201128185176, "grad_norm": 1.4296875, "learning_rate": 0.00025408280629178864, "loss": 5.0029, "mean_token_accuracy": 0.21069106906652452, "num_tokens": 118895898.0, "step": 68540 }, { "entropy": 6.001074028015137, "epoch": 5.333009142190235, "grad_norm": 1.5859375, "learning_rate": 0.0002540552108894603, "loss": 4.9355, "mean_token_accuracy": 0.2175791159272194, "num_tokens": 118904002.0, "step": 68545 }, { "entropy": 5.937737321853637, "epoch": 5.333398171561953, "grad_norm": 1.46875, "learning_rate": 0.0002540276158049358, "loss": 4.8776, "mean_token_accuracy": 0.2239292711019516, "num_tokens": 118912788.0, "step": 68550 }, { "entropy": 5.944146537780762, "epoch": 5.333787200933671, "grad_norm": 1.546875, "learning_rate": 0.00025400002103863367, "loss": 4.9869, "mean_token_accuracy": 0.21585267633199692, "num_tokens": 118921812.0, "step": 68555 }, { "entropy": 5.981778955459594, "epoch": 5.334176230305388, "grad_norm": 1.4296875, "learning_rate": 0.00025397242659097293, "loss": 4.8479, "mean_token_accuracy": 0.2262992739677429, "num_tokens": 118930419.0, "step": 68560 }, { "entropy": 5.90911078453064, "epoch": 5.334565259677106, "grad_norm": 1.546875, "learning_rate": 0.0002539448324623722, "loss": 4.9074, "mean_token_accuracy": 0.22482523918151856, "num_tokens": 118939468.0, "step": 68565 }, { "entropy": 5.95219407081604, "epoch": 5.334954289048823, "grad_norm": 1.53125, "learning_rate": 0.00025391723865325, "loss": 4.9171, "mean_token_accuracy": 0.21627605259418486, "num_tokens": 118948722.0, "step": 68570 }, { "entropy": 6.0599876880645756, "epoch": 5.3353433184205405, "grad_norm": 1.5546875, "learning_rate": 0.00025388964516402527, "loss": 5.0354, "mean_token_accuracy": 0.20854562819004058, "num_tokens": 118956737.0, "step": 68575 }, { "entropy": 6.008223581314087, "epoch": 5.335732347792258, "grad_norm": 1.4765625, "learning_rate": 0.0002538620519951165, "loss": 4.9984, "mean_token_accuracy": 0.21353024393320083, "num_tokens": 118965474.0, "step": 68580 }, { "entropy": 5.914157199859619, "epoch": 5.336121377163976, "grad_norm": 1.5, "learning_rate": 0.00025383445914694245, "loss": 4.8955, "mean_token_accuracy": 0.2215004876255989, "num_tokens": 118974576.0, "step": 68585 }, { "entropy": 5.90371265411377, "epoch": 5.336510406535694, "grad_norm": 1.5078125, "learning_rate": 0.0002538068666199218, "loss": 4.8914, "mean_token_accuracy": 0.21959423571825026, "num_tokens": 118982967.0, "step": 68590 }, { "entropy": 6.0358363628387455, "epoch": 5.336899435907411, "grad_norm": 1.578125, "learning_rate": 0.0002537792744144732, "loss": 5.0072, "mean_token_accuracy": 0.21556587815284728, "num_tokens": 118991356.0, "step": 68595 }, { "entropy": 5.966252040863037, "epoch": 5.337288465279128, "grad_norm": 1.5546875, "learning_rate": 0.0002537516825310154, "loss": 4.8624, "mean_token_accuracy": 0.22226946353912352, "num_tokens": 118999709.0, "step": 68600 }, { "entropy": 5.9338422298431395, "epoch": 5.337677494650846, "grad_norm": 1.5, "learning_rate": 0.0002537240909699669, "loss": 4.9373, "mean_token_accuracy": 0.212609900534153, "num_tokens": 119008238.0, "step": 68605 }, { "entropy": 5.8643840789794925, "epoch": 5.3380665240225635, "grad_norm": 1.453125, "learning_rate": 0.0002536964997317465, "loss": 4.8493, "mean_token_accuracy": 0.2245175674557686, "num_tokens": 119017211.0, "step": 68610 }, { "entropy": 5.98246397972107, "epoch": 5.338455553394281, "grad_norm": 1.3671875, "learning_rate": 0.00025366890881677284, "loss": 5.0023, "mean_token_accuracy": 0.2108254462480545, "num_tokens": 119027006.0, "step": 68615 }, { "entropy": 5.903141260147095, "epoch": 5.338844582765999, "grad_norm": 1.484375, "learning_rate": 0.0002536413182254645, "loss": 4.9172, "mean_token_accuracy": 0.21526656448841094, "num_tokens": 119035700.0, "step": 68620 }, { "entropy": 6.0115643501281735, "epoch": 5.339233612137717, "grad_norm": 1.65625, "learning_rate": 0.00025361372795824015, "loss": 4.969, "mean_token_accuracy": 0.2190668135881424, "num_tokens": 119043703.0, "step": 68625 }, { "entropy": 5.962553262710571, "epoch": 5.339622641509434, "grad_norm": 1.5, "learning_rate": 0.0002535861380155185, "loss": 4.9883, "mean_token_accuracy": 0.21768307238817214, "num_tokens": 119052404.0, "step": 68630 }, { "entropy": 5.941882514953614, "epoch": 5.340011670881151, "grad_norm": 1.5078125, "learning_rate": 0.00025355854839771805, "loss": 4.9274, "mean_token_accuracy": 0.22336046695709227, "num_tokens": 119061377.0, "step": 68635 }, { "entropy": 6.031041860580444, "epoch": 5.340400700252869, "grad_norm": 1.578125, "learning_rate": 0.00025353095910525753, "loss": 4.9964, "mean_token_accuracy": 0.2178083524107933, "num_tokens": 119069206.0, "step": 68640 }, { "entropy": 5.961220407485962, "epoch": 5.3407897296245865, "grad_norm": 1.5078125, "learning_rate": 0.0002535033701385555, "loss": 4.8179, "mean_token_accuracy": 0.22317448407411575, "num_tokens": 119077519.0, "step": 68645 }, { "entropy": 5.862696552276612, "epoch": 5.341178758996304, "grad_norm": 1.5, "learning_rate": 0.0002534757814980307, "loss": 4.865, "mean_token_accuracy": 0.2191338285803795, "num_tokens": 119085899.0, "step": 68650 }, { "entropy": 5.961934614181518, "epoch": 5.341567788368022, "grad_norm": 1.3984375, "learning_rate": 0.00025344819318410167, "loss": 4.9946, "mean_token_accuracy": 0.22243429273366927, "num_tokens": 119095289.0, "step": 68655 }, { "entropy": 6.075289011001587, "epoch": 5.34195681773974, "grad_norm": 1.515625, "learning_rate": 0.00025342060519718693, "loss": 5.0121, "mean_token_accuracy": 0.21083366125822067, "num_tokens": 119104541.0, "step": 68660 }, { "entropy": 6.024787187576294, "epoch": 5.342345847111457, "grad_norm": 1.5625, "learning_rate": 0.00025339301753770515, "loss": 4.9396, "mean_token_accuracy": 0.22392162978649138, "num_tokens": 119113231.0, "step": 68665 }, { "entropy": 5.962022113800049, "epoch": 5.342734876483174, "grad_norm": 1.359375, "learning_rate": 0.000253365430206075, "loss": 5.0162, "mean_token_accuracy": 0.21551752239465713, "num_tokens": 119123319.0, "step": 68670 }, { "entropy": 5.910531759262085, "epoch": 5.343123905854892, "grad_norm": 1.5234375, "learning_rate": 0.0002533378432027149, "loss": 4.8891, "mean_token_accuracy": 0.2244861215353012, "num_tokens": 119132540.0, "step": 68675 }, { "entropy": 6.056602859497071, "epoch": 5.3435129352266095, "grad_norm": 1.65625, "learning_rate": 0.0002533102565280437, "loss": 5.061, "mean_token_accuracy": 0.21344958245754242, "num_tokens": 119141124.0, "step": 68680 }, { "entropy": 5.943327856063843, "epoch": 5.343901964598327, "grad_norm": 1.4140625, "learning_rate": 0.0002532826701824797, "loss": 4.8952, "mean_token_accuracy": 0.22335027754306794, "num_tokens": 119149516.0, "step": 68685 }, { "entropy": 5.980960512161255, "epoch": 5.344290993970045, "grad_norm": 1.515625, "learning_rate": 0.0002532550841664416, "loss": 4.9985, "mean_token_accuracy": 0.21369147151708603, "num_tokens": 119157864.0, "step": 68690 }, { "entropy": 5.9514669418334964, "epoch": 5.344680023341763, "grad_norm": 1.40625, "learning_rate": 0.0002532274984803481, "loss": 4.9378, "mean_token_accuracy": 0.21361672431230544, "num_tokens": 119166707.0, "step": 68695 }, { "entropy": 5.935279464721679, "epoch": 5.34506905271348, "grad_norm": 1.453125, "learning_rate": 0.0002531999131246176, "loss": 4.9127, "mean_token_accuracy": 0.2217701941728592, "num_tokens": 119175219.0, "step": 68700 }, { "entropy": 6.015015602111816, "epoch": 5.345458082085197, "grad_norm": 1.4609375, "learning_rate": 0.0002531723280996687, "loss": 5.0146, "mean_token_accuracy": 0.2138627991080284, "num_tokens": 119185770.0, "step": 68705 }, { "entropy": 5.9967986106872555, "epoch": 5.345847111456915, "grad_norm": 1.5078125, "learning_rate": 0.00025314474340592, "loss": 4.9032, "mean_token_accuracy": 0.21791941672563553, "num_tokens": 119194290.0, "step": 68710 }, { "entropy": 5.938464593887329, "epoch": 5.3462361408286325, "grad_norm": 1.5390625, "learning_rate": 0.00025311715904379004, "loss": 4.9331, "mean_token_accuracy": 0.21329679638147353, "num_tokens": 119203060.0, "step": 68715 }, { "entropy": 5.913239669799805, "epoch": 5.34662517020035, "grad_norm": 1.4375, "learning_rate": 0.00025308957501369737, "loss": 4.9054, "mean_token_accuracy": 0.22053345739841462, "num_tokens": 119211562.0, "step": 68720 }, { "entropy": 6.03177924156189, "epoch": 5.347014199572068, "grad_norm": 1.4375, "learning_rate": 0.00025306199131606055, "loss": 5.0095, "mean_token_accuracy": 0.21362678110599517, "num_tokens": 119220598.0, "step": 68725 }, { "entropy": 5.893276357650757, "epoch": 5.347403228943786, "grad_norm": 1.4765625, "learning_rate": 0.0002530344079512981, "loss": 4.8632, "mean_token_accuracy": 0.2317168653011322, "num_tokens": 119229297.0, "step": 68730 }, { "entropy": 5.872857284545899, "epoch": 5.347792258315502, "grad_norm": 1.4375, "learning_rate": 0.00025300682491982853, "loss": 4.9013, "mean_token_accuracy": 0.21773624420166016, "num_tokens": 119237595.0, "step": 68735 }, { "entropy": 5.911192989349365, "epoch": 5.34818128768722, "grad_norm": 1.40625, "learning_rate": 0.0002529792422220704, "loss": 4.9433, "mean_token_accuracy": 0.21790813207626342, "num_tokens": 119246319.0, "step": 68740 }, { "entropy": 5.922870016098022, "epoch": 5.348570317058938, "grad_norm": 1.46875, "learning_rate": 0.00025295165985844215, "loss": 4.8708, "mean_token_accuracy": 0.2242673695087433, "num_tokens": 119254635.0, "step": 68745 }, { "entropy": 5.994980335235596, "epoch": 5.3489593464306555, "grad_norm": 1.4375, "learning_rate": 0.0002529240778293624, "loss": 5.0166, "mean_token_accuracy": 0.21458190381526948, "num_tokens": 119262681.0, "step": 68750 }, { "entropy": 5.951914262771607, "epoch": 5.349348375802373, "grad_norm": 1.4765625, "learning_rate": 0.00025289649613524954, "loss": 4.9498, "mean_token_accuracy": 0.22685148566961288, "num_tokens": 119271276.0, "step": 68755 }, { "entropy": 5.943306112289429, "epoch": 5.349737405174091, "grad_norm": 1.3359375, "learning_rate": 0.0002528689147765223, "loss": 4.9846, "mean_token_accuracy": 0.21579465121030808, "num_tokens": 119280788.0, "step": 68760 }, { "entropy": 5.982010269165039, "epoch": 5.350126434545809, "grad_norm": 1.3984375, "learning_rate": 0.00025284133375359904, "loss": 5.0165, "mean_token_accuracy": 0.21098989099264145, "num_tokens": 119289627.0, "step": 68765 }, { "entropy": 5.921328067779541, "epoch": 5.350515463917525, "grad_norm": 1.546875, "learning_rate": 0.00025281375306689824, "loss": 4.8808, "mean_token_accuracy": 0.22521564811468125, "num_tokens": 119298038.0, "step": 68770 }, { "entropy": 5.950640058517456, "epoch": 5.350904493289243, "grad_norm": 1.4921875, "learning_rate": 0.00025278617271683846, "loss": 4.917, "mean_token_accuracy": 0.22160522192716597, "num_tokens": 119306371.0, "step": 68775 }, { "entropy": 5.956131553649902, "epoch": 5.351293522660961, "grad_norm": 1.5390625, "learning_rate": 0.0002527585927038381, "loss": 4.9283, "mean_token_accuracy": 0.22353136092424392, "num_tokens": 119315032.0, "step": 68780 }, { "entropy": 5.923272752761841, "epoch": 5.3516825520326785, "grad_norm": 1.4921875, "learning_rate": 0.00025273101302831575, "loss": 4.9689, "mean_token_accuracy": 0.22264983952045442, "num_tokens": 119323657.0, "step": 68785 }, { "entropy": 5.89572434425354, "epoch": 5.352071581404396, "grad_norm": 1.4296875, "learning_rate": 0.00025270343369068976, "loss": 4.8189, "mean_token_accuracy": 0.22656875997781753, "num_tokens": 119332461.0, "step": 68790 }, { "entropy": 5.9316164493560795, "epoch": 5.352460610776114, "grad_norm": 1.4765625, "learning_rate": 0.0002526758546913787, "loss": 4.9257, "mean_token_accuracy": 0.21910176426172256, "num_tokens": 119341213.0, "step": 68795 }, { "entropy": 5.902061414718628, "epoch": 5.352849640147831, "grad_norm": 1.453125, "learning_rate": 0.0002526482760308011, "loss": 4.9052, "mean_token_accuracy": 0.22096736878156661, "num_tokens": 119349547.0, "step": 68800 }, { "entropy": 5.9578498840332035, "epoch": 5.353238669519548, "grad_norm": 1.59375, "learning_rate": 0.00025262069770937525, "loss": 4.9621, "mean_token_accuracy": 0.2123180150985718, "num_tokens": 119358854.0, "step": 68805 }, { "entropy": 5.978305673599243, "epoch": 5.353627698891266, "grad_norm": 1.5, "learning_rate": 0.0002525931197275197, "loss": 4.9178, "mean_token_accuracy": 0.21753152459859848, "num_tokens": 119368352.0, "step": 68810 }, { "entropy": 5.995351791381836, "epoch": 5.354016728262984, "grad_norm": 1.5390625, "learning_rate": 0.00025256554208565296, "loss": 4.9632, "mean_token_accuracy": 0.21783646643161775, "num_tokens": 119376818.0, "step": 68815 }, { "entropy": 5.967716693878174, "epoch": 5.3544057576347015, "grad_norm": 1.53125, "learning_rate": 0.00025253796478419323, "loss": 4.9243, "mean_token_accuracy": 0.21736811250448226, "num_tokens": 119386080.0, "step": 68820 }, { "entropy": 5.9799854278564455, "epoch": 5.354794787006419, "grad_norm": 1.640625, "learning_rate": 0.0002525103878235593, "loss": 4.946, "mean_token_accuracy": 0.2186930298805237, "num_tokens": 119394672.0, "step": 68825 }, { "entropy": 5.9518153190612795, "epoch": 5.355183816378137, "grad_norm": 1.6171875, "learning_rate": 0.0002524828112041694, "loss": 4.9276, "mean_token_accuracy": 0.22101527452468872, "num_tokens": 119402952.0, "step": 68830 }, { "entropy": 5.923309564590454, "epoch": 5.355572845749854, "grad_norm": 1.5390625, "learning_rate": 0.00025245523492644197, "loss": 4.9485, "mean_token_accuracy": 0.2108168348670006, "num_tokens": 119411833.0, "step": 68835 }, { "entropy": 5.863316869735717, "epoch": 5.355961875121571, "grad_norm": 1.4296875, "learning_rate": 0.0002524276589907955, "loss": 4.7678, "mean_token_accuracy": 0.2340243935585022, "num_tokens": 119420671.0, "step": 68840 }, { "entropy": 5.980744647979736, "epoch": 5.356350904493289, "grad_norm": 1.5703125, "learning_rate": 0.00025240008339764844, "loss": 5.0261, "mean_token_accuracy": 0.21652208566665648, "num_tokens": 119430072.0, "step": 68845 }, { "entropy": 6.012799406051636, "epoch": 5.356739933865007, "grad_norm": 1.5625, "learning_rate": 0.000252372508147419, "loss": 4.9887, "mean_token_accuracy": 0.21683751940727233, "num_tokens": 119438882.0, "step": 68850 }, { "entropy": 6.049327325820923, "epoch": 5.3571289632367245, "grad_norm": 1.5, "learning_rate": 0.0002523449332405258, "loss": 5.0186, "mean_token_accuracy": 0.21043152064085008, "num_tokens": 119447454.0, "step": 68855 }, { "entropy": 6.023149633407593, "epoch": 5.357517992608442, "grad_norm": 1.609375, "learning_rate": 0.0002523173586773872, "loss": 4.99, "mean_token_accuracy": 0.2194528415799141, "num_tokens": 119455393.0, "step": 68860 }, { "entropy": 5.895042753219604, "epoch": 5.35790702198016, "grad_norm": 1.4296875, "learning_rate": 0.0002522897844584216, "loss": 4.9156, "mean_token_accuracy": 0.2255195766687393, "num_tokens": 119463769.0, "step": 68865 }, { "entropy": 5.91559362411499, "epoch": 5.358296051351877, "grad_norm": 1.53125, "learning_rate": 0.00025226221058404733, "loss": 4.9978, "mean_token_accuracy": 0.21756433099508285, "num_tokens": 119473026.0, "step": 68870 }, { "entropy": 5.951250457763672, "epoch": 5.358685080723594, "grad_norm": 1.484375, "learning_rate": 0.0002522346370546828, "loss": 4.894, "mean_token_accuracy": 0.22102364897727966, "num_tokens": 119480965.0, "step": 68875 }, { "entropy": 5.952284908294677, "epoch": 5.359074110095312, "grad_norm": 1.578125, "learning_rate": 0.0002522070638707465, "loss": 4.8487, "mean_token_accuracy": 0.2278127208352089, "num_tokens": 119489273.0, "step": 68880 }, { "entropy": 5.860654592514038, "epoch": 5.35946313946703, "grad_norm": 1.46875, "learning_rate": 0.00025217949103265665, "loss": 4.8856, "mean_token_accuracy": 0.2216194674372673, "num_tokens": 119497914.0, "step": 68885 }, { "entropy": 5.956837701797485, "epoch": 5.3598521688387475, "grad_norm": 1.5234375, "learning_rate": 0.00025215191854083166, "loss": 5.0194, "mean_token_accuracy": 0.21451205611228943, "num_tokens": 119506963.0, "step": 68890 }, { "entropy": 5.969401216506958, "epoch": 5.360241198210465, "grad_norm": 1.4453125, "learning_rate": 0.00025212434639568996, "loss": 5.0005, "mean_token_accuracy": 0.20681636929512023, "num_tokens": 119515787.0, "step": 68895 }, { "entropy": 6.029029846191406, "epoch": 5.360630227582183, "grad_norm": 1.46875, "learning_rate": 0.00025209677459765, "loss": 5.0569, "mean_token_accuracy": 0.20825241208076478, "num_tokens": 119523562.0, "step": 68900 }, { "entropy": 5.988119888305664, "epoch": 5.3610192569539, "grad_norm": 1.46875, "learning_rate": 0.0002520692031471299, "loss": 5.0264, "mean_token_accuracy": 0.21438842117786408, "num_tokens": 119532526.0, "step": 68905 }, { "entropy": 5.924050760269165, "epoch": 5.361408286325617, "grad_norm": 1.3828125, "learning_rate": 0.00025204163204454826, "loss": 4.9478, "mean_token_accuracy": 0.21393176764249802, "num_tokens": 119540844.0, "step": 68910 }, { "entropy": 6.0246318817138675, "epoch": 5.361797315697335, "grad_norm": 1.5078125, "learning_rate": 0.0002520140612903233, "loss": 5.0154, "mean_token_accuracy": 0.21892350167036057, "num_tokens": 119550185.0, "step": 68915 }, { "entropy": 5.993782663345337, "epoch": 5.362186345069053, "grad_norm": 1.4609375, "learning_rate": 0.0002519864908848733, "loss": 4.9329, "mean_token_accuracy": 0.21636709272861482, "num_tokens": 119559493.0, "step": 68920 }, { "entropy": 6.001300716400147, "epoch": 5.3625753744407705, "grad_norm": 1.3984375, "learning_rate": 0.00025195892082861674, "loss": 4.9085, "mean_token_accuracy": 0.22554118931293488, "num_tokens": 119567876.0, "step": 68925 }, { "entropy": 6.000425863265991, "epoch": 5.362964403812488, "grad_norm": 1.609375, "learning_rate": 0.0002519313511219719, "loss": 4.9492, "mean_token_accuracy": 0.2203022673726082, "num_tokens": 119576463.0, "step": 68930 }, { "entropy": 5.993487453460693, "epoch": 5.363353433184205, "grad_norm": 1.546875, "learning_rate": 0.00025190378176535703, "loss": 4.9074, "mean_token_accuracy": 0.22356517612934113, "num_tokens": 119584947.0, "step": 68935 }, { "entropy": 5.936607694625854, "epoch": 5.363742462555923, "grad_norm": 1.5, "learning_rate": 0.0002518762127591905, "loss": 4.8393, "mean_token_accuracy": 0.2291971743106842, "num_tokens": 119593005.0, "step": 68940 }, { "entropy": 5.870314455032348, "epoch": 5.36413149192764, "grad_norm": 1.5546875, "learning_rate": 0.0002518486441038907, "loss": 4.9061, "mean_token_accuracy": 0.21924936771392822, "num_tokens": 119601849.0, "step": 68945 }, { "entropy": 5.920074892044068, "epoch": 5.364520521299358, "grad_norm": 1.546875, "learning_rate": 0.0002518210757998758, "loss": 4.8736, "mean_token_accuracy": 0.2212374359369278, "num_tokens": 119610065.0, "step": 68950 }, { "entropy": 5.937868976593018, "epoch": 5.364909550671076, "grad_norm": 1.46875, "learning_rate": 0.0002517935078475642, "loss": 4.8637, "mean_token_accuracy": 0.22682141065597533, "num_tokens": 119618770.0, "step": 68955 }, { "entropy": 6.048112106323242, "epoch": 5.3652985800427935, "grad_norm": 1.4296875, "learning_rate": 0.0002517659402473742, "loss": 5.0452, "mean_token_accuracy": 0.2091663584113121, "num_tokens": 119627768.0, "step": 68960 }, { "entropy": 6.023472642898559, "epoch": 5.365687609414511, "grad_norm": 1.515625, "learning_rate": 0.0002517383729997241, "loss": 5.0737, "mean_token_accuracy": 0.2108045145869255, "num_tokens": 119636260.0, "step": 68965 }, { "entropy": 6.016500473022461, "epoch": 5.366076638786228, "grad_norm": 1.359375, "learning_rate": 0.0002517108061050321, "loss": 5.054, "mean_token_accuracy": 0.21104868203401567, "num_tokens": 119645451.0, "step": 68970 }, { "entropy": 5.973011016845703, "epoch": 5.366465668157946, "grad_norm": 1.4140625, "learning_rate": 0.00025168323956371657, "loss": 4.9712, "mean_token_accuracy": 0.2180153101682663, "num_tokens": 119654699.0, "step": 68975 }, { "entropy": 6.032042121887207, "epoch": 5.366854697529663, "grad_norm": 1.53125, "learning_rate": 0.00025165567337619583, "loss": 5.0174, "mean_token_accuracy": 0.20992347300052644, "num_tokens": 119663082.0, "step": 68980 }, { "entropy": 5.9762200832366945, "epoch": 5.367243726901381, "grad_norm": 1.484375, "learning_rate": 0.000251628107542888, "loss": 4.9704, "mean_token_accuracy": 0.21943359822034836, "num_tokens": 119671268.0, "step": 68985 }, { "entropy": 5.938281059265137, "epoch": 5.367632756273099, "grad_norm": 1.546875, "learning_rate": 0.00025160054206421143, "loss": 4.9808, "mean_token_accuracy": 0.21456556469202043, "num_tokens": 119680070.0, "step": 68990 }, { "entropy": 5.933156585693359, "epoch": 5.3680217856448165, "grad_norm": 1.46875, "learning_rate": 0.0002515729769405845, "loss": 4.8534, "mean_token_accuracy": 0.22508912831544875, "num_tokens": 119689403.0, "step": 68995 }, { "entropy": 5.866895914077759, "epoch": 5.368410815016533, "grad_norm": 1.4140625, "learning_rate": 0.0002515454121724253, "loss": 4.7769, "mean_token_accuracy": 0.23196562379598618, "num_tokens": 119697844.0, "step": 69000 }, { "epoch": 5.368410815016533, "eval_entropy": 5.6759912096157565, "eval_loss": 5.055768966674805, "eval_mean_token_accuracy": 0.2220340483213297, "eval_num_tokens": 119697844.0, "eval_runtime": 21.809, "eval_samples_per_second": 1905.547, "eval_steps_per_second": 238.205, "step": 69000 }, { "entropy": 6.009350156784057, "epoch": 5.368799844388251, "grad_norm": 1.5078125, "learning_rate": 0.00025151784776015216, "loss": 5.0461, "mean_token_accuracy": 0.21573394536972046, "num_tokens": 119707171.0, "step": 69005 }, { "entropy": 5.9767499446868895, "epoch": 5.369188873759969, "grad_norm": 1.5390625, "learning_rate": 0.0002514902837041833, "loss": 5.0589, "mean_token_accuracy": 0.21176643669605255, "num_tokens": 119715897.0, "step": 69010 }, { "entropy": 5.961584901809692, "epoch": 5.369577903131686, "grad_norm": 1.390625, "learning_rate": 0.00025146272000493695, "loss": 4.9272, "mean_token_accuracy": 0.2251289814710617, "num_tokens": 119724480.0, "step": 69015 }, { "entropy": 6.04992642402649, "epoch": 5.369966932503404, "grad_norm": 1.4140625, "learning_rate": 0.0002514351566628313, "loss": 5.0425, "mean_token_accuracy": 0.2147315561771393, "num_tokens": 119733005.0, "step": 69020 }, { "entropy": 6.094898653030396, "epoch": 5.370355961875122, "grad_norm": 1.484375, "learning_rate": 0.0002514075936782847, "loss": 5.0591, "mean_token_accuracy": 0.21183206588029863, "num_tokens": 119741243.0, "step": 69025 }, { "entropy": 5.960351753234863, "epoch": 5.3707449912468395, "grad_norm": 1.5234375, "learning_rate": 0.0002513800310517153, "loss": 5.0027, "mean_token_accuracy": 0.2116766095161438, "num_tokens": 119749343.0, "step": 69030 }, { "entropy": 5.962866926193238, "epoch": 5.371134020618557, "grad_norm": 1.4375, "learning_rate": 0.0002513524687835414, "loss": 4.9898, "mean_token_accuracy": 0.21040924340486528, "num_tokens": 119757708.0, "step": 69035 }, { "entropy": 5.946325826644897, "epoch": 5.371523049990274, "grad_norm": 1.4765625, "learning_rate": 0.0002513249068741811, "loss": 4.9451, "mean_token_accuracy": 0.214374540746212, "num_tokens": 119767146.0, "step": 69040 }, { "entropy": 5.975495672225952, "epoch": 5.371912079361992, "grad_norm": 1.5625, "learning_rate": 0.00025129734532405265, "loss": 4.9711, "mean_token_accuracy": 0.2156537339091301, "num_tokens": 119775046.0, "step": 69045 }, { "entropy": 6.006795835494995, "epoch": 5.372301108733709, "grad_norm": 1.5078125, "learning_rate": 0.00025126978413357424, "loss": 4.9572, "mean_token_accuracy": 0.216485196352005, "num_tokens": 119783336.0, "step": 69050 }, { "entropy": 5.910364151000977, "epoch": 5.372690138105427, "grad_norm": 1.4140625, "learning_rate": 0.0002512422233031641, "loss": 4.9406, "mean_token_accuracy": 0.21487195044755936, "num_tokens": 119792659.0, "step": 69055 }, { "entropy": 5.893155813217163, "epoch": 5.373079167477145, "grad_norm": 1.421875, "learning_rate": 0.0002512146628332404, "loss": 4.892, "mean_token_accuracy": 0.211874321103096, "num_tokens": 119800913.0, "step": 69060 }, { "entropy": 6.048960638046265, "epoch": 5.3734681968488625, "grad_norm": 1.6875, "learning_rate": 0.0002511871027242214, "loss": 5.0652, "mean_token_accuracy": 0.20502713620662688, "num_tokens": 119809011.0, "step": 69065 }, { "entropy": 5.94715142250061, "epoch": 5.373857226220579, "grad_norm": 1.5703125, "learning_rate": 0.0002511595429765251, "loss": 4.8936, "mean_token_accuracy": 0.2197125792503357, "num_tokens": 119817839.0, "step": 69070 }, { "entropy": 6.030389451980591, "epoch": 5.374246255592297, "grad_norm": 1.5703125, "learning_rate": 0.00025113198359056986, "loss": 5.0478, "mean_token_accuracy": 0.21966323852539063, "num_tokens": 119826309.0, "step": 69075 }, { "entropy": 5.977067613601685, "epoch": 5.374635284964015, "grad_norm": 1.546875, "learning_rate": 0.0002511044245667738, "loss": 4.9675, "mean_token_accuracy": 0.21827393919229507, "num_tokens": 119834630.0, "step": 69080 }, { "entropy": 5.986836051940918, "epoch": 5.375024314335732, "grad_norm": 1.59375, "learning_rate": 0.000251076865905555, "loss": 4.9787, "mean_token_accuracy": 0.21972154527902604, "num_tokens": 119843079.0, "step": 69085 }, { "entropy": 6.018704652786255, "epoch": 5.37541334370745, "grad_norm": 1.5, "learning_rate": 0.00025104930760733163, "loss": 5.0091, "mean_token_accuracy": 0.2117392063140869, "num_tokens": 119851594.0, "step": 69090 }, { "entropy": 6.061796617507935, "epoch": 5.375802373079168, "grad_norm": 1.53125, "learning_rate": 0.000251021749672522, "loss": 5.0208, "mean_token_accuracy": 0.2097836196422577, "num_tokens": 119859882.0, "step": 69095 }, { "entropy": 5.951039886474609, "epoch": 5.3761914024508854, "grad_norm": 1.578125, "learning_rate": 0.00025099419210154413, "loss": 4.9339, "mean_token_accuracy": 0.21719225645065307, "num_tokens": 119868424.0, "step": 69100 }, { "entropy": 5.882094097137451, "epoch": 5.376580431822602, "grad_norm": 1.421875, "learning_rate": 0.0002509666348948162, "loss": 4.8073, "mean_token_accuracy": 0.22546813637018204, "num_tokens": 119877691.0, "step": 69105 }, { "entropy": 6.0222697257995605, "epoch": 5.37696946119432, "grad_norm": 1.484375, "learning_rate": 0.00025093907805275636, "loss": 5.0194, "mean_token_accuracy": 0.20675883889198304, "num_tokens": 119886146.0, "step": 69110 }, { "entropy": 5.9277040481567385, "epoch": 5.377358490566038, "grad_norm": 1.4921875, "learning_rate": 0.00025091152157578266, "loss": 4.829, "mean_token_accuracy": 0.22571858018636703, "num_tokens": 119894692.0, "step": 69115 }, { "entropy": 6.020661449432373, "epoch": 5.377747519937755, "grad_norm": 1.4296875, "learning_rate": 0.0002508839654643133, "loss": 5.0239, "mean_token_accuracy": 0.21016445010900497, "num_tokens": 119904777.0, "step": 69120 }, { "entropy": 5.988295364379883, "epoch": 5.378136549309473, "grad_norm": 1.4765625, "learning_rate": 0.0002508564097187664, "loss": 4.9028, "mean_token_accuracy": 0.2235170915722847, "num_tokens": 119913136.0, "step": 69125 }, { "entropy": 5.9395452499389645, "epoch": 5.378525578681191, "grad_norm": 1.5234375, "learning_rate": 0.00025082885433956007, "loss": 4.8699, "mean_token_accuracy": 0.21961246579885482, "num_tokens": 119921571.0, "step": 69130 }, { "entropy": 5.9511559009552, "epoch": 5.3789146080529076, "grad_norm": 1.4609375, "learning_rate": 0.00025080129932711234, "loss": 4.9268, "mean_token_accuracy": 0.22589248716831206, "num_tokens": 119929520.0, "step": 69135 }, { "entropy": 5.959663963317871, "epoch": 5.379303637424625, "grad_norm": 1.609375, "learning_rate": 0.0002507737446818414, "loss": 4.9051, "mean_token_accuracy": 0.2242049589753151, "num_tokens": 119937477.0, "step": 69140 }, { "entropy": 5.9346459865570065, "epoch": 5.379692666796343, "grad_norm": 1.4453125, "learning_rate": 0.0002507461904041653, "loss": 4.8859, "mean_token_accuracy": 0.2235795497894287, "num_tokens": 119945927.0, "step": 69145 }, { "entropy": 5.9584068775177, "epoch": 5.380081696168061, "grad_norm": 1.484375, "learning_rate": 0.00025071863649450216, "loss": 4.9542, "mean_token_accuracy": 0.21586691290140153, "num_tokens": 119954066.0, "step": 69150 }, { "entropy": 5.970383834838867, "epoch": 5.380470725539778, "grad_norm": 1.53125, "learning_rate": 0.00025069108295327006, "loss": 4.9412, "mean_token_accuracy": 0.2197898104786873, "num_tokens": 119962925.0, "step": 69155 }, { "entropy": 5.985500478744507, "epoch": 5.380859754911496, "grad_norm": 1.59375, "learning_rate": 0.00025066352978088706, "loss": 4.9597, "mean_token_accuracy": 0.22405468970537185, "num_tokens": 119971451.0, "step": 69160 }, { "entropy": 5.944410133361816, "epoch": 5.381248784283214, "grad_norm": 1.5078125, "learning_rate": 0.0002506359769777713, "loss": 4.8942, "mean_token_accuracy": 0.22176973074674605, "num_tokens": 119979851.0, "step": 69165 }, { "entropy": 5.943067502975464, "epoch": 5.3816378136549305, "grad_norm": 1.3828125, "learning_rate": 0.0002506084245443408, "loss": 4.9228, "mean_token_accuracy": 0.21691677570343018, "num_tokens": 119988877.0, "step": 69170 }, { "entropy": 5.969129180908203, "epoch": 5.382026843026648, "grad_norm": 1.5859375, "learning_rate": 0.0002505808724810137, "loss": 5.0873, "mean_token_accuracy": 0.21134822815656662, "num_tokens": 119997324.0, "step": 69175 }, { "entropy": 5.942006778717041, "epoch": 5.382415872398366, "grad_norm": 1.4453125, "learning_rate": 0.00025055332078820794, "loss": 5.0195, "mean_token_accuracy": 0.2085981547832489, "num_tokens": 120006171.0, "step": 69180 }, { "entropy": 6.032240676879883, "epoch": 5.382804901770084, "grad_norm": 1.4375, "learning_rate": 0.0002505257694663416, "loss": 4.9768, "mean_token_accuracy": 0.21140389889478683, "num_tokens": 120014812.0, "step": 69185 }, { "entropy": 6.0560871124267575, "epoch": 5.383193931141801, "grad_norm": 1.4609375, "learning_rate": 0.0002504982185158328, "loss": 5.0074, "mean_token_accuracy": 0.21245020031929016, "num_tokens": 120023437.0, "step": 69190 }, { "entropy": 5.920071125030518, "epoch": 5.383582960513519, "grad_norm": 1.546875, "learning_rate": 0.0002504706679370995, "loss": 4.8072, "mean_token_accuracy": 0.228926420211792, "num_tokens": 120031540.0, "step": 69195 }, { "entropy": 5.942682266235352, "epoch": 5.383971989885237, "grad_norm": 1.5390625, "learning_rate": 0.0002504431177305598, "loss": 4.9477, "mean_token_accuracy": 0.2171502470970154, "num_tokens": 120040093.0, "step": 69200 }, { "entropy": 5.996459531784057, "epoch": 5.3843610192569535, "grad_norm": 1.65625, "learning_rate": 0.0002504155678966317, "loss": 4.9527, "mean_token_accuracy": 0.21904054284095764, "num_tokens": 120047822.0, "step": 69205 }, { "entropy": 5.991739082336426, "epoch": 5.384750048628671, "grad_norm": 1.5625, "learning_rate": 0.0002503880184357333, "loss": 5.0335, "mean_token_accuracy": 0.20824511498212814, "num_tokens": 120056295.0, "step": 69210 }, { "entropy": 5.976065826416016, "epoch": 5.385139078000389, "grad_norm": 1.59375, "learning_rate": 0.00025036046934828244, "loss": 4.8966, "mean_token_accuracy": 0.2248357802629471, "num_tokens": 120065274.0, "step": 69215 }, { "entropy": 6.010432338714599, "epoch": 5.385528107372107, "grad_norm": 1.515625, "learning_rate": 0.00025033292063469714, "loss": 4.9251, "mean_token_accuracy": 0.21944453865289687, "num_tokens": 120074162.0, "step": 69220 }, { "entropy": 5.90080156326294, "epoch": 5.385917136743824, "grad_norm": 1.546875, "learning_rate": 0.00025030537229539567, "loss": 4.8955, "mean_token_accuracy": 0.22178859412670135, "num_tokens": 120083208.0, "step": 69225 }, { "entropy": 5.910979413986206, "epoch": 5.386306166115542, "grad_norm": 1.5, "learning_rate": 0.0002502778243307958, "loss": 4.9729, "mean_token_accuracy": 0.21390208452939988, "num_tokens": 120092264.0, "step": 69230 }, { "entropy": 5.933062887191772, "epoch": 5.38669519548726, "grad_norm": 1.484375, "learning_rate": 0.00025025027674131567, "loss": 4.9453, "mean_token_accuracy": 0.21369398832321168, "num_tokens": 120100654.0, "step": 69235 }, { "entropy": 5.9579109191894535, "epoch": 5.3870842248589765, "grad_norm": 1.5234375, "learning_rate": 0.00025022272952737317, "loss": 4.8984, "mean_token_accuracy": 0.21949789375066758, "num_tokens": 120108974.0, "step": 69240 }, { "entropy": 6.00877013206482, "epoch": 5.387473254230694, "grad_norm": 1.4375, "learning_rate": 0.0002501951826893863, "loss": 4.9163, "mean_token_accuracy": 0.216525998711586, "num_tokens": 120118110.0, "step": 69245 }, { "entropy": 5.987317895889282, "epoch": 5.387862283602412, "grad_norm": 1.484375, "learning_rate": 0.0002501676362277731, "loss": 4.9412, "mean_token_accuracy": 0.22301646322011948, "num_tokens": 120126110.0, "step": 69250 }, { "entropy": 5.912262868881226, "epoch": 5.38825131297413, "grad_norm": 1.4765625, "learning_rate": 0.00025014009014295136, "loss": 4.9656, "mean_token_accuracy": 0.21361180394887924, "num_tokens": 120135122.0, "step": 69255 }, { "entropy": 5.950713443756103, "epoch": 5.388640342345847, "grad_norm": 1.4765625, "learning_rate": 0.0002501125444353393, "loss": 4.9308, "mean_token_accuracy": 0.22395459264516832, "num_tokens": 120143745.0, "step": 69260 }, { "entropy": 5.993258094787597, "epoch": 5.389029371717565, "grad_norm": 1.53125, "learning_rate": 0.0002500849991053547, "loss": 4.9762, "mean_token_accuracy": 0.20731472820043564, "num_tokens": 120152005.0, "step": 69265 }, { "entropy": 5.922664165496826, "epoch": 5.389418401089282, "grad_norm": 1.421875, "learning_rate": 0.00025005745415341565, "loss": 4.905, "mean_token_accuracy": 0.22606851011514664, "num_tokens": 120161206.0, "step": 69270 }, { "entropy": 5.994931745529175, "epoch": 5.3898074304609995, "grad_norm": 1.5546875, "learning_rate": 0.00025002990957994, "loss": 4.9464, "mean_token_accuracy": 0.2155529424548149, "num_tokens": 120169199.0, "step": 69275 }, { "entropy": 5.94662446975708, "epoch": 5.390196459832717, "grad_norm": 1.546875, "learning_rate": 0.00025000236538534577, "loss": 4.9554, "mean_token_accuracy": 0.2191656529903412, "num_tokens": 120177959.0, "step": 69280 }, { "entropy": 5.960764312744141, "epoch": 5.390585489204435, "grad_norm": 1.5390625, "learning_rate": 0.00024997482157005074, "loss": 4.8922, "mean_token_accuracy": 0.22175944298505784, "num_tokens": 120186679.0, "step": 69285 }, { "entropy": 5.921430540084839, "epoch": 5.390974518576153, "grad_norm": 1.5546875, "learning_rate": 0.000249947278134473, "loss": 4.8694, "mean_token_accuracy": 0.22561158686876298, "num_tokens": 120195186.0, "step": 69290 }, { "entropy": 5.995001173019409, "epoch": 5.39136354794787, "grad_norm": 1.5234375, "learning_rate": 0.0002499197350790305, "loss": 5.0223, "mean_token_accuracy": 0.21821577250957488, "num_tokens": 120202821.0, "step": 69295 }, { "entropy": 5.92721118927002, "epoch": 5.391752577319588, "grad_norm": 1.4609375, "learning_rate": 0.00024989219240414105, "loss": 4.9797, "mean_token_accuracy": 0.21684201806783676, "num_tokens": 120211429.0, "step": 69300 }, { "entropy": 5.98551926612854, "epoch": 5.392141606691305, "grad_norm": 1.4140625, "learning_rate": 0.00024986465011022263, "loss": 4.9803, "mean_token_accuracy": 0.21427216082811357, "num_tokens": 120220096.0, "step": 69305 }, { "entropy": 5.9349600315094, "epoch": 5.3925306360630225, "grad_norm": 1.453125, "learning_rate": 0.00024983710819769325, "loss": 4.85, "mean_token_accuracy": 0.22334273606538774, "num_tokens": 120228512.0, "step": 69310 }, { "entropy": 5.979427671432495, "epoch": 5.39291966543474, "grad_norm": 1.5078125, "learning_rate": 0.0002498095666669706, "loss": 4.9899, "mean_token_accuracy": 0.21298328191041946, "num_tokens": 120236897.0, "step": 69315 }, { "entropy": 6.004055786132812, "epoch": 5.393308694806458, "grad_norm": 1.546875, "learning_rate": 0.0002497820255184727, "loss": 4.9936, "mean_token_accuracy": 0.2093295305967331, "num_tokens": 120245533.0, "step": 69320 }, { "entropy": 6.024666595458984, "epoch": 5.393697724178176, "grad_norm": 1.53125, "learning_rate": 0.00024975448475261737, "loss": 5.0007, "mean_token_accuracy": 0.2150074690580368, "num_tokens": 120255332.0, "step": 69325 }, { "entropy": 6.042718553543091, "epoch": 5.394086753549893, "grad_norm": 1.53125, "learning_rate": 0.00024972694436982255, "loss": 5.0096, "mean_token_accuracy": 0.21146293878555297, "num_tokens": 120264441.0, "step": 69330 }, { "entropy": 5.890518522262573, "epoch": 5.39447578292161, "grad_norm": 1.578125, "learning_rate": 0.0002496994043705062, "loss": 4.804, "mean_token_accuracy": 0.22933408468961716, "num_tokens": 120272372.0, "step": 69335 }, { "entropy": 5.912908840179443, "epoch": 5.394864812293328, "grad_norm": 1.5625, "learning_rate": 0.0002496718647550861, "loss": 4.9016, "mean_token_accuracy": 0.21331263482570648, "num_tokens": 120280372.0, "step": 69340 }, { "entropy": 5.944162178039551, "epoch": 5.3952538416650455, "grad_norm": 1.59375, "learning_rate": 0.0002496443255239801, "loss": 4.9548, "mean_token_accuracy": 0.21944860368967056, "num_tokens": 120288786.0, "step": 69345 }, { "entropy": 5.920022296905517, "epoch": 5.395642871036763, "grad_norm": 1.515625, "learning_rate": 0.0002496167866776061, "loss": 4.8029, "mean_token_accuracy": 0.2265725016593933, "num_tokens": 120297624.0, "step": 69350 }, { "entropy": 5.915057516098022, "epoch": 5.396031900408481, "grad_norm": 1.4921875, "learning_rate": 0.00024958924821638195, "loss": 4.8956, "mean_token_accuracy": 0.22712543457746506, "num_tokens": 120305764.0, "step": 69355 }, { "entropy": 5.99413480758667, "epoch": 5.396420929780199, "grad_norm": 1.453125, "learning_rate": 0.00024956171014072555, "loss": 5.0702, "mean_token_accuracy": 0.2094024211168289, "num_tokens": 120314337.0, "step": 69360 }, { "entropy": 6.000122737884522, "epoch": 5.396809959151916, "grad_norm": 1.5390625, "learning_rate": 0.00024953417245105467, "loss": 4.9776, "mean_token_accuracy": 0.22048172801733018, "num_tokens": 120322751.0, "step": 69365 }, { "entropy": 5.957219648361206, "epoch": 5.397198988523634, "grad_norm": 1.4453125, "learning_rate": 0.00024950663514778726, "loss": 4.9266, "mean_token_accuracy": 0.2189728155732155, "num_tokens": 120331581.0, "step": 69370 }, { "entropy": 5.924093198776245, "epoch": 5.397588017895351, "grad_norm": 1.5625, "learning_rate": 0.00024947909823134107, "loss": 4.9409, "mean_token_accuracy": 0.2202657863497734, "num_tokens": 120339686.0, "step": 69375 }, { "entropy": 5.965054512023926, "epoch": 5.3979770472670685, "grad_norm": 1.40625, "learning_rate": 0.0002494515617021339, "loss": 4.9728, "mean_token_accuracy": 0.21553620398044587, "num_tokens": 120348328.0, "step": 69380 }, { "entropy": 5.949032545089722, "epoch": 5.398366076638786, "grad_norm": 1.546875, "learning_rate": 0.00024942402556058364, "loss": 4.9011, "mean_token_accuracy": 0.22199678868055345, "num_tokens": 120356025.0, "step": 69385 }, { "entropy": 6.00901517868042, "epoch": 5.398755106010504, "grad_norm": 1.5390625, "learning_rate": 0.0002493964898071081, "loss": 5.0264, "mean_token_accuracy": 0.20385624468326569, "num_tokens": 120364036.0, "step": 69390 }, { "entropy": 5.958004331588745, "epoch": 5.399144135382222, "grad_norm": 1.453125, "learning_rate": 0.0002493689544421251, "loss": 4.9862, "mean_token_accuracy": 0.21645919531583785, "num_tokens": 120373015.0, "step": 69395 }, { "entropy": 6.008584594726562, "epoch": 5.399533164753939, "grad_norm": 1.5390625, "learning_rate": 0.00024934141946605237, "loss": 4.939, "mean_token_accuracy": 0.21706321090459824, "num_tokens": 120381342.0, "step": 69400 }, { "entropy": 5.9857641696929935, "epoch": 5.399922194125656, "grad_norm": 1.546875, "learning_rate": 0.00024931388487930777, "loss": 4.9121, "mean_token_accuracy": 0.20908040404319764, "num_tokens": 120389689.0, "step": 69405 }, { "entropy": 5.987439966201782, "epoch": 5.400311223497374, "grad_norm": 1.40625, "learning_rate": 0.000249286350682309, "loss": 4.9487, "mean_token_accuracy": 0.21842693984508516, "num_tokens": 120397983.0, "step": 69410 }, { "entropy": 5.9292192459106445, "epoch": 5.4007002528690915, "grad_norm": 1.5546875, "learning_rate": 0.0002492588168754741, "loss": 4.8886, "mean_token_accuracy": 0.22557025998830796, "num_tokens": 120406315.0, "step": 69415 }, { "entropy": 5.899976634979248, "epoch": 5.401089282240809, "grad_norm": 1.515625, "learning_rate": 0.00024923128345922055, "loss": 4.9379, "mean_token_accuracy": 0.22425064593553543, "num_tokens": 120414771.0, "step": 69420 }, { "entropy": 5.856578350067139, "epoch": 5.401478311612527, "grad_norm": 1.3125, "learning_rate": 0.0002492037504339663, "loss": 4.8301, "mean_token_accuracy": 0.22903923392295839, "num_tokens": 120424159.0, "step": 69425 }, { "entropy": 5.888695955276489, "epoch": 5.401867340984245, "grad_norm": 1.6015625, "learning_rate": 0.00024917621780012905, "loss": 4.8413, "mean_token_accuracy": 0.22793111205101013, "num_tokens": 120432187.0, "step": 69430 }, { "entropy": 5.946759843826294, "epoch": 5.402256370355962, "grad_norm": 1.546875, "learning_rate": 0.00024914868555812663, "loss": 4.9704, "mean_token_accuracy": 0.2170004203915596, "num_tokens": 120441265.0, "step": 69435 }, { "entropy": 5.89326229095459, "epoch": 5.402645399727679, "grad_norm": 1.5234375, "learning_rate": 0.0002491211537083768, "loss": 4.8802, "mean_token_accuracy": 0.22099369764328003, "num_tokens": 120450183.0, "step": 69440 }, { "entropy": 6.00045747756958, "epoch": 5.403034429099397, "grad_norm": 1.6640625, "learning_rate": 0.0002490936222512972, "loss": 5.0367, "mean_token_accuracy": 0.21045224815607072, "num_tokens": 120458103.0, "step": 69445 }, { "entropy": 5.925220537185669, "epoch": 5.4034234584711145, "grad_norm": 1.453125, "learning_rate": 0.0002490660911873057, "loss": 4.9341, "mean_token_accuracy": 0.21810067743062972, "num_tokens": 120466181.0, "step": 69450 }, { "entropy": 5.95880913734436, "epoch": 5.403812487842832, "grad_norm": 1.515625, "learning_rate": 0.00024903856051681995, "loss": 4.8988, "mean_token_accuracy": 0.20949715822935105, "num_tokens": 120474240.0, "step": 69455 }, { "entropy": 5.940529251098633, "epoch": 5.40420151721455, "grad_norm": 1.4140625, "learning_rate": 0.0002490110302402577, "loss": 4.9871, "mean_token_accuracy": 0.21525032073259354, "num_tokens": 120483897.0, "step": 69460 }, { "entropy": 5.966724061965943, "epoch": 5.404590546586268, "grad_norm": 1.4765625, "learning_rate": 0.0002489835003580367, "loss": 4.96, "mean_token_accuracy": 0.22134848684072495, "num_tokens": 120492654.0, "step": 69465 }, { "entropy": 5.964642429351807, "epoch": 5.404979575957984, "grad_norm": 1.53125, "learning_rate": 0.00024895597087057483, "loss": 4.949, "mean_token_accuracy": 0.22301851361989974, "num_tokens": 120501056.0, "step": 69470 }, { "entropy": 5.965786504745483, "epoch": 5.405368605329702, "grad_norm": 1.4609375, "learning_rate": 0.0002489284417782895, "loss": 4.9409, "mean_token_accuracy": 0.21809854507446289, "num_tokens": 120509767.0, "step": 69475 }, { "entropy": 5.978460693359375, "epoch": 5.40575763470142, "grad_norm": 1.6171875, "learning_rate": 0.0002489009130815986, "loss": 4.9502, "mean_token_accuracy": 0.2145475998520851, "num_tokens": 120518484.0, "step": 69480 }, { "entropy": 5.927890348434448, "epoch": 5.4061466640731375, "grad_norm": 1.375, "learning_rate": 0.0002488733847809197, "loss": 4.8867, "mean_token_accuracy": 0.22907895892858504, "num_tokens": 120527130.0, "step": 69485 }, { "entropy": 5.998595333099365, "epoch": 5.406535693444855, "grad_norm": 1.4609375, "learning_rate": 0.0002488458568766707, "loss": 4.9292, "mean_token_accuracy": 0.2131692111492157, "num_tokens": 120536460.0, "step": 69490 }, { "entropy": 5.9556139469146725, "epoch": 5.406924722816573, "grad_norm": 1.625, "learning_rate": 0.0002488183293692692, "loss": 5.0511, "mean_token_accuracy": 0.21563382148742677, "num_tokens": 120545396.0, "step": 69495 }, { "entropy": 5.937748908996582, "epoch": 5.407313752188291, "grad_norm": 1.4921875, "learning_rate": 0.0002487908022591329, "loss": 4.9563, "mean_token_accuracy": 0.21728212386369705, "num_tokens": 120553896.0, "step": 69500 }, { "entropy": 5.903484630584717, "epoch": 5.407702781560007, "grad_norm": 1.421875, "learning_rate": 0.00024876327554667943, "loss": 4.9107, "mean_token_accuracy": 0.2139052554965019, "num_tokens": 120562209.0, "step": 69505 }, { "entropy": 5.991656160354614, "epoch": 5.408091810931725, "grad_norm": 1.515625, "learning_rate": 0.0002487357492323265, "loss": 4.9193, "mean_token_accuracy": 0.21190870255231858, "num_tokens": 120572040.0, "step": 69510 }, { "entropy": 5.999327278137207, "epoch": 5.408480840303443, "grad_norm": 1.4296875, "learning_rate": 0.0002487082233164918, "loss": 5.0036, "mean_token_accuracy": 0.20574814230203628, "num_tokens": 120580308.0, "step": 69515 }, { "entropy": 6.063082695007324, "epoch": 5.4088698696751605, "grad_norm": 1.5, "learning_rate": 0.0002486806977995929, "loss": 5.0084, "mean_token_accuracy": 0.21703935265541077, "num_tokens": 120590070.0, "step": 69520 }, { "entropy": 6.001849746704101, "epoch": 5.409258899046878, "grad_norm": 1.3984375, "learning_rate": 0.0002486531726820476, "loss": 4.9806, "mean_token_accuracy": 0.21526347249746322, "num_tokens": 120598922.0, "step": 69525 }, { "entropy": 5.914220142364502, "epoch": 5.409647928418596, "grad_norm": 1.4140625, "learning_rate": 0.00024862564796427337, "loss": 4.9054, "mean_token_accuracy": 0.22563911974430084, "num_tokens": 120607312.0, "step": 69530 }, { "entropy": 5.940074825286866, "epoch": 5.410036957790314, "grad_norm": 1.4296875, "learning_rate": 0.000248598123646688, "loss": 4.9293, "mean_token_accuracy": 0.22088136225938798, "num_tokens": 120616214.0, "step": 69535 }, { "entropy": 5.9978776454925535, "epoch": 5.41042598716203, "grad_norm": 1.578125, "learning_rate": 0.0002485705997297091, "loss": 5.026, "mean_token_accuracy": 0.21436664909124375, "num_tokens": 120624784.0, "step": 69540 }, { "entropy": 5.99267611503601, "epoch": 5.410815016533748, "grad_norm": 1.484375, "learning_rate": 0.00024854307621375427, "loss": 4.9853, "mean_token_accuracy": 0.21453779935836792, "num_tokens": 120634052.0, "step": 69545 }, { "entropy": 5.988218355178833, "epoch": 5.411204045905466, "grad_norm": 1.4453125, "learning_rate": 0.0002485155530992411, "loss": 4.9352, "mean_token_accuracy": 0.21579424440860748, "num_tokens": 120642441.0, "step": 69550 }, { "entropy": 5.917684507369995, "epoch": 5.4115930752771835, "grad_norm": 1.4921875, "learning_rate": 0.0002484880303865873, "loss": 4.9083, "mean_token_accuracy": 0.22172731161117554, "num_tokens": 120651342.0, "step": 69555 }, { "entropy": 5.918315982818603, "epoch": 5.411982104648901, "grad_norm": 1.4453125, "learning_rate": 0.0002484605080762104, "loss": 4.9718, "mean_token_accuracy": 0.2228367179632187, "num_tokens": 120661044.0, "step": 69560 }, { "entropy": 5.953747081756592, "epoch": 5.412371134020619, "grad_norm": 1.5390625, "learning_rate": 0.0002484329861685281, "loss": 4.8842, "mean_token_accuracy": 0.22112565189599992, "num_tokens": 120668743.0, "step": 69565 }, { "entropy": 6.006809997558594, "epoch": 5.412760163392337, "grad_norm": 1.5078125, "learning_rate": 0.00024840546466395796, "loss": 5.0119, "mean_token_accuracy": 0.21986104249954225, "num_tokens": 120677379.0, "step": 69570 }, { "entropy": 5.989054155349732, "epoch": 5.413149192764053, "grad_norm": 1.5546875, "learning_rate": 0.00024837794356291756, "loss": 4.9263, "mean_token_accuracy": 0.2183444619178772, "num_tokens": 120685941.0, "step": 69575 }, { "entropy": 6.001258516311646, "epoch": 5.413538222135771, "grad_norm": 1.5, "learning_rate": 0.0002483504228658245, "loss": 5.0097, "mean_token_accuracy": 0.21729765981435775, "num_tokens": 120695155.0, "step": 69580 }, { "entropy": 5.945470571517944, "epoch": 5.413927251507489, "grad_norm": 1.59375, "learning_rate": 0.0002483229025730963, "loss": 4.9136, "mean_token_accuracy": 0.22013757526874542, "num_tokens": 120703564.0, "step": 69585 }, { "entropy": 5.97585096359253, "epoch": 5.4143162808792065, "grad_norm": 1.4765625, "learning_rate": 0.0002482953826851506, "loss": 4.884, "mean_token_accuracy": 0.2252918228507042, "num_tokens": 120712435.0, "step": 69590 }, { "entropy": 5.908626747131348, "epoch": 5.414705310250924, "grad_norm": 1.484375, "learning_rate": 0.000248267863202405, "loss": 4.8639, "mean_token_accuracy": 0.2259386360645294, "num_tokens": 120720801.0, "step": 69595 }, { "entropy": 5.954751825332641, "epoch": 5.415094339622642, "grad_norm": 1.5078125, "learning_rate": 0.00024824034412527704, "loss": 4.9593, "mean_token_accuracy": 0.2264085367321968, "num_tokens": 120729199.0, "step": 69600 }, { "entropy": 5.922840547561646, "epoch": 5.415483368994359, "grad_norm": 1.4765625, "learning_rate": 0.0002482128254541842, "loss": 4.8272, "mean_token_accuracy": 0.23023559153079987, "num_tokens": 120737241.0, "step": 69605 }, { "entropy": 5.9119775772094725, "epoch": 5.415872398366076, "grad_norm": 1.46875, "learning_rate": 0.0002481853071895442, "loss": 4.9398, "mean_token_accuracy": 0.21839763224124908, "num_tokens": 120745704.0, "step": 69610 }, { "entropy": 5.927948713302612, "epoch": 5.416261427737794, "grad_norm": 1.6640625, "learning_rate": 0.0002481577893317744, "loss": 4.8873, "mean_token_accuracy": 0.22726092338562012, "num_tokens": 120753904.0, "step": 69615 }, { "entropy": 5.94631175994873, "epoch": 5.416650457109512, "grad_norm": 1.53125, "learning_rate": 0.0002481302718812924, "loss": 4.8734, "mean_token_accuracy": 0.21951136142015457, "num_tokens": 120761573.0, "step": 69620 }, { "entropy": 6.019516658782959, "epoch": 5.4170394864812295, "grad_norm": 1.5859375, "learning_rate": 0.0002481027548385158, "loss": 4.9926, "mean_token_accuracy": 0.21075040251016616, "num_tokens": 120770336.0, "step": 69625 }, { "entropy": 5.954289150238037, "epoch": 5.417428515852947, "grad_norm": 1.4453125, "learning_rate": 0.00024807523820386207, "loss": 5.0097, "mean_token_accuracy": 0.21802036464214325, "num_tokens": 120779007.0, "step": 69630 }, { "entropy": 5.896920680999756, "epoch": 5.417817545224665, "grad_norm": 1.5625, "learning_rate": 0.0002480477219777488, "loss": 4.8723, "mean_token_accuracy": 0.22808157801628112, "num_tokens": 120787109.0, "step": 69635 }, { "entropy": 5.847638940811157, "epoch": 5.418206574596382, "grad_norm": 1.515625, "learning_rate": 0.0002480202061605933, "loss": 4.7877, "mean_token_accuracy": 0.23531697541475297, "num_tokens": 120795810.0, "step": 69640 }, { "entropy": 5.897540187835693, "epoch": 5.418595603968099, "grad_norm": 1.484375, "learning_rate": 0.0002479926907528134, "loss": 4.8606, "mean_token_accuracy": 0.22465434223413466, "num_tokens": 120804972.0, "step": 69645 }, { "entropy": 5.947163057327271, "epoch": 5.418984633339817, "grad_norm": 1.5390625, "learning_rate": 0.00024796517575482633, "loss": 4.9606, "mean_token_accuracy": 0.21651918143033982, "num_tokens": 120813820.0, "step": 69650 }, { "entropy": 5.965563344955444, "epoch": 5.419373662711535, "grad_norm": 1.4609375, "learning_rate": 0.0002479376611670498, "loss": 4.9037, "mean_token_accuracy": 0.22504474669694902, "num_tokens": 120822298.0, "step": 69655 }, { "entropy": 5.956828832626343, "epoch": 5.4197626920832525, "grad_norm": 1.5390625, "learning_rate": 0.00024791014698990116, "loss": 4.8917, "mean_token_accuracy": 0.22093381434679032, "num_tokens": 120830656.0, "step": 69660 }, { "entropy": 5.986466932296753, "epoch": 5.42015172145497, "grad_norm": 1.5390625, "learning_rate": 0.00024788263322379783, "loss": 4.9501, "mean_token_accuracy": 0.2209106683731079, "num_tokens": 120838750.0, "step": 69665 }, { "entropy": 5.942884540557861, "epoch": 5.420540750826687, "grad_norm": 1.6328125, "learning_rate": 0.00024785511986915746, "loss": 4.895, "mean_token_accuracy": 0.21785439550876617, "num_tokens": 120847695.0, "step": 69670 }, { "entropy": 6.045891618728637, "epoch": 5.420929780198405, "grad_norm": 1.40625, "learning_rate": 0.0002478276069263974, "loss": 5.033, "mean_token_accuracy": 0.2093837782740593, "num_tokens": 120856288.0, "step": 69675 }, { "entropy": 6.046911001205444, "epoch": 5.421318809570122, "grad_norm": 1.421875, "learning_rate": 0.00024780009439593514, "loss": 5.0761, "mean_token_accuracy": 0.21329471617937087, "num_tokens": 120864952.0, "step": 69680 }, { "entropy": 5.942602729797363, "epoch": 5.42170783894184, "grad_norm": 1.578125, "learning_rate": 0.0002477725822781881, "loss": 4.954, "mean_token_accuracy": 0.21525086015462874, "num_tokens": 120873574.0, "step": 69685 }, { "entropy": 5.891190671920777, "epoch": 5.422096868313558, "grad_norm": 1.4375, "learning_rate": 0.0002477450705735739, "loss": 4.8851, "mean_token_accuracy": 0.22408080846071243, "num_tokens": 120881710.0, "step": 69690 }, { "entropy": 5.90842981338501, "epoch": 5.4224858976852754, "grad_norm": 1.484375, "learning_rate": 0.00024771755928250984, "loss": 4.8589, "mean_token_accuracy": 0.227132585644722, "num_tokens": 120889864.0, "step": 69695 }, { "entropy": 5.922195625305176, "epoch": 5.422874927056993, "grad_norm": 1.5, "learning_rate": 0.00024769004840541337, "loss": 4.9384, "mean_token_accuracy": 0.21617465764284133, "num_tokens": 120898997.0, "step": 69700 }, { "entropy": 5.928155040740966, "epoch": 5.42326395642871, "grad_norm": 1.5, "learning_rate": 0.000247662537942702, "loss": 4.9349, "mean_token_accuracy": 0.22389423698186875, "num_tokens": 120907897.0, "step": 69705 }, { "entropy": 5.91570520401001, "epoch": 5.423652985800428, "grad_norm": 1.5625, "learning_rate": 0.0002476350278947931, "loss": 4.8688, "mean_token_accuracy": 0.22564842700958251, "num_tokens": 120916729.0, "step": 69710 }, { "entropy": 5.929300785064697, "epoch": 5.424042015172145, "grad_norm": 1.578125, "learning_rate": 0.000247607518262104, "loss": 4.9721, "mean_token_accuracy": 0.21279922127723694, "num_tokens": 120926012.0, "step": 69715 }, { "entropy": 5.92682204246521, "epoch": 5.424431044543863, "grad_norm": 1.59375, "learning_rate": 0.0002475800090450523, "loss": 4.8934, "mean_token_accuracy": 0.22135115414857864, "num_tokens": 120934016.0, "step": 69720 }, { "entropy": 5.997908735275269, "epoch": 5.424820073915581, "grad_norm": 1.734375, "learning_rate": 0.0002475525002440553, "loss": 5.0349, "mean_token_accuracy": 0.21130410581827164, "num_tokens": 120942415.0, "step": 69725 }, { "entropy": 5.962086725234985, "epoch": 5.425209103287298, "grad_norm": 1.5390625, "learning_rate": 0.00024752499185953043, "loss": 4.962, "mean_token_accuracy": 0.22431014031171798, "num_tokens": 120950143.0, "step": 69730 }, { "entropy": 5.842546033859253, "epoch": 5.425598132659016, "grad_norm": 1.5234375, "learning_rate": 0.0002474974838918951, "loss": 4.9152, "mean_token_accuracy": 0.2200164258480072, "num_tokens": 120958457.0, "step": 69735 }, { "entropy": 5.9410973072052, "epoch": 5.425987162030733, "grad_norm": 1.546875, "learning_rate": 0.0002474699763415667, "loss": 4.9045, "mean_token_accuracy": 0.2279996857047081, "num_tokens": 120966520.0, "step": 69740 }, { "entropy": 5.954097175598145, "epoch": 5.426376191402451, "grad_norm": 1.5703125, "learning_rate": 0.00024744246920896243, "loss": 4.8792, "mean_token_accuracy": 0.22382989078760146, "num_tokens": 120974805.0, "step": 69745 }, { "entropy": 6.013351011276245, "epoch": 5.426765220774168, "grad_norm": 1.4140625, "learning_rate": 0.0002474149624944999, "loss": 4.9675, "mean_token_accuracy": 0.21421680450439454, "num_tokens": 120983455.0, "step": 69750 }, { "entropy": 5.959715700149536, "epoch": 5.427154250145886, "grad_norm": 1.484375, "learning_rate": 0.00024738745619859643, "loss": 4.9702, "mean_token_accuracy": 0.2144887387752533, "num_tokens": 120993310.0, "step": 69755 }, { "entropy": 5.972245597839356, "epoch": 5.427543279517604, "grad_norm": 1.5703125, "learning_rate": 0.00024735995032166934, "loss": 4.9704, "mean_token_accuracy": 0.21893640160560607, "num_tokens": 121002002.0, "step": 69760 }, { "entropy": 5.994754028320313, "epoch": 5.427932308889321, "grad_norm": 1.453125, "learning_rate": 0.0002473324448641361, "loss": 4.9916, "mean_token_accuracy": 0.21555853486061097, "num_tokens": 121010440.0, "step": 69765 }, { "entropy": 5.980138444900513, "epoch": 5.428321338261039, "grad_norm": 1.4921875, "learning_rate": 0.00024730493982641396, "loss": 4.8239, "mean_token_accuracy": 0.22795003205537795, "num_tokens": 121018231.0, "step": 69770 }, { "entropy": 5.995293712615966, "epoch": 5.428710367632756, "grad_norm": 1.5078125, "learning_rate": 0.0002472774352089202, "loss": 4.9731, "mean_token_accuracy": 0.21923116445541382, "num_tokens": 121027193.0, "step": 69775 }, { "entropy": 5.988741397857666, "epoch": 5.429099397004474, "grad_norm": 1.609375, "learning_rate": 0.0002472499310120723, "loss": 4.9603, "mean_token_accuracy": 0.2227725550532341, "num_tokens": 121035472.0, "step": 69780 }, { "entropy": 5.943289375305175, "epoch": 5.429488426376191, "grad_norm": 1.546875, "learning_rate": 0.0002472224272362875, "loss": 4.9276, "mean_token_accuracy": 0.21586958020925523, "num_tokens": 121044167.0, "step": 69785 }, { "entropy": 5.93031530380249, "epoch": 5.429877455747909, "grad_norm": 1.3515625, "learning_rate": 0.00024719492388198313, "loss": 4.8993, "mean_token_accuracy": 0.2209222748875618, "num_tokens": 121053444.0, "step": 69790 }, { "entropy": 5.9733682632446286, "epoch": 5.430266485119627, "grad_norm": 1.671875, "learning_rate": 0.0002471674209495765, "loss": 4.8984, "mean_token_accuracy": 0.22360751628875733, "num_tokens": 121062733.0, "step": 69795 }, { "entropy": 5.999290561676025, "epoch": 5.430655514491344, "grad_norm": 1.5078125, "learning_rate": 0.00024713991843948506, "loss": 4.9702, "mean_token_accuracy": 0.21681024730205536, "num_tokens": 121071187.0, "step": 69800 }, { "entropy": 5.961117219924927, "epoch": 5.431044543863061, "grad_norm": 1.5390625, "learning_rate": 0.00024711241635212597, "loss": 4.9697, "mean_token_accuracy": 0.2162310317158699, "num_tokens": 121079926.0, "step": 69805 }, { "entropy": 5.946539878845215, "epoch": 5.431433573234779, "grad_norm": 1.4296875, "learning_rate": 0.00024708491468791656, "loss": 4.9375, "mean_token_accuracy": 0.22285141348838805, "num_tokens": 121089275.0, "step": 69810 }, { "entropy": 5.9817249298095705, "epoch": 5.431822602606497, "grad_norm": 1.515625, "learning_rate": 0.0002470574134472741, "loss": 4.9, "mean_token_accuracy": 0.22950120121240616, "num_tokens": 121098020.0, "step": 69815 }, { "entropy": 6.008489036560059, "epoch": 5.432211631978214, "grad_norm": 1.546875, "learning_rate": 0.00024702991263061595, "loss": 4.9999, "mean_token_accuracy": 0.21528828293085098, "num_tokens": 121106124.0, "step": 69820 }, { "entropy": 5.9804222106933596, "epoch": 5.432600661349932, "grad_norm": 1.453125, "learning_rate": 0.00024700241223835935, "loss": 5.008, "mean_token_accuracy": 0.21622665226459503, "num_tokens": 121114958.0, "step": 69825 }, { "entropy": 6.023210859298706, "epoch": 5.43298969072165, "grad_norm": 1.40625, "learning_rate": 0.00024697491227092163, "loss": 4.963, "mean_token_accuracy": 0.22363444715738295, "num_tokens": 121123463.0, "step": 69830 }, { "entropy": 6.025192832946777, "epoch": 5.433378720093367, "grad_norm": 1.5078125, "learning_rate": 0.00024694741272872, "loss": 5.049, "mean_token_accuracy": 0.21160695254802703, "num_tokens": 121132260.0, "step": 69835 }, { "entropy": 6.015255975723266, "epoch": 5.433767749465084, "grad_norm": 1.4375, "learning_rate": 0.00024691991361217166, "loss": 4.9184, "mean_token_accuracy": 0.22024457454681395, "num_tokens": 121140409.0, "step": 69840 }, { "entropy": 5.899049711227417, "epoch": 5.434156778836802, "grad_norm": 1.5546875, "learning_rate": 0.00024689241492169403, "loss": 4.9222, "mean_token_accuracy": 0.21644993722438813, "num_tokens": 121148834.0, "step": 69845 }, { "entropy": 5.970679426193238, "epoch": 5.43454580820852, "grad_norm": 1.4765625, "learning_rate": 0.00024686491665770424, "loss": 5.029, "mean_token_accuracy": 0.21138272881507875, "num_tokens": 121157953.0, "step": 69850 }, { "entropy": 6.019716548919678, "epoch": 5.434934837580237, "grad_norm": 1.5234375, "learning_rate": 0.00024683741882061954, "loss": 4.9076, "mean_token_accuracy": 0.22652398198843002, "num_tokens": 121165774.0, "step": 69855 }, { "entropy": 5.978470659255981, "epoch": 5.435323866951955, "grad_norm": 1.421875, "learning_rate": 0.0002468099214108572, "loss": 4.9415, "mean_token_accuracy": 0.22101059108972548, "num_tokens": 121174549.0, "step": 69860 }, { "entropy": 6.026112461090088, "epoch": 5.435712896323673, "grad_norm": 1.421875, "learning_rate": 0.00024678242442883444, "loss": 5.0216, "mean_token_accuracy": 0.22077436298131942, "num_tokens": 121183588.0, "step": 69865 }, { "entropy": 5.961284065246582, "epoch": 5.43610192569539, "grad_norm": 1.5078125, "learning_rate": 0.00024675492787496844, "loss": 4.9946, "mean_token_accuracy": 0.2117645487189293, "num_tokens": 121192349.0, "step": 69870 }, { "entropy": 6.029409646987915, "epoch": 5.436490955067107, "grad_norm": 1.6015625, "learning_rate": 0.00024672743174967645, "loss": 4.9313, "mean_token_accuracy": 0.22920598983764648, "num_tokens": 121200667.0, "step": 69875 }, { "entropy": 5.872901821136475, "epoch": 5.436879984438825, "grad_norm": 1.4609375, "learning_rate": 0.0002466999360533757, "loss": 4.8365, "mean_token_accuracy": 0.22792194038629532, "num_tokens": 121209836.0, "step": 69880 }, { "entropy": 5.978393840789795, "epoch": 5.437269013810543, "grad_norm": 1.609375, "learning_rate": 0.0002466724407864833, "loss": 4.9696, "mean_token_accuracy": 0.21688223034143447, "num_tokens": 121217535.0, "step": 69885 }, { "entropy": 6.003305578231812, "epoch": 5.43765804318226, "grad_norm": 1.53125, "learning_rate": 0.00024664494594941664, "loss": 4.9092, "mean_token_accuracy": 0.22898366004228593, "num_tokens": 121226159.0, "step": 69890 }, { "entropy": 6.033805322647095, "epoch": 5.438047072553978, "grad_norm": 1.46875, "learning_rate": 0.00024661745154259273, "loss": 5.0645, "mean_token_accuracy": 0.2165144294500351, "num_tokens": 121234717.0, "step": 69895 }, { "entropy": 5.991330575942993, "epoch": 5.438436101925696, "grad_norm": 1.734375, "learning_rate": 0.0002465899575664289, "loss": 4.9073, "mean_token_accuracy": 0.21948652863502502, "num_tokens": 121243086.0, "step": 69900 }, { "entropy": 5.989740467071533, "epoch": 5.438825131297413, "grad_norm": 1.5390625, "learning_rate": 0.00024656246402134216, "loss": 5.0348, "mean_token_accuracy": 0.21474512964487075, "num_tokens": 121251350.0, "step": 69905 }, { "entropy": 5.969817686080932, "epoch": 5.43921416066913, "grad_norm": 1.6015625, "learning_rate": 0.0002465349709077498, "loss": 4.9629, "mean_token_accuracy": 0.21102358102798463, "num_tokens": 121260455.0, "step": 69910 }, { "entropy": 5.951726770401001, "epoch": 5.439603190040848, "grad_norm": 1.5078125, "learning_rate": 0.0002465074782260689, "loss": 4.8888, "mean_token_accuracy": 0.22276460528373718, "num_tokens": 121269166.0, "step": 69915 }, { "entropy": 5.921156406402588, "epoch": 5.439992219412566, "grad_norm": 1.484375, "learning_rate": 0.00024647998597671674, "loss": 4.8078, "mean_token_accuracy": 0.23536086082458496, "num_tokens": 121277415.0, "step": 69920 }, { "entropy": 5.969387531280518, "epoch": 5.440381248784283, "grad_norm": 1.5703125, "learning_rate": 0.0002464524941601103, "loss": 4.9355, "mean_token_accuracy": 0.2188545823097229, "num_tokens": 121285961.0, "step": 69925 }, { "entropy": 5.963651132583618, "epoch": 5.440770278156001, "grad_norm": 1.4921875, "learning_rate": 0.00024642500277666696, "loss": 4.9366, "mean_token_accuracy": 0.22320512533187867, "num_tokens": 121294178.0, "step": 69930 }, { "entropy": 5.929413843154907, "epoch": 5.441159307527719, "grad_norm": 1.484375, "learning_rate": 0.00024639751182680363, "loss": 4.8999, "mean_token_accuracy": 0.21915046721696854, "num_tokens": 121303146.0, "step": 69935 }, { "entropy": 5.952569246292114, "epoch": 5.4415483368994355, "grad_norm": 1.4453125, "learning_rate": 0.0002463700213109376, "loss": 4.9174, "mean_token_accuracy": 0.21696809381246568, "num_tokens": 121312485.0, "step": 69940 }, { "entropy": 5.937078619003296, "epoch": 5.441937366271153, "grad_norm": 1.5078125, "learning_rate": 0.00024634253122948584, "loss": 4.8976, "mean_token_accuracy": 0.2242192506790161, "num_tokens": 121320882.0, "step": 69945 }, { "entropy": 5.900988626480102, "epoch": 5.442326395642871, "grad_norm": 1.5, "learning_rate": 0.00024631504158286556, "loss": 4.9167, "mean_token_accuracy": 0.21521260142326354, "num_tokens": 121329289.0, "step": 69950 }, { "entropy": 5.905853605270385, "epoch": 5.442715425014589, "grad_norm": 1.4453125, "learning_rate": 0.00024628755237149385, "loss": 4.8591, "mean_token_accuracy": 0.21939316689968108, "num_tokens": 121337448.0, "step": 69955 }, { "entropy": 5.970423603057862, "epoch": 5.443104454386306, "grad_norm": 1.6328125, "learning_rate": 0.00024626006359578797, "loss": 4.9904, "mean_token_accuracy": 0.21098355650901796, "num_tokens": 121346671.0, "step": 69960 }, { "entropy": 5.925609922409057, "epoch": 5.443493483758024, "grad_norm": 1.578125, "learning_rate": 0.00024623257525616484, "loss": 4.9672, "mean_token_accuracy": 0.21551347374916077, "num_tokens": 121355396.0, "step": 69965 }, { "entropy": 6.0288787364959715, "epoch": 5.443882513129742, "grad_norm": 1.4375, "learning_rate": 0.00024620508735304146, "loss": 5.0395, "mean_token_accuracy": 0.21164844185113907, "num_tokens": 121363574.0, "step": 69970 }, { "entropy": 5.947305059432983, "epoch": 5.4442715425014585, "grad_norm": 1.5703125, "learning_rate": 0.0002461775998868352, "loss": 4.9259, "mean_token_accuracy": 0.2192602962255478, "num_tokens": 121372139.0, "step": 69975 }, { "entropy": 5.978057336807251, "epoch": 5.444660571873176, "grad_norm": 1.609375, "learning_rate": 0.00024615011285796293, "loss": 4.9553, "mean_token_accuracy": 0.21770855635404587, "num_tokens": 121380975.0, "step": 69980 }, { "entropy": 5.966154384613037, "epoch": 5.445049601244894, "grad_norm": 1.5, "learning_rate": 0.00024612262626684176, "loss": 4.981, "mean_token_accuracy": 0.21439764499664307, "num_tokens": 121390340.0, "step": 69985 }, { "entropy": 5.938549566268921, "epoch": 5.445438630616612, "grad_norm": 1.453125, "learning_rate": 0.0002460951401138888, "loss": 4.8701, "mean_token_accuracy": 0.22770666778087617, "num_tokens": 121398807.0, "step": 69990 }, { "entropy": 5.986173057556153, "epoch": 5.445827659988329, "grad_norm": 1.5859375, "learning_rate": 0.00024606765439952105, "loss": 4.9944, "mean_token_accuracy": 0.21809961199760436, "num_tokens": 121407703.0, "step": 69995 }, { "entropy": 5.935518741607666, "epoch": 5.446216689360047, "grad_norm": 1.5078125, "learning_rate": 0.0002460401691241556, "loss": 4.9828, "mean_token_accuracy": 0.22147472351789474, "num_tokens": 121416385.0, "step": 70000 }, { "entropy": 5.888468217849732, "epoch": 5.446605718731764, "grad_norm": 1.5859375, "learning_rate": 0.00024601268428820947, "loss": 4.895, "mean_token_accuracy": 0.21349750757217406, "num_tokens": 121424651.0, "step": 70005 }, { "entropy": 5.931980323791504, "epoch": 5.4469947481034815, "grad_norm": 1.5546875, "learning_rate": 0.00024598519989209983, "loss": 4.9841, "mean_token_accuracy": 0.21779898405075074, "num_tokens": 121434248.0, "step": 70010 }, { "entropy": 5.920939302444458, "epoch": 5.447383777475199, "grad_norm": 1.65625, "learning_rate": 0.0002459577159362434, "loss": 4.9056, "mean_token_accuracy": 0.22563773691654204, "num_tokens": 121442762.0, "step": 70015 }, { "entropy": 6.018200492858886, "epoch": 5.447772806846917, "grad_norm": 1.4921875, "learning_rate": 0.0002459302324210575, "loss": 5.0529, "mean_token_accuracy": 0.21488068550825118, "num_tokens": 121451622.0, "step": 70020 }, { "entropy": 6.014619255065918, "epoch": 5.448161836218635, "grad_norm": 1.4765625, "learning_rate": 0.0002459027493469591, "loss": 4.9653, "mean_token_accuracy": 0.22404997646808625, "num_tokens": 121460308.0, "step": 70025 }, { "entropy": 5.974753379821777, "epoch": 5.448550865590352, "grad_norm": 1.6328125, "learning_rate": 0.00024587526671436517, "loss": 4.9877, "mean_token_accuracy": 0.22001627534627916, "num_tokens": 121469429.0, "step": 70030 }, { "entropy": 5.900829553604126, "epoch": 5.44893989496207, "grad_norm": 1.5546875, "learning_rate": 0.00024584778452369264, "loss": 4.8591, "mean_token_accuracy": 0.21657415181398393, "num_tokens": 121478240.0, "step": 70035 }, { "entropy": 5.958044528961182, "epoch": 5.449328924333787, "grad_norm": 1.4140625, "learning_rate": 0.00024582030277535866, "loss": 4.9576, "mean_token_accuracy": 0.22291708290576934, "num_tokens": 121487480.0, "step": 70040 }, { "entropy": 5.991892719268799, "epoch": 5.4497179537055045, "grad_norm": 1.515625, "learning_rate": 0.00024579282146978016, "loss": 5.0014, "mean_token_accuracy": 0.21514321714639664, "num_tokens": 121495653.0, "step": 70045 }, { "entropy": 5.984756565093994, "epoch": 5.450106983077222, "grad_norm": 1.6328125, "learning_rate": 0.000245765340607374, "loss": 4.9785, "mean_token_accuracy": 0.2211349055171013, "num_tokens": 121503924.0, "step": 70050 }, { "entropy": 5.992353343963623, "epoch": 5.45049601244894, "grad_norm": 1.5703125, "learning_rate": 0.0002457378601885573, "loss": 5.0136, "mean_token_accuracy": 0.21979162693023682, "num_tokens": 121513062.0, "step": 70055 }, { "entropy": 5.950098848342895, "epoch": 5.450885041820658, "grad_norm": 1.421875, "learning_rate": 0.00024571038021374705, "loss": 4.9498, "mean_token_accuracy": 0.20833095014095307, "num_tokens": 121522543.0, "step": 70060 }, { "entropy": 6.040549898147583, "epoch": 5.451274071192375, "grad_norm": 1.5859375, "learning_rate": 0.00024568290068336014, "loss": 5.0694, "mean_token_accuracy": 0.20912840068340302, "num_tokens": 121531081.0, "step": 70065 }, { "entropy": 5.975691270828247, "epoch": 5.451663100564093, "grad_norm": 1.3671875, "learning_rate": 0.0002456554215978135, "loss": 4.9815, "mean_token_accuracy": 0.21624995321035384, "num_tokens": 121540034.0, "step": 70070 }, { "entropy": 5.940537929534912, "epoch": 5.45205212993581, "grad_norm": 1.484375, "learning_rate": 0.0002456279429575242, "loss": 4.964, "mean_token_accuracy": 0.21798825562000274, "num_tokens": 121549006.0, "step": 70075 }, { "entropy": 5.919402647018432, "epoch": 5.4524411593075275, "grad_norm": 1.5078125, "learning_rate": 0.00024560046476290905, "loss": 4.9021, "mean_token_accuracy": 0.21927562057971955, "num_tokens": 121557178.0, "step": 70080 }, { "entropy": 5.960303401947021, "epoch": 5.452830188679245, "grad_norm": 1.5859375, "learning_rate": 0.00024557298701438504, "loss": 4.9218, "mean_token_accuracy": 0.2219780296087265, "num_tokens": 121565594.0, "step": 70085 }, { "entropy": 5.963353157043457, "epoch": 5.453219218050963, "grad_norm": 1.515625, "learning_rate": 0.0002455455097123691, "loss": 4.9463, "mean_token_accuracy": 0.2226736918091774, "num_tokens": 121575115.0, "step": 70090 }, { "entropy": 6.024876451492309, "epoch": 5.453608247422681, "grad_norm": 1.578125, "learning_rate": 0.0002455180328572783, "loss": 5.0851, "mean_token_accuracy": 0.21108345240354537, "num_tokens": 121584674.0, "step": 70095 }, { "entropy": 6.037327623367309, "epoch": 5.453997276794398, "grad_norm": 1.5, "learning_rate": 0.00024549055644952926, "loss": 4.9982, "mean_token_accuracy": 0.2171592190861702, "num_tokens": 121593647.0, "step": 70100 }, { "entropy": 6.053216409683228, "epoch": 5.454386306166116, "grad_norm": 1.5703125, "learning_rate": 0.0002454630804895392, "loss": 4.9197, "mean_token_accuracy": 0.22766707539558412, "num_tokens": 121603187.0, "step": 70105 }, { "entropy": 6.012965440750122, "epoch": 5.454775335537833, "grad_norm": 1.5390625, "learning_rate": 0.0002454356049777248, "loss": 5.0403, "mean_token_accuracy": 0.2095397263765335, "num_tokens": 121612479.0, "step": 70110 }, { "entropy": 5.963444232940674, "epoch": 5.4551643649095505, "grad_norm": 1.4765625, "learning_rate": 0.00024540812991450306, "loss": 4.9744, "mean_token_accuracy": 0.21937051862478257, "num_tokens": 121620859.0, "step": 70115 }, { "entropy": 5.983778476715088, "epoch": 5.455553394281268, "grad_norm": 1.4765625, "learning_rate": 0.00024538065530029093, "loss": 4.9885, "mean_token_accuracy": 0.22022458761930466, "num_tokens": 121629265.0, "step": 70120 }, { "entropy": 5.944018745422364, "epoch": 5.455942423652986, "grad_norm": 1.453125, "learning_rate": 0.0002453531811355051, "loss": 4.942, "mean_token_accuracy": 0.22083521336317063, "num_tokens": 121638246.0, "step": 70125 }, { "entropy": 5.9625472068786625, "epoch": 5.456331453024704, "grad_norm": 1.4140625, "learning_rate": 0.00024532570742056257, "loss": 4.9415, "mean_token_accuracy": 0.22107749283313752, "num_tokens": 121646596.0, "step": 70130 }, { "entropy": 5.961402082443238, "epoch": 5.456720482396421, "grad_norm": 1.625, "learning_rate": 0.00024529823415588025, "loss": 4.9056, "mean_token_accuracy": 0.2189960226416588, "num_tokens": 121654935.0, "step": 70135 }, { "entropy": 5.988764381408691, "epoch": 5.457109511768138, "grad_norm": 1.453125, "learning_rate": 0.0002452707613418749, "loss": 5.0471, "mean_token_accuracy": 0.2054786279797554, "num_tokens": 121663294.0, "step": 70140 }, { "entropy": 5.901919364929199, "epoch": 5.457498541139856, "grad_norm": 1.6875, "learning_rate": 0.00024524328897896345, "loss": 4.9023, "mean_token_accuracy": 0.22331960946321489, "num_tokens": 121671646.0, "step": 70145 }, { "entropy": 5.943007135391236, "epoch": 5.4578875705115735, "grad_norm": 1.4453125, "learning_rate": 0.00024521581706756266, "loss": 4.9567, "mean_token_accuracy": 0.21306896954774857, "num_tokens": 121681237.0, "step": 70150 }, { "entropy": 6.006966686248779, "epoch": 5.458276599883291, "grad_norm": 1.484375, "learning_rate": 0.00024518834560808954, "loss": 4.9327, "mean_token_accuracy": 0.22010865360498427, "num_tokens": 121690295.0, "step": 70155 }, { "entropy": 6.011630582809448, "epoch": 5.458665629255009, "grad_norm": 1.546875, "learning_rate": 0.00024516087460096074, "loss": 4.9376, "mean_token_accuracy": 0.22252710461616515, "num_tokens": 121698880.0, "step": 70160 }, { "entropy": 5.994739770889282, "epoch": 5.459054658626727, "grad_norm": 1.5546875, "learning_rate": 0.0002451334040465933, "loss": 5.0118, "mean_token_accuracy": 0.21929710656404494, "num_tokens": 121707068.0, "step": 70165 }, { "entropy": 5.940282726287842, "epoch": 5.459443687998444, "grad_norm": 1.46875, "learning_rate": 0.00024510593394540383, "loss": 4.9002, "mean_token_accuracy": 0.22216132581233977, "num_tokens": 121715536.0, "step": 70170 }, { "entropy": 5.97674036026001, "epoch": 5.459832717370161, "grad_norm": 1.765625, "learning_rate": 0.0002450784642978092, "loss": 4.9839, "mean_token_accuracy": 0.21331264674663544, "num_tokens": 121723904.0, "step": 70175 }, { "entropy": 5.92652530670166, "epoch": 5.460221746741879, "grad_norm": 1.5625, "learning_rate": 0.0002450509951042263, "loss": 4.9454, "mean_token_accuracy": 0.2235196575522423, "num_tokens": 121732396.0, "step": 70180 }, { "entropy": 5.9980486869812015, "epoch": 5.4606107761135965, "grad_norm": 1.53125, "learning_rate": 0.00024502352636507184, "loss": 5.0436, "mean_token_accuracy": 0.21017932742834092, "num_tokens": 121741913.0, "step": 70185 }, { "entropy": 5.959969902038575, "epoch": 5.460999805485314, "grad_norm": 1.546875, "learning_rate": 0.00024499605808076273, "loss": 4.9384, "mean_token_accuracy": 0.2214701235294342, "num_tokens": 121750649.0, "step": 70190 }, { "entropy": 5.908649682998657, "epoch": 5.461388834857032, "grad_norm": 1.5078125, "learning_rate": 0.00024496859025171564, "loss": 4.9122, "mean_token_accuracy": 0.21795813590288163, "num_tokens": 121759296.0, "step": 70195 }, { "entropy": 5.991874265670776, "epoch": 5.46177786422875, "grad_norm": 1.453125, "learning_rate": 0.0002449411228783474, "loss": 4.8579, "mean_token_accuracy": 0.22521924078464509, "num_tokens": 121767593.0, "step": 70200 }, { "entropy": 5.950638628005981, "epoch": 5.462166893600466, "grad_norm": 1.5234375, "learning_rate": 0.00024491365596107477, "loss": 4.8902, "mean_token_accuracy": 0.2189406245946884, "num_tokens": 121776473.0, "step": 70205 }, { "entropy": 5.947278928756714, "epoch": 5.462555922972184, "grad_norm": 1.546875, "learning_rate": 0.00024488618950031457, "loss": 4.9638, "mean_token_accuracy": 0.21975332349538804, "num_tokens": 121784648.0, "step": 70210 }, { "entropy": 5.908992004394531, "epoch": 5.462944952343902, "grad_norm": 1.6171875, "learning_rate": 0.00024485872349648335, "loss": 4.9032, "mean_token_accuracy": 0.22434411495923995, "num_tokens": 121793650.0, "step": 70215 }, { "entropy": 5.929314088821411, "epoch": 5.4633339817156195, "grad_norm": 1.5, "learning_rate": 0.00024483125794999815, "loss": 4.911, "mean_token_accuracy": 0.22596397548913955, "num_tokens": 121803072.0, "step": 70220 }, { "entropy": 5.982689476013183, "epoch": 5.463723011087337, "grad_norm": 1.4375, "learning_rate": 0.0002448037928612756, "loss": 4.8846, "mean_token_accuracy": 0.22459494173526764, "num_tokens": 121811394.0, "step": 70225 }, { "entropy": 5.9788548946380615, "epoch": 5.464112040459055, "grad_norm": 1.515625, "learning_rate": 0.0002447763282307324, "loss": 4.9402, "mean_token_accuracy": 0.21643175482749938, "num_tokens": 121820504.0, "step": 70230 }, { "entropy": 6.007728958129883, "epoch": 5.4645010698307726, "grad_norm": 1.3984375, "learning_rate": 0.0002447488640587854, "loss": 4.9672, "mean_token_accuracy": 0.22175848931074144, "num_tokens": 121829199.0, "step": 70235 }, { "entropy": 5.934974575042725, "epoch": 5.46489009920249, "grad_norm": 1.515625, "learning_rate": 0.00024472140034585113, "loss": 4.872, "mean_token_accuracy": 0.22756956666707992, "num_tokens": 121837454.0, "step": 70240 }, { "entropy": 5.915169620513916, "epoch": 5.465279128574207, "grad_norm": 1.5859375, "learning_rate": 0.00024469393709234647, "loss": 4.8826, "mean_token_accuracy": 0.22027171701192855, "num_tokens": 121845326.0, "step": 70245 }, { "entropy": 5.914072799682617, "epoch": 5.465668157945925, "grad_norm": 1.390625, "learning_rate": 0.00024466647429868804, "loss": 4.9518, "mean_token_accuracy": 0.22001068890094758, "num_tokens": 121854649.0, "step": 70250 }, { "entropy": 5.981341981887818, "epoch": 5.4660571873176425, "grad_norm": 1.5703125, "learning_rate": 0.0002446390119652926, "loss": 5.0305, "mean_token_accuracy": 0.2188127100467682, "num_tokens": 121863535.0, "step": 70255 }, { "entropy": 6.028214836120606, "epoch": 5.46644621668936, "grad_norm": 1.484375, "learning_rate": 0.00024461155009257684, "loss": 4.9386, "mean_token_accuracy": 0.22699596136808395, "num_tokens": 121872256.0, "step": 70260 }, { "entropy": 5.877805137634278, "epoch": 5.466835246061078, "grad_norm": 1.375, "learning_rate": 0.00024458408868095744, "loss": 4.848, "mean_token_accuracy": 0.2158252105116844, "num_tokens": 121881075.0, "step": 70265 }, { "entropy": 5.975247430801391, "epoch": 5.4672242754327955, "grad_norm": 1.4609375, "learning_rate": 0.00024455662773085107, "loss": 5.0396, "mean_token_accuracy": 0.21376084089279174, "num_tokens": 121890051.0, "step": 70270 }, { "entropy": 5.973037958145142, "epoch": 5.467613304804512, "grad_norm": 1.4609375, "learning_rate": 0.0002445291672426744, "loss": 4.9329, "mean_token_accuracy": 0.2202228859066963, "num_tokens": 121898638.0, "step": 70275 }, { "entropy": 5.914977979660034, "epoch": 5.46800233417623, "grad_norm": 1.4921875, "learning_rate": 0.00024450170721684416, "loss": 4.8458, "mean_token_accuracy": 0.22978811711072922, "num_tokens": 121907422.0, "step": 70280 }, { "entropy": 6.048287963867187, "epoch": 5.468391363547948, "grad_norm": 1.34375, "learning_rate": 0.0002444742476537769, "loss": 5.0081, "mean_token_accuracy": 0.21591449826955794, "num_tokens": 121916623.0, "step": 70285 }, { "entropy": 5.932656908035279, "epoch": 5.4687803929196654, "grad_norm": 1.5390625, "learning_rate": 0.00024444678855388934, "loss": 4.9335, "mean_token_accuracy": 0.21673074662685393, "num_tokens": 121924907.0, "step": 70290 }, { "entropy": 5.9612071990966795, "epoch": 5.469169422291383, "grad_norm": 1.4765625, "learning_rate": 0.00024441932991759824, "loss": 4.911, "mean_token_accuracy": 0.21317079067230224, "num_tokens": 121933224.0, "step": 70295 }, { "entropy": 6.016350603103637, "epoch": 5.469558451663101, "grad_norm": 1.640625, "learning_rate": 0.0002443918717453201, "loss": 5.0505, "mean_token_accuracy": 0.21678704172372817, "num_tokens": 121941249.0, "step": 70300 }, { "entropy": 6.012908935546875, "epoch": 5.4699474810348185, "grad_norm": 1.578125, "learning_rate": 0.0002443644140374715, "loss": 5.0635, "mean_token_accuracy": 0.204950512945652, "num_tokens": 121950427.0, "step": 70305 }, { "entropy": 6.003415203094482, "epoch": 5.470336510406535, "grad_norm": 1.6171875, "learning_rate": 0.00024433695679446934, "loss": 4.9789, "mean_token_accuracy": 0.2115243375301361, "num_tokens": 121959471.0, "step": 70310 }, { "entropy": 5.958139085769654, "epoch": 5.470725539778253, "grad_norm": 1.5625, "learning_rate": 0.0002443095000167299, "loss": 4.9483, "mean_token_accuracy": 0.22107537537813188, "num_tokens": 121968910.0, "step": 70315 }, { "entropy": 6.004298448562622, "epoch": 5.471114569149971, "grad_norm": 1.5859375, "learning_rate": 0.00024428204370467, "loss": 4.9519, "mean_token_accuracy": 0.21145312786102294, "num_tokens": 121976904.0, "step": 70320 }, { "entropy": 5.933706665039063, "epoch": 5.471503598521688, "grad_norm": 1.4296875, "learning_rate": 0.00024425458785870617, "loss": 4.8372, "mean_token_accuracy": 0.2207672953605652, "num_tokens": 121985716.0, "step": 70325 }, { "entropy": 5.926695013046265, "epoch": 5.471892627893406, "grad_norm": 1.4453125, "learning_rate": 0.00024422713247925507, "loss": 4.946, "mean_token_accuracy": 0.21529849916696547, "num_tokens": 121994047.0, "step": 70330 }, { "entropy": 5.930426406860351, "epoch": 5.472281657265124, "grad_norm": 1.546875, "learning_rate": 0.0002441996775667332, "loss": 4.9246, "mean_token_accuracy": 0.22008053511381148, "num_tokens": 122003249.0, "step": 70335 }, { "entropy": 5.983847618103027, "epoch": 5.472670686636841, "grad_norm": 1.5546875, "learning_rate": 0.0002441722231215572, "loss": 4.9482, "mean_token_accuracy": 0.2199401617050171, "num_tokens": 122011144.0, "step": 70340 }, { "entropy": 6.031998205184936, "epoch": 5.473059716008558, "grad_norm": 1.4921875, "learning_rate": 0.00024414476914414373, "loss": 5.017, "mean_token_accuracy": 0.21338811963796617, "num_tokens": 122020389.0, "step": 70345 }, { "entropy": 5.963103151321411, "epoch": 5.473448745380276, "grad_norm": 1.5234375, "learning_rate": 0.00024411731563490918, "loss": 4.9611, "mean_token_accuracy": 0.21821746081113816, "num_tokens": 122028348.0, "step": 70350 }, { "entropy": 6.017904615402221, "epoch": 5.473837774751994, "grad_norm": 1.5234375, "learning_rate": 0.00024408986259427025, "loss": 4.96, "mean_token_accuracy": 0.21725095063447952, "num_tokens": 122036638.0, "step": 70355 }, { "entropy": 6.047570848464966, "epoch": 5.474226804123711, "grad_norm": 1.546875, "learning_rate": 0.00024406241002264346, "loss": 5.0338, "mean_token_accuracy": 0.21034547537565232, "num_tokens": 122045311.0, "step": 70360 }, { "entropy": 5.907257986068726, "epoch": 5.474615833495429, "grad_norm": 1.609375, "learning_rate": 0.00024403495792044532, "loss": 4.9158, "mean_token_accuracy": 0.22249471843242646, "num_tokens": 122054748.0, "step": 70365 }, { "entropy": 5.8872373580932615, "epoch": 5.475004862867147, "grad_norm": 1.4375, "learning_rate": 0.00024400750628809247, "loss": 4.8722, "mean_token_accuracy": 0.22901204377412795, "num_tokens": 122063548.0, "step": 70370 }, { "entropy": 5.932893466949463, "epoch": 5.475393892238864, "grad_norm": 1.4921875, "learning_rate": 0.00024398005512600134, "loss": 4.9874, "mean_token_accuracy": 0.2194409966468811, "num_tokens": 122071907.0, "step": 70375 }, { "entropy": 5.89904088973999, "epoch": 5.475782921610581, "grad_norm": 1.4609375, "learning_rate": 0.00024395260443458856, "loss": 4.8418, "mean_token_accuracy": 0.23071974962949754, "num_tokens": 122079930.0, "step": 70380 }, { "entropy": 5.95824089050293, "epoch": 5.476171950982299, "grad_norm": 1.5, "learning_rate": 0.00024392515421427054, "loss": 4.932, "mean_token_accuracy": 0.21748286187648774, "num_tokens": 122088540.0, "step": 70385 }, { "entropy": 5.96919436454773, "epoch": 5.476560980354017, "grad_norm": 1.421875, "learning_rate": 0.00024389770446546388, "loss": 4.9642, "mean_token_accuracy": 0.21824264526367188, "num_tokens": 122097799.0, "step": 70390 }, { "entropy": 5.999470520019531, "epoch": 5.476950009725734, "grad_norm": 1.390625, "learning_rate": 0.00024387025518858503, "loss": 4.9607, "mean_token_accuracy": 0.21786169558763505, "num_tokens": 122106761.0, "step": 70395 }, { "entropy": 5.982647180557251, "epoch": 5.477339039097452, "grad_norm": 1.421875, "learning_rate": 0.0002438428063840505, "loss": 5.0274, "mean_token_accuracy": 0.21347213685512542, "num_tokens": 122115585.0, "step": 70400 }, { "entropy": 5.890702772140503, "epoch": 5.47772806846917, "grad_norm": 1.53125, "learning_rate": 0.00024381535805227677, "loss": 4.899, "mean_token_accuracy": 0.2185283601284027, "num_tokens": 122123701.0, "step": 70405 }, { "entropy": 5.995426845550537, "epoch": 5.478117097840887, "grad_norm": 1.4375, "learning_rate": 0.00024378791019368036, "loss": 4.9952, "mean_token_accuracy": 0.2249425619840622, "num_tokens": 122132707.0, "step": 70410 }, { "entropy": 5.9993959903717045, "epoch": 5.478506127212604, "grad_norm": 1.4296875, "learning_rate": 0.00024376046280867765, "loss": 4.9941, "mean_token_accuracy": 0.21296221017837524, "num_tokens": 122140611.0, "step": 70415 }, { "entropy": 5.9595160484313965, "epoch": 5.478895156584322, "grad_norm": 1.578125, "learning_rate": 0.00024373301589768531, "loss": 4.907, "mean_token_accuracy": 0.22458894550800323, "num_tokens": 122149453.0, "step": 70420 }, { "entropy": 5.8908594131469725, "epoch": 5.47928418595604, "grad_norm": 1.390625, "learning_rate": 0.0002437055694611197, "loss": 4.866, "mean_token_accuracy": 0.2256157413125038, "num_tokens": 122158177.0, "step": 70425 }, { "entropy": 5.964514875411988, "epoch": 5.479673215327757, "grad_norm": 1.453125, "learning_rate": 0.00024367812349939723, "loss": 4.9467, "mean_token_accuracy": 0.21685306429862977, "num_tokens": 122166860.0, "step": 70430 }, { "entropy": 5.96753339767456, "epoch": 5.480062244699475, "grad_norm": 1.5234375, "learning_rate": 0.00024365067801293438, "loss": 4.9799, "mean_token_accuracy": 0.21732509583234788, "num_tokens": 122175378.0, "step": 70435 }, { "entropy": 5.936414766311645, "epoch": 5.480451274071193, "grad_norm": 1.7109375, "learning_rate": 0.00024362323300214755, "loss": 4.8862, "mean_token_accuracy": 0.22556928396224976, "num_tokens": 122184348.0, "step": 70440 }, { "entropy": 6.016794490814209, "epoch": 5.48084030344291, "grad_norm": 1.4375, "learning_rate": 0.0002435957884674533, "loss": 4.9997, "mean_token_accuracy": 0.21757253557443618, "num_tokens": 122192861.0, "step": 70445 }, { "entropy": 5.896386766433716, "epoch": 5.481229332814627, "grad_norm": 1.4453125, "learning_rate": 0.0002435683444092679, "loss": 4.8296, "mean_token_accuracy": 0.22956524640321732, "num_tokens": 122202076.0, "step": 70450 }, { "entropy": 5.9378471851348875, "epoch": 5.481618362186345, "grad_norm": 1.375, "learning_rate": 0.0002435409008280079, "loss": 4.9218, "mean_token_accuracy": 0.21909688860177995, "num_tokens": 122211482.0, "step": 70455 }, { "entropy": 6.017807960510254, "epoch": 5.482007391558063, "grad_norm": 1.484375, "learning_rate": 0.0002435134577240896, "loss": 4.96, "mean_token_accuracy": 0.21332394778728486, "num_tokens": 122219385.0, "step": 70460 }, { "entropy": 5.946179580688477, "epoch": 5.48239642092978, "grad_norm": 1.4609375, "learning_rate": 0.00024348601509792956, "loss": 4.9768, "mean_token_accuracy": 0.2127937227487564, "num_tokens": 122228544.0, "step": 70465 }, { "entropy": 5.911778688430786, "epoch": 5.482785450301498, "grad_norm": 1.6171875, "learning_rate": 0.00024345857294994405, "loss": 4.8806, "mean_token_accuracy": 0.22565930038690568, "num_tokens": 122237870.0, "step": 70470 }, { "entropy": 5.997793817520142, "epoch": 5.483174479673215, "grad_norm": 1.578125, "learning_rate": 0.00024343113128054945, "loss": 4.9711, "mean_token_accuracy": 0.22394575774669648, "num_tokens": 122245525.0, "step": 70475 }, { "entropy": 5.944190931320191, "epoch": 5.483563509044933, "grad_norm": 1.6015625, "learning_rate": 0.0002434036900901621, "loss": 4.8172, "mean_token_accuracy": 0.23269631415605546, "num_tokens": 122253689.0, "step": 70480 }, { "entropy": 5.936705780029297, "epoch": 5.48395253841665, "grad_norm": 1.6171875, "learning_rate": 0.00024337624937919856, "loss": 4.9918, "mean_token_accuracy": 0.21378928124904634, "num_tokens": 122262179.0, "step": 70485 }, { "entropy": 5.905461835861206, "epoch": 5.484341567788368, "grad_norm": 1.6328125, "learning_rate": 0.00024334880914807512, "loss": 4.9208, "mean_token_accuracy": 0.22155172675848006, "num_tokens": 122270304.0, "step": 70490 }, { "entropy": 5.910798120498657, "epoch": 5.484730597160086, "grad_norm": 1.4921875, "learning_rate": 0.00024332136939720806, "loss": 4.8617, "mean_token_accuracy": 0.2284513831138611, "num_tokens": 122278480.0, "step": 70495 }, { "entropy": 5.919939947128296, "epoch": 5.485119626531803, "grad_norm": 1.5625, "learning_rate": 0.00024329393012701396, "loss": 4.9232, "mean_token_accuracy": 0.21460044980049134, "num_tokens": 122286425.0, "step": 70500 }, { "entropy": 5.948812103271484, "epoch": 5.485508655903521, "grad_norm": 1.453125, "learning_rate": 0.00024326649133790885, "loss": 4.9301, "mean_token_accuracy": 0.21724251359701158, "num_tokens": 122295053.0, "step": 70505 }, { "entropy": 5.945113039016723, "epoch": 5.485897685275238, "grad_norm": 1.4296875, "learning_rate": 0.00024323905303030925, "loss": 4.859, "mean_token_accuracy": 0.23535158783197402, "num_tokens": 122304227.0, "step": 70510 }, { "entropy": 5.919388103485107, "epoch": 5.486286714646956, "grad_norm": 1.515625, "learning_rate": 0.00024321161520463147, "loss": 4.9161, "mean_token_accuracy": 0.22310811877250672, "num_tokens": 122312930.0, "step": 70515 }, { "entropy": 5.915830373764038, "epoch": 5.486675744018673, "grad_norm": 1.46875, "learning_rate": 0.00024318417786129188, "loss": 4.8991, "mean_token_accuracy": 0.2226574882864952, "num_tokens": 122321340.0, "step": 70520 }, { "entropy": 5.961959409713745, "epoch": 5.487064773390391, "grad_norm": 1.5078125, "learning_rate": 0.00024315674100070672, "loss": 4.9588, "mean_token_accuracy": 0.21752821803092956, "num_tokens": 122329697.0, "step": 70525 }, { "entropy": 5.994410610198974, "epoch": 5.487453802762109, "grad_norm": 1.4140625, "learning_rate": 0.0002431293046232923, "loss": 4.9802, "mean_token_accuracy": 0.21960243135690688, "num_tokens": 122337713.0, "step": 70530 }, { "entropy": 5.9285054206848145, "epoch": 5.487842832133826, "grad_norm": 1.5, "learning_rate": 0.00024310186872946498, "loss": 4.8602, "mean_token_accuracy": 0.22690443247556685, "num_tokens": 122346992.0, "step": 70535 }, { "entropy": 5.905802488327026, "epoch": 5.488231861505543, "grad_norm": 1.40625, "learning_rate": 0.00024307443331964107, "loss": 4.8706, "mean_token_accuracy": 0.21943615525960922, "num_tokens": 122355002.0, "step": 70540 }, { "entropy": 5.9703226566314695, "epoch": 5.488620890877261, "grad_norm": 1.5703125, "learning_rate": 0.00024304699839423677, "loss": 4.9387, "mean_token_accuracy": 0.2181223973631859, "num_tokens": 122363300.0, "step": 70545 }, { "entropy": 5.981680774688721, "epoch": 5.489009920248979, "grad_norm": 1.4453125, "learning_rate": 0.00024301956395366838, "loss": 4.9603, "mean_token_accuracy": 0.2173103481531143, "num_tokens": 122372650.0, "step": 70550 }, { "entropy": 5.958162260055542, "epoch": 5.489398949620696, "grad_norm": 1.3984375, "learning_rate": 0.00024299212999835223, "loss": 4.8677, "mean_token_accuracy": 0.22220796644687651, "num_tokens": 122381754.0, "step": 70555 }, { "entropy": 5.957894897460937, "epoch": 5.489787978992414, "grad_norm": 1.546875, "learning_rate": 0.00024296469652870456, "loss": 4.9113, "mean_token_accuracy": 0.21959279030561446, "num_tokens": 122390468.0, "step": 70560 }, { "entropy": 5.974099493026733, "epoch": 5.490177008364132, "grad_norm": 1.515625, "learning_rate": 0.00024293726354514166, "loss": 4.9713, "mean_token_accuracy": 0.22042764127254486, "num_tokens": 122398934.0, "step": 70565 }, { "entropy": 5.941821718215943, "epoch": 5.490566037735849, "grad_norm": 1.4453125, "learning_rate": 0.0002429098310480798, "loss": 4.9452, "mean_token_accuracy": 0.220921990275383, "num_tokens": 122407226.0, "step": 70570 }, { "entropy": 5.979077386856079, "epoch": 5.490955067107567, "grad_norm": 1.6484375, "learning_rate": 0.00024288239903793508, "loss": 4.987, "mean_token_accuracy": 0.21571199893951415, "num_tokens": 122415565.0, "step": 70575 }, { "entropy": 5.966078567504883, "epoch": 5.491344096479284, "grad_norm": 1.40625, "learning_rate": 0.00024285496751512393, "loss": 4.9687, "mean_token_accuracy": 0.2156738445162773, "num_tokens": 122425506.0, "step": 70580 }, { "entropy": 6.020027589797974, "epoch": 5.491733125851002, "grad_norm": 1.53125, "learning_rate": 0.0002428275364800624, "loss": 5.039, "mean_token_accuracy": 0.2182349979877472, "num_tokens": 122434074.0, "step": 70585 }, { "entropy": 5.928857469558716, "epoch": 5.492122155222719, "grad_norm": 1.4375, "learning_rate": 0.00024280010593316683, "loss": 4.9511, "mean_token_accuracy": 0.21847590059041977, "num_tokens": 122443601.0, "step": 70590 }, { "entropy": 6.032143926620483, "epoch": 5.492511184594437, "grad_norm": 1.4453125, "learning_rate": 0.0002427726758748534, "loss": 5.0084, "mean_token_accuracy": 0.20755247175693511, "num_tokens": 122453282.0, "step": 70595 }, { "entropy": 5.992221355438232, "epoch": 5.492900213966155, "grad_norm": 1.5234375, "learning_rate": 0.0002427452463055383, "loss": 4.9152, "mean_token_accuracy": 0.22200459837913514, "num_tokens": 122461307.0, "step": 70600 }, { "entropy": 5.894187641143799, "epoch": 5.493289243337872, "grad_norm": 1.4921875, "learning_rate": 0.00024271781722563773, "loss": 4.7974, "mean_token_accuracy": 0.23077647387981415, "num_tokens": 122470258.0, "step": 70605 }, { "entropy": 5.943425416946411, "epoch": 5.493678272709589, "grad_norm": 1.5703125, "learning_rate": 0.00024269038863556798, "loss": 4.9642, "mean_token_accuracy": 0.21794824451208114, "num_tokens": 122479019.0, "step": 70610 }, { "entropy": 5.924500322341919, "epoch": 5.494067302081307, "grad_norm": 1.6171875, "learning_rate": 0.00024266296053574506, "loss": 4.9006, "mean_token_accuracy": 0.22078728675842285, "num_tokens": 122487592.0, "step": 70615 }, { "entropy": 5.951456928253174, "epoch": 5.494456331453025, "grad_norm": 1.578125, "learning_rate": 0.0002426355329265853, "loss": 4.93, "mean_token_accuracy": 0.21787372827529908, "num_tokens": 122495648.0, "step": 70620 }, { "entropy": 5.995060825347901, "epoch": 5.494845360824742, "grad_norm": 1.4765625, "learning_rate": 0.00024260810580850479, "loss": 4.9654, "mean_token_accuracy": 0.2104364737868309, "num_tokens": 122504244.0, "step": 70625 }, { "entropy": 5.8834315776824955, "epoch": 5.49523439019646, "grad_norm": 1.484375, "learning_rate": 0.00024258067918191971, "loss": 4.8144, "mean_token_accuracy": 0.23290845900774002, "num_tokens": 122512940.0, "step": 70630 }, { "entropy": 5.971502447128296, "epoch": 5.495623419568178, "grad_norm": 1.4453125, "learning_rate": 0.0002425532530472463, "loss": 4.992, "mean_token_accuracy": 0.2123175159096718, "num_tokens": 122522658.0, "step": 70635 }, { "entropy": 5.972108983993531, "epoch": 5.496012448939895, "grad_norm": 1.5859375, "learning_rate": 0.00024252582740490053, "loss": 4.9415, "mean_token_accuracy": 0.22343245297670364, "num_tokens": 122531349.0, "step": 70640 }, { "entropy": 6.027799987792969, "epoch": 5.496401478311612, "grad_norm": 1.625, "learning_rate": 0.00024249840225529874, "loss": 4.9581, "mean_token_accuracy": 0.2242451012134552, "num_tokens": 122539891.0, "step": 70645 }, { "entropy": 5.999165821075439, "epoch": 5.49679050768333, "grad_norm": 1.671875, "learning_rate": 0.0002424709775988569, "loss": 5.0093, "mean_token_accuracy": 0.20905782729387284, "num_tokens": 122548003.0, "step": 70650 }, { "entropy": 5.9686705589294435, "epoch": 5.497179537055048, "grad_norm": 1.4921875, "learning_rate": 0.00024244355343599116, "loss": 4.926, "mean_token_accuracy": 0.2171271786093712, "num_tokens": 122556778.0, "step": 70655 }, { "entropy": 5.98237624168396, "epoch": 5.497568566426765, "grad_norm": 1.4921875, "learning_rate": 0.00024241612976711786, "loss": 4.9161, "mean_token_accuracy": 0.22354793697595596, "num_tokens": 122565470.0, "step": 70660 }, { "entropy": 5.933294296264648, "epoch": 5.497957595798483, "grad_norm": 1.5703125, "learning_rate": 0.00024238870659265278, "loss": 4.9522, "mean_token_accuracy": 0.2193521499633789, "num_tokens": 122573843.0, "step": 70665 }, { "entropy": 5.918291997909546, "epoch": 5.498346625170201, "grad_norm": 1.3671875, "learning_rate": 0.00024236128391301215, "loss": 4.8859, "mean_token_accuracy": 0.22633672654628753, "num_tokens": 122582680.0, "step": 70670 }, { "entropy": 5.989422082901001, "epoch": 5.4987356545419175, "grad_norm": 1.609375, "learning_rate": 0.00024233386172861217, "loss": 4.9242, "mean_token_accuracy": 0.21458499878644943, "num_tokens": 122591364.0, "step": 70675 }, { "entropy": 6.03534426689148, "epoch": 5.499124683913635, "grad_norm": 1.546875, "learning_rate": 0.00024230644003986869, "loss": 4.9811, "mean_token_accuracy": 0.20704880952835084, "num_tokens": 122599885.0, "step": 70680 }, { "entropy": 6.012503433227539, "epoch": 5.499513713285353, "grad_norm": 1.53125, "learning_rate": 0.00024227901884719806, "loss": 4.9205, "mean_token_accuracy": 0.22470949739217758, "num_tokens": 122609087.0, "step": 70685 }, { "entropy": 6.026303434371949, "epoch": 5.499902742657071, "grad_norm": 1.3828125, "learning_rate": 0.00024225159815101626, "loss": 5.0268, "mean_token_accuracy": 0.2101210370659828, "num_tokens": 122617997.0, "step": 70690 }, { "entropy": 5.966021776199341, "epoch": 5.500291772028788, "grad_norm": 1.515625, "learning_rate": 0.00024222417795173929, "loss": 4.949, "mean_token_accuracy": 0.21887064278125762, "num_tokens": 122626488.0, "step": 70695 }, { "entropy": 5.971127319335937, "epoch": 5.500680801400506, "grad_norm": 1.4375, "learning_rate": 0.00024219675824978332, "loss": 4.9706, "mean_token_accuracy": 0.21735353767871857, "num_tokens": 122635279.0, "step": 70700 }, { "entropy": 5.941038656234741, "epoch": 5.501069830772224, "grad_norm": 1.546875, "learning_rate": 0.00024216933904556425, "loss": 4.8744, "mean_token_accuracy": 0.23166452944278718, "num_tokens": 122643129.0, "step": 70705 }, { "entropy": 5.957791042327881, "epoch": 5.501458860143941, "grad_norm": 1.484375, "learning_rate": 0.00024214192033949827, "loss": 4.9801, "mean_token_accuracy": 0.21714633256196975, "num_tokens": 122651191.0, "step": 70710 }, { "entropy": 6.003350877761841, "epoch": 5.501847889515658, "grad_norm": 1.515625, "learning_rate": 0.00024211450213200132, "loss": 5.01, "mean_token_accuracy": 0.2171599641442299, "num_tokens": 122660422.0, "step": 70715 }, { "entropy": 6.02469048500061, "epoch": 5.502236918887376, "grad_norm": 1.4921875, "learning_rate": 0.00024208708442348943, "loss": 5.0324, "mean_token_accuracy": 0.20958724915981292, "num_tokens": 122668714.0, "step": 70720 }, { "entropy": 5.898644304275512, "epoch": 5.502625948259094, "grad_norm": 1.5625, "learning_rate": 0.00024205966721437867, "loss": 4.9012, "mean_token_accuracy": 0.22218665331602097, "num_tokens": 122677814.0, "step": 70725 }, { "entropy": 5.977047157287598, "epoch": 5.503014977630811, "grad_norm": 1.515625, "learning_rate": 0.00024203225050508503, "loss": 4.9393, "mean_token_accuracy": 0.2231607675552368, "num_tokens": 122686213.0, "step": 70730 }, { "entropy": 6.026789426803589, "epoch": 5.503404007002529, "grad_norm": 1.5546875, "learning_rate": 0.0002420048342960245, "loss": 4.9873, "mean_token_accuracy": 0.21268612891435623, "num_tokens": 122694938.0, "step": 70735 }, { "entropy": 5.976043939590454, "epoch": 5.503793036374246, "grad_norm": 1.46875, "learning_rate": 0.00024197741858761318, "loss": 5.0041, "mean_token_accuracy": 0.21414270848035813, "num_tokens": 122703121.0, "step": 70740 }, { "entropy": 5.974841165542602, "epoch": 5.5041820657459635, "grad_norm": 1.5078125, "learning_rate": 0.0002419500033802669, "loss": 4.9423, "mean_token_accuracy": 0.21258212327957154, "num_tokens": 122711741.0, "step": 70745 }, { "entropy": 5.99524245262146, "epoch": 5.504571095117681, "grad_norm": 1.453125, "learning_rate": 0.0002419225886744016, "loss": 4.8789, "mean_token_accuracy": 0.21784351766109467, "num_tokens": 122720730.0, "step": 70750 }, { "entropy": 5.948440408706665, "epoch": 5.504960124489399, "grad_norm": 1.390625, "learning_rate": 0.00024189517447043352, "loss": 4.9176, "mean_token_accuracy": 0.21818767338991166, "num_tokens": 122729483.0, "step": 70755 }, { "entropy": 5.881301927566528, "epoch": 5.505349153861117, "grad_norm": 1.46875, "learning_rate": 0.00024186776076877843, "loss": 4.844, "mean_token_accuracy": 0.22190718203783036, "num_tokens": 122738479.0, "step": 70760 }, { "entropy": 5.969672393798828, "epoch": 5.505738183232834, "grad_norm": 1.5625, "learning_rate": 0.00024184034756985235, "loss": 4.9749, "mean_token_accuracy": 0.21714142858982086, "num_tokens": 122747524.0, "step": 70765 }, { "entropy": 5.947131204605102, "epoch": 5.506127212604552, "grad_norm": 1.515625, "learning_rate": 0.00024181293487407125, "loss": 4.9363, "mean_token_accuracy": 0.22481646686792373, "num_tokens": 122756565.0, "step": 70770 }, { "entropy": 5.896308135986328, "epoch": 5.50651624197627, "grad_norm": 1.46875, "learning_rate": 0.000241785522681851, "loss": 4.9046, "mean_token_accuracy": 0.2226010650396347, "num_tokens": 122764915.0, "step": 70775 }, { "entropy": 5.9126574993133545, "epoch": 5.5069052713479865, "grad_norm": 1.5546875, "learning_rate": 0.00024175811099360757, "loss": 4.8833, "mean_token_accuracy": 0.21962203234434127, "num_tokens": 122773933.0, "step": 70780 }, { "entropy": 5.958370018005371, "epoch": 5.507294300719704, "grad_norm": 1.4765625, "learning_rate": 0.00024173069980975691, "loss": 4.9305, "mean_token_accuracy": 0.2189391851425171, "num_tokens": 122782440.0, "step": 70785 }, { "entropy": 6.003009939193726, "epoch": 5.507683330091422, "grad_norm": 1.5703125, "learning_rate": 0.00024170328913071493, "loss": 4.9145, "mean_token_accuracy": 0.2255675032734871, "num_tokens": 122790916.0, "step": 70790 }, { "entropy": 6.013731575012207, "epoch": 5.5080723594631396, "grad_norm": 1.6015625, "learning_rate": 0.00024167587895689753, "loss": 4.9635, "mean_token_accuracy": 0.22456276118755342, "num_tokens": 122799660.0, "step": 70795 }, { "entropy": 5.941084384918213, "epoch": 5.508461388834857, "grad_norm": 1.4609375, "learning_rate": 0.00024164846928872064, "loss": 4.9129, "mean_token_accuracy": 0.21477831155061722, "num_tokens": 122808191.0, "step": 70800 }, { "entropy": 5.932675457000732, "epoch": 5.508850418206575, "grad_norm": 1.546875, "learning_rate": 0.00024162106012660012, "loss": 4.9376, "mean_token_accuracy": 0.2162783920764923, "num_tokens": 122816604.0, "step": 70805 }, { "entropy": 6.02034912109375, "epoch": 5.509239447578292, "grad_norm": 1.546875, "learning_rate": 0.0002415936514709519, "loss": 5.0228, "mean_token_accuracy": 0.21489442735910416, "num_tokens": 122824539.0, "step": 70810 }, { "entropy": 5.966786098480225, "epoch": 5.5096284769500095, "grad_norm": 1.5703125, "learning_rate": 0.0002415662433221918, "loss": 4.9584, "mean_token_accuracy": 0.2179805800318718, "num_tokens": 122832438.0, "step": 70815 }, { "entropy": 6.106759357452392, "epoch": 5.510017506321727, "grad_norm": 1.703125, "learning_rate": 0.00024153883568073576, "loss": 5.1205, "mean_token_accuracy": 0.20764787644147872, "num_tokens": 122840850.0, "step": 70820 }, { "entropy": 6.029980564117432, "epoch": 5.510406535693445, "grad_norm": 1.5078125, "learning_rate": 0.0002415114285469997, "loss": 5.0045, "mean_token_accuracy": 0.2158176839351654, "num_tokens": 122849790.0, "step": 70825 }, { "entropy": 5.910354471206665, "epoch": 5.5107955650651625, "grad_norm": 1.4453125, "learning_rate": 0.00024148402192139935, "loss": 4.8439, "mean_token_accuracy": 0.2267097771167755, "num_tokens": 122857059.0, "step": 70830 }, { "entropy": 5.986735773086548, "epoch": 5.51118459443688, "grad_norm": 1.5, "learning_rate": 0.00024145661580435063, "loss": 4.9685, "mean_token_accuracy": 0.2182190537452698, "num_tokens": 122865897.0, "step": 70835 }, { "entropy": 6.002157354354859, "epoch": 5.511573623808598, "grad_norm": 1.453125, "learning_rate": 0.00024142921019626933, "loss": 4.967, "mean_token_accuracy": 0.21898044496774674, "num_tokens": 122875371.0, "step": 70840 }, { "entropy": 5.927171421051026, "epoch": 5.511962653180315, "grad_norm": 1.4765625, "learning_rate": 0.00024140180509757143, "loss": 4.9082, "mean_token_accuracy": 0.22391510903835296, "num_tokens": 122883369.0, "step": 70845 }, { "entropy": 5.9694311141967775, "epoch": 5.5123516825520325, "grad_norm": 1.546875, "learning_rate": 0.00024137440050867265, "loss": 4.9922, "mean_token_accuracy": 0.2128205418586731, "num_tokens": 122892518.0, "step": 70850 }, { "entropy": 5.959693098068238, "epoch": 5.51274071192375, "grad_norm": 1.5625, "learning_rate": 0.00024134699642998882, "loss": 4.9322, "mean_token_accuracy": 0.21817529201507568, "num_tokens": 122901257.0, "step": 70855 }, { "entropy": 5.9683057308197025, "epoch": 5.513129741295468, "grad_norm": 1.5078125, "learning_rate": 0.00024131959286193572, "loss": 4.9674, "mean_token_accuracy": 0.22104318737983703, "num_tokens": 122910294.0, "step": 70860 }, { "entropy": 5.960390281677246, "epoch": 5.5135187706671855, "grad_norm": 1.5546875, "learning_rate": 0.00024129218980492917, "loss": 4.9926, "mean_token_accuracy": 0.2167594015598297, "num_tokens": 122919122.0, "step": 70865 }, { "entropy": 5.967777824401855, "epoch": 5.513907800038903, "grad_norm": 1.5390625, "learning_rate": 0.000241264787259385, "loss": 4.9277, "mean_token_accuracy": 0.21707086712121965, "num_tokens": 122927230.0, "step": 70870 }, { "entropy": 5.9385534763336185, "epoch": 5.51429682941062, "grad_norm": 1.546875, "learning_rate": 0.00024123738522571902, "loss": 4.902, "mean_token_accuracy": 0.22274251729249955, "num_tokens": 122936028.0, "step": 70875 }, { "entropy": 5.963991308212281, "epoch": 5.514685858782338, "grad_norm": 1.453125, "learning_rate": 0.0002412099837043469, "loss": 4.9035, "mean_token_accuracy": 0.22129716277122496, "num_tokens": 122943713.0, "step": 70880 }, { "entropy": 6.009473276138306, "epoch": 5.515074888154055, "grad_norm": 1.453125, "learning_rate": 0.00024118258269568456, "loss": 4.9558, "mean_token_accuracy": 0.22478728443384172, "num_tokens": 122952525.0, "step": 70885 }, { "entropy": 5.9801506996154785, "epoch": 5.515463917525773, "grad_norm": 1.390625, "learning_rate": 0.00024115518220014771, "loss": 5.0321, "mean_token_accuracy": 0.21471601575613022, "num_tokens": 122961735.0, "step": 70890 }, { "entropy": 5.937101030349732, "epoch": 5.515852946897491, "grad_norm": 1.5234375, "learning_rate": 0.00024112778221815206, "loss": 4.8996, "mean_token_accuracy": 0.21993622183799744, "num_tokens": 122969956.0, "step": 70895 }, { "entropy": 5.951824951171875, "epoch": 5.5162419762692085, "grad_norm": 1.5546875, "learning_rate": 0.00024110038275011343, "loss": 4.9327, "mean_token_accuracy": 0.21865475922822952, "num_tokens": 122978724.0, "step": 70900 }, { "entropy": 5.956900405883789, "epoch": 5.516631005640926, "grad_norm": 1.6328125, "learning_rate": 0.00024107298379644754, "loss": 4.9395, "mean_token_accuracy": 0.21959673911333083, "num_tokens": 122986904.0, "step": 70905 }, { "entropy": 5.860125350952148, "epoch": 5.517020035012644, "grad_norm": 1.4765625, "learning_rate": 0.0002410455853575701, "loss": 4.8156, "mean_token_accuracy": 0.23102680295705796, "num_tokens": 122995676.0, "step": 70910 }, { "entropy": 5.867335510253906, "epoch": 5.517409064384361, "grad_norm": 1.5234375, "learning_rate": 0.00024101818743389687, "loss": 4.8778, "mean_token_accuracy": 0.2254628911614418, "num_tokens": 123004044.0, "step": 70915 }, { "entropy": 5.908370065689087, "epoch": 5.517798093756078, "grad_norm": 1.6796875, "learning_rate": 0.00024099079002584355, "loss": 4.9326, "mean_token_accuracy": 0.21371461749076842, "num_tokens": 123014416.0, "step": 70920 }, { "entropy": 5.933271026611328, "epoch": 5.518187123127796, "grad_norm": 1.5234375, "learning_rate": 0.00024096339313382586, "loss": 4.9146, "mean_token_accuracy": 0.22008589953184127, "num_tokens": 123023049.0, "step": 70925 }, { "entropy": 5.931514549255371, "epoch": 5.518576152499514, "grad_norm": 1.3828125, "learning_rate": 0.00024093599675825954, "loss": 4.8129, "mean_token_accuracy": 0.22620275616645813, "num_tokens": 123031420.0, "step": 70930 }, { "entropy": 6.034665489196778, "epoch": 5.5189651818712315, "grad_norm": 1.6328125, "learning_rate": 0.00024090860089956024, "loss": 4.9872, "mean_token_accuracy": 0.2136535793542862, "num_tokens": 123039515.0, "step": 70935 }, { "entropy": 5.934506416320801, "epoch": 5.519354211242949, "grad_norm": 1.46875, "learning_rate": 0.0002408812055581437, "loss": 4.9822, "mean_token_accuracy": 0.22170058339834214, "num_tokens": 123048131.0, "step": 70940 }, { "entropy": 5.979631233215332, "epoch": 5.519743240614666, "grad_norm": 1.5078125, "learning_rate": 0.00024085381073442536, "loss": 4.9534, "mean_token_accuracy": 0.21521830707788467, "num_tokens": 123056665.0, "step": 70945 }, { "entropy": 6.0260542869567875, "epoch": 5.520132269986384, "grad_norm": 1.40625, "learning_rate": 0.00024082641642882125, "loss": 5.0597, "mean_token_accuracy": 0.20866467505693437, "num_tokens": 123065855.0, "step": 70950 }, { "entropy": 5.940960836410523, "epoch": 5.520521299358101, "grad_norm": 1.6640625, "learning_rate": 0.00024079902264174686, "loss": 4.8715, "mean_token_accuracy": 0.22485389858484267, "num_tokens": 123073325.0, "step": 70955 }, { "entropy": 5.916835689544678, "epoch": 5.520910328729819, "grad_norm": 1.5, "learning_rate": 0.0002407716293736179, "loss": 4.9367, "mean_token_accuracy": 0.22424513846635818, "num_tokens": 123081932.0, "step": 70960 }, { "entropy": 5.892676973342896, "epoch": 5.521299358101537, "grad_norm": 1.453125, "learning_rate": 0.00024074423662484996, "loss": 4.8671, "mean_token_accuracy": 0.22854380756616594, "num_tokens": 123090801.0, "step": 70965 }, { "entropy": 5.94747405052185, "epoch": 5.5216883874732545, "grad_norm": 1.6015625, "learning_rate": 0.0002407168443958587, "loss": 4.8953, "mean_token_accuracy": 0.2157708302140236, "num_tokens": 123098901.0, "step": 70970 }, { "entropy": 5.992716646194458, "epoch": 5.522077416844972, "grad_norm": 1.53125, "learning_rate": 0.00024068945268705978, "loss": 4.9861, "mean_token_accuracy": 0.2144833117723465, "num_tokens": 123106902.0, "step": 70975 }, { "entropy": 5.972788381576538, "epoch": 5.522466446216689, "grad_norm": 1.578125, "learning_rate": 0.00024066206149886876, "loss": 4.9827, "mean_token_accuracy": 0.21229513138532638, "num_tokens": 123115548.0, "step": 70980 }, { "entropy": 5.978305053710938, "epoch": 5.522855475588407, "grad_norm": 1.578125, "learning_rate": 0.00024063467083170132, "loss": 4.9577, "mean_token_accuracy": 0.21809609234333038, "num_tokens": 123123749.0, "step": 70985 }, { "entropy": 5.932640790939331, "epoch": 5.523244504960124, "grad_norm": 1.53125, "learning_rate": 0.0002406072806859731, "loss": 4.9673, "mean_token_accuracy": 0.2177960082888603, "num_tokens": 123131963.0, "step": 70990 }, { "entropy": 5.8571524143219, "epoch": 5.523633534331842, "grad_norm": 1.53125, "learning_rate": 0.0002405798910620996, "loss": 4.8796, "mean_token_accuracy": 0.22494855672121047, "num_tokens": 123140011.0, "step": 70995 }, { "entropy": 6.021400213241577, "epoch": 5.52402256370356, "grad_norm": 1.4453125, "learning_rate": 0.0002405525019604965, "loss": 5.0384, "mean_token_accuracy": 0.21281415820121766, "num_tokens": 123148470.0, "step": 71000 }, { "entropy": 5.991381025314331, "epoch": 5.5244115930752775, "grad_norm": 1.4453125, "learning_rate": 0.00024052511338157928, "loss": 4.9519, "mean_token_accuracy": 0.21436567604541779, "num_tokens": 123157354.0, "step": 71005 }, { "entropy": 6.002187061309814, "epoch": 5.524800622446994, "grad_norm": 1.8203125, "learning_rate": 0.00024049772532576364, "loss": 5.0168, "mean_token_accuracy": 0.21916416734457017, "num_tokens": 123166088.0, "step": 71010 }, { "entropy": 5.880302381515503, "epoch": 5.525189651818712, "grad_norm": 1.390625, "learning_rate": 0.00024047033779346505, "loss": 4.9694, "mean_token_accuracy": 0.21861686557531357, "num_tokens": 123174675.0, "step": 71015 }, { "entropy": 5.975411510467529, "epoch": 5.52557868119043, "grad_norm": 1.53125, "learning_rate": 0.0002404429507850992, "loss": 4.9869, "mean_token_accuracy": 0.22323040813207626, "num_tokens": 123184362.0, "step": 71020 }, { "entropy": 5.929631996154785, "epoch": 5.525967710562147, "grad_norm": 1.4296875, "learning_rate": 0.0002404155643010815, "loss": 4.9412, "mean_token_accuracy": 0.21899281293153763, "num_tokens": 123193393.0, "step": 71025 }, { "entropy": 5.995051383972168, "epoch": 5.526356739933865, "grad_norm": 1.515625, "learning_rate": 0.00024038817834182762, "loss": 4.9717, "mean_token_accuracy": 0.21933116912841796, "num_tokens": 123202125.0, "step": 71030 }, { "entropy": 5.898466920852661, "epoch": 5.526745769305583, "grad_norm": 1.46875, "learning_rate": 0.00024036079290775308, "loss": 4.9067, "mean_token_accuracy": 0.22351279407739638, "num_tokens": 123210399.0, "step": 71035 }, { "entropy": 6.002439641952515, "epoch": 5.5271347986773005, "grad_norm": 1.703125, "learning_rate": 0.00024033340799927338, "loss": 4.9907, "mean_token_accuracy": 0.2154357135295868, "num_tokens": 123219247.0, "step": 71040 }, { "entropy": 5.9523979187011715, "epoch": 5.527523828049017, "grad_norm": 1.5625, "learning_rate": 0.000240306023616804, "loss": 4.9539, "mean_token_accuracy": 0.2259290933609009, "num_tokens": 123227614.0, "step": 71045 }, { "entropy": 5.948361206054687, "epoch": 5.527912857420735, "grad_norm": 1.515625, "learning_rate": 0.00024027863976076047, "loss": 4.9603, "mean_token_accuracy": 0.2179491013288498, "num_tokens": 123235456.0, "step": 71050 }, { "entropy": 5.915952491760254, "epoch": 5.528301886792453, "grad_norm": 1.546875, "learning_rate": 0.0002402512564315583, "loss": 4.854, "mean_token_accuracy": 0.2244955286383629, "num_tokens": 123244411.0, "step": 71055 }, { "entropy": 5.96636734008789, "epoch": 5.52869091616417, "grad_norm": 1.40625, "learning_rate": 0.00024022387362961306, "loss": 4.9092, "mean_token_accuracy": 0.2226063758134842, "num_tokens": 123253343.0, "step": 71060 }, { "entropy": 6.028327131271363, "epoch": 5.529079945535888, "grad_norm": 1.5078125, "learning_rate": 0.00024019649135534015, "loss": 5.0369, "mean_token_accuracy": 0.21102530062198638, "num_tokens": 123262528.0, "step": 71065 }, { "entropy": 5.91817717552185, "epoch": 5.529468974907606, "grad_norm": 1.390625, "learning_rate": 0.00024016910960915512, "loss": 4.969, "mean_token_accuracy": 0.2161789357662201, "num_tokens": 123272081.0, "step": 71070 }, { "entropy": 6.017677307128906, "epoch": 5.529858004279323, "grad_norm": 1.46875, "learning_rate": 0.00024014172839147336, "loss": 4.9891, "mean_token_accuracy": 0.21666686832904816, "num_tokens": 123280650.0, "step": 71075 }, { "entropy": 6.002981567382813, "epoch": 5.53024703365104, "grad_norm": 1.546875, "learning_rate": 0.00024011434770271033, "loss": 4.9473, "mean_token_accuracy": 0.2170201227068901, "num_tokens": 123288987.0, "step": 71080 }, { "entropy": 6.000453281402588, "epoch": 5.530636063022758, "grad_norm": 1.65625, "learning_rate": 0.0002400869675432817, "loss": 4.9936, "mean_token_accuracy": 0.22091503143310548, "num_tokens": 123296898.0, "step": 71085 }, { "entropy": 5.917473697662354, "epoch": 5.531025092394476, "grad_norm": 1.4453125, "learning_rate": 0.00024005958791360266, "loss": 4.9257, "mean_token_accuracy": 0.21992261558771134, "num_tokens": 123305611.0, "step": 71090 }, { "entropy": 5.960154962539673, "epoch": 5.531414121766193, "grad_norm": 1.5390625, "learning_rate": 0.00024003220881408882, "loss": 4.9272, "mean_token_accuracy": 0.22469554990530013, "num_tokens": 123313794.0, "step": 71095 }, { "entropy": 5.978445100784302, "epoch": 5.531803151137911, "grad_norm": 1.5625, "learning_rate": 0.00024000483024515552, "loss": 4.9403, "mean_token_accuracy": 0.2225944072008133, "num_tokens": 123322088.0, "step": 71100 }, { "entropy": 5.9850749492645265, "epoch": 5.532192180509629, "grad_norm": 1.5, "learning_rate": 0.00023997745220721823, "loss": 4.9591, "mean_token_accuracy": 0.21468393057584761, "num_tokens": 123330111.0, "step": 71105 }, { "entropy": 5.949058103561401, "epoch": 5.5325812098813465, "grad_norm": 1.4921875, "learning_rate": 0.00023995007470069236, "loss": 4.9136, "mean_token_accuracy": 0.22267056852579117, "num_tokens": 123338589.0, "step": 71110 }, { "entropy": 5.995131540298462, "epoch": 5.532970239253063, "grad_norm": 1.4140625, "learning_rate": 0.00023992269772599335, "loss": 5.0114, "mean_token_accuracy": 0.20801491141319275, "num_tokens": 123347941.0, "step": 71115 }, { "entropy": 6.005447101593018, "epoch": 5.533359268624781, "grad_norm": 1.4375, "learning_rate": 0.00023989532128353654, "loss": 5.099, "mean_token_accuracy": 0.20693634897470475, "num_tokens": 123358431.0, "step": 71120 }, { "entropy": 5.914597082138061, "epoch": 5.533748297996499, "grad_norm": 1.6328125, "learning_rate": 0.0002398679453737374, "loss": 4.8777, "mean_token_accuracy": 0.2233620584011078, "num_tokens": 123366548.0, "step": 71125 }, { "entropy": 5.97241473197937, "epoch": 5.534137327368216, "grad_norm": 1.53125, "learning_rate": 0.00023984056999701121, "loss": 4.9184, "mean_token_accuracy": 0.22294820994138717, "num_tokens": 123375438.0, "step": 71130 }, { "entropy": 5.941115474700927, "epoch": 5.534526356739934, "grad_norm": 1.453125, "learning_rate": 0.00023981319515377347, "loss": 4.948, "mean_token_accuracy": 0.21383794844150544, "num_tokens": 123384340.0, "step": 71135 }, { "entropy": 5.94424524307251, "epoch": 5.534915386111652, "grad_norm": 1.53125, "learning_rate": 0.00023978582084443939, "loss": 4.9306, "mean_token_accuracy": 0.22128111720085145, "num_tokens": 123393088.0, "step": 71140 }, { "entropy": 5.840986919403076, "epoch": 5.535304415483369, "grad_norm": 1.4921875, "learning_rate": 0.0002397584470694244, "loss": 4.6682, "mean_token_accuracy": 0.24049134701490402, "num_tokens": 123402198.0, "step": 71145 }, { "entropy": 5.985688161849976, "epoch": 5.535693444855086, "grad_norm": 1.484375, "learning_rate": 0.000239731073829144, "loss": 4.98, "mean_token_accuracy": 0.21640587896108626, "num_tokens": 123411143.0, "step": 71150 }, { "entropy": 6.006634521484375, "epoch": 5.536082474226804, "grad_norm": 1.6640625, "learning_rate": 0.0002397037011240134, "loss": 5.0491, "mean_token_accuracy": 0.21639318466186525, "num_tokens": 123419779.0, "step": 71155 }, { "entropy": 5.944285726547241, "epoch": 5.536471503598522, "grad_norm": 1.4609375, "learning_rate": 0.00023967632895444796, "loss": 4.946, "mean_token_accuracy": 0.2263677030801773, "num_tokens": 123429002.0, "step": 71160 }, { "entropy": 5.875865697860718, "epoch": 5.536860532970239, "grad_norm": 1.4609375, "learning_rate": 0.000239648957320863, "loss": 4.804, "mean_token_accuracy": 0.2277510493993759, "num_tokens": 123437178.0, "step": 71165 }, { "entropy": 5.963204383850098, "epoch": 5.537249562341957, "grad_norm": 1.7890625, "learning_rate": 0.0002396215862236738, "loss": 4.8765, "mean_token_accuracy": 0.2362345963716507, "num_tokens": 123446927.0, "step": 71170 }, { "entropy": 5.982075977325439, "epoch": 5.537638591713675, "grad_norm": 1.4140625, "learning_rate": 0.00023959421566329574, "loss": 4.9526, "mean_token_accuracy": 0.21260907948017121, "num_tokens": 123456567.0, "step": 71175 }, { "entropy": 5.941429853439331, "epoch": 5.538027621085392, "grad_norm": 1.5546875, "learning_rate": 0.00023956684564014415, "loss": 4.8368, "mean_token_accuracy": 0.22583421915769578, "num_tokens": 123465142.0, "step": 71180 }, { "entropy": 5.939698982238769, "epoch": 5.538416650457109, "grad_norm": 1.578125, "learning_rate": 0.00023953947615463423, "loss": 4.9472, "mean_token_accuracy": 0.21497834026813506, "num_tokens": 123474434.0, "step": 71185 }, { "entropy": 5.902551889419556, "epoch": 5.538805679828827, "grad_norm": 1.4140625, "learning_rate": 0.0002395121072071813, "loss": 4.9327, "mean_token_accuracy": 0.22042478173971175, "num_tokens": 123483381.0, "step": 71190 }, { "entropy": 5.986184978485108, "epoch": 5.539194709200545, "grad_norm": 1.46875, "learning_rate": 0.00023948473879820072, "loss": 4.9765, "mean_token_accuracy": 0.21151377707719804, "num_tokens": 123491607.0, "step": 71195 }, { "entropy": 5.994960784912109, "epoch": 5.539583738572262, "grad_norm": 1.4453125, "learning_rate": 0.00023945737092810764, "loss": 5.0565, "mean_token_accuracy": 0.21053973585367203, "num_tokens": 123500938.0, "step": 71200 }, { "entropy": 5.964706563949585, "epoch": 5.53997276794398, "grad_norm": 1.5, "learning_rate": 0.0002394300035973175, "loss": 4.9394, "mean_token_accuracy": 0.21413474380970002, "num_tokens": 123509397.0, "step": 71205 }, { "entropy": 5.9748788356781, "epoch": 5.540361797315697, "grad_norm": 1.4296875, "learning_rate": 0.00023940263680624535, "loss": 4.9278, "mean_token_accuracy": 0.22080014348030091, "num_tokens": 123518366.0, "step": 71210 }, { "entropy": 5.987403297424317, "epoch": 5.540750826687415, "grad_norm": 1.40625, "learning_rate": 0.00023937527055530643, "loss": 4.9672, "mean_token_accuracy": 0.21517172157764436, "num_tokens": 123527159.0, "step": 71215 }, { "entropy": 5.8696386337280275, "epoch": 5.541139856059132, "grad_norm": 1.4453125, "learning_rate": 0.0002393479048449162, "loss": 4.8529, "mean_token_accuracy": 0.22951883524656297, "num_tokens": 123536266.0, "step": 71220 }, { "entropy": 5.9507331371307375, "epoch": 5.54152888543085, "grad_norm": 1.5546875, "learning_rate": 0.00023932053967548971, "loss": 5.0116, "mean_token_accuracy": 0.21587826907634736, "num_tokens": 123545219.0, "step": 71225 }, { "entropy": 5.936486482620239, "epoch": 5.541917914802568, "grad_norm": 1.5390625, "learning_rate": 0.00023929317504744235, "loss": 4.8562, "mean_token_accuracy": 0.22185115963220597, "num_tokens": 123553920.0, "step": 71230 }, { "entropy": 6.017495346069336, "epoch": 5.542306944174285, "grad_norm": 1.4921875, "learning_rate": 0.00023926581096118916, "loss": 4.964, "mean_token_accuracy": 0.2178903803229332, "num_tokens": 123562255.0, "step": 71235 }, { "entropy": 5.936067295074463, "epoch": 5.542695973546003, "grad_norm": 1.5, "learning_rate": 0.0002392384474171454, "loss": 4.9048, "mean_token_accuracy": 0.220511095225811, "num_tokens": 123570931.0, "step": 71240 }, { "entropy": 5.972685432434082, "epoch": 5.543085002917721, "grad_norm": 1.609375, "learning_rate": 0.00023921108441572625, "loss": 5.0264, "mean_token_accuracy": 0.2090453565120697, "num_tokens": 123578737.0, "step": 71245 }, { "entropy": 5.930301475524902, "epoch": 5.543474032289438, "grad_norm": 1.640625, "learning_rate": 0.000239183721957347, "loss": 4.8875, "mean_token_accuracy": 0.2216387450695038, "num_tokens": 123586514.0, "step": 71250 }, { "entropy": 5.968838739395141, "epoch": 5.543863061661155, "grad_norm": 1.453125, "learning_rate": 0.00023915636004242274, "loss": 4.8772, "mean_token_accuracy": 0.22548809498548508, "num_tokens": 123595516.0, "step": 71255 }, { "entropy": 5.963003540039063, "epoch": 5.544252091032873, "grad_norm": 1.515625, "learning_rate": 0.0002391289986713686, "loss": 4.9195, "mean_token_accuracy": 0.21644422858953477, "num_tokens": 123604128.0, "step": 71260 }, { "entropy": 5.912517023086548, "epoch": 5.544641120404591, "grad_norm": 1.421875, "learning_rate": 0.00023910163784459986, "loss": 4.9121, "mean_token_accuracy": 0.2228151962161064, "num_tokens": 123612891.0, "step": 71265 }, { "entropy": 5.914330625534058, "epoch": 5.545030149776308, "grad_norm": 1.4765625, "learning_rate": 0.0002390742775625317, "loss": 4.9417, "mean_token_accuracy": 0.2147146314382553, "num_tokens": 123621443.0, "step": 71270 }, { "entropy": 6.066943788528443, "epoch": 5.545419179148025, "grad_norm": 1.5078125, "learning_rate": 0.00023904691782557908, "loss": 5.0733, "mean_token_accuracy": 0.20723872631788254, "num_tokens": 123630581.0, "step": 71275 }, { "entropy": 6.018024349212647, "epoch": 5.545808208519743, "grad_norm": 1.4140625, "learning_rate": 0.00023901955863415725, "loss": 4.9512, "mean_token_accuracy": 0.21435263901948928, "num_tokens": 123639580.0, "step": 71280 }, { "entropy": 5.968200588226319, "epoch": 5.546197237891461, "grad_norm": 1.6015625, "learning_rate": 0.00023899219998868142, "loss": 4.9217, "mean_token_accuracy": 0.22358225882053376, "num_tokens": 123648024.0, "step": 71285 }, { "entropy": 5.930078983306885, "epoch": 5.546586267263178, "grad_norm": 1.5625, "learning_rate": 0.00023896484188956664, "loss": 5.0065, "mean_token_accuracy": 0.2146504834294319, "num_tokens": 123656274.0, "step": 71290 }, { "entropy": 5.968483972549438, "epoch": 5.546975296634896, "grad_norm": 1.4375, "learning_rate": 0.000238937484337228, "loss": 5.0237, "mean_token_accuracy": 0.21366752982139586, "num_tokens": 123665176.0, "step": 71295 }, { "entropy": 6.0183202743530275, "epoch": 5.547364326006614, "grad_norm": 1.5546875, "learning_rate": 0.00023891012733208062, "loss": 5.0718, "mean_token_accuracy": 0.21795423179864884, "num_tokens": 123674460.0, "step": 71300 }, { "entropy": 6.0261688232421875, "epoch": 5.547753355378331, "grad_norm": 1.6015625, "learning_rate": 0.00023888277087453962, "loss": 4.9266, "mean_token_accuracy": 0.2176585778594017, "num_tokens": 123683930.0, "step": 71305 }, { "entropy": 5.941478109359741, "epoch": 5.548142384750049, "grad_norm": 1.6171875, "learning_rate": 0.00023885541496502017, "loss": 4.8627, "mean_token_accuracy": 0.22013467103242873, "num_tokens": 123692718.0, "step": 71310 }, { "entropy": 5.867500877380371, "epoch": 5.548531414121766, "grad_norm": 1.421875, "learning_rate": 0.00023882805960393722, "loss": 4.8681, "mean_token_accuracy": 0.22218011021614076, "num_tokens": 123701526.0, "step": 71315 }, { "entropy": 5.950256299972534, "epoch": 5.548920443493484, "grad_norm": 1.5, "learning_rate": 0.0002388007047917059, "loss": 4.9841, "mean_token_accuracy": 0.21839507967233657, "num_tokens": 123710466.0, "step": 71320 }, { "entropy": 5.858599138259888, "epoch": 5.549309472865201, "grad_norm": 1.4921875, "learning_rate": 0.00023877335052874122, "loss": 4.8702, "mean_token_accuracy": 0.22504011839628218, "num_tokens": 123718902.0, "step": 71325 }, { "entropy": 5.913662052154541, "epoch": 5.549698502236919, "grad_norm": 1.4765625, "learning_rate": 0.00023874599681545833, "loss": 4.9548, "mean_token_accuracy": 0.22411651760339737, "num_tokens": 123727818.0, "step": 71330 }, { "entropy": 5.949743032455444, "epoch": 5.550087531608637, "grad_norm": 1.671875, "learning_rate": 0.0002387186436522722, "loss": 4.9493, "mean_token_accuracy": 0.2268570989370346, "num_tokens": 123735773.0, "step": 71335 }, { "entropy": 6.037681341171265, "epoch": 5.550476560980354, "grad_norm": 1.59375, "learning_rate": 0.0002386912910395979, "loss": 5.0616, "mean_token_accuracy": 0.21308959573507308, "num_tokens": 123744708.0, "step": 71340 }, { "entropy": 5.946996831893921, "epoch": 5.550865590352071, "grad_norm": 1.5234375, "learning_rate": 0.00023866393897785049, "loss": 4.9163, "mean_token_accuracy": 0.21804601699113846, "num_tokens": 123753081.0, "step": 71345 }, { "entropy": 5.9165685176849365, "epoch": 5.551254619723789, "grad_norm": 1.4921875, "learning_rate": 0.00023863658746744494, "loss": 4.9385, "mean_token_accuracy": 0.22170434892177582, "num_tokens": 123761581.0, "step": 71350 }, { "entropy": 5.951578092575073, "epoch": 5.551643649095507, "grad_norm": 1.5546875, "learning_rate": 0.00023860923650879636, "loss": 4.8939, "mean_token_accuracy": 0.22442959249019623, "num_tokens": 123770000.0, "step": 71355 }, { "entropy": 5.996806478500366, "epoch": 5.552032678467224, "grad_norm": 1.4296875, "learning_rate": 0.0002385818861023197, "loss": 5.0129, "mean_token_accuracy": 0.21791805028915406, "num_tokens": 123778540.0, "step": 71360 }, { "entropy": 5.9745598316192625, "epoch": 5.552421707838942, "grad_norm": 1.46875, "learning_rate": 0.00023855453624842986, "loss": 4.8575, "mean_token_accuracy": 0.2265525281429291, "num_tokens": 123787086.0, "step": 71365 }, { "entropy": 5.9080057621002195, "epoch": 5.55281073721066, "grad_norm": 1.6171875, "learning_rate": 0.000238527186947542, "loss": 4.9362, "mean_token_accuracy": 0.21715307086706162, "num_tokens": 123795040.0, "step": 71370 }, { "entropy": 6.031479787826538, "epoch": 5.553199766582377, "grad_norm": 1.5703125, "learning_rate": 0.000238499838200071, "loss": 5.1178, "mean_token_accuracy": 0.20820316970348357, "num_tokens": 123803610.0, "step": 71375 }, { "entropy": 5.93375940322876, "epoch": 5.553588795954094, "grad_norm": 1.640625, "learning_rate": 0.00023847249000643185, "loss": 4.8991, "mean_token_accuracy": 0.21728943437337875, "num_tokens": 123812044.0, "step": 71380 }, { "entropy": 5.982574558258056, "epoch": 5.553977825325812, "grad_norm": 1.421875, "learning_rate": 0.00023844514236703952, "loss": 4.9728, "mean_token_accuracy": 0.219694884121418, "num_tokens": 123820665.0, "step": 71385 }, { "entropy": 5.951496124267578, "epoch": 5.5543668546975296, "grad_norm": 1.46875, "learning_rate": 0.000238417795282309, "loss": 4.8839, "mean_token_accuracy": 0.22410383373498916, "num_tokens": 123828896.0, "step": 71390 }, { "entropy": 5.983322477340698, "epoch": 5.554755884069247, "grad_norm": 1.3984375, "learning_rate": 0.00023839044875265526, "loss": 4.9956, "mean_token_accuracy": 0.2158604696393013, "num_tokens": 123837955.0, "step": 71395 }, { "entropy": 6.008596706390381, "epoch": 5.555144913440965, "grad_norm": 1.625, "learning_rate": 0.0002383631027784931, "loss": 5.0014, "mean_token_accuracy": 0.2183651804924011, "num_tokens": 123846421.0, "step": 71400 }, { "entropy": 6.046213006973266, "epoch": 5.555533942812683, "grad_norm": 1.3984375, "learning_rate": 0.00023833575736023754, "loss": 5.0653, "mean_token_accuracy": 0.20254047363996505, "num_tokens": 123855208.0, "step": 71405 }, { "entropy": 6.034641599655151, "epoch": 5.5559229721843995, "grad_norm": 1.578125, "learning_rate": 0.00023830841249830348, "loss": 5.1275, "mean_token_accuracy": 0.20732738673686982, "num_tokens": 123863702.0, "step": 71410 }, { "entropy": 5.982849168777466, "epoch": 5.556312001556117, "grad_norm": 1.4609375, "learning_rate": 0.0002382810681931059, "loss": 4.9369, "mean_token_accuracy": 0.21981185376644136, "num_tokens": 123872602.0, "step": 71415 }, { "entropy": 6.028792524337769, "epoch": 5.556701030927835, "grad_norm": 1.5859375, "learning_rate": 0.00023825372444505967, "loss": 4.9992, "mean_token_accuracy": 0.21216824799776077, "num_tokens": 123881614.0, "step": 71420 }, { "entropy": 5.92593297958374, "epoch": 5.5570900602995525, "grad_norm": 1.515625, "learning_rate": 0.00023822638125457974, "loss": 4.8565, "mean_token_accuracy": 0.21412606835365294, "num_tokens": 123889630.0, "step": 71425 }, { "entropy": 5.975437974929809, "epoch": 5.55747908967127, "grad_norm": 1.4453125, "learning_rate": 0.00023819903862208093, "loss": 4.9517, "mean_token_accuracy": 0.22103043794631957, "num_tokens": 123898288.0, "step": 71430 }, { "entropy": 5.9636406898498535, "epoch": 5.557868119042988, "grad_norm": 1.5078125, "learning_rate": 0.0002381716965479781, "loss": 4.9343, "mean_token_accuracy": 0.2189297005534172, "num_tokens": 123906540.0, "step": 71435 }, { "entropy": 5.870230627059937, "epoch": 5.558257148414706, "grad_norm": 1.6484375, "learning_rate": 0.00023814435503268617, "loss": 4.8061, "mean_token_accuracy": 0.22460798174142838, "num_tokens": 123914355.0, "step": 71440 }, { "entropy": 5.932128238677978, "epoch": 5.558646177786423, "grad_norm": 1.390625, "learning_rate": 0.00023811701407661995, "loss": 4.9469, "mean_token_accuracy": 0.21508176922798156, "num_tokens": 123923313.0, "step": 71445 }, { "entropy": 5.91254677772522, "epoch": 5.55903520715814, "grad_norm": 1.5703125, "learning_rate": 0.00023808967368019434, "loss": 4.97, "mean_token_accuracy": 0.2198936551809311, "num_tokens": 123931862.0, "step": 71450 }, { "entropy": 5.989532423019409, "epoch": 5.559424236529858, "grad_norm": 1.5390625, "learning_rate": 0.0002380623338438242, "loss": 4.9754, "mean_token_accuracy": 0.219772270321846, "num_tokens": 123940813.0, "step": 71455 }, { "entropy": 5.994790506362915, "epoch": 5.5598132659015755, "grad_norm": 1.359375, "learning_rate": 0.0002380349945679244, "loss": 4.9915, "mean_token_accuracy": 0.2157420828938484, "num_tokens": 123950037.0, "step": 71460 }, { "entropy": 5.958417701721191, "epoch": 5.560202295273293, "grad_norm": 1.3828125, "learning_rate": 0.00023800765585290967, "loss": 4.9772, "mean_token_accuracy": 0.21437259912490844, "num_tokens": 123958624.0, "step": 71465 }, { "entropy": 5.916739082336425, "epoch": 5.560591324645011, "grad_norm": 1.421875, "learning_rate": 0.00023798031769919488, "loss": 4.8062, "mean_token_accuracy": 0.22598819434642792, "num_tokens": 123967537.0, "step": 71470 }, { "entropy": 5.994444513320923, "epoch": 5.560980354016729, "grad_norm": 1.484375, "learning_rate": 0.0002379529801071949, "loss": 4.9401, "mean_token_accuracy": 0.22464111000299453, "num_tokens": 123976330.0, "step": 71475 }, { "entropy": 5.989505100250244, "epoch": 5.561369383388445, "grad_norm": 1.5703125, "learning_rate": 0.0002379256430773244, "loss": 4.941, "mean_token_accuracy": 0.22138318568468093, "num_tokens": 123984549.0, "step": 71480 }, { "entropy": 5.965972900390625, "epoch": 5.561758412760163, "grad_norm": 1.4921875, "learning_rate": 0.00023789830660999822, "loss": 5.0534, "mean_token_accuracy": 0.20846115797758102, "num_tokens": 123993441.0, "step": 71485 }, { "entropy": 5.954560232162476, "epoch": 5.562147442131881, "grad_norm": 1.4375, "learning_rate": 0.0002378709707056313, "loss": 4.8882, "mean_token_accuracy": 0.22652447372674941, "num_tokens": 124001631.0, "step": 71490 }, { "entropy": 5.958728170394897, "epoch": 5.5625364715035985, "grad_norm": 1.40625, "learning_rate": 0.00023784363536463827, "loss": 4.9532, "mean_token_accuracy": 0.2124000981450081, "num_tokens": 124010159.0, "step": 71495 }, { "entropy": 6.00135908126831, "epoch": 5.562925500875316, "grad_norm": 1.5, "learning_rate": 0.00023781630058743392, "loss": 4.9077, "mean_token_accuracy": 0.2214615151286125, "num_tokens": 124018881.0, "step": 71500 }, { "entropy": 5.911443376541138, "epoch": 5.563314530247034, "grad_norm": 1.4609375, "learning_rate": 0.0002377889663744331, "loss": 4.9463, "mean_token_accuracy": 0.22110024690628052, "num_tokens": 124027528.0, "step": 71505 }, { "entropy": 5.922202014923096, "epoch": 5.563703559618752, "grad_norm": 1.546875, "learning_rate": 0.0002377616327260504, "loss": 4.9166, "mean_token_accuracy": 0.22080135047435762, "num_tokens": 124035733.0, "step": 71510 }, { "entropy": 6.026410102844238, "epoch": 5.564092588990468, "grad_norm": 1.5546875, "learning_rate": 0.00023773429964270065, "loss": 5.0004, "mean_token_accuracy": 0.21989874839782714, "num_tokens": 124044875.0, "step": 71515 }, { "entropy": 5.967165946960449, "epoch": 5.564481618362186, "grad_norm": 1.4765625, "learning_rate": 0.0002377069671247986, "loss": 4.8847, "mean_token_accuracy": 0.2225658968091011, "num_tokens": 124053223.0, "step": 71520 }, { "entropy": 5.950085210800171, "epoch": 5.564870647733904, "grad_norm": 1.578125, "learning_rate": 0.00023767963517275903, "loss": 4.9221, "mean_token_accuracy": 0.21639414578676225, "num_tokens": 124061739.0, "step": 71525 }, { "entropy": 5.860366916656494, "epoch": 5.5652596771056215, "grad_norm": 1.4375, "learning_rate": 0.0002376523037869965, "loss": 4.8219, "mean_token_accuracy": 0.23611561357975006, "num_tokens": 124070264.0, "step": 71530 }, { "entropy": 5.9864359378814695, "epoch": 5.565648706477339, "grad_norm": 1.5234375, "learning_rate": 0.00023762497296792585, "loss": 4.9964, "mean_token_accuracy": 0.2178785890340805, "num_tokens": 124078999.0, "step": 71535 }, { "entropy": 5.989340543746948, "epoch": 5.566037735849057, "grad_norm": 1.53125, "learning_rate": 0.00023759764271596173, "loss": 5.033, "mean_token_accuracy": 0.2139681950211525, "num_tokens": 124088060.0, "step": 71540 }, { "entropy": 5.877062273025513, "epoch": 5.566426765220774, "grad_norm": 1.484375, "learning_rate": 0.00023757031303151888, "loss": 4.8453, "mean_token_accuracy": 0.2268519416451454, "num_tokens": 124096683.0, "step": 71545 }, { "entropy": 5.935090160369873, "epoch": 5.566815794592491, "grad_norm": 1.484375, "learning_rate": 0.00023754298391501195, "loss": 4.9294, "mean_token_accuracy": 0.22316647320985794, "num_tokens": 124104639.0, "step": 71550 }, { "entropy": 5.921485424041748, "epoch": 5.567204823964209, "grad_norm": 1.578125, "learning_rate": 0.0002375156553668556, "loss": 4.8652, "mean_token_accuracy": 0.21907831579446793, "num_tokens": 124112830.0, "step": 71555 }, { "entropy": 5.980562925338745, "epoch": 5.567593853335927, "grad_norm": 1.5390625, "learning_rate": 0.0002374883273874645, "loss": 5.024, "mean_token_accuracy": 0.21733318865299225, "num_tokens": 124121109.0, "step": 71560 }, { "entropy": 5.993254041671753, "epoch": 5.5679828827076445, "grad_norm": 1.390625, "learning_rate": 0.0002374609999772534, "loss": 4.9299, "mean_token_accuracy": 0.2244493305683136, "num_tokens": 124130297.0, "step": 71565 }, { "entropy": 6.029901647567749, "epoch": 5.568371912079362, "grad_norm": 1.4609375, "learning_rate": 0.00023743367313663682, "loss": 4.9665, "mean_token_accuracy": 0.21727085411548613, "num_tokens": 124138489.0, "step": 71570 }, { "entropy": 5.978700780868531, "epoch": 5.56876094145108, "grad_norm": 1.578125, "learning_rate": 0.00023740634686602945, "loss": 4.9527, "mean_token_accuracy": 0.2138536974787712, "num_tokens": 124146850.0, "step": 71575 }, { "entropy": 5.911853504180908, "epoch": 5.569149970822798, "grad_norm": 1.4609375, "learning_rate": 0.00023737902116584598, "loss": 4.8997, "mean_token_accuracy": 0.2219911575317383, "num_tokens": 124155673.0, "step": 71580 }, { "entropy": 5.938500213623047, "epoch": 5.569539000194514, "grad_norm": 1.421875, "learning_rate": 0.00023735169603650104, "loss": 4.8231, "mean_token_accuracy": 0.23067893832921982, "num_tokens": 124164531.0, "step": 71585 }, { "entropy": 5.970232200622559, "epoch": 5.569928029566232, "grad_norm": 1.4921875, "learning_rate": 0.00023732437147840906, "loss": 4.9169, "mean_token_accuracy": 0.21559476107358932, "num_tokens": 124173147.0, "step": 71590 }, { "entropy": 5.911458730697632, "epoch": 5.57031705893795, "grad_norm": 1.515625, "learning_rate": 0.00023729704749198482, "loss": 4.8531, "mean_token_accuracy": 0.2239275321364403, "num_tokens": 124182403.0, "step": 71595 }, { "entropy": 5.990103435516358, "epoch": 5.5707060883096675, "grad_norm": 1.4921875, "learning_rate": 0.00023726972407764286, "loss": 5.0058, "mean_token_accuracy": 0.216741643846035, "num_tokens": 124191352.0, "step": 71600 }, { "entropy": 5.961564302444458, "epoch": 5.571095117681385, "grad_norm": 1.46875, "learning_rate": 0.00023724240123579782, "loss": 4.8943, "mean_token_accuracy": 0.22624872475862504, "num_tokens": 124199948.0, "step": 71605 }, { "entropy": 5.948271703720093, "epoch": 5.571484147053102, "grad_norm": 1.6484375, "learning_rate": 0.00023721507896686412, "loss": 4.8261, "mean_token_accuracy": 0.2308749496936798, "num_tokens": 124207935.0, "step": 71610 }, { "entropy": 5.907149410247802, "epoch": 5.57187317642482, "grad_norm": 1.6171875, "learning_rate": 0.00023718775727125658, "loss": 4.8696, "mean_token_accuracy": 0.224971042573452, "num_tokens": 124216811.0, "step": 71615 }, { "entropy": 5.919652843475342, "epoch": 5.572262205796537, "grad_norm": 1.4921875, "learning_rate": 0.00023716043614938965, "loss": 4.9405, "mean_token_accuracy": 0.21835584938526154, "num_tokens": 124225667.0, "step": 71620 }, { "entropy": 5.94203143119812, "epoch": 5.572651235168255, "grad_norm": 1.4296875, "learning_rate": 0.00023713311560167783, "loss": 4.9393, "mean_token_accuracy": 0.21003020703792571, "num_tokens": 124234094.0, "step": 71625 }, { "entropy": 6.03167724609375, "epoch": 5.573040264539973, "grad_norm": 1.546875, "learning_rate": 0.00023710579562853573, "loss": 4.9745, "mean_token_accuracy": 0.2214861512184143, "num_tokens": 124242178.0, "step": 71630 }, { "entropy": 5.961128902435303, "epoch": 5.5734292939116905, "grad_norm": 1.6484375, "learning_rate": 0.00023707847623037783, "loss": 5.0065, "mean_token_accuracy": 0.2162827581167221, "num_tokens": 124250708.0, "step": 71635 }, { "entropy": 5.905124378204346, "epoch": 5.573818323283408, "grad_norm": 1.4453125, "learning_rate": 0.00023705115740761874, "loss": 4.8904, "mean_token_accuracy": 0.22338349521160125, "num_tokens": 124259160.0, "step": 71640 }, { "entropy": 5.987390613555908, "epoch": 5.574207352655126, "grad_norm": 1.375, "learning_rate": 0.00023702383916067294, "loss": 5.0122, "mean_token_accuracy": 0.2139311969280243, "num_tokens": 124268211.0, "step": 71645 }, { "entropy": 6.071311378479004, "epoch": 5.574596382026843, "grad_norm": 1.5, "learning_rate": 0.00023699652148995488, "loss": 5.0456, "mean_token_accuracy": 0.20477796196937562, "num_tokens": 124277530.0, "step": 71650 }, { "entropy": 5.903726816177368, "epoch": 5.57498541139856, "grad_norm": 1.4375, "learning_rate": 0.00023696920439587917, "loss": 4.8136, "mean_token_accuracy": 0.2322118654847145, "num_tokens": 124286020.0, "step": 71655 }, { "entropy": 5.995105409622193, "epoch": 5.575374440770278, "grad_norm": 1.6171875, "learning_rate": 0.00023694188787886023, "loss": 4.9553, "mean_token_accuracy": 0.21706831455230713, "num_tokens": 124294498.0, "step": 71660 }, { "entropy": 5.959561824798584, "epoch": 5.575763470141996, "grad_norm": 1.578125, "learning_rate": 0.0002369145719393126, "loss": 5.0157, "mean_token_accuracy": 0.2133713573217392, "num_tokens": 124303160.0, "step": 71665 }, { "entropy": 5.945098829269409, "epoch": 5.5761524995137135, "grad_norm": 1.390625, "learning_rate": 0.0002368872565776507, "loss": 4.9916, "mean_token_accuracy": 0.21537958979606628, "num_tokens": 124312684.0, "step": 71670 }, { "entropy": 5.959701251983643, "epoch": 5.576541528885431, "grad_norm": 1.609375, "learning_rate": 0.00023685994179428887, "loss": 4.8778, "mean_token_accuracy": 0.23108814507722855, "num_tokens": 124321426.0, "step": 71675 }, { "entropy": 5.9943990230560305, "epoch": 5.576930558257148, "grad_norm": 1.625, "learning_rate": 0.00023683262758964185, "loss": 4.997, "mean_token_accuracy": 0.2153536483645439, "num_tokens": 124329842.0, "step": 71680 }, { "entropy": 5.920341157913208, "epoch": 5.577319587628866, "grad_norm": 1.5078125, "learning_rate": 0.00023680531396412397, "loss": 4.9043, "mean_token_accuracy": 0.22194890379905702, "num_tokens": 124338906.0, "step": 71685 }, { "entropy": 5.923767137527466, "epoch": 5.577708617000583, "grad_norm": 1.6015625, "learning_rate": 0.00023677800091814966, "loss": 4.9378, "mean_token_accuracy": 0.21430815011262894, "num_tokens": 124346861.0, "step": 71690 }, { "entropy": 5.896508693695068, "epoch": 5.578097646372301, "grad_norm": 1.5078125, "learning_rate": 0.0002367506884521334, "loss": 4.9511, "mean_token_accuracy": 0.21623628437519074, "num_tokens": 124356138.0, "step": 71695 }, { "entropy": 5.967844247817993, "epoch": 5.578486675744019, "grad_norm": 1.53125, "learning_rate": 0.00023672337656648951, "loss": 4.9159, "mean_token_accuracy": 0.22357018738985063, "num_tokens": 124365459.0, "step": 71700 }, { "entropy": 5.962654638290405, "epoch": 5.5788757051157365, "grad_norm": 1.4609375, "learning_rate": 0.0002366960652616324, "loss": 4.9666, "mean_token_accuracy": 0.21764759421348573, "num_tokens": 124374222.0, "step": 71705 }, { "entropy": 6.005130004882813, "epoch": 5.579264734487454, "grad_norm": 1.5859375, "learning_rate": 0.0002366687545379766, "loss": 5.043, "mean_token_accuracy": 0.2138952061533928, "num_tokens": 124383242.0, "step": 71710 }, { "entropy": 5.957384300231934, "epoch": 5.579653763859171, "grad_norm": 1.53125, "learning_rate": 0.00023664144439593644, "loss": 4.9966, "mean_token_accuracy": 0.2260822609066963, "num_tokens": 124392080.0, "step": 71715 }, { "entropy": 5.988266944885254, "epoch": 5.580042793230889, "grad_norm": 1.5, "learning_rate": 0.00023661413483592626, "loss": 4.948, "mean_token_accuracy": 0.21648921817541122, "num_tokens": 124400376.0, "step": 71720 }, { "entropy": 5.966048002243042, "epoch": 5.580431822602606, "grad_norm": 1.375, "learning_rate": 0.00023658682585836049, "loss": 5.0265, "mean_token_accuracy": 0.21196640878915787, "num_tokens": 124409743.0, "step": 71725 }, { "entropy": 5.947758483886719, "epoch": 5.580820851974324, "grad_norm": 1.546875, "learning_rate": 0.00023655951746365356, "loss": 4.9187, "mean_token_accuracy": 0.21657426059246063, "num_tokens": 124418740.0, "step": 71730 }, { "entropy": 6.006952810287475, "epoch": 5.581209881346042, "grad_norm": 1.4609375, "learning_rate": 0.00023653220965221973, "loss": 4.9914, "mean_token_accuracy": 0.21133291572332383, "num_tokens": 124426857.0, "step": 71735 }, { "entropy": 5.985870313644409, "epoch": 5.5815989107177595, "grad_norm": 1.515625, "learning_rate": 0.00023650490242447338, "loss": 4.9256, "mean_token_accuracy": 0.2240399584174156, "num_tokens": 124435749.0, "step": 71740 }, { "entropy": 5.965119504928589, "epoch": 5.581987940089476, "grad_norm": 1.6328125, "learning_rate": 0.00023647759578082883, "loss": 4.9488, "mean_token_accuracy": 0.21598538309335708, "num_tokens": 124444697.0, "step": 71745 }, { "entropy": 5.916910839080811, "epoch": 5.582376969461194, "grad_norm": 1.484375, "learning_rate": 0.00023645028972170046, "loss": 4.8603, "mean_token_accuracy": 0.22530157268047332, "num_tokens": 124452889.0, "step": 71750 }, { "entropy": 5.985986518859863, "epoch": 5.582765998832912, "grad_norm": 1.3828125, "learning_rate": 0.00023642298424750264, "loss": 5.0247, "mean_token_accuracy": 0.21501931995153428, "num_tokens": 124462321.0, "step": 71755 }, { "entropy": 6.000534105300903, "epoch": 5.583155028204629, "grad_norm": 1.6796875, "learning_rate": 0.00023639567935864958, "loss": 4.9849, "mean_token_accuracy": 0.21923601180315017, "num_tokens": 124470903.0, "step": 71760 }, { "entropy": 5.943886756896973, "epoch": 5.583544057576347, "grad_norm": 1.515625, "learning_rate": 0.0002363683750555557, "loss": 5.0358, "mean_token_accuracy": 0.212981915473938, "num_tokens": 124479903.0, "step": 71765 }, { "entropy": 5.955171680450439, "epoch": 5.583933086948065, "grad_norm": 1.5234375, "learning_rate": 0.0002363410713386352, "loss": 4.9222, "mean_token_accuracy": 0.22077054381370545, "num_tokens": 124488114.0, "step": 71770 }, { "entropy": 6.001496124267578, "epoch": 5.5843221163197825, "grad_norm": 1.4765625, "learning_rate": 0.00023631376820830248, "loss": 4.95, "mean_token_accuracy": 0.21600372195243836, "num_tokens": 124496994.0, "step": 71775 }, { "entropy": 5.9759202003479, "epoch": 5.5847111456915, "grad_norm": 1.4453125, "learning_rate": 0.0002362864656649717, "loss": 4.9412, "mean_token_accuracy": 0.22384363859891893, "num_tokens": 124505678.0, "step": 71780 }, { "entropy": 5.993854093551636, "epoch": 5.585100175063217, "grad_norm": 1.5078125, "learning_rate": 0.00023625916370905714, "loss": 4.9239, "mean_token_accuracy": 0.21485771387815475, "num_tokens": 124514675.0, "step": 71785 }, { "entropy": 5.967865657806397, "epoch": 5.585489204434935, "grad_norm": 1.4375, "learning_rate": 0.00023623186234097315, "loss": 4.9971, "mean_token_accuracy": 0.21939122974872588, "num_tokens": 124523405.0, "step": 71790 }, { "entropy": 5.983066129684448, "epoch": 5.585878233806652, "grad_norm": 1.546875, "learning_rate": 0.00023620456156113397, "loss": 5.0388, "mean_token_accuracy": 0.21103414744138718, "num_tokens": 124532100.0, "step": 71795 }, { "entropy": 6.036317539215088, "epoch": 5.58626726317837, "grad_norm": 1.625, "learning_rate": 0.00023617726136995377, "loss": 5.0315, "mean_token_accuracy": 0.21090627908706666, "num_tokens": 124540821.0, "step": 71800 }, { "entropy": 6.011054992675781, "epoch": 5.586656292550088, "grad_norm": 1.390625, "learning_rate": 0.00023614996176784687, "loss": 4.9054, "mean_token_accuracy": 0.21940771937370301, "num_tokens": 124549359.0, "step": 71805 }, { "entropy": 5.964091491699219, "epoch": 5.5870453219218055, "grad_norm": 1.5625, "learning_rate": 0.00023612266275522737, "loss": 5.0015, "mean_token_accuracy": 0.21439261734485626, "num_tokens": 124558888.0, "step": 71810 }, { "entropy": 5.975882863998413, "epoch": 5.587434351293522, "grad_norm": 1.6328125, "learning_rate": 0.00023609536433250966, "loss": 4.9324, "mean_token_accuracy": 0.2247634083032608, "num_tokens": 124567458.0, "step": 71815 }, { "entropy": 5.978480195999145, "epoch": 5.58782338066524, "grad_norm": 1.5859375, "learning_rate": 0.00023606806650010786, "loss": 4.9635, "mean_token_accuracy": 0.21545154601335526, "num_tokens": 124576329.0, "step": 71820 }, { "entropy": 5.946493244171142, "epoch": 5.588212410036958, "grad_norm": 1.4609375, "learning_rate": 0.00023604076925843622, "loss": 4.9317, "mean_token_accuracy": 0.22226136028766633, "num_tokens": 124585615.0, "step": 71825 }, { "entropy": 5.915390253067017, "epoch": 5.588601439408675, "grad_norm": 1.5625, "learning_rate": 0.00023601347260790884, "loss": 4.8817, "mean_token_accuracy": 0.22215299308300018, "num_tokens": 124594170.0, "step": 71830 }, { "entropy": 5.989613008499146, "epoch": 5.588990468780393, "grad_norm": 1.515625, "learning_rate": 0.00023598617654894006, "loss": 5.0036, "mean_token_accuracy": 0.21270175129175187, "num_tokens": 124602671.0, "step": 71835 }, { "entropy": 6.010264253616333, "epoch": 5.589379498152111, "grad_norm": 1.5390625, "learning_rate": 0.00023595888108194385, "loss": 4.9661, "mean_token_accuracy": 0.22624698877334595, "num_tokens": 124611207.0, "step": 71840 }, { "entropy": 5.964342403411865, "epoch": 5.5897685275238285, "grad_norm": 1.578125, "learning_rate": 0.0002359315862073345, "loss": 4.8904, "mean_token_accuracy": 0.21458305716514586, "num_tokens": 124619490.0, "step": 71845 }, { "entropy": 5.886595773696899, "epoch": 5.590157556895545, "grad_norm": 1.453125, "learning_rate": 0.0002359042919255262, "loss": 4.8749, "mean_token_accuracy": 0.21880633682012557, "num_tokens": 124628330.0, "step": 71850 }, { "entropy": 5.91149525642395, "epoch": 5.590546586267263, "grad_norm": 1.375, "learning_rate": 0.00023587699823693304, "loss": 4.9149, "mean_token_accuracy": 0.2214462161064148, "num_tokens": 124637064.0, "step": 71855 }, { "entropy": 5.947497415542602, "epoch": 5.590935615638981, "grad_norm": 1.453125, "learning_rate": 0.00023584970514196912, "loss": 4.9763, "mean_token_accuracy": 0.22130292803049087, "num_tokens": 124645121.0, "step": 71860 }, { "entropy": 5.952523422241211, "epoch": 5.591324645010698, "grad_norm": 1.6328125, "learning_rate": 0.00023582241264104864, "loss": 4.9039, "mean_token_accuracy": 0.21909817755222322, "num_tokens": 124653541.0, "step": 71865 }, { "entropy": 5.929447364807129, "epoch": 5.591713674382416, "grad_norm": 1.4765625, "learning_rate": 0.00023579512073458565, "loss": 4.9516, "mean_token_accuracy": 0.2154666930437088, "num_tokens": 124662010.0, "step": 71870 }, { "entropy": 5.936817026138305, "epoch": 5.592102703754134, "grad_norm": 1.53125, "learning_rate": 0.00023576782942299424, "loss": 4.8992, "mean_token_accuracy": 0.219418565928936, "num_tokens": 124669875.0, "step": 71875 }, { "entropy": 5.969080829620362, "epoch": 5.592491733125851, "grad_norm": 1.546875, "learning_rate": 0.0002357405387066886, "loss": 4.9803, "mean_token_accuracy": 0.21397658586502075, "num_tokens": 124678676.0, "step": 71880 }, { "entropy": 6.0098330020904545, "epoch": 5.592880762497568, "grad_norm": 1.578125, "learning_rate": 0.0002357132485860829, "loss": 5.0184, "mean_token_accuracy": 0.21298391968011857, "num_tokens": 124687508.0, "step": 71885 }, { "entropy": 5.931096696853638, "epoch": 5.593269791869286, "grad_norm": 1.40625, "learning_rate": 0.00023568595906159107, "loss": 4.8973, "mean_token_accuracy": 0.22850116789340974, "num_tokens": 124696080.0, "step": 71890 }, { "entropy": 5.962214469909668, "epoch": 5.593658821241004, "grad_norm": 1.578125, "learning_rate": 0.00023565867013362725, "loss": 5.0052, "mean_token_accuracy": 0.21833460181951522, "num_tokens": 124704294.0, "step": 71895 }, { "entropy": 6.009474229812622, "epoch": 5.594047850612721, "grad_norm": 1.390625, "learning_rate": 0.00023563138180260552, "loss": 4.9997, "mean_token_accuracy": 0.2181362807750702, "num_tokens": 124712893.0, "step": 71900 }, { "entropy": 5.946059608459473, "epoch": 5.594436879984439, "grad_norm": 1.5078125, "learning_rate": 0.00023560409406893986, "loss": 4.8804, "mean_token_accuracy": 0.2253958761692047, "num_tokens": 124720697.0, "step": 71905 }, { "entropy": 5.936862373352051, "epoch": 5.594825909356157, "grad_norm": 1.609375, "learning_rate": 0.00023557680693304435, "loss": 4.933, "mean_token_accuracy": 0.22109376937150954, "num_tokens": 124729183.0, "step": 71910 }, { "entropy": 5.989626693725586, "epoch": 5.595214938727874, "grad_norm": 1.5859375, "learning_rate": 0.00023554952039533307, "loss": 4.9741, "mean_token_accuracy": 0.22106578201055527, "num_tokens": 124737995.0, "step": 71915 }, { "entropy": 5.905414772033692, "epoch": 5.595603968099591, "grad_norm": 1.453125, "learning_rate": 0.00023552223445622006, "loss": 4.8322, "mean_token_accuracy": 0.23181974291801452, "num_tokens": 124747090.0, "step": 71920 }, { "entropy": 5.972628164291382, "epoch": 5.595992997471309, "grad_norm": 1.5078125, "learning_rate": 0.00023549494911611924, "loss": 4.9543, "mean_token_accuracy": 0.212968909740448, "num_tokens": 124755330.0, "step": 71925 }, { "entropy": 5.927337980270385, "epoch": 5.596382026843027, "grad_norm": 1.4375, "learning_rate": 0.00023546766437544477, "loss": 4.8983, "mean_token_accuracy": 0.21769261807203294, "num_tokens": 124764480.0, "step": 71930 }, { "entropy": 6.003054809570313, "epoch": 5.596771056214744, "grad_norm": 1.546875, "learning_rate": 0.00023544038023461057, "loss": 4.9413, "mean_token_accuracy": 0.21740732043981553, "num_tokens": 124772843.0, "step": 71935 }, { "entropy": 5.928217649459839, "epoch": 5.597160085586462, "grad_norm": 1.46875, "learning_rate": 0.0002354130966940306, "loss": 4.8486, "mean_token_accuracy": 0.22657188922166824, "num_tokens": 124781379.0, "step": 71940 }, { "entropy": 6.013958263397217, "epoch": 5.597549114958179, "grad_norm": 1.421875, "learning_rate": 0.00023538581375411876, "loss": 5.0525, "mean_token_accuracy": 0.2110696777701378, "num_tokens": 124790688.0, "step": 71945 }, { "entropy": 6.013502168655395, "epoch": 5.597938144329897, "grad_norm": 1.3984375, "learning_rate": 0.00023535853141528923, "loss": 4.9704, "mean_token_accuracy": 0.22131878584623338, "num_tokens": 124799349.0, "step": 71950 }, { "entropy": 5.947861576080323, "epoch": 5.598327173701614, "grad_norm": 1.71875, "learning_rate": 0.00023533124967795594, "loss": 4.8718, "mean_token_accuracy": 0.2199745923280716, "num_tokens": 124807585.0, "step": 71955 }, { "entropy": 5.990926361083984, "epoch": 5.598716203073332, "grad_norm": 1.5546875, "learning_rate": 0.00023530396854253276, "loss": 5.0191, "mean_token_accuracy": 0.22077550739049911, "num_tokens": 124815849.0, "step": 71960 }, { "entropy": 6.03556809425354, "epoch": 5.59910523244505, "grad_norm": 1.53125, "learning_rate": 0.00023527668800943374, "loss": 5.0182, "mean_token_accuracy": 0.21271554082632066, "num_tokens": 124824312.0, "step": 71965 }, { "entropy": 6.039052820205688, "epoch": 5.599494261816767, "grad_norm": 1.4921875, "learning_rate": 0.0002352494080790727, "loss": 5.0218, "mean_token_accuracy": 0.21654243022203445, "num_tokens": 124832821.0, "step": 71970 }, { "entropy": 5.958756971359253, "epoch": 5.599883291188485, "grad_norm": 1.4140625, "learning_rate": 0.0002352221287518636, "loss": 4.9511, "mean_token_accuracy": 0.21951511949300767, "num_tokens": 124841726.0, "step": 71975 }, { "entropy": 5.94097409248352, "epoch": 5.600272320560203, "grad_norm": 1.3984375, "learning_rate": 0.00023519485002822038, "loss": 4.8688, "mean_token_accuracy": 0.22075520306825638, "num_tokens": 124851053.0, "step": 71980 }, { "entropy": 5.993810939788818, "epoch": 5.6006613499319196, "grad_norm": 1.546875, "learning_rate": 0.00023516757190855705, "loss": 4.9346, "mean_token_accuracy": 0.21474522054195405, "num_tokens": 124859657.0, "step": 71985 }, { "entropy": 5.99341311454773, "epoch": 5.601050379303637, "grad_norm": 1.484375, "learning_rate": 0.00023514029439328734, "loss": 4.9951, "mean_token_accuracy": 0.21699948906898497, "num_tokens": 124868938.0, "step": 71990 }, { "entropy": 6.011152696609497, "epoch": 5.601439408675355, "grad_norm": 1.4296875, "learning_rate": 0.0002351130174828252, "loss": 4.9851, "mean_token_accuracy": 0.2157683938741684, "num_tokens": 124877104.0, "step": 71995 }, { "entropy": 6.0121537208557125, "epoch": 5.601828438047073, "grad_norm": 1.53125, "learning_rate": 0.00023508574117758453, "loss": 4.9603, "mean_token_accuracy": 0.2224699079990387, "num_tokens": 124885693.0, "step": 72000 }, { "epoch": 5.601828438047073, "eval_entropy": 5.676884120651113, "eval_loss": 5.04976749420166, "eval_mean_token_accuracy": 0.22283494280609978, "eval_num_tokens": 124885693.0, "eval_runtime": 21.8114, "eval_samples_per_second": 1905.335, "eval_steps_per_second": 238.178, "step": 72000 }, { "entropy": 5.932283544540406, "epoch": 5.60221746741879, "grad_norm": 1.546875, "learning_rate": 0.00023505846547797928, "loss": 5.0017, "mean_token_accuracy": 0.2147320106625557, "num_tokens": 124894162.0, "step": 72005 }, { "entropy": 5.9542478084564205, "epoch": 5.602606496790508, "grad_norm": 1.4453125, "learning_rate": 0.00023503119038442312, "loss": 4.8871, "mean_token_accuracy": 0.22071647942066192, "num_tokens": 124903603.0, "step": 72010 }, { "entropy": 5.936869144439697, "epoch": 5.602995526162225, "grad_norm": 1.46875, "learning_rate": 0.0002350039158973301, "loss": 4.8465, "mean_token_accuracy": 0.23021106272935868, "num_tokens": 124912418.0, "step": 72015 }, { "entropy": 6.0223236083984375, "epoch": 5.6033845555339425, "grad_norm": 1.6953125, "learning_rate": 0.000234976642017114, "loss": 5.0263, "mean_token_accuracy": 0.21576027423143387, "num_tokens": 124920539.0, "step": 72020 }, { "entropy": 5.9755617618560795, "epoch": 5.60377358490566, "grad_norm": 1.578125, "learning_rate": 0.00023494936874418864, "loss": 4.9874, "mean_token_accuracy": 0.2067431852221489, "num_tokens": 124928580.0, "step": 72025 }, { "entropy": 5.933668565750122, "epoch": 5.604162614277378, "grad_norm": 1.5234375, "learning_rate": 0.00023492209607896793, "loss": 4.855, "mean_token_accuracy": 0.22139349728822708, "num_tokens": 124937453.0, "step": 72030 }, { "entropy": 5.980785703659057, "epoch": 5.604551643649096, "grad_norm": 1.6796875, "learning_rate": 0.00023489482402186558, "loss": 4.9383, "mean_token_accuracy": 0.22610079646110534, "num_tokens": 124945543.0, "step": 72035 }, { "entropy": 5.99549708366394, "epoch": 5.604940673020813, "grad_norm": 1.59375, "learning_rate": 0.0002348675525732954, "loss": 4.9984, "mean_token_accuracy": 0.21345447599887848, "num_tokens": 124954710.0, "step": 72040 }, { "entropy": 6.005642890930176, "epoch": 5.605329702392531, "grad_norm": 1.546875, "learning_rate": 0.00023484028173367127, "loss": 4.9299, "mean_token_accuracy": 0.22087893038988113, "num_tokens": 124963295.0, "step": 72045 }, { "entropy": 6.059423494338989, "epoch": 5.605718731764248, "grad_norm": 1.5, "learning_rate": 0.000234813011503407, "loss": 5.1092, "mean_token_accuracy": 0.20318211019039153, "num_tokens": 124972117.0, "step": 72050 }, { "entropy": 6.029190158843994, "epoch": 5.6061077611359655, "grad_norm": 1.609375, "learning_rate": 0.00023478574188291623, "loss": 5.0191, "mean_token_accuracy": 0.21411577612161636, "num_tokens": 124980802.0, "step": 72055 }, { "entropy": 6.020864057540893, "epoch": 5.606496790507683, "grad_norm": 1.5234375, "learning_rate": 0.00023475847287261282, "loss": 4.9441, "mean_token_accuracy": 0.22262782752513885, "num_tokens": 124989997.0, "step": 72060 }, { "entropy": 6.043002986907959, "epoch": 5.606885819879401, "grad_norm": 1.453125, "learning_rate": 0.00023473120447291057, "loss": 4.9472, "mean_token_accuracy": 0.21670212596654892, "num_tokens": 124998661.0, "step": 72065 }, { "entropy": 5.984840059280396, "epoch": 5.607274849251119, "grad_norm": 1.4375, "learning_rate": 0.0002347039366842232, "loss": 4.9379, "mean_token_accuracy": 0.2203179657459259, "num_tokens": 125007265.0, "step": 72070 }, { "entropy": 5.982944297790527, "epoch": 5.607663878622836, "grad_norm": 1.5234375, "learning_rate": 0.00023467666950696442, "loss": 4.9688, "mean_token_accuracy": 0.21401740312576295, "num_tokens": 125017061.0, "step": 72075 }, { "entropy": 5.994307327270508, "epoch": 5.608052907994553, "grad_norm": 1.5703125, "learning_rate": 0.00023464940294154796, "loss": 4.9964, "mean_token_accuracy": 0.21360096484422683, "num_tokens": 125025773.0, "step": 72080 }, { "entropy": 5.941303491592407, "epoch": 5.608441937366271, "grad_norm": 1.46875, "learning_rate": 0.00023462213698838762, "loss": 4.8405, "mean_token_accuracy": 0.22683088779449462, "num_tokens": 125035399.0, "step": 72085 }, { "entropy": 6.026165580749511, "epoch": 5.6088309667379885, "grad_norm": 1.5390625, "learning_rate": 0.00023459487164789717, "loss": 4.9237, "mean_token_accuracy": 0.22086972147226333, "num_tokens": 125043924.0, "step": 72090 }, { "entropy": 6.050693798065185, "epoch": 5.609219996109706, "grad_norm": 1.5, "learning_rate": 0.0002345676069204901, "loss": 5.0198, "mean_token_accuracy": 0.21340699642896652, "num_tokens": 125052277.0, "step": 72095 }, { "entropy": 6.020176649093628, "epoch": 5.609609025481424, "grad_norm": 1.4609375, "learning_rate": 0.00023454034280658036, "loss": 5.0035, "mean_token_accuracy": 0.218339903652668, "num_tokens": 125061395.0, "step": 72100 }, { "entropy": 5.959775829315186, "epoch": 5.609998054853142, "grad_norm": 1.609375, "learning_rate": 0.00023451307930658145, "loss": 4.9056, "mean_token_accuracy": 0.22010305523872375, "num_tokens": 125070063.0, "step": 72105 }, { "entropy": 5.924965524673462, "epoch": 5.610387084224859, "grad_norm": 1.5546875, "learning_rate": 0.00023448581642090716, "loss": 4.8369, "mean_token_accuracy": 0.2277142435312271, "num_tokens": 125078340.0, "step": 72110 }, { "entropy": 5.953242015838623, "epoch": 5.610776113596577, "grad_norm": 1.5625, "learning_rate": 0.00023445855414997108, "loss": 4.9541, "mean_token_accuracy": 0.22071052938699723, "num_tokens": 125087253.0, "step": 72115 }, { "entropy": 5.965456199645996, "epoch": 5.611165142968294, "grad_norm": 1.5859375, "learning_rate": 0.00023443129249418694, "loss": 4.9371, "mean_token_accuracy": 0.21766656041145324, "num_tokens": 125096351.0, "step": 72120 }, { "entropy": 6.015374088287354, "epoch": 5.6115541723400115, "grad_norm": 1.515625, "learning_rate": 0.00023440403145396838, "loss": 5.0012, "mean_token_accuracy": 0.21136986762285231, "num_tokens": 125104573.0, "step": 72125 }, { "entropy": 5.940572023391724, "epoch": 5.611943201711729, "grad_norm": 1.421875, "learning_rate": 0.00023437677102972903, "loss": 4.914, "mean_token_accuracy": 0.22316266149282454, "num_tokens": 125112609.0, "step": 72130 }, { "entropy": 5.943961429595947, "epoch": 5.612332231083447, "grad_norm": 1.5078125, "learning_rate": 0.00023434951122188247, "loss": 4.9341, "mean_token_accuracy": 0.22291814535856247, "num_tokens": 125121452.0, "step": 72135 }, { "entropy": 5.958939123153686, "epoch": 5.612721260455165, "grad_norm": 1.59375, "learning_rate": 0.0002343222520308423, "loss": 4.9524, "mean_token_accuracy": 0.21974676102399826, "num_tokens": 125129541.0, "step": 72140 }, { "entropy": 5.9088176727294925, "epoch": 5.613110289826882, "grad_norm": 1.515625, "learning_rate": 0.0002342949934570223, "loss": 4.9001, "mean_token_accuracy": 0.21167769581079482, "num_tokens": 125137604.0, "step": 72145 }, { "entropy": 5.9892223358154295, "epoch": 5.613499319198599, "grad_norm": 1.40625, "learning_rate": 0.00023426773550083602, "loss": 4.969, "mean_token_accuracy": 0.21296900361776352, "num_tokens": 125146863.0, "step": 72150 }, { "entropy": 6.025477409362793, "epoch": 5.613888348570317, "grad_norm": 1.546875, "learning_rate": 0.00023424047816269705, "loss": 4.9954, "mean_token_accuracy": 0.21871867626905442, "num_tokens": 125156126.0, "step": 72155 }, { "entropy": 6.0128502368927, "epoch": 5.6142773779420345, "grad_norm": 1.3984375, "learning_rate": 0.00023421322144301889, "loss": 5.0132, "mean_token_accuracy": 0.21121589243412017, "num_tokens": 125165583.0, "step": 72160 }, { "entropy": 5.939020347595215, "epoch": 5.614666407313752, "grad_norm": 1.5625, "learning_rate": 0.0002341859653422152, "loss": 4.8423, "mean_token_accuracy": 0.22626532912254332, "num_tokens": 125174346.0, "step": 72165 }, { "entropy": 5.9511617660522464, "epoch": 5.61505543668547, "grad_norm": 1.53125, "learning_rate": 0.00023415870986069948, "loss": 4.8835, "mean_token_accuracy": 0.21967267990112305, "num_tokens": 125182978.0, "step": 72170 }, { "entropy": 5.986528968811035, "epoch": 5.615444466057188, "grad_norm": 1.546875, "learning_rate": 0.00023413145499888533, "loss": 4.9858, "mean_token_accuracy": 0.21494191735982895, "num_tokens": 125191318.0, "step": 72175 }, { "entropy": 6.000048875808716, "epoch": 5.615833495428905, "grad_norm": 1.515625, "learning_rate": 0.00023410420075718635, "loss": 4.9383, "mean_token_accuracy": 0.21492552608251572, "num_tokens": 125199863.0, "step": 72180 }, { "entropy": 5.932898998260498, "epoch": 5.616222524800622, "grad_norm": 1.40625, "learning_rate": 0.00023407694713601602, "loss": 4.9544, "mean_token_accuracy": 0.21613789200782776, "num_tokens": 125209035.0, "step": 72185 }, { "entropy": 5.957965230941772, "epoch": 5.61661155417234, "grad_norm": 1.46875, "learning_rate": 0.00023404969413578787, "loss": 4.9726, "mean_token_accuracy": 0.22133685648441315, "num_tokens": 125217772.0, "step": 72190 }, { "entropy": 6.0245826721191404, "epoch": 5.6170005835440575, "grad_norm": 1.578125, "learning_rate": 0.0002340224417569154, "loss": 4.897, "mean_token_accuracy": 0.21534340232610702, "num_tokens": 125226420.0, "step": 72195 }, { "entropy": 5.944337272644043, "epoch": 5.617389612915775, "grad_norm": 1.5625, "learning_rate": 0.0002339951899998122, "loss": 4.9375, "mean_token_accuracy": 0.21636035293340683, "num_tokens": 125234437.0, "step": 72200 }, { "entropy": 5.950929164886475, "epoch": 5.617778642287493, "grad_norm": 1.59375, "learning_rate": 0.00023396793886489177, "loss": 4.9645, "mean_token_accuracy": 0.22458522766828537, "num_tokens": 125242672.0, "step": 72205 }, { "entropy": 5.915388059616089, "epoch": 5.618167671659211, "grad_norm": 1.515625, "learning_rate": 0.00023394068835256738, "loss": 4.9252, "mean_token_accuracy": 0.22042891681194304, "num_tokens": 125251407.0, "step": 72210 }, { "entropy": 5.949826669692993, "epoch": 5.618556701030927, "grad_norm": 1.5546875, "learning_rate": 0.00023391343846325286, "loss": 5.0074, "mean_token_accuracy": 0.2167529821395874, "num_tokens": 125259329.0, "step": 72215 }, { "entropy": 5.9700507640838625, "epoch": 5.618945730402645, "grad_norm": 1.609375, "learning_rate": 0.00023388618919736143, "loss": 4.9329, "mean_token_accuracy": 0.21182293444871902, "num_tokens": 125268499.0, "step": 72220 }, { "entropy": 6.024780416488648, "epoch": 5.619334759774363, "grad_norm": 1.5703125, "learning_rate": 0.00023385894055530666, "loss": 4.9634, "mean_token_accuracy": 0.2239742621779442, "num_tokens": 125276574.0, "step": 72225 }, { "entropy": 6.007212972640991, "epoch": 5.6197237891460805, "grad_norm": 1.453125, "learning_rate": 0.00023383169253750203, "loss": 4.9275, "mean_token_accuracy": 0.224239319562912, "num_tokens": 125286000.0, "step": 72230 }, { "entropy": 5.883499193191528, "epoch": 5.620112818517798, "grad_norm": 1.4765625, "learning_rate": 0.00023380444514436093, "loss": 4.8676, "mean_token_accuracy": 0.22815196365118026, "num_tokens": 125294839.0, "step": 72235 }, { "entropy": 5.887261772155762, "epoch": 5.620501847889516, "grad_norm": 1.484375, "learning_rate": 0.0002337771983762968, "loss": 4.8033, "mean_token_accuracy": 0.22126456201076508, "num_tokens": 125303657.0, "step": 72240 }, { "entropy": 5.93742823600769, "epoch": 5.620890877261234, "grad_norm": 1.625, "learning_rate": 0.00023374995223372308, "loss": 4.9091, "mean_token_accuracy": 0.22160035520792007, "num_tokens": 125312596.0, "step": 72245 }, { "entropy": 5.94787564277649, "epoch": 5.62127990663295, "grad_norm": 1.421875, "learning_rate": 0.00023372270671705313, "loss": 4.8995, "mean_token_accuracy": 0.22147901356220245, "num_tokens": 125321044.0, "step": 72250 }, { "entropy": 5.976075124740601, "epoch": 5.621668936004668, "grad_norm": 1.484375, "learning_rate": 0.00023369546182670044, "loss": 4.9461, "mean_token_accuracy": 0.21912810504436492, "num_tokens": 125329313.0, "step": 72255 }, { "entropy": 5.983640861511231, "epoch": 5.622057965376386, "grad_norm": 1.609375, "learning_rate": 0.00023366821756307837, "loss": 4.9329, "mean_token_accuracy": 0.21212354749441148, "num_tokens": 125337768.0, "step": 72260 }, { "entropy": 6.002986764907837, "epoch": 5.6224469947481035, "grad_norm": 1.578125, "learning_rate": 0.00023364097392660033, "loss": 4.9957, "mean_token_accuracy": 0.21368985027074813, "num_tokens": 125346007.0, "step": 72265 }, { "entropy": 5.964420938491822, "epoch": 5.622836024119821, "grad_norm": 1.5234375, "learning_rate": 0.00023361373091767963, "loss": 4.9276, "mean_token_accuracy": 0.21605204790830612, "num_tokens": 125353737.0, "step": 72270 }, { "entropy": 6.041881513595581, "epoch": 5.623225053491539, "grad_norm": 1.5859375, "learning_rate": 0.0002335864885367297, "loss": 4.9757, "mean_token_accuracy": 0.2135939195752144, "num_tokens": 125361963.0, "step": 72275 }, { "entropy": 5.969851303100586, "epoch": 5.623614082863256, "grad_norm": 1.421875, "learning_rate": 0.0002335592467841639, "loss": 4.9642, "mean_token_accuracy": 0.22105509638786316, "num_tokens": 125371572.0, "step": 72280 }, { "entropy": 5.909169054031372, "epoch": 5.624003112234973, "grad_norm": 1.625, "learning_rate": 0.00023353200566039557, "loss": 4.8335, "mean_token_accuracy": 0.237398761510849, "num_tokens": 125380350.0, "step": 72285 }, { "entropy": 5.98205451965332, "epoch": 5.624392141606691, "grad_norm": 1.5, "learning_rate": 0.00023350476516583807, "loss": 4.963, "mean_token_accuracy": 0.21581938862800598, "num_tokens": 125389107.0, "step": 72290 }, { "entropy": 5.9235419750213625, "epoch": 5.624781170978409, "grad_norm": 1.5625, "learning_rate": 0.00023347752530090472, "loss": 4.811, "mean_token_accuracy": 0.2233251675963402, "num_tokens": 125397723.0, "step": 72295 }, { "entropy": 5.907048559188842, "epoch": 5.6251702003501265, "grad_norm": 1.4453125, "learning_rate": 0.0002334502860660088, "loss": 4.8641, "mean_token_accuracy": 0.2215641349554062, "num_tokens": 125406450.0, "step": 72300 }, { "entropy": 5.897864484786988, "epoch": 5.625559229721844, "grad_norm": 1.46875, "learning_rate": 0.00023342304746156367, "loss": 4.8943, "mean_token_accuracy": 0.22244266867637635, "num_tokens": 125415592.0, "step": 72305 }, { "entropy": 6.000604724884033, "epoch": 5.625948259093562, "grad_norm": 1.5234375, "learning_rate": 0.00023339580948798262, "loss": 4.9124, "mean_token_accuracy": 0.2217046409845352, "num_tokens": 125424048.0, "step": 72310 }, { "entropy": 5.99835696220398, "epoch": 5.62633728846528, "grad_norm": 1.5390625, "learning_rate": 0.00023336857214567897, "loss": 4.9449, "mean_token_accuracy": 0.22609375715255736, "num_tokens": 125432402.0, "step": 72315 }, { "entropy": 6.005631923675537, "epoch": 5.626726317836996, "grad_norm": 1.4921875, "learning_rate": 0.00023334133543506598, "loss": 5.0075, "mean_token_accuracy": 0.21291139125823974, "num_tokens": 125440744.0, "step": 72320 }, { "entropy": 5.997346878051758, "epoch": 5.627115347208714, "grad_norm": 1.4921875, "learning_rate": 0.0002333140993565569, "loss": 5.0208, "mean_token_accuracy": 0.2097142145037651, "num_tokens": 125449073.0, "step": 72325 }, { "entropy": 5.927989721298218, "epoch": 5.627504376580432, "grad_norm": 1.5546875, "learning_rate": 0.00023328686391056497, "loss": 4.8193, "mean_token_accuracy": 0.2400944396853447, "num_tokens": 125457363.0, "step": 72330 }, { "entropy": 5.960924243927002, "epoch": 5.6278934059521495, "grad_norm": 1.578125, "learning_rate": 0.00023325962909750349, "loss": 4.8213, "mean_token_accuracy": 0.23475531190633775, "num_tokens": 125465823.0, "step": 72335 }, { "entropy": 5.9974676132202145, "epoch": 5.628282435323867, "grad_norm": 1.5078125, "learning_rate": 0.00023323239491778564, "loss": 4.9344, "mean_token_accuracy": 0.2222289815545082, "num_tokens": 125474567.0, "step": 72340 }, { "entropy": 5.929247760772705, "epoch": 5.628671464695585, "grad_norm": 1.4609375, "learning_rate": 0.00023320516137182484, "loss": 5.029, "mean_token_accuracy": 0.21580374538898467, "num_tokens": 125482761.0, "step": 72345 }, { "entropy": 5.951905584335327, "epoch": 5.629060494067302, "grad_norm": 1.53125, "learning_rate": 0.00023317792846003416, "loss": 4.9166, "mean_token_accuracy": 0.2155584678053856, "num_tokens": 125491443.0, "step": 72350 }, { "entropy": 5.956709146499634, "epoch": 5.629449523439019, "grad_norm": 1.4921875, "learning_rate": 0.00023315069618282686, "loss": 4.8988, "mean_token_accuracy": 0.22171830534934997, "num_tokens": 125500038.0, "step": 72355 }, { "entropy": 5.993507146835327, "epoch": 5.629838552810737, "grad_norm": 1.484375, "learning_rate": 0.0002331234645406161, "loss": 4.9582, "mean_token_accuracy": 0.22184862196445465, "num_tokens": 125508310.0, "step": 72360 }, { "entropy": 5.937461948394775, "epoch": 5.630227582182455, "grad_norm": 1.4765625, "learning_rate": 0.00023309623353381516, "loss": 4.8975, "mean_token_accuracy": 0.2235136076807976, "num_tokens": 125516717.0, "step": 72365 }, { "entropy": 5.938158464431763, "epoch": 5.6306166115541725, "grad_norm": 1.4296875, "learning_rate": 0.00023306900316283713, "loss": 4.9048, "mean_token_accuracy": 0.22072543501853942, "num_tokens": 125525441.0, "step": 72370 }, { "entropy": 5.875360059738159, "epoch": 5.63100564092589, "grad_norm": 1.453125, "learning_rate": 0.0002330417734280953, "loss": 4.8202, "mean_token_accuracy": 0.22180796563625335, "num_tokens": 125533436.0, "step": 72375 }, { "entropy": 6.038035583496094, "epoch": 5.631394670297608, "grad_norm": 1.5, "learning_rate": 0.00023301454433000268, "loss": 4.9833, "mean_token_accuracy": 0.20745279639959335, "num_tokens": 125541876.0, "step": 72380 }, { "entropy": 5.940767049789429, "epoch": 5.631783699669325, "grad_norm": 1.546875, "learning_rate": 0.0002329873158689726, "loss": 4.8851, "mean_token_accuracy": 0.2292938143014908, "num_tokens": 125551027.0, "step": 72385 }, { "entropy": 5.982883405685425, "epoch": 5.632172729041042, "grad_norm": 1.3828125, "learning_rate": 0.00023296008804541812, "loss": 4.9684, "mean_token_accuracy": 0.21341394931077956, "num_tokens": 125560282.0, "step": 72390 }, { "entropy": 6.025834751129151, "epoch": 5.63256175841276, "grad_norm": 1.59375, "learning_rate": 0.0002329328608597524, "loss": 4.9363, "mean_token_accuracy": 0.2222495898604393, "num_tokens": 125569999.0, "step": 72395 }, { "entropy": 5.921707725524902, "epoch": 5.632950787784478, "grad_norm": 1.5390625, "learning_rate": 0.00023290563431238852, "loss": 4.8257, "mean_token_accuracy": 0.22903242707252502, "num_tokens": 125578183.0, "step": 72400 }, { "entropy": 5.9493790626525875, "epoch": 5.6333398171561955, "grad_norm": 1.7109375, "learning_rate": 0.0002328784084037397, "loss": 4.9649, "mean_token_accuracy": 0.21857262700796126, "num_tokens": 125586303.0, "step": 72405 }, { "entropy": 5.926051616668701, "epoch": 5.633728846527913, "grad_norm": 1.6171875, "learning_rate": 0.00023285118313421887, "loss": 4.8858, "mean_token_accuracy": 0.22560517638921737, "num_tokens": 125594724.0, "step": 72410 }, { "entropy": 5.960558319091797, "epoch": 5.63411787589963, "grad_norm": 1.4921875, "learning_rate": 0.0002328239585042393, "loss": 4.9557, "mean_token_accuracy": 0.218736432492733, "num_tokens": 125602552.0, "step": 72415 }, { "entropy": 6.067883014678955, "epoch": 5.634506905271348, "grad_norm": 1.546875, "learning_rate": 0.00023279673451421406, "loss": 5.0724, "mean_token_accuracy": 0.21245322972536088, "num_tokens": 125611775.0, "step": 72420 }, { "entropy": 5.96911358833313, "epoch": 5.634895934643065, "grad_norm": 1.4453125, "learning_rate": 0.00023276951116455626, "loss": 5.0316, "mean_token_accuracy": 0.21345360577106476, "num_tokens": 125620629.0, "step": 72425 }, { "entropy": 5.927129125595092, "epoch": 5.635284964014783, "grad_norm": 1.484375, "learning_rate": 0.00023274228845567886, "loss": 4.8474, "mean_token_accuracy": 0.23167373538017272, "num_tokens": 125629749.0, "step": 72430 }, { "entropy": 5.925306797027588, "epoch": 5.635673993386501, "grad_norm": 1.453125, "learning_rate": 0.00023271506638799494, "loss": 4.9404, "mean_token_accuracy": 0.22155393064022064, "num_tokens": 125638752.0, "step": 72435 }, { "entropy": 5.947801303863526, "epoch": 5.6360630227582185, "grad_norm": 1.5546875, "learning_rate": 0.00023268784496191758, "loss": 4.9126, "mean_token_accuracy": 0.21734260618686677, "num_tokens": 125647128.0, "step": 72440 }, { "entropy": 6.037830591201782, "epoch": 5.636452052129936, "grad_norm": 1.421875, "learning_rate": 0.00023266062417785988, "loss": 4.9747, "mean_token_accuracy": 0.22290472388267518, "num_tokens": 125655448.0, "step": 72445 }, { "entropy": 5.978285503387451, "epoch": 5.636841081501654, "grad_norm": 1.5, "learning_rate": 0.00023263340403623477, "loss": 4.9955, "mean_token_accuracy": 0.2092864453792572, "num_tokens": 125664460.0, "step": 72450 }, { "entropy": 6.049075412750244, "epoch": 5.637230110873371, "grad_norm": 1.4296875, "learning_rate": 0.0002326061845374553, "loss": 5.0416, "mean_token_accuracy": 0.2111099526286125, "num_tokens": 125674710.0, "step": 72455 }, { "entropy": 6.004948091506958, "epoch": 5.637619140245088, "grad_norm": 1.53125, "learning_rate": 0.00023257896568193459, "loss": 4.8775, "mean_token_accuracy": 0.22306284308433533, "num_tokens": 125683097.0, "step": 72460 }, { "entropy": 5.8943016052246096, "epoch": 5.638008169616806, "grad_norm": 1.46875, "learning_rate": 0.0002325517474700855, "loss": 4.8825, "mean_token_accuracy": 0.2329620748758316, "num_tokens": 125692026.0, "step": 72465 }, { "entropy": 5.972401428222656, "epoch": 5.638397198988524, "grad_norm": 1.5625, "learning_rate": 0.0002325245299023211, "loss": 4.9676, "mean_token_accuracy": 0.22386868596076964, "num_tokens": 125701338.0, "step": 72470 }, { "entropy": 5.93399567604065, "epoch": 5.6387862283602415, "grad_norm": 1.453125, "learning_rate": 0.00023249731297905423, "loss": 4.9474, "mean_token_accuracy": 0.22112037986516953, "num_tokens": 125710008.0, "step": 72475 }, { "entropy": 6.0598766803741455, "epoch": 5.639175257731958, "grad_norm": 1.375, "learning_rate": 0.00023247009670069812, "loss": 5.01, "mean_token_accuracy": 0.21524305790662765, "num_tokens": 125719349.0, "step": 72480 }, { "entropy": 5.902631235122681, "epoch": 5.639564287103676, "grad_norm": 1.5703125, "learning_rate": 0.0002324428810676656, "loss": 4.7537, "mean_token_accuracy": 0.2408243179321289, "num_tokens": 125728266.0, "step": 72485 }, { "entropy": 5.9141027450561525, "epoch": 5.639953316475394, "grad_norm": 1.484375, "learning_rate": 0.00023241566608036957, "loss": 5.0054, "mean_token_accuracy": 0.2137009918689728, "num_tokens": 125737676.0, "step": 72490 }, { "entropy": 5.900844573974609, "epoch": 5.640342345847111, "grad_norm": 1.53125, "learning_rate": 0.00023238845173922308, "loss": 4.8904, "mean_token_accuracy": 0.22120697796344757, "num_tokens": 125745830.0, "step": 72495 }, { "entropy": 5.9556175708770756, "epoch": 5.640731375218829, "grad_norm": 1.5625, "learning_rate": 0.00023236123804463898, "loss": 4.8854, "mean_token_accuracy": 0.22525913119316102, "num_tokens": 125755006.0, "step": 72500 }, { "entropy": 5.88781418800354, "epoch": 5.641120404590547, "grad_norm": 1.53125, "learning_rate": 0.00023233402499703027, "loss": 4.8525, "mean_token_accuracy": 0.2285912185907364, "num_tokens": 125763887.0, "step": 72505 }, { "entropy": 5.96304178237915, "epoch": 5.6415094339622645, "grad_norm": 1.53125, "learning_rate": 0.0002323068125968098, "loss": 4.9318, "mean_token_accuracy": 0.22406024038791655, "num_tokens": 125772869.0, "step": 72510 }, { "entropy": 5.971529769897461, "epoch": 5.641898463333982, "grad_norm": 1.5234375, "learning_rate": 0.0002322796008443905, "loss": 4.9351, "mean_token_accuracy": 0.22701532542705535, "num_tokens": 125781326.0, "step": 72515 }, { "entropy": 6.044512987136841, "epoch": 5.642287492705699, "grad_norm": 1.5546875, "learning_rate": 0.0002322523897401852, "loss": 4.9878, "mean_token_accuracy": 0.21242875307798387, "num_tokens": 125790791.0, "step": 72520 }, { "entropy": 6.0123247623443605, "epoch": 5.642676522077417, "grad_norm": 1.5703125, "learning_rate": 0.00023222517928460685, "loss": 5.0455, "mean_token_accuracy": 0.21348005086183547, "num_tokens": 125799549.0, "step": 72525 }, { "entropy": 5.960880851745605, "epoch": 5.643065551449134, "grad_norm": 1.4921875, "learning_rate": 0.00023219796947806842, "loss": 4.9486, "mean_token_accuracy": 0.22254555076360702, "num_tokens": 125808779.0, "step": 72530 }, { "entropy": 5.952186155319214, "epoch": 5.643454580820852, "grad_norm": 1.5703125, "learning_rate": 0.00023217076032098255, "loss": 4.8903, "mean_token_accuracy": 0.2272851973772049, "num_tokens": 125817738.0, "step": 72535 }, { "entropy": 5.950487899780273, "epoch": 5.64384361019257, "grad_norm": 1.453125, "learning_rate": 0.00023214355181376222, "loss": 4.9596, "mean_token_accuracy": 0.21804638653993608, "num_tokens": 125826300.0, "step": 72540 }, { "entropy": 5.899617385864258, "epoch": 5.6442326395642874, "grad_norm": 1.484375, "learning_rate": 0.00023211634395682042, "loss": 4.8724, "mean_token_accuracy": 0.22489833384752272, "num_tokens": 125835499.0, "step": 72545 }, { "entropy": 5.960859775543213, "epoch": 5.644621668936004, "grad_norm": 1.5859375, "learning_rate": 0.00023208913675056976, "loss": 4.8934, "mean_token_accuracy": 0.2238628402352333, "num_tokens": 125844313.0, "step": 72550 }, { "entropy": 5.87387981414795, "epoch": 5.645010698307722, "grad_norm": 1.515625, "learning_rate": 0.0002320619301954231, "loss": 4.8366, "mean_token_accuracy": 0.22894085049629212, "num_tokens": 125852741.0, "step": 72555 }, { "entropy": 5.941502475738526, "epoch": 5.64539972767944, "grad_norm": 1.6328125, "learning_rate": 0.0002320347242917934, "loss": 4.942, "mean_token_accuracy": 0.22158868312835694, "num_tokens": 125860567.0, "step": 72560 }, { "entropy": 5.908563184738159, "epoch": 5.645788757051157, "grad_norm": 1.46875, "learning_rate": 0.00023200751904009332, "loss": 4.9319, "mean_token_accuracy": 0.22615647315979004, "num_tokens": 125869149.0, "step": 72565 }, { "entropy": 5.923479175567627, "epoch": 5.646177786422875, "grad_norm": 1.46875, "learning_rate": 0.00023198031444073575, "loss": 4.8987, "mean_token_accuracy": 0.22287586629390715, "num_tokens": 125877795.0, "step": 72570 }, { "entropy": 5.9272908687591555, "epoch": 5.646566815794593, "grad_norm": 1.546875, "learning_rate": 0.00023195311049413337, "loss": 4.8757, "mean_token_accuracy": 0.22326212972402573, "num_tokens": 125886399.0, "step": 72575 }, { "entropy": 5.916382455825806, "epoch": 5.64695584516631, "grad_norm": 1.5, "learning_rate": 0.00023192590720069907, "loss": 4.8778, "mean_token_accuracy": 0.22502481192350388, "num_tokens": 125894797.0, "step": 72580 }, { "entropy": 5.935520982742309, "epoch": 5.647344874538027, "grad_norm": 1.5390625, "learning_rate": 0.00023189870456084561, "loss": 4.9265, "mean_token_accuracy": 0.22271972596645356, "num_tokens": 125903132.0, "step": 72585 }, { "entropy": 5.922742176055908, "epoch": 5.647733903909745, "grad_norm": 1.5078125, "learning_rate": 0.00023187150257498567, "loss": 4.985, "mean_token_accuracy": 0.21649032086133957, "num_tokens": 125911987.0, "step": 72590 }, { "entropy": 5.965186357498169, "epoch": 5.648122933281463, "grad_norm": 1.5546875, "learning_rate": 0.000231844301243532, "loss": 4.887, "mean_token_accuracy": 0.2257716402411461, "num_tokens": 125920166.0, "step": 72595 }, { "entropy": 5.9584949016571045, "epoch": 5.64851196265318, "grad_norm": 1.546875, "learning_rate": 0.0002318171005668974, "loss": 4.9463, "mean_token_accuracy": 0.2202530711889267, "num_tokens": 125928563.0, "step": 72600 }, { "entropy": 5.969449615478515, "epoch": 5.648900992024898, "grad_norm": 1.5234375, "learning_rate": 0.00023178990054549447, "loss": 4.9451, "mean_token_accuracy": 0.2166808307170868, "num_tokens": 125937294.0, "step": 72605 }, { "entropy": 5.935456132888794, "epoch": 5.649290021396616, "grad_norm": 1.453125, "learning_rate": 0.00023176270117973607, "loss": 4.93, "mean_token_accuracy": 0.22122231423854827, "num_tokens": 125946278.0, "step": 72610 }, { "entropy": 5.888427734375, "epoch": 5.6496790507683325, "grad_norm": 1.40625, "learning_rate": 0.000231735502470035, "loss": 4.8221, "mean_token_accuracy": 0.23065802603960037, "num_tokens": 125954717.0, "step": 72615 }, { "entropy": 5.935413074493408, "epoch": 5.65006808014005, "grad_norm": 1.546875, "learning_rate": 0.00023170830441680368, "loss": 4.954, "mean_token_accuracy": 0.21861388981342317, "num_tokens": 125962738.0, "step": 72620 }, { "entropy": 5.919857692718506, "epoch": 5.650457109511768, "grad_norm": 1.515625, "learning_rate": 0.00023168110702045496, "loss": 4.9319, "mean_token_accuracy": 0.22469876259565352, "num_tokens": 125972048.0, "step": 72625 }, { "entropy": 6.009675979614258, "epoch": 5.650846138883486, "grad_norm": 1.6484375, "learning_rate": 0.00023165391028140154, "loss": 4.9535, "mean_token_accuracy": 0.22055282741785048, "num_tokens": 125980703.0, "step": 72630 }, { "entropy": 6.042292213439941, "epoch": 5.651235168255203, "grad_norm": 1.5859375, "learning_rate": 0.000231626714200056, "loss": 4.9546, "mean_token_accuracy": 0.21929629892110825, "num_tokens": 125989905.0, "step": 72635 }, { "entropy": 5.944596147537231, "epoch": 5.651624197626921, "grad_norm": 1.453125, "learning_rate": 0.00023159951877683099, "loss": 4.9037, "mean_token_accuracy": 0.22625365257263183, "num_tokens": 125997855.0, "step": 72640 }, { "entropy": 5.939704036712646, "epoch": 5.652013226998639, "grad_norm": 1.515625, "learning_rate": 0.0002315723240121393, "loss": 4.9185, "mean_token_accuracy": 0.21861237585544585, "num_tokens": 126007016.0, "step": 72645 }, { "entropy": 5.938398551940918, "epoch": 5.652402256370356, "grad_norm": 1.4921875, "learning_rate": 0.00023154512990639336, "loss": 4.9041, "mean_token_accuracy": 0.22398823648691177, "num_tokens": 126016885.0, "step": 72650 }, { "entropy": 5.961942434310913, "epoch": 5.652791285742073, "grad_norm": 1.515625, "learning_rate": 0.00023151793646000602, "loss": 4.8896, "mean_token_accuracy": 0.21971345841884612, "num_tokens": 126024863.0, "step": 72655 }, { "entropy": 5.967657279968262, "epoch": 5.653180315113791, "grad_norm": 1.5234375, "learning_rate": 0.00023149074367338974, "loss": 4.9571, "mean_token_accuracy": 0.2179378792643547, "num_tokens": 126032983.0, "step": 72660 }, { "entropy": 5.981151866912842, "epoch": 5.653569344485509, "grad_norm": 1.4453125, "learning_rate": 0.0002314635515469572, "loss": 5.0034, "mean_token_accuracy": 0.21470242291688918, "num_tokens": 126041744.0, "step": 72665 }, { "entropy": 5.948379707336426, "epoch": 5.653958373857226, "grad_norm": 1.515625, "learning_rate": 0.00023143636008112096, "loss": 4.8981, "mean_token_accuracy": 0.22322926819324493, "num_tokens": 126050150.0, "step": 72670 }, { "entropy": 5.986972379684448, "epoch": 5.654347403228944, "grad_norm": 1.671875, "learning_rate": 0.00023140916927629352, "loss": 4.9456, "mean_token_accuracy": 0.22065083235502242, "num_tokens": 126058194.0, "step": 72675 }, { "entropy": 5.9589134693145756, "epoch": 5.654736432600662, "grad_norm": 1.40625, "learning_rate": 0.0002313819791328876, "loss": 4.9368, "mean_token_accuracy": 0.2183288276195526, "num_tokens": 126066882.0, "step": 72680 }, { "entropy": 5.9557366371154785, "epoch": 5.6551254619723785, "grad_norm": 1.75, "learning_rate": 0.00023135478965131574, "loss": 4.9787, "mean_token_accuracy": 0.21369950473308563, "num_tokens": 126075511.0, "step": 72685 }, { "entropy": 5.930550146102905, "epoch": 5.655514491344096, "grad_norm": 1.5, "learning_rate": 0.0002313276008319905, "loss": 4.9099, "mean_token_accuracy": 0.219523061811924, "num_tokens": 126084111.0, "step": 72690 }, { "entropy": 5.97290940284729, "epoch": 5.655903520715814, "grad_norm": 1.4609375, "learning_rate": 0.00023130041267532443, "loss": 4.9495, "mean_token_accuracy": 0.21629708409309387, "num_tokens": 126093346.0, "step": 72695 }, { "entropy": 5.972196435928344, "epoch": 5.656292550087532, "grad_norm": 1.359375, "learning_rate": 0.00023127322518173, "loss": 4.9362, "mean_token_accuracy": 0.2242979884147644, "num_tokens": 126102644.0, "step": 72700 }, { "entropy": 5.9347411632537845, "epoch": 5.656681579459249, "grad_norm": 1.4765625, "learning_rate": 0.0002312460383516198, "loss": 4.9117, "mean_token_accuracy": 0.22051851451396942, "num_tokens": 126111054.0, "step": 72705 }, { "entropy": 5.99338002204895, "epoch": 5.657070608830967, "grad_norm": 1.5, "learning_rate": 0.00023121885218540627, "loss": 4.9385, "mean_token_accuracy": 0.2115892291069031, "num_tokens": 126120108.0, "step": 72710 }, { "entropy": 5.907380771636963, "epoch": 5.657459638202685, "grad_norm": 1.484375, "learning_rate": 0.00023119166668350205, "loss": 4.8632, "mean_token_accuracy": 0.22198890894651413, "num_tokens": 126128731.0, "step": 72715 }, { "entropy": 5.960259294509887, "epoch": 5.6578486675744015, "grad_norm": 1.5390625, "learning_rate": 0.0002311644818463195, "loss": 4.9555, "mean_token_accuracy": 0.21847422569990158, "num_tokens": 126137299.0, "step": 72720 }, { "entropy": 5.917295837402344, "epoch": 5.658237696946119, "grad_norm": 1.5859375, "learning_rate": 0.0002311372976742712, "loss": 4.954, "mean_token_accuracy": 0.2151455119252205, "num_tokens": 126145858.0, "step": 72725 }, { "entropy": 5.859869432449341, "epoch": 5.658626726317837, "grad_norm": 1.4375, "learning_rate": 0.0002311101141677696, "loss": 4.8715, "mean_token_accuracy": 0.2240202933549881, "num_tokens": 126154397.0, "step": 72730 }, { "entropy": 6.0130939960479735, "epoch": 5.659015755689555, "grad_norm": 1.6015625, "learning_rate": 0.00023108293132722714, "loss": 4.9873, "mean_token_accuracy": 0.21839783042669297, "num_tokens": 126163518.0, "step": 72735 }, { "entropy": 6.024412345886231, "epoch": 5.659404785061272, "grad_norm": 1.59375, "learning_rate": 0.00023105574915305627, "loss": 5.0041, "mean_token_accuracy": 0.21046695113182068, "num_tokens": 126171982.0, "step": 72740 }, { "entropy": 5.9236854076385494, "epoch": 5.65979381443299, "grad_norm": 1.7890625, "learning_rate": 0.0002310285676456695, "loss": 4.9198, "mean_token_accuracy": 0.2125382497906685, "num_tokens": 126181320.0, "step": 72745 }, { "entropy": 5.949506378173828, "epoch": 5.660182843804707, "grad_norm": 1.5390625, "learning_rate": 0.00023100138680547921, "loss": 4.9429, "mean_token_accuracy": 0.22496840059757234, "num_tokens": 126189949.0, "step": 72750 }, { "entropy": 5.9301587581634525, "epoch": 5.6605718731764245, "grad_norm": 1.640625, "learning_rate": 0.00023097420663289786, "loss": 4.8921, "mean_token_accuracy": 0.22438059747219086, "num_tokens": 126197555.0, "step": 72755 }, { "entropy": 5.95957350730896, "epoch": 5.660960902548142, "grad_norm": 1.640625, "learning_rate": 0.00023094702712833786, "loss": 4.9269, "mean_token_accuracy": 0.21903351694345474, "num_tokens": 126205853.0, "step": 72760 }, { "entropy": 5.935816240310669, "epoch": 5.66134993191986, "grad_norm": 1.421875, "learning_rate": 0.00023091984829221157, "loss": 4.9377, "mean_token_accuracy": 0.2224680468440056, "num_tokens": 126214622.0, "step": 72765 }, { "entropy": 5.962105083465576, "epoch": 5.661738961291578, "grad_norm": 1.515625, "learning_rate": 0.00023089267012493141, "loss": 4.9467, "mean_token_accuracy": 0.21980153024196625, "num_tokens": 126223014.0, "step": 72770 }, { "entropy": 5.9509642124176025, "epoch": 5.662127990663295, "grad_norm": 1.46875, "learning_rate": 0.00023086549262690993, "loss": 4.9499, "mean_token_accuracy": 0.21574712097644805, "num_tokens": 126231591.0, "step": 72775 }, { "entropy": 5.924649715423584, "epoch": 5.662517020035013, "grad_norm": 1.546875, "learning_rate": 0.00023083831579855918, "loss": 4.8804, "mean_token_accuracy": 0.2249688372015953, "num_tokens": 126239982.0, "step": 72780 }, { "entropy": 6.028954982757568, "epoch": 5.662906049406731, "grad_norm": 1.4296875, "learning_rate": 0.00023081113964029177, "loss": 5.0196, "mean_token_accuracy": 0.2145646870136261, "num_tokens": 126248451.0, "step": 72785 }, { "entropy": 5.912058925628662, "epoch": 5.6632950787784475, "grad_norm": 1.515625, "learning_rate": 0.00023078396415251995, "loss": 4.8909, "mean_token_accuracy": 0.2184933677315712, "num_tokens": 126257094.0, "step": 72790 }, { "entropy": 5.978049373626709, "epoch": 5.663684108150165, "grad_norm": 1.6328125, "learning_rate": 0.00023075678933565615, "loss": 4.9998, "mean_token_accuracy": 0.2084408223628998, "num_tokens": 126266143.0, "step": 72795 }, { "entropy": 5.955077314376831, "epoch": 5.664073137521883, "grad_norm": 1.5703125, "learning_rate": 0.0002307296151901126, "loss": 4.9556, "mean_token_accuracy": 0.22117069363594055, "num_tokens": 126275142.0, "step": 72800 }, { "entropy": 6.03149642944336, "epoch": 5.664462166893601, "grad_norm": 1.625, "learning_rate": 0.0002307024417163016, "loss": 5.1248, "mean_token_accuracy": 0.21094515323638915, "num_tokens": 126284414.0, "step": 72805 }, { "entropy": 6.1144472599029545, "epoch": 5.664851196265318, "grad_norm": 1.453125, "learning_rate": 0.00023067526891463563, "loss": 5.0786, "mean_token_accuracy": 0.21219465583562852, "num_tokens": 126293230.0, "step": 72810 }, { "entropy": 6.0772865295410154, "epoch": 5.665240225637035, "grad_norm": 1.515625, "learning_rate": 0.0002306480967855269, "loss": 5.0817, "mean_token_accuracy": 0.20350730419158936, "num_tokens": 126302514.0, "step": 72815 }, { "entropy": 5.9674536228179935, "epoch": 5.665629255008753, "grad_norm": 1.5546875, "learning_rate": 0.00023062092532938772, "loss": 4.8386, "mean_token_accuracy": 0.23173818737268448, "num_tokens": 126310980.0, "step": 72820 }, { "entropy": 5.914691591262818, "epoch": 5.6660182843804705, "grad_norm": 1.4921875, "learning_rate": 0.00023059375454663033, "loss": 4.8306, "mean_token_accuracy": 0.230175244808197, "num_tokens": 126320581.0, "step": 72825 }, { "entropy": 5.931934785842896, "epoch": 5.666407313752188, "grad_norm": 1.625, "learning_rate": 0.0002305665844376671, "loss": 4.85, "mean_token_accuracy": 0.2237171486020088, "num_tokens": 126328988.0, "step": 72830 }, { "entropy": 5.945426368713379, "epoch": 5.666796343123906, "grad_norm": 1.34375, "learning_rate": 0.00023053941500291014, "loss": 4.9848, "mean_token_accuracy": 0.21202347725629805, "num_tokens": 126339010.0, "step": 72835 }, { "entropy": 5.95056939125061, "epoch": 5.667185372495624, "grad_norm": 1.53125, "learning_rate": 0.00023051224624277185, "loss": 4.8689, "mean_token_accuracy": 0.22332751452922822, "num_tokens": 126347249.0, "step": 72840 }, { "entropy": 6.002225923538208, "epoch": 5.667574401867341, "grad_norm": 1.6015625, "learning_rate": 0.0002304850781576644, "loss": 4.9945, "mean_token_accuracy": 0.21101197004318237, "num_tokens": 126355082.0, "step": 72845 }, { "entropy": 5.985752534866333, "epoch": 5.667963431239059, "grad_norm": 1.6015625, "learning_rate": 0.00023045791074800004, "loss": 4.9607, "mean_token_accuracy": 0.2130718007683754, "num_tokens": 126363698.0, "step": 72850 }, { "entropy": 5.962158250808716, "epoch": 5.668352460610776, "grad_norm": 1.5625, "learning_rate": 0.000230430744014191, "loss": 4.9502, "mean_token_accuracy": 0.21430813223123552, "num_tokens": 126373615.0, "step": 72855 }, { "entropy": 5.898162698745727, "epoch": 5.6687414899824935, "grad_norm": 1.46875, "learning_rate": 0.00023040357795664945, "loss": 4.8596, "mean_token_accuracy": 0.22666718512773515, "num_tokens": 126383311.0, "step": 72860 }, { "entropy": 5.990855884552002, "epoch": 5.669130519354211, "grad_norm": 1.703125, "learning_rate": 0.00023037641257578768, "loss": 4.9277, "mean_token_accuracy": 0.2133368134498596, "num_tokens": 126391228.0, "step": 72865 }, { "entropy": 5.9140480041503904, "epoch": 5.669519548725929, "grad_norm": 1.359375, "learning_rate": 0.00023034924787201778, "loss": 4.9465, "mean_token_accuracy": 0.21369985044002532, "num_tokens": 126400123.0, "step": 72870 }, { "entropy": 5.9018913269042965, "epoch": 5.669908578097647, "grad_norm": 1.4140625, "learning_rate": 0.00023032208384575188, "loss": 4.8843, "mean_token_accuracy": 0.22617561370134354, "num_tokens": 126409410.0, "step": 72875 }, { "entropy": 5.882086181640625, "epoch": 5.670297607469364, "grad_norm": 1.46875, "learning_rate": 0.00023029492049740232, "loss": 4.8709, "mean_token_accuracy": 0.22622902691364288, "num_tokens": 126418906.0, "step": 72880 }, { "entropy": 5.964866828918457, "epoch": 5.670686636841081, "grad_norm": 1.6171875, "learning_rate": 0.00023026775782738123, "loss": 4.9697, "mean_token_accuracy": 0.21480847299098968, "num_tokens": 126426780.0, "step": 72885 }, { "entropy": 5.980423498153686, "epoch": 5.671075666212799, "grad_norm": 1.4609375, "learning_rate": 0.0002302405958361007, "loss": 5.0332, "mean_token_accuracy": 0.2138255313038826, "num_tokens": 126435313.0, "step": 72890 }, { "entropy": 5.871739387512207, "epoch": 5.6714646955845165, "grad_norm": 1.5078125, "learning_rate": 0.00023021343452397287, "loss": 4.8267, "mean_token_accuracy": 0.2279508590698242, "num_tokens": 126443921.0, "step": 72895 }, { "entropy": 5.934856843948364, "epoch": 5.671853724956234, "grad_norm": 1.5078125, "learning_rate": 0.00023018627389140989, "loss": 4.9407, "mean_token_accuracy": 0.22341656386852266, "num_tokens": 126452988.0, "step": 72900 }, { "entropy": 6.001782464981079, "epoch": 5.672242754327952, "grad_norm": 1.515625, "learning_rate": 0.0002301591139388239, "loss": 4.9684, "mean_token_accuracy": 0.22213578522205352, "num_tokens": 126461552.0, "step": 72905 }, { "entropy": 5.966126871109009, "epoch": 5.67263178369967, "grad_norm": 1.5546875, "learning_rate": 0.00023013195466662696, "loss": 4.9481, "mean_token_accuracy": 0.21851833313703536, "num_tokens": 126470406.0, "step": 72910 }, { "entropy": 5.980513954162598, "epoch": 5.673020813071387, "grad_norm": 1.53125, "learning_rate": 0.00023010479607523123, "loss": 4.9721, "mean_token_accuracy": 0.21908336579799653, "num_tokens": 126478082.0, "step": 72915 }, { "entropy": 5.959233188629151, "epoch": 5.673409842443104, "grad_norm": 1.6015625, "learning_rate": 0.00023007763816504866, "loss": 4.9583, "mean_token_accuracy": 0.21539176404476165, "num_tokens": 126487298.0, "step": 72920 }, { "entropy": 5.896697235107422, "epoch": 5.673798871814822, "grad_norm": 1.5390625, "learning_rate": 0.00023005048093649157, "loss": 4.8513, "mean_token_accuracy": 0.2270795598626137, "num_tokens": 126495977.0, "step": 72925 }, { "entropy": 5.9429123878479, "epoch": 5.6741879011865395, "grad_norm": 1.5859375, "learning_rate": 0.00023002332438997174, "loss": 4.9154, "mean_token_accuracy": 0.21777993589639663, "num_tokens": 126504497.0, "step": 72930 }, { "entropy": 5.904701614379883, "epoch": 5.674576930558257, "grad_norm": 1.5625, "learning_rate": 0.00022999616852590148, "loss": 4.8181, "mean_token_accuracy": 0.23265775591135024, "num_tokens": 126513563.0, "step": 72935 }, { "entropy": 5.970194578170776, "epoch": 5.674965959929975, "grad_norm": 1.546875, "learning_rate": 0.00022996901334469268, "loss": 4.8649, "mean_token_accuracy": 0.21541497409343718, "num_tokens": 126521668.0, "step": 72940 }, { "entropy": 5.960848045349121, "epoch": 5.675354989301693, "grad_norm": 1.5390625, "learning_rate": 0.00022994185884675738, "loss": 4.9657, "mean_token_accuracy": 0.225208979845047, "num_tokens": 126530452.0, "step": 72945 }, { "entropy": 5.974166536331177, "epoch": 5.675744018673409, "grad_norm": 1.5, "learning_rate": 0.00022991470503250778, "loss": 4.9628, "mean_token_accuracy": 0.21377215087413787, "num_tokens": 126539409.0, "step": 72950 }, { "entropy": 5.962796926498413, "epoch": 5.676133048045127, "grad_norm": 1.5234375, "learning_rate": 0.00022988755190235573, "loss": 4.8707, "mean_token_accuracy": 0.2269235610961914, "num_tokens": 126547620.0, "step": 72955 }, { "entropy": 5.977900695800781, "epoch": 5.676522077416845, "grad_norm": 1.5234375, "learning_rate": 0.00022986039945671323, "loss": 4.9807, "mean_token_accuracy": 0.2160336822271347, "num_tokens": 126556141.0, "step": 72960 }, { "entropy": 5.966115188598633, "epoch": 5.6769111067885625, "grad_norm": 1.5703125, "learning_rate": 0.00022983324769599239, "loss": 4.976, "mean_token_accuracy": 0.22178489118814468, "num_tokens": 126564687.0, "step": 72965 }, { "entropy": 5.961482381820678, "epoch": 5.67730013616028, "grad_norm": 1.546875, "learning_rate": 0.0002298060966206051, "loss": 5.0168, "mean_token_accuracy": 0.2112610563635826, "num_tokens": 126573227.0, "step": 72970 }, { "entropy": 6.022966146469116, "epoch": 5.677689165531998, "grad_norm": 1.484375, "learning_rate": 0.00022977894623096336, "loss": 5.0309, "mean_token_accuracy": 0.20791575461626052, "num_tokens": 126581939.0, "step": 72975 }, { "entropy": 6.043413686752319, "epoch": 5.678078194903716, "grad_norm": 1.3203125, "learning_rate": 0.00022975179652747908, "loss": 5.0642, "mean_token_accuracy": 0.20750347375869752, "num_tokens": 126591341.0, "step": 72980 }, { "entropy": 6.003195476531983, "epoch": 5.678467224275433, "grad_norm": 1.546875, "learning_rate": 0.00022972464751056432, "loss": 5.028, "mean_token_accuracy": 0.21449422389268874, "num_tokens": 126600791.0, "step": 72985 }, { "entropy": 5.928032732009887, "epoch": 5.67885625364715, "grad_norm": 1.4453125, "learning_rate": 0.00022969749918063092, "loss": 4.9311, "mean_token_accuracy": 0.21313513517379762, "num_tokens": 126610725.0, "step": 72990 }, { "entropy": 5.964128065109253, "epoch": 5.679245283018868, "grad_norm": 1.4609375, "learning_rate": 0.00022967035153809097, "loss": 4.917, "mean_token_accuracy": 0.21796328574419022, "num_tokens": 126619478.0, "step": 72995 }, { "entropy": 6.014876508712769, "epoch": 5.6796343123905855, "grad_norm": 1.65625, "learning_rate": 0.0002296432045833562, "loss": 4.9096, "mean_token_accuracy": 0.22569421380758287, "num_tokens": 126627304.0, "step": 73000 }, { "entropy": 5.965623569488526, "epoch": 5.680023341762303, "grad_norm": 1.546875, "learning_rate": 0.00022961605831683856, "loss": 4.9555, "mean_token_accuracy": 0.2218638077378273, "num_tokens": 126635965.0, "step": 73005 }, { "entropy": 5.993376111984253, "epoch": 5.680412371134021, "grad_norm": 1.4609375, "learning_rate": 0.00022958891273895004, "loss": 5.0607, "mean_token_accuracy": 0.2095496326684952, "num_tokens": 126645452.0, "step": 73010 }, { "entropy": 6.004300212860107, "epoch": 5.680801400505739, "grad_norm": 1.53125, "learning_rate": 0.00022956176785010252, "loss": 4.9425, "mean_token_accuracy": 0.22099160701036452, "num_tokens": 126654032.0, "step": 73015 }, { "entropy": 6.013660669326782, "epoch": 5.681190429877455, "grad_norm": 1.6484375, "learning_rate": 0.0002295346236507079, "loss": 5.0768, "mean_token_accuracy": 0.21135346740484237, "num_tokens": 126662479.0, "step": 73020 }, { "entropy": 5.909350919723511, "epoch": 5.681579459249173, "grad_norm": 1.609375, "learning_rate": 0.0002295074801411779, "loss": 4.8355, "mean_token_accuracy": 0.2201574131846428, "num_tokens": 126670218.0, "step": 73025 }, { "entropy": 5.976257228851319, "epoch": 5.681968488620891, "grad_norm": 1.421875, "learning_rate": 0.00022948033732192452, "loss": 4.9807, "mean_token_accuracy": 0.21574137806892396, "num_tokens": 126678852.0, "step": 73030 }, { "entropy": 6.0373852252960205, "epoch": 5.6823575179926085, "grad_norm": 1.5234375, "learning_rate": 0.00022945319519335962, "loss": 5.0207, "mean_token_accuracy": 0.21247072368860245, "num_tokens": 126687909.0, "step": 73035 }, { "entropy": 5.9868968486785885, "epoch": 5.682746547364326, "grad_norm": 1.4765625, "learning_rate": 0.0002294260537558949, "loss": 5.0004, "mean_token_accuracy": 0.21822952926158906, "num_tokens": 126696476.0, "step": 73040 }, { "entropy": 6.05645260810852, "epoch": 5.683135576736044, "grad_norm": 1.4609375, "learning_rate": 0.00022939891300994238, "loss": 5.0287, "mean_token_accuracy": 0.2070160076022148, "num_tokens": 126705302.0, "step": 73045 }, { "entropy": 6.037787771224975, "epoch": 5.683524606107762, "grad_norm": 1.4140625, "learning_rate": 0.0002293717729559137, "loss": 4.9794, "mean_token_accuracy": 0.21440818756818772, "num_tokens": 126714201.0, "step": 73050 }, { "entropy": 6.099712991714478, "epoch": 5.683913635479478, "grad_norm": 1.5625, "learning_rate": 0.00022934463359422074, "loss": 5.1083, "mean_token_accuracy": 0.20904088020324707, "num_tokens": 126722118.0, "step": 73055 }, { "entropy": 5.959718465805054, "epoch": 5.684302664851196, "grad_norm": 1.390625, "learning_rate": 0.0002293174949252753, "loss": 4.9153, "mean_token_accuracy": 0.22269941866397858, "num_tokens": 126730894.0, "step": 73060 }, { "entropy": 5.983993339538574, "epoch": 5.684691694222914, "grad_norm": 1.578125, "learning_rate": 0.0002292903569494892, "loss": 4.9546, "mean_token_accuracy": 0.2162748247385025, "num_tokens": 126739255.0, "step": 73065 }, { "entropy": 5.962177371978759, "epoch": 5.6850807235946315, "grad_norm": 1.515625, "learning_rate": 0.00022926321966727404, "loss": 4.953, "mean_token_accuracy": 0.21684591025114058, "num_tokens": 126747978.0, "step": 73070 }, { "entropy": 5.937758255004883, "epoch": 5.685469752966349, "grad_norm": 1.546875, "learning_rate": 0.00022923608307904192, "loss": 4.8708, "mean_token_accuracy": 0.22621162831783295, "num_tokens": 126755677.0, "step": 73075 }, { "entropy": 5.961876964569091, "epoch": 5.685858782338067, "grad_norm": 1.5703125, "learning_rate": 0.0002292089471852043, "loss": 4.9695, "mean_token_accuracy": 0.22240551561117172, "num_tokens": 126764185.0, "step": 73080 }, { "entropy": 5.954472351074219, "epoch": 5.686247811709784, "grad_norm": 1.3984375, "learning_rate": 0.00022918181198617306, "loss": 5.0049, "mean_token_accuracy": 0.21714649349451065, "num_tokens": 126773895.0, "step": 73085 }, { "entropy": 6.056010055541992, "epoch": 5.686636841081501, "grad_norm": 1.4453125, "learning_rate": 0.00022915467748235984, "loss": 5.0255, "mean_token_accuracy": 0.21674968898296357, "num_tokens": 126782336.0, "step": 73090 }, { "entropy": 6.136869955062866, "epoch": 5.687025870453219, "grad_norm": 1.5546875, "learning_rate": 0.00022912754367417648, "loss": 5.133, "mean_token_accuracy": 0.19777119606733323, "num_tokens": 126790050.0, "step": 73095 }, { "entropy": 6.092506837844849, "epoch": 5.687414899824937, "grad_norm": 1.59375, "learning_rate": 0.00022910041056203458, "loss": 4.9572, "mean_token_accuracy": 0.21926980167627336, "num_tokens": 126797819.0, "step": 73100 }, { "entropy": 5.990675830841065, "epoch": 5.6878039291966545, "grad_norm": 1.5703125, "learning_rate": 0.00022907327814634593, "loss": 4.9768, "mean_token_accuracy": 0.22129994481801987, "num_tokens": 126806620.0, "step": 73105 }, { "entropy": 5.9328569889068605, "epoch": 5.688192958568372, "grad_norm": 1.4140625, "learning_rate": 0.00022904614642752218, "loss": 5.0313, "mean_token_accuracy": 0.2160789266228676, "num_tokens": 126815524.0, "step": 73110 }, { "entropy": 5.916598987579346, "epoch": 5.68858198794009, "grad_norm": 1.546875, "learning_rate": 0.00022901901540597498, "loss": 4.8822, "mean_token_accuracy": 0.22628319561481475, "num_tokens": 126824184.0, "step": 73115 }, { "entropy": 5.9809126377105715, "epoch": 5.688971017311807, "grad_norm": 1.46875, "learning_rate": 0.0002289918850821161, "loss": 4.8806, "mean_token_accuracy": 0.22222674787044525, "num_tokens": 126832455.0, "step": 73120 }, { "entropy": 6.012555742263794, "epoch": 5.689360046683524, "grad_norm": 1.46875, "learning_rate": 0.00022896475545635704, "loss": 4.9336, "mean_token_accuracy": 0.2232738807797432, "num_tokens": 126841816.0, "step": 73125 }, { "entropy": 5.9670123100280765, "epoch": 5.689749076055242, "grad_norm": 1.6015625, "learning_rate": 0.00022893762652910965, "loss": 4.8429, "mean_token_accuracy": 0.23527687042951584, "num_tokens": 126850237.0, "step": 73130 }, { "entropy": 5.909859037399292, "epoch": 5.69013810542696, "grad_norm": 1.484375, "learning_rate": 0.00022891049830078543, "loss": 4.8728, "mean_token_accuracy": 0.217604660987854, "num_tokens": 126858995.0, "step": 73135 }, { "entropy": 5.9720470905303955, "epoch": 5.6905271347986774, "grad_norm": 1.578125, "learning_rate": 0.00022888337077179595, "loss": 5.0006, "mean_token_accuracy": 0.21161896884441375, "num_tokens": 126867942.0, "step": 73140 }, { "entropy": 5.91645393371582, "epoch": 5.690916164170395, "grad_norm": 1.6328125, "learning_rate": 0.00022885624394255294, "loss": 4.8881, "mean_token_accuracy": 0.23157857358455658, "num_tokens": 126877266.0, "step": 73145 }, { "entropy": 6.023869180679322, "epoch": 5.691305193542112, "grad_norm": 1.515625, "learning_rate": 0.00022882911781346805, "loss": 5.0166, "mean_token_accuracy": 0.2152101367712021, "num_tokens": 126885967.0, "step": 73150 }, { "entropy": 5.969755697250366, "epoch": 5.69169422291383, "grad_norm": 1.53125, "learning_rate": 0.0002288019923849528, "loss": 4.8543, "mean_token_accuracy": 0.22965194433927535, "num_tokens": 126893971.0, "step": 73155 }, { "entropy": 5.989588689804077, "epoch": 5.692083252285547, "grad_norm": 1.59375, "learning_rate": 0.0002287748676574188, "loss": 4.959, "mean_token_accuracy": 0.22332651764154435, "num_tokens": 126902343.0, "step": 73160 }, { "entropy": 5.96540207862854, "epoch": 5.692472281657265, "grad_norm": 1.4296875, "learning_rate": 0.0002287477436312776, "loss": 4.9299, "mean_token_accuracy": 0.2194982185959816, "num_tokens": 126910757.0, "step": 73165 }, { "entropy": 6.010799551010132, "epoch": 5.692861311028983, "grad_norm": 1.5625, "learning_rate": 0.00022872062030694073, "loss": 5.0959, "mean_token_accuracy": 0.20197096914052964, "num_tokens": 126919393.0, "step": 73170 }, { "entropy": 6.001668787002563, "epoch": 5.6932503404007, "grad_norm": 1.59375, "learning_rate": 0.0002286934976848198, "loss": 4.9091, "mean_token_accuracy": 0.22211263179779053, "num_tokens": 126927867.0, "step": 73175 }, { "entropy": 5.983290433883667, "epoch": 5.693639369772418, "grad_norm": 1.5703125, "learning_rate": 0.00022866637576532633, "loss": 4.9039, "mean_token_accuracy": 0.22412295192480086, "num_tokens": 126936280.0, "step": 73180 }, { "entropy": 5.95237455368042, "epoch": 5.694028399144136, "grad_norm": 1.546875, "learning_rate": 0.0002286392545488719, "loss": 4.9219, "mean_token_accuracy": 0.22013919055461884, "num_tokens": 126945248.0, "step": 73185 }, { "entropy": 5.89198637008667, "epoch": 5.694417428515853, "grad_norm": 1.5625, "learning_rate": 0.00022861213403586802, "loss": 4.9025, "mean_token_accuracy": 0.2262927323579788, "num_tokens": 126953876.0, "step": 73190 }, { "entropy": 6.022714281082154, "epoch": 5.69480645788757, "grad_norm": 1.578125, "learning_rate": 0.00022858501422672606, "loss": 5.034, "mean_token_accuracy": 0.21607715785503387, "num_tokens": 126962267.0, "step": 73195 }, { "entropy": 6.000125598907471, "epoch": 5.695195487259288, "grad_norm": 1.4609375, "learning_rate": 0.0002285578951218577, "loss": 4.9331, "mean_token_accuracy": 0.22253677994012833, "num_tokens": 126970530.0, "step": 73200 }, { "entropy": 5.917522811889649, "epoch": 5.695584516631006, "grad_norm": 1.6015625, "learning_rate": 0.00022853077672167432, "loss": 4.8926, "mean_token_accuracy": 0.2170576795935631, "num_tokens": 126978772.0, "step": 73205 }, { "entropy": 5.963950300216675, "epoch": 5.695973546002723, "grad_norm": 1.5078125, "learning_rate": 0.0002285036590265875, "loss": 4.9425, "mean_token_accuracy": 0.22397357672452928, "num_tokens": 126986540.0, "step": 73210 }, { "entropy": 5.971228551864624, "epoch": 5.696362575374441, "grad_norm": 1.5390625, "learning_rate": 0.00022847654203700857, "loss": 5.0257, "mean_token_accuracy": 0.2144510805606842, "num_tokens": 126995010.0, "step": 73215 }, { "entropy": 5.931143808364868, "epoch": 5.696751604746158, "grad_norm": 1.4296875, "learning_rate": 0.00022844942575334914, "loss": 4.8907, "mean_token_accuracy": 0.22319256961345674, "num_tokens": 127003366.0, "step": 73220 }, { "entropy": 6.003247022628784, "epoch": 5.697140634117876, "grad_norm": 1.671875, "learning_rate": 0.00022842231017602055, "loss": 4.9277, "mean_token_accuracy": 0.22666798681020736, "num_tokens": 127012593.0, "step": 73225 }, { "entropy": 5.947619771957397, "epoch": 5.697529663489593, "grad_norm": 1.5390625, "learning_rate": 0.00022839519530543423, "loss": 4.949, "mean_token_accuracy": 0.21606281846761705, "num_tokens": 127021023.0, "step": 73230 }, { "entropy": 5.972163963317871, "epoch": 5.697918692861311, "grad_norm": 1.6796875, "learning_rate": 0.0002283680811420017, "loss": 4.9533, "mean_token_accuracy": 0.22022514492273332, "num_tokens": 127028958.0, "step": 73235 }, { "entropy": 5.950520753860474, "epoch": 5.698307722233029, "grad_norm": 1.546875, "learning_rate": 0.00022834096768613437, "loss": 4.8658, "mean_token_accuracy": 0.2287825360894203, "num_tokens": 127038041.0, "step": 73240 }, { "entropy": 6.025143718719482, "epoch": 5.698696751604746, "grad_norm": 1.5625, "learning_rate": 0.00022831385493824353, "loss": 5.0295, "mean_token_accuracy": 0.21622103452682495, "num_tokens": 127046612.0, "step": 73245 }, { "entropy": 6.051503610610962, "epoch": 5.699085780976464, "grad_norm": 1.6015625, "learning_rate": 0.00022828674289874064, "loss": 5.1075, "mean_token_accuracy": 0.2133649617433548, "num_tokens": 127055019.0, "step": 73250 }, { "entropy": 6.030028915405273, "epoch": 5.699474810348181, "grad_norm": 1.6171875, "learning_rate": 0.00022825963156803704, "loss": 5.0403, "mean_token_accuracy": 0.20574882626533508, "num_tokens": 127063108.0, "step": 73255 }, { "entropy": 5.993446493148804, "epoch": 5.699863839719899, "grad_norm": 1.59375, "learning_rate": 0.00022823252094654413, "loss": 4.913, "mean_token_accuracy": 0.21809035241603852, "num_tokens": 127071385.0, "step": 73260 }, { "entropy": 5.931715202331543, "epoch": 5.700252869091616, "grad_norm": 1.4375, "learning_rate": 0.0002282054110346733, "loss": 4.8404, "mean_token_accuracy": 0.22022452652454377, "num_tokens": 127080144.0, "step": 73265 }, { "entropy": 6.001713228225708, "epoch": 5.700641898463334, "grad_norm": 1.4921875, "learning_rate": 0.00022817830183283582, "loss": 4.9586, "mean_token_accuracy": 0.22673921585083007, "num_tokens": 127089261.0, "step": 73270 }, { "entropy": 5.918449258804321, "epoch": 5.701030927835052, "grad_norm": 1.4765625, "learning_rate": 0.00022815119334144312, "loss": 4.9166, "mean_token_accuracy": 0.22626321911811828, "num_tokens": 127097673.0, "step": 73275 }, { "entropy": 6.013857030868531, "epoch": 5.701419957206769, "grad_norm": 1.453125, "learning_rate": 0.00022812408556090657, "loss": 4.9986, "mean_token_accuracy": 0.21233246326446534, "num_tokens": 127105774.0, "step": 73280 }, { "entropy": 6.051039505004883, "epoch": 5.701808986578486, "grad_norm": 1.546875, "learning_rate": 0.00022809697849163736, "loss": 5.0519, "mean_token_accuracy": 0.20555254817008972, "num_tokens": 127114254.0, "step": 73285 }, { "entropy": 6.007740592956543, "epoch": 5.702198015950204, "grad_norm": 1.5390625, "learning_rate": 0.00022806987213404685, "loss": 4.9174, "mean_token_accuracy": 0.2264646425843239, "num_tokens": 127123228.0, "step": 73290 }, { "entropy": 5.893957090377808, "epoch": 5.702587045321922, "grad_norm": 1.578125, "learning_rate": 0.00022804276648854632, "loss": 4.8508, "mean_token_accuracy": 0.2234017878770828, "num_tokens": 127132325.0, "step": 73295 }, { "entropy": 6.041404294967651, "epoch": 5.702976074693639, "grad_norm": 1.6015625, "learning_rate": 0.00022801566155554708, "loss": 4.9854, "mean_token_accuracy": 0.21549068838357927, "num_tokens": 127141594.0, "step": 73300 }, { "entropy": 6.03462700843811, "epoch": 5.703365104065357, "grad_norm": 1.703125, "learning_rate": 0.00022798855733546038, "loss": 4.9949, "mean_token_accuracy": 0.21758174002170563, "num_tokens": 127150099.0, "step": 73305 }, { "entropy": 5.993129110336303, "epoch": 5.703754133437075, "grad_norm": 1.5859375, "learning_rate": 0.0002279614538286975, "loss": 5.0228, "mean_token_accuracy": 0.2110902860760689, "num_tokens": 127158569.0, "step": 73310 }, { "entropy": 6.029888916015625, "epoch": 5.704143162808792, "grad_norm": 1.453125, "learning_rate": 0.00022793435103566972, "loss": 5.0375, "mean_token_accuracy": 0.21542368829250336, "num_tokens": 127167514.0, "step": 73315 }, { "entropy": 5.949106073379516, "epoch": 5.70453219218051, "grad_norm": 1.4140625, "learning_rate": 0.00022790724895678822, "loss": 4.8752, "mean_token_accuracy": 0.22586736381053923, "num_tokens": 127176036.0, "step": 73320 }, { "entropy": 5.969253158569336, "epoch": 5.704921221552227, "grad_norm": 1.5234375, "learning_rate": 0.00022788014759246429, "loss": 4.9552, "mean_token_accuracy": 0.21692299842834473, "num_tokens": 127184347.0, "step": 73325 }, { "entropy": 6.040313720703125, "epoch": 5.705310250923945, "grad_norm": 1.625, "learning_rate": 0.0002278530469431091, "loss": 5.0855, "mean_token_accuracy": 0.21209137737751008, "num_tokens": 127193350.0, "step": 73330 }, { "entropy": 5.973772478103638, "epoch": 5.705699280295662, "grad_norm": 1.4765625, "learning_rate": 0.0002278259470091339, "loss": 4.9326, "mean_token_accuracy": 0.2164492830634117, "num_tokens": 127201910.0, "step": 73335 }, { "entropy": 5.915620565414429, "epoch": 5.70608830966738, "grad_norm": 1.546875, "learning_rate": 0.00022779884779094972, "loss": 4.8812, "mean_token_accuracy": 0.22569292336702346, "num_tokens": 127210528.0, "step": 73340 }, { "entropy": 5.96608247756958, "epoch": 5.706477339039098, "grad_norm": 1.609375, "learning_rate": 0.00022777174928896804, "loss": 4.9621, "mean_token_accuracy": 0.21429431736469268, "num_tokens": 127218671.0, "step": 73345 }, { "entropy": 5.990810108184815, "epoch": 5.706866368410815, "grad_norm": 1.5234375, "learning_rate": 0.0002277446515035999, "loss": 5.0361, "mean_token_accuracy": 0.21298310905694962, "num_tokens": 127228003.0, "step": 73350 }, { "entropy": 5.980877637863159, "epoch": 5.707255397782532, "grad_norm": 1.5703125, "learning_rate": 0.00022771755443525644, "loss": 4.9244, "mean_token_accuracy": 0.223445363342762, "num_tokens": 127236114.0, "step": 73355 }, { "entropy": 5.971400213241577, "epoch": 5.70764442715425, "grad_norm": 1.484375, "learning_rate": 0.00022769045808434884, "loss": 4.9369, "mean_token_accuracy": 0.21867581456899643, "num_tokens": 127245427.0, "step": 73360 }, { "entropy": 5.912933778762818, "epoch": 5.708033456525968, "grad_norm": 1.484375, "learning_rate": 0.0002276633624512882, "loss": 4.8748, "mean_token_accuracy": 0.22943075150251388, "num_tokens": 127254732.0, "step": 73365 }, { "entropy": 5.903292989730835, "epoch": 5.708422485897685, "grad_norm": 1.484375, "learning_rate": 0.00022763626753648575, "loss": 4.8514, "mean_token_accuracy": 0.22833894491195678, "num_tokens": 127262851.0, "step": 73370 }, { "entropy": 6.022132015228271, "epoch": 5.708811515269403, "grad_norm": 1.6015625, "learning_rate": 0.00022760917334035252, "loss": 5.0391, "mean_token_accuracy": 0.20980738699436188, "num_tokens": 127270633.0, "step": 73375 }, { "entropy": 5.950638484954834, "epoch": 5.709200544641121, "grad_norm": 1.640625, "learning_rate": 0.00022758207986329964, "loss": 4.9174, "mean_token_accuracy": 0.2243496894836426, "num_tokens": 127278922.0, "step": 73380 }, { "entropy": 5.979461908340454, "epoch": 5.709589574012838, "grad_norm": 1.5703125, "learning_rate": 0.00022755498710573825, "loss": 4.979, "mean_token_accuracy": 0.2126516342163086, "num_tokens": 127287843.0, "step": 73385 }, { "entropy": 5.952922534942627, "epoch": 5.709978603384555, "grad_norm": 1.453125, "learning_rate": 0.00022752789506807935, "loss": 4.9283, "mean_token_accuracy": 0.22086714655160905, "num_tokens": 127296999.0, "step": 73390 }, { "entropy": 6.054407930374145, "epoch": 5.710367632756273, "grad_norm": 1.5078125, "learning_rate": 0.00022750080375073418, "loss": 5.0284, "mean_token_accuracy": 0.22336628139019013, "num_tokens": 127305387.0, "step": 73395 }, { "entropy": 5.985918664932251, "epoch": 5.710756662127991, "grad_norm": 1.46875, "learning_rate": 0.00022747371315411368, "loss": 4.8908, "mean_token_accuracy": 0.22526371628046035, "num_tokens": 127313467.0, "step": 73400 }, { "entropy": 5.953846645355225, "epoch": 5.711145691499708, "grad_norm": 1.5859375, "learning_rate": 0.00022744662327862887, "loss": 4.916, "mean_token_accuracy": 0.22159930914640427, "num_tokens": 127322381.0, "step": 73405 }, { "entropy": 5.978432846069336, "epoch": 5.711534720871426, "grad_norm": 1.5078125, "learning_rate": 0.0002274195341246909, "loss": 4.9469, "mean_token_accuracy": 0.2099955439567566, "num_tokens": 127330656.0, "step": 73410 }, { "entropy": 5.953506708145142, "epoch": 5.711923750243144, "grad_norm": 1.484375, "learning_rate": 0.00022739244569271077, "loss": 4.9339, "mean_token_accuracy": 0.2216631755232811, "num_tokens": 127339056.0, "step": 73415 }, { "entropy": 5.929978942871093, "epoch": 5.7123127796148605, "grad_norm": 1.609375, "learning_rate": 0.00022736535798309953, "loss": 4.879, "mean_token_accuracy": 0.22452974319458008, "num_tokens": 127346911.0, "step": 73420 }, { "entropy": 5.981953954696655, "epoch": 5.712701808986578, "grad_norm": 1.4921875, "learning_rate": 0.00022733827099626815, "loss": 4.9378, "mean_token_accuracy": 0.21798523962497712, "num_tokens": 127354910.0, "step": 73425 }, { "entropy": 6.037444591522217, "epoch": 5.713090838358296, "grad_norm": 1.453125, "learning_rate": 0.0002273111847326277, "loss": 5.0303, "mean_token_accuracy": 0.2170851856470108, "num_tokens": 127363658.0, "step": 73430 }, { "entropy": 5.902577924728393, "epoch": 5.713479867730014, "grad_norm": 1.5546875, "learning_rate": 0.00022728409919258908, "loss": 4.7888, "mean_token_accuracy": 0.2286820724606514, "num_tokens": 127371749.0, "step": 73435 }, { "entropy": 5.916402339935303, "epoch": 5.713868897101731, "grad_norm": 1.5703125, "learning_rate": 0.00022725701437656328, "loss": 4.8927, "mean_token_accuracy": 0.2284694105386734, "num_tokens": 127380414.0, "step": 73440 }, { "entropy": 5.992641258239746, "epoch": 5.714257926473449, "grad_norm": 1.4921875, "learning_rate": 0.0002272299302849613, "loss": 4.9812, "mean_token_accuracy": 0.21842539608478545, "num_tokens": 127388672.0, "step": 73445 }, { "entropy": 5.915173721313477, "epoch": 5.714646955845167, "grad_norm": 1.5546875, "learning_rate": 0.0002272028469181941, "loss": 4.8968, "mean_token_accuracy": 0.21677886694669724, "num_tokens": 127397313.0, "step": 73450 }, { "entropy": 5.9890586853027346, "epoch": 5.7150359852168835, "grad_norm": 1.5390625, "learning_rate": 0.00022717576427667258, "loss": 4.9166, "mean_token_accuracy": 0.2207922488451004, "num_tokens": 127404953.0, "step": 73455 }, { "entropy": 5.899847555160522, "epoch": 5.715425014588601, "grad_norm": 1.5390625, "learning_rate": 0.00022714868236080776, "loss": 4.8539, "mean_token_accuracy": 0.23402039110660552, "num_tokens": 127413750.0, "step": 73460 }, { "entropy": 5.9386186599731445, "epoch": 5.715814043960319, "grad_norm": 1.5390625, "learning_rate": 0.00022712160117101054, "loss": 4.9699, "mean_token_accuracy": 0.22194555252790452, "num_tokens": 127422667.0, "step": 73465 }, { "entropy": 5.9725341796875, "epoch": 5.716203073332037, "grad_norm": 1.5078125, "learning_rate": 0.00022709452070769176, "loss": 4.8928, "mean_token_accuracy": 0.22151690423488618, "num_tokens": 127431627.0, "step": 73470 }, { "entropy": 6.029455709457397, "epoch": 5.716592102703754, "grad_norm": 1.640625, "learning_rate": 0.00022706744097126242, "loss": 4.9766, "mean_token_accuracy": 0.21266457289457322, "num_tokens": 127439867.0, "step": 73475 }, { "entropy": 5.934326887130737, "epoch": 5.716981132075472, "grad_norm": 1.3828125, "learning_rate": 0.00022704036196213336, "loss": 4.8194, "mean_token_accuracy": 0.2300341919064522, "num_tokens": 127448239.0, "step": 73480 }, { "entropy": 5.944498062133789, "epoch": 5.717370161447189, "grad_norm": 1.578125, "learning_rate": 0.00022701328368071545, "loss": 5.0026, "mean_token_accuracy": 0.20820536613464355, "num_tokens": 127458518.0, "step": 73485 }, { "entropy": 6.006759357452393, "epoch": 5.7177591908189065, "grad_norm": 1.46875, "learning_rate": 0.00022698620612741962, "loss": 4.9914, "mean_token_accuracy": 0.20946191996335983, "num_tokens": 127467640.0, "step": 73490 }, { "entropy": 5.93070502281189, "epoch": 5.718148220190624, "grad_norm": 1.5, "learning_rate": 0.00022695912930265666, "loss": 4.8178, "mean_token_accuracy": 0.2310593232512474, "num_tokens": 127475835.0, "step": 73495 }, { "entropy": 5.904641056060791, "epoch": 5.718537249562342, "grad_norm": 1.5546875, "learning_rate": 0.0002269320532068375, "loss": 4.9045, "mean_token_accuracy": 0.22180160284042358, "num_tokens": 127485081.0, "step": 73500 }, { "entropy": 5.965151453018189, "epoch": 5.71892627893406, "grad_norm": 1.6875, "learning_rate": 0.0002269049778403729, "loss": 4.8796, "mean_token_accuracy": 0.22713935375213623, "num_tokens": 127493380.0, "step": 73505 }, { "entropy": 6.013972473144531, "epoch": 5.719315308305777, "grad_norm": 1.578125, "learning_rate": 0.00022687790320367375, "loss": 5.0125, "mean_token_accuracy": 0.212660513818264, "num_tokens": 127502330.0, "step": 73510 }, { "entropy": 5.956238031387329, "epoch": 5.719704337677495, "grad_norm": 1.5078125, "learning_rate": 0.00022685082929715074, "loss": 4.9055, "mean_token_accuracy": 0.22114844620227814, "num_tokens": 127510516.0, "step": 73515 }, { "entropy": 5.974145078659058, "epoch": 5.720093367049213, "grad_norm": 1.5234375, "learning_rate": 0.00022682375612121481, "loss": 4.96, "mean_token_accuracy": 0.21204971969127656, "num_tokens": 127519192.0, "step": 73520 }, { "entropy": 5.985685539245606, "epoch": 5.7204823964209295, "grad_norm": 1.4609375, "learning_rate": 0.0002267966836762767, "loss": 4.9164, "mean_token_accuracy": 0.21958349496126175, "num_tokens": 127527795.0, "step": 73525 }, { "entropy": 5.9342468738555905, "epoch": 5.720871425792647, "grad_norm": 1.53125, "learning_rate": 0.00022676961196274714, "loss": 4.9713, "mean_token_accuracy": 0.22401099950075148, "num_tokens": 127536132.0, "step": 73530 }, { "entropy": 6.050785923004151, "epoch": 5.721260455164365, "grad_norm": 1.4765625, "learning_rate": 0.00022674254098103692, "loss": 5.0066, "mean_token_accuracy": 0.21433781683444977, "num_tokens": 127544785.0, "step": 73535 }, { "entropy": 5.960423469543457, "epoch": 5.721649484536083, "grad_norm": 1.5625, "learning_rate": 0.0002267154707315569, "loss": 4.864, "mean_token_accuracy": 0.21525000184774398, "num_tokens": 127553442.0, "step": 73540 }, { "entropy": 6.071310710906983, "epoch": 5.7220385139078, "grad_norm": 1.5546875, "learning_rate": 0.0002266884012147178, "loss": 5.1023, "mean_token_accuracy": 0.20675372779369355, "num_tokens": 127561539.0, "step": 73545 }, { "entropy": 6.010825347900391, "epoch": 5.722427543279518, "grad_norm": 1.5078125, "learning_rate": 0.0002266613324309303, "loss": 4.9862, "mean_token_accuracy": 0.21991277039051055, "num_tokens": 127569936.0, "step": 73550 }, { "entropy": 5.9777521133422855, "epoch": 5.722816572651235, "grad_norm": 1.4765625, "learning_rate": 0.00022663426438060508, "loss": 4.9561, "mean_token_accuracy": 0.22072144001722335, "num_tokens": 127578337.0, "step": 73555 }, { "entropy": 5.985173749923706, "epoch": 5.7232056020229525, "grad_norm": 1.59375, "learning_rate": 0.00022660719706415295, "loss": 4.9848, "mean_token_accuracy": 0.20939017683267594, "num_tokens": 127586780.0, "step": 73560 }, { "entropy": 5.920226144790649, "epoch": 5.72359463139467, "grad_norm": 1.484375, "learning_rate": 0.00022658013048198455, "loss": 4.8725, "mean_token_accuracy": 0.23122124820947648, "num_tokens": 127595605.0, "step": 73565 }, { "entropy": 6.0729865550994875, "epoch": 5.723983660766388, "grad_norm": 1.421875, "learning_rate": 0.00022655306463451063, "loss": 5.0846, "mean_token_accuracy": 0.21082287430763244, "num_tokens": 127604695.0, "step": 73570 }, { "entropy": 6.07193775177002, "epoch": 5.724372690138106, "grad_norm": 1.53125, "learning_rate": 0.00022652599952214186, "loss": 5.0418, "mean_token_accuracy": 0.21565143764019012, "num_tokens": 127613666.0, "step": 73575 }, { "entropy": 5.9728750705719, "epoch": 5.724761719509823, "grad_norm": 1.4765625, "learning_rate": 0.00022649893514528892, "loss": 4.9672, "mean_token_accuracy": 0.21677229404449463, "num_tokens": 127623067.0, "step": 73580 }, { "entropy": 6.002970457077026, "epoch": 5.725150748881541, "grad_norm": 1.546875, "learning_rate": 0.0002264718715043624, "loss": 4.9426, "mean_token_accuracy": 0.21113581359386444, "num_tokens": 127631020.0, "step": 73585 }, { "entropy": 5.929935503005981, "epoch": 5.725539778253258, "grad_norm": 1.5546875, "learning_rate": 0.000226444808599773, "loss": 4.9563, "mean_token_accuracy": 0.21889320611953736, "num_tokens": 127639606.0, "step": 73590 }, { "entropy": 5.941722345352173, "epoch": 5.7259288076249755, "grad_norm": 1.3984375, "learning_rate": 0.00022641774643193137, "loss": 4.892, "mean_token_accuracy": 0.22205786257982255, "num_tokens": 127648123.0, "step": 73595 }, { "entropy": 5.986019134521484, "epoch": 5.726317836996693, "grad_norm": 1.4765625, "learning_rate": 0.00022639068500124803, "loss": 5.0287, "mean_token_accuracy": 0.21759441792964934, "num_tokens": 127657210.0, "step": 73600 }, { "entropy": 5.970897579193116, "epoch": 5.726706866368411, "grad_norm": 1.4921875, "learning_rate": 0.00022636362430813363, "loss": 4.869, "mean_token_accuracy": 0.22656756937503814, "num_tokens": 127666617.0, "step": 73605 }, { "entropy": 6.023809719085693, "epoch": 5.727095895740129, "grad_norm": 1.5625, "learning_rate": 0.00022633656435299893, "loss": 5.0513, "mean_token_accuracy": 0.2163427785038948, "num_tokens": 127675555.0, "step": 73610 }, { "entropy": 5.945064067840576, "epoch": 5.727484925111846, "grad_norm": 1.3828125, "learning_rate": 0.00022630950513625436, "loss": 4.8555, "mean_token_accuracy": 0.22436068952083588, "num_tokens": 127684454.0, "step": 73615 }, { "entropy": 5.940009355545044, "epoch": 5.727873954483563, "grad_norm": 1.4375, "learning_rate": 0.00022628244665831067, "loss": 4.9113, "mean_token_accuracy": 0.22099453955888748, "num_tokens": 127693286.0, "step": 73620 }, { "entropy": 5.997782611846924, "epoch": 5.728262983855281, "grad_norm": 1.515625, "learning_rate": 0.0002262553889195782, "loss": 5.0433, "mean_token_accuracy": 0.2175013765692711, "num_tokens": 127701923.0, "step": 73625 }, { "entropy": 5.996645307540893, "epoch": 5.7286520132269985, "grad_norm": 1.640625, "learning_rate": 0.00022622833192046765, "loss": 4.9477, "mean_token_accuracy": 0.2260258361697197, "num_tokens": 127709687.0, "step": 73630 }, { "entropy": 5.935972118377686, "epoch": 5.729041042598716, "grad_norm": 1.5078125, "learning_rate": 0.00022620127566138948, "loss": 4.9644, "mean_token_accuracy": 0.213890440762043, "num_tokens": 127718651.0, "step": 73635 }, { "entropy": 5.924044132232666, "epoch": 5.729430071970434, "grad_norm": 1.515625, "learning_rate": 0.00022617422014275436, "loss": 4.8803, "mean_token_accuracy": 0.2313445121049881, "num_tokens": 127727563.0, "step": 73640 }, { "entropy": 5.934467554092407, "epoch": 5.7298191013421516, "grad_norm": 1.4375, "learning_rate": 0.0002261471653649727, "loss": 4.937, "mean_token_accuracy": 0.2124100521206856, "num_tokens": 127736289.0, "step": 73645 }, { "entropy": 5.8813577651977536, "epoch": 5.730208130713869, "grad_norm": 1.4765625, "learning_rate": 0.00022612011132845506, "loss": 4.8212, "mean_token_accuracy": 0.22848794013261794, "num_tokens": 127745404.0, "step": 73650 }, { "entropy": 5.936109495162964, "epoch": 5.730597160085587, "grad_norm": 1.4609375, "learning_rate": 0.0002260930580336119, "loss": 4.9133, "mean_token_accuracy": 0.22635226994752883, "num_tokens": 127754631.0, "step": 73655 }, { "entropy": 6.009025144577026, "epoch": 5.730986189457304, "grad_norm": 1.6640625, "learning_rate": 0.00022606600548085375, "loss": 4.9502, "mean_token_accuracy": 0.22071287631988526, "num_tokens": 127763564.0, "step": 73660 }, { "entropy": 5.899959707260132, "epoch": 5.7313752188290215, "grad_norm": 1.6015625, "learning_rate": 0.00022603895367059109, "loss": 4.8344, "mean_token_accuracy": 0.22856004536151886, "num_tokens": 127772132.0, "step": 73665 }, { "entropy": 5.977571105957031, "epoch": 5.731764248200739, "grad_norm": 1.5859375, "learning_rate": 0.00022601190260323434, "loss": 5.0193, "mean_token_accuracy": 0.21808982342481614, "num_tokens": 127781582.0, "step": 73670 }, { "entropy": 5.984799194335937, "epoch": 5.732153277572457, "grad_norm": 1.4765625, "learning_rate": 0.000225984852279194, "loss": 4.9669, "mean_token_accuracy": 0.21805085390806198, "num_tokens": 127789504.0, "step": 73675 }, { "entropy": 5.9849841594696045, "epoch": 5.7325423069441745, "grad_norm": 1.4609375, "learning_rate": 0.00022595780269888055, "loss": 4.9472, "mean_token_accuracy": 0.2196095511317253, "num_tokens": 127799268.0, "step": 73680 }, { "entropy": 5.947044038772583, "epoch": 5.732931336315891, "grad_norm": 1.6171875, "learning_rate": 0.00022593075386270438, "loss": 4.9077, "mean_token_accuracy": 0.22274007946252822, "num_tokens": 127808209.0, "step": 73685 }, { "entropy": 5.866025447845459, "epoch": 5.733320365687609, "grad_norm": 1.5234375, "learning_rate": 0.00022590370577107595, "loss": 4.8685, "mean_token_accuracy": 0.2232494667172432, "num_tokens": 127816470.0, "step": 73690 }, { "entropy": 5.972497034072876, "epoch": 5.733709395059327, "grad_norm": 1.578125, "learning_rate": 0.0002258766584244056, "loss": 4.9339, "mean_token_accuracy": 0.2214958995580673, "num_tokens": 127824451.0, "step": 73695 }, { "entropy": 5.908875226974487, "epoch": 5.7340984244310444, "grad_norm": 1.4453125, "learning_rate": 0.00022584961182310382, "loss": 4.8779, "mean_token_accuracy": 0.23376343548297882, "num_tokens": 127833654.0, "step": 73700 }, { "entropy": 5.953571844100952, "epoch": 5.734487453802762, "grad_norm": 1.578125, "learning_rate": 0.00022582256596758094, "loss": 4.8791, "mean_token_accuracy": 0.2238616392016411, "num_tokens": 127842569.0, "step": 73705 }, { "entropy": 6.003153085708618, "epoch": 5.73487648317448, "grad_norm": 1.515625, "learning_rate": 0.00022579552085824728, "loss": 4.9676, "mean_token_accuracy": 0.22277337461709976, "num_tokens": 127851267.0, "step": 73710 }, { "entropy": 5.966017532348633, "epoch": 5.7352655125461975, "grad_norm": 1.5703125, "learning_rate": 0.0002257684764955133, "loss": 4.9606, "mean_token_accuracy": 0.22171594947576523, "num_tokens": 127860225.0, "step": 73715 }, { "entropy": 5.946017694473267, "epoch": 5.735654541917915, "grad_norm": 1.515625, "learning_rate": 0.00022574143287978937, "loss": 4.938, "mean_token_accuracy": 0.2143661543726921, "num_tokens": 127868470.0, "step": 73720 }, { "entropy": 5.894034099578858, "epoch": 5.736043571289632, "grad_norm": 1.421875, "learning_rate": 0.00022571439001148574, "loss": 4.8738, "mean_token_accuracy": 0.22755395025014877, "num_tokens": 127877141.0, "step": 73725 }, { "entropy": 5.957109689712524, "epoch": 5.73643260066135, "grad_norm": 1.5546875, "learning_rate": 0.00022568734789101287, "loss": 4.9474, "mean_token_accuracy": 0.22278209775686264, "num_tokens": 127885900.0, "step": 73730 }, { "entropy": 5.908208560943604, "epoch": 5.736821630033067, "grad_norm": 1.3671875, "learning_rate": 0.0002256603065187809, "loss": 4.8798, "mean_token_accuracy": 0.22201057076454161, "num_tokens": 127894938.0, "step": 73735 }, { "entropy": 5.979791355133057, "epoch": 5.737210659404785, "grad_norm": 1.453125, "learning_rate": 0.00022563326589520027, "loss": 4.893, "mean_token_accuracy": 0.21238429844379425, "num_tokens": 127903846.0, "step": 73740 }, { "entropy": 5.9115869998931885, "epoch": 5.737599688776503, "grad_norm": 1.4921875, "learning_rate": 0.00022560622602068125, "loss": 4.8454, "mean_token_accuracy": 0.22681476920843124, "num_tokens": 127912479.0, "step": 73745 }, { "entropy": 5.895171117782593, "epoch": 5.7379887181482205, "grad_norm": 1.453125, "learning_rate": 0.00022557918689563423, "loss": 4.9333, "mean_token_accuracy": 0.2277906745672226, "num_tokens": 127920773.0, "step": 73750 }, { "entropy": 5.996135997772217, "epoch": 5.738377747519937, "grad_norm": 1.6171875, "learning_rate": 0.0002255521485204693, "loss": 5.0049, "mean_token_accuracy": 0.21437996178865432, "num_tokens": 127929481.0, "step": 73755 }, { "entropy": 5.94037389755249, "epoch": 5.738766776891655, "grad_norm": 1.3671875, "learning_rate": 0.00022552511089559684, "loss": 4.8978, "mean_token_accuracy": 0.22356765121221542, "num_tokens": 127938270.0, "step": 73760 }, { "entropy": 5.907193756103515, "epoch": 5.739155806263373, "grad_norm": 1.515625, "learning_rate": 0.0002254980740214271, "loss": 4.8961, "mean_token_accuracy": 0.22225691080093385, "num_tokens": 127946824.0, "step": 73765 }, { "entropy": 5.9058263301849365, "epoch": 5.73954483563509, "grad_norm": 1.453125, "learning_rate": 0.0002254710378983702, "loss": 4.8722, "mean_token_accuracy": 0.22207724452018737, "num_tokens": 127955935.0, "step": 73770 }, { "entropy": 5.994569873809814, "epoch": 5.739933865006808, "grad_norm": 1.5625, "learning_rate": 0.00022544400252683656, "loss": 4.9902, "mean_token_accuracy": 0.21830691397190094, "num_tokens": 127965445.0, "step": 73775 }, { "entropy": 5.946188449859619, "epoch": 5.740322894378526, "grad_norm": 1.515625, "learning_rate": 0.0002254169679072363, "loss": 4.8437, "mean_token_accuracy": 0.22741733342409134, "num_tokens": 127973391.0, "step": 73780 }, { "entropy": 6.002416944503784, "epoch": 5.7407119237502435, "grad_norm": 1.6484375, "learning_rate": 0.00022538993403997966, "loss": 4.985, "mean_token_accuracy": 0.22188954651355744, "num_tokens": 127981492.0, "step": 73785 }, { "entropy": 5.927619504928589, "epoch": 5.74110095312196, "grad_norm": 1.5234375, "learning_rate": 0.00022536290092547672, "loss": 4.9447, "mean_token_accuracy": 0.21692586392164231, "num_tokens": 127989457.0, "step": 73790 }, { "entropy": 5.9815528869628904, "epoch": 5.741489982493678, "grad_norm": 1.453125, "learning_rate": 0.0002253358685641378, "loss": 5.0156, "mean_token_accuracy": 0.2105855405330658, "num_tokens": 127997652.0, "step": 73795 }, { "entropy": 5.937820768356323, "epoch": 5.741879011865396, "grad_norm": 1.4296875, "learning_rate": 0.000225308836956373, "loss": 4.9244, "mean_token_accuracy": 0.21981030702590942, "num_tokens": 128007530.0, "step": 73800 }, { "entropy": 5.9655677318573, "epoch": 5.742268041237113, "grad_norm": 1.4453125, "learning_rate": 0.00022528180610259247, "loss": 4.9488, "mean_token_accuracy": 0.22177362591028213, "num_tokens": 128016671.0, "step": 73805 }, { "entropy": 5.992573642730713, "epoch": 5.742657070608831, "grad_norm": 1.4453125, "learning_rate": 0.0002252547760032065, "loss": 4.9941, "mean_token_accuracy": 0.21629100143909455, "num_tokens": 128025928.0, "step": 73810 }, { "entropy": 6.009360456466675, "epoch": 5.743046099980549, "grad_norm": 1.5078125, "learning_rate": 0.00022522774665862506, "loss": 4.975, "mean_token_accuracy": 0.2168005645275116, "num_tokens": 128034750.0, "step": 73815 }, { "entropy": 5.945447826385498, "epoch": 5.743435129352266, "grad_norm": 1.4921875, "learning_rate": 0.0002252007180692584, "loss": 4.9115, "mean_token_accuracy": 0.22193935215473176, "num_tokens": 128042556.0, "step": 73820 }, { "entropy": 5.977887153625488, "epoch": 5.743824158723983, "grad_norm": 1.4765625, "learning_rate": 0.00022517369023551654, "loss": 5.0272, "mean_token_accuracy": 0.2116738438606262, "num_tokens": 128051394.0, "step": 73825 }, { "entropy": 5.938125658035278, "epoch": 5.744213188095701, "grad_norm": 1.609375, "learning_rate": 0.00022514666315780963, "loss": 4.9043, "mean_token_accuracy": 0.21459803879261016, "num_tokens": 128059765.0, "step": 73830 }, { "entropy": 6.005118894577026, "epoch": 5.744602217467419, "grad_norm": 1.46875, "learning_rate": 0.00022511963683654774, "loss": 4.9195, "mean_token_accuracy": 0.22322259694337845, "num_tokens": 128068787.0, "step": 73835 }, { "entropy": 5.9656342506408695, "epoch": 5.744991246839136, "grad_norm": 1.5390625, "learning_rate": 0.00022509261127214098, "loss": 4.8749, "mean_token_accuracy": 0.21611988246440889, "num_tokens": 128077754.0, "step": 73840 }, { "entropy": 6.006128931045533, "epoch": 5.745380276210854, "grad_norm": 1.3515625, "learning_rate": 0.0002250655864649994, "loss": 4.9678, "mean_token_accuracy": 0.2157450407743454, "num_tokens": 128086798.0, "step": 73845 }, { "entropy": 5.921226072311401, "epoch": 5.745769305582572, "grad_norm": 1.53125, "learning_rate": 0.0002250385624155331, "loss": 4.8748, "mean_token_accuracy": 0.2248624712228775, "num_tokens": 128095349.0, "step": 73850 }, { "entropy": 5.932105255126953, "epoch": 5.7461583349542895, "grad_norm": 1.4296875, "learning_rate": 0.00022501153912415206, "loss": 4.9215, "mean_token_accuracy": 0.223323193192482, "num_tokens": 128104133.0, "step": 73855 }, { "entropy": 5.907842206954956, "epoch": 5.746547364326006, "grad_norm": 1.53125, "learning_rate": 0.00022498451659126639, "loss": 4.8295, "mean_token_accuracy": 0.22730852663516998, "num_tokens": 128112914.0, "step": 73860 }, { "entropy": 5.992288637161255, "epoch": 5.746936393697724, "grad_norm": 1.5078125, "learning_rate": 0.00022495749481728604, "loss": 4.9863, "mean_token_accuracy": 0.21637393087148665, "num_tokens": 128121296.0, "step": 73865 }, { "entropy": 5.981282424926758, "epoch": 5.747325423069442, "grad_norm": 1.515625, "learning_rate": 0.000224930473802621, "loss": 4.9126, "mean_token_accuracy": 0.21965936273336412, "num_tokens": 128130187.0, "step": 73870 }, { "entropy": 5.983903551101685, "epoch": 5.747714452441159, "grad_norm": 1.46875, "learning_rate": 0.00022490345354768138, "loss": 4.9357, "mean_token_accuracy": 0.21568517237901688, "num_tokens": 128139802.0, "step": 73875 }, { "entropy": 5.956787729263306, "epoch": 5.748103481812877, "grad_norm": 1.7421875, "learning_rate": 0.0002248764340528771, "loss": 4.8542, "mean_token_accuracy": 0.23148174285888673, "num_tokens": 128147902.0, "step": 73880 }, { "entropy": 6.013383245468139, "epoch": 5.748492511184595, "grad_norm": 1.5625, "learning_rate": 0.0002248494153186182, "loss": 5.0319, "mean_token_accuracy": 0.21431788057088852, "num_tokens": 128156268.0, "step": 73885 }, { "entropy": 6.011148262023926, "epoch": 5.748881540556312, "grad_norm": 1.5546875, "learning_rate": 0.00022482239734531462, "loss": 4.9778, "mean_token_accuracy": 0.21912100464105605, "num_tokens": 128164751.0, "step": 73890 }, { "entropy": 6.02691683769226, "epoch": 5.749270569928029, "grad_norm": 1.4921875, "learning_rate": 0.00022479538013337624, "loss": 4.9978, "mean_token_accuracy": 0.2184231996536255, "num_tokens": 128173782.0, "step": 73895 }, { "entropy": 6.062984418869019, "epoch": 5.749659599299747, "grad_norm": 1.4921875, "learning_rate": 0.00022476836368321302, "loss": 5.1419, "mean_token_accuracy": 0.20311890095472335, "num_tokens": 128182891.0, "step": 73900 }, { "entropy": 6.028166675567627, "epoch": 5.750048628671465, "grad_norm": 1.4296875, "learning_rate": 0.00022474134799523499, "loss": 4.9701, "mean_token_accuracy": 0.21794721037149428, "num_tokens": 128191157.0, "step": 73905 }, { "entropy": 5.967519092559814, "epoch": 5.750437658043182, "grad_norm": 1.5625, "learning_rate": 0.00022471433306985202, "loss": 4.9464, "mean_token_accuracy": 0.2215065613389015, "num_tokens": 128199904.0, "step": 73910 }, { "entropy": 5.932801961898804, "epoch": 5.7508266874149, "grad_norm": 1.5546875, "learning_rate": 0.00022468731890747397, "loss": 4.948, "mean_token_accuracy": 0.21921778321266175, "num_tokens": 128208190.0, "step": 73915 }, { "entropy": 5.9668622493743895, "epoch": 5.751215716786618, "grad_norm": 1.4453125, "learning_rate": 0.0002246603055085108, "loss": 4.9372, "mean_token_accuracy": 0.21764402985572814, "num_tokens": 128217375.0, "step": 73920 }, { "entropy": 6.030282068252563, "epoch": 5.751604746158335, "grad_norm": 1.5859375, "learning_rate": 0.00022463329287337235, "loss": 5.0262, "mean_token_accuracy": 0.21233670711517333, "num_tokens": 128227250.0, "step": 73925 }, { "entropy": 5.986766624450683, "epoch": 5.751993775530052, "grad_norm": 1.5703125, "learning_rate": 0.0002246062810024685, "loss": 4.9065, "mean_token_accuracy": 0.22450969219207764, "num_tokens": 128235080.0, "step": 73930 }, { "entropy": 5.9093952655792235, "epoch": 5.75238280490177, "grad_norm": 1.6171875, "learning_rate": 0.00022457926989620915, "loss": 4.7909, "mean_token_accuracy": 0.2274740844964981, "num_tokens": 128243978.0, "step": 73935 }, { "entropy": 5.929203987121582, "epoch": 5.752771834273488, "grad_norm": 1.5078125, "learning_rate": 0.00022455225955500408, "loss": 4.9502, "mean_token_accuracy": 0.22190335541963577, "num_tokens": 128253222.0, "step": 73940 }, { "entropy": 5.988745880126953, "epoch": 5.753160863645205, "grad_norm": 1.5078125, "learning_rate": 0.00022452524997926322, "loss": 4.9424, "mean_token_accuracy": 0.21600847244262694, "num_tokens": 128262209.0, "step": 73945 }, { "entropy": 6.0106785774230955, "epoch": 5.753549893016923, "grad_norm": 1.5, "learning_rate": 0.0002244982411693964, "loss": 4.9414, "mean_token_accuracy": 0.21476107388734816, "num_tokens": 128270507.0, "step": 73950 }, { "entropy": 5.951693916320801, "epoch": 5.75393892238864, "grad_norm": 1.4765625, "learning_rate": 0.0002244712331258133, "loss": 4.9362, "mean_token_accuracy": 0.21896999031305314, "num_tokens": 128279333.0, "step": 73955 }, { "entropy": 5.9365170955657955, "epoch": 5.754327951760358, "grad_norm": 1.5234375, "learning_rate": 0.0002244442258489238, "loss": 4.9952, "mean_token_accuracy": 0.2174038916826248, "num_tokens": 128288206.0, "step": 73960 }, { "entropy": 5.926932287216187, "epoch": 5.754716981132075, "grad_norm": 1.5234375, "learning_rate": 0.00022441721933913778, "loss": 4.9255, "mean_token_accuracy": 0.22017727941274642, "num_tokens": 128297047.0, "step": 73965 }, { "entropy": 5.99899001121521, "epoch": 5.755106010503793, "grad_norm": 1.7265625, "learning_rate": 0.000224390213596865, "loss": 4.976, "mean_token_accuracy": 0.229835844039917, "num_tokens": 128306072.0, "step": 73970 }, { "entropy": 5.970637512207031, "epoch": 5.755495039875511, "grad_norm": 1.4609375, "learning_rate": 0.0002243632086225151, "loss": 4.9532, "mean_token_accuracy": 0.22001931816339493, "num_tokens": 128314004.0, "step": 73975 }, { "entropy": 6.012783670425415, "epoch": 5.755884069247228, "grad_norm": 1.6015625, "learning_rate": 0.0002243362044164979, "loss": 4.9623, "mean_token_accuracy": 0.21459968984127045, "num_tokens": 128322889.0, "step": 73980 }, { "entropy": 6.000055932998658, "epoch": 5.756273098618946, "grad_norm": 1.4921875, "learning_rate": 0.00022430920097922313, "loss": 4.9894, "mean_token_accuracy": 0.21614200323820115, "num_tokens": 128331929.0, "step": 73985 }, { "entropy": 6.044557332992554, "epoch": 5.756662127990664, "grad_norm": 1.546875, "learning_rate": 0.00022428219831110063, "loss": 4.9377, "mean_token_accuracy": 0.22137764394283294, "num_tokens": 128340398.0, "step": 73990 }, { "entropy": 5.8930902004241945, "epoch": 5.757051157362381, "grad_norm": 1.5078125, "learning_rate": 0.00022425519641254, "loss": 4.9028, "mean_token_accuracy": 0.22109356373548508, "num_tokens": 128349195.0, "step": 73995 }, { "entropy": 5.952122545242309, "epoch": 5.757440186734098, "grad_norm": 1.4765625, "learning_rate": 0.00022422819528395094, "loss": 4.8931, "mean_token_accuracy": 0.22573360204696655, "num_tokens": 128357695.0, "step": 74000 }, { "entropy": 5.878929376602173, "epoch": 5.757829216105816, "grad_norm": 1.4296875, "learning_rate": 0.00022420119492574326, "loss": 4.8481, "mean_token_accuracy": 0.2337367594242096, "num_tokens": 128366959.0, "step": 74005 }, { "entropy": 6.002831649780274, "epoch": 5.758218245477534, "grad_norm": 1.4921875, "learning_rate": 0.00022417419533832662, "loss": 4.9705, "mean_token_accuracy": 0.21589026749134063, "num_tokens": 128376065.0, "step": 74010 }, { "entropy": 6.042919301986695, "epoch": 5.758607274849251, "grad_norm": 1.4765625, "learning_rate": 0.00022414719652211063, "loss": 5.0122, "mean_token_accuracy": 0.2203315779566765, "num_tokens": 128384974.0, "step": 74015 }, { "entropy": 5.938033771514893, "epoch": 5.758996304220968, "grad_norm": 1.5, "learning_rate": 0.00022412019847750498, "loss": 4.8922, "mean_token_accuracy": 0.2303795337677002, "num_tokens": 128393290.0, "step": 74020 }, { "entropy": 5.859355878829956, "epoch": 5.759385333592686, "grad_norm": 1.5703125, "learning_rate": 0.0002240932012049194, "loss": 4.8722, "mean_token_accuracy": 0.22061227709054948, "num_tokens": 128401392.0, "step": 74025 }, { "entropy": 5.94991250038147, "epoch": 5.759774362964404, "grad_norm": 1.6640625, "learning_rate": 0.0002240662047047634, "loss": 4.9303, "mean_token_accuracy": 0.22780146896839143, "num_tokens": 128409053.0, "step": 74030 }, { "entropy": 5.926258277893067, "epoch": 5.760163392336121, "grad_norm": 1.546875, "learning_rate": 0.00022403920897744672, "loss": 4.8586, "mean_token_accuracy": 0.22381449341773987, "num_tokens": 128417451.0, "step": 74035 }, { "entropy": 5.970511627197266, "epoch": 5.760552421707839, "grad_norm": 1.453125, "learning_rate": 0.0002240122140233789, "loss": 4.9255, "mean_token_accuracy": 0.22673526555299758, "num_tokens": 128426053.0, "step": 74040 }, { "entropy": 5.955502557754516, "epoch": 5.760941451079557, "grad_norm": 1.46875, "learning_rate": 0.0002239852198429696, "loss": 4.9463, "mean_token_accuracy": 0.22056055963039398, "num_tokens": 128434949.0, "step": 74045 }, { "entropy": 5.97566499710083, "epoch": 5.761330480451274, "grad_norm": 1.5703125, "learning_rate": 0.00022395822643662844, "loss": 5.0013, "mean_token_accuracy": 0.21395210921764374, "num_tokens": 128443830.0, "step": 74050 }, { "entropy": 6.018917226791382, "epoch": 5.761719509822992, "grad_norm": 1.59375, "learning_rate": 0.00022393123380476488, "loss": 4.9728, "mean_token_accuracy": 0.2152975931763649, "num_tokens": 128452055.0, "step": 74055 }, { "entropy": 6.004529190063477, "epoch": 5.762108539194709, "grad_norm": 1.6015625, "learning_rate": 0.00022390424194778858, "loss": 4.9567, "mean_token_accuracy": 0.21951660066843032, "num_tokens": 128460890.0, "step": 74060 }, { "entropy": 5.930108547210693, "epoch": 5.762497568566427, "grad_norm": 1.5546875, "learning_rate": 0.00022387725086610904, "loss": 4.9612, "mean_token_accuracy": 0.2253092870116234, "num_tokens": 128469474.0, "step": 74065 }, { "entropy": 6.038225507736206, "epoch": 5.762886597938144, "grad_norm": 1.5546875, "learning_rate": 0.0002238502605601358, "loss": 5.0244, "mean_token_accuracy": 0.21642083376646043, "num_tokens": 128478217.0, "step": 74070 }, { "entropy": 5.935362529754639, "epoch": 5.763275627309862, "grad_norm": 1.4921875, "learning_rate": 0.00022382327103027854, "loss": 4.9017, "mean_token_accuracy": 0.22184652835130692, "num_tokens": 128486640.0, "step": 74075 }, { "entropy": 5.9567564010620115, "epoch": 5.76366465668158, "grad_norm": 1.5390625, "learning_rate": 0.00022379628227694675, "loss": 4.9586, "mean_token_accuracy": 0.21578085124492646, "num_tokens": 128495460.0, "step": 74080 }, { "entropy": 5.99856276512146, "epoch": 5.764053686053297, "grad_norm": 1.5078125, "learning_rate": 0.00022376929430054982, "loss": 4.9821, "mean_token_accuracy": 0.21449815928936006, "num_tokens": 128504193.0, "step": 74085 }, { "entropy": 5.984014940261841, "epoch": 5.764442715425014, "grad_norm": 1.6484375, "learning_rate": 0.00022374230710149723, "loss": 4.9403, "mean_token_accuracy": 0.22657763063907624, "num_tokens": 128513775.0, "step": 74090 }, { "entropy": 6.015690517425537, "epoch": 5.764831744796732, "grad_norm": 1.5390625, "learning_rate": 0.00022371532068019863, "loss": 4.9521, "mean_token_accuracy": 0.22351000756025313, "num_tokens": 128523382.0, "step": 74095 }, { "entropy": 6.060959672927856, "epoch": 5.76522077416845, "grad_norm": 1.4765625, "learning_rate": 0.00022368833503706338, "loss": 5.0276, "mean_token_accuracy": 0.22141036689281463, "num_tokens": 128531951.0, "step": 74100 }, { "entropy": 6.008744478225708, "epoch": 5.765609803540167, "grad_norm": 1.4140625, "learning_rate": 0.000223661350172501, "loss": 5.0392, "mean_token_accuracy": 0.21202799677848816, "num_tokens": 128540847.0, "step": 74105 }, { "entropy": 5.909643745422363, "epoch": 5.765998832911885, "grad_norm": 1.65625, "learning_rate": 0.00022363436608692085, "loss": 4.8756, "mean_token_accuracy": 0.22227570563554763, "num_tokens": 128549479.0, "step": 74110 }, { "entropy": 5.899044227600098, "epoch": 5.766387862283603, "grad_norm": 1.5859375, "learning_rate": 0.0002236073827807325, "loss": 4.8055, "mean_token_accuracy": 0.2288249284029007, "num_tokens": 128558203.0, "step": 74115 }, { "entropy": 5.977974557876587, "epoch": 5.76677689165532, "grad_norm": 1.421875, "learning_rate": 0.0002235804002543453, "loss": 4.9157, "mean_token_accuracy": 0.2306768536567688, "num_tokens": 128567189.0, "step": 74120 }, { "entropy": 6.029678773880005, "epoch": 5.767165921027037, "grad_norm": 1.3984375, "learning_rate": 0.0002235534185081687, "loss": 5.0153, "mean_token_accuracy": 0.2117398649454117, "num_tokens": 128576159.0, "step": 74125 }, { "entropy": 6.025912570953369, "epoch": 5.767554950398755, "grad_norm": 1.65625, "learning_rate": 0.0002235264375426121, "loss": 5.0105, "mean_token_accuracy": 0.21395154744386674, "num_tokens": 128583893.0, "step": 74130 }, { "entropy": 5.972445297241211, "epoch": 5.767943979770473, "grad_norm": 1.578125, "learning_rate": 0.00022349945735808475, "loss": 4.8987, "mean_token_accuracy": 0.23024458438158035, "num_tokens": 128592455.0, "step": 74135 }, { "entropy": 5.900569486618042, "epoch": 5.76833300914219, "grad_norm": 1.640625, "learning_rate": 0.00022347247795499625, "loss": 4.8778, "mean_token_accuracy": 0.23239547610282899, "num_tokens": 128601754.0, "step": 74140 }, { "entropy": 5.987294101715088, "epoch": 5.768722038513908, "grad_norm": 1.4765625, "learning_rate": 0.00022344549933375597, "loss": 4.8811, "mean_token_accuracy": 0.22763680964708327, "num_tokens": 128609498.0, "step": 74145 }, { "entropy": 5.911344194412232, "epoch": 5.769111067885626, "grad_norm": 1.546875, "learning_rate": 0.00022341852149477309, "loss": 4.892, "mean_token_accuracy": 0.22397129088640214, "num_tokens": 128617906.0, "step": 74150 }, { "entropy": 5.9225921630859375, "epoch": 5.7695000972573425, "grad_norm": 1.5625, "learning_rate": 0.00022339154443845705, "loss": 4.9394, "mean_token_accuracy": 0.21992535889148712, "num_tokens": 128626375.0, "step": 74155 }, { "entropy": 5.957703113555908, "epoch": 5.76988912662906, "grad_norm": 1.46875, "learning_rate": 0.00022336456816521722, "loss": 4.9077, "mean_token_accuracy": 0.22036875337362288, "num_tokens": 128635009.0, "step": 74160 }, { "entropy": 5.996530628204345, "epoch": 5.770278156000778, "grad_norm": 1.4453125, "learning_rate": 0.0002233375926754629, "loss": 4.9128, "mean_token_accuracy": 0.21568868905305863, "num_tokens": 128643895.0, "step": 74165 }, { "entropy": 6.087753868103027, "epoch": 5.770667185372496, "grad_norm": 1.5234375, "learning_rate": 0.00022331061796960328, "loss": 5.1089, "mean_token_accuracy": 0.20633645951747895, "num_tokens": 128652271.0, "step": 74170 }, { "entropy": 5.9094460010528564, "epoch": 5.771056214744213, "grad_norm": 1.453125, "learning_rate": 0.00022328364404804784, "loss": 4.8733, "mean_token_accuracy": 0.2230027586221695, "num_tokens": 128661366.0, "step": 74175 }, { "entropy": 5.920444536209106, "epoch": 5.771445244115931, "grad_norm": 1.625, "learning_rate": 0.00022325667091120576, "loss": 4.9196, "mean_token_accuracy": 0.2127443879842758, "num_tokens": 128669517.0, "step": 74180 }, { "entropy": 5.954239988327027, "epoch": 5.771834273487649, "grad_norm": 1.5234375, "learning_rate": 0.00022322969855948638, "loss": 4.9547, "mean_token_accuracy": 0.22198956310749055, "num_tokens": 128679064.0, "step": 74185 }, { "entropy": 5.97049126625061, "epoch": 5.772223302859366, "grad_norm": 1.5, "learning_rate": 0.00022320272699329885, "loss": 4.956, "mean_token_accuracy": 0.22241855561733245, "num_tokens": 128687547.0, "step": 74190 }, { "entropy": 5.97144193649292, "epoch": 5.772612332231083, "grad_norm": 1.6328125, "learning_rate": 0.00022317575621305254, "loss": 4.991, "mean_token_accuracy": 0.2125887766480446, "num_tokens": 128696519.0, "step": 74195 }, { "entropy": 6.0282642364501955, "epoch": 5.773001361602801, "grad_norm": 1.5859375, "learning_rate": 0.00022314878621915656, "loss": 4.9808, "mean_token_accuracy": 0.22029686570167542, "num_tokens": 128705093.0, "step": 74200 }, { "entropy": 6.009080839157105, "epoch": 5.773390390974519, "grad_norm": 1.4921875, "learning_rate": 0.00022312181701202033, "loss": 4.9164, "mean_token_accuracy": 0.22363196462392806, "num_tokens": 128715094.0, "step": 74205 }, { "entropy": 6.012739515304565, "epoch": 5.773779420346236, "grad_norm": 1.453125, "learning_rate": 0.00022309484859205293, "loss": 4.9982, "mean_token_accuracy": 0.21884559392929076, "num_tokens": 128724202.0, "step": 74210 }, { "entropy": 5.953884315490723, "epoch": 5.774168449717954, "grad_norm": 1.4140625, "learning_rate": 0.00022306788095966356, "loss": 4.8644, "mean_token_accuracy": 0.22896973490715028, "num_tokens": 128732793.0, "step": 74215 }, { "entropy": 6.004562330245972, "epoch": 5.774557479089672, "grad_norm": 1.765625, "learning_rate": 0.00022304091411526144, "loss": 5.0081, "mean_token_accuracy": 0.21928359419107438, "num_tokens": 128742114.0, "step": 74220 }, { "entropy": 5.955711698532104, "epoch": 5.7749465084613885, "grad_norm": 1.5, "learning_rate": 0.0002230139480592558, "loss": 4.9448, "mean_token_accuracy": 0.21268683671951294, "num_tokens": 128751129.0, "step": 74225 }, { "entropy": 6.019234466552734, "epoch": 5.775335537833106, "grad_norm": 1.6015625, "learning_rate": 0.00022298698279205571, "loss": 5.0379, "mean_token_accuracy": 0.2128247231245041, "num_tokens": 128759929.0, "step": 74230 }, { "entropy": 6.046534776687622, "epoch": 5.775724567204824, "grad_norm": 1.390625, "learning_rate": 0.00022296001831407036, "loss": 4.9797, "mean_token_accuracy": 0.21412660777568818, "num_tokens": 128768069.0, "step": 74235 }, { "entropy": 5.95254225730896, "epoch": 5.7761135965765416, "grad_norm": 1.53125, "learning_rate": 0.00022293305462570896, "loss": 4.9105, "mean_token_accuracy": 0.2199403628706932, "num_tokens": 128776590.0, "step": 74240 }, { "entropy": 5.979356050491333, "epoch": 5.776502625948259, "grad_norm": 1.5625, "learning_rate": 0.00022290609172738058, "loss": 4.9234, "mean_token_accuracy": 0.2163197547197342, "num_tokens": 128785407.0, "step": 74245 }, { "entropy": 5.977344512939453, "epoch": 5.776891655319977, "grad_norm": 1.578125, "learning_rate": 0.00022287912961949425, "loss": 5.0382, "mean_token_accuracy": 0.21667649894952773, "num_tokens": 128794357.0, "step": 74250 }, { "entropy": 5.979211664199829, "epoch": 5.777280684691695, "grad_norm": 1.5, "learning_rate": 0.00022285216830245924, "loss": 4.9693, "mean_token_accuracy": 0.21672483533620834, "num_tokens": 128803435.0, "step": 74255 }, { "entropy": 5.901760005950928, "epoch": 5.7776697140634115, "grad_norm": 1.546875, "learning_rate": 0.0002228252077766846, "loss": 4.8221, "mean_token_accuracy": 0.2268456280231476, "num_tokens": 128811898.0, "step": 74260 }, { "entropy": 6.054072761535645, "epoch": 5.778058743435129, "grad_norm": 1.546875, "learning_rate": 0.0002227982480425793, "loss": 5.0136, "mean_token_accuracy": 0.21808566749095917, "num_tokens": 128821607.0, "step": 74265 }, { "entropy": 5.9550083637237545, "epoch": 5.778447772806847, "grad_norm": 1.484375, "learning_rate": 0.0002227712891005525, "loss": 4.9007, "mean_token_accuracy": 0.22599513828754425, "num_tokens": 128830520.0, "step": 74270 }, { "entropy": 5.948575210571289, "epoch": 5.7788368021785645, "grad_norm": 1.640625, "learning_rate": 0.00022274433095101332, "loss": 4.8819, "mean_token_accuracy": 0.22165126204490662, "num_tokens": 128838963.0, "step": 74275 }, { "entropy": 5.961292695999146, "epoch": 5.779225831550282, "grad_norm": 1.4453125, "learning_rate": 0.00022271737359437073, "loss": 4.9163, "mean_token_accuracy": 0.22529024332761766, "num_tokens": 128848398.0, "step": 74280 }, { "entropy": 6.02721471786499, "epoch": 5.779614860922, "grad_norm": 1.5703125, "learning_rate": 0.00022269041703103375, "loss": 4.9627, "mean_token_accuracy": 0.22163235247135163, "num_tokens": 128857030.0, "step": 74285 }, { "entropy": 5.881620073318482, "epoch": 5.780003890293717, "grad_norm": 1.46875, "learning_rate": 0.00022266346126141145, "loss": 4.8527, "mean_token_accuracy": 0.23045167177915574, "num_tokens": 128866097.0, "step": 74290 }, { "entropy": 5.910781764984131, "epoch": 5.7803929196654344, "grad_norm": 1.3984375, "learning_rate": 0.0002226365062859128, "loss": 4.7693, "mean_token_accuracy": 0.23547940701246262, "num_tokens": 128874320.0, "step": 74295 }, { "entropy": 5.915812253952026, "epoch": 5.780781949037152, "grad_norm": 1.40625, "learning_rate": 0.00022260955210494688, "loss": 4.862, "mean_token_accuracy": 0.22532907724380494, "num_tokens": 128882309.0, "step": 74300 }, { "entropy": 5.9534656524658205, "epoch": 5.78117097840887, "grad_norm": 1.6171875, "learning_rate": 0.00022258259871892256, "loss": 4.9971, "mean_token_accuracy": 0.21490557491779327, "num_tokens": 128891313.0, "step": 74305 }, { "entropy": 5.988818883895874, "epoch": 5.7815600077805875, "grad_norm": 1.5390625, "learning_rate": 0.0002225556461282489, "loss": 4.96, "mean_token_accuracy": 0.21611177325248718, "num_tokens": 128899935.0, "step": 74310 }, { "entropy": 6.042578983306885, "epoch": 5.781949037152305, "grad_norm": 1.3828125, "learning_rate": 0.00022252869433333483, "loss": 5.0399, "mean_token_accuracy": 0.21017520129680634, "num_tokens": 128909048.0, "step": 74315 }, { "entropy": 5.974864339828491, "epoch": 5.782338066524023, "grad_norm": 1.453125, "learning_rate": 0.0002225017433345894, "loss": 4.9587, "mean_token_accuracy": 0.21120716482400895, "num_tokens": 128918350.0, "step": 74320 }, { "entropy": 6.004842472076416, "epoch": 5.78272709589574, "grad_norm": 1.5234375, "learning_rate": 0.00022247479313242135, "loss": 4.9389, "mean_token_accuracy": 0.2227520987391472, "num_tokens": 128926579.0, "step": 74325 }, { "entropy": 5.956453514099121, "epoch": 5.783116125267457, "grad_norm": 1.5703125, "learning_rate": 0.00022244784372723976, "loss": 4.8808, "mean_token_accuracy": 0.227315816283226, "num_tokens": 128935117.0, "step": 74330 }, { "entropy": 5.895151424407959, "epoch": 5.783505154639175, "grad_norm": 1.515625, "learning_rate": 0.00022242089511945336, "loss": 4.8401, "mean_token_accuracy": 0.22679676562547685, "num_tokens": 128943639.0, "step": 74335 }, { "entropy": 5.986280012130737, "epoch": 5.783894184010893, "grad_norm": 1.46875, "learning_rate": 0.00022239394730947127, "loss": 4.9684, "mean_token_accuracy": 0.21992597579956055, "num_tokens": 128952163.0, "step": 74340 }, { "entropy": 5.906219244003296, "epoch": 5.7842832133826105, "grad_norm": 1.4921875, "learning_rate": 0.00022236700029770235, "loss": 4.8696, "mean_token_accuracy": 0.22599049359560014, "num_tokens": 128960705.0, "step": 74345 }, { "entropy": 5.962341737747193, "epoch": 5.784672242754328, "grad_norm": 1.609375, "learning_rate": 0.00022234005408455543, "loss": 4.91, "mean_token_accuracy": 0.22650137841701506, "num_tokens": 128971127.0, "step": 74350 }, { "entropy": 6.00708794593811, "epoch": 5.785061272126045, "grad_norm": 1.6796875, "learning_rate": 0.00022231310867043934, "loss": 5.0603, "mean_token_accuracy": 0.21395664811134338, "num_tokens": 128981181.0, "step": 74355 }, { "entropy": 5.989402532577515, "epoch": 5.785450301497763, "grad_norm": 1.5, "learning_rate": 0.00022228616405576296, "loss": 4.9285, "mean_token_accuracy": 0.22056756764650345, "num_tokens": 128989136.0, "step": 74360 }, { "entropy": 6.0663048267364506, "epoch": 5.78583933086948, "grad_norm": 1.578125, "learning_rate": 0.00022225922024093515, "loss": 4.9935, "mean_token_accuracy": 0.21976594477891923, "num_tokens": 128997866.0, "step": 74365 }, { "entropy": 6.040359973907471, "epoch": 5.786228360241198, "grad_norm": 1.5390625, "learning_rate": 0.00022223227722636474, "loss": 4.9283, "mean_token_accuracy": 0.22389977425336838, "num_tokens": 129006332.0, "step": 74370 }, { "entropy": 5.957034969329834, "epoch": 5.786617389612916, "grad_norm": 1.6328125, "learning_rate": 0.00022220533501246049, "loss": 4.8926, "mean_token_accuracy": 0.22728656083345414, "num_tokens": 129014604.0, "step": 74375 }, { "entropy": 5.845887136459351, "epoch": 5.7870064189846335, "grad_norm": 1.625, "learning_rate": 0.00022217839359963133, "loss": 4.866, "mean_token_accuracy": 0.22101878821849824, "num_tokens": 129022754.0, "step": 74380 }, { "entropy": 5.914460277557373, "epoch": 5.787395448356351, "grad_norm": 1.4609375, "learning_rate": 0.00022215145298828587, "loss": 4.8693, "mean_token_accuracy": 0.22014544606208802, "num_tokens": 129031617.0, "step": 74385 }, { "entropy": 5.9735533714294435, "epoch": 5.787784477728069, "grad_norm": 1.5859375, "learning_rate": 0.0002221245131788331, "loss": 4.8313, "mean_token_accuracy": 0.22528285086154937, "num_tokens": 129040197.0, "step": 74390 }, { "entropy": 5.976630067825317, "epoch": 5.788173507099786, "grad_norm": 1.453125, "learning_rate": 0.0002220975741716816, "loss": 4.9154, "mean_token_accuracy": 0.22415462136268616, "num_tokens": 129048975.0, "step": 74395 }, { "entropy": 5.967725944519043, "epoch": 5.788562536471503, "grad_norm": 1.5859375, "learning_rate": 0.0002220706359672402, "loss": 4.8491, "mean_token_accuracy": 0.22340276688337327, "num_tokens": 129056804.0, "step": 74400 }, { "entropy": 5.973757028579712, "epoch": 5.788951565843221, "grad_norm": 1.3984375, "learning_rate": 0.00022204369856591765, "loss": 4.9832, "mean_token_accuracy": 0.21980056911706924, "num_tokens": 129065426.0, "step": 74405 }, { "entropy": 5.988022089004517, "epoch": 5.789340595214939, "grad_norm": 1.5625, "learning_rate": 0.00022201676196812275, "loss": 4.9987, "mean_token_accuracy": 0.21796843111515046, "num_tokens": 129073935.0, "step": 74410 }, { "entropy": 5.927433776855469, "epoch": 5.7897296245866565, "grad_norm": 1.515625, "learning_rate": 0.00022198982617426417, "loss": 4.9454, "mean_token_accuracy": 0.21734785586595534, "num_tokens": 129082823.0, "step": 74415 }, { "entropy": 6.050788307189942, "epoch": 5.790118653958374, "grad_norm": 1.75, "learning_rate": 0.00022196289118475056, "loss": 4.9938, "mean_token_accuracy": 0.21520411372184753, "num_tokens": 129092309.0, "step": 74420 }, { "entropy": 5.938680648803711, "epoch": 5.790507683330091, "grad_norm": 1.453125, "learning_rate": 0.00022193595699999063, "loss": 4.8624, "mean_token_accuracy": 0.22673131227493287, "num_tokens": 129100892.0, "step": 74425 }, { "entropy": 6.017592716217041, "epoch": 5.790896712701809, "grad_norm": 1.5703125, "learning_rate": 0.00022190902362039316, "loss": 5.0243, "mean_token_accuracy": 0.21443244814872742, "num_tokens": 129110331.0, "step": 74430 }, { "entropy": 5.98145170211792, "epoch": 5.791285742073526, "grad_norm": 1.5859375, "learning_rate": 0.00022188209104636675, "loss": 5.0287, "mean_token_accuracy": 0.20809046030044556, "num_tokens": 129119066.0, "step": 74435 }, { "entropy": 5.9320793628692625, "epoch": 5.791674771445244, "grad_norm": 1.5078125, "learning_rate": 0.00022185515927832, "loss": 4.9011, "mean_token_accuracy": 0.2259317457675934, "num_tokens": 129127612.0, "step": 74440 }, { "entropy": 5.989129161834716, "epoch": 5.792063800816962, "grad_norm": 1.421875, "learning_rate": 0.00022182822831666167, "loss": 4.9698, "mean_token_accuracy": 0.2177804470062256, "num_tokens": 129136385.0, "step": 74445 }, { "entropy": 5.984185743331909, "epoch": 5.7924528301886795, "grad_norm": 1.484375, "learning_rate": 0.00022180129816180033, "loss": 4.9121, "mean_token_accuracy": 0.2214762508869171, "num_tokens": 129145918.0, "step": 74450 }, { "entropy": 5.952899503707886, "epoch": 5.792841859560397, "grad_norm": 1.5234375, "learning_rate": 0.00022177436881414458, "loss": 4.978, "mean_token_accuracy": 0.21036597490310668, "num_tokens": 129155234.0, "step": 74455 }, { "entropy": 6.007909202575684, "epoch": 5.793230888932114, "grad_norm": 1.53125, "learning_rate": 0.00022174744027410315, "loss": 4.8813, "mean_token_accuracy": 0.23109251409769058, "num_tokens": 129163113.0, "step": 74460 }, { "entropy": 6.000672197341919, "epoch": 5.793619918303832, "grad_norm": 1.484375, "learning_rate": 0.00022172051254208442, "loss": 4.9663, "mean_token_accuracy": 0.22267835587263107, "num_tokens": 129172020.0, "step": 74465 }, { "entropy": 5.9690320014953615, "epoch": 5.794008947675549, "grad_norm": 1.5390625, "learning_rate": 0.00022169358561849724, "loss": 4.8817, "mean_token_accuracy": 0.2194139301776886, "num_tokens": 129180869.0, "step": 74470 }, { "entropy": 6.025505542755127, "epoch": 5.794397977047267, "grad_norm": 1.640625, "learning_rate": 0.00022166665950374998, "loss": 5.074, "mean_token_accuracy": 0.21208372265100478, "num_tokens": 129189557.0, "step": 74475 }, { "entropy": 5.971070241928101, "epoch": 5.794787006418985, "grad_norm": 1.578125, "learning_rate": 0.00022163973419825128, "loss": 4.9716, "mean_token_accuracy": 0.21518829166889192, "num_tokens": 129198524.0, "step": 74480 }, { "entropy": 6.012900972366333, "epoch": 5.7951760357907025, "grad_norm": 1.5390625, "learning_rate": 0.0002216128097024097, "loss": 4.9832, "mean_token_accuracy": 0.21429242491722106, "num_tokens": 129207119.0, "step": 74485 }, { "entropy": 5.93060827255249, "epoch": 5.795565065162419, "grad_norm": 1.4921875, "learning_rate": 0.00022158588601663376, "loss": 4.8506, "mean_token_accuracy": 0.22371262907981873, "num_tokens": 129214886.0, "step": 74490 }, { "entropy": 5.922150182723999, "epoch": 5.795954094534137, "grad_norm": 1.5, "learning_rate": 0.00022155896314133194, "loss": 4.8942, "mean_token_accuracy": 0.21472203582525254, "num_tokens": 129223638.0, "step": 74495 }, { "entropy": 5.911415004730225, "epoch": 5.796343123905855, "grad_norm": 1.5390625, "learning_rate": 0.00022153204107691287, "loss": 4.9324, "mean_token_accuracy": 0.2171951174736023, "num_tokens": 129232157.0, "step": 74500 }, { "entropy": 5.9966139793396, "epoch": 5.796732153277572, "grad_norm": 1.5546875, "learning_rate": 0.00022150511982378491, "loss": 5.0686, "mean_token_accuracy": 0.2092237040400505, "num_tokens": 129241067.0, "step": 74505 }, { "entropy": 6.022087669372558, "epoch": 5.79712118264929, "grad_norm": 1.5, "learning_rate": 0.0002214781993823567, "loss": 4.9621, "mean_token_accuracy": 0.2258890151977539, "num_tokens": 129249222.0, "step": 74510 }, { "entropy": 5.973256778717041, "epoch": 5.797510212021008, "grad_norm": 1.4375, "learning_rate": 0.00022145127975303658, "loss": 4.8931, "mean_token_accuracy": 0.2184516504406929, "num_tokens": 129258103.0, "step": 74515 }, { "entropy": 5.986192083358764, "epoch": 5.7978992413927255, "grad_norm": 1.5703125, "learning_rate": 0.00022142436093623304, "loss": 4.8993, "mean_token_accuracy": 0.2264567032456398, "num_tokens": 129265651.0, "step": 74520 }, { "entropy": 5.963683605194092, "epoch": 5.798288270764443, "grad_norm": 1.5859375, "learning_rate": 0.00022139744293235453, "loss": 5.0253, "mean_token_accuracy": 0.21307792961597444, "num_tokens": 129274608.0, "step": 74525 }, { "entropy": 5.960446834564209, "epoch": 5.79867730013616, "grad_norm": 1.5625, "learning_rate": 0.00022137052574180955, "loss": 4.9307, "mean_token_accuracy": 0.21911882013082504, "num_tokens": 129283123.0, "step": 74530 }, { "entropy": 5.961977863311768, "epoch": 5.799066329507878, "grad_norm": 1.515625, "learning_rate": 0.00022134360936500636, "loss": 4.8515, "mean_token_accuracy": 0.22168502658605577, "num_tokens": 129291663.0, "step": 74535 }, { "entropy": 5.9627532958984375, "epoch": 5.799455358879595, "grad_norm": 1.609375, "learning_rate": 0.00022131669380235364, "loss": 4.9155, "mean_token_accuracy": 0.21777227967977525, "num_tokens": 129300213.0, "step": 74540 }, { "entropy": 6.0190352439880375, "epoch": 5.799844388251313, "grad_norm": 1.4375, "learning_rate": 0.00022128977905425955, "loss": 5.0507, "mean_token_accuracy": 0.21483851075172425, "num_tokens": 129308128.0, "step": 74545 }, { "entropy": 5.935274982452393, "epoch": 5.800233417623031, "grad_norm": 1.5390625, "learning_rate": 0.00022126286512113265, "loss": 4.8399, "mean_token_accuracy": 0.22432650476694108, "num_tokens": 129316121.0, "step": 74550 }, { "entropy": 5.970142412185669, "epoch": 5.800622446994748, "grad_norm": 1.4921875, "learning_rate": 0.0002212359520033812, "loss": 4.9402, "mean_token_accuracy": 0.2170947641134262, "num_tokens": 129324474.0, "step": 74555 }, { "entropy": 5.9086161136627195, "epoch": 5.801011476366465, "grad_norm": 1.4921875, "learning_rate": 0.00022120903970141364, "loss": 4.9128, "mean_token_accuracy": 0.22303399592638015, "num_tokens": 129332808.0, "step": 74560 }, { "entropy": 5.992447566986084, "epoch": 5.801400505738183, "grad_norm": 1.6171875, "learning_rate": 0.00022118212821563827, "loss": 5.0102, "mean_token_accuracy": 0.2226722940802574, "num_tokens": 129340668.0, "step": 74565 }, { "entropy": 5.958662986755371, "epoch": 5.801789535109901, "grad_norm": 1.53125, "learning_rate": 0.00022115521754646346, "loss": 5.0065, "mean_token_accuracy": 0.21348714977502822, "num_tokens": 129348557.0, "step": 74570 }, { "entropy": 5.9620596408844, "epoch": 5.802178564481618, "grad_norm": 1.4140625, "learning_rate": 0.00022112830769429744, "loss": 4.8813, "mean_token_accuracy": 0.2182161405682564, "num_tokens": 129357190.0, "step": 74575 }, { "entropy": 5.983040618896484, "epoch": 5.802567593853336, "grad_norm": 1.4453125, "learning_rate": 0.00022110139865954865, "loss": 4.938, "mean_token_accuracy": 0.21999209523200988, "num_tokens": 129365180.0, "step": 74580 }, { "entropy": 6.048008441925049, "epoch": 5.802956623225054, "grad_norm": 1.390625, "learning_rate": 0.0002210744904426254, "loss": 4.9882, "mean_token_accuracy": 0.21842924505472183, "num_tokens": 129374038.0, "step": 74585 }, { "entropy": 5.991805171966552, "epoch": 5.8033456525967715, "grad_norm": 1.5859375, "learning_rate": 0.0002210475830439359, "loss": 4.9205, "mean_token_accuracy": 0.22405851930379866, "num_tokens": 129382511.0, "step": 74590 }, { "entropy": 5.959285497665405, "epoch": 5.803734681968488, "grad_norm": 1.5390625, "learning_rate": 0.00022102067646388845, "loss": 4.9438, "mean_token_accuracy": 0.21658312976360322, "num_tokens": 129391309.0, "step": 74595 }, { "entropy": 5.992723846435547, "epoch": 5.804123711340206, "grad_norm": 1.5234375, "learning_rate": 0.00022099377070289124, "loss": 5.0672, "mean_token_accuracy": 0.20857247859239578, "num_tokens": 129401090.0, "step": 74600 }, { "entropy": 6.005412864685058, "epoch": 5.804512740711924, "grad_norm": 1.5, "learning_rate": 0.00022096686576135268, "loss": 4.9172, "mean_token_accuracy": 0.222334323823452, "num_tokens": 129409890.0, "step": 74605 }, { "entropy": 6.039430284500122, "epoch": 5.804901770083641, "grad_norm": 1.5, "learning_rate": 0.00022093996163968088, "loss": 5.0355, "mean_token_accuracy": 0.2135229155421257, "num_tokens": 129418440.0, "step": 74610 }, { "entropy": 6.070140790939331, "epoch": 5.805290799455359, "grad_norm": 1.46875, "learning_rate": 0.00022091305833828412, "loss": 5.0526, "mean_token_accuracy": 0.21326230615377426, "num_tokens": 129427518.0, "step": 74615 }, { "entropy": 5.894359302520752, "epoch": 5.805679828827077, "grad_norm": 1.3984375, "learning_rate": 0.00022088615585757072, "loss": 4.8637, "mean_token_accuracy": 0.2253113105893135, "num_tokens": 129435720.0, "step": 74620 }, { "entropy": 5.961225461959839, "epoch": 5.806068858198794, "grad_norm": 1.4921875, "learning_rate": 0.00022085925419794872, "loss": 4.9098, "mean_token_accuracy": 0.22265677154064178, "num_tokens": 129443900.0, "step": 74625 }, { "entropy": 5.9214503288269045, "epoch": 5.806457887570511, "grad_norm": 1.4609375, "learning_rate": 0.00022083235335982633, "loss": 4.887, "mean_token_accuracy": 0.2305159643292427, "num_tokens": 129452626.0, "step": 74630 }, { "entropy": 5.9452403545379635, "epoch": 5.806846916942229, "grad_norm": 1.46875, "learning_rate": 0.00022080545334361175, "loss": 4.9358, "mean_token_accuracy": 0.22646720707416534, "num_tokens": 129461672.0, "step": 74635 }, { "entropy": 5.977540063858032, "epoch": 5.807235946313947, "grad_norm": 1.4765625, "learning_rate": 0.0002207785541497132, "loss": 4.9935, "mean_token_accuracy": 0.21779861450195312, "num_tokens": 129470647.0, "step": 74640 }, { "entropy": 6.000776863098144, "epoch": 5.807624975685664, "grad_norm": 1.4453125, "learning_rate": 0.00022075165577853872, "loss": 4.9614, "mean_token_accuracy": 0.21805160492658615, "num_tokens": 129479501.0, "step": 74645 }, { "entropy": 6.004046058654785, "epoch": 5.808014005057382, "grad_norm": 1.546875, "learning_rate": 0.0002207247582304966, "loss": 4.9448, "mean_token_accuracy": 0.22690936625003816, "num_tokens": 129487999.0, "step": 74650 }, { "entropy": 6.000285005569458, "epoch": 5.8084030344291, "grad_norm": 1.53125, "learning_rate": 0.00022069786150599486, "loss": 4.9703, "mean_token_accuracy": 0.21706788390874862, "num_tokens": 129496334.0, "step": 74655 }, { "entropy": 5.987415170669555, "epoch": 5.808792063800817, "grad_norm": 1.4765625, "learning_rate": 0.00022067096560544165, "loss": 4.983, "mean_token_accuracy": 0.20947948545217515, "num_tokens": 129505042.0, "step": 74660 }, { "entropy": 5.96248984336853, "epoch": 5.809181093172534, "grad_norm": 1.515625, "learning_rate": 0.00022064407052924494, "loss": 4.9111, "mean_token_accuracy": 0.2145792618393898, "num_tokens": 129514228.0, "step": 74665 }, { "entropy": 5.90454626083374, "epoch": 5.809570122544252, "grad_norm": 1.5546875, "learning_rate": 0.00022061717627781308, "loss": 4.8735, "mean_token_accuracy": 0.2274075046181679, "num_tokens": 129522346.0, "step": 74670 }, { "entropy": 5.940846633911133, "epoch": 5.80995915191597, "grad_norm": 1.5703125, "learning_rate": 0.00022059028285155397, "loss": 4.9042, "mean_token_accuracy": 0.22727851569652557, "num_tokens": 129531160.0, "step": 74675 }, { "entropy": 6.022503471374511, "epoch": 5.810348181287687, "grad_norm": 1.625, "learning_rate": 0.00022056339025087573, "loss": 4.9828, "mean_token_accuracy": 0.21539098024368286, "num_tokens": 129539809.0, "step": 74680 }, { "entropy": 6.0160809516906735, "epoch": 5.810737210659405, "grad_norm": 1.359375, "learning_rate": 0.0002205364984761864, "loss": 4.986, "mean_token_accuracy": 0.21632646173238754, "num_tokens": 129548645.0, "step": 74685 }, { "entropy": 5.937717771530151, "epoch": 5.811126240031122, "grad_norm": 1.515625, "learning_rate": 0.000220509607527894, "loss": 4.8625, "mean_token_accuracy": 0.22783505618572236, "num_tokens": 129557648.0, "step": 74690 }, { "entropy": 5.951441097259521, "epoch": 5.81151526940284, "grad_norm": 1.59375, "learning_rate": 0.0002204827174064066, "loss": 4.9575, "mean_token_accuracy": 0.21695807427167893, "num_tokens": 129567171.0, "step": 74695 }, { "entropy": 5.980539846420288, "epoch": 5.811904298774557, "grad_norm": 1.5703125, "learning_rate": 0.00022045582811213221, "loss": 5.0013, "mean_token_accuracy": 0.21406418979167938, "num_tokens": 129575942.0, "step": 74700 }, { "entropy": 5.97846736907959, "epoch": 5.812293328146275, "grad_norm": 1.4296875, "learning_rate": 0.00022042893964547877, "loss": 4.9269, "mean_token_accuracy": 0.21719594597816466, "num_tokens": 129584404.0, "step": 74705 }, { "entropy": 5.991814422607422, "epoch": 5.812682357517993, "grad_norm": 1.3984375, "learning_rate": 0.0002204020520068543, "loss": 4.9364, "mean_token_accuracy": 0.21474804878234863, "num_tokens": 129593714.0, "step": 74710 }, { "entropy": 5.912239694595337, "epoch": 5.81307138688971, "grad_norm": 1.453125, "learning_rate": 0.00022037516519666684, "loss": 4.8634, "mean_token_accuracy": 0.22384639829397202, "num_tokens": 129602307.0, "step": 74715 }, { "entropy": 5.956178474426269, "epoch": 5.813460416261428, "grad_norm": 1.5703125, "learning_rate": 0.0002203482792153243, "loss": 4.9721, "mean_token_accuracy": 0.21578607708215714, "num_tokens": 129611193.0, "step": 74720 }, { "entropy": 5.982153606414795, "epoch": 5.813849445633146, "grad_norm": 1.46875, "learning_rate": 0.0002203213940632346, "loss": 4.9838, "mean_token_accuracy": 0.2152566209435463, "num_tokens": 129619976.0, "step": 74725 }, { "entropy": 5.971900177001953, "epoch": 5.814238475004863, "grad_norm": 1.4453125, "learning_rate": 0.00022029450974080572, "loss": 4.8968, "mean_token_accuracy": 0.21895099431276321, "num_tokens": 129629177.0, "step": 74730 }, { "entropy": 5.9613972187042235, "epoch": 5.81462750437658, "grad_norm": 1.7109375, "learning_rate": 0.00022026762624844555, "loss": 4.9334, "mean_token_accuracy": 0.21793029457330704, "num_tokens": 129637295.0, "step": 74735 }, { "entropy": 5.972036647796631, "epoch": 5.815016533748298, "grad_norm": 1.53125, "learning_rate": 0.00022024074358656205, "loss": 4.9745, "mean_token_accuracy": 0.21856921762228013, "num_tokens": 129646050.0, "step": 74740 }, { "entropy": 6.001359748840332, "epoch": 5.815405563120016, "grad_norm": 1.5859375, "learning_rate": 0.00022021386175556318, "loss": 4.9333, "mean_token_accuracy": 0.21905555278062822, "num_tokens": 129654982.0, "step": 74745 }, { "entropy": 5.957924270629883, "epoch": 5.815794592491733, "grad_norm": 1.5234375, "learning_rate": 0.0002201869807558567, "loss": 4.9399, "mean_token_accuracy": 0.22014482468366622, "num_tokens": 129663611.0, "step": 74750 }, { "entropy": 6.043409061431885, "epoch": 5.816183621863451, "grad_norm": 1.578125, "learning_rate": 0.00022016010058785053, "loss": 5.0688, "mean_token_accuracy": 0.21099483370780944, "num_tokens": 129672076.0, "step": 74755 }, { "entropy": 5.960317611694336, "epoch": 5.816572651235168, "grad_norm": 1.5078125, "learning_rate": 0.00022013322125195256, "loss": 4.9653, "mean_token_accuracy": 0.22158870249986648, "num_tokens": 129681234.0, "step": 74760 }, { "entropy": 6.025253200531006, "epoch": 5.816961680606886, "grad_norm": 1.5078125, "learning_rate": 0.0002201063427485706, "loss": 4.9594, "mean_token_accuracy": 0.21399749368429183, "num_tokens": 129689602.0, "step": 74765 }, { "entropy": 5.995745086669922, "epoch": 5.817350709978603, "grad_norm": 1.4375, "learning_rate": 0.0002200794650781126, "loss": 4.8994, "mean_token_accuracy": 0.2258068934082985, "num_tokens": 129698614.0, "step": 74770 }, { "entropy": 6.042575836181641, "epoch": 5.817739739350321, "grad_norm": 1.5625, "learning_rate": 0.00022005258824098624, "loss": 5.0112, "mean_token_accuracy": 0.2115415647625923, "num_tokens": 129707167.0, "step": 74775 }, { "entropy": 6.032680416107178, "epoch": 5.818128768722039, "grad_norm": 1.4765625, "learning_rate": 0.0002200257122375995, "loss": 4.9978, "mean_token_accuracy": 0.21499050110578538, "num_tokens": 129715257.0, "step": 74780 }, { "entropy": 5.912034225463867, "epoch": 5.818517798093756, "grad_norm": 1.4453125, "learning_rate": 0.00021999883706835994, "loss": 4.8439, "mean_token_accuracy": 0.22459196895360947, "num_tokens": 129724593.0, "step": 74785 }, { "entropy": 5.920084285736084, "epoch": 5.818906827465474, "grad_norm": 1.4921875, "learning_rate": 0.00021997196273367553, "loss": 4.9023, "mean_token_accuracy": 0.22555151730775833, "num_tokens": 129733255.0, "step": 74790 }, { "entropy": 5.92941107749939, "epoch": 5.819295856837191, "grad_norm": 1.484375, "learning_rate": 0.000219945089233954, "loss": 4.8622, "mean_token_accuracy": 0.2250741496682167, "num_tokens": 129740828.0, "step": 74795 }, { "entropy": 5.947973775863647, "epoch": 5.819684886208909, "grad_norm": 1.46875, "learning_rate": 0.00021991821656960303, "loss": 4.9372, "mean_token_accuracy": 0.21692323982715606, "num_tokens": 129748999.0, "step": 74800 }, { "entropy": 5.978154134750366, "epoch": 5.820073915580626, "grad_norm": 1.453125, "learning_rate": 0.00021989134474103056, "loss": 4.9117, "mean_token_accuracy": 0.2206864356994629, "num_tokens": 129757278.0, "step": 74805 }, { "entropy": 5.947690629959107, "epoch": 5.820462944952344, "grad_norm": 1.4296875, "learning_rate": 0.00021986447374864422, "loss": 4.9589, "mean_token_accuracy": 0.20802993029356004, "num_tokens": 129765644.0, "step": 74810 }, { "entropy": 6.005950403213501, "epoch": 5.820851974324062, "grad_norm": 1.3828125, "learning_rate": 0.00021983760359285171, "loss": 4.9866, "mean_token_accuracy": 0.21875055730342866, "num_tokens": 129774394.0, "step": 74815 }, { "entropy": 5.958064556121826, "epoch": 5.821241003695779, "grad_norm": 1.5390625, "learning_rate": 0.0002198107342740608, "loss": 4.9045, "mean_token_accuracy": 0.22646512538194657, "num_tokens": 129782448.0, "step": 74820 }, { "entropy": 5.953708124160767, "epoch": 5.821630033067496, "grad_norm": 1.515625, "learning_rate": 0.00021978386579267907, "loss": 4.7913, "mean_token_accuracy": 0.2305470660328865, "num_tokens": 129790557.0, "step": 74825 }, { "entropy": 5.944882249832153, "epoch": 5.822019062439214, "grad_norm": 1.5390625, "learning_rate": 0.00021975699814911432, "loss": 4.9084, "mean_token_accuracy": 0.22396039813756943, "num_tokens": 129798651.0, "step": 74830 }, { "entropy": 5.893306016921997, "epoch": 5.8224080918109316, "grad_norm": 1.4453125, "learning_rate": 0.00021973013134377422, "loss": 4.8221, "mean_token_accuracy": 0.23473196625709533, "num_tokens": 129807665.0, "step": 74835 }, { "entropy": 5.9664756774902346, "epoch": 5.822797121182649, "grad_norm": 1.6171875, "learning_rate": 0.00021970326537706643, "loss": 4.8576, "mean_token_accuracy": 0.2306991085410118, "num_tokens": 129815927.0, "step": 74840 }, { "entropy": 5.952864408493042, "epoch": 5.823186150554367, "grad_norm": 1.5234375, "learning_rate": 0.00021967640024939851, "loss": 4.9217, "mean_token_accuracy": 0.22236475348472595, "num_tokens": 129823840.0, "step": 74845 }, { "entropy": 5.981057214736938, "epoch": 5.823575179926085, "grad_norm": 1.5546875, "learning_rate": 0.0002196495359611782, "loss": 4.9717, "mean_token_accuracy": 0.21021681725978852, "num_tokens": 129832238.0, "step": 74850 }, { "entropy": 6.023973417282105, "epoch": 5.823964209297802, "grad_norm": 1.6171875, "learning_rate": 0.0002196226725128131, "loss": 5.0461, "mean_token_accuracy": 0.2133082702755928, "num_tokens": 129841072.0, "step": 74855 }, { "entropy": 5.929681873321533, "epoch": 5.82435323866952, "grad_norm": 1.484375, "learning_rate": 0.00021959580990471073, "loss": 4.9407, "mean_token_accuracy": 0.2181203246116638, "num_tokens": 129850255.0, "step": 74860 }, { "entropy": 5.935883188247681, "epoch": 5.824742268041237, "grad_norm": 1.546875, "learning_rate": 0.0002195689481372788, "loss": 4.926, "mean_token_accuracy": 0.21653397977352143, "num_tokens": 129859201.0, "step": 74865 }, { "entropy": 5.9956306457519535, "epoch": 5.8251312974129545, "grad_norm": 1.484375, "learning_rate": 0.00021954208721092482, "loss": 4.9234, "mean_token_accuracy": 0.2257247507572174, "num_tokens": 129867760.0, "step": 74870 }, { "entropy": 5.948914957046509, "epoch": 5.825520326784672, "grad_norm": 1.5234375, "learning_rate": 0.00021951522712605648, "loss": 4.9135, "mean_token_accuracy": 0.21794894486665725, "num_tokens": 129875852.0, "step": 74875 }, { "entropy": 6.033364009857178, "epoch": 5.82590935615639, "grad_norm": 1.484375, "learning_rate": 0.00021948836788308117, "loss": 5.0033, "mean_token_accuracy": 0.2119821012020111, "num_tokens": 129884629.0, "step": 74880 }, { "entropy": 6.04655647277832, "epoch": 5.826298385528108, "grad_norm": 1.5, "learning_rate": 0.00021946150948240657, "loss": 5.0176, "mean_token_accuracy": 0.21859383434057236, "num_tokens": 129893354.0, "step": 74885 }, { "entropy": 5.9582772731781, "epoch": 5.8266874148998244, "grad_norm": 1.5234375, "learning_rate": 0.00021943465192444023, "loss": 4.9063, "mean_token_accuracy": 0.2189235880970955, "num_tokens": 129902048.0, "step": 74890 }, { "entropy": 5.974492835998535, "epoch": 5.827076444271542, "grad_norm": 1.5390625, "learning_rate": 0.00021940779520958952, "loss": 4.9215, "mean_token_accuracy": 0.22404073178768158, "num_tokens": 129910346.0, "step": 74895 }, { "entropy": 6.043318748474121, "epoch": 5.82746547364326, "grad_norm": 1.484375, "learning_rate": 0.0002193809393382621, "loss": 5.1016, "mean_token_accuracy": 0.2042091280221939, "num_tokens": 129918971.0, "step": 74900 }, { "entropy": 5.994036340713501, "epoch": 5.8278545030149775, "grad_norm": 1.4765625, "learning_rate": 0.00021935408431086528, "loss": 4.9457, "mean_token_accuracy": 0.2123458355665207, "num_tokens": 129928356.0, "step": 74905 }, { "entropy": 5.989865827560425, "epoch": 5.828243532386695, "grad_norm": 1.609375, "learning_rate": 0.00021932723012780677, "loss": 4.8869, "mean_token_accuracy": 0.2295105993747711, "num_tokens": 129937205.0, "step": 74910 }, { "entropy": 5.9744339942932125, "epoch": 5.828632561758413, "grad_norm": 1.5625, "learning_rate": 0.00021930037678949388, "loss": 4.9638, "mean_token_accuracy": 0.21859457492828369, "num_tokens": 129945438.0, "step": 74915 }, { "entropy": 6.003981065750122, "epoch": 5.829021591130131, "grad_norm": 1.4375, "learning_rate": 0.00021927352429633413, "loss": 4.9583, "mean_token_accuracy": 0.21607041954994202, "num_tokens": 129953565.0, "step": 74920 }, { "entropy": 5.941140651702881, "epoch": 5.829410620501848, "grad_norm": 1.53125, "learning_rate": 0.00021924667264873492, "loss": 4.9517, "mean_token_accuracy": 0.21605134010314941, "num_tokens": 129963015.0, "step": 74925 }, { "entropy": 5.973437547683716, "epoch": 5.829799649873565, "grad_norm": 1.625, "learning_rate": 0.0002192198218471037, "loss": 4.9841, "mean_token_accuracy": 0.21653540432453156, "num_tokens": 129972077.0, "step": 74930 }, { "entropy": 6.0400285720825195, "epoch": 5.830188679245283, "grad_norm": 1.6328125, "learning_rate": 0.00021919297189184795, "loss": 5.0388, "mean_token_accuracy": 0.2149857461452484, "num_tokens": 129981535.0, "step": 74935 }, { "entropy": 6.049007940292358, "epoch": 5.8305777086170005, "grad_norm": 1.7890625, "learning_rate": 0.000219166122783375, "loss": 4.9694, "mean_token_accuracy": 0.2202465608716011, "num_tokens": 129988859.0, "step": 74940 }, { "entropy": 5.981409120559692, "epoch": 5.830966737988718, "grad_norm": 1.46875, "learning_rate": 0.00021913927452209232, "loss": 4.9386, "mean_token_accuracy": 0.21949045211076737, "num_tokens": 129997030.0, "step": 74945 }, { "entropy": 5.841466808319092, "epoch": 5.831355767360436, "grad_norm": 1.671875, "learning_rate": 0.00021911242710840717, "loss": 4.7505, "mean_token_accuracy": 0.2314741790294647, "num_tokens": 130005515.0, "step": 74950 }, { "entropy": 5.85128870010376, "epoch": 5.831744796732154, "grad_norm": 1.515625, "learning_rate": 0.00021908558054272703, "loss": 4.8209, "mean_token_accuracy": 0.22870866507291793, "num_tokens": 130014848.0, "step": 74955 }, { "entropy": 5.899602699279785, "epoch": 5.83213382610387, "grad_norm": 1.5, "learning_rate": 0.0002190587348254592, "loss": 4.8597, "mean_token_accuracy": 0.223554590344429, "num_tokens": 130023341.0, "step": 74960 }, { "entropy": 5.986833810806274, "epoch": 5.832522855475588, "grad_norm": 1.640625, "learning_rate": 0.000219031889957011, "loss": 4.9242, "mean_token_accuracy": 0.21719675809144973, "num_tokens": 130031617.0, "step": 74965 }, { "entropy": 5.996923160552979, "epoch": 5.832911884847306, "grad_norm": 1.421875, "learning_rate": 0.00021900504593778985, "loss": 4.9328, "mean_token_accuracy": 0.21896204948425294, "num_tokens": 130040192.0, "step": 74970 }, { "entropy": 6.026058387756348, "epoch": 5.8333009142190235, "grad_norm": 1.6171875, "learning_rate": 0.00021897820276820296, "loss": 4.9996, "mean_token_accuracy": 0.21317307353019715, "num_tokens": 130048707.0, "step": 74975 }, { "entropy": 5.968855953216552, "epoch": 5.833689943590741, "grad_norm": 1.5859375, "learning_rate": 0.0002189513604486577, "loss": 4.9555, "mean_token_accuracy": 0.2164836809039116, "num_tokens": 130056971.0, "step": 74980 }, { "entropy": 5.950008535385132, "epoch": 5.834078972962459, "grad_norm": 1.375, "learning_rate": 0.0002189245189795613, "loss": 4.9039, "mean_token_accuracy": 0.21826159209012985, "num_tokens": 130066151.0, "step": 74985 }, { "entropy": 5.942103052139283, "epoch": 5.834468002334177, "grad_norm": 1.390625, "learning_rate": 0.00021889767836132107, "loss": 5.005, "mean_token_accuracy": 0.21520727574825288, "num_tokens": 130075236.0, "step": 74990 }, { "entropy": 5.956946086883545, "epoch": 5.834857031705893, "grad_norm": 1.5078125, "learning_rate": 0.00021887083859434433, "loss": 4.9585, "mean_token_accuracy": 0.22355642467737197, "num_tokens": 130084154.0, "step": 74995 }, { "entropy": 6.012527418136597, "epoch": 5.835246061077611, "grad_norm": 1.4921875, "learning_rate": 0.00021884399967903818, "loss": 4.9624, "mean_token_accuracy": 0.2186752215027809, "num_tokens": 130093046.0, "step": 75000 }, { "epoch": 5.835246061077611, "eval_entropy": 5.701734090608628, "eval_loss": 5.04495906829834, "eval_mean_token_accuracy": 0.22350261892345344, "eval_num_tokens": 130093046.0, "eval_runtime": 21.6427, "eval_samples_per_second": 1920.188, "eval_steps_per_second": 240.035, "step": 75000 }, { "entropy": 5.955037450790405, "epoch": 5.835635090449329, "grad_norm": 1.5625, "learning_rate": 0.00021881716161581, "loss": 4.9309, "mean_token_accuracy": 0.21489462107419968, "num_tokens": 130101403.0, "step": 75005 }, { "entropy": 5.902156209945678, "epoch": 5.8360241198210465, "grad_norm": 1.75, "learning_rate": 0.00021879032440506697, "loss": 4.8546, "mean_token_accuracy": 0.221111299097538, "num_tokens": 130110051.0, "step": 75010 }, { "entropy": 5.990875196456909, "epoch": 5.836413149192764, "grad_norm": 1.5546875, "learning_rate": 0.0002187634880472163, "loss": 4.9415, "mean_token_accuracy": 0.21849344968795775, "num_tokens": 130118598.0, "step": 75015 }, { "entropy": 5.996807956695557, "epoch": 5.836802178564482, "grad_norm": 1.6015625, "learning_rate": 0.00021873665254266517, "loss": 4.9599, "mean_token_accuracy": 0.21732147783041, "num_tokens": 130126784.0, "step": 75020 }, { "entropy": 5.908301544189453, "epoch": 5.837191207936199, "grad_norm": 1.625, "learning_rate": 0.00021870981789182082, "loss": 4.919, "mean_token_accuracy": 0.22357892245054245, "num_tokens": 130135493.0, "step": 75025 }, { "entropy": 5.919711399078369, "epoch": 5.837580237307916, "grad_norm": 1.640625, "learning_rate": 0.0002186829840950904, "loss": 4.93, "mean_token_accuracy": 0.2198515623807907, "num_tokens": 130144871.0, "step": 75030 }, { "entropy": 6.035551595687866, "epoch": 5.837969266679634, "grad_norm": 1.6796875, "learning_rate": 0.000218656151152881, "loss": 4.9601, "mean_token_accuracy": 0.21848211586475372, "num_tokens": 130153917.0, "step": 75035 }, { "entropy": 6.029910326004028, "epoch": 5.838358296051352, "grad_norm": 1.59375, "learning_rate": 0.00021862931906559992, "loss": 5.0072, "mean_token_accuracy": 0.21773739904165268, "num_tokens": 130161873.0, "step": 75040 }, { "entropy": 5.920537376403809, "epoch": 5.8387473254230695, "grad_norm": 1.5390625, "learning_rate": 0.00021860248783365412, "loss": 4.797, "mean_token_accuracy": 0.23541744202375411, "num_tokens": 130170844.0, "step": 75045 }, { "entropy": 5.938541746139526, "epoch": 5.839136354794787, "grad_norm": 1.5234375, "learning_rate": 0.00021857565745745083, "loss": 4.9135, "mean_token_accuracy": 0.2217307820916176, "num_tokens": 130179076.0, "step": 75050 }, { "entropy": 6.055966854095459, "epoch": 5.839525384166505, "grad_norm": 1.421875, "learning_rate": 0.00021854882793739716, "loss": 5.0421, "mean_token_accuracy": 0.21184190064668657, "num_tokens": 130187992.0, "step": 75055 }, { "entropy": 5.992700624465942, "epoch": 5.839914413538223, "grad_norm": 1.5234375, "learning_rate": 0.00021852199927390015, "loss": 5.007, "mean_token_accuracy": 0.21636045277118682, "num_tokens": 130196642.0, "step": 75060 }, { "entropy": 5.878013849258423, "epoch": 5.840303442909939, "grad_norm": 1.578125, "learning_rate": 0.0002184951714673668, "loss": 4.7668, "mean_token_accuracy": 0.23662480860948562, "num_tokens": 130205536.0, "step": 75065 }, { "entropy": 5.9727105617523195, "epoch": 5.840692472281657, "grad_norm": 1.5, "learning_rate": 0.00021846834451820437, "loss": 5.0138, "mean_token_accuracy": 0.21317314654588698, "num_tokens": 130214153.0, "step": 75070 }, { "entropy": 5.989931058883667, "epoch": 5.841081501653375, "grad_norm": 1.546875, "learning_rate": 0.00021844151842681986, "loss": 4.8797, "mean_token_accuracy": 0.22068050503730774, "num_tokens": 130222437.0, "step": 75075 }, { "entropy": 5.891117334365845, "epoch": 5.8414705310250925, "grad_norm": 1.5, "learning_rate": 0.00021841469319362034, "loss": 4.8698, "mean_token_accuracy": 0.22799665629863738, "num_tokens": 130230920.0, "step": 75080 }, { "entropy": 5.978481912612915, "epoch": 5.84185956039681, "grad_norm": 1.5234375, "learning_rate": 0.00021838786881901267, "loss": 4.9311, "mean_token_accuracy": 0.21898679286241532, "num_tokens": 130239374.0, "step": 75085 }, { "entropy": 5.967590951919556, "epoch": 5.842248589768528, "grad_norm": 1.6015625, "learning_rate": 0.00021836104530340407, "loss": 4.9194, "mean_token_accuracy": 0.21591199487447738, "num_tokens": 130249070.0, "step": 75090 }, { "entropy": 6.022045755386353, "epoch": 5.842637619140245, "grad_norm": 1.609375, "learning_rate": 0.00021833422264720136, "loss": 5.008, "mean_token_accuracy": 0.2155309408903122, "num_tokens": 130258087.0, "step": 75095 }, { "entropy": 5.998011255264283, "epoch": 5.843026648511962, "grad_norm": 1.5625, "learning_rate": 0.00021830740085081169, "loss": 4.9902, "mean_token_accuracy": 0.20982946455478668, "num_tokens": 130266039.0, "step": 75100 }, { "entropy": 5.946198320388794, "epoch": 5.84341567788368, "grad_norm": 1.4765625, "learning_rate": 0.000218280579914642, "loss": 4.8978, "mean_token_accuracy": 0.2221483513712883, "num_tokens": 130274787.0, "step": 75105 }, { "entropy": 5.972231340408325, "epoch": 5.843804707255398, "grad_norm": 1.5390625, "learning_rate": 0.00021825375983909918, "loss": 4.938, "mean_token_accuracy": 0.21653356403112411, "num_tokens": 130284013.0, "step": 75110 }, { "entropy": 5.981378650665283, "epoch": 5.8441937366271155, "grad_norm": 1.546875, "learning_rate": 0.0002182269406245903, "loss": 4.8897, "mean_token_accuracy": 0.23564158231019974, "num_tokens": 130292167.0, "step": 75115 }, { "entropy": 5.974547910690307, "epoch": 5.844582765998833, "grad_norm": 1.5234375, "learning_rate": 0.00021820012227152214, "loss": 4.9189, "mean_token_accuracy": 0.2205956682562828, "num_tokens": 130300614.0, "step": 75120 }, { "entropy": 5.956206321716309, "epoch": 5.844971795370551, "grad_norm": 1.5234375, "learning_rate": 0.00021817330478030177, "loss": 4.8784, "mean_token_accuracy": 0.22766678631305695, "num_tokens": 130309683.0, "step": 75125 }, { "entropy": 6.008305931091309, "epoch": 5.845360824742268, "grad_norm": 1.5625, "learning_rate": 0.00021814648815133604, "loss": 4.9826, "mean_token_accuracy": 0.2131974294781685, "num_tokens": 130318771.0, "step": 75130 }, { "entropy": 6.017253017425537, "epoch": 5.845749854113985, "grad_norm": 1.5390625, "learning_rate": 0.00021811967238503184, "loss": 5.0363, "mean_token_accuracy": 0.21643770784139632, "num_tokens": 130327359.0, "step": 75135 }, { "entropy": 6.0009904384613035, "epoch": 5.846138883485703, "grad_norm": 1.5078125, "learning_rate": 0.00021809285748179612, "loss": 5.047, "mean_token_accuracy": 0.20678585916757583, "num_tokens": 130336690.0, "step": 75140 }, { "entropy": 5.96063494682312, "epoch": 5.846527912857421, "grad_norm": 1.578125, "learning_rate": 0.0002180660434420357, "loss": 4.9429, "mean_token_accuracy": 0.2206372380256653, "num_tokens": 130345391.0, "step": 75145 }, { "entropy": 6.031637382507324, "epoch": 5.8469169422291385, "grad_norm": 1.4375, "learning_rate": 0.00021803923026615746, "loss": 5.0111, "mean_token_accuracy": 0.2200985997915268, "num_tokens": 130354134.0, "step": 75150 }, { "entropy": 6.0123405933380125, "epoch": 5.847305971600856, "grad_norm": 1.5703125, "learning_rate": 0.0002180124179545682, "loss": 4.9381, "mean_token_accuracy": 0.21608905792236327, "num_tokens": 130362633.0, "step": 75155 }, { "entropy": 6.04129548072815, "epoch": 5.847695000972573, "grad_norm": 1.5625, "learning_rate": 0.00021798560650767486, "loss": 5.0677, "mean_token_accuracy": 0.2096573978662491, "num_tokens": 130371110.0, "step": 75160 }, { "entropy": 5.92115626335144, "epoch": 5.848084030344291, "grad_norm": 1.453125, "learning_rate": 0.00021795879592588418, "loss": 4.9254, "mean_token_accuracy": 0.2140694960951805, "num_tokens": 130379754.0, "step": 75165 }, { "entropy": 5.932467269897461, "epoch": 5.848473059716008, "grad_norm": 1.390625, "learning_rate": 0.00021793198620960293, "loss": 4.926, "mean_token_accuracy": 0.21644344478845595, "num_tokens": 130388352.0, "step": 75170 }, { "entropy": 6.022741317749023, "epoch": 5.848862089087726, "grad_norm": 1.546875, "learning_rate": 0.00021790517735923798, "loss": 4.9871, "mean_token_accuracy": 0.21522610187530516, "num_tokens": 130397190.0, "step": 75175 }, { "entropy": 6.017928743362427, "epoch": 5.849251118459444, "grad_norm": 1.4453125, "learning_rate": 0.0002178783693751961, "loss": 4.9684, "mean_token_accuracy": 0.21671112775802612, "num_tokens": 130405955.0, "step": 75180 }, { "entropy": 6.002825403213501, "epoch": 5.8496401478311615, "grad_norm": 1.5703125, "learning_rate": 0.000217851562257884, "loss": 4.983, "mean_token_accuracy": 0.2171285182237625, "num_tokens": 130414366.0, "step": 75185 }, { "entropy": 5.948372459411621, "epoch": 5.850029177202879, "grad_norm": 1.5546875, "learning_rate": 0.00021782475600770856, "loss": 4.848, "mean_token_accuracy": 0.22881193608045577, "num_tokens": 130422600.0, "step": 75190 }, { "entropy": 5.934473085403442, "epoch": 5.850418206574597, "grad_norm": 1.5546875, "learning_rate": 0.00021779795062507634, "loss": 4.9729, "mean_token_accuracy": 0.21951285749673843, "num_tokens": 130431208.0, "step": 75195 }, { "entropy": 5.970952892303467, "epoch": 5.850807235946314, "grad_norm": 1.5234375, "learning_rate": 0.00021777114611039422, "loss": 4.9857, "mean_token_accuracy": 0.2151118740439415, "num_tokens": 130440181.0, "step": 75200 }, { "entropy": 5.966131401062012, "epoch": 5.851196265318031, "grad_norm": 1.4453125, "learning_rate": 0.00021774434246406887, "loss": 4.936, "mean_token_accuracy": 0.21687786430120468, "num_tokens": 130448555.0, "step": 75205 }, { "entropy": 6.060975170135498, "epoch": 5.851585294689749, "grad_norm": 1.4921875, "learning_rate": 0.00021771753968650705, "loss": 5.0702, "mean_token_accuracy": 0.207884281873703, "num_tokens": 130457262.0, "step": 75210 }, { "entropy": 5.9914445877075195, "epoch": 5.851974324061467, "grad_norm": 1.59375, "learning_rate": 0.00021769073777811533, "loss": 4.9102, "mean_token_accuracy": 0.2216745287179947, "num_tokens": 130465257.0, "step": 75215 }, { "entropy": 5.934783315658569, "epoch": 5.8523633534331845, "grad_norm": 1.640625, "learning_rate": 0.00021766393673930046, "loss": 4.8442, "mean_token_accuracy": 0.21795590668916703, "num_tokens": 130473441.0, "step": 75220 }, { "entropy": 5.924726676940918, "epoch": 5.852752382804901, "grad_norm": 1.3515625, "learning_rate": 0.00021763713657046906, "loss": 4.9074, "mean_token_accuracy": 0.22204250395298003, "num_tokens": 130482758.0, "step": 75225 }, { "entropy": 5.98883810043335, "epoch": 5.853141412176619, "grad_norm": 1.5546875, "learning_rate": 0.00021761033727202782, "loss": 5.0377, "mean_token_accuracy": 0.2088179662823677, "num_tokens": 130491826.0, "step": 75230 }, { "entropy": 6.004818153381348, "epoch": 5.853530441548337, "grad_norm": 1.4765625, "learning_rate": 0.00021758353884438343, "loss": 5.0035, "mean_token_accuracy": 0.21052451878786088, "num_tokens": 130501275.0, "step": 75235 }, { "entropy": 5.947307825088501, "epoch": 5.853919470920054, "grad_norm": 1.6796875, "learning_rate": 0.0002175567412879424, "loss": 4.8772, "mean_token_accuracy": 0.22054249793291092, "num_tokens": 130511127.0, "step": 75240 }, { "entropy": 5.944646739959717, "epoch": 5.854308500291772, "grad_norm": 1.546875, "learning_rate": 0.00021752994460311144, "loss": 4.9262, "mean_token_accuracy": 0.22301099598407745, "num_tokens": 130520104.0, "step": 75245 }, { "entropy": 6.019086837768555, "epoch": 5.85469752966349, "grad_norm": 1.5859375, "learning_rate": 0.00021750314879029708, "loss": 4.9843, "mean_token_accuracy": 0.22124726325273514, "num_tokens": 130528657.0, "step": 75250 }, { "entropy": 5.9754256248474125, "epoch": 5.8550865590352075, "grad_norm": 1.4375, "learning_rate": 0.0002174763538499059, "loss": 4.9792, "mean_token_accuracy": 0.2157418742775917, "num_tokens": 130537286.0, "step": 75255 }, { "entropy": 6.04588475227356, "epoch": 5.855475588406925, "grad_norm": 1.5703125, "learning_rate": 0.00021744955978234449, "loss": 5.0582, "mean_token_accuracy": 0.21473521888256072, "num_tokens": 130546220.0, "step": 75260 }, { "entropy": 5.989775228500366, "epoch": 5.855864617778642, "grad_norm": 1.5078125, "learning_rate": 0.0002174227665880193, "loss": 4.9446, "mean_token_accuracy": 0.2144552245736122, "num_tokens": 130555223.0, "step": 75265 }, { "entropy": 6.043210840225219, "epoch": 5.85625364715036, "grad_norm": 1.5703125, "learning_rate": 0.00021739597426733714, "loss": 4.9752, "mean_token_accuracy": 0.21351270228624344, "num_tokens": 130563930.0, "step": 75270 }, { "entropy": 6.011846399307251, "epoch": 5.856642676522077, "grad_norm": 1.640625, "learning_rate": 0.00021736918282070435, "loss": 5.0101, "mean_token_accuracy": 0.22058479189872743, "num_tokens": 130572757.0, "step": 75275 }, { "entropy": 5.954722881317139, "epoch": 5.857031705893795, "grad_norm": 1.5, "learning_rate": 0.00021734239224852742, "loss": 4.9184, "mean_token_accuracy": 0.21994494497776032, "num_tokens": 130581585.0, "step": 75280 }, { "entropy": 5.9526691913604735, "epoch": 5.857420735265513, "grad_norm": 1.5546875, "learning_rate": 0.00021731560255121296, "loss": 4.9157, "mean_token_accuracy": 0.221183080971241, "num_tokens": 130590040.0, "step": 75285 }, { "entropy": 5.927372312545776, "epoch": 5.8578097646372305, "grad_norm": 1.390625, "learning_rate": 0.00021728881372916743, "loss": 4.8363, "mean_token_accuracy": 0.22593884468078612, "num_tokens": 130599623.0, "step": 75290 }, { "entropy": 5.894705200195313, "epoch": 5.858198794008947, "grad_norm": 1.5625, "learning_rate": 0.0002172620257827973, "loss": 4.8469, "mean_token_accuracy": 0.223989999294281, "num_tokens": 130608092.0, "step": 75295 }, { "entropy": 5.951822090148926, "epoch": 5.858587823380665, "grad_norm": 1.6328125, "learning_rate": 0.00021723523871250905, "loss": 4.9101, "mean_token_accuracy": 0.22703285664319992, "num_tokens": 130616274.0, "step": 75300 }, { "entropy": 5.955262756347656, "epoch": 5.858976852752383, "grad_norm": 1.3984375, "learning_rate": 0.00021720845251870907, "loss": 4.9494, "mean_token_accuracy": 0.210658498108387, "num_tokens": 130625591.0, "step": 75305 }, { "entropy": 6.022744655609131, "epoch": 5.8593658821241, "grad_norm": 1.59375, "learning_rate": 0.00021718166720180384, "loss": 4.9582, "mean_token_accuracy": 0.21697202771902085, "num_tokens": 130634754.0, "step": 75310 }, { "entropy": 5.9204576969146725, "epoch": 5.859754911495818, "grad_norm": 1.5390625, "learning_rate": 0.0002171548827621998, "loss": 4.8631, "mean_token_accuracy": 0.23571909964084625, "num_tokens": 130643538.0, "step": 75315 }, { "entropy": 5.921241760253906, "epoch": 5.860143940867536, "grad_norm": 1.5546875, "learning_rate": 0.0002171280992003033, "loss": 4.8791, "mean_token_accuracy": 0.22502767592668532, "num_tokens": 130653277.0, "step": 75320 }, { "entropy": 5.942056179046631, "epoch": 5.8605329702392535, "grad_norm": 1.453125, "learning_rate": 0.00021710131651652087, "loss": 4.9246, "mean_token_accuracy": 0.22603473961353301, "num_tokens": 130663009.0, "step": 75325 }, { "entropy": 5.9027002334594725, "epoch": 5.86092199961097, "grad_norm": 1.65625, "learning_rate": 0.00021707453471125866, "loss": 4.8977, "mean_token_accuracy": 0.21811441332101822, "num_tokens": 130672246.0, "step": 75330 }, { "entropy": 5.958973121643067, "epoch": 5.861311028982688, "grad_norm": 1.734375, "learning_rate": 0.00021704775378492326, "loss": 4.8622, "mean_token_accuracy": 0.22785282284021377, "num_tokens": 130680948.0, "step": 75335 }, { "entropy": 5.983928632736206, "epoch": 5.861700058354406, "grad_norm": 1.6328125, "learning_rate": 0.00021702097373792095, "loss": 4.9251, "mean_token_accuracy": 0.22308722734451295, "num_tokens": 130689755.0, "step": 75340 }, { "entropy": 5.97366852760315, "epoch": 5.862089087726123, "grad_norm": 1.578125, "learning_rate": 0.00021699419457065812, "loss": 4.8969, "mean_token_accuracy": 0.2192154422402382, "num_tokens": 130698429.0, "step": 75345 }, { "entropy": 6.0411553382873535, "epoch": 5.862478117097841, "grad_norm": 1.5859375, "learning_rate": 0.00021696741628354104, "loss": 5.0245, "mean_token_accuracy": 0.2171551451086998, "num_tokens": 130706811.0, "step": 75350 }, { "entropy": 5.911888217926025, "epoch": 5.862867146469559, "grad_norm": 1.5234375, "learning_rate": 0.00021694063887697614, "loss": 4.8303, "mean_token_accuracy": 0.22512923330068588, "num_tokens": 130714909.0, "step": 75355 }, { "entropy": 5.93531060218811, "epoch": 5.863256175841276, "grad_norm": 1.515625, "learning_rate": 0.00021691386235136951, "loss": 4.8465, "mean_token_accuracy": 0.2270304426550865, "num_tokens": 130723006.0, "step": 75360 }, { "entropy": 5.962205696105957, "epoch": 5.863645205212993, "grad_norm": 1.6171875, "learning_rate": 0.00021688708670712764, "loss": 4.9123, "mean_token_accuracy": 0.21693944483995437, "num_tokens": 130731615.0, "step": 75365 }, { "entropy": 6.006429672241211, "epoch": 5.864034234584711, "grad_norm": 1.59375, "learning_rate": 0.00021686031194465666, "loss": 4.998, "mean_token_accuracy": 0.2137029156088829, "num_tokens": 130740387.0, "step": 75370 }, { "entropy": 5.983992671966552, "epoch": 5.864423263956429, "grad_norm": 1.5625, "learning_rate": 0.00021683353806436296, "loss": 4.8565, "mean_token_accuracy": 0.2252255544066429, "num_tokens": 130748420.0, "step": 75375 }, { "entropy": 5.977304410934448, "epoch": 5.864812293328146, "grad_norm": 1.5234375, "learning_rate": 0.0002168067650666527, "loss": 4.9407, "mean_token_accuracy": 0.21890005022287368, "num_tokens": 130756907.0, "step": 75380 }, { "entropy": 6.026253414154053, "epoch": 5.865201322699864, "grad_norm": 1.6640625, "learning_rate": 0.00021677999295193224, "loss": 5.0743, "mean_token_accuracy": 0.20892684757709504, "num_tokens": 130765112.0, "step": 75385 }, { "entropy": 5.986418533325195, "epoch": 5.865590352071582, "grad_norm": 1.65625, "learning_rate": 0.00021675322172060764, "loss": 4.9168, "mean_token_accuracy": 0.2222522273659706, "num_tokens": 130773328.0, "step": 75390 }, { "entropy": 5.91234769821167, "epoch": 5.8659793814432994, "grad_norm": 1.4765625, "learning_rate": 0.00021672645137308516, "loss": 4.9506, "mean_token_accuracy": 0.21173347234725953, "num_tokens": 130782919.0, "step": 75395 }, { "entropy": 5.853524303436279, "epoch": 5.866368410815016, "grad_norm": 1.4296875, "learning_rate": 0.00021669968190977107, "loss": 4.8241, "mean_token_accuracy": 0.23128565698862075, "num_tokens": 130791021.0, "step": 75400 }, { "entropy": 5.959136247634888, "epoch": 5.866757440186734, "grad_norm": 1.40625, "learning_rate": 0.00021667291333107153, "loss": 4.9498, "mean_token_accuracy": 0.2261599987745285, "num_tokens": 130799784.0, "step": 75405 }, { "entropy": 5.965036869049072, "epoch": 5.867146469558452, "grad_norm": 1.421875, "learning_rate": 0.00021664614563739266, "loss": 4.8648, "mean_token_accuracy": 0.23410189598798753, "num_tokens": 130808259.0, "step": 75410 }, { "entropy": 5.97726583480835, "epoch": 5.867535498930169, "grad_norm": 1.5390625, "learning_rate": 0.00021661937882914067, "loss": 4.9727, "mean_token_accuracy": 0.21823120564222337, "num_tokens": 130817389.0, "step": 75415 }, { "entropy": 6.015581703186035, "epoch": 5.867924528301887, "grad_norm": 1.46875, "learning_rate": 0.00021659261290672168, "loss": 4.971, "mean_token_accuracy": 0.21386676728725434, "num_tokens": 130826595.0, "step": 75420 }, { "entropy": 6.027264595031738, "epoch": 5.868313557673605, "grad_norm": 1.6328125, "learning_rate": 0.00021656584787054184, "loss": 5.048, "mean_token_accuracy": 0.2160298928618431, "num_tokens": 130835723.0, "step": 75425 }, { "entropy": 6.023162984848023, "epoch": 5.8687025870453216, "grad_norm": 1.6875, "learning_rate": 0.00021653908372100728, "loss": 5.028, "mean_token_accuracy": 0.21050597429275514, "num_tokens": 130844830.0, "step": 75430 }, { "entropy": 6.018211936950683, "epoch": 5.869091616417039, "grad_norm": 1.515625, "learning_rate": 0.00021651232045852403, "loss": 4.9642, "mean_token_accuracy": 0.21456619650125502, "num_tokens": 130853673.0, "step": 75435 }, { "entropy": 5.9396641731262205, "epoch": 5.869480645788757, "grad_norm": 1.5, "learning_rate": 0.0002164855580834983, "loss": 4.8173, "mean_token_accuracy": 0.22934497147798538, "num_tokens": 130862712.0, "step": 75440 }, { "entropy": 5.954195928573609, "epoch": 5.869869675160475, "grad_norm": 1.546875, "learning_rate": 0.000216458796596336, "loss": 4.9126, "mean_token_accuracy": 0.2219357505440712, "num_tokens": 130871260.0, "step": 75445 }, { "entropy": 5.9409260749816895, "epoch": 5.870258704532192, "grad_norm": 1.484375, "learning_rate": 0.00021643203599744327, "loss": 4.8967, "mean_token_accuracy": 0.22026266008615494, "num_tokens": 130879349.0, "step": 75450 }, { "entropy": 5.95132737159729, "epoch": 5.87064773390391, "grad_norm": 1.5625, "learning_rate": 0.00021640527628722622, "loss": 4.9123, "mean_token_accuracy": 0.2238190531730652, "num_tokens": 130887375.0, "step": 75455 }, { "entropy": 5.952106475830078, "epoch": 5.871036763275628, "grad_norm": 1.5390625, "learning_rate": 0.00021637851746609082, "loss": 4.8991, "mean_token_accuracy": 0.22524582892656325, "num_tokens": 130895803.0, "step": 75460 }, { "entropy": 5.937530755996704, "epoch": 5.8714257926473445, "grad_norm": 1.53125, "learning_rate": 0.00021635175953444314, "loss": 4.9148, "mean_token_accuracy": 0.22142511159181594, "num_tokens": 130903960.0, "step": 75465 }, { "entropy": 5.9152813911437985, "epoch": 5.871814822019062, "grad_norm": 1.625, "learning_rate": 0.0002163250024926891, "loss": 4.8366, "mean_token_accuracy": 0.22593443244695663, "num_tokens": 130912244.0, "step": 75470 }, { "entropy": 5.87206449508667, "epoch": 5.87220385139078, "grad_norm": 1.484375, "learning_rate": 0.00021629824634123479, "loss": 4.8541, "mean_token_accuracy": 0.23321328461170196, "num_tokens": 130921443.0, "step": 75475 }, { "entropy": 6.015424013137817, "epoch": 5.872592880762498, "grad_norm": 1.5625, "learning_rate": 0.00021627149108048615, "loss": 4.9985, "mean_token_accuracy": 0.2202403575181961, "num_tokens": 130929850.0, "step": 75480 }, { "entropy": 6.000602960586548, "epoch": 5.872981910134215, "grad_norm": 1.5390625, "learning_rate": 0.0002162447367108492, "loss": 5.0084, "mean_token_accuracy": 0.21271976381540297, "num_tokens": 130938171.0, "step": 75485 }, { "entropy": 5.95771017074585, "epoch": 5.873370939505933, "grad_norm": 1.5625, "learning_rate": 0.00021621798323272985, "loss": 4.8904, "mean_token_accuracy": 0.22501126080751419, "num_tokens": 130946063.0, "step": 75490 }, { "entropy": 5.89755802154541, "epoch": 5.87375996887765, "grad_norm": 1.5703125, "learning_rate": 0.000216191230646534, "loss": 4.8975, "mean_token_accuracy": 0.22036340534687043, "num_tokens": 130953644.0, "step": 75495 }, { "entropy": 5.945853042602539, "epoch": 5.8741489982493675, "grad_norm": 1.484375, "learning_rate": 0.00021616447895266762, "loss": 4.8879, "mean_token_accuracy": 0.22229375839233398, "num_tokens": 130961939.0, "step": 75500 }, { "entropy": 5.9587281227111815, "epoch": 5.874538027621085, "grad_norm": 1.5, "learning_rate": 0.00021613772815153666, "loss": 4.8531, "mean_token_accuracy": 0.2280240088701248, "num_tokens": 130970513.0, "step": 75505 }, { "entropy": 5.903785562515258, "epoch": 5.874927056992803, "grad_norm": 1.546875, "learning_rate": 0.00021611097824354697, "loss": 4.8377, "mean_token_accuracy": 0.2314414396882057, "num_tokens": 130978662.0, "step": 75510 }, { "entropy": 5.944231653213501, "epoch": 5.875316086364521, "grad_norm": 1.5234375, "learning_rate": 0.0002160842292291045, "loss": 4.9496, "mean_token_accuracy": 0.21866417229175567, "num_tokens": 130987226.0, "step": 75515 }, { "entropy": 5.965762567520142, "epoch": 5.875705115736238, "grad_norm": 1.4765625, "learning_rate": 0.00021605748110861507, "loss": 4.9469, "mean_token_accuracy": 0.22677277028560638, "num_tokens": 130996853.0, "step": 75520 }, { "entropy": 5.957023620605469, "epoch": 5.876094145107956, "grad_norm": 1.578125, "learning_rate": 0.00021603073388248452, "loss": 4.9135, "mean_token_accuracy": 0.22655759006738663, "num_tokens": 131005582.0, "step": 75525 }, { "entropy": 5.971748018264771, "epoch": 5.876483174479673, "grad_norm": 1.5546875, "learning_rate": 0.0002160039875511186, "loss": 4.8913, "mean_token_accuracy": 0.22119861841201782, "num_tokens": 131014138.0, "step": 75530 }, { "entropy": 6.050435256958008, "epoch": 5.8768722038513905, "grad_norm": 1.6875, "learning_rate": 0.00021597724211492336, "loss": 5.0504, "mean_token_accuracy": 0.20884641408920288, "num_tokens": 131022144.0, "step": 75535 }, { "entropy": 6.003734064102173, "epoch": 5.877261233223108, "grad_norm": 1.5390625, "learning_rate": 0.00021595049757430458, "loss": 4.935, "mean_token_accuracy": 0.220840160548687, "num_tokens": 131031316.0, "step": 75540 }, { "entropy": 5.95683479309082, "epoch": 5.877650262594826, "grad_norm": 1.5234375, "learning_rate": 0.00021592375392966802, "loss": 4.9174, "mean_token_accuracy": 0.22201566100120546, "num_tokens": 131039621.0, "step": 75545 }, { "entropy": 5.948804903030395, "epoch": 5.878039291966544, "grad_norm": 1.5078125, "learning_rate": 0.00021589701118141942, "loss": 4.8532, "mean_token_accuracy": 0.22742396146059035, "num_tokens": 131048279.0, "step": 75550 }, { "entropy": 5.918148231506348, "epoch": 5.878428321338261, "grad_norm": 1.515625, "learning_rate": 0.00021587026932996456, "loss": 4.9017, "mean_token_accuracy": 0.22408656775951385, "num_tokens": 131056895.0, "step": 75555 }, { "entropy": 5.9957688331604, "epoch": 5.878817350709978, "grad_norm": 1.4921875, "learning_rate": 0.00021584352837570936, "loss": 4.9947, "mean_token_accuracy": 0.21729426831007004, "num_tokens": 131066076.0, "step": 75560 }, { "entropy": 5.8761138916015625, "epoch": 5.879206380081696, "grad_norm": 1.453125, "learning_rate": 0.00021581678831905939, "loss": 4.8314, "mean_token_accuracy": 0.22739178836345672, "num_tokens": 131074842.0, "step": 75565 }, { "entropy": 5.952015113830567, "epoch": 5.8795954094534135, "grad_norm": 1.484375, "learning_rate": 0.00021579004916042044, "loss": 5.0239, "mean_token_accuracy": 0.20771122127771377, "num_tokens": 131083925.0, "step": 75570 }, { "entropy": 5.985554981231689, "epoch": 5.879984438825131, "grad_norm": 1.6015625, "learning_rate": 0.00021576331090019825, "loss": 4.9374, "mean_token_accuracy": 0.21668141782283784, "num_tokens": 131092088.0, "step": 75575 }, { "entropy": 5.984002256393433, "epoch": 5.880373468196849, "grad_norm": 1.671875, "learning_rate": 0.00021573657353879855, "loss": 4.9691, "mean_token_accuracy": 0.21702119410037995, "num_tokens": 131100485.0, "step": 75580 }, { "entropy": 5.943580198287964, "epoch": 5.880762497568567, "grad_norm": 1.4921875, "learning_rate": 0.00021570983707662705, "loss": 4.8424, "mean_token_accuracy": 0.23992462158203126, "num_tokens": 131109431.0, "step": 75585 }, { "entropy": 5.955830240249634, "epoch": 5.881151526940284, "grad_norm": 1.484375, "learning_rate": 0.00021568310151408939, "loss": 4.9192, "mean_token_accuracy": 0.22028935998678206, "num_tokens": 131117861.0, "step": 75590 }, { "entropy": 5.976267004013062, "epoch": 5.881540556312002, "grad_norm": 1.5, "learning_rate": 0.00021565636685159117, "loss": 4.976, "mean_token_accuracy": 0.219989512860775, "num_tokens": 131126578.0, "step": 75595 }, { "entropy": 5.950083589553833, "epoch": 5.881929585683719, "grad_norm": 1.8203125, "learning_rate": 0.0002156296330895382, "loss": 4.9266, "mean_token_accuracy": 0.22697990387678146, "num_tokens": 131135517.0, "step": 75600 }, { "entropy": 6.036066198348999, "epoch": 5.8823186150554365, "grad_norm": 1.46875, "learning_rate": 0.00021560290022833606, "loss": 5.0318, "mean_token_accuracy": 0.2147227331995964, "num_tokens": 131144211.0, "step": 75605 }, { "entropy": 5.97566442489624, "epoch": 5.882707644427154, "grad_norm": 1.578125, "learning_rate": 0.0002155761682683904, "loss": 4.8854, "mean_token_accuracy": 0.2219949707388878, "num_tokens": 131152937.0, "step": 75610 }, { "entropy": 6.014400243759155, "epoch": 5.883096673798872, "grad_norm": 1.59375, "learning_rate": 0.00021554943721010673, "loss": 4.9274, "mean_token_accuracy": 0.2193492978811264, "num_tokens": 131161557.0, "step": 75615 }, { "entropy": 5.976441287994385, "epoch": 5.88348570317059, "grad_norm": 1.4609375, "learning_rate": 0.0002155227070538907, "loss": 4.9412, "mean_token_accuracy": 0.2224429726600647, "num_tokens": 131170628.0, "step": 75620 }, { "entropy": 5.980197525024414, "epoch": 5.883874732542307, "grad_norm": 1.515625, "learning_rate": 0.00021549597780014807, "loss": 4.9859, "mean_token_accuracy": 0.21812517642974855, "num_tokens": 131179047.0, "step": 75625 }, { "entropy": 6.012881422042847, "epoch": 5.884263761914024, "grad_norm": 1.59375, "learning_rate": 0.0002154692494492842, "loss": 4.9725, "mean_token_accuracy": 0.2183452218770981, "num_tokens": 131187743.0, "step": 75630 }, { "entropy": 6.016065406799316, "epoch": 5.884652791285742, "grad_norm": 1.734375, "learning_rate": 0.00021544252200170465, "loss": 5.064, "mean_token_accuracy": 0.21276151090860368, "num_tokens": 131196572.0, "step": 75635 }, { "entropy": 5.961779594421387, "epoch": 5.8850418206574595, "grad_norm": 1.5078125, "learning_rate": 0.0002154157954578151, "loss": 4.8773, "mean_token_accuracy": 0.2208438739180565, "num_tokens": 131205332.0, "step": 75640 }, { "entropy": 5.927547359466553, "epoch": 5.885430850029177, "grad_norm": 1.5390625, "learning_rate": 0.000215389069818021, "loss": 4.8432, "mean_token_accuracy": 0.2271549090743065, "num_tokens": 131214455.0, "step": 75645 }, { "entropy": 6.0099348545074465, "epoch": 5.885819879400895, "grad_norm": 1.4453125, "learning_rate": 0.00021536234508272783, "loss": 5.0655, "mean_token_accuracy": 0.2201812669634819, "num_tokens": 131222855.0, "step": 75650 }, { "entropy": 5.942979335784912, "epoch": 5.886208908772613, "grad_norm": 1.3984375, "learning_rate": 0.00021533562125234125, "loss": 4.8944, "mean_token_accuracy": 0.22255752682685853, "num_tokens": 131231899.0, "step": 75655 }, { "entropy": 5.9647557735443115, "epoch": 5.88659793814433, "grad_norm": 1.625, "learning_rate": 0.00021530889832726652, "loss": 4.8919, "mean_token_accuracy": 0.22657197266817092, "num_tokens": 131239696.0, "step": 75660 }, { "entropy": 5.964805841445923, "epoch": 5.886986967516047, "grad_norm": 1.53125, "learning_rate": 0.00021528217630790937, "loss": 4.9454, "mean_token_accuracy": 0.22092599272727967, "num_tokens": 131248495.0, "step": 75665 }, { "entropy": 5.947979259490967, "epoch": 5.887375996887765, "grad_norm": 1.59375, "learning_rate": 0.00021525545519467506, "loss": 4.8991, "mean_token_accuracy": 0.22491041719913482, "num_tokens": 131256662.0, "step": 75670 }, { "entropy": 6.076389455795288, "epoch": 5.8877650262594825, "grad_norm": 1.4921875, "learning_rate": 0.00021522873498796912, "loss": 5.1159, "mean_token_accuracy": 0.20593930780887604, "num_tokens": 131266424.0, "step": 75675 }, { "entropy": 5.988425159454346, "epoch": 5.8881540556312, "grad_norm": 1.4609375, "learning_rate": 0.00021520201568819708, "loss": 4.9523, "mean_token_accuracy": 0.21846496760845185, "num_tokens": 131275070.0, "step": 75680 }, { "entropy": 5.953958511352539, "epoch": 5.888543085002918, "grad_norm": 1.6015625, "learning_rate": 0.00021517529729576425, "loss": 4.8626, "mean_token_accuracy": 0.22399222552776338, "num_tokens": 131283138.0, "step": 75685 }, { "entropy": 6.003613615036011, "epoch": 5.888932114374636, "grad_norm": 1.703125, "learning_rate": 0.00021514857981107604, "loss": 4.9059, "mean_token_accuracy": 0.22280484735965728, "num_tokens": 131291284.0, "step": 75690 }, { "entropy": 5.915501117706299, "epoch": 5.889321143746352, "grad_norm": 1.5078125, "learning_rate": 0.00021512186323453786, "loss": 4.875, "mean_token_accuracy": 0.2244104340672493, "num_tokens": 131300377.0, "step": 75695 }, { "entropy": 5.974612188339234, "epoch": 5.88971017311807, "grad_norm": 1.4765625, "learning_rate": 0.00021509514756655514, "loss": 4.9166, "mean_token_accuracy": 0.2197792962193489, "num_tokens": 131309074.0, "step": 75700 }, { "entropy": 5.906082582473755, "epoch": 5.890099202489788, "grad_norm": 1.4140625, "learning_rate": 0.00021506843280753318, "loss": 4.9107, "mean_token_accuracy": 0.21922635287046432, "num_tokens": 131318028.0, "step": 75705 }, { "entropy": 5.96537675857544, "epoch": 5.8904882318615055, "grad_norm": 1.5703125, "learning_rate": 0.00021504171895787738, "loss": 4.954, "mean_token_accuracy": 0.2240684524178505, "num_tokens": 131326141.0, "step": 75710 }, { "entropy": 5.978250026702881, "epoch": 5.890877261233223, "grad_norm": 1.46875, "learning_rate": 0.000215015006017993, "loss": 5.0073, "mean_token_accuracy": 0.21652478575706482, "num_tokens": 131334958.0, "step": 75715 }, { "entropy": 6.014389896392823, "epoch": 5.891266290604941, "grad_norm": 1.5078125, "learning_rate": 0.0002149882939882855, "loss": 5.0207, "mean_token_accuracy": 0.2175044909119606, "num_tokens": 131343752.0, "step": 75720 }, { "entropy": 5.9900815963745115, "epoch": 5.891655319976659, "grad_norm": 1.46875, "learning_rate": 0.00021496158286916011, "loss": 4.9677, "mean_token_accuracy": 0.21860455423593522, "num_tokens": 131352429.0, "step": 75725 }, { "entropy": 5.982416868209839, "epoch": 5.892044349348376, "grad_norm": 1.453125, "learning_rate": 0.00021493487266102202, "loss": 4.9676, "mean_token_accuracy": 0.21308455169200896, "num_tokens": 131360437.0, "step": 75730 }, { "entropy": 5.852781820297241, "epoch": 5.892433378720093, "grad_norm": 1.4609375, "learning_rate": 0.00021490816336427676, "loss": 4.8139, "mean_token_accuracy": 0.22976686507463456, "num_tokens": 131369126.0, "step": 75735 }, { "entropy": 6.021676445007325, "epoch": 5.892822408091811, "grad_norm": 1.46875, "learning_rate": 0.00021488145497932949, "loss": 5.0262, "mean_token_accuracy": 0.21673137694597244, "num_tokens": 131378062.0, "step": 75740 }, { "entropy": 5.962700319290161, "epoch": 5.8932114374635285, "grad_norm": 1.59375, "learning_rate": 0.00021485474750658536, "loss": 4.9495, "mean_token_accuracy": 0.22273496985435487, "num_tokens": 131386244.0, "step": 75745 }, { "entropy": 5.972991895675659, "epoch": 5.893600466835246, "grad_norm": 1.5546875, "learning_rate": 0.00021482804094644976, "loss": 4.9435, "mean_token_accuracy": 0.22451961040496826, "num_tokens": 131394850.0, "step": 75750 }, { "entropy": 6.018024539947509, "epoch": 5.893989496206964, "grad_norm": 1.7109375, "learning_rate": 0.00021480133529932789, "loss": 4.943, "mean_token_accuracy": 0.2180756837129593, "num_tokens": 131402825.0, "step": 75755 }, { "entropy": 5.971045970916748, "epoch": 5.894378525578681, "grad_norm": 1.5390625, "learning_rate": 0.0002147746305656249, "loss": 4.9517, "mean_token_accuracy": 0.2148667871952057, "num_tokens": 131410839.0, "step": 75760 }, { "entropy": 5.9775135040283205, "epoch": 5.894767554950398, "grad_norm": 1.578125, "learning_rate": 0.000214747926745746, "loss": 4.9298, "mean_token_accuracy": 0.21701246201992036, "num_tokens": 131418582.0, "step": 75765 }, { "entropy": 5.949578952789307, "epoch": 5.895156584322116, "grad_norm": 1.59375, "learning_rate": 0.00021472122384009646, "loss": 4.8899, "mean_token_accuracy": 0.22478539496660233, "num_tokens": 131426813.0, "step": 75770 }, { "entropy": 5.9648108959198, "epoch": 5.895545613693834, "grad_norm": 1.625, "learning_rate": 0.0002146945218490814, "loss": 4.9678, "mean_token_accuracy": 0.21769788563251496, "num_tokens": 131436065.0, "step": 75775 }, { "entropy": 5.971624279022217, "epoch": 5.8959346430655515, "grad_norm": 1.6875, "learning_rate": 0.00021466782077310598, "loss": 4.9035, "mean_token_accuracy": 0.22813172936439513, "num_tokens": 131444547.0, "step": 75780 }, { "entropy": 6.011195516586303, "epoch": 5.896323672437269, "grad_norm": 1.3984375, "learning_rate": 0.0002146411206125754, "loss": 4.9152, "mean_token_accuracy": 0.22330242544412612, "num_tokens": 131452904.0, "step": 75785 }, { "entropy": 5.957762861251831, "epoch": 5.896712701808987, "grad_norm": 1.4609375, "learning_rate": 0.00021461442136789472, "loss": 4.9228, "mean_token_accuracy": 0.21901368647813796, "num_tokens": 131462119.0, "step": 75790 }, { "entropy": 5.897545289993286, "epoch": 5.897101731180705, "grad_norm": 1.5546875, "learning_rate": 0.00021458772303946895, "loss": 4.789, "mean_token_accuracy": 0.22688434422016143, "num_tokens": 131470916.0, "step": 75795 }, { "entropy": 5.844310235977173, "epoch": 5.897490760552421, "grad_norm": 1.5390625, "learning_rate": 0.00021456102562770346, "loss": 4.7558, "mean_token_accuracy": 0.23435195535421371, "num_tokens": 131479087.0, "step": 75800 }, { "entropy": 5.966272354125977, "epoch": 5.897879789924139, "grad_norm": 1.65625, "learning_rate": 0.0002145343291330032, "loss": 4.964, "mean_token_accuracy": 0.21106974333524703, "num_tokens": 131487818.0, "step": 75805 }, { "entropy": 5.955660581588745, "epoch": 5.898268819295857, "grad_norm": 1.4453125, "learning_rate": 0.00021450763355577318, "loss": 4.9388, "mean_token_accuracy": 0.2234267547726631, "num_tokens": 131497464.0, "step": 75810 }, { "entropy": 5.986806726455688, "epoch": 5.8986578486675745, "grad_norm": 1.515625, "learning_rate": 0.00021448093889641867, "loss": 4.9184, "mean_token_accuracy": 0.21886376142501832, "num_tokens": 131505909.0, "step": 75815 }, { "entropy": 5.963280248641968, "epoch": 5.899046878039292, "grad_norm": 1.5390625, "learning_rate": 0.0002144542451553445, "loss": 4.9467, "mean_token_accuracy": 0.22219013422727585, "num_tokens": 131515189.0, "step": 75820 }, { "entropy": 6.036799669265747, "epoch": 5.89943590741101, "grad_norm": 1.65625, "learning_rate": 0.0002144275523329558, "loss": 4.9664, "mean_token_accuracy": 0.2268372133374214, "num_tokens": 131524076.0, "step": 75825 }, { "entropy": 5.994196081161499, "epoch": 5.899824936782727, "grad_norm": 1.59375, "learning_rate": 0.00021440086042965762, "loss": 4.9433, "mean_token_accuracy": 0.22480585873126985, "num_tokens": 131532876.0, "step": 75830 }, { "entropy": 5.974919223785401, "epoch": 5.900213966154444, "grad_norm": 1.4921875, "learning_rate": 0.00021437416944585487, "loss": 4.9732, "mean_token_accuracy": 0.22314099818468094, "num_tokens": 131541669.0, "step": 75835 }, { "entropy": 5.964779567718506, "epoch": 5.900602995526162, "grad_norm": 1.5703125, "learning_rate": 0.00021434747938195266, "loss": 4.9791, "mean_token_accuracy": 0.21351983398199081, "num_tokens": 131550337.0, "step": 75840 }, { "entropy": 5.986673831939697, "epoch": 5.90099202489788, "grad_norm": 1.4453125, "learning_rate": 0.00021432079023835587, "loss": 4.9495, "mean_token_accuracy": 0.21799728125333787, "num_tokens": 131559893.0, "step": 75845 }, { "entropy": 6.007574796676636, "epoch": 5.9013810542695975, "grad_norm": 1.5234375, "learning_rate": 0.0002142941020154695, "loss": 5.0267, "mean_token_accuracy": 0.21164468973875045, "num_tokens": 131568557.0, "step": 75850 }, { "entropy": 5.979750347137451, "epoch": 5.901770083641315, "grad_norm": 1.6171875, "learning_rate": 0.00021426741471369855, "loss": 4.9651, "mean_token_accuracy": 0.22452736347913743, "num_tokens": 131577298.0, "step": 75855 }, { "entropy": 5.978922033309937, "epoch": 5.902159113013033, "grad_norm": 1.6015625, "learning_rate": 0.00021424072833344781, "loss": 4.9546, "mean_token_accuracy": 0.21701303422451018, "num_tokens": 131585966.0, "step": 75860 }, { "entropy": 6.023138761520386, "epoch": 5.90254814238475, "grad_norm": 1.703125, "learning_rate": 0.0002142140428751224, "loss": 4.9299, "mean_token_accuracy": 0.21994149386882783, "num_tokens": 131594618.0, "step": 75865 }, { "entropy": 5.991744470596314, "epoch": 5.902937171756467, "grad_norm": 1.578125, "learning_rate": 0.0002141873583391271, "loss": 4.9767, "mean_token_accuracy": 0.2223924919962883, "num_tokens": 131603634.0, "step": 75870 }, { "entropy": 5.926083517074585, "epoch": 5.903326201128185, "grad_norm": 1.546875, "learning_rate": 0.00021416067472586692, "loss": 4.8631, "mean_token_accuracy": 0.22827312499284744, "num_tokens": 131611710.0, "step": 75875 }, { "entropy": 5.898599147796631, "epoch": 5.903715230499903, "grad_norm": 1.6015625, "learning_rate": 0.00021413399203574658, "loss": 4.9603, "mean_token_accuracy": 0.22203667908906938, "num_tokens": 131620636.0, "step": 75880 }, { "entropy": 5.914532995223999, "epoch": 5.9041042598716205, "grad_norm": 1.53125, "learning_rate": 0.00021410731026917106, "loss": 4.8797, "mean_token_accuracy": 0.22430076599121093, "num_tokens": 131629074.0, "step": 75885 }, { "entropy": 5.984271478652954, "epoch": 5.904493289243338, "grad_norm": 1.5078125, "learning_rate": 0.0002140806294265452, "loss": 4.8479, "mean_token_accuracy": 0.22373515963554383, "num_tokens": 131637398.0, "step": 75890 }, { "entropy": 5.954380130767822, "epoch": 5.904882318615055, "grad_norm": 1.515625, "learning_rate": 0.0002140539495082739, "loss": 4.906, "mean_token_accuracy": 0.22087418884038926, "num_tokens": 131645732.0, "step": 75895 }, { "entropy": 5.9468159675598145, "epoch": 5.905271347986773, "grad_norm": 1.4609375, "learning_rate": 0.00021402727051476184, "loss": 4.9431, "mean_token_accuracy": 0.2222451537847519, "num_tokens": 131654519.0, "step": 75900 }, { "entropy": 6.002316236495972, "epoch": 5.90566037735849, "grad_norm": 1.5078125, "learning_rate": 0.0002140005924464139, "loss": 5.0414, "mean_token_accuracy": 0.20920560956001283, "num_tokens": 131663731.0, "step": 75905 }, { "entropy": 6.0468282222747805, "epoch": 5.906049406730208, "grad_norm": 1.5390625, "learning_rate": 0.00021397391530363487, "loss": 4.997, "mean_token_accuracy": 0.21522744446992875, "num_tokens": 131672659.0, "step": 75910 }, { "entropy": 5.945220851898194, "epoch": 5.906438436101926, "grad_norm": 1.4296875, "learning_rate": 0.00021394723908682955, "loss": 4.8218, "mean_token_accuracy": 0.22444464564323424, "num_tokens": 131680978.0, "step": 75915 }, { "entropy": 5.9075664520263675, "epoch": 5.9068274654736435, "grad_norm": 1.6796875, "learning_rate": 0.00021392056379640267, "loss": 4.8736, "mean_token_accuracy": 0.2243838056921959, "num_tokens": 131689491.0, "step": 75920 }, { "entropy": 5.933395576477051, "epoch": 5.907216494845361, "grad_norm": 1.59375, "learning_rate": 0.00021389388943275907, "loss": 4.9745, "mean_token_accuracy": 0.21307849735021592, "num_tokens": 131698519.0, "step": 75925 }, { "entropy": 5.941667938232422, "epoch": 5.907605524217079, "grad_norm": 1.6015625, "learning_rate": 0.00021386721599630333, "loss": 4.9167, "mean_token_accuracy": 0.22358036637306214, "num_tokens": 131707035.0, "step": 75930 }, { "entropy": 5.952823448181152, "epoch": 5.907994553588796, "grad_norm": 1.5859375, "learning_rate": 0.00021384054348744035, "loss": 4.929, "mean_token_accuracy": 0.22395991832017897, "num_tokens": 131715656.0, "step": 75935 }, { "entropy": 5.967580366134643, "epoch": 5.908383582960513, "grad_norm": 1.5625, "learning_rate": 0.0002138138719065748, "loss": 4.9716, "mean_token_accuracy": 0.22600956559181212, "num_tokens": 131723916.0, "step": 75940 }, { "entropy": 5.977602481842041, "epoch": 5.908772612332231, "grad_norm": 1.3828125, "learning_rate": 0.0002137872012541114, "loss": 4.9865, "mean_token_accuracy": 0.21291892379522323, "num_tokens": 131732818.0, "step": 75945 }, { "entropy": 5.90695013999939, "epoch": 5.909161641703949, "grad_norm": 1.4765625, "learning_rate": 0.00021376053153045473, "loss": 4.8937, "mean_token_accuracy": 0.22568605691194535, "num_tokens": 131741287.0, "step": 75950 }, { "entropy": 5.988749217987061, "epoch": 5.9095506710756665, "grad_norm": 1.546875, "learning_rate": 0.00021373386273600953, "loss": 4.938, "mean_token_accuracy": 0.21693199574947358, "num_tokens": 131749167.0, "step": 75955 }, { "entropy": 5.954548263549805, "epoch": 5.909939700447384, "grad_norm": 1.46875, "learning_rate": 0.00021370719487118046, "loss": 4.9452, "mean_token_accuracy": 0.22163229286670685, "num_tokens": 131757588.0, "step": 75960 }, { "entropy": 6.000315570831299, "epoch": 5.910328729819101, "grad_norm": 1.5, "learning_rate": 0.0002136805279363721, "loss": 4.9828, "mean_token_accuracy": 0.21620805710554122, "num_tokens": 131766128.0, "step": 75965 }, { "entropy": 6.072630119323731, "epoch": 5.910717759190819, "grad_norm": 1.515625, "learning_rate": 0.00021365386193198917, "loss": 4.9935, "mean_token_accuracy": 0.21735645234584808, "num_tokens": 131773923.0, "step": 75970 }, { "entropy": 5.931922960281372, "epoch": 5.911106788562536, "grad_norm": 1.5546875, "learning_rate": 0.0002136271968584363, "loss": 4.8731, "mean_token_accuracy": 0.22980883568525315, "num_tokens": 131782359.0, "step": 75975 }, { "entropy": 5.96781587600708, "epoch": 5.911495817934254, "grad_norm": 1.5859375, "learning_rate": 0.00021360053271611795, "loss": 4.9267, "mean_token_accuracy": 0.2190510094165802, "num_tokens": 131790394.0, "step": 75980 }, { "entropy": 5.9741966247558596, "epoch": 5.911884847305972, "grad_norm": 1.59375, "learning_rate": 0.00021357386950543884, "loss": 5.0478, "mean_token_accuracy": 0.20757967829704285, "num_tokens": 131798812.0, "step": 75985 }, { "entropy": 5.903533887863159, "epoch": 5.912273876677689, "grad_norm": 1.4609375, "learning_rate": 0.00021354720722680347, "loss": 4.8859, "mean_token_accuracy": 0.2236032098531723, "num_tokens": 131806938.0, "step": 75990 }, { "entropy": 5.955878829956054, "epoch": 5.912662906049407, "grad_norm": 1.4296875, "learning_rate": 0.00021352054588061632, "loss": 4.9818, "mean_token_accuracy": 0.21862297207117082, "num_tokens": 131815995.0, "step": 75995 }, { "entropy": 5.9811145782470705, "epoch": 5.913051935421124, "grad_norm": 1.4453125, "learning_rate": 0.0002134938854672821, "loss": 4.8926, "mean_token_accuracy": 0.2151590868830681, "num_tokens": 131824258.0, "step": 76000 }, { "entropy": 5.994270086288452, "epoch": 5.913440964792842, "grad_norm": 1.40625, "learning_rate": 0.00021346722598720536, "loss": 4.9781, "mean_token_accuracy": 0.217181196808815, "num_tokens": 131832410.0, "step": 76005 }, { "entropy": 5.981575441360474, "epoch": 5.913829994164559, "grad_norm": 1.5546875, "learning_rate": 0.00021344056744079044, "loss": 4.9068, "mean_token_accuracy": 0.22308890223503114, "num_tokens": 131840753.0, "step": 76010 }, { "entropy": 5.948577499389648, "epoch": 5.914219023536277, "grad_norm": 1.546875, "learning_rate": 0.00021341390982844194, "loss": 4.9138, "mean_token_accuracy": 0.21866722106933595, "num_tokens": 131848724.0, "step": 76015 }, { "entropy": 5.974097061157226, "epoch": 5.914608052907995, "grad_norm": 1.46875, "learning_rate": 0.00021338725315056434, "loss": 5.0642, "mean_token_accuracy": 0.2120060384273529, "num_tokens": 131857393.0, "step": 76020 }, { "entropy": 6.040370273590088, "epoch": 5.914997082279712, "grad_norm": 1.3984375, "learning_rate": 0.00021336059740756214, "loss": 5.0559, "mean_token_accuracy": 0.20803145468235015, "num_tokens": 131867450.0, "step": 76025 }, { "entropy": 5.994358205795288, "epoch": 5.915386111651429, "grad_norm": 1.484375, "learning_rate": 0.00021333394259983975, "loss": 4.9108, "mean_token_accuracy": 0.22007979452610016, "num_tokens": 131875494.0, "step": 76030 }, { "entropy": 5.965454530715943, "epoch": 5.915775141023147, "grad_norm": 1.359375, "learning_rate": 0.00021330728872780158, "loss": 4.9792, "mean_token_accuracy": 0.21237826049327851, "num_tokens": 131884867.0, "step": 76035 }, { "entropy": 6.029264116287232, "epoch": 5.916164170394865, "grad_norm": 1.4921875, "learning_rate": 0.00021328063579185213, "loss": 5.0149, "mean_token_accuracy": 0.21859276294708252, "num_tokens": 131893173.0, "step": 76040 }, { "entropy": 5.925900077819824, "epoch": 5.916553199766582, "grad_norm": 1.546875, "learning_rate": 0.0002132539837923958, "loss": 4.9276, "mean_token_accuracy": 0.22561073899269105, "num_tokens": 131901696.0, "step": 76045 }, { "entropy": 5.928811073303223, "epoch": 5.9169422291383, "grad_norm": 1.46875, "learning_rate": 0.00021322733272983703, "loss": 4.8441, "mean_token_accuracy": 0.22970204055309296, "num_tokens": 131910066.0, "step": 76050 }, { "entropy": 5.891610193252563, "epoch": 5.917331258510018, "grad_norm": 1.609375, "learning_rate": 0.00021320068260458015, "loss": 4.8506, "mean_token_accuracy": 0.224024261534214, "num_tokens": 131918169.0, "step": 76055 }, { "entropy": 5.898797035217285, "epoch": 5.917720287881735, "grad_norm": 1.484375, "learning_rate": 0.00021317403341702945, "loss": 4.9005, "mean_token_accuracy": 0.21719679832458497, "num_tokens": 131927746.0, "step": 76060 }, { "entropy": 6.022747659683228, "epoch": 5.918109317253453, "grad_norm": 1.5546875, "learning_rate": 0.00021314738516758946, "loss": 5.0116, "mean_token_accuracy": 0.2127477928996086, "num_tokens": 131937044.0, "step": 76065 }, { "entropy": 5.946790599822998, "epoch": 5.91849834662517, "grad_norm": 1.4765625, "learning_rate": 0.0002131207378566644, "loss": 4.9416, "mean_token_accuracy": 0.22318791896104812, "num_tokens": 131945990.0, "step": 76070 }, { "entropy": 5.931189107894897, "epoch": 5.918887375996888, "grad_norm": 1.515625, "learning_rate": 0.00021309409148465876, "loss": 4.8261, "mean_token_accuracy": 0.22401141375303268, "num_tokens": 131954153.0, "step": 76075 }, { "entropy": 5.966889142990112, "epoch": 5.919276405368605, "grad_norm": 1.5078125, "learning_rate": 0.0002130674460519767, "loss": 4.9204, "mean_token_accuracy": 0.22252853214740753, "num_tokens": 131962628.0, "step": 76080 }, { "entropy": 5.965726661682129, "epoch": 5.919665434740323, "grad_norm": 1.4140625, "learning_rate": 0.00021304080155902256, "loss": 4.9884, "mean_token_accuracy": 0.21511397659778594, "num_tokens": 131971158.0, "step": 76085 }, { "entropy": 5.9635313034057615, "epoch": 5.920054464112041, "grad_norm": 1.4140625, "learning_rate": 0.00021301415800620066, "loss": 4.931, "mean_token_accuracy": 0.22572052329778672, "num_tokens": 131979854.0, "step": 76090 }, { "entropy": 6.051819372177124, "epoch": 5.9204434934837575, "grad_norm": 1.5546875, "learning_rate": 0.00021298751539391525, "loss": 5.0362, "mean_token_accuracy": 0.2150921791791916, "num_tokens": 131987271.0, "step": 76095 }, { "entropy": 6.021653890609741, "epoch": 5.920832522855475, "grad_norm": 1.640625, "learning_rate": 0.0002129608737225706, "loss": 5.0652, "mean_token_accuracy": 0.21265406161546707, "num_tokens": 131995897.0, "step": 76100 }, { "entropy": 5.9407209873199465, "epoch": 5.921221552227193, "grad_norm": 1.5234375, "learning_rate": 0.00021293423299257092, "loss": 4.8781, "mean_token_accuracy": 0.22856495380401612, "num_tokens": 132004723.0, "step": 76105 }, { "entropy": 6.022292995452881, "epoch": 5.921610581598911, "grad_norm": 1.578125, "learning_rate": 0.00021290759320432046, "loss": 4.9769, "mean_token_accuracy": 0.21723985373973848, "num_tokens": 132013345.0, "step": 76110 }, { "entropy": 6.000735950469971, "epoch": 5.921999610970628, "grad_norm": 1.515625, "learning_rate": 0.0002128809543582234, "loss": 5.0195, "mean_token_accuracy": 0.21672162264585496, "num_tokens": 132022206.0, "step": 76115 }, { "entropy": 5.993424129486084, "epoch": 5.922388640342346, "grad_norm": 1.5390625, "learning_rate": 0.00021285431645468405, "loss": 4.9622, "mean_token_accuracy": 0.21868382543325424, "num_tokens": 132031316.0, "step": 76120 }, { "entropy": 6.041905069351197, "epoch": 5.922777669714064, "grad_norm": 1.4296875, "learning_rate": 0.00021282767949410653, "loss": 4.9919, "mean_token_accuracy": 0.2187298357486725, "num_tokens": 132039836.0, "step": 76125 }, { "entropy": 6.018416547775269, "epoch": 5.923166699085781, "grad_norm": 1.609375, "learning_rate": 0.00021280104347689495, "loss": 5.0108, "mean_token_accuracy": 0.20694769769906998, "num_tokens": 132048773.0, "step": 76130 }, { "entropy": 5.951013565063477, "epoch": 5.923555728457498, "grad_norm": 1.625, "learning_rate": 0.00021277440840345363, "loss": 4.882, "mean_token_accuracy": 0.22289179861545563, "num_tokens": 132056645.0, "step": 76135 }, { "entropy": 5.867643356323242, "epoch": 5.923944757829216, "grad_norm": 1.46875, "learning_rate": 0.00021274777427418657, "loss": 4.8619, "mean_token_accuracy": 0.21571651548147203, "num_tokens": 132065400.0, "step": 76140 }, { "entropy": 5.929050016403198, "epoch": 5.924333787200934, "grad_norm": 1.4921875, "learning_rate": 0.00021272114108949797, "loss": 4.9772, "mean_token_accuracy": 0.21824582666158676, "num_tokens": 132073985.0, "step": 76145 }, { "entropy": 5.92439227104187, "epoch": 5.924722816572651, "grad_norm": 1.4921875, "learning_rate": 0.0002126945088497919, "loss": 4.8931, "mean_token_accuracy": 0.22408050000667573, "num_tokens": 132082711.0, "step": 76150 }, { "entropy": 5.917526769638061, "epoch": 5.925111845944369, "grad_norm": 1.46875, "learning_rate": 0.0002126678775554725, "loss": 4.8491, "mean_token_accuracy": 0.22800713181495666, "num_tokens": 132091580.0, "step": 76155 }, { "entropy": 5.962390470504761, "epoch": 5.925500875316087, "grad_norm": 1.59375, "learning_rate": 0.0002126412472069439, "loss": 4.9093, "mean_token_accuracy": 0.22120893895626068, "num_tokens": 132100183.0, "step": 76160 }, { "entropy": 5.968575477600098, "epoch": 5.9258899046878035, "grad_norm": 1.5234375, "learning_rate": 0.00021261461780461006, "loss": 4.9366, "mean_token_accuracy": 0.220784692466259, "num_tokens": 132109319.0, "step": 76165 }, { "entropy": 5.963030672073364, "epoch": 5.926278934059521, "grad_norm": 1.5625, "learning_rate": 0.00021258798934887513, "loss": 4.9503, "mean_token_accuracy": 0.21764845103025438, "num_tokens": 132118045.0, "step": 76170 }, { "entropy": 6.040059900283813, "epoch": 5.926667963431239, "grad_norm": 1.609375, "learning_rate": 0.00021256136184014313, "loss": 5.0143, "mean_token_accuracy": 0.2187262937426567, "num_tokens": 132126714.0, "step": 76175 }, { "entropy": 5.939790105819702, "epoch": 5.927056992802957, "grad_norm": 1.5, "learning_rate": 0.00021253473527881806, "loss": 4.9163, "mean_token_accuracy": 0.22141444981098174, "num_tokens": 132135603.0, "step": 76180 }, { "entropy": 6.035864686965942, "epoch": 5.927446022174674, "grad_norm": 1.46875, "learning_rate": 0.00021250810966530392, "loss": 4.9687, "mean_token_accuracy": 0.2188978001475334, "num_tokens": 132145306.0, "step": 76185 }, { "entropy": 5.990002679824829, "epoch": 5.927835051546392, "grad_norm": 1.5546875, "learning_rate": 0.0002124814850000048, "loss": 4.9587, "mean_token_accuracy": 0.21399222314357758, "num_tokens": 132153336.0, "step": 76190 }, { "entropy": 5.995144510269165, "epoch": 5.92822408091811, "grad_norm": 1.5390625, "learning_rate": 0.00021245486128332458, "loss": 4.9018, "mean_token_accuracy": 0.22614268064498902, "num_tokens": 132161649.0, "step": 76195 }, { "entropy": 5.962189674377441, "epoch": 5.9286131102898265, "grad_norm": 1.5390625, "learning_rate": 0.00021242823851566733, "loss": 4.893, "mean_token_accuracy": 0.22498476207256318, "num_tokens": 132170491.0, "step": 76200 }, { "entropy": 6.002477693557739, "epoch": 5.929002139661544, "grad_norm": 1.453125, "learning_rate": 0.00021240161669743696, "loss": 5.0142, "mean_token_accuracy": 0.2159342497587204, "num_tokens": 132178635.0, "step": 76205 }, { "entropy": 5.905142402648925, "epoch": 5.929391169033262, "grad_norm": 1.4375, "learning_rate": 0.0002123749958290374, "loss": 4.8375, "mean_token_accuracy": 0.22697214037179947, "num_tokens": 132188293.0, "step": 76210 }, { "entropy": 5.90825629234314, "epoch": 5.92978019840498, "grad_norm": 1.6171875, "learning_rate": 0.0002123483759108727, "loss": 4.8609, "mean_token_accuracy": 0.22335285395383836, "num_tokens": 132197184.0, "step": 76215 }, { "entropy": 5.984269094467163, "epoch": 5.930169227776697, "grad_norm": 1.546875, "learning_rate": 0.00021232175694334653, "loss": 4.9772, "mean_token_accuracy": 0.22193194478750228, "num_tokens": 132205388.0, "step": 76220 }, { "entropy": 5.978462791442871, "epoch": 5.930558257148415, "grad_norm": 1.5078125, "learning_rate": 0.00021229513892686303, "loss": 4.9827, "mean_token_accuracy": 0.21611057370901107, "num_tokens": 132213711.0, "step": 76225 }, { "entropy": 6.034187889099121, "epoch": 5.930947286520132, "grad_norm": 1.59375, "learning_rate": 0.000212268521861826, "loss": 5.0246, "mean_token_accuracy": 0.21345863193273545, "num_tokens": 132222295.0, "step": 76230 }, { "entropy": 6.016640090942383, "epoch": 5.9313363158918495, "grad_norm": 1.703125, "learning_rate": 0.0002122419057486393, "loss": 4.9208, "mean_token_accuracy": 0.218939471244812, "num_tokens": 132230750.0, "step": 76235 }, { "entropy": 6.001356315612793, "epoch": 5.931725345263567, "grad_norm": 1.609375, "learning_rate": 0.00021221529058770673, "loss": 4.9121, "mean_token_accuracy": 0.2259412318468094, "num_tokens": 132238385.0, "step": 76240 }, { "entropy": 5.951796007156372, "epoch": 5.932114374635285, "grad_norm": 1.4765625, "learning_rate": 0.00021218867637943224, "loss": 4.9482, "mean_token_accuracy": 0.21261410564184188, "num_tokens": 132247702.0, "step": 76245 }, { "entropy": 6.01995816230774, "epoch": 5.932503404007003, "grad_norm": 1.5234375, "learning_rate": 0.0002121620631242196, "loss": 5.0102, "mean_token_accuracy": 0.21508917659521104, "num_tokens": 132256766.0, "step": 76250 }, { "entropy": 5.9945070266723635, "epoch": 5.93289243337872, "grad_norm": 1.4921875, "learning_rate": 0.00021213545082247266, "loss": 4.9246, "mean_token_accuracy": 0.22606377601623534, "num_tokens": 132265034.0, "step": 76255 }, { "entropy": 5.953047609329223, "epoch": 5.933281462750438, "grad_norm": 1.484375, "learning_rate": 0.00021210883947459509, "loss": 4.8998, "mean_token_accuracy": 0.23012032210826874, "num_tokens": 132273721.0, "step": 76260 }, { "entropy": 5.9472228527069095, "epoch": 5.933670492122156, "grad_norm": 1.3984375, "learning_rate": 0.00021208222908099085, "loss": 4.9148, "mean_token_accuracy": 0.22382429838180543, "num_tokens": 132282890.0, "step": 76265 }, { "entropy": 5.977645397186279, "epoch": 5.9340595214938725, "grad_norm": 1.5, "learning_rate": 0.0002120556196420636, "loss": 4.9666, "mean_token_accuracy": 0.2156862735748291, "num_tokens": 132291509.0, "step": 76270 }, { "entropy": 5.93904480934143, "epoch": 5.93444855086559, "grad_norm": 1.5859375, "learning_rate": 0.00021202901115821728, "loss": 4.8251, "mean_token_accuracy": 0.2253840908408165, "num_tokens": 132299762.0, "step": 76275 }, { "entropy": 5.933605527877807, "epoch": 5.934837580237308, "grad_norm": 1.4453125, "learning_rate": 0.0002120024036298554, "loss": 4.9213, "mean_token_accuracy": 0.22036652714014054, "num_tokens": 132308573.0, "step": 76280 }, { "entropy": 5.9672215461730955, "epoch": 5.935226609609026, "grad_norm": 1.421875, "learning_rate": 0.00021197579705738173, "loss": 4.9822, "mean_token_accuracy": 0.21302978843450546, "num_tokens": 132317211.0, "step": 76285 }, { "entropy": 5.965671253204346, "epoch": 5.935615638980743, "grad_norm": 1.578125, "learning_rate": 0.00021194919144120006, "loss": 4.9905, "mean_token_accuracy": 0.21808684319257737, "num_tokens": 132325920.0, "step": 76290 }, { "entropy": 5.970162963867187, "epoch": 5.936004668352461, "grad_norm": 1.4375, "learning_rate": 0.00021192258678171406, "loss": 4.9827, "mean_token_accuracy": 0.21107023507356643, "num_tokens": 132334886.0, "step": 76295 }, { "entropy": 5.979976034164428, "epoch": 5.936393697724178, "grad_norm": 1.484375, "learning_rate": 0.0002118959830793274, "loss": 4.9101, "mean_token_accuracy": 0.21509451419115067, "num_tokens": 132344586.0, "step": 76300 }, { "entropy": 5.969796800613404, "epoch": 5.9367827270958955, "grad_norm": 1.4765625, "learning_rate": 0.00021186938033444382, "loss": 4.9495, "mean_token_accuracy": 0.21757058501243592, "num_tokens": 132353716.0, "step": 76305 }, { "entropy": 5.9717775821685795, "epoch": 5.937171756467613, "grad_norm": 1.421875, "learning_rate": 0.00021184277854746682, "loss": 4.9589, "mean_token_accuracy": 0.21845427751541138, "num_tokens": 132363213.0, "step": 76310 }, { "entropy": 5.995095252990723, "epoch": 5.937560785839331, "grad_norm": 1.703125, "learning_rate": 0.00021181617771880013, "loss": 4.9609, "mean_token_accuracy": 0.223108272254467, "num_tokens": 132372222.0, "step": 76315 }, { "entropy": 5.956013822555542, "epoch": 5.937949815211049, "grad_norm": 1.484375, "learning_rate": 0.00021178957784884745, "loss": 4.9316, "mean_token_accuracy": 0.22291901260614394, "num_tokens": 132380886.0, "step": 76320 }, { "entropy": 5.97578797340393, "epoch": 5.938338844582766, "grad_norm": 1.734375, "learning_rate": 0.00021176297893801222, "loss": 4.898, "mean_token_accuracy": 0.22731840312480928, "num_tokens": 132389443.0, "step": 76325 }, { "entropy": 5.95592999458313, "epoch": 5.938727873954484, "grad_norm": 1.5859375, "learning_rate": 0.00021173638098669818, "loss": 4.8807, "mean_token_accuracy": 0.22008594125509262, "num_tokens": 132397700.0, "step": 76330 }, { "entropy": 5.95688419342041, "epoch": 5.939116903326201, "grad_norm": 1.515625, "learning_rate": 0.0002117097839953089, "loss": 4.9352, "mean_token_accuracy": 0.22258417308330536, "num_tokens": 132406556.0, "step": 76335 }, { "entropy": 5.996276760101319, "epoch": 5.9395059326979185, "grad_norm": 1.4921875, "learning_rate": 0.00021168318796424784, "loss": 4.9441, "mean_token_accuracy": 0.2200467362999916, "num_tokens": 132415062.0, "step": 76340 }, { "entropy": 5.983078813552856, "epoch": 5.939894962069636, "grad_norm": 1.6484375, "learning_rate": 0.00021165659289391865, "loss": 4.903, "mean_token_accuracy": 0.2285816863179207, "num_tokens": 132423732.0, "step": 76345 }, { "entropy": 5.9513458728790285, "epoch": 5.940283991441354, "grad_norm": 1.6640625, "learning_rate": 0.0002116299987847249, "loss": 4.9841, "mean_token_accuracy": 0.22003257274627686, "num_tokens": 132432524.0, "step": 76350 }, { "entropy": 5.9460986137390135, "epoch": 5.940673020813072, "grad_norm": 1.4765625, "learning_rate": 0.00021160340563707004, "loss": 4.877, "mean_token_accuracy": 0.23558858036994934, "num_tokens": 132442195.0, "step": 76355 }, { "entropy": 5.904898595809937, "epoch": 5.941062050184789, "grad_norm": 1.421875, "learning_rate": 0.00021157681345135754, "loss": 4.8815, "mean_token_accuracy": 0.22475899010896683, "num_tokens": 132451488.0, "step": 76360 }, { "entropy": 5.887748289108276, "epoch": 5.941451079556506, "grad_norm": 1.5703125, "learning_rate": 0.00021155022222799097, "loss": 4.8686, "mean_token_accuracy": 0.22398218363523484, "num_tokens": 132460343.0, "step": 76365 }, { "entropy": 6.036226367950439, "epoch": 5.941840108928224, "grad_norm": 1.5078125, "learning_rate": 0.00021152363196737378, "loss": 5.0504, "mean_token_accuracy": 0.21844153255224227, "num_tokens": 132469700.0, "step": 76370 }, { "entropy": 5.946969652175904, "epoch": 5.9422291382999415, "grad_norm": 1.421875, "learning_rate": 0.0002114970426699095, "loss": 4.8965, "mean_token_accuracy": 0.22064703553915024, "num_tokens": 132478181.0, "step": 76375 }, { "entropy": 5.98697190284729, "epoch": 5.942618167671659, "grad_norm": 1.3828125, "learning_rate": 0.00021147045433600142, "loss": 4.9197, "mean_token_accuracy": 0.21854668110609055, "num_tokens": 132487664.0, "step": 76380 }, { "entropy": 6.015982341766358, "epoch": 5.943007197043377, "grad_norm": 1.5234375, "learning_rate": 0.00021144386696605316, "loss": 5.0216, "mean_token_accuracy": 0.20751693546772004, "num_tokens": 132496657.0, "step": 76385 }, { "entropy": 6.005096054077148, "epoch": 5.943396226415095, "grad_norm": 1.515625, "learning_rate": 0.00021141728056046804, "loss": 5.0417, "mean_token_accuracy": 0.21228197067975998, "num_tokens": 132506225.0, "step": 76390 }, { "entropy": 5.983226633071899, "epoch": 5.943785255786812, "grad_norm": 1.4921875, "learning_rate": 0.00021139069511964942, "loss": 4.9289, "mean_token_accuracy": 0.22022390216588975, "num_tokens": 132514922.0, "step": 76395 }, { "entropy": 6.009896516799927, "epoch": 5.944174285158529, "grad_norm": 1.546875, "learning_rate": 0.0002113641106440008, "loss": 4.9531, "mean_token_accuracy": 0.21839309632778167, "num_tokens": 132523761.0, "step": 76400 }, { "entropy": 6.001777029037475, "epoch": 5.944563314530247, "grad_norm": 1.6171875, "learning_rate": 0.0002113375271339255, "loss": 4.9659, "mean_token_accuracy": 0.22089091688394547, "num_tokens": 132532483.0, "step": 76405 }, { "entropy": 5.975278234481811, "epoch": 5.9449523439019645, "grad_norm": 1.5, "learning_rate": 0.0002113109445898269, "loss": 4.8765, "mean_token_accuracy": 0.22130245268344878, "num_tokens": 132541177.0, "step": 76410 }, { "entropy": 5.982903671264649, "epoch": 5.945341373273682, "grad_norm": 1.4375, "learning_rate": 0.00021128436301210842, "loss": 4.9991, "mean_token_accuracy": 0.21699151396751404, "num_tokens": 132549806.0, "step": 76415 }, { "entropy": 6.069178104400635, "epoch": 5.9457304026454, "grad_norm": 1.6640625, "learning_rate": 0.00021125778240117327, "loss": 4.9811, "mean_token_accuracy": 0.22431721538305283, "num_tokens": 132557805.0, "step": 76420 }, { "entropy": 5.947932195663452, "epoch": 5.946119432017118, "grad_norm": 1.5546875, "learning_rate": 0.0002112312027574248, "loss": 4.9197, "mean_token_accuracy": 0.22801153510808944, "num_tokens": 132566090.0, "step": 76425 }, { "entropy": 5.918825674057007, "epoch": 5.946508461388834, "grad_norm": 1.5, "learning_rate": 0.00021120462408126634, "loss": 4.9291, "mean_token_accuracy": 0.2184022381901741, "num_tokens": 132574416.0, "step": 76430 }, { "entropy": 5.9341014385223385, "epoch": 5.946897490760552, "grad_norm": 1.5234375, "learning_rate": 0.00021117804637310123, "loss": 4.835, "mean_token_accuracy": 0.22244606167078018, "num_tokens": 132582094.0, "step": 76435 }, { "entropy": 5.917664909362793, "epoch": 5.94728652013227, "grad_norm": 1.515625, "learning_rate": 0.0002111514696333326, "loss": 4.951, "mean_token_accuracy": 0.2150795802474022, "num_tokens": 132590967.0, "step": 76440 }, { "entropy": 5.980406951904297, "epoch": 5.9476755495039875, "grad_norm": 1.5, "learning_rate": 0.00021112489386236383, "loss": 4.9604, "mean_token_accuracy": 0.22194251269102097, "num_tokens": 132599150.0, "step": 76445 }, { "entropy": 6.034422445297241, "epoch": 5.948064578875705, "grad_norm": 1.546875, "learning_rate": 0.00021109831906059807, "loss": 5.0354, "mean_token_accuracy": 0.2103809341788292, "num_tokens": 132608798.0, "step": 76450 }, { "entropy": 5.96384973526001, "epoch": 5.948453608247423, "grad_norm": 1.3828125, "learning_rate": 0.0002110717452284387, "loss": 4.9271, "mean_token_accuracy": 0.22060575634241103, "num_tokens": 132617462.0, "step": 76455 }, { "entropy": 5.975049734115601, "epoch": 5.948842637619141, "grad_norm": 1.46875, "learning_rate": 0.00021104517236628868, "loss": 4.8952, "mean_token_accuracy": 0.2230422243475914, "num_tokens": 132626093.0, "step": 76460 }, { "entropy": 5.980978155136109, "epoch": 5.949231666990858, "grad_norm": 1.609375, "learning_rate": 0.0002110186004745515, "loss": 4.9222, "mean_token_accuracy": 0.2187782883644104, "num_tokens": 132634844.0, "step": 76465 }, { "entropy": 5.94197039604187, "epoch": 5.949620696362575, "grad_norm": 1.6875, "learning_rate": 0.00021099202955363023, "loss": 4.8411, "mean_token_accuracy": 0.22342236936092377, "num_tokens": 132642138.0, "step": 76470 }, { "entropy": 5.988800477981568, "epoch": 5.950009725734293, "grad_norm": 1.609375, "learning_rate": 0.00021096545960392805, "loss": 5.0387, "mean_token_accuracy": 0.21124572157859803, "num_tokens": 132650761.0, "step": 76475 }, { "entropy": 5.983235311508179, "epoch": 5.9503987551060105, "grad_norm": 1.6328125, "learning_rate": 0.00021093889062584803, "loss": 4.9367, "mean_token_accuracy": 0.2210688352584839, "num_tokens": 132660166.0, "step": 76480 }, { "entropy": 6.0448699474334715, "epoch": 5.950787784477728, "grad_norm": 1.4609375, "learning_rate": 0.00021091232261979343, "loss": 4.9138, "mean_token_accuracy": 0.22947245389223098, "num_tokens": 132669766.0, "step": 76485 }, { "entropy": 6.060372829437256, "epoch": 5.951176813849446, "grad_norm": 1.53125, "learning_rate": 0.0002108857555861673, "loss": 5.0461, "mean_token_accuracy": 0.21241808086633682, "num_tokens": 132678524.0, "step": 76490 }, { "entropy": 5.976383399963379, "epoch": 5.9515658432211636, "grad_norm": 1.578125, "learning_rate": 0.00021085918952537275, "loss": 4.9436, "mean_token_accuracy": 0.22428935319185256, "num_tokens": 132687152.0, "step": 76495 }, { "entropy": 6.067989826202393, "epoch": 5.95195487259288, "grad_norm": 1.6171875, "learning_rate": 0.00021083262443781297, "loss": 5.0917, "mean_token_accuracy": 0.2051993802189827, "num_tokens": 132695438.0, "step": 76500 }, { "entropy": 5.993937635421753, "epoch": 5.952343901964598, "grad_norm": 1.6328125, "learning_rate": 0.00021080606032389094, "loss": 4.9082, "mean_token_accuracy": 0.22401574105024338, "num_tokens": 132703746.0, "step": 76505 }, { "entropy": 5.991696977615357, "epoch": 5.952732931336316, "grad_norm": 1.5234375, "learning_rate": 0.0002107794971840098, "loss": 5.0178, "mean_token_accuracy": 0.21880230605602263, "num_tokens": 132713140.0, "step": 76510 }, { "entropy": 5.986170434951783, "epoch": 5.9531219607080335, "grad_norm": 1.40625, "learning_rate": 0.00021075293501857264, "loss": 5.0017, "mean_token_accuracy": 0.21491063386201859, "num_tokens": 132722291.0, "step": 76515 }, { "entropy": 5.985276126861573, "epoch": 5.953510990079751, "grad_norm": 1.5859375, "learning_rate": 0.00021072637382798232, "loss": 4.8949, "mean_token_accuracy": 0.22182900011539458, "num_tokens": 132729794.0, "step": 76520 }, { "entropy": 5.956818771362305, "epoch": 5.953900019451469, "grad_norm": 1.640625, "learning_rate": 0.00021069981361264195, "loss": 4.9016, "mean_token_accuracy": 0.22393874675035477, "num_tokens": 132738052.0, "step": 76525 }, { "entropy": 6.017718839645386, "epoch": 5.9542890488231865, "grad_norm": 1.5078125, "learning_rate": 0.0002106732543729546, "loss": 4.9528, "mean_token_accuracy": 0.23062801510095596, "num_tokens": 132746704.0, "step": 76530 }, { "entropy": 5.954107856750488, "epoch": 5.954678078194903, "grad_norm": 1.5546875, "learning_rate": 0.00021064669610932325, "loss": 4.9065, "mean_token_accuracy": 0.2258006066083908, "num_tokens": 132755752.0, "step": 76535 }, { "entropy": 5.958869361877442, "epoch": 5.955067107566621, "grad_norm": 1.5703125, "learning_rate": 0.00021062013882215086, "loss": 4.8758, "mean_token_accuracy": 0.23096795827150346, "num_tokens": 132764116.0, "step": 76540 }, { "entropy": 5.993494081497192, "epoch": 5.955456136938339, "grad_norm": 1.609375, "learning_rate": 0.00021059358251184046, "loss": 5.0023, "mean_token_accuracy": 0.21509197354316711, "num_tokens": 132772825.0, "step": 76545 }, { "entropy": 5.921010446548462, "epoch": 5.9558451663100564, "grad_norm": 1.484375, "learning_rate": 0.00021056702717879482, "loss": 4.9003, "mean_token_accuracy": 0.22108598053455353, "num_tokens": 132781832.0, "step": 76550 }, { "entropy": 6.059085988998413, "epoch": 5.956234195681774, "grad_norm": 1.609375, "learning_rate": 0.00021054047282341703, "loss": 5.0562, "mean_token_accuracy": 0.21404702216386795, "num_tokens": 132789783.0, "step": 76555 }, { "entropy": 5.956517457962036, "epoch": 5.956623225053492, "grad_norm": 1.5703125, "learning_rate": 0.00021051391944610997, "loss": 4.8954, "mean_token_accuracy": 0.22301306575536728, "num_tokens": 132798034.0, "step": 76560 }, { "entropy": 5.983991575241089, "epoch": 5.957012254425209, "grad_norm": 1.46875, "learning_rate": 0.00021048736704727656, "loss": 4.9358, "mean_token_accuracy": 0.21720358729362488, "num_tokens": 132806384.0, "step": 76565 }, { "entropy": 5.990347480773925, "epoch": 5.957401283796926, "grad_norm": 1.5546875, "learning_rate": 0.00021046081562731966, "loss": 4.9938, "mean_token_accuracy": 0.2164604663848877, "num_tokens": 132815035.0, "step": 76570 }, { "entropy": 6.012320184707642, "epoch": 5.957790313168644, "grad_norm": 1.65625, "learning_rate": 0.00021043426518664216, "loss": 5.0348, "mean_token_accuracy": 0.2125747784972191, "num_tokens": 132823210.0, "step": 76575 }, { "entropy": 6.007803678512573, "epoch": 5.958179342540362, "grad_norm": 1.5390625, "learning_rate": 0.00021040771572564693, "loss": 4.8758, "mean_token_accuracy": 0.23070555329322814, "num_tokens": 132832078.0, "step": 76580 }, { "entropy": 5.963626861572266, "epoch": 5.958568371912079, "grad_norm": 1.5703125, "learning_rate": 0.00021038116724473677, "loss": 4.9204, "mean_token_accuracy": 0.21983421593904495, "num_tokens": 132840642.0, "step": 76585 }, { "entropy": 5.93292202949524, "epoch": 5.958957401283797, "grad_norm": 1.453125, "learning_rate": 0.00021035461974431446, "loss": 4.924, "mean_token_accuracy": 0.22176503390073776, "num_tokens": 132850046.0, "step": 76590 }, { "entropy": 5.993535757064819, "epoch": 5.959346430655515, "grad_norm": 1.6171875, "learning_rate": 0.00021032807322478303, "loss": 4.9499, "mean_token_accuracy": 0.2103102132678032, "num_tokens": 132858342.0, "step": 76595 }, { "entropy": 6.027574300765991, "epoch": 5.9597354600272325, "grad_norm": 1.703125, "learning_rate": 0.00021030152768654515, "loss": 4.977, "mean_token_accuracy": 0.2187955379486084, "num_tokens": 132866010.0, "step": 76600 }, { "entropy": 5.932058811187744, "epoch": 5.960124489398949, "grad_norm": 1.53125, "learning_rate": 0.00021027498313000358, "loss": 4.891, "mean_token_accuracy": 0.22569548189640046, "num_tokens": 132874770.0, "step": 76605 }, { "entropy": 6.013638639450074, "epoch": 5.960513518770667, "grad_norm": 1.5625, "learning_rate": 0.00021024843955556112, "loss": 5.054, "mean_token_accuracy": 0.20791116505861282, "num_tokens": 132882582.0, "step": 76610 }, { "entropy": 5.927585220336914, "epoch": 5.960902548142385, "grad_norm": 1.4609375, "learning_rate": 0.00021022189696362053, "loss": 4.9868, "mean_token_accuracy": 0.2119032233953476, "num_tokens": 132891848.0, "step": 76615 }, { "entropy": 5.996703195571899, "epoch": 5.961291577514102, "grad_norm": 1.5078125, "learning_rate": 0.0002101953553545845, "loss": 4.9582, "mean_token_accuracy": 0.21794053316116332, "num_tokens": 132901508.0, "step": 76620 }, { "entropy": 6.093919849395752, "epoch": 5.96168060688582, "grad_norm": 1.578125, "learning_rate": 0.0002101688147288559, "loss": 5.0563, "mean_token_accuracy": 0.2100182741880417, "num_tokens": 132910220.0, "step": 76625 }, { "entropy": 5.998880195617676, "epoch": 5.962069636257538, "grad_norm": 1.5, "learning_rate": 0.0002101422750868373, "loss": 4.9068, "mean_token_accuracy": 0.21769822537899017, "num_tokens": 132919446.0, "step": 76630 }, { "entropy": 5.993906927108765, "epoch": 5.962458665629255, "grad_norm": 1.515625, "learning_rate": 0.0002101157364289315, "loss": 4.919, "mean_token_accuracy": 0.22167381197214125, "num_tokens": 132927739.0, "step": 76635 }, { "entropy": 5.913827657699585, "epoch": 5.962847695000972, "grad_norm": 1.609375, "learning_rate": 0.00021008919875554105, "loss": 4.8946, "mean_token_accuracy": 0.2217745900154114, "num_tokens": 132935935.0, "step": 76640 }, { "entropy": 5.986498641967773, "epoch": 5.96323672437269, "grad_norm": 1.5390625, "learning_rate": 0.0002100626620670687, "loss": 5.0035, "mean_token_accuracy": 0.21553474217653273, "num_tokens": 132943545.0, "step": 76645 }, { "entropy": 6.003711462020874, "epoch": 5.963625753744408, "grad_norm": 1.6171875, "learning_rate": 0.0002100361263639171, "loss": 5.0122, "mean_token_accuracy": 0.21173954159021377, "num_tokens": 132952284.0, "step": 76650 }, { "entropy": 5.954073286056518, "epoch": 5.964014783116125, "grad_norm": 1.515625, "learning_rate": 0.00021000959164648892, "loss": 4.8624, "mean_token_accuracy": 0.22590485513210296, "num_tokens": 132961251.0, "step": 76655 }, { "entropy": 6.039183902740478, "epoch": 5.964403812487843, "grad_norm": 1.6796875, "learning_rate": 0.00020998305791518668, "loss": 4.9278, "mean_token_accuracy": 0.2174799233675003, "num_tokens": 132969733.0, "step": 76660 }, { "entropy": 5.995110940933228, "epoch": 5.964792841859561, "grad_norm": 1.421875, "learning_rate": 0.0002099565251704131, "loss": 4.9148, "mean_token_accuracy": 0.2190564289689064, "num_tokens": 132977880.0, "step": 76665 }, { "entropy": 6.000592136383057, "epoch": 5.965181871231278, "grad_norm": 1.5234375, "learning_rate": 0.00020992999341257069, "loss": 4.9167, "mean_token_accuracy": 0.22005137354135512, "num_tokens": 132986702.0, "step": 76670 }, { "entropy": 5.993964147567749, "epoch": 5.965570900602995, "grad_norm": 1.546875, "learning_rate": 0.00020990346264206206, "loss": 4.998, "mean_token_accuracy": 0.216702701151371, "num_tokens": 132996506.0, "step": 76675 }, { "entropy": 5.951447296142578, "epoch": 5.965959929974713, "grad_norm": 1.4921875, "learning_rate": 0.00020987693285928977, "loss": 4.889, "mean_token_accuracy": 0.2267771452665329, "num_tokens": 133005259.0, "step": 76680 }, { "entropy": 6.004345226287842, "epoch": 5.966348959346431, "grad_norm": 1.5, "learning_rate": 0.00020985040406465644, "loss": 4.9723, "mean_token_accuracy": 0.21950361132621765, "num_tokens": 133013977.0, "step": 76685 }, { "entropy": 5.942533206939697, "epoch": 5.966737988718148, "grad_norm": 1.4765625, "learning_rate": 0.00020982387625856447, "loss": 4.9008, "mean_token_accuracy": 0.2264646530151367, "num_tokens": 133022887.0, "step": 76690 }, { "entropy": 5.999416255950928, "epoch": 5.967127018089866, "grad_norm": 1.625, "learning_rate": 0.0002097973494414165, "loss": 5.005, "mean_token_accuracy": 0.22284844517707825, "num_tokens": 133031927.0, "step": 76695 }, { "entropy": 5.968070220947266, "epoch": 5.967516047461583, "grad_norm": 1.5703125, "learning_rate": 0.00020977082361361488, "loss": 4.9615, "mean_token_accuracy": 0.2240196242928505, "num_tokens": 133040814.0, "step": 76700 }, { "entropy": 5.986406135559082, "epoch": 5.967905076833301, "grad_norm": 1.5625, "learning_rate": 0.00020974429877556228, "loss": 4.9085, "mean_token_accuracy": 0.21860576570034027, "num_tokens": 133048890.0, "step": 76705 }, { "entropy": 5.956060218811035, "epoch": 5.968294106205018, "grad_norm": 1.5703125, "learning_rate": 0.00020971777492766102, "loss": 4.9277, "mean_token_accuracy": 0.22136975824832916, "num_tokens": 133057618.0, "step": 76710 }, { "entropy": 5.967570352554321, "epoch": 5.968683135576736, "grad_norm": 1.515625, "learning_rate": 0.00020969125207031365, "loss": 4.9321, "mean_token_accuracy": 0.22118736505508424, "num_tokens": 133065766.0, "step": 76715 }, { "entropy": 5.907491779327392, "epoch": 5.969072164948454, "grad_norm": 1.5234375, "learning_rate": 0.00020966473020392256, "loss": 4.8654, "mean_token_accuracy": 0.21503092497587203, "num_tokens": 133074266.0, "step": 76720 }, { "entropy": 6.038563299179077, "epoch": 5.969461194320171, "grad_norm": 1.5, "learning_rate": 0.0002096382093288901, "loss": 4.9939, "mean_token_accuracy": 0.21218398958444595, "num_tokens": 133082662.0, "step": 76725 }, { "entropy": 5.970776605606079, "epoch": 5.969850223691889, "grad_norm": 1.5078125, "learning_rate": 0.00020961168944561888, "loss": 4.9487, "mean_token_accuracy": 0.21506679207086563, "num_tokens": 133091305.0, "step": 76730 }, { "entropy": 5.969977235794067, "epoch": 5.970239253063606, "grad_norm": 1.5078125, "learning_rate": 0.00020958517055451125, "loss": 4.9759, "mean_token_accuracy": 0.21502998918294908, "num_tokens": 133100154.0, "step": 76735 }, { "entropy": 6.028014039993286, "epoch": 5.970628282435324, "grad_norm": 1.703125, "learning_rate": 0.00020955865265596946, "loss": 5.03, "mean_token_accuracy": 0.21870625466108323, "num_tokens": 133108637.0, "step": 76740 }, { "entropy": 5.9332670211792, "epoch": 5.971017311807041, "grad_norm": 1.46875, "learning_rate": 0.000209532135750396, "loss": 4.9362, "mean_token_accuracy": 0.21140479296445847, "num_tokens": 133117463.0, "step": 76745 }, { "entropy": 5.966789960861206, "epoch": 5.971406341178759, "grad_norm": 1.4453125, "learning_rate": 0.00020950561983819316, "loss": 4.9177, "mean_token_accuracy": 0.21949040293693542, "num_tokens": 133126030.0, "step": 76750 }, { "entropy": 5.962873935699463, "epoch": 5.971795370550477, "grad_norm": 1.6171875, "learning_rate": 0.0002094791049197633, "loss": 4.8935, "mean_token_accuracy": 0.22716207504272462, "num_tokens": 133134455.0, "step": 76755 }, { "entropy": 6.019323253631592, "epoch": 5.972184399922194, "grad_norm": 1.5859375, "learning_rate": 0.00020945259099550866, "loss": 4.9714, "mean_token_accuracy": 0.2121277004480362, "num_tokens": 133142846.0, "step": 76760 }, { "entropy": 5.95589246749878, "epoch": 5.972573429293911, "grad_norm": 1.578125, "learning_rate": 0.00020942607806583174, "loss": 4.8933, "mean_token_accuracy": 0.22936320453882217, "num_tokens": 133151551.0, "step": 76765 }, { "entropy": 5.934711933135986, "epoch": 5.972962458665629, "grad_norm": 1.421875, "learning_rate": 0.00020939956613113465, "loss": 4.9092, "mean_token_accuracy": 0.21863277554512023, "num_tokens": 133160457.0, "step": 76770 }, { "entropy": 5.876204156875611, "epoch": 5.973351488037347, "grad_norm": 1.6015625, "learning_rate": 0.00020937305519181976, "loss": 4.803, "mean_token_accuracy": 0.23065300285816193, "num_tokens": 133168159.0, "step": 76775 }, { "entropy": 5.9455420017242435, "epoch": 5.973740517409064, "grad_norm": 1.5546875, "learning_rate": 0.00020934654524828927, "loss": 4.964, "mean_token_accuracy": 0.22638704478740693, "num_tokens": 133176646.0, "step": 76780 }, { "entropy": 6.018430471420288, "epoch": 5.974129546780782, "grad_norm": 1.578125, "learning_rate": 0.0002093200363009455, "loss": 4.9874, "mean_token_accuracy": 0.21489593237638474, "num_tokens": 133184716.0, "step": 76785 }, { "entropy": 6.003715515136719, "epoch": 5.9745185761525, "grad_norm": 1.6171875, "learning_rate": 0.00020929352835019055, "loss": 5.048, "mean_token_accuracy": 0.21338895112276077, "num_tokens": 133192991.0, "step": 76790 }, { "entropy": 5.985891056060791, "epoch": 5.974907605524217, "grad_norm": 1.5, "learning_rate": 0.00020926702139642677, "loss": 4.9149, "mean_token_accuracy": 0.2205267384648323, "num_tokens": 133201785.0, "step": 76795 }, { "entropy": 6.044186973571778, "epoch": 5.975296634895935, "grad_norm": 1.4765625, "learning_rate": 0.00020924051544005636, "loss": 5.001, "mean_token_accuracy": 0.2164405271410942, "num_tokens": 133210618.0, "step": 76800 }, { "entropy": 5.98232135772705, "epoch": 5.975685664267652, "grad_norm": 1.5546875, "learning_rate": 0.00020921401048148137, "loss": 4.9082, "mean_token_accuracy": 0.21804079413414001, "num_tokens": 133218730.0, "step": 76805 }, { "entropy": 5.987695741653442, "epoch": 5.97607469363937, "grad_norm": 1.421875, "learning_rate": 0.00020918750652110414, "loss": 4.9842, "mean_token_accuracy": 0.21163113713264464, "num_tokens": 133227866.0, "step": 76810 }, { "entropy": 5.998150491714478, "epoch": 5.976463723011087, "grad_norm": 1.515625, "learning_rate": 0.00020916100355932677, "loss": 4.9811, "mean_token_accuracy": 0.22020472288131715, "num_tokens": 133236376.0, "step": 76815 }, { "entropy": 5.958772659301758, "epoch": 5.976852752382805, "grad_norm": 1.5703125, "learning_rate": 0.00020913450159655133, "loss": 4.8701, "mean_token_accuracy": 0.23272328227758407, "num_tokens": 133244949.0, "step": 76820 }, { "entropy": 5.998414707183838, "epoch": 5.977241781754523, "grad_norm": 1.6171875, "learning_rate": 0.00020910800063318004, "loss": 4.9791, "mean_token_accuracy": 0.21842104941606522, "num_tokens": 133253082.0, "step": 76825 }, { "entropy": 6.021354913711548, "epoch": 5.97763081112624, "grad_norm": 1.5703125, "learning_rate": 0.0002090815006696149, "loss": 4.9889, "mean_token_accuracy": 0.21992327868938447, "num_tokens": 133261716.0, "step": 76830 }, { "entropy": 5.9231987476348875, "epoch": 5.978019840497957, "grad_norm": 1.4375, "learning_rate": 0.00020905500170625808, "loss": 4.9026, "mean_token_accuracy": 0.2206484094262123, "num_tokens": 133271070.0, "step": 76835 }, { "entropy": 6.019783449172974, "epoch": 5.978408869869675, "grad_norm": 1.484375, "learning_rate": 0.00020902850374351168, "loss": 4.9563, "mean_token_accuracy": 0.21560767889022828, "num_tokens": 133280275.0, "step": 76840 }, { "entropy": 5.99537763595581, "epoch": 5.978797899241393, "grad_norm": 1.5859375, "learning_rate": 0.00020900200678177766, "loss": 4.8692, "mean_token_accuracy": 0.22781355381011964, "num_tokens": 133288890.0, "step": 76845 }, { "entropy": 6.007684898376465, "epoch": 5.97918692861311, "grad_norm": 1.421875, "learning_rate": 0.0002089755108214582, "loss": 5.0261, "mean_token_accuracy": 0.22309363335371019, "num_tokens": 133298318.0, "step": 76850 }, { "entropy": 5.905185890197754, "epoch": 5.979575957984828, "grad_norm": 1.53125, "learning_rate": 0.00020894901586295529, "loss": 4.9037, "mean_token_accuracy": 0.23458901792764664, "num_tokens": 133306601.0, "step": 76855 }, { "entropy": 6.0069451332092285, "epoch": 5.979964987356546, "grad_norm": 1.6171875, "learning_rate": 0.00020892252190667088, "loss": 5.0366, "mean_token_accuracy": 0.21249158531427384, "num_tokens": 133315367.0, "step": 76860 }, { "entropy": 5.926737070083618, "epoch": 5.980354016728263, "grad_norm": 1.5546875, "learning_rate": 0.000208896028953007, "loss": 4.8755, "mean_token_accuracy": 0.22236594557762146, "num_tokens": 133323672.0, "step": 76865 }, { "entropy": 5.985556554794312, "epoch": 5.98074304609998, "grad_norm": 1.4921875, "learning_rate": 0.00020886953700236576, "loss": 4.9367, "mean_token_accuracy": 0.22075784355401992, "num_tokens": 133332111.0, "step": 76870 }, { "entropy": 6.05053596496582, "epoch": 5.981132075471698, "grad_norm": 1.5, "learning_rate": 0.00020884304605514899, "loss": 5.0005, "mean_token_accuracy": 0.2217547655105591, "num_tokens": 133340020.0, "step": 76875 }, { "entropy": 6.051310873031616, "epoch": 5.981521104843416, "grad_norm": 1.5625, "learning_rate": 0.00020881655611175865, "loss": 5.036, "mean_token_accuracy": 0.21145085841417313, "num_tokens": 133349145.0, "step": 76880 }, { "entropy": 5.993061590194702, "epoch": 5.981910134215133, "grad_norm": 1.5859375, "learning_rate": 0.0002087900671725968, "loss": 5.0472, "mean_token_accuracy": 0.2114439055323601, "num_tokens": 133358196.0, "step": 76885 }, { "entropy": 5.96725172996521, "epoch": 5.982299163586851, "grad_norm": 1.546875, "learning_rate": 0.00020876357923806527, "loss": 4.9781, "mean_token_accuracy": 0.21329282373189926, "num_tokens": 133367405.0, "step": 76890 }, { "entropy": 6.012993717193604, "epoch": 5.982688192958569, "grad_norm": 1.515625, "learning_rate": 0.00020873709230856608, "loss": 4.9876, "mean_token_accuracy": 0.21588334441184998, "num_tokens": 133376184.0, "step": 76895 }, { "entropy": 6.053491163253784, "epoch": 5.9830772223302855, "grad_norm": 1.59375, "learning_rate": 0.00020871060638450101, "loss": 4.9948, "mean_token_accuracy": 0.2177640527486801, "num_tokens": 133385316.0, "step": 76900 }, { "entropy": 6.007946872711182, "epoch": 5.983466251702003, "grad_norm": 1.6171875, "learning_rate": 0.0002086841214662719, "loss": 4.895, "mean_token_accuracy": 0.22642500102519988, "num_tokens": 133393847.0, "step": 76905 }, { "entropy": 5.993705415725708, "epoch": 5.983855281073721, "grad_norm": 1.40625, "learning_rate": 0.00020865763755428075, "loss": 4.9658, "mean_token_accuracy": 0.22106704860925674, "num_tokens": 133403252.0, "step": 76910 }, { "entropy": 5.971817064285278, "epoch": 5.984244310445439, "grad_norm": 1.4140625, "learning_rate": 0.00020863115464892935, "loss": 4.9463, "mean_token_accuracy": 0.21253135800361633, "num_tokens": 133413210.0, "step": 76915 }, { "entropy": 5.907345581054687, "epoch": 5.984633339817156, "grad_norm": 1.625, "learning_rate": 0.00020860467275061952, "loss": 4.8542, "mean_token_accuracy": 0.22638775855302812, "num_tokens": 133421105.0, "step": 76920 }, { "entropy": 5.904464483261108, "epoch": 5.985022369188874, "grad_norm": 1.5078125, "learning_rate": 0.00020857819185975308, "loss": 4.9145, "mean_token_accuracy": 0.22159548848867416, "num_tokens": 133430268.0, "step": 76925 }, { "entropy": 6.026965570449829, "epoch": 5.985411398560592, "grad_norm": 1.5234375, "learning_rate": 0.00020855171197673185, "loss": 5.0528, "mean_token_accuracy": 0.20412066727876663, "num_tokens": 133438815.0, "step": 76930 }, { "entropy": 6.01101131439209, "epoch": 5.985800427932309, "grad_norm": 1.5234375, "learning_rate": 0.0002085252331019577, "loss": 4.9836, "mean_token_accuracy": 0.22079085558652878, "num_tokens": 133447178.0, "step": 76935 }, { "entropy": 6.00927848815918, "epoch": 5.986189457304026, "grad_norm": 1.5078125, "learning_rate": 0.00020849875523583234, "loss": 4.9482, "mean_token_accuracy": 0.225357486307621, "num_tokens": 133456765.0, "step": 76940 }, { "entropy": 5.938028287887573, "epoch": 5.986578486675744, "grad_norm": 1.5703125, "learning_rate": 0.00020847227837875743, "loss": 4.897, "mean_token_accuracy": 0.22405486255884172, "num_tokens": 133464916.0, "step": 76945 }, { "entropy": 6.029953527450561, "epoch": 5.986967516047462, "grad_norm": 1.59375, "learning_rate": 0.00020844580253113486, "loss": 4.9873, "mean_token_accuracy": 0.21183068305253983, "num_tokens": 133472954.0, "step": 76950 }, { "entropy": 5.981648063659668, "epoch": 5.987356545419179, "grad_norm": 1.609375, "learning_rate": 0.0002084193276933663, "loss": 4.9236, "mean_token_accuracy": 0.21969530284404754, "num_tokens": 133481370.0, "step": 76955 }, { "entropy": 6.051704931259155, "epoch": 5.987745574790897, "grad_norm": 1.5234375, "learning_rate": 0.0002083928538658535, "loss": 5.035, "mean_token_accuracy": 0.2084259107708931, "num_tokens": 133489839.0, "step": 76960 }, { "entropy": 5.952039623260498, "epoch": 5.988134604162614, "grad_norm": 1.5234375, "learning_rate": 0.00020836638104899808, "loss": 4.9345, "mean_token_accuracy": 0.21670638769865036, "num_tokens": 133498669.0, "step": 76965 }, { "entropy": 6.0337859153747555, "epoch": 5.9885236335343315, "grad_norm": 1.4453125, "learning_rate": 0.0002083399092432018, "loss": 4.986, "mean_token_accuracy": 0.2173389732837677, "num_tokens": 133508424.0, "step": 76970 }, { "entropy": 6.017998600006104, "epoch": 5.988912662906049, "grad_norm": 1.6875, "learning_rate": 0.00020831343844886625, "loss": 4.9453, "mean_token_accuracy": 0.21847324818372726, "num_tokens": 133517166.0, "step": 76975 }, { "entropy": 6.032848834991455, "epoch": 5.989301692277767, "grad_norm": 1.3671875, "learning_rate": 0.00020828696866639324, "loss": 4.9779, "mean_token_accuracy": 0.21819241642951964, "num_tokens": 133526578.0, "step": 76980 }, { "entropy": 5.9617030143737795, "epoch": 5.989690721649485, "grad_norm": 1.5234375, "learning_rate": 0.00020826049989618422, "loss": 4.9655, "mean_token_accuracy": 0.22247709780931474, "num_tokens": 133534835.0, "step": 76985 }, { "entropy": 5.9843724250793455, "epoch": 5.990079751021202, "grad_norm": 1.53125, "learning_rate": 0.00020823403213864077, "loss": 4.982, "mean_token_accuracy": 0.21093514561653137, "num_tokens": 133543906.0, "step": 76990 }, { "entropy": 6.011821222305298, "epoch": 5.99046878039292, "grad_norm": 1.546875, "learning_rate": 0.00020820756539416475, "loss": 4.9354, "mean_token_accuracy": 0.21746853291988372, "num_tokens": 133553113.0, "step": 76995 }, { "entropy": 6.017393302917481, "epoch": 5.990857809764638, "grad_norm": 1.671875, "learning_rate": 0.00020818109966315757, "loss": 4.9614, "mean_token_accuracy": 0.2190835729241371, "num_tokens": 133561369.0, "step": 77000 }, { "entropy": 6.002895355224609, "epoch": 5.9912468391363545, "grad_norm": 1.546875, "learning_rate": 0.00020815463494602095, "loss": 4.949, "mean_token_accuracy": 0.21522486060857773, "num_tokens": 133570359.0, "step": 77005 }, { "entropy": 5.86725344657898, "epoch": 5.991635868508072, "grad_norm": 1.5, "learning_rate": 0.00020812817124315626, "loss": 4.8139, "mean_token_accuracy": 0.2287147432565689, "num_tokens": 133579594.0, "step": 77010 }, { "entropy": 5.982420873641968, "epoch": 5.99202489787979, "grad_norm": 1.484375, "learning_rate": 0.00020810170855496514, "loss": 4.9808, "mean_token_accuracy": 0.2171440303325653, "num_tokens": 133587801.0, "step": 77015 }, { "entropy": 5.96649203300476, "epoch": 5.992413927251508, "grad_norm": 1.6953125, "learning_rate": 0.00020807524688184914, "loss": 4.9417, "mean_token_accuracy": 0.22505539655685425, "num_tokens": 133597333.0, "step": 77020 }, { "entropy": 5.9384620666503904, "epoch": 5.992802956623225, "grad_norm": 1.59375, "learning_rate": 0.0002080487862242097, "loss": 4.8432, "mean_token_accuracy": 0.22624974995851516, "num_tokens": 133605425.0, "step": 77025 }, { "entropy": 5.925303554534912, "epoch": 5.993191985994943, "grad_norm": 1.421875, "learning_rate": 0.0002080223265824484, "loss": 4.857, "mean_token_accuracy": 0.23043868988752364, "num_tokens": 133614332.0, "step": 77030 }, { "entropy": 5.9542076587677, "epoch": 5.99358101536666, "grad_norm": 1.484375, "learning_rate": 0.00020799586795696668, "loss": 4.8583, "mean_token_accuracy": 0.2232855036854744, "num_tokens": 133622608.0, "step": 77035 }, { "entropy": 5.913707304000854, "epoch": 5.9939700447383775, "grad_norm": 1.5703125, "learning_rate": 0.00020796941034816602, "loss": 4.8976, "mean_token_accuracy": 0.21951364427804948, "num_tokens": 133631117.0, "step": 77040 }, { "entropy": 6.017784690856933, "epoch": 5.994359074110095, "grad_norm": 1.328125, "learning_rate": 0.0002079429537564479, "loss": 5.0096, "mean_token_accuracy": 0.21839469522237778, "num_tokens": 133640483.0, "step": 77045 }, { "entropy": 6.041435861587525, "epoch": 5.994748103481813, "grad_norm": 1.546875, "learning_rate": 0.00020791649818221365, "loss": 5.043, "mean_token_accuracy": 0.21378972232341767, "num_tokens": 133649251.0, "step": 77050 }, { "entropy": 6.000570344924927, "epoch": 5.995137132853531, "grad_norm": 1.5078125, "learning_rate": 0.00020789004362586477, "loss": 5.0028, "mean_token_accuracy": 0.20864510983228685, "num_tokens": 133658438.0, "step": 77055 }, { "entropy": 5.964153385162353, "epoch": 5.995526162225248, "grad_norm": 1.4453125, "learning_rate": 0.0002078635900878027, "loss": 4.9462, "mean_token_accuracy": 0.21100929677486419, "num_tokens": 133668184.0, "step": 77060 }, { "entropy": 5.916752672195434, "epoch": 5.995915191596966, "grad_norm": 1.4140625, "learning_rate": 0.00020783713756842876, "loss": 4.8955, "mean_token_accuracy": 0.22271228581666946, "num_tokens": 133676807.0, "step": 77065 }, { "entropy": 5.902385139465332, "epoch": 5.996304220968683, "grad_norm": 1.46875, "learning_rate": 0.0002078106860681444, "loss": 4.8485, "mean_token_accuracy": 0.22798672467470169, "num_tokens": 133685492.0, "step": 77070 }, { "entropy": 5.940501689910889, "epoch": 5.9966932503404005, "grad_norm": 1.578125, "learning_rate": 0.00020778423558735087, "loss": 4.8951, "mean_token_accuracy": 0.2226317211985588, "num_tokens": 133693683.0, "step": 77075 }, { "entropy": 5.978494930267334, "epoch": 5.997082279712118, "grad_norm": 1.578125, "learning_rate": 0.0002077577861264497, "loss": 4.9016, "mean_token_accuracy": 0.22277920246124266, "num_tokens": 133702323.0, "step": 77080 }, { "entropy": 5.9431970596313475, "epoch": 5.997471309083836, "grad_norm": 1.4609375, "learning_rate": 0.00020773133768584208, "loss": 5.0221, "mean_token_accuracy": 0.20935623496770858, "num_tokens": 133711481.0, "step": 77085 }, { "entropy": 5.97619366645813, "epoch": 5.9978603384555536, "grad_norm": 1.71875, "learning_rate": 0.00020770489026592927, "loss": 4.9237, "mean_token_accuracy": 0.21824227571487426, "num_tokens": 133719823.0, "step": 77090 }, { "entropy": 5.99796838760376, "epoch": 5.998249367827271, "grad_norm": 1.5703125, "learning_rate": 0.00020767844386711265, "loss": 4.9571, "mean_token_accuracy": 0.21242578327655792, "num_tokens": 133728016.0, "step": 77095 }, { "entropy": 6.016863441467285, "epoch": 5.998638397198988, "grad_norm": 1.5078125, "learning_rate": 0.0002076519984897935, "loss": 5.0258, "mean_token_accuracy": 0.21622181832790374, "num_tokens": 133735881.0, "step": 77100 }, { "entropy": 5.923881196975708, "epoch": 5.999027426570706, "grad_norm": 1.5546875, "learning_rate": 0.00020762555413437306, "loss": 4.9464, "mean_token_accuracy": 0.2273606464266777, "num_tokens": 133744779.0, "step": 77105 }, { "entropy": 6.005107355117798, "epoch": 5.9994164559424235, "grad_norm": 1.6171875, "learning_rate": 0.0002075991108012526, "loss": 5.0063, "mean_token_accuracy": 0.22038340121507644, "num_tokens": 133753199.0, "step": 77110 }, { "entropy": 5.972241163253784, "epoch": 5.999805485314141, "grad_norm": 1.46875, "learning_rate": 0.0002075726684908334, "loss": 4.8557, "mean_token_accuracy": 0.22678070068359374, "num_tokens": 133762417.0, "step": 77115 }, { "entropy": 6.006879647572835, "epoch": 6.000155611748687, "grad_norm": 1.5078125, "learning_rate": 0.00020754622720351663, "loss": 5.001, "mean_token_accuracy": 0.21360349655151367, "num_tokens": 133769537.0, "step": 77120 }, { "entropy": 5.963804054260254, "epoch": 6.000544641120404, "grad_norm": 1.703125, "learning_rate": 0.00020751978693970335, "loss": 4.8998, "mean_token_accuracy": 0.22788792997598648, "num_tokens": 133778328.0, "step": 77125 }, { "entropy": 5.984372568130493, "epoch": 6.000933670492122, "grad_norm": 1.4765625, "learning_rate": 0.00020749334769979506, "loss": 4.9204, "mean_token_accuracy": 0.21725817918777465, "num_tokens": 133787571.0, "step": 77130 }, { "entropy": 5.921166467666626, "epoch": 6.00132269986384, "grad_norm": 1.609375, "learning_rate": 0.00020746690948419272, "loss": 4.8331, "mean_token_accuracy": 0.22612046599388122, "num_tokens": 133795189.0, "step": 77135 }, { "entropy": 5.918843984603882, "epoch": 6.0017117292355575, "grad_norm": 1.546875, "learning_rate": 0.00020744047229329755, "loss": 4.8997, "mean_token_accuracy": 0.21915606707334517, "num_tokens": 133802840.0, "step": 77140 }, { "entropy": 5.975061655044556, "epoch": 6.002100758607275, "grad_norm": 1.4296875, "learning_rate": 0.0002074140361275107, "loss": 5.0432, "mean_token_accuracy": 0.21217696964740754, "num_tokens": 133812648.0, "step": 77145 }, { "entropy": 5.993687582015991, "epoch": 6.002489787978992, "grad_norm": 1.40625, "learning_rate": 0.00020738760098723324, "loss": 4.9421, "mean_token_accuracy": 0.22535849809646608, "num_tokens": 133820769.0, "step": 77150 }, { "entropy": 6.069813632965088, "epoch": 6.00287881735071, "grad_norm": 1.6484375, "learning_rate": 0.00020736116687286634, "loss": 4.9749, "mean_token_accuracy": 0.2149847850203514, "num_tokens": 133828939.0, "step": 77155 }, { "entropy": 5.990317630767822, "epoch": 6.003267846722427, "grad_norm": 1.484375, "learning_rate": 0.00020733473378481112, "loss": 4.8938, "mean_token_accuracy": 0.2232806235551834, "num_tokens": 133837770.0, "step": 77160 }, { "entropy": 5.964057731628418, "epoch": 6.003656876094145, "grad_norm": 1.609375, "learning_rate": 0.0002073083017234685, "loss": 4.9178, "mean_token_accuracy": 0.22058667242527008, "num_tokens": 133846244.0, "step": 77165 }, { "entropy": 5.937447929382325, "epoch": 6.004045905465863, "grad_norm": 1.703125, "learning_rate": 0.00020728187068923975, "loss": 4.8657, "mean_token_accuracy": 0.22705131769180298, "num_tokens": 133854874.0, "step": 77170 }, { "entropy": 5.966950559616089, "epoch": 6.0044349348375805, "grad_norm": 1.5625, "learning_rate": 0.00020725544068252584, "loss": 4.9487, "mean_token_accuracy": 0.21752160787582397, "num_tokens": 133863449.0, "step": 77175 }, { "entropy": 5.87031512260437, "epoch": 6.004823964209298, "grad_norm": 1.515625, "learning_rate": 0.0002072290117037277, "loss": 4.7379, "mean_token_accuracy": 0.23350879102945327, "num_tokens": 133871787.0, "step": 77180 }, { "entropy": 5.9386896133422855, "epoch": 6.005212993581015, "grad_norm": 1.484375, "learning_rate": 0.00020720258375324653, "loss": 4.9174, "mean_token_accuracy": 0.22336423099040986, "num_tokens": 133880368.0, "step": 77185 }, { "entropy": 5.984735107421875, "epoch": 6.005602022952733, "grad_norm": 1.46875, "learning_rate": 0.0002071761568314831, "loss": 4.9232, "mean_token_accuracy": 0.22758807092905045, "num_tokens": 133889687.0, "step": 77190 }, { "entropy": 5.949311447143555, "epoch": 6.00599105232445, "grad_norm": 1.515625, "learning_rate": 0.0002071497309388387, "loss": 4.8997, "mean_token_accuracy": 0.22296371757984162, "num_tokens": 133899450.0, "step": 77195 }, { "entropy": 5.994116115570068, "epoch": 6.006380081696168, "grad_norm": 1.5078125, "learning_rate": 0.00020712330607571407, "loss": 4.8939, "mean_token_accuracy": 0.2270330622792244, "num_tokens": 133907777.0, "step": 77200 }, { "entropy": 5.91080117225647, "epoch": 6.006769111067886, "grad_norm": 1.5703125, "learning_rate": 0.00020709688224251029, "loss": 4.8368, "mean_token_accuracy": 0.22681725323200225, "num_tokens": 133915852.0, "step": 77205 }, { "entropy": 5.987572193145752, "epoch": 6.0071581404396035, "grad_norm": 1.6015625, "learning_rate": 0.00020707045943962817, "loss": 4.9849, "mean_token_accuracy": 0.2170867443084717, "num_tokens": 133925174.0, "step": 77210 }, { "entropy": 5.969158792495728, "epoch": 6.007547169811321, "grad_norm": 1.4453125, "learning_rate": 0.0002070440376674687, "loss": 4.91, "mean_token_accuracy": 0.21896461695432662, "num_tokens": 133934902.0, "step": 77215 }, { "entropy": 5.955985593795776, "epoch": 6.007936199183038, "grad_norm": 1.421875, "learning_rate": 0.00020701761692643283, "loss": 4.8984, "mean_token_accuracy": 0.2231582894921303, "num_tokens": 133943608.0, "step": 77220 }, { "entropy": 6.005164623260498, "epoch": 6.008325228554756, "grad_norm": 1.546875, "learning_rate": 0.00020699119721692138, "loss": 4.9977, "mean_token_accuracy": 0.21900182217359543, "num_tokens": 133952556.0, "step": 77225 }, { "entropy": 5.886459922790527, "epoch": 6.008714257926473, "grad_norm": 1.5546875, "learning_rate": 0.00020696477853933531, "loss": 4.8067, "mean_token_accuracy": 0.2316868335008621, "num_tokens": 133961156.0, "step": 77230 }, { "entropy": 6.035867309570312, "epoch": 6.009103287298191, "grad_norm": 1.4609375, "learning_rate": 0.0002069383608940754, "loss": 4.9454, "mean_token_accuracy": 0.2193396881222725, "num_tokens": 133969857.0, "step": 77235 }, { "entropy": 5.972268724441529, "epoch": 6.009492316669909, "grad_norm": 1.53125, "learning_rate": 0.00020691194428154258, "loss": 4.898, "mean_token_accuracy": 0.21767839789390564, "num_tokens": 133978090.0, "step": 77240 }, { "entropy": 5.937094116210938, "epoch": 6.0098813460416265, "grad_norm": 1.6171875, "learning_rate": 0.00020688552870213762, "loss": 4.8327, "mean_token_accuracy": 0.22977281957864762, "num_tokens": 133986027.0, "step": 77245 }, { "entropy": 5.936698150634766, "epoch": 6.010270375413343, "grad_norm": 1.5390625, "learning_rate": 0.0002068591141562614, "loss": 4.8228, "mean_token_accuracy": 0.23438769727945327, "num_tokens": 133994607.0, "step": 77250 }, { "entropy": 5.9959992408752445, "epoch": 6.010659404785061, "grad_norm": 1.5546875, "learning_rate": 0.00020683270064431454, "loss": 4.9731, "mean_token_accuracy": 0.2207173690199852, "num_tokens": 134003612.0, "step": 77255 }, { "entropy": 5.990382719039917, "epoch": 6.011048434156779, "grad_norm": 1.6328125, "learning_rate": 0.000206806288166698, "loss": 4.9473, "mean_token_accuracy": 0.22227606326341628, "num_tokens": 134012022.0, "step": 77260 }, { "entropy": 5.984481716156006, "epoch": 6.011437463528496, "grad_norm": 1.59375, "learning_rate": 0.00020677987672381248, "loss": 4.8701, "mean_token_accuracy": 0.227724127471447, "num_tokens": 134020304.0, "step": 77265 }, { "entropy": 6.009970045089721, "epoch": 6.011826492900214, "grad_norm": 1.4921875, "learning_rate": 0.0002067534663160588, "loss": 4.985, "mean_token_accuracy": 0.2256305769085884, "num_tokens": 134028949.0, "step": 77270 }, { "entropy": 5.973845386505127, "epoch": 6.012215522271932, "grad_norm": 1.671875, "learning_rate": 0.00020672705694383759, "loss": 4.9376, "mean_token_accuracy": 0.22260891348123552, "num_tokens": 134036996.0, "step": 77275 }, { "entropy": 5.935384893417359, "epoch": 6.0126045516436495, "grad_norm": 1.5234375, "learning_rate": 0.00020670064860754973, "loss": 4.8811, "mean_token_accuracy": 0.22404216080904008, "num_tokens": 134045682.0, "step": 77280 }, { "entropy": 6.010344171524048, "epoch": 6.012993581015366, "grad_norm": 1.6171875, "learning_rate": 0.0002066742413075957, "loss": 4.9386, "mean_token_accuracy": 0.22231684029102325, "num_tokens": 134054355.0, "step": 77285 }, { "entropy": 6.012735795974732, "epoch": 6.013382610387084, "grad_norm": 1.515625, "learning_rate": 0.00020664783504437635, "loss": 4.9524, "mean_token_accuracy": 0.21430301517248154, "num_tokens": 134062978.0, "step": 77290 }, { "entropy": 6.029959011077881, "epoch": 6.013771639758802, "grad_norm": 1.484375, "learning_rate": 0.0002066214298182923, "loss": 4.9736, "mean_token_accuracy": 0.21935460418462754, "num_tokens": 134072481.0, "step": 77295 }, { "entropy": 6.016332340240479, "epoch": 6.014160669130519, "grad_norm": 1.6328125, "learning_rate": 0.00020659502562974424, "loss": 4.8694, "mean_token_accuracy": 0.2219953417778015, "num_tokens": 134080603.0, "step": 77300 }, { "entropy": 6.000202178955078, "epoch": 6.014549698502237, "grad_norm": 1.59375, "learning_rate": 0.00020656862247913277, "loss": 4.9309, "mean_token_accuracy": 0.2187982589006424, "num_tokens": 134089847.0, "step": 77305 }, { "entropy": 5.940379858016968, "epoch": 6.014938727873955, "grad_norm": 1.4140625, "learning_rate": 0.00020654222036685854, "loss": 4.8917, "mean_token_accuracy": 0.22553602010011672, "num_tokens": 134098648.0, "step": 77310 }, { "entropy": 5.9866907596588135, "epoch": 6.0153277572456725, "grad_norm": 1.609375, "learning_rate": 0.00020651581929332215, "loss": 4.9201, "mean_token_accuracy": 0.224651537835598, "num_tokens": 134106926.0, "step": 77315 }, { "entropy": 5.974052810668946, "epoch": 6.015716786617389, "grad_norm": 1.5546875, "learning_rate": 0.00020648941925892418, "loss": 4.8679, "mean_token_accuracy": 0.22212464958429337, "num_tokens": 134116151.0, "step": 77320 }, { "entropy": 5.978938293457031, "epoch": 6.016105815989107, "grad_norm": 1.546875, "learning_rate": 0.00020646302026406516, "loss": 4.9245, "mean_token_accuracy": 0.21990459263324738, "num_tokens": 134125546.0, "step": 77325 }, { "entropy": 6.007490015029907, "epoch": 6.016494845360825, "grad_norm": 1.5, "learning_rate": 0.00020643662230914584, "loss": 4.9041, "mean_token_accuracy": 0.22710235118865968, "num_tokens": 134133993.0, "step": 77330 }, { "entropy": 5.898662757873535, "epoch": 6.016883874732542, "grad_norm": 1.46875, "learning_rate": 0.00020641022539456661, "loss": 4.8614, "mean_token_accuracy": 0.2238541454076767, "num_tokens": 134142749.0, "step": 77335 }, { "entropy": 5.995209074020385, "epoch": 6.01727290410426, "grad_norm": 1.3828125, "learning_rate": 0.00020638382952072805, "loss": 4.9829, "mean_token_accuracy": 0.21985611021518708, "num_tokens": 134151731.0, "step": 77340 }, { "entropy": 6.005035543441773, "epoch": 6.017661933475978, "grad_norm": 1.53125, "learning_rate": 0.00020635743468803064, "loss": 4.9655, "mean_token_accuracy": 0.21878334283828735, "num_tokens": 134161137.0, "step": 77345 }, { "entropy": 5.978911304473877, "epoch": 6.018050962847695, "grad_norm": 1.734375, "learning_rate": 0.0002063310408968749, "loss": 4.8601, "mean_token_accuracy": 0.231124809384346, "num_tokens": 134169883.0, "step": 77350 }, { "entropy": 6.02721266746521, "epoch": 6.018439992219412, "grad_norm": 1.484375, "learning_rate": 0.0002063046481476613, "loss": 5.033, "mean_token_accuracy": 0.21880795955657958, "num_tokens": 134178399.0, "step": 77355 }, { "entropy": 6.0200762271881105, "epoch": 6.01882902159113, "grad_norm": 1.7734375, "learning_rate": 0.0002062782564407904, "loss": 4.9516, "mean_token_accuracy": 0.2192690849304199, "num_tokens": 134186270.0, "step": 77360 }, { "entropy": 5.920985221862793, "epoch": 6.019218050962848, "grad_norm": 1.65625, "learning_rate": 0.00020625186577666256, "loss": 4.8096, "mean_token_accuracy": 0.2376904994249344, "num_tokens": 134194809.0, "step": 77365 }, { "entropy": 6.036172676086426, "epoch": 6.019607080334565, "grad_norm": 1.6015625, "learning_rate": 0.00020622547615567816, "loss": 5.0527, "mean_token_accuracy": 0.20707651525735854, "num_tokens": 134203212.0, "step": 77370 }, { "entropy": 6.003637838363647, "epoch": 6.019996109706283, "grad_norm": 1.6484375, "learning_rate": 0.0002061990875782378, "loss": 4.9639, "mean_token_accuracy": 0.22037897557020186, "num_tokens": 134211971.0, "step": 77375 }, { "entropy": 5.983209609985352, "epoch": 6.020385139078001, "grad_norm": 1.546875, "learning_rate": 0.00020617270004474165, "loss": 4.9117, "mean_token_accuracy": 0.22632469832897187, "num_tokens": 134220970.0, "step": 77380 }, { "entropy": 5.953566598892212, "epoch": 6.020774168449718, "grad_norm": 1.515625, "learning_rate": 0.00020614631355559033, "loss": 4.9063, "mean_token_accuracy": 0.21737792044878007, "num_tokens": 134230084.0, "step": 77385 }, { "entropy": 5.940289163589478, "epoch": 6.021163197821435, "grad_norm": 1.53125, "learning_rate": 0.000206119928111184, "loss": 4.8707, "mean_token_accuracy": 0.22485526502132416, "num_tokens": 134239051.0, "step": 77390 }, { "entropy": 5.921415758132935, "epoch": 6.021552227193153, "grad_norm": 1.6640625, "learning_rate": 0.00020609354371192324, "loss": 4.8942, "mean_token_accuracy": 0.22107823342084884, "num_tokens": 134247398.0, "step": 77395 }, { "entropy": 5.992382574081421, "epoch": 6.021941256564871, "grad_norm": 1.5703125, "learning_rate": 0.00020606716035820823, "loss": 4.9737, "mean_token_accuracy": 0.2180938631296158, "num_tokens": 134256109.0, "step": 77400 }, { "entropy": 5.976199054718018, "epoch": 6.022330285936588, "grad_norm": 1.5390625, "learning_rate": 0.00020604077805043932, "loss": 4.9254, "mean_token_accuracy": 0.22226646393537522, "num_tokens": 134264879.0, "step": 77405 }, { "entropy": 6.028080081939697, "epoch": 6.022719315308306, "grad_norm": 1.7421875, "learning_rate": 0.0002060143967890169, "loss": 4.9083, "mean_token_accuracy": 0.21855670362710952, "num_tokens": 134272949.0, "step": 77410 }, { "entropy": 5.942157936096192, "epoch": 6.023108344680024, "grad_norm": 1.578125, "learning_rate": 0.00020598801657434118, "loss": 4.913, "mean_token_accuracy": 0.2198380634188652, "num_tokens": 134281831.0, "step": 77415 }, { "entropy": 5.924440002441406, "epoch": 6.023497374051741, "grad_norm": 1.46875, "learning_rate": 0.00020596163740681245, "loss": 4.9343, "mean_token_accuracy": 0.22290041744709016, "num_tokens": 134291410.0, "step": 77420 }, { "entropy": 5.979711484909058, "epoch": 6.023886403423458, "grad_norm": 1.5546875, "learning_rate": 0.000205935259286831, "loss": 4.9175, "mean_token_accuracy": 0.22350115478038787, "num_tokens": 134299707.0, "step": 77425 }, { "entropy": 6.0375651836395265, "epoch": 6.024275432795176, "grad_norm": 1.5859375, "learning_rate": 0.0002059088822147971, "loss": 4.9543, "mean_token_accuracy": 0.2227134734392166, "num_tokens": 134308052.0, "step": 77430 }, { "entropy": 5.970802354812622, "epoch": 6.024664462166894, "grad_norm": 1.53125, "learning_rate": 0.00020588250619111087, "loss": 4.925, "mean_token_accuracy": 0.21959677934646607, "num_tokens": 134316669.0, "step": 77435 }, { "entropy": 5.9212476253509525, "epoch": 6.025053491538611, "grad_norm": 1.5625, "learning_rate": 0.0002058561312161727, "loss": 4.7572, "mean_token_accuracy": 0.23666637837886811, "num_tokens": 134324924.0, "step": 77440 }, { "entropy": 5.981415557861328, "epoch": 6.025442520910329, "grad_norm": 1.6328125, "learning_rate": 0.00020582975729038262, "loss": 5.0004, "mean_token_accuracy": 0.21752534061670303, "num_tokens": 134333563.0, "step": 77445 }, { "entropy": 6.002754545211792, "epoch": 6.025831550282046, "grad_norm": 1.421875, "learning_rate": 0.00020580338441414088, "loss": 4.9385, "mean_token_accuracy": 0.21931889802217483, "num_tokens": 134342260.0, "step": 77450 }, { "entropy": 5.953294467926026, "epoch": 6.026220579653764, "grad_norm": 1.484375, "learning_rate": 0.00020577701258784754, "loss": 4.9302, "mean_token_accuracy": 0.21714317798614502, "num_tokens": 134350770.0, "step": 77455 }, { "entropy": 5.984437465667725, "epoch": 6.026609609025481, "grad_norm": 1.6328125, "learning_rate": 0.00020575064181190295, "loss": 4.8308, "mean_token_accuracy": 0.22686077654361725, "num_tokens": 134358896.0, "step": 77460 }, { "entropy": 6.010274600982666, "epoch": 6.026998638397199, "grad_norm": 1.515625, "learning_rate": 0.00020572427208670713, "loss": 5.0011, "mean_token_accuracy": 0.21117804199457169, "num_tokens": 134367056.0, "step": 77465 }, { "entropy": 5.977928543090821, "epoch": 6.027387667768917, "grad_norm": 1.5859375, "learning_rate": 0.00020569790341266027, "loss": 4.9884, "mean_token_accuracy": 0.21931353360414504, "num_tokens": 134376360.0, "step": 77470 }, { "entropy": 5.967798042297363, "epoch": 6.027776697140634, "grad_norm": 1.6875, "learning_rate": 0.0002056715357901624, "loss": 4.8978, "mean_token_accuracy": 0.21902000159025192, "num_tokens": 134385087.0, "step": 77475 }, { "entropy": 6.044174766540527, "epoch": 6.028165726512352, "grad_norm": 1.6015625, "learning_rate": 0.00020564516921961362, "loss": 4.9531, "mean_token_accuracy": 0.21599837839603425, "num_tokens": 134393561.0, "step": 77480 }, { "entropy": 6.01698260307312, "epoch": 6.028554755884069, "grad_norm": 1.5390625, "learning_rate": 0.000205618803701414, "loss": 4.9356, "mean_token_accuracy": 0.2264395162463188, "num_tokens": 134402385.0, "step": 77485 }, { "entropy": 5.97895073890686, "epoch": 6.028943785255787, "grad_norm": 1.5546875, "learning_rate": 0.0002055924392359636, "loss": 4.8949, "mean_token_accuracy": 0.21980111598968505, "num_tokens": 134410739.0, "step": 77490 }, { "entropy": 5.956437015533448, "epoch": 6.029332814627504, "grad_norm": 1.5, "learning_rate": 0.0002055660758236625, "loss": 4.9339, "mean_token_accuracy": 0.2247818276286125, "num_tokens": 134419431.0, "step": 77495 }, { "entropy": 5.9876786231994625, "epoch": 6.029721843999222, "grad_norm": 1.4375, "learning_rate": 0.00020553971346491063, "loss": 4.9936, "mean_token_accuracy": 0.21837008148431777, "num_tokens": 134427952.0, "step": 77500 }, { "entropy": 5.90460319519043, "epoch": 6.03011087337094, "grad_norm": 1.7890625, "learning_rate": 0.00020551335216010804, "loss": 4.8427, "mean_token_accuracy": 0.2301195353269577, "num_tokens": 134436713.0, "step": 77505 }, { "entropy": 5.950352668762207, "epoch": 6.030499902742657, "grad_norm": 1.4921875, "learning_rate": 0.0002054869919096548, "loss": 4.8732, "mean_token_accuracy": 0.22478476613759996, "num_tokens": 134444920.0, "step": 77510 }, { "entropy": 5.938903522491455, "epoch": 6.030888932114375, "grad_norm": 1.625, "learning_rate": 0.00020546063271395076, "loss": 4.8843, "mean_token_accuracy": 0.22249113023281097, "num_tokens": 134453442.0, "step": 77515 }, { "entropy": 6.082631349563599, "epoch": 6.031277961486092, "grad_norm": 1.484375, "learning_rate": 0.00020543427457339592, "loss": 5.0532, "mean_token_accuracy": 0.2126928374171257, "num_tokens": 134462328.0, "step": 77520 }, { "entropy": 5.911359643936157, "epoch": 6.0316669908578096, "grad_norm": 1.5703125, "learning_rate": 0.00020540791748839028, "loss": 4.8858, "mean_token_accuracy": 0.22006149291992189, "num_tokens": 134470777.0, "step": 77525 }, { "entropy": 5.9269492626190186, "epoch": 6.032056020229527, "grad_norm": 1.46875, "learning_rate": 0.00020538156145933373, "loss": 4.9069, "mean_token_accuracy": 0.22235708236694335, "num_tokens": 134479400.0, "step": 77530 }, { "entropy": 6.001809978485108, "epoch": 6.032445049601245, "grad_norm": 1.453125, "learning_rate": 0.00020535520648662614, "loss": 4.9648, "mean_token_accuracy": 0.22024015635251998, "num_tokens": 134488026.0, "step": 77535 }, { "entropy": 6.007876586914063, "epoch": 6.032834078972963, "grad_norm": 1.4609375, "learning_rate": 0.00020532885257066748, "loss": 4.9715, "mean_token_accuracy": 0.22467001974582673, "num_tokens": 134496681.0, "step": 77540 }, { "entropy": 5.928050899505616, "epoch": 6.03322310834468, "grad_norm": 1.546875, "learning_rate": 0.00020530249971185754, "loss": 4.8801, "mean_token_accuracy": 0.2203107476234436, "num_tokens": 134505025.0, "step": 77545 }, { "entropy": 5.926378488540649, "epoch": 6.033612137716397, "grad_norm": 1.6640625, "learning_rate": 0.00020527614791059635, "loss": 4.835, "mean_token_accuracy": 0.22455671429634094, "num_tokens": 134513594.0, "step": 77550 }, { "entropy": 6.013893413543701, "epoch": 6.034001167088115, "grad_norm": 1.59375, "learning_rate": 0.00020524979716728353, "loss": 4.9701, "mean_token_accuracy": 0.22002838999032975, "num_tokens": 134522471.0, "step": 77555 }, { "entropy": 5.965164852142334, "epoch": 6.0343901964598325, "grad_norm": 1.5546875, "learning_rate": 0.00020522344748231903, "loss": 4.9743, "mean_token_accuracy": 0.221189084649086, "num_tokens": 134530675.0, "step": 77560 }, { "entropy": 5.943581676483154, "epoch": 6.03477922583155, "grad_norm": 1.4921875, "learning_rate": 0.00020519709885610267, "loss": 4.8491, "mean_token_accuracy": 0.2228779211640358, "num_tokens": 134539786.0, "step": 77565 }, { "entropy": 5.953074932098389, "epoch": 6.035168255203268, "grad_norm": 1.5234375, "learning_rate": 0.00020517075128903423, "loss": 4.9312, "mean_token_accuracy": 0.2229670539498329, "num_tokens": 134547989.0, "step": 77570 }, { "entropy": 6.004550981521606, "epoch": 6.035557284574986, "grad_norm": 1.609375, "learning_rate": 0.00020514440478151352, "loss": 4.9666, "mean_token_accuracy": 0.2208867222070694, "num_tokens": 134556613.0, "step": 77575 }, { "entropy": 6.0341614246368405, "epoch": 6.035946313946703, "grad_norm": 1.5546875, "learning_rate": 0.00020511805933394022, "loss": 5.0514, "mean_token_accuracy": 0.21251089572906495, "num_tokens": 134564932.0, "step": 77580 }, { "entropy": 5.991259145736694, "epoch": 6.03633534331842, "grad_norm": 1.4140625, "learning_rate": 0.00020509171494671418, "loss": 4.9337, "mean_token_accuracy": 0.22043437212705613, "num_tokens": 134573551.0, "step": 77585 }, { "entropy": 5.973898601531983, "epoch": 6.036724372690138, "grad_norm": 1.5, "learning_rate": 0.00020506537162023503, "loss": 4.9304, "mean_token_accuracy": 0.21939200460910796, "num_tokens": 134581763.0, "step": 77590 }, { "entropy": 5.958333969116211, "epoch": 6.0371134020618555, "grad_norm": 1.5234375, "learning_rate": 0.00020503902935490266, "loss": 4.9591, "mean_token_accuracy": 0.21743723154067993, "num_tokens": 134591096.0, "step": 77595 }, { "entropy": 5.992141056060791, "epoch": 6.037502431433573, "grad_norm": 1.5546875, "learning_rate": 0.00020501268815111657, "loss": 4.9385, "mean_token_accuracy": 0.21838610470294953, "num_tokens": 134599626.0, "step": 77600 }, { "entropy": 6.053526067733765, "epoch": 6.037891460805291, "grad_norm": 1.4375, "learning_rate": 0.00020498634800927663, "loss": 5.009, "mean_token_accuracy": 0.21248390823602675, "num_tokens": 134607726.0, "step": 77605 }, { "entropy": 5.980777883529663, "epoch": 6.038280490177009, "grad_norm": 1.671875, "learning_rate": 0.00020496000892978233, "loss": 4.8985, "mean_token_accuracy": 0.22154248803853988, "num_tokens": 134615977.0, "step": 77610 }, { "entropy": 5.944348239898682, "epoch": 6.038669519548726, "grad_norm": 1.5625, "learning_rate": 0.0002049336709130335, "loss": 4.8949, "mean_token_accuracy": 0.22854854464530944, "num_tokens": 134624636.0, "step": 77615 }, { "entropy": 5.898325634002686, "epoch": 6.039058548920443, "grad_norm": 1.4765625, "learning_rate": 0.00020490733395942969, "loss": 4.8386, "mean_token_accuracy": 0.23115002661943435, "num_tokens": 134633856.0, "step": 77620 }, { "entropy": 5.980371522903442, "epoch": 6.039447578292161, "grad_norm": 1.765625, "learning_rate": 0.00020488099806937043, "loss": 4.939, "mean_token_accuracy": 0.22500165104866027, "num_tokens": 134642195.0, "step": 77625 }, { "entropy": 5.971798610687256, "epoch": 6.0398366076638785, "grad_norm": 1.4921875, "learning_rate": 0.0002048546632432555, "loss": 4.9132, "mean_token_accuracy": 0.22144813984632492, "num_tokens": 134650336.0, "step": 77630 }, { "entropy": 5.9069019794464115, "epoch": 6.040225637035596, "grad_norm": 1.546875, "learning_rate": 0.00020482832948148444, "loss": 4.8568, "mean_token_accuracy": 0.2290749430656433, "num_tokens": 134659576.0, "step": 77635 }, { "entropy": 6.002629947662354, "epoch": 6.040614666407314, "grad_norm": 1.5703125, "learning_rate": 0.0002048019967844567, "loss": 4.996, "mean_token_accuracy": 0.22060558944940567, "num_tokens": 134667939.0, "step": 77640 }, { "entropy": 5.933436298370362, "epoch": 6.041003695779032, "grad_norm": 1.5546875, "learning_rate": 0.00020477566515257197, "loss": 4.832, "mean_token_accuracy": 0.22532147765159607, "num_tokens": 134676024.0, "step": 77645 }, { "entropy": 5.935768079757691, "epoch": 6.041392725150749, "grad_norm": 1.640625, "learning_rate": 0.00020474933458622974, "loss": 4.9014, "mean_token_accuracy": 0.21894921660423278, "num_tokens": 134685210.0, "step": 77650 }, { "entropy": 5.951097679138184, "epoch": 6.041781754522466, "grad_norm": 1.6015625, "learning_rate": 0.00020472300508582946, "loss": 4.9193, "mean_token_accuracy": 0.21972052305936812, "num_tokens": 134693951.0, "step": 77655 }, { "entropy": 5.988010740280151, "epoch": 6.042170783894184, "grad_norm": 1.578125, "learning_rate": 0.00020469667665177084, "loss": 4.8769, "mean_token_accuracy": 0.22732580453157425, "num_tokens": 134701999.0, "step": 77660 }, { "entropy": 5.930520820617676, "epoch": 6.0425598132659015, "grad_norm": 1.4375, "learning_rate": 0.00020467034928445323, "loss": 4.9292, "mean_token_accuracy": 0.21766661256551742, "num_tokens": 134710933.0, "step": 77665 }, { "entropy": 5.975750732421875, "epoch": 6.042948842637619, "grad_norm": 1.484375, "learning_rate": 0.00020464402298427608, "loss": 4.9808, "mean_token_accuracy": 0.21860561668872833, "num_tokens": 134719577.0, "step": 77670 }, { "entropy": 5.932960939407349, "epoch": 6.043337872009337, "grad_norm": 1.5703125, "learning_rate": 0.00020461769775163897, "loss": 4.837, "mean_token_accuracy": 0.22973683327436448, "num_tokens": 134727472.0, "step": 77675 }, { "entropy": 6.02776255607605, "epoch": 6.043726901381055, "grad_norm": 1.5703125, "learning_rate": 0.00020459137358694126, "loss": 5.0186, "mean_token_accuracy": 0.21540241688489914, "num_tokens": 134736351.0, "step": 77680 }, { "entropy": 5.987282371520996, "epoch": 6.044115930752771, "grad_norm": 1.5625, "learning_rate": 0.00020456505049058234, "loss": 5.0067, "mean_token_accuracy": 0.21220969557762145, "num_tokens": 134744953.0, "step": 77685 }, { "entropy": 6.047860765457154, "epoch": 6.044504960124489, "grad_norm": 1.453125, "learning_rate": 0.00020453872846296168, "loss": 5.002, "mean_token_accuracy": 0.20939269363880159, "num_tokens": 134753309.0, "step": 77690 }, { "entropy": 6.013701963424682, "epoch": 6.044893989496207, "grad_norm": 1.484375, "learning_rate": 0.00020451240750447868, "loss": 4.9524, "mean_token_accuracy": 0.22526639550924302, "num_tokens": 134761977.0, "step": 77695 }, { "entropy": 5.902167654037475, "epoch": 6.0452830188679245, "grad_norm": 1.5, "learning_rate": 0.00020448608761553273, "loss": 4.8695, "mean_token_accuracy": 0.2245625600218773, "num_tokens": 134770781.0, "step": 77700 }, { "entropy": 5.9834754943847654, "epoch": 6.045672048239642, "grad_norm": 1.5390625, "learning_rate": 0.00020445976879652312, "loss": 4.968, "mean_token_accuracy": 0.21440071910619735, "num_tokens": 134779640.0, "step": 77705 }, { "entropy": 5.979857587814331, "epoch": 6.04606107761136, "grad_norm": 1.6953125, "learning_rate": 0.00020443345104784934, "loss": 4.9093, "mean_token_accuracy": 0.2272307440638542, "num_tokens": 134789130.0, "step": 77710 }, { "entropy": 5.918622732162476, "epoch": 6.046450106983078, "grad_norm": 1.5703125, "learning_rate": 0.00020440713436991055, "loss": 4.8488, "mean_token_accuracy": 0.2257406696677208, "num_tokens": 134797214.0, "step": 77715 }, { "entropy": 5.976826763153076, "epoch": 6.046839136354794, "grad_norm": 1.6953125, "learning_rate": 0.000204380818763106, "loss": 4.975, "mean_token_accuracy": 0.21334893852472306, "num_tokens": 134805403.0, "step": 77720 }, { "entropy": 5.947823619842529, "epoch": 6.047228165726512, "grad_norm": 1.59375, "learning_rate": 0.00020435450422783525, "loss": 4.9025, "mean_token_accuracy": 0.2205536648631096, "num_tokens": 134813409.0, "step": 77725 }, { "entropy": 5.916941833496094, "epoch": 6.04761719509823, "grad_norm": 1.796875, "learning_rate": 0.00020432819076449745, "loss": 4.8563, "mean_token_accuracy": 0.22390880733728408, "num_tokens": 134822821.0, "step": 77730 }, { "entropy": 6.01198263168335, "epoch": 6.0480062244699475, "grad_norm": 1.6328125, "learning_rate": 0.00020430187837349186, "loss": 4.9639, "mean_token_accuracy": 0.22288390547037124, "num_tokens": 134831286.0, "step": 77735 }, { "entropy": 5.938953399658203, "epoch": 6.048395253841665, "grad_norm": 1.609375, "learning_rate": 0.00020427556705521777, "loss": 4.8049, "mean_token_accuracy": 0.23457493185997008, "num_tokens": 134840273.0, "step": 77740 }, { "entropy": 5.966055488586425, "epoch": 6.048784283213383, "grad_norm": 1.5703125, "learning_rate": 0.0002042492568100744, "loss": 4.8923, "mean_token_accuracy": 0.21983334124088288, "num_tokens": 134848254.0, "step": 77745 }, { "entropy": 5.898483848571777, "epoch": 6.049173312585101, "grad_norm": 1.734375, "learning_rate": 0.0002042229476384609, "loss": 4.8194, "mean_token_accuracy": 0.23587443083524703, "num_tokens": 134856045.0, "step": 77750 }, { "entropy": 5.915934324264526, "epoch": 6.049562341956817, "grad_norm": 1.5, "learning_rate": 0.00020419663954077656, "loss": 4.8835, "mean_token_accuracy": 0.22112328559160233, "num_tokens": 134865157.0, "step": 77755 }, { "entropy": 5.9438755989074705, "epoch": 6.049951371328535, "grad_norm": 1.65625, "learning_rate": 0.00020417033251742046, "loss": 4.9548, "mean_token_accuracy": 0.21761519014835357, "num_tokens": 134873859.0, "step": 77760 }, { "entropy": 5.984092473983765, "epoch": 6.050340400700253, "grad_norm": 1.734375, "learning_rate": 0.0002041440265687919, "loss": 4.8079, "mean_token_accuracy": 0.23234899640083312, "num_tokens": 134882386.0, "step": 77765 }, { "entropy": 6.037471437454224, "epoch": 6.0507294300719705, "grad_norm": 1.5078125, "learning_rate": 0.00020411772169528987, "loss": 4.9796, "mean_token_accuracy": 0.21096444129943848, "num_tokens": 134890701.0, "step": 77770 }, { "entropy": 5.9838213443756105, "epoch": 6.051118459443688, "grad_norm": 1.5625, "learning_rate": 0.00020409141789731362, "loss": 4.9753, "mean_token_accuracy": 0.2134937271475792, "num_tokens": 134898409.0, "step": 77775 }, { "entropy": 5.95708737373352, "epoch": 6.051507488815406, "grad_norm": 1.46875, "learning_rate": 0.00020406511517526228, "loss": 4.9843, "mean_token_accuracy": 0.2122500404715538, "num_tokens": 134907159.0, "step": 77780 }, { "entropy": 5.959597873687744, "epoch": 6.051896518187123, "grad_norm": 1.5703125, "learning_rate": 0.00020403881352953486, "loss": 4.8843, "mean_token_accuracy": 0.22884802967309953, "num_tokens": 134915206.0, "step": 77785 }, { "entropy": 5.939011859893799, "epoch": 6.05228554755884, "grad_norm": 1.6015625, "learning_rate": 0.00020401251296053047, "loss": 4.9231, "mean_token_accuracy": 0.2273995578289032, "num_tokens": 134924275.0, "step": 77790 }, { "entropy": 6.003844118118286, "epoch": 6.052674576930558, "grad_norm": 1.4140625, "learning_rate": 0.00020398621346864827, "loss": 4.9993, "mean_token_accuracy": 0.21560055315494536, "num_tokens": 134933280.0, "step": 77795 }, { "entropy": 6.023497104644775, "epoch": 6.053063606302276, "grad_norm": 1.7109375, "learning_rate": 0.00020395991505428723, "loss": 4.9491, "mean_token_accuracy": 0.2228104665875435, "num_tokens": 134941810.0, "step": 77800 }, { "entropy": 5.991574764251709, "epoch": 6.0534526356739935, "grad_norm": 1.484375, "learning_rate": 0.00020393361771784647, "loss": 4.9746, "mean_token_accuracy": 0.21099766343832016, "num_tokens": 134950419.0, "step": 77805 }, { "entropy": 6.0198320865631105, "epoch": 6.053841665045711, "grad_norm": 1.6640625, "learning_rate": 0.0002039073214597249, "loss": 4.9262, "mean_token_accuracy": 0.22320237755775452, "num_tokens": 134959150.0, "step": 77810 }, { "entropy": 5.941063594818115, "epoch": 6.054230694417429, "grad_norm": 1.609375, "learning_rate": 0.00020388102628032156, "loss": 4.891, "mean_token_accuracy": 0.22152338176965714, "num_tokens": 134967778.0, "step": 77815 }, { "entropy": 6.0032140731811525, "epoch": 6.054619723789146, "grad_norm": 1.5078125, "learning_rate": 0.00020385473218003546, "loss": 4.9272, "mean_token_accuracy": 0.2187305822968483, "num_tokens": 134975969.0, "step": 77820 }, { "entropy": 5.965050077438354, "epoch": 6.055008753160863, "grad_norm": 1.5546875, "learning_rate": 0.00020382843915926557, "loss": 4.8274, "mean_token_accuracy": 0.23009021878242492, "num_tokens": 134985370.0, "step": 77825 }, { "entropy": 5.902154064178466, "epoch": 6.055397782532581, "grad_norm": 1.515625, "learning_rate": 0.00020380214721841083, "loss": 4.8204, "mean_token_accuracy": 0.22571178078651427, "num_tokens": 134994374.0, "step": 77830 }, { "entropy": 5.954391860961914, "epoch": 6.055786811904299, "grad_norm": 1.8515625, "learning_rate": 0.00020377585635787015, "loss": 4.9311, "mean_token_accuracy": 0.21615663468837737, "num_tokens": 135001914.0, "step": 77835 }, { "entropy": 5.98260235786438, "epoch": 6.0561758412760165, "grad_norm": 1.6484375, "learning_rate": 0.00020374956657804254, "loss": 5.0912, "mean_token_accuracy": 0.21001579612493515, "num_tokens": 135010561.0, "step": 77840 }, { "entropy": 5.963683271408081, "epoch": 6.056564870647734, "grad_norm": 1.546875, "learning_rate": 0.0002037232778793268, "loss": 4.8851, "mean_token_accuracy": 0.22478196024894714, "num_tokens": 135019308.0, "step": 77845 }, { "entropy": 5.985214424133301, "epoch": 6.056953900019452, "grad_norm": 1.484375, "learning_rate": 0.0002036969902621219, "loss": 4.9118, "mean_token_accuracy": 0.21541074067354202, "num_tokens": 135027818.0, "step": 77850 }, { "entropy": 5.938775968551636, "epoch": 6.057342929391169, "grad_norm": 1.5, "learning_rate": 0.0002036707037268266, "loss": 4.9439, "mean_token_accuracy": 0.22086464166641234, "num_tokens": 135036978.0, "step": 77855 }, { "entropy": 5.941401386260987, "epoch": 6.057731958762886, "grad_norm": 1.5625, "learning_rate": 0.00020364441827383994, "loss": 4.9399, "mean_token_accuracy": 0.2192774996161461, "num_tokens": 135046113.0, "step": 77860 }, { "entropy": 5.9581053256988525, "epoch": 6.058120988134604, "grad_norm": 1.4921875, "learning_rate": 0.00020361813390356066, "loss": 4.8329, "mean_token_accuracy": 0.22635435909032822, "num_tokens": 135054072.0, "step": 77865 }, { "entropy": 5.892794418334961, "epoch": 6.058510017506322, "grad_norm": 1.59375, "learning_rate": 0.00020359185061638753, "loss": 4.8054, "mean_token_accuracy": 0.2313562661409378, "num_tokens": 135062606.0, "step": 77870 }, { "entropy": 6.012898588180542, "epoch": 6.0588990468780395, "grad_norm": 1.453125, "learning_rate": 0.0002035655684127194, "loss": 4.9966, "mean_token_accuracy": 0.2153088390827179, "num_tokens": 135071893.0, "step": 77875 }, { "entropy": 5.952249908447266, "epoch": 6.059288076249757, "grad_norm": 1.6640625, "learning_rate": 0.0002035392872929551, "loss": 4.8936, "mean_token_accuracy": 0.22607151865959169, "num_tokens": 135081339.0, "step": 77880 }, { "entropy": 6.018096542358398, "epoch": 6.059677105621474, "grad_norm": 1.6640625, "learning_rate": 0.00020351300725749338, "loss": 4.9979, "mean_token_accuracy": 0.22137173861265183, "num_tokens": 135089862.0, "step": 77885 }, { "entropy": 5.946950674057007, "epoch": 6.060066134993192, "grad_norm": 1.578125, "learning_rate": 0.000203486728306733, "loss": 4.9467, "mean_token_accuracy": 0.21569077372550965, "num_tokens": 135097426.0, "step": 77890 }, { "entropy": 5.929494190216064, "epoch": 6.060455164364909, "grad_norm": 1.578125, "learning_rate": 0.00020346045044107269, "loss": 4.8748, "mean_token_accuracy": 0.22807603925466538, "num_tokens": 135105894.0, "step": 77895 }, { "entropy": 5.996301221847534, "epoch": 6.060844193736627, "grad_norm": 1.6328125, "learning_rate": 0.0002034341736609112, "loss": 4.8947, "mean_token_accuracy": 0.2321320429444313, "num_tokens": 135113880.0, "step": 77900 }, { "entropy": 6.082368993759156, "epoch": 6.061233223108345, "grad_norm": 1.6640625, "learning_rate": 0.00020340789796664715, "loss": 4.9953, "mean_token_accuracy": 0.21067555397748947, "num_tokens": 135122622.0, "step": 77905 }, { "entropy": 5.977445077896118, "epoch": 6.0616222524800625, "grad_norm": 1.5625, "learning_rate": 0.00020338162335867938, "loss": 4.9126, "mean_token_accuracy": 0.22017618119716645, "num_tokens": 135130998.0, "step": 77910 }, { "entropy": 6.016769123077393, "epoch": 6.06201128185178, "grad_norm": 1.5390625, "learning_rate": 0.00020335534983740645, "loss": 4.9437, "mean_token_accuracy": 0.22748716473579406, "num_tokens": 135140043.0, "step": 77915 }, { "entropy": 5.920091533660889, "epoch": 6.062400311223497, "grad_norm": 1.5703125, "learning_rate": 0.00020332907740322693, "loss": 4.8987, "mean_token_accuracy": 0.22399997860193252, "num_tokens": 135147914.0, "step": 77920 }, { "entropy": 5.949782752990723, "epoch": 6.062789340595215, "grad_norm": 1.5703125, "learning_rate": 0.00020330280605653967, "loss": 4.9341, "mean_token_accuracy": 0.22286033630371094, "num_tokens": 135156359.0, "step": 77925 }, { "entropy": 5.983214521408081, "epoch": 6.063178369966932, "grad_norm": 1.53125, "learning_rate": 0.00020327653579774331, "loss": 4.9527, "mean_token_accuracy": 0.22346986085176468, "num_tokens": 135165369.0, "step": 77930 }, { "entropy": 5.981209087371826, "epoch": 6.06356739933865, "grad_norm": 1.5859375, "learning_rate": 0.00020325026662723622, "loss": 4.9988, "mean_token_accuracy": 0.21941498517990113, "num_tokens": 135174423.0, "step": 77935 }, { "entropy": 5.944496440887451, "epoch": 6.063956428710368, "grad_norm": 1.5234375, "learning_rate": 0.00020322399854541724, "loss": 4.8982, "mean_token_accuracy": 0.2249224454164505, "num_tokens": 135183260.0, "step": 77940 }, { "entropy": 5.963327407836914, "epoch": 6.0643454580820855, "grad_norm": 1.5390625, "learning_rate": 0.0002031977315526848, "loss": 4.9712, "mean_token_accuracy": 0.2163778617978096, "num_tokens": 135192236.0, "step": 77945 }, { "entropy": 6.014355754852295, "epoch": 6.064734487453803, "grad_norm": 1.484375, "learning_rate": 0.00020317146564943745, "loss": 4.9284, "mean_token_accuracy": 0.22324275970458984, "num_tokens": 135201087.0, "step": 77950 }, { "entropy": 5.984144830703736, "epoch": 6.06512351682552, "grad_norm": 1.5234375, "learning_rate": 0.0002031452008360738, "loss": 4.9509, "mean_token_accuracy": 0.222816164791584, "num_tokens": 135210214.0, "step": 77955 }, { "entropy": 5.911145544052124, "epoch": 6.065512546197238, "grad_norm": 1.546875, "learning_rate": 0.0002031189371129924, "loss": 4.8118, "mean_token_accuracy": 0.23140286654233932, "num_tokens": 135219085.0, "step": 77960 }, { "entropy": 5.994936561584472, "epoch": 6.065901575568955, "grad_norm": 1.6171875, "learning_rate": 0.0002030926744805917, "loss": 4.9707, "mean_token_accuracy": 0.2178179457783699, "num_tokens": 135227437.0, "step": 77965 }, { "entropy": 5.9807776927948, "epoch": 6.066290604940673, "grad_norm": 1.671875, "learning_rate": 0.0002030664129392702, "loss": 5.0124, "mean_token_accuracy": 0.21513006687164307, "num_tokens": 135236345.0, "step": 77970 }, { "entropy": 5.9765973567962645, "epoch": 6.066679634312391, "grad_norm": 1.53125, "learning_rate": 0.00020304015248942642, "loss": 4.9436, "mean_token_accuracy": 0.22375525981187822, "num_tokens": 135245269.0, "step": 77975 }, { "entropy": 6.03334527015686, "epoch": 6.0670686636841085, "grad_norm": 1.390625, "learning_rate": 0.00020301389313145886, "loss": 4.9608, "mean_token_accuracy": 0.22217994183301926, "num_tokens": 135253809.0, "step": 77980 }, { "entropy": 5.997375202178955, "epoch": 6.067457693055825, "grad_norm": 1.46875, "learning_rate": 0.00020298763486576566, "loss": 4.8808, "mean_token_accuracy": 0.2261785924434662, "num_tokens": 135263583.0, "step": 77985 }, { "entropy": 5.9226892471313475, "epoch": 6.067846722427543, "grad_norm": 1.5703125, "learning_rate": 0.00020296137769274563, "loss": 4.8795, "mean_token_accuracy": 0.2286846086382866, "num_tokens": 135272027.0, "step": 77990 }, { "entropy": 5.973358917236328, "epoch": 6.068235751799261, "grad_norm": 1.6171875, "learning_rate": 0.00020293512161279704, "loss": 5.0167, "mean_token_accuracy": 0.2188491106033325, "num_tokens": 135280320.0, "step": 77995 }, { "entropy": 5.903932332992554, "epoch": 6.068624781170978, "grad_norm": 1.6796875, "learning_rate": 0.00020290886662631825, "loss": 4.8596, "mean_token_accuracy": 0.2267376646399498, "num_tokens": 135288757.0, "step": 78000 }, { "epoch": 6.068624781170978, "eval_entropy": 5.674746320887869, "eval_loss": 5.044197082519531, "eval_mean_token_accuracy": 0.22419949895464766, "eval_num_tokens": 135288757.0, "eval_runtime": 21.6275, "eval_samples_per_second": 1921.533, "eval_steps_per_second": 240.203, "step": 78000 }, { "entropy": 5.985635566711426, "epoch": 6.069013810542696, "grad_norm": 1.5625, "learning_rate": 0.00020288261273370767, "loss": 4.9276, "mean_token_accuracy": 0.224013289809227, "num_tokens": 135297685.0, "step": 78005 }, { "entropy": 5.890841388702393, "epoch": 6.069402839914414, "grad_norm": 1.5859375, "learning_rate": 0.00020285635993536372, "loss": 4.7195, "mean_token_accuracy": 0.23789566159248351, "num_tokens": 135305975.0, "step": 78010 }, { "entropy": 5.9819926738739015, "epoch": 6.0697918692861315, "grad_norm": 1.515625, "learning_rate": 0.00020283010823168464, "loss": 4.9691, "mean_token_accuracy": 0.22070698887109758, "num_tokens": 135315210.0, "step": 78015 }, { "entropy": 5.904526853561402, "epoch": 6.070180898657848, "grad_norm": 1.546875, "learning_rate": 0.00020280385762306874, "loss": 4.8561, "mean_token_accuracy": 0.22912377417087554, "num_tokens": 135323360.0, "step": 78020 }, { "entropy": 5.986085891723633, "epoch": 6.070569928029566, "grad_norm": 1.4921875, "learning_rate": 0.00020277760810991446, "loss": 4.911, "mean_token_accuracy": 0.22665352523326873, "num_tokens": 135332326.0, "step": 78025 }, { "entropy": 6.007417964935303, "epoch": 6.070958957401284, "grad_norm": 1.515625, "learning_rate": 0.00020275135969262, "loss": 5.0495, "mean_token_accuracy": 0.2141617015004158, "num_tokens": 135341759.0, "step": 78030 }, { "entropy": 6.044129514694214, "epoch": 6.071347986773001, "grad_norm": 1.6328125, "learning_rate": 0.00020272511237158364, "loss": 4.9632, "mean_token_accuracy": 0.2190430134534836, "num_tokens": 135349150.0, "step": 78035 }, { "entropy": 6.009207534790039, "epoch": 6.071737016144719, "grad_norm": 1.625, "learning_rate": 0.00020269886614720367, "loss": 4.9278, "mean_token_accuracy": 0.22112569212913513, "num_tokens": 135357483.0, "step": 78040 }, { "entropy": 5.9999665260314945, "epoch": 6.072126045516437, "grad_norm": 1.7109375, "learning_rate": 0.00020267262101987833, "loss": 4.9262, "mean_token_accuracy": 0.21539801955223084, "num_tokens": 135365937.0, "step": 78045 }, { "entropy": 6.034775066375732, "epoch": 6.0725150748881545, "grad_norm": 1.4375, "learning_rate": 0.00020264637699000587, "loss": 5.0689, "mean_token_accuracy": 0.21587740182876586, "num_tokens": 135374372.0, "step": 78050 }, { "entropy": 5.972180318832398, "epoch": 6.072904104259871, "grad_norm": 1.4140625, "learning_rate": 0.0002026201340579844, "loss": 4.9243, "mean_token_accuracy": 0.21376640498638153, "num_tokens": 135382625.0, "step": 78055 }, { "entropy": 6.0044841289520265, "epoch": 6.073293133631589, "grad_norm": 1.6015625, "learning_rate": 0.00020259389222421225, "loss": 4.9157, "mean_token_accuracy": 0.22653304785490036, "num_tokens": 135391037.0, "step": 78060 }, { "entropy": 5.9874166488647464, "epoch": 6.073682163003307, "grad_norm": 1.65625, "learning_rate": 0.00020256765148908752, "loss": 4.9402, "mean_token_accuracy": 0.22228442132472992, "num_tokens": 135400278.0, "step": 78065 }, { "entropy": 5.974554395675659, "epoch": 6.074071192375024, "grad_norm": 1.578125, "learning_rate": 0.0002025414118530084, "loss": 4.9126, "mean_token_accuracy": 0.223488487303257, "num_tokens": 135409189.0, "step": 78070 }, { "entropy": 5.922073078155518, "epoch": 6.074460221746742, "grad_norm": 1.671875, "learning_rate": 0.00020251517331637303, "loss": 4.8647, "mean_token_accuracy": 0.2338866338133812, "num_tokens": 135417926.0, "step": 78075 }, { "entropy": 5.969542741775513, "epoch": 6.07484925111846, "grad_norm": 1.59375, "learning_rate": 0.00020248893587957955, "loss": 4.9349, "mean_token_accuracy": 0.21988017559051515, "num_tokens": 135426236.0, "step": 78080 }, { "entropy": 5.952415084838867, "epoch": 6.0752382804901774, "grad_norm": 1.59375, "learning_rate": 0.00020246269954302603, "loss": 4.9768, "mean_token_accuracy": 0.2148200422525406, "num_tokens": 135434816.0, "step": 78085 }, { "entropy": 5.940057468414307, "epoch": 6.075627309861894, "grad_norm": 1.6015625, "learning_rate": 0.00020243646430711065, "loss": 4.8097, "mean_token_accuracy": 0.2401748701930046, "num_tokens": 135443194.0, "step": 78090 }, { "entropy": 5.895291090011597, "epoch": 6.076016339233612, "grad_norm": 1.609375, "learning_rate": 0.00020241023017223138, "loss": 4.8163, "mean_token_accuracy": 0.22246948778629302, "num_tokens": 135451568.0, "step": 78095 }, { "entropy": 5.874649286270142, "epoch": 6.07640536860533, "grad_norm": 1.6015625, "learning_rate": 0.00020238399713878635, "loss": 4.7788, "mean_token_accuracy": 0.23226355761289597, "num_tokens": 135459633.0, "step": 78100 }, { "entropy": 6.016199684143066, "epoch": 6.076794397977047, "grad_norm": 1.625, "learning_rate": 0.00020235776520717352, "loss": 5.0104, "mean_token_accuracy": 0.2190709486603737, "num_tokens": 135467939.0, "step": 78105 }, { "entropy": 6.004969787597656, "epoch": 6.077183427348765, "grad_norm": 1.734375, "learning_rate": 0.000202331534377791, "loss": 4.9775, "mean_token_accuracy": 0.21960571110248567, "num_tokens": 135476200.0, "step": 78110 }, { "entropy": 5.9907396793365475, "epoch": 6.077572456720483, "grad_norm": 1.53125, "learning_rate": 0.00020230530465103686, "loss": 4.8747, "mean_token_accuracy": 0.2299434170126915, "num_tokens": 135484564.0, "step": 78115 }, { "entropy": 5.974975538253784, "epoch": 6.0779614860921996, "grad_norm": 1.6875, "learning_rate": 0.00020227907602730888, "loss": 4.9431, "mean_token_accuracy": 0.22075805068016052, "num_tokens": 135493359.0, "step": 78120 }, { "entropy": 5.924606084823608, "epoch": 6.078350515463917, "grad_norm": 1.421875, "learning_rate": 0.00020225284850700526, "loss": 4.9237, "mean_token_accuracy": 0.2304464966058731, "num_tokens": 135502440.0, "step": 78125 }, { "entropy": 6.001686382293701, "epoch": 6.078739544835635, "grad_norm": 1.5234375, "learning_rate": 0.00020222662209052388, "loss": 4.9352, "mean_token_accuracy": 0.22169570922851561, "num_tokens": 135511185.0, "step": 78130 }, { "entropy": 5.9566662311553955, "epoch": 6.079128574207353, "grad_norm": 1.5703125, "learning_rate": 0.00020220039677826263, "loss": 4.8743, "mean_token_accuracy": 0.21854217648506163, "num_tokens": 135519683.0, "step": 78135 }, { "entropy": 6.007566022872925, "epoch": 6.07951760357907, "grad_norm": 1.5234375, "learning_rate": 0.00020217417257061953, "loss": 4.9451, "mean_token_accuracy": 0.22036110758781433, "num_tokens": 135527963.0, "step": 78140 }, { "entropy": 5.933487367630005, "epoch": 6.079906632950788, "grad_norm": 1.7421875, "learning_rate": 0.00020214794946799247, "loss": 4.8944, "mean_token_accuracy": 0.2287461429834366, "num_tokens": 135536110.0, "step": 78145 }, { "entropy": 5.980324697494507, "epoch": 6.080295662322506, "grad_norm": 1.609375, "learning_rate": 0.0002021217274707793, "loss": 4.904, "mean_token_accuracy": 0.21983834356069565, "num_tokens": 135544391.0, "step": 78150 }, { "entropy": 5.901234292984009, "epoch": 6.0806846916942225, "grad_norm": 1.4765625, "learning_rate": 0.00020209550657937787, "loss": 4.8735, "mean_token_accuracy": 0.22051397562026978, "num_tokens": 135553449.0, "step": 78155 }, { "entropy": 5.968926620483399, "epoch": 6.08107372106594, "grad_norm": 1.5703125, "learning_rate": 0.00020206928679418612, "loss": 4.9678, "mean_token_accuracy": 0.21841342449188234, "num_tokens": 135562457.0, "step": 78160 }, { "entropy": 5.924316120147705, "epoch": 6.081462750437658, "grad_norm": 1.5390625, "learning_rate": 0.00020204306811560187, "loss": 4.8599, "mean_token_accuracy": 0.23003023117780685, "num_tokens": 135570820.0, "step": 78165 }, { "entropy": 5.961174964904785, "epoch": 6.081851779809376, "grad_norm": 1.5703125, "learning_rate": 0.00020201685054402303, "loss": 4.8848, "mean_token_accuracy": 0.2240026295185089, "num_tokens": 135579086.0, "step": 78170 }, { "entropy": 5.973650550842285, "epoch": 6.082240809181093, "grad_norm": 1.53125, "learning_rate": 0.0002019906340798472, "loss": 4.9107, "mean_token_accuracy": 0.22466128766536714, "num_tokens": 135587723.0, "step": 78175 }, { "entropy": 5.9488404273986815, "epoch": 6.082629838552811, "grad_norm": 1.484375, "learning_rate": 0.00020196441872347232, "loss": 4.9351, "mean_token_accuracy": 0.22238851636648177, "num_tokens": 135596396.0, "step": 78180 }, { "entropy": 5.9618528366088865, "epoch": 6.083018867924529, "grad_norm": 1.484375, "learning_rate": 0.00020193820447529605, "loss": 4.876, "mean_token_accuracy": 0.22049222141504288, "num_tokens": 135604193.0, "step": 78185 }, { "entropy": 5.927823114395141, "epoch": 6.0834078972962455, "grad_norm": 1.671875, "learning_rate": 0.0002019119913357163, "loss": 4.9647, "mean_token_accuracy": 0.21910331696271895, "num_tokens": 135612719.0, "step": 78190 }, { "entropy": 5.905794429779053, "epoch": 6.083796926667963, "grad_norm": 1.5546875, "learning_rate": 0.00020188577930513074, "loss": 4.9063, "mean_token_accuracy": 0.2226342722773552, "num_tokens": 135621350.0, "step": 78195 }, { "entropy": 6.03681492805481, "epoch": 6.084185956039681, "grad_norm": 1.5703125, "learning_rate": 0.0002018595683839372, "loss": 5.008, "mean_token_accuracy": 0.2172956347465515, "num_tokens": 135629799.0, "step": 78200 }, { "entropy": 5.981302213668823, "epoch": 6.084574985411399, "grad_norm": 1.46875, "learning_rate": 0.00020183335857253327, "loss": 4.9389, "mean_token_accuracy": 0.22085150927305222, "num_tokens": 135638679.0, "step": 78205 }, { "entropy": 5.939679384231567, "epoch": 6.084964014783116, "grad_norm": 1.515625, "learning_rate": 0.00020180714987131658, "loss": 4.8383, "mean_token_accuracy": 0.22711574733257295, "num_tokens": 135646638.0, "step": 78210 }, { "entropy": 5.958037376403809, "epoch": 6.085353044154834, "grad_norm": 1.640625, "learning_rate": 0.000201780942280685, "loss": 4.94, "mean_token_accuracy": 0.2228827506303787, "num_tokens": 135654861.0, "step": 78215 }, { "entropy": 5.9381880283355715, "epoch": 6.085742073526551, "grad_norm": 1.6796875, "learning_rate": 0.000201754735801036, "loss": 4.8244, "mean_token_accuracy": 0.2219199001789093, "num_tokens": 135662506.0, "step": 78220 }, { "entropy": 5.963792037963867, "epoch": 6.0861311028982685, "grad_norm": 1.515625, "learning_rate": 0.00020172853043276735, "loss": 4.8962, "mean_token_accuracy": 0.2203740045428276, "num_tokens": 135670970.0, "step": 78225 }, { "entropy": 5.986278676986695, "epoch": 6.086520132269986, "grad_norm": 1.5625, "learning_rate": 0.0002017023261762766, "loss": 4.9627, "mean_token_accuracy": 0.2270832121372223, "num_tokens": 135680058.0, "step": 78230 }, { "entropy": 6.010351514816284, "epoch": 6.086909161641704, "grad_norm": 1.5703125, "learning_rate": 0.0002016761230319613, "loss": 4.9853, "mean_token_accuracy": 0.21775639355182647, "num_tokens": 135688835.0, "step": 78235 }, { "entropy": 5.985901117324829, "epoch": 6.087298191013422, "grad_norm": 1.59375, "learning_rate": 0.00020164992100021924, "loss": 4.9348, "mean_token_accuracy": 0.2217437282204628, "num_tokens": 135697019.0, "step": 78240 }, { "entropy": 6.035257148742676, "epoch": 6.087687220385139, "grad_norm": 1.5546875, "learning_rate": 0.00020162372008144792, "loss": 4.977, "mean_token_accuracy": 0.2180163249373436, "num_tokens": 135706148.0, "step": 78245 }, { "entropy": 5.969739246368408, "epoch": 6.088076249756857, "grad_norm": 1.578125, "learning_rate": 0.00020159752027604477, "loss": 4.9249, "mean_token_accuracy": 0.21598249673843384, "num_tokens": 135714859.0, "step": 78250 }, { "entropy": 5.97525315284729, "epoch": 6.088465279128574, "grad_norm": 1.59375, "learning_rate": 0.00020157132158440732, "loss": 4.9099, "mean_token_accuracy": 0.21825291961431503, "num_tokens": 135722671.0, "step": 78255 }, { "entropy": 5.8818765640258786, "epoch": 6.0888543085002915, "grad_norm": 1.578125, "learning_rate": 0.00020154512400693338, "loss": 4.8211, "mean_token_accuracy": 0.22820490300655366, "num_tokens": 135731192.0, "step": 78260 }, { "entropy": 5.9135274410247805, "epoch": 6.089243337872009, "grad_norm": 1.53125, "learning_rate": 0.0002015189275440202, "loss": 4.8799, "mean_token_accuracy": 0.22689738124608994, "num_tokens": 135739394.0, "step": 78265 }, { "entropy": 6.028908586502075, "epoch": 6.089632367243727, "grad_norm": 1.6328125, "learning_rate": 0.00020149273219606528, "loss": 4.9841, "mean_token_accuracy": 0.2104635387659073, "num_tokens": 135748708.0, "step": 78270 }, { "entropy": 6.017696762084961, "epoch": 6.090021396615445, "grad_norm": 1.609375, "learning_rate": 0.0002014665379634662, "loss": 4.9102, "mean_token_accuracy": 0.22166254818439485, "num_tokens": 135756686.0, "step": 78275 }, { "entropy": 5.969715976715088, "epoch": 6.090410425987162, "grad_norm": 1.53125, "learning_rate": 0.00020144034484662044, "loss": 4.8674, "mean_token_accuracy": 0.22737436145544052, "num_tokens": 135765062.0, "step": 78280 }, { "entropy": 5.960886383056641, "epoch": 6.09079945535888, "grad_norm": 1.6953125, "learning_rate": 0.00020141415284592528, "loss": 4.9609, "mean_token_accuracy": 0.21668445318937302, "num_tokens": 135773651.0, "step": 78285 }, { "entropy": 5.986602544784546, "epoch": 6.091188484730597, "grad_norm": 1.5625, "learning_rate": 0.00020138796196177827, "loss": 4.9672, "mean_token_accuracy": 0.22843015491962432, "num_tokens": 135781910.0, "step": 78290 }, { "entropy": 5.940346384048462, "epoch": 6.0915775141023145, "grad_norm": 1.546875, "learning_rate": 0.00020136177219457675, "loss": 4.9133, "mean_token_accuracy": 0.21467115730047226, "num_tokens": 135790118.0, "step": 78295 }, { "entropy": 5.889401435852051, "epoch": 6.091966543474032, "grad_norm": 1.6796875, "learning_rate": 0.0002013355835447181, "loss": 4.8478, "mean_token_accuracy": 0.22108627557754518, "num_tokens": 135799109.0, "step": 78300 }, { "entropy": 6.015622186660766, "epoch": 6.09235557284575, "grad_norm": 1.421875, "learning_rate": 0.00020130939601259974, "loss": 4.9757, "mean_token_accuracy": 0.22181079983711244, "num_tokens": 135808542.0, "step": 78305 }, { "entropy": 5.994078779220581, "epoch": 6.092744602217468, "grad_norm": 1.5859375, "learning_rate": 0.00020128320959861902, "loss": 4.9054, "mean_token_accuracy": 0.2278132528066635, "num_tokens": 135817617.0, "step": 78310 }, { "entropy": 6.033066654205323, "epoch": 6.093133631589185, "grad_norm": 1.5625, "learning_rate": 0.00020125702430317323, "loss": 5.0221, "mean_token_accuracy": 0.2120734080672264, "num_tokens": 135827192.0, "step": 78315 }, { "entropy": 6.0025825023651125, "epoch": 6.093522660960902, "grad_norm": 1.5625, "learning_rate": 0.0002012308401266597, "loss": 4.9805, "mean_token_accuracy": 0.2124684363603592, "num_tokens": 135835581.0, "step": 78320 }, { "entropy": 5.947249126434326, "epoch": 6.09391169033262, "grad_norm": 1.5, "learning_rate": 0.00020120465706947584, "loss": 4.8556, "mean_token_accuracy": 0.22199095338582991, "num_tokens": 135844329.0, "step": 78325 }, { "entropy": 5.981993532180786, "epoch": 6.0943007197043375, "grad_norm": 1.4765625, "learning_rate": 0.00020117847513201876, "loss": 4.9023, "mean_token_accuracy": 0.22581162452697753, "num_tokens": 135853141.0, "step": 78330 }, { "entropy": 6.012953615188598, "epoch": 6.094689749076055, "grad_norm": 1.65625, "learning_rate": 0.0002011522943146859, "loss": 4.9484, "mean_token_accuracy": 0.21931291371583939, "num_tokens": 135860911.0, "step": 78335 }, { "entropy": 5.961538791656494, "epoch": 6.095078778447773, "grad_norm": 1.515625, "learning_rate": 0.0002011261146178744, "loss": 4.9188, "mean_token_accuracy": 0.222324900329113, "num_tokens": 135869672.0, "step": 78340 }, { "entropy": 5.911401653289795, "epoch": 6.095467807819491, "grad_norm": 1.5, "learning_rate": 0.00020109993604198152, "loss": 4.8742, "mean_token_accuracy": 0.22937599271535875, "num_tokens": 135878076.0, "step": 78345 }, { "entropy": 5.91434760093689, "epoch": 6.095856837191208, "grad_norm": 1.5390625, "learning_rate": 0.0002010737585874045, "loss": 4.9257, "mean_token_accuracy": 0.21909331530332565, "num_tokens": 135886783.0, "step": 78350 }, { "entropy": 5.983807849884033, "epoch": 6.096245866562925, "grad_norm": 1.6328125, "learning_rate": 0.0002010475822545405, "loss": 4.9721, "mean_token_accuracy": 0.21677321046590806, "num_tokens": 135895121.0, "step": 78355 }, { "entropy": 5.939267015457153, "epoch": 6.096634895934643, "grad_norm": 1.4921875, "learning_rate": 0.0002010214070437868, "loss": 4.9304, "mean_token_accuracy": 0.22152261435985565, "num_tokens": 135903981.0, "step": 78360 }, { "entropy": 5.964714050292969, "epoch": 6.0970239253063605, "grad_norm": 1.53125, "learning_rate": 0.00020099523295554045, "loss": 4.8854, "mean_token_accuracy": 0.22363710403442383, "num_tokens": 135911847.0, "step": 78365 }, { "entropy": 5.938686943054199, "epoch": 6.097412954678078, "grad_norm": 1.6328125, "learning_rate": 0.00020096905999019871, "loss": 4.8925, "mean_token_accuracy": 0.22739910334348679, "num_tokens": 135920926.0, "step": 78370 }, { "entropy": 5.927397012710571, "epoch": 6.097801984049796, "grad_norm": 1.625, "learning_rate": 0.00020094288814815858, "loss": 4.8736, "mean_token_accuracy": 0.2275019630789757, "num_tokens": 135928902.0, "step": 78375 }, { "entropy": 5.96088056564331, "epoch": 6.098191013421514, "grad_norm": 1.4609375, "learning_rate": 0.00020091671742981725, "loss": 4.9537, "mean_token_accuracy": 0.22085745483636857, "num_tokens": 135938201.0, "step": 78380 }, { "entropy": 6.004913187026977, "epoch": 6.098580042793231, "grad_norm": 1.6796875, "learning_rate": 0.00020089054783557176, "loss": 4.8685, "mean_token_accuracy": 0.22405725866556167, "num_tokens": 135946584.0, "step": 78385 }, { "entropy": 5.958474254608154, "epoch": 6.098969072164948, "grad_norm": 1.640625, "learning_rate": 0.00020086437936581936, "loss": 4.8839, "mean_token_accuracy": 0.21675440073013305, "num_tokens": 135954758.0, "step": 78390 }, { "entropy": 5.905165719985962, "epoch": 6.099358101536666, "grad_norm": 1.640625, "learning_rate": 0.00020083821202095697, "loss": 4.8748, "mean_token_accuracy": 0.22586527168750764, "num_tokens": 135964088.0, "step": 78395 }, { "entropy": 5.974940586090088, "epoch": 6.0997471309083835, "grad_norm": 1.6015625, "learning_rate": 0.00020081204580138162, "loss": 4.9715, "mean_token_accuracy": 0.21640000492334366, "num_tokens": 135972669.0, "step": 78400 }, { "entropy": 5.946333932876587, "epoch": 6.100136160280101, "grad_norm": 1.484375, "learning_rate": 0.00020078588070749048, "loss": 4.851, "mean_token_accuracy": 0.22575690299272538, "num_tokens": 135981287.0, "step": 78405 }, { "entropy": 5.9553179264068605, "epoch": 6.100525189651819, "grad_norm": 1.5546875, "learning_rate": 0.00020075971673968042, "loss": 4.8407, "mean_token_accuracy": 0.220459420979023, "num_tokens": 135989412.0, "step": 78410 }, { "entropy": 5.992336893081665, "epoch": 6.100914219023537, "grad_norm": 1.671875, "learning_rate": 0.00020073355389834852, "loss": 4.9073, "mean_token_accuracy": 0.2298018679022789, "num_tokens": 135998070.0, "step": 78415 }, { "entropy": 5.970849704742432, "epoch": 6.101303248395254, "grad_norm": 1.5859375, "learning_rate": 0.00020070739218389173, "loss": 4.9141, "mean_token_accuracy": 0.22805558145046234, "num_tokens": 136007219.0, "step": 78420 }, { "entropy": 5.991208457946778, "epoch": 6.101692277766971, "grad_norm": 1.6171875, "learning_rate": 0.00020068123159670698, "loss": 4.9129, "mean_token_accuracy": 0.23118423372507096, "num_tokens": 136015658.0, "step": 78425 }, { "entropy": 5.9620085716247555, "epoch": 6.102081307138689, "grad_norm": 1.5, "learning_rate": 0.00020065507213719132, "loss": 4.9987, "mean_token_accuracy": 0.21187917441129683, "num_tokens": 136024669.0, "step": 78430 }, { "entropy": 5.9589409828186035, "epoch": 6.1024703365104065, "grad_norm": 1.5, "learning_rate": 0.00020062891380574156, "loss": 4.936, "mean_token_accuracy": 0.2157642126083374, "num_tokens": 136033183.0, "step": 78435 }, { "entropy": 5.93713903427124, "epoch": 6.102859365882124, "grad_norm": 1.5390625, "learning_rate": 0.00020060275660275468, "loss": 4.8003, "mean_token_accuracy": 0.23457692712545394, "num_tokens": 136042125.0, "step": 78440 }, { "entropy": 5.933380556106568, "epoch": 6.103248395253842, "grad_norm": 1.625, "learning_rate": 0.00020057660052862753, "loss": 4.8727, "mean_token_accuracy": 0.22898467779159545, "num_tokens": 136050415.0, "step": 78445 }, { "entropy": 5.920478677749633, "epoch": 6.10363742462556, "grad_norm": 1.46875, "learning_rate": 0.00020055044558375695, "loss": 4.9291, "mean_token_accuracy": 0.21685829013586044, "num_tokens": 136059208.0, "step": 78450 }, { "entropy": 5.970703363418579, "epoch": 6.104026453997276, "grad_norm": 1.515625, "learning_rate": 0.00020052429176853993, "loss": 4.9713, "mean_token_accuracy": 0.218191060423851, "num_tokens": 136067814.0, "step": 78455 }, { "entropy": 5.956562328338623, "epoch": 6.104415483368994, "grad_norm": 1.6171875, "learning_rate": 0.00020049813908337323, "loss": 4.9678, "mean_token_accuracy": 0.22928624451160431, "num_tokens": 136076450.0, "step": 78460 }, { "entropy": 5.894328689575195, "epoch": 6.104804512740712, "grad_norm": 1.578125, "learning_rate": 0.0002004719875286537, "loss": 4.8219, "mean_token_accuracy": 0.22623507380485536, "num_tokens": 136085393.0, "step": 78465 }, { "entropy": 5.924663782119751, "epoch": 6.1051935421124295, "grad_norm": 1.59375, "learning_rate": 0.0002004458371047782, "loss": 4.8827, "mean_token_accuracy": 0.2290019229054451, "num_tokens": 136093942.0, "step": 78470 }, { "entropy": 5.972107076644898, "epoch": 6.105582571484147, "grad_norm": 1.65625, "learning_rate": 0.00020041968781214336, "loss": 4.8941, "mean_token_accuracy": 0.22824961096048355, "num_tokens": 136102357.0, "step": 78475 }, { "entropy": 5.956307077407837, "epoch": 6.105971600855865, "grad_norm": 1.46875, "learning_rate": 0.0002003935396511461, "loss": 4.9295, "mean_token_accuracy": 0.2217320129275322, "num_tokens": 136111966.0, "step": 78480 }, { "entropy": 5.954202556610108, "epoch": 6.106360630227583, "grad_norm": 1.640625, "learning_rate": 0.00020036739262218313, "loss": 4.9287, "mean_token_accuracy": 0.21754074841737747, "num_tokens": 136120461.0, "step": 78485 }, { "entropy": 5.9700439453125, "epoch": 6.106749659599299, "grad_norm": 1.6328125, "learning_rate": 0.00020034124672565112, "loss": 4.9445, "mean_token_accuracy": 0.21563442498445512, "num_tokens": 136128414.0, "step": 78490 }, { "entropy": 5.998425388336182, "epoch": 6.107138688971017, "grad_norm": 1.6171875, "learning_rate": 0.0002003151019619469, "loss": 4.9309, "mean_token_accuracy": 0.2237512856721878, "num_tokens": 136137363.0, "step": 78495 }, { "entropy": 6.058087778091431, "epoch": 6.107527718342735, "grad_norm": 1.5546875, "learning_rate": 0.00020028895833146715, "loss": 5.0696, "mean_token_accuracy": 0.20810706913471222, "num_tokens": 136146494.0, "step": 78500 }, { "entropy": 6.05325927734375, "epoch": 6.1079167477144525, "grad_norm": 1.5, "learning_rate": 0.00020026281583460854, "loss": 5.0224, "mean_token_accuracy": 0.2140989735722542, "num_tokens": 136155011.0, "step": 78505 }, { "entropy": 6.022303199768066, "epoch": 6.10830577708617, "grad_norm": 1.5234375, "learning_rate": 0.00020023667447176776, "loss": 4.9573, "mean_token_accuracy": 0.21531793028116225, "num_tokens": 136163206.0, "step": 78510 }, { "entropy": 5.968208932876587, "epoch": 6.108694806457888, "grad_norm": 1.6796875, "learning_rate": 0.00020021053424334142, "loss": 4.9764, "mean_token_accuracy": 0.22114571034908295, "num_tokens": 136171863.0, "step": 78515 }, { "entropy": 5.96893720626831, "epoch": 6.109083835829606, "grad_norm": 1.546875, "learning_rate": 0.00020018439514972615, "loss": 4.8881, "mean_token_accuracy": 0.22343537360429763, "num_tokens": 136180685.0, "step": 78520 }, { "entropy": 5.969165086746216, "epoch": 6.109472865201322, "grad_norm": 1.5390625, "learning_rate": 0.0002001582571913186, "loss": 4.8855, "mean_token_accuracy": 0.2221762016415596, "num_tokens": 136189410.0, "step": 78525 }, { "entropy": 5.932357597351074, "epoch": 6.10986189457304, "grad_norm": 1.5625, "learning_rate": 0.00020013212036851542, "loss": 4.8925, "mean_token_accuracy": 0.21919392943382263, "num_tokens": 136198645.0, "step": 78530 }, { "entropy": 5.836781454086304, "epoch": 6.110250923944758, "grad_norm": 1.515625, "learning_rate": 0.00020010598468171316, "loss": 4.6828, "mean_token_accuracy": 0.24857892990112304, "num_tokens": 136207691.0, "step": 78535 }, { "entropy": 5.985394096374511, "epoch": 6.1106399533164755, "grad_norm": 1.421875, "learning_rate": 0.0002000798501313083, "loss": 4.9704, "mean_token_accuracy": 0.21573147773742676, "num_tokens": 136216838.0, "step": 78540 }, { "entropy": 6.031375074386597, "epoch": 6.111028982688193, "grad_norm": 1.453125, "learning_rate": 0.00020005371671769756, "loss": 4.9895, "mean_token_accuracy": 0.21868302077054977, "num_tokens": 136225421.0, "step": 78545 }, { "entropy": 5.961360836029053, "epoch": 6.111418012059911, "grad_norm": 1.6328125, "learning_rate": 0.00020002758444127738, "loss": 4.8843, "mean_token_accuracy": 0.22049076557159425, "num_tokens": 136233919.0, "step": 78550 }, { "entropy": 5.922882318496704, "epoch": 6.111807041431628, "grad_norm": 1.484375, "learning_rate": 0.00020000145330244424, "loss": 4.7975, "mean_token_accuracy": 0.22663377970457077, "num_tokens": 136241662.0, "step": 78555 }, { "entropy": 5.9643824100494385, "epoch": 6.112196070803345, "grad_norm": 1.3671875, "learning_rate": 0.0001999753233015947, "loss": 5.0022, "mean_token_accuracy": 0.21466088742017747, "num_tokens": 136251153.0, "step": 78560 }, { "entropy": 5.958481740951538, "epoch": 6.112585100175063, "grad_norm": 1.6484375, "learning_rate": 0.00019994919443912514, "loss": 4.8182, "mean_token_accuracy": 0.23033823370933532, "num_tokens": 136259392.0, "step": 78565 }, { "entropy": 5.9595917701721195, "epoch": 6.112974129546781, "grad_norm": 1.6796875, "learning_rate": 0.00019992306671543213, "loss": 4.9442, "mean_token_accuracy": 0.22140335887670518, "num_tokens": 136268438.0, "step": 78570 }, { "entropy": 5.961529731750488, "epoch": 6.1133631589184985, "grad_norm": 1.6015625, "learning_rate": 0.00019989694013091214, "loss": 4.968, "mean_token_accuracy": 0.2194148138165474, "num_tokens": 136277501.0, "step": 78575 }, { "entropy": 5.889406394958496, "epoch": 6.113752188290216, "grad_norm": 1.4765625, "learning_rate": 0.00019987081468596146, "loss": 4.8353, "mean_token_accuracy": 0.23202701508998871, "num_tokens": 136285699.0, "step": 78580 }, { "entropy": 6.0094305038452145, "epoch": 6.114141217661934, "grad_norm": 1.6953125, "learning_rate": 0.00019984469038097658, "loss": 4.9749, "mean_token_accuracy": 0.222022707760334, "num_tokens": 136294560.0, "step": 78585 }, { "entropy": 6.0004417419433596, "epoch": 6.114530247033651, "grad_norm": 1.6328125, "learning_rate": 0.000199818567216354, "loss": 4.9225, "mean_token_accuracy": 0.22777402102947236, "num_tokens": 136303523.0, "step": 78590 }, { "entropy": 6.034603834152222, "epoch": 6.114919276405368, "grad_norm": 1.4375, "learning_rate": 0.00019979244519248996, "loss": 5.0494, "mean_token_accuracy": 0.21380944401025773, "num_tokens": 136312897.0, "step": 78595 }, { "entropy": 5.898952007293701, "epoch": 6.115308305777086, "grad_norm": 1.4453125, "learning_rate": 0.0001997663243097808, "loss": 4.7808, "mean_token_accuracy": 0.2306784823536873, "num_tokens": 136321550.0, "step": 78600 }, { "entropy": 5.992227554321289, "epoch": 6.115697335148804, "grad_norm": 1.5390625, "learning_rate": 0.00019974020456862295, "loss": 4.9815, "mean_token_accuracy": 0.2275203660130501, "num_tokens": 136330477.0, "step": 78605 }, { "entropy": 5.97981333732605, "epoch": 6.1160863645205215, "grad_norm": 1.5625, "learning_rate": 0.00019971408596941283, "loss": 4.9931, "mean_token_accuracy": 0.21446480304002763, "num_tokens": 136338956.0, "step": 78610 }, { "entropy": 5.984450435638427, "epoch": 6.116475393892239, "grad_norm": 1.5, "learning_rate": 0.0001996879685125465, "loss": 4.8987, "mean_token_accuracy": 0.22448585778474808, "num_tokens": 136347124.0, "step": 78615 }, { "entropy": 5.93726224899292, "epoch": 6.116864423263957, "grad_norm": 1.5078125, "learning_rate": 0.00019966185219842038, "loss": 4.8762, "mean_token_accuracy": 0.2140411004424095, "num_tokens": 136355456.0, "step": 78620 }, { "entropy": 5.9282817363739015, "epoch": 6.117253452635674, "grad_norm": 1.578125, "learning_rate": 0.00019963573702743077, "loss": 4.9551, "mean_token_accuracy": 0.2192707657814026, "num_tokens": 136364264.0, "step": 78625 }, { "entropy": 5.967901134490967, "epoch": 6.117642482007391, "grad_norm": 1.5390625, "learning_rate": 0.00019960962299997394, "loss": 4.8721, "mean_token_accuracy": 0.2309507042169571, "num_tokens": 136373105.0, "step": 78630 }, { "entropy": 5.91287055015564, "epoch": 6.118031511379109, "grad_norm": 1.59375, "learning_rate": 0.00019958351011644605, "loss": 4.8756, "mean_token_accuracy": 0.21847671866416932, "num_tokens": 136381968.0, "step": 78635 }, { "entropy": 5.934564828872681, "epoch": 6.118420540750827, "grad_norm": 1.5390625, "learning_rate": 0.0001995573983772433, "loss": 4.828, "mean_token_accuracy": 0.2331065520644188, "num_tokens": 136389803.0, "step": 78640 }, { "entropy": 5.997598552703858, "epoch": 6.1188095701225445, "grad_norm": 1.6640625, "learning_rate": 0.00019953128778276197, "loss": 4.9311, "mean_token_accuracy": 0.22141017019748688, "num_tokens": 136397704.0, "step": 78645 }, { "entropy": 6.0067493438720705, "epoch": 6.119198599494262, "grad_norm": 1.4765625, "learning_rate": 0.0001995051783333982, "loss": 4.9909, "mean_token_accuracy": 0.21464648246765136, "num_tokens": 136406042.0, "step": 78650 }, { "entropy": 6.001147890090943, "epoch": 6.119587628865979, "grad_norm": 1.515625, "learning_rate": 0.00019947907002954818, "loss": 4.9574, "mean_token_accuracy": 0.2186083197593689, "num_tokens": 136414128.0, "step": 78655 }, { "entropy": 5.971075582504272, "epoch": 6.119976658237697, "grad_norm": 1.6015625, "learning_rate": 0.00019945296287160818, "loss": 4.9194, "mean_token_accuracy": 0.22189908474683762, "num_tokens": 136422710.0, "step": 78660 }, { "entropy": 5.9549116611480715, "epoch": 6.120365687609414, "grad_norm": 1.59375, "learning_rate": 0.0001994268568599742, "loss": 5.0005, "mean_token_accuracy": 0.20999650955200194, "num_tokens": 136430743.0, "step": 78665 }, { "entropy": 5.952028751373291, "epoch": 6.120754716981132, "grad_norm": 1.546875, "learning_rate": 0.00019940075199504232, "loss": 4.8831, "mean_token_accuracy": 0.2252148911356926, "num_tokens": 136440033.0, "step": 78670 }, { "entropy": 5.974386882781983, "epoch": 6.12114374635285, "grad_norm": 1.6015625, "learning_rate": 0.00019937464827720874, "loss": 4.8616, "mean_token_accuracy": 0.23385551422834397, "num_tokens": 136448077.0, "step": 78675 }, { "entropy": 5.999250507354736, "epoch": 6.121532775724567, "grad_norm": 1.5390625, "learning_rate": 0.00019934854570686944, "loss": 4.984, "mean_token_accuracy": 0.2167230427265167, "num_tokens": 136456930.0, "step": 78680 }, { "entropy": 5.897667360305786, "epoch": 6.121921805096285, "grad_norm": 1.5078125, "learning_rate": 0.00019932244428442065, "loss": 4.8525, "mean_token_accuracy": 0.227958944439888, "num_tokens": 136464990.0, "step": 78685 }, { "entropy": 5.878890180587769, "epoch": 6.122310834468002, "grad_norm": 1.71875, "learning_rate": 0.00019929634401025825, "loss": 4.8516, "mean_token_accuracy": 0.2264557361602783, "num_tokens": 136473459.0, "step": 78690 }, { "entropy": 5.987198209762573, "epoch": 6.12269986383972, "grad_norm": 1.5859375, "learning_rate": 0.0001992702448847783, "loss": 5.0076, "mean_token_accuracy": 0.21289132237434388, "num_tokens": 136481643.0, "step": 78695 }, { "entropy": 5.907851791381836, "epoch": 6.123088893211437, "grad_norm": 1.5, "learning_rate": 0.00019924414690837688, "loss": 4.8332, "mean_token_accuracy": 0.22933602929115296, "num_tokens": 136490394.0, "step": 78700 }, { "entropy": 5.954915475845337, "epoch": 6.123477922583155, "grad_norm": 1.53125, "learning_rate": 0.00019921805008145, "loss": 4.9589, "mean_token_accuracy": 0.21602309942245485, "num_tokens": 136499383.0, "step": 78705 }, { "entropy": 5.96660590171814, "epoch": 6.123866951954873, "grad_norm": 1.484375, "learning_rate": 0.00019919195440439358, "loss": 4.9154, "mean_token_accuracy": 0.22569091022014617, "num_tokens": 136508294.0, "step": 78710 }, { "entropy": 5.9572892665863035, "epoch": 6.12425598132659, "grad_norm": 1.46875, "learning_rate": 0.00019916585987760356, "loss": 4.8792, "mean_token_accuracy": 0.2245973527431488, "num_tokens": 136516819.0, "step": 78715 }, { "entropy": 5.965902376174927, "epoch": 6.124645010698308, "grad_norm": 1.6640625, "learning_rate": 0.00019913976650147585, "loss": 4.885, "mean_token_accuracy": 0.2214389756321907, "num_tokens": 136525512.0, "step": 78720 }, { "entropy": 5.967025995254517, "epoch": 6.125034040070025, "grad_norm": 1.59375, "learning_rate": 0.00019911367427640647, "loss": 4.9129, "mean_token_accuracy": 0.2209485426545143, "num_tokens": 136534673.0, "step": 78725 }, { "entropy": 5.958683633804322, "epoch": 6.125423069441743, "grad_norm": 1.4140625, "learning_rate": 0.00019908758320279134, "loss": 4.9064, "mean_token_accuracy": 0.21643196195363998, "num_tokens": 136544079.0, "step": 78730 }, { "entropy": 5.974506807327271, "epoch": 6.12581209881346, "grad_norm": 1.609375, "learning_rate": 0.00019906149328102635, "loss": 4.9069, "mean_token_accuracy": 0.2247644543647766, "num_tokens": 136552712.0, "step": 78735 }, { "entropy": 6.013232612609864, "epoch": 6.126201128185178, "grad_norm": 1.625, "learning_rate": 0.00019903540451150732, "loss": 4.9928, "mean_token_accuracy": 0.2182633548974991, "num_tokens": 136561444.0, "step": 78740 }, { "entropy": 5.910155534744263, "epoch": 6.126590157556896, "grad_norm": 1.515625, "learning_rate": 0.00019900931689463008, "loss": 4.8679, "mean_token_accuracy": 0.2251318320631981, "num_tokens": 136570619.0, "step": 78745 }, { "entropy": 5.927820873260498, "epoch": 6.126979186928613, "grad_norm": 1.4296875, "learning_rate": 0.00019898323043079054, "loss": 4.8526, "mean_token_accuracy": 0.22456406205892562, "num_tokens": 136579230.0, "step": 78750 }, { "entropy": 5.99037504196167, "epoch": 6.127368216300331, "grad_norm": 1.671875, "learning_rate": 0.00019895714512038436, "loss": 4.9928, "mean_token_accuracy": 0.21802987456321715, "num_tokens": 136587614.0, "step": 78755 }, { "entropy": 5.993751335144043, "epoch": 6.127757245672048, "grad_norm": 1.6171875, "learning_rate": 0.00019893106096380763, "loss": 4.8875, "mean_token_accuracy": 0.22469125390052797, "num_tokens": 136595509.0, "step": 78760 }, { "entropy": 5.979387092590332, "epoch": 6.128146275043766, "grad_norm": 1.515625, "learning_rate": 0.00019890497796145584, "loss": 4.9283, "mean_token_accuracy": 0.2224093794822693, "num_tokens": 136604160.0, "step": 78765 }, { "entropy": 5.965836000442505, "epoch": 6.128535304415483, "grad_norm": 1.5703125, "learning_rate": 0.00019887889611372502, "loss": 4.9494, "mean_token_accuracy": 0.22006654888391494, "num_tokens": 136613260.0, "step": 78770 }, { "entropy": 5.949742031097412, "epoch": 6.128924333787201, "grad_norm": 1.65625, "learning_rate": 0.0001988528154210107, "loss": 4.8694, "mean_token_accuracy": 0.23093582391738893, "num_tokens": 136621189.0, "step": 78775 }, { "entropy": 5.983337545394898, "epoch": 6.129313363158919, "grad_norm": 1.5390625, "learning_rate": 0.0001988267358837087, "loss": 4.9898, "mean_token_accuracy": 0.21921508014202118, "num_tokens": 136630732.0, "step": 78780 }, { "entropy": 6.01609845161438, "epoch": 6.129702392530636, "grad_norm": 1.6796875, "learning_rate": 0.0001988006575022147, "loss": 4.938, "mean_token_accuracy": 0.22378284186124803, "num_tokens": 136639194.0, "step": 78785 }, { "entropy": 5.922202491760254, "epoch": 6.130091421902353, "grad_norm": 1.5546875, "learning_rate": 0.00019877458027692458, "loss": 4.8713, "mean_token_accuracy": 0.21950026005506515, "num_tokens": 136647478.0, "step": 78790 }, { "entropy": 5.996760463714599, "epoch": 6.130480451274071, "grad_norm": 1.5, "learning_rate": 0.00019874850420823376, "loss": 5.0454, "mean_token_accuracy": 0.21112051606178284, "num_tokens": 136655967.0, "step": 78795 }, { "entropy": 5.984359312057495, "epoch": 6.130869480645789, "grad_norm": 1.4453125, "learning_rate": 0.00019872242929653812, "loss": 4.9134, "mean_token_accuracy": 0.21882197111845017, "num_tokens": 136666207.0, "step": 78800 }, { "entropy": 5.971501159667969, "epoch": 6.131258510017506, "grad_norm": 1.515625, "learning_rate": 0.00019869635554223313, "loss": 4.8592, "mean_token_accuracy": 0.2239970788359642, "num_tokens": 136674661.0, "step": 78805 }, { "entropy": 5.944386577606201, "epoch": 6.131647539389224, "grad_norm": 1.6328125, "learning_rate": 0.00019867028294571454, "loss": 4.8922, "mean_token_accuracy": 0.22543565779924393, "num_tokens": 136683213.0, "step": 78810 }, { "entropy": 5.996570444107055, "epoch": 6.132036568760942, "grad_norm": 1.609375, "learning_rate": 0.00019864421150737787, "loss": 5.014, "mean_token_accuracy": 0.20677502304315568, "num_tokens": 136692565.0, "step": 78815 }, { "entropy": 5.9893182754516605, "epoch": 6.132425598132659, "grad_norm": 1.5625, "learning_rate": 0.00019861814122761883, "loss": 4.9032, "mean_token_accuracy": 0.2206261858344078, "num_tokens": 136700712.0, "step": 78820 }, { "entropy": 5.91471266746521, "epoch": 6.132814627504376, "grad_norm": 1.4609375, "learning_rate": 0.0001985920721068329, "loss": 4.8796, "mean_token_accuracy": 0.23263075947761536, "num_tokens": 136709414.0, "step": 78825 }, { "entropy": 5.893651866912842, "epoch": 6.133203656876094, "grad_norm": 1.453125, "learning_rate": 0.00019856600414541566, "loss": 4.803, "mean_token_accuracy": 0.2273870438337326, "num_tokens": 136718324.0, "step": 78830 }, { "entropy": 5.9667566299438475, "epoch": 6.133592686247812, "grad_norm": 1.5390625, "learning_rate": 0.00019853993734376263, "loss": 4.9674, "mean_token_accuracy": 0.22334721088409423, "num_tokens": 136727026.0, "step": 78835 }, { "entropy": 5.943632650375366, "epoch": 6.133981715619529, "grad_norm": 1.453125, "learning_rate": 0.00019851387170226936, "loss": 4.8731, "mean_token_accuracy": 0.21944154649972916, "num_tokens": 136736140.0, "step": 78840 }, { "entropy": 5.925212621688843, "epoch": 6.134370744991247, "grad_norm": 1.6484375, "learning_rate": 0.0001984878072213313, "loss": 4.8879, "mean_token_accuracy": 0.22796605825424193, "num_tokens": 136745600.0, "step": 78845 }, { "entropy": 6.007452154159546, "epoch": 6.134759774362965, "grad_norm": 1.546875, "learning_rate": 0.00019846174390134396, "loss": 5.0104, "mean_token_accuracy": 0.21322810351848603, "num_tokens": 136755499.0, "step": 78850 }, { "entropy": 5.949771213531494, "epoch": 6.1351488037346815, "grad_norm": 1.6171875, "learning_rate": 0.00019843568174270293, "loss": 4.828, "mean_token_accuracy": 0.22947811782360078, "num_tokens": 136763429.0, "step": 78855 }, { "entropy": 5.978890609741211, "epoch": 6.135537833106399, "grad_norm": 1.6015625, "learning_rate": 0.00019840962074580348, "loss": 4.9193, "mean_token_accuracy": 0.22466979175806046, "num_tokens": 136771450.0, "step": 78860 }, { "entropy": 5.9711432456970215, "epoch": 6.135926862478117, "grad_norm": 1.5390625, "learning_rate": 0.0001983835609110412, "loss": 4.925, "mean_token_accuracy": 0.2249930590391159, "num_tokens": 136779694.0, "step": 78865 }, { "entropy": 5.962436819076538, "epoch": 6.136315891849835, "grad_norm": 1.5234375, "learning_rate": 0.00019835750223881144, "loss": 4.9465, "mean_token_accuracy": 0.22128317803144454, "num_tokens": 136788373.0, "step": 78870 }, { "entropy": 5.947157764434815, "epoch": 6.136704921221552, "grad_norm": 1.46875, "learning_rate": 0.00019833144472950953, "loss": 4.8901, "mean_token_accuracy": 0.22303520888090134, "num_tokens": 136796546.0, "step": 78875 }, { "entropy": 5.96454610824585, "epoch": 6.13709395059327, "grad_norm": 1.5390625, "learning_rate": 0.000198305388383531, "loss": 4.9106, "mean_token_accuracy": 0.2254924327135086, "num_tokens": 136805349.0, "step": 78880 }, { "entropy": 6.010669565200805, "epoch": 6.137482979964988, "grad_norm": 1.7109375, "learning_rate": 0.00019827933320127106, "loss": 4.9488, "mean_token_accuracy": 0.22360581308603286, "num_tokens": 136814936.0, "step": 78885 }, { "entropy": 5.990770626068115, "epoch": 6.1378720093367045, "grad_norm": 1.5546875, "learning_rate": 0.00019825327918312515, "loss": 4.8979, "mean_token_accuracy": 0.22744717001914977, "num_tokens": 136822974.0, "step": 78890 }, { "entropy": 5.972367906570435, "epoch": 6.138261038708422, "grad_norm": 1.5703125, "learning_rate": 0.00019822722632948858, "loss": 4.8329, "mean_token_accuracy": 0.22646649330854415, "num_tokens": 136830898.0, "step": 78895 }, { "entropy": 6.053360414505005, "epoch": 6.13865006808014, "grad_norm": 1.4921875, "learning_rate": 0.0001982011746407567, "loss": 5.0345, "mean_token_accuracy": 0.21833558082580568, "num_tokens": 136839349.0, "step": 78900 }, { "entropy": 5.955715131759644, "epoch": 6.139039097451858, "grad_norm": 1.65625, "learning_rate": 0.0001981751241173247, "loss": 4.8976, "mean_token_accuracy": 0.2290905609726906, "num_tokens": 136847599.0, "step": 78905 }, { "entropy": 5.97434515953064, "epoch": 6.139428126823575, "grad_norm": 1.6015625, "learning_rate": 0.00019814907475958793, "loss": 4.8743, "mean_token_accuracy": 0.22201920300722122, "num_tokens": 136856276.0, "step": 78910 }, { "entropy": 5.980785942077636, "epoch": 6.139817156195293, "grad_norm": 1.3828125, "learning_rate": 0.0001981230265679415, "loss": 4.9245, "mean_token_accuracy": 0.22012439966201783, "num_tokens": 136865844.0, "step": 78915 }, { "entropy": 5.879122924804688, "epoch": 6.140206185567011, "grad_norm": 1.359375, "learning_rate": 0.00019809697954278088, "loss": 4.8413, "mean_token_accuracy": 0.23089629858732225, "num_tokens": 136874719.0, "step": 78920 }, { "entropy": 5.9317444324493405, "epoch": 6.1405952149387275, "grad_norm": 1.671875, "learning_rate": 0.0001980709336845012, "loss": 4.876, "mean_token_accuracy": 0.22598715722560883, "num_tokens": 136883323.0, "step": 78925 }, { "entropy": 6.0239190578460695, "epoch": 6.140984244310445, "grad_norm": 1.5625, "learning_rate": 0.00019804488899349772, "loss": 5.0145, "mean_token_accuracy": 0.2152661070227623, "num_tokens": 136892019.0, "step": 78930 }, { "entropy": 5.940943622589112, "epoch": 6.141373273682163, "grad_norm": 1.59375, "learning_rate": 0.00019801884547016553, "loss": 4.9075, "mean_token_accuracy": 0.22422507405281067, "num_tokens": 136901188.0, "step": 78935 }, { "entropy": 5.981811475753784, "epoch": 6.141762303053881, "grad_norm": 1.3984375, "learning_rate": 0.0001979928031148998, "loss": 4.9283, "mean_token_accuracy": 0.22906084656715392, "num_tokens": 136910531.0, "step": 78940 }, { "entropy": 5.953662538528443, "epoch": 6.142151332425598, "grad_norm": 1.5234375, "learning_rate": 0.0001979667619280957, "loss": 4.9662, "mean_token_accuracy": 0.21604142636060714, "num_tokens": 136920045.0, "step": 78945 }, { "entropy": 5.986766147613525, "epoch": 6.142540361797316, "grad_norm": 1.6015625, "learning_rate": 0.00019794072191014838, "loss": 4.9043, "mean_token_accuracy": 0.22126989513635636, "num_tokens": 136929696.0, "step": 78950 }, { "entropy": 5.971985769271851, "epoch": 6.142929391169034, "grad_norm": 1.5703125, "learning_rate": 0.00019791468306145298, "loss": 4.8738, "mean_token_accuracy": 0.224392768740654, "num_tokens": 136937546.0, "step": 78955 }, { "entropy": 5.951761054992676, "epoch": 6.1433184205407505, "grad_norm": 1.3984375, "learning_rate": 0.0001978886453824046, "loss": 4.9304, "mean_token_accuracy": 0.21947243064641953, "num_tokens": 136947295.0, "step": 78960 }, { "entropy": 5.983538198471069, "epoch": 6.143707449912468, "grad_norm": 1.5859375, "learning_rate": 0.0001978626088733982, "loss": 4.8975, "mean_token_accuracy": 0.22671755850315095, "num_tokens": 136955361.0, "step": 78965 }, { "entropy": 5.971900558471679, "epoch": 6.144096479284186, "grad_norm": 1.4140625, "learning_rate": 0.00019783657353482904, "loss": 4.9096, "mean_token_accuracy": 0.23156654238700866, "num_tokens": 136964212.0, "step": 78970 }, { "entropy": 5.97320408821106, "epoch": 6.144485508655904, "grad_norm": 1.5625, "learning_rate": 0.00019781053936709198, "loss": 4.9129, "mean_token_accuracy": 0.2203710913658142, "num_tokens": 136972432.0, "step": 78975 }, { "entropy": 5.927911949157715, "epoch": 6.144874538027621, "grad_norm": 1.5390625, "learning_rate": 0.00019778450637058216, "loss": 4.8422, "mean_token_accuracy": 0.22761031687259675, "num_tokens": 136980496.0, "step": 78980 }, { "entropy": 5.959466981887817, "epoch": 6.145263567399339, "grad_norm": 1.5078125, "learning_rate": 0.00019775847454569446, "loss": 4.894, "mean_token_accuracy": 0.22535288631916045, "num_tokens": 136988739.0, "step": 78985 }, { "entropy": 5.942465591430664, "epoch": 6.145652596771056, "grad_norm": 1.609375, "learning_rate": 0.00019773244389282408, "loss": 4.8608, "mean_token_accuracy": 0.21792869120836258, "num_tokens": 136996493.0, "step": 78990 }, { "entropy": 5.926329708099365, "epoch": 6.1460416261427735, "grad_norm": 1.4765625, "learning_rate": 0.0001977064144123658, "loss": 4.8947, "mean_token_accuracy": 0.2257568806409836, "num_tokens": 137005542.0, "step": 78995 }, { "entropy": 5.91122612953186, "epoch": 6.146430655514491, "grad_norm": 1.4296875, "learning_rate": 0.00019768038610471473, "loss": 4.858, "mean_token_accuracy": 0.2233612507581711, "num_tokens": 137014396.0, "step": 79000 }, { "entropy": 5.96497688293457, "epoch": 6.146819684886209, "grad_norm": 1.671875, "learning_rate": 0.00019765435897026575, "loss": 5.0373, "mean_token_accuracy": 0.2129688560962677, "num_tokens": 137023410.0, "step": 79005 }, { "entropy": 6.008572053909302, "epoch": 6.147208714257927, "grad_norm": 1.4296875, "learning_rate": 0.00019762833300941373, "loss": 4.9062, "mean_token_accuracy": 0.2198584035038948, "num_tokens": 137031869.0, "step": 79010 }, { "entropy": 5.98424015045166, "epoch": 6.147597743629644, "grad_norm": 1.5078125, "learning_rate": 0.00019760230822255358, "loss": 4.8468, "mean_token_accuracy": 0.23060715198516846, "num_tokens": 137040570.0, "step": 79015 }, { "entropy": 5.996257543563843, "epoch": 6.147986773001362, "grad_norm": 1.578125, "learning_rate": 0.00019757628461008025, "loss": 4.9843, "mean_token_accuracy": 0.21626638621091843, "num_tokens": 137048962.0, "step": 79020 }, { "entropy": 6.025349712371826, "epoch": 6.148375802373079, "grad_norm": 1.671875, "learning_rate": 0.0001975502621723886, "loss": 4.9559, "mean_token_accuracy": 0.21729299277067185, "num_tokens": 137056989.0, "step": 79025 }, { "entropy": 5.938254308700562, "epoch": 6.1487648317447965, "grad_norm": 1.53125, "learning_rate": 0.00019752424090987338, "loss": 4.8855, "mean_token_accuracy": 0.22599090337753297, "num_tokens": 137065798.0, "step": 79030 }, { "entropy": 5.970391273498535, "epoch": 6.149153861116514, "grad_norm": 1.5390625, "learning_rate": 0.00019749822082292947, "loss": 4.9822, "mean_token_accuracy": 0.21601008027791976, "num_tokens": 137074650.0, "step": 79035 }, { "entropy": 5.909721612930298, "epoch": 6.149542890488232, "grad_norm": 1.6875, "learning_rate": 0.00019747220191195175, "loss": 4.8705, "mean_token_accuracy": 0.2242736592888832, "num_tokens": 137082881.0, "step": 79040 }, { "entropy": 5.976190662384033, "epoch": 6.14993191985995, "grad_norm": 1.5703125, "learning_rate": 0.00019744618417733494, "loss": 4.9843, "mean_token_accuracy": 0.21500724852085112, "num_tokens": 137091456.0, "step": 79045 }, { "entropy": 5.963031864166259, "epoch": 6.150320949231667, "grad_norm": 1.5390625, "learning_rate": 0.0001974201676194738, "loss": 4.8979, "mean_token_accuracy": 0.22342006862163544, "num_tokens": 137100882.0, "step": 79050 }, { "entropy": 5.978305244445801, "epoch": 6.150709978603385, "grad_norm": 1.6015625, "learning_rate": 0.00019739415223876322, "loss": 4.9527, "mean_token_accuracy": 0.22125126272439957, "num_tokens": 137109596.0, "step": 79055 }, { "entropy": 6.027043724060059, "epoch": 6.151099007975102, "grad_norm": 1.4375, "learning_rate": 0.00019736813803559783, "loss": 5.0167, "mean_token_accuracy": 0.21568835377693177, "num_tokens": 137117941.0, "step": 79060 }, { "entropy": 5.9933525085449215, "epoch": 6.1514880373468195, "grad_norm": 1.515625, "learning_rate": 0.0001973421250103724, "loss": 4.9597, "mean_token_accuracy": 0.2129237860441208, "num_tokens": 137127069.0, "step": 79065 }, { "entropy": 5.996827125549316, "epoch": 6.151877066718537, "grad_norm": 1.4609375, "learning_rate": 0.00019731611316348158, "loss": 4.9822, "mean_token_accuracy": 0.21508847028017045, "num_tokens": 137135626.0, "step": 79070 }, { "entropy": 5.92444486618042, "epoch": 6.152266096090255, "grad_norm": 1.4765625, "learning_rate": 0.00019729010249532015, "loss": 4.8761, "mean_token_accuracy": 0.22490203827619554, "num_tokens": 137144552.0, "step": 79075 }, { "entropy": 5.9769879341125485, "epoch": 6.152655125461973, "grad_norm": 1.6015625, "learning_rate": 0.00019726409300628266, "loss": 4.9541, "mean_token_accuracy": 0.22209542542695998, "num_tokens": 137153028.0, "step": 79080 }, { "entropy": 5.9671900272369385, "epoch": 6.15304415483369, "grad_norm": 1.4296875, "learning_rate": 0.00019723808469676384, "loss": 4.9703, "mean_token_accuracy": 0.21768055409193038, "num_tokens": 137162034.0, "step": 79085 }, { "entropy": 6.019922590255737, "epoch": 6.153433184205407, "grad_norm": 1.5546875, "learning_rate": 0.00019721207756715842, "loss": 4.9565, "mean_token_accuracy": 0.22168430387973787, "num_tokens": 137170796.0, "step": 79090 }, { "entropy": 5.9583827495574955, "epoch": 6.153822213577125, "grad_norm": 1.6015625, "learning_rate": 0.00019718607161786083, "loss": 4.8891, "mean_token_accuracy": 0.2255186378955841, "num_tokens": 137179090.0, "step": 79095 }, { "entropy": 5.916441535949707, "epoch": 6.1542112429488425, "grad_norm": 1.4921875, "learning_rate": 0.0001971600668492658, "loss": 4.8354, "mean_token_accuracy": 0.22876286655664443, "num_tokens": 137187952.0, "step": 79100 }, { "entropy": 6.02269229888916, "epoch": 6.15460027232056, "grad_norm": 1.7421875, "learning_rate": 0.00019713406326176775, "loss": 4.9249, "mean_token_accuracy": 0.2217179149389267, "num_tokens": 137196063.0, "step": 79105 }, { "entropy": 5.986225652694702, "epoch": 6.154989301692278, "grad_norm": 1.6953125, "learning_rate": 0.00019710806085576144, "loss": 5.0036, "mean_token_accuracy": 0.21810629218816757, "num_tokens": 137204238.0, "step": 79110 }, { "entropy": 5.912337970733643, "epoch": 6.155378331063996, "grad_norm": 1.515625, "learning_rate": 0.0001970820596316412, "loss": 4.8122, "mean_token_accuracy": 0.23265117406845093, "num_tokens": 137212609.0, "step": 79115 }, { "entropy": 6.0232611179351805, "epoch": 6.155767360435713, "grad_norm": 1.6484375, "learning_rate": 0.00019705605958980182, "loss": 5.0393, "mean_token_accuracy": 0.21273597478866577, "num_tokens": 137220722.0, "step": 79120 }, { "entropy": 5.9417329788208, "epoch": 6.15615638980743, "grad_norm": 1.5625, "learning_rate": 0.00019703006073063767, "loss": 4.8677, "mean_token_accuracy": 0.22172589004039764, "num_tokens": 137229414.0, "step": 79125 }, { "entropy": 6.011443042755127, "epoch": 6.156545419179148, "grad_norm": 1.6640625, "learning_rate": 0.00019700406305454322, "loss": 4.9987, "mean_token_accuracy": 0.21313070356845856, "num_tokens": 137238373.0, "step": 79130 }, { "entropy": 5.930182600021363, "epoch": 6.1569344485508655, "grad_norm": 1.7109375, "learning_rate": 0.00019697806656191296, "loss": 4.8703, "mean_token_accuracy": 0.22149323374032975, "num_tokens": 137246410.0, "step": 79135 }, { "entropy": 5.9598595142364506, "epoch": 6.157323477922583, "grad_norm": 1.5234375, "learning_rate": 0.0001969520712531414, "loss": 4.9707, "mean_token_accuracy": 0.2149055615067482, "num_tokens": 137255714.0, "step": 79140 }, { "entropy": 5.943698120117188, "epoch": 6.157712507294301, "grad_norm": 1.4453125, "learning_rate": 0.00019692607712862287, "loss": 4.8926, "mean_token_accuracy": 0.21975095123052596, "num_tokens": 137264618.0, "step": 79145 }, { "entropy": 5.953506422042847, "epoch": 6.158101536666019, "grad_norm": 1.6640625, "learning_rate": 0.00019690008418875188, "loss": 4.8495, "mean_token_accuracy": 0.2311854749917984, "num_tokens": 137272377.0, "step": 79150 }, { "entropy": 5.952644872665405, "epoch": 6.158490566037736, "grad_norm": 1.765625, "learning_rate": 0.00019687409243392278, "loss": 4.8997, "mean_token_accuracy": 0.2220569968223572, "num_tokens": 137281267.0, "step": 79155 }, { "entropy": 5.8947947978973385, "epoch": 6.158879595409453, "grad_norm": 1.453125, "learning_rate": 0.00019684810186453, "loss": 4.8505, "mean_token_accuracy": 0.2208537772297859, "num_tokens": 137290474.0, "step": 79160 }, { "entropy": 5.90294451713562, "epoch": 6.159268624781171, "grad_norm": 1.46875, "learning_rate": 0.00019682211248096793, "loss": 4.8343, "mean_token_accuracy": 0.23102210611104965, "num_tokens": 137299060.0, "step": 79165 }, { "entropy": 5.9517073154449465, "epoch": 6.1596576541528885, "grad_norm": 1.609375, "learning_rate": 0.0001967961242836308, "loss": 4.9602, "mean_token_accuracy": 0.21876242607831956, "num_tokens": 137307440.0, "step": 79170 }, { "entropy": 5.93889684677124, "epoch": 6.160046683524606, "grad_norm": 1.578125, "learning_rate": 0.0001967701372729131, "loss": 4.872, "mean_token_accuracy": 0.22552878111600877, "num_tokens": 137315842.0, "step": 79175 }, { "entropy": 5.973778009414673, "epoch": 6.160435712896324, "grad_norm": 1.6015625, "learning_rate": 0.00019674415144920894, "loss": 4.9474, "mean_token_accuracy": 0.2187244176864624, "num_tokens": 137324297.0, "step": 79180 }, { "entropy": 5.978236818313599, "epoch": 6.1608247422680416, "grad_norm": 1.640625, "learning_rate": 0.0001967181668129127, "loss": 4.9039, "mean_token_accuracy": 0.22910358607769013, "num_tokens": 137332529.0, "step": 79185 }, { "entropy": 5.873778676986694, "epoch": 6.161213771639758, "grad_norm": 1.4375, "learning_rate": 0.00019669218336441875, "loss": 4.8317, "mean_token_accuracy": 0.2273958742618561, "num_tokens": 137341070.0, "step": 79190 }, { "entropy": 5.965333271026611, "epoch": 6.161602801011476, "grad_norm": 1.5625, "learning_rate": 0.00019666620110412125, "loss": 4.9328, "mean_token_accuracy": 0.21960118561983108, "num_tokens": 137350179.0, "step": 79195 }, { "entropy": 5.949791336059571, "epoch": 6.161991830383194, "grad_norm": 1.609375, "learning_rate": 0.00019664022003241456, "loss": 4.9126, "mean_token_accuracy": 0.21660742461681365, "num_tokens": 137358216.0, "step": 79200 }, { "entropy": 5.930989837646484, "epoch": 6.1623808597549115, "grad_norm": 1.640625, "learning_rate": 0.00019661424014969276, "loss": 4.9684, "mean_token_accuracy": 0.2154742181301117, "num_tokens": 137366184.0, "step": 79205 }, { "entropy": 6.028099918365479, "epoch": 6.162769889126629, "grad_norm": 1.453125, "learning_rate": 0.00019658826145635007, "loss": 5.0211, "mean_token_accuracy": 0.21172949224710463, "num_tokens": 137375515.0, "step": 79210 }, { "entropy": 5.977033090591431, "epoch": 6.163158918498347, "grad_norm": 1.4296875, "learning_rate": 0.00019656228395278076, "loss": 5.0029, "mean_token_accuracy": 0.21573712080717086, "num_tokens": 137384955.0, "step": 79215 }, { "entropy": 5.990919399261474, "epoch": 6.1635479478700645, "grad_norm": 1.5, "learning_rate": 0.0001965363076393789, "loss": 4.9516, "mean_token_accuracy": 0.22270189225673676, "num_tokens": 137394338.0, "step": 79220 }, { "entropy": 5.980376482009888, "epoch": 6.163936977241781, "grad_norm": 1.484375, "learning_rate": 0.00019651033251653866, "loss": 4.9429, "mean_token_accuracy": 0.21708168536424638, "num_tokens": 137403552.0, "step": 79225 }, { "entropy": 5.90495023727417, "epoch": 6.164326006613499, "grad_norm": 1.625, "learning_rate": 0.00019648435858465424, "loss": 4.8757, "mean_token_accuracy": 0.22392307072877884, "num_tokens": 137412659.0, "step": 79230 }, { "entropy": 5.949674606323242, "epoch": 6.164715035985217, "grad_norm": 1.4921875, "learning_rate": 0.00019645838584411967, "loss": 4.9305, "mean_token_accuracy": 0.22761750668287278, "num_tokens": 137421907.0, "step": 79235 }, { "entropy": 5.99226942062378, "epoch": 6.1651040653569344, "grad_norm": 1.609375, "learning_rate": 0.00019643241429532916, "loss": 4.9704, "mean_token_accuracy": 0.22198613733053207, "num_tokens": 137430323.0, "step": 79240 }, { "entropy": 5.942294788360596, "epoch": 6.165493094728652, "grad_norm": 1.53125, "learning_rate": 0.00019640644393867663, "loss": 4.8998, "mean_token_accuracy": 0.22801827192306517, "num_tokens": 137438572.0, "step": 79245 }, { "entropy": 5.899667406082154, "epoch": 6.16588212410037, "grad_norm": 1.53125, "learning_rate": 0.00019638047477455616, "loss": 4.7994, "mean_token_accuracy": 0.23496681153774263, "num_tokens": 137447252.0, "step": 79250 }, { "entropy": 5.993371105194091, "epoch": 6.1662711534720875, "grad_norm": 1.6484375, "learning_rate": 0.00019635450680336198, "loss": 4.9129, "mean_token_accuracy": 0.22194566130638121, "num_tokens": 137455349.0, "step": 79255 }, { "entropy": 5.895857191085815, "epoch": 6.166660182843804, "grad_norm": 1.6171875, "learning_rate": 0.00019632854002548796, "loss": 4.7982, "mean_token_accuracy": 0.2311977669596672, "num_tokens": 137463526.0, "step": 79260 }, { "entropy": 5.877495765686035, "epoch": 6.167049212215522, "grad_norm": 1.4921875, "learning_rate": 0.00019630257444132803, "loss": 4.8283, "mean_token_accuracy": 0.22517864853143693, "num_tokens": 137471985.0, "step": 79265 }, { "entropy": 5.992117309570313, "epoch": 6.16743824158724, "grad_norm": 1.6015625, "learning_rate": 0.00019627661005127634, "loss": 5.0062, "mean_token_accuracy": 0.21477101892232894, "num_tokens": 137480972.0, "step": 79270 }, { "entropy": 5.9760339736938475, "epoch": 6.167827270958957, "grad_norm": 1.59375, "learning_rate": 0.0001962506468557268, "loss": 4.8599, "mean_token_accuracy": 0.23819465637207032, "num_tokens": 137489471.0, "step": 79275 }, { "entropy": 6.02827672958374, "epoch": 6.168216300330675, "grad_norm": 1.671875, "learning_rate": 0.0001962246848550734, "loss": 5.0189, "mean_token_accuracy": 0.21359410583972932, "num_tokens": 137498267.0, "step": 79280 }, { "entropy": 5.923919439315796, "epoch": 6.168605329702393, "grad_norm": 1.53125, "learning_rate": 0.00019619872404971002, "loss": 4.9228, "mean_token_accuracy": 0.21790040880441666, "num_tokens": 137506604.0, "step": 79285 }, { "entropy": 5.989980459213257, "epoch": 6.1689943590741105, "grad_norm": 1.4921875, "learning_rate": 0.00019617276444003053, "loss": 4.9587, "mean_token_accuracy": 0.21990588158369065, "num_tokens": 137515354.0, "step": 79290 }, { "entropy": 5.927034521102906, "epoch": 6.169383388445827, "grad_norm": 1.6171875, "learning_rate": 0.00019614680602642886, "loss": 4.8203, "mean_token_accuracy": 0.23616329133510588, "num_tokens": 137523879.0, "step": 79295 }, { "entropy": 6.009552907943726, "epoch": 6.169772417817545, "grad_norm": 1.7265625, "learning_rate": 0.00019612084880929888, "loss": 4.9182, "mean_token_accuracy": 0.2243254154920578, "num_tokens": 137532195.0, "step": 79300 }, { "entropy": 5.948806190490723, "epoch": 6.170161447189263, "grad_norm": 1.5859375, "learning_rate": 0.00019609489278903452, "loss": 4.885, "mean_token_accuracy": 0.22203729152679444, "num_tokens": 137540122.0, "step": 79305 }, { "entropy": 5.892035627365113, "epoch": 6.17055047656098, "grad_norm": 1.609375, "learning_rate": 0.00019606893796602953, "loss": 4.8427, "mean_token_accuracy": 0.22220426201820373, "num_tokens": 137549180.0, "step": 79310 }, { "entropy": 6.005953454971314, "epoch": 6.170939505932698, "grad_norm": 1.5625, "learning_rate": 0.0001960429843406778, "loss": 4.974, "mean_token_accuracy": 0.2069421410560608, "num_tokens": 137558363.0, "step": 79315 }, { "entropy": 5.989331865310669, "epoch": 6.171328535304416, "grad_norm": 1.6640625, "learning_rate": 0.0001960170319133731, "loss": 4.927, "mean_token_accuracy": 0.22333947122097014, "num_tokens": 137566894.0, "step": 79320 }, { "entropy": 5.946901321411133, "epoch": 6.171717564676133, "grad_norm": 1.625, "learning_rate": 0.00019599108068450922, "loss": 4.9291, "mean_token_accuracy": 0.2165914550423622, "num_tokens": 137576106.0, "step": 79325 }, { "entropy": 5.933172082901001, "epoch": 6.17210659404785, "grad_norm": 1.5546875, "learning_rate": 0.00019596513065447995, "loss": 4.8518, "mean_token_accuracy": 0.2256227970123291, "num_tokens": 137585392.0, "step": 79330 }, { "entropy": 5.977402782440185, "epoch": 6.172495623419568, "grad_norm": 1.6328125, "learning_rate": 0.00019593918182367903, "loss": 4.9463, "mean_token_accuracy": 0.21733978837728501, "num_tokens": 137593687.0, "step": 79335 }, { "entropy": 5.967447090148926, "epoch": 6.172884652791286, "grad_norm": 1.5078125, "learning_rate": 0.00019591323419250017, "loss": 4.9087, "mean_token_accuracy": 0.21444923728704451, "num_tokens": 137602358.0, "step": 79340 }, { "entropy": 5.9588024616241455, "epoch": 6.173273682163003, "grad_norm": 1.7421875, "learning_rate": 0.00019588728776133714, "loss": 4.8787, "mean_token_accuracy": 0.23151189237833023, "num_tokens": 137611140.0, "step": 79345 }, { "entropy": 5.965338897705078, "epoch": 6.173662711534721, "grad_norm": 1.7109375, "learning_rate": 0.00019586134253058357, "loss": 4.9036, "mean_token_accuracy": 0.224187932908535, "num_tokens": 137619859.0, "step": 79350 }, { "entropy": 5.934031391143799, "epoch": 6.174051740906439, "grad_norm": 1.8046875, "learning_rate": 0.00019583539850063315, "loss": 4.8716, "mean_token_accuracy": 0.2273362696170807, "num_tokens": 137627885.0, "step": 79355 }, { "entropy": 5.9629127979278564, "epoch": 6.174440770278156, "grad_norm": 1.6171875, "learning_rate": 0.00019580945567187956, "loss": 4.9226, "mean_token_accuracy": 0.21639098078012467, "num_tokens": 137636903.0, "step": 79360 }, { "entropy": 5.962752628326416, "epoch": 6.174829799649873, "grad_norm": 1.625, "learning_rate": 0.0001957835140447165, "loss": 4.9107, "mean_token_accuracy": 0.22388675212860107, "num_tokens": 137645418.0, "step": 79365 }, { "entropy": 6.024716854095459, "epoch": 6.175218829021591, "grad_norm": 1.6640625, "learning_rate": 0.0001957575736195375, "loss": 4.9861, "mean_token_accuracy": 0.222356940805912, "num_tokens": 137654348.0, "step": 79370 }, { "entropy": 5.971407651901245, "epoch": 6.175607858393309, "grad_norm": 1.5390625, "learning_rate": 0.0001957316343967362, "loss": 4.858, "mean_token_accuracy": 0.22231405675411225, "num_tokens": 137662264.0, "step": 79375 }, { "entropy": 6.009288549423218, "epoch": 6.175996887765026, "grad_norm": 1.546875, "learning_rate": 0.00019570569637670604, "loss": 4.9494, "mean_token_accuracy": 0.2167347177863121, "num_tokens": 137670730.0, "step": 79380 }, { "entropy": 5.95785870552063, "epoch": 6.176385917136744, "grad_norm": 1.5234375, "learning_rate": 0.00019567975955984079, "loss": 4.9001, "mean_token_accuracy": 0.22899568527936937, "num_tokens": 137680156.0, "step": 79385 }, { "entropy": 6.048834753036499, "epoch": 6.176774946508462, "grad_norm": 1.5546875, "learning_rate": 0.00019565382394653403, "loss": 4.9417, "mean_token_accuracy": 0.22017960995435715, "num_tokens": 137688878.0, "step": 79390 }, { "entropy": 6.065632009506226, "epoch": 6.177163975880179, "grad_norm": 1.59375, "learning_rate": 0.0001956278895371792, "loss": 5.0151, "mean_token_accuracy": 0.2181781381368637, "num_tokens": 137697321.0, "step": 79395 }, { "entropy": 5.957924747467041, "epoch": 6.177553005251896, "grad_norm": 1.5625, "learning_rate": 0.00019560195633216976, "loss": 4.9339, "mean_token_accuracy": 0.22174030244350434, "num_tokens": 137706436.0, "step": 79400 }, { "entropy": 6.017624378204346, "epoch": 6.177942034623614, "grad_norm": 1.46875, "learning_rate": 0.00019557602433189925, "loss": 4.9952, "mean_token_accuracy": 0.21589977741241456, "num_tokens": 137715391.0, "step": 79405 }, { "entropy": 5.956071090698242, "epoch": 6.178331063995332, "grad_norm": 1.5703125, "learning_rate": 0.00019555009353676116, "loss": 4.8868, "mean_token_accuracy": 0.22691207975149155, "num_tokens": 137723901.0, "step": 79410 }, { "entropy": 5.941185426712036, "epoch": 6.178720093367049, "grad_norm": 1.515625, "learning_rate": 0.00019552416394714894, "loss": 4.9698, "mean_token_accuracy": 0.21797839403152466, "num_tokens": 137733109.0, "step": 79415 }, { "entropy": 5.9432957649230955, "epoch": 6.179109122738767, "grad_norm": 1.4453125, "learning_rate": 0.00019549823556345603, "loss": 4.877, "mean_token_accuracy": 0.2284097358584404, "num_tokens": 137742777.0, "step": 79420 }, { "entropy": 5.972169208526611, "epoch": 6.179498152110484, "grad_norm": 1.546875, "learning_rate": 0.00019547230838607593, "loss": 4.9663, "mean_token_accuracy": 0.21303676962852477, "num_tokens": 137751919.0, "step": 79425 }, { "entropy": 5.955071544647216, "epoch": 6.179887181482202, "grad_norm": 1.5390625, "learning_rate": 0.00019544638241540186, "loss": 4.9244, "mean_token_accuracy": 0.21741227060556412, "num_tokens": 137760947.0, "step": 79430 }, { "entropy": 5.942549419403076, "epoch": 6.180276210853919, "grad_norm": 1.4765625, "learning_rate": 0.00019542045765182737, "loss": 4.8664, "mean_token_accuracy": 0.22595133036375045, "num_tokens": 137769127.0, "step": 79435 }, { "entropy": 5.991839504241943, "epoch": 6.180665240225637, "grad_norm": 1.5546875, "learning_rate": 0.00019539453409574576, "loss": 4.8982, "mean_token_accuracy": 0.22174542248249055, "num_tokens": 137778062.0, "step": 79440 }, { "entropy": 6.029169750213623, "epoch": 6.181054269597355, "grad_norm": 1.5234375, "learning_rate": 0.00019536861174755045, "loss": 5.1001, "mean_token_accuracy": 0.20719262063503266, "num_tokens": 137787024.0, "step": 79445 }, { "entropy": 5.953707265853882, "epoch": 6.181443298969072, "grad_norm": 1.515625, "learning_rate": 0.00019534269060763454, "loss": 4.9305, "mean_token_accuracy": 0.21859549283981322, "num_tokens": 137794934.0, "step": 79450 }, { "entropy": 5.936577415466308, "epoch": 6.18183232834079, "grad_norm": 1.9609375, "learning_rate": 0.00019531677067639164, "loss": 4.8852, "mean_token_accuracy": 0.22338711768388747, "num_tokens": 137803650.0, "step": 79455 }, { "entropy": 6.0225691318511965, "epoch": 6.182221357712507, "grad_norm": 1.6171875, "learning_rate": 0.00019529085195421492, "loss": 5.0306, "mean_token_accuracy": 0.21426304131746293, "num_tokens": 137813057.0, "step": 79460 }, { "entropy": 5.9748406410217285, "epoch": 6.182610387084225, "grad_norm": 1.4375, "learning_rate": 0.00019526493444149763, "loss": 4.9232, "mean_token_accuracy": 0.21800258308649062, "num_tokens": 137821840.0, "step": 79465 }, { "entropy": 5.931950092315674, "epoch": 6.182999416455942, "grad_norm": 1.5625, "learning_rate": 0.00019523901813863303, "loss": 4.8759, "mean_token_accuracy": 0.22692939192056655, "num_tokens": 137829634.0, "step": 79470 }, { "entropy": 5.998644399642944, "epoch": 6.18338844582766, "grad_norm": 1.6875, "learning_rate": 0.00019521310304601447, "loss": 4.894, "mean_token_accuracy": 0.22558328211307527, "num_tokens": 137838357.0, "step": 79475 }, { "entropy": 5.998757600784302, "epoch": 6.183777475199378, "grad_norm": 1.6015625, "learning_rate": 0.000195187189164035, "loss": 4.9403, "mean_token_accuracy": 0.2135901302099228, "num_tokens": 137845953.0, "step": 79480 }, { "entropy": 5.94584379196167, "epoch": 6.184166504571095, "grad_norm": 1.5234375, "learning_rate": 0.0001951612764930879, "loss": 4.9892, "mean_token_accuracy": 0.21195582002401353, "num_tokens": 137854551.0, "step": 79485 }, { "entropy": 5.941933250427246, "epoch": 6.184555533942813, "grad_norm": 1.5234375, "learning_rate": 0.00019513536503356637, "loss": 4.9247, "mean_token_accuracy": 0.22057410329580307, "num_tokens": 137863231.0, "step": 79490 }, { "entropy": 6.003873825073242, "epoch": 6.18494456331453, "grad_norm": 1.59375, "learning_rate": 0.00019510945478586351, "loss": 4.9836, "mean_token_accuracy": 0.21771241575479508, "num_tokens": 137871613.0, "step": 79495 }, { "entropy": 5.9731488704681395, "epoch": 6.185333592686248, "grad_norm": 1.5, "learning_rate": 0.00019508354575037258, "loss": 4.9336, "mean_token_accuracy": 0.2221928969025612, "num_tokens": 137880319.0, "step": 79500 }, { "entropy": 5.960566711425781, "epoch": 6.185722622057965, "grad_norm": 1.4296875, "learning_rate": 0.0001950576379274866, "loss": 4.9199, "mean_token_accuracy": 0.22295173704624177, "num_tokens": 137889489.0, "step": 79505 }, { "entropy": 6.000883388519287, "epoch": 6.186111651429683, "grad_norm": 1.6875, "learning_rate": 0.0001950317313175987, "loss": 4.9715, "mean_token_accuracy": 0.21598806232213974, "num_tokens": 137897930.0, "step": 79510 }, { "entropy": 6.0559666633605955, "epoch": 6.186500680801401, "grad_norm": 1.578125, "learning_rate": 0.00019500582592110207, "loss": 4.9724, "mean_token_accuracy": 0.21480585932731627, "num_tokens": 137906947.0, "step": 79515 }, { "entropy": 5.97120475769043, "epoch": 6.186889710173118, "grad_norm": 1.640625, "learning_rate": 0.00019497992173838963, "loss": 4.891, "mean_token_accuracy": 0.22061660438776015, "num_tokens": 137916007.0, "step": 79520 }, { "entropy": 5.993329238891602, "epoch": 6.187278739544835, "grad_norm": 1.578125, "learning_rate": 0.00019495401876985457, "loss": 4.9589, "mean_token_accuracy": 0.2177450478076935, "num_tokens": 137925149.0, "step": 79525 }, { "entropy": 5.933354759216309, "epoch": 6.187667768916553, "grad_norm": 1.734375, "learning_rate": 0.00019492811701588982, "loss": 4.9226, "mean_token_accuracy": 0.22297506630420685, "num_tokens": 137933970.0, "step": 79530 }, { "entropy": 6.009746170043945, "epoch": 6.188056798288271, "grad_norm": 1.6171875, "learning_rate": 0.0001949022164768885, "loss": 4.9331, "mean_token_accuracy": 0.21894347220659255, "num_tokens": 137942579.0, "step": 79535 }, { "entropy": 5.977053260803222, "epoch": 6.188445827659988, "grad_norm": 1.703125, "learning_rate": 0.0001948763171532435, "loss": 4.9087, "mean_token_accuracy": 0.23211622834205628, "num_tokens": 137951049.0, "step": 79540 }, { "entropy": 5.934276342391968, "epoch": 6.188834857031706, "grad_norm": 1.5859375, "learning_rate": 0.0001948504190453479, "loss": 4.8654, "mean_token_accuracy": 0.23529740571975707, "num_tokens": 137958726.0, "step": 79545 }, { "entropy": 5.928645038604737, "epoch": 6.189223886403424, "grad_norm": 1.53125, "learning_rate": 0.00019482452215359463, "loss": 4.8506, "mean_token_accuracy": 0.22487399131059646, "num_tokens": 137968050.0, "step": 79550 }, { "entropy": 5.96699070930481, "epoch": 6.189612915775141, "grad_norm": 1.6484375, "learning_rate": 0.00019479862647837665, "loss": 4.9085, "mean_token_accuracy": 0.22640119045972823, "num_tokens": 137976162.0, "step": 79555 }, { "entropy": 5.939764738082886, "epoch": 6.190001945146858, "grad_norm": 1.703125, "learning_rate": 0.00019477273202008678, "loss": 4.9292, "mean_token_accuracy": 0.22290742993354798, "num_tokens": 137985045.0, "step": 79560 }, { "entropy": 5.958351373672485, "epoch": 6.190390974518576, "grad_norm": 1.515625, "learning_rate": 0.00019474683877911808, "loss": 4.8992, "mean_token_accuracy": 0.2167590156197548, "num_tokens": 137993715.0, "step": 79565 }, { "entropy": 6.026981258392334, "epoch": 6.190780003890294, "grad_norm": 1.5234375, "learning_rate": 0.00019472094675586333, "loss": 5.0338, "mean_token_accuracy": 0.21942880153656005, "num_tokens": 138002280.0, "step": 79570 }, { "entropy": 6.036942005157471, "epoch": 6.191169033262011, "grad_norm": 1.5234375, "learning_rate": 0.0001946950559507154, "loss": 4.9291, "mean_token_accuracy": 0.2160528063774109, "num_tokens": 138011027.0, "step": 79575 }, { "entropy": 6.005313396453857, "epoch": 6.191558062633729, "grad_norm": 1.609375, "learning_rate": 0.00019466916636406718, "loss": 4.988, "mean_token_accuracy": 0.2130245327949524, "num_tokens": 138019149.0, "step": 79580 }, { "entropy": 6.048730516433716, "epoch": 6.191947092005447, "grad_norm": 1.6171875, "learning_rate": 0.00019464327799631153, "loss": 5.0152, "mean_token_accuracy": 0.21961454749107362, "num_tokens": 138027551.0, "step": 79585 }, { "entropy": 5.9462381362915036, "epoch": 6.192336121377164, "grad_norm": 1.53125, "learning_rate": 0.00019461739084784124, "loss": 4.9831, "mean_token_accuracy": 0.21267153024673463, "num_tokens": 138036368.0, "step": 79590 }, { "entropy": 5.952931356430054, "epoch": 6.192725150748881, "grad_norm": 1.6328125, "learning_rate": 0.0001945915049190491, "loss": 4.9439, "mean_token_accuracy": 0.2210552379488945, "num_tokens": 138044934.0, "step": 79595 }, { "entropy": 5.980203628540039, "epoch": 6.193114180120599, "grad_norm": 1.609375, "learning_rate": 0.00019456562021032787, "loss": 4.896, "mean_token_accuracy": 0.22648950219154357, "num_tokens": 138053030.0, "step": 79600 }, { "entropy": 5.913761854171753, "epoch": 6.193503209492317, "grad_norm": 1.5390625, "learning_rate": 0.00019453973672207037, "loss": 4.8796, "mean_token_accuracy": 0.22770137339830399, "num_tokens": 138062188.0, "step": 79605 }, { "entropy": 5.960789585113526, "epoch": 6.193892238864034, "grad_norm": 1.5703125, "learning_rate": 0.0001945138544546693, "loss": 4.8961, "mean_token_accuracy": 0.22554732114076614, "num_tokens": 138071042.0, "step": 79610 }, { "entropy": 5.956880140304565, "epoch": 6.194281268235752, "grad_norm": 1.5703125, "learning_rate": 0.0001944879734085173, "loss": 4.9198, "mean_token_accuracy": 0.2234371393918991, "num_tokens": 138079370.0, "step": 79615 }, { "entropy": 6.0080560684204105, "epoch": 6.19467029760747, "grad_norm": 1.6796875, "learning_rate": 0.00019446209358400723, "loss": 4.9544, "mean_token_accuracy": 0.2169836699962616, "num_tokens": 138087758.0, "step": 79620 }, { "entropy": 5.9419698238372805, "epoch": 6.195059326979187, "grad_norm": 1.625, "learning_rate": 0.0001944362149815317, "loss": 4.9461, "mean_token_accuracy": 0.22101276665925979, "num_tokens": 138096001.0, "step": 79625 }, { "entropy": 5.989284372329712, "epoch": 6.195448356350904, "grad_norm": 1.5546875, "learning_rate": 0.00019441033760148337, "loss": 5.0095, "mean_token_accuracy": 0.21683213412761687, "num_tokens": 138105003.0, "step": 79630 }, { "entropy": 5.981075239181519, "epoch": 6.195837385722622, "grad_norm": 1.5, "learning_rate": 0.00019438446144425493, "loss": 4.9097, "mean_token_accuracy": 0.21443400382995606, "num_tokens": 138113097.0, "step": 79635 }, { "entropy": 6.066406774520874, "epoch": 6.19622641509434, "grad_norm": 1.65625, "learning_rate": 0.00019435858651023892, "loss": 5.0188, "mean_token_accuracy": 0.21824993640184404, "num_tokens": 138122305.0, "step": 79640 }, { "entropy": 5.899138164520264, "epoch": 6.196615444466057, "grad_norm": 1.6796875, "learning_rate": 0.00019433271279982795, "loss": 4.8582, "mean_token_accuracy": 0.23093915730714798, "num_tokens": 138130633.0, "step": 79645 }, { "entropy": 5.945448589324951, "epoch": 6.197004473837775, "grad_norm": 1.5859375, "learning_rate": 0.0001943068403134147, "loss": 4.9976, "mean_token_accuracy": 0.21781107485294343, "num_tokens": 138139166.0, "step": 79650 }, { "entropy": 5.995903253555298, "epoch": 6.197393503209493, "grad_norm": 1.6328125, "learning_rate": 0.00019428096905139175, "loss": 4.9673, "mean_token_accuracy": 0.22360957860946656, "num_tokens": 138148072.0, "step": 79655 }, { "entropy": 6.009780216217041, "epoch": 6.1977825325812095, "grad_norm": 1.578125, "learning_rate": 0.00019425509901415162, "loss": 4.9238, "mean_token_accuracy": 0.2153704881668091, "num_tokens": 138155859.0, "step": 79660 }, { "entropy": 6.040027141571045, "epoch": 6.198171561952927, "grad_norm": 1.6875, "learning_rate": 0.00019422923020208688, "loss": 4.9844, "mean_token_accuracy": 0.20676391273736955, "num_tokens": 138164570.0, "step": 79665 }, { "entropy": 5.976370477676392, "epoch": 6.198560591324645, "grad_norm": 1.625, "learning_rate": 0.00019420336261558995, "loss": 4.8973, "mean_token_accuracy": 0.22038774192333221, "num_tokens": 138172794.0, "step": 79670 }, { "entropy": 5.938037395477295, "epoch": 6.198949620696363, "grad_norm": 1.6171875, "learning_rate": 0.00019417749625505343, "loss": 4.8777, "mean_token_accuracy": 0.22565864026546478, "num_tokens": 138182016.0, "step": 79675 }, { "entropy": 5.980306005477905, "epoch": 6.19933865006808, "grad_norm": 1.59375, "learning_rate": 0.00019415163112086975, "loss": 5.0, "mean_token_accuracy": 0.21616332083940507, "num_tokens": 138191298.0, "step": 79680 }, { "entropy": 5.939406251907348, "epoch": 6.199727679439798, "grad_norm": 1.4765625, "learning_rate": 0.00019412576721343134, "loss": 4.893, "mean_token_accuracy": 0.2198581576347351, "num_tokens": 138200253.0, "step": 79685 }, { "entropy": 5.98449182510376, "epoch": 6.200116708811516, "grad_norm": 1.5546875, "learning_rate": 0.00019409990453313076, "loss": 4.934, "mean_token_accuracy": 0.22124186009168625, "num_tokens": 138209406.0, "step": 79690 }, { "entropy": 5.97465181350708, "epoch": 6.2005057381832325, "grad_norm": 1.5234375, "learning_rate": 0.0001940740430803603, "loss": 4.9082, "mean_token_accuracy": 0.22218364477157593, "num_tokens": 138218486.0, "step": 79695 }, { "entropy": 5.937479734420776, "epoch": 6.20089476755495, "grad_norm": 1.5859375, "learning_rate": 0.00019404818285551252, "loss": 4.8233, "mean_token_accuracy": 0.2345029518008232, "num_tokens": 138226734.0, "step": 79700 }, { "entropy": 5.994907379150391, "epoch": 6.201283796926668, "grad_norm": 1.6640625, "learning_rate": 0.0001940223238589796, "loss": 4.949, "mean_token_accuracy": 0.22809687554836272, "num_tokens": 138235290.0, "step": 79705 }, { "entropy": 5.926184797286988, "epoch": 6.201672826298386, "grad_norm": 1.5078125, "learning_rate": 0.00019399646609115408, "loss": 4.855, "mean_token_accuracy": 0.23414897173643112, "num_tokens": 138243664.0, "step": 79710 }, { "entropy": 5.970319128036499, "epoch": 6.202061855670103, "grad_norm": 1.671875, "learning_rate": 0.00019397060955242824, "loss": 4.9326, "mean_token_accuracy": 0.21271145939826966, "num_tokens": 138252450.0, "step": 79715 }, { "entropy": 5.977016592025757, "epoch": 6.202450885041821, "grad_norm": 1.59375, "learning_rate": 0.00019394475424319442, "loss": 5.0397, "mean_token_accuracy": 0.21145578920841218, "num_tokens": 138260719.0, "step": 79720 }, { "entropy": 6.0019426345825195, "epoch": 6.202839914413538, "grad_norm": 1.5625, "learning_rate": 0.00019391890016384495, "loss": 4.9199, "mean_token_accuracy": 0.22061970233917236, "num_tokens": 138268831.0, "step": 79725 }, { "entropy": 5.960845804214477, "epoch": 6.2032289437852555, "grad_norm": 1.75, "learning_rate": 0.00019389304731477213, "loss": 4.9235, "mean_token_accuracy": 0.2217656269669533, "num_tokens": 138276899.0, "step": 79730 }, { "entropy": 5.985551357269287, "epoch": 6.203617973156973, "grad_norm": 1.703125, "learning_rate": 0.00019386719569636823, "loss": 4.9721, "mean_token_accuracy": 0.22180745899677276, "num_tokens": 138284962.0, "step": 79735 }, { "entropy": 6.063968992233276, "epoch": 6.204007002528691, "grad_norm": 1.6875, "learning_rate": 0.00019384134530902553, "loss": 5.0379, "mean_token_accuracy": 0.21763056367635727, "num_tokens": 138293711.0, "step": 79740 }, { "entropy": 5.963944721221924, "epoch": 6.204396031900409, "grad_norm": 1.5390625, "learning_rate": 0.0001938154961531362, "loss": 4.8643, "mean_token_accuracy": 0.22805121839046477, "num_tokens": 138302032.0, "step": 79745 }, { "entropy": 5.941394996643067, "epoch": 6.204785061272126, "grad_norm": 1.5078125, "learning_rate": 0.0001937896482290925, "loss": 4.893, "mean_token_accuracy": 0.22244299203157425, "num_tokens": 138310301.0, "step": 79750 }, { "entropy": 5.97747163772583, "epoch": 6.205174090643844, "grad_norm": 1.625, "learning_rate": 0.00019376380153728667, "loss": 4.9389, "mean_token_accuracy": 0.22543756514787675, "num_tokens": 138318964.0, "step": 79755 }, { "entropy": 5.994526672363281, "epoch": 6.205563120015561, "grad_norm": 1.5390625, "learning_rate": 0.00019373795607811078, "loss": 4.9023, "mean_token_accuracy": 0.2275601953268051, "num_tokens": 138327285.0, "step": 79760 }, { "entropy": 6.001405334472656, "epoch": 6.2059521493872785, "grad_norm": 1.546875, "learning_rate": 0.00019371211185195708, "loss": 4.8537, "mean_token_accuracy": 0.2228407859802246, "num_tokens": 138336088.0, "step": 79765 }, { "entropy": 6.035896921157837, "epoch": 6.206341178758996, "grad_norm": 1.625, "learning_rate": 0.0001936862688592177, "loss": 4.9358, "mean_token_accuracy": 0.22250894010066985, "num_tokens": 138344493.0, "step": 79770 }, { "entropy": 5.869189262390137, "epoch": 6.206730208130714, "grad_norm": 1.5, "learning_rate": 0.0001936604271002848, "loss": 4.8491, "mean_token_accuracy": 0.2243872806429863, "num_tokens": 138352931.0, "step": 79775 }, { "entropy": 5.9611390113830565, "epoch": 6.2071192375024316, "grad_norm": 1.421875, "learning_rate": 0.00019363458657555038, "loss": 4.9021, "mean_token_accuracy": 0.21720437854528427, "num_tokens": 138361972.0, "step": 79780 }, { "entropy": 5.913915681838989, "epoch": 6.207508266874149, "grad_norm": 1.4375, "learning_rate": 0.00019360874728540668, "loss": 4.8797, "mean_token_accuracy": 0.2219817414879799, "num_tokens": 138370941.0, "step": 79785 }, { "entropy": 5.9492237091064455, "epoch": 6.207897296245867, "grad_norm": 1.5, "learning_rate": 0.00019358290923024562, "loss": 4.9968, "mean_token_accuracy": 0.2170637547969818, "num_tokens": 138380185.0, "step": 79790 }, { "entropy": 6.0023480415344235, "epoch": 6.208286325617584, "grad_norm": 1.4140625, "learning_rate": 0.0001935570724104594, "loss": 4.9814, "mean_token_accuracy": 0.2154964402318001, "num_tokens": 138389790.0, "step": 79795 }, { "entropy": 6.0200567722320555, "epoch": 6.2086753549893015, "grad_norm": 1.5, "learning_rate": 0.00019353123682643998, "loss": 4.9216, "mean_token_accuracy": 0.22072939127683638, "num_tokens": 138399066.0, "step": 79800 }, { "entropy": 5.995497608184815, "epoch": 6.209064384361019, "grad_norm": 1.46875, "learning_rate": 0.00019350540247857928, "loss": 4.9589, "mean_token_accuracy": 0.21752391904592513, "num_tokens": 138408014.0, "step": 79805 }, { "entropy": 6.018437814712525, "epoch": 6.209453413732737, "grad_norm": 1.5390625, "learning_rate": 0.00019347956936726946, "loss": 5.0329, "mean_token_accuracy": 0.2173070952296257, "num_tokens": 138416996.0, "step": 79810 }, { "entropy": 5.9925621509552, "epoch": 6.2098424431044545, "grad_norm": 1.6796875, "learning_rate": 0.0001934537374929024, "loss": 4.9479, "mean_token_accuracy": 0.21811287403106688, "num_tokens": 138425496.0, "step": 79815 }, { "entropy": 5.984643411636353, "epoch": 6.210231472476172, "grad_norm": 1.625, "learning_rate": 0.00019342790685587008, "loss": 4.8766, "mean_token_accuracy": 0.2224881500005722, "num_tokens": 138433970.0, "step": 79820 }, { "entropy": 5.972914552688598, "epoch": 6.21062050184789, "grad_norm": 1.46875, "learning_rate": 0.0001934020774565645, "loss": 4.8714, "mean_token_accuracy": 0.22625983208417894, "num_tokens": 138442703.0, "step": 79825 }, { "entropy": 5.9512190341949465, "epoch": 6.211009531219607, "grad_norm": 1.53125, "learning_rate": 0.0001933762492953775, "loss": 4.905, "mean_token_accuracy": 0.21802688837051393, "num_tokens": 138451263.0, "step": 79830 }, { "entropy": 6.008898305892944, "epoch": 6.2113985605913244, "grad_norm": 1.5703125, "learning_rate": 0.00019335042237270095, "loss": 4.9189, "mean_token_accuracy": 0.22262635678052903, "num_tokens": 138459154.0, "step": 79835 }, { "entropy": 6.017796039581299, "epoch": 6.211787589963042, "grad_norm": 1.578125, "learning_rate": 0.00019332459668892676, "loss": 4.9379, "mean_token_accuracy": 0.22495976984500884, "num_tokens": 138467923.0, "step": 79840 }, { "entropy": 5.957146835327149, "epoch": 6.21217661933476, "grad_norm": 1.5703125, "learning_rate": 0.00019329877224444675, "loss": 4.9034, "mean_token_accuracy": 0.22493798285722733, "num_tokens": 138476453.0, "step": 79845 }, { "entropy": 5.981274223327636, "epoch": 6.2125656487064775, "grad_norm": 1.515625, "learning_rate": 0.0001932729490396529, "loss": 4.9056, "mean_token_accuracy": 0.2251599356532097, "num_tokens": 138485680.0, "step": 79850 }, { "entropy": 5.973556089401245, "epoch": 6.212954678078195, "grad_norm": 1.5625, "learning_rate": 0.00019324712707493707, "loss": 4.93, "mean_token_accuracy": 0.2147836282849312, "num_tokens": 138494448.0, "step": 79855 }, { "entropy": 5.9563719749450685, "epoch": 6.213343707449912, "grad_norm": 1.6640625, "learning_rate": 0.0001932213063506909, "loss": 4.8638, "mean_token_accuracy": 0.2253995269536972, "num_tokens": 138502518.0, "step": 79860 }, { "entropy": 5.91676344871521, "epoch": 6.21373273682163, "grad_norm": 1.6171875, "learning_rate": 0.00019319548686730625, "loss": 4.9201, "mean_token_accuracy": 0.21966246962547303, "num_tokens": 138511218.0, "step": 79865 }, { "entropy": 5.964319133758545, "epoch": 6.214121766193347, "grad_norm": 1.6328125, "learning_rate": 0.00019316966862517482, "loss": 4.9401, "mean_token_accuracy": 0.21427278518676757, "num_tokens": 138520030.0, "step": 79870 }, { "entropy": 5.997924566268921, "epoch": 6.214510795565065, "grad_norm": 1.5703125, "learning_rate": 0.0001931438516246885, "loss": 4.9269, "mean_token_accuracy": 0.22006016224622726, "num_tokens": 138529130.0, "step": 79875 }, { "entropy": 5.99649863243103, "epoch": 6.214899824936783, "grad_norm": 1.5859375, "learning_rate": 0.0001931180358662389, "loss": 4.9421, "mean_token_accuracy": 0.22425933182239532, "num_tokens": 138537881.0, "step": 79880 }, { "entropy": 5.971860551834107, "epoch": 6.2152888543085005, "grad_norm": 1.6484375, "learning_rate": 0.00019309222135021776, "loss": 4.8815, "mean_token_accuracy": 0.23005254119634627, "num_tokens": 138546176.0, "step": 79885 }, { "entropy": 5.931798315048217, "epoch": 6.215677883680218, "grad_norm": 1.6171875, "learning_rate": 0.0001930664080770168, "loss": 4.8342, "mean_token_accuracy": 0.23020280450582503, "num_tokens": 138554918.0, "step": 79890 }, { "entropy": 5.911038160324097, "epoch": 6.216066913051935, "grad_norm": 1.5, "learning_rate": 0.00019304059604702772, "loss": 4.861, "mean_token_accuracy": 0.22534206211566926, "num_tokens": 138564022.0, "step": 79895 }, { "entropy": 5.974187183380127, "epoch": 6.216455942423653, "grad_norm": 1.4296875, "learning_rate": 0.00019301478526064213, "loss": 4.9754, "mean_token_accuracy": 0.2210260733962059, "num_tokens": 138573009.0, "step": 79900 }, { "entropy": 5.9545948028564455, "epoch": 6.21684497179537, "grad_norm": 1.5703125, "learning_rate": 0.00019298897571825175, "loss": 4.9668, "mean_token_accuracy": 0.22072848528623581, "num_tokens": 138580910.0, "step": 79905 }, { "entropy": 5.961371278762817, "epoch": 6.217234001167088, "grad_norm": 1.578125, "learning_rate": 0.00019296316742024806, "loss": 4.9284, "mean_token_accuracy": 0.2203731968998909, "num_tokens": 138589434.0, "step": 79910 }, { "entropy": 5.929994678497314, "epoch": 6.217623030538806, "grad_norm": 1.5234375, "learning_rate": 0.00019293736036702259, "loss": 4.8536, "mean_token_accuracy": 0.21923349499702455, "num_tokens": 138598173.0, "step": 79915 }, { "entropy": 5.990842628479004, "epoch": 6.2180120599105235, "grad_norm": 1.5703125, "learning_rate": 0.0001929115545589672, "loss": 4.9078, "mean_token_accuracy": 0.2217731148004532, "num_tokens": 138607244.0, "step": 79920 }, { "entropy": 5.92891411781311, "epoch": 6.218401089282241, "grad_norm": 1.5234375, "learning_rate": 0.0001928857499964733, "loss": 4.87, "mean_token_accuracy": 0.22926084697246552, "num_tokens": 138616166.0, "step": 79925 }, { "entropy": 5.956151485443115, "epoch": 6.218790118653958, "grad_norm": 1.546875, "learning_rate": 0.00019285994667993245, "loss": 4.9304, "mean_token_accuracy": 0.2282259300351143, "num_tokens": 138624792.0, "step": 79930 }, { "entropy": 6.0048271179199215, "epoch": 6.219179148025676, "grad_norm": 1.625, "learning_rate": 0.00019283414460973626, "loss": 4.9544, "mean_token_accuracy": 0.21998497992753982, "num_tokens": 138633646.0, "step": 79935 }, { "entropy": 5.921176433563232, "epoch": 6.219568177397393, "grad_norm": 1.5390625, "learning_rate": 0.00019280834378627605, "loss": 4.8089, "mean_token_accuracy": 0.22570632994174958, "num_tokens": 138641924.0, "step": 79940 }, { "entropy": 5.883162784576416, "epoch": 6.219957206769111, "grad_norm": 1.4765625, "learning_rate": 0.0001927825442099434, "loss": 4.7859, "mean_token_accuracy": 0.23931537717580795, "num_tokens": 138650482.0, "step": 79945 }, { "entropy": 5.92144284248352, "epoch": 6.220346236140829, "grad_norm": 1.5390625, "learning_rate": 0.0001927567458811298, "loss": 4.8627, "mean_token_accuracy": 0.22535786628723145, "num_tokens": 138658805.0, "step": 79950 }, { "entropy": 5.980515575408935, "epoch": 6.2207352655125465, "grad_norm": 1.421875, "learning_rate": 0.00019273094880022662, "loss": 5.009, "mean_token_accuracy": 0.21804411262273787, "num_tokens": 138667888.0, "step": 79955 }, { "entropy": 5.942375612258911, "epoch": 6.221124294884264, "grad_norm": 1.6171875, "learning_rate": 0.00019270515296762543, "loss": 4.8333, "mean_token_accuracy": 0.22584726363420488, "num_tokens": 138676068.0, "step": 79960 }, { "entropy": 6.003423976898193, "epoch": 6.221513324255981, "grad_norm": 1.4453125, "learning_rate": 0.00019267935838371752, "loss": 5.004, "mean_token_accuracy": 0.2144085004925728, "num_tokens": 138685041.0, "step": 79965 }, { "entropy": 5.937396287918091, "epoch": 6.221902353627699, "grad_norm": 1.46875, "learning_rate": 0.0001926535650488943, "loss": 4.8636, "mean_token_accuracy": 0.22527590095996858, "num_tokens": 138693816.0, "step": 79970 }, { "entropy": 5.927091598510742, "epoch": 6.222291382999416, "grad_norm": 1.5078125, "learning_rate": 0.0001926277729635472, "loss": 4.8673, "mean_token_accuracy": 0.2290528193116188, "num_tokens": 138702765.0, "step": 79975 }, { "entropy": 5.927750873565674, "epoch": 6.222680412371134, "grad_norm": 1.53125, "learning_rate": 0.00019260198212806747, "loss": 4.8842, "mean_token_accuracy": 0.22678946405649186, "num_tokens": 138711679.0, "step": 79980 }, { "entropy": 5.9225057601928714, "epoch": 6.223069441742852, "grad_norm": 1.546875, "learning_rate": 0.0001925761925428466, "loss": 4.8485, "mean_token_accuracy": 0.22968191057443618, "num_tokens": 138719781.0, "step": 79985 }, { "entropy": 5.98445234298706, "epoch": 6.2234584711145695, "grad_norm": 1.484375, "learning_rate": 0.00019255040420827576, "loss": 4.9757, "mean_token_accuracy": 0.21483351290225983, "num_tokens": 138728399.0, "step": 79990 }, { "entropy": 5.985298538208008, "epoch": 6.223847500486286, "grad_norm": 1.5859375, "learning_rate": 0.00019252461712474629, "loss": 4.9224, "mean_token_accuracy": 0.2170774444937706, "num_tokens": 138737481.0, "step": 79995 }, { "entropy": 6.078380489349366, "epoch": 6.224236529858004, "grad_norm": 1.4609375, "learning_rate": 0.0001924988312926495, "loss": 5.0777, "mean_token_accuracy": 0.213588710129261, "num_tokens": 138746453.0, "step": 80000 }, { "entropy": 6.001856470108033, "epoch": 6.224625559229722, "grad_norm": 1.4921875, "learning_rate": 0.00019247304671237664, "loss": 4.9607, "mean_token_accuracy": 0.2262277141213417, "num_tokens": 138754676.0, "step": 80005 }, { "entropy": 5.945106124877929, "epoch": 6.225014588601439, "grad_norm": 1.7265625, "learning_rate": 0.00019244726338431896, "loss": 4.8626, "mean_token_accuracy": 0.2203497916460037, "num_tokens": 138763403.0, "step": 80010 }, { "entropy": 6.00696291923523, "epoch": 6.225403617973157, "grad_norm": 1.5390625, "learning_rate": 0.00019242148130886773, "loss": 4.9261, "mean_token_accuracy": 0.22686820477247238, "num_tokens": 138772597.0, "step": 80015 }, { "entropy": 5.9677405834198, "epoch": 6.225792647344875, "grad_norm": 1.53125, "learning_rate": 0.00019239570048641398, "loss": 4.8874, "mean_token_accuracy": 0.22184973061084748, "num_tokens": 138781364.0, "step": 80020 }, { "entropy": 6.067014694213867, "epoch": 6.2261816767165925, "grad_norm": 1.5625, "learning_rate": 0.000192369920917349, "loss": 5.0475, "mean_token_accuracy": 0.21243318319320678, "num_tokens": 138789720.0, "step": 80025 }, { "entropy": 5.969296264648437, "epoch": 6.226570706088309, "grad_norm": 1.6953125, "learning_rate": 0.000192344142602064, "loss": 4.939, "mean_token_accuracy": 0.22091440707445145, "num_tokens": 138798582.0, "step": 80030 }, { "entropy": 5.941404676437378, "epoch": 6.226959735460027, "grad_norm": 1.4609375, "learning_rate": 0.00019231836554095, "loss": 4.8986, "mean_token_accuracy": 0.22727575153112411, "num_tokens": 138807580.0, "step": 80035 }, { "entropy": 5.884705495834351, "epoch": 6.227348764831745, "grad_norm": 1.5390625, "learning_rate": 0.00019229258973439827, "loss": 4.8417, "mean_token_accuracy": 0.22424816936254502, "num_tokens": 138815988.0, "step": 80040 }, { "entropy": 5.989632225036621, "epoch": 6.227737794203462, "grad_norm": 1.6015625, "learning_rate": 0.00019226681518279975, "loss": 4.905, "mean_token_accuracy": 0.2193565160036087, "num_tokens": 138824049.0, "step": 80045 }, { "entropy": 5.9522132396698, "epoch": 6.22812682357518, "grad_norm": 1.65625, "learning_rate": 0.00019224104188654572, "loss": 4.8104, "mean_token_accuracy": 0.23222687542438508, "num_tokens": 138833219.0, "step": 80050 }, { "entropy": 5.950984334945678, "epoch": 6.228515852946898, "grad_norm": 1.6328125, "learning_rate": 0.00019221526984602717, "loss": 4.8834, "mean_token_accuracy": 0.22631106823682784, "num_tokens": 138841398.0, "step": 80055 }, { "entropy": 5.979631519317627, "epoch": 6.228904882318615, "grad_norm": 1.59375, "learning_rate": 0.0001921894990616351, "loss": 4.9506, "mean_token_accuracy": 0.21904913634061812, "num_tokens": 138849711.0, "step": 80060 }, { "entropy": 5.924089050292968, "epoch": 6.229293911690332, "grad_norm": 1.515625, "learning_rate": 0.00019216372953376055, "loss": 4.8048, "mean_token_accuracy": 0.23367371559143066, "num_tokens": 138858317.0, "step": 80065 }, { "entropy": 5.956614208221436, "epoch": 6.22968294106205, "grad_norm": 1.53125, "learning_rate": 0.0001921379612627946, "loss": 5.0095, "mean_token_accuracy": 0.21113065630197525, "num_tokens": 138866506.0, "step": 80070 }, { "entropy": 5.952702760696411, "epoch": 6.230071970433768, "grad_norm": 1.46875, "learning_rate": 0.00019211219424912818, "loss": 4.9314, "mean_token_accuracy": 0.22341269701719285, "num_tokens": 138875458.0, "step": 80075 }, { "entropy": 6.024172163009643, "epoch": 6.230460999805485, "grad_norm": 1.4140625, "learning_rate": 0.0001920864284931523, "loss": 5.0031, "mean_token_accuracy": 0.2115068182349205, "num_tokens": 138884323.0, "step": 80080 }, { "entropy": 5.9845531463623045, "epoch": 6.230850029177203, "grad_norm": 1.625, "learning_rate": 0.00019206066399525784, "loss": 4.8707, "mean_token_accuracy": 0.22973206490278245, "num_tokens": 138892758.0, "step": 80085 }, { "entropy": 6.008491659164429, "epoch": 6.231239058548921, "grad_norm": 1.703125, "learning_rate": 0.00019203490075583586, "loss": 4.9475, "mean_token_accuracy": 0.226315413415432, "num_tokens": 138901045.0, "step": 80090 }, { "entropy": 5.997810649871826, "epoch": 6.231628087920638, "grad_norm": 1.6796875, "learning_rate": 0.0001920091387752772, "loss": 4.9833, "mean_token_accuracy": 0.21520777195692062, "num_tokens": 138909677.0, "step": 80095 }, { "entropy": 5.938766765594482, "epoch": 6.232017117292355, "grad_norm": 1.5390625, "learning_rate": 0.00019198337805397282, "loss": 4.8538, "mean_token_accuracy": 0.2283240482211113, "num_tokens": 138918156.0, "step": 80100 }, { "entropy": 6.036249589920044, "epoch": 6.232406146664073, "grad_norm": 1.5390625, "learning_rate": 0.00019195761859231342, "loss": 5.0012, "mean_token_accuracy": 0.21367700546979904, "num_tokens": 138926157.0, "step": 80105 }, { "entropy": 5.9774253368377686, "epoch": 6.232795176035791, "grad_norm": 1.5859375, "learning_rate": 0.00019193186039068993, "loss": 5.0404, "mean_token_accuracy": 0.21074442714452743, "num_tokens": 138935240.0, "step": 80110 }, { "entropy": 5.975606393814087, "epoch": 6.233184205407508, "grad_norm": 1.5390625, "learning_rate": 0.00019190610344949337, "loss": 4.9877, "mean_token_accuracy": 0.22510451525449754, "num_tokens": 138944744.0, "step": 80115 }, { "entropy": 5.98780198097229, "epoch": 6.233573234779226, "grad_norm": 1.5546875, "learning_rate": 0.00019188034776911438, "loss": 4.887, "mean_token_accuracy": 0.22548603862524033, "num_tokens": 138952818.0, "step": 80120 }, { "entropy": 5.990399169921875, "epoch": 6.233962264150944, "grad_norm": 1.6015625, "learning_rate": 0.00019185459334994387, "loss": 4.9264, "mean_token_accuracy": 0.218938410282135, "num_tokens": 138961748.0, "step": 80125 }, { "entropy": 5.930001735687256, "epoch": 6.234351293522661, "grad_norm": 1.6640625, "learning_rate": 0.00019182884019237258, "loss": 4.9408, "mean_token_accuracy": 0.2264801874756813, "num_tokens": 138970327.0, "step": 80130 }, { "entropy": 5.916275501251221, "epoch": 6.234740322894378, "grad_norm": 1.5234375, "learning_rate": 0.0001918030882967912, "loss": 4.9001, "mean_token_accuracy": 0.22582300007343292, "num_tokens": 138979061.0, "step": 80135 }, { "entropy": 6.026755905151367, "epoch": 6.235129352266096, "grad_norm": 1.5703125, "learning_rate": 0.00019177733766359057, "loss": 4.9544, "mean_token_accuracy": 0.2167467474937439, "num_tokens": 138987135.0, "step": 80140 }, { "entropy": 5.97624454498291, "epoch": 6.235518381637814, "grad_norm": 1.5859375, "learning_rate": 0.00019175158829316135, "loss": 4.9614, "mean_token_accuracy": 0.2231220245361328, "num_tokens": 138994950.0, "step": 80145 }, { "entropy": 5.983102035522461, "epoch": 6.235907411009531, "grad_norm": 1.546875, "learning_rate": 0.00019172584018589429, "loss": 4.9291, "mean_token_accuracy": 0.21789480894804, "num_tokens": 139004442.0, "step": 80150 }, { "entropy": 5.980429697036743, "epoch": 6.236296440381249, "grad_norm": 1.578125, "learning_rate": 0.00019170009334218004, "loss": 4.9237, "mean_token_accuracy": 0.23102206438779832, "num_tokens": 139012657.0, "step": 80155 }, { "entropy": 5.990257835388183, "epoch": 6.236685469752967, "grad_norm": 1.6171875, "learning_rate": 0.00019167434776240933, "loss": 4.9869, "mean_token_accuracy": 0.21335504055023194, "num_tokens": 139021365.0, "step": 80160 }, { "entropy": 5.975764274597168, "epoch": 6.237074499124684, "grad_norm": 1.5234375, "learning_rate": 0.00019164860344697272, "loss": 4.9609, "mean_token_accuracy": 0.2256344199180603, "num_tokens": 139030528.0, "step": 80165 }, { "entropy": 6.0508225440979, "epoch": 6.237463528496401, "grad_norm": 1.5546875, "learning_rate": 0.00019162286039626093, "loss": 4.9696, "mean_token_accuracy": 0.2183699756860733, "num_tokens": 139039098.0, "step": 80170 }, { "entropy": 5.984281206130982, "epoch": 6.237852557868119, "grad_norm": 1.4609375, "learning_rate": 0.00019159711861066453, "loss": 4.9512, "mean_token_accuracy": 0.2234419673681259, "num_tokens": 139047948.0, "step": 80175 }, { "entropy": 5.956870603561401, "epoch": 6.238241587239837, "grad_norm": 1.578125, "learning_rate": 0.000191571378090574, "loss": 4.9212, "mean_token_accuracy": 0.21947567611932756, "num_tokens": 139056561.0, "step": 80180 }, { "entropy": 5.94955415725708, "epoch": 6.238630616611554, "grad_norm": 1.609375, "learning_rate": 0.0001915456388363801, "loss": 4.9351, "mean_token_accuracy": 0.22104964256286622, "num_tokens": 139065567.0, "step": 80185 }, { "entropy": 6.012798261642456, "epoch": 6.239019645983272, "grad_norm": 1.4921875, "learning_rate": 0.0001915199008484733, "loss": 5.039, "mean_token_accuracy": 0.21409912705421447, "num_tokens": 139075249.0, "step": 80190 }, { "entropy": 5.93210277557373, "epoch": 6.239408675354989, "grad_norm": 1.671875, "learning_rate": 0.00019149416412724414, "loss": 4.9189, "mean_token_accuracy": 0.21581896096467973, "num_tokens": 139084226.0, "step": 80195 }, { "entropy": 5.897347450256348, "epoch": 6.239797704726707, "grad_norm": 1.390625, "learning_rate": 0.00019146842867308306, "loss": 4.8354, "mean_token_accuracy": 0.23297619074583054, "num_tokens": 139093247.0, "step": 80200 }, { "entropy": 5.968873119354248, "epoch": 6.240186734098424, "grad_norm": 1.515625, "learning_rate": 0.00019144269448638073, "loss": 4.9647, "mean_token_accuracy": 0.21599065661430358, "num_tokens": 139102771.0, "step": 80205 }, { "entropy": 5.982603549957275, "epoch": 6.240575763470142, "grad_norm": 1.421875, "learning_rate": 0.00019141696156752748, "loss": 4.9077, "mean_token_accuracy": 0.22271136790513993, "num_tokens": 139111815.0, "step": 80210 }, { "entropy": 6.049552965164184, "epoch": 6.24096479284186, "grad_norm": 1.65625, "learning_rate": 0.00019139122991691378, "loss": 5.0083, "mean_token_accuracy": 0.21942714601755142, "num_tokens": 139119581.0, "step": 80215 }, { "entropy": 6.061219644546509, "epoch": 6.241353822213577, "grad_norm": 1.6484375, "learning_rate": 0.0001913654995349301, "loss": 4.9665, "mean_token_accuracy": 0.2201542466878891, "num_tokens": 139128377.0, "step": 80220 }, { "entropy": 6.004542112350464, "epoch": 6.241742851585295, "grad_norm": 1.5390625, "learning_rate": 0.00019133977042196682, "loss": 4.9467, "mean_token_accuracy": 0.21861826181411742, "num_tokens": 139137158.0, "step": 80225 }, { "entropy": 5.936137771606445, "epoch": 6.242131880957012, "grad_norm": 1.5, "learning_rate": 0.0001913140425784144, "loss": 4.8454, "mean_token_accuracy": 0.22711904495954513, "num_tokens": 139145652.0, "step": 80230 }, { "entropy": 5.961682367324829, "epoch": 6.24252091032873, "grad_norm": 1.578125, "learning_rate": 0.00019128831600466313, "loss": 4.9494, "mean_token_accuracy": 0.21885040402412415, "num_tokens": 139154670.0, "step": 80235 }, { "entropy": 5.932866764068604, "epoch": 6.242909939700447, "grad_norm": 1.4453125, "learning_rate": 0.00019126259070110347, "loss": 4.8937, "mean_token_accuracy": 0.22698913514614105, "num_tokens": 139163892.0, "step": 80240 }, { "entropy": 5.950962066650391, "epoch": 6.243298969072165, "grad_norm": 1.5703125, "learning_rate": 0.00019123686666812562, "loss": 4.8775, "mean_token_accuracy": 0.22376986145973204, "num_tokens": 139173187.0, "step": 80245 }, { "entropy": 5.982334089279175, "epoch": 6.243687998443883, "grad_norm": 1.5625, "learning_rate": 0.0001912111439061201, "loss": 4.9123, "mean_token_accuracy": 0.22526841461658478, "num_tokens": 139180970.0, "step": 80250 }, { "entropy": 6.029639530181885, "epoch": 6.2440770278156, "grad_norm": 1.515625, "learning_rate": 0.0001911854224154771, "loss": 5.0085, "mean_token_accuracy": 0.21758198142051696, "num_tokens": 139189303.0, "step": 80255 }, { "entropy": 5.945736980438232, "epoch": 6.244466057187318, "grad_norm": 1.5703125, "learning_rate": 0.0001911597021965869, "loss": 4.8725, "mean_token_accuracy": 0.22480645030736923, "num_tokens": 139197953.0, "step": 80260 }, { "entropy": 5.980121898651123, "epoch": 6.244855086559035, "grad_norm": 1.609375, "learning_rate": 0.00019113398324983972, "loss": 4.9509, "mean_token_accuracy": 0.21194576621055602, "num_tokens": 139206544.0, "step": 80265 }, { "entropy": 5.956782865524292, "epoch": 6.245244115930753, "grad_norm": 1.4921875, "learning_rate": 0.00019110826557562594, "loss": 4.9353, "mean_token_accuracy": 0.21818137764930726, "num_tokens": 139215721.0, "step": 80270 }, { "entropy": 5.991478347778321, "epoch": 6.24563314530247, "grad_norm": 1.5234375, "learning_rate": 0.00019108254917433564, "loss": 4.9405, "mean_token_accuracy": 0.22441145032644272, "num_tokens": 139224441.0, "step": 80275 }, { "entropy": 6.020716667175293, "epoch": 6.246022174674188, "grad_norm": 1.640625, "learning_rate": 0.00019105683404635915, "loss": 4.9365, "mean_token_accuracy": 0.218800887465477, "num_tokens": 139232698.0, "step": 80280 }, { "entropy": 5.984579181671142, "epoch": 6.246411204045906, "grad_norm": 1.515625, "learning_rate": 0.00019103112019208662, "loss": 4.9616, "mean_token_accuracy": 0.21505143493413925, "num_tokens": 139242190.0, "step": 80285 }, { "entropy": 5.966636753082275, "epoch": 6.246800233417623, "grad_norm": 1.484375, "learning_rate": 0.00019100540761190815, "loss": 4.9271, "mean_token_accuracy": 0.2202674612402916, "num_tokens": 139251086.0, "step": 80290 }, { "entropy": 5.98963680267334, "epoch": 6.24718926278934, "grad_norm": 1.546875, "learning_rate": 0.00019097969630621386, "loss": 4.8845, "mean_token_accuracy": 0.22730763107538224, "num_tokens": 139259874.0, "step": 80295 }, { "entropy": 5.995368528366089, "epoch": 6.247578292161058, "grad_norm": 1.5390625, "learning_rate": 0.000190953986275394, "loss": 5.0256, "mean_token_accuracy": 0.21167052090167998, "num_tokens": 139268165.0, "step": 80300 }, { "entropy": 6.000151205062866, "epoch": 6.247967321532776, "grad_norm": 1.6796875, "learning_rate": 0.00019092827751983866, "loss": 4.9962, "mean_token_accuracy": 0.2198484718799591, "num_tokens": 139277770.0, "step": 80305 }, { "entropy": 5.908852815628052, "epoch": 6.248356350904493, "grad_norm": 1.421875, "learning_rate": 0.0001909025700399377, "loss": 4.7682, "mean_token_accuracy": 0.23624135702848434, "num_tokens": 139286586.0, "step": 80310 }, { "entropy": 5.981142663955689, "epoch": 6.248745380276211, "grad_norm": 1.6171875, "learning_rate": 0.0001908768638360816, "loss": 4.9225, "mean_token_accuracy": 0.21761636734008788, "num_tokens": 139294540.0, "step": 80315 }, { "entropy": 5.947405481338501, "epoch": 6.249134409647929, "grad_norm": 1.6640625, "learning_rate": 0.00019085115890866018, "loss": 4.9059, "mean_token_accuracy": 0.23013843595981598, "num_tokens": 139302813.0, "step": 80320 }, { "entropy": 5.976039791107178, "epoch": 6.249523439019646, "grad_norm": 1.609375, "learning_rate": 0.00019082545525806344, "loss": 4.9599, "mean_token_accuracy": 0.21685190200805665, "num_tokens": 139311572.0, "step": 80325 }, { "entropy": 5.977466726303101, "epoch": 6.249912468391363, "grad_norm": 1.5859375, "learning_rate": 0.00019079975288468142, "loss": 4.9268, "mean_token_accuracy": 0.2255333036184311, "num_tokens": 139320653.0, "step": 80330 }, { "entropy": 6.0107275485992435, "epoch": 6.250301497763081, "grad_norm": 1.4609375, "learning_rate": 0.00019077405178890417, "loss": 4.9284, "mean_token_accuracy": 0.21743201613426208, "num_tokens": 139329581.0, "step": 80335 }, { "entropy": 6.120006847381592, "epoch": 6.250690527134799, "grad_norm": 1.5546875, "learning_rate": 0.00019074835197112162, "loss": 5.0895, "mean_token_accuracy": 0.20896613448858262, "num_tokens": 139337835.0, "step": 80340 }, { "entropy": 6.026638078689575, "epoch": 6.251079556506516, "grad_norm": 1.53125, "learning_rate": 0.00019072265343172368, "loss": 5.0163, "mean_token_accuracy": 0.21295485645532608, "num_tokens": 139346967.0, "step": 80345 }, { "entropy": 5.976271724700927, "epoch": 6.251468585878234, "grad_norm": 1.71875, "learning_rate": 0.00019069695617110038, "loss": 4.9288, "mean_token_accuracy": 0.2200591653585434, "num_tokens": 139354980.0, "step": 80350 }, { "entropy": 5.974779033660889, "epoch": 6.251857615249952, "grad_norm": 1.65625, "learning_rate": 0.0001906712601896416, "loss": 4.9399, "mean_token_accuracy": 0.21681870818138121, "num_tokens": 139363618.0, "step": 80355 }, { "entropy": 5.963871240615845, "epoch": 6.252246644621669, "grad_norm": 1.5234375, "learning_rate": 0.0001906455654877372, "loss": 4.9323, "mean_token_accuracy": 0.22650104761123657, "num_tokens": 139372377.0, "step": 80360 }, { "entropy": 5.923278856277466, "epoch": 6.252635673993386, "grad_norm": 1.5234375, "learning_rate": 0.00019061987206577712, "loss": 4.7948, "mean_token_accuracy": 0.23266690522432326, "num_tokens": 139380842.0, "step": 80365 }, { "entropy": 5.877077865600586, "epoch": 6.253024703365104, "grad_norm": 1.6015625, "learning_rate": 0.0001905941799241511, "loss": 4.8105, "mean_token_accuracy": 0.23551322519779205, "num_tokens": 139390004.0, "step": 80370 }, { "entropy": 5.961658573150634, "epoch": 6.2534137327368216, "grad_norm": 1.71875, "learning_rate": 0.00019056848906324914, "loss": 4.8234, "mean_token_accuracy": 0.2260149300098419, "num_tokens": 139398059.0, "step": 80375 }, { "entropy": 5.864412641525268, "epoch": 6.253802762108539, "grad_norm": 1.53125, "learning_rate": 0.0001905427994834608, "loss": 4.8377, "mean_token_accuracy": 0.234512260556221, "num_tokens": 139406499.0, "step": 80380 }, { "entropy": 5.982770729064941, "epoch": 6.254191791480257, "grad_norm": 1.6796875, "learning_rate": 0.00019051711118517618, "loss": 4.9151, "mean_token_accuracy": 0.2246263101696968, "num_tokens": 139414629.0, "step": 80385 }, { "entropy": 5.924739837646484, "epoch": 6.254580820851975, "grad_norm": 1.5, "learning_rate": 0.00019049142416878496, "loss": 4.8823, "mean_token_accuracy": 0.21907055675983428, "num_tokens": 139424474.0, "step": 80390 }, { "entropy": 6.0668354511260985, "epoch": 6.2549698502236915, "grad_norm": 1.5703125, "learning_rate": 0.00019046573843467684, "loss": 4.9314, "mean_token_accuracy": 0.22173729091882705, "num_tokens": 139433452.0, "step": 80395 }, { "entropy": 5.959890079498291, "epoch": 6.255358879595409, "grad_norm": 1.5390625, "learning_rate": 0.0001904400539832416, "loss": 4.8635, "mean_token_accuracy": 0.22497277706861496, "num_tokens": 139442249.0, "step": 80400 }, { "entropy": 6.038123941421508, "epoch": 6.255747908967127, "grad_norm": 1.6015625, "learning_rate": 0.00019041437081486896, "loss": 4.9729, "mean_token_accuracy": 0.21033526211977005, "num_tokens": 139451027.0, "step": 80405 }, { "entropy": 6.007887172698974, "epoch": 6.2561369383388445, "grad_norm": 1.5625, "learning_rate": 0.00019038868892994854, "loss": 4.9795, "mean_token_accuracy": 0.21829184144735336, "num_tokens": 139459816.0, "step": 80410 }, { "entropy": 5.998119831085205, "epoch": 6.256525967710562, "grad_norm": 3.109375, "learning_rate": 0.00019036300832887015, "loss": 4.9079, "mean_token_accuracy": 0.22780579179525376, "num_tokens": 139468043.0, "step": 80415 }, { "entropy": 6.0031023025512695, "epoch": 6.25691499708228, "grad_norm": 1.640625, "learning_rate": 0.00019033732901202339, "loss": 4.9492, "mean_token_accuracy": 0.2211369425058365, "num_tokens": 139476561.0, "step": 80420 }, { "entropy": 5.965800476074219, "epoch": 6.257304026453998, "grad_norm": 1.4765625, "learning_rate": 0.0001903116509797979, "loss": 4.918, "mean_token_accuracy": 0.21829174011945723, "num_tokens": 139485179.0, "step": 80425 }, { "entropy": 5.984697723388672, "epoch": 6.2576930558257144, "grad_norm": 1.546875, "learning_rate": 0.0001902859742325833, "loss": 4.9544, "mean_token_accuracy": 0.21962982714176177, "num_tokens": 139492962.0, "step": 80430 }, { "entropy": 5.966595983505249, "epoch": 6.258082085197432, "grad_norm": 1.5625, "learning_rate": 0.00019026029877076923, "loss": 4.9543, "mean_token_accuracy": 0.21921565532684326, "num_tokens": 139502382.0, "step": 80435 }, { "entropy": 5.878050231933594, "epoch": 6.25847111456915, "grad_norm": 1.46875, "learning_rate": 0.0001902346245947452, "loss": 4.8161, "mean_token_accuracy": 0.23269507735967637, "num_tokens": 139511693.0, "step": 80440 }, { "entropy": 6.020147180557251, "epoch": 6.2588601439408675, "grad_norm": 1.578125, "learning_rate": 0.00019020895170490082, "loss": 4.9694, "mean_token_accuracy": 0.21880081444978713, "num_tokens": 139520020.0, "step": 80445 }, { "entropy": 5.932745265960693, "epoch": 6.259249173312585, "grad_norm": 1.5703125, "learning_rate": 0.00019018328010162567, "loss": 4.9303, "mean_token_accuracy": 0.21606847196817397, "num_tokens": 139528291.0, "step": 80450 }, { "entropy": 5.948555517196655, "epoch": 6.259638202684303, "grad_norm": 1.5859375, "learning_rate": 0.00019015760978530926, "loss": 4.9502, "mean_token_accuracy": 0.21818622052669526, "num_tokens": 139536469.0, "step": 80455 }, { "entropy": 5.939505577087402, "epoch": 6.260027232056021, "grad_norm": 1.578125, "learning_rate": 0.00019013194075634106, "loss": 4.8503, "mean_token_accuracy": 0.23321955353021623, "num_tokens": 139545212.0, "step": 80460 }, { "entropy": 5.975971126556397, "epoch": 6.260416261427737, "grad_norm": 1.59375, "learning_rate": 0.00019010627301511057, "loss": 4.9351, "mean_token_accuracy": 0.21820525377988814, "num_tokens": 139553510.0, "step": 80465 }, { "entropy": 5.9626062393188475, "epoch": 6.260805290799455, "grad_norm": 1.5, "learning_rate": 0.00019008060656200732, "loss": 4.8943, "mean_token_accuracy": 0.22280961871147156, "num_tokens": 139561553.0, "step": 80470 }, { "entropy": 6.006557321548462, "epoch": 6.261194320171173, "grad_norm": 1.46875, "learning_rate": 0.00019005494139742068, "loss": 4.9933, "mean_token_accuracy": 0.21731957346200942, "num_tokens": 139571163.0, "step": 80475 }, { "entropy": 6.002400350570679, "epoch": 6.2615833495428905, "grad_norm": 1.5546875, "learning_rate": 0.0001900292775217401, "loss": 4.9363, "mean_token_accuracy": 0.21575907766819, "num_tokens": 139579429.0, "step": 80480 }, { "entropy": 5.964996480941773, "epoch": 6.261972378914608, "grad_norm": 1.6484375, "learning_rate": 0.000190003614935355, "loss": 4.9015, "mean_token_accuracy": 0.22534175962209702, "num_tokens": 139588851.0, "step": 80485 }, { "entropy": 5.954633092880249, "epoch": 6.262361408286326, "grad_norm": 1.6796875, "learning_rate": 0.00018997795363865473, "loss": 4.8435, "mean_token_accuracy": 0.22770313620567323, "num_tokens": 139597189.0, "step": 80490 }, { "entropy": 5.910151672363281, "epoch": 6.262750437658044, "grad_norm": 1.6953125, "learning_rate": 0.0001899522936320287, "loss": 4.8283, "mean_token_accuracy": 0.22679278552532195, "num_tokens": 139605257.0, "step": 80495 }, { "entropy": 5.9266026496887205, "epoch": 6.26313946702976, "grad_norm": 1.5234375, "learning_rate": 0.0001899266349158662, "loss": 4.8948, "mean_token_accuracy": 0.2172493517398834, "num_tokens": 139613374.0, "step": 80500 }, { "entropy": 6.024798727035522, "epoch": 6.263528496401478, "grad_norm": 1.7109375, "learning_rate": 0.00018990097749055669, "loss": 4.9969, "mean_token_accuracy": 0.2088245078921318, "num_tokens": 139622260.0, "step": 80505 }, { "entropy": 6.020614433288574, "epoch": 6.263917525773196, "grad_norm": 1.5859375, "learning_rate": 0.00018987532135648926, "loss": 5.0032, "mean_token_accuracy": 0.21210717260837555, "num_tokens": 139630127.0, "step": 80510 }, { "entropy": 6.023227739334106, "epoch": 6.2643065551449135, "grad_norm": 1.5390625, "learning_rate": 0.0001898496665140535, "loss": 4.9775, "mean_token_accuracy": 0.2169090300798416, "num_tokens": 139638999.0, "step": 80515 }, { "entropy": 6.026350736618042, "epoch": 6.264695584516631, "grad_norm": 1.5390625, "learning_rate": 0.00018982401296363844, "loss": 4.9789, "mean_token_accuracy": 0.21807647347450257, "num_tokens": 139647100.0, "step": 80520 }, { "entropy": 5.9934406757354735, "epoch": 6.265084613888349, "grad_norm": 1.609375, "learning_rate": 0.00018979836070563339, "loss": 4.8933, "mean_token_accuracy": 0.22341385632753372, "num_tokens": 139655330.0, "step": 80525 }, { "entropy": 5.907823944091797, "epoch": 6.265473643260066, "grad_norm": 1.5859375, "learning_rate": 0.00018977270974042764, "loss": 4.8022, "mean_token_accuracy": 0.23568839877843856, "num_tokens": 139663702.0, "step": 80530 }, { "entropy": 5.956437063217163, "epoch": 6.265862672631783, "grad_norm": 1.5625, "learning_rate": 0.00018974706006841035, "loss": 4.9701, "mean_token_accuracy": 0.21976171135902406, "num_tokens": 139672302.0, "step": 80535 }, { "entropy": 5.925638008117676, "epoch": 6.266251702003501, "grad_norm": 1.734375, "learning_rate": 0.00018972141168997075, "loss": 4.8018, "mean_token_accuracy": 0.22518396973609925, "num_tokens": 139680881.0, "step": 80540 }, { "entropy": 5.976995658874512, "epoch": 6.266640731375219, "grad_norm": 1.484375, "learning_rate": 0.00018969576460549798, "loss": 4.864, "mean_token_accuracy": 0.2299143761396408, "num_tokens": 139690134.0, "step": 80545 }, { "entropy": 5.9761217594146725, "epoch": 6.2670297607469365, "grad_norm": 1.703125, "learning_rate": 0.00018967011881538122, "loss": 4.9102, "mean_token_accuracy": 0.22536627650260926, "num_tokens": 139699066.0, "step": 80550 }, { "entropy": 5.988219261169434, "epoch": 6.267418790118654, "grad_norm": 1.546875, "learning_rate": 0.00018964447432000964, "loss": 4.96, "mean_token_accuracy": 0.22141536921262742, "num_tokens": 139707884.0, "step": 80555 }, { "entropy": 5.999737787246704, "epoch": 6.267807819490372, "grad_norm": 1.5859375, "learning_rate": 0.00018961883111977225, "loss": 4.9358, "mean_token_accuracy": 0.22934476435184478, "num_tokens": 139716848.0, "step": 80560 }, { "entropy": 5.919596385955811, "epoch": 6.268196848862089, "grad_norm": 1.5625, "learning_rate": 0.0001895931892150582, "loss": 4.8115, "mean_token_accuracy": 0.23043763637542725, "num_tokens": 139725639.0, "step": 80565 }, { "entropy": 5.891748380661011, "epoch": 6.268585878233806, "grad_norm": 1.5703125, "learning_rate": 0.00018956754860625653, "loss": 4.8799, "mean_token_accuracy": 0.2312275603413582, "num_tokens": 139734259.0, "step": 80570 }, { "entropy": 5.941840505599975, "epoch": 6.268974907605524, "grad_norm": 1.5390625, "learning_rate": 0.00018954190929375625, "loss": 4.9363, "mean_token_accuracy": 0.22420917004346846, "num_tokens": 139743049.0, "step": 80575 }, { "entropy": 5.969996690750122, "epoch": 6.269363936977242, "grad_norm": 1.5234375, "learning_rate": 0.00018951627127794656, "loss": 4.9382, "mean_token_accuracy": 0.22064988017082215, "num_tokens": 139751686.0, "step": 80580 }, { "entropy": 5.991896772384644, "epoch": 6.2697529663489595, "grad_norm": 1.6171875, "learning_rate": 0.0001894906345592165, "loss": 4.9848, "mean_token_accuracy": 0.2174515664577484, "num_tokens": 139760268.0, "step": 80585 }, { "entropy": 5.95908522605896, "epoch": 6.270141995720677, "grad_norm": 1.65625, "learning_rate": 0.0001894649991379549, "loss": 4.8799, "mean_token_accuracy": 0.22710421681404114, "num_tokens": 139769081.0, "step": 80590 }, { "entropy": 6.003872632980347, "epoch": 6.270531025092394, "grad_norm": 1.6953125, "learning_rate": 0.00018943936501455077, "loss": 5.0113, "mean_token_accuracy": 0.221414253115654, "num_tokens": 139777879.0, "step": 80595 }, { "entropy": 6.075345373153686, "epoch": 6.270920054464112, "grad_norm": 1.5078125, "learning_rate": 0.00018941373218939306, "loss": 5.0447, "mean_token_accuracy": 0.21136215776205064, "num_tokens": 139786105.0, "step": 80600 }, { "entropy": 6.046206998825073, "epoch": 6.271309083835829, "grad_norm": 1.5703125, "learning_rate": 0.00018938810066287078, "loss": 4.9539, "mean_token_accuracy": 0.2230125278234482, "num_tokens": 139795230.0, "step": 80605 }, { "entropy": 5.928977727890015, "epoch": 6.271698113207547, "grad_norm": 1.640625, "learning_rate": 0.0001893624704353728, "loss": 4.8199, "mean_token_accuracy": 0.22967091351747512, "num_tokens": 139803522.0, "step": 80610 }, { "entropy": 5.9459412574768065, "epoch": 6.272087142579265, "grad_norm": 1.59375, "learning_rate": 0.00018933684150728802, "loss": 4.8949, "mean_token_accuracy": 0.22807173430919647, "num_tokens": 139812550.0, "step": 80615 }, { "entropy": 5.943883752822876, "epoch": 6.2724761719509825, "grad_norm": 1.546875, "learning_rate": 0.00018931121387900536, "loss": 4.9606, "mean_token_accuracy": 0.21931248605251313, "num_tokens": 139820725.0, "step": 80620 }, { "entropy": 5.896672296524048, "epoch": 6.2728652013227, "grad_norm": 1.6875, "learning_rate": 0.00018928558755091358, "loss": 4.8237, "mean_token_accuracy": 0.22586772739887237, "num_tokens": 139828754.0, "step": 80625 }, { "entropy": 5.97490930557251, "epoch": 6.273254230694418, "grad_norm": 1.5625, "learning_rate": 0.00018925996252340167, "loss": 4.8992, "mean_token_accuracy": 0.22533331513404847, "num_tokens": 139837640.0, "step": 80630 }, { "entropy": 6.003220176696777, "epoch": 6.273643260066135, "grad_norm": 1.671875, "learning_rate": 0.0001892343387968583, "loss": 4.9563, "mean_token_accuracy": 0.22125212997198104, "num_tokens": 139846483.0, "step": 80635 }, { "entropy": 6.010891962051391, "epoch": 6.274032289437852, "grad_norm": 1.4921875, "learning_rate": 0.00018920871637167236, "loss": 5.0079, "mean_token_accuracy": 0.20958862751722335, "num_tokens": 139855174.0, "step": 80640 }, { "entropy": 5.8938984870910645, "epoch": 6.27442131880957, "grad_norm": 1.59375, "learning_rate": 0.00018918309524823247, "loss": 4.8153, "mean_token_accuracy": 0.224630144238472, "num_tokens": 139863583.0, "step": 80645 }, { "entropy": 5.942338323593139, "epoch": 6.274810348181288, "grad_norm": 1.6640625, "learning_rate": 0.00018915747542692758, "loss": 4.928, "mean_token_accuracy": 0.2276465967297554, "num_tokens": 139871909.0, "step": 80650 }, { "entropy": 6.006707191467285, "epoch": 6.2751993775530055, "grad_norm": 1.6015625, "learning_rate": 0.00018913185690814637, "loss": 4.9748, "mean_token_accuracy": 0.22455118596553802, "num_tokens": 139880262.0, "step": 80655 }, { "entropy": 5.977741861343384, "epoch": 6.275588406924723, "grad_norm": 1.640625, "learning_rate": 0.00018910623969227764, "loss": 4.9528, "mean_token_accuracy": 0.2133171498775482, "num_tokens": 139889018.0, "step": 80660 }, { "entropy": 5.960037136077881, "epoch": 6.27597743629644, "grad_norm": 1.609375, "learning_rate": 0.00018908062377971, "loss": 4.8167, "mean_token_accuracy": 0.22979181110858918, "num_tokens": 139897230.0, "step": 80665 }, { "entropy": 5.977007913589477, "epoch": 6.276366465668158, "grad_norm": 1.6640625, "learning_rate": 0.00018905500917083213, "loss": 4.9288, "mean_token_accuracy": 0.2252034530043602, "num_tokens": 139905797.0, "step": 80670 }, { "entropy": 6.011875200271606, "epoch": 6.276755495039875, "grad_norm": 1.546875, "learning_rate": 0.00018902939586603262, "loss": 4.8859, "mean_token_accuracy": 0.22142704874277114, "num_tokens": 139914726.0, "step": 80675 }, { "entropy": 5.901184701919556, "epoch": 6.277144524411593, "grad_norm": 1.6171875, "learning_rate": 0.00018900378386570027, "loss": 4.8021, "mean_token_accuracy": 0.2379198804497719, "num_tokens": 139923217.0, "step": 80680 }, { "entropy": 5.874596977233887, "epoch": 6.277533553783311, "grad_norm": 1.65625, "learning_rate": 0.0001889781731702236, "loss": 4.8686, "mean_token_accuracy": 0.22748982310295104, "num_tokens": 139931799.0, "step": 80685 }, { "entropy": 5.9368444919586185, "epoch": 6.2779225831550285, "grad_norm": 1.6640625, "learning_rate": 0.00018895256377999121, "loss": 4.9304, "mean_token_accuracy": 0.21759516447782518, "num_tokens": 139940783.0, "step": 80690 }, { "entropy": 6.022189617156982, "epoch": 6.278311612526746, "grad_norm": 1.625, "learning_rate": 0.0001889269556953917, "loss": 4.8756, "mean_token_accuracy": 0.22712236046791076, "num_tokens": 139949263.0, "step": 80695 }, { "entropy": 5.921438884735108, "epoch": 6.278700641898463, "grad_norm": 1.7265625, "learning_rate": 0.0001889013489168137, "loss": 4.8931, "mean_token_accuracy": 0.2327013149857521, "num_tokens": 139958012.0, "step": 80700 }, { "entropy": 5.920327234268188, "epoch": 6.279089671270181, "grad_norm": 1.4921875, "learning_rate": 0.00018887574344464563, "loss": 4.9046, "mean_token_accuracy": 0.22645654380321503, "num_tokens": 139966723.0, "step": 80705 }, { "entropy": 6.003917551040649, "epoch": 6.279478700641898, "grad_norm": 1.46875, "learning_rate": 0.00018885013927927608, "loss": 4.9884, "mean_token_accuracy": 0.22453253269195556, "num_tokens": 139975496.0, "step": 80710 }, { "entropy": 6.0114177703857425, "epoch": 6.279867730013616, "grad_norm": 1.6875, "learning_rate": 0.00018882453642109353, "loss": 4.9379, "mean_token_accuracy": 0.2202129527926445, "num_tokens": 139983861.0, "step": 80715 }, { "entropy": 5.937944841384888, "epoch": 6.280256759385334, "grad_norm": 1.6796875, "learning_rate": 0.0001887989348704865, "loss": 4.8526, "mean_token_accuracy": 0.2275329202413559, "num_tokens": 139992565.0, "step": 80720 }, { "entropy": 6.00098180770874, "epoch": 6.2806457887570515, "grad_norm": 1.6015625, "learning_rate": 0.00018877333462784346, "loss": 4.955, "mean_token_accuracy": 0.21971245259046554, "num_tokens": 140001943.0, "step": 80725 }, { "entropy": 6.010072374343872, "epoch": 6.281034818128768, "grad_norm": 1.671875, "learning_rate": 0.0001887477356935528, "loss": 4.9867, "mean_token_accuracy": 0.21524942368268968, "num_tokens": 140010667.0, "step": 80730 }, { "entropy": 5.922651243209839, "epoch": 6.281423847500486, "grad_norm": 1.5078125, "learning_rate": 0.00018872213806800297, "loss": 4.8662, "mean_token_accuracy": 0.2303991883993149, "num_tokens": 140019725.0, "step": 80735 }, { "entropy": 5.9251086711883545, "epoch": 6.281812876872204, "grad_norm": 1.546875, "learning_rate": 0.00018869654175158234, "loss": 4.8687, "mean_token_accuracy": 0.23534294217824936, "num_tokens": 140028789.0, "step": 80740 }, { "entropy": 5.931915616989135, "epoch": 6.282201906243921, "grad_norm": 1.59375, "learning_rate": 0.0001886709467446794, "loss": 4.894, "mean_token_accuracy": 0.2239112749695778, "num_tokens": 140037736.0, "step": 80745 }, { "entropy": 5.961803770065307, "epoch": 6.282590935615639, "grad_norm": 1.5703125, "learning_rate": 0.00018864535304768238, "loss": 4.9773, "mean_token_accuracy": 0.21855029165744783, "num_tokens": 140046120.0, "step": 80750 }, { "entropy": 5.97981367111206, "epoch": 6.282979964987357, "grad_norm": 1.6484375, "learning_rate": 0.00018861976066097968, "loss": 4.9537, "mean_token_accuracy": 0.2174478828907013, "num_tokens": 140054963.0, "step": 80755 }, { "entropy": 5.95885443687439, "epoch": 6.2833689943590745, "grad_norm": 1.3984375, "learning_rate": 0.00018859416958495962, "loss": 4.9106, "mean_token_accuracy": 0.22218480408191682, "num_tokens": 140064215.0, "step": 80760 }, { "entropy": 5.943155956268311, "epoch": 6.283758023730791, "grad_norm": 1.40625, "learning_rate": 0.00018856857982001051, "loss": 4.9024, "mean_token_accuracy": 0.2196154311299324, "num_tokens": 140074037.0, "step": 80765 }, { "entropy": 6.062546253204346, "epoch": 6.284147053102509, "grad_norm": 1.5390625, "learning_rate": 0.0001885429913665207, "loss": 5.0833, "mean_token_accuracy": 0.20941018760204316, "num_tokens": 140083277.0, "step": 80770 }, { "entropy": 6.068348836898804, "epoch": 6.284536082474227, "grad_norm": 1.46875, "learning_rate": 0.00018851740422487829, "loss": 5.0386, "mean_token_accuracy": 0.21738290190696716, "num_tokens": 140093027.0, "step": 80775 }, { "entropy": 5.936559724807739, "epoch": 6.284925111845944, "grad_norm": 1.5625, "learning_rate": 0.00018849181839547164, "loss": 4.8356, "mean_token_accuracy": 0.2305673837661743, "num_tokens": 140101154.0, "step": 80780 }, { "entropy": 6.027870178222656, "epoch": 6.285314141217662, "grad_norm": 1.5703125, "learning_rate": 0.00018846623387868894, "loss": 4.9984, "mean_token_accuracy": 0.21781247556209565, "num_tokens": 140109337.0, "step": 80785 }, { "entropy": 5.913628387451172, "epoch": 6.28570317058938, "grad_norm": 1.4765625, "learning_rate": 0.00018844065067491844, "loss": 4.8583, "mean_token_accuracy": 0.227262507379055, "num_tokens": 140117985.0, "step": 80790 }, { "entropy": 5.970162296295166, "epoch": 6.2860921999610975, "grad_norm": 1.5078125, "learning_rate": 0.00018841506878454828, "loss": 4.8678, "mean_token_accuracy": 0.2258630007505417, "num_tokens": 140126804.0, "step": 80795 }, { "entropy": 5.919177913665772, "epoch": 6.286481229332814, "grad_norm": 1.4765625, "learning_rate": 0.00018838948820796664, "loss": 4.8507, "mean_token_accuracy": 0.23295949250459672, "num_tokens": 140136119.0, "step": 80800 }, { "entropy": 5.949384975433349, "epoch": 6.286870258704532, "grad_norm": 1.5625, "learning_rate": 0.00018836390894556165, "loss": 4.8956, "mean_token_accuracy": 0.21734274178743362, "num_tokens": 140144501.0, "step": 80805 }, { "entropy": 5.932889604568482, "epoch": 6.28725928807625, "grad_norm": 1.5546875, "learning_rate": 0.00018833833099772147, "loss": 4.9016, "mean_token_accuracy": 0.2223481386899948, "num_tokens": 140152867.0, "step": 80810 }, { "entropy": 5.99184284210205, "epoch": 6.287648317447967, "grad_norm": 1.578125, "learning_rate": 0.00018831275436483418, "loss": 4.9711, "mean_token_accuracy": 0.2218160003423691, "num_tokens": 140161262.0, "step": 80815 }, { "entropy": 5.956709623336792, "epoch": 6.288037346819685, "grad_norm": 1.5, "learning_rate": 0.00018828717904728788, "loss": 4.848, "mean_token_accuracy": 0.23468939810991288, "num_tokens": 140170471.0, "step": 80820 }, { "entropy": 5.97047758102417, "epoch": 6.288426376191403, "grad_norm": 1.4140625, "learning_rate": 0.00018826160504547063, "loss": 4.9328, "mean_token_accuracy": 0.22414567768573762, "num_tokens": 140179880.0, "step": 80825 }, { "entropy": 5.914414262771606, "epoch": 6.2888154055631205, "grad_norm": 1.5546875, "learning_rate": 0.00018823603235977043, "loss": 4.8364, "mean_token_accuracy": 0.22690450102090837, "num_tokens": 140188273.0, "step": 80830 }, { "entropy": 5.961648273468017, "epoch": 6.289204434934837, "grad_norm": 1.4296875, "learning_rate": 0.00018821046099057532, "loss": 4.9841, "mean_token_accuracy": 0.21643772423267366, "num_tokens": 140197522.0, "step": 80835 }, { "entropy": 5.940830087661743, "epoch": 6.289593464306555, "grad_norm": 1.578125, "learning_rate": 0.00018818489093827334, "loss": 4.8976, "mean_token_accuracy": 0.22867703139781953, "num_tokens": 140205998.0, "step": 80840 }, { "entropy": 5.998374032974243, "epoch": 6.289982493678273, "grad_norm": 1.671875, "learning_rate": 0.00018815932220325239, "loss": 5.006, "mean_token_accuracy": 0.21155470609664917, "num_tokens": 140214454.0, "step": 80845 }, { "entropy": 5.927531003952026, "epoch": 6.29037152304999, "grad_norm": 1.65625, "learning_rate": 0.0001881337547859006, "loss": 4.7898, "mean_token_accuracy": 0.23194326609373092, "num_tokens": 140222571.0, "step": 80850 }, { "entropy": 5.961789560317993, "epoch": 6.290760552421708, "grad_norm": 1.546875, "learning_rate": 0.00018810818868660585, "loss": 5.0013, "mean_token_accuracy": 0.21660682260990144, "num_tokens": 140231857.0, "step": 80855 }, { "entropy": 6.009832382202148, "epoch": 6.291149581793426, "grad_norm": 1.5625, "learning_rate": 0.00018808262390575598, "loss": 4.9434, "mean_token_accuracy": 0.2226993039250374, "num_tokens": 140240351.0, "step": 80860 }, { "entropy": 5.9814859390258786, "epoch": 6.291538611165143, "grad_norm": 1.5625, "learning_rate": 0.00018805706044373893, "loss": 4.911, "mean_token_accuracy": 0.22355422079563142, "num_tokens": 140248609.0, "step": 80865 }, { "entropy": 5.9399346828460695, "epoch": 6.29192764053686, "grad_norm": 1.4921875, "learning_rate": 0.00018803149830094268, "loss": 4.9285, "mean_token_accuracy": 0.22252807021141052, "num_tokens": 140257716.0, "step": 80870 }, { "entropy": 6.000695276260376, "epoch": 6.292316669908578, "grad_norm": 1.6171875, "learning_rate": 0.00018800593747775492, "loss": 4.9356, "mean_token_accuracy": 0.22589959502220153, "num_tokens": 140265986.0, "step": 80875 }, { "entropy": 5.962469482421875, "epoch": 6.292705699280296, "grad_norm": 1.5703125, "learning_rate": 0.00018798037797456368, "loss": 4.8821, "mean_token_accuracy": 0.22734427601099014, "num_tokens": 140274633.0, "step": 80880 }, { "entropy": 5.894175481796265, "epoch": 6.293094728652013, "grad_norm": 1.5390625, "learning_rate": 0.0001879548197917566, "loss": 4.8859, "mean_token_accuracy": 0.225224170088768, "num_tokens": 140282962.0, "step": 80885 }, { "entropy": 5.9517113208770756, "epoch": 6.293483758023731, "grad_norm": 1.6796875, "learning_rate": 0.00018792926292972168, "loss": 4.9335, "mean_token_accuracy": 0.21829790771007537, "num_tokens": 140290945.0, "step": 80890 }, { "entropy": 5.998342800140381, "epoch": 6.293872787395449, "grad_norm": 1.53125, "learning_rate": 0.00018790370738884653, "loss": 4.9283, "mean_token_accuracy": 0.21716422736644744, "num_tokens": 140299536.0, "step": 80895 }, { "entropy": 6.004630184173584, "epoch": 6.294261816767166, "grad_norm": 1.421875, "learning_rate": 0.00018787815316951905, "loss": 4.9644, "mean_token_accuracy": 0.2159113645553589, "num_tokens": 140308792.0, "step": 80900 }, { "entropy": 5.984836721420288, "epoch": 6.294650846138883, "grad_norm": 1.5546875, "learning_rate": 0.00018785260027212692, "loss": 4.8762, "mean_token_accuracy": 0.22321363687515258, "num_tokens": 140317128.0, "step": 80905 }, { "entropy": 5.969964694976807, "epoch": 6.295039875510601, "grad_norm": 1.6015625, "learning_rate": 0.0001878270486970578, "loss": 4.8777, "mean_token_accuracy": 0.22675697058439254, "num_tokens": 140326127.0, "step": 80910 }, { "entropy": 5.995491552352905, "epoch": 6.295428904882319, "grad_norm": 1.4921875, "learning_rate": 0.00018780149844469958, "loss": 4.9957, "mean_token_accuracy": 0.21455106884241104, "num_tokens": 140335037.0, "step": 80915 }, { "entropy": 5.926424789428711, "epoch": 6.295817934254036, "grad_norm": 1.6484375, "learning_rate": 0.00018777594951543974, "loss": 4.9324, "mean_token_accuracy": 0.2206193298101425, "num_tokens": 140343517.0, "step": 80920 }, { "entropy": 5.91227536201477, "epoch": 6.296206963625754, "grad_norm": 1.484375, "learning_rate": 0.00018775040190966607, "loss": 4.9261, "mean_token_accuracy": 0.22226907759904863, "num_tokens": 140352211.0, "step": 80925 }, { "entropy": 5.988093471527099, "epoch": 6.296595992997471, "grad_norm": 1.6171875, "learning_rate": 0.0001877248556277662, "loss": 5.001, "mean_token_accuracy": 0.21614395529031755, "num_tokens": 140360833.0, "step": 80930 }, { "entropy": 5.9014129638671875, "epoch": 6.296985022369189, "grad_norm": 1.3984375, "learning_rate": 0.00018769931067012775, "loss": 4.854, "mean_token_accuracy": 0.22745656073093415, "num_tokens": 140369432.0, "step": 80935 }, { "entropy": 6.006623697280884, "epoch": 6.297374051740906, "grad_norm": 1.5546875, "learning_rate": 0.00018767376703713828, "loss": 4.8647, "mean_token_accuracy": 0.21761720776557922, "num_tokens": 140378443.0, "step": 80940 }, { "entropy": 6.02153639793396, "epoch": 6.297763081112624, "grad_norm": 1.65625, "learning_rate": 0.00018764822472918535, "loss": 4.9854, "mean_token_accuracy": 0.21534970849752427, "num_tokens": 140386393.0, "step": 80945 }, { "entropy": 6.033579969406128, "epoch": 6.298152110484342, "grad_norm": 1.5625, "learning_rate": 0.00018762268374665665, "loss": 5.0022, "mean_token_accuracy": 0.2141214519739151, "num_tokens": 140395104.0, "step": 80950 }, { "entropy": 5.93167929649353, "epoch": 6.298541139856059, "grad_norm": 1.484375, "learning_rate": 0.00018759714408993962, "loss": 4.8701, "mean_token_accuracy": 0.22129660099744797, "num_tokens": 140403363.0, "step": 80955 }, { "entropy": 6.032492828369141, "epoch": 6.298930169227777, "grad_norm": 1.59375, "learning_rate": 0.00018757160575942183, "loss": 5.0259, "mean_token_accuracy": 0.21868330538272857, "num_tokens": 140411803.0, "step": 80960 }, { "entropy": 5.929594469070435, "epoch": 6.299319198599494, "grad_norm": 1.515625, "learning_rate": 0.00018754606875549074, "loss": 4.8379, "mean_token_accuracy": 0.2273387908935547, "num_tokens": 140420906.0, "step": 80965 }, { "entropy": 5.994311714172364, "epoch": 6.2997082279712115, "grad_norm": 1.484375, "learning_rate": 0.00018752053307853384, "loss": 4.9432, "mean_token_accuracy": 0.22033000290393828, "num_tokens": 140429855.0, "step": 80970 }, { "entropy": 5.994245338439941, "epoch": 6.300097257342929, "grad_norm": 1.5234375, "learning_rate": 0.0001874949987289386, "loss": 4.9027, "mean_token_accuracy": 0.21899940818548203, "num_tokens": 140439146.0, "step": 80975 }, { "entropy": 5.996577739715576, "epoch": 6.300486286714647, "grad_norm": 1.6171875, "learning_rate": 0.0001874694657070925, "loss": 4.915, "mean_token_accuracy": 0.22597428113222123, "num_tokens": 140447273.0, "step": 80980 }, { "entropy": 6.0153467655181885, "epoch": 6.300875316086365, "grad_norm": 1.5703125, "learning_rate": 0.00018744393401338294, "loss": 4.9764, "mean_token_accuracy": 0.21441719084978103, "num_tokens": 140456034.0, "step": 80985 }, { "entropy": 5.9779167652130125, "epoch": 6.301264345458082, "grad_norm": 1.6015625, "learning_rate": 0.00018741840364819735, "loss": 4.9403, "mean_token_accuracy": 0.2276265099644661, "num_tokens": 140464175.0, "step": 80990 }, { "entropy": 5.889973163604736, "epoch": 6.3016533748298, "grad_norm": 1.5078125, "learning_rate": 0.00018739287461192307, "loss": 4.8545, "mean_token_accuracy": 0.22926456183195115, "num_tokens": 140472764.0, "step": 80995 }, { "entropy": 5.898661327362061, "epoch": 6.302042404201517, "grad_norm": 1.5390625, "learning_rate": 0.00018736734690494745, "loss": 4.8479, "mean_token_accuracy": 0.22817789912223815, "num_tokens": 140482232.0, "step": 81000 }, { "epoch": 6.302042404201517, "eval_entropy": 5.681481358727317, "eval_loss": 5.041774272918701, "eval_mean_token_accuracy": 0.22452311488988883, "eval_num_tokens": 140482232.0, "eval_runtime": 21.6624, "eval_samples_per_second": 1918.443, "eval_steps_per_second": 239.817, "step": 81000 } ], "logging_steps": 5, "max_steps": 128520, "num_input_tokens_seen": 0, "num_train_epochs": 10, "save_steps": 3000, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 2.827511094352896e+16, "train_batch_size": 16, "trial_name": null, "trial_params": null }