{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.17504959738592601, "eval_steps": 500, "global_step": 3000, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 10.69196834564209, "epoch": 0.00029174932897654333, "grad_norm": 13.0625, "learning_rate": 2e-06, "loss": 10.8036, "mean_token_accuracy": 0.0, "num_tokens": 9376.0, "step": 5 }, { "entropy": 10.691983699798584, "epoch": 0.0005834986579530867, "grad_norm": 13.0625, "learning_rate": 4.5e-06, "loss": 10.7354, "mean_token_accuracy": 0.00011641443707048893, "num_tokens": 18416.0, "step": 10 }, { "entropy": 10.690966510772705, "epoch": 0.00087524798692963, "grad_norm": 10.0625, "learning_rate": 7e-06, "loss": 10.5172, "mean_token_accuracy": 0.029424548242241146, "num_tokens": 27778.0, "step": 15 }, { "entropy": 10.678794956207275, "epoch": 0.0011669973159061733, "grad_norm": 5.90625, "learning_rate": 9.5e-06, "loss": 10.2454, "mean_token_accuracy": 0.04061399847269058, "num_tokens": 37698.0, "step": 20 }, { "entropy": 10.63073034286499, "epoch": 0.0014587466448827168, "grad_norm": 4.1875, "learning_rate": 1.2e-05, "loss": 9.9716, "mean_token_accuracy": 0.04182791076600552, "num_tokens": 47412.0, "step": 25 }, { "entropy": 10.602538585662842, "epoch": 0.00175049597385926, "grad_norm": 3.21875, "learning_rate": 1.4500000000000002e-05, "loss": 9.7862, "mean_token_accuracy": 0.04080851711332798, "num_tokens": 56226.0, "step": 30 }, { "entropy": 10.595691585540772, "epoch": 0.0020422453028358036, "grad_norm": 2.859375, "learning_rate": 1.7000000000000003e-05, "loss": 9.6992, "mean_token_accuracy": 0.04258432537317276, "num_tokens": 65953.0, "step": 35 }, { "entropy": 10.587265396118164, "epoch": 0.0023339946318123466, "grad_norm": 2.703125, "learning_rate": 1.95e-05, "loss": 9.6666, "mean_token_accuracy": 0.040068139880895616, "num_tokens": 74939.0, "step": 40 }, { "entropy": 10.5896146774292, "epoch": 0.00262574396078889, "grad_norm": 2.5625, "learning_rate": 2.2e-05, "loss": 9.6425, "mean_token_accuracy": 0.04199751690030098, "num_tokens": 83855.0, "step": 45 }, { "entropy": 10.573621463775634, "epoch": 0.0029174932897654336, "grad_norm": 2.359375, "learning_rate": 2.4500000000000003e-05, "loss": 9.5754, "mean_token_accuracy": 0.045654605329036715, "num_tokens": 93561.0, "step": 50 }, { "entropy": 10.557998752593994, "epoch": 0.003209242618741977, "grad_norm": 2.1875, "learning_rate": 2.7e-05, "loss": 9.479, "mean_token_accuracy": 0.05661129578948021, "num_tokens": 103395.0, "step": 55 }, { "entropy": 10.49096736907959, "epoch": 0.00350099194771852, "grad_norm": 2.40625, "learning_rate": 2.95e-05, "loss": 9.4209, "mean_token_accuracy": 0.05532712675631046, "num_tokens": 112462.0, "step": 60 }, { "entropy": 10.353149223327637, "epoch": 0.0037927412766950636, "grad_norm": 2.34375, "learning_rate": 3.2e-05, "loss": 9.3195, "mean_token_accuracy": 0.05394121035933495, "num_tokens": 121553.0, "step": 65 }, { "entropy": 10.451189041137695, "epoch": 0.004084490605671607, "grad_norm": 2.234375, "learning_rate": 3.4500000000000005e-05, "loss": 9.2945, "mean_token_accuracy": 0.05459350645542145, "num_tokens": 131138.0, "step": 70 }, { "entropy": 10.415141296386718, "epoch": 0.00437623993464815, "grad_norm": 2.140625, "learning_rate": 3.7e-05, "loss": 9.2235, "mean_token_accuracy": 0.05688905864953995, "num_tokens": 140171.0, "step": 75 }, { "entropy": 10.439569473266602, "epoch": 0.004667989263624693, "grad_norm": 2.046875, "learning_rate": 3.95e-05, "loss": 9.0989, "mean_token_accuracy": 0.055916853994131085, "num_tokens": 149483.0, "step": 80 }, { "entropy": 10.392880725860596, "epoch": 0.004959738592601237, "grad_norm": 1.8984375, "learning_rate": 4.2000000000000004e-05, "loss": 9.0805, "mean_token_accuracy": 0.05239327773451805, "num_tokens": 159190.0, "step": 85 }, { "entropy": 10.381812000274659, "epoch": 0.00525148792157778, "grad_norm": 1.84375, "learning_rate": 4.45e-05, "loss": 8.9431, "mean_token_accuracy": 0.05531255267560482, "num_tokens": 169601.0, "step": 90 }, { "entropy": 10.296150207519531, "epoch": 0.005543237250554324, "grad_norm": 1.9765625, "learning_rate": 4.7000000000000004e-05, "loss": 8.8622, "mean_token_accuracy": 0.057431581988930704, "num_tokens": 179268.0, "step": 95 }, { "entropy": 10.249444198608398, "epoch": 0.005834986579530867, "grad_norm": 2.875, "learning_rate": 4.9500000000000004e-05, "loss": 8.7591, "mean_token_accuracy": 0.05835646912455559, "num_tokens": 188699.0, "step": 100 }, { "entropy": 10.191282558441163, "epoch": 0.00612673590850741, "grad_norm": 1.8359375, "learning_rate": 5.2e-05, "loss": 8.6842, "mean_token_accuracy": 0.05705415904521942, "num_tokens": 199939.0, "step": 105 }, { "entropy": 10.147027969360352, "epoch": 0.006418485237483954, "grad_norm": 2.0, "learning_rate": 5.45e-05, "loss": 8.5501, "mean_token_accuracy": 0.06250228881835937, "num_tokens": 209419.0, "step": 110 }, { "entropy": 10.024614429473877, "epoch": 0.006710234566460497, "grad_norm": 1.9375, "learning_rate": 5.7e-05, "loss": 8.4704, "mean_token_accuracy": 0.06286126635968685, "num_tokens": 218642.0, "step": 115 }, { "entropy": 9.988630104064942, "epoch": 0.00700198389543704, "grad_norm": 1.640625, "learning_rate": 5.9499999999999996e-05, "loss": 8.3393, "mean_token_accuracy": 0.061313451081514356, "num_tokens": 228358.0, "step": 120 }, { "entropy": 9.84273166656494, "epoch": 0.007293733224413584, "grad_norm": 1.875, "learning_rate": 6.2e-05, "loss": 8.1163, "mean_token_accuracy": 0.0694800227880478, "num_tokens": 237860.0, "step": 125 }, { "entropy": 9.692254257202148, "epoch": 0.007585482553390127, "grad_norm": 1.5625, "learning_rate": 6.450000000000001e-05, "loss": 8.1599, "mean_token_accuracy": 0.06262776851654053, "num_tokens": 247547.0, "step": 130 }, { "entropy": 9.467087554931641, "epoch": 0.007877231882366671, "grad_norm": 1.6015625, "learning_rate": 6.7e-05, "loss": 8.0195, "mean_token_accuracy": 0.07063104063272477, "num_tokens": 256405.0, "step": 135 }, { "entropy": 9.383435821533203, "epoch": 0.008168981211343214, "grad_norm": 1.421875, "learning_rate": 6.950000000000001e-05, "loss": 7.9616, "mean_token_accuracy": 0.06774205490946769, "num_tokens": 265249.0, "step": 140 }, { "entropy": 9.17911729812622, "epoch": 0.008460730540319757, "grad_norm": 1.2265625, "learning_rate": 7.2e-05, "loss": 7.8784, "mean_token_accuracy": 0.0681417278945446, "num_tokens": 275681.0, "step": 145 }, { "entropy": 8.988021278381348, "epoch": 0.0087524798692963, "grad_norm": 1.4453125, "learning_rate": 7.45e-05, "loss": 7.7636, "mean_token_accuracy": 0.07039406709372997, "num_tokens": 284957.0, "step": 150 }, { "entropy": 8.73282070159912, "epoch": 0.009044229198272843, "grad_norm": 1.390625, "learning_rate": 7.7e-05, "loss": 7.6563, "mean_token_accuracy": 0.07246890291571617, "num_tokens": 294010.0, "step": 155 }, { "entropy": 8.682876682281494, "epoch": 0.009335978527249386, "grad_norm": 1.125, "learning_rate": 7.950000000000001e-05, "loss": 7.7148, "mean_token_accuracy": 0.07290182597935199, "num_tokens": 303264.0, "step": 160 }, { "entropy": 8.486510944366454, "epoch": 0.009627727856225931, "grad_norm": 1.203125, "learning_rate": 8.2e-05, "loss": 7.5966, "mean_token_accuracy": 0.07415391989052296, "num_tokens": 313450.0, "step": 165 }, { "entropy": 8.362883186340332, "epoch": 0.009919477185202474, "grad_norm": 1.2265625, "learning_rate": 8.450000000000001e-05, "loss": 7.5375, "mean_token_accuracy": 0.07450749576091767, "num_tokens": 322764.0, "step": 170 }, { "entropy": 8.276646995544434, "epoch": 0.010211226514179017, "grad_norm": 1.296875, "learning_rate": 8.7e-05, "loss": 7.5492, "mean_token_accuracy": 0.07559143453836441, "num_tokens": 332228.0, "step": 175 }, { "entropy": 8.189496421813965, "epoch": 0.01050297584315556, "grad_norm": 1.296875, "learning_rate": 8.95e-05, "loss": 7.4578, "mean_token_accuracy": 0.07792975381016731, "num_tokens": 341589.0, "step": 180 }, { "entropy": 8.08325457572937, "epoch": 0.010794725172132104, "grad_norm": 1.09375, "learning_rate": 9.2e-05, "loss": 7.3998, "mean_token_accuracy": 0.07972711473703384, "num_tokens": 351166.0, "step": 185 }, { "entropy": 8.023299407958984, "epoch": 0.011086474501108648, "grad_norm": 1.25, "learning_rate": 9.45e-05, "loss": 7.4712, "mean_token_accuracy": 0.07630453184247017, "num_tokens": 360962.0, "step": 190 }, { "entropy": 7.986406993865967, "epoch": 0.011378223830085191, "grad_norm": 1.28125, "learning_rate": 9.7e-05, "loss": 7.4208, "mean_token_accuracy": 0.07656608372926713, "num_tokens": 370859.0, "step": 195 }, { "entropy": 7.958215236663818, "epoch": 0.011669973159061734, "grad_norm": 1.390625, "learning_rate": 9.95e-05, "loss": 7.4388, "mean_token_accuracy": 0.07721348851919174, "num_tokens": 381017.0, "step": 200 }, { "entropy": 7.953992605209351, "epoch": 0.011961722488038277, "grad_norm": 1.234375, "learning_rate": 0.000102, "loss": 7.4808, "mean_token_accuracy": 0.07665727399289608, "num_tokens": 390849.0, "step": 205 }, { "entropy": 7.941216659545899, "epoch": 0.01225347181701482, "grad_norm": 1.1171875, "learning_rate": 0.00010449999999999999, "loss": 7.4537, "mean_token_accuracy": 0.07717064693570137, "num_tokens": 401131.0, "step": 210 }, { "entropy": 7.940151929855347, "epoch": 0.012545221145991364, "grad_norm": 1.2109375, "learning_rate": 0.000107, "loss": 7.3567, "mean_token_accuracy": 0.07789909988641738, "num_tokens": 410171.0, "step": 215 }, { "entropy": 7.845122528076172, "epoch": 0.012836970474967908, "grad_norm": 1.3984375, "learning_rate": 0.0001095, "loss": 7.4298, "mean_token_accuracy": 0.07820538356900215, "num_tokens": 419352.0, "step": 220 }, { "entropy": 7.826071691513062, "epoch": 0.013128719803944451, "grad_norm": 1.0625, "learning_rate": 0.000112, "loss": 7.2948, "mean_token_accuracy": 0.08607594929635524, "num_tokens": 428862.0, "step": 225 }, { "entropy": 7.802604389190674, "epoch": 0.013420469132920994, "grad_norm": 1.140625, "learning_rate": 0.0001145, "loss": 7.2856, "mean_token_accuracy": 0.07789736986160278, "num_tokens": 438900.0, "step": 230 }, { "entropy": 7.759540748596192, "epoch": 0.013712218461897538, "grad_norm": 1.25, "learning_rate": 0.00011700000000000001, "loss": 7.2419, "mean_token_accuracy": 0.08156893700361252, "num_tokens": 447867.0, "step": 235 }, { "entropy": 7.753300333023072, "epoch": 0.01400396779087408, "grad_norm": 1.21875, "learning_rate": 0.00011949999999999999, "loss": 7.3329, "mean_token_accuracy": 0.074883484095335, "num_tokens": 457978.0, "step": 240 }, { "entropy": 7.775896072387695, "epoch": 0.014295717119850624, "grad_norm": 1.203125, "learning_rate": 0.000122, "loss": 7.2889, "mean_token_accuracy": 0.08151891827583313, "num_tokens": 466846.0, "step": 245 }, { "entropy": 7.732866048812866, "epoch": 0.014587466448827168, "grad_norm": 1.3515625, "learning_rate": 0.0001245, "loss": 7.2876, "mean_token_accuracy": 0.07967406883835793, "num_tokens": 475862.0, "step": 250 }, { "entropy": 7.682526159286499, "epoch": 0.014879215777803712, "grad_norm": 1.21875, "learning_rate": 0.000127, "loss": 7.3177, "mean_token_accuracy": 0.0773643635213375, "num_tokens": 486088.0, "step": 255 }, { "entropy": 7.789633178710938, "epoch": 0.015170965106780255, "grad_norm": 1.140625, "learning_rate": 0.0001295, "loss": 7.19, "mean_token_accuracy": 0.0791048213839531, "num_tokens": 495515.0, "step": 260 }, { "entropy": 7.739433479309082, "epoch": 0.015462714435756798, "grad_norm": 1.3125, "learning_rate": 0.000132, "loss": 7.314, "mean_token_accuracy": 0.07758257985115051, "num_tokens": 505617.0, "step": 265 }, { "entropy": 7.701812362670898, "epoch": 0.015754463764733342, "grad_norm": 1.078125, "learning_rate": 0.00013450000000000002, "loss": 7.2826, "mean_token_accuracy": 0.07801382765173911, "num_tokens": 515977.0, "step": 270 }, { "entropy": 7.724566078186035, "epoch": 0.016046213093709884, "grad_norm": 1.1171875, "learning_rate": 0.00013700000000000002, "loss": 7.3384, "mean_token_accuracy": 0.08092856109142303, "num_tokens": 526525.0, "step": 275 }, { "entropy": 7.645784378051758, "epoch": 0.01633796242268643, "grad_norm": 1.1484375, "learning_rate": 0.0001395, "loss": 7.2771, "mean_token_accuracy": 0.08373014777898788, "num_tokens": 536494.0, "step": 280 }, { "entropy": 7.622757911682129, "epoch": 0.01662971175166297, "grad_norm": 1.3203125, "learning_rate": 0.00014199999999999998, "loss": 7.3146, "mean_token_accuracy": 0.08114334717392921, "num_tokens": 545326.0, "step": 285 }, { "entropy": 7.662983512878418, "epoch": 0.016921461080639515, "grad_norm": 1.484375, "learning_rate": 0.0001445, "loss": 7.1416, "mean_token_accuracy": 0.08460377976298332, "num_tokens": 553678.0, "step": 290 }, { "entropy": 7.63046498298645, "epoch": 0.01721321040961606, "grad_norm": 1.46875, "learning_rate": 0.000147, "loss": 7.2891, "mean_token_accuracy": 0.08224759995937347, "num_tokens": 563860.0, "step": 295 }, { "entropy": 7.621852588653565, "epoch": 0.0175049597385926, "grad_norm": 1.234375, "learning_rate": 0.0001495, "loss": 7.238, "mean_token_accuracy": 0.08669779226183891, "num_tokens": 572492.0, "step": 300 }, { "entropy": 7.564120435714722, "epoch": 0.017796709067569146, "grad_norm": 1.28125, "learning_rate": 0.000152, "loss": 7.1166, "mean_token_accuracy": 0.08243767246603965, "num_tokens": 581840.0, "step": 305 }, { "entropy": 7.6293127059936525, "epoch": 0.018088458396545687, "grad_norm": 1.09375, "learning_rate": 0.00015450000000000001, "loss": 7.2465, "mean_token_accuracy": 0.0864152580499649, "num_tokens": 591697.0, "step": 310 }, { "entropy": 7.534941625595093, "epoch": 0.01838020772552223, "grad_norm": 1.375, "learning_rate": 0.000157, "loss": 7.1059, "mean_token_accuracy": 0.0846880093216896, "num_tokens": 601153.0, "step": 315 }, { "entropy": 7.607311391830445, "epoch": 0.018671957054498773, "grad_norm": 1.1796875, "learning_rate": 0.0001595, "loss": 7.1949, "mean_token_accuracy": 0.08106868788599968, "num_tokens": 609516.0, "step": 320 }, { "entropy": 7.579704999923706, "epoch": 0.018963706383475318, "grad_norm": 1.109375, "learning_rate": 0.000162, "loss": 7.2078, "mean_token_accuracy": 0.07954892218112945, "num_tokens": 618836.0, "step": 325 }, { "entropy": 7.576669311523437, "epoch": 0.019255455712451863, "grad_norm": 1.25, "learning_rate": 0.00016450000000000001, "loss": 7.2136, "mean_token_accuracy": 0.08916370049118996, "num_tokens": 628223.0, "step": 330 }, { "entropy": 7.503057956695557, "epoch": 0.019547205041428404, "grad_norm": 1.171875, "learning_rate": 0.00016700000000000002, "loss": 7.1113, "mean_token_accuracy": 0.08817728385329246, "num_tokens": 637609.0, "step": 335 }, { "entropy": 7.545721530914307, "epoch": 0.01983895437040495, "grad_norm": 1.1171875, "learning_rate": 0.00016950000000000003, "loss": 7.1296, "mean_token_accuracy": 0.08344640359282493, "num_tokens": 646652.0, "step": 340 }, { "entropy": 7.413992404937744, "epoch": 0.02013070369938149, "grad_norm": 1.328125, "learning_rate": 0.00017199999999999998, "loss": 7.137, "mean_token_accuracy": 0.08315069451928139, "num_tokens": 656238.0, "step": 345 }, { "entropy": 7.479533767700195, "epoch": 0.020422453028358035, "grad_norm": 1.3515625, "learning_rate": 0.00017449999999999999, "loss": 7.1428, "mean_token_accuracy": 0.08378953337669373, "num_tokens": 665148.0, "step": 350 }, { "entropy": 7.503499221801758, "epoch": 0.02071420235733458, "grad_norm": 1.3671875, "learning_rate": 0.000177, "loss": 7.049, "mean_token_accuracy": 0.08563587218523025, "num_tokens": 675192.0, "step": 355 }, { "entropy": 7.388577222824097, "epoch": 0.02100595168631112, "grad_norm": 1.265625, "learning_rate": 0.0001795, "loss": 7.0679, "mean_token_accuracy": 0.08425286635756493, "num_tokens": 684813.0, "step": 360 }, { "entropy": 7.496100616455078, "epoch": 0.021297701015287666, "grad_norm": 1.1484375, "learning_rate": 0.000182, "loss": 7.0952, "mean_token_accuracy": 0.08246167674660683, "num_tokens": 694545.0, "step": 365 }, { "entropy": 7.4700541496276855, "epoch": 0.021589450344264207, "grad_norm": 1.28125, "learning_rate": 0.0001845, "loss": 7.0857, "mean_token_accuracy": 0.08829364702105522, "num_tokens": 704312.0, "step": 370 }, { "entropy": 7.475095510482788, "epoch": 0.021881199673240752, "grad_norm": 1.265625, "learning_rate": 0.000187, "loss": 7.1189, "mean_token_accuracy": 0.08108639344573021, "num_tokens": 713743.0, "step": 375 }, { "entropy": 7.403366279602051, "epoch": 0.022172949002217297, "grad_norm": 1.2421875, "learning_rate": 0.0001895, "loss": 7.0088, "mean_token_accuracy": 0.08252720050513744, "num_tokens": 722497.0, "step": 380 }, { "entropy": 7.3469452381134035, "epoch": 0.022464698331193838, "grad_norm": 1.421875, "learning_rate": 0.000192, "loss": 6.9952, "mean_token_accuracy": 0.08496845439076424, "num_tokens": 731849.0, "step": 385 }, { "entropy": 7.4720964431762695, "epoch": 0.022756447660170383, "grad_norm": 1.1953125, "learning_rate": 0.0001945, "loss": 7.1709, "mean_token_accuracy": 0.08666181415319443, "num_tokens": 741345.0, "step": 390 }, { "entropy": 7.3531989574432375, "epoch": 0.023048196989146924, "grad_norm": 1.1953125, "learning_rate": 0.00019700000000000002, "loss": 7.1245, "mean_token_accuracy": 0.08187859356403351, "num_tokens": 751363.0, "step": 395 }, { "entropy": 7.323095083236694, "epoch": 0.02333994631812347, "grad_norm": 1.265625, "learning_rate": 0.00019950000000000002, "loss": 6.9475, "mean_token_accuracy": 0.08857285082340241, "num_tokens": 761174.0, "step": 400 }, { "entropy": 7.323359584808349, "epoch": 0.02363169564710001, "grad_norm": 1.2109375, "learning_rate": 0.000202, "loss": 6.9364, "mean_token_accuracy": 0.0823954962193966, "num_tokens": 770773.0, "step": 405 }, { "entropy": 7.241050577163696, "epoch": 0.023923444976076555, "grad_norm": 1.265625, "learning_rate": 0.00020449999999999998, "loss": 6.964, "mean_token_accuracy": 0.08706902638077736, "num_tokens": 780462.0, "step": 410 }, { "entropy": 7.354639291763306, "epoch": 0.0242151943050531, "grad_norm": 1.171875, "learning_rate": 0.000207, "loss": 6.9719, "mean_token_accuracy": 0.08648092672228813, "num_tokens": 789822.0, "step": 415 }, { "entropy": 7.251240015029907, "epoch": 0.02450694363402964, "grad_norm": 1.1640625, "learning_rate": 0.0002095, "loss": 6.9392, "mean_token_accuracy": 0.08409521207213402, "num_tokens": 799724.0, "step": 420 }, { "entropy": 7.2920667171478275, "epoch": 0.024798692963006186, "grad_norm": 1.140625, "learning_rate": 0.000212, "loss": 7.0463, "mean_token_accuracy": 0.08510638326406479, "num_tokens": 809331.0, "step": 425 }, { "entropy": 7.488130569458008, "epoch": 0.025090442291982727, "grad_norm": 1.1015625, "learning_rate": 0.0002145, "loss": 7.057, "mean_token_accuracy": 0.08337506577372551, "num_tokens": 818665.0, "step": 430 }, { "entropy": 7.296667957305909, "epoch": 0.025382191620959272, "grad_norm": 1.234375, "learning_rate": 0.00021700000000000002, "loss": 6.9754, "mean_token_accuracy": 0.08416144661605358, "num_tokens": 828580.0, "step": 435 }, { "entropy": 7.240721750259399, "epoch": 0.025673940949935817, "grad_norm": 1.609375, "learning_rate": 0.0002195, "loss": 7.0171, "mean_token_accuracy": 0.08526882231235504, "num_tokens": 837661.0, "step": 440 }, { "entropy": 7.22621784210205, "epoch": 0.025965690278912358, "grad_norm": 1.21875, "learning_rate": 0.000222, "loss": 6.9839, "mean_token_accuracy": 0.08228468671441078, "num_tokens": 847069.0, "step": 445 }, { "entropy": 7.250874137878418, "epoch": 0.026257439607888903, "grad_norm": 1.1796875, "learning_rate": 0.0002245, "loss": 6.9794, "mean_token_accuracy": 0.08245958164334297, "num_tokens": 856743.0, "step": 450 }, { "entropy": 7.338770008087158, "epoch": 0.026549188936865444, "grad_norm": 1.2734375, "learning_rate": 0.00022700000000000002, "loss": 7.0198, "mean_token_accuracy": 0.08468568697571754, "num_tokens": 865502.0, "step": 455 }, { "entropy": 7.33205771446228, "epoch": 0.02684093826584199, "grad_norm": 1.1484375, "learning_rate": 0.00022950000000000002, "loss": 6.9651, "mean_token_accuracy": 0.0839608520269394, "num_tokens": 874178.0, "step": 460 }, { "entropy": 7.088795518875122, "epoch": 0.02713268759481853, "grad_norm": 1.234375, "learning_rate": 0.00023200000000000003, "loss": 6.8514, "mean_token_accuracy": 0.08765117079019547, "num_tokens": 883182.0, "step": 465 }, { "entropy": 7.3482073783874515, "epoch": 0.027424436923795075, "grad_norm": 1.234375, "learning_rate": 0.00023449999999999998, "loss": 6.9282, "mean_token_accuracy": 0.08807430192828178, "num_tokens": 891879.0, "step": 470 }, { "entropy": 7.25138897895813, "epoch": 0.02771618625277162, "grad_norm": 1.28125, "learning_rate": 0.000237, "loss": 6.9982, "mean_token_accuracy": 0.08774204924702644, "num_tokens": 901925.0, "step": 475 }, { "entropy": 7.124047946929932, "epoch": 0.02800793558174816, "grad_norm": 1.21875, "learning_rate": 0.0002395, "loss": 6.9424, "mean_token_accuracy": 0.08976237252354621, "num_tokens": 910609.0, "step": 480 }, { "entropy": 7.321299314498901, "epoch": 0.028299684910724706, "grad_norm": 1.2109375, "learning_rate": 0.000242, "loss": 7.0122, "mean_token_accuracy": 0.08504581227898597, "num_tokens": 919643.0, "step": 485 }, { "entropy": 7.123654794692993, "epoch": 0.028591434239701247, "grad_norm": 1.09375, "learning_rate": 0.0002445, "loss": 6.8913, "mean_token_accuracy": 0.0893466129899025, "num_tokens": 929160.0, "step": 490 }, { "entropy": 7.151027345657349, "epoch": 0.028883183568677792, "grad_norm": 1.1875, "learning_rate": 0.000247, "loss": 6.8194, "mean_token_accuracy": 0.09795917496085167, "num_tokens": 938329.0, "step": 495 }, { "entropy": 7.3193886280059814, "epoch": 0.029174932897654337, "grad_norm": 1.2265625, "learning_rate": 0.0002495, "loss": 7.1734, "mean_token_accuracy": 0.0849479891359806, "num_tokens": 947919.0, "step": 500 }, { "entropy": 7.266849994659424, "epoch": 0.029466682226630878, "grad_norm": 1.21875, "learning_rate": 0.000252, "loss": 6.9606, "mean_token_accuracy": 0.08843713030219078, "num_tokens": 957647.0, "step": 505 }, { "entropy": 7.076206827163697, "epoch": 0.029758431555607423, "grad_norm": 1.1640625, "learning_rate": 0.0002545, "loss": 6.8029, "mean_token_accuracy": 0.08850999772548676, "num_tokens": 966569.0, "step": 510 }, { "entropy": 7.057240724563599, "epoch": 0.030050180884583964, "grad_norm": 1.1875, "learning_rate": 0.000257, "loss": 6.8111, "mean_token_accuracy": 0.09094983339309692, "num_tokens": 976051.0, "step": 515 }, { "entropy": 7.113047027587891, "epoch": 0.03034193021356051, "grad_norm": 1.1015625, "learning_rate": 0.0002595, "loss": 6.8614, "mean_token_accuracy": 0.0857666164636612, "num_tokens": 985445.0, "step": 520 }, { "entropy": 7.186595869064331, "epoch": 0.03063367954253705, "grad_norm": 0.96875, "learning_rate": 0.000262, "loss": 6.9374, "mean_token_accuracy": 0.09131588712334633, "num_tokens": 995633.0, "step": 525 }, { "entropy": 7.1607764720916744, "epoch": 0.030925428871513595, "grad_norm": 1.1875, "learning_rate": 0.00026450000000000003, "loss": 6.9758, "mean_token_accuracy": 0.08313630521297455, "num_tokens": 1005518.0, "step": 530 }, { "entropy": 7.11238431930542, "epoch": 0.03121717820049014, "grad_norm": 1.1953125, "learning_rate": 0.00026700000000000004, "loss": 6.9041, "mean_token_accuracy": 0.08468850925564766, "num_tokens": 1014791.0, "step": 535 }, { "entropy": 7.10997519493103, "epoch": 0.031508927529466685, "grad_norm": 1.046875, "learning_rate": 0.00026950000000000005, "loss": 6.8947, "mean_token_accuracy": 0.09137562066316604, "num_tokens": 1024607.0, "step": 540 }, { "entropy": 7.005407094955444, "epoch": 0.031800676858443226, "grad_norm": 1.0625, "learning_rate": 0.00027200000000000005, "loss": 6.7183, "mean_token_accuracy": 0.09899639561772347, "num_tokens": 1034939.0, "step": 545 }, { "entropy": 7.011656808853149, "epoch": 0.03209242618741977, "grad_norm": 1.125, "learning_rate": 0.0002745, "loss": 6.7633, "mean_token_accuracy": 0.0912862703204155, "num_tokens": 1043982.0, "step": 550 }, { "entropy": 7.030924987792969, "epoch": 0.032384175516396316, "grad_norm": 1.015625, "learning_rate": 0.000277, "loss": 6.792, "mean_token_accuracy": 0.08782375603914261, "num_tokens": 1053519.0, "step": 555 }, { "entropy": 7.136856937408448, "epoch": 0.03267592484537286, "grad_norm": 1.1015625, "learning_rate": 0.0002795, "loss": 7.0022, "mean_token_accuracy": 0.08456368148326873, "num_tokens": 1064293.0, "step": 560 }, { "entropy": 7.047938442230224, "epoch": 0.0329676741743494, "grad_norm": 1.15625, "learning_rate": 0.00028199999999999997, "loss": 6.9196, "mean_token_accuracy": 0.08983817920088769, "num_tokens": 1074013.0, "step": 565 }, { "entropy": 7.060609769821167, "epoch": 0.03325942350332594, "grad_norm": 1.09375, "learning_rate": 0.0002845, "loss": 6.7375, "mean_token_accuracy": 0.09103487208485603, "num_tokens": 1084246.0, "step": 570 }, { "entropy": 7.055113077163696, "epoch": 0.03355117283230249, "grad_norm": 1.25, "learning_rate": 0.000287, "loss": 6.9214, "mean_token_accuracy": 0.08176419213414192, "num_tokens": 1093301.0, "step": 575 }, { "entropy": 7.076783752441406, "epoch": 0.03384292216127903, "grad_norm": 1.2265625, "learning_rate": 0.0002895, "loss": 6.9173, "mean_token_accuracy": 0.0938428908586502, "num_tokens": 1103001.0, "step": 580 }, { "entropy": 7.104855298995972, "epoch": 0.03413467149025557, "grad_norm": 1.1796875, "learning_rate": 0.000292, "loss": 6.8065, "mean_token_accuracy": 0.0953914389014244, "num_tokens": 1111233.0, "step": 585 }, { "entropy": 7.02773814201355, "epoch": 0.03442642081923212, "grad_norm": 1.0703125, "learning_rate": 0.0002945, "loss": 6.8948, "mean_token_accuracy": 0.085613664239645, "num_tokens": 1121254.0, "step": 590 }, { "entropy": 7.111239337921143, "epoch": 0.03471817014820866, "grad_norm": 1.2109375, "learning_rate": 0.000297, "loss": 6.9226, "mean_token_accuracy": 0.08546795472502708, "num_tokens": 1132420.0, "step": 595 }, { "entropy": 7.03243350982666, "epoch": 0.0350099194771852, "grad_norm": 1.265625, "learning_rate": 0.0002995, "loss": 6.8178, "mean_token_accuracy": 0.09553094804286957, "num_tokens": 1141582.0, "step": 600 }, { "entropy": 7.081856727600098, "epoch": 0.03530166880616174, "grad_norm": 1.0390625, "learning_rate": 0.000302, "loss": 6.9839, "mean_token_accuracy": 0.08826950266957283, "num_tokens": 1151756.0, "step": 605 }, { "entropy": 7.009781455993652, "epoch": 0.03559341813513829, "grad_norm": 1.1875, "learning_rate": 0.0003045, "loss": 6.7564, "mean_token_accuracy": 0.09513645693659782, "num_tokens": 1160624.0, "step": 610 }, { "entropy": 7.095517921447754, "epoch": 0.03588516746411483, "grad_norm": 1.2109375, "learning_rate": 0.000307, "loss": 6.8711, "mean_token_accuracy": 0.0887086771428585, "num_tokens": 1169713.0, "step": 615 }, { "entropy": 6.925157833099365, "epoch": 0.036176916793091374, "grad_norm": 1.265625, "learning_rate": 0.0003095, "loss": 6.7838, "mean_token_accuracy": 0.09514963701367378, "num_tokens": 1178983.0, "step": 620 }, { "entropy": 7.0570183277130125, "epoch": 0.03646866612206792, "grad_norm": 1.078125, "learning_rate": 0.000312, "loss": 6.8797, "mean_token_accuracy": 0.08803052604198455, "num_tokens": 1189103.0, "step": 625 }, { "entropy": 6.9957983016967775, "epoch": 0.03676041545104446, "grad_norm": 1.1640625, "learning_rate": 0.0003145, "loss": 6.8739, "mean_token_accuracy": 0.08884734362363815, "num_tokens": 1198249.0, "step": 630 }, { "entropy": 6.861308431625366, "epoch": 0.037052164780021005, "grad_norm": 0.94140625, "learning_rate": 0.000317, "loss": 6.7178, "mean_token_accuracy": 0.09863906130194663, "num_tokens": 1207946.0, "step": 635 }, { "entropy": 6.984153413772583, "epoch": 0.037343914108997546, "grad_norm": 1.171875, "learning_rate": 0.0003195, "loss": 6.8166, "mean_token_accuracy": 0.0928347222507, "num_tokens": 1218298.0, "step": 640 }, { "entropy": 7.125207710266113, "epoch": 0.037635663437974094, "grad_norm": 1.1015625, "learning_rate": 0.000322, "loss": 6.8759, "mean_token_accuracy": 0.08900825083255767, "num_tokens": 1228291.0, "step": 645 }, { "entropy": 6.95434799194336, "epoch": 0.037927412766950636, "grad_norm": 1.3046875, "learning_rate": 0.00032450000000000003, "loss": 6.7389, "mean_token_accuracy": 0.08987870886921882, "num_tokens": 1237106.0, "step": 650 }, { "entropy": 6.88364200592041, "epoch": 0.03821916209592718, "grad_norm": 1.1171875, "learning_rate": 0.00032700000000000003, "loss": 6.7234, "mean_token_accuracy": 0.0889329269528389, "num_tokens": 1246191.0, "step": 655 }, { "entropy": 6.868375635147094, "epoch": 0.038510911424903725, "grad_norm": 1.1015625, "learning_rate": 0.00032950000000000004, "loss": 6.6889, "mean_token_accuracy": 0.098920189589262, "num_tokens": 1256071.0, "step": 660 }, { "entropy": 6.872937250137329, "epoch": 0.038802660753880266, "grad_norm": 1.1796875, "learning_rate": 0.00033200000000000005, "loss": 6.7492, "mean_token_accuracy": 0.08766399398446083, "num_tokens": 1266495.0, "step": 665 }, { "entropy": 6.899469661712646, "epoch": 0.03909441008285681, "grad_norm": 1.25, "learning_rate": 0.00033450000000000005, "loss": 6.7863, "mean_token_accuracy": 0.09696677550673485, "num_tokens": 1275054.0, "step": 670 }, { "entropy": 6.993720483779907, "epoch": 0.039386159411833356, "grad_norm": 1.3046875, "learning_rate": 0.000337, "loss": 6.8245, "mean_token_accuracy": 0.09204187542200089, "num_tokens": 1284654.0, "step": 675 }, { "entropy": 6.815813589096069, "epoch": 0.0396779087408099, "grad_norm": 1.1796875, "learning_rate": 0.0003395, "loss": 6.7124, "mean_token_accuracy": 0.09631834179162979, "num_tokens": 1294080.0, "step": 680 }, { "entropy": 6.981986474990845, "epoch": 0.03996965806978644, "grad_norm": 1.2109375, "learning_rate": 0.000342, "loss": 6.7317, "mean_token_accuracy": 0.0942990817129612, "num_tokens": 1303578.0, "step": 685 }, { "entropy": 6.933795309066772, "epoch": 0.04026140739876298, "grad_norm": 1.171875, "learning_rate": 0.00034449999999999997, "loss": 6.8006, "mean_token_accuracy": 0.09185948371887206, "num_tokens": 1312690.0, "step": 690 }, { "entropy": 6.84517650604248, "epoch": 0.04055315672773953, "grad_norm": 1.125, "learning_rate": 0.000347, "loss": 6.7076, "mean_token_accuracy": 0.09742054864764213, "num_tokens": 1322356.0, "step": 695 }, { "entropy": 6.9569329738616945, "epoch": 0.04084490605671607, "grad_norm": 1.1640625, "learning_rate": 0.0003495, "loss": 6.7981, "mean_token_accuracy": 0.09365248009562492, "num_tokens": 1331343.0, "step": 700 }, { "entropy": 6.990424251556396, "epoch": 0.04113665538569261, "grad_norm": 1.03125, "learning_rate": 0.000352, "loss": 6.8491, "mean_token_accuracy": 0.0921269752085209, "num_tokens": 1341145.0, "step": 705 }, { "entropy": 6.963319873809814, "epoch": 0.04142840471466916, "grad_norm": 1.234375, "learning_rate": 0.0003545, "loss": 6.8309, "mean_token_accuracy": 0.09416978061199188, "num_tokens": 1350510.0, "step": 710 }, { "entropy": 6.865133380889892, "epoch": 0.0417201540436457, "grad_norm": 1.3359375, "learning_rate": 0.000357, "loss": 6.7864, "mean_token_accuracy": 0.09067512676119804, "num_tokens": 1359799.0, "step": 715 }, { "entropy": 6.878024053573609, "epoch": 0.04201190337262224, "grad_norm": 1.2109375, "learning_rate": 0.0003595, "loss": 6.8363, "mean_token_accuracy": 0.09358146041631699, "num_tokens": 1369443.0, "step": 720 }, { "entropy": 6.90676736831665, "epoch": 0.04230365270159878, "grad_norm": 1.1484375, "learning_rate": 0.000362, "loss": 6.685, "mean_token_accuracy": 0.09888828694820403, "num_tokens": 1379261.0, "step": 725 }, { "entropy": 6.881983280181885, "epoch": 0.04259540203057533, "grad_norm": 1.2421875, "learning_rate": 0.0003645, "loss": 6.7664, "mean_token_accuracy": 0.10230381861329078, "num_tokens": 1388451.0, "step": 730 }, { "entropy": 6.774169158935547, "epoch": 0.04288715135955187, "grad_norm": 0.96484375, "learning_rate": 0.000367, "loss": 6.7704, "mean_token_accuracy": 0.09487680047750473, "num_tokens": 1398191.0, "step": 735 }, { "entropy": 6.9481110095977785, "epoch": 0.043178900688528414, "grad_norm": 1.2265625, "learning_rate": 0.0003695, "loss": 6.7186, "mean_token_accuracy": 0.09421756863594055, "num_tokens": 1408276.0, "step": 740 }, { "entropy": 6.931284427642822, "epoch": 0.04347065001750496, "grad_norm": 1.03125, "learning_rate": 0.000372, "loss": 6.7896, "mean_token_accuracy": 0.09712609723210335, "num_tokens": 1417329.0, "step": 745 }, { "entropy": 6.8381664752960205, "epoch": 0.043762399346481504, "grad_norm": 1.1640625, "learning_rate": 0.0003745, "loss": 6.8117, "mean_token_accuracy": 0.09550364837050437, "num_tokens": 1426361.0, "step": 750 }, { "entropy": 6.8008181095123295, "epoch": 0.044054148675458045, "grad_norm": 1.2265625, "learning_rate": 0.000377, "loss": 6.6971, "mean_token_accuracy": 0.0986745998263359, "num_tokens": 1436292.0, "step": 755 }, { "entropy": 6.845808029174805, "epoch": 0.04434589800443459, "grad_norm": 1.09375, "learning_rate": 0.0003795, "loss": 6.5971, "mean_token_accuracy": 0.09895778745412827, "num_tokens": 1445518.0, "step": 760 }, { "entropy": 6.755419540405273, "epoch": 0.044637647333411135, "grad_norm": 1.046875, "learning_rate": 0.000382, "loss": 6.6102, "mean_token_accuracy": 0.1003187820315361, "num_tokens": 1456140.0, "step": 765 }, { "entropy": 6.721004772186279, "epoch": 0.044929396662387676, "grad_norm": 1.1171875, "learning_rate": 0.0003845, "loss": 6.7213, "mean_token_accuracy": 0.0939919888973236, "num_tokens": 1464997.0, "step": 770 }, { "entropy": 6.738425827026367, "epoch": 0.04522114599136422, "grad_norm": 1.0234375, "learning_rate": 0.00038700000000000003, "loss": 6.652, "mean_token_accuracy": 0.10241445153951645, "num_tokens": 1474687.0, "step": 775 }, { "entropy": 6.810252714157104, "epoch": 0.045512895320340765, "grad_norm": 1.03125, "learning_rate": 0.00038950000000000003, "loss": 6.7066, "mean_token_accuracy": 0.09432699158787727, "num_tokens": 1484826.0, "step": 780 }, { "entropy": 6.8092962265014645, "epoch": 0.04580464464931731, "grad_norm": 1.1640625, "learning_rate": 0.00039200000000000004, "loss": 6.7216, "mean_token_accuracy": 0.09401827231049538, "num_tokens": 1494200.0, "step": 785 }, { "entropy": 6.736168766021729, "epoch": 0.04609639397829385, "grad_norm": 1.1953125, "learning_rate": 0.00039450000000000005, "loss": 6.6461, "mean_token_accuracy": 0.10280982181429862, "num_tokens": 1503343.0, "step": 790 }, { "entropy": 6.672789764404297, "epoch": 0.046388143307270396, "grad_norm": 1.109375, "learning_rate": 0.00039700000000000005, "loss": 6.6333, "mean_token_accuracy": 0.10122447237372398, "num_tokens": 1511936.0, "step": 795 }, { "entropy": 6.843571376800537, "epoch": 0.04667989263624694, "grad_norm": 1.1015625, "learning_rate": 0.0003995, "loss": 6.6928, "mean_token_accuracy": 0.09420284777879714, "num_tokens": 1521692.0, "step": 800 }, { "entropy": 6.806577157974243, "epoch": 0.04697164196522348, "grad_norm": 1.265625, "learning_rate": 0.000402, "loss": 6.6285, "mean_token_accuracy": 0.09857678040862083, "num_tokens": 1530517.0, "step": 805 }, { "entropy": 6.741385078430175, "epoch": 0.04726339129420002, "grad_norm": 1.140625, "learning_rate": 0.0004045, "loss": 6.658, "mean_token_accuracy": 0.1008826494216919, "num_tokens": 1540037.0, "step": 810 }, { "entropy": 6.744747114181519, "epoch": 0.04755514062317657, "grad_norm": 1.09375, "learning_rate": 0.00040699999999999997, "loss": 6.673, "mean_token_accuracy": 0.1030520461499691, "num_tokens": 1549099.0, "step": 815 }, { "entropy": 6.728698205947876, "epoch": 0.04784688995215311, "grad_norm": 1.03125, "learning_rate": 0.0004095, "loss": 6.5874, "mean_token_accuracy": 0.10317010059952736, "num_tokens": 1559150.0, "step": 820 }, { "entropy": 6.691241073608398, "epoch": 0.04813863928112965, "grad_norm": 1.2265625, "learning_rate": 0.000412, "loss": 6.6829, "mean_token_accuracy": 0.09901780784130096, "num_tokens": 1567999.0, "step": 825 }, { "entropy": 6.715443181991577, "epoch": 0.0484303886101062, "grad_norm": 1.1796875, "learning_rate": 0.0004145, "loss": 6.7417, "mean_token_accuracy": 0.10948037281632424, "num_tokens": 1576600.0, "step": 830 }, { "entropy": 6.6703986644744875, "epoch": 0.04872213793908274, "grad_norm": 1.2109375, "learning_rate": 0.000417, "loss": 6.5241, "mean_token_accuracy": 0.1046327918767929, "num_tokens": 1586462.0, "step": 835 }, { "entropy": 6.64805235862732, "epoch": 0.04901388726805928, "grad_norm": 1.1171875, "learning_rate": 0.0004195, "loss": 6.6576, "mean_token_accuracy": 0.09610966295003891, "num_tokens": 1596159.0, "step": 840 }, { "entropy": 6.804348373413086, "epoch": 0.04930563659703582, "grad_norm": 1.1171875, "learning_rate": 0.000422, "loss": 6.6896, "mean_token_accuracy": 0.10318435579538346, "num_tokens": 1606010.0, "step": 845 }, { "entropy": 6.724388599395752, "epoch": 0.04959738592601237, "grad_norm": 1.1484375, "learning_rate": 0.0004245, "loss": 6.714, "mean_token_accuracy": 0.10009755790233613, "num_tokens": 1614968.0, "step": 850 }, { "entropy": 6.730385255813599, "epoch": 0.04988913525498891, "grad_norm": 1.1171875, "learning_rate": 0.000427, "loss": 6.5681, "mean_token_accuracy": 0.10025268271565438, "num_tokens": 1623895.0, "step": 855 }, { "entropy": 6.804841709136963, "epoch": 0.050180884583965454, "grad_norm": 1.1171875, "learning_rate": 0.0004295, "loss": 6.6844, "mean_token_accuracy": 0.09485859274864197, "num_tokens": 1633732.0, "step": 860 }, { "entropy": 6.677802991867066, "epoch": 0.050472633912942, "grad_norm": 0.98828125, "learning_rate": 0.000432, "loss": 6.65, "mean_token_accuracy": 0.10071519836783409, "num_tokens": 1643176.0, "step": 865 }, { "entropy": 6.67259259223938, "epoch": 0.050764383241918544, "grad_norm": 1.0859375, "learning_rate": 0.0004345, "loss": 6.7125, "mean_token_accuracy": 0.09944225549697876, "num_tokens": 1652652.0, "step": 870 }, { "entropy": 6.769341325759887, "epoch": 0.051056132570895085, "grad_norm": 1.09375, "learning_rate": 0.000437, "loss": 6.7087, "mean_token_accuracy": 0.09546388238668442, "num_tokens": 1661279.0, "step": 875 }, { "entropy": 6.785306167602539, "epoch": 0.051347881899871634, "grad_norm": 1.0234375, "learning_rate": 0.0004395, "loss": 6.7172, "mean_token_accuracy": 0.09483732208609581, "num_tokens": 1671254.0, "step": 880 }, { "entropy": 6.627253103256225, "epoch": 0.051639631228848175, "grad_norm": 1.1953125, "learning_rate": 0.000442, "loss": 6.4968, "mean_token_accuracy": 0.10113293752074241, "num_tokens": 1679921.0, "step": 885 }, { "entropy": 6.703667211532593, "epoch": 0.051931380557824716, "grad_norm": 1.0859375, "learning_rate": 0.0004445, "loss": 6.6159, "mean_token_accuracy": 0.10109170824289322, "num_tokens": 1689706.0, "step": 890 }, { "entropy": 6.751815223693848, "epoch": 0.05222312988680126, "grad_norm": 0.99609375, "learning_rate": 0.000447, "loss": 6.696, "mean_token_accuracy": 0.09690436124801635, "num_tokens": 1700322.0, "step": 895 }, { "entropy": 6.633773994445801, "epoch": 0.052514879215777806, "grad_norm": 1.171875, "learning_rate": 0.00044950000000000003, "loss": 6.574, "mean_token_accuracy": 0.10566928014159202, "num_tokens": 1709179.0, "step": 900 }, { "entropy": 6.579496812820435, "epoch": 0.05280662854475435, "grad_norm": 1.0859375, "learning_rate": 0.00045200000000000004, "loss": 6.528, "mean_token_accuracy": 0.10681467652320861, "num_tokens": 1718427.0, "step": 905 }, { "entropy": 6.682822132110596, "epoch": 0.05309837787373089, "grad_norm": 0.9609375, "learning_rate": 0.00045450000000000004, "loss": 6.5837, "mean_token_accuracy": 0.09797712191939353, "num_tokens": 1727930.0, "step": 910 }, { "entropy": 6.625987529754639, "epoch": 0.05339012720270744, "grad_norm": 1.1171875, "learning_rate": 0.00045700000000000005, "loss": 6.6188, "mean_token_accuracy": 0.10405138954520225, "num_tokens": 1737264.0, "step": 915 }, { "entropy": 6.602404928207397, "epoch": 0.05368187653168398, "grad_norm": 1.2265625, "learning_rate": 0.00045950000000000006, "loss": 6.5705, "mean_token_accuracy": 0.10319243893027305, "num_tokens": 1746388.0, "step": 920 }, { "entropy": 6.655055236816406, "epoch": 0.05397362586066052, "grad_norm": 1.03125, "learning_rate": 0.000462, "loss": 6.588, "mean_token_accuracy": 0.09976595863699914, "num_tokens": 1755992.0, "step": 925 }, { "entropy": 6.557945108413696, "epoch": 0.05426537518963706, "grad_norm": 1.2265625, "learning_rate": 0.0004645, "loss": 6.5948, "mean_token_accuracy": 0.1043360821902752, "num_tokens": 1765101.0, "step": 930 }, { "entropy": 6.608616828918457, "epoch": 0.05455712451861361, "grad_norm": 1.09375, "learning_rate": 0.000467, "loss": 6.518, "mean_token_accuracy": 0.10695041045546531, "num_tokens": 1773377.0, "step": 935 }, { "entropy": 6.7846527099609375, "epoch": 0.05484887384759015, "grad_norm": 1.0625, "learning_rate": 0.0004695, "loss": 6.685, "mean_token_accuracy": 0.09719114303588867, "num_tokens": 1782691.0, "step": 940 }, { "entropy": 6.581558084487915, "epoch": 0.05514062317656669, "grad_norm": 1.234375, "learning_rate": 0.000472, "loss": 6.6633, "mean_token_accuracy": 0.09527761414647103, "num_tokens": 1792327.0, "step": 945 }, { "entropy": 6.649594068527222, "epoch": 0.05543237250554324, "grad_norm": 1.0625, "learning_rate": 0.0004745, "loss": 6.6353, "mean_token_accuracy": 0.10013408064842225, "num_tokens": 1802419.0, "step": 950 }, { "entropy": 6.586823034286499, "epoch": 0.05572412183451978, "grad_norm": 1.09375, "learning_rate": 0.000477, "loss": 6.5391, "mean_token_accuracy": 0.10384995490312576, "num_tokens": 1811809.0, "step": 955 }, { "entropy": 6.593689727783203, "epoch": 0.05601587116349632, "grad_norm": 1.03125, "learning_rate": 0.0004795, "loss": 6.6023, "mean_token_accuracy": 0.1025864191353321, "num_tokens": 1820811.0, "step": 960 }, { "entropy": 6.703953552246094, "epoch": 0.05630762049247287, "grad_norm": 1.125, "learning_rate": 0.000482, "loss": 6.662, "mean_token_accuracy": 0.09310555234551429, "num_tokens": 1830646.0, "step": 965 }, { "entropy": 6.43831353187561, "epoch": 0.05659936982144941, "grad_norm": 1.1796875, "learning_rate": 0.0004845, "loss": 6.5116, "mean_token_accuracy": 0.10798174142837524, "num_tokens": 1839729.0, "step": 970 }, { "entropy": 6.744899940490723, "epoch": 0.05689111915042595, "grad_norm": 1.1484375, "learning_rate": 0.000487, "loss": 6.6372, "mean_token_accuracy": 0.09991811662912368, "num_tokens": 1848997.0, "step": 975 }, { "entropy": 6.513811635971069, "epoch": 0.057182868479402495, "grad_norm": 1.203125, "learning_rate": 0.0004895, "loss": 6.5616, "mean_token_accuracy": 0.10880497097969055, "num_tokens": 1859123.0, "step": 980 }, { "entropy": 6.667817068099976, "epoch": 0.05747461780837904, "grad_norm": 1.1015625, "learning_rate": 0.000492, "loss": 6.6949, "mean_token_accuracy": 0.11167361810803414, "num_tokens": 1868327.0, "step": 985 }, { "entropy": 6.558897924423218, "epoch": 0.057766367137355584, "grad_norm": 1.21875, "learning_rate": 0.0004945, "loss": 6.5809, "mean_token_accuracy": 0.1034304141998291, "num_tokens": 1877880.0, "step": 990 }, { "entropy": 6.661033344268799, "epoch": 0.058058116466332126, "grad_norm": 1.03125, "learning_rate": 0.000497, "loss": 6.5736, "mean_token_accuracy": 0.10090498700737953, "num_tokens": 1887331.0, "step": 995 }, { "entropy": 6.638740062713623, "epoch": 0.058349865795308674, "grad_norm": 1.0625, "learning_rate": 0.0004995, "loss": 6.6316, "mean_token_accuracy": 0.09878421947360039, "num_tokens": 1897343.0, "step": 1000 }, { "entropy": 6.650649118423462, "epoch": 0.058641615124285215, "grad_norm": 1.0390625, "learning_rate": 0.000499998026082006, "loss": 6.6473, "mean_token_accuracy": 0.10691011771559715, "num_tokens": 1906422.0, "step": 1005 }, { "entropy": 6.63336181640625, "epoch": 0.058933364453261756, "grad_norm": 1.0625, "learning_rate": 0.0004999900070995136, "loss": 6.671, "mean_token_accuracy": 0.1082217514514923, "num_tokens": 1916122.0, "step": 1010 }, { "entropy": 6.511569929122925, "epoch": 0.0592251137822383, "grad_norm": 1.1328125, "learning_rate": 0.0004999758199023239, "loss": 6.4567, "mean_token_accuracy": 0.10471461117267608, "num_tokens": 1924822.0, "step": 1015 }, { "entropy": 6.540279054641724, "epoch": 0.059516863111214846, "grad_norm": 1.2578125, "learning_rate": 0.0004999554648793858, "loss": 6.6222, "mean_token_accuracy": 0.10849541574716567, "num_tokens": 1934629.0, "step": 1020 }, { "entropy": 6.493051528930664, "epoch": 0.05980861244019139, "grad_norm": 1.1328125, "learning_rate": 0.0004999289425887425, "loss": 6.4939, "mean_token_accuracy": 0.10078425854444503, "num_tokens": 1943171.0, "step": 1025 }, { "entropy": 6.736955261230468, "epoch": 0.06010036176916793, "grad_norm": 1.03125, "learning_rate": 0.0004998962537575161, "loss": 6.648, "mean_token_accuracy": 0.10098663121461868, "num_tokens": 1953716.0, "step": 1030 }, { "entropy": 6.582661819458008, "epoch": 0.06039211109814448, "grad_norm": 1.1015625, "learning_rate": 0.0004998573992818874, "loss": 6.6512, "mean_token_accuracy": 0.10541167482733727, "num_tokens": 1962852.0, "step": 1035 }, { "entropy": 6.67156400680542, "epoch": 0.06068386042712102, "grad_norm": 1.125, "learning_rate": 0.0004998123802270715, "loss": 6.6404, "mean_token_accuracy": 0.10719699263572693, "num_tokens": 1971762.0, "step": 1040 }, { "entropy": 6.535550498962403, "epoch": 0.06097560975609756, "grad_norm": 1.125, "learning_rate": 0.0004997611978272886, "loss": 6.5646, "mean_token_accuracy": 0.10268182530999184, "num_tokens": 1981798.0, "step": 1045 }, { "entropy": 6.513294410705567, "epoch": 0.0612673590850741, "grad_norm": 1.046875, "learning_rate": 0.0004997038534857298, "loss": 6.4932, "mean_token_accuracy": 0.1034928672015667, "num_tokens": 1990479.0, "step": 1050 }, { "entropy": 6.672393798828125, "epoch": 0.06155910841405065, "grad_norm": 1.4375, "learning_rate": 0.0004996403487745194, "loss": 6.5911, "mean_token_accuracy": 0.10503169894218445, "num_tokens": 2000194.0, "step": 1055 }, { "entropy": 6.536614418029785, "epoch": 0.06185085774302719, "grad_norm": 1.0859375, "learning_rate": 0.000499570685434671, "loss": 6.6125, "mean_token_accuracy": 0.10448794513940811, "num_tokens": 2010806.0, "step": 1060 }, { "entropy": 6.543749761581421, "epoch": 0.06214260707200373, "grad_norm": 1.1484375, "learning_rate": 0.0004994948653760405, "loss": 6.5712, "mean_token_accuracy": 0.10555129945278167, "num_tokens": 2019811.0, "step": 1065 }, { "entropy": 6.564803409576416, "epoch": 0.06243435640098028, "grad_norm": 1.09375, "learning_rate": 0.0004994128906772729, "loss": 6.5333, "mean_token_accuracy": 0.10878547504544259, "num_tokens": 2028581.0, "step": 1070 }, { "entropy": 6.543899917602539, "epoch": 0.06272610572995682, "grad_norm": 1.2421875, "learning_rate": 0.000499324763585746, "loss": 6.555, "mean_token_accuracy": 0.10785453170537948, "num_tokens": 2037496.0, "step": 1075 }, { "entropy": 6.552090215682983, "epoch": 0.06301785505893337, "grad_norm": 1.1015625, "learning_rate": 0.0004992304865175085, "loss": 6.4859, "mean_token_accuracy": 0.1107458420097828, "num_tokens": 2046183.0, "step": 1080 }, { "entropy": 6.6219559669494625, "epoch": 0.0633096043879099, "grad_norm": 0.94921875, "learning_rate": 0.0004991300620572138, "loss": 6.6477, "mean_token_accuracy": 0.10132529735565185, "num_tokens": 2056360.0, "step": 1085 }, { "entropy": 6.406348085403442, "epoch": 0.06360135371688645, "grad_norm": 1.0234375, "learning_rate": 0.0004990234929580494, "loss": 6.4436, "mean_token_accuracy": 0.11206084564328193, "num_tokens": 2066139.0, "step": 1090 }, { "entropy": 6.533041286468506, "epoch": 0.063893103045863, "grad_norm": 1.09375, "learning_rate": 0.0004989107821416609, "loss": 6.5685, "mean_token_accuracy": 0.10588387921452522, "num_tokens": 2075284.0, "step": 1095 }, { "entropy": 6.4999213218688965, "epoch": 0.06418485237483953, "grad_norm": 1.1015625, "learning_rate": 0.0004987919326980723, "loss": 6.4587, "mean_token_accuracy": 0.10920145735144615, "num_tokens": 2084896.0, "step": 1100 }, { "entropy": 6.566693067550659, "epoch": 0.06447660170381608, "grad_norm": 1.15625, "learning_rate": 0.0004986669478856011, "loss": 6.5482, "mean_token_accuracy": 0.11378610283136367, "num_tokens": 2094149.0, "step": 1105 }, { "entropy": 6.5364597797393795, "epoch": 0.06476835103279263, "grad_norm": 0.96875, "learning_rate": 0.0004985358311307688, "loss": 6.6266, "mean_token_accuracy": 0.10551877319812775, "num_tokens": 2104527.0, "step": 1110 }, { "entropy": 6.542181444168091, "epoch": 0.06506010036176917, "grad_norm": 1.15625, "learning_rate": 0.0004983985860282081, "loss": 6.4897, "mean_token_accuracy": 0.10867034271359444, "num_tokens": 2113737.0, "step": 1115 }, { "entropy": 6.457909774780274, "epoch": 0.06535184969074571, "grad_norm": 1.0234375, "learning_rate": 0.0004982552163405623, "loss": 6.5155, "mean_token_accuracy": 0.11161521077156067, "num_tokens": 2123517.0, "step": 1120 }, { "entropy": 6.464603519439697, "epoch": 0.06564359901972225, "grad_norm": 0.99609375, "learning_rate": 0.0004981057259983839, "loss": 6.43, "mean_token_accuracy": 0.10833626836538315, "num_tokens": 2133389.0, "step": 1125 }, { "entropy": 6.695741128921509, "epoch": 0.0659353483486988, "grad_norm": 1.0703125, "learning_rate": 0.0004979501191000262, "loss": 6.6258, "mean_token_accuracy": 0.1069041796028614, "num_tokens": 2142569.0, "step": 1130 }, { "entropy": 6.528357124328613, "epoch": 0.06622709767767535, "grad_norm": 1.1875, "learning_rate": 0.0004977883999115311, "loss": 6.4632, "mean_token_accuracy": 0.10537031814455985, "num_tokens": 2151422.0, "step": 1135 }, { "entropy": 6.430627536773682, "epoch": 0.06651884700665188, "grad_norm": 1.0546875, "learning_rate": 0.0004976205728665113, "loss": 6.4825, "mean_token_accuracy": 0.10998515039682388, "num_tokens": 2160696.0, "step": 1140 }, { "entropy": 6.443187093734741, "epoch": 0.06681059633562843, "grad_norm": 0.93359375, "learning_rate": 0.0004974466425660307, "loss": 6.473, "mean_token_accuracy": 0.11025330871343612, "num_tokens": 2171333.0, "step": 1145 }, { "entropy": 6.476709651947021, "epoch": 0.06710234566460498, "grad_norm": 0.94921875, "learning_rate": 0.0004972666137784759, "loss": 6.4448, "mean_token_accuracy": 0.11565838381648064, "num_tokens": 2180755.0, "step": 1150 }, { "entropy": 6.591566276550293, "epoch": 0.06739409499358151, "grad_norm": 1.0390625, "learning_rate": 0.0004970804914394271, "loss": 6.5623, "mean_token_accuracy": 0.10833770707249642, "num_tokens": 2189805.0, "step": 1155 }, { "entropy": 6.487264585494995, "epoch": 0.06768584432255806, "grad_norm": 1.0546875, "learning_rate": 0.0004968882806515225, "loss": 6.4206, "mean_token_accuracy": 0.10597622171044349, "num_tokens": 2199696.0, "step": 1160 }, { "entropy": 6.503916501998901, "epoch": 0.0679775936515346, "grad_norm": 1.0078125, "learning_rate": 0.0004966899866843177, "loss": 6.5065, "mean_token_accuracy": 0.11296691745519638, "num_tokens": 2210667.0, "step": 1165 }, { "entropy": 6.4775800704956055, "epoch": 0.06826934298051114, "grad_norm": 1.015625, "learning_rate": 0.000496485614974142, "loss": 6.4924, "mean_token_accuracy": 0.11328694522380829, "num_tokens": 2219517.0, "step": 1170 }, { "entropy": 6.4405846118927, "epoch": 0.06856109230948769, "grad_norm": 0.9453125, "learning_rate": 0.0004962751711239492, "loss": 6.4377, "mean_token_accuracy": 0.10667010024189949, "num_tokens": 2228418.0, "step": 1175 }, { "entropy": 6.424973726272583, "epoch": 0.06885284163846424, "grad_norm": 1.046875, "learning_rate": 0.0004960586609031636, "loss": 6.4672, "mean_token_accuracy": 0.10987688899040222, "num_tokens": 2238787.0, "step": 1180 }, { "entropy": 6.491880607604981, "epoch": 0.06914459096744077, "grad_norm": 0.99609375, "learning_rate": 0.0004958360902475224, "loss": 6.4953, "mean_token_accuracy": 0.11162107959389686, "num_tokens": 2248750.0, "step": 1185 }, { "entropy": 6.446459341049194, "epoch": 0.06943634029641732, "grad_norm": 1.0234375, "learning_rate": 0.0004956074652589125, "loss": 6.4687, "mean_token_accuracy": 0.11494983360171318, "num_tokens": 2258250.0, "step": 1190 }, { "entropy": 6.443336868286133, "epoch": 0.06972808962539385, "grad_norm": 0.96484375, "learning_rate": 0.0004953727922052035, "loss": 6.4389, "mean_token_accuracy": 0.10993985310196877, "num_tokens": 2268149.0, "step": 1195 }, { "entropy": 6.5478602886199955, "epoch": 0.0700198389543704, "grad_norm": 1.21875, "learning_rate": 0.0004951320775200756, "loss": 6.4572, "mean_token_accuracy": 0.11372324377298355, "num_tokens": 2276746.0, "step": 1200 }, { "entropy": 6.315929794311524, "epoch": 0.07031158828334695, "grad_norm": 1.0234375, "learning_rate": 0.0004948853278028436, "loss": 6.3928, "mean_token_accuracy": 0.10992860049009323, "num_tokens": 2286192.0, "step": 1205 }, { "entropy": 6.42680606842041, "epoch": 0.07060333761232349, "grad_norm": 1.0, "learning_rate": 0.0004946325498182755, "loss": 6.3928, "mean_token_accuracy": 0.11117786765098572, "num_tokens": 2296087.0, "step": 1210 }, { "entropy": 6.398185729980469, "epoch": 0.07089508694130003, "grad_norm": 0.90234375, "learning_rate": 0.0004943737504964076, "loss": 6.4682, "mean_token_accuracy": 0.10990155264735221, "num_tokens": 2306219.0, "step": 1215 }, { "entropy": 6.4592015743255615, "epoch": 0.07118683627027658, "grad_norm": 1.0234375, "learning_rate": 0.000494108936932354, "loss": 6.4012, "mean_token_accuracy": 0.11408278942108155, "num_tokens": 2315171.0, "step": 1220 }, { "entropy": 6.316812133789062, "epoch": 0.07147858559925312, "grad_norm": 1.0, "learning_rate": 0.0004938381163861124, "loss": 6.267, "mean_token_accuracy": 0.1170704185962677, "num_tokens": 2323791.0, "step": 1225 }, { "entropy": 6.456182384490967, "epoch": 0.07177033492822966, "grad_norm": 1.03125, "learning_rate": 0.0004935612962823645, "loss": 6.3477, "mean_token_accuracy": 0.11591391935944557, "num_tokens": 2333242.0, "step": 1230 }, { "entropy": 6.497243118286133, "epoch": 0.07206208425720621, "grad_norm": 0.96484375, "learning_rate": 0.0004932784842102739, "loss": 6.4143, "mean_token_accuracy": 0.1154218778014183, "num_tokens": 2343685.0, "step": 1235 }, { "entropy": 6.377239084243774, "epoch": 0.07235383358618275, "grad_norm": 1.0859375, "learning_rate": 0.0004929896879232758, "loss": 6.397, "mean_token_accuracy": 0.11717568039894104, "num_tokens": 2352899.0, "step": 1240 }, { "entropy": 6.3864076137542725, "epoch": 0.0726455829151593, "grad_norm": 1.46875, "learning_rate": 0.0004926949153388668, "loss": 6.5139, "mean_token_accuracy": 0.11911385580897331, "num_tokens": 2362381.0, "step": 1245 }, { "entropy": 6.464845848083496, "epoch": 0.07293733224413584, "grad_norm": 1.0078125, "learning_rate": 0.0004923941745383859, "loss": 6.3956, "mean_token_accuracy": 0.11288046464323997, "num_tokens": 2372309.0, "step": 1250 }, { "entropy": 6.503108024597168, "epoch": 0.07322908157311238, "grad_norm": 1.046875, "learning_rate": 0.000492087473766794, "loss": 6.5013, "mean_token_accuracy": 0.11466107293963432, "num_tokens": 2381236.0, "step": 1255 }, { "entropy": 6.4154833316802975, "epoch": 0.07352083090208893, "grad_norm": 0.94140625, "learning_rate": 0.000491774821432448, "loss": 6.4491, "mean_token_accuracy": 0.11527864336967468, "num_tokens": 2390793.0, "step": 1260 }, { "entropy": 6.414394474029541, "epoch": 0.07381258023106547, "grad_norm": 0.94140625, "learning_rate": 0.0004914562261068693, "loss": 6.3753, "mean_token_accuracy": 0.11422505304217338, "num_tokens": 2400007.0, "step": 1265 }, { "entropy": 6.423696422576905, "epoch": 0.07410432956004201, "grad_norm": 1.0078125, "learning_rate": 0.0004911316965245098, "loss": 6.428, "mean_token_accuracy": 0.11575796380639077, "num_tokens": 2409606.0, "step": 1270 }, { "entropy": 6.41414155960083, "epoch": 0.07439607888901856, "grad_norm": 1.078125, "learning_rate": 0.000490801241582512, "loss": 6.3543, "mean_token_accuracy": 0.11173621639609337, "num_tokens": 2419074.0, "step": 1275 }, { "entropy": 6.403918361663818, "epoch": 0.07468782821799509, "grad_norm": 1.0703125, "learning_rate": 0.000490464870340465, "loss": 6.3939, "mean_token_accuracy": 0.11463204845786094, "num_tokens": 2428772.0, "step": 1280 }, { "entropy": 6.533142328262329, "epoch": 0.07497957754697164, "grad_norm": 0.99609375, "learning_rate": 0.0004901225920201563, "loss": 6.5168, "mean_token_accuracy": 0.11531570181250572, "num_tokens": 2438931.0, "step": 1285 }, { "entropy": 6.282506227493286, "epoch": 0.07527132687594819, "grad_norm": 1.09375, "learning_rate": 0.000489774416005319, "loss": 6.2793, "mean_token_accuracy": 0.11793802455067634, "num_tokens": 2448339.0, "step": 1290 }, { "entropy": 6.3312074661254885, "epoch": 0.07556307620492472, "grad_norm": 1.03125, "learning_rate": 0.0004894203518413742, "loss": 6.3356, "mean_token_accuracy": 0.11392701491713524, "num_tokens": 2458432.0, "step": 1295 }, { "entropy": 6.3252379417419435, "epoch": 0.07585482553390127, "grad_norm": 0.96875, "learning_rate": 0.0004890604092351701, "loss": 6.3885, "mean_token_accuracy": 0.11167708337306977, "num_tokens": 2468257.0, "step": 1300 }, { "entropy": 6.410771226882934, "epoch": 0.07614657486287782, "grad_norm": 1.0234375, "learning_rate": 0.000488694598054715, "loss": 6.3856, "mean_token_accuracy": 0.11263055056333542, "num_tokens": 2477267.0, "step": 1305 }, { "entropy": 6.425689220428467, "epoch": 0.07643832419185435, "grad_norm": 0.97265625, "learning_rate": 0.0004883229283289071, "loss": 6.3308, "mean_token_accuracy": 0.10780216380953789, "num_tokens": 2485952.0, "step": 1310 }, { "entropy": 6.379551649093628, "epoch": 0.0767300735208309, "grad_norm": 1.125, "learning_rate": 0.00048794541024725993, "loss": 6.4322, "mean_token_accuracy": 0.1152675449848175, "num_tokens": 2495289.0, "step": 1315 }, { "entropy": 6.50159215927124, "epoch": 0.07702182284980745, "grad_norm": 1.0390625, "learning_rate": 0.0004875620541596221, "loss": 6.3428, "mean_token_accuracy": 0.11285355165600777, "num_tokens": 2505304.0, "step": 1320 }, { "entropy": 6.3611382961273195, "epoch": 0.07731357217878398, "grad_norm": 1.0390625, "learning_rate": 0.00048717287057589454, "loss": 6.3711, "mean_token_accuracy": 0.11867863908410073, "num_tokens": 2515436.0, "step": 1325 }, { "entropy": 6.414155960083008, "epoch": 0.07760532150776053, "grad_norm": 0.94921875, "learning_rate": 0.0004867778701657417, "loss": 6.4959, "mean_token_accuracy": 0.10673807635903358, "num_tokens": 2525195.0, "step": 1330 }, { "entropy": 6.472268724441529, "epoch": 0.07789707083673708, "grad_norm": 1.078125, "learning_rate": 0.00048637706375829955, "loss": 6.329, "mean_token_accuracy": 0.12044179886579513, "num_tokens": 2533900.0, "step": 1335 }, { "entropy": 6.299315404891968, "epoch": 0.07818882016571362, "grad_norm": 1.0234375, "learning_rate": 0.000485970462341878, "loss": 6.3818, "mean_token_accuracy": 0.11268014311790467, "num_tokens": 2543506.0, "step": 1340 }, { "entropy": 6.4526282787323, "epoch": 0.07848056949469016, "grad_norm": 0.98046875, "learning_rate": 0.00048555807706366044, "loss": 6.4108, "mean_token_accuracy": 0.11387890353798866, "num_tokens": 2552899.0, "step": 1345 }, { "entropy": 6.348006105422973, "epoch": 0.07877231882366671, "grad_norm": 0.9375, "learning_rate": 0.00048513991922939756, "loss": 6.3313, "mean_token_accuracy": 0.11401514112949371, "num_tokens": 2563020.0, "step": 1350 }, { "entropy": 6.369770574569702, "epoch": 0.07906406815264325, "grad_norm": 1.09375, "learning_rate": 0.00048471600030309744, "loss": 6.3511, "mean_token_accuracy": 0.11567247584462166, "num_tokens": 2571784.0, "step": 1355 }, { "entropy": 6.307307720184326, "epoch": 0.0793558174816198, "grad_norm": 1.15625, "learning_rate": 0.00048428633190671186, "loss": 6.3938, "mean_token_accuracy": 0.11736602932214737, "num_tokens": 2580879.0, "step": 1360 }, { "entropy": 6.45410795211792, "epoch": 0.07964756681059633, "grad_norm": 1.046875, "learning_rate": 0.0004838509258198167, "loss": 6.3383, "mean_token_accuracy": 0.11524840667843819, "num_tokens": 2589398.0, "step": 1365 }, { "entropy": 6.316630792617798, "epoch": 0.07993931613957288, "grad_norm": 1.0859375, "learning_rate": 0.00048340979397929, "loss": 6.3257, "mean_token_accuracy": 0.1217143066227436, "num_tokens": 2598446.0, "step": 1370 }, { "entropy": 6.411429595947266, "epoch": 0.08023106546854943, "grad_norm": 1.1640625, "learning_rate": 0.00048296294847898386, "loss": 6.4564, "mean_token_accuracy": 0.11443509832024575, "num_tokens": 2608646.0, "step": 1375 }, { "entropy": 6.5289661407470705, "epoch": 0.08052281479752596, "grad_norm": 0.9921875, "learning_rate": 0.0004825104015693934, "loss": 6.5233, "mean_token_accuracy": 0.10254140794277192, "num_tokens": 2619588.0, "step": 1380 }, { "entropy": 6.416348648071289, "epoch": 0.08081456412650251, "grad_norm": 1.0234375, "learning_rate": 0.0004820521656573208, "loss": 6.3574, "mean_token_accuracy": 0.11526949927210808, "num_tokens": 2628585.0, "step": 1385 }, { "entropy": 6.382719421386719, "epoch": 0.08110631345547906, "grad_norm": 1.15625, "learning_rate": 0.00048158825330553505, "loss": 6.2697, "mean_token_accuracy": 0.12054040431976318, "num_tokens": 2636965.0, "step": 1390 }, { "entropy": 6.318143606185913, "epoch": 0.08139806278445559, "grad_norm": 1.09375, "learning_rate": 0.00048111867723242763, "loss": 6.2257, "mean_token_accuracy": 0.12370629087090493, "num_tokens": 2645926.0, "step": 1395 }, { "entropy": 6.3341890335083, "epoch": 0.08168981211343214, "grad_norm": 1.09375, "learning_rate": 0.0004806434503116637, "loss": 6.326, "mean_token_accuracy": 0.11409061923623084, "num_tokens": 2654566.0, "step": 1400 }, { "entropy": 6.446702146530152, "epoch": 0.08198156144240869, "grad_norm": 1.0859375, "learning_rate": 0.0004801625855718296, "loss": 6.4087, "mean_token_accuracy": 0.11707663610577583, "num_tokens": 2663383.0, "step": 1405 }, { "entropy": 6.315024089813233, "epoch": 0.08227331077138522, "grad_norm": 1.015625, "learning_rate": 0.00047967609619607477, "loss": 6.2755, "mean_token_accuracy": 0.1180037334561348, "num_tokens": 2672567.0, "step": 1410 }, { "entropy": 6.357727575302124, "epoch": 0.08256506010036177, "grad_norm": 1.0546875, "learning_rate": 0.0004791839955217513, "loss": 6.4337, "mean_token_accuracy": 0.11114252284169197, "num_tokens": 2681966.0, "step": 1415 }, { "entropy": 6.441995429992676, "epoch": 0.08285680942933832, "grad_norm": 1.0546875, "learning_rate": 0.00047868629704004786, "loss": 6.3481, "mean_token_accuracy": 0.11805550679564476, "num_tokens": 2690215.0, "step": 1420 }, { "entropy": 6.332686853408814, "epoch": 0.08314855875831485, "grad_norm": 1.140625, "learning_rate": 0.00047818301439561965, "loss": 6.393, "mean_token_accuracy": 0.11177687272429467, "num_tokens": 2700766.0, "step": 1425 }, { "entropy": 6.261061716079712, "epoch": 0.0834403080872914, "grad_norm": 1.1640625, "learning_rate": 0.00047767416138621454, "loss": 6.2868, "mean_token_accuracy": 0.11431297659873962, "num_tokens": 2710028.0, "step": 1430 }, { "entropy": 6.5042167663574215, "epoch": 0.08373205741626795, "grad_norm": 1.0546875, "learning_rate": 0.000477159751962295, "loss": 6.4711, "mean_token_accuracy": 0.11762162894010544, "num_tokens": 2720628.0, "step": 1435 }, { "entropy": 6.23676061630249, "epoch": 0.08402380674524448, "grad_norm": 1.09375, "learning_rate": 0.00047663980022665507, "loss": 6.2522, "mean_token_accuracy": 0.11971108093857766, "num_tokens": 2729826.0, "step": 1440 }, { "entropy": 6.443781185150146, "epoch": 0.08431555607422103, "grad_norm": 1.03125, "learning_rate": 0.00047611432043403437, "loss": 6.4593, "mean_token_accuracy": 0.11329575181007386, "num_tokens": 2739937.0, "step": 1445 }, { "entropy": 6.39516134262085, "epoch": 0.08460730540319757, "grad_norm": 1.0234375, "learning_rate": 0.0004755833269907267, "loss": 6.4063, "mean_token_accuracy": 0.11360016688704491, "num_tokens": 2749542.0, "step": 1450 }, { "entropy": 6.336669158935547, "epoch": 0.08489905473217411, "grad_norm": 1.015625, "learning_rate": 0.0004750468344541857, "loss": 6.3085, "mean_token_accuracy": 0.12215447798371315, "num_tokens": 2759545.0, "step": 1455 }, { "entropy": 6.356807231903076, "epoch": 0.08519080406115066, "grad_norm": 1.0234375, "learning_rate": 0.00047450485753262525, "loss": 6.3257, "mean_token_accuracy": 0.12252013981342316, "num_tokens": 2769065.0, "step": 1460 }, { "entropy": 6.375159883499146, "epoch": 0.0854825533901272, "grad_norm": 1.078125, "learning_rate": 0.00047395741108461633, "loss": 6.2551, "mean_token_accuracy": 0.11856821104884148, "num_tokens": 2778608.0, "step": 1465 }, { "entropy": 6.184617376327514, "epoch": 0.08577430271910375, "grad_norm": 1.15625, "learning_rate": 0.00047340451011867985, "loss": 6.2887, "mean_token_accuracy": 0.12425651028752327, "num_tokens": 2787723.0, "step": 1470 }, { "entropy": 6.407329750061035, "epoch": 0.0860660520480803, "grad_norm": 1.0, "learning_rate": 0.00047284616979287515, "loss": 6.2254, "mean_token_accuracy": 0.1285393789410591, "num_tokens": 2796385.0, "step": 1475 }, { "entropy": 6.187299633026123, "epoch": 0.08635780137705683, "grad_norm": 1.1171875, "learning_rate": 0.00047228240541438433, "loss": 6.2521, "mean_token_accuracy": 0.12240941449999809, "num_tokens": 2805425.0, "step": 1480 }, { "entropy": 6.419047546386719, "epoch": 0.08664955070603338, "grad_norm": 1.015625, "learning_rate": 0.00047171323243909257, "loss": 6.4074, "mean_token_accuracy": 0.11365959122776985, "num_tokens": 2816947.0, "step": 1485 }, { "entropy": 6.266291618347168, "epoch": 0.08694130003500992, "grad_norm": 1.140625, "learning_rate": 0.00047113866647116457, "loss": 6.3063, "mean_token_accuracy": 0.12005587667226791, "num_tokens": 2826701.0, "step": 1490 }, { "entropy": 6.427331399917603, "epoch": 0.08723304936398646, "grad_norm": 1.109375, "learning_rate": 0.0004705587232626164, "loss": 6.3071, "mean_token_accuracy": 0.1235899992287159, "num_tokens": 2836591.0, "step": 1495 }, { "entropy": 6.238853168487549, "epoch": 0.08752479869296301, "grad_norm": 1.0546875, "learning_rate": 0.00046997341871288424, "loss": 6.2287, "mean_token_accuracy": 0.12085602730512619, "num_tokens": 2844624.0, "step": 1500 }, { "entropy": 6.5039948463439945, "epoch": 0.08781654802193956, "grad_norm": 1.03125, "learning_rate": 0.0004693827688683879, "loss": 6.3706, "mean_token_accuracy": 0.11352829337120056, "num_tokens": 2853736.0, "step": 1505 }, { "entropy": 6.2476152896881105, "epoch": 0.08810829735091609, "grad_norm": 1.2109375, "learning_rate": 0.0004687867899220914, "loss": 6.2534, "mean_token_accuracy": 0.11727567315101624, "num_tokens": 2863176.0, "step": 1510 }, { "entropy": 6.279230070114136, "epoch": 0.08840004667989264, "grad_norm": 0.953125, "learning_rate": 0.00046818549821305846, "loss": 6.2798, "mean_token_accuracy": 0.11535517126321793, "num_tokens": 2872087.0, "step": 1515 }, { "entropy": 6.298987531661988, "epoch": 0.08869179600886919, "grad_norm": 1.0, "learning_rate": 0.00046757891022600494, "loss": 6.355, "mean_token_accuracy": 0.11613577753305435, "num_tokens": 2882916.0, "step": 1520 }, { "entropy": 6.26947922706604, "epoch": 0.08898354533784572, "grad_norm": 0.92578125, "learning_rate": 0.0004669670425908471, "loss": 6.2438, "mean_token_accuracy": 0.12345949336886405, "num_tokens": 2893116.0, "step": 1525 }, { "entropy": 6.363525342941284, "epoch": 0.08927529466682227, "grad_norm": 1.0234375, "learning_rate": 0.0004663499120822451, "loss": 6.3962, "mean_token_accuracy": 0.10942287668585778, "num_tokens": 2902419.0, "step": 1530 }, { "entropy": 6.405201196670532, "epoch": 0.0895670439957988, "grad_norm": 1.09375, "learning_rate": 0.0004657275356191437, "loss": 6.2938, "mean_token_accuracy": 0.1213503472507, "num_tokens": 2911300.0, "step": 1535 }, { "entropy": 6.345795631408691, "epoch": 0.08985879332477535, "grad_norm": 0.9921875, "learning_rate": 0.00046509993026430804, "loss": 6.3545, "mean_token_accuracy": 0.1187653012573719, "num_tokens": 2921190.0, "step": 1540 }, { "entropy": 6.468287611007691, "epoch": 0.0901505426537519, "grad_norm": 0.9765625, "learning_rate": 0.0004644671132238558, "loss": 6.4109, "mean_token_accuracy": 0.11848839297890663, "num_tokens": 2931964.0, "step": 1545 }, { "entropy": 6.317207956314087, "epoch": 0.09044229198272843, "grad_norm": 1.109375, "learning_rate": 0.00046382910184678585, "loss": 6.2755, "mean_token_accuracy": 0.11598291173577309, "num_tokens": 2940780.0, "step": 1550 }, { "entropy": 6.33673996925354, "epoch": 0.09073404131170498, "grad_norm": 1.109375, "learning_rate": 0.0004631859136245025, "loss": 6.3085, "mean_token_accuracy": 0.11326714009046554, "num_tokens": 2949537.0, "step": 1555 }, { "entropy": 6.271080875396729, "epoch": 0.09102579064068153, "grad_norm": 1.0546875, "learning_rate": 0.0004625375661903357, "loss": 6.3005, "mean_token_accuracy": 0.12357675582170487, "num_tokens": 2959034.0, "step": 1560 }, { "entropy": 6.347681617736816, "epoch": 0.09131753996965807, "grad_norm": 0.86328125, "learning_rate": 0.00046188407731905787, "loss": 6.2425, "mean_token_accuracy": 0.11625017821788788, "num_tokens": 2968480.0, "step": 1565 }, { "entropy": 6.238370418548584, "epoch": 0.09160928929863461, "grad_norm": 0.9609375, "learning_rate": 0.00046122546492639643, "loss": 6.2272, "mean_token_accuracy": 0.12265427559614181, "num_tokens": 2977911.0, "step": 1570 }, { "entropy": 6.211631393432617, "epoch": 0.09190103862761116, "grad_norm": 1.0546875, "learning_rate": 0.000460561747068543, "loss": 6.3499, "mean_token_accuracy": 0.1291658066213131, "num_tokens": 2987139.0, "step": 1575 }, { "entropy": 6.402784824371338, "epoch": 0.0921927879565877, "grad_norm": 0.9921875, "learning_rate": 0.0004598929419416578, "loss": 6.2812, "mean_token_accuracy": 0.12039563283324242, "num_tokens": 2996496.0, "step": 1580 }, { "entropy": 6.420582628250122, "epoch": 0.09248453728556424, "grad_norm": 1.125, "learning_rate": 0.00045921906788137123, "loss": 6.3001, "mean_token_accuracy": 0.11506841331720352, "num_tokens": 3005691.0, "step": 1585 }, { "entropy": 6.272823667526245, "epoch": 0.09277628661454079, "grad_norm": 0.97265625, "learning_rate": 0.00045854014336228115, "loss": 6.3014, "mean_token_accuracy": 0.12312400192022324, "num_tokens": 3015044.0, "step": 1590 }, { "entropy": 6.450143337249756, "epoch": 0.09306803594351733, "grad_norm": 1.09375, "learning_rate": 0.00045785618699744615, "loss": 6.4255, "mean_token_accuracy": 0.11360339000821114, "num_tokens": 3024195.0, "step": 1595 }, { "entropy": 6.354039144515991, "epoch": 0.09335978527249388, "grad_norm": 1.0546875, "learning_rate": 0.00045716721753787543, "loss": 6.2459, "mean_token_accuracy": 0.11926767155528069, "num_tokens": 3033701.0, "step": 1600 }, { "entropy": 6.228268671035766, "epoch": 0.09365153460147041, "grad_norm": 0.984375, "learning_rate": 0.0004564732538720148, "loss": 6.2753, "mean_token_accuracy": 0.12374345734715461, "num_tokens": 3043541.0, "step": 1605 }, { "entropy": 6.303274917602539, "epoch": 0.09394328393044696, "grad_norm": 1.0, "learning_rate": 0.00045577431502522877, "loss": 6.2592, "mean_token_accuracy": 0.1281718336045742, "num_tokens": 3053489.0, "step": 1610 }, { "entropy": 6.252635860443116, "epoch": 0.0942350332594235, "grad_norm": 1.0, "learning_rate": 0.0004550704201592787, "loss": 6.2725, "mean_token_accuracy": 0.12302799075841904, "num_tokens": 3062904.0, "step": 1615 }, { "entropy": 6.202295446395874, "epoch": 0.09452678258840004, "grad_norm": 1.1484375, "learning_rate": 0.0004543615885717981, "loss": 6.0565, "mean_token_accuracy": 0.1329715795814991, "num_tokens": 3072021.0, "step": 1620 }, { "entropy": 6.1748401641845705, "epoch": 0.09481853191737659, "grad_norm": 1.0234375, "learning_rate": 0.00045364783969576296, "loss": 6.2428, "mean_token_accuracy": 0.11738629788160324, "num_tokens": 3082016.0, "step": 1625 }, { "entropy": 6.369678926467896, "epoch": 0.09511028124635314, "grad_norm": 1.0234375, "learning_rate": 0.0004529291930989592, "loss": 6.2417, "mean_token_accuracy": 0.12121309861540794, "num_tokens": 3091996.0, "step": 1630 }, { "entropy": 6.229206562042236, "epoch": 0.09540203057532967, "grad_norm": 1.0078125, "learning_rate": 0.0004522056684834464, "loss": 6.1711, "mean_token_accuracy": 0.12580040022730826, "num_tokens": 3101944.0, "step": 1635 }, { "entropy": 6.121789741516113, "epoch": 0.09569377990430622, "grad_norm": 1.109375, "learning_rate": 0.0004514772856850173, "loss": 6.1806, "mean_token_accuracy": 0.12133874893188476, "num_tokens": 3110666.0, "step": 1640 }, { "entropy": 6.4672160148620605, "epoch": 0.09598552923328277, "grad_norm": 1.015625, "learning_rate": 0.0004507440646726542, "loss": 6.3902, "mean_token_accuracy": 0.11804559379816056, "num_tokens": 3120370.0, "step": 1645 }, { "entropy": 6.264255619049072, "epoch": 0.0962772785622593, "grad_norm": 0.97265625, "learning_rate": 0.0004500060255479818, "loss": 6.1807, "mean_token_accuracy": 0.12386891469359398, "num_tokens": 3130025.0, "step": 1650 }, { "entropy": 6.22208800315857, "epoch": 0.09656902789123585, "grad_norm": 1.0, "learning_rate": 0.0004492631885447151, "loss": 6.2496, "mean_token_accuracy": 0.11741102412343025, "num_tokens": 3140065.0, "step": 1655 }, { "entropy": 6.287959051132202, "epoch": 0.0968607772202124, "grad_norm": 1.1171875, "learning_rate": 0.00044851557402810616, "loss": 6.3009, "mean_token_accuracy": 0.124704909324646, "num_tokens": 3148891.0, "step": 1660 }, { "entropy": 6.357010126113892, "epoch": 0.09715252654918893, "grad_norm": 1.0625, "learning_rate": 0.00044776320249438444, "loss": 6.2193, "mean_token_accuracy": 0.12245449349284172, "num_tokens": 3158349.0, "step": 1665 }, { "entropy": 6.240838527679443, "epoch": 0.09744427587816548, "grad_norm": 1.0390625, "learning_rate": 0.00044700609457019565, "loss": 6.3556, "mean_token_accuracy": 0.11844354793429375, "num_tokens": 3168214.0, "step": 1670 }, { "entropy": 6.300184059143066, "epoch": 0.09773602520714203, "grad_norm": 0.921875, "learning_rate": 0.0004462442710120359, "loss": 6.1448, "mean_token_accuracy": 0.12163960486650467, "num_tokens": 3178119.0, "step": 1675 }, { "entropy": 6.314942026138306, "epoch": 0.09802777453611856, "grad_norm": 1.0234375, "learning_rate": 0.000445477752705683, "loss": 6.2403, "mean_token_accuracy": 0.12064114734530448, "num_tokens": 3187060.0, "step": 1680 }, { "entropy": 6.250327491760254, "epoch": 0.09831952386509511, "grad_norm": 0.97265625, "learning_rate": 0.00044470656066562336, "loss": 6.3025, "mean_token_accuracy": 0.12025051936507225, "num_tokens": 3196468.0, "step": 1685 }, { "entropy": 6.3662707805633545, "epoch": 0.09861127319407165, "grad_norm": 1.0078125, "learning_rate": 0.0004439307160344765, "loss": 6.2003, "mean_token_accuracy": 0.1232446551322937, "num_tokens": 3205009.0, "step": 1690 }, { "entropy": 6.1288464069366455, "epoch": 0.0989030225230482, "grad_norm": 1.0546875, "learning_rate": 0.00044315024008241473, "loss": 6.1478, "mean_token_accuracy": 0.12729258313775063, "num_tokens": 3213666.0, "step": 1695 }, { "entropy": 6.288136625289917, "epoch": 0.09919477185202474, "grad_norm": 1.0546875, "learning_rate": 0.0004423651542065806, "loss": 6.1941, "mean_token_accuracy": 0.13063909932971002, "num_tokens": 3223124.0, "step": 1700 }, { "entropy": 6.193147420883179, "epoch": 0.09948652118100128, "grad_norm": 1.0546875, "learning_rate": 0.00044157547993050006, "loss": 6.2283, "mean_token_accuracy": 0.12324749156832696, "num_tokens": 3232784.0, "step": 1705 }, { "entropy": 6.303015089035034, "epoch": 0.09977827050997783, "grad_norm": 1.0234375, "learning_rate": 0.00044078123890349227, "loss": 6.2131, "mean_token_accuracy": 0.12409283444285393, "num_tokens": 3242296.0, "step": 1710 }, { "entropy": 6.229840278625488, "epoch": 0.10007001983895437, "grad_norm": 1.53125, "learning_rate": 0.00043998245290007606, "loss": 6.2414, "mean_token_accuracy": 0.12382307648658752, "num_tokens": 3251954.0, "step": 1715 }, { "entropy": 6.19064416885376, "epoch": 0.10036176916793091, "grad_norm": 1.0078125, "learning_rate": 0.00043917914381937323, "loss": 6.1897, "mean_token_accuracy": 0.11765580922365189, "num_tokens": 3261115.0, "step": 1720 }, { "entropy": 6.189918899536133, "epoch": 0.10065351849690746, "grad_norm": 1.1171875, "learning_rate": 0.00043837133368450815, "loss": 6.1931, "mean_token_accuracy": 0.12054690048098564, "num_tokens": 3269896.0, "step": 1725 }, { "entropy": 6.284554767608642, "epoch": 0.100945267825884, "grad_norm": 0.9921875, "learning_rate": 0.0004375590446420037, "loss": 6.16, "mean_token_accuracy": 0.12517104819417, "num_tokens": 3280066.0, "step": 1730 }, { "entropy": 6.189452266693115, "epoch": 0.10123701715486054, "grad_norm": 1.0859375, "learning_rate": 0.0004367422989611743, "loss": 6.1386, "mean_token_accuracy": 0.12676257863640786, "num_tokens": 3289378.0, "step": 1735 }, { "entropy": 6.276723575592041, "epoch": 0.10152876648383709, "grad_norm": 0.984375, "learning_rate": 0.0004359211190335153, "loss": 6.3124, "mean_token_accuracy": 0.12249552607536315, "num_tokens": 3299529.0, "step": 1740 }, { "entropy": 6.3476848125457765, "epoch": 0.10182051581281364, "grad_norm": 1.0703125, "learning_rate": 0.00043509552737208923, "loss": 6.2807, "mean_token_accuracy": 0.1219617947936058, "num_tokens": 3308265.0, "step": 1745 }, { "entropy": 6.2723053932189945, "epoch": 0.10211226514179017, "grad_norm": 1.03125, "learning_rate": 0.00043426554661090853, "loss": 6.2029, "mean_token_accuracy": 0.12301502600312234, "num_tokens": 3318062.0, "step": 1750 }, { "entropy": 6.362277698516846, "epoch": 0.10240401447076672, "grad_norm": 0.98828125, "learning_rate": 0.00043343119950431516, "loss": 6.3285, "mean_token_accuracy": 0.1206172190606594, "num_tokens": 3328561.0, "step": 1755 }, { "entropy": 6.213156986236572, "epoch": 0.10269576379974327, "grad_norm": 0.99609375, "learning_rate": 0.00043259250892635644, "loss": 6.2485, "mean_token_accuracy": 0.12045412585139274, "num_tokens": 3338052.0, "step": 1760 }, { "entropy": 6.214480304718018, "epoch": 0.1029875131287198, "grad_norm": 1.0, "learning_rate": 0.0004317494978701582, "loss": 6.1606, "mean_token_accuracy": 0.1277881905436516, "num_tokens": 3349357.0, "step": 1765 }, { "entropy": 6.226798820495605, "epoch": 0.10327926245769635, "grad_norm": 1.015625, "learning_rate": 0.0004309021894472943, "loss": 6.1348, "mean_token_accuracy": 0.12920267134904861, "num_tokens": 3359030.0, "step": 1770 }, { "entropy": 6.139141702651978, "epoch": 0.10357101178667288, "grad_norm": 1.1953125, "learning_rate": 0.0004300506068871534, "loss": 6.1265, "mean_token_accuracy": 0.13153293505311012, "num_tokens": 3367702.0, "step": 1775 }, { "entropy": 6.308718204498291, "epoch": 0.10386276111564943, "grad_norm": 1.109375, "learning_rate": 0.00042919477353630135, "loss": 6.146, "mean_token_accuracy": 0.1294103018939495, "num_tokens": 3376626.0, "step": 1780 }, { "entropy": 6.128504610061645, "epoch": 0.10415451044462598, "grad_norm": 1.0390625, "learning_rate": 0.000428334712857842, "loss": 6.1039, "mean_token_accuracy": 0.12742208167910576, "num_tokens": 3386301.0, "step": 1785 }, { "entropy": 6.205838346481324, "epoch": 0.10444625977360252, "grad_norm": 1.0390625, "learning_rate": 0.00042747044843077304, "loss": 6.1932, "mean_token_accuracy": 0.12324661612510682, "num_tokens": 3396104.0, "step": 1790 }, { "entropy": 6.306753921508789, "epoch": 0.10473800910257906, "grad_norm": 1.0234375, "learning_rate": 0.00042660200394934047, "loss": 6.2169, "mean_token_accuracy": 0.12297144085168839, "num_tokens": 3405123.0, "step": 1795 }, { "entropy": 6.220966863632202, "epoch": 0.10502975843155561, "grad_norm": 0.97265625, "learning_rate": 0.00042572940322238844, "loss": 6.1626, "mean_token_accuracy": 0.12484495714306831, "num_tokens": 3414967.0, "step": 1800 }, { "entropy": 6.274843978881836, "epoch": 0.10532150776053215, "grad_norm": 0.90234375, "learning_rate": 0.00042485267017270664, "loss": 6.3424, "mean_token_accuracy": 0.11909266263246536, "num_tokens": 3425947.0, "step": 1805 }, { "entropy": 6.383258819580078, "epoch": 0.1056132570895087, "grad_norm": 0.953125, "learning_rate": 0.0004239718288363745, "loss": 6.2704, "mean_token_accuracy": 0.12300543934106827, "num_tokens": 3436012.0, "step": 1810 }, { "entropy": 6.266382646560669, "epoch": 0.10590500641848524, "grad_norm": 1.0, "learning_rate": 0.0004230869033621023, "loss": 6.1846, "mean_token_accuracy": 0.11848850473761559, "num_tokens": 3446474.0, "step": 1815 }, { "entropy": 6.16329665184021, "epoch": 0.10619675574746178, "grad_norm": 1.0078125, "learning_rate": 0.0004221979180105688, "loss": 6.0963, "mean_token_accuracy": 0.13093286454677583, "num_tokens": 3455491.0, "step": 1820 }, { "entropy": 6.145866918563843, "epoch": 0.10648850507643833, "grad_norm": 0.98828125, "learning_rate": 0.00042130489715375645, "loss": 6.0143, "mean_token_accuracy": 0.13937579542398454, "num_tokens": 3464418.0, "step": 1825 }, { "entropy": 6.21917028427124, "epoch": 0.10678025440541487, "grad_norm": 1.1328125, "learning_rate": 0.00042040786527428335, "loss": 6.1965, "mean_token_accuracy": 0.12161976620554923, "num_tokens": 3472877.0, "step": 1830 }, { "entropy": 6.186547470092774, "epoch": 0.10707200373439141, "grad_norm": 1.03125, "learning_rate": 0.0004195068469647315, "loss": 6.1542, "mean_token_accuracy": 0.12836315035820006, "num_tokens": 3483037.0, "step": 1835 }, { "entropy": 6.19683837890625, "epoch": 0.10736375306336796, "grad_norm": 0.9453125, "learning_rate": 0.00041860186692697297, "loss": 6.083, "mean_token_accuracy": 0.1275312103331089, "num_tokens": 3492873.0, "step": 1840 }, { "entropy": 6.1625336647033695, "epoch": 0.1076555023923445, "grad_norm": 1.1171875, "learning_rate": 0.00041769294997149264, "loss": 6.2381, "mean_token_accuracy": 0.12316666096448899, "num_tokens": 3501842.0, "step": 1845 }, { "entropy": 6.2700042724609375, "epoch": 0.10794725172132104, "grad_norm": 1.0625, "learning_rate": 0.0004167801210167081, "loss": 6.1544, "mean_token_accuracy": 0.12415701374411584, "num_tokens": 3510415.0, "step": 1850 }, { "entropy": 6.35073299407959, "epoch": 0.10823900105029759, "grad_norm": 1.0234375, "learning_rate": 0.0004158634050882861, "loss": 6.3202, "mean_token_accuracy": 0.11843622103333473, "num_tokens": 3521437.0, "step": 1855 }, { "entropy": 6.284471845626831, "epoch": 0.10853075037927412, "grad_norm": 1.0234375, "learning_rate": 0.0004149428273184569, "loss": 6.2712, "mean_token_accuracy": 0.12350925728678704, "num_tokens": 3531733.0, "step": 1860 }, { "entropy": 6.20415997505188, "epoch": 0.10882249970825067, "grad_norm": 1.046875, "learning_rate": 0.0004140184129453253, "loss": 6.0453, "mean_token_accuracy": 0.13318468108773232, "num_tokens": 3540724.0, "step": 1865 }, { "entropy": 6.169241571426392, "epoch": 0.10911424903722722, "grad_norm": 1.078125, "learning_rate": 0.000413090187312178, "loss": 6.1824, "mean_token_accuracy": 0.1301153838634491, "num_tokens": 3551015.0, "step": 1870 }, { "entropy": 6.233869838714599, "epoch": 0.10940599836620375, "grad_norm": 1.0859375, "learning_rate": 0.0004121581758667898, "loss": 6.2521, "mean_token_accuracy": 0.1265456885099411, "num_tokens": 3560526.0, "step": 1875 }, { "entropy": 6.1837160110473635, "epoch": 0.1096977476951803, "grad_norm": 1.0078125, "learning_rate": 0.00041122240416072533, "loss": 6.1241, "mean_token_accuracy": 0.12862038388848304, "num_tokens": 3569966.0, "step": 1880 }, { "entropy": 6.278997421264648, "epoch": 0.10998949702415685, "grad_norm": 0.96484375, "learning_rate": 0.0004102828978486385, "loss": 6.111, "mean_token_accuracy": 0.12866452112793922, "num_tokens": 3579061.0, "step": 1885 }, { "entropy": 6.257272148132325, "epoch": 0.11028124635313338, "grad_norm": 1.109375, "learning_rate": 0.0004093396826875695, "loss": 6.1377, "mean_token_accuracy": 0.12756876572966575, "num_tokens": 3587633.0, "step": 1890 }, { "entropy": 6.2344451427459715, "epoch": 0.11057299568210993, "grad_norm": 1.0078125, "learning_rate": 0.00040839278453623837, "loss": 6.0465, "mean_token_accuracy": 0.13229672834277154, "num_tokens": 3597136.0, "step": 1895 }, { "entropy": 6.11575870513916, "epoch": 0.11086474501108648, "grad_norm": 1.15625, "learning_rate": 0.0004074422293543363, "loss": 6.0951, "mean_token_accuracy": 0.12402657866477966, "num_tokens": 3605948.0, "step": 1900 }, { "entropy": 6.241190814971924, "epoch": 0.11115649434006301, "grad_norm": 1.0859375, "learning_rate": 0.0004064880432018137, "loss": 6.2258, "mean_token_accuracy": 0.12266718074679375, "num_tokens": 3615620.0, "step": 1905 }, { "entropy": 6.2283697605133055, "epoch": 0.11144824366903956, "grad_norm": 1.0625, "learning_rate": 0.00040553025223816615, "loss": 6.1949, "mean_token_accuracy": 0.1251465432345867, "num_tokens": 3624624.0, "step": 1910 }, { "entropy": 6.229434013366699, "epoch": 0.11173999299801611, "grad_norm": 0.9921875, "learning_rate": 0.00040456888272171653, "loss": 6.2181, "mean_token_accuracy": 0.12829322069883348, "num_tokens": 3634574.0, "step": 1915 }, { "entropy": 6.126652479171753, "epoch": 0.11203174232699264, "grad_norm": 1.015625, "learning_rate": 0.00040360396100889577, "loss": 6.0134, "mean_token_accuracy": 0.1284105472266674, "num_tokens": 3643991.0, "step": 1920 }, { "entropy": 6.069678211212159, "epoch": 0.1123234916559692, "grad_norm": 1.1328125, "learning_rate": 0.0004026355135535202, "loss": 6.0424, "mean_token_accuracy": 0.134358549118042, "num_tokens": 3652069.0, "step": 1925 }, { "entropy": 6.215138530731201, "epoch": 0.11261524098494574, "grad_norm": 0.98828125, "learning_rate": 0.000401663566906066, "loss": 6.2137, "mean_token_accuracy": 0.12257095649838448, "num_tokens": 3662227.0, "step": 1930 }, { "entropy": 6.292611455917358, "epoch": 0.11290699031392228, "grad_norm": 0.94921875, "learning_rate": 0.00040068814771294134, "loss": 6.1373, "mean_token_accuracy": 0.13084000647068023, "num_tokens": 3671511.0, "step": 1935 }, { "entropy": 6.098296356201172, "epoch": 0.11319873964289882, "grad_norm": 1.046875, "learning_rate": 0.0003997092827157562, "loss": 6.1175, "mean_token_accuracy": 0.13061317726969718, "num_tokens": 3680063.0, "step": 1940 }, { "entropy": 6.218745851516724, "epoch": 0.11349048897187536, "grad_norm": 1.0390625, "learning_rate": 0.000398726998750589, "loss": 6.1272, "mean_token_accuracy": 0.12958021759986876, "num_tokens": 3689299.0, "step": 1945 }, { "entropy": 6.187112522125244, "epoch": 0.1137822383008519, "grad_norm": 1.0078125, "learning_rate": 0.00039774132274725076, "loss": 6.1287, "mean_token_accuracy": 0.1283968210220337, "num_tokens": 3698071.0, "step": 1950 }, { "entropy": 6.100534152984619, "epoch": 0.11407398762982845, "grad_norm": 1.1328125, "learning_rate": 0.00039675228172854707, "loss": 6.0399, "mean_token_accuracy": 0.12726911306381225, "num_tokens": 3706773.0, "step": 1955 }, { "entropy": 6.179676485061646, "epoch": 0.11436573695880499, "grad_norm": 1.0546875, "learning_rate": 0.0003957599028095371, "loss": 6.0878, "mean_token_accuracy": 0.12605519965291023, "num_tokens": 3716814.0, "step": 1960 }, { "entropy": 6.254482316970825, "epoch": 0.11465748628778154, "grad_norm": 1.1015625, "learning_rate": 0.00039476421319679017, "loss": 6.1327, "mean_token_accuracy": 0.12759872823953627, "num_tokens": 3725596.0, "step": 1965 }, { "entropy": 6.121477890014648, "epoch": 0.11494923561675809, "grad_norm": 1.0859375, "learning_rate": 0.00039376524018764, "loss": 6.0897, "mean_token_accuracy": 0.13351815789937974, "num_tokens": 3734996.0, "step": 1970 }, { "entropy": 6.22856559753418, "epoch": 0.11524098494573462, "grad_norm": 1.0234375, "learning_rate": 0.00039276301116943616, "loss": 6.1254, "mean_token_accuracy": 0.12725835070014, "num_tokens": 3744109.0, "step": 1975 }, { "entropy": 6.288533735275268, "epoch": 0.11553273427471117, "grad_norm": 1.0546875, "learning_rate": 0.0003917575536187936, "loss": 6.1903, "mean_token_accuracy": 0.11792054921388626, "num_tokens": 3754416.0, "step": 1980 }, { "entropy": 6.226859855651855, "epoch": 0.11582448360368772, "grad_norm": 0.94140625, "learning_rate": 0.00039074889510083894, "loss": 6.2235, "mean_token_accuracy": 0.11969063058495522, "num_tokens": 3764401.0, "step": 1985 }, { "entropy": 6.328698396682739, "epoch": 0.11611623293266425, "grad_norm": 1.0390625, "learning_rate": 0.00038973706326845495, "loss": 6.2422, "mean_token_accuracy": 0.12645296901464462, "num_tokens": 3774098.0, "step": 1990 }, { "entropy": 6.225485849380493, "epoch": 0.1164079822616408, "grad_norm": 1.015625, "learning_rate": 0.0003887220858615225, "loss": 6.2042, "mean_token_accuracy": 0.1278956189751625, "num_tokens": 3783569.0, "step": 1995 }, { "entropy": 6.185959148406982, "epoch": 0.11669973159061735, "grad_norm": 0.9921875, "learning_rate": 0.0003877039907061597, "loss": 6.051, "mean_token_accuracy": 0.11998816132545471, "num_tokens": 3793898.0, "step": 2000 }, { "entropy": 6.1757483959198, "epoch": 0.11699148091959388, "grad_norm": 0.95703125, "learning_rate": 0.0003866828057139598, "loss": 6.184, "mean_token_accuracy": 0.12747337818145751, "num_tokens": 3803847.0, "step": 2005 }, { "entropy": 6.097095108032226, "epoch": 0.11728323024857043, "grad_norm": 1.125, "learning_rate": 0.00038565855888122503, "loss": 5.9902, "mean_token_accuracy": 0.14047103226184846, "num_tokens": 3812421.0, "step": 2010 }, { "entropy": 6.1024925231933596, "epoch": 0.11757497957754696, "grad_norm": 1.0234375, "learning_rate": 0.00038463127828819975, "loss": 6.1063, "mean_token_accuracy": 0.1260400377213955, "num_tokens": 3821897.0, "step": 2015 }, { "entropy": 6.344009780883789, "epoch": 0.11786672890652351, "grad_norm": 1.046875, "learning_rate": 0.00038360099209830043, "loss": 6.2277, "mean_token_accuracy": 0.1214868538081646, "num_tokens": 3831207.0, "step": 2020 }, { "entropy": 6.1543212890625, "epoch": 0.11815847823550006, "grad_norm": 1.015625, "learning_rate": 0.0003825677285573433, "loss": 5.9863, "mean_token_accuracy": 0.14326240345835686, "num_tokens": 3840590.0, "step": 2025 }, { "entropy": 6.025796031951904, "epoch": 0.1184502275644766, "grad_norm": 1.0625, "learning_rate": 0.00038153151599277027, "loss": 6.0514, "mean_token_accuracy": 0.13036804422736167, "num_tokens": 3850600.0, "step": 2030 }, { "entropy": 6.169336032867432, "epoch": 0.11874197689345314, "grad_norm": 1.015625, "learning_rate": 0.0003804923828128723, "loss": 6.092, "mean_token_accuracy": 0.1290174663066864, "num_tokens": 3860191.0, "step": 2035 }, { "entropy": 6.159327983856201, "epoch": 0.11903372622242969, "grad_norm": 1.0859375, "learning_rate": 0.0003794503575060104, "loss": 6.0568, "mean_token_accuracy": 0.13136546462774276, "num_tokens": 3869471.0, "step": 2040 }, { "entropy": 6.1873383045196535, "epoch": 0.11932547555140623, "grad_norm": 1.03125, "learning_rate": 0.00037840546863983484, "loss": 6.2054, "mean_token_accuracy": 0.1257386215031147, "num_tokens": 3878813.0, "step": 2045 }, { "entropy": 6.143853998184204, "epoch": 0.11961722488038277, "grad_norm": 1.0390625, "learning_rate": 0.0003773577448605015, "loss": 6.0548, "mean_token_accuracy": 0.1329750269651413, "num_tokens": 3887857.0, "step": 2050 }, { "entropy": 6.135542106628418, "epoch": 0.11990897420935932, "grad_norm": 1.0390625, "learning_rate": 0.0003763072148918872, "loss": 6.0346, "mean_token_accuracy": 0.12965454980731012, "num_tokens": 3896674.0, "step": 2055 }, { "entropy": 6.12315263748169, "epoch": 0.12020072353833586, "grad_norm": 1.0078125, "learning_rate": 0.0003752539075348017, "loss": 6.0583, "mean_token_accuracy": 0.13050565123558044, "num_tokens": 3907043.0, "step": 2060 }, { "entropy": 6.1918113231658936, "epoch": 0.1204924728673124, "grad_norm": 0.94921875, "learning_rate": 0.00037419785166619817, "loss": 6.0715, "mean_token_accuracy": 0.13669336065649987, "num_tokens": 3916464.0, "step": 2065 }, { "entropy": 6.082077074050903, "epoch": 0.12078422219628895, "grad_norm": 1.0546875, "learning_rate": 0.0003731390762383818, "loss": 5.9847, "mean_token_accuracy": 0.1324693463742733, "num_tokens": 3925314.0, "step": 2070 }, { "entropy": 6.234340381622315, "epoch": 0.12107597152526549, "grad_norm": 1.0, "learning_rate": 0.0003720776102782158, "loss": 6.1491, "mean_token_accuracy": 0.13121804893016814, "num_tokens": 3935483.0, "step": 2075 }, { "entropy": 6.205264520645142, "epoch": 0.12136772085424204, "grad_norm": 0.97265625, "learning_rate": 0.00037101348288632555, "loss": 6.0325, "mean_token_accuracy": 0.12864793166518212, "num_tokens": 3945680.0, "step": 2080 }, { "entropy": 6.145557498931884, "epoch": 0.12165947018321858, "grad_norm": 1.1640625, "learning_rate": 0.0003699467232363012, "loss": 6.1068, "mean_token_accuracy": 0.13312529623508454, "num_tokens": 3955050.0, "step": 2085 }, { "entropy": 6.220155525207519, "epoch": 0.12195121951219512, "grad_norm": 0.98046875, "learning_rate": 0.0003688773605738973, "loss": 6.1739, "mean_token_accuracy": 0.12807397097349166, "num_tokens": 3965137.0, "step": 2090 }, { "entropy": 6.205538082122803, "epoch": 0.12224296884117167, "grad_norm": 1.1640625, "learning_rate": 0.00036780542421623134, "loss": 6.0811, "mean_token_accuracy": 0.1324646107852459, "num_tokens": 3974321.0, "step": 2095 }, { "entropy": 6.14320821762085, "epoch": 0.1225347181701482, "grad_norm": 0.98828125, "learning_rate": 0.0003667309435509802, "loss": 5.9899, "mean_token_accuracy": 0.13220726251602172, "num_tokens": 3983585.0, "step": 2100 }, { "entropy": 6.185551595687866, "epoch": 0.12282646749912475, "grad_norm": 0.97265625, "learning_rate": 0.0003656539480355741, "loss": 6.0992, "mean_token_accuracy": 0.13207164481282235, "num_tokens": 3993244.0, "step": 2105 }, { "entropy": 6.090251731872558, "epoch": 0.1231182168281013, "grad_norm": 1.1015625, "learning_rate": 0.0003645744671963891, "loss": 5.9719, "mean_token_accuracy": 0.13249791339039801, "num_tokens": 4001809.0, "step": 2110 }, { "entropy": 5.980392408370972, "epoch": 0.12340996615707783, "grad_norm": 1.0546875, "learning_rate": 0.0003634925306279376, "loss": 6.0348, "mean_token_accuracy": 0.1358187809586525, "num_tokens": 4010544.0, "step": 2115 }, { "entropy": 6.2454461574554445, "epoch": 0.12370171548605438, "grad_norm": 0.9609375, "learning_rate": 0.0003624081679920574, "loss": 6.1575, "mean_token_accuracy": 0.12497098445892334, "num_tokens": 4020652.0, "step": 2120 }, { "entropy": 6.19257550239563, "epoch": 0.12399346481503093, "grad_norm": 1.0546875, "learning_rate": 0.0003613214090170977, "loss": 6.1815, "mean_token_accuracy": 0.1306192584335804, "num_tokens": 4029292.0, "step": 2125 }, { "entropy": 6.063637828826904, "epoch": 0.12428521414400746, "grad_norm": 1.0078125, "learning_rate": 0.0003602322834971048, "loss": 6.0053, "mean_token_accuracy": 0.13113986626267432, "num_tokens": 4038962.0, "step": 2130 }, { "entropy": 6.1634547233581545, "epoch": 0.12457696347298401, "grad_norm": 1.0859375, "learning_rate": 0.0003591408212910051, "loss": 6.0119, "mean_token_accuracy": 0.1333060897886753, "num_tokens": 4048099.0, "step": 2135 }, { "entropy": 6.054674100875855, "epoch": 0.12486871280196056, "grad_norm": 1.0625, "learning_rate": 0.0003580470523217863, "loss": 6.0573, "mean_token_accuracy": 0.13094019517302513, "num_tokens": 4057178.0, "step": 2140 }, { "entropy": 6.151257133483886, "epoch": 0.1251604621309371, "grad_norm": 1.09375, "learning_rate": 0.0003569510065756771, "loss": 6.1344, "mean_token_accuracy": 0.13510328382253647, "num_tokens": 4066942.0, "step": 2145 }, { "entropy": 6.162200164794922, "epoch": 0.12545221145991364, "grad_norm": 0.99609375, "learning_rate": 0.0003558527141013254, "loss": 6.0538, "mean_token_accuracy": 0.13089121207594873, "num_tokens": 4076996.0, "step": 2150 }, { "entropy": 6.204866743087768, "epoch": 0.1257439607888902, "grad_norm": 1.0078125, "learning_rate": 0.0003547522050089742, "loss": 6.1049, "mean_token_accuracy": 0.1330699637532234, "num_tokens": 4085914.0, "step": 2155 }, { "entropy": 6.158906650543213, "epoch": 0.12603571011786674, "grad_norm": 1.1328125, "learning_rate": 0.00035364950946963606, "loss": 5.9965, "mean_token_accuracy": 0.13708881437778472, "num_tokens": 4095338.0, "step": 2160 }, { "entropy": 6.146380472183227, "epoch": 0.12632745944684326, "grad_norm": 1.078125, "learning_rate": 0.0003525446577142663, "loss": 6.0579, "mean_token_accuracy": 0.12941342294216157, "num_tokens": 4103479.0, "step": 2165 }, { "entropy": 6.203834438323975, "epoch": 0.1266192087758198, "grad_norm": 1.0234375, "learning_rate": 0.00035143768003293395, "loss": 6.1182, "mean_token_accuracy": 0.1333833985030651, "num_tokens": 4112916.0, "step": 2170 }, { "entropy": 6.124022054672241, "epoch": 0.12691095810479636, "grad_norm": 1.03125, "learning_rate": 0.0003503286067739913, "loss": 5.9385, "mean_token_accuracy": 0.13590933308005332, "num_tokens": 4121888.0, "step": 2175 }, { "entropy": 6.10663537979126, "epoch": 0.1272027074337729, "grad_norm": 1.09375, "learning_rate": 0.00034921746834324193, "loss": 6.0631, "mean_token_accuracy": 0.1324682280421257, "num_tokens": 4130890.0, "step": 2180 }, { "entropy": 6.162923336029053, "epoch": 0.12749445676274945, "grad_norm": 1.0390625, "learning_rate": 0.0003481042952031072, "loss": 6.0507, "mean_token_accuracy": 0.1312302142381668, "num_tokens": 4140444.0, "step": 2185 }, { "entropy": 6.046947240829468, "epoch": 0.127786206091726, "grad_norm": 1.0, "learning_rate": 0.0003469891178717911, "loss": 5.9898, "mean_token_accuracy": 0.12995862513780593, "num_tokens": 4150167.0, "step": 2190 }, { "entropy": 6.1181951522827145, "epoch": 0.12807795542070252, "grad_norm": 1.046875, "learning_rate": 0.0003458719669224436, "loss": 5.998, "mean_token_accuracy": 0.1331616722047329, "num_tokens": 4159057.0, "step": 2195 }, { "entropy": 6.236394929885864, "epoch": 0.12836970474967907, "grad_norm": 0.97265625, "learning_rate": 0.0003447528729823221, "loss": 6.1961, "mean_token_accuracy": 0.12343473508954048, "num_tokens": 4170300.0, "step": 2200 }, { "entropy": 6.111977624893188, "epoch": 0.12866145407865562, "grad_norm": 1.078125, "learning_rate": 0.0003436318667319525, "loss": 6.0592, "mean_token_accuracy": 0.13006481528282166, "num_tokens": 4179023.0, "step": 2205 }, { "entropy": 6.138869905471802, "epoch": 0.12895320340763217, "grad_norm": 1.015625, "learning_rate": 0.00034250897890428716, "loss": 6.0127, "mean_token_accuracy": 0.13645198419690133, "num_tokens": 4187930.0, "step": 2210 }, { "entropy": 6.11465425491333, "epoch": 0.12924495273660871, "grad_norm": 1.0703125, "learning_rate": 0.0003413842402838633, "loss": 5.9816, "mean_token_accuracy": 0.13514165207743645, "num_tokens": 4196863.0, "step": 2215 }, { "entropy": 6.159387445449829, "epoch": 0.12953670206558526, "grad_norm": 0.98046875, "learning_rate": 0.00034025768170595834, "loss": 6.0554, "mean_token_accuracy": 0.133841223269701, "num_tokens": 4206446.0, "step": 2220 }, { "entropy": 6.110213375091552, "epoch": 0.12982845139456178, "grad_norm": 1.1875, "learning_rate": 0.0003391293340557446, "loss": 6.0419, "mean_token_accuracy": 0.13170824572443962, "num_tokens": 4215390.0, "step": 2225 }, { "entropy": 6.143122148513794, "epoch": 0.13012020072353833, "grad_norm": 0.98828125, "learning_rate": 0.0003379992282674431, "loss": 5.9628, "mean_token_accuracy": 0.1296013280749321, "num_tokens": 4224549.0, "step": 2230 }, { "entropy": 6.032369470596313, "epoch": 0.13041195005251488, "grad_norm": 0.859375, "learning_rate": 0.0003368673953234749, "loss": 6.0248, "mean_token_accuracy": 0.13395655602216722, "num_tokens": 4234911.0, "step": 2235 }, { "entropy": 6.108939552307129, "epoch": 0.13070369938149143, "grad_norm": 1.0703125, "learning_rate": 0.00033573386625361176, "loss": 5.9833, "mean_token_accuracy": 0.1381675697863102, "num_tokens": 4244084.0, "step": 2240 }, { "entropy": 6.152256298065185, "epoch": 0.13099544871046798, "grad_norm": 1.0390625, "learning_rate": 0.00033459867213412567, "loss": 6.0867, "mean_token_accuracy": 0.1329598158597946, "num_tokens": 4253102.0, "step": 2245 }, { "entropy": 6.228173685073853, "epoch": 0.1312871980394445, "grad_norm": 1.046875, "learning_rate": 0.000333461844086937, "loss": 6.1341, "mean_token_accuracy": 0.12330343350768089, "num_tokens": 4263220.0, "step": 2250 }, { "entropy": 6.15165696144104, "epoch": 0.13157894736842105, "grad_norm": 1.0390625, "learning_rate": 0.00033232341327876097, "loss": 6.0217, "mean_token_accuracy": 0.13015433102846147, "num_tokens": 4272951.0, "step": 2255 }, { "entropy": 6.0193620204925535, "epoch": 0.1318706966973976, "grad_norm": 1.0078125, "learning_rate": 0.0003311834109202531, "loss": 5.9992, "mean_token_accuracy": 0.12776204496622084, "num_tokens": 4282920.0, "step": 2260 }, { "entropy": 6.203376007080078, "epoch": 0.13216244602637414, "grad_norm": 1.03125, "learning_rate": 0.00033004186826515416, "loss": 6.144, "mean_token_accuracy": 0.13627443239092826, "num_tokens": 4293307.0, "step": 2265 }, { "entropy": 6.149167823791504, "epoch": 0.1324541953553507, "grad_norm": 1.0, "learning_rate": 0.0003288988166094324, "loss": 6.0379, "mean_token_accuracy": 0.13878687396645545, "num_tokens": 4303345.0, "step": 2270 }, { "entropy": 6.014406394958496, "epoch": 0.13274594468432724, "grad_norm": 0.99609375, "learning_rate": 0.00032775428729042656, "loss": 5.9448, "mean_token_accuracy": 0.13974148780107498, "num_tokens": 4312466.0, "step": 2275 }, { "entropy": 6.043557357788086, "epoch": 0.13303769401330376, "grad_norm": 0.9921875, "learning_rate": 0.000326608311685986, "loss": 5.918, "mean_token_accuracy": 0.13819573670625687, "num_tokens": 4321922.0, "step": 2280 }, { "entropy": 6.043844318389892, "epoch": 0.1333294433422803, "grad_norm": 1.03125, "learning_rate": 0.0003254609212136108, "loss": 6.0421, "mean_token_accuracy": 0.13316982761025428, "num_tokens": 4332861.0, "step": 2285 }, { "entropy": 6.0816281795501705, "epoch": 0.13362119267125686, "grad_norm": 0.984375, "learning_rate": 0.00032431214732959036, "loss": 5.941, "mean_token_accuracy": 0.13233345076441766, "num_tokens": 4342538.0, "step": 2290 }, { "entropy": 6.050484228134155, "epoch": 0.1339129420002334, "grad_norm": 1.0234375, "learning_rate": 0.000323162021528141, "loss": 5.9245, "mean_token_accuracy": 0.1377279981970787, "num_tokens": 4351725.0, "step": 2295 }, { "entropy": 6.128743600845337, "epoch": 0.13420469132920995, "grad_norm": 1.09375, "learning_rate": 0.00032201057534054264, "loss": 5.9753, "mean_token_accuracy": 0.1378311976790428, "num_tokens": 4360279.0, "step": 2300 }, { "entropy": 6.107240343093872, "epoch": 0.13449644065818647, "grad_norm": 1.0546875, "learning_rate": 0.00032085784033427414, "loss": 6.0398, "mean_token_accuracy": 0.13199200704693795, "num_tokens": 4370121.0, "step": 2305 }, { "entropy": 6.114462852478027, "epoch": 0.13478818998716302, "grad_norm": 1.0625, "learning_rate": 0.0003197038481121478, "loss": 6.052, "mean_token_accuracy": 0.12872423157095908, "num_tokens": 4379801.0, "step": 2310 }, { "entropy": 6.113399362564087, "epoch": 0.13507993931613957, "grad_norm": 0.99609375, "learning_rate": 0.0003185486303114436, "loss": 6.0406, "mean_token_accuracy": 0.12906918823719024, "num_tokens": 4389542.0, "step": 2315 }, { "entropy": 6.191231679916382, "epoch": 0.13537168864511612, "grad_norm": 1.0859375, "learning_rate": 0.0003173922186030409, "loss": 6.2285, "mean_token_accuracy": 0.12242957651615143, "num_tokens": 4399704.0, "step": 2320 }, { "entropy": 6.161467218399048, "epoch": 0.13566343797409267, "grad_norm": 1.0546875, "learning_rate": 0.000316234644690551, "loss": 5.9699, "mean_token_accuracy": 0.13790022283792497, "num_tokens": 4408884.0, "step": 2325 }, { "entropy": 6.051607608795166, "epoch": 0.1359551873030692, "grad_norm": 1.015625, "learning_rate": 0.0003150759403094473, "loss": 5.9478, "mean_token_accuracy": 0.1472274973988533, "num_tokens": 4418539.0, "step": 2330 }, { "entropy": 6.120077419281006, "epoch": 0.13624693663204573, "grad_norm": 0.98046875, "learning_rate": 0.00031391613722619587, "loss": 5.8789, "mean_token_accuracy": 0.13548571541905402, "num_tokens": 4428364.0, "step": 2335 }, { "entropy": 5.988148164749146, "epoch": 0.13653868596102228, "grad_norm": 0.97265625, "learning_rate": 0.000312755267237384, "loss": 6.0086, "mean_token_accuracy": 0.13620148003101348, "num_tokens": 4437597.0, "step": 2340 }, { "entropy": 6.115688276290894, "epoch": 0.13683043528999883, "grad_norm": 0.9375, "learning_rate": 0.0003115933621688488, "loss": 6.1011, "mean_token_accuracy": 0.1336211532354355, "num_tokens": 4448633.0, "step": 2345 }, { "entropy": 6.210470676422119, "epoch": 0.13712218461897538, "grad_norm": 1.0703125, "learning_rate": 0.00031043045387480487, "loss": 5.9385, "mean_token_accuracy": 0.13692572787404061, "num_tokens": 4458200.0, "step": 2350 }, { "entropy": 6.055985021591186, "epoch": 0.13741393394795193, "grad_norm": 1.0234375, "learning_rate": 0.0003092665742369703, "loss": 5.9568, "mean_token_accuracy": 0.13043170794844627, "num_tokens": 4467758.0, "step": 2355 }, { "entropy": 6.099366617202759, "epoch": 0.13770568327692848, "grad_norm": 1.0625, "learning_rate": 0.00030810175516369343, "loss": 5.962, "mean_token_accuracy": 0.1362786166369915, "num_tokens": 4477446.0, "step": 2360 }, { "entropy": 6.1166033267974855, "epoch": 0.137997432605905, "grad_norm": 1.0625, "learning_rate": 0.0003069360285890775, "loss": 6.0527, "mean_token_accuracy": 0.12857796847820283, "num_tokens": 4486754.0, "step": 2365 }, { "entropy": 6.072907209396362, "epoch": 0.13828918193488154, "grad_norm": 1.0625, "learning_rate": 0.00030576942647210547, "loss": 6.0746, "mean_token_accuracy": 0.13448990508913994, "num_tokens": 4495841.0, "step": 2370 }, { "entropy": 6.1608072280883786, "epoch": 0.1385809312638581, "grad_norm": 0.95703125, "learning_rate": 0.00030460198079576355, "loss": 6.0425, "mean_token_accuracy": 0.1289051041007042, "num_tokens": 4506373.0, "step": 2375 }, { "entropy": 6.127575874328613, "epoch": 0.13887268059283464, "grad_norm": 1.0546875, "learning_rate": 0.0003034337235661648, "loss": 6.0468, "mean_token_accuracy": 0.13214912116527558, "num_tokens": 4515843.0, "step": 2380 }, { "entropy": 6.090031909942627, "epoch": 0.1391644299218112, "grad_norm": 1.046875, "learning_rate": 0.0003022646868116714, "loss": 5.9924, "mean_token_accuracy": 0.13868472278118132, "num_tokens": 4525216.0, "step": 2385 }, { "entropy": 6.175815439224243, "epoch": 0.1394561792507877, "grad_norm": 1.078125, "learning_rate": 0.0003010949025820163, "loss": 6.0182, "mean_token_accuracy": 0.13675328269600867, "num_tokens": 4534691.0, "step": 2390 }, { "entropy": 6.1263453483581545, "epoch": 0.13974792857976426, "grad_norm": 0.9453125, "learning_rate": 0.0002999244029474252, "loss": 6.0589, "mean_token_accuracy": 0.12986232116818427, "num_tokens": 4545428.0, "step": 2395 }, { "entropy": 6.090114164352417, "epoch": 0.1400396779087408, "grad_norm": 1.109375, "learning_rate": 0.00029875321999773684, "loss": 5.9025, "mean_token_accuracy": 0.1333586908876896, "num_tokens": 4554173.0, "step": 2400 }, { "entropy": 6.063518381118774, "epoch": 0.14033142723771735, "grad_norm": 1.0234375, "learning_rate": 0.00029758138584152333, "loss": 6.0331, "mean_token_accuracy": 0.12861537262797357, "num_tokens": 4564085.0, "step": 2405 }, { "entropy": 6.133324050903321, "epoch": 0.1406231765666939, "grad_norm": 1.0234375, "learning_rate": 0.0002964089326052102, "loss": 6.0132, "mean_token_accuracy": 0.1282704494893551, "num_tokens": 4573763.0, "step": 2410 }, { "entropy": 6.088792705535889, "epoch": 0.14091492589567045, "grad_norm": 1.0703125, "learning_rate": 0.0002952358924321949, "loss": 6.0044, "mean_token_accuracy": 0.13971484899520875, "num_tokens": 4583062.0, "step": 2415 }, { "entropy": 6.160576200485229, "epoch": 0.14120667522464697, "grad_norm": 1.015625, "learning_rate": 0.00029406229748196657, "loss": 6.0049, "mean_token_accuracy": 0.1300945073366165, "num_tokens": 4592247.0, "step": 2420 }, { "entropy": 6.049785470962524, "epoch": 0.14149842455362352, "grad_norm": 1.0625, "learning_rate": 0.0002928881799292235, "loss": 5.9297, "mean_token_accuracy": 0.13601833581924438, "num_tokens": 4601862.0, "step": 2425 }, { "entropy": 6.123089218139649, "epoch": 0.14179017388260007, "grad_norm": 1.1015625, "learning_rate": 0.00029171357196299154, "loss": 5.9442, "mean_token_accuracy": 0.14178707599639892, "num_tokens": 4610613.0, "step": 2430 }, { "entropy": 6.128375244140625, "epoch": 0.14208192321157662, "grad_norm": 0.91015625, "learning_rate": 0.0002905385057857414, "loss": 6.0802, "mean_token_accuracy": 0.1361641526222229, "num_tokens": 4621557.0, "step": 2435 }, { "entropy": 6.056922101974488, "epoch": 0.14237367254055316, "grad_norm": 1.0234375, "learning_rate": 0.0002893630136125058, "loss": 6.0376, "mean_token_accuracy": 0.12935881689190865, "num_tokens": 4631111.0, "step": 2440 }, { "entropy": 6.109204339981079, "epoch": 0.1426654218695297, "grad_norm": 1.0078125, "learning_rate": 0.0002881871276699967, "loss": 6.0496, "mean_token_accuracy": 0.13275820761919022, "num_tokens": 4640753.0, "step": 2445 }, { "entropy": 6.178110218048095, "epoch": 0.14295717119850623, "grad_norm": 0.92578125, "learning_rate": 0.00028701088019572114, "loss": 6.0044, "mean_token_accuracy": 0.1331684447824955, "num_tokens": 4651226.0, "step": 2450 }, { "entropy": 6.040668582916259, "epoch": 0.14324892052748278, "grad_norm": 1.0390625, "learning_rate": 0.0002858343034370977, "loss": 5.9114, "mean_token_accuracy": 0.13811235800385474, "num_tokens": 4661303.0, "step": 2455 }, { "entropy": 6.034663486480713, "epoch": 0.14354066985645933, "grad_norm": 1.0, "learning_rate": 0.00028465742965057267, "loss": 6.0288, "mean_token_accuracy": 0.13574993163347243, "num_tokens": 4670380.0, "step": 2460 }, { "entropy": 6.162771701812744, "epoch": 0.14383241918543588, "grad_norm": 1.0703125, "learning_rate": 0.00028348029110073533, "loss": 6.0914, "mean_token_accuracy": 0.13298429995775224, "num_tokens": 4680219.0, "step": 2465 }, { "entropy": 6.1167665958404545, "epoch": 0.14412416851441243, "grad_norm": 1.0234375, "learning_rate": 0.00028230292005943365, "loss": 5.9838, "mean_token_accuracy": 0.13663672134280205, "num_tokens": 4689667.0, "step": 2470 }, { "entropy": 6.099624300003052, "epoch": 0.14441591784338895, "grad_norm": 1.171875, "learning_rate": 0.00028112534880488945, "loss": 5.9561, "mean_token_accuracy": 0.1408042088150978, "num_tokens": 4698801.0, "step": 2475 }, { "entropy": 6.209147024154663, "epoch": 0.1447076671723655, "grad_norm": 0.9609375, "learning_rate": 0.0002799476096208137, "loss": 6.1095, "mean_token_accuracy": 0.12842155173420905, "num_tokens": 4709398.0, "step": 2480 }, { "entropy": 6.107708263397217, "epoch": 0.14499941650134204, "grad_norm": 0.9921875, "learning_rate": 0.00027876973479552087, "loss": 5.9758, "mean_token_accuracy": 0.1377686306834221, "num_tokens": 4718082.0, "step": 2485 }, { "entropy": 6.053830575942993, "epoch": 0.1452911658303186, "grad_norm": 0.984375, "learning_rate": 0.00027759175662104424, "loss": 5.973, "mean_token_accuracy": 0.13549438789486884, "num_tokens": 4728122.0, "step": 2490 }, { "entropy": 6.171555519104004, "epoch": 0.14558291515929514, "grad_norm": 1.03125, "learning_rate": 0.0002764137073922508, "loss": 6.0576, "mean_token_accuracy": 0.13965055495500564, "num_tokens": 4738078.0, "step": 2495 }, { "entropy": 6.111799240112305, "epoch": 0.1458746644882717, "grad_norm": 1.0, "learning_rate": 0.00027523561940595505, "loss": 5.9423, "mean_token_accuracy": 0.13925925344228746, "num_tokens": 4747132.0, "step": 2500 }, { "entropy": 6.114526176452637, "epoch": 0.1461664138172482, "grad_norm": 1.0625, "learning_rate": 0.0002740575249600342, "loss": 5.9618, "mean_token_accuracy": 0.14162555187940598, "num_tokens": 4756392.0, "step": 2505 }, { "entropy": 5.990750360488891, "epoch": 0.14645816314622476, "grad_norm": 1.0703125, "learning_rate": 0.00027287945635254263, "loss": 5.9853, "mean_token_accuracy": 0.13961677849292756, "num_tokens": 4765492.0, "step": 2510 }, { "entropy": 6.10812292098999, "epoch": 0.1467499124752013, "grad_norm": 1.0, "learning_rate": 0.00027170144588082635, "loss": 6.0067, "mean_token_accuracy": 0.13272907435894013, "num_tokens": 4774635.0, "step": 2515 }, { "entropy": 6.110986614227295, "epoch": 0.14704166180417785, "grad_norm": 1.0234375, "learning_rate": 0.00027052352584063763, "loss": 5.9091, "mean_token_accuracy": 0.14452143907546997, "num_tokens": 4784542.0, "step": 2520 }, { "entropy": 6.097382688522339, "epoch": 0.1473334111331544, "grad_norm": 1.0546875, "learning_rate": 0.00026934572852524907, "loss": 5.9974, "mean_token_accuracy": 0.13697264865040779, "num_tokens": 4793245.0, "step": 2525 }, { "entropy": 6.0698380947113035, "epoch": 0.14762516046213095, "grad_norm": 1.15625, "learning_rate": 0.00026816808622456937, "loss": 5.8884, "mean_token_accuracy": 0.14629276543855668, "num_tokens": 4801576.0, "step": 2530 }, { "entropy": 6.065158843994141, "epoch": 0.14791690979110747, "grad_norm": 1.0234375, "learning_rate": 0.0002669906312242569, "loss": 5.9188, "mean_token_accuracy": 0.14538922160863876, "num_tokens": 4809742.0, "step": 2535 }, { "entropy": 6.059357643127441, "epoch": 0.14820865912008402, "grad_norm": 1.078125, "learning_rate": 0.00026581339580483525, "loss": 5.9825, "mean_token_accuracy": 0.14246814250946044, "num_tokens": 4820110.0, "step": 2540 }, { "entropy": 6.152837419509888, "epoch": 0.14850040844906057, "grad_norm": 1.03125, "learning_rate": 0.0002646364122408082, "loss": 5.9469, "mean_token_accuracy": 0.14219153597950934, "num_tokens": 4828843.0, "step": 2545 }, { "entropy": 6.047616100311279, "epoch": 0.14879215777803712, "grad_norm": 1.4609375, "learning_rate": 0.0002634597127997749, "loss": 5.9368, "mean_token_accuracy": 0.14226388707756996, "num_tokens": 4838835.0, "step": 2550 }, { "entropy": 6.015814018249512, "epoch": 0.14908390710701366, "grad_norm": 1.0, "learning_rate": 0.0002622833297415445, "loss": 5.8561, "mean_token_accuracy": 0.13575126305222512, "num_tokens": 4848055.0, "step": 2555 }, { "entropy": 6.080614185333252, "epoch": 0.14937565643599018, "grad_norm": 1.03125, "learning_rate": 0.0002611072953172531, "loss": 5.931, "mean_token_accuracy": 0.13824644461274146, "num_tokens": 4857564.0, "step": 2560 }, { "entropy": 5.9679922580719, "epoch": 0.14966740576496673, "grad_norm": 1.078125, "learning_rate": 0.00025993164176847845, "loss": 5.8316, "mean_token_accuracy": 0.14536818563938142, "num_tokens": 4865841.0, "step": 2565 }, { "entropy": 5.9873395442962645, "epoch": 0.14995915509394328, "grad_norm": 1.0703125, "learning_rate": 0.0002587564013263564, "loss": 5.9094, "mean_token_accuracy": 0.1428757280111313, "num_tokens": 4874967.0, "step": 2570 }, { "entropy": 6.153641319274902, "epoch": 0.15025090442291983, "grad_norm": 1.09375, "learning_rate": 0.0002575816062106974, "loss": 5.9139, "mean_token_accuracy": 0.1396403469145298, "num_tokens": 4883439.0, "step": 2575 }, { "entropy": 6.063961839675903, "epoch": 0.15054265375189638, "grad_norm": 1.09375, "learning_rate": 0.00025640728862910293, "loss": 5.9448, "mean_token_accuracy": 0.13880855590105057, "num_tokens": 4892694.0, "step": 2580 }, { "entropy": 6.055100393295288, "epoch": 0.15083440308087293, "grad_norm": 1.015625, "learning_rate": 0.00025523348077608285, "loss": 5.897, "mean_token_accuracy": 0.1369130827486515, "num_tokens": 4901388.0, "step": 2585 }, { "entropy": 6.080492448806763, "epoch": 0.15112615240984945, "grad_norm": 1.0703125, "learning_rate": 0.00025406021483217225, "loss": 5.9181, "mean_token_accuracy": 0.14280352666974067, "num_tokens": 4911348.0, "step": 2590 }, { "entropy": 6.0501851558685305, "epoch": 0.151417901738826, "grad_norm": 1.140625, "learning_rate": 0.00025288752296304963, "loss": 5.8717, "mean_token_accuracy": 0.13778910115361215, "num_tokens": 4920844.0, "step": 2595 }, { "entropy": 5.984165191650391, "epoch": 0.15170965106780254, "grad_norm": 1.0078125, "learning_rate": 0.000251715437318655, "loss": 5.8849, "mean_token_accuracy": 0.1374461717903614, "num_tokens": 4930052.0, "step": 2600 }, { "entropy": 6.111906480789185, "epoch": 0.1520014003967791, "grad_norm": 1.0234375, "learning_rate": 0.0002505439900323084, "loss": 5.9468, "mean_token_accuracy": 0.14332334846258163, "num_tokens": 4939166.0, "step": 2605 }, { "entropy": 6.058598613739013, "epoch": 0.15229314972575564, "grad_norm": 1.03125, "learning_rate": 0.00024937321321982894, "loss": 5.9688, "mean_token_accuracy": 0.13846543580293655, "num_tokens": 4948334.0, "step": 2610 }, { "entropy": 6.12415075302124, "epoch": 0.1525848990547322, "grad_norm": 0.96484375, "learning_rate": 0.00024820313897865433, "loss": 6.0144, "mean_token_accuracy": 0.1384118027985096, "num_tokens": 4958245.0, "step": 2615 }, { "entropy": 6.115054178237915, "epoch": 0.1528766483837087, "grad_norm": 1.046875, "learning_rate": 0.00024703379938696105, "loss": 5.9209, "mean_token_accuracy": 0.13665172830224037, "num_tokens": 4967708.0, "step": 2620 }, { "entropy": 6.010182428359985, "epoch": 0.15316839771268526, "grad_norm": 1.0859375, "learning_rate": 0.00024586522650278447, "loss": 5.98, "mean_token_accuracy": 0.13535310477018356, "num_tokens": 4976727.0, "step": 2625 }, { "entropy": 5.934082746505737, "epoch": 0.1534601470416618, "grad_norm": 1.0859375, "learning_rate": 0.00024469745236314064, "loss": 5.8608, "mean_token_accuracy": 0.14374621510505675, "num_tokens": 4985599.0, "step": 2630 }, { "entropy": 6.145913887023926, "epoch": 0.15375189637063835, "grad_norm": 0.94921875, "learning_rate": 0.00024353050898314767, "loss": 5.9841, "mean_token_accuracy": 0.138478884100914, "num_tokens": 4995934.0, "step": 2635 }, { "entropy": 6.10263876914978, "epoch": 0.1540436456996149, "grad_norm": 0.90625, "learning_rate": 0.00024236442835514743, "loss": 5.9324, "mean_token_accuracy": 0.1366652801632881, "num_tokens": 5005590.0, "step": 2640 }, { "entropy": 5.94466609954834, "epoch": 0.15433539502859142, "grad_norm": 0.97265625, "learning_rate": 0.00024119924244782965, "loss": 5.8964, "mean_token_accuracy": 0.13653595745563507, "num_tokens": 5015453.0, "step": 2645 }, { "entropy": 6.07912244796753, "epoch": 0.15462714435756797, "grad_norm": 1.0546875, "learning_rate": 0.00024003498320535462, "loss": 5.9804, "mean_token_accuracy": 0.14280492663383484, "num_tokens": 5025136.0, "step": 2650 }, { "entropy": 6.05559515953064, "epoch": 0.15491889368654452, "grad_norm": 1.015625, "learning_rate": 0.00023887168254647727, "loss": 5.8736, "mean_token_accuracy": 0.13317790552973746, "num_tokens": 5034838.0, "step": 2655 }, { "entropy": 6.057173538208008, "epoch": 0.15521064301552107, "grad_norm": 0.88671875, "learning_rate": 0.00023770937236367308, "loss": 5.8705, "mean_token_accuracy": 0.1401037745177746, "num_tokens": 5044970.0, "step": 2660 }, { "entropy": 6.178555107116699, "epoch": 0.15550239234449761, "grad_norm": 1.0546875, "learning_rate": 0.00023654808452226278, "loss": 6.0939, "mean_token_accuracy": 0.13883488550782203, "num_tokens": 5054945.0, "step": 2665 }, { "entropy": 6.067953443527221, "epoch": 0.15579414167347416, "grad_norm": 1.1328125, "learning_rate": 0.00023538785085953912, "loss": 5.8947, "mean_token_accuracy": 0.13750653117895126, "num_tokens": 5064588.0, "step": 2670 }, { "entropy": 6.067738580703735, "epoch": 0.15608589100245068, "grad_norm": 1.0859375, "learning_rate": 0.00023422870318389404, "loss": 5.941, "mean_token_accuracy": 0.13957893401384353, "num_tokens": 5074924.0, "step": 2675 }, { "entropy": 6.013417530059814, "epoch": 0.15637764033142723, "grad_norm": 1.015625, "learning_rate": 0.0002330706732739468, "loss": 5.8744, "mean_token_accuracy": 0.14573107957839965, "num_tokens": 5083601.0, "step": 2680 }, { "entropy": 6.001936149597168, "epoch": 0.15666938966040378, "grad_norm": 1.0078125, "learning_rate": 0.00023191379287767211, "loss": 5.8342, "mean_token_accuracy": 0.1469048775732517, "num_tokens": 5093500.0, "step": 2685 }, { "entropy": 6.06051721572876, "epoch": 0.15696113898938033, "grad_norm": 1.0390625, "learning_rate": 0.0002307580937115305, "loss": 5.7508, "mean_token_accuracy": 0.1494755744934082, "num_tokens": 5102178.0, "step": 2690 }, { "entropy": 5.993919372558594, "epoch": 0.15725288831835688, "grad_norm": 1.03125, "learning_rate": 0.00022960360745959846, "loss": 5.8858, "mean_token_accuracy": 0.14383454471826554, "num_tokens": 5110999.0, "step": 2695 }, { "entropy": 6.09775972366333, "epoch": 0.15754463764733342, "grad_norm": 1.0, "learning_rate": 0.00022845036577269972, "loss": 6.0099, "mean_token_accuracy": 0.1328982025384903, "num_tokens": 5120623.0, "step": 2700 }, { "entropy": 6.1089558601379395, "epoch": 0.15783638697630994, "grad_norm": 1.0078125, "learning_rate": 0.00022729840026753777, "loss": 5.9253, "mean_token_accuracy": 0.1386694572865963, "num_tokens": 5129671.0, "step": 2705 }, { "entropy": 6.073097181320191, "epoch": 0.1581281363052865, "grad_norm": 0.96484375, "learning_rate": 0.0002261477425258287, "loss": 5.8923, "mean_token_accuracy": 0.14483443424105644, "num_tokens": 5138614.0, "step": 2710 }, { "entropy": 6.124736642837524, "epoch": 0.15841988563426304, "grad_norm": 1.046875, "learning_rate": 0.0002249984240934358, "loss": 5.9174, "mean_token_accuracy": 0.14498594552278518, "num_tokens": 5148351.0, "step": 2715 }, { "entropy": 6.035539150238037, "epoch": 0.1587116349632396, "grad_norm": 1.0703125, "learning_rate": 0.00022385047647950464, "loss": 5.8949, "mean_token_accuracy": 0.13273870199918747, "num_tokens": 5158592.0, "step": 2720 }, { "entropy": 6.073336935043335, "epoch": 0.15900338429221614, "grad_norm": 1.125, "learning_rate": 0.0002227039311555986, "loss": 5.8747, "mean_token_accuracy": 0.14133515432476998, "num_tokens": 5167383.0, "step": 2725 }, { "entropy": 6.112156391143799, "epoch": 0.15929513362119266, "grad_norm": 0.94921875, "learning_rate": 0.0002215588195548372, "loss": 6.0548, "mean_token_accuracy": 0.1266437642276287, "num_tokens": 5177192.0, "step": 2730 }, { "entropy": 6.092114686965942, "epoch": 0.1595868829501692, "grad_norm": 1.1875, "learning_rate": 0.00022041517307103337, "loss": 5.9684, "mean_token_accuracy": 0.13050038665533065, "num_tokens": 5187890.0, "step": 2735 }, { "entropy": 6.140649461746216, "epoch": 0.15987863227914575, "grad_norm": 1.0625, "learning_rate": 0.0002192730230578331, "loss": 6.0046, "mean_token_accuracy": 0.13416488394141196, "num_tokens": 5197571.0, "step": 2740 }, { "entropy": 6.050485706329345, "epoch": 0.1601703816081223, "grad_norm": 1.0234375, "learning_rate": 0.0002181324008278559, "loss": 5.9753, "mean_token_accuracy": 0.13092653825879097, "num_tokens": 5206923.0, "step": 2745 }, { "entropy": 6.1053454875946045, "epoch": 0.16046213093709885, "grad_norm": 0.99609375, "learning_rate": 0.00021699333765183655, "loss": 5.9261, "mean_token_accuracy": 0.14082997888326645, "num_tokens": 5216567.0, "step": 2750 }, { "entropy": 6.00426607131958, "epoch": 0.1607538802660754, "grad_norm": 1.015625, "learning_rate": 0.0002158558647577673, "loss": 5.8069, "mean_token_accuracy": 0.14154668897390366, "num_tokens": 5225862.0, "step": 2755 }, { "entropy": 6.000382614135742, "epoch": 0.16104562959505192, "grad_norm": 1.0234375, "learning_rate": 0.00021472001333004215, "loss": 5.9596, "mean_token_accuracy": 0.13876780420541762, "num_tokens": 5235919.0, "step": 2760 }, { "entropy": 6.104824113845825, "epoch": 0.16133737892402847, "grad_norm": 1.1015625, "learning_rate": 0.00021358581450860186, "loss": 5.8815, "mean_token_accuracy": 0.1419053629040718, "num_tokens": 5245125.0, "step": 2765 }, { "entropy": 5.9989981174469, "epoch": 0.16162912825300502, "grad_norm": 0.9765625, "learning_rate": 0.0002124532993880799, "loss": 5.7302, "mean_token_accuracy": 0.15449366718530655, "num_tokens": 5254341.0, "step": 2770 }, { "entropy": 5.942910671234131, "epoch": 0.16192087758198156, "grad_norm": 1.078125, "learning_rate": 0.00021132249901695044, "loss": 5.8397, "mean_token_accuracy": 0.14861955791711806, "num_tokens": 5263470.0, "step": 2775 }, { "entropy": 6.055013132095337, "epoch": 0.1622126269109581, "grad_norm": 1.0078125, "learning_rate": 0.00021019344439667705, "loss": 5.9507, "mean_token_accuracy": 0.1320488780736923, "num_tokens": 5273425.0, "step": 2780 }, { "entropy": 6.076160669326782, "epoch": 0.16250437623993466, "grad_norm": 1.0703125, "learning_rate": 0.00020906616648086213, "loss": 6.0262, "mean_token_accuracy": 0.14037303403019905, "num_tokens": 5282530.0, "step": 2785 }, { "entropy": 6.019495344161987, "epoch": 0.16279612556891118, "grad_norm": 1.046875, "learning_rate": 0.00020794069617439942, "loss": 5.8767, "mean_token_accuracy": 0.14658062309026718, "num_tokens": 5290997.0, "step": 2790 }, { "entropy": 6.0506243228912355, "epoch": 0.16308787489788773, "grad_norm": 0.93359375, "learning_rate": 0.00020681706433262593, "loss": 5.9504, "mean_token_accuracy": 0.13620981499552726, "num_tokens": 5301781.0, "step": 2795 }, { "entropy": 6.093423652648926, "epoch": 0.16337962422686428, "grad_norm": 1.0390625, "learning_rate": 0.00020569530176047602, "loss": 5.8574, "mean_token_accuracy": 0.14253985211253167, "num_tokens": 5311256.0, "step": 2800 }, { "entropy": 6.068989706039429, "epoch": 0.16367137355584083, "grad_norm": 1.0234375, "learning_rate": 0.0002045754392116374, "loss": 5.9108, "mean_token_accuracy": 0.13667885661125184, "num_tokens": 5320458.0, "step": 2805 }, { "entropy": 5.997001647949219, "epoch": 0.16396312288481737, "grad_norm": 1.0390625, "learning_rate": 0.00020345750738770757, "loss": 5.8018, "mean_token_accuracy": 0.1458800107240677, "num_tokens": 5330411.0, "step": 2810 }, { "entropy": 6.098129320144653, "epoch": 0.1642548722137939, "grad_norm": 0.91796875, "learning_rate": 0.00020234153693735214, "loss": 5.9696, "mean_token_accuracy": 0.12953805774450303, "num_tokens": 5340911.0, "step": 2815 }, { "entropy": 6.080776023864746, "epoch": 0.16454662154277044, "grad_norm": 1.0234375, "learning_rate": 0.0002012275584554647, "loss": 5.8799, "mean_token_accuracy": 0.14661106169223787, "num_tokens": 5350608.0, "step": 2820 }, { "entropy": 6.045346450805664, "epoch": 0.164838370871747, "grad_norm": 1.109375, "learning_rate": 0.00020011560248232803, "loss": 5.9228, "mean_token_accuracy": 0.13775852844119071, "num_tokens": 5359929.0, "step": 2825 }, { "entropy": 6.088241815567017, "epoch": 0.16513012020072354, "grad_norm": 1.0859375, "learning_rate": 0.00019900569950277692, "loss": 5.8719, "mean_token_accuracy": 0.14300134778022766, "num_tokens": 5369025.0, "step": 2830 }, { "entropy": 5.926961278915405, "epoch": 0.1654218695297001, "grad_norm": 1.0390625, "learning_rate": 0.00019789787994536228, "loss": 5.7771, "mean_token_accuracy": 0.1498278111219406, "num_tokens": 5378260.0, "step": 2835 }, { "entropy": 5.974400472640991, "epoch": 0.16571361885867664, "grad_norm": 0.97265625, "learning_rate": 0.00019679217418151667, "loss": 5.8522, "mean_token_accuracy": 0.143273513764143, "num_tokens": 5387524.0, "step": 2840 }, { "entropy": 6.0697774410247805, "epoch": 0.16600536818765316, "grad_norm": 1.0078125, "learning_rate": 0.00019568861252472236, "loss": 5.8223, "mean_token_accuracy": 0.15310993790626526, "num_tokens": 5396495.0, "step": 2845 }, { "entropy": 6.030423736572265, "epoch": 0.1662971175166297, "grad_norm": 1.015625, "learning_rate": 0.00019458722522967952, "loss": 5.9322, "mean_token_accuracy": 0.1452712744474411, "num_tokens": 5406624.0, "step": 2850 }, { "entropy": 5.970934820175171, "epoch": 0.16658886684560625, "grad_norm": 1.2265625, "learning_rate": 0.00019348804249147723, "loss": 5.8656, "mean_token_accuracy": 0.13966285288333893, "num_tokens": 5415738.0, "step": 2855 }, { "entropy": 6.051425218582153, "epoch": 0.1668806161745828, "grad_norm": 1.1328125, "learning_rate": 0.0001923910944447655, "loss": 5.8702, "mean_token_accuracy": 0.1442988932132721, "num_tokens": 5424469.0, "step": 2860 }, { "entropy": 6.093666505813599, "epoch": 0.16717236550355935, "grad_norm": 1.0625, "learning_rate": 0.00019129641116292928, "loss": 5.8642, "mean_token_accuracy": 0.14960020035505295, "num_tokens": 5433989.0, "step": 2865 }, { "entropy": 5.988446140289307, "epoch": 0.1674641148325359, "grad_norm": 1.0859375, "learning_rate": 0.00019020402265726343, "loss": 5.8997, "mean_token_accuracy": 0.13471955358982085, "num_tokens": 5444470.0, "step": 2870 }, { "entropy": 6.030282115936279, "epoch": 0.16775586416151242, "grad_norm": 1.078125, "learning_rate": 0.0001891139588761509, "loss": 5.8569, "mean_token_accuracy": 0.15230374932289123, "num_tokens": 5452888.0, "step": 2875 }, { "entropy": 6.032169675827026, "epoch": 0.16804761349048897, "grad_norm": 1.078125, "learning_rate": 0.00018802624970424076, "loss": 5.749, "mean_token_accuracy": 0.15015550553798676, "num_tokens": 5462238.0, "step": 2880 }, { "entropy": 5.957490491867065, "epoch": 0.16833936281946552, "grad_norm": 0.96875, "learning_rate": 0.00018694092496162945, "loss": 5.8234, "mean_token_accuracy": 0.14722683280706406, "num_tokens": 5471677.0, "step": 2885 }, { "entropy": 5.960818767547607, "epoch": 0.16863111214844206, "grad_norm": 1.0625, "learning_rate": 0.00018585801440304306, "loss": 5.7365, "mean_token_accuracy": 0.14228329360485076, "num_tokens": 5480410.0, "step": 2890 }, { "entropy": 6.09484372138977, "epoch": 0.1689228614774186, "grad_norm": 1.1171875, "learning_rate": 0.00018477754771702165, "loss": 6.0165, "mean_token_accuracy": 0.13433389142155647, "num_tokens": 5489073.0, "step": 2895 }, { "entropy": 6.085838413238525, "epoch": 0.16921461080639513, "grad_norm": 1.109375, "learning_rate": 0.00018369955452510506, "loss": 5.9362, "mean_token_accuracy": 0.1429956153035164, "num_tokens": 5499075.0, "step": 2900 }, { "entropy": 6.072705221176148, "epoch": 0.16950636013537168, "grad_norm": 1.078125, "learning_rate": 0.0001826240643810212, "loss": 5.9514, "mean_token_accuracy": 0.14289605990052223, "num_tokens": 5509280.0, "step": 2905 }, { "entropy": 6.048653411865234, "epoch": 0.16979810946434823, "grad_norm": 0.98828125, "learning_rate": 0.0001815511067698758, "loss": 5.8695, "mean_token_accuracy": 0.13732953518629074, "num_tokens": 5518750.0, "step": 2910 }, { "entropy": 6.091159248352051, "epoch": 0.17008985879332478, "grad_norm": 1.1796875, "learning_rate": 0.0001804807111073436, "loss": 5.8803, "mean_token_accuracy": 0.14374977126717567, "num_tokens": 5528443.0, "step": 2915 }, { "entropy": 6.060678482055664, "epoch": 0.17038160812230133, "grad_norm": 1.0390625, "learning_rate": 0.0001794129067388625, "loss": 5.8407, "mean_token_accuracy": 0.1465306468307972, "num_tokens": 5537646.0, "step": 2920 }, { "entropy": 6.0398924350738525, "epoch": 0.17067335745127787, "grad_norm": 1.0390625, "learning_rate": 0.00017834772293882868, "loss": 5.8269, "mean_token_accuracy": 0.1500069558620453, "num_tokens": 5547027.0, "step": 2925 }, { "entropy": 6.058400297164917, "epoch": 0.1709651067802544, "grad_norm": 1.015625, "learning_rate": 0.000177285188909794, "loss": 5.911, "mean_token_accuracy": 0.14219145476818085, "num_tokens": 5556645.0, "step": 2930 }, { "entropy": 5.983715200424195, "epoch": 0.17125685610923094, "grad_norm": 1.0078125, "learning_rate": 0.0001762253337816656, "loss": 5.8125, "mean_token_accuracy": 0.14482296258211136, "num_tokens": 5566266.0, "step": 2935 }, { "entropy": 5.9874872207641605, "epoch": 0.1715486054382075, "grad_norm": 1.1328125, "learning_rate": 0.00017516818661090738, "loss": 5.7831, "mean_token_accuracy": 0.15274099111557007, "num_tokens": 5575715.0, "step": 2940 }, { "entropy": 6.064141082763672, "epoch": 0.17184035476718404, "grad_norm": 0.98046875, "learning_rate": 0.0001741137763797428, "loss": 5.9109, "mean_token_accuracy": 0.14370758086442947, "num_tokens": 5584311.0, "step": 2945 }, { "entropy": 6.031230497360229, "epoch": 0.1721321040961606, "grad_norm": 1.0859375, "learning_rate": 0.00017306213199536115, "loss": 5.8661, "mean_token_accuracy": 0.1443212330341339, "num_tokens": 5594110.0, "step": 2950 }, { "entropy": 6.044523668289185, "epoch": 0.17242385342513714, "grad_norm": 1.046875, "learning_rate": 0.0001720132822891243, "loss": 5.8734, "mean_token_accuracy": 0.14023427292704582, "num_tokens": 5603266.0, "step": 2955 }, { "entropy": 6.053596162796021, "epoch": 0.17271560275411366, "grad_norm": 1.015625, "learning_rate": 0.0001709672560157769, "loss": 5.8288, "mean_token_accuracy": 0.14189991652965545, "num_tokens": 5613105.0, "step": 2960 }, { "entropy": 6.043732070922852, "epoch": 0.1730073520830902, "grad_norm": 1.109375, "learning_rate": 0.00016992408185265758, "loss": 5.8523, "mean_token_accuracy": 0.13648542538285255, "num_tokens": 5621862.0, "step": 2965 }, { "entropy": 6.057532119750976, "epoch": 0.17329910141206675, "grad_norm": 1.0546875, "learning_rate": 0.00016888378839891298, "loss": 5.8793, "mean_token_accuracy": 0.14230196923017502, "num_tokens": 5630564.0, "step": 2970 }, { "entropy": 6.163407611846924, "epoch": 0.1735908507410433, "grad_norm": 1.0625, "learning_rate": 0.0001678464041747137, "loss": 6.0071, "mean_token_accuracy": 0.1394879087805748, "num_tokens": 5641429.0, "step": 2975 }, { "entropy": 6.146255159378052, "epoch": 0.17388260007001985, "grad_norm": 1.015625, "learning_rate": 0.00016681195762047223, "loss": 6.1251, "mean_token_accuracy": 0.1400466650724411, "num_tokens": 5651239.0, "step": 2980 }, { "entropy": 6.05663537979126, "epoch": 0.17417434939899637, "grad_norm": 1.015625, "learning_rate": 0.00016578047709606337, "loss": 5.7851, "mean_token_accuracy": 0.14893259853124619, "num_tokens": 5659848.0, "step": 2985 }, { "entropy": 6.0152841091156, "epoch": 0.17446609872797292, "grad_norm": 1.109375, "learning_rate": 0.00016475199088004678, "loss": 5.824, "mean_token_accuracy": 0.14212177693843842, "num_tokens": 5668767.0, "step": 2990 }, { "entropy": 6.074228811264038, "epoch": 0.17475784805694947, "grad_norm": 1.046875, "learning_rate": 0.00016372652716889163, "loss": 5.9407, "mean_token_accuracy": 0.14109326303005218, "num_tokens": 5679053.0, "step": 2995 }, { "entropy": 6.091854429244995, "epoch": 0.17504959738592601, "grad_norm": 1.09375, "learning_rate": 0.0001627041140762035, "loss": 5.9487, "mean_token_accuracy": 0.14340727925300598, "num_tokens": 5689187.0, "step": 3000 } ], "logging_steps": 5, "max_steps": 4000, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 8303370854400000.0, "train_batch_size": 16, "trial_name": null, "trial_params": null }