{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.029174932897654337, "eval_steps": 500, "global_step": 500, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 10.69196834564209, "epoch": 0.00029174932897654333, "grad_norm": 13.0625, "learning_rate": 2e-06, "loss": 10.8036, "mean_token_accuracy": 0.0, "num_tokens": 9376.0, "step": 5 }, { "entropy": 10.691983699798584, "epoch": 0.0005834986579530867, "grad_norm": 13.0625, "learning_rate": 4.5e-06, "loss": 10.7354, "mean_token_accuracy": 0.00011641443707048893, "num_tokens": 18416.0, "step": 10 }, { "entropy": 10.690966510772705, "epoch": 0.00087524798692963, "grad_norm": 10.0625, "learning_rate": 7e-06, "loss": 10.5172, "mean_token_accuracy": 0.029424548242241146, "num_tokens": 27778.0, "step": 15 }, { "entropy": 10.678794956207275, "epoch": 0.0011669973159061733, "grad_norm": 5.90625, "learning_rate": 9.5e-06, "loss": 10.2454, "mean_token_accuracy": 0.04061399847269058, "num_tokens": 37698.0, "step": 20 }, { "entropy": 10.63073034286499, "epoch": 0.0014587466448827168, "grad_norm": 4.1875, "learning_rate": 1.2e-05, "loss": 9.9716, "mean_token_accuracy": 0.04182791076600552, "num_tokens": 47412.0, "step": 25 }, { "entropy": 10.602538585662842, "epoch": 0.00175049597385926, "grad_norm": 3.21875, "learning_rate": 1.4500000000000002e-05, "loss": 9.7862, "mean_token_accuracy": 0.04080851711332798, "num_tokens": 56226.0, "step": 30 }, { "entropy": 10.595691585540772, "epoch": 0.0020422453028358036, "grad_norm": 2.859375, "learning_rate": 1.7000000000000003e-05, "loss": 9.6992, "mean_token_accuracy": 0.04258432537317276, "num_tokens": 65953.0, "step": 35 }, { "entropy": 10.587265396118164, "epoch": 0.0023339946318123466, "grad_norm": 2.703125, "learning_rate": 1.95e-05, "loss": 9.6666, "mean_token_accuracy": 0.040068139880895616, "num_tokens": 74939.0, "step": 40 }, { "entropy": 10.5896146774292, "epoch": 0.00262574396078889, "grad_norm": 2.5625, "learning_rate": 2.2e-05, "loss": 9.6425, "mean_token_accuracy": 0.04199751690030098, "num_tokens": 83855.0, "step": 45 }, { "entropy": 10.573621463775634, "epoch": 0.0029174932897654336, "grad_norm": 2.359375, "learning_rate": 2.4500000000000003e-05, "loss": 9.5754, "mean_token_accuracy": 0.045654605329036715, "num_tokens": 93561.0, "step": 50 }, { "entropy": 10.557998752593994, "epoch": 0.003209242618741977, "grad_norm": 2.1875, "learning_rate": 2.7e-05, "loss": 9.479, "mean_token_accuracy": 0.05661129578948021, "num_tokens": 103395.0, "step": 55 }, { "entropy": 10.49096736907959, "epoch": 0.00350099194771852, "grad_norm": 2.40625, "learning_rate": 2.95e-05, "loss": 9.4209, "mean_token_accuracy": 0.05532712675631046, "num_tokens": 112462.0, "step": 60 }, { "entropy": 10.353149223327637, "epoch": 0.0037927412766950636, "grad_norm": 2.34375, "learning_rate": 3.2e-05, "loss": 9.3195, "mean_token_accuracy": 0.05394121035933495, "num_tokens": 121553.0, "step": 65 }, { "entropy": 10.451189041137695, "epoch": 0.004084490605671607, "grad_norm": 2.234375, "learning_rate": 3.4500000000000005e-05, "loss": 9.2945, "mean_token_accuracy": 0.05459350645542145, "num_tokens": 131138.0, "step": 70 }, { "entropy": 10.415141296386718, "epoch": 0.00437623993464815, "grad_norm": 2.140625, "learning_rate": 3.7e-05, "loss": 9.2235, "mean_token_accuracy": 0.05688905864953995, "num_tokens": 140171.0, "step": 75 }, { "entropy": 10.439569473266602, "epoch": 0.004667989263624693, "grad_norm": 2.046875, "learning_rate": 3.95e-05, "loss": 9.0989, "mean_token_accuracy": 0.055916853994131085, "num_tokens": 149483.0, "step": 80 }, { "entropy": 10.392880725860596, "epoch": 0.004959738592601237, "grad_norm": 1.8984375, "learning_rate": 4.2000000000000004e-05, "loss": 9.0805, "mean_token_accuracy": 0.05239327773451805, "num_tokens": 159190.0, "step": 85 }, { "entropy": 10.381812000274659, "epoch": 0.00525148792157778, "grad_norm": 1.84375, "learning_rate": 4.45e-05, "loss": 8.9431, "mean_token_accuracy": 0.05531255267560482, "num_tokens": 169601.0, "step": 90 }, { "entropy": 10.296150207519531, "epoch": 0.005543237250554324, "grad_norm": 1.9765625, "learning_rate": 4.7000000000000004e-05, "loss": 8.8622, "mean_token_accuracy": 0.057431581988930704, "num_tokens": 179268.0, "step": 95 }, { "entropy": 10.249444198608398, "epoch": 0.005834986579530867, "grad_norm": 2.875, "learning_rate": 4.9500000000000004e-05, "loss": 8.7591, "mean_token_accuracy": 0.05835646912455559, "num_tokens": 188699.0, "step": 100 }, { "entropy": 10.191282558441163, "epoch": 0.00612673590850741, "grad_norm": 1.8359375, "learning_rate": 5.2e-05, "loss": 8.6842, "mean_token_accuracy": 0.05705415904521942, "num_tokens": 199939.0, "step": 105 }, { "entropy": 10.147027969360352, "epoch": 0.006418485237483954, "grad_norm": 2.0, "learning_rate": 5.45e-05, "loss": 8.5501, "mean_token_accuracy": 0.06250228881835937, "num_tokens": 209419.0, "step": 110 }, { "entropy": 10.024614429473877, "epoch": 0.006710234566460497, "grad_norm": 1.9375, "learning_rate": 5.7e-05, "loss": 8.4704, "mean_token_accuracy": 0.06286126635968685, "num_tokens": 218642.0, "step": 115 }, { "entropy": 9.988630104064942, "epoch": 0.00700198389543704, "grad_norm": 1.640625, "learning_rate": 5.9499999999999996e-05, "loss": 8.3393, "mean_token_accuracy": 0.061313451081514356, "num_tokens": 228358.0, "step": 120 }, { "entropy": 9.84273166656494, "epoch": 0.007293733224413584, "grad_norm": 1.875, "learning_rate": 6.2e-05, "loss": 8.1163, "mean_token_accuracy": 0.0694800227880478, "num_tokens": 237860.0, "step": 125 }, { "entropy": 9.692254257202148, "epoch": 0.007585482553390127, "grad_norm": 1.5625, "learning_rate": 6.450000000000001e-05, "loss": 8.1599, "mean_token_accuracy": 0.06262776851654053, "num_tokens": 247547.0, "step": 130 }, { "entropy": 9.467087554931641, "epoch": 0.007877231882366671, "grad_norm": 1.6015625, "learning_rate": 6.7e-05, "loss": 8.0195, "mean_token_accuracy": 0.07063104063272477, "num_tokens": 256405.0, "step": 135 }, { "entropy": 9.383435821533203, "epoch": 0.008168981211343214, "grad_norm": 1.421875, "learning_rate": 6.950000000000001e-05, "loss": 7.9616, "mean_token_accuracy": 0.06774205490946769, "num_tokens": 265249.0, "step": 140 }, { "entropy": 9.17911729812622, "epoch": 0.008460730540319757, "grad_norm": 1.2265625, "learning_rate": 7.2e-05, "loss": 7.8784, "mean_token_accuracy": 0.0681417278945446, "num_tokens": 275681.0, "step": 145 }, { "entropy": 8.988021278381348, "epoch": 0.0087524798692963, "grad_norm": 1.4453125, "learning_rate": 7.45e-05, "loss": 7.7636, "mean_token_accuracy": 0.07039406709372997, "num_tokens": 284957.0, "step": 150 }, { "entropy": 8.73282070159912, "epoch": 0.009044229198272843, "grad_norm": 1.390625, "learning_rate": 7.7e-05, "loss": 7.6563, "mean_token_accuracy": 0.07246890291571617, "num_tokens": 294010.0, "step": 155 }, { "entropy": 8.682876682281494, "epoch": 0.009335978527249386, "grad_norm": 1.125, "learning_rate": 7.950000000000001e-05, "loss": 7.7148, "mean_token_accuracy": 0.07290182597935199, "num_tokens": 303264.0, "step": 160 }, { "entropy": 8.486510944366454, "epoch": 0.009627727856225931, "grad_norm": 1.203125, "learning_rate": 8.2e-05, "loss": 7.5966, "mean_token_accuracy": 0.07415391989052296, "num_tokens": 313450.0, "step": 165 }, { "entropy": 8.362883186340332, "epoch": 0.009919477185202474, "grad_norm": 1.2265625, "learning_rate": 8.450000000000001e-05, "loss": 7.5375, "mean_token_accuracy": 0.07450749576091767, "num_tokens": 322764.0, "step": 170 }, { "entropy": 8.276646995544434, "epoch": 0.010211226514179017, "grad_norm": 1.296875, "learning_rate": 8.7e-05, "loss": 7.5492, "mean_token_accuracy": 0.07559143453836441, "num_tokens": 332228.0, "step": 175 }, { "entropy": 8.189496421813965, "epoch": 0.01050297584315556, "grad_norm": 1.296875, "learning_rate": 8.95e-05, "loss": 7.4578, "mean_token_accuracy": 0.07792975381016731, "num_tokens": 341589.0, "step": 180 }, { "entropy": 8.08325457572937, "epoch": 0.010794725172132104, "grad_norm": 1.09375, "learning_rate": 9.2e-05, "loss": 7.3998, "mean_token_accuracy": 0.07972711473703384, "num_tokens": 351166.0, "step": 185 }, { "entropy": 8.023299407958984, "epoch": 0.011086474501108648, "grad_norm": 1.25, "learning_rate": 9.45e-05, "loss": 7.4712, "mean_token_accuracy": 0.07630453184247017, "num_tokens": 360962.0, "step": 190 }, { "entropy": 7.986406993865967, "epoch": 0.011378223830085191, "grad_norm": 1.28125, "learning_rate": 9.7e-05, "loss": 7.4208, "mean_token_accuracy": 0.07656608372926713, "num_tokens": 370859.0, "step": 195 }, { "entropy": 7.958215236663818, "epoch": 0.011669973159061734, "grad_norm": 1.390625, "learning_rate": 9.95e-05, "loss": 7.4388, "mean_token_accuracy": 0.07721348851919174, "num_tokens": 381017.0, "step": 200 }, { "entropy": 7.953992605209351, "epoch": 0.011961722488038277, "grad_norm": 1.234375, "learning_rate": 0.000102, "loss": 7.4808, "mean_token_accuracy": 0.07665727399289608, "num_tokens": 390849.0, "step": 205 }, { "entropy": 7.941216659545899, "epoch": 0.01225347181701482, "grad_norm": 1.1171875, "learning_rate": 0.00010449999999999999, "loss": 7.4537, "mean_token_accuracy": 0.07717064693570137, "num_tokens": 401131.0, "step": 210 }, { "entropy": 7.940151929855347, "epoch": 0.012545221145991364, "grad_norm": 1.2109375, "learning_rate": 0.000107, "loss": 7.3567, "mean_token_accuracy": 0.07789909988641738, "num_tokens": 410171.0, "step": 215 }, { "entropy": 7.845122528076172, "epoch": 0.012836970474967908, "grad_norm": 1.3984375, "learning_rate": 0.0001095, "loss": 7.4298, "mean_token_accuracy": 0.07820538356900215, "num_tokens": 419352.0, "step": 220 }, { "entropy": 7.826071691513062, "epoch": 0.013128719803944451, "grad_norm": 1.0625, "learning_rate": 0.000112, "loss": 7.2948, "mean_token_accuracy": 0.08607594929635524, "num_tokens": 428862.0, "step": 225 }, { "entropy": 7.802604389190674, "epoch": 0.013420469132920994, "grad_norm": 1.140625, "learning_rate": 0.0001145, "loss": 7.2856, "mean_token_accuracy": 0.07789736986160278, "num_tokens": 438900.0, "step": 230 }, { "entropy": 7.759540748596192, "epoch": 0.013712218461897538, "grad_norm": 1.25, "learning_rate": 0.00011700000000000001, "loss": 7.2419, "mean_token_accuracy": 0.08156893700361252, "num_tokens": 447867.0, "step": 235 }, { "entropy": 7.753300333023072, "epoch": 0.01400396779087408, "grad_norm": 1.21875, "learning_rate": 0.00011949999999999999, "loss": 7.3329, "mean_token_accuracy": 0.074883484095335, "num_tokens": 457978.0, "step": 240 }, { "entropy": 7.775896072387695, "epoch": 0.014295717119850624, "grad_norm": 1.203125, "learning_rate": 0.000122, "loss": 7.2889, "mean_token_accuracy": 0.08151891827583313, "num_tokens": 466846.0, "step": 245 }, { "entropy": 7.732866048812866, "epoch": 0.014587466448827168, "grad_norm": 1.3515625, "learning_rate": 0.0001245, "loss": 7.2876, "mean_token_accuracy": 0.07967406883835793, "num_tokens": 475862.0, "step": 250 }, { "entropy": 7.682526159286499, "epoch": 0.014879215777803712, "grad_norm": 1.21875, "learning_rate": 0.000127, "loss": 7.3177, "mean_token_accuracy": 0.0773643635213375, "num_tokens": 486088.0, "step": 255 }, { "entropy": 7.789633178710938, "epoch": 0.015170965106780255, "grad_norm": 1.140625, "learning_rate": 0.0001295, "loss": 7.19, "mean_token_accuracy": 0.0791048213839531, "num_tokens": 495515.0, "step": 260 }, { "entropy": 7.739433479309082, "epoch": 0.015462714435756798, "grad_norm": 1.3125, "learning_rate": 0.000132, "loss": 7.314, "mean_token_accuracy": 0.07758257985115051, "num_tokens": 505617.0, "step": 265 }, { "entropy": 7.701812362670898, "epoch": 0.015754463764733342, "grad_norm": 1.078125, "learning_rate": 0.00013450000000000002, "loss": 7.2826, "mean_token_accuracy": 0.07801382765173911, "num_tokens": 515977.0, "step": 270 }, { "entropy": 7.724566078186035, "epoch": 0.016046213093709884, "grad_norm": 1.1171875, "learning_rate": 0.00013700000000000002, "loss": 7.3384, "mean_token_accuracy": 0.08092856109142303, "num_tokens": 526525.0, "step": 275 }, { "entropy": 7.645784378051758, "epoch": 0.01633796242268643, "grad_norm": 1.1484375, "learning_rate": 0.0001395, "loss": 7.2771, "mean_token_accuracy": 0.08373014777898788, "num_tokens": 536494.0, "step": 280 }, { "entropy": 7.622757911682129, "epoch": 0.01662971175166297, "grad_norm": 1.3203125, "learning_rate": 0.00014199999999999998, "loss": 7.3146, "mean_token_accuracy": 0.08114334717392921, "num_tokens": 545326.0, "step": 285 }, { "entropy": 7.662983512878418, "epoch": 0.016921461080639515, "grad_norm": 1.484375, "learning_rate": 0.0001445, "loss": 7.1416, "mean_token_accuracy": 0.08460377976298332, "num_tokens": 553678.0, "step": 290 }, { "entropy": 7.63046498298645, "epoch": 0.01721321040961606, "grad_norm": 1.46875, "learning_rate": 0.000147, "loss": 7.2891, "mean_token_accuracy": 0.08224759995937347, "num_tokens": 563860.0, "step": 295 }, { "entropy": 7.621852588653565, "epoch": 0.0175049597385926, "grad_norm": 1.234375, "learning_rate": 0.0001495, "loss": 7.238, "mean_token_accuracy": 0.08669779226183891, "num_tokens": 572492.0, "step": 300 }, { "entropy": 7.564120435714722, "epoch": 0.017796709067569146, "grad_norm": 1.28125, "learning_rate": 0.000152, "loss": 7.1166, "mean_token_accuracy": 0.08243767246603965, "num_tokens": 581840.0, "step": 305 }, { "entropy": 7.6293127059936525, "epoch": 0.018088458396545687, "grad_norm": 1.09375, "learning_rate": 0.00015450000000000001, "loss": 7.2465, "mean_token_accuracy": 0.0864152580499649, "num_tokens": 591697.0, "step": 310 }, { "entropy": 7.534941625595093, "epoch": 0.01838020772552223, "grad_norm": 1.375, "learning_rate": 0.000157, "loss": 7.1059, "mean_token_accuracy": 0.0846880093216896, "num_tokens": 601153.0, "step": 315 }, { "entropy": 7.607311391830445, "epoch": 0.018671957054498773, "grad_norm": 1.1796875, "learning_rate": 0.0001595, "loss": 7.1949, "mean_token_accuracy": 0.08106868788599968, "num_tokens": 609516.0, "step": 320 }, { "entropy": 7.579704999923706, "epoch": 0.018963706383475318, "grad_norm": 1.109375, "learning_rate": 0.000162, "loss": 7.2078, "mean_token_accuracy": 0.07954892218112945, "num_tokens": 618836.0, "step": 325 }, { "entropy": 7.576669311523437, "epoch": 0.019255455712451863, "grad_norm": 1.25, "learning_rate": 0.00016450000000000001, "loss": 7.2136, "mean_token_accuracy": 0.08916370049118996, "num_tokens": 628223.0, "step": 330 }, { "entropy": 7.503057956695557, "epoch": 0.019547205041428404, "grad_norm": 1.171875, "learning_rate": 0.00016700000000000002, "loss": 7.1113, "mean_token_accuracy": 0.08817728385329246, "num_tokens": 637609.0, "step": 335 }, { "entropy": 7.545721530914307, "epoch": 0.01983895437040495, "grad_norm": 1.1171875, "learning_rate": 0.00016950000000000003, "loss": 7.1296, "mean_token_accuracy": 0.08344640359282493, "num_tokens": 646652.0, "step": 340 }, { "entropy": 7.413992404937744, "epoch": 0.02013070369938149, "grad_norm": 1.328125, "learning_rate": 0.00017199999999999998, "loss": 7.137, "mean_token_accuracy": 0.08315069451928139, "num_tokens": 656238.0, "step": 345 }, { "entropy": 7.479533767700195, "epoch": 0.020422453028358035, "grad_norm": 1.3515625, "learning_rate": 0.00017449999999999999, "loss": 7.1428, "mean_token_accuracy": 0.08378953337669373, "num_tokens": 665148.0, "step": 350 }, { "entropy": 7.503499221801758, "epoch": 0.02071420235733458, "grad_norm": 1.3671875, "learning_rate": 0.000177, "loss": 7.049, "mean_token_accuracy": 0.08563587218523025, "num_tokens": 675192.0, "step": 355 }, { "entropy": 7.388577222824097, "epoch": 0.02100595168631112, "grad_norm": 1.265625, "learning_rate": 0.0001795, "loss": 7.0679, "mean_token_accuracy": 0.08425286635756493, "num_tokens": 684813.0, "step": 360 }, { "entropy": 7.496100616455078, "epoch": 0.021297701015287666, "grad_norm": 1.1484375, "learning_rate": 0.000182, "loss": 7.0952, "mean_token_accuracy": 0.08246167674660683, "num_tokens": 694545.0, "step": 365 }, { "entropy": 7.4700541496276855, "epoch": 0.021589450344264207, "grad_norm": 1.28125, "learning_rate": 0.0001845, "loss": 7.0857, "mean_token_accuracy": 0.08829364702105522, "num_tokens": 704312.0, "step": 370 }, { "entropy": 7.475095510482788, "epoch": 0.021881199673240752, "grad_norm": 1.265625, "learning_rate": 0.000187, "loss": 7.1189, "mean_token_accuracy": 0.08108639344573021, "num_tokens": 713743.0, "step": 375 }, { "entropy": 7.403366279602051, "epoch": 0.022172949002217297, "grad_norm": 1.2421875, "learning_rate": 0.0001895, "loss": 7.0088, "mean_token_accuracy": 0.08252720050513744, "num_tokens": 722497.0, "step": 380 }, { "entropy": 7.3469452381134035, "epoch": 0.022464698331193838, "grad_norm": 1.421875, "learning_rate": 0.000192, "loss": 6.9952, "mean_token_accuracy": 0.08496845439076424, "num_tokens": 731849.0, "step": 385 }, { "entropy": 7.4720964431762695, "epoch": 0.022756447660170383, "grad_norm": 1.1953125, "learning_rate": 0.0001945, "loss": 7.1709, "mean_token_accuracy": 0.08666181415319443, "num_tokens": 741345.0, "step": 390 }, { "entropy": 7.3531989574432375, "epoch": 0.023048196989146924, "grad_norm": 1.1953125, "learning_rate": 0.00019700000000000002, "loss": 7.1245, "mean_token_accuracy": 0.08187859356403351, "num_tokens": 751363.0, "step": 395 }, { "entropy": 7.323095083236694, "epoch": 0.02333994631812347, "grad_norm": 1.265625, "learning_rate": 0.00019950000000000002, "loss": 6.9475, "mean_token_accuracy": 0.08857285082340241, "num_tokens": 761174.0, "step": 400 }, { "entropy": 7.323359584808349, "epoch": 0.02363169564710001, "grad_norm": 1.2109375, "learning_rate": 0.000202, "loss": 6.9364, "mean_token_accuracy": 0.0823954962193966, "num_tokens": 770773.0, "step": 405 }, { "entropy": 7.241050577163696, "epoch": 0.023923444976076555, "grad_norm": 1.265625, "learning_rate": 0.00020449999999999998, "loss": 6.964, "mean_token_accuracy": 0.08706902638077736, "num_tokens": 780462.0, "step": 410 }, { "entropy": 7.354639291763306, "epoch": 0.0242151943050531, "grad_norm": 1.171875, "learning_rate": 0.000207, "loss": 6.9719, "mean_token_accuracy": 0.08648092672228813, "num_tokens": 789822.0, "step": 415 }, { "entropy": 7.251240015029907, "epoch": 0.02450694363402964, "grad_norm": 1.1640625, "learning_rate": 0.0002095, "loss": 6.9392, "mean_token_accuracy": 0.08409521207213402, "num_tokens": 799724.0, "step": 420 }, { "entropy": 7.2920667171478275, "epoch": 0.024798692963006186, "grad_norm": 1.140625, "learning_rate": 0.000212, "loss": 7.0463, "mean_token_accuracy": 0.08510638326406479, "num_tokens": 809331.0, "step": 425 }, { "entropy": 7.488130569458008, "epoch": 0.025090442291982727, "grad_norm": 1.1015625, "learning_rate": 0.0002145, "loss": 7.057, "mean_token_accuracy": 0.08337506577372551, "num_tokens": 818665.0, "step": 430 }, { "entropy": 7.296667957305909, "epoch": 0.025382191620959272, "grad_norm": 1.234375, "learning_rate": 0.00021700000000000002, "loss": 6.9754, "mean_token_accuracy": 0.08416144661605358, "num_tokens": 828580.0, "step": 435 }, { "entropy": 7.240721750259399, "epoch": 0.025673940949935817, "grad_norm": 1.609375, "learning_rate": 0.0002195, "loss": 7.0171, "mean_token_accuracy": 0.08526882231235504, "num_tokens": 837661.0, "step": 440 }, { "entropy": 7.22621784210205, "epoch": 0.025965690278912358, "grad_norm": 1.21875, "learning_rate": 0.000222, "loss": 6.9839, "mean_token_accuracy": 0.08228468671441078, "num_tokens": 847069.0, "step": 445 }, { "entropy": 7.250874137878418, "epoch": 0.026257439607888903, "grad_norm": 1.1796875, "learning_rate": 0.0002245, "loss": 6.9794, "mean_token_accuracy": 0.08245958164334297, "num_tokens": 856743.0, "step": 450 }, { "entropy": 7.338770008087158, "epoch": 0.026549188936865444, "grad_norm": 1.2734375, "learning_rate": 0.00022700000000000002, "loss": 7.0198, "mean_token_accuracy": 0.08468568697571754, "num_tokens": 865502.0, "step": 455 }, { "entropy": 7.33205771446228, "epoch": 0.02684093826584199, "grad_norm": 1.1484375, "learning_rate": 0.00022950000000000002, "loss": 6.9651, "mean_token_accuracy": 0.0839608520269394, "num_tokens": 874178.0, "step": 460 }, { "entropy": 7.088795518875122, "epoch": 0.02713268759481853, "grad_norm": 1.234375, "learning_rate": 0.00023200000000000003, "loss": 6.8514, "mean_token_accuracy": 0.08765117079019547, "num_tokens": 883182.0, "step": 465 }, { "entropy": 7.3482073783874515, "epoch": 0.027424436923795075, "grad_norm": 1.234375, "learning_rate": 0.00023449999999999998, "loss": 6.9282, "mean_token_accuracy": 0.08807430192828178, "num_tokens": 891879.0, "step": 470 }, { "entropy": 7.25138897895813, "epoch": 0.02771618625277162, "grad_norm": 1.28125, "learning_rate": 0.000237, "loss": 6.9982, "mean_token_accuracy": 0.08774204924702644, "num_tokens": 901925.0, "step": 475 }, { "entropy": 7.124047946929932, "epoch": 0.02800793558174816, "grad_norm": 1.21875, "learning_rate": 0.0002395, "loss": 6.9424, "mean_token_accuracy": 0.08976237252354621, "num_tokens": 910609.0, "step": 480 }, { "entropy": 7.321299314498901, "epoch": 0.028299684910724706, "grad_norm": 1.2109375, "learning_rate": 0.000242, "loss": 7.0122, "mean_token_accuracy": 0.08504581227898597, "num_tokens": 919643.0, "step": 485 }, { "entropy": 7.123654794692993, "epoch": 0.028591434239701247, "grad_norm": 1.09375, "learning_rate": 0.0002445, "loss": 6.8913, "mean_token_accuracy": 0.0893466129899025, "num_tokens": 929160.0, "step": 490 }, { "entropy": 7.151027345657349, "epoch": 0.028883183568677792, "grad_norm": 1.1875, "learning_rate": 0.000247, "loss": 6.8194, "mean_token_accuracy": 0.09795917496085167, "num_tokens": 938329.0, "step": 495 }, { "entropy": 7.3193886280059814, "epoch": 0.029174932897654337, "grad_norm": 1.2265625, "learning_rate": 0.0002495, "loss": 7.1734, "mean_token_accuracy": 0.0849479891359806, "num_tokens": 947919.0, "step": 500 } ], "logging_steps": 5, "max_steps": 4000, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 1361486628864000.0, "train_batch_size": 16, "trial_name": null, "trial_params": null }