{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.011172310545543924, "eval_steps": 500, "global_step": 500, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 10.74203462600708, "epoch": 0.00011172310545543924, "grad_norm": 7.40625, "learning_rate": 2e-06, "loss": 10.545, "mean_token_accuracy": 0.0, "num_tokens": 4264.0, "step": 5 }, { "entropy": 10.74201259613037, "epoch": 0.00022344621091087847, "grad_norm": 6.84375, "learning_rate": 4.5e-06, "loss": 10.5105, "mean_token_accuracy": 0.0002816901309415698, "num_tokens": 8413.0, "step": 10 }, { "entropy": 10.742000961303711, "epoch": 0.0003351693163663177, "grad_norm": 6.78125, "learning_rate": 7e-06, "loss": 10.4826, "mean_token_accuracy": 0.0, "num_tokens": 12394.0, "step": 15 }, { "entropy": 10.742033767700196, "epoch": 0.00044689242182175694, "grad_norm": 5.90625, "learning_rate": 9.5e-06, "loss": 10.4451, "mean_token_accuracy": 0.0004269361263141036, "num_tokens": 16610.0, "step": 20 }, { "entropy": 10.742008590698243, "epoch": 0.0005586155272771962, "grad_norm": 5.9375, "learning_rate": 1.2e-05, "loss": 10.3813, "mean_token_accuracy": 0.0017635513795539737, "num_tokens": 21243.0, "step": 25 }, { "entropy": 10.74174461364746, "epoch": 0.0006703386327326354, "grad_norm": 5.1875, "learning_rate": 1.4500000000000002e-05, "loss": 10.2219, "mean_token_accuracy": 0.019105370296165346, "num_tokens": 25571.0, "step": 30 }, { "entropy": 10.741024494171143, "epoch": 0.0007820617381880747, "grad_norm": 4.75, "learning_rate": 1.7000000000000003e-05, "loss": 10.0233, "mean_token_accuracy": 0.0476666621863842, "num_tokens": 29412.0, "step": 35 }, { "entropy": 10.739530563354492, "epoch": 0.0008937848436435139, "grad_norm": 3.75, "learning_rate": 1.95e-05, "loss": 9.943, "mean_token_accuracy": 0.04776074178516865, "num_tokens": 33893.0, "step": 40 }, { "entropy": 10.736891174316407, "epoch": 0.0010055079490989532, "grad_norm": 3.09375, "learning_rate": 2.2e-05, "loss": 9.7721, "mean_token_accuracy": 0.05200008656829595, "num_tokens": 38043.0, "step": 45 }, { "entropy": 10.733825874328613, "epoch": 0.0011172310545543925, "grad_norm": 2.75, "learning_rate": 2.4500000000000003e-05, "loss": 9.7095, "mean_token_accuracy": 0.05134744010865688, "num_tokens": 42222.0, "step": 50 }, { "entropy": 10.731979370117188, "epoch": 0.0012289541600098315, "grad_norm": 2.765625, "learning_rate": 2.7e-05, "loss": 9.6035, "mean_token_accuracy": 0.05346306636929512, "num_tokens": 46321.0, "step": 55 }, { "entropy": 10.729666996002198, "epoch": 0.0013406772654652708, "grad_norm": 2.515625, "learning_rate": 2.95e-05, "loss": 9.5985, "mean_token_accuracy": 0.053918526880443095, "num_tokens": 50816.0, "step": 60 }, { "entropy": 10.726247787475586, "epoch": 0.0014524003709207101, "grad_norm": 2.453125, "learning_rate": 3.2e-05, "loss": 9.5526, "mean_token_accuracy": 0.05777559094130993, "num_tokens": 55331.0, "step": 65 }, { "entropy": 10.722254943847656, "epoch": 0.0015641234763761494, "grad_norm": 2.296875, "learning_rate": 3.4500000000000005e-05, "loss": 9.4754, "mean_token_accuracy": 0.060246657207608224, "num_tokens": 59379.0, "step": 70 }, { "entropy": 10.717647266387939, "epoch": 0.0016758465818315885, "grad_norm": 2.375, "learning_rate": 3.7e-05, "loss": 9.3716, "mean_token_accuracy": 0.05563458241522312, "num_tokens": 63463.0, "step": 75 }, { "entropy": 10.709985065460206, "epoch": 0.0017875696872870278, "grad_norm": 2.234375, "learning_rate": 3.95e-05, "loss": 9.4054, "mean_token_accuracy": 0.04782464448362589, "num_tokens": 67897.0, "step": 80 }, { "entropy": 10.698591709136963, "epoch": 0.001899292792742467, "grad_norm": 2.703125, "learning_rate": 4.2000000000000004e-05, "loss": 9.2081, "mean_token_accuracy": 0.05416969805955887, "num_tokens": 71995.0, "step": 85 }, { "entropy": 10.679736518859864, "epoch": 0.0020110158981979064, "grad_norm": 2.453125, "learning_rate": 4.45e-05, "loss": 9.0655, "mean_token_accuracy": 0.06419909372925758, "num_tokens": 75745.0, "step": 90 }, { "entropy": 10.639767360687255, "epoch": 0.0021227390036533456, "grad_norm": 2.296875, "learning_rate": 4.7000000000000004e-05, "loss": 9.0156, "mean_token_accuracy": 0.06227423809468746, "num_tokens": 79641.0, "step": 95 }, { "entropy": 10.604651832580567, "epoch": 0.002234462109108785, "grad_norm": 2.328125, "learning_rate": 4.9500000000000004e-05, "loss": 8.9827, "mean_token_accuracy": 0.07007253468036652, "num_tokens": 84368.0, "step": 100 }, { "entropy": 10.576740074157716, "epoch": 0.0023461852145642242, "grad_norm": 3.0, "learning_rate": 5.2e-05, "loss": 8.9633, "mean_token_accuracy": 0.06716309636831283, "num_tokens": 89177.0, "step": 105 }, { "entropy": 10.532594108581543, "epoch": 0.002457908320019663, "grad_norm": 2.171875, "learning_rate": 5.45e-05, "loss": 8.7625, "mean_token_accuracy": 0.06927448399364948, "num_tokens": 93266.0, "step": 110 }, { "entropy": 10.469588470458984, "epoch": 0.0025696314254751024, "grad_norm": 1.9921875, "learning_rate": 5.7e-05, "loss": 8.6738, "mean_token_accuracy": 0.0684173908084631, "num_tokens": 97385.0, "step": 115 }, { "entropy": 10.414745044708251, "epoch": 0.0026813545309305417, "grad_norm": 2.203125, "learning_rate": 5.9499999999999996e-05, "loss": 8.4918, "mean_token_accuracy": 0.06782151162624359, "num_tokens": 100911.0, "step": 120 }, { "entropy": 10.343620300292969, "epoch": 0.002793077636385981, "grad_norm": 1.8359375, "learning_rate": 6.2e-05, "loss": 8.4104, "mean_token_accuracy": 0.07619427219033241, "num_tokens": 104785.0, "step": 125 }, { "entropy": 10.282330799102784, "epoch": 0.0029048007418414202, "grad_norm": 2.09375, "learning_rate": 6.450000000000001e-05, "loss": 8.3421, "mean_token_accuracy": 0.0715565849095583, "num_tokens": 109434.0, "step": 130 }, { "entropy": 10.177853965759278, "epoch": 0.0030165238472968595, "grad_norm": 1.7578125, "learning_rate": 6.7e-05, "loss": 8.3045, "mean_token_accuracy": 0.07821577228605747, "num_tokens": 113869.0, "step": 135 }, { "entropy": 10.01875, "epoch": 0.003128246952752299, "grad_norm": 1.640625, "learning_rate": 6.950000000000001e-05, "loss": 8.2069, "mean_token_accuracy": 0.07112646363675594, "num_tokens": 118332.0, "step": 140 }, { "entropy": 9.93814001083374, "epoch": 0.003239970058207738, "grad_norm": 1.65625, "learning_rate": 7.2e-05, "loss": 8.0893, "mean_token_accuracy": 0.06839369647204877, "num_tokens": 122140.0, "step": 145 }, { "entropy": 9.799712753295898, "epoch": 0.003351693163663177, "grad_norm": 1.6875, "learning_rate": 7.45e-05, "loss": 7.9249, "mean_token_accuracy": 0.067073168233037, "num_tokens": 126515.0, "step": 150 }, { "entropy": 9.603694915771484, "epoch": 0.0034634162691186163, "grad_norm": 1.5078125, "learning_rate": 7.7e-05, "loss": 7.897, "mean_token_accuracy": 0.07342451699078083, "num_tokens": 130397.0, "step": 155 }, { "entropy": 9.402643203735352, "epoch": 0.0035751393745740555, "grad_norm": 1.359375, "learning_rate": 7.950000000000001e-05, "loss": 7.815, "mean_token_accuracy": 0.07550931498408317, "num_tokens": 134428.0, "step": 160 }, { "entropy": 9.27815113067627, "epoch": 0.003686862480029495, "grad_norm": 1.5546875, "learning_rate": 8.2e-05, "loss": 7.6921, "mean_token_accuracy": 0.08235657699406147, "num_tokens": 138294.0, "step": 165 }, { "entropy": 9.126440715789794, "epoch": 0.003798585585484934, "grad_norm": 1.203125, "learning_rate": 8.450000000000001e-05, "loss": 7.6466, "mean_token_accuracy": 0.0780983179807663, "num_tokens": 142750.0, "step": 170 }, { "entropy": 8.904253101348877, "epoch": 0.003910308690940373, "grad_norm": 1.1328125, "learning_rate": 8.7e-05, "loss": 7.5833, "mean_token_accuracy": 0.06832590401172638, "num_tokens": 147220.0, "step": 175 }, { "entropy": 8.704329586029052, "epoch": 0.004022031796395813, "grad_norm": 1.0546875, "learning_rate": 8.95e-05, "loss": 7.464, "mean_token_accuracy": 0.08249393478035927, "num_tokens": 151396.0, "step": 180 }, { "entropy": 8.544238567352295, "epoch": 0.0041337549018512516, "grad_norm": 1.21875, "learning_rate": 9.2e-05, "loss": 7.4503, "mean_token_accuracy": 0.07549951747059822, "num_tokens": 155336.0, "step": 185 }, { "entropy": 8.501252269744873, "epoch": 0.004245478007306691, "grad_norm": 1.1953125, "learning_rate": 9.45e-05, "loss": 7.4842, "mean_token_accuracy": 0.07688803523778916, "num_tokens": 159752.0, "step": 190 }, { "entropy": 8.432751655578613, "epoch": 0.00435720111276213, "grad_norm": 1.1953125, "learning_rate": 9.7e-05, "loss": 7.5426, "mean_token_accuracy": 0.07533748783171176, "num_tokens": 163895.0, "step": 195 }, { "entropy": 8.257897663116456, "epoch": 0.00446892421821757, "grad_norm": 1.0234375, "learning_rate": 9.95e-05, "loss": 7.3421, "mean_token_accuracy": 0.08197390548884868, "num_tokens": 168312.0, "step": 200 }, { "entropy": 8.259009075164794, "epoch": 0.004580647323673009, "grad_norm": 1.546875, "learning_rate": 0.000102, "loss": 7.3701, "mean_token_accuracy": 0.08555959761142731, "num_tokens": 172358.0, "step": 205 }, { "entropy": 8.100054454803466, "epoch": 0.0046923704291284484, "grad_norm": 1.1171875, "learning_rate": 0.00010449999999999999, "loss": 7.357, "mean_token_accuracy": 0.08119111023843288, "num_tokens": 177085.0, "step": 210 }, { "entropy": 8.163977813720702, "epoch": 0.004804093534583887, "grad_norm": 1.15625, "learning_rate": 0.000107, "loss": 7.4691, "mean_token_accuracy": 0.07897469773888588, "num_tokens": 181410.0, "step": 215 }, { "entropy": 8.064214897155761, "epoch": 0.004915816640039326, "grad_norm": 1.125, "learning_rate": 0.0001095, "loss": 7.2085, "mean_token_accuracy": 0.08347514495253563, "num_tokens": 185649.0, "step": 220 }, { "entropy": 7.9723944664001465, "epoch": 0.005027539745494766, "grad_norm": 1.0625, "learning_rate": 0.000112, "loss": 7.2571, "mean_token_accuracy": 0.08833960294723511, "num_tokens": 190055.0, "step": 225 }, { "entropy": 7.958705711364746, "epoch": 0.005139262850950205, "grad_norm": 1.1796875, "learning_rate": 0.0001145, "loss": 7.2784, "mean_token_accuracy": 0.08142814487218857, "num_tokens": 194267.0, "step": 230 }, { "entropy": 7.980498743057251, "epoch": 0.0052509859564056445, "grad_norm": 1.2734375, "learning_rate": 0.00011700000000000001, "loss": 7.2042, "mean_token_accuracy": 0.08119908273220063, "num_tokens": 198483.0, "step": 235 }, { "entropy": 7.903439283370972, "epoch": 0.005362709061861083, "grad_norm": 1.3046875, "learning_rate": 0.00011949999999999999, "loss": 7.1137, "mean_token_accuracy": 0.09260561317205429, "num_tokens": 202514.0, "step": 240 }, { "entropy": 7.820244312286377, "epoch": 0.005474432167316523, "grad_norm": 1.3046875, "learning_rate": 0.000122, "loss": 7.2591, "mean_token_accuracy": 0.08432262316346169, "num_tokens": 206748.0, "step": 245 }, { "entropy": 7.817278146743774, "epoch": 0.005586155272771962, "grad_norm": 1.3515625, "learning_rate": 0.0001245, "loss": 7.1337, "mean_token_accuracy": 0.08795059770345688, "num_tokens": 210981.0, "step": 250 }, { "entropy": 7.902036476135254, "epoch": 0.005697878378227402, "grad_norm": 1.28125, "learning_rate": 0.000127, "loss": 7.2718, "mean_token_accuracy": 0.08792312145233154, "num_tokens": 215551.0, "step": 255 }, { "entropy": 7.720875978469849, "epoch": 0.0058096014836828405, "grad_norm": 1.21875, "learning_rate": 0.0001295, "loss": 7.0933, "mean_token_accuracy": 0.09327159300446511, "num_tokens": 219677.0, "step": 260 }, { "entropy": 7.8553773880004885, "epoch": 0.005921324589138279, "grad_norm": 1.4765625, "learning_rate": 0.000132, "loss": 7.1915, "mean_token_accuracy": 0.08988388553261757, "num_tokens": 223457.0, "step": 265 }, { "entropy": 7.8154174327850345, "epoch": 0.006033047694593719, "grad_norm": 1.375, "learning_rate": 0.00013450000000000002, "loss": 7.026, "mean_token_accuracy": 0.10610299035906792, "num_tokens": 227135.0, "step": 270 }, { "entropy": 7.805374622344971, "epoch": 0.006144770800049158, "grad_norm": 1.3203125, "learning_rate": 0.00013700000000000002, "loss": 7.2242, "mean_token_accuracy": 0.0845766805112362, "num_tokens": 231393.0, "step": 275 }, { "entropy": 7.793313646316529, "epoch": 0.006256493905504598, "grad_norm": 1.109375, "learning_rate": 0.0001395, "loss": 7.2039, "mean_token_accuracy": 0.09036076590418815, "num_tokens": 235959.0, "step": 280 }, { "entropy": 7.797818899154663, "epoch": 0.0063682170109600365, "grad_norm": 1.265625, "learning_rate": 0.00014199999999999998, "loss": 7.0391, "mean_token_accuracy": 0.10008666068315505, "num_tokens": 239875.0, "step": 285 }, { "entropy": 7.643310832977295, "epoch": 0.006479940116415476, "grad_norm": 1.203125, "learning_rate": 0.0001445, "loss": 7.1816, "mean_token_accuracy": 0.10088859647512435, "num_tokens": 244397.0, "step": 290 }, { "entropy": 7.749200963973999, "epoch": 0.006591663221870915, "grad_norm": 1.3515625, "learning_rate": 0.000147, "loss": 7.1022, "mean_token_accuracy": 0.09432346150279045, "num_tokens": 248441.0, "step": 295 }, { "entropy": 7.724449968338012, "epoch": 0.006703386327326354, "grad_norm": 1.6328125, "learning_rate": 0.0001495, "loss": 7.1223, "mean_token_accuracy": 0.09665866494178772, "num_tokens": 252693.0, "step": 300 }, { "entropy": 7.719059801101684, "epoch": 0.006815109432781794, "grad_norm": 1.375, "learning_rate": 0.000152, "loss": 7.0852, "mean_token_accuracy": 0.0973274439573288, "num_tokens": 257135.0, "step": 305 }, { "entropy": 7.689913558959961, "epoch": 0.0069268325382372325, "grad_norm": 1.3515625, "learning_rate": 0.00015450000000000001, "loss": 7.1788, "mean_token_accuracy": 0.09386017993092537, "num_tokens": 261919.0, "step": 310 }, { "entropy": 7.723158597946167, "epoch": 0.007038555643692672, "grad_norm": 1.3125, "learning_rate": 0.000157, "loss": 7.0899, "mean_token_accuracy": 0.10055064782500267, "num_tokens": 266656.0, "step": 315 }, { "entropy": 7.58135347366333, "epoch": 0.007150278749148111, "grad_norm": 1.28125, "learning_rate": 0.0001595, "loss": 7.0484, "mean_token_accuracy": 0.0989685259759426, "num_tokens": 270879.0, "step": 320 }, { "entropy": 7.633032703399659, "epoch": 0.007262001854603551, "grad_norm": 1.3046875, "learning_rate": 0.000162, "loss": 7.0017, "mean_token_accuracy": 0.11045164242386818, "num_tokens": 274884.0, "step": 325 }, { "entropy": 7.55345048904419, "epoch": 0.00737372496005899, "grad_norm": 1.328125, "learning_rate": 0.00016450000000000001, "loss": 6.9434, "mean_token_accuracy": 0.10104935392737388, "num_tokens": 279096.0, "step": 330 }, { "entropy": 7.626837635040284, "epoch": 0.007485448065514429, "grad_norm": 1.453125, "learning_rate": 0.00016700000000000002, "loss": 7.0338, "mean_token_accuracy": 0.10009614899754524, "num_tokens": 282923.0, "step": 335 }, { "entropy": 7.528380966186523, "epoch": 0.007597171170969868, "grad_norm": 1.3359375, "learning_rate": 0.00016950000000000003, "loss": 6.99, "mean_token_accuracy": 0.10532780215144158, "num_tokens": 287283.0, "step": 340 }, { "entropy": 7.572710466384888, "epoch": 0.007708894276425307, "grad_norm": 1.4375, "learning_rate": 0.00017199999999999998, "loss": 6.9504, "mean_token_accuracy": 0.10530123338103295, "num_tokens": 291409.0, "step": 345 }, { "entropy": 7.547561979293823, "epoch": 0.007820617381880746, "grad_norm": 1.40625, "learning_rate": 0.00017449999999999999, "loss": 6.9732, "mean_token_accuracy": 0.10650015398859977, "num_tokens": 295157.0, "step": 350 }, { "entropy": 7.669625616073608, "epoch": 0.007932340487336187, "grad_norm": 1.4453125, "learning_rate": 0.000177, "loss": 7.0005, "mean_token_accuracy": 0.10243007764220238, "num_tokens": 299370.0, "step": 355 }, { "entropy": 7.543743228912353, "epoch": 0.008044063592791625, "grad_norm": 1.390625, "learning_rate": 0.0001795, "loss": 7.0093, "mean_token_accuracy": 0.11244696080684662, "num_tokens": 303955.0, "step": 360 }, { "entropy": 7.570756626129151, "epoch": 0.008155786698247064, "grad_norm": 1.4921875, "learning_rate": 0.000182, "loss": 6.9899, "mean_token_accuracy": 0.10562622845172882, "num_tokens": 308047.0, "step": 365 }, { "entropy": 7.594445466995239, "epoch": 0.008267509803702503, "grad_norm": 1.609375, "learning_rate": 0.0001845, "loss": 6.9313, "mean_token_accuracy": 0.11213268861174583, "num_tokens": 312050.0, "step": 370 }, { "entropy": 7.5787379264831545, "epoch": 0.008379232909157944, "grad_norm": 1.3203125, "learning_rate": 0.000187, "loss": 6.9007, "mean_token_accuracy": 0.11451447457075119, "num_tokens": 315901.0, "step": 375 }, { "entropy": 7.617064571380615, "epoch": 0.008490956014613383, "grad_norm": 1.1484375, "learning_rate": 0.0001895, "loss": 6.9233, "mean_token_accuracy": 0.11718286573886871, "num_tokens": 320077.0, "step": 380 }, { "entropy": 7.479556846618652, "epoch": 0.008602679120068821, "grad_norm": 1.546875, "learning_rate": 0.000192, "loss": 6.8783, "mean_token_accuracy": 0.11937321722507477, "num_tokens": 324365.0, "step": 385 }, { "entropy": 7.485933542251587, "epoch": 0.00871440222552426, "grad_norm": 1.4921875, "learning_rate": 0.0001945, "loss": 6.8292, "mean_token_accuracy": 0.11517802253365517, "num_tokens": 327971.0, "step": 390 }, { "entropy": 7.489345073699951, "epoch": 0.0088261253309797, "grad_norm": 1.5390625, "learning_rate": 0.00019700000000000002, "loss": 6.8634, "mean_token_accuracy": 0.12188869342207909, "num_tokens": 331791.0, "step": 395 }, { "entropy": 7.405192232131958, "epoch": 0.00893784843643514, "grad_norm": 1.34375, "learning_rate": 0.00019950000000000002, "loss": 6.9151, "mean_token_accuracy": 0.11866991743445396, "num_tokens": 335616.0, "step": 400 }, { "entropy": 7.442100572586059, "epoch": 0.009049571541890579, "grad_norm": 1.3359375, "learning_rate": 0.000202, "loss": 6.8337, "mean_token_accuracy": 0.1216049998998642, "num_tokens": 339815.0, "step": 405 }, { "entropy": 7.466716241836548, "epoch": 0.009161294647346017, "grad_norm": 1.4140625, "learning_rate": 0.00020449999999999998, "loss": 6.8153, "mean_token_accuracy": 0.11885289028286934, "num_tokens": 344045.0, "step": 410 }, { "entropy": 7.439525604248047, "epoch": 0.009273017752801456, "grad_norm": 1.5859375, "learning_rate": 0.000207, "loss": 6.9127, "mean_token_accuracy": 0.1201499916613102, "num_tokens": 348726.0, "step": 415 }, { "entropy": 7.421639108657837, "epoch": 0.009384740858256897, "grad_norm": 1.375, "learning_rate": 0.0002095, "loss": 6.8973, "mean_token_accuracy": 0.11855003610253334, "num_tokens": 353228.0, "step": 420 }, { "entropy": 7.533071041107178, "epoch": 0.009496463963712336, "grad_norm": 1.3046875, "learning_rate": 0.000212, "loss": 6.8732, "mean_token_accuracy": 0.12777991741895675, "num_tokens": 357379.0, "step": 425 }, { "entropy": 7.404365539550781, "epoch": 0.009608187069167775, "grad_norm": 1.78125, "learning_rate": 0.0002145, "loss": 6.8237, "mean_token_accuracy": 0.11873817816376686, "num_tokens": 361347.0, "step": 430 }, { "entropy": 7.3829724311828615, "epoch": 0.009719910174623213, "grad_norm": 1.4453125, "learning_rate": 0.00021700000000000002, "loss": 6.8001, "mean_token_accuracy": 0.12097886875271797, "num_tokens": 365364.0, "step": 435 }, { "entropy": 7.4662988662719725, "epoch": 0.009831633280078652, "grad_norm": 1.5078125, "learning_rate": 0.0002195, "loss": 6.8435, "mean_token_accuracy": 0.1184915505349636, "num_tokens": 369648.0, "step": 440 }, { "entropy": 7.550151824951172, "epoch": 0.009943356385534093, "grad_norm": 1.34375, "learning_rate": 0.000222, "loss": 6.8211, "mean_token_accuracy": 0.1224476382136345, "num_tokens": 373734.0, "step": 445 }, { "entropy": 7.477874803543091, "epoch": 0.010055079490989532, "grad_norm": 1.6328125, "learning_rate": 0.0002245, "loss": 6.8174, "mean_token_accuracy": 0.12541017457842826, "num_tokens": 378184.0, "step": 450 }, { "entropy": 7.454969882965088, "epoch": 0.01016680259644497, "grad_norm": 1.3828125, "learning_rate": 0.00022700000000000002, "loss": 6.9275, "mean_token_accuracy": 0.11591533869504929, "num_tokens": 382686.0, "step": 455 }, { "entropy": 7.344128131866455, "epoch": 0.01027852570190041, "grad_norm": 1.6640625, "learning_rate": 0.00022950000000000002, "loss": 6.8348, "mean_token_accuracy": 0.12774229273200036, "num_tokens": 387210.0, "step": 460 }, { "entropy": 7.421209812164307, "epoch": 0.01039024880735585, "grad_norm": 1.484375, "learning_rate": 0.00023200000000000003, "loss": 6.8216, "mean_token_accuracy": 0.12031811997294425, "num_tokens": 391247.0, "step": 465 }, { "entropy": 7.465836143493652, "epoch": 0.010501971912811289, "grad_norm": 1.4921875, "learning_rate": 0.00023449999999999998, "loss": 6.6907, "mean_token_accuracy": 0.13249015137553216, "num_tokens": 395188.0, "step": 470 }, { "entropy": 7.280446100234985, "epoch": 0.010613695018266728, "grad_norm": 1.4375, "learning_rate": 0.000237, "loss": 6.7666, "mean_token_accuracy": 0.12789778113365174, "num_tokens": 399513.0, "step": 475 }, { "entropy": 7.51575026512146, "epoch": 0.010725418123722167, "grad_norm": 1.59375, "learning_rate": 0.0002395, "loss": 6.8438, "mean_token_accuracy": 0.12305677309632301, "num_tokens": 404052.0, "step": 480 }, { "entropy": 7.260741233825684, "epoch": 0.010837141229177606, "grad_norm": 1.40625, "learning_rate": 0.000242, "loss": 6.6724, "mean_token_accuracy": 0.13464880287647246, "num_tokens": 408299.0, "step": 485 }, { "entropy": 7.3084382057189945, "epoch": 0.010948864334633046, "grad_norm": 1.5859375, "learning_rate": 0.0002445, "loss": 6.6808, "mean_token_accuracy": 0.12868183255195617, "num_tokens": 412376.0, "step": 490 }, { "entropy": 7.318713665008545, "epoch": 0.011060587440088485, "grad_norm": 1.484375, "learning_rate": 0.000247, "loss": 6.7365, "mean_token_accuracy": 0.12830623611807823, "num_tokens": 417010.0, "step": 495 }, { "entropy": 7.343731689453125, "epoch": 0.011172310545543924, "grad_norm": 1.734375, "learning_rate": 0.0002495, "loss": 6.615, "mean_token_accuracy": 0.1360365241765976, "num_tokens": 421167.0, "step": 500 } ], "logging_steps": 5, "max_steps": 4000, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 91074473164800.0, "train_batch_size": 16, "trial_name": null, "trial_params": null }