{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.033516931636631775, "eval_steps": 500, "global_step": 1500, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 10.74203462600708, "epoch": 0.00011172310545543924, "grad_norm": 7.40625, "learning_rate": 2e-06, "loss": 10.545, "mean_token_accuracy": 0.0, "num_tokens": 4264.0, "step": 5 }, { "entropy": 10.74201259613037, "epoch": 0.00022344621091087847, "grad_norm": 6.84375, "learning_rate": 4.5e-06, "loss": 10.5105, "mean_token_accuracy": 0.0002816901309415698, "num_tokens": 8413.0, "step": 10 }, { "entropy": 10.742000961303711, "epoch": 0.0003351693163663177, "grad_norm": 6.78125, "learning_rate": 7e-06, "loss": 10.4826, "mean_token_accuracy": 0.0, "num_tokens": 12394.0, "step": 15 }, { "entropy": 10.742033767700196, "epoch": 0.00044689242182175694, "grad_norm": 5.90625, "learning_rate": 9.5e-06, "loss": 10.4451, "mean_token_accuracy": 0.0004269361263141036, "num_tokens": 16610.0, "step": 20 }, { "entropy": 10.742008590698243, "epoch": 0.0005586155272771962, "grad_norm": 5.9375, "learning_rate": 1.2e-05, "loss": 10.3813, "mean_token_accuracy": 0.0017635513795539737, "num_tokens": 21243.0, "step": 25 }, { "entropy": 10.74174461364746, "epoch": 0.0006703386327326354, "grad_norm": 5.1875, "learning_rate": 1.4500000000000002e-05, "loss": 10.2219, "mean_token_accuracy": 0.019105370296165346, "num_tokens": 25571.0, "step": 30 }, { "entropy": 10.741024494171143, "epoch": 0.0007820617381880747, "grad_norm": 4.75, "learning_rate": 1.7000000000000003e-05, "loss": 10.0233, "mean_token_accuracy": 0.0476666621863842, "num_tokens": 29412.0, "step": 35 }, { "entropy": 10.739530563354492, "epoch": 0.0008937848436435139, "grad_norm": 3.75, "learning_rate": 1.95e-05, "loss": 9.943, "mean_token_accuracy": 0.04776074178516865, "num_tokens": 33893.0, "step": 40 }, { "entropy": 10.736891174316407, "epoch": 0.0010055079490989532, "grad_norm": 3.09375, "learning_rate": 2.2e-05, "loss": 9.7721, "mean_token_accuracy": 0.05200008656829595, "num_tokens": 38043.0, "step": 45 }, { "entropy": 10.733825874328613, "epoch": 0.0011172310545543925, "grad_norm": 2.75, "learning_rate": 2.4500000000000003e-05, "loss": 9.7095, "mean_token_accuracy": 0.05134744010865688, "num_tokens": 42222.0, "step": 50 }, { "entropy": 10.731979370117188, "epoch": 0.0012289541600098315, "grad_norm": 2.765625, "learning_rate": 2.7e-05, "loss": 9.6035, "mean_token_accuracy": 0.05346306636929512, "num_tokens": 46321.0, "step": 55 }, { "entropy": 10.729666996002198, "epoch": 0.0013406772654652708, "grad_norm": 2.515625, "learning_rate": 2.95e-05, "loss": 9.5985, "mean_token_accuracy": 0.053918526880443095, "num_tokens": 50816.0, "step": 60 }, { "entropy": 10.726247787475586, "epoch": 0.0014524003709207101, "grad_norm": 2.453125, "learning_rate": 3.2e-05, "loss": 9.5526, "mean_token_accuracy": 0.05777559094130993, "num_tokens": 55331.0, "step": 65 }, { "entropy": 10.722254943847656, "epoch": 0.0015641234763761494, "grad_norm": 2.296875, "learning_rate": 3.4500000000000005e-05, "loss": 9.4754, "mean_token_accuracy": 0.060246657207608224, "num_tokens": 59379.0, "step": 70 }, { "entropy": 10.717647266387939, "epoch": 0.0016758465818315885, "grad_norm": 2.375, "learning_rate": 3.7e-05, "loss": 9.3716, "mean_token_accuracy": 0.05563458241522312, "num_tokens": 63463.0, "step": 75 }, { "entropy": 10.709985065460206, "epoch": 0.0017875696872870278, "grad_norm": 2.234375, "learning_rate": 3.95e-05, "loss": 9.4054, "mean_token_accuracy": 0.04782464448362589, "num_tokens": 67897.0, "step": 80 }, { "entropy": 10.698591709136963, "epoch": 0.001899292792742467, "grad_norm": 2.703125, "learning_rate": 4.2000000000000004e-05, "loss": 9.2081, "mean_token_accuracy": 0.05416969805955887, "num_tokens": 71995.0, "step": 85 }, { "entropy": 10.679736518859864, "epoch": 0.0020110158981979064, "grad_norm": 2.453125, "learning_rate": 4.45e-05, "loss": 9.0655, "mean_token_accuracy": 0.06419909372925758, "num_tokens": 75745.0, "step": 90 }, { "entropy": 10.639767360687255, "epoch": 0.0021227390036533456, "grad_norm": 2.296875, "learning_rate": 4.7000000000000004e-05, "loss": 9.0156, "mean_token_accuracy": 0.06227423809468746, "num_tokens": 79641.0, "step": 95 }, { "entropy": 10.604651832580567, "epoch": 0.002234462109108785, "grad_norm": 2.328125, "learning_rate": 4.9500000000000004e-05, "loss": 8.9827, "mean_token_accuracy": 0.07007253468036652, "num_tokens": 84368.0, "step": 100 }, { "entropy": 10.576740074157716, "epoch": 0.0023461852145642242, "grad_norm": 3.0, "learning_rate": 5.2e-05, "loss": 8.9633, "mean_token_accuracy": 0.06716309636831283, "num_tokens": 89177.0, "step": 105 }, { "entropy": 10.532594108581543, "epoch": 0.002457908320019663, "grad_norm": 2.171875, "learning_rate": 5.45e-05, "loss": 8.7625, "mean_token_accuracy": 0.06927448399364948, "num_tokens": 93266.0, "step": 110 }, { "entropy": 10.469588470458984, "epoch": 0.0025696314254751024, "grad_norm": 1.9921875, "learning_rate": 5.7e-05, "loss": 8.6738, "mean_token_accuracy": 0.0684173908084631, "num_tokens": 97385.0, "step": 115 }, { "entropy": 10.414745044708251, "epoch": 0.0026813545309305417, "grad_norm": 2.203125, "learning_rate": 5.9499999999999996e-05, "loss": 8.4918, "mean_token_accuracy": 0.06782151162624359, "num_tokens": 100911.0, "step": 120 }, { "entropy": 10.343620300292969, "epoch": 0.002793077636385981, "grad_norm": 1.8359375, "learning_rate": 6.2e-05, "loss": 8.4104, "mean_token_accuracy": 0.07619427219033241, "num_tokens": 104785.0, "step": 125 }, { "entropy": 10.282330799102784, "epoch": 0.0029048007418414202, "grad_norm": 2.09375, "learning_rate": 6.450000000000001e-05, "loss": 8.3421, "mean_token_accuracy": 0.0715565849095583, "num_tokens": 109434.0, "step": 130 }, { "entropy": 10.177853965759278, "epoch": 0.0030165238472968595, "grad_norm": 1.7578125, "learning_rate": 6.7e-05, "loss": 8.3045, "mean_token_accuracy": 0.07821577228605747, "num_tokens": 113869.0, "step": 135 }, { "entropy": 10.01875, "epoch": 0.003128246952752299, "grad_norm": 1.640625, "learning_rate": 6.950000000000001e-05, "loss": 8.2069, "mean_token_accuracy": 0.07112646363675594, "num_tokens": 118332.0, "step": 140 }, { "entropy": 9.93814001083374, "epoch": 0.003239970058207738, "grad_norm": 1.65625, "learning_rate": 7.2e-05, "loss": 8.0893, "mean_token_accuracy": 0.06839369647204877, "num_tokens": 122140.0, "step": 145 }, { "entropy": 9.799712753295898, "epoch": 0.003351693163663177, "grad_norm": 1.6875, "learning_rate": 7.45e-05, "loss": 7.9249, "mean_token_accuracy": 0.067073168233037, "num_tokens": 126515.0, "step": 150 }, { "entropy": 9.603694915771484, "epoch": 0.0034634162691186163, "grad_norm": 1.5078125, "learning_rate": 7.7e-05, "loss": 7.897, "mean_token_accuracy": 0.07342451699078083, "num_tokens": 130397.0, "step": 155 }, { "entropy": 9.402643203735352, "epoch": 0.0035751393745740555, "grad_norm": 1.359375, "learning_rate": 7.950000000000001e-05, "loss": 7.815, "mean_token_accuracy": 0.07550931498408317, "num_tokens": 134428.0, "step": 160 }, { "entropy": 9.27815113067627, "epoch": 0.003686862480029495, "grad_norm": 1.5546875, "learning_rate": 8.2e-05, "loss": 7.6921, "mean_token_accuracy": 0.08235657699406147, "num_tokens": 138294.0, "step": 165 }, { "entropy": 9.126440715789794, "epoch": 0.003798585585484934, "grad_norm": 1.203125, "learning_rate": 8.450000000000001e-05, "loss": 7.6466, "mean_token_accuracy": 0.0780983179807663, "num_tokens": 142750.0, "step": 170 }, { "entropy": 8.904253101348877, "epoch": 0.003910308690940373, "grad_norm": 1.1328125, "learning_rate": 8.7e-05, "loss": 7.5833, "mean_token_accuracy": 0.06832590401172638, "num_tokens": 147220.0, "step": 175 }, { "entropy": 8.704329586029052, "epoch": 0.004022031796395813, "grad_norm": 1.0546875, "learning_rate": 8.95e-05, "loss": 7.464, "mean_token_accuracy": 0.08249393478035927, "num_tokens": 151396.0, "step": 180 }, { "entropy": 8.544238567352295, "epoch": 0.0041337549018512516, "grad_norm": 1.21875, "learning_rate": 9.2e-05, "loss": 7.4503, "mean_token_accuracy": 0.07549951747059822, "num_tokens": 155336.0, "step": 185 }, { "entropy": 8.501252269744873, "epoch": 0.004245478007306691, "grad_norm": 1.1953125, "learning_rate": 9.45e-05, "loss": 7.4842, "mean_token_accuracy": 0.07688803523778916, "num_tokens": 159752.0, "step": 190 }, { "entropy": 8.432751655578613, "epoch": 0.00435720111276213, "grad_norm": 1.1953125, "learning_rate": 9.7e-05, "loss": 7.5426, "mean_token_accuracy": 0.07533748783171176, "num_tokens": 163895.0, "step": 195 }, { "entropy": 8.257897663116456, "epoch": 0.00446892421821757, "grad_norm": 1.0234375, "learning_rate": 9.95e-05, "loss": 7.3421, "mean_token_accuracy": 0.08197390548884868, "num_tokens": 168312.0, "step": 200 }, { "entropy": 8.259009075164794, "epoch": 0.004580647323673009, "grad_norm": 1.546875, "learning_rate": 0.000102, "loss": 7.3701, "mean_token_accuracy": 0.08555959761142731, "num_tokens": 172358.0, "step": 205 }, { "entropy": 8.100054454803466, "epoch": 0.0046923704291284484, "grad_norm": 1.1171875, "learning_rate": 0.00010449999999999999, "loss": 7.357, "mean_token_accuracy": 0.08119111023843288, "num_tokens": 177085.0, "step": 210 }, { "entropy": 8.163977813720702, "epoch": 0.004804093534583887, "grad_norm": 1.15625, "learning_rate": 0.000107, "loss": 7.4691, "mean_token_accuracy": 0.07897469773888588, "num_tokens": 181410.0, "step": 215 }, { "entropy": 8.064214897155761, "epoch": 0.004915816640039326, "grad_norm": 1.125, "learning_rate": 0.0001095, "loss": 7.2085, "mean_token_accuracy": 0.08347514495253563, "num_tokens": 185649.0, "step": 220 }, { "entropy": 7.9723944664001465, "epoch": 0.005027539745494766, "grad_norm": 1.0625, "learning_rate": 0.000112, "loss": 7.2571, "mean_token_accuracy": 0.08833960294723511, "num_tokens": 190055.0, "step": 225 }, { "entropy": 7.958705711364746, "epoch": 0.005139262850950205, "grad_norm": 1.1796875, "learning_rate": 0.0001145, "loss": 7.2784, "mean_token_accuracy": 0.08142814487218857, "num_tokens": 194267.0, "step": 230 }, { "entropy": 7.980498743057251, "epoch": 0.0052509859564056445, "grad_norm": 1.2734375, "learning_rate": 0.00011700000000000001, "loss": 7.2042, "mean_token_accuracy": 0.08119908273220063, "num_tokens": 198483.0, "step": 235 }, { "entropy": 7.903439283370972, "epoch": 0.005362709061861083, "grad_norm": 1.3046875, "learning_rate": 0.00011949999999999999, "loss": 7.1137, "mean_token_accuracy": 0.09260561317205429, "num_tokens": 202514.0, "step": 240 }, { "entropy": 7.820244312286377, "epoch": 0.005474432167316523, "grad_norm": 1.3046875, "learning_rate": 0.000122, "loss": 7.2591, "mean_token_accuracy": 0.08432262316346169, "num_tokens": 206748.0, "step": 245 }, { "entropy": 7.817278146743774, "epoch": 0.005586155272771962, "grad_norm": 1.3515625, "learning_rate": 0.0001245, "loss": 7.1337, "mean_token_accuracy": 0.08795059770345688, "num_tokens": 210981.0, "step": 250 }, { "entropy": 7.902036476135254, "epoch": 0.005697878378227402, "grad_norm": 1.28125, "learning_rate": 0.000127, "loss": 7.2718, "mean_token_accuracy": 0.08792312145233154, "num_tokens": 215551.0, "step": 255 }, { "entropy": 7.720875978469849, "epoch": 0.0058096014836828405, "grad_norm": 1.21875, "learning_rate": 0.0001295, "loss": 7.0933, "mean_token_accuracy": 0.09327159300446511, "num_tokens": 219677.0, "step": 260 }, { "entropy": 7.8553773880004885, "epoch": 0.005921324589138279, "grad_norm": 1.4765625, "learning_rate": 0.000132, "loss": 7.1915, "mean_token_accuracy": 0.08988388553261757, "num_tokens": 223457.0, "step": 265 }, { "entropy": 7.8154174327850345, "epoch": 0.006033047694593719, "grad_norm": 1.375, "learning_rate": 0.00013450000000000002, "loss": 7.026, "mean_token_accuracy": 0.10610299035906792, "num_tokens": 227135.0, "step": 270 }, { "entropy": 7.805374622344971, "epoch": 0.006144770800049158, "grad_norm": 1.3203125, "learning_rate": 0.00013700000000000002, "loss": 7.2242, "mean_token_accuracy": 0.0845766805112362, "num_tokens": 231393.0, "step": 275 }, { "entropy": 7.793313646316529, "epoch": 0.006256493905504598, "grad_norm": 1.109375, "learning_rate": 0.0001395, "loss": 7.2039, "mean_token_accuracy": 0.09036076590418815, "num_tokens": 235959.0, "step": 280 }, { "entropy": 7.797818899154663, "epoch": 0.0063682170109600365, "grad_norm": 1.265625, "learning_rate": 0.00014199999999999998, "loss": 7.0391, "mean_token_accuracy": 0.10008666068315505, "num_tokens": 239875.0, "step": 285 }, { "entropy": 7.643310832977295, "epoch": 0.006479940116415476, "grad_norm": 1.203125, "learning_rate": 0.0001445, "loss": 7.1816, "mean_token_accuracy": 0.10088859647512435, "num_tokens": 244397.0, "step": 290 }, { "entropy": 7.749200963973999, "epoch": 0.006591663221870915, "grad_norm": 1.3515625, "learning_rate": 0.000147, "loss": 7.1022, "mean_token_accuracy": 0.09432346150279045, "num_tokens": 248441.0, "step": 295 }, { "entropy": 7.724449968338012, "epoch": 0.006703386327326354, "grad_norm": 1.6328125, "learning_rate": 0.0001495, "loss": 7.1223, "mean_token_accuracy": 0.09665866494178772, "num_tokens": 252693.0, "step": 300 }, { "entropy": 7.719059801101684, "epoch": 0.006815109432781794, "grad_norm": 1.375, "learning_rate": 0.000152, "loss": 7.0852, "mean_token_accuracy": 0.0973274439573288, "num_tokens": 257135.0, "step": 305 }, { "entropy": 7.689913558959961, "epoch": 0.0069268325382372325, "grad_norm": 1.3515625, "learning_rate": 0.00015450000000000001, "loss": 7.1788, "mean_token_accuracy": 0.09386017993092537, "num_tokens": 261919.0, "step": 310 }, { "entropy": 7.723158597946167, "epoch": 0.007038555643692672, "grad_norm": 1.3125, "learning_rate": 0.000157, "loss": 7.0899, "mean_token_accuracy": 0.10055064782500267, "num_tokens": 266656.0, "step": 315 }, { "entropy": 7.58135347366333, "epoch": 0.007150278749148111, "grad_norm": 1.28125, "learning_rate": 0.0001595, "loss": 7.0484, "mean_token_accuracy": 0.0989685259759426, "num_tokens": 270879.0, "step": 320 }, { "entropy": 7.633032703399659, "epoch": 0.007262001854603551, "grad_norm": 1.3046875, "learning_rate": 0.000162, "loss": 7.0017, "mean_token_accuracy": 0.11045164242386818, "num_tokens": 274884.0, "step": 325 }, { "entropy": 7.55345048904419, "epoch": 0.00737372496005899, "grad_norm": 1.328125, "learning_rate": 0.00016450000000000001, "loss": 6.9434, "mean_token_accuracy": 0.10104935392737388, "num_tokens": 279096.0, "step": 330 }, { "entropy": 7.626837635040284, "epoch": 0.007485448065514429, "grad_norm": 1.453125, "learning_rate": 0.00016700000000000002, "loss": 7.0338, "mean_token_accuracy": 0.10009614899754524, "num_tokens": 282923.0, "step": 335 }, { "entropy": 7.528380966186523, "epoch": 0.007597171170969868, "grad_norm": 1.3359375, "learning_rate": 0.00016950000000000003, "loss": 6.99, "mean_token_accuracy": 0.10532780215144158, "num_tokens": 287283.0, "step": 340 }, { "entropy": 7.572710466384888, "epoch": 0.007708894276425307, "grad_norm": 1.4375, "learning_rate": 0.00017199999999999998, "loss": 6.9504, "mean_token_accuracy": 0.10530123338103295, "num_tokens": 291409.0, "step": 345 }, { "entropy": 7.547561979293823, "epoch": 0.007820617381880746, "grad_norm": 1.40625, "learning_rate": 0.00017449999999999999, "loss": 6.9732, "mean_token_accuracy": 0.10650015398859977, "num_tokens": 295157.0, "step": 350 }, { "entropy": 7.669625616073608, "epoch": 0.007932340487336187, "grad_norm": 1.4453125, "learning_rate": 0.000177, "loss": 7.0005, "mean_token_accuracy": 0.10243007764220238, "num_tokens": 299370.0, "step": 355 }, { "entropy": 7.543743228912353, "epoch": 0.008044063592791625, "grad_norm": 1.390625, "learning_rate": 0.0001795, "loss": 7.0093, "mean_token_accuracy": 0.11244696080684662, "num_tokens": 303955.0, "step": 360 }, { "entropy": 7.570756626129151, "epoch": 0.008155786698247064, "grad_norm": 1.4921875, "learning_rate": 0.000182, "loss": 6.9899, "mean_token_accuracy": 0.10562622845172882, "num_tokens": 308047.0, "step": 365 }, { "entropy": 7.594445466995239, "epoch": 0.008267509803702503, "grad_norm": 1.609375, "learning_rate": 0.0001845, "loss": 6.9313, "mean_token_accuracy": 0.11213268861174583, "num_tokens": 312050.0, "step": 370 }, { "entropy": 7.5787379264831545, "epoch": 0.008379232909157944, "grad_norm": 1.3203125, "learning_rate": 0.000187, "loss": 6.9007, "mean_token_accuracy": 0.11451447457075119, "num_tokens": 315901.0, "step": 375 }, { "entropy": 7.617064571380615, "epoch": 0.008490956014613383, "grad_norm": 1.1484375, "learning_rate": 0.0001895, "loss": 6.9233, "mean_token_accuracy": 0.11718286573886871, "num_tokens": 320077.0, "step": 380 }, { "entropy": 7.479556846618652, "epoch": 0.008602679120068821, "grad_norm": 1.546875, "learning_rate": 0.000192, "loss": 6.8783, "mean_token_accuracy": 0.11937321722507477, "num_tokens": 324365.0, "step": 385 }, { "entropy": 7.485933542251587, "epoch": 0.00871440222552426, "grad_norm": 1.4921875, "learning_rate": 0.0001945, "loss": 6.8292, "mean_token_accuracy": 0.11517802253365517, "num_tokens": 327971.0, "step": 390 }, { "entropy": 7.489345073699951, "epoch": 0.0088261253309797, "grad_norm": 1.5390625, "learning_rate": 0.00019700000000000002, "loss": 6.8634, "mean_token_accuracy": 0.12188869342207909, "num_tokens": 331791.0, "step": 395 }, { "entropy": 7.405192232131958, "epoch": 0.00893784843643514, "grad_norm": 1.34375, "learning_rate": 0.00019950000000000002, "loss": 6.9151, "mean_token_accuracy": 0.11866991743445396, "num_tokens": 335616.0, "step": 400 }, { "entropy": 7.442100572586059, "epoch": 0.009049571541890579, "grad_norm": 1.3359375, "learning_rate": 0.000202, "loss": 6.8337, "mean_token_accuracy": 0.1216049998998642, "num_tokens": 339815.0, "step": 405 }, { "entropy": 7.466716241836548, "epoch": 0.009161294647346017, "grad_norm": 1.4140625, "learning_rate": 0.00020449999999999998, "loss": 6.8153, "mean_token_accuracy": 0.11885289028286934, "num_tokens": 344045.0, "step": 410 }, { "entropy": 7.439525604248047, "epoch": 0.009273017752801456, "grad_norm": 1.5859375, "learning_rate": 0.000207, "loss": 6.9127, "mean_token_accuracy": 0.1201499916613102, "num_tokens": 348726.0, "step": 415 }, { "entropy": 7.421639108657837, "epoch": 0.009384740858256897, "grad_norm": 1.375, "learning_rate": 0.0002095, "loss": 6.8973, "mean_token_accuracy": 0.11855003610253334, "num_tokens": 353228.0, "step": 420 }, { "entropy": 7.533071041107178, "epoch": 0.009496463963712336, "grad_norm": 1.3046875, "learning_rate": 0.000212, "loss": 6.8732, "mean_token_accuracy": 0.12777991741895675, "num_tokens": 357379.0, "step": 425 }, { "entropy": 7.404365539550781, "epoch": 0.009608187069167775, "grad_norm": 1.78125, "learning_rate": 0.0002145, "loss": 6.8237, "mean_token_accuracy": 0.11873817816376686, "num_tokens": 361347.0, "step": 430 }, { "entropy": 7.3829724311828615, "epoch": 0.009719910174623213, "grad_norm": 1.4453125, "learning_rate": 0.00021700000000000002, "loss": 6.8001, "mean_token_accuracy": 0.12097886875271797, "num_tokens": 365364.0, "step": 435 }, { "entropy": 7.4662988662719725, "epoch": 0.009831633280078652, "grad_norm": 1.5078125, "learning_rate": 0.0002195, "loss": 6.8435, "mean_token_accuracy": 0.1184915505349636, "num_tokens": 369648.0, "step": 440 }, { "entropy": 7.550151824951172, "epoch": 0.009943356385534093, "grad_norm": 1.34375, "learning_rate": 0.000222, "loss": 6.8211, "mean_token_accuracy": 0.1224476382136345, "num_tokens": 373734.0, "step": 445 }, { "entropy": 7.477874803543091, "epoch": 0.010055079490989532, "grad_norm": 1.6328125, "learning_rate": 0.0002245, "loss": 6.8174, "mean_token_accuracy": 0.12541017457842826, "num_tokens": 378184.0, "step": 450 }, { "entropy": 7.454969882965088, "epoch": 0.01016680259644497, "grad_norm": 1.3828125, "learning_rate": 0.00022700000000000002, "loss": 6.9275, "mean_token_accuracy": 0.11591533869504929, "num_tokens": 382686.0, "step": 455 }, { "entropy": 7.344128131866455, "epoch": 0.01027852570190041, "grad_norm": 1.6640625, "learning_rate": 0.00022950000000000002, "loss": 6.8348, "mean_token_accuracy": 0.12774229273200036, "num_tokens": 387210.0, "step": 460 }, { "entropy": 7.421209812164307, "epoch": 0.01039024880735585, "grad_norm": 1.484375, "learning_rate": 0.00023200000000000003, "loss": 6.8216, "mean_token_accuracy": 0.12031811997294425, "num_tokens": 391247.0, "step": 465 }, { "entropy": 7.465836143493652, "epoch": 0.010501971912811289, "grad_norm": 1.4921875, "learning_rate": 0.00023449999999999998, "loss": 6.6907, "mean_token_accuracy": 0.13249015137553216, "num_tokens": 395188.0, "step": 470 }, { "entropy": 7.280446100234985, "epoch": 0.010613695018266728, "grad_norm": 1.4375, "learning_rate": 0.000237, "loss": 6.7666, "mean_token_accuracy": 0.12789778113365174, "num_tokens": 399513.0, "step": 475 }, { "entropy": 7.51575026512146, "epoch": 0.010725418123722167, "grad_norm": 1.59375, "learning_rate": 0.0002395, "loss": 6.8438, "mean_token_accuracy": 0.12305677309632301, "num_tokens": 404052.0, "step": 480 }, { "entropy": 7.260741233825684, "epoch": 0.010837141229177606, "grad_norm": 1.40625, "learning_rate": 0.000242, "loss": 6.6724, "mean_token_accuracy": 0.13464880287647246, "num_tokens": 408299.0, "step": 485 }, { "entropy": 7.3084382057189945, "epoch": 0.010948864334633046, "grad_norm": 1.5859375, "learning_rate": 0.0002445, "loss": 6.6808, "mean_token_accuracy": 0.12868183255195617, "num_tokens": 412376.0, "step": 490 }, { "entropy": 7.318713665008545, "epoch": 0.011060587440088485, "grad_norm": 1.484375, "learning_rate": 0.000247, "loss": 6.7365, "mean_token_accuracy": 0.12830623611807823, "num_tokens": 417010.0, "step": 495 }, { "entropy": 7.343731689453125, "epoch": 0.011172310545543924, "grad_norm": 1.734375, "learning_rate": 0.0002495, "loss": 6.615, "mean_token_accuracy": 0.1360365241765976, "num_tokens": 421167.0, "step": 500 }, { "entropy": 7.227418041229248, "epoch": 0.011284033650999363, "grad_norm": 1.3984375, "learning_rate": 0.000252, "loss": 6.715, "mean_token_accuracy": 0.1310766190290451, "num_tokens": 425942.0, "step": 505 }, { "entropy": 7.354942321777344, "epoch": 0.011395756756454803, "grad_norm": 1.3203125, "learning_rate": 0.0002545, "loss": 6.7458, "mean_token_accuracy": 0.13017034903168678, "num_tokens": 430529.0, "step": 510 }, { "entropy": 7.211854124069214, "epoch": 0.011507479861910242, "grad_norm": 1.515625, "learning_rate": 0.000257, "loss": 6.6012, "mean_token_accuracy": 0.12464086860418319, "num_tokens": 434464.0, "step": 515 }, { "entropy": 7.229535865783691, "epoch": 0.011619202967365681, "grad_norm": 1.578125, "learning_rate": 0.0002595, "loss": 6.72, "mean_token_accuracy": 0.13534524589776992, "num_tokens": 438763.0, "step": 520 }, { "entropy": 7.300835609436035, "epoch": 0.01173092607282112, "grad_norm": 1.4296875, "learning_rate": 0.000262, "loss": 6.67, "mean_token_accuracy": 0.12867324203252792, "num_tokens": 442945.0, "step": 525 }, { "entropy": 7.314332723617554, "epoch": 0.011842649178276559, "grad_norm": 1.5859375, "learning_rate": 0.00026450000000000003, "loss": 6.7556, "mean_token_accuracy": 0.12306396216154099, "num_tokens": 447301.0, "step": 530 }, { "entropy": 7.266288375854492, "epoch": 0.011954372283732, "grad_norm": 1.5625, "learning_rate": 0.00026700000000000004, "loss": 6.6174, "mean_token_accuracy": 0.13486616015434266, "num_tokens": 451365.0, "step": 535 }, { "entropy": 7.152557897567749, "epoch": 0.012066095389187438, "grad_norm": 1.671875, "learning_rate": 0.00026950000000000005, "loss": 6.6467, "mean_token_accuracy": 0.13019582405686378, "num_tokens": 455469.0, "step": 540 }, { "entropy": 7.219053745269775, "epoch": 0.012177818494642877, "grad_norm": 1.40625, "learning_rate": 0.00027200000000000005, "loss": 6.7099, "mean_token_accuracy": 0.13144526258111, "num_tokens": 459641.0, "step": 545 }, { "entropy": 7.226452398300171, "epoch": 0.012289541600098316, "grad_norm": 1.5390625, "learning_rate": 0.0002745, "loss": 6.6922, "mean_token_accuracy": 0.13080282509326935, "num_tokens": 463866.0, "step": 550 }, { "entropy": 7.169753932952881, "epoch": 0.012401264705553756, "grad_norm": 1.578125, "learning_rate": 0.000277, "loss": 6.5534, "mean_token_accuracy": 0.14116353392601014, "num_tokens": 467692.0, "step": 555 }, { "entropy": 7.142725467681885, "epoch": 0.012512987811009195, "grad_norm": 1.625, "learning_rate": 0.0002795, "loss": 6.706, "mean_token_accuracy": 0.13806632682681083, "num_tokens": 471719.0, "step": 560 }, { "entropy": 7.179370450973511, "epoch": 0.012624710916464634, "grad_norm": 1.4765625, "learning_rate": 0.00028199999999999997, "loss": 6.6323, "mean_token_accuracy": 0.12942282631993293, "num_tokens": 475978.0, "step": 565 }, { "entropy": 7.241915130615235, "epoch": 0.012736434021920073, "grad_norm": 1.390625, "learning_rate": 0.0002845, "loss": 6.7049, "mean_token_accuracy": 0.13150753006339072, "num_tokens": 480538.0, "step": 570 }, { "entropy": 7.216012620925904, "epoch": 0.012848157127375512, "grad_norm": 1.53125, "learning_rate": 0.000287, "loss": 6.6041, "mean_token_accuracy": 0.13532499819993973, "num_tokens": 484604.0, "step": 575 }, { "entropy": 7.280426120758056, "epoch": 0.012959880232830952, "grad_norm": 1.3359375, "learning_rate": 0.0002895, "loss": 6.6293, "mean_token_accuracy": 0.13353263586759567, "num_tokens": 489117.0, "step": 580 }, { "entropy": 7.161381196975708, "epoch": 0.013071603338286391, "grad_norm": 1.640625, "learning_rate": 0.000292, "loss": 6.5337, "mean_token_accuracy": 0.14060464650392532, "num_tokens": 493020.0, "step": 585 }, { "entropy": 7.130830383300781, "epoch": 0.01318332644374183, "grad_norm": 1.6171875, "learning_rate": 0.0002945, "loss": 6.688, "mean_token_accuracy": 0.1310403361916542, "num_tokens": 497224.0, "step": 590 }, { "entropy": 7.2293980598449705, "epoch": 0.013295049549197269, "grad_norm": 1.578125, "learning_rate": 0.000297, "loss": 6.6199, "mean_token_accuracy": 0.13552179485559462, "num_tokens": 501323.0, "step": 595 }, { "entropy": 7.092097234725952, "epoch": 0.013406772654652708, "grad_norm": 1.59375, "learning_rate": 0.0002995, "loss": 6.6871, "mean_token_accuracy": 0.1318632557988167, "num_tokens": 505544.0, "step": 600 }, { "entropy": 7.2185986042022705, "epoch": 0.013518495760108148, "grad_norm": 1.4296875, "learning_rate": 0.000302, "loss": 6.624, "mean_token_accuracy": 0.14037465676665306, "num_tokens": 509980.0, "step": 605 }, { "entropy": 7.0673870086669925, "epoch": 0.013630218865563587, "grad_norm": 1.84375, "learning_rate": 0.0003045, "loss": 6.4906, "mean_token_accuracy": 0.1455707758665085, "num_tokens": 514264.0, "step": 610 }, { "entropy": 7.061304330825806, "epoch": 0.013741941971019026, "grad_norm": 1.6875, "learning_rate": 0.000307, "loss": 6.573, "mean_token_accuracy": 0.14321403577923775, "num_tokens": 518482.0, "step": 615 }, { "entropy": 7.22766146659851, "epoch": 0.013853665076474465, "grad_norm": 1.515625, "learning_rate": 0.0003095, "loss": 6.6066, "mean_token_accuracy": 0.1336400181055069, "num_tokens": 522765.0, "step": 620 }, { "entropy": 7.029418087005615, "epoch": 0.013965388181929906, "grad_norm": 1.3515625, "learning_rate": 0.000312, "loss": 6.4457, "mean_token_accuracy": 0.14515347853302957, "num_tokens": 526794.0, "step": 625 }, { "entropy": 7.065269136428833, "epoch": 0.014077111287385344, "grad_norm": 1.53125, "learning_rate": 0.0003145, "loss": 6.5766, "mean_token_accuracy": 0.14270118325948716, "num_tokens": 531070.0, "step": 630 }, { "entropy": 7.208616876602173, "epoch": 0.014188834392840783, "grad_norm": 1.390625, "learning_rate": 0.000317, "loss": 6.6389, "mean_token_accuracy": 0.13457323089241982, "num_tokens": 535655.0, "step": 635 }, { "entropy": 7.065006256103516, "epoch": 0.014300557498296222, "grad_norm": 1.375, "learning_rate": 0.0003195, "loss": 6.666, "mean_token_accuracy": 0.13108374997973443, "num_tokens": 540231.0, "step": 640 }, { "entropy": 7.094880771636963, "epoch": 0.014412280603751661, "grad_norm": 1.4921875, "learning_rate": 0.000322, "loss": 6.5078, "mean_token_accuracy": 0.14435381516814233, "num_tokens": 544180.0, "step": 645 }, { "entropy": 7.076756286621094, "epoch": 0.014524003709207102, "grad_norm": 1.640625, "learning_rate": 0.00032450000000000003, "loss": 6.4786, "mean_token_accuracy": 0.13342859596014023, "num_tokens": 547905.0, "step": 650 }, { "entropy": 6.96412615776062, "epoch": 0.01463572681466254, "grad_norm": 1.53125, "learning_rate": 0.00032700000000000003, "loss": 6.5565, "mean_token_accuracy": 0.14217662066221237, "num_tokens": 552248.0, "step": 655 }, { "entropy": 7.046826982498169, "epoch": 0.01474744992011798, "grad_norm": 1.6875, "learning_rate": 0.00032950000000000004, "loss": 6.3918, "mean_token_accuracy": 0.14909711182117463, "num_tokens": 556430.0, "step": 660 }, { "entropy": 7.026239967346191, "epoch": 0.014859173025573418, "grad_norm": 1.6875, "learning_rate": 0.00033200000000000005, "loss": 6.4678, "mean_token_accuracy": 0.15065777227282523, "num_tokens": 560114.0, "step": 665 }, { "entropy": 6.857525396347046, "epoch": 0.014970896131028859, "grad_norm": 1.3515625, "learning_rate": 0.00033450000000000005, "loss": 6.4711, "mean_token_accuracy": 0.14087381735444068, "num_tokens": 564624.0, "step": 670 }, { "entropy": 7.029787588119507, "epoch": 0.015082619236484298, "grad_norm": 1.6015625, "learning_rate": 0.000337, "loss": 6.4073, "mean_token_accuracy": 0.14824407249689103, "num_tokens": 568918.0, "step": 675 }, { "entropy": 7.077581787109375, "epoch": 0.015194342341939737, "grad_norm": 1.59375, "learning_rate": 0.0003395, "loss": 6.4725, "mean_token_accuracy": 0.15365976840257645, "num_tokens": 572972.0, "step": 680 }, { "entropy": 6.980326414108276, "epoch": 0.015306065447395175, "grad_norm": 1.5, "learning_rate": 0.000342, "loss": 6.4873, "mean_token_accuracy": 0.15378629714250563, "num_tokens": 577250.0, "step": 685 }, { "entropy": 7.116094398498535, "epoch": 0.015417788552850614, "grad_norm": 1.4296875, "learning_rate": 0.00034449999999999997, "loss": 6.4245, "mean_token_accuracy": 0.1488552987575531, "num_tokens": 581418.0, "step": 690 }, { "entropy": 6.932662296295166, "epoch": 0.015529511658306055, "grad_norm": 1.6015625, "learning_rate": 0.000347, "loss": 6.5042, "mean_token_accuracy": 0.15049396306276322, "num_tokens": 585675.0, "step": 695 }, { "entropy": 6.966062307357788, "epoch": 0.015641234763761492, "grad_norm": 1.46875, "learning_rate": 0.0003495, "loss": 6.392, "mean_token_accuracy": 0.1462944969534874, "num_tokens": 590032.0, "step": 700 }, { "entropy": 6.915396404266358, "epoch": 0.015752957869216933, "grad_norm": 1.5390625, "learning_rate": 0.000352, "loss": 6.3949, "mean_token_accuracy": 0.1510719522833824, "num_tokens": 594185.0, "step": 705 }, { "entropy": 6.896506881713867, "epoch": 0.015864680974672373, "grad_norm": 1.5546875, "learning_rate": 0.0003545, "loss": 6.3488, "mean_token_accuracy": 0.15710561126470565, "num_tokens": 598246.0, "step": 710 }, { "entropy": 6.905340528488159, "epoch": 0.01597640408012781, "grad_norm": 1.515625, "learning_rate": 0.000357, "loss": 6.4826, "mean_token_accuracy": 0.14725056737661363, "num_tokens": 602676.0, "step": 715 }, { "entropy": 6.877582645416259, "epoch": 0.01608812718558325, "grad_norm": 1.5546875, "learning_rate": 0.0003595, "loss": 6.3352, "mean_token_accuracy": 0.16034641861915588, "num_tokens": 606693.0, "step": 720 }, { "entropy": 6.880430507659912, "epoch": 0.01619985029103869, "grad_norm": 1.6484375, "learning_rate": 0.000362, "loss": 6.3591, "mean_token_accuracy": 0.14268538355827332, "num_tokens": 610780.0, "step": 725 }, { "entropy": 6.902221918106079, "epoch": 0.01631157339649413, "grad_norm": 1.421875, "learning_rate": 0.0003645, "loss": 6.4226, "mean_token_accuracy": 0.1481914848089218, "num_tokens": 614746.0, "step": 730 }, { "entropy": 6.847220468521118, "epoch": 0.01642329650194957, "grad_norm": 1.375, "learning_rate": 0.000367, "loss": 6.3719, "mean_token_accuracy": 0.15163339525461197, "num_tokens": 619222.0, "step": 735 }, { "entropy": 6.968106889724732, "epoch": 0.016535019607405006, "grad_norm": 1.34375, "learning_rate": 0.0003695, "loss": 6.5165, "mean_token_accuracy": 0.14626363143324853, "num_tokens": 623746.0, "step": 740 }, { "entropy": 6.9071704864501955, "epoch": 0.016646742712860447, "grad_norm": 1.28125, "learning_rate": 0.000372, "loss": 6.366, "mean_token_accuracy": 0.15544869527220725, "num_tokens": 628392.0, "step": 745 }, { "entropy": 6.845142030715943, "epoch": 0.016758465818315887, "grad_norm": 1.5234375, "learning_rate": 0.0003745, "loss": 6.3775, "mean_token_accuracy": 0.14660717099905013, "num_tokens": 632439.0, "step": 750 }, { "entropy": 6.813414907455444, "epoch": 0.016870188923771325, "grad_norm": 1.3515625, "learning_rate": 0.000377, "loss": 6.4088, "mean_token_accuracy": 0.1431469090282917, "num_tokens": 636801.0, "step": 755 }, { "entropy": 6.88551287651062, "epoch": 0.016981912029226765, "grad_norm": 1.5234375, "learning_rate": 0.0003795, "loss": 6.2173, "mean_token_accuracy": 0.16097238063812255, "num_tokens": 640818.0, "step": 760 }, { "entropy": 6.7791321754455565, "epoch": 0.017093635134682202, "grad_norm": 1.6171875, "learning_rate": 0.000382, "loss": 6.3784, "mean_token_accuracy": 0.14307227358222008, "num_tokens": 644914.0, "step": 765 }, { "entropy": 6.967279005050659, "epoch": 0.017205358240137643, "grad_norm": 1.5625, "learning_rate": 0.0003845, "loss": 6.4658, "mean_token_accuracy": 0.14935086220502852, "num_tokens": 649368.0, "step": 770 }, { "entropy": 6.788582992553711, "epoch": 0.017317081345593083, "grad_norm": 1.5390625, "learning_rate": 0.00038700000000000003, "loss": 6.2984, "mean_token_accuracy": 0.15846630781888962, "num_tokens": 653537.0, "step": 775 }, { "entropy": 6.87021164894104, "epoch": 0.01742880445104852, "grad_norm": 1.5625, "learning_rate": 0.00038950000000000003, "loss": 6.4177, "mean_token_accuracy": 0.13871796652674676, "num_tokens": 658232.0, "step": 780 }, { "entropy": 6.85303897857666, "epoch": 0.01754052755650396, "grad_norm": 1.453125, "learning_rate": 0.00039200000000000004, "loss": 6.3841, "mean_token_accuracy": 0.14893919229507446, "num_tokens": 662512.0, "step": 785 }, { "entropy": 6.839845895767212, "epoch": 0.0176522506619594, "grad_norm": 1.4765625, "learning_rate": 0.00039450000000000005, "loss": 6.372, "mean_token_accuracy": 0.15011741518974303, "num_tokens": 666759.0, "step": 790 }, { "entropy": 6.646692132949829, "epoch": 0.01776397376741484, "grad_norm": 1.46875, "learning_rate": 0.00039700000000000005, "loss": 6.2896, "mean_token_accuracy": 0.1571863681077957, "num_tokens": 670870.0, "step": 795 }, { "entropy": 6.806870698928833, "epoch": 0.01787569687287028, "grad_norm": 1.515625, "learning_rate": 0.0003995, "loss": 6.2513, "mean_token_accuracy": 0.158031065762043, "num_tokens": 675150.0, "step": 800 }, { "entropy": 6.714898729324341, "epoch": 0.017987419978325717, "grad_norm": 1.6875, "learning_rate": 0.000402, "loss": 6.1745, "mean_token_accuracy": 0.1610417976975441, "num_tokens": 679083.0, "step": 805 }, { "entropy": 6.70656795501709, "epoch": 0.018099143083781157, "grad_norm": 1.65625, "learning_rate": 0.0004045, "loss": 6.371, "mean_token_accuracy": 0.15746122524142264, "num_tokens": 683477.0, "step": 810 }, { "entropy": 6.743958902359009, "epoch": 0.018210866189236594, "grad_norm": 1.453125, "learning_rate": 0.00040699999999999997, "loss": 6.1656, "mean_token_accuracy": 0.16271859258413315, "num_tokens": 687819.0, "step": 815 }, { "entropy": 6.8285057067871096, "epoch": 0.018322589294692035, "grad_norm": 1.3671875, "learning_rate": 0.0004095, "loss": 6.3924, "mean_token_accuracy": 0.15080199763178825, "num_tokens": 692017.0, "step": 820 }, { "entropy": 6.8905205726623535, "epoch": 0.018434312400147475, "grad_norm": 1.34375, "learning_rate": 0.000412, "loss": 6.3853, "mean_token_accuracy": 0.14643741324543952, "num_tokens": 696853.0, "step": 825 }, { "entropy": 6.839770412445068, "epoch": 0.018546035505602913, "grad_norm": 1.3671875, "learning_rate": 0.0004145, "loss": 6.4221, "mean_token_accuracy": 0.1416957326233387, "num_tokens": 701131.0, "step": 830 }, { "entropy": 6.750663423538208, "epoch": 0.018657758611058353, "grad_norm": 1.5546875, "learning_rate": 0.000417, "loss": 6.3757, "mean_token_accuracy": 0.1462937667965889, "num_tokens": 705428.0, "step": 835 }, { "entropy": 6.672054672241211, "epoch": 0.018769481716513794, "grad_norm": 1.3984375, "learning_rate": 0.0004195, "loss": 6.2377, "mean_token_accuracy": 0.16088497787714004, "num_tokens": 709760.0, "step": 840 }, { "entropy": 6.700072860717773, "epoch": 0.01888120482196923, "grad_norm": 1.375, "learning_rate": 0.000422, "loss": 6.2073, "mean_token_accuracy": 0.1617395505309105, "num_tokens": 713964.0, "step": 845 }, { "entropy": 6.665010023117065, "epoch": 0.01899292792742467, "grad_norm": 1.5078125, "learning_rate": 0.0004245, "loss": 6.3575, "mean_token_accuracy": 0.15287077873945237, "num_tokens": 718305.0, "step": 850 }, { "entropy": 6.806714677810669, "epoch": 0.01910465103288011, "grad_norm": 1.5390625, "learning_rate": 0.000427, "loss": 6.2661, "mean_token_accuracy": 0.15892615169286728, "num_tokens": 722705.0, "step": 855 }, { "entropy": 6.528658866882324, "epoch": 0.01921637413833555, "grad_norm": 1.5703125, "learning_rate": 0.0004295, "loss": 6.1765, "mean_token_accuracy": 0.16424758732318878, "num_tokens": 726529.0, "step": 860 }, { "entropy": 6.659326124191284, "epoch": 0.01932809724379099, "grad_norm": 1.4375, "learning_rate": 0.000432, "loss": 6.2522, "mean_token_accuracy": 0.15339272618293762, "num_tokens": 730535.0, "step": 865 }, { "entropy": 6.74210753440857, "epoch": 0.019439820349246427, "grad_norm": 1.3984375, "learning_rate": 0.0004345, "loss": 6.2117, "mean_token_accuracy": 0.15879523605108262, "num_tokens": 734836.0, "step": 870 }, { "entropy": 6.65736346244812, "epoch": 0.019551543454701868, "grad_norm": 1.453125, "learning_rate": 0.000437, "loss": 6.2891, "mean_token_accuracy": 0.15371360629796982, "num_tokens": 739176.0, "step": 875 }, { "entropy": 6.574539995193481, "epoch": 0.019663266560157305, "grad_norm": 1.390625, "learning_rate": 0.0004395, "loss": 6.2674, "mean_token_accuracy": 0.15556667894124984, "num_tokens": 743497.0, "step": 880 }, { "entropy": 6.720397853851319, "epoch": 0.019774989665612745, "grad_norm": 1.5234375, "learning_rate": 0.000442, "loss": 6.2818, "mean_token_accuracy": 0.16183461248874664, "num_tokens": 747185.0, "step": 885 }, { "entropy": 6.739978790283203, "epoch": 0.019886712771068186, "grad_norm": 1.375, "learning_rate": 0.0004445, "loss": 6.4179, "mean_token_accuracy": 0.1448575735092163, "num_tokens": 751345.0, "step": 890 }, { "entropy": 6.7309082508087155, "epoch": 0.019998435876523623, "grad_norm": 1.4765625, "learning_rate": 0.000447, "loss": 6.2944, "mean_token_accuracy": 0.15704837888479234, "num_tokens": 755618.0, "step": 895 }, { "entropy": 6.653637266159057, "epoch": 0.020110158981979064, "grad_norm": 1.46875, "learning_rate": 0.00044950000000000003, "loss": 6.2788, "mean_token_accuracy": 0.15478281527757645, "num_tokens": 759583.0, "step": 900 }, { "entropy": 6.644137716293335, "epoch": 0.0202218820874345, "grad_norm": 1.453125, "learning_rate": 0.00045200000000000004, "loss": 6.1758, "mean_token_accuracy": 0.1591601625084877, "num_tokens": 763861.0, "step": 905 }, { "entropy": 6.53189525604248, "epoch": 0.02033360519288994, "grad_norm": 1.3984375, "learning_rate": 0.00045450000000000004, "loss": 6.1717, "mean_token_accuracy": 0.16117519289255142, "num_tokens": 768046.0, "step": 910 }, { "entropy": 6.686648035049439, "epoch": 0.020445328298345382, "grad_norm": 1.4921875, "learning_rate": 0.00045700000000000005, "loss": 6.1927, "mean_token_accuracy": 0.15583422034978867, "num_tokens": 772570.0, "step": 915 }, { "entropy": 6.651849317550659, "epoch": 0.02055705140380082, "grad_norm": 1.3359375, "learning_rate": 0.00045950000000000006, "loss": 6.3181, "mean_token_accuracy": 0.15458481013774872, "num_tokens": 777324.0, "step": 920 }, { "entropy": 6.669686937332154, "epoch": 0.02066877450925626, "grad_norm": 1.328125, "learning_rate": 0.000462, "loss": 6.3017, "mean_token_accuracy": 0.14780564680695535, "num_tokens": 781829.0, "step": 925 }, { "entropy": 6.655124092102051, "epoch": 0.0207804976147117, "grad_norm": 1.3359375, "learning_rate": 0.0004645, "loss": 6.1719, "mean_token_accuracy": 0.15766340345144272, "num_tokens": 786089.0, "step": 930 }, { "entropy": 6.433820819854736, "epoch": 0.020892220720167137, "grad_norm": 1.3203125, "learning_rate": 0.000467, "loss": 6.1607, "mean_token_accuracy": 0.16852562725543976, "num_tokens": 790273.0, "step": 935 }, { "entropy": 6.675999402999878, "epoch": 0.021003943825622578, "grad_norm": 1.3515625, "learning_rate": 0.0004695, "loss": 6.1583, "mean_token_accuracy": 0.17233449518680571, "num_tokens": 794600.0, "step": 940 }, { "entropy": 6.556878328323364, "epoch": 0.021115666931078015, "grad_norm": 1.5078125, "learning_rate": 0.000472, "loss": 6.149, "mean_token_accuracy": 0.16213736683130264, "num_tokens": 798756.0, "step": 945 }, { "entropy": 6.6472193717956545, "epoch": 0.021227390036533456, "grad_norm": 1.3828125, "learning_rate": 0.0004745, "loss": 6.1599, "mean_token_accuracy": 0.16358468383550645, "num_tokens": 803122.0, "step": 950 }, { "entropy": 6.386259412765503, "epoch": 0.021339113141988896, "grad_norm": 1.5390625, "learning_rate": 0.000477, "loss": 6.1891, "mean_token_accuracy": 0.15860249921679498, "num_tokens": 807393.0, "step": 955 }, { "entropy": 6.601777124404907, "epoch": 0.021450836247444333, "grad_norm": 1.46875, "learning_rate": 0.0004795, "loss": 6.1289, "mean_token_accuracy": 0.16311845034360886, "num_tokens": 811735.0, "step": 960 }, { "entropy": 6.646067714691162, "epoch": 0.021562559352899774, "grad_norm": 1.3671875, "learning_rate": 0.000482, "loss": 6.3186, "mean_token_accuracy": 0.15336783230304718, "num_tokens": 816327.0, "step": 965 }, { "entropy": 6.546494245529175, "epoch": 0.02167428245835521, "grad_norm": 1.578125, "learning_rate": 0.0004845, "loss": 6.1048, "mean_token_accuracy": 0.1641931340098381, "num_tokens": 820476.0, "step": 970 }, { "entropy": 6.502486848831177, "epoch": 0.02178600556381065, "grad_norm": 1.3984375, "learning_rate": 0.000487, "loss": 6.1289, "mean_token_accuracy": 0.16595971435308457, "num_tokens": 824563.0, "step": 975 }, { "entropy": 6.51844539642334, "epoch": 0.021897728669266092, "grad_norm": 1.375, "learning_rate": 0.0004895, "loss": 6.2249, "mean_token_accuracy": 0.15903169065713882, "num_tokens": 829307.0, "step": 980 }, { "entropy": 6.48329792022705, "epoch": 0.02200945177472153, "grad_norm": 1.359375, "learning_rate": 0.000492, "loss": 6.2234, "mean_token_accuracy": 0.16081805527210236, "num_tokens": 833876.0, "step": 985 }, { "entropy": 6.577699089050293, "epoch": 0.02212117488017697, "grad_norm": 1.421875, "learning_rate": 0.0004945, "loss": 6.3108, "mean_token_accuracy": 0.15140475034713746, "num_tokens": 838484.0, "step": 990 }, { "entropy": 6.628869199752808, "epoch": 0.022232897985632407, "grad_norm": 1.453125, "learning_rate": 0.000497, "loss": 6.1561, "mean_token_accuracy": 0.1592697098851204, "num_tokens": 842813.0, "step": 995 }, { "entropy": 6.393803596496582, "epoch": 0.022344621091087848, "grad_norm": 1.515625, "learning_rate": 0.0004995, "loss": 6.0899, "mean_token_accuracy": 0.16069612354040147, "num_tokens": 846638.0, "step": 1000 }, { "entropy": 6.4989090919494625, "epoch": 0.022456344196543288, "grad_norm": 1.578125, "learning_rate": 0.000499998026082006, "loss": 6.0626, "mean_token_accuracy": 0.17749472558498383, "num_tokens": 850577.0, "step": 1005 }, { "entropy": 6.439338541030883, "epoch": 0.022568067301998725, "grad_norm": 1.34375, "learning_rate": 0.0004999900070995136, "loss": 6.0906, "mean_token_accuracy": 0.16202376335859298, "num_tokens": 854904.0, "step": 1010 }, { "entropy": 6.5132981300354, "epoch": 0.022679790407454166, "grad_norm": 1.421875, "learning_rate": 0.0004999758199023239, "loss": 6.1076, "mean_token_accuracy": 0.17384408712387084, "num_tokens": 858859.0, "step": 1015 }, { "entropy": 6.43322901725769, "epoch": 0.022791513512909607, "grad_norm": 1.5, "learning_rate": 0.0004999554648793858, "loss": 6.055, "mean_token_accuracy": 0.16654047518968582, "num_tokens": 863121.0, "step": 1020 }, { "entropy": 6.506139421463013, "epoch": 0.022903236618365044, "grad_norm": 1.4765625, "learning_rate": 0.0004999289425887425, "loss": 6.1709, "mean_token_accuracy": 0.15935743749141693, "num_tokens": 867805.0, "step": 1025 }, { "entropy": 6.488983964920044, "epoch": 0.023014959723820484, "grad_norm": 1.2578125, "learning_rate": 0.0004998962537575161, "loss": 6.1244, "mean_token_accuracy": 0.1593026451766491, "num_tokens": 871988.0, "step": 1030 }, { "entropy": 6.497362184524536, "epoch": 0.02312668282927592, "grad_norm": 1.4296875, "learning_rate": 0.0004998573992818874, "loss": 6.0959, "mean_token_accuracy": 0.16356074959039688, "num_tokens": 876181.0, "step": 1035 }, { "entropy": 6.301354026794433, "epoch": 0.023238405934731362, "grad_norm": 1.7265625, "learning_rate": 0.0004998123802270715, "loss": 5.9669, "mean_token_accuracy": 0.18099125623703002, "num_tokens": 880521.0, "step": 1040 }, { "entropy": 6.322625303268433, "epoch": 0.023350129040186803, "grad_norm": 1.3046875, "learning_rate": 0.0004997611978272886, "loss": 6.1019, "mean_token_accuracy": 0.16592444032430648, "num_tokens": 885006.0, "step": 1045 }, { "entropy": 6.541764831542968, "epoch": 0.02346185214564224, "grad_norm": 1.34375, "learning_rate": 0.0004997038534857298, "loss": 6.1038, "mean_token_accuracy": 0.15975722372531892, "num_tokens": 889184.0, "step": 1050 }, { "entropy": 6.410001420974732, "epoch": 0.02357357525109768, "grad_norm": 1.46875, "learning_rate": 0.0004996403487745194, "loss": 6.0039, "mean_token_accuracy": 0.17406690418720244, "num_tokens": 893806.0, "step": 1055 }, { "entropy": 6.391436147689819, "epoch": 0.023685298356553117, "grad_norm": 1.3828125, "learning_rate": 0.000499570685434671, "loss": 6.0131, "mean_token_accuracy": 0.17006947249174117, "num_tokens": 897578.0, "step": 1060 }, { "entropy": 6.47973518371582, "epoch": 0.023797021462008558, "grad_norm": 1.3515625, "learning_rate": 0.0004994948653760405, "loss": 6.2734, "mean_token_accuracy": 0.15798939615488053, "num_tokens": 902225.0, "step": 1065 }, { "entropy": 6.551846933364868, "epoch": 0.023908744567464, "grad_norm": 1.2890625, "learning_rate": 0.0004994128906772729, "loss": 6.1246, "mean_token_accuracy": 0.1635009005665779, "num_tokens": 906477.0, "step": 1070 }, { "entropy": 6.386241388320923, "epoch": 0.024020467672919436, "grad_norm": 1.2578125, "learning_rate": 0.000499324763585746, "loss": 6.1123, "mean_token_accuracy": 0.15879142582416533, "num_tokens": 910948.0, "step": 1075 }, { "entropy": 6.503281879425049, "epoch": 0.024132190778374876, "grad_norm": 1.421875, "learning_rate": 0.0004992304865175085, "loss": 6.2186, "mean_token_accuracy": 0.14976079761981964, "num_tokens": 915157.0, "step": 1080 }, { "entropy": 6.450709199905395, "epoch": 0.024243913883830313, "grad_norm": 1.3125, "learning_rate": 0.0004991300620572138, "loss": 6.0396, "mean_token_accuracy": 0.16553105041384697, "num_tokens": 920251.0, "step": 1085 }, { "entropy": 6.222010898590088, "epoch": 0.024355636989285754, "grad_norm": 1.3515625, "learning_rate": 0.0004990234929580494, "loss": 6.1224, "mean_token_accuracy": 0.16098514199256897, "num_tokens": 924510.0, "step": 1090 }, { "entropy": 6.347459030151367, "epoch": 0.024467360094741195, "grad_norm": 1.359375, "learning_rate": 0.0004989107821416609, "loss": 6.0245, "mean_token_accuracy": 0.1654239609837532, "num_tokens": 928925.0, "step": 1095 }, { "entropy": 6.316383314132691, "epoch": 0.02457908320019663, "grad_norm": 1.2734375, "learning_rate": 0.0004987919326980723, "loss": 6.0384, "mean_token_accuracy": 0.17247851192951202, "num_tokens": 933211.0, "step": 1100 }, { "entropy": 6.317654371261597, "epoch": 0.024690806305652072, "grad_norm": 1.40625, "learning_rate": 0.0004986669478856011, "loss": 6.1915, "mean_token_accuracy": 0.15772637948393822, "num_tokens": 937621.0, "step": 1105 }, { "entropy": 6.42638087272644, "epoch": 0.024802529411107513, "grad_norm": 1.375, "learning_rate": 0.0004985358311307688, "loss": 6.0898, "mean_token_accuracy": 0.1647167555987835, "num_tokens": 941629.0, "step": 1110 }, { "entropy": 6.330166149139404, "epoch": 0.02491425251656295, "grad_norm": 1.3671875, "learning_rate": 0.0004983985860282081, "loss": 6.0709, "mean_token_accuracy": 0.16174031496047975, "num_tokens": 945853.0, "step": 1115 }, { "entropy": 6.225450944900513, "epoch": 0.02502597562201839, "grad_norm": 1.5703125, "learning_rate": 0.0004982552163405623, "loss": 5.9055, "mean_token_accuracy": 0.17898752093315123, "num_tokens": 949758.0, "step": 1120 }, { "entropy": 6.182316493988037, "epoch": 0.025137698727473828, "grad_norm": 1.40625, "learning_rate": 0.0004981057259983839, "loss": 6.0268, "mean_token_accuracy": 0.17987219095230103, "num_tokens": 954028.0, "step": 1125 }, { "entropy": 6.319781017303467, "epoch": 0.02524942183292927, "grad_norm": 1.4296875, "learning_rate": 0.0004979501191000262, "loss": 6.0393, "mean_token_accuracy": 0.16309117376804352, "num_tokens": 958006.0, "step": 1130 }, { "entropy": 6.320125341415405, "epoch": 0.02536114493838471, "grad_norm": 1.4921875, "learning_rate": 0.0004977883999115311, "loss": 5.9716, "mean_token_accuracy": 0.17731243520975112, "num_tokens": 962637.0, "step": 1135 }, { "entropy": 6.350974798202515, "epoch": 0.025472868043840146, "grad_norm": 1.2734375, "learning_rate": 0.0004976205728665113, "loss": 5.9456, "mean_token_accuracy": 0.17742093056440353, "num_tokens": 966770.0, "step": 1140 }, { "entropy": 6.1780962467193605, "epoch": 0.025584591149295587, "grad_norm": 1.3984375, "learning_rate": 0.0004974466425660307, "loss": 5.9758, "mean_token_accuracy": 0.1761695474386215, "num_tokens": 970976.0, "step": 1145 }, { "entropy": 6.276739263534546, "epoch": 0.025696314254751024, "grad_norm": 1.4453125, "learning_rate": 0.0004972666137784759, "loss": 6.0095, "mean_token_accuracy": 0.16108598709106445, "num_tokens": 975253.0, "step": 1150 }, { "entropy": 6.226910066604614, "epoch": 0.025808037360206464, "grad_norm": 1.2734375, "learning_rate": 0.0004970804914394271, "loss": 5.998, "mean_token_accuracy": 0.1661012887954712, "num_tokens": 979388.0, "step": 1155 }, { "entropy": 6.162249755859375, "epoch": 0.025919760465661905, "grad_norm": 1.453125, "learning_rate": 0.0004968882806515225, "loss": 5.9613, "mean_token_accuracy": 0.1830698937177658, "num_tokens": 983216.0, "step": 1160 }, { "entropy": 6.258333396911621, "epoch": 0.026031483571117342, "grad_norm": 1.2265625, "learning_rate": 0.0004966899866843177, "loss": 6.061, "mean_token_accuracy": 0.16143736988306046, "num_tokens": 987850.0, "step": 1165 }, { "entropy": 6.322597026824951, "epoch": 0.026143206676572783, "grad_norm": 1.2578125, "learning_rate": 0.000496485614974142, "loss": 5.9894, "mean_token_accuracy": 0.17105733901262282, "num_tokens": 992232.0, "step": 1170 }, { "entropy": 6.21760311126709, "epoch": 0.02625492978202822, "grad_norm": 1.421875, "learning_rate": 0.0004962751711239492, "loss": 6.0848, "mean_token_accuracy": 0.1664736032485962, "num_tokens": 996428.0, "step": 1175 }, { "entropy": 6.334726476669312, "epoch": 0.02636665288748366, "grad_norm": 1.4140625, "learning_rate": 0.0004960586609031636, "loss": 5.9449, "mean_token_accuracy": 0.17343248575925826, "num_tokens": 1000336.0, "step": 1180 }, { "entropy": 6.3395665168762205, "epoch": 0.0264783759929391, "grad_norm": 1.4609375, "learning_rate": 0.0004958360902475224, "loss": 5.9253, "mean_token_accuracy": 0.17060509622097014, "num_tokens": 1004312.0, "step": 1185 }, { "entropy": 6.365295124053955, "epoch": 0.026590099098394538, "grad_norm": 1.359375, "learning_rate": 0.0004956074652589125, "loss": 6.1563, "mean_token_accuracy": 0.16267625764012336, "num_tokens": 1008728.0, "step": 1190 }, { "entropy": 6.270880270004272, "epoch": 0.02670182220384998, "grad_norm": 1.359375, "learning_rate": 0.0004953727922052035, "loss": 6.0663, "mean_token_accuracy": 0.16970421522855758, "num_tokens": 1013385.0, "step": 1195 }, { "entropy": 6.310678911209107, "epoch": 0.026813545309305416, "grad_norm": 1.265625, "learning_rate": 0.0004951320775200756, "loss": 6.0449, "mean_token_accuracy": 0.16335367113351823, "num_tokens": 1017537.0, "step": 1200 }, { "entropy": 6.093309450149536, "epoch": 0.026925268414760856, "grad_norm": 1.4296875, "learning_rate": 0.0004948853278028436, "loss": 5.9362, "mean_token_accuracy": 0.17884828001260758, "num_tokens": 1021753.0, "step": 1205 }, { "entropy": 6.228685140609741, "epoch": 0.027036991520216297, "grad_norm": 1.296875, "learning_rate": 0.0004946325498182755, "loss": 6.0468, "mean_token_accuracy": 0.16449340134859086, "num_tokens": 1026248.0, "step": 1210 }, { "entropy": 6.192647790908813, "epoch": 0.027148714625671734, "grad_norm": 1.3828125, "learning_rate": 0.0004943737504964076, "loss": 5.838, "mean_token_accuracy": 0.18312328010797502, "num_tokens": 1030284.0, "step": 1215 }, { "entropy": 6.250751209259033, "epoch": 0.027260437731127175, "grad_norm": 1.3125, "learning_rate": 0.000494108936932354, "loss": 6.1342, "mean_token_accuracy": 0.16936966106295587, "num_tokens": 1034444.0, "step": 1220 }, { "entropy": 6.304910802841187, "epoch": 0.027372160836582615, "grad_norm": 1.359375, "learning_rate": 0.0004938381163861124, "loss": 5.9104, "mean_token_accuracy": 0.18955854922533036, "num_tokens": 1038819.0, "step": 1225 }, { "entropy": 6.332531595230103, "epoch": 0.027483883942038052, "grad_norm": 1.3203125, "learning_rate": 0.0004935612962823645, "loss": 6.1242, "mean_token_accuracy": 0.16566465348005294, "num_tokens": 1043303.0, "step": 1230 }, { "entropy": 6.162945175170899, "epoch": 0.027595607047493493, "grad_norm": 1.4453125, "learning_rate": 0.0004932784842102739, "loss": 5.9639, "mean_token_accuracy": 0.1748690575361252, "num_tokens": 1047451.0, "step": 1235 }, { "entropy": 6.292677593231201, "epoch": 0.02770733015294893, "grad_norm": 1.1875, "learning_rate": 0.0004929896879232758, "loss": 6.0031, "mean_token_accuracy": 0.17595543414354325, "num_tokens": 1052370.0, "step": 1240 }, { "entropy": 6.406116533279419, "epoch": 0.02781905325840437, "grad_norm": 1.3984375, "learning_rate": 0.0004926949153388668, "loss": 6.1119, "mean_token_accuracy": 0.1625329688191414, "num_tokens": 1056755.0, "step": 1245 }, { "entropy": 6.257381248474121, "epoch": 0.02793077636385981, "grad_norm": 1.25, "learning_rate": 0.0004923941745383859, "loss": 5.9983, "mean_token_accuracy": 0.16609450280666352, "num_tokens": 1061380.0, "step": 1250 }, { "entropy": 6.04865870475769, "epoch": 0.02804249946931525, "grad_norm": 1.2578125, "learning_rate": 0.000492087473766794, "loss": 5.8919, "mean_token_accuracy": 0.18033342361450194, "num_tokens": 1065633.0, "step": 1255 }, { "entropy": 6.278530168533325, "epoch": 0.02815422257477069, "grad_norm": 1.46875, "learning_rate": 0.000491774821432448, "loss": 6.0283, "mean_token_accuracy": 0.16999331265687942, "num_tokens": 1070131.0, "step": 1260 }, { "entropy": 6.240628862380982, "epoch": 0.028265945680226126, "grad_norm": 1.3046875, "learning_rate": 0.0004914562261068693, "loss": 5.9501, "mean_token_accuracy": 0.16984693259000777, "num_tokens": 1074465.0, "step": 1265 }, { "entropy": 6.062196207046509, "epoch": 0.028377668785681567, "grad_norm": 1.4296875, "learning_rate": 0.0004911316965245098, "loss": 5.828, "mean_token_accuracy": 0.17757159918546678, "num_tokens": 1078738.0, "step": 1270 }, { "entropy": 6.12146635055542, "epoch": 0.028489391891137007, "grad_norm": 1.3203125, "learning_rate": 0.000490801241582512, "loss": 5.9453, "mean_token_accuracy": 0.17620262503623962, "num_tokens": 1082529.0, "step": 1275 }, { "entropy": 6.328038311004638, "epoch": 0.028601114996592444, "grad_norm": 1.3125, "learning_rate": 0.000490464870340465, "loss": 6.0216, "mean_token_accuracy": 0.16488975435495376, "num_tokens": 1087043.0, "step": 1280 }, { "entropy": 6.050336456298828, "epoch": 0.028712838102047885, "grad_norm": 1.4296875, "learning_rate": 0.0004901225920201563, "loss": 5.9187, "mean_token_accuracy": 0.18301421254873276, "num_tokens": 1091045.0, "step": 1285 }, { "entropy": 6.1567244052886965, "epoch": 0.028824561207503322, "grad_norm": 1.421875, "learning_rate": 0.000489774416005319, "loss": 5.8778, "mean_token_accuracy": 0.18505997806787491, "num_tokens": 1094949.0, "step": 1290 }, { "entropy": 6.193764543533325, "epoch": 0.028936284312958763, "grad_norm": 1.390625, "learning_rate": 0.0004894203518413742, "loss": 5.942, "mean_token_accuracy": 0.17170550525188447, "num_tokens": 1099131.0, "step": 1295 }, { "entropy": 6.024008512496948, "epoch": 0.029048007418414203, "grad_norm": 1.3359375, "learning_rate": 0.0004890604092351701, "loss": 5.8863, "mean_token_accuracy": 0.18198106437921524, "num_tokens": 1102967.0, "step": 1300 }, { "entropy": 6.191930198669434, "epoch": 0.02915973052386964, "grad_norm": 1.3359375, "learning_rate": 0.000488694598054715, "loss": 5.8698, "mean_token_accuracy": 0.18373733162879943, "num_tokens": 1106777.0, "step": 1305 }, { "entropy": 6.126851320266724, "epoch": 0.02927145362932508, "grad_norm": 1.34375, "learning_rate": 0.0004883229283289071, "loss": 5.9212, "mean_token_accuracy": 0.17913941144943238, "num_tokens": 1111184.0, "step": 1310 }, { "entropy": 6.192364168167114, "epoch": 0.02938317673478052, "grad_norm": 1.15625, "learning_rate": 0.00048794541024725993, "loss": 5.9298, "mean_token_accuracy": 0.17791166305541992, "num_tokens": 1115651.0, "step": 1315 }, { "entropy": 6.26938943862915, "epoch": 0.02949489984023596, "grad_norm": 1.1796875, "learning_rate": 0.0004875620541596221, "loss": 5.955, "mean_token_accuracy": 0.1659138545393944, "num_tokens": 1120012.0, "step": 1320 }, { "entropy": 6.076159715652466, "epoch": 0.0296066229456914, "grad_norm": 1.3046875, "learning_rate": 0.00048717287057589454, "loss": 5.8588, "mean_token_accuracy": 0.17886159271001817, "num_tokens": 1124549.0, "step": 1325 }, { "entropy": 6.182869958877563, "epoch": 0.029718346051146836, "grad_norm": 1.3515625, "learning_rate": 0.0004867778701657417, "loss": 5.9345, "mean_token_accuracy": 0.17838005125522613, "num_tokens": 1128968.0, "step": 1330 }, { "entropy": 6.133463668823242, "epoch": 0.029830069156602277, "grad_norm": 1.2890625, "learning_rate": 0.00048637706375829955, "loss": 5.9933, "mean_token_accuracy": 0.17328195571899413, "num_tokens": 1133396.0, "step": 1335 }, { "entropy": 6.253204965591431, "epoch": 0.029941792262057718, "grad_norm": 1.3828125, "learning_rate": 0.000485970462341878, "loss": 5.9025, "mean_token_accuracy": 0.170744127035141, "num_tokens": 1137577.0, "step": 1340 }, { "entropy": 6.061755275726318, "epoch": 0.030053515367513155, "grad_norm": 1.3515625, "learning_rate": 0.00048555807706366044, "loss": 5.7801, "mean_token_accuracy": 0.18417277485132216, "num_tokens": 1141551.0, "step": 1345 }, { "entropy": 6.116015100479126, "epoch": 0.030165238472968595, "grad_norm": 1.421875, "learning_rate": 0.00048513991922939756, "loss": 5.8398, "mean_token_accuracy": 0.17423712015151976, "num_tokens": 1145295.0, "step": 1350 }, { "entropy": 6.067533349990844, "epoch": 0.030276961578424032, "grad_norm": 1.2578125, "learning_rate": 0.00048471600030309744, "loss": 6.0567, "mean_token_accuracy": 0.16484877467155457, "num_tokens": 1149946.0, "step": 1355 }, { "entropy": 6.1512785911560055, "epoch": 0.030388684683879473, "grad_norm": 1.5390625, "learning_rate": 0.00048428633190671186, "loss": 5.9399, "mean_token_accuracy": 0.18146816939115523, "num_tokens": 1153955.0, "step": 1360 }, { "entropy": 6.143903684616089, "epoch": 0.030500407789334914, "grad_norm": 1.3515625, "learning_rate": 0.0004838509258198167, "loss": 5.849, "mean_token_accuracy": 0.18261384814977646, "num_tokens": 1158568.0, "step": 1365 }, { "entropy": 6.127876806259155, "epoch": 0.03061213089479035, "grad_norm": 1.4609375, "learning_rate": 0.00048340979397929, "loss": 5.7759, "mean_token_accuracy": 0.18599571883678437, "num_tokens": 1162217.0, "step": 1370 }, { "entropy": 6.076024913787842, "epoch": 0.03072385400024579, "grad_norm": 1.4375, "learning_rate": 0.00048296294847898386, "loss": 5.8861, "mean_token_accuracy": 0.17389037311077118, "num_tokens": 1165905.0, "step": 1375 }, { "entropy": 6.11526198387146, "epoch": 0.03083557710570123, "grad_norm": 1.4453125, "learning_rate": 0.0004825104015693934, "loss": 5.8432, "mean_token_accuracy": 0.17682357281446456, "num_tokens": 1170352.0, "step": 1380 }, { "entropy": 6.046456527709961, "epoch": 0.03094730021115667, "grad_norm": 1.2734375, "learning_rate": 0.0004820521656573208, "loss": 5.9274, "mean_token_accuracy": 0.17616797983646393, "num_tokens": 1174560.0, "step": 1385 }, { "entropy": 6.11228313446045, "epoch": 0.03105902331661211, "grad_norm": 1.34375, "learning_rate": 0.00048158825330553505, "loss": 5.8708, "mean_token_accuracy": 0.17557800114154815, "num_tokens": 1178544.0, "step": 1390 }, { "entropy": 5.975264167785644, "epoch": 0.031170746422067547, "grad_norm": 1.4453125, "learning_rate": 0.00048111867723242763, "loss": 5.6949, "mean_token_accuracy": 0.19889509081840515, "num_tokens": 1182541.0, "step": 1395 }, { "entropy": 5.97807993888855, "epoch": 0.031282469527522984, "grad_norm": 1.2890625, "learning_rate": 0.0004806434503116637, "loss": 5.7847, "mean_token_accuracy": 0.1825215622782707, "num_tokens": 1186684.0, "step": 1400 }, { "entropy": 6.036240196228027, "epoch": 0.03139419263297843, "grad_norm": 1.3203125, "learning_rate": 0.0004801625855718296, "loss": 5.7286, "mean_token_accuracy": 0.1909311071038246, "num_tokens": 1190785.0, "step": 1405 }, { "entropy": 5.977891159057617, "epoch": 0.031505915738433865, "grad_norm": 1.2265625, "learning_rate": 0.00047967609619607477, "loss": 5.7739, "mean_token_accuracy": 0.17418278902769088, "num_tokens": 1194940.0, "step": 1410 }, { "entropy": 5.920260810852051, "epoch": 0.0316176388438893, "grad_norm": 1.3359375, "learning_rate": 0.0004791839955217513, "loss": 5.7381, "mean_token_accuracy": 0.18921381384134292, "num_tokens": 1198765.0, "step": 1415 }, { "entropy": 6.071567487716675, "epoch": 0.031729361949344746, "grad_norm": 1.3046875, "learning_rate": 0.00047868629704004786, "loss": 5.9463, "mean_token_accuracy": 0.17053111791610717, "num_tokens": 1203266.0, "step": 1420 }, { "entropy": 6.066260862350464, "epoch": 0.03184108505480018, "grad_norm": 1.2109375, "learning_rate": 0.00047818301439561965, "loss": 5.7346, "mean_token_accuracy": 0.19455005526542662, "num_tokens": 1207414.0, "step": 1425 }, { "entropy": 5.978516721725464, "epoch": 0.03195280816025562, "grad_norm": 1.2734375, "learning_rate": 0.00047767416138621454, "loss": 5.7596, "mean_token_accuracy": 0.1821496695280075, "num_tokens": 1211325.0, "step": 1430 }, { "entropy": 6.088147068023682, "epoch": 0.032064531265711065, "grad_norm": 1.28125, "learning_rate": 0.000477159751962295, "loss": 5.7876, "mean_token_accuracy": 0.17757320106029512, "num_tokens": 1215866.0, "step": 1435 }, { "entropy": 6.105999946594238, "epoch": 0.0321762543711665, "grad_norm": 1.171875, "learning_rate": 0.00047663980022665507, "loss": 5.8637, "mean_token_accuracy": 0.16661322563886644, "num_tokens": 1220241.0, "step": 1440 }, { "entropy": 5.943767118453979, "epoch": 0.03228797747662194, "grad_norm": 1.3828125, "learning_rate": 0.00047611432043403437, "loss": 5.8393, "mean_token_accuracy": 0.17783186137676238, "num_tokens": 1224330.0, "step": 1445 }, { "entropy": 6.21411657333374, "epoch": 0.03239970058207738, "grad_norm": 1.2890625, "learning_rate": 0.0004755833269907267, "loss": 5.9352, "mean_token_accuracy": 0.16817386895418168, "num_tokens": 1228518.0, "step": 1450 }, { "entropy": 5.985192489624024, "epoch": 0.03251142368753282, "grad_norm": 1.2578125, "learning_rate": 0.0004750468344541857, "loss": 5.8087, "mean_token_accuracy": 0.1855456992983818, "num_tokens": 1232556.0, "step": 1455 }, { "entropy": 5.902926826477051, "epoch": 0.03262314679298826, "grad_norm": 1.5546875, "learning_rate": 0.00047450485753262525, "loss": 5.8417, "mean_token_accuracy": 0.17538347840309143, "num_tokens": 1236464.0, "step": 1460 }, { "entropy": 6.1002099990844725, "epoch": 0.032734869898443694, "grad_norm": 1.296875, "learning_rate": 0.00047395741108461633, "loss": 5.8552, "mean_token_accuracy": 0.1877426788210869, "num_tokens": 1240478.0, "step": 1465 }, { "entropy": 6.054091215133667, "epoch": 0.03284659300389914, "grad_norm": 1.359375, "learning_rate": 0.00047340451011867985, "loss": 5.8806, "mean_token_accuracy": 0.1829858422279358, "num_tokens": 1244149.0, "step": 1470 }, { "entropy": 6.208575963973999, "epoch": 0.032958316109354575, "grad_norm": 1.5390625, "learning_rate": 0.00047284616979287515, "loss": 5.9965, "mean_token_accuracy": 0.15834348127245904, "num_tokens": 1248617.0, "step": 1475 }, { "entropy": 6.053374433517456, "epoch": 0.03307003921481001, "grad_norm": 1.25, "learning_rate": 0.00047228240541438433, "loss": 5.8381, "mean_token_accuracy": 0.18422103077173232, "num_tokens": 1253044.0, "step": 1480 }, { "entropy": 6.099059247970581, "epoch": 0.03318176232026546, "grad_norm": 1.4296875, "learning_rate": 0.00047171323243909257, "loss": 5.8787, "mean_token_accuracy": 0.1814146339893341, "num_tokens": 1257651.0, "step": 1485 }, { "entropy": 6.0209493160247805, "epoch": 0.033293485425720894, "grad_norm": 1.3359375, "learning_rate": 0.00047113866647116457, "loss": 5.8113, "mean_token_accuracy": 0.19222917556762695, "num_tokens": 1261805.0, "step": 1490 }, { "entropy": 5.859741830825806, "epoch": 0.03340520853117633, "grad_norm": 1.3125, "learning_rate": 0.0004705587232626164, "loss": 5.6211, "mean_token_accuracy": 0.20293725579977034, "num_tokens": 1265625.0, "step": 1495 }, { "entropy": 5.956333827972412, "epoch": 0.033516931636631775, "grad_norm": 1.265625, "learning_rate": 0.00046997341871288424, "loss": 5.7941, "mean_token_accuracy": 0.18911935687065123, "num_tokens": 1269876.0, "step": 1500 } ], "logging_steps": 5, "max_steps": 4000, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 272346935132160.0, "train_batch_size": 16, "trial_name": null, "trial_params": null }