{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.08937848436435139, "eval_steps": 500, "global_step": 4000, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 10.74203462600708, "epoch": 0.00011172310545543924, "grad_norm": 7.40625, "learning_rate": 2e-06, "loss": 10.545, "mean_token_accuracy": 0.0, "num_tokens": 4264.0, "step": 5 }, { "entropy": 10.74201259613037, "epoch": 0.00022344621091087847, "grad_norm": 6.84375, "learning_rate": 4.5e-06, "loss": 10.5105, "mean_token_accuracy": 0.0002816901309415698, "num_tokens": 8413.0, "step": 10 }, { "entropy": 10.742000961303711, "epoch": 0.0003351693163663177, "grad_norm": 6.78125, "learning_rate": 7e-06, "loss": 10.4826, "mean_token_accuracy": 0.0, "num_tokens": 12394.0, "step": 15 }, { "entropy": 10.742033767700196, "epoch": 0.00044689242182175694, "grad_norm": 5.90625, "learning_rate": 9.5e-06, "loss": 10.4451, "mean_token_accuracy": 0.0004269361263141036, "num_tokens": 16610.0, "step": 20 }, { "entropy": 10.742008590698243, "epoch": 0.0005586155272771962, "grad_norm": 5.9375, "learning_rate": 1.2e-05, "loss": 10.3813, "mean_token_accuracy": 0.0017635513795539737, "num_tokens": 21243.0, "step": 25 }, { "entropy": 10.74174461364746, "epoch": 0.0006703386327326354, "grad_norm": 5.1875, "learning_rate": 1.4500000000000002e-05, "loss": 10.2219, "mean_token_accuracy": 0.019105370296165346, "num_tokens": 25571.0, "step": 30 }, { "entropy": 10.741024494171143, "epoch": 0.0007820617381880747, "grad_norm": 4.75, "learning_rate": 1.7000000000000003e-05, "loss": 10.0233, "mean_token_accuracy": 0.0476666621863842, "num_tokens": 29412.0, "step": 35 }, { "entropy": 10.739530563354492, "epoch": 0.0008937848436435139, "grad_norm": 3.75, "learning_rate": 1.95e-05, "loss": 9.943, "mean_token_accuracy": 0.04776074178516865, "num_tokens": 33893.0, "step": 40 }, { "entropy": 10.736891174316407, "epoch": 0.0010055079490989532, "grad_norm": 3.09375, "learning_rate": 2.2e-05, "loss": 9.7721, "mean_token_accuracy": 0.05200008656829595, "num_tokens": 38043.0, "step": 45 }, { "entropy": 10.733825874328613, "epoch": 0.0011172310545543925, "grad_norm": 2.75, "learning_rate": 2.4500000000000003e-05, "loss": 9.7095, "mean_token_accuracy": 0.05134744010865688, "num_tokens": 42222.0, "step": 50 }, { "entropy": 10.731979370117188, "epoch": 0.0012289541600098315, "grad_norm": 2.765625, "learning_rate": 2.7e-05, "loss": 9.6035, "mean_token_accuracy": 0.05346306636929512, "num_tokens": 46321.0, "step": 55 }, { "entropy": 10.729666996002198, "epoch": 0.0013406772654652708, "grad_norm": 2.515625, "learning_rate": 2.95e-05, "loss": 9.5985, "mean_token_accuracy": 0.053918526880443095, "num_tokens": 50816.0, "step": 60 }, { "entropy": 10.726247787475586, "epoch": 0.0014524003709207101, "grad_norm": 2.453125, "learning_rate": 3.2e-05, "loss": 9.5526, "mean_token_accuracy": 0.05777559094130993, "num_tokens": 55331.0, "step": 65 }, { "entropy": 10.722254943847656, "epoch": 0.0015641234763761494, "grad_norm": 2.296875, "learning_rate": 3.4500000000000005e-05, "loss": 9.4754, "mean_token_accuracy": 0.060246657207608224, "num_tokens": 59379.0, "step": 70 }, { "entropy": 10.717647266387939, "epoch": 0.0016758465818315885, "grad_norm": 2.375, "learning_rate": 3.7e-05, "loss": 9.3716, "mean_token_accuracy": 0.05563458241522312, "num_tokens": 63463.0, "step": 75 }, { "entropy": 10.709985065460206, "epoch": 0.0017875696872870278, "grad_norm": 2.234375, "learning_rate": 3.95e-05, "loss": 9.4054, "mean_token_accuracy": 0.04782464448362589, "num_tokens": 67897.0, "step": 80 }, { "entropy": 10.698591709136963, "epoch": 0.001899292792742467, "grad_norm": 2.703125, "learning_rate": 4.2000000000000004e-05, "loss": 9.2081, "mean_token_accuracy": 0.05416969805955887, "num_tokens": 71995.0, "step": 85 }, { "entropy": 10.679736518859864, "epoch": 0.0020110158981979064, "grad_norm": 2.453125, "learning_rate": 4.45e-05, "loss": 9.0655, "mean_token_accuracy": 0.06419909372925758, "num_tokens": 75745.0, "step": 90 }, { "entropy": 10.639767360687255, "epoch": 0.0021227390036533456, "grad_norm": 2.296875, "learning_rate": 4.7000000000000004e-05, "loss": 9.0156, "mean_token_accuracy": 0.06227423809468746, "num_tokens": 79641.0, "step": 95 }, { "entropy": 10.604651832580567, "epoch": 0.002234462109108785, "grad_norm": 2.328125, "learning_rate": 4.9500000000000004e-05, "loss": 8.9827, "mean_token_accuracy": 0.07007253468036652, "num_tokens": 84368.0, "step": 100 }, { "entropy": 10.576740074157716, "epoch": 0.0023461852145642242, "grad_norm": 3.0, "learning_rate": 5.2e-05, "loss": 8.9633, "mean_token_accuracy": 0.06716309636831283, "num_tokens": 89177.0, "step": 105 }, { "entropy": 10.532594108581543, "epoch": 0.002457908320019663, "grad_norm": 2.171875, "learning_rate": 5.45e-05, "loss": 8.7625, "mean_token_accuracy": 0.06927448399364948, "num_tokens": 93266.0, "step": 110 }, { "entropy": 10.469588470458984, "epoch": 0.0025696314254751024, "grad_norm": 1.9921875, "learning_rate": 5.7e-05, "loss": 8.6738, "mean_token_accuracy": 0.0684173908084631, "num_tokens": 97385.0, "step": 115 }, { "entropy": 10.414745044708251, "epoch": 0.0026813545309305417, "grad_norm": 2.203125, "learning_rate": 5.9499999999999996e-05, "loss": 8.4918, "mean_token_accuracy": 0.06782151162624359, "num_tokens": 100911.0, "step": 120 }, { "entropy": 10.343620300292969, "epoch": 0.002793077636385981, "grad_norm": 1.8359375, "learning_rate": 6.2e-05, "loss": 8.4104, "mean_token_accuracy": 0.07619427219033241, "num_tokens": 104785.0, "step": 125 }, { "entropy": 10.282330799102784, "epoch": 0.0029048007418414202, "grad_norm": 2.09375, "learning_rate": 6.450000000000001e-05, "loss": 8.3421, "mean_token_accuracy": 0.0715565849095583, "num_tokens": 109434.0, "step": 130 }, { "entropy": 10.177853965759278, "epoch": 0.0030165238472968595, "grad_norm": 1.7578125, "learning_rate": 6.7e-05, "loss": 8.3045, "mean_token_accuracy": 0.07821577228605747, "num_tokens": 113869.0, "step": 135 }, { "entropy": 10.01875, "epoch": 0.003128246952752299, "grad_norm": 1.640625, "learning_rate": 6.950000000000001e-05, "loss": 8.2069, "mean_token_accuracy": 0.07112646363675594, "num_tokens": 118332.0, "step": 140 }, { "entropy": 9.93814001083374, "epoch": 0.003239970058207738, "grad_norm": 1.65625, "learning_rate": 7.2e-05, "loss": 8.0893, "mean_token_accuracy": 0.06839369647204877, "num_tokens": 122140.0, "step": 145 }, { "entropy": 9.799712753295898, "epoch": 0.003351693163663177, "grad_norm": 1.6875, "learning_rate": 7.45e-05, "loss": 7.9249, "mean_token_accuracy": 0.067073168233037, "num_tokens": 126515.0, "step": 150 }, { "entropy": 9.603694915771484, "epoch": 0.0034634162691186163, "grad_norm": 1.5078125, "learning_rate": 7.7e-05, "loss": 7.897, "mean_token_accuracy": 0.07342451699078083, "num_tokens": 130397.0, "step": 155 }, { "entropy": 9.402643203735352, "epoch": 0.0035751393745740555, "grad_norm": 1.359375, "learning_rate": 7.950000000000001e-05, "loss": 7.815, "mean_token_accuracy": 0.07550931498408317, "num_tokens": 134428.0, "step": 160 }, { "entropy": 9.27815113067627, "epoch": 0.003686862480029495, "grad_norm": 1.5546875, "learning_rate": 8.2e-05, "loss": 7.6921, "mean_token_accuracy": 0.08235657699406147, "num_tokens": 138294.0, "step": 165 }, { "entropy": 9.126440715789794, "epoch": 0.003798585585484934, "grad_norm": 1.203125, "learning_rate": 8.450000000000001e-05, "loss": 7.6466, "mean_token_accuracy": 0.0780983179807663, "num_tokens": 142750.0, "step": 170 }, { "entropy": 8.904253101348877, "epoch": 0.003910308690940373, "grad_norm": 1.1328125, "learning_rate": 8.7e-05, "loss": 7.5833, "mean_token_accuracy": 0.06832590401172638, "num_tokens": 147220.0, "step": 175 }, { "entropy": 8.704329586029052, "epoch": 0.004022031796395813, "grad_norm": 1.0546875, "learning_rate": 8.95e-05, "loss": 7.464, "mean_token_accuracy": 0.08249393478035927, "num_tokens": 151396.0, "step": 180 }, { "entropy": 8.544238567352295, "epoch": 0.0041337549018512516, "grad_norm": 1.21875, "learning_rate": 9.2e-05, "loss": 7.4503, "mean_token_accuracy": 0.07549951747059822, "num_tokens": 155336.0, "step": 185 }, { "entropy": 8.501252269744873, "epoch": 0.004245478007306691, "grad_norm": 1.1953125, "learning_rate": 9.45e-05, "loss": 7.4842, "mean_token_accuracy": 0.07688803523778916, "num_tokens": 159752.0, "step": 190 }, { "entropy": 8.432751655578613, "epoch": 0.00435720111276213, "grad_norm": 1.1953125, "learning_rate": 9.7e-05, "loss": 7.5426, "mean_token_accuracy": 0.07533748783171176, "num_tokens": 163895.0, "step": 195 }, { "entropy": 8.257897663116456, "epoch": 0.00446892421821757, "grad_norm": 1.0234375, "learning_rate": 9.95e-05, "loss": 7.3421, "mean_token_accuracy": 0.08197390548884868, "num_tokens": 168312.0, "step": 200 }, { "entropy": 8.259009075164794, "epoch": 0.004580647323673009, "grad_norm": 1.546875, "learning_rate": 0.000102, "loss": 7.3701, "mean_token_accuracy": 0.08555959761142731, "num_tokens": 172358.0, "step": 205 }, { "entropy": 8.100054454803466, "epoch": 0.0046923704291284484, "grad_norm": 1.1171875, "learning_rate": 0.00010449999999999999, "loss": 7.357, "mean_token_accuracy": 0.08119111023843288, "num_tokens": 177085.0, "step": 210 }, { "entropy": 8.163977813720702, "epoch": 0.004804093534583887, "grad_norm": 1.15625, "learning_rate": 0.000107, "loss": 7.4691, "mean_token_accuracy": 0.07897469773888588, "num_tokens": 181410.0, "step": 215 }, { "entropy": 8.064214897155761, "epoch": 0.004915816640039326, "grad_norm": 1.125, "learning_rate": 0.0001095, "loss": 7.2085, "mean_token_accuracy": 0.08347514495253563, "num_tokens": 185649.0, "step": 220 }, { "entropy": 7.9723944664001465, "epoch": 0.005027539745494766, "grad_norm": 1.0625, "learning_rate": 0.000112, "loss": 7.2571, "mean_token_accuracy": 0.08833960294723511, "num_tokens": 190055.0, "step": 225 }, { "entropy": 7.958705711364746, "epoch": 0.005139262850950205, "grad_norm": 1.1796875, "learning_rate": 0.0001145, "loss": 7.2784, "mean_token_accuracy": 0.08142814487218857, "num_tokens": 194267.0, "step": 230 }, { "entropy": 7.980498743057251, "epoch": 0.0052509859564056445, "grad_norm": 1.2734375, "learning_rate": 0.00011700000000000001, "loss": 7.2042, "mean_token_accuracy": 0.08119908273220063, "num_tokens": 198483.0, "step": 235 }, { "entropy": 7.903439283370972, "epoch": 0.005362709061861083, "grad_norm": 1.3046875, "learning_rate": 0.00011949999999999999, "loss": 7.1137, "mean_token_accuracy": 0.09260561317205429, "num_tokens": 202514.0, "step": 240 }, { "entropy": 7.820244312286377, "epoch": 0.005474432167316523, "grad_norm": 1.3046875, "learning_rate": 0.000122, "loss": 7.2591, "mean_token_accuracy": 0.08432262316346169, "num_tokens": 206748.0, "step": 245 }, { "entropy": 7.817278146743774, "epoch": 0.005586155272771962, "grad_norm": 1.3515625, "learning_rate": 0.0001245, "loss": 7.1337, "mean_token_accuracy": 0.08795059770345688, "num_tokens": 210981.0, "step": 250 }, { "entropy": 7.902036476135254, "epoch": 0.005697878378227402, "grad_norm": 1.28125, "learning_rate": 0.000127, "loss": 7.2718, "mean_token_accuracy": 0.08792312145233154, "num_tokens": 215551.0, "step": 255 }, { "entropy": 7.720875978469849, "epoch": 0.0058096014836828405, "grad_norm": 1.21875, "learning_rate": 0.0001295, "loss": 7.0933, "mean_token_accuracy": 0.09327159300446511, "num_tokens": 219677.0, "step": 260 }, { "entropy": 7.8553773880004885, "epoch": 0.005921324589138279, "grad_norm": 1.4765625, "learning_rate": 0.000132, "loss": 7.1915, "mean_token_accuracy": 0.08988388553261757, "num_tokens": 223457.0, "step": 265 }, { "entropy": 7.8154174327850345, "epoch": 0.006033047694593719, "grad_norm": 1.375, "learning_rate": 0.00013450000000000002, "loss": 7.026, "mean_token_accuracy": 0.10610299035906792, "num_tokens": 227135.0, "step": 270 }, { "entropy": 7.805374622344971, "epoch": 0.006144770800049158, "grad_norm": 1.3203125, "learning_rate": 0.00013700000000000002, "loss": 7.2242, "mean_token_accuracy": 0.0845766805112362, "num_tokens": 231393.0, "step": 275 }, { "entropy": 7.793313646316529, "epoch": 0.006256493905504598, "grad_norm": 1.109375, "learning_rate": 0.0001395, "loss": 7.2039, "mean_token_accuracy": 0.09036076590418815, "num_tokens": 235959.0, "step": 280 }, { "entropy": 7.797818899154663, "epoch": 0.0063682170109600365, "grad_norm": 1.265625, "learning_rate": 0.00014199999999999998, "loss": 7.0391, "mean_token_accuracy": 0.10008666068315505, "num_tokens": 239875.0, "step": 285 }, { "entropy": 7.643310832977295, "epoch": 0.006479940116415476, "grad_norm": 1.203125, "learning_rate": 0.0001445, "loss": 7.1816, "mean_token_accuracy": 0.10088859647512435, "num_tokens": 244397.0, "step": 290 }, { "entropy": 7.749200963973999, "epoch": 0.006591663221870915, "grad_norm": 1.3515625, "learning_rate": 0.000147, "loss": 7.1022, "mean_token_accuracy": 0.09432346150279045, "num_tokens": 248441.0, "step": 295 }, { "entropy": 7.724449968338012, "epoch": 0.006703386327326354, "grad_norm": 1.6328125, "learning_rate": 0.0001495, "loss": 7.1223, "mean_token_accuracy": 0.09665866494178772, "num_tokens": 252693.0, "step": 300 }, { "entropy": 7.719059801101684, "epoch": 0.006815109432781794, "grad_norm": 1.375, "learning_rate": 0.000152, "loss": 7.0852, "mean_token_accuracy": 0.0973274439573288, "num_tokens": 257135.0, "step": 305 }, { "entropy": 7.689913558959961, "epoch": 0.0069268325382372325, "grad_norm": 1.3515625, "learning_rate": 0.00015450000000000001, "loss": 7.1788, "mean_token_accuracy": 0.09386017993092537, "num_tokens": 261919.0, "step": 310 }, { "entropy": 7.723158597946167, "epoch": 0.007038555643692672, "grad_norm": 1.3125, "learning_rate": 0.000157, "loss": 7.0899, "mean_token_accuracy": 0.10055064782500267, "num_tokens": 266656.0, "step": 315 }, { "entropy": 7.58135347366333, "epoch": 0.007150278749148111, "grad_norm": 1.28125, "learning_rate": 0.0001595, "loss": 7.0484, "mean_token_accuracy": 0.0989685259759426, "num_tokens": 270879.0, "step": 320 }, { "entropy": 7.633032703399659, "epoch": 0.007262001854603551, "grad_norm": 1.3046875, "learning_rate": 0.000162, "loss": 7.0017, "mean_token_accuracy": 0.11045164242386818, "num_tokens": 274884.0, "step": 325 }, { "entropy": 7.55345048904419, "epoch": 0.00737372496005899, "grad_norm": 1.328125, "learning_rate": 0.00016450000000000001, "loss": 6.9434, "mean_token_accuracy": 0.10104935392737388, "num_tokens": 279096.0, "step": 330 }, { "entropy": 7.626837635040284, "epoch": 0.007485448065514429, "grad_norm": 1.453125, "learning_rate": 0.00016700000000000002, "loss": 7.0338, "mean_token_accuracy": 0.10009614899754524, "num_tokens": 282923.0, "step": 335 }, { "entropy": 7.528380966186523, "epoch": 0.007597171170969868, "grad_norm": 1.3359375, "learning_rate": 0.00016950000000000003, "loss": 6.99, "mean_token_accuracy": 0.10532780215144158, "num_tokens": 287283.0, "step": 340 }, { "entropy": 7.572710466384888, "epoch": 0.007708894276425307, "grad_norm": 1.4375, "learning_rate": 0.00017199999999999998, "loss": 6.9504, "mean_token_accuracy": 0.10530123338103295, "num_tokens": 291409.0, "step": 345 }, { "entropy": 7.547561979293823, "epoch": 0.007820617381880746, "grad_norm": 1.40625, "learning_rate": 0.00017449999999999999, "loss": 6.9732, "mean_token_accuracy": 0.10650015398859977, "num_tokens": 295157.0, "step": 350 }, { "entropy": 7.669625616073608, "epoch": 0.007932340487336187, "grad_norm": 1.4453125, "learning_rate": 0.000177, "loss": 7.0005, "mean_token_accuracy": 0.10243007764220238, "num_tokens": 299370.0, "step": 355 }, { "entropy": 7.543743228912353, "epoch": 0.008044063592791625, "grad_norm": 1.390625, "learning_rate": 0.0001795, "loss": 7.0093, "mean_token_accuracy": 0.11244696080684662, "num_tokens": 303955.0, "step": 360 }, { "entropy": 7.570756626129151, "epoch": 0.008155786698247064, "grad_norm": 1.4921875, "learning_rate": 0.000182, "loss": 6.9899, "mean_token_accuracy": 0.10562622845172882, "num_tokens": 308047.0, "step": 365 }, { "entropy": 7.594445466995239, "epoch": 0.008267509803702503, "grad_norm": 1.609375, "learning_rate": 0.0001845, "loss": 6.9313, "mean_token_accuracy": 0.11213268861174583, "num_tokens": 312050.0, "step": 370 }, { "entropy": 7.5787379264831545, "epoch": 0.008379232909157944, "grad_norm": 1.3203125, "learning_rate": 0.000187, "loss": 6.9007, "mean_token_accuracy": 0.11451447457075119, "num_tokens": 315901.0, "step": 375 }, { "entropy": 7.617064571380615, "epoch": 0.008490956014613383, "grad_norm": 1.1484375, "learning_rate": 0.0001895, "loss": 6.9233, "mean_token_accuracy": 0.11718286573886871, "num_tokens": 320077.0, "step": 380 }, { "entropy": 7.479556846618652, "epoch": 0.008602679120068821, "grad_norm": 1.546875, "learning_rate": 0.000192, "loss": 6.8783, "mean_token_accuracy": 0.11937321722507477, "num_tokens": 324365.0, "step": 385 }, { "entropy": 7.485933542251587, "epoch": 0.00871440222552426, "grad_norm": 1.4921875, "learning_rate": 0.0001945, "loss": 6.8292, "mean_token_accuracy": 0.11517802253365517, "num_tokens": 327971.0, "step": 390 }, { "entropy": 7.489345073699951, "epoch": 0.0088261253309797, "grad_norm": 1.5390625, "learning_rate": 0.00019700000000000002, "loss": 6.8634, "mean_token_accuracy": 0.12188869342207909, "num_tokens": 331791.0, "step": 395 }, { "entropy": 7.405192232131958, "epoch": 0.00893784843643514, "grad_norm": 1.34375, "learning_rate": 0.00019950000000000002, "loss": 6.9151, "mean_token_accuracy": 0.11866991743445396, "num_tokens": 335616.0, "step": 400 }, { "entropy": 7.442100572586059, "epoch": 0.009049571541890579, "grad_norm": 1.3359375, "learning_rate": 0.000202, "loss": 6.8337, "mean_token_accuracy": 0.1216049998998642, "num_tokens": 339815.0, "step": 405 }, { "entropy": 7.466716241836548, "epoch": 0.009161294647346017, "grad_norm": 1.4140625, "learning_rate": 0.00020449999999999998, "loss": 6.8153, "mean_token_accuracy": 0.11885289028286934, "num_tokens": 344045.0, "step": 410 }, { "entropy": 7.439525604248047, "epoch": 0.009273017752801456, "grad_norm": 1.5859375, "learning_rate": 0.000207, "loss": 6.9127, "mean_token_accuracy": 0.1201499916613102, "num_tokens": 348726.0, "step": 415 }, { "entropy": 7.421639108657837, "epoch": 0.009384740858256897, "grad_norm": 1.375, "learning_rate": 0.0002095, "loss": 6.8973, "mean_token_accuracy": 0.11855003610253334, "num_tokens": 353228.0, "step": 420 }, { "entropy": 7.533071041107178, "epoch": 0.009496463963712336, "grad_norm": 1.3046875, "learning_rate": 0.000212, "loss": 6.8732, "mean_token_accuracy": 0.12777991741895675, "num_tokens": 357379.0, "step": 425 }, { "entropy": 7.404365539550781, "epoch": 0.009608187069167775, "grad_norm": 1.78125, "learning_rate": 0.0002145, "loss": 6.8237, "mean_token_accuracy": 0.11873817816376686, "num_tokens": 361347.0, "step": 430 }, { "entropy": 7.3829724311828615, "epoch": 0.009719910174623213, "grad_norm": 1.4453125, "learning_rate": 0.00021700000000000002, "loss": 6.8001, "mean_token_accuracy": 0.12097886875271797, "num_tokens": 365364.0, "step": 435 }, { "entropy": 7.4662988662719725, "epoch": 0.009831633280078652, "grad_norm": 1.5078125, "learning_rate": 0.0002195, "loss": 6.8435, "mean_token_accuracy": 0.1184915505349636, "num_tokens": 369648.0, "step": 440 }, { "entropy": 7.550151824951172, "epoch": 0.009943356385534093, "grad_norm": 1.34375, "learning_rate": 0.000222, "loss": 6.8211, "mean_token_accuracy": 0.1224476382136345, "num_tokens": 373734.0, "step": 445 }, { "entropy": 7.477874803543091, "epoch": 0.010055079490989532, "grad_norm": 1.6328125, "learning_rate": 0.0002245, "loss": 6.8174, "mean_token_accuracy": 0.12541017457842826, "num_tokens": 378184.0, "step": 450 }, { "entropy": 7.454969882965088, "epoch": 0.01016680259644497, "grad_norm": 1.3828125, "learning_rate": 0.00022700000000000002, "loss": 6.9275, "mean_token_accuracy": 0.11591533869504929, "num_tokens": 382686.0, "step": 455 }, { "entropy": 7.344128131866455, "epoch": 0.01027852570190041, "grad_norm": 1.6640625, "learning_rate": 0.00022950000000000002, "loss": 6.8348, "mean_token_accuracy": 0.12774229273200036, "num_tokens": 387210.0, "step": 460 }, { "entropy": 7.421209812164307, "epoch": 0.01039024880735585, "grad_norm": 1.484375, "learning_rate": 0.00023200000000000003, "loss": 6.8216, "mean_token_accuracy": 0.12031811997294425, "num_tokens": 391247.0, "step": 465 }, { "entropy": 7.465836143493652, "epoch": 0.010501971912811289, "grad_norm": 1.4921875, "learning_rate": 0.00023449999999999998, "loss": 6.6907, "mean_token_accuracy": 0.13249015137553216, "num_tokens": 395188.0, "step": 470 }, { "entropy": 7.280446100234985, "epoch": 0.010613695018266728, "grad_norm": 1.4375, "learning_rate": 0.000237, "loss": 6.7666, "mean_token_accuracy": 0.12789778113365174, "num_tokens": 399513.0, "step": 475 }, { "entropy": 7.51575026512146, "epoch": 0.010725418123722167, "grad_norm": 1.59375, "learning_rate": 0.0002395, "loss": 6.8438, "mean_token_accuracy": 0.12305677309632301, "num_tokens": 404052.0, "step": 480 }, { "entropy": 7.260741233825684, "epoch": 0.010837141229177606, "grad_norm": 1.40625, "learning_rate": 0.000242, "loss": 6.6724, "mean_token_accuracy": 0.13464880287647246, "num_tokens": 408299.0, "step": 485 }, { "entropy": 7.3084382057189945, "epoch": 0.010948864334633046, "grad_norm": 1.5859375, "learning_rate": 0.0002445, "loss": 6.6808, "mean_token_accuracy": 0.12868183255195617, "num_tokens": 412376.0, "step": 490 }, { "entropy": 7.318713665008545, "epoch": 0.011060587440088485, "grad_norm": 1.484375, "learning_rate": 0.000247, "loss": 6.7365, "mean_token_accuracy": 0.12830623611807823, "num_tokens": 417010.0, "step": 495 }, { "entropy": 7.343731689453125, "epoch": 0.011172310545543924, "grad_norm": 1.734375, "learning_rate": 0.0002495, "loss": 6.615, "mean_token_accuracy": 0.1360365241765976, "num_tokens": 421167.0, "step": 500 }, { "entropy": 7.227418041229248, "epoch": 0.011284033650999363, "grad_norm": 1.3984375, "learning_rate": 0.000252, "loss": 6.715, "mean_token_accuracy": 0.1310766190290451, "num_tokens": 425942.0, "step": 505 }, { "entropy": 7.354942321777344, "epoch": 0.011395756756454803, "grad_norm": 1.3203125, "learning_rate": 0.0002545, "loss": 6.7458, "mean_token_accuracy": 0.13017034903168678, "num_tokens": 430529.0, "step": 510 }, { "entropy": 7.211854124069214, "epoch": 0.011507479861910242, "grad_norm": 1.515625, "learning_rate": 0.000257, "loss": 6.6012, "mean_token_accuracy": 0.12464086860418319, "num_tokens": 434464.0, "step": 515 }, { "entropy": 7.229535865783691, "epoch": 0.011619202967365681, "grad_norm": 1.578125, "learning_rate": 0.0002595, "loss": 6.72, "mean_token_accuracy": 0.13534524589776992, "num_tokens": 438763.0, "step": 520 }, { "entropy": 7.300835609436035, "epoch": 0.01173092607282112, "grad_norm": 1.4296875, "learning_rate": 0.000262, "loss": 6.67, "mean_token_accuracy": 0.12867324203252792, "num_tokens": 442945.0, "step": 525 }, { "entropy": 7.314332723617554, "epoch": 0.011842649178276559, "grad_norm": 1.5859375, "learning_rate": 0.00026450000000000003, "loss": 6.7556, "mean_token_accuracy": 0.12306396216154099, "num_tokens": 447301.0, "step": 530 }, { "entropy": 7.266288375854492, "epoch": 0.011954372283732, "grad_norm": 1.5625, "learning_rate": 0.00026700000000000004, "loss": 6.6174, "mean_token_accuracy": 0.13486616015434266, "num_tokens": 451365.0, "step": 535 }, { "entropy": 7.152557897567749, "epoch": 0.012066095389187438, "grad_norm": 1.671875, "learning_rate": 0.00026950000000000005, "loss": 6.6467, "mean_token_accuracy": 0.13019582405686378, "num_tokens": 455469.0, "step": 540 }, { "entropy": 7.219053745269775, "epoch": 0.012177818494642877, "grad_norm": 1.40625, "learning_rate": 0.00027200000000000005, "loss": 6.7099, "mean_token_accuracy": 0.13144526258111, "num_tokens": 459641.0, "step": 545 }, { "entropy": 7.226452398300171, "epoch": 0.012289541600098316, "grad_norm": 1.5390625, "learning_rate": 0.0002745, "loss": 6.6922, "mean_token_accuracy": 0.13080282509326935, "num_tokens": 463866.0, "step": 550 }, { "entropy": 7.169753932952881, "epoch": 0.012401264705553756, "grad_norm": 1.578125, "learning_rate": 0.000277, "loss": 6.5534, "mean_token_accuracy": 0.14116353392601014, "num_tokens": 467692.0, "step": 555 }, { "entropy": 7.142725467681885, "epoch": 0.012512987811009195, "grad_norm": 1.625, "learning_rate": 0.0002795, "loss": 6.706, "mean_token_accuracy": 0.13806632682681083, "num_tokens": 471719.0, "step": 560 }, { "entropy": 7.179370450973511, "epoch": 0.012624710916464634, "grad_norm": 1.4765625, "learning_rate": 0.00028199999999999997, "loss": 6.6323, "mean_token_accuracy": 0.12942282631993293, "num_tokens": 475978.0, "step": 565 }, { "entropy": 7.241915130615235, "epoch": 0.012736434021920073, "grad_norm": 1.390625, "learning_rate": 0.0002845, "loss": 6.7049, "mean_token_accuracy": 0.13150753006339072, "num_tokens": 480538.0, "step": 570 }, { "entropy": 7.216012620925904, "epoch": 0.012848157127375512, "grad_norm": 1.53125, "learning_rate": 0.000287, "loss": 6.6041, "mean_token_accuracy": 0.13532499819993973, "num_tokens": 484604.0, "step": 575 }, { "entropy": 7.280426120758056, "epoch": 0.012959880232830952, "grad_norm": 1.3359375, "learning_rate": 0.0002895, "loss": 6.6293, "mean_token_accuracy": 0.13353263586759567, "num_tokens": 489117.0, "step": 580 }, { "entropy": 7.161381196975708, "epoch": 0.013071603338286391, "grad_norm": 1.640625, "learning_rate": 0.000292, "loss": 6.5337, "mean_token_accuracy": 0.14060464650392532, "num_tokens": 493020.0, "step": 585 }, { "entropy": 7.130830383300781, "epoch": 0.01318332644374183, "grad_norm": 1.6171875, "learning_rate": 0.0002945, "loss": 6.688, "mean_token_accuracy": 0.1310403361916542, "num_tokens": 497224.0, "step": 590 }, { "entropy": 7.2293980598449705, "epoch": 0.013295049549197269, "grad_norm": 1.578125, "learning_rate": 0.000297, "loss": 6.6199, "mean_token_accuracy": 0.13552179485559462, "num_tokens": 501323.0, "step": 595 }, { "entropy": 7.092097234725952, "epoch": 0.013406772654652708, "grad_norm": 1.59375, "learning_rate": 0.0002995, "loss": 6.6871, "mean_token_accuracy": 0.1318632557988167, "num_tokens": 505544.0, "step": 600 }, { "entropy": 7.2185986042022705, "epoch": 0.013518495760108148, "grad_norm": 1.4296875, "learning_rate": 0.000302, "loss": 6.624, "mean_token_accuracy": 0.14037465676665306, "num_tokens": 509980.0, "step": 605 }, { "entropy": 7.0673870086669925, "epoch": 0.013630218865563587, "grad_norm": 1.84375, "learning_rate": 0.0003045, "loss": 6.4906, "mean_token_accuracy": 0.1455707758665085, "num_tokens": 514264.0, "step": 610 }, { "entropy": 7.061304330825806, "epoch": 0.013741941971019026, "grad_norm": 1.6875, "learning_rate": 0.000307, "loss": 6.573, "mean_token_accuracy": 0.14321403577923775, "num_tokens": 518482.0, "step": 615 }, { "entropy": 7.22766146659851, "epoch": 0.013853665076474465, "grad_norm": 1.515625, "learning_rate": 0.0003095, "loss": 6.6066, "mean_token_accuracy": 0.1336400181055069, "num_tokens": 522765.0, "step": 620 }, { "entropy": 7.029418087005615, "epoch": 0.013965388181929906, "grad_norm": 1.3515625, "learning_rate": 0.000312, "loss": 6.4457, "mean_token_accuracy": 0.14515347853302957, "num_tokens": 526794.0, "step": 625 }, { "entropy": 7.065269136428833, "epoch": 0.014077111287385344, "grad_norm": 1.53125, "learning_rate": 0.0003145, "loss": 6.5766, "mean_token_accuracy": 0.14270118325948716, "num_tokens": 531070.0, "step": 630 }, { "entropy": 7.208616876602173, "epoch": 0.014188834392840783, "grad_norm": 1.390625, "learning_rate": 0.000317, "loss": 6.6389, "mean_token_accuracy": 0.13457323089241982, "num_tokens": 535655.0, "step": 635 }, { "entropy": 7.065006256103516, "epoch": 0.014300557498296222, "grad_norm": 1.375, "learning_rate": 0.0003195, "loss": 6.666, "mean_token_accuracy": 0.13108374997973443, "num_tokens": 540231.0, "step": 640 }, { "entropy": 7.094880771636963, "epoch": 0.014412280603751661, "grad_norm": 1.4921875, "learning_rate": 0.000322, "loss": 6.5078, "mean_token_accuracy": 0.14435381516814233, "num_tokens": 544180.0, "step": 645 }, { "entropy": 7.076756286621094, "epoch": 0.014524003709207102, "grad_norm": 1.640625, "learning_rate": 0.00032450000000000003, "loss": 6.4786, "mean_token_accuracy": 0.13342859596014023, "num_tokens": 547905.0, "step": 650 }, { "entropy": 6.96412615776062, "epoch": 0.01463572681466254, "grad_norm": 1.53125, "learning_rate": 0.00032700000000000003, "loss": 6.5565, "mean_token_accuracy": 0.14217662066221237, "num_tokens": 552248.0, "step": 655 }, { "entropy": 7.046826982498169, "epoch": 0.01474744992011798, "grad_norm": 1.6875, "learning_rate": 0.00032950000000000004, "loss": 6.3918, "mean_token_accuracy": 0.14909711182117463, "num_tokens": 556430.0, "step": 660 }, { "entropy": 7.026239967346191, "epoch": 0.014859173025573418, "grad_norm": 1.6875, "learning_rate": 0.00033200000000000005, "loss": 6.4678, "mean_token_accuracy": 0.15065777227282523, "num_tokens": 560114.0, "step": 665 }, { "entropy": 6.857525396347046, "epoch": 0.014970896131028859, "grad_norm": 1.3515625, "learning_rate": 0.00033450000000000005, "loss": 6.4711, "mean_token_accuracy": 0.14087381735444068, "num_tokens": 564624.0, "step": 670 }, { "entropy": 7.029787588119507, "epoch": 0.015082619236484298, "grad_norm": 1.6015625, "learning_rate": 0.000337, "loss": 6.4073, "mean_token_accuracy": 0.14824407249689103, "num_tokens": 568918.0, "step": 675 }, { "entropy": 7.077581787109375, "epoch": 0.015194342341939737, "grad_norm": 1.59375, "learning_rate": 0.0003395, "loss": 6.4725, "mean_token_accuracy": 0.15365976840257645, "num_tokens": 572972.0, "step": 680 }, { "entropy": 6.980326414108276, "epoch": 0.015306065447395175, "grad_norm": 1.5, "learning_rate": 0.000342, "loss": 6.4873, "mean_token_accuracy": 0.15378629714250563, "num_tokens": 577250.0, "step": 685 }, { "entropy": 7.116094398498535, "epoch": 0.015417788552850614, "grad_norm": 1.4296875, "learning_rate": 0.00034449999999999997, "loss": 6.4245, "mean_token_accuracy": 0.1488552987575531, "num_tokens": 581418.0, "step": 690 }, { "entropy": 6.932662296295166, "epoch": 0.015529511658306055, "grad_norm": 1.6015625, "learning_rate": 0.000347, "loss": 6.5042, "mean_token_accuracy": 0.15049396306276322, "num_tokens": 585675.0, "step": 695 }, { "entropy": 6.966062307357788, "epoch": 0.015641234763761492, "grad_norm": 1.46875, "learning_rate": 0.0003495, "loss": 6.392, "mean_token_accuracy": 0.1462944969534874, "num_tokens": 590032.0, "step": 700 }, { "entropy": 6.915396404266358, "epoch": 0.015752957869216933, "grad_norm": 1.5390625, "learning_rate": 0.000352, "loss": 6.3949, "mean_token_accuracy": 0.1510719522833824, "num_tokens": 594185.0, "step": 705 }, { "entropy": 6.896506881713867, "epoch": 0.015864680974672373, "grad_norm": 1.5546875, "learning_rate": 0.0003545, "loss": 6.3488, "mean_token_accuracy": 0.15710561126470565, "num_tokens": 598246.0, "step": 710 }, { "entropy": 6.905340528488159, "epoch": 0.01597640408012781, "grad_norm": 1.515625, "learning_rate": 0.000357, "loss": 6.4826, "mean_token_accuracy": 0.14725056737661363, "num_tokens": 602676.0, "step": 715 }, { "entropy": 6.877582645416259, "epoch": 0.01608812718558325, "grad_norm": 1.5546875, "learning_rate": 0.0003595, "loss": 6.3352, "mean_token_accuracy": 0.16034641861915588, "num_tokens": 606693.0, "step": 720 }, { "entropy": 6.880430507659912, "epoch": 0.01619985029103869, "grad_norm": 1.6484375, "learning_rate": 0.000362, "loss": 6.3591, "mean_token_accuracy": 0.14268538355827332, "num_tokens": 610780.0, "step": 725 }, { "entropy": 6.902221918106079, "epoch": 0.01631157339649413, "grad_norm": 1.421875, "learning_rate": 0.0003645, "loss": 6.4226, "mean_token_accuracy": 0.1481914848089218, "num_tokens": 614746.0, "step": 730 }, { "entropy": 6.847220468521118, "epoch": 0.01642329650194957, "grad_norm": 1.375, "learning_rate": 0.000367, "loss": 6.3719, "mean_token_accuracy": 0.15163339525461197, "num_tokens": 619222.0, "step": 735 }, { "entropy": 6.968106889724732, "epoch": 0.016535019607405006, "grad_norm": 1.34375, "learning_rate": 0.0003695, "loss": 6.5165, "mean_token_accuracy": 0.14626363143324853, "num_tokens": 623746.0, "step": 740 }, { "entropy": 6.9071704864501955, "epoch": 0.016646742712860447, "grad_norm": 1.28125, "learning_rate": 0.000372, "loss": 6.366, "mean_token_accuracy": 0.15544869527220725, "num_tokens": 628392.0, "step": 745 }, { "entropy": 6.845142030715943, "epoch": 0.016758465818315887, "grad_norm": 1.5234375, "learning_rate": 0.0003745, "loss": 6.3775, "mean_token_accuracy": 0.14660717099905013, "num_tokens": 632439.0, "step": 750 }, { "entropy": 6.813414907455444, "epoch": 0.016870188923771325, "grad_norm": 1.3515625, "learning_rate": 0.000377, "loss": 6.4088, "mean_token_accuracy": 0.1431469090282917, "num_tokens": 636801.0, "step": 755 }, { "entropy": 6.88551287651062, "epoch": 0.016981912029226765, "grad_norm": 1.5234375, "learning_rate": 0.0003795, "loss": 6.2173, "mean_token_accuracy": 0.16097238063812255, "num_tokens": 640818.0, "step": 760 }, { "entropy": 6.7791321754455565, "epoch": 0.017093635134682202, "grad_norm": 1.6171875, "learning_rate": 0.000382, "loss": 6.3784, "mean_token_accuracy": 0.14307227358222008, "num_tokens": 644914.0, "step": 765 }, { "entropy": 6.967279005050659, "epoch": 0.017205358240137643, "grad_norm": 1.5625, "learning_rate": 0.0003845, "loss": 6.4658, "mean_token_accuracy": 0.14935086220502852, "num_tokens": 649368.0, "step": 770 }, { "entropy": 6.788582992553711, "epoch": 0.017317081345593083, "grad_norm": 1.5390625, "learning_rate": 0.00038700000000000003, "loss": 6.2984, "mean_token_accuracy": 0.15846630781888962, "num_tokens": 653537.0, "step": 775 }, { "entropy": 6.87021164894104, "epoch": 0.01742880445104852, "grad_norm": 1.5625, "learning_rate": 0.00038950000000000003, "loss": 6.4177, "mean_token_accuracy": 0.13871796652674676, "num_tokens": 658232.0, "step": 780 }, { "entropy": 6.85303897857666, "epoch": 0.01754052755650396, "grad_norm": 1.453125, "learning_rate": 0.00039200000000000004, "loss": 6.3841, "mean_token_accuracy": 0.14893919229507446, "num_tokens": 662512.0, "step": 785 }, { "entropy": 6.839845895767212, "epoch": 0.0176522506619594, "grad_norm": 1.4765625, "learning_rate": 0.00039450000000000005, "loss": 6.372, "mean_token_accuracy": 0.15011741518974303, "num_tokens": 666759.0, "step": 790 }, { "entropy": 6.646692132949829, "epoch": 0.01776397376741484, "grad_norm": 1.46875, "learning_rate": 0.00039700000000000005, "loss": 6.2896, "mean_token_accuracy": 0.1571863681077957, "num_tokens": 670870.0, "step": 795 }, { "entropy": 6.806870698928833, "epoch": 0.01787569687287028, "grad_norm": 1.515625, "learning_rate": 0.0003995, "loss": 6.2513, "mean_token_accuracy": 0.158031065762043, "num_tokens": 675150.0, "step": 800 }, { "entropy": 6.714898729324341, "epoch": 0.017987419978325717, "grad_norm": 1.6875, "learning_rate": 0.000402, "loss": 6.1745, "mean_token_accuracy": 0.1610417976975441, "num_tokens": 679083.0, "step": 805 }, { "entropy": 6.70656795501709, "epoch": 0.018099143083781157, "grad_norm": 1.65625, "learning_rate": 0.0004045, "loss": 6.371, "mean_token_accuracy": 0.15746122524142264, "num_tokens": 683477.0, "step": 810 }, { "entropy": 6.743958902359009, "epoch": 0.018210866189236594, "grad_norm": 1.453125, "learning_rate": 0.00040699999999999997, "loss": 6.1656, "mean_token_accuracy": 0.16271859258413315, "num_tokens": 687819.0, "step": 815 }, { "entropy": 6.8285057067871096, "epoch": 0.018322589294692035, "grad_norm": 1.3671875, "learning_rate": 0.0004095, "loss": 6.3924, "mean_token_accuracy": 0.15080199763178825, "num_tokens": 692017.0, "step": 820 }, { "entropy": 6.8905205726623535, "epoch": 0.018434312400147475, "grad_norm": 1.34375, "learning_rate": 0.000412, "loss": 6.3853, "mean_token_accuracy": 0.14643741324543952, "num_tokens": 696853.0, "step": 825 }, { "entropy": 6.839770412445068, "epoch": 0.018546035505602913, "grad_norm": 1.3671875, "learning_rate": 0.0004145, "loss": 6.4221, "mean_token_accuracy": 0.1416957326233387, "num_tokens": 701131.0, "step": 830 }, { "entropy": 6.750663423538208, "epoch": 0.018657758611058353, "grad_norm": 1.5546875, "learning_rate": 0.000417, "loss": 6.3757, "mean_token_accuracy": 0.1462937667965889, "num_tokens": 705428.0, "step": 835 }, { "entropy": 6.672054672241211, "epoch": 0.018769481716513794, "grad_norm": 1.3984375, "learning_rate": 0.0004195, "loss": 6.2377, "mean_token_accuracy": 0.16088497787714004, "num_tokens": 709760.0, "step": 840 }, { "entropy": 6.700072860717773, "epoch": 0.01888120482196923, "grad_norm": 1.375, "learning_rate": 0.000422, "loss": 6.2073, "mean_token_accuracy": 0.1617395505309105, "num_tokens": 713964.0, "step": 845 }, { "entropy": 6.665010023117065, "epoch": 0.01899292792742467, "grad_norm": 1.5078125, "learning_rate": 0.0004245, "loss": 6.3575, "mean_token_accuracy": 0.15287077873945237, "num_tokens": 718305.0, "step": 850 }, { "entropy": 6.806714677810669, "epoch": 0.01910465103288011, "grad_norm": 1.5390625, "learning_rate": 0.000427, "loss": 6.2661, "mean_token_accuracy": 0.15892615169286728, "num_tokens": 722705.0, "step": 855 }, { "entropy": 6.528658866882324, "epoch": 0.01921637413833555, "grad_norm": 1.5703125, "learning_rate": 0.0004295, "loss": 6.1765, "mean_token_accuracy": 0.16424758732318878, "num_tokens": 726529.0, "step": 860 }, { "entropy": 6.659326124191284, "epoch": 0.01932809724379099, "grad_norm": 1.4375, "learning_rate": 0.000432, "loss": 6.2522, "mean_token_accuracy": 0.15339272618293762, "num_tokens": 730535.0, "step": 865 }, { "entropy": 6.74210753440857, "epoch": 0.019439820349246427, "grad_norm": 1.3984375, "learning_rate": 0.0004345, "loss": 6.2117, "mean_token_accuracy": 0.15879523605108262, "num_tokens": 734836.0, "step": 870 }, { "entropy": 6.65736346244812, "epoch": 0.019551543454701868, "grad_norm": 1.453125, "learning_rate": 0.000437, "loss": 6.2891, "mean_token_accuracy": 0.15371360629796982, "num_tokens": 739176.0, "step": 875 }, { "entropy": 6.574539995193481, "epoch": 0.019663266560157305, "grad_norm": 1.390625, "learning_rate": 0.0004395, "loss": 6.2674, "mean_token_accuracy": 0.15556667894124984, "num_tokens": 743497.0, "step": 880 }, { "entropy": 6.720397853851319, "epoch": 0.019774989665612745, "grad_norm": 1.5234375, "learning_rate": 0.000442, "loss": 6.2818, "mean_token_accuracy": 0.16183461248874664, "num_tokens": 747185.0, "step": 885 }, { "entropy": 6.739978790283203, "epoch": 0.019886712771068186, "grad_norm": 1.375, "learning_rate": 0.0004445, "loss": 6.4179, "mean_token_accuracy": 0.1448575735092163, "num_tokens": 751345.0, "step": 890 }, { "entropy": 6.7309082508087155, "epoch": 0.019998435876523623, "grad_norm": 1.4765625, "learning_rate": 0.000447, "loss": 6.2944, "mean_token_accuracy": 0.15704837888479234, "num_tokens": 755618.0, "step": 895 }, { "entropy": 6.653637266159057, "epoch": 0.020110158981979064, "grad_norm": 1.46875, "learning_rate": 0.00044950000000000003, "loss": 6.2788, "mean_token_accuracy": 0.15478281527757645, "num_tokens": 759583.0, "step": 900 }, { "entropy": 6.644137716293335, "epoch": 0.0202218820874345, "grad_norm": 1.453125, "learning_rate": 0.00045200000000000004, "loss": 6.1758, "mean_token_accuracy": 0.1591601625084877, "num_tokens": 763861.0, "step": 905 }, { "entropy": 6.53189525604248, "epoch": 0.02033360519288994, "grad_norm": 1.3984375, "learning_rate": 0.00045450000000000004, "loss": 6.1717, "mean_token_accuracy": 0.16117519289255142, "num_tokens": 768046.0, "step": 910 }, { "entropy": 6.686648035049439, "epoch": 0.020445328298345382, "grad_norm": 1.4921875, "learning_rate": 0.00045700000000000005, "loss": 6.1927, "mean_token_accuracy": 0.15583422034978867, "num_tokens": 772570.0, "step": 915 }, { "entropy": 6.651849317550659, "epoch": 0.02055705140380082, "grad_norm": 1.3359375, "learning_rate": 0.00045950000000000006, "loss": 6.3181, "mean_token_accuracy": 0.15458481013774872, "num_tokens": 777324.0, "step": 920 }, { "entropy": 6.669686937332154, "epoch": 0.02066877450925626, "grad_norm": 1.328125, "learning_rate": 0.000462, "loss": 6.3017, "mean_token_accuracy": 0.14780564680695535, "num_tokens": 781829.0, "step": 925 }, { "entropy": 6.655124092102051, "epoch": 0.0207804976147117, "grad_norm": 1.3359375, "learning_rate": 0.0004645, "loss": 6.1719, "mean_token_accuracy": 0.15766340345144272, "num_tokens": 786089.0, "step": 930 }, { "entropy": 6.433820819854736, "epoch": 0.020892220720167137, "grad_norm": 1.3203125, "learning_rate": 0.000467, "loss": 6.1607, "mean_token_accuracy": 0.16852562725543976, "num_tokens": 790273.0, "step": 935 }, { "entropy": 6.675999402999878, "epoch": 0.021003943825622578, "grad_norm": 1.3515625, "learning_rate": 0.0004695, "loss": 6.1583, "mean_token_accuracy": 0.17233449518680571, "num_tokens": 794600.0, "step": 940 }, { "entropy": 6.556878328323364, "epoch": 0.021115666931078015, "grad_norm": 1.5078125, "learning_rate": 0.000472, "loss": 6.149, "mean_token_accuracy": 0.16213736683130264, "num_tokens": 798756.0, "step": 945 }, { "entropy": 6.6472193717956545, "epoch": 0.021227390036533456, "grad_norm": 1.3828125, "learning_rate": 0.0004745, "loss": 6.1599, "mean_token_accuracy": 0.16358468383550645, "num_tokens": 803122.0, "step": 950 }, { "entropy": 6.386259412765503, "epoch": 0.021339113141988896, "grad_norm": 1.5390625, "learning_rate": 0.000477, "loss": 6.1891, "mean_token_accuracy": 0.15860249921679498, "num_tokens": 807393.0, "step": 955 }, { "entropy": 6.601777124404907, "epoch": 0.021450836247444333, "grad_norm": 1.46875, "learning_rate": 0.0004795, "loss": 6.1289, "mean_token_accuracy": 0.16311845034360886, "num_tokens": 811735.0, "step": 960 }, { "entropy": 6.646067714691162, "epoch": 0.021562559352899774, "grad_norm": 1.3671875, "learning_rate": 0.000482, "loss": 6.3186, "mean_token_accuracy": 0.15336783230304718, "num_tokens": 816327.0, "step": 965 }, { "entropy": 6.546494245529175, "epoch": 0.02167428245835521, "grad_norm": 1.578125, "learning_rate": 0.0004845, "loss": 6.1048, "mean_token_accuracy": 0.1641931340098381, "num_tokens": 820476.0, "step": 970 }, { "entropy": 6.502486848831177, "epoch": 0.02178600556381065, "grad_norm": 1.3984375, "learning_rate": 0.000487, "loss": 6.1289, "mean_token_accuracy": 0.16595971435308457, "num_tokens": 824563.0, "step": 975 }, { "entropy": 6.51844539642334, "epoch": 0.021897728669266092, "grad_norm": 1.375, "learning_rate": 0.0004895, "loss": 6.2249, "mean_token_accuracy": 0.15903169065713882, "num_tokens": 829307.0, "step": 980 }, { "entropy": 6.48329792022705, "epoch": 0.02200945177472153, "grad_norm": 1.359375, "learning_rate": 0.000492, "loss": 6.2234, "mean_token_accuracy": 0.16081805527210236, "num_tokens": 833876.0, "step": 985 }, { "entropy": 6.577699089050293, "epoch": 0.02212117488017697, "grad_norm": 1.421875, "learning_rate": 0.0004945, "loss": 6.3108, "mean_token_accuracy": 0.15140475034713746, "num_tokens": 838484.0, "step": 990 }, { "entropy": 6.628869199752808, "epoch": 0.022232897985632407, "grad_norm": 1.453125, "learning_rate": 0.000497, "loss": 6.1561, "mean_token_accuracy": 0.1592697098851204, "num_tokens": 842813.0, "step": 995 }, { "entropy": 6.393803596496582, "epoch": 0.022344621091087848, "grad_norm": 1.515625, "learning_rate": 0.0004995, "loss": 6.0899, "mean_token_accuracy": 0.16069612354040147, "num_tokens": 846638.0, "step": 1000 }, { "entropy": 6.4989090919494625, "epoch": 0.022456344196543288, "grad_norm": 1.578125, "learning_rate": 0.000499998026082006, "loss": 6.0626, "mean_token_accuracy": 0.17749472558498383, "num_tokens": 850577.0, "step": 1005 }, { "entropy": 6.439338541030883, "epoch": 0.022568067301998725, "grad_norm": 1.34375, "learning_rate": 0.0004999900070995136, "loss": 6.0906, "mean_token_accuracy": 0.16202376335859298, "num_tokens": 854904.0, "step": 1010 }, { "entropy": 6.5132981300354, "epoch": 0.022679790407454166, "grad_norm": 1.421875, "learning_rate": 0.0004999758199023239, "loss": 6.1076, "mean_token_accuracy": 0.17384408712387084, "num_tokens": 858859.0, "step": 1015 }, { "entropy": 6.43322901725769, "epoch": 0.022791513512909607, "grad_norm": 1.5, "learning_rate": 0.0004999554648793858, "loss": 6.055, "mean_token_accuracy": 0.16654047518968582, "num_tokens": 863121.0, "step": 1020 }, { "entropy": 6.506139421463013, "epoch": 0.022903236618365044, "grad_norm": 1.4765625, "learning_rate": 0.0004999289425887425, "loss": 6.1709, "mean_token_accuracy": 0.15935743749141693, "num_tokens": 867805.0, "step": 1025 }, { "entropy": 6.488983964920044, "epoch": 0.023014959723820484, "grad_norm": 1.2578125, "learning_rate": 0.0004998962537575161, "loss": 6.1244, "mean_token_accuracy": 0.1593026451766491, "num_tokens": 871988.0, "step": 1030 }, { "entropy": 6.497362184524536, "epoch": 0.02312668282927592, "grad_norm": 1.4296875, "learning_rate": 0.0004998573992818874, "loss": 6.0959, "mean_token_accuracy": 0.16356074959039688, "num_tokens": 876181.0, "step": 1035 }, { "entropy": 6.301354026794433, "epoch": 0.023238405934731362, "grad_norm": 1.7265625, "learning_rate": 0.0004998123802270715, "loss": 5.9669, "mean_token_accuracy": 0.18099125623703002, "num_tokens": 880521.0, "step": 1040 }, { "entropy": 6.322625303268433, "epoch": 0.023350129040186803, "grad_norm": 1.3046875, "learning_rate": 0.0004997611978272886, "loss": 6.1019, "mean_token_accuracy": 0.16592444032430648, "num_tokens": 885006.0, "step": 1045 }, { "entropy": 6.541764831542968, "epoch": 0.02346185214564224, "grad_norm": 1.34375, "learning_rate": 0.0004997038534857298, "loss": 6.1038, "mean_token_accuracy": 0.15975722372531892, "num_tokens": 889184.0, "step": 1050 }, { "entropy": 6.410001420974732, "epoch": 0.02357357525109768, "grad_norm": 1.46875, "learning_rate": 0.0004996403487745194, "loss": 6.0039, "mean_token_accuracy": 0.17406690418720244, "num_tokens": 893806.0, "step": 1055 }, { "entropy": 6.391436147689819, "epoch": 0.023685298356553117, "grad_norm": 1.3828125, "learning_rate": 0.000499570685434671, "loss": 6.0131, "mean_token_accuracy": 0.17006947249174117, "num_tokens": 897578.0, "step": 1060 }, { "entropy": 6.47973518371582, "epoch": 0.023797021462008558, "grad_norm": 1.3515625, "learning_rate": 0.0004994948653760405, "loss": 6.2734, "mean_token_accuracy": 0.15798939615488053, "num_tokens": 902225.0, "step": 1065 }, { "entropy": 6.551846933364868, "epoch": 0.023908744567464, "grad_norm": 1.2890625, "learning_rate": 0.0004994128906772729, "loss": 6.1246, "mean_token_accuracy": 0.1635009005665779, "num_tokens": 906477.0, "step": 1070 }, { "entropy": 6.386241388320923, "epoch": 0.024020467672919436, "grad_norm": 1.2578125, "learning_rate": 0.000499324763585746, "loss": 6.1123, "mean_token_accuracy": 0.15879142582416533, "num_tokens": 910948.0, "step": 1075 }, { "entropy": 6.503281879425049, "epoch": 0.024132190778374876, "grad_norm": 1.421875, "learning_rate": 0.0004992304865175085, "loss": 6.2186, "mean_token_accuracy": 0.14976079761981964, "num_tokens": 915157.0, "step": 1080 }, { "entropy": 6.450709199905395, "epoch": 0.024243913883830313, "grad_norm": 1.3125, "learning_rate": 0.0004991300620572138, "loss": 6.0396, "mean_token_accuracy": 0.16553105041384697, "num_tokens": 920251.0, "step": 1085 }, { "entropy": 6.222010898590088, "epoch": 0.024355636989285754, "grad_norm": 1.3515625, "learning_rate": 0.0004990234929580494, "loss": 6.1224, "mean_token_accuracy": 0.16098514199256897, "num_tokens": 924510.0, "step": 1090 }, { "entropy": 6.347459030151367, "epoch": 0.024467360094741195, "grad_norm": 1.359375, "learning_rate": 0.0004989107821416609, "loss": 6.0245, "mean_token_accuracy": 0.1654239609837532, "num_tokens": 928925.0, "step": 1095 }, { "entropy": 6.316383314132691, "epoch": 0.02457908320019663, "grad_norm": 1.2734375, "learning_rate": 0.0004987919326980723, "loss": 6.0384, "mean_token_accuracy": 0.17247851192951202, "num_tokens": 933211.0, "step": 1100 }, { "entropy": 6.317654371261597, "epoch": 0.024690806305652072, "grad_norm": 1.40625, "learning_rate": 0.0004986669478856011, "loss": 6.1915, "mean_token_accuracy": 0.15772637948393822, "num_tokens": 937621.0, "step": 1105 }, { "entropy": 6.42638087272644, "epoch": 0.024802529411107513, "grad_norm": 1.375, "learning_rate": 0.0004985358311307688, "loss": 6.0898, "mean_token_accuracy": 0.1647167555987835, "num_tokens": 941629.0, "step": 1110 }, { "entropy": 6.330166149139404, "epoch": 0.02491425251656295, "grad_norm": 1.3671875, "learning_rate": 0.0004983985860282081, "loss": 6.0709, "mean_token_accuracy": 0.16174031496047975, "num_tokens": 945853.0, "step": 1115 }, { "entropy": 6.225450944900513, "epoch": 0.02502597562201839, "grad_norm": 1.5703125, "learning_rate": 0.0004982552163405623, "loss": 5.9055, "mean_token_accuracy": 0.17898752093315123, "num_tokens": 949758.0, "step": 1120 }, { "entropy": 6.182316493988037, "epoch": 0.025137698727473828, "grad_norm": 1.40625, "learning_rate": 0.0004981057259983839, "loss": 6.0268, "mean_token_accuracy": 0.17987219095230103, "num_tokens": 954028.0, "step": 1125 }, { "entropy": 6.319781017303467, "epoch": 0.02524942183292927, "grad_norm": 1.4296875, "learning_rate": 0.0004979501191000262, "loss": 6.0393, "mean_token_accuracy": 0.16309117376804352, "num_tokens": 958006.0, "step": 1130 }, { "entropy": 6.320125341415405, "epoch": 0.02536114493838471, "grad_norm": 1.4921875, "learning_rate": 0.0004977883999115311, "loss": 5.9716, "mean_token_accuracy": 0.17731243520975112, "num_tokens": 962637.0, "step": 1135 }, { "entropy": 6.350974798202515, "epoch": 0.025472868043840146, "grad_norm": 1.2734375, "learning_rate": 0.0004976205728665113, "loss": 5.9456, "mean_token_accuracy": 0.17742093056440353, "num_tokens": 966770.0, "step": 1140 }, { "entropy": 6.1780962467193605, "epoch": 0.025584591149295587, "grad_norm": 1.3984375, "learning_rate": 0.0004974466425660307, "loss": 5.9758, "mean_token_accuracy": 0.1761695474386215, "num_tokens": 970976.0, "step": 1145 }, { "entropy": 6.276739263534546, "epoch": 0.025696314254751024, "grad_norm": 1.4453125, "learning_rate": 0.0004972666137784759, "loss": 6.0095, "mean_token_accuracy": 0.16108598709106445, "num_tokens": 975253.0, "step": 1150 }, { "entropy": 6.226910066604614, "epoch": 0.025808037360206464, "grad_norm": 1.2734375, "learning_rate": 0.0004970804914394271, "loss": 5.998, "mean_token_accuracy": 0.1661012887954712, "num_tokens": 979388.0, "step": 1155 }, { "entropy": 6.162249755859375, "epoch": 0.025919760465661905, "grad_norm": 1.453125, "learning_rate": 0.0004968882806515225, "loss": 5.9613, "mean_token_accuracy": 0.1830698937177658, "num_tokens": 983216.0, "step": 1160 }, { "entropy": 6.258333396911621, "epoch": 0.026031483571117342, "grad_norm": 1.2265625, "learning_rate": 0.0004966899866843177, "loss": 6.061, "mean_token_accuracy": 0.16143736988306046, "num_tokens": 987850.0, "step": 1165 }, { "entropy": 6.322597026824951, "epoch": 0.026143206676572783, "grad_norm": 1.2578125, "learning_rate": 0.000496485614974142, "loss": 5.9894, "mean_token_accuracy": 0.17105733901262282, "num_tokens": 992232.0, "step": 1170 }, { "entropy": 6.21760311126709, "epoch": 0.02625492978202822, "grad_norm": 1.421875, "learning_rate": 0.0004962751711239492, "loss": 6.0848, "mean_token_accuracy": 0.1664736032485962, "num_tokens": 996428.0, "step": 1175 }, { "entropy": 6.334726476669312, "epoch": 0.02636665288748366, "grad_norm": 1.4140625, "learning_rate": 0.0004960586609031636, "loss": 5.9449, "mean_token_accuracy": 0.17343248575925826, "num_tokens": 1000336.0, "step": 1180 }, { "entropy": 6.3395665168762205, "epoch": 0.0264783759929391, "grad_norm": 1.4609375, "learning_rate": 0.0004958360902475224, "loss": 5.9253, "mean_token_accuracy": 0.17060509622097014, "num_tokens": 1004312.0, "step": 1185 }, { "entropy": 6.365295124053955, "epoch": 0.026590099098394538, "grad_norm": 1.359375, "learning_rate": 0.0004956074652589125, "loss": 6.1563, "mean_token_accuracy": 0.16267625764012336, "num_tokens": 1008728.0, "step": 1190 }, { "entropy": 6.270880270004272, "epoch": 0.02670182220384998, "grad_norm": 1.359375, "learning_rate": 0.0004953727922052035, "loss": 6.0663, "mean_token_accuracy": 0.16970421522855758, "num_tokens": 1013385.0, "step": 1195 }, { "entropy": 6.310678911209107, "epoch": 0.026813545309305416, "grad_norm": 1.265625, "learning_rate": 0.0004951320775200756, "loss": 6.0449, "mean_token_accuracy": 0.16335367113351823, "num_tokens": 1017537.0, "step": 1200 }, { "entropy": 6.093309450149536, "epoch": 0.026925268414760856, "grad_norm": 1.4296875, "learning_rate": 0.0004948853278028436, "loss": 5.9362, "mean_token_accuracy": 0.17884828001260758, "num_tokens": 1021753.0, "step": 1205 }, { "entropy": 6.228685140609741, "epoch": 0.027036991520216297, "grad_norm": 1.296875, "learning_rate": 0.0004946325498182755, "loss": 6.0468, "mean_token_accuracy": 0.16449340134859086, "num_tokens": 1026248.0, "step": 1210 }, { "entropy": 6.192647790908813, "epoch": 0.027148714625671734, "grad_norm": 1.3828125, "learning_rate": 0.0004943737504964076, "loss": 5.838, "mean_token_accuracy": 0.18312328010797502, "num_tokens": 1030284.0, "step": 1215 }, { "entropy": 6.250751209259033, "epoch": 0.027260437731127175, "grad_norm": 1.3125, "learning_rate": 0.000494108936932354, "loss": 6.1342, "mean_token_accuracy": 0.16936966106295587, "num_tokens": 1034444.0, "step": 1220 }, { "entropy": 6.304910802841187, "epoch": 0.027372160836582615, "grad_norm": 1.359375, "learning_rate": 0.0004938381163861124, "loss": 5.9104, "mean_token_accuracy": 0.18955854922533036, "num_tokens": 1038819.0, "step": 1225 }, { "entropy": 6.332531595230103, "epoch": 0.027483883942038052, "grad_norm": 1.3203125, "learning_rate": 0.0004935612962823645, "loss": 6.1242, "mean_token_accuracy": 0.16566465348005294, "num_tokens": 1043303.0, "step": 1230 }, { "entropy": 6.162945175170899, "epoch": 0.027595607047493493, "grad_norm": 1.4453125, "learning_rate": 0.0004932784842102739, "loss": 5.9639, "mean_token_accuracy": 0.1748690575361252, "num_tokens": 1047451.0, "step": 1235 }, { "entropy": 6.292677593231201, "epoch": 0.02770733015294893, "grad_norm": 1.1875, "learning_rate": 0.0004929896879232758, "loss": 6.0031, "mean_token_accuracy": 0.17595543414354325, "num_tokens": 1052370.0, "step": 1240 }, { "entropy": 6.406116533279419, "epoch": 0.02781905325840437, "grad_norm": 1.3984375, "learning_rate": 0.0004926949153388668, "loss": 6.1119, "mean_token_accuracy": 0.1625329688191414, "num_tokens": 1056755.0, "step": 1245 }, { "entropy": 6.257381248474121, "epoch": 0.02793077636385981, "grad_norm": 1.25, "learning_rate": 0.0004923941745383859, "loss": 5.9983, "mean_token_accuracy": 0.16609450280666352, "num_tokens": 1061380.0, "step": 1250 }, { "entropy": 6.04865870475769, "epoch": 0.02804249946931525, "grad_norm": 1.2578125, "learning_rate": 0.000492087473766794, "loss": 5.8919, "mean_token_accuracy": 0.18033342361450194, "num_tokens": 1065633.0, "step": 1255 }, { "entropy": 6.278530168533325, "epoch": 0.02815422257477069, "grad_norm": 1.46875, "learning_rate": 0.000491774821432448, "loss": 6.0283, "mean_token_accuracy": 0.16999331265687942, "num_tokens": 1070131.0, "step": 1260 }, { "entropy": 6.240628862380982, "epoch": 0.028265945680226126, "grad_norm": 1.3046875, "learning_rate": 0.0004914562261068693, "loss": 5.9501, "mean_token_accuracy": 0.16984693259000777, "num_tokens": 1074465.0, "step": 1265 }, { "entropy": 6.062196207046509, "epoch": 0.028377668785681567, "grad_norm": 1.4296875, "learning_rate": 0.0004911316965245098, "loss": 5.828, "mean_token_accuracy": 0.17757159918546678, "num_tokens": 1078738.0, "step": 1270 }, { "entropy": 6.12146635055542, "epoch": 0.028489391891137007, "grad_norm": 1.3203125, "learning_rate": 0.000490801241582512, "loss": 5.9453, "mean_token_accuracy": 0.17620262503623962, "num_tokens": 1082529.0, "step": 1275 }, { "entropy": 6.328038311004638, "epoch": 0.028601114996592444, "grad_norm": 1.3125, "learning_rate": 0.000490464870340465, "loss": 6.0216, "mean_token_accuracy": 0.16488975435495376, "num_tokens": 1087043.0, "step": 1280 }, { "entropy": 6.050336456298828, "epoch": 0.028712838102047885, "grad_norm": 1.4296875, "learning_rate": 0.0004901225920201563, "loss": 5.9187, "mean_token_accuracy": 0.18301421254873276, "num_tokens": 1091045.0, "step": 1285 }, { "entropy": 6.1567244052886965, "epoch": 0.028824561207503322, "grad_norm": 1.421875, "learning_rate": 0.000489774416005319, "loss": 5.8778, "mean_token_accuracy": 0.18505997806787491, "num_tokens": 1094949.0, "step": 1290 }, { "entropy": 6.193764543533325, "epoch": 0.028936284312958763, "grad_norm": 1.390625, "learning_rate": 0.0004894203518413742, "loss": 5.942, "mean_token_accuracy": 0.17170550525188447, "num_tokens": 1099131.0, "step": 1295 }, { "entropy": 6.024008512496948, "epoch": 0.029048007418414203, "grad_norm": 1.3359375, "learning_rate": 0.0004890604092351701, "loss": 5.8863, "mean_token_accuracy": 0.18198106437921524, "num_tokens": 1102967.0, "step": 1300 }, { "entropy": 6.191930198669434, "epoch": 0.02915973052386964, "grad_norm": 1.3359375, "learning_rate": 0.000488694598054715, "loss": 5.8698, "mean_token_accuracy": 0.18373733162879943, "num_tokens": 1106777.0, "step": 1305 }, { "entropy": 6.126851320266724, "epoch": 0.02927145362932508, "grad_norm": 1.34375, "learning_rate": 0.0004883229283289071, "loss": 5.9212, "mean_token_accuracy": 0.17913941144943238, "num_tokens": 1111184.0, "step": 1310 }, { "entropy": 6.192364168167114, "epoch": 0.02938317673478052, "grad_norm": 1.15625, "learning_rate": 0.00048794541024725993, "loss": 5.9298, "mean_token_accuracy": 0.17791166305541992, "num_tokens": 1115651.0, "step": 1315 }, { "entropy": 6.26938943862915, "epoch": 0.02949489984023596, "grad_norm": 1.1796875, "learning_rate": 0.0004875620541596221, "loss": 5.955, "mean_token_accuracy": 0.1659138545393944, "num_tokens": 1120012.0, "step": 1320 }, { "entropy": 6.076159715652466, "epoch": 0.0296066229456914, "grad_norm": 1.3046875, "learning_rate": 0.00048717287057589454, "loss": 5.8588, "mean_token_accuracy": 0.17886159271001817, "num_tokens": 1124549.0, "step": 1325 }, { "entropy": 6.182869958877563, "epoch": 0.029718346051146836, "grad_norm": 1.3515625, "learning_rate": 0.0004867778701657417, "loss": 5.9345, "mean_token_accuracy": 0.17838005125522613, "num_tokens": 1128968.0, "step": 1330 }, { "entropy": 6.133463668823242, "epoch": 0.029830069156602277, "grad_norm": 1.2890625, "learning_rate": 0.00048637706375829955, "loss": 5.9933, "mean_token_accuracy": 0.17328195571899413, "num_tokens": 1133396.0, "step": 1335 }, { "entropy": 6.253204965591431, "epoch": 0.029941792262057718, "grad_norm": 1.3828125, "learning_rate": 0.000485970462341878, "loss": 5.9025, "mean_token_accuracy": 0.170744127035141, "num_tokens": 1137577.0, "step": 1340 }, { "entropy": 6.061755275726318, "epoch": 0.030053515367513155, "grad_norm": 1.3515625, "learning_rate": 0.00048555807706366044, "loss": 5.7801, "mean_token_accuracy": 0.18417277485132216, "num_tokens": 1141551.0, "step": 1345 }, { "entropy": 6.116015100479126, "epoch": 0.030165238472968595, "grad_norm": 1.421875, "learning_rate": 0.00048513991922939756, "loss": 5.8398, "mean_token_accuracy": 0.17423712015151976, "num_tokens": 1145295.0, "step": 1350 }, { "entropy": 6.067533349990844, "epoch": 0.030276961578424032, "grad_norm": 1.2578125, "learning_rate": 0.00048471600030309744, "loss": 6.0567, "mean_token_accuracy": 0.16484877467155457, "num_tokens": 1149946.0, "step": 1355 }, { "entropy": 6.1512785911560055, "epoch": 0.030388684683879473, "grad_norm": 1.5390625, "learning_rate": 0.00048428633190671186, "loss": 5.9399, "mean_token_accuracy": 0.18146816939115523, "num_tokens": 1153955.0, "step": 1360 }, { "entropy": 6.143903684616089, "epoch": 0.030500407789334914, "grad_norm": 1.3515625, "learning_rate": 0.0004838509258198167, "loss": 5.849, "mean_token_accuracy": 0.18261384814977646, "num_tokens": 1158568.0, "step": 1365 }, { "entropy": 6.127876806259155, "epoch": 0.03061213089479035, "grad_norm": 1.4609375, "learning_rate": 0.00048340979397929, "loss": 5.7759, "mean_token_accuracy": 0.18599571883678437, "num_tokens": 1162217.0, "step": 1370 }, { "entropy": 6.076024913787842, "epoch": 0.03072385400024579, "grad_norm": 1.4375, "learning_rate": 0.00048296294847898386, "loss": 5.8861, "mean_token_accuracy": 0.17389037311077118, "num_tokens": 1165905.0, "step": 1375 }, { "entropy": 6.11526198387146, "epoch": 0.03083557710570123, "grad_norm": 1.4453125, "learning_rate": 0.0004825104015693934, "loss": 5.8432, "mean_token_accuracy": 0.17682357281446456, "num_tokens": 1170352.0, "step": 1380 }, { "entropy": 6.046456527709961, "epoch": 0.03094730021115667, "grad_norm": 1.2734375, "learning_rate": 0.0004820521656573208, "loss": 5.9274, "mean_token_accuracy": 0.17616797983646393, "num_tokens": 1174560.0, "step": 1385 }, { "entropy": 6.11228313446045, "epoch": 0.03105902331661211, "grad_norm": 1.34375, "learning_rate": 0.00048158825330553505, "loss": 5.8708, "mean_token_accuracy": 0.17557800114154815, "num_tokens": 1178544.0, "step": 1390 }, { "entropy": 5.975264167785644, "epoch": 0.031170746422067547, "grad_norm": 1.4453125, "learning_rate": 0.00048111867723242763, "loss": 5.6949, "mean_token_accuracy": 0.19889509081840515, "num_tokens": 1182541.0, "step": 1395 }, { "entropy": 5.97807993888855, "epoch": 0.031282469527522984, "grad_norm": 1.2890625, "learning_rate": 0.0004806434503116637, "loss": 5.7847, "mean_token_accuracy": 0.1825215622782707, "num_tokens": 1186684.0, "step": 1400 }, { "entropy": 6.036240196228027, "epoch": 0.03139419263297843, "grad_norm": 1.3203125, "learning_rate": 0.0004801625855718296, "loss": 5.7286, "mean_token_accuracy": 0.1909311071038246, "num_tokens": 1190785.0, "step": 1405 }, { "entropy": 5.977891159057617, "epoch": 0.031505915738433865, "grad_norm": 1.2265625, "learning_rate": 0.00047967609619607477, "loss": 5.7739, "mean_token_accuracy": 0.17418278902769088, "num_tokens": 1194940.0, "step": 1410 }, { "entropy": 5.920260810852051, "epoch": 0.0316176388438893, "grad_norm": 1.3359375, "learning_rate": 0.0004791839955217513, "loss": 5.7381, "mean_token_accuracy": 0.18921381384134292, "num_tokens": 1198765.0, "step": 1415 }, { "entropy": 6.071567487716675, "epoch": 0.031729361949344746, "grad_norm": 1.3046875, "learning_rate": 0.00047868629704004786, "loss": 5.9463, "mean_token_accuracy": 0.17053111791610717, "num_tokens": 1203266.0, "step": 1420 }, { "entropy": 6.066260862350464, "epoch": 0.03184108505480018, "grad_norm": 1.2109375, "learning_rate": 0.00047818301439561965, "loss": 5.7346, "mean_token_accuracy": 0.19455005526542662, "num_tokens": 1207414.0, "step": 1425 }, { "entropy": 5.978516721725464, "epoch": 0.03195280816025562, "grad_norm": 1.2734375, "learning_rate": 0.00047767416138621454, "loss": 5.7596, "mean_token_accuracy": 0.1821496695280075, "num_tokens": 1211325.0, "step": 1430 }, { "entropy": 6.088147068023682, "epoch": 0.032064531265711065, "grad_norm": 1.28125, "learning_rate": 0.000477159751962295, "loss": 5.7876, "mean_token_accuracy": 0.17757320106029512, "num_tokens": 1215866.0, "step": 1435 }, { "entropy": 6.105999946594238, "epoch": 0.0321762543711665, "grad_norm": 1.171875, "learning_rate": 0.00047663980022665507, "loss": 5.8637, "mean_token_accuracy": 0.16661322563886644, "num_tokens": 1220241.0, "step": 1440 }, { "entropy": 5.943767118453979, "epoch": 0.03228797747662194, "grad_norm": 1.3828125, "learning_rate": 0.00047611432043403437, "loss": 5.8393, "mean_token_accuracy": 0.17783186137676238, "num_tokens": 1224330.0, "step": 1445 }, { "entropy": 6.21411657333374, "epoch": 0.03239970058207738, "grad_norm": 1.2890625, "learning_rate": 0.0004755833269907267, "loss": 5.9352, "mean_token_accuracy": 0.16817386895418168, "num_tokens": 1228518.0, "step": 1450 }, { "entropy": 5.985192489624024, "epoch": 0.03251142368753282, "grad_norm": 1.2578125, "learning_rate": 0.0004750468344541857, "loss": 5.8087, "mean_token_accuracy": 0.1855456992983818, "num_tokens": 1232556.0, "step": 1455 }, { "entropy": 5.902926826477051, "epoch": 0.03262314679298826, "grad_norm": 1.5546875, "learning_rate": 0.00047450485753262525, "loss": 5.8417, "mean_token_accuracy": 0.17538347840309143, "num_tokens": 1236464.0, "step": 1460 }, { "entropy": 6.1002099990844725, "epoch": 0.032734869898443694, "grad_norm": 1.296875, "learning_rate": 0.00047395741108461633, "loss": 5.8552, "mean_token_accuracy": 0.1877426788210869, "num_tokens": 1240478.0, "step": 1465 }, { "entropy": 6.054091215133667, "epoch": 0.03284659300389914, "grad_norm": 1.359375, "learning_rate": 0.00047340451011867985, "loss": 5.8806, "mean_token_accuracy": 0.1829858422279358, "num_tokens": 1244149.0, "step": 1470 }, { "entropy": 6.208575963973999, "epoch": 0.032958316109354575, "grad_norm": 1.5390625, "learning_rate": 0.00047284616979287515, "loss": 5.9965, "mean_token_accuracy": 0.15834348127245904, "num_tokens": 1248617.0, "step": 1475 }, { "entropy": 6.053374433517456, "epoch": 0.03307003921481001, "grad_norm": 1.25, "learning_rate": 0.00047228240541438433, "loss": 5.8381, "mean_token_accuracy": 0.18422103077173232, "num_tokens": 1253044.0, "step": 1480 }, { "entropy": 6.099059247970581, "epoch": 0.03318176232026546, "grad_norm": 1.4296875, "learning_rate": 0.00047171323243909257, "loss": 5.8787, "mean_token_accuracy": 0.1814146339893341, "num_tokens": 1257651.0, "step": 1485 }, { "entropy": 6.0209493160247805, "epoch": 0.033293485425720894, "grad_norm": 1.3359375, "learning_rate": 0.00047113866647116457, "loss": 5.8113, "mean_token_accuracy": 0.19222917556762695, "num_tokens": 1261805.0, "step": 1490 }, { "entropy": 5.859741830825806, "epoch": 0.03340520853117633, "grad_norm": 1.3125, "learning_rate": 0.0004705587232626164, "loss": 5.6211, "mean_token_accuracy": 0.20293725579977034, "num_tokens": 1265625.0, "step": 1495 }, { "entropy": 5.956333827972412, "epoch": 0.033516931636631775, "grad_norm": 1.265625, "learning_rate": 0.00046997341871288424, "loss": 5.7941, "mean_token_accuracy": 0.18911935687065123, "num_tokens": 1269876.0, "step": 1500 }, { "entropy": 5.947610187530517, "epoch": 0.03362865474208721, "grad_norm": 1.1953125, "learning_rate": 0.0004693827688683879, "loss": 5.7585, "mean_token_accuracy": 0.18911905884742736, "num_tokens": 1273821.0, "step": 1505 }, { "entropy": 5.978272771835327, "epoch": 0.03374037784754265, "grad_norm": 1.25, "learning_rate": 0.0004687867899220914, "loss": 5.8581, "mean_token_accuracy": 0.1890767216682434, "num_tokens": 1278574.0, "step": 1510 }, { "entropy": 6.054383754730225, "epoch": 0.033852100952998086, "grad_norm": 1.390625, "learning_rate": 0.00046818549821305846, "loss": 5.8519, "mean_token_accuracy": 0.17416736483573914, "num_tokens": 1283271.0, "step": 1515 }, { "entropy": 5.997065925598145, "epoch": 0.03396382405845353, "grad_norm": 1.375, "learning_rate": 0.00046757891022600494, "loss": 5.6877, "mean_token_accuracy": 0.1906101658940315, "num_tokens": 1287633.0, "step": 1520 }, { "entropy": 5.85000958442688, "epoch": 0.03407554716390897, "grad_norm": 1.5390625, "learning_rate": 0.0004669670425908471, "loss": 5.6926, "mean_token_accuracy": 0.19665769934654237, "num_tokens": 1291796.0, "step": 1525 }, { "entropy": 5.956004524230957, "epoch": 0.034187270269364405, "grad_norm": 1.4140625, "learning_rate": 0.0004663499120822451, "loss": 5.8535, "mean_token_accuracy": 0.18395211100578307, "num_tokens": 1296086.0, "step": 1530 }, { "entropy": 5.935553312301636, "epoch": 0.03429899337481985, "grad_norm": 1.2265625, "learning_rate": 0.0004657275356191437, "loss": 5.7859, "mean_token_accuracy": 0.1771954283118248, "num_tokens": 1300651.0, "step": 1535 }, { "entropy": 5.98644380569458, "epoch": 0.034410716480275286, "grad_norm": 1.4609375, "learning_rate": 0.00046509993026430804, "loss": 5.7857, "mean_token_accuracy": 0.18615951985120774, "num_tokens": 1304930.0, "step": 1540 }, { "entropy": 6.049903631210327, "epoch": 0.03452243958573072, "grad_norm": 1.3046875, "learning_rate": 0.0004644671132238558, "loss": 5.9064, "mean_token_accuracy": 0.17017292976379395, "num_tokens": 1308950.0, "step": 1545 }, { "entropy": 6.011875438690185, "epoch": 0.03463416269118617, "grad_norm": 1.4765625, "learning_rate": 0.00046382910184678585, "loss": 5.7646, "mean_token_accuracy": 0.18291668146848677, "num_tokens": 1313059.0, "step": 1550 }, { "entropy": 5.82340407371521, "epoch": 0.034745885796641604, "grad_norm": 1.40625, "learning_rate": 0.0004631859136245025, "loss": 5.653, "mean_token_accuracy": 0.20044284611940383, "num_tokens": 1316756.0, "step": 1555 }, { "entropy": 5.832498359680176, "epoch": 0.03485760890209704, "grad_norm": 1.375, "learning_rate": 0.0004625375661903357, "loss": 5.9377, "mean_token_accuracy": 0.1717216596007347, "num_tokens": 1320834.0, "step": 1560 }, { "entropy": 6.000537538528443, "epoch": 0.034969332007552485, "grad_norm": 1.4296875, "learning_rate": 0.00046188407731905787, "loss": 5.7466, "mean_token_accuracy": 0.179401932656765, "num_tokens": 1324484.0, "step": 1565 }, { "entropy": 5.9155961036682125, "epoch": 0.03508105511300792, "grad_norm": 1.2578125, "learning_rate": 0.00046122546492639643, "loss": 5.7167, "mean_token_accuracy": 0.18550520837306977, "num_tokens": 1328935.0, "step": 1570 }, { "entropy": 5.872024726867676, "epoch": 0.03519277821846336, "grad_norm": 1.4453125, "learning_rate": 0.000460561747068543, "loss": 5.712, "mean_token_accuracy": 0.18719355762004852, "num_tokens": 1333225.0, "step": 1575 }, { "entropy": 5.869159507751465, "epoch": 0.0353045013239188, "grad_norm": 1.4296875, "learning_rate": 0.0004598929419416578, "loss": 5.651, "mean_token_accuracy": 0.18982717245817185, "num_tokens": 1337234.0, "step": 1580 }, { "entropy": 5.923066091537476, "epoch": 0.03541622442937424, "grad_norm": 1.3671875, "learning_rate": 0.00045921906788137123, "loss": 5.9007, "mean_token_accuracy": 0.1787141427397728, "num_tokens": 1341765.0, "step": 1585 }, { "entropy": 6.0253113269805905, "epoch": 0.03552794753482968, "grad_norm": 1.3515625, "learning_rate": 0.00045854014336228115, "loss": 5.7594, "mean_token_accuracy": 0.18375371396541595, "num_tokens": 1346087.0, "step": 1590 }, { "entropy": 5.957542037963867, "epoch": 0.035639670640285115, "grad_norm": 1.328125, "learning_rate": 0.00045785618699744615, "loss": 5.8163, "mean_token_accuracy": 0.17815666794776916, "num_tokens": 1350443.0, "step": 1595 }, { "entropy": 5.926890325546265, "epoch": 0.03575139374574056, "grad_norm": 1.1484375, "learning_rate": 0.00045716721753787543, "loss": 5.816, "mean_token_accuracy": 0.18130575716495514, "num_tokens": 1355092.0, "step": 1600 }, { "entropy": 5.974433660507202, "epoch": 0.035863116851195996, "grad_norm": 1.25, "learning_rate": 0.0004564732538720148, "loss": 5.835, "mean_token_accuracy": 0.18347030133008957, "num_tokens": 1359379.0, "step": 1605 }, { "entropy": 5.953034782409668, "epoch": 0.03597483995665143, "grad_norm": 1.3515625, "learning_rate": 0.00045577431502522877, "loss": 5.6628, "mean_token_accuracy": 0.19076226502656937, "num_tokens": 1363346.0, "step": 1610 }, { "entropy": 5.8596611499786375, "epoch": 0.03608656306210688, "grad_norm": 1.28125, "learning_rate": 0.0004550704201592787, "loss": 5.7542, "mean_token_accuracy": 0.18018715232610702, "num_tokens": 1367322.0, "step": 1615 }, { "entropy": 5.794494342803955, "epoch": 0.036198286167562314, "grad_norm": 1.296875, "learning_rate": 0.0004543615885717981, "loss": 5.6992, "mean_token_accuracy": 0.17892082631587983, "num_tokens": 1371165.0, "step": 1620 }, { "entropy": 5.782205438613891, "epoch": 0.03631000927301775, "grad_norm": 1.3125, "learning_rate": 0.00045364783969576296, "loss": 5.7294, "mean_token_accuracy": 0.18963399678468704, "num_tokens": 1375119.0, "step": 1625 }, { "entropy": 6.001317644119263, "epoch": 0.03642173237847319, "grad_norm": 1.296875, "learning_rate": 0.0004529291930989592, "loss": 5.6411, "mean_token_accuracy": 0.18632617145776748, "num_tokens": 1379268.0, "step": 1630 }, { "entropy": 5.849557733535766, "epoch": 0.03653345548392863, "grad_norm": 1.296875, "learning_rate": 0.0004522056684834464, "loss": 5.7699, "mean_token_accuracy": 0.1743351399898529, "num_tokens": 1383477.0, "step": 1635 }, { "entropy": 5.865782070159912, "epoch": 0.03664517858938407, "grad_norm": 1.3984375, "learning_rate": 0.0004514772856850173, "loss": 5.6866, "mean_token_accuracy": 0.18341614156961442, "num_tokens": 1387138.0, "step": 1640 }, { "entropy": 5.977947139739991, "epoch": 0.03675690169483951, "grad_norm": 1.3203125, "learning_rate": 0.0004507440646726542, "loss": 5.8143, "mean_token_accuracy": 0.172549207508564, "num_tokens": 1391758.0, "step": 1645 }, { "entropy": 5.8711779594421385, "epoch": 0.03686862480029495, "grad_norm": 1.3671875, "learning_rate": 0.0004500060255479818, "loss": 5.723, "mean_token_accuracy": 0.17711774334311486, "num_tokens": 1395517.0, "step": 1650 }, { "entropy": 5.922771453857422, "epoch": 0.03698034790575039, "grad_norm": 1.34375, "learning_rate": 0.0004492631885447151, "loss": 5.7544, "mean_token_accuracy": 0.19050031006336213, "num_tokens": 1400021.0, "step": 1655 }, { "entropy": 6.1255439758300785, "epoch": 0.037092071011205825, "grad_norm": 1.3828125, "learning_rate": 0.00044851557402810616, "loss": 5.9007, "mean_token_accuracy": 0.17477723360061645, "num_tokens": 1404456.0, "step": 1660 }, { "entropy": 5.92813024520874, "epoch": 0.03720379411666127, "grad_norm": 1.2578125, "learning_rate": 0.00044776320249438444, "loss": 5.7934, "mean_token_accuracy": 0.1815376475453377, "num_tokens": 1408612.0, "step": 1665 }, { "entropy": 5.931152248382569, "epoch": 0.037315517222116706, "grad_norm": 1.296875, "learning_rate": 0.00044700609457019565, "loss": 5.7709, "mean_token_accuracy": 0.18026064932346345, "num_tokens": 1412688.0, "step": 1670 }, { "entropy": 5.978479957580566, "epoch": 0.037427240327572144, "grad_norm": 1.3203125, "learning_rate": 0.0004462442710120359, "loss": 5.8158, "mean_token_accuracy": 0.1856473058462143, "num_tokens": 1417273.0, "step": 1675 }, { "entropy": 5.903031873703003, "epoch": 0.03753896343302759, "grad_norm": 1.3046875, "learning_rate": 0.000445477752705683, "loss": 5.7375, "mean_token_accuracy": 0.1884758025407791, "num_tokens": 1421737.0, "step": 1680 }, { "entropy": 5.8098523139953615, "epoch": 0.037650686538483025, "grad_norm": 1.2734375, "learning_rate": 0.00044470656066562336, "loss": 5.5071, "mean_token_accuracy": 0.21041337251663209, "num_tokens": 1426154.0, "step": 1685 }, { "entropy": 5.780639505386352, "epoch": 0.03776240964393846, "grad_norm": 1.390625, "learning_rate": 0.0004439307160344765, "loss": 5.7721, "mean_token_accuracy": 0.17714227586984635, "num_tokens": 1430270.0, "step": 1690 }, { "entropy": 5.961412334442139, "epoch": 0.0378741327493939, "grad_norm": 1.2421875, "learning_rate": 0.00044315024008241473, "loss": 5.643, "mean_token_accuracy": 0.19645272940397263, "num_tokens": 1434877.0, "step": 1695 }, { "entropy": 5.815417146682739, "epoch": 0.03798585585484934, "grad_norm": 1.3125, "learning_rate": 0.0004423651542065806, "loss": 5.7024, "mean_token_accuracy": 0.19412025362253188, "num_tokens": 1438690.0, "step": 1700 }, { "entropy": 5.813020801544189, "epoch": 0.03809757896030478, "grad_norm": 1.4296875, "learning_rate": 0.00044157547993050006, "loss": 5.666, "mean_token_accuracy": 0.18868900388479232, "num_tokens": 1443085.0, "step": 1705 }, { "entropy": 5.746577167510987, "epoch": 0.03820930206576022, "grad_norm": 1.4453125, "learning_rate": 0.00044078123890349227, "loss": 5.5337, "mean_token_accuracy": 0.20610977411270143, "num_tokens": 1447280.0, "step": 1710 }, { "entropy": 5.846112585067749, "epoch": 0.03832102517121566, "grad_norm": 1.25, "learning_rate": 0.00043998245290007606, "loss": 5.7143, "mean_token_accuracy": 0.1895755797624588, "num_tokens": 1451639.0, "step": 1715 }, { "entropy": 5.9104358673095705, "epoch": 0.0384327482766711, "grad_norm": 1.3515625, "learning_rate": 0.00043917914381937323, "loss": 5.6867, "mean_token_accuracy": 0.18838332891464232, "num_tokens": 1455473.0, "step": 1720 }, { "entropy": 5.924994277954101, "epoch": 0.038544471382126536, "grad_norm": 1.2109375, "learning_rate": 0.00043837133368450815, "loss": 5.7771, "mean_token_accuracy": 0.17980068176984787, "num_tokens": 1460332.0, "step": 1725 }, { "entropy": 5.907491636276245, "epoch": 0.03865619448758198, "grad_norm": 1.21875, "learning_rate": 0.0004375590446420037, "loss": 5.658, "mean_token_accuracy": 0.19679046124219896, "num_tokens": 1465013.0, "step": 1730 }, { "entropy": 5.766436243057251, "epoch": 0.03876791759303742, "grad_norm": 1.328125, "learning_rate": 0.0004367422989611743, "loss": 5.5845, "mean_token_accuracy": 0.1921959325671196, "num_tokens": 1469070.0, "step": 1735 }, { "entropy": 5.966058731079102, "epoch": 0.038879640698492854, "grad_norm": 1.1953125, "learning_rate": 0.0004359211190335153, "loss": 5.6631, "mean_token_accuracy": 0.18933282941579818, "num_tokens": 1473426.0, "step": 1740 }, { "entropy": 5.8712715148925785, "epoch": 0.0389913638039483, "grad_norm": 1.359375, "learning_rate": 0.00043509552737208923, "loss": 5.7692, "mean_token_accuracy": 0.18656760305166245, "num_tokens": 1477631.0, "step": 1745 }, { "entropy": 5.809204721450806, "epoch": 0.039103086909403735, "grad_norm": 1.265625, "learning_rate": 0.00043426554661090853, "loss": 5.7989, "mean_token_accuracy": 0.1808011546730995, "num_tokens": 1481921.0, "step": 1750 }, { "entropy": 5.959576177597046, "epoch": 0.03921481001485917, "grad_norm": 1.265625, "learning_rate": 0.00043343119950431516, "loss": 5.7858, "mean_token_accuracy": 0.18863923847675323, "num_tokens": 1486571.0, "step": 1755 }, { "entropy": 6.01992974281311, "epoch": 0.03932653312031461, "grad_norm": 1.2890625, "learning_rate": 0.00043259250892635644, "loss": 5.7733, "mean_token_accuracy": 0.17147145718336104, "num_tokens": 1490952.0, "step": 1760 }, { "entropy": 5.805021715164185, "epoch": 0.03943825622577005, "grad_norm": 1.2421875, "learning_rate": 0.0004317494978701582, "loss": 5.5844, "mean_token_accuracy": 0.20293330252170563, "num_tokens": 1495144.0, "step": 1765 }, { "entropy": 5.851907777786255, "epoch": 0.03954997933122549, "grad_norm": 1.3203125, "learning_rate": 0.0004309021894472943, "loss": 5.7049, "mean_token_accuracy": 0.1867707759141922, "num_tokens": 1499386.0, "step": 1770 }, { "entropy": 5.924546384811402, "epoch": 0.03966170243668093, "grad_norm": 1.4609375, "learning_rate": 0.0004300506068871534, "loss": 5.6447, "mean_token_accuracy": 0.196545746922493, "num_tokens": 1503583.0, "step": 1775 }, { "entropy": 5.851029920578003, "epoch": 0.03977342554213637, "grad_norm": 1.46875, "learning_rate": 0.00042919477353630135, "loss": 5.6454, "mean_token_accuracy": 0.18555532693862914, "num_tokens": 1507680.0, "step": 1780 }, { "entropy": 5.900534915924072, "epoch": 0.03988514864759181, "grad_norm": 1.2109375, "learning_rate": 0.000428334712857842, "loss": 5.7511, "mean_token_accuracy": 0.18316335380077362, "num_tokens": 1511856.0, "step": 1785 }, { "entropy": 5.938773584365845, "epoch": 0.039996871753047246, "grad_norm": 1.234375, "learning_rate": 0.00042747044843077304, "loss": 5.6779, "mean_token_accuracy": 0.18426842391490936, "num_tokens": 1516176.0, "step": 1790 }, { "entropy": 5.897777462005616, "epoch": 0.04010859485850269, "grad_norm": 1.34375, "learning_rate": 0.00042660200394934047, "loss": 5.6167, "mean_token_accuracy": 0.19120081663131713, "num_tokens": 1520060.0, "step": 1795 }, { "entropy": 5.674463272094727, "epoch": 0.04022031796395813, "grad_norm": 1.34375, "learning_rate": 0.00042572940322238844, "loss": 5.6891, "mean_token_accuracy": 0.1935557708144188, "num_tokens": 1524165.0, "step": 1800 }, { "entropy": 5.897950935363769, "epoch": 0.040332041069413564, "grad_norm": 1.2421875, "learning_rate": 0.00042485267017270664, "loss": 5.873, "mean_token_accuracy": 0.1720517948269844, "num_tokens": 1528065.0, "step": 1805 }, { "entropy": 5.998282623291016, "epoch": 0.040443764174869, "grad_norm": 1.2578125, "learning_rate": 0.0004239718288363745, "loss": 5.6418, "mean_token_accuracy": 0.19317266643047332, "num_tokens": 1532618.0, "step": 1810 }, { "entropy": 5.780726480484009, "epoch": 0.040555487280324445, "grad_norm": 1.203125, "learning_rate": 0.0004230869033621023, "loss": 5.6881, "mean_token_accuracy": 0.18989397287368776, "num_tokens": 1536965.0, "step": 1815 }, { "entropy": 5.810385847091675, "epoch": 0.04066721038577988, "grad_norm": 1.3125, "learning_rate": 0.0004221979180105688, "loss": 5.81, "mean_token_accuracy": 0.17670476138591767, "num_tokens": 1541332.0, "step": 1820 }, { "entropy": 5.831990575790405, "epoch": 0.04077893349123532, "grad_norm": 1.21875, "learning_rate": 0.00042130489715375645, "loss": 5.5056, "mean_token_accuracy": 0.20245466083288194, "num_tokens": 1545324.0, "step": 1825 }, { "entropy": 5.938973903656006, "epoch": 0.040890656596690764, "grad_norm": 1.28125, "learning_rate": 0.00042040786527428335, "loss": 5.718, "mean_token_accuracy": 0.1829439416527748, "num_tokens": 1549409.0, "step": 1830 }, { "entropy": 5.827459383010864, "epoch": 0.0410023797021462, "grad_norm": 1.328125, "learning_rate": 0.0004195068469647315, "loss": 5.722, "mean_token_accuracy": 0.18134666085243226, "num_tokens": 1553526.0, "step": 1835 }, { "entropy": 5.846643352508545, "epoch": 0.04111410280760164, "grad_norm": 1.234375, "learning_rate": 0.00041860186692697297, "loss": 5.8215, "mean_token_accuracy": 0.18818144947290422, "num_tokens": 1558475.0, "step": 1840 }, { "entropy": 5.911942195892334, "epoch": 0.04122582591305708, "grad_norm": 1.3828125, "learning_rate": 0.00041769294997149264, "loss": 5.6244, "mean_token_accuracy": 0.18921684920787812, "num_tokens": 1562702.0, "step": 1845 }, { "entropy": 5.760951137542724, "epoch": 0.04133754901851252, "grad_norm": 1.2890625, "learning_rate": 0.0004167801210167081, "loss": 5.6199, "mean_token_accuracy": 0.2041267544031143, "num_tokens": 1566706.0, "step": 1850 }, { "entropy": 5.749172258377075, "epoch": 0.041449272123967956, "grad_norm": 1.2890625, "learning_rate": 0.0004158634050882861, "loss": 5.6459, "mean_token_accuracy": 0.1950855016708374, "num_tokens": 1570843.0, "step": 1855 }, { "entropy": 5.89965443611145, "epoch": 0.0415609952294234, "grad_norm": 1.21875, "learning_rate": 0.0004149428273184569, "loss": 5.6739, "mean_token_accuracy": 0.18709891736507417, "num_tokens": 1575308.0, "step": 1860 }, { "entropy": 5.850597333908081, "epoch": 0.04167271833487884, "grad_norm": 1.328125, "learning_rate": 0.0004140184129453253, "loss": 5.8073, "mean_token_accuracy": 0.1735033169388771, "num_tokens": 1579397.0, "step": 1865 }, { "entropy": 5.788528537750244, "epoch": 0.041784441440334275, "grad_norm": 1.40625, "learning_rate": 0.000413090187312178, "loss": 5.5974, "mean_token_accuracy": 0.1987029194831848, "num_tokens": 1583464.0, "step": 1870 }, { "entropy": 5.821397066116333, "epoch": 0.04189616454578971, "grad_norm": 1.1875, "learning_rate": 0.0004121581758667898, "loss": 5.6181, "mean_token_accuracy": 0.18513045012950896, "num_tokens": 1587948.0, "step": 1875 }, { "entropy": 5.83982481956482, "epoch": 0.042007887651245156, "grad_norm": 1.3671875, "learning_rate": 0.00041122240416072533, "loss": 5.5384, "mean_token_accuracy": 0.2091333582997322, "num_tokens": 1591855.0, "step": 1880 }, { "entropy": 5.8791999340057375, "epoch": 0.04211961075670059, "grad_norm": 1.171875, "learning_rate": 0.0004102828978486385, "loss": 5.6762, "mean_token_accuracy": 0.19092029482126235, "num_tokens": 1595951.0, "step": 1885 }, { "entropy": 5.779487609863281, "epoch": 0.04223133386215603, "grad_norm": 1.3671875, "learning_rate": 0.0004093396826875695, "loss": 5.6041, "mean_token_accuracy": 0.19690629988908767, "num_tokens": 1600091.0, "step": 1890 }, { "entropy": 5.929903554916382, "epoch": 0.042343056967611474, "grad_norm": 1.3359375, "learning_rate": 0.00040839278453623837, "loss": 5.6967, "mean_token_accuracy": 0.18317292779684066, "num_tokens": 1604093.0, "step": 1895 }, { "entropy": 5.816547489166259, "epoch": 0.04245478007306691, "grad_norm": 1.25, "learning_rate": 0.0004074422293543363, "loss": 5.6041, "mean_token_accuracy": 0.19519466310739517, "num_tokens": 1608254.0, "step": 1900 }, { "entropy": 5.730870199203491, "epoch": 0.04256650317852235, "grad_norm": 1.2578125, "learning_rate": 0.0004064880432018137, "loss": 5.7094, "mean_token_accuracy": 0.18937533646821975, "num_tokens": 1612064.0, "step": 1905 }, { "entropy": 5.835119581222534, "epoch": 0.04267822628397779, "grad_norm": 1.28125, "learning_rate": 0.00040553025223816615, "loss": 5.7613, "mean_token_accuracy": 0.18858376294374465, "num_tokens": 1616494.0, "step": 1910 }, { "entropy": 5.779830884933472, "epoch": 0.04278994938943323, "grad_norm": 1.3046875, "learning_rate": 0.00040456888272171653, "loss": 5.4725, "mean_token_accuracy": 0.20619394183158873, "num_tokens": 1620432.0, "step": 1915 }, { "entropy": 5.958911371231079, "epoch": 0.04290167249488867, "grad_norm": 1.21875, "learning_rate": 0.00040360396100889577, "loss": 5.7467, "mean_token_accuracy": 0.17847216576337815, "num_tokens": 1625170.0, "step": 1920 }, { "entropy": 5.828932857513427, "epoch": 0.043013395600344104, "grad_norm": 1.265625, "learning_rate": 0.0004026355135535202, "loss": 5.6647, "mean_token_accuracy": 0.18227333724498748, "num_tokens": 1629487.0, "step": 1925 }, { "entropy": 5.734749698638916, "epoch": 0.04312511870579955, "grad_norm": 1.3671875, "learning_rate": 0.000401663566906066, "loss": 5.6037, "mean_token_accuracy": 0.19136299937963486, "num_tokens": 1633868.0, "step": 1930 }, { "entropy": 5.85823073387146, "epoch": 0.043236841811254985, "grad_norm": 1.3515625, "learning_rate": 0.00040068814771294134, "loss": 5.725, "mean_token_accuracy": 0.18341838121414183, "num_tokens": 1638153.0, "step": 1935 }, { "entropy": 5.7378229141235355, "epoch": 0.04334856491671042, "grad_norm": 1.3203125, "learning_rate": 0.0003997092827157562, "loss": 5.5213, "mean_token_accuracy": 0.21243593096733093, "num_tokens": 1642365.0, "step": 1940 }, { "entropy": 6.021594619750976, "epoch": 0.043460288022165866, "grad_norm": 1.2734375, "learning_rate": 0.000398726998750589, "loss": 5.6583, "mean_token_accuracy": 0.18683991432189942, "num_tokens": 1646202.0, "step": 1945 }, { "entropy": 5.737234687805175, "epoch": 0.0435720111276213, "grad_norm": 1.2421875, "learning_rate": 0.00039774132274725076, "loss": 5.5423, "mean_token_accuracy": 0.20251974761486052, "num_tokens": 1650542.0, "step": 1950 }, { "entropy": 5.632225704193115, "epoch": 0.04368373423307674, "grad_norm": 1.3828125, "learning_rate": 0.00039675228172854707, "loss": 5.4996, "mean_token_accuracy": 0.20376336723566055, "num_tokens": 1654386.0, "step": 1955 }, { "entropy": 5.716553688049316, "epoch": 0.043795457338532184, "grad_norm": 1.328125, "learning_rate": 0.0003957599028095371, "loss": 5.4805, "mean_token_accuracy": 0.20812955051660537, "num_tokens": 1658211.0, "step": 1960 }, { "entropy": 5.847964096069336, "epoch": 0.04390718044398762, "grad_norm": 1.390625, "learning_rate": 0.00039476421319679017, "loss": 5.6714, "mean_token_accuracy": 0.183257956802845, "num_tokens": 1662757.0, "step": 1965 }, { "entropy": 5.93111743927002, "epoch": 0.04401890354944306, "grad_norm": 1.3984375, "learning_rate": 0.00039376524018764, "loss": 5.671, "mean_token_accuracy": 0.18319940865039824, "num_tokens": 1666714.0, "step": 1970 }, { "entropy": 5.817181968688965, "epoch": 0.0441306266548985, "grad_norm": 1.1953125, "learning_rate": 0.00039276301116943616, "loss": 5.6546, "mean_token_accuracy": 0.18562693744897843, "num_tokens": 1671029.0, "step": 1975 }, { "entropy": 5.8121912479400635, "epoch": 0.04424234976035394, "grad_norm": 1.2578125, "learning_rate": 0.0003917575536187936, "loss": 5.6513, "mean_token_accuracy": 0.1900311678647995, "num_tokens": 1675366.0, "step": 1980 }, { "entropy": 5.853685092926026, "epoch": 0.04435407286580938, "grad_norm": 1.4453125, "learning_rate": 0.00039074889510083894, "loss": 5.5223, "mean_token_accuracy": 0.21142301857471466, "num_tokens": 1679657.0, "step": 1985 }, { "entropy": 5.725562191009521, "epoch": 0.044465795971264814, "grad_norm": 1.3515625, "learning_rate": 0.00038973706326845495, "loss": 5.5366, "mean_token_accuracy": 0.19422180354595184, "num_tokens": 1683676.0, "step": 1990 }, { "entropy": 5.668733263015747, "epoch": 0.04457751907672026, "grad_norm": 1.3515625, "learning_rate": 0.0003887220858615225, "loss": 5.5311, "mean_token_accuracy": 0.20603107661008835, "num_tokens": 1687718.0, "step": 1995 }, { "entropy": 5.6940343379974365, "epoch": 0.044689242182175695, "grad_norm": 1.3671875, "learning_rate": 0.0003877039907061597, "loss": 5.5685, "mean_token_accuracy": 0.18587933331727982, "num_tokens": 1691434.0, "step": 2000 }, { "entropy": 5.721743106842041, "epoch": 0.04480096528763113, "grad_norm": 1.2578125, "learning_rate": 0.0003866828057139598, "loss": 5.6397, "mean_token_accuracy": 0.18485358059406282, "num_tokens": 1695714.0, "step": 2005 }, { "entropy": 5.784295082092285, "epoch": 0.044912688393086576, "grad_norm": 1.3359375, "learning_rate": 0.00038565855888122503, "loss": 5.4378, "mean_token_accuracy": 0.20242598354816438, "num_tokens": 1700245.0, "step": 2010 }, { "entropy": 5.62515549659729, "epoch": 0.045024411498542014, "grad_norm": 1.4140625, "learning_rate": 0.00038463127828819975, "loss": 5.5494, "mean_token_accuracy": 0.20422022193670272, "num_tokens": 1704329.0, "step": 2015 }, { "entropy": 5.733830881118775, "epoch": 0.04513613460399745, "grad_norm": 1.3828125, "learning_rate": 0.00038360099209830043, "loss": 5.5726, "mean_token_accuracy": 0.19276565164327622, "num_tokens": 1708387.0, "step": 2020 }, { "entropy": 5.789889287948609, "epoch": 0.045247857709452895, "grad_norm": 1.3828125, "learning_rate": 0.0003825677285573433, "loss": 5.5658, "mean_token_accuracy": 0.1929836466908455, "num_tokens": 1712620.0, "step": 2025 }, { "entropy": 5.746649646759034, "epoch": 0.04535958081490833, "grad_norm": 1.3046875, "learning_rate": 0.00038153151599277027, "loss": 5.5775, "mean_token_accuracy": 0.19831744730472564, "num_tokens": 1716862.0, "step": 2030 }, { "entropy": 5.86361927986145, "epoch": 0.04547130392036377, "grad_norm": 1.375, "learning_rate": 0.0003804923828128723, "loss": 5.6553, "mean_token_accuracy": 0.18186011761426926, "num_tokens": 1721121.0, "step": 2035 }, { "entropy": 5.826954174041748, "epoch": 0.04558302702581921, "grad_norm": 1.234375, "learning_rate": 0.0003794503575060104, "loss": 5.4734, "mean_token_accuracy": 0.20993418246507645, "num_tokens": 1725307.0, "step": 2040 }, { "entropy": 5.828565216064453, "epoch": 0.04569475013127465, "grad_norm": 1.1796875, "learning_rate": 0.00037840546863983484, "loss": 5.6917, "mean_token_accuracy": 0.18647813200950622, "num_tokens": 1729931.0, "step": 2045 }, { "entropy": 5.691795730590821, "epoch": 0.04580647323673009, "grad_norm": 1.2734375, "learning_rate": 0.0003773577448605015, "loss": 5.677, "mean_token_accuracy": 0.18873957991600038, "num_tokens": 1734117.0, "step": 2050 }, { "entropy": 5.802150058746338, "epoch": 0.045918196342185524, "grad_norm": 1.2890625, "learning_rate": 0.0003763072148918872, "loss": 5.6918, "mean_token_accuracy": 0.1806354731321335, "num_tokens": 1738246.0, "step": 2055 }, { "entropy": 5.928330421447754, "epoch": 0.04602991944764097, "grad_norm": 1.2890625, "learning_rate": 0.0003752539075348017, "loss": 5.634, "mean_token_accuracy": 0.1888989970088005, "num_tokens": 1742557.0, "step": 2060 }, { "entropy": 5.763717365264893, "epoch": 0.046141642553096406, "grad_norm": 1.28125, "learning_rate": 0.00037419785166619817, "loss": 5.5667, "mean_token_accuracy": 0.19592652171850206, "num_tokens": 1746639.0, "step": 2065 }, { "entropy": 5.832269716262817, "epoch": 0.04625336565855184, "grad_norm": 1.203125, "learning_rate": 0.0003731390762383818, "loss": 5.6515, "mean_token_accuracy": 0.18419942110776902, "num_tokens": 1751528.0, "step": 2070 }, { "entropy": 5.7962113380432125, "epoch": 0.04636508876400729, "grad_norm": 1.25, "learning_rate": 0.0003720776102782158, "loss": 5.4677, "mean_token_accuracy": 0.20580795109272004, "num_tokens": 1755734.0, "step": 2075 }, { "entropy": 5.7612978458404545, "epoch": 0.046476811869462724, "grad_norm": 1.2421875, "learning_rate": 0.00037101348288632555, "loss": 5.6062, "mean_token_accuracy": 0.19590772986412047, "num_tokens": 1760188.0, "step": 2080 }, { "entropy": 5.779658651351928, "epoch": 0.04658853497491816, "grad_norm": 1.3515625, "learning_rate": 0.0003699467232363012, "loss": 5.5658, "mean_token_accuracy": 0.20426930040121077, "num_tokens": 1764469.0, "step": 2085 }, { "entropy": 5.796822643280029, "epoch": 0.046700258080373605, "grad_norm": 1.234375, "learning_rate": 0.0003688773605738973, "loss": 5.6241, "mean_token_accuracy": 0.1935473784804344, "num_tokens": 1768946.0, "step": 2090 }, { "entropy": 5.739144229888916, "epoch": 0.04681198118582904, "grad_norm": 1.375, "learning_rate": 0.00036780542421623134, "loss": 5.452, "mean_token_accuracy": 0.20726609230041504, "num_tokens": 1772806.0, "step": 2095 }, { "entropy": 5.762845706939697, "epoch": 0.04692370429128448, "grad_norm": 1.296875, "learning_rate": 0.0003667309435509802, "loss": 5.7521, "mean_token_accuracy": 0.1798543617129326, "num_tokens": 1777333.0, "step": 2100 }, { "entropy": 5.788598918914795, "epoch": 0.047035427396739916, "grad_norm": 1.4296875, "learning_rate": 0.0003656539480355741, "loss": 5.5277, "mean_token_accuracy": 0.19866943806409837, "num_tokens": 1781232.0, "step": 2105 }, { "entropy": 5.829206132888794, "epoch": 0.04714715050219536, "grad_norm": 1.328125, "learning_rate": 0.0003645744671963891, "loss": 5.6079, "mean_token_accuracy": 0.18846295773983002, "num_tokens": 1785543.0, "step": 2110 }, { "entropy": 5.724898433685302, "epoch": 0.0472588736076508, "grad_norm": 1.1953125, "learning_rate": 0.0003634925306279376, "loss": 5.601, "mean_token_accuracy": 0.18806510120630265, "num_tokens": 1789926.0, "step": 2115 }, { "entropy": 5.709711313247681, "epoch": 0.047370596713106235, "grad_norm": 1.2578125, "learning_rate": 0.0003624081679920574, "loss": 5.5505, "mean_token_accuracy": 0.19849662482738495, "num_tokens": 1794307.0, "step": 2120 }, { "entropy": 5.706761646270752, "epoch": 0.04748231981856168, "grad_norm": 1.296875, "learning_rate": 0.0003613214090170977, "loss": 5.473, "mean_token_accuracy": 0.20660974830389023, "num_tokens": 1798553.0, "step": 2125 }, { "entropy": 5.782987308502197, "epoch": 0.047594042924017116, "grad_norm": 1.296875, "learning_rate": 0.0003602322834971048, "loss": 5.4317, "mean_token_accuracy": 0.21588237285614015, "num_tokens": 1802795.0, "step": 2130 }, { "entropy": 5.62813401222229, "epoch": 0.04770576602947255, "grad_norm": 1.359375, "learning_rate": 0.0003591408212910051, "loss": 5.4229, "mean_token_accuracy": 0.20910920351743698, "num_tokens": 1806762.0, "step": 2135 }, { "entropy": 5.61645393371582, "epoch": 0.047817489134928, "grad_norm": 1.28125, "learning_rate": 0.0003580470523217863, "loss": 5.4807, "mean_token_accuracy": 0.20365458726882935, "num_tokens": 1811067.0, "step": 2140 }, { "entropy": 5.593378210067749, "epoch": 0.047929212240383434, "grad_norm": 1.3046875, "learning_rate": 0.0003569510065756771, "loss": 5.4525, "mean_token_accuracy": 0.20863720178604125, "num_tokens": 1815180.0, "step": 2145 }, { "entropy": 5.623372507095337, "epoch": 0.04804093534583887, "grad_norm": 1.2890625, "learning_rate": 0.0003558527141013254, "loss": 5.5856, "mean_token_accuracy": 0.1915388822555542, "num_tokens": 1819564.0, "step": 2150 }, { "entropy": 5.802288627624511, "epoch": 0.048152658451294315, "grad_norm": 1.140625, "learning_rate": 0.0003547522050089742, "loss": 5.535, "mean_token_accuracy": 0.20326677560806275, "num_tokens": 1823974.0, "step": 2155 }, { "entropy": 5.881820392608643, "epoch": 0.04826438155674975, "grad_norm": 1.234375, "learning_rate": 0.00035364950946963606, "loss": 5.6065, "mean_token_accuracy": 0.1908256970345974, "num_tokens": 1828532.0, "step": 2160 }, { "entropy": 5.701642608642578, "epoch": 0.04837610466220519, "grad_norm": 1.1953125, "learning_rate": 0.0003525446577142663, "loss": 5.5115, "mean_token_accuracy": 0.20846942365169524, "num_tokens": 1832678.0, "step": 2165 }, { "entropy": 5.717232418060303, "epoch": 0.04848782776766063, "grad_norm": 1.1953125, "learning_rate": 0.00035143768003293395, "loss": 5.5227, "mean_token_accuracy": 0.20353641510009765, "num_tokens": 1837118.0, "step": 2170 }, { "entropy": 5.7132915496826175, "epoch": 0.04859955087311607, "grad_norm": 1.2109375, "learning_rate": 0.0003503286067739913, "loss": 5.4338, "mean_token_accuracy": 0.20535381585359574, "num_tokens": 1841348.0, "step": 2175 }, { "entropy": 5.668986082077026, "epoch": 0.04871127397857151, "grad_norm": 1.25, "learning_rate": 0.00034921746834324193, "loss": 5.5611, "mean_token_accuracy": 0.1910241276025772, "num_tokens": 1845715.0, "step": 2180 }, { "entropy": 5.724797916412354, "epoch": 0.048822997084026945, "grad_norm": 1.234375, "learning_rate": 0.0003481042952031072, "loss": 5.5269, "mean_token_accuracy": 0.1976793333888054, "num_tokens": 1850028.0, "step": 2185 }, { "entropy": 5.77208890914917, "epoch": 0.04893472018948239, "grad_norm": 1.296875, "learning_rate": 0.0003469891178717911, "loss": 5.5548, "mean_token_accuracy": 0.1952129825949669, "num_tokens": 1854331.0, "step": 2190 }, { "entropy": 5.690452289581299, "epoch": 0.049046443294937826, "grad_norm": 1.3515625, "learning_rate": 0.0003458719669224436, "loss": 5.4759, "mean_token_accuracy": 0.21617792248725892, "num_tokens": 1858740.0, "step": 2195 }, { "entropy": 5.787473392486572, "epoch": 0.04915816640039326, "grad_norm": 1.2578125, "learning_rate": 0.0003447528729823221, "loss": 5.6273, "mean_token_accuracy": 0.19919337928295136, "num_tokens": 1863091.0, "step": 2200 }, { "entropy": 5.811230134963989, "epoch": 0.04926988950584871, "grad_norm": 1.2890625, "learning_rate": 0.0003436318667319525, "loss": 5.5562, "mean_token_accuracy": 0.1929182305932045, "num_tokens": 1867164.0, "step": 2205 }, { "entropy": 5.705197381973266, "epoch": 0.049381612611304145, "grad_norm": 1.3515625, "learning_rate": 0.00034250897890428716, "loss": 5.6218, "mean_token_accuracy": 0.18770090788602828, "num_tokens": 1871614.0, "step": 2210 }, { "entropy": 5.780409431457519, "epoch": 0.04949333571675958, "grad_norm": 1.1875, "learning_rate": 0.0003413842402838633, "loss": 5.6555, "mean_token_accuracy": 0.18250572085380554, "num_tokens": 1876315.0, "step": 2215 }, { "entropy": 5.786741590499878, "epoch": 0.049605058822215026, "grad_norm": 1.28125, "learning_rate": 0.00034025768170595834, "loss": 5.5971, "mean_token_accuracy": 0.19007931649684906, "num_tokens": 1880404.0, "step": 2220 }, { "entropy": 5.8036340236663815, "epoch": 0.04971678192767046, "grad_norm": 1.2109375, "learning_rate": 0.0003391293340557446, "loss": 5.5786, "mean_token_accuracy": 0.1949792042374611, "num_tokens": 1885056.0, "step": 2225 }, { "entropy": 5.699591016769409, "epoch": 0.0498285050331259, "grad_norm": 1.21875, "learning_rate": 0.0003379992282674431, "loss": 5.486, "mean_token_accuracy": 0.19173632711172103, "num_tokens": 1889170.0, "step": 2230 }, { "entropy": 5.668955135345459, "epoch": 0.04994022813858134, "grad_norm": 1.359375, "learning_rate": 0.0003368673953234749, "loss": 5.4143, "mean_token_accuracy": 0.203122578561306, "num_tokens": 1893344.0, "step": 2235 }, { "entropy": 5.6577390193939205, "epoch": 0.05005195124403678, "grad_norm": 1.421875, "learning_rate": 0.00033573386625361176, "loss": 5.5016, "mean_token_accuracy": 0.20062802582979203, "num_tokens": 1897399.0, "step": 2240 }, { "entropy": 5.685666561126709, "epoch": 0.05016367434949222, "grad_norm": 1.21875, "learning_rate": 0.00033459867213412567, "loss": 5.5944, "mean_token_accuracy": 0.19337151050567628, "num_tokens": 1901687.0, "step": 2245 }, { "entropy": 5.606955575942993, "epoch": 0.050275397454947655, "grad_norm": 1.3515625, "learning_rate": 0.000333461844086937, "loss": 5.3316, "mean_token_accuracy": 0.20973291248083115, "num_tokens": 1905556.0, "step": 2250 }, { "entropy": 5.688958406448364, "epoch": 0.0503871205604031, "grad_norm": 1.421875, "learning_rate": 0.00033232341327876097, "loss": 5.4847, "mean_token_accuracy": 0.20489684492349625, "num_tokens": 1909477.0, "step": 2255 }, { "entropy": 5.79883189201355, "epoch": 0.05049884366585854, "grad_norm": 1.265625, "learning_rate": 0.0003311834109202531, "loss": 5.5427, "mean_token_accuracy": 0.19271014332771302, "num_tokens": 1913593.0, "step": 2260 }, { "entropy": 5.727897787094117, "epoch": 0.050610566771313974, "grad_norm": 1.4609375, "learning_rate": 0.00033004186826515416, "loss": 5.6088, "mean_token_accuracy": 0.19398681819438934, "num_tokens": 1917853.0, "step": 2265 }, { "entropy": 5.713510322570801, "epoch": 0.05072228987676942, "grad_norm": 1.34375, "learning_rate": 0.0003288988166094324, "loss": 5.4865, "mean_token_accuracy": 0.19069691747426987, "num_tokens": 1922075.0, "step": 2270 }, { "entropy": 5.742081880569458, "epoch": 0.050834012982224855, "grad_norm": 1.3046875, "learning_rate": 0.00032775428729042656, "loss": 5.5265, "mean_token_accuracy": 0.19670794606208802, "num_tokens": 1926595.0, "step": 2275 }, { "entropy": 5.659421730041504, "epoch": 0.05094573608768029, "grad_norm": 1.21875, "learning_rate": 0.000326608311685986, "loss": 5.4308, "mean_token_accuracy": 0.21417462676763535, "num_tokens": 1930748.0, "step": 2280 }, { "entropy": 5.7727135181427, "epoch": 0.05105745919313573, "grad_norm": 1.3046875, "learning_rate": 0.0003254609212136108, "loss": 5.5924, "mean_token_accuracy": 0.19971541166305543, "num_tokens": 1935243.0, "step": 2285 }, { "entropy": 5.814140462875367, "epoch": 0.05116918229859117, "grad_norm": 1.1484375, "learning_rate": 0.00032431214732959036, "loss": 5.6066, "mean_token_accuracy": 0.18658054620027542, "num_tokens": 1939932.0, "step": 2290 }, { "entropy": 5.821799945831299, "epoch": 0.05128090540404661, "grad_norm": 1.296875, "learning_rate": 0.000323162021528141, "loss": 5.5663, "mean_token_accuracy": 0.19208056181669236, "num_tokens": 1944021.0, "step": 2295 }, { "entropy": 5.667191028594971, "epoch": 0.05139262850950205, "grad_norm": 1.296875, "learning_rate": 0.00032201057534054264, "loss": 5.4898, "mean_token_accuracy": 0.19366947710514068, "num_tokens": 1948339.0, "step": 2300 }, { "entropy": 5.712211561203003, "epoch": 0.05150435161495749, "grad_norm": 1.3828125, "learning_rate": 0.00032085784033427414, "loss": 5.641, "mean_token_accuracy": 0.1895766705274582, "num_tokens": 1952489.0, "step": 2305 }, { "entropy": 5.688895845413208, "epoch": 0.05161607472041293, "grad_norm": 1.2109375, "learning_rate": 0.0003197038481121478, "loss": 5.4639, "mean_token_accuracy": 0.19564596861600875, "num_tokens": 1956765.0, "step": 2310 }, { "entropy": 5.784148550033569, "epoch": 0.051727797825868366, "grad_norm": 1.265625, "learning_rate": 0.0003185486303114436, "loss": 5.5065, "mean_token_accuracy": 0.19699872732162477, "num_tokens": 1960490.0, "step": 2315 }, { "entropy": 5.768551969528199, "epoch": 0.05183952093132381, "grad_norm": 1.3984375, "learning_rate": 0.0003173922186030409, "loss": 5.5974, "mean_token_accuracy": 0.18267382681369781, "num_tokens": 1964452.0, "step": 2320 }, { "entropy": 5.775525951385498, "epoch": 0.05195124403677925, "grad_norm": 1.28125, "learning_rate": 0.000316234644690551, "loss": 5.5279, "mean_token_accuracy": 0.20707689225673676, "num_tokens": 1968765.0, "step": 2325 }, { "entropy": 5.656964111328125, "epoch": 0.052062967142234684, "grad_norm": 1.1875, "learning_rate": 0.0003150759403094473, "loss": 5.3023, "mean_token_accuracy": 0.20677033066749573, "num_tokens": 1972696.0, "step": 2330 }, { "entropy": 5.731927442550659, "epoch": 0.05217469024769013, "grad_norm": 1.2734375, "learning_rate": 0.00031391613722619587, "loss": 5.6455, "mean_token_accuracy": 0.1690948113799095, "num_tokens": 1976873.0, "step": 2335 }, { "entropy": 5.701600790023804, "epoch": 0.052286413353145565, "grad_norm": 1.21875, "learning_rate": 0.000312755267237384, "loss": 5.4535, "mean_token_accuracy": 0.20874593853950502, "num_tokens": 1981203.0, "step": 2340 }, { "entropy": 5.716491413116455, "epoch": 0.052398136458601, "grad_norm": 1.203125, "learning_rate": 0.0003115933621688488, "loss": 5.4959, "mean_token_accuracy": 0.19572610706090926, "num_tokens": 1985311.0, "step": 2345 }, { "entropy": 5.722491359710693, "epoch": 0.05250985956405644, "grad_norm": 1.3125, "learning_rate": 0.00031043045387480487, "loss": 5.487, "mean_token_accuracy": 0.19076797217130662, "num_tokens": 1989525.0, "step": 2350 }, { "entropy": 5.713915491104126, "epoch": 0.052621582669511884, "grad_norm": 1.2890625, "learning_rate": 0.0003092665742369703, "loss": 5.5469, "mean_token_accuracy": 0.19271685034036637, "num_tokens": 1993322.0, "step": 2355 }, { "entropy": 5.756639909744263, "epoch": 0.05273330577496732, "grad_norm": 1.296875, "learning_rate": 0.00030810175516369343, "loss": 5.5986, "mean_token_accuracy": 0.19009712785482408, "num_tokens": 1997360.0, "step": 2360 }, { "entropy": 5.864648628234863, "epoch": 0.05284502888042276, "grad_norm": 1.3671875, "learning_rate": 0.0003069360285890775, "loss": 5.4436, "mean_token_accuracy": 0.20150963515043258, "num_tokens": 2001867.0, "step": 2365 }, { "entropy": 5.802446031570435, "epoch": 0.0529567519858782, "grad_norm": 1.3046875, "learning_rate": 0.00030576942647210547, "loss": 5.6381, "mean_token_accuracy": 0.19385351836681367, "num_tokens": 2005729.0, "step": 2370 }, { "entropy": 5.738719177246094, "epoch": 0.05306847509133364, "grad_norm": 1.265625, "learning_rate": 0.00030460198079576355, "loss": 5.5142, "mean_token_accuracy": 0.1945842370390892, "num_tokens": 2009839.0, "step": 2375 }, { "entropy": 5.718826341629028, "epoch": 0.053180198196789076, "grad_norm": 1.359375, "learning_rate": 0.0003034337235661648, "loss": 5.4732, "mean_token_accuracy": 0.1891820028424263, "num_tokens": 2013967.0, "step": 2380 }, { "entropy": 5.774100112915039, "epoch": 0.05329192130224452, "grad_norm": 1.3828125, "learning_rate": 0.0003022646868116714, "loss": 5.5776, "mean_token_accuracy": 0.19752005487680435, "num_tokens": 2018353.0, "step": 2385 }, { "entropy": 5.8372434139251705, "epoch": 0.05340364440769996, "grad_norm": 1.4765625, "learning_rate": 0.0003010949025820163, "loss": 5.641, "mean_token_accuracy": 0.18861606419086457, "num_tokens": 2022171.0, "step": 2390 }, { "entropy": 5.75879545211792, "epoch": 0.053515367513155394, "grad_norm": 1.390625, "learning_rate": 0.0002999244029474252, "loss": 5.547, "mean_token_accuracy": 0.20157204419374466, "num_tokens": 2026341.0, "step": 2395 }, { "entropy": 5.830027294158936, "epoch": 0.05362709061861083, "grad_norm": 1.1953125, "learning_rate": 0.00029875321999773684, "loss": 5.588, "mean_token_accuracy": 0.19347797334194183, "num_tokens": 2031021.0, "step": 2400 }, { "entropy": 5.816708278656006, "epoch": 0.053738813724066276, "grad_norm": 1.3046875, "learning_rate": 0.00029758138584152333, "loss": 5.6899, "mean_token_accuracy": 0.18223569244146348, "num_tokens": 2035653.0, "step": 2405 }, { "entropy": 5.729998159408569, "epoch": 0.05385053682952171, "grad_norm": 1.265625, "learning_rate": 0.0002964089326052102, "loss": 5.6188, "mean_token_accuracy": 0.20222849845886232, "num_tokens": 2039728.0, "step": 2410 }, { "entropy": 5.713871240615845, "epoch": 0.05396225993497715, "grad_norm": 1.4140625, "learning_rate": 0.0002952358924321949, "loss": 5.4909, "mean_token_accuracy": 0.19180112928152085, "num_tokens": 2044078.0, "step": 2415 }, { "entropy": 5.726597166061401, "epoch": 0.054073983040432594, "grad_norm": 1.3046875, "learning_rate": 0.00029406229748196657, "loss": 5.3667, "mean_token_accuracy": 0.21022001802921295, "num_tokens": 2048138.0, "step": 2420 }, { "entropy": 5.739075231552124, "epoch": 0.05418570614588803, "grad_norm": 1.21875, "learning_rate": 0.0002928881799292235, "loss": 5.6663, "mean_token_accuracy": 0.188392074406147, "num_tokens": 2052837.0, "step": 2425 }, { "entropy": 5.754153871536255, "epoch": 0.05429742925134347, "grad_norm": 1.359375, "learning_rate": 0.00029171357196299154, "loss": 5.5659, "mean_token_accuracy": 0.20061070024967192, "num_tokens": 2056715.0, "step": 2430 }, { "entropy": 5.690628623962402, "epoch": 0.05440915235679891, "grad_norm": 1.234375, "learning_rate": 0.0002905385057857414, "loss": 5.5361, "mean_token_accuracy": 0.1939275875687599, "num_tokens": 2060508.0, "step": 2435 }, { "entropy": 5.781807994842529, "epoch": 0.05452087546225435, "grad_norm": 1.2578125, "learning_rate": 0.0002893630136125058, "loss": 5.5752, "mean_token_accuracy": 0.18510538935661316, "num_tokens": 2065050.0, "step": 2440 }, { "entropy": 5.740582275390625, "epoch": 0.054632598567709786, "grad_norm": 1.1875, "learning_rate": 0.0002881871276699967, "loss": 5.4727, "mean_token_accuracy": 0.1987502843141556, "num_tokens": 2069488.0, "step": 2445 }, { "entropy": 5.70595965385437, "epoch": 0.05474432167316523, "grad_norm": 1.3203125, "learning_rate": 0.00028701088019572114, "loss": 5.5521, "mean_token_accuracy": 0.19443101733922957, "num_tokens": 2073605.0, "step": 2450 }, { "entropy": 5.707414436340332, "epoch": 0.05485604477862067, "grad_norm": 1.234375, "learning_rate": 0.0002858343034370977, "loss": 5.4163, "mean_token_accuracy": 0.20107322484254836, "num_tokens": 2077721.0, "step": 2455 }, { "entropy": 5.679768180847168, "epoch": 0.054967767884076105, "grad_norm": 1.296875, "learning_rate": 0.00028465742965057267, "loss": 5.5498, "mean_token_accuracy": 0.19062326103448868, "num_tokens": 2081945.0, "step": 2460 }, { "entropy": 5.776157379150391, "epoch": 0.05507949098953154, "grad_norm": 1.2578125, "learning_rate": 0.00028348029110073533, "loss": 5.6399, "mean_token_accuracy": 0.189193694293499, "num_tokens": 2086184.0, "step": 2465 }, { "entropy": 5.761434888839721, "epoch": 0.055191214094986986, "grad_norm": 1.3828125, "learning_rate": 0.00028230292005943365, "loss": 5.4473, "mean_token_accuracy": 0.20474444925785065, "num_tokens": 2090271.0, "step": 2470 }, { "entropy": 5.625124883651734, "epoch": 0.05530293720044242, "grad_norm": 1.2265625, "learning_rate": 0.00028112534880488945, "loss": 5.4348, "mean_token_accuracy": 0.19888102859258652, "num_tokens": 2094427.0, "step": 2475 }, { "entropy": 5.551406145095825, "epoch": 0.05541466030589786, "grad_norm": 1.25, "learning_rate": 0.0002799476096208137, "loss": 5.2503, "mean_token_accuracy": 0.22414482980966569, "num_tokens": 2098795.0, "step": 2480 }, { "entropy": 5.698645448684692, "epoch": 0.055526383411353304, "grad_norm": 1.3125, "learning_rate": 0.00027876973479552087, "loss": 5.4507, "mean_token_accuracy": 0.21797254532575608, "num_tokens": 2103190.0, "step": 2485 }, { "entropy": 5.7277178287506105, "epoch": 0.05563810651680874, "grad_norm": 1.2578125, "learning_rate": 0.00027759175662104424, "loss": 5.3879, "mean_token_accuracy": 0.2203633740544319, "num_tokens": 2107253.0, "step": 2490 }, { "entropy": 5.6748926639556885, "epoch": 0.05574982962226418, "grad_norm": 1.2265625, "learning_rate": 0.0002764137073922508, "loss": 5.572, "mean_token_accuracy": 0.19839244335889816, "num_tokens": 2111361.0, "step": 2495 }, { "entropy": 5.68821496963501, "epoch": 0.05586155272771962, "grad_norm": 1.3046875, "learning_rate": 0.00027523561940595505, "loss": 5.4097, "mean_token_accuracy": 0.2047291651368141, "num_tokens": 2115586.0, "step": 2500 }, { "entropy": 5.779299640655518, "epoch": 0.05597327583317506, "grad_norm": 1.2421875, "learning_rate": 0.0002740575249600342, "loss": 5.5373, "mean_token_accuracy": 0.1977283999323845, "num_tokens": 2119746.0, "step": 2505 }, { "entropy": 5.650565814971924, "epoch": 0.0560849989386305, "grad_norm": 1.2421875, "learning_rate": 0.00027287945635254263, "loss": 5.5265, "mean_token_accuracy": 0.19489531219005585, "num_tokens": 2124367.0, "step": 2510 }, { "entropy": 5.795668697357177, "epoch": 0.05619672204408594, "grad_norm": 1.3125, "learning_rate": 0.00027170144588082635, "loss": 5.5271, "mean_token_accuracy": 0.19151871800422668, "num_tokens": 2128772.0, "step": 2515 }, { "entropy": 5.783979797363282, "epoch": 0.05630844514954138, "grad_norm": 1.234375, "learning_rate": 0.00027052352584063763, "loss": 5.4057, "mean_token_accuracy": 0.20860070288181304, "num_tokens": 2132943.0, "step": 2520 }, { "entropy": 5.579121398925781, "epoch": 0.056420168254996815, "grad_norm": 1.2890625, "learning_rate": 0.00026934572852524907, "loss": 5.3935, "mean_token_accuracy": 0.2062055453658104, "num_tokens": 2137332.0, "step": 2525 }, { "entropy": 5.585285711288452, "epoch": 0.05653189136045225, "grad_norm": 1.3046875, "learning_rate": 0.00026816808622456937, "loss": 5.4183, "mean_token_accuracy": 0.20738962888717652, "num_tokens": 2141459.0, "step": 2530 }, { "entropy": 5.581014633178711, "epoch": 0.056643614465907696, "grad_norm": 1.3671875, "learning_rate": 0.0002669906312242569, "loss": 5.3718, "mean_token_accuracy": 0.20966480523347855, "num_tokens": 2145450.0, "step": 2535 }, { "entropy": 5.709204387664795, "epoch": 0.05675533757136313, "grad_norm": 1.3046875, "learning_rate": 0.00026581339580483525, "loss": 5.5215, "mean_token_accuracy": 0.19486008882522582, "num_tokens": 2149908.0, "step": 2540 }, { "entropy": 5.81135311126709, "epoch": 0.05686706067681857, "grad_norm": 1.25, "learning_rate": 0.0002646364122408082, "loss": 5.6473, "mean_token_accuracy": 0.18592869490385056, "num_tokens": 2154641.0, "step": 2545 }, { "entropy": 5.743757867813111, "epoch": 0.056978783782274015, "grad_norm": 1.3984375, "learning_rate": 0.0002634597127997749, "loss": 5.4325, "mean_token_accuracy": 0.20286497473716736, "num_tokens": 2158558.0, "step": 2550 }, { "entropy": 5.736222839355468, "epoch": 0.05709050688772945, "grad_norm": 1.2265625, "learning_rate": 0.0002622833297415445, "loss": 5.4822, "mean_token_accuracy": 0.20705748796463014, "num_tokens": 2162953.0, "step": 2555 }, { "entropy": 5.728305435180664, "epoch": 0.05720222999318489, "grad_norm": 1.375, "learning_rate": 0.0002611072953172531, "loss": 5.5456, "mean_token_accuracy": 0.19390425831079483, "num_tokens": 2167438.0, "step": 2560 }, { "entropy": 5.734443330764771, "epoch": 0.05731395309864033, "grad_norm": 1.3203125, "learning_rate": 0.00025993164176847845, "loss": 5.464, "mean_token_accuracy": 0.20087790936231614, "num_tokens": 2171603.0, "step": 2565 }, { "entropy": 5.737977695465088, "epoch": 0.05742567620409577, "grad_norm": 1.25, "learning_rate": 0.0002587564013263564, "loss": 5.498, "mean_token_accuracy": 0.19558269530534744, "num_tokens": 2175976.0, "step": 2570 }, { "entropy": 5.766001796722412, "epoch": 0.05753739930955121, "grad_norm": 1.4453125, "learning_rate": 0.0002575816062106974, "loss": 5.3427, "mean_token_accuracy": 0.2205933377146721, "num_tokens": 2179626.0, "step": 2575 }, { "entropy": 5.643783760070801, "epoch": 0.057649122415006644, "grad_norm": 1.28125, "learning_rate": 0.00025640728862910293, "loss": 5.4789, "mean_token_accuracy": 0.20106479972600938, "num_tokens": 2183903.0, "step": 2580 }, { "entropy": 5.61820912361145, "epoch": 0.05776084552046209, "grad_norm": 1.203125, "learning_rate": 0.00025523348077608285, "loss": 5.5113, "mean_token_accuracy": 0.1954667776823044, "num_tokens": 2188232.0, "step": 2585 }, { "entropy": 5.654152536392212, "epoch": 0.057872568625917525, "grad_norm": 1.28125, "learning_rate": 0.00025406021483217225, "loss": 5.4086, "mean_token_accuracy": 0.2141653209924698, "num_tokens": 2192465.0, "step": 2590 }, { "entropy": 5.7762407779693605, "epoch": 0.05798429173137296, "grad_norm": 1.3203125, "learning_rate": 0.00025288752296304963, "loss": 5.4788, "mean_token_accuracy": 0.19897868633270263, "num_tokens": 2196597.0, "step": 2595 }, { "entropy": 5.663915967941284, "epoch": 0.05809601483682841, "grad_norm": 1.421875, "learning_rate": 0.000251715437318655, "loss": 5.4153, "mean_token_accuracy": 0.19493801891803741, "num_tokens": 2200590.0, "step": 2600 }, { "entropy": 5.633232975006104, "epoch": 0.058207737942283844, "grad_norm": 1.4609375, "learning_rate": 0.0002505439900323084, "loss": 5.3918, "mean_token_accuracy": 0.204731585085392, "num_tokens": 2204897.0, "step": 2605 }, { "entropy": 5.740216207504273, "epoch": 0.05831946104773928, "grad_norm": 1.328125, "learning_rate": 0.00024937321321982894, "loss": 5.5004, "mean_token_accuracy": 0.1938529819250107, "num_tokens": 2209187.0, "step": 2610 }, { "entropy": 5.715686464309693, "epoch": 0.058431184153194725, "grad_norm": 1.3671875, "learning_rate": 0.00024820313897865433, "loss": 5.5595, "mean_token_accuracy": 0.20210601687431334, "num_tokens": 2213496.0, "step": 2615 }, { "entropy": 5.646053171157837, "epoch": 0.05854290725865016, "grad_norm": 1.25, "learning_rate": 0.00024703379938696105, "loss": 5.3267, "mean_token_accuracy": 0.2136288985610008, "num_tokens": 2217612.0, "step": 2620 }, { "entropy": 5.582569265365601, "epoch": 0.0586546303641056, "grad_norm": 1.1875, "learning_rate": 0.00024586522650278447, "loss": 5.3083, "mean_token_accuracy": 0.2052677869796753, "num_tokens": 2221830.0, "step": 2625 }, { "entropy": 5.684707498550415, "epoch": 0.05876635346956104, "grad_norm": 1.1953125, "learning_rate": 0.00024469745236314064, "loss": 5.3923, "mean_token_accuracy": 0.2086835339665413, "num_tokens": 2226552.0, "step": 2630 }, { "entropy": 5.722059297561645, "epoch": 0.05887807657501648, "grad_norm": 1.5234375, "learning_rate": 0.00024353050898314767, "loss": 5.498, "mean_token_accuracy": 0.20146586149930953, "num_tokens": 2230785.0, "step": 2635 }, { "entropy": 5.678656578063965, "epoch": 0.05898979968047192, "grad_norm": 1.375, "learning_rate": 0.00024236442835514743, "loss": 5.3457, "mean_token_accuracy": 0.20883162021636964, "num_tokens": 2235103.0, "step": 2640 }, { "entropy": 5.732641696929932, "epoch": 0.059101522785927355, "grad_norm": 1.328125, "learning_rate": 0.00024119924244782965, "loss": 5.4506, "mean_token_accuracy": 0.20166707560420036, "num_tokens": 2239699.0, "step": 2645 }, { "entropy": 5.742127323150635, "epoch": 0.0592132458913828, "grad_norm": 1.28125, "learning_rate": 0.00024003498320535462, "loss": 5.5482, "mean_token_accuracy": 0.18562940657138824, "num_tokens": 2244112.0, "step": 2650 }, { "entropy": 5.637723159790039, "epoch": 0.059324968996838236, "grad_norm": 1.4375, "learning_rate": 0.00023887168254647727, "loss": 5.3385, "mean_token_accuracy": 0.21312180608510972, "num_tokens": 2247902.0, "step": 2655 }, { "entropy": 5.600325059890747, "epoch": 0.05943669210229367, "grad_norm": 1.2109375, "learning_rate": 0.00023770937236367308, "loss": 5.4058, "mean_token_accuracy": 0.1909279465675354, "num_tokens": 2251966.0, "step": 2660 }, { "entropy": 5.647561836242676, "epoch": 0.05954841520774912, "grad_norm": 1.25, "learning_rate": 0.00023654808452226278, "loss": 5.4118, "mean_token_accuracy": 0.20381290316581727, "num_tokens": 2256579.0, "step": 2665 }, { "entropy": 5.709055614471436, "epoch": 0.059660138313204554, "grad_norm": 1.1171875, "learning_rate": 0.00023538785085953912, "loss": 5.4918, "mean_token_accuracy": 0.20567824095487594, "num_tokens": 2261466.0, "step": 2670 }, { "entropy": 5.651337146759033, "epoch": 0.05977186141865999, "grad_norm": 1.1796875, "learning_rate": 0.00023422870318389404, "loss": 5.4168, "mean_token_accuracy": 0.20561701506376268, "num_tokens": 2266547.0, "step": 2675 }, { "entropy": 5.723851871490479, "epoch": 0.059883584524115435, "grad_norm": 1.328125, "learning_rate": 0.0002330706732739468, "loss": 5.5041, "mean_token_accuracy": 0.1933462366461754, "num_tokens": 2270686.0, "step": 2680 }, { "entropy": 5.628253173828125, "epoch": 0.05999530762957087, "grad_norm": 1.3203125, "learning_rate": 0.00023191379287767211, "loss": 5.3672, "mean_token_accuracy": 0.21610769629478455, "num_tokens": 2274819.0, "step": 2685 }, { "entropy": 5.6342497825622555, "epoch": 0.06010703073502631, "grad_norm": 1.3359375, "learning_rate": 0.0002307580937115305, "loss": 5.3348, "mean_token_accuracy": 0.21631180346012116, "num_tokens": 2278991.0, "step": 2690 }, { "entropy": 5.7209268569946286, "epoch": 0.06021875384048175, "grad_norm": 1.265625, "learning_rate": 0.00022960360745959846, "loss": 5.4823, "mean_token_accuracy": 0.2016025885939598, "num_tokens": 2283300.0, "step": 2695 }, { "entropy": 5.7764557838439945, "epoch": 0.06033047694593719, "grad_norm": 1.15625, "learning_rate": 0.00022845036577269972, "loss": 5.5319, "mean_token_accuracy": 0.19847869277000427, "num_tokens": 2288263.0, "step": 2700 }, { "entropy": 5.787051963806152, "epoch": 0.06044220005139263, "grad_norm": 1.2578125, "learning_rate": 0.00022729840026753777, "loss": 5.4309, "mean_token_accuracy": 0.1996562197804451, "num_tokens": 2292413.0, "step": 2705 }, { "entropy": 5.728420066833496, "epoch": 0.060553923156848065, "grad_norm": 1.2734375, "learning_rate": 0.0002261477425258287, "loss": 5.444, "mean_token_accuracy": 0.20907077044248581, "num_tokens": 2297154.0, "step": 2710 }, { "entropy": 5.6644935131073, "epoch": 0.06066564626230351, "grad_norm": 1.3125, "learning_rate": 0.0002249984240934358, "loss": 5.4308, "mean_token_accuracy": 0.2125580057501793, "num_tokens": 2301162.0, "step": 2715 }, { "entropy": 5.746449279785156, "epoch": 0.060777369367758946, "grad_norm": 1.2734375, "learning_rate": 0.00022385047647950464, "loss": 5.4339, "mean_token_accuracy": 0.1966474771499634, "num_tokens": 2305827.0, "step": 2720 }, { "entropy": 5.712580442428589, "epoch": 0.06088909247321438, "grad_norm": 1.125, "learning_rate": 0.0002227039311555986, "loss": 5.4109, "mean_token_accuracy": 0.1991946816444397, "num_tokens": 2310167.0, "step": 2725 }, { "entropy": 5.612943077087403, "epoch": 0.06100081557866983, "grad_norm": 1.3046875, "learning_rate": 0.0002215588195548372, "loss": 5.3646, "mean_token_accuracy": 0.21367968916893004, "num_tokens": 2314324.0, "step": 2730 }, { "entropy": 5.602614831924439, "epoch": 0.061112538684125264, "grad_norm": 1.453125, "learning_rate": 0.00022041517307103337, "loss": 5.4077, "mean_token_accuracy": 0.1989472836256027, "num_tokens": 2318316.0, "step": 2735 }, { "entropy": 5.596106052398682, "epoch": 0.0612242617895807, "grad_norm": 1.28125, "learning_rate": 0.0002192730230578331, "loss": 5.3815, "mean_token_accuracy": 0.21190638095140457, "num_tokens": 2322450.0, "step": 2740 }, { "entropy": 5.6977253437042235, "epoch": 0.061335984895036146, "grad_norm": 1.3515625, "learning_rate": 0.0002181324008278559, "loss": 5.5464, "mean_token_accuracy": 0.20245341062545777, "num_tokens": 2326849.0, "step": 2745 }, { "entropy": 5.6974265575408936, "epoch": 0.06144770800049158, "grad_norm": 1.3359375, "learning_rate": 0.00021699333765183655, "loss": 5.3075, "mean_token_accuracy": 0.21131206750869752, "num_tokens": 2331326.0, "step": 2750 }, { "entropy": 5.609620380401611, "epoch": 0.06155943110594702, "grad_norm": 1.3828125, "learning_rate": 0.0002158558647577673, "loss": 5.301, "mean_token_accuracy": 0.21574847102165223, "num_tokens": 2335443.0, "step": 2755 }, { "entropy": 5.723866319656372, "epoch": 0.06167115421140246, "grad_norm": 1.34375, "learning_rate": 0.00021472001333004215, "loss": 5.5859, "mean_token_accuracy": 0.19365599304437636, "num_tokens": 2339836.0, "step": 2760 }, { "entropy": 5.684416246414185, "epoch": 0.0617828773168579, "grad_norm": 1.21875, "learning_rate": 0.00021358581450860186, "loss": 5.417, "mean_token_accuracy": 0.2063658282160759, "num_tokens": 2344125.0, "step": 2765 }, { "entropy": 5.6221246242523195, "epoch": 0.06189460042231334, "grad_norm": 1.3125, "learning_rate": 0.0002124532993880799, "loss": 5.3519, "mean_token_accuracy": 0.20936380624771117, "num_tokens": 2348375.0, "step": 2770 }, { "entropy": 5.616058301925659, "epoch": 0.062006323527768775, "grad_norm": 1.2734375, "learning_rate": 0.00021132249901695044, "loss": 5.26, "mean_token_accuracy": 0.22578572183847428, "num_tokens": 2352315.0, "step": 2775 }, { "entropy": 5.6582283020019535, "epoch": 0.06211804663322422, "grad_norm": 1.375, "learning_rate": 0.00021019344439667705, "loss": 5.3208, "mean_token_accuracy": 0.22070808410644532, "num_tokens": 2356351.0, "step": 2780 }, { "entropy": 5.663221788406372, "epoch": 0.062229769738679656, "grad_norm": 1.34375, "learning_rate": 0.00020906616648086213, "loss": 5.3256, "mean_token_accuracy": 0.20464612394571305, "num_tokens": 2360690.0, "step": 2785 }, { "entropy": 5.712641191482544, "epoch": 0.062341492844135094, "grad_norm": 1.2890625, "learning_rate": 0.00020794069617439942, "loss": 5.3701, "mean_token_accuracy": 0.2112012192606926, "num_tokens": 2364581.0, "step": 2790 }, { "entropy": 5.671883583068848, "epoch": 0.06245321594959054, "grad_norm": 1.4140625, "learning_rate": 0.00020681706433262593, "loss": 5.4907, "mean_token_accuracy": 0.21165458709001542, "num_tokens": 2368799.0, "step": 2795 }, { "entropy": 5.652011823654175, "epoch": 0.06256493905504597, "grad_norm": 1.390625, "learning_rate": 0.00020569530176047602, "loss": 5.3811, "mean_token_accuracy": 0.2047820582985878, "num_tokens": 2372843.0, "step": 2800 }, { "entropy": 5.629188394546508, "epoch": 0.06267666216050141, "grad_norm": 1.3515625, "learning_rate": 0.0002045754392116374, "loss": 5.2659, "mean_token_accuracy": 0.22178127020597457, "num_tokens": 2376998.0, "step": 2805 }, { "entropy": 5.74638090133667, "epoch": 0.06278838526595686, "grad_norm": 1.3203125, "learning_rate": 0.00020345750738770757, "loss": 5.4709, "mean_token_accuracy": 0.20035234242677688, "num_tokens": 2381511.0, "step": 2810 }, { "entropy": 5.746858596801758, "epoch": 0.06290010837141229, "grad_norm": 1.296875, "learning_rate": 0.00020234153693735214, "loss": 5.4442, "mean_token_accuracy": 0.21169123500585557, "num_tokens": 2385352.0, "step": 2815 }, { "entropy": 5.596214485168457, "epoch": 0.06301183147686773, "grad_norm": 1.28125, "learning_rate": 0.0002012275584554647, "loss": 5.3718, "mean_token_accuracy": 0.20885302722454072, "num_tokens": 2389631.0, "step": 2820 }, { "entropy": 5.635304594039917, "epoch": 0.06312355458232317, "grad_norm": 1.265625, "learning_rate": 0.00020011560248232803, "loss": 5.5109, "mean_token_accuracy": 0.19816787391901017, "num_tokens": 2394253.0, "step": 2825 }, { "entropy": 5.660125255584717, "epoch": 0.0632352776877786, "grad_norm": 1.3359375, "learning_rate": 0.00019900569950277692, "loss": 5.3589, "mean_token_accuracy": 0.21076688766479493, "num_tokens": 2398397.0, "step": 2830 }, { "entropy": 5.612528276443482, "epoch": 0.06334700079323405, "grad_norm": 1.2890625, "learning_rate": 0.00019789787994536228, "loss": 5.3586, "mean_token_accuracy": 0.21716920733451844, "num_tokens": 2402624.0, "step": 2835 }, { "entropy": 5.602710866928101, "epoch": 0.06345872389868949, "grad_norm": 1.4375, "learning_rate": 0.00019679217418151667, "loss": 5.3197, "mean_token_accuracy": 0.20867802053689957, "num_tokens": 2406841.0, "step": 2840 }, { "entropy": 5.7144159317016605, "epoch": 0.06357044700414492, "grad_norm": 1.390625, "learning_rate": 0.00019568861252472236, "loss": 5.3641, "mean_token_accuracy": 0.20947953015565873, "num_tokens": 2410760.0, "step": 2845 }, { "entropy": 5.546571922302246, "epoch": 0.06368217010960037, "grad_norm": 1.2890625, "learning_rate": 0.00019458722522967952, "loss": 5.2964, "mean_token_accuracy": 0.21963961869478227, "num_tokens": 2415022.0, "step": 2850 }, { "entropy": 5.6442108154296875, "epoch": 0.06379389321505581, "grad_norm": 1.3359375, "learning_rate": 0.00019348804249147723, "loss": 5.4682, "mean_token_accuracy": 0.2053038701415062, "num_tokens": 2419569.0, "step": 2855 }, { "entropy": 5.556906986236572, "epoch": 0.06390561632051124, "grad_norm": 1.2265625, "learning_rate": 0.0001923910944447655, "loss": 5.387, "mean_token_accuracy": 0.217524017393589, "num_tokens": 2423979.0, "step": 2860 }, { "entropy": 5.622811889648437, "epoch": 0.06401733942596669, "grad_norm": 1.0703125, "learning_rate": 0.00019129641116292928, "loss": 5.34, "mean_token_accuracy": 0.21249400526285173, "num_tokens": 2428714.0, "step": 2865 }, { "entropy": 5.612063026428222, "epoch": 0.06412906253142213, "grad_norm": 1.2421875, "learning_rate": 0.00019020402265726343, "loss": 5.3926, "mean_token_accuracy": 0.21560358256101608, "num_tokens": 2433133.0, "step": 2870 }, { "entropy": 5.733652210235595, "epoch": 0.06424078563687756, "grad_norm": 1.4140625, "learning_rate": 0.0001891139588761509, "loss": 5.3896, "mean_token_accuracy": 0.20228823721408845, "num_tokens": 2436934.0, "step": 2875 }, { "entropy": 5.791445779800415, "epoch": 0.064352508742333, "grad_norm": 1.3671875, "learning_rate": 0.00018802624970424076, "loss": 5.4891, "mean_token_accuracy": 0.19218750596046447, "num_tokens": 2441569.0, "step": 2880 }, { "entropy": 5.7009679794311525, "epoch": 0.06446423184778845, "grad_norm": 1.34375, "learning_rate": 0.00018694092496162945, "loss": 5.4602, "mean_token_accuracy": 0.2004503607749939, "num_tokens": 2445672.0, "step": 2885 }, { "entropy": 5.695861387252807, "epoch": 0.06457595495324388, "grad_norm": 1.328125, "learning_rate": 0.00018585801440304306, "loss": 5.3984, "mean_token_accuracy": 0.21129112392663957, "num_tokens": 2449608.0, "step": 2890 }, { "entropy": 5.610105514526367, "epoch": 0.06468767805869932, "grad_norm": 1.3671875, "learning_rate": 0.00018477754771702165, "loss": 5.3041, "mean_token_accuracy": 0.21272615641355513, "num_tokens": 2453604.0, "step": 2895 }, { "entropy": 5.785283613204956, "epoch": 0.06479940116415477, "grad_norm": 1.296875, "learning_rate": 0.00018369955452510506, "loss": 5.542, "mean_token_accuracy": 0.19543841928243638, "num_tokens": 2457973.0, "step": 2900 }, { "entropy": 5.576959562301636, "epoch": 0.0649111242696102, "grad_norm": 1.203125, "learning_rate": 0.0001826240643810212, "loss": 5.2954, "mean_token_accuracy": 0.21963100880384445, "num_tokens": 2462123.0, "step": 2905 }, { "entropy": 5.5987739086151125, "epoch": 0.06502284737506564, "grad_norm": 1.328125, "learning_rate": 0.0001815511067698758, "loss": 5.3741, "mean_token_accuracy": 0.20394418984651566, "num_tokens": 2466404.0, "step": 2910 }, { "entropy": 5.599570846557617, "epoch": 0.06513457048052107, "grad_norm": 1.3046875, "learning_rate": 0.0001804807111073436, "loss": 5.4111, "mean_token_accuracy": 0.2101197898387909, "num_tokens": 2471086.0, "step": 2915 }, { "entropy": 5.728887939453125, "epoch": 0.06524629358597651, "grad_norm": 1.2734375, "learning_rate": 0.0001794129067388625, "loss": 5.4369, "mean_token_accuracy": 0.19458499997854234, "num_tokens": 2475411.0, "step": 2920 }, { "entropy": 5.772345447540284, "epoch": 0.06535801669143196, "grad_norm": 1.1953125, "learning_rate": 0.00017834772293882868, "loss": 5.5032, "mean_token_accuracy": 0.19811111837625503, "num_tokens": 2479742.0, "step": 2925 }, { "entropy": 5.731832504272461, "epoch": 0.06546973979688739, "grad_norm": 1.234375, "learning_rate": 0.000177285188909794, "loss": 5.5256, "mean_token_accuracy": 0.19889512807130813, "num_tokens": 2484339.0, "step": 2930 }, { "entropy": 5.6758034229278564, "epoch": 0.06558146290234283, "grad_norm": 1.28125, "learning_rate": 0.0001762253337816656, "loss": 5.4664, "mean_token_accuracy": 0.20579820573329927, "num_tokens": 2488619.0, "step": 2935 }, { "entropy": 5.765306663513184, "epoch": 0.06569318600779828, "grad_norm": 1.2890625, "learning_rate": 0.00017516818661090738, "loss": 5.5043, "mean_token_accuracy": 0.19775743186473846, "num_tokens": 2493068.0, "step": 2940 }, { "entropy": 5.652463054656982, "epoch": 0.0658049091132537, "grad_norm": 1.3359375, "learning_rate": 0.0001741137763797428, "loss": 5.2482, "mean_token_accuracy": 0.23082863986492158, "num_tokens": 2497322.0, "step": 2945 }, { "entropy": 5.812825775146484, "epoch": 0.06591663221870915, "grad_norm": 1.3984375, "learning_rate": 0.00017306213199536115, "loss": 5.5222, "mean_token_accuracy": 0.18363130688667298, "num_tokens": 2501476.0, "step": 2950 }, { "entropy": 5.639954090118408, "epoch": 0.0660283553241646, "grad_norm": 1.421875, "learning_rate": 0.0001720132822891243, "loss": 5.3021, "mean_token_accuracy": 0.21535781025886536, "num_tokens": 2505520.0, "step": 2955 }, { "entropy": 5.607745599746704, "epoch": 0.06614007842962003, "grad_norm": 1.2734375, "learning_rate": 0.0001709672560157769, "loss": 5.2646, "mean_token_accuracy": 0.21338043361902237, "num_tokens": 2509912.0, "step": 2960 }, { "entropy": 5.706130886077881, "epoch": 0.06625180153507547, "grad_norm": 1.2890625, "learning_rate": 0.00016992408185265758, "loss": 5.5395, "mean_token_accuracy": 0.19716476798057556, "num_tokens": 2514342.0, "step": 2965 }, { "entropy": 5.630351114273071, "epoch": 0.06636352464053091, "grad_norm": 1.1875, "learning_rate": 0.00016888378839891298, "loss": 5.2632, "mean_token_accuracy": 0.21412647962570192, "num_tokens": 2518771.0, "step": 2970 }, { "entropy": 5.680066061019898, "epoch": 0.06647524774598634, "grad_norm": 1.203125, "learning_rate": 0.0001678464041747137, "loss": 5.3748, "mean_token_accuracy": 0.19917938560247422, "num_tokens": 2522908.0, "step": 2975 }, { "entropy": 5.595112133026123, "epoch": 0.06658697085144179, "grad_norm": 1.3203125, "learning_rate": 0.00016681195762047223, "loss": 5.3649, "mean_token_accuracy": 0.21546784788370132, "num_tokens": 2527150.0, "step": 2980 }, { "entropy": 5.624182558059692, "epoch": 0.06669869395689723, "grad_norm": 1.296875, "learning_rate": 0.00016578047709606337, "loss": 5.2446, "mean_token_accuracy": 0.21532990038394928, "num_tokens": 2531708.0, "step": 2985 }, { "entropy": 5.688130235671997, "epoch": 0.06681041706235266, "grad_norm": 1.234375, "learning_rate": 0.00016475199088004678, "loss": 5.3917, "mean_token_accuracy": 0.20507018119096757, "num_tokens": 2536403.0, "step": 2990 }, { "entropy": 5.59664306640625, "epoch": 0.0669221401678081, "grad_norm": 1.359375, "learning_rate": 0.00016372652716889163, "loss": 5.2967, "mean_token_accuracy": 0.21951241195201873, "num_tokens": 2540527.0, "step": 2995 }, { "entropy": 5.678198194503784, "epoch": 0.06703386327326355, "grad_norm": 1.4296875, "learning_rate": 0.0001627041140762035, "loss": 5.3924, "mean_token_accuracy": 0.20448053181171416, "num_tokens": 2544603.0, "step": 3000 }, { "entropy": 5.622107076644897, "epoch": 0.06714558637871898, "grad_norm": 1.46875, "learning_rate": 0.00016168477963195382, "loss": 5.3918, "mean_token_accuracy": 0.20578134208917617, "num_tokens": 2548211.0, "step": 3005 }, { "entropy": 5.5697588443756105, "epoch": 0.06725730948417442, "grad_norm": 1.234375, "learning_rate": 0.0001606685517817114, "loss": 5.3427, "mean_token_accuracy": 0.21928378343582153, "num_tokens": 2552772.0, "step": 3010 }, { "entropy": 5.638986587524414, "epoch": 0.06736903258962987, "grad_norm": 1.390625, "learning_rate": 0.00015965545838587592, "loss": 5.3433, "mean_token_accuracy": 0.2137608751654625, "num_tokens": 2557221.0, "step": 3015 }, { "entropy": 5.617996072769165, "epoch": 0.0674807556950853, "grad_norm": 1.34375, "learning_rate": 0.00015864552721891467, "loss": 5.2909, "mean_token_accuracy": 0.22195946127176286, "num_tokens": 2561383.0, "step": 3020 }, { "entropy": 5.660844516754151, "epoch": 0.06759247880054074, "grad_norm": 1.296875, "learning_rate": 0.00015763878596860076, "loss": 5.4319, "mean_token_accuracy": 0.2059861347079277, "num_tokens": 2565688.0, "step": 3025 }, { "entropy": 5.734495162963867, "epoch": 0.06770420190599617, "grad_norm": 1.3125, "learning_rate": 0.00015663526223525412, "loss": 5.4203, "mean_token_accuracy": 0.20661102682352067, "num_tokens": 2569677.0, "step": 3030 }, { "entropy": 5.668662261962891, "epoch": 0.06781592501145162, "grad_norm": 1.4375, "learning_rate": 0.0001556349835309848, "loss": 5.3722, "mean_token_accuracy": 0.2033245787024498, "num_tokens": 2573507.0, "step": 3035 }, { "entropy": 5.6115399360656735, "epoch": 0.06792764811690706, "grad_norm": 1.125, "learning_rate": 0.0001546379772789389, "loss": 5.3547, "mean_token_accuracy": 0.2055089771747589, "num_tokens": 2578069.0, "step": 3040 }, { "entropy": 5.711817598342895, "epoch": 0.06803937122236249, "grad_norm": 1.296875, "learning_rate": 0.00015364427081254622, "loss": 5.4195, "mean_token_accuracy": 0.1933088108897209, "num_tokens": 2582054.0, "step": 3045 }, { "entropy": 5.6535242080688475, "epoch": 0.06815109432781793, "grad_norm": 1.3125, "learning_rate": 0.00015265389137477165, "loss": 5.2475, "mean_token_accuracy": 0.20738670974969864, "num_tokens": 2585729.0, "step": 3050 }, { "entropy": 5.589264392852783, "epoch": 0.06826281743327338, "grad_norm": 1.3203125, "learning_rate": 0.00015166686611736786, "loss": 5.3462, "mean_token_accuracy": 0.21424128711223603, "num_tokens": 2589872.0, "step": 3055 }, { "entropy": 5.560762739181518, "epoch": 0.06837454053872881, "grad_norm": 1.3203125, "learning_rate": 0.00015068322210013064, "loss": 5.2998, "mean_token_accuracy": 0.21292162388563157, "num_tokens": 2593616.0, "step": 3060 }, { "entropy": 5.6391003131866455, "epoch": 0.06848626364418425, "grad_norm": 1.296875, "learning_rate": 0.0001497029862901578, "loss": 5.3307, "mean_token_accuracy": 0.20281794518232346, "num_tokens": 2597907.0, "step": 3065 }, { "entropy": 5.628227758407593, "epoch": 0.0685979867496397, "grad_norm": 1.2578125, "learning_rate": 0.00014872618556110905, "loss": 5.341, "mean_token_accuracy": 0.20735297352075577, "num_tokens": 2602051.0, "step": 3070 }, { "entropy": 5.568817281723023, "epoch": 0.06870970985509513, "grad_norm": 1.3203125, "learning_rate": 0.00014775284669246992, "loss": 5.3085, "mean_token_accuracy": 0.2230152130126953, "num_tokens": 2606214.0, "step": 3075 }, { "entropy": 5.699526786804199, "epoch": 0.06882143296055057, "grad_norm": 1.2734375, "learning_rate": 0.00014678299636881716, "loss": 5.4604, "mean_token_accuracy": 0.2045097067952156, "num_tokens": 2610766.0, "step": 3080 }, { "entropy": 5.720143032073975, "epoch": 0.06893315606600602, "grad_norm": 1.28125, "learning_rate": 0.0001458166611790873, "loss": 5.4899, "mean_token_accuracy": 0.19933217763900757, "num_tokens": 2614715.0, "step": 3085 }, { "entropy": 5.722377920150757, "epoch": 0.06904487917146145, "grad_norm": 1.390625, "learning_rate": 0.00014485386761584773, "loss": 5.3442, "mean_token_accuracy": 0.2098390132188797, "num_tokens": 2618750.0, "step": 3090 }, { "entropy": 5.585204696655273, "epoch": 0.06915660227691689, "grad_norm": 1.1875, "learning_rate": 0.00014389464207457042, "loss": 5.2674, "mean_token_accuracy": 0.21748966127634048, "num_tokens": 2623692.0, "step": 3095 }, { "entropy": 5.645673656463623, "epoch": 0.06926832538237233, "grad_norm": 1.2265625, "learning_rate": 0.00014293901085290795, "loss": 5.3308, "mean_token_accuracy": 0.21164227575063704, "num_tokens": 2628797.0, "step": 3100 }, { "entropy": 5.58236780166626, "epoch": 0.06938004848782776, "grad_norm": 1.296875, "learning_rate": 0.00014198700014997307, "loss": 5.366, "mean_token_accuracy": 0.1984266683459282, "num_tokens": 2633246.0, "step": 3105 }, { "entropy": 5.616124296188355, "epoch": 0.06949177159328321, "grad_norm": 1.28125, "learning_rate": 0.00014103863606562016, "loss": 5.281, "mean_token_accuracy": 0.21451370120048524, "num_tokens": 2637455.0, "step": 3110 }, { "entropy": 5.70268816947937, "epoch": 0.06960349469873865, "grad_norm": 1.3125, "learning_rate": 0.00014009394459972964, "loss": 5.5515, "mean_token_accuracy": 0.20195948630571364, "num_tokens": 2642205.0, "step": 3115 }, { "entropy": 5.719800329208374, "epoch": 0.06971521780419408, "grad_norm": 1.3984375, "learning_rate": 0.00013915295165149513, "loss": 5.4788, "mean_token_accuracy": 0.20116885006427765, "num_tokens": 2646534.0, "step": 3120 }, { "entropy": 5.64207239151001, "epoch": 0.06982694090964953, "grad_norm": 1.2578125, "learning_rate": 0.00013821568301871384, "loss": 5.449, "mean_token_accuracy": 0.19510029256343842, "num_tokens": 2651164.0, "step": 3125 }, { "entropy": 5.598998975753784, "epoch": 0.06993866401510497, "grad_norm": 1.3125, "learning_rate": 0.00013728216439707862, "loss": 5.2194, "mean_token_accuracy": 0.22186099737882614, "num_tokens": 2654874.0, "step": 3130 }, { "entropy": 5.641804456710815, "epoch": 0.0700503871205604, "grad_norm": 1.3515625, "learning_rate": 0.00013635242137947419, "loss": 5.4562, "mean_token_accuracy": 0.20273958146572113, "num_tokens": 2659125.0, "step": 3135 }, { "entropy": 5.648518085479736, "epoch": 0.07016211022601584, "grad_norm": 1.28125, "learning_rate": 0.00013542647945527498, "loss": 5.3014, "mean_token_accuracy": 0.2190367430448532, "num_tokens": 2663161.0, "step": 3140 }, { "entropy": 5.617127418518066, "epoch": 0.07027383333147127, "grad_norm": 1.2734375, "learning_rate": 0.0001345043640096465, "loss": 5.2522, "mean_token_accuracy": 0.2186114564538002, "num_tokens": 2667561.0, "step": 3145 }, { "entropy": 5.575188446044922, "epoch": 0.07038555643692672, "grad_norm": 1.171875, "learning_rate": 0.00013358610032284957, "loss": 5.2346, "mean_token_accuracy": 0.22437924295663833, "num_tokens": 2671854.0, "step": 3150 }, { "entropy": 5.619395685195923, "epoch": 0.07049727954238216, "grad_norm": 1.2734375, "learning_rate": 0.000132671713569547, "loss": 5.4031, "mean_token_accuracy": 0.20520273745059966, "num_tokens": 2676350.0, "step": 3155 }, { "entropy": 5.623759126663208, "epoch": 0.0706090026478376, "grad_norm": 1.171875, "learning_rate": 0.0001317612288181136, "loss": 5.335, "mean_token_accuracy": 0.20776157081127167, "num_tokens": 2680290.0, "step": 3160 }, { "entropy": 5.513316249847412, "epoch": 0.07072072575329304, "grad_norm": 1.1953125, "learning_rate": 0.00013085467102994864, "loss": 5.2621, "mean_token_accuracy": 0.21627698540687562, "num_tokens": 2684856.0, "step": 3165 }, { "entropy": 5.519444227218628, "epoch": 0.07083244885874848, "grad_norm": 1.296875, "learning_rate": 0.00012995206505879198, "loss": 5.2567, "mean_token_accuracy": 0.22906775772571564, "num_tokens": 2689344.0, "step": 3170 }, { "entropy": 5.652344274520874, "epoch": 0.07094417196420391, "grad_norm": 1.2734375, "learning_rate": 0.0001290534356500421, "loss": 5.4571, "mean_token_accuracy": 0.19304423332214354, "num_tokens": 2693646.0, "step": 3175 }, { "entropy": 5.671027946472168, "epoch": 0.07105589506965936, "grad_norm": 1.3515625, "learning_rate": 0.00012815880744007827, "loss": 5.3689, "mean_token_accuracy": 0.20677870661020278, "num_tokens": 2697624.0, "step": 3180 }, { "entropy": 5.518811798095703, "epoch": 0.0711676181751148, "grad_norm": 1.3125, "learning_rate": 0.00012726820495558483, "loss": 5.1631, "mean_token_accuracy": 0.2378458559513092, "num_tokens": 2701715.0, "step": 3185 }, { "entropy": 5.649792337417603, "epoch": 0.07127934128057023, "grad_norm": 1.2421875, "learning_rate": 0.00012638165261287868, "loss": 5.3514, "mean_token_accuracy": 0.21666739583015443, "num_tokens": 2705944.0, "step": 3190 }, { "entropy": 5.6121738910675045, "epoch": 0.07139106438602567, "grad_norm": 1.4453125, "learning_rate": 0.0001254991747172402, "loss": 5.3352, "mean_token_accuracy": 0.2155696466565132, "num_tokens": 2710131.0, "step": 3195 }, { "entropy": 5.653721332550049, "epoch": 0.07150278749148112, "grad_norm": 1.109375, "learning_rate": 0.00012462079546224662, "loss": 5.5097, "mean_token_accuracy": 0.20381901562213897, "num_tokens": 2714667.0, "step": 3200 }, { "entropy": 5.615315675735474, "epoch": 0.07161451059693655, "grad_norm": 1.359375, "learning_rate": 0.00012374653892910896, "loss": 5.2634, "mean_token_accuracy": 0.21610590815544128, "num_tokens": 2719067.0, "step": 3205 }, { "entropy": 5.5931305408477785, "epoch": 0.07172623370239199, "grad_norm": 1.40625, "learning_rate": 0.00012287642908601166, "loss": 5.2798, "mean_token_accuracy": 0.21317292153835296, "num_tokens": 2723283.0, "step": 3210 }, { "entropy": 5.70312271118164, "epoch": 0.07183795680784744, "grad_norm": 1.265625, "learning_rate": 0.00012201048978745569, "loss": 5.4082, "mean_token_accuracy": 0.20306612849235534, "num_tokens": 2727838.0, "step": 3215 }, { "entropy": 5.688286066055298, "epoch": 0.07194967991330287, "grad_norm": 2.515625, "learning_rate": 0.00012114874477360427, "loss": 5.2829, "mean_token_accuracy": 0.2075771778821945, "num_tokens": 2732225.0, "step": 3220 }, { "entropy": 5.630373954772949, "epoch": 0.07206140301875831, "grad_norm": 1.3984375, "learning_rate": 0.00012029121766963236, "loss": 5.367, "mean_token_accuracy": 0.21760180741548538, "num_tokens": 2736392.0, "step": 3225 }, { "entropy": 5.611014318466187, "epoch": 0.07217312612421375, "grad_norm": 1.34375, "learning_rate": 0.00011943793198507858, "loss": 5.3061, "mean_token_accuracy": 0.21080368161201476, "num_tokens": 2740807.0, "step": 3230 }, { "entropy": 5.633539915084839, "epoch": 0.07228484922966918, "grad_norm": 1.3515625, "learning_rate": 0.00011858891111320104, "loss": 5.2852, "mean_token_accuracy": 0.2113287329673767, "num_tokens": 2744882.0, "step": 3235 }, { "entropy": 5.652337455749512, "epoch": 0.07239657233512463, "grad_norm": 1.3828125, "learning_rate": 0.0001177441783303359, "loss": 5.3465, "mean_token_accuracy": 0.19676152616739273, "num_tokens": 2749005.0, "step": 3240 }, { "entropy": 5.596548557281494, "epoch": 0.07250829544058007, "grad_norm": 1.4609375, "learning_rate": 0.00011690375679525896, "loss": 5.3138, "mean_token_accuracy": 0.21947170794010162, "num_tokens": 2753144.0, "step": 3245 }, { "entropy": 5.594069957733154, "epoch": 0.0726200185460355, "grad_norm": 1.2890625, "learning_rate": 0.00011606766954855124, "loss": 5.375, "mean_token_accuracy": 0.20199813395738603, "num_tokens": 2757166.0, "step": 3250 }, { "entropy": 5.686679220199585, "epoch": 0.07273174165149095, "grad_norm": 1.2109375, "learning_rate": 0.00011523593951196702, "loss": 5.4953, "mean_token_accuracy": 0.20583337396383286, "num_tokens": 2761694.0, "step": 3255 }, { "entropy": 5.639123249053955, "epoch": 0.07284346475694638, "grad_norm": 1.2734375, "learning_rate": 0.00011440858948780523, "loss": 5.3497, "mean_token_accuracy": 0.20156496912240982, "num_tokens": 2765805.0, "step": 3260 }, { "entropy": 5.677051067352295, "epoch": 0.07295518786240182, "grad_norm": 1.2734375, "learning_rate": 0.00011358564215828484, "loss": 5.4183, "mean_token_accuracy": 0.20630619972944259, "num_tokens": 2769943.0, "step": 3265 }, { "entropy": 5.627818298339844, "epoch": 0.07306691096785727, "grad_norm": 1.375, "learning_rate": 0.00011276712008492254, "loss": 5.4099, "mean_token_accuracy": 0.20188342779874802, "num_tokens": 2773942.0, "step": 3270 }, { "entropy": 5.66841311454773, "epoch": 0.0731786340733127, "grad_norm": 1.3046875, "learning_rate": 0.00011195304570791451, "loss": 5.3857, "mean_token_accuracy": 0.19944757223129272, "num_tokens": 2778400.0, "step": 3275 }, { "entropy": 5.587056684494018, "epoch": 0.07329035717876814, "grad_norm": 1.453125, "learning_rate": 0.00011114344134552094, "loss": 5.3839, "mean_token_accuracy": 0.21059890538454057, "num_tokens": 2782508.0, "step": 3280 }, { "entropy": 5.7147684574127195, "epoch": 0.07340208028422358, "grad_norm": 1.3203125, "learning_rate": 0.0001103383291934545, "loss": 5.4363, "mean_token_accuracy": 0.1962822750210762, "num_tokens": 2786691.0, "step": 3285 }, { "entropy": 5.712974691390992, "epoch": 0.07351380338967901, "grad_norm": 1.359375, "learning_rate": 0.00010953773132427141, "loss": 5.4821, "mean_token_accuracy": 0.19333103895187378, "num_tokens": 2791548.0, "step": 3290 }, { "entropy": 5.6734947681427, "epoch": 0.07362552649513446, "grad_norm": 1.1953125, "learning_rate": 0.00010874166968676677, "loss": 5.2523, "mean_token_accuracy": 0.21183599829673766, "num_tokens": 2795852.0, "step": 3295 }, { "entropy": 5.733351469039917, "epoch": 0.0737372496005899, "grad_norm": 1.2890625, "learning_rate": 0.00010795016610537251, "loss": 5.3301, "mean_token_accuracy": 0.20432137697935104, "num_tokens": 2800385.0, "step": 3300 }, { "entropy": 5.611080169677734, "epoch": 0.07384897270604533, "grad_norm": 1.3359375, "learning_rate": 0.00010716324227955904, "loss": 5.2166, "mean_token_accuracy": 0.2197134181857109, "num_tokens": 2804295.0, "step": 3305 }, { "entropy": 5.539245700836181, "epoch": 0.07396069581150078, "grad_norm": 1.3515625, "learning_rate": 0.0001063809197832406, "loss": 5.2014, "mean_token_accuracy": 0.21054498553276063, "num_tokens": 2808305.0, "step": 3310 }, { "entropy": 5.469600009918213, "epoch": 0.07407241891695622, "grad_norm": 1.234375, "learning_rate": 0.00010560322006418368, "loss": 5.2348, "mean_token_accuracy": 0.22622232586145402, "num_tokens": 2813215.0, "step": 3315 }, { "entropy": 5.5544756889343265, "epoch": 0.07418414202241165, "grad_norm": 1.40625, "learning_rate": 0.00010483016444341887, "loss": 5.3035, "mean_token_accuracy": 0.21456746906042098, "num_tokens": 2817352.0, "step": 3320 }, { "entropy": 5.5173357963562015, "epoch": 0.0742958651278671, "grad_norm": 1.390625, "learning_rate": 0.00010406177411465654, "loss": 5.1518, "mean_token_accuracy": 0.22930039912462236, "num_tokens": 2821486.0, "step": 3325 }, { "entropy": 5.63260703086853, "epoch": 0.07440758823332254, "grad_norm": 1.3046875, "learning_rate": 0.00010329807014370562, "loss": 5.3578, "mean_token_accuracy": 0.20518976747989653, "num_tokens": 2825772.0, "step": 3330 }, { "entropy": 5.613286876678467, "epoch": 0.07451931133877797, "grad_norm": 1.390625, "learning_rate": 0.00010253907346789632, "loss": 5.2301, "mean_token_accuracy": 0.2215651661157608, "num_tokens": 2829751.0, "step": 3335 }, { "entropy": 5.589096975326538, "epoch": 0.07463103444423341, "grad_norm": 1.2890625, "learning_rate": 0.00010178480489550596, "loss": 5.2576, "mean_token_accuracy": 0.21702108085155486, "num_tokens": 2833887.0, "step": 3340 }, { "entropy": 5.63301568031311, "epoch": 0.07474275754968886, "grad_norm": 1.359375, "learning_rate": 0.00010103528510518836, "loss": 5.3826, "mean_token_accuracy": 0.20653112530708312, "num_tokens": 2838255.0, "step": 3345 }, { "entropy": 5.67524151802063, "epoch": 0.07485448065514429, "grad_norm": 1.421875, "learning_rate": 0.0001002905346454073, "loss": 5.4079, "mean_token_accuracy": 0.20599524229764937, "num_tokens": 2842432.0, "step": 3350 }, { "entropy": 5.547143030166626, "epoch": 0.07496620376059973, "grad_norm": 1.2734375, "learning_rate": 9.955057393387285e-05, "loss": 5.2149, "mean_token_accuracy": 0.22138799726963043, "num_tokens": 2846793.0, "step": 3355 }, { "entropy": 5.594313383102417, "epoch": 0.07507792686605518, "grad_norm": 1.4453125, "learning_rate": 9.88154232569816e-05, "loss": 5.2984, "mean_token_accuracy": 0.21841018348932267, "num_tokens": 2850640.0, "step": 3360 }, { "entropy": 5.552529430389404, "epoch": 0.0751896499715106, "grad_norm": 1.3125, "learning_rate": 9.808510276926075e-05, "loss": 5.2852, "mean_token_accuracy": 0.22227568924427032, "num_tokens": 2854935.0, "step": 3365 }, { "entropy": 5.525260782241821, "epoch": 0.07530137307696605, "grad_norm": 1.3125, "learning_rate": 9.735963249281549e-05, "loss": 5.1534, "mean_token_accuracy": 0.23119736164808274, "num_tokens": 2858777.0, "step": 3370 }, { "entropy": 5.597141599655151, "epoch": 0.0754130961824215, "grad_norm": 1.359375, "learning_rate": 9.663903231677974e-05, "loss": 5.3521, "mean_token_accuracy": 0.20306329131126405, "num_tokens": 2863048.0, "step": 3375 }, { "entropy": 5.6410009384155275, "epoch": 0.07552481928787692, "grad_norm": 1.265625, "learning_rate": 9.592332199677145e-05, "loss": 5.4613, "mean_token_accuracy": 0.2133955880999565, "num_tokens": 2867614.0, "step": 3380 }, { "entropy": 5.609254264831543, "epoch": 0.07563654239333237, "grad_norm": 1.453125, "learning_rate": 9.521252115435061e-05, "loss": 5.3742, "mean_token_accuracy": 0.21081015318632126, "num_tokens": 2871872.0, "step": 3385 }, { "entropy": 5.691639852523804, "epoch": 0.0757482654987878, "grad_norm": 1.3359375, "learning_rate": 9.450664927648126e-05, "loss": 5.4202, "mean_token_accuracy": 0.20292532742023467, "num_tokens": 2876240.0, "step": 3390 }, { "entropy": 5.636670351028442, "epoch": 0.07585998860424324, "grad_norm": 1.3515625, "learning_rate": 9.380572571499758e-05, "loss": 5.2689, "mean_token_accuracy": 0.21996590942144395, "num_tokens": 2880301.0, "step": 3395 }, { "entropy": 5.675829076766968, "epoch": 0.07597171170969869, "grad_norm": 1.2265625, "learning_rate": 9.310976968607307e-05, "loss": 5.3086, "mean_token_accuracy": 0.22123734802007675, "num_tokens": 2884552.0, "step": 3400 }, { "entropy": 5.634104871749878, "epoch": 0.07608343481515412, "grad_norm": 1.3828125, "learning_rate": 9.241880026969381e-05, "loss": 5.3006, "mean_token_accuracy": 0.20040488690137864, "num_tokens": 2888851.0, "step": 3405 }, { "entropy": 5.5746925354003904, "epoch": 0.07619515792060956, "grad_norm": 1.296875, "learning_rate": 9.173283640913537e-05, "loss": 5.2415, "mean_token_accuracy": 0.22433702349662782, "num_tokens": 2892712.0, "step": 3410 }, { "entropy": 5.620074892044068, "epoch": 0.076306881026065, "grad_norm": 1.2734375, "learning_rate": 9.10518969104436e-05, "loss": 5.3529, "mean_token_accuracy": 0.20692348778247832, "num_tokens": 2897018.0, "step": 3415 }, { "entropy": 5.516711568832397, "epoch": 0.07641860413152043, "grad_norm": 1.90625, "learning_rate": 9.037600044191868e-05, "loss": 5.4452, "mean_token_accuracy": 0.21995796114206315, "num_tokens": 2901689.0, "step": 3420 }, { "entropy": 5.528185558319092, "epoch": 0.07653032723697588, "grad_norm": 1.265625, "learning_rate": 8.970516553360383e-05, "loss": 5.2348, "mean_token_accuracy": 0.2222063884139061, "num_tokens": 2905625.0, "step": 3425 }, { "entropy": 5.593515157699585, "epoch": 0.07664205034243132, "grad_norm": 1.328125, "learning_rate": 8.903941057677692e-05, "loss": 5.3418, "mean_token_accuracy": 0.21491294354200363, "num_tokens": 2909913.0, "step": 3430 }, { "entropy": 5.633850717544556, "epoch": 0.07675377344788675, "grad_norm": 1.2421875, "learning_rate": 8.837875382344635e-05, "loss": 5.3329, "mean_token_accuracy": 0.21063277274370193, "num_tokens": 2914583.0, "step": 3435 }, { "entropy": 5.605971717834473, "epoch": 0.0768654965533422, "grad_norm": 1.2578125, "learning_rate": 8.772321338585076e-05, "loss": 5.2942, "mean_token_accuracy": 0.21364900469779968, "num_tokens": 2918753.0, "step": 3440 }, { "entropy": 5.581877565383911, "epoch": 0.07697721965879764, "grad_norm": 1.3125, "learning_rate": 8.707280723596242e-05, "loss": 5.3525, "mean_token_accuracy": 0.212966750562191, "num_tokens": 2922982.0, "step": 3445 }, { "entropy": 5.540095424652099, "epoch": 0.07708894276425307, "grad_norm": 1.34375, "learning_rate": 8.64275532049944e-05, "loss": 5.2323, "mean_token_accuracy": 0.2168658971786499, "num_tokens": 2927603.0, "step": 3450 }, { "entropy": 5.559815359115601, "epoch": 0.07720066586970852, "grad_norm": 1.203125, "learning_rate": 8.578746898291198e-05, "loss": 5.1838, "mean_token_accuracy": 0.22491378486156463, "num_tokens": 2932040.0, "step": 3455 }, { "entropy": 5.619689416885376, "epoch": 0.07731238897516396, "grad_norm": 1.4375, "learning_rate": 8.515257211794742e-05, "loss": 5.2521, "mean_token_accuracy": 0.21349863857030868, "num_tokens": 2935857.0, "step": 3460 }, { "entropy": 5.5853088855743405, "epoch": 0.07742411208061939, "grad_norm": 1.2109375, "learning_rate": 8.452288001611896e-05, "loss": 5.3033, "mean_token_accuracy": 0.21696949154138565, "num_tokens": 2940103.0, "step": 3465 }, { "entropy": 5.624681711196899, "epoch": 0.07753583518607483, "grad_norm": 1.1640625, "learning_rate": 8.389840994075379e-05, "loss": 5.3664, "mean_token_accuracy": 0.2176609754562378, "num_tokens": 2944437.0, "step": 3470 }, { "entropy": 5.614411687850952, "epoch": 0.07764755829153028, "grad_norm": 1.3671875, "learning_rate": 8.327917901201435e-05, "loss": 5.3038, "mean_token_accuracy": 0.2120346873998642, "num_tokens": 2948550.0, "step": 3475 }, { "entropy": 5.609672546386719, "epoch": 0.07775928139698571, "grad_norm": 1.390625, "learning_rate": 8.266520420642931e-05, "loss": 5.2985, "mean_token_accuracy": 0.21615774631500245, "num_tokens": 2952466.0, "step": 3480 }, { "entropy": 5.695987367630005, "epoch": 0.07787100450244115, "grad_norm": 1.625, "learning_rate": 8.205650235642828e-05, "loss": 5.4194, "mean_token_accuracy": 0.19847894757986068, "num_tokens": 2956504.0, "step": 3485 }, { "entropy": 5.666062545776367, "epoch": 0.0779827276078966, "grad_norm": 1.4296875, "learning_rate": 8.145309014987978e-05, "loss": 5.3827, "mean_token_accuracy": 0.20386045277118683, "num_tokens": 2961034.0, "step": 3490 }, { "entropy": 5.606233358383179, "epoch": 0.07809445071335203, "grad_norm": 1.2890625, "learning_rate": 8.085498412963437e-05, "loss": 5.4119, "mean_token_accuracy": 0.20896730124950408, "num_tokens": 2965522.0, "step": 3495 }, { "entropy": 5.582093715667725, "epoch": 0.07820617381880747, "grad_norm": 1.3046875, "learning_rate": 8.026220069307078e-05, "loss": 5.175, "mean_token_accuracy": 0.22600839287042618, "num_tokens": 2969523.0, "step": 3500 }, { "entropy": 5.648726129531861, "epoch": 0.0783178969242629, "grad_norm": 1.3359375, "learning_rate": 7.967475609164621e-05, "loss": 5.2617, "mean_token_accuracy": 0.2210591584444046, "num_tokens": 2973482.0, "step": 3505 }, { "entropy": 5.64477858543396, "epoch": 0.07842962002971834, "grad_norm": 1.390625, "learning_rate": 7.909266643045124e-05, "loss": 5.3993, "mean_token_accuracy": 0.20203785747289657, "num_tokens": 2977696.0, "step": 3510 }, { "entropy": 5.661210346221924, "epoch": 0.07854134313517379, "grad_norm": 1.203125, "learning_rate": 7.851594766776802e-05, "loss": 5.307, "mean_token_accuracy": 0.21592496931552888, "num_tokens": 2981683.0, "step": 3515 }, { "entropy": 5.591487312316895, "epoch": 0.07865306624062922, "grad_norm": 1.2578125, "learning_rate": 7.794461561463265e-05, "loss": 5.2825, "mean_token_accuracy": 0.21814689189195632, "num_tokens": 2986040.0, "step": 3520 }, { "entropy": 5.520713806152344, "epoch": 0.07876478934608466, "grad_norm": 2.328125, "learning_rate": 7.7378685934402e-05, "loss": 5.1859, "mean_token_accuracy": 0.22736109644174576, "num_tokens": 2990453.0, "step": 3525 }, { "entropy": 5.57408881187439, "epoch": 0.0788765124515401, "grad_norm": 1.21875, "learning_rate": 7.68181741423242e-05, "loss": 5.3577, "mean_token_accuracy": 0.20576396882534026, "num_tokens": 2994870.0, "step": 3530 }, { "entropy": 5.566109895706177, "epoch": 0.07898823555699554, "grad_norm": 1.4140625, "learning_rate": 7.626309560511313e-05, "loss": 5.2321, "mean_token_accuracy": 0.22257633805274962, "num_tokens": 2998692.0, "step": 3535 }, { "entropy": 5.651077699661255, "epoch": 0.07909995866245098, "grad_norm": 1.2734375, "learning_rate": 7.571346554052724e-05, "loss": 5.4113, "mean_token_accuracy": 0.20006688684225082, "num_tokens": 3002830.0, "step": 3540 }, { "entropy": 5.665845584869385, "epoch": 0.07921168176790643, "grad_norm": 1.3203125, "learning_rate": 7.516929901695249e-05, "loss": 5.3137, "mean_token_accuracy": 0.20740436911582946, "num_tokens": 3007302.0, "step": 3545 }, { "entropy": 5.618817615509033, "epoch": 0.07932340487336186, "grad_norm": 1.5, "learning_rate": 7.463061095298893e-05, "loss": 5.2635, "mean_token_accuracy": 0.2198699712753296, "num_tokens": 3011156.0, "step": 3550 }, { "entropy": 5.666779851913452, "epoch": 0.0794351279788173, "grad_norm": 1.28125, "learning_rate": 7.409741611704198e-05, "loss": 5.3482, "mean_token_accuracy": 0.20920169055461885, "num_tokens": 3015577.0, "step": 3555 }, { "entropy": 5.505196571350098, "epoch": 0.07954685108427274, "grad_norm": 1.2890625, "learning_rate": 7.35697291269174e-05, "loss": 5.1681, "mean_token_accuracy": 0.22661744505167009, "num_tokens": 3019801.0, "step": 3560 }, { "entropy": 5.628220748901367, "epoch": 0.07965857418972817, "grad_norm": 1.2109375, "learning_rate": 7.304756444942056e-05, "loss": 5.3181, "mean_token_accuracy": 0.2193499967455864, "num_tokens": 3023916.0, "step": 3565 }, { "entropy": 5.612834501266479, "epoch": 0.07977029729518362, "grad_norm": 1.2890625, "learning_rate": 7.253093639995994e-05, "loss": 5.3256, "mean_token_accuracy": 0.20452884137630462, "num_tokens": 3028161.0, "step": 3570 }, { "entropy": 5.682301568984985, "epoch": 0.07988202040063906, "grad_norm": 1.4609375, "learning_rate": 7.20198591421544e-05, "loss": 5.3278, "mean_token_accuracy": 0.21033651977777482, "num_tokens": 3032080.0, "step": 3575 }, { "entropy": 5.686801958084106, "epoch": 0.07999374350609449, "grad_norm": 1.296875, "learning_rate": 7.151434668744517e-05, "loss": 5.4331, "mean_token_accuracy": 0.20019310861825942, "num_tokens": 3036535.0, "step": 3580 }, { "entropy": 5.584930467605591, "epoch": 0.08010546661154994, "grad_norm": 1.375, "learning_rate": 7.101441289471153e-05, "loss": 5.3741, "mean_token_accuracy": 0.20859978944063187, "num_tokens": 3040649.0, "step": 3585 }, { "entropy": 5.607728004455566, "epoch": 0.08021718971700538, "grad_norm": 1.296875, "learning_rate": 7.052007146989098e-05, "loss": 5.3176, "mean_token_accuracy": 0.2208326652646065, "num_tokens": 3044883.0, "step": 3590 }, { "entropy": 5.606212949752807, "epoch": 0.08032891282246081, "grad_norm": 1.578125, "learning_rate": 7.003133596560341e-05, "loss": 5.2064, "mean_token_accuracy": 0.22535468339920045, "num_tokens": 3048802.0, "step": 3595 }, { "entropy": 5.628868532180786, "epoch": 0.08044063592791625, "grad_norm": 1.296875, "learning_rate": 6.954821978077952e-05, "loss": 5.3854, "mean_token_accuracy": 0.21277399063110353, "num_tokens": 3053078.0, "step": 3600 }, { "entropy": 5.65153751373291, "epoch": 0.0805523590333717, "grad_norm": 1.15625, "learning_rate": 6.907073616029356e-05, "loss": 5.3074, "mean_token_accuracy": 0.20606451183557511, "num_tokens": 3057691.0, "step": 3605 }, { "entropy": 5.760905456542969, "epoch": 0.08066408213882713, "grad_norm": 1.25, "learning_rate": 6.85988981946002e-05, "loss": 5.5137, "mean_token_accuracy": 0.19400741457939147, "num_tokens": 3062459.0, "step": 3610 }, { "entropy": 5.711138677597046, "epoch": 0.08077580524428257, "grad_norm": 1.3984375, "learning_rate": 6.813271881937564e-05, "loss": 5.3843, "mean_token_accuracy": 0.20873532444238663, "num_tokens": 3066453.0, "step": 3615 }, { "entropy": 5.532869958877564, "epoch": 0.080887528349738, "grad_norm": 1.296875, "learning_rate": 6.767221081516286e-05, "loss": 5.2696, "mean_token_accuracy": 0.22122857272624968, "num_tokens": 3070726.0, "step": 3620 }, { "entropy": 5.7132974624633786, "epoch": 0.08099925145519345, "grad_norm": 1.3515625, "learning_rate": 6.72173868070215e-05, "loss": 5.3751, "mean_token_accuracy": 0.21080582290887834, "num_tokens": 3074907.0, "step": 3625 }, { "entropy": 5.64652190208435, "epoch": 0.08111097456064889, "grad_norm": 1.359375, "learning_rate": 6.676825926418149e-05, "loss": 5.343, "mean_token_accuracy": 0.2070286214351654, "num_tokens": 3078851.0, "step": 3630 }, { "entropy": 5.631018114089966, "epoch": 0.08122269766610432, "grad_norm": 1.359375, "learning_rate": 6.632484049970122e-05, "loss": 5.2338, "mean_token_accuracy": 0.21441571563482284, "num_tokens": 3082871.0, "step": 3635 }, { "entropy": 5.665914630889892, "epoch": 0.08133442077155977, "grad_norm": 1.265625, "learning_rate": 6.588714267013019e-05, "loss": 5.3675, "mean_token_accuracy": 0.21185107082128524, "num_tokens": 3087385.0, "step": 3640 }, { "entropy": 5.570506286621094, "epoch": 0.08144614387701521, "grad_norm": 1.203125, "learning_rate": 6.545517777517544e-05, "loss": 5.3111, "mean_token_accuracy": 0.20417589098215103, "num_tokens": 3091818.0, "step": 3645 }, { "entropy": 5.659856939315796, "epoch": 0.08155786698247064, "grad_norm": 1.296875, "learning_rate": 6.502895765737281e-05, "loss": 5.3422, "mean_token_accuracy": 0.2085869640111923, "num_tokens": 3096045.0, "step": 3650 }, { "entropy": 5.6597761631011965, "epoch": 0.08166959008792608, "grad_norm": 1.3203125, "learning_rate": 6.460849400176212e-05, "loss": 5.379, "mean_token_accuracy": 0.2018310993909836, "num_tokens": 3100313.0, "step": 3655 }, { "entropy": 5.610556793212891, "epoch": 0.08178131319338153, "grad_norm": 1.3671875, "learning_rate": 6.419379833556694e-05, "loss": 5.3534, "mean_token_accuracy": 0.22189855575561523, "num_tokens": 3104434.0, "step": 3660 }, { "entropy": 5.654457426071167, "epoch": 0.08189303629883696, "grad_norm": 1.265625, "learning_rate": 6.378488202787835e-05, "loss": 5.2827, "mean_token_accuracy": 0.22774875164031982, "num_tokens": 3108801.0, "step": 3665 }, { "entropy": 5.638199090957642, "epoch": 0.0820047594042924, "grad_norm": 1.296875, "learning_rate": 6.33817562893435e-05, "loss": 5.3595, "mean_token_accuracy": 0.20279042720794677, "num_tokens": 3113250.0, "step": 3670 }, { "entropy": 5.627264547348022, "epoch": 0.08211648250974785, "grad_norm": 1.296875, "learning_rate": 6.29844321718582e-05, "loss": 5.268, "mean_token_accuracy": 0.21937764436006546, "num_tokens": 3117524.0, "step": 3675 }, { "entropy": 5.6254109859466555, "epoch": 0.08222820561520328, "grad_norm": 1.3671875, "learning_rate": 6.259292056826383e-05, "loss": 5.3917, "mean_token_accuracy": 0.20597360134124756, "num_tokens": 3122416.0, "step": 3680 }, { "entropy": 5.67297739982605, "epoch": 0.08233992872065872, "grad_norm": 1.2265625, "learning_rate": 6.220723221204873e-05, "loss": 5.3425, "mean_token_accuracy": 0.21909067630767823, "num_tokens": 3126556.0, "step": 3685 }, { "entropy": 5.5861554622650145, "epoch": 0.08245165182611416, "grad_norm": 1.296875, "learning_rate": 6.182737767705406e-05, "loss": 5.2812, "mean_token_accuracy": 0.21893683075904846, "num_tokens": 3130802.0, "step": 3690 }, { "entropy": 5.676740026473999, "epoch": 0.0825633749315696, "grad_norm": 1.3125, "learning_rate": 6.145336737718375e-05, "loss": 5.3257, "mean_token_accuracy": 0.20887255668640137, "num_tokens": 3135123.0, "step": 3695 }, { "entropy": 5.573624897003174, "epoch": 0.08267509803702504, "grad_norm": 1.2578125, "learning_rate": 6.10852115661191e-05, "loss": 5.2818, "mean_token_accuracy": 0.20997430831193925, "num_tokens": 3139154.0, "step": 3700 }, { "entropy": 5.61875286102295, "epoch": 0.08278682114248048, "grad_norm": 1.296875, "learning_rate": 6.072292033703766e-05, "loss": 5.3097, "mean_token_accuracy": 0.21799131631851196, "num_tokens": 3143563.0, "step": 3705 }, { "entropy": 5.612141466140747, "epoch": 0.08289854424793591, "grad_norm": 1.390625, "learning_rate": 6.036650362233648e-05, "loss": 5.2624, "mean_token_accuracy": 0.21610828042030333, "num_tokens": 3147426.0, "step": 3710 }, { "entropy": 5.630769205093384, "epoch": 0.08301026735339136, "grad_norm": 1.2734375, "learning_rate": 6.0015971193359824e-05, "loss": 5.3198, "mean_token_accuracy": 0.22308328300714492, "num_tokens": 3151602.0, "step": 3715 }, { "entropy": 5.662342548370361, "epoch": 0.0831219904588468, "grad_norm": 1.3203125, "learning_rate": 5.9671332660131306e-05, "loss": 5.3128, "mean_token_accuracy": 0.20877344012260438, "num_tokens": 3155494.0, "step": 3720 }, { "entropy": 5.616480445861816, "epoch": 0.08323371356430223, "grad_norm": 1.34375, "learning_rate": 5.933259747109042e-05, "loss": 5.249, "mean_token_accuracy": 0.2296250879764557, "num_tokens": 3159548.0, "step": 3725 }, { "entropy": 5.616093254089355, "epoch": 0.08334543666975767, "grad_norm": 1.34375, "learning_rate": 5.899977491283351e-05, "loss": 5.2948, "mean_token_accuracy": 0.21538150012493135, "num_tokens": 3163531.0, "step": 3730 }, { "entropy": 5.640008640289307, "epoch": 0.0834571597752131, "grad_norm": 1.2734375, "learning_rate": 5.867287410985908e-05, "loss": 5.2828, "mean_token_accuracy": 0.22129616886377335, "num_tokens": 3167833.0, "step": 3735 }, { "entropy": 5.693461656570435, "epoch": 0.08356888288066855, "grad_norm": 1.3125, "learning_rate": 5.835190402431779e-05, "loss": 5.3702, "mean_token_accuracy": 0.21054567247629166, "num_tokens": 3172022.0, "step": 3740 }, { "entropy": 5.677970314025879, "epoch": 0.083680605986124, "grad_norm": 1.375, "learning_rate": 5.803687345576673e-05, "loss": 5.4136, "mean_token_accuracy": 0.2075629785656929, "num_tokens": 3176354.0, "step": 3745 }, { "entropy": 5.578473663330078, "epoch": 0.08379232909157942, "grad_norm": 1.2421875, "learning_rate": 5.7727791040927977e-05, "loss": 5.2941, "mean_token_accuracy": 0.2221289023756981, "num_tokens": 3180828.0, "step": 3750 }, { "entropy": 5.672476530075073, "epoch": 0.08390405219703487, "grad_norm": 1.296875, "learning_rate": 5.742466525345213e-05, "loss": 5.3437, "mean_token_accuracy": 0.20644573420286177, "num_tokens": 3185032.0, "step": 3755 }, { "entropy": 5.604012823104858, "epoch": 0.08401577530249031, "grad_norm": 1.296875, "learning_rate": 5.7127504403685775e-05, "loss": 5.2496, "mean_token_accuracy": 0.2142631232738495, "num_tokens": 3189160.0, "step": 3760 }, { "entropy": 5.663827133178711, "epoch": 0.08412749840794574, "grad_norm": 1.2890625, "learning_rate": 5.6836316638443664e-05, "loss": 5.3955, "mean_token_accuracy": 0.20509500205516815, "num_tokens": 3193489.0, "step": 3765 }, { "entropy": 5.597621488571167, "epoch": 0.08423922151340119, "grad_norm": 1.2265625, "learning_rate": 5.655110994078553e-05, "loss": 5.3143, "mean_token_accuracy": 0.2035353362560272, "num_tokens": 3197847.0, "step": 3770 }, { "entropy": 5.65077919960022, "epoch": 0.08435094461885663, "grad_norm": 1.296875, "learning_rate": 5.6271892129797056e-05, "loss": 5.3806, "mean_token_accuracy": 0.20232707709074021, "num_tokens": 3202248.0, "step": 3775 }, { "entropy": 5.553995800018311, "epoch": 0.08446266772431206, "grad_norm": 1.3984375, "learning_rate": 5.599867086037556e-05, "loss": 5.235, "mean_token_accuracy": 0.2232307404279709, "num_tokens": 3206458.0, "step": 3780 }, { "entropy": 5.678331470489502, "epoch": 0.0845743908297675, "grad_norm": 1.4453125, "learning_rate": 5.573145362302012e-05, "loss": 5.3889, "mean_token_accuracy": 0.19883892238140105, "num_tokens": 3210283.0, "step": 3785 }, { "entropy": 5.762803459167481, "epoch": 0.08468611393522295, "grad_norm": 1.375, "learning_rate": 5.5470247743626404e-05, "loss": 5.4709, "mean_token_accuracy": 0.2024947628378868, "num_tokens": 3214630.0, "step": 3790 }, { "entropy": 5.675040864944458, "epoch": 0.08479783704067838, "grad_norm": 1.2421875, "learning_rate": 5.5215060383285414e-05, "loss": 5.3822, "mean_token_accuracy": 0.19620390236377716, "num_tokens": 3218614.0, "step": 3795 }, { "entropy": 5.663913774490356, "epoch": 0.08490956014613382, "grad_norm": 1.328125, "learning_rate": 5.496589853808759e-05, "loss": 5.2087, "mean_token_accuracy": 0.21898047477006913, "num_tokens": 3222629.0, "step": 3800 }, { "entropy": 5.6438130855560305, "epoch": 0.08502128325158927, "grad_norm": 1.328125, "learning_rate": 5.47227690389308e-05, "loss": 5.3723, "mean_token_accuracy": 0.20091044455766677, "num_tokens": 3226610.0, "step": 3805 }, { "entropy": 5.621782350540161, "epoch": 0.0851330063570447, "grad_norm": 1.34375, "learning_rate": 5.448567855133306e-05, "loss": 5.2408, "mean_token_accuracy": 0.21439284235239028, "num_tokens": 3230733.0, "step": 3810 }, { "entropy": 5.639111328125, "epoch": 0.08524472946250014, "grad_norm": 1.2890625, "learning_rate": 5.425463357524986e-05, "loss": 5.3778, "mean_token_accuracy": 0.2101699247956276, "num_tokens": 3234886.0, "step": 3815 }, { "entropy": 5.644361877441407, "epoch": 0.08535645256795558, "grad_norm": 1.25, "learning_rate": 5.402964044489591e-05, "loss": 5.2513, "mean_token_accuracy": 0.20897443294525148, "num_tokens": 3239256.0, "step": 3820 }, { "entropy": 5.611676645278931, "epoch": 0.08546817567341101, "grad_norm": 1.390625, "learning_rate": 5.381070532857153e-05, "loss": 5.316, "mean_token_accuracy": 0.21087998300790786, "num_tokens": 3243300.0, "step": 3825 }, { "entropy": 5.672077608108521, "epoch": 0.08557989877886646, "grad_norm": 1.265625, "learning_rate": 5.359783422849357e-05, "loss": 5.4337, "mean_token_accuracy": 0.19756073355674744, "num_tokens": 3248038.0, "step": 3830 }, { "entropy": 5.582310199737549, "epoch": 0.0856916218843219, "grad_norm": 1.5234375, "learning_rate": 5.3391032980630736e-05, "loss": 5.3052, "mean_token_accuracy": 0.21166286915540694, "num_tokens": 3251987.0, "step": 3835 }, { "entropy": 5.6600724220275875, "epoch": 0.08580334498977733, "grad_norm": 1.3515625, "learning_rate": 5.31903072545437e-05, "loss": 5.4011, "mean_token_accuracy": 0.203070168197155, "num_tokens": 3256104.0, "step": 3840 }, { "entropy": 5.666264581680298, "epoch": 0.08591506809523278, "grad_norm": 1.28125, "learning_rate": 5.29956625532297e-05, "loss": 5.2765, "mean_token_accuracy": 0.21566030532121658, "num_tokens": 3260439.0, "step": 3845 }, { "entropy": 5.61574649810791, "epoch": 0.08602679120068821, "grad_norm": 1.40625, "learning_rate": 5.280710421297146e-05, "loss": 5.3493, "mean_token_accuracy": 0.20139459818601607, "num_tokens": 3264766.0, "step": 3850 }, { "entropy": 5.624459362030029, "epoch": 0.08613851430614365, "grad_norm": 1.296875, "learning_rate": 5.2624637403191165e-05, "loss": 5.4526, "mean_token_accuracy": 0.19859057813882827, "num_tokens": 3269211.0, "step": 3855 }, { "entropy": 5.6024806022644045, "epoch": 0.0862502374115991, "grad_norm": 1.3515625, "learning_rate": 5.2448267126308605e-05, "loss": 5.3306, "mean_token_accuracy": 0.2112487643957138, "num_tokens": 3273116.0, "step": 3860 }, { "entropy": 5.597120571136474, "epoch": 0.08636196051705453, "grad_norm": 1.28125, "learning_rate": 5.2277998217603954e-05, "loss": 5.3694, "mean_token_accuracy": 0.2089441180229187, "num_tokens": 3277347.0, "step": 3865 }, { "entropy": 5.700920629501343, "epoch": 0.08647368362250997, "grad_norm": 1.375, "learning_rate": 5.211383534508541e-05, "loss": 5.3661, "mean_token_accuracy": 0.20611102283000945, "num_tokens": 3281772.0, "step": 3870 }, { "entropy": 5.585329294204712, "epoch": 0.08658540672796541, "grad_norm": 1.2109375, "learning_rate": 5.1955783009361044e-05, "loss": 5.2832, "mean_token_accuracy": 0.21443279832601547, "num_tokens": 3286115.0, "step": 3875 }, { "entropy": 5.653279829025268, "epoch": 0.08669712983342084, "grad_norm": 1.34375, "learning_rate": 5.180384554351543e-05, "loss": 5.3824, "mean_token_accuracy": 0.2080657109618187, "num_tokens": 3290791.0, "step": 3880 }, { "entropy": 5.669637393951416, "epoch": 0.08680885293887629, "grad_norm": 1.2578125, "learning_rate": 5.1658027112990976e-05, "loss": 5.3465, "mean_token_accuracy": 0.22144186198711396, "num_tokens": 3295327.0, "step": 3885 }, { "entropy": 5.711081886291504, "epoch": 0.08692057604433173, "grad_norm": 1.3671875, "learning_rate": 5.151833171547365e-05, "loss": 5.4463, "mean_token_accuracy": 0.20244335383176804, "num_tokens": 3299267.0, "step": 3890 }, { "entropy": 5.636924457550049, "epoch": 0.08703229914978716, "grad_norm": 1.109375, "learning_rate": 5.1384763180783274e-05, "loss": 5.4062, "mean_token_accuracy": 0.20746810883283615, "num_tokens": 3304074.0, "step": 3895 }, { "entropy": 5.637734651565552, "epoch": 0.0871440222552426, "grad_norm": 1.34375, "learning_rate": 5.125732517076876e-05, "loss": 5.3251, "mean_token_accuracy": 0.2097361832857132, "num_tokens": 3308292.0, "step": 3900 }, { "entropy": 5.633953189849853, "epoch": 0.08725574536069805, "grad_norm": 1.2890625, "learning_rate": 5.113602117920747e-05, "loss": 5.3888, "mean_token_accuracy": 0.21099466532468797, "num_tokens": 3312161.0, "step": 3905 }, { "entropy": 5.656825065612793, "epoch": 0.08736746846615348, "grad_norm": 1.28125, "learning_rate": 5.102085453170966e-05, "loss": 5.3267, "mean_token_accuracy": 0.2001182571053505, "num_tokens": 3316271.0, "step": 3910 }, { "entropy": 5.677023983001709, "epoch": 0.08747919157160892, "grad_norm": 1.265625, "learning_rate": 5.091182838562709e-05, "loss": 5.4061, "mean_token_accuracy": 0.19816306382417678, "num_tokens": 3320663.0, "step": 3915 }, { "entropy": 5.607973432540893, "epoch": 0.08759091467706437, "grad_norm": 1.3203125, "learning_rate": 5.0808945729966716e-05, "loss": 5.3822, "mean_token_accuracy": 0.20814824402332305, "num_tokens": 3324699.0, "step": 3920 }, { "entropy": 5.697803211212158, "epoch": 0.0877026377825198, "grad_norm": 1.3203125, "learning_rate": 5.071220938530844e-05, "loss": 5.3707, "mean_token_accuracy": 0.19458835422992707, "num_tokens": 3328737.0, "step": 3925 }, { "entropy": 5.7307751178741455, "epoch": 0.08781436088797524, "grad_norm": 1.296875, "learning_rate": 5.0621622003728026e-05, "loss": 5.4589, "mean_token_accuracy": 0.20548731684684754, "num_tokens": 3333238.0, "step": 3930 }, { "entropy": 5.672309398651123, "epoch": 0.08792608399343069, "grad_norm": 1.3359375, "learning_rate": 5.053718606872433e-05, "loss": 5.398, "mean_token_accuracy": 0.20169921666383744, "num_tokens": 3337505.0, "step": 3935 }, { "entropy": 5.6464564323425295, "epoch": 0.08803780709888612, "grad_norm": 1.3828125, "learning_rate": 5.0458903895151134e-05, "loss": 5.2632, "mean_token_accuracy": 0.2304834946990013, "num_tokens": 3341870.0, "step": 3940 }, { "entropy": 5.685274839401245, "epoch": 0.08814953020434156, "grad_norm": 1.3046875, "learning_rate": 5.038677762915381e-05, "loss": 5.2985, "mean_token_accuracy": 0.20485025644302368, "num_tokens": 3346200.0, "step": 3945 }, { "entropy": 5.628360939025879, "epoch": 0.088261253309797, "grad_norm": 1.328125, "learning_rate": 5.032080924811033e-05, "loss": 5.2183, "mean_token_accuracy": 0.2136240467429161, "num_tokens": 3350463.0, "step": 3950 }, { "entropy": 5.582505941390991, "epoch": 0.08837297641525244, "grad_norm": 1.3046875, "learning_rate": 5.026100056057718e-05, "loss": 5.2084, "mean_token_accuracy": 0.23170518428087233, "num_tokens": 3354207.0, "step": 3955 }, { "entropy": 5.67683629989624, "epoch": 0.08848469952070788, "grad_norm": 1.234375, "learning_rate": 5.0207353206239764e-05, "loss": 5.348, "mean_token_accuracy": 0.21558842658996583, "num_tokens": 3358954.0, "step": 3960 }, { "entropy": 5.7070441246032715, "epoch": 0.08859642262616332, "grad_norm": 1.3515625, "learning_rate": 5.0159868655867436e-05, "loss": 5.4158, "mean_token_accuracy": 0.21012357175350188, "num_tokens": 3363031.0, "step": 3965 }, { "entropy": 5.63456654548645, "epoch": 0.08870814573161875, "grad_norm": 1.3203125, "learning_rate": 5.011854821127305e-05, "loss": 5.3845, "mean_token_accuracy": 0.20455027371644974, "num_tokens": 3367512.0, "step": 3970 }, { "entropy": 5.658596038818359, "epoch": 0.0888198688370742, "grad_norm": 1.3671875, "learning_rate": 5.008339300527755e-05, "loss": 5.3662, "mean_token_accuracy": 0.2060423269867897, "num_tokens": 3371509.0, "step": 3975 }, { "entropy": 5.630813550949097, "epoch": 0.08893159194252963, "grad_norm": 1.5390625, "learning_rate": 5.005440400167859e-05, "loss": 5.3012, "mean_token_accuracy": 0.2052410736680031, "num_tokens": 3375476.0, "step": 3980 }, { "entropy": 5.597796773910522, "epoch": 0.08904331504798507, "grad_norm": 1.4296875, "learning_rate": 5.003158199522442e-05, "loss": 5.2462, "mean_token_accuracy": 0.21848327964544295, "num_tokens": 3379687.0, "step": 3985 }, { "entropy": 5.62085919380188, "epoch": 0.08915503815344052, "grad_norm": 1.46875, "learning_rate": 5.0014927611591806e-05, "loss": 5.3419, "mean_token_accuracy": 0.21537360697984695, "num_tokens": 3383750.0, "step": 3990 }, { "entropy": 5.628591918945313, "epoch": 0.08926676125889595, "grad_norm": 1.453125, "learning_rate": 5.000444130736916e-05, "loss": 5.3254, "mean_token_accuracy": 0.21683470755815507, "num_tokens": 3387621.0, "step": 3995 }, { "entropy": 5.56071720123291, "epoch": 0.08937848436435139, "grad_norm": 1.2421875, "learning_rate": 5.0000123370043736e-05, "loss": 5.2765, "mean_token_accuracy": 0.215224190056324, "num_tokens": 3392112.0, "step": 4000 } ], "logging_steps": 5, "max_steps": 4000, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 728529201561600.0, "train_batch_size": 16, "trial_name": null, "trial_params": null }