{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.20338786065026004, "eval_steps": 500, "global_step": 3500, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 10.692013454437255, "epoch": 0.0002905540866432286, "grad_norm": 12.125, "learning_rate": 2e-06, "loss": 10.8253, "mean_token_accuracy": 0.00011534024961292743, "num_tokens": 10788.0, "step": 5 }, { "entropy": 10.692022037506103, "epoch": 0.0005811081732864572, "grad_norm": 12.4375, "learning_rate": 4.5e-06, "loss": 10.7714, "mean_token_accuracy": 0.0003569915541447699, "num_tokens": 21530.0, "step": 10 }, { "entropy": 10.691065692901612, "epoch": 0.0008716622599296859, "grad_norm": 9.0625, "learning_rate": 7e-06, "loss": 10.5249, "mean_token_accuracy": 0.024039586074650288, "num_tokens": 31586.0, "step": 15 }, { "entropy": 10.681152439117431, "epoch": 0.0011622163465729145, "grad_norm": 6.59375, "learning_rate": 9.5e-06, "loss": 10.1914, "mean_token_accuracy": 0.04179190285503864, "num_tokens": 40558.0, "step": 20 }, { "entropy": 10.632322597503663, "epoch": 0.0014527704332161432, "grad_norm": 3.84375, "learning_rate": 1.2e-05, "loss": 9.9485, "mean_token_accuracy": 0.04313154201954603, "num_tokens": 50140.0, "step": 25 }, { "entropy": 10.600634860992432, "epoch": 0.0017433245198593718, "grad_norm": 3.3125, "learning_rate": 1.4500000000000002e-05, "loss": 9.7726, "mean_token_accuracy": 0.04188743010163307, "num_tokens": 59092.0, "step": 30 }, { "entropy": 10.610234546661378, "epoch": 0.0020338786065026006, "grad_norm": 2.796875, "learning_rate": 1.7000000000000003e-05, "loss": 9.7306, "mean_token_accuracy": 0.03705091737210751, "num_tokens": 68279.0, "step": 35 }, { "entropy": 10.6115083694458, "epoch": 0.002324432693145829, "grad_norm": 2.6875, "learning_rate": 1.95e-05, "loss": 9.7246, "mean_token_accuracy": 0.03739018738269806, "num_tokens": 79896.0, "step": 40 }, { "entropy": 10.594012641906739, "epoch": 0.0026149867797890577, "grad_norm": 2.453125, "learning_rate": 2.2e-05, "loss": 9.6422, "mean_token_accuracy": 0.04058306273072958, "num_tokens": 89336.0, "step": 45 }, { "entropy": 10.573887252807618, "epoch": 0.0029055408664322865, "grad_norm": 2.453125, "learning_rate": 2.4500000000000003e-05, "loss": 9.5546, "mean_token_accuracy": 0.04180898889899254, "num_tokens": 98466.0, "step": 50 }, { "entropy": 10.593281364440918, "epoch": 0.003196094953075515, "grad_norm": 2.59375, "learning_rate": 2.7e-05, "loss": 9.5105, "mean_token_accuracy": 0.04817579984664917, "num_tokens": 108540.0, "step": 55 }, { "entropy": 10.526645183563232, "epoch": 0.0034866490397187436, "grad_norm": 2.171875, "learning_rate": 2.95e-05, "loss": 9.4716, "mean_token_accuracy": 0.050264496356248856, "num_tokens": 118750.0, "step": 60 }, { "entropy": 10.412051582336426, "epoch": 0.0037772031263619723, "grad_norm": 2.140625, "learning_rate": 3.2e-05, "loss": 9.3319, "mean_token_accuracy": 0.05254916958510876, "num_tokens": 127809.0, "step": 65 }, { "entropy": 10.48470401763916, "epoch": 0.004067757213005201, "grad_norm": 2.421875, "learning_rate": 3.4500000000000005e-05, "loss": 9.2973, "mean_token_accuracy": 0.05050221066921949, "num_tokens": 137280.0, "step": 70 }, { "entropy": 10.446945762634277, "epoch": 0.0043583112996484295, "grad_norm": 2.078125, "learning_rate": 3.7e-05, "loss": 9.2174, "mean_token_accuracy": 0.050593961775302884, "num_tokens": 147299.0, "step": 75 }, { "entropy": 10.421859169006348, "epoch": 0.004648865386291658, "grad_norm": 2.578125, "learning_rate": 3.95e-05, "loss": 9.136, "mean_token_accuracy": 0.05404375270009041, "num_tokens": 157174.0, "step": 80 }, { "entropy": 10.441582870483398, "epoch": 0.004939419472934887, "grad_norm": 2.046875, "learning_rate": 4.2000000000000004e-05, "loss": 9.0058, "mean_token_accuracy": 0.05041108168661594, "num_tokens": 167491.0, "step": 85 }, { "entropy": 10.385116672515869, "epoch": 0.005229973559578115, "grad_norm": 2.046875, "learning_rate": 4.45e-05, "loss": 8.9325, "mean_token_accuracy": 0.05533732958137989, "num_tokens": 177873.0, "step": 90 }, { "entropy": 10.342092037200928, "epoch": 0.005520527646221344, "grad_norm": 1.9375, "learning_rate": 4.7000000000000004e-05, "loss": 8.826, "mean_token_accuracy": 0.0548530388623476, "num_tokens": 187473.0, "step": 95 }, { "entropy": 10.286836433410645, "epoch": 0.005811081732864573, "grad_norm": 1.9921875, "learning_rate": 4.9500000000000004e-05, "loss": 8.6569, "mean_token_accuracy": 0.05997130684554577, "num_tokens": 197515.0, "step": 100 }, { "entropy": 10.200335216522216, "epoch": 0.006101635819507801, "grad_norm": 1.921875, "learning_rate": 5.2e-05, "loss": 8.5902, "mean_token_accuracy": 0.058104698359966275, "num_tokens": 208667.0, "step": 105 }, { "entropy": 10.139002704620362, "epoch": 0.00639218990615103, "grad_norm": 1.7421875, "learning_rate": 5.45e-05, "loss": 8.4807, "mean_token_accuracy": 0.06041117906570435, "num_tokens": 218735.0, "step": 110 }, { "entropy": 10.01154441833496, "epoch": 0.006682743992794259, "grad_norm": 2.078125, "learning_rate": 5.7e-05, "loss": 8.3825, "mean_token_accuracy": 0.06299497745931149, "num_tokens": 228662.0, "step": 115 }, { "entropy": 9.89796781539917, "epoch": 0.006973298079437487, "grad_norm": 1.640625, "learning_rate": 5.9499999999999996e-05, "loss": 8.2306, "mean_token_accuracy": 0.0671528723090887, "num_tokens": 238398.0, "step": 120 }, { "entropy": 9.823051834106446, "epoch": 0.007263852166080716, "grad_norm": 1.546875, "learning_rate": 6.2e-05, "loss": 8.1653, "mean_token_accuracy": 0.06395192183554173, "num_tokens": 248686.0, "step": 125 }, { "entropy": 9.683453178405761, "epoch": 0.007554406252723945, "grad_norm": 1.7421875, "learning_rate": 6.450000000000001e-05, "loss": 8.047, "mean_token_accuracy": 0.06545184403657914, "num_tokens": 258243.0, "step": 130 }, { "entropy": 9.465025901794434, "epoch": 0.007844960339367173, "grad_norm": 1.4765625, "learning_rate": 6.7e-05, "loss": 7.8093, "mean_token_accuracy": 0.07491479925811291, "num_tokens": 266700.0, "step": 135 }, { "entropy": 9.230644702911377, "epoch": 0.008135514426010402, "grad_norm": 1.578125, "learning_rate": 6.950000000000001e-05, "loss": 7.7068, "mean_token_accuracy": 0.0849619172513485, "num_tokens": 275769.0, "step": 140 }, { "entropy": 9.029471111297607, "epoch": 0.00842606851265363, "grad_norm": 1.453125, "learning_rate": 7.2e-05, "loss": 7.7501, "mean_token_accuracy": 0.06648054942488671, "num_tokens": 286179.0, "step": 145 }, { "entropy": 8.853238105773926, "epoch": 0.008716622599296859, "grad_norm": 1.4765625, "learning_rate": 7.45e-05, "loss": 7.6829, "mean_token_accuracy": 0.06797396205365658, "num_tokens": 295721.0, "step": 150 }, { "entropy": 8.664832592010498, "epoch": 0.009007176685940088, "grad_norm": 1.671875, "learning_rate": 7.7e-05, "loss": 7.5839, "mean_token_accuracy": 0.06939561814069747, "num_tokens": 304857.0, "step": 155 }, { "entropy": 8.603672409057618, "epoch": 0.009297730772583316, "grad_norm": 1.3125, "learning_rate": 7.950000000000001e-05, "loss": 7.5881, "mean_token_accuracy": 0.0636594358831644, "num_tokens": 314711.0, "step": 160 }, { "entropy": 8.415755271911621, "epoch": 0.009588284859226545, "grad_norm": 1.1328125, "learning_rate": 8.2e-05, "loss": 7.4831, "mean_token_accuracy": 0.07131265327334405, "num_tokens": 324019.0, "step": 165 }, { "entropy": 8.281650257110595, "epoch": 0.009878838945869774, "grad_norm": 1.03125, "learning_rate": 8.450000000000001e-05, "loss": 7.4462, "mean_token_accuracy": 0.06885843947529793, "num_tokens": 334619.0, "step": 170 }, { "entropy": 8.176009941101075, "epoch": 0.010169393032513002, "grad_norm": 1.1328125, "learning_rate": 8.7e-05, "loss": 7.516, "mean_token_accuracy": 0.06891523078083991, "num_tokens": 343788.0, "step": 175 }, { "entropy": 8.143517398834229, "epoch": 0.01045994711915623, "grad_norm": 1.2109375, "learning_rate": 8.95e-05, "loss": 7.4422, "mean_token_accuracy": 0.06905875466763974, "num_tokens": 352974.0, "step": 180 }, { "entropy": 8.098498773574828, "epoch": 0.01075050120579946, "grad_norm": 1.265625, "learning_rate": 9.2e-05, "loss": 7.3605, "mean_token_accuracy": 0.07677599526941777, "num_tokens": 362342.0, "step": 185 }, { "entropy": 7.9134715557098385, "epoch": 0.011041055292442687, "grad_norm": 1.1875, "learning_rate": 9.45e-05, "loss": 7.3028, "mean_token_accuracy": 0.07759733125567436, "num_tokens": 372939.0, "step": 190 }, { "entropy": 7.9448919773101805, "epoch": 0.011331609379085917, "grad_norm": 1.265625, "learning_rate": 9.7e-05, "loss": 7.3574, "mean_token_accuracy": 0.07698826119303703, "num_tokens": 381957.0, "step": 195 }, { "entropy": 7.866607666015625, "epoch": 0.011622163465729146, "grad_norm": 1.3828125, "learning_rate": 9.95e-05, "loss": 7.359, "mean_token_accuracy": 0.07136249989271164, "num_tokens": 392592.0, "step": 200 }, { "entropy": 7.92036657333374, "epoch": 0.011912717552372373, "grad_norm": 1.3828125, "learning_rate": 0.000102, "loss": 7.3296, "mean_token_accuracy": 0.07443161755800247, "num_tokens": 402921.0, "step": 205 }, { "entropy": 7.811191749572754, "epoch": 0.012203271639015602, "grad_norm": 1.0859375, "learning_rate": 0.00010449999999999999, "loss": 7.2769, "mean_token_accuracy": 0.08031044751405716, "num_tokens": 412036.0, "step": 210 }, { "entropy": 7.7815025806427, "epoch": 0.012493825725658832, "grad_norm": 1.15625, "learning_rate": 0.000107, "loss": 7.2312, "mean_token_accuracy": 0.07401583753526211, "num_tokens": 422098.0, "step": 215 }, { "entropy": 7.856000328063965, "epoch": 0.01278437981230206, "grad_norm": 1.390625, "learning_rate": 0.0001095, "loss": 7.3411, "mean_token_accuracy": 0.07584784552454948, "num_tokens": 431146.0, "step": 220 }, { "entropy": 7.768830442428589, "epoch": 0.013074933898945288, "grad_norm": 1.6484375, "learning_rate": 0.000112, "loss": 7.3719, "mean_token_accuracy": 0.07549082823097705, "num_tokens": 440737.0, "step": 225 }, { "entropy": 7.7340232849121096, "epoch": 0.013365487985588518, "grad_norm": 1.1640625, "learning_rate": 0.0001145, "loss": 7.2487, "mean_token_accuracy": 0.07361838817596436, "num_tokens": 451703.0, "step": 230 }, { "entropy": 7.819036912918091, "epoch": 0.013656042072231747, "grad_norm": 1.34375, "learning_rate": 0.00011700000000000001, "loss": 7.2772, "mean_token_accuracy": 0.07234742939472198, "num_tokens": 461814.0, "step": 235 }, { "entropy": 7.680500268936157, "epoch": 0.013946596158874974, "grad_norm": 1.078125, "learning_rate": 0.00011949999999999999, "loss": 7.1571, "mean_token_accuracy": 0.08204417824745178, "num_tokens": 472097.0, "step": 240 }, { "entropy": 7.729534482955932, "epoch": 0.014237150245518203, "grad_norm": 1.3984375, "learning_rate": 0.000122, "loss": 7.1848, "mean_token_accuracy": 0.08709119185805321, "num_tokens": 481358.0, "step": 245 }, { "entropy": 7.560984992980957, "epoch": 0.014527704332161433, "grad_norm": 1.5078125, "learning_rate": 0.0001245, "loss": 7.2044, "mean_token_accuracy": 0.07833344042301178, "num_tokens": 491420.0, "step": 250 }, { "entropy": 7.682111406326294, "epoch": 0.01481825841880466, "grad_norm": 1.2734375, "learning_rate": 0.000127, "loss": 7.1728, "mean_token_accuracy": 0.08949121907353401, "num_tokens": 499373.0, "step": 255 }, { "entropy": 7.732259702682495, "epoch": 0.01510881250544789, "grad_norm": 1.234375, "learning_rate": 0.0001295, "loss": 7.2722, "mean_token_accuracy": 0.07445954978466034, "num_tokens": 509300.0, "step": 260 }, { "entropy": 7.59925479888916, "epoch": 0.015399366592091119, "grad_norm": 2.515625, "learning_rate": 0.000132, "loss": 7.2628, "mean_token_accuracy": 0.07740841507911682, "num_tokens": 519383.0, "step": 265 }, { "entropy": 7.5937131404876705, "epoch": 0.015689920678734346, "grad_norm": 1.2265625, "learning_rate": 0.00013450000000000002, "loss": 7.2049, "mean_token_accuracy": 0.07306748554110527, "num_tokens": 528947.0, "step": 270 }, { "entropy": 7.72738127708435, "epoch": 0.015980474765377575, "grad_norm": 1.328125, "learning_rate": 0.00013700000000000002, "loss": 7.1361, "mean_token_accuracy": 0.08117511533200741, "num_tokens": 538150.0, "step": 275 }, { "entropy": 7.532864713668824, "epoch": 0.016271028852020804, "grad_norm": 1.1953125, "learning_rate": 0.0001395, "loss": 7.1629, "mean_token_accuracy": 0.07852732315659523, "num_tokens": 547488.0, "step": 280 }, { "entropy": 7.593377494812012, "epoch": 0.016561582938664034, "grad_norm": 1.2890625, "learning_rate": 0.00014199999999999998, "loss": 7.1742, "mean_token_accuracy": 0.07643779553472996, "num_tokens": 556242.0, "step": 285 }, { "entropy": 7.6778340339660645, "epoch": 0.01685213702530726, "grad_norm": 1.2734375, "learning_rate": 0.0001445, "loss": 7.1334, "mean_token_accuracy": 0.07919927760958671, "num_tokens": 566407.0, "step": 290 }, { "entropy": 7.54665789604187, "epoch": 0.01714269111195049, "grad_norm": 1.3046875, "learning_rate": 0.000147, "loss": 7.1739, "mean_token_accuracy": 0.07580296993255616, "num_tokens": 575820.0, "step": 295 }, { "entropy": 7.5551825046539305, "epoch": 0.017433245198593718, "grad_norm": 1.2265625, "learning_rate": 0.0001495, "loss": 7.2182, "mean_token_accuracy": 0.0772180262953043, "num_tokens": 585374.0, "step": 300 }, { "entropy": 7.52297887802124, "epoch": 0.017723799285236947, "grad_norm": 1.21875, "learning_rate": 0.000152, "loss": 7.0797, "mean_token_accuracy": 0.07936501353979111, "num_tokens": 595141.0, "step": 305 }, { "entropy": 7.577914524078369, "epoch": 0.018014353371880176, "grad_norm": 1.296875, "learning_rate": 0.00015450000000000001, "loss": 7.0687, "mean_token_accuracy": 0.0796559315174818, "num_tokens": 604481.0, "step": 310 }, { "entropy": 7.417883062362671, "epoch": 0.018304907458523405, "grad_norm": 1.234375, "learning_rate": 0.000157, "loss": 7.0375, "mean_token_accuracy": 0.08207950145006179, "num_tokens": 614063.0, "step": 315 }, { "entropy": 7.440096426010132, "epoch": 0.01859546154516663, "grad_norm": 1.109375, "learning_rate": 0.0001595, "loss": 7.0574, "mean_token_accuracy": 0.07540913559496402, "num_tokens": 624389.0, "step": 320 }, { "entropy": 7.416240692138672, "epoch": 0.01888601563180986, "grad_norm": 1.1796875, "learning_rate": 0.000162, "loss": 7.087, "mean_token_accuracy": 0.08941936045885086, "num_tokens": 634289.0, "step": 325 }, { "entropy": 7.504856967926026, "epoch": 0.01917656971845309, "grad_norm": 1.1328125, "learning_rate": 0.00016450000000000001, "loss": 7.0857, "mean_token_accuracy": 0.081592907756567, "num_tokens": 643950.0, "step": 330 }, { "entropy": 7.438478994369507, "epoch": 0.01946712380509632, "grad_norm": 1.1875, "learning_rate": 0.00016700000000000002, "loss": 7.0506, "mean_token_accuracy": 0.07806282639503478, "num_tokens": 653210.0, "step": 335 }, { "entropy": 7.493538475036621, "epoch": 0.019757677891739548, "grad_norm": 1.375, "learning_rate": 0.00016950000000000003, "loss": 7.0527, "mean_token_accuracy": 0.08196914717555046, "num_tokens": 662862.0, "step": 340 }, { "entropy": 7.4518084049224855, "epoch": 0.020048231978382777, "grad_norm": 1.2265625, "learning_rate": 0.00017199999999999998, "loss": 7.0057, "mean_token_accuracy": 0.07910942509770394, "num_tokens": 673323.0, "step": 345 }, { "entropy": 7.414995431900024, "epoch": 0.020338786065026003, "grad_norm": 1.1015625, "learning_rate": 0.00017449999999999999, "loss": 7.055, "mean_token_accuracy": 0.08215757757425309, "num_tokens": 683532.0, "step": 350 }, { "entropy": 7.348615980148315, "epoch": 0.020629340151669232, "grad_norm": 1.234375, "learning_rate": 0.000177, "loss": 6.9814, "mean_token_accuracy": 0.0809572272002697, "num_tokens": 693162.0, "step": 355 }, { "entropy": 7.25407395362854, "epoch": 0.02091989423831246, "grad_norm": 0.95703125, "learning_rate": 0.0001795, "loss": 6.9904, "mean_token_accuracy": 0.07966803461313247, "num_tokens": 703783.0, "step": 360 }, { "entropy": 7.457367944717407, "epoch": 0.02121044832495569, "grad_norm": 1.296875, "learning_rate": 0.000182, "loss": 7.0101, "mean_token_accuracy": 0.08167746141552926, "num_tokens": 713083.0, "step": 365 }, { "entropy": 7.2763917446136475, "epoch": 0.02150100241159892, "grad_norm": 1.2265625, "learning_rate": 0.0001845, "loss": 6.9183, "mean_token_accuracy": 0.08331615403294564, "num_tokens": 722036.0, "step": 370 }, { "entropy": 7.346493482589722, "epoch": 0.02179155649824215, "grad_norm": 1.2109375, "learning_rate": 0.000187, "loss": 7.0015, "mean_token_accuracy": 0.08131363317370414, "num_tokens": 732465.0, "step": 375 }, { "entropy": 7.370974349975586, "epoch": 0.022082110584885375, "grad_norm": 1.15625, "learning_rate": 0.0001895, "loss": 7.0694, "mean_token_accuracy": 0.0784931555390358, "num_tokens": 742592.0, "step": 380 }, { "entropy": 7.243825960159302, "epoch": 0.022372664671528604, "grad_norm": 1.109375, "learning_rate": 0.000192, "loss": 6.9464, "mean_token_accuracy": 0.08015396147966385, "num_tokens": 752150.0, "step": 385 }, { "entropy": 7.414292812347412, "epoch": 0.022663218758171833, "grad_norm": 1.3359375, "learning_rate": 0.0001945, "loss": 7.0178, "mean_token_accuracy": 0.0777292400598526, "num_tokens": 761550.0, "step": 390 }, { "entropy": 7.340526723861695, "epoch": 0.022953772844815062, "grad_norm": 1.3515625, "learning_rate": 0.00019700000000000002, "loss": 6.9556, "mean_token_accuracy": 0.07885948345065116, "num_tokens": 771899.0, "step": 395 }, { "entropy": 7.310690546035767, "epoch": 0.02324432693145829, "grad_norm": 1.015625, "learning_rate": 0.00019950000000000002, "loss": 7.1145, "mean_token_accuracy": 0.07887880131602287, "num_tokens": 782948.0, "step": 400 }, { "entropy": 7.256437063217163, "epoch": 0.02353488101810152, "grad_norm": 1.28125, "learning_rate": 0.000202, "loss": 6.963, "mean_token_accuracy": 0.08006646111607552, "num_tokens": 792563.0, "step": 405 }, { "entropy": 7.28327488899231, "epoch": 0.023825435104744747, "grad_norm": 1.28125, "learning_rate": 0.00020449999999999998, "loss": 6.8839, "mean_token_accuracy": 0.0808573119342327, "num_tokens": 801736.0, "step": 410 }, { "entropy": 7.292191982269287, "epoch": 0.024115989191387976, "grad_norm": 1.1484375, "learning_rate": 0.000207, "loss": 6.9514, "mean_token_accuracy": 0.07757750265300274, "num_tokens": 811527.0, "step": 415 }, { "entropy": 7.277588653564453, "epoch": 0.024406543278031205, "grad_norm": 1.078125, "learning_rate": 0.0002095, "loss": 6.9567, "mean_token_accuracy": 0.08245478793978692, "num_tokens": 822003.0, "step": 420 }, { "entropy": 7.219156408309937, "epoch": 0.024697097364674434, "grad_norm": 1.2734375, "learning_rate": 0.000212, "loss": 6.8475, "mean_token_accuracy": 0.08649195730686188, "num_tokens": 831773.0, "step": 425 }, { "entropy": 7.16748538017273, "epoch": 0.024987651451317663, "grad_norm": 1.0859375, "learning_rate": 0.0002145, "loss": 6.853, "mean_token_accuracy": 0.08320235460996628, "num_tokens": 841233.0, "step": 430 }, { "entropy": 7.227472400665283, "epoch": 0.025278205537960893, "grad_norm": 1.0859375, "learning_rate": 0.00021700000000000002, "loss": 6.9353, "mean_token_accuracy": 0.0826109692454338, "num_tokens": 851851.0, "step": 435 }, { "entropy": 7.172217082977295, "epoch": 0.02556875962460412, "grad_norm": 1.21875, "learning_rate": 0.0002195, "loss": 6.8521, "mean_token_accuracy": 0.08434986025094986, "num_tokens": 861898.0, "step": 440 }, { "entropy": 7.161604738235473, "epoch": 0.025859313711247348, "grad_norm": 1.265625, "learning_rate": 0.000222, "loss": 6.9483, "mean_token_accuracy": 0.08010145872831345, "num_tokens": 871037.0, "step": 445 }, { "entropy": 7.2003782272338865, "epoch": 0.026149867797890577, "grad_norm": 0.984375, "learning_rate": 0.0002245, "loss": 6.8892, "mean_token_accuracy": 0.08248139917850494, "num_tokens": 882805.0, "step": 450 }, { "entropy": 7.0999010562896725, "epoch": 0.026440421884533806, "grad_norm": 1.03125, "learning_rate": 0.00022700000000000002, "loss": 6.8614, "mean_token_accuracy": 0.0847211316227913, "num_tokens": 893020.0, "step": 455 }, { "entropy": 7.154237747192383, "epoch": 0.026730975971177035, "grad_norm": 1.375, "learning_rate": 0.00022950000000000002, "loss": 6.8617, "mean_token_accuracy": 0.08975208401679993, "num_tokens": 902409.0, "step": 460 }, { "entropy": 7.152691459655761, "epoch": 0.027021530057820264, "grad_norm": 1.2734375, "learning_rate": 0.00023200000000000003, "loss": 6.8884, "mean_token_accuracy": 0.08094722181558608, "num_tokens": 912665.0, "step": 465 }, { "entropy": 7.048449563980102, "epoch": 0.027312084144463494, "grad_norm": 1.234375, "learning_rate": 0.00023449999999999998, "loss": 6.7633, "mean_token_accuracy": 0.0842330276966095, "num_tokens": 921520.0, "step": 470 }, { "entropy": 7.150616073608399, "epoch": 0.02760263823110672, "grad_norm": 1.1328125, "learning_rate": 0.000237, "loss": 6.7382, "mean_token_accuracy": 0.08964505940675735, "num_tokens": 931513.0, "step": 475 }, { "entropy": 7.082989072799682, "epoch": 0.02789319231774995, "grad_norm": 1.1796875, "learning_rate": 0.0002395, "loss": 6.8599, "mean_token_accuracy": 0.08315788432955742, "num_tokens": 940748.0, "step": 480 }, { "entropy": 7.063059997558594, "epoch": 0.028183746404393178, "grad_norm": 1.1328125, "learning_rate": 0.000242, "loss": 6.81, "mean_token_accuracy": 0.08362271934747696, "num_tokens": 949810.0, "step": 485 }, { "entropy": 7.115930604934692, "epoch": 0.028474300491036407, "grad_norm": 1.09375, "learning_rate": 0.0002445, "loss": 6.7554, "mean_token_accuracy": 0.09185877740383148, "num_tokens": 959122.0, "step": 490 }, { "entropy": 7.133077001571655, "epoch": 0.028764854577679636, "grad_norm": 1.1640625, "learning_rate": 0.000247, "loss": 6.887, "mean_token_accuracy": 0.08635125607252121, "num_tokens": 968974.0, "step": 495 }, { "entropy": 7.069976043701172, "epoch": 0.029055408664322865, "grad_norm": 1.0390625, "learning_rate": 0.0002495, "loss": 6.8548, "mean_token_accuracy": 0.08358358740806579, "num_tokens": 978444.0, "step": 500 }, { "entropy": 7.1011241436004635, "epoch": 0.02934596275096609, "grad_norm": 1.046875, "learning_rate": 0.000252, "loss": 6.7724, "mean_token_accuracy": 0.09029116481542587, "num_tokens": 988025.0, "step": 505 }, { "entropy": 7.02938323020935, "epoch": 0.02963651683760932, "grad_norm": 1.1640625, "learning_rate": 0.0002545, "loss": 6.8098, "mean_token_accuracy": 0.0861921526491642, "num_tokens": 997783.0, "step": 510 }, { "entropy": 7.101745176315307, "epoch": 0.02992707092425255, "grad_norm": 1.2421875, "learning_rate": 0.000257, "loss": 6.7998, "mean_token_accuracy": 0.08733523786067962, "num_tokens": 1006208.0, "step": 515 }, { "entropy": 6.995005512237549, "epoch": 0.03021762501089578, "grad_norm": 1.234375, "learning_rate": 0.0002595, "loss": 6.7581, "mean_token_accuracy": 0.08793584778904914, "num_tokens": 1016861.0, "step": 520 }, { "entropy": 7.110492086410522, "epoch": 0.030508179097539008, "grad_norm": 1.1640625, "learning_rate": 0.000262, "loss": 6.7479, "mean_token_accuracy": 0.08422723487019539, "num_tokens": 1026276.0, "step": 525 }, { "entropy": 6.966236734390259, "epoch": 0.030798733184182237, "grad_norm": 1.2578125, "learning_rate": 0.00026450000000000003, "loss": 6.8109, "mean_token_accuracy": 0.09106520414352418, "num_tokens": 1035571.0, "step": 530 }, { "entropy": 7.032464265823364, "epoch": 0.031089287270825463, "grad_norm": 1.2734375, "learning_rate": 0.00026700000000000004, "loss": 6.8321, "mean_token_accuracy": 0.08516258671879769, "num_tokens": 1044794.0, "step": 535 }, { "entropy": 7.120251321792603, "epoch": 0.03137984135746869, "grad_norm": 1.15625, "learning_rate": 0.00026950000000000005, "loss": 6.8057, "mean_token_accuracy": 0.08295166790485382, "num_tokens": 1054919.0, "step": 540 }, { "entropy": 6.968770742416382, "epoch": 0.031670395444111925, "grad_norm": 1.234375, "learning_rate": 0.00027200000000000005, "loss": 6.695, "mean_token_accuracy": 0.09049282670021057, "num_tokens": 1064220.0, "step": 545 }, { "entropy": 6.963365888595581, "epoch": 0.03196094953075515, "grad_norm": 1.1640625, "learning_rate": 0.0002745, "loss": 6.7935, "mean_token_accuracy": 0.08347960636019706, "num_tokens": 1075044.0, "step": 550 }, { "entropy": 7.027530097961426, "epoch": 0.032251503617398376, "grad_norm": 1.34375, "learning_rate": 0.000277, "loss": 6.7377, "mean_token_accuracy": 0.09026792943477631, "num_tokens": 1083608.0, "step": 555 }, { "entropy": 6.977536869049072, "epoch": 0.03254205770404161, "grad_norm": 1.125, "learning_rate": 0.0002795, "loss": 6.7649, "mean_token_accuracy": 0.09168017953634262, "num_tokens": 1094270.0, "step": 560 }, { "entropy": 6.97630295753479, "epoch": 0.032832611790684835, "grad_norm": 1.2421875, "learning_rate": 0.00028199999999999997, "loss": 6.7807, "mean_token_accuracy": 0.08632769882678985, "num_tokens": 1103763.0, "step": 565 }, { "entropy": 7.034525442123413, "epoch": 0.03312316587732807, "grad_norm": 1.1796875, "learning_rate": 0.0002845, "loss": 6.7585, "mean_token_accuracy": 0.09223658666014671, "num_tokens": 1113117.0, "step": 570 }, { "entropy": 6.9836554527282715, "epoch": 0.03341371996397129, "grad_norm": 1.234375, "learning_rate": 0.000287, "loss": 6.8207, "mean_token_accuracy": 0.0857993058860302, "num_tokens": 1123254.0, "step": 575 }, { "entropy": 6.890299654006958, "epoch": 0.03370427405061452, "grad_norm": 1.203125, "learning_rate": 0.0002895, "loss": 6.7576, "mean_token_accuracy": 0.09352053552865983, "num_tokens": 1132608.0, "step": 580 }, { "entropy": 6.976414442062378, "epoch": 0.03399482813725775, "grad_norm": 1.15625, "learning_rate": 0.000292, "loss": 6.6998, "mean_token_accuracy": 0.09929749593138695, "num_tokens": 1142525.0, "step": 585 }, { "entropy": 6.91153621673584, "epoch": 0.03428538222390098, "grad_norm": 1.2890625, "learning_rate": 0.0002945, "loss": 6.7312, "mean_token_accuracy": 0.09118211716413498, "num_tokens": 1151294.0, "step": 590 }, { "entropy": 6.890883445739746, "epoch": 0.03457593631054421, "grad_norm": 1.3046875, "learning_rate": 0.000297, "loss": 6.6838, "mean_token_accuracy": 0.09118377938866615, "num_tokens": 1160388.0, "step": 595 }, { "entropy": 7.041623067855835, "epoch": 0.034866490397187436, "grad_norm": 1.2578125, "learning_rate": 0.0002995, "loss": 6.8162, "mean_token_accuracy": 0.08897348642349243, "num_tokens": 1169616.0, "step": 600 }, { "entropy": 6.859910583496093, "epoch": 0.03515704448383067, "grad_norm": 1.2734375, "learning_rate": 0.000302, "loss": 6.6653, "mean_token_accuracy": 0.09158354997634888, "num_tokens": 1179715.0, "step": 605 }, { "entropy": 6.859572076797486, "epoch": 0.035447598570473894, "grad_norm": 1.1171875, "learning_rate": 0.0003045, "loss": 6.6291, "mean_token_accuracy": 0.09261076152324677, "num_tokens": 1188206.0, "step": 610 }, { "entropy": 6.957557249069214, "epoch": 0.03573815265711712, "grad_norm": 1.171875, "learning_rate": 0.000307, "loss": 6.7527, "mean_token_accuracy": 0.08373265452682972, "num_tokens": 1197372.0, "step": 615 }, { "entropy": 6.925255870819091, "epoch": 0.03602870674376035, "grad_norm": 1.109375, "learning_rate": 0.0003095, "loss": 6.7477, "mean_token_accuracy": 0.08401187434792519, "num_tokens": 1207698.0, "step": 620 }, { "entropy": 6.975111675262451, "epoch": 0.03631926083040358, "grad_norm": 1.078125, "learning_rate": 0.000312, "loss": 6.7088, "mean_token_accuracy": 0.08878697119653226, "num_tokens": 1217256.0, "step": 625 }, { "entropy": 6.7793882369995115, "epoch": 0.03660981491704681, "grad_norm": 1.125, "learning_rate": 0.0003145, "loss": 6.5962, "mean_token_accuracy": 0.08970977216959, "num_tokens": 1226574.0, "step": 630 }, { "entropy": 6.868472766876221, "epoch": 0.03690036900369004, "grad_norm": 1.21875, "learning_rate": 0.000317, "loss": 6.7118, "mean_token_accuracy": 0.09969199374318123, "num_tokens": 1234999.0, "step": 635 }, { "entropy": 6.824588871002197, "epoch": 0.03719092309033326, "grad_norm": 1.140625, "learning_rate": 0.0003195, "loss": 6.6674, "mean_token_accuracy": 0.09083129242062568, "num_tokens": 1244390.0, "step": 640 }, { "entropy": 6.80760760307312, "epoch": 0.037481477176976495, "grad_norm": 1.15625, "learning_rate": 0.000322, "loss": 6.6152, "mean_token_accuracy": 0.09922600984573364, "num_tokens": 1253649.0, "step": 645 }, { "entropy": 6.868955373764038, "epoch": 0.03777203126361972, "grad_norm": 1.078125, "learning_rate": 0.00032450000000000003, "loss": 6.6038, "mean_token_accuracy": 0.09038031622767448, "num_tokens": 1262715.0, "step": 650 }, { "entropy": 6.799616193771362, "epoch": 0.038062585350262954, "grad_norm": 1.2890625, "learning_rate": 0.00032700000000000003, "loss": 6.6623, "mean_token_accuracy": 0.09431513771414757, "num_tokens": 1271384.0, "step": 655 }, { "entropy": 6.898798608779908, "epoch": 0.03835313943690618, "grad_norm": 1.140625, "learning_rate": 0.00032950000000000004, "loss": 6.7402, "mean_token_accuracy": 0.09072391986846924, "num_tokens": 1281217.0, "step": 660 }, { "entropy": 6.83271975517273, "epoch": 0.03864369352354941, "grad_norm": 1.1328125, "learning_rate": 0.00033200000000000005, "loss": 6.7192, "mean_token_accuracy": 0.08845826983451843, "num_tokens": 1291419.0, "step": 665 }, { "entropy": 6.803164100646972, "epoch": 0.03893424761019264, "grad_norm": 1.28125, "learning_rate": 0.00033450000000000005, "loss": 6.7509, "mean_token_accuracy": 0.09317919313907623, "num_tokens": 1300750.0, "step": 670 }, { "entropy": 6.924269723892212, "epoch": 0.03922480169683586, "grad_norm": 1.1015625, "learning_rate": 0.000337, "loss": 6.674, "mean_token_accuracy": 0.09520297944545746, "num_tokens": 1309975.0, "step": 675 }, { "entropy": 6.822680854797364, "epoch": 0.039515355783479096, "grad_norm": 1.0390625, "learning_rate": 0.0003395, "loss": 6.6411, "mean_token_accuracy": 0.09562266170978546, "num_tokens": 1320984.0, "step": 680 }, { "entropy": 6.780631351470947, "epoch": 0.03980590987012232, "grad_norm": 1.125, "learning_rate": 0.000342, "loss": 6.6535, "mean_token_accuracy": 0.09362242966890336, "num_tokens": 1329901.0, "step": 685 }, { "entropy": 6.880793523788452, "epoch": 0.040096463956765555, "grad_norm": 1.2109375, "learning_rate": 0.00034449999999999997, "loss": 6.7526, "mean_token_accuracy": 0.09442069381475449, "num_tokens": 1340185.0, "step": 690 }, { "entropy": 6.807402038574219, "epoch": 0.04038701804340878, "grad_norm": 1.0703125, "learning_rate": 0.000347, "loss": 6.6918, "mean_token_accuracy": 0.09226417914032936, "num_tokens": 1349655.0, "step": 695 }, { "entropy": 6.853033638000488, "epoch": 0.040677572130052006, "grad_norm": 1.1796875, "learning_rate": 0.0003495, "loss": 6.6612, "mean_token_accuracy": 0.08990521878004074, "num_tokens": 1359193.0, "step": 700 }, { "entropy": 6.800865554809571, "epoch": 0.04096812621669524, "grad_norm": 1.09375, "learning_rate": 0.000352, "loss": 6.5969, "mean_token_accuracy": 0.09179130122065544, "num_tokens": 1368280.0, "step": 705 }, { "entropy": 6.742464542388916, "epoch": 0.041258680303338464, "grad_norm": 1.1875, "learning_rate": 0.0003545, "loss": 6.6564, "mean_token_accuracy": 0.08979732692241668, "num_tokens": 1378006.0, "step": 710 }, { "entropy": 6.877160882949829, "epoch": 0.0415492343899817, "grad_norm": 1.1953125, "learning_rate": 0.000357, "loss": 6.6672, "mean_token_accuracy": 0.09487208649516106, "num_tokens": 1387908.0, "step": 715 }, { "entropy": 6.7572847366333, "epoch": 0.04183978847662492, "grad_norm": 1.234375, "learning_rate": 0.0003595, "loss": 6.6392, "mean_token_accuracy": 0.09631308168172836, "num_tokens": 1396865.0, "step": 720 }, { "entropy": 6.801170921325683, "epoch": 0.042130342563268156, "grad_norm": 1.140625, "learning_rate": 0.000362, "loss": 6.6724, "mean_token_accuracy": 0.09610226228833199, "num_tokens": 1405636.0, "step": 725 }, { "entropy": 6.8957888126373295, "epoch": 0.04242089664991138, "grad_norm": 1.078125, "learning_rate": 0.0003645, "loss": 6.6814, "mean_token_accuracy": 0.09137585759162903, "num_tokens": 1414373.0, "step": 730 }, { "entropy": 6.785763597488403, "epoch": 0.04271145073655461, "grad_norm": 1.0, "learning_rate": 0.000367, "loss": 6.6742, "mean_token_accuracy": 0.09274838268756866, "num_tokens": 1425925.0, "step": 735 }, { "entropy": 6.702451086044311, "epoch": 0.04300200482319784, "grad_norm": 1.140625, "learning_rate": 0.0003695, "loss": 6.5992, "mean_token_accuracy": 0.092991454154253, "num_tokens": 1436539.0, "step": 740 }, { "entropy": 6.715664482116699, "epoch": 0.043292558909841065, "grad_norm": 1.15625, "learning_rate": 0.000372, "loss": 6.5928, "mean_token_accuracy": 0.09597984626889229, "num_tokens": 1445913.0, "step": 745 }, { "entropy": 6.814825916290284, "epoch": 0.0435831129964843, "grad_norm": 1.1484375, "learning_rate": 0.0003745, "loss": 6.6661, "mean_token_accuracy": 0.08998511806130409, "num_tokens": 1455387.0, "step": 750 }, { "entropy": 6.769626665115356, "epoch": 0.043873667083127524, "grad_norm": 1.0625, "learning_rate": 0.000377, "loss": 6.6905, "mean_token_accuracy": 0.09334170669317246, "num_tokens": 1465050.0, "step": 755 }, { "entropy": 6.801269054412842, "epoch": 0.04416422116977075, "grad_norm": 1.0625, "learning_rate": 0.0003795, "loss": 6.6236, "mean_token_accuracy": 0.0948921263217926, "num_tokens": 1474448.0, "step": 760 }, { "entropy": 6.676837682723999, "epoch": 0.04445477525641398, "grad_norm": 1.09375, "learning_rate": 0.000382, "loss": 6.5515, "mean_token_accuracy": 0.0982357420027256, "num_tokens": 1485048.0, "step": 765 }, { "entropy": 6.727758884429932, "epoch": 0.04474532934305721, "grad_norm": 1.171875, "learning_rate": 0.0003845, "loss": 6.5684, "mean_token_accuracy": 0.09265084117650986, "num_tokens": 1495441.0, "step": 770 }, { "entropy": 6.6234723091125485, "epoch": 0.04503588342970044, "grad_norm": 1.34375, "learning_rate": 0.00038700000000000003, "loss": 6.4869, "mean_token_accuracy": 0.10020759403705597, "num_tokens": 1504273.0, "step": 775 }, { "entropy": 6.7275268077850345, "epoch": 0.045326437516343666, "grad_norm": 1.109375, "learning_rate": 0.00038950000000000003, "loss": 6.6772, "mean_token_accuracy": 0.0932683877646923, "num_tokens": 1513631.0, "step": 780 }, { "entropy": 6.699482059478759, "epoch": 0.0456169916029869, "grad_norm": 1.0546875, "learning_rate": 0.00039200000000000004, "loss": 6.6101, "mean_token_accuracy": 0.0970641016960144, "num_tokens": 1524005.0, "step": 785 }, { "entropy": 6.69863338470459, "epoch": 0.045907545689630125, "grad_norm": 1.1015625, "learning_rate": 0.00039450000000000005, "loss": 6.5287, "mean_token_accuracy": 0.09622322842478752, "num_tokens": 1533970.0, "step": 790 }, { "entropy": 6.781415510177612, "epoch": 0.04619809977627335, "grad_norm": 1.15625, "learning_rate": 0.00039700000000000005, "loss": 6.614, "mean_token_accuracy": 0.0962904892861843, "num_tokens": 1543152.0, "step": 795 }, { "entropy": 6.566462612152099, "epoch": 0.04648865386291658, "grad_norm": 1.1171875, "learning_rate": 0.0003995, "loss": 6.4738, "mean_token_accuracy": 0.0966126188635826, "num_tokens": 1552181.0, "step": 800 }, { "entropy": 6.660043859481812, "epoch": 0.04677920794955981, "grad_norm": 1.15625, "learning_rate": 0.000402, "loss": 6.488, "mean_token_accuracy": 0.10304239392280579, "num_tokens": 1561384.0, "step": 805 }, { "entropy": 6.574128723144531, "epoch": 0.04706976203620304, "grad_norm": 1.0546875, "learning_rate": 0.0004045, "loss": 6.4141, "mean_token_accuracy": 0.10381592363119126, "num_tokens": 1570517.0, "step": 810 }, { "entropy": 6.631992340087891, "epoch": 0.04736031612284627, "grad_norm": 1.078125, "learning_rate": 0.00040699999999999997, "loss": 6.5389, "mean_token_accuracy": 0.09975797310471535, "num_tokens": 1579404.0, "step": 815 }, { "entropy": 6.548789834976196, "epoch": 0.04765087020948949, "grad_norm": 1.0625, "learning_rate": 0.0004095, "loss": 6.4271, "mean_token_accuracy": 0.09895784109830856, "num_tokens": 1589351.0, "step": 820 }, { "entropy": 6.643519687652588, "epoch": 0.047941424296132726, "grad_norm": 1.078125, "learning_rate": 0.000412, "loss": 6.4288, "mean_token_accuracy": 0.09936647340655327, "num_tokens": 1598083.0, "step": 825 }, { "entropy": 6.553793811798096, "epoch": 0.04823197838277595, "grad_norm": 1.1953125, "learning_rate": 0.0004145, "loss": 6.4337, "mean_token_accuracy": 0.10424233078956605, "num_tokens": 1607063.0, "step": 830 }, { "entropy": 6.551960134506226, "epoch": 0.048522532469419184, "grad_norm": 1.2421875, "learning_rate": 0.000417, "loss": 6.4999, "mean_token_accuracy": 0.1029004231095314, "num_tokens": 1616804.0, "step": 835 }, { "entropy": 6.624791765213013, "epoch": 0.04881308655606241, "grad_norm": 1.171875, "learning_rate": 0.0004195, "loss": 6.5016, "mean_token_accuracy": 0.10294707268476486, "num_tokens": 1626005.0, "step": 840 }, { "entropy": 6.597585964202881, "epoch": 0.04910364064270564, "grad_norm": 1.171875, "learning_rate": 0.000422, "loss": 6.4951, "mean_token_accuracy": 0.10337291657924652, "num_tokens": 1635145.0, "step": 845 }, { "entropy": 6.543288469314575, "epoch": 0.04939419472934887, "grad_norm": 1.1953125, "learning_rate": 0.0004245, "loss": 6.4558, "mean_token_accuracy": 0.10390876084566117, "num_tokens": 1644381.0, "step": 850 }, { "entropy": 6.646559333801269, "epoch": 0.049684748815992094, "grad_norm": 1.09375, "learning_rate": 0.000427, "loss": 6.606, "mean_token_accuracy": 0.09714684486389161, "num_tokens": 1653965.0, "step": 855 }, { "entropy": 6.615056085586548, "epoch": 0.04997530290263533, "grad_norm": 1.4296875, "learning_rate": 0.0004295, "loss": 6.4749, "mean_token_accuracy": 0.10362254977226257, "num_tokens": 1663120.0, "step": 860 }, { "entropy": 6.491550159454346, "epoch": 0.05026585698927855, "grad_norm": 1.1015625, "learning_rate": 0.000432, "loss": 6.4611, "mean_token_accuracy": 0.10190960243344308, "num_tokens": 1672533.0, "step": 865 }, { "entropy": 6.599954557418823, "epoch": 0.050556411075921785, "grad_norm": 1.0234375, "learning_rate": 0.0004345, "loss": 6.5367, "mean_token_accuracy": 0.09783021062612533, "num_tokens": 1682123.0, "step": 870 }, { "entropy": 6.579014635086059, "epoch": 0.05084696516256501, "grad_norm": 1.3671875, "learning_rate": 0.000437, "loss": 6.4836, "mean_token_accuracy": 0.09750580117106437, "num_tokens": 1690996.0, "step": 875 }, { "entropy": 6.623455667495728, "epoch": 0.05113751924920824, "grad_norm": 1.015625, "learning_rate": 0.0004395, "loss": 6.6269, "mean_token_accuracy": 0.09714528471231461, "num_tokens": 1701264.0, "step": 880 }, { "entropy": 6.633913516998291, "epoch": 0.05142807333585147, "grad_norm": 1.09375, "learning_rate": 0.000442, "loss": 6.53, "mean_token_accuracy": 0.10271772965788842, "num_tokens": 1711226.0, "step": 885 }, { "entropy": 6.582356214523315, "epoch": 0.051718627422494695, "grad_norm": 1.046875, "learning_rate": 0.0004445, "loss": 6.4446, "mean_token_accuracy": 0.10424281507730485, "num_tokens": 1721241.0, "step": 890 }, { "entropy": 6.601112365722656, "epoch": 0.05200918150913793, "grad_norm": 1.0546875, "learning_rate": 0.000447, "loss": 6.5286, "mean_token_accuracy": 0.10329965353012086, "num_tokens": 1730916.0, "step": 895 }, { "entropy": 6.650094270706177, "epoch": 0.052299735595781154, "grad_norm": 1.3203125, "learning_rate": 0.00044950000000000003, "loss": 6.5418, "mean_token_accuracy": 0.10129279345273971, "num_tokens": 1741590.0, "step": 900 }, { "entropy": 6.553584146499634, "epoch": 0.052590289682424386, "grad_norm": 1.2890625, "learning_rate": 0.00045200000000000004, "loss": 6.532, "mean_token_accuracy": 0.09813695922493934, "num_tokens": 1751419.0, "step": 905 }, { "entropy": 6.428548288345337, "epoch": 0.05288084376906761, "grad_norm": 1.1875, "learning_rate": 0.00045450000000000004, "loss": 6.3947, "mean_token_accuracy": 0.10944176390767098, "num_tokens": 1761947.0, "step": 910 }, { "entropy": 6.63139066696167, "epoch": 0.05317139785571084, "grad_norm": 1.1015625, "learning_rate": 0.00045700000000000005, "loss": 6.4533, "mean_token_accuracy": 0.1052020475268364, "num_tokens": 1773204.0, "step": 915 }, { "entropy": 6.442141962051392, "epoch": 0.05346195194235407, "grad_norm": 1.125, "learning_rate": 0.00045950000000000006, "loss": 6.4139, "mean_token_accuracy": 0.10542120933532714, "num_tokens": 1783110.0, "step": 920 }, { "entropy": 6.468068027496338, "epoch": 0.053752506028997296, "grad_norm": 1.109375, "learning_rate": 0.000462, "loss": 6.3869, "mean_token_accuracy": 0.10259869024157524, "num_tokens": 1791332.0, "step": 925 }, { "entropy": 6.4169505596160885, "epoch": 0.05404306011564053, "grad_norm": 1.046875, "learning_rate": 0.0004645, "loss": 6.4024, "mean_token_accuracy": 0.10698127672076226, "num_tokens": 1801302.0, "step": 930 }, { "entropy": 6.594544839859009, "epoch": 0.054333614202283755, "grad_norm": 1.1953125, "learning_rate": 0.000467, "loss": 6.497, "mean_token_accuracy": 0.10172575935721398, "num_tokens": 1810949.0, "step": 935 }, { "entropy": 6.589707708358764, "epoch": 0.05462416828892699, "grad_norm": 1.1328125, "learning_rate": 0.0004695, "loss": 6.482, "mean_token_accuracy": 0.10701743364334107, "num_tokens": 1820042.0, "step": 940 }, { "entropy": 6.3840772151947025, "epoch": 0.05491472237557021, "grad_norm": 1.0859375, "learning_rate": 0.000472, "loss": 6.4086, "mean_token_accuracy": 0.11226747334003448, "num_tokens": 1829079.0, "step": 945 }, { "entropy": 6.685991048812866, "epoch": 0.05520527646221344, "grad_norm": 1.09375, "learning_rate": 0.0004745, "loss": 6.6022, "mean_token_accuracy": 0.09806751757860184, "num_tokens": 1839635.0, "step": 950 }, { "entropy": 6.483322238922119, "epoch": 0.05549583054885667, "grad_norm": 1.1171875, "learning_rate": 0.000477, "loss": 6.458, "mean_token_accuracy": 0.10805773884057998, "num_tokens": 1849651.0, "step": 955 }, { "entropy": 6.516399383544922, "epoch": 0.0557863846354999, "grad_norm": 1.1015625, "learning_rate": 0.0004795, "loss": 6.4495, "mean_token_accuracy": 0.098360076546669, "num_tokens": 1859132.0, "step": 960 }, { "entropy": 6.511109638214111, "epoch": 0.05607693872214313, "grad_norm": 1.09375, "learning_rate": 0.000482, "loss": 6.4723, "mean_token_accuracy": 0.10554241985082627, "num_tokens": 1868063.0, "step": 965 }, { "entropy": 6.4864051818847654, "epoch": 0.056367492808786356, "grad_norm": 1.2109375, "learning_rate": 0.0004845, "loss": 6.4308, "mean_token_accuracy": 0.10283332020044327, "num_tokens": 1877204.0, "step": 970 }, { "entropy": 6.515411281585694, "epoch": 0.05665804689542958, "grad_norm": 1.046875, "learning_rate": 0.000487, "loss": 6.4761, "mean_token_accuracy": 0.10713874846696854, "num_tokens": 1886987.0, "step": 975 }, { "entropy": 6.520045566558838, "epoch": 0.056948600982072814, "grad_norm": 1.0703125, "learning_rate": 0.0004895, "loss": 6.5135, "mean_token_accuracy": 0.1081652283668518, "num_tokens": 1896791.0, "step": 980 }, { "entropy": 6.366655588150024, "epoch": 0.05723915506871604, "grad_norm": 1.1015625, "learning_rate": 0.000492, "loss": 6.3233, "mean_token_accuracy": 0.11065977737307549, "num_tokens": 1905878.0, "step": 985 }, { "entropy": 6.603346538543701, "epoch": 0.05752970915535927, "grad_norm": 1.171875, "learning_rate": 0.0004945, "loss": 6.5566, "mean_token_accuracy": 0.10223873779177665, "num_tokens": 1914742.0, "step": 990 }, { "entropy": 6.4896119117736815, "epoch": 0.0578202632420025, "grad_norm": 1.25, "learning_rate": 0.000497, "loss": 6.3861, "mean_token_accuracy": 0.10645260885357857, "num_tokens": 1924175.0, "step": 995 }, { "entropy": 6.419984769821167, "epoch": 0.05811081732864573, "grad_norm": 1.140625, "learning_rate": 0.0004995, "loss": 6.3878, "mean_token_accuracy": 0.11293421387672424, "num_tokens": 1933724.0, "step": 1000 }, { "entropy": 6.515293407440185, "epoch": 0.05840137141528896, "grad_norm": 1.0390625, "learning_rate": 0.000499998026082006, "loss": 6.5608, "mean_token_accuracy": 0.10285485908389091, "num_tokens": 1943987.0, "step": 1005 }, { "entropy": 6.596132755279541, "epoch": 0.05869192550193218, "grad_norm": 1.1484375, "learning_rate": 0.0004999900070995136, "loss": 6.5914, "mean_token_accuracy": 0.10778910219669342, "num_tokens": 1953754.0, "step": 1010 }, { "entropy": 6.429438877105713, "epoch": 0.058982479588575415, "grad_norm": 1.0859375, "learning_rate": 0.0004999758199023239, "loss": 6.4654, "mean_token_accuracy": 0.106864894926548, "num_tokens": 1963630.0, "step": 1015 }, { "entropy": 6.527030992507934, "epoch": 0.05927303367521864, "grad_norm": 1.125, "learning_rate": 0.0004999554648793858, "loss": 6.4443, "mean_token_accuracy": 0.11184166073799133, "num_tokens": 1973325.0, "step": 1020 }, { "entropy": 6.455427885055542, "epoch": 0.05956358776186187, "grad_norm": 1.15625, "learning_rate": 0.0004999289425887425, "loss": 6.364, "mean_token_accuracy": 0.11303301379084588, "num_tokens": 1983269.0, "step": 1025 }, { "entropy": 6.333305406570434, "epoch": 0.0598541418485051, "grad_norm": 1.1484375, "learning_rate": 0.0004998962537575161, "loss": 6.3086, "mean_token_accuracy": 0.10803757533431053, "num_tokens": 1992269.0, "step": 1030 }, { "entropy": 6.459513521194458, "epoch": 0.060144695935148325, "grad_norm": 1.1015625, "learning_rate": 0.0004998573992818874, "loss": 6.3731, "mean_token_accuracy": 0.10919068828225136, "num_tokens": 2001520.0, "step": 1035 }, { "entropy": 6.40694751739502, "epoch": 0.06043525002179156, "grad_norm": 1.125, "learning_rate": 0.0004998123802270715, "loss": 6.4015, "mean_token_accuracy": 0.10682632625102997, "num_tokens": 2009787.0, "step": 1040 }, { "entropy": 6.541155672073364, "epoch": 0.06072580410843478, "grad_norm": 1.09375, "learning_rate": 0.0004997611978272886, "loss": 6.4651, "mean_token_accuracy": 0.1081154353916645, "num_tokens": 2018830.0, "step": 1045 }, { "entropy": 6.345413541793823, "epoch": 0.061016358195078016, "grad_norm": 1.0078125, "learning_rate": 0.0004997038534857298, "loss": 6.3822, "mean_token_accuracy": 0.10369199216365814, "num_tokens": 2029222.0, "step": 1050 }, { "entropy": 6.523482990264893, "epoch": 0.06130691228172124, "grad_norm": 1.0078125, "learning_rate": 0.0004996403487745194, "loss": 6.4571, "mean_token_accuracy": 0.0996652863919735, "num_tokens": 2037777.0, "step": 1055 }, { "entropy": 6.409976768493652, "epoch": 0.061597466368364474, "grad_norm": 1.1171875, "learning_rate": 0.000499570685434671, "loss": 6.4149, "mean_token_accuracy": 0.10962732359766961, "num_tokens": 2048137.0, "step": 1060 }, { "entropy": 6.4193802833557125, "epoch": 0.0618880204550077, "grad_norm": 0.96484375, "learning_rate": 0.0004994948653760405, "loss": 6.4228, "mean_token_accuracy": 0.10600300803780556, "num_tokens": 2058379.0, "step": 1065 }, { "entropy": 6.587002468109131, "epoch": 0.062178574541650926, "grad_norm": 1.078125, "learning_rate": 0.0004994128906772729, "loss": 6.5367, "mean_token_accuracy": 0.10047689005732537, "num_tokens": 2068844.0, "step": 1070 }, { "entropy": 6.351005172729492, "epoch": 0.06246912862829416, "grad_norm": 1.21875, "learning_rate": 0.000499324763585746, "loss": 6.3839, "mean_token_accuracy": 0.11975573673844338, "num_tokens": 2078859.0, "step": 1075 }, { "entropy": 6.442875385284424, "epoch": 0.06275968271493738, "grad_norm": 1.140625, "learning_rate": 0.0004992304865175085, "loss": 6.4104, "mean_token_accuracy": 0.10901174843311309, "num_tokens": 2087621.0, "step": 1080 }, { "entropy": 6.451695346832276, "epoch": 0.06305023680158062, "grad_norm": 0.94921875, "learning_rate": 0.0004991300620572138, "loss": 6.4497, "mean_token_accuracy": 0.10689355432987213, "num_tokens": 2096878.0, "step": 1085 }, { "entropy": 6.527059412002563, "epoch": 0.06334079088822385, "grad_norm": 1.0078125, "learning_rate": 0.0004990234929580494, "loss": 6.4976, "mean_token_accuracy": 0.10578126087784767, "num_tokens": 2106018.0, "step": 1090 }, { "entropy": 6.425774145126343, "epoch": 0.06363134497486707, "grad_norm": 1.1484375, "learning_rate": 0.0004989107821416609, "loss": 6.3355, "mean_token_accuracy": 0.11034304574131966, "num_tokens": 2114980.0, "step": 1095 }, { "entropy": 6.324463939666748, "epoch": 0.0639218990615103, "grad_norm": 1.078125, "learning_rate": 0.0004987919326980723, "loss": 6.3556, "mean_token_accuracy": 0.10826032757759094, "num_tokens": 2123655.0, "step": 1100 }, { "entropy": 6.5232044696807865, "epoch": 0.06421245314815353, "grad_norm": 1.125, "learning_rate": 0.0004986669478856011, "loss": 6.4283, "mean_token_accuracy": 0.10399825125932693, "num_tokens": 2133543.0, "step": 1105 }, { "entropy": 6.313161087036133, "epoch": 0.06450300723479675, "grad_norm": 1.046875, "learning_rate": 0.0004985358311307688, "loss": 6.3388, "mean_token_accuracy": 0.11555257141590118, "num_tokens": 2142187.0, "step": 1110 }, { "entropy": 6.3854879379272464, "epoch": 0.06479356132143999, "grad_norm": 1.140625, "learning_rate": 0.0004983985860282081, "loss": 6.3585, "mean_token_accuracy": 0.10878968238830566, "num_tokens": 2151894.0, "step": 1115 }, { "entropy": 6.38906192779541, "epoch": 0.06508411540808322, "grad_norm": 1.15625, "learning_rate": 0.0004982552163405623, "loss": 6.2847, "mean_token_accuracy": 0.11355354338884353, "num_tokens": 2161930.0, "step": 1120 }, { "entropy": 6.289382266998291, "epoch": 0.06537466949472644, "grad_norm": 1.078125, "learning_rate": 0.0004981057259983839, "loss": 6.3569, "mean_token_accuracy": 0.1129719614982605, "num_tokens": 2171023.0, "step": 1125 }, { "entropy": 6.4400489807128904, "epoch": 0.06566522358136967, "grad_norm": 1.0546875, "learning_rate": 0.0004979501191000262, "loss": 6.4426, "mean_token_accuracy": 0.11219586357474327, "num_tokens": 2180657.0, "step": 1130 }, { "entropy": 6.376230049133301, "epoch": 0.0659557776680129, "grad_norm": 1.09375, "learning_rate": 0.0004977883999115311, "loss": 6.3582, "mean_token_accuracy": 0.10606605932116508, "num_tokens": 2191341.0, "step": 1135 }, { "entropy": 6.304773330688477, "epoch": 0.06624633175465613, "grad_norm": 1.1328125, "learning_rate": 0.0004976205728665113, "loss": 6.3338, "mean_token_accuracy": 0.10943459793925285, "num_tokens": 2200206.0, "step": 1140 }, { "entropy": 6.41196608543396, "epoch": 0.06653688584129935, "grad_norm": 1.03125, "learning_rate": 0.0004974466425660307, "loss": 6.3872, "mean_token_accuracy": 0.11151469200849533, "num_tokens": 2209840.0, "step": 1145 }, { "entropy": 6.328424167633057, "epoch": 0.06682743992794259, "grad_norm": 1.125, "learning_rate": 0.0004972666137784759, "loss": 6.3484, "mean_token_accuracy": 0.1169155366718769, "num_tokens": 2219304.0, "step": 1150 }, { "entropy": 6.443253898620606, "epoch": 0.06711799401458582, "grad_norm": 1.0625, "learning_rate": 0.0004970804914394271, "loss": 6.3727, "mean_token_accuracy": 0.11276882886886597, "num_tokens": 2229184.0, "step": 1155 }, { "entropy": 6.262433385848999, "epoch": 0.06740854810122904, "grad_norm": 1.1171875, "learning_rate": 0.0004968882806515225, "loss": 6.2706, "mean_token_accuracy": 0.11013494282960892, "num_tokens": 2238444.0, "step": 1160 }, { "entropy": 6.4703967571258545, "epoch": 0.06769910218787227, "grad_norm": 1.0703125, "learning_rate": 0.0004966899866843177, "loss": 6.4657, "mean_token_accuracy": 0.11107994392514228, "num_tokens": 2247346.0, "step": 1165 }, { "entropy": 6.371312046051026, "epoch": 0.0679896562745155, "grad_norm": 1.1015625, "learning_rate": 0.000496485614974142, "loss": 6.329, "mean_token_accuracy": 0.11129426136612892, "num_tokens": 2256532.0, "step": 1170 }, { "entropy": 6.257063865661621, "epoch": 0.06828021036115874, "grad_norm": 1.0078125, "learning_rate": 0.0004962751711239492, "loss": 6.2688, "mean_token_accuracy": 0.11564552634954453, "num_tokens": 2266254.0, "step": 1175 }, { "entropy": 6.30529637336731, "epoch": 0.06857076444780195, "grad_norm": 1.0859375, "learning_rate": 0.0004960586609031636, "loss": 6.2288, "mean_token_accuracy": 0.11662948206067085, "num_tokens": 2275285.0, "step": 1180 }, { "entropy": 6.3822582244873045, "epoch": 0.06886131853444519, "grad_norm": 1.1328125, "learning_rate": 0.0004958360902475224, "loss": 6.3453, "mean_token_accuracy": 0.11292837411165238, "num_tokens": 2285448.0, "step": 1185 }, { "entropy": 6.24997091293335, "epoch": 0.06915187262108842, "grad_norm": 1.0703125, "learning_rate": 0.0004956074652589125, "loss": 6.2455, "mean_token_accuracy": 0.1130777969956398, "num_tokens": 2295896.0, "step": 1190 }, { "entropy": 6.280991077423096, "epoch": 0.06944242670773164, "grad_norm": 1.171875, "learning_rate": 0.0004953727922052035, "loss": 6.3089, "mean_token_accuracy": 0.10868189558386802, "num_tokens": 2306873.0, "step": 1195 }, { "entropy": 6.47158374786377, "epoch": 0.06973298079437487, "grad_norm": 1.1015625, "learning_rate": 0.0004951320775200756, "loss": 6.4186, "mean_token_accuracy": 0.10683797150850297, "num_tokens": 2317843.0, "step": 1200 }, { "entropy": 6.257269239425659, "epoch": 0.0700235348810181, "grad_norm": 1.0390625, "learning_rate": 0.0004948853278028436, "loss": 6.2455, "mean_token_accuracy": 0.11401106640696526, "num_tokens": 2327047.0, "step": 1205 }, { "entropy": 6.321083211898804, "epoch": 0.07031408896766134, "grad_norm": 1.0625, "learning_rate": 0.0004946325498182755, "loss": 6.3372, "mean_token_accuracy": 0.11759073585271836, "num_tokens": 2336893.0, "step": 1210 }, { "entropy": 6.334356689453125, "epoch": 0.07060464305430456, "grad_norm": 0.93359375, "learning_rate": 0.0004943737504964076, "loss": 6.2793, "mean_token_accuracy": 0.11712626814842224, "num_tokens": 2346788.0, "step": 1215 }, { "entropy": 6.306163549423218, "epoch": 0.07089519714094779, "grad_norm": 0.9609375, "learning_rate": 0.000494108936932354, "loss": 6.285, "mean_token_accuracy": 0.11232926696538925, "num_tokens": 2356261.0, "step": 1220 }, { "entropy": 6.299500322341919, "epoch": 0.07118575122759102, "grad_norm": 1.125, "learning_rate": 0.0004938381163861124, "loss": 6.2777, "mean_token_accuracy": 0.11824780255556107, "num_tokens": 2366038.0, "step": 1225 }, { "entropy": 6.250729322433472, "epoch": 0.07147630531423424, "grad_norm": 1.0390625, "learning_rate": 0.0004935612962823645, "loss": 6.2505, "mean_token_accuracy": 0.11852356940507888, "num_tokens": 2375839.0, "step": 1230 }, { "entropy": 6.387542676925659, "epoch": 0.07176685940087747, "grad_norm": 1.09375, "learning_rate": 0.0004932784842102739, "loss": 6.2843, "mean_token_accuracy": 0.11505208611488342, "num_tokens": 2384862.0, "step": 1235 }, { "entropy": 6.261922121047974, "epoch": 0.0720574134875207, "grad_norm": 0.984375, "learning_rate": 0.0004929896879232758, "loss": 6.3258, "mean_token_accuracy": 0.10773891285061836, "num_tokens": 2395086.0, "step": 1240 }, { "entropy": 6.389956378936768, "epoch": 0.07234796757416392, "grad_norm": 1.0390625, "learning_rate": 0.0004926949153388668, "loss": 6.3688, "mean_token_accuracy": 0.11114799231290817, "num_tokens": 2405601.0, "step": 1245 }, { "entropy": 6.205085325241089, "epoch": 0.07263852166080716, "grad_norm": 0.91015625, "learning_rate": 0.0004923941745383859, "loss": 6.2512, "mean_token_accuracy": 0.1158894307911396, "num_tokens": 2416195.0, "step": 1250 }, { "entropy": 6.327854824066162, "epoch": 0.07292907574745039, "grad_norm": 1.125, "learning_rate": 0.000492087473766794, "loss": 6.1885, "mean_token_accuracy": 0.11666455045342446, "num_tokens": 2424810.0, "step": 1255 }, { "entropy": 6.270368146896362, "epoch": 0.07321962983409362, "grad_norm": 1.140625, "learning_rate": 0.000491774821432448, "loss": 6.3428, "mean_token_accuracy": 0.11471045464277267, "num_tokens": 2434367.0, "step": 1260 }, { "entropy": 6.3180938243865965, "epoch": 0.07351018392073684, "grad_norm": 1.125, "learning_rate": 0.0004914562261068693, "loss": 6.2969, "mean_token_accuracy": 0.11603154689073562, "num_tokens": 2443610.0, "step": 1265 }, { "entropy": 6.276625680923462, "epoch": 0.07380073800738007, "grad_norm": 1.078125, "learning_rate": 0.0004911316965245098, "loss": 6.2087, "mean_token_accuracy": 0.11644172966480255, "num_tokens": 2453481.0, "step": 1270 }, { "entropy": 6.126973104476929, "epoch": 0.0740912920940233, "grad_norm": 0.98828125, "learning_rate": 0.000490801241582512, "loss": 6.2526, "mean_token_accuracy": 0.12029187902808189, "num_tokens": 2463104.0, "step": 1275 }, { "entropy": 6.366124963760376, "epoch": 0.07438184618066652, "grad_norm": 1.046875, "learning_rate": 0.000490464870340465, "loss": 6.2256, "mean_token_accuracy": 0.11856506243348122, "num_tokens": 2472860.0, "step": 1280 }, { "entropy": 6.325764846801758, "epoch": 0.07467240026730976, "grad_norm": 1.1015625, "learning_rate": 0.0004901225920201563, "loss": 6.26, "mean_token_accuracy": 0.11878090873360633, "num_tokens": 2482643.0, "step": 1285 }, { "entropy": 6.244407844543457, "epoch": 0.07496295435395299, "grad_norm": 1.1015625, "learning_rate": 0.000489774416005319, "loss": 6.2963, "mean_token_accuracy": 0.11809295788407326, "num_tokens": 2491895.0, "step": 1290 }, { "entropy": 6.29679856300354, "epoch": 0.07525350844059622, "grad_norm": 1.1953125, "learning_rate": 0.0004894203518413742, "loss": 6.2099, "mean_token_accuracy": 0.11272355318069457, "num_tokens": 2501080.0, "step": 1295 }, { "entropy": 6.253429985046386, "epoch": 0.07554406252723944, "grad_norm": 1.1328125, "learning_rate": 0.0004890604092351701, "loss": 6.2024, "mean_token_accuracy": 0.11589482352137566, "num_tokens": 2510341.0, "step": 1300 }, { "entropy": 6.217455101013184, "epoch": 0.07583461661388267, "grad_norm": 1.0078125, "learning_rate": 0.000488694598054715, "loss": 6.3344, "mean_token_accuracy": 0.117685367166996, "num_tokens": 2520655.0, "step": 1305 }, { "entropy": 6.29218373298645, "epoch": 0.07612517070052591, "grad_norm": 0.99609375, "learning_rate": 0.0004883229283289071, "loss": 6.259, "mean_token_accuracy": 0.11394123807549476, "num_tokens": 2530022.0, "step": 1310 }, { "entropy": 6.272565269470215, "epoch": 0.07641572478716913, "grad_norm": 1.03125, "learning_rate": 0.00048794541024725993, "loss": 6.2531, "mean_token_accuracy": 0.11075997799634933, "num_tokens": 2541451.0, "step": 1315 }, { "entropy": 6.214617490768433, "epoch": 0.07670627887381236, "grad_norm": 1.0546875, "learning_rate": 0.0004875620541596221, "loss": 6.1515, "mean_token_accuracy": 0.11713779196143151, "num_tokens": 2550299.0, "step": 1320 }, { "entropy": 6.279712581634522, "epoch": 0.07699683296045559, "grad_norm": 1.0078125, "learning_rate": 0.00048717287057589454, "loss": 6.2833, "mean_token_accuracy": 0.11670693308115006, "num_tokens": 2560422.0, "step": 1325 }, { "entropy": 6.251215887069702, "epoch": 0.07728738704709882, "grad_norm": 0.97265625, "learning_rate": 0.0004867778701657417, "loss": 6.1963, "mean_token_accuracy": 0.12052965685725212, "num_tokens": 2570327.0, "step": 1330 }, { "entropy": 6.290622997283935, "epoch": 0.07757794113374204, "grad_norm": 0.97265625, "learning_rate": 0.00048637706375829955, "loss": 6.303, "mean_token_accuracy": 0.12087919563055038, "num_tokens": 2580026.0, "step": 1335 }, { "entropy": 6.2676429271698, "epoch": 0.07786849522038528, "grad_norm": 1.0859375, "learning_rate": 0.000485970462341878, "loss": 6.3344, "mean_token_accuracy": 0.11165543794631957, "num_tokens": 2591172.0, "step": 1340 }, { "entropy": 6.31669340133667, "epoch": 0.07815904930702851, "grad_norm": 0.89453125, "learning_rate": 0.00048555807706366044, "loss": 6.2188, "mean_token_accuracy": 0.11619681417942047, "num_tokens": 2601725.0, "step": 1345 }, { "entropy": 6.1492432117462155, "epoch": 0.07844960339367173, "grad_norm": 1.0625, "learning_rate": 0.00048513991922939756, "loss": 6.2285, "mean_token_accuracy": 0.10701777413487434, "num_tokens": 2611909.0, "step": 1350 }, { "entropy": 6.327322006225586, "epoch": 0.07874015748031496, "grad_norm": 1.09375, "learning_rate": 0.00048471600030309744, "loss": 6.2134, "mean_token_accuracy": 0.11941884234547614, "num_tokens": 2621273.0, "step": 1355 }, { "entropy": 6.27476658821106, "epoch": 0.07903071156695819, "grad_norm": 1.203125, "learning_rate": 0.00048428633190671186, "loss": 6.2408, "mean_token_accuracy": 0.11688115298748017, "num_tokens": 2631072.0, "step": 1360 }, { "entropy": 6.332375431060791, "epoch": 0.07932126565360141, "grad_norm": 1.0546875, "learning_rate": 0.0004838509258198167, "loss": 6.3279, "mean_token_accuracy": 0.10464770346879959, "num_tokens": 2641868.0, "step": 1365 }, { "entropy": 6.315234565734864, "epoch": 0.07961181974024464, "grad_norm": 1.0234375, "learning_rate": 0.00048340979397929, "loss": 6.2211, "mean_token_accuracy": 0.11905064806342125, "num_tokens": 2651495.0, "step": 1370 }, { "entropy": 6.127819538116455, "epoch": 0.07990237382688788, "grad_norm": 1.046875, "learning_rate": 0.00048296294847898386, "loss": 6.1337, "mean_token_accuracy": 0.12542947009205818, "num_tokens": 2660418.0, "step": 1375 }, { "entropy": 6.218345642089844, "epoch": 0.08019292791353111, "grad_norm": 0.96484375, "learning_rate": 0.0004825104015693934, "loss": 6.3179, "mean_token_accuracy": 0.11425245255231857, "num_tokens": 2670656.0, "step": 1380 }, { "entropy": 6.304035377502442, "epoch": 0.08048348200017433, "grad_norm": 1.0390625, "learning_rate": 0.0004820521656573208, "loss": 6.1612, "mean_token_accuracy": 0.12277446761727333, "num_tokens": 2679806.0, "step": 1385 }, { "entropy": 6.233858823776245, "epoch": 0.08077403608681756, "grad_norm": 1.0, "learning_rate": 0.00048158825330553505, "loss": 6.2365, "mean_token_accuracy": 0.11297848522663116, "num_tokens": 2689690.0, "step": 1390 }, { "entropy": 6.260920190811158, "epoch": 0.0810645901734608, "grad_norm": 1.0859375, "learning_rate": 0.00048111867723242763, "loss": 6.2509, "mean_token_accuracy": 0.11679463014006615, "num_tokens": 2699923.0, "step": 1395 }, { "entropy": 6.293380784988403, "epoch": 0.08135514426010401, "grad_norm": 0.99609375, "learning_rate": 0.0004806434503116637, "loss": 6.2307, "mean_token_accuracy": 0.12221046313643455, "num_tokens": 2709476.0, "step": 1400 }, { "entropy": 6.20638747215271, "epoch": 0.08164569834674724, "grad_norm": 0.97265625, "learning_rate": 0.0004801625855718296, "loss": 6.243, "mean_token_accuracy": 0.12326459586620331, "num_tokens": 2719235.0, "step": 1405 }, { "entropy": 6.2035150051116945, "epoch": 0.08193625243339048, "grad_norm": 1.046875, "learning_rate": 0.00047967609619607477, "loss": 6.1337, "mean_token_accuracy": 0.12361931875348091, "num_tokens": 2728275.0, "step": 1410 }, { "entropy": 6.172535991668701, "epoch": 0.08222680652003371, "grad_norm": 1.078125, "learning_rate": 0.0004791839955217513, "loss": 6.2901, "mean_token_accuracy": 0.11154365614056587, "num_tokens": 2739138.0, "step": 1415 }, { "entropy": 6.309834671020508, "epoch": 0.08251736060667693, "grad_norm": 0.9921875, "learning_rate": 0.00047868629704004786, "loss": 6.1975, "mean_token_accuracy": 0.12241730839014053, "num_tokens": 2749077.0, "step": 1420 }, { "entropy": 6.187080812454224, "epoch": 0.08280791469332016, "grad_norm": 1.0859375, "learning_rate": 0.00047818301439561965, "loss": 6.1652, "mean_token_accuracy": 0.12800487205386163, "num_tokens": 2758005.0, "step": 1425 }, { "entropy": 6.194875431060791, "epoch": 0.0830984687799634, "grad_norm": 1.0078125, "learning_rate": 0.00047767416138621454, "loss": 6.1579, "mean_token_accuracy": 0.12136282622814179, "num_tokens": 2768012.0, "step": 1430 }, { "entropy": 6.2406840324401855, "epoch": 0.08338902286660661, "grad_norm": 0.98828125, "learning_rate": 0.000477159751962295, "loss": 6.2887, "mean_token_accuracy": 0.11709356978535652, "num_tokens": 2778694.0, "step": 1435 }, { "entropy": 6.249140071868896, "epoch": 0.08367957695324985, "grad_norm": 1.078125, "learning_rate": 0.00047663980022665507, "loss": 6.1696, "mean_token_accuracy": 0.12004066854715348, "num_tokens": 2788970.0, "step": 1440 }, { "entropy": 6.281752204895019, "epoch": 0.08397013103989308, "grad_norm": 1.0625, "learning_rate": 0.00047611432043403437, "loss": 6.1724, "mean_token_accuracy": 0.126155137270689, "num_tokens": 2797712.0, "step": 1445 }, { "entropy": 6.065038061141967, "epoch": 0.08426068512653631, "grad_norm": 1.0625, "learning_rate": 0.0004755833269907267, "loss": 6.1986, "mean_token_accuracy": 0.1191088818013668, "num_tokens": 2807812.0, "step": 1450 }, { "entropy": 6.368619108200074, "epoch": 0.08455123921317953, "grad_norm": 1.15625, "learning_rate": 0.0004750468344541857, "loss": 6.2814, "mean_token_accuracy": 0.11855203360319137, "num_tokens": 2817983.0, "step": 1455 }, { "entropy": 6.161626720428467, "epoch": 0.08484179329982276, "grad_norm": 0.98046875, "learning_rate": 0.00047450485753262525, "loss": 6.1715, "mean_token_accuracy": 0.11652336046099662, "num_tokens": 2827936.0, "step": 1460 }, { "entropy": 6.251077365875244, "epoch": 0.085132347386466, "grad_norm": 1.1171875, "learning_rate": 0.00047395741108461633, "loss": 6.1981, "mean_token_accuracy": 0.13417380750179292, "num_tokens": 2838088.0, "step": 1465 }, { "entropy": 6.252039957046509, "epoch": 0.08542290147310921, "grad_norm": 1.1015625, "learning_rate": 0.00047340451011867985, "loss": 6.1931, "mean_token_accuracy": 0.12354014292359353, "num_tokens": 2847463.0, "step": 1470 }, { "entropy": 6.080291652679444, "epoch": 0.08571345555975245, "grad_norm": 0.97265625, "learning_rate": 0.00047284616979287515, "loss": 6.1409, "mean_token_accuracy": 0.12890383899211882, "num_tokens": 2857021.0, "step": 1475 }, { "entropy": 6.2580098628997805, "epoch": 0.08600400964639568, "grad_norm": 0.9765625, "learning_rate": 0.00047228240541438433, "loss": 6.1901, "mean_token_accuracy": 0.12243498712778092, "num_tokens": 2867577.0, "step": 1480 }, { "entropy": 6.258398723602295, "epoch": 0.08629456373303891, "grad_norm": 1.1484375, "learning_rate": 0.00047171323243909257, "loss": 6.2612, "mean_token_accuracy": 0.1226688154041767, "num_tokens": 2877508.0, "step": 1485 }, { "entropy": 6.195114278793335, "epoch": 0.08658511781968213, "grad_norm": 0.96484375, "learning_rate": 0.00047113866647116457, "loss": 6.1484, "mean_token_accuracy": 0.12138795107603073, "num_tokens": 2887193.0, "step": 1490 }, { "entropy": 6.263925457000733, "epoch": 0.08687567190632536, "grad_norm": 1.0390625, "learning_rate": 0.0004705587232626164, "loss": 6.1099, "mean_token_accuracy": 0.12464227676391601, "num_tokens": 2896345.0, "step": 1495 }, { "entropy": 6.047787523269653, "epoch": 0.0871662259929686, "grad_norm": 1.0390625, "learning_rate": 0.00046997341871288424, "loss": 6.0758, "mean_token_accuracy": 0.12386289611458778, "num_tokens": 2905855.0, "step": 1500 }, { "entropy": 6.170946264266968, "epoch": 0.08745678007961181, "grad_norm": 1.125, "learning_rate": 0.0004693827688683879, "loss": 6.1479, "mean_token_accuracy": 0.12517718896269797, "num_tokens": 2914747.0, "step": 1505 }, { "entropy": 6.053203916549682, "epoch": 0.08774733416625505, "grad_norm": 1.03125, "learning_rate": 0.0004687867899220914, "loss": 6.0277, "mean_token_accuracy": 0.1249882385134697, "num_tokens": 2924085.0, "step": 1510 }, { "entropy": 6.226366186141968, "epoch": 0.08803788825289828, "grad_norm": 1.0234375, "learning_rate": 0.00046818549821305846, "loss": 6.184, "mean_token_accuracy": 0.12349544689059258, "num_tokens": 2934137.0, "step": 1515 }, { "entropy": 6.120088529586792, "epoch": 0.0883284423395415, "grad_norm": 1.015625, "learning_rate": 0.00046757891022600494, "loss": 6.0708, "mean_token_accuracy": 0.12396376803517342, "num_tokens": 2943868.0, "step": 1520 }, { "entropy": 6.102652740478516, "epoch": 0.08861899642618473, "grad_norm": 1.0546875, "learning_rate": 0.0004669670425908471, "loss": 6.1274, "mean_token_accuracy": 0.1155236929655075, "num_tokens": 2953399.0, "step": 1525 }, { "entropy": 6.192172336578369, "epoch": 0.08890955051282796, "grad_norm": 1.046875, "learning_rate": 0.0004663499120822451, "loss": 6.1235, "mean_token_accuracy": 0.12404483556747437, "num_tokens": 2963356.0, "step": 1530 }, { "entropy": 6.156837511062622, "epoch": 0.0892001045994712, "grad_norm": 1.0390625, "learning_rate": 0.0004657275356191437, "loss": 6.1485, "mean_token_accuracy": 0.11465330868959427, "num_tokens": 2973111.0, "step": 1535 }, { "entropy": 6.199955844879151, "epoch": 0.08949065868611442, "grad_norm": 1.0, "learning_rate": 0.00046509993026430804, "loss": 6.2266, "mean_token_accuracy": 0.12046344429254532, "num_tokens": 2983410.0, "step": 1540 }, { "entropy": 6.216725921630859, "epoch": 0.08978121277275765, "grad_norm": 1.171875, "learning_rate": 0.0004644671132238558, "loss": 6.1542, "mean_token_accuracy": 0.12176189124584198, "num_tokens": 2992168.0, "step": 1545 }, { "entropy": 6.1444254398345945, "epoch": 0.09007176685940088, "grad_norm": 1.09375, "learning_rate": 0.00046382910184678585, "loss": 6.124, "mean_token_accuracy": 0.11986778303980827, "num_tokens": 3001813.0, "step": 1550 }, { "entropy": 6.1660035133361815, "epoch": 0.0903623209460441, "grad_norm": 1.078125, "learning_rate": 0.0004631859136245025, "loss": 6.2097, "mean_token_accuracy": 0.12152451127767563, "num_tokens": 3010646.0, "step": 1555 }, { "entropy": 6.243027400970459, "epoch": 0.09065287503268733, "grad_norm": 1.078125, "learning_rate": 0.0004625375661903357, "loss": 6.1377, "mean_token_accuracy": 0.12305564433336258, "num_tokens": 3019647.0, "step": 1560 }, { "entropy": 6.047219085693359, "epoch": 0.09094342911933057, "grad_norm": 1.015625, "learning_rate": 0.00046188407731905787, "loss": 6.0258, "mean_token_accuracy": 0.12844225764274597, "num_tokens": 3029071.0, "step": 1565 }, { "entropy": 6.0907470226287845, "epoch": 0.0912339832059738, "grad_norm": 1.0234375, "learning_rate": 0.00046122546492639643, "loss": 6.0384, "mean_token_accuracy": 0.13014808297157288, "num_tokens": 3037978.0, "step": 1570 }, { "entropy": 6.1422034740448, "epoch": 0.09152453729261702, "grad_norm": 1.09375, "learning_rate": 0.000460561747068543, "loss": 6.1474, "mean_token_accuracy": 0.12799782454967498, "num_tokens": 3047312.0, "step": 1575 }, { "entropy": 6.136872339248657, "epoch": 0.09181509137926025, "grad_norm": 1.0546875, "learning_rate": 0.0004598929419416578, "loss": 6.0871, "mean_token_accuracy": 0.12448323741555214, "num_tokens": 3055657.0, "step": 1580 }, { "entropy": 6.184458923339844, "epoch": 0.09210564546590348, "grad_norm": 1.0078125, "learning_rate": 0.00045921906788137123, "loss": 6.2451, "mean_token_accuracy": 0.1185241773724556, "num_tokens": 3066344.0, "step": 1585 }, { "entropy": 6.301413631439209, "epoch": 0.0923961995525467, "grad_norm": 1.0078125, "learning_rate": 0.00045854014336228115, "loss": 6.2121, "mean_token_accuracy": 0.11998013481497764, "num_tokens": 3076481.0, "step": 1590 }, { "entropy": 6.087073802947998, "epoch": 0.09268675363918993, "grad_norm": 1.0390625, "learning_rate": 0.00045785618699744615, "loss": 6.0722, "mean_token_accuracy": 0.12851928919553757, "num_tokens": 3085647.0, "step": 1595 }, { "entropy": 6.2406998634338375, "epoch": 0.09297730772583317, "grad_norm": 1.1171875, "learning_rate": 0.00045716721753787543, "loss": 6.1909, "mean_token_accuracy": 0.12459061220288277, "num_tokens": 3095085.0, "step": 1600 }, { "entropy": 6.156445837020874, "epoch": 0.0932678618124764, "grad_norm": 1.1484375, "learning_rate": 0.0004564732538720148, "loss": 6.1138, "mean_token_accuracy": 0.12587291449308396, "num_tokens": 3104313.0, "step": 1605 }, { "entropy": 6.215060758590698, "epoch": 0.09355841589911962, "grad_norm": 0.98046875, "learning_rate": 0.00045577431502522877, "loss": 6.1969, "mean_token_accuracy": 0.11667787209153176, "num_tokens": 3115071.0, "step": 1610 }, { "entropy": 6.139194774627685, "epoch": 0.09384896998576285, "grad_norm": 1.0390625, "learning_rate": 0.0004550704201592787, "loss": 6.1682, "mean_token_accuracy": 0.12204712033271789, "num_tokens": 3124152.0, "step": 1615 }, { "entropy": 6.224874258041382, "epoch": 0.09413952407240608, "grad_norm": 1.0390625, "learning_rate": 0.0004543615885717981, "loss": 6.1518, "mean_token_accuracy": 0.12817504107952118, "num_tokens": 3133733.0, "step": 1620 }, { "entropy": 6.059720706939697, "epoch": 0.0944300781590493, "grad_norm": 1.0546875, "learning_rate": 0.00045364783969576296, "loss": 6.0599, "mean_token_accuracy": 0.12859237790107728, "num_tokens": 3142843.0, "step": 1625 }, { "entropy": 6.157731437683106, "epoch": 0.09472063224569253, "grad_norm": 1.0234375, "learning_rate": 0.0004529291930989592, "loss": 6.0586, "mean_token_accuracy": 0.12594763189554214, "num_tokens": 3152091.0, "step": 1630 }, { "entropy": 6.018420934677124, "epoch": 0.09501118633233577, "grad_norm": 1.0, "learning_rate": 0.0004522056684834464, "loss": 6.1296, "mean_token_accuracy": 0.12261961698532105, "num_tokens": 3162594.0, "step": 1635 }, { "entropy": 6.239905881881714, "epoch": 0.09530174041897899, "grad_norm": 0.94921875, "learning_rate": 0.0004514772856850173, "loss": 6.1522, "mean_token_accuracy": 0.1294144131243229, "num_tokens": 3172575.0, "step": 1640 }, { "entropy": 6.194077634811402, "epoch": 0.09559229450562222, "grad_norm": 0.9921875, "learning_rate": 0.0004507440646726542, "loss": 6.1598, "mean_token_accuracy": 0.12255481034517288, "num_tokens": 3182066.0, "step": 1645 }, { "entropy": 6.107237339019775, "epoch": 0.09588284859226545, "grad_norm": 1.1328125, "learning_rate": 0.0004500060255479818, "loss": 6.0264, "mean_token_accuracy": 0.12209519520401954, "num_tokens": 3191093.0, "step": 1650 }, { "entropy": 6.18548550605774, "epoch": 0.09617340267890868, "grad_norm": 1.046875, "learning_rate": 0.0004492631885447151, "loss": 6.1164, "mean_token_accuracy": 0.1266675502061844, "num_tokens": 3200466.0, "step": 1655 }, { "entropy": 6.148427295684814, "epoch": 0.0964639567655519, "grad_norm": 1.0859375, "learning_rate": 0.00044851557402810616, "loss": 6.0961, "mean_token_accuracy": 0.1309407591819763, "num_tokens": 3209962.0, "step": 1660 }, { "entropy": 6.137912273406982, "epoch": 0.09675451085219514, "grad_norm": 1.0703125, "learning_rate": 0.00044776320249438444, "loss": 6.0753, "mean_token_accuracy": 0.13115072175860404, "num_tokens": 3219735.0, "step": 1665 }, { "entropy": 6.088384389877319, "epoch": 0.09704506493883837, "grad_norm": 1.125, "learning_rate": 0.00044700609457019565, "loss": 6.125, "mean_token_accuracy": 0.1225659005343914, "num_tokens": 3228793.0, "step": 1670 }, { "entropy": 6.067927408218384, "epoch": 0.09733561902548159, "grad_norm": 1.078125, "learning_rate": 0.0004462442710120359, "loss": 5.9736, "mean_token_accuracy": 0.1300351545214653, "num_tokens": 3238045.0, "step": 1675 }, { "entropy": 6.178382873535156, "epoch": 0.09762617311212482, "grad_norm": 1.0078125, "learning_rate": 0.000445477752705683, "loss": 6.1776, "mean_token_accuracy": 0.12008099108934403, "num_tokens": 3248238.0, "step": 1680 }, { "entropy": 6.156318283081054, "epoch": 0.09791672719876805, "grad_norm": 1.1484375, "learning_rate": 0.00044470656066562336, "loss": 6.0686, "mean_token_accuracy": 0.1366035208106041, "num_tokens": 3256445.0, "step": 1685 }, { "entropy": 6.028420305252075, "epoch": 0.09820728128541129, "grad_norm": 1.03125, "learning_rate": 0.0004439307160344765, "loss": 6.0412, "mean_token_accuracy": 0.1275148406624794, "num_tokens": 3266342.0, "step": 1690 }, { "entropy": 6.081392288208008, "epoch": 0.0984978353720545, "grad_norm": 1.0234375, "learning_rate": 0.00044315024008241473, "loss": 6.0836, "mean_token_accuracy": 0.12850913628935814, "num_tokens": 3276081.0, "step": 1695 }, { "entropy": 6.141415071487427, "epoch": 0.09878838945869774, "grad_norm": 1.0546875, "learning_rate": 0.0004423651542065806, "loss": 6.094, "mean_token_accuracy": 0.12524966821074485, "num_tokens": 3285228.0, "step": 1700 }, { "entropy": 6.129530048370361, "epoch": 0.09907894354534097, "grad_norm": 1.0703125, "learning_rate": 0.00044157547993050006, "loss": 6.1391, "mean_token_accuracy": 0.1269663617014885, "num_tokens": 3294392.0, "step": 1705 }, { "entropy": 6.269520378112793, "epoch": 0.09936949763198419, "grad_norm": 1.0078125, "learning_rate": 0.00044078123890349227, "loss": 6.2016, "mean_token_accuracy": 0.11826551407575607, "num_tokens": 3304255.0, "step": 1710 }, { "entropy": 6.058578109741211, "epoch": 0.09966005171862742, "grad_norm": 1.0234375, "learning_rate": 0.00043998245290007606, "loss": 5.9811, "mean_token_accuracy": 0.1295688658952713, "num_tokens": 3312731.0, "step": 1715 }, { "entropy": 6.168110990524292, "epoch": 0.09995060580527065, "grad_norm": 1.0546875, "learning_rate": 0.00043917914381937323, "loss": 6.0579, "mean_token_accuracy": 0.12608980387449265, "num_tokens": 3322178.0, "step": 1720 }, { "entropy": 6.064984083175659, "epoch": 0.10024115989191389, "grad_norm": 1.0234375, "learning_rate": 0.00043837133368450815, "loss": 6.0326, "mean_token_accuracy": 0.12514449581503867, "num_tokens": 3331688.0, "step": 1725 }, { "entropy": 6.188555145263672, "epoch": 0.1005317139785571, "grad_norm": 1.0546875, "learning_rate": 0.0004375590446420037, "loss": 6.2908, "mean_token_accuracy": 0.11966812238097191, "num_tokens": 3342151.0, "step": 1730 }, { "entropy": 6.153595590591431, "epoch": 0.10082226806520034, "grad_norm": 0.984375, "learning_rate": 0.0004367422989611743, "loss": 6.06, "mean_token_accuracy": 0.13309167325496674, "num_tokens": 3351405.0, "step": 1735 }, { "entropy": 6.072870206832886, "epoch": 0.10111282215184357, "grad_norm": 1.078125, "learning_rate": 0.0004359211190335153, "loss": 6.0799, "mean_token_accuracy": 0.12330102473497391, "num_tokens": 3362122.0, "step": 1740 }, { "entropy": 6.11573429107666, "epoch": 0.10140337623848679, "grad_norm": 0.890625, "learning_rate": 0.00043509552737208923, "loss": 6.1035, "mean_token_accuracy": 0.125773186981678, "num_tokens": 3372797.0, "step": 1745 }, { "entropy": 6.074742650985717, "epoch": 0.10169393032513002, "grad_norm": 0.97265625, "learning_rate": 0.00043426554661090853, "loss": 5.999, "mean_token_accuracy": 0.13261257037520408, "num_tokens": 3382574.0, "step": 1750 }, { "entropy": 6.100408744812012, "epoch": 0.10198448441177325, "grad_norm": 1.03125, "learning_rate": 0.00043343119950431516, "loss": 6.0462, "mean_token_accuracy": 0.1297650747001171, "num_tokens": 3392128.0, "step": 1755 }, { "entropy": 6.075628852844238, "epoch": 0.10227503849841647, "grad_norm": 1.0625, "learning_rate": 0.00043259250892635644, "loss": 5.9802, "mean_token_accuracy": 0.1275343604385853, "num_tokens": 3401154.0, "step": 1760 }, { "entropy": 6.036476182937622, "epoch": 0.1025655925850597, "grad_norm": 1.09375, "learning_rate": 0.0004317494978701582, "loss": 6.0298, "mean_token_accuracy": 0.13419338539242745, "num_tokens": 3410133.0, "step": 1765 }, { "entropy": 6.148456811904907, "epoch": 0.10285614667170294, "grad_norm": 0.99609375, "learning_rate": 0.0004309021894472943, "loss": 6.0791, "mean_token_accuracy": 0.12794992104172706, "num_tokens": 3420270.0, "step": 1770 }, { "entropy": 6.103959608078003, "epoch": 0.10314670075834617, "grad_norm": 1.0234375, "learning_rate": 0.0004300506068871534, "loss": 6.0662, "mean_token_accuracy": 0.12644353434443473, "num_tokens": 3430854.0, "step": 1775 }, { "entropy": 6.200176763534546, "epoch": 0.10343725484498939, "grad_norm": 1.0625, "learning_rate": 0.00042919477353630135, "loss": 6.035, "mean_token_accuracy": 0.12726576030254363, "num_tokens": 3441280.0, "step": 1780 }, { "entropy": 5.975127696990967, "epoch": 0.10372780893163262, "grad_norm": 1.1171875, "learning_rate": 0.000428334712857842, "loss": 5.9856, "mean_token_accuracy": 0.13601229563355446, "num_tokens": 3450103.0, "step": 1785 }, { "entropy": 6.0330243587493895, "epoch": 0.10401836301827586, "grad_norm": 0.9921875, "learning_rate": 0.00042747044843077304, "loss": 6.0696, "mean_token_accuracy": 0.12510816380381584, "num_tokens": 3461013.0, "step": 1790 }, { "entropy": 6.096307325363159, "epoch": 0.10430891710491907, "grad_norm": 1.0234375, "learning_rate": 0.00042660200394934047, "loss": 5.9965, "mean_token_accuracy": 0.13395112082362176, "num_tokens": 3470120.0, "step": 1795 }, { "entropy": 6.193869876861572, "epoch": 0.10459947119156231, "grad_norm": 1.171875, "learning_rate": 0.00042572940322238844, "loss": 6.1934, "mean_token_accuracy": 0.12477752342820167, "num_tokens": 3480010.0, "step": 1800 }, { "entropy": 6.083474636077881, "epoch": 0.10489002527820554, "grad_norm": 1.0390625, "learning_rate": 0.00042485267017270664, "loss": 6.0506, "mean_token_accuracy": 0.12901688143610954, "num_tokens": 3490140.0, "step": 1805 }, { "entropy": 6.154728937149048, "epoch": 0.10518057936484877, "grad_norm": 1.3125, "learning_rate": 0.0004239718288363745, "loss": 6.0767, "mean_token_accuracy": 0.12849546670913697, "num_tokens": 3501120.0, "step": 1810 }, { "entropy": 6.052251720428467, "epoch": 0.10547113345149199, "grad_norm": 0.9765625, "learning_rate": 0.0004230869033621023, "loss": 5.8971, "mean_token_accuracy": 0.13428612872958184, "num_tokens": 3510199.0, "step": 1815 }, { "entropy": 6.032751893997192, "epoch": 0.10576168753813522, "grad_norm": 1.0390625, "learning_rate": 0.0004221979180105688, "loss": 6.0217, "mean_token_accuracy": 0.12719288766384124, "num_tokens": 3519146.0, "step": 1820 }, { "entropy": 6.124502849578858, "epoch": 0.10605224162477846, "grad_norm": 0.95703125, "learning_rate": 0.00042130489715375645, "loss": 6.0924, "mean_token_accuracy": 0.13152782544493674, "num_tokens": 3529281.0, "step": 1825 }, { "entropy": 5.984056615829468, "epoch": 0.10634279571142168, "grad_norm": 1.0703125, "learning_rate": 0.00042040786527428335, "loss": 6.0373, "mean_token_accuracy": 0.1306003786623478, "num_tokens": 3539371.0, "step": 1830 }, { "entropy": 6.161852884292602, "epoch": 0.10663334979806491, "grad_norm": 1.03125, "learning_rate": 0.0004195068469647315, "loss": 6.1009, "mean_token_accuracy": 0.12435954585671424, "num_tokens": 3549375.0, "step": 1835 }, { "entropy": 5.991615581512451, "epoch": 0.10692390388470814, "grad_norm": 1.0390625, "learning_rate": 0.00041860186692697297, "loss": 6.0098, "mean_token_accuracy": 0.12970533594489098, "num_tokens": 3558935.0, "step": 1840 }, { "entropy": 6.1774444580078125, "epoch": 0.10721445797135137, "grad_norm": 1.046875, "learning_rate": 0.00041769294997149264, "loss": 6.0616, "mean_token_accuracy": 0.12848633974790574, "num_tokens": 3568947.0, "step": 1845 }, { "entropy": 5.936046028137207, "epoch": 0.10750501205799459, "grad_norm": 1.0078125, "learning_rate": 0.0004167801210167081, "loss": 5.9816, "mean_token_accuracy": 0.1268470034003258, "num_tokens": 3579479.0, "step": 1850 }, { "entropy": 6.122731304168701, "epoch": 0.10779556614463782, "grad_norm": 1.09375, "learning_rate": 0.0004158634050882861, "loss": 5.9675, "mean_token_accuracy": 0.12663150280714036, "num_tokens": 3588901.0, "step": 1855 }, { "entropy": 6.087626218795776, "epoch": 0.10808612023128106, "grad_norm": 1.0546875, "learning_rate": 0.0004149428273184569, "loss": 5.968, "mean_token_accuracy": 0.13817571178078653, "num_tokens": 3598290.0, "step": 1860 }, { "entropy": 5.992796802520752, "epoch": 0.10837667431792428, "grad_norm": 1.15625, "learning_rate": 0.0004140184129453253, "loss": 6.0643, "mean_token_accuracy": 0.12368949353694916, "num_tokens": 3608000.0, "step": 1865 }, { "entropy": 6.115261077880859, "epoch": 0.10866722840456751, "grad_norm": 1.1015625, "learning_rate": 0.000413090187312178, "loss": 6.0252, "mean_token_accuracy": 0.12702150121331215, "num_tokens": 3617557.0, "step": 1870 }, { "entropy": 6.0366315841674805, "epoch": 0.10895778249121074, "grad_norm": 1.0234375, "learning_rate": 0.0004121581758667898, "loss": 6.0296, "mean_token_accuracy": 0.12519691735506058, "num_tokens": 3628784.0, "step": 1875 }, { "entropy": 6.1003316879272464, "epoch": 0.10924833657785397, "grad_norm": 1.0625, "learning_rate": 0.00041122240416072533, "loss": 5.9738, "mean_token_accuracy": 0.1348504453897476, "num_tokens": 3637362.0, "step": 1880 }, { "entropy": 6.078695774078369, "epoch": 0.1095388906644972, "grad_norm": 0.97265625, "learning_rate": 0.0004102828978486385, "loss": 6.0113, "mean_token_accuracy": 0.13162249848246574, "num_tokens": 3647236.0, "step": 1885 }, { "entropy": 6.04180326461792, "epoch": 0.10982944475114043, "grad_norm": 1.0234375, "learning_rate": 0.0004093396826875695, "loss": 5.9672, "mean_token_accuracy": 0.13503263145685196, "num_tokens": 3656778.0, "step": 1890 }, { "entropy": 6.088074684143066, "epoch": 0.11011999883778366, "grad_norm": 1.1953125, "learning_rate": 0.00040839278453623837, "loss": 6.1134, "mean_token_accuracy": 0.12615369856357575, "num_tokens": 3665659.0, "step": 1895 }, { "entropy": 5.993572330474853, "epoch": 0.11041055292442688, "grad_norm": 1.078125, "learning_rate": 0.0004074422293543363, "loss": 5.9876, "mean_token_accuracy": 0.13086738660931588, "num_tokens": 3675998.0, "step": 1900 }, { "entropy": 6.057390117645264, "epoch": 0.11070110701107011, "grad_norm": 0.984375, "learning_rate": 0.0004064880432018137, "loss": 5.9815, "mean_token_accuracy": 0.12661390975117684, "num_tokens": 3686429.0, "step": 1905 }, { "entropy": 6.126709651947022, "epoch": 0.11099166109771334, "grad_norm": 0.99609375, "learning_rate": 0.00040553025223816615, "loss": 6.0305, "mean_token_accuracy": 0.13001628071069718, "num_tokens": 3696611.0, "step": 1910 }, { "entropy": 6.0224635124206545, "epoch": 0.11128221518435656, "grad_norm": 1.03125, "learning_rate": 0.00040456888272171653, "loss": 5.8559, "mean_token_accuracy": 0.14033628329634668, "num_tokens": 3706164.0, "step": 1915 }, { "entropy": 5.912648868560791, "epoch": 0.1115727692709998, "grad_norm": 1.03125, "learning_rate": 0.00040360396100889577, "loss": 5.9874, "mean_token_accuracy": 0.1366017334163189, "num_tokens": 3715656.0, "step": 1920 }, { "entropy": 6.123447513580322, "epoch": 0.11186332335764303, "grad_norm": 1.1328125, "learning_rate": 0.0004026355135535202, "loss": 6.037, "mean_token_accuracy": 0.13282812014222145, "num_tokens": 3724989.0, "step": 1925 }, { "entropy": 6.025955486297607, "epoch": 0.11215387744428626, "grad_norm": 1.203125, "learning_rate": 0.000401663566906066, "loss": 5.9432, "mean_token_accuracy": 0.1403130918741226, "num_tokens": 3733997.0, "step": 1930 }, { "entropy": 5.990260124206543, "epoch": 0.11244443153092948, "grad_norm": 1.0703125, "learning_rate": 0.00040068814771294134, "loss": 6.0374, "mean_token_accuracy": 0.1268382787704468, "num_tokens": 3743987.0, "step": 1935 }, { "entropy": 6.108919668197632, "epoch": 0.11273498561757271, "grad_norm": 1.0234375, "learning_rate": 0.0003997092827157562, "loss": 6.0427, "mean_token_accuracy": 0.12940073609352112, "num_tokens": 3753455.0, "step": 1940 }, { "entropy": 6.063518142700195, "epoch": 0.11302553970421594, "grad_norm": 1.0859375, "learning_rate": 0.000398726998750589, "loss": 5.9631, "mean_token_accuracy": 0.13474399223923683, "num_tokens": 3762574.0, "step": 1945 }, { "entropy": 6.006039571762085, "epoch": 0.11331609379085916, "grad_norm": 1.15625, "learning_rate": 0.00039774132274725076, "loss": 5.9105, "mean_token_accuracy": 0.13433051109313965, "num_tokens": 3771030.0, "step": 1950 }, { "entropy": 6.05625548362732, "epoch": 0.1136066478775024, "grad_norm": 1.0859375, "learning_rate": 0.00039675228172854707, "loss": 6.0116, "mean_token_accuracy": 0.12894580587744714, "num_tokens": 3780165.0, "step": 1955 }, { "entropy": 6.104951047897339, "epoch": 0.11389720196414563, "grad_norm": 0.984375, "learning_rate": 0.0003957599028095371, "loss": 5.9758, "mean_token_accuracy": 0.1321735166013241, "num_tokens": 3789668.0, "step": 1960 }, { "entropy": 6.019385576248169, "epoch": 0.11418775605078886, "grad_norm": 1.0703125, "learning_rate": 0.00039476421319679017, "loss": 6.0284, "mean_token_accuracy": 0.1343548469245434, "num_tokens": 3799521.0, "step": 1965 }, { "entropy": 6.024891090393067, "epoch": 0.11447831013743208, "grad_norm": 1.09375, "learning_rate": 0.00039376524018764, "loss": 5.8961, "mean_token_accuracy": 0.14202071875333785, "num_tokens": 3808626.0, "step": 1970 }, { "entropy": 6.0244913578033445, "epoch": 0.11476886422407531, "grad_norm": 0.9921875, "learning_rate": 0.00039276301116943616, "loss": 5.9947, "mean_token_accuracy": 0.125540604442358, "num_tokens": 3817822.0, "step": 1975 }, { "entropy": 6.006051397323608, "epoch": 0.11505941831071854, "grad_norm": 1.078125, "learning_rate": 0.0003917575536187936, "loss": 5.9396, "mean_token_accuracy": 0.14070837944746017, "num_tokens": 3827221.0, "step": 1980 }, { "entropy": 6.057012033462525, "epoch": 0.11534997239736176, "grad_norm": 1.0, "learning_rate": 0.00039074889510083894, "loss": 5.9645, "mean_token_accuracy": 0.12805723547935485, "num_tokens": 3836430.0, "step": 1985 }, { "entropy": 6.025897645950318, "epoch": 0.115640526484005, "grad_norm": 1.0703125, "learning_rate": 0.00038973706326845495, "loss": 5.9427, "mean_token_accuracy": 0.13494896292686462, "num_tokens": 3846131.0, "step": 1990 }, { "entropy": 5.960288715362549, "epoch": 0.11593108057064823, "grad_norm": 1.0234375, "learning_rate": 0.0003887220858615225, "loss": 5.8965, "mean_token_accuracy": 0.13898257911205292, "num_tokens": 3855807.0, "step": 1995 }, { "entropy": 6.005527400970459, "epoch": 0.11622163465729146, "grad_norm": 1.1015625, "learning_rate": 0.0003877039907061597, "loss": 5.9919, "mean_token_accuracy": 0.1341300755739212, "num_tokens": 3865577.0, "step": 2000 }, { "entropy": 6.020885372161866, "epoch": 0.11651218874393468, "grad_norm": 1.0546875, "learning_rate": 0.0003866828057139598, "loss": 6.0277, "mean_token_accuracy": 0.12657435163855552, "num_tokens": 3875005.0, "step": 2005 }, { "entropy": 6.156516599655151, "epoch": 0.11680274283057791, "grad_norm": 1.0546875, "learning_rate": 0.00038565855888122503, "loss": 6.0878, "mean_token_accuracy": 0.12202497869729996, "num_tokens": 3884037.0, "step": 2010 }, { "entropy": 6.17493462562561, "epoch": 0.11709329691722115, "grad_norm": 1.0859375, "learning_rate": 0.00038463127828819975, "loss": 6.1017, "mean_token_accuracy": 0.12757360935211182, "num_tokens": 3893965.0, "step": 2015 }, { "entropy": 6.048020505905152, "epoch": 0.11738385100386436, "grad_norm": 0.99609375, "learning_rate": 0.00038360099209830043, "loss": 5.9497, "mean_token_accuracy": 0.14000242203474045, "num_tokens": 3903703.0, "step": 2020 }, { "entropy": 5.98990831375122, "epoch": 0.1176744050905076, "grad_norm": 1.09375, "learning_rate": 0.0003825677285573433, "loss": 5.9054, "mean_token_accuracy": 0.1310841754078865, "num_tokens": 3913045.0, "step": 2025 }, { "entropy": 6.00819730758667, "epoch": 0.11796495917715083, "grad_norm": 1.1640625, "learning_rate": 0.00038153151599277027, "loss": 5.9595, "mean_token_accuracy": 0.13758676499128342, "num_tokens": 3922410.0, "step": 2030 }, { "entropy": 6.037257862091065, "epoch": 0.11825551326379405, "grad_norm": 1.0, "learning_rate": 0.0003804923828128723, "loss": 5.9736, "mean_token_accuracy": 0.130282711237669, "num_tokens": 3931458.0, "step": 2035 }, { "entropy": 6.077354669570923, "epoch": 0.11854606735043728, "grad_norm": 0.96484375, "learning_rate": 0.0003794503575060104, "loss": 6.0508, "mean_token_accuracy": 0.13168376535177231, "num_tokens": 3942121.0, "step": 2040 }, { "entropy": 6.044887590408325, "epoch": 0.11883662143708051, "grad_norm": 1.0390625, "learning_rate": 0.00037840546863983484, "loss": 5.9959, "mean_token_accuracy": 0.13084948435425758, "num_tokens": 3952253.0, "step": 2045 }, { "entropy": 6.054182767868042, "epoch": 0.11912717552372375, "grad_norm": 1.0546875, "learning_rate": 0.0003773577448605015, "loss": 6.0084, "mean_token_accuracy": 0.12859943136572838, "num_tokens": 3961789.0, "step": 2050 }, { "entropy": 6.001371192932129, "epoch": 0.11941772961036697, "grad_norm": 1.078125, "learning_rate": 0.0003763072148918872, "loss": 5.9063, "mean_token_accuracy": 0.1340605929493904, "num_tokens": 3971730.0, "step": 2055 }, { "entropy": 6.027997779846191, "epoch": 0.1197082836970102, "grad_norm": 1.03125, "learning_rate": 0.0003752539075348017, "loss": 5.9682, "mean_token_accuracy": 0.12761855274438857, "num_tokens": 3982356.0, "step": 2060 }, { "entropy": 6.0816364765167235, "epoch": 0.11999883778365343, "grad_norm": 1.1171875, "learning_rate": 0.00037419785166619817, "loss": 5.9698, "mean_token_accuracy": 0.12905391156673432, "num_tokens": 3992619.0, "step": 2065 }, { "entropy": 5.949817657470703, "epoch": 0.12028939187029665, "grad_norm": 0.9765625, "learning_rate": 0.0003731390762383818, "loss": 5.8642, "mean_token_accuracy": 0.13732533380389214, "num_tokens": 4002233.0, "step": 2070 }, { "entropy": 5.997682762145996, "epoch": 0.12057994595693988, "grad_norm": 0.96484375, "learning_rate": 0.0003720776102782158, "loss": 6.0073, "mean_token_accuracy": 0.12828967198729516, "num_tokens": 4012265.0, "step": 2075 }, { "entropy": 6.046585321426392, "epoch": 0.12087050004358312, "grad_norm": 1.09375, "learning_rate": 0.00037101348288632555, "loss": 5.9949, "mean_token_accuracy": 0.13329361379146576, "num_tokens": 4021899.0, "step": 2080 }, { "entropy": 6.136781024932861, "epoch": 0.12116105413022635, "grad_norm": 1.4921875, "learning_rate": 0.0003699467232363012, "loss": 6.1281, "mean_token_accuracy": 0.12372240424156189, "num_tokens": 4031951.0, "step": 2085 }, { "entropy": 5.959255409240723, "epoch": 0.12145160821686957, "grad_norm": 1.0390625, "learning_rate": 0.0003688773605738973, "loss": 5.7985, "mean_token_accuracy": 0.14132873937487603, "num_tokens": 4040535.0, "step": 2090 }, { "entropy": 5.875403928756714, "epoch": 0.1217421623035128, "grad_norm": 1.0234375, "learning_rate": 0.00036780542421623134, "loss": 5.8698, "mean_token_accuracy": 0.14000626653432846, "num_tokens": 4049951.0, "step": 2095 }, { "entropy": 6.094307279586792, "epoch": 0.12203271639015603, "grad_norm": 1.1171875, "learning_rate": 0.0003667309435509802, "loss": 6.0269, "mean_token_accuracy": 0.12536544725298882, "num_tokens": 4059623.0, "step": 2100 }, { "entropy": 6.034672784805298, "epoch": 0.12232327047679925, "grad_norm": 1.0, "learning_rate": 0.0003656539480355741, "loss": 5.8494, "mean_token_accuracy": 0.14006635397672654, "num_tokens": 4068820.0, "step": 2105 }, { "entropy": 5.914458560943603, "epoch": 0.12261382456344248, "grad_norm": 0.95703125, "learning_rate": 0.0003645744671963891, "loss": 5.8758, "mean_token_accuracy": 0.13851067423820496, "num_tokens": 4078699.0, "step": 2110 }, { "entropy": 5.967116165161133, "epoch": 0.12290437865008572, "grad_norm": 1.1015625, "learning_rate": 0.0003634925306279376, "loss": 5.8401, "mean_token_accuracy": 0.14074087589979173, "num_tokens": 4087998.0, "step": 2115 }, { "entropy": 6.043182373046875, "epoch": 0.12319493273672895, "grad_norm": 1.0625, "learning_rate": 0.0003624081679920574, "loss": 5.9877, "mean_token_accuracy": 0.13383241593837739, "num_tokens": 4097091.0, "step": 2120 }, { "entropy": 5.932327079772949, "epoch": 0.12348548682337217, "grad_norm": 1.0390625, "learning_rate": 0.0003613214090170977, "loss": 5.9291, "mean_token_accuracy": 0.13196048736572266, "num_tokens": 4106964.0, "step": 2125 }, { "entropy": 6.049034261703492, "epoch": 0.1237760409100154, "grad_norm": 1.0546875, "learning_rate": 0.0003602322834971048, "loss": 5.9481, "mean_token_accuracy": 0.1403219759464264, "num_tokens": 4116898.0, "step": 2130 }, { "entropy": 5.968407535552979, "epoch": 0.12406659499665863, "grad_norm": 1.0, "learning_rate": 0.0003591408212910051, "loss": 5.8773, "mean_token_accuracy": 0.1425372302532196, "num_tokens": 4125706.0, "step": 2135 }, { "entropy": 6.0740570545196535, "epoch": 0.12435714908330185, "grad_norm": 0.95703125, "learning_rate": 0.0003580470523217863, "loss": 6.0003, "mean_token_accuracy": 0.1340542823076248, "num_tokens": 4135601.0, "step": 2140 }, { "entropy": 5.985355806350708, "epoch": 0.12464770316994508, "grad_norm": 1.03125, "learning_rate": 0.0003569510065756771, "loss": 5.9452, "mean_token_accuracy": 0.13526148721575737, "num_tokens": 4145049.0, "step": 2145 }, { "entropy": 6.050859975814819, "epoch": 0.12493825725658832, "grad_norm": 1.1328125, "learning_rate": 0.0003558527141013254, "loss": 5.9104, "mean_token_accuracy": 0.1342906855046749, "num_tokens": 4154089.0, "step": 2150 }, { "entropy": 6.029706764221191, "epoch": 0.12522881134323155, "grad_norm": 0.9765625, "learning_rate": 0.0003547522050089742, "loss": 5.9294, "mean_token_accuracy": 0.1347600869834423, "num_tokens": 4163729.0, "step": 2155 }, { "entropy": 5.928568124771118, "epoch": 0.12551936542987477, "grad_norm": 1.125, "learning_rate": 0.00035364950946963606, "loss": 5.8799, "mean_token_accuracy": 0.13473999574780465, "num_tokens": 4173027.0, "step": 2160 }, { "entropy": 5.970612621307373, "epoch": 0.125809919516518, "grad_norm": 0.96484375, "learning_rate": 0.0003525446577142663, "loss": 5.9384, "mean_token_accuracy": 0.13225939273834228, "num_tokens": 4182703.0, "step": 2165 }, { "entropy": 6.1540978908538815, "epoch": 0.12610047360316123, "grad_norm": 0.95703125, "learning_rate": 0.00035143768003293395, "loss": 5.985, "mean_token_accuracy": 0.13003097623586654, "num_tokens": 4192927.0, "step": 2170 }, { "entropy": 5.967820882797241, "epoch": 0.12639102768980445, "grad_norm": 1.015625, "learning_rate": 0.0003503286067739913, "loss": 5.9551, "mean_token_accuracy": 0.1343395359814167, "num_tokens": 4203562.0, "step": 2175 }, { "entropy": 5.968146181106567, "epoch": 0.1266815817764477, "grad_norm": 0.94140625, "learning_rate": 0.00034921746834324193, "loss": 5.909, "mean_token_accuracy": 0.14129758030176162, "num_tokens": 4213223.0, "step": 2180 }, { "entropy": 6.010010147094727, "epoch": 0.12697213586309092, "grad_norm": 0.984375, "learning_rate": 0.0003481042952031072, "loss": 5.8735, "mean_token_accuracy": 0.13559180721640587, "num_tokens": 4222676.0, "step": 2185 }, { "entropy": 6.019833612442016, "epoch": 0.12726268994973414, "grad_norm": 1.015625, "learning_rate": 0.0003469891178717911, "loss": 5.9847, "mean_token_accuracy": 0.1309241108596325, "num_tokens": 4232854.0, "step": 2190 }, { "entropy": 6.01093168258667, "epoch": 0.12755324403637738, "grad_norm": 0.98046875, "learning_rate": 0.0003458719669224436, "loss": 5.8711, "mean_token_accuracy": 0.14472563490271567, "num_tokens": 4242702.0, "step": 2195 }, { "entropy": 6.029361248016357, "epoch": 0.1278437981230206, "grad_norm": 1.0078125, "learning_rate": 0.0003447528729823221, "loss": 5.9419, "mean_token_accuracy": 0.13157446980476378, "num_tokens": 4252837.0, "step": 2200 }, { "entropy": 5.959269094467163, "epoch": 0.12813435220966382, "grad_norm": 1.0390625, "learning_rate": 0.0003436318667319525, "loss": 5.8399, "mean_token_accuracy": 0.1406804084777832, "num_tokens": 4261958.0, "step": 2205 }, { "entropy": 6.050781154632569, "epoch": 0.12842490629630707, "grad_norm": 1.0859375, "learning_rate": 0.00034250897890428716, "loss": 5.9415, "mean_token_accuracy": 0.14063480123877525, "num_tokens": 4270916.0, "step": 2210 }, { "entropy": 6.006767225265503, "epoch": 0.1287154603829503, "grad_norm": 1.0703125, "learning_rate": 0.0003413842402838633, "loss": 5.9463, "mean_token_accuracy": 0.1407653845846653, "num_tokens": 4280614.0, "step": 2215 }, { "entropy": 5.892512798309326, "epoch": 0.1290060144695935, "grad_norm": 1.1328125, "learning_rate": 0.00034025768170595834, "loss": 5.8542, "mean_token_accuracy": 0.13779841586947442, "num_tokens": 4290511.0, "step": 2220 }, { "entropy": 6.083350658416748, "epoch": 0.12929656855623675, "grad_norm": 1.078125, "learning_rate": 0.0003391293340557446, "loss": 5.9252, "mean_token_accuracy": 0.13738311529159547, "num_tokens": 4300101.0, "step": 2225 }, { "entropy": 6.020438623428345, "epoch": 0.12958712264287997, "grad_norm": 0.90234375, "learning_rate": 0.0003379992282674431, "loss": 5.898, "mean_token_accuracy": 0.13345685228705406, "num_tokens": 4310263.0, "step": 2230 }, { "entropy": 5.936104154586792, "epoch": 0.1298776767295232, "grad_norm": 1.1328125, "learning_rate": 0.0003368673953234749, "loss": 5.9102, "mean_token_accuracy": 0.13602888882160186, "num_tokens": 4319472.0, "step": 2235 }, { "entropy": 6.055332803726197, "epoch": 0.13016823081616644, "grad_norm": 1.03125, "learning_rate": 0.00033573386625361176, "loss": 5.8534, "mean_token_accuracy": 0.1360207498073578, "num_tokens": 4329228.0, "step": 2240 }, { "entropy": 5.921377229690552, "epoch": 0.13045878490280965, "grad_norm": 0.921875, "learning_rate": 0.00033459867213412567, "loss": 5.886, "mean_token_accuracy": 0.13516351208090782, "num_tokens": 4339816.0, "step": 2245 }, { "entropy": 5.94791316986084, "epoch": 0.13074933898945287, "grad_norm": 1.0625, "learning_rate": 0.000333461844086937, "loss": 5.8351, "mean_token_accuracy": 0.13289576545357704, "num_tokens": 4349152.0, "step": 2250 }, { "entropy": 5.988745975494385, "epoch": 0.13103989307609612, "grad_norm": 1.0625, "learning_rate": 0.00033232341327876097, "loss": 5.9542, "mean_token_accuracy": 0.13524625673890114, "num_tokens": 4359073.0, "step": 2255 }, { "entropy": 5.959168386459351, "epoch": 0.13133044716273934, "grad_norm": 1.046875, "learning_rate": 0.0003311834109202531, "loss": 5.9377, "mean_token_accuracy": 0.136678983271122, "num_tokens": 4368437.0, "step": 2260 }, { "entropy": 6.065321207046509, "epoch": 0.13162100124938259, "grad_norm": 1.0546875, "learning_rate": 0.00033004186826515416, "loss": 5.9577, "mean_token_accuracy": 0.13410670906305314, "num_tokens": 4378430.0, "step": 2265 }, { "entropy": 6.087664270401001, "epoch": 0.1319115553360258, "grad_norm": 1.0625, "learning_rate": 0.0003288988166094324, "loss": 5.9672, "mean_token_accuracy": 0.13350549340248108, "num_tokens": 4388500.0, "step": 2270 }, { "entropy": 5.964868593215942, "epoch": 0.13220210942266902, "grad_norm": 1.0390625, "learning_rate": 0.00032775428729042656, "loss": 5.8422, "mean_token_accuracy": 0.14961724877357482, "num_tokens": 4398232.0, "step": 2275 }, { "entropy": 5.969161415100098, "epoch": 0.13249266350931227, "grad_norm": 1.1484375, "learning_rate": 0.000326608311685986, "loss": 5.9124, "mean_token_accuracy": 0.1390094742178917, "num_tokens": 4406569.0, "step": 2280 }, { "entropy": 6.083000707626343, "epoch": 0.1327832175959555, "grad_norm": 1.0703125, "learning_rate": 0.0003254609212136108, "loss": 5.9028, "mean_token_accuracy": 0.14335579425096512, "num_tokens": 4415634.0, "step": 2285 }, { "entropy": 5.942263126373291, "epoch": 0.1330737716825987, "grad_norm": 0.91796875, "learning_rate": 0.00032431214732959036, "loss": 5.9028, "mean_token_accuracy": 0.1399638831615448, "num_tokens": 4426079.0, "step": 2290 }, { "entropy": 5.997076416015625, "epoch": 0.13336432576924195, "grad_norm": 0.98046875, "learning_rate": 0.000323162021528141, "loss": 5.9007, "mean_token_accuracy": 0.1342967502772808, "num_tokens": 4435587.0, "step": 2295 }, { "entropy": 5.9411468505859375, "epoch": 0.13365487985588517, "grad_norm": 1.0390625, "learning_rate": 0.00032201057534054264, "loss": 5.852, "mean_token_accuracy": 0.13950249254703523, "num_tokens": 4445466.0, "step": 2300 }, { "entropy": 5.994159173965454, "epoch": 0.1339454339425284, "grad_norm": 0.96875, "learning_rate": 0.00032085784033427414, "loss": 5.9415, "mean_token_accuracy": 0.1332622177898884, "num_tokens": 4455342.0, "step": 2305 }, { "entropy": 6.0287621974945065, "epoch": 0.13423598802917164, "grad_norm": 1.015625, "learning_rate": 0.0003197038481121478, "loss": 5.8712, "mean_token_accuracy": 0.13551222681999206, "num_tokens": 4464358.0, "step": 2310 }, { "entropy": 6.003249263763427, "epoch": 0.13452654211581486, "grad_norm": 1.125, "learning_rate": 0.0003185486303114436, "loss": 5.85, "mean_token_accuracy": 0.1360574722290039, "num_tokens": 4473419.0, "step": 2315 }, { "entropy": 5.895709609985351, "epoch": 0.13481709620245808, "grad_norm": 1.0390625, "learning_rate": 0.0003173922186030409, "loss": 5.8087, "mean_token_accuracy": 0.13682912141084672, "num_tokens": 4483426.0, "step": 2320 }, { "entropy": 6.04387469291687, "epoch": 0.13510765028910132, "grad_norm": 1.0, "learning_rate": 0.000316234644690551, "loss": 5.9602, "mean_token_accuracy": 0.13195119872689248, "num_tokens": 4493213.0, "step": 2325 }, { "entropy": 6.024215412139893, "epoch": 0.13539820437574454, "grad_norm": 1.0546875, "learning_rate": 0.0003150759403094473, "loss": 5.8664, "mean_token_accuracy": 0.14107481837272645, "num_tokens": 4503189.0, "step": 2330 }, { "entropy": 5.925279331207276, "epoch": 0.13568875846238776, "grad_norm": 0.99609375, "learning_rate": 0.00031391613722619587, "loss": 5.9355, "mean_token_accuracy": 0.12918271347880364, "num_tokens": 4513253.0, "step": 2335 }, { "entropy": 5.961361694335937, "epoch": 0.135979312549031, "grad_norm": 1.0, "learning_rate": 0.000312755267237384, "loss": 5.7951, "mean_token_accuracy": 0.1382595956325531, "num_tokens": 4523419.0, "step": 2340 }, { "entropy": 5.926408576965332, "epoch": 0.13626986663567422, "grad_norm": 1.0625, "learning_rate": 0.0003115933621688488, "loss": 5.9564, "mean_token_accuracy": 0.13528416752815248, "num_tokens": 4533585.0, "step": 2345 }, { "entropy": 5.992029476165771, "epoch": 0.13656042072231747, "grad_norm": 1.0, "learning_rate": 0.00031043045387480487, "loss": 5.8679, "mean_token_accuracy": 0.14141826182603837, "num_tokens": 4541863.0, "step": 2350 }, { "entropy": 6.003516006469726, "epoch": 0.1368509748089607, "grad_norm": 1.0078125, "learning_rate": 0.0003092665742369703, "loss": 5.8371, "mean_token_accuracy": 0.13811903372406958, "num_tokens": 4551044.0, "step": 2355 }, { "entropy": 5.98145227432251, "epoch": 0.1371415288956039, "grad_norm": 0.98046875, "learning_rate": 0.00030810175516369343, "loss": 5.8757, "mean_token_accuracy": 0.14308483600616456, "num_tokens": 4561525.0, "step": 2360 }, { "entropy": 5.967531442642212, "epoch": 0.13743208298224716, "grad_norm": 1.1796875, "learning_rate": 0.0003069360285890775, "loss": 5.8273, "mean_token_accuracy": 0.14423855245113373, "num_tokens": 4571012.0, "step": 2365 }, { "entropy": 5.948016929626465, "epoch": 0.13772263706889037, "grad_norm": 1.109375, "learning_rate": 0.00030576942647210547, "loss": 5.8638, "mean_token_accuracy": 0.13877268359065056, "num_tokens": 4580840.0, "step": 2370 }, { "entropy": 5.953177118301392, "epoch": 0.1380131911555336, "grad_norm": 1.0625, "learning_rate": 0.00030460198079576355, "loss": 5.9276, "mean_token_accuracy": 0.13606794849038123, "num_tokens": 4591093.0, "step": 2375 }, { "entropy": 5.916067981719971, "epoch": 0.13830374524217684, "grad_norm": 1.0546875, "learning_rate": 0.0003034337235661648, "loss": 5.8848, "mean_token_accuracy": 0.1396774709224701, "num_tokens": 4601449.0, "step": 2380 }, { "entropy": 6.057155704498291, "epoch": 0.13859429932882006, "grad_norm": 0.94921875, "learning_rate": 0.0003022646868116714, "loss": 5.9087, "mean_token_accuracy": 0.1398300603032112, "num_tokens": 4611314.0, "step": 2385 }, { "entropy": 6.022958469390869, "epoch": 0.13888485341546328, "grad_norm": 1.0390625, "learning_rate": 0.0003010949025820163, "loss": 5.9069, "mean_token_accuracy": 0.13639484643936156, "num_tokens": 4620461.0, "step": 2390 }, { "entropy": 6.024860906600952, "epoch": 0.13917540750210652, "grad_norm": 1.0625, "learning_rate": 0.0002999244029474252, "loss": 5.8656, "mean_token_accuracy": 0.14114097729325295, "num_tokens": 4630198.0, "step": 2395 }, { "entropy": 5.89768385887146, "epoch": 0.13946596158874974, "grad_norm": 1.0390625, "learning_rate": 0.00029875321999773684, "loss": 5.7678, "mean_token_accuracy": 0.1444575846195221, "num_tokens": 4639275.0, "step": 2400 }, { "entropy": 5.9961847305297855, "epoch": 0.13975651567539296, "grad_norm": 0.96875, "learning_rate": 0.00029758138584152333, "loss": 5.8535, "mean_token_accuracy": 0.13934674188494683, "num_tokens": 4648914.0, "step": 2405 }, { "entropy": 5.936286783218383, "epoch": 0.1400470697620362, "grad_norm": 1.0625, "learning_rate": 0.0002964089326052102, "loss": 5.765, "mean_token_accuracy": 0.14789522886276246, "num_tokens": 4658351.0, "step": 2410 }, { "entropy": 5.933369731903076, "epoch": 0.14033762384867943, "grad_norm": 1.03125, "learning_rate": 0.0002952358924321949, "loss": 5.779, "mean_token_accuracy": 0.13668361231684684, "num_tokens": 4667832.0, "step": 2415 }, { "entropy": 5.889568758010864, "epoch": 0.14062817793532267, "grad_norm": 0.99609375, "learning_rate": 0.00029406229748196657, "loss": 5.84, "mean_token_accuracy": 0.14445363059639932, "num_tokens": 4678007.0, "step": 2420 }, { "entropy": 5.9436970233917235, "epoch": 0.1409187320219659, "grad_norm": 0.97265625, "learning_rate": 0.0002928881799292235, "loss": 5.9731, "mean_token_accuracy": 0.1374736785888672, "num_tokens": 4687980.0, "step": 2425 }, { "entropy": 6.0395537376403805, "epoch": 0.1412092861086091, "grad_norm": 0.94921875, "learning_rate": 0.00029171357196299154, "loss": 5.9202, "mean_token_accuracy": 0.1379444718360901, "num_tokens": 4699183.0, "step": 2430 }, { "entropy": 6.017334127426148, "epoch": 0.14149984019525236, "grad_norm": 1.0390625, "learning_rate": 0.0002905385057857414, "loss": 5.8333, "mean_token_accuracy": 0.13580716103315355, "num_tokens": 4708877.0, "step": 2435 }, { "entropy": 5.877793979644776, "epoch": 0.14179039428189558, "grad_norm": 1.0234375, "learning_rate": 0.0002893630136125058, "loss": 5.7952, "mean_token_accuracy": 0.14586628898978232, "num_tokens": 4718456.0, "step": 2440 }, { "entropy": 5.883253383636474, "epoch": 0.1420809483685388, "grad_norm": 0.9921875, "learning_rate": 0.0002881871276699967, "loss": 5.7874, "mean_token_accuracy": 0.14279707446694373, "num_tokens": 4728536.0, "step": 2445 }, { "entropy": 5.97650408744812, "epoch": 0.14237150245518204, "grad_norm": 1.03125, "learning_rate": 0.00028701088019572114, "loss": 5.9474, "mean_token_accuracy": 0.13733349069952966, "num_tokens": 4738474.0, "step": 2450 }, { "entropy": 6.021295547485352, "epoch": 0.14266205654182526, "grad_norm": 1.03125, "learning_rate": 0.0002858343034370977, "loss": 5.8469, "mean_token_accuracy": 0.13698814958333969, "num_tokens": 4748242.0, "step": 2455 }, { "entropy": 5.994341087341309, "epoch": 0.14295261062846848, "grad_norm": 1.046875, "learning_rate": 0.00028465742965057267, "loss": 5.846, "mean_token_accuracy": 0.14408844113349914, "num_tokens": 4757787.0, "step": 2460 }, { "entropy": 5.905521297454834, "epoch": 0.14324316471511173, "grad_norm": 0.984375, "learning_rate": 0.00028348029110073533, "loss": 5.7272, "mean_token_accuracy": 0.14780522286891937, "num_tokens": 4767178.0, "step": 2465 }, { "entropy": 5.858093166351319, "epoch": 0.14353371880175494, "grad_norm": 1.140625, "learning_rate": 0.00028230292005943365, "loss": 5.7769, "mean_token_accuracy": 0.1437581166625023, "num_tokens": 4776463.0, "step": 2470 }, { "entropy": 5.954789066314698, "epoch": 0.14382427288839816, "grad_norm": 1.0078125, "learning_rate": 0.00028112534880488945, "loss": 5.815, "mean_token_accuracy": 0.14446621090173722, "num_tokens": 4785972.0, "step": 2475 }, { "entropy": 5.911713743209839, "epoch": 0.1441148269750414, "grad_norm": 1.109375, "learning_rate": 0.0002799476096208137, "loss": 5.7652, "mean_token_accuracy": 0.14482518881559373, "num_tokens": 4794986.0, "step": 2480 }, { "entropy": 5.940880584716797, "epoch": 0.14440538106168463, "grad_norm": 1.1328125, "learning_rate": 0.00027876973479552087, "loss": 5.8926, "mean_token_accuracy": 0.13828022554516792, "num_tokens": 4804625.0, "step": 2485 }, { "entropy": 5.915801620483398, "epoch": 0.14469593514832785, "grad_norm": 1.0703125, "learning_rate": 0.00027759175662104424, "loss": 5.7716, "mean_token_accuracy": 0.1409230798482895, "num_tokens": 4813901.0, "step": 2490 }, { "entropy": 5.948210859298706, "epoch": 0.1449864892349711, "grad_norm": 1.046875, "learning_rate": 0.0002764137073922508, "loss": 5.8636, "mean_token_accuracy": 0.14530568122863768, "num_tokens": 4823986.0, "step": 2495 }, { "entropy": 5.922775316238403, "epoch": 0.1452770433216143, "grad_norm": 1.015625, "learning_rate": 0.00027523561940595505, "loss": 5.7392, "mean_token_accuracy": 0.14593456238508223, "num_tokens": 4832915.0, "step": 2500 }, { "entropy": 5.960989475250244, "epoch": 0.14556759740825756, "grad_norm": 1.046875, "learning_rate": 0.0002740575249600342, "loss": 5.8974, "mean_token_accuracy": 0.14358005076646804, "num_tokens": 4843429.0, "step": 2505 }, { "entropy": 5.960518932342529, "epoch": 0.14585815149490078, "grad_norm": 1.0859375, "learning_rate": 0.00027287945635254263, "loss": 5.8041, "mean_token_accuracy": 0.14740034490823745, "num_tokens": 4853335.0, "step": 2510 }, { "entropy": 5.957660055160522, "epoch": 0.146148705581544, "grad_norm": 0.98046875, "learning_rate": 0.00027170144588082635, "loss": 5.836, "mean_token_accuracy": 0.13884815871715545, "num_tokens": 4863933.0, "step": 2515 }, { "entropy": 5.8527185916900635, "epoch": 0.14643925966818724, "grad_norm": 1.109375, "learning_rate": 0.00027052352584063763, "loss": 5.7122, "mean_token_accuracy": 0.1447383351624012, "num_tokens": 4873323.0, "step": 2520 }, { "entropy": 6.075045490264893, "epoch": 0.14672981375483046, "grad_norm": 1.0390625, "learning_rate": 0.00026934572852524907, "loss": 5.9355, "mean_token_accuracy": 0.13352688699960708, "num_tokens": 4882785.0, "step": 2525 }, { "entropy": 6.037387275695801, "epoch": 0.14702036784147368, "grad_norm": 1.0234375, "learning_rate": 0.00026816808622456937, "loss": 5.8805, "mean_token_accuracy": 0.13637359216809272, "num_tokens": 4892677.0, "step": 2530 }, { "entropy": 5.883517932891846, "epoch": 0.14731092192811693, "grad_norm": 1.0703125, "learning_rate": 0.0002669906312242569, "loss": 5.7739, "mean_token_accuracy": 0.14754577577114106, "num_tokens": 4901306.0, "step": 2535 }, { "entropy": 5.858320474624634, "epoch": 0.14760147601476015, "grad_norm": 1.125, "learning_rate": 0.00026581339580483525, "loss": 5.7128, "mean_token_accuracy": 0.1494575932621956, "num_tokens": 4911279.0, "step": 2540 }, { "entropy": 5.962831926345825, "epoch": 0.14789203010140337, "grad_norm": 1.09375, "learning_rate": 0.0002646364122408082, "loss": 5.7916, "mean_token_accuracy": 0.14201443195343016, "num_tokens": 4920966.0, "step": 2545 }, { "entropy": 5.910948848724365, "epoch": 0.1481825841880466, "grad_norm": 1.0546875, "learning_rate": 0.0002634597127997749, "loss": 5.8652, "mean_token_accuracy": 0.1409970834851265, "num_tokens": 4931345.0, "step": 2550 }, { "entropy": 5.95679817199707, "epoch": 0.14847313827468983, "grad_norm": 1.0546875, "learning_rate": 0.0002622833297415445, "loss": 5.8795, "mean_token_accuracy": 0.14074026122689248, "num_tokens": 4941845.0, "step": 2555 }, { "entropy": 5.986813497543335, "epoch": 0.14876369236133305, "grad_norm": 1.0859375, "learning_rate": 0.0002611072953172531, "loss": 5.8127, "mean_token_accuracy": 0.14215635135769844, "num_tokens": 4951626.0, "step": 2560 }, { "entropy": 5.944373035430909, "epoch": 0.1490542464479763, "grad_norm": 1.140625, "learning_rate": 0.00025993164176847845, "loss": 5.7808, "mean_token_accuracy": 0.14248338341712952, "num_tokens": 4960993.0, "step": 2565 }, { "entropy": 5.859599304199219, "epoch": 0.14934480053461952, "grad_norm": 1.1015625, "learning_rate": 0.0002587564013263564, "loss": 5.7994, "mean_token_accuracy": 0.1465395838022232, "num_tokens": 4970322.0, "step": 2570 }, { "entropy": 5.894820642471314, "epoch": 0.14963535462126276, "grad_norm": 1.1015625, "learning_rate": 0.0002575816062106974, "loss": 5.6972, "mean_token_accuracy": 0.14775724858045577, "num_tokens": 4980321.0, "step": 2575 }, { "entropy": 5.900203990936279, "epoch": 0.14992590870790598, "grad_norm": 1.046875, "learning_rate": 0.00025640728862910293, "loss": 5.9086, "mean_token_accuracy": 0.134638911485672, "num_tokens": 4990286.0, "step": 2580 }, { "entropy": 5.938738059997559, "epoch": 0.1502164627945492, "grad_norm": 1.03125, "learning_rate": 0.00025523348077608285, "loss": 5.8706, "mean_token_accuracy": 0.13753649964928627, "num_tokens": 5000180.0, "step": 2585 }, { "entropy": 5.996861553192138, "epoch": 0.15050701688119245, "grad_norm": 1.0625, "learning_rate": 0.00025406021483217225, "loss": 5.8412, "mean_token_accuracy": 0.1416856624186039, "num_tokens": 5009783.0, "step": 2590 }, { "entropy": 5.976705121994018, "epoch": 0.15079757096783566, "grad_norm": 1.140625, "learning_rate": 0.00025288752296304963, "loss": 5.7734, "mean_token_accuracy": 0.1562106654047966, "num_tokens": 5019459.0, "step": 2595 }, { "entropy": 5.9754555225372314, "epoch": 0.15108812505447888, "grad_norm": 1.0546875, "learning_rate": 0.000251715437318655, "loss": 5.883, "mean_token_accuracy": 0.13459220975637437, "num_tokens": 5028847.0, "step": 2600 }, { "entropy": 5.975049638748169, "epoch": 0.15137867914112213, "grad_norm": 0.9921875, "learning_rate": 0.0002505439900323084, "loss": 5.8806, "mean_token_accuracy": 0.13831514939665795, "num_tokens": 5039362.0, "step": 2605 }, { "entropy": 5.929315376281738, "epoch": 0.15166923322776535, "grad_norm": 0.93359375, "learning_rate": 0.00024937321321982894, "loss": 5.9088, "mean_token_accuracy": 0.13965440541505814, "num_tokens": 5049803.0, "step": 2610 }, { "entropy": 6.005295848846435, "epoch": 0.15195978731440857, "grad_norm": 1.046875, "learning_rate": 0.00024820313897865433, "loss": 5.8046, "mean_token_accuracy": 0.15203196853399276, "num_tokens": 5058953.0, "step": 2615 }, { "entropy": 5.952736806869507, "epoch": 0.15225034140105181, "grad_norm": 0.9921875, "learning_rate": 0.00024703379938696105, "loss": 5.7627, "mean_token_accuracy": 0.14916136115789413, "num_tokens": 5069029.0, "step": 2620 }, { "entropy": 5.865251255035401, "epoch": 0.15254089548769503, "grad_norm": 0.96875, "learning_rate": 0.00024586522650278447, "loss": 5.8061, "mean_token_accuracy": 0.14489350616931915, "num_tokens": 5079812.0, "step": 2625 }, { "entropy": 5.890660905838013, "epoch": 0.15283144957433825, "grad_norm": 1.09375, "learning_rate": 0.00024469745236314064, "loss": 5.7891, "mean_token_accuracy": 0.14032236784696578, "num_tokens": 5090113.0, "step": 2630 }, { "entropy": 5.920516014099121, "epoch": 0.1531220036609815, "grad_norm": 1.078125, "learning_rate": 0.00024353050898314767, "loss": 5.7687, "mean_token_accuracy": 0.14643793925642967, "num_tokens": 5099577.0, "step": 2635 }, { "entropy": 5.8947196960449215, "epoch": 0.15341255774762472, "grad_norm": 1.0546875, "learning_rate": 0.00024236442835514743, "loss": 5.7246, "mean_token_accuracy": 0.14922971576452254, "num_tokens": 5108781.0, "step": 2640 }, { "entropy": 5.897604846954346, "epoch": 0.15370311183426794, "grad_norm": 1.0, "learning_rate": 0.00024119924244782965, "loss": 5.7623, "mean_token_accuracy": 0.14440225511789323, "num_tokens": 5119319.0, "step": 2645 }, { "entropy": 5.872856330871582, "epoch": 0.15399366592091118, "grad_norm": 1.125, "learning_rate": 0.00024003498320535462, "loss": 5.7137, "mean_token_accuracy": 0.15078908503055571, "num_tokens": 5128935.0, "step": 2650 }, { "entropy": 5.917783260345459, "epoch": 0.1542842200075544, "grad_norm": 1.0625, "learning_rate": 0.00023887168254647727, "loss": 5.755, "mean_token_accuracy": 0.1451076850295067, "num_tokens": 5138570.0, "step": 2655 }, { "entropy": 5.805684804916382, "epoch": 0.15457477409419765, "grad_norm": 1.15625, "learning_rate": 0.00023770937236367308, "loss": 5.712, "mean_token_accuracy": 0.15744808316230774, "num_tokens": 5148094.0, "step": 2660 }, { "entropy": 5.86561131477356, "epoch": 0.15486532818084087, "grad_norm": 0.96875, "learning_rate": 0.00023654808452226278, "loss": 5.6778, "mean_token_accuracy": 0.15375634729862214, "num_tokens": 5157299.0, "step": 2665 }, { "entropy": 5.90407919883728, "epoch": 0.15515588226748409, "grad_norm": 0.96484375, "learning_rate": 0.00023538785085953912, "loss": 5.9222, "mean_token_accuracy": 0.14214715361595154, "num_tokens": 5167432.0, "step": 2670 }, { "entropy": 5.9763596534729, "epoch": 0.15544643635412733, "grad_norm": 1.0234375, "learning_rate": 0.00023422870318389404, "loss": 5.738, "mean_token_accuracy": 0.1518242448568344, "num_tokens": 5176541.0, "step": 2675 }, { "entropy": 5.928113222122192, "epoch": 0.15573699044077055, "grad_norm": 0.9609375, "learning_rate": 0.0002330706732739468, "loss": 5.7139, "mean_token_accuracy": 0.1446213059127331, "num_tokens": 5186666.0, "step": 2680 }, { "entropy": 5.835961246490479, "epoch": 0.15602754452741377, "grad_norm": 1.078125, "learning_rate": 0.00023191379287767211, "loss": 5.7449, "mean_token_accuracy": 0.15025219842791557, "num_tokens": 5196221.0, "step": 2685 }, { "entropy": 5.917377948760986, "epoch": 0.15631809861405702, "grad_norm": 1.03125, "learning_rate": 0.0002307580937115305, "loss": 5.8546, "mean_token_accuracy": 0.14272238165140153, "num_tokens": 5206249.0, "step": 2690 }, { "entropy": 5.970059776306153, "epoch": 0.15660865270070023, "grad_norm": 1.0703125, "learning_rate": 0.00022960360745959846, "loss": 5.8008, "mean_token_accuracy": 0.14766136854887008, "num_tokens": 5215901.0, "step": 2695 }, { "entropy": 5.907421875, "epoch": 0.15689920678734345, "grad_norm": 1.0078125, "learning_rate": 0.00022845036577269972, "loss": 5.7708, "mean_token_accuracy": 0.14345001056790352, "num_tokens": 5226205.0, "step": 2700 }, { "entropy": 5.887366724014282, "epoch": 0.1571897608739867, "grad_norm": 0.9453125, "learning_rate": 0.00022729840026753777, "loss": 5.8056, "mean_token_accuracy": 0.14355208426713945, "num_tokens": 5237481.0, "step": 2705 }, { "entropy": 5.955323934555054, "epoch": 0.15748031496062992, "grad_norm": 1.0078125, "learning_rate": 0.0002261477425258287, "loss": 5.7643, "mean_token_accuracy": 0.15425921827554703, "num_tokens": 5247155.0, "step": 2710 }, { "entropy": 5.967349004745484, "epoch": 0.15777086904727314, "grad_norm": 1.1171875, "learning_rate": 0.0002249984240934358, "loss": 5.8244, "mean_token_accuracy": 0.14410397857427598, "num_tokens": 5256127.0, "step": 2715 }, { "entropy": 5.930360937118531, "epoch": 0.15806142313391638, "grad_norm": 1.0703125, "learning_rate": 0.00022385047647950464, "loss": 5.7649, "mean_token_accuracy": 0.14806724488735198, "num_tokens": 5265280.0, "step": 2720 }, { "entropy": 5.913939189910889, "epoch": 0.1583519772205596, "grad_norm": 1.046875, "learning_rate": 0.0002227039311555986, "loss": 5.7836, "mean_token_accuracy": 0.14790970534086229, "num_tokens": 5274390.0, "step": 2725 }, { "entropy": 5.9784170627594, "epoch": 0.15864253130720282, "grad_norm": 1.0078125, "learning_rate": 0.0002215588195548372, "loss": 5.8437, "mean_token_accuracy": 0.14414348900318147, "num_tokens": 5283826.0, "step": 2730 }, { "entropy": 5.959238147735595, "epoch": 0.15893308539384607, "grad_norm": 1.09375, "learning_rate": 0.00022041517307103337, "loss": 5.8148, "mean_token_accuracy": 0.14707006216049195, "num_tokens": 5292862.0, "step": 2735 }, { "entropy": 5.957505512237549, "epoch": 0.1592236394804893, "grad_norm": 1.03125, "learning_rate": 0.0002192730230578331, "loss": 5.7287, "mean_token_accuracy": 0.1460419476032257, "num_tokens": 5302244.0, "step": 2740 }, { "entropy": 6.075874519348145, "epoch": 0.15951419356713253, "grad_norm": 1.1015625, "learning_rate": 0.0002181324008278559, "loss": 5.9223, "mean_token_accuracy": 0.13467609658837318, "num_tokens": 5312906.0, "step": 2745 }, { "entropy": 5.897729682922363, "epoch": 0.15980474765377575, "grad_norm": 1.078125, "learning_rate": 0.00021699333765183655, "loss": 5.7687, "mean_token_accuracy": 0.1508830301463604, "num_tokens": 5321738.0, "step": 2750 }, { "entropy": 5.812964534759521, "epoch": 0.16009530174041897, "grad_norm": 1.125, "learning_rate": 0.0002158558647577673, "loss": 5.658, "mean_token_accuracy": 0.15175112932920456, "num_tokens": 5331221.0, "step": 2755 }, { "entropy": 5.896923208236695, "epoch": 0.16038585582706222, "grad_norm": 1.03125, "learning_rate": 0.00021472001333004215, "loss": 5.7474, "mean_token_accuracy": 0.14340464845299722, "num_tokens": 5341956.0, "step": 2760 }, { "entropy": 5.91347713470459, "epoch": 0.16067640991370544, "grad_norm": 1.046875, "learning_rate": 0.00021358581450860186, "loss": 5.7184, "mean_token_accuracy": 0.14855737686157228, "num_tokens": 5351357.0, "step": 2765 }, { "entropy": 5.904409599304199, "epoch": 0.16096696400034866, "grad_norm": 1.0234375, "learning_rate": 0.0002124532993880799, "loss": 5.8077, "mean_token_accuracy": 0.14600047171115876, "num_tokens": 5361178.0, "step": 2770 }, { "entropy": 5.955002212524414, "epoch": 0.1612575180869919, "grad_norm": 0.984375, "learning_rate": 0.00021132249901695044, "loss": 5.8103, "mean_token_accuracy": 0.13823165595531464, "num_tokens": 5370898.0, "step": 2775 }, { "entropy": 5.957718086242676, "epoch": 0.16154807217363512, "grad_norm": 0.95703125, "learning_rate": 0.00021019344439667705, "loss": 5.8191, "mean_token_accuracy": 0.14815184324979783, "num_tokens": 5380743.0, "step": 2780 }, { "entropy": 5.98155779838562, "epoch": 0.16183862626027834, "grad_norm": 0.98828125, "learning_rate": 0.00020906616648086213, "loss": 5.7453, "mean_token_accuracy": 0.14605957567691802, "num_tokens": 5389943.0, "step": 2785 }, { "entropy": 5.8878249168396, "epoch": 0.1621291803469216, "grad_norm": 1.09375, "learning_rate": 0.00020794069617439942, "loss": 5.7142, "mean_token_accuracy": 0.15016124546527862, "num_tokens": 5399270.0, "step": 2790 }, { "entropy": 5.889486312866211, "epoch": 0.1624197344335648, "grad_norm": 0.97265625, "learning_rate": 0.00020681706433262593, "loss": 5.8271, "mean_token_accuracy": 0.15024770498275758, "num_tokens": 5409699.0, "step": 2795 }, { "entropy": 6.002854061126709, "epoch": 0.16271028852020802, "grad_norm": 1.09375, "learning_rate": 0.00020569530176047602, "loss": 5.8079, "mean_token_accuracy": 0.1427007272839546, "num_tokens": 5420130.0, "step": 2800 }, { "entropy": 5.825487995147705, "epoch": 0.16300084260685127, "grad_norm": 1.015625, "learning_rate": 0.0002045754392116374, "loss": 5.6747, "mean_token_accuracy": 0.14737912863492966, "num_tokens": 5429177.0, "step": 2805 }, { "entropy": 5.901130294799804, "epoch": 0.1632913966934945, "grad_norm": 1.15625, "learning_rate": 0.00020345750738770757, "loss": 5.7953, "mean_token_accuracy": 0.14220078587532042, "num_tokens": 5438590.0, "step": 2810 }, { "entropy": 6.006308889389038, "epoch": 0.16358195078013774, "grad_norm": 1.1953125, "learning_rate": 0.00020234153693735214, "loss": 5.8566, "mean_token_accuracy": 0.1467955783009529, "num_tokens": 5448445.0, "step": 2815 }, { "entropy": 5.905307912826538, "epoch": 0.16387250486678095, "grad_norm": 0.9453125, "learning_rate": 0.0002012275584554647, "loss": 5.6731, "mean_token_accuracy": 0.14606699496507644, "num_tokens": 5458758.0, "step": 2820 }, { "entropy": 5.921207332611084, "epoch": 0.16416305895342417, "grad_norm": 1.0625, "learning_rate": 0.00020011560248232803, "loss": 5.7984, "mean_token_accuracy": 0.14677803218364716, "num_tokens": 5468642.0, "step": 2825 }, { "entropy": 5.953426313400269, "epoch": 0.16445361304006742, "grad_norm": 1.03125, "learning_rate": 0.00019900569950277692, "loss": 5.8543, "mean_token_accuracy": 0.14940119087696074, "num_tokens": 5478800.0, "step": 2830 }, { "entropy": 5.881549310684204, "epoch": 0.16474416712671064, "grad_norm": 1.015625, "learning_rate": 0.00019789787994536228, "loss": 5.7544, "mean_token_accuracy": 0.1494704306125641, "num_tokens": 5487897.0, "step": 2835 }, { "entropy": 5.942999458312988, "epoch": 0.16503472121335386, "grad_norm": 1.0234375, "learning_rate": 0.00019679217418151667, "loss": 5.7595, "mean_token_accuracy": 0.13909929171204566, "num_tokens": 5497234.0, "step": 2840 }, { "entropy": 5.984720182418823, "epoch": 0.1653252752999971, "grad_norm": 1.0078125, "learning_rate": 0.00019568861252472236, "loss": 5.7619, "mean_token_accuracy": 0.15149074494838716, "num_tokens": 5507262.0, "step": 2845 }, { "entropy": 5.940817594528198, "epoch": 0.16561582938664032, "grad_norm": 1.0078125, "learning_rate": 0.00019458722522967952, "loss": 5.678, "mean_token_accuracy": 0.1579856887459755, "num_tokens": 5516573.0, "step": 2850 }, { "entropy": 5.8865667343139645, "epoch": 0.16590638347328354, "grad_norm": 0.984375, "learning_rate": 0.00019348804249147723, "loss": 5.7854, "mean_token_accuracy": 0.14595144391059875, "num_tokens": 5526099.0, "step": 2855 }, { "entropy": 5.8241832733154295, "epoch": 0.1661969375599268, "grad_norm": 1.0390625, "learning_rate": 0.0001923910944447655, "loss": 5.6603, "mean_token_accuracy": 0.14613760709762574, "num_tokens": 5534831.0, "step": 2860 }, { "entropy": 5.93641939163208, "epoch": 0.16648749164657, "grad_norm": 1.34375, "learning_rate": 0.00019129641116292928, "loss": 5.8284, "mean_token_accuracy": 0.14684894010424615, "num_tokens": 5544650.0, "step": 2865 }, { "entropy": 5.9685893058776855, "epoch": 0.16677804573321323, "grad_norm": 1.0234375, "learning_rate": 0.00019020402265726343, "loss": 5.8244, "mean_token_accuracy": 0.1474883571267128, "num_tokens": 5553485.0, "step": 2870 }, { "entropy": 5.951635408401489, "epoch": 0.16706859981985647, "grad_norm": 1.0234375, "learning_rate": 0.0001891139588761509, "loss": 5.7402, "mean_token_accuracy": 0.14412671104073524, "num_tokens": 5563571.0, "step": 2875 }, { "entropy": 5.9211838722229, "epoch": 0.1673591539064997, "grad_norm": 1.046875, "learning_rate": 0.00018802624970424076, "loss": 5.7236, "mean_token_accuracy": 0.15366243422031403, "num_tokens": 5572617.0, "step": 2880 }, { "entropy": 5.850592470169067, "epoch": 0.1676497079931429, "grad_norm": 1.0, "learning_rate": 0.00018694092496162945, "loss": 5.6817, "mean_token_accuracy": 0.15009764581918716, "num_tokens": 5582357.0, "step": 2885 }, { "entropy": 5.834707450866699, "epoch": 0.16794026207978616, "grad_norm": 1.0390625, "learning_rate": 0.00018585801440304306, "loss": 5.7079, "mean_token_accuracy": 0.14229186177253722, "num_tokens": 5592448.0, "step": 2890 }, { "entropy": 5.911720561981201, "epoch": 0.16823081616642938, "grad_norm": 1.0, "learning_rate": 0.00018477754771702165, "loss": 5.8118, "mean_token_accuracy": 0.14399052932858467, "num_tokens": 5601890.0, "step": 2895 }, { "entropy": 5.933764410018921, "epoch": 0.16852137025307262, "grad_norm": 0.98046875, "learning_rate": 0.00018369955452510506, "loss": 5.7993, "mean_token_accuracy": 0.1465545892715454, "num_tokens": 5611901.0, "step": 2900 }, { "entropy": 5.9211501121521, "epoch": 0.16881192433971584, "grad_norm": 0.9453125, "learning_rate": 0.0001826240643810212, "loss": 5.7557, "mean_token_accuracy": 0.14484031200408937, "num_tokens": 5621547.0, "step": 2905 }, { "entropy": 5.891935014724732, "epoch": 0.16910247842635906, "grad_norm": 1.046875, "learning_rate": 0.0001815511067698758, "loss": 5.6849, "mean_token_accuracy": 0.15294240340590476, "num_tokens": 5630740.0, "step": 2910 }, { "entropy": 5.875355195999146, "epoch": 0.1693930325130023, "grad_norm": 1.1015625, "learning_rate": 0.0001804807111073436, "loss": 5.7265, "mean_token_accuracy": 0.1539645791053772, "num_tokens": 5640296.0, "step": 2915 }, { "entropy": 5.914417552947998, "epoch": 0.16968358659964553, "grad_norm": 1.1171875, "learning_rate": 0.0001794129067388625, "loss": 5.7295, "mean_token_accuracy": 0.14810295403003693, "num_tokens": 5649778.0, "step": 2920 }, { "entropy": 5.879631567001343, "epoch": 0.16997414068628874, "grad_norm": 0.94140625, "learning_rate": 0.00017834772293882868, "loss": 5.7339, "mean_token_accuracy": 0.14394181370735168, "num_tokens": 5659745.0, "step": 2925 }, { "entropy": 6.0029990673065186, "epoch": 0.170264694772932, "grad_norm": 1.015625, "learning_rate": 0.000177285188909794, "loss": 5.7599, "mean_token_accuracy": 0.14953728914260864, "num_tokens": 5669891.0, "step": 2930 }, { "entropy": 5.977743339538574, "epoch": 0.1705552488595752, "grad_norm": 0.94140625, "learning_rate": 0.0001762253337816656, "loss": 5.7746, "mean_token_accuracy": 0.1446845069527626, "num_tokens": 5679730.0, "step": 2935 }, { "entropy": 5.958973121643067, "epoch": 0.17084580294621843, "grad_norm": 1.0, "learning_rate": 0.00017516818661090738, "loss": 5.8194, "mean_token_accuracy": 0.143901277333498, "num_tokens": 5690925.0, "step": 2940 }, { "entropy": 5.890838766098023, "epoch": 0.17113635703286167, "grad_norm": 1.1796875, "learning_rate": 0.0001741137763797428, "loss": 5.7161, "mean_token_accuracy": 0.14537345618009567, "num_tokens": 5700800.0, "step": 2945 }, { "entropy": 5.8760809898376465, "epoch": 0.1714269111195049, "grad_norm": 1.09375, "learning_rate": 0.00017306213199536115, "loss": 5.6808, "mean_token_accuracy": 0.15021713823080063, "num_tokens": 5709473.0, "step": 2950 }, { "entropy": 5.901801872253418, "epoch": 0.1717174652061481, "grad_norm": 0.9765625, "learning_rate": 0.0001720132822891243, "loss": 5.7423, "mean_token_accuracy": 0.1451901450753212, "num_tokens": 5719784.0, "step": 2955 }, { "entropy": 5.956298685073852, "epoch": 0.17200801929279136, "grad_norm": 1.1171875, "learning_rate": 0.0001709672560157769, "loss": 5.9105, "mean_token_accuracy": 0.13622788190841675, "num_tokens": 5729581.0, "step": 2960 }, { "entropy": 5.921852874755859, "epoch": 0.17229857337943458, "grad_norm": 1.109375, "learning_rate": 0.00016992408185265758, "loss": 5.7555, "mean_token_accuracy": 0.14972951859235764, "num_tokens": 5738601.0, "step": 2965 }, { "entropy": 5.904282426834106, "epoch": 0.17258912746607782, "grad_norm": 0.9921875, "learning_rate": 0.00016888378839891298, "loss": 5.7279, "mean_token_accuracy": 0.13775414377450942, "num_tokens": 5749495.0, "step": 2970 }, { "entropy": 5.960662364959717, "epoch": 0.17287968155272104, "grad_norm": 1.0546875, "learning_rate": 0.0001678464041747137, "loss": 5.822, "mean_token_accuracy": 0.14975018352270125, "num_tokens": 5759197.0, "step": 2975 }, { "entropy": 5.979755926132202, "epoch": 0.17317023563936426, "grad_norm": 1.015625, "learning_rate": 0.00016681195762047223, "loss": 5.7843, "mean_token_accuracy": 0.1442870318889618, "num_tokens": 5769577.0, "step": 2980 }, { "entropy": 5.899517250061035, "epoch": 0.1734607897260075, "grad_norm": 1.0078125, "learning_rate": 0.00016578047709606337, "loss": 5.6851, "mean_token_accuracy": 0.1443849101662636, "num_tokens": 5778978.0, "step": 2985 }, { "entropy": 5.862039566040039, "epoch": 0.17375134381265073, "grad_norm": 1.1171875, "learning_rate": 0.00016475199088004678, "loss": 5.6688, "mean_token_accuracy": 0.1521701768040657, "num_tokens": 5788667.0, "step": 2990 }, { "entropy": 5.862866544723511, "epoch": 0.17404189789929395, "grad_norm": 0.98828125, "learning_rate": 0.00016372652716889163, "loss": 5.6814, "mean_token_accuracy": 0.15066895335912706, "num_tokens": 5798864.0, "step": 2995 }, { "entropy": 5.9001668930053714, "epoch": 0.1743324519859372, "grad_norm": 1.0, "learning_rate": 0.0001627041140762035, "loss": 5.6612, "mean_token_accuracy": 0.15261971354484558, "num_tokens": 5808659.0, "step": 3000 }, { "entropy": 5.878597450256348, "epoch": 0.1746230060725804, "grad_norm": 1.0546875, "learning_rate": 0.00016168477963195382, "loss": 5.7867, "mean_token_accuracy": 0.14320920333266257, "num_tokens": 5818499.0, "step": 3005 }, { "entropy": 5.879825782775879, "epoch": 0.17491356015922363, "grad_norm": 0.9921875, "learning_rate": 0.0001606685517817114, "loss": 5.6923, "mean_token_accuracy": 0.15759273767471313, "num_tokens": 5827680.0, "step": 3010 }, { "entropy": 5.958223152160644, "epoch": 0.17520411424586688, "grad_norm": 1.078125, "learning_rate": 0.00015965545838587592, "loss": 5.7086, "mean_token_accuracy": 0.14666144996881486, "num_tokens": 5837224.0, "step": 3015 }, { "entropy": 5.919479656219482, "epoch": 0.1754946683325101, "grad_norm": 0.953125, "learning_rate": 0.00015864552721891467, "loss": 5.6725, "mean_token_accuracy": 0.15637809187173843, "num_tokens": 5846512.0, "step": 3020 }, { "entropy": 5.86658205986023, "epoch": 0.17578522241915331, "grad_norm": 0.98046875, "learning_rate": 0.00015763878596860076, "loss": 5.7294, "mean_token_accuracy": 0.14851637333631515, "num_tokens": 5857056.0, "step": 3025 }, { "entropy": 5.890032815933227, "epoch": 0.17607577650579656, "grad_norm": 1.0078125, "learning_rate": 0.00015663526223525412, "loss": 5.6946, "mean_token_accuracy": 0.14713255912065507, "num_tokens": 5866839.0, "step": 3030 }, { "entropy": 5.9111411571502686, "epoch": 0.17636633059243978, "grad_norm": 0.98828125, "learning_rate": 0.0001556349835309848, "loss": 5.7433, "mean_token_accuracy": 0.14883865118026735, "num_tokens": 5877401.0, "step": 3035 }, { "entropy": 5.895590496063233, "epoch": 0.176656884679083, "grad_norm": 0.98828125, "learning_rate": 0.0001546379772789389, "loss": 5.7289, "mean_token_accuracy": 0.15450553148984908, "num_tokens": 5887451.0, "step": 3040 }, { "entropy": 5.888083982467651, "epoch": 0.17694743876572624, "grad_norm": 0.921875, "learning_rate": 0.00015364427081254622, "loss": 5.7456, "mean_token_accuracy": 0.1440143756568432, "num_tokens": 5898300.0, "step": 3045 }, { "entropy": 5.914128017425537, "epoch": 0.17723799285236946, "grad_norm": 1.03125, "learning_rate": 0.00015265389137477165, "loss": 5.7786, "mean_token_accuracy": 0.14416275471448897, "num_tokens": 5907351.0, "step": 3050 }, { "entropy": 5.84907488822937, "epoch": 0.1775285469390127, "grad_norm": 1.0546875, "learning_rate": 0.00015166686611736786, "loss": 5.6605, "mean_token_accuracy": 0.15831585973501205, "num_tokens": 5916059.0, "step": 3055 }, { "entropy": 5.902460718154908, "epoch": 0.17781910102565593, "grad_norm": 1.140625, "learning_rate": 0.00015068322210013064, "loss": 5.8242, "mean_token_accuracy": 0.15070847496390344, "num_tokens": 5925958.0, "step": 3060 }, { "entropy": 5.961663293838501, "epoch": 0.17810965511229915, "grad_norm": 1.0, "learning_rate": 0.0001497029862901578, "loss": 5.74, "mean_token_accuracy": 0.14450665712356567, "num_tokens": 5935330.0, "step": 3065 }, { "entropy": 5.893162393569947, "epoch": 0.1784002091989424, "grad_norm": 1.078125, "learning_rate": 0.00014872618556110905, "loss": 5.6834, "mean_token_accuracy": 0.147453735768795, "num_tokens": 5945505.0, "step": 3070 }, { "entropy": 5.981773090362549, "epoch": 0.1786907632855856, "grad_norm": 1.015625, "learning_rate": 0.00014775284669246992, "loss": 5.8428, "mean_token_accuracy": 0.14135268032550813, "num_tokens": 5957048.0, "step": 3075 }, { "entropy": 5.91824107170105, "epoch": 0.17898131737222883, "grad_norm": 0.96484375, "learning_rate": 0.00014678299636881716, "loss": 5.8079, "mean_token_accuracy": 0.14488901793956757, "num_tokens": 5967630.0, "step": 3080 }, { "entropy": 5.90251350402832, "epoch": 0.17927187145887208, "grad_norm": 1.1171875, "learning_rate": 0.0001458166611790873, "loss": 5.6931, "mean_token_accuracy": 0.1529642015695572, "num_tokens": 5975532.0, "step": 3085 }, { "entropy": 5.887459230422974, "epoch": 0.1795624255455153, "grad_norm": 1.0703125, "learning_rate": 0.00014485386761584773, "loss": 5.7081, "mean_token_accuracy": 0.15198315531015397, "num_tokens": 5985905.0, "step": 3090 }, { "entropy": 5.8855259895324705, "epoch": 0.17985297963215852, "grad_norm": 1.0625, "learning_rate": 0.00014389464207457042, "loss": 5.6167, "mean_token_accuracy": 0.15220856815576553, "num_tokens": 5995349.0, "step": 3095 }, { "entropy": 5.928559255599976, "epoch": 0.18014353371880176, "grad_norm": 1.1015625, "learning_rate": 0.00014293901085290795, "loss": 5.6806, "mean_token_accuracy": 0.15280585885047912, "num_tokens": 6004065.0, "step": 3100 }, { "entropy": 5.9865350246429445, "epoch": 0.18043408780544498, "grad_norm": 0.98828125, "learning_rate": 0.00014198700014997307, "loss": 5.933, "mean_token_accuracy": 0.1400913752615452, "num_tokens": 6014607.0, "step": 3105 }, { "entropy": 5.912071418762207, "epoch": 0.1807246418920882, "grad_norm": 1.0078125, "learning_rate": 0.00014103863606562016, "loss": 5.7095, "mean_token_accuracy": 0.14968972504138947, "num_tokens": 6024304.0, "step": 3110 }, { "entropy": 5.859876823425293, "epoch": 0.18101519597873145, "grad_norm": 1.046875, "learning_rate": 0.00014009394459972964, "loss": 5.6216, "mean_token_accuracy": 0.15522498413920402, "num_tokens": 6033407.0, "step": 3115 }, { "entropy": 5.950158929824829, "epoch": 0.18130575006537467, "grad_norm": 1.0390625, "learning_rate": 0.00013915295165149513, "loss": 5.7527, "mean_token_accuracy": 0.14455037340521812, "num_tokens": 6043018.0, "step": 3120 }, { "entropy": 5.838319206237793, "epoch": 0.18159630415201788, "grad_norm": 1.03125, "learning_rate": 0.00013821568301871384, "loss": 5.6203, "mean_token_accuracy": 0.1501316547393799, "num_tokens": 6052508.0, "step": 3125 }, { "entropy": 5.891601181030273, "epoch": 0.18188685823866113, "grad_norm": 1.0, "learning_rate": 0.00013728216439707862, "loss": 5.7249, "mean_token_accuracy": 0.14241826310753822, "num_tokens": 6061607.0, "step": 3130 }, { "entropy": 5.867679405212402, "epoch": 0.18217741232530435, "grad_norm": 1.0703125, "learning_rate": 0.00013635242137947419, "loss": 5.7514, "mean_token_accuracy": 0.14486004188656806, "num_tokens": 6070910.0, "step": 3135 }, { "entropy": 5.965913105010986, "epoch": 0.1824679664119476, "grad_norm": 1.09375, "learning_rate": 0.00013542647945527498, "loss": 5.7377, "mean_token_accuracy": 0.1480937719345093, "num_tokens": 6080867.0, "step": 3140 }, { "entropy": 5.951571130752564, "epoch": 0.18275852049859082, "grad_norm": 1.0703125, "learning_rate": 0.0001345043640096465, "loss": 5.7088, "mean_token_accuracy": 0.15468264669179915, "num_tokens": 6090301.0, "step": 3145 }, { "entropy": 5.883486270904541, "epoch": 0.18304907458523403, "grad_norm": 1.015625, "learning_rate": 0.00013358610032284957, "loss": 5.6794, "mean_token_accuracy": 0.15486145615577698, "num_tokens": 6099323.0, "step": 3150 }, { "entropy": 5.826396417617798, "epoch": 0.18333962867187728, "grad_norm": 1.03125, "learning_rate": 0.000132671713569547, "loss": 5.6129, "mean_token_accuracy": 0.16014978289604187, "num_tokens": 6108851.0, "step": 3155 }, { "entropy": 5.940812397003174, "epoch": 0.1836301827585205, "grad_norm": 1.0859375, "learning_rate": 0.0001317612288181136, "loss": 5.7632, "mean_token_accuracy": 0.14373914673924446, "num_tokens": 6118065.0, "step": 3160 }, { "entropy": 5.9504388809204105, "epoch": 0.18392073684516372, "grad_norm": 1.1171875, "learning_rate": 0.00013085467102994864, "loss": 5.7073, "mean_token_accuracy": 0.1490368887782097, "num_tokens": 6127970.0, "step": 3165 }, { "entropy": 5.968365716934204, "epoch": 0.18421129093180696, "grad_norm": 1.0546875, "learning_rate": 0.00012995206505879198, "loss": 5.773, "mean_token_accuracy": 0.1418151006102562, "num_tokens": 6137535.0, "step": 3170 }, { "entropy": 5.804055118560791, "epoch": 0.18450184501845018, "grad_norm": 1.0703125, "learning_rate": 0.0001290534356500421, "loss": 5.6775, "mean_token_accuracy": 0.15127334445714952, "num_tokens": 6147648.0, "step": 3175 }, { "entropy": 5.952842330932617, "epoch": 0.1847923991050934, "grad_norm": 1.078125, "learning_rate": 0.00012815880744007827, "loss": 5.7308, "mean_token_accuracy": 0.1473206475377083, "num_tokens": 6158012.0, "step": 3180 }, { "entropy": 5.904750967025757, "epoch": 0.18508295319173665, "grad_norm": 1.1171875, "learning_rate": 0.00012726820495558483, "loss": 5.6467, "mean_token_accuracy": 0.15495714843273162, "num_tokens": 6166382.0, "step": 3185 }, { "entropy": 5.848727464675903, "epoch": 0.18537350727837987, "grad_norm": 1.0546875, "learning_rate": 0.00012638165261287868, "loss": 5.7411, "mean_token_accuracy": 0.14970375895500182, "num_tokens": 6176317.0, "step": 3190 }, { "entropy": 5.875356388092041, "epoch": 0.1856640613650231, "grad_norm": 1.0859375, "learning_rate": 0.0001254991747172402, "loss": 5.6542, "mean_token_accuracy": 0.15642333328723906, "num_tokens": 6185083.0, "step": 3195 }, { "entropy": 5.983763647079468, "epoch": 0.18595461545166633, "grad_norm": 0.95703125, "learning_rate": 0.00012462079546224662, "loss": 5.8397, "mean_token_accuracy": 0.14416735768318176, "num_tokens": 6195916.0, "step": 3200 }, { "entropy": 5.9738654613494875, "epoch": 0.18624516953830955, "grad_norm": 1.046875, "learning_rate": 0.00012374653892910896, "loss": 5.7225, "mean_token_accuracy": 0.14738543182611466, "num_tokens": 6205552.0, "step": 3205 }, { "entropy": 5.905939817428589, "epoch": 0.1865357236249528, "grad_norm": 0.99609375, "learning_rate": 0.00012287642908601166, "loss": 5.6979, "mean_token_accuracy": 0.15550366342067717, "num_tokens": 6214548.0, "step": 3210 }, { "entropy": 5.850633335113526, "epoch": 0.18682627771159602, "grad_norm": 1.0234375, "learning_rate": 0.00012201048978745569, "loss": 5.7273, "mean_token_accuracy": 0.14697117879986762, "num_tokens": 6223556.0, "step": 3215 }, { "entropy": 5.895660352706909, "epoch": 0.18711683179823924, "grad_norm": 1.0234375, "learning_rate": 0.00012114874477360427, "loss": 5.6831, "mean_token_accuracy": 0.1549847200512886, "num_tokens": 6232862.0, "step": 3220 }, { "entropy": 5.926797246932983, "epoch": 0.18740738588488248, "grad_norm": 1.0234375, "learning_rate": 0.00012029121766963236, "loss": 5.7048, "mean_token_accuracy": 0.15579066723585128, "num_tokens": 6242866.0, "step": 3225 }, { "entropy": 5.911966037750244, "epoch": 0.1876979399715257, "grad_norm": 1.1171875, "learning_rate": 0.00011943793198507858, "loss": 5.6633, "mean_token_accuracy": 0.1504863455891609, "num_tokens": 6253120.0, "step": 3230 }, { "entropy": 5.939072513580323, "epoch": 0.18798849405816892, "grad_norm": 1.046875, "learning_rate": 0.00011858891111320104, "loss": 5.7064, "mean_token_accuracy": 0.1529112383723259, "num_tokens": 6262362.0, "step": 3235 }, { "entropy": 5.948238801956177, "epoch": 0.18827904814481217, "grad_norm": 0.97265625, "learning_rate": 0.0001177441783303359, "loss": 5.7631, "mean_token_accuracy": 0.14808702915906907, "num_tokens": 6272186.0, "step": 3240 }, { "entropy": 5.881315660476685, "epoch": 0.18856960223145539, "grad_norm": 0.9921875, "learning_rate": 0.00011690375679525896, "loss": 5.7049, "mean_token_accuracy": 0.15038980543613434, "num_tokens": 6282259.0, "step": 3245 }, { "entropy": 5.826404809951782, "epoch": 0.1888601563180986, "grad_norm": 1.1328125, "learning_rate": 0.00011606766954855124, "loss": 5.6422, "mean_token_accuracy": 0.15315619856119156, "num_tokens": 6290636.0, "step": 3250 }, { "entropy": 5.947768211364746, "epoch": 0.18915071040474185, "grad_norm": 0.984375, "learning_rate": 0.00011523593951196702, "loss": 5.7543, "mean_token_accuracy": 0.15584465861320496, "num_tokens": 6300635.0, "step": 3255 }, { "entropy": 5.89833984375, "epoch": 0.18944126449138507, "grad_norm": 1.0625, "learning_rate": 0.00011440858948780523, "loss": 5.7036, "mean_token_accuracy": 0.14794304966926575, "num_tokens": 6310405.0, "step": 3260 }, { "entropy": 5.956763172149659, "epoch": 0.1897318185780283, "grad_norm": 0.99609375, "learning_rate": 0.00011358564215828484, "loss": 5.6648, "mean_token_accuracy": 0.14478933736681937, "num_tokens": 6320568.0, "step": 3265 }, { "entropy": 5.889064073562622, "epoch": 0.19002237266467153, "grad_norm": 1.0625, "learning_rate": 0.00011276712008492254, "loss": 5.7212, "mean_token_accuracy": 0.14623939320445062, "num_tokens": 6330934.0, "step": 3270 }, { "entropy": 5.8466448307037355, "epoch": 0.19031292675131475, "grad_norm": 0.9609375, "learning_rate": 0.00011195304570791451, "loss": 5.6291, "mean_token_accuracy": 0.1494644194841385, "num_tokens": 6340021.0, "step": 3275 }, { "entropy": 5.905776739120483, "epoch": 0.19060348083795797, "grad_norm": 0.9375, "learning_rate": 0.00011114344134552094, "loss": 5.7767, "mean_token_accuracy": 0.13632216230034827, "num_tokens": 6350634.0, "step": 3280 }, { "entropy": 5.877668142318726, "epoch": 0.19089403492460122, "grad_norm": 0.9609375, "learning_rate": 0.0001103383291934545, "loss": 5.6113, "mean_token_accuracy": 0.15489494949579238, "num_tokens": 6360352.0, "step": 3285 }, { "entropy": 5.925946044921875, "epoch": 0.19118458901124444, "grad_norm": 1.0625, "learning_rate": 0.00010953773132427141, "loss": 5.7767, "mean_token_accuracy": 0.14482601433992387, "num_tokens": 6370093.0, "step": 3290 }, { "entropy": 5.921476888656616, "epoch": 0.19147514309788768, "grad_norm": 0.96484375, "learning_rate": 0.00010874166968676677, "loss": 5.7685, "mean_token_accuracy": 0.14415259957313536, "num_tokens": 6381177.0, "step": 3295 }, { "entropy": 5.873376417160034, "epoch": 0.1917656971845309, "grad_norm": 1.046875, "learning_rate": 0.00010795016610537251, "loss": 5.6712, "mean_token_accuracy": 0.1550527662038803, "num_tokens": 6390136.0, "step": 3300 }, { "entropy": 5.962003517150879, "epoch": 0.19205625127117412, "grad_norm": 0.99609375, "learning_rate": 0.00010716324227955904, "loss": 5.8546, "mean_token_accuracy": 0.1455419696867466, "num_tokens": 6400471.0, "step": 3305 }, { "entropy": 6.009838676452636, "epoch": 0.19234680535781737, "grad_norm": 1.015625, "learning_rate": 0.0001063809197832406, "loss": 5.8329, "mean_token_accuracy": 0.14172329530119895, "num_tokens": 6411243.0, "step": 3310 }, { "entropy": 5.960184240341187, "epoch": 0.1926373594444606, "grad_norm": 0.9765625, "learning_rate": 0.00010560322006418368, "loss": 5.7264, "mean_token_accuracy": 0.1475974753499031, "num_tokens": 6420207.0, "step": 3315 }, { "entropy": 5.8688677787780765, "epoch": 0.1929279135311038, "grad_norm": 0.96484375, "learning_rate": 0.00010483016444341887, "loss": 5.6774, "mean_token_accuracy": 0.15368302464485167, "num_tokens": 6431028.0, "step": 3320 }, { "entropy": 5.884518241882324, "epoch": 0.19321846761774705, "grad_norm": 0.98828125, "learning_rate": 0.00010406177411465654, "loss": 5.7066, "mean_token_accuracy": 0.14887502565979957, "num_tokens": 6441006.0, "step": 3325 }, { "entropy": 6.020867872238159, "epoch": 0.19350902170439027, "grad_norm": 1.1875, "learning_rate": 0.00010329807014370562, "loss": 5.7659, "mean_token_accuracy": 0.15222514867782594, "num_tokens": 6450410.0, "step": 3330 }, { "entropy": 5.9165369987487795, "epoch": 0.1937995757910335, "grad_norm": 0.95703125, "learning_rate": 0.00010253907346789632, "loss": 5.7041, "mean_token_accuracy": 0.15221134722232818, "num_tokens": 6460206.0, "step": 3335 }, { "entropy": 5.947690725326538, "epoch": 0.19409012987767674, "grad_norm": 1.0234375, "learning_rate": 0.00010178480489550596, "loss": 5.7285, "mean_token_accuracy": 0.14923365116119386, "num_tokens": 6470222.0, "step": 3340 }, { "entropy": 5.853886842727661, "epoch": 0.19438068396431996, "grad_norm": 1.015625, "learning_rate": 0.00010103528510518836, "loss": 5.5911, "mean_token_accuracy": 0.15906597673892975, "num_tokens": 6479734.0, "step": 3345 }, { "entropy": 5.842826843261719, "epoch": 0.19467123805096317, "grad_norm": 1.140625, "learning_rate": 0.0001002905346454073, "loss": 5.6474, "mean_token_accuracy": 0.15893638432025908, "num_tokens": 6488767.0, "step": 3350 }, { "entropy": 5.8372596263885494, "epoch": 0.19496179213760642, "grad_norm": 1.09375, "learning_rate": 9.955057393387285e-05, "loss": 5.6566, "mean_token_accuracy": 0.15050486475229263, "num_tokens": 6498580.0, "step": 3355 }, { "entropy": 5.933157968521118, "epoch": 0.19525234622424964, "grad_norm": 1.0390625, "learning_rate": 9.88154232569816e-05, "loss": 5.7511, "mean_token_accuracy": 0.15162570774555206, "num_tokens": 6508220.0, "step": 3360 }, { "entropy": 5.836697673797607, "epoch": 0.1955429003108929, "grad_norm": 1.0390625, "learning_rate": 9.808510276926075e-05, "loss": 5.5555, "mean_token_accuracy": 0.15324481427669526, "num_tokens": 6517213.0, "step": 3365 }, { "entropy": 5.878100919723511, "epoch": 0.1958334543975361, "grad_norm": 1.0546875, "learning_rate": 9.735963249281549e-05, "loss": 5.6691, "mean_token_accuracy": 0.1557715505361557, "num_tokens": 6526374.0, "step": 3370 }, { "entropy": 5.88363561630249, "epoch": 0.19612400848417932, "grad_norm": 1.046875, "learning_rate": 9.663903231677974e-05, "loss": 5.6126, "mean_token_accuracy": 0.1484391175210476, "num_tokens": 6535905.0, "step": 3375 }, { "entropy": 5.840852355957031, "epoch": 0.19641456257082257, "grad_norm": 0.9609375, "learning_rate": 9.592332199677145e-05, "loss": 5.7618, "mean_token_accuracy": 0.15169932842254638, "num_tokens": 6546647.0, "step": 3380 }, { "entropy": 5.921357583999634, "epoch": 0.1967051166574658, "grad_norm": 1.046875, "learning_rate": 9.521252115435061e-05, "loss": 5.7452, "mean_token_accuracy": 0.14468733072280884, "num_tokens": 6556782.0, "step": 3385 }, { "entropy": 5.931183528900147, "epoch": 0.196995670744109, "grad_norm": 1.1015625, "learning_rate": 9.450664927648126e-05, "loss": 5.6788, "mean_token_accuracy": 0.15360817313194275, "num_tokens": 6566100.0, "step": 3390 }, { "entropy": 5.913093900680542, "epoch": 0.19728622483075225, "grad_norm": 1.109375, "learning_rate": 9.380572571499758e-05, "loss": 5.7203, "mean_token_accuracy": 0.1516430251300335, "num_tokens": 6575699.0, "step": 3395 }, { "entropy": 5.895590543746948, "epoch": 0.19757677891739547, "grad_norm": 1.1015625, "learning_rate": 9.310976968607307e-05, "loss": 5.6955, "mean_token_accuracy": 0.15117278844118118, "num_tokens": 6586421.0, "step": 3400 }, { "entropy": 5.899382448196411, "epoch": 0.1978673330040387, "grad_norm": 1.015625, "learning_rate": 9.241880026969381e-05, "loss": 5.7211, "mean_token_accuracy": 0.15007722228765488, "num_tokens": 6595709.0, "step": 3405 }, { "entropy": 5.849699306488037, "epoch": 0.19815788709068194, "grad_norm": 1.03125, "learning_rate": 9.173283640913537e-05, "loss": 5.6391, "mean_token_accuracy": 0.15192460417747497, "num_tokens": 6605584.0, "step": 3410 }, { "entropy": 5.875099325180054, "epoch": 0.19844844117732516, "grad_norm": 1.0703125, "learning_rate": 9.10518969104436e-05, "loss": 5.6592, "mean_token_accuracy": 0.14897078275680542, "num_tokens": 6614954.0, "step": 3415 }, { "entropy": 5.88078670501709, "epoch": 0.19873899526396838, "grad_norm": 1.015625, "learning_rate": 9.037600044191868e-05, "loss": 5.7177, "mean_token_accuracy": 0.15258491933345794, "num_tokens": 6624711.0, "step": 3420 }, { "entropy": 5.862894535064697, "epoch": 0.19902954935061162, "grad_norm": 1.078125, "learning_rate": 8.970516553360383e-05, "loss": 5.6295, "mean_token_accuracy": 0.15298304632306098, "num_tokens": 6633557.0, "step": 3425 }, { "entropy": 5.947640514373779, "epoch": 0.19932010343725484, "grad_norm": 1.0703125, "learning_rate": 8.903941057677692e-05, "loss": 5.7019, "mean_token_accuracy": 0.14800181463360787, "num_tokens": 6642879.0, "step": 3430 }, { "entropy": 5.876432323455811, "epoch": 0.19961065752389806, "grad_norm": 0.98828125, "learning_rate": 8.837875382344635e-05, "loss": 5.6511, "mean_token_accuracy": 0.15685335844755172, "num_tokens": 6653203.0, "step": 3435 }, { "entropy": 5.934163999557495, "epoch": 0.1999012116105413, "grad_norm": 1.09375, "learning_rate": 8.772321338585076e-05, "loss": 5.7326, "mean_token_accuracy": 0.14604269564151764, "num_tokens": 6663164.0, "step": 3440 }, { "entropy": 5.877704620361328, "epoch": 0.20019176569718453, "grad_norm": 0.96875, "learning_rate": 8.707280723596242e-05, "loss": 5.6234, "mean_token_accuracy": 0.15717218369245528, "num_tokens": 6673360.0, "step": 3445 }, { "entropy": 5.871836137771607, "epoch": 0.20048231978382777, "grad_norm": 1.0078125, "learning_rate": 8.64275532049944e-05, "loss": 5.6095, "mean_token_accuracy": 0.15653758198022844, "num_tokens": 6683378.0, "step": 3450 }, { "entropy": 5.891933822631836, "epoch": 0.200772873870471, "grad_norm": 1.0625, "learning_rate": 8.578746898291198e-05, "loss": 5.7233, "mean_token_accuracy": 0.1492978498339653, "num_tokens": 6693290.0, "step": 3455 }, { "entropy": 5.93402681350708, "epoch": 0.2010634279571142, "grad_norm": 1.09375, "learning_rate": 8.515257211794742e-05, "loss": 5.7245, "mean_token_accuracy": 0.15207166522741317, "num_tokens": 6702944.0, "step": 3460 }, { "entropy": 5.853806114196777, "epoch": 0.20135398204375746, "grad_norm": 1.0234375, "learning_rate": 8.452288001611896e-05, "loss": 5.6635, "mean_token_accuracy": 0.15432647466659546, "num_tokens": 6713115.0, "step": 3465 }, { "entropy": 5.8708747863769535, "epoch": 0.20164453613040068, "grad_norm": 1.0859375, "learning_rate": 8.389840994075379e-05, "loss": 5.6348, "mean_token_accuracy": 0.15231843888759614, "num_tokens": 6722299.0, "step": 3470 }, { "entropy": 5.882935237884522, "epoch": 0.2019350902170439, "grad_norm": 1.0703125, "learning_rate": 8.327917901201435e-05, "loss": 5.7129, "mean_token_accuracy": 0.15215571522712706, "num_tokens": 6731614.0, "step": 3475 }, { "entropy": 5.86389126777649, "epoch": 0.20222564430368714, "grad_norm": 1.078125, "learning_rate": 8.266520420642931e-05, "loss": 5.6949, "mean_token_accuracy": 0.15433192551136016, "num_tokens": 6742004.0, "step": 3480 }, { "entropy": 5.847345590591431, "epoch": 0.20251619839033036, "grad_norm": 1.0078125, "learning_rate": 8.205650235642828e-05, "loss": 5.5562, "mean_token_accuracy": 0.15808666944503785, "num_tokens": 6750792.0, "step": 3485 }, { "entropy": 5.8795068740844725, "epoch": 0.20280675247697358, "grad_norm": 1.0859375, "learning_rate": 8.145309014987978e-05, "loss": 5.6589, "mean_token_accuracy": 0.14861153066158295, "num_tokens": 6760267.0, "step": 3490 }, { "entropy": 5.927186775207519, "epoch": 0.20309730656361683, "grad_norm": 1.015625, "learning_rate": 8.085498412963437e-05, "loss": 5.7421, "mean_token_accuracy": 0.15237132087349892, "num_tokens": 6770765.0, "step": 3495 }, { "entropy": 5.8566515922546385, "epoch": 0.20338786065026004, "grad_norm": 0.99609375, "learning_rate": 8.026220069307078e-05, "loss": 5.6345, "mean_token_accuracy": 0.15394409149885177, "num_tokens": 6779927.0, "step": 3500 } ], "logging_steps": 5, "max_steps": 4000, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 9992917794816000.0, "train_batch_size": 16, "trial_name": null, "trial_params": null }